{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.58468609665186, "eval_steps": 4000, "global_step": 36000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.8286386209540069, "epoch": 0.00016241280462551668, "grad_norm": 9.25, "learning_rate": 4.5e-07, "loss": 1.0799656867980958, "mean_token_accuracy": 0.7693958081305027, "num_tokens": 21078.0, "step": 10 }, { "entropy": 0.7109394183382391, "epoch": 0.00032482560925103335, "grad_norm": 12.0625, "learning_rate": 9.5e-07, "loss": 0.8955118179321289, "mean_token_accuracy": 0.8040434066206217, "num_tokens": 41157.0, "step": 20 }, { "entropy": 0.7656834285706282, "epoch": 0.00048723841387655003, "grad_norm": 9.875, "learning_rate": 1.45e-06, "loss": 1.0864809989929198, "mean_token_accuracy": 0.7730953447520733, "num_tokens": 61654.0, "step": 30 }, { "entropy": 0.72407943662256, "epoch": 0.0006496512185020667, "grad_norm": 11.0, "learning_rate": 1.95e-06, "loss": 0.9031203269958497, "mean_token_accuracy": 0.7893224690109492, "num_tokens": 82960.0, "step": 40 }, { "entropy": 0.8371759531088173, "epoch": 0.0008120640231275833, "grad_norm": 14.1875, "learning_rate": 2.4500000000000003e-06, "loss": 1.013376522064209, "mean_token_accuracy": 0.7663579270243644, "num_tokens": 104980.0, "step": 50 }, { "entropy": 0.7614489119965583, "epoch": 0.0009744768277531001, "grad_norm": 11.75, "learning_rate": 2.95e-06, "loss": 0.9164009094238281, "mean_token_accuracy": 0.7984466932713985, "num_tokens": 125062.0, "step": 60 }, { "entropy": 0.6971589954569936, "epoch": 0.0011368896323786168, "grad_norm": 11.125, "learning_rate": 3.4500000000000004e-06, "loss": 0.9299216270446777, "mean_token_accuracy": 0.7987640958279372, "num_tokens": 144332.0, "step": 70 }, { "entropy": 0.7037347192876041, "epoch": 0.0012993024370041334, "grad_norm": 8.6875, "learning_rate": 3.95e-06, "loss": 0.8815269470214844, "mean_token_accuracy": 0.80237399302423, "num_tokens": 164793.0, "step": 80 }, { "entropy": 0.6618278024718165, "epoch": 0.00146171524162965, "grad_norm": 9.6875, "learning_rate": 4.45e-06, "loss": 0.7643122673034668, "mean_token_accuracy": 0.8236934401094913, "num_tokens": 185887.0, "step": 90 }, { "entropy": 0.7201404077932239, "epoch": 0.0016241280462551667, "grad_norm": 12.0, "learning_rate": 4.950000000000001e-06, "loss": 0.9489357948303223, "mean_token_accuracy": 0.7943450938910246, "num_tokens": 206736.0, "step": 100 }, { "entropy": 0.7261254206299782, "epoch": 0.0017865408508806835, "grad_norm": 15.0625, "learning_rate": 5.45e-06, "loss": 0.9126925468444824, "mean_token_accuracy": 0.7977610722184181, "num_tokens": 227243.0, "step": 110 }, { "entropy": 0.8010070217773319, "epoch": 0.0019489536555062001, "grad_norm": 13.875, "learning_rate": 5.95e-06, "loss": 1.0046897888183595, "mean_token_accuracy": 0.7712242294102907, "num_tokens": 247183.0, "step": 120 }, { "entropy": 0.7256525276228786, "epoch": 0.002111366460131717, "grad_norm": 8.6875, "learning_rate": 6.45e-06, "loss": 0.852382755279541, "mean_token_accuracy": 0.8060502171516418, "num_tokens": 267532.0, "step": 130 }, { "entropy": 0.7117265942506492, "epoch": 0.0022737792647572336, "grad_norm": 12.8125, "learning_rate": 6.950000000000001e-06, "loss": 0.8560203552246094, "mean_token_accuracy": 0.8086145672947168, "num_tokens": 289440.0, "step": 140 }, { "entropy": 0.7038921610452235, "epoch": 0.00243619206938275, "grad_norm": 9.375, "learning_rate": 7.45e-06, "loss": 0.8178808212280273, "mean_token_accuracy": 0.815917557477951, "num_tokens": 310714.0, "step": 150 }, { "entropy": 0.848792072199285, "epoch": 0.002598604874008267, "grad_norm": 13.0, "learning_rate": 7.95e-06, "loss": 0.9831900596618652, "mean_token_accuracy": 0.7895596921443939, "num_tokens": 329435.0, "step": 160 }, { "entropy": 0.6665874444413931, "epoch": 0.0027610176786337834, "grad_norm": 7.3125, "learning_rate": 8.45e-06, "loss": 0.7425652503967285, "mean_token_accuracy": 0.8268452137708664, "num_tokens": 351279.0, "step": 170 }, { "entropy": 0.7654673175886273, "epoch": 0.0029234304832593, "grad_norm": 10.625, "learning_rate": 8.95e-06, "loss": 0.859465217590332, "mean_token_accuracy": 0.7999506097286939, "num_tokens": 372012.0, "step": 180 }, { "entropy": 0.7425559777766466, "epoch": 0.0030858432878848167, "grad_norm": 9.5, "learning_rate": 9.450000000000001e-06, "loss": 0.8205994606018067, "mean_token_accuracy": 0.8093760065734387, "num_tokens": 392252.0, "step": 190 }, { "entropy": 0.6891162494663149, "epoch": 0.0032482560925103333, "grad_norm": 9.4375, "learning_rate": 9.950000000000001e-06, "loss": 0.6921127319335938, "mean_token_accuracy": 0.8340979300439357, "num_tokens": 412508.0, "step": 200 }, { "entropy": 0.7497544032521546, "epoch": 0.0034106688971358504, "grad_norm": 6.34375, "learning_rate": 1.045e-05, "loss": 0.7874168872833252, "mean_token_accuracy": 0.8073534950613975, "num_tokens": 432996.0, "step": 210 }, { "entropy": 0.8025054382160306, "epoch": 0.003573081701761367, "grad_norm": 10.4375, "learning_rate": 1.095e-05, "loss": 0.8000614166259765, "mean_token_accuracy": 0.8073957156389951, "num_tokens": 453540.0, "step": 220 }, { "entropy": 0.726252057030797, "epoch": 0.0037354945063868836, "grad_norm": 7.28125, "learning_rate": 1.145e-05, "loss": 0.699830961227417, "mean_token_accuracy": 0.8347548361867666, "num_tokens": 475088.0, "step": 230 }, { "entropy": 0.7629142621532082, "epoch": 0.0038979073110124002, "grad_norm": 10.375, "learning_rate": 1.195e-05, "loss": 0.7690689563751221, "mean_token_accuracy": 0.819105388969183, "num_tokens": 494855.0, "step": 240 }, { "entropy": 0.7240849315188825, "epoch": 0.004060320115637917, "grad_norm": 8.1875, "learning_rate": 1.2450000000000001e-05, "loss": 0.7371947765350342, "mean_token_accuracy": 0.8307590883225202, "num_tokens": 513907.0, "step": 250 }, { "entropy": 0.7596399324014783, "epoch": 0.004222732920263434, "grad_norm": 8.5, "learning_rate": 1.2950000000000001e-05, "loss": 0.7624147415161133, "mean_token_accuracy": 0.8173091482371092, "num_tokens": 533835.0, "step": 260 }, { "entropy": 0.7431545678526164, "epoch": 0.00438514572488895, "grad_norm": 6.53125, "learning_rate": 1.3450000000000002e-05, "loss": 0.7522071361541748, "mean_token_accuracy": 0.8200604744255543, "num_tokens": 554020.0, "step": 270 }, { "entropy": 0.7573855429887771, "epoch": 0.004547558529514467, "grad_norm": 8.5, "learning_rate": 1.3950000000000002e-05, "loss": 0.7579145431518555, "mean_token_accuracy": 0.8237630523741245, "num_tokens": 574522.0, "step": 280 }, { "entropy": 0.7901369592174887, "epoch": 0.004709971334139983, "grad_norm": 11.3125, "learning_rate": 1.4449999999999999e-05, "loss": 0.7745565891265869, "mean_token_accuracy": 0.8216199889779091, "num_tokens": 595133.0, "step": 290 }, { "entropy": 0.7269687445834279, "epoch": 0.0048723841387655, "grad_norm": 10.5625, "learning_rate": 1.4950000000000001e-05, "loss": 0.7418421745300293, "mean_token_accuracy": 0.828744861483574, "num_tokens": 614857.0, "step": 300 }, { "entropy": 0.7721429783850908, "epoch": 0.005034796943391017, "grad_norm": 8.125, "learning_rate": 1.545e-05, "loss": 0.8017391204833985, "mean_token_accuracy": 0.8127230260521173, "num_tokens": 635235.0, "step": 310 }, { "entropy": 0.7957702752202749, "epoch": 0.005197209748016534, "grad_norm": 8.4375, "learning_rate": 1.595e-05, "loss": 0.8230579376220704, "mean_token_accuracy": 0.7985282287001609, "num_tokens": 656197.0, "step": 320 }, { "entropy": 0.6822628723457456, "epoch": 0.005359622552642051, "grad_norm": 9.5625, "learning_rate": 1.645e-05, "loss": 0.6820508480072022, "mean_token_accuracy": 0.8312795639038086, "num_tokens": 676265.0, "step": 330 }, { "entropy": 0.6956167140975594, "epoch": 0.005522035357267567, "grad_norm": 5.46875, "learning_rate": 1.6950000000000002e-05, "loss": 0.7457751750946044, "mean_token_accuracy": 0.8247509013861418, "num_tokens": 697557.0, "step": 340 }, { "entropy": 0.7414393374696374, "epoch": 0.005684448161893084, "grad_norm": 7.5625, "learning_rate": 1.745e-05, "loss": 0.7440137386322021, "mean_token_accuracy": 0.82403952665627, "num_tokens": 717764.0, "step": 350 }, { "entropy": 0.7625441277399659, "epoch": 0.0058468609665186, "grad_norm": 7.71875, "learning_rate": 1.795e-05, "loss": 0.7318333148956299, "mean_token_accuracy": 0.8224152456969023, "num_tokens": 737751.0, "step": 360 }, { "entropy": 0.734699510037899, "epoch": 0.006009273771144117, "grad_norm": 6.8125, "learning_rate": 1.845e-05, "loss": 0.7759143829345703, "mean_token_accuracy": 0.8186948299407959, "num_tokens": 758755.0, "step": 370 }, { "entropy": 0.8060480868443847, "epoch": 0.006171686575769633, "grad_norm": 7.46875, "learning_rate": 1.895e-05, "loss": 0.7542331218719482, "mean_token_accuracy": 0.8169570811092853, "num_tokens": 779110.0, "step": 380 }, { "entropy": 0.6588757059536874, "epoch": 0.00633409938039515, "grad_norm": 6.4375, "learning_rate": 1.9450000000000002e-05, "loss": 0.5770083427429199, "mean_token_accuracy": 0.8503068417310715, "num_tokens": 799775.0, "step": 390 }, { "entropy": 0.6667641870677471, "epoch": 0.006496512185020667, "grad_norm": 11.8125, "learning_rate": 1.995e-05, "loss": 0.6269936084747314, "mean_token_accuracy": 0.8433299727737904, "num_tokens": 820320.0, "step": 400 }, { "entropy": 0.6915348025038839, "epoch": 0.006658924989646184, "grad_norm": 5.40625, "learning_rate": 2.045e-05, "loss": 0.6881805419921875, "mean_token_accuracy": 0.8291698649525643, "num_tokens": 840349.0, "step": 410 }, { "entropy": 0.740300617273897, "epoch": 0.006821337794271701, "grad_norm": 9.4375, "learning_rate": 2.095e-05, "loss": 0.7356808662414551, "mean_token_accuracy": 0.8218936193734407, "num_tokens": 861048.0, "step": 420 }, { "entropy": 0.6525337123312056, "epoch": 0.006983750598897217, "grad_norm": 8.4375, "learning_rate": 2.145e-05, "loss": 0.6163470268249511, "mean_token_accuracy": 0.8430293515324593, "num_tokens": 883800.0, "step": 430 }, { "entropy": 0.6596776175312697, "epoch": 0.007146163403522734, "grad_norm": 8.875, "learning_rate": 2.195e-05, "loss": 0.6624906063079834, "mean_token_accuracy": 0.8395840384066104, "num_tokens": 903944.0, "step": 440 }, { "entropy": 0.6519672375172376, "epoch": 0.00730857620814825, "grad_norm": 9.25, "learning_rate": 2.245e-05, "loss": 0.6771381855010986, "mean_token_accuracy": 0.8358573734760284, "num_tokens": 924769.0, "step": 450 }, { "entropy": 0.7214407650753856, "epoch": 0.007470989012773767, "grad_norm": 8.625, "learning_rate": 2.2950000000000002e-05, "loss": 0.7346301555633545, "mean_token_accuracy": 0.8196297101676464, "num_tokens": 945920.0, "step": 460 }, { "entropy": 0.7234843699261546, "epoch": 0.007633401817399283, "grad_norm": 12.375, "learning_rate": 2.345e-05, "loss": 0.7236921787261963, "mean_token_accuracy": 0.8303526669740677, "num_tokens": 967065.0, "step": 470 }, { "entropy": 0.70143166417256, "epoch": 0.0077958146220248005, "grad_norm": 6.625, "learning_rate": 2.395e-05, "loss": 0.6931093215942383, "mean_token_accuracy": 0.8317725829780102, "num_tokens": 986483.0, "step": 480 }, { "entropy": 0.6759544815868139, "epoch": 0.007958227426650318, "grad_norm": 7.40625, "learning_rate": 2.445e-05, "loss": 0.679323148727417, "mean_token_accuracy": 0.8361477315425873, "num_tokens": 1006208.0, "step": 490 }, { "entropy": 0.6707666153088212, "epoch": 0.008120640231275834, "grad_norm": 6.84375, "learning_rate": 2.495e-05, "loss": 0.6959585666656494, "mean_token_accuracy": 0.8390910148620605, "num_tokens": 1026627.0, "step": 500 }, { "entropy": 0.6844200716353953, "epoch": 0.00828305303590135, "grad_norm": 8.125, "learning_rate": 2.5450000000000002e-05, "loss": 0.6855648517608642, "mean_token_accuracy": 0.8376705981791019, "num_tokens": 1048389.0, "step": 510 }, { "entropy": 0.7058569299057126, "epoch": 0.008445465840526868, "grad_norm": 8.125, "learning_rate": 2.595e-05, "loss": 0.726499366760254, "mean_token_accuracy": 0.81929427459836, "num_tokens": 1070137.0, "step": 520 }, { "entropy": 0.6845117727294564, "epoch": 0.008607878645152384, "grad_norm": 9.0, "learning_rate": 2.6450000000000003e-05, "loss": 0.6557787418365478, "mean_token_accuracy": 0.8437227971851826, "num_tokens": 1090180.0, "step": 530 }, { "entropy": 0.7029878507833928, "epoch": 0.0087702914497779, "grad_norm": 8.6875, "learning_rate": 2.6950000000000005e-05, "loss": 0.6765800952911377, "mean_token_accuracy": 0.8378778167068959, "num_tokens": 1109304.0, "step": 540 }, { "entropy": 0.6664782756008207, "epoch": 0.008932704254403416, "grad_norm": 10.0625, "learning_rate": 2.7450000000000003e-05, "loss": 0.7219091892242432, "mean_token_accuracy": 0.8199756242334842, "num_tokens": 1129567.0, "step": 550 }, { "entropy": 0.6574279968626797, "epoch": 0.009095117059028934, "grad_norm": 7.34375, "learning_rate": 2.7950000000000005e-05, "loss": 0.6412994384765625, "mean_token_accuracy": 0.847743783891201, "num_tokens": 1149958.0, "step": 560 }, { "entropy": 0.6927648137323559, "epoch": 0.00925752986365445, "grad_norm": 7.5, "learning_rate": 2.845e-05, "loss": 0.682568359375, "mean_token_accuracy": 0.8263876050710678, "num_tokens": 1169775.0, "step": 570 }, { "entropy": 0.6439135386608541, "epoch": 0.009419942668279967, "grad_norm": 7.5625, "learning_rate": 2.895e-05, "loss": 0.5950417518615723, "mean_token_accuracy": 0.8508162133395671, "num_tokens": 1189853.0, "step": 580 }, { "entropy": 0.712180577032268, "epoch": 0.009582355472905485, "grad_norm": 6.90625, "learning_rate": 2.945e-05, "loss": 0.7307719707489013, "mean_token_accuracy": 0.8247457049787045, "num_tokens": 1210168.0, "step": 590 }, { "entropy": 0.7006784784607589, "epoch": 0.009744768277531, "grad_norm": 8.75, "learning_rate": 2.995e-05, "loss": 0.6609793663024902, "mean_token_accuracy": 0.8408290341496467, "num_tokens": 1230776.0, "step": 600 }, { "entropy": 0.7163872819393873, "epoch": 0.009907181082156517, "grad_norm": 8.5625, "learning_rate": 3.045e-05, "loss": 0.7742831230163574, "mean_token_accuracy": 0.822585117071867, "num_tokens": 1251914.0, "step": 610 }, { "entropy": 0.6246914233081042, "epoch": 0.010069593886782033, "grad_norm": 6.5, "learning_rate": 3.095e-05, "loss": 0.615490198135376, "mean_token_accuracy": 0.8435915000736713, "num_tokens": 1272275.0, "step": 620 }, { "entropy": 0.6043330681510269, "epoch": 0.010232006691407551, "grad_norm": 7.78125, "learning_rate": 3.145e-05, "loss": 0.5805882930755615, "mean_token_accuracy": 0.8595341272652149, "num_tokens": 1291733.0, "step": 630 }, { "entropy": 0.6278383932542055, "epoch": 0.010394419496033067, "grad_norm": 7.5, "learning_rate": 3.1950000000000004e-05, "loss": 0.6627034664154052, "mean_token_accuracy": 0.8372619360685348, "num_tokens": 1311579.0, "step": 640 }, { "entropy": 0.7058345880359411, "epoch": 0.010556832300658583, "grad_norm": 7.40625, "learning_rate": 3.245e-05, "loss": 0.6865080833435059, "mean_token_accuracy": 0.833170697838068, "num_tokens": 1331163.0, "step": 650 }, { "entropy": 0.6692308727651834, "epoch": 0.010719245105284101, "grad_norm": 6.84375, "learning_rate": 3.295e-05, "loss": 0.6427846431732178, "mean_token_accuracy": 0.848775465041399, "num_tokens": 1350229.0, "step": 660 }, { "entropy": 0.7206677223555744, "epoch": 0.010881657909909618, "grad_norm": 9.375, "learning_rate": 3.345000000000001e-05, "loss": 0.7576824188232422, "mean_token_accuracy": 0.8148382417857647, "num_tokens": 1370212.0, "step": 670 }, { "entropy": 0.6522296311333775, "epoch": 0.011044070714535134, "grad_norm": 8.5, "learning_rate": 3.3950000000000005e-05, "loss": 0.6881757736206054, "mean_token_accuracy": 0.8299212366342544, "num_tokens": 1390679.0, "step": 680 }, { "entropy": 0.6086408912204206, "epoch": 0.01120648351916065, "grad_norm": 8.4375, "learning_rate": 3.445e-05, "loss": 0.6275379180908203, "mean_token_accuracy": 0.8528399422764779, "num_tokens": 1410597.0, "step": 690 }, { "entropy": 0.7196457803249359, "epoch": 0.011368896323786168, "grad_norm": 6.65625, "learning_rate": 3.495e-05, "loss": 0.7207755088806153, "mean_token_accuracy": 0.8347064822912216, "num_tokens": 1431528.0, "step": 700 }, { "entropy": 0.6606773607432842, "epoch": 0.011531309128411684, "grad_norm": 8.875, "learning_rate": 3.545e-05, "loss": 0.6552667617797852, "mean_token_accuracy": 0.8414863862097264, "num_tokens": 1451109.0, "step": 710 }, { "entropy": 0.6706155283376575, "epoch": 0.0116937219330372, "grad_norm": 8.3125, "learning_rate": 3.595e-05, "loss": 0.6719372272491455, "mean_token_accuracy": 0.8321613404899836, "num_tokens": 1471205.0, "step": 720 }, { "entropy": 0.6477373008616268, "epoch": 0.011856134737662718, "grad_norm": 9.0625, "learning_rate": 3.645e-05, "loss": 0.6495148181915283, "mean_token_accuracy": 0.836396151036024, "num_tokens": 1491334.0, "step": 730 }, { "entropy": 0.6897125015035271, "epoch": 0.012018547542288234, "grad_norm": 7.71875, "learning_rate": 3.6950000000000004e-05, "loss": 0.6889693737030029, "mean_token_accuracy": 0.8305387049913406, "num_tokens": 1511805.0, "step": 740 }, { "entropy": 0.6438182471320033, "epoch": 0.01218096034691375, "grad_norm": 8.25, "learning_rate": 3.745e-05, "loss": 0.6293457508087158, "mean_token_accuracy": 0.8460224624723196, "num_tokens": 1531375.0, "step": 750 }, { "entropy": 0.6562992895022035, "epoch": 0.012343373151539267, "grad_norm": 6.8125, "learning_rate": 3.795e-05, "loss": 0.6884897708892822, "mean_token_accuracy": 0.8328377775847912, "num_tokens": 1551968.0, "step": 760 }, { "entropy": 0.6044487936422229, "epoch": 0.012505785956164785, "grad_norm": 7.0625, "learning_rate": 3.845e-05, "loss": 0.6261463165283203, "mean_token_accuracy": 0.8525740645825863, "num_tokens": 1571824.0, "step": 770 }, { "entropy": 0.6126528047956527, "epoch": 0.0126681987607903, "grad_norm": 7.625, "learning_rate": 3.8950000000000005e-05, "loss": 0.6340300083160401, "mean_token_accuracy": 0.8427666001021862, "num_tokens": 1592653.0, "step": 780 }, { "entropy": 0.5936457801610231, "epoch": 0.012830611565415817, "grad_norm": 10.5625, "learning_rate": 3.9450000000000003e-05, "loss": 0.60413498878479, "mean_token_accuracy": 0.8519487999379635, "num_tokens": 1613628.0, "step": 790 }, { "entropy": 0.6624419002793729, "epoch": 0.012993024370041333, "grad_norm": 7.5, "learning_rate": 3.995e-05, "loss": 0.66268310546875, "mean_token_accuracy": 0.8383010856807231, "num_tokens": 1634109.0, "step": 800 }, { "entropy": 0.7716493745334446, "epoch": 0.013155437174666851, "grad_norm": 11.625, "learning_rate": 4.045000000000001e-05, "loss": 0.7763179779052735, "mean_token_accuracy": 0.8299281183630228, "num_tokens": 1654487.0, "step": 810 }, { "entropy": 0.7061418435536325, "epoch": 0.013317849979292367, "grad_norm": 10.75, "learning_rate": 4.095e-05, "loss": 0.7221976280212402, "mean_token_accuracy": 0.8228506475687027, "num_tokens": 1674688.0, "step": 820 }, { "entropy": 0.6204464551992714, "epoch": 0.013480262783917884, "grad_norm": 12.4375, "learning_rate": 4.145e-05, "loss": 0.6605092525482178, "mean_token_accuracy": 0.8365028351545334, "num_tokens": 1695100.0, "step": 830 }, { "entropy": 0.6647799324244261, "epoch": 0.013642675588543401, "grad_norm": 7.1875, "learning_rate": 4.195e-05, "loss": 0.6104082107543946, "mean_token_accuracy": 0.8425073504447937, "num_tokens": 1715477.0, "step": 840 }, { "entropy": 0.6345407022163272, "epoch": 0.013805088393168918, "grad_norm": 10.375, "learning_rate": 4.245e-05, "loss": 0.6713770389556885, "mean_token_accuracy": 0.8404051989316941, "num_tokens": 1734868.0, "step": 850 }, { "entropy": 0.7121429244987667, "epoch": 0.013967501197794434, "grad_norm": 7.21875, "learning_rate": 4.295e-05, "loss": 0.7055813312530518, "mean_token_accuracy": 0.8333683721721172, "num_tokens": 1755207.0, "step": 860 }, { "entropy": 0.6758566972799599, "epoch": 0.01412991400241995, "grad_norm": 9.5, "learning_rate": 4.345e-05, "loss": 0.7095383167266845, "mean_token_accuracy": 0.833843195810914, "num_tokens": 1776283.0, "step": 870 }, { "entropy": 0.6648086906876415, "epoch": 0.014292326807045468, "grad_norm": 7.65625, "learning_rate": 4.3950000000000004e-05, "loss": 0.6750187397003173, "mean_token_accuracy": 0.836848222091794, "num_tokens": 1797574.0, "step": 880 }, { "entropy": 0.6431586857885122, "epoch": 0.014454739611670984, "grad_norm": 8.0625, "learning_rate": 4.445e-05, "loss": 0.6321547985076904, "mean_token_accuracy": 0.8366352871060372, "num_tokens": 1817879.0, "step": 890 }, { "entropy": 0.5857367699034512, "epoch": 0.0146171524162965, "grad_norm": 8.9375, "learning_rate": 4.495e-05, "loss": 0.605044174194336, "mean_token_accuracy": 0.8495098151266575, "num_tokens": 1837049.0, "step": 900 }, { "entropy": 0.5559913588687777, "epoch": 0.014779565220922018, "grad_norm": 6.5, "learning_rate": 4.545000000000001e-05, "loss": 0.5686515808105469, "mean_token_accuracy": 0.860679442435503, "num_tokens": 1856738.0, "step": 910 }, { "entropy": 0.66058643553406, "epoch": 0.014941978025547534, "grad_norm": 6.09375, "learning_rate": 4.5950000000000006e-05, "loss": 0.6703020572662354, "mean_token_accuracy": 0.8388163961470128, "num_tokens": 1877866.0, "step": 920 }, { "entropy": 0.6154505412094295, "epoch": 0.01510439083017305, "grad_norm": 6.90625, "learning_rate": 4.6450000000000004e-05, "loss": 0.614939832687378, "mean_token_accuracy": 0.8522789657115937, "num_tokens": 1897917.0, "step": 930 }, { "entropy": 0.5696395044215024, "epoch": 0.015266803634798567, "grad_norm": 5.9375, "learning_rate": 4.695e-05, "loss": 0.5447560787200928, "mean_token_accuracy": 0.8636209405958652, "num_tokens": 1916760.0, "step": 940 }, { "entropy": 0.6210475713945925, "epoch": 0.015429216439424085, "grad_norm": 8.125, "learning_rate": 4.745e-05, "loss": 0.6639426708221435, "mean_token_accuracy": 0.8451591573655606, "num_tokens": 1937032.0, "step": 950 }, { "entropy": 0.6005269814282655, "epoch": 0.015591629244049601, "grad_norm": 6.65625, "learning_rate": 4.795e-05, "loss": 0.6444539546966552, "mean_token_accuracy": 0.8426235385239125, "num_tokens": 1957253.0, "step": 960 }, { "entropy": 0.6851747852051631, "epoch": 0.01575404204867512, "grad_norm": 8.75, "learning_rate": 4.845e-05, "loss": 0.6680282115936279, "mean_token_accuracy": 0.8380367375910283, "num_tokens": 1976829.0, "step": 970 }, { "entropy": 0.7627738047856838, "epoch": 0.015916454853300635, "grad_norm": 8.875, "learning_rate": 4.8950000000000004e-05, "loss": 0.7941970825195312, "mean_token_accuracy": 0.8154043816030025, "num_tokens": 1997973.0, "step": 980 }, { "entropy": 0.6788709055166692, "epoch": 0.01607886765792615, "grad_norm": 5.90625, "learning_rate": 4.945e-05, "loss": 0.6722760200500488, "mean_token_accuracy": 0.838634318113327, "num_tokens": 2020914.0, "step": 990 }, { "entropy": 0.7065723296254873, "epoch": 0.016241280462551667, "grad_norm": 11.875, "learning_rate": 4.995e-05, "loss": 0.7217304706573486, "mean_token_accuracy": 0.8208229046314954, "num_tokens": 2041016.0, "step": 1000 }, { "entropy": 0.6567716733086855, "epoch": 0.016403693267177184, "grad_norm": 7.21875, "learning_rate": 4.999999727635224e-05, "loss": 0.6528256893157959, "mean_token_accuracy": 0.8417807046324015, "num_tokens": 2061456.0, "step": 1010 }, { "entropy": 0.67735909326002, "epoch": 0.0165661060718027, "grad_norm": 7.53125, "learning_rate": 4.99999878612743e-05, "loss": 0.6576723098754883, "mean_token_accuracy": 0.8372169874608517, "num_tokens": 2082536.0, "step": 1020 }, { "entropy": 0.6566119282040745, "epoch": 0.016728518876428216, "grad_norm": 7.53125, "learning_rate": 4.9999971721143444e-05, "loss": 0.7015716075897217, "mean_token_accuracy": 0.82717998996377, "num_tokens": 2103485.0, "step": 1030 }, { "entropy": 0.6743375883437693, "epoch": 0.016890931681053736, "grad_norm": 8.1875, "learning_rate": 4.9999948855964015e-05, "loss": 0.6762298107147217, "mean_token_accuracy": 0.8294478237628937, "num_tokens": 2124022.0, "step": 1040 }, { "entropy": 0.6313844756223261, "epoch": 0.017053344485679252, "grad_norm": 7.09375, "learning_rate": 4.9999919265742155e-05, "loss": 0.6340336799621582, "mean_token_accuracy": 0.8431316096335649, "num_tokens": 2144043.0, "step": 1050 }, { "entropy": 0.6607924028299749, "epoch": 0.017215757290304768, "grad_norm": 7.53125, "learning_rate": 4.999988295048583e-05, "loss": 0.6779970169067383, "mean_token_accuracy": 0.8276824347674847, "num_tokens": 2164537.0, "step": 1060 }, { "entropy": 0.6185945854289457, "epoch": 0.017378170094930284, "grad_norm": 8.1875, "learning_rate": 4.9999839910204816e-05, "loss": 0.6573071479797363, "mean_token_accuracy": 0.8407052546739578, "num_tokens": 2186031.0, "step": 1070 }, { "entropy": 0.674162417370826, "epoch": 0.0175405828995558, "grad_norm": 6.4375, "learning_rate": 4.9999790144910676e-05, "loss": 0.6554736614227294, "mean_token_accuracy": 0.8369926974177361, "num_tokens": 2207052.0, "step": 1080 }, { "entropy": 0.7422868219204247, "epoch": 0.017702995704181317, "grad_norm": 8.25, "learning_rate": 4.99997336546168e-05, "loss": 0.720973539352417, "mean_token_accuracy": 0.8286464180797338, "num_tokens": 2227432.0, "step": 1090 }, { "entropy": 0.6908392930403352, "epoch": 0.017865408508806833, "grad_norm": 7.34375, "learning_rate": 4.9999670439338385e-05, "loss": 0.6983513832092285, "mean_token_accuracy": 0.8333748318254948, "num_tokens": 2248598.0, "step": 1100 }, { "entropy": 0.603192143375054, "epoch": 0.018027821313432352, "grad_norm": 10.0625, "learning_rate": 4.999960049909245e-05, "loss": 0.5810305118560791, "mean_token_accuracy": 0.8501943588256836, "num_tokens": 2269864.0, "step": 1110 }, { "entropy": 0.6362513208761811, "epoch": 0.01819023411805787, "grad_norm": 5.625, "learning_rate": 4.999952383389779e-05, "loss": 0.6297592639923095, "mean_token_accuracy": 0.8458648063242435, "num_tokens": 2290890.0, "step": 1120 }, { "entropy": 0.7054472896736115, "epoch": 0.018352646922683385, "grad_norm": 7.40625, "learning_rate": 4.999944044377504e-05, "loss": 0.7286113739013672, "mean_token_accuracy": 0.8242336392402649, "num_tokens": 2311861.0, "step": 1130 }, { "entropy": 0.5913792917504906, "epoch": 0.0185150597273089, "grad_norm": 10.1875, "learning_rate": 4.999935032874662e-05, "loss": 0.5708553314208984, "mean_token_accuracy": 0.8517396159470081, "num_tokens": 2332486.0, "step": 1140 }, { "entropy": 0.6411094740964473, "epoch": 0.018677472531934417, "grad_norm": 8.4375, "learning_rate": 4.999925348883678e-05, "loss": 0.6693879127502441, "mean_token_accuracy": 0.8454736657440662, "num_tokens": 2353486.0, "step": 1150 }, { "entropy": 0.6356449664570392, "epoch": 0.018839885336559933, "grad_norm": 5.8125, "learning_rate": 4.9999149924071584e-05, "loss": 0.698000717163086, "mean_token_accuracy": 0.83321433365345, "num_tokens": 2374007.0, "step": 1160 }, { "entropy": 0.6261114864144475, "epoch": 0.01900229814118545, "grad_norm": 7.96875, "learning_rate": 4.999903963447886e-05, "loss": 0.6136640071868896, "mean_token_accuracy": 0.8442231640219688, "num_tokens": 2393752.0, "step": 1170 }, { "entropy": 0.6122575618326664, "epoch": 0.01916471094581097, "grad_norm": 6.0, "learning_rate": 4.9998922620088304e-05, "loss": 0.555076265335083, "mean_token_accuracy": 0.8535819552838803, "num_tokens": 2414294.0, "step": 1180 }, { "entropy": 0.628760457225144, "epoch": 0.019327123750436485, "grad_norm": 8.0, "learning_rate": 4.9998798880931376e-05, "loss": 0.6284883975982666, "mean_token_accuracy": 0.8457021541893482, "num_tokens": 2434025.0, "step": 1190 }, { "entropy": 0.5905484580434859, "epoch": 0.019489536555062, "grad_norm": 9.0, "learning_rate": 4.999866841704136e-05, "loss": 0.6752679347991943, "mean_token_accuracy": 0.8277235560119152, "num_tokens": 2454698.0, "step": 1200 }, { "entropy": 0.6085076556541026, "epoch": 0.019651949359687518, "grad_norm": 9.5625, "learning_rate": 4.999853122845337e-05, "loss": 0.5819586753845215, "mean_token_accuracy": 0.8564575485885143, "num_tokens": 2475017.0, "step": 1210 }, { "entropy": 0.7193897894583643, "epoch": 0.019814362164313034, "grad_norm": 7.28125, "learning_rate": 4.99983873152043e-05, "loss": 0.7372403144836426, "mean_token_accuracy": 0.8103011205792428, "num_tokens": 2495417.0, "step": 1220 }, { "entropy": 0.6662851992063225, "epoch": 0.01997677496893855, "grad_norm": 8.6875, "learning_rate": 4.9998236677332854e-05, "loss": 0.7223872661590576, "mean_token_accuracy": 0.8314795598387719, "num_tokens": 2515771.0, "step": 1230 }, { "entropy": 0.7223233181983233, "epoch": 0.020139187773564066, "grad_norm": 10.0, "learning_rate": 4.9998079314879566e-05, "loss": 0.655531358718872, "mean_token_accuracy": 0.8460821695625782, "num_tokens": 2536086.0, "step": 1240 }, { "entropy": 0.6147067807614803, "epoch": 0.020301600578189586, "grad_norm": 6.8125, "learning_rate": 4.999791522788676e-05, "loss": 0.6075562953948974, "mean_token_accuracy": 0.8397103898227215, "num_tokens": 2557128.0, "step": 1250 }, { "entropy": 0.6335235115140676, "epoch": 0.020464013382815102, "grad_norm": 9.8125, "learning_rate": 4.9997744416398576e-05, "loss": 0.6286555767059326, "mean_token_accuracy": 0.8338091671466827, "num_tokens": 2578115.0, "step": 1260 }, { "entropy": 0.5821547092869878, "epoch": 0.02062642618744062, "grad_norm": 9.125, "learning_rate": 4.999756688046097e-05, "loss": 0.6697710037231446, "mean_token_accuracy": 0.8428331598639488, "num_tokens": 2598353.0, "step": 1270 }, { "entropy": 0.6776509778574109, "epoch": 0.020788838992066135, "grad_norm": 13.5, "learning_rate": 4.99973826201217e-05, "loss": 0.674089002609253, "mean_token_accuracy": 0.8287919774651528, "num_tokens": 2618104.0, "step": 1280 }, { "entropy": 0.6259799963794649, "epoch": 0.02095125179669165, "grad_norm": 5.34375, "learning_rate": 4.999719163543032e-05, "loss": 0.6220345973968506, "mean_token_accuracy": 0.8407798357307911, "num_tokens": 2639320.0, "step": 1290 }, { "entropy": 0.6262943460606039, "epoch": 0.021113664601317167, "grad_norm": 5.96875, "learning_rate": 4.999699392643821e-05, "loss": 0.6192759513854981, "mean_token_accuracy": 0.8404114864766598, "num_tokens": 2659183.0, "step": 1300 }, { "entropy": 0.6027031498961151, "epoch": 0.021276077405942683, "grad_norm": 6.625, "learning_rate": 4.999678949319856e-05, "loss": 0.6081377983093261, "mean_token_accuracy": 0.850033626705408, "num_tokens": 2680174.0, "step": 1310 }, { "entropy": 0.6384805213660002, "epoch": 0.021438490210568203, "grad_norm": 7.15625, "learning_rate": 4.9996578335766355e-05, "loss": 0.6952379703521728, "mean_token_accuracy": 0.8259844411164522, "num_tokens": 2701385.0, "step": 1320 }, { "entropy": 0.6324350102804601, "epoch": 0.02160090301519372, "grad_norm": 11.8125, "learning_rate": 4.999636045419841e-05, "loss": 0.6400077819824219, "mean_token_accuracy": 0.845042721927166, "num_tokens": 2722502.0, "step": 1330 }, { "entropy": 0.6273757327347994, "epoch": 0.021763315819819235, "grad_norm": 7.125, "learning_rate": 4.999613584855333e-05, "loss": 0.6311779499053956, "mean_token_accuracy": 0.8395951971411705, "num_tokens": 2741959.0, "step": 1340 }, { "entropy": 0.6877656266093254, "epoch": 0.02192572862444475, "grad_norm": 6.65625, "learning_rate": 4.999590451889152e-05, "loss": 0.6830215930938721, "mean_token_accuracy": 0.8293817102909088, "num_tokens": 2763514.0, "step": 1350 }, { "entropy": 0.6326506265439094, "epoch": 0.022088141429070268, "grad_norm": 8.8125, "learning_rate": 4.999566646527522e-05, "loss": 0.6457833290100098, "mean_token_accuracy": 0.8413306251168251, "num_tokens": 2783106.0, "step": 1360 }, { "entropy": 0.7112111530266703, "epoch": 0.022250554233695784, "grad_norm": 11.25, "learning_rate": 4.9995421687768476e-05, "loss": 0.7356928825378418, "mean_token_accuracy": 0.8242002084851265, "num_tokens": 2805110.0, "step": 1370 }, { "entropy": 0.6938821950927376, "epoch": 0.0224129670383213, "grad_norm": 8.875, "learning_rate": 4.999517018643711e-05, "loss": 0.6780797958374023, "mean_token_accuracy": 0.8318148702383041, "num_tokens": 2825434.0, "step": 1380 }, { "entropy": 0.660740125272423, "epoch": 0.02257537984294682, "grad_norm": 7.59375, "learning_rate": 4.99949119613488e-05, "loss": 0.6329428195953369, "mean_token_accuracy": 0.8385577112436294, "num_tokens": 2845972.0, "step": 1390 }, { "entropy": 0.6460150822065771, "epoch": 0.022737792647572336, "grad_norm": 7.25, "learning_rate": 4.9994647012573004e-05, "loss": 0.6976537227630615, "mean_token_accuracy": 0.8317453965544701, "num_tokens": 2866846.0, "step": 1400 }, { "entropy": 0.6826882255263627, "epoch": 0.022900205452197852, "grad_norm": 9.25, "learning_rate": 4.999437534018099e-05, "loss": 0.7186339855194092, "mean_token_accuracy": 0.826085914671421, "num_tokens": 2886897.0, "step": 1410 }, { "entropy": 0.7203893756493926, "epoch": 0.023062618256823368, "grad_norm": 9.5625, "learning_rate": 4.9994096944245826e-05, "loss": 0.69368896484375, "mean_token_accuracy": 0.8317368142306805, "num_tokens": 2907810.0, "step": 1420 }, { "entropy": 0.6474122636020183, "epoch": 0.023225031061448884, "grad_norm": 6.5625, "learning_rate": 4.999381182484242e-05, "loss": 0.654993724822998, "mean_token_accuracy": 0.8460724711418152, "num_tokens": 2929364.0, "step": 1430 }, { "entropy": 0.6712787088006735, "epoch": 0.0233874438660744, "grad_norm": 7.5, "learning_rate": 4.9993519982047465e-05, "loss": 0.6528678417205811, "mean_token_accuracy": 0.8440250113606453, "num_tokens": 2949771.0, "step": 1440 }, { "entropy": 0.6068566062487661, "epoch": 0.023549856670699917, "grad_norm": 8.5, "learning_rate": 4.9993221415939464e-05, "loss": 0.6209955215454102, "mean_token_accuracy": 0.8436641719192266, "num_tokens": 2970708.0, "step": 1450 }, { "entropy": 0.6884843144565821, "epoch": 0.023712269475325436, "grad_norm": 7.375, "learning_rate": 4.9992916126598734e-05, "loss": 0.6602507591247558, "mean_token_accuracy": 0.8337929643690586, "num_tokens": 2991126.0, "step": 1460 }, { "entropy": 0.7101544714532793, "epoch": 0.023874682279950953, "grad_norm": 10.1875, "learning_rate": 4.99926041141074e-05, "loss": 0.7643000602722168, "mean_token_accuracy": 0.8093240343034267, "num_tokens": 3010976.0, "step": 1470 }, { "entropy": 0.6422369550913573, "epoch": 0.02403709508457647, "grad_norm": 9.5625, "learning_rate": 4.999228537854938e-05, "loss": 0.6396332263946534, "mean_token_accuracy": 0.840703946352005, "num_tokens": 3031020.0, "step": 1480 }, { "entropy": 0.6317154383286834, "epoch": 0.024199507889201985, "grad_norm": 5.875, "learning_rate": 4.999195992001044e-05, "loss": 0.6271434783935547, "mean_token_accuracy": 0.8460198536515235, "num_tokens": 3051194.0, "step": 1490 }, { "entropy": 0.6059641180559993, "epoch": 0.0243619206938275, "grad_norm": 8.6875, "learning_rate": 4.9991627738578115e-05, "loss": 0.5861680030822753, "mean_token_accuracy": 0.855878384411335, "num_tokens": 3073657.0, "step": 1500 }, { "entropy": 0.6576013986952602, "epoch": 0.024524333498453017, "grad_norm": 10.0625, "learning_rate": 4.9991288834341755e-05, "loss": 0.6853253364562988, "mean_token_accuracy": 0.8249302089214325, "num_tokens": 3093966.0, "step": 1510 }, { "entropy": 0.6546165156178176, "epoch": 0.024686746303078533, "grad_norm": 10.125, "learning_rate": 4.9990943207392534e-05, "loss": 0.6464301586151123, "mean_token_accuracy": 0.848953840136528, "num_tokens": 3114787.0, "step": 1520 }, { "entropy": 0.6702816617675126, "epoch": 0.02484915910770405, "grad_norm": 9.5625, "learning_rate": 4.999059085782344e-05, "loss": 0.7352957725524902, "mean_token_accuracy": 0.8313984517008066, "num_tokens": 3135298.0, "step": 1530 }, { "entropy": 0.6151116089895368, "epoch": 0.02501157191232957, "grad_norm": 7.90625, "learning_rate": 4.999023178572922e-05, "loss": 0.6389631271362305, "mean_token_accuracy": 0.8396187096834182, "num_tokens": 3154742.0, "step": 1540 }, { "entropy": 0.6610760375857353, "epoch": 0.025173984716955086, "grad_norm": 6.53125, "learning_rate": 4.998986599120651e-05, "loss": 0.6815928936004638, "mean_token_accuracy": 0.8293173111975193, "num_tokens": 3176582.0, "step": 1550 }, { "entropy": 0.7457611185498536, "epoch": 0.0253363975215806, "grad_norm": 9.8125, "learning_rate": 4.998949347435368e-05, "loss": 0.7027628421783447, "mean_token_accuracy": 0.8341170594096183, "num_tokens": 3197288.0, "step": 1560 }, { "entropy": 0.6536169507540762, "epoch": 0.025498810326206118, "grad_norm": 7.0, "learning_rate": 4.998911423527094e-05, "loss": 0.7027228832244873, "mean_token_accuracy": 0.837767268717289, "num_tokens": 3217391.0, "step": 1570 }, { "entropy": 0.6839637429453432, "epoch": 0.025661223130831634, "grad_norm": 8.0625, "learning_rate": 4.998872827406032e-05, "loss": 0.6732037544250489, "mean_token_accuracy": 0.8272624306380749, "num_tokens": 3237450.0, "step": 1580 }, { "entropy": 0.6068074489943683, "epoch": 0.02582363593545715, "grad_norm": 8.375, "learning_rate": 4.9988335590825626e-05, "loss": 0.5995161056518554, "mean_token_accuracy": 0.8518301270902157, "num_tokens": 3257823.0, "step": 1590 }, { "entropy": 0.7045330876484514, "epoch": 0.025986048740082666, "grad_norm": 6.5625, "learning_rate": 4.99879361856725e-05, "loss": 0.7300395965576172, "mean_token_accuracy": 0.8216715585440397, "num_tokens": 3278658.0, "step": 1600 }, { "entropy": 0.7003553207963705, "epoch": 0.026148461544708186, "grad_norm": 9.375, "learning_rate": 4.9987530058708386e-05, "loss": 0.7295712947845459, "mean_token_accuracy": 0.827605814114213, "num_tokens": 3300790.0, "step": 1610 }, { "entropy": 0.6379376510158181, "epoch": 0.026310874349333702, "grad_norm": 7.875, "learning_rate": 4.9987117210042535e-05, "loss": 0.6378554821014404, "mean_token_accuracy": 0.8439707070589065, "num_tokens": 3322718.0, "step": 1620 }, { "entropy": 0.6577769642695784, "epoch": 0.02647328715395922, "grad_norm": 14.125, "learning_rate": 4.998669763978599e-05, "loss": 0.6310774326324463, "mean_token_accuracy": 0.8462517261505127, "num_tokens": 3342580.0, "step": 1630 }, { "entropy": 0.686842864844948, "epoch": 0.026635699958584735, "grad_norm": 8.5, "learning_rate": 4.998627134805164e-05, "loss": 0.7196121215820312, "mean_token_accuracy": 0.8283118709921837, "num_tokens": 3362778.0, "step": 1640 }, { "entropy": 0.7469226297922432, "epoch": 0.02679811276321025, "grad_norm": 7.8125, "learning_rate": 4.998583833495414e-05, "loss": 0.717543077468872, "mean_token_accuracy": 0.8232828296720982, "num_tokens": 3382935.0, "step": 1650 }, { "entropy": 0.6493885385803878, "epoch": 0.026960525567835767, "grad_norm": 9.4375, "learning_rate": 4.998539860060997e-05, "loss": 0.642906665802002, "mean_token_accuracy": 0.8445032376796007, "num_tokens": 3402898.0, "step": 1660 }, { "entropy": 0.6137605054304004, "epoch": 0.027122938372461283, "grad_norm": 8.375, "learning_rate": 4.998495214513742e-05, "loss": 0.6090366840362549, "mean_token_accuracy": 0.8509395346045494, "num_tokens": 3423369.0, "step": 1670 }, { "entropy": 0.6584057150408625, "epoch": 0.027285351177086803, "grad_norm": 9.9375, "learning_rate": 4.99844989686566e-05, "loss": 0.684459114074707, "mean_token_accuracy": 0.8399760983884335, "num_tokens": 3443150.0, "step": 1680 }, { "entropy": 0.5983063196763396, "epoch": 0.02744776398171232, "grad_norm": 9.0625, "learning_rate": 4.998403907128941e-05, "loss": 0.617271614074707, "mean_token_accuracy": 0.8493560530245304, "num_tokens": 3463689.0, "step": 1690 }, { "entropy": 0.7433805920183658, "epoch": 0.027610176786337835, "grad_norm": 8.6875, "learning_rate": 4.998357245315956e-05, "loss": 0.7538199424743652, "mean_token_accuracy": 0.8160848811268806, "num_tokens": 3483373.0, "step": 1700 }, { "entropy": 0.6546157393604517, "epoch": 0.02777258959096335, "grad_norm": 7.46875, "learning_rate": 4.9983099114392575e-05, "loss": 0.652245569229126, "mean_token_accuracy": 0.8428901672363281, "num_tokens": 3503738.0, "step": 1710 }, { "entropy": 0.6344511146657169, "epoch": 0.027935002395588868, "grad_norm": 7.125, "learning_rate": 4.998261905511577e-05, "loss": 0.6381659984588623, "mean_token_accuracy": 0.839777535200119, "num_tokens": 3524489.0, "step": 1720 }, { "entropy": 0.7599488878622651, "epoch": 0.028097415200214384, "grad_norm": 9.1875, "learning_rate": 4.998213227545832e-05, "loss": 0.7533522605895996, "mean_token_accuracy": 0.8187672339379788, "num_tokens": 3545698.0, "step": 1730 }, { "entropy": 0.6055545805953443, "epoch": 0.0282598280048399, "grad_norm": 4.71875, "learning_rate": 4.998163877555112e-05, "loss": 0.5821003437042236, "mean_token_accuracy": 0.856587091833353, "num_tokens": 3565365.0, "step": 1740 }, { "entropy": 0.4880189746618271, "epoch": 0.02842224080946542, "grad_norm": 7.5, "learning_rate": 4.998113855552696e-05, "loss": 0.5201074600219726, "mean_token_accuracy": 0.8660154804587364, "num_tokens": 3584203.0, "step": 1750 }, { "entropy": 0.566974843107164, "epoch": 0.028584653614090936, "grad_norm": 8.25, "learning_rate": 4.9980631615520376e-05, "loss": 0.5837238788604736, "mean_token_accuracy": 0.8564683832228184, "num_tokens": 3604865.0, "step": 1760 }, { "entropy": 0.6121708530932665, "epoch": 0.028747066418716452, "grad_norm": 7.40625, "learning_rate": 4.998011795566776e-05, "loss": 0.6285966396331787, "mean_token_accuracy": 0.8450384791940451, "num_tokens": 3624628.0, "step": 1770 }, { "entropy": 0.6610128439962863, "epoch": 0.028909479223341968, "grad_norm": 7.3125, "learning_rate": 4.997959757610726e-05, "loss": 0.6536825656890869, "mean_token_accuracy": 0.8381315685808659, "num_tokens": 3645530.0, "step": 1780 }, { "entropy": 0.650514520611614, "epoch": 0.029071892027967484, "grad_norm": 7.125, "learning_rate": 4.9979070476978884e-05, "loss": 0.6949801445007324, "mean_token_accuracy": 0.8273599307984114, "num_tokens": 3666153.0, "step": 1790 }, { "entropy": 0.6403517935425043, "epoch": 0.029234304832593, "grad_norm": 6.125, "learning_rate": 4.9978536658424413e-05, "loss": 0.6089488506317139, "mean_token_accuracy": 0.845673780143261, "num_tokens": 3686500.0, "step": 1800 }, { "entropy": 0.7061127666383982, "epoch": 0.029396717637218517, "grad_norm": 9.3125, "learning_rate": 4.997799612058744e-05, "loss": 0.7406625270843505, "mean_token_accuracy": 0.8216935351490975, "num_tokens": 3706767.0, "step": 1810 }, { "entropy": 0.6842590109445155, "epoch": 0.029559130441844036, "grad_norm": 8.1875, "learning_rate": 4.997744886361338e-05, "loss": 0.6931375980377197, "mean_token_accuracy": 0.8345143616199493, "num_tokens": 3727303.0, "step": 1820 }, { "entropy": 0.6869341291487217, "epoch": 0.029721543246469553, "grad_norm": 8.8125, "learning_rate": 4.997689488764944e-05, "loss": 0.7084289073944092, "mean_token_accuracy": 0.8276141107082366, "num_tokens": 3748063.0, "step": 1830 }, { "entropy": 0.6600330295041203, "epoch": 0.02988395605109507, "grad_norm": 8.875, "learning_rate": 4.9976334192844646e-05, "loss": 0.633921480178833, "mean_token_accuracy": 0.8415381994098425, "num_tokens": 3769480.0, "step": 1840 }, { "entropy": 0.7443829724565149, "epoch": 0.030046368855720585, "grad_norm": 7.0625, "learning_rate": 4.997576677934982e-05, "loss": 0.7611069679260254, "mean_token_accuracy": 0.8150496128946543, "num_tokens": 3791311.0, "step": 1850 }, { "entropy": 0.7486577089177444, "epoch": 0.0302087816603461, "grad_norm": 12.5625, "learning_rate": 4.99751926473176e-05, "loss": 0.7113588333129883, "mean_token_accuracy": 0.8199596181511879, "num_tokens": 3813378.0, "step": 1860 }, { "entropy": 0.6778116539120674, "epoch": 0.030371194464971617, "grad_norm": 6.5, "learning_rate": 4.997461179690244e-05, "loss": 0.7105162620544434, "mean_token_accuracy": 0.8218120686709881, "num_tokens": 3833517.0, "step": 1870 }, { "entropy": 0.6684778113849461, "epoch": 0.030533607269597134, "grad_norm": 7.75, "learning_rate": 4.9974024228260565e-05, "loss": 0.6603516578674317, "mean_token_accuracy": 0.828897763043642, "num_tokens": 3853646.0, "step": 1880 }, { "entropy": 0.6688979282975197, "epoch": 0.030696020074222653, "grad_norm": 10.25, "learning_rate": 4.997342994155005e-05, "loss": 0.67752685546875, "mean_token_accuracy": 0.8379020355641842, "num_tokens": 3874335.0, "step": 1890 }, { "entropy": 0.6140990403946489, "epoch": 0.03085843287884817, "grad_norm": 9.625, "learning_rate": 4.997282893693076e-05, "loss": 0.6682180404663086, "mean_token_accuracy": 0.829295140132308, "num_tokens": 3893705.0, "step": 1900 }, { "entropy": 0.6512978106737137, "epoch": 0.031020845683473686, "grad_norm": 10.375, "learning_rate": 4.997222121456436e-05, "loss": 0.6616105556488037, "mean_token_accuracy": 0.8433177877217531, "num_tokens": 3913957.0, "step": 1910 }, { "entropy": 0.6472589701414109, "epoch": 0.031183258488099202, "grad_norm": 6.8125, "learning_rate": 4.9971606774614345e-05, "loss": 0.5852319240570069, "mean_token_accuracy": 0.8498035192489624, "num_tokens": 3934278.0, "step": 1920 }, { "entropy": 0.7154510764405131, "epoch": 0.03134567129272472, "grad_norm": 10.1875, "learning_rate": 4.997098561724597e-05, "loss": 0.7976554870605469, "mean_token_accuracy": 0.8133331589400769, "num_tokens": 3954782.0, "step": 1930 }, { "entropy": 0.6751969298813492, "epoch": 0.03150808409735024, "grad_norm": 14.0625, "learning_rate": 4.997035774262635e-05, "loss": 0.7179558753967286, "mean_token_accuracy": 0.8260372389107943, "num_tokens": 3975619.0, "step": 1940 }, { "entropy": 0.5933005978353322, "epoch": 0.03167049690197575, "grad_norm": 7.875, "learning_rate": 4.9969723150924385e-05, "loss": 0.5667738914489746, "mean_token_accuracy": 0.848986653983593, "num_tokens": 3996094.0, "step": 1950 }, { "entropy": 0.6796863836236298, "epoch": 0.03183290970660127, "grad_norm": 8.6875, "learning_rate": 4.9969081842310776e-05, "loss": 0.7167119979858398, "mean_token_accuracy": 0.8279650837182999, "num_tokens": 4016937.0, "step": 1960 }, { "entropy": 0.6594563874881715, "epoch": 0.03199532251122678, "grad_norm": 10.625, "learning_rate": 4.996843381695804e-05, "loss": 0.680524492263794, "mean_token_accuracy": 0.8339626871049404, "num_tokens": 4037390.0, "step": 1970 }, { "entropy": 0.7767967276275158, "epoch": 0.0321577353158523, "grad_norm": 7.28125, "learning_rate": 4.996777907504048e-05, "loss": 0.7757351398468018, "mean_token_accuracy": 0.8121193595230579, "num_tokens": 4058914.0, "step": 1980 }, { "entropy": 0.6791807080619037, "epoch": 0.032320148120477815, "grad_norm": 8.625, "learning_rate": 4.996711761673425e-05, "loss": 0.6949872493743896, "mean_token_accuracy": 0.8287593573331833, "num_tokens": 4080202.0, "step": 1990 }, { "entropy": 0.5941385162062943, "epoch": 0.032482560925103335, "grad_norm": 7.09375, "learning_rate": 4.9966449442217264e-05, "loss": 0.5493052959442138, "mean_token_accuracy": 0.8565529599785805, "num_tokens": 4100583.0, "step": 2000 }, { "entropy": 0.6329201754182577, "epoch": 0.032644973729728854, "grad_norm": 6.8125, "learning_rate": 4.9965774551669276e-05, "loss": 0.6539619922637939, "mean_token_accuracy": 0.8407168544828891, "num_tokens": 4121317.0, "step": 2010 }, { "entropy": 0.6138559967279434, "epoch": 0.03280738653435437, "grad_norm": 8.125, "learning_rate": 4.996509294527182e-05, "loss": 0.6240595817565918, "mean_token_accuracy": 0.8450943857431412, "num_tokens": 4140819.0, "step": 2020 }, { "entropy": 0.6662635295651853, "epoch": 0.03296979933897989, "grad_norm": 9.4375, "learning_rate": 4.996440462320826e-05, "loss": 0.6726973056793213, "mean_token_accuracy": 0.841603733971715, "num_tokens": 4162343.0, "step": 2030 }, { "entropy": 0.623607392469421, "epoch": 0.0331322121436054, "grad_norm": 6.6875, "learning_rate": 4.9963709585663756e-05, "loss": 0.6472007274627686, "mean_token_accuracy": 0.8434355542063713, "num_tokens": 4183537.0, "step": 2040 }, { "entropy": 0.6435566311702132, "epoch": 0.03329462494823092, "grad_norm": 9.0, "learning_rate": 4.9963007832825266e-05, "loss": 0.6425178050994873, "mean_token_accuracy": 0.8408272985368968, "num_tokens": 4203313.0, "step": 2050 }, { "entropy": 0.6491169307380915, "epoch": 0.03345703775285643, "grad_norm": 10.8125, "learning_rate": 4.9962299364881565e-05, "loss": 0.6958297729492188, "mean_token_accuracy": 0.8402622133493424, "num_tokens": 4222877.0, "step": 2060 }, { "entropy": 0.6941154435276985, "epoch": 0.03361945055748195, "grad_norm": 9.25, "learning_rate": 4.996158418202324e-05, "loss": 0.7042751789093018, "mean_token_accuracy": 0.839061988145113, "num_tokens": 4242751.0, "step": 2070 }, { "entropy": 0.5966043720021844, "epoch": 0.03378186336210747, "grad_norm": 7.59375, "learning_rate": 4.996086228444267e-05, "loss": 0.5783230304718018, "mean_token_accuracy": 0.8504262544214726, "num_tokens": 4264156.0, "step": 2080 }, { "entropy": 0.6556655721738934, "epoch": 0.033944276166732984, "grad_norm": 6.03125, "learning_rate": 4.9960133672334055e-05, "loss": 0.6465120792388916, "mean_token_accuracy": 0.8351392693817615, "num_tokens": 4285366.0, "step": 2090 }, { "entropy": 0.7022624588571489, "epoch": 0.034106688971358504, "grad_norm": 8.375, "learning_rate": 4.995939834589338e-05, "loss": 0.6974969387054444, "mean_token_accuracy": 0.8283555507659912, "num_tokens": 4306996.0, "step": 2100 }, { "entropy": 0.6127382433973253, "epoch": 0.034269101775984016, "grad_norm": 6.03125, "learning_rate": 4.995865630531846e-05, "loss": 0.6397301197052002, "mean_token_accuracy": 0.8459843885153532, "num_tokens": 4326392.0, "step": 2110 }, { "entropy": 0.6887777224183083, "epoch": 0.034431514580609536, "grad_norm": 9.6875, "learning_rate": 4.995790755080891e-05, "loss": 0.6962561130523681, "mean_token_accuracy": 0.8213602989912033, "num_tokens": 4346742.0, "step": 2120 }, { "entropy": 0.5878725726157427, "epoch": 0.03459392738523505, "grad_norm": 9.5625, "learning_rate": 4.995715208256613e-05, "loss": 0.5715918064117431, "mean_token_accuracy": 0.8581021271646023, "num_tokens": 4366715.0, "step": 2130 }, { "entropy": 0.620410893857479, "epoch": 0.03475634018986057, "grad_norm": 6.78125, "learning_rate": 4.9956389900793354e-05, "loss": 0.6760702133178711, "mean_token_accuracy": 0.835820921510458, "num_tokens": 4387373.0, "step": 2140 }, { "entropy": 0.5778453190810978, "epoch": 0.03491875299448609, "grad_norm": 8.5, "learning_rate": 4.995562100569561e-05, "loss": 0.6110926628112793, "mean_token_accuracy": 0.8419410035014152, "num_tokens": 4407378.0, "step": 2150 }, { "entropy": 0.6965666376054287, "epoch": 0.0350811657991116, "grad_norm": 6.625, "learning_rate": 4.995484539747973e-05, "loss": 0.7376019477844238, "mean_token_accuracy": 0.8128385357558727, "num_tokens": 4428563.0, "step": 2160 }, { "entropy": 0.6876415701583027, "epoch": 0.03524357860373712, "grad_norm": 6.5, "learning_rate": 4.9954063076354364e-05, "loss": 0.6575036525726319, "mean_token_accuracy": 0.828713221848011, "num_tokens": 4448744.0, "step": 2170 }, { "entropy": 0.6416564293205738, "epoch": 0.03540599140836263, "grad_norm": 6.34375, "learning_rate": 4.995327404252994e-05, "loss": 0.621129846572876, "mean_token_accuracy": 0.8493403427302837, "num_tokens": 4468329.0, "step": 2180 }, { "entropy": 0.6869419689755887, "epoch": 0.03556840421298815, "grad_norm": 8.0625, "learning_rate": 4.995247829621872e-05, "loss": 0.6869090080261231, "mean_token_accuracy": 0.8322326209396124, "num_tokens": 4489087.0, "step": 2190 }, { "entropy": 0.5583072192966938, "epoch": 0.035730817017613666, "grad_norm": 6.375, "learning_rate": 4.995167583763476e-05, "loss": 0.6015540599822998, "mean_token_accuracy": 0.8491132784634828, "num_tokens": 4509204.0, "step": 2200 }, { "entropy": 0.563787151966244, "epoch": 0.035893229822239185, "grad_norm": 9.4375, "learning_rate": 4.9950866666993936e-05, "loss": 0.5742937564849854, "mean_token_accuracy": 0.8562870733439922, "num_tokens": 4529540.0, "step": 2210 }, { "entropy": 0.6526942936703563, "epoch": 0.036055642626864705, "grad_norm": 6.75, "learning_rate": 4.995005078451389e-05, "loss": 0.642384147644043, "mean_token_accuracy": 0.8385043375194072, "num_tokens": 4550570.0, "step": 2220 }, { "entropy": 0.686827337089926, "epoch": 0.03621805543149022, "grad_norm": 8.0625, "learning_rate": 4.994922819041412e-05, "loss": 0.7027174472808838, "mean_token_accuracy": 0.8330831401050091, "num_tokens": 4570321.0, "step": 2230 }, { "entropy": 0.6269988880492747, "epoch": 0.03638046823611574, "grad_norm": 8.4375, "learning_rate": 4.994839888491589e-05, "loss": 0.6209956169128418, "mean_token_accuracy": 0.8434634730219841, "num_tokens": 4590661.0, "step": 2240 }, { "entropy": 0.6285771703347564, "epoch": 0.03654288104074125, "grad_norm": 8.375, "learning_rate": 4.9947562868242305e-05, "loss": 0.6264989852905274, "mean_token_accuracy": 0.8432045605033636, "num_tokens": 4611286.0, "step": 2250 }, { "entropy": 0.6674019176512956, "epoch": 0.03670529384536677, "grad_norm": 8.0625, "learning_rate": 4.994672014061823e-05, "loss": 0.6920874118804932, "mean_token_accuracy": 0.8319635316729546, "num_tokens": 4631076.0, "step": 2260 }, { "entropy": 0.6526093812193722, "epoch": 0.03686770664999228, "grad_norm": 7.28125, "learning_rate": 4.994587070227038e-05, "loss": 0.6433675289154053, "mean_token_accuracy": 0.836441696062684, "num_tokens": 4652108.0, "step": 2270 }, { "entropy": 0.6292307368479669, "epoch": 0.0370301194546178, "grad_norm": 7.53125, "learning_rate": 4.994501455342724e-05, "loss": 0.6888304233551026, "mean_token_accuracy": 0.8364014320075512, "num_tokens": 4671534.0, "step": 2280 }, { "entropy": 0.6040578121319413, "epoch": 0.03719253225924332, "grad_norm": 4.71875, "learning_rate": 4.994415169431913e-05, "loss": 0.6241706371307373, "mean_token_accuracy": 0.8489211052656174, "num_tokens": 4691460.0, "step": 2290 }, { "entropy": 0.6578195394948125, "epoch": 0.037354945063868834, "grad_norm": 7.375, "learning_rate": 4.994328212517816e-05, "loss": 0.6137680053710938, "mean_token_accuracy": 0.8434836030006408, "num_tokens": 4711957.0, "step": 2300 }, { "entropy": 0.6509777183644474, "epoch": 0.037517357868494354, "grad_norm": 8.75, "learning_rate": 4.994240584623824e-05, "loss": 0.6698960304260254, "mean_token_accuracy": 0.8323767930269241, "num_tokens": 4732336.0, "step": 2310 }, { "entropy": 0.6516154005192221, "epoch": 0.03767977067311987, "grad_norm": 7.46875, "learning_rate": 4.994152285773509e-05, "loss": 0.6755148410797119, "mean_token_accuracy": 0.8318980149924755, "num_tokens": 4751417.0, "step": 2320 }, { "entropy": 0.6206552578136325, "epoch": 0.037842183477745386, "grad_norm": 8.3125, "learning_rate": 4.994063315990624e-05, "loss": 0.6169948101043701, "mean_token_accuracy": 0.8539159312844277, "num_tokens": 4771601.0, "step": 2330 }, { "entropy": 0.6806374900974334, "epoch": 0.0380045962823709, "grad_norm": 7.625, "learning_rate": 4.993973675299102e-05, "loss": 0.7160804748535157, "mean_token_accuracy": 0.8221852160990238, "num_tokens": 4792077.0, "step": 2340 }, { "entropy": 0.6235373409464955, "epoch": 0.03816700908699642, "grad_norm": 6.65625, "learning_rate": 4.993883363723056e-05, "loss": 0.637391996383667, "mean_token_accuracy": 0.8426662363111973, "num_tokens": 4812432.0, "step": 2350 }, { "entropy": 0.6373634625226259, "epoch": 0.03832942189162194, "grad_norm": 14.0625, "learning_rate": 4.9937923812867804e-05, "loss": 0.623402452468872, "mean_token_accuracy": 0.8462376371026039, "num_tokens": 4832913.0, "step": 2360 }, { "entropy": 0.6548450456932187, "epoch": 0.03849183469624745, "grad_norm": 8.8125, "learning_rate": 4.9937007280147506e-05, "loss": 0.6566375255584717, "mean_token_accuracy": 0.8474233612418175, "num_tokens": 4852875.0, "step": 2370 }, { "entropy": 0.6077595518901944, "epoch": 0.03865424750087297, "grad_norm": 6.21875, "learning_rate": 4.99360840393162e-05, "loss": 0.5916748046875, "mean_token_accuracy": 0.8549061041325331, "num_tokens": 4872657.0, "step": 2380 }, { "entropy": 0.6320307263173163, "epoch": 0.038816660305498484, "grad_norm": 7.90625, "learning_rate": 4.9935154090622256e-05, "loss": 0.6422575950622559, "mean_token_accuracy": 0.8447648040950299, "num_tokens": 4893851.0, "step": 2390 }, { "entropy": 0.6536320655606687, "epoch": 0.038979073110124, "grad_norm": 7.15625, "learning_rate": 4.993421743431582e-05, "loss": 0.6682426929473877, "mean_token_accuracy": 0.8385644659399987, "num_tokens": 4913847.0, "step": 2400 }, { "entropy": 0.6405682291835546, "epoch": 0.039141485914749516, "grad_norm": 8.5, "learning_rate": 4.993327407064885e-05, "loss": 0.6972053050994873, "mean_token_accuracy": 0.832927867770195, "num_tokens": 4934444.0, "step": 2410 }, { "entropy": 0.689426377415657, "epoch": 0.039303898719375036, "grad_norm": 10.75, "learning_rate": 4.993232399987513e-05, "loss": 0.6514886856079102, "mean_token_accuracy": 0.836055675148964, "num_tokens": 4955378.0, "step": 2420 }, { "entropy": 0.6522393541410565, "epoch": 0.039466311524000555, "grad_norm": 6.4375, "learning_rate": 4.993136722225022e-05, "loss": 0.6825310230255127, "mean_token_accuracy": 0.8419976815581321, "num_tokens": 4974551.0, "step": 2430 }, { "entropy": 0.6360483765602112, "epoch": 0.03962872432862607, "grad_norm": 9.0, "learning_rate": 4.9930403738031496e-05, "loss": 0.6411428451538086, "mean_token_accuracy": 0.8455651920288801, "num_tokens": 4993679.0, "step": 2440 }, { "entropy": 0.6481083652935922, "epoch": 0.03979113713325159, "grad_norm": 8.4375, "learning_rate": 4.9929433547478147e-05, "loss": 0.6905539035797119, "mean_token_accuracy": 0.8374447442591191, "num_tokens": 5014197.0, "step": 2450 }, { "entropy": 0.5613165777176619, "epoch": 0.0399535499378771, "grad_norm": 6.15625, "learning_rate": 4.992845665085113e-05, "loss": 0.5980227947235107, "mean_token_accuracy": 0.8497913345694542, "num_tokens": 5033478.0, "step": 2460 }, { "entropy": 0.6386135086882859, "epoch": 0.04011596274250262, "grad_norm": 6.65625, "learning_rate": 4.9927473048413265e-05, "loss": 0.6227917671203613, "mean_token_accuracy": 0.8425655208528042, "num_tokens": 5054241.0, "step": 2470 }, { "entropy": 0.6724992427043617, "epoch": 0.04027837554712813, "grad_norm": 8.0625, "learning_rate": 4.992648274042913e-05, "loss": 0.665386152267456, "mean_token_accuracy": 0.8398520104587078, "num_tokens": 5074465.0, "step": 2480 }, { "entropy": 0.5983042795211077, "epoch": 0.04044078835175365, "grad_norm": 6.59375, "learning_rate": 4.9925485727165114e-05, "loss": 0.5984559059143066, "mean_token_accuracy": 0.8589447520673275, "num_tokens": 5094733.0, "step": 2490 }, { "entropy": 0.6814679374918342, "epoch": 0.04060320115637917, "grad_norm": 5.59375, "learning_rate": 4.992448200888942e-05, "loss": 0.6941049098968506, "mean_token_accuracy": 0.8306655757129192, "num_tokens": 5113676.0, "step": 2500 }, { "entropy": 0.6662566600367427, "epoch": 0.040765613961004685, "grad_norm": 10.75, "learning_rate": 4.992347158587205e-05, "loss": 0.677312707901001, "mean_token_accuracy": 0.8293142408132553, "num_tokens": 5133935.0, "step": 2510 }, { "entropy": 0.6669080972671508, "epoch": 0.040928026765630204, "grad_norm": 11.25, "learning_rate": 4.992245445838482e-05, "loss": 0.6824161529541015, "mean_token_accuracy": 0.8259681671857834, "num_tokens": 5153663.0, "step": 2520 }, { "entropy": 0.6314652482979, "epoch": 0.04109043957025572, "grad_norm": 7.9375, "learning_rate": 4.992143062670132e-05, "loss": 0.5916683197021484, "mean_token_accuracy": 0.850905179977417, "num_tokens": 5174098.0, "step": 2530 }, { "entropy": 0.7374189527705312, "epoch": 0.04125285237488124, "grad_norm": 9.6875, "learning_rate": 4.992040009109698e-05, "loss": 0.7898959159851074, "mean_token_accuracy": 0.8092671103775502, "num_tokens": 5194690.0, "step": 2540 }, { "entropy": 0.70632503782399, "epoch": 0.04141526517950675, "grad_norm": 7.90625, "learning_rate": 4.991936285184901e-05, "loss": 0.6878218650817871, "mean_token_accuracy": 0.8274204213172197, "num_tokens": 5215001.0, "step": 2550 }, { "entropy": 0.679837900120765, "epoch": 0.04157767798413227, "grad_norm": 8.0, "learning_rate": 4.9918318909236427e-05, "loss": 0.6833276271820068, "mean_token_accuracy": 0.8315151773393155, "num_tokens": 5235591.0, "step": 2560 }, { "entropy": 0.6829681197181344, "epoch": 0.04174009078875779, "grad_norm": 8.4375, "learning_rate": 4.991726826354006e-05, "loss": 0.7016257286071778, "mean_token_accuracy": 0.8277913201600313, "num_tokens": 5257601.0, "step": 2570 }, { "entropy": 0.595448627974838, "epoch": 0.0419025035933833, "grad_norm": 5.15625, "learning_rate": 4.991621091504254e-05, "loss": 0.5617449283599854, "mean_token_accuracy": 0.8588613517582416, "num_tokens": 5277839.0, "step": 2580 }, { "entropy": 0.5623145036399364, "epoch": 0.04206491639800882, "grad_norm": 10.5625, "learning_rate": 4.9915146864028275e-05, "loss": 0.5626225948333741, "mean_token_accuracy": 0.8517605714499951, "num_tokens": 5298223.0, "step": 2590 }, { "entropy": 0.5724875956773758, "epoch": 0.042227329202634334, "grad_norm": 6.78125, "learning_rate": 4.991407611078351e-05, "loss": 0.5911717891693116, "mean_token_accuracy": 0.8581851676106453, "num_tokens": 5318362.0, "step": 2600 }, { "entropy": 0.6032400705851615, "epoch": 0.042389742007259854, "grad_norm": 8.6875, "learning_rate": 4.991299865559629e-05, "loss": 0.5904241561889648, "mean_token_accuracy": 0.851003035530448, "num_tokens": 5339217.0, "step": 2610 }, { "entropy": 0.6398322516586632, "epoch": 0.042552154811885366, "grad_norm": 7.15625, "learning_rate": 4.991191449875644e-05, "loss": 0.6712616920471192, "mean_token_accuracy": 0.8360833860933781, "num_tokens": 5359712.0, "step": 2620 }, { "entropy": 0.7209280911833048, "epoch": 0.042714567616510886, "grad_norm": 9.4375, "learning_rate": 4.99108236405556e-05, "loss": 0.7008921146392822, "mean_token_accuracy": 0.8279690191149711, "num_tokens": 5381308.0, "step": 2630 }, { "entropy": 0.7144496374763548, "epoch": 0.042876980421136406, "grad_norm": 9.4375, "learning_rate": 4.990972608128722e-05, "loss": 0.7088531970977783, "mean_token_accuracy": 0.8318045917898417, "num_tokens": 5401685.0, "step": 2640 }, { "entropy": 0.6163334139157086, "epoch": 0.04303939322576192, "grad_norm": 6.96875, "learning_rate": 4.990862182124655e-05, "loss": 0.6124753952026367, "mean_token_accuracy": 0.8464390028268098, "num_tokens": 5421394.0, "step": 2650 }, { "entropy": 0.6740220096893609, "epoch": 0.04320180603038744, "grad_norm": 9.4375, "learning_rate": 4.990751086073062e-05, "loss": 0.7052641868591308, "mean_token_accuracy": 0.8279772713780403, "num_tokens": 5441651.0, "step": 2660 }, { "entropy": 0.6317045450210571, "epoch": 0.04336421883501295, "grad_norm": 5.1875, "learning_rate": 4.990639320003829e-05, "loss": 0.6352618217468262, "mean_token_accuracy": 0.8391068048775197, "num_tokens": 5462467.0, "step": 2670 }, { "entropy": 0.5632481563836336, "epoch": 0.04352663163963847, "grad_norm": 5.84375, "learning_rate": 4.9905268839470234e-05, "loss": 0.543444013595581, "mean_token_accuracy": 0.8620394960045814, "num_tokens": 5483588.0, "step": 2680 }, { "entropy": 0.6363900216296315, "epoch": 0.04368904444426398, "grad_norm": 6.25, "learning_rate": 4.9904137779328875e-05, "loss": 0.7050906181335449, "mean_token_accuracy": 0.8380511701107025, "num_tokens": 5503456.0, "step": 2690 }, { "entropy": 0.6352678050287068, "epoch": 0.0438514572488895, "grad_norm": 8.0625, "learning_rate": 4.990300001991848e-05, "loss": 0.6055617332458496, "mean_token_accuracy": 0.8458418905735016, "num_tokens": 5523863.0, "step": 2700 }, { "entropy": 0.6059881245717407, "epoch": 0.04401387005351502, "grad_norm": 9.0625, "learning_rate": 4.990185556154512e-05, "loss": 0.5839466094970703, "mean_token_accuracy": 0.8468217875808477, "num_tokens": 5543824.0, "step": 2710 }, { "entropy": 0.6353316034190357, "epoch": 0.044176282858140535, "grad_norm": 8.8125, "learning_rate": 4.9900704404516656e-05, "loss": 0.6560567378997803, "mean_token_accuracy": 0.8402208670973778, "num_tokens": 5563228.0, "step": 2720 }, { "entropy": 0.6160068994387984, "epoch": 0.044338695662766055, "grad_norm": 10.125, "learning_rate": 4.989954654914274e-05, "loss": 0.6391449451446534, "mean_token_accuracy": 0.846841161698103, "num_tokens": 5581925.0, "step": 2730 }, { "entropy": 0.5835158546920866, "epoch": 0.04450110846739157, "grad_norm": 5.75, "learning_rate": 4.9898381995734844e-05, "loss": 0.6077471256256104, "mean_token_accuracy": 0.8472371194511652, "num_tokens": 5602456.0, "step": 2740 }, { "entropy": 0.7187348742038011, "epoch": 0.04466352127201709, "grad_norm": 11.3125, "learning_rate": 4.9897210744606235e-05, "loss": 0.7577851772308349, "mean_token_accuracy": 0.821418435126543, "num_tokens": 5623190.0, "step": 2750 }, { "entropy": 0.7146253853105009, "epoch": 0.0448259340766426, "grad_norm": 5.59375, "learning_rate": 4.989603279607199e-05, "loss": 0.6649045944213867, "mean_token_accuracy": 0.8378861252218485, "num_tokens": 5643660.0, "step": 2760 }, { "entropy": 0.7270177016500383, "epoch": 0.04498834688126812, "grad_norm": 10.3125, "learning_rate": 4.989484815044897e-05, "loss": 0.7664875984191895, "mean_token_accuracy": 0.8206714265048504, "num_tokens": 5663671.0, "step": 2770 }, { "entropy": 0.6373738550581038, "epoch": 0.04515075968589364, "grad_norm": 11.5625, "learning_rate": 4.9893656808055845e-05, "loss": 0.6514851570129394, "mean_token_accuracy": 0.8311269264668226, "num_tokens": 5684474.0, "step": 2780 }, { "entropy": 0.6361436916980893, "epoch": 0.04531317249051915, "grad_norm": 7.40625, "learning_rate": 4.98924587692131e-05, "loss": 0.6313751220703125, "mean_token_accuracy": 0.8405101835727692, "num_tokens": 5703791.0, "step": 2790 }, { "entropy": 0.6087742246687412, "epoch": 0.04547558529514467, "grad_norm": 7.90625, "learning_rate": 4.9891254034242996e-05, "loss": 0.5916975498199463, "mean_token_accuracy": 0.8437209621071815, "num_tokens": 5723794.0, "step": 2800 }, { "entropy": 0.6337647124193608, "epoch": 0.045637998099770184, "grad_norm": 8.25, "learning_rate": 4.989004260346962e-05, "loss": 0.6329709053039551, "mean_token_accuracy": 0.8375658243894577, "num_tokens": 5744769.0, "step": 2810 }, { "entropy": 0.6656116365455091, "epoch": 0.045800410904395704, "grad_norm": 10.0, "learning_rate": 4.9888824477218845e-05, "loss": 0.6892581939697265, "mean_token_accuracy": 0.8408070728182793, "num_tokens": 5766321.0, "step": 2820 }, { "entropy": 0.5909729884937406, "epoch": 0.04596282370902122, "grad_norm": 7.59375, "learning_rate": 4.988759965581836e-05, "loss": 0.6100039482116699, "mean_token_accuracy": 0.8441951796412468, "num_tokens": 5786765.0, "step": 2830 }, { "entropy": 0.6329749719239771, "epoch": 0.046125236513646736, "grad_norm": 8.4375, "learning_rate": 4.9886368139597626e-05, "loss": 0.5884695053100586, "mean_token_accuracy": 0.8480496771633625, "num_tokens": 5808063.0, "step": 2840 }, { "entropy": 0.5918437451589853, "epoch": 0.046287649318272256, "grad_norm": 9.375, "learning_rate": 4.988512992888794e-05, "loss": 0.595492935180664, "mean_token_accuracy": 0.845385817438364, "num_tokens": 5828793.0, "step": 2850 }, { "entropy": 0.6279665031470358, "epoch": 0.04645006212289777, "grad_norm": 8.3125, "learning_rate": 4.9883885024022374e-05, "loss": 0.670698881149292, "mean_token_accuracy": 0.8347293566912413, "num_tokens": 5848752.0, "step": 2860 }, { "entropy": 0.6289356740191578, "epoch": 0.04661247492752329, "grad_norm": 8.9375, "learning_rate": 4.988263342533582e-05, "loss": 0.693397331237793, "mean_token_accuracy": 0.8231019467115402, "num_tokens": 5871221.0, "step": 2870 }, { "entropy": 0.587257741112262, "epoch": 0.0467748877321488, "grad_norm": 11.5, "learning_rate": 4.988137513316494e-05, "loss": 0.572995376586914, "mean_token_accuracy": 0.8613566741347313, "num_tokens": 5889998.0, "step": 2880 }, { "entropy": 0.7090319300070405, "epoch": 0.04693730053677432, "grad_norm": 5.6875, "learning_rate": 4.988011014784825e-05, "loss": 0.7409762382507324, "mean_token_accuracy": 0.8242812421172857, "num_tokens": 5910277.0, "step": 2890 }, { "entropy": 0.6868734234943986, "epoch": 0.04709971334139983, "grad_norm": 6.625, "learning_rate": 4.9878838469726e-05, "loss": 0.7320771217346191, "mean_token_accuracy": 0.8271150484681129, "num_tokens": 5930948.0, "step": 2900 }, { "entropy": 0.6431249202229082, "epoch": 0.04726212614602535, "grad_norm": 5.4375, "learning_rate": 4.9877560099140296e-05, "loss": 0.661271333694458, "mean_token_accuracy": 0.8406444422900676, "num_tokens": 5951340.0, "step": 2910 }, { "entropy": 0.7424022488296032, "epoch": 0.04742453895065087, "grad_norm": 5.5, "learning_rate": 4.987627503643502e-05, "loss": 0.7327793598175049, "mean_token_accuracy": 0.8177293986082077, "num_tokens": 5973098.0, "step": 2920 }, { "entropy": 0.6934476930648088, "epoch": 0.047586951755276385, "grad_norm": 9.25, "learning_rate": 4.987498328195585e-05, "loss": 0.6487076759338379, "mean_token_accuracy": 0.8421486996114254, "num_tokens": 5992652.0, "step": 2930 }, { "entropy": 0.661999425292015, "epoch": 0.047749364559901905, "grad_norm": 8.0625, "learning_rate": 4.987368483605028e-05, "loss": 0.6471284389495849, "mean_token_accuracy": 0.8400127746164798, "num_tokens": 6013071.0, "step": 2940 }, { "entropy": 0.6999843327328563, "epoch": 0.04791177736452742, "grad_norm": 5.65625, "learning_rate": 4.9872379699067584e-05, "loss": 0.7519407272338867, "mean_token_accuracy": 0.8198323249816895, "num_tokens": 6034594.0, "step": 2950 }, { "entropy": 0.7032069018110633, "epoch": 0.04807419016915294, "grad_norm": 8.8125, "learning_rate": 4.9871067871358847e-05, "loss": 0.645330810546875, "mean_token_accuracy": 0.8383244939148426, "num_tokens": 6055560.0, "step": 2960 }, { "entropy": 0.662582057993859, "epoch": 0.04823660297377845, "grad_norm": 7.21875, "learning_rate": 4.986974935327696e-05, "loss": 0.6841488838195801, "mean_token_accuracy": 0.8291450373828411, "num_tokens": 6076928.0, "step": 2970 }, { "entropy": 0.5949266533367336, "epoch": 0.04839901577840397, "grad_norm": 7.34375, "learning_rate": 4.986842414517661e-05, "loss": 0.6104370594024658, "mean_token_accuracy": 0.8429790183901786, "num_tokens": 6097585.0, "step": 2980 }, { "entropy": 0.6268146784044802, "epoch": 0.04856142858302949, "grad_norm": 7.625, "learning_rate": 4.986709224741428e-05, "loss": 0.6487352848052979, "mean_token_accuracy": 0.8405282892286777, "num_tokens": 6117450.0, "step": 2990 }, { "entropy": 0.6422375218011439, "epoch": 0.048723841387655, "grad_norm": 6.3125, "learning_rate": 4.986575366034824e-05, "loss": 0.6440940380096436, "mean_token_accuracy": 0.8349718920886516, "num_tokens": 6138334.0, "step": 3000 }, { "entropy": 0.6935611752793193, "epoch": 0.04888625419228052, "grad_norm": 8.6875, "learning_rate": 4.986440838433859e-05, "loss": 0.6782209396362304, "mean_token_accuracy": 0.8318407140672207, "num_tokens": 6158947.0, "step": 3010 }, { "entropy": 0.6235702277161181, "epoch": 0.049048666996906035, "grad_norm": 6.34375, "learning_rate": 4.98630564197472e-05, "loss": 0.5967243671417236, "mean_token_accuracy": 0.8466006837785244, "num_tokens": 6178603.0, "step": 3020 }, { "entropy": 0.7022992140147835, "epoch": 0.049211079801531554, "grad_norm": 6.59375, "learning_rate": 4.9861697766937765e-05, "loss": 0.7170434951782226, "mean_token_accuracy": 0.8257182449102402, "num_tokens": 6200715.0, "step": 3030 }, { "entropy": 0.7003879647701978, "epoch": 0.04937349260615707, "grad_norm": 6.125, "learning_rate": 4.986033242627575e-05, "loss": 0.7401596546173096, "mean_token_accuracy": 0.8131972953677178, "num_tokens": 6222628.0, "step": 3040 }, { "entropy": 0.6100624246522784, "epoch": 0.04953590541078259, "grad_norm": 10.3125, "learning_rate": 4.985896039812845e-05, "loss": 0.6422460079193115, "mean_token_accuracy": 0.8437771417200566, "num_tokens": 6242870.0, "step": 3050 }, { "entropy": 0.6766166457906365, "epoch": 0.0496983182154081, "grad_norm": 7.53125, "learning_rate": 4.985758168286493e-05, "loss": 0.6614872932434082, "mean_token_accuracy": 0.8315763741731643, "num_tokens": 6265029.0, "step": 3060 }, { "entropy": 0.5662491852068342, "epoch": 0.04986073102003362, "grad_norm": 8.8125, "learning_rate": 4.985619628085607e-05, "loss": 0.5579596042633057, "mean_token_accuracy": 0.8544669635593891, "num_tokens": 6285111.0, "step": 3070 }, { "entropy": 0.6171354637481272, "epoch": 0.05002314382465914, "grad_norm": 8.625, "learning_rate": 4.9854804192474556e-05, "loss": 0.6334100246429444, "mean_token_accuracy": 0.840851490944624, "num_tokens": 6305331.0, "step": 3080 }, { "entropy": 0.6492121773771942, "epoch": 0.05018555662928465, "grad_norm": 9.6875, "learning_rate": 4.985340541809486e-05, "loss": 0.6877458572387696, "mean_token_accuracy": 0.8281893685460091, "num_tokens": 6325641.0, "step": 3090 }, { "entropy": 0.6027677514590323, "epoch": 0.05034796943391017, "grad_norm": 7.4375, "learning_rate": 4.9851999958093245e-05, "loss": 0.5979518890380859, "mean_token_accuracy": 0.8514004915952682, "num_tokens": 6346572.0, "step": 3100 }, { "entropy": 0.6478552164975554, "epoch": 0.050510382238535684, "grad_norm": 7.03125, "learning_rate": 4.985058781284779e-05, "loss": 0.6190874099731445, "mean_token_accuracy": 0.8382560908794403, "num_tokens": 6366039.0, "step": 3110 }, { "entropy": 0.615083362814039, "epoch": 0.0506727950431612, "grad_norm": 10.1875, "learning_rate": 4.984916898273837e-05, "loss": 0.6345150470733643, "mean_token_accuracy": 0.8417654484510422, "num_tokens": 6385456.0, "step": 3120 }, { "entropy": 0.6141808737069369, "epoch": 0.050835207847786716, "grad_norm": 7.5625, "learning_rate": 4.9847743468146644e-05, "loss": 0.6316059112548829, "mean_token_accuracy": 0.8432671047747136, "num_tokens": 6406968.0, "step": 3130 }, { "entropy": 0.6828809939324856, "epoch": 0.050997620652412236, "grad_norm": 8.3125, "learning_rate": 4.984631126945608e-05, "loss": 0.6829803466796875, "mean_token_accuracy": 0.8207681879401207, "num_tokens": 6427228.0, "step": 3140 }, { "entropy": 0.6489829713478684, "epoch": 0.051160033457037755, "grad_norm": 7.5, "learning_rate": 4.9844872387051954e-05, "loss": 0.6350878238677978, "mean_token_accuracy": 0.8414121761918067, "num_tokens": 6446851.0, "step": 3150 }, { "entropy": 0.5352966155856848, "epoch": 0.05132244626166327, "grad_norm": 8.6875, "learning_rate": 4.984342682132131e-05, "loss": 0.5481082916259765, "mean_token_accuracy": 0.8659876964986324, "num_tokens": 6467984.0, "step": 3160 }, { "entropy": 0.6254248144570738, "epoch": 0.05148485906628879, "grad_norm": 11.8125, "learning_rate": 4.984197457265303e-05, "loss": 0.683281135559082, "mean_token_accuracy": 0.8344996437430382, "num_tokens": 6488577.0, "step": 3170 }, { "entropy": 0.6474242734722793, "epoch": 0.0516472718709143, "grad_norm": 8.375, "learning_rate": 4.9840515641437755e-05, "loss": 0.6612156867980957, "mean_token_accuracy": 0.8423461005091667, "num_tokens": 6509074.0, "step": 3180 }, { "entropy": 0.6262621279805899, "epoch": 0.05180968467553982, "grad_norm": 7.4375, "learning_rate": 4.983905002806796e-05, "loss": 0.6439118385314941, "mean_token_accuracy": 0.8551285330206155, "num_tokens": 6529124.0, "step": 3190 }, { "entropy": 0.6742719715461135, "epoch": 0.05197209748016533, "grad_norm": 6.65625, "learning_rate": 4.983757773293787e-05, "loss": 0.6999811172485352, "mean_token_accuracy": 0.8285171501338482, "num_tokens": 6549018.0, "step": 3200 }, { "entropy": 0.6714853652752936, "epoch": 0.05213451028479085, "grad_norm": 9.3125, "learning_rate": 4.983609875644355e-05, "loss": 0.6614511966705322, "mean_token_accuracy": 0.8380776554346084, "num_tokens": 6570060.0, "step": 3210 }, { "entropy": 0.6439214648678899, "epoch": 0.05229692308941637, "grad_norm": 10.5625, "learning_rate": 4.9834613098982855e-05, "loss": 0.6004345893859864, "mean_token_accuracy": 0.8492955140769481, "num_tokens": 6590034.0, "step": 3220 }, { "entropy": 0.6454493676312267, "epoch": 0.052459335894041885, "grad_norm": 8.9375, "learning_rate": 4.983312076095542e-05, "loss": 0.6671023368835449, "mean_token_accuracy": 0.8310371153056622, "num_tokens": 6610627.0, "step": 3230 }, { "entropy": 0.6315222263336182, "epoch": 0.052621748698667405, "grad_norm": 6.5, "learning_rate": 4.98316217427627e-05, "loss": 0.6295682430267334, "mean_token_accuracy": 0.8411233454942704, "num_tokens": 6631467.0, "step": 3240 }, { "entropy": 0.6201523557305336, "epoch": 0.05278416150329292, "grad_norm": 6.8125, "learning_rate": 4.983011604480792e-05, "loss": 0.6581500053405762, "mean_token_accuracy": 0.8345489218831063, "num_tokens": 6652253.0, "step": 3250 }, { "entropy": 0.6057658595498652, "epoch": 0.05294657430791844, "grad_norm": 7.8125, "learning_rate": 4.982860366749612e-05, "loss": 0.6194047451019287, "mean_token_accuracy": 0.8457935705780983, "num_tokens": 6674023.0, "step": 3260 }, { "entropy": 0.6321124321315438, "epoch": 0.05310898711254395, "grad_norm": 9.5625, "learning_rate": 4.982708461123414e-05, "loss": 0.6193779468536377, "mean_token_accuracy": 0.8444336891174317, "num_tokens": 6693482.0, "step": 3270 }, { "entropy": 0.6074628360569477, "epoch": 0.05327139991716947, "grad_norm": 12.25, "learning_rate": 4.98255588764306e-05, "loss": 0.6265405654907227, "mean_token_accuracy": 0.8478332698345185, "num_tokens": 6713510.0, "step": 3280 }, { "entropy": 0.6593122572638095, "epoch": 0.05343381272179499, "grad_norm": 6.6875, "learning_rate": 4.9824026463495935e-05, "loss": 0.6423667430877685, "mean_token_accuracy": 0.8253486692905426, "num_tokens": 6733819.0, "step": 3290 }, { "entropy": 0.6318762991577387, "epoch": 0.0535962255264205, "grad_norm": 7.40625, "learning_rate": 4.982248737284235e-05, "loss": 0.6779256343841553, "mean_token_accuracy": 0.8331849966198206, "num_tokens": 6755317.0, "step": 3300 }, { "entropy": 0.6566152520477772, "epoch": 0.05375863833104602, "grad_norm": 9.1875, "learning_rate": 4.982094160488389e-05, "loss": 0.6812151432037353, "mean_token_accuracy": 0.8303148686885834, "num_tokens": 6775917.0, "step": 3310 }, { "entropy": 0.6755422582384198, "epoch": 0.053921051135671534, "grad_norm": 6.15625, "learning_rate": 4.981938916003635e-05, "loss": 0.7052660942077636, "mean_token_accuracy": 0.8284700527787209, "num_tokens": 6796904.0, "step": 3320 }, { "entropy": 0.6428181540220976, "epoch": 0.054083463940297054, "grad_norm": 5.5, "learning_rate": 4.981783003871735e-05, "loss": 0.6236994743347168, "mean_token_accuracy": 0.842438717931509, "num_tokens": 6816656.0, "step": 3330 }, { "entropy": 0.6446730414405465, "epoch": 0.054245876744922567, "grad_norm": 7.65625, "learning_rate": 4.981626424134629e-05, "loss": 0.6383639812469483, "mean_token_accuracy": 0.839545851200819, "num_tokens": 6836337.0, "step": 3340 }, { "entropy": 0.673233937472105, "epoch": 0.054408289549548086, "grad_norm": 8.1875, "learning_rate": 4.981469176834439e-05, "loss": 0.7100165843963623, "mean_token_accuracy": 0.8334970086812973, "num_tokens": 6856421.0, "step": 3350 }, { "entropy": 0.6346360729075968, "epoch": 0.054570702354173606, "grad_norm": 10.125, "learning_rate": 4.9813112620134625e-05, "loss": 0.6407549858093262, "mean_token_accuracy": 0.8395348787307739, "num_tokens": 6876054.0, "step": 3360 }, { "entropy": 0.684779678657651, "epoch": 0.05473311515879912, "grad_norm": 7.25, "learning_rate": 4.9811526797141806e-05, "loss": 0.6471865177154541, "mean_token_accuracy": 0.8374948419630528, "num_tokens": 6897223.0, "step": 3370 }, { "entropy": 0.7285437794402242, "epoch": 0.05489552796342464, "grad_norm": 7.28125, "learning_rate": 4.9809934299792524e-05, "loss": 0.7308565139770508, "mean_token_accuracy": 0.8201438646763564, "num_tokens": 6917348.0, "step": 3380 }, { "entropy": 0.5953182641416788, "epoch": 0.05505794076805015, "grad_norm": 6.75, "learning_rate": 4.980833512851515e-05, "loss": 0.5936457633972168, "mean_token_accuracy": 0.85238401517272, "num_tokens": 6937214.0, "step": 3390 }, { "entropy": 0.6735324635636062, "epoch": 0.05522035357267567, "grad_norm": 8.875, "learning_rate": 4.9806729283739874e-05, "loss": 0.7508646488189697, "mean_token_accuracy": 0.8197361096739769, "num_tokens": 6957456.0, "step": 3400 }, { "entropy": 0.6712119284085929, "epoch": 0.05538276637730118, "grad_norm": 10.625, "learning_rate": 4.9805116765898676e-05, "loss": 0.6719058990478516, "mean_token_accuracy": 0.8326025024056435, "num_tokens": 6977485.0, "step": 3410 }, { "entropy": 0.7157453505322338, "epoch": 0.0555451791819267, "grad_norm": 7.28125, "learning_rate": 4.980349757542532e-05, "loss": 0.6884281158447265, "mean_token_accuracy": 0.8272968545556069, "num_tokens": 6998327.0, "step": 3420 }, { "entropy": 0.6955807664431631, "epoch": 0.05570759198655222, "grad_norm": 6.65625, "learning_rate": 4.9801871712755364e-05, "loss": 0.6830050468444824, "mean_token_accuracy": 0.8290074713528156, "num_tokens": 7018742.0, "step": 3430 }, { "entropy": 0.6512462690472602, "epoch": 0.055870004791177735, "grad_norm": 5.71875, "learning_rate": 4.980023917832619e-05, "loss": 0.639318323135376, "mean_token_accuracy": 0.8357956558465958, "num_tokens": 7038824.0, "step": 3440 }, { "entropy": 0.7076734066009521, "epoch": 0.056032417595803255, "grad_norm": 10.5, "learning_rate": 4.9798599972576944e-05, "loss": 0.6960817337036133, "mean_token_accuracy": 0.8302401900291443, "num_tokens": 7059257.0, "step": 3450 }, { "entropy": 0.7038292715325951, "epoch": 0.05619483040042877, "grad_norm": 8.0, "learning_rate": 4.9796954095948564e-05, "loss": 0.6924526691436768, "mean_token_accuracy": 0.8354487463831901, "num_tokens": 7081574.0, "step": 3460 }, { "entropy": 0.6379551439546048, "epoch": 0.05635724320505429, "grad_norm": 7.0, "learning_rate": 4.979530154888381e-05, "loss": 0.6768503189086914, "mean_token_accuracy": 0.8333509303629398, "num_tokens": 7101787.0, "step": 3470 }, { "entropy": 0.589049381390214, "epoch": 0.0565196560096798, "grad_norm": 6.46875, "learning_rate": 4.9793642331827216e-05, "loss": 0.6215909957885742, "mean_token_accuracy": 0.8486528433859348, "num_tokens": 7120899.0, "step": 3480 }, { "entropy": 0.6488440335728228, "epoch": 0.05668206881430532, "grad_norm": 10.5, "learning_rate": 4.9791976445225116e-05, "loss": 0.6715599536895752, "mean_token_accuracy": 0.8359510585665703, "num_tokens": 7140551.0, "step": 3490 }, { "entropy": 0.6717993238940835, "epoch": 0.05684448161893084, "grad_norm": 8.25, "learning_rate": 4.979030388952563e-05, "loss": 0.7009417533874511, "mean_token_accuracy": 0.831206327676773, "num_tokens": 7162405.0, "step": 3500 }, { "entropy": 0.6181788121350109, "epoch": 0.05700689442355635, "grad_norm": 8.75, "learning_rate": 4.978862466517869e-05, "loss": 0.6091383934020996, "mean_token_accuracy": 0.8513526760041714, "num_tokens": 7182595.0, "step": 3510 }, { "entropy": 0.6840516184456646, "epoch": 0.05716930722818187, "grad_norm": 8.3125, "learning_rate": 4.9786938772636004e-05, "loss": 0.6596336841583252, "mean_token_accuracy": 0.8308140747249126, "num_tokens": 7205469.0, "step": 3520 }, { "entropy": 0.5835915111005306, "epoch": 0.057331720032807384, "grad_norm": 6.5625, "learning_rate": 4.9785246212351083e-05, "loss": 0.6211875915527344, "mean_token_accuracy": 0.847928524017334, "num_tokens": 7226037.0, "step": 3530 }, { "entropy": 0.6607072552666068, "epoch": 0.057494132837432904, "grad_norm": 10.25, "learning_rate": 4.978354698477923e-05, "loss": 0.6849515438079834, "mean_token_accuracy": 0.8259208116680383, "num_tokens": 7246327.0, "step": 3540 }, { "entropy": 0.6076311991550029, "epoch": 0.05765654564205842, "grad_norm": 7.8125, "learning_rate": 4.978184109037754e-05, "loss": 0.5726810932159424, "mean_token_accuracy": 0.8491845276206732, "num_tokens": 7266171.0, "step": 3550 }, { "entropy": 0.7481310613453388, "epoch": 0.057818958446683937, "grad_norm": 7.125, "learning_rate": 4.978012852960491e-05, "loss": 0.7897719860076904, "mean_token_accuracy": 0.8150894939899445, "num_tokens": 7287541.0, "step": 3560 }, { "entropy": 0.7153817551210523, "epoch": 0.057981371251309456, "grad_norm": 8.5625, "learning_rate": 4.9778409302922e-05, "loss": 0.750181007385254, "mean_token_accuracy": 0.8134925406426191, "num_tokens": 7309214.0, "step": 3570 }, { "entropy": 0.65593605004251, "epoch": 0.05814378405593497, "grad_norm": 10.9375, "learning_rate": 4.9776683410791316e-05, "loss": 0.6135035037994385, "mean_token_accuracy": 0.8380598038434982, "num_tokens": 7330411.0, "step": 3580 }, { "entropy": 0.665345411747694, "epoch": 0.05830619686056049, "grad_norm": 8.3125, "learning_rate": 4.977495085367711e-05, "loss": 0.6529447078704834, "mean_token_accuracy": 0.8338006265461445, "num_tokens": 7350502.0, "step": 3590 }, { "entropy": 0.6232823869213462, "epoch": 0.058468609665186, "grad_norm": 8.125, "learning_rate": 4.977321163204544e-05, "loss": 0.6381690025329589, "mean_token_accuracy": 0.8272351827472448, "num_tokens": 7370261.0, "step": 3600 }, { "entropy": 0.6225099029019475, "epoch": 0.05863102246981152, "grad_norm": 6.125, "learning_rate": 4.9771465746364166e-05, "loss": 0.6379477977752686, "mean_token_accuracy": 0.8398970864713192, "num_tokens": 7390120.0, "step": 3610 }, { "entropy": 0.707944474555552, "epoch": 0.058793435274437034, "grad_norm": 6.1875, "learning_rate": 4.976971319710294e-05, "loss": 0.735454511642456, "mean_token_accuracy": 0.8203855894505978, "num_tokens": 7410105.0, "step": 3620 }, { "entropy": 0.6314360270276665, "epoch": 0.05895584807906255, "grad_norm": 6.65625, "learning_rate": 4.9767953984733196e-05, "loss": 0.6023908615112304, "mean_token_accuracy": 0.8484996825456619, "num_tokens": 7429911.0, "step": 3630 }, { "entropy": 0.6067619973793625, "epoch": 0.05911826088368807, "grad_norm": 8.0625, "learning_rate": 4.976618810972817e-05, "loss": 0.6397185325622559, "mean_token_accuracy": 0.8350897818803787, "num_tokens": 7449056.0, "step": 3640 }, { "entropy": 0.7075800098478794, "epoch": 0.059280673688313586, "grad_norm": 7.03125, "learning_rate": 4.9764415572562887e-05, "loss": 0.7227832317352295, "mean_token_accuracy": 0.8289556048810482, "num_tokens": 7469969.0, "step": 3650 }, { "entropy": 0.6366183378733694, "epoch": 0.059443086492939105, "grad_norm": 8.8125, "learning_rate": 4.976263637371416e-05, "loss": 0.673203992843628, "mean_token_accuracy": 0.8265930786728859, "num_tokens": 7490360.0, "step": 3660 }, { "entropy": 0.6385518738068641, "epoch": 0.05960549929756462, "grad_norm": 7.59375, "learning_rate": 4.976085051366058e-05, "loss": 0.6257910251617431, "mean_token_accuracy": 0.8463421709835529, "num_tokens": 7512677.0, "step": 3670 }, { "entropy": 0.6634161598049104, "epoch": 0.05976791210219014, "grad_norm": 10.0625, "learning_rate": 4.9759057992882587e-05, "loss": 0.6892859458923339, "mean_token_accuracy": 0.8272095255553722, "num_tokens": 7531436.0, "step": 3680 }, { "entropy": 0.6745593910571188, "epoch": 0.05993032490681565, "grad_norm": 7.0625, "learning_rate": 4.975725881186234e-05, "loss": 0.6488647937774659, "mean_token_accuracy": 0.8441109918057919, "num_tokens": 7551673.0, "step": 3690 }, { "entropy": 0.616761663928628, "epoch": 0.06009273771144117, "grad_norm": 9.1875, "learning_rate": 4.975545297108384e-05, "loss": 0.607551097869873, "mean_token_accuracy": 0.8412525683641434, "num_tokens": 7571978.0, "step": 3700 }, { "entropy": 0.6694912530481816, "epoch": 0.06025515051606669, "grad_norm": 8.125, "learning_rate": 4.975364047103286e-05, "loss": 0.7068482875823975, "mean_token_accuracy": 0.8315350703895092, "num_tokens": 7592049.0, "step": 3710 }, { "entropy": 0.6048460864461959, "epoch": 0.0604175633206922, "grad_norm": 8.625, "learning_rate": 4.9751821312196955e-05, "loss": 0.6369690418243408, "mean_token_accuracy": 0.8351354736834764, "num_tokens": 7612880.0, "step": 3720 }, { "entropy": 0.7358152823522687, "epoch": 0.06057997612531772, "grad_norm": 7.96875, "learning_rate": 4.974999549506549e-05, "loss": 0.7889390468597413, "mean_token_accuracy": 0.8173042796552181, "num_tokens": 7633734.0, "step": 3730 }, { "entropy": 0.6880794854834675, "epoch": 0.060742388929943235, "grad_norm": 7.4375, "learning_rate": 4.974816302012962e-05, "loss": 0.684275770187378, "mean_token_accuracy": 0.8307307705283165, "num_tokens": 7656054.0, "step": 3740 }, { "entropy": 0.6932039026170969, "epoch": 0.060904801734568755, "grad_norm": 10.875, "learning_rate": 4.9746323887882275e-05, "loss": 0.6498753070831299, "mean_token_accuracy": 0.8387250781059266, "num_tokens": 7677207.0, "step": 3750 }, { "entropy": 0.6073678065091371, "epoch": 0.06106721453919427, "grad_norm": 7.0625, "learning_rate": 4.9744478098818195e-05, "loss": 0.5961812973022461, "mean_token_accuracy": 0.8385385982692242, "num_tokens": 7697083.0, "step": 3760 }, { "entropy": 0.6104508604854345, "epoch": 0.06122962734381979, "grad_norm": 5.96875, "learning_rate": 4.974262565343389e-05, "loss": 0.5813981056213379, "mean_token_accuracy": 0.8522955946624279, "num_tokens": 7718347.0, "step": 3770 }, { "entropy": 0.6045610118657351, "epoch": 0.06139204014844531, "grad_norm": 7.09375, "learning_rate": 4.974076655222769e-05, "loss": 0.6310525417327881, "mean_token_accuracy": 0.8386100128293037, "num_tokens": 7738530.0, "step": 3780 }, { "entropy": 0.5910926104523242, "epoch": 0.06155445295307082, "grad_norm": 9.0625, "learning_rate": 4.973890079569967e-05, "loss": 0.6282540321350097, "mean_token_accuracy": 0.8489861045032739, "num_tokens": 7758434.0, "step": 3790 }, { "entropy": 0.5710391078144312, "epoch": 0.06171686575769634, "grad_norm": 13.0, "learning_rate": 4.9737028384351755e-05, "loss": 0.6210896968841553, "mean_token_accuracy": 0.8436822183430195, "num_tokens": 7779365.0, "step": 3800 }, { "entropy": 0.7116972275078297, "epoch": 0.06187927856232185, "grad_norm": 8.0, "learning_rate": 4.97351493186876e-05, "loss": 0.766285514831543, "mean_token_accuracy": 0.8200442895293236, "num_tokens": 7799334.0, "step": 3810 }, { "entropy": 0.67995271733962, "epoch": 0.06204169136694737, "grad_norm": 6.3125, "learning_rate": 4.9733263599212695e-05, "loss": 0.6566415786743164, "mean_token_accuracy": 0.8402710676193237, "num_tokens": 7819052.0, "step": 3820 }, { "entropy": 0.6811694384552538, "epoch": 0.062204104171572884, "grad_norm": 6.4375, "learning_rate": 4.97313712264343e-05, "loss": 0.6304548740386963, "mean_token_accuracy": 0.8392180155962705, "num_tokens": 7839838.0, "step": 3830 }, { "entropy": 0.6380248936824501, "epoch": 0.062366516976198404, "grad_norm": 11.6875, "learning_rate": 4.972947220086146e-05, "loss": 0.6095435142517089, "mean_token_accuracy": 0.846200242638588, "num_tokens": 7859579.0, "step": 3840 }, { "entropy": 0.5935035164933652, "epoch": 0.06252892978082392, "grad_norm": 4.9375, "learning_rate": 4.972756652300502e-05, "loss": 0.5667986392974853, "mean_token_accuracy": 0.8525295637547969, "num_tokens": 7879808.0, "step": 3850 }, { "entropy": 0.6477035215124488, "epoch": 0.06269134258544944, "grad_norm": 7.5625, "learning_rate": 4.972565419337761e-05, "loss": 0.7064467430114746, "mean_token_accuracy": 0.8296240210533142, "num_tokens": 7901563.0, "step": 3860 }, { "entropy": 0.6724066206254065, "epoch": 0.06285375539007496, "grad_norm": 6.9375, "learning_rate": 4.9723735212493674e-05, "loss": 0.6806609153747558, "mean_token_accuracy": 0.833264297246933, "num_tokens": 7922549.0, "step": 3870 }, { "entropy": 0.622235485073179, "epoch": 0.06301616819470048, "grad_norm": 7.25, "learning_rate": 4.9721809580869385e-05, "loss": 0.6572322368621826, "mean_token_accuracy": 0.8402150720357895, "num_tokens": 7942661.0, "step": 3880 }, { "entropy": 0.717705905623734, "epoch": 0.06317858099932598, "grad_norm": 7.34375, "learning_rate": 4.9719877299022765e-05, "loss": 0.7567597389221191, "mean_token_accuracy": 0.8185842230916023, "num_tokens": 7963771.0, "step": 3890 }, { "entropy": 0.5887428083457052, "epoch": 0.0633409938039515, "grad_norm": 6.75, "learning_rate": 4.9717938367473593e-05, "loss": 0.5570251941680908, "mean_token_accuracy": 0.8605486780405045, "num_tokens": 7983205.0, "step": 3900 }, { "entropy": 0.54711245726794, "epoch": 0.06350340660857702, "grad_norm": 7.28125, "learning_rate": 4.971599278674346e-05, "loss": 0.564736270904541, "mean_token_accuracy": 0.8536185957491398, "num_tokens": 8003663.0, "step": 3910 }, { "entropy": 0.6282231878489256, "epoch": 0.06366581941320254, "grad_norm": 7.0625, "learning_rate": 4.971404055735571e-05, "loss": 0.672048807144165, "mean_token_accuracy": 0.8340695530176163, "num_tokens": 8024170.0, "step": 3920 }, { "entropy": 0.5719426597468555, "epoch": 0.06382823221782806, "grad_norm": 8.5, "learning_rate": 4.971208167983552e-05, "loss": 0.5595303058624268, "mean_token_accuracy": 0.8493384972214699, "num_tokens": 8045765.0, "step": 3930 }, { "entropy": 0.6285661475732922, "epoch": 0.06399064502245357, "grad_norm": 6.6875, "learning_rate": 4.971011615470981e-05, "loss": 0.6237983703613281, "mean_token_accuracy": 0.8351557396352292, "num_tokens": 8065808.0, "step": 3940 }, { "entropy": 0.556355993822217, "epoch": 0.06415305782707909, "grad_norm": 7.6875, "learning_rate": 4.9708143982507326e-05, "loss": 0.5424407958984375, "mean_token_accuracy": 0.8569916449487209, "num_tokens": 8086332.0, "step": 3950 }, { "entropy": 0.6120845274999738, "epoch": 0.0643154706317046, "grad_norm": 6.84375, "learning_rate": 4.970616516375859e-05, "loss": 0.6195963859558106, "mean_token_accuracy": 0.8409288100898266, "num_tokens": 8107618.0, "step": 3960 }, { "entropy": 0.6709695937111974, "epoch": 0.06447788343633012, "grad_norm": 8.9375, "learning_rate": 4.970417969899589e-05, "loss": 0.6882740974426269, "mean_token_accuracy": 0.8349254507571459, "num_tokens": 8127660.0, "step": 3970 }, { "entropy": 0.6144146902486682, "epoch": 0.06464029624095563, "grad_norm": 7.90625, "learning_rate": 4.9702187588753334e-05, "loss": 0.6158870697021485, "mean_token_accuracy": 0.8434836991131306, "num_tokens": 8147886.0, "step": 3980 }, { "entropy": 0.5471114906016737, "epoch": 0.06480270904558115, "grad_norm": 5.46875, "learning_rate": 4.970018883356681e-05, "loss": 0.5272904396057129, "mean_token_accuracy": 0.8653822094202042, "num_tokens": 8167565.0, "step": 3990 }, { "epoch": 0.06496512185020667, "eval_entropy": 0.6584339497089386, "eval_loss": 0.687670111656189, "eval_mean_token_accuracy": 0.8280174841880799, "eval_num_tokens": 8188940.0, "eval_runtime": 40.4592, "eval_samples_per_second": 49.432, "eval_steps_per_second": 6.179, "step": 4000 }, { "entropy": 0.59657037188299, "epoch": 0.06512753465483219, "grad_norm": 18.375, "learning_rate": 4.969617139051429e-05, "loss": 0.6662103652954101, "mean_token_accuracy": 0.8357427053153514, "num_tokens": 8208086.0, "step": 4010 }, { "entropy": 0.6556566601619125, "epoch": 0.06528994745945771, "grad_norm": 8.6875, "learning_rate": 4.9694152703729004e-05, "loss": 0.6410644054412842, "mean_token_accuracy": 0.8400427147746086, "num_tokens": 8227787.0, "step": 4020 }, { "entropy": 0.6485343052074313, "epoch": 0.06545236026408321, "grad_norm": 7.6875, "learning_rate": 4.9692127374161136e-05, "loss": 0.6166937351226807, "mean_token_accuracy": 0.8426643446087837, "num_tokens": 8248157.0, "step": 4030 }, { "entropy": 0.6764893119223416, "epoch": 0.06561477306870873, "grad_norm": 7.09375, "learning_rate": 4.969009540235551e-05, "loss": 0.6841977119445801, "mean_token_accuracy": 0.8340508855879307, "num_tokens": 8268849.0, "step": 4040 }, { "entropy": 0.6103664681315422, "epoch": 0.06577718587333425, "grad_norm": 6.90625, "learning_rate": 4.968805678885875e-05, "loss": 0.6078847885131836, "mean_token_accuracy": 0.8430127948522568, "num_tokens": 8288273.0, "step": 4050 }, { "entropy": 0.6488130383193493, "epoch": 0.06593959867795977, "grad_norm": 6.375, "learning_rate": 4.968601153421921e-05, "loss": 0.6693777561187744, "mean_token_accuracy": 0.8321704961359501, "num_tokens": 8309094.0, "step": 4060 }, { "entropy": 0.6404385806061328, "epoch": 0.0661020114825853, "grad_norm": 8.1875, "learning_rate": 4.96839596389871e-05, "loss": 0.6492941856384278, "mean_token_accuracy": 0.8379133835434913, "num_tokens": 8328906.0, "step": 4070 }, { "entropy": 0.6383732973597944, "epoch": 0.0662644242872108, "grad_norm": 7.875, "learning_rate": 4.968190110371438e-05, "loss": 0.683575439453125, "mean_token_accuracy": 0.8337679870426655, "num_tokens": 8350405.0, "step": 4080 }, { "entropy": 0.7279273853637278, "epoch": 0.06642683709183632, "grad_norm": 6.1875, "learning_rate": 4.967983592895478e-05, "loss": 0.7294415473937989, "mean_token_accuracy": 0.8200351405888796, "num_tokens": 8371903.0, "step": 4090 }, { "entropy": 0.6089258077554405, "epoch": 0.06658924989646184, "grad_norm": 8.4375, "learning_rate": 4.967776411526386e-05, "loss": 0.6082272529602051, "mean_token_accuracy": 0.8504539206624031, "num_tokens": 8392929.0, "step": 4100 }, { "entropy": 0.6479860631749034, "epoch": 0.06675166270108736, "grad_norm": 7.53125, "learning_rate": 4.967568566319893e-05, "loss": 0.6464333534240723, "mean_token_accuracy": 0.8407898757606744, "num_tokens": 8413921.0, "step": 4110 }, { "entropy": 0.6782472599297762, "epoch": 0.06691407550571286, "grad_norm": 8.375, "learning_rate": 4.96736005733191e-05, "loss": 0.7056226253509521, "mean_token_accuracy": 0.8367070361971856, "num_tokens": 8433785.0, "step": 4120 }, { "entropy": 0.6130849519744516, "epoch": 0.06707648831033838, "grad_norm": 6.9375, "learning_rate": 4.9671508846185266e-05, "loss": 0.6041444778442383, "mean_token_accuracy": 0.8490801520645619, "num_tokens": 8453684.0, "step": 4130 }, { "entropy": 0.6525204100646078, "epoch": 0.0672389011149639, "grad_norm": 8.6875, "learning_rate": 4.966941048236011e-05, "loss": 0.6274653434753418, "mean_token_accuracy": 0.844075383245945, "num_tokens": 8473500.0, "step": 4140 }, { "entropy": 0.6187574036419392, "epoch": 0.06740131391958942, "grad_norm": 5.75, "learning_rate": 4.966730548240809e-05, "loss": 0.6418675422668457, "mean_token_accuracy": 0.8527890175580979, "num_tokens": 8492844.0, "step": 4150 }, { "entropy": 0.5923375618644059, "epoch": 0.06756372672421494, "grad_norm": 5.90625, "learning_rate": 4.9665193846895465e-05, "loss": 0.6104167938232422, "mean_token_accuracy": 0.845196595042944, "num_tokens": 8514070.0, "step": 4160 }, { "entropy": 0.5581407878547907, "epoch": 0.06772613952884045, "grad_norm": 7.8125, "learning_rate": 4.9663075576390254e-05, "loss": 0.5616621017456055, "mean_token_accuracy": 0.8598431661725044, "num_tokens": 8533457.0, "step": 4170 }, { "entropy": 0.5695889973081648, "epoch": 0.06788855233346597, "grad_norm": 8.75, "learning_rate": 4.966095067146229e-05, "loss": 0.588599157333374, "mean_token_accuracy": 0.846741109341383, "num_tokens": 8553780.0, "step": 4180 }, { "entropy": 0.7367532709613442, "epoch": 0.06805096513809149, "grad_norm": 7.40625, "learning_rate": 4.9658819132683176e-05, "loss": 0.8038776397705079, "mean_token_accuracy": 0.8104439463466406, "num_tokens": 8573445.0, "step": 4190 }, { "entropy": 0.6487067444249988, "epoch": 0.06821337794271701, "grad_norm": 10.375, "learning_rate": 4.965668096062629e-05, "loss": 0.6201260566711426, "mean_token_accuracy": 0.8406964227557182, "num_tokens": 8593615.0, "step": 4200 }, { "entropy": 0.7759757129475474, "epoch": 0.06837579074734253, "grad_norm": 6.71875, "learning_rate": 4.9654536155866824e-05, "loss": 0.749416732788086, "mean_token_accuracy": 0.8167964987456798, "num_tokens": 8617507.0, "step": 4210 }, { "entropy": 0.6116909880191088, "epoch": 0.06853820355196803, "grad_norm": 8.5625, "learning_rate": 4.965238471898172e-05, "loss": 0.6042019367218018, "mean_token_accuracy": 0.8502664744853974, "num_tokens": 8637588.0, "step": 4220 }, { "entropy": 0.6624170936644077, "epoch": 0.06870061635659355, "grad_norm": 10.3125, "learning_rate": 4.965022665054972e-05, "loss": 0.7312849521636963, "mean_token_accuracy": 0.8316965609788894, "num_tokens": 8657565.0, "step": 4230 }, { "entropy": 0.5678249921649694, "epoch": 0.06886302916121907, "grad_norm": 8.5, "learning_rate": 4.964806195115136e-05, "loss": 0.5588680744171143, "mean_token_accuracy": 0.8551277458667755, "num_tokens": 8677706.0, "step": 4240 }, { "entropy": 0.6550601082853973, "epoch": 0.06902544196584459, "grad_norm": 6.6875, "learning_rate": 4.964589062136894e-05, "loss": 0.6155716896057128, "mean_token_accuracy": 0.8475619602948428, "num_tokens": 8698804.0, "step": 4250 }, { "entropy": 0.6035366371273995, "epoch": 0.0691878547704701, "grad_norm": 9.6875, "learning_rate": 4.964371266178656e-05, "loss": 0.6050459384918213, "mean_token_accuracy": 0.8467766128480434, "num_tokens": 8719528.0, "step": 4260 }, { "entropy": 0.6342330690473318, "epoch": 0.06935026757509562, "grad_norm": 10.0625, "learning_rate": 4.964152807299008e-05, "loss": 0.6773311614990234, "mean_token_accuracy": 0.8325214240700006, "num_tokens": 8740859.0, "step": 4270 }, { "entropy": 0.6128977849148214, "epoch": 0.06951268037972114, "grad_norm": 7.71875, "learning_rate": 4.963933685556717e-05, "loss": 0.6456241607666016, "mean_token_accuracy": 0.8447628572583199, "num_tokens": 8761760.0, "step": 4280 }, { "entropy": 0.5949186106212437, "epoch": 0.06967509318434666, "grad_norm": 6.3125, "learning_rate": 4.963713901010728e-05, "loss": 0.5786555767059326, "mean_token_accuracy": 0.8502746544778347, "num_tokens": 8782382.0, "step": 4290 }, { "entropy": 0.7527461871504784, "epoch": 0.06983750598897218, "grad_norm": 6.28125, "learning_rate": 4.963493453720162e-05, "loss": 0.7537468910217285, "mean_token_accuracy": 0.8092567604035139, "num_tokens": 8802014.0, "step": 4300 }, { "entropy": 0.6926262227818369, "epoch": 0.06999991879359768, "grad_norm": 9.3125, "learning_rate": 4.963272343744321e-05, "loss": 0.7002501964569092, "mean_token_accuracy": 0.8282694987952709, "num_tokens": 8823176.0, "step": 4310 }, { "entropy": 0.6235510830767452, "epoch": 0.0701623315982232, "grad_norm": 7.46875, "learning_rate": 4.963050571142684e-05, "loss": 0.6615278720855713, "mean_token_accuracy": 0.8476155772805214, "num_tokens": 8843165.0, "step": 4320 }, { "entropy": 0.7028528685681522, "epoch": 0.07032474440284872, "grad_norm": 8.125, "learning_rate": 4.962828135974907e-05, "loss": 0.694635534286499, "mean_token_accuracy": 0.8282914761453867, "num_tokens": 8862884.0, "step": 4330 }, { "entropy": 0.6162197687663138, "epoch": 0.07048715720747424, "grad_norm": 6.8125, "learning_rate": 4.962605038300828e-05, "loss": 0.6006672382354736, "mean_token_accuracy": 0.8466765988618136, "num_tokens": 8883222.0, "step": 4340 }, { "entropy": 0.6671367372386158, "epoch": 0.07064957001209976, "grad_norm": 8.0625, "learning_rate": 4.9623812781804584e-05, "loss": 0.6649251461029053, "mean_token_accuracy": 0.831134419888258, "num_tokens": 8905739.0, "step": 4350 }, { "entropy": 0.6145354522392154, "epoch": 0.07081198281672527, "grad_norm": 7.1875, "learning_rate": 4.9621568556739915e-05, "loss": 0.6461136817932129, "mean_token_accuracy": 0.8431534878909588, "num_tokens": 8925618.0, "step": 4360 }, { "entropy": 0.6345865175127983, "epoch": 0.07097439562135079, "grad_norm": 10.625, "learning_rate": 4.9619317708417965e-05, "loss": 0.6354070663452148, "mean_token_accuracy": 0.8425127878785134, "num_tokens": 8946401.0, "step": 4370 }, { "entropy": 0.6136418614536524, "epoch": 0.0711368084259763, "grad_norm": 7.53125, "learning_rate": 4.9617060237444227e-05, "loss": 0.6376131534576416, "mean_token_accuracy": 0.8425911530852318, "num_tokens": 8966725.0, "step": 4380 }, { "entropy": 0.6740480018779635, "epoch": 0.07129922123060183, "grad_norm": 8.1875, "learning_rate": 4.961479614442597e-05, "loss": 0.675442123413086, "mean_token_accuracy": 0.8270412348210812, "num_tokens": 8988854.0, "step": 4390 }, { "entropy": 0.6035504080355167, "epoch": 0.07146163403522733, "grad_norm": 10.5625, "learning_rate": 4.9612525429972215e-05, "loss": 0.6455621242523193, "mean_token_accuracy": 0.8451152667403221, "num_tokens": 9009574.0, "step": 4400 }, { "entropy": 0.594661158695817, "epoch": 0.07162404683985285, "grad_norm": 8.625, "learning_rate": 4.961024809469382e-05, "loss": 0.6251354694366456, "mean_token_accuracy": 0.8522915355861187, "num_tokens": 9028996.0, "step": 4410 }, { "entropy": 0.6308258430100977, "epoch": 0.07178645964447837, "grad_norm": 8.3125, "learning_rate": 4.960796413920337e-05, "loss": 0.6239512920379638, "mean_token_accuracy": 0.8413037165999413, "num_tokens": 9048121.0, "step": 4420 }, { "entropy": 0.6547151442617178, "epoch": 0.07194887244910389, "grad_norm": 9.375, "learning_rate": 4.9605673564115274e-05, "loss": 0.6519896507263183, "mean_token_accuracy": 0.8345177296549082, "num_tokens": 9068131.0, "step": 4430 }, { "entropy": 0.6199771880172193, "epoch": 0.07211128525372941, "grad_norm": 5.3125, "learning_rate": 4.9603376370045684e-05, "loss": 0.6159055233001709, "mean_token_accuracy": 0.8393093034625053, "num_tokens": 9088272.0, "step": 4440 }, { "entropy": 0.6139411455951631, "epoch": 0.07227369805835492, "grad_norm": 7.875, "learning_rate": 4.960107255761256e-05, "loss": 0.602547025680542, "mean_token_accuracy": 0.8453815996646881, "num_tokens": 9108377.0, "step": 4450 }, { "entropy": 0.7398131346330047, "epoch": 0.07243611086298044, "grad_norm": 9.8125, "learning_rate": 4.9598762127435625e-05, "loss": 0.7744777202606201, "mean_token_accuracy": 0.8173283323645592, "num_tokens": 9128649.0, "step": 4460 }, { "entropy": 0.6618171680718661, "epoch": 0.07259852366760595, "grad_norm": 9.5, "learning_rate": 4.95964450801364e-05, "loss": 0.6518251419067382, "mean_token_accuracy": 0.8385445035994052, "num_tokens": 9150860.0, "step": 4470 }, { "entropy": 0.6526267222128809, "epoch": 0.07276093647223147, "grad_norm": 8.3125, "learning_rate": 4.959412141633817e-05, "loss": 0.6878862380981445, "mean_token_accuracy": 0.8334402985870838, "num_tokens": 9172263.0, "step": 4480 }, { "entropy": 0.6544343112036586, "epoch": 0.072923349276857, "grad_norm": 8.4375, "learning_rate": 4.959179113666601e-05, "loss": 0.6764401435852051, "mean_token_accuracy": 0.8297100096940995, "num_tokens": 9192713.0, "step": 4490 }, { "entropy": 0.6737438500858843, "epoch": 0.0730857620814825, "grad_norm": 6.09375, "learning_rate": 4.958945424174677e-05, "loss": 0.6143169403076172, "mean_token_accuracy": 0.8463603287935257, "num_tokens": 9212843.0, "step": 4500 }, { "entropy": 0.608481558971107, "epoch": 0.07324817488610802, "grad_norm": 7.59375, "learning_rate": 4.958711073220907e-05, "loss": 0.6361787796020508, "mean_token_accuracy": 0.8443557702004909, "num_tokens": 9233124.0, "step": 4510 }, { "entropy": 0.5904541192110628, "epoch": 0.07341058769073354, "grad_norm": 8.125, "learning_rate": 4.9584760608683335e-05, "loss": 0.6713534832000733, "mean_token_accuracy": 0.8394067980349064, "num_tokens": 9253776.0, "step": 4520 }, { "entropy": 0.7111636479385197, "epoch": 0.07357300049535906, "grad_norm": 7.625, "learning_rate": 4.958240387180174e-05, "loss": 0.7027684688568115, "mean_token_accuracy": 0.8293249811977148, "num_tokens": 9274460.0, "step": 4530 }, { "entropy": 0.653181302268058, "epoch": 0.07373541329998456, "grad_norm": 7.6875, "learning_rate": 4.958004052219826e-05, "loss": 0.6477846622467041, "mean_token_accuracy": 0.8470566391944885, "num_tokens": 9294755.0, "step": 4540 }, { "entropy": 0.6654880329966545, "epoch": 0.07389782610461008, "grad_norm": 5.21875, "learning_rate": 4.957767056050864e-05, "loss": 0.6708653450012207, "mean_token_accuracy": 0.8277440384030342, "num_tokens": 9315338.0, "step": 4550 }, { "entropy": 0.5965668763965368, "epoch": 0.0740602389092356, "grad_norm": 6.125, "learning_rate": 4.9575293987370396e-05, "loss": 0.5827322006225586, "mean_token_accuracy": 0.851749524474144, "num_tokens": 9335605.0, "step": 4560 }, { "entropy": 0.5778095096349716, "epoch": 0.07422265171386112, "grad_norm": 6.46875, "learning_rate": 4.957291080342285e-05, "loss": 0.598599910736084, "mean_token_accuracy": 0.8527276519685983, "num_tokens": 9356232.0, "step": 4570 }, { "entropy": 0.6098885674029588, "epoch": 0.07438506451848664, "grad_norm": 6.875, "learning_rate": 4.957052100930707e-05, "loss": 0.6338545799255371, "mean_token_accuracy": 0.8488633498549462, "num_tokens": 9375932.0, "step": 4580 }, { "entropy": 0.6734701137989759, "epoch": 0.07454747732311215, "grad_norm": 7.1875, "learning_rate": 4.9568124605665925e-05, "loss": 0.6525713920593261, "mean_token_accuracy": 0.8386058017611504, "num_tokens": 9396996.0, "step": 4590 }, { "entropy": 0.5879238824360072, "epoch": 0.07470989012773767, "grad_norm": 7.40625, "learning_rate": 4.956572159314404e-05, "loss": 0.6008066177368164, "mean_token_accuracy": 0.8475782603025437, "num_tokens": 9416377.0, "step": 4600 }, { "entropy": 0.608251191303134, "epoch": 0.07487230293236319, "grad_norm": 11.4375, "learning_rate": 4.956331197238784e-05, "loss": 0.661914587020874, "mean_token_accuracy": 0.8446639597415924, "num_tokens": 9435692.0, "step": 4610 }, { "entropy": 0.7311778465285897, "epoch": 0.07503471573698871, "grad_norm": 8.125, "learning_rate": 4.956089574404551e-05, "loss": 0.7442729473114014, "mean_token_accuracy": 0.8161278996616602, "num_tokens": 9457501.0, "step": 4620 }, { "entropy": 0.5746764669194817, "epoch": 0.07519712854161423, "grad_norm": 5.5625, "learning_rate": 4.955847290876704e-05, "loss": 0.5439295291900634, "mean_token_accuracy": 0.8540162913501262, "num_tokens": 9477210.0, "step": 4630 }, { "entropy": 0.6886419186368584, "epoch": 0.07535954134623973, "grad_norm": 6.84375, "learning_rate": 4.955604346720416e-05, "loss": 0.7328068256378174, "mean_token_accuracy": 0.8253999069333077, "num_tokens": 9497196.0, "step": 4640 }, { "entropy": 0.5974585706368089, "epoch": 0.07552195415086525, "grad_norm": 7.3125, "learning_rate": 4.9553607420010406e-05, "loss": 0.6019351482391357, "mean_token_accuracy": 0.8427147604525089, "num_tokens": 9518102.0, "step": 4650 }, { "entropy": 0.6890899701043963, "epoch": 0.07568436695549077, "grad_norm": 8.5625, "learning_rate": 4.9551164767841075e-05, "loss": 0.6990561485290527, "mean_token_accuracy": 0.8328306473791599, "num_tokens": 9537523.0, "step": 4660 }, { "entropy": 0.6631820605136454, "epoch": 0.07584677976011629, "grad_norm": 8.3125, "learning_rate": 4.954871551135324e-05, "loss": 0.625786542892456, "mean_token_accuracy": 0.841561759263277, "num_tokens": 9557823.0, "step": 4670 }, { "entropy": 0.6061957945115864, "epoch": 0.0760091925647418, "grad_norm": 7.5, "learning_rate": 4.9546259651205765e-05, "loss": 0.617872953414917, "mean_token_accuracy": 0.8374070636928082, "num_tokens": 9577709.0, "step": 4680 }, { "entropy": 0.6638525852933526, "epoch": 0.07617160536936732, "grad_norm": 7.5625, "learning_rate": 4.954379718805928e-05, "loss": 0.6399277210235595, "mean_token_accuracy": 0.8351655241101981, "num_tokens": 9598351.0, "step": 4690 }, { "entropy": 0.6586564770899713, "epoch": 0.07633401817399284, "grad_norm": 7.46875, "learning_rate": 4.9541328122576194e-05, "loss": 0.6815990924835205, "mean_token_accuracy": 0.8324289739131927, "num_tokens": 9619117.0, "step": 4700 }, { "entropy": 0.625049875676632, "epoch": 0.07649643097861836, "grad_norm": 6.75, "learning_rate": 4.953885245542069e-05, "loss": 0.6064480304718017, "mean_token_accuracy": 0.8460681267082691, "num_tokens": 9639292.0, "step": 4710 }, { "entropy": 0.6891991007141769, "epoch": 0.07665884378324388, "grad_norm": 7.96875, "learning_rate": 4.953637018725873e-05, "loss": 0.7469194889068603, "mean_token_accuracy": 0.8167282767593861, "num_tokens": 9659694.0, "step": 4720 }, { "entropy": 0.644246906042099, "epoch": 0.07682125658786938, "grad_norm": 7.15625, "learning_rate": 4.953388131875804e-05, "loss": 0.6113909244537353, "mean_token_accuracy": 0.8501339592039585, "num_tokens": 9680290.0, "step": 4730 }, { "entropy": 0.6095455882139504, "epoch": 0.0769836693924949, "grad_norm": 9.5625, "learning_rate": 4.953138585058814e-05, "loss": 0.6163639068603516, "mean_token_accuracy": 0.8464456975460053, "num_tokens": 9699993.0, "step": 4740 }, { "entropy": 0.5748913143761456, "epoch": 0.07714608219712042, "grad_norm": 8.5, "learning_rate": 4.952888378342032e-05, "loss": 0.5689167499542236, "mean_token_accuracy": 0.8654819943010807, "num_tokens": 9719782.0, "step": 4750 }, { "entropy": 0.6310321614146233, "epoch": 0.07730849500174594, "grad_norm": 12.5, "learning_rate": 4.952637511792764e-05, "loss": 0.6626490116119385, "mean_token_accuracy": 0.8381782792508602, "num_tokens": 9741155.0, "step": 4760 }, { "entropy": 0.6368576645851135, "epoch": 0.07747090780637146, "grad_norm": 9.8125, "learning_rate": 4.952385985478493e-05, "loss": 0.6029601097106934, "mean_token_accuracy": 0.8416288785636425, "num_tokens": 9761043.0, "step": 4770 }, { "entropy": 0.6221295884344726, "epoch": 0.07763332061099697, "grad_norm": 8.6875, "learning_rate": 4.95213379946688e-05, "loss": 0.6285975456237793, "mean_token_accuracy": 0.8402429152280092, "num_tokens": 9781303.0, "step": 4780 }, { "entropy": 0.5921527820639312, "epoch": 0.07779573341562249, "grad_norm": 10.5625, "learning_rate": 4.9518809538257646e-05, "loss": 0.659816837310791, "mean_token_accuracy": 0.8424258559942246, "num_tokens": 9801989.0, "step": 4790 }, { "entropy": 0.589257238060236, "epoch": 0.077958146220248, "grad_norm": 7.46875, "learning_rate": 4.951627448623162e-05, "loss": 0.6013991832733154, "mean_token_accuracy": 0.8496914029121398, "num_tokens": 9822856.0, "step": 4800 }, { "entropy": 0.6988964445888997, "epoch": 0.07812055902487353, "grad_norm": 6.96875, "learning_rate": 4.951373283927266e-05, "loss": 0.7083846092224121, "mean_token_accuracy": 0.8164467625319958, "num_tokens": 9843361.0, "step": 4810 }, { "entropy": 0.6911227965727449, "epoch": 0.07828297182949903, "grad_norm": 8.6875, "learning_rate": 4.951118459806449e-05, "loss": 0.7014126777648926, "mean_token_accuracy": 0.8366714313626289, "num_tokens": 9863157.0, "step": 4820 }, { "entropy": 0.6688828192185611, "epoch": 0.07844538463412455, "grad_norm": 6.03125, "learning_rate": 4.9508629763292554e-05, "loss": 0.6663030624389649, "mean_token_accuracy": 0.825884073972702, "num_tokens": 9883876.0, "step": 4830 }, { "entropy": 0.7494215987622738, "epoch": 0.07860779743875007, "grad_norm": 5.84375, "learning_rate": 4.9506068335644154e-05, "loss": 0.7448901653289794, "mean_token_accuracy": 0.8165868297219276, "num_tokens": 9903546.0, "step": 4840 }, { "entropy": 0.6206991045735777, "epoch": 0.07877021024337559, "grad_norm": 7.71875, "learning_rate": 4.9503500315808284e-05, "loss": 0.632866621017456, "mean_token_accuracy": 0.8432051688432693, "num_tokens": 9923466.0, "step": 4850 }, { "entropy": 0.596147621795535, "epoch": 0.07893262304800111, "grad_norm": 7.78125, "learning_rate": 4.9500925704475765e-05, "loss": 0.5856470108032227, "mean_token_accuracy": 0.848544605076313, "num_tokens": 9946533.0, "step": 4860 }, { "entropy": 0.6550322595983744, "epoch": 0.07909503585262662, "grad_norm": 5.65625, "learning_rate": 4.9498344502339165e-05, "loss": 0.6990450382232666, "mean_token_accuracy": 0.8321107421070337, "num_tokens": 9966961.0, "step": 4870 }, { "entropy": 0.6440950100310147, "epoch": 0.07925744865725214, "grad_norm": 7.53125, "learning_rate": 4.949575671009285e-05, "loss": 0.679059362411499, "mean_token_accuracy": 0.8301635667681694, "num_tokens": 9986555.0, "step": 4880 }, { "entropy": 0.6795095540583134, "epoch": 0.07941986146187766, "grad_norm": 7.125, "learning_rate": 4.949316232843292e-05, "loss": 0.6497490406036377, "mean_token_accuracy": 0.8340746454894543, "num_tokens": 10007179.0, "step": 4890 }, { "entropy": 0.614184751920402, "epoch": 0.07958227426650318, "grad_norm": 8.125, "learning_rate": 4.9490561358057276e-05, "loss": 0.6331201553344726, "mean_token_accuracy": 0.8490272544324398, "num_tokens": 10027530.0, "step": 4900 }, { "entropy": 0.6610461741220206, "epoch": 0.07974468707112868, "grad_norm": 9.9375, "learning_rate": 4.948795379966559e-05, "loss": 0.6990130424499512, "mean_token_accuracy": 0.8327658340334892, "num_tokens": 10046684.0, "step": 4910 }, { "entropy": 0.5885923689231276, "epoch": 0.0799070998757542, "grad_norm": 7.5625, "learning_rate": 4.9485339653959294e-05, "loss": 0.557637071609497, "mean_token_accuracy": 0.8561469249427318, "num_tokens": 10067042.0, "step": 4920 }, { "entropy": 0.6668364732526243, "epoch": 0.08006951268037972, "grad_norm": 8.8125, "learning_rate": 4.948271892164161e-05, "loss": 0.7047749519348144, "mean_token_accuracy": 0.8359684132039547, "num_tokens": 10088330.0, "step": 4930 }, { "entropy": 0.658598153758794, "epoch": 0.08023192548500524, "grad_norm": 7.34375, "learning_rate": 4.948009160341752e-05, "loss": 0.6554466724395752, "mean_token_accuracy": 0.8344687484204769, "num_tokens": 10107684.0, "step": 4940 }, { "entropy": 0.6474485736340284, "epoch": 0.08039433828963076, "grad_norm": 8.75, "learning_rate": 4.9477457699993765e-05, "loss": 0.6534360408782959, "mean_token_accuracy": 0.8392691500484943, "num_tokens": 10128773.0, "step": 4950 }, { "entropy": 0.6443928050808608, "epoch": 0.08055675109425627, "grad_norm": 7.34375, "learning_rate": 4.9474817212078885e-05, "loss": 0.6535509109497071, "mean_token_accuracy": 0.8415901988744736, "num_tokens": 10149077.0, "step": 4960 }, { "entropy": 0.6375644318759441, "epoch": 0.08071916389888179, "grad_norm": 9.375, "learning_rate": 4.947217014038316e-05, "loss": 0.6529776573181152, "mean_token_accuracy": 0.8371326476335526, "num_tokens": 10168255.0, "step": 4970 }, { "entropy": 0.5736218354664743, "epoch": 0.0808815767035073, "grad_norm": 6.1875, "learning_rate": 4.9469516485618675e-05, "loss": 0.5750738143920898, "mean_token_accuracy": 0.8604113213717938, "num_tokens": 10188814.0, "step": 4980 }, { "entropy": 0.6259093351662159, "epoch": 0.08104398950813282, "grad_norm": 8.875, "learning_rate": 4.946685624849927e-05, "loss": 0.6583810806274414, "mean_token_accuracy": 0.8400992691516876, "num_tokens": 10208281.0, "step": 4990 }, { "entropy": 0.5598170708399266, "epoch": 0.08120640231275834, "grad_norm": 5.84375, "learning_rate": 4.946418942974054e-05, "loss": 0.5375143527984619, "mean_token_accuracy": 0.8721061527729035, "num_tokens": 10227802.0, "step": 5000 }, { "entropy": 0.6057121331803501, "epoch": 0.08136881511738385, "grad_norm": 7.96875, "learning_rate": 4.9461516030059876e-05, "loss": 0.6155375480651856, "mean_token_accuracy": 0.8383884519338608, "num_tokens": 10249326.0, "step": 5010 }, { "entropy": 0.5951614056713879, "epoch": 0.08153122792200937, "grad_norm": 7.875, "learning_rate": 4.945883605017643e-05, "loss": 0.5660048961639405, "mean_token_accuracy": 0.8564432084560394, "num_tokens": 10269990.0, "step": 5020 }, { "entropy": 0.650169312208891, "epoch": 0.08169364072663489, "grad_norm": 5.0, "learning_rate": 4.945614949081112e-05, "loss": 0.6910473823547363, "mean_token_accuracy": 0.830925741046667, "num_tokens": 10291079.0, "step": 5030 }, { "entropy": 0.5980288774706424, "epoch": 0.08185605353126041, "grad_norm": 9.75, "learning_rate": 4.9453456352686626e-05, "loss": 0.6289026737213135, "mean_token_accuracy": 0.8433196566998958, "num_tokens": 10311387.0, "step": 5040 }, { "entropy": 0.6629435306414961, "epoch": 0.08201846633588591, "grad_norm": 5.625, "learning_rate": 4.945075663652742e-05, "loss": 0.6363174438476562, "mean_token_accuracy": 0.8429024174809456, "num_tokens": 10332262.0, "step": 5050 }, { "entropy": 0.6410766674671322, "epoch": 0.08218087914051143, "grad_norm": 11.0625, "learning_rate": 4.9448050343059736e-05, "loss": 0.6726670742034913, "mean_token_accuracy": 0.8403808742761611, "num_tokens": 10352804.0, "step": 5060 }, { "entropy": 0.6930725152604282, "epoch": 0.08234329194513695, "grad_norm": 8.875, "learning_rate": 4.9445337473011563e-05, "loss": 0.7510185718536377, "mean_token_accuracy": 0.8295759953558445, "num_tokens": 10373034.0, "step": 5070 }, { "entropy": 0.5894734486937523, "epoch": 0.08250570474976247, "grad_norm": 6.53125, "learning_rate": 4.9442618027112667e-05, "loss": 0.5793861865997314, "mean_token_accuracy": 0.8555416770279407, "num_tokens": 10394727.0, "step": 5080 }, { "entropy": 0.7120319345965982, "epoch": 0.082668117554388, "grad_norm": 7.03125, "learning_rate": 4.94398920060946e-05, "loss": 0.7151927471160888, "mean_token_accuracy": 0.8383033473044634, "num_tokens": 10415359.0, "step": 5090 }, { "entropy": 0.6719475731253624, "epoch": 0.0828305303590135, "grad_norm": 7.9375, "learning_rate": 4.943715941069065e-05, "loss": 0.6789883136749267, "mean_token_accuracy": 0.8341887325048447, "num_tokens": 10434865.0, "step": 5100 }, { "entropy": 0.5589958894997835, "epoch": 0.08299294316363902, "grad_norm": 8.75, "learning_rate": 4.9434420241635905e-05, "loss": 0.5733313083648681, "mean_token_accuracy": 0.8563144087791443, "num_tokens": 10455073.0, "step": 5110 }, { "entropy": 0.6855927634984255, "epoch": 0.08315535596826454, "grad_norm": 7.21875, "learning_rate": 4.9431674499667194e-05, "loss": 0.6664769172668457, "mean_token_accuracy": 0.8326185751706362, "num_tokens": 10477025.0, "step": 5120 }, { "entropy": 0.5816048513166606, "epoch": 0.08331776877289006, "grad_norm": 7.5, "learning_rate": 4.9428922185523143e-05, "loss": 0.5941498279571533, "mean_token_accuracy": 0.8555799119174481, "num_tokens": 10496949.0, "step": 5130 }, { "entropy": 0.6426875446923077, "epoch": 0.08348018157751558, "grad_norm": 6.5625, "learning_rate": 4.9426163299944114e-05, "loss": 0.6639914989471436, "mean_token_accuracy": 0.8337427839636803, "num_tokens": 10516984.0, "step": 5140 }, { "entropy": 0.5499494080431759, "epoch": 0.08364259438214108, "grad_norm": 7.1875, "learning_rate": 4.9423397843672277e-05, "loss": 0.553646469116211, "mean_token_accuracy": 0.8541104160249233, "num_tokens": 10536896.0, "step": 5150 }, { "entropy": 0.6421358630061149, "epoch": 0.0838050071867666, "grad_norm": 4.78125, "learning_rate": 4.942062581745153e-05, "loss": 0.6216344833374023, "mean_token_accuracy": 0.8433695696294308, "num_tokens": 10559031.0, "step": 5160 }, { "entropy": 0.6411819517612457, "epoch": 0.08396741999139212, "grad_norm": 11.1875, "learning_rate": 4.9417847222027544e-05, "loss": 0.6660083770751953, "mean_token_accuracy": 0.8391093079000711, "num_tokens": 10579138.0, "step": 5170 }, { "entropy": 0.5786192860454321, "epoch": 0.08412983279601764, "grad_norm": 8.0625, "learning_rate": 4.9415062058147785e-05, "loss": 0.5851787090301513, "mean_token_accuracy": 0.8527331590652466, "num_tokens": 10599403.0, "step": 5180 }, { "entropy": 0.5920738274231553, "epoch": 0.08429224560064315, "grad_norm": 6.625, "learning_rate": 4.941227032656147e-05, "loss": 0.6059837341308594, "mean_token_accuracy": 0.8455815583467483, "num_tokens": 10618721.0, "step": 5190 }, { "entropy": 0.6267990993335844, "epoch": 0.08445465840526867, "grad_norm": 6.46875, "learning_rate": 4.9409472028019564e-05, "loss": 0.6119988441467286, "mean_token_accuracy": 0.847959142178297, "num_tokens": 10639705.0, "step": 5200 }, { "entropy": 0.5783751524984837, "epoch": 0.08461707120989419, "grad_norm": 5.9375, "learning_rate": 4.9406667163274835e-05, "loss": 0.5898916244506835, "mean_token_accuracy": 0.8498507089912891, "num_tokens": 10660051.0, "step": 5210 }, { "entropy": 0.6499343666248023, "epoch": 0.08477948401451971, "grad_norm": 6.46875, "learning_rate": 4.940385573308178e-05, "loss": 0.6796340942382812, "mean_token_accuracy": 0.8294782746583224, "num_tokens": 10680245.0, "step": 5220 }, { "entropy": 0.6164681887254119, "epoch": 0.08494189681914523, "grad_norm": 4.875, "learning_rate": 4.94010377381967e-05, "loss": 0.6364531993865967, "mean_token_accuracy": 0.8416301932185888, "num_tokens": 10699589.0, "step": 5230 }, { "entropy": 0.5570803395938129, "epoch": 0.08510430962377073, "grad_norm": 7.875, "learning_rate": 4.939821317937762e-05, "loss": 0.5307340145111084, "mean_token_accuracy": 0.8631787493824958, "num_tokens": 10719661.0, "step": 5240 }, { "entropy": 0.6254891388118267, "epoch": 0.08526672242839625, "grad_norm": 8.8125, "learning_rate": 4.9395382057384363e-05, "loss": 0.659565544128418, "mean_token_accuracy": 0.8414617232978344, "num_tokens": 10739598.0, "step": 5250 }, { "entropy": 0.6107869914732873, "epoch": 0.08542913523302177, "grad_norm": 7.21875, "learning_rate": 4.939254437297851e-05, "loss": 0.6181818962097168, "mean_token_accuracy": 0.8477704729884863, "num_tokens": 10760220.0, "step": 5260 }, { "entropy": 0.6104566549183801, "epoch": 0.08559154803764729, "grad_norm": 9.6875, "learning_rate": 4.938970012692341e-05, "loss": 0.6153532981872558, "mean_token_accuracy": 0.8421719916164875, "num_tokens": 10780130.0, "step": 5270 }, { "entropy": 0.6349617819301784, "epoch": 0.08575396084227281, "grad_norm": 6.53125, "learning_rate": 4.938684931998415e-05, "loss": 0.6742961406707764, "mean_token_accuracy": 0.839853010326624, "num_tokens": 10800374.0, "step": 5280 }, { "entropy": 0.6702006112784147, "epoch": 0.08591637364689832, "grad_norm": 7.53125, "learning_rate": 4.938399195292762e-05, "loss": 0.6885315418243408, "mean_token_accuracy": 0.8360910423099994, "num_tokens": 10820651.0, "step": 5290 }, { "entropy": 0.6499825142323971, "epoch": 0.08607878645152384, "grad_norm": 7.6875, "learning_rate": 4.938112802652246e-05, "loss": 0.6884824752807617, "mean_token_accuracy": 0.833566851168871, "num_tokens": 10840416.0, "step": 5300 }, { "entropy": 0.7190689125098289, "epoch": 0.08624119925614936, "grad_norm": 9.3125, "learning_rate": 4.9378257541539067e-05, "loss": 0.6715456962585449, "mean_token_accuracy": 0.8415072001516819, "num_tokens": 10860558.0, "step": 5310 }, { "entropy": 0.6251872099936009, "epoch": 0.08640361206077488, "grad_norm": 7.40625, "learning_rate": 4.937538049874961e-05, "loss": 0.6179144859313965, "mean_token_accuracy": 0.8462849885225296, "num_tokens": 10880340.0, "step": 5320 }, { "entropy": 0.6427540705539286, "epoch": 0.08656602486540038, "grad_norm": 6.84375, "learning_rate": 4.937249689892801e-05, "loss": 0.6948603630065918, "mean_token_accuracy": 0.8310207940638066, "num_tokens": 10899272.0, "step": 5330 }, { "entropy": 0.6112544117495418, "epoch": 0.0867284376700259, "grad_norm": 7.4375, "learning_rate": 4.936960674284998e-05, "loss": 0.604194164276123, "mean_token_accuracy": 0.847838393971324, "num_tokens": 10919262.0, "step": 5340 }, { "entropy": 0.6243371238466352, "epoch": 0.08689085047465142, "grad_norm": 6.65625, "learning_rate": 4.9366710031292965e-05, "loss": 0.6522641181945801, "mean_token_accuracy": 0.8375919163227081, "num_tokens": 10939919.0, "step": 5350 }, { "entropy": 0.5814169902354479, "epoch": 0.08705326327927694, "grad_norm": 8.125, "learning_rate": 4.9363806765036194e-05, "loss": 0.5493687152862549, "mean_token_accuracy": 0.8554010517895222, "num_tokens": 10959080.0, "step": 5360 }, { "entropy": 0.642770760692656, "epoch": 0.08721567608390246, "grad_norm": 6.0625, "learning_rate": 4.9360896944860644e-05, "loss": 0.6677518844604492, "mean_token_accuracy": 0.8433307923376561, "num_tokens": 10978344.0, "step": 5370 }, { "entropy": 0.6084460916928947, "epoch": 0.08737808888852797, "grad_norm": 9.5, "learning_rate": 4.935798057154907e-05, "loss": 0.6008291721343995, "mean_token_accuracy": 0.8442369610071182, "num_tokens": 10998474.0, "step": 5380 }, { "entropy": 0.7281197951640934, "epoch": 0.08754050169315349, "grad_norm": 7.84375, "learning_rate": 4.935505764588598e-05, "loss": 0.7159610271453858, "mean_token_accuracy": 0.8228184826672077, "num_tokens": 11019736.0, "step": 5390 }, { "entropy": 0.6604039056226612, "epoch": 0.087702914497779, "grad_norm": 8.1875, "learning_rate": 4.935212816865765e-05, "loss": 0.6889187812805175, "mean_token_accuracy": 0.8336355306208134, "num_tokens": 11040722.0, "step": 5400 }, { "entropy": 0.5105343041010201, "epoch": 0.08786532730240453, "grad_norm": 7.78125, "learning_rate": 4.9349192140652115e-05, "loss": 0.48794264793395997, "mean_token_accuracy": 0.8761614501476288, "num_tokens": 11061966.0, "step": 5410 }, { "entropy": 0.6003414323553443, "epoch": 0.08802774010703004, "grad_norm": 7.78125, "learning_rate": 4.934624956265917e-05, "loss": 0.6512250423431396, "mean_token_accuracy": 0.8346175529062748, "num_tokens": 11082417.0, "step": 5420 }, { "entropy": 0.6423029700294137, "epoch": 0.08819015291165555, "grad_norm": 11.75, "learning_rate": 4.9343300435470384e-05, "loss": 0.7145370006561279, "mean_token_accuracy": 0.8275042608380317, "num_tokens": 11104089.0, "step": 5430 }, { "entropy": 0.6451686321292073, "epoch": 0.08835256571628107, "grad_norm": 6.3125, "learning_rate": 4.9340344759879064e-05, "loss": 0.6304905414581299, "mean_token_accuracy": 0.8430520944297314, "num_tokens": 11124864.0, "step": 5440 }, { "entropy": 0.6334490654990077, "epoch": 0.08851497852090659, "grad_norm": 6.46875, "learning_rate": 4.933738253668031e-05, "loss": 0.6170599937438965, "mean_token_accuracy": 0.837143412232399, "num_tokens": 11144364.0, "step": 5450 }, { "entropy": 0.6064558143727481, "epoch": 0.08867739132553211, "grad_norm": 7.46875, "learning_rate": 4.9334413766670956e-05, "loss": 0.6072060585021972, "mean_token_accuracy": 0.8475678980350494, "num_tokens": 11164317.0, "step": 5460 }, { "entropy": 0.6237148152664304, "epoch": 0.08883980413015762, "grad_norm": 9.125, "learning_rate": 4.9331438450649606e-05, "loss": 0.6093404769897461, "mean_token_accuracy": 0.8471099127084016, "num_tokens": 11184928.0, "step": 5470 }, { "entropy": 0.5757282917387784, "epoch": 0.08900221693478313, "grad_norm": 10.125, "learning_rate": 4.932845658941664e-05, "loss": 0.6404849529266358, "mean_token_accuracy": 0.8386787280440331, "num_tokens": 11206130.0, "step": 5480 }, { "entropy": 0.6905780477449298, "epoch": 0.08916462973940865, "grad_norm": 7.46875, "learning_rate": 4.932546818377417e-05, "loss": 0.702696418762207, "mean_token_accuracy": 0.8250477857887745, "num_tokens": 11228674.0, "step": 5490 }, { "entropy": 0.6459718506783247, "epoch": 0.08932704254403417, "grad_norm": 8.0625, "learning_rate": 4.9322473234526096e-05, "loss": 0.6440560340881347, "mean_token_accuracy": 0.8414949037134647, "num_tokens": 11248476.0, "step": 5500 }, { "entropy": 0.5802592306397856, "epoch": 0.0894894553486597, "grad_norm": 7.65625, "learning_rate": 4.9319471742478055e-05, "loss": 0.6213495254516601, "mean_token_accuracy": 0.848654656112194, "num_tokens": 11268080.0, "step": 5510 }, { "entropy": 0.6442588407546281, "epoch": 0.0896518681532852, "grad_norm": 7.09375, "learning_rate": 4.9316463708437466e-05, "loss": 0.6078289985656739, "mean_token_accuracy": 0.8529248848557472, "num_tokens": 11288752.0, "step": 5520 }, { "entropy": 0.5800073832273483, "epoch": 0.08981428095791072, "grad_norm": 6.09375, "learning_rate": 4.9313449133213483e-05, "loss": 0.5902406692504882, "mean_token_accuracy": 0.8432722076773643, "num_tokens": 11309193.0, "step": 5530 }, { "entropy": 0.6451068416237831, "epoch": 0.08997669376253624, "grad_norm": 9.9375, "learning_rate": 4.931042801761705e-05, "loss": 0.6964611530303955, "mean_token_accuracy": 0.8266104102134705, "num_tokens": 11328028.0, "step": 5540 }, { "entropy": 0.7333416105248034, "epoch": 0.09013910656716176, "grad_norm": 7.5625, "learning_rate": 4.930740036246084e-05, "loss": 0.75954270362854, "mean_token_accuracy": 0.8153920006006956, "num_tokens": 11348913.0, "step": 5550 }, { "entropy": 0.5992802513763309, "epoch": 0.09030151937178728, "grad_norm": 6.9375, "learning_rate": 4.9304366168559315e-05, "loss": 0.5746379852294922, "mean_token_accuracy": 0.8538239255547524, "num_tokens": 11368667.0, "step": 5560 }, { "entropy": 0.617322726920247, "epoch": 0.09046393217641278, "grad_norm": 5.78125, "learning_rate": 4.930132543672866e-05, "loss": 0.607831335067749, "mean_token_accuracy": 0.8455162569880486, "num_tokens": 11388742.0, "step": 5570 }, { "entropy": 0.6373940145596861, "epoch": 0.0906263449810383, "grad_norm": 6.1875, "learning_rate": 4.9298278167786854e-05, "loss": 0.6336771011352539, "mean_token_accuracy": 0.8423676803708077, "num_tokens": 11409260.0, "step": 5580 }, { "entropy": 0.6668388342484832, "epoch": 0.09078875778566382, "grad_norm": 7.53125, "learning_rate": 4.9295224362553616e-05, "loss": 0.7081441879272461, "mean_token_accuracy": 0.8305798426270485, "num_tokens": 11431389.0, "step": 5590 }, { "entropy": 0.6991683353669942, "epoch": 0.09095117059028934, "grad_norm": 7.90625, "learning_rate": 4.929216402185042e-05, "loss": 0.715422534942627, "mean_token_accuracy": 0.8236151970922947, "num_tokens": 11451943.0, "step": 5600 }, { "entropy": 0.6517792828381062, "epoch": 0.09111358339491485, "grad_norm": 6.96875, "learning_rate": 4.928909714650051e-05, "loss": 0.6366158962249756, "mean_token_accuracy": 0.8373116962611675, "num_tokens": 11473005.0, "step": 5610 }, { "entropy": 0.6652334915474057, "epoch": 0.09127599619954037, "grad_norm": 8.6875, "learning_rate": 4.928602373732888e-05, "loss": 0.6986649990081787, "mean_token_accuracy": 0.8397133007645607, "num_tokens": 11494121.0, "step": 5620 }, { "entropy": 0.5822399449534714, "epoch": 0.09143840900416589, "grad_norm": 8.25, "learning_rate": 4.928294379516228e-05, "loss": 0.5544229030609131, "mean_token_accuracy": 0.8519444763660431, "num_tokens": 11514745.0, "step": 5630 }, { "entropy": 0.5854098604992032, "epoch": 0.09160082180879141, "grad_norm": 7.1875, "learning_rate": 4.927985732082924e-05, "loss": 0.584111499786377, "mean_token_accuracy": 0.8497672028839588, "num_tokens": 11535310.0, "step": 5640 }, { "entropy": 0.5732845838181675, "epoch": 0.09176323461341693, "grad_norm": 6.46875, "learning_rate": 4.9276764315160005e-05, "loss": 0.5545302391052246, "mean_token_accuracy": 0.8615542069077492, "num_tokens": 11555854.0, "step": 5650 }, { "entropy": 0.6476027883589268, "epoch": 0.09192564741804243, "grad_norm": 4.96875, "learning_rate": 4.9273664778986613e-05, "loss": 0.7048705101013184, "mean_token_accuracy": 0.8281946685165167, "num_tokens": 11575133.0, "step": 5660 }, { "entropy": 0.7215040531009436, "epoch": 0.09208806022266795, "grad_norm": 7.96875, "learning_rate": 4.927055871314284e-05, "loss": 0.7234652996063232, "mean_token_accuracy": 0.8235920663923025, "num_tokens": 11596195.0, "step": 5670 }, { "entropy": 0.5627514095511288, "epoch": 0.09225047302729347, "grad_norm": 6.53125, "learning_rate": 4.9267446118464233e-05, "loss": 0.5749897003173828, "mean_token_accuracy": 0.857719873636961, "num_tokens": 11617287.0, "step": 5680 }, { "entropy": 0.6435061246156693, "epoch": 0.09241288583191899, "grad_norm": 9.625, "learning_rate": 4.926432699578809e-05, "loss": 0.6815619945526123, "mean_token_accuracy": 0.8332644391804933, "num_tokens": 11637975.0, "step": 5690 }, { "entropy": 0.6932725168764591, "epoch": 0.09257529863654451, "grad_norm": 8.0625, "learning_rate": 4.926120134595345e-05, "loss": 0.6874166488647461, "mean_token_accuracy": 0.8254999034106731, "num_tokens": 11658955.0, "step": 5700 }, { "entropy": 0.6644466552883387, "epoch": 0.09273771144117002, "grad_norm": 8.875, "learning_rate": 4.9258069169801114e-05, "loss": 0.6455849170684814, "mean_token_accuracy": 0.8269536457955837, "num_tokens": 11679577.0, "step": 5710 }, { "entropy": 0.6981634385883808, "epoch": 0.09290012424579554, "grad_norm": 7.90625, "learning_rate": 4.925493046817367e-05, "loss": 0.7206590652465821, "mean_token_accuracy": 0.8137824270874262, "num_tokens": 11701631.0, "step": 5720 }, { "entropy": 0.6097036791965366, "epoch": 0.09306253705042106, "grad_norm": 9.3125, "learning_rate": 4.92517852419154e-05, "loss": 0.6002647876739502, "mean_token_accuracy": 0.842541278898716, "num_tokens": 11722057.0, "step": 5730 }, { "entropy": 0.6781312499195338, "epoch": 0.09322494985504658, "grad_norm": 7.90625, "learning_rate": 4.924863349187242e-05, "loss": 0.6763605594635009, "mean_token_accuracy": 0.8276946157217026, "num_tokens": 11742861.0, "step": 5740 }, { "entropy": 0.6410096267703921, "epoch": 0.09338736265967208, "grad_norm": 9.875, "learning_rate": 4.9245475218892524e-05, "loss": 0.7083607673645019, "mean_token_accuracy": 0.8270403660833836, "num_tokens": 11763285.0, "step": 5750 }, { "entropy": 0.6320790896192193, "epoch": 0.0935497754642976, "grad_norm": 12.4375, "learning_rate": 4.92423104238253e-05, "loss": 0.5950321674346923, "mean_token_accuracy": 0.8523061156272889, "num_tokens": 11784748.0, "step": 5760 }, { "entropy": 0.6549301604740322, "epoch": 0.09371218826892312, "grad_norm": 8.75, "learning_rate": 4.9239139107522106e-05, "loss": 0.6309489250183106, "mean_token_accuracy": 0.8387120313942432, "num_tokens": 11805146.0, "step": 5770 }, { "entropy": 0.5753857920877635, "epoch": 0.09387460107354864, "grad_norm": 4.90625, "learning_rate": 4.923596127083601e-05, "loss": 0.5750814914703369, "mean_token_accuracy": 0.8526087913662195, "num_tokens": 11825359.0, "step": 5780 }, { "entropy": 0.5677464101463556, "epoch": 0.09403701387817416, "grad_norm": 7.8125, "learning_rate": 4.923277691462186e-05, "loss": 0.5646823406219482, "mean_token_accuracy": 0.8607584916055202, "num_tokens": 11845409.0, "step": 5790 }, { "entropy": 0.6200788105838001, "epoch": 0.09419942668279967, "grad_norm": 7.46875, "learning_rate": 4.922958603973626e-05, "loss": 0.6502737045288086, "mean_token_accuracy": 0.8411554090678692, "num_tokens": 11866489.0, "step": 5800 }, { "entropy": 0.6292120623402297, "epoch": 0.09436183948742519, "grad_norm": 6.9375, "learning_rate": 4.9226388647037566e-05, "loss": 0.6439945220947265, "mean_token_accuracy": 0.8383519954979419, "num_tokens": 11887006.0, "step": 5810 }, { "entropy": 0.677078590542078, "epoch": 0.0945242522920507, "grad_norm": 7.1875, "learning_rate": 4.9223184737385884e-05, "loss": 0.7318645477294922, "mean_token_accuracy": 0.823764257133007, "num_tokens": 11906871.0, "step": 5820 }, { "entropy": 0.6257118264213204, "epoch": 0.09468666509667623, "grad_norm": 5.5625, "learning_rate": 4.921997431164307e-05, "loss": 0.6435337066650391, "mean_token_accuracy": 0.8396163575351239, "num_tokens": 11926335.0, "step": 5830 }, { "entropy": 0.7018745961599052, "epoch": 0.09484907790130175, "grad_norm": 11.25, "learning_rate": 4.921675737067273e-05, "loss": 0.6689714908599853, "mean_token_accuracy": 0.8301255956292153, "num_tokens": 11947027.0, "step": 5840 }, { "entropy": 0.7136979087255895, "epoch": 0.09501149070592725, "grad_norm": 9.8125, "learning_rate": 4.9213533915340235e-05, "loss": 0.6811447143554688, "mean_token_accuracy": 0.8385517653077841, "num_tokens": 11966872.0, "step": 5850 }, { "entropy": 0.6285030204802752, "epoch": 0.09517390351055277, "grad_norm": 7.84375, "learning_rate": 4.9210303946512705e-05, "loss": 0.6226911067962646, "mean_token_accuracy": 0.8465060502290725, "num_tokens": 11987527.0, "step": 5860 }, { "entropy": 0.609409558121115, "epoch": 0.09533631631517829, "grad_norm": 6.5625, "learning_rate": 4.9207067465058996e-05, "loss": 0.6263372421264648, "mean_token_accuracy": 0.8349673487246037, "num_tokens": 12006871.0, "step": 5870 }, { "entropy": 0.6607967047020793, "epoch": 0.09549872911980381, "grad_norm": 12.1875, "learning_rate": 4.920382447184975e-05, "loss": 0.6952318668365478, "mean_token_accuracy": 0.8282220892608165, "num_tokens": 12027045.0, "step": 5880 }, { "entropy": 0.6388654561713338, "epoch": 0.09566114192442932, "grad_norm": 7.28125, "learning_rate": 4.920057496775732e-05, "loss": 0.6413753986358642, "mean_token_accuracy": 0.8395051188766957, "num_tokens": 12047663.0, "step": 5890 }, { "entropy": 0.6895679261535406, "epoch": 0.09582355472905484, "grad_norm": 11.125, "learning_rate": 4.919731895365583e-05, "loss": 0.6976691246032715, "mean_token_accuracy": 0.834809473529458, "num_tokens": 12067909.0, "step": 5900 }, { "entropy": 0.6663657059893012, "epoch": 0.09598596753368036, "grad_norm": 6.5625, "learning_rate": 4.9194056430421164e-05, "loss": 0.6548609733581543, "mean_token_accuracy": 0.8349889636039733, "num_tokens": 12087003.0, "step": 5910 }, { "entropy": 0.6139764716848731, "epoch": 0.09614838033830587, "grad_norm": 9.1875, "learning_rate": 4.919078739893095e-05, "loss": 0.6343098163604737, "mean_token_accuracy": 0.8475162290036679, "num_tokens": 12107473.0, "step": 5920 }, { "entropy": 0.5921707196161151, "epoch": 0.0963107931429314, "grad_norm": 10.0625, "learning_rate": 4.9187511860064556e-05, "loss": 0.5860202312469482, "mean_token_accuracy": 0.8487659100443125, "num_tokens": 12127591.0, "step": 5930 }, { "entropy": 0.6342114270664752, "epoch": 0.0964732059475569, "grad_norm": 7.125, "learning_rate": 4.918422981470312e-05, "loss": 0.6286733627319336, "mean_token_accuracy": 0.8476006545126438, "num_tokens": 12146983.0, "step": 5940 }, { "entropy": 0.7546248151455075, "epoch": 0.09663561875218242, "grad_norm": 9.9375, "learning_rate": 4.918094126372951e-05, "loss": 0.7934096813201904, "mean_token_accuracy": 0.8111888900399208, "num_tokens": 12167492.0, "step": 5950 }, { "entropy": 0.6676985073834658, "epoch": 0.09679803155680794, "grad_norm": 7.90625, "learning_rate": 4.917764620802835e-05, "loss": 0.6434507369995117, "mean_token_accuracy": 0.8340744532644748, "num_tokens": 12187634.0, "step": 5960 }, { "entropy": 0.6119903038721531, "epoch": 0.09696044436143346, "grad_norm": 7.0625, "learning_rate": 4.917434464848603e-05, "loss": 0.6177764892578125, "mean_token_accuracy": 0.8404625453054905, "num_tokens": 12208070.0, "step": 5970 }, { "entropy": 0.580264858994633, "epoch": 0.09712285716605898, "grad_norm": 8.75, "learning_rate": 4.9171036585990674e-05, "loss": 0.6094505786895752, "mean_token_accuracy": 0.8474940560758114, "num_tokens": 12228907.0, "step": 5980 }, { "entropy": 0.5836649311706423, "epoch": 0.09728526997068448, "grad_norm": 8.0, "learning_rate": 4.916772202143215e-05, "loss": 0.5997894287109375, "mean_token_accuracy": 0.8503757081925869, "num_tokens": 12249368.0, "step": 5990 }, { "entropy": 0.6027049476280808, "epoch": 0.09744768277531, "grad_norm": 9.5625, "learning_rate": 4.9164400955702084e-05, "loss": 0.5994089603424072, "mean_token_accuracy": 0.8458671323955059, "num_tokens": 12269719.0, "step": 6000 }, { "entropy": 0.6554845773614943, "epoch": 0.09761009557993552, "grad_norm": 10.5, "learning_rate": 4.9161073389693864e-05, "loss": 0.6659326076507568, "mean_token_accuracy": 0.8357393354177475, "num_tokens": 12289469.0, "step": 6010 }, { "entropy": 0.5960832364857197, "epoch": 0.09777250838456104, "grad_norm": 9.6875, "learning_rate": 4.91577393243026e-05, "loss": 0.5783562660217285, "mean_token_accuracy": 0.8506297983229161, "num_tokens": 12308690.0, "step": 6020 }, { "entropy": 0.5752148922532797, "epoch": 0.09793492118918655, "grad_norm": 9.5, "learning_rate": 4.915439876042517e-05, "loss": 0.6113204002380371, "mean_token_accuracy": 0.839603129029274, "num_tokens": 12329583.0, "step": 6030 }, { "entropy": 0.6065985410474241, "epoch": 0.09809733399381207, "grad_norm": 7.84375, "learning_rate": 4.915105169896018e-05, "loss": 0.593541955947876, "mean_token_accuracy": 0.8497001029551029, "num_tokens": 12350237.0, "step": 6040 }, { "entropy": 0.6282325727399438, "epoch": 0.09825974679843759, "grad_norm": 6.90625, "learning_rate": 4.914769814080802e-05, "loss": 0.632943058013916, "mean_token_accuracy": 0.8353254850953817, "num_tokens": 12370420.0, "step": 6050 }, { "entropy": 0.5607091772370041, "epoch": 0.09842215960306311, "grad_norm": 7.3125, "learning_rate": 4.914433808687079e-05, "loss": 0.5594011783599854, "mean_token_accuracy": 0.8519423916935921, "num_tokens": 12389920.0, "step": 6060 }, { "entropy": 0.6183028971310705, "epoch": 0.09858457240768863, "grad_norm": 8.8125, "learning_rate": 4.914097153805235e-05, "loss": 0.602258825302124, "mean_token_accuracy": 0.853596031665802, "num_tokens": 12410944.0, "step": 6070 }, { "entropy": 0.6815085278823971, "epoch": 0.09874698521231413, "grad_norm": 7.125, "learning_rate": 4.913759849525831e-05, "loss": 0.697646951675415, "mean_token_accuracy": 0.8308833621442318, "num_tokens": 12431751.0, "step": 6080 }, { "entropy": 0.6059432869311422, "epoch": 0.09890939801693965, "grad_norm": 10.8125, "learning_rate": 4.9134218959396025e-05, "loss": 0.6104983329772949, "mean_token_accuracy": 0.8482199154794217, "num_tokens": 12452106.0, "step": 6090 }, { "entropy": 0.6143333061598242, "epoch": 0.09907181082156517, "grad_norm": 6.96875, "learning_rate": 4.913083293137461e-05, "loss": 0.6225437641143798, "mean_token_accuracy": 0.8433362126350403, "num_tokens": 12474058.0, "step": 6100 }, { "entropy": 0.612652269564569, "epoch": 0.09923422362619069, "grad_norm": 9.5, "learning_rate": 4.912744041210491e-05, "loss": 0.6343034744262696, "mean_token_accuracy": 0.840189841017127, "num_tokens": 12493704.0, "step": 6110 }, { "entropy": 0.5554334382526577, "epoch": 0.0993966364308162, "grad_norm": 7.25, "learning_rate": 4.9124041402499504e-05, "loss": 0.6024789810180664, "mean_token_accuracy": 0.8435857474803925, "num_tokens": 12513136.0, "step": 6120 }, { "entropy": 0.6666329228319228, "epoch": 0.09955904923544172, "grad_norm": 6.4375, "learning_rate": 4.912063590347275e-05, "loss": 0.6778152465820313, "mean_token_accuracy": 0.827507147192955, "num_tokens": 12534285.0, "step": 6130 }, { "entropy": 0.5980260455049574, "epoch": 0.09972146204006724, "grad_norm": 8.8125, "learning_rate": 4.911722391594074e-05, "loss": 0.5889979362487793, "mean_token_accuracy": 0.8478504225611687, "num_tokens": 12555325.0, "step": 6140 }, { "entropy": 0.6120086058042944, "epoch": 0.09988387484469276, "grad_norm": 7.125, "learning_rate": 4.911380544082128e-05, "loss": 0.5923365592956543, "mean_token_accuracy": 0.8444542773067951, "num_tokens": 12575992.0, "step": 6150 }, { "entropy": 0.6001654099673033, "epoch": 0.10004628764931828, "grad_norm": 8.25, "learning_rate": 4.911038047903397e-05, "loss": 0.6027307033538818, "mean_token_accuracy": 0.8473360680043698, "num_tokens": 12597334.0, "step": 6160 }, { "entropy": 0.6207100682891905, "epoch": 0.10020870045394378, "grad_norm": 7.03125, "learning_rate": 4.910694903150013e-05, "loss": 0.6054044246673584, "mean_token_accuracy": 0.8388069026172161, "num_tokens": 12617418.0, "step": 6170 }, { "entropy": 0.6936485547572374, "epoch": 0.1003711132585693, "grad_norm": 6.03125, "learning_rate": 4.910351109914282e-05, "loss": 0.7291698932647706, "mean_token_accuracy": 0.8230216655880213, "num_tokens": 12636690.0, "step": 6180 }, { "entropy": 0.6112619993276894, "epoch": 0.10053352606319482, "grad_norm": 7.8125, "learning_rate": 4.910006668288686e-05, "loss": 0.590873384475708, "mean_token_accuracy": 0.8559373661875724, "num_tokens": 12656389.0, "step": 6190 }, { "entropy": 0.5967893553897738, "epoch": 0.10069593886782034, "grad_norm": 6.25, "learning_rate": 4.90966157836588e-05, "loss": 0.5933689594268798, "mean_token_accuracy": 0.8468652173876763, "num_tokens": 12677105.0, "step": 6200 }, { "entropy": 0.5689596822950989, "epoch": 0.10085835167244586, "grad_norm": 8.875, "learning_rate": 4.9093158402386937e-05, "loss": 0.5938102245330811, "mean_token_accuracy": 0.8549989901483059, "num_tokens": 12696883.0, "step": 6210 }, { "entropy": 0.6307418226730078, "epoch": 0.10102076447707137, "grad_norm": 6.71875, "learning_rate": 4.908969454000132e-05, "loss": 0.6243972778320312, "mean_token_accuracy": 0.8452994950115681, "num_tokens": 12716908.0, "step": 6220 }, { "entropy": 0.6778909185901284, "epoch": 0.10118317728169689, "grad_norm": 8.5625, "learning_rate": 4.908622419743373e-05, "loss": 0.7170105457305909, "mean_token_accuracy": 0.8166264861822128, "num_tokens": 12737328.0, "step": 6230 }, { "entropy": 0.621736378595233, "epoch": 0.1013455900863224, "grad_norm": 8.3125, "learning_rate": 4.90827473756177e-05, "loss": 0.6073185443878174, "mean_token_accuracy": 0.8497686441987753, "num_tokens": 12757787.0, "step": 6240 }, { "entropy": 0.6796503243967891, "epoch": 0.10150800289094793, "grad_norm": 8.0, "learning_rate": 4.907926407548851e-05, "loss": 0.7197381973266601, "mean_token_accuracy": 0.8208652697503567, "num_tokens": 12777607.0, "step": 6250 }, { "entropy": 0.6326322045177222, "epoch": 0.10167041569557343, "grad_norm": 8.375, "learning_rate": 4.907577429798316e-05, "loss": 0.6549229145050048, "mean_token_accuracy": 0.8428358383476734, "num_tokens": 12797653.0, "step": 6260 }, { "entropy": 0.6525430457666517, "epoch": 0.10183282850019895, "grad_norm": 5.46875, "learning_rate": 4.907227804404042e-05, "loss": 0.662497615814209, "mean_token_accuracy": 0.8433516226708889, "num_tokens": 12818394.0, "step": 6270 }, { "entropy": 0.6628718571737409, "epoch": 0.10199524130482447, "grad_norm": 6.4375, "learning_rate": 4.906877531460079e-05, "loss": 0.6757307052612305, "mean_token_accuracy": 0.8292798720300197, "num_tokens": 12839235.0, "step": 6280 }, { "entropy": 0.6136347286403179, "epoch": 0.10215765410944999, "grad_norm": 8.4375, "learning_rate": 4.906526611060651e-05, "loss": 0.596739387512207, "mean_token_accuracy": 0.8457308225333691, "num_tokens": 12859680.0, "step": 6290 }, { "entropy": 0.6096434370614588, "epoch": 0.10232006691407551, "grad_norm": 6.5625, "learning_rate": 4.9061750433001564e-05, "loss": 0.6274813652038574, "mean_token_accuracy": 0.8374573700129986, "num_tokens": 12881118.0, "step": 6300 }, { "entropy": 0.6869486537761986, "epoch": 0.10248247971870102, "grad_norm": 10.0, "learning_rate": 4.905822828273167e-05, "loss": 0.726727819442749, "mean_token_accuracy": 0.8138910997658968, "num_tokens": 12902968.0, "step": 6310 }, { "entropy": 0.6905327472835779, "epoch": 0.10264489252332654, "grad_norm": 8.375, "learning_rate": 4.905469966074431e-05, "loss": 0.6612315654754639, "mean_token_accuracy": 0.8297219827771187, "num_tokens": 12923854.0, "step": 6320 }, { "entropy": 0.6386252098716796, "epoch": 0.10280730532795206, "grad_norm": 8.5625, "learning_rate": 4.9051164567988673e-05, "loss": 0.6311389923095703, "mean_token_accuracy": 0.8365753784775734, "num_tokens": 12943621.0, "step": 6330 }, { "entropy": 0.5903109846636653, "epoch": 0.10296971813257758, "grad_norm": 7.5, "learning_rate": 4.9047623005415716e-05, "loss": 0.5930712699890137, "mean_token_accuracy": 0.8421047933399677, "num_tokens": 12963481.0, "step": 6340 }, { "entropy": 0.677538734395057, "epoch": 0.1031321309372031, "grad_norm": 6.53125, "learning_rate": 4.904407497397813e-05, "loss": 0.660320520401001, "mean_token_accuracy": 0.8387979425489902, "num_tokens": 12984158.0, "step": 6350 }, { "entropy": 0.6726973691955209, "epoch": 0.1032945437418286, "grad_norm": 7.875, "learning_rate": 4.904052047463034e-05, "loss": 0.7057188034057618, "mean_token_accuracy": 0.8199150513857603, "num_tokens": 13003340.0, "step": 6360 }, { "entropy": 0.5950033149216324, "epoch": 0.10345695654645412, "grad_norm": 5.71875, "learning_rate": 4.903695950832852e-05, "loss": 0.635451078414917, "mean_token_accuracy": 0.8366922959685326, "num_tokens": 13024184.0, "step": 6370 }, { "entropy": 0.6123795830644667, "epoch": 0.10361936935107964, "grad_norm": 9.6875, "learning_rate": 4.903339207603056e-05, "loss": 0.63008713722229, "mean_token_accuracy": 0.8346828334033489, "num_tokens": 13043670.0, "step": 6380 }, { "entropy": 0.6219707918353379, "epoch": 0.10378178215570516, "grad_norm": 7.84375, "learning_rate": 4.902981817869613e-05, "loss": 0.6600622653961181, "mean_token_accuracy": 0.8456276528537273, "num_tokens": 13063421.0, "step": 6390 }, { "entropy": 0.6061103956773877, "epoch": 0.10394419496033067, "grad_norm": 5.90625, "learning_rate": 4.90262378172866e-05, "loss": 0.5751877307891846, "mean_token_accuracy": 0.8529136382043362, "num_tokens": 13084355.0, "step": 6400 }, { "entropy": 0.634320900356397, "epoch": 0.10410660776495619, "grad_norm": 8.0625, "learning_rate": 4.9022650992765105e-05, "loss": 0.6343759059906006, "mean_token_accuracy": 0.8439286552369595, "num_tokens": 13104810.0, "step": 6410 }, { "entropy": 0.5623653528280557, "epoch": 0.1042690205695817, "grad_norm": 7.78125, "learning_rate": 4.9019057706096506e-05, "loss": 0.5704917907714844, "mean_token_accuracy": 0.8563205279409886, "num_tokens": 13123974.0, "step": 6420 }, { "entropy": 0.6860338868573308, "epoch": 0.10443143337420722, "grad_norm": 8.8125, "learning_rate": 4.90154579582474e-05, "loss": 0.6964627265930176, "mean_token_accuracy": 0.8305376373231411, "num_tokens": 13143856.0, "step": 6430 }, { "entropy": 0.5709740391001106, "epoch": 0.10459384617883274, "grad_norm": 7.34375, "learning_rate": 4.901185175018613e-05, "loss": 0.6113903999328614, "mean_token_accuracy": 0.8465806435793638, "num_tokens": 13163545.0, "step": 6440 }, { "entropy": 0.6497429087758064, "epoch": 0.10475625898345825, "grad_norm": 11.3125, "learning_rate": 4.900823908288279e-05, "loss": 0.6574363708496094, "mean_token_accuracy": 0.8371558859944344, "num_tokens": 13184840.0, "step": 6450 }, { "entropy": 0.6203077908605337, "epoch": 0.10491867178808377, "grad_norm": 9.3125, "learning_rate": 4.900461995730917e-05, "loss": 0.5649062156677246, "mean_token_accuracy": 0.8436340287327766, "num_tokens": 13204754.0, "step": 6460 }, { "entropy": 0.6261931812390685, "epoch": 0.10508108459270929, "grad_norm": 8.4375, "learning_rate": 4.900099437443883e-05, "loss": 0.6290972709655762, "mean_token_accuracy": 0.8385742295533418, "num_tokens": 13224445.0, "step": 6470 }, { "entropy": 0.6390118858776986, "epoch": 0.10524349739733481, "grad_norm": 6.9375, "learning_rate": 4.899736233524708e-05, "loss": 0.6686450958251953, "mean_token_accuracy": 0.8302474655210972, "num_tokens": 13243995.0, "step": 6480 }, { "entropy": 0.6340270144864917, "epoch": 0.10540591020196033, "grad_norm": 10.0, "learning_rate": 4.899372384071092e-05, "loss": 0.6745894908905029, "mean_token_accuracy": 0.841634188964963, "num_tokens": 13263468.0, "step": 6490 }, { "entropy": 0.6341075411066412, "epoch": 0.10556832300658583, "grad_norm": 6.3125, "learning_rate": 4.8990078891809125e-05, "loss": 0.6327983379364014, "mean_token_accuracy": 0.8408970452845097, "num_tokens": 13283929.0, "step": 6500 }, { "entropy": 0.6664155066013336, "epoch": 0.10573073581121135, "grad_norm": 7.625, "learning_rate": 4.89864274895222e-05, "loss": 0.6782182216644287, "mean_token_accuracy": 0.833850584179163, "num_tokens": 13303313.0, "step": 6510 }, { "entropy": 0.6132186763454228, "epoch": 0.10589314861583687, "grad_norm": 5.375, "learning_rate": 4.898276963483237e-05, "loss": 0.6186100482940674, "mean_token_accuracy": 0.8431302443146705, "num_tokens": 13324373.0, "step": 6520 }, { "entropy": 0.6714445546269416, "epoch": 0.1060555614204624, "grad_norm": 5.46875, "learning_rate": 4.897910532872361e-05, "loss": 0.6207530975341797, "mean_token_accuracy": 0.8447301346808672, "num_tokens": 13345239.0, "step": 6530 }, { "entropy": 0.6688847640994936, "epoch": 0.1062179742250879, "grad_norm": 7.09375, "learning_rate": 4.897543457218162e-05, "loss": 0.6689769268035889, "mean_token_accuracy": 0.8340058982372284, "num_tokens": 13365930.0, "step": 6540 }, { "entropy": 0.592306956090033, "epoch": 0.10638038702971342, "grad_norm": 9.1875, "learning_rate": 4.897175736619386e-05, "loss": 0.6057229518890381, "mean_token_accuracy": 0.8451463550329208, "num_tokens": 13386363.0, "step": 6550 }, { "entropy": 0.5931718320585787, "epoch": 0.10654279983433894, "grad_norm": 8.75, "learning_rate": 4.8968073711749496e-05, "loss": 0.6492452621459961, "mean_token_accuracy": 0.8454679928719997, "num_tokens": 13407512.0, "step": 6560 }, { "entropy": 0.659595332108438, "epoch": 0.10670521263896446, "grad_norm": 7.0625, "learning_rate": 4.8964383609839424e-05, "loss": 0.6515290260314941, "mean_token_accuracy": 0.8403771601617336, "num_tokens": 13428265.0, "step": 6570 }, { "entropy": 0.5930665609426796, "epoch": 0.10686762544358998, "grad_norm": 6.15625, "learning_rate": 4.8960687061456324e-05, "loss": 0.5729175090789795, "mean_token_accuracy": 0.8499673165380954, "num_tokens": 13447885.0, "step": 6580 }, { "entropy": 0.6070752565748989, "epoch": 0.10703003824821548, "grad_norm": 6.84375, "learning_rate": 4.895698406759454e-05, "loss": 0.6022463321685791, "mean_token_accuracy": 0.8481736466288566, "num_tokens": 13468551.0, "step": 6590 }, { "entropy": 0.5811776736751199, "epoch": 0.107192451052841, "grad_norm": 7.4375, "learning_rate": 4.895327462925021e-05, "loss": 0.5739788055419922, "mean_token_accuracy": 0.8505115218460559, "num_tokens": 13489971.0, "step": 6600 }, { "entropy": 0.6433970564976335, "epoch": 0.10735486385746652, "grad_norm": 6.90625, "learning_rate": 4.894955874742117e-05, "loss": 0.6606588363647461, "mean_token_accuracy": 0.8362593173980712, "num_tokens": 13510937.0, "step": 6610 }, { "entropy": 0.5758526429533959, "epoch": 0.10751727666209204, "grad_norm": 6.65625, "learning_rate": 4.8945836423107004e-05, "loss": 0.6286211967468261, "mean_token_accuracy": 0.8415801376104355, "num_tokens": 13531274.0, "step": 6620 }, { "entropy": 0.5736963151022791, "epoch": 0.10767968946671756, "grad_norm": 6.65625, "learning_rate": 4.894210765730903e-05, "loss": 0.6679504871368408, "mean_token_accuracy": 0.8332979448139668, "num_tokens": 13552115.0, "step": 6630 }, { "entropy": 0.6388195671141148, "epoch": 0.10784210227134307, "grad_norm": 6.96875, "learning_rate": 4.893837245103028e-05, "loss": 0.6431354999542236, "mean_token_accuracy": 0.8358840674161911, "num_tokens": 13572359.0, "step": 6640 }, { "entropy": 0.6485201071016491, "epoch": 0.10800451507596859, "grad_norm": 7.71875, "learning_rate": 4.893463080527555e-05, "loss": 0.6077786445617676, "mean_token_accuracy": 0.8512351542711258, "num_tokens": 13593733.0, "step": 6650 }, { "entropy": 0.6238375777378679, "epoch": 0.10816692788059411, "grad_norm": 10.5625, "learning_rate": 4.8930882721051345e-05, "loss": 0.5886755466461182, "mean_token_accuracy": 0.8462965518236161, "num_tokens": 13614714.0, "step": 6660 }, { "entropy": 0.669042232260108, "epoch": 0.10832934068521963, "grad_norm": 7.21875, "learning_rate": 4.89271281993659e-05, "loss": 0.6709877967834472, "mean_token_accuracy": 0.8353570513427258, "num_tokens": 13634407.0, "step": 6670 }, { "entropy": 0.5910451102070511, "epoch": 0.10849175348984513, "grad_norm": 8.4375, "learning_rate": 4.89233672412292e-05, "loss": 0.6187312126159668, "mean_token_accuracy": 0.842661264538765, "num_tokens": 13656375.0, "step": 6680 }, { "entropy": 0.606962144561112, "epoch": 0.10865416629447065, "grad_norm": 8.5, "learning_rate": 4.891959984765295e-05, "loss": 0.6096054553985596, "mean_token_accuracy": 0.8443181097507477, "num_tokens": 13678261.0, "step": 6690 }, { "entropy": 0.620755261555314, "epoch": 0.10881657909909617, "grad_norm": 7.375, "learning_rate": 4.891582601965059e-05, "loss": 0.6147064208984375, "mean_token_accuracy": 0.8440775915980339, "num_tokens": 13699279.0, "step": 6700 }, { "entropy": 0.56182921952568, "epoch": 0.10897899190372169, "grad_norm": 9.5, "learning_rate": 4.8912045758237276e-05, "loss": 0.6163622379302979, "mean_token_accuracy": 0.8419118158519268, "num_tokens": 13718771.0, "step": 6710 }, { "entropy": 0.614237979799509, "epoch": 0.10914140470834721, "grad_norm": 5.59375, "learning_rate": 4.8908259064429915e-05, "loss": 0.5982274055480957, "mean_token_accuracy": 0.8418500125408173, "num_tokens": 13738663.0, "step": 6720 }, { "entropy": 0.6365445976145565, "epoch": 0.10930381751297272, "grad_norm": 7.75, "learning_rate": 4.890446593924714e-05, "loss": 0.6637476444244385, "mean_token_accuracy": 0.8420601941645145, "num_tokens": 13758053.0, "step": 6730 }, { "entropy": 0.6402726686559618, "epoch": 0.10946623031759824, "grad_norm": 8.75, "learning_rate": 4.890066638370929e-05, "loss": 0.6488207817077637, "mean_token_accuracy": 0.8352530241012573, "num_tokens": 13777372.0, "step": 6740 }, { "entropy": 0.6088193757459521, "epoch": 0.10962864312222376, "grad_norm": 9.4375, "learning_rate": 4.889686039883849e-05, "loss": 0.5872569561004639, "mean_token_accuracy": 0.8487405680119992, "num_tokens": 13798195.0, "step": 6750 }, { "entropy": 0.5976423224434256, "epoch": 0.10979105592684928, "grad_norm": 5.34375, "learning_rate": 4.889304798565852e-05, "loss": 0.6092954158782959, "mean_token_accuracy": 0.8431301355361939, "num_tokens": 13819754.0, "step": 6760 }, { "entropy": 0.6678327482193709, "epoch": 0.1099534687314748, "grad_norm": 6.8125, "learning_rate": 4.888922914519495e-05, "loss": 0.6916511058807373, "mean_token_accuracy": 0.8308367826044559, "num_tokens": 13840842.0, "step": 6770 }, { "entropy": 0.6302380417473614, "epoch": 0.1101158815361003, "grad_norm": 10.125, "learning_rate": 4.8885403878475054e-05, "loss": 0.611336612701416, "mean_token_accuracy": 0.8436132676899433, "num_tokens": 13860966.0, "step": 6780 }, { "entropy": 0.6915411301422865, "epoch": 0.11027829434072582, "grad_norm": 10.4375, "learning_rate": 4.8881572186527836e-05, "loss": 0.7231813430786133, "mean_token_accuracy": 0.8216905999928713, "num_tokens": 13882550.0, "step": 6790 }, { "entropy": 0.632090959046036, "epoch": 0.11044070714535134, "grad_norm": 7.5, "learning_rate": 4.887773407038403e-05, "loss": 0.6470117092132568, "mean_token_accuracy": 0.8358137283474207, "num_tokens": 13903085.0, "step": 6800 }, { "entropy": 0.6490141788963228, "epoch": 0.11060311994997686, "grad_norm": 8.875, "learning_rate": 4.88738895310761e-05, "loss": 0.6354988574981689, "mean_token_accuracy": 0.850813964009285, "num_tokens": 13922823.0, "step": 6810 }, { "entropy": 0.669668807182461, "epoch": 0.11076553275460237, "grad_norm": 8.8125, "learning_rate": 4.887003856963823e-05, "loss": 0.6762049674987793, "mean_token_accuracy": 0.8345622800290584, "num_tokens": 13942950.0, "step": 6820 }, { "entropy": 0.5729212189093232, "epoch": 0.11092794555922789, "grad_norm": 8.3125, "learning_rate": 4.8866181187106344e-05, "loss": 0.5701552867889405, "mean_token_accuracy": 0.8569412715733051, "num_tokens": 13963871.0, "step": 6830 }, { "entropy": 0.6246520292013884, "epoch": 0.1110903583638534, "grad_norm": 6.9375, "learning_rate": 4.8862317384518075e-05, "loss": 0.6252270221710206, "mean_token_accuracy": 0.8386704131960869, "num_tokens": 13984529.0, "step": 6840 }, { "entropy": 0.56360171912238, "epoch": 0.11125277116847893, "grad_norm": 7.03125, "learning_rate": 4.885844716291281e-05, "loss": 0.5482209682464599, "mean_token_accuracy": 0.8529964804649353, "num_tokens": 14004812.0, "step": 6850 }, { "entropy": 0.6201188803184777, "epoch": 0.11141518397310445, "grad_norm": 8.5625, "learning_rate": 4.885457052333163e-05, "loss": 0.6806389808654785, "mean_token_accuracy": 0.8331883233040571, "num_tokens": 14025039.0, "step": 6860 }, { "entropy": 0.675892140995711, "epoch": 0.11157759677772995, "grad_norm": 7.09375, "learning_rate": 4.885068746681738e-05, "loss": 0.6782083511352539, "mean_token_accuracy": 0.836098014190793, "num_tokens": 14044706.0, "step": 6870 }, { "entropy": 0.6391027141362429, "epoch": 0.11174000958235547, "grad_norm": 9.125, "learning_rate": 4.884679799441459e-05, "loss": 0.663369607925415, "mean_token_accuracy": 0.8380234383046627, "num_tokens": 14065036.0, "step": 6880 }, { "entropy": 0.6439007128588855, "epoch": 0.11190242238698099, "grad_norm": 7.125, "learning_rate": 4.884290210716956e-05, "loss": 0.6571524620056153, "mean_token_accuracy": 0.8414820030331611, "num_tokens": 14085665.0, "step": 6890 }, { "entropy": 0.6176325906068086, "epoch": 0.11206483519160651, "grad_norm": 7.125, "learning_rate": 4.883899980613027e-05, "loss": 0.593321704864502, "mean_token_accuracy": 0.8552440814673901, "num_tokens": 14106260.0, "step": 6900 }, { "entropy": 0.6730373224243522, "epoch": 0.11222724799623203, "grad_norm": 6.21875, "learning_rate": 4.8835091092346464e-05, "loss": 0.6489469051361084, "mean_token_accuracy": 0.8356033369898797, "num_tokens": 14126429.0, "step": 6910 }, { "entropy": 0.6162665181793272, "epoch": 0.11238966080085754, "grad_norm": 7.90625, "learning_rate": 4.883117596686958e-05, "loss": 0.6322609424591065, "mean_token_accuracy": 0.8343748074024916, "num_tokens": 14145408.0, "step": 6920 }, { "entropy": 0.5378955965861678, "epoch": 0.11255207360548306, "grad_norm": 7.375, "learning_rate": 4.882725443075281e-05, "loss": 0.5281177043914795, "mean_token_accuracy": 0.8669402003288269, "num_tokens": 14164958.0, "step": 6930 }, { "entropy": 0.6279783669859171, "epoch": 0.11271448641010857, "grad_norm": 10.75, "learning_rate": 4.882332648505105e-05, "loss": 0.7311088562011718, "mean_token_accuracy": 0.8274219367653132, "num_tokens": 14185423.0, "step": 6940 }, { "entropy": 0.659845559950918, "epoch": 0.1128768992147341, "grad_norm": 8.1875, "learning_rate": 4.8819392130820925e-05, "loss": 0.6503970623016357, "mean_token_accuracy": 0.8358858600258827, "num_tokens": 14206347.0, "step": 6950 }, { "entropy": 0.6662270731292665, "epoch": 0.1130393120193596, "grad_norm": 9.6875, "learning_rate": 4.8815451369120776e-05, "loss": 0.6333790302276612, "mean_token_accuracy": 0.8423026278614998, "num_tokens": 14226947.0, "step": 6960 }, { "entropy": 0.6885839609894902, "epoch": 0.11320172482398512, "grad_norm": 8.5625, "learning_rate": 4.8811504201010706e-05, "loss": 0.7121707916259765, "mean_token_accuracy": 0.8277998588979244, "num_tokens": 14246980.0, "step": 6970 }, { "entropy": 0.7000529564917087, "epoch": 0.11336413762861064, "grad_norm": 6.875, "learning_rate": 4.880755062755248e-05, "loss": 0.6723496913909912, "mean_token_accuracy": 0.832783379778266, "num_tokens": 14268163.0, "step": 6980 }, { "entropy": 0.583333833143115, "epoch": 0.11352655043323616, "grad_norm": 6.90625, "learning_rate": 4.8803590649809634e-05, "loss": 0.5970757007598877, "mean_token_accuracy": 0.8468028523027897, "num_tokens": 14288440.0, "step": 6990 }, { "entropy": 0.6454388303682208, "epoch": 0.11368896323786168, "grad_norm": 6.84375, "learning_rate": 4.87996242688474e-05, "loss": 0.6254180431365967, "mean_token_accuracy": 0.8469494134187698, "num_tokens": 14309122.0, "step": 7000 }, { "entropy": 0.6867518450133503, "epoch": 0.11385137604248718, "grad_norm": 8.875, "learning_rate": 4.879565148573276e-05, "loss": 0.7179302215576172, "mean_token_accuracy": 0.8309253677725792, "num_tokens": 14329578.0, "step": 7010 }, { "entropy": 0.5841545347124338, "epoch": 0.1140137888471127, "grad_norm": 11.5, "learning_rate": 4.87916723015344e-05, "loss": 0.559435510635376, "mean_token_accuracy": 0.8564340442419052, "num_tokens": 14349107.0, "step": 7020 }, { "entropy": 0.6947998816147447, "epoch": 0.11417620165173822, "grad_norm": 9.4375, "learning_rate": 4.878768671732271e-05, "loss": 0.6578237056732178, "mean_token_accuracy": 0.8378112848848105, "num_tokens": 14370523.0, "step": 7030 }, { "entropy": 0.6449729646556079, "epoch": 0.11433861445636374, "grad_norm": 7.84375, "learning_rate": 4.878369473416984e-05, "loss": 0.7106992244720459, "mean_token_accuracy": 0.8284663043916225, "num_tokens": 14391019.0, "step": 7040 }, { "entropy": 0.5898728968575597, "epoch": 0.11450102726098926, "grad_norm": 9.1875, "learning_rate": 4.877969635314963e-05, "loss": 0.6204934597015381, "mean_token_accuracy": 0.8463316172361374, "num_tokens": 14410755.0, "step": 7050 }, { "entropy": 0.7000406663864851, "epoch": 0.11466344006561477, "grad_norm": 10.0, "learning_rate": 4.8775691575337666e-05, "loss": 0.6957732677459717, "mean_token_accuracy": 0.8246676102280617, "num_tokens": 14431723.0, "step": 7060 }, { "entropy": 0.6235147194005549, "epoch": 0.11482585287024029, "grad_norm": 9.25, "learning_rate": 4.877168040181124e-05, "loss": 0.6475462436676025, "mean_token_accuracy": 0.8401832170784473, "num_tokens": 14451231.0, "step": 7070 }, { "entropy": 0.6663553392514586, "epoch": 0.11498826567486581, "grad_norm": 5.40625, "learning_rate": 4.876766283364935e-05, "loss": 0.6326309204101562, "mean_token_accuracy": 0.8428232319653034, "num_tokens": 14473701.0, "step": 7080 }, { "entropy": 0.6804873918183147, "epoch": 0.11515067847949133, "grad_norm": 9.75, "learning_rate": 4.876363887193275e-05, "loss": 0.7120452880859375, "mean_token_accuracy": 0.8237445276230574, "num_tokens": 14493949.0, "step": 7090 }, { "entropy": 0.6549240319058299, "epoch": 0.11531309128411683, "grad_norm": 9.6875, "learning_rate": 4.875960851774388e-05, "loss": 0.6439688205718994, "mean_token_accuracy": 0.839663740992546, "num_tokens": 14514394.0, "step": 7100 }, { "entropy": 0.6700948871672153, "epoch": 0.11547550408874235, "grad_norm": 6.625, "learning_rate": 4.875557177216693e-05, "loss": 0.7211855411529541, "mean_token_accuracy": 0.8280825346708298, "num_tokens": 14535955.0, "step": 7110 }, { "entropy": 0.6330760207027197, "epoch": 0.11563791689336787, "grad_norm": 8.8125, "learning_rate": 4.875152863628779e-05, "loss": 0.6327279567718506, "mean_token_accuracy": 0.8427125945687294, "num_tokens": 14554819.0, "step": 7120 }, { "entropy": 0.6690751980990172, "epoch": 0.11580032969799339, "grad_norm": 9.5, "learning_rate": 4.8747479111194063e-05, "loss": 0.6943010330200196, "mean_token_accuracy": 0.8277784004807472, "num_tokens": 14574662.0, "step": 7130 }, { "entropy": 0.6235324409790337, "epoch": 0.11596274250261891, "grad_norm": 7.6875, "learning_rate": 4.874342319797509e-05, "loss": 0.6451843738555908, "mean_token_accuracy": 0.8397147111594677, "num_tokens": 14593859.0, "step": 7140 }, { "entropy": 0.6349905861541629, "epoch": 0.11612515530724442, "grad_norm": 6.84375, "learning_rate": 4.8739360897721906e-05, "loss": 0.6042563438415527, "mean_token_accuracy": 0.8480540368705988, "num_tokens": 14615210.0, "step": 7150 }, { "entropy": 0.6056862762197852, "epoch": 0.11628756811186994, "grad_norm": 6.875, "learning_rate": 4.87352922115273e-05, "loss": 0.5884300231933594, "mean_token_accuracy": 0.8559227049350738, "num_tokens": 14635612.0, "step": 7160 }, { "entropy": 0.6033580385148525, "epoch": 0.11644998091649546, "grad_norm": 7.125, "learning_rate": 4.873121714048574e-05, "loss": 0.6091251850128174, "mean_token_accuracy": 0.8353392295539379, "num_tokens": 14655003.0, "step": 7170 }, { "entropy": 0.6596353005617857, "epoch": 0.11661239372112098, "grad_norm": 6.25, "learning_rate": 4.872713568569345e-05, "loss": 0.6886902332305909, "mean_token_accuracy": 0.8290299266576767, "num_tokens": 14675284.0, "step": 7180 }, { "entropy": 0.5943818567320704, "epoch": 0.1167748065257465, "grad_norm": 11.4375, "learning_rate": 4.872304784824833e-05, "loss": 0.6276145458221436, "mean_token_accuracy": 0.8399595737457275, "num_tokens": 14695261.0, "step": 7190 }, { "entropy": 0.5994626818224787, "epoch": 0.116937219330372, "grad_norm": 12.375, "learning_rate": 4.871895362925002e-05, "loss": 0.6485479354858399, "mean_token_accuracy": 0.8366317495703697, "num_tokens": 14716642.0, "step": 7200 }, { "entropy": 0.6693848886527121, "epoch": 0.11709963213499752, "grad_norm": 7.09375, "learning_rate": 4.871485302979988e-05, "loss": 0.7286888599395752, "mean_token_accuracy": 0.8176114059984684, "num_tokens": 14736843.0, "step": 7210 }, { "entropy": 0.6585784211754799, "epoch": 0.11726204493962304, "grad_norm": 5.9375, "learning_rate": 4.871074605100098e-05, "loss": 0.6013680458068847, "mean_token_accuracy": 0.8484255261719227, "num_tokens": 14758963.0, "step": 7220 }, { "entropy": 0.5930521002039313, "epoch": 0.11742445774424856, "grad_norm": 7.8125, "learning_rate": 4.87066326939581e-05, "loss": 0.5705056190490723, "mean_token_accuracy": 0.8507889948785305, "num_tokens": 14779682.0, "step": 7230 }, { "entropy": 0.585646181087941, "epoch": 0.11758687054887407, "grad_norm": 8.3125, "learning_rate": 4.870251295977776e-05, "loss": 0.5886154651641846, "mean_token_accuracy": 0.8511557713150978, "num_tokens": 14799732.0, "step": 7240 }, { "entropy": 0.556627737544477, "epoch": 0.11774928335349959, "grad_norm": 9.125, "learning_rate": 4.8698386849568154e-05, "loss": 0.5919708251953125, "mean_token_accuracy": 0.8468708410859108, "num_tokens": 14818347.0, "step": 7250 }, { "entropy": 0.5633593716658651, "epoch": 0.1179116961581251, "grad_norm": 8.375, "learning_rate": 4.869425436443924e-05, "loss": 0.6168779850006103, "mean_token_accuracy": 0.8454789571464062, "num_tokens": 14838085.0, "step": 7260 }, { "entropy": 0.6732808827189729, "epoch": 0.11807410896275063, "grad_norm": 9.4375, "learning_rate": 4.869011550550264e-05, "loss": 0.7014983654022217, "mean_token_accuracy": 0.830406354367733, "num_tokens": 14859088.0, "step": 7270 }, { "entropy": 0.5778659253381193, "epoch": 0.11823652176737615, "grad_norm": 6.625, "learning_rate": 4.868597027387174e-05, "loss": 0.5551287651062011, "mean_token_accuracy": 0.8569247588515282, "num_tokens": 14879448.0, "step": 7280 }, { "entropy": 0.6157184482552112, "epoch": 0.11839893457200165, "grad_norm": 12.25, "learning_rate": 4.8681818670661593e-05, "loss": 0.6244954586029052, "mean_token_accuracy": 0.8459557637572288, "num_tokens": 14900882.0, "step": 7290 }, { "entropy": 0.6667919580824673, "epoch": 0.11856134737662717, "grad_norm": 7.0625, "learning_rate": 4.8677660696989016e-05, "loss": 0.6828048706054688, "mean_token_accuracy": 0.8306096665561199, "num_tokens": 14921907.0, "step": 7300 }, { "entropy": 0.7016960868611932, "epoch": 0.11872376018125269, "grad_norm": 7.34375, "learning_rate": 4.867349635397248e-05, "loss": 0.716359806060791, "mean_token_accuracy": 0.8232195496559143, "num_tokens": 14942105.0, "step": 7310 }, { "entropy": 0.6506758023053407, "epoch": 0.11888617298587821, "grad_norm": 6.5625, "learning_rate": 4.8669325642732246e-05, "loss": 0.6265828132629394, "mean_token_accuracy": 0.8364840589463711, "num_tokens": 14962347.0, "step": 7320 }, { "entropy": 0.6793728331103921, "epoch": 0.11904858579050372, "grad_norm": 10.8125, "learning_rate": 4.86651485643902e-05, "loss": 0.6768495082855225, "mean_token_accuracy": 0.8394718952476978, "num_tokens": 14982923.0, "step": 7330 }, { "entropy": 0.6176534604281188, "epoch": 0.11921099859512924, "grad_norm": 8.875, "learning_rate": 4.8660965120070015e-05, "loss": 0.6288275241851806, "mean_token_accuracy": 0.8474026873707772, "num_tokens": 15003266.0, "step": 7340 }, { "entropy": 0.5955722751095891, "epoch": 0.11937341139975476, "grad_norm": 8.1875, "learning_rate": 4.865677531089704e-05, "loss": 0.6159415721893311, "mean_token_accuracy": 0.856735248491168, "num_tokens": 15023046.0, "step": 7350 }, { "entropy": 0.5504735384136439, "epoch": 0.11953582420438028, "grad_norm": 10.8125, "learning_rate": 4.865257913799834e-05, "loss": 0.5912277698516846, "mean_token_accuracy": 0.8499266438186168, "num_tokens": 15043325.0, "step": 7360 }, { "entropy": 0.6680921972263605, "epoch": 0.1196982370090058, "grad_norm": 7.71875, "learning_rate": 4.8648376602502695e-05, "loss": 0.6677202701568603, "mean_token_accuracy": 0.8364586301147938, "num_tokens": 15063912.0, "step": 7370 }, { "entropy": 0.6183457057923079, "epoch": 0.1198606498136313, "grad_norm": 9.5625, "learning_rate": 4.8644167705540593e-05, "loss": 0.6339645385742188, "mean_token_accuracy": 0.8400274563580752, "num_tokens": 15083557.0, "step": 7380 }, { "entropy": 0.6802886843681335, "epoch": 0.12002306261825682, "grad_norm": 8.5, "learning_rate": 4.863995244824425e-05, "loss": 0.6425731182098389, "mean_token_accuracy": 0.8400769006460905, "num_tokens": 15103372.0, "step": 7390 }, { "entropy": 0.610713183064945, "epoch": 0.12018547542288234, "grad_norm": 6.0625, "learning_rate": 4.863573083174756e-05, "loss": 0.604921531677246, "mean_token_accuracy": 0.8408932879567146, "num_tokens": 15124074.0, "step": 7400 }, { "entropy": 0.6164196205325425, "epoch": 0.12034788822750786, "grad_norm": 6.375, "learning_rate": 4.8631502857186164e-05, "loss": 0.583981704711914, "mean_token_accuracy": 0.8540714737027884, "num_tokens": 15144951.0, "step": 7410 }, { "entropy": 0.6007607446517795, "epoch": 0.12051030103213338, "grad_norm": 8.75, "learning_rate": 4.86272685256974e-05, "loss": 0.6579561710357666, "mean_token_accuracy": 0.8367973990738392, "num_tokens": 15166024.0, "step": 7420 }, { "entropy": 0.640202040784061, "epoch": 0.12067271383675889, "grad_norm": 5.875, "learning_rate": 4.862302783842029e-05, "loss": 0.6547267436981201, "mean_token_accuracy": 0.843694356828928, "num_tokens": 15186140.0, "step": 7430 }, { "entropy": 0.6304908854886889, "epoch": 0.1208351266413844, "grad_norm": 10.0, "learning_rate": 4.861878079649561e-05, "loss": 0.6184782981872559, "mean_token_accuracy": 0.8437280673533678, "num_tokens": 15206838.0, "step": 7440 }, { "entropy": 0.567953909188509, "epoch": 0.12099753944600992, "grad_norm": 10.5625, "learning_rate": 4.861452740106581e-05, "loss": 0.581709623336792, "mean_token_accuracy": 0.8579314887523651, "num_tokens": 15226190.0, "step": 7450 }, { "entropy": 0.560838807746768, "epoch": 0.12115995225063544, "grad_norm": 6.28125, "learning_rate": 4.8610267653275076e-05, "loss": 0.5765435695648193, "mean_token_accuracy": 0.8543419755995274, "num_tokens": 15246656.0, "step": 7460 }, { "entropy": 0.6734841542318464, "epoch": 0.12132236505526095, "grad_norm": 10.0, "learning_rate": 4.8606001554269275e-05, "loss": 0.6710083961486817, "mean_token_accuracy": 0.841570220515132, "num_tokens": 15268922.0, "step": 7470 }, { "entropy": 0.6127755543217063, "epoch": 0.12148477785988647, "grad_norm": 9.0625, "learning_rate": 4.860172910519601e-05, "loss": 0.6012803077697754, "mean_token_accuracy": 0.8373278252780437, "num_tokens": 15289142.0, "step": 7480 }, { "entropy": 0.5476171324029565, "epoch": 0.12164719066451199, "grad_norm": 6.75, "learning_rate": 4.859745030720457e-05, "loss": 0.5680364608764649, "mean_token_accuracy": 0.8531597897410392, "num_tokens": 15309367.0, "step": 7490 }, { "entropy": 0.6312498510349542, "epoch": 0.12180960346913751, "grad_norm": 11.5, "learning_rate": 4.859316516144597e-05, "loss": 0.6221071720123291, "mean_token_accuracy": 0.8452431313693524, "num_tokens": 15329615.0, "step": 7500 }, { "entropy": 0.7319263068959116, "epoch": 0.12197201627376303, "grad_norm": 8.25, "learning_rate": 4.8588873669072915e-05, "loss": 0.7496577262878418, "mean_token_accuracy": 0.8232697162777185, "num_tokens": 15350838.0, "step": 7510 }, { "entropy": 0.5956805900670588, "epoch": 0.12213442907838853, "grad_norm": 9.125, "learning_rate": 4.858457583123983e-05, "loss": 0.6017590045928956, "mean_token_accuracy": 0.8455284662544728, "num_tokens": 15369977.0, "step": 7520 }, { "entropy": 0.6103997309692204, "epoch": 0.12229684188301405, "grad_norm": 6.5625, "learning_rate": 4.858027164910285e-05, "loss": 0.5640773773193359, "mean_token_accuracy": 0.8637897662818432, "num_tokens": 15389758.0, "step": 7530 }, { "entropy": 0.5763955962378532, "epoch": 0.12245925468763957, "grad_norm": 8.0625, "learning_rate": 4.8575961123819795e-05, "loss": 0.5918526172637939, "mean_token_accuracy": 0.8524938590824604, "num_tokens": 15411488.0, "step": 7540 }, { "entropy": 0.5492710906080902, "epoch": 0.1226216674922651, "grad_norm": 7.5, "learning_rate": 4.857164425655022e-05, "loss": 0.6020978450775146, "mean_token_accuracy": 0.8505723290145397, "num_tokens": 15431645.0, "step": 7550 }, { "entropy": 0.6210299440659582, "epoch": 0.12278408029689061, "grad_norm": 7.34375, "learning_rate": 4.856732104845536e-05, "loss": 0.6359973907470703, "mean_token_accuracy": 0.8416826289147139, "num_tokens": 15451539.0, "step": 7560 }, { "entropy": 0.6309370721690357, "epoch": 0.12294649310151612, "grad_norm": 7.84375, "learning_rate": 4.856299150069818e-05, "loss": 0.6386836051940918, "mean_token_accuracy": 0.8368857085704804, "num_tokens": 15472379.0, "step": 7570 }, { "entropy": 0.6273793512955308, "epoch": 0.12310890590614164, "grad_norm": 7.40625, "learning_rate": 4.855865561444333e-05, "loss": 0.6163985252380371, "mean_token_accuracy": 0.847382290661335, "num_tokens": 15493319.0, "step": 7580 }, { "entropy": 0.6242604058235883, "epoch": 0.12327131871076716, "grad_norm": 7.625, "learning_rate": 4.855431339085717e-05, "loss": 0.6415502548217773, "mean_token_accuracy": 0.8408247478306293, "num_tokens": 15515465.0, "step": 7590 }, { "entropy": 0.5763382008764892, "epoch": 0.12343373151539268, "grad_norm": 8.1875, "learning_rate": 4.854996483110778e-05, "loss": 0.5750430583953857, "mean_token_accuracy": 0.8425360545516014, "num_tokens": 15535541.0, "step": 7600 }, { "entropy": 0.6822948658838868, "epoch": 0.12359614432001818, "grad_norm": 8.75, "learning_rate": 4.854560993636492e-05, "loss": 0.6955759048461914, "mean_token_accuracy": 0.8186479087918996, "num_tokens": 15556040.0, "step": 7610 }, { "entropy": 0.609074542298913, "epoch": 0.1237585571246437, "grad_norm": 10.625, "learning_rate": 4.854124870780008e-05, "loss": 0.6055562019348144, "mean_token_accuracy": 0.8485120698809624, "num_tokens": 15576238.0, "step": 7620 }, { "entropy": 0.6269749568775296, "epoch": 0.12392096992926922, "grad_norm": 7.4375, "learning_rate": 4.853688114658642e-05, "loss": 0.6646974086761475, "mean_token_accuracy": 0.8391705103218555, "num_tokens": 15596646.0, "step": 7630 }, { "entropy": 0.6298165768384933, "epoch": 0.12408338273389474, "grad_norm": 5.875, "learning_rate": 4.853250725389884e-05, "loss": 0.6116808891296387, "mean_token_accuracy": 0.8425516501069069, "num_tokens": 15617354.0, "step": 7640 }, { "entropy": 0.5775593463331461, "epoch": 0.12424579553852026, "grad_norm": 9.875, "learning_rate": 4.8528127030913925e-05, "loss": 0.6081920146942139, "mean_token_accuracy": 0.8469698771834373, "num_tokens": 15637242.0, "step": 7650 }, { "entropy": 0.6062617841176688, "epoch": 0.12440820834314577, "grad_norm": 6.5, "learning_rate": 4.8523740478809965e-05, "loss": 0.6285706520080566, "mean_token_accuracy": 0.8504937168210744, "num_tokens": 15657128.0, "step": 7660 }, { "entropy": 0.5479859788902104, "epoch": 0.12457062114777129, "grad_norm": 5.96875, "learning_rate": 4.851934759876694e-05, "loss": 0.5487621784210205, "mean_token_accuracy": 0.8601790960878134, "num_tokens": 15677076.0, "step": 7670 }, { "entropy": 0.6316460096044466, "epoch": 0.12473303395239681, "grad_norm": 11.25, "learning_rate": 4.8514948391966566e-05, "loss": 0.6669494152069092, "mean_token_accuracy": 0.8348216570913791, "num_tokens": 15698066.0, "step": 7680 }, { "entropy": 0.6628032744396478, "epoch": 0.12489544675702233, "grad_norm": 8.625, "learning_rate": 4.851054285959222e-05, "loss": 0.6674529552459717, "mean_token_accuracy": 0.8374891072511673, "num_tokens": 15718577.0, "step": 7690 }, { "entropy": 0.6248521354049444, "epoch": 0.12505785956164783, "grad_norm": 5.46875, "learning_rate": 4.850613100282901e-05, "loss": 0.6675062656402588, "mean_token_accuracy": 0.8277590230107308, "num_tokens": 15738470.0, "step": 7700 }, { "entropy": 0.6901901179924608, "epoch": 0.12522027236627337, "grad_norm": 6.6875, "learning_rate": 4.8501712822863746e-05, "loss": 0.6707696914672852, "mean_token_accuracy": 0.8383807621896266, "num_tokens": 15759479.0, "step": 7710 }, { "entropy": 0.5925189642235636, "epoch": 0.12538268517089887, "grad_norm": 9.0, "learning_rate": 4.84972883208849e-05, "loss": 0.5746827602386475, "mean_token_accuracy": 0.8556260541081429, "num_tokens": 15779705.0, "step": 7720 }, { "entropy": 0.6398994821123779, "epoch": 0.12554509797552438, "grad_norm": 6.5625, "learning_rate": 4.849285749808269e-05, "loss": 0.615979528427124, "mean_token_accuracy": 0.840717040002346, "num_tokens": 15800617.0, "step": 7730 }, { "entropy": 0.5638362001627684, "epoch": 0.1257075107801499, "grad_norm": 7.53125, "learning_rate": 4.8488420355649025e-05, "loss": 0.5557899475097656, "mean_token_accuracy": 0.863019373267889, "num_tokens": 15819646.0, "step": 7740 }, { "entropy": 0.6186658089514822, "epoch": 0.12586992358477542, "grad_norm": 9.6875, "learning_rate": 4.848397689477749e-05, "loss": 0.6154867649078369, "mean_token_accuracy": 0.8464500948786735, "num_tokens": 15840857.0, "step": 7750 }, { "entropy": 0.5703591752797366, "epoch": 0.12603233638940095, "grad_norm": 9.25, "learning_rate": 4.8479527116663396e-05, "loss": 0.5840265274047851, "mean_token_accuracy": 0.8546222925186158, "num_tokens": 15860373.0, "step": 7760 }, { "entropy": 0.6932855471968651, "epoch": 0.12619474919402646, "grad_norm": 7.4375, "learning_rate": 4.8475071022503734e-05, "loss": 0.6869179725646972, "mean_token_accuracy": 0.8237015314400196, "num_tokens": 15880774.0, "step": 7770 }, { "entropy": 0.6024833154398948, "epoch": 0.12635716199865196, "grad_norm": 7.28125, "learning_rate": 4.847060861349722e-05, "loss": 0.6251701831817627, "mean_token_accuracy": 0.8417396977543831, "num_tokens": 15901455.0, "step": 7780 }, { "entropy": 0.6365250603761524, "epoch": 0.1265195748032775, "grad_norm": 7.4375, "learning_rate": 4.8466139890844236e-05, "loss": 0.6903351306915283, "mean_token_accuracy": 0.8256426963955164, "num_tokens": 15923308.0, "step": 7790 }, { "entropy": 0.5827832067385316, "epoch": 0.126681987607903, "grad_norm": 7.71875, "learning_rate": 4.846166485574689e-05, "loss": 0.5857896327972412, "mean_token_accuracy": 0.8434395104646683, "num_tokens": 15943225.0, "step": 7800 }, { "entropy": 0.6343667877838015, "epoch": 0.12684440041252854, "grad_norm": 8.0625, "learning_rate": 4.845718350940896e-05, "loss": 0.580354642868042, "mean_token_accuracy": 0.8512080490589142, "num_tokens": 15963343.0, "step": 7810 }, { "entropy": 0.6492784551344812, "epoch": 0.12700681321715404, "grad_norm": 7.4375, "learning_rate": 4.845269585303596e-05, "loss": 0.630829906463623, "mean_token_accuracy": 0.8393112353980541, "num_tokens": 15984076.0, "step": 7820 }, { "entropy": 0.6305854475125671, "epoch": 0.12716922602177955, "grad_norm": 7.5, "learning_rate": 4.8448201887835064e-05, "loss": 0.6465327739715576, "mean_token_accuracy": 0.835585230588913, "num_tokens": 16004111.0, "step": 7830 }, { "entropy": 0.5650284240022302, "epoch": 0.12733163882640508, "grad_norm": 7.6875, "learning_rate": 4.844370161501517e-05, "loss": 0.5929896831512451, "mean_token_accuracy": 0.8557569023221732, "num_tokens": 16023767.0, "step": 7840 }, { "entropy": 0.6274729921482504, "epoch": 0.12749405163103059, "grad_norm": 7.59375, "learning_rate": 4.843919503578685e-05, "loss": 0.6637857913970947, "mean_token_accuracy": 0.834445309638977, "num_tokens": 16044399.0, "step": 7850 }, { "entropy": 0.6519081751815975, "epoch": 0.12765646443565612, "grad_norm": 8.375, "learning_rate": 4.8434682151362385e-05, "loss": 0.6519596099853515, "mean_token_accuracy": 0.8383948385715485, "num_tokens": 16064677.0, "step": 7860 }, { "entropy": 0.6375115774571896, "epoch": 0.12781887724028163, "grad_norm": 5.71875, "learning_rate": 4.843016296295576e-05, "loss": 0.6133630275726318, "mean_token_accuracy": 0.8395615514367819, "num_tokens": 16085253.0, "step": 7870 }, { "entropy": 0.5950665302574635, "epoch": 0.12798129004490713, "grad_norm": 12.625, "learning_rate": 4.842563747178265e-05, "loss": 0.600170373916626, "mean_token_accuracy": 0.8479973211884498, "num_tokens": 16104421.0, "step": 7880 }, { "entropy": 0.6079981143586337, "epoch": 0.12814370284953266, "grad_norm": 8.0, "learning_rate": 4.84211056790604e-05, "loss": 0.6188004970550537, "mean_token_accuracy": 0.844696868211031, "num_tokens": 16125818.0, "step": 7890 }, { "entropy": 0.6150463140569628, "epoch": 0.12830611565415817, "grad_norm": 6.09375, "learning_rate": 4.841656758600809e-05, "loss": 0.6155622482299805, "mean_token_accuracy": 0.848316814750433, "num_tokens": 16146289.0, "step": 7900 }, { "entropy": 0.6402594113722444, "epoch": 0.1284685284587837, "grad_norm": 7.4375, "learning_rate": 4.841202319384648e-05, "loss": 0.6352404117584228, "mean_token_accuracy": 0.8428412113338709, "num_tokens": 16168690.0, "step": 7910 }, { "entropy": 0.6167690481990575, "epoch": 0.1286309412634092, "grad_norm": 17.0, "learning_rate": 4.840747250379801e-05, "loss": 0.6364299297332764, "mean_token_accuracy": 0.8411181882023812, "num_tokens": 16189736.0, "step": 7920 }, { "entropy": 0.6205445756204426, "epoch": 0.12879335406803472, "grad_norm": 6.875, "learning_rate": 4.840291551708684e-05, "loss": 0.6238097667694091, "mean_token_accuracy": 0.8449044957756996, "num_tokens": 16210965.0, "step": 7930 }, { "entropy": 0.5817910208366811, "epoch": 0.12895576687266025, "grad_norm": 8.875, "learning_rate": 4.8398352234938794e-05, "loss": 0.6258269309997558, "mean_token_accuracy": 0.8443170059472322, "num_tokens": 16230942.0, "step": 7940 }, { "entropy": 0.578250830154866, "epoch": 0.12911817967728575, "grad_norm": 7.9375, "learning_rate": 4.839378265858141e-05, "loss": 0.5993615627288819, "mean_token_accuracy": 0.8485110260546207, "num_tokens": 16251667.0, "step": 7950 }, { "entropy": 0.6684277079999447, "epoch": 0.12928059248191126, "grad_norm": 8.375, "learning_rate": 4.8389206789243925e-05, "loss": 0.6276770114898682, "mean_token_accuracy": 0.8393541127443314, "num_tokens": 16272430.0, "step": 7960 }, { "entropy": 0.5910617119632662, "epoch": 0.1294430052865368, "grad_norm": 7.5625, "learning_rate": 4.838462462815724e-05, "loss": 0.5928113460540771, "mean_token_accuracy": 0.8496321134269238, "num_tokens": 16292443.0, "step": 7970 }, { "entropy": 0.6718311110511422, "epoch": 0.1296054180911623, "grad_norm": 8.9375, "learning_rate": 4.8380036176553975e-05, "loss": 0.6581284523010253, "mean_token_accuracy": 0.8403376929461956, "num_tokens": 16313001.0, "step": 7980 }, { "entropy": 0.6199390255846083, "epoch": 0.12976783089578783, "grad_norm": 10.375, "learning_rate": 4.8375441435668445e-05, "loss": 0.6699905395507812, "mean_token_accuracy": 0.8359346866607666, "num_tokens": 16333028.0, "step": 7990 }, { "epoch": 0.12993024370041334, "eval_entropy": 0.6512044446468354, "eval_loss": 0.6597878336906433, "eval_mean_token_accuracy": 0.8333811078071595, "eval_num_tokens": 16353816.0, "eval_runtime": 40.1175, "eval_samples_per_second": 49.854, "eval_steps_per_second": 6.232, "step": 8000 }, { "entropy": 0.6002837738138623, "epoch": 0.13009265650503885, "grad_norm": 7.65625, "learning_rate": 4.836623309099623e-05, "loss": 0.6236101150512695, "mean_token_accuracy": 0.8401299823075533, "num_tokens": 16374463.0, "step": 8010 }, { "entropy": 0.6160245701670647, "epoch": 0.13025506930966438, "grad_norm": 7.6875, "learning_rate": 4.8361619489686606e-05, "loss": 0.6124776363372803, "mean_token_accuracy": 0.841727401316166, "num_tokens": 16395242.0, "step": 8020 }, { "entropy": 0.6377709816209972, "epoch": 0.13041748211428988, "grad_norm": 6.53125, "learning_rate": 4.835699960404885e-05, "loss": 0.6485124588012695, "mean_token_accuracy": 0.8398052036762238, "num_tokens": 16416702.0, "step": 8030 }, { "entropy": 0.6418528018519283, "epoch": 0.13057989491891542, "grad_norm": 6.65625, "learning_rate": 4.835237343532569e-05, "loss": 0.665829086303711, "mean_token_accuracy": 0.8453404977917671, "num_tokens": 16438032.0, "step": 8040 }, { "entropy": 0.586878748331219, "epoch": 0.13074230772354092, "grad_norm": 6.40625, "learning_rate": 4.8347740984761616e-05, "loss": 0.5672257423400879, "mean_token_accuracy": 0.8515409275889396, "num_tokens": 16457970.0, "step": 8050 }, { "entropy": 0.6691286198794841, "epoch": 0.13090472052816643, "grad_norm": 7.90625, "learning_rate": 4.8343102253602735e-05, "loss": 0.7103353977203369, "mean_token_accuracy": 0.8292105980217457, "num_tokens": 16479122.0, "step": 8060 }, { "entropy": 0.6820785360410809, "epoch": 0.13106713333279196, "grad_norm": 10.6875, "learning_rate": 4.8338457243096884e-05, "loss": 0.6687970161437988, "mean_token_accuracy": 0.8260152503848076, "num_tokens": 16498423.0, "step": 8070 }, { "entropy": 0.6616665316745639, "epoch": 0.13122954613741747, "grad_norm": 11.0625, "learning_rate": 4.833380595449359e-05, "loss": 0.6667894840240478, "mean_token_accuracy": 0.8441867493093014, "num_tokens": 16519794.0, "step": 8080 }, { "entropy": 0.6193872195668518, "epoch": 0.131391958942043, "grad_norm": 8.5, "learning_rate": 4.832914838904405e-05, "loss": 0.5703090190887451, "mean_token_accuracy": 0.8525636248290539, "num_tokens": 16538888.0, "step": 8090 }, { "entropy": 0.6712438145652413, "epoch": 0.1315543717466685, "grad_norm": 12.375, "learning_rate": 4.832448454800117e-05, "loss": 0.7059022426605225, "mean_token_accuracy": 0.8354361575096846, "num_tokens": 16558517.0, "step": 8100 }, { "entropy": 0.6247339708730578, "epoch": 0.131716784551294, "grad_norm": 8.3125, "learning_rate": 4.8319814432619526e-05, "loss": 0.6660276412963867, "mean_token_accuracy": 0.8404201753437519, "num_tokens": 16577964.0, "step": 8110 }, { "entropy": 0.6482763753272593, "epoch": 0.13187919735591955, "grad_norm": 6.75, "learning_rate": 4.831513804415539e-05, "loss": 0.6290378570556641, "mean_token_accuracy": 0.8450009893625975, "num_tokens": 16598015.0, "step": 8120 }, { "entropy": 0.5352983921766281, "epoch": 0.13204161016054505, "grad_norm": 7.5625, "learning_rate": 4.8310455383866734e-05, "loss": 0.5190680503845215, "mean_token_accuracy": 0.8622370228171349, "num_tokens": 16618662.0, "step": 8130 }, { "entropy": 0.5972808548249304, "epoch": 0.1322040229651706, "grad_norm": 10.4375, "learning_rate": 4.830576645301318e-05, "loss": 0.6521633625030517, "mean_token_accuracy": 0.83751914575696, "num_tokens": 16639387.0, "step": 8140 }, { "entropy": 0.5835219390690327, "epoch": 0.1323664357697961, "grad_norm": 4.96875, "learning_rate": 4.830107125285608e-05, "loss": 0.6134262084960938, "mean_token_accuracy": 0.8468405909836292, "num_tokens": 16660264.0, "step": 8150 }, { "entropy": 0.6249120375141501, "epoch": 0.1325288485744216, "grad_norm": 9.125, "learning_rate": 4.829636978465844e-05, "loss": 0.6265413761138916, "mean_token_accuracy": 0.8365109220147133, "num_tokens": 16680610.0, "step": 8160 }, { "entropy": 0.6322290762327611, "epoch": 0.13269126137904713, "grad_norm": 6.75, "learning_rate": 4.829166204968498e-05, "loss": 0.596568489074707, "mean_token_accuracy": 0.8476288914680481, "num_tokens": 16701930.0, "step": 8170 }, { "entropy": 0.5928081708028913, "epoch": 0.13285367418367264, "grad_norm": 7.3125, "learning_rate": 4.828694804920208e-05, "loss": 0.646027660369873, "mean_token_accuracy": 0.8451593883335591, "num_tokens": 16722190.0, "step": 8180 }, { "entropy": 0.6093266423791647, "epoch": 0.13301608698829817, "grad_norm": 6.15625, "learning_rate": 4.828222778447782e-05, "loss": 0.6057221412658691, "mean_token_accuracy": 0.8497763186693191, "num_tokens": 16742276.0, "step": 8190 }, { "entropy": 0.6136107521131635, "epoch": 0.13317849979292368, "grad_norm": 7.625, "learning_rate": 4.8277501256781964e-05, "loss": 0.5997648715972901, "mean_token_accuracy": 0.8429534651339055, "num_tokens": 16763073.0, "step": 8200 }, { "entropy": 0.608992308191955, "epoch": 0.13334091259754918, "grad_norm": 8.5625, "learning_rate": 4.827276846738596e-05, "loss": 0.6207221984863281, "mean_token_accuracy": 0.8499386459589005, "num_tokens": 16782752.0, "step": 8210 }, { "entropy": 0.6417168821208179, "epoch": 0.13350332540217472, "grad_norm": 7.75, "learning_rate": 4.8268029417562935e-05, "loss": 0.6070938587188721, "mean_token_accuracy": 0.8402719169855117, "num_tokens": 16801792.0, "step": 8220 }, { "entropy": 0.6015859568491578, "epoch": 0.13366573820680022, "grad_norm": 7.5, "learning_rate": 4.82632841085877e-05, "loss": 0.6316658020019531, "mean_token_accuracy": 0.8397339679300785, "num_tokens": 16821149.0, "step": 8230 }, { "entropy": 0.632970084855333, "epoch": 0.13382815101142573, "grad_norm": 4.875, "learning_rate": 4.825853254173675e-05, "loss": 0.6383554935455322, "mean_token_accuracy": 0.8498728990554809, "num_tokens": 16840958.0, "step": 8240 }, { "entropy": 0.6239515744149685, "epoch": 0.13399056381605126, "grad_norm": 8.6875, "learning_rate": 4.8253774718288294e-05, "loss": 0.6052073955535888, "mean_token_accuracy": 0.8569794990122318, "num_tokens": 16861430.0, "step": 8250 }, { "entropy": 0.6152473001740872, "epoch": 0.13415297662067677, "grad_norm": 9.75, "learning_rate": 4.824901063952217e-05, "loss": 0.6460752964019776, "mean_token_accuracy": 0.8433881383389235, "num_tokens": 16881447.0, "step": 8260 }, { "entropy": 0.647532626800239, "epoch": 0.1343153894253023, "grad_norm": 8.6875, "learning_rate": 4.8244240306719945e-05, "loss": 0.707727575302124, "mean_token_accuracy": 0.827545964717865, "num_tokens": 16901273.0, "step": 8270 }, { "entropy": 0.6197872122749686, "epoch": 0.1344778022299278, "grad_norm": 8.5625, "learning_rate": 4.823946372116484e-05, "loss": 0.5668740749359131, "mean_token_accuracy": 0.849470553547144, "num_tokens": 16922359.0, "step": 8280 }, { "entropy": 0.5717398472130298, "epoch": 0.1346402150345533, "grad_norm": 11.6875, "learning_rate": 4.8234680884141745e-05, "loss": 0.5939699172973633, "mean_token_accuracy": 0.8414655283093453, "num_tokens": 16942434.0, "step": 8290 }, { "entropy": 0.6043474021367728, "epoch": 0.13480262783917885, "grad_norm": 8.9375, "learning_rate": 4.82298917969373e-05, "loss": 0.5975978374481201, "mean_token_accuracy": 0.8487195003777742, "num_tokens": 16964170.0, "step": 8300 }, { "entropy": 0.58698799489066, "epoch": 0.13496504064380435, "grad_norm": 11.125, "learning_rate": 4.822509646083974e-05, "loss": 0.6196430683135986, "mean_token_accuracy": 0.850944322347641, "num_tokens": 16985103.0, "step": 8310 }, { "entropy": 0.6047907034866512, "epoch": 0.13512745344842989, "grad_norm": 8.25, "learning_rate": 4.822029487713904e-05, "loss": 0.6213749408721924, "mean_token_accuracy": 0.8484115842729807, "num_tokens": 17004827.0, "step": 8320 }, { "entropy": 0.6345514814369381, "epoch": 0.1352898662530554, "grad_norm": 9.5, "learning_rate": 4.821548704712684e-05, "loss": 0.6249322891235352, "mean_token_accuracy": 0.8428008608520031, "num_tokens": 17025021.0, "step": 8330 }, { "entropy": 0.5765104973688722, "epoch": 0.1354522790576809, "grad_norm": 7.59375, "learning_rate": 4.8210672972096446e-05, "loss": 0.5767984390258789, "mean_token_accuracy": 0.8518035106360913, "num_tokens": 17044124.0, "step": 8340 }, { "entropy": 0.5617858508601785, "epoch": 0.13561469186230643, "grad_norm": 7.71875, "learning_rate": 4.820585265334286e-05, "loss": 0.5512345790863037, "mean_token_accuracy": 0.8665278743952513, "num_tokens": 17065164.0, "step": 8350 }, { "entropy": 0.7074656657874584, "epoch": 0.13577710466693194, "grad_norm": 6.15625, "learning_rate": 4.820102609216276e-05, "loss": 0.7114555358886718, "mean_token_accuracy": 0.8246616054326296, "num_tokens": 17085388.0, "step": 8360 }, { "entropy": 0.5556575623340905, "epoch": 0.13593951747155747, "grad_norm": 9.8125, "learning_rate": 4.81961932898545e-05, "loss": 0.5528528213500976, "mean_token_accuracy": 0.8575867399573326, "num_tokens": 17105465.0, "step": 8370 }, { "entropy": 0.5605721755884587, "epoch": 0.13610193027618298, "grad_norm": 10.6875, "learning_rate": 4.8191354247718114e-05, "loss": 0.596155834197998, "mean_token_accuracy": 0.8503992758691311, "num_tokens": 17126407.0, "step": 8380 }, { "entropy": 0.5901248413138092, "epoch": 0.13626434308080848, "grad_norm": 9.4375, "learning_rate": 4.818650896705531e-05, "loss": 0.6547510623931885, "mean_token_accuracy": 0.8477352254092694, "num_tokens": 17147632.0, "step": 8390 }, { "entropy": 0.6591494657099247, "epoch": 0.13642675588543401, "grad_norm": 5.4375, "learning_rate": 4.818165744916949e-05, "loss": 0.6659523963928222, "mean_token_accuracy": 0.8445221774280072, "num_tokens": 17168117.0, "step": 8400 }, { "entropy": 0.672949877474457, "epoch": 0.13658916869005952, "grad_norm": 7.90625, "learning_rate": 4.817679969536572e-05, "loss": 0.6292330741882324, "mean_token_accuracy": 0.8421241238713264, "num_tokens": 17189327.0, "step": 8410 }, { "entropy": 0.6465920623391866, "epoch": 0.13675158149468505, "grad_norm": 5.34375, "learning_rate": 4.817193570695074e-05, "loss": 0.6280487060546875, "mean_token_accuracy": 0.8433338016271591, "num_tokens": 17211229.0, "step": 8420 }, { "entropy": 0.647976403683424, "epoch": 0.13691399429931056, "grad_norm": 6.3125, "learning_rate": 4.8167065485232994e-05, "loss": 0.6501492500305176, "mean_token_accuracy": 0.8366633869707585, "num_tokens": 17232095.0, "step": 8430 }, { "entropy": 0.6474811005406081, "epoch": 0.13707640710393607, "grad_norm": 8.75, "learning_rate": 4.8162189031522556e-05, "loss": 0.662212610244751, "mean_token_accuracy": 0.8346234235912562, "num_tokens": 17252545.0, "step": 8440 }, { "entropy": 0.6744946873746812, "epoch": 0.1372388199085616, "grad_norm": 12.0625, "learning_rate": 4.8157306347131216e-05, "loss": 0.7001089572906494, "mean_token_accuracy": 0.8311279579997063, "num_tokens": 17272984.0, "step": 8450 }, { "entropy": 0.557199427112937, "epoch": 0.1374012327131871, "grad_norm": 8.375, "learning_rate": 4.8152417433372423e-05, "loss": 0.5723966121673584, "mean_token_accuracy": 0.8493536658585071, "num_tokens": 17292973.0, "step": 8460 }, { "entropy": 0.7297378906048835, "epoch": 0.1375636455178126, "grad_norm": 7.625, "learning_rate": 4.814752229156132e-05, "loss": 0.7361185073852539, "mean_token_accuracy": 0.822200732678175, "num_tokens": 17313628.0, "step": 8470 }, { "entropy": 0.6316851863637567, "epoch": 0.13772605832243814, "grad_norm": 5.5, "learning_rate": 4.814262092301469e-05, "loss": 0.6168622493743896, "mean_token_accuracy": 0.8409944657236338, "num_tokens": 17333527.0, "step": 8480 }, { "entropy": 0.677087564393878, "epoch": 0.13788847112706365, "grad_norm": 7.90625, "learning_rate": 4.813771332905102e-05, "loss": 0.674922513961792, "mean_token_accuracy": 0.8243818216025829, "num_tokens": 17353329.0, "step": 8490 }, { "entropy": 0.6535451786592603, "epoch": 0.13805088393168918, "grad_norm": 7.15625, "learning_rate": 4.813279951099047e-05, "loss": 0.6694985389709472, "mean_token_accuracy": 0.8277546979486943, "num_tokens": 17372939.0, "step": 8500 }, { "entropy": 0.6181755037046969, "epoch": 0.1382132967363147, "grad_norm": 14.3125, "learning_rate": 4.8127879470154866e-05, "loss": 0.6153836727142334, "mean_token_accuracy": 0.8436597272753715, "num_tokens": 17394086.0, "step": 8510 }, { "entropy": 0.5728129694238305, "epoch": 0.1383757095409402, "grad_norm": 6.84375, "learning_rate": 4.8122953207867704e-05, "loss": 0.6187980651855469, "mean_token_accuracy": 0.8469486124813557, "num_tokens": 17415331.0, "step": 8520 }, { "entropy": 0.6382316127419472, "epoch": 0.13853812234556573, "grad_norm": 7.375, "learning_rate": 4.8118020725454165e-05, "loss": 0.6913145542144775, "mean_token_accuracy": 0.833270663022995, "num_tokens": 17435921.0, "step": 8530 }, { "entropy": 0.6189044157974422, "epoch": 0.13870053515019123, "grad_norm": 7.5, "learning_rate": 4.8113082024241096e-05, "loss": 0.6309364795684814, "mean_token_accuracy": 0.8435577481985093, "num_tokens": 17456980.0, "step": 8540 }, { "entropy": 0.6040691871196031, "epoch": 0.13886294795481677, "grad_norm": 5.25, "learning_rate": 4.810813710555702e-05, "loss": 0.5949012756347656, "mean_token_accuracy": 0.8508635856211185, "num_tokens": 17477910.0, "step": 8550 }, { "entropy": 0.6506683127954602, "epoch": 0.13902536075944227, "grad_norm": 8.625, "learning_rate": 4.810318597073213e-05, "loss": 0.6433038711547852, "mean_token_accuracy": 0.843486038595438, "num_tokens": 17498053.0, "step": 8560 }, { "entropy": 0.6198129962198436, "epoch": 0.13918777356406778, "grad_norm": 8.8125, "learning_rate": 4.8098228621098296e-05, "loss": 0.6160755157470703, "mean_token_accuracy": 0.8377025984227657, "num_tokens": 17519206.0, "step": 8570 }, { "entropy": 0.7188583522103726, "epoch": 0.1393501863686933, "grad_norm": 5.8125, "learning_rate": 4.809326505798905e-05, "loss": 0.7471960544586181, "mean_token_accuracy": 0.818550718203187, "num_tokens": 17539265.0, "step": 8580 }, { "entropy": 0.6336034391541034, "epoch": 0.13951259917331882, "grad_norm": 7.0, "learning_rate": 4.8088295282739596e-05, "loss": 0.6573149681091308, "mean_token_accuracy": 0.8382480029016733, "num_tokens": 17559723.0, "step": 8590 }, { "entropy": 0.6569077915512025, "epoch": 0.13967501197794435, "grad_norm": 7.1875, "learning_rate": 4.8083319296686835e-05, "loss": 0.668522310256958, "mean_token_accuracy": 0.8360339254140854, "num_tokens": 17579817.0, "step": 8600 }, { "entropy": 0.5352107850834728, "epoch": 0.13983742478256986, "grad_norm": 8.125, "learning_rate": 4.80783371011693e-05, "loss": 0.5300621509552002, "mean_token_accuracy": 0.8656205184757709, "num_tokens": 17600407.0, "step": 8610 }, { "entropy": 0.6283737347461283, "epoch": 0.13999983758719536, "grad_norm": 9.8125, "learning_rate": 4.807334869752722e-05, "loss": 0.6202961444854737, "mean_token_accuracy": 0.8459905974566937, "num_tokens": 17620507.0, "step": 8620 }, { "entropy": 0.5526928183622658, "epoch": 0.1401622503918209, "grad_norm": 6.78125, "learning_rate": 4.806835408710249e-05, "loss": 0.5597908020019531, "mean_token_accuracy": 0.8588463172316552, "num_tokens": 17640900.0, "step": 8630 }, { "entropy": 0.6468131605535745, "epoch": 0.1403246631964464, "grad_norm": 7.90625, "learning_rate": 4.806335327123866e-05, "loss": 0.6744547843933105, "mean_token_accuracy": 0.8320296593010426, "num_tokens": 17660891.0, "step": 8640 }, { "entropy": 0.6314097859431058, "epoch": 0.14048707600107194, "grad_norm": 7.65625, "learning_rate": 4.805834625128098e-05, "loss": 0.6375339984893799, "mean_token_accuracy": 0.8433954488486052, "num_tokens": 17681418.0, "step": 8650 }, { "entropy": 0.5357688201125711, "epoch": 0.14064948880569744, "grad_norm": 8.5, "learning_rate": 4.805333302857633e-05, "loss": 0.5254237651824951, "mean_token_accuracy": 0.8610177971422672, "num_tokens": 17702678.0, "step": 8660 }, { "entropy": 0.5494879598729312, "epoch": 0.14081190161032295, "grad_norm": 8.6875, "learning_rate": 4.8048313604473293e-05, "loss": 0.5278853416442871, "mean_token_accuracy": 0.8578646138310433, "num_tokens": 17722471.0, "step": 8670 }, { "entropy": 0.6348255965858698, "epoch": 0.14097431441494848, "grad_norm": 7.03125, "learning_rate": 4.804328798032209e-05, "loss": 0.6691157817840576, "mean_token_accuracy": 0.836989164352417, "num_tokens": 17742749.0, "step": 8680 }, { "entropy": 0.6216359496116638, "epoch": 0.141136727219574, "grad_norm": 11.6875, "learning_rate": 4.803825615747464e-05, "loss": 0.6069502353668212, "mean_token_accuracy": 0.8472615905106068, "num_tokens": 17762555.0, "step": 8690 }, { "entropy": 0.6245265663601458, "epoch": 0.14129914002419952, "grad_norm": 6.65625, "learning_rate": 4.803321813728451e-05, "loss": 0.6186189174652099, "mean_token_accuracy": 0.8466506563127041, "num_tokens": 17781825.0, "step": 8700 }, { "entropy": 0.603897444717586, "epoch": 0.14146155282882503, "grad_norm": 8.125, "learning_rate": 4.8028173921106935e-05, "loss": 0.5964725017547607, "mean_token_accuracy": 0.8599480934441089, "num_tokens": 17801791.0, "step": 8710 }, { "entropy": 0.6199798761401325, "epoch": 0.14162396563345053, "grad_norm": 11.0, "learning_rate": 4.8023123510298815e-05, "loss": 0.6387128353118896, "mean_token_accuracy": 0.844667038321495, "num_tokens": 17822323.0, "step": 8720 }, { "entropy": 0.5863169393502176, "epoch": 0.14178637843807607, "grad_norm": 7.65625, "learning_rate": 4.801806690621874e-05, "loss": 0.6053766727447509, "mean_token_accuracy": 0.8421031963080168, "num_tokens": 17842553.0, "step": 8730 }, { "entropy": 0.6366223342716694, "epoch": 0.14194879124270157, "grad_norm": 6.0625, "learning_rate": 4.801300411022693e-05, "loss": 0.5729235649108887, "mean_token_accuracy": 0.8551762863993645, "num_tokens": 17862821.0, "step": 8740 }, { "entropy": 0.5494275813922286, "epoch": 0.14211120404732708, "grad_norm": 9.625, "learning_rate": 4.8007935123685297e-05, "loss": 0.561906099319458, "mean_token_accuracy": 0.8588738687336445, "num_tokens": 17883838.0, "step": 8750 }, { "entropy": 0.6048988094553351, "epoch": 0.1422736168519526, "grad_norm": 8.25, "learning_rate": 4.800285994795741e-05, "loss": 0.6365787029266358, "mean_token_accuracy": 0.8365307912230492, "num_tokens": 17904520.0, "step": 8760 }, { "entropy": 0.5896524689160287, "epoch": 0.14243602965657812, "grad_norm": 8.25, "learning_rate": 4.79977785844085e-05, "loss": 0.6091255187988281, "mean_token_accuracy": 0.8466038279235363, "num_tokens": 17924765.0, "step": 8770 }, { "entropy": 0.6075211567804217, "epoch": 0.14259844246120365, "grad_norm": 10.8125, "learning_rate": 4.7992691034405476e-05, "loss": 0.6383663177490234, "mean_token_accuracy": 0.8371895730495453, "num_tokens": 17946877.0, "step": 8780 }, { "entropy": 0.535763907013461, "epoch": 0.14276085526582916, "grad_norm": 8.625, "learning_rate": 4.798759729931688e-05, "loss": 0.493394660949707, "mean_token_accuracy": 0.8665234051644802, "num_tokens": 17966619.0, "step": 8790 }, { "entropy": 0.590048149973154, "epoch": 0.14292326807045466, "grad_norm": 10.3125, "learning_rate": 4.7982497380512945e-05, "loss": 0.5950063228607178, "mean_token_accuracy": 0.8475125938653946, "num_tokens": 17987381.0, "step": 8800 }, { "entropy": 0.6200922342017293, "epoch": 0.1430856808750802, "grad_norm": 8.5, "learning_rate": 4.797739127936558e-05, "loss": 0.6113042831420898, "mean_token_accuracy": 0.845060658082366, "num_tokens": 18007954.0, "step": 8810 }, { "entropy": 0.6321099965833128, "epoch": 0.1432480936797057, "grad_norm": 8.25, "learning_rate": 4.797227899724831e-05, "loss": 0.6427988052368164, "mean_token_accuracy": 0.8395305521786213, "num_tokens": 18027573.0, "step": 8820 }, { "entropy": 0.5789375138469041, "epoch": 0.14341050648433123, "grad_norm": 5.65625, "learning_rate": 4.796716053553637e-05, "loss": 0.5639959812164307, "mean_token_accuracy": 0.8546579889953136, "num_tokens": 18047771.0, "step": 8830 }, { "entropy": 0.5127344804815948, "epoch": 0.14357291928895674, "grad_norm": 8.125, "learning_rate": 4.796203589560663e-05, "loss": 0.5762393474578857, "mean_token_accuracy": 0.8536888927221298, "num_tokens": 18067502.0, "step": 8840 }, { "entropy": 0.638441712781787, "epoch": 0.14373533209358225, "grad_norm": 7.6875, "learning_rate": 4.795690507883762e-05, "loss": 0.6196602821350098, "mean_token_accuracy": 0.8432079963386059, "num_tokens": 18086834.0, "step": 8850 }, { "entropy": 0.6633912310004234, "epoch": 0.14389774489820778, "grad_norm": 9.75, "learning_rate": 4.795176808660956e-05, "loss": 0.6984458446502686, "mean_token_accuracy": 0.8249208971858024, "num_tokens": 18105943.0, "step": 8860 }, { "entropy": 0.7260170597583055, "epoch": 0.14406015770283329, "grad_norm": 8.0625, "learning_rate": 4.7946624920304304e-05, "loss": 0.739480447769165, "mean_token_accuracy": 0.823813508450985, "num_tokens": 18126554.0, "step": 8870 }, { "entropy": 0.5872039915062487, "epoch": 0.14422257050745882, "grad_norm": 9.125, "learning_rate": 4.7941475581305376e-05, "loss": 0.6195332527160644, "mean_token_accuracy": 0.8462771445512771, "num_tokens": 18145758.0, "step": 8880 }, { "entropy": 0.6454668801277876, "epoch": 0.14438498331208433, "grad_norm": 7.9375, "learning_rate": 4.793632007099796e-05, "loss": 0.6371306419372559, "mean_token_accuracy": 0.8479496099054813, "num_tokens": 18166369.0, "step": 8890 }, { "entropy": 0.6207818016409874, "epoch": 0.14454739611670983, "grad_norm": 7.71875, "learning_rate": 4.793115839076889e-05, "loss": 0.6086225032806396, "mean_token_accuracy": 0.8488855518400669, "num_tokens": 18187631.0, "step": 8900 }, { "entropy": 0.647044169716537, "epoch": 0.14470980892133536, "grad_norm": 7.65625, "learning_rate": 4.792599054200669e-05, "loss": 0.630368995666504, "mean_token_accuracy": 0.8473310865461826, "num_tokens": 18206494.0, "step": 8910 }, { "entropy": 0.6967596558853983, "epoch": 0.14487222172596087, "grad_norm": 11.0, "learning_rate": 4.79208165261015e-05, "loss": 0.7384674072265625, "mean_token_accuracy": 0.8266443505883216, "num_tokens": 18227930.0, "step": 8920 }, { "entropy": 0.5934607520699501, "epoch": 0.1450346345305864, "grad_norm": 5.90625, "learning_rate": 4.791563634444516e-05, "loss": 0.5694482803344727, "mean_token_accuracy": 0.8540064878761768, "num_tokens": 18249285.0, "step": 8930 }, { "entropy": 0.6964512680657208, "epoch": 0.1451970473352119, "grad_norm": 6.65625, "learning_rate": 4.791044999843114e-05, "loss": 0.7183862209320069, "mean_token_accuracy": 0.8237753346562385, "num_tokens": 18270855.0, "step": 8940 }, { "entropy": 0.7606234382838011, "epoch": 0.14535946013983742, "grad_norm": 7.75, "learning_rate": 4.790525748945459e-05, "loss": 0.7820095539093017, "mean_token_accuracy": 0.8059801030904055, "num_tokens": 18292495.0, "step": 8950 }, { "entropy": 0.642435679025948, "epoch": 0.14552187294446295, "grad_norm": 7.375, "learning_rate": 4.790005881891229e-05, "loss": 0.6539732933044433, "mean_token_accuracy": 0.8353834673762321, "num_tokens": 18313284.0, "step": 8960 }, { "entropy": 0.5751558568328619, "epoch": 0.14568428574908845, "grad_norm": 7.09375, "learning_rate": 4.78948539882027e-05, "loss": 0.550535774230957, "mean_token_accuracy": 0.8527534812688827, "num_tokens": 18333872.0, "step": 8970 }, { "entropy": 0.6356768487021327, "epoch": 0.145846698553714, "grad_norm": 10.5, "learning_rate": 4.788964299872595e-05, "loss": 0.6564856052398682, "mean_token_accuracy": 0.8408609978854656, "num_tokens": 18355042.0, "step": 8980 }, { "entropy": 0.5898800482973456, "epoch": 0.1460091113583395, "grad_norm": 7.53125, "learning_rate": 4.7884425851883776e-05, "loss": 0.5684184074401856, "mean_token_accuracy": 0.8519672967493535, "num_tokens": 18375349.0, "step": 8990 }, { "entropy": 0.5975275709759444, "epoch": 0.146171524162965, "grad_norm": 8.0, "learning_rate": 4.787920254907963e-05, "loss": 0.6020020008087158, "mean_token_accuracy": 0.8505015857517719, "num_tokens": 18395664.0, "step": 9000 }, { "entropy": 0.6543949369341135, "epoch": 0.14633393696759053, "grad_norm": 8.1875, "learning_rate": 4.787397309171857e-05, "loss": 0.6423961639404296, "mean_token_accuracy": 0.8405837953090668, "num_tokens": 18414997.0, "step": 9010 }, { "entropy": 0.6199060659855604, "epoch": 0.14649634977221604, "grad_norm": 10.125, "learning_rate": 4.786873748120735e-05, "loss": 0.6181083679199219, "mean_token_accuracy": 0.8354721985757351, "num_tokens": 18435259.0, "step": 9020 }, { "entropy": 0.5546169493347406, "epoch": 0.14665876257684154, "grad_norm": 8.5, "learning_rate": 4.7863495718954355e-05, "loss": 0.575148344039917, "mean_token_accuracy": 0.8507708147168159, "num_tokens": 18455992.0, "step": 9030 }, { "entropy": 0.5520155111327767, "epoch": 0.14682117538146708, "grad_norm": 7.9375, "learning_rate": 4.785824780636963e-05, "loss": 0.561829662322998, "mean_token_accuracy": 0.8581220734864473, "num_tokens": 18476478.0, "step": 9040 }, { "entropy": 0.6744874310679734, "epoch": 0.14698358818609258, "grad_norm": 7.03125, "learning_rate": 4.785299374486486e-05, "loss": 0.6754958629608154, "mean_token_accuracy": 0.8356623984873295, "num_tokens": 18497302.0, "step": 9050 }, { "entropy": 0.6525230835191905, "epoch": 0.14714600099071812, "grad_norm": 6.03125, "learning_rate": 4.784773353585343e-05, "loss": 0.6599681854248047, "mean_token_accuracy": 0.8379609428346158, "num_tokens": 18519168.0, "step": 9060 }, { "entropy": 0.6066897181794048, "epoch": 0.14730841379534362, "grad_norm": 8.1875, "learning_rate": 4.7842467180750324e-05, "loss": 0.573602819442749, "mean_token_accuracy": 0.8542135834693909, "num_tokens": 18538875.0, "step": 9070 }, { "entropy": 0.585414238832891, "epoch": 0.14747082659996913, "grad_norm": 8.5625, "learning_rate": 4.7837194680972206e-05, "loss": 0.5836697578430176, "mean_token_accuracy": 0.850047605484724, "num_tokens": 18559647.0, "step": 9080 }, { "entropy": 0.5991341841407121, "epoch": 0.14763323940459466, "grad_norm": 5.625, "learning_rate": 4.783191603793741e-05, "loss": 0.6530519485473633, "mean_token_accuracy": 0.8373940519988536, "num_tokens": 18581607.0, "step": 9090 }, { "entropy": 0.5853006782010197, "epoch": 0.14779565220922017, "grad_norm": 7.90625, "learning_rate": 4.782663125306588e-05, "loss": 0.6276863574981689, "mean_token_accuracy": 0.8422775700688362, "num_tokens": 18600924.0, "step": 9100 }, { "entropy": 0.6123523896560072, "epoch": 0.1479580650138457, "grad_norm": 6.21875, "learning_rate": 4.782134032777924e-05, "loss": 0.6104051113128662, "mean_token_accuracy": 0.8474269192665815, "num_tokens": 18622314.0, "step": 9110 }, { "entropy": 0.5908287854865193, "epoch": 0.1481204778184712, "grad_norm": 9.25, "learning_rate": 4.7816043263500764e-05, "loss": 0.5948742389678955, "mean_token_accuracy": 0.8567447409033775, "num_tokens": 18642725.0, "step": 9120 }, { "entropy": 0.6689820470288396, "epoch": 0.1482828906230967, "grad_norm": 10.125, "learning_rate": 4.781074006165538e-05, "loss": 0.6869154930114746, "mean_token_accuracy": 0.8300175409764051, "num_tokens": 18663687.0, "step": 9130 }, { "entropy": 0.624483793694526, "epoch": 0.14844530342772225, "grad_norm": 7.125, "learning_rate": 4.7805430723669656e-05, "loss": 0.6391027927398681, "mean_token_accuracy": 0.8439335450530052, "num_tokens": 18683561.0, "step": 9140 }, { "entropy": 0.606061231624335, "epoch": 0.14860771623234775, "grad_norm": 10.5625, "learning_rate": 4.780011525097181e-05, "loss": 0.5734774112701416, "mean_token_accuracy": 0.8566057853400707, "num_tokens": 18703962.0, "step": 9150 }, { "entropy": 0.6509995698928833, "epoch": 0.1487701290369733, "grad_norm": 8.75, "learning_rate": 4.779479364499172e-05, "loss": 0.6732940196990966, "mean_token_accuracy": 0.8378686271607876, "num_tokens": 18725401.0, "step": 9160 }, { "entropy": 0.6176853084936738, "epoch": 0.1489325418415988, "grad_norm": 12.0, "learning_rate": 4.778946590716092e-05, "loss": 0.6686935424804688, "mean_token_accuracy": 0.8384677097201347, "num_tokens": 18745900.0, "step": 9170 }, { "entropy": 0.6305993126705289, "epoch": 0.1490949546462243, "grad_norm": 8.4375, "learning_rate": 4.778413203891257e-05, "loss": 0.669380521774292, "mean_token_accuracy": 0.8343824103474617, "num_tokens": 18766879.0, "step": 9180 }, { "entropy": 0.6602992217056454, "epoch": 0.14925736745084983, "grad_norm": 7.875, "learning_rate": 4.77787920416815e-05, "loss": 0.6773960590362549, "mean_token_accuracy": 0.836940386146307, "num_tokens": 18786710.0, "step": 9190 }, { "entropy": 0.6405679081566632, "epoch": 0.14941978025547534, "grad_norm": 5.46875, "learning_rate": 4.7773445916904175e-05, "loss": 0.6209536552429199, "mean_token_accuracy": 0.8485879246145487, "num_tokens": 18807377.0, "step": 9200 }, { "entropy": 0.6160450478084385, "epoch": 0.14958219306010087, "grad_norm": 7.375, "learning_rate": 4.776809366601872e-05, "loss": 0.6320612907409668, "mean_token_accuracy": 0.843862647563219, "num_tokens": 18828217.0, "step": 9210 }, { "entropy": 0.6477995933033526, "epoch": 0.14974460586472638, "grad_norm": 7.09375, "learning_rate": 4.77627352904649e-05, "loss": 0.638882064819336, "mean_token_accuracy": 0.8336539629846811, "num_tokens": 18848628.0, "step": 9220 }, { "entropy": 0.5719367106445133, "epoch": 0.14990701866935188, "grad_norm": 7.1875, "learning_rate": 4.775737079168413e-05, "loss": 0.5550568580627442, "mean_token_accuracy": 0.8616848662495613, "num_tokens": 18869336.0, "step": 9230 }, { "entropy": 0.6118508036248386, "epoch": 0.15006943147397742, "grad_norm": 10.375, "learning_rate": 4.775200017111947e-05, "loss": 0.6317952632904053, "mean_token_accuracy": 0.8357299461960792, "num_tokens": 18890199.0, "step": 9240 }, { "entropy": 0.6451764466241002, "epoch": 0.15023184427860292, "grad_norm": 7.0625, "learning_rate": 4.774662343021564e-05, "loss": 0.6544273376464844, "mean_token_accuracy": 0.8358705043792725, "num_tokens": 18911713.0, "step": 9250 }, { "entropy": 0.5338861975818873, "epoch": 0.15039425708322846, "grad_norm": 8.5, "learning_rate": 4.774124057041898e-05, "loss": 0.5663548469543457, "mean_token_accuracy": 0.8531091459095478, "num_tokens": 18931721.0, "step": 9260 }, { "entropy": 0.6365612098947168, "epoch": 0.15055666988785396, "grad_norm": 8.6875, "learning_rate": 4.77358515931775e-05, "loss": 0.626079797744751, "mean_token_accuracy": 0.8469805810600519, "num_tokens": 18951837.0, "step": 9270 }, { "entropy": 0.6128804503940046, "epoch": 0.15071908269247947, "grad_norm": 7.96875, "learning_rate": 4.7730456499940854e-05, "loss": 0.6717112541198731, "mean_token_accuracy": 0.8364338502287865, "num_tokens": 18972136.0, "step": 9280 }, { "entropy": 0.671223658695817, "epoch": 0.150881495497105, "grad_norm": 8.125, "learning_rate": 4.772505529216032e-05, "loss": 0.6622696876525879, "mean_token_accuracy": 0.8370720207691192, "num_tokens": 18992215.0, "step": 9290 }, { "entropy": 0.6786268007010221, "epoch": 0.1510439083017305, "grad_norm": 9.5625, "learning_rate": 4.771964797128884e-05, "loss": 0.6802579402923584, "mean_token_accuracy": 0.8324664890766144, "num_tokens": 19013386.0, "step": 9300 }, { "entropy": 0.6320101212710142, "epoch": 0.151206321106356, "grad_norm": 8.625, "learning_rate": 4.7714234538781e-05, "loss": 0.641576623916626, "mean_token_accuracy": 0.841977807879448, "num_tokens": 19033413.0, "step": 9310 }, { "entropy": 0.6837564260698855, "epoch": 0.15136873391098155, "grad_norm": 7.8125, "learning_rate": 4.7708814996093024e-05, "loss": 0.6872798919677734, "mean_token_accuracy": 0.8306986182928086, "num_tokens": 19053777.0, "step": 9320 }, { "entropy": 0.6602279188111424, "epoch": 0.15153114671560705, "grad_norm": 8.75, "learning_rate": 4.770338934468277e-05, "loss": 0.6122377872467041, "mean_token_accuracy": 0.8492344062775373, "num_tokens": 19074150.0, "step": 9330 }, { "entropy": 0.5828174193389714, "epoch": 0.15169355952023258, "grad_norm": 7.4375, "learning_rate": 4.769795758600976e-05, "loss": 0.5968486309051514, "mean_token_accuracy": 0.8481022179126739, "num_tokens": 19095472.0, "step": 9340 }, { "entropy": 0.586430444708094, "epoch": 0.1518559723248581, "grad_norm": 7.5625, "learning_rate": 4.769251972153515e-05, "loss": 0.6035156726837159, "mean_token_accuracy": 0.8519285053014756, "num_tokens": 19115103.0, "step": 9350 }, { "entropy": 0.6085972970351576, "epoch": 0.1520183851294836, "grad_norm": 7.9375, "learning_rate": 4.768707575272174e-05, "loss": 0.6127945899963378, "mean_token_accuracy": 0.8465140715241433, "num_tokens": 19135329.0, "step": 9360 }, { "entropy": 0.6286271648481488, "epoch": 0.15218079793410913, "grad_norm": 8.625, "learning_rate": 4.768162568103397e-05, "loss": 0.5919161319732666, "mean_token_accuracy": 0.8485459983348846, "num_tokens": 19155481.0, "step": 9370 }, { "entropy": 0.5644595285877585, "epoch": 0.15234321073873464, "grad_norm": 6.4375, "learning_rate": 4.767616950793792e-05, "loss": 0.5931994915008545, "mean_token_accuracy": 0.8527758210897446, "num_tokens": 19176477.0, "step": 9380 }, { "entropy": 0.595355412364006, "epoch": 0.15250562354336017, "grad_norm": 7.53125, "learning_rate": 4.76707072349013e-05, "loss": 0.6290109634399415, "mean_token_accuracy": 0.849372398853302, "num_tokens": 19198585.0, "step": 9390 }, { "entropy": 0.6382844749838114, "epoch": 0.15266803634798568, "grad_norm": 7.0, "learning_rate": 4.766523886339349e-05, "loss": 0.6386823177337646, "mean_token_accuracy": 0.845276989787817, "num_tokens": 19218942.0, "step": 9400 }, { "entropy": 0.5796367482282221, "epoch": 0.15283044915261118, "grad_norm": 8.0, "learning_rate": 4.7659764394885495e-05, "loss": 0.5816111087799072, "mean_token_accuracy": 0.8576555110514164, "num_tokens": 19239570.0, "step": 9410 }, { "entropy": 0.614752927236259, "epoch": 0.15299286195723671, "grad_norm": 13.1875, "learning_rate": 4.7654283830849945e-05, "loss": 0.6411834716796875, "mean_token_accuracy": 0.8368097584694624, "num_tokens": 19259358.0, "step": 9420 }, { "entropy": 0.5999226151034236, "epoch": 0.15315527476186222, "grad_norm": 6.59375, "learning_rate": 4.7648797172761127e-05, "loss": 0.6217093467712402, "mean_token_accuracy": 0.8428853027522564, "num_tokens": 19279803.0, "step": 9430 }, { "entropy": 0.6397399811074138, "epoch": 0.15331768756648775, "grad_norm": 7.5625, "learning_rate": 4.764330442209498e-05, "loss": 0.6770953178405762, "mean_token_accuracy": 0.8353389024734497, "num_tokens": 19300548.0, "step": 9440 }, { "entropy": 0.6582180628553033, "epoch": 0.15348010037111326, "grad_norm": 8.5, "learning_rate": 4.763780558032905e-05, "loss": 0.6480880737304687, "mean_token_accuracy": 0.8370811097323895, "num_tokens": 19320983.0, "step": 9450 }, { "entropy": 0.6426882747560739, "epoch": 0.15364251317573877, "grad_norm": 7.46875, "learning_rate": 4.763230064894255e-05, "loss": 0.6488073348999024, "mean_token_accuracy": 0.8393580108880997, "num_tokens": 19340646.0, "step": 9460 }, { "entropy": 0.568936332874, "epoch": 0.1538049259803643, "grad_norm": 9.5, "learning_rate": 4.7626789629416305e-05, "loss": 0.5239686489105224, "mean_token_accuracy": 0.8632427386939525, "num_tokens": 19361509.0, "step": 9470 }, { "entropy": 0.5813541390933097, "epoch": 0.1539673387849898, "grad_norm": 8.75, "learning_rate": 4.7621272523232805e-05, "loss": 0.5929550647735595, "mean_token_accuracy": 0.8509740315377712, "num_tokens": 19381922.0, "step": 9480 }, { "entropy": 0.6374801522120833, "epoch": 0.15412975158961534, "grad_norm": 9.8125, "learning_rate": 4.761574933187616e-05, "loss": 0.6530354499816895, "mean_token_accuracy": 0.842949989438057, "num_tokens": 19402294.0, "step": 9490 }, { "entropy": 0.5915313007310032, "epoch": 0.15429216439424084, "grad_norm": 8.875, "learning_rate": 4.761022005683211e-05, "loss": 0.623656940460205, "mean_token_accuracy": 0.8449139714241027, "num_tokens": 19423228.0, "step": 9500 }, { "entropy": 0.6307830279693007, "epoch": 0.15445457719886635, "grad_norm": 9.8125, "learning_rate": 4.760468469958806e-05, "loss": 0.6370206832885742, "mean_token_accuracy": 0.8410321936011315, "num_tokens": 19443385.0, "step": 9510 }, { "entropy": 0.5717444282956421, "epoch": 0.15461699000349188, "grad_norm": 7.09375, "learning_rate": 4.7599143261633015e-05, "loss": 0.567040205001831, "mean_token_accuracy": 0.8576523587107658, "num_tokens": 19465376.0, "step": 9520 }, { "entropy": 0.5838196300901473, "epoch": 0.1547794028081174, "grad_norm": 9.75, "learning_rate": 4.7593595744457655e-05, "loss": 0.6029806137084961, "mean_token_accuracy": 0.8475877128541469, "num_tokens": 19486617.0, "step": 9530 }, { "entropy": 0.6519259840250016, "epoch": 0.15494181561274292, "grad_norm": 8.375, "learning_rate": 4.758804214955426e-05, "loss": 0.6817457199096679, "mean_token_accuracy": 0.8346240479499102, "num_tokens": 19508004.0, "step": 9540 }, { "entropy": 0.6889466105028987, "epoch": 0.15510422841736843, "grad_norm": 8.375, "learning_rate": 4.758248247841676e-05, "loss": 0.7079968452453613, "mean_token_accuracy": 0.826197998598218, "num_tokens": 19529802.0, "step": 9550 }, { "entropy": 0.6728490669745952, "epoch": 0.15526664122199393, "grad_norm": 8.6875, "learning_rate": 4.757691673254073e-05, "loss": 0.7061266899108887, "mean_token_accuracy": 0.8264325864613056, "num_tokens": 19550230.0, "step": 9560 }, { "entropy": 0.6599953419528901, "epoch": 0.15542905402661947, "grad_norm": 5.34375, "learning_rate": 4.757134491342335e-05, "loss": 0.6428809642791748, "mean_token_accuracy": 0.8317606687545777, "num_tokens": 19571868.0, "step": 9570 }, { "entropy": 0.6808361680712551, "epoch": 0.15559146683124497, "grad_norm": 10.25, "learning_rate": 4.756576702256347e-05, "loss": 0.6610795021057129, "mean_token_accuracy": 0.8325070716440678, "num_tokens": 19591765.0, "step": 9580 }, { "entropy": 0.6286493331193924, "epoch": 0.15575387963587048, "grad_norm": 7.28125, "learning_rate": 4.7560183061461543e-05, "loss": 0.5736021518707275, "mean_token_accuracy": 0.8557942725718022, "num_tokens": 19612175.0, "step": 9590 }, { "entropy": 0.5353074976243078, "epoch": 0.155916292440496, "grad_norm": 7.71875, "learning_rate": 4.7554593031619673e-05, "loss": 0.6169938087463379, "mean_token_accuracy": 0.8495191283524036, "num_tokens": 19632064.0, "step": 9600 }, { "entropy": 0.6597498061135412, "epoch": 0.15607870524512152, "grad_norm": 11.6875, "learning_rate": 4.754899693454159e-05, "loss": 0.6788104057312012, "mean_token_accuracy": 0.8402855955064297, "num_tokens": 19653128.0, "step": 9610 }, { "entropy": 0.6469740585424006, "epoch": 0.15624111804974705, "grad_norm": 7.65625, "learning_rate": 4.754339477173267e-05, "loss": 0.6675477504730225, "mean_token_accuracy": 0.8299224019050598, "num_tokens": 19673326.0, "step": 9620 }, { "entropy": 0.5688302397727967, "epoch": 0.15640353085437256, "grad_norm": 6.21875, "learning_rate": 4.753778654469987e-05, "loss": 0.5748984813690186, "mean_token_accuracy": 0.8528425954282284, "num_tokens": 19693282.0, "step": 9630 }, { "entropy": 0.6028886201791466, "epoch": 0.15656594365899806, "grad_norm": 7.90625, "learning_rate": 4.7532172254951844e-05, "loss": 0.6257241249084473, "mean_token_accuracy": 0.8434146121144295, "num_tokens": 19713749.0, "step": 9640 }, { "entropy": 0.6426247789524495, "epoch": 0.1567283564636236, "grad_norm": 7.03125, "learning_rate": 4.752655190399885e-05, "loss": 0.6677342414855957, "mean_token_accuracy": 0.832595519721508, "num_tokens": 19734272.0, "step": 9650 }, { "entropy": 0.6408684544265271, "epoch": 0.1568907692682491, "grad_norm": 6.4375, "learning_rate": 4.7520925493352764e-05, "loss": 0.6047965526580811, "mean_token_accuracy": 0.8512013837695122, "num_tokens": 19754999.0, "step": 9660 }, { "entropy": 0.6145822267513722, "epoch": 0.15705318207287464, "grad_norm": 10.0625, "learning_rate": 4.7515293024527116e-05, "loss": 0.6732779026031495, "mean_token_accuracy": 0.8434772111475468, "num_tokens": 19775900.0, "step": 9670 }, { "entropy": 0.6563623644411564, "epoch": 0.15721559487750014, "grad_norm": 8.3125, "learning_rate": 4.7509654499037034e-05, "loss": 0.6312705039978027, "mean_token_accuracy": 0.8425785824656487, "num_tokens": 19795762.0, "step": 9680 }, { "entropy": 0.5867878974415361, "epoch": 0.15737800768212565, "grad_norm": 6.78125, "learning_rate": 4.750400991839931e-05, "loss": 0.5712440013885498, "mean_token_accuracy": 0.8634155042469501, "num_tokens": 19815569.0, "step": 9690 }, { "entropy": 0.603073606826365, "epoch": 0.15754042048675118, "grad_norm": 4.9375, "learning_rate": 4.7498359284132344e-05, "loss": 0.5984757900238037, "mean_token_accuracy": 0.8530003942549229, "num_tokens": 19835166.0, "step": 9700 }, { "entropy": 0.6206632005982101, "epoch": 0.1577028332913767, "grad_norm": 7.96875, "learning_rate": 4.7492702597756164e-05, "loss": 0.6072278499603272, "mean_token_accuracy": 0.8495746836066246, "num_tokens": 19855187.0, "step": 9710 }, { "entropy": 0.6478312129154802, "epoch": 0.15786524609600222, "grad_norm": 6.4375, "learning_rate": 4.7487039860792436e-05, "loss": 0.6670050621032715, "mean_token_accuracy": 0.8348179310560226, "num_tokens": 19876271.0, "step": 9720 }, { "entropy": 0.5571336104068905, "epoch": 0.15802765890062773, "grad_norm": 7.0, "learning_rate": 4.748137107476446e-05, "loss": 0.5447845935821534, "mean_token_accuracy": 0.8595463387668133, "num_tokens": 19896238.0, "step": 9730 }, { "entropy": 0.6005212897434831, "epoch": 0.15819007170525323, "grad_norm": 8.5, "learning_rate": 4.747569624119713e-05, "loss": 0.6174000263214111, "mean_token_accuracy": 0.8469960875809193, "num_tokens": 19916850.0, "step": 9740 }, { "entropy": 0.6102871877141297, "epoch": 0.15835248450987877, "grad_norm": 7.8125, "learning_rate": 4.7470015361617006e-05, "loss": 0.6289696216583252, "mean_token_accuracy": 0.8428732868283987, "num_tokens": 19937466.0, "step": 9750 }, { "entropy": 0.5997185956686735, "epoch": 0.15851489731450427, "grad_norm": 7.90625, "learning_rate": 4.7464328437552245e-05, "loss": 0.6241291046142579, "mean_token_accuracy": 0.8472841091454029, "num_tokens": 19958155.0, "step": 9760 }, { "entropy": 0.6648338919505477, "epoch": 0.1586773101191298, "grad_norm": 11.125, "learning_rate": 4.745863547053265e-05, "loss": 0.6752971649169922, "mean_token_accuracy": 0.8366879358887672, "num_tokens": 19977324.0, "step": 9770 }, { "entropy": 0.5789738723542541, "epoch": 0.1588397229237553, "grad_norm": 9.1875, "learning_rate": 4.745293646208965e-05, "loss": 0.5664704322814942, "mean_token_accuracy": 0.8487032026052475, "num_tokens": 19997076.0, "step": 9780 }, { "entropy": 0.6300338912289589, "epoch": 0.15900213572838082, "grad_norm": 7.3125, "learning_rate": 4.7447231413756276e-05, "loss": 0.6146106719970703, "mean_token_accuracy": 0.8390329584479332, "num_tokens": 20017729.0, "step": 9790 }, { "entropy": 0.6204449416138231, "epoch": 0.15916454853300635, "grad_norm": 8.3125, "learning_rate": 4.74415203270672e-05, "loss": 0.6354228496551514, "mean_token_accuracy": 0.8435870558023453, "num_tokens": 20037343.0, "step": 9800 }, { "entropy": 0.5659003305714577, "epoch": 0.15932696133763186, "grad_norm": 6.75, "learning_rate": 4.7435803203558726e-05, "loss": 0.5645187377929688, "mean_token_accuracy": 0.8562339976429939, "num_tokens": 20059193.0, "step": 9810 }, { "entropy": 0.5824140844400972, "epoch": 0.15948937414225736, "grad_norm": 8.6875, "learning_rate": 4.7430080044768765e-05, "loss": 0.6013901710510254, "mean_token_accuracy": 0.8432653449475765, "num_tokens": 20080738.0, "step": 9820 }, { "entropy": 0.6200696306303144, "epoch": 0.1596517869468829, "grad_norm": 6.75, "learning_rate": 4.7424350852236876e-05, "loss": 0.6118596076965332, "mean_token_accuracy": 0.8418068371713161, "num_tokens": 20101094.0, "step": 9830 }, { "entropy": 0.5530235239304602, "epoch": 0.1598141997515084, "grad_norm": 8.375, "learning_rate": 4.74186156275042e-05, "loss": 0.5241657733917237, "mean_token_accuracy": 0.8719382792711258, "num_tokens": 20120581.0, "step": 9840 }, { "entropy": 0.5808429464697837, "epoch": 0.15997661255613393, "grad_norm": 7.28125, "learning_rate": 4.7412874372113544e-05, "loss": 0.5879287242889404, "mean_token_accuracy": 0.847440917044878, "num_tokens": 20142219.0, "step": 9850 }, { "entropy": 0.5360729384236038, "epoch": 0.16013902536075944, "grad_norm": 7.1875, "learning_rate": 4.7407127087609305e-05, "loss": 0.5218863487243652, "mean_token_accuracy": 0.8638460032641888, "num_tokens": 20163259.0, "step": 9860 }, { "entropy": 0.6425107331946492, "epoch": 0.16030143816538495, "grad_norm": 6.53125, "learning_rate": 4.740137377553753e-05, "loss": 0.6645955562591552, "mean_token_accuracy": 0.8458774819970131, "num_tokens": 20182185.0, "step": 9870 }, { "entropy": 0.5561765970662236, "epoch": 0.16046385097001048, "grad_norm": 5.96875, "learning_rate": 4.739561443744586e-05, "loss": 0.5652360439300537, "mean_token_accuracy": 0.8513098962604999, "num_tokens": 20202062.0, "step": 9880 }, { "entropy": 0.6039927275385708, "epoch": 0.16062626377463599, "grad_norm": 6.25, "learning_rate": 4.738984907488357e-05, "loss": 0.6235170841217041, "mean_token_accuracy": 0.8409020751714706, "num_tokens": 20222496.0, "step": 9890 }, { "entropy": 0.5775435818359256, "epoch": 0.16078867657926152, "grad_norm": 5.90625, "learning_rate": 4.7384077689401576e-05, "loss": 0.5950204849243164, "mean_token_accuracy": 0.8477249838411808, "num_tokens": 20242251.0, "step": 9900 }, { "entropy": 0.6783268143422901, "epoch": 0.16095108938388702, "grad_norm": 4.90625, "learning_rate": 4.737830028255237e-05, "loss": 0.6445770263671875, "mean_token_accuracy": 0.846524391695857, "num_tokens": 20262155.0, "step": 9910 }, { "entropy": 0.6511921867728233, "epoch": 0.16111350218851253, "grad_norm": 6.1875, "learning_rate": 4.73725168558901e-05, "loss": 0.6584742069244385, "mean_token_accuracy": 0.8270201563835144, "num_tokens": 20282916.0, "step": 9920 }, { "entropy": 0.5804347527679056, "epoch": 0.16127591499313806, "grad_norm": 7.1875, "learning_rate": 4.7366727410970515e-05, "loss": 0.5705376625061035, "mean_token_accuracy": 0.8526408389210701, "num_tokens": 20303044.0, "step": 9930 }, { "entropy": 0.5436915442347526, "epoch": 0.16143832779776357, "grad_norm": 8.0625, "learning_rate": 4.7360931949350984e-05, "loss": 0.5509803771972657, "mean_token_accuracy": 0.8655401818454266, "num_tokens": 20322781.0, "step": 9940 }, { "entropy": 0.5842553658410907, "epoch": 0.1616007406023891, "grad_norm": 6.46875, "learning_rate": 4.735513047259051e-05, "loss": 0.6214926719665528, "mean_token_accuracy": 0.8449900954961777, "num_tokens": 20343783.0, "step": 9950 }, { "entropy": 0.5747113563120365, "epoch": 0.1617631534070146, "grad_norm": 10.0, "learning_rate": 4.73493229822497e-05, "loss": 0.5740239143371582, "mean_token_accuracy": 0.8648852463811636, "num_tokens": 20364671.0, "step": 9960 }, { "entropy": 0.5857602461241186, "epoch": 0.16192556621164012, "grad_norm": 10.4375, "learning_rate": 4.734350947989078e-05, "loss": 0.6017921924591064, "mean_token_accuracy": 0.849933621659875, "num_tokens": 20385364.0, "step": 9970 }, { "entropy": 0.5855033164843917, "epoch": 0.16208797901626565, "grad_norm": 6.90625, "learning_rate": 4.733768996707759e-05, "loss": 0.6099676609039306, "mean_token_accuracy": 0.84154096506536, "num_tokens": 20404966.0, "step": 9980 }, { "entropy": 0.613588894950226, "epoch": 0.16225039182089115, "grad_norm": 11.0625, "learning_rate": 4.7331864445375604e-05, "loss": 0.673856782913208, "mean_token_accuracy": 0.836117721349001, "num_tokens": 20424758.0, "step": 9990 }, { "entropy": 0.6387387309223413, "epoch": 0.1624128046255167, "grad_norm": 8.8125, "learning_rate": 4.73260329163519e-05, "loss": 0.6230509757995606, "mean_token_accuracy": 0.8452924638986588, "num_tokens": 20444932.0, "step": 10000 }, { "entropy": 0.6292905842885375, "epoch": 0.1625752174301422, "grad_norm": 10.375, "learning_rate": 4.7320195381575164e-05, "loss": 0.6288307189941407, "mean_token_accuracy": 0.8423650063574314, "num_tokens": 20465552.0, "step": 10010 }, { "entropy": 0.5735433204099536, "epoch": 0.1627376302347677, "grad_norm": 8.875, "learning_rate": 4.73143518426157e-05, "loss": 0.564060640335083, "mean_token_accuracy": 0.8548333950340747, "num_tokens": 20484946.0, "step": 10020 }, { "entropy": 0.640919862035662, "epoch": 0.16290004303939323, "grad_norm": 6.75, "learning_rate": 4.730850230104545e-05, "loss": 0.6143383026123047, "mean_token_accuracy": 0.8440393216907978, "num_tokens": 20507176.0, "step": 10030 }, { "entropy": 0.6496960234828293, "epoch": 0.16306245584401874, "grad_norm": 5.90625, "learning_rate": 4.7302646758437945e-05, "loss": 0.6794010639190674, "mean_token_accuracy": 0.8283379197120666, "num_tokens": 20527671.0, "step": 10040 }, { "entropy": 0.6454533107578755, "epoch": 0.16322486864864427, "grad_norm": 9.0, "learning_rate": 4.729678521636834e-05, "loss": 0.6555508136749267, "mean_token_accuracy": 0.8326481461524964, "num_tokens": 20548818.0, "step": 10050 }, { "entropy": 0.5529184692539275, "epoch": 0.16338728145326978, "grad_norm": 8.875, "learning_rate": 4.7290917676413405e-05, "loss": 0.5706881999969482, "mean_token_accuracy": 0.8554768905043602, "num_tokens": 20568545.0, "step": 10060 }, { "entropy": 0.6126372271217406, "epoch": 0.16354969425789528, "grad_norm": 8.125, "learning_rate": 4.7285044140151514e-05, "loss": 0.5821037769317627, "mean_token_accuracy": 0.8512091115117073, "num_tokens": 20589653.0, "step": 10070 }, { "entropy": 0.5499625711236149, "epoch": 0.16371210706252082, "grad_norm": 6.21875, "learning_rate": 4.7279164609162664e-05, "loss": 0.5796096801757813, "mean_token_accuracy": 0.8545595355331898, "num_tokens": 20609503.0, "step": 10080 }, { "entropy": 0.5897466137073935, "epoch": 0.16387451986714632, "grad_norm": 10.125, "learning_rate": 4.727327908502848e-05, "loss": 0.5967008590698242, "mean_token_accuracy": 0.8452329732477665, "num_tokens": 20629082.0, "step": 10090 }, { "entropy": 0.6203928643837571, "epoch": 0.16403693267177183, "grad_norm": 9.1875, "learning_rate": 4.7267387569332144e-05, "loss": 0.6630392074584961, "mean_token_accuracy": 0.8498360618948937, "num_tokens": 20650120.0, "step": 10100 }, { "entropy": 0.6710710220038891, "epoch": 0.16419934547639736, "grad_norm": 10.375, "learning_rate": 4.7261490063658525e-05, "loss": 0.6594163417816162, "mean_token_accuracy": 0.8320409130305052, "num_tokens": 20670294.0, "step": 10110 }, { "entropy": 0.7260538349393755, "epoch": 0.16436175828102287, "grad_norm": 8.1875, "learning_rate": 4.7255586569594045e-05, "loss": 0.7361472129821778, "mean_token_accuracy": 0.8247964542359114, "num_tokens": 20690975.0, "step": 10120 }, { "entropy": 0.5999591907486319, "epoch": 0.1645241710856484, "grad_norm": 6.40625, "learning_rate": 4.724967708872676e-05, "loss": 0.5981400966644287, "mean_token_accuracy": 0.8527772448956966, "num_tokens": 20711690.0, "step": 10130 }, { "entropy": 0.5683107278309762, "epoch": 0.1646865838902739, "grad_norm": 8.625, "learning_rate": 4.724376162264634e-05, "loss": 0.5460116863250732, "mean_token_accuracy": 0.8584129229187966, "num_tokens": 20731670.0, "step": 10140 }, { "entropy": 0.6354150795843452, "epoch": 0.1648489966948994, "grad_norm": 7.75, "learning_rate": 4.723784017294405e-05, "loss": 0.6727088451385498, "mean_token_accuracy": 0.8353624798357486, "num_tokens": 20752352.0, "step": 10150 }, { "entropy": 0.6236502299085259, "epoch": 0.16501140949952495, "grad_norm": 9.3125, "learning_rate": 4.723191274121278e-05, "loss": 0.5961717128753662, "mean_token_accuracy": 0.8429586805403233, "num_tokens": 20771883.0, "step": 10160 }, { "entropy": 0.7304754287004471, "epoch": 0.16517382230415045, "grad_norm": 8.5, "learning_rate": 4.722597932904702e-05, "loss": 0.7665973663330078, "mean_token_accuracy": 0.8197622079402208, "num_tokens": 20792730.0, "step": 10170 }, { "entropy": 0.6256721806246788, "epoch": 0.165336235108776, "grad_norm": 9.125, "learning_rate": 4.722003993804286e-05, "loss": 0.6191418647766114, "mean_token_accuracy": 0.8493439488112926, "num_tokens": 20813482.0, "step": 10180 }, { "entropy": 0.6137599318288267, "epoch": 0.1654986479134015, "grad_norm": 8.25, "learning_rate": 4.721409456979803e-05, "loss": 0.6372104167938233, "mean_token_accuracy": 0.843912660330534, "num_tokens": 20834396.0, "step": 10190 }, { "entropy": 0.5676281632855534, "epoch": 0.165661060718027, "grad_norm": 5.46875, "learning_rate": 4.7208143225911836e-05, "loss": 0.5307728767395019, "mean_token_accuracy": 0.8583210855722427, "num_tokens": 20856038.0, "step": 10200 }, { "entropy": 0.5808394033461809, "epoch": 0.16582347352265253, "grad_norm": 7.0, "learning_rate": 4.720218590798521e-05, "loss": 0.5605245590209961, "mean_token_accuracy": 0.8576077461242676, "num_tokens": 20876577.0, "step": 10210 }, { "entropy": 0.5972050973214209, "epoch": 0.16598588632727804, "grad_norm": 8.625, "learning_rate": 4.719622261762067e-05, "loss": 0.592203950881958, "mean_token_accuracy": 0.8461033940315247, "num_tokens": 20896662.0, "step": 10220 }, { "entropy": 0.6008110371418297, "epoch": 0.16614829913190357, "grad_norm": 9.0625, "learning_rate": 4.719025335642236e-05, "loss": 0.6636116981506348, "mean_token_accuracy": 0.8344780251383781, "num_tokens": 20916892.0, "step": 10230 }, { "entropy": 0.6933499976992608, "epoch": 0.16631071193652908, "grad_norm": 7.5, "learning_rate": 4.718427812599604e-05, "loss": 0.67960205078125, "mean_token_accuracy": 0.8183411508798599, "num_tokens": 20936683.0, "step": 10240 }, { "entropy": 0.6092169320210814, "epoch": 0.16647312474115458, "grad_norm": 7.78125, "learning_rate": 4.717829692794904e-05, "loss": 0.6351668357849121, "mean_token_accuracy": 0.8445023156702518, "num_tokens": 20957178.0, "step": 10250 }, { "entropy": 0.6240492655895651, "epoch": 0.16663553754578012, "grad_norm": 8.1875, "learning_rate": 4.717230976389032e-05, "loss": 0.5972093105316162, "mean_token_accuracy": 0.8557727560400963, "num_tokens": 20976808.0, "step": 10260 }, { "entropy": 0.5924633769318461, "epoch": 0.16679795035040562, "grad_norm": 4.8125, "learning_rate": 4.716631663543045e-05, "loss": 0.575700330734253, "mean_token_accuracy": 0.8456524550914765, "num_tokens": 20998818.0, "step": 10270 }, { "entropy": 0.5724406103603542, "epoch": 0.16696036315503116, "grad_norm": 8.6875, "learning_rate": 4.7160317544181585e-05, "loss": 0.5980769634246826, "mean_token_accuracy": 0.8465342834591866, "num_tokens": 21019352.0, "step": 10280 }, { "entropy": 0.49440871328115465, "epoch": 0.16712277595965666, "grad_norm": 5.46875, "learning_rate": 4.715431249175751e-05, "loss": 0.5427539348602295, "mean_token_accuracy": 0.858744015544653, "num_tokens": 21039076.0, "step": 10290 }, { "entropy": 0.6056377184577286, "epoch": 0.16728518876428217, "grad_norm": 8.5625, "learning_rate": 4.7148301479773576e-05, "loss": 0.6022718906402588, "mean_token_accuracy": 0.8471645466983319, "num_tokens": 21058334.0, "step": 10300 }, { "entropy": 0.5987233026884496, "epoch": 0.1674476015689077, "grad_norm": 9.1875, "learning_rate": 4.714228450984677e-05, "loss": 0.6375426769256591, "mean_token_accuracy": 0.8418488562107086, "num_tokens": 21079128.0, "step": 10310 }, { "entropy": 0.610554994083941, "epoch": 0.1676100143735332, "grad_norm": 6.65625, "learning_rate": 4.7136261583595676e-05, "loss": 0.5745908737182617, "mean_token_accuracy": 0.8553778603672981, "num_tokens": 21098678.0, "step": 10320 }, { "entropy": 0.6034529755823315, "epoch": 0.16777242717815874, "grad_norm": 7.9375, "learning_rate": 4.713023270264045e-05, "loss": 0.6157416343688965, "mean_token_accuracy": 0.8498106732964515, "num_tokens": 21119826.0, "step": 10330 }, { "entropy": 0.5748192287981511, "epoch": 0.16793483998278425, "grad_norm": 8.3125, "learning_rate": 4.7124197868602916e-05, "loss": 0.5943433761596679, "mean_token_accuracy": 0.856507969275117, "num_tokens": 21140555.0, "step": 10340 }, { "entropy": 0.5567594275809824, "epoch": 0.16809725278740975, "grad_norm": 8.125, "learning_rate": 4.7118157083106415e-05, "loss": 0.5686344623565673, "mean_token_accuracy": 0.8534098178148269, "num_tokens": 21162129.0, "step": 10350 }, { "entropy": 0.585849080979824, "epoch": 0.16825966559203528, "grad_norm": 6.03125, "learning_rate": 4.711211034777596e-05, "loss": 0.585263442993164, "mean_token_accuracy": 0.8598802357912063, "num_tokens": 21183409.0, "step": 10360 }, { "entropy": 0.5705983297433704, "epoch": 0.1684220783966608, "grad_norm": 8.1875, "learning_rate": 4.710605766423813e-05, "loss": 0.5681751251220704, "mean_token_accuracy": 0.8627011843025685, "num_tokens": 21204471.0, "step": 10370 }, { "entropy": 0.6004733739420771, "epoch": 0.1685844912012863, "grad_norm": 8.8125, "learning_rate": 4.7099999034121106e-05, "loss": 0.5981147766113282, "mean_token_accuracy": 0.8471820540726185, "num_tokens": 21225477.0, "step": 10380 }, { "entropy": 0.5937882238999009, "epoch": 0.16874690400591183, "grad_norm": 9.6875, "learning_rate": 4.7093934459054676e-05, "loss": 0.6099638938903809, "mean_token_accuracy": 0.8439375191926957, "num_tokens": 21244982.0, "step": 10390 }, { "entropy": 0.6564030193723738, "epoch": 0.16890931681053734, "grad_norm": 8.8125, "learning_rate": 4.7087863940670216e-05, "loss": 0.7038453578948974, "mean_token_accuracy": 0.8276472575962543, "num_tokens": 21265465.0, "step": 10400 }, { "entropy": 0.5750477065565065, "epoch": 0.16907172961516287, "grad_norm": 7.21875, "learning_rate": 4.7081787480600726e-05, "loss": 0.5419651985168457, "mean_token_accuracy": 0.8617801934480667, "num_tokens": 21286204.0, "step": 10410 }, { "entropy": 0.5551675577647984, "epoch": 0.16923414241978837, "grad_norm": 7.5625, "learning_rate": 4.707570508048077e-05, "loss": 0.5645916938781739, "mean_token_accuracy": 0.8483758747577668, "num_tokens": 21306521.0, "step": 10420 }, { "entropy": 0.5960325178690254, "epoch": 0.16939655522441388, "grad_norm": 7.15625, "learning_rate": 4.706961674194654e-05, "loss": 0.5771548748016357, "mean_token_accuracy": 0.8501707784831524, "num_tokens": 21326752.0, "step": 10430 }, { "entropy": 0.6105166886933148, "epoch": 0.16955896802903941, "grad_norm": 9.5, "learning_rate": 4.706352246663581e-05, "loss": 0.6537672996520996, "mean_token_accuracy": 0.8330821670591831, "num_tokens": 21347222.0, "step": 10440 }, { "entropy": 0.6188543607946485, "epoch": 0.16972138083366492, "grad_norm": 7.53125, "learning_rate": 4.705742225618794e-05, "loss": 0.6583258152008057, "mean_token_accuracy": 0.8370934624224902, "num_tokens": 21366553.0, "step": 10450 }, { "entropy": 0.6345521989744156, "epoch": 0.16988379363829045, "grad_norm": 8.1875, "learning_rate": 4.7051316112243926e-05, "loss": 0.6178805351257324, "mean_token_accuracy": 0.8467279814183712, "num_tokens": 21387074.0, "step": 10460 }, { "entropy": 0.668431849218905, "epoch": 0.17004620644291596, "grad_norm": 7.25, "learning_rate": 4.704520403644632e-05, "loss": 0.6284631729125977, "mean_token_accuracy": 0.8482674896717072, "num_tokens": 21407276.0, "step": 10470 }, { "entropy": 0.5915845348499715, "epoch": 0.17020861924754146, "grad_norm": 8.75, "learning_rate": 4.703908603043928e-05, "loss": 0.64119873046875, "mean_token_accuracy": 0.8467101413756609, "num_tokens": 21428457.0, "step": 10480 }, { "entropy": 0.5231925231404603, "epoch": 0.170371032052167, "grad_norm": 8.25, "learning_rate": 4.703296209586857e-05, "loss": 0.5436205863952637, "mean_token_accuracy": 0.858207831531763, "num_tokens": 21448090.0, "step": 10490 }, { "entropy": 0.5917032637633384, "epoch": 0.1705334448567925, "grad_norm": 8.3125, "learning_rate": 4.7026832234381534e-05, "loss": 0.5627042770385742, "mean_token_accuracy": 0.8518933445215225, "num_tokens": 21469051.0, "step": 10500 }, { "entropy": 0.5583326623775065, "epoch": 0.17069585766141804, "grad_norm": 7.0625, "learning_rate": 4.7020696447627135e-05, "loss": 0.5373233795166016, "mean_token_accuracy": 0.8591613344848156, "num_tokens": 21489212.0, "step": 10510 }, { "entropy": 0.6639450607821346, "epoch": 0.17085827046604354, "grad_norm": 8.5, "learning_rate": 4.7014554737255895e-05, "loss": 0.7171398162841797, "mean_token_accuracy": 0.8222590766847133, "num_tokens": 21509362.0, "step": 10520 }, { "entropy": 0.6761670219711959, "epoch": 0.17102068327066905, "grad_norm": 9.125, "learning_rate": 4.700840710491996e-05, "loss": 0.6910423278808594, "mean_token_accuracy": 0.8262012612074614, "num_tokens": 21529451.0, "step": 10530 }, { "entropy": 0.6781721117906272, "epoch": 0.17118309607529458, "grad_norm": 6.46875, "learning_rate": 4.700225355227305e-05, "loss": 0.6644456863403321, "mean_token_accuracy": 0.8337820455431938, "num_tokens": 21550961.0, "step": 10540 }, { "entropy": 0.6340088805183768, "epoch": 0.1713455088799201, "grad_norm": 8.3125, "learning_rate": 4.699609408097049e-05, "loss": 0.6273257255554199, "mean_token_accuracy": 0.8420660763978958, "num_tokens": 21572266.0, "step": 10550 }, { "entropy": 0.6510842032730579, "epoch": 0.17150792168454562, "grad_norm": 9.0625, "learning_rate": 4.698992869266919e-05, "loss": 0.6351901054382324, "mean_token_accuracy": 0.8334381133317947, "num_tokens": 21593594.0, "step": 10560 }, { "entropy": 0.6943551875650883, "epoch": 0.17167033448917113, "grad_norm": 11.0625, "learning_rate": 4.698375738902765e-05, "loss": 0.7374504566192627, "mean_token_accuracy": 0.821067775785923, "num_tokens": 21614266.0, "step": 10570 }, { "entropy": 0.6836581083014608, "epoch": 0.17183274729379663, "grad_norm": 7.625, "learning_rate": 4.6977580171705966e-05, "loss": 0.6874443054199219, "mean_token_accuracy": 0.8279351517558098, "num_tokens": 21634106.0, "step": 10580 }, { "entropy": 0.6171251626685261, "epoch": 0.17199516009842217, "grad_norm": 7.78125, "learning_rate": 4.697139704236583e-05, "loss": 0.6435835838317872, "mean_token_accuracy": 0.8442153163254261, "num_tokens": 21654421.0, "step": 10590 }, { "entropy": 0.6085685432888568, "epoch": 0.17215757290304767, "grad_norm": 6.84375, "learning_rate": 4.69652080026705e-05, "loss": 0.6002433776855469, "mean_token_accuracy": 0.8494298763573169, "num_tokens": 21675967.0, "step": 10600 }, { "entropy": 0.5912724924273789, "epoch": 0.1723199857076732, "grad_norm": 8.8125, "learning_rate": 4.695901305428486e-05, "loss": 0.5677783966064454, "mean_token_accuracy": 0.8532762497663497, "num_tokens": 21695098.0, "step": 10610 }, { "entropy": 0.6128319635055959, "epoch": 0.1724823985122987, "grad_norm": 7.46875, "learning_rate": 4.695281219887536e-05, "loss": 0.6275811672210694, "mean_token_accuracy": 0.8459358856081962, "num_tokens": 21716548.0, "step": 10620 }, { "entropy": 0.572039258480072, "epoch": 0.17264481131692422, "grad_norm": 8.6875, "learning_rate": 4.694660543811005e-05, "loss": 0.6030188083648682, "mean_token_accuracy": 0.8532883554697037, "num_tokens": 21736454.0, "step": 10630 }, { "entropy": 0.6417946837842464, "epoch": 0.17280722412154975, "grad_norm": 8.8125, "learning_rate": 4.694039277365855e-05, "loss": 0.6691797256469727, "mean_token_accuracy": 0.8340727329254151, "num_tokens": 21756074.0, "step": 10640 }, { "entropy": 0.6199332669377327, "epoch": 0.17296963692617526, "grad_norm": 5.34375, "learning_rate": 4.693417420719208e-05, "loss": 0.5659583568572998, "mean_token_accuracy": 0.8639690816402436, "num_tokens": 21775830.0, "step": 10650 }, { "entropy": 0.6786440270021558, "epoch": 0.17313204973080076, "grad_norm": 8.3125, "learning_rate": 4.692794974038346e-05, "loss": 0.7215734958648682, "mean_token_accuracy": 0.8249361164867878, "num_tokens": 21796753.0, "step": 10660 }, { "entropy": 0.6814297997392714, "epoch": 0.1732944625354263, "grad_norm": 8.125, "learning_rate": 4.6921719374907076e-05, "loss": 0.6739514350891114, "mean_token_accuracy": 0.8306961540132761, "num_tokens": 21817382.0, "step": 10670 }, { "entropy": 0.6765802304260433, "epoch": 0.1734568753400518, "grad_norm": 7.59375, "learning_rate": 4.6915483112438916e-05, "loss": 0.7113444805145264, "mean_token_accuracy": 0.8271530359983444, "num_tokens": 21837949.0, "step": 10680 }, { "entropy": 0.6123078907839954, "epoch": 0.17361928814467734, "grad_norm": 8.8125, "learning_rate": 4.6909240954656544e-05, "loss": 0.596946907043457, "mean_token_accuracy": 0.8530781116336584, "num_tokens": 21859921.0, "step": 10690 }, { "entropy": 0.6887896069325506, "epoch": 0.17378170094930284, "grad_norm": 12.25, "learning_rate": 4.6902992903239126e-05, "loss": 0.6963600158691406, "mean_token_accuracy": 0.8260877415537834, "num_tokens": 21880022.0, "step": 10700 }, { "entropy": 0.5960656862240284, "epoch": 0.17394411375392835, "grad_norm": 8.375, "learning_rate": 4.6896738959867384e-05, "loss": 0.6011978149414062, "mean_token_accuracy": 0.8459673263132572, "num_tokens": 21901668.0, "step": 10710 }, { "entropy": 0.5453526728088036, "epoch": 0.17410652655855388, "grad_norm": 5.75, "learning_rate": 4.6890479126223654e-05, "loss": 0.5343749523162842, "mean_token_accuracy": 0.8527902200818062, "num_tokens": 21922822.0, "step": 10720 }, { "entropy": 0.6030847841873765, "epoch": 0.1742689393631794, "grad_norm": 11.0, "learning_rate": 4.688421340399185e-05, "loss": 0.6199338436126709, "mean_token_accuracy": 0.8487144328653813, "num_tokens": 21943078.0, "step": 10730 }, { "entropy": 0.5403317713178695, "epoch": 0.17443135216780492, "grad_norm": 10.875, "learning_rate": 4.687794179485745e-05, "loss": 0.6082958698272705, "mean_token_accuracy": 0.8525116287171841, "num_tokens": 21963036.0, "step": 10740 }, { "entropy": 0.6356238946318626, "epoch": 0.17459376497243043, "grad_norm": 5.75, "learning_rate": 4.6871664300507546e-05, "loss": 0.6417235851287841, "mean_token_accuracy": 0.847812169417739, "num_tokens": 21984065.0, "step": 10750 }, { "entropy": 0.635120618995279, "epoch": 0.17475617777705593, "grad_norm": 7.75, "learning_rate": 4.6865380922630786e-05, "loss": 0.6134832382202149, "mean_token_accuracy": 0.8507581070065499, "num_tokens": 22005273.0, "step": 10760 }, { "entropy": 0.6795597025193274, "epoch": 0.17491859058168147, "grad_norm": 7.09375, "learning_rate": 4.685909166291742e-05, "loss": 0.6947340965270996, "mean_token_accuracy": 0.8323920376598835, "num_tokens": 22025960.0, "step": 10770 }, { "entropy": 0.6110397621057928, "epoch": 0.17508100338630697, "grad_norm": 12.3125, "learning_rate": 4.685279652305927e-05, "loss": 0.638221263885498, "mean_token_accuracy": 0.8368886917829513, "num_tokens": 22049193.0, "step": 10780 }, { "entropy": 0.6113326961174608, "epoch": 0.1752434161909325, "grad_norm": 5.3125, "learning_rate": 4.684649550474975e-05, "loss": 0.614938497543335, "mean_token_accuracy": 0.8524614930152893, "num_tokens": 22069948.0, "step": 10790 }, { "entropy": 0.6313136884942651, "epoch": 0.175405828995558, "grad_norm": 6.8125, "learning_rate": 4.684018860968384e-05, "loss": 0.6065897941589355, "mean_token_accuracy": 0.8557863235473633, "num_tokens": 22090506.0, "step": 10800 }, { "entropy": 0.5972631795331835, "epoch": 0.17556824180018352, "grad_norm": 7.65625, "learning_rate": 4.68338758395581e-05, "loss": 0.6023406982421875, "mean_token_accuracy": 0.8473982945084572, "num_tokens": 22110431.0, "step": 10810 }, { "entropy": 0.5519067537970841, "epoch": 0.17573065460480905, "grad_norm": 7.6875, "learning_rate": 4.682755719607071e-05, "loss": 0.5770535945892334, "mean_token_accuracy": 0.8571524303406477, "num_tokens": 22130202.0, "step": 10820 }, { "entropy": 0.5809687945991755, "epoch": 0.17589306740943456, "grad_norm": 8.3125, "learning_rate": 4.682123268092137e-05, "loss": 0.6151505470275879, "mean_token_accuracy": 0.8523137882351876, "num_tokens": 22150108.0, "step": 10830 }, { "entropy": 0.5806112525984645, "epoch": 0.1760554802140601, "grad_norm": 7.9375, "learning_rate": 4.68149022958114e-05, "loss": 0.5730878353118897, "mean_token_accuracy": 0.8575144052505493, "num_tokens": 22169379.0, "step": 10840 }, { "entropy": 0.6602497113868594, "epoch": 0.1762178930186856, "grad_norm": 8.25, "learning_rate": 4.680856604244369e-05, "loss": 0.6340813159942627, "mean_token_accuracy": 0.8443503774702549, "num_tokens": 22189675.0, "step": 10850 }, { "entropy": 0.6732729093171657, "epoch": 0.1763803058233111, "grad_norm": 9.0, "learning_rate": 4.680222392252269e-05, "loss": 0.6872151851654053, "mean_token_accuracy": 0.835339380055666, "num_tokens": 22210795.0, "step": 10860 }, { "entropy": 0.5664860108867288, "epoch": 0.17654271862793663, "grad_norm": 10.1875, "learning_rate": 4.679587593775447e-05, "loss": 0.5525238990783692, "mean_token_accuracy": 0.8540775731205941, "num_tokens": 22231794.0, "step": 10870 }, { "entropy": 0.5827737994492054, "epoch": 0.17670513143256214, "grad_norm": 7.21875, "learning_rate": 4.678952208984664e-05, "loss": 0.5807932376861572, "mean_token_accuracy": 0.8526519849896431, "num_tokens": 22252305.0, "step": 10880 }, { "entropy": 0.6414047250524163, "epoch": 0.17686754423718765, "grad_norm": 8.4375, "learning_rate": 4.678316238050839e-05, "loss": 0.6418270587921142, "mean_token_accuracy": 0.845734903216362, "num_tokens": 22272523.0, "step": 10890 }, { "entropy": 0.6352237395010889, "epoch": 0.17702995704181318, "grad_norm": 7.84375, "learning_rate": 4.677679681145051e-05, "loss": 0.6773062705993652, "mean_token_accuracy": 0.8409270659089089, "num_tokens": 22294076.0, "step": 10900 }, { "entropy": 0.5979948588646948, "epoch": 0.17719236984643869, "grad_norm": 6.71875, "learning_rate": 4.6770425384385344e-05, "loss": 0.5737119197845459, "mean_token_accuracy": 0.8464342504739761, "num_tokens": 22314009.0, "step": 10910 }, { "entropy": 0.6170298194512724, "epoch": 0.17735478265106422, "grad_norm": 7.75, "learning_rate": 4.6764048101026825e-05, "loss": 0.6047065734863282, "mean_token_accuracy": 0.8543164685368538, "num_tokens": 22336064.0, "step": 10920 }, { "entropy": 0.6079199057072401, "epoch": 0.17751719545568972, "grad_norm": 7.96875, "learning_rate": 4.675766496309046e-05, "loss": 0.6036756038665771, "mean_token_accuracy": 0.8476140175014735, "num_tokens": 22355096.0, "step": 10930 }, { "entropy": 0.6273944883607327, "epoch": 0.17767960826031523, "grad_norm": 9.3125, "learning_rate": 4.675127597229332e-05, "loss": 0.6007763385772705, "mean_token_accuracy": 0.8472405135631561, "num_tokens": 22376721.0, "step": 10940 }, { "entropy": 0.6312616460025311, "epoch": 0.17784202106494076, "grad_norm": 11.875, "learning_rate": 4.6744881130354056e-05, "loss": 0.6448246955871582, "mean_token_accuracy": 0.8414410702884197, "num_tokens": 22397526.0, "step": 10950 }, { "entropy": 0.6069944577291608, "epoch": 0.17800443386956627, "grad_norm": 9.125, "learning_rate": 4.67384804389929e-05, "loss": 0.6356436729431152, "mean_token_accuracy": 0.8389561884105206, "num_tokens": 22418091.0, "step": 10960 }, { "entropy": 0.5530365534126759, "epoch": 0.1781668466741918, "grad_norm": 7.0625, "learning_rate": 4.673207389993166e-05, "loss": 0.5295453071594238, "mean_token_accuracy": 0.8684907328337431, "num_tokens": 22438771.0, "step": 10970 }, { "entropy": 0.5843997832387686, "epoch": 0.1783292594788173, "grad_norm": 7.71875, "learning_rate": 4.6725661514893696e-05, "loss": 0.5798361301422119, "mean_token_accuracy": 0.8562892414629459, "num_tokens": 22459254.0, "step": 10980 }, { "entropy": 0.5853789418935775, "epoch": 0.17849167228344281, "grad_norm": 5.5, "learning_rate": 4.671924328560396e-05, "loss": 0.6005899429321289, "mean_token_accuracy": 0.8469374477863312, "num_tokens": 22480369.0, "step": 10990 }, { "entropy": 0.589882192388177, "epoch": 0.17865408508806835, "grad_norm": 5.875, "learning_rate": 4.671281921378897e-05, "loss": 0.5855106353759766, "mean_token_accuracy": 0.8496033824980259, "num_tokens": 22501009.0, "step": 11000 }, { "entropy": 0.5323560175485909, "epoch": 0.17881649789269385, "grad_norm": 7.96875, "learning_rate": 4.670638930117681e-05, "loss": 0.5418843746185302, "mean_token_accuracy": 0.8670040659606457, "num_tokens": 22520545.0, "step": 11010 }, { "entropy": 0.608418776281178, "epoch": 0.1789789106973194, "grad_norm": 9.0, "learning_rate": 4.6699953549497156e-05, "loss": 0.6710271835327148, "mean_token_accuracy": 0.8405123308300972, "num_tokens": 22542378.0, "step": 11020 }, { "entropy": 0.5733260607346893, "epoch": 0.1791413235019449, "grad_norm": 8.4375, "learning_rate": 4.669351196048122e-05, "loss": 0.5523947715759278, "mean_token_accuracy": 0.8474179647862912, "num_tokens": 22562329.0, "step": 11030 }, { "entropy": 0.6337099796161055, "epoch": 0.1793037363065704, "grad_norm": 8.125, "learning_rate": 4.668706453586181e-05, "loss": 0.6196693420410156, "mean_token_accuracy": 0.8471325434744358, "num_tokens": 22584193.0, "step": 11040 }, { "entropy": 0.6362235917709768, "epoch": 0.17946614911119593, "grad_norm": 6.21875, "learning_rate": 4.668061127737332e-05, "loss": 0.6721042633056641, "mean_token_accuracy": 0.8359228141605854, "num_tokens": 22604041.0, "step": 11050 }, { "entropy": 0.6092807310633361, "epoch": 0.17962856191582144, "grad_norm": 9.125, "learning_rate": 4.667415218675165e-05, "loss": 0.5539704322814941, "mean_token_accuracy": 0.8553075969219208, "num_tokens": 22624723.0, "step": 11060 }, { "entropy": 0.5759239071980119, "epoch": 0.17979097472044697, "grad_norm": 12.75, "learning_rate": 4.666768726573435e-05, "loss": 0.5975768089294433, "mean_token_accuracy": 0.8472062081098557, "num_tokens": 22645678.0, "step": 11070 }, { "entropy": 0.6080147368367761, "epoch": 0.17995338752507248, "grad_norm": 10.25, "learning_rate": 4.666121651606047e-05, "loss": 0.6572309970855713, "mean_token_accuracy": 0.8465596012771129, "num_tokens": 22667241.0, "step": 11080 }, { "entropy": 0.6499949716031551, "epoch": 0.18011580032969798, "grad_norm": 11.125, "learning_rate": 4.665473993947067e-05, "loss": 0.6843333721160889, "mean_token_accuracy": 0.8348166979849339, "num_tokens": 22686897.0, "step": 11090 }, { "entropy": 0.6501326019875705, "epoch": 0.18027821313432352, "grad_norm": 6.84375, "learning_rate": 4.6648257537707155e-05, "loss": 0.6440104007720947, "mean_token_accuracy": 0.849724854528904, "num_tokens": 22707449.0, "step": 11100 }, { "entropy": 0.6061643383465707, "epoch": 0.18044062593894902, "grad_norm": 6.75, "learning_rate": 4.6641769312513714e-05, "loss": 0.5639350414276123, "mean_token_accuracy": 0.857370761781931, "num_tokens": 22727456.0, "step": 11110 }, { "entropy": 0.5360599214211106, "epoch": 0.18060303874357456, "grad_norm": 9.5, "learning_rate": 4.6635275265635694e-05, "loss": 0.5453049659729003, "mean_token_accuracy": 0.8583155244588851, "num_tokens": 22747733.0, "step": 11120 }, { "entropy": 0.622758490499109, "epoch": 0.18076545154820006, "grad_norm": 10.875, "learning_rate": 4.662877539882001e-05, "loss": 0.6537322521209716, "mean_token_accuracy": 0.8441423065960407, "num_tokens": 22767066.0, "step": 11130 }, { "entropy": 0.5657371178735048, "epoch": 0.18092786435282557, "grad_norm": 9.6875, "learning_rate": 4.662226971381513e-05, "loss": 0.5762892246246338, "mean_token_accuracy": 0.8549931004643441, "num_tokens": 22786607.0, "step": 11140 }, { "entropy": 0.5394769676961004, "epoch": 0.1810902771574511, "grad_norm": 8.125, "learning_rate": 4.66157582123711e-05, "loss": 0.5325759410858154, "mean_token_accuracy": 0.8651075452566147, "num_tokens": 22806453.0, "step": 11150 }, { "entropy": 0.6356092429719865, "epoch": 0.1812526899620766, "grad_norm": 6.78125, "learning_rate": 4.6609240896239534e-05, "loss": 0.637923002243042, "mean_token_accuracy": 0.8396657794713974, "num_tokens": 22826619.0, "step": 11160 }, { "entropy": 0.6450096301734447, "epoch": 0.1814151027667021, "grad_norm": 6.78125, "learning_rate": 4.660271776717361e-05, "loss": 0.6121939182281494, "mean_token_accuracy": 0.8498387351632118, "num_tokens": 22846502.0, "step": 11170 }, { "entropy": 0.6279677834361792, "epoch": 0.18157751557132765, "grad_norm": 7.875, "learning_rate": 4.659618882692805e-05, "loss": 0.6552072525024414, "mean_token_accuracy": 0.8420822951942682, "num_tokens": 22866502.0, "step": 11180 }, { "entropy": 0.5738108268007636, "epoch": 0.18173992837595315, "grad_norm": 8.4375, "learning_rate": 4.658965407725916e-05, "loss": 0.5637845993041992, "mean_token_accuracy": 0.845904940366745, "num_tokens": 22887661.0, "step": 11190 }, { "entropy": 0.518202861584723, "epoch": 0.18190234118057869, "grad_norm": 9.25, "learning_rate": 4.6583113519924815e-05, "loss": 0.5322105884552002, "mean_token_accuracy": 0.8660988800227643, "num_tokens": 22907126.0, "step": 11200 }, { "entropy": 0.6461315168417059, "epoch": 0.1820647539852042, "grad_norm": 5.53125, "learning_rate": 4.657656715668442e-05, "loss": 0.676042127609253, "mean_token_accuracy": 0.8293530806899071, "num_tokens": 22929119.0, "step": 11210 }, { "entropy": 0.6140487620607018, "epoch": 0.1822271667898297, "grad_norm": 7.21875, "learning_rate": 4.657001498929897e-05, "loss": 0.6162654399871826, "mean_token_accuracy": 0.8537043545395135, "num_tokens": 22950175.0, "step": 11220 }, { "entropy": 0.5411909286864102, "epoch": 0.18238957959445523, "grad_norm": 7.1875, "learning_rate": 4.656345701953101e-05, "loss": 0.5150916099548339, "mean_token_accuracy": 0.8698645062744618, "num_tokens": 22971493.0, "step": 11230 }, { "entropy": 0.6187210272997617, "epoch": 0.18255199239908074, "grad_norm": 9.0625, "learning_rate": 4.6556893249144654e-05, "loss": 0.6413628101348877, "mean_token_accuracy": 0.8356572844088077, "num_tokens": 22991445.0, "step": 11240 }, { "entropy": 0.5899793728254735, "epoch": 0.18271440520370627, "grad_norm": 10.4375, "learning_rate": 4.655032367990557e-05, "loss": 0.6310328960418701, "mean_token_accuracy": 0.840613280236721, "num_tokens": 23010450.0, "step": 11250 }, { "entropy": 0.6489702215418219, "epoch": 0.18287681800833178, "grad_norm": 9.9375, "learning_rate": 4.654374831358098e-05, "loss": 0.6480605602264404, "mean_token_accuracy": 0.8406102821230889, "num_tokens": 23032489.0, "step": 11260 }, { "entropy": 0.5562030443921685, "epoch": 0.18303923081295728, "grad_norm": 7.1875, "learning_rate": 4.653716715193968e-05, "loss": 0.6100626945495605, "mean_token_accuracy": 0.8498644292354584, "num_tokens": 23051978.0, "step": 11270 }, { "entropy": 0.5883121547289193, "epoch": 0.18320164361758282, "grad_norm": 8.0, "learning_rate": 4.6530580196752015e-05, "loss": 0.5543926239013672, "mean_token_accuracy": 0.8623779296875, "num_tokens": 23071896.0, "step": 11280 }, { "entropy": 0.5047340583987534, "epoch": 0.18336405642220832, "grad_norm": 4.96875, "learning_rate": 4.6523987449789885e-05, "loss": 0.5033855438232422, "mean_token_accuracy": 0.8689239278435708, "num_tokens": 23093232.0, "step": 11290 }, { "entropy": 0.5638967530801893, "epoch": 0.18352646922683385, "grad_norm": 9.375, "learning_rate": 4.6517388912826763e-05, "loss": 0.5758753776550293, "mean_token_accuracy": 0.8549058258533477, "num_tokens": 23113377.0, "step": 11300 }, { "entropy": 0.5715846370905637, "epoch": 0.18368888203145936, "grad_norm": 8.625, "learning_rate": 4.651078458763767e-05, "loss": 0.6035704135894775, "mean_token_accuracy": 0.8475138381123543, "num_tokens": 23135211.0, "step": 11310 }, { "entropy": 0.5947141963988543, "epoch": 0.18385129483608487, "grad_norm": 8.0625, "learning_rate": 4.6504174475999174e-05, "loss": 0.6079383850097656, "mean_token_accuracy": 0.8471342951059342, "num_tokens": 23156141.0, "step": 11320 }, { "entropy": 0.6095105501823127, "epoch": 0.1840137076407104, "grad_norm": 6.6875, "learning_rate": 4.649755857968942e-05, "loss": 0.608941650390625, "mean_token_accuracy": 0.8421090051531792, "num_tokens": 23176547.0, "step": 11330 }, { "entropy": 0.5989863969385624, "epoch": 0.1841761204453359, "grad_norm": 6.625, "learning_rate": 4.6490936900488096e-05, "loss": 0.6429137706756591, "mean_token_accuracy": 0.8409624509513378, "num_tokens": 23196869.0, "step": 11340 }, { "entropy": 0.5538722459226847, "epoch": 0.18433853324996144, "grad_norm": 5.59375, "learning_rate": 4.648430944017644e-05, "loss": 0.5704489707946777, "mean_token_accuracy": 0.8609937012195588, "num_tokens": 23217310.0, "step": 11350 }, { "entropy": 0.6208458315581084, "epoch": 0.18450094605458695, "grad_norm": 8.6875, "learning_rate": 4.647767620053727e-05, "loss": 0.6122315406799317, "mean_token_accuracy": 0.8450802378356457, "num_tokens": 23237880.0, "step": 11360 }, { "entropy": 0.5913416612893343, "epoch": 0.18466335885921245, "grad_norm": 5.15625, "learning_rate": 4.6471037183354936e-05, "loss": 0.5684560775756836, "mean_token_accuracy": 0.8536857448518276, "num_tokens": 23258935.0, "step": 11370 }, { "entropy": 0.6448482762090861, "epoch": 0.18482577166383798, "grad_norm": 6.53125, "learning_rate": 4.646439239041534e-05, "loss": 0.6638885974884033, "mean_token_accuracy": 0.8385859522968531, "num_tokens": 23280937.0, "step": 11380 }, { "entropy": 0.6316696994006634, "epoch": 0.1849881844684635, "grad_norm": 8.125, "learning_rate": 4.6457741823505956e-05, "loss": 0.6612439155578613, "mean_token_accuracy": 0.8354389876127243, "num_tokens": 23302581.0, "step": 11390 }, { "entropy": 0.6395163542591036, "epoch": 0.18515059727308902, "grad_norm": 7.25, "learning_rate": 4.64510854844158e-05, "loss": 0.6510869026184082, "mean_token_accuracy": 0.8346766863018275, "num_tokens": 23323339.0, "step": 11400 }, { "entropy": 0.5586938069202005, "epoch": 0.18531301007771453, "grad_norm": 7.46875, "learning_rate": 4.6444423374935436e-05, "loss": 0.507680606842041, "mean_token_accuracy": 0.8696677081286908, "num_tokens": 23343155.0, "step": 11410 }, { "entropy": 0.5520674834027887, "epoch": 0.18547542288234004, "grad_norm": 8.8125, "learning_rate": 4.643775549685699e-05, "loss": 0.5349523067474365, "mean_token_accuracy": 0.8678378507494926, "num_tokens": 23363569.0, "step": 11420 }, { "entropy": 0.6324312012642622, "epoch": 0.18563783568696557, "grad_norm": 8.5, "learning_rate": 4.643108185197414e-05, "loss": 0.6364957332611084, "mean_token_accuracy": 0.8420477129518986, "num_tokens": 23383718.0, "step": 11430 }, { "entropy": 0.5789354477077723, "epoch": 0.18580024849159107, "grad_norm": 8.875, "learning_rate": 4.64244024420821e-05, "loss": 0.6040971279144287, "mean_token_accuracy": 0.8514778058975935, "num_tokens": 23403636.0, "step": 11440 }, { "entropy": 0.5714084260165692, "epoch": 0.18596266129621658, "grad_norm": 6.625, "learning_rate": 4.6417717268977665e-05, "loss": 0.5539509296417237, "mean_token_accuracy": 0.8528409779071808, "num_tokens": 23425599.0, "step": 11450 }, { "entropy": 0.6188283680006862, "epoch": 0.18612507410084211, "grad_norm": 10.625, "learning_rate": 4.641102633445915e-05, "loss": 0.6770379066467285, "mean_token_accuracy": 0.8255448900163174, "num_tokens": 23446559.0, "step": 11460 }, { "entropy": 0.5487773073837161, "epoch": 0.18628748690546762, "grad_norm": 4.8125, "learning_rate": 4.640432964032644e-05, "loss": 0.5427996158599854, "mean_token_accuracy": 0.8605930663645267, "num_tokens": 23466608.0, "step": 11470 }, { "entropy": 0.5994386035948992, "epoch": 0.18644989971009315, "grad_norm": 9.3125, "learning_rate": 4.6397627188380946e-05, "loss": 0.6010112762451172, "mean_token_accuracy": 0.8474491968750953, "num_tokens": 23486326.0, "step": 11480 }, { "entropy": 0.5763688830658793, "epoch": 0.18661231251471866, "grad_norm": 8.5625, "learning_rate": 4.6390918980425647e-05, "loss": 0.5786778926849365, "mean_token_accuracy": 0.8502227276563644, "num_tokens": 23505775.0, "step": 11490 }, { "entropy": 0.6072590574622154, "epoch": 0.18677472531934416, "grad_norm": 7.65625, "learning_rate": 4.638420501826507e-05, "loss": 0.5698222160339356, "mean_token_accuracy": 0.8524160712957383, "num_tokens": 23525161.0, "step": 11500 }, { "entropy": 0.5710085694678128, "epoch": 0.1869371381239697, "grad_norm": 6.6875, "learning_rate": 4.637748530370529e-05, "loss": 0.6042403697967529, "mean_token_accuracy": 0.8427183195948601, "num_tokens": 23544901.0, "step": 11510 }, { "entropy": 0.6102345215156675, "epoch": 0.1870995509285952, "grad_norm": 6.59375, "learning_rate": 4.637075983855391e-05, "loss": 0.6511147499084473, "mean_token_accuracy": 0.8361846413463354, "num_tokens": 23564850.0, "step": 11520 }, { "entropy": 0.6077489078976214, "epoch": 0.18726196373322074, "grad_norm": 6.84375, "learning_rate": 4.6364028624620115e-05, "loss": 0.6187078952789307, "mean_token_accuracy": 0.845134174823761, "num_tokens": 23585786.0, "step": 11530 }, { "entropy": 0.5890426313504576, "epoch": 0.18742437653784624, "grad_norm": 8.0625, "learning_rate": 4.635729166371461e-05, "loss": 0.5800262451171875, "mean_token_accuracy": 0.8502888932824135, "num_tokens": 23605510.0, "step": 11540 }, { "entropy": 0.572234072163701, "epoch": 0.18758678934247175, "grad_norm": 5.8125, "learning_rate": 4.6350548957649644e-05, "loss": 0.5232526779174804, "mean_token_accuracy": 0.861703735589981, "num_tokens": 23624877.0, "step": 11550 }, { "entropy": 0.6060842154547572, "epoch": 0.18774920214709728, "grad_norm": 7.1875, "learning_rate": 4.634380050823902e-05, "loss": 0.6746888160705566, "mean_token_accuracy": 0.8327226176857948, "num_tokens": 23645022.0, "step": 11560 }, { "entropy": 0.5589473262429238, "epoch": 0.1879116149517228, "grad_norm": 5.78125, "learning_rate": 4.633704631729811e-05, "loss": 0.5405016422271729, "mean_token_accuracy": 0.8564403526484966, "num_tokens": 23664351.0, "step": 11570 }, { "entropy": 0.5991588875651359, "epoch": 0.18807402775634832, "grad_norm": 7.4375, "learning_rate": 4.6330286386643775e-05, "loss": 0.6078540325164795, "mean_token_accuracy": 0.8473441913723946, "num_tokens": 23685274.0, "step": 11580 }, { "entropy": 0.5984087789431214, "epoch": 0.18823644056097383, "grad_norm": 8.25, "learning_rate": 4.632352071809446e-05, "loss": 0.6191217422485351, "mean_token_accuracy": 0.838365388661623, "num_tokens": 23705371.0, "step": 11590 }, { "entropy": 0.6619485140778124, "epoch": 0.18839885336559933, "grad_norm": 5.71875, "learning_rate": 4.631674931347017e-05, "loss": 0.6891249179840088, "mean_token_accuracy": 0.8329481985419989, "num_tokens": 23726303.0, "step": 11600 }, { "entropy": 0.5806306603364646, "epoch": 0.18856126617022487, "grad_norm": 7.15625, "learning_rate": 4.630997217459239e-05, "loss": 0.5531257152557373, "mean_token_accuracy": 0.8558954007923603, "num_tokens": 23745604.0, "step": 11610 }, { "entropy": 0.5989479161798954, "epoch": 0.18872367897485037, "grad_norm": 8.5625, "learning_rate": 4.630318930328421e-05, "loss": 0.561142873764038, "mean_token_accuracy": 0.8608078248798847, "num_tokens": 23765378.0, "step": 11620 }, { "entropy": 0.5502746394835413, "epoch": 0.1888860917794759, "grad_norm": 9.3125, "learning_rate": 4.629640070137023e-05, "loss": 0.6189996719360351, "mean_token_accuracy": 0.8484484314918518, "num_tokens": 23786104.0, "step": 11630 }, { "entropy": 0.6045003263279796, "epoch": 0.1890485045841014, "grad_norm": 8.375, "learning_rate": 4.62896063706766e-05, "loss": 0.639933967590332, "mean_token_accuracy": 0.8455297954380512, "num_tokens": 23807812.0, "step": 11640 }, { "entropy": 0.5947369188070297, "epoch": 0.18921091738872692, "grad_norm": 7.3125, "learning_rate": 4.6282806313031014e-05, "loss": 0.6229263782501221, "mean_token_accuracy": 0.84931422136724, "num_tokens": 23828831.0, "step": 11650 }, { "entropy": 0.5550688760355115, "epoch": 0.18937333019335245, "grad_norm": 7.34375, "learning_rate": 4.62760005302627e-05, "loss": 0.5538161277770997, "mean_token_accuracy": 0.8545195765793323, "num_tokens": 23849000.0, "step": 11660 }, { "entropy": 0.5729357229545713, "epoch": 0.18953574299797796, "grad_norm": 10.375, "learning_rate": 4.626918902420243e-05, "loss": 0.5721407890319824, "mean_token_accuracy": 0.8482706271111965, "num_tokens": 23871039.0, "step": 11670 }, { "entropy": 0.5566247878596187, "epoch": 0.1896981558026035, "grad_norm": 10.25, "learning_rate": 4.626237179668251e-05, "loss": 0.5426021099090577, "mean_token_accuracy": 0.855032379925251, "num_tokens": 23890811.0, "step": 11680 }, { "entropy": 0.5885805001482367, "epoch": 0.189860568607229, "grad_norm": 7.25, "learning_rate": 4.625554884953679e-05, "loss": 0.5761745929718017, "mean_token_accuracy": 0.8414988122880459, "num_tokens": 23911690.0, "step": 11690 }, { "entropy": 0.5638963340781629, "epoch": 0.1900229814118545, "grad_norm": 7.71875, "learning_rate": 4.6248720184600664e-05, "loss": 0.5529824256896972, "mean_token_accuracy": 0.8537318170070648, "num_tokens": 23932474.0, "step": 11700 }, { "entropy": 0.7039069826714694, "epoch": 0.19018539421648004, "grad_norm": 7.84375, "learning_rate": 4.6241885803711055e-05, "loss": 0.7582479000091553, "mean_token_accuracy": 0.8250743001699448, "num_tokens": 23953149.0, "step": 11710 }, { "entropy": 0.6131513524800539, "epoch": 0.19034780702110554, "grad_norm": 8.8125, "learning_rate": 4.6235045708706426e-05, "loss": 0.6371394157409668, "mean_token_accuracy": 0.841522041708231, "num_tokens": 23973637.0, "step": 11720 }, { "entropy": 0.7674106302438304, "epoch": 0.19051021982573105, "grad_norm": 10.9375, "learning_rate": 4.622819990142678e-05, "loss": 0.7631343841552735, "mean_token_accuracy": 0.8224827516824007, "num_tokens": 23993107.0, "step": 11730 }, { "entropy": 0.6727558286860585, "epoch": 0.19067263263035658, "grad_norm": 6.875, "learning_rate": 4.6221348383713645e-05, "loss": 0.6429602146148682, "mean_token_accuracy": 0.8432405613362789, "num_tokens": 24013651.0, "step": 11740 }, { "entropy": 0.6304172269999981, "epoch": 0.1908350454349821, "grad_norm": 8.25, "learning_rate": 4.6214491157410114e-05, "loss": 0.6969801902770996, "mean_token_accuracy": 0.8280431032180786, "num_tokens": 24033391.0, "step": 11750 }, { "entropy": 0.5995217938907444, "epoch": 0.19099745823960762, "grad_norm": 10.0625, "learning_rate": 4.6207628224360784e-05, "loss": 0.6132400512695313, "mean_token_accuracy": 0.8412525109946728, "num_tokens": 24053390.0, "step": 11760 }, { "entropy": 0.6190703211352229, "epoch": 0.19115987104423313, "grad_norm": 7.9375, "learning_rate": 4.620075958641179e-05, "loss": 0.6451432704925537, "mean_token_accuracy": 0.8455492798238993, "num_tokens": 24073824.0, "step": 11770 }, { "entropy": 0.6562349705956876, "epoch": 0.19132228384885863, "grad_norm": 7.59375, "learning_rate": 4.6193885245410826e-05, "loss": 0.6470342636108398, "mean_token_accuracy": 0.8407332591712475, "num_tokens": 24094013.0, "step": 11780 }, { "entropy": 0.5651896812021733, "epoch": 0.19148469665348417, "grad_norm": 8.0, "learning_rate": 4.618700520320711e-05, "loss": 0.5558263301849365, "mean_token_accuracy": 0.8527702510356903, "num_tokens": 24113113.0, "step": 11790 }, { "entropy": 0.7047504777088761, "epoch": 0.19164710945810967, "grad_norm": 5.75, "learning_rate": 4.6180119461651375e-05, "loss": 0.6877196788787842, "mean_token_accuracy": 0.8346897013485431, "num_tokens": 24134457.0, "step": 11800 }, { "entropy": 0.4878023267257959, "epoch": 0.1918095222627352, "grad_norm": 8.5, "learning_rate": 4.61732280225959e-05, "loss": 0.4870959758758545, "mean_token_accuracy": 0.8794792555272579, "num_tokens": 24154058.0, "step": 11810 }, { "entropy": 0.5612718896009028, "epoch": 0.1919719350673607, "grad_norm": 6.71875, "learning_rate": 4.61663308878945e-05, "loss": 0.5664602279663086, "mean_token_accuracy": 0.8527847126126289, "num_tokens": 24175371.0, "step": 11820 }, { "entropy": 0.5913427806459367, "epoch": 0.19213434787198622, "grad_norm": 9.8125, "learning_rate": 4.6159428059402536e-05, "loss": 0.612132215499878, "mean_token_accuracy": 0.8464497491717339, "num_tokens": 24195440.0, "step": 11830 }, { "entropy": 0.622787051834166, "epoch": 0.19229676067661175, "grad_norm": 6.03125, "learning_rate": 4.615251953897687e-05, "loss": 0.5943440437316895, "mean_token_accuracy": 0.8490841206163168, "num_tokens": 24216256.0, "step": 11840 }, { "entropy": 0.6061259699054062, "epoch": 0.19245917348123726, "grad_norm": 12.75, "learning_rate": 4.61456053284759e-05, "loss": 0.62724928855896, "mean_token_accuracy": 0.8399424858391284, "num_tokens": 24237488.0, "step": 11850 }, { "entropy": 0.5865895381197334, "epoch": 0.1926215862858628, "grad_norm": 9.4375, "learning_rate": 4.613868542975958e-05, "loss": 0.6027060508728027, "mean_token_accuracy": 0.8473015904426575, "num_tokens": 24259264.0, "step": 11860 }, { "entropy": 0.621085929311812, "epoch": 0.1927839990904883, "grad_norm": 6.75, "learning_rate": 4.613175984468937e-05, "loss": 0.6310685157775879, "mean_token_accuracy": 0.832755483686924, "num_tokens": 24281295.0, "step": 11870 }, { "entropy": 0.6070008102804423, "epoch": 0.1929464118951138, "grad_norm": 9.0, "learning_rate": 4.6124828575128276e-05, "loss": 0.5890292644500732, "mean_token_accuracy": 0.8455547466874123, "num_tokens": 24300892.0, "step": 11880 }, { "entropy": 0.5771111030131578, "epoch": 0.19310882469973933, "grad_norm": 8.1875, "learning_rate": 4.611789162294082e-05, "loss": 0.6208341121673584, "mean_token_accuracy": 0.8475520819425583, "num_tokens": 24320874.0, "step": 11890 }, { "entropy": 0.6597407171502709, "epoch": 0.19327123750436484, "grad_norm": 8.25, "learning_rate": 4.611094898999305e-05, "loss": 0.6532712936401367, "mean_token_accuracy": 0.8465806555002928, "num_tokens": 24341321.0, "step": 11900 }, { "entropy": 0.5456974997185171, "epoch": 0.19343365030899037, "grad_norm": 8.5625, "learning_rate": 4.610400067815257e-05, "loss": 0.5554890155792236, "mean_token_accuracy": 0.8589973010122776, "num_tokens": 24360405.0, "step": 11910 }, { "entropy": 0.6638603099156171, "epoch": 0.19359606311361588, "grad_norm": 6.3125, "learning_rate": 4.609704668928848e-05, "loss": 0.661817979812622, "mean_token_accuracy": 0.8369853772222996, "num_tokens": 24380332.0, "step": 11920 }, { "entropy": 0.614758375287056, "epoch": 0.19375847591824139, "grad_norm": 9.875, "learning_rate": 4.60900870252714e-05, "loss": 0.6699307918548584, "mean_token_accuracy": 0.8342101223766804, "num_tokens": 24402414.0, "step": 11930 }, { "entropy": 0.7106262544635683, "epoch": 0.19392088872286692, "grad_norm": 10.5625, "learning_rate": 4.608312168797353e-05, "loss": 0.7082159519195557, "mean_token_accuracy": 0.832688856124878, "num_tokens": 24423182.0, "step": 11940 }, { "entropy": 0.650323319947347, "epoch": 0.19408330152749242, "grad_norm": 7.09375, "learning_rate": 4.607615067926854e-05, "loss": 0.5938681125640869, "mean_token_accuracy": 0.8429953418672085, "num_tokens": 24443395.0, "step": 11950 }, { "entropy": 0.6124298573471606, "epoch": 0.19424571433211796, "grad_norm": 7.875, "learning_rate": 4.6069174001031644e-05, "loss": 0.6113751888275146, "mean_token_accuracy": 0.8444213792681694, "num_tokens": 24464007.0, "step": 11960 }, { "entropy": 0.6030102519318461, "epoch": 0.19440812713674346, "grad_norm": 5.96875, "learning_rate": 4.60621916551396e-05, "loss": 0.601668119430542, "mean_token_accuracy": 0.8506322573870421, "num_tokens": 24484337.0, "step": 11970 }, { "entropy": 0.6361741611734033, "epoch": 0.19457053994136897, "grad_norm": 6.625, "learning_rate": 4.605520364347067e-05, "loss": 0.6812771797180176, "mean_token_accuracy": 0.8322399992495775, "num_tokens": 24505336.0, "step": 11980 }, { "entropy": 0.5935441061388701, "epoch": 0.1947329527459945, "grad_norm": 8.75, "learning_rate": 4.604820996790463e-05, "loss": 0.6081809997558594, "mean_token_accuracy": 0.8515283331274986, "num_tokens": 24525417.0, "step": 11990 }, { "epoch": 0.19489536555062, "eval_entropy": 0.6352745468616485, "eval_loss": 0.6333270072937012, "eval_mean_token_accuracy": 0.8394083044528962, "eval_num_tokens": 24545303.0, "eval_runtime": 40.3085, "eval_samples_per_second": 49.617, "eval_steps_per_second": 6.202, "step": 12000 }, { "entropy": 0.5842212397838011, "epoch": 0.19505777835524551, "grad_norm": 6.84375, "learning_rate": 4.6034205632608055e-05, "loss": 0.582798957824707, "mean_token_accuracy": 0.8542703567072749, "num_tokens": 24566632.0, "step": 12010 }, { "entropy": 0.5612338077276945, "epoch": 0.19522019115987105, "grad_norm": 7.3125, "learning_rate": 4.60271949766447e-05, "loss": 0.5664519309997559, "mean_token_accuracy": 0.850143076479435, "num_tokens": 24586892.0, "step": 12020 }, { "entropy": 0.6560438976623117, "epoch": 0.19538260396449655, "grad_norm": 8.8125, "learning_rate": 4.602017866431865e-05, "loss": 0.6273918151855469, "mean_token_accuracy": 0.8384039390832185, "num_tokens": 24607205.0, "step": 12030 }, { "entropy": 0.5763902154751122, "epoch": 0.1955450167691221, "grad_norm": 7.1875, "learning_rate": 4.601315669751729e-05, "loss": 0.5894418239593506, "mean_token_accuracy": 0.8517339989542961, "num_tokens": 24626219.0, "step": 12040 }, { "entropy": 0.6443814169615507, "epoch": 0.1957074295737476, "grad_norm": 8.375, "learning_rate": 4.600612907812956e-05, "loss": 0.6380340099334717, "mean_token_accuracy": 0.8465047001838684, "num_tokens": 24645825.0, "step": 12050 }, { "entropy": 0.6643472737632692, "epoch": 0.1958698423783731, "grad_norm": 7.3125, "learning_rate": 4.599909580804589e-05, "loss": 0.7097051620483399, "mean_token_accuracy": 0.8234158299863339, "num_tokens": 24665422.0, "step": 12060 }, { "entropy": 0.5927482888102531, "epoch": 0.19603225518299863, "grad_norm": 7.65625, "learning_rate": 4.599205688915826e-05, "loss": 0.5924841880798339, "mean_token_accuracy": 0.8567998267710208, "num_tokens": 24687497.0, "step": 12070 }, { "entropy": 0.6623673619702458, "epoch": 0.19619466798762414, "grad_norm": 6.5, "learning_rate": 4.5985012323360154e-05, "loss": 0.6647514343261719, "mean_token_accuracy": 0.8347026467323303, "num_tokens": 24709193.0, "step": 12080 }, { "entropy": 0.5642630288377404, "epoch": 0.19635708079224967, "grad_norm": 6.90625, "learning_rate": 4.597796211254658e-05, "loss": 0.5989195823669433, "mean_token_accuracy": 0.8474084064364433, "num_tokens": 24730282.0, "step": 12090 }, { "entropy": 0.5500552109675482, "epoch": 0.19651949359687518, "grad_norm": 6.1875, "learning_rate": 4.597090625861404e-05, "loss": 0.6277587890625, "mean_token_accuracy": 0.8525433756411076, "num_tokens": 24751481.0, "step": 12100 }, { "entropy": 0.5770912560634315, "epoch": 0.19668190640150068, "grad_norm": 9.4375, "learning_rate": 4.5963844763460586e-05, "loss": 0.5572945594787597, "mean_token_accuracy": 0.8621942054480314, "num_tokens": 24772257.0, "step": 12110 }, { "entropy": 0.6638257725164294, "epoch": 0.19684431920612622, "grad_norm": 9.9375, "learning_rate": 4.5956777628985786e-05, "loss": 0.6389250755310059, "mean_token_accuracy": 0.8278104931116104, "num_tokens": 24792250.0, "step": 12120 }, { "entropy": 0.6357780814170837, "epoch": 0.19700673201075172, "grad_norm": 8.25, "learning_rate": 4.59497048570907e-05, "loss": 0.6687206268310547, "mean_token_accuracy": 0.8391313157975674, "num_tokens": 24812178.0, "step": 12130 }, { "entropy": 0.5939867103472352, "epoch": 0.19716914481537726, "grad_norm": 14.625, "learning_rate": 4.594262644967793e-05, "loss": 0.5968604564666748, "mean_token_accuracy": 0.8549564704298973, "num_tokens": 24832205.0, "step": 12140 }, { "entropy": 0.563919450622052, "epoch": 0.19733155762000276, "grad_norm": 8.5625, "learning_rate": 4.5935542408651576e-05, "loss": 0.5433680057525635, "mean_token_accuracy": 0.8539632156491279, "num_tokens": 24852209.0, "step": 12150 }, { "entropy": 0.677375310845673, "epoch": 0.19749397042462827, "grad_norm": 7.3125, "learning_rate": 4.592845273591727e-05, "loss": 0.6873537540435791, "mean_token_accuracy": 0.8329411759972573, "num_tokens": 24874039.0, "step": 12160 }, { "entropy": 0.5796006670221686, "epoch": 0.1976563832292538, "grad_norm": 9.625, "learning_rate": 4.592135743338214e-05, "loss": 0.5948408126831055, "mean_token_accuracy": 0.8498248875141143, "num_tokens": 24894232.0, "step": 12170 }, { "entropy": 0.5285936133936048, "epoch": 0.1978187960338793, "grad_norm": 7.4375, "learning_rate": 4.5914256502954843e-05, "loss": 0.5077470779418946, "mean_token_accuracy": 0.8718863628804684, "num_tokens": 24914862.0, "step": 12180 }, { "entropy": 0.5790426744148135, "epoch": 0.19798120883850484, "grad_norm": 5.6875, "learning_rate": 4.590714994654555e-05, "loss": 0.6062549114227295, "mean_token_accuracy": 0.8500985227525234, "num_tokens": 24935027.0, "step": 12190 }, { "entropy": 0.6258042281493544, "epoch": 0.19814362164313035, "grad_norm": 11.375, "learning_rate": 4.590003776606593e-05, "loss": 0.5895543098449707, "mean_token_accuracy": 0.8503380060195923, "num_tokens": 24954785.0, "step": 12200 }, { "entropy": 0.6277354843914509, "epoch": 0.19830603444775585, "grad_norm": 9.4375, "learning_rate": 4.589291996342917e-05, "loss": 0.6376527786254883, "mean_token_accuracy": 0.839674511179328, "num_tokens": 24974983.0, "step": 12210 }, { "entropy": 0.5727580291219055, "epoch": 0.19846844725238139, "grad_norm": 8.6875, "learning_rate": 4.588579654055001e-05, "loss": 0.5452008724212647, "mean_token_accuracy": 0.8614663556218147, "num_tokens": 24995188.0, "step": 12220 }, { "entropy": 0.5996033737435937, "epoch": 0.1986308600570069, "grad_norm": 5.90625, "learning_rate": 4.5878667499344626e-05, "loss": 0.6016168117523193, "mean_token_accuracy": 0.8393660090863705, "num_tokens": 25016571.0, "step": 12230 }, { "entropy": 0.5416421694681048, "epoch": 0.1987932728616324, "grad_norm": 8.875, "learning_rate": 4.587153284173077e-05, "loss": 0.5561915874481201, "mean_token_accuracy": 0.8631891179829836, "num_tokens": 25037971.0, "step": 12240 }, { "entropy": 0.6198043281212449, "epoch": 0.19895568566625793, "grad_norm": 6.03125, "learning_rate": 4.586439256962767e-05, "loss": 0.6787820816040039, "mean_token_accuracy": 0.8327558744698763, "num_tokens": 25058284.0, "step": 12250 }, { "entropy": 0.5668345962651073, "epoch": 0.19911809847088344, "grad_norm": 6.8125, "learning_rate": 4.585724668495608e-05, "loss": 0.5951244831085205, "mean_token_accuracy": 0.8487914100289344, "num_tokens": 25077610.0, "step": 12260 }, { "entropy": 0.5841509610414505, "epoch": 0.19928051127550897, "grad_norm": 7.46875, "learning_rate": 4.585009518963825e-05, "loss": 0.6184364318847656, "mean_token_accuracy": 0.8462065104395151, "num_tokens": 25098169.0, "step": 12270 }, { "entropy": 0.5929702019318939, "epoch": 0.19944292408013448, "grad_norm": 6.71875, "learning_rate": 4.584293808559797e-05, "loss": 0.5947806358337402, "mean_token_accuracy": 0.8467857114970684, "num_tokens": 25118267.0, "step": 12280 }, { "entropy": 0.5853442711755633, "epoch": 0.19960533688475998, "grad_norm": 8.5, "learning_rate": 4.5835775374760496e-05, "loss": 0.5717984199523926, "mean_token_accuracy": 0.8507145315408706, "num_tokens": 25138674.0, "step": 12290 }, { "entropy": 0.6651414018124342, "epoch": 0.19976774968938552, "grad_norm": 8.125, "learning_rate": 4.582860705905262e-05, "loss": 0.6717865943908692, "mean_token_accuracy": 0.8396883226931096, "num_tokens": 25159648.0, "step": 12300 }, { "entropy": 0.5973228931427002, "epoch": 0.19993016249401102, "grad_norm": 5.75, "learning_rate": 4.5821433140402635e-05, "loss": 0.5680655479431153, "mean_token_accuracy": 0.8569359742105007, "num_tokens": 25180509.0, "step": 12310 }, { "entropy": 0.5540860029170289, "epoch": 0.20009257529863655, "grad_norm": 8.0625, "learning_rate": 4.581425362074035e-05, "loss": 0.5690892696380615, "mean_token_accuracy": 0.859893174469471, "num_tokens": 25200902.0, "step": 12320 }, { "entropy": 0.6248894959688187, "epoch": 0.20025498810326206, "grad_norm": 8.375, "learning_rate": 4.580706850199706e-05, "loss": 0.6312798500061035, "mean_token_accuracy": 0.8403501480817794, "num_tokens": 25220635.0, "step": 12330 }, { "entropy": 0.5906405672896653, "epoch": 0.20041740090788757, "grad_norm": 8.4375, "learning_rate": 4.579987778610558e-05, "loss": 0.6269954681396485, "mean_token_accuracy": 0.8447614349424839, "num_tokens": 25241666.0, "step": 12340 }, { "entropy": 0.6615077394992113, "epoch": 0.2005798137125131, "grad_norm": 6.84375, "learning_rate": 4.5792681475000235e-05, "loss": 0.6507661819458008, "mean_token_accuracy": 0.8414684787392617, "num_tokens": 25262934.0, "step": 12350 }, { "entropy": 0.5459652805700899, "epoch": 0.2007422265171386, "grad_norm": 7.90625, "learning_rate": 4.578547957061684e-05, "loss": 0.5598945617675781, "mean_token_accuracy": 0.8539892956614494, "num_tokens": 25282350.0, "step": 12360 }, { "entropy": 0.6762089921161533, "epoch": 0.20090463932176414, "grad_norm": 7.1875, "learning_rate": 4.577827207489273e-05, "loss": 0.692571496963501, "mean_token_accuracy": 0.8281513914465904, "num_tokens": 25303253.0, "step": 12370 }, { "entropy": 0.544951643422246, "epoch": 0.20106705212638964, "grad_norm": 5.65625, "learning_rate": 4.577105898976673e-05, "loss": 0.5579776287078857, "mean_token_accuracy": 0.8642911426723003, "num_tokens": 25323221.0, "step": 12380 }, { "entropy": 0.6526072254404426, "epoch": 0.20122946493101515, "grad_norm": 9.6875, "learning_rate": 4.5763840317179185e-05, "loss": 0.6545165061950684, "mean_token_accuracy": 0.8361254878342151, "num_tokens": 25343338.0, "step": 12390 }, { "entropy": 0.6418019724078476, "epoch": 0.20139187773564068, "grad_norm": 9.0625, "learning_rate": 4.5756616059071934e-05, "loss": 0.6175976276397706, "mean_token_accuracy": 0.8409507911652326, "num_tokens": 25363911.0, "step": 12400 }, { "entropy": 0.6676965657621622, "epoch": 0.2015542905402662, "grad_norm": 5.625, "learning_rate": 4.574938621738831e-05, "loss": 0.6540782451629639, "mean_token_accuracy": 0.8318482153117657, "num_tokens": 25384986.0, "step": 12410 }, { "entropy": 0.6576505059376359, "epoch": 0.20171670334489172, "grad_norm": 7.90625, "learning_rate": 4.574215079407317e-05, "loss": 0.6810944080352783, "mean_token_accuracy": 0.8311419367790223, "num_tokens": 25405111.0, "step": 12420 }, { "entropy": 0.6235237221233547, "epoch": 0.20187911614951723, "grad_norm": 9.375, "learning_rate": 4.573490979107285e-05, "loss": 0.6142261505126954, "mean_token_accuracy": 0.8412287473678589, "num_tokens": 25424890.0, "step": 12430 }, { "entropy": 0.6629935150966049, "epoch": 0.20204152895414274, "grad_norm": 8.1875, "learning_rate": 4.572766321033519e-05, "loss": 0.6362610816955566, "mean_token_accuracy": 0.839865130931139, "num_tokens": 25445756.0, "step": 12440 }, { "entropy": 0.6212058047764003, "epoch": 0.20220394175876827, "grad_norm": 8.8125, "learning_rate": 4.572041105380955e-05, "loss": 0.627192211151123, "mean_token_accuracy": 0.8364308565855026, "num_tokens": 25466700.0, "step": 12450 }, { "entropy": 0.6234149986878037, "epoch": 0.20236635456339377, "grad_norm": 5.59375, "learning_rate": 4.571315332344677e-05, "loss": 0.6454553604125977, "mean_token_accuracy": 0.84310552328825, "num_tokens": 25487474.0, "step": 12460 }, { "entropy": 0.5880932228639721, "epoch": 0.2025287673680193, "grad_norm": 6.75, "learning_rate": 4.570589002119919e-05, "loss": 0.5909905433654785, "mean_token_accuracy": 0.8543611988425255, "num_tokens": 25507920.0, "step": 12470 }, { "entropy": 0.5964352490380407, "epoch": 0.2026911801726448, "grad_norm": 7.4375, "learning_rate": 4.569862114902067e-05, "loss": 0.6112945079803467, "mean_token_accuracy": 0.8511624678969383, "num_tokens": 25528521.0, "step": 12480 }, { "entropy": 0.5483819904737175, "epoch": 0.20285359297727032, "grad_norm": 5.625, "learning_rate": 4.5691346708866546e-05, "loss": 0.5642324924468994, "mean_token_accuracy": 0.8618316642940045, "num_tokens": 25549204.0, "step": 12490 }, { "entropy": 0.5949614201206714, "epoch": 0.20301600578189585, "grad_norm": 8.125, "learning_rate": 4.5684066702693646e-05, "loss": 0.6095510005950928, "mean_token_accuracy": 0.845836928486824, "num_tokens": 25570451.0, "step": 12500 }, { "entropy": 0.5709110877476633, "epoch": 0.20317841858652136, "grad_norm": 6.65625, "learning_rate": 4.5676781132460324e-05, "loss": 0.598017692565918, "mean_token_accuracy": 0.8556294903159142, "num_tokens": 25591357.0, "step": 12510 }, { "entropy": 0.5978128618560732, "epoch": 0.20334083139114686, "grad_norm": 7.8125, "learning_rate": 4.5669490000126404e-05, "loss": 0.5989922523498535, "mean_token_accuracy": 0.8496179550886154, "num_tokens": 25611389.0, "step": 12520 }, { "entropy": 0.5824659419246018, "epoch": 0.2035032441957724, "grad_norm": 8.9375, "learning_rate": 4.566219330765323e-05, "loss": 0.6109497547149658, "mean_token_accuracy": 0.8479265555739403, "num_tokens": 25632320.0, "step": 12530 }, { "entropy": 0.6336340075358748, "epoch": 0.2036656570003979, "grad_norm": 9.5625, "learning_rate": 4.5654891057003614e-05, "loss": 0.6162057399749756, "mean_token_accuracy": 0.8453248865902424, "num_tokens": 25652972.0, "step": 12540 }, { "entropy": 0.6921040973626077, "epoch": 0.20382806980502344, "grad_norm": 9.25, "learning_rate": 4.564758325014189e-05, "loss": 0.6840372085571289, "mean_token_accuracy": 0.8254360154271125, "num_tokens": 25674637.0, "step": 12550 }, { "entropy": 0.5493938840925694, "epoch": 0.20399048260964894, "grad_norm": 7.84375, "learning_rate": 4.564026988903387e-05, "loss": 0.5005664348602294, "mean_token_accuracy": 0.8690766595304013, "num_tokens": 25693758.0, "step": 12560 }, { "entropy": 0.5918134281411767, "epoch": 0.20415289541427445, "grad_norm": 8.0625, "learning_rate": 4.5632950975646855e-05, "loss": 0.6353377342224121, "mean_token_accuracy": 0.8374360002577305, "num_tokens": 25713942.0, "step": 12570 }, { "entropy": 0.627518549002707, "epoch": 0.20431530821889998, "grad_norm": 11.4375, "learning_rate": 4.562562651194966e-05, "loss": 0.6557719230651855, "mean_token_accuracy": 0.8441725812852383, "num_tokens": 25733785.0, "step": 12580 }, { "entropy": 0.6129566465504468, "epoch": 0.2044777210235255, "grad_norm": 12.0, "learning_rate": 4.561829649991258e-05, "loss": 0.6014132499694824, "mean_token_accuracy": 0.8462629064917564, "num_tokens": 25753691.0, "step": 12590 }, { "entropy": 0.6471533371135593, "epoch": 0.20464013382815102, "grad_norm": 8.8125, "learning_rate": 4.561096094150742e-05, "loss": 0.6440921783447265, "mean_token_accuracy": 0.8424212314188481, "num_tokens": 25773465.0, "step": 12600 }, { "entropy": 0.5994148073717952, "epoch": 0.20480254663277653, "grad_norm": 8.75, "learning_rate": 4.560361983870743e-05, "loss": 0.5762141704559326, "mean_token_accuracy": 0.8506194092333317, "num_tokens": 25793534.0, "step": 12610 }, { "entropy": 0.5853875853121281, "epoch": 0.20496495943740203, "grad_norm": 10.0625, "learning_rate": 4.5596273193487406e-05, "loss": 0.5767448425292969, "mean_token_accuracy": 0.8518157228827477, "num_tokens": 25813729.0, "step": 12620 }, { "entropy": 0.574063543882221, "epoch": 0.20512737224202757, "grad_norm": 6.28125, "learning_rate": 4.558892100782361e-05, "loss": 0.5954799652099609, "mean_token_accuracy": 0.8461894355714321, "num_tokens": 25834794.0, "step": 12630 }, { "entropy": 0.573026316286996, "epoch": 0.20528978504665307, "grad_norm": 5.53125, "learning_rate": 4.558156328369377e-05, "loss": 0.581175708770752, "mean_token_accuracy": 0.852231876552105, "num_tokens": 25854624.0, "step": 12640 }, { "entropy": 0.6256012193858623, "epoch": 0.2054521978512786, "grad_norm": 11.375, "learning_rate": 4.557420002307718e-05, "loss": 0.7018474578857422, "mean_token_accuracy": 0.8344818133860826, "num_tokens": 25874297.0, "step": 12650 }, { "entropy": 0.6324831193313003, "epoch": 0.2056146106559041, "grad_norm": 8.0625, "learning_rate": 4.5566831227954534e-05, "loss": 0.6324845790863037, "mean_token_accuracy": 0.8384547051042318, "num_tokens": 25895409.0, "step": 12660 }, { "entropy": 0.565849128831178, "epoch": 0.20577702346052962, "grad_norm": 6.3125, "learning_rate": 4.555945690030806e-05, "loss": 0.5494294166564941, "mean_token_accuracy": 0.8569397337734699, "num_tokens": 25915064.0, "step": 12670 }, { "entropy": 0.6091129289939999, "epoch": 0.20593943626515515, "grad_norm": 7.40625, "learning_rate": 4.555207704212149e-05, "loss": 0.5675833702087403, "mean_token_accuracy": 0.8546780467033386, "num_tokens": 25935944.0, "step": 12680 }, { "entropy": 0.6037541112396866, "epoch": 0.20610184906978066, "grad_norm": 7.875, "learning_rate": 4.554469165538e-05, "loss": 0.6208678245544433, "mean_token_accuracy": 0.8511412315070629, "num_tokens": 25956399.0, "step": 12690 }, { "entropy": 0.5678708024322987, "epoch": 0.2062642618744062, "grad_norm": 8.8125, "learning_rate": 4.553730074207028e-05, "loss": 0.5802405834197998, "mean_token_accuracy": 0.8421403937041759, "num_tokens": 25977047.0, "step": 12700 }, { "entropy": 0.5321389018557966, "epoch": 0.2064266746790317, "grad_norm": 8.625, "learning_rate": 4.552990430418051e-05, "loss": 0.5730510711669922, "mean_token_accuracy": 0.8496560178697109, "num_tokens": 25997649.0, "step": 12710 }, { "entropy": 0.5172807401046157, "epoch": 0.2065890874836572, "grad_norm": 6.4375, "learning_rate": 4.5522502343700344e-05, "loss": 0.5073169231414795, "mean_token_accuracy": 0.8676378220319748, "num_tokens": 26017249.0, "step": 12720 }, { "entropy": 0.5905818049795926, "epoch": 0.20675150028828274, "grad_norm": 6.84375, "learning_rate": 4.551509486262092e-05, "loss": 0.6217871189117432, "mean_token_accuracy": 0.8470325686037541, "num_tokens": 26037807.0, "step": 12730 }, { "entropy": 0.5386319880373776, "epoch": 0.20691391309290824, "grad_norm": 7.15625, "learning_rate": 4.550768186293488e-05, "loss": 0.5165777683258057, "mean_token_accuracy": 0.8650362238287925, "num_tokens": 26058342.0, "step": 12740 }, { "entropy": 0.6223049905151129, "epoch": 0.20707632589753378, "grad_norm": 9.4375, "learning_rate": 4.5500263346636335e-05, "loss": 0.6315126895904541, "mean_token_accuracy": 0.8455738827586174, "num_tokens": 26079612.0, "step": 12750 }, { "entropy": 0.5634799910709262, "epoch": 0.20723873870215928, "grad_norm": 7.0, "learning_rate": 4.549283931572087e-05, "loss": 0.5063044548034668, "mean_token_accuracy": 0.859919936209917, "num_tokens": 26099959.0, "step": 12760 }, { "entropy": 0.634121502796188, "epoch": 0.2074011515067848, "grad_norm": 10.25, "learning_rate": 4.548540977218558e-05, "loss": 0.6917435646057128, "mean_token_accuracy": 0.8359726808965207, "num_tokens": 26120413.0, "step": 12770 }, { "entropy": 0.5698966154828667, "epoch": 0.20756356431141032, "grad_norm": 8.25, "learning_rate": 4.547797471802902e-05, "loss": 0.5422182083129883, "mean_token_accuracy": 0.8577943921089173, "num_tokens": 26140404.0, "step": 12780 }, { "entropy": 0.5425614455714822, "epoch": 0.20772597711603583, "grad_norm": 6.25, "learning_rate": 4.547053415525124e-05, "loss": 0.5776753902435303, "mean_token_accuracy": 0.8568359181284905, "num_tokens": 26159751.0, "step": 12790 }, { "entropy": 0.5403234341181815, "epoch": 0.20788838992066133, "grad_norm": 9.125, "learning_rate": 4.5463088085853764e-05, "loss": 0.5276986598968506, "mean_token_accuracy": 0.8671185091137886, "num_tokens": 26181101.0, "step": 12800 }, { "entropy": 0.555131318513304, "epoch": 0.20805080272528687, "grad_norm": 7.34375, "learning_rate": 4.545563651183961e-05, "loss": 0.5465211391448974, "mean_token_accuracy": 0.8508646734058857, "num_tokens": 26201244.0, "step": 12810 }, { "entropy": 0.5831199629232288, "epoch": 0.20821321552991237, "grad_norm": 11.125, "learning_rate": 4.5448179435213266e-05, "loss": 0.6354680538177491, "mean_token_accuracy": 0.8401526510715485, "num_tokens": 26221019.0, "step": 12820 }, { "entropy": 0.6137001304887235, "epoch": 0.2083756283345379, "grad_norm": 8.25, "learning_rate": 4.544071685798069e-05, "loss": 0.6217742919921875, "mean_token_accuracy": 0.845080553740263, "num_tokens": 26242519.0, "step": 12830 }, { "entropy": 0.6177702963352203, "epoch": 0.2085380411391634, "grad_norm": 6.6875, "learning_rate": 4.543324878214935e-05, "loss": 0.6535583972930908, "mean_token_accuracy": 0.8384648930281401, "num_tokens": 26262102.0, "step": 12840 }, { "entropy": 0.5606361345387996, "epoch": 0.20870045394378892, "grad_norm": 5.75, "learning_rate": 4.542577520972816e-05, "loss": 0.5556678295135498, "mean_token_accuracy": 0.8576150618493557, "num_tokens": 26282728.0, "step": 12850 }, { "entropy": 0.5913861093111337, "epoch": 0.20886286674841445, "grad_norm": 8.375, "learning_rate": 4.5418296142727546e-05, "loss": 0.587209415435791, "mean_token_accuracy": 0.8512399435043335, "num_tokens": 26303066.0, "step": 12860 }, { "entropy": 0.5728941245004535, "epoch": 0.20902527955303996, "grad_norm": 8.625, "learning_rate": 4.541081158315937e-05, "loss": 0.5922245979309082, "mean_token_accuracy": 0.8495579227805138, "num_tokens": 26324145.0, "step": 12870 }, { "entropy": 0.6242799975909292, "epoch": 0.2091876923576655, "grad_norm": 10.1875, "learning_rate": 4.540332153303701e-05, "loss": 0.6024978160858154, "mean_token_accuracy": 0.8456556364893913, "num_tokens": 26345287.0, "step": 12880 }, { "entropy": 0.5608430268242955, "epoch": 0.209350105162291, "grad_norm": 7.96875, "learning_rate": 4.539582599437531e-05, "loss": 0.5367940425872803, "mean_token_accuracy": 0.8634302474558353, "num_tokens": 26366246.0, "step": 12890 }, { "entropy": 0.6002460293471813, "epoch": 0.2095125179669165, "grad_norm": 5.75, "learning_rate": 4.5388324969190575e-05, "loss": 0.595156478881836, "mean_token_accuracy": 0.856720020622015, "num_tokens": 26386159.0, "step": 12900 }, { "entropy": 0.5566518366336822, "epoch": 0.20967493077154203, "grad_norm": 6.34375, "learning_rate": 4.538081845950061e-05, "loss": 0.5688837051391602, "mean_token_accuracy": 0.8517802715301513, "num_tokens": 26407716.0, "step": 12910 }, { "entropy": 0.6460247313603759, "epoch": 0.20983734357616754, "grad_norm": 10.75, "learning_rate": 4.537330646732467e-05, "loss": 0.6878816604614257, "mean_token_accuracy": 0.8275242324918508, "num_tokens": 26428923.0, "step": 12920 }, { "entropy": 0.5795514481142163, "epoch": 0.20999975638079307, "grad_norm": 6.09375, "learning_rate": 4.53657889946835e-05, "loss": 0.5784704208374023, "mean_token_accuracy": 0.854938293620944, "num_tokens": 26450044.0, "step": 12930 }, { "entropy": 0.564535618852824, "epoch": 0.21016216918541858, "grad_norm": 8.125, "learning_rate": 4.535826604359933e-05, "loss": 0.6065794467926026, "mean_token_accuracy": 0.8490377325564623, "num_tokens": 26469650.0, "step": 12940 }, { "entropy": 0.6050719400402158, "epoch": 0.21032458199004408, "grad_norm": 8.625, "learning_rate": 4.535073761609584e-05, "loss": 0.6083506107330322, "mean_token_accuracy": 0.8514999642968177, "num_tokens": 26491114.0, "step": 12950 }, { "entropy": 0.6171657664701342, "epoch": 0.21048699479466962, "grad_norm": 13.125, "learning_rate": 4.534320371419819e-05, "loss": 0.5959738731384278, "mean_token_accuracy": 0.8469117738306522, "num_tokens": 26509790.0, "step": 12960 }, { "entropy": 0.5391187734901906, "epoch": 0.21064940759929512, "grad_norm": 8.0, "learning_rate": 4.5335664339933026e-05, "loss": 0.5375486373901367, "mean_token_accuracy": 0.8594507731497287, "num_tokens": 26529014.0, "step": 12970 }, { "entropy": 0.5697816568426788, "epoch": 0.21081182040392066, "grad_norm": 7.375, "learning_rate": 4.532811949532846e-05, "loss": 0.6093725204467774, "mean_token_accuracy": 0.8468419961631298, "num_tokens": 26548741.0, "step": 12980 }, { "entropy": 0.6318000695668161, "epoch": 0.21097423320854616, "grad_norm": 12.875, "learning_rate": 4.532056918241405e-05, "loss": 0.6285727024078369, "mean_token_accuracy": 0.8420143134891986, "num_tokens": 26569622.0, "step": 12990 }, { "entropy": 0.5309915577992796, "epoch": 0.21113664601317167, "grad_norm": 8.1875, "learning_rate": 4.531301340322088e-05, "loss": 0.5215253829956055, "mean_token_accuracy": 0.8714127957820892, "num_tokens": 26588775.0, "step": 13000 }, { "entropy": 0.5509628580883146, "epoch": 0.2112990588177972, "grad_norm": 6.15625, "learning_rate": 4.5305452159781446e-05, "loss": 0.557252311706543, "mean_token_accuracy": 0.8641130894422531, "num_tokens": 26607611.0, "step": 13010 }, { "entropy": 0.559067863272503, "epoch": 0.2114614716224227, "grad_norm": 8.1875, "learning_rate": 4.529788545412974e-05, "loss": 0.5459411144256592, "mean_token_accuracy": 0.8546712540090085, "num_tokens": 26626936.0, "step": 13020 }, { "entropy": 0.47954417162109164, "epoch": 0.21162388442704824, "grad_norm": 8.75, "learning_rate": 4.529031328830125e-05, "loss": 0.4769723415374756, "mean_token_accuracy": 0.8765573270618916, "num_tokens": 26645804.0, "step": 13030 }, { "entropy": 0.6317354856058955, "epoch": 0.21178629723167375, "grad_norm": 8.9375, "learning_rate": 4.528273566433286e-05, "loss": 0.6989704608917237, "mean_token_accuracy": 0.8353893034160137, "num_tokens": 26665657.0, "step": 13040 }, { "entropy": 0.5908635720610619, "epoch": 0.21194871003629925, "grad_norm": 8.375, "learning_rate": 4.527515258426302e-05, "loss": 0.6051485538482666, "mean_token_accuracy": 0.842450650781393, "num_tokens": 26684975.0, "step": 13050 }, { "entropy": 0.5843564012087882, "epoch": 0.2121111228409248, "grad_norm": 10.375, "learning_rate": 4.5267564050131545e-05, "loss": 0.5552528381347657, "mean_token_accuracy": 0.8510452441871166, "num_tokens": 26705812.0, "step": 13060 }, { "entropy": 0.5904080636799336, "epoch": 0.2122735356455503, "grad_norm": 6.65625, "learning_rate": 4.525997006397981e-05, "loss": 0.5950635433197021, "mean_token_accuracy": 0.8481556177139282, "num_tokens": 26727312.0, "step": 13070 }, { "entropy": 0.5930886968970299, "epoch": 0.2124359484501758, "grad_norm": 5.84375, "learning_rate": 4.525237062785058e-05, "loss": 0.5662363529205322, "mean_token_accuracy": 0.8589229010045528, "num_tokens": 26747351.0, "step": 13080 }, { "entropy": 0.6134946128353477, "epoch": 0.21259836125480133, "grad_norm": 10.8125, "learning_rate": 4.524476574378815e-05, "loss": 0.6202672481536865, "mean_token_accuracy": 0.8436128254979849, "num_tokens": 26767330.0, "step": 13090 }, { "entropy": 0.5631523092277348, "epoch": 0.21276077405942684, "grad_norm": 5.5625, "learning_rate": 4.523715541383823e-05, "loss": 0.6167941093444824, "mean_token_accuracy": 0.8495938830077648, "num_tokens": 26787762.0, "step": 13100 }, { "entropy": 0.5860170730389654, "epoch": 0.21292318686405237, "grad_norm": 5.53125, "learning_rate": 4.522953964004803e-05, "loss": 0.5743618011474609, "mean_token_accuracy": 0.8501062326133251, "num_tokens": 26806907.0, "step": 13110 }, { "entropy": 0.6544931184500455, "epoch": 0.21308559966867788, "grad_norm": 8.125, "learning_rate": 4.5221918424466205e-05, "loss": 0.7203569889068604, "mean_token_accuracy": 0.8309626929461956, "num_tokens": 26826584.0, "step": 13120 }, { "entropy": 0.5908799624070525, "epoch": 0.21324801247330338, "grad_norm": 6.96875, "learning_rate": 4.521429176914287e-05, "loss": 0.598411750793457, "mean_token_accuracy": 0.8551476657390594, "num_tokens": 26845347.0, "step": 13130 }, { "entropy": 0.5607292917557061, "epoch": 0.21341042527792892, "grad_norm": 16.875, "learning_rate": 4.520665967612963e-05, "loss": 0.5665550708770752, "mean_token_accuracy": 0.8568595871329308, "num_tokens": 26865107.0, "step": 13140 }, { "entropy": 0.5846299070864915, "epoch": 0.21357283808255442, "grad_norm": 8.9375, "learning_rate": 4.519902214747951e-05, "loss": 0.5735989570617676, "mean_token_accuracy": 0.8532745398581028, "num_tokens": 26885825.0, "step": 13150 }, { "entropy": 0.5879601422231644, "epoch": 0.21373525088717996, "grad_norm": 7.21875, "learning_rate": 4.519137918524705e-05, "loss": 0.6088402748107911, "mean_token_accuracy": 0.8364171959459782, "num_tokens": 26906327.0, "step": 13160 }, { "entropy": 0.6215938205365091, "epoch": 0.21389766369180546, "grad_norm": 6.15625, "learning_rate": 4.518373079148821e-05, "loss": 0.6142525196075439, "mean_token_accuracy": 0.847584730386734, "num_tokens": 26926813.0, "step": 13170 }, { "entropy": 0.6777175518684089, "epoch": 0.21406007649643097, "grad_norm": 5.6875, "learning_rate": 4.517607696826043e-05, "loss": 0.6888678550720215, "mean_token_accuracy": 0.8328000564128161, "num_tokens": 26947930.0, "step": 13180 }, { "entropy": 0.5537998434156179, "epoch": 0.2142224893010565, "grad_norm": 5.90625, "learning_rate": 4.516841771762259e-05, "loss": 0.554570484161377, "mean_token_accuracy": 0.855620163679123, "num_tokens": 26969037.0, "step": 13190 }, { "entropy": 0.6061325184069574, "epoch": 0.214384902105682, "grad_norm": 8.0625, "learning_rate": 4.516075304163507e-05, "loss": 0.5850739479064941, "mean_token_accuracy": 0.8552710197865963, "num_tokens": 26988595.0, "step": 13200 }, { "entropy": 0.5684152217581868, "epoch": 0.21454731491030754, "grad_norm": 7.21875, "learning_rate": 4.515308294235967e-05, "loss": 0.5409348011016846, "mean_token_accuracy": 0.8607885114848614, "num_tokens": 27008679.0, "step": 13210 }, { "entropy": 0.5725357919931412, "epoch": 0.21470972771493305, "grad_norm": 13.375, "learning_rate": 4.514540742185967e-05, "loss": 0.6376799583435059, "mean_token_accuracy": 0.8449529021978378, "num_tokens": 27028110.0, "step": 13220 }, { "entropy": 0.5455437148921192, "epoch": 0.21487214051955855, "grad_norm": 6.53125, "learning_rate": 4.5137726482199795e-05, "loss": 0.5551892757415772, "mean_token_accuracy": 0.8614797934889793, "num_tokens": 27048075.0, "step": 13230 }, { "entropy": 0.6112853334285319, "epoch": 0.21503455332418409, "grad_norm": 10.0, "learning_rate": 4.513004012544624e-05, "loss": 0.6099318027496338, "mean_token_accuracy": 0.8447923831641674, "num_tokens": 27068804.0, "step": 13240 }, { "entropy": 0.561993311997503, "epoch": 0.2151969661288096, "grad_norm": 6.96875, "learning_rate": 4.512234835366665e-05, "loss": 0.5408859729766846, "mean_token_accuracy": 0.8612990379333496, "num_tokens": 27088007.0, "step": 13250 }, { "entropy": 0.5996526384260505, "epoch": 0.21535937893343512, "grad_norm": 11.75, "learning_rate": 4.5114651168930146e-05, "loss": 0.6766511917114257, "mean_token_accuracy": 0.8420096188783646, "num_tokens": 27108241.0, "step": 13260 }, { "entropy": 0.6187214515171945, "epoch": 0.21552179173806063, "grad_norm": 8.8125, "learning_rate": 4.510694857330726e-05, "loss": 0.6370086669921875, "mean_token_accuracy": 0.849754985421896, "num_tokens": 27128670.0, "step": 13270 }, { "entropy": 0.5616675010882318, "epoch": 0.21568420454268614, "grad_norm": 6.75, "learning_rate": 4.509924056887002e-05, "loss": 0.5633458614349365, "mean_token_accuracy": 0.857379600405693, "num_tokens": 27149453.0, "step": 13280 }, { "entropy": 0.5845215354114771, "epoch": 0.21584661734731167, "grad_norm": 8.1875, "learning_rate": 4.50915271576919e-05, "loss": 0.5596214771270752, "mean_token_accuracy": 0.8613359294831753, "num_tokens": 27169482.0, "step": 13290 }, { "entropy": 0.6241718929260969, "epoch": 0.21600903015193718, "grad_norm": 8.375, "learning_rate": 4.508380834184782e-05, "loss": 0.6312120437622071, "mean_token_accuracy": 0.849313897639513, "num_tokens": 27190053.0, "step": 13300 }, { "entropy": 0.5954360147938133, "epoch": 0.21617144295656268, "grad_norm": 8.1875, "learning_rate": 4.507608412341416e-05, "loss": 0.5822605133056641, "mean_token_accuracy": 0.8527102522552014, "num_tokens": 27209705.0, "step": 13310 }, { "entropy": 0.6242711815051735, "epoch": 0.21633385576118822, "grad_norm": 8.625, "learning_rate": 4.5068354504468745e-05, "loss": 0.5923354625701904, "mean_token_accuracy": 0.8470178112387657, "num_tokens": 27229733.0, "step": 13320 }, { "entropy": 0.7092706411611289, "epoch": 0.21649626856581372, "grad_norm": 7.09375, "learning_rate": 4.506061948709088e-05, "loss": 0.7210259914398194, "mean_token_accuracy": 0.8336750157177448, "num_tokens": 27251310.0, "step": 13330 }, { "entropy": 0.5234185881912709, "epoch": 0.21665868137043925, "grad_norm": 6.96875, "learning_rate": 4.5052879073361286e-05, "loss": 0.5401426315307617, "mean_token_accuracy": 0.8577727094292641, "num_tokens": 27271976.0, "step": 13340 }, { "entropy": 0.5632377143017948, "epoch": 0.21682109417506476, "grad_norm": 7.15625, "learning_rate": 4.504513326536216e-05, "loss": 0.555366039276123, "mean_token_accuracy": 0.848810525238514, "num_tokens": 27291720.0, "step": 13350 }, { "entropy": 0.6184621044434607, "epoch": 0.21698350697969027, "grad_norm": 7.8125, "learning_rate": 4.5037382065177126e-05, "loss": 0.6270238876342773, "mean_token_accuracy": 0.8402108550071716, "num_tokens": 27313075.0, "step": 13360 }, { "entropy": 0.6369271812960505, "epoch": 0.2171459197843158, "grad_norm": 9.8125, "learning_rate": 4.5029625474891294e-05, "loss": 0.5924434185028076, "mean_token_accuracy": 0.8406204037368298, "num_tokens": 27333762.0, "step": 13370 }, { "entropy": 0.5673545027151704, "epoch": 0.2173083325889413, "grad_norm": 8.1875, "learning_rate": 4.502186349659119e-05, "loss": 0.6143340587615966, "mean_token_accuracy": 0.8496801681816578, "num_tokens": 27355200.0, "step": 13380 }, { "entropy": 0.5819858834147453, "epoch": 0.21747074539356684, "grad_norm": 7.5, "learning_rate": 4.501409613236481e-05, "loss": 0.5708133697509765, "mean_token_accuracy": 0.8557849057018757, "num_tokens": 27374582.0, "step": 13390 }, { "entropy": 0.5533765202388168, "epoch": 0.21763315819819234, "grad_norm": 6.90625, "learning_rate": 4.500632338430159e-05, "loss": 0.6125475883483886, "mean_token_accuracy": 0.8456336699426175, "num_tokens": 27395773.0, "step": 13400 }, { "entropy": 0.6313641514629126, "epoch": 0.21779557100281785, "grad_norm": 8.75, "learning_rate": 4.499854525449242e-05, "loss": 0.6225035190582275, "mean_token_accuracy": 0.8393168538808823, "num_tokens": 27416111.0, "step": 13410 }, { "entropy": 0.6179720372892916, "epoch": 0.21795798380744338, "grad_norm": 6.8125, "learning_rate": 4.499076174502964e-05, "loss": 0.6161185264587402, "mean_token_accuracy": 0.8513596564531326, "num_tokens": 27436254.0, "step": 13420 }, { "entropy": 0.590073402132839, "epoch": 0.2181203966120689, "grad_norm": 10.4375, "learning_rate": 4.4982972858007014e-05, "loss": 0.6111728191375733, "mean_token_accuracy": 0.8455126576125622, "num_tokens": 27457682.0, "step": 13430 }, { "entropy": 0.6442305687814951, "epoch": 0.21828280941669442, "grad_norm": 8.1875, "learning_rate": 4.4975178595519784e-05, "loss": 0.6590892791748046, "mean_token_accuracy": 0.8325745470821857, "num_tokens": 27479258.0, "step": 13440 }, { "entropy": 0.604471187852323, "epoch": 0.21844522222131993, "grad_norm": 9.3125, "learning_rate": 4.496737895966462e-05, "loss": 0.6176891803741456, "mean_token_accuracy": 0.8488929964601993, "num_tokens": 27499221.0, "step": 13450 }, { "entropy": 0.6158365201205015, "epoch": 0.21860763502594543, "grad_norm": 7.625, "learning_rate": 4.4959573952539644e-05, "loss": 0.5916090965270996, "mean_token_accuracy": 0.8533323884010315, "num_tokens": 27519600.0, "step": 13460 }, { "entropy": 0.6057021263055503, "epoch": 0.21877004783057097, "grad_norm": 11.5, "learning_rate": 4.495176357624441e-05, "loss": 0.6100963592529297, "mean_token_accuracy": 0.8426780834794044, "num_tokens": 27538892.0, "step": 13470 }, { "entropy": 0.6184348238864914, "epoch": 0.21893246063519647, "grad_norm": 5.625, "learning_rate": 4.4943947832879945e-05, "loss": 0.6120424747467041, "mean_token_accuracy": 0.8492647856473923, "num_tokens": 27558588.0, "step": 13480 }, { "entropy": 0.5870922184083611, "epoch": 0.219094873439822, "grad_norm": 7.4375, "learning_rate": 4.4936126724548686e-05, "loss": 0.5942336082458496, "mean_token_accuracy": 0.85293108522892, "num_tokens": 27579238.0, "step": 13490 }, { "entropy": 0.6466701513156294, "epoch": 0.2192572862444475, "grad_norm": 6.75, "learning_rate": 4.4928300253354536e-05, "loss": 0.6805175304412842, "mean_token_accuracy": 0.8288794130086898, "num_tokens": 27598014.0, "step": 13500 }, { "entropy": 0.5830862953327596, "epoch": 0.21941969904907302, "grad_norm": 6.96875, "learning_rate": 4.492046842140284e-05, "loss": 0.6143934726715088, "mean_token_accuracy": 0.8496368303894997, "num_tokens": 27617769.0, "step": 13510 }, { "entropy": 0.7295439038425684, "epoch": 0.21958211185369855, "grad_norm": 5.53125, "learning_rate": 4.491263123080036e-05, "loss": 0.7626360416412353, "mean_token_accuracy": 0.8090497124940157, "num_tokens": 27638735.0, "step": 13520 }, { "entropy": 0.6053784744814038, "epoch": 0.21974452465832406, "grad_norm": 7.09375, "learning_rate": 4.490478868365533e-05, "loss": 0.5695422649383545, "mean_token_accuracy": 0.8540315806865693, "num_tokens": 27658683.0, "step": 13530 }, { "entropy": 0.6701673232018948, "epoch": 0.2199069374629496, "grad_norm": 11.1875, "learning_rate": 4.4896940782077416e-05, "loss": 0.65236496925354, "mean_token_accuracy": 0.8288718581199646, "num_tokens": 27679782.0, "step": 13540 }, { "entropy": 0.5447944714687765, "epoch": 0.2200693502675751, "grad_norm": 5.375, "learning_rate": 4.488908752817771e-05, "loss": 0.503563928604126, "mean_token_accuracy": 0.8681561291217804, "num_tokens": 27699878.0, "step": 13550 }, { "entropy": 0.5631998360157013, "epoch": 0.2202317630722006, "grad_norm": 9.0, "learning_rate": 4.488122892406876e-05, "loss": 0.5946437835693359, "mean_token_accuracy": 0.8484135314822197, "num_tokens": 27719670.0, "step": 13560 }, { "entropy": 0.5773196968249976, "epoch": 0.22039417587682614, "grad_norm": 6.53125, "learning_rate": 4.4873364971864554e-05, "loss": 0.604633378982544, "mean_token_accuracy": 0.8464183278381825, "num_tokens": 27740124.0, "step": 13570 }, { "entropy": 0.550227849278599, "epoch": 0.22055658868145164, "grad_norm": 7.125, "learning_rate": 4.4865495673680505e-05, "loss": 0.5245660305023193, "mean_token_accuracy": 0.8624074079096318, "num_tokens": 27759341.0, "step": 13580 }, { "entropy": 0.5853316965512931, "epoch": 0.22071900148607715, "grad_norm": 6.9375, "learning_rate": 4.485762103163348e-05, "loss": 0.6123684883117676, "mean_token_accuracy": 0.857279871404171, "num_tokens": 27780094.0, "step": 13590 }, { "entropy": 0.6120886289514601, "epoch": 0.22088141429070268, "grad_norm": 7.46875, "learning_rate": 4.484974104784177e-05, "loss": 0.6310450553894043, "mean_token_accuracy": 0.8393819686025381, "num_tokens": 27800206.0, "step": 13600 }, { "entropy": 0.6180294941645116, "epoch": 0.2210438270953282, "grad_norm": 6.75, "learning_rate": 4.4841855724425096e-05, "loss": 0.6286464691162109, "mean_token_accuracy": 0.8329641379415988, "num_tokens": 27821152.0, "step": 13610 }, { "entropy": 0.5798514286056161, "epoch": 0.22120623989995372, "grad_norm": 7.34375, "learning_rate": 4.483396506350466e-05, "loss": 0.6167507171630859, "mean_token_accuracy": 0.8508647918701172, "num_tokens": 27842506.0, "step": 13620 }, { "entropy": 0.5403699401766062, "epoch": 0.22136865270457923, "grad_norm": 7.3125, "learning_rate": 4.4826069067203034e-05, "loss": 0.5899118423461914, "mean_token_accuracy": 0.8516736440360546, "num_tokens": 27863904.0, "step": 13630 }, { "entropy": 0.5831394665874541, "epoch": 0.22153106550920473, "grad_norm": 10.8125, "learning_rate": 4.4818167737644274e-05, "loss": 0.5981091976165771, "mean_token_accuracy": 0.8512608230113983, "num_tokens": 27884047.0, "step": 13640 }, { "entropy": 0.6130176941864193, "epoch": 0.22169347831383027, "grad_norm": 8.5, "learning_rate": 4.481026107695385e-05, "loss": 0.5933070182800293, "mean_token_accuracy": 0.8522829137742519, "num_tokens": 27903916.0, "step": 13650 }, { "entropy": 0.6087853613309562, "epoch": 0.22185589111845577, "grad_norm": 8.375, "learning_rate": 4.480234908725869e-05, "loss": 0.5607362270355225, "mean_token_accuracy": 0.8576692640781403, "num_tokens": 27923521.0, "step": 13660 }, { "entropy": 0.5609751909971237, "epoch": 0.2220183039230813, "grad_norm": 7.90625, "learning_rate": 4.479443177068711e-05, "loss": 0.5735602378845215, "mean_token_accuracy": 0.8542346373200417, "num_tokens": 27943921.0, "step": 13670 }, { "entropy": 0.529983954783529, "epoch": 0.2221807167277068, "grad_norm": 8.25, "learning_rate": 4.47865091293689e-05, "loss": 0.5503905296325684, "mean_token_accuracy": 0.8610822096467018, "num_tokens": 27962733.0, "step": 13680 }, { "entropy": 0.5485262484289706, "epoch": 0.22234312953233232, "grad_norm": 6.46875, "learning_rate": 4.477858116543527e-05, "loss": 0.5694108009338379, "mean_token_accuracy": 0.8507606893777847, "num_tokens": 27983373.0, "step": 13690 }, { "entropy": 0.5920074631460011, "epoch": 0.22250554233695785, "grad_norm": 8.5, "learning_rate": 4.477064788101886e-05, "loss": 0.6683462619781494, "mean_token_accuracy": 0.8407866597175598, "num_tokens": 28003489.0, "step": 13700 }, { "entropy": 0.6349648659117519, "epoch": 0.22266795514158336, "grad_norm": 7.8125, "learning_rate": 4.4762709278253734e-05, "loss": 0.6356976509094239, "mean_token_accuracy": 0.8409346073865891, "num_tokens": 28023105.0, "step": 13710 }, { "entropy": 0.5340277361683547, "epoch": 0.2228303679462089, "grad_norm": 7.125, "learning_rate": 4.47547653592754e-05, "loss": 0.5230738639831543, "mean_token_accuracy": 0.8633794024586677, "num_tokens": 28044186.0, "step": 13720 }, { "entropy": 0.6415080146864056, "epoch": 0.2229927807508344, "grad_norm": 9.0625, "learning_rate": 4.474681612622078e-05, "loss": 0.6102344036102295, "mean_token_accuracy": 0.8445476673543453, "num_tokens": 28065539.0, "step": 13730 }, { "entropy": 0.616783452546224, "epoch": 0.2231551935554599, "grad_norm": 8.375, "learning_rate": 4.4738861581228255e-05, "loss": 0.6026972770690918, "mean_token_accuracy": 0.8515866793692112, "num_tokens": 28086505.0, "step": 13740 }, { "entropy": 0.5939816577825695, "epoch": 0.22331760636008544, "grad_norm": 8.9375, "learning_rate": 4.47309017264376e-05, "loss": 0.5734948635101318, "mean_token_accuracy": 0.8500930014997721, "num_tokens": 28106588.0, "step": 13750 }, { "entropy": 0.5319269943749532, "epoch": 0.22348001916471094, "grad_norm": 12.0, "learning_rate": 4.4722936563990034e-05, "loss": 0.5489365100860596, "mean_token_accuracy": 0.8652431167662143, "num_tokens": 28126403.0, "step": 13760 }, { "entropy": 0.61227259747684, "epoch": 0.22364243196933647, "grad_norm": 6.5625, "learning_rate": 4.471496609602821e-05, "loss": 0.6666303157806397, "mean_token_accuracy": 0.834812230616808, "num_tokens": 28146706.0, "step": 13770 }, { "entropy": 0.5662860034964978, "epoch": 0.22380484477396198, "grad_norm": 8.1875, "learning_rate": 4.4706990324696206e-05, "loss": 0.5735319137573243, "mean_token_accuracy": 0.849877105653286, "num_tokens": 28168122.0, "step": 13780 }, { "entropy": 0.5746642330661416, "epoch": 0.2239672575785875, "grad_norm": 6.84375, "learning_rate": 4.4699009252139514e-05, "loss": 0.531390380859375, "mean_token_accuracy": 0.864101642370224, "num_tokens": 28189353.0, "step": 13790 }, { "entropy": 0.5412967998534441, "epoch": 0.22412967038321302, "grad_norm": 9.125, "learning_rate": 4.469102288050506e-05, "loss": 0.6026793956756592, "mean_token_accuracy": 0.8498197734355927, "num_tokens": 28210693.0, "step": 13800 }, { "entropy": 0.5952402434311808, "epoch": 0.22429208318783853, "grad_norm": 7.5625, "learning_rate": 4.468303121194119e-05, "loss": 0.644437599182129, "mean_token_accuracy": 0.8459443241357804, "num_tokens": 28230354.0, "step": 13810 }, { "entropy": 0.618439129460603, "epoch": 0.22445449599246406, "grad_norm": 6.40625, "learning_rate": 4.46750342485977e-05, "loss": 0.5595462322235107, "mean_token_accuracy": 0.8510464958846569, "num_tokens": 28250690.0, "step": 13820 }, { "entropy": 0.5725077806739136, "epoch": 0.22461690879708957, "grad_norm": 7.28125, "learning_rate": 4.466703199262578e-05, "loss": 0.5617525100708007, "mean_token_accuracy": 0.8542746573686599, "num_tokens": 28270725.0, "step": 13830 }, { "entropy": 0.6076036158949136, "epoch": 0.22477932160171507, "grad_norm": 6.53125, "learning_rate": 4.4659024446178054e-05, "loss": 0.6088498592376709, "mean_token_accuracy": 0.8498963922262192, "num_tokens": 28290057.0, "step": 13840 }, { "entropy": 0.6049760754220188, "epoch": 0.2249417344063406, "grad_norm": 7.03125, "learning_rate": 4.465101161140857e-05, "loss": 0.6366272449493409, "mean_token_accuracy": 0.8464096069335938, "num_tokens": 28311388.0, "step": 13850 }, { "entropy": 0.5702020277967677, "epoch": 0.2251041472109661, "grad_norm": 6.5625, "learning_rate": 4.4642993490472795e-05, "loss": 0.5936555385589599, "mean_token_accuracy": 0.8497156903147698, "num_tokens": 28332070.0, "step": 13860 }, { "entropy": 0.5557423291727901, "epoch": 0.22526656001559162, "grad_norm": 8.6875, "learning_rate": 4.4634970085527634e-05, "loss": 0.5669330596923828, "mean_token_accuracy": 0.861674465239048, "num_tokens": 28351696.0, "step": 13870 }, { "entropy": 0.6310632089152932, "epoch": 0.22542897282021715, "grad_norm": 8.0, "learning_rate": 4.462694139873139e-05, "loss": 0.6187809944152832, "mean_token_accuracy": 0.8501496009528637, "num_tokens": 28371205.0, "step": 13880 }, { "entropy": 0.5907484350726009, "epoch": 0.22559138562484266, "grad_norm": 9.375, "learning_rate": 4.46189074322438e-05, "loss": 0.5945881366729736, "mean_token_accuracy": 0.8455508224666118, "num_tokens": 28391529.0, "step": 13890 }, { "entropy": 0.5764099372550845, "epoch": 0.2257537984294682, "grad_norm": 7.625, "learning_rate": 4.461086818822602e-05, "loss": 0.565182113647461, "mean_token_accuracy": 0.8497063960880041, "num_tokens": 28411163.0, "step": 13900 }, { "entropy": 0.5862484039738775, "epoch": 0.2259162112340937, "grad_norm": 10.6875, "learning_rate": 4.460282366884063e-05, "loss": 0.5830499649047851, "mean_token_accuracy": 0.8527098469436168, "num_tokens": 28432416.0, "step": 13910 }, { "entropy": 0.5945220396388322, "epoch": 0.2260786240387192, "grad_norm": 7.3125, "learning_rate": 4.459477387625161e-05, "loss": 0.6214711189270019, "mean_token_accuracy": 0.8454022675752639, "num_tokens": 28451930.0, "step": 13920 }, { "entropy": 0.6161815460771323, "epoch": 0.22624103684334473, "grad_norm": 8.9375, "learning_rate": 4.458671881262438e-05, "loss": 0.6246932983398438, "mean_token_accuracy": 0.8488273587077856, "num_tokens": 28472505.0, "step": 13930 }, { "entropy": 0.5473623688332736, "epoch": 0.22640344964797024, "grad_norm": 11.75, "learning_rate": 4.457865848012578e-05, "loss": 0.5360188484191895, "mean_token_accuracy": 0.8589949645102024, "num_tokens": 28491661.0, "step": 13940 }, { "entropy": 0.5951306293718517, "epoch": 0.22656586245259577, "grad_norm": 6.53125, "learning_rate": 4.4570592880924045e-05, "loss": 0.6291618347167969, "mean_token_accuracy": 0.8427003055810929, "num_tokens": 28512636.0, "step": 13950 }, { "entropy": 0.5335546204354614, "epoch": 0.22672827525722128, "grad_norm": 7.40625, "learning_rate": 4.4562522017188846e-05, "loss": 0.5278321743011475, "mean_token_accuracy": 0.8717438161373139, "num_tokens": 28533536.0, "step": 13960 }, { "entropy": 0.563526123133488, "epoch": 0.22689068806184678, "grad_norm": 8.25, "learning_rate": 4.4554445891091256e-05, "loss": 0.5699947834014892, "mean_token_accuracy": 0.858772262185812, "num_tokens": 28554248.0, "step": 13970 }, { "entropy": 0.5539604137651623, "epoch": 0.22705310086647232, "grad_norm": 10.125, "learning_rate": 4.454636450480377e-05, "loss": 0.536622142791748, "mean_token_accuracy": 0.8501306846737862, "num_tokens": 28573328.0, "step": 13980 }, { "entropy": 0.5269551783800125, "epoch": 0.22721551367109782, "grad_norm": 9.125, "learning_rate": 4.453827786050031e-05, "loss": 0.5000077724456787, "mean_token_accuracy": 0.8657857678830624, "num_tokens": 28594484.0, "step": 13990 }, { "entropy": 0.6549689246341586, "epoch": 0.22737792647572336, "grad_norm": 6.25, "learning_rate": 4.45301859603562e-05, "loss": 0.7027140140533448, "mean_token_accuracy": 0.8267220567911864, "num_tokens": 28615269.0, "step": 14000 }, { "entropy": 0.6449488624930382, "epoch": 0.22754033928034886, "grad_norm": 7.75, "learning_rate": 4.4522088806548166e-05, "loss": 0.6412299633026123, "mean_token_accuracy": 0.840188154950738, "num_tokens": 28634914.0, "step": 14010 }, { "entropy": 0.6314699687995017, "epoch": 0.22770275208497437, "grad_norm": 7.84375, "learning_rate": 4.4513986401254384e-05, "loss": 0.6465074062347412, "mean_token_accuracy": 0.8414154484868049, "num_tokens": 28656289.0, "step": 14020 }, { "entropy": 0.5783427474088967, "epoch": 0.2278651648895999, "grad_norm": 7.78125, "learning_rate": 4.4505878746654396e-05, "loss": 0.5527902126312256, "mean_token_accuracy": 0.8667437300086022, "num_tokens": 28676809.0, "step": 14030 }, { "entropy": 0.5383872201666235, "epoch": 0.2280275776942254, "grad_norm": 7.40625, "learning_rate": 4.4497765844929185e-05, "loss": 0.5562599658966064, "mean_token_accuracy": 0.8558428712189198, "num_tokens": 28697767.0, "step": 14040 }, { "entropy": 0.5104854839853943, "epoch": 0.22818999049885094, "grad_norm": 6.625, "learning_rate": 4.448964769826115e-05, "loss": 0.5210018634796143, "mean_token_accuracy": 0.8615947142243385, "num_tokens": 28717567.0, "step": 14050 }, { "entropy": 0.5568932576104999, "epoch": 0.22835240330347645, "grad_norm": 11.25, "learning_rate": 4.448152430883408e-05, "loss": 0.5360284805297851, "mean_token_accuracy": 0.8587586566805839, "num_tokens": 28736710.0, "step": 14060 }, { "entropy": 0.537816553749144, "epoch": 0.22851481610810195, "grad_norm": 7.53125, "learning_rate": 4.447339567883319e-05, "loss": 0.5984487533569336, "mean_token_accuracy": 0.8550431087613106, "num_tokens": 28756469.0, "step": 14070 }, { "entropy": 0.5987397157587111, "epoch": 0.2286772289127275, "grad_norm": 5.625, "learning_rate": 4.4465261810445104e-05, "loss": 0.6542885780334473, "mean_token_accuracy": 0.8517462208867073, "num_tokens": 28776940.0, "step": 14080 }, { "entropy": 0.5673832355998456, "epoch": 0.228839641717353, "grad_norm": 9.375, "learning_rate": 4.4457122705857836e-05, "loss": 0.5409218311309815, "mean_token_accuracy": 0.8584367960691452, "num_tokens": 28796051.0, "step": 14090 }, { "entropy": 0.6524776551872492, "epoch": 0.22900205452197853, "grad_norm": 8.5, "learning_rate": 4.444897836726084e-05, "loss": 0.7008672714233398, "mean_token_accuracy": 0.837493521720171, "num_tokens": 28816015.0, "step": 14100 }, { "entropy": 0.6407729657832533, "epoch": 0.22916446732660403, "grad_norm": 7.21875, "learning_rate": 4.4440828796844944e-05, "loss": 0.6540714263916015, "mean_token_accuracy": 0.8395816773176193, "num_tokens": 28836752.0, "step": 14110 }, { "entropy": 0.6154855888802558, "epoch": 0.22932688013122954, "grad_norm": 7.03125, "learning_rate": 4.443267399680242e-05, "loss": 0.6000308990478516, "mean_token_accuracy": 0.852210120856762, "num_tokens": 28858320.0, "step": 14120 }, { "entropy": 0.6484136031009257, "epoch": 0.22948929293585507, "grad_norm": 8.5625, "learning_rate": 4.442451396932692e-05, "loss": 0.637156629562378, "mean_token_accuracy": 0.843451027572155, "num_tokens": 28877612.0, "step": 14130 }, { "entropy": 0.5736938045360148, "epoch": 0.22965170574048058, "grad_norm": 9.4375, "learning_rate": 4.441634871661351e-05, "loss": 0.5833540916442871, "mean_token_accuracy": 0.8545294493436814, "num_tokens": 28897519.0, "step": 14140 }, { "entropy": 0.6414812512695789, "epoch": 0.22981411854510608, "grad_norm": 10.0, "learning_rate": 4.4408178240858656e-05, "loss": 0.6741921424865722, "mean_token_accuracy": 0.837662261724472, "num_tokens": 28917929.0, "step": 14150 }, { "entropy": 0.5852225442416966, "epoch": 0.22997653134973162, "grad_norm": 9.25, "learning_rate": 4.4400002544260235e-05, "loss": 0.582069206237793, "mean_token_accuracy": 0.8444306261837482, "num_tokens": 28938370.0, "step": 14160 }, { "entropy": 0.5976995093282312, "epoch": 0.23013894415435712, "grad_norm": 10.5, "learning_rate": 4.439182162901753e-05, "loss": 0.6008153915405273, "mean_token_accuracy": 0.8453587353229522, "num_tokens": 28958406.0, "step": 14170 }, { "entropy": 0.6024293678812682, "epoch": 0.23030135695898266, "grad_norm": 5.84375, "learning_rate": 4.438363549733123e-05, "loss": 0.6366767406463623, "mean_token_accuracy": 0.8400787223130465, "num_tokens": 28980534.0, "step": 14180 }, { "entropy": 0.5903919907286763, "epoch": 0.23046376976360816, "grad_norm": 6.53125, "learning_rate": 4.437544415140342e-05, "loss": 0.5683595657348632, "mean_token_accuracy": 0.8524060562252999, "num_tokens": 29001215.0, "step": 14190 }, { "entropy": 0.6237150091677904, "epoch": 0.23062618256823367, "grad_norm": 7.125, "learning_rate": 4.436724759343759e-05, "loss": 0.6340179920196534, "mean_token_accuracy": 0.8495498407632113, "num_tokens": 29023828.0, "step": 14200 }, { "entropy": 0.6070982997305692, "epoch": 0.2307885953728592, "grad_norm": 5.6875, "learning_rate": 4.435904582563863e-05, "loss": 0.5932548522949219, "mean_token_accuracy": 0.8436196200549603, "num_tokens": 29043421.0, "step": 14210 }, { "entropy": 0.5533425382804126, "epoch": 0.2309510081774847, "grad_norm": 7.3125, "learning_rate": 4.435083885021284e-05, "loss": 0.5561661720275879, "mean_token_accuracy": 0.8636214017868042, "num_tokens": 29063319.0, "step": 14220 }, { "entropy": 0.5582830990664661, "epoch": 0.23111342098211024, "grad_norm": 10.5625, "learning_rate": 4.4342626669367904e-05, "loss": 0.5643480777740478, "mean_token_accuracy": 0.8621426865458488, "num_tokens": 29083152.0, "step": 14230 }, { "entropy": 0.5823808816727251, "epoch": 0.23127583378673575, "grad_norm": 7.25, "learning_rate": 4.433440928531293e-05, "loss": 0.6051177501678466, "mean_token_accuracy": 0.8514732748270035, "num_tokens": 29103696.0, "step": 14240 }, { "entropy": 0.5406205859966576, "epoch": 0.23143824659136125, "grad_norm": 6.9375, "learning_rate": 4.432618670025841e-05, "loss": 0.5925899982452393, "mean_token_accuracy": 0.8534427121281624, "num_tokens": 29124042.0, "step": 14250 }, { "entropy": 0.6258663108572364, "epoch": 0.23160065939598679, "grad_norm": 9.1875, "learning_rate": 4.4317958916416225e-05, "loss": 0.6602246284484863, "mean_token_accuracy": 0.8395012296736241, "num_tokens": 29144428.0, "step": 14260 }, { "entropy": 0.5573412707075477, "epoch": 0.2317630722006123, "grad_norm": 6.5625, "learning_rate": 4.430972593599968e-05, "loss": 0.5324358940124512, "mean_token_accuracy": 0.8588787525892257, "num_tokens": 29166001.0, "step": 14270 }, { "entropy": 0.6020629708655179, "epoch": 0.23192548500523782, "grad_norm": 7.28125, "learning_rate": 4.430148776122347e-05, "loss": 0.5773401260375977, "mean_token_accuracy": 0.8549735575914383, "num_tokens": 29185809.0, "step": 14280 }, { "entropy": 0.5154556749388576, "epoch": 0.23208789780986333, "grad_norm": 11.8125, "learning_rate": 4.429324439430367e-05, "loss": 0.5672462463378907, "mean_token_accuracy": 0.8564390800893307, "num_tokens": 29206174.0, "step": 14290 }, { "entropy": 0.6067350013181567, "epoch": 0.23225031061448884, "grad_norm": 8.625, "learning_rate": 4.428499583745777e-05, "loss": 0.6073486328125, "mean_token_accuracy": 0.8483822628855705, "num_tokens": 29226890.0, "step": 14300 }, { "entropy": 0.621578310802579, "epoch": 0.23241272341911437, "grad_norm": 9.5, "learning_rate": 4.4276742092904644e-05, "loss": 0.5912760257720947, "mean_token_accuracy": 0.8459760159254074, "num_tokens": 29245624.0, "step": 14310 }, { "entropy": 0.5951930285431445, "epoch": 0.23257513622373988, "grad_norm": 8.0625, "learning_rate": 4.426848316286457e-05, "loss": 0.632740592956543, "mean_token_accuracy": 0.8413855493068695, "num_tokens": 29265252.0, "step": 14320 }, { "entropy": 0.6244874449912459, "epoch": 0.2327375490283654, "grad_norm": 7.75, "learning_rate": 4.426021904955924e-05, "loss": 0.6067125797271729, "mean_token_accuracy": 0.8513967491686344, "num_tokens": 29285241.0, "step": 14330 }, { "entropy": 0.6195795141160488, "epoch": 0.23289996183299091, "grad_norm": 7.0, "learning_rate": 4.4251949755211685e-05, "loss": 0.6409644603729248, "mean_token_accuracy": 0.8410849574953317, "num_tokens": 29305003.0, "step": 14340 }, { "entropy": 0.5860907919704914, "epoch": 0.23306237463761642, "grad_norm": 7.75, "learning_rate": 4.424367528204638e-05, "loss": 0.5434869766235352, "mean_token_accuracy": 0.8593247652053833, "num_tokens": 29326024.0, "step": 14350 }, { "entropy": 0.6002020202111453, "epoch": 0.23322478744224195, "grad_norm": 10.6875, "learning_rate": 4.423539563228918e-05, "loss": 0.6290452957153321, "mean_token_accuracy": 0.8493446066975594, "num_tokens": 29347159.0, "step": 14360 }, { "entropy": 0.5403524368070066, "epoch": 0.23338720024686746, "grad_norm": 10.5625, "learning_rate": 4.422711080816733e-05, "loss": 0.567730188369751, "mean_token_accuracy": 0.8518587246537208, "num_tokens": 29367947.0, "step": 14370 }, { "entropy": 0.5872438973747194, "epoch": 0.233549613051493, "grad_norm": 7.09375, "learning_rate": 4.4218820811909465e-05, "loss": 0.6316866874694824, "mean_token_accuracy": 0.8442548219114542, "num_tokens": 29386509.0, "step": 14380 }, { "entropy": 0.5720058725215494, "epoch": 0.2337120258561185, "grad_norm": 10.0625, "learning_rate": 4.4210525645745604e-05, "loss": 0.5692018032073974, "mean_token_accuracy": 0.8552003227174282, "num_tokens": 29407702.0, "step": 14390 }, { "entropy": 0.5787298213690519, "epoch": 0.233874438660744, "grad_norm": 8.0, "learning_rate": 4.420222531190717e-05, "loss": 0.6025168418884277, "mean_token_accuracy": 0.8427248656749725, "num_tokens": 29428029.0, "step": 14400 }, { "entropy": 0.5485108428634703, "epoch": 0.23403685146536954, "grad_norm": 8.1875, "learning_rate": 4.419391981262697e-05, "loss": 0.5677234172821045, "mean_token_accuracy": 0.8596973657608032, "num_tokens": 29448232.0, "step": 14410 }, { "entropy": 0.7251012403517961, "epoch": 0.23419926426999504, "grad_norm": 9.375, "learning_rate": 4.4185609150139216e-05, "loss": 0.7318049430847168, "mean_token_accuracy": 0.8250875841826201, "num_tokens": 29470253.0, "step": 14420 }, { "entropy": 0.5567233490757644, "epoch": 0.23436167707462055, "grad_norm": 8.25, "learning_rate": 4.4177293326679475e-05, "loss": 0.5465403079986573, "mean_token_accuracy": 0.8551524549722671, "num_tokens": 29490684.0, "step": 14430 }, { "entropy": 0.5763582966290415, "epoch": 0.23452408987924608, "grad_norm": 5.6875, "learning_rate": 4.4168972344484736e-05, "loss": 0.6043893337249756, "mean_token_accuracy": 0.8444477461278439, "num_tokens": 29512303.0, "step": 14440 }, { "entropy": 0.5581884070299565, "epoch": 0.2346865026838716, "grad_norm": 10.5625, "learning_rate": 4.4160646205793354e-05, "loss": 0.5740495204925538, "mean_token_accuracy": 0.8584456026554108, "num_tokens": 29532583.0, "step": 14450 }, { "entropy": 0.5767486054450274, "epoch": 0.23484891548849712, "grad_norm": 6.96875, "learning_rate": 4.415231491284508e-05, "loss": 0.5999647617340088, "mean_token_accuracy": 0.8478722974658013, "num_tokens": 29552523.0, "step": 14460 }, { "entropy": 0.5878359829541295, "epoch": 0.23501132829312263, "grad_norm": 9.6875, "learning_rate": 4.4143978467881053e-05, "loss": 0.5972198009490967, "mean_token_accuracy": 0.840363047271967, "num_tokens": 29573147.0, "step": 14470 }, { "entropy": 0.6153153183870017, "epoch": 0.23517374109774813, "grad_norm": 6.71875, "learning_rate": 4.41356368731438e-05, "loss": 0.6012801170349121, "mean_token_accuracy": 0.8452833637595176, "num_tokens": 29593853.0, "step": 14480 }, { "entropy": 0.5837062304839492, "epoch": 0.23533615390237367, "grad_norm": 8.75, "learning_rate": 4.412729013087722e-05, "loss": 0.5403291702270507, "mean_token_accuracy": 0.8603835113346576, "num_tokens": 29613245.0, "step": 14490 }, { "entropy": 0.5337497735396027, "epoch": 0.23549856670699917, "grad_norm": 9.9375, "learning_rate": 4.4118938243326605e-05, "loss": 0.5492832660675049, "mean_token_accuracy": 0.8583649463951588, "num_tokens": 29633775.0, "step": 14500 }, { "entropy": 0.597385904379189, "epoch": 0.2356609795116247, "grad_norm": 10.5625, "learning_rate": 4.411058121273863e-05, "loss": 0.5671964645385742, "mean_token_accuracy": 0.8593403846025467, "num_tokens": 29655573.0, "step": 14510 }, { "entropy": 0.5606032523326576, "epoch": 0.2358233923162502, "grad_norm": 6.21875, "learning_rate": 4.4102219041361376e-05, "loss": 0.5972947120666504, "mean_token_accuracy": 0.843195577710867, "num_tokens": 29675104.0, "step": 14520 }, { "entropy": 0.5573966089636088, "epoch": 0.23598580512087572, "grad_norm": 7.1875, "learning_rate": 4.4093851731444264e-05, "loss": 0.5859920978546143, "mean_token_accuracy": 0.8542788952589035, "num_tokens": 29694977.0, "step": 14530 }, { "entropy": 0.5382746668532491, "epoch": 0.23614821792550125, "grad_norm": 5.46875, "learning_rate": 4.408547928523812e-05, "loss": 0.5236104488372803, "mean_token_accuracy": 0.8660301841795445, "num_tokens": 29714440.0, "step": 14540 }, { "entropy": 0.5802041619084776, "epoch": 0.23631063073012676, "grad_norm": 5.5, "learning_rate": 4.4077101704995166e-05, "loss": 0.5348324298858642, "mean_token_accuracy": 0.862752340734005, "num_tokens": 29734946.0, "step": 14550 }, { "entropy": 0.5489219477400183, "epoch": 0.2364730435347523, "grad_norm": 9.4375, "learning_rate": 4.4068718992968975e-05, "loss": 0.5289930820465087, "mean_token_accuracy": 0.8595574207603931, "num_tokens": 29754165.0, "step": 14560 }, { "entropy": 0.5149812425952405, "epoch": 0.2366354563393778, "grad_norm": 6.625, "learning_rate": 4.4060331151414526e-05, "loss": 0.5386037826538086, "mean_token_accuracy": 0.8643578045070172, "num_tokens": 29775100.0, "step": 14570 }, { "entropy": 0.5464812146499753, "epoch": 0.2367978691440033, "grad_norm": 6.3125, "learning_rate": 4.405193818258815e-05, "loss": 0.5282162666320801, "mean_token_accuracy": 0.8610968567430973, "num_tokens": 29795599.0, "step": 14580 }, { "entropy": 0.5647190879099071, "epoch": 0.23696028194862884, "grad_norm": 10.0, "learning_rate": 4.4043540088747595e-05, "loss": 0.6285149574279785, "mean_token_accuracy": 0.8476939555257559, "num_tokens": 29816060.0, "step": 14590 }, { "entropy": 0.5409979239106179, "epoch": 0.23712269475325434, "grad_norm": 7.75, "learning_rate": 4.403513687215195e-05, "loss": 0.5370771884918213, "mean_token_accuracy": 0.8598192229866981, "num_tokens": 29837333.0, "step": 14600 }, { "entropy": 0.5457262203097344, "epoch": 0.23728510755787988, "grad_norm": 6.4375, "learning_rate": 4.402672853506172e-05, "loss": 0.5339758396148682, "mean_token_accuracy": 0.8637374684214592, "num_tokens": 29858998.0, "step": 14610 }, { "entropy": 0.619594536907971, "epoch": 0.23744752036250538, "grad_norm": 8.625, "learning_rate": 4.4018315079738746e-05, "loss": 0.6460004329681397, "mean_token_accuracy": 0.8417407542467117, "num_tokens": 29878870.0, "step": 14620 }, { "entropy": 0.6194007402285934, "epoch": 0.2376099331671309, "grad_norm": 10.75, "learning_rate": 4.400989650844628e-05, "loss": 0.6005556583404541, "mean_token_accuracy": 0.8471309795975686, "num_tokens": 29900033.0, "step": 14630 }, { "entropy": 0.6226085294503718, "epoch": 0.23777234597175642, "grad_norm": 8.5, "learning_rate": 4.400147282344893e-05, "loss": 0.6639465808868408, "mean_token_accuracy": 0.8335112281143665, "num_tokens": 29921148.0, "step": 14640 }, { "entropy": 0.5869026051834225, "epoch": 0.23793475877638193, "grad_norm": 7.0625, "learning_rate": 4.3993044027012684e-05, "loss": 0.5739975452423096, "mean_token_accuracy": 0.8650178827345372, "num_tokens": 29940508.0, "step": 14650 }, { "entropy": 0.677211913280189, "epoch": 0.23809717158100743, "grad_norm": 8.6875, "learning_rate": 4.3984610121404914e-05, "loss": 0.6504720211029053, "mean_token_accuracy": 0.8356803823262453, "num_tokens": 29963895.0, "step": 14660 }, { "entropy": 0.5961818290874362, "epoch": 0.23825958438563297, "grad_norm": 9.5625, "learning_rate": 4.397617110889435e-05, "loss": 0.6467212200164795, "mean_token_accuracy": 0.8445644795894622, "num_tokens": 29984981.0, "step": 14670 }, { "entropy": 0.5332651942968368, "epoch": 0.23842199719025847, "grad_norm": 6.90625, "learning_rate": 4.3967726991751115e-05, "loss": 0.5183073520660401, "mean_token_accuracy": 0.8592260695993901, "num_tokens": 30005065.0, "step": 14680 }, { "entropy": 0.6033140605315566, "epoch": 0.238584409994884, "grad_norm": 8.9375, "learning_rate": 4.3959277772246695e-05, "loss": 0.5964116096496582, "mean_token_accuracy": 0.8468216463923455, "num_tokens": 30025215.0, "step": 14690 }, { "entropy": 0.542246154230088, "epoch": 0.2387468227995095, "grad_norm": 7.40625, "learning_rate": 4.395082345265394e-05, "loss": 0.539665699005127, "mean_token_accuracy": 0.8643945179879665, "num_tokens": 30043474.0, "step": 14700 }, { "entropy": 0.5461127854883671, "epoch": 0.23890923560413502, "grad_norm": 7.34375, "learning_rate": 4.39423640352471e-05, "loss": 0.5873907089233399, "mean_token_accuracy": 0.8533617570996285, "num_tokens": 30063958.0, "step": 14710 }, { "entropy": 0.6103121068328619, "epoch": 0.23907164840876055, "grad_norm": 9.375, "learning_rate": 4.3933899522301746e-05, "loss": 0.6296722888946533, "mean_token_accuracy": 0.8477992609143257, "num_tokens": 30084235.0, "step": 14720 }, { "entropy": 0.569952345918864, "epoch": 0.23923406121338606, "grad_norm": 11.0, "learning_rate": 4.392542991609488e-05, "loss": 0.5820718288421631, "mean_token_accuracy": 0.854785966873169, "num_tokens": 30104669.0, "step": 14730 }, { "entropy": 0.6363669512793422, "epoch": 0.2393964740180116, "grad_norm": 9.25, "learning_rate": 4.3916955218904833e-05, "loss": 0.6531990528106689, "mean_token_accuracy": 0.8345799945294857, "num_tokens": 30125093.0, "step": 14740 }, { "entropy": 0.609832201898098, "epoch": 0.2395588868226371, "grad_norm": 10.375, "learning_rate": 4.390847543301132e-05, "loss": 0.5841368675231934, "mean_token_accuracy": 0.8438720520585775, "num_tokens": 30145441.0, "step": 14750 }, { "entropy": 0.5882110844366253, "epoch": 0.2397212996272626, "grad_norm": 9.3125, "learning_rate": 4.3899990560695414e-05, "loss": 0.5855683326721192, "mean_token_accuracy": 0.8536567606031895, "num_tokens": 30165982.0, "step": 14760 }, { "entropy": 0.5687101386953145, "epoch": 0.23988371243188814, "grad_norm": 8.625, "learning_rate": 4.389150060423958e-05, "loss": 0.5624008178710938, "mean_token_accuracy": 0.8569696247577667, "num_tokens": 30186338.0, "step": 14770 }, { "entropy": 0.5845256824977696, "epoch": 0.24004612523651364, "grad_norm": 8.9375, "learning_rate": 4.388300556592763e-05, "loss": 0.6297461032867432, "mean_token_accuracy": 0.8434038307517767, "num_tokens": 30206993.0, "step": 14780 }, { "entropy": 0.5873375245369971, "epoch": 0.24020853804113917, "grad_norm": 6.78125, "learning_rate": 4.3874505448044734e-05, "loss": 0.5527103424072266, "mean_token_accuracy": 0.8617402002215385, "num_tokens": 30228128.0, "step": 14790 }, { "entropy": 0.687246706802398, "epoch": 0.24037095084576468, "grad_norm": 10.1875, "learning_rate": 4.386600025287746e-05, "loss": 0.6868251323699951, "mean_token_accuracy": 0.8385193429887294, "num_tokens": 30248950.0, "step": 14800 }, { "entropy": 0.6285386463627219, "epoch": 0.2405333636503902, "grad_norm": 7.78125, "learning_rate": 4.385748998271372e-05, "loss": 0.6195930004119873, "mean_token_accuracy": 0.8385484501719475, "num_tokens": 30268246.0, "step": 14810 }, { "entropy": 0.5239374488592148, "epoch": 0.24069577645501572, "grad_norm": 6.75, "learning_rate": 4.38489746398428e-05, "loss": 0.5067069053649902, "mean_token_accuracy": 0.8702627994120121, "num_tokens": 30287504.0, "step": 14820 }, { "entropy": 0.5879964422434568, "epoch": 0.24085818925964123, "grad_norm": 6.625, "learning_rate": 4.3840454226555336e-05, "loss": 0.595723295211792, "mean_token_accuracy": 0.8532620728015899, "num_tokens": 30308618.0, "step": 14830 }, { "entropy": 0.5661723539233208, "epoch": 0.24102060206426676, "grad_norm": 8.375, "learning_rate": 4.383192874514335e-05, "loss": 0.5768740177154541, "mean_token_accuracy": 0.8580047070980072, "num_tokens": 30329468.0, "step": 14840 }, { "entropy": 0.560481853177771, "epoch": 0.24118301486889226, "grad_norm": 9.625, "learning_rate": 4.38233981979002e-05, "loss": 0.5720639705657959, "mean_token_accuracy": 0.8582237392663956, "num_tokens": 30348891.0, "step": 14850 }, { "entropy": 0.5252339316997677, "epoch": 0.24134542767351777, "grad_norm": 6.125, "learning_rate": 4.381486258712064e-05, "loss": 0.5085159301757812, "mean_token_accuracy": 0.8672223754227162, "num_tokens": 30367424.0, "step": 14860 }, { "entropy": 0.6448436572682112, "epoch": 0.2415078404781433, "grad_norm": 8.25, "learning_rate": 4.380632191510075e-05, "loss": 0.6645538806915283, "mean_token_accuracy": 0.8306098140776157, "num_tokens": 30387894.0, "step": 14870 }, { "entropy": 0.5036853117868304, "epoch": 0.2416702532827688, "grad_norm": 9.25, "learning_rate": 4.379777618413801e-05, "loss": 0.5116088390350342, "mean_token_accuracy": 0.8658053562045097, "num_tokens": 30407310.0, "step": 14880 }, { "entropy": 0.5769014475867152, "epoch": 0.24183266608739434, "grad_norm": 6.8125, "learning_rate": 4.378922539653123e-05, "loss": 0.5549660682678222, "mean_token_accuracy": 0.856963224709034, "num_tokens": 30428070.0, "step": 14890 }, { "entropy": 0.5755767674185336, "epoch": 0.24199507889201985, "grad_norm": 11.3125, "learning_rate": 4.3780669554580586e-05, "loss": 0.6151656150817871, "mean_token_accuracy": 0.8406831540167332, "num_tokens": 30448027.0, "step": 14900 }, { "entropy": 0.5615435445681214, "epoch": 0.24215749169664536, "grad_norm": 9.1875, "learning_rate": 4.377210866058763e-05, "loss": 0.5779373645782471, "mean_token_accuracy": 0.8570484668016434, "num_tokens": 30467607.0, "step": 14910 }, { "entropy": 0.5238499933853745, "epoch": 0.2423199045012709, "grad_norm": 9.0, "learning_rate": 4.3763542716855256e-05, "loss": 0.5502255916595459, "mean_token_accuracy": 0.8568500109016896, "num_tokens": 30487259.0, "step": 14920 }, { "entropy": 0.6081096332520246, "epoch": 0.2424823173058964, "grad_norm": 9.5, "learning_rate": 4.375497172568772e-05, "loss": 0.6475711345672608, "mean_token_accuracy": 0.8418792761862278, "num_tokens": 30508147.0, "step": 14930 }, { "entropy": 0.5225677321199328, "epoch": 0.2426447301105219, "grad_norm": 6.1875, "learning_rate": 4.374639568939065e-05, "loss": 0.4899734020233154, "mean_token_accuracy": 0.8770474031567573, "num_tokens": 30528876.0, "step": 14940 }, { "entropy": 0.6693194425664842, "epoch": 0.24280714291514743, "grad_norm": 7.40625, "learning_rate": 4.3737814610271e-05, "loss": 0.6949044227600097, "mean_token_accuracy": 0.836475407704711, "num_tokens": 30550620.0, "step": 14950 }, { "entropy": 0.6108877833932638, "epoch": 0.24296955571977294, "grad_norm": 6.6875, "learning_rate": 4.372922849063711e-05, "loss": 0.589052677154541, "mean_token_accuracy": 0.8511971358209849, "num_tokens": 30571127.0, "step": 14960 }, { "entropy": 0.585554796922952, "epoch": 0.24313196852439847, "grad_norm": 11.6875, "learning_rate": 4.3720637332798666e-05, "loss": 0.590482521057129, "mean_token_accuracy": 0.8527560845017433, "num_tokens": 30591014.0, "step": 14970 }, { "entropy": 0.6299329937435687, "epoch": 0.24329438132902398, "grad_norm": 8.625, "learning_rate": 4.3712041139066706e-05, "loss": 0.6605061054229736, "mean_token_accuracy": 0.8374121967703104, "num_tokens": 30611768.0, "step": 14980 }, { "entropy": 0.5743547551333904, "epoch": 0.24345679413364948, "grad_norm": 8.125, "learning_rate": 4.370343991175363e-05, "loss": 0.5842247486114502, "mean_token_accuracy": 0.8541637055575848, "num_tokens": 30632433.0, "step": 14990 }, { "entropy": 0.5950376314111054, "epoch": 0.24361920693827502, "grad_norm": 7.96875, "learning_rate": 4.3694833653173185e-05, "loss": 0.5478064060211182, "mean_token_accuracy": 0.8641412816941738, "num_tokens": 30654015.0, "step": 15000 }, { "entropy": 0.6485071200877428, "epoch": 0.24378161974290052, "grad_norm": 11.3125, "learning_rate": 4.368622236564047e-05, "loss": 0.606068468093872, "mean_token_accuracy": 0.8489415943622589, "num_tokens": 30674123.0, "step": 15010 }, { "entropy": 0.5891464309301228, "epoch": 0.24394403254752606, "grad_norm": 20.875, "learning_rate": 4.367760605147195e-05, "loss": 0.653269910812378, "mean_token_accuracy": 0.839951304346323, "num_tokens": 30694037.0, "step": 15020 }, { "entropy": 0.6294226916506886, "epoch": 0.24410644535215156, "grad_norm": 7.96875, "learning_rate": 4.3668984712985424e-05, "loss": 0.6595374584197998, "mean_token_accuracy": 0.8356666781008244, "num_tokens": 30714350.0, "step": 15030 }, { "entropy": 0.538958351034671, "epoch": 0.24426885815677707, "grad_norm": 6.71875, "learning_rate": 4.366035835250005e-05, "loss": 0.5581567764282227, "mean_token_accuracy": 0.8548636771738529, "num_tokens": 30735217.0, "step": 15040 }, { "entropy": 0.6154553745873272, "epoch": 0.2444312709614026, "grad_norm": 5.40625, "learning_rate": 4.3651726972336346e-05, "loss": 0.572450828552246, "mean_token_accuracy": 0.8533853113651275, "num_tokens": 30755471.0, "step": 15050 }, { "entropy": 0.5973708195611834, "epoch": 0.2445936837660281, "grad_norm": 5.15625, "learning_rate": 4.364309057481617e-05, "loss": 0.6325802803039551, "mean_token_accuracy": 0.8517468959093094, "num_tokens": 30776688.0, "step": 15060 }, { "entropy": 0.5826473977416754, "epoch": 0.24475609657065364, "grad_norm": 7.375, "learning_rate": 4.3634449162262725e-05, "loss": 0.5725443363189697, "mean_token_accuracy": 0.856584595143795, "num_tokens": 30795605.0, "step": 15070 }, { "entropy": 0.5394411638379097, "epoch": 0.24491850937527915, "grad_norm": 7.0, "learning_rate": 4.3625802737000586e-05, "loss": 0.5030874729156494, "mean_token_accuracy": 0.8665475234389305, "num_tokens": 30815429.0, "step": 15080 }, { "entropy": 0.5412048373371363, "epoch": 0.24508092217990465, "grad_norm": 7.34375, "learning_rate": 4.361715130135565e-05, "loss": 0.5371362686157226, "mean_token_accuracy": 0.8615266591310501, "num_tokens": 30835451.0, "step": 15090 }, { "entropy": 0.540456778742373, "epoch": 0.2452433349845302, "grad_norm": 6.8125, "learning_rate": 4.360849485765517e-05, "loss": 0.5781017303466797, "mean_token_accuracy": 0.8527266636490822, "num_tokens": 30855324.0, "step": 15100 }, { "entropy": 0.6495681690052152, "epoch": 0.2454057477891557, "grad_norm": 5.21875, "learning_rate": 4.359983340822775e-05, "loss": 0.6465807914733886, "mean_token_accuracy": 0.8363168716430665, "num_tokens": 30876397.0, "step": 15110 }, { "entropy": 0.5944933845661581, "epoch": 0.24556816059378123, "grad_norm": 8.0, "learning_rate": 4.3591166955403356e-05, "loss": 0.5981156349182128, "mean_token_accuracy": 0.8489713847637177, "num_tokens": 30897124.0, "step": 15120 }, { "entropy": 0.6534764861688018, "epoch": 0.24573057339840673, "grad_norm": 10.3125, "learning_rate": 4.3582495501513264e-05, "loss": 0.6767714500427247, "mean_token_accuracy": 0.8347577914595604, "num_tokens": 30918376.0, "step": 15130 }, { "entropy": 0.6362490458413959, "epoch": 0.24589298620303224, "grad_norm": 8.375, "learning_rate": 4.3573819048890116e-05, "loss": 0.6539965152740479, "mean_token_accuracy": 0.8312241673469544, "num_tokens": 30939832.0, "step": 15140 }, { "entropy": 0.5229353215312585, "epoch": 0.24605539900765777, "grad_norm": 5.28125, "learning_rate": 4.356513759986791e-05, "loss": 0.5273227691650391, "mean_token_accuracy": 0.8652983829379082, "num_tokens": 30959956.0, "step": 15150 }, { "entropy": 0.6362977486103774, "epoch": 0.24621781181228328, "grad_norm": 5.625, "learning_rate": 4.3556451156781965e-05, "loss": 0.6242793560028076, "mean_token_accuracy": 0.8456807862967253, "num_tokens": 30980893.0, "step": 15160 }, { "entropy": 0.5384583485312759, "epoch": 0.2463802246169088, "grad_norm": 8.8125, "learning_rate": 4.354775972196895e-05, "loss": 0.5819664001464844, "mean_token_accuracy": 0.8562564298510551, "num_tokens": 31000691.0, "step": 15170 }, { "entropy": 0.6258472930639982, "epoch": 0.24654263742153432, "grad_norm": 8.6875, "learning_rate": 4.3539063297766894e-05, "loss": 0.6226630210876465, "mean_token_accuracy": 0.8435637213289737, "num_tokens": 31021095.0, "step": 15180 }, { "entropy": 0.5226189535111189, "epoch": 0.24670505022615982, "grad_norm": 7.625, "learning_rate": 4.353036188651514e-05, "loss": 0.4939117908477783, "mean_token_accuracy": 0.8774497926235199, "num_tokens": 31040908.0, "step": 15190 }, { "entropy": 0.5515336023643613, "epoch": 0.24686746303078536, "grad_norm": 8.1875, "learning_rate": 4.352165549055439e-05, "loss": 0.560255765914917, "mean_token_accuracy": 0.8591833896934986, "num_tokens": 31061562.0, "step": 15200 }, { "entropy": 0.46942175440490247, "epoch": 0.24702987583541086, "grad_norm": 10.375, "learning_rate": 4.35129441122267e-05, "loss": 0.4594561100006104, "mean_token_accuracy": 0.8757174961268902, "num_tokens": 31080682.0, "step": 15210 }, { "entropy": 0.5413955338299274, "epoch": 0.24719228864003637, "grad_norm": 7.34375, "learning_rate": 4.350422775387543e-05, "loss": 0.5352540493011475, "mean_token_accuracy": 0.8671479307115078, "num_tokens": 31102879.0, "step": 15220 }, { "entropy": 0.6085431596264244, "epoch": 0.2473547014446619, "grad_norm": 5.40625, "learning_rate": 4.349550641784531e-05, "loss": 0.6637259960174561, "mean_token_accuracy": 0.8344017527997494, "num_tokens": 31122888.0, "step": 15230 }, { "entropy": 0.5345024525653571, "epoch": 0.2475171142492874, "grad_norm": 9.8125, "learning_rate": 4.34867801064824e-05, "loss": 0.5595914840698242, "mean_token_accuracy": 0.8488235265016556, "num_tokens": 31142442.0, "step": 15240 }, { "entropy": 0.5410179506987334, "epoch": 0.24767952705391294, "grad_norm": 5.25, "learning_rate": 4.34780488221341e-05, "loss": 0.5111274242401123, "mean_token_accuracy": 0.8741055347025395, "num_tokens": 31163165.0, "step": 15250 }, { "entropy": 0.5568346183747053, "epoch": 0.24784193985853845, "grad_norm": 8.6875, "learning_rate": 4.346931256714913e-05, "loss": 0.5668274879455566, "mean_token_accuracy": 0.8567698888480664, "num_tokens": 31182327.0, "step": 15260 }, { "entropy": 0.5658491785638035, "epoch": 0.24800435266316395, "grad_norm": 9.25, "learning_rate": 4.346057134387758e-05, "loss": 0.5809285163879394, "mean_token_accuracy": 0.8494610711932182, "num_tokens": 31201584.0, "step": 15270 }, { "entropy": 0.5550103968475014, "epoch": 0.24816676546778949, "grad_norm": 8.875, "learning_rate": 4.345182515467084e-05, "loss": 0.5920053005218506, "mean_token_accuracy": 0.8491007022559642, "num_tokens": 31221505.0, "step": 15280 }, { "entropy": 0.5834278243593871, "epoch": 0.248329178272415, "grad_norm": 6.53125, "learning_rate": 4.344307400188168e-05, "loss": 0.6301911354064942, "mean_token_accuracy": 0.8393901444971561, "num_tokens": 31241491.0, "step": 15290 }, { "entropy": 0.5348898220341652, "epoch": 0.24849159107704052, "grad_norm": 9.9375, "learning_rate": 4.343431788786415e-05, "loss": 0.5553106307983399, "mean_token_accuracy": 0.8565469086170197, "num_tokens": 31262902.0, "step": 15300 }, { "entropy": 0.5247830992564559, "epoch": 0.24865400388166603, "grad_norm": 7.65625, "learning_rate": 4.342555681497369e-05, "loss": 0.5062832355499267, "mean_token_accuracy": 0.8671508803963661, "num_tokens": 31283911.0, "step": 15310 }, { "entropy": 0.5091532193124294, "epoch": 0.24881641668629154, "grad_norm": 5.28125, "learning_rate": 4.341679078556704e-05, "loss": 0.5440468311309814, "mean_token_accuracy": 0.861503129452467, "num_tokens": 31303941.0, "step": 15320 }, { "entropy": 0.6267969204112888, "epoch": 0.24897882949091707, "grad_norm": 11.0, "learning_rate": 4.340801980200228e-05, "loss": 0.6562600135803223, "mean_token_accuracy": 0.8411119185388088, "num_tokens": 31323761.0, "step": 15330 }, { "entropy": 0.6203807605430484, "epoch": 0.24914124229554258, "grad_norm": 9.25, "learning_rate": 4.339924386663882e-05, "loss": 0.5832053184509277, "mean_token_accuracy": 0.8573539555072784, "num_tokens": 31344120.0, "step": 15340 }, { "entropy": 0.5713986282236874, "epoch": 0.2493036551001681, "grad_norm": 10.4375, "learning_rate": 4.339046298183741e-05, "loss": 0.5910331249237061, "mean_token_accuracy": 0.8455503262579441, "num_tokens": 31364297.0, "step": 15350 }, { "entropy": 0.5738907265011222, "epoch": 0.24946606790479361, "grad_norm": 7.21875, "learning_rate": 4.338167714996012e-05, "loss": 0.5743090152740479, "mean_token_accuracy": 0.8490411575883627, "num_tokens": 31385435.0, "step": 15360 }, { "entropy": 0.6226803259924054, "epoch": 0.24962848070941912, "grad_norm": 6.96875, "learning_rate": 4.3372886373370376e-05, "loss": 0.662813663482666, "mean_token_accuracy": 0.8439899906516075, "num_tokens": 31407684.0, "step": 15370 }, { "entropy": 0.5530667746439576, "epoch": 0.24979089351404465, "grad_norm": 9.9375, "learning_rate": 4.33640906544329e-05, "loss": 0.5643144607543945, "mean_token_accuracy": 0.8632739603519439, "num_tokens": 31427250.0, "step": 15380 }, { "entropy": 0.6290823282208293, "epoch": 0.24995330631867016, "grad_norm": 9.5625, "learning_rate": 4.335528999551377e-05, "loss": 0.6765377998352051, "mean_token_accuracy": 0.8345309391617775, "num_tokens": 31448177.0, "step": 15390 }, { "entropy": 0.6678023953456431, "epoch": 0.25011571912329567, "grad_norm": 7.875, "learning_rate": 4.3346484398980394e-05, "loss": 0.679468297958374, "mean_token_accuracy": 0.833036357909441, "num_tokens": 31469428.0, "step": 15400 }, { "entropy": 0.4688108302652836, "epoch": 0.2502781319279212, "grad_norm": 8.6875, "learning_rate": 4.333767386720147e-05, "loss": 0.4608167171478271, "mean_token_accuracy": 0.8769662849605083, "num_tokens": 31489377.0, "step": 15410 }, { "entropy": 0.6404851194471121, "epoch": 0.25044054473254673, "grad_norm": 10.4375, "learning_rate": 4.3328858402547065e-05, "loss": 0.6063575267791748, "mean_token_accuracy": 0.8455529227852822, "num_tokens": 31509416.0, "step": 15420 }, { "entropy": 0.503203792963177, "epoch": 0.2506029575371722, "grad_norm": 6.8125, "learning_rate": 4.3320038007388556e-05, "loss": 0.5147240161895752, "mean_token_accuracy": 0.8650565199553967, "num_tokens": 31529232.0, "step": 15430 }, { "entropy": 0.5574098563753068, "epoch": 0.25076537034179774, "grad_norm": 9.375, "learning_rate": 4.331121268409866e-05, "loss": 0.5542675971984863, "mean_token_accuracy": 0.8587027601897717, "num_tokens": 31551073.0, "step": 15440 }, { "entropy": 0.5560150746256113, "epoch": 0.2509277831464233, "grad_norm": 9.9375, "learning_rate": 4.3302382435051393e-05, "loss": 0.5500722885131836, "mean_token_accuracy": 0.8638024650514126, "num_tokens": 31572091.0, "step": 15450 }, { "entropy": 0.6067171305418014, "epoch": 0.25109019595104876, "grad_norm": 13.3125, "learning_rate": 4.3293547262622115e-05, "loss": 0.6475485324859619, "mean_token_accuracy": 0.8446847170591354, "num_tokens": 31592189.0, "step": 15460 }, { "entropy": 0.5441944845020771, "epoch": 0.2512526087556743, "grad_norm": 8.0, "learning_rate": 4.328470716918752e-05, "loss": 0.5204062461853027, "mean_token_accuracy": 0.8664009988307952, "num_tokens": 31612449.0, "step": 15470 }, { "entropy": 0.5215622836723923, "epoch": 0.2514150215602998, "grad_norm": 8.625, "learning_rate": 4.32758621571256e-05, "loss": 0.5645112037658692, "mean_token_accuracy": 0.8565972276031971, "num_tokens": 31633348.0, "step": 15480 }, { "entropy": 0.560841653496027, "epoch": 0.25157743436492536, "grad_norm": 7.5, "learning_rate": 4.326701222881568e-05, "loss": 0.5883710861206055, "mean_token_accuracy": 0.8478001751005649, "num_tokens": 31653528.0, "step": 15490 }, { "entropy": 0.6301664214581251, "epoch": 0.25173984716955083, "grad_norm": 6.40625, "learning_rate": 4.325815738663843e-05, "loss": 0.6019854545593262, "mean_token_accuracy": 0.8453720815479755, "num_tokens": 31674539.0, "step": 15500 }, { "entropy": 0.5082409573718906, "epoch": 0.25190225997417637, "grad_norm": 9.8125, "learning_rate": 4.3249297632975813e-05, "loss": 0.49705934524536133, "mean_token_accuracy": 0.8691798731684685, "num_tokens": 31694592.0, "step": 15510 }, { "entropy": 0.5715178216807544, "epoch": 0.2520646727788019, "grad_norm": 7.1875, "learning_rate": 4.324043297021111e-05, "loss": 0.5892731666564941, "mean_token_accuracy": 0.8504037477076054, "num_tokens": 31714741.0, "step": 15520 }, { "entropy": 0.575499612186104, "epoch": 0.2522270855834274, "grad_norm": 7.9375, "learning_rate": 4.323156340072895e-05, "loss": 0.5749993324279785, "mean_token_accuracy": 0.8490799978375435, "num_tokens": 31734416.0, "step": 15530 }, { "entropy": 0.6137212052941322, "epoch": 0.2523894983880529, "grad_norm": 6.0, "learning_rate": 4.322268892691526e-05, "loss": 0.602094316482544, "mean_token_accuracy": 0.8485502868890762, "num_tokens": 31755722.0, "step": 15540 }, { "entropy": 0.6559651636518538, "epoch": 0.25255191119267845, "grad_norm": 7.09375, "learning_rate": 4.32138095511573e-05, "loss": 0.6765952110290527, "mean_token_accuracy": 0.8346683736890554, "num_tokens": 31775135.0, "step": 15550 }, { "entropy": 0.5045758728403598, "epoch": 0.2527143239973039, "grad_norm": 9.25, "learning_rate": 4.320492527584363e-05, "loss": 0.46181230545043944, "mean_token_accuracy": 0.8868521563708782, "num_tokens": 31795722.0, "step": 15560 }, { "entropy": 0.5339118548668921, "epoch": 0.25287673680192946, "grad_norm": 6.53125, "learning_rate": 4.319603610336416e-05, "loss": 0.5583122730255127, "mean_token_accuracy": 0.8545616641640663, "num_tokens": 31814996.0, "step": 15570 }, { "entropy": 0.4760604371316731, "epoch": 0.253039149606555, "grad_norm": 6.5, "learning_rate": 4.318714203611007e-05, "loss": 0.49817795753479005, "mean_token_accuracy": 0.8684930555522442, "num_tokens": 31834454.0, "step": 15580 }, { "entropy": 0.5157092433888465, "epoch": 0.2532015624111805, "grad_norm": 8.6875, "learning_rate": 4.317824307647391e-05, "loss": 0.549840259552002, "mean_token_accuracy": 0.8601284757256508, "num_tokens": 31854369.0, "step": 15590 }, { "entropy": 0.5532092477194965, "epoch": 0.253363975215806, "grad_norm": 8.1875, "learning_rate": 4.3169339226849505e-05, "loss": 0.5727435111999511, "mean_token_accuracy": 0.8526933941990137, "num_tokens": 31875676.0, "step": 15600 }, { "entropy": 0.5453777751885355, "epoch": 0.25352638802043154, "grad_norm": 7.625, "learning_rate": 4.316043048963202e-05, "loss": 0.5265498638153077, "mean_token_accuracy": 0.8595675863325596, "num_tokens": 31895612.0, "step": 15610 }, { "entropy": 0.5747438267804682, "epoch": 0.25368880082505707, "grad_norm": 9.0625, "learning_rate": 4.315151686721791e-05, "loss": 0.5577717781066894, "mean_token_accuracy": 0.8612784147262573, "num_tokens": 31915229.0, "step": 15620 }, { "entropy": 0.5240500099025667, "epoch": 0.25385121362968255, "grad_norm": 6.65625, "learning_rate": 4.3142598362004985e-05, "loss": 0.5302580833435059, "mean_token_accuracy": 0.86611467897892, "num_tokens": 31934941.0, "step": 15630 }, { "entropy": 0.609642923809588, "epoch": 0.2540136264343081, "grad_norm": 6.15625, "learning_rate": 4.313367497639231e-05, "loss": 0.6148351192474365, "mean_token_accuracy": 0.8453241415321827, "num_tokens": 31955323.0, "step": 15640 }, { "entropy": 0.568718890612945, "epoch": 0.2541760392389336, "grad_norm": 8.125, "learning_rate": 4.312474671278033e-05, "loss": 0.5747434616088867, "mean_token_accuracy": 0.8550405524671078, "num_tokens": 31975137.0, "step": 15650 }, { "entropy": 0.5473157517611981, "epoch": 0.2543384520435591, "grad_norm": 7.1875, "learning_rate": 4.311581357357074e-05, "loss": 0.5780817985534668, "mean_token_accuracy": 0.8631300315260887, "num_tokens": 31994772.0, "step": 15660 }, { "entropy": 0.547796099120751, "epoch": 0.2545008648481846, "grad_norm": 7.21875, "learning_rate": 4.3106875561166596e-05, "loss": 0.5117413997650146, "mean_token_accuracy": 0.8690782651305199, "num_tokens": 32014173.0, "step": 15670 }, { "entropy": 0.5009539962280541, "epoch": 0.25466327765281016, "grad_norm": 5.6875, "learning_rate": 4.309793267797222e-05, "loss": 0.48561906814575195, "mean_token_accuracy": 0.876363368332386, "num_tokens": 32034593.0, "step": 15680 }, { "entropy": 0.6489931442774832, "epoch": 0.25482569045743564, "grad_norm": 9.1875, "learning_rate": 4.308898492639329e-05, "loss": 0.6516633987426758, "mean_token_accuracy": 0.8318918745964765, "num_tokens": 32054941.0, "step": 15690 }, { "entropy": 0.5608673102688044, "epoch": 0.25498810326206117, "grad_norm": 7.75, "learning_rate": 4.308003230883676e-05, "loss": 0.5833994388580322, "mean_token_accuracy": 0.8530357964336872, "num_tokens": 32074973.0, "step": 15700 }, { "entropy": 0.5728492319583893, "epoch": 0.2551505160666867, "grad_norm": 7.25, "learning_rate": 4.30710748277109e-05, "loss": 0.5899284362792969, "mean_token_accuracy": 0.8559984862804413, "num_tokens": 32096871.0, "step": 15710 }, { "entropy": 0.5860084610059857, "epoch": 0.25531292887131224, "grad_norm": 7.8125, "learning_rate": 4.306211248542531e-05, "loss": 0.5921046257019043, "mean_token_accuracy": 0.856103340536356, "num_tokens": 32115329.0, "step": 15720 }, { "entropy": 0.6470977185294032, "epoch": 0.2554753416759377, "grad_norm": 10.0, "learning_rate": 4.3053145284390864e-05, "loss": 0.6689095020294189, "mean_token_accuracy": 0.825097155943513, "num_tokens": 32136804.0, "step": 15730 }, { "entropy": 0.5800309094134718, "epoch": 0.25563775448056325, "grad_norm": 7.0625, "learning_rate": 4.304417322701977e-05, "loss": 0.5901936531066895, "mean_token_accuracy": 0.8507696568965912, "num_tokens": 32157432.0, "step": 15740 }, { "entropy": 0.5346530498936772, "epoch": 0.2558001672851888, "grad_norm": 11.75, "learning_rate": 4.303519631572552e-05, "loss": 0.5190016746520996, "mean_token_accuracy": 0.8742322601377964, "num_tokens": 32177944.0, "step": 15750 }, { "entropy": 0.61239367374219, "epoch": 0.25596258008981426, "grad_norm": 7.78125, "learning_rate": 4.302621455292294e-05, "loss": 0.6012380599975586, "mean_token_accuracy": 0.8453654490411282, "num_tokens": 32199357.0, "step": 15760 }, { "entropy": 0.5522593474946916, "epoch": 0.2561249928944398, "grad_norm": 6.96875, "learning_rate": 4.301722794102812e-05, "loss": 0.5532767295837402, "mean_token_accuracy": 0.8587029751390218, "num_tokens": 32218829.0, "step": 15770 }, { "entropy": 0.5581951828673481, "epoch": 0.25628740569906533, "grad_norm": 7.03125, "learning_rate": 4.30082364824585e-05, "loss": 0.5771262168884277, "mean_token_accuracy": 0.8547569043934345, "num_tokens": 32239384.0, "step": 15780 }, { "entropy": 0.6390960846096277, "epoch": 0.2564498185036908, "grad_norm": 7.09375, "learning_rate": 4.2999240179632794e-05, "loss": 0.6417674064636231, "mean_token_accuracy": 0.844633562117815, "num_tokens": 32259644.0, "step": 15790 }, { "entropy": 0.5922097467817367, "epoch": 0.25661223130831634, "grad_norm": 8.9375, "learning_rate": 4.299023903497102e-05, "loss": 0.5955427169799805, "mean_token_accuracy": 0.847586727142334, "num_tokens": 32280235.0, "step": 15800 }, { "entropy": 0.594960379647091, "epoch": 0.2567746441129419, "grad_norm": 7.375, "learning_rate": 4.298123305089453e-05, "loss": 0.5736542701721191, "mean_token_accuracy": 0.8510989397764206, "num_tokens": 32299739.0, "step": 15810 }, { "entropy": 0.5179244023747742, "epoch": 0.2569370569175674, "grad_norm": 5.9375, "learning_rate": 4.297222222982593e-05, "loss": 0.4979219436645508, "mean_token_accuracy": 0.8639967389404773, "num_tokens": 32322457.0, "step": 15820 }, { "entropy": 0.5297730300575495, "epoch": 0.2570994697221929, "grad_norm": 6.65625, "learning_rate": 4.2963206574189166e-05, "loss": 0.5702173233032226, "mean_token_accuracy": 0.856246829777956, "num_tokens": 32342122.0, "step": 15830 }, { "entropy": 0.6159854920580983, "epoch": 0.2572618825268184, "grad_norm": 7.71875, "learning_rate": 4.295418608640947e-05, "loss": 0.5980271339416504, "mean_token_accuracy": 0.8491918802261352, "num_tokens": 32363420.0, "step": 15840 }, { "entropy": 0.52522870588582, "epoch": 0.25742429533144395, "grad_norm": 6.65625, "learning_rate": 4.294516076891335e-05, "loss": 0.5282418251037597, "mean_token_accuracy": 0.8686798684298992, "num_tokens": 32383569.0, "step": 15850 }, { "entropy": 0.5813529073260725, "epoch": 0.25758670813606943, "grad_norm": 8.6875, "learning_rate": 4.293613062412866e-05, "loss": 0.6494122505187988, "mean_token_accuracy": 0.8402756504714489, "num_tokens": 32403662.0, "step": 15860 }, { "entropy": 0.6148645138368011, "epoch": 0.25774912094069496, "grad_norm": 8.5, "learning_rate": 4.292709565448452e-05, "loss": 0.6143770217895508, "mean_token_accuracy": 0.8451914139091968, "num_tokens": 32425203.0, "step": 15870 }, { "entropy": 0.6489903093315661, "epoch": 0.2579115337453205, "grad_norm": 10.75, "learning_rate": 4.291805586241137e-05, "loss": 0.729645824432373, "mean_token_accuracy": 0.8307115159928798, "num_tokens": 32445964.0, "step": 15880 }, { "entropy": 0.5806382352486252, "epoch": 0.258073946549946, "grad_norm": 6.0625, "learning_rate": 4.290901125034092e-05, "loss": 0.5491117477416992, "mean_token_accuracy": 0.8596501752734185, "num_tokens": 32467185.0, "step": 15890 }, { "entropy": 0.6109069483354688, "epoch": 0.2582363593545715, "grad_norm": 7.375, "learning_rate": 4.2899961820706193e-05, "loss": 0.5586971282958985, "mean_token_accuracy": 0.8523763608187437, "num_tokens": 32487569.0, "step": 15900 }, { "entropy": 0.5413804239593446, "epoch": 0.25839877215919704, "grad_norm": 6.15625, "learning_rate": 4.2890907575941515e-05, "loss": 0.5060252666473388, "mean_token_accuracy": 0.8706704676151276, "num_tokens": 32508128.0, "step": 15910 }, { "entropy": 0.5825108227320015, "epoch": 0.2585611849638225, "grad_norm": 9.4375, "learning_rate": 4.2881848518482485e-05, "loss": 0.5634130001068115, "mean_token_accuracy": 0.8502587854862214, "num_tokens": 32528795.0, "step": 15920 }, { "entropy": 0.48144742781296374, "epoch": 0.25872359776844805, "grad_norm": 10.1875, "learning_rate": 4.287278465076602e-05, "loss": 0.49934802055358884, "mean_token_accuracy": 0.8735240899026394, "num_tokens": 32549627.0, "step": 15930 }, { "entropy": 0.5593880249187351, "epoch": 0.2588860105730736, "grad_norm": 6.6875, "learning_rate": 4.2863715975230315e-05, "loss": 0.5780657291412353, "mean_token_accuracy": 0.8456660892814398, "num_tokens": 32570728.0, "step": 15940 }, { "entropy": 0.5743173694703728, "epoch": 0.2590484233776991, "grad_norm": 8.0, "learning_rate": 4.2854642494314865e-05, "loss": 0.5898411273956299, "mean_token_accuracy": 0.8542416028678417, "num_tokens": 32591104.0, "step": 15950 }, { "entropy": 0.601020597666502, "epoch": 0.2592108361823246, "grad_norm": 12.5, "learning_rate": 4.2845564210460464e-05, "loss": 0.6554780960083008, "mean_token_accuracy": 0.8408015370368958, "num_tokens": 32611629.0, "step": 15960 }, { "entropy": 0.5835861927829683, "epoch": 0.25937324898695013, "grad_norm": 8.5, "learning_rate": 4.283648112610918e-05, "loss": 0.5824780464172363, "mean_token_accuracy": 0.8554405227303505, "num_tokens": 32631774.0, "step": 15970 }, { "entropy": 0.5203159669414162, "epoch": 0.25953566179157567, "grad_norm": 7.25, "learning_rate": 4.282739324370439e-05, "loss": 0.5492111682891846, "mean_token_accuracy": 0.854703713953495, "num_tokens": 32652251.0, "step": 15980 }, { "entropy": 0.6131322188302875, "epoch": 0.25969807459620114, "grad_norm": 5.59375, "learning_rate": 4.281830056569076e-05, "loss": 0.6020207405090332, "mean_token_accuracy": 0.8518664203584194, "num_tokens": 32674966.0, "step": 15990 }, { "epoch": 0.2598604874008267, "eval_entropy": 0.6120449800491333, "eval_loss": 0.613021194934845, "eval_mean_token_accuracy": 0.843826699256897, "eval_num_tokens": 32694423.0, "eval_runtime": 40.1626, "eval_samples_per_second": 49.798, "eval_steps_per_second": 6.225, "step": 16000 }, { "entropy": 0.5872263912344351, "epoch": 0.2600229002054522, "grad_norm": 7.34375, "learning_rate": 4.2800100832622034e-05, "loss": 0.5916765689849853, "mean_token_accuracy": 0.8476166643202305, "num_tokens": 32716875.0, "step": 16010 }, { "entropy": 0.5311224710196256, "epoch": 0.2601853130100777, "grad_norm": 9.9375, "learning_rate": 4.279099378246272e-05, "loss": 0.5223794460296631, "mean_token_accuracy": 0.861445589736104, "num_tokens": 32737111.0, "step": 16020 }, { "entropy": 0.5683638142421842, "epoch": 0.2603477258147032, "grad_norm": 6.5, "learning_rate": 4.2781881946486093e-05, "loss": 0.5886410236358642, "mean_token_accuracy": 0.8489915072917938, "num_tokens": 32756461.0, "step": 16030 }, { "entropy": 0.5772123669274152, "epoch": 0.26051013861932876, "grad_norm": 10.0625, "learning_rate": 4.277276532714326e-05, "loss": 0.5594343185424805, "mean_token_accuracy": 0.8571921654045582, "num_tokens": 32776649.0, "step": 16040 }, { "entropy": 0.5909796336665749, "epoch": 0.2606725514239543, "grad_norm": 7.25, "learning_rate": 4.2763643926886615e-05, "loss": 0.6415755271911621, "mean_token_accuracy": 0.8333929240703583, "num_tokens": 32796688.0, "step": 16050 }, { "entropy": 0.5632294069975614, "epoch": 0.26083496422857977, "grad_norm": 9.3125, "learning_rate": 4.275451774816983e-05, "loss": 0.5782293796539306, "mean_token_accuracy": 0.8559122875332832, "num_tokens": 32817121.0, "step": 16060 }, { "entropy": 0.5966997879557312, "epoch": 0.2609973770332053, "grad_norm": 7.75, "learning_rate": 4.2745386793447875e-05, "loss": 0.5659688949584961, "mean_token_accuracy": 0.8616336017847062, "num_tokens": 32836848.0, "step": 16070 }, { "entropy": 0.5465869106352329, "epoch": 0.26115978983783084, "grad_norm": 5.09375, "learning_rate": 4.273625106517699e-05, "loss": 0.5423137664794921, "mean_token_accuracy": 0.8634883366525173, "num_tokens": 32857559.0, "step": 16080 }, { "entropy": 0.5609927339479327, "epoch": 0.2613222026424563, "grad_norm": 7.125, "learning_rate": 4.2727110565814695e-05, "loss": 0.5616235256195068, "mean_token_accuracy": 0.8476842626929283, "num_tokens": 32878441.0, "step": 16090 }, { "entropy": 0.6178541194181889, "epoch": 0.26148461544708185, "grad_norm": 10.4375, "learning_rate": 4.271796529781984e-05, "loss": 0.6368340015411377, "mean_token_accuracy": 0.842853956669569, "num_tokens": 32899307.0, "step": 16100 }, { "entropy": 0.6189182843081653, "epoch": 0.2616470282517074, "grad_norm": 7.84375, "learning_rate": 4.270881526365249e-05, "loss": 0.607978105545044, "mean_token_accuracy": 0.8537335358560085, "num_tokens": 32920933.0, "step": 16110 }, { "entropy": 0.6145026623271406, "epoch": 0.26180944105633286, "grad_norm": 9.75, "learning_rate": 4.269966046577404e-05, "loss": 0.625002384185791, "mean_token_accuracy": 0.8482311524450779, "num_tokens": 32940610.0, "step": 16120 }, { "entropy": 0.5594085396733135, "epoch": 0.2619718538609584, "grad_norm": 7.125, "learning_rate": 4.2690500906647133e-05, "loss": 0.556900930404663, "mean_token_accuracy": 0.8569698378443718, "num_tokens": 32960174.0, "step": 16130 }, { "entropy": 0.5490311951376498, "epoch": 0.2621342666655839, "grad_norm": 8.875, "learning_rate": 4.2681336588735745e-05, "loss": 0.5387625694274902, "mean_token_accuracy": 0.8680584646761418, "num_tokens": 32979413.0, "step": 16140 }, { "entropy": 0.5449624948669225, "epoch": 0.2622966794702094, "grad_norm": 7.625, "learning_rate": 4.267216751450507e-05, "loss": 0.5729319095611572, "mean_token_accuracy": 0.8505830615758896, "num_tokens": 33000883.0, "step": 16150 }, { "entropy": 0.5244334993883968, "epoch": 0.26245909227483494, "grad_norm": 7.59375, "learning_rate": 4.266299368642162e-05, "loss": 0.5112378120422363, "mean_token_accuracy": 0.8633287761360406, "num_tokens": 33022034.0, "step": 16160 }, { "entropy": 0.5062373321503401, "epoch": 0.26262150507946047, "grad_norm": 7.625, "learning_rate": 4.2653815106953165e-05, "loss": 0.46835908889770506, "mean_token_accuracy": 0.8749705143272877, "num_tokens": 33042733.0, "step": 16170 }, { "entropy": 0.571616944577545, "epoch": 0.262783917884086, "grad_norm": 5.78125, "learning_rate": 4.264463177856878e-05, "loss": 0.5439795017242431, "mean_token_accuracy": 0.8584276922047138, "num_tokens": 33062510.0, "step": 16180 }, { "entropy": 0.5502996761351824, "epoch": 0.2629463306887115, "grad_norm": 8.125, "learning_rate": 4.2635443703738784e-05, "loss": 0.5287948608398437, "mean_token_accuracy": 0.8635528326034546, "num_tokens": 33082386.0, "step": 16190 }, { "entropy": 0.5331251315306872, "epoch": 0.263108743493337, "grad_norm": 10.0625, "learning_rate": 4.262625088493481e-05, "loss": 0.5483633518218994, "mean_token_accuracy": 0.8582705166190863, "num_tokens": 33102055.0, "step": 16200 }, { "entropy": 0.5693039912730455, "epoch": 0.26327115629796255, "grad_norm": 7.25, "learning_rate": 4.261705332462973e-05, "loss": 0.5953843593597412, "mean_token_accuracy": 0.8560689210891723, "num_tokens": 33122732.0, "step": 16210 }, { "entropy": 0.5127101918216794, "epoch": 0.263433569102588, "grad_norm": 10.0625, "learning_rate": 4.260785102529772e-05, "loss": 0.5462515830993653, "mean_token_accuracy": 0.8586858376860619, "num_tokens": 33142369.0, "step": 16220 }, { "entropy": 0.5132590401917696, "epoch": 0.26359598190721356, "grad_norm": 9.5625, "learning_rate": 4.25986439894142e-05, "loss": 0.5183812141418457, "mean_token_accuracy": 0.857141500711441, "num_tokens": 33162384.0, "step": 16230 }, { "entropy": 0.6678705089259893, "epoch": 0.2637583947118391, "grad_norm": 13.0, "learning_rate": 4.2589432219455906e-05, "loss": 0.7182539939880371, "mean_token_accuracy": 0.826000128313899, "num_tokens": 33185201.0, "step": 16240 }, { "entropy": 0.6287650496698916, "epoch": 0.2639208075164646, "grad_norm": 13.125, "learning_rate": 4.258021571790081e-05, "loss": 0.6098937511444091, "mean_token_accuracy": 0.8485548622906208, "num_tokens": 33204868.0, "step": 16250 }, { "entropy": 0.5461895851418376, "epoch": 0.2640832203210901, "grad_norm": 8.375, "learning_rate": 4.2570994487228184e-05, "loss": 0.576033639907837, "mean_token_accuracy": 0.8543567016720772, "num_tokens": 33225037.0, "step": 16260 }, { "entropy": 0.5336149439914152, "epoch": 0.26424563312571564, "grad_norm": 8.6875, "learning_rate": 4.256176852991855e-05, "loss": 0.523495101928711, "mean_token_accuracy": 0.8604555539786816, "num_tokens": 33246194.0, "step": 16270 }, { "entropy": 0.5963545046746731, "epoch": 0.2644080459303412, "grad_norm": 7.53125, "learning_rate": 4.255253784845371e-05, "loss": 0.6163718223571777, "mean_token_accuracy": 0.8453723147511483, "num_tokens": 33266049.0, "step": 16280 }, { "entropy": 0.5250309262424707, "epoch": 0.26457045873496665, "grad_norm": 7.6875, "learning_rate": 4.2543302445316745e-05, "loss": 0.5137829303741455, "mean_token_accuracy": 0.8653454124927521, "num_tokens": 33285186.0, "step": 16290 }, { "entropy": 0.5527250727638602, "epoch": 0.2647328715395922, "grad_norm": 8.0625, "learning_rate": 4.2534062322992e-05, "loss": 0.5296201229095459, "mean_token_accuracy": 0.8618603713810444, "num_tokens": 33305524.0, "step": 16300 }, { "entropy": 0.5441329414024949, "epoch": 0.2648952843442177, "grad_norm": 11.3125, "learning_rate": 4.252481748396507e-05, "loss": 0.5337966918945313, "mean_token_accuracy": 0.8627076774835587, "num_tokens": 33326671.0, "step": 16310 }, { "entropy": 0.6234054951928556, "epoch": 0.2650576971488432, "grad_norm": 6.8125, "learning_rate": 4.2515567930722865e-05, "loss": 0.6547018051147461, "mean_token_accuracy": 0.8392869472503662, "num_tokens": 33347013.0, "step": 16320 }, { "entropy": 0.582083504460752, "epoch": 0.26522010995346873, "grad_norm": 8.3125, "learning_rate": 4.2506313665753516e-05, "loss": 0.5876821517944336, "mean_token_accuracy": 0.85640790425241, "num_tokens": 33368195.0, "step": 16330 }, { "entropy": 0.5619365168735385, "epoch": 0.26538252275809426, "grad_norm": 8.5, "learning_rate": 4.2497054691546454e-05, "loss": 0.5679545402526855, "mean_token_accuracy": 0.8563005596399307, "num_tokens": 33388153.0, "step": 16340 }, { "entropy": 0.6284754982218146, "epoch": 0.26554493556271974, "grad_norm": 6.40625, "learning_rate": 4.248779101059236e-05, "loss": 0.6104865074157715, "mean_token_accuracy": 0.8421074993908405, "num_tokens": 33408692.0, "step": 16350 }, { "entropy": 0.5835771359503269, "epoch": 0.2657073483673453, "grad_norm": 10.6875, "learning_rate": 4.247852262538318e-05, "loss": 0.604541540145874, "mean_token_accuracy": 0.8534373760223388, "num_tokens": 33429638.0, "step": 16360 }, { "entropy": 0.5364490568637847, "epoch": 0.2658697611719708, "grad_norm": 7.65625, "learning_rate": 4.2469249538412126e-05, "loss": 0.5276559352874756, "mean_token_accuracy": 0.8644181504845619, "num_tokens": 33450595.0, "step": 16370 }, { "entropy": 0.5514813918620348, "epoch": 0.26603217397659634, "grad_norm": 10.875, "learning_rate": 4.245997175217369e-05, "loss": 0.5529515743255615, "mean_token_accuracy": 0.8537359863519669, "num_tokens": 33470948.0, "step": 16380 }, { "entropy": 0.5129128593951464, "epoch": 0.2661945867812218, "grad_norm": 6.4375, "learning_rate": 4.2450689269163625e-05, "loss": 0.5420063972473145, "mean_token_accuracy": 0.8648550517857074, "num_tokens": 33490824.0, "step": 16390 }, { "entropy": 0.5412522336468101, "epoch": 0.26635699958584735, "grad_norm": 7.53125, "learning_rate": 4.244140209187891e-05, "loss": 0.5616102695465088, "mean_token_accuracy": 0.8605915065854788, "num_tokens": 33510489.0, "step": 16400 }, { "entropy": 0.5327125217765569, "epoch": 0.2665194123904729, "grad_norm": 10.9375, "learning_rate": 4.243211022281785e-05, "loss": 0.5690330982208252, "mean_token_accuracy": 0.8564606696367264, "num_tokens": 33530612.0, "step": 16410 }, { "entropy": 0.5826835228130222, "epoch": 0.26668182519509837, "grad_norm": 9.5625, "learning_rate": 4.242281366447996e-05, "loss": 0.6051537990570068, "mean_token_accuracy": 0.8548326402902603, "num_tokens": 33550459.0, "step": 16420 }, { "entropy": 0.604815945122391, "epoch": 0.2668442379997239, "grad_norm": 5.0625, "learning_rate": 4.241351241936604e-05, "loss": 0.590269136428833, "mean_token_accuracy": 0.8574791558086872, "num_tokens": 33570656.0, "step": 16430 }, { "entropy": 0.5160299823153764, "epoch": 0.26700665080434943, "grad_norm": 4.875, "learning_rate": 4.240420648997814e-05, "loss": 0.48104586601257326, "mean_token_accuracy": 0.868197463452816, "num_tokens": 33590302.0, "step": 16440 }, { "entropy": 0.5970751129090786, "epoch": 0.2671690636089749, "grad_norm": 10.25, "learning_rate": 4.239489587881958e-05, "loss": 0.6419044971466065, "mean_token_accuracy": 0.8423970334231854, "num_tokens": 33611273.0, "step": 16450 }, { "entropy": 0.5298323538154364, "epoch": 0.26733147641360044, "grad_norm": 6.0625, "learning_rate": 4.238558058839495e-05, "loss": 0.5215121269226074, "mean_token_accuracy": 0.863980320841074, "num_tokens": 33631449.0, "step": 16460 }, { "entropy": 0.5542154439724982, "epoch": 0.267493889218226, "grad_norm": 11.0, "learning_rate": 4.2376260621210054e-05, "loss": 0.6321946620941162, "mean_token_accuracy": 0.84544732645154, "num_tokens": 33651168.0, "step": 16470 }, { "entropy": 0.5517195663414896, "epoch": 0.26765630202285146, "grad_norm": 7.90625, "learning_rate": 4.236693597977201e-05, "loss": 0.5449804306030274, "mean_token_accuracy": 0.8584469564259052, "num_tokens": 33671619.0, "step": 16480 }, { "entropy": 0.6310051124542951, "epoch": 0.267818714827477, "grad_norm": 9.75, "learning_rate": 4.2357606666589145e-05, "loss": 0.6404865741729736, "mean_token_accuracy": 0.8426645874977112, "num_tokens": 33692472.0, "step": 16490 }, { "entropy": 0.5884273577481508, "epoch": 0.2679811276321025, "grad_norm": 11.9375, "learning_rate": 4.234827268417109e-05, "loss": 0.5502813339233399, "mean_token_accuracy": 0.8546661324799061, "num_tokens": 33715309.0, "step": 16500 }, { "entropy": 0.5015754324384034, "epoch": 0.26814354043672806, "grad_norm": 6.71875, "learning_rate": 4.233893403502869e-05, "loss": 0.5132555961608887, "mean_token_accuracy": 0.8690888926386833, "num_tokens": 33736855.0, "step": 16510 }, { "entropy": 0.6149736329913139, "epoch": 0.26830595324135353, "grad_norm": 9.8125, "learning_rate": 4.2329590721674065e-05, "loss": 0.6158228874206543, "mean_token_accuracy": 0.8513496980071068, "num_tokens": 33758831.0, "step": 16520 }, { "entropy": 0.5170143836177885, "epoch": 0.26846836604597907, "grad_norm": 11.125, "learning_rate": 4.2320242746620596e-05, "loss": 0.5161044597625732, "mean_token_accuracy": 0.8749561227858067, "num_tokens": 33778378.0, "step": 16530 }, { "entropy": 0.5795797571539879, "epoch": 0.2686307788506046, "grad_norm": 5.5625, "learning_rate": 4.23108901123829e-05, "loss": 0.6109806537628174, "mean_token_accuracy": 0.8498612947762012, "num_tokens": 33799531.0, "step": 16540 }, { "entropy": 0.600351981446147, "epoch": 0.2687931916552301, "grad_norm": 7.90625, "learning_rate": 4.230153282147686e-05, "loss": 0.6233660697937011, "mean_token_accuracy": 0.8492235220968724, "num_tokens": 33819666.0, "step": 16550 }, { "entropy": 0.5845697808545083, "epoch": 0.2689556044598556, "grad_norm": 11.4375, "learning_rate": 4.229217087641961e-05, "loss": 0.5883178234100341, "mean_token_accuracy": 0.8510662697255611, "num_tokens": 33839301.0, "step": 16560 }, { "entropy": 0.510821298789233, "epoch": 0.26911801726448115, "grad_norm": 6.6875, "learning_rate": 4.228280427972954e-05, "loss": 0.5181769371032715, "mean_token_accuracy": 0.8714165113866329, "num_tokens": 33858289.0, "step": 16570 }, { "entropy": 0.6021355765871703, "epoch": 0.2692804300691066, "grad_norm": 6.28125, "learning_rate": 4.227343303392627e-05, "loss": 0.6193072319030761, "mean_token_accuracy": 0.8441445380449295, "num_tokens": 33880149.0, "step": 16580 }, { "entropy": 0.6207169647328555, "epoch": 0.26944284287373216, "grad_norm": 6.28125, "learning_rate": 4.226405714153069e-05, "loss": 0.6047979354858398, "mean_token_accuracy": 0.8490476347506046, "num_tokens": 33900625.0, "step": 16590 }, { "entropy": 0.5802690184675157, "epoch": 0.2696052556783577, "grad_norm": 10.0625, "learning_rate": 4.225467660506495e-05, "loss": 0.57479829788208, "mean_token_accuracy": 0.8546000212430954, "num_tokens": 33922498.0, "step": 16600 }, { "entropy": 0.5623771105427295, "epoch": 0.2697676684829832, "grad_norm": 5.28125, "learning_rate": 4.224529142705241e-05, "loss": 0.5789182662963868, "mean_token_accuracy": 0.8512364804744721, "num_tokens": 33943684.0, "step": 16610 }, { "entropy": 0.564122330583632, "epoch": 0.2699300812876087, "grad_norm": 9.1875, "learning_rate": 4.2235901610017736e-05, "loss": 0.5522418022155762, "mean_token_accuracy": 0.8605771139264107, "num_tokens": 33964202.0, "step": 16620 }, { "entropy": 0.5890005382709205, "epoch": 0.27009249409223424, "grad_norm": 5.65625, "learning_rate": 4.222650715648678e-05, "loss": 0.5731732368469238, "mean_token_accuracy": 0.8579270958900451, "num_tokens": 33985023.0, "step": 16630 }, { "entropy": 0.5548042587935924, "epoch": 0.27025490689685977, "grad_norm": 5.4375, "learning_rate": 4.22171080689867e-05, "loss": 0.5435409069061279, "mean_token_accuracy": 0.8553012430667877, "num_tokens": 34005510.0, "step": 16640 }, { "entropy": 0.5324314016848802, "epoch": 0.27041731970148525, "grad_norm": 8.8125, "learning_rate": 4.220770435004585e-05, "loss": 0.5271359443664551, "mean_token_accuracy": 0.864433404058218, "num_tokens": 34025083.0, "step": 16650 }, { "entropy": 0.5429102313704789, "epoch": 0.2705797325061108, "grad_norm": 8.25, "learning_rate": 4.219829600219386e-05, "loss": 0.5883169174194336, "mean_token_accuracy": 0.8542148374021054, "num_tokens": 34045486.0, "step": 16660 }, { "entropy": 0.615102867782116, "epoch": 0.2707421453107363, "grad_norm": 7.375, "learning_rate": 4.218888302796159e-05, "loss": 0.6614723205566406, "mean_token_accuracy": 0.8445832528173923, "num_tokens": 34064920.0, "step": 16670 }, { "entropy": 0.5798448003828526, "epoch": 0.2709045581153618, "grad_norm": 6.1875, "learning_rate": 4.217946542988116e-05, "loss": 0.5739744663238525, "mean_token_accuracy": 0.852310837060213, "num_tokens": 34087385.0, "step": 16680 }, { "entropy": 0.6251213777810335, "epoch": 0.2710669709199873, "grad_norm": 9.9375, "learning_rate": 4.2170043210485914e-05, "loss": 0.6683781147003174, "mean_token_accuracy": 0.8383262310177088, "num_tokens": 34108974.0, "step": 16690 }, { "entropy": 0.5418097000569105, "epoch": 0.27122938372461286, "grad_norm": 10.625, "learning_rate": 4.216061637231046e-05, "loss": 0.49447288513183596, "mean_token_accuracy": 0.8673963028937578, "num_tokens": 34130178.0, "step": 16700 }, { "entropy": 0.5465645428746939, "epoch": 0.27139179652923834, "grad_norm": 9.3125, "learning_rate": 4.215118491789064e-05, "loss": 0.5338427543640136, "mean_token_accuracy": 0.8583656795322895, "num_tokens": 34150770.0, "step": 16710 }, { "entropy": 0.5824407969601453, "epoch": 0.27155420933386387, "grad_norm": 12.125, "learning_rate": 4.214174884976353e-05, "loss": 0.5812499523162842, "mean_token_accuracy": 0.860411973297596, "num_tokens": 34170714.0, "step": 16720 }, { "entropy": 0.49869737653061746, "epoch": 0.2717166221384894, "grad_norm": 6.78125, "learning_rate": 4.213230817046745e-05, "loss": 0.48421783447265626, "mean_token_accuracy": 0.8789186835289001, "num_tokens": 34191449.0, "step": 16730 }, { "entropy": 0.5124646240845323, "epoch": 0.27187903494311494, "grad_norm": 8.4375, "learning_rate": 4.2122862882541984e-05, "loss": 0.5075724601745606, "mean_token_accuracy": 0.8635381847620011, "num_tokens": 34210849.0, "step": 16740 }, { "entropy": 0.5456450674682856, "epoch": 0.2720414477477404, "grad_norm": 9.125, "learning_rate": 4.2113412988527906e-05, "loss": 0.5643913745880127, "mean_token_accuracy": 0.8609402634203434, "num_tokens": 34231095.0, "step": 16750 }, { "entropy": 0.5326840508729219, "epoch": 0.27220386055236595, "grad_norm": 7.0, "learning_rate": 4.210395849096728e-05, "loss": 0.5703724384307861, "mean_token_accuracy": 0.8605490572750568, "num_tokens": 34251363.0, "step": 16760 }, { "entropy": 0.6256217143498362, "epoch": 0.2723662733569915, "grad_norm": 8.375, "learning_rate": 4.209449939240339e-05, "loss": 0.6251783847808838, "mean_token_accuracy": 0.8438511416316032, "num_tokens": 34272421.0, "step": 16770 }, { "entropy": 0.5645361507311464, "epoch": 0.27252868616161696, "grad_norm": 7.84375, "learning_rate": 4.2085035695380734e-05, "loss": 0.5741783618927002, "mean_token_accuracy": 0.8586551181972026, "num_tokens": 34293010.0, "step": 16780 }, { "entropy": 0.49915633974596857, "epoch": 0.2726910989662425, "grad_norm": 8.25, "learning_rate": 4.207556740244508e-05, "loss": 0.510115098953247, "mean_token_accuracy": 0.8660508673638105, "num_tokens": 34313705.0, "step": 16790 }, { "entropy": 0.5490601538680494, "epoch": 0.27285351177086803, "grad_norm": 8.0, "learning_rate": 4.206609451614342e-05, "loss": 0.5408076763153076, "mean_token_accuracy": 0.8670002140104771, "num_tokens": 34333963.0, "step": 16800 }, { "entropy": 0.528739502467215, "epoch": 0.2730159245754935, "grad_norm": 6.65625, "learning_rate": 4.205661703902399e-05, "loss": 0.5205760955810547, "mean_token_accuracy": 0.8645144209265709, "num_tokens": 34353673.0, "step": 16810 }, { "entropy": 0.5508116657845676, "epoch": 0.27317833738011904, "grad_norm": 8.625, "learning_rate": 4.204713497363624e-05, "loss": 0.5400552749633789, "mean_token_accuracy": 0.8547159381210804, "num_tokens": 34375454.0, "step": 16820 }, { "entropy": 0.5627385311760008, "epoch": 0.2733407501847446, "grad_norm": 6.75, "learning_rate": 4.2037648322530865e-05, "loss": 0.6165915489196777, "mean_token_accuracy": 0.8455269411206245, "num_tokens": 34396146.0, "step": 16830 }, { "entropy": 0.604011891130358, "epoch": 0.2735031629893701, "grad_norm": 7.0625, "learning_rate": 4.202815708825981e-05, "loss": 0.6942059993743896, "mean_token_accuracy": 0.8383936524391175, "num_tokens": 34417549.0, "step": 16840 }, { "entropy": 0.5634883895516396, "epoch": 0.2736655757939956, "grad_norm": 8.25, "learning_rate": 4.201866127337622e-05, "loss": 0.5792362689971924, "mean_token_accuracy": 0.857165378332138, "num_tokens": 34437902.0, "step": 16850 }, { "entropy": 0.6638612424023449, "epoch": 0.2738279885986211, "grad_norm": 7.6875, "learning_rate": 4.2009160880434514e-05, "loss": 0.603727912902832, "mean_token_accuracy": 0.8444490224123001, "num_tokens": 34458536.0, "step": 16860 }, { "entropy": 0.6491080243140459, "epoch": 0.27399040140324665, "grad_norm": 7.5, "learning_rate": 4.19996559119903e-05, "loss": 0.6011486530303956, "mean_token_accuracy": 0.8444184988737107, "num_tokens": 34478671.0, "step": 16870 }, { "entropy": 0.5894396848045289, "epoch": 0.27415281420787213, "grad_norm": 7.65625, "learning_rate": 4.199014637060044e-05, "loss": 0.5975615024566651, "mean_token_accuracy": 0.8498446650803089, "num_tokens": 34499308.0, "step": 16880 }, { "entropy": 0.5785379224922508, "epoch": 0.27431522701249766, "grad_norm": 6.28125, "learning_rate": 4.1980632258823016e-05, "loss": 0.5998688220977784, "mean_token_accuracy": 0.8473719231784343, "num_tokens": 34521074.0, "step": 16890 }, { "entropy": 0.5925297302193939, "epoch": 0.2744776398171232, "grad_norm": 12.875, "learning_rate": 4.1971113579217356e-05, "loss": 0.6416069984436035, "mean_token_accuracy": 0.8358314383774996, "num_tokens": 34541899.0, "step": 16900 }, { "entropy": 0.5447445314377546, "epoch": 0.2746400526217487, "grad_norm": 6.1875, "learning_rate": 4.196159033434402e-05, "loss": 0.5301802158355713, "mean_token_accuracy": 0.8715900272130966, "num_tokens": 34564169.0, "step": 16910 }, { "entropy": 0.5589986986480653, "epoch": 0.2748024654263742, "grad_norm": 9.375, "learning_rate": 4.1952062526764745e-05, "loss": 0.5843135356903076, "mean_token_accuracy": 0.8539220787584781, "num_tokens": 34585052.0, "step": 16920 }, { "entropy": 0.650121925584972, "epoch": 0.27496487823099974, "grad_norm": 7.9375, "learning_rate": 4.194253015904256e-05, "loss": 0.6756893634796143, "mean_token_accuracy": 0.8363918952643872, "num_tokens": 34605493.0, "step": 16930 }, { "entropy": 0.5356220480054616, "epoch": 0.2751272910356252, "grad_norm": 7.125, "learning_rate": 4.1932993233741683e-05, "loss": 0.5589962482452393, "mean_token_accuracy": 0.8615595169365406, "num_tokens": 34625675.0, "step": 16940 }, { "entropy": 0.6288696965202689, "epoch": 0.27528970384025075, "grad_norm": 7.84375, "learning_rate": 4.192345175342758e-05, "loss": 0.5986683368682861, "mean_token_accuracy": 0.8498246043920517, "num_tokens": 34647371.0, "step": 16950 }, { "entropy": 0.5831231956370175, "epoch": 0.2754521166448763, "grad_norm": 5.84375, "learning_rate": 4.191390572066691e-05, "loss": 0.6215912342071533, "mean_token_accuracy": 0.8437368616461753, "num_tokens": 34668184.0, "step": 16960 }, { "entropy": 0.6514689784497023, "epoch": 0.2756145294495018, "grad_norm": 7.0, "learning_rate": 4.19043551380276e-05, "loss": 0.6273575305938721, "mean_token_accuracy": 0.84620710760355, "num_tokens": 34690032.0, "step": 16970 }, { "entropy": 0.6574565122369677, "epoch": 0.2757769422541273, "grad_norm": 8.125, "learning_rate": 4.189480000807876e-05, "loss": 0.6485837936401367, "mean_token_accuracy": 0.8359887711703777, "num_tokens": 34711887.0, "step": 16980 }, { "entropy": 0.5792182378470898, "epoch": 0.27593935505875283, "grad_norm": 6.53125, "learning_rate": 4.188524033339076e-05, "loss": 0.6029642581939697, "mean_token_accuracy": 0.8530496574938298, "num_tokens": 34732237.0, "step": 16990 }, { "entropy": 0.5870880537666381, "epoch": 0.27610176786337837, "grad_norm": 10.25, "learning_rate": 4.187567611653515e-05, "loss": 0.6324345111846924, "mean_token_accuracy": 0.8510872669517994, "num_tokens": 34751892.0, "step": 17000 }, { "entropy": 0.5934215808287263, "epoch": 0.27626418066800384, "grad_norm": 7.8125, "learning_rate": 4.186610736008475e-05, "loss": 0.6163208961486817, "mean_token_accuracy": 0.8436141848564148, "num_tokens": 34773308.0, "step": 17010 }, { "entropy": 0.6300136646255851, "epoch": 0.2764265934726294, "grad_norm": 8.25, "learning_rate": 4.185653406661356e-05, "loss": 0.6235562324523926, "mean_token_accuracy": 0.8438818752765656, "num_tokens": 34793468.0, "step": 17020 }, { "entropy": 0.5535814927890896, "epoch": 0.2765890062772549, "grad_norm": 6.59375, "learning_rate": 4.1846956238696826e-05, "loss": 0.503101110458374, "mean_token_accuracy": 0.8690377783030272, "num_tokens": 34813889.0, "step": 17030 }, { "entropy": 0.5688198977615684, "epoch": 0.2767514190818804, "grad_norm": 8.375, "learning_rate": 4.1837373878911e-05, "loss": 0.5583671569824219, "mean_token_accuracy": 0.8567825440317393, "num_tokens": 34833380.0, "step": 17040 }, { "entropy": 0.5855814252980054, "epoch": 0.2769138318865059, "grad_norm": 6.0625, "learning_rate": 4.182778698983376e-05, "loss": 0.5642076015472413, "mean_token_accuracy": 0.8621127642691135, "num_tokens": 34854976.0, "step": 17050 }, { "entropy": 0.5549559784121811, "epoch": 0.27707624469113146, "grad_norm": 6.0, "learning_rate": 4.1818195574044005e-05, "loss": 0.5466836452484131, "mean_token_accuracy": 0.8516192182898521, "num_tokens": 34875440.0, "step": 17060 }, { "entropy": 0.5718593508936465, "epoch": 0.277238657495757, "grad_norm": 8.5625, "learning_rate": 4.1808599634121847e-05, "loss": 0.5986371517181397, "mean_token_accuracy": 0.8434766665101051, "num_tokens": 34895789.0, "step": 17070 }, { "entropy": 0.5525220753159374, "epoch": 0.27740107030038247, "grad_norm": 7.40625, "learning_rate": 4.17989991726486e-05, "loss": 0.5577431678771972, "mean_token_accuracy": 0.8547557480633259, "num_tokens": 34915986.0, "step": 17080 }, { "entropy": 0.5904794835485518, "epoch": 0.277563483105008, "grad_norm": 7.875, "learning_rate": 4.178939419220683e-05, "loss": 0.5893994808197022, "mean_token_accuracy": 0.8502130255103111, "num_tokens": 34936538.0, "step": 17090 }, { "entropy": 0.5207047936972231, "epoch": 0.27772589590963354, "grad_norm": 7.25, "learning_rate": 4.1779784695380296e-05, "loss": 0.5168735980987549, "mean_token_accuracy": 0.8733654268085956, "num_tokens": 34957085.0, "step": 17100 }, { "entropy": 0.519741227477789, "epoch": 0.277888308714259, "grad_norm": 7.09375, "learning_rate": 4.177017068475397e-05, "loss": 0.5618374824523926, "mean_token_accuracy": 0.8610585384070873, "num_tokens": 34977462.0, "step": 17110 }, { "entropy": 0.5616461067460478, "epoch": 0.27805072151888455, "grad_norm": 6.375, "learning_rate": 4.176055216291403e-05, "loss": 0.5823271751403809, "mean_token_accuracy": 0.856568917632103, "num_tokens": 34998017.0, "step": 17120 }, { "entropy": 0.624355851393193, "epoch": 0.2782131343235101, "grad_norm": 8.0625, "learning_rate": 4.17509291324479e-05, "loss": 0.619963550567627, "mean_token_accuracy": 0.8428517036139965, "num_tokens": 35018636.0, "step": 17130 }, { "entropy": 0.6934627486392856, "epoch": 0.27837554712813556, "grad_norm": 7.5625, "learning_rate": 4.174130159594418e-05, "loss": 0.6825096130371093, "mean_token_accuracy": 0.8393096674233675, "num_tokens": 35040798.0, "step": 17140 }, { "entropy": 0.6589559866115451, "epoch": 0.2785379599327611, "grad_norm": 7.5, "learning_rate": 4.173166955599271e-05, "loss": 0.6742685794830322, "mean_token_accuracy": 0.8311224080622196, "num_tokens": 35062688.0, "step": 17150 }, { "entropy": 0.5310449233278632, "epoch": 0.2787003727373866, "grad_norm": 5.90625, "learning_rate": 4.1722033015184524e-05, "loss": 0.5447644233703614, "mean_token_accuracy": 0.8583401057869195, "num_tokens": 35082848.0, "step": 17160 }, { "entropy": 0.5440952454693615, "epoch": 0.27886278554201216, "grad_norm": 8.5625, "learning_rate": 4.1712391976111884e-05, "loss": 0.532557487487793, "mean_token_accuracy": 0.8669322341680527, "num_tokens": 35103224.0, "step": 17170 }, { "entropy": 0.5400978217832744, "epoch": 0.27902519834663764, "grad_norm": 8.6875, "learning_rate": 4.1702746441368244e-05, "loss": 0.5274088382720947, "mean_token_accuracy": 0.8641109816730023, "num_tokens": 35123850.0, "step": 17180 }, { "entropy": 0.5854986840859056, "epoch": 0.27918761115126317, "grad_norm": 8.8125, "learning_rate": 4.169309641354827e-05, "loss": 0.628855562210083, "mean_token_accuracy": 0.8477097854018212, "num_tokens": 35144296.0, "step": 17190 }, { "entropy": 0.5581474377773702, "epoch": 0.2793500239558887, "grad_norm": 5.71875, "learning_rate": 4.1683441895247845e-05, "loss": 0.5336379528045654, "mean_token_accuracy": 0.8676164999604226, "num_tokens": 35165064.0, "step": 17200 }, { "entropy": 0.6300271459389478, "epoch": 0.2795124367605142, "grad_norm": 9.0, "learning_rate": 4.167378288906406e-05, "loss": 0.6607104778289795, "mean_token_accuracy": 0.8378219157457352, "num_tokens": 35185703.0, "step": 17210 }, { "entropy": 0.578103550337255, "epoch": 0.2796748495651397, "grad_norm": 6.78125, "learning_rate": 4.1664119397595204e-05, "loss": 0.5638640880584717, "mean_token_accuracy": 0.8464062280952931, "num_tokens": 35205799.0, "step": 17220 }, { "entropy": 0.5622347308322787, "epoch": 0.27983726236976525, "grad_norm": 7.46875, "learning_rate": 4.1654451423440774e-05, "loss": 0.5247482299804688, "mean_token_accuracy": 0.8586546801030636, "num_tokens": 35226867.0, "step": 17230 }, { "entropy": 0.5682780356612056, "epoch": 0.2799996751743907, "grad_norm": 9.375, "learning_rate": 4.164477896920149e-05, "loss": 0.6097508430480957, "mean_token_accuracy": 0.8518507562577724, "num_tokens": 35246731.0, "step": 17240 }, { "entropy": 0.6013665796723217, "epoch": 0.28016208797901626, "grad_norm": 8.3125, "learning_rate": 4.163510203747926e-05, "loss": 0.5910921096801758, "mean_token_accuracy": 0.8462337102741003, "num_tokens": 35266318.0, "step": 17250 }, { "entropy": 0.5779182584956288, "epoch": 0.2803245007836418, "grad_norm": 7.78125, "learning_rate": 4.162542063087719e-05, "loss": 0.5700791358947754, "mean_token_accuracy": 0.848541832715273, "num_tokens": 35287564.0, "step": 17260 }, { "entropy": 0.5899602007120848, "epoch": 0.2804869135882673, "grad_norm": 7.03125, "learning_rate": 4.16157347519996e-05, "loss": 0.6195521354675293, "mean_token_accuracy": 0.8446982979774476, "num_tokens": 35308302.0, "step": 17270 }, { "entropy": 0.5693035269156098, "epoch": 0.2806493263928928, "grad_norm": 9.875, "learning_rate": 4.160604440345204e-05, "loss": 0.5649159908294678, "mean_token_accuracy": 0.8521599486470223, "num_tokens": 35327306.0, "step": 17280 }, { "entropy": 0.6129769959487021, "epoch": 0.28081173919751834, "grad_norm": 11.875, "learning_rate": 4.15963495878412e-05, "loss": 0.6063143730163574, "mean_token_accuracy": 0.8516183126717806, "num_tokens": 35347327.0, "step": 17290 }, { "entropy": 0.5757642877288163, "epoch": 0.2809741520021439, "grad_norm": 10.25, "learning_rate": 4.158665030777503e-05, "loss": 0.5601007461547851, "mean_token_accuracy": 0.8558866009116173, "num_tokens": 35367302.0, "step": 17300 }, { "entropy": 0.5465124701149762, "epoch": 0.28113656480676935, "grad_norm": 7.125, "learning_rate": 4.157694656586264e-05, "loss": 0.5488223552703857, "mean_token_accuracy": 0.8587705932557583, "num_tokens": 35388511.0, "step": 17310 }, { "entropy": 0.5497525088489056, "epoch": 0.2812989776113949, "grad_norm": 9.625, "learning_rate": 4.156723836471438e-05, "loss": 0.5553276538848877, "mean_token_accuracy": 0.8568070910871028, "num_tokens": 35409351.0, "step": 17320 }, { "entropy": 0.4744534857571125, "epoch": 0.2814613904160204, "grad_norm": 6.34375, "learning_rate": 4.1557525706941766e-05, "loss": 0.5034657001495362, "mean_token_accuracy": 0.8700916402041912, "num_tokens": 35428953.0, "step": 17330 }, { "entropy": 0.5527645528316498, "epoch": 0.2816238032206459, "grad_norm": 8.875, "learning_rate": 4.154780859515752e-05, "loss": 0.5486737728118897, "mean_token_accuracy": 0.8577717334032059, "num_tokens": 35447996.0, "step": 17340 }, { "entropy": 0.5527544550132006, "epoch": 0.28178621602527143, "grad_norm": 8.75, "learning_rate": 4.153808703197558e-05, "loss": 0.5449261665344238, "mean_token_accuracy": 0.8609203234314918, "num_tokens": 35468642.0, "step": 17350 }, { "entropy": 0.5800910275429487, "epoch": 0.28194862882989696, "grad_norm": 8.25, "learning_rate": 4.1528361020011066e-05, "loss": 0.5869035720825195, "mean_token_accuracy": 0.8520423315465451, "num_tokens": 35489466.0, "step": 17360 }, { "entropy": 0.5823664361611008, "epoch": 0.28211104163452244, "grad_norm": 7.59375, "learning_rate": 4.151863056188028e-05, "loss": 0.5862632751464844, "mean_token_accuracy": 0.8559168040752411, "num_tokens": 35510451.0, "step": 17370 }, { "entropy": 0.5499073902145029, "epoch": 0.282273454439148, "grad_norm": 6.1875, "learning_rate": 4.1508895660200753e-05, "loss": 0.5790492057800293, "mean_token_accuracy": 0.8581585083156824, "num_tokens": 35531384.0, "step": 17380 }, { "entropy": 0.49489111742004754, "epoch": 0.2824358672437735, "grad_norm": 8.0, "learning_rate": 4.1499156317591206e-05, "loss": 0.47258906364440917, "mean_token_accuracy": 0.8745524615049363, "num_tokens": 35551730.0, "step": 17390 }, { "entropy": 0.598347395658493, "epoch": 0.28259828004839904, "grad_norm": 7.25, "learning_rate": 4.148941253667151e-05, "loss": 0.5980254650115967, "mean_token_accuracy": 0.8490207344293594, "num_tokens": 35571934.0, "step": 17400 }, { "entropy": 0.5667345805559307, "epoch": 0.2827606928530245, "grad_norm": 7.3125, "learning_rate": 4.1479664320062794e-05, "loss": 0.592627477645874, "mean_token_accuracy": 0.8590881638228893, "num_tokens": 35592705.0, "step": 17410 }, { "entropy": 0.6416580906137824, "epoch": 0.28292310565765005, "grad_norm": 12.3125, "learning_rate": 4.146991167038734e-05, "loss": 0.719015645980835, "mean_token_accuracy": 0.8285266526043416, "num_tokens": 35612561.0, "step": 17420 }, { "entropy": 0.6247211523354054, "epoch": 0.2830855184622756, "grad_norm": 7.5625, "learning_rate": 4.146015459026863e-05, "loss": 0.5971425533294678, "mean_token_accuracy": 0.8441060222685337, "num_tokens": 35632509.0, "step": 17430 }, { "entropy": 0.6453419416211545, "epoch": 0.28324793126690107, "grad_norm": 9.0625, "learning_rate": 4.1450393082331345e-05, "loss": 0.6612844467163086, "mean_token_accuracy": 0.8376931887120008, "num_tokens": 35651998.0, "step": 17440 }, { "entropy": 0.5539188359864056, "epoch": 0.2834103440715266, "grad_norm": 6.53125, "learning_rate": 4.144062714920135e-05, "loss": 0.5210306167602539, "mean_token_accuracy": 0.8713847391307354, "num_tokens": 35673054.0, "step": 17450 }, { "entropy": 0.5958240246400237, "epoch": 0.28357275687615213, "grad_norm": 7.28125, "learning_rate": 4.14308567935057e-05, "loss": 0.5703432559967041, "mean_token_accuracy": 0.853314845263958, "num_tokens": 35694354.0, "step": 17460 }, { "entropy": 0.6154017019551248, "epoch": 0.2837351696807776, "grad_norm": 9.4375, "learning_rate": 4.142108201787266e-05, "loss": 0.6284646034240723, "mean_token_accuracy": 0.8475752905011177, "num_tokens": 35714786.0, "step": 17470 }, { "entropy": 0.5869739778339863, "epoch": 0.28389758248540314, "grad_norm": 7.40625, "learning_rate": 4.141130282493164e-05, "loss": 0.6405982494354248, "mean_token_accuracy": 0.8430444978177547, "num_tokens": 35736322.0, "step": 17480 }, { "entropy": 0.5373887211317196, "epoch": 0.2840599952900287, "grad_norm": 7.4375, "learning_rate": 4.140151921731328e-05, "loss": 0.5245596408843994, "mean_token_accuracy": 0.8653483852744103, "num_tokens": 35756708.0, "step": 17490 }, { "entropy": 0.5025547658558935, "epoch": 0.28422240809465416, "grad_norm": 7.09375, "learning_rate": 4.1391731197649396e-05, "loss": 0.5525405406951904, "mean_token_accuracy": 0.8613792434334755, "num_tokens": 35777159.0, "step": 17500 }, { "entropy": 0.5854659236036241, "epoch": 0.2843848208992797, "grad_norm": 8.875, "learning_rate": 4.138193876857298e-05, "loss": 0.5806197643280029, "mean_token_accuracy": 0.8589339584112168, "num_tokens": 35796565.0, "step": 17510 }, { "entropy": 0.5519607802852988, "epoch": 0.2845472337039052, "grad_norm": 7.46875, "learning_rate": 4.137214193271821e-05, "loss": 0.545901870727539, "mean_token_accuracy": 0.8574182726442814, "num_tokens": 35818235.0, "step": 17520 }, { "entropy": 0.6152186324819923, "epoch": 0.28470964650853076, "grad_norm": 8.3125, "learning_rate": 4.1362340692720476e-05, "loss": 0.6106796741485596, "mean_token_accuracy": 0.8448817804455757, "num_tokens": 35840010.0, "step": 17530 }, { "entropy": 0.5822362299077213, "epoch": 0.28487205931315623, "grad_norm": 7.0, "learning_rate": 4.1352535051216325e-05, "loss": 0.588127851486206, "mean_token_accuracy": 0.8579162038862705, "num_tokens": 35859662.0, "step": 17540 }, { "entropy": 0.5471317727118731, "epoch": 0.28503447211778177, "grad_norm": 9.125, "learning_rate": 4.134272501084349e-05, "loss": 0.5259416103363037, "mean_token_accuracy": 0.8706240721046925, "num_tokens": 35880234.0, "step": 17550 }, { "entropy": 0.5969628514256329, "epoch": 0.2851968849224073, "grad_norm": 6.59375, "learning_rate": 4.1332910574240904e-05, "loss": 0.56806960105896, "mean_token_accuracy": 0.8556464098393917, "num_tokens": 35901623.0, "step": 17560 }, { "entropy": 0.574421445466578, "epoch": 0.2853592977270328, "grad_norm": 9.9375, "learning_rate": 4.132309174404866e-05, "loss": 0.600691556930542, "mean_token_accuracy": 0.8485545732080937, "num_tokens": 35923096.0, "step": 17570 }, { "entropy": 0.5160778786055744, "epoch": 0.2855217105316583, "grad_norm": 6.6875, "learning_rate": 4.1313268522908054e-05, "loss": 0.5769938468933106, "mean_token_accuracy": 0.8572316449135542, "num_tokens": 35942435.0, "step": 17580 }, { "entropy": 0.5498999962583184, "epoch": 0.28568412333628385, "grad_norm": 7.15625, "learning_rate": 4.130344091346156e-05, "loss": 0.5378740787506103, "mean_token_accuracy": 0.8644469544291496, "num_tokens": 35961577.0, "step": 17590 }, { "entropy": 0.5533097469247877, "epoch": 0.2858465361409093, "grad_norm": 8.125, "learning_rate": 4.129360891835282e-05, "loss": 0.549836254119873, "mean_token_accuracy": 0.8656658448278904, "num_tokens": 35981559.0, "step": 17600 }, { "entropy": 0.5843121553771198, "epoch": 0.28600894894553486, "grad_norm": 8.875, "learning_rate": 4.128377254022666e-05, "loss": 0.5941105842590332, "mean_token_accuracy": 0.8556938670575619, "num_tokens": 36001462.0, "step": 17610 }, { "entropy": 0.5473244554363191, "epoch": 0.2861713617501604, "grad_norm": 7.5, "learning_rate": 4.127393178172909e-05, "loss": 0.5528611183166504, "mean_token_accuracy": 0.8558194275945425, "num_tokens": 36021045.0, "step": 17620 }, { "entropy": 0.553973457403481, "epoch": 0.2863337745547859, "grad_norm": 10.8125, "learning_rate": 4.12640866455073e-05, "loss": 0.5782723426818848, "mean_token_accuracy": 0.85633700825274, "num_tokens": 36040359.0, "step": 17630 }, { "entropy": 0.5864728387678042, "epoch": 0.2864961873594114, "grad_norm": 10.5, "learning_rate": 4.125423713420964e-05, "loss": 0.5553581714630127, "mean_token_accuracy": 0.8580593869090081, "num_tokens": 36060630.0, "step": 17640 }, { "entropy": 0.5424744283314794, "epoch": 0.28665860016403694, "grad_norm": 8.0, "learning_rate": 4.124438325048568e-05, "loss": 0.5376532077789307, "mean_token_accuracy": 0.857544032484293, "num_tokens": 36081055.0, "step": 17650 }, { "entropy": 0.6458050215616822, "epoch": 0.28682101296866247, "grad_norm": 5.9375, "learning_rate": 4.123452499698611e-05, "loss": 0.6484622001647949, "mean_token_accuracy": 0.8370225392282009, "num_tokens": 36103235.0, "step": 17660 }, { "entropy": 0.534138029627502, "epoch": 0.28698342577328795, "grad_norm": 6.71875, "learning_rate": 4.1224662376362835e-05, "loss": 0.525483512878418, "mean_token_accuracy": 0.8630974285304547, "num_tokens": 36123020.0, "step": 17670 }, { "entropy": 0.5162336615845561, "epoch": 0.2871458385779135, "grad_norm": 6.59375, "learning_rate": 4.121479539126891e-05, "loss": 0.541999626159668, "mean_token_accuracy": 0.8643454276025295, "num_tokens": 36143251.0, "step": 17680 }, { "entropy": 0.6323876513168216, "epoch": 0.287308251382539, "grad_norm": 6.75, "learning_rate": 4.120492404435859e-05, "loss": 0.6170620918273926, "mean_token_accuracy": 0.8446521505713462, "num_tokens": 36165943.0, "step": 17690 }, { "entropy": 0.5623032076284289, "epoch": 0.2874706641871645, "grad_norm": 9.0625, "learning_rate": 4.119504833828728e-05, "loss": 0.5820642948150635, "mean_token_accuracy": 0.8524319879710675, "num_tokens": 36186983.0, "step": 17700 }, { "entropy": 0.6092072970233857, "epoch": 0.28763307699179, "grad_norm": 7.96875, "learning_rate": 4.1185168275711575e-05, "loss": 0.6203063488006592, "mean_token_accuracy": 0.8448413096368312, "num_tokens": 36207530.0, "step": 17710 }, { "entropy": 0.5783728525508195, "epoch": 0.28779548979641556, "grad_norm": 7.84375, "learning_rate": 4.117528385928923e-05, "loss": 0.5510667324066162, "mean_token_accuracy": 0.8617670249193907, "num_tokens": 36226903.0, "step": 17720 }, { "entropy": 0.6476022410672158, "epoch": 0.2879579026010411, "grad_norm": 6.75, "learning_rate": 4.116539509167917e-05, "loss": 0.6388350486755371, "mean_token_accuracy": 0.8455386407673359, "num_tokens": 36247134.0, "step": 17730 }, { "entropy": 0.5517082770355046, "epoch": 0.28812031540566657, "grad_norm": 8.1875, "learning_rate": 4.115550197554151e-05, "loss": 0.5484023094177246, "mean_token_accuracy": 0.8587029784917831, "num_tokens": 36268517.0, "step": 17740 }, { "entropy": 0.562576531432569, "epoch": 0.2882827282102921, "grad_norm": 6.90625, "learning_rate": 4.114560451353751e-05, "loss": 0.602958869934082, "mean_token_accuracy": 0.8474968262016773, "num_tokens": 36289504.0, "step": 17750 }, { "entropy": 0.5603354729246348, "epoch": 0.28844514101491764, "grad_norm": 7.5, "learning_rate": 4.11357027083296e-05, "loss": 0.5313716888427734, "mean_token_accuracy": 0.8664328280836344, "num_tokens": 36311290.0, "step": 17760 }, { "entropy": 0.5495112643111497, "epoch": 0.2886075538195431, "grad_norm": 6.90625, "learning_rate": 4.112579656258141e-05, "loss": 0.5571826457977295, "mean_token_accuracy": 0.8597597695887089, "num_tokens": 36333031.0, "step": 17770 }, { "entropy": 0.6527315212413669, "epoch": 0.28876996662416865, "grad_norm": 9.9375, "learning_rate": 4.11158860789577e-05, "loss": 0.6422440052032471, "mean_token_accuracy": 0.8332031443715096, "num_tokens": 36352934.0, "step": 17780 }, { "entropy": 0.577813727222383, "epoch": 0.2889323794287942, "grad_norm": 9.4375, "learning_rate": 4.110597126012441e-05, "loss": 0.5936680793762207, "mean_token_accuracy": 0.8521417856216431, "num_tokens": 36373320.0, "step": 17790 }, { "entropy": 0.5374428056180477, "epoch": 0.28909479223341966, "grad_norm": 7.625, "learning_rate": 4.109605210874866e-05, "loss": 0.5424469947814942, "mean_token_accuracy": 0.8592448588460684, "num_tokens": 36393144.0, "step": 17800 }, { "entropy": 0.5207731116563081, "epoch": 0.2892572050380452, "grad_norm": 8.875, "learning_rate": 4.108612862749872e-05, "loss": 0.5289613723754882, "mean_token_accuracy": 0.8686387054622173, "num_tokens": 36413043.0, "step": 17810 }, { "entropy": 0.5566857509315014, "epoch": 0.28941961784267073, "grad_norm": 9.8125, "learning_rate": 4.107620081904403e-05, "loss": 0.5656529426574707, "mean_token_accuracy": 0.8588267520070076, "num_tokens": 36432857.0, "step": 17820 }, { "entropy": 0.5664749258663505, "epoch": 0.2895820306472962, "grad_norm": 8.125, "learning_rate": 4.1066268686055185e-05, "loss": 0.5908914566040039, "mean_token_accuracy": 0.843728294223547, "num_tokens": 36454438.0, "step": 17830 }, { "entropy": 0.537671027542092, "epoch": 0.28974444345192174, "grad_norm": 6.8125, "learning_rate": 4.105633223120396e-05, "loss": 0.5199490547180176, "mean_token_accuracy": 0.8649649038910866, "num_tokens": 36475197.0, "step": 17840 }, { "entropy": 0.568777548475191, "epoch": 0.2899068562565473, "grad_norm": 7.65625, "learning_rate": 4.104639145716329e-05, "loss": 0.590980339050293, "mean_token_accuracy": 0.8534414507448673, "num_tokens": 36497981.0, "step": 17850 }, { "entropy": 0.5720078336074949, "epoch": 0.2900692690611728, "grad_norm": 6.75, "learning_rate": 4.103644636660725e-05, "loss": 0.5618825912475586, "mean_token_accuracy": 0.8561365321278572, "num_tokens": 36518080.0, "step": 17860 }, { "entropy": 0.5823044904274866, "epoch": 0.2902316818657983, "grad_norm": 6.625, "learning_rate": 4.102649696221109e-05, "loss": 0.5696081638336181, "mean_token_accuracy": 0.8533410087227822, "num_tokens": 36537423.0, "step": 17870 }, { "entropy": 0.5678859127685427, "epoch": 0.2903940946704238, "grad_norm": 9.75, "learning_rate": 4.101654324665124e-05, "loss": 0.5897946357727051, "mean_token_accuracy": 0.8512251764535904, "num_tokens": 36557439.0, "step": 17880 }, { "entropy": 0.6353920376393944, "epoch": 0.29055650747504935, "grad_norm": 8.3125, "learning_rate": 4.100658522260525e-05, "loss": 0.6696792602539062, "mean_token_accuracy": 0.8361506476998329, "num_tokens": 36577983.0, "step": 17890 }, { "entropy": 0.5568199940957129, "epoch": 0.29071892027967483, "grad_norm": 6.78125, "learning_rate": 4.099662289275187e-05, "loss": 0.5541680335998536, "mean_token_accuracy": 0.8598075456917286, "num_tokens": 36598132.0, "step": 17900 }, { "entropy": 0.5291572362184525, "epoch": 0.29088133308430036, "grad_norm": 5.34375, "learning_rate": 4.098665625977098e-05, "loss": 0.5445431232452392, "mean_token_accuracy": 0.8656539022922516, "num_tokens": 36618896.0, "step": 17910 }, { "entropy": 0.6025902549037709, "epoch": 0.2910437458889259, "grad_norm": 7.59375, "learning_rate": 4.097668532634364e-05, "loss": 0.6150074958801269, "mean_token_accuracy": 0.8478502459824085, "num_tokens": 36639908.0, "step": 17920 }, { "entropy": 0.6107180405408144, "epoch": 0.2912061586935514, "grad_norm": 9.4375, "learning_rate": 4.0966710095152025e-05, "loss": 0.652470064163208, "mean_token_accuracy": 0.8425132732838392, "num_tokens": 36660160.0, "step": 17930 }, { "entropy": 0.5969099901616574, "epoch": 0.2913685714981769, "grad_norm": 7.65625, "learning_rate": 4.095673056887952e-05, "loss": 0.5847942352294921, "mean_token_accuracy": 0.8524424131959677, "num_tokens": 36679780.0, "step": 17940 }, { "entropy": 0.6449717089533806, "epoch": 0.29153098430280244, "grad_norm": 9.5625, "learning_rate": 4.094674675021062e-05, "loss": 0.6113699436187744, "mean_token_accuracy": 0.8545657977461815, "num_tokens": 36700959.0, "step": 17950 }, { "entropy": 0.5516521789133548, "epoch": 0.291693397107428, "grad_norm": 9.0, "learning_rate": 4.093675864183102e-05, "loss": 0.5698765277862549, "mean_token_accuracy": 0.8648547828197479, "num_tokens": 36721201.0, "step": 17960 }, { "entropy": 0.555703211389482, "epoch": 0.29185580991205345, "grad_norm": 8.9375, "learning_rate": 4.092676624642753e-05, "loss": 0.6030320644378662, "mean_token_accuracy": 0.8496562197804451, "num_tokens": 36740652.0, "step": 17970 }, { "entropy": 0.5522500654682517, "epoch": 0.292018222716679, "grad_norm": 9.3125, "learning_rate": 4.091676956668812e-05, "loss": 0.5329155921936035, "mean_token_accuracy": 0.8671309120953083, "num_tokens": 36761112.0, "step": 17980 }, { "entropy": 0.5402680757455528, "epoch": 0.2921806355213045, "grad_norm": 6.65625, "learning_rate": 4.0906768605301926e-05, "loss": 0.5264708995819092, "mean_token_accuracy": 0.8663390628993511, "num_tokens": 36781696.0, "step": 17990 }, { "entropy": 0.6154843703843653, "epoch": 0.29234304832593, "grad_norm": 9.625, "learning_rate": 4.0896763364959226e-05, "loss": 0.5661901950836181, "mean_token_accuracy": 0.8550937570631504, "num_tokens": 36801898.0, "step": 18000 }, { "entropy": 0.5111170560587197, "epoch": 0.29250546113055553, "grad_norm": 7.3125, "learning_rate": 4.088675384835146e-05, "loss": 0.5245023727416992, "mean_token_accuracy": 0.8623235650360584, "num_tokens": 36821759.0, "step": 18010 }, { "entropy": 0.6104663755279034, "epoch": 0.29266787393518107, "grad_norm": 8.0625, "learning_rate": 4.0876740058171205e-05, "loss": 0.6635880947113038, "mean_token_accuracy": 0.8331946823745966, "num_tokens": 36841356.0, "step": 18020 }, { "entropy": 0.5692138301208616, "epoch": 0.29283028673980654, "grad_norm": 6.34375, "learning_rate": 4.0866721997112187e-05, "loss": 0.6090588092803955, "mean_token_accuracy": 0.8457665733993054, "num_tokens": 36862269.0, "step": 18030 }, { "entropy": 0.5730566069483757, "epoch": 0.2929926995444321, "grad_norm": 9.125, "learning_rate": 4.0856699667869306e-05, "loss": 0.5650660514831543, "mean_token_accuracy": 0.8469328068196773, "num_tokens": 36883190.0, "step": 18040 }, { "entropy": 0.5944055709987879, "epoch": 0.2931551123490576, "grad_norm": 8.625, "learning_rate": 4.0846673073138574e-05, "loss": 0.5808224201202392, "mean_token_accuracy": 0.8544750109314918, "num_tokens": 36904410.0, "step": 18050 }, { "entropy": 0.5761209764517844, "epoch": 0.2933175251536831, "grad_norm": 7.28125, "learning_rate": 4.083664221561717e-05, "loss": 0.518587875366211, "mean_token_accuracy": 0.8651981003582477, "num_tokens": 36923996.0, "step": 18060 }, { "entropy": 0.5270165452267974, "epoch": 0.2934799379583086, "grad_norm": 9.625, "learning_rate": 4.0826607098003425e-05, "loss": 0.5439772605895996, "mean_token_accuracy": 0.8673811666667461, "num_tokens": 36944136.0, "step": 18070 }, { "entropy": 0.5486955150030554, "epoch": 0.29364235076293416, "grad_norm": 7.5, "learning_rate": 4.081656772299679e-05, "loss": 0.5619600772857666, "mean_token_accuracy": 0.8522886082530021, "num_tokens": 36964878.0, "step": 18080 }, { "entropy": 0.4929536744020879, "epoch": 0.2938047635675597, "grad_norm": 6.34375, "learning_rate": 4.08065240932979e-05, "loss": 0.5016175746917725, "mean_token_accuracy": 0.8689725793898105, "num_tokens": 36984441.0, "step": 18090 }, { "entropy": 0.5907150311395526, "epoch": 0.29396717637218517, "grad_norm": 8.75, "learning_rate": 4.079647621160851e-05, "loss": 0.6377906322479248, "mean_token_accuracy": 0.8404063172638416, "num_tokens": 37006031.0, "step": 18100 }, { "entropy": 0.5768464021384716, "epoch": 0.2941295891768107, "grad_norm": 8.5625, "learning_rate": 4.078642408063151e-05, "loss": 0.5937373638153076, "mean_token_accuracy": 0.8580769155174494, "num_tokens": 37027121.0, "step": 18110 }, { "entropy": 0.5411137895891442, "epoch": 0.29429200198143624, "grad_norm": 7.5625, "learning_rate": 4.0776367703070964e-05, "loss": 0.5420875549316406, "mean_token_accuracy": 0.860224773734808, "num_tokens": 37046699.0, "step": 18120 }, { "entropy": 0.5106237702071666, "epoch": 0.2944544147860617, "grad_norm": 6.125, "learning_rate": 4.0766307081632044e-05, "loss": 0.5123288631439209, "mean_token_accuracy": 0.8725985728204251, "num_tokens": 37067915.0, "step": 18130 }, { "entropy": 0.5638970719650388, "epoch": 0.29461682759068725, "grad_norm": 7.03125, "learning_rate": 4.075624221902109e-05, "loss": 0.590222692489624, "mean_token_accuracy": 0.8569910779595376, "num_tokens": 37087216.0, "step": 18140 }, { "entropy": 0.51576405800879, "epoch": 0.2947792403953128, "grad_norm": 5.4375, "learning_rate": 4.074617311794556e-05, "loss": 0.5310060024261475, "mean_token_accuracy": 0.8604837134480476, "num_tokens": 37107950.0, "step": 18150 }, { "entropy": 0.5134930270723999, "epoch": 0.29494165319993826, "grad_norm": 7.0625, "learning_rate": 4.073609978111409e-05, "loss": 0.5159493923187256, "mean_token_accuracy": 0.8667227417230606, "num_tokens": 37127416.0, "step": 18160 }, { "entropy": 0.522550730407238, "epoch": 0.2951040660045638, "grad_norm": 6.5, "learning_rate": 4.0726022211236406e-05, "loss": 0.5133474349975586, "mean_token_accuracy": 0.8685505025088787, "num_tokens": 37148291.0, "step": 18170 }, { "entropy": 0.5872115667909383, "epoch": 0.2952664788091893, "grad_norm": 6.21875, "learning_rate": 4.07159404110234e-05, "loss": 0.5909671306610107, "mean_token_accuracy": 0.8518031291663647, "num_tokens": 37169408.0, "step": 18180 }, { "entropy": 0.6117963010445238, "epoch": 0.29542889161381486, "grad_norm": 10.0, "learning_rate": 4.070585438318711e-05, "loss": 0.635195541381836, "mean_token_accuracy": 0.8412977695465088, "num_tokens": 37189834.0, "step": 18190 }, { "entropy": 0.5234861487522722, "epoch": 0.29559130441844034, "grad_norm": 10.4375, "learning_rate": 4.0695764130440694e-05, "loss": 0.559336519241333, "mean_token_accuracy": 0.855384674668312, "num_tokens": 37210210.0, "step": 18200 }, { "entropy": 0.5356620155274868, "epoch": 0.29575371722306587, "grad_norm": 7.15625, "learning_rate": 4.0685669655498446e-05, "loss": 0.5773856163024902, "mean_token_accuracy": 0.8580003976821899, "num_tokens": 37229609.0, "step": 18210 }, { "entropy": 0.5619220338761807, "epoch": 0.2959161300276914, "grad_norm": 9.0, "learning_rate": 4.067557096107582e-05, "loss": 0.5762789726257325, "mean_token_accuracy": 0.8572461754083633, "num_tokens": 37250673.0, "step": 18220 }, { "entropy": 0.5985932556912303, "epoch": 0.2960785428323169, "grad_norm": 9.75, "learning_rate": 4.066546804988938e-05, "loss": 0.5882694244384765, "mean_token_accuracy": 0.8536705445498228, "num_tokens": 37271854.0, "step": 18230 }, { "entropy": 0.6399203925393522, "epoch": 0.2962409556369424, "grad_norm": 10.4375, "learning_rate": 4.0655360924656816e-05, "loss": 0.6362391471862793, "mean_token_accuracy": 0.8352310247719288, "num_tokens": 37293019.0, "step": 18240 }, { "entropy": 0.5028411030769349, "epoch": 0.29640336844156795, "grad_norm": 16.25, "learning_rate": 4.064524958809698e-05, "loss": 0.4999791145324707, "mean_token_accuracy": 0.8723169803619385, "num_tokens": 37312412.0, "step": 18250 }, { "entropy": 0.5751097188331187, "epoch": 0.2965657812461934, "grad_norm": 9.875, "learning_rate": 4.0635134042929845e-05, "loss": 0.5989929676055908, "mean_token_accuracy": 0.851113050058484, "num_tokens": 37332487.0, "step": 18260 }, { "entropy": 0.5347581686452031, "epoch": 0.29672819405081896, "grad_norm": 8.0, "learning_rate": 4.0625014291876525e-05, "loss": 0.5251726150512696, "mean_token_accuracy": 0.8616917006671428, "num_tokens": 37352682.0, "step": 18270 }, { "entropy": 0.575373284239322, "epoch": 0.2968906068554445, "grad_norm": 9.1875, "learning_rate": 4.061489033765923e-05, "loss": 0.5845426559448242, "mean_token_accuracy": 0.8572585381567478, "num_tokens": 37373882.0, "step": 18280 }, { "entropy": 0.555945485830307, "epoch": 0.29705301966007, "grad_norm": 6.96875, "learning_rate": 4.060476218300136e-05, "loss": 0.5536273002624512, "mean_token_accuracy": 0.8602010656148196, "num_tokens": 37395146.0, "step": 18290 }, { "entropy": 0.5867072810418904, "epoch": 0.2972154324646955, "grad_norm": 6.0, "learning_rate": 4.059462983062738e-05, "loss": 0.592656421661377, "mean_token_accuracy": 0.8501064013689756, "num_tokens": 37415945.0, "step": 18300 }, { "entropy": 0.49287839424796404, "epoch": 0.29737784526932104, "grad_norm": 6.8125, "learning_rate": 4.0584493283262934e-05, "loss": 0.5179312705993653, "mean_token_accuracy": 0.8665899276733399, "num_tokens": 37435325.0, "step": 18310 }, { "entropy": 0.5457955406047403, "epoch": 0.2975402580739466, "grad_norm": 6.75, "learning_rate": 4.057435254363477e-05, "loss": 0.5549544334411621, "mean_token_accuracy": 0.8597264714539051, "num_tokens": 37456261.0, "step": 18320 }, { "entropy": 0.5304658240173012, "epoch": 0.29770267087857205, "grad_norm": 6.25, "learning_rate": 4.0564207614470774e-05, "loss": 0.5480710029602051, "mean_token_accuracy": 0.8660931870341301, "num_tokens": 37476561.0, "step": 18330 }, { "entropy": 0.5616916247876361, "epoch": 0.2978650836831976, "grad_norm": 6.34375, "learning_rate": 4.055405849849995e-05, "loss": 0.5445189952850342, "mean_token_accuracy": 0.8548055727034807, "num_tokens": 37497620.0, "step": 18340 }, { "entropy": 0.5865047479979694, "epoch": 0.2980274964878231, "grad_norm": 5.1875, "learning_rate": 4.0543905198452423e-05, "loss": 0.6317931652069092, "mean_token_accuracy": 0.847425140067935, "num_tokens": 37519010.0, "step": 18350 }, { "entropy": 0.5604267084971071, "epoch": 0.2981899092924486, "grad_norm": 7.65625, "learning_rate": 4.053374771705948e-05, "loss": 0.5366101741790772, "mean_token_accuracy": 0.8648546151816845, "num_tokens": 37540024.0, "step": 18360 }, { "entropy": 0.6291342639364302, "epoch": 0.29835232209707413, "grad_norm": 8.625, "learning_rate": 4.0523586057053484e-05, "loss": 0.6290030479431152, "mean_token_accuracy": 0.8334765449166298, "num_tokens": 37559561.0, "step": 18370 }, { "entropy": 0.4761138725094497, "epoch": 0.29851473490169966, "grad_norm": 6.53125, "learning_rate": 4.051342022116795e-05, "loss": 0.471433162689209, "mean_token_accuracy": 0.8751187555491924, "num_tokens": 37580476.0, "step": 18380 }, { "entropy": 0.591613108292222, "epoch": 0.29867714770632514, "grad_norm": 8.125, "learning_rate": 4.0503250212137523e-05, "loss": 0.6463563919067383, "mean_token_accuracy": 0.83936932310462, "num_tokens": 37601462.0, "step": 18390 }, { "entropy": 0.5198147079441696, "epoch": 0.2988395605109507, "grad_norm": 6.34375, "learning_rate": 4.049307603269793e-05, "loss": 0.5053734302520752, "mean_token_accuracy": 0.8686460986733436, "num_tokens": 37621076.0, "step": 18400 }, { "entropy": 0.5581785670481623, "epoch": 0.2990019733155762, "grad_norm": 7.6875, "learning_rate": 4.048289768558608e-05, "loss": 0.5392992973327637, "mean_token_accuracy": 0.8625946007668972, "num_tokens": 37641908.0, "step": 18410 }, { "entropy": 0.5275594906881451, "epoch": 0.29916438612020174, "grad_norm": 8.6875, "learning_rate": 4.047271517353995e-05, "loss": 0.49792022705078126, "mean_token_accuracy": 0.8674438059329986, "num_tokens": 37662683.0, "step": 18420 }, { "entropy": 0.5245737377554178, "epoch": 0.2993267989248272, "grad_norm": 8.3125, "learning_rate": 4.0462528499298666e-05, "loss": 0.5501349925994873, "mean_token_accuracy": 0.8588576681911946, "num_tokens": 37682302.0, "step": 18430 }, { "entropy": 0.480031169205904, "epoch": 0.29948921172945275, "grad_norm": 7.25, "learning_rate": 4.045233766560247e-05, "loss": 0.47205214500427245, "mean_token_accuracy": 0.8748327143490314, "num_tokens": 37704008.0, "step": 18440 }, { "entropy": 0.44854514035396276, "epoch": 0.2996516245340783, "grad_norm": 5.5, "learning_rate": 4.0442142675192715e-05, "loss": 0.4672853469848633, "mean_token_accuracy": 0.875875324010849, "num_tokens": 37724921.0, "step": 18450 }, { "entropy": 0.4931590172462165, "epoch": 0.29981403733870376, "grad_norm": 14.0625, "learning_rate": 4.043194353081188e-05, "loss": 0.5496779918670655, "mean_token_accuracy": 0.8608825527131557, "num_tokens": 37745873.0, "step": 18460 }, { "entropy": 0.5909688537940383, "epoch": 0.2999764501433293, "grad_norm": 7.90625, "learning_rate": 4.042174023520354e-05, "loss": 0.6300872802734375, "mean_token_accuracy": 0.8459713123738766, "num_tokens": 37766060.0, "step": 18470 }, { "entropy": 0.4987281003035605, "epoch": 0.30013886294795483, "grad_norm": 5.71875, "learning_rate": 4.041153279111243e-05, "loss": 0.4945223808288574, "mean_token_accuracy": 0.8740331277251243, "num_tokens": 37786082.0, "step": 18480 }, { "entropy": 0.6078218809794634, "epoch": 0.3003012757525803, "grad_norm": 6.3125, "learning_rate": 4.0401321201284356e-05, "loss": 0.5837239742279052, "mean_token_accuracy": 0.8519362024962902, "num_tokens": 37806640.0, "step": 18490 }, { "entropy": 0.6298030248843134, "epoch": 0.30046368855720584, "grad_norm": 7.46875, "learning_rate": 4.039110546846627e-05, "loss": 0.622196102142334, "mean_token_accuracy": 0.8506173595786095, "num_tokens": 37828216.0, "step": 18500 }, { "entropy": 0.526211079210043, "epoch": 0.3006261013618314, "grad_norm": 5.9375, "learning_rate": 4.038088559540623e-05, "loss": 0.5140679359436036, "mean_token_accuracy": 0.8674201183021069, "num_tokens": 37848437.0, "step": 18510 }, { "entropy": 0.6190586889162659, "epoch": 0.3007885141664569, "grad_norm": 8.4375, "learning_rate": 4.037066158485338e-05, "loss": 0.6683550357818604, "mean_token_accuracy": 0.8353213183581829, "num_tokens": 37869560.0, "step": 18520 }, { "entropy": 0.5134971441468223, "epoch": 0.3009509269710824, "grad_norm": 8.0625, "learning_rate": 4.036043343955804e-05, "loss": 0.5547324657440186, "mean_token_accuracy": 0.8696597218513489, "num_tokens": 37889486.0, "step": 18530 }, { "entropy": 0.5937203916721046, "epoch": 0.3011133397757079, "grad_norm": 7.84375, "learning_rate": 4.0350201162271585e-05, "loss": 0.5922856807708741, "mean_token_accuracy": 0.8509636022150516, "num_tokens": 37909604.0, "step": 18540 }, { "entropy": 0.6088982063345612, "epoch": 0.30127575258033346, "grad_norm": 8.1875, "learning_rate": 4.0339964755746504e-05, "loss": 0.6338249683380127, "mean_token_accuracy": 0.8501441366970539, "num_tokens": 37929060.0, "step": 18550 }, { "entropy": 0.6426794612780213, "epoch": 0.30143816538495893, "grad_norm": 7.78125, "learning_rate": 4.032972422273644e-05, "loss": 0.6053624153137207, "mean_token_accuracy": 0.8474758937954903, "num_tokens": 37949396.0, "step": 18560 }, { "entropy": 0.46357202297076583, "epoch": 0.30160057818958447, "grad_norm": 6.78125, "learning_rate": 4.031947956599611e-05, "loss": 0.40838823318481443, "mean_token_accuracy": 0.8943016901612282, "num_tokens": 37969557.0, "step": 18570 }, { "entropy": 0.514061052724719, "epoch": 0.30176299099421, "grad_norm": 9.0625, "learning_rate": 4.030923078828135e-05, "loss": 0.5570794582366944, "mean_token_accuracy": 0.8568534646183252, "num_tokens": 37989542.0, "step": 18580 }, { "entropy": 0.5405584103893488, "epoch": 0.3019254037988355, "grad_norm": 8.8125, "learning_rate": 4.029897789234909e-05, "loss": 0.5596442699432373, "mean_token_accuracy": 0.8651847392320633, "num_tokens": 38008726.0, "step": 18590 }, { "entropy": 0.4916353357024491, "epoch": 0.302087816603461, "grad_norm": 8.625, "learning_rate": 4.028872088095741e-05, "loss": 0.4604952812194824, "mean_token_accuracy": 0.8768504455685615, "num_tokens": 38029129.0, "step": 18600 }, { "entropy": 0.5155279682483525, "epoch": 0.30225022940808655, "grad_norm": 7.46875, "learning_rate": 4.027845975686544e-05, "loss": 0.523536205291748, "mean_token_accuracy": 0.8625660508871078, "num_tokens": 38048987.0, "step": 18610 }, { "entropy": 0.4857929261401296, "epoch": 0.302412642212712, "grad_norm": 5.65625, "learning_rate": 4.026819452283347e-05, "loss": 0.4623286247253418, "mean_token_accuracy": 0.8777495145797729, "num_tokens": 38069112.0, "step": 18620 }, { "entropy": 0.5810016373172402, "epoch": 0.30257505501733756, "grad_norm": 6.34375, "learning_rate": 4.025792518162285e-05, "loss": 0.6277034759521485, "mean_token_accuracy": 0.8362510047852993, "num_tokens": 38090019.0, "step": 18630 }, { "entropy": 0.5497262555174529, "epoch": 0.3027374678219631, "grad_norm": 6.125, "learning_rate": 4.024765173599607e-05, "loss": 0.5717017650604248, "mean_token_accuracy": 0.8614972122013569, "num_tokens": 38111190.0, "step": 18640 }, { "entropy": 0.5776823358610272, "epoch": 0.3028998806265886, "grad_norm": 8.3125, "learning_rate": 4.0237374188716716e-05, "loss": 0.5677416801452637, "mean_token_accuracy": 0.8574865818023681, "num_tokens": 38131531.0, "step": 18650 }, { "entropy": 0.5262401051819324, "epoch": 0.3030622934312141, "grad_norm": 6.875, "learning_rate": 4.022709254254945e-05, "loss": 0.49150938987731935, "mean_token_accuracy": 0.8737956151366234, "num_tokens": 38151996.0, "step": 18660 }, { "entropy": 0.5739308902528137, "epoch": 0.30322470623583964, "grad_norm": 7.4375, "learning_rate": 4.021680680026007e-05, "loss": 0.569417667388916, "mean_token_accuracy": 0.8551946900784969, "num_tokens": 38172399.0, "step": 18670 }, { "entropy": 0.5793012114241719, "epoch": 0.30338711904046517, "grad_norm": 6.5625, "learning_rate": 4.020651696461547e-05, "loss": 0.6440511226654053, "mean_token_accuracy": 0.8509455643594265, "num_tokens": 38192936.0, "step": 18680 }, { "entropy": 0.560908401152119, "epoch": 0.30354953184509065, "grad_norm": 6.28125, "learning_rate": 4.0196223038383626e-05, "loss": 0.5597870826721192, "mean_token_accuracy": 0.8571750685572624, "num_tokens": 38214802.0, "step": 18690 }, { "entropy": 0.5578504668548703, "epoch": 0.3037119446497162, "grad_norm": 6.53125, "learning_rate": 4.018592502433363e-05, "loss": 0.5760014057159424, "mean_token_accuracy": 0.8574293315410614, "num_tokens": 38236120.0, "step": 18700 }, { "entropy": 0.5486619657371193, "epoch": 0.3038743574543417, "grad_norm": 5.96875, "learning_rate": 4.017562292523568e-05, "loss": 0.5545848846435547, "mean_token_accuracy": 0.8563994932919741, "num_tokens": 38256453.0, "step": 18710 }, { "entropy": 0.5290350871160626, "epoch": 0.3040367702589672, "grad_norm": 6.0, "learning_rate": 4.016531674386106e-05, "loss": 0.5835164546966553, "mean_token_accuracy": 0.8578483976423741, "num_tokens": 38277192.0, "step": 18720 }, { "entropy": 0.6084001552313566, "epoch": 0.3041991830635927, "grad_norm": 7.125, "learning_rate": 4.015500648298215e-05, "loss": 0.5854540348052979, "mean_token_accuracy": 0.8465478666126728, "num_tokens": 38297855.0, "step": 18730 }, { "entropy": 0.565308470511809, "epoch": 0.30436159586821826, "grad_norm": 10.5625, "learning_rate": 4.014469214537244e-05, "loss": 0.607196855545044, "mean_token_accuracy": 0.8484242931008339, "num_tokens": 38318252.0, "step": 18740 }, { "entropy": 0.574339872598648, "epoch": 0.3045240086728438, "grad_norm": 7.75, "learning_rate": 4.013437373380651e-05, "loss": 0.5973798274993897, "mean_token_accuracy": 0.8446942731738091, "num_tokens": 38337633.0, "step": 18750 }, { "entropy": 0.5720671666786075, "epoch": 0.30468642147746927, "grad_norm": 8.625, "learning_rate": 4.012405125106003e-05, "loss": 0.5775179862976074, "mean_token_accuracy": 0.8548632331192494, "num_tokens": 38358263.0, "step": 18760 }, { "entropy": 0.5116192387416959, "epoch": 0.3048488342820948, "grad_norm": 6.5, "learning_rate": 4.011372469990977e-05, "loss": 0.5235109329223633, "mean_token_accuracy": 0.8610612653195858, "num_tokens": 38377842.0, "step": 18770 }, { "entropy": 0.5275371117517352, "epoch": 0.30501124708672034, "grad_norm": 8.375, "learning_rate": 4.01033940831336e-05, "loss": 0.5244380474090576, "mean_token_accuracy": 0.8636931829154492, "num_tokens": 38397175.0, "step": 18780 }, { "entropy": 0.5273407051339746, "epoch": 0.3051736598913458, "grad_norm": 9.3125, "learning_rate": 4.009305940351048e-05, "loss": 0.5104909896850586, "mean_token_accuracy": 0.8686032436788083, "num_tokens": 38417280.0, "step": 18790 }, { "entropy": 0.514790934510529, "epoch": 0.30533607269597135, "grad_norm": 11.3125, "learning_rate": 4.008272066382047e-05, "loss": 0.5102662563323974, "mean_token_accuracy": 0.8684730850160122, "num_tokens": 38438506.0, "step": 18800 }, { "entropy": 0.5778977618552744, "epoch": 0.3054984855005969, "grad_norm": 10.75, "learning_rate": 4.007237786684469e-05, "loss": 0.5812434196472168, "mean_token_accuracy": 0.8492145761847496, "num_tokens": 38460147.0, "step": 18810 }, { "entropy": 0.5289366538636386, "epoch": 0.30566089830522236, "grad_norm": 9.0, "learning_rate": 4.0062031015365396e-05, "loss": 0.5674821376800537, "mean_token_accuracy": 0.8563410319387913, "num_tokens": 38480880.0, "step": 18820 }, { "entropy": 0.6358812071383, "epoch": 0.3058233111098479, "grad_norm": 7.46875, "learning_rate": 4.005168011216592e-05, "loss": 0.6255525588989258, "mean_token_accuracy": 0.8439608298242092, "num_tokens": 38501894.0, "step": 18830 }, { "entropy": 0.5146015097387135, "epoch": 0.30598572391447343, "grad_norm": 5.75, "learning_rate": 4.004132516003066e-05, "loss": 0.4996341705322266, "mean_token_accuracy": 0.8677243966609239, "num_tokens": 38522925.0, "step": 18840 }, { "entropy": 0.5024016416631639, "epoch": 0.3061481367190989, "grad_norm": 8.375, "learning_rate": 4.003096616174512e-05, "loss": 0.4870443820953369, "mean_token_accuracy": 0.8678838357329368, "num_tokens": 38543956.0, "step": 18850 }, { "entropy": 0.5860246462281793, "epoch": 0.30631054952372444, "grad_norm": 7.1875, "learning_rate": 4.002060312009591e-05, "loss": 0.6507218360900879, "mean_token_accuracy": 0.8421036954969168, "num_tokens": 38565183.0, "step": 18860 }, { "entropy": 0.5225791018456221, "epoch": 0.30647296232835, "grad_norm": 7.5, "learning_rate": 4.0010236037870705e-05, "loss": 0.4806240081787109, "mean_token_accuracy": 0.872143467515707, "num_tokens": 38586255.0, "step": 18870 }, { "entropy": 0.5179202020633966, "epoch": 0.3066353751329755, "grad_norm": 7.71875, "learning_rate": 3.9999864917858276e-05, "loss": 0.5184689044952393, "mean_token_accuracy": 0.8641481995582581, "num_tokens": 38606584.0, "step": 18880 }, { "entropy": 0.5677586127072572, "epoch": 0.306797787937601, "grad_norm": 6.96875, "learning_rate": 3.998948976284847e-05, "loss": 0.5744168281555175, "mean_token_accuracy": 0.8513001285493373, "num_tokens": 38626528.0, "step": 18890 }, { "entropy": 0.515854315739125, "epoch": 0.3069602007422265, "grad_norm": 7.0, "learning_rate": 3.9979110575632226e-05, "loss": 0.5207403182983399, "mean_token_accuracy": 0.8589541107416153, "num_tokens": 38647371.0, "step": 18900 }, { "entropy": 0.6085777279455215, "epoch": 0.30712261354685205, "grad_norm": 7.125, "learning_rate": 3.996872735900158e-05, "loss": 0.6056053638458252, "mean_token_accuracy": 0.8429012976586818, "num_tokens": 38668004.0, "step": 18910 }, { "entropy": 0.5638324806466699, "epoch": 0.30728502635147753, "grad_norm": 9.125, "learning_rate": 3.995834011574963e-05, "loss": 0.5830959796905517, "mean_token_accuracy": 0.8498951315879821, "num_tokens": 38688512.0, "step": 18920 }, { "entropy": 0.5790169212035835, "epoch": 0.30744743915610306, "grad_norm": 6.71875, "learning_rate": 3.994794884867058e-05, "loss": 0.603140926361084, "mean_token_accuracy": 0.8551956124603748, "num_tokens": 38709657.0, "step": 18930 }, { "entropy": 0.5848646854050458, "epoch": 0.3076098519607286, "grad_norm": 7.25, "learning_rate": 3.993755356055969e-05, "loss": 0.5836717128753662, "mean_token_accuracy": 0.8537973761558533, "num_tokens": 38730011.0, "step": 18940 }, { "entropy": 0.5304347008001059, "epoch": 0.3077722647653541, "grad_norm": 10.3125, "learning_rate": 3.9927154254213324e-05, "loss": 0.5124943733215332, "mean_token_accuracy": 0.8593435332179069, "num_tokens": 38750360.0, "step": 18950 }, { "entropy": 0.5537048161029816, "epoch": 0.3079346775699796, "grad_norm": 7.3125, "learning_rate": 3.991675093242891e-05, "loss": 0.5733994960784912, "mean_token_accuracy": 0.853875944763422, "num_tokens": 38769989.0, "step": 18960 }, { "entropy": 0.646009061485529, "epoch": 0.30809709037460514, "grad_norm": 7.21875, "learning_rate": 3.990634359800498e-05, "loss": 0.6725071430206299, "mean_token_accuracy": 0.841486033052206, "num_tokens": 38791407.0, "step": 18970 }, { "entropy": 0.5538863874971867, "epoch": 0.3082595031792307, "grad_norm": 5.6875, "learning_rate": 3.989593225374112e-05, "loss": 0.5354800224304199, "mean_token_accuracy": 0.868000753968954, "num_tokens": 38812137.0, "step": 18980 }, { "entropy": 0.6242260855156928, "epoch": 0.30842191598385615, "grad_norm": 8.9375, "learning_rate": 3.9885516902438016e-05, "loss": 0.5793234825134277, "mean_token_accuracy": 0.8533586151897907, "num_tokens": 38832093.0, "step": 18990 }, { "entropy": 0.5957398721016943, "epoch": 0.3085843287884817, "grad_norm": 9.5625, "learning_rate": 3.98750975468974e-05, "loss": 0.6055310726165771, "mean_token_accuracy": 0.8475604251027107, "num_tokens": 38853016.0, "step": 19000 }, { "entropy": 0.5511787381023169, "epoch": 0.3087467415931072, "grad_norm": 7.21875, "learning_rate": 3.9864674189922114e-05, "loss": 0.5812894344329834, "mean_token_accuracy": 0.8532300375401973, "num_tokens": 38874452.0, "step": 19010 }, { "entropy": 0.5321362631861121, "epoch": 0.3089091543977327, "grad_norm": 7.75, "learning_rate": 3.985424683431607e-05, "loss": 0.4938765048980713, "mean_token_accuracy": 0.8735089272260665, "num_tokens": 38893395.0, "step": 19020 }, { "entropy": 0.5352374540176242, "epoch": 0.30907156720235823, "grad_norm": 8.4375, "learning_rate": 3.984381548288425e-05, "loss": 0.5238100051879883, "mean_token_accuracy": 0.863590133190155, "num_tokens": 38912921.0, "step": 19030 }, { "entropy": 0.6083398039452732, "epoch": 0.30923398000698377, "grad_norm": 8.375, "learning_rate": 3.983338013843269e-05, "loss": 0.6686630249023438, "mean_token_accuracy": 0.8335504595190286, "num_tokens": 38933240.0, "step": 19040 }, { "entropy": 0.4984588557155803, "epoch": 0.30939639281160924, "grad_norm": 5.4375, "learning_rate": 3.982294080376855e-05, "loss": 0.4973402500152588, "mean_token_accuracy": 0.8700132440775633, "num_tokens": 38954709.0, "step": 19050 }, { "entropy": 0.5311712921597064, "epoch": 0.3095588056162348, "grad_norm": 8.8125, "learning_rate": 3.981249748170002e-05, "loss": 0.535819673538208, "mean_token_accuracy": 0.8602229751646518, "num_tokens": 38974865.0, "step": 19060 }, { "entropy": 0.5581549669615924, "epoch": 0.3097212184208603, "grad_norm": 7.375, "learning_rate": 3.9802050175036377e-05, "loss": 0.5196681022644043, "mean_token_accuracy": 0.8629326976835727, "num_tokens": 38996017.0, "step": 19070 }, { "entropy": 0.6870385620277375, "epoch": 0.30988363122548584, "grad_norm": 8.875, "learning_rate": 3.9791598886587964e-05, "loss": 0.705416202545166, "mean_token_accuracy": 0.8247367113828659, "num_tokens": 39016907.0, "step": 19080 }, { "entropy": 0.5622619421221315, "epoch": 0.3100460440301113, "grad_norm": 9.1875, "learning_rate": 3.978114361916622e-05, "loss": 0.5847455501556397, "mean_token_accuracy": 0.8482499629259109, "num_tokens": 39037388.0, "step": 19090 }, { "entropy": 0.5848425036529079, "epoch": 0.31020845683473686, "grad_norm": 8.5625, "learning_rate": 3.977068437558361e-05, "loss": 0.6195621013641357, "mean_token_accuracy": 0.8549220554530621, "num_tokens": 39058198.0, "step": 19100 }, { "entropy": 0.5159534751437604, "epoch": 0.3103708696393624, "grad_norm": 11.0, "learning_rate": 3.976022115865372e-05, "loss": 0.5237014293670654, "mean_token_accuracy": 0.8680881977081298, "num_tokens": 39077955.0, "step": 19110 }, { "entropy": 0.6860589657910168, "epoch": 0.31053328244398787, "grad_norm": 7.1875, "learning_rate": 3.974975397119116e-05, "loss": 0.6303433895111084, "mean_token_accuracy": 0.84304124340415, "num_tokens": 39098155.0, "step": 19120 }, { "entropy": 0.5860568817937747, "epoch": 0.3106956952486134, "grad_norm": 7.96875, "learning_rate": 3.973928281601164e-05, "loss": 0.5881663799285889, "mean_token_accuracy": 0.8512168727815151, "num_tokens": 39118038.0, "step": 19130 }, { "entropy": 0.5705150796566159, "epoch": 0.31085810805323894, "grad_norm": 11.5625, "learning_rate": 3.9728807695931916e-05, "loss": 0.6196613788604737, "mean_token_accuracy": 0.8537365816533565, "num_tokens": 39138809.0, "step": 19140 }, { "entropy": 0.47885154485702514, "epoch": 0.3110205208578644, "grad_norm": 6.96875, "learning_rate": 3.9718328613769817e-05, "loss": 0.45858087539672854, "mean_token_accuracy": 0.8804532706737518, "num_tokens": 39157960.0, "step": 19150 }, { "entropy": 0.5192302588373423, "epoch": 0.31118293366248995, "grad_norm": 8.9375, "learning_rate": 3.9707845572344244e-05, "loss": 0.5124351978302002, "mean_token_accuracy": 0.8645814381539821, "num_tokens": 39178443.0, "step": 19160 }, { "entropy": 0.5327319487929344, "epoch": 0.3113453464671155, "grad_norm": 6.34375, "learning_rate": 3.969735857447516e-05, "loss": 0.5344436168670654, "mean_token_accuracy": 0.8677810408174992, "num_tokens": 39198807.0, "step": 19170 }, { "entropy": 0.5710339611396194, "epoch": 0.31150775927174096, "grad_norm": 7.15625, "learning_rate": 3.968686762298359e-05, "loss": 0.5479374408721924, "mean_token_accuracy": 0.855444285273552, "num_tokens": 39219293.0, "step": 19180 }, { "entropy": 0.43814735640771685, "epoch": 0.3116701720763665, "grad_norm": 6.96875, "learning_rate": 3.967637272069162e-05, "loss": 0.38538327217102053, "mean_token_accuracy": 0.8971199378371238, "num_tokens": 39238312.0, "step": 19190 }, { "entropy": 0.544992359355092, "epoch": 0.311832584880992, "grad_norm": 7.625, "learning_rate": 3.966587387042241e-05, "loss": 0.5848678588867188, "mean_token_accuracy": 0.8497995935380459, "num_tokens": 39258617.0, "step": 19200 }, { "entropy": 0.49279797710478307, "epoch": 0.31199499768561756, "grad_norm": 15.3125, "learning_rate": 3.965537107500017e-05, "loss": 0.5475634098052978, "mean_token_accuracy": 0.8686653397977352, "num_tokens": 39278534.0, "step": 19210 }, { "entropy": 0.5287778607103973, "epoch": 0.31215741049024304, "grad_norm": 9.0625, "learning_rate": 3.964486433725017e-05, "loss": 0.5726676464080811, "mean_token_accuracy": 0.8591269560158252, "num_tokens": 39298880.0, "step": 19220 }, { "entropy": 0.5519081845879554, "epoch": 0.31231982329486857, "grad_norm": 7.9375, "learning_rate": 3.963435365999875e-05, "loss": 0.5998354434967041, "mean_token_accuracy": 0.8481284163892269, "num_tokens": 39319667.0, "step": 19230 }, { "entropy": 0.6301240844652056, "epoch": 0.3124822360994941, "grad_norm": 8.8125, "learning_rate": 3.9623839046073305e-05, "loss": 0.642618465423584, "mean_token_accuracy": 0.837563606724143, "num_tokens": 39340429.0, "step": 19240 }, { "entropy": 0.4826443509198725, "epoch": 0.3126446489041196, "grad_norm": 9.75, "learning_rate": 3.9613320498302304e-05, "loss": 0.47468152046203616, "mean_token_accuracy": 0.876922146230936, "num_tokens": 39360430.0, "step": 19250 }, { "entropy": 0.5668265367858112, "epoch": 0.3128070617087451, "grad_norm": 9.4375, "learning_rate": 3.9602798019515233e-05, "loss": 0.5279725074768067, "mean_token_accuracy": 0.8610369861125946, "num_tokens": 39380891.0, "step": 19260 }, { "entropy": 0.5270667726173996, "epoch": 0.31296947451337065, "grad_norm": 9.375, "learning_rate": 3.959227161254269e-05, "loss": 0.5035872459411621, "mean_token_accuracy": 0.867455618083477, "num_tokens": 39401129.0, "step": 19270 }, { "entropy": 0.5017395663075149, "epoch": 0.3131318873179961, "grad_norm": 5.90625, "learning_rate": 3.958174128021628e-05, "loss": 0.511758279800415, "mean_token_accuracy": 0.8668456487357616, "num_tokens": 39421192.0, "step": 19280 }, { "entropy": 0.5174957217648626, "epoch": 0.31329430012262166, "grad_norm": 8.0625, "learning_rate": 3.9571207025368695e-05, "loss": 0.5325199604034424, "mean_token_accuracy": 0.8600674942135811, "num_tokens": 39441591.0, "step": 19290 }, { "entropy": 0.5682986180298031, "epoch": 0.3134567129272472, "grad_norm": 7.6875, "learning_rate": 3.9560668850833674e-05, "loss": 0.5601281642913818, "mean_token_accuracy": 0.8608564235270023, "num_tokens": 39460923.0, "step": 19300 }, { "entropy": 0.533686973946169, "epoch": 0.3136191257318727, "grad_norm": 6.59375, "learning_rate": 3.955012675944602e-05, "loss": 0.544423770904541, "mean_token_accuracy": 0.8653843514621258, "num_tokens": 39481678.0, "step": 19310 }, { "entropy": 0.5507425420219079, "epoch": 0.3137815385364982, "grad_norm": 9.6875, "learning_rate": 3.953958075404156e-05, "loss": 0.5740674495697021, "mean_token_accuracy": 0.8559039458632469, "num_tokens": 39502316.0, "step": 19320 }, { "entropy": 0.5801454225555063, "epoch": 0.31394395134112374, "grad_norm": 6.34375, "learning_rate": 3.95290308374572e-05, "loss": 0.5982348918914795, "mean_token_accuracy": 0.8555800009518861, "num_tokens": 39522596.0, "step": 19330 }, { "entropy": 0.6091916370671242, "epoch": 0.3141063641457493, "grad_norm": 6.625, "learning_rate": 3.951847701253089e-05, "loss": 0.6586312770843505, "mean_token_accuracy": 0.8406965442001819, "num_tokens": 39542470.0, "step": 19340 }, { "entropy": 0.5263452836312353, "epoch": 0.31426877695037475, "grad_norm": 7.0, "learning_rate": 3.950791928210164e-05, "loss": 0.5331189632415771, "mean_token_accuracy": 0.8639646083116531, "num_tokens": 39562192.0, "step": 19350 }, { "entropy": 0.5400573233608157, "epoch": 0.3144311897550003, "grad_norm": 6.125, "learning_rate": 3.94973576490095e-05, "loss": 0.5522817611694336, "mean_token_accuracy": 0.8622964017093182, "num_tokens": 39582132.0, "step": 19360 }, { "entropy": 0.6017205367796123, "epoch": 0.3145936025596258, "grad_norm": 10.0625, "learning_rate": 3.948679211609557e-05, "loss": 0.6157132148742676, "mean_token_accuracy": 0.8447596989572048, "num_tokens": 39602548.0, "step": 19370 }, { "entropy": 0.5592338665854186, "epoch": 0.3147560153642513, "grad_norm": 8.0, "learning_rate": 3.9476222686202004e-05, "loss": 0.6307149887084961, "mean_token_accuracy": 0.8462336950004101, "num_tokens": 39623627.0, "step": 19380 }, { "entropy": 0.5967822981532663, "epoch": 0.31491842816887683, "grad_norm": 4.9375, "learning_rate": 3.9465649362171994e-05, "loss": 0.5895767211914062, "mean_token_accuracy": 0.8498439226299525, "num_tokens": 39644228.0, "step": 19390 }, { "entropy": 0.5383216224145144, "epoch": 0.31508084097350236, "grad_norm": 7.90625, "learning_rate": 3.9455072146849815e-05, "loss": 0.5457468032836914, "mean_token_accuracy": 0.8613985605537892, "num_tokens": 39664139.0, "step": 19400 }, { "entropy": 0.6676898158621043, "epoch": 0.31524325377812784, "grad_norm": 6.625, "learning_rate": 3.944449104308072e-05, "loss": 0.6607512950897216, "mean_token_accuracy": 0.8377457454800605, "num_tokens": 39685399.0, "step": 19410 }, { "entropy": 0.6280208151321858, "epoch": 0.3154056665827534, "grad_norm": 9.3125, "learning_rate": 3.943390605371109e-05, "loss": 0.6138193130493164, "mean_token_accuracy": 0.847489869222045, "num_tokens": 39707706.0, "step": 19420 }, { "entropy": 0.628469105064869, "epoch": 0.3155680793873789, "grad_norm": 7.78125, "learning_rate": 3.9423317181588284e-05, "loss": 0.6331322193145752, "mean_token_accuracy": 0.8453275434672832, "num_tokens": 39728038.0, "step": 19430 }, { "entropy": 0.5060825611464679, "epoch": 0.31573049219200444, "grad_norm": 10.0, "learning_rate": 3.9412724429560754e-05, "loss": 0.5083190441131592, "mean_token_accuracy": 0.8726790450513363, "num_tokens": 39748514.0, "step": 19440 }, { "entropy": 0.4799587679095566, "epoch": 0.3158929049966299, "grad_norm": 6.5625, "learning_rate": 3.9402127800477944e-05, "loss": 0.47894110679626467, "mean_token_accuracy": 0.8799192920327187, "num_tokens": 39768195.0, "step": 19450 }, { "entropy": 0.5562040118500591, "epoch": 0.31605531780125545, "grad_norm": 11.125, "learning_rate": 3.93915272971904e-05, "loss": 0.5658151149749756, "mean_token_accuracy": 0.8553099315613508, "num_tokens": 39787899.0, "step": 19460 }, { "entropy": 0.5441144986078144, "epoch": 0.316217730605881, "grad_norm": 7.25, "learning_rate": 3.938092292254967e-05, "loss": 0.5577087879180909, "mean_token_accuracy": 0.853182328492403, "num_tokens": 39808082.0, "step": 19470 }, { "entropy": 0.48495374359190463, "epoch": 0.31638014341050646, "grad_norm": 7.9375, "learning_rate": 3.937031467940835e-05, "loss": 0.4723358154296875, "mean_token_accuracy": 0.8687118560075759, "num_tokens": 39828651.0, "step": 19480 }, { "entropy": 0.5390023849904537, "epoch": 0.316542556215132, "grad_norm": 6.6875, "learning_rate": 3.935970257062009e-05, "loss": 0.515623664855957, "mean_token_accuracy": 0.8600548416376114, "num_tokens": 39849089.0, "step": 19490 }, { "entropy": 0.534993429388851, "epoch": 0.31670496901975753, "grad_norm": 6.28125, "learning_rate": 3.934908659903956e-05, "loss": 0.5749815940856934, "mean_token_accuracy": 0.8567329987883567, "num_tokens": 39869834.0, "step": 19500 }, { "entropy": 0.5613266935572028, "epoch": 0.316867381824383, "grad_norm": 7.0625, "learning_rate": 3.9338466767522496e-05, "loss": 0.5985610961914063, "mean_token_accuracy": 0.8471956968307495, "num_tokens": 39890325.0, "step": 19510 }, { "entropy": 0.5950109224766493, "epoch": 0.31702979462900854, "grad_norm": 9.5625, "learning_rate": 3.932784307892565e-05, "loss": 0.6104081630706787, "mean_token_accuracy": 0.8508874930441379, "num_tokens": 39910724.0, "step": 19520 }, { "entropy": 0.5881017514504492, "epoch": 0.3171922074336341, "grad_norm": 8.25, "learning_rate": 3.931721553610681e-05, "loss": 0.5622600555419922, "mean_token_accuracy": 0.860868314653635, "num_tokens": 39931531.0, "step": 19530 }, { "entropy": 0.5962625299114734, "epoch": 0.3173546202382596, "grad_norm": 7.5625, "learning_rate": 3.930658414192481e-05, "loss": 0.5906525135040284, "mean_token_accuracy": 0.8515744864940643, "num_tokens": 39951722.0, "step": 19540 }, { "entropy": 0.5768448542803526, "epoch": 0.3175170330428851, "grad_norm": 7.375, "learning_rate": 3.9295948899239534e-05, "loss": 0.5756896495819092, "mean_token_accuracy": 0.8503908183425665, "num_tokens": 39972275.0, "step": 19550 }, { "entropy": 0.5503929348662495, "epoch": 0.3176794458475106, "grad_norm": 7.03125, "learning_rate": 3.928530981091187e-05, "loss": 0.5346224784851075, "mean_token_accuracy": 0.8624202698469162, "num_tokens": 39993761.0, "step": 19560 }, { "entropy": 0.6092671368271112, "epoch": 0.31784185865213616, "grad_norm": 8.375, "learning_rate": 3.927466687980376e-05, "loss": 0.6240594387054443, "mean_token_accuracy": 0.8406522646546364, "num_tokens": 40014892.0, "step": 19570 }, { "entropy": 0.5335901903919875, "epoch": 0.31800427145676163, "grad_norm": 5.125, "learning_rate": 3.926402010877819e-05, "loss": 0.5396511077880859, "mean_token_accuracy": 0.8637661635875702, "num_tokens": 40035232.0, "step": 19580 }, { "entropy": 0.5771766271442175, "epoch": 0.31816668426138717, "grad_norm": 5.90625, "learning_rate": 3.925336950069915e-05, "loss": 0.5831156730651855, "mean_token_accuracy": 0.8487849824130536, "num_tokens": 40056401.0, "step": 19590 }, { "entropy": 0.5180296842008829, "epoch": 0.3183290970660127, "grad_norm": 9.4375, "learning_rate": 3.924271505843167e-05, "loss": 0.5219240665435791, "mean_token_accuracy": 0.8592601247131825, "num_tokens": 40075233.0, "step": 19600 }, { "entropy": 0.56553725739941, "epoch": 0.3184915098706382, "grad_norm": 5.34375, "learning_rate": 3.923205678484184e-05, "loss": 0.5500072479248047, "mean_token_accuracy": 0.8595289554446935, "num_tokens": 40095390.0, "step": 19610 }, { "entropy": 0.5385913213714957, "epoch": 0.3186539226752637, "grad_norm": 6.96875, "learning_rate": 3.9221394682796756e-05, "loss": 0.5421299457550048, "mean_token_accuracy": 0.8707927107810974, "num_tokens": 40116661.0, "step": 19620 }, { "entropy": 0.5736958432011307, "epoch": 0.31881633547988925, "grad_norm": 6.78125, "learning_rate": 3.921072875516454e-05, "loss": 0.598740816116333, "mean_token_accuracy": 0.8546320587396622, "num_tokens": 40136935.0, "step": 19630 }, { "entropy": 0.6134945794008673, "epoch": 0.3189787482845147, "grad_norm": 10.25, "learning_rate": 3.920005900481434e-05, "loss": 0.6222496509552002, "mean_token_accuracy": 0.8509710840880871, "num_tokens": 40157665.0, "step": 19640 }, { "entropy": 0.6565963018685579, "epoch": 0.31914116108914026, "grad_norm": 7.5, "learning_rate": 3.9189385434616366e-05, "loss": 0.6266607284545899, "mean_token_accuracy": 0.8395815525203943, "num_tokens": 40179034.0, "step": 19650 }, { "entropy": 0.5256908962503075, "epoch": 0.3193035738937658, "grad_norm": 8.5625, "learning_rate": 3.917870804744182e-05, "loss": 0.5384593963623047, "mean_token_accuracy": 0.8644326299428939, "num_tokens": 40199909.0, "step": 19660 }, { "entropy": 0.6060989880934358, "epoch": 0.3194659866983913, "grad_norm": 9.75, "learning_rate": 3.916802684616294e-05, "loss": 0.6036511421203613, "mean_token_accuracy": 0.8500706322491169, "num_tokens": 40220992.0, "step": 19670 }, { "entropy": 0.575438390346244, "epoch": 0.3196283995030168, "grad_norm": 7.78125, "learning_rate": 3.9157341833653e-05, "loss": 0.606380033493042, "mean_token_accuracy": 0.8532156061381102, "num_tokens": 40242990.0, "step": 19680 }, { "entropy": 0.540601222589612, "epoch": 0.31979081230764234, "grad_norm": 5.96875, "learning_rate": 3.9146653012786295e-05, "loss": 0.5079649925231934, "mean_token_accuracy": 0.8659315899014473, "num_tokens": 40263202.0, "step": 19690 }, { "entropy": 0.5532876365818084, "epoch": 0.31995322511226787, "grad_norm": 6.84375, "learning_rate": 3.913596038643814e-05, "loss": 0.5773871898651123, "mean_token_accuracy": 0.8529730640351773, "num_tokens": 40284519.0, "step": 19700 }, { "entropy": 0.5379133305512369, "epoch": 0.32011563791689335, "grad_norm": 7.46875, "learning_rate": 3.912526395748486e-05, "loss": 0.5361634731292725, "mean_token_accuracy": 0.8628397792577743, "num_tokens": 40305255.0, "step": 19710 }, { "entropy": 0.5893181855790317, "epoch": 0.3202780507215189, "grad_norm": 10.6875, "learning_rate": 3.911456372880383e-05, "loss": 0.6547330856323242, "mean_token_accuracy": 0.8449287779629231, "num_tokens": 40326213.0, "step": 19720 }, { "entropy": 0.5179369143210352, "epoch": 0.3204404635261444, "grad_norm": 7.6875, "learning_rate": 3.910385970327345e-05, "loss": 0.537169075012207, "mean_token_accuracy": 0.860140572488308, "num_tokens": 40347883.0, "step": 19730 }, { "entropy": 0.5375458169262857, "epoch": 0.3206028763307699, "grad_norm": 7.375, "learning_rate": 3.90931518837731e-05, "loss": 0.5277934551239014, "mean_token_accuracy": 0.871111424267292, "num_tokens": 40367913.0, "step": 19740 }, { "entropy": 0.5792287923395634, "epoch": 0.3207652891353954, "grad_norm": 5.5, "learning_rate": 3.908244027318323e-05, "loss": 0.5967052936553955, "mean_token_accuracy": 0.8489834614098072, "num_tokens": 40387807.0, "step": 19750 }, { "entropy": 0.5935343234799803, "epoch": 0.32092770194002096, "grad_norm": 6.53125, "learning_rate": 3.9071724874385274e-05, "loss": 0.6210056781768799, "mean_token_accuracy": 0.8529943019151688, "num_tokens": 40407614.0, "step": 19760 }, { "entropy": 0.5722434962168336, "epoch": 0.3210901147446465, "grad_norm": 7.5625, "learning_rate": 3.906100569026171e-05, "loss": 0.5679896354675293, "mean_token_accuracy": 0.8505684830248356, "num_tokens": 40429289.0, "step": 19770 }, { "entropy": 0.545999848563224, "epoch": 0.32125252754927197, "grad_norm": 12.0625, "learning_rate": 3.905028272369601e-05, "loss": 0.5709371089935302, "mean_token_accuracy": 0.8496932595968246, "num_tokens": 40449467.0, "step": 19780 }, { "entropy": 0.5450378015637398, "epoch": 0.3214149403538975, "grad_norm": 9.125, "learning_rate": 3.903955597757268e-05, "loss": 0.5618586540222168, "mean_token_accuracy": 0.8544690035283565, "num_tokens": 40470102.0, "step": 19790 }, { "entropy": 0.580790686327964, "epoch": 0.32157735315852304, "grad_norm": 6.53125, "learning_rate": 3.902882545477724e-05, "loss": 0.5696881771087646, "mean_token_accuracy": 0.8549814328551293, "num_tokens": 40490578.0, "step": 19800 }, { "entropy": 0.6026866814587265, "epoch": 0.3217397659631485, "grad_norm": 5.5625, "learning_rate": 3.9018091158196224e-05, "loss": 0.5902295589447022, "mean_token_accuracy": 0.8537688009440899, "num_tokens": 40511071.0, "step": 19810 }, { "entropy": 0.5318947600200772, "epoch": 0.32190217876777405, "grad_norm": 9.375, "learning_rate": 3.900735309071719e-05, "loss": 0.5128041267395019, "mean_token_accuracy": 0.8675425566732884, "num_tokens": 40530925.0, "step": 19820 }, { "entropy": 0.5283474426716566, "epoch": 0.3220645915723996, "grad_norm": 8.625, "learning_rate": 3.899661125522868e-05, "loss": 0.5639280319213867, "mean_token_accuracy": 0.8646511472761631, "num_tokens": 40551964.0, "step": 19830 }, { "entropy": 0.6227468535304069, "epoch": 0.32222700437702506, "grad_norm": 10.3125, "learning_rate": 3.89858656546203e-05, "loss": 0.6629209518432617, "mean_token_accuracy": 0.8413042537868023, "num_tokens": 40573791.0, "step": 19840 }, { "entropy": 0.5881687111221254, "epoch": 0.3223894171816506, "grad_norm": 7.9375, "learning_rate": 3.897511629178262e-05, "loss": 0.5973340988159179, "mean_token_accuracy": 0.8471304021775723, "num_tokens": 40594664.0, "step": 19850 }, { "entropy": 0.5967919916380197, "epoch": 0.32255182998627613, "grad_norm": 8.5625, "learning_rate": 3.896436316960726e-05, "loss": 0.5865896224975586, "mean_token_accuracy": 0.8562688034027814, "num_tokens": 40614112.0, "step": 19860 }, { "entropy": 0.6108686328399926, "epoch": 0.32271424279090166, "grad_norm": 7.0625, "learning_rate": 3.8953606290986814e-05, "loss": 0.6083669185638427, "mean_token_accuracy": 0.8412919618189335, "num_tokens": 40635397.0, "step": 19870 }, { "entropy": 0.5203675724565983, "epoch": 0.32287665559552714, "grad_norm": 8.8125, "learning_rate": 3.894284565881493e-05, "loss": 0.49150424003601073, "mean_token_accuracy": 0.8730705507099629, "num_tokens": 40655704.0, "step": 19880 }, { "entropy": 0.5716422371566295, "epoch": 0.3230390684001527, "grad_norm": 7.875, "learning_rate": 3.893208127598622e-05, "loss": 0.5687380313873291, "mean_token_accuracy": 0.8547327250242234, "num_tokens": 40676354.0, "step": 19890 }, { "entropy": 0.5656626813579351, "epoch": 0.3232014812047782, "grad_norm": 10.5, "learning_rate": 3.8921313145396334e-05, "loss": 0.5647895336151123, "mean_token_accuracy": 0.8536812320351601, "num_tokens": 40696530.0, "step": 19900 }, { "entropy": 0.5409168111160397, "epoch": 0.3233638940094037, "grad_norm": 7.25, "learning_rate": 3.8910541269941924e-05, "loss": 0.5285530090332031, "mean_token_accuracy": 0.8732989732176065, "num_tokens": 40717601.0, "step": 19910 }, { "entropy": 0.6130751780699939, "epoch": 0.3235263068140292, "grad_norm": 8.25, "learning_rate": 3.889976565252066e-05, "loss": 0.6324321746826171, "mean_token_accuracy": 0.8532677531242371, "num_tokens": 40737814.0, "step": 19920 }, { "entropy": 0.5145825708284975, "epoch": 0.32368871961865475, "grad_norm": 10.125, "learning_rate": 3.888898629603119e-05, "loss": 0.5276144027709961, "mean_token_accuracy": 0.8675759010016918, "num_tokens": 40758135.0, "step": 19930 }, { "entropy": 0.5005684619769454, "epoch": 0.32385113242328023, "grad_norm": 6.84375, "learning_rate": 3.88782032033732e-05, "loss": 0.5135180473327636, "mean_token_accuracy": 0.8687723644077778, "num_tokens": 40778330.0, "step": 19940 }, { "entropy": 0.5062372504500672, "epoch": 0.32401354522790576, "grad_norm": 7.5625, "learning_rate": 3.886741637744735e-05, "loss": 0.5013963222503662, "mean_token_accuracy": 0.8653702154755593, "num_tokens": 40798835.0, "step": 19950 }, { "entropy": 0.5539556500501931, "epoch": 0.3241759580325313, "grad_norm": 6.5, "learning_rate": 3.885662582115534e-05, "loss": 0.5449463367462158, "mean_token_accuracy": 0.8528797946870327, "num_tokens": 40817518.0, "step": 19960 }, { "entropy": 0.5752821778412909, "epoch": 0.3243383708371568, "grad_norm": 8.5, "learning_rate": 3.8845831537399835e-05, "loss": 0.5447644710540771, "mean_token_accuracy": 0.8640910472720862, "num_tokens": 40838538.0, "step": 19970 }, { "entropy": 0.5251571651548147, "epoch": 0.3245007836417823, "grad_norm": 7.15625, "learning_rate": 3.883503352908453e-05, "loss": 0.5643019676208496, "mean_token_accuracy": 0.8531571350991726, "num_tokens": 40858324.0, "step": 19980 }, { "entropy": 0.528089985344559, "epoch": 0.32466319644640784, "grad_norm": 6.8125, "learning_rate": 3.8824231799114116e-05, "loss": 0.5477115154266358, "mean_token_accuracy": 0.866584275662899, "num_tokens": 40877730.0, "step": 19990 }, { "epoch": 0.3248256092510334, "eval_entropy": 0.5932083523869515, "eval_loss": 0.5908288955688477, "eval_mean_token_accuracy": 0.8494270906448365, "eval_num_tokens": 40897311.0, "eval_runtime": 40.1073, "eval_samples_per_second": 49.866, "eval_steps_per_second": 6.233, "step": 20000 }, { "entropy": 0.5258246382931248, "epoch": 0.32498802205565885, "grad_norm": 9.375, "learning_rate": 3.880261718583171e-05, "loss": 0.5176889896392822, "mean_token_accuracy": 0.8661935655400157, "num_tokens": 40916775.0, "step": 20010 }, { "entropy": 0.5707350197248161, "epoch": 0.3251504348602844, "grad_norm": 8.6875, "learning_rate": 3.87918043083341e-05, "loss": 0.5853331089019775, "mean_token_accuracy": 0.8564554944634437, "num_tokens": 40938589.0, "step": 20020 }, { "entropy": 0.5551344627514482, "epoch": 0.3253128476649099, "grad_norm": 12.3125, "learning_rate": 3.8780987720810135e-05, "loss": 0.5574994087219238, "mean_token_accuracy": 0.8442889615893364, "num_tokens": 40959538.0, "step": 20030 }, { "entropy": 0.539919011760503, "epoch": 0.3254752604695354, "grad_norm": 8.4375, "learning_rate": 3.877016742616951e-05, "loss": 0.5372710704803467, "mean_token_accuracy": 0.8631287947297096, "num_tokens": 40980152.0, "step": 20040 }, { "entropy": 0.5584120092913508, "epoch": 0.32563767327416093, "grad_norm": 7.6875, "learning_rate": 3.875934342732289e-05, "loss": 0.5717068195343018, "mean_token_accuracy": 0.8580597907304763, "num_tokens": 40999864.0, "step": 20050 }, { "entropy": 0.616081522218883, "epoch": 0.32580008607878647, "grad_norm": 6.6875, "learning_rate": 3.8748515727181964e-05, "loss": 0.6341357707977295, "mean_token_accuracy": 0.8412978053092957, "num_tokens": 41019418.0, "step": 20060 }, { "entropy": 0.5850926938466727, "epoch": 0.32596249888341194, "grad_norm": 9.4375, "learning_rate": 3.873768432865942e-05, "loss": 0.6184796333312989, "mean_token_accuracy": 0.8462235383689404, "num_tokens": 41039609.0, "step": 20070 }, { "entropy": 0.533634114637971, "epoch": 0.3261249116880375, "grad_norm": 7.03125, "learning_rate": 3.872684923466891e-05, "loss": 0.5075406074523926, "mean_token_accuracy": 0.8738115198910237, "num_tokens": 41059630.0, "step": 20080 }, { "entropy": 0.5464841176290065, "epoch": 0.326287324492663, "grad_norm": 8.5, "learning_rate": 3.8716010448125106e-05, "loss": 0.5541236400604248, "mean_token_accuracy": 0.862818793207407, "num_tokens": 41080850.0, "step": 20090 }, { "entropy": 0.569511732365936, "epoch": 0.32644973729728854, "grad_norm": 6.21875, "learning_rate": 3.8705167971943676e-05, "loss": 0.5877649307250976, "mean_token_accuracy": 0.857048773765564, "num_tokens": 41103159.0, "step": 20100 }, { "entropy": 0.6059314062818885, "epoch": 0.326612150101914, "grad_norm": 8.75, "learning_rate": 3.8694321809041254e-05, "loss": 0.5983298778533935, "mean_token_accuracy": 0.8511995449662209, "num_tokens": 41124357.0, "step": 20110 }, { "entropy": 0.5439999983180315, "epoch": 0.32677456290653956, "grad_norm": 7.71875, "learning_rate": 3.8683471962335494e-05, "loss": 0.5570600509643555, "mean_token_accuracy": 0.8575830176472664, "num_tokens": 41144581.0, "step": 20120 }, { "entropy": 0.5316380645148456, "epoch": 0.3269369757111651, "grad_norm": 8.125, "learning_rate": 3.8672618434745016e-05, "loss": 0.5397607326507569, "mean_token_accuracy": 0.8645428784191609, "num_tokens": 41164880.0, "step": 20130 }, { "entropy": 0.5089918345678598, "epoch": 0.32709938851579057, "grad_norm": 5.8125, "learning_rate": 3.866176122918946e-05, "loss": 0.5502643585205078, "mean_token_accuracy": 0.8622263945639134, "num_tokens": 41185854.0, "step": 20140 }, { "entropy": 0.5675724079832435, "epoch": 0.3272618013204161, "grad_norm": 9.1875, "learning_rate": 3.865090034858942e-05, "loss": 0.5718104839324951, "mean_token_accuracy": 0.8518867403268814, "num_tokens": 41206482.0, "step": 20150 }, { "entropy": 0.5881489543244243, "epoch": 0.32742421412504163, "grad_norm": 6.375, "learning_rate": 3.8640035795866525e-05, "loss": 0.5723332405090332, "mean_token_accuracy": 0.8669893182814121, "num_tokens": 41226597.0, "step": 20160 }, { "entropy": 0.5522896509617568, "epoch": 0.3275866269296671, "grad_norm": 7.40625, "learning_rate": 3.8629167573943334e-05, "loss": 0.5575553417205811, "mean_token_accuracy": 0.8607357569038868, "num_tokens": 41246492.0, "step": 20170 }, { "entropy": 0.5054645639844239, "epoch": 0.32774903973429265, "grad_norm": 8.5625, "learning_rate": 3.8618295685743436e-05, "loss": 0.5064489364624023, "mean_token_accuracy": 0.8735892698168755, "num_tokens": 41265524.0, "step": 20180 }, { "entropy": 0.5575888625346124, "epoch": 0.3279114525389182, "grad_norm": 9.1875, "learning_rate": 3.86074201341914e-05, "loss": 0.5426346778869628, "mean_token_accuracy": 0.8707714308053255, "num_tokens": 41287850.0, "step": 20190 }, { "entropy": 0.5646102683618665, "epoch": 0.32807386534354366, "grad_norm": 8.9375, "learning_rate": 3.859654092221276e-05, "loss": 0.5689468383789062, "mean_token_accuracy": 0.848051880300045, "num_tokens": 41307815.0, "step": 20200 }, { "entropy": 0.5392456836998463, "epoch": 0.3282362781481692, "grad_norm": 10.0625, "learning_rate": 3.858565805273406e-05, "loss": 0.5314042568206787, "mean_token_accuracy": 0.8643523506820202, "num_tokens": 41328445.0, "step": 20210 }, { "entropy": 0.6064204074442386, "epoch": 0.3283986909527947, "grad_norm": 8.1875, "learning_rate": 3.8574771528682806e-05, "loss": 0.6308775424957276, "mean_token_accuracy": 0.8465713232755661, "num_tokens": 41349405.0, "step": 20220 }, { "entropy": 0.502283345349133, "epoch": 0.32856110375742026, "grad_norm": 8.25, "learning_rate": 3.8563881352987516e-05, "loss": 0.5050107955932617, "mean_token_accuracy": 0.8683884404599667, "num_tokens": 41369445.0, "step": 20230 }, { "entropy": 0.5671620949171483, "epoch": 0.32872351656204574, "grad_norm": 4.90625, "learning_rate": 3.855298752857764e-05, "loss": 0.5647209167480469, "mean_token_accuracy": 0.8586450040340423, "num_tokens": 41391232.0, "step": 20240 }, { "entropy": 0.6342523289844394, "epoch": 0.32888592936667127, "grad_norm": 6.53125, "learning_rate": 3.854209005838368e-05, "loss": 0.6508600234985351, "mean_token_accuracy": 0.8338122446089983, "num_tokens": 41412527.0, "step": 20250 }, { "entropy": 0.6246680040843785, "epoch": 0.3290483421712968, "grad_norm": 11.8125, "learning_rate": 3.853118894533705e-05, "loss": 0.6561876773834229, "mean_token_accuracy": 0.8361747726798058, "num_tokens": 41433210.0, "step": 20260 }, { "entropy": 0.6017771938815712, "epoch": 0.3292107549759223, "grad_norm": 13.5625, "learning_rate": 3.8520284192370195e-05, "loss": 0.6240430355072022, "mean_token_accuracy": 0.8496897026896477, "num_tokens": 41453950.0, "step": 20270 }, { "entropy": 0.5229405462741852, "epoch": 0.3293731677805478, "grad_norm": 6.84375, "learning_rate": 3.850937580241649e-05, "loss": 0.5229180812835693, "mean_token_accuracy": 0.8722349815070629, "num_tokens": 41473968.0, "step": 20280 }, { "entropy": 0.5189528007991612, "epoch": 0.32953558058517335, "grad_norm": 6.25, "learning_rate": 3.8498463778410346e-05, "loss": 0.5390919208526611, "mean_token_accuracy": 0.8588165313005447, "num_tokens": 41495041.0, "step": 20290 }, { "entropy": 0.4963974079117179, "epoch": 0.3296979933897988, "grad_norm": 10.0, "learning_rate": 3.84875481232871e-05, "loss": 0.49689221382141113, "mean_token_accuracy": 0.8699768863618373, "num_tokens": 41514329.0, "step": 20300 }, { "entropy": 0.5069220548961312, "epoch": 0.32986040619442436, "grad_norm": 5.59375, "learning_rate": 3.8476628839983106e-05, "loss": 0.5296567440032959, "mean_token_accuracy": 0.8658665500581264, "num_tokens": 41534674.0, "step": 20310 }, { "entropy": 0.5749042716808617, "epoch": 0.3300228189990499, "grad_norm": 6.59375, "learning_rate": 3.846570593143566e-05, "loss": 0.5957942962646484, "mean_token_accuracy": 0.8556736081838607, "num_tokens": 41555557.0, "step": 20320 }, { "entropy": 0.562180996593088, "epoch": 0.3301852318036754, "grad_norm": 7.6875, "learning_rate": 3.845477940058307e-05, "loss": 0.587843656539917, "mean_token_accuracy": 0.8556431740522384, "num_tokens": 41576400.0, "step": 20330 }, { "entropy": 0.5460783205926418, "epoch": 0.3303476446083009, "grad_norm": 10.3125, "learning_rate": 3.844384925036457e-05, "loss": 0.529017162322998, "mean_token_accuracy": 0.8624743930995464, "num_tokens": 41597303.0, "step": 20340 }, { "entropy": 0.6169278368353843, "epoch": 0.33051005741292644, "grad_norm": 8.1875, "learning_rate": 3.843291548372041e-05, "loss": 0.614155387878418, "mean_token_accuracy": 0.8594807602465153, "num_tokens": 41616974.0, "step": 20350 }, { "entropy": 0.5893424484878779, "epoch": 0.330672470217552, "grad_norm": 11.0, "learning_rate": 3.84219781035918e-05, "loss": 0.5875109195709228, "mean_token_accuracy": 0.8550508454442024, "num_tokens": 41637824.0, "step": 20360 }, { "entropy": 0.6058869617059827, "epoch": 0.33083488302217745, "grad_norm": 5.71875, "learning_rate": 3.841103711292092e-05, "loss": 0.5774574279785156, "mean_token_accuracy": 0.8547391809523106, "num_tokens": 41659031.0, "step": 20370 }, { "entropy": 0.5102329127956182, "epoch": 0.330997295826803, "grad_norm": 7.0, "learning_rate": 3.8400092514650913e-05, "loss": 0.5139196872711181, "mean_token_accuracy": 0.8710854962468147, "num_tokens": 41679457.0, "step": 20380 }, { "entropy": 0.5354670776519924, "epoch": 0.3311597086314285, "grad_norm": 8.3125, "learning_rate": 3.83891443117259e-05, "loss": 0.5355747699737549, "mean_token_accuracy": 0.8689523614943028, "num_tokens": 41699438.0, "step": 20390 }, { "entropy": 0.5157699976116419, "epoch": 0.331322121436054, "grad_norm": 9.125, "learning_rate": 3.837819250709098e-05, "loss": 0.5157564640045166, "mean_token_accuracy": 0.8631924841552973, "num_tokens": 41719843.0, "step": 20400 }, { "entropy": 0.52330502262339, "epoch": 0.33148453424067953, "grad_norm": 8.0, "learning_rate": 3.836723710369222e-05, "loss": 0.5508649349212646, "mean_token_accuracy": 0.857424645870924, "num_tokens": 41739707.0, "step": 20410 }, { "entropy": 0.5078095159493387, "epoch": 0.33164694704530506, "grad_norm": 6.125, "learning_rate": 3.8356278104476625e-05, "loss": 0.48797106742858887, "mean_token_accuracy": 0.8688635788857937, "num_tokens": 41761207.0, "step": 20420 }, { "entropy": 0.5987143235281109, "epoch": 0.33180935984993054, "grad_norm": 7.71875, "learning_rate": 3.8345315512392207e-05, "loss": 0.614687728881836, "mean_token_accuracy": 0.8451770409941674, "num_tokens": 41782234.0, "step": 20430 }, { "entropy": 0.4992811969481409, "epoch": 0.3319717726545561, "grad_norm": 8.0, "learning_rate": 3.833434933038793e-05, "loss": 0.49220967292785645, "mean_token_accuracy": 0.8720801621675491, "num_tokens": 41801808.0, "step": 20440 }, { "entropy": 0.5571612041443587, "epoch": 0.3321341854591816, "grad_norm": 7.1875, "learning_rate": 3.832337956141371e-05, "loss": 0.5701161861419678, "mean_token_accuracy": 0.8564592488110065, "num_tokens": 41822603.0, "step": 20450 }, { "entropy": 0.5115193566307425, "epoch": 0.33229659826380714, "grad_norm": 9.0, "learning_rate": 3.8312406208420445e-05, "loss": 0.5746944427490235, "mean_token_accuracy": 0.862982577085495, "num_tokens": 41842810.0, "step": 20460 }, { "entropy": 0.5494257669895888, "epoch": 0.3324590110684326, "grad_norm": 6.15625, "learning_rate": 3.830142927435999e-05, "loss": 0.5464491367340087, "mean_token_accuracy": 0.8553936511278153, "num_tokens": 41862867.0, "step": 20470 }, { "entropy": 0.5794742895290256, "epoch": 0.33262142387305815, "grad_norm": 8.0625, "learning_rate": 3.829044876218517e-05, "loss": 0.5548861503601075, "mean_token_accuracy": 0.8602238148450851, "num_tokens": 41883249.0, "step": 20480 }, { "entropy": 0.5690852659754455, "epoch": 0.3327838366776837, "grad_norm": 6.5, "learning_rate": 3.827946467484978e-05, "loss": 0.5930018901824952, "mean_token_accuracy": 0.8515468046069146, "num_tokens": 41904232.0, "step": 20490 }, { "entropy": 0.5621062159538269, "epoch": 0.33294624948230916, "grad_norm": 9.5625, "learning_rate": 3.8268477015308526e-05, "loss": 0.5763182640075684, "mean_token_accuracy": 0.8545185789465904, "num_tokens": 41925240.0, "step": 20500 }, { "entropy": 0.5822457010392099, "epoch": 0.3331086622869347, "grad_norm": 8.0625, "learning_rate": 3.825748578651714e-05, "loss": 0.5645479679107666, "mean_token_accuracy": 0.8548313274979591, "num_tokens": 41944654.0, "step": 20510 }, { "entropy": 0.580738668749109, "epoch": 0.33327107509156023, "grad_norm": 8.0, "learning_rate": 3.824649099143229e-05, "loss": 0.594007921218872, "mean_token_accuracy": 0.85033935084939, "num_tokens": 41966380.0, "step": 20520 }, { "entropy": 0.5456235494464636, "epoch": 0.3334334878961857, "grad_norm": 6.1875, "learning_rate": 3.8235492633011596e-05, "loss": 0.517634105682373, "mean_token_accuracy": 0.869189316779375, "num_tokens": 41987528.0, "step": 20530 }, { "entropy": 0.546254996350035, "epoch": 0.33359590070081124, "grad_norm": 7.375, "learning_rate": 3.8224490714213626e-05, "loss": 0.5575330257415771, "mean_token_accuracy": 0.8636027194559575, "num_tokens": 42007339.0, "step": 20540 }, { "entropy": 0.47852977802976965, "epoch": 0.3337583135054368, "grad_norm": 10.0625, "learning_rate": 3.8213485237997944e-05, "loss": 0.4823010444641113, "mean_token_accuracy": 0.8742073811590672, "num_tokens": 42028145.0, "step": 20550 }, { "entropy": 0.581709171179682, "epoch": 0.3339207263100623, "grad_norm": 8.625, "learning_rate": 3.8202476207325036e-05, "loss": 0.6190417766571045, "mean_token_accuracy": 0.8381850473582745, "num_tokens": 42047891.0, "step": 20560 }, { "entropy": 0.5712052478455008, "epoch": 0.3340831391146878, "grad_norm": 7.625, "learning_rate": 3.8191463625156354e-05, "loss": 0.580459451675415, "mean_token_accuracy": 0.85219143666327, "num_tokens": 42067879.0, "step": 20570 }, { "entropy": 0.5726041273213923, "epoch": 0.3342455519193133, "grad_norm": 6.25, "learning_rate": 3.818044749445432e-05, "loss": 0.5721821308135986, "mean_token_accuracy": 0.8524363044649362, "num_tokens": 42088497.0, "step": 20580 }, { "entropy": 0.5534457415342331, "epoch": 0.33440796472393886, "grad_norm": 8.25, "learning_rate": 3.816942781818228e-05, "loss": 0.5509944438934327, "mean_token_accuracy": 0.8607300028204918, "num_tokens": 42109350.0, "step": 20590 }, { "entropy": 0.5477527287788689, "epoch": 0.33457037752856433, "grad_norm": 6.4375, "learning_rate": 3.815840459930456e-05, "loss": 0.5754600048065186, "mean_token_accuracy": 0.8637143053114414, "num_tokens": 42130375.0, "step": 20600 }, { "entropy": 0.5319512112531811, "epoch": 0.33473279033318987, "grad_norm": 6.15625, "learning_rate": 3.8147377840786435e-05, "loss": 0.49176802635192873, "mean_token_accuracy": 0.8773545492440462, "num_tokens": 42151380.0, "step": 20610 }, { "entropy": 0.5461848322302103, "epoch": 0.3348952031378154, "grad_norm": 4.6875, "learning_rate": 3.813634754559412e-05, "loss": 0.5768444061279296, "mean_token_accuracy": 0.8608327001333237, "num_tokens": 42172391.0, "step": 20620 }, { "entropy": 0.5714185600169003, "epoch": 0.3350576159424409, "grad_norm": 9.125, "learning_rate": 3.81253137166948e-05, "loss": 0.5906174182891846, "mean_token_accuracy": 0.8592486258596181, "num_tokens": 42192915.0, "step": 20630 }, { "entropy": 0.5490285479463637, "epoch": 0.3352200287470664, "grad_norm": 10.375, "learning_rate": 3.811427635705659e-05, "loss": 0.5687652587890625, "mean_token_accuracy": 0.8604401141405106, "num_tokens": 42213135.0, "step": 20640 }, { "entropy": 0.5097557628527284, "epoch": 0.33538244155169195, "grad_norm": 14.25, "learning_rate": 3.8103235469648565e-05, "loss": 0.5130792140960694, "mean_token_accuracy": 0.8737553738057613, "num_tokens": 42232997.0, "step": 20650 }, { "entropy": 0.5026414898224175, "epoch": 0.3355448543563175, "grad_norm": 8.5, "learning_rate": 3.809219105744075e-05, "loss": 0.5358746528625489, "mean_token_accuracy": 0.8633633837103843, "num_tokens": 42253622.0, "step": 20660 }, { "entropy": 0.5592889266088605, "epoch": 0.33570726716094296, "grad_norm": 8.0625, "learning_rate": 3.808114312340412e-05, "loss": 0.5412032127380371, "mean_token_accuracy": 0.8701852299273014, "num_tokens": 42273935.0, "step": 20670 }, { "entropy": 0.5344620172400028, "epoch": 0.3358696799655685, "grad_norm": 7.53125, "learning_rate": 3.807009167051059e-05, "loss": 0.5496950149536133, "mean_token_accuracy": 0.8611288610845804, "num_tokens": 42293479.0, "step": 20680 }, { "entropy": 0.5664816641714424, "epoch": 0.336032092770194, "grad_norm": 6.65625, "learning_rate": 3.805903670173303e-05, "loss": 0.5592621803283692, "mean_token_accuracy": 0.8634056583046913, "num_tokens": 42313415.0, "step": 20690 }, { "entropy": 0.5659895903430879, "epoch": 0.3361945055748195, "grad_norm": 7.21875, "learning_rate": 3.804797822004525e-05, "loss": 0.5717123508453369, "mean_token_accuracy": 0.8568331733345985, "num_tokens": 42335556.0, "step": 20700 }, { "entropy": 0.5611231119371951, "epoch": 0.33635691837944504, "grad_norm": 8.375, "learning_rate": 3.8036916228422e-05, "loss": 0.5660227775573731, "mean_token_accuracy": 0.8578096784651279, "num_tokens": 42355716.0, "step": 20710 }, { "entropy": 0.5736502340063453, "epoch": 0.33651933118407057, "grad_norm": 9.1875, "learning_rate": 3.8025850729838995e-05, "loss": 0.5795518398284912, "mean_token_accuracy": 0.8586622409522533, "num_tokens": 42376357.0, "step": 20720 }, { "entropy": 0.5585266957990825, "epoch": 0.33668174398869605, "grad_norm": 6.90625, "learning_rate": 3.801478172727286e-05, "loss": 0.5670055389404297, "mean_token_accuracy": 0.854182193800807, "num_tokens": 42396614.0, "step": 20730 }, { "entropy": 0.5456746683456004, "epoch": 0.3368441567933216, "grad_norm": 7.75, "learning_rate": 3.80037092237012e-05, "loss": 0.5159268856048584, "mean_token_accuracy": 0.8610098365694284, "num_tokens": 42417146.0, "step": 20740 }, { "entropy": 0.5509303160011768, "epoch": 0.3370065695979471, "grad_norm": 8.0, "learning_rate": 3.7992633222102525e-05, "loss": 0.5614491939544678, "mean_token_accuracy": 0.8674316138029099, "num_tokens": 42437178.0, "step": 20750 }, { "entropy": 0.5054333887062967, "epoch": 0.3371689824025726, "grad_norm": 8.5, "learning_rate": 3.798155372545632e-05, "loss": 0.5196519374847413, "mean_token_accuracy": 0.8699027933180332, "num_tokens": 42456628.0, "step": 20760 }, { "entropy": 0.5985231728293001, "epoch": 0.3373313952071981, "grad_norm": 10.5, "learning_rate": 3.797047073674299e-05, "loss": 0.5708291530609131, "mean_token_accuracy": 0.8559908423572778, "num_tokens": 42476580.0, "step": 20770 }, { "entropy": 0.5735493028070777, "epoch": 0.33749380801182366, "grad_norm": 11.8125, "learning_rate": 3.7959384258943885e-05, "loss": 0.6453959465026855, "mean_token_accuracy": 0.8479140192270279, "num_tokens": 42495898.0, "step": 20780 }, { "entropy": 0.5782978703733533, "epoch": 0.3376562208164492, "grad_norm": 6.4375, "learning_rate": 3.794829429504129e-05, "loss": 0.6096779346466065, "mean_token_accuracy": 0.8540595714002848, "num_tokens": 42516222.0, "step": 20790 }, { "entropy": 0.5651690520811826, "epoch": 0.33781863362107467, "grad_norm": 7.125, "learning_rate": 3.793720084801842e-05, "loss": 0.5304489612579346, "mean_token_accuracy": 0.86651796028018, "num_tokens": 42536450.0, "step": 20800 }, { "entropy": 0.6439645347185433, "epoch": 0.3379810464257002, "grad_norm": 7.25, "learning_rate": 3.792610392085945e-05, "loss": 0.6724597930908203, "mean_token_accuracy": 0.8360070049762726, "num_tokens": 42557052.0, "step": 20810 }, { "entropy": 0.5568502291571349, "epoch": 0.33814345923032574, "grad_norm": 6.71875, "learning_rate": 3.791500351654948e-05, "loss": 0.5513248443603516, "mean_token_accuracy": 0.8574566349387169, "num_tokens": 42579272.0, "step": 20820 }, { "entropy": 0.5631507073529065, "epoch": 0.3383058720349512, "grad_norm": 10.0625, "learning_rate": 3.790389963807454e-05, "loss": 0.5373784065246582, "mean_token_accuracy": 0.86322673112154, "num_tokens": 42599724.0, "step": 20830 }, { "entropy": 0.5501909313956276, "epoch": 0.33846828483957675, "grad_norm": 7.9375, "learning_rate": 3.78927922884216e-05, "loss": 0.5373705387115478, "mean_token_accuracy": 0.8663251385092735, "num_tokens": 42620249.0, "step": 20840 }, { "entropy": 0.5444812235422433, "epoch": 0.3386306976442023, "grad_norm": 8.1875, "learning_rate": 3.788168147057855e-05, "loss": 0.5472448348999024, "mean_token_accuracy": 0.8618907168507576, "num_tokens": 42642462.0, "step": 20850 }, { "entropy": 0.6104479443281889, "epoch": 0.33879311044882776, "grad_norm": 8.25, "learning_rate": 3.7870567187534246e-05, "loss": 0.6048952579498291, "mean_token_accuracy": 0.8479999653995037, "num_tokens": 42663095.0, "step": 20860 }, { "entropy": 0.5369756100699306, "epoch": 0.3389555232534533, "grad_norm": 8.5, "learning_rate": 3.7859449442278436e-05, "loss": 0.5424748420715332, "mean_token_accuracy": 0.8623659722507, "num_tokens": 42682475.0, "step": 20870 }, { "entropy": 0.5654821131378412, "epoch": 0.33911793605807883, "grad_norm": 7.8125, "learning_rate": 3.784832823780182e-05, "loss": 0.5445939540863037, "mean_token_accuracy": 0.8635365940630436, "num_tokens": 42703284.0, "step": 20880 }, { "entropy": 0.5717876829206944, "epoch": 0.33928034886270436, "grad_norm": 7.125, "learning_rate": 3.783720357709605e-05, "loss": 0.6143857955932617, "mean_token_accuracy": 0.8466533958911896, "num_tokens": 42724096.0, "step": 20890 }, { "entropy": 0.5461292976047843, "epoch": 0.33944276166732984, "grad_norm": 6.34375, "learning_rate": 3.782607546315366e-05, "loss": 0.5192225933074951, "mean_token_accuracy": 0.8664758950471878, "num_tokens": 42744813.0, "step": 20900 }, { "entropy": 0.5342408258002251, "epoch": 0.3396051744719554, "grad_norm": 7.125, "learning_rate": 3.781494389896814e-05, "loss": 0.5185364723205567, "mean_token_accuracy": 0.8655607536435127, "num_tokens": 42766427.0, "step": 20910 }, { "entropy": 0.4996810111217201, "epoch": 0.3397675872765809, "grad_norm": 7.3125, "learning_rate": 3.780380888753392e-05, "loss": 0.5234630584716797, "mean_token_accuracy": 0.8690463855862618, "num_tokens": 42787462.0, "step": 20920 }, { "entropy": 0.5432744802441448, "epoch": 0.3399300000812064, "grad_norm": 6.34375, "learning_rate": 3.779267043184633e-05, "loss": 0.5768684387207031, "mean_token_accuracy": 0.8520784880965948, "num_tokens": 42808282.0, "step": 20930 }, { "entropy": 0.5169015765190125, "epoch": 0.3400924128858319, "grad_norm": 6.40625, "learning_rate": 3.7781528534901646e-05, "loss": 0.5006703853607177, "mean_token_accuracy": 0.8721001140773297, "num_tokens": 42828619.0, "step": 20940 }, { "entropy": 0.5533454094082118, "epoch": 0.34025482569045745, "grad_norm": 11.75, "learning_rate": 3.777038319969706e-05, "loss": 0.5154829502105713, "mean_token_accuracy": 0.8614557649940252, "num_tokens": 42849112.0, "step": 20950 }, { "entropy": 0.4907979262061417, "epoch": 0.34041723849508293, "grad_norm": 7.53125, "learning_rate": 3.7759234429230696e-05, "loss": 0.5211287021636963, "mean_token_accuracy": 0.8582017160952091, "num_tokens": 42868762.0, "step": 20960 }, { "entropy": 0.4907255725003779, "epoch": 0.34057965129970846, "grad_norm": 7.53125, "learning_rate": 3.7748082226501593e-05, "loss": 0.49332122802734374, "mean_token_accuracy": 0.8721557080745697, "num_tokens": 42888764.0, "step": 20970 }, { "entropy": 0.5641098922118545, "epoch": 0.340742064104334, "grad_norm": 8.4375, "learning_rate": 3.773692659450972e-05, "loss": 0.5899402141571045, "mean_token_accuracy": 0.8526029475033283, "num_tokens": 42909490.0, "step": 20980 }, { "entropy": 0.5195209678262472, "epoch": 0.3409044769089595, "grad_norm": 7.875, "learning_rate": 3.7725767536255976e-05, "loss": 0.5608676910400391, "mean_token_accuracy": 0.8601963382214308, "num_tokens": 42930394.0, "step": 20990 }, { "entropy": 0.4971170451492071, "epoch": 0.341066889713585, "grad_norm": 8.4375, "learning_rate": 3.7714605054742154e-05, "loss": 0.5011800765991211, "mean_token_accuracy": 0.8665483504533767, "num_tokens": 42950870.0, "step": 21000 }, { "entropy": 0.6138926239684224, "epoch": 0.34122930251821054, "grad_norm": 9.0, "learning_rate": 3.770343915297101e-05, "loss": 0.6509011268615723, "mean_token_accuracy": 0.8378890212625265, "num_tokens": 42971682.0, "step": 21010 }, { "entropy": 0.4860070194117725, "epoch": 0.3413917153228361, "grad_norm": 6.03125, "learning_rate": 3.769226983394617e-05, "loss": 0.4814160346984863, "mean_token_accuracy": 0.8700296960771083, "num_tokens": 42993433.0, "step": 21020 }, { "entropy": 0.5010112621821463, "epoch": 0.34155412812746155, "grad_norm": 9.75, "learning_rate": 3.768109710067224e-05, "loss": 0.47664618492126465, "mean_token_accuracy": 0.8822697527706623, "num_tokens": 43013261.0, "step": 21030 }, { "entropy": 0.5282897782512009, "epoch": 0.3417165409320871, "grad_norm": 7.09375, "learning_rate": 3.7669920956154675e-05, "loss": 0.5546607971191406, "mean_token_accuracy": 0.8562342844903469, "num_tokens": 43032826.0, "step": 21040 }, { "entropy": 0.5296033099293709, "epoch": 0.3418789537367126, "grad_norm": 14.3125, "learning_rate": 3.7658741403399907e-05, "loss": 0.5320944786071777, "mean_token_accuracy": 0.861217838525772, "num_tokens": 43052675.0, "step": 21050 }, { "entropy": 0.48334149033762513, "epoch": 0.3420413665413381, "grad_norm": 8.1875, "learning_rate": 3.764755844541526e-05, "loss": 0.4809300422668457, "mean_token_accuracy": 0.8720012940466404, "num_tokens": 43072423.0, "step": 21060 }, { "entropy": 0.5509046551305801, "epoch": 0.34220377934596363, "grad_norm": 8.8125, "learning_rate": 3.763637208520894e-05, "loss": 0.5834864139556885, "mean_token_accuracy": 0.8508333615958691, "num_tokens": 43094223.0, "step": 21070 }, { "entropy": 0.5801546820439398, "epoch": 0.34236619215058917, "grad_norm": 10.4375, "learning_rate": 3.762518232579015e-05, "loss": 0.5965095043182373, "mean_token_accuracy": 0.8504482470452785, "num_tokens": 43114577.0, "step": 21080 }, { "entropy": 0.500376574555412, "epoch": 0.34252860495521464, "grad_norm": 8.4375, "learning_rate": 3.7613989170168945e-05, "loss": 0.47359442710876465, "mean_token_accuracy": 0.8767856165766716, "num_tokens": 43135200.0, "step": 21090 }, { "entropy": 0.5051122381351888, "epoch": 0.3426910177598402, "grad_norm": 8.25, "learning_rate": 3.76027926213563e-05, "loss": 0.4842665672302246, "mean_token_accuracy": 0.8753570772707462, "num_tokens": 43155354.0, "step": 21100 }, { "entropy": 0.5315281203947961, "epoch": 0.3428534305644657, "grad_norm": 6.875, "learning_rate": 3.759159268236412e-05, "loss": 0.5438448905944824, "mean_token_accuracy": 0.8609080240130424, "num_tokens": 43174756.0, "step": 21110 }, { "entropy": 0.5070532309822738, "epoch": 0.34301584336909124, "grad_norm": 6.5, "learning_rate": 3.7580389356205205e-05, "loss": 0.5295492649078369, "mean_token_accuracy": 0.8644339330494404, "num_tokens": 43195146.0, "step": 21120 }, { "entropy": 0.5052597049623728, "epoch": 0.3431782561737167, "grad_norm": 7.09375, "learning_rate": 3.756918264589329e-05, "loss": 0.5092920303344727, "mean_token_accuracy": 0.8674265153706073, "num_tokens": 43216168.0, "step": 21130 }, { "entropy": 0.5324864949099719, "epoch": 0.34334066897834226, "grad_norm": 9.4375, "learning_rate": 3.755797255444298e-05, "loss": 0.5399191379547119, "mean_token_accuracy": 0.8678036272525788, "num_tokens": 43235988.0, "step": 21140 }, { "entropy": 0.5012240679003298, "epoch": 0.3435030817829678, "grad_norm": 7.34375, "learning_rate": 3.7546759084869834e-05, "loss": 0.5233304500579834, "mean_token_accuracy": 0.859471607208252, "num_tokens": 43256656.0, "step": 21150 }, { "entropy": 0.574106779973954, "epoch": 0.34366549458759327, "grad_norm": 6.1875, "learning_rate": 3.75355422401903e-05, "loss": 0.5541740894317627, "mean_token_accuracy": 0.8537972375750542, "num_tokens": 43277141.0, "step": 21160 }, { "entropy": 0.5159168996848166, "epoch": 0.3438279073922188, "grad_norm": 7.46875, "learning_rate": 3.7524322023421744e-05, "loss": 0.5284635066986084, "mean_token_accuracy": 0.8674596942961216, "num_tokens": 43298387.0, "step": 21170 }, { "entropy": 0.5503235080279409, "epoch": 0.34399032019684433, "grad_norm": 12.875, "learning_rate": 3.75130984375824e-05, "loss": 0.5595190525054932, "mean_token_accuracy": 0.8490270659327507, "num_tokens": 43319510.0, "step": 21180 }, { "entropy": 0.570077950321138, "epoch": 0.3441527330014698, "grad_norm": 9.125, "learning_rate": 3.7501871485691465e-05, "loss": 0.5637058258056641, "mean_token_accuracy": 0.8543650805950165, "num_tokens": 43339645.0, "step": 21190 }, { "entropy": 0.5571671977639199, "epoch": 0.34431514580609535, "grad_norm": 9.4375, "learning_rate": 3.7490641170769e-05, "loss": 0.552903127670288, "mean_token_accuracy": 0.8631694979965687, "num_tokens": 43360985.0, "step": 21200 }, { "entropy": 0.5670518563594669, "epoch": 0.3444775586107209, "grad_norm": 7.8125, "learning_rate": 3.747940749583599e-05, "loss": 0.5864743709564209, "mean_token_accuracy": 0.8530047971755266, "num_tokens": 43382664.0, "step": 21210 }, { "entropy": 0.5779545023571699, "epoch": 0.3446399714153464, "grad_norm": 11.0, "learning_rate": 3.7468170463914314e-05, "loss": 0.6344746589660645, "mean_token_accuracy": 0.8477489799261093, "num_tokens": 43404657.0, "step": 21220 }, { "entropy": 0.5779235538095235, "epoch": 0.3448023842199719, "grad_norm": 5.59375, "learning_rate": 3.745693007802677e-05, "loss": 0.6117434024810791, "mean_token_accuracy": 0.8496381796896457, "num_tokens": 43425324.0, "step": 21230 }, { "entropy": 0.56191716035828, "epoch": 0.3449647970245974, "grad_norm": 9.8125, "learning_rate": 3.744568634119704e-05, "loss": 0.558140230178833, "mean_token_accuracy": 0.8561855968087911, "num_tokens": 43445987.0, "step": 21240 }, { "entropy": 0.5502116495743394, "epoch": 0.34512720982922296, "grad_norm": 5.9375, "learning_rate": 3.74344392564497e-05, "loss": 0.5209548473358154, "mean_token_accuracy": 0.8719334699213505, "num_tokens": 43465646.0, "step": 21250 }, { "entropy": 0.5691877705976367, "epoch": 0.34528962263384844, "grad_norm": 6.71875, "learning_rate": 3.742318882681027e-05, "loss": 0.5437555313110352, "mean_token_accuracy": 0.8581645138561725, "num_tokens": 43487006.0, "step": 21260 }, { "entropy": 0.5894635946024209, "epoch": 0.34545203543847397, "grad_norm": 9.125, "learning_rate": 3.741193505530513e-05, "loss": 0.5693212032318116, "mean_token_accuracy": 0.8525977946817875, "num_tokens": 43506851.0, "step": 21270 }, { "entropy": 0.4519010942429304, "epoch": 0.3456144482430995, "grad_norm": 6.78125, "learning_rate": 3.7400677944961557e-05, "loss": 0.4853959083557129, "mean_token_accuracy": 0.8798061981797218, "num_tokens": 43527005.0, "step": 21280 }, { "entropy": 0.5040416173171252, "epoch": 0.345776861047725, "grad_norm": 10.5, "learning_rate": 3.7389417498807746e-05, "loss": 0.5110989570617676, "mean_token_accuracy": 0.8601395882666111, "num_tokens": 43547377.0, "step": 21290 }, { "entropy": 0.47961400989443065, "epoch": 0.3459392738523505, "grad_norm": 9.6875, "learning_rate": 3.737815371987279e-05, "loss": 0.5103609085083007, "mean_token_accuracy": 0.871604447811842, "num_tokens": 43568198.0, "step": 21300 }, { "entropy": 0.529077723575756, "epoch": 0.34610168665697605, "grad_norm": 9.9375, "learning_rate": 3.736688661118666e-05, "loss": 0.538639497756958, "mean_token_accuracy": 0.8583280898630619, "num_tokens": 43588617.0, "step": 21310 }, { "entropy": 0.5430535471066833, "epoch": 0.3462640994616015, "grad_norm": 7.71875, "learning_rate": 3.735561617578024e-05, "loss": 0.5266341686248779, "mean_token_accuracy": 0.8575321979820728, "num_tokens": 43609496.0, "step": 21320 }, { "entropy": 0.5389159864746034, "epoch": 0.34642651226622706, "grad_norm": 7.0, "learning_rate": 3.7344342416685304e-05, "loss": 0.519633150100708, "mean_token_accuracy": 0.8588675782084465, "num_tokens": 43630704.0, "step": 21330 }, { "entropy": 0.5120542561169714, "epoch": 0.3465889250708526, "grad_norm": 6.40625, "learning_rate": 3.7333065336934515e-05, "loss": 0.5246307373046875, "mean_token_accuracy": 0.8666411295533181, "num_tokens": 43649862.0, "step": 21340 }, { "entropy": 0.6195092142559588, "epoch": 0.3467513378754781, "grad_norm": 7.34375, "learning_rate": 3.732178493956143e-05, "loss": 0.6885006427764893, "mean_token_accuracy": 0.8250632867217064, "num_tokens": 43669687.0, "step": 21350 }, { "entropy": 0.6005741259083152, "epoch": 0.3469137506801036, "grad_norm": 8.875, "learning_rate": 3.7310501227600515e-05, "loss": 0.5819031238555908, "mean_token_accuracy": 0.8553003333508968, "num_tokens": 43690942.0, "step": 21360 }, { "entropy": 0.5737603027839213, "epoch": 0.34707616348472914, "grad_norm": 8.3125, "learning_rate": 3.729921420408709e-05, "loss": 0.5572847366333008, "mean_token_accuracy": 0.8666542716324329, "num_tokens": 43712678.0, "step": 21370 }, { "entropy": 0.5865101933944971, "epoch": 0.3472385762893547, "grad_norm": 9.1875, "learning_rate": 3.728792387205741e-05, "loss": 0.6006796836853028, "mean_token_accuracy": 0.851875352114439, "num_tokens": 43732947.0, "step": 21380 }, { "entropy": 0.48164226887747646, "epoch": 0.34740098909398015, "grad_norm": 10.125, "learning_rate": 3.727663023454859e-05, "loss": 0.48984537124633787, "mean_token_accuracy": 0.868570027500391, "num_tokens": 43752766.0, "step": 21390 }, { "entropy": 0.48823147965595126, "epoch": 0.3475634018986057, "grad_norm": 7.78125, "learning_rate": 3.7265333294598656e-05, "loss": 0.4858410358428955, "mean_token_accuracy": 0.8801802046597004, "num_tokens": 43771542.0, "step": 21400 }, { "entropy": 0.5525647732429206, "epoch": 0.3477258147032312, "grad_norm": 8.8125, "learning_rate": 3.725403305524649e-05, "loss": 0.5387996196746826, "mean_token_accuracy": 0.8682037949562073, "num_tokens": 43790525.0, "step": 21410 }, { "entropy": 0.47912707990035414, "epoch": 0.3478882275078567, "grad_norm": 7.84375, "learning_rate": 3.72427295195319e-05, "loss": 0.4974337100982666, "mean_token_accuracy": 0.8760239653289318, "num_tokens": 43810732.0, "step": 21420 }, { "entropy": 0.4995779213262722, "epoch": 0.34805064031248223, "grad_norm": 5.84375, "learning_rate": 3.723142269049556e-05, "loss": 0.4735243797302246, "mean_token_accuracy": 0.8807542406022548, "num_tokens": 43831517.0, "step": 21430 }, { "entropy": 0.5473405677825213, "epoch": 0.34821305311710776, "grad_norm": 7.40625, "learning_rate": 3.7220112571179015e-05, "loss": 0.5550507545471192, "mean_token_accuracy": 0.8586175017058849, "num_tokens": 43851490.0, "step": 21440 }, { "entropy": 0.5400142607744783, "epoch": 0.3483754659217333, "grad_norm": 9.25, "learning_rate": 3.720879916462473e-05, "loss": 0.578197431564331, "mean_token_accuracy": 0.8527533613145352, "num_tokens": 43871548.0, "step": 21450 }, { "entropy": 0.5078492473810912, "epoch": 0.3485378787263588, "grad_norm": 6.21875, "learning_rate": 3.719748247387603e-05, "loss": 0.5176805973052978, "mean_token_accuracy": 0.8761091165244579, "num_tokens": 43891660.0, "step": 21460 }, { "entropy": 0.48810845194384456, "epoch": 0.3487002915309843, "grad_norm": 6.6875, "learning_rate": 3.718616250197714e-05, "loss": 0.5015100479125977, "mean_token_accuracy": 0.8648010976612568, "num_tokens": 43912005.0, "step": 21470 }, { "entropy": 0.47190925776958464, "epoch": 0.34886270433560984, "grad_norm": 7.78125, "learning_rate": 3.717483925197315e-05, "loss": 0.4817328453063965, "mean_token_accuracy": 0.876376535743475, "num_tokens": 43931396.0, "step": 21480 }, { "entropy": 0.529636730439961, "epoch": 0.3490251171402353, "grad_norm": 7.03125, "learning_rate": 3.716351272691003e-05, "loss": 0.5204188823699951, "mean_token_accuracy": 0.8676709145307541, "num_tokens": 43950996.0, "step": 21490 }, { "entropy": 0.5262589151039719, "epoch": 0.34918752994486085, "grad_norm": 7.25, "learning_rate": 3.715218292983466e-05, "loss": 0.543371057510376, "mean_token_accuracy": 0.8545373544096947, "num_tokens": 43972637.0, "step": 21500 }, { "entropy": 0.5064210678450763, "epoch": 0.3493499427494864, "grad_norm": 6.40625, "learning_rate": 3.714084986379477e-05, "loss": 0.4744619369506836, "mean_token_accuracy": 0.8743989668786526, "num_tokens": 43992250.0, "step": 21510 }, { "entropy": 0.5680611081887037, "epoch": 0.34951235555411186, "grad_norm": 9.875, "learning_rate": 3.712951353183898e-05, "loss": 0.5830663681030274, "mean_token_accuracy": 0.863859997689724, "num_tokens": 44013218.0, "step": 21520 }, { "entropy": 0.4360484509263188, "epoch": 0.3496747683587374, "grad_norm": 4.90625, "learning_rate": 3.711817393701679e-05, "loss": 0.4132223606109619, "mean_token_accuracy": 0.885017243027687, "num_tokens": 44032874.0, "step": 21530 }, { "entropy": 0.5024894583038986, "epoch": 0.34983718116336293, "grad_norm": 9.6875, "learning_rate": 3.710683108237858e-05, "loss": 0.4771139144897461, "mean_token_accuracy": 0.8795409981161356, "num_tokens": 44052713.0, "step": 21540 }, { "entropy": 0.5225233669392765, "epoch": 0.3499995939679884, "grad_norm": 7.28125, "learning_rate": 3.709548497097559e-05, "loss": 0.5286216735839844, "mean_token_accuracy": 0.8644353672862053, "num_tokens": 44073299.0, "step": 21550 }, { "entropy": 0.55095727564767, "epoch": 0.35016200677261394, "grad_norm": 7.0, "learning_rate": 3.708413560585997e-05, "loss": 0.5868868350982666, "mean_token_accuracy": 0.851996437460184, "num_tokens": 44094358.0, "step": 21560 }, { "entropy": 0.5585955049376935, "epoch": 0.3503244195772395, "grad_norm": 7.65625, "learning_rate": 3.707278299008471e-05, "loss": 0.5599225997924805, "mean_token_accuracy": 0.8577305674552917, "num_tokens": 44115192.0, "step": 21570 }, { "entropy": 0.5963627215474844, "epoch": 0.350486832381865, "grad_norm": 16.125, "learning_rate": 3.70614271267037e-05, "loss": 0.6331636428833007, "mean_token_accuracy": 0.8444083340466022, "num_tokens": 44135218.0, "step": 21580 }, { "entropy": 0.5134365015197545, "epoch": 0.3506492451864905, "grad_norm": 9.0625, "learning_rate": 3.7050068018771685e-05, "loss": 0.5529001235961915, "mean_token_accuracy": 0.8635319948196412, "num_tokens": 44154868.0, "step": 21590 }, { "entropy": 0.5415897570550442, "epoch": 0.350811657991116, "grad_norm": 7.6875, "learning_rate": 3.703870566934429e-05, "loss": 0.563785457611084, "mean_token_accuracy": 0.855938021093607, "num_tokens": 44174958.0, "step": 21600 }, { "entropy": 0.5919224286451936, "epoch": 0.35097407079574156, "grad_norm": 7.9375, "learning_rate": 3.702734008147801e-05, "loss": 0.5804090023040771, "mean_token_accuracy": 0.8549750946462155, "num_tokens": 44197653.0, "step": 21610 }, { "entropy": 0.498003351315856, "epoch": 0.35113648360036703, "grad_norm": 8.375, "learning_rate": 3.701597125823023e-05, "loss": 0.4994787693023682, "mean_token_accuracy": 0.8688813537359238, "num_tokens": 44218706.0, "step": 21620 }, { "entropy": 0.5473702850751578, "epoch": 0.35129889640499257, "grad_norm": 6.25, "learning_rate": 3.700459920265917e-05, "loss": 0.5011055946350098, "mean_token_accuracy": 0.8620822094380856, "num_tokens": 44239599.0, "step": 21630 }, { "entropy": 0.5481806642375886, "epoch": 0.3514613092096181, "grad_norm": 9.0, "learning_rate": 3.699322391782394e-05, "loss": 0.606500244140625, "mean_token_accuracy": 0.8552890524268151, "num_tokens": 44260030.0, "step": 21640 }, { "entropy": 0.5533314242959022, "epoch": 0.3516237220142436, "grad_norm": 6.25, "learning_rate": 3.698184540678453e-05, "loss": 0.5632325172424316, "mean_token_accuracy": 0.8551447935402393, "num_tokens": 44279360.0, "step": 21650 }, { "entropy": 0.5809630160685628, "epoch": 0.3517861348188691, "grad_norm": 9.375, "learning_rate": 3.697046367260178e-05, "loss": 0.6267180442810059, "mean_token_accuracy": 0.8508105248212814, "num_tokens": 44298809.0, "step": 21660 }, { "entropy": 0.606494342116639, "epoch": 0.35194854762349465, "grad_norm": 8.0625, "learning_rate": 3.69590787183374e-05, "loss": 0.5740711688995361, "mean_token_accuracy": 0.8548745211213827, "num_tokens": 44318321.0, "step": 21670 }, { "entropy": 0.48012208715081217, "epoch": 0.3521109604281202, "grad_norm": 11.0625, "learning_rate": 3.694769054705396e-05, "loss": 0.46072964668273925, "mean_token_accuracy": 0.8849034443497658, "num_tokens": 44338352.0, "step": 21680 }, { "entropy": 0.4617147091077641, "epoch": 0.35227337323274566, "grad_norm": 7.21875, "learning_rate": 3.693629916181492e-05, "loss": 0.47025418281555176, "mean_token_accuracy": 0.8807723551988602, "num_tokens": 44357534.0, "step": 21690 }, { "entropy": 0.5836778533644974, "epoch": 0.3524357860373712, "grad_norm": 7.03125, "learning_rate": 3.6924904565684585e-05, "loss": 0.6206705570220947, "mean_token_accuracy": 0.8555289160460233, "num_tokens": 44377290.0, "step": 21700 }, { "entropy": 0.4984380847774446, "epoch": 0.3525981988419967, "grad_norm": 5.34375, "learning_rate": 3.691350676172811e-05, "loss": 0.462026309967041, "mean_token_accuracy": 0.8787111185491085, "num_tokens": 44398962.0, "step": 21710 }, { "entropy": 0.5435928407125175, "epoch": 0.3527606116466222, "grad_norm": 6.28125, "learning_rate": 3.690210575301155e-05, "loss": 0.5441035747528076, "mean_token_accuracy": 0.8599406030029059, "num_tokens": 44419541.0, "step": 21720 }, { "entropy": 0.5423305165953934, "epoch": 0.35292302445124774, "grad_norm": 4.46875, "learning_rate": 3.689070154260179e-05, "loss": 0.5704238891601563, "mean_token_accuracy": 0.8553355723619461, "num_tokens": 44439035.0, "step": 21730 }, { "entropy": 0.552898257644847, "epoch": 0.35308543725587327, "grad_norm": 6.53125, "learning_rate": 3.68792941335666e-05, "loss": 0.5355385303497314, "mean_token_accuracy": 0.8645597096532583, "num_tokens": 44460569.0, "step": 21740 }, { "entropy": 0.5165185953956097, "epoch": 0.35324785006049875, "grad_norm": 8.0, "learning_rate": 3.6867883528974576e-05, "loss": 0.5000123500823974, "mean_token_accuracy": 0.87314523011446, "num_tokens": 44480905.0, "step": 21750 }, { "entropy": 0.49139151107519863, "epoch": 0.3534102628651243, "grad_norm": 8.0, "learning_rate": 3.685646973189523e-05, "loss": 0.5180537223815918, "mean_token_accuracy": 0.8720071502029896, "num_tokens": 44500235.0, "step": 21760 }, { "entropy": 0.55072255525738, "epoch": 0.3535726756697498, "grad_norm": 7.28125, "learning_rate": 3.6845052745398866e-05, "loss": 0.5549768924713134, "mean_token_accuracy": 0.8527305822819471, "num_tokens": 44521332.0, "step": 21770 }, { "entropy": 0.5192476293072105, "epoch": 0.3537350884743753, "grad_norm": 8.6875, "learning_rate": 3.6833632572556705e-05, "loss": 0.5043487071990966, "mean_token_accuracy": 0.8677250273525715, "num_tokens": 44540746.0, "step": 21780 }, { "entropy": 0.47438510404899714, "epoch": 0.3538975012790008, "grad_norm": 6.8125, "learning_rate": 3.682220921644077e-05, "loss": 0.4808980941772461, "mean_token_accuracy": 0.8842921815812588, "num_tokens": 44560244.0, "step": 21790 }, { "entropy": 0.5818553438410163, "epoch": 0.35405991408362636, "grad_norm": 7.90625, "learning_rate": 3.681078268012401e-05, "loss": 0.5823946952819824, "mean_token_accuracy": 0.8535633683204651, "num_tokens": 44580065.0, "step": 21800 }, { "entropy": 0.515645598853007, "epoch": 0.3542223268882519, "grad_norm": 9.5625, "learning_rate": 3.6799352966680147e-05, "loss": 0.5042791366577148, "mean_token_accuracy": 0.8658063814043999, "num_tokens": 44602214.0, "step": 21810 }, { "entropy": 0.5196126556023956, "epoch": 0.35438473969287737, "grad_norm": 5.90625, "learning_rate": 3.678792007918383e-05, "loss": 0.4982717990875244, "mean_token_accuracy": 0.8693961277604103, "num_tokens": 44622227.0, "step": 21820 }, { "entropy": 0.4864508622325957, "epoch": 0.3545471524975029, "grad_norm": 9.8125, "learning_rate": 3.677648402071051e-05, "loss": 0.5489206790924073, "mean_token_accuracy": 0.8616645157337188, "num_tokens": 44641713.0, "step": 21830 }, { "entropy": 0.5858467519748956, "epoch": 0.35470956530212844, "grad_norm": 8.125, "learning_rate": 3.6765044794336525e-05, "loss": 0.6453559398651123, "mean_token_accuracy": 0.8480042748153209, "num_tokens": 44662167.0, "step": 21840 }, { "entropy": 0.5292134121526033, "epoch": 0.3548719781067539, "grad_norm": 6.875, "learning_rate": 3.675360240313906e-05, "loss": 0.5062375068664551, "mean_token_accuracy": 0.8673783734440803, "num_tokens": 44681723.0, "step": 21850 }, { "entropy": 0.6032746971584857, "epoch": 0.35503439091137945, "grad_norm": 9.25, "learning_rate": 3.6742156850196116e-05, "loss": 0.5393080711364746, "mean_token_accuracy": 0.8594005361199379, "num_tokens": 44702561.0, "step": 21860 }, { "entropy": 0.49641904830932615, "epoch": 0.355196803716005, "grad_norm": 8.3125, "learning_rate": 3.673070813858661e-05, "loss": 0.4966739654541016, "mean_token_accuracy": 0.8760651707649231, "num_tokens": 44721952.0, "step": 21870 }, { "entropy": 0.5487524488009512, "epoch": 0.35535921652063046, "grad_norm": 9.1875, "learning_rate": 3.671925627139024e-05, "loss": 0.554964542388916, "mean_token_accuracy": 0.8561396688222885, "num_tokens": 44741788.0, "step": 21880 }, { "entropy": 0.48239508452825247, "epoch": 0.355521629325256, "grad_norm": 7.90625, "learning_rate": 3.6707801251687604e-05, "loss": 0.5059203147888184, "mean_token_accuracy": 0.8724339105188846, "num_tokens": 44761786.0, "step": 21890 }, { "entropy": 0.5832954145036637, "epoch": 0.35568404212988153, "grad_norm": 9.8125, "learning_rate": 3.6696343082560105e-05, "loss": 0.6032882690429687, "mean_token_accuracy": 0.8437954049557448, "num_tokens": 44783681.0, "step": 21900 }, { "entropy": 0.5574038908816874, "epoch": 0.35584645493450706, "grad_norm": 5.5625, "learning_rate": 3.6684881767090045e-05, "loss": 0.5643949508666992, "mean_token_accuracy": 0.857009730860591, "num_tokens": 44805127.0, "step": 21910 }, { "entropy": 0.4810190365416929, "epoch": 0.35600886773913254, "grad_norm": 10.375, "learning_rate": 3.667341730836052e-05, "loss": 0.5055337429046631, "mean_token_accuracy": 0.8722274832427501, "num_tokens": 44824876.0, "step": 21920 }, { "entropy": 0.5386395157314837, "epoch": 0.3561712805437581, "grad_norm": 10.1875, "learning_rate": 3.6661949709455514e-05, "loss": 0.5412801265716553, "mean_token_accuracy": 0.8553182676434516, "num_tokens": 44845063.0, "step": 21930 }, { "entropy": 0.587773175444454, "epoch": 0.3563336933483836, "grad_norm": 8.125, "learning_rate": 3.665047897345982e-05, "loss": 0.6137939453125, "mean_token_accuracy": 0.8439148873090744, "num_tokens": 44865656.0, "step": 21940 }, { "entropy": 0.5175199605058879, "epoch": 0.3564961061530091, "grad_norm": 5.625, "learning_rate": 3.6639005103459104e-05, "loss": 0.5095441341400146, "mean_token_accuracy": 0.8687964402139187, "num_tokens": 44885868.0, "step": 21950 }, { "entropy": 0.5835752455983311, "epoch": 0.3566585189576346, "grad_norm": 16.875, "learning_rate": 3.662752810253987e-05, "loss": 0.6248465538024902, "mean_token_accuracy": 0.8542846202850342, "num_tokens": 44906704.0, "step": 21960 }, { "entropy": 0.5835324994288384, "epoch": 0.35682093176226015, "grad_norm": 8.4375, "learning_rate": 3.661604797378942e-05, "loss": 0.5633364200592041, "mean_token_accuracy": 0.8538009770214557, "num_tokens": 44926676.0, "step": 21970 }, { "entropy": 0.53116120621562, "epoch": 0.35698334456688563, "grad_norm": 6.25, "learning_rate": 3.6604564720295975e-05, "loss": 0.5457303047180175, "mean_token_accuracy": 0.8618809126317502, "num_tokens": 44947249.0, "step": 21980 }, { "entropy": 0.5035348412580788, "epoch": 0.35714575737151116, "grad_norm": 7.375, "learning_rate": 3.659307834514853e-05, "loss": 0.5207488536834717, "mean_token_accuracy": 0.8654859304428101, "num_tokens": 44968072.0, "step": 21990 }, { "entropy": 0.5952181398868561, "epoch": 0.3573081701761367, "grad_norm": 9.75, "learning_rate": 3.6581588851436966e-05, "loss": 0.5836207866668701, "mean_token_accuracy": 0.8528221480548381, "num_tokens": 44988990.0, "step": 22000 }, { "entropy": 0.5420656684786082, "epoch": 0.35747058298076223, "grad_norm": 6.875, "learning_rate": 3.657009624225197e-05, "loss": 0.5425662040710449, "mean_token_accuracy": 0.8631796941161156, "num_tokens": 45009112.0, "step": 22010 }, { "entropy": 0.5318556288722902, "epoch": 0.3576329957853877, "grad_norm": 7.625, "learning_rate": 3.6558600520685084e-05, "loss": 0.5316891670227051, "mean_token_accuracy": 0.8674138702452183, "num_tokens": 45029108.0, "step": 22020 }, { "entropy": 0.4942887583747506, "epoch": 0.35779540859001324, "grad_norm": 9.75, "learning_rate": 3.6547101689828684e-05, "loss": 0.48763370513916016, "mean_token_accuracy": 0.8772669836878777, "num_tokens": 45050137.0, "step": 22030 }, { "entropy": 0.5007436298765242, "epoch": 0.3579578213946388, "grad_norm": 5.96875, "learning_rate": 3.6535599752775975e-05, "loss": 0.46999049186706543, "mean_token_accuracy": 0.8719119802117348, "num_tokens": 45070562.0, "step": 22040 }, { "entropy": 0.5411676256917417, "epoch": 0.35812023419926425, "grad_norm": 9.0625, "learning_rate": 3.6524094712621004e-05, "loss": 0.5984457492828369, "mean_token_accuracy": 0.8583813183009624, "num_tokens": 45090188.0, "step": 22050 }, { "entropy": 0.44545589475892483, "epoch": 0.3582826470038898, "grad_norm": 7.15625, "learning_rate": 3.651258657245866e-05, "loss": 0.44718003273010254, "mean_token_accuracy": 0.8888007670640945, "num_tokens": 45110803.0, "step": 22060 }, { "entropy": 0.6053970804437995, "epoch": 0.3584450598085153, "grad_norm": 6.625, "learning_rate": 3.6501075335384654e-05, "loss": 0.6317929744720459, "mean_token_accuracy": 0.8477165762335062, "num_tokens": 45130906.0, "step": 22070 }, { "entropy": 0.5168034635018557, "epoch": 0.3586074726131408, "grad_norm": 8.875, "learning_rate": 3.648956100449554e-05, "loss": 0.560523509979248, "mean_token_accuracy": 0.862342418730259, "num_tokens": 45151430.0, "step": 22080 }, { "entropy": 0.5511314554139972, "epoch": 0.35876988541776633, "grad_norm": 9.5, "learning_rate": 3.647804358288869e-05, "loss": 0.5162510871887207, "mean_token_accuracy": 0.8694643691182137, "num_tokens": 45172098.0, "step": 22090 }, { "entropy": 0.5397120059467853, "epoch": 0.35893229822239187, "grad_norm": 14.5, "learning_rate": 3.6466523073662325e-05, "loss": 0.5300876140594483, "mean_token_accuracy": 0.864759573340416, "num_tokens": 45191466.0, "step": 22100 }, { "entropy": 0.5278235613368452, "epoch": 0.35909471102701734, "grad_norm": 9.9375, "learning_rate": 3.6454999479915484e-05, "loss": 0.553561019897461, "mean_token_accuracy": 0.8631356805562973, "num_tokens": 45211959.0, "step": 22110 }, { "entropy": 0.5071602772455662, "epoch": 0.3592571238316429, "grad_norm": 7.65625, "learning_rate": 3.644347280474804e-05, "loss": 0.47554659843444824, "mean_token_accuracy": 0.8854575321078301, "num_tokens": 45232866.0, "step": 22120 }, { "entropy": 0.4931931376457214, "epoch": 0.3594195366362684, "grad_norm": 8.625, "learning_rate": 3.643194305126069e-05, "loss": 0.49465503692626955, "mean_token_accuracy": 0.8659982047975063, "num_tokens": 45253874.0, "step": 22130 }, { "entropy": 0.5244854310993106, "epoch": 0.35958194944089394, "grad_norm": 8.75, "learning_rate": 3.642041022255497e-05, "loss": 0.5578582286834717, "mean_token_accuracy": 0.8598717704415322, "num_tokens": 45275143.0, "step": 22140 }, { "entropy": 0.47107594572007655, "epoch": 0.3597443622455194, "grad_norm": 5.96875, "learning_rate": 3.640887432173323e-05, "loss": 0.4795197010040283, "mean_token_accuracy": 0.8728474907577037, "num_tokens": 45295254.0, "step": 22150 }, { "entropy": 0.5526194002944976, "epoch": 0.35990677505014496, "grad_norm": 8.0625, "learning_rate": 3.639733535189866e-05, "loss": 0.5327893257141113, "mean_token_accuracy": 0.8618099734187126, "num_tokens": 45315815.0, "step": 22160 }, { "entropy": 0.5084180941572413, "epoch": 0.3600691878547705, "grad_norm": 5.6875, "learning_rate": 3.638579331615527e-05, "loss": 0.5276590347290039, "mean_token_accuracy": 0.8709589824080467, "num_tokens": 45335335.0, "step": 22170 }, { "entropy": 0.5346804557368159, "epoch": 0.36023160065939597, "grad_norm": 9.8125, "learning_rate": 3.6374248217607886e-05, "loss": 0.5672584533691406, "mean_token_accuracy": 0.8569342024624348, "num_tokens": 45356385.0, "step": 22180 }, { "entropy": 0.5921129929833114, "epoch": 0.3603940134640215, "grad_norm": 9.0, "learning_rate": 3.636270005936217e-05, "loss": 0.5767473697662353, "mean_token_accuracy": 0.8461877532303334, "num_tokens": 45375413.0, "step": 22190 }, { "entropy": 0.6093559931963682, "epoch": 0.36055642626864703, "grad_norm": 8.1875, "learning_rate": 3.6351148844524594e-05, "loss": 0.6237957000732421, "mean_token_accuracy": 0.8486976057291031, "num_tokens": 45396329.0, "step": 22200 }, { "entropy": 0.6094029310159386, "epoch": 0.3607188390732725, "grad_norm": 6.53125, "learning_rate": 3.633959457620249e-05, "loss": 0.5926123142242432, "mean_token_accuracy": 0.8491690862923861, "num_tokens": 45416194.0, "step": 22210 }, { "entropy": 0.5944394648075104, "epoch": 0.36088125187789805, "grad_norm": 9.4375, "learning_rate": 3.632803725750394e-05, "loss": 0.6248032569885253, "mean_token_accuracy": 0.845386903360486, "num_tokens": 45437660.0, "step": 22220 }, { "entropy": 0.5811026097740978, "epoch": 0.3610436646825236, "grad_norm": 6.65625, "learning_rate": 3.631647689153792e-05, "loss": 0.6323313236236572, "mean_token_accuracy": 0.8482848394662141, "num_tokens": 45457885.0, "step": 22230 }, { "entropy": 0.5439787949435413, "epoch": 0.3612060774871491, "grad_norm": 9.3125, "learning_rate": 3.6304913481414185e-05, "loss": 0.5603982925415039, "mean_token_accuracy": 0.8516043558716774, "num_tokens": 45477832.0, "step": 22240 }, { "entropy": 0.5780838655307889, "epoch": 0.3613684902917746, "grad_norm": 11.125, "learning_rate": 3.629334703024331e-05, "loss": 0.5688809394836426, "mean_token_accuracy": 0.8537171684205532, "num_tokens": 45498859.0, "step": 22250 }, { "entropy": 0.5445112710818648, "epoch": 0.3615309030964001, "grad_norm": 8.5, "learning_rate": 3.628177754113671e-05, "loss": 0.5171935081481933, "mean_token_accuracy": 0.8676237478852272, "num_tokens": 45519765.0, "step": 22260 }, { "entropy": 0.5242340377066285, "epoch": 0.36169331590102566, "grad_norm": 7.0, "learning_rate": 3.627020501720659e-05, "loss": 0.546094560623169, "mean_token_accuracy": 0.8627755973488093, "num_tokens": 45540133.0, "step": 22270 }, { "entropy": 0.591062839794904, "epoch": 0.36185572870565114, "grad_norm": 9.8125, "learning_rate": 3.6258629461566005e-05, "loss": 0.6062967300415039, "mean_token_accuracy": 0.8515837341547012, "num_tokens": 45561583.0, "step": 22280 }, { "entropy": 0.5886002252344043, "epoch": 0.36201814151027667, "grad_norm": 6.3125, "learning_rate": 3.624705087732878e-05, "loss": 0.6218472480773926, "mean_token_accuracy": 0.8407300688326359, "num_tokens": 45581659.0, "step": 22290 }, { "entropy": 0.5773891171440482, "epoch": 0.3621805543149022, "grad_norm": 7.96875, "learning_rate": 3.62354692676096e-05, "loss": 0.543226671218872, "mean_token_accuracy": 0.856671379506588, "num_tokens": 45601467.0, "step": 22300 }, { "entropy": 0.5339827533811331, "epoch": 0.3623429671195277, "grad_norm": 8.0625, "learning_rate": 3.622388463552393e-05, "loss": 0.5364508152008056, "mean_token_accuracy": 0.8621521323919297, "num_tokens": 45621953.0, "step": 22310 }, { "entropy": 0.4878361980430782, "epoch": 0.3625053799241532, "grad_norm": 7.375, "learning_rate": 3.6212296984188074e-05, "loss": 0.5297654151916504, "mean_token_accuracy": 0.8705601416528225, "num_tokens": 45641677.0, "step": 22320 }, { "entropy": 0.5138225459493697, "epoch": 0.36266779272877875, "grad_norm": 6.03125, "learning_rate": 3.6200706316719135e-05, "loss": 0.5136440753936767, "mean_token_accuracy": 0.8723449550569058, "num_tokens": 45661073.0, "step": 22330 }, { "entropy": 0.5173530599102378, "epoch": 0.3628302055334042, "grad_norm": 11.1875, "learning_rate": 3.618911263623502e-05, "loss": 0.5069920539855957, "mean_token_accuracy": 0.8697887666523456, "num_tokens": 45682083.0, "step": 22340 }, { "entropy": 0.5886632575653493, "epoch": 0.36299261833802976, "grad_norm": 12.625, "learning_rate": 3.6177515945854457e-05, "loss": 0.6017391681671143, "mean_token_accuracy": 0.8439410604536534, "num_tokens": 45702286.0, "step": 22350 }, { "entropy": 0.543036094494164, "epoch": 0.3631550311426553, "grad_norm": 8.6875, "learning_rate": 3.616591624869699e-05, "loss": 0.5345306873321534, "mean_token_accuracy": 0.862287325412035, "num_tokens": 45721492.0, "step": 22360 }, { "entropy": 0.5217805022373796, "epoch": 0.3633174439472808, "grad_norm": 7.96875, "learning_rate": 3.6154313547882956e-05, "loss": 0.4941995143890381, "mean_token_accuracy": 0.8761439457535743, "num_tokens": 45740241.0, "step": 22370 }, { "entropy": 0.5209983649663628, "epoch": 0.3634798567519063, "grad_norm": 7.15625, "learning_rate": 3.614270784653351e-05, "loss": 0.5240054130554199, "mean_token_accuracy": 0.8622512258589268, "num_tokens": 45760393.0, "step": 22380 }, { "entropy": 0.5026755829341709, "epoch": 0.36364226955653184, "grad_norm": 10.0625, "learning_rate": 3.613109914777061e-05, "loss": 0.49358415603637695, "mean_token_accuracy": 0.8731410123407841, "num_tokens": 45780942.0, "step": 22390 }, { "entropy": 0.5014746790751815, "epoch": 0.36380468236115737, "grad_norm": 6.375, "learning_rate": 3.611948745471703e-05, "loss": 0.4699852466583252, "mean_token_accuracy": 0.8689093895256519, "num_tokens": 45801880.0, "step": 22400 }, { "entropy": 0.5131936501711607, "epoch": 0.36396709516578285, "grad_norm": 9.5, "learning_rate": 3.610787277049633e-05, "loss": 0.5164310932159424, "mean_token_accuracy": 0.8663072057068348, "num_tokens": 45821267.0, "step": 22410 }, { "entropy": 0.4994734394364059, "epoch": 0.3641295079704084, "grad_norm": 4.5625, "learning_rate": 3.609625509823289e-05, "loss": 0.5087766170501709, "mean_token_accuracy": 0.8696040697395802, "num_tokens": 45842073.0, "step": 22420 }, { "entropy": 0.5538337216712534, "epoch": 0.3642919207750339, "grad_norm": 8.8125, "learning_rate": 3.608463444105189e-05, "loss": 0.5491084098815918, "mean_token_accuracy": 0.8498035863041877, "num_tokens": 45862449.0, "step": 22430 }, { "entropy": 0.5388235297985375, "epoch": 0.3644543335796594, "grad_norm": 10.9375, "learning_rate": 3.607301080207932e-05, "loss": 0.6304543018341064, "mean_token_accuracy": 0.857686672359705, "num_tokens": 45883404.0, "step": 22440 }, { "entropy": 0.5203216661699116, "epoch": 0.36461674638428493, "grad_norm": 5.46875, "learning_rate": 3.6061384184441956e-05, "loss": 0.5590576648712158, "mean_token_accuracy": 0.8596357282251119, "num_tokens": 45903966.0, "step": 22450 }, { "entropy": 0.5473650400526822, "epoch": 0.36477915918891046, "grad_norm": 6.09375, "learning_rate": 3.604975459126739e-05, "loss": 0.55399169921875, "mean_token_accuracy": 0.8622149959206581, "num_tokens": 45924088.0, "step": 22460 }, { "entropy": 0.527728881035, "epoch": 0.364941571993536, "grad_norm": 8.125, "learning_rate": 3.6038122025683994e-05, "loss": 0.49657497406005857, "mean_token_accuracy": 0.8673058494925499, "num_tokens": 45944498.0, "step": 22470 }, { "entropy": 0.5301307275891304, "epoch": 0.3651039847981615, "grad_norm": 8.3125, "learning_rate": 3.6026486490820986e-05, "loss": 0.5738278388977051, "mean_token_accuracy": 0.8554430663585663, "num_tokens": 45963570.0, "step": 22480 }, { "entropy": 0.5484862302895636, "epoch": 0.365266397602787, "grad_norm": 6.875, "learning_rate": 3.601484798980832e-05, "loss": 0.5608875751495361, "mean_token_accuracy": 0.8544336929917336, "num_tokens": 45985113.0, "step": 22490 }, { "entropy": 0.549569896387402, "epoch": 0.36542881040741254, "grad_norm": 6.65625, "learning_rate": 3.600320652577679e-05, "loss": 0.5329383373260498, "mean_token_accuracy": 0.8592706963419914, "num_tokens": 46004958.0, "step": 22500 }, { "entropy": 0.5578990668058396, "epoch": 0.365591223212038, "grad_norm": 5.625, "learning_rate": 3.599156210185798e-05, "loss": 0.5637103080749511, "mean_token_accuracy": 0.8621811509132385, "num_tokens": 46024298.0, "step": 22510 }, { "entropy": 0.526423163432628, "epoch": 0.36575363601666355, "grad_norm": 8.375, "learning_rate": 3.597991472118426e-05, "loss": 0.5573925971984863, "mean_token_accuracy": 0.862083799391985, "num_tokens": 46044222.0, "step": 22520 }, { "entropy": 0.5596354202367365, "epoch": 0.3659160488212891, "grad_norm": 9.9375, "learning_rate": 3.596826438688881e-05, "loss": 0.5738032817840576, "mean_token_accuracy": 0.8538367539644242, "num_tokens": 46064472.0, "step": 22530 }, { "entropy": 0.5945897872559727, "epoch": 0.36607846162591456, "grad_norm": 8.3125, "learning_rate": 3.5956611102105584e-05, "loss": 0.6222953796386719, "mean_token_accuracy": 0.8442585721611977, "num_tokens": 46084666.0, "step": 22540 }, { "entropy": 0.6085175042040646, "epoch": 0.3662408744305401, "grad_norm": 8.1875, "learning_rate": 3.594495486996935e-05, "loss": 0.5987044334411621, "mean_token_accuracy": 0.8501650646328927, "num_tokens": 46106845.0, "step": 22550 }, { "entropy": 0.5357793137431145, "epoch": 0.36640328723516563, "grad_norm": 10.0, "learning_rate": 3.593329569361566e-05, "loss": 0.5084915637969971, "mean_token_accuracy": 0.8592867992818356, "num_tokens": 46127098.0, "step": 22560 }, { "entropy": 0.57223765111994, "epoch": 0.36656570003979116, "grad_norm": 9.1875, "learning_rate": 3.5921633576180856e-05, "loss": 0.5900027275085449, "mean_token_accuracy": 0.8568408265709877, "num_tokens": 46147138.0, "step": 22570 }, { "entropy": 0.498483234224841, "epoch": 0.36672811284441664, "grad_norm": 7.5, "learning_rate": 3.5909968520802076e-05, "loss": 0.504655408859253, "mean_token_accuracy": 0.8765921898186206, "num_tokens": 46167731.0, "step": 22580 }, { "entropy": 0.4863421001471579, "epoch": 0.3668905256490422, "grad_norm": 6.875, "learning_rate": 3.589830053061724e-05, "loss": 0.48332624435424804, "mean_token_accuracy": 0.8732934996485711, "num_tokens": 46188521.0, "step": 22590 }, { "entropy": 0.5965361991431564, "epoch": 0.3670529384536677, "grad_norm": 7.8125, "learning_rate": 3.5886629608765075e-05, "loss": 0.628386402130127, "mean_token_accuracy": 0.839428273960948, "num_tokens": 46208227.0, "step": 22600 }, { "entropy": 0.516195021988824, "epoch": 0.3672153512582932, "grad_norm": 10.25, "learning_rate": 3.587495575838508e-05, "loss": 0.4876420497894287, "mean_token_accuracy": 0.874594870954752, "num_tokens": 46228065.0, "step": 22610 }, { "entropy": 0.5001425674185157, "epoch": 0.3673777640629187, "grad_norm": 7.65625, "learning_rate": 3.5863278982617544e-05, "loss": 0.4988094806671143, "mean_token_accuracy": 0.8746064335107804, "num_tokens": 46247436.0, "step": 22620 }, { "entropy": 0.4953230457380414, "epoch": 0.36754017686754425, "grad_norm": 9.9375, "learning_rate": 3.585159928460354e-05, "loss": 0.47537813186645506, "mean_token_accuracy": 0.8794655568897725, "num_tokens": 46267756.0, "step": 22630 }, { "entropy": 0.5102482470683753, "epoch": 0.36770258967216973, "grad_norm": 6.0625, "learning_rate": 3.583991666748496e-05, "loss": 0.5246462345123291, "mean_token_accuracy": 0.8625853963196277, "num_tokens": 46288319.0, "step": 22640 }, { "entropy": 0.5063205063343048, "epoch": 0.36786500247679527, "grad_norm": 11.75, "learning_rate": 3.582823113440442e-05, "loss": 0.5079082012176513, "mean_token_accuracy": 0.868780754506588, "num_tokens": 46307549.0, "step": 22650 }, { "entropy": 0.5103387008653953, "epoch": 0.3680274152814208, "grad_norm": 7.125, "learning_rate": 3.581654268850537e-05, "loss": 0.5136359214782715, "mean_token_accuracy": 0.8635205499827862, "num_tokens": 46327819.0, "step": 22660 }, { "entropy": 0.5618640937842428, "epoch": 0.3681898280860463, "grad_norm": 12.5, "learning_rate": 3.580485133293203e-05, "loss": 0.576469898223877, "mean_token_accuracy": 0.8440437003970146, "num_tokens": 46349805.0, "step": 22670 }, { "entropy": 0.5614996634423732, "epoch": 0.3683522408906718, "grad_norm": 5.46875, "learning_rate": 3.579315707082941e-05, "loss": 0.5707251071929932, "mean_token_accuracy": 0.8505207046866416, "num_tokens": 46372002.0, "step": 22680 }, { "entropy": 0.5534514199011028, "epoch": 0.36851465369529735, "grad_norm": 7.09375, "learning_rate": 3.578145990534327e-05, "loss": 0.5328909873962402, "mean_token_accuracy": 0.8627839908003807, "num_tokens": 46391672.0, "step": 22690 }, { "entropy": 0.5272256378084421, "epoch": 0.3686770664999229, "grad_norm": 6.71875, "learning_rate": 3.576975983962019e-05, "loss": 0.5815550327301026, "mean_token_accuracy": 0.8539358582347631, "num_tokens": 46412585.0, "step": 22700 }, { "entropy": 0.5788405261933803, "epoch": 0.36883947930454836, "grad_norm": 7.65625, "learning_rate": 3.57580568768075e-05, "loss": 0.580315637588501, "mean_token_accuracy": 0.8456543140113354, "num_tokens": 46433911.0, "step": 22710 }, { "entropy": 0.5318998185917735, "epoch": 0.3690018921091739, "grad_norm": 6.03125, "learning_rate": 3.574635102005335e-05, "loss": 0.49951949119567873, "mean_token_accuracy": 0.8704735808074474, "num_tokens": 46453154.0, "step": 22720 }, { "entropy": 0.5594008721411228, "epoch": 0.3691643049137994, "grad_norm": 6.1875, "learning_rate": 3.5734642272506616e-05, "loss": 0.5615673542022706, "mean_token_accuracy": 0.8592425882816315, "num_tokens": 46474077.0, "step": 22730 }, { "entropy": 0.5833348056301475, "epoch": 0.3693267177184249, "grad_norm": 10.0, "learning_rate": 3.572293063731698e-05, "loss": 0.627398681640625, "mean_token_accuracy": 0.8437128119170666, "num_tokens": 46494452.0, "step": 22740 }, { "entropy": 0.5044870178215206, "epoch": 0.36948913052305044, "grad_norm": 6.4375, "learning_rate": 3.571121611763491e-05, "loss": 0.49809775352478025, "mean_token_accuracy": 0.8761745683848858, "num_tokens": 46515451.0, "step": 22750 }, { "entropy": 0.5683391018770635, "epoch": 0.36965154332767597, "grad_norm": 12.1875, "learning_rate": 3.569949871661163e-05, "loss": 0.5646000862121582, "mean_token_accuracy": 0.8612325817346573, "num_tokens": 46535715.0, "step": 22760 }, { "entropy": 0.5393053836422042, "epoch": 0.36981395613230145, "grad_norm": 8.625, "learning_rate": 3.5687778437399154e-05, "loss": 0.5669569969177246, "mean_token_accuracy": 0.8690717004239559, "num_tokens": 46556940.0, "step": 22770 }, { "entropy": 0.4696126381866634, "epoch": 0.369976368936927, "grad_norm": 8.125, "learning_rate": 3.567605528315026e-05, "loss": 0.506529426574707, "mean_token_accuracy": 0.8779649198055267, "num_tokens": 46577909.0, "step": 22780 }, { "entropy": 0.5180344953201711, "epoch": 0.3701387817415525, "grad_norm": 5.09375, "learning_rate": 3.5664329257018496e-05, "loss": 0.5046396255493164, "mean_token_accuracy": 0.8725584954023361, "num_tokens": 46598156.0, "step": 22790 }, { "entropy": 0.5245853875298053, "epoch": 0.37030119454617805, "grad_norm": 7.09375, "learning_rate": 3.56526003621582e-05, "loss": 0.5262390613555908, "mean_token_accuracy": 0.8684110846370459, "num_tokens": 46619036.0, "step": 22800 }, { "entropy": 0.5361057993024587, "epoch": 0.3704636073508035, "grad_norm": 6.59375, "learning_rate": 3.5640868601724466e-05, "loss": 0.49814157485961913, "mean_token_accuracy": 0.871850086003542, "num_tokens": 46639079.0, "step": 22810 }, { "entropy": 0.5254886455833911, "epoch": 0.37062602015542906, "grad_norm": 10.125, "learning_rate": 3.562913397887316e-05, "loss": 0.5756486892700196, "mean_token_accuracy": 0.8552132278680802, "num_tokens": 46659528.0, "step": 22820 }, { "entropy": 0.5132388005033135, "epoch": 0.3707884329600546, "grad_norm": 7.875, "learning_rate": 3.5617396496760935e-05, "loss": 0.5069278240203857, "mean_token_accuracy": 0.8765708640217781, "num_tokens": 46679889.0, "step": 22830 }, { "entropy": 0.5437707738019526, "epoch": 0.37095084576468007, "grad_norm": 8.75, "learning_rate": 3.5605656158545184e-05, "loss": 0.5513464927673339, "mean_token_accuracy": 0.8712418720126152, "num_tokens": 46702352.0, "step": 22840 }, { "entropy": 0.5607295256108046, "epoch": 0.3711132585693056, "grad_norm": 5.78125, "learning_rate": 3.559391296738409e-05, "loss": 0.5468845844268799, "mean_token_accuracy": 0.8700308963656426, "num_tokens": 46722400.0, "step": 22850 }, { "entropy": 0.5075481545645744, "epoch": 0.37127567137393114, "grad_norm": 12.875, "learning_rate": 3.55821669264366e-05, "loss": 0.51412353515625, "mean_token_accuracy": 0.8679320923984051, "num_tokens": 46742501.0, "step": 22860 }, { "entropy": 0.5388759735506028, "epoch": 0.3714380841785566, "grad_norm": 8.3125, "learning_rate": 3.557041803886244e-05, "loss": 0.5300612449645996, "mean_token_accuracy": 0.8614227347075939, "num_tokens": 46762113.0, "step": 22870 }, { "entropy": 0.5458118900191039, "epoch": 0.37160049698318215, "grad_norm": 8.3125, "learning_rate": 3.555866630782205e-05, "loss": 0.5642400741577148, "mean_token_accuracy": 0.8576182417571545, "num_tokens": 46782277.0, "step": 22880 }, { "entropy": 0.526531751290895, "epoch": 0.3717629097878077, "grad_norm": 6.53125, "learning_rate": 3.554691173647671e-05, "loss": 0.5234723567962647, "mean_token_accuracy": 0.863782000541687, "num_tokens": 46802951.0, "step": 22890 }, { "entropy": 0.5256036151666195, "epoch": 0.37192532259243316, "grad_norm": 8.25, "learning_rate": 3.5535154327988395e-05, "loss": 0.5279816150665283, "mean_token_accuracy": 0.8615976721048355, "num_tokens": 46824235.0, "step": 22900 }, { "entropy": 0.5613566390704363, "epoch": 0.3720877353970587, "grad_norm": 9.75, "learning_rate": 3.55233940855199e-05, "loss": 0.5567831993103027, "mean_token_accuracy": 0.8626518622040749, "num_tokens": 46844664.0, "step": 22910 }, { "entropy": 0.5466673552058637, "epoch": 0.37225014820168423, "grad_norm": 7.03125, "learning_rate": 3.551163101223474e-05, "loss": 0.5369855403900147, "mean_token_accuracy": 0.8599102776497602, "num_tokens": 46865476.0, "step": 22920 }, { "entropy": 0.5471957039088011, "epoch": 0.37241256100630976, "grad_norm": 6.90625, "learning_rate": 3.549986511129722e-05, "loss": 0.5098142623901367, "mean_token_accuracy": 0.8685966536402703, "num_tokens": 46886198.0, "step": 22930 }, { "entropy": 0.4645593389868736, "epoch": 0.37257497381093524, "grad_norm": 9.6875, "learning_rate": 3.548809638587239e-05, "loss": 0.4508031368255615, "mean_token_accuracy": 0.8803025424480438, "num_tokens": 46906434.0, "step": 22940 }, { "entropy": 0.5266782679595053, "epoch": 0.3727373866155608, "grad_norm": 8.25, "learning_rate": 3.5476324839126054e-05, "loss": 0.5376164436340332, "mean_token_accuracy": 0.8612623754888773, "num_tokens": 46926922.0, "step": 22950 }, { "entropy": 0.4882442941889167, "epoch": 0.3728997994201863, "grad_norm": 7.875, "learning_rate": 3.54645504742248e-05, "loss": 0.5712001323699951, "mean_token_accuracy": 0.865396112576127, "num_tokens": 46946238.0, "step": 22960 }, { "entropy": 0.496988816652447, "epoch": 0.3730622122248118, "grad_norm": 7.90625, "learning_rate": 3.5452773294335946e-05, "loss": 0.5029908657073975, "mean_token_accuracy": 0.8775486685335636, "num_tokens": 46966658.0, "step": 22970 }, { "entropy": 0.5280406025238336, "epoch": 0.3732246250294373, "grad_norm": 10.875, "learning_rate": 3.544099330262759e-05, "loss": 0.49698305130004883, "mean_token_accuracy": 0.8702978737652302, "num_tokens": 46987267.0, "step": 22980 }, { "entropy": 0.4936371401883662, "epoch": 0.37338703783406285, "grad_norm": 7.875, "learning_rate": 3.542921050226856e-05, "loss": 0.5295087814331054, "mean_token_accuracy": 0.861780758947134, "num_tokens": 47007524.0, "step": 22990 }, { "entropy": 0.47892022065352646, "epoch": 0.37354945063868833, "grad_norm": 9.5625, "learning_rate": 3.541742489642848e-05, "loss": 0.5456148624420166, "mean_token_accuracy": 0.8599766887724399, "num_tokens": 47027393.0, "step": 23000 }, { "entropy": 0.571288030827418, "epoch": 0.37371186344331386, "grad_norm": 7.96875, "learning_rate": 3.540563648827768e-05, "loss": 0.5712827205657959, "mean_token_accuracy": 0.8631726332008839, "num_tokens": 47049011.0, "step": 23010 }, { "entropy": 0.560052125249058, "epoch": 0.3738742762479394, "grad_norm": 7.96875, "learning_rate": 3.5393845280987286e-05, "loss": 0.5331133842468262, "mean_token_accuracy": 0.8646037772297859, "num_tokens": 47070858.0, "step": 23020 }, { "entropy": 0.6352939387783408, "epoch": 0.37403668905256493, "grad_norm": 7.96875, "learning_rate": 3.538205127772915e-05, "loss": 0.6375955104827881, "mean_token_accuracy": 0.8402499165385962, "num_tokens": 47090720.0, "step": 23030 }, { "entropy": 0.4966933771967888, "epoch": 0.3741991018571904, "grad_norm": 7.0, "learning_rate": 3.5370254481675894e-05, "loss": 0.4814156532287598, "mean_token_accuracy": 0.8715220600366592, "num_tokens": 47110745.0, "step": 23040 }, { "entropy": 0.6033111325930804, "epoch": 0.37436151466181594, "grad_norm": 7.71875, "learning_rate": 3.535845489600087e-05, "loss": 0.6000465869903564, "mean_token_accuracy": 0.851013221591711, "num_tokens": 47131882.0, "step": 23050 }, { "entropy": 0.5365425140596927, "epoch": 0.3745239274664415, "grad_norm": 9.5625, "learning_rate": 3.5346652523878196e-05, "loss": 0.5196335315704346, "mean_token_accuracy": 0.8638619355857372, "num_tokens": 47152617.0, "step": 23060 }, { "entropy": 0.6058875522576272, "epoch": 0.37468634027106695, "grad_norm": 5.21875, "learning_rate": 3.5334847368482745e-05, "loss": 0.6404666423797607, "mean_token_accuracy": 0.8379699695855379, "num_tokens": 47173228.0, "step": 23070 }, { "entropy": 0.4880610327934846, "epoch": 0.3748487530756925, "grad_norm": 8.625, "learning_rate": 3.532303943299014e-05, "loss": 0.49109439849853515, "mean_token_accuracy": 0.8789512477815151, "num_tokens": 47193733.0, "step": 23080 }, { "entropy": 0.5497254593297839, "epoch": 0.375011165880318, "grad_norm": 9.625, "learning_rate": 3.5311228720576707e-05, "loss": 0.551785659790039, "mean_token_accuracy": 0.8620145283639431, "num_tokens": 47214564.0, "step": 23090 }, { "entropy": 0.4589710982516408, "epoch": 0.3751735786849435, "grad_norm": 6.25, "learning_rate": 3.529941523441958e-05, "loss": 0.45055465698242186, "mean_token_accuracy": 0.8832620993256569, "num_tokens": 47234326.0, "step": 23100 }, { "entropy": 0.49950263244099913, "epoch": 0.37533599148956903, "grad_norm": 11.5, "learning_rate": 3.5287598977696614e-05, "loss": 0.5233136653900147, "mean_token_accuracy": 0.863804891705513, "num_tokens": 47253919.0, "step": 23110 }, { "entropy": 0.5818585760425776, "epoch": 0.37549840429419457, "grad_norm": 9.4375, "learning_rate": 3.52757799535864e-05, "loss": 0.5802332401275635, "mean_token_accuracy": 0.8521456062793732, "num_tokens": 47275355.0, "step": 23120 }, { "entropy": 0.48734450014308095, "epoch": 0.37566081709882004, "grad_norm": 8.4375, "learning_rate": 3.526395816526828e-05, "loss": 0.5121031761169433, "mean_token_accuracy": 0.8631136104464531, "num_tokens": 47295598.0, "step": 23130 }, { "entropy": 0.5018413669196888, "epoch": 0.3758232299034456, "grad_norm": 8.3125, "learning_rate": 3.525213361592236e-05, "loss": 0.5102596282958984, "mean_token_accuracy": 0.8629988119006157, "num_tokens": 47316093.0, "step": 23140 }, { "entropy": 0.578115433268249, "epoch": 0.3759856427080711, "grad_norm": 7.78125, "learning_rate": 3.524030630872944e-05, "loss": 0.6214663028717041, "mean_token_accuracy": 0.8461781218647957, "num_tokens": 47337298.0, "step": 23150 }, { "entropy": 0.5498658765107394, "epoch": 0.37614805551269664, "grad_norm": 6.125, "learning_rate": 3.522847624687113e-05, "loss": 0.5372975826263428, "mean_token_accuracy": 0.8585484951734543, "num_tokens": 47358181.0, "step": 23160 }, { "entropy": 0.5674035249277949, "epoch": 0.3763104683173221, "grad_norm": 9.3125, "learning_rate": 3.5216643433529706e-05, "loss": 0.5584349155426025, "mean_token_accuracy": 0.8618085101246834, "num_tokens": 47378835.0, "step": 23170 }, { "entropy": 0.5508882936555892, "epoch": 0.37647288112194766, "grad_norm": 6.9375, "learning_rate": 3.5204807871888246e-05, "loss": 0.558116340637207, "mean_token_accuracy": 0.8662411734461785, "num_tokens": 47398174.0, "step": 23180 }, { "entropy": 0.5321155557408929, "epoch": 0.3766352939265732, "grad_norm": 7.1875, "learning_rate": 3.519296956513053e-05, "loss": 0.5405116558074952, "mean_token_accuracy": 0.863373076915741, "num_tokens": 47418930.0, "step": 23190 }, { "entropy": 0.5763557997532189, "epoch": 0.37679770673119867, "grad_norm": 5.8125, "learning_rate": 3.5181128516441095e-05, "loss": 0.5841362953186036, "mean_token_accuracy": 0.8575020115822554, "num_tokens": 47439195.0, "step": 23200 }, { "entropy": 0.5498569095507264, "epoch": 0.3769601195358242, "grad_norm": 5.71875, "learning_rate": 3.516928472900521e-05, "loss": 0.5873496532440186, "mean_token_accuracy": 0.859566243737936, "num_tokens": 47460804.0, "step": 23210 }, { "entropy": 0.5625232204794883, "epoch": 0.37712253234044973, "grad_norm": 7.25, "learning_rate": 3.5157438206008876e-05, "loss": 0.55870680809021, "mean_token_accuracy": 0.8648183718323708, "num_tokens": 47481481.0, "step": 23220 }, { "entropy": 0.5258202247787267, "epoch": 0.3772849451450752, "grad_norm": 7.28125, "learning_rate": 3.5145588950638844e-05, "loss": 0.4839372158050537, "mean_token_accuracy": 0.8768865942955018, "num_tokens": 47501516.0, "step": 23230 }, { "entropy": 0.628549318946898, "epoch": 0.37744735794970075, "grad_norm": 7.125, "learning_rate": 3.513373696608258e-05, "loss": 0.644710111618042, "mean_token_accuracy": 0.842871118709445, "num_tokens": 47522128.0, "step": 23240 }, { "entropy": 0.5085605416446924, "epoch": 0.3776097707543263, "grad_norm": 9.8125, "learning_rate": 3.5121882255528296e-05, "loss": 0.5093700408935546, "mean_token_accuracy": 0.8702546983957291, "num_tokens": 47543002.0, "step": 23250 }, { "entropy": 0.5005460197338835, "epoch": 0.3777721835589518, "grad_norm": 6.28125, "learning_rate": 3.5110024822164934e-05, "loss": 0.48158607482910154, "mean_token_accuracy": 0.8776849590241909, "num_tokens": 47563548.0, "step": 23260 }, { "entropy": 0.5071444848086685, "epoch": 0.3779345963635773, "grad_norm": 10.875, "learning_rate": 3.5098164669182175e-05, "loss": 0.5122921466827393, "mean_token_accuracy": 0.8713502727448941, "num_tokens": 47583230.0, "step": 23270 }, { "entropy": 0.4995664938353002, "epoch": 0.3780970091682028, "grad_norm": 8.3125, "learning_rate": 3.508630179977043e-05, "loss": 0.5138347625732422, "mean_token_accuracy": 0.8662989065051079, "num_tokens": 47604014.0, "step": 23280 }, { "entropy": 0.5845841980539263, "epoch": 0.37825942197282836, "grad_norm": 5.90625, "learning_rate": 3.507443621712083e-05, "loss": 0.5698809146881103, "mean_token_accuracy": 0.8617636803537607, "num_tokens": 47624674.0, "step": 23290 }, { "entropy": 0.5725499807856977, "epoch": 0.37842183477745384, "grad_norm": 12.8125, "learning_rate": 3.506256792442525e-05, "loss": 0.5955534458160401, "mean_token_accuracy": 0.8502981245517731, "num_tokens": 47645742.0, "step": 23300 }, { "entropy": 0.5264549440238625, "epoch": 0.37858424758207937, "grad_norm": 8.625, "learning_rate": 3.505069692487628e-05, "loss": 0.5521557807922364, "mean_token_accuracy": 0.8687032990157604, "num_tokens": 47665677.0, "step": 23310 }, { "entropy": 0.54162556855008, "epoch": 0.3787466603867049, "grad_norm": 6.0625, "learning_rate": 3.503882322166726e-05, "loss": 0.5396908283233642, "mean_token_accuracy": 0.8575963176786899, "num_tokens": 47686692.0, "step": 23320 }, { "entropy": 0.49104399350471795, "epoch": 0.3789090731913304, "grad_norm": 6.3125, "learning_rate": 3.502694681799222e-05, "loss": 0.491621732711792, "mean_token_accuracy": 0.8782141469419003, "num_tokens": 47707130.0, "step": 23330 }, { "entropy": 0.49153111353516576, "epoch": 0.3790714859959559, "grad_norm": 10.25, "learning_rate": 3.5015067717045956e-05, "loss": 0.5104156494140625, "mean_token_accuracy": 0.8701667435467243, "num_tokens": 47726964.0, "step": 23340 }, { "entropy": 0.5356636739801616, "epoch": 0.37923389880058145, "grad_norm": 6.59375, "learning_rate": 3.5003185922023975e-05, "loss": 0.5055852890014648, "mean_token_accuracy": 0.8678868159651756, "num_tokens": 47747247.0, "step": 23350 }, { "entropy": 0.5401990255806595, "epoch": 0.379396311605207, "grad_norm": 5.53125, "learning_rate": 3.499130143612249e-05, "loss": 0.5481836318969726, "mean_token_accuracy": 0.8628500305116177, "num_tokens": 47767945.0, "step": 23360 }, { "entropy": 0.5417534617241472, "epoch": 0.37955872440983246, "grad_norm": 11.875, "learning_rate": 3.497941426253847e-05, "loss": 0.5466581821441651, "mean_token_accuracy": 0.8594752680510283, "num_tokens": 47789218.0, "step": 23370 }, { "entropy": 0.5258222323842346, "epoch": 0.379721137214458, "grad_norm": 7.5625, "learning_rate": 3.496752440446959e-05, "loss": 0.5128636360168457, "mean_token_accuracy": 0.8603849198669196, "num_tokens": 47808817.0, "step": 23380 }, { "entropy": 0.4762317748274654, "epoch": 0.3798835500190835, "grad_norm": 9.3125, "learning_rate": 3.495563186511424e-05, "loss": 0.5172730922698975, "mean_token_accuracy": 0.8748526282608509, "num_tokens": 47829391.0, "step": 23390 }, { "entropy": 0.45121222916059195, "epoch": 0.380045962823709, "grad_norm": 8.5625, "learning_rate": 3.4943736647671547e-05, "loss": 0.4369924068450928, "mean_token_accuracy": 0.885579739511013, "num_tokens": 47849416.0, "step": 23400 }, { "entropy": 0.5380913590546698, "epoch": 0.38020837562833454, "grad_norm": 5.3125, "learning_rate": 3.493183875534134e-05, "loss": 0.5485765933990479, "mean_token_accuracy": 0.8605882182717324, "num_tokens": 47870056.0, "step": 23410 }, { "entropy": 0.5652221563737839, "epoch": 0.38037078843296007, "grad_norm": 10.75, "learning_rate": 3.49199381913242e-05, "loss": 0.5633525848388672, "mean_token_accuracy": 0.8557614356279373, "num_tokens": 47890163.0, "step": 23420 }, { "entropy": 0.5265408675186336, "epoch": 0.38053320123758555, "grad_norm": 6.34375, "learning_rate": 3.490803495882138e-05, "loss": 0.5179901123046875, "mean_token_accuracy": 0.8720933947712183, "num_tokens": 47912021.0, "step": 23430 }, { "entropy": 0.5559795063454658, "epoch": 0.3806956140422111, "grad_norm": 11.0, "learning_rate": 3.4896129061034896e-05, "loss": 0.5901319503784179, "mean_token_accuracy": 0.8546281069517135, "num_tokens": 47932769.0, "step": 23440 }, { "entropy": 0.5480166509747505, "epoch": 0.3808580268468366, "grad_norm": 6.28125, "learning_rate": 3.4884220501167455e-05, "loss": 0.5394044399261475, "mean_token_accuracy": 0.8672267783433198, "num_tokens": 47953128.0, "step": 23450 }, { "entropy": 0.4782569863367826, "epoch": 0.3810204396514621, "grad_norm": 4.78125, "learning_rate": 3.487230928242249e-05, "loss": 0.4927670955657959, "mean_token_accuracy": 0.8648092590272427, "num_tokens": 47974467.0, "step": 23460 }, { "entropy": 0.501753849547822, "epoch": 0.38118285245608763, "grad_norm": 7.0, "learning_rate": 3.486039540800413e-05, "loss": 0.5144572734832764, "mean_token_accuracy": 0.8649049296975135, "num_tokens": 47995616.0, "step": 23470 }, { "entropy": 0.538450820185244, "epoch": 0.38134526526071316, "grad_norm": 7.65625, "learning_rate": 3.484847888111725e-05, "loss": 0.5712307453155517, "mean_token_accuracy": 0.8561130963265896, "num_tokens": 48016981.0, "step": 23480 }, { "entropy": 0.5631506662350148, "epoch": 0.3815076780653387, "grad_norm": 7.125, "learning_rate": 3.483655970496742e-05, "loss": 0.56732177734375, "mean_token_accuracy": 0.8528319109231234, "num_tokens": 48037335.0, "step": 23490 }, { "entropy": 0.5370853966567666, "epoch": 0.3816700908699642, "grad_norm": 8.5625, "learning_rate": 3.4824637882760926e-05, "loss": 0.5631498336791992, "mean_token_accuracy": 0.8590424001216889, "num_tokens": 48058034.0, "step": 23500 }, { "entropy": 0.5949568750336767, "epoch": 0.3818325036745897, "grad_norm": 6.75, "learning_rate": 3.481271341770476e-05, "loss": 0.6184279441833496, "mean_token_accuracy": 0.847149258852005, "num_tokens": 48078783.0, "step": 23510 }, { "entropy": 0.5055835673119873, "epoch": 0.38199491647921524, "grad_norm": 9.625, "learning_rate": 3.480078631300663e-05, "loss": 0.5114854335784912, "mean_token_accuracy": 0.8693468421697617, "num_tokens": 48100358.0, "step": 23520 }, { "entropy": 0.5151665612123907, "epoch": 0.3821573292838407, "grad_norm": 6.0, "learning_rate": 3.478885657187495e-05, "loss": 0.5543181896209717, "mean_token_accuracy": 0.8669786743819714, "num_tokens": 48120677.0, "step": 23530 }, { "entropy": 0.5973755480721593, "epoch": 0.38231974208846625, "grad_norm": 11.0, "learning_rate": 3.477692419751886e-05, "loss": 0.6188558578491211, "mean_token_accuracy": 0.8456725552678108, "num_tokens": 48141091.0, "step": 23540 }, { "entropy": 0.5443610266316682, "epoch": 0.3824821548930918, "grad_norm": 8.875, "learning_rate": 3.47649891931482e-05, "loss": 0.5470822334289551, "mean_token_accuracy": 0.8671425685286522, "num_tokens": 48161245.0, "step": 23550 }, { "entropy": 0.5164826216641814, "epoch": 0.38264456769771726, "grad_norm": 6.4375, "learning_rate": 3.475305156197348e-05, "loss": 0.47877206802368166, "mean_token_accuracy": 0.8691567055881023, "num_tokens": 48180732.0, "step": 23560 }, { "entropy": 0.5802039559464902, "epoch": 0.3828069805023428, "grad_norm": 8.0, "learning_rate": 3.4741111307205984e-05, "loss": 0.5927969455718994, "mean_token_accuracy": 0.8535598516464233, "num_tokens": 48201450.0, "step": 23570 }, { "entropy": 0.5903122657909989, "epoch": 0.38296939330696833, "grad_norm": 7.3125, "learning_rate": 3.4729168432057654e-05, "loss": 0.592861270904541, "mean_token_accuracy": 0.8502638541162014, "num_tokens": 48223020.0, "step": 23580 }, { "entropy": 0.5342993377707899, "epoch": 0.38313180611159386, "grad_norm": 7.8125, "learning_rate": 3.4717222939741144e-05, "loss": 0.5393466472625732, "mean_token_accuracy": 0.8666709829121828, "num_tokens": 48244420.0, "step": 23590 }, { "entropy": 0.5356148012448102, "epoch": 0.38329421891621934, "grad_norm": 10.0625, "learning_rate": 3.4705274833469826e-05, "loss": 0.518127155303955, "mean_token_accuracy": 0.8713029198348522, "num_tokens": 48264562.0, "step": 23600 }, { "entropy": 0.4990497679915279, "epoch": 0.3834566317208449, "grad_norm": 10.875, "learning_rate": 3.469332411645777e-05, "loss": 0.5320947647094727, "mean_token_accuracy": 0.8701103553175926, "num_tokens": 48283628.0, "step": 23610 }, { "entropy": 0.5612592508085072, "epoch": 0.3836190445254704, "grad_norm": 6.3125, "learning_rate": 3.468137079191975e-05, "loss": 0.567941427230835, "mean_token_accuracy": 0.856011351197958, "num_tokens": 48304254.0, "step": 23620 }, { "entropy": 0.5070313761942089, "epoch": 0.3837814573300959, "grad_norm": 8.6875, "learning_rate": 3.466941486307121e-05, "loss": 0.49141554832458495, "mean_token_accuracy": 0.8748818807303905, "num_tokens": 48324460.0, "step": 23630 }, { "entropy": 0.5520128135569393, "epoch": 0.3839438701347214, "grad_norm": 6.8125, "learning_rate": 3.465745633312836e-05, "loss": 0.5662581920623779, "mean_token_accuracy": 0.848382630944252, "num_tokens": 48345877.0, "step": 23640 }, { "entropy": 0.5857702340465039, "epoch": 0.38410628293934695, "grad_norm": 7.46875, "learning_rate": 3.4645495205308046e-05, "loss": 0.5871270179748536, "mean_token_accuracy": 0.8553826045244932, "num_tokens": 48365556.0, "step": 23650 }, { "entropy": 0.5530993167776614, "epoch": 0.38426869574397243, "grad_norm": 7.125, "learning_rate": 3.4633531482827846e-05, "loss": 0.5805275917053223, "mean_token_accuracy": 0.8547425717115402, "num_tokens": 48387098.0, "step": 23660 }, { "entropy": 0.5627901503816247, "epoch": 0.38443110854859797, "grad_norm": 11.875, "learning_rate": 3.4621565168906025e-05, "loss": 0.571068525314331, "mean_token_accuracy": 0.8591080777347088, "num_tokens": 48407647.0, "step": 23670 }, { "entropy": 0.5305544070899486, "epoch": 0.3845935213532235, "grad_norm": 8.5, "learning_rate": 3.460959626676155e-05, "loss": 0.47148799896240234, "mean_token_accuracy": 0.8746775396168232, "num_tokens": 48428915.0, "step": 23680 }, { "entropy": 0.5250191957689821, "epoch": 0.384755934157849, "grad_norm": 13.25, "learning_rate": 3.4597624779614086e-05, "loss": 0.5076956748962402, "mean_token_accuracy": 0.8702695377171039, "num_tokens": 48449356.0, "step": 23690 }, { "entropy": 0.42083700983785094, "epoch": 0.3849183469624745, "grad_norm": 10.25, "learning_rate": 3.458565071068398e-05, "loss": 0.45928044319152833, "mean_token_accuracy": 0.8880272328853607, "num_tokens": 48469611.0, "step": 23700 }, { "entropy": 0.5583666137652472, "epoch": 0.38508075976710004, "grad_norm": 8.6875, "learning_rate": 3.4573674063192296e-05, "loss": 0.6178882122039795, "mean_token_accuracy": 0.8414328459650278, "num_tokens": 48489744.0, "step": 23710 }, { "entropy": 0.5521074629854411, "epoch": 0.3852431725717256, "grad_norm": 10.0, "learning_rate": 3.4561694840360776e-05, "loss": 0.5744510650634765, "mean_token_accuracy": 0.8531186789274215, "num_tokens": 48509799.0, "step": 23720 }, { "entropy": 0.5598664331249893, "epoch": 0.38540558537635106, "grad_norm": 6.71875, "learning_rate": 3.454971304541185e-05, "loss": 0.5660371780395508, "mean_token_accuracy": 0.8550675347447395, "num_tokens": 48530507.0, "step": 23730 }, { "entropy": 0.5949550493620336, "epoch": 0.3855679981809766, "grad_norm": 7.84375, "learning_rate": 3.4537728681568655e-05, "loss": 0.5599926948547364, "mean_token_accuracy": 0.8594248220324516, "num_tokens": 48551102.0, "step": 23740 }, { "entropy": 0.4969536532647908, "epoch": 0.3857304109856021, "grad_norm": 9.5625, "learning_rate": 3.4525741752055013e-05, "loss": 0.4961082458496094, "mean_token_accuracy": 0.8666239030659199, "num_tokens": 48570677.0, "step": 23750 }, { "entropy": 0.5967108998447657, "epoch": 0.3858928237902276, "grad_norm": 14.0625, "learning_rate": 3.451375226009543e-05, "loss": 0.6018310070037842, "mean_token_accuracy": 0.8561515100300312, "num_tokens": 48590468.0, "step": 23760 }, { "entropy": 0.47868533805012703, "epoch": 0.38605523659485314, "grad_norm": 5.625, "learning_rate": 3.4501760208915106e-05, "loss": 0.47731552124023435, "mean_token_accuracy": 0.871814139187336, "num_tokens": 48611502.0, "step": 23770 }, { "entropy": 0.563042457215488, "epoch": 0.38621764939947867, "grad_norm": 8.6875, "learning_rate": 3.448976560173993e-05, "loss": 0.5868594169616699, "mean_token_accuracy": 0.8435235068202018, "num_tokens": 48631909.0, "step": 23780 }, { "entropy": 0.5629034579265862, "epoch": 0.38638006220410415, "grad_norm": 7.34375, "learning_rate": 3.4477768441796484e-05, "loss": 0.5925994396209717, "mean_token_accuracy": 0.8596901133656502, "num_tokens": 48651263.0, "step": 23790 }, { "entropy": 0.5777868398465216, "epoch": 0.3865424750087297, "grad_norm": 8.6875, "learning_rate": 3.446576873231203e-05, "loss": 0.569429349899292, "mean_token_accuracy": 0.8620200663805008, "num_tokens": 48671950.0, "step": 23800 }, { "entropy": 0.4785087413620204, "epoch": 0.3867048878133552, "grad_norm": 9.125, "learning_rate": 3.445376647651452e-05, "loss": 0.476682710647583, "mean_token_accuracy": 0.880969313532114, "num_tokens": 48691954.0, "step": 23810 }, { "entropy": 0.5805737585760653, "epoch": 0.38686730061798075, "grad_norm": 9.3125, "learning_rate": 3.4441761677632564e-05, "loss": 0.5855605125427246, "mean_token_accuracy": 0.8499524317681789, "num_tokens": 48712790.0, "step": 23820 }, { "entropy": 0.5424793984740972, "epoch": 0.3870297134226062, "grad_norm": 8.875, "learning_rate": 3.4429754338895505e-05, "loss": 0.5154288291931153, "mean_token_accuracy": 0.8689431592822074, "num_tokens": 48732732.0, "step": 23830 }, { "entropy": 0.5817006151657551, "epoch": 0.38719212622723176, "grad_norm": 7.34375, "learning_rate": 3.441774446353334e-05, "loss": 0.593597412109375, "mean_token_accuracy": 0.8492477923631668, "num_tokens": 48754507.0, "step": 23840 }, { "entropy": 0.5576871499419213, "epoch": 0.3873545390318573, "grad_norm": 12.0, "learning_rate": 3.440573205477675e-05, "loss": 0.5655125617980957, "mean_token_accuracy": 0.8645967841148376, "num_tokens": 48774367.0, "step": 23850 }, { "entropy": 0.4901885537430644, "epoch": 0.38751695183648277, "grad_norm": 6.625, "learning_rate": 3.4393717115857094e-05, "loss": 0.4879577159881592, "mean_token_accuracy": 0.8758647382259369, "num_tokens": 48794526.0, "step": 23860 }, { "entropy": 0.5840347717981785, "epoch": 0.3876793646411083, "grad_norm": 10.75, "learning_rate": 3.438169965000643e-05, "loss": 0.5695525169372558, "mean_token_accuracy": 0.8586090043187141, "num_tokens": 48815849.0, "step": 23870 }, { "entropy": 0.49606708558276297, "epoch": 0.38784177744573384, "grad_norm": 7.28125, "learning_rate": 3.436967966045747e-05, "loss": 0.49727258682250974, "mean_token_accuracy": 0.8652135841548443, "num_tokens": 48834996.0, "step": 23880 }, { "entropy": 0.5342682395130396, "epoch": 0.3880041902503593, "grad_norm": 7.0625, "learning_rate": 3.435765715044362e-05, "loss": 0.5263957500457763, "mean_token_accuracy": 0.8688271194696426, "num_tokens": 48855301.0, "step": 23890 }, { "entropy": 0.5678919623605907, "epoch": 0.38816660305498485, "grad_norm": 8.5, "learning_rate": 3.434563212319897e-05, "loss": 0.5671892166137695, "mean_token_accuracy": 0.8622882030904293, "num_tokens": 48875417.0, "step": 23900 }, { "entropy": 0.5210700994823128, "epoch": 0.3883290158596104, "grad_norm": 7.84375, "learning_rate": 3.4333604581958286e-05, "loss": 0.5360320091247559, "mean_token_accuracy": 0.8665295284241438, "num_tokens": 48895209.0, "step": 23910 }, { "entropy": 0.5094985549338162, "epoch": 0.3884914286642359, "grad_norm": 5.40625, "learning_rate": 3.432157452995699e-05, "loss": 0.48364906311035155, "mean_token_accuracy": 0.8690386734902859, "num_tokens": 48915045.0, "step": 23920 }, { "entropy": 0.48963782461360095, "epoch": 0.3886538414688614, "grad_norm": 7.875, "learning_rate": 3.430954197043119e-05, "loss": 0.5120352745056153, "mean_token_accuracy": 0.870234988629818, "num_tokens": 48935903.0, "step": 23930 }, { "entropy": 0.562684582080692, "epoch": 0.3888162542734869, "grad_norm": 8.6875, "learning_rate": 3.4297506906617674e-05, "loss": 0.5709455013275146, "mean_token_accuracy": 0.857391194626689, "num_tokens": 48955559.0, "step": 23940 }, { "entropy": 0.47424800116568805, "epoch": 0.38897866707811246, "grad_norm": 7.5625, "learning_rate": 3.428546934175391e-05, "loss": 0.4597425937652588, "mean_token_accuracy": 0.8867179691791535, "num_tokens": 48977027.0, "step": 23950 }, { "entropy": 0.5251229098532348, "epoch": 0.38914107988273794, "grad_norm": 7.8125, "learning_rate": 3.4273429279078026e-05, "loss": 0.5439733505249024, "mean_token_accuracy": 0.8640069529414177, "num_tokens": 48997590.0, "step": 23960 }, { "entropy": 0.5697257700841873, "epoch": 0.3893034926873635, "grad_norm": 10.0, "learning_rate": 3.4261386721828825e-05, "loss": 0.5587650299072265, "mean_token_accuracy": 0.8628555290400982, "num_tokens": 49016902.0, "step": 23970 }, { "entropy": 0.4703827913152054, "epoch": 0.389465905491989, "grad_norm": 4.96875, "learning_rate": 3.424934167324579e-05, "loss": 0.464036750793457, "mean_token_accuracy": 0.8807435438036919, "num_tokens": 49036684.0, "step": 23980 }, { "entropy": 0.5090048952028156, "epoch": 0.3896283182966145, "grad_norm": 6.4375, "learning_rate": 3.423729413656905e-05, "loss": 0.5437698364257812, "mean_token_accuracy": 0.8648832157254219, "num_tokens": 49057995.0, "step": 23990 }, { "epoch": 0.38979073110124, "eval_entropy": 0.5637254813313484, "eval_loss": 0.5675074458122253, "eval_mean_token_accuracy": 0.8551123147010803, "eval_num_tokens": 49078774.0, "eval_runtime": 40.294, "eval_samples_per_second": 49.635, "eval_steps_per_second": 6.204, "step": 24000 }, { "entropy": 0.5470815454609692, "epoch": 0.38995314390586555, "grad_norm": 5.375, "learning_rate": 3.4213191611898405e-05, "loss": 0.5593103885650634, "mean_token_accuracy": 0.8582735929638148, "num_tokens": 49099171.0, "step": 24010 }, { "entropy": 0.5273791500367224, "epoch": 0.39011555671049103, "grad_norm": 5.9375, "learning_rate": 3.420113663038814e-05, "loss": 0.5481484413146973, "mean_token_accuracy": 0.85798534527421, "num_tokens": 49119274.0, "step": 24020 }, { "entropy": 0.5714621988590807, "epoch": 0.39027796951511656, "grad_norm": 8.0625, "learning_rate": 3.418907917375144e-05, "loss": 0.5809464931488038, "mean_token_accuracy": 0.859968900680542, "num_tokens": 49139083.0, "step": 24030 }, { "entropy": 0.5914743417873979, "epoch": 0.3904403823197421, "grad_norm": 8.9375, "learning_rate": 3.4177019245231786e-05, "loss": 0.5923002243041993, "mean_token_accuracy": 0.8478016547858716, "num_tokens": 49159312.0, "step": 24040 }, { "entropy": 0.5385115864686668, "epoch": 0.39060279512436763, "grad_norm": 7.15625, "learning_rate": 3.4164956848073336e-05, "loss": 0.5466501235961914, "mean_token_accuracy": 0.8565024055540562, "num_tokens": 49180250.0, "step": 24050 }, { "entropy": 0.5059388472698629, "epoch": 0.3907652079289931, "grad_norm": 6.75, "learning_rate": 3.4152891985520894e-05, "loss": 0.5066898345947266, "mean_token_accuracy": 0.8683594718575478, "num_tokens": 49201019.0, "step": 24060 }, { "entropy": 0.5544144594110548, "epoch": 0.39092762073361864, "grad_norm": 9.75, "learning_rate": 3.4140824660819946e-05, "loss": 0.5690405368804932, "mean_token_accuracy": 0.8509377285838127, "num_tokens": 49220995.0, "step": 24070 }, { "entropy": 0.5950842717662453, "epoch": 0.3910900335382442, "grad_norm": 5.0625, "learning_rate": 3.4128754877216606e-05, "loss": 0.5678687572479248, "mean_token_accuracy": 0.8584673322737217, "num_tokens": 49241743.0, "step": 24080 }, { "entropy": 0.544534741831012, "epoch": 0.39125244634286965, "grad_norm": 9.25, "learning_rate": 3.4116682637957707e-05, "loss": 0.5424981117248535, "mean_token_accuracy": 0.8638590648770332, "num_tokens": 49262114.0, "step": 24090 }, { "entropy": 0.5847654730081558, "epoch": 0.3914148591474952, "grad_norm": 8.8125, "learning_rate": 3.410460794629068e-05, "loss": 0.6122738361358643, "mean_token_accuracy": 0.8516114003956318, "num_tokens": 49283411.0, "step": 24100 }, { "entropy": 0.5177680325694383, "epoch": 0.3915772719521207, "grad_norm": 9.75, "learning_rate": 3.4092530805463655e-05, "loss": 0.53689546585083, "mean_token_accuracy": 0.8627045162022113, "num_tokens": 49303443.0, "step": 24110 }, { "entropy": 0.5199734096881002, "epoch": 0.3917396847567462, "grad_norm": 7.53125, "learning_rate": 3.408045121872541e-05, "loss": 0.4856442928314209, "mean_token_accuracy": 0.881899195164442, "num_tokens": 49323782.0, "step": 24120 }, { "entropy": 0.513450882351026, "epoch": 0.39190209756137173, "grad_norm": 8.1875, "learning_rate": 3.406836918932538e-05, "loss": 0.5112613201141357, "mean_token_accuracy": 0.8693561427295208, "num_tokens": 49343626.0, "step": 24130 }, { "entropy": 0.5693189200013876, "epoch": 0.39206451036599727, "grad_norm": 8.625, "learning_rate": 3.405628472051365e-05, "loss": 0.591523265838623, "mean_token_accuracy": 0.8597451001405716, "num_tokens": 49364281.0, "step": 24140 }, { "entropy": 0.5522109396755696, "epoch": 0.3922269231706228, "grad_norm": 7.75, "learning_rate": 3.404419781554099e-05, "loss": 0.5487237930297851, "mean_token_accuracy": 0.8625265426933766, "num_tokens": 49384550.0, "step": 24150 }, { "entropy": 0.593453058693558, "epoch": 0.3923893359752483, "grad_norm": 7.3125, "learning_rate": 3.403210847765878e-05, "loss": 0.6052311897277832, "mean_token_accuracy": 0.8471031688153744, "num_tokens": 49404580.0, "step": 24160 }, { "entropy": 0.5515667457133532, "epoch": 0.3925517487798738, "grad_norm": 11.75, "learning_rate": 3.4020016710119104e-05, "loss": 0.5541321277618408, "mean_token_accuracy": 0.8659717224538326, "num_tokens": 49425312.0, "step": 24170 }, { "entropy": 0.5102088353596628, "epoch": 0.39271416158449934, "grad_norm": 11.125, "learning_rate": 3.4007922516174665e-05, "loss": 0.5203387260437011, "mean_token_accuracy": 0.8678213790059089, "num_tokens": 49445943.0, "step": 24180 }, { "entropy": 0.521721200272441, "epoch": 0.3928765743891248, "grad_norm": 14.0625, "learning_rate": 3.399582589907881e-05, "loss": 0.5335447311401367, "mean_token_accuracy": 0.8675961889326572, "num_tokens": 49465942.0, "step": 24190 }, { "entropy": 0.5248227306175977, "epoch": 0.39303898719375036, "grad_norm": 6.8125, "learning_rate": 3.398372686208557e-05, "loss": 0.4982480049133301, "mean_token_accuracy": 0.875780388712883, "num_tokens": 49485004.0, "step": 24200 }, { "entropy": 0.5399140848778188, "epoch": 0.3932013999983759, "grad_norm": 7.96875, "learning_rate": 3.397162540844963e-05, "loss": 0.5400734424591065, "mean_token_accuracy": 0.8679162740707398, "num_tokens": 49504741.0, "step": 24210 }, { "entropy": 0.6539133792743087, "epoch": 0.39336381280300137, "grad_norm": 9.1875, "learning_rate": 3.395952154142628e-05, "loss": 0.7067049026489258, "mean_token_accuracy": 0.8358887210488319, "num_tokens": 49525284.0, "step": 24220 }, { "entropy": 0.5917888195253909, "epoch": 0.3935262256076269, "grad_norm": 10.1875, "learning_rate": 3.39474152642715e-05, "loss": 0.6000495433807373, "mean_token_accuracy": 0.8480644874274731, "num_tokens": 49544947.0, "step": 24230 }, { "entropy": 0.4984207819681615, "epoch": 0.39368863841225243, "grad_norm": 8.625, "learning_rate": 3.393530658024191e-05, "loss": 0.47518553733825686, "mean_token_accuracy": 0.8829759016633034, "num_tokens": 49565151.0, "step": 24240 }, { "entropy": 0.5419592611724511, "epoch": 0.3938510512168779, "grad_norm": 5.3125, "learning_rate": 3.3923195492594776e-05, "loss": 0.5468581676483154, "mean_token_accuracy": 0.8680461443960666, "num_tokens": 49586642.0, "step": 24250 }, { "entropy": 0.5260915311053396, "epoch": 0.39401346402150345, "grad_norm": 5.96875, "learning_rate": 3.3911082004588e-05, "loss": 0.5469674110412598, "mean_token_accuracy": 0.8541105460375548, "num_tokens": 49606186.0, "step": 24260 }, { "entropy": 0.47945679258555174, "epoch": 0.394175876826129, "grad_norm": 8.375, "learning_rate": 3.3898966119480125e-05, "loss": 0.4717095375061035, "mean_token_accuracy": 0.8782904975116252, "num_tokens": 49625578.0, "step": 24270 }, { "entropy": 0.4894809193909168, "epoch": 0.3943382896307545, "grad_norm": 8.375, "learning_rate": 3.3886847840530374e-05, "loss": 0.5080100536346436, "mean_token_accuracy": 0.8695916786789895, "num_tokens": 49645466.0, "step": 24280 }, { "entropy": 0.5191498143598438, "epoch": 0.39450070243538, "grad_norm": 8.6875, "learning_rate": 3.3874727170998574e-05, "loss": 0.5614278793334961, "mean_token_accuracy": 0.8652841538190842, "num_tokens": 49666219.0, "step": 24290 }, { "entropy": 0.556421373737976, "epoch": 0.3946631152400055, "grad_norm": 7.15625, "learning_rate": 3.386260411414523e-05, "loss": 0.5604465007781982, "mean_token_accuracy": 0.8581210598349571, "num_tokens": 49685223.0, "step": 24300 }, { "entropy": 0.48089061630889773, "epoch": 0.39482552804463106, "grad_norm": 7.8125, "learning_rate": 3.385047867323145e-05, "loss": 0.44666128158569335, "mean_token_accuracy": 0.8811507910490036, "num_tokens": 49705750.0, "step": 24310 }, { "entropy": 0.5026311038527638, "epoch": 0.39498794084925654, "grad_norm": 8.0, "learning_rate": 3.383835085151904e-05, "loss": 0.4860729694366455, "mean_token_accuracy": 0.8721625335514546, "num_tokens": 49726102.0, "step": 24320 }, { "entropy": 0.6206942440476269, "epoch": 0.39515035365388207, "grad_norm": 7.59375, "learning_rate": 3.3826220652270365e-05, "loss": 0.6403229236602783, "mean_token_accuracy": 0.8495640516281128, "num_tokens": 49746757.0, "step": 24330 }, { "entropy": 0.6080902880057693, "epoch": 0.3953127664585076, "grad_norm": 8.6875, "learning_rate": 3.381408807874852e-05, "loss": 0.6647547245025635, "mean_token_accuracy": 0.8369383759796619, "num_tokens": 49767947.0, "step": 24340 }, { "entropy": 0.562875070096925, "epoch": 0.3954751792631331, "grad_norm": 10.375, "learning_rate": 3.380195313421715e-05, "loss": 0.5710540294647217, "mean_token_accuracy": 0.8555803343653678, "num_tokens": 49788844.0, "step": 24350 }, { "entropy": 0.5438224884681404, "epoch": 0.3956375920677586, "grad_norm": 7.46875, "learning_rate": 3.378981582194062e-05, "loss": 0.5352099895477295, "mean_token_accuracy": 0.8640500456094742, "num_tokens": 49809020.0, "step": 24360 }, { "entropy": 0.5487508226651698, "epoch": 0.39580000487238415, "grad_norm": 6.53125, "learning_rate": 3.377767614518388e-05, "loss": 0.5067363739013672, "mean_token_accuracy": 0.8645423963665962, "num_tokens": 49830165.0, "step": 24370 }, { "entropy": 0.45935055054724216, "epoch": 0.3959624176770097, "grad_norm": 6.40625, "learning_rate": 3.376553410721252e-05, "loss": 0.44804673194885253, "mean_token_accuracy": 0.8846891708672047, "num_tokens": 49849847.0, "step": 24380 }, { "entropy": 0.5758420048980042, "epoch": 0.39612483048163516, "grad_norm": 6.78125, "learning_rate": 3.375338971129279e-05, "loss": 0.5575816631317139, "mean_token_accuracy": 0.8618034847080708, "num_tokens": 49870067.0, "step": 24390 }, { "entropy": 0.45775031694211066, "epoch": 0.3962872432862607, "grad_norm": 6.5, "learning_rate": 3.374124296069156e-05, "loss": 0.4685710906982422, "mean_token_accuracy": 0.878773408383131, "num_tokens": 49890641.0, "step": 24400 }, { "entropy": 0.4571589208673686, "epoch": 0.3964496560908862, "grad_norm": 6.0625, "learning_rate": 3.372909385867633e-05, "loss": 0.4606015205383301, "mean_token_accuracy": 0.8764919295907021, "num_tokens": 49910677.0, "step": 24410 }, { "entropy": 0.5417944345623255, "epoch": 0.3966120688955117, "grad_norm": 8.625, "learning_rate": 3.3716942408515226e-05, "loss": 0.5845203399658203, "mean_token_accuracy": 0.8530892439186573, "num_tokens": 49930442.0, "step": 24420 }, { "entropy": 0.583834565198049, "epoch": 0.39677448170013724, "grad_norm": 7.125, "learning_rate": 3.370478861347703e-05, "loss": 0.6038324356079101, "mean_token_accuracy": 0.8622652448713779, "num_tokens": 49952232.0, "step": 24430 }, { "entropy": 0.5695758547633887, "epoch": 0.39693689450476277, "grad_norm": 7.8125, "learning_rate": 3.369263247683114e-05, "loss": 0.605810546875, "mean_token_accuracy": 0.8507026106119155, "num_tokens": 49973416.0, "step": 24440 }, { "entropy": 0.5338407902047038, "epoch": 0.39709930730938825, "grad_norm": 8.5, "learning_rate": 3.368047400184757e-05, "loss": 0.5314123630523682, "mean_token_accuracy": 0.8644703276455402, "num_tokens": 49993341.0, "step": 24450 }, { "entropy": 0.587674260744825, "epoch": 0.3972617201140138, "grad_norm": 6.90625, "learning_rate": 3.3668313191796984e-05, "loss": 0.5830754280090332, "mean_token_accuracy": 0.849614730104804, "num_tokens": 50012579.0, "step": 24460 }, { "entropy": 0.5092047724872828, "epoch": 0.3974241329186393, "grad_norm": 8.875, "learning_rate": 3.365615004995067e-05, "loss": 0.521315050125122, "mean_token_accuracy": 0.8619146205484867, "num_tokens": 50033066.0, "step": 24470 }, { "entropy": 0.5565886603202671, "epoch": 0.3975865457232648, "grad_norm": 6.5, "learning_rate": 3.364398457958055e-05, "loss": 0.5631035804748535, "mean_token_accuracy": 0.8540438883006573, "num_tokens": 50054324.0, "step": 24480 }, { "entropy": 0.5142906873952597, "epoch": 0.39774895852789033, "grad_norm": 14.375, "learning_rate": 3.3631816783959136e-05, "loss": 0.5352102756500244, "mean_token_accuracy": 0.8597650971263647, "num_tokens": 50073873.0, "step": 24490 }, { "entropy": 0.564775818400085, "epoch": 0.39791137133251586, "grad_norm": 8.3125, "learning_rate": 3.361964666635962e-05, "loss": 0.5884331703186035, "mean_token_accuracy": 0.8570561379194259, "num_tokens": 50093299.0, "step": 24500 }, { "entropy": 0.5846339884679764, "epoch": 0.3980737841371414, "grad_norm": 6.1875, "learning_rate": 3.360747423005577e-05, "loss": 0.6248421192169189, "mean_token_accuracy": 0.8512643650174141, "num_tokens": 50113942.0, "step": 24510 }, { "entropy": 0.5850527752190828, "epoch": 0.3982361969417669, "grad_norm": 10.8125, "learning_rate": 3.3595299478322017e-05, "loss": 0.5873960018157959, "mean_token_accuracy": 0.8515430822968483, "num_tokens": 50134492.0, "step": 24520 }, { "entropy": 0.5614682870917023, "epoch": 0.3983986097463924, "grad_norm": 8.5, "learning_rate": 3.358312241443338e-05, "loss": 0.5744276523590088, "mean_token_accuracy": 0.8537463754415512, "num_tokens": 50155004.0, "step": 24530 }, { "entropy": 0.5558976626023651, "epoch": 0.39856102255101794, "grad_norm": 8.4375, "learning_rate": 3.357094304166553e-05, "loss": 0.5068215370178223, "mean_token_accuracy": 0.8669219389557838, "num_tokens": 50174133.0, "step": 24540 }, { "entropy": 0.6058720836881548, "epoch": 0.3987234353556434, "grad_norm": 8.6875, "learning_rate": 3.355876136329473e-05, "loss": 0.6238439559936524, "mean_token_accuracy": 0.8591556489467621, "num_tokens": 50195298.0, "step": 24550 }, { "entropy": 0.5775792581262067, "epoch": 0.39888584816026895, "grad_norm": 8.75, "learning_rate": 3.3546577382597896e-05, "loss": 0.6167443275451661, "mean_token_accuracy": 0.8506046891212463, "num_tokens": 50216301.0, "step": 24560 }, { "entropy": 0.5926234765443951, "epoch": 0.3990482609648945, "grad_norm": 6.46875, "learning_rate": 3.353439110285254e-05, "loss": 0.571668291091919, "mean_token_accuracy": 0.8554886281490326, "num_tokens": 50236744.0, "step": 24570 }, { "entropy": 0.5382444981485606, "epoch": 0.39921067376951996, "grad_norm": 6.3125, "learning_rate": 3.35222025273368e-05, "loss": 0.5097333908081054, "mean_token_accuracy": 0.8638208977878093, "num_tokens": 50257176.0, "step": 24580 }, { "entropy": 0.5809641570784152, "epoch": 0.3993730865741455, "grad_norm": 6.84375, "learning_rate": 3.351001165932942e-05, "loss": 0.5785306453704834, "mean_token_accuracy": 0.8542505957186222, "num_tokens": 50277880.0, "step": 24590 }, { "entropy": 0.5576749980449677, "epoch": 0.39953549937877103, "grad_norm": 9.4375, "learning_rate": 3.3497818502109787e-05, "loss": 0.5372408390045166, "mean_token_accuracy": 0.8587405133992434, "num_tokens": 50298402.0, "step": 24600 }, { "entropy": 0.5698979392182082, "epoch": 0.39969791218339656, "grad_norm": 6.71875, "learning_rate": 3.348562305895787e-05, "loss": 0.5533380508422852, "mean_token_accuracy": 0.8619211509823799, "num_tokens": 50318902.0, "step": 24610 }, { "entropy": 0.5035459279548377, "epoch": 0.39986032498802204, "grad_norm": 8.5, "learning_rate": 3.3473425333154286e-05, "loss": 0.48060007095336915, "mean_token_accuracy": 0.8768001101911068, "num_tokens": 50339801.0, "step": 24620 }, { "entropy": 0.4768885377794504, "epoch": 0.4000227377926476, "grad_norm": 7.03125, "learning_rate": 3.3461225327980236e-05, "loss": 0.4980560302734375, "mean_token_accuracy": 0.8777055807411671, "num_tokens": 50359692.0, "step": 24630 }, { "entropy": 0.5606810877099633, "epoch": 0.4001851505972731, "grad_norm": 8.625, "learning_rate": 3.3449023046717574e-05, "loss": 0.6263270854949952, "mean_token_accuracy": 0.8446399018168449, "num_tokens": 50380089.0, "step": 24640 }, { "entropy": 0.567219059728086, "epoch": 0.4003475634018986, "grad_norm": 7.6875, "learning_rate": 3.343681849264871e-05, "loss": 0.5682858943939209, "mean_token_accuracy": 0.8557911373674869, "num_tokens": 50401013.0, "step": 24650 }, { "entropy": 0.5201390456175432, "epoch": 0.4005099762065241, "grad_norm": 6.90625, "learning_rate": 3.3424611669056724e-05, "loss": 0.5405611515045166, "mean_token_accuracy": 0.865534345805645, "num_tokens": 50421210.0, "step": 24660 }, { "entropy": 0.5210041671991348, "epoch": 0.40067238901114965, "grad_norm": 7.78125, "learning_rate": 3.341240257922526e-05, "loss": 0.5044244289398193, "mean_token_accuracy": 0.8687691271305085, "num_tokens": 50441565.0, "step": 24670 }, { "entropy": 0.5202719015069306, "epoch": 0.40083480181577513, "grad_norm": 5.40625, "learning_rate": 3.340019122643859e-05, "loss": 0.48703689575195314, "mean_token_accuracy": 0.8775925043970346, "num_tokens": 50461385.0, "step": 24680 }, { "entropy": 0.424806459993124, "epoch": 0.40099721462040067, "grad_norm": 6.125, "learning_rate": 3.33879776139816e-05, "loss": 0.4296908378601074, "mean_token_accuracy": 0.8890633910894394, "num_tokens": 50481043.0, "step": 24690 }, { "entropy": 0.5221292734146118, "epoch": 0.4011596274250262, "grad_norm": 7.78125, "learning_rate": 3.3375761745139796e-05, "loss": 0.5456648349761963, "mean_token_accuracy": 0.8620258621871472, "num_tokens": 50501461.0, "step": 24700 }, { "entropy": 0.5230364803224802, "epoch": 0.40132204022965173, "grad_norm": 9.0, "learning_rate": 3.3363543623199244e-05, "loss": 0.5583702087402344, "mean_token_accuracy": 0.8629333063960075, "num_tokens": 50524402.0, "step": 24710 }, { "entropy": 0.5414495103526861, "epoch": 0.4014844530342772, "grad_norm": 6.28125, "learning_rate": 3.335132325144667e-05, "loss": 0.5327662944793701, "mean_token_accuracy": 0.8654169566929341, "num_tokens": 50545037.0, "step": 24720 }, { "entropy": 0.5475381553173065, "epoch": 0.40164686583890274, "grad_norm": 8.9375, "learning_rate": 3.333910063316937e-05, "loss": 0.4954291820526123, "mean_token_accuracy": 0.8769735060632229, "num_tokens": 50564929.0, "step": 24730 }, { "entropy": 0.5223632203880697, "epoch": 0.4018092786435283, "grad_norm": 12.375, "learning_rate": 3.332687577165526e-05, "loss": 0.5556440830230713, "mean_token_accuracy": 0.862972405552864, "num_tokens": 50585969.0, "step": 24740 }, { "entropy": 0.536286451946944, "epoch": 0.40197169144815376, "grad_norm": 10.375, "learning_rate": 3.331464867019286e-05, "loss": 0.5522490501403808, "mean_token_accuracy": 0.8656185768544674, "num_tokens": 50606386.0, "step": 24750 }, { "entropy": 0.4679999236017466, "epoch": 0.4021341042527793, "grad_norm": 7.0625, "learning_rate": 3.3302419332071264e-05, "loss": 0.5227734565734863, "mean_token_accuracy": 0.8635454043745995, "num_tokens": 50625576.0, "step": 24760 }, { "entropy": 0.588271027058363, "epoch": 0.4022965170574048, "grad_norm": 8.875, "learning_rate": 3.3290187760580224e-05, "loss": 0.6271987915039062, "mean_token_accuracy": 0.8493224211037159, "num_tokens": 50645384.0, "step": 24770 }, { "entropy": 0.5425276891328394, "epoch": 0.4024589298620303, "grad_norm": 7.0625, "learning_rate": 3.327795395901004e-05, "loss": 0.509632158279419, "mean_token_accuracy": 0.8600460760295391, "num_tokens": 50667221.0, "step": 24780 }, { "entropy": 0.5516342369839549, "epoch": 0.40262134266665583, "grad_norm": 7.0, "learning_rate": 3.326571793065164e-05, "loss": 0.5292848110198974, "mean_token_accuracy": 0.8611587196588516, "num_tokens": 50688163.0, "step": 24790 }, { "entropy": 0.5037799165584147, "epoch": 0.40278375547128137, "grad_norm": 7.59375, "learning_rate": 3.325347967879654e-05, "loss": 0.5035677433013916, "mean_token_accuracy": 0.8791987538337708, "num_tokens": 50709200.0, "step": 24800 }, { "entropy": 0.5215102039743215, "epoch": 0.40294616827590685, "grad_norm": 7.0, "learning_rate": 3.324123920673685e-05, "loss": 0.549717903137207, "mean_token_accuracy": 0.8651593759655952, "num_tokens": 50729448.0, "step": 24810 }, { "entropy": 0.5296195364557207, "epoch": 0.4031085810805324, "grad_norm": 7.53125, "learning_rate": 3.322899651776531e-05, "loss": 0.5221252918243409, "mean_token_accuracy": 0.8729255452752114, "num_tokens": 50750465.0, "step": 24820 }, { "entropy": 0.5017266682349145, "epoch": 0.4032709938851579, "grad_norm": 10.375, "learning_rate": 3.3216751615175204e-05, "loss": 0.5189737796783447, "mean_token_accuracy": 0.8803450286388397, "num_tokens": 50770167.0, "step": 24830 }, { "entropy": 0.5359395843930542, "epoch": 0.40343340668978345, "grad_norm": 9.25, "learning_rate": 3.320450450226044e-05, "loss": 0.534287977218628, "mean_token_accuracy": 0.8644127279520035, "num_tokens": 50791229.0, "step": 24840 }, { "entropy": 0.5798644173890353, "epoch": 0.4035958194944089, "grad_norm": 12.875, "learning_rate": 3.3192255182315535e-05, "loss": 0.596154260635376, "mean_token_accuracy": 0.8500757347792387, "num_tokens": 50813451.0, "step": 24850 }, { "entropy": 0.5313674295321107, "epoch": 0.40375823229903446, "grad_norm": 8.0, "learning_rate": 3.318000365863558e-05, "loss": 0.5799715518951416, "mean_token_accuracy": 0.8544572860002517, "num_tokens": 50832349.0, "step": 24860 }, { "entropy": 0.5053093465976417, "epoch": 0.40392064510366, "grad_norm": 7.25, "learning_rate": 3.316774993451624e-05, "loss": 0.5047046661376953, "mean_token_accuracy": 0.8757122941315174, "num_tokens": 50852593.0, "step": 24870 }, { "entropy": 0.480148171633482, "epoch": 0.40408305790828547, "grad_norm": 8.1875, "learning_rate": 3.315549401325383e-05, "loss": 0.4358085632324219, "mean_token_accuracy": 0.8822451248764992, "num_tokens": 50872351.0, "step": 24880 }, { "entropy": 0.5351269998587668, "epoch": 0.404245470712911, "grad_norm": 8.875, "learning_rate": 3.314323589814519e-05, "loss": 0.5243041515350342, "mean_token_accuracy": 0.87459683008492, "num_tokens": 50892056.0, "step": 24890 }, { "entropy": 0.5375764241674915, "epoch": 0.40440788351753654, "grad_norm": 10.5, "learning_rate": 3.313097559248779e-05, "loss": 0.5837990760803222, "mean_token_accuracy": 0.862605344504118, "num_tokens": 50911746.0, "step": 24900 }, { "entropy": 0.5436143177561462, "epoch": 0.404570296322162, "grad_norm": 11.375, "learning_rate": 3.3118713099579695e-05, "loss": 0.5762386798858643, "mean_token_accuracy": 0.8500058472156524, "num_tokens": 50931745.0, "step": 24910 }, { "entropy": 0.5300541246077046, "epoch": 0.40473270912678755, "grad_norm": 6.3125, "learning_rate": 3.310644842271953e-05, "loss": 0.5195698261260986, "mean_token_accuracy": 0.8673166073858738, "num_tokens": 50952171.0, "step": 24920 }, { "entropy": 0.5580717776436359, "epoch": 0.4048951219314131, "grad_norm": 12.5, "learning_rate": 3.309418156520652e-05, "loss": 0.5701028823852539, "mean_token_accuracy": 0.8580047309398651, "num_tokens": 50972923.0, "step": 24930 }, { "entropy": 0.4800017481669784, "epoch": 0.4050575347360386, "grad_norm": 8.9375, "learning_rate": 3.308191253034047e-05, "loss": 0.4500971794128418, "mean_token_accuracy": 0.8837778083980083, "num_tokens": 50993112.0, "step": 24940 }, { "entropy": 0.4880117943510413, "epoch": 0.4052199475406641, "grad_norm": 7.3125, "learning_rate": 3.306964132142179e-05, "loss": 0.4946317195892334, "mean_token_accuracy": 0.8702634982764721, "num_tokens": 51012658.0, "step": 24950 }, { "entropy": 0.5226860797964037, "epoch": 0.4053823603452896, "grad_norm": 8.4375, "learning_rate": 3.305736794175146e-05, "loss": 0.5503151893615723, "mean_token_accuracy": 0.8650079503655433, "num_tokens": 51033008.0, "step": 24960 }, { "entropy": 0.5558324968907982, "epoch": 0.40554477314991516, "grad_norm": 6.65625, "learning_rate": 3.304509239463104e-05, "loss": 0.566602087020874, "mean_token_accuracy": 0.8595930002629757, "num_tokens": 51054426.0, "step": 24970 }, { "entropy": 0.5375002248678357, "epoch": 0.40570718595454064, "grad_norm": 12.875, "learning_rate": 3.30328146833627e-05, "loss": 0.5405380725860596, "mean_token_accuracy": 0.8717418611049652, "num_tokens": 51074224.0, "step": 24980 }, { "entropy": 0.5348454692400992, "epoch": 0.4058695987591662, "grad_norm": 5.59375, "learning_rate": 3.302053481124914e-05, "loss": 0.5977858543395996, "mean_token_accuracy": 0.855983504280448, "num_tokens": 51096757.0, "step": 24990 }, { "entropy": 0.5838438208214939, "epoch": 0.4060320115637917, "grad_norm": 14.875, "learning_rate": 3.3008252781593705e-05, "loss": 0.6205543518066406, "mean_token_accuracy": 0.8500596769154072, "num_tokens": 51119258.0, "step": 25000 }, { "entropy": 0.5193705357611179, "epoch": 0.4061944243684172, "grad_norm": 9.3125, "learning_rate": 3.299596859770027e-05, "loss": 0.5671008586883545, "mean_token_accuracy": 0.8613362364470959, "num_tokens": 51138247.0, "step": 25010 }, { "entropy": 0.5452842829748988, "epoch": 0.4063568371730427, "grad_norm": 8.6875, "learning_rate": 3.298368226287332e-05, "loss": 0.5821037292480469, "mean_token_accuracy": 0.8549463383853435, "num_tokens": 51157375.0, "step": 25020 }, { "entropy": 0.5559474711306394, "epoch": 0.40651924997766825, "grad_norm": 8.625, "learning_rate": 3.297139378041788e-05, "loss": 0.5703703403472901, "mean_token_accuracy": 0.8571316428482533, "num_tokens": 51177682.0, "step": 25030 }, { "entropy": 0.5868739212397486, "epoch": 0.40668166278229373, "grad_norm": 8.375, "learning_rate": 3.2959103153639616e-05, "loss": 0.5792486667633057, "mean_token_accuracy": 0.8579266123473644, "num_tokens": 51198079.0, "step": 25040 }, { "entropy": 0.4383959240280092, "epoch": 0.40684407558691926, "grad_norm": 6.78125, "learning_rate": 3.2946810385844705e-05, "loss": 0.44569907188415525, "mean_token_accuracy": 0.8822499930858612, "num_tokens": 51218068.0, "step": 25050 }, { "entropy": 0.5247417388949543, "epoch": 0.4070064883915448, "grad_norm": 10.3125, "learning_rate": 3.2934515480339945e-05, "loss": 0.4918965339660645, "mean_token_accuracy": 0.8747635371983051, "num_tokens": 51237900.0, "step": 25060 }, { "entropy": 0.4831520746462047, "epoch": 0.40716890119617033, "grad_norm": 11.6875, "learning_rate": 3.292221844043269e-05, "loss": 0.5054845809936523, "mean_token_accuracy": 0.8761356875300408, "num_tokens": 51257170.0, "step": 25070 }, { "entropy": 0.5313878068700433, "epoch": 0.4073313140007958, "grad_norm": 6.6875, "learning_rate": 3.290991926943087e-05, "loss": 0.508045244216919, "mean_token_accuracy": 0.871259118616581, "num_tokens": 51276177.0, "step": 25080 }, { "entropy": 0.5120634741149843, "epoch": 0.40749372680542134, "grad_norm": 6.0, "learning_rate": 3.2897617970642994e-05, "loss": 0.5466601371765136, "mean_token_accuracy": 0.8665314018726349, "num_tokens": 51296054.0, "step": 25090 }, { "entropy": 0.6233436285983771, "epoch": 0.4076561396100469, "grad_norm": 7.90625, "learning_rate": 3.288531454737812e-05, "loss": 0.6286232471466064, "mean_token_accuracy": 0.8417238719761372, "num_tokens": 51316457.0, "step": 25100 }, { "entropy": 0.5086704493500293, "epoch": 0.40781855241467235, "grad_norm": 7.34375, "learning_rate": 3.287300900294593e-05, "loss": 0.48212876319885256, "mean_token_accuracy": 0.8741145327687263, "num_tokens": 51337529.0, "step": 25110 }, { "entropy": 0.5538184839067981, "epoch": 0.4079809652192979, "grad_norm": 7.78125, "learning_rate": 3.286070134065662e-05, "loss": 0.569442892074585, "mean_token_accuracy": 0.8591975264251233, "num_tokens": 51357111.0, "step": 25120 }, { "entropy": 0.5504454242996871, "epoch": 0.4081433780239234, "grad_norm": 6.65625, "learning_rate": 3.284839156382098e-05, "loss": 0.5442337989807129, "mean_token_accuracy": 0.8666186206042766, "num_tokens": 51378062.0, "step": 25130 }, { "entropy": 0.5188783780671656, "epoch": 0.4083057908285489, "grad_norm": 7.5625, "learning_rate": 3.283607967575037e-05, "loss": 0.5225536823272705, "mean_token_accuracy": 0.8741969250142574, "num_tokens": 51397852.0, "step": 25140 }, { "entropy": 0.5153032909147441, "epoch": 0.40846820363317443, "grad_norm": 5.59375, "learning_rate": 3.282376567975672e-05, "loss": 0.5229459762573242, "mean_token_accuracy": 0.8715800285339356, "num_tokens": 51417793.0, "step": 25150 }, { "entropy": 0.5368939979467541, "epoch": 0.40863061643779997, "grad_norm": 9.1875, "learning_rate": 3.281144957915252e-05, "loss": 0.5754826068878174, "mean_token_accuracy": 0.8616510044783354, "num_tokens": 51440667.0, "step": 25160 }, { "entropy": 0.49383406941778957, "epoch": 0.4087930292424255, "grad_norm": 7.75, "learning_rate": 3.279913137725082e-05, "loss": 0.47629785537719727, "mean_token_accuracy": 0.8758905433118344, "num_tokens": 51461719.0, "step": 25170 }, { "entropy": 0.5647580330260098, "epoch": 0.408955442047051, "grad_norm": 6.09375, "learning_rate": 3.2786811077365265e-05, "loss": 0.5508701801300049, "mean_token_accuracy": 0.8634980488568544, "num_tokens": 51482187.0, "step": 25180 }, { "entropy": 0.5274709517136216, "epoch": 0.4091178548516765, "grad_norm": 5.21875, "learning_rate": 3.277448868281002e-05, "loss": 0.5422244548797608, "mean_token_accuracy": 0.8664735473692418, "num_tokens": 51503218.0, "step": 25190 }, { "entropy": 0.4733066062442958, "epoch": 0.40928026765630204, "grad_norm": 8.75, "learning_rate": 3.276216419689986e-05, "loss": 0.4914716720581055, "mean_token_accuracy": 0.8818962126970291, "num_tokens": 51522181.0, "step": 25200 }, { "entropy": 0.5192671744152904, "epoch": 0.4094426804609275, "grad_norm": 6.65625, "learning_rate": 3.2749837622950067e-05, "loss": 0.4869736671447754, "mean_token_accuracy": 0.8693846091628075, "num_tokens": 51542289.0, "step": 25210 }, { "entropy": 0.590949431899935, "epoch": 0.40960509326555306, "grad_norm": 7.375, "learning_rate": 3.2737508964276556e-05, "loss": 0.6090972423553467, "mean_token_accuracy": 0.8470668002963067, "num_tokens": 51564324.0, "step": 25220 }, { "entropy": 0.4933886076323688, "epoch": 0.4097675060701786, "grad_norm": 10.1875, "learning_rate": 3.272517822419573e-05, "loss": 0.5148904323577881, "mean_token_accuracy": 0.8677328310906887, "num_tokens": 51585350.0, "step": 25230 }, { "entropy": 0.5094031355343759, "epoch": 0.40992991887480407, "grad_norm": 4.9375, "learning_rate": 3.271284540602461e-05, "loss": 0.5282598018646241, "mean_token_accuracy": 0.8695204310119152, "num_tokens": 51605613.0, "step": 25240 }, { "entropy": 0.5088961606845259, "epoch": 0.4100923316794296, "grad_norm": 6.03125, "learning_rate": 3.270051051308074e-05, "loss": 0.5168599605560302, "mean_token_accuracy": 0.8719507984817028, "num_tokens": 51627366.0, "step": 25250 }, { "entropy": 0.5920502545777708, "epoch": 0.41025474448405513, "grad_norm": 7.53125, "learning_rate": 3.268817354868223e-05, "loss": 0.5765781402587891, "mean_token_accuracy": 0.8519936833530665, "num_tokens": 51648361.0, "step": 25260 }, { "entropy": 0.5519197563640773, "epoch": 0.4104171572886806, "grad_norm": 8.75, "learning_rate": 3.267583451614777e-05, "loss": 0.5451009750366211, "mean_token_accuracy": 0.8552171923220158, "num_tokens": 51668594.0, "step": 25270 }, { "entropy": 0.5631777686998248, "epoch": 0.41057957009330615, "grad_norm": 6.3125, "learning_rate": 3.2663493418796566e-05, "loss": 0.5508751392364502, "mean_token_accuracy": 0.8606623455882072, "num_tokens": 51689915.0, "step": 25280 }, { "entropy": 0.4951519231311977, "epoch": 0.4107419828979317, "grad_norm": 9.375, "learning_rate": 3.265115025994841e-05, "loss": 0.5097496032714843, "mean_token_accuracy": 0.8752794310450553, "num_tokens": 51709410.0, "step": 25290 }, { "entropy": 0.60302872704342, "epoch": 0.4109043957025572, "grad_norm": 7.96875, "learning_rate": 3.2638805042923635e-05, "loss": 0.5931108474731446, "mean_token_accuracy": 0.857911828905344, "num_tokens": 51730534.0, "step": 25300 }, { "entropy": 0.5163030728232115, "epoch": 0.4110668085071827, "grad_norm": 8.5, "learning_rate": 3.262645777104315e-05, "loss": 0.504947566986084, "mean_token_accuracy": 0.8620601341128349, "num_tokens": 51750419.0, "step": 25310 }, { "entropy": 0.6103019653353841, "epoch": 0.4112292213118082, "grad_norm": 7.46875, "learning_rate": 3.2614108447628376e-05, "loss": 0.6235942840576172, "mean_token_accuracy": 0.843829907476902, "num_tokens": 51772364.0, "step": 25320 }, { "entropy": 0.5975800118874759, "epoch": 0.41139163411643376, "grad_norm": 7.3125, "learning_rate": 3.260175707600132e-05, "loss": 0.6280171871185303, "mean_token_accuracy": 0.845548202842474, "num_tokens": 51793452.0, "step": 25330 }, { "entropy": 0.4531507635489106, "epoch": 0.41155404692105924, "grad_norm": 5.40625, "learning_rate": 3.258940365948452e-05, "loss": 0.4364427089691162, "mean_token_accuracy": 0.8826680421829224, "num_tokens": 51814768.0, "step": 25340 }, { "entropy": 0.5348030606284737, "epoch": 0.41171645972568477, "grad_norm": 9.1875, "learning_rate": 3.2577048201401085e-05, "loss": 0.5560841083526611, "mean_token_accuracy": 0.8594465799629688, "num_tokens": 51835517.0, "step": 25350 }, { "entropy": 0.5656724194064736, "epoch": 0.4118788725303103, "grad_norm": 7.25, "learning_rate": 3.256469070507466e-05, "loss": 0.5837292194366455, "mean_token_accuracy": 0.8510655704885721, "num_tokens": 51856206.0, "step": 25360 }, { "entropy": 0.5455660265404731, "epoch": 0.4120412853349358, "grad_norm": 8.5625, "learning_rate": 3.2552331173829424e-05, "loss": 0.5626893520355225, "mean_token_accuracy": 0.8596199974417686, "num_tokens": 51875750.0, "step": 25370 }, { "entropy": 0.5807529872749001, "epoch": 0.4122036981395613, "grad_norm": 7.15625, "learning_rate": 3.253996961099014e-05, "loss": 0.5728814601898193, "mean_token_accuracy": 0.8529332995414733, "num_tokens": 51897242.0, "step": 25380 }, { "entropy": 0.4849427772220224, "epoch": 0.41236611094418685, "grad_norm": 7.15625, "learning_rate": 3.2527606019882086e-05, "loss": 0.48970746994018555, "mean_token_accuracy": 0.8802861593663692, "num_tokens": 51916240.0, "step": 25390 }, { "entropy": 0.5293574736453592, "epoch": 0.4125285237488124, "grad_norm": 7.53125, "learning_rate": 3.251524040383108e-05, "loss": 0.5553319454193115, "mean_token_accuracy": 0.8593196079134942, "num_tokens": 51936543.0, "step": 25400 }, { "entropy": 0.5929553141817451, "epoch": 0.41269093655343786, "grad_norm": 8.4375, "learning_rate": 3.250287276616353e-05, "loss": 0.6112259864807129, "mean_token_accuracy": 0.8469288147985935, "num_tokens": 51955387.0, "step": 25410 }, { "entropy": 0.540330576710403, "epoch": 0.4128533493580634, "grad_norm": 6.5, "learning_rate": 3.249050311020634e-05, "loss": 0.5391010761260986, "mean_token_accuracy": 0.8628093712031841, "num_tokens": 51975647.0, "step": 25420 }, { "entropy": 0.520256845606491, "epoch": 0.4130157621626889, "grad_norm": 5.71875, "learning_rate": 3.247813143928698e-05, "loss": 0.5635770320892334, "mean_token_accuracy": 0.865212307870388, "num_tokens": 51996035.0, "step": 25430 }, { "entropy": 0.5693472034297884, "epoch": 0.4131781749673144, "grad_norm": 8.1875, "learning_rate": 3.2465757756733454e-05, "loss": 0.5446886539459228, "mean_token_accuracy": 0.8683592341840267, "num_tokens": 52016722.0, "step": 25440 }, { "entropy": 0.5002526983618736, "epoch": 0.41334058777193994, "grad_norm": 7.21875, "learning_rate": 3.245338206587432e-05, "loss": 0.47034468650817873, "mean_token_accuracy": 0.8788267187774181, "num_tokens": 52037205.0, "step": 25450 }, { "entropy": 0.5580893530510366, "epoch": 0.41350300057656547, "grad_norm": 6.65625, "learning_rate": 3.2441004370038656e-05, "loss": 0.5750881195068359, "mean_token_accuracy": 0.8579423114657402, "num_tokens": 52057299.0, "step": 25460 }, { "entropy": 0.5026374509092421, "epoch": 0.41366541338119095, "grad_norm": 6.3125, "learning_rate": 3.2428624672556095e-05, "loss": 0.5181890487670898, "mean_token_accuracy": 0.8667039625346661, "num_tokens": 52077676.0, "step": 25470 }, { "entropy": 0.4719900216907263, "epoch": 0.4138278261858165, "grad_norm": 9.4375, "learning_rate": 3.24162429767568e-05, "loss": 0.46311087608337403, "mean_token_accuracy": 0.8847668409347534, "num_tokens": 52096380.0, "step": 25480 }, { "entropy": 0.49754854626953604, "epoch": 0.413990238990442, "grad_norm": 7.3125, "learning_rate": 3.240385928597148e-05, "loss": 0.49266839027404785, "mean_token_accuracy": 0.8770412042737007, "num_tokens": 52116400.0, "step": 25490 }, { "entropy": 0.4713777111377567, "epoch": 0.41415265179506755, "grad_norm": 7.71875, "learning_rate": 3.2391473603531374e-05, "loss": 0.44735121726989746, "mean_token_accuracy": 0.8792950481176376, "num_tokens": 52136643.0, "step": 25500 }, { "entropy": 0.5501636788481846, "epoch": 0.41431506459969303, "grad_norm": 8.5, "learning_rate": 3.237908593276825e-05, "loss": 0.5728245258331299, "mean_token_accuracy": 0.8529164776206016, "num_tokens": 52156536.0, "step": 25510 }, { "entropy": 0.5381138104945421, "epoch": 0.41447747740431856, "grad_norm": 6.84375, "learning_rate": 3.236669627701443e-05, "loss": 0.5558248519897461, "mean_token_accuracy": 0.8595959283411503, "num_tokens": 52176535.0, "step": 25520 }, { "entropy": 0.5629498870112002, "epoch": 0.4146398902089441, "grad_norm": 8.0625, "learning_rate": 3.2354304639602765e-05, "loss": 0.5796255111694336, "mean_token_accuracy": 0.8553454361855983, "num_tokens": 52197749.0, "step": 25530 }, { "entropy": 0.5713775873184204, "epoch": 0.4148023030135696, "grad_norm": 8.75, "learning_rate": 3.2341911023866617e-05, "loss": 0.5597432613372803, "mean_token_accuracy": 0.8614897020161152, "num_tokens": 52218289.0, "step": 25540 }, { "entropy": 0.5614398820325732, "epoch": 0.4149647158181951, "grad_norm": 9.8125, "learning_rate": 3.2329515433139897e-05, "loss": 0.6000655651092529, "mean_token_accuracy": 0.8536012053489686, "num_tokens": 52240413.0, "step": 25550 }, { "entropy": 0.6442205234896392, "epoch": 0.41512712862282064, "grad_norm": 6.46875, "learning_rate": 3.231711787075706e-05, "loss": 0.6977475643157959, "mean_token_accuracy": 0.8337103236466646, "num_tokens": 52261170.0, "step": 25560 }, { "entropy": 0.5533858236391097, "epoch": 0.4152895414274461, "grad_norm": 7.34375, "learning_rate": 3.230471834005308e-05, "loss": 0.5420894622802734, "mean_token_accuracy": 0.8603348501026631, "num_tokens": 52282515.0, "step": 25570 }, { "entropy": 0.5799517730250955, "epoch": 0.41545195423207165, "grad_norm": 10.0625, "learning_rate": 3.229231684436344e-05, "loss": 0.5732659816741943, "mean_token_accuracy": 0.84960383400321, "num_tokens": 52302630.0, "step": 25580 }, { "entropy": 0.4566038035438396, "epoch": 0.4156143670366972, "grad_norm": 5.09375, "learning_rate": 3.227991338702417e-05, "loss": 0.4110555648803711, "mean_token_accuracy": 0.8857577197253704, "num_tokens": 52323175.0, "step": 25590 }, { "entropy": 0.4929009010549635, "epoch": 0.41577677984132266, "grad_norm": 6.625, "learning_rate": 3.226750797137185e-05, "loss": 0.46628379821777344, "mean_token_accuracy": 0.8678748615086078, "num_tokens": 52344101.0, "step": 25600 }, { "entropy": 0.47562762089073657, "epoch": 0.4159391926459482, "grad_norm": 5.4375, "learning_rate": 3.225510060074356e-05, "loss": 0.49250307083129885, "mean_token_accuracy": 0.8703025840222836, "num_tokens": 52364114.0, "step": 25610 }, { "entropy": 0.5088329302147031, "epoch": 0.41610160545057373, "grad_norm": 6.6875, "learning_rate": 3.22426912784769e-05, "loss": 0.4973293304443359, "mean_token_accuracy": 0.8665605306625366, "num_tokens": 52385463.0, "step": 25620 }, { "entropy": 0.5468743508681655, "epoch": 0.41626401825519926, "grad_norm": 10.5625, "learning_rate": 3.223028000791e-05, "loss": 0.5036086559295654, "mean_token_accuracy": 0.868207111954689, "num_tokens": 52406049.0, "step": 25630 }, { "entropy": 0.44798689559102056, "epoch": 0.41642643105982474, "grad_norm": 5.53125, "learning_rate": 3.221786679238154e-05, "loss": 0.44849424362182616, "mean_token_accuracy": 0.8869002774357796, "num_tokens": 52426784.0, "step": 25640 }, { "entropy": 0.42774236453697084, "epoch": 0.4165888438644503, "grad_norm": 11.375, "learning_rate": 3.220545163523068e-05, "loss": 0.4663724899291992, "mean_token_accuracy": 0.8823844365775585, "num_tokens": 52447285.0, "step": 25650 }, { "entropy": 0.5102943607140332, "epoch": 0.4167512566690758, "grad_norm": 6.375, "learning_rate": 3.219303453979715e-05, "loss": 0.503302526473999, "mean_token_accuracy": 0.8683681294322014, "num_tokens": 52467046.0, "step": 25660 }, { "entropy": 0.5356067596003413, "epoch": 0.4169136694737013, "grad_norm": 9.875, "learning_rate": 3.218061550942115e-05, "loss": 0.597426462173462, "mean_token_accuracy": 0.84616807885468, "num_tokens": 52488399.0, "step": 25670 }, { "entropy": 0.5494789345189929, "epoch": 0.4170760822783268, "grad_norm": 8.0625, "learning_rate": 3.216819454744345e-05, "loss": 0.5711367130279541, "mean_token_accuracy": 0.8596862509846688, "num_tokens": 52508870.0, "step": 25680 }, { "entropy": 0.5665111511480063, "epoch": 0.41723849508295235, "grad_norm": 9.875, "learning_rate": 3.2155771657205304e-05, "loss": 0.5598531723022461, "mean_token_accuracy": 0.8618370190262794, "num_tokens": 52530077.0, "step": 25690 }, { "entropy": 0.5230646975338459, "epoch": 0.41740090788757783, "grad_norm": 8.3125, "learning_rate": 3.21433468420485e-05, "loss": 0.5428545475006104, "mean_token_accuracy": 0.8602124769240618, "num_tokens": 52549291.0, "step": 25700 }, { "entropy": 0.49194653034210206, "epoch": 0.41756332069220337, "grad_norm": 5.46875, "learning_rate": 3.213092010531534e-05, "loss": 0.46704850196838377, "mean_token_accuracy": 0.8761406935751438, "num_tokens": 52569178.0, "step": 25710 }, { "entropy": 0.518027339456603, "epoch": 0.4177257334968289, "grad_norm": 7.5625, "learning_rate": 3.211849145034865e-05, "loss": 0.508852767944336, "mean_token_accuracy": 0.8703674167394638, "num_tokens": 52589296.0, "step": 25720 }, { "entropy": 0.5370525011792779, "epoch": 0.41788814630145443, "grad_norm": 8.4375, "learning_rate": 3.210606088049176e-05, "loss": 0.5458516120910645, "mean_token_accuracy": 0.8614116158336401, "num_tokens": 52610241.0, "step": 25730 }, { "entropy": 0.5422722487710416, "epoch": 0.4180505591060799, "grad_norm": 10.625, "learning_rate": 3.209362839908853e-05, "loss": 0.6065820693969727, "mean_token_accuracy": 0.8461984626948833, "num_tokens": 52629335.0, "step": 25740 }, { "entropy": 0.5094201260246336, "epoch": 0.41821297191070544, "grad_norm": 7.78125, "learning_rate": 3.208119400948331e-05, "loss": 0.48579044342041017, "mean_token_accuracy": 0.8735195487737656, "num_tokens": 52650933.0, "step": 25750 }, { "entropy": 0.516224688757211, "epoch": 0.418375384715331, "grad_norm": 6.8125, "learning_rate": 3.2068757715020995e-05, "loss": 0.483828067779541, "mean_token_accuracy": 0.8724147580564022, "num_tokens": 52671127.0, "step": 25760 }, { "entropy": 0.4885833171196282, "epoch": 0.41853779751995646, "grad_norm": 6.71875, "learning_rate": 3.205631951904696e-05, "loss": 0.4948446750640869, "mean_token_accuracy": 0.8720498990267516, "num_tokens": 52692165.0, "step": 25770 }, { "entropy": 0.5013317247852683, "epoch": 0.418700210324582, "grad_norm": 7.9375, "learning_rate": 3.204387942490712e-05, "loss": 0.5151903629302979, "mean_token_accuracy": 0.874787350744009, "num_tokens": 52712219.0, "step": 25780 }, { "entropy": 0.5527803116478026, "epoch": 0.4188626231292075, "grad_norm": 7.6875, "learning_rate": 3.203143743594789e-05, "loss": 0.5959082126617432, "mean_token_accuracy": 0.8578294094651937, "num_tokens": 52733150.0, "step": 25790 }, { "entropy": 0.48373413900844753, "epoch": 0.419025035933833, "grad_norm": 6.9375, "learning_rate": 3.201899355551618e-05, "loss": 0.4935576915740967, "mean_token_accuracy": 0.871484537422657, "num_tokens": 52753274.0, "step": 25800 }, { "entropy": 0.5884950891137123, "epoch": 0.41918744873845853, "grad_norm": 7.71875, "learning_rate": 3.200654778695943e-05, "loss": 0.6307910442352295, "mean_token_accuracy": 0.8478124819695949, "num_tokens": 52773925.0, "step": 25810 }, { "entropy": 0.47720295009203256, "epoch": 0.41934986154308407, "grad_norm": 5.75, "learning_rate": 3.199410013362558e-05, "loss": 0.44926652908325193, "mean_token_accuracy": 0.8743626110255718, "num_tokens": 52793907.0, "step": 25820 }, { "entropy": 0.5504545530304312, "epoch": 0.41951227434770955, "grad_norm": 7.90625, "learning_rate": 3.198165059886307e-05, "loss": 0.5332975387573242, "mean_token_accuracy": 0.863922755792737, "num_tokens": 52814112.0, "step": 25830 }, { "entropy": 0.5630201070569456, "epoch": 0.4196746871523351, "grad_norm": 7.3125, "learning_rate": 3.196919918602087e-05, "loss": 0.5809246063232422, "mean_token_accuracy": 0.8578296817839146, "num_tokens": 52834995.0, "step": 25840 }, { "entropy": 0.5794985789339989, "epoch": 0.4198370999569606, "grad_norm": 10.9375, "learning_rate": 3.195674589844842e-05, "loss": 0.6090047359466553, "mean_token_accuracy": 0.8550545275211334, "num_tokens": 52854951.0, "step": 25850 }, { "entropy": 0.4636266532354057, "epoch": 0.41999951276158615, "grad_norm": 8.5, "learning_rate": 3.1944290739495695e-05, "loss": 0.4624065399169922, "mean_token_accuracy": 0.8780642818659544, "num_tokens": 52875530.0, "step": 25860 }, { "entropy": 0.4846934449742548, "epoch": 0.4201619255662116, "grad_norm": 8.5625, "learning_rate": 3.1931833712513146e-05, "loss": 0.4879265308380127, "mean_token_accuracy": 0.8752511214464903, "num_tokens": 52895664.0, "step": 25870 }, { "entropy": 0.5569766034139321, "epoch": 0.42032433837083716, "grad_norm": 6.3125, "learning_rate": 3.191937482085176e-05, "loss": 0.5507461071014405, "mean_token_accuracy": 0.8651439655572176, "num_tokens": 52917394.0, "step": 25880 }, { "entropy": 0.5131411178037524, "epoch": 0.4204867511754627, "grad_norm": 7.125, "learning_rate": 3.190691406786299e-05, "loss": 0.47635536193847655, "mean_token_accuracy": 0.8790477592498064, "num_tokens": 52937302.0, "step": 25890 }, { "entropy": 0.516530344914645, "epoch": 0.42064916398008817, "grad_norm": 6.875, "learning_rate": 3.189445145689882e-05, "loss": 0.5579797267913819, "mean_token_accuracy": 0.8636225178837776, "num_tokens": 52957890.0, "step": 25900 }, { "entropy": 0.5130226615816355, "epoch": 0.4208115767847137, "grad_norm": 5.875, "learning_rate": 3.188198699131171e-05, "loss": 0.5303301334381103, "mean_token_accuracy": 0.869339008629322, "num_tokens": 52977769.0, "step": 25910 }, { "entropy": 0.5385393127333373, "epoch": 0.42097398958933924, "grad_norm": 8.75, "learning_rate": 3.1869520674454624e-05, "loss": 0.530564546585083, "mean_token_accuracy": 0.8683712385594845, "num_tokens": 52998757.0, "step": 25920 }, { "entropy": 0.5261168368626385, "epoch": 0.4211364023939647, "grad_norm": 7.75, "learning_rate": 3.185705250968105e-05, "loss": 0.47595987319946287, "mean_token_accuracy": 0.883159664273262, "num_tokens": 53018613.0, "step": 25930 }, { "entropy": 0.529576008557342, "epoch": 0.42129881519859025, "grad_norm": 7.28125, "learning_rate": 3.184458250034493e-05, "loss": 0.5502344608306885, "mean_token_accuracy": 0.8604525402188301, "num_tokens": 53039739.0, "step": 25940 }, { "entropy": 0.5339185941964388, "epoch": 0.4214612280032158, "grad_norm": 9.5625, "learning_rate": 3.183211064980075e-05, "loss": 0.578618335723877, "mean_token_accuracy": 0.8596599020063878, "num_tokens": 53060331.0, "step": 25950 }, { "entropy": 0.5812776100821793, "epoch": 0.4216236408078413, "grad_norm": 13.0, "learning_rate": 3.1819636961403443e-05, "loss": 0.5753157615661622, "mean_token_accuracy": 0.8559711903333664, "num_tokens": 53081190.0, "step": 25960 }, { "entropy": 0.5282956954091788, "epoch": 0.4217860536124668, "grad_norm": 7.84375, "learning_rate": 3.1807161438508465e-05, "loss": 0.5454727649688721, "mean_token_accuracy": 0.86385711543262, "num_tokens": 53102555.0, "step": 25970 }, { "entropy": 0.495172376325354, "epoch": 0.4219484664170923, "grad_norm": 8.5, "learning_rate": 3.179468408447176e-05, "loss": 0.5281413555145263, "mean_token_accuracy": 0.8639149211347104, "num_tokens": 53122194.0, "step": 25980 }, { "entropy": 0.5663021387532353, "epoch": 0.42211087922171786, "grad_norm": 6.8125, "learning_rate": 3.178220490264977e-05, "loss": 0.6023267269134521, "mean_token_accuracy": 0.850651728734374, "num_tokens": 53143523.0, "step": 25990 }, { "entropy": 0.46800175299867985, "epoch": 0.42227329202634334, "grad_norm": 7.84375, "learning_rate": 3.1769723896399415e-05, "loss": 0.4666964054107666, "mean_token_accuracy": 0.8823631525039672, "num_tokens": 53165978.0, "step": 26000 }, { "entropy": 0.5163110538385809, "epoch": 0.4224357048309689, "grad_norm": 5.28125, "learning_rate": 3.1757241069078126e-05, "loss": 0.5024280071258544, "mean_token_accuracy": 0.8668322116136551, "num_tokens": 53187506.0, "step": 26010 }, { "entropy": 0.48313176329247653, "epoch": 0.4225981176355944, "grad_norm": 5.75, "learning_rate": 3.1744756424043803e-05, "loss": 0.5220269203186035, "mean_token_accuracy": 0.8713211715221405, "num_tokens": 53207209.0, "step": 26020 }, { "entropy": 0.5362095199991017, "epoch": 0.4227605304402199, "grad_norm": 8.0, "learning_rate": 3.173226996465484e-05, "loss": 0.5468008995056153, "mean_token_accuracy": 0.8625670209527015, "num_tokens": 53226835.0, "step": 26030 }, { "entropy": 0.5095091768074781, "epoch": 0.4229229432448454, "grad_norm": 6.75, "learning_rate": 3.1719781694270124e-05, "loss": 0.49617924690246584, "mean_token_accuracy": 0.8644309170544148, "num_tokens": 53247078.0, "step": 26040 }, { "entropy": 0.4972918125800788, "epoch": 0.42308535604947095, "grad_norm": 8.625, "learning_rate": 3.170729161624904e-05, "loss": 0.5204285144805908, "mean_token_accuracy": 0.8703681707382203, "num_tokens": 53267859.0, "step": 26050 }, { "entropy": 0.5583084385376423, "epoch": 0.4232477688540965, "grad_norm": 8.6875, "learning_rate": 3.169479973395143e-05, "loss": 0.5382142066955566, "mean_token_accuracy": 0.861668660491705, "num_tokens": 53288153.0, "step": 26060 }, { "entropy": 0.5674798764288426, "epoch": 0.42341018165872196, "grad_norm": 9.25, "learning_rate": 3.168230605073765e-05, "loss": 0.5714748859405517, "mean_token_accuracy": 0.8572727739810944, "num_tokens": 53308704.0, "step": 26070 }, { "entropy": 0.5764185952953994, "epoch": 0.4235725944633475, "grad_norm": 7.3125, "learning_rate": 3.166981056996852e-05, "loss": 0.5755550384521484, "mean_token_accuracy": 0.8588298425078392, "num_tokens": 53329202.0, "step": 26080 }, { "entropy": 0.4808438041713089, "epoch": 0.42373500726797303, "grad_norm": 6.125, "learning_rate": 3.165731329500536e-05, "loss": 0.4663823127746582, "mean_token_accuracy": 0.8789558589458466, "num_tokens": 53348725.0, "step": 26090 }, { "entropy": 0.48298922828398644, "epoch": 0.4238974200725985, "grad_norm": 7.9375, "learning_rate": 3.164481422920996e-05, "loss": 0.47258687019348145, "mean_token_accuracy": 0.8739002346992493, "num_tokens": 53368321.0, "step": 26100 }, { "entropy": 0.4612211043480784, "epoch": 0.42405983287722404, "grad_norm": 11.375, "learning_rate": 3.16323133759446e-05, "loss": 0.429952335357666, "mean_token_accuracy": 0.8857774078845978, "num_tokens": 53388986.0, "step": 26110 }, { "entropy": 0.5063950899988413, "epoch": 0.4242222456818496, "grad_norm": 6.5, "learning_rate": 3.161981073857203e-05, "loss": 0.516152811050415, "mean_token_accuracy": 0.8707935132086277, "num_tokens": 53409712.0, "step": 26120 }, { "entropy": 0.5596029178239406, "epoch": 0.42438465848647505, "grad_norm": 5.625, "learning_rate": 3.160730632045551e-05, "loss": 0.5536952495574952, "mean_token_accuracy": 0.859734732657671, "num_tokens": 53430995.0, "step": 26130 }, { "entropy": 0.46577100141439587, "epoch": 0.4245470712911006, "grad_norm": 6.6875, "learning_rate": 3.159480012495873e-05, "loss": 0.47863178253173827, "mean_token_accuracy": 0.8788735270500183, "num_tokens": 53451531.0, "step": 26140 }, { "entropy": 0.4203683691797778, "epoch": 0.4247094840957261, "grad_norm": 8.375, "learning_rate": 3.1582292155445896e-05, "loss": 0.4302022457122803, "mean_token_accuracy": 0.8908935882151127, "num_tokens": 53470653.0, "step": 26150 }, { "entropy": 0.5022329020313918, "epoch": 0.4248718969003516, "grad_norm": 6.65625, "learning_rate": 3.156978241528168e-05, "loss": 0.518714714050293, "mean_token_accuracy": 0.8695842556655407, "num_tokens": 53491423.0, "step": 26160 }, { "entropy": 0.5512746045831591, "epoch": 0.42503430970497713, "grad_norm": 9.75, "learning_rate": 3.155727090783123e-05, "loss": 0.5485617637634277, "mean_token_accuracy": 0.8620844349265099, "num_tokens": 53511769.0, "step": 26170 }, { "entropy": 0.5347740378696472, "epoch": 0.42519672250960266, "grad_norm": 5.125, "learning_rate": 3.1544757636460176e-05, "loss": 0.5319727420806885, "mean_token_accuracy": 0.8667205452919007, "num_tokens": 53532387.0, "step": 26180 }, { "entropy": 0.5781703687272965, "epoch": 0.4253591353142282, "grad_norm": 10.3125, "learning_rate": 3.15322426045346e-05, "loss": 0.6596169471740723, "mean_token_accuracy": 0.8383496649563312, "num_tokens": 53554291.0, "step": 26190 }, { "entropy": 0.5523478910792619, "epoch": 0.4255215481188537, "grad_norm": 5.1875, "learning_rate": 3.1519725815421086e-05, "loss": 0.5360152721405029, "mean_token_accuracy": 0.8639686457812786, "num_tokens": 53574168.0, "step": 26200 }, { "entropy": 0.5805981829296798, "epoch": 0.4256839609234792, "grad_norm": 8.4375, "learning_rate": 3.150720727248668e-05, "loss": 0.5832035064697265, "mean_token_accuracy": 0.8591724395751953, "num_tokens": 53595180.0, "step": 26210 }, { "entropy": 0.4912083494476974, "epoch": 0.42584637372810474, "grad_norm": 5.125, "learning_rate": 3.149468697909889e-05, "loss": 0.4988560199737549, "mean_token_accuracy": 0.8784642018377781, "num_tokens": 53615193.0, "step": 26220 }, { "entropy": 0.5159098997013644, "epoch": 0.4260087865327302, "grad_norm": 6.28125, "learning_rate": 3.14821649386257e-05, "loss": 0.5352456092834472, "mean_token_accuracy": 0.8633601270616055, "num_tokens": 53636589.0, "step": 26230 }, { "entropy": 0.49961121287196875, "epoch": 0.42617119933735575, "grad_norm": 12.4375, "learning_rate": 3.146964115443559e-05, "loss": 0.4994646549224854, "mean_token_accuracy": 0.8702877499163151, "num_tokens": 53656808.0, "step": 26240 }, { "entropy": 0.5086843435186893, "epoch": 0.4263336121419813, "grad_norm": 7.53125, "learning_rate": 3.1457115629897456e-05, "loss": 0.5040114879608154, "mean_token_accuracy": 0.8692098781466484, "num_tokens": 53676697.0, "step": 26250 }, { "entropy": 0.5707472438924015, "epoch": 0.42649602494660677, "grad_norm": 7.09375, "learning_rate": 3.1444588368380715e-05, "loss": 0.5983742237091064, "mean_token_accuracy": 0.8518050938844681, "num_tokens": 53696767.0, "step": 26260 }, { "entropy": 0.4743402528576553, "epoch": 0.4266584377512323, "grad_norm": 5.59375, "learning_rate": 3.143205937325521e-05, "loss": 0.4283727169036865, "mean_token_accuracy": 0.8885200098156929, "num_tokens": 53717109.0, "step": 26270 }, { "entropy": 0.4650275648571551, "epoch": 0.42682085055585783, "grad_norm": 7.71875, "learning_rate": 3.141952864789128e-05, "loss": 0.45522541999816896, "mean_token_accuracy": 0.8747443877160549, "num_tokens": 53736952.0, "step": 26280 }, { "entropy": 0.520511639630422, "epoch": 0.42698326336048337, "grad_norm": 6.625, "learning_rate": 3.140699619565972e-05, "loss": 0.5124590873718262, "mean_token_accuracy": 0.8666912041604519, "num_tokens": 53756854.0, "step": 26290 }, { "entropy": 0.5814689291641116, "epoch": 0.42714567616510885, "grad_norm": 10.8125, "learning_rate": 3.1394462019931785e-05, "loss": 0.5890640258789063, "mean_token_accuracy": 0.8591370917856693, "num_tokens": 53778286.0, "step": 26300 }, { "entropy": 0.48275368600152435, "epoch": 0.4273080889697344, "grad_norm": 8.9375, "learning_rate": 3.1381926124079196e-05, "loss": 0.47987875938415525, "mean_token_accuracy": 0.8782180935144425, "num_tokens": 53798203.0, "step": 26310 }, { "entropy": 0.5148432906717062, "epoch": 0.4274705017743599, "grad_norm": 5.84375, "learning_rate": 3.136938851147414e-05, "loss": 0.5323846817016602, "mean_token_accuracy": 0.8673043251037598, "num_tokens": 53818641.0, "step": 26320 }, { "entropy": 0.4841863142326474, "epoch": 0.4276329145789854, "grad_norm": 6.59375, "learning_rate": 3.135684918548925e-05, "loss": 0.4680328845977783, "mean_token_accuracy": 0.8780590943992138, "num_tokens": 53840093.0, "step": 26330 }, { "entropy": 0.5157970013096929, "epoch": 0.4277953273836109, "grad_norm": 10.25, "learning_rate": 3.1344308149497655e-05, "loss": 0.5487277030944824, "mean_token_accuracy": 0.8679249748587609, "num_tokens": 53859973.0, "step": 26340 }, { "entropy": 0.5025227293372154, "epoch": 0.42795774018823646, "grad_norm": 9.25, "learning_rate": 3.13317654068729e-05, "loss": 0.4844356536865234, "mean_token_accuracy": 0.8813383288681507, "num_tokens": 53879408.0, "step": 26350 }, { "entropy": 0.45562847042456267, "epoch": 0.42812015299286194, "grad_norm": 4.71875, "learning_rate": 3.1319220960989024e-05, "loss": 0.5080379962921142, "mean_token_accuracy": 0.8688146375119686, "num_tokens": 53898922.0, "step": 26360 }, { "entropy": 0.5546802303986624, "epoch": 0.42828256579748747, "grad_norm": 7.3125, "learning_rate": 3.1306674815220516e-05, "loss": 0.5671001434326172, "mean_token_accuracy": 0.8508445955812931, "num_tokens": 53920089.0, "step": 26370 }, { "entropy": 0.49256305387243626, "epoch": 0.428444978602113, "grad_norm": 6.0625, "learning_rate": 3.12941269729423e-05, "loss": 0.47075700759887695, "mean_token_accuracy": 0.8754027597606182, "num_tokens": 53939617.0, "step": 26380 }, { "entropy": 0.5048099600942806, "epoch": 0.4286073914067385, "grad_norm": 10.875, "learning_rate": 3.1281577437529786e-05, "loss": 0.50218825340271, "mean_token_accuracy": 0.8753619566559792, "num_tokens": 53960825.0, "step": 26390 }, { "entropy": 0.5073998478706926, "epoch": 0.428769804211364, "grad_norm": 8.6875, "learning_rate": 3.126902621235882e-05, "loss": 0.5164266109466553, "mean_token_accuracy": 0.8696310162544251, "num_tokens": 53981707.0, "step": 26400 }, { "entropy": 0.5174917437601835, "epoch": 0.42893221701598955, "grad_norm": 7.9375, "learning_rate": 3.125647330080572e-05, "loss": 0.5196106433868408, "mean_token_accuracy": 0.8668940372765064, "num_tokens": 54001638.0, "step": 26410 }, { "entropy": 0.5059850884601473, "epoch": 0.4290946298206151, "grad_norm": 7.78125, "learning_rate": 3.1243918706247245e-05, "loss": 0.5082090854644775, "mean_token_accuracy": 0.8626607395708561, "num_tokens": 54021523.0, "step": 26420 }, { "entropy": 0.5528865655418486, "epoch": 0.42925704262524056, "grad_norm": 7.125, "learning_rate": 3.123136243206059e-05, "loss": 0.54991455078125, "mean_token_accuracy": 0.8627529352903366, "num_tokens": 54042675.0, "step": 26430 }, { "entropy": 0.5532626616535709, "epoch": 0.4294194554298661, "grad_norm": 6.125, "learning_rate": 3.121880448162345e-05, "loss": 0.5937977313995362, "mean_token_accuracy": 0.8589829917997122, "num_tokens": 54062895.0, "step": 26440 }, { "entropy": 0.5254064027685672, "epoch": 0.4295818682344916, "grad_norm": 7.28125, "learning_rate": 3.1206244858313935e-05, "loss": 0.4956506729125977, "mean_token_accuracy": 0.8662436306476593, "num_tokens": 54084011.0, "step": 26450 }, { "entropy": 0.6057888876646758, "epoch": 0.4297442810391171, "grad_norm": 8.1875, "learning_rate": 3.119368356551059e-05, "loss": 0.5886111736297608, "mean_token_accuracy": 0.8451783813536167, "num_tokens": 54105189.0, "step": 26460 }, { "entropy": 0.5290971436537802, "epoch": 0.42990669384374264, "grad_norm": 6.84375, "learning_rate": 3.1181120606592454e-05, "loss": 0.5410046100616455, "mean_token_accuracy": 0.860647463798523, "num_tokens": 54124676.0, "step": 26470 }, { "entropy": 0.48946149055846033, "epoch": 0.43006910664836817, "grad_norm": 7.875, "learning_rate": 3.1168555984938986e-05, "loss": 0.4987939357757568, "mean_token_accuracy": 0.8819429256021977, "num_tokens": 54145848.0, "step": 26480 }, { "entropy": 0.5439423554576933, "epoch": 0.43023151945299365, "grad_norm": 7.59375, "learning_rate": 3.1155989703930086e-05, "loss": 0.5868628025054932, "mean_token_accuracy": 0.8605824045836925, "num_tokens": 54165748.0, "step": 26490 }, { "entropy": 0.5332016918575391, "epoch": 0.4303939322576192, "grad_norm": 14.25, "learning_rate": 3.1143421766946126e-05, "loss": 0.5294876575469971, "mean_token_accuracy": 0.8552493035793305, "num_tokens": 54185891.0, "step": 26500 }, { "entropy": 0.5729429565835744, "epoch": 0.4305563450622447, "grad_norm": 11.5625, "learning_rate": 3.1130852177367905e-05, "loss": 0.5412538051605225, "mean_token_accuracy": 0.8650202982127666, "num_tokens": 54206353.0, "step": 26510 }, { "entropy": 0.5026615750975907, "epoch": 0.43071875786687025, "grad_norm": 6.625, "learning_rate": 3.111828093857667e-05, "loss": 0.5295844554901123, "mean_token_accuracy": 0.8712313890457153, "num_tokens": 54226437.0, "step": 26520 }, { "entropy": 0.4892513652332127, "epoch": 0.43088117067149573, "grad_norm": 9.875, "learning_rate": 3.1105708053954106e-05, "loss": 0.5077725887298584, "mean_token_accuracy": 0.876500590890646, "num_tokens": 54246896.0, "step": 26530 }, { "entropy": 0.5436348012648523, "epoch": 0.43104358347612126, "grad_norm": 9.0625, "learning_rate": 3.109313352688237e-05, "loss": 0.5929782390594482, "mean_token_accuracy": 0.852525944635272, "num_tokens": 54267094.0, "step": 26540 }, { "entropy": 0.5234177305363119, "epoch": 0.4312059962807468, "grad_norm": 8.9375, "learning_rate": 3.1080557360744005e-05, "loss": 0.5364881038665772, "mean_token_accuracy": 0.8646044284105301, "num_tokens": 54286352.0, "step": 26550 }, { "entropy": 0.5222048241645098, "epoch": 0.4313684090853723, "grad_norm": 9.0625, "learning_rate": 3.106797955892205e-05, "loss": 0.5703032493591309, "mean_token_accuracy": 0.8520666599273682, "num_tokens": 54307009.0, "step": 26560 }, { "entropy": 0.5417647248599679, "epoch": 0.4315308218899978, "grad_norm": 8.0625, "learning_rate": 3.105540012479996e-05, "loss": 0.5160929203033447, "mean_token_accuracy": 0.8734475433826446, "num_tokens": 54326766.0, "step": 26570 }, { "entropy": 0.5138268779963255, "epoch": 0.43169323469462334, "grad_norm": 8.125, "learning_rate": 3.104281906176163e-05, "loss": 0.48660926818847655, "mean_token_accuracy": 0.8752601712942123, "num_tokens": 54347130.0, "step": 26580 }, { "entropy": 0.5025562706636265, "epoch": 0.4318556474992488, "grad_norm": 7.5625, "learning_rate": 3.1030236373191385e-05, "loss": 0.5202531337738037, "mean_token_accuracy": 0.8699207060039044, "num_tokens": 54367048.0, "step": 26590 }, { "entropy": 0.5354378638789058, "epoch": 0.43201806030387435, "grad_norm": 8.5625, "learning_rate": 3.101765206247401e-05, "loss": 0.5609186172485352, "mean_token_accuracy": 0.8593226723372936, "num_tokens": 54386962.0, "step": 26600 }, { "entropy": 0.4143619808135554, "epoch": 0.4321804731084999, "grad_norm": 7.34375, "learning_rate": 3.1005066132994696e-05, "loss": 0.4217390537261963, "mean_token_accuracy": 0.8915362112224102, "num_tokens": 54407075.0, "step": 26610 }, { "entropy": 0.4838870458304882, "epoch": 0.43234288591312536, "grad_norm": 8.875, "learning_rate": 3.099247858813911e-05, "loss": 0.5110352993011474, "mean_token_accuracy": 0.8693156875669956, "num_tokens": 54427925.0, "step": 26620 }, { "entropy": 0.5089731890708208, "epoch": 0.4325052987177509, "grad_norm": 5.75, "learning_rate": 3.097988943129331e-05, "loss": 0.5225047588348388, "mean_token_accuracy": 0.860106123238802, "num_tokens": 54448530.0, "step": 26630 }, { "entropy": 0.5895540602505207, "epoch": 0.43266771152237643, "grad_norm": 8.5625, "learning_rate": 3.096729866584381e-05, "loss": 0.6228594779968262, "mean_token_accuracy": 0.8524701084941626, "num_tokens": 54469003.0, "step": 26640 }, { "entropy": 0.514575906842947, "epoch": 0.43283012432700196, "grad_norm": 11.25, "learning_rate": 3.095470629517756e-05, "loss": 0.5403034687042236, "mean_token_accuracy": 0.8595052137970924, "num_tokens": 54488798.0, "step": 26650 }, { "entropy": 0.5221792967990041, "epoch": 0.43299253713162744, "grad_norm": 6.96875, "learning_rate": 3.094211232268194e-05, "loss": 0.5204185485839844, "mean_token_accuracy": 0.8598261848092079, "num_tokens": 54508761.0, "step": 26660 }, { "entropy": 0.5681801720522344, "epoch": 0.433154949936253, "grad_norm": 7.46875, "learning_rate": 3.092951675174475e-05, "loss": 0.58130784034729, "mean_token_accuracy": 0.8572632074356079, "num_tokens": 54529524.0, "step": 26670 }, { "entropy": 0.48390958122909067, "epoch": 0.4333173627408785, "grad_norm": 8.4375, "learning_rate": 3.091691958575422e-05, "loss": 0.4913118839263916, "mean_token_accuracy": 0.8714043438434601, "num_tokens": 54550424.0, "step": 26680 }, { "entropy": 0.5250225475057959, "epoch": 0.433479775545504, "grad_norm": 6.90625, "learning_rate": 3.0904320828099026e-05, "loss": 0.5219854354858399, "mean_token_accuracy": 0.8722835328429938, "num_tokens": 54570742.0, "step": 26690 }, { "entropy": 0.4988068257458508, "epoch": 0.4336421883501295, "grad_norm": 6.59375, "learning_rate": 3.089172048216827e-05, "loss": 0.4991009712219238, "mean_token_accuracy": 0.8717376034706831, "num_tokens": 54590738.0, "step": 26700 }, { "entropy": 0.5385075101163238, "epoch": 0.43380460115475505, "grad_norm": 8.0, "learning_rate": 3.0879118551351455e-05, "loss": 0.5113287448883057, "mean_token_accuracy": 0.8682886637747288, "num_tokens": 54611425.0, "step": 26710 }, { "entropy": 0.49123778035864235, "epoch": 0.43396701395938053, "grad_norm": 8.125, "learning_rate": 3.0866515039038543e-05, "loss": 0.43929152488708495, "mean_token_accuracy": 0.8864768534898758, "num_tokens": 54631298.0, "step": 26720 }, { "entropy": 0.4656914257444441, "epoch": 0.43412942676400607, "grad_norm": 7.375, "learning_rate": 3.085390994861989e-05, "loss": 0.4675886154174805, "mean_token_accuracy": 0.8772530876100063, "num_tokens": 54651744.0, "step": 26730 }, { "entropy": 0.5404176487587392, "epoch": 0.4342918395686316, "grad_norm": 8.125, "learning_rate": 3.084130328348632e-05, "loss": 0.5728754997253418, "mean_token_accuracy": 0.858978233486414, "num_tokens": 54672689.0, "step": 26740 }, { "entropy": 0.4994218789041042, "epoch": 0.43445425237325713, "grad_norm": 5.5625, "learning_rate": 3.0828695047029036e-05, "loss": 0.5237968444824219, "mean_token_accuracy": 0.8697491139173508, "num_tokens": 54692767.0, "step": 26750 }, { "entropy": 0.4951876137405634, "epoch": 0.4346166651778826, "grad_norm": 8.25, "learning_rate": 3.081608524263967e-05, "loss": 0.49139742851257323, "mean_token_accuracy": 0.8708185113966465, "num_tokens": 54713406.0, "step": 26760 }, { "entropy": 0.5145915291272104, "epoch": 0.43477907798250814, "grad_norm": 8.625, "learning_rate": 3.080347387371032e-05, "loss": 0.5114877700805665, "mean_token_accuracy": 0.8670777320861817, "num_tokens": 54734301.0, "step": 26770 }, { "entropy": 0.5081913491245359, "epoch": 0.4349414907871337, "grad_norm": 8.6875, "learning_rate": 3.079086094363345e-05, "loss": 0.5182557106018066, "mean_token_accuracy": 0.8704255856573582, "num_tokens": 54755207.0, "step": 26780 }, { "entropy": 0.48840864514932036, "epoch": 0.43510390359175916, "grad_norm": 7.03125, "learning_rate": 3.077824645580198e-05, "loss": 0.5048822879791259, "mean_token_accuracy": 0.8727167975157499, "num_tokens": 54773829.0, "step": 26790 }, { "entropy": 0.5090606729499996, "epoch": 0.4352663163963847, "grad_norm": 8.9375, "learning_rate": 3.07656304136092e-05, "loss": 0.5203195571899414, "mean_token_accuracy": 0.8654130011796951, "num_tokens": 54794210.0, "step": 26800 }, { "entropy": 0.4721269342582673, "epoch": 0.4354287292010102, "grad_norm": 8.8125, "learning_rate": 3.0753012820448914e-05, "loss": 0.46477470397949217, "mean_token_accuracy": 0.8802007094025612, "num_tokens": 54814036.0, "step": 26810 }, { "entropy": 0.5001543298945762, "epoch": 0.4355911420056357, "grad_norm": 6.125, "learning_rate": 3.074039367971523e-05, "loss": 0.48691325187683104, "mean_token_accuracy": 0.8793206624686718, "num_tokens": 54835281.0, "step": 26820 }, { "entropy": 0.5345731656532735, "epoch": 0.43575355481026123, "grad_norm": 7.5625, "learning_rate": 3.072777299480275e-05, "loss": 0.5122151851654053, "mean_token_accuracy": 0.866938441246748, "num_tokens": 54855534.0, "step": 26830 }, { "entropy": 0.5127610915806144, "epoch": 0.43591596761488677, "grad_norm": 6.125, "learning_rate": 3.071515076910647e-05, "loss": 0.5024378776550293, "mean_token_accuracy": 0.8693154700100422, "num_tokens": 54875642.0, "step": 26840 }, { "entropy": 0.5013603906612843, "epoch": 0.4360783804195123, "grad_norm": 10.9375, "learning_rate": 3.0702527006021774e-05, "loss": 0.5494681835174561, "mean_token_accuracy": 0.8603448450565339, "num_tokens": 54894335.0, "step": 26850 }, { "entropy": 0.5531791246728972, "epoch": 0.4362407932241378, "grad_norm": 8.6875, "learning_rate": 3.0689901708944515e-05, "loss": 0.6018117427825928, "mean_token_accuracy": 0.85612678155303, "num_tokens": 54915442.0, "step": 26860 }, { "entropy": 0.557512700278312, "epoch": 0.4364032060287633, "grad_norm": 8.4375, "learning_rate": 3.0677274881270894e-05, "loss": 0.523082685470581, "mean_token_accuracy": 0.8692874372005462, "num_tokens": 54935811.0, "step": 26870 }, { "entropy": 0.49158645793795586, "epoch": 0.43656561883338885, "grad_norm": 7.8125, "learning_rate": 3.066464652639758e-05, "loss": 0.5066465854644775, "mean_token_accuracy": 0.8714259028434753, "num_tokens": 54954733.0, "step": 26880 }, { "entropy": 0.5155477747321129, "epoch": 0.4367280316380143, "grad_norm": 9.3125, "learning_rate": 3.0652016647721623e-05, "loss": 0.5126651287078857, "mean_token_accuracy": 0.8676353961229324, "num_tokens": 54975094.0, "step": 26890 }, { "entropy": 0.5137879548594355, "epoch": 0.43689044444263986, "grad_norm": 5.59375, "learning_rate": 3.063938524864048e-05, "loss": 0.49982824325561526, "mean_token_accuracy": 0.8678163841366768, "num_tokens": 54997122.0, "step": 26900 }, { "entropy": 0.5218381367623806, "epoch": 0.4370528572472654, "grad_norm": 6.375, "learning_rate": 3.0626752332552025e-05, "loss": 0.568983507156372, "mean_token_accuracy": 0.8636690985411406, "num_tokens": 55017057.0, "step": 26910 }, { "entropy": 0.5401337065733969, "epoch": 0.43721527005189087, "grad_norm": 6.84375, "learning_rate": 3.061411790285456e-05, "loss": 0.5535965919494629, "mean_token_accuracy": 0.8644356988370419, "num_tokens": 55037012.0, "step": 26920 }, { "entropy": 0.5869622863829136, "epoch": 0.4373776828565164, "grad_norm": 10.875, "learning_rate": 3.060148196294675e-05, "loss": 0.5416614532470703, "mean_token_accuracy": 0.8606539323925972, "num_tokens": 55056798.0, "step": 26930 }, { "entropy": 0.5363588805310429, "epoch": 0.43754009566114194, "grad_norm": 7.3125, "learning_rate": 3.0588844516227714e-05, "loss": 0.49663877487182617, "mean_token_accuracy": 0.8696520425379276, "num_tokens": 55077220.0, "step": 26940 }, { "entropy": 0.5014222712256015, "epoch": 0.4377025084657674, "grad_norm": 5.71875, "learning_rate": 3.057620556609694e-05, "loss": 0.5350190162658691, "mean_token_accuracy": 0.8645533107221126, "num_tokens": 55097829.0, "step": 26950 }, { "entropy": 0.5029997228644788, "epoch": 0.43786492127039295, "grad_norm": 11.875, "learning_rate": 3.056356511595433e-05, "loss": 0.5386734008789062, "mean_token_accuracy": 0.869632513821125, "num_tokens": 55117005.0, "step": 26960 }, { "entropy": 0.575042939465493, "epoch": 0.4380273340750185, "grad_norm": 9.3125, "learning_rate": 3.0550923169200214e-05, "loss": 0.595947265625, "mean_token_accuracy": 0.8545689858496189, "num_tokens": 55137849.0, "step": 26970 }, { "entropy": 0.6491784100653604, "epoch": 0.438189746879644, "grad_norm": 8.625, "learning_rate": 3.053827972923528e-05, "loss": 0.6883252143859864, "mean_token_accuracy": 0.8324871927499771, "num_tokens": 55159729.0, "step": 26980 }, { "entropy": 0.5628588520921767, "epoch": 0.4383521596842695, "grad_norm": 6.65625, "learning_rate": 3.0525634799460654e-05, "loss": 0.5863224506378174, "mean_token_accuracy": 0.8498340670019389, "num_tokens": 55179567.0, "step": 26990 }, { "entropy": 0.5358456050977111, "epoch": 0.438514572488895, "grad_norm": 8.3125, "learning_rate": 3.0512988383277853e-05, "loss": 0.5146778106689454, "mean_token_accuracy": 0.8667303539812565, "num_tokens": 55199502.0, "step": 27000 }, { "entropy": 0.5640515458770097, "epoch": 0.43867698529352056, "grad_norm": 8.75, "learning_rate": 3.0500340484088778e-05, "loss": 0.5817858695983886, "mean_token_accuracy": 0.8544801115989685, "num_tokens": 55219042.0, "step": 27010 }, { "entropy": 0.5506502404343336, "epoch": 0.43883939809814604, "grad_norm": 7.21875, "learning_rate": 3.0487691105295758e-05, "loss": 0.548121976852417, "mean_token_accuracy": 0.850363128632307, "num_tokens": 55238104.0, "step": 27020 }, { "entropy": 0.4861097265034914, "epoch": 0.43900181090277157, "grad_norm": 7.09375, "learning_rate": 3.0475040250301497e-05, "loss": 0.4275508880615234, "mean_token_accuracy": 0.8820276372134686, "num_tokens": 55258317.0, "step": 27030 }, { "entropy": 0.481755858566612, "epoch": 0.4391642237073971, "grad_norm": 8.4375, "learning_rate": 3.0462387922509105e-05, "loss": 0.45993905067443847, "mean_token_accuracy": 0.8868843279778957, "num_tokens": 55278323.0, "step": 27040 }, { "entropy": 0.4703269128454849, "epoch": 0.4393266365120226, "grad_norm": 4.71875, "learning_rate": 3.044973412532209e-05, "loss": 0.4828486442565918, "mean_token_accuracy": 0.8776221714913846, "num_tokens": 55297420.0, "step": 27050 }, { "entropy": 0.5157658666837961, "epoch": 0.4394890493166481, "grad_norm": 7.875, "learning_rate": 3.043707886214434e-05, "loss": 0.510365629196167, "mean_token_accuracy": 0.8775257594883442, "num_tokens": 55318038.0, "step": 27060 }, { "entropy": 0.5182433150708675, "epoch": 0.43965146212127365, "grad_norm": 10.0625, "learning_rate": 3.0424422136380158e-05, "loss": 0.5361198902130127, "mean_token_accuracy": 0.8708617962896824, "num_tokens": 55339045.0, "step": 27070 }, { "entropy": 0.47627518344670533, "epoch": 0.4398138749258992, "grad_norm": 9.1875, "learning_rate": 3.0411763951434242e-05, "loss": 0.46596250534057615, "mean_token_accuracy": 0.881960965692997, "num_tokens": 55359496.0, "step": 27080 }, { "entropy": 0.48303752364590763, "epoch": 0.43997628773052466, "grad_norm": 7.40625, "learning_rate": 3.039910431071165e-05, "loss": 0.5369595527648926, "mean_token_accuracy": 0.8641105860471725, "num_tokens": 55380095.0, "step": 27090 }, { "entropy": 0.5046060610096902, "epoch": 0.4401387005351502, "grad_norm": 7.0, "learning_rate": 3.0386443217617867e-05, "loss": 0.5194183826446533, "mean_token_accuracy": 0.8675149701535702, "num_tokens": 55400296.0, "step": 27100 }, { "entropy": 0.5057170979678631, "epoch": 0.44030111333977573, "grad_norm": 8.5, "learning_rate": 3.037378067555875e-05, "loss": 0.5203274726867676, "mean_token_accuracy": 0.8720692843198776, "num_tokens": 55421395.0, "step": 27110 }, { "entropy": 0.6131428938359023, "epoch": 0.4404635261444012, "grad_norm": 6.375, "learning_rate": 3.0361116687940556e-05, "loss": 0.6149850368499756, "mean_token_accuracy": 0.8417527608573436, "num_tokens": 55442167.0, "step": 27120 }, { "entropy": 0.5441217758692801, "epoch": 0.44062593894902674, "grad_norm": 9.3125, "learning_rate": 3.0348451258169925e-05, "loss": 0.5217996120452881, "mean_token_accuracy": 0.8671445786952973, "num_tokens": 55462832.0, "step": 27130 }, { "entropy": 0.4976544429548085, "epoch": 0.4407883517536523, "grad_norm": 7.59375, "learning_rate": 3.0335784389653887e-05, "loss": 0.4890916347503662, "mean_token_accuracy": 0.8734675623476506, "num_tokens": 55483892.0, "step": 27140 }, { "entropy": 0.5568031307775527, "epoch": 0.44095076455827775, "grad_norm": 6.21875, "learning_rate": 3.032311608579986e-05, "loss": 0.5358655452728271, "mean_token_accuracy": 0.8669014245271682, "num_tokens": 55504320.0, "step": 27150 }, { "entropy": 0.49871573350392284, "epoch": 0.4411131773629033, "grad_norm": 6.21875, "learning_rate": 3.0310446350015636e-05, "loss": 0.49774761199951173, "mean_token_accuracy": 0.8651471607387066, "num_tokens": 55526353.0, "step": 27160 }, { "entropy": 0.5685152924619615, "epoch": 0.4412755901675288, "grad_norm": 9.1875, "learning_rate": 3.0297775185709414e-05, "loss": 0.5961421012878418, "mean_token_accuracy": 0.8542404055595398, "num_tokens": 55547541.0, "step": 27170 }, { "entropy": 0.49678133903071287, "epoch": 0.4414380029721543, "grad_norm": 4.8125, "learning_rate": 3.028510259628976e-05, "loss": 0.4837193012237549, "mean_token_accuracy": 0.8756991527974606, "num_tokens": 55568647.0, "step": 27180 }, { "entropy": 0.5176765469834208, "epoch": 0.44160041577677983, "grad_norm": 5.21875, "learning_rate": 3.027242858516563e-05, "loss": 0.539128303527832, "mean_token_accuracy": 0.8731474369764328, "num_tokens": 55588744.0, "step": 27190 }, { "entropy": 0.550701069040224, "epoch": 0.44176282858140536, "grad_norm": 6.71875, "learning_rate": 3.0259753155746363e-05, "loss": 0.5892716884613037, "mean_token_accuracy": 0.8614097677171231, "num_tokens": 55608248.0, "step": 27200 }, { "entropy": 0.5029158903285861, "epoch": 0.4419252413860309, "grad_norm": 5.4375, "learning_rate": 3.024707631144167e-05, "loss": 0.5024892330169678, "mean_token_accuracy": 0.8727006711065769, "num_tokens": 55628516.0, "step": 27210 }, { "entropy": 0.4638066618703306, "epoch": 0.4420876541906564, "grad_norm": 8.4375, "learning_rate": 3.0234398055661667e-05, "loss": 0.48854885101318357, "mean_token_accuracy": 0.873700724542141, "num_tokens": 55649273.0, "step": 27220 }, { "entropy": 0.47275223713368175, "epoch": 0.4422500669952819, "grad_norm": 9.3125, "learning_rate": 3.0221718391816816e-05, "loss": 0.4710687160491943, "mean_token_accuracy": 0.8771762073040008, "num_tokens": 55669210.0, "step": 27230 }, { "entropy": 0.5611609892453998, "epoch": 0.44241247979990744, "grad_norm": 9.125, "learning_rate": 3.020903732331799e-05, "loss": 0.5483808517456055, "mean_token_accuracy": 0.8577362351119519, "num_tokens": 55690165.0, "step": 27240 }, { "entropy": 0.5019849573262036, "epoch": 0.4425748926045329, "grad_norm": 11.75, "learning_rate": 3.0196354853576404e-05, "loss": 0.47623019218444823, "mean_token_accuracy": 0.8878120966255665, "num_tokens": 55709978.0, "step": 27250 }, { "entropy": 0.5766485585831106, "epoch": 0.44273730540915845, "grad_norm": 9.0625, "learning_rate": 3.01836709860037e-05, "loss": 0.56859130859375, "mean_token_accuracy": 0.8532906875014306, "num_tokens": 55731107.0, "step": 27260 }, { "entropy": 0.46530290339142083, "epoch": 0.442899718213784, "grad_norm": 11.0, "learning_rate": 3.0170985724011842e-05, "loss": 0.4409780979156494, "mean_token_accuracy": 0.8799609616398811, "num_tokens": 55751181.0, "step": 27270 }, { "entropy": 0.5087373574264348, "epoch": 0.44306213101840947, "grad_norm": 6.40625, "learning_rate": 3.0158299071013202e-05, "loss": 0.49903407096862795, "mean_token_accuracy": 0.8628100242465735, "num_tokens": 55770590.0, "step": 27280 }, { "entropy": 0.5108993250876666, "epoch": 0.443224543823035, "grad_norm": 6.40625, "learning_rate": 3.0145611030420522e-05, "loss": 0.5626221656799316, "mean_token_accuracy": 0.8675781033933163, "num_tokens": 55791618.0, "step": 27290 }, { "entropy": 0.4797052348963916, "epoch": 0.44338695662766053, "grad_norm": 7.4375, "learning_rate": 3.0132921605646912e-05, "loss": 0.5313747882843017, "mean_token_accuracy": 0.8695507697761059, "num_tokens": 55811544.0, "step": 27300 }, { "entropy": 0.5900356122292578, "epoch": 0.44354936943228607, "grad_norm": 8.4375, "learning_rate": 3.0120230800105857e-05, "loss": 0.6271039485931397, "mean_token_accuracy": 0.857377254217863, "num_tokens": 55832286.0, "step": 27310 }, { "entropy": 0.49382907184772196, "epoch": 0.44371178223691154, "grad_norm": 7.375, "learning_rate": 3.01075386172112e-05, "loss": 0.5063539981842041, "mean_token_accuracy": 0.8756177663803101, "num_tokens": 55852017.0, "step": 27320 }, { "entropy": 0.5082624503411353, "epoch": 0.4438741950415371, "grad_norm": 9.0, "learning_rate": 3.009484506037719e-05, "loss": 0.5057880401611328, "mean_token_accuracy": 0.8652433432638645, "num_tokens": 55873681.0, "step": 27330 }, { "entropy": 0.5111311489716173, "epoch": 0.4440366078461626, "grad_norm": 6.03125, "learning_rate": 3.00821501330184e-05, "loss": 0.5077598094940186, "mean_token_accuracy": 0.8754937760531902, "num_tokens": 55894903.0, "step": 27340 }, { "entropy": 0.4634359278716147, "epoch": 0.4441990206507881, "grad_norm": 9.0, "learning_rate": 3.0069453838549806e-05, "loss": 0.47876534461975095, "mean_token_accuracy": 0.8788744933903218, "num_tokens": 55915418.0, "step": 27350 }, { "entropy": 0.4893330675549805, "epoch": 0.4443614334554136, "grad_norm": 7.34375, "learning_rate": 3.005675618038673e-05, "loss": 0.44977564811706544, "mean_token_accuracy": 0.87604189068079, "num_tokens": 55935275.0, "step": 27360 }, { "entropy": 0.5168673981912434, "epoch": 0.44452384626003916, "grad_norm": 11.1875, "learning_rate": 3.004405716194488e-05, "loss": 0.5626243114471435, "mean_token_accuracy": 0.8583581402897835, "num_tokens": 55954690.0, "step": 27370 }, { "entropy": 0.4817249019630253, "epoch": 0.44468625906466464, "grad_norm": 10.75, "learning_rate": 3.003135678664033e-05, "loss": 0.529530382156372, "mean_token_accuracy": 0.8730773575603962, "num_tokens": 55974465.0, "step": 27380 }, { "entropy": 0.5289487045258283, "epoch": 0.44484867186929017, "grad_norm": 5.5, "learning_rate": 3.0018655057889482e-05, "loss": 0.5650976181030274, "mean_token_accuracy": 0.8635201297700406, "num_tokens": 55994092.0, "step": 27390 }, { "entropy": 0.5725059876218438, "epoch": 0.4450110846739157, "grad_norm": 8.5625, "learning_rate": 3.0005951979109155e-05, "loss": 0.6047881126403809, "mean_token_accuracy": 0.8567812725901603, "num_tokens": 56014419.0, "step": 27400 }, { "entropy": 0.5280761973001062, "epoch": 0.44517349747854124, "grad_norm": 7.28125, "learning_rate": 2.9993247553716484e-05, "loss": 0.508406114578247, "mean_token_accuracy": 0.8674389019608497, "num_tokens": 56035522.0, "step": 27410 }, { "entropy": 0.5342308286111802, "epoch": 0.4453359102831667, "grad_norm": 5.90625, "learning_rate": 2.9980541785129012e-05, "loss": 0.5391977310180665, "mean_token_accuracy": 0.8635302193462848, "num_tokens": 56055465.0, "step": 27420 }, { "entropy": 0.487649381486699, "epoch": 0.44549832308779225, "grad_norm": 7.4375, "learning_rate": 2.99678346767646e-05, "loss": 0.4839106559753418, "mean_token_accuracy": 0.8780412517488003, "num_tokens": 56075077.0, "step": 27430 }, { "entropy": 0.47437108277808876, "epoch": 0.4456607358924178, "grad_norm": 7.5625, "learning_rate": 2.9955126232041496e-05, "loss": 0.46820816993713377, "mean_token_accuracy": 0.8784167058765888, "num_tokens": 56095576.0, "step": 27440 }, { "entropy": 0.5081771889701485, "epoch": 0.44582314869704326, "grad_norm": 9.1875, "learning_rate": 2.9942416454378296e-05, "loss": 0.5080283164978028, "mean_token_accuracy": 0.8738152541220188, "num_tokens": 56114594.0, "step": 27450 }, { "entropy": 0.5496200503315777, "epoch": 0.4459855615016688, "grad_norm": 6.0, "learning_rate": 2.9929705347193966e-05, "loss": 0.5539786338806152, "mean_token_accuracy": 0.8692952737212181, "num_tokens": 56135148.0, "step": 27460 }, { "entropy": 0.45578996525146065, "epoch": 0.4461479743062943, "grad_norm": 5.34375, "learning_rate": 2.9916992913907814e-05, "loss": 0.47879323959350584, "mean_token_accuracy": 0.8847390830516815, "num_tokens": 56154659.0, "step": 27470 }, { "entropy": 0.5028160045389086, "epoch": 0.4463103871109198, "grad_norm": 8.6875, "learning_rate": 2.9904279157939525e-05, "loss": 0.5629745483398437, "mean_token_accuracy": 0.860260084271431, "num_tokens": 56175762.0, "step": 27480 }, { "entropy": 0.42568334874231367, "epoch": 0.44647279991554534, "grad_norm": 8.9375, "learning_rate": 2.9891564082709123e-05, "loss": 0.4326143264770508, "mean_token_accuracy": 0.8924735195934772, "num_tokens": 56195953.0, "step": 27490 }, { "entropy": 0.4986663500778377, "epoch": 0.44663521272017087, "grad_norm": 5.15625, "learning_rate": 2.9878847691636985e-05, "loss": 0.4687326908111572, "mean_token_accuracy": 0.8736995488405228, "num_tokens": 56216604.0, "step": 27500 }, { "entropy": 0.47569279102608564, "epoch": 0.44679762552479635, "grad_norm": 6.8125, "learning_rate": 2.9866129988143853e-05, "loss": 0.4851207733154297, "mean_token_accuracy": 0.8794075772166252, "num_tokens": 56237849.0, "step": 27510 }, { "entropy": 0.48038350851275025, "epoch": 0.4469600383294219, "grad_norm": 7.375, "learning_rate": 2.985341097565082e-05, "loss": 0.4679347038269043, "mean_token_accuracy": 0.8777019068598747, "num_tokens": 56258647.0, "step": 27520 }, { "entropy": 0.5460156882880256, "epoch": 0.4471224511340474, "grad_norm": 7.34375, "learning_rate": 2.9840690657579324e-05, "loss": 0.4965061187744141, "mean_token_accuracy": 0.8728871699422598, "num_tokens": 56279234.0, "step": 27530 }, { "entropy": 0.5350760090630502, "epoch": 0.44728486393867295, "grad_norm": 9.4375, "learning_rate": 2.9827969037351166e-05, "loss": 0.5187799453735351, "mean_token_accuracy": 0.8699410758912564, "num_tokens": 56300189.0, "step": 27540 }, { "entropy": 0.5151982740266249, "epoch": 0.4474472767432984, "grad_norm": 5.71875, "learning_rate": 2.981524611838848e-05, "loss": 0.45757360458374025, "mean_token_accuracy": 0.8829277276992797, "num_tokens": 56321698.0, "step": 27550 }, { "entropy": 0.4480190242640674, "epoch": 0.44760968954792396, "grad_norm": 9.1875, "learning_rate": 2.9802521904113778e-05, "loss": 0.5054731845855713, "mean_token_accuracy": 0.8751645080745221, "num_tokens": 56342065.0, "step": 27560 }, { "entropy": 0.5197412563953548, "epoch": 0.4477721023525495, "grad_norm": 9.5, "learning_rate": 2.978979639794988e-05, "loss": 0.561060094833374, "mean_token_accuracy": 0.8642024844884872, "num_tokens": 56362415.0, "step": 27570 }, { "entropy": 0.46230391040444374, "epoch": 0.447934515157175, "grad_norm": 8.375, "learning_rate": 2.9777069603319994e-05, "loss": 0.49129185676574705, "mean_token_accuracy": 0.8724095463752747, "num_tokens": 56382271.0, "step": 27580 }, { "entropy": 0.5471215604804456, "epoch": 0.4480969279618005, "grad_norm": 7.1875, "learning_rate": 2.9764341523647645e-05, "loss": 0.6013251304626465, "mean_token_accuracy": 0.8551538266241551, "num_tokens": 56402687.0, "step": 27590 }, { "entropy": 0.5851567406672984, "epoch": 0.44825934076642604, "grad_norm": 8.75, "learning_rate": 2.9751612162356725e-05, "loss": 0.5470786094665527, "mean_token_accuracy": 0.8647656932473182, "num_tokens": 56423274.0, "step": 27600 }, { "entropy": 0.5084506246494129, "epoch": 0.4484217535710515, "grad_norm": 8.3125, "learning_rate": 2.973888152287144e-05, "loss": 0.5340044975280762, "mean_token_accuracy": 0.8664151422679425, "num_tokens": 56444441.0, "step": 27610 }, { "entropy": 0.5077030701562762, "epoch": 0.44858416637567705, "grad_norm": 8.0625, "learning_rate": 2.972614960861639e-05, "loss": 0.5306628227233887, "mean_token_accuracy": 0.8696650039404631, "num_tokens": 56463507.0, "step": 27620 }, { "entropy": 0.5160880568902939, "epoch": 0.4487465791803026, "grad_norm": 6.65625, "learning_rate": 2.9713416423016466e-05, "loss": 0.4837037086486816, "mean_token_accuracy": 0.8810078144073487, "num_tokens": 56482722.0, "step": 27630 }, { "entropy": 0.5227928462438285, "epoch": 0.4489089919849281, "grad_norm": 8.9375, "learning_rate": 2.9700681969496937e-05, "loss": 0.5156248092651368, "mean_token_accuracy": 0.8673313677310943, "num_tokens": 56504096.0, "step": 27640 }, { "entropy": 0.5935252169147134, "epoch": 0.4490714047895536, "grad_norm": 6.96875, "learning_rate": 2.9687946251483394e-05, "loss": 0.5783194065093994, "mean_token_accuracy": 0.8519051276147366, "num_tokens": 56524768.0, "step": 27650 }, { "entropy": 0.6159563443623484, "epoch": 0.44923381759417913, "grad_norm": 6.875, "learning_rate": 2.9675209272401765e-05, "loss": 0.6225059986114502, "mean_token_accuracy": 0.8387514986097813, "num_tokens": 56544927.0, "step": 27660 }, { "entropy": 0.5161966452840716, "epoch": 0.44939623039880466, "grad_norm": 6.0625, "learning_rate": 2.9662471035678346e-05, "loss": 0.5211599349975586, "mean_token_accuracy": 0.861641599982977, "num_tokens": 56565486.0, "step": 27670 }, { "entropy": 0.4803266603965312, "epoch": 0.44955864320343014, "grad_norm": 5.40625, "learning_rate": 2.9649731544739733e-05, "loss": 0.49917969703674314, "mean_token_accuracy": 0.8728828027844429, "num_tokens": 56586134.0, "step": 27680 }, { "entropy": 0.47412106483243405, "epoch": 0.4497210560080557, "grad_norm": 9.1875, "learning_rate": 2.9636990803012893e-05, "loss": 0.4657122611999512, "mean_token_accuracy": 0.8911771476268768, "num_tokens": 56606440.0, "step": 27690 }, { "entropy": 0.5424385031219572, "epoch": 0.4498834688126812, "grad_norm": 6.8125, "learning_rate": 2.9624248813925094e-05, "loss": 0.567103385925293, "mean_token_accuracy": 0.8623527109622955, "num_tokens": 56626049.0, "step": 27700 }, { "entropy": 0.4593048396985978, "epoch": 0.4500458816173067, "grad_norm": 9.75, "learning_rate": 2.9611505580903977e-05, "loss": 0.47066497802734375, "mean_token_accuracy": 0.8742348283529282, "num_tokens": 56645533.0, "step": 27710 }, { "entropy": 0.48223865386098624, "epoch": 0.4502082944219322, "grad_norm": 7.9375, "learning_rate": 2.9598761107377498e-05, "loss": 0.47821626663208006, "mean_token_accuracy": 0.881100806593895, "num_tokens": 56665584.0, "step": 27720 }, { "entropy": 0.5023659316357225, "epoch": 0.45037070722655775, "grad_norm": 7.09375, "learning_rate": 2.958601539677394e-05, "loss": 0.48133211135864257, "mean_token_accuracy": 0.8764194183051586, "num_tokens": 56687023.0, "step": 27730 }, { "entropy": 0.5197680281009525, "epoch": 0.45053312003118323, "grad_norm": 9.4375, "learning_rate": 2.957326845252194e-05, "loss": 0.5338258266448974, "mean_token_accuracy": 0.8639291673898697, "num_tokens": 56707177.0, "step": 27740 }, { "entropy": 0.5231988635845483, "epoch": 0.45069553283580877, "grad_norm": 8.8125, "learning_rate": 2.9560520278050448e-05, "loss": 0.5094373226165771, "mean_token_accuracy": 0.8687764957547188, "num_tokens": 56728713.0, "step": 27750 }, { "entropy": 0.47884522438980637, "epoch": 0.4508579456404343, "grad_norm": 8.125, "learning_rate": 2.954777087678875e-05, "loss": 0.4620362281799316, "mean_token_accuracy": 0.8785881973803044, "num_tokens": 56748557.0, "step": 27760 }, { "entropy": 0.49885212825611236, "epoch": 0.45102035844505983, "grad_norm": 9.625, "learning_rate": 2.953502025216646e-05, "loss": 0.503712511062622, "mean_token_accuracy": 0.8713699534535408, "num_tokens": 56769356.0, "step": 27770 }, { "entropy": 0.46684436984360217, "epoch": 0.4511827712496853, "grad_norm": 9.9375, "learning_rate": 2.952226840761354e-05, "loss": 0.4527806282043457, "mean_token_accuracy": 0.8795828327536583, "num_tokens": 56789479.0, "step": 27780 }, { "entropy": 0.48974854149855673, "epoch": 0.45134518405431084, "grad_norm": 7.0, "learning_rate": 2.950951534656025e-05, "loss": 0.46338319778442383, "mean_token_accuracy": 0.8781877338886261, "num_tokens": 56810659.0, "step": 27790 }, { "entropy": 0.49248120239935816, "epoch": 0.4515075968589364, "grad_norm": 8.0625, "learning_rate": 2.9496761072437202e-05, "loss": 0.4911224842071533, "mean_token_accuracy": 0.8764248505234719, "num_tokens": 56831701.0, "step": 27800 }, { "entropy": 0.49278630600310863, "epoch": 0.45167000966356186, "grad_norm": 7.03125, "learning_rate": 2.9484005588675313e-05, "loss": 0.47745490074157715, "mean_token_accuracy": 0.8704216599464416, "num_tokens": 56850634.0, "step": 27810 }, { "entropy": 0.47929648105055095, "epoch": 0.4518324224681874, "grad_norm": 7.40625, "learning_rate": 2.947124889870585e-05, "loss": 0.4843841552734375, "mean_token_accuracy": 0.8734408773481845, "num_tokens": 56872522.0, "step": 27820 }, { "entropy": 0.47668720008805393, "epoch": 0.4519948352728129, "grad_norm": 10.375, "learning_rate": 2.9458491005960386e-05, "loss": 0.5225075244903564, "mean_token_accuracy": 0.8707329206168651, "num_tokens": 56892175.0, "step": 27830 }, { "entropy": 0.49260620479471984, "epoch": 0.4521572480774384, "grad_norm": 5.75, "learning_rate": 2.9445731913870816e-05, "loss": 0.4771301746368408, "mean_token_accuracy": 0.8791799023747444, "num_tokens": 56912585.0, "step": 27840 }, { "entropy": 0.4822661988670006, "epoch": 0.45231966088206393, "grad_norm": 10.0625, "learning_rate": 2.9432971625869367e-05, "loss": 0.5201068878173828, "mean_token_accuracy": 0.8631275564432144, "num_tokens": 56933266.0, "step": 27850 }, { "entropy": 0.51104031347204, "epoch": 0.45248207368668947, "grad_norm": 12.1875, "learning_rate": 2.9420210145388595e-05, "loss": 0.5032454490661621, "mean_token_accuracy": 0.8668810598552227, "num_tokens": 56953909.0, "step": 27860 }, { "entropy": 0.6333530560135842, "epoch": 0.452644486491315, "grad_norm": 11.5, "learning_rate": 2.9407447475861356e-05, "loss": 0.6678153991699218, "mean_token_accuracy": 0.8415273122489453, "num_tokens": 56974936.0, "step": 27870 }, { "entropy": 0.533442331571132, "epoch": 0.4528068992959405, "grad_norm": 8.625, "learning_rate": 2.9394683620720846e-05, "loss": 0.5945525646209717, "mean_token_accuracy": 0.8582693263888359, "num_tokens": 56995058.0, "step": 27880 }, { "entropy": 0.46883983693551273, "epoch": 0.452969312100566, "grad_norm": 8.4375, "learning_rate": 2.9381918583400553e-05, "loss": 0.4554112434387207, "mean_token_accuracy": 0.8908465370535851, "num_tokens": 57015191.0, "step": 27890 }, { "entropy": 0.577692665765062, "epoch": 0.45313172490519155, "grad_norm": 10.5625, "learning_rate": 2.936915236733433e-05, "loss": 0.549635362625122, "mean_token_accuracy": 0.8569009244441986, "num_tokens": 57034717.0, "step": 27900 }, { "entropy": 0.4780918015167117, "epoch": 0.453294137709817, "grad_norm": 9.0625, "learning_rate": 2.935638497595629e-05, "loss": 0.5154565334320068, "mean_token_accuracy": 0.8733496107161045, "num_tokens": 57055057.0, "step": 27910 }, { "entropy": 0.5785620251204818, "epoch": 0.45345655051444256, "grad_norm": 10.125, "learning_rate": 2.9343616412700908e-05, "loss": 0.5828054428100586, "mean_token_accuracy": 0.8555382870137691, "num_tokens": 57076239.0, "step": 27920 }, { "entropy": 0.5751172923715785, "epoch": 0.4536189633190681, "grad_norm": 8.6875, "learning_rate": 2.9330846681002942e-05, "loss": 0.6005470752716064, "mean_token_accuracy": 0.8553027667105197, "num_tokens": 57098929.0, "step": 27930 }, { "entropy": 0.5203103151172399, "epoch": 0.45378137612369357, "grad_norm": 8.625, "learning_rate": 2.9318075784297494e-05, "loss": 0.5234109401702881, "mean_token_accuracy": 0.8663516607135534, "num_tokens": 57120099.0, "step": 27940 }, { "entropy": 0.5321633242070675, "epoch": 0.4539437889283191, "grad_norm": 11.0625, "learning_rate": 2.930530372601995e-05, "loss": 0.5512485504150391, "mean_token_accuracy": 0.8660279542207718, "num_tokens": 57139795.0, "step": 27950 }, { "entropy": 0.5003785068169236, "epoch": 0.45410620173294464, "grad_norm": 8.0625, "learning_rate": 2.9292530509606033e-05, "loss": 0.4947153091430664, "mean_token_accuracy": 0.8785861395299435, "num_tokens": 57160397.0, "step": 27960 }, { "entropy": 0.4445462642703205, "epoch": 0.4542686145375701, "grad_norm": 9.4375, "learning_rate": 2.9279756138491754e-05, "loss": 0.4654655456542969, "mean_token_accuracy": 0.8850097946822644, "num_tokens": 57181727.0, "step": 27970 }, { "entropy": 0.5683333247900009, "epoch": 0.45443102734219565, "grad_norm": 10.25, "learning_rate": 2.926698061611346e-05, "loss": 0.5688388824462891, "mean_token_accuracy": 0.860228106752038, "num_tokens": 57202140.0, "step": 27980 }, { "entropy": 0.48379323692061005, "epoch": 0.4545934401468212, "grad_norm": 8.5, "learning_rate": 2.9254203945907794e-05, "loss": 0.47608389854431155, "mean_token_accuracy": 0.879845168441534, "num_tokens": 57223058.0, "step": 27990 }, { "epoch": 0.4547558529514467, "eval_entropy": 0.5441888830661774, "eval_loss": 0.5518063902854919, "eval_mean_token_accuracy": 0.8600729928016663, "eval_num_tokens": 57242778.0, "eval_runtime": 40.2499, "eval_samples_per_second": 49.69, "eval_steps_per_second": 6.211, "step": 28000 }, { "entropy": 0.48952402198920025, "epoch": 0.4549182657560722, "grad_norm": 7.28125, "learning_rate": 2.9228647175762445e-05, "loss": 0.5143888473510743, "mean_token_accuracy": 0.867078723013401, "num_tokens": 57263299.0, "step": 28010 }, { "entropy": 0.5396759864408522, "epoch": 0.4550806785606977, "grad_norm": 6.15625, "learning_rate": 2.92158670826976e-05, "loss": 0.5393098831176758, "mean_token_accuracy": 0.8725659303367138, "num_tokens": 57284598.0, "step": 28020 }, { "entropy": 0.517999223107472, "epoch": 0.45524309136532326, "grad_norm": 8.8125, "learning_rate": 2.920308585555504e-05, "loss": 0.5075906276702881, "mean_token_accuracy": 0.8702138021588326, "num_tokens": 57305160.0, "step": 28030 }, { "entropy": 0.5549280947539955, "epoch": 0.45540550416994874, "grad_norm": 6.15625, "learning_rate": 2.919030349777293e-05, "loss": 0.5839489936828614, "mean_token_accuracy": 0.8565610155463219, "num_tokens": 57325441.0, "step": 28040 }, { "entropy": 0.5128659505862743, "epoch": 0.45556791697457427, "grad_norm": 6.3125, "learning_rate": 2.917752001278976e-05, "loss": 0.4966397762298584, "mean_token_accuracy": 0.8731828995049, "num_tokens": 57345297.0, "step": 28050 }, { "entropy": 0.5385017185704782, "epoch": 0.4557303297791998, "grad_norm": 8.0, "learning_rate": 2.916473540404433e-05, "loss": 0.49066753387451173, "mean_token_accuracy": 0.8759444318711758, "num_tokens": 57366497.0, "step": 28060 }, { "entropy": 0.529580403631553, "epoch": 0.4558927425838253, "grad_norm": 9.0625, "learning_rate": 2.915194967497571e-05, "loss": 0.5299291133880615, "mean_token_accuracy": 0.8664688996970653, "num_tokens": 57386949.0, "step": 28070 }, { "entropy": 0.5750752655323594, "epoch": 0.4560551553884508, "grad_norm": 6.125, "learning_rate": 2.9139162829023292e-05, "loss": 0.5896079540252686, "mean_token_accuracy": 0.8533597849309444, "num_tokens": 57408045.0, "step": 28080 }, { "entropy": 0.4991929487325251, "epoch": 0.45621756819307635, "grad_norm": 9.125, "learning_rate": 2.9126374869626777e-05, "loss": 0.5069374561309814, "mean_token_accuracy": 0.8679572634398938, "num_tokens": 57427807.0, "step": 28090 }, { "entropy": 0.46944609307684004, "epoch": 0.4563799809977019, "grad_norm": 7.1875, "learning_rate": 2.911358580022615e-05, "loss": 0.4558931827545166, "mean_token_accuracy": 0.8824787326157093, "num_tokens": 57447866.0, "step": 28100 }, { "entropy": 0.43078374401666225, "epoch": 0.45654239380232736, "grad_norm": 8.8125, "learning_rate": 2.910079562426169e-05, "loss": 0.4022679805755615, "mean_token_accuracy": 0.8916513793170452, "num_tokens": 57466679.0, "step": 28110 }, { "entropy": 0.5269088610075414, "epoch": 0.4567048066069529, "grad_norm": 7.46875, "learning_rate": 2.9088004345174e-05, "loss": 0.5316169261932373, "mean_token_accuracy": 0.8533508881926537, "num_tokens": 57486343.0, "step": 28120 }, { "entropy": 0.4818964248523116, "epoch": 0.45686721941157843, "grad_norm": 7.28125, "learning_rate": 2.9075211966403948e-05, "loss": 0.4827631950378418, "mean_token_accuracy": 0.8727773398160934, "num_tokens": 57506978.0, "step": 28130 }, { "entropy": 0.4838607113342732, "epoch": 0.4570296322162039, "grad_norm": 6.59375, "learning_rate": 2.9062418491392718e-05, "loss": 0.4867546558380127, "mean_token_accuracy": 0.8754599928855896, "num_tokens": 57526599.0, "step": 28140 }, { "entropy": 0.5435472069308162, "epoch": 0.45719204502082944, "grad_norm": 11.3125, "learning_rate": 2.9049623923581788e-05, "loss": 0.6364171981811524, "mean_token_accuracy": 0.8509659618139267, "num_tokens": 57547188.0, "step": 28150 }, { "entropy": 0.49644737197086214, "epoch": 0.457354457825455, "grad_norm": 7.3125, "learning_rate": 2.903682826641292e-05, "loss": 0.515169906616211, "mean_token_accuracy": 0.8726398512721062, "num_tokens": 57569570.0, "step": 28160 }, { "entropy": 0.48946651970036326, "epoch": 0.45751687063008045, "grad_norm": 12.75, "learning_rate": 2.9024031523328183e-05, "loss": 0.4747940540313721, "mean_token_accuracy": 0.8815559990704059, "num_tokens": 57589610.0, "step": 28170 }, { "entropy": 0.5725207781419158, "epoch": 0.457679283434706, "grad_norm": 6.5625, "learning_rate": 2.9011233697769914e-05, "loss": 0.5641712665557861, "mean_token_accuracy": 0.8569286536425352, "num_tokens": 57609812.0, "step": 28180 }, { "entropy": 0.533456351654604, "epoch": 0.4578416962393315, "grad_norm": 8.1875, "learning_rate": 2.8998434793180767e-05, "loss": 0.5626682281494141, "mean_token_accuracy": 0.861941971629858, "num_tokens": 57629214.0, "step": 28190 }, { "entropy": 0.49125935332849624, "epoch": 0.45800410904395705, "grad_norm": 12.125, "learning_rate": 2.8985634813003672e-05, "loss": 0.4998145580291748, "mean_token_accuracy": 0.8718176349997521, "num_tokens": 57650587.0, "step": 28200 }, { "entropy": 0.5387174333445728, "epoch": 0.45816652184858253, "grad_norm": 7.40625, "learning_rate": 2.8972833760681867e-05, "loss": 0.534962797164917, "mean_token_accuracy": 0.869414459913969, "num_tokens": 57671898.0, "step": 28210 }, { "entropy": 0.4518477004021406, "epoch": 0.45832893465320806, "grad_norm": 7.03125, "learning_rate": 2.896003163965884e-05, "loss": 0.4726675510406494, "mean_token_accuracy": 0.8794634446501732, "num_tokens": 57692822.0, "step": 28220 }, { "entropy": 0.5405137675348669, "epoch": 0.4584913474578336, "grad_norm": 8.6875, "learning_rate": 2.89472284533784e-05, "loss": 0.5719991683959961, "mean_token_accuracy": 0.858391311392188, "num_tokens": 57713030.0, "step": 28230 }, { "entropy": 0.5613314555026591, "epoch": 0.4586537602624591, "grad_norm": 6.25, "learning_rate": 2.8934424205284643e-05, "loss": 0.5509742736816406, "mean_token_accuracy": 0.866412004083395, "num_tokens": 57734798.0, "step": 28240 }, { "entropy": 0.5574503833195195, "epoch": 0.4588161730670846, "grad_norm": 8.75, "learning_rate": 2.8921618898821934e-05, "loss": 0.5286017894744873, "mean_token_accuracy": 0.8658315978944302, "num_tokens": 57756250.0, "step": 28250 }, { "entropy": 0.5151393934618682, "epoch": 0.45897858587171014, "grad_norm": 10.3125, "learning_rate": 2.890881253743492e-05, "loss": 0.5381489753723144, "mean_token_accuracy": 0.8738049898296595, "num_tokens": 57776265.0, "step": 28260 }, { "entropy": 0.46738332798704507, "epoch": 0.4591409986763356, "grad_norm": 11.5, "learning_rate": 2.8896005124568554e-05, "loss": 0.4683993339538574, "mean_token_accuracy": 0.8755813539028168, "num_tokens": 57796790.0, "step": 28270 }, { "entropy": 0.5273630083538592, "epoch": 0.45930341148096115, "grad_norm": 9.6875, "learning_rate": 2.8883196663668062e-05, "loss": 0.5507990837097168, "mean_token_accuracy": 0.8600769765675068, "num_tokens": 57817484.0, "step": 28280 }, { "entropy": 0.4415387250483036, "epoch": 0.4594658242855867, "grad_norm": 6.03125, "learning_rate": 2.887038715817893e-05, "loss": 0.4413275718688965, "mean_token_accuracy": 0.8893660947680473, "num_tokens": 57837740.0, "step": 28290 }, { "entropy": 0.5317445192020387, "epoch": 0.45962823709021217, "grad_norm": 7.0, "learning_rate": 2.8857576611546953e-05, "loss": 0.559794807434082, "mean_token_accuracy": 0.8656041763722897, "num_tokens": 57857361.0, "step": 28300 }, { "entropy": 0.502260118466802, "epoch": 0.4597906498948377, "grad_norm": 6.4375, "learning_rate": 2.88447650272182e-05, "loss": 0.5337009429931641, "mean_token_accuracy": 0.8711214151233435, "num_tokens": 57876673.0, "step": 28310 }, { "entropy": 0.5326050275471061, "epoch": 0.45995306269946323, "grad_norm": 9.9375, "learning_rate": 2.8831952408639017e-05, "loss": 0.5522456169128418, "mean_token_accuracy": 0.8649732425808907, "num_tokens": 57897760.0, "step": 28320 }, { "entropy": 0.512941948743537, "epoch": 0.46011547550408877, "grad_norm": 11.1875, "learning_rate": 2.8819138759256025e-05, "loss": 0.5521686553955079, "mean_token_accuracy": 0.8665618255734444, "num_tokens": 57917713.0, "step": 28330 }, { "entropy": 0.4751192986033857, "epoch": 0.46027788830871424, "grad_norm": 6.375, "learning_rate": 2.8806324082516118e-05, "loss": 0.4707766532897949, "mean_token_accuracy": 0.8736432760953903, "num_tokens": 57938881.0, "step": 28340 }, { "entropy": 0.5120963967172429, "epoch": 0.4604403011133398, "grad_norm": 9.5, "learning_rate": 2.8793508381866485e-05, "loss": 0.4795109272003174, "mean_token_accuracy": 0.8774783879518508, "num_tokens": 57959295.0, "step": 28350 }, { "entropy": 0.5658920949324966, "epoch": 0.4606027139179653, "grad_norm": 13.6875, "learning_rate": 2.8780691660754565e-05, "loss": 0.6059384346008301, "mean_token_accuracy": 0.8520291686058045, "num_tokens": 57979009.0, "step": 28360 }, { "entropy": 0.4981432196684182, "epoch": 0.4607651267225908, "grad_norm": 8.5625, "learning_rate": 2.8767873922628102e-05, "loss": 0.43939967155456544, "mean_token_accuracy": 0.8817379660904408, "num_tokens": 57999339.0, "step": 28370 }, { "entropy": 0.5212194129824639, "epoch": 0.4609275395272163, "grad_norm": 6.0625, "learning_rate": 2.8755055170935076e-05, "loss": 0.5792467594146729, "mean_token_accuracy": 0.8642659697681665, "num_tokens": 58019417.0, "step": 28380 }, { "entropy": 0.44297404419630765, "epoch": 0.46108995233184186, "grad_norm": 7.125, "learning_rate": 2.8742235409123774e-05, "loss": 0.4357861042022705, "mean_token_accuracy": 0.8881089258939028, "num_tokens": 58038736.0, "step": 28390 }, { "entropy": 0.5363168688025326, "epoch": 0.46125236513646733, "grad_norm": 8.3125, "learning_rate": 2.872941464064274e-05, "loss": 0.5447350978851319, "mean_token_accuracy": 0.8607410121709108, "num_tokens": 58059315.0, "step": 28400 }, { "entropy": 0.5475703152827919, "epoch": 0.46141477794109287, "grad_norm": 8.375, "learning_rate": 2.8716592868940777e-05, "loss": 0.5251903533935547, "mean_token_accuracy": 0.861194783449173, "num_tokens": 58080513.0, "step": 28410 }, { "entropy": 0.4576488234102726, "epoch": 0.4615771907457184, "grad_norm": 6.25, "learning_rate": 2.8703770097466986e-05, "loss": 0.4897459030151367, "mean_token_accuracy": 0.8768083900213242, "num_tokens": 58100753.0, "step": 28420 }, { "entropy": 0.5401749092619866, "epoch": 0.46173960355034394, "grad_norm": 7.53125, "learning_rate": 2.869094632967072e-05, "loss": 0.5256563663482666, "mean_token_accuracy": 0.8685476124286652, "num_tokens": 58120992.0, "step": 28430 }, { "entropy": 0.5994820178952068, "epoch": 0.4619020163549694, "grad_norm": 7.03125, "learning_rate": 2.8678121569001592e-05, "loss": 0.5905335903167724, "mean_token_accuracy": 0.8479108743369579, "num_tokens": 58141673.0, "step": 28440 }, { "entropy": 0.5807786268182099, "epoch": 0.46206442915959495, "grad_norm": 7.125, "learning_rate": 2.866529581890949e-05, "loss": 0.5700356960296631, "mean_token_accuracy": 0.8585917323827743, "num_tokens": 58162745.0, "step": 28450 }, { "entropy": 0.49119173910003155, "epoch": 0.4622268419642205, "grad_norm": 7.84375, "learning_rate": 2.8652469082844585e-05, "loss": 0.4945389270782471, "mean_token_accuracy": 0.8758151896297932, "num_tokens": 58183459.0, "step": 28460 }, { "entropy": 0.4786935143638402, "epoch": 0.46238925476884596, "grad_norm": 6.71875, "learning_rate": 2.8639641364257284e-05, "loss": 0.5056787014007569, "mean_token_accuracy": 0.8769511818885803, "num_tokens": 58204210.0, "step": 28470 }, { "entropy": 0.4530389823485166, "epoch": 0.4625516675734715, "grad_norm": 12.4375, "learning_rate": 2.8626812666598275e-05, "loss": 0.45955824851989746, "mean_token_accuracy": 0.8805523261427879, "num_tokens": 58224947.0, "step": 28480 }, { "entropy": 0.5226126336492598, "epoch": 0.462714080378097, "grad_norm": 7.875, "learning_rate": 2.861398299331851e-05, "loss": 0.5214745044708252, "mean_token_accuracy": 0.866798072308302, "num_tokens": 58246051.0, "step": 28490 }, { "entropy": 0.4578794526401907, "epoch": 0.4628764931827225, "grad_norm": 5.125, "learning_rate": 2.8601152347869193e-05, "loss": 0.4578597068786621, "mean_token_accuracy": 0.8783680595457554, "num_tokens": 58266863.0, "step": 28500 }, { "entropy": 0.4489408145658672, "epoch": 0.46303890598734804, "grad_norm": 7.46875, "learning_rate": 2.8588320733701813e-05, "loss": 0.4768265724182129, "mean_token_accuracy": 0.8775707565248012, "num_tokens": 58285919.0, "step": 28510 }, { "entropy": 0.49431963795796036, "epoch": 0.46320131879197357, "grad_norm": 5.03125, "learning_rate": 2.8575488154268083e-05, "loss": 0.5043485164642334, "mean_token_accuracy": 0.8650501355528831, "num_tokens": 58306424.0, "step": 28520 }, { "entropy": 0.5237580328248441, "epoch": 0.46336373159659905, "grad_norm": 8.4375, "learning_rate": 2.856265461302e-05, "loss": 0.5038021564483642, "mean_token_accuracy": 0.8681864835321903, "num_tokens": 58326799.0, "step": 28530 }, { "entropy": 0.49096395750530064, "epoch": 0.4635261444012246, "grad_norm": 5.3125, "learning_rate": 2.8549820113409824e-05, "loss": 0.5077643394470215, "mean_token_accuracy": 0.8642884336411953, "num_tokens": 58348097.0, "step": 28540 }, { "entropy": 0.5835176645312459, "epoch": 0.4636885572058501, "grad_norm": 8.25, "learning_rate": 2.8536984658890064e-05, "loss": 0.6336695194244385, "mean_token_accuracy": 0.84471683986485, "num_tokens": 58367712.0, "step": 28550 }, { "entropy": 0.5091809654608369, "epoch": 0.46385097001047565, "grad_norm": 8.4375, "learning_rate": 2.852414825291348e-05, "loss": 0.5190454483032226, "mean_token_accuracy": 0.8638127416372299, "num_tokens": 58387056.0, "step": 28560 }, { "entropy": 0.46120275696739554, "epoch": 0.4640133828151011, "grad_norm": 4.96875, "learning_rate": 2.8511310898933085e-05, "loss": 0.44015069007873536, "mean_token_accuracy": 0.8889320299029351, "num_tokens": 58407491.0, "step": 28570 }, { "entropy": 0.6074223978444934, "epoch": 0.46417579561972666, "grad_norm": 9.5, "learning_rate": 2.8498472600402183e-05, "loss": 0.6582001686096192, "mean_token_accuracy": 0.8509986132383347, "num_tokens": 58428341.0, "step": 28580 }, { "entropy": 0.5233629588969052, "epoch": 0.4643382084243522, "grad_norm": 7.9375, "learning_rate": 2.8485633360774284e-05, "loss": 0.5261407852172851, "mean_token_accuracy": 0.8707919381558895, "num_tokens": 58448294.0, "step": 28590 }, { "entropy": 0.5530929511412979, "epoch": 0.4645006212289777, "grad_norm": 8.4375, "learning_rate": 2.8472793183503173e-05, "loss": 0.5527029514312745, "mean_token_accuracy": 0.8626071806997061, "num_tokens": 58469783.0, "step": 28600 }, { "entropy": 0.5605999634368345, "epoch": 0.4646630340336032, "grad_norm": 7.71875, "learning_rate": 2.8459952072042894e-05, "loss": 0.5172740459442139, "mean_token_accuracy": 0.8667139351367951, "num_tokens": 58490031.0, "step": 28610 }, { "entropy": 0.5199708007276058, "epoch": 0.46482544683822874, "grad_norm": 8.75, "learning_rate": 2.8447110029847735e-05, "loss": 0.5435936927795411, "mean_token_accuracy": 0.8610306687653064, "num_tokens": 58511167.0, "step": 28620 }, { "entropy": 0.5285219707060606, "epoch": 0.4649878596428542, "grad_norm": 9.0, "learning_rate": 2.843426706037223e-05, "loss": 0.5509239673614502, "mean_token_accuracy": 0.8529490254819393, "num_tokens": 58531846.0, "step": 28630 }, { "entropy": 0.4617819300852716, "epoch": 0.46515027244747975, "grad_norm": 8.625, "learning_rate": 2.842142316707116e-05, "loss": 0.4571998119354248, "mean_token_accuracy": 0.8861551232635975, "num_tokens": 58551960.0, "step": 28640 }, { "entropy": 0.5548846970312298, "epoch": 0.4653126852521053, "grad_norm": 7.28125, "learning_rate": 2.840857835339957e-05, "loss": 0.5538515090942383, "mean_token_accuracy": 0.8615544237196445, "num_tokens": 58571994.0, "step": 28650 }, { "entropy": 0.5113757980056107, "epoch": 0.4654750980567308, "grad_norm": 9.5, "learning_rate": 2.8395732622812753e-05, "loss": 0.4978204250335693, "mean_token_accuracy": 0.8723662622272969, "num_tokens": 58592663.0, "step": 28660 }, { "entropy": 0.5653941868338734, "epoch": 0.4656375108613563, "grad_norm": 7.75, "learning_rate": 2.8382885978766226e-05, "loss": 0.6409220218658447, "mean_token_accuracy": 0.8487643830478191, "num_tokens": 58613682.0, "step": 28670 }, { "entropy": 0.5341850281460211, "epoch": 0.46579992366598183, "grad_norm": 12.0, "learning_rate": 2.8370038424715762e-05, "loss": 0.5393381118774414, "mean_token_accuracy": 0.8591853231191635, "num_tokens": 58634313.0, "step": 28680 }, { "entropy": 0.5011114836204797, "epoch": 0.46596233647060736, "grad_norm": 6.59375, "learning_rate": 2.8357189964117393e-05, "loss": 0.5079142093658447, "mean_token_accuracy": 0.8740311890840531, "num_tokens": 58654664.0, "step": 28690 }, { "entropy": 0.6170508376322686, "epoch": 0.46612474927523284, "grad_norm": 9.0, "learning_rate": 2.8344340600427377e-05, "loss": 0.6418595314025879, "mean_token_accuracy": 0.8460695169866085, "num_tokens": 58675988.0, "step": 28700 }, { "entropy": 0.5121612361632287, "epoch": 0.4662871620798584, "grad_norm": 6.90625, "learning_rate": 2.8331490337102227e-05, "loss": 0.5404640674591065, "mean_token_accuracy": 0.8714973345398903, "num_tokens": 58696159.0, "step": 28710 }, { "entropy": 0.4462528958567418, "epoch": 0.4664495748844839, "grad_norm": 8.9375, "learning_rate": 2.8318639177598676e-05, "loss": 0.48027911186218264, "mean_token_accuracy": 0.8837172731757164, "num_tokens": 58716041.0, "step": 28720 }, { "entropy": 0.44541050363332035, "epoch": 0.4666119876891094, "grad_norm": 5.53125, "learning_rate": 2.8305787125373745e-05, "loss": 0.4326921939849854, "mean_token_accuracy": 0.8939703673124313, "num_tokens": 58736381.0, "step": 28730 }, { "entropy": 0.5445876111276448, "epoch": 0.4667744004937349, "grad_norm": 5.84375, "learning_rate": 2.829293418388464e-05, "loss": 0.5757375717163086, "mean_token_accuracy": 0.86097097620368, "num_tokens": 58756944.0, "step": 28740 }, { "entropy": 0.4825132834259421, "epoch": 0.46693681329836045, "grad_norm": 8.25, "learning_rate": 2.8280080356588835e-05, "loss": 0.47270898818969725, "mean_token_accuracy": 0.8781957753002644, "num_tokens": 58775845.0, "step": 28750 }, { "entropy": 0.5101991995703429, "epoch": 0.467099226102986, "grad_norm": 7.59375, "learning_rate": 2.826722564694405e-05, "loss": 0.5021873950958252, "mean_token_accuracy": 0.8747146472334861, "num_tokens": 58795264.0, "step": 28760 }, { "entropy": 0.4870492432266474, "epoch": 0.46726163890761147, "grad_norm": 7.8125, "learning_rate": 2.825437005840822e-05, "loss": 0.4967355728149414, "mean_token_accuracy": 0.8747383810579776, "num_tokens": 58815089.0, "step": 28770 }, { "entropy": 0.6020934372674673, "epoch": 0.467424051712237, "grad_norm": 7.0625, "learning_rate": 2.824151359443954e-05, "loss": 0.5662275314331054, "mean_token_accuracy": 0.8609477512538433, "num_tokens": 58836348.0, "step": 28780 }, { "entropy": 0.5522577329073102, "epoch": 0.46758646451686253, "grad_norm": 6.1875, "learning_rate": 2.82286562584964e-05, "loss": 0.5624095439910889, "mean_token_accuracy": 0.8500551402568817, "num_tokens": 58856950.0, "step": 28790 }, { "entropy": 0.5230826886137947, "epoch": 0.467748877321488, "grad_norm": 7.59375, "learning_rate": 2.8215798054037483e-05, "loss": 0.4668538570404053, "mean_token_accuracy": 0.8786075439304113, "num_tokens": 58877433.0, "step": 28800 }, { "entropy": 0.46910892869345844, "epoch": 0.46791129012611354, "grad_norm": 8.4375, "learning_rate": 2.820293898452166e-05, "loss": 0.45151596069335936, "mean_token_accuracy": 0.8821590825915336, "num_tokens": 58897446.0, "step": 28810 }, { "entropy": 0.5674657616298646, "epoch": 0.4680737029307391, "grad_norm": 8.4375, "learning_rate": 2.8190079053408052e-05, "loss": 0.6006256103515625, "mean_token_accuracy": 0.8582635506987571, "num_tokens": 58917580.0, "step": 28820 }, { "entropy": 0.5289128978736699, "epoch": 0.46823611573536456, "grad_norm": 8.3125, "learning_rate": 2.8177218264156008e-05, "loss": 0.5238483428955079, "mean_token_accuracy": 0.8720385029911994, "num_tokens": 58937111.0, "step": 28830 }, { "entropy": 0.4805091550806537, "epoch": 0.4683985285399901, "grad_norm": 8.875, "learning_rate": 2.8164356620225114e-05, "loss": 0.4741964817047119, "mean_token_accuracy": 0.8736087627708912, "num_tokens": 58957083.0, "step": 28840 }, { "entropy": 0.4591565925627947, "epoch": 0.4685609413446156, "grad_norm": 8.75, "learning_rate": 2.815149412507518e-05, "loss": 0.4875450134277344, "mean_token_accuracy": 0.8846498399972915, "num_tokens": 58976646.0, "step": 28850 }, { "entropy": 0.5367325347382575, "epoch": 0.4687233541492411, "grad_norm": 8.5625, "learning_rate": 2.8138630782166236e-05, "loss": 0.5388582229614258, "mean_token_accuracy": 0.8628377974033355, "num_tokens": 58998093.0, "step": 28860 }, { "entropy": 0.5019594680983573, "epoch": 0.46888576695386663, "grad_norm": 10.3125, "learning_rate": 2.812576659495856e-05, "loss": 0.5273561000823974, "mean_token_accuracy": 0.8658452503383159, "num_tokens": 59018151.0, "step": 28870 }, { "entropy": 0.5993008362944238, "epoch": 0.46904817975849217, "grad_norm": 9.0625, "learning_rate": 2.8112901566912646e-05, "loss": 0.583241319656372, "mean_token_accuracy": 0.8501493118703365, "num_tokens": 59038409.0, "step": 28880 }, { "entropy": 0.6123212797334417, "epoch": 0.4692105925631177, "grad_norm": 9.5, "learning_rate": 2.810003570148922e-05, "loss": 0.6621934413909912, "mean_token_accuracy": 0.8378510192036629, "num_tokens": 59058351.0, "step": 28890 }, { "entropy": 0.5347143078222871, "epoch": 0.4693730053677432, "grad_norm": 7.65625, "learning_rate": 2.808716900214921e-05, "loss": 0.557252311706543, "mean_token_accuracy": 0.8570691607892513, "num_tokens": 59080849.0, "step": 28900 }, { "entropy": 0.5318448594072833, "epoch": 0.4695354181723687, "grad_norm": 7.53125, "learning_rate": 2.8074301472353807e-05, "loss": 0.5008243560791016, "mean_token_accuracy": 0.8729621157050133, "num_tokens": 59101671.0, "step": 28910 }, { "entropy": 0.5269583736546337, "epoch": 0.46969783097699425, "grad_norm": 8.875, "learning_rate": 2.8061433115564407e-05, "loss": 0.5474551677703857, "mean_token_accuracy": 0.8615919455885888, "num_tokens": 59122218.0, "step": 28920 }, { "entropy": 0.5491807425860316, "epoch": 0.4698602437816197, "grad_norm": 9.25, "learning_rate": 2.8048563935242613e-05, "loss": 0.5691217899322509, "mean_token_accuracy": 0.8603252366185188, "num_tokens": 59143448.0, "step": 28930 }, { "entropy": 0.4917367325630039, "epoch": 0.47002265658624526, "grad_norm": 8.75, "learning_rate": 2.8035693934850265e-05, "loss": 0.4639258861541748, "mean_token_accuracy": 0.8873022764921188, "num_tokens": 59164432.0, "step": 28940 }, { "entropy": 0.48173368512652814, "epoch": 0.4701850693908708, "grad_norm": 7.09375, "learning_rate": 2.8022823117849434e-05, "loss": 0.4740555763244629, "mean_token_accuracy": 0.8831047616899014, "num_tokens": 59184924.0, "step": 28950 }, { "entropy": 0.4607706246431917, "epoch": 0.47034748219549627, "grad_norm": 9.5625, "learning_rate": 2.800995148770239e-05, "loss": 0.4716629505157471, "mean_token_accuracy": 0.8890001893043518, "num_tokens": 59204387.0, "step": 28960 }, { "entropy": 0.41450703288428487, "epoch": 0.4705098950001218, "grad_norm": 5.3125, "learning_rate": 2.7997079047871628e-05, "loss": 0.38582582473754884, "mean_token_accuracy": 0.9042799971997738, "num_tokens": 59224540.0, "step": 28970 }, { "entropy": 0.498604900855571, "epoch": 0.47067230780474734, "grad_norm": 7.625, "learning_rate": 2.7984205801819863e-05, "loss": 0.4882101535797119, "mean_token_accuracy": 0.8776780173182488, "num_tokens": 59245730.0, "step": 28980 }, { "entropy": 0.4720327663002536, "epoch": 0.47083472060937287, "grad_norm": 9.875, "learning_rate": 2.7971331753010033e-05, "loss": 0.4667468547821045, "mean_token_accuracy": 0.8862298645079136, "num_tokens": 59265028.0, "step": 28990 }, { "entropy": 0.4733597475569695, "epoch": 0.47099713341399835, "grad_norm": 7.28125, "learning_rate": 2.7958456904905284e-05, "loss": 0.49491591453552247, "mean_token_accuracy": 0.8707137577235698, "num_tokens": 59285453.0, "step": 29000 }, { "entropy": 0.507611849764362, "epoch": 0.4711595462186239, "grad_norm": 7.8125, "learning_rate": 2.7945581260968988e-05, "loss": 0.4839050769805908, "mean_token_accuracy": 0.867521571740508, "num_tokens": 59305589.0, "step": 29010 }, { "entropy": 0.5105169345159084, "epoch": 0.4713219590232494, "grad_norm": 7.6875, "learning_rate": 2.7932704824664696e-05, "loss": 0.4917591094970703, "mean_token_accuracy": 0.8640990361571312, "num_tokens": 59325640.0, "step": 29020 }, { "entropy": 0.4640126708894968, "epoch": 0.4714843718278749, "grad_norm": 8.25, "learning_rate": 2.7919827599456232e-05, "loss": 0.5124655723571777, "mean_token_accuracy": 0.8804964117705822, "num_tokens": 59345425.0, "step": 29030 }, { "entropy": 0.5048807728104293, "epoch": 0.4716467846325004, "grad_norm": 5.90625, "learning_rate": 2.7906949588807573e-05, "loss": 0.49563260078430177, "mean_token_accuracy": 0.8725179046392441, "num_tokens": 59366680.0, "step": 29040 }, { "entropy": 0.4982226439286023, "epoch": 0.47180919743712596, "grad_norm": 9.6875, "learning_rate": 2.7894070796182946e-05, "loss": 0.5183835506439209, "mean_token_accuracy": 0.8684291578829288, "num_tokens": 59386179.0, "step": 29050 }, { "entropy": 0.49047725009731946, "epoch": 0.47197161024175144, "grad_norm": 11.75, "learning_rate": 2.7881191225046766e-05, "loss": 0.5048642158508301, "mean_token_accuracy": 0.8687760289758444, "num_tokens": 59406008.0, "step": 29060 }, { "entropy": 0.49520368240773677, "epoch": 0.47213402304637697, "grad_norm": 5.5, "learning_rate": 2.7868310878863672e-05, "loss": 0.46657638549804686, "mean_token_accuracy": 0.8850192427635193, "num_tokens": 59425854.0, "step": 29070 }, { "entropy": 0.5125074000097811, "epoch": 0.4722964358510025, "grad_norm": 10.5625, "learning_rate": 2.785542976109851e-05, "loss": 0.5276947498321534, "mean_token_accuracy": 0.8698401913046837, "num_tokens": 59445909.0, "step": 29080 }, { "entropy": 0.6231117453426123, "epoch": 0.472458848655628, "grad_norm": 9.8125, "learning_rate": 2.7842547875216314e-05, "loss": 0.700288724899292, "mean_token_accuracy": 0.8300345376133919, "num_tokens": 59468174.0, "step": 29090 }, { "entropy": 0.4805035094730556, "epoch": 0.4726212614602535, "grad_norm": 6.59375, "learning_rate": 2.7829665224682367e-05, "loss": 0.46932177543640136, "mean_token_accuracy": 0.8789479933679104, "num_tokens": 59488572.0, "step": 29100 }, { "entropy": 0.4812570647103712, "epoch": 0.47278367426487905, "grad_norm": 10.25, "learning_rate": 2.7816781812962106e-05, "loss": 0.4593153953552246, "mean_token_accuracy": 0.8801739007234574, "num_tokens": 59508626.0, "step": 29110 }, { "entropy": 0.5619163550203666, "epoch": 0.4729460870695046, "grad_norm": 7.4375, "learning_rate": 2.7803897643521208e-05, "loss": 0.6146229267120361, "mean_token_accuracy": 0.840416020154953, "num_tokens": 59529377.0, "step": 29120 }, { "entropy": 0.4514863653574139, "epoch": 0.47310849987413006, "grad_norm": 7.96875, "learning_rate": 2.7791012719825537e-05, "loss": 0.4712690830230713, "mean_token_accuracy": 0.8814768403768539, "num_tokens": 59549754.0, "step": 29130 }, { "entropy": 0.5462221841327846, "epoch": 0.4732709126787556, "grad_norm": 7.125, "learning_rate": 2.7778127045341184e-05, "loss": 0.5591458797454834, "mean_token_accuracy": 0.8581615753471852, "num_tokens": 59569285.0, "step": 29140 }, { "entropy": 0.5204723903210834, "epoch": 0.47343332548338113, "grad_norm": 10.9375, "learning_rate": 2.7765240623534406e-05, "loss": 0.5422287940979004, "mean_token_accuracy": 0.8627918712794781, "num_tokens": 59590648.0, "step": 29150 }, { "entropy": 0.5784099218435585, "epoch": 0.4735957382880066, "grad_norm": 8.875, "learning_rate": 2.775235345787169e-05, "loss": 0.5869207859039307, "mean_token_accuracy": 0.8526345402002334, "num_tokens": 59610828.0, "step": 29160 }, { "entropy": 0.48779931450262665, "epoch": 0.47375815109263214, "grad_norm": 5.75, "learning_rate": 2.77394655518197e-05, "loss": 0.4360316276550293, "mean_token_accuracy": 0.8829068727791309, "num_tokens": 59632275.0, "step": 29170 }, { "entropy": 0.5344619671814144, "epoch": 0.4739205638972577, "grad_norm": 8.625, "learning_rate": 2.7726576908845326e-05, "loss": 0.5644847393035889, "mean_token_accuracy": 0.8634223960340023, "num_tokens": 59652355.0, "step": 29180 }, { "entropy": 0.5304775146767498, "epoch": 0.47408297670188315, "grad_norm": 9.6875, "learning_rate": 2.7713687532415634e-05, "loss": 0.5688430309295655, "mean_token_accuracy": 0.8622008301317692, "num_tokens": 59673353.0, "step": 29190 }, { "entropy": 0.4949146155733615, "epoch": 0.4742453895065087, "grad_norm": 9.25, "learning_rate": 2.77007974259979e-05, "loss": 0.5196728229522705, "mean_token_accuracy": 0.8749715499579906, "num_tokens": 59693373.0, "step": 29200 }, { "entropy": 0.5511972334701568, "epoch": 0.4744078023111342, "grad_norm": 5.90625, "learning_rate": 2.768790659305958e-05, "loss": 0.5451839447021485, "mean_token_accuracy": 0.8599359475076198, "num_tokens": 59714269.0, "step": 29210 }, { "entropy": 0.5794609194621444, "epoch": 0.47457021511575975, "grad_norm": 6.9375, "learning_rate": 2.7675015037068353e-05, "loss": 0.6084275245666504, "mean_token_accuracy": 0.856339019536972, "num_tokens": 59735049.0, "step": 29220 }, { "entropy": 0.46456572310999034, "epoch": 0.47473262792038523, "grad_norm": 5.59375, "learning_rate": 2.7662122761492077e-05, "loss": 0.4709340572357178, "mean_token_accuracy": 0.8785843297839164, "num_tokens": 59755248.0, "step": 29230 }, { "entropy": 0.49348001040052625, "epoch": 0.47489504072501076, "grad_norm": 9.875, "learning_rate": 2.7649229769798778e-05, "loss": 0.4944154739379883, "mean_token_accuracy": 0.8823047116398811, "num_tokens": 59777055.0, "step": 29240 }, { "entropy": 0.5304674033541232, "epoch": 0.4750574535296363, "grad_norm": 9.9375, "learning_rate": 2.763633606545673e-05, "loss": 0.5062361240386963, "mean_token_accuracy": 0.8706802144646645, "num_tokens": 59797661.0, "step": 29250 }, { "entropy": 0.5543469178490341, "epoch": 0.4752198663342618, "grad_norm": 6.4375, "learning_rate": 2.762344165193435e-05, "loss": 0.5556524753570556, "mean_token_accuracy": 0.8573232799768448, "num_tokens": 59817646.0, "step": 29260 }, { "entropy": 0.5326763639226556, "epoch": 0.4753822791388873, "grad_norm": 7.8125, "learning_rate": 2.7610546532700273e-05, "loss": 0.4878638744354248, "mean_token_accuracy": 0.8750081643462181, "num_tokens": 59838036.0, "step": 29270 }, { "entropy": 0.5074692221358419, "epoch": 0.47554469194351284, "grad_norm": 7.375, "learning_rate": 2.7597650711223305e-05, "loss": 0.5110429286956787, "mean_token_accuracy": 0.8702082328498364, "num_tokens": 59858754.0, "step": 29280 }, { "entropy": 0.47091527259908617, "epoch": 0.4757071047481383, "grad_norm": 9.75, "learning_rate": 2.7584754190972463e-05, "loss": 0.508536958694458, "mean_token_accuracy": 0.8694832641631365, "num_tokens": 59880655.0, "step": 29290 }, { "entropy": 0.4723741309950128, "epoch": 0.47586951755276385, "grad_norm": 7.03125, "learning_rate": 2.7571856975416944e-05, "loss": 0.4935288906097412, "mean_token_accuracy": 0.8806958936154843, "num_tokens": 59900987.0, "step": 29300 }, { "entropy": 0.49176813787780704, "epoch": 0.4760319303573894, "grad_norm": 6.625, "learning_rate": 2.7558959068026106e-05, "loss": 0.4761043071746826, "mean_token_accuracy": 0.8785827994346619, "num_tokens": 59921704.0, "step": 29310 }, { "entropy": 0.4842653120867908, "epoch": 0.47619434316201487, "grad_norm": 9.875, "learning_rate": 2.754606047226953e-05, "loss": 0.47976126670837405, "mean_token_accuracy": 0.8742985285818576, "num_tokens": 59942440.0, "step": 29320 }, { "entropy": 0.45057608569040897, "epoch": 0.4763567559666404, "grad_norm": 8.3125, "learning_rate": 2.753316119161696e-05, "loss": 0.4638981342315674, "mean_token_accuracy": 0.8838927946984768, "num_tokens": 59963542.0, "step": 29330 }, { "entropy": 0.48528456832282246, "epoch": 0.47651916877126593, "grad_norm": 6.53125, "learning_rate": 2.7520261229538347e-05, "loss": 0.4632599353790283, "mean_token_accuracy": 0.8749178193509579, "num_tokens": 59984405.0, "step": 29340 }, { "entropy": 0.5292535034939647, "epoch": 0.47668158157589147, "grad_norm": 7.625, "learning_rate": 2.75073605895038e-05, "loss": 0.5723861217498779, "mean_token_accuracy": 0.8543614126741886, "num_tokens": 60006474.0, "step": 29350 }, { "entropy": 0.56714669726789, "epoch": 0.47684399438051694, "grad_norm": 6.8125, "learning_rate": 2.749445927498361e-05, "loss": 0.5599283218383789, "mean_token_accuracy": 0.8447634615004063, "num_tokens": 60027765.0, "step": 29360 }, { "entropy": 0.5392264002468437, "epoch": 0.4770064071851425, "grad_norm": 9.8125, "learning_rate": 2.748155728944828e-05, "loss": 0.5512895107269287, "mean_token_accuracy": 0.8631967589259147, "num_tokens": 60047664.0, "step": 29370 }, { "entropy": 0.46034361869096757, "epoch": 0.477168819989768, "grad_norm": 6.34375, "learning_rate": 2.746865463636845e-05, "loss": 0.4695130348205566, "mean_token_accuracy": 0.8772197350859642, "num_tokens": 60068312.0, "step": 29380 }, { "entropy": 0.5103020229493268, "epoch": 0.4773312327943935, "grad_norm": 11.6875, "learning_rate": 2.745575131921498e-05, "loss": 0.543897008895874, "mean_token_accuracy": 0.8584680661559105, "num_tokens": 60088003.0, "step": 29390 }, { "entropy": 0.5412410012446344, "epoch": 0.477493645599019, "grad_norm": 6.90625, "learning_rate": 2.744284734145889e-05, "loss": 0.5487354755401611, "mean_token_accuracy": 0.8645126767456531, "num_tokens": 60108639.0, "step": 29400 }, { "entropy": 0.5813955397112295, "epoch": 0.47765605840364456, "grad_norm": 7.40625, "learning_rate": 2.7429942706571376e-05, "loss": 0.628877830505371, "mean_token_accuracy": 0.8525042816996574, "num_tokens": 60129699.0, "step": 29410 }, { "entropy": 0.45172173441387714, "epoch": 0.47781847120827003, "grad_norm": 7.75, "learning_rate": 2.7417037418023807e-05, "loss": 0.4584473133087158, "mean_token_accuracy": 0.8905608534812928, "num_tokens": 60148885.0, "step": 29420 }, { "entropy": 0.5677950949408114, "epoch": 0.47798088401289557, "grad_norm": 7.6875, "learning_rate": 2.7404131479287737e-05, "loss": 0.5595879077911377, "mean_token_accuracy": 0.8744869694113732, "num_tokens": 60167978.0, "step": 29430 }, { "entropy": 0.48404775145463647, "epoch": 0.4781432968175211, "grad_norm": 9.125, "learning_rate": 2.7391224893834904e-05, "loss": 0.5031661510467529, "mean_token_accuracy": 0.8685784190893173, "num_tokens": 60187473.0, "step": 29440 }, { "entropy": 0.5043280594749376, "epoch": 0.47830570962214664, "grad_norm": 7.875, "learning_rate": 2.7378317665137197e-05, "loss": 0.5054443359375, "mean_token_accuracy": 0.8712377823889256, "num_tokens": 60208791.0, "step": 29450 }, { "entropy": 0.6021320603787899, "epoch": 0.4784681224267721, "grad_norm": 6.25, "learning_rate": 2.7365409796666703e-05, "loss": 0.6106886863708496, "mean_token_accuracy": 0.8551202431321144, "num_tokens": 60229743.0, "step": 29460 }, { "entropy": 0.5146654705982655, "epoch": 0.47863053523139765, "grad_norm": 5.9375, "learning_rate": 2.7352501291895637e-05, "loss": 0.5126700878143311, "mean_token_accuracy": 0.8685191497206688, "num_tokens": 60250674.0, "step": 29470 }, { "entropy": 0.632385182287544, "epoch": 0.4787929480360232, "grad_norm": 7.5, "learning_rate": 2.7339592154296457e-05, "loss": 0.6202254295349121, "mean_token_accuracy": 0.8507012009620667, "num_tokens": 60271039.0, "step": 29480 }, { "entropy": 0.5470962394028902, "epoch": 0.47895536084064866, "grad_norm": 4.53125, "learning_rate": 2.7326682387341717e-05, "loss": 0.5675343036651611, "mean_token_accuracy": 0.8566773720085621, "num_tokens": 60292537.0, "step": 29490 }, { "entropy": 0.5249214741867035, "epoch": 0.4791177736452742, "grad_norm": 6.9375, "learning_rate": 2.7313771994504195e-05, "loss": 0.5128068923950195, "mean_token_accuracy": 0.8744842410087585, "num_tokens": 60312647.0, "step": 29500 }, { "entropy": 0.5530703178141266, "epoch": 0.4792801864498997, "grad_norm": 7.90625, "learning_rate": 2.7300860979256798e-05, "loss": 0.5479613780975342, "mean_token_accuracy": 0.8654669560492039, "num_tokens": 60332689.0, "step": 29510 }, { "entropy": 0.4852082619909197, "epoch": 0.4794425992545252, "grad_norm": 11.3125, "learning_rate": 2.7287949345072635e-05, "loss": 0.47780413627624513, "mean_token_accuracy": 0.8818675145506859, "num_tokens": 60351996.0, "step": 29520 }, { "entropy": 0.5326118987752124, "epoch": 0.47960501205915074, "grad_norm": 7.5625, "learning_rate": 2.7275037095424953e-05, "loss": 0.5676815986633301, "mean_token_accuracy": 0.8570737045258283, "num_tokens": 60372274.0, "step": 29530 }, { "entropy": 0.4631880828179419, "epoch": 0.47976742486377627, "grad_norm": 7.25, "learning_rate": 2.7262124233787172e-05, "loss": 0.4440745830535889, "mean_token_accuracy": 0.8860004730522633, "num_tokens": 60392906.0, "step": 29540 }, { "entropy": 0.5011167306452989, "epoch": 0.4799298376684018, "grad_norm": 6.8125, "learning_rate": 2.7249210763632898e-05, "loss": 0.5023388862609863, "mean_token_accuracy": 0.8715539656579494, "num_tokens": 60413309.0, "step": 29550 }, { "entropy": 0.4597462934907526, "epoch": 0.4800922504730273, "grad_norm": 11.75, "learning_rate": 2.7236296688435868e-05, "loss": 0.4675177574157715, "mean_token_accuracy": 0.8796481259167195, "num_tokens": 60434245.0, "step": 29560 }, { "entropy": 0.5782324160449207, "epoch": 0.4802546632776528, "grad_norm": 6.65625, "learning_rate": 2.7223382011670012e-05, "loss": 0.591136884689331, "mean_token_accuracy": 0.8440025478601456, "num_tokens": 60454589.0, "step": 29570 }, { "entropy": 0.4709653503727168, "epoch": 0.48041707608227835, "grad_norm": 7.84375, "learning_rate": 2.7210466736809387e-05, "loss": 0.47792782783508303, "mean_token_accuracy": 0.8835742913186551, "num_tokens": 60475205.0, "step": 29580 }, { "entropy": 0.5613249571062624, "epoch": 0.4805794888869038, "grad_norm": 8.4375, "learning_rate": 2.719755086732825e-05, "loss": 0.5236572742462158, "mean_token_accuracy": 0.8690123841166496, "num_tokens": 60495646.0, "step": 29590 }, { "entropy": 0.5990663065109402, "epoch": 0.48074190169152936, "grad_norm": 6.65625, "learning_rate": 2.7184634406700986e-05, "loss": 0.6056470394134521, "mean_token_accuracy": 0.8554785706102848, "num_tokens": 60516240.0, "step": 29600 }, { "entropy": 0.4954465480521321, "epoch": 0.4809043144961549, "grad_norm": 7.59375, "learning_rate": 2.717171735840216e-05, "loss": 0.4734655857086182, "mean_token_accuracy": 0.8827458553016185, "num_tokens": 60535498.0, "step": 29610 }, { "entropy": 0.41187417223118244, "epoch": 0.4810667273007804, "grad_norm": 11.875, "learning_rate": 2.7158799725906482e-05, "loss": 0.4087969303131104, "mean_token_accuracy": 0.8972854971885681, "num_tokens": 60556508.0, "step": 29620 }, { "entropy": 0.5187026370549574, "epoch": 0.4812291401054059, "grad_norm": 5.53125, "learning_rate": 2.7145881512688824e-05, "loss": 0.5632044792175293, "mean_token_accuracy": 0.8694371372461319, "num_tokens": 60576456.0, "step": 29630 }, { "entropy": 0.49102704410906883, "epoch": 0.48139155291003144, "grad_norm": 7.09375, "learning_rate": 2.7132962722224227e-05, "loss": 0.498667573928833, "mean_token_accuracy": 0.8760030813515186, "num_tokens": 60597658.0, "step": 29640 }, { "entropy": 0.4475715471664444, "epoch": 0.4815539657146569, "grad_norm": 7.5, "learning_rate": 2.7120043357987856e-05, "loss": 0.4275506019592285, "mean_token_accuracy": 0.8866591908037662, "num_tokens": 60617752.0, "step": 29650 }, { "entropy": 0.5014886402990669, "epoch": 0.48171637851928245, "grad_norm": 8.0, "learning_rate": 2.7107123423455057e-05, "loss": 0.5038645267486572, "mean_token_accuracy": 0.86918326318264, "num_tokens": 60638325.0, "step": 29660 }, { "entropy": 0.519360332749784, "epoch": 0.481878791323908, "grad_norm": 10.875, "learning_rate": 2.7094202922101318e-05, "loss": 0.5435659408569335, "mean_token_accuracy": 0.8648259781301022, "num_tokens": 60658792.0, "step": 29670 }, { "entropy": 0.6445486386306584, "epoch": 0.4820412041285335, "grad_norm": 8.75, "learning_rate": 2.708128185740229e-05, "loss": 0.6282527446746826, "mean_token_accuracy": 0.8412114650011062, "num_tokens": 60682503.0, "step": 29680 }, { "entropy": 0.5103652227902785, "epoch": 0.482203616933159, "grad_norm": 10.6875, "learning_rate": 2.7068360232833772e-05, "loss": 0.5392825126647949, "mean_token_accuracy": 0.8645791403949261, "num_tokens": 60703347.0, "step": 29690 }, { "entropy": 0.4788790072314441, "epoch": 0.48236602973778453, "grad_norm": 6.3125, "learning_rate": 2.705543805187169e-05, "loss": 0.4928687572479248, "mean_token_accuracy": 0.8770027764141559, "num_tokens": 60723680.0, "step": 29700 }, { "entropy": 0.5170168743468821, "epoch": 0.48252844254241006, "grad_norm": 11.9375, "learning_rate": 2.704251531799217e-05, "loss": 0.4810340881347656, "mean_token_accuracy": 0.8725479528307915, "num_tokens": 60745029.0, "step": 29710 }, { "entropy": 0.5183397804386913, "epoch": 0.48269085534703554, "grad_norm": 8.25, "learning_rate": 2.7029592034671424e-05, "loss": 0.5425444126129151, "mean_token_accuracy": 0.8662149779498577, "num_tokens": 60766015.0, "step": 29720 }, { "entropy": 0.5395031598396599, "epoch": 0.4828532681516611, "grad_norm": 11.1875, "learning_rate": 2.7016668205385863e-05, "loss": 0.5130730628967285, "mean_token_accuracy": 0.8666693948209285, "num_tokens": 60786405.0, "step": 29730 }, { "entropy": 0.5517880907282233, "epoch": 0.4830156809562866, "grad_norm": 7.15625, "learning_rate": 2.7003743833612023e-05, "loss": 0.5733532428741455, "mean_token_accuracy": 0.8584562078118324, "num_tokens": 60806698.0, "step": 29740 }, { "entropy": 0.5730183784849942, "epoch": 0.4831780937609121, "grad_norm": 8.3125, "learning_rate": 2.6990818922826596e-05, "loss": 0.57197585105896, "mean_token_accuracy": 0.8476547561585903, "num_tokens": 60827537.0, "step": 29750 }, { "entropy": 0.5533103136345744, "epoch": 0.4833405065655376, "grad_norm": 7.5, "learning_rate": 2.6977893476506393e-05, "loss": 0.577481460571289, "mean_token_accuracy": 0.860558132827282, "num_tokens": 60848066.0, "step": 29760 }, { "entropy": 0.45370709961280226, "epoch": 0.48350291937016315, "grad_norm": 7.96875, "learning_rate": 2.6964967498128407e-05, "loss": 0.4289956569671631, "mean_token_accuracy": 0.892080084234476, "num_tokens": 60868493.0, "step": 29770 }, { "entropy": 0.4949894939083606, "epoch": 0.4836653321747887, "grad_norm": 6.78125, "learning_rate": 2.6952040991169747e-05, "loss": 0.4752922534942627, "mean_token_accuracy": 0.8784846656024456, "num_tokens": 60889076.0, "step": 29780 }, { "entropy": 0.48860285901464523, "epoch": 0.48382774497941416, "grad_norm": 8.375, "learning_rate": 2.693911395910767e-05, "loss": 0.5030402660369873, "mean_token_accuracy": 0.867689611017704, "num_tokens": 60909607.0, "step": 29790 }, { "entropy": 0.481493732961826, "epoch": 0.4839901577840397, "grad_norm": 4.71875, "learning_rate": 2.692618640541959e-05, "loss": 0.46890997886657715, "mean_token_accuracy": 0.8801246553659439, "num_tokens": 60930179.0, "step": 29800 }, { "entropy": 0.4926418269518763, "epoch": 0.48415257058866523, "grad_norm": 10.9375, "learning_rate": 2.6913258333583025e-05, "loss": 0.5208756446838378, "mean_token_accuracy": 0.8652375198900699, "num_tokens": 60949757.0, "step": 29810 }, { "entropy": 0.5450511113740504, "epoch": 0.4843149833932907, "grad_norm": 9.125, "learning_rate": 2.6900329747075677e-05, "loss": 0.5472739219665528, "mean_token_accuracy": 0.8598699398338795, "num_tokens": 60970071.0, "step": 29820 }, { "entropy": 0.5112455891678109, "epoch": 0.48447739619791624, "grad_norm": 8.0625, "learning_rate": 2.688740064937535e-05, "loss": 0.5195834159851074, "mean_token_accuracy": 0.8668784521520138, "num_tokens": 60990112.0, "step": 29830 }, { "entropy": 0.517966901184991, "epoch": 0.4846398090025418, "grad_norm": 10.125, "learning_rate": 2.687447104396001e-05, "loss": 0.49804072380065917, "mean_token_accuracy": 0.8773394979536533, "num_tokens": 61012147.0, "step": 29840 }, { "entropy": 0.5584859501570463, "epoch": 0.48480222180716726, "grad_norm": 5.9375, "learning_rate": 2.6861540934307746e-05, "loss": 0.5686408519744873, "mean_token_accuracy": 0.8544702749699354, "num_tokens": 61032762.0, "step": 29850 }, { "entropy": 0.4955867235548794, "epoch": 0.4849646346117928, "grad_norm": 8.625, "learning_rate": 2.684861032389679e-05, "loss": 0.49292740821838377, "mean_token_accuracy": 0.8721981771290302, "num_tokens": 61053004.0, "step": 29860 }, { "entropy": 0.649409282905981, "epoch": 0.4851270474164183, "grad_norm": 8.5, "learning_rate": 2.68356792162055e-05, "loss": 0.6697579860687256, "mean_token_accuracy": 0.8376047853380442, "num_tokens": 61074051.0, "step": 29870 }, { "entropy": 0.487559350207448, "epoch": 0.4852894602210438, "grad_norm": 6.1875, "learning_rate": 2.6822747614712374e-05, "loss": 0.4505396842956543, "mean_token_accuracy": 0.8798145987093449, "num_tokens": 61094196.0, "step": 29880 }, { "entropy": 0.4557596504222602, "epoch": 0.48545187302566933, "grad_norm": 9.5, "learning_rate": 2.6809815522896047e-05, "loss": 0.44684624671936035, "mean_token_accuracy": 0.8865221582353116, "num_tokens": 61114216.0, "step": 29890 }, { "entropy": 0.49129079645499585, "epoch": 0.48561428583029487, "grad_norm": 6.0, "learning_rate": 2.6796882944235275e-05, "loss": 0.4906649112701416, "mean_token_accuracy": 0.8728243939578533, "num_tokens": 61134573.0, "step": 29900 }, { "entropy": 0.5212351752445101, "epoch": 0.4857766986349204, "grad_norm": 7.15625, "learning_rate": 2.678394988220896e-05, "loss": 0.5722396373748779, "mean_token_accuracy": 0.8581037942320109, "num_tokens": 61154788.0, "step": 29910 }, { "entropy": 0.498322302242741, "epoch": 0.4859391114395459, "grad_norm": 7.0625, "learning_rate": 2.6771016340296102e-05, "loss": 0.4833559036254883, "mean_token_accuracy": 0.8750042654573917, "num_tokens": 61176820.0, "step": 29920 }, { "entropy": 0.5365836209617555, "epoch": 0.4861015242441714, "grad_norm": 7.9375, "learning_rate": 2.675808232197588e-05, "loss": 0.5318466663360596, "mean_token_accuracy": 0.8658442594110966, "num_tokens": 61197244.0, "step": 29930 }, { "entropy": 0.5024980888934806, "epoch": 0.48626393704879695, "grad_norm": 6.8125, "learning_rate": 2.6745147830727557e-05, "loss": 0.50679612159729, "mean_token_accuracy": 0.8752139590680599, "num_tokens": 61217182.0, "step": 29940 }, { "entropy": 0.4963731272146106, "epoch": 0.4864263498534224, "grad_norm": 6.0, "learning_rate": 2.673221287003055e-05, "loss": 0.5420843124389648, "mean_token_accuracy": 0.8680335745215416, "num_tokens": 61237226.0, "step": 29950 }, { "entropy": 0.4804054842446931, "epoch": 0.48658876265804796, "grad_norm": 7.5625, "learning_rate": 2.671927744336438e-05, "loss": 0.5258739471435547, "mean_token_accuracy": 0.8703325003385544, "num_tokens": 61257079.0, "step": 29960 }, { "entropy": 0.47754820762202144, "epoch": 0.4867511754626735, "grad_norm": 8.5, "learning_rate": 2.670634155420872e-05, "loss": 0.4926462650299072, "mean_token_accuracy": 0.869492755830288, "num_tokens": 61277613.0, "step": 29970 }, { "entropy": 0.5729579982114956, "epoch": 0.48691358826729897, "grad_norm": 6.6875, "learning_rate": 2.6693405206043354e-05, "loss": 0.5480486869812011, "mean_token_accuracy": 0.86570425927639, "num_tokens": 61298213.0, "step": 29980 }, { "entropy": 0.49753935243934394, "epoch": 0.4870760010719245, "grad_norm": 8.9375, "learning_rate": 2.668046840234817e-05, "loss": 0.463856840133667, "mean_token_accuracy": 0.8777034610509873, "num_tokens": 61318897.0, "step": 29990 }, { "entropy": 0.4641304031945765, "epoch": 0.48723841387655004, "grad_norm": 10.5, "learning_rate": 2.6667531146603216e-05, "loss": 0.43685169219970704, "mean_token_accuracy": 0.8847464174032211, "num_tokens": 61338608.0, "step": 30000 }, { "entropy": 0.43955771944019945, "epoch": 0.48740082668117557, "grad_norm": 5.78125, "learning_rate": 2.665459344228863e-05, "loss": 0.4642635345458984, "mean_token_accuracy": 0.8810644365847111, "num_tokens": 61358800.0, "step": 30010 }, { "entropy": 0.4733219462446868, "epoch": 0.48756323948580105, "grad_norm": 8.125, "learning_rate": 2.6641655292884694e-05, "loss": 0.47419443130493166, "mean_token_accuracy": 0.8825159944593907, "num_tokens": 61379146.0, "step": 30020 }, { "entropy": 0.5096843206323683, "epoch": 0.4877256522904266, "grad_norm": 8.0625, "learning_rate": 2.6628716701871793e-05, "loss": 0.527325439453125, "mean_token_accuracy": 0.8592043444514275, "num_tokens": 61398997.0, "step": 30030 }, { "entropy": 0.535060270037502, "epoch": 0.4878880650950521, "grad_norm": 7.5625, "learning_rate": 2.6615777672730437e-05, "loss": 0.5630969047546387, "mean_token_accuracy": 0.8506309509277343, "num_tokens": 61419827.0, "step": 30040 }, { "entropy": 0.4415871178731322, "epoch": 0.4880504778996776, "grad_norm": 7.46875, "learning_rate": 2.6602838208941266e-05, "loss": 0.4716456890106201, "mean_token_accuracy": 0.8887098826467991, "num_tokens": 61440173.0, "step": 30050 }, { "entropy": 0.45274502753745766, "epoch": 0.4882128907043031, "grad_norm": 6.65625, "learning_rate": 2.6589898313985006e-05, "loss": 0.4595757007598877, "mean_token_accuracy": 0.8788973763585091, "num_tokens": 61460553.0, "step": 30060 }, { "entropy": 0.4252335591241717, "epoch": 0.48837530350892866, "grad_norm": 9.125, "learning_rate": 2.657695799134253e-05, "loss": 0.42985143661499026, "mean_token_accuracy": 0.8924656808376312, "num_tokens": 61481079.0, "step": 30070 }, { "entropy": 0.44788708586711434, "epoch": 0.48853771631355414, "grad_norm": 7.4375, "learning_rate": 2.6564017244494805e-05, "loss": 0.42978811264038086, "mean_token_accuracy": 0.8829262234270573, "num_tokens": 61500762.0, "step": 30080 }, { "entropy": 0.5700707169249654, "epoch": 0.48870012911817967, "grad_norm": 7.25, "learning_rate": 2.6551076076922933e-05, "loss": 0.5816641807556152, "mean_token_accuracy": 0.857812387496233, "num_tokens": 61520628.0, "step": 30090 }, { "entropy": 0.5153474589809776, "epoch": 0.4888625419228052, "grad_norm": 6.875, "learning_rate": 2.6538134492108103e-05, "loss": 0.5383924007415771, "mean_token_accuracy": 0.8654929660260677, "num_tokens": 61541351.0, "step": 30100 }, { "entropy": 0.5095272520091385, "epoch": 0.4890249547274307, "grad_norm": 7.28125, "learning_rate": 2.652519249353164e-05, "loss": 0.5477429389953613, "mean_token_accuracy": 0.8602794758975506, "num_tokens": 61561791.0, "step": 30110 }, { "entropy": 0.4994806745555252, "epoch": 0.4891873675320562, "grad_norm": 8.75, "learning_rate": 2.6512250084674973e-05, "loss": 0.4817654132843018, "mean_token_accuracy": 0.8751686945557594, "num_tokens": 61582246.0, "step": 30120 }, { "entropy": 0.5301328948931768, "epoch": 0.48934978033668175, "grad_norm": 7.03125, "learning_rate": 2.649930726901963e-05, "loss": 0.5003461837768555, "mean_token_accuracy": 0.8695394821465016, "num_tokens": 61604283.0, "step": 30130 }, { "entropy": 0.5047398585826158, "epoch": 0.4895121931413073, "grad_norm": 5.21875, "learning_rate": 2.648636405004727e-05, "loss": 0.4982298851013184, "mean_token_accuracy": 0.8746279820799827, "num_tokens": 61623753.0, "step": 30140 }, { "entropy": 0.4831450752448291, "epoch": 0.48967460594593276, "grad_norm": 9.4375, "learning_rate": 2.6473420431239626e-05, "loss": 0.5067430019378663, "mean_token_accuracy": 0.8715280137956143, "num_tokens": 61644275.0, "step": 30150 }, { "entropy": 0.5027948100585491, "epoch": 0.4898370187505583, "grad_norm": 9.5625, "learning_rate": 2.646047641607859e-05, "loss": 0.5231240749359131, "mean_token_accuracy": 0.8735895469784737, "num_tokens": 61663702.0, "step": 30160 }, { "entropy": 0.5178452826105058, "epoch": 0.48999943155518383, "grad_norm": 10.0625, "learning_rate": 2.6447532008046106e-05, "loss": 0.5340951919555664, "mean_token_accuracy": 0.8653065502643585, "num_tokens": 61684386.0, "step": 30170 }, { "entropy": 0.521889213193208, "epoch": 0.4901618443598093, "grad_norm": 10.1875, "learning_rate": 2.6434587210624263e-05, "loss": 0.5686691284179688, "mean_token_accuracy": 0.8573576383292675, "num_tokens": 61704673.0, "step": 30180 }, { "entropy": 0.5135290110483766, "epoch": 0.49032425716443484, "grad_norm": 9.875, "learning_rate": 2.6421642027295236e-05, "loss": 0.5327964305877686, "mean_token_accuracy": 0.8700820945203305, "num_tokens": 61725753.0, "step": 30190 }, { "entropy": 0.4099705256987363, "epoch": 0.4904866699690604, "grad_norm": 6.125, "learning_rate": 2.6408696461541303e-05, "loss": 0.4193225383758545, "mean_token_accuracy": 0.897350399941206, "num_tokens": 61747581.0, "step": 30200 }, { "entropy": 0.4896069903392345, "epoch": 0.49064908277368585, "grad_norm": 7.6875, "learning_rate": 2.6395750516844863e-05, "loss": 0.47652711868286135, "mean_token_accuracy": 0.8685698784887791, "num_tokens": 61768406.0, "step": 30210 }, { "entropy": 0.4952986028511077, "epoch": 0.4908114955783114, "grad_norm": 6.34375, "learning_rate": 2.6382804196688394e-05, "loss": 0.4614094257354736, "mean_token_accuracy": 0.8882255688309669, "num_tokens": 61789082.0, "step": 30220 }, { "entropy": 0.4760035391896963, "epoch": 0.4909739083829369, "grad_norm": 6.90625, "learning_rate": 2.636985750455449e-05, "loss": 0.4864801406860352, "mean_token_accuracy": 0.8773373775184155, "num_tokens": 61809169.0, "step": 30230 }, { "entropy": 0.5891461042687297, "epoch": 0.49113632118756245, "grad_norm": 6.75, "learning_rate": 2.6356910443925837e-05, "loss": 0.5992877006530761, "mean_token_accuracy": 0.8500635012984276, "num_tokens": 61830123.0, "step": 30240 }, { "entropy": 0.501731023634784, "epoch": 0.49129873399218793, "grad_norm": 10.25, "learning_rate": 2.6343963018285235e-05, "loss": 0.5126551628112793, "mean_token_accuracy": 0.8749392934143543, "num_tokens": 61852243.0, "step": 30250 }, { "entropy": 0.49700449258089063, "epoch": 0.49146114679681346, "grad_norm": 9.5625, "learning_rate": 2.6331015231115542e-05, "loss": 0.513553524017334, "mean_token_accuracy": 0.8654677368700504, "num_tokens": 61872540.0, "step": 30260 }, { "entropy": 0.4762661008164287, "epoch": 0.491623559601439, "grad_norm": 9.4375, "learning_rate": 2.6318067085899777e-05, "loss": 0.4792464256286621, "mean_token_accuracy": 0.8799596525728702, "num_tokens": 61893221.0, "step": 30270 }, { "entropy": 0.5100882638711483, "epoch": 0.4917859724060645, "grad_norm": 8.5625, "learning_rate": 2.6305118586120998e-05, "loss": 0.5225683212280273, "mean_token_accuracy": 0.8678221181035042, "num_tokens": 61913529.0, "step": 30280 }, { "entropy": 0.4800251376349479, "epoch": 0.49194838521069, "grad_norm": 7.21875, "learning_rate": 2.629216973526238e-05, "loss": 0.4860246181488037, "mean_token_accuracy": 0.8772603366523981, "num_tokens": 61933456.0, "step": 30290 }, { "entropy": 0.5236603042110801, "epoch": 0.49211079801531554, "grad_norm": 7.875, "learning_rate": 2.6279220536807204e-05, "loss": 0.5455100059509277, "mean_token_accuracy": 0.8637721229344606, "num_tokens": 61954176.0, "step": 30300 }, { "entropy": 0.5543377702590078, "epoch": 0.492273210819941, "grad_norm": 7.40625, "learning_rate": 2.6266270994238828e-05, "loss": 0.5468708992004394, "mean_token_accuracy": 0.8660032354295254, "num_tokens": 61974333.0, "step": 30310 }, { "entropy": 0.4878885676851496, "epoch": 0.49243562362456655, "grad_norm": 7.5, "learning_rate": 2.625332111104072e-05, "loss": 0.5142910003662109, "mean_token_accuracy": 0.8704902812838554, "num_tokens": 61996078.0, "step": 30320 }, { "entropy": 0.5132138452958316, "epoch": 0.4925980364291921, "grad_norm": 6.46875, "learning_rate": 2.6240370890696403e-05, "loss": 0.5062345027923584, "mean_token_accuracy": 0.8702041000127793, "num_tokens": 62014909.0, "step": 30330 }, { "entropy": 0.5446961538866162, "epoch": 0.4927604492338176, "grad_norm": 10.375, "learning_rate": 2.622742033668953e-05, "loss": 0.5493142604827881, "mean_token_accuracy": 0.8677078902721405, "num_tokens": 62035563.0, "step": 30340 }, { "entropy": 0.5544630941469222, "epoch": 0.4929228620384431, "grad_norm": 10.9375, "learning_rate": 2.621446945250383e-05, "loss": 0.570211124420166, "mean_token_accuracy": 0.8567478392273188, "num_tokens": 62056184.0, "step": 30350 }, { "entropy": 0.4904654514975846, "epoch": 0.49308527484306863, "grad_norm": 9.25, "learning_rate": 2.620151824162312e-05, "loss": 0.4716200351715088, "mean_token_accuracy": 0.8723306380212307, "num_tokens": 62076062.0, "step": 30360 }, { "entropy": 0.49410928809084, "epoch": 0.49324768764769417, "grad_norm": 9.25, "learning_rate": 2.61885667075313e-05, "loss": 0.49779596328735354, "mean_token_accuracy": 0.8639520108699799, "num_tokens": 62095762.0, "step": 30370 }, { "entropy": 0.5638323184568435, "epoch": 0.49341010045231964, "grad_norm": 8.9375, "learning_rate": 2.617561485371236e-05, "loss": 0.5657856464385986, "mean_token_accuracy": 0.8515051126480102, "num_tokens": 62117100.0, "step": 30380 }, { "entropy": 0.5236329250968993, "epoch": 0.4935725132569452, "grad_norm": 5.25, "learning_rate": 2.6162662683650397e-05, "loss": 0.4660347461700439, "mean_token_accuracy": 0.8810234762728214, "num_tokens": 62137127.0, "step": 30390 }, { "entropy": 0.47539623114280405, "epoch": 0.4937349260615707, "grad_norm": 7.375, "learning_rate": 2.6149710200829545e-05, "loss": 0.47725510597229004, "mean_token_accuracy": 0.8792604945600033, "num_tokens": 62156995.0, "step": 30400 }, { "entropy": 0.5026486547663808, "epoch": 0.4938973388661962, "grad_norm": 9.75, "learning_rate": 2.613675740873407e-05, "loss": 0.504782772064209, "mean_token_accuracy": 0.8726330913603306, "num_tokens": 62176071.0, "step": 30410 }, { "entropy": 0.46541387708857657, "epoch": 0.4940597516708217, "grad_norm": 8.5625, "learning_rate": 2.6123804310848298e-05, "loss": 0.47075252532958983, "mean_token_accuracy": 0.8812093429267407, "num_tokens": 62194942.0, "step": 30420 }, { "entropy": 0.4851918583270162, "epoch": 0.49422216447544726, "grad_norm": 10.6875, "learning_rate": 2.611085091065665e-05, "loss": 0.5061672687530517, "mean_token_accuracy": 0.8788064964115619, "num_tokens": 62215478.0, "step": 30430 }, { "entropy": 0.5110025990288705, "epoch": 0.49438457728007273, "grad_norm": 13.3125, "learning_rate": 2.6097897211643597e-05, "loss": 0.5120035171508789, "mean_token_accuracy": 0.8699561581015587, "num_tokens": 62235550.0, "step": 30440 }, { "entropy": 0.5003997090272605, "epoch": 0.49454699008469827, "grad_norm": 8.625, "learning_rate": 2.608494321729373e-05, "loss": 0.49400973320007324, "mean_token_accuracy": 0.8729841209948063, "num_tokens": 62255440.0, "step": 30450 }, { "entropy": 0.4641249504871666, "epoch": 0.4947094028893238, "grad_norm": 5.34375, "learning_rate": 2.6071988931091695e-05, "loss": 0.4550004959106445, "mean_token_accuracy": 0.8866696208715439, "num_tokens": 62275552.0, "step": 30460 }, { "entropy": 0.5039339892799035, "epoch": 0.49487181569394934, "grad_norm": 7.625, "learning_rate": 2.6059034356522234e-05, "loss": 0.5211454868316651, "mean_token_accuracy": 0.8695507273077965, "num_tokens": 62296710.0, "step": 30470 }, { "entropy": 0.46454361209180206, "epoch": 0.4950342284985748, "grad_norm": 5.6875, "learning_rate": 2.604607949707016e-05, "loss": 0.46201448440551757, "mean_token_accuracy": 0.882608300447464, "num_tokens": 62317282.0, "step": 30480 }, { "entropy": 0.4845169786014594, "epoch": 0.49519664130320035, "grad_norm": 7.40625, "learning_rate": 2.6033124356220328e-05, "loss": 0.4958409309387207, "mean_token_accuracy": 0.873705892264843, "num_tokens": 62337931.0, "step": 30490 }, { "entropy": 0.4919731826521456, "epoch": 0.4953590541078259, "grad_norm": 10.125, "learning_rate": 2.6020168937457744e-05, "loss": 0.5272331714630127, "mean_token_accuracy": 0.8704997308552265, "num_tokens": 62357696.0, "step": 30500 }, { "entropy": 0.4228378449101001, "epoch": 0.49552146691245136, "grad_norm": 8.75, "learning_rate": 2.6007213244267415e-05, "loss": 0.4252029895782471, "mean_token_accuracy": 0.8881394982337951, "num_tokens": 62377249.0, "step": 30510 }, { "entropy": 0.4533903363160789, "epoch": 0.4956838797170769, "grad_norm": 9.25, "learning_rate": 2.5994257280134455e-05, "loss": 0.45027670860290525, "mean_token_accuracy": 0.8905290596187114, "num_tokens": 62398389.0, "step": 30520 }, { "entropy": 0.4873589690774679, "epoch": 0.4958462925217024, "grad_norm": 6.75, "learning_rate": 2.5981301048544055e-05, "loss": 0.5163526058197021, "mean_token_accuracy": 0.871699383109808, "num_tokens": 62417621.0, "step": 30530 }, { "entropy": 0.46431480599567293, "epoch": 0.4960087053263279, "grad_norm": 10.3125, "learning_rate": 2.5968344552981465e-05, "loss": 0.4917804718017578, "mean_token_accuracy": 0.8729633808135986, "num_tokens": 62437578.0, "step": 30540 }, { "entropy": 0.5074082003440707, "epoch": 0.49617111813095344, "grad_norm": 6.5625, "learning_rate": 2.5955387796932022e-05, "loss": 0.47925896644592286, "mean_token_accuracy": 0.8755578853189945, "num_tokens": 62458133.0, "step": 30550 }, { "entropy": 0.4348384527023882, "epoch": 0.49633353093557897, "grad_norm": 8.875, "learning_rate": 2.5942430783881104e-05, "loss": 0.445039701461792, "mean_token_accuracy": 0.8834964036941528, "num_tokens": 62478307.0, "step": 30560 }, { "entropy": 0.47746557565405967, "epoch": 0.4964959437402045, "grad_norm": 7.875, "learning_rate": 2.59294735173142e-05, "loss": 0.44989709854125975, "mean_token_accuracy": 0.8790071040391922, "num_tokens": 62499555.0, "step": 30570 }, { "entropy": 0.5187020897865295, "epoch": 0.49665835654483, "grad_norm": 6.09375, "learning_rate": 2.5916516000716822e-05, "loss": 0.5426670551300049, "mean_token_accuracy": 0.8655966587364674, "num_tokens": 62520494.0, "step": 30580 }, { "entropy": 0.4227032272145152, "epoch": 0.4968207693494555, "grad_norm": 8.0625, "learning_rate": 2.5903558237574594e-05, "loss": 0.41092934608459475, "mean_token_accuracy": 0.8920796245336533, "num_tokens": 62540511.0, "step": 30590 }, { "entropy": 0.5064334815368057, "epoch": 0.49698318215408105, "grad_norm": 10.125, "learning_rate": 2.5890600231373147e-05, "loss": 0.5478888988494873, "mean_token_accuracy": 0.8684739585965872, "num_tokens": 62559843.0, "step": 30600 }, { "entropy": 0.4649269653949887, "epoch": 0.4971455949587065, "grad_norm": 11.0, "learning_rate": 2.5877641985598254e-05, "loss": 0.46546039581298826, "mean_token_accuracy": 0.8835222393274307, "num_tokens": 62578645.0, "step": 30610 }, { "entropy": 0.4410695023369044, "epoch": 0.49730800776333206, "grad_norm": 7.03125, "learning_rate": 2.5864683503735688e-05, "loss": 0.4625762939453125, "mean_token_accuracy": 0.8809315547347069, "num_tokens": 62598959.0, "step": 30620 }, { "entropy": 0.5100359302014112, "epoch": 0.4974704205679576, "grad_norm": 11.5625, "learning_rate": 2.5851724789271315e-05, "loss": 0.5133030414581299, "mean_token_accuracy": 0.8688674956560135, "num_tokens": 62619936.0, "step": 30630 }, { "entropy": 0.4976271322928369, "epoch": 0.49763283337258307, "grad_norm": 6.96875, "learning_rate": 2.583876584569106e-05, "loss": 0.4955767631530762, "mean_token_accuracy": 0.8729942969977855, "num_tokens": 62640492.0, "step": 30640 }, { "entropy": 0.43746135646943, "epoch": 0.4977952461772086, "grad_norm": 7.65625, "learning_rate": 2.5825806676480907e-05, "loss": 0.4749462127685547, "mean_token_accuracy": 0.8774041071534157, "num_tokens": 62659339.0, "step": 30650 }, { "entropy": 0.4396726899314672, "epoch": 0.49795765898183414, "grad_norm": 5.84375, "learning_rate": 2.5812847285126906e-05, "loss": 0.4430410861968994, "mean_token_accuracy": 0.8917746014893055, "num_tokens": 62678698.0, "step": 30660 }, { "entropy": 0.480262959189713, "epoch": 0.4981200717864596, "grad_norm": 9.9375, "learning_rate": 2.5799887675115147e-05, "loss": 0.4709348201751709, "mean_token_accuracy": 0.8819316975772381, "num_tokens": 62699193.0, "step": 30670 }, { "entropy": 0.5463363481219858, "epoch": 0.49828248459108515, "grad_norm": 8.4375, "learning_rate": 2.5786927849931825e-05, "loss": 0.5104465961456299, "mean_token_accuracy": 0.8709375485777855, "num_tokens": 62719791.0, "step": 30680 }, { "entropy": 0.5104331964626908, "epoch": 0.4984448973957107, "grad_norm": 6.125, "learning_rate": 2.5773967813063125e-05, "loss": 0.5357676029205323, "mean_token_accuracy": 0.8564973168075085, "num_tokens": 62739928.0, "step": 30690 }, { "entropy": 0.48209630395285785, "epoch": 0.4986073102003362, "grad_norm": 8.625, "learning_rate": 2.5761007567995353e-05, "loss": 0.45403451919555665, "mean_token_accuracy": 0.8767270036041737, "num_tokens": 62760333.0, "step": 30700 }, { "entropy": 0.5153867456130683, "epoch": 0.4987697230049617, "grad_norm": 13.1875, "learning_rate": 2.5748047118214835e-05, "loss": 0.5748306274414062, "mean_token_accuracy": 0.855607844889164, "num_tokens": 62780264.0, "step": 30710 }, { "entropy": 0.5527590315788984, "epoch": 0.49893213580958723, "grad_norm": 13.25, "learning_rate": 2.573508646720796e-05, "loss": 0.5738747119903564, "mean_token_accuracy": 0.8579062327742577, "num_tokens": 62800186.0, "step": 30720 }, { "entropy": 0.4992442848160863, "epoch": 0.49909454861421276, "grad_norm": 10.0625, "learning_rate": 2.5722125618461175e-05, "loss": 0.4925652027130127, "mean_token_accuracy": 0.8746158614754677, "num_tokens": 62822757.0, "step": 30730 }, { "entropy": 0.5208871163893491, "epoch": 0.49925696141883824, "grad_norm": 8.5625, "learning_rate": 2.570916457546097e-05, "loss": 0.5250263214111328, "mean_token_accuracy": 0.8665183283388614, "num_tokens": 62843430.0, "step": 30740 }, { "entropy": 0.4987202765420079, "epoch": 0.4994193742234638, "grad_norm": 10.6875, "learning_rate": 2.5696203341693902e-05, "loss": 0.5430459022521973, "mean_token_accuracy": 0.8693216603249312, "num_tokens": 62863427.0, "step": 30750 }, { "entropy": 0.5829684255179017, "epoch": 0.4995817870280893, "grad_norm": 7.15625, "learning_rate": 2.5683241920646572e-05, "loss": 0.601649808883667, "mean_token_accuracy": 0.8550139106810093, "num_tokens": 62883846.0, "step": 30760 }, { "entropy": 0.5745293566025793, "epoch": 0.4997441998327148, "grad_norm": 7.96875, "learning_rate": 2.567028031580564e-05, "loss": 0.6170824527740478, "mean_token_accuracy": 0.8481758117675782, "num_tokens": 62904156.0, "step": 30770 }, { "entropy": 0.5470445358194411, "epoch": 0.4999066126373403, "grad_norm": 8.75, "learning_rate": 2.565731853065778e-05, "loss": 0.5533169269561767, "mean_token_accuracy": 0.8700152479112149, "num_tokens": 62925795.0, "step": 30780 }, { "entropy": 0.5426269664429129, "epoch": 0.5000690254419659, "grad_norm": 4.21875, "learning_rate": 2.5644356568689763e-05, "loss": 0.5475377559661865, "mean_token_accuracy": 0.8683408368378878, "num_tokens": 62946833.0, "step": 30790 }, { "entropy": 0.532044337131083, "epoch": 0.5002314382465913, "grad_norm": 8.8125, "learning_rate": 2.5631394433388385e-05, "loss": 0.490903377532959, "mean_token_accuracy": 0.8670671299099922, "num_tokens": 62967548.0, "step": 30800 }, { "entropy": 0.4674599841004238, "epoch": 0.5003938510512169, "grad_norm": 11.6875, "learning_rate": 2.5618432128240483e-05, "loss": 0.4400550365447998, "mean_token_accuracy": 0.8835840925574303, "num_tokens": 62987169.0, "step": 30810 }, { "entropy": 0.45229013967327775, "epoch": 0.5005562638558424, "grad_norm": 6.0, "learning_rate": 2.5605469656732954e-05, "loss": 0.4245868682861328, "mean_token_accuracy": 0.8871519461274147, "num_tokens": 63007221.0, "step": 30820 }, { "entropy": 0.49253651523031294, "epoch": 0.5007186766604679, "grad_norm": 16.75, "learning_rate": 2.5592507022352713e-05, "loss": 0.48865370750427245, "mean_token_accuracy": 0.8773426309227943, "num_tokens": 63028681.0, "step": 30830 }, { "entropy": 0.4299283406231552, "epoch": 0.5008810894650935, "grad_norm": 6.4375, "learning_rate": 2.5579544228586767e-05, "loss": 0.43002886772155763, "mean_token_accuracy": 0.8833753518760205, "num_tokens": 63049481.0, "step": 30840 }, { "entropy": 0.5228127751033753, "epoch": 0.5010435022697189, "grad_norm": 8.8125, "learning_rate": 2.5566581278922113e-05, "loss": 0.5524937152862549, "mean_token_accuracy": 0.8659674070775509, "num_tokens": 63071360.0, "step": 30850 }, { "entropy": 0.5086765705840662, "epoch": 0.5012059150743444, "grad_norm": 7.59375, "learning_rate": 2.5553618176845824e-05, "loss": 0.5200385093688965, "mean_token_accuracy": 0.8698768258094788, "num_tokens": 63092473.0, "step": 30860 }, { "entropy": 0.4547089242376387, "epoch": 0.50136832787897, "grad_norm": 6.34375, "learning_rate": 2.5540654925844997e-05, "loss": 0.4663630485534668, "mean_token_accuracy": 0.8817520800977945, "num_tokens": 63111948.0, "step": 30870 }, { "entropy": 0.4980192950926721, "epoch": 0.5015307406835955, "grad_norm": 8.625, "learning_rate": 2.5527691529406785e-05, "loss": 0.5350961208343505, "mean_token_accuracy": 0.863745704293251, "num_tokens": 63132471.0, "step": 30880 }, { "entropy": 0.45823753252625465, "epoch": 0.501693153488221, "grad_norm": 6.71875, "learning_rate": 2.5514727991018366e-05, "loss": 0.45459766387939454, "mean_token_accuracy": 0.8867032773792743, "num_tokens": 63152876.0, "step": 30890 }, { "entropy": 0.5019978042691946, "epoch": 0.5018555662928466, "grad_norm": 6.53125, "learning_rate": 2.5501764314166948e-05, "loss": 0.49185924530029296, "mean_token_accuracy": 0.876114359870553, "num_tokens": 63173810.0, "step": 30900 }, { "entropy": 0.46008493879344314, "epoch": 0.502017979097472, "grad_norm": 7.8125, "learning_rate": 2.548880050233982e-05, "loss": 0.4573627471923828, "mean_token_accuracy": 0.8838027566671371, "num_tokens": 63193253.0, "step": 30910 }, { "entropy": 0.4920669169630855, "epoch": 0.5021803919020975, "grad_norm": 8.5, "learning_rate": 2.5475836559024245e-05, "loss": 0.5201551914215088, "mean_token_accuracy": 0.8709423765540123, "num_tokens": 63213476.0, "step": 30920 }, { "entropy": 0.5327320579439402, "epoch": 0.5023428047067231, "grad_norm": 6.5, "learning_rate": 2.5462872487707578e-05, "loss": 0.5551751136779786, "mean_token_accuracy": 0.8605267081409693, "num_tokens": 63234608.0, "step": 30930 }, { "entropy": 0.4709260633215308, "epoch": 0.5025052175113486, "grad_norm": 10.5, "learning_rate": 2.5449908291877163e-05, "loss": 0.4904721736907959, "mean_token_accuracy": 0.874935220927, "num_tokens": 63254706.0, "step": 30940 }, { "entropy": 0.49455576394684614, "epoch": 0.5026676303159741, "grad_norm": 7.1875, "learning_rate": 2.543694397502041e-05, "loss": 0.5085570812225342, "mean_token_accuracy": 0.8718381352722645, "num_tokens": 63275045.0, "step": 30950 }, { "entropy": 0.5725363776087761, "epoch": 0.5028300431205996, "grad_norm": 7.125, "learning_rate": 2.5423979540624743e-05, "loss": 0.5924774169921875, "mean_token_accuracy": 0.8532403245568275, "num_tokens": 63295595.0, "step": 30960 }, { "entropy": 0.5804558306001126, "epoch": 0.5029924559252251, "grad_norm": 9.9375, "learning_rate": 2.541101499217763e-05, "loss": 0.5645534992218018, "mean_token_accuracy": 0.8602942600846291, "num_tokens": 63314737.0, "step": 30970 }, { "entropy": 0.5781186825595797, "epoch": 0.5031548687298507, "grad_norm": 8.375, "learning_rate": 2.5398050333166556e-05, "loss": 0.6102898597717286, "mean_token_accuracy": 0.8500448048114777, "num_tokens": 63336456.0, "step": 30980 }, { "entropy": 0.5248013722710312, "epoch": 0.5033172815344762, "grad_norm": 8.625, "learning_rate": 2.538508556707905e-05, "loss": 0.5418924808502197, "mean_token_accuracy": 0.8645344406366349, "num_tokens": 63357546.0, "step": 30990 }, { "entropy": 0.5431352938525379, "epoch": 0.5034796943391017, "grad_norm": 6.9375, "learning_rate": 2.5372120697402668e-05, "loss": 0.545280933380127, "mean_token_accuracy": 0.869857943803072, "num_tokens": 63377496.0, "step": 31000 }, { "entropy": 0.5434500108938665, "epoch": 0.5036421071437273, "grad_norm": 6.03125, "learning_rate": 2.5359155727624967e-05, "loss": 0.5474634647369385, "mean_token_accuracy": 0.8586061395704746, "num_tokens": 63397760.0, "step": 31010 }, { "entropy": 0.5027830949053168, "epoch": 0.5038045199483527, "grad_norm": 8.1875, "learning_rate": 2.534619066123358e-05, "loss": 0.4951018810272217, "mean_token_accuracy": 0.8699811305850744, "num_tokens": 63417909.0, "step": 31020 }, { "entropy": 0.48969662794843316, "epoch": 0.5039669327529782, "grad_norm": 8.4375, "learning_rate": 2.5333225501716122e-05, "loss": 0.4860862731933594, "mean_token_accuracy": 0.8704923883080482, "num_tokens": 63438182.0, "step": 31030 }, { "entropy": 0.4967236865311861, "epoch": 0.5041293455576038, "grad_norm": 6.8125, "learning_rate": 2.5320260252560257e-05, "loss": 0.5233484268188476, "mean_token_accuracy": 0.870791421085596, "num_tokens": 63458102.0, "step": 31040 }, { "entropy": 0.4368639747845009, "epoch": 0.5042917583622293, "grad_norm": 5.65625, "learning_rate": 2.5307294917253667e-05, "loss": 0.41996021270751954, "mean_token_accuracy": 0.8908371031284332, "num_tokens": 63478270.0, "step": 31050 }, { "entropy": 0.5225863297469914, "epoch": 0.5044541711668548, "grad_norm": 6.21875, "learning_rate": 2.5294329499284047e-05, "loss": 0.5451902866363525, "mean_token_accuracy": 0.8659935861825943, "num_tokens": 63499471.0, "step": 31060 }, { "entropy": 0.5028060196666047, "epoch": 0.5046165839714803, "grad_norm": 9.0, "learning_rate": 2.528136400213914e-05, "loss": 0.5199184894561768, "mean_token_accuracy": 0.8694649368524552, "num_tokens": 63519591.0, "step": 31070 }, { "entropy": 0.5243601767346263, "epoch": 0.5047789967761058, "grad_norm": 8.5625, "learning_rate": 2.5268398429306677e-05, "loss": 0.4969650745391846, "mean_token_accuracy": 0.8783114463090896, "num_tokens": 63539936.0, "step": 31080 }, { "entropy": 0.5960184166207909, "epoch": 0.5049414095807313, "grad_norm": 8.25, "learning_rate": 2.525543278427443e-05, "loss": 0.592011547088623, "mean_token_accuracy": 0.8490048408508301, "num_tokens": 63560489.0, "step": 31090 }, { "entropy": 0.580484717618674, "epoch": 0.5051038223853569, "grad_norm": 11.5, "learning_rate": 2.5242467070530195e-05, "loss": 0.5620294094085694, "mean_token_accuracy": 0.8598048843443393, "num_tokens": 63581026.0, "step": 31100 }, { "entropy": 0.5274917416274547, "epoch": 0.5052662351899824, "grad_norm": 9.3125, "learning_rate": 2.522950129156178e-05, "loss": 0.5459061622619629, "mean_token_accuracy": 0.8565484628081321, "num_tokens": 63601413.0, "step": 31110 }, { "entropy": 0.47519553927704694, "epoch": 0.5054286479946078, "grad_norm": 6.0625, "learning_rate": 2.5216535450856994e-05, "loss": 0.4461238384246826, "mean_token_accuracy": 0.8849045678973197, "num_tokens": 63621908.0, "step": 31120 }, { "entropy": 0.5771022098138928, "epoch": 0.5055910607992334, "grad_norm": 6.84375, "learning_rate": 2.5203569551903682e-05, "loss": 0.591285514831543, "mean_token_accuracy": 0.8545915607362986, "num_tokens": 63643462.0, "step": 31130 }, { "entropy": 0.5222721460275352, "epoch": 0.5057534736038589, "grad_norm": 7.5625, "learning_rate": 2.5190603598189704e-05, "loss": 0.565674877166748, "mean_token_accuracy": 0.8669797025620938, "num_tokens": 63664113.0, "step": 31140 }, { "entropy": 0.5848565527237952, "epoch": 0.5059158864084844, "grad_norm": 6.34375, "learning_rate": 2.5177637593202935e-05, "loss": 0.5782303810119629, "mean_token_accuracy": 0.8618705078959465, "num_tokens": 63685544.0, "step": 31150 }, { "entropy": 0.5247034734115005, "epoch": 0.50607829921311, "grad_norm": 6.78125, "learning_rate": 2.516467154043125e-05, "loss": 0.5311241149902344, "mean_token_accuracy": 0.8705053735524416, "num_tokens": 63705578.0, "step": 31160 }, { "entropy": 0.508901415579021, "epoch": 0.5062407120177355, "grad_norm": 5.53125, "learning_rate": 2.515170544336255e-05, "loss": 0.48520455360412595, "mean_token_accuracy": 0.8807548485696316, "num_tokens": 63725717.0, "step": 31170 }, { "entropy": 0.5674579416401684, "epoch": 0.506403124822361, "grad_norm": 9.3125, "learning_rate": 2.513873930548475e-05, "loss": 0.5618189811706543, "mean_token_accuracy": 0.8561816483736038, "num_tokens": 63746195.0, "step": 31180 }, { "entropy": 0.5311344156973064, "epoch": 0.5065655376269865, "grad_norm": 7.5625, "learning_rate": 2.512577313028576e-05, "loss": 0.5378102779388427, "mean_token_accuracy": 0.8680837921798229, "num_tokens": 63767194.0, "step": 31190 }, { "entropy": 0.47301930682733656, "epoch": 0.506727950431612, "grad_norm": 9.1875, "learning_rate": 2.511280692125352e-05, "loss": 0.4473231315612793, "mean_token_accuracy": 0.881066520512104, "num_tokens": 63786718.0, "step": 31200 }, { "entropy": 0.5166785879526288, "epoch": 0.5068903632362376, "grad_norm": 12.5, "learning_rate": 2.509984068187596e-05, "loss": 0.5207250118255615, "mean_token_accuracy": 0.8656733512878418, "num_tokens": 63807722.0, "step": 31210 }, { "entropy": 0.5005590539425612, "epoch": 0.5070527760408631, "grad_norm": 7.25, "learning_rate": 2.5086874415641033e-05, "loss": 0.5609787464141845, "mean_token_accuracy": 0.8576747052371502, "num_tokens": 63827510.0, "step": 31220 }, { "entropy": 0.5807335109682754, "epoch": 0.5072151888454886, "grad_norm": 9.6875, "learning_rate": 2.50739081260367e-05, "loss": 0.6269726753234863, "mean_token_accuracy": 0.8458425734192133, "num_tokens": 63846283.0, "step": 31230 }, { "entropy": 0.45723277390934525, "epoch": 0.5073776016501141, "grad_norm": 8.3125, "learning_rate": 2.50609418165509e-05, "loss": 0.44083271026611326, "mean_token_accuracy": 0.8905237339437008, "num_tokens": 63865923.0, "step": 31240 }, { "entropy": 0.5534209537319839, "epoch": 0.5075400144547396, "grad_norm": 6.4375, "learning_rate": 2.5047975490671627e-05, "loss": 0.523739242553711, "mean_token_accuracy": 0.8712362129241228, "num_tokens": 63886664.0, "step": 31250 }, { "entropy": 0.47124530901201067, "epoch": 0.5077024272593651, "grad_norm": 6.34375, "learning_rate": 2.5035009151886836e-05, "loss": 0.4780773162841797, "mean_token_accuracy": 0.872762282192707, "num_tokens": 63906926.0, "step": 31260 }, { "entropy": 0.5377285491907969, "epoch": 0.5078648400639907, "grad_norm": 13.0625, "learning_rate": 2.502204280368451e-05, "loss": 0.5421071529388428, "mean_token_accuracy": 0.8675767444074154, "num_tokens": 63926573.0, "step": 31270 }, { "entropy": 0.5739461981225759, "epoch": 0.5080272528686162, "grad_norm": 10.5625, "learning_rate": 2.5009076449552605e-05, "loss": 0.5823330879211426, "mean_token_accuracy": 0.8554668717086316, "num_tokens": 63948250.0, "step": 31280 }, { "entropy": 0.4982933820458129, "epoch": 0.5081896656732416, "grad_norm": 9.9375, "learning_rate": 2.4996110092979132e-05, "loss": 0.5096698760986328, "mean_token_accuracy": 0.8730714991688728, "num_tokens": 63968639.0, "step": 31290 }, { "entropy": 0.5116185680963099, "epoch": 0.5083520784778672, "grad_norm": 7.1875, "learning_rate": 2.4983143737452036e-05, "loss": 0.5201897144317627, "mean_token_accuracy": 0.8637016639113426, "num_tokens": 63989879.0, "step": 31300 }, { "entropy": 0.5345291260629892, "epoch": 0.5085144912824927, "grad_norm": 8.9375, "learning_rate": 2.4970177386459325e-05, "loss": 0.5226802349090576, "mean_token_accuracy": 0.8631611682474614, "num_tokens": 64010612.0, "step": 31310 }, { "entropy": 0.5360772182233632, "epoch": 0.5086769040871182, "grad_norm": 6.53125, "learning_rate": 2.495721104348896e-05, "loss": 0.5293684959411621, "mean_token_accuracy": 0.876145800948143, "num_tokens": 64030120.0, "step": 31320 }, { "entropy": 0.5112530216341838, "epoch": 0.5088393168917438, "grad_norm": 8.4375, "learning_rate": 2.494424471202892e-05, "loss": 0.5075409889221192, "mean_token_accuracy": 0.8725536562502384, "num_tokens": 64050784.0, "step": 31330 }, { "entropy": 0.48728248351253567, "epoch": 0.5090017296963693, "grad_norm": 10.8125, "learning_rate": 2.493127839556718e-05, "loss": 0.5027622699737548, "mean_token_accuracy": 0.8670290302485227, "num_tokens": 64070428.0, "step": 31340 }, { "entropy": 0.4942189686000347, "epoch": 0.5091641425009947, "grad_norm": 7.5625, "learning_rate": 2.4918312097591702e-05, "loss": 0.49208431243896483, "mean_token_accuracy": 0.8711544938385487, "num_tokens": 64090718.0, "step": 31350 }, { "entropy": 0.49619610672816633, "epoch": 0.5093265553056203, "grad_norm": 7.0, "learning_rate": 2.490534582159046e-05, "loss": 0.500821304321289, "mean_token_accuracy": 0.868914358317852, "num_tokens": 64112181.0, "step": 31360 }, { "entropy": 0.4967054320499301, "epoch": 0.5094889681102458, "grad_norm": 7.15625, "learning_rate": 2.48923795710514e-05, "loss": 0.48534693717956545, "mean_token_accuracy": 0.8766528733074666, "num_tokens": 64131941.0, "step": 31370 }, { "entropy": 0.5339177510235459, "epoch": 0.5096513809148713, "grad_norm": 7.125, "learning_rate": 2.4879413349462473e-05, "loss": 0.5206130981445313, "mean_token_accuracy": 0.8724849846214056, "num_tokens": 64153536.0, "step": 31380 }, { "entropy": 0.4945803613867611, "epoch": 0.5098137937194969, "grad_norm": 10.5, "learning_rate": 2.4866447160311636e-05, "loss": 0.5093672275543213, "mean_token_accuracy": 0.8763057559728622, "num_tokens": 64173712.0, "step": 31390 }, { "entropy": 0.5137289888691157, "epoch": 0.5099762065241223, "grad_norm": 7.1875, "learning_rate": 2.4853481007086803e-05, "loss": 0.5466082572937012, "mean_token_accuracy": 0.8600450672209263, "num_tokens": 64192958.0, "step": 31400 }, { "entropy": 0.4881234313827008, "epoch": 0.5101386193287479, "grad_norm": 7.125, "learning_rate": 2.4840514893275914e-05, "loss": 0.46816329956054686, "mean_token_accuracy": 0.8737611286342144, "num_tokens": 64212687.0, "step": 31410 }, { "entropy": 0.43072693292051556, "epoch": 0.5103010321333734, "grad_norm": 6.59375, "learning_rate": 2.4827548822366877e-05, "loss": 0.42693161964416504, "mean_token_accuracy": 0.8838998459279537, "num_tokens": 64232216.0, "step": 31420 }, { "entropy": 0.45978101273067296, "epoch": 0.5104634449379989, "grad_norm": 8.125, "learning_rate": 2.4814582797847593e-05, "loss": 0.46312775611877444, "mean_token_accuracy": 0.8838886834681035, "num_tokens": 64251446.0, "step": 31430 }, { "entropy": 0.5035333069041371, "epoch": 0.5106258577426245, "grad_norm": 7.4375, "learning_rate": 2.480161682320596e-05, "loss": 0.5440796852111817, "mean_token_accuracy": 0.8676906295120717, "num_tokens": 64272414.0, "step": 31440 }, { "entropy": 0.5059620055370033, "epoch": 0.51078827054725, "grad_norm": 10.5, "learning_rate": 2.4788650901929842e-05, "loss": 0.5036671161651611, "mean_token_accuracy": 0.8809638246893883, "num_tokens": 64292301.0, "step": 31450 }, { "entropy": 0.4990936552174389, "epoch": 0.5109506833518754, "grad_norm": 10.0625, "learning_rate": 2.47756850375071e-05, "loss": 0.5343925952911377, "mean_token_accuracy": 0.8702289573848248, "num_tokens": 64311661.0, "step": 31460 }, { "entropy": 0.5140576610341668, "epoch": 0.511113096156501, "grad_norm": 8.3125, "learning_rate": 2.4762719233425595e-05, "loss": 0.5367635250091553, "mean_token_accuracy": 0.8706135220825673, "num_tokens": 64331457.0, "step": 31470 }, { "entropy": 0.564902906329371, "epoch": 0.5112755089611265, "grad_norm": 9.0625, "learning_rate": 2.4749753493173146e-05, "loss": 0.5571750640869141, "mean_token_accuracy": 0.8642473790794611, "num_tokens": 64352127.0, "step": 31480 }, { "entropy": 0.5148959412472323, "epoch": 0.511437921765752, "grad_norm": 7.125, "learning_rate": 2.473678782023757e-05, "loss": 0.522284460067749, "mean_token_accuracy": 0.8729870699346065, "num_tokens": 64373480.0, "step": 31490 }, { "entropy": 0.4708524478599429, "epoch": 0.5116003345703776, "grad_norm": 8.5625, "learning_rate": 2.4723822218106666e-05, "loss": 0.4871383190155029, "mean_token_accuracy": 0.8796190045773983, "num_tokens": 64394266.0, "step": 31500 }, { "entropy": 0.5530656065791846, "epoch": 0.511762747375003, "grad_norm": 6.9375, "learning_rate": 2.4710856690268196e-05, "loss": 0.5431325435638428, "mean_token_accuracy": 0.8641827218234539, "num_tokens": 64415238.0, "step": 31510 }, { "entropy": 0.5239378379890696, "epoch": 0.5119251601796285, "grad_norm": 8.0625, "learning_rate": 2.4697891240209933e-05, "loss": 0.49851303100585936, "mean_token_accuracy": 0.872267734259367, "num_tokens": 64436652.0, "step": 31520 }, { "entropy": 0.5107231616042555, "epoch": 0.5120875729842541, "grad_norm": 6.96875, "learning_rate": 2.468492587141961e-05, "loss": 0.4844343185424805, "mean_token_accuracy": 0.8753704614937305, "num_tokens": 64458019.0, "step": 31530 }, { "entropy": 0.44907164145261047, "epoch": 0.5122499857888796, "grad_norm": 7.8125, "learning_rate": 2.467196058738493e-05, "loss": 0.4586945533752441, "mean_token_accuracy": 0.8821403846144676, "num_tokens": 64478005.0, "step": 31540 }, { "entropy": 0.528500972664915, "epoch": 0.5124123985935051, "grad_norm": 5.84375, "learning_rate": 2.4658995391593593e-05, "loss": 0.5393474102020264, "mean_token_accuracy": 0.8670339226722718, "num_tokens": 64498309.0, "step": 31550 }, { "entropy": 0.4714937834069133, "epoch": 0.5125748113981307, "grad_norm": 6.4375, "learning_rate": 2.464603028753325e-05, "loss": 0.514289140701294, "mean_token_accuracy": 0.8751979980617761, "num_tokens": 64518926.0, "step": 31560 }, { "entropy": 0.4604245376540348, "epoch": 0.5127372242027561, "grad_norm": 9.0625, "learning_rate": 2.4633065278691567e-05, "loss": 0.4549668312072754, "mean_token_accuracy": 0.8814656987786293, "num_tokens": 64539533.0, "step": 31570 }, { "entropy": 0.48911209269426764, "epoch": 0.5128996370073816, "grad_norm": 7.28125, "learning_rate": 2.462010036855615e-05, "loss": 0.4882661819458008, "mean_token_accuracy": 0.8762936003506183, "num_tokens": 64560603.0, "step": 31580 }, { "entropy": 0.5008675747551024, "epoch": 0.5130620498120072, "grad_norm": 7.75, "learning_rate": 2.4607135560614583e-05, "loss": 0.510643196105957, "mean_token_accuracy": 0.8800863225013018, "num_tokens": 64579709.0, "step": 31590 }, { "entropy": 0.40986216969322414, "epoch": 0.5132244626166327, "grad_norm": 10.5, "learning_rate": 2.4594170858354427e-05, "loss": 0.3996280670166016, "mean_token_accuracy": 0.8924286879599095, "num_tokens": 64599982.0, "step": 31600 }, { "entropy": 0.5349804350640625, "epoch": 0.5133868754212582, "grad_norm": 8.625, "learning_rate": 2.458120626526324e-05, "loss": 0.5295713424682618, "mean_token_accuracy": 0.8756115455180407, "num_tokens": 64620576.0, "step": 31610 }, { "entropy": 0.45686810282059015, "epoch": 0.5135492882258837, "grad_norm": 11.75, "learning_rate": 2.456824178482849e-05, "loss": 0.4990899085998535, "mean_token_accuracy": 0.8711816787719726, "num_tokens": 64640474.0, "step": 31620 }, { "entropy": 0.5743285831529648, "epoch": 0.5137117010305092, "grad_norm": 5.625, "learning_rate": 2.4555277420537675e-05, "loss": 0.5815680503845215, "mean_token_accuracy": 0.8535645857453347, "num_tokens": 64660601.0, "step": 31630 }, { "entropy": 0.46380920028313993, "epoch": 0.5138741138351348, "grad_norm": 9.125, "learning_rate": 2.454231317587824e-05, "loss": 0.4839338302612305, "mean_token_accuracy": 0.8802500292658806, "num_tokens": 64679925.0, "step": 31640 }, { "entropy": 0.530510958051309, "epoch": 0.5140365266397603, "grad_norm": 6.4375, "learning_rate": 2.4529349054337587e-05, "loss": 0.5314265251159668, "mean_token_accuracy": 0.8676993541419507, "num_tokens": 64699973.0, "step": 31650 }, { "entropy": 0.5221024069003761, "epoch": 0.5141989394443858, "grad_norm": 7.90625, "learning_rate": 2.4516385059403095e-05, "loss": 0.5489985942840576, "mean_token_accuracy": 0.8641322743147611, "num_tokens": 64719177.0, "step": 31660 }, { "entropy": 0.45507272984832525, "epoch": 0.5143613522490114, "grad_norm": 8.125, "learning_rate": 2.4503421194562103e-05, "loss": 0.45491909980773926, "mean_token_accuracy": 0.8864268340170384, "num_tokens": 64739546.0, "step": 31670 }, { "entropy": 0.48251351070357484, "epoch": 0.5145237650536368, "grad_norm": 8.75, "learning_rate": 2.449045746330193e-05, "loss": 0.5065985202789307, "mean_token_accuracy": 0.8716546334326267, "num_tokens": 64759150.0, "step": 31680 }, { "entropy": 0.4678797002416104, "epoch": 0.5146861778582623, "grad_norm": 6.34375, "learning_rate": 2.4477493869109853e-05, "loss": 0.4818274974822998, "mean_token_accuracy": 0.8805451069027186, "num_tokens": 64780408.0, "step": 31690 }, { "entropy": 0.5049496863503009, "epoch": 0.5148485906628879, "grad_norm": 7.78125, "learning_rate": 2.4464530415473087e-05, "loss": 0.5188385486602783, "mean_token_accuracy": 0.8720504656434059, "num_tokens": 64801061.0, "step": 31700 }, { "entropy": 0.5490647946717218, "epoch": 0.5150110034675134, "grad_norm": 8.25, "learning_rate": 2.4451567105878842e-05, "loss": 0.532465124130249, "mean_token_accuracy": 0.8642654992640019, "num_tokens": 64822404.0, "step": 31710 }, { "entropy": 0.5230568445753306, "epoch": 0.5151734162721389, "grad_norm": 11.625, "learning_rate": 2.443860394381429e-05, "loss": 0.4831412315368652, "mean_token_accuracy": 0.881611493229866, "num_tokens": 64841067.0, "step": 31720 }, { "entropy": 0.5389516274444759, "epoch": 0.5153358290767645, "grad_norm": 7.71875, "learning_rate": 2.442564093276653e-05, "loss": 0.5225939750671387, "mean_token_accuracy": 0.8703916773200036, "num_tokens": 64861714.0, "step": 31730 }, { "entropy": 0.5079233683412895, "epoch": 0.5154982418813899, "grad_norm": 6.5, "learning_rate": 2.441267807622266e-05, "loss": 0.49684629440307615, "mean_token_accuracy": 0.8753706328570843, "num_tokens": 64881656.0, "step": 31740 }, { "entropy": 0.5793736977502704, "epoch": 0.5156606546860154, "grad_norm": 10.9375, "learning_rate": 2.4399715377669698e-05, "loss": 0.6116445541381836, "mean_token_accuracy": 0.8517182812094688, "num_tokens": 64901869.0, "step": 31750 }, { "entropy": 0.5432271152269095, "epoch": 0.515823067490641, "grad_norm": 8.9375, "learning_rate": 2.4386752840594643e-05, "loss": 0.5649291038513183, "mean_token_accuracy": 0.8622763954102993, "num_tokens": 64922658.0, "step": 31760 }, { "entropy": 0.5102298968471587, "epoch": 0.5159854802952665, "grad_norm": 7.4375, "learning_rate": 2.4373790468484466e-05, "loss": 0.49146018028259275, "mean_token_accuracy": 0.8747186385095119, "num_tokens": 64943489.0, "step": 31770 }, { "entropy": 0.5531921558082104, "epoch": 0.516147893099892, "grad_norm": 8.8125, "learning_rate": 2.436082826482605e-05, "loss": 0.5821649551391601, "mean_token_accuracy": 0.8579642526805401, "num_tokens": 64964866.0, "step": 31780 }, { "entropy": 0.44418733306229113, "epoch": 0.5163103059045175, "grad_norm": 6.8125, "learning_rate": 2.434786623310627e-05, "loss": 0.43855991363525393, "mean_token_accuracy": 0.8791685063391924, "num_tokens": 64985152.0, "step": 31790 }, { "entropy": 0.4625800663838163, "epoch": 0.516472718709143, "grad_norm": 7.875, "learning_rate": 2.433490437681194e-05, "loss": 0.47405142784118653, "mean_token_accuracy": 0.8854402892291546, "num_tokens": 65004500.0, "step": 31800 }, { "entropy": 0.5459943887079135, "epoch": 0.5166351315137685, "grad_norm": 6.6875, "learning_rate": 2.432194269942983e-05, "loss": 0.5206427097320556, "mean_token_accuracy": 0.870201250910759, "num_tokens": 65024830.0, "step": 31810 }, { "entropy": 0.5844416637904942, "epoch": 0.5167975443183941, "grad_norm": 9.75, "learning_rate": 2.4308981204446647e-05, "loss": 0.5958810329437256, "mean_token_accuracy": 0.8488966196775436, "num_tokens": 65044785.0, "step": 31820 }, { "entropy": 0.4825925830751657, "epoch": 0.5169599571230196, "grad_norm": 10.6875, "learning_rate": 2.4296019895349083e-05, "loss": 0.5136378288269043, "mean_token_accuracy": 0.8730720303952694, "num_tokens": 65065003.0, "step": 31830 }, { "entropy": 0.5214458112604916, "epoch": 0.517122369927645, "grad_norm": 6.03125, "learning_rate": 2.428305877562375e-05, "loss": 0.5323106288909912, "mean_token_accuracy": 0.8703538931906223, "num_tokens": 65085528.0, "step": 31840 }, { "entropy": 0.49421712281182406, "epoch": 0.5172847827322706, "grad_norm": 7.5, "learning_rate": 2.4270097848757217e-05, "loss": 0.4815335273742676, "mean_token_accuracy": 0.8732552267611027, "num_tokens": 65106591.0, "step": 31850 }, { "entropy": 0.4858395718038082, "epoch": 0.5174471955368961, "grad_norm": 6.15625, "learning_rate": 2.4257137118236e-05, "loss": 0.4936209201812744, "mean_token_accuracy": 0.8734801806509495, "num_tokens": 65127690.0, "step": 31860 }, { "entropy": 0.4252887805458158, "epoch": 0.5176096083415217, "grad_norm": 6.71875, "learning_rate": 2.424417658754656e-05, "loss": 0.4176274299621582, "mean_token_accuracy": 0.8891563273966312, "num_tokens": 65148254.0, "step": 31870 }, { "entropy": 0.5193524038186297, "epoch": 0.5177720211461472, "grad_norm": 9.0625, "learning_rate": 2.423121626017533e-05, "loss": 0.5388798713684082, "mean_token_accuracy": 0.8683447428047657, "num_tokens": 65169269.0, "step": 31880 }, { "entropy": 0.5068851973395795, "epoch": 0.5179344339507727, "grad_norm": 6.5625, "learning_rate": 2.4218256139608646e-05, "loss": 0.49756393432617185, "mean_token_accuracy": 0.8802759349346161, "num_tokens": 65188452.0, "step": 31890 }, { "entropy": 0.4957798327319324, "epoch": 0.5180968467553982, "grad_norm": 9.1875, "learning_rate": 2.420529622933282e-05, "loss": 0.4983179569244385, "mean_token_accuracy": 0.8740420959889889, "num_tokens": 65209357.0, "step": 31900 }, { "entropy": 0.5331252472475171, "epoch": 0.5182592595600237, "grad_norm": 6.0, "learning_rate": 2.41923365328341e-05, "loss": 0.5302881240844727, "mean_token_accuracy": 0.8621334679424763, "num_tokens": 65230310.0, "step": 31910 }, { "entropy": 0.42941749540623275, "epoch": 0.5184216723646492, "grad_norm": 8.6875, "learning_rate": 2.4179377053598654e-05, "loss": 0.43677868843078616, "mean_token_accuracy": 0.8920993342995643, "num_tokens": 65251135.0, "step": 31920 }, { "entropy": 0.500172538345214, "epoch": 0.5185840851692748, "grad_norm": 5.1875, "learning_rate": 2.4166417795112646e-05, "loss": 0.4706252098083496, "mean_token_accuracy": 0.8766123689711094, "num_tokens": 65271783.0, "step": 31930 }, { "entropy": 0.6117228420451284, "epoch": 0.5187464979739003, "grad_norm": 6.5, "learning_rate": 2.4153458760862104e-05, "loss": 0.635905122756958, "mean_token_accuracy": 0.8449424345046281, "num_tokens": 65292520.0, "step": 31940 }, { "entropy": 0.5325430804863572, "epoch": 0.5189089107785257, "grad_norm": 6.90625, "learning_rate": 2.4140499954333063e-05, "loss": 0.5645117282867431, "mean_token_accuracy": 0.8663497149944306, "num_tokens": 65313614.0, "step": 31950 }, { "entropy": 0.4516424720175564, "epoch": 0.5190713235831513, "grad_norm": 7.65625, "learning_rate": 2.412754137901147e-05, "loss": 0.470012903213501, "mean_token_accuracy": 0.881708151102066, "num_tokens": 65334038.0, "step": 31960 }, { "entropy": 0.5022185544949025, "epoch": 0.5192337363877768, "grad_norm": 10.8125, "learning_rate": 2.4114583038383204e-05, "loss": 0.5040915489196778, "mean_token_accuracy": 0.874006712436676, "num_tokens": 65355467.0, "step": 31970 }, { "entropy": 0.5295085556805134, "epoch": 0.5193961491924023, "grad_norm": 7.40625, "learning_rate": 2.4101624935934085e-05, "loss": 0.5014502048492432, "mean_token_accuracy": 0.8715894818305969, "num_tokens": 65376116.0, "step": 31980 }, { "entropy": 0.47011025808751583, "epoch": 0.5195585619970279, "grad_norm": 11.5625, "learning_rate": 2.4088667075149886e-05, "loss": 0.5108585834503174, "mean_token_accuracy": 0.8754473805427552, "num_tokens": 65396866.0, "step": 31990 }, { "epoch": 0.5197209748016534, "eval_entropy": 0.5435711845159531, "eval_loss": 0.5334779620170593, "eval_mean_token_accuracy": 0.8646890954971314, "eval_num_tokens": 65417249.0, "eval_runtime": 40.3049, "eval_samples_per_second": 49.622, "eval_steps_per_second": 6.203, "step": 32000 }, { "entropy": 0.4463274016743526, "epoch": 0.5198833876062788, "grad_norm": 6.71875, "learning_rate": 2.4062752092518927e-05, "loss": 0.4454516887664795, "mean_token_accuracy": 0.8882415909320116, "num_tokens": 65437831.0, "step": 32010 }, { "entropy": 0.5641618329100311, "epoch": 0.5200458004109044, "grad_norm": 8.1875, "learning_rate": 2.404979497764336e-05, "loss": 0.5450178146362304, "mean_token_accuracy": 0.8561033755540848, "num_tokens": 65458779.0, "step": 32020 }, { "entropy": 0.5010769475251436, "epoch": 0.5202082132155299, "grad_norm": 8.25, "learning_rate": 2.4036838118375067e-05, "loss": 0.4833087921142578, "mean_token_accuracy": 0.879993773251772, "num_tokens": 65478715.0, "step": 32030 }, { "entropy": 0.5423857097513973, "epoch": 0.5203706260201554, "grad_norm": 8.75, "learning_rate": 2.4023881518199497e-05, "loss": 0.5583311557769776, "mean_token_accuracy": 0.8702725648880005, "num_tokens": 65498467.0, "step": 32040 }, { "entropy": 0.4668980533955619, "epoch": 0.520533038824781, "grad_norm": 5.15625, "learning_rate": 2.401092518060199e-05, "loss": 0.4571049690246582, "mean_token_accuracy": 0.8776378765702247, "num_tokens": 65518112.0, "step": 32050 }, { "entropy": 0.4601549171842635, "epoch": 0.5206954516294064, "grad_norm": 7.84375, "learning_rate": 2.399796910906783e-05, "loss": 0.4762396335601807, "mean_token_accuracy": 0.8714640635997057, "num_tokens": 65538076.0, "step": 32060 }, { "entropy": 0.45349740230012686, "epoch": 0.5208578644340319, "grad_norm": 4.71875, "learning_rate": 2.3985013307082238e-05, "loss": 0.4853828907012939, "mean_token_accuracy": 0.8840164136141538, "num_tokens": 65558116.0, "step": 32070 }, { "entropy": 0.5141229214146733, "epoch": 0.5210202772386575, "grad_norm": 6.25, "learning_rate": 2.3972057778130337e-05, "loss": 0.5007837295532227, "mean_token_accuracy": 0.8701067987829447, "num_tokens": 65578251.0, "step": 32080 }, { "entropy": 0.4534931580070406, "epoch": 0.521182690043283, "grad_norm": 6.53125, "learning_rate": 2.3959102525697207e-05, "loss": 0.45786185264587403, "mean_token_accuracy": 0.8853714436292648, "num_tokens": 65599426.0, "step": 32090 }, { "entropy": 0.4763696023263037, "epoch": 0.5213451028479086, "grad_norm": 7.84375, "learning_rate": 2.3946147553267843e-05, "loss": 0.46722073554992677, "mean_token_accuracy": 0.8808918125927448, "num_tokens": 65620349.0, "step": 32100 }, { "entropy": 0.5246857958380133, "epoch": 0.5215075156525341, "grad_norm": 7.40625, "learning_rate": 2.393319286432715e-05, "loss": 0.5786768436431885, "mean_token_accuracy": 0.8668648295104504, "num_tokens": 65640301.0, "step": 32110 }, { "entropy": 0.5341463503893464, "epoch": 0.5216699284571595, "grad_norm": 9.875, "learning_rate": 2.3920238462359967e-05, "loss": 0.5437932014465332, "mean_token_accuracy": 0.8627737656235694, "num_tokens": 65660582.0, "step": 32120 }, { "entropy": 0.5422573374584317, "epoch": 0.5218323412617851, "grad_norm": 5.65625, "learning_rate": 2.3907284350851083e-05, "loss": 0.5173760414123535, "mean_token_accuracy": 0.8667926982045173, "num_tokens": 65680419.0, "step": 32130 }, { "entropy": 0.4727510468568653, "epoch": 0.5219947540664106, "grad_norm": 11.9375, "learning_rate": 2.389433053328515e-05, "loss": 0.4518135547637939, "mean_token_accuracy": 0.8855110205709934, "num_tokens": 65701564.0, "step": 32140 }, { "entropy": 0.4822386335581541, "epoch": 0.5221571668710361, "grad_norm": 10.625, "learning_rate": 2.3881377013146793e-05, "loss": 0.47096867561340333, "mean_token_accuracy": 0.8798721224069596, "num_tokens": 65721192.0, "step": 32150 }, { "entropy": 0.4734748762333766, "epoch": 0.5223195796756617, "grad_norm": 7.375, "learning_rate": 2.3868423793920532e-05, "loss": 0.44486727714538576, "mean_token_accuracy": 0.8806769132614136, "num_tokens": 65741762.0, "step": 32160 }, { "entropy": 0.4480273856315762, "epoch": 0.5224819924802871, "grad_norm": 5.65625, "learning_rate": 2.3855470879090813e-05, "loss": 0.43381896018981936, "mean_token_accuracy": 0.8878937222063541, "num_tokens": 65762385.0, "step": 32170 }, { "entropy": 0.4639682239620015, "epoch": 0.5226444052849126, "grad_norm": 10.0, "learning_rate": 2.3842518272142006e-05, "loss": 0.5031438350677491, "mean_token_accuracy": 0.8769525602459908, "num_tokens": 65782484.0, "step": 32180 }, { "entropy": 0.5111422085901722, "epoch": 0.5228068180895382, "grad_norm": 5.625, "learning_rate": 2.3829565976558373e-05, "loss": 0.5638608455657959, "mean_token_accuracy": 0.8621011957526207, "num_tokens": 65802628.0, "step": 32190 }, { "entropy": 0.5033729222603143, "epoch": 0.5229692308941637, "grad_norm": 7.15625, "learning_rate": 2.381661399582413e-05, "loss": 0.5432794094085693, "mean_token_accuracy": 0.8604748986661435, "num_tokens": 65822636.0, "step": 32200 }, { "entropy": 0.5175486814230681, "epoch": 0.5231316436987892, "grad_norm": 9.5, "learning_rate": 2.3803662333423386e-05, "loss": 0.5050787925720215, "mean_token_accuracy": 0.8639198429882526, "num_tokens": 65843033.0, "step": 32210 }, { "entropy": 0.5353206885512918, "epoch": 0.5232940565034148, "grad_norm": 7.96875, "learning_rate": 2.3790710992840155e-05, "loss": 0.5240823745727539, "mean_token_accuracy": 0.8657391272485256, "num_tokens": 65864420.0, "step": 32220 }, { "entropy": 0.4753953646635637, "epoch": 0.5234564693080402, "grad_norm": 6.03125, "learning_rate": 2.3777759977558392e-05, "loss": 0.47089762687683107, "mean_token_accuracy": 0.8850571863353253, "num_tokens": 65884671.0, "step": 32230 }, { "entropy": 0.42645889101549983, "epoch": 0.5236188821126657, "grad_norm": 8.9375, "learning_rate": 2.376480929106193e-05, "loss": 0.4254753589630127, "mean_token_accuracy": 0.8885055363178254, "num_tokens": 65905856.0, "step": 32240 }, { "entropy": 0.4537255208473653, "epoch": 0.5237812949172913, "grad_norm": 7.5625, "learning_rate": 2.3751858936834554e-05, "loss": 0.4510823726654053, "mean_token_accuracy": 0.883241830766201, "num_tokens": 65925331.0, "step": 32250 }, { "entropy": 0.5443071022164077, "epoch": 0.5239437077219168, "grad_norm": 10.5625, "learning_rate": 2.373890891835993e-05, "loss": 0.5385807991027832, "mean_token_accuracy": 0.8695555370301008, "num_tokens": 65946632.0, "step": 32260 }, { "entropy": 0.5175013852771372, "epoch": 0.5241061205265423, "grad_norm": 13.125, "learning_rate": 2.372595923912164e-05, "loss": 0.5482803344726562, "mean_token_accuracy": 0.8657186351716518, "num_tokens": 65967565.0, "step": 32270 }, { "entropy": 0.5001365350093693, "epoch": 0.5242685333311679, "grad_norm": 6.65625, "learning_rate": 2.3713009902603167e-05, "loss": 0.5293495655059814, "mean_token_accuracy": 0.8662685737013817, "num_tokens": 65988889.0, "step": 32280 }, { "entropy": 0.5404625029768795, "epoch": 0.5244309461357933, "grad_norm": 6.875, "learning_rate": 2.3700060912287943e-05, "loss": 0.5786478519439697, "mean_token_accuracy": 0.8626107566058636, "num_tokens": 66009279.0, "step": 32290 }, { "entropy": 0.48064499637112024, "epoch": 0.5245933589404188, "grad_norm": 5.5, "learning_rate": 2.3687112271659236e-05, "loss": 0.4971757411956787, "mean_token_accuracy": 0.8816525593400002, "num_tokens": 66029684.0, "step": 32300 }, { "entropy": 0.49382392605766656, "epoch": 0.5247557717450444, "grad_norm": 15.6875, "learning_rate": 2.3674163984200287e-05, "loss": 0.5158262729644776, "mean_token_accuracy": 0.8745053738355637, "num_tokens": 66048892.0, "step": 32310 }, { "entropy": 0.540617058495991, "epoch": 0.5249181845496699, "grad_norm": 7.5, "learning_rate": 2.366121605339421e-05, "loss": 0.5566507816314697, "mean_token_accuracy": 0.8635015293955803, "num_tokens": 66070299.0, "step": 32320 }, { "entropy": 0.48672333364374937, "epoch": 0.5250805973542955, "grad_norm": 9.5625, "learning_rate": 2.3648268482724017e-05, "loss": 0.4804685592651367, "mean_token_accuracy": 0.8746005900204181, "num_tokens": 66090539.0, "step": 32330 }, { "entropy": 0.5427389019168913, "epoch": 0.5252430101589209, "grad_norm": 7.1875, "learning_rate": 2.3635321275672644e-05, "loss": 0.545236349105835, "mean_token_accuracy": 0.8599127843976021, "num_tokens": 66111077.0, "step": 32340 }, { "entropy": 0.5261860045138747, "epoch": 0.5254054229635464, "grad_norm": 8.625, "learning_rate": 2.3622374435722908e-05, "loss": 0.5440515041351318, "mean_token_accuracy": 0.8716329850256443, "num_tokens": 66131500.0, "step": 32350 }, { "entropy": 0.4874029252678156, "epoch": 0.525567835768172, "grad_norm": 8.125, "learning_rate": 2.3609427966357547e-05, "loss": 0.5141664028167725, "mean_token_accuracy": 0.872572049498558, "num_tokens": 66151210.0, "step": 32360 }, { "entropy": 0.5343034153804183, "epoch": 0.5257302485727975, "grad_norm": 9.1875, "learning_rate": 2.3596481871059194e-05, "loss": 0.5240890502929687, "mean_token_accuracy": 0.870276103168726, "num_tokens": 66171569.0, "step": 32370 }, { "entropy": 0.47301261839456854, "epoch": 0.525892661377423, "grad_norm": 8.625, "learning_rate": 2.358353615331037e-05, "loss": 0.4896370887756348, "mean_token_accuracy": 0.8805594921112061, "num_tokens": 66193658.0, "step": 32380 }, { "entropy": 0.5156035942956805, "epoch": 0.5260550741820486, "grad_norm": 7.75, "learning_rate": 2.3570590816593494e-05, "loss": 0.49200100898742677, "mean_token_accuracy": 0.8764811046421528, "num_tokens": 66214280.0, "step": 32390 }, { "entropy": 0.518183997599408, "epoch": 0.526217486986674, "grad_norm": 9.9375, "learning_rate": 2.355764586439091e-05, "loss": 0.49608497619628905, "mean_token_accuracy": 0.8673455268144608, "num_tokens": 66234867.0, "step": 32400 }, { "entropy": 0.5413148131221532, "epoch": 0.5263798997912995, "grad_norm": 5.6875, "learning_rate": 2.354470130018483e-05, "loss": 0.5391173362731934, "mean_token_accuracy": 0.8639550812542438, "num_tokens": 66256453.0, "step": 32410 }, { "entropy": 0.5153211651369929, "epoch": 0.5265423125959251, "grad_norm": 9.8125, "learning_rate": 2.3531757127457374e-05, "loss": 0.48618292808532715, "mean_token_accuracy": 0.8799338944256305, "num_tokens": 66277425.0, "step": 32420 }, { "entropy": 0.46757388330297545, "epoch": 0.5267047254005506, "grad_norm": 10.8125, "learning_rate": 2.3518813349690547e-05, "loss": 0.47550210952758787, "mean_token_accuracy": 0.8820863835513592, "num_tokens": 66297358.0, "step": 32430 }, { "entropy": 0.4802468687528744, "epoch": 0.526867138205176, "grad_norm": 8.25, "learning_rate": 2.3505869970366247e-05, "loss": 0.4909496307373047, "mean_token_accuracy": 0.8810056120157241, "num_tokens": 66317323.0, "step": 32440 }, { "entropy": 0.5636429914273322, "epoch": 0.5270295510098016, "grad_norm": 8.875, "learning_rate": 2.3492926992966303e-05, "loss": 0.5893250465393066, "mean_token_accuracy": 0.8638626627624035, "num_tokens": 66337681.0, "step": 32450 }, { "entropy": 0.4628427307587117, "epoch": 0.5271919638144271, "grad_norm": 6.40625, "learning_rate": 2.347998442097237e-05, "loss": 0.4464442729949951, "mean_token_accuracy": 0.8814917452633381, "num_tokens": 66358081.0, "step": 32460 }, { "entropy": 0.47034822651185093, "epoch": 0.5273543766190526, "grad_norm": 7.1875, "learning_rate": 2.3467042257866044e-05, "loss": 0.46502079963684084, "mean_token_accuracy": 0.8840247943997384, "num_tokens": 66379646.0, "step": 32470 }, { "entropy": 0.5026594616589136, "epoch": 0.5275167894236782, "grad_norm": 7.3125, "learning_rate": 2.3454100507128806e-05, "loss": 0.5435523509979248, "mean_token_accuracy": 0.8607279852032661, "num_tokens": 66400110.0, "step": 32480 }, { "entropy": 0.6047575959935785, "epoch": 0.5276792022283037, "grad_norm": 8.5625, "learning_rate": 2.3441159172242e-05, "loss": 0.6161753177642822, "mean_token_accuracy": 0.8454909287393093, "num_tokens": 66420762.0, "step": 32490 }, { "entropy": 0.46706012487411497, "epoch": 0.5278416150329291, "grad_norm": 10.0, "learning_rate": 2.3428218256686873e-05, "loss": 0.47799954414367674, "mean_token_accuracy": 0.8782646067440509, "num_tokens": 66441315.0, "step": 32500 }, { "entropy": 0.5199498703121208, "epoch": 0.5280040278375547, "grad_norm": 11.1875, "learning_rate": 2.3415277763944578e-05, "loss": 0.5070500373840332, "mean_token_accuracy": 0.867745628207922, "num_tokens": 66460962.0, "step": 32510 }, { "entropy": 0.4659481802256778, "epoch": 0.5281664406421802, "grad_norm": 6.5, "learning_rate": 2.340233769749612e-05, "loss": 0.4874136447906494, "mean_token_accuracy": 0.879593276232481, "num_tokens": 66480823.0, "step": 32520 }, { "entropy": 0.4709164334461093, "epoch": 0.5283288534468057, "grad_norm": 9.375, "learning_rate": 2.3389398060822422e-05, "loss": 0.4702265739440918, "mean_token_accuracy": 0.8867265716195106, "num_tokens": 66501840.0, "step": 32530 }, { "entropy": 0.5098220149986445, "epoch": 0.5284912662514313, "grad_norm": 8.1875, "learning_rate": 2.3376458857404253e-05, "loss": 0.5513124465942383, "mean_token_accuracy": 0.8693359225988389, "num_tokens": 66524094.0, "step": 32540 }, { "entropy": 0.48883825172670187, "epoch": 0.5286536790560568, "grad_norm": 7.375, "learning_rate": 2.33635200907223e-05, "loss": 0.5303766250610351, "mean_token_accuracy": 0.8605763830244542, "num_tokens": 66543805.0, "step": 32550 }, { "entropy": 0.5398591757752002, "epoch": 0.5288160918606823, "grad_norm": 10.6875, "learning_rate": 2.3350581764257124e-05, "loss": 0.5733153820037842, "mean_token_accuracy": 0.8481892824172974, "num_tokens": 66564588.0, "step": 32560 }, { "entropy": 0.5216809779405593, "epoch": 0.5289785046653078, "grad_norm": 6.5625, "learning_rate": 2.3337643881489163e-05, "loss": 0.4994957447052002, "mean_token_accuracy": 0.875600402802229, "num_tokens": 66585677.0, "step": 32570 }, { "entropy": 0.4802111144643277, "epoch": 0.5291409174699333, "grad_norm": 5.6875, "learning_rate": 2.332470644589873e-05, "loss": 0.4922330379486084, "mean_token_accuracy": 0.8726156920194625, "num_tokens": 66606189.0, "step": 32580 }, { "entropy": 0.49278554660268126, "epoch": 0.5293033302745589, "grad_norm": 9.25, "learning_rate": 2.3311769460966034e-05, "loss": 0.4768968105316162, "mean_token_accuracy": 0.8778623759746551, "num_tokens": 66626925.0, "step": 32590 }, { "entropy": 0.5064407004509122, "epoch": 0.5294657430791844, "grad_norm": 8.125, "learning_rate": 2.3298832930171134e-05, "loss": 0.5814823150634766, "mean_token_accuracy": 0.8563963498920202, "num_tokens": 66646830.0, "step": 32600 }, { "entropy": 0.5224996482720599, "epoch": 0.5296281558838098, "grad_norm": 6.75, "learning_rate": 2.3285896856994006e-05, "loss": 0.5544665336608887, "mean_token_accuracy": 0.8646035399287939, "num_tokens": 66667856.0, "step": 32610 }, { "entropy": 0.528996616275981, "epoch": 0.5297905686884354, "grad_norm": 11.1875, "learning_rate": 2.3272961244914483e-05, "loss": 0.4975640296936035, "mean_token_accuracy": 0.8739037767052651, "num_tokens": 66687976.0, "step": 32620 }, { "entropy": 0.533230008976534, "epoch": 0.5299529814930609, "grad_norm": 5.78125, "learning_rate": 2.326002609741226e-05, "loss": 0.52183518409729, "mean_token_accuracy": 0.8701559405773878, "num_tokens": 66708620.0, "step": 32630 }, { "entropy": 0.5010134418960661, "epoch": 0.5301153942976864, "grad_norm": 7.0625, "learning_rate": 2.3247091417966932e-05, "loss": 0.4694943904876709, "mean_token_accuracy": 0.8811018671840429, "num_tokens": 66728854.0, "step": 32640 }, { "entropy": 0.4928140091709793, "epoch": 0.530277807102312, "grad_norm": 6.5, "learning_rate": 2.3234157210057948e-05, "loss": 0.46771931648254395, "mean_token_accuracy": 0.8821816585958004, "num_tokens": 66749262.0, "step": 32650 }, { "entropy": 0.5664487617090345, "epoch": 0.5304402199069375, "grad_norm": 7.59375, "learning_rate": 2.3221223477164637e-05, "loss": 0.6064012050628662, "mean_token_accuracy": 0.8469003453850746, "num_tokens": 66770290.0, "step": 32660 }, { "entropy": 0.4953888944815844, "epoch": 0.5306026327115629, "grad_norm": 6.03125, "learning_rate": 2.3208290222766215e-05, "loss": 0.4613226890563965, "mean_token_accuracy": 0.8770062454044819, "num_tokens": 66792253.0, "step": 32670 }, { "entropy": 0.4760645147413015, "epoch": 0.5307650455161885, "grad_norm": 6.375, "learning_rate": 2.3195357450341747e-05, "loss": 0.4352574348449707, "mean_token_accuracy": 0.8907764203846454, "num_tokens": 66813127.0, "step": 32680 }, { "entropy": 0.49212415223009887, "epoch": 0.530927458320814, "grad_norm": 8.6875, "learning_rate": 2.3182425163370184e-05, "loss": 0.5220905303955078, "mean_token_accuracy": 0.8718458153307438, "num_tokens": 66833914.0, "step": 32690 }, { "entropy": 0.476950765773654, "epoch": 0.5310898711254395, "grad_norm": 5.28125, "learning_rate": 2.3169493365330338e-05, "loss": 0.4816749572753906, "mean_token_accuracy": 0.8748804412782192, "num_tokens": 66854306.0, "step": 32700 }, { "entropy": 0.4427878403570503, "epoch": 0.5312522839300651, "grad_norm": 6.53125, "learning_rate": 2.315656205970088e-05, "loss": 0.4731252670288086, "mean_token_accuracy": 0.8855576887726784, "num_tokens": 66873903.0, "step": 32710 }, { "entropy": 0.498014506441541, "epoch": 0.5314146967346906, "grad_norm": 8.125, "learning_rate": 2.3143631249960386e-05, "loss": 0.4536584854125977, "mean_token_accuracy": 0.8867255732417106, "num_tokens": 66894100.0, "step": 32720 }, { "entropy": 0.477185506792739, "epoch": 0.531577109539316, "grad_norm": 5.75, "learning_rate": 2.3130700939587247e-05, "loss": 0.5139286041259765, "mean_token_accuracy": 0.8775724165141583, "num_tokens": 66914360.0, "step": 32730 }, { "entropy": 0.5347449270077049, "epoch": 0.5317395223439416, "grad_norm": 10.75, "learning_rate": 2.311777113205976e-05, "loss": 0.5629463195800781, "mean_token_accuracy": 0.8536611661314965, "num_tokens": 66934832.0, "step": 32740 }, { "entropy": 0.552800724375993, "epoch": 0.5319019351485671, "grad_norm": 8.75, "learning_rate": 2.3104841830856073e-05, "loss": 0.546446418762207, "mean_token_accuracy": 0.8640116959810257, "num_tokens": 66954493.0, "step": 32750 }, { "entropy": 0.48592754974961283, "epoch": 0.5320643479531927, "grad_norm": 9.125, "learning_rate": 2.309191303945418e-05, "loss": 0.4768341541290283, "mean_token_accuracy": 0.8734835833311081, "num_tokens": 66974922.0, "step": 32760 }, { "entropy": 0.5000361226731911, "epoch": 0.5322267607578182, "grad_norm": 5.71875, "learning_rate": 2.3078984761331973e-05, "loss": 0.4872912406921387, "mean_token_accuracy": 0.8747485183179379, "num_tokens": 66996536.0, "step": 32770 }, { "entropy": 0.4710672049317509, "epoch": 0.5323891735624436, "grad_norm": 7.875, "learning_rate": 2.306605699996719e-05, "loss": 0.48632097244262695, "mean_token_accuracy": 0.8779416307806969, "num_tokens": 67016313.0, "step": 32780 }, { "entropy": 0.5291117968503386, "epoch": 0.5325515863670692, "grad_norm": 8.3125, "learning_rate": 2.305312975883741e-05, "loss": 0.5384933948516846, "mean_token_accuracy": 0.8686050578951836, "num_tokens": 67037028.0, "step": 32790 }, { "entropy": 0.4670780538814142, "epoch": 0.5327139991716947, "grad_norm": 5.90625, "learning_rate": 2.30402030414201e-05, "loss": 0.48860921859741213, "mean_token_accuracy": 0.8706880435347557, "num_tokens": 67057534.0, "step": 32800 }, { "entropy": 0.4696903506293893, "epoch": 0.5328764119763202, "grad_norm": 7.65625, "learning_rate": 2.302727685119259e-05, "loss": 0.5334705352783203, "mean_token_accuracy": 0.8719631433486938, "num_tokens": 67077047.0, "step": 32810 }, { "entropy": 0.44733525696210563, "epoch": 0.5330388247809458, "grad_norm": 7.90625, "learning_rate": 2.3014351191632026e-05, "loss": 0.4464900016784668, "mean_token_accuracy": 0.886394377052784, "num_tokens": 67096524.0, "step": 32820 }, { "entropy": 0.5560731885954737, "epoch": 0.5332012375855713, "grad_norm": 7.875, "learning_rate": 2.3001426066215463e-05, "loss": 0.5633484363555908, "mean_token_accuracy": 0.8631261631846427, "num_tokens": 67118200.0, "step": 32830 }, { "entropy": 0.5145490691997111, "epoch": 0.5333636503901967, "grad_norm": 7.71875, "learning_rate": 2.2988501478419775e-05, "loss": 0.4940930366516113, "mean_token_accuracy": 0.8738794352859258, "num_tokens": 67138452.0, "step": 32840 }, { "entropy": 0.5695694834925235, "epoch": 0.5335260631948223, "grad_norm": 7.21875, "learning_rate": 2.297557743172171e-05, "loss": 0.5532413959503174, "mean_token_accuracy": 0.8605085492134095, "num_tokens": 67160100.0, "step": 32850 }, { "entropy": 0.5626272991299629, "epoch": 0.5336884759994478, "grad_norm": 6.1875, "learning_rate": 2.296265392959787e-05, "loss": 0.5708122253417969, "mean_token_accuracy": 0.861725141108036, "num_tokens": 67180290.0, "step": 32860 }, { "entropy": 0.538824743963778, "epoch": 0.5338508888040733, "grad_norm": 6.8125, "learning_rate": 2.294973097552469e-05, "loss": 0.5272441864013672, "mean_token_accuracy": 0.86572335511446, "num_tokens": 67201461.0, "step": 32870 }, { "entropy": 0.514518678188324, "epoch": 0.5340133016086989, "grad_norm": 6.3125, "learning_rate": 2.2936808572978492e-05, "loss": 0.4908015251159668, "mean_token_accuracy": 0.8665127895772458, "num_tokens": 67222450.0, "step": 32880 }, { "entropy": 0.5197007052600384, "epoch": 0.5341757144133243, "grad_norm": 7.15625, "learning_rate": 2.2923886725435433e-05, "loss": 0.5046964645385742, "mean_token_accuracy": 0.8710944265127182, "num_tokens": 67241686.0, "step": 32890 }, { "entropy": 0.5433647131547332, "epoch": 0.5343381272179498, "grad_norm": 9.875, "learning_rate": 2.2910965436371502e-05, "loss": 0.5563732147216797, "mean_token_accuracy": 0.861873684078455, "num_tokens": 67262403.0, "step": 32900 }, { "entropy": 0.5445385276339948, "epoch": 0.5345005400225754, "grad_norm": 11.5625, "learning_rate": 2.289804470926257e-05, "loss": 0.59857177734375, "mean_token_accuracy": 0.8586912170052529, "num_tokens": 67283407.0, "step": 32910 }, { "entropy": 0.5489644240122289, "epoch": 0.5346629528272009, "grad_norm": 9.25, "learning_rate": 2.288512454758432e-05, "loss": 0.5666347980499268, "mean_token_accuracy": 0.8678211003541947, "num_tokens": 67302719.0, "step": 32920 }, { "entropy": 0.5456996961496771, "epoch": 0.5348253656318264, "grad_norm": 8.875, "learning_rate": 2.2872204954812332e-05, "loss": 0.5822239398956299, "mean_token_accuracy": 0.8573476634919643, "num_tokens": 67323279.0, "step": 32930 }, { "entropy": 0.5652053585799877, "epoch": 0.534987778436452, "grad_norm": 7.03125, "learning_rate": 2.2859285934421996e-05, "loss": 0.5865334033966064, "mean_token_accuracy": 0.8632900461554527, "num_tokens": 67344229.0, "step": 32940 }, { "entropy": 0.46165919820778073, "epoch": 0.5351501912410774, "grad_norm": 9.125, "learning_rate": 2.2846367489888544e-05, "loss": 0.44862751960754393, "mean_token_accuracy": 0.8846436686813831, "num_tokens": 67365004.0, "step": 32950 }, { "entropy": 0.5541324409656226, "epoch": 0.5353126040457029, "grad_norm": 12.125, "learning_rate": 2.2833449624687078e-05, "loss": 0.5242507934570313, "mean_token_accuracy": 0.8652288518846035, "num_tokens": 67386889.0, "step": 32960 }, { "entropy": 0.5944210954941809, "epoch": 0.5354750168503285, "grad_norm": 9.4375, "learning_rate": 2.2820532342292547e-05, "loss": 0.6086171627044678, "mean_token_accuracy": 0.8493060059845448, "num_tokens": 67407297.0, "step": 32970 }, { "entropy": 0.5019004900241271, "epoch": 0.535637429654954, "grad_norm": 9.5625, "learning_rate": 2.2807615646179697e-05, "loss": 0.46617608070373534, "mean_token_accuracy": 0.8732406802475452, "num_tokens": 67427997.0, "step": 32980 }, { "entropy": 0.5707862267270685, "epoch": 0.5357998424595796, "grad_norm": 6.65625, "learning_rate": 2.279469953982317e-05, "loss": 0.6045993804931641, "mean_token_accuracy": 0.8481650006026029, "num_tokens": 67450231.0, "step": 32990 }, { "entropy": 0.4815137625904754, "epoch": 0.535962255264205, "grad_norm": 8.8125, "learning_rate": 2.2781784026697427e-05, "loss": 0.49737749099731443, "mean_token_accuracy": 0.8748418495059014, "num_tokens": 67472258.0, "step": 33000 }, { "entropy": 0.4480097529478371, "epoch": 0.5361246680688305, "grad_norm": 5.28125, "learning_rate": 2.2768869110276764e-05, "loss": 0.3788824319839478, "mean_token_accuracy": 0.8982210613787174, "num_tokens": 67492073.0, "step": 33010 }, { "entropy": 0.45280841409694406, "epoch": 0.5362870808734561, "grad_norm": 7.28125, "learning_rate": 2.2755954794035327e-05, "loss": 0.46574993133544923, "mean_token_accuracy": 0.8809876352548599, "num_tokens": 67512778.0, "step": 33020 }, { "entropy": 0.517536657396704, "epoch": 0.5364494936780816, "grad_norm": 6.90625, "learning_rate": 2.2743041081447088e-05, "loss": 0.5407838821411133, "mean_token_accuracy": 0.8746400058269501, "num_tokens": 67533897.0, "step": 33030 }, { "entropy": 0.580740409810096, "epoch": 0.5366119064827071, "grad_norm": 9.4375, "learning_rate": 2.2730127975985868e-05, "loss": 0.5848737716674804, "mean_token_accuracy": 0.8543719828128815, "num_tokens": 67554717.0, "step": 33040 }, { "entropy": 0.5211548042949289, "epoch": 0.5367743192873327, "grad_norm": 4.34375, "learning_rate": 2.2717215481125333e-05, "loss": 0.5052491188049316, "mean_token_accuracy": 0.8700866349041462, "num_tokens": 67574665.0, "step": 33050 }, { "entropy": 0.49489269563928245, "epoch": 0.5369367320919581, "grad_norm": 14.0625, "learning_rate": 2.2704303600338962e-05, "loss": 0.49632997512817384, "mean_token_accuracy": 0.8713954783976078, "num_tokens": 67596493.0, "step": 33060 }, { "entropy": 0.4595108923036605, "epoch": 0.5370991448965836, "grad_norm": 9.125, "learning_rate": 2.269139233710007e-05, "loss": 0.4537147045135498, "mean_token_accuracy": 0.8804702654480934, "num_tokens": 67616283.0, "step": 33070 }, { "entropy": 0.5467124318587594, "epoch": 0.5372615577012092, "grad_norm": 7.21875, "learning_rate": 2.2678481694881843e-05, "loss": 0.5416676998138428, "mean_token_accuracy": 0.8634032782167196, "num_tokens": 67637740.0, "step": 33080 }, { "entropy": 0.4828449568711221, "epoch": 0.5374239705058347, "grad_norm": 8.8125, "learning_rate": 2.266557167715725e-05, "loss": 0.4983325958251953, "mean_token_accuracy": 0.8741713687777519, "num_tokens": 67659010.0, "step": 33090 }, { "entropy": 0.5056463782209903, "epoch": 0.5375863833104602, "grad_norm": 7.46875, "learning_rate": 2.265266228739912e-05, "loss": 0.5212023258209229, "mean_token_accuracy": 0.8703475572168827, "num_tokens": 67679648.0, "step": 33100 }, { "entropy": 0.5141458952799439, "epoch": 0.5377487961150857, "grad_norm": 8.1875, "learning_rate": 2.2639753529080117e-05, "loss": 0.5216042518615722, "mean_token_accuracy": 0.8696788311004638, "num_tokens": 67700601.0, "step": 33110 }, { "entropy": 0.5577704962808638, "epoch": 0.5379112089197112, "grad_norm": 7.6875, "learning_rate": 2.262684540567271e-05, "loss": 0.5485371589660645, "mean_token_accuracy": 0.8682889953255654, "num_tokens": 67722446.0, "step": 33120 }, { "entropy": 0.4419416519580409, "epoch": 0.5380736217243367, "grad_norm": 6.90625, "learning_rate": 2.2613937920649236e-05, "loss": 0.5068124771118164, "mean_token_accuracy": 0.873594519495964, "num_tokens": 67741980.0, "step": 33130 }, { "entropy": 0.47142268856987357, "epoch": 0.5382360345289623, "grad_norm": 8.5625, "learning_rate": 2.260103107748181e-05, "loss": 0.4757381916046143, "mean_token_accuracy": 0.8767985232174397, "num_tokens": 67762889.0, "step": 33140 }, { "entropy": 0.5141531300963834, "epoch": 0.5383984473335878, "grad_norm": 6.53125, "learning_rate": 2.258812487964242e-05, "loss": 0.5164625644683838, "mean_token_accuracy": 0.8741278141736984, "num_tokens": 67782869.0, "step": 33150 }, { "entropy": 0.4289492588490248, "epoch": 0.5385608601382132, "grad_norm": 11.25, "learning_rate": 2.257521933060286e-05, "loss": 0.4134061336517334, "mean_token_accuracy": 0.8899612694978714, "num_tokens": 67803858.0, "step": 33160 }, { "entropy": 0.47381586651317775, "epoch": 0.5387232729428388, "grad_norm": 13.5625, "learning_rate": 2.256231443383475e-05, "loss": 0.4945474147796631, "mean_token_accuracy": 0.8788340352475643, "num_tokens": 67824984.0, "step": 33170 }, { "entropy": 0.4264356805477291, "epoch": 0.5388856857474643, "grad_norm": 12.3125, "learning_rate": 2.2549410192809526e-05, "loss": 0.44061965942382814, "mean_token_accuracy": 0.8830974742770195, "num_tokens": 67843941.0, "step": 33180 }, { "entropy": 0.4913007877767086, "epoch": 0.5390480985520898, "grad_norm": 5.78125, "learning_rate": 2.253650661099848e-05, "loss": 0.4912854194641113, "mean_token_accuracy": 0.8743470579385757, "num_tokens": 67866012.0, "step": 33190 }, { "entropy": 0.5307337297592312, "epoch": 0.5392105113567154, "grad_norm": 10.125, "learning_rate": 2.2523603691872683e-05, "loss": 0.5261868476867676, "mean_token_accuracy": 0.8672286428511142, "num_tokens": 67885633.0, "step": 33200 }, { "entropy": 0.4887002401985228, "epoch": 0.5393729241613409, "grad_norm": 9.625, "learning_rate": 2.2510701438903068e-05, "loss": 0.503861379623413, "mean_token_accuracy": 0.8765039809048176, "num_tokens": 67905336.0, "step": 33210 }, { "entropy": 0.5051737172994762, "epoch": 0.5395353369659664, "grad_norm": 8.3125, "learning_rate": 2.2497799855560354e-05, "loss": 0.5371496677398682, "mean_token_accuracy": 0.8708290956914425, "num_tokens": 67926501.0, "step": 33220 }, { "entropy": 0.45476394777651874, "epoch": 0.5396977497705919, "grad_norm": 6.1875, "learning_rate": 2.2484898945315095e-05, "loss": 0.44231410026550294, "mean_token_accuracy": 0.8890948362648488, "num_tokens": 67947136.0, "step": 33230 }, { "entropy": 0.44398899832740424, "epoch": 0.5398601625752174, "grad_norm": 9.1875, "learning_rate": 2.2471998711637684e-05, "loss": 0.4634708881378174, "mean_token_accuracy": 0.8752835385501385, "num_tokens": 67966198.0, "step": 33240 }, { "entropy": 0.4963882165029645, "epoch": 0.540022575379843, "grad_norm": 8.3125, "learning_rate": 2.2459099157998296e-05, "loss": 0.5084300518035889, "mean_token_accuracy": 0.8769156686961651, "num_tokens": 67986407.0, "step": 33250 }, { "entropy": 0.47158871341962366, "epoch": 0.5401849881844685, "grad_norm": 8.3125, "learning_rate": 2.2446200287866944e-05, "loss": 0.46752400398254396, "mean_token_accuracy": 0.8747147388756276, "num_tokens": 68005869.0, "step": 33260 }, { "entropy": 0.49041389748454095, "epoch": 0.540347400989094, "grad_norm": 10.8125, "learning_rate": 2.2433302104713462e-05, "loss": 0.5097508907318116, "mean_token_accuracy": 0.873805795609951, "num_tokens": 68026202.0, "step": 33270 }, { "entropy": 0.474134402256459, "epoch": 0.5405098137937195, "grad_norm": 9.625, "learning_rate": 2.2420404612007468e-05, "loss": 0.4815934181213379, "mean_token_accuracy": 0.8758148342370987, "num_tokens": 68045893.0, "step": 33280 }, { "entropy": 0.49069400699809196, "epoch": 0.540672226598345, "grad_norm": 8.3125, "learning_rate": 2.2407507813218434e-05, "loss": 0.48001389503479003, "mean_token_accuracy": 0.8661003768444061, "num_tokens": 68066068.0, "step": 33290 }, { "entropy": 0.5716423511505127, "epoch": 0.5408346394029705, "grad_norm": 7.25, "learning_rate": 2.2394611711815634e-05, "loss": 0.5595417022705078, "mean_token_accuracy": 0.8686589658260345, "num_tokens": 68086944.0, "step": 33300 }, { "entropy": 0.5035804902901873, "epoch": 0.5409970522075961, "grad_norm": 7.0625, "learning_rate": 2.238171631126813e-05, "loss": 0.4869039535522461, "mean_token_accuracy": 0.8801019251346588, "num_tokens": 68107169.0, "step": 33310 }, { "entropy": 0.5052243522368371, "epoch": 0.5411594650122216, "grad_norm": 6.125, "learning_rate": 2.2368821615044832e-05, "loss": 0.5146710395812988, "mean_token_accuracy": 0.8662437550723553, "num_tokens": 68127610.0, "step": 33320 }, { "entropy": 0.41654260715004054, "epoch": 0.541321877816847, "grad_norm": 5.78125, "learning_rate": 2.2355927626614426e-05, "loss": 0.43950557708740234, "mean_token_accuracy": 0.8930185467004776, "num_tokens": 68147415.0, "step": 33330 }, { "entropy": 0.5206709966994822, "epoch": 0.5414842906214726, "grad_norm": 7.125, "learning_rate": 2.2343034349445423e-05, "loss": 0.5341089248657227, "mean_token_accuracy": 0.8702145893126726, "num_tokens": 68168517.0, "step": 33340 }, { "entropy": 0.5909528512042016, "epoch": 0.5416467034260981, "grad_norm": 9.1875, "learning_rate": 2.2330141787006165e-05, "loss": 0.6003854274749756, "mean_token_accuracy": 0.8529349848628044, "num_tokens": 68191697.0, "step": 33350 }, { "entropy": 0.5397138382773846, "epoch": 0.5418091162307236, "grad_norm": 7.25, "learning_rate": 2.2317249942764758e-05, "loss": 0.5493967533111572, "mean_token_accuracy": 0.8606333419680595, "num_tokens": 68212250.0, "step": 33360 }, { "entropy": 0.47205501173157244, "epoch": 0.5419715290353492, "grad_norm": 8.75, "learning_rate": 2.2304358820189146e-05, "loss": 0.4590886116027832, "mean_token_accuracy": 0.8820004306733609, "num_tokens": 68234249.0, "step": 33370 }, { "entropy": 0.48822519700042905, "epoch": 0.5421339418399747, "grad_norm": 9.9375, "learning_rate": 2.2291468422747077e-05, "loss": 0.4978174686431885, "mean_token_accuracy": 0.8755841057747602, "num_tokens": 68255569.0, "step": 33380 }, { "entropy": 0.46375337410718204, "epoch": 0.5422963546446001, "grad_norm": 10.5625, "learning_rate": 2.227857875390608e-05, "loss": 0.44492011070251464, "mean_token_accuracy": 0.8772645220160484, "num_tokens": 68276870.0, "step": 33390 }, { "entropy": 0.5155336276628077, "epoch": 0.5424587674492257, "grad_norm": 5.28125, "learning_rate": 2.2265689817133517e-05, "loss": 0.5314523220062256, "mean_token_accuracy": 0.8737161293625831, "num_tokens": 68297073.0, "step": 33400 }, { "entropy": 0.5359852105844766, "epoch": 0.5426211802538512, "grad_norm": 10.0625, "learning_rate": 2.2252801615896542e-05, "loss": 0.5427725315093994, "mean_token_accuracy": 0.8727028504014015, "num_tokens": 68317043.0, "step": 33410 }, { "entropy": 0.5307764233555645, "epoch": 0.5427835930584767, "grad_norm": 6.6875, "learning_rate": 2.2239914153662102e-05, "loss": 0.5087746620178223, "mean_token_accuracy": 0.8781487956643105, "num_tokens": 68337049.0, "step": 33420 }, { "entropy": 0.4663276055827737, "epoch": 0.5429460058631023, "grad_norm": 11.625, "learning_rate": 2.2227027433896967e-05, "loss": 0.5130875110626221, "mean_token_accuracy": 0.8678036965429783, "num_tokens": 68357111.0, "step": 33430 }, { "entropy": 0.4962276759557426, "epoch": 0.5431084186677277, "grad_norm": 6.5625, "learning_rate": 2.2214141460067667e-05, "loss": 0.5082298278808594, "mean_token_accuracy": 0.8749689199030399, "num_tokens": 68377983.0, "step": 33440 }, { "entropy": 0.44234788888134063, "epoch": 0.5432708314723533, "grad_norm": 9.25, "learning_rate": 2.220125623564058e-05, "loss": 0.43184924125671387, "mean_token_accuracy": 0.8864670112729073, "num_tokens": 68398507.0, "step": 33450 }, { "entropy": 0.4878842759877443, "epoch": 0.5434332442769788, "grad_norm": 8.9375, "learning_rate": 2.218837176408187e-05, "loss": 0.4968769073486328, "mean_token_accuracy": 0.8653305366635322, "num_tokens": 68418531.0, "step": 33460 }, { "entropy": 0.5374108772724867, "epoch": 0.5435956570816043, "grad_norm": 7.84375, "learning_rate": 2.2175488048857462e-05, "loss": 0.5138206958770752, "mean_token_accuracy": 0.8728295043110847, "num_tokens": 68439131.0, "step": 33470 }, { "entropy": 0.4325492143630981, "epoch": 0.5437580698862299, "grad_norm": 7.625, "learning_rate": 2.216260509343311e-05, "loss": 0.4399118423461914, "mean_token_accuracy": 0.8919104568660259, "num_tokens": 68458918.0, "step": 33480 }, { "entropy": 0.49625964760780333, "epoch": 0.5439204826908554, "grad_norm": 9.0, "learning_rate": 2.2149722901274382e-05, "loss": 0.5188203811645508, "mean_token_accuracy": 0.8696750447154045, "num_tokens": 68478584.0, "step": 33490 }, { "entropy": 0.46760306269861757, "epoch": 0.5440828954954808, "grad_norm": 5.9375, "learning_rate": 2.2136841475846586e-05, "loss": 0.4818405628204346, "mean_token_accuracy": 0.8756172627210617, "num_tokens": 68499434.0, "step": 33500 }, { "entropy": 0.5448808514280244, "epoch": 0.5442453083001064, "grad_norm": 7.65625, "learning_rate": 2.2123960820614875e-05, "loss": 0.5551241397857666, "mean_token_accuracy": 0.8585790652781725, "num_tokens": 68520045.0, "step": 33510 }, { "entropy": 0.48159954412840306, "epoch": 0.5444077211047319, "grad_norm": 12.25, "learning_rate": 2.2111080939044166e-05, "loss": 0.4752756118774414, "mean_token_accuracy": 0.8761787042021751, "num_tokens": 68541304.0, "step": 33520 }, { "entropy": 0.4943916528020054, "epoch": 0.5445701339093574, "grad_norm": 7.0, "learning_rate": 2.2098201834599172e-05, "loss": 0.5155853271484375, "mean_token_accuracy": 0.86746766269207, "num_tokens": 68561698.0, "step": 33530 }, { "entropy": 0.5340118791442364, "epoch": 0.544732546713983, "grad_norm": 13.1875, "learning_rate": 2.2085323510744414e-05, "loss": 0.5341507911682128, "mean_token_accuracy": 0.865185060352087, "num_tokens": 68581862.0, "step": 33540 }, { "entropy": 0.5048008145415224, "epoch": 0.5448949595186084, "grad_norm": 7.15625, "learning_rate": 2.2072445970944166e-05, "loss": 0.5080407142639161, "mean_token_accuracy": 0.8736014045774937, "num_tokens": 68603229.0, "step": 33550 }, { "entropy": 0.4910031044855714, "epoch": 0.5450573723232339, "grad_norm": 6.46875, "learning_rate": 2.205956921866254e-05, "loss": 0.4944744110107422, "mean_token_accuracy": 0.8780560486018658, "num_tokens": 68624069.0, "step": 33560 }, { "entropy": 0.5115315243136138, "epoch": 0.5452197851278595, "grad_norm": 6.90625, "learning_rate": 2.204669325736341e-05, "loss": 0.5151458263397217, "mean_token_accuracy": 0.8617636248469353, "num_tokens": 68644276.0, "step": 33570 }, { "entropy": 0.48581056750845164, "epoch": 0.545382197932485, "grad_norm": 7.09375, "learning_rate": 2.2033818090510422e-05, "loss": 0.5089701175689697, "mean_token_accuracy": 0.8723434753715992, "num_tokens": 68665579.0, "step": 33580 }, { "entropy": 0.4839793669525534, "epoch": 0.5455446107371105, "grad_norm": 4.75, "learning_rate": 2.202094372156703e-05, "loss": 0.5076016426086426, "mean_token_accuracy": 0.8720679119229316, "num_tokens": 68685170.0, "step": 33590 }, { "entropy": 0.5663524148985744, "epoch": 0.5457070235417361, "grad_norm": 6.96875, "learning_rate": 2.2008070153996483e-05, "loss": 0.5927314758300781, "mean_token_accuracy": 0.859750097990036, "num_tokens": 68705699.0, "step": 33600 }, { "entropy": 0.5428223856724799, "epoch": 0.5458694363463615, "grad_norm": 6.3125, "learning_rate": 2.1995197391261782e-05, "loss": 0.5632279872894287, "mean_token_accuracy": 0.8607417088001966, "num_tokens": 68726554.0, "step": 33610 }, { "entropy": 0.5287891311571002, "epoch": 0.546031849150987, "grad_norm": 7.40625, "learning_rate": 2.1982325436825743e-05, "loss": 0.5187876701354981, "mean_token_accuracy": 0.8670607775449752, "num_tokens": 68748173.0, "step": 33620 }, { "entropy": 0.5366115199401975, "epoch": 0.5461942619556126, "grad_norm": 7.09375, "learning_rate": 2.196945429415094e-05, "loss": 0.5440903663635254, "mean_token_accuracy": 0.8679592341184617, "num_tokens": 68770135.0, "step": 33630 }, { "entropy": 0.5490993307903409, "epoch": 0.5463566747602381, "grad_norm": 10.25, "learning_rate": 2.195658396669973e-05, "loss": 0.5862680435180664, "mean_token_accuracy": 0.8561960939317942, "num_tokens": 68790143.0, "step": 33640 }, { "entropy": 0.4596920091426, "epoch": 0.5465190875648636, "grad_norm": 7.84375, "learning_rate": 2.194371445793429e-05, "loss": 0.4475874900817871, "mean_token_accuracy": 0.8831777170300483, "num_tokens": 68809910.0, "step": 33650 }, { "entropy": 0.5676915866322816, "epoch": 0.5466815003694891, "grad_norm": 7.28125, "learning_rate": 2.193084577131652e-05, "loss": 0.5510447978973388, "mean_token_accuracy": 0.8659780111163855, "num_tokens": 68831340.0, "step": 33660 }, { "entropy": 0.5031451881397515, "epoch": 0.5468439131741146, "grad_norm": 13.125, "learning_rate": 2.1917977910308134e-05, "loss": 0.4976961612701416, "mean_token_accuracy": 0.8731383413076401, "num_tokens": 68852521.0, "step": 33670 }, { "entropy": 0.5082315989769995, "epoch": 0.5470063259787402, "grad_norm": 6.90625, "learning_rate": 2.1905110878370624e-05, "loss": 0.5394809722900391, "mean_token_accuracy": 0.881472185254097, "num_tokens": 68871990.0, "step": 33680 }, { "entropy": 0.5268838602583855, "epoch": 0.5471687387833657, "grad_norm": 8.0, "learning_rate": 2.1892244678965236e-05, "loss": 0.5325503349304199, "mean_token_accuracy": 0.8647225953638553, "num_tokens": 68891570.0, "step": 33690 }, { "entropy": 0.5486882321536541, "epoch": 0.5473311515879912, "grad_norm": 6.5, "learning_rate": 2.1879379315553022e-05, "loss": 0.5232158660888672, "mean_token_accuracy": 0.8633068993687629, "num_tokens": 68912236.0, "step": 33700 }, { "entropy": 0.5080272956751287, "epoch": 0.5474935643926168, "grad_norm": 11.5625, "learning_rate": 2.1866514791594776e-05, "loss": 0.5114031791687011, "mean_token_accuracy": 0.8697652652859688, "num_tokens": 68933295.0, "step": 33710 }, { "entropy": 0.520780862821266, "epoch": 0.5476559771972422, "grad_norm": 10.0625, "learning_rate": 2.1853651110551094e-05, "loss": 0.5365932941436767, "mean_token_accuracy": 0.8683645501732826, "num_tokens": 68954075.0, "step": 33720 }, { "entropy": 0.5485076494049281, "epoch": 0.5478183900018677, "grad_norm": 7.5625, "learning_rate": 2.184078827588234e-05, "loss": 0.5130879402160644, "mean_token_accuracy": 0.8693035677075386, "num_tokens": 68973666.0, "step": 33730 }, { "entropy": 0.40100018768571316, "epoch": 0.5479808028064933, "grad_norm": 7.40625, "learning_rate": 2.1827926291048638e-05, "loss": 0.3670509338378906, "mean_token_accuracy": 0.9048851899802685, "num_tokens": 68993260.0, "step": 33740 }, { "entropy": 0.5185030865948648, "epoch": 0.5481432156111188, "grad_norm": 8.25, "learning_rate": 2.1815065159509885e-05, "loss": 0.5452479362487793, "mean_token_accuracy": 0.8645625326782465, "num_tokens": 69014320.0, "step": 33750 }, { "entropy": 0.4520452327094972, "epoch": 0.5483056284157443, "grad_norm": 6.6875, "learning_rate": 2.180220488472577e-05, "loss": 0.4525897979736328, "mean_token_accuracy": 0.8847043149173259, "num_tokens": 69034069.0, "step": 33760 }, { "entropy": 0.4792000159155577, "epoch": 0.5484680412203699, "grad_norm": 5.8125, "learning_rate": 2.1789345470155725e-05, "loss": 0.47873744964599607, "mean_token_accuracy": 0.870918034017086, "num_tokens": 69054041.0, "step": 33770 }, { "entropy": 0.4692484918050468, "epoch": 0.5486304540249953, "grad_norm": 8.0, "learning_rate": 2.1776486919258965e-05, "loss": 0.4822674751281738, "mean_token_accuracy": 0.8736551456153393, "num_tokens": 69075049.0, "step": 33780 }, { "entropy": 0.5533133916556835, "epoch": 0.5487928668296208, "grad_norm": 9.75, "learning_rate": 2.176362923549447e-05, "loss": 0.599947452545166, "mean_token_accuracy": 0.8578931078314781, "num_tokens": 69095224.0, "step": 33790 }, { "entropy": 0.47489711875095963, "epoch": 0.5489552796342464, "grad_norm": 8.1875, "learning_rate": 2.1750772422320977e-05, "loss": 0.5112692832946777, "mean_token_accuracy": 0.8759594984352589, "num_tokens": 69115669.0, "step": 33800 }, { "entropy": 0.5247186324093491, "epoch": 0.5491176924388719, "grad_norm": 6.90625, "learning_rate": 2.1737916483197017e-05, "loss": 0.5539400100708007, "mean_token_accuracy": 0.860515919700265, "num_tokens": 69137870.0, "step": 33810 }, { "entropy": 0.45998743185773494, "epoch": 0.5492801052434974, "grad_norm": 9.25, "learning_rate": 2.172506142158084e-05, "loss": 0.44403390884399413, "mean_token_accuracy": 0.8863782770931721, "num_tokens": 69159243.0, "step": 33820 }, { "entropy": 0.4849973525851965, "epoch": 0.5494425180481229, "grad_norm": 6.8125, "learning_rate": 2.1712207240930507e-05, "loss": 0.4921281814575195, "mean_token_accuracy": 0.8784383341670037, "num_tokens": 69178783.0, "step": 33830 }, { "entropy": 0.459086738480255, "epoch": 0.5496049308527484, "grad_norm": 7.6875, "learning_rate": 2.169935394470382e-05, "loss": 0.4879415512084961, "mean_token_accuracy": 0.8805905781686306, "num_tokens": 69199069.0, "step": 33840 }, { "entropy": 0.5058258512523025, "epoch": 0.5497673436573739, "grad_norm": 6.96875, "learning_rate": 2.1686501536358334e-05, "loss": 0.5280792713165283, "mean_token_accuracy": 0.8809782069176435, "num_tokens": 69219119.0, "step": 33850 }, { "entropy": 0.507034054864198, "epoch": 0.5499297564619995, "grad_norm": 6.09375, "learning_rate": 2.1673650019351374e-05, "loss": 0.5133120059967041, "mean_token_accuracy": 0.8727388210594654, "num_tokens": 69239714.0, "step": 33860 }, { "entropy": 0.4960570607334375, "epoch": 0.550092169266625, "grad_norm": 5.46875, "learning_rate": 2.1660799397140045e-05, "loss": 0.4704521656036377, "mean_token_accuracy": 0.8823664113879204, "num_tokens": 69260074.0, "step": 33870 }, { "entropy": 0.523968976829201, "epoch": 0.5502545820712504, "grad_norm": 7.4375, "learning_rate": 2.164794967318118e-05, "loss": 0.5161651134490967, "mean_token_accuracy": 0.8688462004065514, "num_tokens": 69280491.0, "step": 33880 }, { "entropy": 0.4810294737573713, "epoch": 0.550416994875876, "grad_norm": 5.28125, "learning_rate": 2.1635100850931385e-05, "loss": 0.5014121055603027, "mean_token_accuracy": 0.870734129846096, "num_tokens": 69300322.0, "step": 33890 }, { "entropy": 0.4866638079751283, "epoch": 0.5505794076805015, "grad_norm": 7.28125, "learning_rate": 2.162225293384703e-05, "loss": 0.516301441192627, "mean_token_accuracy": 0.8712336659431458, "num_tokens": 69321225.0, "step": 33900 }, { "entropy": 0.5268201882019639, "epoch": 0.5507418204851271, "grad_norm": 8.5, "learning_rate": 2.1609405925384214e-05, "loss": 0.520289945602417, "mean_token_accuracy": 0.8740871854126453, "num_tokens": 69340836.0, "step": 33910 }, { "entropy": 0.47803408522158863, "epoch": 0.5509042332897526, "grad_norm": 6.84375, "learning_rate": 2.1596559828998837e-05, "loss": 0.45181875228881835, "mean_token_accuracy": 0.882061368227005, "num_tokens": 69361302.0, "step": 33920 }, { "entropy": 0.4712110889144242, "epoch": 0.551066646094378, "grad_norm": 5.9375, "learning_rate": 2.1583714648146504e-05, "loss": 0.44107418060302733, "mean_token_accuracy": 0.8868093475699425, "num_tokens": 69380602.0, "step": 33930 }, { "entropy": 0.502981933276169, "epoch": 0.5512290588990036, "grad_norm": 13.6875, "learning_rate": 2.1570870386282615e-05, "loss": 0.5006446361541748, "mean_token_accuracy": 0.8774623736739159, "num_tokens": 69399570.0, "step": 33940 }, { "entropy": 0.4921667458023876, "epoch": 0.5513914717036291, "grad_norm": 8.25, "learning_rate": 2.15580270468623e-05, "loss": 0.5033316135406494, "mean_token_accuracy": 0.8668560326099396, "num_tokens": 69418998.0, "step": 33950 }, { "entropy": 0.47964778216555715, "epoch": 0.5515538845082546, "grad_norm": 7.59375, "learning_rate": 2.1545184633340434e-05, "loss": 0.4808070659637451, "mean_token_accuracy": 0.882119120657444, "num_tokens": 69438662.0, "step": 33960 }, { "entropy": 0.43518576892092825, "epoch": 0.5517162973128802, "grad_norm": 11.1875, "learning_rate": 2.1532343149171675e-05, "loss": 0.4336407661437988, "mean_token_accuracy": 0.889134718477726, "num_tokens": 69458909.0, "step": 33970 }, { "entropy": 0.4329780153464526, "epoch": 0.5518787101175057, "grad_norm": 12.4375, "learning_rate": 2.1519502597810404e-05, "loss": 0.4519818782806396, "mean_token_accuracy": 0.8897483959794045, "num_tokens": 69479312.0, "step": 33980 }, { "entropy": 0.5104085814207793, "epoch": 0.5520411229221311, "grad_norm": 8.25, "learning_rate": 2.1506662982710747e-05, "loss": 0.5020429134368897, "mean_token_accuracy": 0.8746480740606785, "num_tokens": 69500181.0, "step": 33990 }, { "entropy": 0.47903393004089595, "epoch": 0.5522035357267567, "grad_norm": 7.9375, "learning_rate": 2.149382430732661e-05, "loss": 0.46356797218322754, "mean_token_accuracy": 0.8766411602497101, "num_tokens": 69520889.0, "step": 34000 }, { "entropy": 0.4973522378131747, "epoch": 0.5523659485313822, "grad_norm": 8.625, "learning_rate": 2.1480986575111605e-05, "loss": 0.49213075637817383, "mean_token_accuracy": 0.8718222737312317, "num_tokens": 69541367.0, "step": 34010 }, { "entropy": 0.4829199007712305, "epoch": 0.5525283613360077, "grad_norm": 11.4375, "learning_rate": 2.1468149789519118e-05, "loss": 0.45187668800354003, "mean_token_accuracy": 0.8809490002691746, "num_tokens": 69561008.0, "step": 34020 }, { "entropy": 0.425837971130386, "epoch": 0.5526907741406333, "grad_norm": 9.0, "learning_rate": 2.1455313954002285e-05, "loss": 0.44309382438659667, "mean_token_accuracy": 0.888883751630783, "num_tokens": 69581900.0, "step": 34030 }, { "entropy": 0.4946030925028026, "epoch": 0.5528531869452588, "grad_norm": 9.75, "learning_rate": 2.1442479072013958e-05, "loss": 0.5483765125274658, "mean_token_accuracy": 0.8593298442661762, "num_tokens": 69602478.0, "step": 34040 }, { "entropy": 0.5531061929184944, "epoch": 0.5530155997498842, "grad_norm": 9.0, "learning_rate": 2.1429645147006754e-05, "loss": 0.5781039714813232, "mean_token_accuracy": 0.8600262388586998, "num_tokens": 69623401.0, "step": 34050 }, { "entropy": 0.4687629329040647, "epoch": 0.5531780125545098, "grad_norm": 6.5625, "learning_rate": 2.1416812182433035e-05, "loss": 0.44787936210632323, "mean_token_accuracy": 0.8818682730197906, "num_tokens": 69642663.0, "step": 34060 }, { "entropy": 0.501962796645239, "epoch": 0.5533404253591353, "grad_norm": 6.09375, "learning_rate": 2.140398018174488e-05, "loss": 0.49068689346313477, "mean_token_accuracy": 0.8727966424077749, "num_tokens": 69661937.0, "step": 34070 }, { "entropy": 0.44825147041119634, "epoch": 0.5535028381637608, "grad_norm": 6.84375, "learning_rate": 2.1391149148394148e-05, "loss": 0.46203007698059084, "mean_token_accuracy": 0.8813515804708004, "num_tokens": 69683161.0, "step": 34080 }, { "entropy": 0.45110149746760725, "epoch": 0.5536652509683864, "grad_norm": 4.0, "learning_rate": 2.137831908583241e-05, "loss": 0.4494613170623779, "mean_token_accuracy": 0.8835438802838326, "num_tokens": 69703800.0, "step": 34090 }, { "entropy": 0.4750289857387543, "epoch": 0.5538276637730118, "grad_norm": 7.78125, "learning_rate": 2.1365489997510967e-05, "loss": 0.44250850677490233, "mean_token_accuracy": 0.8751864179968833, "num_tokens": 69723797.0, "step": 34100 }, { "entropy": 0.4391176711767912, "epoch": 0.5539900765776374, "grad_norm": 9.5625, "learning_rate": 2.1352661886880894e-05, "loss": 0.43527789115905763, "mean_token_accuracy": 0.8833812512457371, "num_tokens": 69743336.0, "step": 34110 }, { "entropy": 0.5042473228182643, "epoch": 0.5541524893822629, "grad_norm": 6.15625, "learning_rate": 2.1339834757392953e-05, "loss": 0.5285406112670898, "mean_token_accuracy": 0.8727432809770107, "num_tokens": 69763830.0, "step": 34120 }, { "entropy": 0.4043325950391591, "epoch": 0.5543149021868884, "grad_norm": 9.1875, "learning_rate": 2.13270086124977e-05, "loss": 0.3670841455459595, "mean_token_accuracy": 0.901578602194786, "num_tokens": 69783525.0, "step": 34130 }, { "entropy": 0.5282034748466685, "epoch": 0.554477314991514, "grad_norm": 7.28125, "learning_rate": 2.1314183455645386e-05, "loss": 0.5173911094665528, "mean_token_accuracy": 0.8635507769882679, "num_tokens": 69804212.0, "step": 34140 }, { "entropy": 0.4405926693230867, "epoch": 0.5546397277961395, "grad_norm": 9.4375, "learning_rate": 2.1301359290286e-05, "loss": 0.4537059783935547, "mean_token_accuracy": 0.8873001031577588, "num_tokens": 69823011.0, "step": 34150 }, { "entropy": 0.533292758371681, "epoch": 0.5548021406007649, "grad_norm": 8.625, "learning_rate": 2.1288536119869273e-05, "loss": 0.5358974933624268, "mean_token_accuracy": 0.8623500406742096, "num_tokens": 69844624.0, "step": 34160 }, { "entropy": 0.5525579012464732, "epoch": 0.5549645534053905, "grad_norm": 7.09375, "learning_rate": 2.127571394784469e-05, "loss": 0.5271025657653808, "mean_token_accuracy": 0.8684543140232563, "num_tokens": 69864762.0, "step": 34170 }, { "entropy": 0.5145470515359193, "epoch": 0.555126966210016, "grad_norm": 13.6875, "learning_rate": 2.1262892777661404e-05, "loss": 0.5839977264404297, "mean_token_accuracy": 0.8599419817328453, "num_tokens": 69885383.0, "step": 34180 }, { "entropy": 0.45715162423439326, "epoch": 0.5552893790146415, "grad_norm": 12.0, "learning_rate": 2.125007261276837e-05, "loss": 0.4776647090911865, "mean_token_accuracy": 0.8766120292246342, "num_tokens": 69904977.0, "step": 34190 }, { "entropy": 0.5160606379155069, "epoch": 0.5554517918192671, "grad_norm": 12.375, "learning_rate": 2.1237253456614227e-05, "loss": 0.5432309627532959, "mean_token_accuracy": 0.8706870548427105, "num_tokens": 69925515.0, "step": 34200 }, { "entropy": 0.4255206938600168, "epoch": 0.5556142046238925, "grad_norm": 6.90625, "learning_rate": 2.122443531264736e-05, "loss": 0.45685949325561526, "mean_token_accuracy": 0.883085048943758, "num_tokens": 69946226.0, "step": 34210 }, { "entropy": 0.4560190875083208, "epoch": 0.555776617428518, "grad_norm": 5.5625, "learning_rate": 2.1211618184315885e-05, "loss": 0.4478724479675293, "mean_token_accuracy": 0.8852220684289932, "num_tokens": 69966852.0, "step": 34220 }, { "entropy": 0.44994520633481444, "epoch": 0.5559390302331436, "grad_norm": 9.375, "learning_rate": 2.1198802075067624e-05, "loss": 0.4342986583709717, "mean_token_accuracy": 0.8882243476808072, "num_tokens": 69987177.0, "step": 34230 }, { "entropy": 0.49745861971750854, "epoch": 0.5561014430377691, "grad_norm": 7.625, "learning_rate": 2.1185986988350147e-05, "loss": 0.5224419116973877, "mean_token_accuracy": 0.8665642373263835, "num_tokens": 70007261.0, "step": 34240 }, { "entropy": 0.5065399416722357, "epoch": 0.5562638558423946, "grad_norm": 8.8125, "learning_rate": 2.117317292761075e-05, "loss": 0.5284903049468994, "mean_token_accuracy": 0.8648033283650876, "num_tokens": 70026609.0, "step": 34250 }, { "entropy": 0.4760451527312398, "epoch": 0.5564262686470202, "grad_norm": 8.6875, "learning_rate": 2.116035989629643e-05, "loss": 0.5072333335876464, "mean_token_accuracy": 0.8727751493453979, "num_tokens": 70047018.0, "step": 34260 }, { "entropy": 0.482893331348896, "epoch": 0.5565886814516456, "grad_norm": 6.90625, "learning_rate": 2.1147547897853924e-05, "loss": 0.5377142429351807, "mean_token_accuracy": 0.8681183196604252, "num_tokens": 70067879.0, "step": 34270 }, { "entropy": 0.5108528202166781, "epoch": 0.5567510942562711, "grad_norm": 9.3125, "learning_rate": 2.11347369357297e-05, "loss": 0.4921539306640625, "mean_token_accuracy": 0.8748038411140442, "num_tokens": 70088165.0, "step": 34280 }, { "entropy": 0.5154920598259196, "epoch": 0.5569135070608967, "grad_norm": 6.6875, "learning_rate": 2.1121927013369923e-05, "loss": 0.5216649055480957, "mean_token_accuracy": 0.8720419008284808, "num_tokens": 70109038.0, "step": 34290 }, { "entropy": 0.5074167178012431, "epoch": 0.5570759198655222, "grad_norm": 7.9375, "learning_rate": 2.1109118134220495e-05, "loss": 0.5181425094604493, "mean_token_accuracy": 0.8697020083665847, "num_tokens": 70129164.0, "step": 34300 }, { "entropy": 0.4884337204508483, "epoch": 0.5572383326701477, "grad_norm": 9.4375, "learning_rate": 2.1096310301727035e-05, "loss": 0.46446948051452636, "mean_token_accuracy": 0.8758760750293731, "num_tokens": 70149233.0, "step": 34310 }, { "entropy": 0.5107352879829705, "epoch": 0.5574007454747733, "grad_norm": 4.84375, "learning_rate": 2.1083503519334867e-05, "loss": 0.48760204315185546, "mean_token_accuracy": 0.8766903355717659, "num_tokens": 70169796.0, "step": 34320 }, { "entropy": 0.47839214936830105, "epoch": 0.5575631582793987, "grad_norm": 14.9375, "learning_rate": 2.107069779048907e-05, "loss": 0.4767155647277832, "mean_token_accuracy": 0.8806215837597847, "num_tokens": 70191282.0, "step": 34330 }, { "entropy": 0.46691877890843897, "epoch": 0.5577255710840243, "grad_norm": 7.28125, "learning_rate": 2.1057893118634382e-05, "loss": 0.48032350540161134, "mean_token_accuracy": 0.8726262830197811, "num_tokens": 70212136.0, "step": 34340 }, { "entropy": 0.46525451326742767, "epoch": 0.5578879838886498, "grad_norm": 5.5625, "learning_rate": 2.1045089507215312e-05, "loss": 0.4670886993408203, "mean_token_accuracy": 0.8801200285553932, "num_tokens": 70232730.0, "step": 34350 }, { "entropy": 0.515624888241291, "epoch": 0.5580503966932753, "grad_norm": 9.125, "learning_rate": 2.1032286959676058e-05, "loss": 0.5364349842071533, "mean_token_accuracy": 0.865925046056509, "num_tokens": 70253482.0, "step": 34360 }, { "entropy": 0.5046710526105016, "epoch": 0.5582128094979009, "grad_norm": 7.5, "learning_rate": 2.101948547946052e-05, "loss": 0.5447606086730957, "mean_token_accuracy": 0.8708166740834713, "num_tokens": 70273913.0, "step": 34370 }, { "entropy": 0.4832702114712447, "epoch": 0.5583752223025263, "grad_norm": 7.78125, "learning_rate": 2.1006685070012334e-05, "loss": 0.4952534198760986, "mean_token_accuracy": 0.8793291226029396, "num_tokens": 70294916.0, "step": 34380 }, { "entropy": 0.447965563647449, "epoch": 0.5585376351071518, "grad_norm": 10.1875, "learning_rate": 2.0993885734774842e-05, "loss": 0.45066261291503906, "mean_token_accuracy": 0.8823843881487846, "num_tokens": 70315875.0, "step": 34390 }, { "entropy": 0.4531406541354954, "epoch": 0.5587000479117774, "grad_norm": 8.5625, "learning_rate": 2.098108747719109e-05, "loss": 0.43594064712524416, "mean_token_accuracy": 0.8798953130841255, "num_tokens": 70335888.0, "step": 34400 }, { "entropy": 0.49902948264498265, "epoch": 0.5588624607164029, "grad_norm": 7.84375, "learning_rate": 2.0968290300703845e-05, "loss": 0.49384756088256837, "mean_token_accuracy": 0.8716082014143467, "num_tokens": 70358155.0, "step": 34410 }, { "entropy": 0.5495085548842326, "epoch": 0.5590248735210284, "grad_norm": 10.1875, "learning_rate": 2.095549420875556e-05, "loss": 0.5554338455200195, "mean_token_accuracy": 0.8570383638143539, "num_tokens": 70377752.0, "step": 34420 }, { "entropy": 0.5181454066187143, "epoch": 0.559187286325654, "grad_norm": 8.875, "learning_rate": 2.094269920478842e-05, "loss": 0.494932222366333, "mean_token_accuracy": 0.8733607940375805, "num_tokens": 70398505.0, "step": 34430 }, { "entropy": 0.4953248830744997, "epoch": 0.5593496991302794, "grad_norm": 4.90625, "learning_rate": 2.0929905292244322e-05, "loss": 0.4984746932983398, "mean_token_accuracy": 0.8765162169933319, "num_tokens": 70418657.0, "step": 34440 }, { "entropy": 0.5314223393099382, "epoch": 0.5595121119349049, "grad_norm": 7.8125, "learning_rate": 2.091711247456484e-05, "loss": 0.5134416103363038, "mean_token_accuracy": 0.8746513843536377, "num_tokens": 70438831.0, "step": 34450 }, { "entropy": 0.5021224085241556, "epoch": 0.5596745247395305, "grad_norm": 6.65625, "learning_rate": 2.0904320755191283e-05, "loss": 0.50058012008667, "mean_token_accuracy": 0.869370809942484, "num_tokens": 70458054.0, "step": 34460 }, { "entropy": 0.48685859008692206, "epoch": 0.559836937544156, "grad_norm": 13.6875, "learning_rate": 2.089153013756465e-05, "loss": 0.5046381473541259, "mean_token_accuracy": 0.8752521492540837, "num_tokens": 70478965.0, "step": 34470 }, { "entropy": 0.4195751552004367, "epoch": 0.5599993503487815, "grad_norm": 7.625, "learning_rate": 2.0878740625125633e-05, "loss": 0.4254859447479248, "mean_token_accuracy": 0.8863438948988914, "num_tokens": 70499725.0, "step": 34480 }, { "entropy": 0.4875357083976269, "epoch": 0.560161763153407, "grad_norm": 6.40625, "learning_rate": 2.0865952221314664e-05, "loss": 0.49010448455810546, "mean_token_accuracy": 0.871698647737503, "num_tokens": 70521428.0, "step": 34490 }, { "entropy": 0.448056256538257, "epoch": 0.5603241759580325, "grad_norm": 8.4375, "learning_rate": 2.0853164929571822e-05, "loss": 0.4018381118774414, "mean_token_accuracy": 0.8886393658816815, "num_tokens": 70541418.0, "step": 34500 }, { "entropy": 0.5430981740355492, "epoch": 0.560486588762658, "grad_norm": 5.78125, "learning_rate": 2.0840378753336942e-05, "loss": 0.5877717494964599, "mean_token_accuracy": 0.8484640121459961, "num_tokens": 70562553.0, "step": 34510 }, { "entropy": 0.4600142488256097, "epoch": 0.5606490015672836, "grad_norm": 6.28125, "learning_rate": 2.0827593696049525e-05, "loss": 0.4282061100006104, "mean_token_accuracy": 0.8892242413014173, "num_tokens": 70582558.0, "step": 34520 }, { "entropy": 0.4776402392424643, "epoch": 0.5608114143719091, "grad_norm": 6.25, "learning_rate": 2.081480976114878e-05, "loss": 0.486096715927124, "mean_token_accuracy": 0.8741221770644187, "num_tokens": 70602900.0, "step": 34530 }, { "entropy": 0.48262185615021735, "epoch": 0.5609738271765345, "grad_norm": 12.4375, "learning_rate": 2.080202695207361e-05, "loss": 0.5496110916137695, "mean_token_accuracy": 0.8730777487158775, "num_tokens": 70623249.0, "step": 34540 }, { "entropy": 0.39689771803095936, "epoch": 0.5611362399811601, "grad_norm": 7.625, "learning_rate": 2.0789245272262638e-05, "loss": 0.3777339458465576, "mean_token_accuracy": 0.8984143860638142, "num_tokens": 70642381.0, "step": 34550 }, { "entropy": 0.49803549514617773, "epoch": 0.5612986527857856, "grad_norm": 7.875, "learning_rate": 2.0776464725154137e-05, "loss": 0.5172844409942627, "mean_token_accuracy": 0.8698162406682968, "num_tokens": 70663173.0, "step": 34560 }, { "entropy": 0.5323108837008477, "epoch": 0.5614610655904112, "grad_norm": 8.4375, "learning_rate": 2.076368531418612e-05, "loss": 0.5813912868499755, "mean_token_accuracy": 0.8548152774572373, "num_tokens": 70683330.0, "step": 34570 }, { "entropy": 0.5067643852438778, "epoch": 0.5616234783950367, "grad_norm": 6.09375, "learning_rate": 2.075090704279628e-05, "loss": 0.4940641403198242, "mean_token_accuracy": 0.8793788313865661, "num_tokens": 70703283.0, "step": 34580 }, { "entropy": 0.5791491781594231, "epoch": 0.5617858911996622, "grad_norm": 10.125, "learning_rate": 2.0738129914421987e-05, "loss": 0.5809484958648682, "mean_token_accuracy": 0.858603087067604, "num_tokens": 70723836.0, "step": 34590 }, { "entropy": 0.4569374238606542, "epoch": 0.5619483040042877, "grad_norm": 8.4375, "learning_rate": 2.072535393250033e-05, "loss": 0.4381058692932129, "mean_token_accuracy": 0.8907965552061796, "num_tokens": 70743963.0, "step": 34600 }, { "entropy": 0.5010301585076377, "epoch": 0.5621107168089132, "grad_norm": 8.8125, "learning_rate": 2.071257910046807e-05, "loss": 0.48470497131347656, "mean_token_accuracy": 0.8748321052640676, "num_tokens": 70763876.0, "step": 34610 }, { "entropy": 0.5651604687795043, "epoch": 0.5622731296135387, "grad_norm": 6.875, "learning_rate": 2.069980542176167e-05, "loss": 0.5963554859161377, "mean_token_accuracy": 0.8573240779340268, "num_tokens": 70785318.0, "step": 34620 }, { "entropy": 0.47854647524654864, "epoch": 0.5624355424181643, "grad_norm": 6.0, "learning_rate": 2.0687032899817277e-05, "loss": 0.49874148368835447, "mean_token_accuracy": 0.881337983906269, "num_tokens": 70806107.0, "step": 34630 }, { "entropy": 0.4789683695882559, "epoch": 0.5625979552227898, "grad_norm": 9.375, "learning_rate": 2.0674261538070717e-05, "loss": 0.5007937908172607, "mean_token_accuracy": 0.8765693627297878, "num_tokens": 70826906.0, "step": 34640 }, { "entropy": 0.4771538968663663, "epoch": 0.5627603680274152, "grad_norm": 3.78125, "learning_rate": 2.0661491339957528e-05, "loss": 0.4639010429382324, "mean_token_accuracy": 0.8857994571328163, "num_tokens": 70847464.0, "step": 34650 }, { "entropy": 0.499520261446014, "epoch": 0.5629227808320408, "grad_norm": 9.875, "learning_rate": 2.0648722308912927e-05, "loss": 0.4947873592376709, "mean_token_accuracy": 0.8731232985854149, "num_tokens": 70867012.0, "step": 34660 }, { "entropy": 0.49294444895349443, "epoch": 0.5630851936366663, "grad_norm": 8.125, "learning_rate": 2.0635954448371796e-05, "loss": 0.4743643760681152, "mean_token_accuracy": 0.8843513838946819, "num_tokens": 70886604.0, "step": 34670 }, { "entropy": 0.4815678860293701, "epoch": 0.5632476064412918, "grad_norm": 13.6875, "learning_rate": 2.0623187761768734e-05, "loss": 0.49619135856628416, "mean_token_accuracy": 0.8789019376039505, "num_tokens": 70907758.0, "step": 34680 }, { "entropy": 0.42690492630936205, "epoch": 0.5634100192459174, "grad_norm": 9.25, "learning_rate": 2.0610422252537996e-05, "loss": 0.42781615257263184, "mean_token_accuracy": 0.8851472303271294, "num_tokens": 70927292.0, "step": 34690 }, { "entropy": 0.4761223338311538, "epoch": 0.5635724320505429, "grad_norm": 9.6875, "learning_rate": 2.0597657924113528e-05, "loss": 0.4773038387298584, "mean_token_accuracy": 0.8756697084754705, "num_tokens": 70947417.0, "step": 34700 }, { "entropy": 0.6108558603562415, "epoch": 0.5637348448551683, "grad_norm": 6.1875, "learning_rate": 2.0584894779928985e-05, "loss": 0.6215550422668457, "mean_token_accuracy": 0.8545157637447118, "num_tokens": 70969063.0, "step": 34710 }, { "entropy": 0.45702446419745685, "epoch": 0.5638972576597939, "grad_norm": 7.96875, "learning_rate": 2.0572132823417662e-05, "loss": 0.46111421585083007, "mean_token_accuracy": 0.8747239202260971, "num_tokens": 70988585.0, "step": 34720 }, { "entropy": 0.4605277282302268, "epoch": 0.5640596704644194, "grad_norm": 8.25, "learning_rate": 2.055937205801256e-05, "loss": 0.4342050552368164, "mean_token_accuracy": 0.8870020620524883, "num_tokens": 71008208.0, "step": 34730 }, { "entropy": 0.4896334719378501, "epoch": 0.5642220832690449, "grad_norm": 10.6875, "learning_rate": 2.054661248714636e-05, "loss": 0.45511322021484374, "mean_token_accuracy": 0.8830964401364326, "num_tokens": 71028189.0, "step": 34740 }, { "entropy": 0.4962799789849669, "epoch": 0.5643844960736705, "grad_norm": 9.5625, "learning_rate": 2.05338541142514e-05, "loss": 0.5084120273590088, "mean_token_accuracy": 0.8721415407955646, "num_tokens": 71047824.0, "step": 34750 }, { "entropy": 0.45862949253059926, "epoch": 0.564546908878296, "grad_norm": 5.84375, "learning_rate": 2.0521096942759723e-05, "loss": 0.4405822277069092, "mean_token_accuracy": 0.8863287039101124, "num_tokens": 71068283.0, "step": 34760 }, { "entropy": 0.49449151852168144, "epoch": 0.5647093216829214, "grad_norm": 6.6875, "learning_rate": 2.0508340976103043e-05, "loss": 0.5077680110931396, "mean_token_accuracy": 0.8650071255862712, "num_tokens": 71088106.0, "step": 34770 }, { "entropy": 0.4664253987139091, "epoch": 0.564871734487547, "grad_norm": 6.875, "learning_rate": 2.0495586217712725e-05, "loss": 0.4763810634613037, "mean_token_accuracy": 0.8787409633398056, "num_tokens": 71107801.0, "step": 34780 }, { "entropy": 0.5265321785816923, "epoch": 0.5650341472921725, "grad_norm": 6.28125, "learning_rate": 2.0482832671019847e-05, "loss": 0.5626398086547851, "mean_token_accuracy": 0.8643428958952427, "num_tokens": 71128909.0, "step": 34790 }, { "entropy": 0.5055589692550712, "epoch": 0.5651965600967981, "grad_norm": 8.0625, "learning_rate": 2.047008033945512e-05, "loss": 0.502316665649414, "mean_token_accuracy": 0.8745052278041839, "num_tokens": 71149971.0, "step": 34800 }, { "entropy": 0.47698192845564336, "epoch": 0.5653589729014236, "grad_norm": 9.5, "learning_rate": 2.0457329226448967e-05, "loss": 0.5061979293823242, "mean_token_accuracy": 0.8723123468458652, "num_tokens": 71169525.0, "step": 34810 }, { "entropy": 0.4782237640582025, "epoch": 0.565521385706049, "grad_norm": 6.78125, "learning_rate": 2.0444579335431464e-05, "loss": 0.49452881813049315, "mean_token_accuracy": 0.8736629325896501, "num_tokens": 71189826.0, "step": 34820 }, { "entropy": 0.5603102063760161, "epoch": 0.5656837985106746, "grad_norm": 8.3125, "learning_rate": 2.043183066983236e-05, "loss": 0.5362167835235596, "mean_token_accuracy": 0.8641893390566111, "num_tokens": 71212809.0, "step": 34830 }, { "entropy": 0.47653927877545355, "epoch": 0.5658462113153001, "grad_norm": 7.78125, "learning_rate": 2.041908323308106e-05, "loss": 0.516403341293335, "mean_token_accuracy": 0.8692436680197716, "num_tokens": 71232661.0, "step": 34840 }, { "entropy": 0.4793540730141103, "epoch": 0.5660086241199256, "grad_norm": 6.625, "learning_rate": 2.040633702860668e-05, "loss": 0.454522705078125, "mean_token_accuracy": 0.8846742898225785, "num_tokens": 71253827.0, "step": 34850 }, { "entropy": 0.48299675539601594, "epoch": 0.5661710369245512, "grad_norm": 7.75, "learning_rate": 2.039359205983795e-05, "loss": 0.5054035186767578, "mean_token_accuracy": 0.8699159834533929, "num_tokens": 71274366.0, "step": 34860 }, { "entropy": 0.45336519037373363, "epoch": 0.5663334497291767, "grad_norm": 8.0, "learning_rate": 2.0380848330203314e-05, "loss": 0.3939234495162964, "mean_token_accuracy": 0.8970321334898472, "num_tokens": 71294116.0, "step": 34870 }, { "entropy": 0.5371098374482244, "epoch": 0.5664958625338021, "grad_norm": 11.75, "learning_rate": 2.0368105843130862e-05, "loss": 0.5254314422607422, "mean_token_accuracy": 0.8690562717616558, "num_tokens": 71314566.0, "step": 34880 }, { "entropy": 0.48186783902347086, "epoch": 0.5666582753384277, "grad_norm": 10.5625, "learning_rate": 2.0355364602048342e-05, "loss": 0.4568496227264404, "mean_token_accuracy": 0.8833194449543953, "num_tokens": 71334539.0, "step": 34890 }, { "entropy": 0.4095654758391902, "epoch": 0.5668206881430532, "grad_norm": 10.1875, "learning_rate": 2.034262461038319e-05, "loss": 0.40563116073608396, "mean_token_accuracy": 0.8931937098503113, "num_tokens": 71354976.0, "step": 34900 }, { "entropy": 0.44991155792959037, "epoch": 0.5669831009476787, "grad_norm": 8.0, "learning_rate": 2.0329885871562475e-05, "loss": 0.48073339462280273, "mean_token_accuracy": 0.8749138675630093, "num_tokens": 71377026.0, "step": 34910 }, { "entropy": 0.5136917638126761, "epoch": 0.5671455137523043, "grad_norm": 7.25, "learning_rate": 2.0317148389012956e-05, "loss": 0.5577004432678223, "mean_token_accuracy": 0.8620994292199612, "num_tokens": 71396577.0, "step": 34920 }, { "entropy": 0.4831500891596079, "epoch": 0.5673079265569297, "grad_norm": 5.25, "learning_rate": 2.0304412166161052e-05, "loss": 0.4902970790863037, "mean_token_accuracy": 0.8798348784446717, "num_tokens": 71417750.0, "step": 34930 }, { "entropy": 0.47617808654904364, "epoch": 0.5674703393615552, "grad_norm": 10.5625, "learning_rate": 2.0291677206432823e-05, "loss": 0.4725971698760986, "mean_token_accuracy": 0.8770605310797691, "num_tokens": 71439085.0, "step": 34940 }, { "entropy": 0.4150344125460833, "epoch": 0.5676327521661808, "grad_norm": 6.96875, "learning_rate": 2.0278943513254005e-05, "loss": 0.40584430694580076, "mean_token_accuracy": 0.8975309379398823, "num_tokens": 71457851.0, "step": 34950 }, { "entropy": 0.5292735514231026, "epoch": 0.5677951649708063, "grad_norm": 8.125, "learning_rate": 2.0266211090049996e-05, "loss": 0.5454298973083496, "mean_token_accuracy": 0.8667261973023415, "num_tokens": 71477803.0, "step": 34960 }, { "entropy": 0.5285453464370221, "epoch": 0.5679575777754318, "grad_norm": 8.5625, "learning_rate": 2.025347994024584e-05, "loss": 0.5311562538146972, "mean_token_accuracy": 0.867181496322155, "num_tokens": 71498260.0, "step": 34970 }, { "entropy": 0.43806261613499375, "epoch": 0.5681199905800574, "grad_norm": 5.9375, "learning_rate": 2.0240750067266255e-05, "loss": 0.448976993560791, "mean_token_accuracy": 0.8785400088876486, "num_tokens": 71519345.0, "step": 34980 }, { "entropy": 0.5054113526362926, "epoch": 0.5682824033846828, "grad_norm": 8.25, "learning_rate": 2.022802147453559e-05, "loss": 0.5149348258972168, "mean_token_accuracy": 0.8674313440918923, "num_tokens": 71540488.0, "step": 34990 }, { "entropy": 0.5302013392560184, "epoch": 0.5684448161893083, "grad_norm": 5.40625, "learning_rate": 2.0215294165477867e-05, "loss": 0.5469722747802734, "mean_token_accuracy": 0.8635726720094681, "num_tokens": 71563109.0, "step": 35000 }, { "entropy": 0.4694493652903475, "epoch": 0.5686072289939339, "grad_norm": 5.90625, "learning_rate": 2.020256814351678e-05, "loss": 0.4577460765838623, "mean_token_accuracy": 0.8836593680083752, "num_tokens": 71583247.0, "step": 35010 }, { "entropy": 0.4979432867374271, "epoch": 0.5687696417985594, "grad_norm": 9.5, "learning_rate": 2.0189843412075632e-05, "loss": 0.5117532253265381, "mean_token_accuracy": 0.8673950858414173, "num_tokens": 71603861.0, "step": 35020 }, { "entropy": 0.5268384081777185, "epoch": 0.568932054603185, "grad_norm": 8.5, "learning_rate": 2.0177119974577423e-05, "loss": 0.5456787586212158, "mean_token_accuracy": 0.8603182222694159, "num_tokens": 71624383.0, "step": 35030 }, { "entropy": 0.5225970756262541, "epoch": 0.5690944674078104, "grad_norm": 10.5625, "learning_rate": 2.0164397834444782e-05, "loss": 0.5266626834869385, "mean_token_accuracy": 0.868008466809988, "num_tokens": 71644111.0, "step": 35040 }, { "entropy": 0.48486509285867213, "epoch": 0.5692568802124359, "grad_norm": 6.84375, "learning_rate": 2.015167699509998e-05, "loss": 0.49770417213439944, "mean_token_accuracy": 0.8824911795556545, "num_tokens": 71664275.0, "step": 35050 }, { "entropy": 0.5637024248950183, "epoch": 0.5694192930170615, "grad_norm": 9.3125, "learning_rate": 2.0138957459964966e-05, "loss": 0.5851668357849121, "mean_token_accuracy": 0.8578349262475967, "num_tokens": 71685989.0, "step": 35060 }, { "entropy": 0.5482973799109458, "epoch": 0.569581705821687, "grad_norm": 9.0, "learning_rate": 2.012623923246133e-05, "loss": 0.5288400173187255, "mean_token_accuracy": 0.8677950225770473, "num_tokens": 71706896.0, "step": 35070 }, { "entropy": 0.5307497866917401, "epoch": 0.5697441186263125, "grad_norm": 7.625, "learning_rate": 2.0113522316010283e-05, "loss": 0.5533623695373535, "mean_token_accuracy": 0.8618308059871197, "num_tokens": 71727167.0, "step": 35080 }, { "entropy": 0.5067502087913454, "epoch": 0.5699065314309381, "grad_norm": 8.1875, "learning_rate": 2.010080671403272e-05, "loss": 0.49077458381652833, "mean_token_accuracy": 0.8750096470117569, "num_tokens": 71747153.0, "step": 35090 }, { "entropy": 0.508166627259925, "epoch": 0.5700689442355635, "grad_norm": 7.8125, "learning_rate": 2.0088092429949163e-05, "loss": 0.4806680679321289, "mean_token_accuracy": 0.8751934170722961, "num_tokens": 71768260.0, "step": 35100 }, { "entropy": 0.46800614716485145, "epoch": 0.570231357040189, "grad_norm": 9.1875, "learning_rate": 2.007537946717977e-05, "loss": 0.5247076034545899, "mean_token_accuracy": 0.8686347384005785, "num_tokens": 71789366.0, "step": 35110 }, { "entropy": 0.4788985221646726, "epoch": 0.5703937698448146, "grad_norm": 5.65625, "learning_rate": 2.0062667829144377e-05, "loss": 0.4638078689575195, "mean_token_accuracy": 0.8813885979354381, "num_tokens": 71810142.0, "step": 35120 }, { "entropy": 0.45482188570313153, "epoch": 0.5705561826494401, "grad_norm": 4.34375, "learning_rate": 2.0049957519262434e-05, "loss": 0.4294625759124756, "mean_token_accuracy": 0.8898667350411416, "num_tokens": 71830390.0, "step": 35130 }, { "entropy": 0.522005493263714, "epoch": 0.5707185954540656, "grad_norm": 10.0, "learning_rate": 2.0037248540953038e-05, "loss": 0.5120690345764161, "mean_token_accuracy": 0.8703705713152885, "num_tokens": 71852728.0, "step": 35140 }, { "entropy": 0.43475394051056354, "epoch": 0.5708810082586911, "grad_norm": 5.5625, "learning_rate": 2.0024540897634947e-05, "loss": 0.4568382740020752, "mean_token_accuracy": 0.8903486330062151, "num_tokens": 71872652.0, "step": 35150 }, { "entropy": 0.5192686026683078, "epoch": 0.5710434210633166, "grad_norm": 5.125, "learning_rate": 2.001183459272652e-05, "loss": 0.5284985542297364, "mean_token_accuracy": 0.8661310613155365, "num_tokens": 71893520.0, "step": 35160 }, { "entropy": 0.4849213314475492, "epoch": 0.5712058338679421, "grad_norm": 11.4375, "learning_rate": 1.9999129629645806e-05, "loss": 0.4959848880767822, "mean_token_accuracy": 0.8776094879955053, "num_tokens": 71913553.0, "step": 35170 }, { "entropy": 0.5057167560094967, "epoch": 0.5713682466725677, "grad_norm": 10.5625, "learning_rate": 1.998642601181047e-05, "loss": 0.5124267101287842, "mean_token_accuracy": 0.8666249215602875, "num_tokens": 71934676.0, "step": 35180 }, { "entropy": 0.5166067194426432, "epoch": 0.5715306594771932, "grad_norm": 11.8125, "learning_rate": 1.997372374263779e-05, "loss": 0.5389686584472656, "mean_token_accuracy": 0.865152994915843, "num_tokens": 71954271.0, "step": 35190 }, { "entropy": 0.4393458048463799, "epoch": 0.5716930722818186, "grad_norm": 8.0, "learning_rate": 1.9961022825544735e-05, "loss": 0.45366339683532714, "mean_token_accuracy": 0.8860217802226543, "num_tokens": 71973412.0, "step": 35200 }, { "entropy": 0.4900574030121788, "epoch": 0.5718554850864442, "grad_norm": 8.125, "learning_rate": 1.9948323263947853e-05, "loss": 0.48357267379760743, "mean_token_accuracy": 0.8728819444775582, "num_tokens": 71994229.0, "step": 35210 }, { "entropy": 0.4179455946199596, "epoch": 0.5720178978910697, "grad_norm": 5.28125, "learning_rate": 1.9935625061263356e-05, "loss": 0.44046435356140134, "mean_token_accuracy": 0.890372796356678, "num_tokens": 72013770.0, "step": 35220 }, { "entropy": 0.49527778872288764, "epoch": 0.5721803106956952, "grad_norm": 15.8125, "learning_rate": 1.9922928220907116e-05, "loss": 0.5227673530578614, "mean_token_accuracy": 0.8691906869411469, "num_tokens": 72034092.0, "step": 35230 }, { "entropy": 0.5062321400269866, "epoch": 0.5723427235003208, "grad_norm": 7.78125, "learning_rate": 1.991023274629459e-05, "loss": 0.5155374526977539, "mean_token_accuracy": 0.8683955699205399, "num_tokens": 72053333.0, "step": 35240 }, { "entropy": 0.4899992852238938, "epoch": 0.5725051363049463, "grad_norm": 8.5, "learning_rate": 1.989753864084089e-05, "loss": 0.5187952995300293, "mean_token_accuracy": 0.8693899199366569, "num_tokens": 72075098.0, "step": 35250 }, { "entropy": 0.4520259898621589, "epoch": 0.5726675491095718, "grad_norm": 11.0625, "learning_rate": 1.988484590796077e-05, "loss": 0.4368502140045166, "mean_token_accuracy": 0.8857277475297451, "num_tokens": 72094792.0, "step": 35260 }, { "entropy": 0.5363670466933399, "epoch": 0.5728299619141973, "grad_norm": 5.90625, "learning_rate": 1.9872154551068587e-05, "loss": 0.565367317199707, "mean_token_accuracy": 0.8561111085116864, "num_tokens": 72115364.0, "step": 35270 }, { "entropy": 0.47905132616870105, "epoch": 0.5729923747188228, "grad_norm": 9.3125, "learning_rate": 1.985946457357837e-05, "loss": 0.4833566665649414, "mean_token_accuracy": 0.8734516359865665, "num_tokens": 72135474.0, "step": 35280 }, { "entropy": 0.5327798760961742, "epoch": 0.5731547875234484, "grad_norm": 8.1875, "learning_rate": 1.9846775978903715e-05, "loss": 0.5180971145629882, "mean_token_accuracy": 0.8669820465147495, "num_tokens": 72154897.0, "step": 35290 }, { "entropy": 0.5559980712831021, "epoch": 0.5733172003280739, "grad_norm": 7.03125, "learning_rate": 1.983408877045791e-05, "loss": 0.5702974319458007, "mean_token_accuracy": 0.8580952174961567, "num_tokens": 72175256.0, "step": 35300 }, { "entropy": 0.5266974648460746, "epoch": 0.5734796131326994, "grad_norm": 8.625, "learning_rate": 1.982140295165384e-05, "loss": 0.5337141036987305, "mean_token_accuracy": 0.8667919367551804, "num_tokens": 72195687.0, "step": 35310 }, { "entropy": 0.5135111227631569, "epoch": 0.5736420259373249, "grad_norm": 6.8125, "learning_rate": 1.980871852590401e-05, "loss": 0.5278810501098633, "mean_token_accuracy": 0.8711406491696835, "num_tokens": 72216419.0, "step": 35320 }, { "entropy": 0.4720841435249895, "epoch": 0.5738044387419504, "grad_norm": 6.84375, "learning_rate": 1.979603549662056e-05, "loss": 0.4846165180206299, "mean_token_accuracy": 0.8822045281529427, "num_tokens": 72237783.0, "step": 35330 }, { "entropy": 0.44560605542501436, "epoch": 0.5739668515465759, "grad_norm": 7.6875, "learning_rate": 1.9783353867215265e-05, "loss": 0.43014960289001464, "mean_token_accuracy": 0.8870272479951382, "num_tokens": 72258499.0, "step": 35340 }, { "entropy": 0.545111465966329, "epoch": 0.5741292643512015, "grad_norm": 8.25, "learning_rate": 1.9770673641099498e-05, "loss": 0.5253788471221924, "mean_token_accuracy": 0.8628722935914993, "num_tokens": 72279692.0, "step": 35350 }, { "entropy": 0.4645933476276696, "epoch": 0.574291677155827, "grad_norm": 6.25, "learning_rate": 1.975799482168427e-05, "loss": 0.4438615322113037, "mean_token_accuracy": 0.8875696711242199, "num_tokens": 72299471.0, "step": 35360 }, { "entropy": 0.4763076829724014, "epoch": 0.5744540899604524, "grad_norm": 6.9375, "learning_rate": 1.974531741238023e-05, "loss": 0.48317227363586424, "mean_token_accuracy": 0.8727102398872375, "num_tokens": 72319585.0, "step": 35370 }, { "entropy": 0.4537927029421553, "epoch": 0.574616502765078, "grad_norm": 5.8125, "learning_rate": 1.97326414165976e-05, "loss": 0.4454843044281006, "mean_token_accuracy": 0.8842326655983925, "num_tokens": 72339531.0, "step": 35380 }, { "entropy": 0.518293599714525, "epoch": 0.5747789155697035, "grad_norm": 10.1875, "learning_rate": 1.9719966837746276e-05, "loss": 0.5239322662353516, "mean_token_accuracy": 0.8714905016124248, "num_tokens": 72359162.0, "step": 35390 }, { "entropy": 0.5017513856291771, "epoch": 0.574941328374329, "grad_norm": 5.625, "learning_rate": 1.970729367923573e-05, "loss": 0.4994038581848145, "mean_token_accuracy": 0.877447097748518, "num_tokens": 72380379.0, "step": 35400 }, { "entropy": 0.47544234625529497, "epoch": 0.5751037411789546, "grad_norm": 8.1875, "learning_rate": 1.969462194447509e-05, "loss": 0.49881682395935056, "mean_token_accuracy": 0.8745658576488495, "num_tokens": 72400727.0, "step": 35410 }, { "entropy": 0.394749592943117, "epoch": 0.57526615398358, "grad_norm": 10.25, "learning_rate": 1.9681951636873067e-05, "loss": 0.3541309118270874, "mean_token_accuracy": 0.9039084300398826, "num_tokens": 72420304.0, "step": 35420 }, { "entropy": 0.4846257843775675, "epoch": 0.5754285667882055, "grad_norm": 6.0625, "learning_rate": 1.9669282759837996e-05, "loss": 0.46775059700012206, "mean_token_accuracy": 0.878752438351512, "num_tokens": 72441385.0, "step": 35430 }, { "entropy": 0.512512823799625, "epoch": 0.5755909795928311, "grad_norm": 6.75, "learning_rate": 1.965661531677785e-05, "loss": 0.511643362045288, "mean_token_accuracy": 0.8738086454570293, "num_tokens": 72461314.0, "step": 35440 }, { "entropy": 0.47105136755853894, "epoch": 0.5757533923974566, "grad_norm": 13.0625, "learning_rate": 1.9643949311100193e-05, "loss": 0.49589967727661133, "mean_token_accuracy": 0.8749259889125824, "num_tokens": 72482582.0, "step": 35450 }, { "entropy": 0.5483934213174507, "epoch": 0.5759158052020822, "grad_norm": 7.59375, "learning_rate": 1.9631284746212207e-05, "loss": 0.5773508548736572, "mean_token_accuracy": 0.8603455200791359, "num_tokens": 72504052.0, "step": 35460 }, { "entropy": 0.4333242515102029, "epoch": 0.5760782180067077, "grad_norm": 7.6875, "learning_rate": 1.9618621625520695e-05, "loss": 0.4417896270751953, "mean_token_accuracy": 0.8854976907372475, "num_tokens": 72523657.0, "step": 35470 }, { "entropy": 0.5490050204098225, "epoch": 0.5762406308113331, "grad_norm": 8.875, "learning_rate": 1.9605959952432045e-05, "loss": 0.5026678085327149, "mean_token_accuracy": 0.8730398714542389, "num_tokens": 72545133.0, "step": 35480 }, { "entropy": 0.4752177944406867, "epoch": 0.5764030436159587, "grad_norm": 8.0625, "learning_rate": 1.95932997303523e-05, "loss": 0.4895893096923828, "mean_token_accuracy": 0.8736348383128643, "num_tokens": 72566157.0, "step": 35490 }, { "entropy": 0.47617207895964386, "epoch": 0.5765654564205842, "grad_norm": 8.875, "learning_rate": 1.958064096268708e-05, "loss": 0.5119708061218262, "mean_token_accuracy": 0.8702007882297039, "num_tokens": 72586335.0, "step": 35500 }, { "entropy": 0.485381368547678, "epoch": 0.5767278692252097, "grad_norm": 6.875, "learning_rate": 1.9567983652841618e-05, "loss": 0.5113878726959229, "mean_token_accuracy": 0.8741186879575252, "num_tokens": 72606460.0, "step": 35510 }, { "entropy": 0.46341732763685284, "epoch": 0.5768902820298353, "grad_norm": 8.375, "learning_rate": 1.9555327804220754e-05, "loss": 0.45360622406005857, "mean_token_accuracy": 0.8794531367719174, "num_tokens": 72627322.0, "step": 35520 }, { "entropy": 0.41934563680551945, "epoch": 0.5770526948344608, "grad_norm": 7.78125, "learning_rate": 1.9542673420228964e-05, "loss": 0.3949080228805542, "mean_token_accuracy": 0.8971073001623153, "num_tokens": 72646666.0, "step": 35530 }, { "entropy": 0.4801793386694044, "epoch": 0.5772151076390862, "grad_norm": 10.75, "learning_rate": 1.9530020504270273e-05, "loss": 0.48345298767089845, "mean_token_accuracy": 0.8773797497153282, "num_tokens": 72667594.0, "step": 35540 }, { "entropy": 0.49723189789801836, "epoch": 0.5773775204437118, "grad_norm": 6.375, "learning_rate": 1.9517369059748365e-05, "loss": 0.4977464199066162, "mean_token_accuracy": 0.8691658906638622, "num_tokens": 72688273.0, "step": 35550 }, { "entropy": 0.44376993768382816, "epoch": 0.5775399332483373, "grad_norm": 7.4375, "learning_rate": 1.9504719090066502e-05, "loss": 0.4893683910369873, "mean_token_accuracy": 0.8861746147274971, "num_tokens": 72708834.0, "step": 35560 }, { "entropy": 0.4419066194910556, "epoch": 0.5777023460529628, "grad_norm": 8.625, "learning_rate": 1.9492070598627553e-05, "loss": 0.4583296775817871, "mean_token_accuracy": 0.8798258394002915, "num_tokens": 72730356.0, "step": 35570 }, { "entropy": 0.5207978910300881, "epoch": 0.5778647588575884, "grad_norm": 6.59375, "learning_rate": 1.9479423588833996e-05, "loss": 0.5213712692260742, "mean_token_accuracy": 0.8730552222579717, "num_tokens": 72751759.0, "step": 35580 }, { "entropy": 0.47828973256982865, "epoch": 0.5780271716622138, "grad_norm": 11.125, "learning_rate": 1.9466778064087886e-05, "loss": 0.4969003200531006, "mean_token_accuracy": 0.8758047930896282, "num_tokens": 72773300.0, "step": 35590 }, { "entropy": 0.48286981508135796, "epoch": 0.5781895844668393, "grad_norm": 6.78125, "learning_rate": 1.945413402779092e-05, "loss": 0.4850332736968994, "mean_token_accuracy": 0.8762808255851269, "num_tokens": 72795365.0, "step": 35600 }, { "entropy": 0.5551985192578286, "epoch": 0.5783519972714649, "grad_norm": 8.5, "learning_rate": 1.944149148334437e-05, "loss": 0.5783005714416504, "mean_token_accuracy": 0.8668156832456588, "num_tokens": 72817101.0, "step": 35610 }, { "entropy": 0.47192288199439647, "epoch": 0.5785144100760904, "grad_norm": 6.9375, "learning_rate": 1.9428850434149098e-05, "loss": 0.43670010566711426, "mean_token_accuracy": 0.884991142898798, "num_tokens": 72838431.0, "step": 35620 }, { "entropy": 0.5473644613754004, "epoch": 0.5786768228807159, "grad_norm": 7.46875, "learning_rate": 1.9416210883605573e-05, "loss": 0.5788946151733398, "mean_token_accuracy": 0.8434464104473591, "num_tokens": 72859123.0, "step": 35630 }, { "entropy": 0.478962611919269, "epoch": 0.5788392356853415, "grad_norm": 9.125, "learning_rate": 1.940357283511388e-05, "loss": 0.5026509761810303, "mean_token_accuracy": 0.8742302693426609, "num_tokens": 72878970.0, "step": 35640 }, { "entropy": 0.5686134153744206, "epoch": 0.5790016484899669, "grad_norm": 8.3125, "learning_rate": 1.939093629207367e-05, "loss": 0.6010343551635742, "mean_token_accuracy": 0.8534506179392338, "num_tokens": 72898490.0, "step": 35650 }, { "entropy": 0.4544618075247854, "epoch": 0.5791640612945924, "grad_norm": 5.5625, "learning_rate": 1.9378301257884195e-05, "loss": 0.445522403717041, "mean_token_accuracy": 0.8852240912616253, "num_tokens": 72918567.0, "step": 35660 }, { "entropy": 0.4762196332740132, "epoch": 0.579326474099218, "grad_norm": 7.03125, "learning_rate": 1.936566773594433e-05, "loss": 0.46373400688171384, "mean_token_accuracy": 0.8773585550487042, "num_tokens": 72939852.0, "step": 35670 }, { "entropy": 0.5091265562921763, "epoch": 0.5794888869038435, "grad_norm": 7.71875, "learning_rate": 1.935303572965249e-05, "loss": 0.4906982421875, "mean_token_accuracy": 0.8700317494571209, "num_tokens": 72959350.0, "step": 35680 }, { "entropy": 0.4609913203399628, "epoch": 0.5796512997084691, "grad_norm": 8.0625, "learning_rate": 1.9340405242406744e-05, "loss": 0.48447117805480955, "mean_token_accuracy": 0.8790274687111378, "num_tokens": 72979708.0, "step": 35690 }, { "entropy": 0.4752211211249232, "epoch": 0.5798137125130945, "grad_norm": 8.3125, "learning_rate": 1.9327776277604694e-05, "loss": 0.5047016143798828, "mean_token_accuracy": 0.8818192154169082, "num_tokens": 73001174.0, "step": 35700 }, { "entropy": 0.5462072098860518, "epoch": 0.57997612531772, "grad_norm": 7.21875, "learning_rate": 1.931514883864358e-05, "loss": 0.5003799438476563, "mean_token_accuracy": 0.8733808405697345, "num_tokens": 73022151.0, "step": 35710 }, { "entropy": 0.4847595132421702, "epoch": 0.5801385381223456, "grad_norm": 8.75, "learning_rate": 1.9302522928920207e-05, "loss": 0.519412612915039, "mean_token_accuracy": 0.8738117277622223, "num_tokens": 73041597.0, "step": 35720 }, { "entropy": 0.42400085178669544, "epoch": 0.5803009509269711, "grad_norm": 6.21875, "learning_rate": 1.9289898551830965e-05, "loss": 0.4307117938995361, "mean_token_accuracy": 0.8873087473213672, "num_tokens": 73061173.0, "step": 35730 }, { "entropy": 0.46986113467719404, "epoch": 0.5804633637315966, "grad_norm": 11.0, "learning_rate": 1.927727571077184e-05, "loss": 0.5222992897033691, "mean_token_accuracy": 0.8686073735356331, "num_tokens": 73080682.0, "step": 35740 }, { "entropy": 0.5160985419293865, "epoch": 0.5806257765362222, "grad_norm": 7.1875, "learning_rate": 1.926465440913842e-05, "loss": 0.5411452293395996, "mean_token_accuracy": 0.8689249783754349, "num_tokens": 73101638.0, "step": 35750 }, { "entropy": 0.48366700068581847, "epoch": 0.5807881893408476, "grad_norm": 7.84375, "learning_rate": 1.925203465032585e-05, "loss": 0.48059887886047364, "mean_token_accuracy": 0.8789863005280495, "num_tokens": 73122320.0, "step": 35760 }, { "entropy": 0.48181718395790085, "epoch": 0.5809506021454731, "grad_norm": 11.3125, "learning_rate": 1.923941643772888e-05, "loss": 0.49228410720825194, "mean_token_accuracy": 0.8737196993082762, "num_tokens": 73142969.0, "step": 35770 }, { "entropy": 0.47220885392744094, "epoch": 0.5811130149500987, "grad_norm": 11.3125, "learning_rate": 1.922679977474183e-05, "loss": 0.49103217124938964, "mean_token_accuracy": 0.8732566699385643, "num_tokens": 73163397.0, "step": 35780 }, { "entropy": 0.49429815537296234, "epoch": 0.5812754277547242, "grad_norm": 7.4375, "learning_rate": 1.9214184664758612e-05, "loss": 0.5304154872894287, "mean_token_accuracy": 0.8679283633828163, "num_tokens": 73183166.0, "step": 35790 }, { "entropy": 0.49542769910767676, "epoch": 0.5814378405593497, "grad_norm": 7.6875, "learning_rate": 1.9201571111172732e-05, "loss": 0.5472351551055908, "mean_token_accuracy": 0.8648921579122544, "num_tokens": 73202664.0, "step": 35800 }, { "entropy": 0.41655356702394786, "epoch": 0.5816002533639753, "grad_norm": 4.875, "learning_rate": 1.918895911737724e-05, "loss": 0.387218976020813, "mean_token_accuracy": 0.8966086618602276, "num_tokens": 73221834.0, "step": 35810 }, { "entropy": 0.5333805223926902, "epoch": 0.5817626661686007, "grad_norm": 4.84375, "learning_rate": 1.9176348686764816e-05, "loss": 0.5333885669708252, "mean_token_accuracy": 0.8728076040744781, "num_tokens": 73242720.0, "step": 35820 }, { "entropy": 0.47388181819114833, "epoch": 0.5819250789732262, "grad_norm": 7.65625, "learning_rate": 1.9163739822727683e-05, "loss": 0.5109090805053711, "mean_token_accuracy": 0.8860897071659565, "num_tokens": 73263361.0, "step": 35830 }, { "entropy": 0.5140248330309987, "epoch": 0.5820874917778518, "grad_norm": 9.0, "learning_rate": 1.9151132528657645e-05, "loss": 0.4885869026184082, "mean_token_accuracy": 0.8726772665977478, "num_tokens": 73283738.0, "step": 35840 }, { "entropy": 0.45320728844963015, "epoch": 0.5822499045824773, "grad_norm": 8.4375, "learning_rate": 1.9138526807946105e-05, "loss": 0.4760264873504639, "mean_token_accuracy": 0.8808666363358497, "num_tokens": 73304230.0, "step": 35850 }, { "entropy": 0.4778599556419067, "epoch": 0.5824123173871028, "grad_norm": 11.1875, "learning_rate": 1.9125922663984034e-05, "loss": 0.4544682502746582, "mean_token_accuracy": 0.8863369505852461, "num_tokens": 73324292.0, "step": 35860 }, { "entropy": 0.4511441068025306, "epoch": 0.5825747301917283, "grad_norm": 7.9375, "learning_rate": 1.9113320100161965e-05, "loss": 0.463943338394165, "mean_token_accuracy": 0.8822577059268951, "num_tokens": 73344905.0, "step": 35870 }, { "entropy": 0.5073189568473027, "epoch": 0.5827371429963538, "grad_norm": 7.875, "learning_rate": 1.910071911987002e-05, "loss": 0.5422058582305909, "mean_token_accuracy": 0.8703247912228107, "num_tokens": 73365568.0, "step": 35880 }, { "entropy": 0.5112473953515291, "epoch": 0.5828995558009793, "grad_norm": 7.875, "learning_rate": 1.9088119726497882e-05, "loss": 0.5209843635559082, "mean_token_accuracy": 0.8778479151427746, "num_tokens": 73386129.0, "step": 35890 }, { "entropy": 0.4623198303859681, "epoch": 0.5830619686056049, "grad_norm": 8.6875, "learning_rate": 1.9075521923434822e-05, "loss": 0.42987847328186035, "mean_token_accuracy": 0.8828278444707394, "num_tokens": 73405946.0, "step": 35900 }, { "entropy": 0.4787001106888056, "epoch": 0.5832243814102304, "grad_norm": 6.53125, "learning_rate": 1.9062925714069688e-05, "loss": 0.4607100486755371, "mean_token_accuracy": 0.8803922191262246, "num_tokens": 73425701.0, "step": 35910 }, { "entropy": 0.4909517400432378, "epoch": 0.583386794214856, "grad_norm": 5.90625, "learning_rate": 1.9050331101790874e-05, "loss": 0.49463305473327634, "mean_token_accuracy": 0.8764684133231639, "num_tokens": 73446062.0, "step": 35920 }, { "entropy": 0.4801846581976861, "epoch": 0.5835492070194814, "grad_norm": 13.875, "learning_rate": 1.9037738089986368e-05, "loss": 0.48386492729187014, "mean_token_accuracy": 0.8831513248383999, "num_tokens": 73465983.0, "step": 35930 }, { "entropy": 0.44464865741319953, "epoch": 0.5837116198241069, "grad_norm": 10.25, "learning_rate": 1.9025146682043714e-05, "loss": 0.4053050994873047, "mean_token_accuracy": 0.8936971254646778, "num_tokens": 73486804.0, "step": 35940 }, { "entropy": 0.4627448882907629, "epoch": 0.5838740326287325, "grad_norm": 6.0625, "learning_rate": 1.9012556881350028e-05, "loss": 0.4583892822265625, "mean_token_accuracy": 0.8845570560544729, "num_tokens": 73508053.0, "step": 35950 }, { "entropy": 0.43732062744093125, "epoch": 0.584036445433358, "grad_norm": 4.59375, "learning_rate": 1.8999968691292008e-05, "loss": 0.418790864944458, "mean_token_accuracy": 0.8850777491927146, "num_tokens": 73526769.0, "step": 35960 }, { "entropy": 0.5147913709515706, "epoch": 0.5841988582379835, "grad_norm": 9.8125, "learning_rate": 1.898738211525588e-05, "loss": 0.49486594200134276, "mean_token_accuracy": 0.8699352584779263, "num_tokens": 73548090.0, "step": 35970 }, { "entropy": 0.4678251658566296, "epoch": 0.584361271042609, "grad_norm": 6.15625, "learning_rate": 1.8974797156627476e-05, "loss": 0.4651028633117676, "mean_token_accuracy": 0.8825579956173897, "num_tokens": 73566792.0, "step": 35980 }, { "entropy": 0.5122425441164523, "epoch": 0.5845236838472345, "grad_norm": 7.71875, "learning_rate": 1.8962213818792186e-05, "loss": 0.5353062152862549, "mean_token_accuracy": 0.8677972353994846, "num_tokens": 73588499.0, "step": 35990 }, { "epoch": 0.58468609665186, "eval_entropy": 0.5086739993989468, "eval_loss": 0.5173910856246948, "eval_mean_token_accuracy": 0.8680103075504303, "eval_num_tokens": 73608229.0, "eval_runtime": 40.4342, "eval_samples_per_second": 49.463, "eval_steps_per_second": 6.183, "step": 36000 } ], "logging_steps": 10, "max_steps": 61572, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 4000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 5.88763742720516e+18, "train_batch_size": 2, "trial_name": null, "trial_params": null }