{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 5.0, "eval_steps": 500, "global_step": 395, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.012658227848101266, "grad_norm": 2.261342763900757, "learning_rate": 0.0, "loss": 0.9274, "mean_token_accuracy": 0.8330742120742798, "num_tokens": 5210.0, "step": 1 }, { "epoch": 0.02531645569620253, "grad_norm": 2.449852466583252, "learning_rate": 1.6666666666666667e-05, "loss": 0.9839, "mean_token_accuracy": 0.8264493942260742, "num_tokens": 10552.0, "step": 2 }, { "epoch": 0.0379746835443038, "grad_norm": 2.1478281021118164, "learning_rate": 3.3333333333333335e-05, "loss": 0.8987, "mean_token_accuracy": 0.8358815312385559, "num_tokens": 15783.0, "step": 3 }, { "epoch": 0.05063291139240506, "grad_norm": 1.6363688707351685, "learning_rate": 5e-05, "loss": 0.7419, "mean_token_accuracy": 0.849078357219696, "num_tokens": 21055.0, "step": 4 }, { "epoch": 0.06329113924050633, "grad_norm": 1.1455320119857788, "learning_rate": 6.666666666666667e-05, "loss": 0.5762, "mean_token_accuracy": 0.8692193627357483, "num_tokens": 26525.0, "step": 5 }, { "epoch": 0.0759493670886076, "grad_norm": 0.8304877281188965, "learning_rate": 8.333333333333334e-05, "loss": 0.3965, "mean_token_accuracy": 0.9039722084999084, "num_tokens": 31775.0, "step": 6 }, { "epoch": 0.08860759493670886, "grad_norm": 0.6689921617507935, "learning_rate": 0.0001, "loss": 0.3648, "mean_token_accuracy": 0.901260495185852, "num_tokens": 37075.0, "step": 7 }, { "epoch": 0.10126582278481013, "grad_norm": 0.5956555008888245, "learning_rate": 0.00011666666666666668, "loss": 0.3464, "mean_token_accuracy": 0.9010356664657593, "num_tokens": 42353.0, "step": 8 }, { "epoch": 0.11392405063291139, "grad_norm": 0.6162813305854797, "learning_rate": 0.00013333333333333334, "loss": 0.3337, "mean_token_accuracy": 0.9090375304222107, "num_tokens": 47529.0, "step": 9 }, { "epoch": 0.12658227848101267, "grad_norm": 0.5204370617866516, "learning_rate": 0.00015000000000000001, "loss": 0.304, "mean_token_accuracy": 0.912761926651001, "num_tokens": 52843.0, "step": 10 }, { "epoch": 0.13924050632911392, "grad_norm": 0.48423895239830017, "learning_rate": 0.0001666666666666667, "loss": 0.2637, "mean_token_accuracy": 0.9209375977516174, "num_tokens": 57941.0, "step": 11 }, { "epoch": 0.1518987341772152, "grad_norm": 0.38198572397232056, "learning_rate": 0.00018333333333333334, "loss": 0.2515, "mean_token_accuracy": 0.9205062389373779, "num_tokens": 63062.0, "step": 12 }, { "epoch": 0.16455696202531644, "grad_norm": 0.33576324582099915, "learning_rate": 0.0002, "loss": 0.2714, "mean_token_accuracy": 0.9151454567909241, "num_tokens": 68111.0, "step": 13 }, { "epoch": 0.17721518987341772, "grad_norm": 0.39188244938850403, "learning_rate": 0.0001999966358932628, "loss": 0.2835, "mean_token_accuracy": 0.9112998843193054, "num_tokens": 73237.0, "step": 14 }, { "epoch": 0.189873417721519, "grad_norm": 0.337475448846817, "learning_rate": 0.00019998654379939533, "loss": 0.2363, "mean_token_accuracy": 0.9202312231063843, "num_tokens": 78491.0, "step": 15 }, { "epoch": 0.20253164556962025, "grad_norm": 0.3103994131088257, "learning_rate": 0.00019996972439741538, "loss": 0.252, "mean_token_accuracy": 0.9178321957588196, "num_tokens": 83703.0, "step": 16 }, { "epoch": 0.21518987341772153, "grad_norm": 0.3581632971763611, "learning_rate": 0.0001999461788189681, "loss": 0.2444, "mean_token_accuracy": 0.9205324053764343, "num_tokens": 88876.0, "step": 17 }, { "epoch": 0.22784810126582278, "grad_norm": 0.32648301124572754, "learning_rate": 0.00019991590864825028, "loss": 0.234, "mean_token_accuracy": 0.9243931770324707, "num_tokens": 93966.0, "step": 18 }, { "epoch": 0.24050632911392406, "grad_norm": 0.2799859642982483, "learning_rate": 0.00019987891592190366, "loss": 0.2141, "mean_token_accuracy": 0.9284865260124207, "num_tokens": 99078.0, "step": 19 }, { "epoch": 0.25316455696202533, "grad_norm": 0.313972145318985, "learning_rate": 0.00019983520312887785, "loss": 0.1924, "mean_token_accuracy": 0.9333333373069763, "num_tokens": 104362.0, "step": 20 }, { "epoch": 0.26582278481012656, "grad_norm": 0.2953855097293854, "learning_rate": 0.00019978477321026282, "loss": 0.2044, "mean_token_accuracy": 0.9312687516212463, "num_tokens": 109431.0, "step": 21 }, { "epoch": 0.27848101265822783, "grad_norm": 0.25561973452568054, "learning_rate": 0.0001997276295590912, "loss": 0.1856, "mean_token_accuracy": 0.9355758428573608, "num_tokens": 114757.0, "step": 22 }, { "epoch": 0.2911392405063291, "grad_norm": 0.3690224885940552, "learning_rate": 0.00019966377602010984, "loss": 0.214, "mean_token_accuracy": 0.9297286868095398, "num_tokens": 119944.0, "step": 23 }, { "epoch": 0.3037974683544304, "grad_norm": 0.30690351128578186, "learning_rate": 0.0001995932168895211, "loss": 0.2016, "mean_token_accuracy": 0.9312902688980103, "num_tokens": 125131.0, "step": 24 }, { "epoch": 0.31645569620253167, "grad_norm": 0.2413513958454132, "learning_rate": 0.00019951595691469396, "loss": 0.1891, "mean_token_accuracy": 0.9348336458206177, "num_tokens": 130305.0, "step": 25 }, { "epoch": 0.3291139240506329, "grad_norm": 0.24211426079273224, "learning_rate": 0.00019943200129384444, "loss": 0.17, "mean_token_accuracy": 0.9368179440498352, "num_tokens": 135592.0, "step": 26 }, { "epoch": 0.34177215189873417, "grad_norm": 0.2686380445957184, "learning_rate": 0.0001993413556756859, "loss": 0.1896, "mean_token_accuracy": 0.9321302175521851, "num_tokens": 140754.0, "step": 27 }, { "epoch": 0.35443037974683544, "grad_norm": 0.23685204982757568, "learning_rate": 0.0001992440261590491, "loss": 0.1819, "mean_token_accuracy": 0.9341317415237427, "num_tokens": 145828.0, "step": 28 }, { "epoch": 0.3670886075949367, "grad_norm": 0.2507152259349823, "learning_rate": 0.00019914001929247167, "loss": 0.1872, "mean_token_accuracy": 0.9352476596832275, "num_tokens": 151081.0, "step": 29 }, { "epoch": 0.379746835443038, "grad_norm": 0.3149111270904541, "learning_rate": 0.0001990293420737576, "loss": 0.1856, "mean_token_accuracy": 0.9363527297973633, "num_tokens": 156157.0, "step": 30 }, { "epoch": 0.3924050632911392, "grad_norm": 0.32569149136543274, "learning_rate": 0.00019891200194950643, "loss": 0.1871, "mean_token_accuracy": 0.9361127018928528, "num_tokens": 161402.0, "step": 31 }, { "epoch": 0.4050632911392405, "grad_norm": 0.22079512476921082, "learning_rate": 0.00019878800681461222, "loss": 0.1797, "mean_token_accuracy": 0.9368836283683777, "num_tokens": 166536.0, "step": 32 }, { "epoch": 0.4177215189873418, "grad_norm": 0.19111287593841553, "learning_rate": 0.00019865736501173238, "loss": 0.1579, "mean_token_accuracy": 0.9415755867958069, "num_tokens": 171906.0, "step": 33 }, { "epoch": 0.43037974683544306, "grad_norm": 0.26968979835510254, "learning_rate": 0.00019852008533072625, "loss": 0.184, "mean_token_accuracy": 0.9414872527122498, "num_tokens": 177080.0, "step": 34 }, { "epoch": 0.4430379746835443, "grad_norm": 0.22977136075496674, "learning_rate": 0.00019837617700806383, "loss": 0.1676, "mean_token_accuracy": 0.939095139503479, "num_tokens": 182316.0, "step": 35 }, { "epoch": 0.45569620253164556, "grad_norm": 0.24089650809764862, "learning_rate": 0.00019822564972620427, "loss": 0.1625, "mean_token_accuracy": 0.9419515132904053, "num_tokens": 187617.0, "step": 36 }, { "epoch": 0.46835443037974683, "grad_norm": 0.2149692326784134, "learning_rate": 0.0001980685136129445, "loss": 0.1676, "mean_token_accuracy": 0.939225435256958, "num_tokens": 192716.0, "step": 37 }, { "epoch": 0.4810126582278481, "grad_norm": 0.26619356870651245, "learning_rate": 0.00019790477924073755, "loss": 0.1611, "mean_token_accuracy": 0.9411424994468689, "num_tokens": 197979.0, "step": 38 }, { "epoch": 0.4936708860759494, "grad_norm": 0.23377306759357452, "learning_rate": 0.00019773445762598163, "loss": 0.1641, "mean_token_accuracy": 0.9381566047668457, "num_tokens": 203088.0, "step": 39 }, { "epoch": 0.5063291139240507, "grad_norm": 0.19846892356872559, "learning_rate": 0.00019755756022827846, "loss": 0.1535, "mean_token_accuracy": 0.9402109980583191, "num_tokens": 208270.0, "step": 40 }, { "epoch": 0.5189873417721519, "grad_norm": 0.23873910307884216, "learning_rate": 0.00019737409894966267, "loss": 0.1631, "mean_token_accuracy": 0.9398959875106812, "num_tokens": 213525.0, "step": 41 }, { "epoch": 0.5316455696202531, "grad_norm": 0.20881879329681396, "learning_rate": 0.00019718408613380074, "loss": 0.1471, "mean_token_accuracy": 0.9439833760261536, "num_tokens": 218891.0, "step": 42 }, { "epoch": 0.5443037974683544, "grad_norm": 0.2424459010362625, "learning_rate": 0.00019698753456516048, "loss": 0.1685, "mean_token_accuracy": 0.9352998733520508, "num_tokens": 224040.0, "step": 43 }, { "epoch": 0.5569620253164557, "grad_norm": 0.21166983246803284, "learning_rate": 0.00019678445746815107, "loss": 0.1509, "mean_token_accuracy": 0.9393350481987, "num_tokens": 229247.0, "step": 44 }, { "epoch": 0.569620253164557, "grad_norm": 0.1993303894996643, "learning_rate": 0.00019657486850623306, "loss": 0.1469, "mean_token_accuracy": 0.943667471408844, "num_tokens": 234459.0, "step": 45 }, { "epoch": 0.5822784810126582, "grad_norm": 0.25715190172195435, "learning_rate": 0.00019635878178099928, "loss": 0.1526, "mean_token_accuracy": 0.942389190196991, "num_tokens": 239713.0, "step": 46 }, { "epoch": 0.5949367088607594, "grad_norm": 0.24931733310222626, "learning_rate": 0.0001961362118312259, "loss": 0.1563, "mean_token_accuracy": 0.939279317855835, "num_tokens": 244800.0, "step": 47 }, { "epoch": 0.6075949367088608, "grad_norm": 0.26232779026031494, "learning_rate": 0.0001959071736318942, "loss": 0.1557, "mean_token_accuracy": 0.9432733058929443, "num_tokens": 250082.0, "step": 48 }, { "epoch": 0.620253164556962, "grad_norm": 0.1654760241508484, "learning_rate": 0.00019567168259318325, "loss": 0.1421, "mean_token_accuracy": 0.9437916278839111, "num_tokens": 255252.0, "step": 49 }, { "epoch": 0.6329113924050633, "grad_norm": 0.21212145686149597, "learning_rate": 0.00019542975455943281, "loss": 0.162, "mean_token_accuracy": 0.9394306540489197, "num_tokens": 260269.0, "step": 50 }, { "epoch": 0.6455696202531646, "grad_norm": 0.20102886855602264, "learning_rate": 0.00019518140580807744, "loss": 0.1506, "mean_token_accuracy": 0.9436455368995667, "num_tokens": 265479.0, "step": 51 }, { "epoch": 0.6582278481012658, "grad_norm": 0.19386816024780273, "learning_rate": 0.00019492665304855132, "loss": 0.1509, "mean_token_accuracy": 0.9443071484565735, "num_tokens": 270804.0, "step": 52 }, { "epoch": 0.6708860759493671, "grad_norm": 0.214805006980896, "learning_rate": 0.0001946655134211639, "loss": 0.1503, "mean_token_accuracy": 0.9397239089012146, "num_tokens": 276011.0, "step": 53 }, { "epoch": 0.6835443037974683, "grad_norm": 0.21464605629444122, "learning_rate": 0.0001943980044959468, "loss": 0.1462, "mean_token_accuracy": 0.9446601867675781, "num_tokens": 281225.0, "step": 54 }, { "epoch": 0.6962025316455697, "grad_norm": 0.18139995634555817, "learning_rate": 0.0001941241442714716, "loss": 0.1563, "mean_token_accuracy": 0.9417494535446167, "num_tokens": 286422.0, "step": 55 }, { "epoch": 0.7088607594936709, "grad_norm": 0.19541846215724945, "learning_rate": 0.0001938439511736388, "loss": 0.1469, "mean_token_accuracy": 0.9456856846809387, "num_tokens": 291678.0, "step": 56 }, { "epoch": 0.7215189873417721, "grad_norm": 0.17339253425598145, "learning_rate": 0.0001935574440544381, "loss": 0.1483, "mean_token_accuracy": 0.94073486328125, "num_tokens": 296804.0, "step": 57 }, { "epoch": 0.7341772151898734, "grad_norm": 0.1698339283466339, "learning_rate": 0.0001932646421906802, "loss": 0.1499, "mean_token_accuracy": 0.9414712190628052, "num_tokens": 301857.0, "step": 58 }, { "epoch": 0.7468354430379747, "grad_norm": 0.15577521920204163, "learning_rate": 0.00019296556528269952, "loss": 0.1367, "mean_token_accuracy": 0.9456140398979187, "num_tokens": 307051.0, "step": 59 }, { "epoch": 0.759493670886076, "grad_norm": 0.1727830171585083, "learning_rate": 0.00019266023345302887, "loss": 0.1345, "mean_token_accuracy": 0.9436017274856567, "num_tokens": 312257.0, "step": 60 }, { "epoch": 0.7721518987341772, "grad_norm": 0.21114714443683624, "learning_rate": 0.00019234866724504555, "loss": 0.1493, "mean_token_accuracy": 0.9414653182029724, "num_tokens": 317412.0, "step": 61 }, { "epoch": 0.7848101265822784, "grad_norm": 0.16771085560321808, "learning_rate": 0.00019203088762158915, "loss": 0.1359, "mean_token_accuracy": 0.9490300416946411, "num_tokens": 322734.0, "step": 62 }, { "epoch": 0.7974683544303798, "grad_norm": 0.2068631500005722, "learning_rate": 0.00019170691596355114, "loss": 0.1369, "mean_token_accuracy": 0.9427874684333801, "num_tokens": 328129.0, "step": 63 }, { "epoch": 0.810126582278481, "grad_norm": 0.21625596284866333, "learning_rate": 0.00019137677406843619, "loss": 0.1337, "mean_token_accuracy": 0.9430990219116211, "num_tokens": 333272.0, "step": 64 }, { "epoch": 0.8227848101265823, "grad_norm": 0.18965695798397064, "learning_rate": 0.00019104048414889587, "loss": 0.1402, "mean_token_accuracy": 0.946105420589447, "num_tokens": 338420.0, "step": 65 }, { "epoch": 0.8354430379746836, "grad_norm": 0.2020321488380432, "learning_rate": 0.00019069806883123387, "loss": 0.144, "mean_token_accuracy": 0.9439906477928162, "num_tokens": 343626.0, "step": 66 }, { "epoch": 0.8481012658227848, "grad_norm": 0.16373580694198608, "learning_rate": 0.00019034955115388363, "loss": 0.1305, "mean_token_accuracy": 0.9499515295028687, "num_tokens": 348845.0, "step": 67 }, { "epoch": 0.8607594936708861, "grad_norm": 0.21636246144771576, "learning_rate": 0.00018999495456585854, "loss": 0.1379, "mean_token_accuracy": 0.9468349814414978, "num_tokens": 354138.0, "step": 68 }, { "epoch": 0.8734177215189873, "grad_norm": 0.17930467426776886, "learning_rate": 0.00018963430292517398, "loss": 0.1435, "mean_token_accuracy": 0.9450312852859497, "num_tokens": 359314.0, "step": 69 }, { "epoch": 0.8860759493670886, "grad_norm": 0.1796340048313141, "learning_rate": 0.00018926762049724228, "loss": 0.1377, "mean_token_accuracy": 0.9456329941749573, "num_tokens": 364473.0, "step": 70 }, { "epoch": 0.8987341772151899, "grad_norm": 0.16919006407260895, "learning_rate": 0.00018889493195323997, "loss": 0.1388, "mean_token_accuracy": 0.9469609260559082, "num_tokens": 369703.0, "step": 71 }, { "epoch": 0.9113924050632911, "grad_norm": 0.1674400418996811, "learning_rate": 0.00018851626236844786, "loss": 0.1344, "mean_token_accuracy": 0.9464495778083801, "num_tokens": 374865.0, "step": 72 }, { "epoch": 0.9240506329113924, "grad_norm": 0.16778463125228882, "learning_rate": 0.00018813163722056396, "loss": 0.1444, "mean_token_accuracy": 0.9406762719154358, "num_tokens": 379986.0, "step": 73 }, { "epoch": 0.9367088607594937, "grad_norm": 0.15615388751029968, "learning_rate": 0.0001877410823879893, "loss": 0.1285, "mean_token_accuracy": 0.9444658160209656, "num_tokens": 385254.0, "step": 74 }, { "epoch": 0.9493670886075949, "grad_norm": 0.18973414599895477, "learning_rate": 0.0001873446241480868, "loss": 0.1351, "mean_token_accuracy": 0.9457808136940002, "num_tokens": 390556.0, "step": 75 }, { "epoch": 0.9620253164556962, "grad_norm": 0.1932706981897354, "learning_rate": 0.00018694228917541313, "loss": 0.1345, "mean_token_accuracy": 0.9486399292945862, "num_tokens": 395877.0, "step": 76 }, { "epoch": 0.9746835443037974, "grad_norm": 0.21864649653434753, "learning_rate": 0.00018653410453992413, "loss": 0.1331, "mean_token_accuracy": 0.9453898072242737, "num_tokens": 400995.0, "step": 77 }, { "epoch": 0.9873417721518988, "grad_norm": 0.16413134336471558, "learning_rate": 0.0001861200977051535, "loss": 0.1308, "mean_token_accuracy": 0.9469521641731262, "num_tokens": 406243.0, "step": 78 }, { "epoch": 1.0, "grad_norm": 0.22194692492485046, "learning_rate": 0.0001857002965263648, "loss": 0.1345, "mean_token_accuracy": 0.9429290294647217, "num_tokens": 411476.0, "step": 79 }, { "epoch": 1.0126582278481013, "grad_norm": 0.15325264632701874, "learning_rate": 0.00018527472924867756, "loss": 0.1321, "mean_token_accuracy": 0.9436901211738586, "num_tokens": 416548.0, "step": 80 }, { "epoch": 1.0253164556962024, "grad_norm": 0.18894121050834656, "learning_rate": 0.00018484342450516671, "loss": 0.1278, "mean_token_accuracy": 0.9453338384628296, "num_tokens": 421734.0, "step": 81 }, { "epoch": 1.0379746835443038, "grad_norm": 0.2188521921634674, "learning_rate": 0.0001844064113149361, "loss": 0.1267, "mean_token_accuracy": 0.9463608860969543, "num_tokens": 427074.0, "step": 82 }, { "epoch": 1.0506329113924051, "grad_norm": 0.27444732189178467, "learning_rate": 0.0001839637190811661, "loss": 0.1249, "mean_token_accuracy": 0.946395218372345, "num_tokens": 432492.0, "step": 83 }, { "epoch": 1.0632911392405062, "grad_norm": 0.14062751829624176, "learning_rate": 0.00018351537758913518, "loss": 0.1205, "mean_token_accuracy": 0.9433669447898865, "num_tokens": 437712.0, "step": 84 }, { "epoch": 1.0759493670886076, "grad_norm": 0.2686416804790497, "learning_rate": 0.00018306141700421606, "loss": 0.1285, "mean_token_accuracy": 0.9453015327453613, "num_tokens": 442767.0, "step": 85 }, { "epoch": 1.0886075949367089, "grad_norm": 0.1684628427028656, "learning_rate": 0.000182601867869846, "loss": 0.1381, "mean_token_accuracy": 0.9451888203620911, "num_tokens": 447757.0, "step": 86 }, { "epoch": 1.1012658227848102, "grad_norm": 0.21591678261756897, "learning_rate": 0.00018213676110547176, "loss": 0.1363, "mean_token_accuracy": 0.9451231956481934, "num_tokens": 452814.0, "step": 87 }, { "epoch": 1.1139240506329113, "grad_norm": 0.22342060506343842, "learning_rate": 0.0001816661280044693, "loss": 0.1395, "mean_token_accuracy": 0.9416748881340027, "num_tokens": 457953.0, "step": 88 }, { "epoch": 1.1265822784810127, "grad_norm": 0.15861928462982178, "learning_rate": 0.00018119000023203837, "loss": 0.1298, "mean_token_accuracy": 0.9489896297454834, "num_tokens": 463114.0, "step": 89 }, { "epoch": 1.139240506329114, "grad_norm": 0.14701464772224426, "learning_rate": 0.0001807084098230719, "loss": 0.1247, "mean_token_accuracy": 0.9497681856155396, "num_tokens": 468354.0, "step": 90 }, { "epoch": 1.1518987341772151, "grad_norm": 0.11642320454120636, "learning_rate": 0.0001802213891800007, "loss": 0.1212, "mean_token_accuracy": 0.949401319026947, "num_tokens": 473596.0, "step": 91 }, { "epoch": 1.1645569620253164, "grad_norm": 0.15525047481060028, "learning_rate": 0.00017972897107061328, "loss": 0.126, "mean_token_accuracy": 0.9478814601898193, "num_tokens": 478687.0, "step": 92 }, { "epoch": 1.1772151898734178, "grad_norm": 0.15354906022548676, "learning_rate": 0.00017923118862585123, "loss": 0.1305, "mean_token_accuracy": 0.9484842419624329, "num_tokens": 483798.0, "step": 93 }, { "epoch": 1.189873417721519, "grad_norm": 0.16433700919151306, "learning_rate": 0.00017872807533758007, "loss": 0.1331, "mean_token_accuracy": 0.9448692202568054, "num_tokens": 488832.0, "step": 94 }, { "epoch": 1.2025316455696202, "grad_norm": 0.14196732640266418, "learning_rate": 0.00017821966505633587, "loss": 0.1252, "mean_token_accuracy": 0.9504452347755432, "num_tokens": 494062.0, "step": 95 }, { "epoch": 1.2151898734177216, "grad_norm": 0.15048350393772125, "learning_rate": 0.00017770599198904763, "loss": 0.128, "mean_token_accuracy": 0.9498940110206604, "num_tokens": 499315.0, "step": 96 }, { "epoch": 1.2278481012658227, "grad_norm": 0.19549059867858887, "learning_rate": 0.00017718709069673594, "loss": 0.1345, "mean_token_accuracy": 0.9464973211288452, "num_tokens": 504575.0, "step": 97 }, { "epoch": 1.240506329113924, "grad_norm": 0.1423873007297516, "learning_rate": 0.00017666299609218745, "loss": 0.1245, "mean_token_accuracy": 0.9458649754524231, "num_tokens": 509645.0, "step": 98 }, { "epoch": 1.2531645569620253, "grad_norm": 0.1903885006904602, "learning_rate": 0.00017613374343760594, "loss": 0.1306, "mean_token_accuracy": 0.9471228718757629, "num_tokens": 514853.0, "step": 99 }, { "epoch": 1.2658227848101267, "grad_norm": 0.15726621448993683, "learning_rate": 0.00017559936834223982, "loss": 0.1273, "mean_token_accuracy": 0.9503991007804871, "num_tokens": 520179.0, "step": 100 }, { "epoch": 1.2784810126582278, "grad_norm": 0.12970785796642303, "learning_rate": 0.0001750599067599863, "loss": 0.1249, "mean_token_accuracy": 0.9486523866653442, "num_tokens": 525326.0, "step": 101 }, { "epoch": 1.2911392405063291, "grad_norm": 0.16852085292339325, "learning_rate": 0.00017451539498697225, "loss": 0.1302, "mean_token_accuracy": 0.9456775784492493, "num_tokens": 530526.0, "step": 102 }, { "epoch": 1.3037974683544304, "grad_norm": 0.1304207593202591, "learning_rate": 0.0001739658696591121, "loss": 0.126, "mean_token_accuracy": 0.9477406740188599, "num_tokens": 535680.0, "step": 103 }, { "epoch": 1.3164556962025316, "grad_norm": 0.12224633246660233, "learning_rate": 0.00017341136774964307, "loss": 0.1283, "mean_token_accuracy": 0.9467939734458923, "num_tokens": 540875.0, "step": 104 }, { "epoch": 1.3291139240506329, "grad_norm": 0.15364806354045868, "learning_rate": 0.0001728519265666373, "loss": 0.1235, "mean_token_accuracy": 0.9479364156723022, "num_tokens": 546221.0, "step": 105 }, { "epoch": 1.3417721518987342, "grad_norm": 0.122112937271595, "learning_rate": 0.00017228758375049185, "loss": 0.1245, "mean_token_accuracy": 0.943025529384613, "num_tokens": 551375.0, "step": 106 }, { "epoch": 1.3544303797468356, "grad_norm": 0.12079890817403793, "learning_rate": 0.00017171837727139613, "loss": 0.1232, "mean_token_accuracy": 0.9487327337265015, "num_tokens": 556647.0, "step": 107 }, { "epoch": 1.3670886075949367, "grad_norm": 0.22763219475746155, "learning_rate": 0.0001711443454267772, "loss": 0.1286, "mean_token_accuracy": 0.9476664662361145, "num_tokens": 561832.0, "step": 108 }, { "epoch": 1.379746835443038, "grad_norm": 0.14368991553783417, "learning_rate": 0.00017056552683872292, "loss": 0.1206, "mean_token_accuracy": 0.9500395059585571, "num_tokens": 566960.0, "step": 109 }, { "epoch": 1.3924050632911391, "grad_norm": 0.137187197804451, "learning_rate": 0.00016998196045138353, "loss": 0.1196, "mean_token_accuracy": 0.9471749067306519, "num_tokens": 572192.0, "step": 110 }, { "epoch": 1.4050632911392404, "grad_norm": 0.12349066883325577, "learning_rate": 0.00016939368552835137, "loss": 0.1191, "mean_token_accuracy": 0.9507257342338562, "num_tokens": 577492.0, "step": 111 }, { "epoch": 1.4177215189873418, "grad_norm": 0.1606503129005432, "learning_rate": 0.00016880074165001905, "loss": 0.1308, "mean_token_accuracy": 0.951308012008667, "num_tokens": 582793.0, "step": 112 }, { "epoch": 1.4303797468354431, "grad_norm": 0.1452348381280899, "learning_rate": 0.0001682031687109165, "loss": 0.1236, "mean_token_accuracy": 0.9501745104789734, "num_tokens": 588015.0, "step": 113 }, { "epoch": 1.4430379746835442, "grad_norm": 0.1393907517194748, "learning_rate": 0.00016760100691702674, "loss": 0.1215, "mean_token_accuracy": 0.953479528427124, "num_tokens": 593324.0, "step": 114 }, { "epoch": 1.4556962025316456, "grad_norm": 0.17773191630840302, "learning_rate": 0.0001669942967830807, "loss": 0.1272, "mean_token_accuracy": 0.9480122327804565, "num_tokens": 598620.0, "step": 115 }, { "epoch": 1.4683544303797469, "grad_norm": 0.1251114010810852, "learning_rate": 0.00016638307912983136, "loss": 0.1253, "mean_token_accuracy": 0.9470962882041931, "num_tokens": 603712.0, "step": 116 }, { "epoch": 1.481012658227848, "grad_norm": 0.2559885084629059, "learning_rate": 0.00016576739508130726, "loss": 0.1275, "mean_token_accuracy": 0.9498353600502014, "num_tokens": 608939.0, "step": 117 }, { "epoch": 1.4936708860759493, "grad_norm": 0.1673833280801773, "learning_rate": 0.0001651472860620455, "loss": 0.1252, "mean_token_accuracy": 0.9469268321990967, "num_tokens": 614128.0, "step": 118 }, { "epoch": 1.5063291139240507, "grad_norm": 0.13037990033626556, "learning_rate": 0.00016452279379430463, "loss": 0.1231, "mean_token_accuracy": 0.9495947957038879, "num_tokens": 619251.0, "step": 119 }, { "epoch": 1.518987341772152, "grad_norm": 0.11066332459449768, "learning_rate": 0.00016389396029525762, "loss": 0.1203, "mean_token_accuracy": 0.9498069286346436, "num_tokens": 624495.0, "step": 120 }, { "epoch": 1.5316455696202531, "grad_norm": 0.1207226887345314, "learning_rate": 0.0001632608278741646, "loss": 0.1223, "mean_token_accuracy": 0.948310136795044, "num_tokens": 629589.0, "step": 121 }, { "epoch": 1.5443037974683544, "grad_norm": 0.1282467097043991, "learning_rate": 0.00016262343912952656, "loss": 0.123, "mean_token_accuracy": 0.9489855170249939, "num_tokens": 634828.0, "step": 122 }, { "epoch": 1.5569620253164556, "grad_norm": 0.16653472185134888, "learning_rate": 0.0001619818369462188, "loss": 0.1274, "mean_token_accuracy": 0.947590708732605, "num_tokens": 640101.0, "step": 123 }, { "epoch": 1.5696202531645569, "grad_norm": 0.1379830688238144, "learning_rate": 0.0001613360644926059, "loss": 0.12, "mean_token_accuracy": 0.9533698558807373, "num_tokens": 645462.0, "step": 124 }, { "epoch": 1.5822784810126582, "grad_norm": 0.1411072164773941, "learning_rate": 0.00016068616521763707, "loss": 0.1246, "mean_token_accuracy": 0.9507206678390503, "num_tokens": 650660.0, "step": 125 }, { "epoch": 1.5949367088607596, "grad_norm": 0.15294188261032104, "learning_rate": 0.00016003218284792298, "loss": 0.1247, "mean_token_accuracy": 0.9487677216529846, "num_tokens": 655877.0, "step": 126 }, { "epoch": 1.6075949367088609, "grad_norm": 0.1204475536942482, "learning_rate": 0.00015937416138479344, "loss": 0.1175, "mean_token_accuracy": 0.9533510804176331, "num_tokens": 661193.0, "step": 127 }, { "epoch": 1.620253164556962, "grad_norm": 0.13293962180614471, "learning_rate": 0.0001587121451013373, "loss": 0.1223, "mean_token_accuracy": 0.9472352266311646, "num_tokens": 666393.0, "step": 128 }, { "epoch": 1.6329113924050633, "grad_norm": 0.11509446054697037, "learning_rate": 0.0001580461785394233, "loss": 0.118, "mean_token_accuracy": 0.9501758217811584, "num_tokens": 671575.0, "step": 129 }, { "epoch": 1.6455696202531644, "grad_norm": 0.11632049083709717, "learning_rate": 0.00015737630650670335, "loss": 0.1198, "mean_token_accuracy": 0.9511387944221497, "num_tokens": 676776.0, "step": 130 }, { "epoch": 1.6582278481012658, "grad_norm": 0.14730048179626465, "learning_rate": 0.00015670257407359792, "loss": 0.1179, "mean_token_accuracy": 0.948544979095459, "num_tokens": 682029.0, "step": 131 }, { "epoch": 1.6708860759493671, "grad_norm": 0.169641375541687, "learning_rate": 0.00015602502657026328, "loss": 0.1234, "mean_token_accuracy": 0.9496759176254272, "num_tokens": 687339.0, "step": 132 }, { "epoch": 1.6835443037974684, "grad_norm": 0.10720019787549973, "learning_rate": 0.00015534370958354186, "loss": 0.1192, "mean_token_accuracy": 0.950038731098175, "num_tokens": 692567.0, "step": 133 }, { "epoch": 1.6962025316455698, "grad_norm": 0.14673638343811035, "learning_rate": 0.00015465866895389495, "loss": 0.1232, "mean_token_accuracy": 0.9517359733581543, "num_tokens": 697873.0, "step": 134 }, { "epoch": 1.7088607594936709, "grad_norm": 0.11593678593635559, "learning_rate": 0.00015396995077231854, "loss": 0.1194, "mean_token_accuracy": 0.9523058533668518, "num_tokens": 703011.0, "step": 135 }, { "epoch": 1.721518987341772, "grad_norm": 0.09349008649587631, "learning_rate": 0.00015327760137724212, "loss": 0.122, "mean_token_accuracy": 0.9510685205459595, "num_tokens": 708082.0, "step": 136 }, { "epoch": 1.7341772151898733, "grad_norm": 0.10837123543024063, "learning_rate": 0.00015258166735141092, "loss": 0.1214, "mean_token_accuracy": 0.9500493407249451, "num_tokens": 713211.0, "step": 137 }, { "epoch": 1.7468354430379747, "grad_norm": 0.10963979363441467, "learning_rate": 0.0001518821955187519, "loss": 0.1199, "mean_token_accuracy": 0.9493547081947327, "num_tokens": 718389.0, "step": 138 }, { "epoch": 1.759493670886076, "grad_norm": 0.108366958796978, "learning_rate": 0.00015117923294122312, "loss": 0.1182, "mean_token_accuracy": 0.9521881341934204, "num_tokens": 723640.0, "step": 139 }, { "epoch": 1.7721518987341773, "grad_norm": 0.10612353682518005, "learning_rate": 0.0001504728269156475, "loss": 0.1173, "mean_token_accuracy": 0.9468570351600647, "num_tokens": 728747.0, "step": 140 }, { "epoch": 1.7848101265822784, "grad_norm": 0.10319573432207108, "learning_rate": 0.00014976302497053036, "loss": 0.1121, "mean_token_accuracy": 0.9531159400939941, "num_tokens": 733994.0, "step": 141 }, { "epoch": 1.7974683544303798, "grad_norm": 0.11267366260290146, "learning_rate": 0.00014904987486286184, "loss": 0.1137, "mean_token_accuracy": 0.9541195034980774, "num_tokens": 739180.0, "step": 142 }, { "epoch": 1.810126582278481, "grad_norm": 0.13383233547210693, "learning_rate": 0.00014833342457490361, "loss": 0.1214, "mean_token_accuracy": 0.9502696394920349, "num_tokens": 744251.0, "step": 143 }, { "epoch": 1.8227848101265822, "grad_norm": 0.17001107335090637, "learning_rate": 0.00014761372231096047, "loss": 0.1157, "mean_token_accuracy": 0.9521386623382568, "num_tokens": 749622.0, "step": 144 }, { "epoch": 1.8354430379746836, "grad_norm": 0.12594255805015564, "learning_rate": 0.00014689081649413708, "loss": 0.1182, "mean_token_accuracy": 0.9487131237983704, "num_tokens": 754970.0, "step": 145 }, { "epoch": 1.8481012658227849, "grad_norm": 0.1139696016907692, "learning_rate": 0.00014616475576308005, "loss": 0.1211, "mean_token_accuracy": 0.9446545839309692, "num_tokens": 760057.0, "step": 146 }, { "epoch": 1.8607594936708862, "grad_norm": 0.11146289855241776, "learning_rate": 0.00014543558896870531, "loss": 0.1165, "mean_token_accuracy": 0.949729323387146, "num_tokens": 765293.0, "step": 147 }, { "epoch": 1.8734177215189873, "grad_norm": 0.11601708829402924, "learning_rate": 0.0001447033651709114, "loss": 0.1216, "mean_token_accuracy": 0.9519582986831665, "num_tokens": 770540.0, "step": 148 }, { "epoch": 1.8860759493670884, "grad_norm": 0.1349141150712967, "learning_rate": 0.0001439681336352785, "loss": 0.1134, "mean_token_accuracy": 0.9564322829246521, "num_tokens": 775952.0, "step": 149 }, { "epoch": 1.8987341772151898, "grad_norm": 0.11901061981916428, "learning_rate": 0.00014322994382975386, "loss": 0.1158, "mean_token_accuracy": 0.9476328492164612, "num_tokens": 781191.0, "step": 150 }, { "epoch": 1.9113924050632911, "grad_norm": 0.10183963924646378, "learning_rate": 0.0001424888454213235, "loss": 0.1222, "mean_token_accuracy": 0.949402391910553, "num_tokens": 786275.0, "step": 151 }, { "epoch": 1.9240506329113924, "grad_norm": 0.10988782346248627, "learning_rate": 0.0001417448882726703, "loss": 0.1206, "mean_token_accuracy": 0.950117826461792, "num_tokens": 791431.0, "step": 152 }, { "epoch": 1.9367088607594938, "grad_norm": 0.11146315932273865, "learning_rate": 0.00014099812243881948, "loss": 0.1154, "mean_token_accuracy": 0.9520351886749268, "num_tokens": 796728.0, "step": 153 }, { "epoch": 1.9493670886075949, "grad_norm": 0.09734103083610535, "learning_rate": 0.00014024859816377046, "loss": 0.1144, "mean_token_accuracy": 0.9512288570404053, "num_tokens": 802000.0, "step": 154 }, { "epoch": 1.9620253164556962, "grad_norm": 0.09847570210695267, "learning_rate": 0.00013949636587711644, "loss": 0.1162, "mean_token_accuracy": 0.9531669616699219, "num_tokens": 807274.0, "step": 155 }, { "epoch": 1.9746835443037973, "grad_norm": 0.11049605160951614, "learning_rate": 0.0001387414761906516, "loss": 0.1168, "mean_token_accuracy": 0.9521486163139343, "num_tokens": 812667.0, "step": 156 }, { "epoch": 1.9873417721518987, "grad_norm": 0.12828807532787323, "learning_rate": 0.00013798397989496549, "loss": 0.1213, "mean_token_accuracy": 0.9485089182853699, "num_tokens": 817761.0, "step": 157 }, { "epoch": 2.0, "grad_norm": 0.08749315142631531, "learning_rate": 0.00013722392795602594, "loss": 0.1153, "mean_token_accuracy": 0.9507448077201843, "num_tokens": 822860.0, "step": 158 }, { "epoch": 2.0126582278481013, "grad_norm": 0.1040758490562439, "learning_rate": 0.0001364613715117499, "loss": 0.113, "mean_token_accuracy": 0.9519175887107849, "num_tokens": 828165.0, "step": 159 }, { "epoch": 2.0253164556962027, "grad_norm": 0.1114276871085167, "learning_rate": 0.00013569636186856288, "loss": 0.1109, "mean_token_accuracy": 0.9505388736724854, "num_tokens": 833425.0, "step": 160 }, { "epoch": 2.037974683544304, "grad_norm": 0.0839025005698204, "learning_rate": 0.0001349289504979467, "loss": 0.1154, "mean_token_accuracy": 0.9530664682388306, "num_tokens": 838560.0, "step": 161 }, { "epoch": 2.050632911392405, "grad_norm": 0.09230242669582367, "learning_rate": 0.0001341591890329766, "loss": 0.1146, "mean_token_accuracy": 0.9486173987388611, "num_tokens": 843723.0, "step": 162 }, { "epoch": 2.0632911392405062, "grad_norm": 0.07964486628770828, "learning_rate": 0.00013338712926484725, "loss": 0.1095, "mean_token_accuracy": 0.9523173570632935, "num_tokens": 849030.0, "step": 163 }, { "epoch": 2.0759493670886076, "grad_norm": 0.12312997877597809, "learning_rate": 0.00013261282313938795, "loss": 0.1161, "mean_token_accuracy": 0.950698733329773, "num_tokens": 854246.0, "step": 164 }, { "epoch": 2.088607594936709, "grad_norm": 0.11605784296989441, "learning_rate": 0.00013183632275356777, "loss": 0.1129, "mean_token_accuracy": 0.9517543911933899, "num_tokens": 859554.0, "step": 165 }, { "epoch": 2.1012658227848102, "grad_norm": 0.09419958293437958, "learning_rate": 0.00013105768035199034, "loss": 0.112, "mean_token_accuracy": 0.950269877910614, "num_tokens": 864806.0, "step": 166 }, { "epoch": 2.1139240506329116, "grad_norm": 0.11429665982723236, "learning_rate": 0.0001302769483233786, "loss": 0.1137, "mean_token_accuracy": 0.9541642069816589, "num_tokens": 869997.0, "step": 167 }, { "epoch": 2.1265822784810124, "grad_norm": 0.11947552114725113, "learning_rate": 0.00012949417919705007, "loss": 0.116, "mean_token_accuracy": 0.9537324905395508, "num_tokens": 875205.0, "step": 168 }, { "epoch": 2.1392405063291138, "grad_norm": 0.13403531908988953, "learning_rate": 0.00012870942563938264, "loss": 0.1182, "mean_token_accuracy": 0.9547651410102844, "num_tokens": 880442.0, "step": 169 }, { "epoch": 2.151898734177215, "grad_norm": 0.09392501413822174, "learning_rate": 0.0001279227404502709, "loss": 0.1148, "mean_token_accuracy": 0.9532988667488098, "num_tokens": 885538.0, "step": 170 }, { "epoch": 2.1645569620253164, "grad_norm": 0.13457965850830078, "learning_rate": 0.00012713417655957376, "loss": 0.1151, "mean_token_accuracy": 0.9484173655509949, "num_tokens": 890720.0, "step": 171 }, { "epoch": 2.1772151898734178, "grad_norm": 0.096675805747509, "learning_rate": 0.00012634378702355313, "loss": 0.1109, "mean_token_accuracy": 0.9544493556022644, "num_tokens": 895987.0, "step": 172 }, { "epoch": 2.189873417721519, "grad_norm": 0.09749137610197067, "learning_rate": 0.00012555162502130433, "loss": 0.1102, "mean_token_accuracy": 0.9534346461296082, "num_tokens": 901248.0, "step": 173 }, { "epoch": 2.2025316455696204, "grad_norm": 0.09648600965738297, "learning_rate": 0.00012475774385117786, "loss": 0.1132, "mean_token_accuracy": 0.9511432647705078, "num_tokens": 906429.0, "step": 174 }, { "epoch": 2.2151898734177213, "grad_norm": 0.11956477910280228, "learning_rate": 0.00012396219692719363, "loss": 0.1159, "mean_token_accuracy": 0.9516765475273132, "num_tokens": 911563.0, "step": 175 }, { "epoch": 2.2278481012658227, "grad_norm": 0.11230012029409409, "learning_rate": 0.000123165037775447, "loss": 0.1129, "mean_token_accuracy": 0.951176106929779, "num_tokens": 916686.0, "step": 176 }, { "epoch": 2.240506329113924, "grad_norm": 0.13427633047103882, "learning_rate": 0.00012236632003050736, "loss": 0.1191, "mean_token_accuracy": 0.9477163553237915, "num_tokens": 921742.0, "step": 177 }, { "epoch": 2.2531645569620253, "grad_norm": 0.1290883868932724, "learning_rate": 0.00012156609743180969, "loss": 0.1127, "mean_token_accuracy": 0.950269877910614, "num_tokens": 926994.0, "step": 178 }, { "epoch": 2.2658227848101267, "grad_norm": 0.08057372272014618, "learning_rate": 0.0001207644238200387, "loss": 0.1125, "mean_token_accuracy": 0.9483300447463989, "num_tokens": 932148.0, "step": 179 }, { "epoch": 2.278481012658228, "grad_norm": 0.11464843153953552, "learning_rate": 0.00011996135313350636, "loss": 0.1165, "mean_token_accuracy": 0.9480494260787964, "num_tokens": 937390.0, "step": 180 }, { "epoch": 2.291139240506329, "grad_norm": 0.1148659810423851, "learning_rate": 0.0001191569394045228, "loss": 0.1135, "mean_token_accuracy": 0.9494910836219788, "num_tokens": 942661.0, "step": 181 }, { "epoch": 2.3037974683544302, "grad_norm": 0.1096266508102417, "learning_rate": 0.00011835123675576092, "loss": 0.1108, "mean_token_accuracy": 0.9535801410675049, "num_tokens": 948046.0, "step": 182 }, { "epoch": 2.3164556962025316, "grad_norm": 0.11258285492658615, "learning_rate": 0.0001175442993966149, "loss": 0.1116, "mean_token_accuracy": 0.9536716938018799, "num_tokens": 953312.0, "step": 183 }, { "epoch": 2.329113924050633, "grad_norm": 0.09487363696098328, "learning_rate": 0.00011673618161955288, "loss": 0.1123, "mean_token_accuracy": 0.9542192220687866, "num_tokens": 958531.0, "step": 184 }, { "epoch": 2.3417721518987342, "grad_norm": 0.10504362732172012, "learning_rate": 0.00011592693779646405, "loss": 0.1091, "mean_token_accuracy": 0.9548643827438354, "num_tokens": 963868.0, "step": 185 }, { "epoch": 2.3544303797468356, "grad_norm": 0.10166207700967789, "learning_rate": 0.00011511662237500032, "loss": 0.111, "mean_token_accuracy": 0.9527420997619629, "num_tokens": 969074.0, "step": 186 }, { "epoch": 2.367088607594937, "grad_norm": 0.0899074450135231, "learning_rate": 0.00011430528987491305, "loss": 0.1134, "mean_token_accuracy": 0.9507843255996704, "num_tokens": 974238.0, "step": 187 }, { "epoch": 2.379746835443038, "grad_norm": 0.08563630282878876, "learning_rate": 0.00011349299488438485, "loss": 0.11, "mean_token_accuracy": 0.955788254737854, "num_tokens": 979459.0, "step": 188 }, { "epoch": 2.392405063291139, "grad_norm": 0.11500842124223709, "learning_rate": 0.00011267979205635675, "loss": 0.1091, "mean_token_accuracy": 0.954186737537384, "num_tokens": 984718.0, "step": 189 }, { "epoch": 2.4050632911392404, "grad_norm": 0.092518649995327, "learning_rate": 0.00011186573610485098, "loss": 0.1149, "mean_token_accuracy": 0.9542879462242126, "num_tokens": 989901.0, "step": 190 }, { "epoch": 2.4177215189873418, "grad_norm": 0.11641688644886017, "learning_rate": 0.00011105088180128976, "loss": 0.1163, "mean_token_accuracy": 0.9520922899246216, "num_tokens": 995079.0, "step": 191 }, { "epoch": 2.430379746835443, "grad_norm": 0.10992075502872467, "learning_rate": 0.00011023528397081011, "loss": 0.1131, "mean_token_accuracy": 0.9550126194953918, "num_tokens": 1000300.0, "step": 192 }, { "epoch": 2.4430379746835444, "grad_norm": 0.12892654538154602, "learning_rate": 0.0001094189974885752, "loss": 0.1174, "mean_token_accuracy": 0.9511012434959412, "num_tokens": 1005313.0, "step": 193 }, { "epoch": 2.4556962025316453, "grad_norm": 0.10617399960756302, "learning_rate": 0.00010860207727608214, "loss": 0.1162, "mean_token_accuracy": 0.9493392109870911, "num_tokens": 1010371.0, "step": 194 }, { "epoch": 2.4683544303797467, "grad_norm": 0.1117515116930008, "learning_rate": 0.00010778457829746666, "loss": 0.1132, "mean_token_accuracy": 0.9525145292282104, "num_tokens": 1015426.0, "step": 195 }, { "epoch": 2.481012658227848, "grad_norm": 0.09666470438241959, "learning_rate": 0.00010696655555580524, "loss": 0.1123, "mean_token_accuracy": 0.9508653283119202, "num_tokens": 1020517.0, "step": 196 }, { "epoch": 2.4936708860759493, "grad_norm": 0.13866201043128967, "learning_rate": 0.00010614806408941422, "loss": 0.112, "mean_token_accuracy": 0.9557572603225708, "num_tokens": 1025870.0, "step": 197 }, { "epoch": 2.5063291139240507, "grad_norm": 0.0827043205499649, "learning_rate": 0.00010532915896814672, "loss": 0.1095, "mean_token_accuracy": 0.9521714448928833, "num_tokens": 1031161.0, "step": 198 }, { "epoch": 2.518987341772152, "grad_norm": 0.09126809984445572, "learning_rate": 0.00010450989528968746, "loss": 0.1111, "mean_token_accuracy": 0.951029896736145, "num_tokens": 1036371.0, "step": 199 }, { "epoch": 2.5316455696202533, "grad_norm": 0.0837259516119957, "learning_rate": 0.00010369032817584561, "loss": 0.114, "mean_token_accuracy": 0.9502448439598083, "num_tokens": 1041540.0, "step": 200 }, { "epoch": 2.5443037974683547, "grad_norm": 0.09508928656578064, "learning_rate": 0.00010287051276884618, "loss": 0.115, "mean_token_accuracy": 0.9502407908439636, "num_tokens": 1046588.0, "step": 201 }, { "epoch": 2.5569620253164556, "grad_norm": 0.10246361792087555, "learning_rate": 0.00010205050422761988, "loss": 0.1143, "mean_token_accuracy": 0.947189450263977, "num_tokens": 1051651.0, "step": 202 }, { "epoch": 2.569620253164557, "grad_norm": 0.11269509047269821, "learning_rate": 0.00010123035772409184, "loss": 0.1159, "mean_token_accuracy": 0.951171875, "num_tokens": 1056835.0, "step": 203 }, { "epoch": 2.5822784810126582, "grad_norm": 0.19371971487998962, "learning_rate": 0.0001004101284394696, "loss": 0.1139, "mean_token_accuracy": 0.9502364993095398, "num_tokens": 1062184.0, "step": 204 }, { "epoch": 2.5949367088607596, "grad_norm": 0.07230806350708008, "learning_rate": 9.958987156053045e-05, "loss": 0.1075, "mean_token_accuracy": 0.9555003643035889, "num_tokens": 1067484.0, "step": 205 }, { "epoch": 2.607594936708861, "grad_norm": 0.08113159984350204, "learning_rate": 9.87696422759082e-05, "loss": 0.1088, "mean_token_accuracy": 0.9582512974739075, "num_tokens": 1072626.0, "step": 206 }, { "epoch": 2.620253164556962, "grad_norm": 0.1027611568570137, "learning_rate": 9.794949577238013e-05, "loss": 0.111, "mean_token_accuracy": 0.9528957605361938, "num_tokens": 1077870.0, "step": 207 }, { "epoch": 2.632911392405063, "grad_norm": 0.0853879526257515, "learning_rate": 9.712948723115383e-05, "loss": 0.1063, "mean_token_accuracy": 0.9563567638397217, "num_tokens": 1083204.0, "step": 208 }, { "epoch": 2.6455696202531644, "grad_norm": 0.09815023094415665, "learning_rate": 9.630967182415442e-05, "loss": 0.1174, "mean_token_accuracy": 0.9501211643218994, "num_tokens": 1088220.0, "step": 209 }, { "epoch": 2.6582278481012658, "grad_norm": 0.08170381933450699, "learning_rate": 9.549010471031256e-05, "loss": 0.1115, "mean_token_accuracy": 0.9547125697135925, "num_tokens": 1093451.0, "step": 210 }, { "epoch": 2.670886075949367, "grad_norm": 0.09601102769374847, "learning_rate": 9.467084103185329e-05, "loss": 0.1171, "mean_token_accuracy": 0.9542239904403687, "num_tokens": 1098605.0, "step": 211 }, { "epoch": 2.6835443037974684, "grad_norm": 0.09155265986919403, "learning_rate": 9.385193591058579e-05, "loss": 0.1093, "mean_token_accuracy": 0.9578231573104858, "num_tokens": 1103814.0, "step": 212 }, { "epoch": 2.6962025316455698, "grad_norm": 0.09160866588354111, "learning_rate": 9.303344444419476e-05, "loss": 0.1112, "mean_token_accuracy": 0.951647937297821, "num_tokens": 1108945.0, "step": 213 }, { "epoch": 2.708860759493671, "grad_norm": 0.10708494484424591, "learning_rate": 9.221542170253339e-05, "loss": 0.1133, "mean_token_accuracy": 0.9530802965164185, "num_tokens": 1114252.0, "step": 214 }, { "epoch": 2.721518987341772, "grad_norm": 0.08773200213909149, "learning_rate": 9.139792272391791e-05, "loss": 0.11, "mean_token_accuracy": 0.9543495178222656, "num_tokens": 1119420.0, "step": 215 }, { "epoch": 2.7341772151898733, "grad_norm": 0.10514669865369797, "learning_rate": 9.058100251142483e-05, "loss": 0.1162, "mean_token_accuracy": 0.9470460414886475, "num_tokens": 1124545.0, "step": 216 }, { "epoch": 2.7468354430379747, "grad_norm": 0.13822774589061737, "learning_rate": 8.976471602918991e-05, "loss": 0.1084, "mean_token_accuracy": 0.955195426940918, "num_tokens": 1129854.0, "step": 217 }, { "epoch": 2.759493670886076, "grad_norm": 0.10257484018802643, "learning_rate": 8.894911819871026e-05, "loss": 0.1127, "mean_token_accuracy": 0.9548011422157288, "num_tokens": 1135073.0, "step": 218 }, { "epoch": 2.7721518987341773, "grad_norm": 0.15447267889976501, "learning_rate": 8.813426389514903e-05, "loss": 0.1058, "mean_token_accuracy": 0.9547005295753479, "num_tokens": 1140413.0, "step": 219 }, { "epoch": 2.7848101265822782, "grad_norm": 0.08518294990062714, "learning_rate": 8.732020794364326e-05, "loss": 0.1112, "mean_token_accuracy": 0.9537380337715149, "num_tokens": 1145600.0, "step": 220 }, { "epoch": 2.7974683544303796, "grad_norm": 0.1725679337978363, "learning_rate": 8.650700511561514e-05, "loss": 0.1139, "mean_token_accuracy": 0.9512341022491455, "num_tokens": 1150688.0, "step": 221 }, { "epoch": 2.810126582278481, "grad_norm": 0.09164884686470032, "learning_rate": 8.5694710125087e-05, "loss": 0.1083, "mean_token_accuracy": 0.9564552903175354, "num_tokens": 1155988.0, "step": 222 }, { "epoch": 2.8227848101265822, "grad_norm": 0.12649889290332794, "learning_rate": 8.488337762499972e-05, "loss": 0.1082, "mean_token_accuracy": 0.9533155560493469, "num_tokens": 1161300.0, "step": 223 }, { "epoch": 2.8354430379746836, "grad_norm": 0.10542358458042145, "learning_rate": 8.407306220353596e-05, "loss": 0.113, "mean_token_accuracy": 0.9506816267967224, "num_tokens": 1166352.0, "step": 224 }, { "epoch": 2.848101265822785, "grad_norm": 0.12877212464809418, "learning_rate": 8.326381838044713e-05, "loss": 0.1136, "mean_token_accuracy": 0.9508786201477051, "num_tokens": 1171424.0, "step": 225 }, { "epoch": 2.8607594936708862, "grad_norm": 0.08036050945520401, "learning_rate": 8.245570060338512e-05, "loss": 0.108, "mean_token_accuracy": 0.9533178806304932, "num_tokens": 1176672.0, "step": 226 }, { "epoch": 2.8734177215189876, "grad_norm": 0.11726133525371552, "learning_rate": 8.164876324423909e-05, "loss": 0.1069, "mean_token_accuracy": 0.9536500573158264, "num_tokens": 1181914.0, "step": 227 }, { "epoch": 2.8860759493670884, "grad_norm": 0.09797175228595734, "learning_rate": 8.084306059547722e-05, "loss": 0.1111, "mean_token_accuracy": 0.9521328210830688, "num_tokens": 1187159.0, "step": 228 }, { "epoch": 2.8987341772151898, "grad_norm": 0.09934044629335403, "learning_rate": 8.003864686649366e-05, "loss": 0.1057, "mean_token_accuracy": 0.9541738033294678, "num_tokens": 1192482.0, "step": 229 }, { "epoch": 2.911392405063291, "grad_norm": 0.12974561750888824, "learning_rate": 7.923557617996131e-05, "loss": 0.1126, "mean_token_accuracy": 0.9513805508613586, "num_tokens": 1197544.0, "step": 230 }, { "epoch": 2.9240506329113924, "grad_norm": 0.15223093330860138, "learning_rate": 7.843390256819034e-05, "loss": 0.1119, "mean_token_accuracy": 0.9524279236793518, "num_tokens": 1202674.0, "step": 231 }, { "epoch": 2.9367088607594938, "grad_norm": 0.0986715778708458, "learning_rate": 7.763367996949267e-05, "loss": 0.1043, "mean_token_accuracy": 0.9544337391853333, "num_tokens": 1208027.0, "step": 232 }, { "epoch": 2.9493670886075947, "grad_norm": 0.10474951565265656, "learning_rate": 7.683496222455304e-05, "loss": 0.1108, "mean_token_accuracy": 0.951941967010498, "num_tokens": 1213189.0, "step": 233 }, { "epoch": 2.962025316455696, "grad_norm": 0.12877650558948517, "learning_rate": 7.603780307280639e-05, "loss": 0.1071, "mean_token_accuracy": 0.954459547996521, "num_tokens": 1218545.0, "step": 234 }, { "epoch": 2.9746835443037973, "grad_norm": 0.14582286775112152, "learning_rate": 7.524225614882216e-05, "loss": 0.1079, "mean_token_accuracy": 0.9513266086578369, "num_tokens": 1223848.0, "step": 235 }, { "epoch": 2.9873417721518987, "grad_norm": 0.07670250535011292, "learning_rate": 7.44483749786957e-05, "loss": 0.1066, "mean_token_accuracy": 0.9508670568466187, "num_tokens": 1229102.0, "step": 236 }, { "epoch": 3.0, "grad_norm": 0.11895658075809479, "learning_rate": 7.365621297644686e-05, "loss": 0.1084, "mean_token_accuracy": 0.9556490182876587, "num_tokens": 1234397.0, "step": 237 }, { "epoch": 3.0126582278481013, "grad_norm": 0.07659917324781418, "learning_rate": 7.286582344042625e-05, "loss": 0.1094, "mean_token_accuracy": 0.9530108571052551, "num_tokens": 1239526.0, "step": 238 }, { "epoch": 3.0253164556962027, "grad_norm": 0.08306147903203964, "learning_rate": 7.207725954972913e-05, "loss": 0.1029, "mean_token_accuracy": 0.9556412696838379, "num_tokens": 1244775.0, "step": 239 }, { "epoch": 3.037974683544304, "grad_norm": 0.11685889959335327, "learning_rate": 7.129057436061739e-05, "loss": 0.1036, "mean_token_accuracy": 0.9539796113967896, "num_tokens": 1250141.0, "step": 240 }, { "epoch": 3.050632911392405, "grad_norm": 0.08046155422925949, "learning_rate": 7.050582080294996e-05, "loss": 0.1042, "mean_token_accuracy": 0.9550777673721313, "num_tokens": 1255414.0, "step": 241 }, { "epoch": 3.0632911392405062, "grad_norm": 0.09916442632675171, "learning_rate": 6.972305167662145e-05, "loss": 0.1107, "mean_token_accuracy": 0.9493569135665894, "num_tokens": 1260454.0, "step": 242 }, { "epoch": 3.0759493670886076, "grad_norm": 0.07666052132844925, "learning_rate": 6.89423196480097e-05, "loss": 0.107, "mean_token_accuracy": 0.9538767337799072, "num_tokens": 1265548.0, "step": 243 }, { "epoch": 3.088607594936709, "grad_norm": 0.09515383839607239, "learning_rate": 6.816367724643224e-05, "loss": 0.103, "mean_token_accuracy": 0.9558286666870117, "num_tokens": 1270819.0, "step": 244 }, { "epoch": 3.1012658227848102, "grad_norm": 0.07828706502914429, "learning_rate": 6.738717686061206e-05, "loss": 0.1075, "mean_token_accuracy": 0.9554416537284851, "num_tokens": 1275955.0, "step": 245 }, { "epoch": 3.1139240506329116, "grad_norm": 0.06959263980388641, "learning_rate": 6.661287073515275e-05, "loss": 0.1057, "mean_token_accuracy": 0.9535741806030273, "num_tokens": 1281167.0, "step": 246 }, { "epoch": 3.1265822784810124, "grad_norm": 0.08991727977991104, "learning_rate": 6.58408109670234e-05, "loss": 0.1062, "mean_token_accuracy": 0.9538699388504028, "num_tokens": 1286412.0, "step": 247 }, { "epoch": 3.1392405063291138, "grad_norm": 0.0742548480629921, "learning_rate": 6.507104950205336e-05, "loss": 0.1057, "mean_token_accuracy": 0.9552783370018005, "num_tokens": 1291686.0, "step": 248 }, { "epoch": 3.151898734177215, "grad_norm": 0.09274096041917801, "learning_rate": 6.430363813143716e-05, "loss": 0.108, "mean_token_accuracy": 0.9522682428359985, "num_tokens": 1296820.0, "step": 249 }, { "epoch": 3.1645569620253164, "grad_norm": 0.07980688661336899, "learning_rate": 6.35386284882501e-05, "loss": 0.1049, "mean_token_accuracy": 0.954318642616272, "num_tokens": 1302094.0, "step": 250 }, { "epoch": 3.1772151898734178, "grad_norm": 0.0840386226773262, "learning_rate": 6.277607204397408e-05, "loss": 0.1056, "mean_token_accuracy": 0.9568414688110352, "num_tokens": 1307325.0, "step": 251 }, { "epoch": 3.189873417721519, "grad_norm": 0.11037012934684753, "learning_rate": 6.201602010503454e-05, "loss": 0.1121, "mean_token_accuracy": 0.950276255607605, "num_tokens": 1312276.0, "step": 252 }, { "epoch": 3.2025316455696204, "grad_norm": 0.08207038044929504, "learning_rate": 6.125852380934841e-05, "loss": 0.1086, "mean_token_accuracy": 0.9517102837562561, "num_tokens": 1317310.0, "step": 253 }, { "epoch": 3.2151898734177213, "grad_norm": 0.08561797440052032, "learning_rate": 6.0503634122883556e-05, "loss": 0.1088, "mean_token_accuracy": 0.9532359838485718, "num_tokens": 1322442.0, "step": 254 }, { "epoch": 3.2278481012658227, "grad_norm": 0.1632906049489975, "learning_rate": 5.975140183622958e-05, "loss": 0.1022, "mean_token_accuracy": 0.9594208598136902, "num_tokens": 1327755.0, "step": 255 }, { "epoch": 3.240506329113924, "grad_norm": 0.07698379456996918, "learning_rate": 5.900187756118055e-05, "loss": 0.1091, "mean_token_accuracy": 0.9542356133460999, "num_tokens": 1332954.0, "step": 256 }, { "epoch": 3.2531645569620253, "grad_norm": 0.07018712162971497, "learning_rate": 5.8255111727329717e-05, "loss": 0.1051, "mean_token_accuracy": 0.955034613609314, "num_tokens": 1338222.0, "step": 257 }, { "epoch": 3.2658227848101267, "grad_norm": 0.07832547277212143, "learning_rate": 5.751115457867653e-05, "loss": 0.1057, "mean_token_accuracy": 0.954049825668335, "num_tokens": 1343422.0, "step": 258 }, { "epoch": 3.278481012658228, "grad_norm": 0.11230257153511047, "learning_rate": 5.6770056170246175e-05, "loss": 0.1061, "mean_token_accuracy": 0.9552909135818481, "num_tokens": 1348608.0, "step": 259 }, { "epoch": 3.291139240506329, "grad_norm": 0.07142212241888046, "learning_rate": 5.6031866364721554e-05, "loss": 0.1072, "mean_token_accuracy": 0.9554328322410583, "num_tokens": 1353743.0, "step": 260 }, { "epoch": 3.3037974683544302, "grad_norm": 0.0787329375743866, "learning_rate": 5.529663482908864e-05, "loss": 0.1051, "mean_token_accuracy": 0.953653872013092, "num_tokens": 1359007.0, "step": 261 }, { "epoch": 3.3164556962025316, "grad_norm": 0.1963065266609192, "learning_rate": 5.4564411031294695e-05, "loss": 0.1095, "mean_token_accuracy": 0.9543879628181458, "num_tokens": 1364267.0, "step": 262 }, { "epoch": 3.329113924050633, "grad_norm": 0.07281672954559326, "learning_rate": 5.383524423691994e-05, "loss": 0.1023, "mean_token_accuracy": 0.9560855627059937, "num_tokens": 1369614.0, "step": 263 }, { "epoch": 3.3417721518987342, "grad_norm": 0.09342652559280396, "learning_rate": 5.310918350586291e-05, "loss": 0.1104, "mean_token_accuracy": 0.952820897102356, "num_tokens": 1374765.0, "step": 264 }, { "epoch": 3.3544303797468356, "grad_norm": 0.07760917395353317, "learning_rate": 5.2386277689039565e-05, "loss": 0.1062, "mean_token_accuracy": 0.9535561800003052, "num_tokens": 1379975.0, "step": 265 }, { "epoch": 3.367088607594937, "grad_norm": 0.0827326700091362, "learning_rate": 5.1666575425096396e-05, "loss": 0.1073, "mean_token_accuracy": 0.9565638899803162, "num_tokens": 1385196.0, "step": 266 }, { "epoch": 3.379746835443038, "grad_norm": 0.06986885517835617, "learning_rate": 5.095012513713815e-05, "loss": 0.1025, "mean_token_accuracy": 0.9559379816055298, "num_tokens": 1390548.0, "step": 267 }, { "epoch": 3.392405063291139, "grad_norm": 0.0762210562825203, "learning_rate": 5.023697502946969e-05, "loss": 0.1104, "mean_token_accuracy": 0.9542302489280701, "num_tokens": 1395659.0, "step": 268 }, { "epoch": 3.4050632911392404, "grad_norm": 0.08255967497825623, "learning_rate": 4.9527173084352544e-05, "loss": 0.102, "mean_token_accuracy": 0.9543691277503967, "num_tokens": 1401136.0, "step": 269 }, { "epoch": 3.4177215189873418, "grad_norm": 0.2949913442134857, "learning_rate": 4.882076705877689e-05, "loss": 0.1044, "mean_token_accuracy": 0.9576367735862732, "num_tokens": 1406464.0, "step": 270 }, { "epoch": 3.430379746835443, "grad_norm": 0.0810595452785492, "learning_rate": 4.811780448124812e-05, "loss": 0.1116, "mean_token_accuracy": 0.9548583030700684, "num_tokens": 1411468.0, "step": 271 }, { "epoch": 3.4430379746835444, "grad_norm": 0.11588563770055771, "learning_rate": 4.741833264858909e-05, "loss": 0.1096, "mean_token_accuracy": 0.9515007138252258, "num_tokens": 1416563.0, "step": 272 }, { "epoch": 3.4556962025316453, "grad_norm": 0.12587064504623413, "learning_rate": 4.6722398622757935e-05, "loss": 0.1046, "mean_token_accuracy": 0.9545803070068359, "num_tokens": 1421845.0, "step": 273 }, { "epoch": 3.4683544303797467, "grad_norm": 0.09493621438741684, "learning_rate": 4.603004922768148e-05, "loss": 0.1055, "mean_token_accuracy": 0.9531071186065674, "num_tokens": 1427155.0, "step": 274 }, { "epoch": 3.481012658227848, "grad_norm": 0.12601108849048615, "learning_rate": 4.5341331046105064e-05, "loss": 0.1048, "mean_token_accuracy": 0.9577872157096863, "num_tokens": 1432407.0, "step": 275 }, { "epoch": 3.4936708860759493, "grad_norm": 0.10189390927553177, "learning_rate": 4.465629041645819e-05, "loss": 0.1126, "mean_token_accuracy": 0.9512391686439514, "num_tokens": 1437434.0, "step": 276 }, { "epoch": 3.5063291139240507, "grad_norm": 0.0744316354393959, "learning_rate": 4.397497342973676e-05, "loss": 0.1011, "mean_token_accuracy": 0.9574943780899048, "num_tokens": 1442862.0, "step": 277 }, { "epoch": 3.518987341772152, "grad_norm": 0.08852620422840118, "learning_rate": 4.3297425926402115e-05, "loss": 0.1056, "mean_token_accuracy": 0.9545888304710388, "num_tokens": 1448167.0, "step": 278 }, { "epoch": 3.5316455696202533, "grad_norm": 0.10621877759695053, "learning_rate": 4.2623693493296644e-05, "loss": 0.1062, "mean_token_accuracy": 0.9530797600746155, "num_tokens": 1453410.0, "step": 279 }, { "epoch": 3.5443037974683547, "grad_norm": 0.12595853209495544, "learning_rate": 4.1953821460576715e-05, "loss": 0.1061, "mean_token_accuracy": 0.9557862281799316, "num_tokens": 1458676.0, "step": 280 }, { "epoch": 3.5569620253164556, "grad_norm": 0.07249915599822998, "learning_rate": 4.1287854898662705e-05, "loss": 0.1051, "mean_token_accuracy": 0.9545806050300598, "num_tokens": 1463914.0, "step": 281 }, { "epoch": 3.569620253164557, "grad_norm": 0.07927811145782471, "learning_rate": 4.0625838615206566e-05, "loss": 0.1098, "mean_token_accuracy": 0.9522687196731567, "num_tokens": 1469069.0, "step": 282 }, { "epoch": 3.5822784810126582, "grad_norm": 0.090684674680233, "learning_rate": 3.996781715207706e-05, "loss": 0.1066, "mean_token_accuracy": 0.9550113677978516, "num_tokens": 1474401.0, "step": 283 }, { "epoch": 3.5949367088607596, "grad_norm": 0.08619457483291626, "learning_rate": 3.9313834782362926e-05, "loss": 0.1077, "mean_token_accuracy": 0.956727921962738, "num_tokens": 1479526.0, "step": 284 }, { "epoch": 3.607594936708861, "grad_norm": 0.08588071167469025, "learning_rate": 3.866393550739416e-05, "loss": 0.107, "mean_token_accuracy": 0.951872706413269, "num_tokens": 1484743.0, "step": 285 }, { "epoch": 3.620253164556962, "grad_norm": 0.14406421780586243, "learning_rate": 3.801816305378124e-05, "loss": 0.105, "mean_token_accuracy": 0.9508963227272034, "num_tokens": 1489939.0, "step": 286 }, { "epoch": 3.632911392405063, "grad_norm": 0.07721186429262161, "learning_rate": 3.737656087047347e-05, "loss": 0.1072, "mean_token_accuracy": 0.955703616142273, "num_tokens": 1495105.0, "step": 287 }, { "epoch": 3.6455696202531644, "grad_norm": 0.12911659479141235, "learning_rate": 3.673917212583538e-05, "loss": 0.1072, "mean_token_accuracy": 0.9535064101219177, "num_tokens": 1500331.0, "step": 288 }, { "epoch": 3.6582278481012658, "grad_norm": 0.11017242074012756, "learning_rate": 3.610603970474239e-05, "loss": 0.1031, "mean_token_accuracy": 0.955674409866333, "num_tokens": 1505629.0, "step": 289 }, { "epoch": 3.670886075949367, "grad_norm": 0.08761169761419296, "learning_rate": 3.547720620569539e-05, "loss": 0.1072, "mean_token_accuracy": 0.9508035778999329, "num_tokens": 1510795.0, "step": 290 }, { "epoch": 3.6835443037974684, "grad_norm": 0.09792128205299377, "learning_rate": 3.485271393795453e-05, "loss": 0.103, "mean_token_accuracy": 0.9534751176834106, "num_tokens": 1516125.0, "step": 291 }, { "epoch": 3.6962025316455698, "grad_norm": 0.12610845267772675, "learning_rate": 3.4232604918692754e-05, "loss": 0.1055, "mean_token_accuracy": 0.9523255825042725, "num_tokens": 1521349.0, "step": 292 }, { "epoch": 3.708860759493671, "grad_norm": 0.08853945136070251, "learning_rate": 3.361692087016863e-05, "loss": 0.1059, "mean_token_accuracy": 0.9500682950019836, "num_tokens": 1526540.0, "step": 293 }, { "epoch": 3.721518987341772, "grad_norm": 0.06902845948934555, "learning_rate": 3.300570321691934e-05, "loss": 0.1056, "mean_token_accuracy": 0.9520946741104126, "num_tokens": 1531760.0, "step": 294 }, { "epoch": 3.7341772151898733, "grad_norm": 0.07241090387105942, "learning_rate": 3.2398993082973294e-05, "loss": 0.1009, "mean_token_accuracy": 0.9556169509887695, "num_tokens": 1537254.0, "step": 295 }, { "epoch": 3.7468354430379747, "grad_norm": 0.10073200613260269, "learning_rate": 3.179683128908352e-05, "loss": 0.1069, "mean_token_accuracy": 0.9539434909820557, "num_tokens": 1542377.0, "step": 296 }, { "epoch": 3.759493670886076, "grad_norm": 0.0977904349565506, "learning_rate": 3.1199258349980966e-05, "loss": 0.1071, "mean_token_accuracy": 0.9532988667488098, "num_tokens": 1547473.0, "step": 297 }, { "epoch": 3.7721518987341773, "grad_norm": 0.08963675051927567, "learning_rate": 3.0606314471648643e-05, "loss": 0.1049, "mean_token_accuracy": 0.952194333076477, "num_tokens": 1552641.0, "step": 298 }, { "epoch": 3.7848101265822782, "grad_norm": 0.08540157228708267, "learning_rate": 3.0018039548616494e-05, "loss": 0.1078, "mean_token_accuracy": 0.9502468109130859, "num_tokens": 1557770.0, "step": 299 }, { "epoch": 3.7974683544303796, "grad_norm": 0.07660060375928879, "learning_rate": 2.943447316127712e-05, "loss": 0.1101, "mean_token_accuracy": 0.9517952799797058, "num_tokens": 1562875.0, "step": 300 }, { "epoch": 3.810126582278481, "grad_norm": 0.08242560923099518, "learning_rate": 2.8855654573222825e-05, "loss": 0.1087, "mean_token_accuracy": 0.9529340863227844, "num_tokens": 1567932.0, "step": 301 }, { "epoch": 3.8227848101265822, "grad_norm": 0.07197526842355728, "learning_rate": 2.8281622728603864e-05, "loss": 0.1072, "mean_token_accuracy": 0.9523903131484985, "num_tokens": 1573079.0, "step": 302 }, { "epoch": 3.8354430379746836, "grad_norm": 0.0890003964304924, "learning_rate": 2.7712416249508177e-05, "loss": 0.1092, "mean_token_accuracy": 0.9537814855575562, "num_tokens": 1578141.0, "step": 303 }, { "epoch": 3.848101265822785, "grad_norm": 0.10012844949960709, "learning_rate": 2.714807343336273e-05, "loss": 0.108, "mean_token_accuracy": 0.9498612880706787, "num_tokens": 1583251.0, "step": 304 }, { "epoch": 3.8607594936708862, "grad_norm": 0.08376947045326233, "learning_rate": 2.6588632250356948e-05, "loss": 0.1057, "mean_token_accuracy": 0.9516860842704773, "num_tokens": 1588386.0, "step": 305 }, { "epoch": 3.8734177215189876, "grad_norm": 0.12690703570842743, "learning_rate": 2.6034130340887895e-05, "loss": 0.1088, "mean_token_accuracy": 0.9529805183410645, "num_tokens": 1593533.0, "step": 306 }, { "epoch": 3.8860759493670884, "grad_norm": 0.09463846683502197, "learning_rate": 2.5484605013027784e-05, "loss": 0.101, "mean_token_accuracy": 0.9561387300491333, "num_tokens": 1598932.0, "step": 307 }, { "epoch": 3.8987341772151898, "grad_norm": 0.0749184638261795, "learning_rate": 2.4940093240013717e-05, "loss": 0.1017, "mean_token_accuracy": 0.9565382599830627, "num_tokens": 1604265.0, "step": 308 }, { "epoch": 3.911392405063291, "grad_norm": 0.0753999873995781, "learning_rate": 2.4400631657760186e-05, "loss": 0.1048, "mean_token_accuracy": 0.9529388546943665, "num_tokens": 1609450.0, "step": 309 }, { "epoch": 3.9240506329113924, "grad_norm": 0.09461472928524017, "learning_rate": 2.3866256562394083e-05, "loss": 0.1053, "mean_token_accuracy": 0.9552039504051208, "num_tokens": 1614760.0, "step": 310 }, { "epoch": 3.9367088607594938, "grad_norm": 0.08459661155939102, "learning_rate": 2.333700390781256e-05, "loss": 0.1062, "mean_token_accuracy": 0.9539961218833923, "num_tokens": 1619954.0, "step": 311 }, { "epoch": 3.9493670886075947, "grad_norm": 0.0780106633901596, "learning_rate": 2.2812909303264085e-05, "loss": 0.1086, "mean_token_accuracy": 0.9520302414894104, "num_tokens": 1625042.0, "step": 312 }, { "epoch": 3.962025316455696, "grad_norm": 0.0692264512181282, "learning_rate": 2.2294008010952382e-05, "loss": 0.1052, "mean_token_accuracy": 0.9553224444389343, "num_tokens": 1630254.0, "step": 313 }, { "epoch": 3.9746835443037973, "grad_norm": 0.08776938170194626, "learning_rate": 2.1780334943664162e-05, "loss": 0.108, "mean_token_accuracy": 0.9492525458335876, "num_tokens": 1635402.0, "step": 314 }, { "epoch": 3.9873417721518987, "grad_norm": 0.08817070722579956, "learning_rate": 2.127192466241994e-05, "loss": 0.1033, "mean_token_accuracy": 0.955152690410614, "num_tokens": 1640706.0, "step": 315 }, { "epoch": 4.0, "grad_norm": 0.07555601745843887, "learning_rate": 2.07688113741488e-05, "loss": 0.1071, "mean_token_accuracy": 0.9514446258544922, "num_tokens": 1645754.0, "step": 316 }, { "epoch": 4.012658227848101, "grad_norm": 0.09684138000011444, "learning_rate": 2.0271028929386738e-05, "loss": 0.1006, "mean_token_accuracy": 0.956803023815155, "num_tokens": 1651073.0, "step": 317 }, { "epoch": 4.025316455696203, "grad_norm": 0.0689501166343689, "learning_rate": 1.977861081999931e-05, "loss": 0.1062, "mean_token_accuracy": 0.9500601887702942, "num_tokens": 1656123.0, "step": 318 }, { "epoch": 4.037974683544304, "grad_norm": 0.0964011624455452, "learning_rate": 1.92915901769281e-05, "loss": 0.1031, "mean_token_accuracy": 0.9536062479019165, "num_tokens": 1661317.0, "step": 319 }, { "epoch": 4.050632911392405, "grad_norm": 0.07395302504301071, "learning_rate": 1.880999976796164e-05, "loss": 0.1046, "mean_token_accuracy": 0.9519667625427246, "num_tokens": 1666440.0, "step": 320 }, { "epoch": 4.063291139240507, "grad_norm": 0.08307081460952759, "learning_rate": 1.8333871995530726e-05, "loss": 0.1002, "mean_token_accuracy": 0.9573794603347778, "num_tokens": 1671877.0, "step": 321 }, { "epoch": 4.075949367088608, "grad_norm": 0.06272169202566147, "learning_rate": 1.786323889452828e-05, "loss": 0.1008, "mean_token_accuracy": 0.9574791193008423, "num_tokens": 1677209.0, "step": 322 }, { "epoch": 4.0886075949367084, "grad_norm": 0.07284139841794968, "learning_rate": 1.739813213015401e-05, "loss": 0.104, "mean_token_accuracy": 0.9567620754241943, "num_tokens": 1682338.0, "step": 323 }, { "epoch": 4.10126582278481, "grad_norm": 0.06694748252630234, "learning_rate": 1.693858299578396e-05, "loss": 0.1031, "mean_token_accuracy": 0.9539980292320251, "num_tokens": 1687467.0, "step": 324 }, { "epoch": 4.113924050632911, "grad_norm": 0.07162707298994064, "learning_rate": 1.6484622410864835e-05, "loss": 0.1022, "mean_token_accuracy": 0.954440176486969, "num_tokens": 1692711.0, "step": 325 }, { "epoch": 4.1265822784810124, "grad_norm": 0.06535227596759796, "learning_rate": 1.6036280918833924e-05, "loss": 0.1022, "mean_token_accuracy": 0.9556373357772827, "num_tokens": 1697937.0, "step": 326 }, { "epoch": 4.139240506329114, "grad_norm": 0.07000143826007843, "learning_rate": 1.5593588685063896e-05, "loss": 0.1018, "mean_token_accuracy": 0.9560693502426147, "num_tokens": 1703191.0, "step": 327 }, { "epoch": 4.151898734177215, "grad_norm": 0.07342347502708435, "learning_rate": 1.515657549483328e-05, "loss": 0.1062, "mean_token_accuracy": 0.9525246620178223, "num_tokens": 1708226.0, "step": 328 }, { "epoch": 4.1645569620253164, "grad_norm": 0.08151296526193619, "learning_rate": 1.4725270751322452e-05, "loss": 0.1073, "mean_token_accuracy": 0.9529818892478943, "num_tokens": 1713203.0, "step": 329 }, { "epoch": 4.177215189873418, "grad_norm": 0.06281263381242752, "learning_rate": 1.4299703473635218e-05, "loss": 0.0973, "mean_token_accuracy": 0.958076000213623, "num_tokens": 1718610.0, "step": 330 }, { "epoch": 4.189873417721519, "grad_norm": 0.08737554401159286, "learning_rate": 1.3879902294846536e-05, "loss": 0.1069, "mean_token_accuracy": 0.9523618221282959, "num_tokens": 1723649.0, "step": 331 }, { "epoch": 4.2025316455696204, "grad_norm": 0.12319174408912659, "learning_rate": 1.3465895460075873e-05, "loss": 0.1023, "mean_token_accuracy": 0.9562439322471619, "num_tokens": 1728878.0, "step": 332 }, { "epoch": 4.215189873417722, "grad_norm": 0.07765615731477737, "learning_rate": 1.3057710824586899e-05, "loss": 0.106, "mean_token_accuracy": 0.9550222158432007, "num_tokens": 1733900.0, "step": 333 }, { "epoch": 4.227848101265823, "grad_norm": 0.0769255980849266, "learning_rate": 1.2655375851913232e-05, "loss": 0.1029, "mean_token_accuracy": 0.9560784101486206, "num_tokens": 1739064.0, "step": 334 }, { "epoch": 4.2405063291139244, "grad_norm": 0.07434723526239395, "learning_rate": 1.22589176120107e-05, "loss": 0.0997, "mean_token_accuracy": 0.9566869139671326, "num_tokens": 1744392.0, "step": 335 }, { "epoch": 4.253164556962025, "grad_norm": 0.06731196492910385, "learning_rate": 1.186836277943606e-05, "loss": 0.1056, "mean_token_accuracy": 0.9545182585716248, "num_tokens": 1749469.0, "step": 336 }, { "epoch": 4.265822784810126, "grad_norm": 0.07609716057777405, "learning_rate": 1.1483737631552161e-05, "loss": 0.1023, "mean_token_accuracy": 0.953596293926239, "num_tokens": 1754705.0, "step": 337 }, { "epoch": 4.2784810126582276, "grad_norm": 0.07831935584545135, "learning_rate": 1.1105068046760048e-05, "loss": 0.1022, "mean_token_accuracy": 0.9571400880813599, "num_tokens": 1759902.0, "step": 338 }, { "epoch": 4.291139240506329, "grad_norm": 0.09007194638252258, "learning_rate": 1.0732379502757717e-05, "loss": 0.104, "mean_token_accuracy": 0.9568931460380554, "num_tokens": 1765000.0, "step": 339 }, { "epoch": 4.30379746835443, "grad_norm": 0.07691890746355057, "learning_rate": 1.036569707482602e-05, "loss": 0.104, "mean_token_accuracy": 0.953274667263031, "num_tokens": 1770179.0, "step": 340 }, { "epoch": 4.3164556962025316, "grad_norm": 0.06939467787742615, "learning_rate": 1.0005045434141502e-05, "loss": 0.1, "mean_token_accuracy": 0.956974983215332, "num_tokens": 1775519.0, "step": 341 }, { "epoch": 4.329113924050633, "grad_norm": 0.08041319996118546, "learning_rate": 9.6504488461164e-06, "loss": 0.1049, "mean_token_accuracy": 0.95549076795578, "num_tokens": 1780728.0, "step": 342 }, { "epoch": 4.341772151898734, "grad_norm": 0.07367473840713501, "learning_rate": 9.301931168766164e-06, "loss": 0.1011, "mean_token_accuracy": 0.956186056137085, "num_tokens": 1785973.0, "step": 343 }, { "epoch": 4.3544303797468356, "grad_norm": 0.07549143582582474, "learning_rate": 8.959515851104117e-06, "loss": 0.1051, "mean_token_accuracy": 0.9559249877929688, "num_tokens": 1791210.0, "step": 344 }, { "epoch": 4.367088607594937, "grad_norm": 0.07187310606241226, "learning_rate": 8.623225931563805e-06, "loss": 0.104, "mean_token_accuracy": 0.9560890197753906, "num_tokens": 1796398.0, "step": 345 }, { "epoch": 4.379746835443038, "grad_norm": 0.06743541359901428, "learning_rate": 8.293084036448895e-06, "loss": 0.0988, "mean_token_accuracy": 0.9584117531776428, "num_tokens": 1801776.0, "step": 346 }, { "epoch": 4.3924050632911396, "grad_norm": 0.067915178835392, "learning_rate": 7.96911237841088e-06, "loss": 0.1004, "mean_token_accuracy": 0.9545979499816895, "num_tokens": 1807038.0, "step": 347 }, { "epoch": 4.405063291139241, "grad_norm": 0.09219470620155334, "learning_rate": 7.651332754954477e-06, "loss": 0.1003, "mean_token_accuracy": 0.9545368552207947, "num_tokens": 1812403.0, "step": 348 }, { "epoch": 4.417721518987342, "grad_norm": 0.11064563691616058, "learning_rate": 7.3397665469711495e-06, "loss": 0.1019, "mean_token_accuracy": 0.9539871215820312, "num_tokens": 1817596.0, "step": 349 }, { "epoch": 4.430379746835443, "grad_norm": 0.09897923469543457, "learning_rate": 7.034434717300509e-06, "loss": 0.105, "mean_token_accuracy": 0.9534472823143005, "num_tokens": 1822751.0, "step": 350 }, { "epoch": 4.443037974683544, "grad_norm": 0.07111285626888275, "learning_rate": 6.735357809319809e-06, "loss": 0.1018, "mean_token_accuracy": 0.9563706517219543, "num_tokens": 1827995.0, "step": 351 }, { "epoch": 4.455696202531645, "grad_norm": 0.2520071566104889, "learning_rate": 6.442555945561901e-06, "loss": 0.1053, "mean_token_accuracy": 0.9519890546798706, "num_tokens": 1833162.0, "step": 352 }, { "epoch": 4.468354430379747, "grad_norm": 0.12714385986328125, "learning_rate": 6.156048826361238e-06, "loss": 0.1061, "mean_token_accuracy": 0.9527450799942017, "num_tokens": 1838326.0, "step": 353 }, { "epoch": 4.481012658227848, "grad_norm": 0.08718091994524002, "learning_rate": 5.8758557285284125e-06, "loss": 0.1032, "mean_token_accuracy": 0.9563856720924377, "num_tokens": 1843503.0, "step": 354 }, { "epoch": 4.493670886075949, "grad_norm": 0.07357566058635712, "learning_rate": 5.6019955040531925e-06, "loss": 0.1023, "mean_token_accuracy": 0.9551690816879272, "num_tokens": 1848742.0, "step": 355 }, { "epoch": 4.506329113924051, "grad_norm": 0.07677753269672394, "learning_rate": 5.334486578836118e-06, "loss": 0.1004, "mean_token_accuracy": 0.9548485279083252, "num_tokens": 1854055.0, "step": 356 }, { "epoch": 4.518987341772152, "grad_norm": 0.07052655518054962, "learning_rate": 5.073346951448699e-06, "loss": 0.1038, "mean_token_accuracy": 0.9546507000923157, "num_tokens": 1859301.0, "step": 357 }, { "epoch": 4.531645569620253, "grad_norm": 0.07745072990655899, "learning_rate": 4.818594191922576e-06, "loss": 0.1005, "mean_token_accuracy": 0.95723557472229, "num_tokens": 1864603.0, "step": 358 }, { "epoch": 4.544303797468355, "grad_norm": 0.08845014125108719, "learning_rate": 4.5702454405672e-06, "loss": 0.105, "mean_token_accuracy": 0.9560937285423279, "num_tokens": 1869746.0, "step": 359 }, { "epoch": 4.556962025316456, "grad_norm": 0.0690731629729271, "learning_rate": 4.328317406816751e-06, "loss": 0.1015, "mean_token_accuracy": 0.9542607665061951, "num_tokens": 1875079.0, "step": 360 }, { "epoch": 4.569620253164557, "grad_norm": 0.0831163302063942, "learning_rate": 4.092826368105795e-06, "loss": 0.1051, "mean_token_accuracy": 0.9527947902679443, "num_tokens": 1880206.0, "step": 361 }, { "epoch": 4.582278481012658, "grad_norm": 0.0732286274433136, "learning_rate": 3.863788168774118e-06, "loss": 0.0997, "mean_token_accuracy": 0.9570702314376831, "num_tokens": 1885581.0, "step": 362 }, { "epoch": 4.594936708860759, "grad_norm": 0.08837465196847916, "learning_rate": 3.6412182190007082e-06, "loss": 0.105, "mean_token_accuracy": 0.9544827342033386, "num_tokens": 1890720.0, "step": 363 }, { "epoch": 4.6075949367088604, "grad_norm": 0.08702041208744049, "learning_rate": 3.425131493766931e-06, "loss": 0.1033, "mean_token_accuracy": 0.9553981423377991, "num_tokens": 1896008.0, "step": 364 }, { "epoch": 4.620253164556962, "grad_norm": 0.09506855905056, "learning_rate": 3.2155425318489584e-06, "loss": 0.1046, "mean_token_accuracy": 0.9514335989952087, "num_tokens": 1901199.0, "step": 365 }, { "epoch": 4.632911392405063, "grad_norm": 0.07980173826217651, "learning_rate": 3.012465434839529e-06, "loss": 0.1028, "mean_token_accuracy": 0.9555080533027649, "num_tokens": 1906410.0, "step": 366 }, { "epoch": 4.6455696202531644, "grad_norm": 0.07992957532405853, "learning_rate": 2.8159138661992824e-06, "loss": 0.0993, "mean_token_accuracy": 0.9551005363464355, "num_tokens": 1911797.0, "step": 367 }, { "epoch": 4.658227848101266, "grad_norm": 0.06562772393226624, "learning_rate": 2.6259010503373206e-06, "loss": 0.1005, "mean_token_accuracy": 0.9560797810554504, "num_tokens": 1917075.0, "step": 368 }, { "epoch": 4.670886075949367, "grad_norm": 0.08056320250034332, "learning_rate": 2.4424397717215387e-06, "loss": 0.1007, "mean_token_accuracy": 0.9569810032844543, "num_tokens": 1922346.0, "step": 369 }, { "epoch": 4.6835443037974684, "grad_norm": 0.0747138187289238, "learning_rate": 2.2655423740183924e-06, "loss": 0.1052, "mean_token_accuracy": 0.9540755748748779, "num_tokens": 1927440.0, "step": 370 }, { "epoch": 4.69620253164557, "grad_norm": 0.08138495683670044, "learning_rate": 2.0952207592624505e-06, "loss": 0.1023, "mean_token_accuracy": 0.9549393653869629, "num_tokens": 1932697.0, "step": 371 }, { "epoch": 4.708860759493671, "grad_norm": 0.07584184408187866, "learning_rate": 1.9314863870555255e-06, "loss": 0.1068, "mean_token_accuracy": 0.95260089635849, "num_tokens": 1937740.0, "step": 372 }, { "epoch": 4.7215189873417724, "grad_norm": 0.07171127945184708, "learning_rate": 1.7743502737957106e-06, "loss": 0.1037, "mean_token_accuracy": 0.9526029229164124, "num_tokens": 1942952.0, "step": 373 }, { "epoch": 4.734177215189874, "grad_norm": 0.07656321674585342, "learning_rate": 1.6238229919361858e-06, "loss": 0.1044, "mean_token_accuracy": 0.95380699634552, "num_tokens": 1948125.0, "step": 374 }, { "epoch": 4.746835443037975, "grad_norm": 0.07331555336713791, "learning_rate": 1.4799146692737741e-06, "loss": 0.1049, "mean_token_accuracy": 0.9529948234558105, "num_tokens": 1953231.0, "step": 375 }, { "epoch": 4.759493670886076, "grad_norm": 0.07884940505027771, "learning_rate": 1.3426349882676325e-06, "loss": 0.1068, "mean_token_accuracy": 0.9540776014328003, "num_tokens": 1958347.0, "step": 376 }, { "epoch": 4.772151898734177, "grad_norm": 0.1426946520805359, "learning_rate": 1.211993185387772e-06, "loss": 0.1001, "mean_token_accuracy": 0.9522359371185303, "num_tokens": 1963666.0, "step": 377 }, { "epoch": 4.784810126582278, "grad_norm": 0.07278037071228027, "learning_rate": 1.0879980504935772e-06, "loss": 0.1008, "mean_token_accuracy": 0.9554380774497986, "num_tokens": 1969026.0, "step": 378 }, { "epoch": 4.7974683544303796, "grad_norm": 0.08306018263101578, "learning_rate": 9.706579262424131e-07, "loss": 0.1028, "mean_token_accuracy": 0.9530498385429382, "num_tokens": 1974287.0, "step": 379 }, { "epoch": 4.810126582278481, "grad_norm": 0.08014005422592163, "learning_rate": 8.599807075283406e-07, "loss": 0.1036, "mean_token_accuracy": 0.9550078511238098, "num_tokens": 1979463.0, "step": 380 }, { "epoch": 4.822784810126582, "grad_norm": 0.09596075862646103, "learning_rate": 7.559738409508855e-07, "loss": 0.1025, "mean_token_accuracy": 0.954913318157196, "num_tokens": 1984717.0, "step": 381 }, { "epoch": 4.8354430379746836, "grad_norm": 0.08025940507650375, "learning_rate": 6.586443243140838e-07, "loss": 0.104, "mean_token_accuracy": 0.951367199420929, "num_tokens": 1989901.0, "step": 382 }, { "epoch": 4.848101265822785, "grad_norm": 0.12304380536079407, "learning_rate": 5.679987061555703e-07, "loss": 0.1032, "mean_token_accuracy": 0.9531791806221008, "num_tokens": 1995155.0, "step": 383 }, { "epoch": 4.860759493670886, "grad_norm": 0.07420387864112854, "learning_rate": 4.840430853060518e-07, "loss": 0.1052, "mean_token_accuracy": 0.9540906548500061, "num_tokens": 2000316.0, "step": 384 }, { "epoch": 4.8734177215189876, "grad_norm": 0.06775283068418503, "learning_rate": 4.0678311047890327e-07, "loss": 0.1049, "mean_token_accuracy": 0.951873779296875, "num_tokens": 2005450.0, "step": 385 }, { "epoch": 4.886075949367089, "grad_norm": 0.08906703442335129, "learning_rate": 3.362239798901712e-07, "loss": 0.1036, "mean_token_accuracy": 0.956197202205658, "num_tokens": 2010605.0, "step": 386 }, { "epoch": 4.89873417721519, "grad_norm": 0.06832820922136307, "learning_rate": 2.723704409087979e-07, "loss": 0.1024, "mean_token_accuracy": 0.954034149646759, "num_tokens": 2015825.0, "step": 387 }, { "epoch": 4.911392405063291, "grad_norm": 0.08005010336637497, "learning_rate": 2.1522678973718847e-07, "loss": 0.1018, "mean_token_accuracy": 0.9544236063957214, "num_tokens": 2021111.0, "step": 388 }, { "epoch": 4.924050632911392, "grad_norm": 0.09537311643362045, "learning_rate": 1.6479687112217479e-07, "loss": 0.102, "mean_token_accuracy": 0.9552180767059326, "num_tokens": 2026311.0, "step": 389 }, { "epoch": 4.936708860759493, "grad_norm": 0.07920707017183304, "learning_rate": 1.2108407809635624e-07, "loss": 0.1052, "mean_token_accuracy": 0.9539999961853027, "num_tokens": 2031375.0, "step": 390 }, { "epoch": 4.949367088607595, "grad_norm": 0.07268811017274857, "learning_rate": 8.40913517497377e-08, "loss": 0.1069, "mean_token_accuracy": 0.9519230723381042, "num_tokens": 2036431.0, "step": 391 }, { "epoch": 4.962025316455696, "grad_norm": 0.08966528624296188, "learning_rate": 5.382118103193223e-08, "loss": 0.1058, "mean_token_accuracy": 0.9516574740409851, "num_tokens": 2041563.0, "step": 392 }, { "epoch": 4.974683544303797, "grad_norm": 0.09453365951776505, "learning_rate": 3.027560258465067e-08, "loss": 0.1062, "mean_token_accuracy": 0.9526419043540955, "num_tokens": 2046737.0, "step": 393 }, { "epoch": 4.987341772151899, "grad_norm": 0.07027182728052139, "learning_rate": 1.345620060465569e-08, "loss": 0.1008, "mean_token_accuracy": 0.9557777643203735, "num_tokens": 2052002.0, "step": 394 }, { "epoch": 5.0, "grad_norm": 0.06676497310400009, "learning_rate": 3.3641067372358612e-09, "loss": 0.0987, "mean_token_accuracy": 0.9561353921890259, "num_tokens": 2057355.0, "step": 395 }, { "epoch": 5.0, "step": 395, "total_flos": 1.1838517166892646e+17, "train_loss": 0.13332003966162476, "train_runtime": 398.9704, "train_samples_per_second": 62.661, "train_steps_per_second": 0.99 } ], "logging_steps": 1.0, "max_steps": 395, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.1838517166892646e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }