| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 5.0, |
| "eval_steps": 500, |
| "global_step": 395, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.012658227848101266, |
| "grad_norm": 2.261342763900757, |
| "learning_rate": 0.0, |
| "loss": 0.9274, |
| "mean_token_accuracy": 0.8330742120742798, |
| "num_tokens": 5210.0, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.02531645569620253, |
| "grad_norm": 2.449852466583252, |
| "learning_rate": 1.6666666666666667e-05, |
| "loss": 0.9839, |
| "mean_token_accuracy": 0.8264493942260742, |
| "num_tokens": 10552.0, |
| "step": 2 |
| }, |
| { |
| "epoch": 0.0379746835443038, |
| "grad_norm": 2.1478281021118164, |
| "learning_rate": 3.3333333333333335e-05, |
| "loss": 0.8987, |
| "mean_token_accuracy": 0.8358815312385559, |
| "num_tokens": 15783.0, |
| "step": 3 |
| }, |
| { |
| "epoch": 0.05063291139240506, |
| "grad_norm": 1.6363688707351685, |
| "learning_rate": 5e-05, |
| "loss": 0.7419, |
| "mean_token_accuracy": 0.849078357219696, |
| "num_tokens": 21055.0, |
| "step": 4 |
| }, |
| { |
| "epoch": 0.06329113924050633, |
| "grad_norm": 1.1455320119857788, |
| "learning_rate": 6.666666666666667e-05, |
| "loss": 0.5762, |
| "mean_token_accuracy": 0.8692193627357483, |
| "num_tokens": 26525.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.0759493670886076, |
| "grad_norm": 0.8304877281188965, |
| "learning_rate": 8.333333333333334e-05, |
| "loss": 0.3965, |
| "mean_token_accuracy": 0.9039722084999084, |
| "num_tokens": 31775.0, |
| "step": 6 |
| }, |
| { |
| "epoch": 0.08860759493670886, |
| "grad_norm": 0.6689921617507935, |
| "learning_rate": 0.0001, |
| "loss": 0.3648, |
| "mean_token_accuracy": 0.901260495185852, |
| "num_tokens": 37075.0, |
| "step": 7 |
| }, |
| { |
| "epoch": 0.10126582278481013, |
| "grad_norm": 0.5956555008888245, |
| "learning_rate": 0.00011666666666666668, |
| "loss": 0.3464, |
| "mean_token_accuracy": 0.9010356664657593, |
| "num_tokens": 42353.0, |
| "step": 8 |
| }, |
| { |
| "epoch": 0.11392405063291139, |
| "grad_norm": 0.6162813305854797, |
| "learning_rate": 0.00013333333333333334, |
| "loss": 0.3337, |
| "mean_token_accuracy": 0.9090375304222107, |
| "num_tokens": 47529.0, |
| "step": 9 |
| }, |
| { |
| "epoch": 0.12658227848101267, |
| "grad_norm": 0.5204370617866516, |
| "learning_rate": 0.00015000000000000001, |
| "loss": 0.304, |
| "mean_token_accuracy": 0.912761926651001, |
| "num_tokens": 52843.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.13924050632911392, |
| "grad_norm": 0.48423895239830017, |
| "learning_rate": 0.0001666666666666667, |
| "loss": 0.2637, |
| "mean_token_accuracy": 0.9209375977516174, |
| "num_tokens": 57941.0, |
| "step": 11 |
| }, |
| { |
| "epoch": 0.1518987341772152, |
| "grad_norm": 0.38198572397232056, |
| "learning_rate": 0.00018333333333333334, |
| "loss": 0.2515, |
| "mean_token_accuracy": 0.9205062389373779, |
| "num_tokens": 63062.0, |
| "step": 12 |
| }, |
| { |
| "epoch": 0.16455696202531644, |
| "grad_norm": 0.33576324582099915, |
| "learning_rate": 0.0002, |
| "loss": 0.2714, |
| "mean_token_accuracy": 0.9151454567909241, |
| "num_tokens": 68111.0, |
| "step": 13 |
| }, |
| { |
| "epoch": 0.17721518987341772, |
| "grad_norm": 0.39188244938850403, |
| "learning_rate": 0.0001999966358932628, |
| "loss": 0.2835, |
| "mean_token_accuracy": 0.9112998843193054, |
| "num_tokens": 73237.0, |
| "step": 14 |
| }, |
| { |
| "epoch": 0.189873417721519, |
| "grad_norm": 0.337475448846817, |
| "learning_rate": 0.00019998654379939533, |
| "loss": 0.2363, |
| "mean_token_accuracy": 0.9202312231063843, |
| "num_tokens": 78491.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.20253164556962025, |
| "grad_norm": 0.3103994131088257, |
| "learning_rate": 0.00019996972439741538, |
| "loss": 0.252, |
| "mean_token_accuracy": 0.9178321957588196, |
| "num_tokens": 83703.0, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.21518987341772153, |
| "grad_norm": 0.3581632971763611, |
| "learning_rate": 0.0001999461788189681, |
| "loss": 0.2444, |
| "mean_token_accuracy": 0.9205324053764343, |
| "num_tokens": 88876.0, |
| "step": 17 |
| }, |
| { |
| "epoch": 0.22784810126582278, |
| "grad_norm": 0.32648301124572754, |
| "learning_rate": 0.00019991590864825028, |
| "loss": 0.234, |
| "mean_token_accuracy": 0.9243931770324707, |
| "num_tokens": 93966.0, |
| "step": 18 |
| }, |
| { |
| "epoch": 0.24050632911392406, |
| "grad_norm": 0.2799859642982483, |
| "learning_rate": 0.00019987891592190366, |
| "loss": 0.2141, |
| "mean_token_accuracy": 0.9284865260124207, |
| "num_tokens": 99078.0, |
| "step": 19 |
| }, |
| { |
| "epoch": 0.25316455696202533, |
| "grad_norm": 0.313972145318985, |
| "learning_rate": 0.00019983520312887785, |
| "loss": 0.1924, |
| "mean_token_accuracy": 0.9333333373069763, |
| "num_tokens": 104362.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.26582278481012656, |
| "grad_norm": 0.2953855097293854, |
| "learning_rate": 0.00019978477321026282, |
| "loss": 0.2044, |
| "mean_token_accuracy": 0.9312687516212463, |
| "num_tokens": 109431.0, |
| "step": 21 |
| }, |
| { |
| "epoch": 0.27848101265822783, |
| "grad_norm": 0.25561973452568054, |
| "learning_rate": 0.0001997276295590912, |
| "loss": 0.1856, |
| "mean_token_accuracy": 0.9355758428573608, |
| "num_tokens": 114757.0, |
| "step": 22 |
| }, |
| { |
| "epoch": 0.2911392405063291, |
| "grad_norm": 0.3690224885940552, |
| "learning_rate": 0.00019966377602010984, |
| "loss": 0.214, |
| "mean_token_accuracy": 0.9297286868095398, |
| "num_tokens": 119944.0, |
| "step": 23 |
| }, |
| { |
| "epoch": 0.3037974683544304, |
| "grad_norm": 0.30690351128578186, |
| "learning_rate": 0.0001995932168895211, |
| "loss": 0.2016, |
| "mean_token_accuracy": 0.9312902688980103, |
| "num_tokens": 125131.0, |
| "step": 24 |
| }, |
| { |
| "epoch": 0.31645569620253167, |
| "grad_norm": 0.2413513958454132, |
| "learning_rate": 0.00019951595691469396, |
| "loss": 0.1891, |
| "mean_token_accuracy": 0.9348336458206177, |
| "num_tokens": 130305.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.3291139240506329, |
| "grad_norm": 0.24211426079273224, |
| "learning_rate": 0.00019943200129384444, |
| "loss": 0.17, |
| "mean_token_accuracy": 0.9368179440498352, |
| "num_tokens": 135592.0, |
| "step": 26 |
| }, |
| { |
| "epoch": 0.34177215189873417, |
| "grad_norm": 0.2686380445957184, |
| "learning_rate": 0.0001993413556756859, |
| "loss": 0.1896, |
| "mean_token_accuracy": 0.9321302175521851, |
| "num_tokens": 140754.0, |
| "step": 27 |
| }, |
| { |
| "epoch": 0.35443037974683544, |
| "grad_norm": 0.23685204982757568, |
| "learning_rate": 0.0001992440261590491, |
| "loss": 0.1819, |
| "mean_token_accuracy": 0.9341317415237427, |
| "num_tokens": 145828.0, |
| "step": 28 |
| }, |
| { |
| "epoch": 0.3670886075949367, |
| "grad_norm": 0.2507152259349823, |
| "learning_rate": 0.00019914001929247167, |
| "loss": 0.1872, |
| "mean_token_accuracy": 0.9352476596832275, |
| "num_tokens": 151081.0, |
| "step": 29 |
| }, |
| { |
| "epoch": 0.379746835443038, |
| "grad_norm": 0.3149111270904541, |
| "learning_rate": 0.0001990293420737576, |
| "loss": 0.1856, |
| "mean_token_accuracy": 0.9363527297973633, |
| "num_tokens": 156157.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.3924050632911392, |
| "grad_norm": 0.32569149136543274, |
| "learning_rate": 0.00019891200194950643, |
| "loss": 0.1871, |
| "mean_token_accuracy": 0.9361127018928528, |
| "num_tokens": 161402.0, |
| "step": 31 |
| }, |
| { |
| "epoch": 0.4050632911392405, |
| "grad_norm": 0.22079512476921082, |
| "learning_rate": 0.00019878800681461222, |
| "loss": 0.1797, |
| "mean_token_accuracy": 0.9368836283683777, |
| "num_tokens": 166536.0, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.4177215189873418, |
| "grad_norm": 0.19111287593841553, |
| "learning_rate": 0.00019865736501173238, |
| "loss": 0.1579, |
| "mean_token_accuracy": 0.9415755867958069, |
| "num_tokens": 171906.0, |
| "step": 33 |
| }, |
| { |
| "epoch": 0.43037974683544306, |
| "grad_norm": 0.26968979835510254, |
| "learning_rate": 0.00019852008533072625, |
| "loss": 0.184, |
| "mean_token_accuracy": 0.9414872527122498, |
| "num_tokens": 177080.0, |
| "step": 34 |
| }, |
| { |
| "epoch": 0.4430379746835443, |
| "grad_norm": 0.22977136075496674, |
| "learning_rate": 0.00019837617700806383, |
| "loss": 0.1676, |
| "mean_token_accuracy": 0.939095139503479, |
| "num_tokens": 182316.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.45569620253164556, |
| "grad_norm": 0.24089650809764862, |
| "learning_rate": 0.00019822564972620427, |
| "loss": 0.1625, |
| "mean_token_accuracy": 0.9419515132904053, |
| "num_tokens": 187617.0, |
| "step": 36 |
| }, |
| { |
| "epoch": 0.46835443037974683, |
| "grad_norm": 0.2149692326784134, |
| "learning_rate": 0.0001980685136129445, |
| "loss": 0.1676, |
| "mean_token_accuracy": 0.939225435256958, |
| "num_tokens": 192716.0, |
| "step": 37 |
| }, |
| { |
| "epoch": 0.4810126582278481, |
| "grad_norm": 0.26619356870651245, |
| "learning_rate": 0.00019790477924073755, |
| "loss": 0.1611, |
| "mean_token_accuracy": 0.9411424994468689, |
| "num_tokens": 197979.0, |
| "step": 38 |
| }, |
| { |
| "epoch": 0.4936708860759494, |
| "grad_norm": 0.23377306759357452, |
| "learning_rate": 0.00019773445762598163, |
| "loss": 0.1641, |
| "mean_token_accuracy": 0.9381566047668457, |
| "num_tokens": 203088.0, |
| "step": 39 |
| }, |
| { |
| "epoch": 0.5063291139240507, |
| "grad_norm": 0.19846892356872559, |
| "learning_rate": 0.00019755756022827846, |
| "loss": 0.1535, |
| "mean_token_accuracy": 0.9402109980583191, |
| "num_tokens": 208270.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.5189873417721519, |
| "grad_norm": 0.23873910307884216, |
| "learning_rate": 0.00019737409894966267, |
| "loss": 0.1631, |
| "mean_token_accuracy": 0.9398959875106812, |
| "num_tokens": 213525.0, |
| "step": 41 |
| }, |
| { |
| "epoch": 0.5316455696202531, |
| "grad_norm": 0.20881879329681396, |
| "learning_rate": 0.00019718408613380074, |
| "loss": 0.1471, |
| "mean_token_accuracy": 0.9439833760261536, |
| "num_tokens": 218891.0, |
| "step": 42 |
| }, |
| { |
| "epoch": 0.5443037974683544, |
| "grad_norm": 0.2424459010362625, |
| "learning_rate": 0.00019698753456516048, |
| "loss": 0.1685, |
| "mean_token_accuracy": 0.9352998733520508, |
| "num_tokens": 224040.0, |
| "step": 43 |
| }, |
| { |
| "epoch": 0.5569620253164557, |
| "grad_norm": 0.21166983246803284, |
| "learning_rate": 0.00019678445746815107, |
| "loss": 0.1509, |
| "mean_token_accuracy": 0.9393350481987, |
| "num_tokens": 229247.0, |
| "step": 44 |
| }, |
| { |
| "epoch": 0.569620253164557, |
| "grad_norm": 0.1993303894996643, |
| "learning_rate": 0.00019657486850623306, |
| "loss": 0.1469, |
| "mean_token_accuracy": 0.943667471408844, |
| "num_tokens": 234459.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.5822784810126582, |
| "grad_norm": 0.25715190172195435, |
| "learning_rate": 0.00019635878178099928, |
| "loss": 0.1526, |
| "mean_token_accuracy": 0.942389190196991, |
| "num_tokens": 239713.0, |
| "step": 46 |
| }, |
| { |
| "epoch": 0.5949367088607594, |
| "grad_norm": 0.24931733310222626, |
| "learning_rate": 0.0001961362118312259, |
| "loss": 0.1563, |
| "mean_token_accuracy": 0.939279317855835, |
| "num_tokens": 244800.0, |
| "step": 47 |
| }, |
| { |
| "epoch": 0.6075949367088608, |
| "grad_norm": 0.26232779026031494, |
| "learning_rate": 0.0001959071736318942, |
| "loss": 0.1557, |
| "mean_token_accuracy": 0.9432733058929443, |
| "num_tokens": 250082.0, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.620253164556962, |
| "grad_norm": 0.1654760241508484, |
| "learning_rate": 0.00019567168259318325, |
| "loss": 0.1421, |
| "mean_token_accuracy": 0.9437916278839111, |
| "num_tokens": 255252.0, |
| "step": 49 |
| }, |
| { |
| "epoch": 0.6329113924050633, |
| "grad_norm": 0.21212145686149597, |
| "learning_rate": 0.00019542975455943281, |
| "loss": 0.162, |
| "mean_token_accuracy": 0.9394306540489197, |
| "num_tokens": 260269.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.6455696202531646, |
| "grad_norm": 0.20102886855602264, |
| "learning_rate": 0.00019518140580807744, |
| "loss": 0.1506, |
| "mean_token_accuracy": 0.9436455368995667, |
| "num_tokens": 265479.0, |
| "step": 51 |
| }, |
| { |
| "epoch": 0.6582278481012658, |
| "grad_norm": 0.19386816024780273, |
| "learning_rate": 0.00019492665304855132, |
| "loss": 0.1509, |
| "mean_token_accuracy": 0.9443071484565735, |
| "num_tokens": 270804.0, |
| "step": 52 |
| }, |
| { |
| "epoch": 0.6708860759493671, |
| "grad_norm": 0.214805006980896, |
| "learning_rate": 0.0001946655134211639, |
| "loss": 0.1503, |
| "mean_token_accuracy": 0.9397239089012146, |
| "num_tokens": 276011.0, |
| "step": 53 |
| }, |
| { |
| "epoch": 0.6835443037974683, |
| "grad_norm": 0.21464605629444122, |
| "learning_rate": 0.0001943980044959468, |
| "loss": 0.1462, |
| "mean_token_accuracy": 0.9446601867675781, |
| "num_tokens": 281225.0, |
| "step": 54 |
| }, |
| { |
| "epoch": 0.6962025316455697, |
| "grad_norm": 0.18139995634555817, |
| "learning_rate": 0.0001941241442714716, |
| "loss": 0.1563, |
| "mean_token_accuracy": 0.9417494535446167, |
| "num_tokens": 286422.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.7088607594936709, |
| "grad_norm": 0.19541846215724945, |
| "learning_rate": 0.0001938439511736388, |
| "loss": 0.1469, |
| "mean_token_accuracy": 0.9456856846809387, |
| "num_tokens": 291678.0, |
| "step": 56 |
| }, |
| { |
| "epoch": 0.7215189873417721, |
| "grad_norm": 0.17339253425598145, |
| "learning_rate": 0.0001935574440544381, |
| "loss": 0.1483, |
| "mean_token_accuracy": 0.94073486328125, |
| "num_tokens": 296804.0, |
| "step": 57 |
| }, |
| { |
| "epoch": 0.7341772151898734, |
| "grad_norm": 0.1698339283466339, |
| "learning_rate": 0.0001932646421906802, |
| "loss": 0.1499, |
| "mean_token_accuracy": 0.9414712190628052, |
| "num_tokens": 301857.0, |
| "step": 58 |
| }, |
| { |
| "epoch": 0.7468354430379747, |
| "grad_norm": 0.15577521920204163, |
| "learning_rate": 0.00019296556528269952, |
| "loss": 0.1367, |
| "mean_token_accuracy": 0.9456140398979187, |
| "num_tokens": 307051.0, |
| "step": 59 |
| }, |
| { |
| "epoch": 0.759493670886076, |
| "grad_norm": 0.1727830171585083, |
| "learning_rate": 0.00019266023345302887, |
| "loss": 0.1345, |
| "mean_token_accuracy": 0.9436017274856567, |
| "num_tokens": 312257.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.7721518987341772, |
| "grad_norm": 0.21114714443683624, |
| "learning_rate": 0.00019234866724504555, |
| "loss": 0.1493, |
| "mean_token_accuracy": 0.9414653182029724, |
| "num_tokens": 317412.0, |
| "step": 61 |
| }, |
| { |
| "epoch": 0.7848101265822784, |
| "grad_norm": 0.16771085560321808, |
| "learning_rate": 0.00019203088762158915, |
| "loss": 0.1359, |
| "mean_token_accuracy": 0.9490300416946411, |
| "num_tokens": 322734.0, |
| "step": 62 |
| }, |
| { |
| "epoch": 0.7974683544303798, |
| "grad_norm": 0.2068631500005722, |
| "learning_rate": 0.00019170691596355114, |
| "loss": 0.1369, |
| "mean_token_accuracy": 0.9427874684333801, |
| "num_tokens": 328129.0, |
| "step": 63 |
| }, |
| { |
| "epoch": 0.810126582278481, |
| "grad_norm": 0.21625596284866333, |
| "learning_rate": 0.00019137677406843619, |
| "loss": 0.1337, |
| "mean_token_accuracy": 0.9430990219116211, |
| "num_tokens": 333272.0, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.8227848101265823, |
| "grad_norm": 0.18965695798397064, |
| "learning_rate": 0.00019104048414889587, |
| "loss": 0.1402, |
| "mean_token_accuracy": 0.946105420589447, |
| "num_tokens": 338420.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.8354430379746836, |
| "grad_norm": 0.2020321488380432, |
| "learning_rate": 0.00019069806883123387, |
| "loss": 0.144, |
| "mean_token_accuracy": 0.9439906477928162, |
| "num_tokens": 343626.0, |
| "step": 66 |
| }, |
| { |
| "epoch": 0.8481012658227848, |
| "grad_norm": 0.16373580694198608, |
| "learning_rate": 0.00019034955115388363, |
| "loss": 0.1305, |
| "mean_token_accuracy": 0.9499515295028687, |
| "num_tokens": 348845.0, |
| "step": 67 |
| }, |
| { |
| "epoch": 0.8607594936708861, |
| "grad_norm": 0.21636246144771576, |
| "learning_rate": 0.00018999495456585854, |
| "loss": 0.1379, |
| "mean_token_accuracy": 0.9468349814414978, |
| "num_tokens": 354138.0, |
| "step": 68 |
| }, |
| { |
| "epoch": 0.8734177215189873, |
| "grad_norm": 0.17930467426776886, |
| "learning_rate": 0.00018963430292517398, |
| "loss": 0.1435, |
| "mean_token_accuracy": 0.9450312852859497, |
| "num_tokens": 359314.0, |
| "step": 69 |
| }, |
| { |
| "epoch": 0.8860759493670886, |
| "grad_norm": 0.1796340048313141, |
| "learning_rate": 0.00018926762049724228, |
| "loss": 0.1377, |
| "mean_token_accuracy": 0.9456329941749573, |
| "num_tokens": 364473.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.8987341772151899, |
| "grad_norm": 0.16919006407260895, |
| "learning_rate": 0.00018889493195323997, |
| "loss": 0.1388, |
| "mean_token_accuracy": 0.9469609260559082, |
| "num_tokens": 369703.0, |
| "step": 71 |
| }, |
| { |
| "epoch": 0.9113924050632911, |
| "grad_norm": 0.1674400418996811, |
| "learning_rate": 0.00018851626236844786, |
| "loss": 0.1344, |
| "mean_token_accuracy": 0.9464495778083801, |
| "num_tokens": 374865.0, |
| "step": 72 |
| }, |
| { |
| "epoch": 0.9240506329113924, |
| "grad_norm": 0.16778463125228882, |
| "learning_rate": 0.00018813163722056396, |
| "loss": 0.1444, |
| "mean_token_accuracy": 0.9406762719154358, |
| "num_tokens": 379986.0, |
| "step": 73 |
| }, |
| { |
| "epoch": 0.9367088607594937, |
| "grad_norm": 0.15615388751029968, |
| "learning_rate": 0.0001877410823879893, |
| "loss": 0.1285, |
| "mean_token_accuracy": 0.9444658160209656, |
| "num_tokens": 385254.0, |
| "step": 74 |
| }, |
| { |
| "epoch": 0.9493670886075949, |
| "grad_norm": 0.18973414599895477, |
| "learning_rate": 0.0001873446241480868, |
| "loss": 0.1351, |
| "mean_token_accuracy": 0.9457808136940002, |
| "num_tokens": 390556.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.9620253164556962, |
| "grad_norm": 0.1932706981897354, |
| "learning_rate": 0.00018694228917541313, |
| "loss": 0.1345, |
| "mean_token_accuracy": 0.9486399292945862, |
| "num_tokens": 395877.0, |
| "step": 76 |
| }, |
| { |
| "epoch": 0.9746835443037974, |
| "grad_norm": 0.21864649653434753, |
| "learning_rate": 0.00018653410453992413, |
| "loss": 0.1331, |
| "mean_token_accuracy": 0.9453898072242737, |
| "num_tokens": 400995.0, |
| "step": 77 |
| }, |
| { |
| "epoch": 0.9873417721518988, |
| "grad_norm": 0.16413134336471558, |
| "learning_rate": 0.0001861200977051535, |
| "loss": 0.1308, |
| "mean_token_accuracy": 0.9469521641731262, |
| "num_tokens": 406243.0, |
| "step": 78 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 0.22194692492485046, |
| "learning_rate": 0.0001857002965263648, |
| "loss": 0.1345, |
| "mean_token_accuracy": 0.9429290294647217, |
| "num_tokens": 411476.0, |
| "step": 79 |
| }, |
| { |
| "epoch": 1.0126582278481013, |
| "grad_norm": 0.15325264632701874, |
| "learning_rate": 0.00018527472924867756, |
| "loss": 0.1321, |
| "mean_token_accuracy": 0.9436901211738586, |
| "num_tokens": 416548.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 1.0253164556962024, |
| "grad_norm": 0.18894121050834656, |
| "learning_rate": 0.00018484342450516671, |
| "loss": 0.1278, |
| "mean_token_accuracy": 0.9453338384628296, |
| "num_tokens": 421734.0, |
| "step": 81 |
| }, |
| { |
| "epoch": 1.0379746835443038, |
| "grad_norm": 0.2188521921634674, |
| "learning_rate": 0.0001844064113149361, |
| "loss": 0.1267, |
| "mean_token_accuracy": 0.9463608860969543, |
| "num_tokens": 427074.0, |
| "step": 82 |
| }, |
| { |
| "epoch": 1.0506329113924051, |
| "grad_norm": 0.27444732189178467, |
| "learning_rate": 0.0001839637190811661, |
| "loss": 0.1249, |
| "mean_token_accuracy": 0.946395218372345, |
| "num_tokens": 432492.0, |
| "step": 83 |
| }, |
| { |
| "epoch": 1.0632911392405062, |
| "grad_norm": 0.14062751829624176, |
| "learning_rate": 0.00018351537758913518, |
| "loss": 0.1205, |
| "mean_token_accuracy": 0.9433669447898865, |
| "num_tokens": 437712.0, |
| "step": 84 |
| }, |
| { |
| "epoch": 1.0759493670886076, |
| "grad_norm": 0.2686416804790497, |
| "learning_rate": 0.00018306141700421606, |
| "loss": 0.1285, |
| "mean_token_accuracy": 0.9453015327453613, |
| "num_tokens": 442767.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 1.0886075949367089, |
| "grad_norm": 0.1684628427028656, |
| "learning_rate": 0.000182601867869846, |
| "loss": 0.1381, |
| "mean_token_accuracy": 0.9451888203620911, |
| "num_tokens": 447757.0, |
| "step": 86 |
| }, |
| { |
| "epoch": 1.1012658227848102, |
| "grad_norm": 0.21591678261756897, |
| "learning_rate": 0.00018213676110547176, |
| "loss": 0.1363, |
| "mean_token_accuracy": 0.9451231956481934, |
| "num_tokens": 452814.0, |
| "step": 87 |
| }, |
| { |
| "epoch": 1.1139240506329113, |
| "grad_norm": 0.22342060506343842, |
| "learning_rate": 0.0001816661280044693, |
| "loss": 0.1395, |
| "mean_token_accuracy": 0.9416748881340027, |
| "num_tokens": 457953.0, |
| "step": 88 |
| }, |
| { |
| "epoch": 1.1265822784810127, |
| "grad_norm": 0.15861928462982178, |
| "learning_rate": 0.00018119000023203837, |
| "loss": 0.1298, |
| "mean_token_accuracy": 0.9489896297454834, |
| "num_tokens": 463114.0, |
| "step": 89 |
| }, |
| { |
| "epoch": 1.139240506329114, |
| "grad_norm": 0.14701464772224426, |
| "learning_rate": 0.0001807084098230719, |
| "loss": 0.1247, |
| "mean_token_accuracy": 0.9497681856155396, |
| "num_tokens": 468354.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 1.1518987341772151, |
| "grad_norm": 0.11642320454120636, |
| "learning_rate": 0.0001802213891800007, |
| "loss": 0.1212, |
| "mean_token_accuracy": 0.949401319026947, |
| "num_tokens": 473596.0, |
| "step": 91 |
| }, |
| { |
| "epoch": 1.1645569620253164, |
| "grad_norm": 0.15525047481060028, |
| "learning_rate": 0.00017972897107061328, |
| "loss": 0.126, |
| "mean_token_accuracy": 0.9478814601898193, |
| "num_tokens": 478687.0, |
| "step": 92 |
| }, |
| { |
| "epoch": 1.1772151898734178, |
| "grad_norm": 0.15354906022548676, |
| "learning_rate": 0.00017923118862585123, |
| "loss": 0.1305, |
| "mean_token_accuracy": 0.9484842419624329, |
| "num_tokens": 483798.0, |
| "step": 93 |
| }, |
| { |
| "epoch": 1.189873417721519, |
| "grad_norm": 0.16433700919151306, |
| "learning_rate": 0.00017872807533758007, |
| "loss": 0.1331, |
| "mean_token_accuracy": 0.9448692202568054, |
| "num_tokens": 488832.0, |
| "step": 94 |
| }, |
| { |
| "epoch": 1.2025316455696202, |
| "grad_norm": 0.14196732640266418, |
| "learning_rate": 0.00017821966505633587, |
| "loss": 0.1252, |
| "mean_token_accuracy": 0.9504452347755432, |
| "num_tokens": 494062.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 1.2151898734177216, |
| "grad_norm": 0.15048350393772125, |
| "learning_rate": 0.00017770599198904763, |
| "loss": 0.128, |
| "mean_token_accuracy": 0.9498940110206604, |
| "num_tokens": 499315.0, |
| "step": 96 |
| }, |
| { |
| "epoch": 1.2278481012658227, |
| "grad_norm": 0.19549059867858887, |
| "learning_rate": 0.00017718709069673594, |
| "loss": 0.1345, |
| "mean_token_accuracy": 0.9464973211288452, |
| "num_tokens": 504575.0, |
| "step": 97 |
| }, |
| { |
| "epoch": 1.240506329113924, |
| "grad_norm": 0.1423873007297516, |
| "learning_rate": 0.00017666299609218745, |
| "loss": 0.1245, |
| "mean_token_accuracy": 0.9458649754524231, |
| "num_tokens": 509645.0, |
| "step": 98 |
| }, |
| { |
| "epoch": 1.2531645569620253, |
| "grad_norm": 0.1903885006904602, |
| "learning_rate": 0.00017613374343760594, |
| "loss": 0.1306, |
| "mean_token_accuracy": 0.9471228718757629, |
| "num_tokens": 514853.0, |
| "step": 99 |
| }, |
| { |
| "epoch": 1.2658227848101267, |
| "grad_norm": 0.15726621448993683, |
| "learning_rate": 0.00017559936834223982, |
| "loss": 0.1273, |
| "mean_token_accuracy": 0.9503991007804871, |
| "num_tokens": 520179.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 1.2784810126582278, |
| "grad_norm": 0.12970785796642303, |
| "learning_rate": 0.0001750599067599863, |
| "loss": 0.1249, |
| "mean_token_accuracy": 0.9486523866653442, |
| "num_tokens": 525326.0, |
| "step": 101 |
| }, |
| { |
| "epoch": 1.2911392405063291, |
| "grad_norm": 0.16852085292339325, |
| "learning_rate": 0.00017451539498697225, |
| "loss": 0.1302, |
| "mean_token_accuracy": 0.9456775784492493, |
| "num_tokens": 530526.0, |
| "step": 102 |
| }, |
| { |
| "epoch": 1.3037974683544304, |
| "grad_norm": 0.1304207593202591, |
| "learning_rate": 0.0001739658696591121, |
| "loss": 0.126, |
| "mean_token_accuracy": 0.9477406740188599, |
| "num_tokens": 535680.0, |
| "step": 103 |
| }, |
| { |
| "epoch": 1.3164556962025316, |
| "grad_norm": 0.12224633246660233, |
| "learning_rate": 0.00017341136774964307, |
| "loss": 0.1283, |
| "mean_token_accuracy": 0.9467939734458923, |
| "num_tokens": 540875.0, |
| "step": 104 |
| }, |
| { |
| "epoch": 1.3291139240506329, |
| "grad_norm": 0.15364806354045868, |
| "learning_rate": 0.0001728519265666373, |
| "loss": 0.1235, |
| "mean_token_accuracy": 0.9479364156723022, |
| "num_tokens": 546221.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 1.3417721518987342, |
| "grad_norm": 0.122112937271595, |
| "learning_rate": 0.00017228758375049185, |
| "loss": 0.1245, |
| "mean_token_accuracy": 0.943025529384613, |
| "num_tokens": 551375.0, |
| "step": 106 |
| }, |
| { |
| "epoch": 1.3544303797468356, |
| "grad_norm": 0.12079890817403793, |
| "learning_rate": 0.00017171837727139613, |
| "loss": 0.1232, |
| "mean_token_accuracy": 0.9487327337265015, |
| "num_tokens": 556647.0, |
| "step": 107 |
| }, |
| { |
| "epoch": 1.3670886075949367, |
| "grad_norm": 0.22763219475746155, |
| "learning_rate": 0.0001711443454267772, |
| "loss": 0.1286, |
| "mean_token_accuracy": 0.9476664662361145, |
| "num_tokens": 561832.0, |
| "step": 108 |
| }, |
| { |
| "epoch": 1.379746835443038, |
| "grad_norm": 0.14368991553783417, |
| "learning_rate": 0.00017056552683872292, |
| "loss": 0.1206, |
| "mean_token_accuracy": 0.9500395059585571, |
| "num_tokens": 566960.0, |
| "step": 109 |
| }, |
| { |
| "epoch": 1.3924050632911391, |
| "grad_norm": 0.137187197804451, |
| "learning_rate": 0.00016998196045138353, |
| "loss": 0.1196, |
| "mean_token_accuracy": 0.9471749067306519, |
| "num_tokens": 572192.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 1.4050632911392404, |
| "grad_norm": 0.12349066883325577, |
| "learning_rate": 0.00016939368552835137, |
| "loss": 0.1191, |
| "mean_token_accuracy": 0.9507257342338562, |
| "num_tokens": 577492.0, |
| "step": 111 |
| }, |
| { |
| "epoch": 1.4177215189873418, |
| "grad_norm": 0.1606503129005432, |
| "learning_rate": 0.00016880074165001905, |
| "loss": 0.1308, |
| "mean_token_accuracy": 0.951308012008667, |
| "num_tokens": 582793.0, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.4303797468354431, |
| "grad_norm": 0.1452348381280899, |
| "learning_rate": 0.0001682031687109165, |
| "loss": 0.1236, |
| "mean_token_accuracy": 0.9501745104789734, |
| "num_tokens": 588015.0, |
| "step": 113 |
| }, |
| { |
| "epoch": 1.4430379746835442, |
| "grad_norm": 0.1393907517194748, |
| "learning_rate": 0.00016760100691702674, |
| "loss": 0.1215, |
| "mean_token_accuracy": 0.953479528427124, |
| "num_tokens": 593324.0, |
| "step": 114 |
| }, |
| { |
| "epoch": 1.4556962025316456, |
| "grad_norm": 0.17773191630840302, |
| "learning_rate": 0.0001669942967830807, |
| "loss": 0.1272, |
| "mean_token_accuracy": 0.9480122327804565, |
| "num_tokens": 598620.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 1.4683544303797469, |
| "grad_norm": 0.1251114010810852, |
| "learning_rate": 0.00016638307912983136, |
| "loss": 0.1253, |
| "mean_token_accuracy": 0.9470962882041931, |
| "num_tokens": 603712.0, |
| "step": 116 |
| }, |
| { |
| "epoch": 1.481012658227848, |
| "grad_norm": 0.2559885084629059, |
| "learning_rate": 0.00016576739508130726, |
| "loss": 0.1275, |
| "mean_token_accuracy": 0.9498353600502014, |
| "num_tokens": 608939.0, |
| "step": 117 |
| }, |
| { |
| "epoch": 1.4936708860759493, |
| "grad_norm": 0.1673833280801773, |
| "learning_rate": 0.0001651472860620455, |
| "loss": 0.1252, |
| "mean_token_accuracy": 0.9469268321990967, |
| "num_tokens": 614128.0, |
| "step": 118 |
| }, |
| { |
| "epoch": 1.5063291139240507, |
| "grad_norm": 0.13037990033626556, |
| "learning_rate": 0.00016452279379430463, |
| "loss": 0.1231, |
| "mean_token_accuracy": 0.9495947957038879, |
| "num_tokens": 619251.0, |
| "step": 119 |
| }, |
| { |
| "epoch": 1.518987341772152, |
| "grad_norm": 0.11066332459449768, |
| "learning_rate": 0.00016389396029525762, |
| "loss": 0.1203, |
| "mean_token_accuracy": 0.9498069286346436, |
| "num_tokens": 624495.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 1.5316455696202531, |
| "grad_norm": 0.1207226887345314, |
| "learning_rate": 0.0001632608278741646, |
| "loss": 0.1223, |
| "mean_token_accuracy": 0.948310136795044, |
| "num_tokens": 629589.0, |
| "step": 121 |
| }, |
| { |
| "epoch": 1.5443037974683544, |
| "grad_norm": 0.1282467097043991, |
| "learning_rate": 0.00016262343912952656, |
| "loss": 0.123, |
| "mean_token_accuracy": 0.9489855170249939, |
| "num_tokens": 634828.0, |
| "step": 122 |
| }, |
| { |
| "epoch": 1.5569620253164556, |
| "grad_norm": 0.16653472185134888, |
| "learning_rate": 0.0001619818369462188, |
| "loss": 0.1274, |
| "mean_token_accuracy": 0.947590708732605, |
| "num_tokens": 640101.0, |
| "step": 123 |
| }, |
| { |
| "epoch": 1.5696202531645569, |
| "grad_norm": 0.1379830688238144, |
| "learning_rate": 0.0001613360644926059, |
| "loss": 0.12, |
| "mean_token_accuracy": 0.9533698558807373, |
| "num_tokens": 645462.0, |
| "step": 124 |
| }, |
| { |
| "epoch": 1.5822784810126582, |
| "grad_norm": 0.1411072164773941, |
| "learning_rate": 0.00016068616521763707, |
| "loss": 0.1246, |
| "mean_token_accuracy": 0.9507206678390503, |
| "num_tokens": 650660.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 1.5949367088607596, |
| "grad_norm": 0.15294188261032104, |
| "learning_rate": 0.00016003218284792298, |
| "loss": 0.1247, |
| "mean_token_accuracy": 0.9487677216529846, |
| "num_tokens": 655877.0, |
| "step": 126 |
| }, |
| { |
| "epoch": 1.6075949367088609, |
| "grad_norm": 0.1204475536942482, |
| "learning_rate": 0.00015937416138479344, |
| "loss": 0.1175, |
| "mean_token_accuracy": 0.9533510804176331, |
| "num_tokens": 661193.0, |
| "step": 127 |
| }, |
| { |
| "epoch": 1.620253164556962, |
| "grad_norm": 0.13293962180614471, |
| "learning_rate": 0.0001587121451013373, |
| "loss": 0.1223, |
| "mean_token_accuracy": 0.9472352266311646, |
| "num_tokens": 666393.0, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.6329113924050633, |
| "grad_norm": 0.11509446054697037, |
| "learning_rate": 0.0001580461785394233, |
| "loss": 0.118, |
| "mean_token_accuracy": 0.9501758217811584, |
| "num_tokens": 671575.0, |
| "step": 129 |
| }, |
| { |
| "epoch": 1.6455696202531644, |
| "grad_norm": 0.11632049083709717, |
| "learning_rate": 0.00015737630650670335, |
| "loss": 0.1198, |
| "mean_token_accuracy": 0.9511387944221497, |
| "num_tokens": 676776.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 1.6582278481012658, |
| "grad_norm": 0.14730048179626465, |
| "learning_rate": 0.00015670257407359792, |
| "loss": 0.1179, |
| "mean_token_accuracy": 0.948544979095459, |
| "num_tokens": 682029.0, |
| "step": 131 |
| }, |
| { |
| "epoch": 1.6708860759493671, |
| "grad_norm": 0.169641375541687, |
| "learning_rate": 0.00015602502657026328, |
| "loss": 0.1234, |
| "mean_token_accuracy": 0.9496759176254272, |
| "num_tokens": 687339.0, |
| "step": 132 |
| }, |
| { |
| "epoch": 1.6835443037974684, |
| "grad_norm": 0.10720019787549973, |
| "learning_rate": 0.00015534370958354186, |
| "loss": 0.1192, |
| "mean_token_accuracy": 0.950038731098175, |
| "num_tokens": 692567.0, |
| "step": 133 |
| }, |
| { |
| "epoch": 1.6962025316455698, |
| "grad_norm": 0.14673638343811035, |
| "learning_rate": 0.00015465866895389495, |
| "loss": 0.1232, |
| "mean_token_accuracy": 0.9517359733581543, |
| "num_tokens": 697873.0, |
| "step": 134 |
| }, |
| { |
| "epoch": 1.7088607594936709, |
| "grad_norm": 0.11593678593635559, |
| "learning_rate": 0.00015396995077231854, |
| "loss": 0.1194, |
| "mean_token_accuracy": 0.9523058533668518, |
| "num_tokens": 703011.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 1.721518987341772, |
| "grad_norm": 0.09349008649587631, |
| "learning_rate": 0.00015327760137724212, |
| "loss": 0.122, |
| "mean_token_accuracy": 0.9510685205459595, |
| "num_tokens": 708082.0, |
| "step": 136 |
| }, |
| { |
| "epoch": 1.7341772151898733, |
| "grad_norm": 0.10837123543024063, |
| "learning_rate": 0.00015258166735141092, |
| "loss": 0.1214, |
| "mean_token_accuracy": 0.9500493407249451, |
| "num_tokens": 713211.0, |
| "step": 137 |
| }, |
| { |
| "epoch": 1.7468354430379747, |
| "grad_norm": 0.10963979363441467, |
| "learning_rate": 0.0001518821955187519, |
| "loss": 0.1199, |
| "mean_token_accuracy": 0.9493547081947327, |
| "num_tokens": 718389.0, |
| "step": 138 |
| }, |
| { |
| "epoch": 1.759493670886076, |
| "grad_norm": 0.108366958796978, |
| "learning_rate": 0.00015117923294122312, |
| "loss": 0.1182, |
| "mean_token_accuracy": 0.9521881341934204, |
| "num_tokens": 723640.0, |
| "step": 139 |
| }, |
| { |
| "epoch": 1.7721518987341773, |
| "grad_norm": 0.10612353682518005, |
| "learning_rate": 0.0001504728269156475, |
| "loss": 0.1173, |
| "mean_token_accuracy": 0.9468570351600647, |
| "num_tokens": 728747.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.7848101265822784, |
| "grad_norm": 0.10319573432207108, |
| "learning_rate": 0.00014976302497053036, |
| "loss": 0.1121, |
| "mean_token_accuracy": 0.9531159400939941, |
| "num_tokens": 733994.0, |
| "step": 141 |
| }, |
| { |
| "epoch": 1.7974683544303798, |
| "grad_norm": 0.11267366260290146, |
| "learning_rate": 0.00014904987486286184, |
| "loss": 0.1137, |
| "mean_token_accuracy": 0.9541195034980774, |
| "num_tokens": 739180.0, |
| "step": 142 |
| }, |
| { |
| "epoch": 1.810126582278481, |
| "grad_norm": 0.13383233547210693, |
| "learning_rate": 0.00014833342457490361, |
| "loss": 0.1214, |
| "mean_token_accuracy": 0.9502696394920349, |
| "num_tokens": 744251.0, |
| "step": 143 |
| }, |
| { |
| "epoch": 1.8227848101265822, |
| "grad_norm": 0.17001107335090637, |
| "learning_rate": 0.00014761372231096047, |
| "loss": 0.1157, |
| "mean_token_accuracy": 0.9521386623382568, |
| "num_tokens": 749622.0, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.8354430379746836, |
| "grad_norm": 0.12594255805015564, |
| "learning_rate": 0.00014689081649413708, |
| "loss": 0.1182, |
| "mean_token_accuracy": 0.9487131237983704, |
| "num_tokens": 754970.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 1.8481012658227849, |
| "grad_norm": 0.1139696016907692, |
| "learning_rate": 0.00014616475576308005, |
| "loss": 0.1211, |
| "mean_token_accuracy": 0.9446545839309692, |
| "num_tokens": 760057.0, |
| "step": 146 |
| }, |
| { |
| "epoch": 1.8607594936708862, |
| "grad_norm": 0.11146289855241776, |
| "learning_rate": 0.00014543558896870531, |
| "loss": 0.1165, |
| "mean_token_accuracy": 0.949729323387146, |
| "num_tokens": 765293.0, |
| "step": 147 |
| }, |
| { |
| "epoch": 1.8734177215189873, |
| "grad_norm": 0.11601708829402924, |
| "learning_rate": 0.0001447033651709114, |
| "loss": 0.1216, |
| "mean_token_accuracy": 0.9519582986831665, |
| "num_tokens": 770540.0, |
| "step": 148 |
| }, |
| { |
| "epoch": 1.8860759493670884, |
| "grad_norm": 0.1349141150712967, |
| "learning_rate": 0.0001439681336352785, |
| "loss": 0.1134, |
| "mean_token_accuracy": 0.9564322829246521, |
| "num_tokens": 775952.0, |
| "step": 149 |
| }, |
| { |
| "epoch": 1.8987341772151898, |
| "grad_norm": 0.11901061981916428, |
| "learning_rate": 0.00014322994382975386, |
| "loss": 0.1158, |
| "mean_token_accuracy": 0.9476328492164612, |
| "num_tokens": 781191.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 1.9113924050632911, |
| "grad_norm": 0.10183963924646378, |
| "learning_rate": 0.0001424888454213235, |
| "loss": 0.1222, |
| "mean_token_accuracy": 0.949402391910553, |
| "num_tokens": 786275.0, |
| "step": 151 |
| }, |
| { |
| "epoch": 1.9240506329113924, |
| "grad_norm": 0.10988782346248627, |
| "learning_rate": 0.0001417448882726703, |
| "loss": 0.1206, |
| "mean_token_accuracy": 0.950117826461792, |
| "num_tokens": 791431.0, |
| "step": 152 |
| }, |
| { |
| "epoch": 1.9367088607594938, |
| "grad_norm": 0.11146315932273865, |
| "learning_rate": 0.00014099812243881948, |
| "loss": 0.1154, |
| "mean_token_accuracy": 0.9520351886749268, |
| "num_tokens": 796728.0, |
| "step": 153 |
| }, |
| { |
| "epoch": 1.9493670886075949, |
| "grad_norm": 0.09734103083610535, |
| "learning_rate": 0.00014024859816377046, |
| "loss": 0.1144, |
| "mean_token_accuracy": 0.9512288570404053, |
| "num_tokens": 802000.0, |
| "step": 154 |
| }, |
| { |
| "epoch": 1.9620253164556962, |
| "grad_norm": 0.09847570210695267, |
| "learning_rate": 0.00013949636587711644, |
| "loss": 0.1162, |
| "mean_token_accuracy": 0.9531669616699219, |
| "num_tokens": 807274.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 1.9746835443037973, |
| "grad_norm": 0.11049605160951614, |
| "learning_rate": 0.0001387414761906516, |
| "loss": 0.1168, |
| "mean_token_accuracy": 0.9521486163139343, |
| "num_tokens": 812667.0, |
| "step": 156 |
| }, |
| { |
| "epoch": 1.9873417721518987, |
| "grad_norm": 0.12828807532787323, |
| "learning_rate": 0.00013798397989496549, |
| "loss": 0.1213, |
| "mean_token_accuracy": 0.9485089182853699, |
| "num_tokens": 817761.0, |
| "step": 157 |
| }, |
| { |
| "epoch": 2.0, |
| "grad_norm": 0.08749315142631531, |
| "learning_rate": 0.00013722392795602594, |
| "loss": 0.1153, |
| "mean_token_accuracy": 0.9507448077201843, |
| "num_tokens": 822860.0, |
| "step": 158 |
| }, |
| { |
| "epoch": 2.0126582278481013, |
| "grad_norm": 0.1040758490562439, |
| "learning_rate": 0.0001364613715117499, |
| "loss": 0.113, |
| "mean_token_accuracy": 0.9519175887107849, |
| "num_tokens": 828165.0, |
| "step": 159 |
| }, |
| { |
| "epoch": 2.0253164556962027, |
| "grad_norm": 0.1114276871085167, |
| "learning_rate": 0.00013569636186856288, |
| "loss": 0.1109, |
| "mean_token_accuracy": 0.9505388736724854, |
| "num_tokens": 833425.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 2.037974683544304, |
| "grad_norm": 0.0839025005698204, |
| "learning_rate": 0.0001349289504979467, |
| "loss": 0.1154, |
| "mean_token_accuracy": 0.9530664682388306, |
| "num_tokens": 838560.0, |
| "step": 161 |
| }, |
| { |
| "epoch": 2.050632911392405, |
| "grad_norm": 0.09230242669582367, |
| "learning_rate": 0.0001341591890329766, |
| "loss": 0.1146, |
| "mean_token_accuracy": 0.9486173987388611, |
| "num_tokens": 843723.0, |
| "step": 162 |
| }, |
| { |
| "epoch": 2.0632911392405062, |
| "grad_norm": 0.07964486628770828, |
| "learning_rate": 0.00013338712926484725, |
| "loss": 0.1095, |
| "mean_token_accuracy": 0.9523173570632935, |
| "num_tokens": 849030.0, |
| "step": 163 |
| }, |
| { |
| "epoch": 2.0759493670886076, |
| "grad_norm": 0.12312997877597809, |
| "learning_rate": 0.00013261282313938795, |
| "loss": 0.1161, |
| "mean_token_accuracy": 0.950698733329773, |
| "num_tokens": 854246.0, |
| "step": 164 |
| }, |
| { |
| "epoch": 2.088607594936709, |
| "grad_norm": 0.11605784296989441, |
| "learning_rate": 0.00013183632275356777, |
| "loss": 0.1129, |
| "mean_token_accuracy": 0.9517543911933899, |
| "num_tokens": 859554.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 2.1012658227848102, |
| "grad_norm": 0.09419958293437958, |
| "learning_rate": 0.00013105768035199034, |
| "loss": 0.112, |
| "mean_token_accuracy": 0.950269877910614, |
| "num_tokens": 864806.0, |
| "step": 166 |
| }, |
| { |
| "epoch": 2.1139240506329116, |
| "grad_norm": 0.11429665982723236, |
| "learning_rate": 0.0001302769483233786, |
| "loss": 0.1137, |
| "mean_token_accuracy": 0.9541642069816589, |
| "num_tokens": 869997.0, |
| "step": 167 |
| }, |
| { |
| "epoch": 2.1265822784810124, |
| "grad_norm": 0.11947552114725113, |
| "learning_rate": 0.00012949417919705007, |
| "loss": 0.116, |
| "mean_token_accuracy": 0.9537324905395508, |
| "num_tokens": 875205.0, |
| "step": 168 |
| }, |
| { |
| "epoch": 2.1392405063291138, |
| "grad_norm": 0.13403531908988953, |
| "learning_rate": 0.00012870942563938264, |
| "loss": 0.1182, |
| "mean_token_accuracy": 0.9547651410102844, |
| "num_tokens": 880442.0, |
| "step": 169 |
| }, |
| { |
| "epoch": 2.151898734177215, |
| "grad_norm": 0.09392501413822174, |
| "learning_rate": 0.0001279227404502709, |
| "loss": 0.1148, |
| "mean_token_accuracy": 0.9532988667488098, |
| "num_tokens": 885538.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 2.1645569620253164, |
| "grad_norm": 0.13457965850830078, |
| "learning_rate": 0.00012713417655957376, |
| "loss": 0.1151, |
| "mean_token_accuracy": 0.9484173655509949, |
| "num_tokens": 890720.0, |
| "step": 171 |
| }, |
| { |
| "epoch": 2.1772151898734178, |
| "grad_norm": 0.096675805747509, |
| "learning_rate": 0.00012634378702355313, |
| "loss": 0.1109, |
| "mean_token_accuracy": 0.9544493556022644, |
| "num_tokens": 895987.0, |
| "step": 172 |
| }, |
| { |
| "epoch": 2.189873417721519, |
| "grad_norm": 0.09749137610197067, |
| "learning_rate": 0.00012555162502130433, |
| "loss": 0.1102, |
| "mean_token_accuracy": 0.9534346461296082, |
| "num_tokens": 901248.0, |
| "step": 173 |
| }, |
| { |
| "epoch": 2.2025316455696204, |
| "grad_norm": 0.09648600965738297, |
| "learning_rate": 0.00012475774385117786, |
| "loss": 0.1132, |
| "mean_token_accuracy": 0.9511432647705078, |
| "num_tokens": 906429.0, |
| "step": 174 |
| }, |
| { |
| "epoch": 2.2151898734177213, |
| "grad_norm": 0.11956477910280228, |
| "learning_rate": 0.00012396219692719363, |
| "loss": 0.1159, |
| "mean_token_accuracy": 0.9516765475273132, |
| "num_tokens": 911563.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 2.2278481012658227, |
| "grad_norm": 0.11230012029409409, |
| "learning_rate": 0.000123165037775447, |
| "loss": 0.1129, |
| "mean_token_accuracy": 0.951176106929779, |
| "num_tokens": 916686.0, |
| "step": 176 |
| }, |
| { |
| "epoch": 2.240506329113924, |
| "grad_norm": 0.13427633047103882, |
| "learning_rate": 0.00012236632003050736, |
| "loss": 0.1191, |
| "mean_token_accuracy": 0.9477163553237915, |
| "num_tokens": 921742.0, |
| "step": 177 |
| }, |
| { |
| "epoch": 2.2531645569620253, |
| "grad_norm": 0.1290883868932724, |
| "learning_rate": 0.00012156609743180969, |
| "loss": 0.1127, |
| "mean_token_accuracy": 0.950269877910614, |
| "num_tokens": 926994.0, |
| "step": 178 |
| }, |
| { |
| "epoch": 2.2658227848101267, |
| "grad_norm": 0.08057372272014618, |
| "learning_rate": 0.0001207644238200387, |
| "loss": 0.1125, |
| "mean_token_accuracy": 0.9483300447463989, |
| "num_tokens": 932148.0, |
| "step": 179 |
| }, |
| { |
| "epoch": 2.278481012658228, |
| "grad_norm": 0.11464843153953552, |
| "learning_rate": 0.00011996135313350636, |
| "loss": 0.1165, |
| "mean_token_accuracy": 0.9480494260787964, |
| "num_tokens": 937390.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 2.291139240506329, |
| "grad_norm": 0.1148659810423851, |
| "learning_rate": 0.0001191569394045228, |
| "loss": 0.1135, |
| "mean_token_accuracy": 0.9494910836219788, |
| "num_tokens": 942661.0, |
| "step": 181 |
| }, |
| { |
| "epoch": 2.3037974683544302, |
| "grad_norm": 0.1096266508102417, |
| "learning_rate": 0.00011835123675576092, |
| "loss": 0.1108, |
| "mean_token_accuracy": 0.9535801410675049, |
| "num_tokens": 948046.0, |
| "step": 182 |
| }, |
| { |
| "epoch": 2.3164556962025316, |
| "grad_norm": 0.11258285492658615, |
| "learning_rate": 0.0001175442993966149, |
| "loss": 0.1116, |
| "mean_token_accuracy": 0.9536716938018799, |
| "num_tokens": 953312.0, |
| "step": 183 |
| }, |
| { |
| "epoch": 2.329113924050633, |
| "grad_norm": 0.09487363696098328, |
| "learning_rate": 0.00011673618161955288, |
| "loss": 0.1123, |
| "mean_token_accuracy": 0.9542192220687866, |
| "num_tokens": 958531.0, |
| "step": 184 |
| }, |
| { |
| "epoch": 2.3417721518987342, |
| "grad_norm": 0.10504362732172012, |
| "learning_rate": 0.00011592693779646405, |
| "loss": 0.1091, |
| "mean_token_accuracy": 0.9548643827438354, |
| "num_tokens": 963868.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 2.3544303797468356, |
| "grad_norm": 0.10166207700967789, |
| "learning_rate": 0.00011511662237500032, |
| "loss": 0.111, |
| "mean_token_accuracy": 0.9527420997619629, |
| "num_tokens": 969074.0, |
| "step": 186 |
| }, |
| { |
| "epoch": 2.367088607594937, |
| "grad_norm": 0.0899074450135231, |
| "learning_rate": 0.00011430528987491305, |
| "loss": 0.1134, |
| "mean_token_accuracy": 0.9507843255996704, |
| "num_tokens": 974238.0, |
| "step": 187 |
| }, |
| { |
| "epoch": 2.379746835443038, |
| "grad_norm": 0.08563630282878876, |
| "learning_rate": 0.00011349299488438485, |
| "loss": 0.11, |
| "mean_token_accuracy": 0.955788254737854, |
| "num_tokens": 979459.0, |
| "step": 188 |
| }, |
| { |
| "epoch": 2.392405063291139, |
| "grad_norm": 0.11500842124223709, |
| "learning_rate": 0.00011267979205635675, |
| "loss": 0.1091, |
| "mean_token_accuracy": 0.954186737537384, |
| "num_tokens": 984718.0, |
| "step": 189 |
| }, |
| { |
| "epoch": 2.4050632911392404, |
| "grad_norm": 0.092518649995327, |
| "learning_rate": 0.00011186573610485098, |
| "loss": 0.1149, |
| "mean_token_accuracy": 0.9542879462242126, |
| "num_tokens": 989901.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 2.4177215189873418, |
| "grad_norm": 0.11641688644886017, |
| "learning_rate": 0.00011105088180128976, |
| "loss": 0.1163, |
| "mean_token_accuracy": 0.9520922899246216, |
| "num_tokens": 995079.0, |
| "step": 191 |
| }, |
| { |
| "epoch": 2.430379746835443, |
| "grad_norm": 0.10992075502872467, |
| "learning_rate": 0.00011023528397081011, |
| "loss": 0.1131, |
| "mean_token_accuracy": 0.9550126194953918, |
| "num_tokens": 1000300.0, |
| "step": 192 |
| }, |
| { |
| "epoch": 2.4430379746835444, |
| "grad_norm": 0.12892654538154602, |
| "learning_rate": 0.0001094189974885752, |
| "loss": 0.1174, |
| "mean_token_accuracy": 0.9511012434959412, |
| "num_tokens": 1005313.0, |
| "step": 193 |
| }, |
| { |
| "epoch": 2.4556962025316453, |
| "grad_norm": 0.10617399960756302, |
| "learning_rate": 0.00010860207727608214, |
| "loss": 0.1162, |
| "mean_token_accuracy": 0.9493392109870911, |
| "num_tokens": 1010371.0, |
| "step": 194 |
| }, |
| { |
| "epoch": 2.4683544303797467, |
| "grad_norm": 0.1117515116930008, |
| "learning_rate": 0.00010778457829746666, |
| "loss": 0.1132, |
| "mean_token_accuracy": 0.9525145292282104, |
| "num_tokens": 1015426.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 2.481012658227848, |
| "grad_norm": 0.09666470438241959, |
| "learning_rate": 0.00010696655555580524, |
| "loss": 0.1123, |
| "mean_token_accuracy": 0.9508653283119202, |
| "num_tokens": 1020517.0, |
| "step": 196 |
| }, |
| { |
| "epoch": 2.4936708860759493, |
| "grad_norm": 0.13866201043128967, |
| "learning_rate": 0.00010614806408941422, |
| "loss": 0.112, |
| "mean_token_accuracy": 0.9557572603225708, |
| "num_tokens": 1025870.0, |
| "step": 197 |
| }, |
| { |
| "epoch": 2.5063291139240507, |
| "grad_norm": 0.0827043205499649, |
| "learning_rate": 0.00010532915896814672, |
| "loss": 0.1095, |
| "mean_token_accuracy": 0.9521714448928833, |
| "num_tokens": 1031161.0, |
| "step": 198 |
| }, |
| { |
| "epoch": 2.518987341772152, |
| "grad_norm": 0.09126809984445572, |
| "learning_rate": 0.00010450989528968746, |
| "loss": 0.1111, |
| "mean_token_accuracy": 0.951029896736145, |
| "num_tokens": 1036371.0, |
| "step": 199 |
| }, |
| { |
| "epoch": 2.5316455696202533, |
| "grad_norm": 0.0837259516119957, |
| "learning_rate": 0.00010369032817584561, |
| "loss": 0.114, |
| "mean_token_accuracy": 0.9502448439598083, |
| "num_tokens": 1041540.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 2.5443037974683547, |
| "grad_norm": 0.09508928656578064, |
| "learning_rate": 0.00010287051276884618, |
| "loss": 0.115, |
| "mean_token_accuracy": 0.9502407908439636, |
| "num_tokens": 1046588.0, |
| "step": 201 |
| }, |
| { |
| "epoch": 2.5569620253164556, |
| "grad_norm": 0.10246361792087555, |
| "learning_rate": 0.00010205050422761988, |
| "loss": 0.1143, |
| "mean_token_accuracy": 0.947189450263977, |
| "num_tokens": 1051651.0, |
| "step": 202 |
| }, |
| { |
| "epoch": 2.569620253164557, |
| "grad_norm": 0.11269509047269821, |
| "learning_rate": 0.00010123035772409184, |
| "loss": 0.1159, |
| "mean_token_accuracy": 0.951171875, |
| "num_tokens": 1056835.0, |
| "step": 203 |
| }, |
| { |
| "epoch": 2.5822784810126582, |
| "grad_norm": 0.19371971487998962, |
| "learning_rate": 0.0001004101284394696, |
| "loss": 0.1139, |
| "mean_token_accuracy": 0.9502364993095398, |
| "num_tokens": 1062184.0, |
| "step": 204 |
| }, |
| { |
| "epoch": 2.5949367088607596, |
| "grad_norm": 0.07230806350708008, |
| "learning_rate": 9.958987156053045e-05, |
| "loss": 0.1075, |
| "mean_token_accuracy": 0.9555003643035889, |
| "num_tokens": 1067484.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 2.607594936708861, |
| "grad_norm": 0.08113159984350204, |
| "learning_rate": 9.87696422759082e-05, |
| "loss": 0.1088, |
| "mean_token_accuracy": 0.9582512974739075, |
| "num_tokens": 1072626.0, |
| "step": 206 |
| }, |
| { |
| "epoch": 2.620253164556962, |
| "grad_norm": 0.1027611568570137, |
| "learning_rate": 9.794949577238013e-05, |
| "loss": 0.111, |
| "mean_token_accuracy": 0.9528957605361938, |
| "num_tokens": 1077870.0, |
| "step": 207 |
| }, |
| { |
| "epoch": 2.632911392405063, |
| "grad_norm": 0.0853879526257515, |
| "learning_rate": 9.712948723115383e-05, |
| "loss": 0.1063, |
| "mean_token_accuracy": 0.9563567638397217, |
| "num_tokens": 1083204.0, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.6455696202531644, |
| "grad_norm": 0.09815023094415665, |
| "learning_rate": 9.630967182415442e-05, |
| "loss": 0.1174, |
| "mean_token_accuracy": 0.9501211643218994, |
| "num_tokens": 1088220.0, |
| "step": 209 |
| }, |
| { |
| "epoch": 2.6582278481012658, |
| "grad_norm": 0.08170381933450699, |
| "learning_rate": 9.549010471031256e-05, |
| "loss": 0.1115, |
| "mean_token_accuracy": 0.9547125697135925, |
| "num_tokens": 1093451.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 2.670886075949367, |
| "grad_norm": 0.09601102769374847, |
| "learning_rate": 9.467084103185329e-05, |
| "loss": 0.1171, |
| "mean_token_accuracy": 0.9542239904403687, |
| "num_tokens": 1098605.0, |
| "step": 211 |
| }, |
| { |
| "epoch": 2.6835443037974684, |
| "grad_norm": 0.09155265986919403, |
| "learning_rate": 9.385193591058579e-05, |
| "loss": 0.1093, |
| "mean_token_accuracy": 0.9578231573104858, |
| "num_tokens": 1103814.0, |
| "step": 212 |
| }, |
| { |
| "epoch": 2.6962025316455698, |
| "grad_norm": 0.09160866588354111, |
| "learning_rate": 9.303344444419476e-05, |
| "loss": 0.1112, |
| "mean_token_accuracy": 0.951647937297821, |
| "num_tokens": 1108945.0, |
| "step": 213 |
| }, |
| { |
| "epoch": 2.708860759493671, |
| "grad_norm": 0.10708494484424591, |
| "learning_rate": 9.221542170253339e-05, |
| "loss": 0.1133, |
| "mean_token_accuracy": 0.9530802965164185, |
| "num_tokens": 1114252.0, |
| "step": 214 |
| }, |
| { |
| "epoch": 2.721518987341772, |
| "grad_norm": 0.08773200213909149, |
| "learning_rate": 9.139792272391791e-05, |
| "loss": 0.11, |
| "mean_token_accuracy": 0.9543495178222656, |
| "num_tokens": 1119420.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 2.7341772151898733, |
| "grad_norm": 0.10514669865369797, |
| "learning_rate": 9.058100251142483e-05, |
| "loss": 0.1162, |
| "mean_token_accuracy": 0.9470460414886475, |
| "num_tokens": 1124545.0, |
| "step": 216 |
| }, |
| { |
| "epoch": 2.7468354430379747, |
| "grad_norm": 0.13822774589061737, |
| "learning_rate": 8.976471602918991e-05, |
| "loss": 0.1084, |
| "mean_token_accuracy": 0.955195426940918, |
| "num_tokens": 1129854.0, |
| "step": 217 |
| }, |
| { |
| "epoch": 2.759493670886076, |
| "grad_norm": 0.10257484018802643, |
| "learning_rate": 8.894911819871026e-05, |
| "loss": 0.1127, |
| "mean_token_accuracy": 0.9548011422157288, |
| "num_tokens": 1135073.0, |
| "step": 218 |
| }, |
| { |
| "epoch": 2.7721518987341773, |
| "grad_norm": 0.15447267889976501, |
| "learning_rate": 8.813426389514903e-05, |
| "loss": 0.1058, |
| "mean_token_accuracy": 0.9547005295753479, |
| "num_tokens": 1140413.0, |
| "step": 219 |
| }, |
| { |
| "epoch": 2.7848101265822782, |
| "grad_norm": 0.08518294990062714, |
| "learning_rate": 8.732020794364326e-05, |
| "loss": 0.1112, |
| "mean_token_accuracy": 0.9537380337715149, |
| "num_tokens": 1145600.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 2.7974683544303796, |
| "grad_norm": 0.1725679337978363, |
| "learning_rate": 8.650700511561514e-05, |
| "loss": 0.1139, |
| "mean_token_accuracy": 0.9512341022491455, |
| "num_tokens": 1150688.0, |
| "step": 221 |
| }, |
| { |
| "epoch": 2.810126582278481, |
| "grad_norm": 0.09164884686470032, |
| "learning_rate": 8.5694710125087e-05, |
| "loss": 0.1083, |
| "mean_token_accuracy": 0.9564552903175354, |
| "num_tokens": 1155988.0, |
| "step": 222 |
| }, |
| { |
| "epoch": 2.8227848101265822, |
| "grad_norm": 0.12649889290332794, |
| "learning_rate": 8.488337762499972e-05, |
| "loss": 0.1082, |
| "mean_token_accuracy": 0.9533155560493469, |
| "num_tokens": 1161300.0, |
| "step": 223 |
| }, |
| { |
| "epoch": 2.8354430379746836, |
| "grad_norm": 0.10542358458042145, |
| "learning_rate": 8.407306220353596e-05, |
| "loss": 0.113, |
| "mean_token_accuracy": 0.9506816267967224, |
| "num_tokens": 1166352.0, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.848101265822785, |
| "grad_norm": 0.12877212464809418, |
| "learning_rate": 8.326381838044713e-05, |
| "loss": 0.1136, |
| "mean_token_accuracy": 0.9508786201477051, |
| "num_tokens": 1171424.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 2.8607594936708862, |
| "grad_norm": 0.08036050945520401, |
| "learning_rate": 8.245570060338512e-05, |
| "loss": 0.108, |
| "mean_token_accuracy": 0.9533178806304932, |
| "num_tokens": 1176672.0, |
| "step": 226 |
| }, |
| { |
| "epoch": 2.8734177215189876, |
| "grad_norm": 0.11726133525371552, |
| "learning_rate": 8.164876324423909e-05, |
| "loss": 0.1069, |
| "mean_token_accuracy": 0.9536500573158264, |
| "num_tokens": 1181914.0, |
| "step": 227 |
| }, |
| { |
| "epoch": 2.8860759493670884, |
| "grad_norm": 0.09797175228595734, |
| "learning_rate": 8.084306059547722e-05, |
| "loss": 0.1111, |
| "mean_token_accuracy": 0.9521328210830688, |
| "num_tokens": 1187159.0, |
| "step": 228 |
| }, |
| { |
| "epoch": 2.8987341772151898, |
| "grad_norm": 0.09934044629335403, |
| "learning_rate": 8.003864686649366e-05, |
| "loss": 0.1057, |
| "mean_token_accuracy": 0.9541738033294678, |
| "num_tokens": 1192482.0, |
| "step": 229 |
| }, |
| { |
| "epoch": 2.911392405063291, |
| "grad_norm": 0.12974561750888824, |
| "learning_rate": 7.923557617996131e-05, |
| "loss": 0.1126, |
| "mean_token_accuracy": 0.9513805508613586, |
| "num_tokens": 1197544.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 2.9240506329113924, |
| "grad_norm": 0.15223093330860138, |
| "learning_rate": 7.843390256819034e-05, |
| "loss": 0.1119, |
| "mean_token_accuracy": 0.9524279236793518, |
| "num_tokens": 1202674.0, |
| "step": 231 |
| }, |
| { |
| "epoch": 2.9367088607594938, |
| "grad_norm": 0.0986715778708458, |
| "learning_rate": 7.763367996949267e-05, |
| "loss": 0.1043, |
| "mean_token_accuracy": 0.9544337391853333, |
| "num_tokens": 1208027.0, |
| "step": 232 |
| }, |
| { |
| "epoch": 2.9493670886075947, |
| "grad_norm": 0.10474951565265656, |
| "learning_rate": 7.683496222455304e-05, |
| "loss": 0.1108, |
| "mean_token_accuracy": 0.951941967010498, |
| "num_tokens": 1213189.0, |
| "step": 233 |
| }, |
| { |
| "epoch": 2.962025316455696, |
| "grad_norm": 0.12877650558948517, |
| "learning_rate": 7.603780307280639e-05, |
| "loss": 0.1071, |
| "mean_token_accuracy": 0.954459547996521, |
| "num_tokens": 1218545.0, |
| "step": 234 |
| }, |
| { |
| "epoch": 2.9746835443037973, |
| "grad_norm": 0.14582286775112152, |
| "learning_rate": 7.524225614882216e-05, |
| "loss": 0.1079, |
| "mean_token_accuracy": 0.9513266086578369, |
| "num_tokens": 1223848.0, |
| "step": 235 |
| }, |
| { |
| "epoch": 2.9873417721518987, |
| "grad_norm": 0.07670250535011292, |
| "learning_rate": 7.44483749786957e-05, |
| "loss": 0.1066, |
| "mean_token_accuracy": 0.9508670568466187, |
| "num_tokens": 1229102.0, |
| "step": 236 |
| }, |
| { |
| "epoch": 3.0, |
| "grad_norm": 0.11895658075809479, |
| "learning_rate": 7.365621297644686e-05, |
| "loss": 0.1084, |
| "mean_token_accuracy": 0.9556490182876587, |
| "num_tokens": 1234397.0, |
| "step": 237 |
| }, |
| { |
| "epoch": 3.0126582278481013, |
| "grad_norm": 0.07659917324781418, |
| "learning_rate": 7.286582344042625e-05, |
| "loss": 0.1094, |
| "mean_token_accuracy": 0.9530108571052551, |
| "num_tokens": 1239526.0, |
| "step": 238 |
| }, |
| { |
| "epoch": 3.0253164556962027, |
| "grad_norm": 0.08306147903203964, |
| "learning_rate": 7.207725954972913e-05, |
| "loss": 0.1029, |
| "mean_token_accuracy": 0.9556412696838379, |
| "num_tokens": 1244775.0, |
| "step": 239 |
| }, |
| { |
| "epoch": 3.037974683544304, |
| "grad_norm": 0.11685889959335327, |
| "learning_rate": 7.129057436061739e-05, |
| "loss": 0.1036, |
| "mean_token_accuracy": 0.9539796113967896, |
| "num_tokens": 1250141.0, |
| "step": 240 |
| }, |
| { |
| "epoch": 3.050632911392405, |
| "grad_norm": 0.08046155422925949, |
| "learning_rate": 7.050582080294996e-05, |
| "loss": 0.1042, |
| "mean_token_accuracy": 0.9550777673721313, |
| "num_tokens": 1255414.0, |
| "step": 241 |
| }, |
| { |
| "epoch": 3.0632911392405062, |
| "grad_norm": 0.09916442632675171, |
| "learning_rate": 6.972305167662145e-05, |
| "loss": 0.1107, |
| "mean_token_accuracy": 0.9493569135665894, |
| "num_tokens": 1260454.0, |
| "step": 242 |
| }, |
| { |
| "epoch": 3.0759493670886076, |
| "grad_norm": 0.07666052132844925, |
| "learning_rate": 6.89423196480097e-05, |
| "loss": 0.107, |
| "mean_token_accuracy": 0.9538767337799072, |
| "num_tokens": 1265548.0, |
| "step": 243 |
| }, |
| { |
| "epoch": 3.088607594936709, |
| "grad_norm": 0.09515383839607239, |
| "learning_rate": 6.816367724643224e-05, |
| "loss": 0.103, |
| "mean_token_accuracy": 0.9558286666870117, |
| "num_tokens": 1270819.0, |
| "step": 244 |
| }, |
| { |
| "epoch": 3.1012658227848102, |
| "grad_norm": 0.07828706502914429, |
| "learning_rate": 6.738717686061206e-05, |
| "loss": 0.1075, |
| "mean_token_accuracy": 0.9554416537284851, |
| "num_tokens": 1275955.0, |
| "step": 245 |
| }, |
| { |
| "epoch": 3.1139240506329116, |
| "grad_norm": 0.06959263980388641, |
| "learning_rate": 6.661287073515275e-05, |
| "loss": 0.1057, |
| "mean_token_accuracy": 0.9535741806030273, |
| "num_tokens": 1281167.0, |
| "step": 246 |
| }, |
| { |
| "epoch": 3.1265822784810124, |
| "grad_norm": 0.08991727977991104, |
| "learning_rate": 6.58408109670234e-05, |
| "loss": 0.1062, |
| "mean_token_accuracy": 0.9538699388504028, |
| "num_tokens": 1286412.0, |
| "step": 247 |
| }, |
| { |
| "epoch": 3.1392405063291138, |
| "grad_norm": 0.0742548480629921, |
| "learning_rate": 6.507104950205336e-05, |
| "loss": 0.1057, |
| "mean_token_accuracy": 0.9552783370018005, |
| "num_tokens": 1291686.0, |
| "step": 248 |
| }, |
| { |
| "epoch": 3.151898734177215, |
| "grad_norm": 0.09274096041917801, |
| "learning_rate": 6.430363813143716e-05, |
| "loss": 0.108, |
| "mean_token_accuracy": 0.9522682428359985, |
| "num_tokens": 1296820.0, |
| "step": 249 |
| }, |
| { |
| "epoch": 3.1645569620253164, |
| "grad_norm": 0.07980688661336899, |
| "learning_rate": 6.35386284882501e-05, |
| "loss": 0.1049, |
| "mean_token_accuracy": 0.954318642616272, |
| "num_tokens": 1302094.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 3.1772151898734178, |
| "grad_norm": 0.0840386226773262, |
| "learning_rate": 6.277607204397408e-05, |
| "loss": 0.1056, |
| "mean_token_accuracy": 0.9568414688110352, |
| "num_tokens": 1307325.0, |
| "step": 251 |
| }, |
| { |
| "epoch": 3.189873417721519, |
| "grad_norm": 0.11037012934684753, |
| "learning_rate": 6.201602010503454e-05, |
| "loss": 0.1121, |
| "mean_token_accuracy": 0.950276255607605, |
| "num_tokens": 1312276.0, |
| "step": 252 |
| }, |
| { |
| "epoch": 3.2025316455696204, |
| "grad_norm": 0.08207038044929504, |
| "learning_rate": 6.125852380934841e-05, |
| "loss": 0.1086, |
| "mean_token_accuracy": 0.9517102837562561, |
| "num_tokens": 1317310.0, |
| "step": 253 |
| }, |
| { |
| "epoch": 3.2151898734177213, |
| "grad_norm": 0.08561797440052032, |
| "learning_rate": 6.0503634122883556e-05, |
| "loss": 0.1088, |
| "mean_token_accuracy": 0.9532359838485718, |
| "num_tokens": 1322442.0, |
| "step": 254 |
| }, |
| { |
| "epoch": 3.2278481012658227, |
| "grad_norm": 0.1632906049489975, |
| "learning_rate": 5.975140183622958e-05, |
| "loss": 0.1022, |
| "mean_token_accuracy": 0.9594208598136902, |
| "num_tokens": 1327755.0, |
| "step": 255 |
| }, |
| { |
| "epoch": 3.240506329113924, |
| "grad_norm": 0.07698379456996918, |
| "learning_rate": 5.900187756118055e-05, |
| "loss": 0.1091, |
| "mean_token_accuracy": 0.9542356133460999, |
| "num_tokens": 1332954.0, |
| "step": 256 |
| }, |
| { |
| "epoch": 3.2531645569620253, |
| "grad_norm": 0.07018712162971497, |
| "learning_rate": 5.8255111727329717e-05, |
| "loss": 0.1051, |
| "mean_token_accuracy": 0.955034613609314, |
| "num_tokens": 1338222.0, |
| "step": 257 |
| }, |
| { |
| "epoch": 3.2658227848101267, |
| "grad_norm": 0.07832547277212143, |
| "learning_rate": 5.751115457867653e-05, |
| "loss": 0.1057, |
| "mean_token_accuracy": 0.954049825668335, |
| "num_tokens": 1343422.0, |
| "step": 258 |
| }, |
| { |
| "epoch": 3.278481012658228, |
| "grad_norm": 0.11230257153511047, |
| "learning_rate": 5.6770056170246175e-05, |
| "loss": 0.1061, |
| "mean_token_accuracy": 0.9552909135818481, |
| "num_tokens": 1348608.0, |
| "step": 259 |
| }, |
| { |
| "epoch": 3.291139240506329, |
| "grad_norm": 0.07142212241888046, |
| "learning_rate": 5.6031866364721554e-05, |
| "loss": 0.1072, |
| "mean_token_accuracy": 0.9554328322410583, |
| "num_tokens": 1353743.0, |
| "step": 260 |
| }, |
| { |
| "epoch": 3.3037974683544302, |
| "grad_norm": 0.0787329375743866, |
| "learning_rate": 5.529663482908864e-05, |
| "loss": 0.1051, |
| "mean_token_accuracy": 0.953653872013092, |
| "num_tokens": 1359007.0, |
| "step": 261 |
| }, |
| { |
| "epoch": 3.3164556962025316, |
| "grad_norm": 0.1963065266609192, |
| "learning_rate": 5.4564411031294695e-05, |
| "loss": 0.1095, |
| "mean_token_accuracy": 0.9543879628181458, |
| "num_tokens": 1364267.0, |
| "step": 262 |
| }, |
| { |
| "epoch": 3.329113924050633, |
| "grad_norm": 0.07281672954559326, |
| "learning_rate": 5.383524423691994e-05, |
| "loss": 0.1023, |
| "mean_token_accuracy": 0.9560855627059937, |
| "num_tokens": 1369614.0, |
| "step": 263 |
| }, |
| { |
| "epoch": 3.3417721518987342, |
| "grad_norm": 0.09342652559280396, |
| "learning_rate": 5.310918350586291e-05, |
| "loss": 0.1104, |
| "mean_token_accuracy": 0.952820897102356, |
| "num_tokens": 1374765.0, |
| "step": 264 |
| }, |
| { |
| "epoch": 3.3544303797468356, |
| "grad_norm": 0.07760917395353317, |
| "learning_rate": 5.2386277689039565e-05, |
| "loss": 0.1062, |
| "mean_token_accuracy": 0.9535561800003052, |
| "num_tokens": 1379975.0, |
| "step": 265 |
| }, |
| { |
| "epoch": 3.367088607594937, |
| "grad_norm": 0.0827326700091362, |
| "learning_rate": 5.1666575425096396e-05, |
| "loss": 0.1073, |
| "mean_token_accuracy": 0.9565638899803162, |
| "num_tokens": 1385196.0, |
| "step": 266 |
| }, |
| { |
| "epoch": 3.379746835443038, |
| "grad_norm": 0.06986885517835617, |
| "learning_rate": 5.095012513713815e-05, |
| "loss": 0.1025, |
| "mean_token_accuracy": 0.9559379816055298, |
| "num_tokens": 1390548.0, |
| "step": 267 |
| }, |
| { |
| "epoch": 3.392405063291139, |
| "grad_norm": 0.0762210562825203, |
| "learning_rate": 5.023697502946969e-05, |
| "loss": 0.1104, |
| "mean_token_accuracy": 0.9542302489280701, |
| "num_tokens": 1395659.0, |
| "step": 268 |
| }, |
| { |
| "epoch": 3.4050632911392404, |
| "grad_norm": 0.08255967497825623, |
| "learning_rate": 4.9527173084352544e-05, |
| "loss": 0.102, |
| "mean_token_accuracy": 0.9543691277503967, |
| "num_tokens": 1401136.0, |
| "step": 269 |
| }, |
| { |
| "epoch": 3.4177215189873418, |
| "grad_norm": 0.2949913442134857, |
| "learning_rate": 4.882076705877689e-05, |
| "loss": 0.1044, |
| "mean_token_accuracy": 0.9576367735862732, |
| "num_tokens": 1406464.0, |
| "step": 270 |
| }, |
| { |
| "epoch": 3.430379746835443, |
| "grad_norm": 0.0810595452785492, |
| "learning_rate": 4.811780448124812e-05, |
| "loss": 0.1116, |
| "mean_token_accuracy": 0.9548583030700684, |
| "num_tokens": 1411468.0, |
| "step": 271 |
| }, |
| { |
| "epoch": 3.4430379746835444, |
| "grad_norm": 0.11588563770055771, |
| "learning_rate": 4.741833264858909e-05, |
| "loss": 0.1096, |
| "mean_token_accuracy": 0.9515007138252258, |
| "num_tokens": 1416563.0, |
| "step": 272 |
| }, |
| { |
| "epoch": 3.4556962025316453, |
| "grad_norm": 0.12587064504623413, |
| "learning_rate": 4.6722398622757935e-05, |
| "loss": 0.1046, |
| "mean_token_accuracy": 0.9545803070068359, |
| "num_tokens": 1421845.0, |
| "step": 273 |
| }, |
| { |
| "epoch": 3.4683544303797467, |
| "grad_norm": 0.09493621438741684, |
| "learning_rate": 4.603004922768148e-05, |
| "loss": 0.1055, |
| "mean_token_accuracy": 0.9531071186065674, |
| "num_tokens": 1427155.0, |
| "step": 274 |
| }, |
| { |
| "epoch": 3.481012658227848, |
| "grad_norm": 0.12601108849048615, |
| "learning_rate": 4.5341331046105064e-05, |
| "loss": 0.1048, |
| "mean_token_accuracy": 0.9577872157096863, |
| "num_tokens": 1432407.0, |
| "step": 275 |
| }, |
| { |
| "epoch": 3.4936708860759493, |
| "grad_norm": 0.10189390927553177, |
| "learning_rate": 4.465629041645819e-05, |
| "loss": 0.1126, |
| "mean_token_accuracy": 0.9512391686439514, |
| "num_tokens": 1437434.0, |
| "step": 276 |
| }, |
| { |
| "epoch": 3.5063291139240507, |
| "grad_norm": 0.0744316354393959, |
| "learning_rate": 4.397497342973676e-05, |
| "loss": 0.1011, |
| "mean_token_accuracy": 0.9574943780899048, |
| "num_tokens": 1442862.0, |
| "step": 277 |
| }, |
| { |
| "epoch": 3.518987341772152, |
| "grad_norm": 0.08852620422840118, |
| "learning_rate": 4.3297425926402115e-05, |
| "loss": 0.1056, |
| "mean_token_accuracy": 0.9545888304710388, |
| "num_tokens": 1448167.0, |
| "step": 278 |
| }, |
| { |
| "epoch": 3.5316455696202533, |
| "grad_norm": 0.10621877759695053, |
| "learning_rate": 4.2623693493296644e-05, |
| "loss": 0.1062, |
| "mean_token_accuracy": 0.9530797600746155, |
| "num_tokens": 1453410.0, |
| "step": 279 |
| }, |
| { |
| "epoch": 3.5443037974683547, |
| "grad_norm": 0.12595853209495544, |
| "learning_rate": 4.1953821460576715e-05, |
| "loss": 0.1061, |
| "mean_token_accuracy": 0.9557862281799316, |
| "num_tokens": 1458676.0, |
| "step": 280 |
| }, |
| { |
| "epoch": 3.5569620253164556, |
| "grad_norm": 0.07249915599822998, |
| "learning_rate": 4.1287854898662705e-05, |
| "loss": 0.1051, |
| "mean_token_accuracy": 0.9545806050300598, |
| "num_tokens": 1463914.0, |
| "step": 281 |
| }, |
| { |
| "epoch": 3.569620253164557, |
| "grad_norm": 0.07927811145782471, |
| "learning_rate": 4.0625838615206566e-05, |
| "loss": 0.1098, |
| "mean_token_accuracy": 0.9522687196731567, |
| "num_tokens": 1469069.0, |
| "step": 282 |
| }, |
| { |
| "epoch": 3.5822784810126582, |
| "grad_norm": 0.090684674680233, |
| "learning_rate": 3.996781715207706e-05, |
| "loss": 0.1066, |
| "mean_token_accuracy": 0.9550113677978516, |
| "num_tokens": 1474401.0, |
| "step": 283 |
| }, |
| { |
| "epoch": 3.5949367088607596, |
| "grad_norm": 0.08619457483291626, |
| "learning_rate": 3.9313834782362926e-05, |
| "loss": 0.1077, |
| "mean_token_accuracy": 0.956727921962738, |
| "num_tokens": 1479526.0, |
| "step": 284 |
| }, |
| { |
| "epoch": 3.607594936708861, |
| "grad_norm": 0.08588071167469025, |
| "learning_rate": 3.866393550739416e-05, |
| "loss": 0.107, |
| "mean_token_accuracy": 0.951872706413269, |
| "num_tokens": 1484743.0, |
| "step": 285 |
| }, |
| { |
| "epoch": 3.620253164556962, |
| "grad_norm": 0.14406421780586243, |
| "learning_rate": 3.801816305378124e-05, |
| "loss": 0.105, |
| "mean_token_accuracy": 0.9508963227272034, |
| "num_tokens": 1489939.0, |
| "step": 286 |
| }, |
| { |
| "epoch": 3.632911392405063, |
| "grad_norm": 0.07721186429262161, |
| "learning_rate": 3.737656087047347e-05, |
| "loss": 0.1072, |
| "mean_token_accuracy": 0.955703616142273, |
| "num_tokens": 1495105.0, |
| "step": 287 |
| }, |
| { |
| "epoch": 3.6455696202531644, |
| "grad_norm": 0.12911659479141235, |
| "learning_rate": 3.673917212583538e-05, |
| "loss": 0.1072, |
| "mean_token_accuracy": 0.9535064101219177, |
| "num_tokens": 1500331.0, |
| "step": 288 |
| }, |
| { |
| "epoch": 3.6582278481012658, |
| "grad_norm": 0.11017242074012756, |
| "learning_rate": 3.610603970474239e-05, |
| "loss": 0.1031, |
| "mean_token_accuracy": 0.955674409866333, |
| "num_tokens": 1505629.0, |
| "step": 289 |
| }, |
| { |
| "epoch": 3.670886075949367, |
| "grad_norm": 0.08761169761419296, |
| "learning_rate": 3.547720620569539e-05, |
| "loss": 0.1072, |
| "mean_token_accuracy": 0.9508035778999329, |
| "num_tokens": 1510795.0, |
| "step": 290 |
| }, |
| { |
| "epoch": 3.6835443037974684, |
| "grad_norm": 0.09792128205299377, |
| "learning_rate": 3.485271393795453e-05, |
| "loss": 0.103, |
| "mean_token_accuracy": 0.9534751176834106, |
| "num_tokens": 1516125.0, |
| "step": 291 |
| }, |
| { |
| "epoch": 3.6962025316455698, |
| "grad_norm": 0.12610845267772675, |
| "learning_rate": 3.4232604918692754e-05, |
| "loss": 0.1055, |
| "mean_token_accuracy": 0.9523255825042725, |
| "num_tokens": 1521349.0, |
| "step": 292 |
| }, |
| { |
| "epoch": 3.708860759493671, |
| "grad_norm": 0.08853945136070251, |
| "learning_rate": 3.361692087016863e-05, |
| "loss": 0.1059, |
| "mean_token_accuracy": 0.9500682950019836, |
| "num_tokens": 1526540.0, |
| "step": 293 |
| }, |
| { |
| "epoch": 3.721518987341772, |
| "grad_norm": 0.06902845948934555, |
| "learning_rate": 3.300570321691934e-05, |
| "loss": 0.1056, |
| "mean_token_accuracy": 0.9520946741104126, |
| "num_tokens": 1531760.0, |
| "step": 294 |
| }, |
| { |
| "epoch": 3.7341772151898733, |
| "grad_norm": 0.07241090387105942, |
| "learning_rate": 3.2398993082973294e-05, |
| "loss": 0.1009, |
| "mean_token_accuracy": 0.9556169509887695, |
| "num_tokens": 1537254.0, |
| "step": 295 |
| }, |
| { |
| "epoch": 3.7468354430379747, |
| "grad_norm": 0.10073200613260269, |
| "learning_rate": 3.179683128908352e-05, |
| "loss": 0.1069, |
| "mean_token_accuracy": 0.9539434909820557, |
| "num_tokens": 1542377.0, |
| "step": 296 |
| }, |
| { |
| "epoch": 3.759493670886076, |
| "grad_norm": 0.0977904349565506, |
| "learning_rate": 3.1199258349980966e-05, |
| "loss": 0.1071, |
| "mean_token_accuracy": 0.9532988667488098, |
| "num_tokens": 1547473.0, |
| "step": 297 |
| }, |
| { |
| "epoch": 3.7721518987341773, |
| "grad_norm": 0.08963675051927567, |
| "learning_rate": 3.0606314471648643e-05, |
| "loss": 0.1049, |
| "mean_token_accuracy": 0.952194333076477, |
| "num_tokens": 1552641.0, |
| "step": 298 |
| }, |
| { |
| "epoch": 3.7848101265822782, |
| "grad_norm": 0.08540157228708267, |
| "learning_rate": 3.0018039548616494e-05, |
| "loss": 0.1078, |
| "mean_token_accuracy": 0.9502468109130859, |
| "num_tokens": 1557770.0, |
| "step": 299 |
| }, |
| { |
| "epoch": 3.7974683544303796, |
| "grad_norm": 0.07660060375928879, |
| "learning_rate": 2.943447316127712e-05, |
| "loss": 0.1101, |
| "mean_token_accuracy": 0.9517952799797058, |
| "num_tokens": 1562875.0, |
| "step": 300 |
| }, |
| { |
| "epoch": 3.810126582278481, |
| "grad_norm": 0.08242560923099518, |
| "learning_rate": 2.8855654573222825e-05, |
| "loss": 0.1087, |
| "mean_token_accuracy": 0.9529340863227844, |
| "num_tokens": 1567932.0, |
| "step": 301 |
| }, |
| { |
| "epoch": 3.8227848101265822, |
| "grad_norm": 0.07197526842355728, |
| "learning_rate": 2.8281622728603864e-05, |
| "loss": 0.1072, |
| "mean_token_accuracy": 0.9523903131484985, |
| "num_tokens": 1573079.0, |
| "step": 302 |
| }, |
| { |
| "epoch": 3.8354430379746836, |
| "grad_norm": 0.0890003964304924, |
| "learning_rate": 2.7712416249508177e-05, |
| "loss": 0.1092, |
| "mean_token_accuracy": 0.9537814855575562, |
| "num_tokens": 1578141.0, |
| "step": 303 |
| }, |
| { |
| "epoch": 3.848101265822785, |
| "grad_norm": 0.10012844949960709, |
| "learning_rate": 2.714807343336273e-05, |
| "loss": 0.108, |
| "mean_token_accuracy": 0.9498612880706787, |
| "num_tokens": 1583251.0, |
| "step": 304 |
| }, |
| { |
| "epoch": 3.8607594936708862, |
| "grad_norm": 0.08376947045326233, |
| "learning_rate": 2.6588632250356948e-05, |
| "loss": 0.1057, |
| "mean_token_accuracy": 0.9516860842704773, |
| "num_tokens": 1588386.0, |
| "step": 305 |
| }, |
| { |
| "epoch": 3.8734177215189876, |
| "grad_norm": 0.12690703570842743, |
| "learning_rate": 2.6034130340887895e-05, |
| "loss": 0.1088, |
| "mean_token_accuracy": 0.9529805183410645, |
| "num_tokens": 1593533.0, |
| "step": 306 |
| }, |
| { |
| "epoch": 3.8860759493670884, |
| "grad_norm": 0.09463846683502197, |
| "learning_rate": 2.5484605013027784e-05, |
| "loss": 0.101, |
| "mean_token_accuracy": 0.9561387300491333, |
| "num_tokens": 1598932.0, |
| "step": 307 |
| }, |
| { |
| "epoch": 3.8987341772151898, |
| "grad_norm": 0.0749184638261795, |
| "learning_rate": 2.4940093240013717e-05, |
| "loss": 0.1017, |
| "mean_token_accuracy": 0.9565382599830627, |
| "num_tokens": 1604265.0, |
| "step": 308 |
| }, |
| { |
| "epoch": 3.911392405063291, |
| "grad_norm": 0.0753999873995781, |
| "learning_rate": 2.4400631657760186e-05, |
| "loss": 0.1048, |
| "mean_token_accuracy": 0.9529388546943665, |
| "num_tokens": 1609450.0, |
| "step": 309 |
| }, |
| { |
| "epoch": 3.9240506329113924, |
| "grad_norm": 0.09461472928524017, |
| "learning_rate": 2.3866256562394083e-05, |
| "loss": 0.1053, |
| "mean_token_accuracy": 0.9552039504051208, |
| "num_tokens": 1614760.0, |
| "step": 310 |
| }, |
| { |
| "epoch": 3.9367088607594938, |
| "grad_norm": 0.08459661155939102, |
| "learning_rate": 2.333700390781256e-05, |
| "loss": 0.1062, |
| "mean_token_accuracy": 0.9539961218833923, |
| "num_tokens": 1619954.0, |
| "step": 311 |
| }, |
| { |
| "epoch": 3.9493670886075947, |
| "grad_norm": 0.0780106633901596, |
| "learning_rate": 2.2812909303264085e-05, |
| "loss": 0.1086, |
| "mean_token_accuracy": 0.9520302414894104, |
| "num_tokens": 1625042.0, |
| "step": 312 |
| }, |
| { |
| "epoch": 3.962025316455696, |
| "grad_norm": 0.0692264512181282, |
| "learning_rate": 2.2294008010952382e-05, |
| "loss": 0.1052, |
| "mean_token_accuracy": 0.9553224444389343, |
| "num_tokens": 1630254.0, |
| "step": 313 |
| }, |
| { |
| "epoch": 3.9746835443037973, |
| "grad_norm": 0.08776938170194626, |
| "learning_rate": 2.1780334943664162e-05, |
| "loss": 0.108, |
| "mean_token_accuracy": 0.9492525458335876, |
| "num_tokens": 1635402.0, |
| "step": 314 |
| }, |
| { |
| "epoch": 3.9873417721518987, |
| "grad_norm": 0.08817070722579956, |
| "learning_rate": 2.127192466241994e-05, |
| "loss": 0.1033, |
| "mean_token_accuracy": 0.955152690410614, |
| "num_tokens": 1640706.0, |
| "step": 315 |
| }, |
| { |
| "epoch": 4.0, |
| "grad_norm": 0.07555601745843887, |
| "learning_rate": 2.07688113741488e-05, |
| "loss": 0.1071, |
| "mean_token_accuracy": 0.9514446258544922, |
| "num_tokens": 1645754.0, |
| "step": 316 |
| }, |
| { |
| "epoch": 4.012658227848101, |
| "grad_norm": 0.09684138000011444, |
| "learning_rate": 2.0271028929386738e-05, |
| "loss": 0.1006, |
| "mean_token_accuracy": 0.956803023815155, |
| "num_tokens": 1651073.0, |
| "step": 317 |
| }, |
| { |
| "epoch": 4.025316455696203, |
| "grad_norm": 0.0689501166343689, |
| "learning_rate": 1.977861081999931e-05, |
| "loss": 0.1062, |
| "mean_token_accuracy": 0.9500601887702942, |
| "num_tokens": 1656123.0, |
| "step": 318 |
| }, |
| { |
| "epoch": 4.037974683544304, |
| "grad_norm": 0.0964011624455452, |
| "learning_rate": 1.92915901769281e-05, |
| "loss": 0.1031, |
| "mean_token_accuracy": 0.9536062479019165, |
| "num_tokens": 1661317.0, |
| "step": 319 |
| }, |
| { |
| "epoch": 4.050632911392405, |
| "grad_norm": 0.07395302504301071, |
| "learning_rate": 1.880999976796164e-05, |
| "loss": 0.1046, |
| "mean_token_accuracy": 0.9519667625427246, |
| "num_tokens": 1666440.0, |
| "step": 320 |
| }, |
| { |
| "epoch": 4.063291139240507, |
| "grad_norm": 0.08307081460952759, |
| "learning_rate": 1.8333871995530726e-05, |
| "loss": 0.1002, |
| "mean_token_accuracy": 0.9573794603347778, |
| "num_tokens": 1671877.0, |
| "step": 321 |
| }, |
| { |
| "epoch": 4.075949367088608, |
| "grad_norm": 0.06272169202566147, |
| "learning_rate": 1.786323889452828e-05, |
| "loss": 0.1008, |
| "mean_token_accuracy": 0.9574791193008423, |
| "num_tokens": 1677209.0, |
| "step": 322 |
| }, |
| { |
| "epoch": 4.0886075949367084, |
| "grad_norm": 0.07284139841794968, |
| "learning_rate": 1.739813213015401e-05, |
| "loss": 0.104, |
| "mean_token_accuracy": 0.9567620754241943, |
| "num_tokens": 1682338.0, |
| "step": 323 |
| }, |
| { |
| "epoch": 4.10126582278481, |
| "grad_norm": 0.06694748252630234, |
| "learning_rate": 1.693858299578396e-05, |
| "loss": 0.1031, |
| "mean_token_accuracy": 0.9539980292320251, |
| "num_tokens": 1687467.0, |
| "step": 324 |
| }, |
| { |
| "epoch": 4.113924050632911, |
| "grad_norm": 0.07162707298994064, |
| "learning_rate": 1.6484622410864835e-05, |
| "loss": 0.1022, |
| "mean_token_accuracy": 0.954440176486969, |
| "num_tokens": 1692711.0, |
| "step": 325 |
| }, |
| { |
| "epoch": 4.1265822784810124, |
| "grad_norm": 0.06535227596759796, |
| "learning_rate": 1.6036280918833924e-05, |
| "loss": 0.1022, |
| "mean_token_accuracy": 0.9556373357772827, |
| "num_tokens": 1697937.0, |
| "step": 326 |
| }, |
| { |
| "epoch": 4.139240506329114, |
| "grad_norm": 0.07000143826007843, |
| "learning_rate": 1.5593588685063896e-05, |
| "loss": 0.1018, |
| "mean_token_accuracy": 0.9560693502426147, |
| "num_tokens": 1703191.0, |
| "step": 327 |
| }, |
| { |
| "epoch": 4.151898734177215, |
| "grad_norm": 0.07342347502708435, |
| "learning_rate": 1.515657549483328e-05, |
| "loss": 0.1062, |
| "mean_token_accuracy": 0.9525246620178223, |
| "num_tokens": 1708226.0, |
| "step": 328 |
| }, |
| { |
| "epoch": 4.1645569620253164, |
| "grad_norm": 0.08151296526193619, |
| "learning_rate": 1.4725270751322452e-05, |
| "loss": 0.1073, |
| "mean_token_accuracy": 0.9529818892478943, |
| "num_tokens": 1713203.0, |
| "step": 329 |
| }, |
| { |
| "epoch": 4.177215189873418, |
| "grad_norm": 0.06281263381242752, |
| "learning_rate": 1.4299703473635218e-05, |
| "loss": 0.0973, |
| "mean_token_accuracy": 0.958076000213623, |
| "num_tokens": 1718610.0, |
| "step": 330 |
| }, |
| { |
| "epoch": 4.189873417721519, |
| "grad_norm": 0.08737554401159286, |
| "learning_rate": 1.3879902294846536e-05, |
| "loss": 0.1069, |
| "mean_token_accuracy": 0.9523618221282959, |
| "num_tokens": 1723649.0, |
| "step": 331 |
| }, |
| { |
| "epoch": 4.2025316455696204, |
| "grad_norm": 0.12319174408912659, |
| "learning_rate": 1.3465895460075873e-05, |
| "loss": 0.1023, |
| "mean_token_accuracy": 0.9562439322471619, |
| "num_tokens": 1728878.0, |
| "step": 332 |
| }, |
| { |
| "epoch": 4.215189873417722, |
| "grad_norm": 0.07765615731477737, |
| "learning_rate": 1.3057710824586899e-05, |
| "loss": 0.106, |
| "mean_token_accuracy": 0.9550222158432007, |
| "num_tokens": 1733900.0, |
| "step": 333 |
| }, |
| { |
| "epoch": 4.227848101265823, |
| "grad_norm": 0.0769255980849266, |
| "learning_rate": 1.2655375851913232e-05, |
| "loss": 0.1029, |
| "mean_token_accuracy": 0.9560784101486206, |
| "num_tokens": 1739064.0, |
| "step": 334 |
| }, |
| { |
| "epoch": 4.2405063291139244, |
| "grad_norm": 0.07434723526239395, |
| "learning_rate": 1.22589176120107e-05, |
| "loss": 0.0997, |
| "mean_token_accuracy": 0.9566869139671326, |
| "num_tokens": 1744392.0, |
| "step": 335 |
| }, |
| { |
| "epoch": 4.253164556962025, |
| "grad_norm": 0.06731196492910385, |
| "learning_rate": 1.186836277943606e-05, |
| "loss": 0.1056, |
| "mean_token_accuracy": 0.9545182585716248, |
| "num_tokens": 1749469.0, |
| "step": 336 |
| }, |
| { |
| "epoch": 4.265822784810126, |
| "grad_norm": 0.07609716057777405, |
| "learning_rate": 1.1483737631552161e-05, |
| "loss": 0.1023, |
| "mean_token_accuracy": 0.953596293926239, |
| "num_tokens": 1754705.0, |
| "step": 337 |
| }, |
| { |
| "epoch": 4.2784810126582276, |
| "grad_norm": 0.07831935584545135, |
| "learning_rate": 1.1105068046760048e-05, |
| "loss": 0.1022, |
| "mean_token_accuracy": 0.9571400880813599, |
| "num_tokens": 1759902.0, |
| "step": 338 |
| }, |
| { |
| "epoch": 4.291139240506329, |
| "grad_norm": 0.09007194638252258, |
| "learning_rate": 1.0732379502757717e-05, |
| "loss": 0.104, |
| "mean_token_accuracy": 0.9568931460380554, |
| "num_tokens": 1765000.0, |
| "step": 339 |
| }, |
| { |
| "epoch": 4.30379746835443, |
| "grad_norm": 0.07691890746355057, |
| "learning_rate": 1.036569707482602e-05, |
| "loss": 0.104, |
| "mean_token_accuracy": 0.953274667263031, |
| "num_tokens": 1770179.0, |
| "step": 340 |
| }, |
| { |
| "epoch": 4.3164556962025316, |
| "grad_norm": 0.06939467787742615, |
| "learning_rate": 1.0005045434141502e-05, |
| "loss": 0.1, |
| "mean_token_accuracy": 0.956974983215332, |
| "num_tokens": 1775519.0, |
| "step": 341 |
| }, |
| { |
| "epoch": 4.329113924050633, |
| "grad_norm": 0.08041319996118546, |
| "learning_rate": 9.6504488461164e-06, |
| "loss": 0.1049, |
| "mean_token_accuracy": 0.95549076795578, |
| "num_tokens": 1780728.0, |
| "step": 342 |
| }, |
| { |
| "epoch": 4.341772151898734, |
| "grad_norm": 0.07367473840713501, |
| "learning_rate": 9.301931168766164e-06, |
| "loss": 0.1011, |
| "mean_token_accuracy": 0.956186056137085, |
| "num_tokens": 1785973.0, |
| "step": 343 |
| }, |
| { |
| "epoch": 4.3544303797468356, |
| "grad_norm": 0.07549143582582474, |
| "learning_rate": 8.959515851104117e-06, |
| "loss": 0.1051, |
| "mean_token_accuracy": 0.9559249877929688, |
| "num_tokens": 1791210.0, |
| "step": 344 |
| }, |
| { |
| "epoch": 4.367088607594937, |
| "grad_norm": 0.07187310606241226, |
| "learning_rate": 8.623225931563805e-06, |
| "loss": 0.104, |
| "mean_token_accuracy": 0.9560890197753906, |
| "num_tokens": 1796398.0, |
| "step": 345 |
| }, |
| { |
| "epoch": 4.379746835443038, |
| "grad_norm": 0.06743541359901428, |
| "learning_rate": 8.293084036448895e-06, |
| "loss": 0.0988, |
| "mean_token_accuracy": 0.9584117531776428, |
| "num_tokens": 1801776.0, |
| "step": 346 |
| }, |
| { |
| "epoch": 4.3924050632911396, |
| "grad_norm": 0.067915178835392, |
| "learning_rate": 7.96911237841088e-06, |
| "loss": 0.1004, |
| "mean_token_accuracy": 0.9545979499816895, |
| "num_tokens": 1807038.0, |
| "step": 347 |
| }, |
| { |
| "epoch": 4.405063291139241, |
| "grad_norm": 0.09219470620155334, |
| "learning_rate": 7.651332754954477e-06, |
| "loss": 0.1003, |
| "mean_token_accuracy": 0.9545368552207947, |
| "num_tokens": 1812403.0, |
| "step": 348 |
| }, |
| { |
| "epoch": 4.417721518987342, |
| "grad_norm": 0.11064563691616058, |
| "learning_rate": 7.3397665469711495e-06, |
| "loss": 0.1019, |
| "mean_token_accuracy": 0.9539871215820312, |
| "num_tokens": 1817596.0, |
| "step": 349 |
| }, |
| { |
| "epoch": 4.430379746835443, |
| "grad_norm": 0.09897923469543457, |
| "learning_rate": 7.034434717300509e-06, |
| "loss": 0.105, |
| "mean_token_accuracy": 0.9534472823143005, |
| "num_tokens": 1822751.0, |
| "step": 350 |
| }, |
| { |
| "epoch": 4.443037974683544, |
| "grad_norm": 0.07111285626888275, |
| "learning_rate": 6.735357809319809e-06, |
| "loss": 0.1018, |
| "mean_token_accuracy": 0.9563706517219543, |
| "num_tokens": 1827995.0, |
| "step": 351 |
| }, |
| { |
| "epoch": 4.455696202531645, |
| "grad_norm": 0.2520071566104889, |
| "learning_rate": 6.442555945561901e-06, |
| "loss": 0.1053, |
| "mean_token_accuracy": 0.9519890546798706, |
| "num_tokens": 1833162.0, |
| "step": 352 |
| }, |
| { |
| "epoch": 4.468354430379747, |
| "grad_norm": 0.12714385986328125, |
| "learning_rate": 6.156048826361238e-06, |
| "loss": 0.1061, |
| "mean_token_accuracy": 0.9527450799942017, |
| "num_tokens": 1838326.0, |
| "step": 353 |
| }, |
| { |
| "epoch": 4.481012658227848, |
| "grad_norm": 0.08718091994524002, |
| "learning_rate": 5.8758557285284125e-06, |
| "loss": 0.1032, |
| "mean_token_accuracy": 0.9563856720924377, |
| "num_tokens": 1843503.0, |
| "step": 354 |
| }, |
| { |
| "epoch": 4.493670886075949, |
| "grad_norm": 0.07357566058635712, |
| "learning_rate": 5.6019955040531925e-06, |
| "loss": 0.1023, |
| "mean_token_accuracy": 0.9551690816879272, |
| "num_tokens": 1848742.0, |
| "step": 355 |
| }, |
| { |
| "epoch": 4.506329113924051, |
| "grad_norm": 0.07677753269672394, |
| "learning_rate": 5.334486578836118e-06, |
| "loss": 0.1004, |
| "mean_token_accuracy": 0.9548485279083252, |
| "num_tokens": 1854055.0, |
| "step": 356 |
| }, |
| { |
| "epoch": 4.518987341772152, |
| "grad_norm": 0.07052655518054962, |
| "learning_rate": 5.073346951448699e-06, |
| "loss": 0.1038, |
| "mean_token_accuracy": 0.9546507000923157, |
| "num_tokens": 1859301.0, |
| "step": 357 |
| }, |
| { |
| "epoch": 4.531645569620253, |
| "grad_norm": 0.07745072990655899, |
| "learning_rate": 4.818594191922576e-06, |
| "loss": 0.1005, |
| "mean_token_accuracy": 0.95723557472229, |
| "num_tokens": 1864603.0, |
| "step": 358 |
| }, |
| { |
| "epoch": 4.544303797468355, |
| "grad_norm": 0.08845014125108719, |
| "learning_rate": 4.5702454405672e-06, |
| "loss": 0.105, |
| "mean_token_accuracy": 0.9560937285423279, |
| "num_tokens": 1869746.0, |
| "step": 359 |
| }, |
| { |
| "epoch": 4.556962025316456, |
| "grad_norm": 0.0690731629729271, |
| "learning_rate": 4.328317406816751e-06, |
| "loss": 0.1015, |
| "mean_token_accuracy": 0.9542607665061951, |
| "num_tokens": 1875079.0, |
| "step": 360 |
| }, |
| { |
| "epoch": 4.569620253164557, |
| "grad_norm": 0.0831163302063942, |
| "learning_rate": 4.092826368105795e-06, |
| "loss": 0.1051, |
| "mean_token_accuracy": 0.9527947902679443, |
| "num_tokens": 1880206.0, |
| "step": 361 |
| }, |
| { |
| "epoch": 4.582278481012658, |
| "grad_norm": 0.0732286274433136, |
| "learning_rate": 3.863788168774118e-06, |
| "loss": 0.0997, |
| "mean_token_accuracy": 0.9570702314376831, |
| "num_tokens": 1885581.0, |
| "step": 362 |
| }, |
| { |
| "epoch": 4.594936708860759, |
| "grad_norm": 0.08837465196847916, |
| "learning_rate": 3.6412182190007082e-06, |
| "loss": 0.105, |
| "mean_token_accuracy": 0.9544827342033386, |
| "num_tokens": 1890720.0, |
| "step": 363 |
| }, |
| { |
| "epoch": 4.6075949367088604, |
| "grad_norm": 0.08702041208744049, |
| "learning_rate": 3.425131493766931e-06, |
| "loss": 0.1033, |
| "mean_token_accuracy": 0.9553981423377991, |
| "num_tokens": 1896008.0, |
| "step": 364 |
| }, |
| { |
| "epoch": 4.620253164556962, |
| "grad_norm": 0.09506855905056, |
| "learning_rate": 3.2155425318489584e-06, |
| "loss": 0.1046, |
| "mean_token_accuracy": 0.9514335989952087, |
| "num_tokens": 1901199.0, |
| "step": 365 |
| }, |
| { |
| "epoch": 4.632911392405063, |
| "grad_norm": 0.07980173826217651, |
| "learning_rate": 3.012465434839529e-06, |
| "loss": 0.1028, |
| "mean_token_accuracy": 0.9555080533027649, |
| "num_tokens": 1906410.0, |
| "step": 366 |
| }, |
| { |
| "epoch": 4.6455696202531644, |
| "grad_norm": 0.07992957532405853, |
| "learning_rate": 2.8159138661992824e-06, |
| "loss": 0.0993, |
| "mean_token_accuracy": 0.9551005363464355, |
| "num_tokens": 1911797.0, |
| "step": 367 |
| }, |
| { |
| "epoch": 4.658227848101266, |
| "grad_norm": 0.06562772393226624, |
| "learning_rate": 2.6259010503373206e-06, |
| "loss": 0.1005, |
| "mean_token_accuracy": 0.9560797810554504, |
| "num_tokens": 1917075.0, |
| "step": 368 |
| }, |
| { |
| "epoch": 4.670886075949367, |
| "grad_norm": 0.08056320250034332, |
| "learning_rate": 2.4424397717215387e-06, |
| "loss": 0.1007, |
| "mean_token_accuracy": 0.9569810032844543, |
| "num_tokens": 1922346.0, |
| "step": 369 |
| }, |
| { |
| "epoch": 4.6835443037974684, |
| "grad_norm": 0.0747138187289238, |
| "learning_rate": 2.2655423740183924e-06, |
| "loss": 0.1052, |
| "mean_token_accuracy": 0.9540755748748779, |
| "num_tokens": 1927440.0, |
| "step": 370 |
| }, |
| { |
| "epoch": 4.69620253164557, |
| "grad_norm": 0.08138495683670044, |
| "learning_rate": 2.0952207592624505e-06, |
| "loss": 0.1023, |
| "mean_token_accuracy": 0.9549393653869629, |
| "num_tokens": 1932697.0, |
| "step": 371 |
| }, |
| { |
| "epoch": 4.708860759493671, |
| "grad_norm": 0.07584184408187866, |
| "learning_rate": 1.9314863870555255e-06, |
| "loss": 0.1068, |
| "mean_token_accuracy": 0.95260089635849, |
| "num_tokens": 1937740.0, |
| "step": 372 |
| }, |
| { |
| "epoch": 4.7215189873417724, |
| "grad_norm": 0.07171127945184708, |
| "learning_rate": 1.7743502737957106e-06, |
| "loss": 0.1037, |
| "mean_token_accuracy": 0.9526029229164124, |
| "num_tokens": 1942952.0, |
| "step": 373 |
| }, |
| { |
| "epoch": 4.734177215189874, |
| "grad_norm": 0.07656321674585342, |
| "learning_rate": 1.6238229919361858e-06, |
| "loss": 0.1044, |
| "mean_token_accuracy": 0.95380699634552, |
| "num_tokens": 1948125.0, |
| "step": 374 |
| }, |
| { |
| "epoch": 4.746835443037975, |
| "grad_norm": 0.07331555336713791, |
| "learning_rate": 1.4799146692737741e-06, |
| "loss": 0.1049, |
| "mean_token_accuracy": 0.9529948234558105, |
| "num_tokens": 1953231.0, |
| "step": 375 |
| }, |
| { |
| "epoch": 4.759493670886076, |
| "grad_norm": 0.07884940505027771, |
| "learning_rate": 1.3426349882676325e-06, |
| "loss": 0.1068, |
| "mean_token_accuracy": 0.9540776014328003, |
| "num_tokens": 1958347.0, |
| "step": 376 |
| }, |
| { |
| "epoch": 4.772151898734177, |
| "grad_norm": 0.1426946520805359, |
| "learning_rate": 1.211993185387772e-06, |
| "loss": 0.1001, |
| "mean_token_accuracy": 0.9522359371185303, |
| "num_tokens": 1963666.0, |
| "step": 377 |
| }, |
| { |
| "epoch": 4.784810126582278, |
| "grad_norm": 0.07278037071228027, |
| "learning_rate": 1.0879980504935772e-06, |
| "loss": 0.1008, |
| "mean_token_accuracy": 0.9554380774497986, |
| "num_tokens": 1969026.0, |
| "step": 378 |
| }, |
| { |
| "epoch": 4.7974683544303796, |
| "grad_norm": 0.08306018263101578, |
| "learning_rate": 9.706579262424131e-07, |
| "loss": 0.1028, |
| "mean_token_accuracy": 0.9530498385429382, |
| "num_tokens": 1974287.0, |
| "step": 379 |
| }, |
| { |
| "epoch": 4.810126582278481, |
| "grad_norm": 0.08014005422592163, |
| "learning_rate": 8.599807075283406e-07, |
| "loss": 0.1036, |
| "mean_token_accuracy": 0.9550078511238098, |
| "num_tokens": 1979463.0, |
| "step": 380 |
| }, |
| { |
| "epoch": 4.822784810126582, |
| "grad_norm": 0.09596075862646103, |
| "learning_rate": 7.559738409508855e-07, |
| "loss": 0.1025, |
| "mean_token_accuracy": 0.954913318157196, |
| "num_tokens": 1984717.0, |
| "step": 381 |
| }, |
| { |
| "epoch": 4.8354430379746836, |
| "grad_norm": 0.08025940507650375, |
| "learning_rate": 6.586443243140838e-07, |
| "loss": 0.104, |
| "mean_token_accuracy": 0.951367199420929, |
| "num_tokens": 1989901.0, |
| "step": 382 |
| }, |
| { |
| "epoch": 4.848101265822785, |
| "grad_norm": 0.12304380536079407, |
| "learning_rate": 5.679987061555703e-07, |
| "loss": 0.1032, |
| "mean_token_accuracy": 0.9531791806221008, |
| "num_tokens": 1995155.0, |
| "step": 383 |
| }, |
| { |
| "epoch": 4.860759493670886, |
| "grad_norm": 0.07420387864112854, |
| "learning_rate": 4.840430853060518e-07, |
| "loss": 0.1052, |
| "mean_token_accuracy": 0.9540906548500061, |
| "num_tokens": 2000316.0, |
| "step": 384 |
| }, |
| { |
| "epoch": 4.8734177215189876, |
| "grad_norm": 0.06775283068418503, |
| "learning_rate": 4.0678311047890327e-07, |
| "loss": 0.1049, |
| "mean_token_accuracy": 0.951873779296875, |
| "num_tokens": 2005450.0, |
| "step": 385 |
| }, |
| { |
| "epoch": 4.886075949367089, |
| "grad_norm": 0.08906703442335129, |
| "learning_rate": 3.362239798901712e-07, |
| "loss": 0.1036, |
| "mean_token_accuracy": 0.956197202205658, |
| "num_tokens": 2010605.0, |
| "step": 386 |
| }, |
| { |
| "epoch": 4.89873417721519, |
| "grad_norm": 0.06832820922136307, |
| "learning_rate": 2.723704409087979e-07, |
| "loss": 0.1024, |
| "mean_token_accuracy": 0.954034149646759, |
| "num_tokens": 2015825.0, |
| "step": 387 |
| }, |
| { |
| "epoch": 4.911392405063291, |
| "grad_norm": 0.08005010336637497, |
| "learning_rate": 2.1522678973718847e-07, |
| "loss": 0.1018, |
| "mean_token_accuracy": 0.9544236063957214, |
| "num_tokens": 2021111.0, |
| "step": 388 |
| }, |
| { |
| "epoch": 4.924050632911392, |
| "grad_norm": 0.09537311643362045, |
| "learning_rate": 1.6479687112217479e-07, |
| "loss": 0.102, |
| "mean_token_accuracy": 0.9552180767059326, |
| "num_tokens": 2026311.0, |
| "step": 389 |
| }, |
| { |
| "epoch": 4.936708860759493, |
| "grad_norm": 0.07920707017183304, |
| "learning_rate": 1.2108407809635624e-07, |
| "loss": 0.1052, |
| "mean_token_accuracy": 0.9539999961853027, |
| "num_tokens": 2031375.0, |
| "step": 390 |
| }, |
| { |
| "epoch": 4.949367088607595, |
| "grad_norm": 0.07268811017274857, |
| "learning_rate": 8.40913517497377e-08, |
| "loss": 0.1069, |
| "mean_token_accuracy": 0.9519230723381042, |
| "num_tokens": 2036431.0, |
| "step": 391 |
| }, |
| { |
| "epoch": 4.962025316455696, |
| "grad_norm": 0.08966528624296188, |
| "learning_rate": 5.382118103193223e-08, |
| "loss": 0.1058, |
| "mean_token_accuracy": 0.9516574740409851, |
| "num_tokens": 2041563.0, |
| "step": 392 |
| }, |
| { |
| "epoch": 4.974683544303797, |
| "grad_norm": 0.09453365951776505, |
| "learning_rate": 3.027560258465067e-08, |
| "loss": 0.1062, |
| "mean_token_accuracy": 0.9526419043540955, |
| "num_tokens": 2046737.0, |
| "step": 393 |
| }, |
| { |
| "epoch": 4.987341772151899, |
| "grad_norm": 0.07027182728052139, |
| "learning_rate": 1.345620060465569e-08, |
| "loss": 0.1008, |
| "mean_token_accuracy": 0.9557777643203735, |
| "num_tokens": 2052002.0, |
| "step": 394 |
| }, |
| { |
| "epoch": 5.0, |
| "grad_norm": 0.06676497310400009, |
| "learning_rate": 3.3641067372358612e-09, |
| "loss": 0.0987, |
| "mean_token_accuracy": 0.9561353921890259, |
| "num_tokens": 2057355.0, |
| "step": 395 |
| }, |
| { |
| "epoch": 5.0, |
| "step": 395, |
| "total_flos": 1.1838517166892646e+17, |
| "train_loss": 0.13332003966162476, |
| "train_runtime": 398.9704, |
| "train_samples_per_second": 62.661, |
| "train_steps_per_second": 0.99 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 395, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 5, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.1838517166892646e+17, |
| "train_batch_size": 16, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|