| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 5.0, |
| "eval_steps": 500, |
| "global_step": 395, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.012658227848101266, |
| "grad_norm": 11.197978973388672, |
| "learning_rate": 0.0, |
| "loss": 2.2125, |
| "mean_token_accuracy": 0.6573320031166077, |
| "num_tokens": 5956.0, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.02531645569620253, |
| "grad_norm": 11.276443481445312, |
| "learning_rate": 1.6666666666666667e-05, |
| "loss": 2.1926, |
| "mean_token_accuracy": 0.6713488101959229, |
| "num_tokens": 11573.0, |
| "step": 2 |
| }, |
| { |
| "epoch": 0.0379746835443038, |
| "grad_norm": 8.826214790344238, |
| "learning_rate": 3.3333333333333335e-05, |
| "loss": 1.9803, |
| "mean_token_accuracy": 0.6706287860870361, |
| "num_tokens": 17442.0, |
| "step": 3 |
| }, |
| { |
| "epoch": 0.05063291139240506, |
| "grad_norm": 3.760211229324341, |
| "learning_rate": 5e-05, |
| "loss": 1.5535, |
| "mean_token_accuracy": 0.7151785492897034, |
| "num_tokens": 23106.0, |
| "step": 4 |
| }, |
| { |
| "epoch": 0.06329113924050633, |
| "grad_norm": 2.5126516819000244, |
| "learning_rate": 6.666666666666667e-05, |
| "loss": 1.3566, |
| "mean_token_accuracy": 0.7275997996330261, |
| "num_tokens": 29007.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.0759493670886076, |
| "grad_norm": 1.2685871124267578, |
| "learning_rate": 8.333333333333334e-05, |
| "loss": 1.1504, |
| "mean_token_accuracy": 0.7566807270050049, |
| "num_tokens": 34759.0, |
| "step": 6 |
| }, |
| { |
| "epoch": 0.08860759493670886, |
| "grad_norm": 0.7646545171737671, |
| "learning_rate": 0.0001, |
| "loss": 1.0527, |
| "mean_token_accuracy": 0.7682668566703796, |
| "num_tokens": 40489.0, |
| "step": 7 |
| }, |
| { |
| "epoch": 0.10126582278481013, |
| "grad_norm": 0.7801079750061035, |
| "learning_rate": 0.00011666666666666668, |
| "loss": 1.041, |
| "mean_token_accuracy": 0.7639105319976807, |
| "num_tokens": 46322.0, |
| "step": 8 |
| }, |
| { |
| "epoch": 0.11392405063291139, |
| "grad_norm": 0.7384425401687622, |
| "learning_rate": 0.00013333333333333334, |
| "loss": 0.9788, |
| "mean_token_accuracy": 0.7751237154006958, |
| "num_tokens": 52247.0, |
| "step": 9 |
| }, |
| { |
| "epoch": 0.12658227848101267, |
| "grad_norm": 0.6203671097755432, |
| "learning_rate": 0.00015000000000000001, |
| "loss": 0.8751, |
| "mean_token_accuracy": 0.790015697479248, |
| "num_tokens": 58040.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.13924050632911392, |
| "grad_norm": 0.6348746418952942, |
| "learning_rate": 0.0001666666666666667, |
| "loss": 0.7843, |
| "mean_token_accuracy": 0.8102871179580688, |
| "num_tokens": 63781.0, |
| "step": 11 |
| }, |
| { |
| "epoch": 0.1518987341772152, |
| "grad_norm": 0.5648266077041626, |
| "learning_rate": 0.00018333333333333334, |
| "loss": 0.7496, |
| "mean_token_accuracy": 0.8179905414581299, |
| "num_tokens": 69548.0, |
| "step": 12 |
| }, |
| { |
| "epoch": 0.16455696202531644, |
| "grad_norm": 0.5915428996086121, |
| "learning_rate": 0.0002, |
| "loss": 0.653, |
| "mean_token_accuracy": 0.8322916626930237, |
| "num_tokens": 75372.0, |
| "step": 13 |
| }, |
| { |
| "epoch": 0.17721518987341772, |
| "grad_norm": 0.748708963394165, |
| "learning_rate": 0.0001999966358932628, |
| "loss": 0.6096, |
| "mean_token_accuracy": 0.845966637134552, |
| "num_tokens": 81188.0, |
| "step": 14 |
| }, |
| { |
| "epoch": 0.189873417721519, |
| "grad_norm": 0.8758018016815186, |
| "learning_rate": 0.00019998654379939533, |
| "loss": 0.5494, |
| "mean_token_accuracy": 0.855889081954956, |
| "num_tokens": 86949.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.20253164556962025, |
| "grad_norm": 0.8752768039703369, |
| "learning_rate": 0.00019996972439741538, |
| "loss": 0.5225, |
| "mean_token_accuracy": 0.8620573282241821, |
| "num_tokens": 92943.0, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.21518987341772153, |
| "grad_norm": 0.7944232225418091, |
| "learning_rate": 0.0001999461788189681, |
| "loss": 0.3732, |
| "mean_token_accuracy": 0.8982363343238831, |
| "num_tokens": 98677.0, |
| "step": 17 |
| }, |
| { |
| "epoch": 0.22784810126582278, |
| "grad_norm": 1.1192169189453125, |
| "learning_rate": 0.00019991590864825028, |
| "loss": 0.3387, |
| "mean_token_accuracy": 0.910362720489502, |
| "num_tokens": 104531.0, |
| "step": 18 |
| }, |
| { |
| "epoch": 0.24050632911392406, |
| "grad_norm": 1.0875548124313354, |
| "learning_rate": 0.00019987891592190366, |
| "loss": 0.3235, |
| "mean_token_accuracy": 0.9153859615325928, |
| "num_tokens": 110386.0, |
| "step": 19 |
| }, |
| { |
| "epoch": 0.25316455696202533, |
| "grad_norm": 0.7268864512443542, |
| "learning_rate": 0.00019983520312887785, |
| "loss": 0.275, |
| "mean_token_accuracy": 0.9278350472450256, |
| "num_tokens": 116076.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.26582278481012656, |
| "grad_norm": 0.6245627403259277, |
| "learning_rate": 0.00019978477321026282, |
| "loss": 0.2344, |
| "mean_token_accuracy": 0.9346787333488464, |
| "num_tokens": 121789.0, |
| "step": 21 |
| }, |
| { |
| "epoch": 0.27848101265822783, |
| "grad_norm": 0.5919852256774902, |
| "learning_rate": 0.0001997276295590912, |
| "loss": 0.2204, |
| "mean_token_accuracy": 0.937617838382721, |
| "num_tokens": 127688.0, |
| "step": 22 |
| }, |
| { |
| "epoch": 0.2911392405063291, |
| "grad_norm": 0.7417113780975342, |
| "learning_rate": 0.00019966377602010984, |
| "loss": 0.2393, |
| "mean_token_accuracy": 0.9361550807952881, |
| "num_tokens": 133375.0, |
| "step": 23 |
| }, |
| { |
| "epoch": 0.3037974683544304, |
| "grad_norm": 0.587989091873169, |
| "learning_rate": 0.0001995932168895211, |
| "loss": 0.1962, |
| "mean_token_accuracy": 0.9441181421279907, |
| "num_tokens": 139058.0, |
| "step": 24 |
| }, |
| { |
| "epoch": 0.31645569620253167, |
| "grad_norm": 0.6960006952285767, |
| "learning_rate": 0.00019951595691469396, |
| "loss": 0.1871, |
| "mean_token_accuracy": 0.947879433631897, |
| "num_tokens": 144993.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.3291139240506329, |
| "grad_norm": 0.5633086562156677, |
| "learning_rate": 0.00019943200129384444, |
| "loss": 0.1649, |
| "mean_token_accuracy": 0.9524052143096924, |
| "num_tokens": 150940.0, |
| "step": 26 |
| }, |
| { |
| "epoch": 0.34177215189873417, |
| "grad_norm": 0.45496875047683716, |
| "learning_rate": 0.0001993413556756859, |
| "loss": 0.168, |
| "mean_token_accuracy": 0.9526759386062622, |
| "num_tokens": 156815.0, |
| "step": 27 |
| }, |
| { |
| "epoch": 0.35443037974683544, |
| "grad_norm": 0.5659371018409729, |
| "learning_rate": 0.0001992440261590491, |
| "loss": 0.1711, |
| "mean_token_accuracy": 0.95039302110672, |
| "num_tokens": 162604.0, |
| "step": 28 |
| }, |
| { |
| "epoch": 0.3670886075949367, |
| "grad_norm": 0.44007769227027893, |
| "learning_rate": 0.00019914001929247167, |
| "loss": 0.1652, |
| "mean_token_accuracy": 0.9532406330108643, |
| "num_tokens": 168207.0, |
| "step": 29 |
| }, |
| { |
| "epoch": 0.379746835443038, |
| "grad_norm": 0.49571409821510315, |
| "learning_rate": 0.0001990293420737576, |
| "loss": 0.1549, |
| "mean_token_accuracy": 0.9526830315589905, |
| "num_tokens": 174104.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.3924050632911392, |
| "grad_norm": 0.5281901359558105, |
| "learning_rate": 0.00019891200194950643, |
| "loss": 0.1606, |
| "mean_token_accuracy": 0.9500631093978882, |
| "num_tokens": 179715.0, |
| "step": 31 |
| }, |
| { |
| "epoch": 0.4050632911392405, |
| "grad_norm": 0.4619312286376953, |
| "learning_rate": 0.00019878800681461222, |
| "loss": 0.144, |
| "mean_token_accuracy": 0.9560834169387817, |
| "num_tokens": 185631.0, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.4177215189873418, |
| "grad_norm": 0.34627005457878113, |
| "learning_rate": 0.00019865736501173238, |
| "loss": 0.1337, |
| "mean_token_accuracy": 0.9609469771385193, |
| "num_tokens": 191482.0, |
| "step": 33 |
| }, |
| { |
| "epoch": 0.43037974683544306, |
| "grad_norm": 0.31673797965049744, |
| "learning_rate": 0.00019852008533072625, |
| "loss": 0.1276, |
| "mean_token_accuracy": 0.958939254283905, |
| "num_tokens": 197391.0, |
| "step": 34 |
| }, |
| { |
| "epoch": 0.4430379746835443, |
| "grad_norm": 0.2983987033367157, |
| "learning_rate": 0.00019837617700806383, |
| "loss": 0.1283, |
| "mean_token_accuracy": 0.9599243402481079, |
| "num_tokens": 203269.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.45569620253164556, |
| "grad_norm": 0.33408424258232117, |
| "learning_rate": 0.00019822564972620427, |
| "loss": 0.1352, |
| "mean_token_accuracy": 0.956938624382019, |
| "num_tokens": 209069.0, |
| "step": 36 |
| }, |
| { |
| "epoch": 0.46835443037974683, |
| "grad_norm": 0.3550320863723755, |
| "learning_rate": 0.0001980685136129445, |
| "loss": 0.1303, |
| "mean_token_accuracy": 0.9570572972297668, |
| "num_tokens": 214978.0, |
| "step": 37 |
| }, |
| { |
| "epoch": 0.4810126582278481, |
| "grad_norm": 0.32619988918304443, |
| "learning_rate": 0.00019790477924073755, |
| "loss": 0.1305, |
| "mean_token_accuracy": 0.9614076614379883, |
| "num_tokens": 220924.0, |
| "step": 38 |
| }, |
| { |
| "epoch": 0.4936708860759494, |
| "grad_norm": 0.39009329676628113, |
| "learning_rate": 0.00019773445762598163, |
| "loss": 0.1417, |
| "mean_token_accuracy": 0.9594571590423584, |
| "num_tokens": 226883.0, |
| "step": 39 |
| }, |
| { |
| "epoch": 0.5063291139240507, |
| "grad_norm": 0.26525068283081055, |
| "learning_rate": 0.00019755756022827846, |
| "loss": 0.1287, |
| "mean_token_accuracy": 0.9604967832565308, |
| "num_tokens": 232744.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.5189873417721519, |
| "grad_norm": 0.3513065576553345, |
| "learning_rate": 0.00019737409894966267, |
| "loss": 0.1335, |
| "mean_token_accuracy": 0.957602858543396, |
| "num_tokens": 238398.0, |
| "step": 41 |
| }, |
| { |
| "epoch": 0.5316455696202531, |
| "grad_norm": 0.33718594908714294, |
| "learning_rate": 0.00019718408613380074, |
| "loss": 0.1291, |
| "mean_token_accuracy": 0.9594740867614746, |
| "num_tokens": 244014.0, |
| "step": 42 |
| }, |
| { |
| "epoch": 0.5443037974683544, |
| "grad_norm": 0.35459810495376587, |
| "learning_rate": 0.00019698753456516048, |
| "loss": 0.1325, |
| "mean_token_accuracy": 0.9590643048286438, |
| "num_tokens": 249892.0, |
| "step": 43 |
| }, |
| { |
| "epoch": 0.5569620253164557, |
| "grad_norm": 0.25926443934440613, |
| "learning_rate": 0.00019678445746815107, |
| "loss": 0.1151, |
| "mean_token_accuracy": 0.9624645709991455, |
| "num_tokens": 255604.0, |
| "step": 44 |
| }, |
| { |
| "epoch": 0.569620253164557, |
| "grad_norm": 0.4317176640033722, |
| "learning_rate": 0.00019657486850623306, |
| "loss": 0.1064, |
| "mean_token_accuracy": 0.9645217657089233, |
| "num_tokens": 261418.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.5822784810126582, |
| "grad_norm": 0.30352234840393066, |
| "learning_rate": 0.00019635878178099928, |
| "loss": 0.1105, |
| "mean_token_accuracy": 0.9666838645935059, |
| "num_tokens": 267305.0, |
| "step": 46 |
| }, |
| { |
| "epoch": 0.5949367088607594, |
| "grad_norm": 0.2374143749475479, |
| "learning_rate": 0.0001961362118312259, |
| "loss": 0.1115, |
| "mean_token_accuracy": 0.967215895652771, |
| "num_tokens": 273256.0, |
| "step": 47 |
| }, |
| { |
| "epoch": 0.6075949367088608, |
| "grad_norm": 0.3764690160751343, |
| "learning_rate": 0.0001959071736318942, |
| "loss": 0.1168, |
| "mean_token_accuracy": 0.9633293747901917, |
| "num_tokens": 279183.0, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.620253164556962, |
| "grad_norm": 0.2127414494752884, |
| "learning_rate": 0.00019567168259318325, |
| "loss": 0.1106, |
| "mean_token_accuracy": 0.9629500508308411, |
| "num_tokens": 284996.0, |
| "step": 49 |
| }, |
| { |
| "epoch": 0.6329113924050633, |
| "grad_norm": 0.3254893720149994, |
| "learning_rate": 0.00019542975455943281, |
| "loss": 0.1082, |
| "mean_token_accuracy": 0.9625527262687683, |
| "num_tokens": 290748.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.6455696202531646, |
| "grad_norm": 0.3024154603481293, |
| "learning_rate": 0.00019518140580807744, |
| "loss": 0.1159, |
| "mean_token_accuracy": 0.9615980982780457, |
| "num_tokens": 296619.0, |
| "step": 51 |
| }, |
| { |
| "epoch": 0.6582278481012658, |
| "grad_norm": 0.6238520741462708, |
| "learning_rate": 0.00019492665304855132, |
| "loss": 0.1168, |
| "mean_token_accuracy": 0.962277352809906, |
| "num_tokens": 302409.0, |
| "step": 52 |
| }, |
| { |
| "epoch": 0.6708860759493671, |
| "grad_norm": 0.24419891834259033, |
| "learning_rate": 0.0001946655134211639, |
| "loss": 0.1015, |
| "mean_token_accuracy": 0.9673066735267639, |
| "num_tokens": 308254.0, |
| "step": 53 |
| }, |
| { |
| "epoch": 0.6835443037974683, |
| "grad_norm": 0.2389822155237198, |
| "learning_rate": 0.0001943980044959468, |
| "loss": 0.113, |
| "mean_token_accuracy": 0.9640350937843323, |
| "num_tokens": 314018.0, |
| "step": 54 |
| }, |
| { |
| "epoch": 0.6962025316455697, |
| "grad_norm": 0.2802983224391937, |
| "learning_rate": 0.0001941241442714716, |
| "loss": 0.1072, |
| "mean_token_accuracy": 0.9653002023696899, |
| "num_tokens": 319961.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.7088607594936709, |
| "grad_norm": 0.18901215493679047, |
| "learning_rate": 0.0001938439511736388, |
| "loss": 0.1033, |
| "mean_token_accuracy": 0.9646428823471069, |
| "num_tokens": 325625.0, |
| "step": 56 |
| }, |
| { |
| "epoch": 0.7215189873417721, |
| "grad_norm": 0.32898858189582825, |
| "learning_rate": 0.0001935574440544381, |
| "loss": 0.1033, |
| "mean_token_accuracy": 0.9662618041038513, |
| "num_tokens": 331617.0, |
| "step": 57 |
| }, |
| { |
| "epoch": 0.7341772151898734, |
| "grad_norm": 0.16215252876281738, |
| "learning_rate": 0.0001932646421906802, |
| "loss": 0.0929, |
| "mean_token_accuracy": 0.9681463837623596, |
| "num_tokens": 337583.0, |
| "step": 58 |
| }, |
| { |
| "epoch": 0.7468354430379747, |
| "grad_norm": 0.21538810431957245, |
| "learning_rate": 0.00019296556528269952, |
| "loss": 0.1094, |
| "mean_token_accuracy": 0.9648312330245972, |
| "num_tokens": 343277.0, |
| "step": 59 |
| }, |
| { |
| "epoch": 0.759493670886076, |
| "grad_norm": 0.20596884191036224, |
| "learning_rate": 0.00019266023345302887, |
| "loss": 0.1007, |
| "mean_token_accuracy": 0.9644421339035034, |
| "num_tokens": 349050.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.7721518987341772, |
| "grad_norm": 0.1876419484615326, |
| "learning_rate": 0.00019234866724504555, |
| "loss": 0.0955, |
| "mean_token_accuracy": 0.9664292931556702, |
| "num_tokens": 355012.0, |
| "step": 61 |
| }, |
| { |
| "epoch": 0.7848101265822784, |
| "grad_norm": 0.18318991363048553, |
| "learning_rate": 0.00019203088762158915, |
| "loss": 0.0957, |
| "mean_token_accuracy": 0.9672302603721619, |
| "num_tokens": 360813.0, |
| "step": 62 |
| }, |
| { |
| "epoch": 0.7974683544303798, |
| "grad_norm": 0.21235841512680054, |
| "learning_rate": 0.00019170691596355114, |
| "loss": 0.0997, |
| "mean_token_accuracy": 0.9650312066078186, |
| "num_tokens": 366482.0, |
| "step": 63 |
| }, |
| { |
| "epoch": 0.810126582278481, |
| "grad_norm": 0.17755351960659027, |
| "learning_rate": 0.00019137677406843619, |
| "loss": 0.091, |
| "mean_token_accuracy": 0.9684760570526123, |
| "num_tokens": 372478.0, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.8227848101265823, |
| "grad_norm": 0.18638521432876587, |
| "learning_rate": 0.00019104048414889587, |
| "loss": 0.0964, |
| "mean_token_accuracy": 0.9686295390129089, |
| "num_tokens": 378248.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.8354430379746836, |
| "grad_norm": 0.16087719798088074, |
| "learning_rate": 0.00019069806883123387, |
| "loss": 0.0893, |
| "mean_token_accuracy": 0.9704923629760742, |
| "num_tokens": 384141.0, |
| "step": 66 |
| }, |
| { |
| "epoch": 0.8481012658227848, |
| "grad_norm": 0.16863004863262177, |
| "learning_rate": 0.00019034955115388363, |
| "loss": 0.0935, |
| "mean_token_accuracy": 0.9690488576889038, |
| "num_tokens": 389956.0, |
| "step": 67 |
| }, |
| { |
| "epoch": 0.8607594936708861, |
| "grad_norm": 0.2595883905887604, |
| "learning_rate": 0.00018999495456585854, |
| "loss": 0.1035, |
| "mean_token_accuracy": 0.966398298740387, |
| "num_tokens": 395734.0, |
| "step": 68 |
| }, |
| { |
| "epoch": 0.8734177215189873, |
| "grad_norm": 0.15674294531345367, |
| "learning_rate": 0.00018963430292517398, |
| "loss": 0.1001, |
| "mean_token_accuracy": 0.9677476286888123, |
| "num_tokens": 401472.0, |
| "step": 69 |
| }, |
| { |
| "epoch": 0.8860759493670886, |
| "grad_norm": 0.13319358229637146, |
| "learning_rate": 0.00018926762049724228, |
| "loss": 0.0936, |
| "mean_token_accuracy": 0.9681246876716614, |
| "num_tokens": 407183.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.8987341772151899, |
| "grad_norm": 0.16479410231113434, |
| "learning_rate": 0.00018889493195323997, |
| "loss": 0.0891, |
| "mean_token_accuracy": 0.9669564962387085, |
| "num_tokens": 412997.0, |
| "step": 71 |
| }, |
| { |
| "epoch": 0.9113924050632911, |
| "grad_norm": 0.19525185227394104, |
| "learning_rate": 0.00018851626236844786, |
| "loss": 0.0916, |
| "mean_token_accuracy": 0.9695397615432739, |
| "num_tokens": 419036.0, |
| "step": 72 |
| }, |
| { |
| "epoch": 0.9240506329113924, |
| "grad_norm": 0.14232105016708374, |
| "learning_rate": 0.00018813163722056396, |
| "loss": 0.0949, |
| "mean_token_accuracy": 0.9683631658554077, |
| "num_tokens": 424916.0, |
| "step": 73 |
| }, |
| { |
| "epoch": 0.9367088607594937, |
| "grad_norm": 0.14310362935066223, |
| "learning_rate": 0.0001877410823879893, |
| "loss": 0.0878, |
| "mean_token_accuracy": 0.9713746905326843, |
| "num_tokens": 430814.0, |
| "step": 74 |
| }, |
| { |
| "epoch": 0.9493670886075949, |
| "grad_norm": 0.1776161938905716, |
| "learning_rate": 0.0001873446241480868, |
| "loss": 0.0933, |
| "mean_token_accuracy": 0.9697895646095276, |
| "num_tokens": 436770.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.9620253164556962, |
| "grad_norm": 0.16261084377765656, |
| "learning_rate": 0.00018694228917541313, |
| "loss": 0.0933, |
| "mean_token_accuracy": 0.9694162607192993, |
| "num_tokens": 442556.0, |
| "step": 76 |
| }, |
| { |
| "epoch": 0.9746835443037974, |
| "grad_norm": 0.17474666237831116, |
| "learning_rate": 0.00018653410453992413, |
| "loss": 0.091, |
| "mean_token_accuracy": 0.9704390168190002, |
| "num_tokens": 448337.0, |
| "step": 77 |
| }, |
| { |
| "epoch": 0.9873417721518988, |
| "grad_norm": 0.16762994229793549, |
| "learning_rate": 0.0001861200977051535, |
| "loss": 0.0885, |
| "mean_token_accuracy": 0.9703090190887451, |
| "num_tokens": 454194.0, |
| "step": 78 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 0.15185800194740295, |
| "learning_rate": 0.0001857002965263648, |
| "loss": 0.0868, |
| "mean_token_accuracy": 0.9698991179466248, |
| "num_tokens": 460105.0, |
| "step": 79 |
| }, |
| { |
| "epoch": 1.0126582278481013, |
| "grad_norm": 0.1631181240081787, |
| "learning_rate": 0.00018527472924867756, |
| "loss": 0.0881, |
| "mean_token_accuracy": 0.969143271446228, |
| "num_tokens": 465970.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 1.0253164556962024, |
| "grad_norm": 0.138313889503479, |
| "learning_rate": 0.00018484342450516671, |
| "loss": 0.087, |
| "mean_token_accuracy": 0.9698519110679626, |
| "num_tokens": 471706.0, |
| "step": 81 |
| }, |
| { |
| "epoch": 1.0379746835443038, |
| "grad_norm": 0.2044484168291092, |
| "learning_rate": 0.0001844064113149361, |
| "loss": 0.0882, |
| "mean_token_accuracy": 0.9679310321807861, |
| "num_tokens": 477570.0, |
| "step": 82 |
| }, |
| { |
| "epoch": 1.0506329113924051, |
| "grad_norm": 0.12826398015022278, |
| "learning_rate": 0.0001839637190811661, |
| "loss": 0.0886, |
| "mean_token_accuracy": 0.9679872393608093, |
| "num_tokens": 483288.0, |
| "step": 83 |
| }, |
| { |
| "epoch": 1.0632911392405062, |
| "grad_norm": 0.14064167439937592, |
| "learning_rate": 0.00018351537758913518, |
| "loss": 0.0897, |
| "mean_token_accuracy": 0.9681583642959595, |
| "num_tokens": 489162.0, |
| "step": 84 |
| }, |
| { |
| "epoch": 1.0759493670886076, |
| "grad_norm": 0.12677496671676636, |
| "learning_rate": 0.00018306141700421606, |
| "loss": 0.0887, |
| "mean_token_accuracy": 0.9705982208251953, |
| "num_tokens": 495110.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 1.0886075949367089, |
| "grad_norm": 0.15661370754241943, |
| "learning_rate": 0.000182601867869846, |
| "loss": 0.0854, |
| "mean_token_accuracy": 0.9703992009162903, |
| "num_tokens": 501086.0, |
| "step": 86 |
| }, |
| { |
| "epoch": 1.1012658227848102, |
| "grad_norm": 0.17122779786586761, |
| "learning_rate": 0.00018213676110547176, |
| "loss": 0.0841, |
| "mean_token_accuracy": 0.9700527191162109, |
| "num_tokens": 507027.0, |
| "step": 87 |
| }, |
| { |
| "epoch": 1.1139240506329113, |
| "grad_norm": 0.14393500983715057, |
| "learning_rate": 0.0001816661280044693, |
| "loss": 0.0879, |
| "mean_token_accuracy": 0.9708383679389954, |
| "num_tokens": 512852.0, |
| "step": 88 |
| }, |
| { |
| "epoch": 1.1265822784810127, |
| "grad_norm": 0.13653580844402313, |
| "learning_rate": 0.00018119000023203837, |
| "loss": 0.0836, |
| "mean_token_accuracy": 0.9715254306793213, |
| "num_tokens": 518816.0, |
| "step": 89 |
| }, |
| { |
| "epoch": 1.139240506329114, |
| "grad_norm": 0.119191013276577, |
| "learning_rate": 0.0001807084098230719, |
| "loss": 0.0888, |
| "mean_token_accuracy": 0.969799816608429, |
| "num_tokens": 524774.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 1.1518987341772151, |
| "grad_norm": 0.13606540858745575, |
| "learning_rate": 0.0001802213891800007, |
| "loss": 0.0914, |
| "mean_token_accuracy": 0.9713476896286011, |
| "num_tokens": 530492.0, |
| "step": 91 |
| }, |
| { |
| "epoch": 1.1645569620253164, |
| "grad_norm": 0.1045287474989891, |
| "learning_rate": 0.00017972897107061328, |
| "loss": 0.0892, |
| "mean_token_accuracy": 0.9692742228507996, |
| "num_tokens": 536219.0, |
| "step": 92 |
| }, |
| { |
| "epoch": 1.1772151898734178, |
| "grad_norm": 0.11407322436571121, |
| "learning_rate": 0.00017923118862585123, |
| "loss": 0.0868, |
| "mean_token_accuracy": 0.9704458117485046, |
| "num_tokens": 542272.0, |
| "step": 93 |
| }, |
| { |
| "epoch": 1.189873417721519, |
| "grad_norm": 0.09578792750835419, |
| "learning_rate": 0.00017872807533758007, |
| "loss": 0.0865, |
| "mean_token_accuracy": 0.9701651334762573, |
| "num_tokens": 547967.0, |
| "step": 94 |
| }, |
| { |
| "epoch": 1.2025316455696202, |
| "grad_norm": 0.10400957614183426, |
| "learning_rate": 0.00017821966505633587, |
| "loss": 0.0862, |
| "mean_token_accuracy": 0.9684265851974487, |
| "num_tokens": 553732.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 1.2151898734177216, |
| "grad_norm": 0.1001543328166008, |
| "learning_rate": 0.00017770599198904763, |
| "loss": 0.0879, |
| "mean_token_accuracy": 0.9701571464538574, |
| "num_tokens": 559459.0, |
| "step": 96 |
| }, |
| { |
| "epoch": 1.2278481012658227, |
| "grad_norm": 0.09234999120235443, |
| "learning_rate": 0.00017718709069673594, |
| "loss": 0.0846, |
| "mean_token_accuracy": 0.968562126159668, |
| "num_tokens": 565344.0, |
| "step": 97 |
| }, |
| { |
| "epoch": 1.240506329113924, |
| "grad_norm": 0.13882777094841003, |
| "learning_rate": 0.00017666299609218745, |
| "loss": 0.0891, |
| "mean_token_accuracy": 0.9695484638214111, |
| "num_tokens": 571122.0, |
| "step": 98 |
| }, |
| { |
| "epoch": 1.2531645569620253, |
| "grad_norm": 0.08778692781925201, |
| "learning_rate": 0.00017613374343760594, |
| "loss": 0.0878, |
| "mean_token_accuracy": 0.9698153138160706, |
| "num_tokens": 576818.0, |
| "step": 99 |
| }, |
| { |
| "epoch": 1.2658227848101267, |
| "grad_norm": 0.10923833400011063, |
| "learning_rate": 0.00017559936834223982, |
| "loss": 0.0879, |
| "mean_token_accuracy": 0.9689220190048218, |
| "num_tokens": 582513.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 1.2784810126582278, |
| "grad_norm": 0.10132668167352676, |
| "learning_rate": 0.0001750599067599863, |
| "loss": 0.0863, |
| "mean_token_accuracy": 0.9684970378875732, |
| "num_tokens": 588259.0, |
| "step": 101 |
| }, |
| { |
| "epoch": 1.2911392405063291, |
| "grad_norm": 0.08531607687473297, |
| "learning_rate": 0.00017451539498697225, |
| "loss": 0.0836, |
| "mean_token_accuracy": 0.967986524105072, |
| "num_tokens": 594258.0, |
| "step": 102 |
| }, |
| { |
| "epoch": 1.3037974683544304, |
| "grad_norm": 0.09016811102628708, |
| "learning_rate": 0.0001739658696591121, |
| "loss": 0.0876, |
| "mean_token_accuracy": 0.966867983341217, |
| "num_tokens": 600117.0, |
| "step": 103 |
| }, |
| { |
| "epoch": 1.3164556962025316, |
| "grad_norm": 0.08775028586387634, |
| "learning_rate": 0.00017341136774964307, |
| "loss": 0.0867, |
| "mean_token_accuracy": 0.9703442454338074, |
| "num_tokens": 605846.0, |
| "step": 104 |
| }, |
| { |
| "epoch": 1.3291139240506329, |
| "grad_norm": 0.11099086701869965, |
| "learning_rate": 0.0001728519265666373, |
| "loss": 0.0895, |
| "mean_token_accuracy": 0.970858633518219, |
| "num_tokens": 611675.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 1.3417721518987342, |
| "grad_norm": 0.10359926521778107, |
| "learning_rate": 0.00017228758375049185, |
| "loss": 0.09, |
| "mean_token_accuracy": 0.9666965007781982, |
| "num_tokens": 617324.0, |
| "step": 106 |
| }, |
| { |
| "epoch": 1.3544303797468356, |
| "grad_norm": 0.0925629511475563, |
| "learning_rate": 0.00017171837727139613, |
| "loss": 0.0826, |
| "mean_token_accuracy": 0.9694368243217468, |
| "num_tokens": 623212.0, |
| "step": 107 |
| }, |
| { |
| "epoch": 1.3670886075949367, |
| "grad_norm": 0.09996061027050018, |
| "learning_rate": 0.0001711443454267772, |
| "loss": 0.0867, |
| "mean_token_accuracy": 0.9683344960212708, |
| "num_tokens": 628992.0, |
| "step": 108 |
| }, |
| { |
| "epoch": 1.379746835443038, |
| "grad_norm": 0.09014004468917847, |
| "learning_rate": 0.00017056552683872292, |
| "loss": 0.0831, |
| "mean_token_accuracy": 0.9679315090179443, |
| "num_tokens": 635012.0, |
| "step": 109 |
| }, |
| { |
| "epoch": 1.3924050632911391, |
| "grad_norm": 0.09641507267951965, |
| "learning_rate": 0.00016998196045138353, |
| "loss": 0.0833, |
| "mean_token_accuracy": 0.9693028330802917, |
| "num_tokens": 640842.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 1.4050632911392404, |
| "grad_norm": 0.10992120206356049, |
| "learning_rate": 0.00016939368552835137, |
| "loss": 0.0821, |
| "mean_token_accuracy": 0.9706032276153564, |
| "num_tokens": 646791.0, |
| "step": 111 |
| }, |
| { |
| "epoch": 1.4177215189873418, |
| "grad_norm": 0.08793023973703384, |
| "learning_rate": 0.00016880074165001905, |
| "loss": 0.0842, |
| "mean_token_accuracy": 0.9703037738800049, |
| "num_tokens": 652748.0, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.4303797468354431, |
| "grad_norm": 0.08371416479349136, |
| "learning_rate": 0.0001682031687109165, |
| "loss": 0.0839, |
| "mean_token_accuracy": 0.9678037166595459, |
| "num_tokens": 658558.0, |
| "step": 113 |
| }, |
| { |
| "epoch": 1.4430379746835442, |
| "grad_norm": 0.0789172500371933, |
| "learning_rate": 0.00016760100691702674, |
| "loss": 0.0809, |
| "mean_token_accuracy": 0.970935046672821, |
| "num_tokens": 664643.0, |
| "step": 114 |
| }, |
| { |
| "epoch": 1.4556962025316456, |
| "grad_norm": 0.08477390557527542, |
| "learning_rate": 0.0001669942967830807, |
| "loss": 0.0826, |
| "mean_token_accuracy": 0.9699388742446899, |
| "num_tokens": 670595.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 1.4683544303797469, |
| "grad_norm": 0.08667643368244171, |
| "learning_rate": 0.00016638307912983136, |
| "loss": 0.0838, |
| "mean_token_accuracy": 0.9711210131645203, |
| "num_tokens": 676511.0, |
| "step": 116 |
| }, |
| { |
| "epoch": 1.481012658227848, |
| "grad_norm": 0.08859161287546158, |
| "learning_rate": 0.00016576739508130726, |
| "loss": 0.0889, |
| "mean_token_accuracy": 0.9705829620361328, |
| "num_tokens": 682150.0, |
| "step": 117 |
| }, |
| { |
| "epoch": 1.4936708860759493, |
| "grad_norm": 0.08228243142366409, |
| "learning_rate": 0.0001651472860620455, |
| "loss": 0.0835, |
| "mean_token_accuracy": 0.9720097184181213, |
| "num_tokens": 687966.0, |
| "step": 118 |
| }, |
| { |
| "epoch": 1.5063291139240507, |
| "grad_norm": 0.07806692272424698, |
| "learning_rate": 0.00016452279379430463, |
| "loss": 0.0834, |
| "mean_token_accuracy": 0.9707849621772766, |
| "num_tokens": 693712.0, |
| "step": 119 |
| }, |
| { |
| "epoch": 1.518987341772152, |
| "grad_norm": 0.09221310168504715, |
| "learning_rate": 0.00016389396029525762, |
| "loss": 0.0885, |
| "mean_token_accuracy": 0.9690666794776917, |
| "num_tokens": 699401.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 1.5316455696202531, |
| "grad_norm": 0.08803010731935501, |
| "learning_rate": 0.0001632608278741646, |
| "loss": 0.0839, |
| "mean_token_accuracy": 0.9693771600723267, |
| "num_tokens": 705245.0, |
| "step": 121 |
| }, |
| { |
| "epoch": 1.5443037974683544, |
| "grad_norm": 0.08484382927417755, |
| "learning_rate": 0.00016262343912952656, |
| "loss": 0.0848, |
| "mean_token_accuracy": 0.9663436412811279, |
| "num_tokens": 710984.0, |
| "step": 122 |
| }, |
| { |
| "epoch": 1.5569620253164556, |
| "grad_norm": 0.06981898099184036, |
| "learning_rate": 0.0001619818369462188, |
| "loss": 0.0834, |
| "mean_token_accuracy": 0.9713114500045776, |
| "num_tokens": 716660.0, |
| "step": 123 |
| }, |
| { |
| "epoch": 1.5696202531645569, |
| "grad_norm": 0.08020604401826859, |
| "learning_rate": 0.0001613360644926059, |
| "loss": 0.0847, |
| "mean_token_accuracy": 0.968184232711792, |
| "num_tokens": 722413.0, |
| "step": 124 |
| }, |
| { |
| "epoch": 1.5822784810126582, |
| "grad_norm": 0.09930495172739029, |
| "learning_rate": 0.00016068616521763707, |
| "loss": 0.0836, |
| "mean_token_accuracy": 0.9696969985961914, |
| "num_tokens": 728285.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 1.5949367088607596, |
| "grad_norm": 0.08344559371471405, |
| "learning_rate": 0.00016003218284792298, |
| "loss": 0.086, |
| "mean_token_accuracy": 0.967332124710083, |
| "num_tokens": 733859.0, |
| "step": 126 |
| }, |
| { |
| "epoch": 1.6075949367088609, |
| "grad_norm": 0.07405643910169601, |
| "learning_rate": 0.00015937416138479344, |
| "loss": 0.0838, |
| "mean_token_accuracy": 0.9711013436317444, |
| "num_tokens": 739598.0, |
| "step": 127 |
| }, |
| { |
| "epoch": 1.620253164556962, |
| "grad_norm": 0.0813552737236023, |
| "learning_rate": 0.0001587121451013373, |
| "loss": 0.0844, |
| "mean_token_accuracy": 0.9705159664154053, |
| "num_tokens": 745360.0, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.6329113924050633, |
| "grad_norm": 0.07733441889286041, |
| "learning_rate": 0.0001580461785394233, |
| "loss": 0.0826, |
| "mean_token_accuracy": 0.9701492786407471, |
| "num_tokens": 751253.0, |
| "step": 129 |
| }, |
| { |
| "epoch": 1.6455696202531644, |
| "grad_norm": 0.0735301524400711, |
| "learning_rate": 0.00015737630650670335, |
| "loss": 0.0844, |
| "mean_token_accuracy": 0.9684435725212097, |
| "num_tokens": 756926.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 1.6582278481012658, |
| "grad_norm": 0.08164644241333008, |
| "learning_rate": 0.00015670257407359792, |
| "loss": 0.0868, |
| "mean_token_accuracy": 0.9707592129707336, |
| "num_tokens": 762667.0, |
| "step": 131 |
| }, |
| { |
| "epoch": 1.6708860759493671, |
| "grad_norm": 0.07316756993532181, |
| "learning_rate": 0.00015602502657026328, |
| "loss": 0.0863, |
| "mean_token_accuracy": 0.9686090350151062, |
| "num_tokens": 768274.0, |
| "step": 132 |
| }, |
| { |
| "epoch": 1.6835443037974684, |
| "grad_norm": 0.06914970278739929, |
| "learning_rate": 0.00015534370958354186, |
| "loss": 0.0806, |
| "mean_token_accuracy": 0.9706634879112244, |
| "num_tokens": 774201.0, |
| "step": 133 |
| }, |
| { |
| "epoch": 1.6962025316455698, |
| "grad_norm": 0.07306254655122757, |
| "learning_rate": 0.00015465866895389495, |
| "loss": 0.0803, |
| "mean_token_accuracy": 0.9705682396888733, |
| "num_tokens": 780143.0, |
| "step": 134 |
| }, |
| { |
| "epoch": 1.7088607594936709, |
| "grad_norm": 0.07241412997245789, |
| "learning_rate": 0.00015396995077231854, |
| "loss": 0.0822, |
| "mean_token_accuracy": 0.9694019556045532, |
| "num_tokens": 785959.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 1.721518987341772, |
| "grad_norm": 0.08982262760400772, |
| "learning_rate": 0.00015327760137724212, |
| "loss": 0.0816, |
| "mean_token_accuracy": 0.9704459309577942, |
| "num_tokens": 791809.0, |
| "step": 136 |
| }, |
| { |
| "epoch": 1.7341772151898733, |
| "grad_norm": 0.0707545205950737, |
| "learning_rate": 0.00015258166735141092, |
| "loss": 0.0805, |
| "mean_token_accuracy": 0.9702767133712769, |
| "num_tokens": 797727.0, |
| "step": 137 |
| }, |
| { |
| "epoch": 1.7468354430379747, |
| "grad_norm": 0.06939110159873962, |
| "learning_rate": 0.0001518821955187519, |
| "loss": 0.0821, |
| "mean_token_accuracy": 0.9708311557769775, |
| "num_tokens": 803482.0, |
| "step": 138 |
| }, |
| { |
| "epoch": 1.759493670886076, |
| "grad_norm": 0.06984034180641174, |
| "learning_rate": 0.00015117923294122312, |
| "loss": 0.0814, |
| "mean_token_accuracy": 0.9717060327529907, |
| "num_tokens": 809519.0, |
| "step": 139 |
| }, |
| { |
| "epoch": 1.7721518987341773, |
| "grad_norm": 0.071834996342659, |
| "learning_rate": 0.0001504728269156475, |
| "loss": 0.0837, |
| "mean_token_accuracy": 0.9692060947418213, |
| "num_tokens": 815201.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.7848101265822784, |
| "grad_norm": 0.06867428123950958, |
| "learning_rate": 0.00014976302497053036, |
| "loss": 0.0818, |
| "mean_token_accuracy": 0.969128429889679, |
| "num_tokens": 821128.0, |
| "step": 141 |
| }, |
| { |
| "epoch": 1.7974683544303798, |
| "grad_norm": 0.07886156439781189, |
| "learning_rate": 0.00014904987486286184, |
| "loss": 0.0846, |
| "mean_token_accuracy": 0.9705423712730408, |
| "num_tokens": 826963.0, |
| "step": 142 |
| }, |
| { |
| "epoch": 1.810126582278481, |
| "grad_norm": 0.07062580436468124, |
| "learning_rate": 0.00014833342457490361, |
| "loss": 0.0802, |
| "mean_token_accuracy": 0.9710095524787903, |
| "num_tokens": 832891.0, |
| "step": 143 |
| }, |
| { |
| "epoch": 1.8227848101265822, |
| "grad_norm": 0.0702303871512413, |
| "learning_rate": 0.00014761372231096047, |
| "loss": 0.0807, |
| "mean_token_accuracy": 0.9701517820358276, |
| "num_tokens": 838818.0, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.8354430379746836, |
| "grad_norm": 0.07356806099414825, |
| "learning_rate": 0.00014689081649413708, |
| "loss": 0.0815, |
| "mean_token_accuracy": 0.9718139171600342, |
| "num_tokens": 844665.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 1.8481012658227849, |
| "grad_norm": 0.07695885747671127, |
| "learning_rate": 0.00014616475576308005, |
| "loss": 0.0824, |
| "mean_token_accuracy": 0.9687390327453613, |
| "num_tokens": 850423.0, |
| "step": 146 |
| }, |
| { |
| "epoch": 1.8607594936708862, |
| "grad_norm": 0.07924854755401611, |
| "learning_rate": 0.00014543558896870531, |
| "loss": 0.084, |
| "mean_token_accuracy": 0.9691846966743469, |
| "num_tokens": 856166.0, |
| "step": 147 |
| }, |
| { |
| "epoch": 1.8734177215189873, |
| "grad_norm": 0.06506441533565521, |
| "learning_rate": 0.0001447033651709114, |
| "loss": 0.0812, |
| "mean_token_accuracy": 0.9717061519622803, |
| "num_tokens": 862097.0, |
| "step": 148 |
| }, |
| { |
| "epoch": 1.8860759493670884, |
| "grad_norm": 0.08221415430307388, |
| "learning_rate": 0.0001439681336352785, |
| "loss": 0.0847, |
| "mean_token_accuracy": 0.96860671043396, |
| "num_tokens": 867831.0, |
| "step": 149 |
| }, |
| { |
| "epoch": 1.8987341772151898, |
| "grad_norm": 0.06203217804431915, |
| "learning_rate": 0.00014322994382975386, |
| "loss": 0.081, |
| "mean_token_accuracy": 0.9704849123954773, |
| "num_tokens": 873587.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 1.9113924050632911, |
| "grad_norm": 0.0693584606051445, |
| "learning_rate": 0.0001424888454213235, |
| "loss": 0.0835, |
| "mean_token_accuracy": 0.9718832969665527, |
| "num_tokens": 879306.0, |
| "step": 151 |
| }, |
| { |
| "epoch": 1.9240506329113924, |
| "grad_norm": 0.07542399317026138, |
| "learning_rate": 0.0001417448882726703, |
| "loss": 0.0869, |
| "mean_token_accuracy": 0.9694873094558716, |
| "num_tokens": 885007.0, |
| "step": 152 |
| }, |
| { |
| "epoch": 1.9367088607594938, |
| "grad_norm": 0.06910575181245804, |
| "learning_rate": 0.00014099812243881948, |
| "loss": 0.0798, |
| "mean_token_accuracy": 0.9715608358383179, |
| "num_tokens": 891119.0, |
| "step": 153 |
| }, |
| { |
| "epoch": 1.9493670886075949, |
| "grad_norm": 0.07143940776586533, |
| "learning_rate": 0.00014024859816377046, |
| "loss": 0.0832, |
| "mean_token_accuracy": 0.9683129787445068, |
| "num_tokens": 896832.0, |
| "step": 154 |
| }, |
| { |
| "epoch": 1.9620253164556962, |
| "grad_norm": 0.06761741638183594, |
| "learning_rate": 0.00013949636587711644, |
| "loss": 0.084, |
| "mean_token_accuracy": 0.9718760848045349, |
| "num_tokens": 902514.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 1.9746835443037973, |
| "grad_norm": 0.07367364317178726, |
| "learning_rate": 0.0001387414761906516, |
| "loss": 0.0789, |
| "mean_token_accuracy": 0.9691286087036133, |
| "num_tokens": 908603.0, |
| "step": 156 |
| }, |
| { |
| "epoch": 1.9873417721518987, |
| "grad_norm": 0.06280063837766647, |
| "learning_rate": 0.00013798397989496549, |
| "loss": 0.0818, |
| "mean_token_accuracy": 0.9685900807380676, |
| "num_tokens": 914334.0, |
| "step": 157 |
| }, |
| { |
| "epoch": 2.0, |
| "grad_norm": 0.06626482307910919, |
| "learning_rate": 0.00013722392795602594, |
| "loss": 0.0812, |
| "mean_token_accuracy": 0.970950722694397, |
| "num_tokens": 920078.0, |
| "step": 158 |
| }, |
| { |
| "epoch": 2.0126582278481013, |
| "grad_norm": 0.0648651048541069, |
| "learning_rate": 0.0001364613715117499, |
| "loss": 0.0817, |
| "mean_token_accuracy": 0.9702180624008179, |
| "num_tokens": 925783.0, |
| "step": 159 |
| }, |
| { |
| "epoch": 2.0253164556962027, |
| "grad_norm": 0.06400693207979202, |
| "learning_rate": 0.00013569636186856288, |
| "loss": 0.0806, |
| "mean_token_accuracy": 0.9703844785690308, |
| "num_tokens": 931621.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 2.037974683544304, |
| "grad_norm": 0.06594045460224152, |
| "learning_rate": 0.0001349289504979467, |
| "loss": 0.0816, |
| "mean_token_accuracy": 0.9699637293815613, |
| "num_tokens": 937478.0, |
| "step": 161 |
| }, |
| { |
| "epoch": 2.050632911392405, |
| "grad_norm": 0.07075533270835876, |
| "learning_rate": 0.0001341591890329766, |
| "loss": 0.0826, |
| "mean_token_accuracy": 0.9692522883415222, |
| "num_tokens": 943266.0, |
| "step": 162 |
| }, |
| { |
| "epoch": 2.0632911392405062, |
| "grad_norm": 0.06899682432413101, |
| "learning_rate": 0.00013338712926484725, |
| "loss": 0.0795, |
| "mean_token_accuracy": 0.9705134630203247, |
| "num_tokens": 949231.0, |
| "step": 163 |
| }, |
| { |
| "epoch": 2.0759493670886076, |
| "grad_norm": 0.07616809010505676, |
| "learning_rate": 0.00013261282313938795, |
| "loss": 0.0806, |
| "mean_token_accuracy": 0.9711308479309082, |
| "num_tokens": 955149.0, |
| "step": 164 |
| }, |
| { |
| "epoch": 2.088607594936709, |
| "grad_norm": 0.07235827296972275, |
| "learning_rate": 0.00013183632275356777, |
| "loss": 0.0792, |
| "mean_token_accuracy": 0.9715502262115479, |
| "num_tokens": 961083.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 2.1012658227848102, |
| "grad_norm": 0.07813423871994019, |
| "learning_rate": 0.00013105768035199034, |
| "loss": 0.0839, |
| "mean_token_accuracy": 0.969510018825531, |
| "num_tokens": 966821.0, |
| "step": 166 |
| }, |
| { |
| "epoch": 2.1139240506329116, |
| "grad_norm": 0.07437107712030411, |
| "learning_rate": 0.0001302769483233786, |
| "loss": 0.0826, |
| "mean_token_accuracy": 0.9698913097381592, |
| "num_tokens": 972498.0, |
| "step": 167 |
| }, |
| { |
| "epoch": 2.1265822784810124, |
| "grad_norm": 0.07271190732717514, |
| "learning_rate": 0.00012949417919705007, |
| "loss": 0.0846, |
| "mean_token_accuracy": 0.9689054489135742, |
| "num_tokens": 978190.0, |
| "step": 168 |
| }, |
| { |
| "epoch": 2.1392405063291138, |
| "grad_norm": 0.07017494738101959, |
| "learning_rate": 0.00012870942563938264, |
| "loss": 0.0812, |
| "mean_token_accuracy": 0.9709565043449402, |
| "num_tokens": 984004.0, |
| "step": 169 |
| }, |
| { |
| "epoch": 2.151898734177215, |
| "grad_norm": 0.07087378203868866, |
| "learning_rate": 0.0001279227404502709, |
| "loss": 0.0804, |
| "mean_token_accuracy": 0.9712267518043518, |
| "num_tokens": 989872.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 2.1645569620253164, |
| "grad_norm": 0.07257304340600967, |
| "learning_rate": 0.00012713417655957376, |
| "loss": 0.081, |
| "mean_token_accuracy": 0.9708016514778137, |
| "num_tokens": 995587.0, |
| "step": 171 |
| }, |
| { |
| "epoch": 2.1772151898734178, |
| "grad_norm": 0.06339263916015625, |
| "learning_rate": 0.00012634378702355313, |
| "loss": 0.0813, |
| "mean_token_accuracy": 0.9715899229049683, |
| "num_tokens": 1001318.0, |
| "step": 172 |
| }, |
| { |
| "epoch": 2.189873417721519, |
| "grad_norm": 0.06601085513830185, |
| "learning_rate": 0.00012555162502130433, |
| "loss": 0.0802, |
| "mean_token_accuracy": 0.970442533493042, |
| "num_tokens": 1007235.0, |
| "step": 173 |
| }, |
| { |
| "epoch": 2.2025316455696204, |
| "grad_norm": 0.06804762035608292, |
| "learning_rate": 0.00012475774385117786, |
| "loss": 0.0809, |
| "mean_token_accuracy": 0.9702970385551453, |
| "num_tokens": 1013056.0, |
| "step": 174 |
| }, |
| { |
| "epoch": 2.2151898734177213, |
| "grad_norm": 0.07080934196710587, |
| "learning_rate": 0.00012396219692719363, |
| "loss": 0.0829, |
| "mean_token_accuracy": 0.9680212140083313, |
| "num_tokens": 1018780.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 2.2278481012658227, |
| "grad_norm": 0.06396940350532532, |
| "learning_rate": 0.000123165037775447, |
| "loss": 0.0817, |
| "mean_token_accuracy": 0.9708994626998901, |
| "num_tokens": 1024514.0, |
| "step": 176 |
| }, |
| { |
| "epoch": 2.240506329113924, |
| "grad_norm": 0.0716780498623848, |
| "learning_rate": 0.00012236632003050736, |
| "loss": 0.0829, |
| "mean_token_accuracy": 0.9703912734985352, |
| "num_tokens": 1030252.0, |
| "step": 177 |
| }, |
| { |
| "epoch": 2.2531645569620253, |
| "grad_norm": 0.07340048253536224, |
| "learning_rate": 0.00012156609743180969, |
| "loss": 0.0832, |
| "mean_token_accuracy": 0.9693446159362793, |
| "num_tokens": 1035992.0, |
| "step": 178 |
| }, |
| { |
| "epoch": 2.2658227848101267, |
| "grad_norm": 0.06560252606868744, |
| "learning_rate": 0.0001207644238200387, |
| "loss": 0.0811, |
| "mean_token_accuracy": 0.9689528346061707, |
| "num_tokens": 1041757.0, |
| "step": 179 |
| }, |
| { |
| "epoch": 2.278481012658228, |
| "grad_norm": 0.0696624368429184, |
| "learning_rate": 0.00011996135313350636, |
| "loss": 0.0815, |
| "mean_token_accuracy": 0.969944417476654, |
| "num_tokens": 1047577.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 2.291139240506329, |
| "grad_norm": 0.06634440273046494, |
| "learning_rate": 0.0001191569394045228, |
| "loss": 0.079, |
| "mean_token_accuracy": 0.9712415933609009, |
| "num_tokens": 1053448.0, |
| "step": 181 |
| }, |
| { |
| "epoch": 2.3037974683544302, |
| "grad_norm": 0.06298618018627167, |
| "learning_rate": 0.00011835123675576092, |
| "loss": 0.0804, |
| "mean_token_accuracy": 0.9704663157463074, |
| "num_tokens": 1059302.0, |
| "step": 182 |
| }, |
| { |
| "epoch": 2.3164556962025316, |
| "grad_norm": 0.06103714182972908, |
| "learning_rate": 0.0001175442993966149, |
| "loss": 0.077, |
| "mean_token_accuracy": 0.9714381694793701, |
| "num_tokens": 1065318.0, |
| "step": 183 |
| }, |
| { |
| "epoch": 2.329113924050633, |
| "grad_norm": 0.08317714929580688, |
| "learning_rate": 0.00011673618161955288, |
| "loss": 0.0828, |
| "mean_token_accuracy": 0.9694072604179382, |
| "num_tokens": 1071135.0, |
| "step": 184 |
| }, |
| { |
| "epoch": 2.3417721518987342, |
| "grad_norm": 0.06834248453378677, |
| "learning_rate": 0.00011592693779646405, |
| "loss": 0.0812, |
| "mean_token_accuracy": 0.9709871411323547, |
| "num_tokens": 1077024.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 2.3544303797468356, |
| "grad_norm": 0.06887873262166977, |
| "learning_rate": 0.00011511662237500032, |
| "loss": 0.0816, |
| "mean_token_accuracy": 0.9696813225746155, |
| "num_tokens": 1082893.0, |
| "step": 186 |
| }, |
| { |
| "epoch": 2.367088607594937, |
| "grad_norm": 0.07658988982439041, |
| "learning_rate": 0.00011430528987491305, |
| "loss": 0.0784, |
| "mean_token_accuracy": 0.9689241647720337, |
| "num_tokens": 1088878.0, |
| "step": 187 |
| }, |
| { |
| "epoch": 2.379746835443038, |
| "grad_norm": 0.07818251848220825, |
| "learning_rate": 0.00011349299488438485, |
| "loss": 0.0832, |
| "mean_token_accuracy": 0.9675313234329224, |
| "num_tokens": 1094763.0, |
| "step": 188 |
| }, |
| { |
| "epoch": 2.392405063291139, |
| "grad_norm": 0.06414368003606796, |
| "learning_rate": 0.00011267979205635675, |
| "loss": 0.0815, |
| "mean_token_accuracy": 0.9699221253395081, |
| "num_tokens": 1100479.0, |
| "step": 189 |
| }, |
| { |
| "epoch": 2.4050632911392404, |
| "grad_norm": 0.08263374865055084, |
| "learning_rate": 0.00011186573610485098, |
| "loss": 0.0836, |
| "mean_token_accuracy": 0.9690180420875549, |
| "num_tokens": 1106256.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 2.4177215189873418, |
| "grad_norm": 0.06332731992006302, |
| "learning_rate": 0.00011105088180128976, |
| "loss": 0.079, |
| "mean_token_accuracy": 0.9711905717849731, |
| "num_tokens": 1112082.0, |
| "step": 191 |
| }, |
| { |
| "epoch": 2.430379746835443, |
| "grad_norm": 0.06817943602800369, |
| "learning_rate": 0.00011023528397081011, |
| "loss": 0.0794, |
| "mean_token_accuracy": 0.9718405604362488, |
| "num_tokens": 1118041.0, |
| "step": 192 |
| }, |
| { |
| "epoch": 2.4430379746835444, |
| "grad_norm": 0.07826139777898788, |
| "learning_rate": 0.0001094189974885752, |
| "loss": 0.0819, |
| "mean_token_accuracy": 0.9710296392440796, |
| "num_tokens": 1123835.0, |
| "step": 193 |
| }, |
| { |
| "epoch": 2.4556962025316453, |
| "grad_norm": 0.09749728441238403, |
| "learning_rate": 0.00010860207727608214, |
| "loss": 0.0824, |
| "mean_token_accuracy": 0.9701254963874817, |
| "num_tokens": 1129556.0, |
| "step": 194 |
| }, |
| { |
| "epoch": 2.4683544303797467, |
| "grad_norm": 0.08234766125679016, |
| "learning_rate": 0.00010778457829746666, |
| "loss": 0.0825, |
| "mean_token_accuracy": 0.9703004956245422, |
| "num_tokens": 1135344.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 2.481012658227848, |
| "grad_norm": 0.0916622132062912, |
| "learning_rate": 0.00010696655555580524, |
| "loss": 0.0794, |
| "mean_token_accuracy": 0.9722175002098083, |
| "num_tokens": 1141275.0, |
| "step": 196 |
| }, |
| { |
| "epoch": 2.4936708860759493, |
| "grad_norm": 0.07968051731586456, |
| "learning_rate": 0.00010614806408941422, |
| "loss": 0.0824, |
| "mean_token_accuracy": 0.9686840176582336, |
| "num_tokens": 1147023.0, |
| "step": 197 |
| }, |
| { |
| "epoch": 2.5063291139240507, |
| "grad_norm": 0.06887777894735336, |
| "learning_rate": 0.00010532915896814672, |
| "loss": 0.0812, |
| "mean_token_accuracy": 0.9703223705291748, |
| "num_tokens": 1152950.0, |
| "step": 198 |
| }, |
| { |
| "epoch": 2.518987341772152, |
| "grad_norm": 0.0808170810341835, |
| "learning_rate": 0.00010450989528968746, |
| "loss": 0.084, |
| "mean_token_accuracy": 0.9684757590293884, |
| "num_tokens": 1158597.0, |
| "step": 199 |
| }, |
| { |
| "epoch": 2.5316455696202533, |
| "grad_norm": 0.06715542078018188, |
| "learning_rate": 0.00010369032817584561, |
| "loss": 0.0807, |
| "mean_token_accuracy": 0.970038115978241, |
| "num_tokens": 1164435.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 2.5443037974683547, |
| "grad_norm": 0.08024689555168152, |
| "learning_rate": 0.00010287051276884618, |
| "loss": 0.0832, |
| "mean_token_accuracy": 0.9692226648330688, |
| "num_tokens": 1170185.0, |
| "step": 201 |
| }, |
| { |
| "epoch": 2.5569620253164556, |
| "grad_norm": 0.06640373915433884, |
| "learning_rate": 0.00010205050422761988, |
| "loss": 0.0829, |
| "mean_token_accuracy": 0.9687222242355347, |
| "num_tokens": 1175876.0, |
| "step": 202 |
| }, |
| { |
| "epoch": 2.569620253164557, |
| "grad_norm": 0.07751741260290146, |
| "learning_rate": 0.00010123035772409184, |
| "loss": 0.0822, |
| "mean_token_accuracy": 0.96784508228302, |
| "num_tokens": 1181569.0, |
| "step": 203 |
| }, |
| { |
| "epoch": 2.5822784810126582, |
| "grad_norm": 0.06302241235971451, |
| "learning_rate": 0.0001004101284394696, |
| "loss": 0.0796, |
| "mean_token_accuracy": 0.9697484970092773, |
| "num_tokens": 1187517.0, |
| "step": 204 |
| }, |
| { |
| "epoch": 2.5949367088607596, |
| "grad_norm": 0.06423830986022949, |
| "learning_rate": 9.958987156053045e-05, |
| "loss": 0.08, |
| "mean_token_accuracy": 0.9715918898582458, |
| "num_tokens": 1193354.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 2.607594936708861, |
| "grad_norm": 0.07380242645740509, |
| "learning_rate": 9.87696422759082e-05, |
| "loss": 0.0787, |
| "mean_token_accuracy": 0.9722175002098083, |
| "num_tokens": 1199321.0, |
| "step": 206 |
| }, |
| { |
| "epoch": 2.620253164556962, |
| "grad_norm": 0.06480070948600769, |
| "learning_rate": 9.794949577238013e-05, |
| "loss": 0.0794, |
| "mean_token_accuracy": 0.9726945161819458, |
| "num_tokens": 1205208.0, |
| "step": 207 |
| }, |
| { |
| "epoch": 2.632911392405063, |
| "grad_norm": 0.09705960750579834, |
| "learning_rate": 9.712948723115383e-05, |
| "loss": 0.0786, |
| "mean_token_accuracy": 0.9717357158660889, |
| "num_tokens": 1211039.0, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.6455696202531644, |
| "grad_norm": 0.07256985455751419, |
| "learning_rate": 9.630967182415442e-05, |
| "loss": 0.0801, |
| "mean_token_accuracy": 0.9715599417686462, |
| "num_tokens": 1216975.0, |
| "step": 209 |
| }, |
| { |
| "epoch": 2.6582278481012658, |
| "grad_norm": 0.07309860736131668, |
| "learning_rate": 9.549010471031256e-05, |
| "loss": 0.0804, |
| "mean_token_accuracy": 0.9698572158813477, |
| "num_tokens": 1222712.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 2.670886075949367, |
| "grad_norm": 0.08559804409742355, |
| "learning_rate": 9.467084103185329e-05, |
| "loss": 0.0796, |
| "mean_token_accuracy": 0.9707877039909363, |
| "num_tokens": 1228527.0, |
| "step": 211 |
| }, |
| { |
| "epoch": 2.6835443037974684, |
| "grad_norm": 0.0890304371714592, |
| "learning_rate": 9.385193591058579e-05, |
| "loss": 0.0789, |
| "mean_token_accuracy": 0.9719783663749695, |
| "num_tokens": 1234515.0, |
| "step": 212 |
| }, |
| { |
| "epoch": 2.6962025316455698, |
| "grad_norm": 0.07330089062452316, |
| "learning_rate": 9.303344444419476e-05, |
| "loss": 0.0781, |
| "mean_token_accuracy": 0.972399890422821, |
| "num_tokens": 1240521.0, |
| "step": 213 |
| }, |
| { |
| "epoch": 2.708860759493671, |
| "grad_norm": 0.06156392768025398, |
| "learning_rate": 9.221542170253339e-05, |
| "loss": 0.0819, |
| "mean_token_accuracy": 0.9704664349555969, |
| "num_tokens": 1246138.0, |
| "step": 214 |
| }, |
| { |
| "epoch": 2.721518987341772, |
| "grad_norm": 0.07013130933046341, |
| "learning_rate": 9.139792272391791e-05, |
| "loss": 0.0812, |
| "mean_token_accuracy": 0.9703513383865356, |
| "num_tokens": 1252037.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 2.7341772151898733, |
| "grad_norm": 0.07664390653371811, |
| "learning_rate": 9.058100251142483e-05, |
| "loss": 0.0817, |
| "mean_token_accuracy": 0.970625102519989, |
| "num_tokens": 1257684.0, |
| "step": 216 |
| }, |
| { |
| "epoch": 2.7468354430379747, |
| "grad_norm": 0.11009793728590012, |
| "learning_rate": 8.976471602918991e-05, |
| "loss": 0.0812, |
| "mean_token_accuracy": 0.9696917533874512, |
| "num_tokens": 1263588.0, |
| "step": 217 |
| }, |
| { |
| "epoch": 2.759493670886076, |
| "grad_norm": 0.06719589978456497, |
| "learning_rate": 8.894911819871026e-05, |
| "loss": 0.0795, |
| "mean_token_accuracy": 0.9698387980461121, |
| "num_tokens": 1269421.0, |
| "step": 218 |
| }, |
| { |
| "epoch": 2.7721518987341773, |
| "grad_norm": 0.12703068554401398, |
| "learning_rate": 8.813426389514903e-05, |
| "loss": 0.0818, |
| "mean_token_accuracy": 0.9672332406044006, |
| "num_tokens": 1275192.0, |
| "step": 219 |
| }, |
| { |
| "epoch": 2.7848101265822782, |
| "grad_norm": 0.16315780580043793, |
| "learning_rate": 8.732020794364326e-05, |
| "loss": 0.0811, |
| "mean_token_accuracy": 0.9697076082229614, |
| "num_tokens": 1280967.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 2.7974683544303796, |
| "grad_norm": 0.20341816544532776, |
| "learning_rate": 8.650700511561514e-05, |
| "loss": 0.0793, |
| "mean_token_accuracy": 0.9723266363143921, |
| "num_tokens": 1286885.0, |
| "step": 221 |
| }, |
| { |
| "epoch": 2.810126582278481, |
| "grad_norm": 0.11723124235868454, |
| "learning_rate": 8.5694710125087e-05, |
| "loss": 0.0786, |
| "mean_token_accuracy": 0.9704720973968506, |
| "num_tokens": 1292774.0, |
| "step": 222 |
| }, |
| { |
| "epoch": 2.8227848101265822, |
| "grad_norm": 0.1419627070426941, |
| "learning_rate": 8.488337762499972e-05, |
| "loss": 0.0805, |
| "mean_token_accuracy": 0.9703508615493774, |
| "num_tokens": 1298538.0, |
| "step": 223 |
| }, |
| { |
| "epoch": 2.8354430379746836, |
| "grad_norm": 0.11497867107391357, |
| "learning_rate": 8.407306220353596e-05, |
| "loss": 0.0815, |
| "mean_token_accuracy": 0.9683766961097717, |
| "num_tokens": 1304294.0, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.848101265822785, |
| "grad_norm": 0.1476864069700241, |
| "learning_rate": 8.326381838044713e-05, |
| "loss": 0.0779, |
| "mean_token_accuracy": 0.9735862016677856, |
| "num_tokens": 1310264.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 2.8607594936708862, |
| "grad_norm": 0.16264992952346802, |
| "learning_rate": 8.245570060338512e-05, |
| "loss": 0.0804, |
| "mean_token_accuracy": 0.9690141081809998, |
| "num_tokens": 1316008.0, |
| "step": 226 |
| }, |
| { |
| "epoch": 2.8734177215189876, |
| "grad_norm": 0.08981442451477051, |
| "learning_rate": 8.164876324423909e-05, |
| "loss": 0.0777, |
| "mean_token_accuracy": 0.9729821681976318, |
| "num_tokens": 1321957.0, |
| "step": 227 |
| }, |
| { |
| "epoch": 2.8860759493670884, |
| "grad_norm": 0.12265730649232864, |
| "learning_rate": 8.084306059547722e-05, |
| "loss": 0.0781, |
| "mean_token_accuracy": 0.970678985118866, |
| "num_tokens": 1327853.0, |
| "step": 228 |
| }, |
| { |
| "epoch": 2.8987341772151898, |
| "grad_norm": 0.08478284627199173, |
| "learning_rate": 8.003864686649366e-05, |
| "loss": 0.0817, |
| "mean_token_accuracy": 0.9698615670204163, |
| "num_tokens": 1333624.0, |
| "step": 229 |
| }, |
| { |
| "epoch": 2.911392405063291, |
| "grad_norm": 0.08693704754114151, |
| "learning_rate": 7.923557617996131e-05, |
| "loss": 0.082, |
| "mean_token_accuracy": 0.9714744091033936, |
| "num_tokens": 1339297.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 2.9240506329113924, |
| "grad_norm": 0.0729907900094986, |
| "learning_rate": 7.843390256819034e-05, |
| "loss": 0.0762, |
| "mean_token_accuracy": 0.9713568091392517, |
| "num_tokens": 1345331.0, |
| "step": 231 |
| }, |
| { |
| "epoch": 2.9367088607594938, |
| "grad_norm": 0.07349084317684174, |
| "learning_rate": 7.763367996949267e-05, |
| "loss": 0.0807, |
| "mean_token_accuracy": 0.9700000286102295, |
| "num_tokens": 1351095.0, |
| "step": 232 |
| }, |
| { |
| "epoch": 2.9493670886075947, |
| "grad_norm": 0.07819319516420364, |
| "learning_rate": 7.683496222455304e-05, |
| "loss": 0.0802, |
| "mean_token_accuracy": 0.9721308350563049, |
| "num_tokens": 1356936.0, |
| "step": 233 |
| }, |
| { |
| "epoch": 2.962025316455696, |
| "grad_norm": 0.07689930498600006, |
| "learning_rate": 7.603780307280639e-05, |
| "loss": 0.0825, |
| "mean_token_accuracy": 0.9697132706642151, |
| "num_tokens": 1362580.0, |
| "step": 234 |
| }, |
| { |
| "epoch": 2.9746835443037973, |
| "grad_norm": 0.09075320512056351, |
| "learning_rate": 7.524225614882216e-05, |
| "loss": 0.0798, |
| "mean_token_accuracy": 0.9697710871696472, |
| "num_tokens": 1368367.0, |
| "step": 235 |
| }, |
| { |
| "epoch": 2.9873417721518987, |
| "grad_norm": 0.09070567041635513, |
| "learning_rate": 7.44483749786957e-05, |
| "loss": 0.0786, |
| "mean_token_accuracy": 0.971564769744873, |
| "num_tokens": 1374304.0, |
| "step": 236 |
| }, |
| { |
| "epoch": 3.0, |
| "grad_norm": 0.06513367593288422, |
| "learning_rate": 7.365621297644686e-05, |
| "loss": 0.0797, |
| "mean_token_accuracy": 0.9717634320259094, |
| "num_tokens": 1379999.0, |
| "step": 237 |
| }, |
| { |
| "epoch": 3.0126582278481013, |
| "grad_norm": 0.1306091845035553, |
| "learning_rate": 7.286582344042625e-05, |
| "loss": 0.0801, |
| "mean_token_accuracy": 0.9709312915802002, |
| "num_tokens": 1385636.0, |
| "step": 238 |
| }, |
| { |
| "epoch": 3.0253164556962027, |
| "grad_norm": 0.07664618641138077, |
| "learning_rate": 7.207725954972913e-05, |
| "loss": 0.0815, |
| "mean_token_accuracy": 0.9686498045921326, |
| "num_tokens": 1391314.0, |
| "step": 239 |
| }, |
| { |
| "epoch": 3.037974683544304, |
| "grad_norm": 0.0977763831615448, |
| "learning_rate": 7.129057436061739e-05, |
| "loss": 0.0779, |
| "mean_token_accuracy": 0.9701290130615234, |
| "num_tokens": 1397270.0, |
| "step": 240 |
| }, |
| { |
| "epoch": 3.050632911392405, |
| "grad_norm": 0.06652140617370605, |
| "learning_rate": 7.050582080294996e-05, |
| "loss": 0.0759, |
| "mean_token_accuracy": 0.9703101515769958, |
| "num_tokens": 1403363.0, |
| "step": 241 |
| }, |
| { |
| "epoch": 3.0632911392405062, |
| "grad_norm": 0.06535639613866806, |
| "learning_rate": 6.972305167662145e-05, |
| "loss": 0.0761, |
| "mean_token_accuracy": 0.9717714786529541, |
| "num_tokens": 1409343.0, |
| "step": 242 |
| }, |
| { |
| "epoch": 3.0759493670886076, |
| "grad_norm": 0.14863204956054688, |
| "learning_rate": 6.89423196480097e-05, |
| "loss": 0.0764, |
| "mean_token_accuracy": 0.9727972745895386, |
| "num_tokens": 1415252.0, |
| "step": 243 |
| }, |
| { |
| "epoch": 3.088607594936709, |
| "grad_norm": 0.12706619501113892, |
| "learning_rate": 6.816367724643224e-05, |
| "loss": 0.0809, |
| "mean_token_accuracy": 0.9703253507614136, |
| "num_tokens": 1420910.0, |
| "step": 244 |
| }, |
| { |
| "epoch": 3.1012658227848102, |
| "grad_norm": 0.11461978405714035, |
| "learning_rate": 6.738717686061206e-05, |
| "loss": 0.0775, |
| "mean_token_accuracy": 0.9719387888908386, |
| "num_tokens": 1426854.0, |
| "step": 245 |
| }, |
| { |
| "epoch": 3.1139240506329116, |
| "grad_norm": 0.07422919571399689, |
| "learning_rate": 6.661287073515275e-05, |
| "loss": 0.0802, |
| "mean_token_accuracy": 0.9705517292022705, |
| "num_tokens": 1432555.0, |
| "step": 246 |
| }, |
| { |
| "epoch": 3.1265822784810124, |
| "grad_norm": 0.1299969106912613, |
| "learning_rate": 6.58408109670234e-05, |
| "loss": 0.0802, |
| "mean_token_accuracy": 0.970957338809967, |
| "num_tokens": 1438197.0, |
| "step": 247 |
| }, |
| { |
| "epoch": 3.1392405063291138, |
| "grad_norm": 0.06016664579510689, |
| "learning_rate": 6.507104950205336e-05, |
| "loss": 0.0808, |
| "mean_token_accuracy": 0.9692197442054749, |
| "num_tokens": 1443849.0, |
| "step": 248 |
| }, |
| { |
| "epoch": 3.151898734177215, |
| "grad_norm": 0.07276305556297302, |
| "learning_rate": 6.430363813143716e-05, |
| "loss": 0.0779, |
| "mean_token_accuracy": 0.9725557565689087, |
| "num_tokens": 1449743.0, |
| "step": 249 |
| }, |
| { |
| "epoch": 3.1645569620253164, |
| "grad_norm": 0.14158909022808075, |
| "learning_rate": 6.35386284882501e-05, |
| "loss": 0.0812, |
| "mean_token_accuracy": 0.9695501923561096, |
| "num_tokens": 1455587.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 3.1772151898734178, |
| "grad_norm": 0.07185238599777222, |
| "learning_rate": 6.277607204397408e-05, |
| "loss": 0.08, |
| "mean_token_accuracy": 0.9723237752914429, |
| "num_tokens": 1461396.0, |
| "step": 251 |
| }, |
| { |
| "epoch": 3.189873417721519, |
| "grad_norm": 0.11205340176820755, |
| "learning_rate": 6.201602010503454e-05, |
| "loss": 0.0799, |
| "mean_token_accuracy": 0.9720181822776794, |
| "num_tokens": 1467178.0, |
| "step": 252 |
| }, |
| { |
| "epoch": 3.2025316455696204, |
| "grad_norm": 0.16124460101127625, |
| "learning_rate": 6.125852380934841e-05, |
| "loss": 0.078, |
| "mean_token_accuracy": 0.9711191058158875, |
| "num_tokens": 1473059.0, |
| "step": 253 |
| }, |
| { |
| "epoch": 3.2151898734177213, |
| "grad_norm": 0.08562294393777847, |
| "learning_rate": 6.0503634122883556e-05, |
| "loss": 0.079, |
| "mean_token_accuracy": 0.9705219268798828, |
| "num_tokens": 1478890.0, |
| "step": 254 |
| }, |
| { |
| "epoch": 3.2278481012658227, |
| "grad_norm": 0.11821357160806656, |
| "learning_rate": 5.975140183622958e-05, |
| "loss": 0.0777, |
| "mean_token_accuracy": 0.9715889692306519, |
| "num_tokens": 1484832.0, |
| "step": 255 |
| }, |
| { |
| "epoch": 3.240506329113924, |
| "grad_norm": 0.1310524344444275, |
| "learning_rate": 5.900187756118055e-05, |
| "loss": 0.0791, |
| "mean_token_accuracy": 0.9707400798797607, |
| "num_tokens": 1490706.0, |
| "step": 256 |
| }, |
| { |
| "epoch": 3.2531645569620253, |
| "grad_norm": 0.09574417024850845, |
| "learning_rate": 5.8255111727329717e-05, |
| "loss": 0.0796, |
| "mean_token_accuracy": 0.969775915145874, |
| "num_tokens": 1496527.0, |
| "step": 257 |
| }, |
| { |
| "epoch": 3.2658227848101267, |
| "grad_norm": 0.13490068912506104, |
| "learning_rate": 5.751115457867653e-05, |
| "loss": 0.0803, |
| "mean_token_accuracy": 0.9699646830558777, |
| "num_tokens": 1502251.0, |
| "step": 258 |
| }, |
| { |
| "epoch": 3.278481012658228, |
| "grad_norm": 0.06857483088970184, |
| "learning_rate": 5.6770056170246175e-05, |
| "loss": 0.0779, |
| "mean_token_accuracy": 0.9711849689483643, |
| "num_tokens": 1508180.0, |
| "step": 259 |
| }, |
| { |
| "epoch": 3.291139240506329, |
| "grad_norm": 0.14988020062446594, |
| "learning_rate": 5.6031866364721554e-05, |
| "loss": 0.0776, |
| "mean_token_accuracy": 0.9725578427314758, |
| "num_tokens": 1514038.0, |
| "step": 260 |
| }, |
| { |
| "epoch": 3.3037974683544302, |
| "grad_norm": 1.6094964742660522, |
| "learning_rate": 5.529663482908864e-05, |
| "loss": 0.0811, |
| "mean_token_accuracy": 0.9708961844444275, |
| "num_tokens": 1519737.0, |
| "step": 261 |
| }, |
| { |
| "epoch": 3.3164556962025316, |
| "grad_norm": 0.12591439485549927, |
| "learning_rate": 5.4564411031294695e-05, |
| "loss": 0.078, |
| "mean_token_accuracy": 0.9724565148353577, |
| "num_tokens": 1525610.0, |
| "step": 262 |
| }, |
| { |
| "epoch": 3.329113924050633, |
| "grad_norm": 0.07375043630599976, |
| "learning_rate": 5.383524423691994e-05, |
| "loss": 0.0793, |
| "mean_token_accuracy": 0.9706550240516663, |
| "num_tokens": 1531399.0, |
| "step": 263 |
| }, |
| { |
| "epoch": 3.3417721518987342, |
| "grad_norm": 0.07204035669565201, |
| "learning_rate": 5.310918350586291e-05, |
| "loss": 0.0767, |
| "mean_token_accuracy": 0.9731408357620239, |
| "num_tokens": 1537420.0, |
| "step": 264 |
| }, |
| { |
| "epoch": 3.3544303797468356, |
| "grad_norm": 0.06837223470211029, |
| "learning_rate": 5.2386277689039565e-05, |
| "loss": 0.0813, |
| "mean_token_accuracy": 0.9714285731315613, |
| "num_tokens": 1543084.0, |
| "step": 265 |
| }, |
| { |
| "epoch": 3.367088607594937, |
| "grad_norm": 0.09739254415035248, |
| "learning_rate": 5.1666575425096396e-05, |
| "loss": 0.0767, |
| "mean_token_accuracy": 0.9723784923553467, |
| "num_tokens": 1549013.0, |
| "step": 266 |
| }, |
| { |
| "epoch": 3.379746835443038, |
| "grad_norm": 0.06620758026838303, |
| "learning_rate": 5.095012513713815e-05, |
| "loss": 0.0814, |
| "mean_token_accuracy": 0.9697670340538025, |
| "num_tokens": 1554700.0, |
| "step": 267 |
| }, |
| { |
| "epoch": 3.392405063291139, |
| "grad_norm": 3.2062768936157227, |
| "learning_rate": 5.023697502946969e-05, |
| "loss": 0.0874, |
| "mean_token_accuracy": 0.9678978323936462, |
| "num_tokens": 1560558.0, |
| "step": 268 |
| }, |
| { |
| "epoch": 3.4050632911392404, |
| "grad_norm": 0.07550380378961563, |
| "learning_rate": 4.9527173084352544e-05, |
| "loss": 0.0805, |
| "mean_token_accuracy": 0.9684154391288757, |
| "num_tokens": 1566226.0, |
| "step": 269 |
| }, |
| { |
| "epoch": 3.4177215189873418, |
| "grad_norm": 2.6636927127838135, |
| "learning_rate": 4.882076705877689e-05, |
| "loss": 0.0854, |
| "mean_token_accuracy": 0.9687827229499817, |
| "num_tokens": 1572024.0, |
| "step": 270 |
| }, |
| { |
| "epoch": 3.430379746835443, |
| "grad_norm": 0.11234506964683533, |
| "learning_rate": 4.811780448124812e-05, |
| "loss": 0.0809, |
| "mean_token_accuracy": 0.970019519329071, |
| "num_tokens": 1577725.0, |
| "step": 271 |
| }, |
| { |
| "epoch": 3.4430379746835444, |
| "grad_norm": 0.24648332595825195, |
| "learning_rate": 4.741833264858909e-05, |
| "loss": 0.0873, |
| "mean_token_accuracy": 0.9710736870765686, |
| "num_tokens": 1583666.0, |
| "step": 272 |
| }, |
| { |
| "epoch": 3.4556962025316453, |
| "grad_norm": 0.13464736938476562, |
| "learning_rate": 4.6722398622757935e-05, |
| "loss": 0.0807, |
| "mean_token_accuracy": 0.9684116840362549, |
| "num_tokens": 1589365.0, |
| "step": 273 |
| }, |
| { |
| "epoch": 3.4683544303797467, |
| "grad_norm": 0.15187641978263855, |
| "learning_rate": 4.603004922768148e-05, |
| "loss": 0.0844, |
| "mean_token_accuracy": 0.9703108668327332, |
| "num_tokens": 1595155.0, |
| "step": 274 |
| }, |
| { |
| "epoch": 3.481012658227848, |
| "grad_norm": 0.11025819182395935, |
| "learning_rate": 4.5341331046105064e-05, |
| "loss": 0.0794, |
| "mean_token_accuracy": 0.970588207244873, |
| "num_tokens": 1600999.0, |
| "step": 275 |
| }, |
| { |
| "epoch": 3.4936708860759493, |
| "grad_norm": 0.16418573260307312, |
| "learning_rate": 4.465629041645819e-05, |
| "loss": 0.0817, |
| "mean_token_accuracy": 0.9688612222671509, |
| "num_tokens": 1606683.0, |
| "step": 276 |
| }, |
| { |
| "epoch": 3.5063291139240507, |
| "grad_norm": 0.20723280310630798, |
| "learning_rate": 4.397497342973676e-05, |
| "loss": 0.0835, |
| "mean_token_accuracy": 0.9696651101112366, |
| "num_tokens": 1612450.0, |
| "step": 277 |
| }, |
| { |
| "epoch": 3.518987341772152, |
| "grad_norm": 0.10691708326339722, |
| "learning_rate": 4.3297425926402115e-05, |
| "loss": 0.079, |
| "mean_token_accuracy": 0.970613956451416, |
| "num_tokens": 1618231.0, |
| "step": 278 |
| }, |
| { |
| "epoch": 3.5316455696202533, |
| "grad_norm": 0.08413207530975342, |
| "learning_rate": 4.2623693493296644e-05, |
| "loss": 0.0853, |
| "mean_token_accuracy": 0.9680407047271729, |
| "num_tokens": 1623802.0, |
| "step": 279 |
| }, |
| { |
| "epoch": 3.5443037974683547, |
| "grad_norm": 0.0731053277850151, |
| "learning_rate": 4.1953821460576715e-05, |
| "loss": 0.0757, |
| "mean_token_accuracy": 0.9723010063171387, |
| "num_tokens": 1629859.0, |
| "step": 280 |
| }, |
| { |
| "epoch": 3.5569620253164556, |
| "grad_norm": 0.12216750532388687, |
| "learning_rate": 4.1287854898662705e-05, |
| "loss": 0.0815, |
| "mean_token_accuracy": 0.9699074029922485, |
| "num_tokens": 1635539.0, |
| "step": 281 |
| }, |
| { |
| "epoch": 3.569620253164557, |
| "grad_norm": 0.14565329253673553, |
| "learning_rate": 4.0625838615206566e-05, |
| "loss": 0.0814, |
| "mean_token_accuracy": 0.9697181582450867, |
| "num_tokens": 1641316.0, |
| "step": 282 |
| }, |
| { |
| "epoch": 3.5822784810126582, |
| "grad_norm": 0.10866527259349823, |
| "learning_rate": 3.996781715207706e-05, |
| "loss": 0.0813, |
| "mean_token_accuracy": 0.9699694514274597, |
| "num_tokens": 1646941.0, |
| "step": 283 |
| }, |
| { |
| "epoch": 3.5949367088607596, |
| "grad_norm": 0.07269653677940369, |
| "learning_rate": 3.9313834782362926e-05, |
| "loss": 0.0781, |
| "mean_token_accuracy": 0.9698261022567749, |
| "num_tokens": 1652871.0, |
| "step": 284 |
| }, |
| { |
| "epoch": 3.607594936708861, |
| "grad_norm": 0.08844961225986481, |
| "learning_rate": 3.866393550739416e-05, |
| "loss": 0.0779, |
| "mean_token_accuracy": 0.9734051823616028, |
| "num_tokens": 1658688.0, |
| "step": 285 |
| }, |
| { |
| "epoch": 3.620253164556962, |
| "grad_norm": 0.23879852890968323, |
| "learning_rate": 3.801816305378124e-05, |
| "loss": 0.0799, |
| "mean_token_accuracy": 0.9712653756141663, |
| "num_tokens": 1664529.0, |
| "step": 286 |
| }, |
| { |
| "epoch": 3.632911392405063, |
| "grad_norm": 0.07687602192163467, |
| "learning_rate": 3.737656087047347e-05, |
| "loss": 0.0796, |
| "mean_token_accuracy": 0.9710347056388855, |
| "num_tokens": 1670324.0, |
| "step": 287 |
| }, |
| { |
| "epoch": 3.6455696202531644, |
| "grad_norm": 0.06936953216791153, |
| "learning_rate": 3.673917212583538e-05, |
| "loss": 0.0756, |
| "mean_token_accuracy": 0.972872793674469, |
| "num_tokens": 1676323.0, |
| "step": 288 |
| }, |
| { |
| "epoch": 3.6582278481012658, |
| "grad_norm": 0.06485825031995773, |
| "learning_rate": 3.610603970474239e-05, |
| "loss": 0.0779, |
| "mean_token_accuracy": 0.9692094922065735, |
| "num_tokens": 1682168.0, |
| "step": 289 |
| }, |
| { |
| "epoch": 3.670886075949367, |
| "grad_norm": 0.05847015231847763, |
| "learning_rate": 3.547720620569539e-05, |
| "loss": 0.0788, |
| "mean_token_accuracy": 0.9695237874984741, |
| "num_tokens": 1688007.0, |
| "step": 290 |
| }, |
| { |
| "epoch": 3.6835443037974684, |
| "grad_norm": 0.07112373411655426, |
| "learning_rate": 3.485271393795453e-05, |
| "loss": 0.0767, |
| "mean_token_accuracy": 0.9705587029457092, |
| "num_tokens": 1694049.0, |
| "step": 291 |
| }, |
| { |
| "epoch": 3.6962025316455698, |
| "grad_norm": 0.07661055028438568, |
| "learning_rate": 3.4232604918692754e-05, |
| "loss": 0.0791, |
| "mean_token_accuracy": 0.9712532758712769, |
| "num_tokens": 1699818.0, |
| "step": 292 |
| }, |
| { |
| "epoch": 3.708860759493671, |
| "grad_norm": 0.08328502625226974, |
| "learning_rate": 3.361692087016863e-05, |
| "loss": 0.0804, |
| "mean_token_accuracy": 0.9705464839935303, |
| "num_tokens": 1705518.0, |
| "step": 293 |
| }, |
| { |
| "epoch": 3.721518987341772, |
| "grad_norm": 0.07525166124105453, |
| "learning_rate": 3.300570321691934e-05, |
| "loss": 0.0782, |
| "mean_token_accuracy": 0.9703742265701294, |
| "num_tokens": 1711354.0, |
| "step": 294 |
| }, |
| { |
| "epoch": 3.7341772151898733, |
| "grad_norm": 0.05936251953244209, |
| "learning_rate": 3.2398993082973294e-05, |
| "loss": 0.0792, |
| "mean_token_accuracy": 0.9714688062667847, |
| "num_tokens": 1717096.0, |
| "step": 295 |
| }, |
| { |
| "epoch": 3.7468354430379747, |
| "grad_norm": 0.9336976408958435, |
| "learning_rate": 3.179683128908352e-05, |
| "loss": 0.0852, |
| "mean_token_accuracy": 0.9706405401229858, |
| "num_tokens": 1722780.0, |
| "step": 296 |
| }, |
| { |
| "epoch": 3.759493670886076, |
| "grad_norm": 0.06697431206703186, |
| "learning_rate": 3.1199258349980966e-05, |
| "loss": 0.0777, |
| "mean_token_accuracy": 0.9715363383293152, |
| "num_tokens": 1728676.0, |
| "step": 297 |
| }, |
| { |
| "epoch": 3.7721518987341773, |
| "grad_norm": 0.06829504668712616, |
| "learning_rate": 3.0606314471648643e-05, |
| "loss": 0.0804, |
| "mean_token_accuracy": 0.9701782464981079, |
| "num_tokens": 1734407.0, |
| "step": 298 |
| }, |
| { |
| "epoch": 3.7848101265822782, |
| "grad_norm": 0.07030507922172546, |
| "learning_rate": 3.0018039548616494e-05, |
| "loss": 0.0749, |
| "mean_token_accuracy": 0.9729909896850586, |
| "num_tokens": 1740469.0, |
| "step": 299 |
| }, |
| { |
| "epoch": 3.7974683544303796, |
| "grad_norm": 0.07017358392477036, |
| "learning_rate": 2.943447316127712e-05, |
| "loss": 0.081, |
| "mean_token_accuracy": 0.968805730342865, |
| "num_tokens": 1746143.0, |
| "step": 300 |
| }, |
| { |
| "epoch": 3.810126582278481, |
| "grad_norm": 0.06848268955945969, |
| "learning_rate": 2.8855654573222825e-05, |
| "loss": 0.0784, |
| "mean_token_accuracy": 0.9709241986274719, |
| "num_tokens": 1751985.0, |
| "step": 301 |
| }, |
| { |
| "epoch": 3.8227848101265822, |
| "grad_norm": 0.06129057705402374, |
| "learning_rate": 2.8281622728603864e-05, |
| "loss": 0.0778, |
| "mean_token_accuracy": 0.9718717932701111, |
| "num_tokens": 1757915.0, |
| "step": 302 |
| }, |
| { |
| "epoch": 3.8354430379746836, |
| "grad_norm": 0.059805795550346375, |
| "learning_rate": 2.7712416249508177e-05, |
| "loss": 0.0779, |
| "mean_token_accuracy": 0.9707764387130737, |
| "num_tokens": 1763762.0, |
| "step": 303 |
| }, |
| { |
| "epoch": 3.848101265822785, |
| "grad_norm": 0.06053877994418144, |
| "learning_rate": 2.714807343336273e-05, |
| "loss": 0.0791, |
| "mean_token_accuracy": 0.9692063927650452, |
| "num_tokens": 1769509.0, |
| "step": 304 |
| }, |
| { |
| "epoch": 3.8607594936708862, |
| "grad_norm": 0.059059906750917435, |
| "learning_rate": 2.6588632250356948e-05, |
| "loss": 0.0774, |
| "mean_token_accuracy": 0.9722741842269897, |
| "num_tokens": 1775452.0, |
| "step": 305 |
| }, |
| { |
| "epoch": 3.8734177215189876, |
| "grad_norm": 0.05404770001769066, |
| "learning_rate": 2.6034130340887895e-05, |
| "loss": 0.0801, |
| "mean_token_accuracy": 0.9705519080162048, |
| "num_tokens": 1781187.0, |
| "step": 306 |
| }, |
| { |
| "epoch": 3.8860759493670884, |
| "grad_norm": 0.06307448446750641, |
| "learning_rate": 2.5484605013027784e-05, |
| "loss": 0.0771, |
| "mean_token_accuracy": 0.9702105522155762, |
| "num_tokens": 1787092.0, |
| "step": 307 |
| }, |
| { |
| "epoch": 3.8987341772151898, |
| "grad_norm": 0.056615523993968964, |
| "learning_rate": 2.4940093240013717e-05, |
| "loss": 0.0768, |
| "mean_token_accuracy": 0.9707582592964172, |
| "num_tokens": 1793038.0, |
| "step": 308 |
| }, |
| { |
| "epoch": 3.911392405063291, |
| "grad_norm": 0.06251045316457748, |
| "learning_rate": 2.4400631657760186e-05, |
| "loss": 0.0777, |
| "mean_token_accuracy": 0.9698939323425293, |
| "num_tokens": 1798948.0, |
| "step": 309 |
| }, |
| { |
| "epoch": 3.9240506329113924, |
| "grad_norm": 0.06428255885839462, |
| "learning_rate": 2.3866256562394083e-05, |
| "loss": 0.0769, |
| "mean_token_accuracy": 0.9723984003067017, |
| "num_tokens": 1804845.0, |
| "step": 310 |
| }, |
| { |
| "epoch": 3.9367088607594938, |
| "grad_norm": 0.06822579354047775, |
| "learning_rate": 2.333700390781256e-05, |
| "loss": 0.0776, |
| "mean_token_accuracy": 0.9734973311424255, |
| "num_tokens": 1810682.0, |
| "step": 311 |
| }, |
| { |
| "epoch": 3.9493670886075947, |
| "grad_norm": 0.07946109026670456, |
| "learning_rate": 2.2812909303264085e-05, |
| "loss": 0.0774, |
| "mean_token_accuracy": 0.9704923629760742, |
| "num_tokens": 1816575.0, |
| "step": 312 |
| }, |
| { |
| "epoch": 3.962025316455696, |
| "grad_norm": 0.05697230249643326, |
| "learning_rate": 2.2294008010952382e-05, |
| "loss": 0.0788, |
| "mean_token_accuracy": 0.9713143110275269, |
| "num_tokens": 1822391.0, |
| "step": 313 |
| }, |
| { |
| "epoch": 3.9746835443037973, |
| "grad_norm": 0.05985480546951294, |
| "learning_rate": 2.1780334943664162e-05, |
| "loss": 0.0778, |
| "mean_token_accuracy": 0.9696394801139832, |
| "num_tokens": 1828252.0, |
| "step": 314 |
| }, |
| { |
| "epoch": 3.9873417721518987, |
| "grad_norm": 0.07457312196493149, |
| "learning_rate": 2.127192466241994e-05, |
| "loss": 0.0771, |
| "mean_token_accuracy": 0.9737654328346252, |
| "num_tokens": 1834148.0, |
| "step": 315 |
| }, |
| { |
| "epoch": 4.0, |
| "grad_norm": 0.07451052963733673, |
| "learning_rate": 2.07688113741488e-05, |
| "loss": 0.0807, |
| "mean_token_accuracy": 0.970366358757019, |
| "num_tokens": 1839780.0, |
| "step": 316 |
| }, |
| { |
| "epoch": 4.012658227848101, |
| "grad_norm": 0.06042718142271042, |
| "learning_rate": 2.0271028929386738e-05, |
| "loss": 0.0751, |
| "mean_token_accuracy": 0.9707651138305664, |
| "num_tokens": 1845830.0, |
| "step": 317 |
| }, |
| { |
| "epoch": 4.025316455696203, |
| "grad_norm": 0.05794535577297211, |
| "learning_rate": 1.977861081999931e-05, |
| "loss": 0.079, |
| "mean_token_accuracy": 0.9711419939994812, |
| "num_tokens": 1851577.0, |
| "step": 318 |
| }, |
| { |
| "epoch": 4.037974683544304, |
| "grad_norm": 0.057247843593358994, |
| "learning_rate": 1.92915901769281e-05, |
| "loss": 0.0796, |
| "mean_token_accuracy": 0.9693425297737122, |
| "num_tokens": 1857284.0, |
| "step": 319 |
| }, |
| { |
| "epoch": 4.050632911392405, |
| "grad_norm": 0.06188493221998215, |
| "learning_rate": 1.880999976796164e-05, |
| "loss": 0.0757, |
| "mean_token_accuracy": 0.9716632962226868, |
| "num_tokens": 1863312.0, |
| "step": 320 |
| }, |
| { |
| "epoch": 4.063291139240507, |
| "grad_norm": 0.05771747604012489, |
| "learning_rate": 1.8333871995530726e-05, |
| "loss": 0.0785, |
| "mean_token_accuracy": 0.9692708253860474, |
| "num_tokens": 1869136.0, |
| "step": 321 |
| }, |
| { |
| "epoch": 4.075949367088608, |
| "grad_norm": 0.05652361363172531, |
| "learning_rate": 1.786323889452828e-05, |
| "loss": 0.0773, |
| "mean_token_accuracy": 0.9709202647209167, |
| "num_tokens": 1875046.0, |
| "step": 322 |
| }, |
| { |
| "epoch": 4.0886075949367084, |
| "grad_norm": 0.05673353746533394, |
| "learning_rate": 1.739813213015401e-05, |
| "loss": 0.0793, |
| "mean_token_accuracy": 0.9699859023094177, |
| "num_tokens": 1880774.0, |
| "step": 323 |
| }, |
| { |
| "epoch": 4.10126582278481, |
| "grad_norm": 0.06132633239030838, |
| "learning_rate": 1.693858299578396e-05, |
| "loss": 0.0763, |
| "mean_token_accuracy": 0.9706130623817444, |
| "num_tokens": 1886759.0, |
| "step": 324 |
| }, |
| { |
| "epoch": 4.113924050632911, |
| "grad_norm": 0.056123439222574234, |
| "learning_rate": 1.6484622410864835e-05, |
| "loss": 0.0779, |
| "mean_token_accuracy": 0.9699808955192566, |
| "num_tokens": 1892586.0, |
| "step": 325 |
| }, |
| { |
| "epoch": 4.1265822784810124, |
| "grad_norm": 0.06860559433698654, |
| "learning_rate": 1.6036280918833924e-05, |
| "loss": 0.0762, |
| "mean_token_accuracy": 0.9718095660209656, |
| "num_tokens": 1898574.0, |
| "step": 326 |
| }, |
| { |
| "epoch": 4.139240506329114, |
| "grad_norm": 0.057196494191884995, |
| "learning_rate": 1.5593588685063896e-05, |
| "loss": 0.0755, |
| "mean_token_accuracy": 0.9706724882125854, |
| "num_tokens": 1904571.0, |
| "step": 327 |
| }, |
| { |
| "epoch": 4.151898734177215, |
| "grad_norm": 0.05489705130457878, |
| "learning_rate": 1.515657549483328e-05, |
| "loss": 0.0769, |
| "mean_token_accuracy": 0.9721410274505615, |
| "num_tokens": 1910450.0, |
| "step": 328 |
| }, |
| { |
| "epoch": 4.1645569620253164, |
| "grad_norm": 0.062416039407253265, |
| "learning_rate": 1.4725270751322452e-05, |
| "loss": 0.0789, |
| "mean_token_accuracy": 0.9689679145812988, |
| "num_tokens": 1916250.0, |
| "step": 329 |
| }, |
| { |
| "epoch": 4.177215189873418, |
| "grad_norm": 0.05836787447333336, |
| "learning_rate": 1.4299703473635218e-05, |
| "loss": 0.0759, |
| "mean_token_accuracy": 0.9725050926208496, |
| "num_tokens": 1922206.0, |
| "step": 330 |
| }, |
| { |
| "epoch": 4.189873417721519, |
| "grad_norm": 0.06579294800758362, |
| "learning_rate": 1.3879902294846536e-05, |
| "loss": 0.0774, |
| "mean_token_accuracy": 0.9693894982337952, |
| "num_tokens": 1928085.0, |
| "step": 331 |
| }, |
| { |
| "epoch": 4.2025316455696204, |
| "grad_norm": 0.06163820996880531, |
| "learning_rate": 1.3465895460075873e-05, |
| "loss": 0.0814, |
| "mean_token_accuracy": 0.9713560342788696, |
| "num_tokens": 1933665.0, |
| "step": 332 |
| }, |
| { |
| "epoch": 4.215189873417722, |
| "grad_norm": 0.06440580636262894, |
| "learning_rate": 1.3057710824586899e-05, |
| "loss": 0.0794, |
| "mean_token_accuracy": 0.9684858918190002, |
| "num_tokens": 1939409.0, |
| "step": 333 |
| }, |
| { |
| "epoch": 4.227848101265823, |
| "grad_norm": 0.06846589595079422, |
| "learning_rate": 1.2655375851913232e-05, |
| "loss": 0.0779, |
| "mean_token_accuracy": 0.9719237685203552, |
| "num_tokens": 1945243.0, |
| "step": 334 |
| }, |
| { |
| "epoch": 4.2405063291139244, |
| "grad_norm": 0.06552578508853912, |
| "learning_rate": 1.22589176120107e-05, |
| "loss": 0.0768, |
| "mean_token_accuracy": 0.9721074104309082, |
| "num_tokens": 1951115.0, |
| "step": 335 |
| }, |
| { |
| "epoch": 4.253164556962025, |
| "grad_norm": 0.059337787330150604, |
| "learning_rate": 1.186836277943606e-05, |
| "loss": 0.0776, |
| "mean_token_accuracy": 0.9703677892684937, |
| "num_tokens": 1956916.0, |
| "step": 336 |
| }, |
| { |
| "epoch": 4.265822784810126, |
| "grad_norm": 0.07464569061994553, |
| "learning_rate": 1.1483737631552161e-05, |
| "loss": 0.0797, |
| "mean_token_accuracy": 0.9708686470985413, |
| "num_tokens": 1962644.0, |
| "step": 337 |
| }, |
| { |
| "epoch": 4.2784810126582276, |
| "grad_norm": 0.06734161078929901, |
| "learning_rate": 1.1105068046760048e-05, |
| "loss": 0.0776, |
| "mean_token_accuracy": 0.9691272974014282, |
| "num_tokens": 1968506.0, |
| "step": 338 |
| }, |
| { |
| "epoch": 4.291139240506329, |
| "grad_norm": 0.06930230557918549, |
| "learning_rate": 1.0732379502757717e-05, |
| "loss": 0.0789, |
| "mean_token_accuracy": 0.969554603099823, |
| "num_tokens": 1974318.0, |
| "step": 339 |
| }, |
| { |
| "epoch": 4.30379746835443, |
| "grad_norm": 0.0679992139339447, |
| "learning_rate": 1.036569707482602e-05, |
| "loss": 0.0753, |
| "mean_token_accuracy": 0.9715152382850647, |
| "num_tokens": 1980315.0, |
| "step": 340 |
| }, |
| { |
| "epoch": 4.3164556962025316, |
| "grad_norm": 0.07055645436048508, |
| "learning_rate": 1.0005045434141502e-05, |
| "loss": 0.0789, |
| "mean_token_accuracy": 0.967298686504364, |
| "num_tokens": 1986128.0, |
| "step": 341 |
| }, |
| { |
| "epoch": 4.329113924050633, |
| "grad_norm": 0.06478093564510345, |
| "learning_rate": 9.6504488461164e-06, |
| "loss": 0.0777, |
| "mean_token_accuracy": 0.9695026874542236, |
| "num_tokens": 1991963.0, |
| "step": 342 |
| }, |
| { |
| "epoch": 4.341772151898734, |
| "grad_norm": 0.05864814668893814, |
| "learning_rate": 9.301931168766164e-06, |
| "loss": 0.0789, |
| "mean_token_accuracy": 0.9722025394439697, |
| "num_tokens": 1997675.0, |
| "step": 343 |
| }, |
| { |
| "epoch": 4.3544303797468356, |
| "grad_norm": 0.057372983545064926, |
| "learning_rate": 8.959515851104117e-06, |
| "loss": 0.0763, |
| "mean_token_accuracy": 0.9710463881492615, |
| "num_tokens": 2003645.0, |
| "step": 344 |
| }, |
| { |
| "epoch": 4.367088607594937, |
| "grad_norm": 0.05886904522776604, |
| "learning_rate": 8.623225931563805e-06, |
| "loss": 0.0765, |
| "mean_token_accuracy": 0.9717639088630676, |
| "num_tokens": 2009588.0, |
| "step": 345 |
| }, |
| { |
| "epoch": 4.379746835443038, |
| "grad_norm": 0.058638498187065125, |
| "learning_rate": 8.293084036448895e-06, |
| "loss": 0.0778, |
| "mean_token_accuracy": 0.9706800580024719, |
| "num_tokens": 2015416.0, |
| "step": 346 |
| }, |
| { |
| "epoch": 4.3924050632911396, |
| "grad_norm": 0.055953070521354675, |
| "learning_rate": 7.96911237841088e-06, |
| "loss": 0.0778, |
| "mean_token_accuracy": 0.9712381362915039, |
| "num_tokens": 2021182.0, |
| "step": 347 |
| }, |
| { |
| "epoch": 4.405063291139241, |
| "grad_norm": 0.05705662816762924, |
| "learning_rate": 7.651332754954477e-06, |
| "loss": 0.0781, |
| "mean_token_accuracy": 0.9709312319755554, |
| "num_tokens": 2026991.0, |
| "step": 348 |
| }, |
| { |
| "epoch": 4.417721518987342, |
| "grad_norm": 0.06720998138189316, |
| "learning_rate": 7.3397665469711495e-06, |
| "loss": 0.0785, |
| "mean_token_accuracy": 0.9710195660591125, |
| "num_tokens": 2032783.0, |
| "step": 349 |
| }, |
| { |
| "epoch": 4.430379746835443, |
| "grad_norm": 0.05840713158249855, |
| "learning_rate": 7.034434717300509e-06, |
| "loss": 0.0749, |
| "mean_token_accuracy": 0.973750650882721, |
| "num_tokens": 2038790.0, |
| "step": 350 |
| }, |
| { |
| "epoch": 4.443037974683544, |
| "grad_norm": 0.06675554811954498, |
| "learning_rate": 6.735357809319809e-06, |
| "loss": 0.0756, |
| "mean_token_accuracy": 0.9730185270309448, |
| "num_tokens": 2044784.0, |
| "step": 351 |
| }, |
| { |
| "epoch": 4.455696202531645, |
| "grad_norm": 0.06554147601127625, |
| "learning_rate": 6.442555945561901e-06, |
| "loss": 0.0792, |
| "mean_token_accuracy": 0.9715539813041687, |
| "num_tokens": 2050543.0, |
| "step": 352 |
| }, |
| { |
| "epoch": 4.468354430379747, |
| "grad_norm": 0.06406175345182419, |
| "learning_rate": 6.156048826361238e-06, |
| "loss": 0.0775, |
| "mean_token_accuracy": 0.9712255001068115, |
| "num_tokens": 2056376.0, |
| "step": 353 |
| }, |
| { |
| "epoch": 4.481012658227848, |
| "grad_norm": 0.05737734213471413, |
| "learning_rate": 5.8758557285284125e-06, |
| "loss": 0.0759, |
| "mean_token_accuracy": 0.9722080826759338, |
| "num_tokens": 2062341.0, |
| "step": 354 |
| }, |
| { |
| "epoch": 4.493670886075949, |
| "grad_norm": 0.058641061186790466, |
| "learning_rate": 5.6019955040531925e-06, |
| "loss": 0.0771, |
| "mean_token_accuracy": 0.9707903861999512, |
| "num_tokens": 2068225.0, |
| "step": 355 |
| }, |
| { |
| "epoch": 4.506329113924051, |
| "grad_norm": 0.06712588667869568, |
| "learning_rate": 5.334486578836118e-06, |
| "loss": 0.0765, |
| "mean_token_accuracy": 0.9706331491470337, |
| "num_tokens": 2074180.0, |
| "step": 356 |
| }, |
| { |
| "epoch": 4.518987341772152, |
| "grad_norm": 0.06461600959300995, |
| "learning_rate": 5.073346951448699e-06, |
| "loss": 0.08, |
| "mean_token_accuracy": 0.9709550738334656, |
| "num_tokens": 2079856.0, |
| "step": 357 |
| }, |
| { |
| "epoch": 4.531645569620253, |
| "grad_norm": 0.07402454316616058, |
| "learning_rate": 4.818594191922576e-06, |
| "loss": 0.0795, |
| "mean_token_accuracy": 0.9725420475006104, |
| "num_tokens": 2085565.0, |
| "step": 358 |
| }, |
| { |
| "epoch": 4.544303797468355, |
| "grad_norm": 0.05966600775718689, |
| "learning_rate": 4.5702454405672e-06, |
| "loss": 0.078, |
| "mean_token_accuracy": 0.9685818552970886, |
| "num_tokens": 2091390.0, |
| "step": 359 |
| }, |
| { |
| "epoch": 4.556962025316456, |
| "grad_norm": 0.06288423389196396, |
| "learning_rate": 4.328317406816751e-06, |
| "loss": 0.0776, |
| "mean_token_accuracy": 0.9723670482635498, |
| "num_tokens": 2097208.0, |
| "step": 360 |
| }, |
| { |
| "epoch": 4.569620253164557, |
| "grad_norm": 0.06594210118055344, |
| "learning_rate": 4.092826368105795e-06, |
| "loss": 0.0808, |
| "mean_token_accuracy": 0.9683079719543457, |
| "num_tokens": 2102857.0, |
| "step": 361 |
| }, |
| { |
| "epoch": 4.582278481012658, |
| "grad_norm": 0.06201909855008125, |
| "learning_rate": 3.863788168774118e-06, |
| "loss": 0.0762, |
| "mean_token_accuracy": 0.9730194211006165, |
| "num_tokens": 2108740.0, |
| "step": 362 |
| }, |
| { |
| "epoch": 4.594936708860759, |
| "grad_norm": 0.07590262591838837, |
| "learning_rate": 3.6412182190007082e-06, |
| "loss": 0.0792, |
| "mean_token_accuracy": 0.9691489338874817, |
| "num_tokens": 2114444.0, |
| "step": 363 |
| }, |
| { |
| "epoch": 4.6075949367088604, |
| "grad_norm": 0.058905087411403656, |
| "learning_rate": 3.425131493766931e-06, |
| "loss": 0.0788, |
| "mean_token_accuracy": 0.9723153114318848, |
| "num_tokens": 2120179.0, |
| "step": 364 |
| }, |
| { |
| "epoch": 4.620253164556962, |
| "grad_norm": 0.06537073850631714, |
| "learning_rate": 3.2155425318489584e-06, |
| "loss": 0.0775, |
| "mean_token_accuracy": 0.9721066951751709, |
| "num_tokens": 2126015.0, |
| "step": 365 |
| }, |
| { |
| "epoch": 4.632911392405063, |
| "grad_norm": 0.074104443192482, |
| "learning_rate": 3.012465434839529e-06, |
| "loss": 0.0785, |
| "mean_token_accuracy": 0.9693859815597534, |
| "num_tokens": 2131828.0, |
| "step": 366 |
| }, |
| { |
| "epoch": 4.6455696202531644, |
| "grad_norm": 0.06384899467229843, |
| "learning_rate": 2.8159138661992824e-06, |
| "loss": 0.0795, |
| "mean_token_accuracy": 0.9716049432754517, |
| "num_tokens": 2137562.0, |
| "step": 367 |
| }, |
| { |
| "epoch": 4.658227848101266, |
| "grad_norm": 0.07530912756919861, |
| "learning_rate": 2.6259010503373206e-06, |
| "loss": 0.0769, |
| "mean_token_accuracy": 0.9712377786636353, |
| "num_tokens": 2143467.0, |
| "step": 368 |
| }, |
| { |
| "epoch": 4.670886075949367, |
| "grad_norm": 0.06394244730472565, |
| "learning_rate": 2.4424397717215387e-06, |
| "loss": 0.078, |
| "mean_token_accuracy": 0.9697181582450867, |
| "num_tokens": 2149244.0, |
| "step": 369 |
| }, |
| { |
| "epoch": 4.6835443037974684, |
| "grad_norm": 0.07698839902877808, |
| "learning_rate": 2.2655423740183924e-06, |
| "loss": 0.0798, |
| "mean_token_accuracy": 0.9722123146057129, |
| "num_tokens": 2154922.0, |
| "step": 370 |
| }, |
| { |
| "epoch": 4.69620253164557, |
| "grad_norm": 0.0612369030714035, |
| "learning_rate": 2.0952207592624505e-06, |
| "loss": 0.0794, |
| "mean_token_accuracy": 0.969454824924469, |
| "num_tokens": 2160617.0, |
| "step": 371 |
| }, |
| { |
| "epoch": 4.708860759493671, |
| "grad_norm": 0.06153201311826706, |
| "learning_rate": 1.9314863870555255e-06, |
| "loss": 0.0791, |
| "mean_token_accuracy": 0.9693984985351562, |
| "num_tokens": 2166367.0, |
| "step": 372 |
| }, |
| { |
| "epoch": 4.7215189873417724, |
| "grad_norm": 0.05991169437766075, |
| "learning_rate": 1.7743502737957106e-06, |
| "loss": 0.0787, |
| "mean_token_accuracy": 0.9701519012451172, |
| "num_tokens": 2172093.0, |
| "step": 373 |
| }, |
| { |
| "epoch": 4.734177215189874, |
| "grad_norm": 0.061358775943517685, |
| "learning_rate": 1.6238229919361858e-06, |
| "loss": 0.079, |
| "mean_token_accuracy": 0.9693090319633484, |
| "num_tokens": 2177859.0, |
| "step": 374 |
| }, |
| { |
| "epoch": 4.746835443037975, |
| "grad_norm": 0.06134023889899254, |
| "learning_rate": 1.4799146692737741e-06, |
| "loss": 0.0767, |
| "mean_token_accuracy": 0.9715369939804077, |
| "num_tokens": 2183720.0, |
| "step": 375 |
| }, |
| { |
| "epoch": 4.759493670886076, |
| "grad_norm": 0.05467069521546364, |
| "learning_rate": 1.3426349882676325e-06, |
| "loss": 0.0787, |
| "mean_token_accuracy": 0.9697826504707336, |
| "num_tokens": 2189443.0, |
| "step": 376 |
| }, |
| { |
| "epoch": 4.772151898734177, |
| "grad_norm": 0.06292378157377243, |
| "learning_rate": 1.211993185387772e-06, |
| "loss": 0.0807, |
| "mean_token_accuracy": 0.9686599373817444, |
| "num_tokens": 2195059.0, |
| "step": 377 |
| }, |
| { |
| "epoch": 4.784810126582278, |
| "grad_norm": 0.05961504578590393, |
| "learning_rate": 1.0879980504935772e-06, |
| "loss": 0.0756, |
| "mean_token_accuracy": 0.9717646837234497, |
| "num_tokens": 2201073.0, |
| "step": 378 |
| }, |
| { |
| "epoch": 4.7974683544303796, |
| "grad_norm": 0.06441368907690048, |
| "learning_rate": 9.706579262424131e-07, |
| "loss": 0.0807, |
| "mean_token_accuracy": 0.969048023223877, |
| "num_tokens": 2206694.0, |
| "step": 379 |
| }, |
| { |
| "epoch": 4.810126582278481, |
| "grad_norm": 0.07030190527439117, |
| "learning_rate": 8.599807075283406e-07, |
| "loss": 0.0768, |
| "mean_token_accuracy": 0.9719101190567017, |
| "num_tokens": 2212632.0, |
| "step": 380 |
| }, |
| { |
| "epoch": 4.822784810126582, |
| "grad_norm": 0.06316056102514267, |
| "learning_rate": 7.559738409508855e-07, |
| "loss": 0.0773, |
| "mean_token_accuracy": 0.9711191058158875, |
| "num_tokens": 2218513.0, |
| "step": 381 |
| }, |
| { |
| "epoch": 4.8354430379746836, |
| "grad_norm": 0.06939555704593658, |
| "learning_rate": 6.586443243140838e-07, |
| "loss": 0.0775, |
| "mean_token_accuracy": 0.9715026021003723, |
| "num_tokens": 2224367.0, |
| "step": 382 |
| }, |
| { |
| "epoch": 4.848101265822785, |
| "grad_norm": 0.06221834197640419, |
| "learning_rate": 5.679987061555703e-07, |
| "loss": 0.0767, |
| "mean_token_accuracy": 0.9719110727310181, |
| "num_tokens": 2230234.0, |
| "step": 383 |
| }, |
| { |
| "epoch": 4.860759493670886, |
| "grad_norm": 0.06537239253520966, |
| "learning_rate": 4.840430853060518e-07, |
| "loss": 0.0749, |
| "mean_token_accuracy": 0.9727303385734558, |
| "num_tokens": 2236202.0, |
| "step": 384 |
| }, |
| { |
| "epoch": 4.8734177215189876, |
| "grad_norm": 0.06031161919236183, |
| "learning_rate": 4.0678311047890327e-07, |
| "loss": 0.0776, |
| "mean_token_accuracy": 0.9701727032661438, |
| "num_tokens": 2241999.0, |
| "step": 385 |
| }, |
| { |
| "epoch": 4.886075949367089, |
| "grad_norm": 0.0632636696100235, |
| "learning_rate": 3.362239798901712e-07, |
| "loss": 0.0793, |
| "mean_token_accuracy": 0.9722172617912292, |
| "num_tokens": 2247678.0, |
| "step": 386 |
| }, |
| { |
| "epoch": 4.89873417721519, |
| "grad_norm": 0.06093168631196022, |
| "learning_rate": 2.723704409087979e-07, |
| "loss": 0.0795, |
| "mean_token_accuracy": 0.9690831303596497, |
| "num_tokens": 2253370.0, |
| "step": 387 |
| }, |
| { |
| "epoch": 4.911392405063291, |
| "grad_norm": 0.0712820366024971, |
| "learning_rate": 2.1522678973718847e-07, |
| "loss": 0.0776, |
| "mean_token_accuracy": 0.9702679514884949, |
| "num_tokens": 2259219.0, |
| "step": 388 |
| }, |
| { |
| "epoch": 4.924050632911392, |
| "grad_norm": 0.06232396140694618, |
| "learning_rate": 1.6479687112217479e-07, |
| "loss": 0.0775, |
| "mean_token_accuracy": 0.9717797636985779, |
| "num_tokens": 2265059.0, |
| "step": 389 |
| }, |
| { |
| "epoch": 4.936708860759493, |
| "grad_norm": 0.07412244379520416, |
| "learning_rate": 1.2108407809635624e-07, |
| "loss": 0.0798, |
| "mean_token_accuracy": 0.9692225456237793, |
| "num_tokens": 2270744.0, |
| "step": 390 |
| }, |
| { |
| "epoch": 4.949367088607595, |
| "grad_norm": 0.06119261309504509, |
| "learning_rate": 8.40913517497377e-08, |
| "loss": 0.0761, |
| "mean_token_accuracy": 0.9705832004547119, |
| "num_tokens": 2276655.0, |
| "step": 391 |
| }, |
| { |
| "epoch": 4.962025316455696, |
| "grad_norm": 0.059338781982660294, |
| "learning_rate": 5.382118103193223e-08, |
| "loss": 0.0773, |
| "mean_token_accuracy": 0.9722415208816528, |
| "num_tokens": 2282483.0, |
| "step": 392 |
| }, |
| { |
| "epoch": 4.974683544303797, |
| "grad_norm": 0.07498956471681595, |
| "learning_rate": 3.027560258465067e-08, |
| "loss": 0.0774, |
| "mean_token_accuracy": 0.9694932699203491, |
| "num_tokens": 2288349.0, |
| "step": 393 |
| }, |
| { |
| "epoch": 4.987341772151899, |
| "grad_norm": 0.06674467027187347, |
| "learning_rate": 1.345620060465569e-08, |
| "loss": 0.0799, |
| "mean_token_accuracy": 0.9709312915802002, |
| "num_tokens": 2293986.0, |
| "step": 394 |
| }, |
| { |
| "epoch": 5.0, |
| "grad_norm": 0.06420715898275375, |
| "learning_rate": 3.3641067372358612e-09, |
| "loss": 0.0742, |
| "mean_token_accuracy": 0.9736490845680237, |
| "num_tokens": 2300046.0, |
| "step": 395 |
| }, |
| { |
| "epoch": 5.0, |
| "step": 395, |
| "total_flos": 1.433986508301271e+17, |
| "train_loss": 0.13250939466908007, |
| "train_runtime": 455.932, |
| "train_samples_per_second": 54.833, |
| "train_steps_per_second": 0.866 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 395, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 5, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.433986508301271e+17, |
| "train_batch_size": 16, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|