{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 30, "global_step": 2346, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0012801024081926554, "grad_norm": 92.7056884765625, "learning_rate": 0.0, "loss": 1.697, "step": 1 }, { "epoch": 0.002560204816385311, "grad_norm": 97.21253204345703, "learning_rate": 1.408450704225352e-08, "loss": 1.752, "step": 2 }, { "epoch": 0.0038403072245779663, "grad_norm": 90.0287857055664, "learning_rate": 2.816901408450704e-08, "loss": 1.655, "step": 3 }, { "epoch": 0.005120409632770622, "grad_norm": 95.35676574707031, "learning_rate": 4.2253521126760564e-08, "loss": 1.716, "step": 4 }, { "epoch": 0.006400512040963277, "grad_norm": 102.2269515991211, "learning_rate": 5.633802816901408e-08, "loss": 1.821, "step": 5 }, { "epoch": 0.007680614449155933, "grad_norm": 99.38582611083984, "learning_rate": 7.042253521126761e-08, "loss": 1.782, "step": 6 }, { "epoch": 0.008960716857348588, "grad_norm": 96.41349029541016, "learning_rate": 8.450704225352113e-08, "loss": 1.745, "step": 7 }, { "epoch": 0.010240819265541243, "grad_norm": 95.18534851074219, "learning_rate": 9.859154929577463e-08, "loss": 1.726, "step": 8 }, { "epoch": 0.011520921673733898, "grad_norm": 95.86149597167969, "learning_rate": 1.1267605633802817e-07, "loss": 1.728, "step": 9 }, { "epoch": 0.012801024081926553, "grad_norm": 95.08584594726562, "learning_rate": 1.2676056338028167e-07, "loss": 1.722, "step": 10 }, { "epoch": 0.01408112649011921, "grad_norm": 98.77447509765625, "learning_rate": 1.4084507042253522e-07, "loss": 1.777, "step": 11 }, { "epoch": 0.015361228898311865, "grad_norm": 96.22913360595703, "learning_rate": 1.549295774647887e-07, "loss": 1.738, "step": 12 }, { "epoch": 0.016641331306504522, "grad_norm": 95.02128601074219, "learning_rate": 1.6901408450704225e-07, "loss": 1.731, "step": 13 }, { "epoch": 0.017921433714697177, "grad_norm": 93.63664245605469, "learning_rate": 1.8309859154929577e-07, "loss": 1.698, "step": 14 }, { "epoch": 0.019201536122889832, "grad_norm": 94.87774658203125, "learning_rate": 1.9718309859154927e-07, "loss": 1.72, "step": 15 }, { "epoch": 0.020481638531082487, "grad_norm": 96.28085327148438, "learning_rate": 2.112676056338028e-07, "loss": 1.739, "step": 16 }, { "epoch": 0.021761740939275142, "grad_norm": 89.48104858398438, "learning_rate": 2.2535211267605633e-07, "loss": 1.656, "step": 17 }, { "epoch": 0.023041843347467797, "grad_norm": 94.04985809326172, "learning_rate": 2.394366197183098e-07, "loss": 1.702, "step": 18 }, { "epoch": 0.024321945755660452, "grad_norm": 99.77753448486328, "learning_rate": 2.5352112676056334e-07, "loss": 1.776, "step": 19 }, { "epoch": 0.025602048163853107, "grad_norm": 94.89751434326172, "learning_rate": 2.6760563380281686e-07, "loss": 1.714, "step": 20 }, { "epoch": 0.026882150572045762, "grad_norm": 97.38967895507812, "learning_rate": 2.8169014084507043e-07, "loss": 1.755, "step": 21 }, { "epoch": 0.02816225298023842, "grad_norm": 96.78072357177734, "learning_rate": 2.957746478873239e-07, "loss": 1.748, "step": 22 }, { "epoch": 0.029442355388431075, "grad_norm": 96.18782806396484, "learning_rate": 3.098591549295774e-07, "loss": 1.73, "step": 23 }, { "epoch": 0.03072245779662373, "grad_norm": 92.47620391845703, "learning_rate": 3.23943661971831e-07, "loss": 1.687, "step": 24 }, { "epoch": 0.032002560204816385, "grad_norm": 90.51629638671875, "learning_rate": 3.380281690140845e-07, "loss": 1.665, "step": 25 }, { "epoch": 0.033282662613009044, "grad_norm": 102.45218658447266, "learning_rate": 3.52112676056338e-07, "loss": 1.807, "step": 26 }, { "epoch": 0.034562765021201695, "grad_norm": 100.599853515625, "learning_rate": 3.6619718309859155e-07, "loss": 1.79, "step": 27 }, { "epoch": 0.035842867429394354, "grad_norm": 99.5367202758789, "learning_rate": 3.8028169014084507e-07, "loss": 1.771, "step": 28 }, { "epoch": 0.037122969837587005, "grad_norm": 94.69949340820312, "learning_rate": 3.9436619718309853e-07, "loss": 1.71, "step": 29 }, { "epoch": 0.038403072245779664, "grad_norm": 96.85765838623047, "learning_rate": 4.084507042253521e-07, "loss": 1.735, "step": 30 }, { "epoch": 0.038403072245779664, "eval_loss": 0.018103886395692825, "eval_runtime": 30.1216, "eval_samples_per_second": 16.467, "eval_steps_per_second": 2.058, "step": 30 }, { "epoch": 0.039683174653972315, "grad_norm": 93.37199401855469, "learning_rate": 4.225352112676056e-07, "loss": 1.685, "step": 31 }, { "epoch": 0.040963277062164974, "grad_norm": 93.5723648071289, "learning_rate": 4.366197183098591e-07, "loss": 1.682, "step": 32 }, { "epoch": 0.042243379470357625, "grad_norm": 91.97074890136719, "learning_rate": 4.5070422535211266e-07, "loss": 1.673, "step": 33 }, { "epoch": 0.043523481878550284, "grad_norm": 94.24687194824219, "learning_rate": 4.647887323943662e-07, "loss": 1.707, "step": 34 }, { "epoch": 0.04480358428674294, "grad_norm": 91.87054443359375, "learning_rate": 4.788732394366196e-07, "loss": 1.651, "step": 35 }, { "epoch": 0.046083686694935594, "grad_norm": 87.93646240234375, "learning_rate": 4.929577464788733e-07, "loss": 1.609, "step": 36 }, { "epoch": 0.04736378910312825, "grad_norm": 93.40409851074219, "learning_rate": 5.070422535211267e-07, "loss": 1.671, "step": 37 }, { "epoch": 0.048643891511320904, "grad_norm": 88.72947692871094, "learning_rate": 5.211267605633802e-07, "loss": 1.604, "step": 38 }, { "epoch": 0.04992399391951356, "grad_norm": 87.67916870117188, "learning_rate": 5.352112676056337e-07, "loss": 1.601, "step": 39 }, { "epoch": 0.051204096327706214, "grad_norm": 89.75273132324219, "learning_rate": 5.492957746478873e-07, "loss": 1.63, "step": 40 }, { "epoch": 0.05248419873589887, "grad_norm": 87.74675750732422, "learning_rate": 5.633802816901409e-07, "loss": 1.594, "step": 41 }, { "epoch": 0.053764301144091524, "grad_norm": 88.40725708007812, "learning_rate": 5.774647887323944e-07, "loss": 1.592, "step": 42 }, { "epoch": 0.05504440355228418, "grad_norm": 89.701171875, "learning_rate": 5.915492957746478e-07, "loss": 1.612, "step": 43 }, { "epoch": 0.05632450596047684, "grad_norm": 88.04122161865234, "learning_rate": 6.056338028169013e-07, "loss": 1.598, "step": 44 }, { "epoch": 0.05760460836866949, "grad_norm": 94.17707061767578, "learning_rate": 6.197183098591548e-07, "loss": 1.676, "step": 45 }, { "epoch": 0.05888471077686215, "grad_norm": 88.97752380371094, "learning_rate": 6.338028169014085e-07, "loss": 1.604, "step": 46 }, { "epoch": 0.0601648131850548, "grad_norm": 91.09588623046875, "learning_rate": 6.47887323943662e-07, "loss": 1.631, "step": 47 }, { "epoch": 0.06144491559324746, "grad_norm": 82.6801986694336, "learning_rate": 6.619718309859155e-07, "loss": 1.515, "step": 48 }, { "epoch": 0.06272501800144012, "grad_norm": 73.98797607421875, "learning_rate": 6.76056338028169e-07, "loss": 1.399, "step": 49 }, { "epoch": 0.06400512040963277, "grad_norm": 72.6869888305664, "learning_rate": 6.901408450704224e-07, "loss": 1.376, "step": 50 }, { "epoch": 0.06528522281782542, "grad_norm": 73.36976623535156, "learning_rate": 7.04225352112676e-07, "loss": 1.39, "step": 51 }, { "epoch": 0.06656532522601809, "grad_norm": 77.68911743164062, "learning_rate": 7.183098591549296e-07, "loss": 1.432, "step": 52 }, { "epoch": 0.06784542763421074, "grad_norm": 73.26194763183594, "learning_rate": 7.323943661971831e-07, "loss": 1.385, "step": 53 }, { "epoch": 0.06912553004240339, "grad_norm": 72.94297790527344, "learning_rate": 7.464788732394366e-07, "loss": 1.383, "step": 54 }, { "epoch": 0.07040563245059604, "grad_norm": 72.09347534179688, "learning_rate": 7.605633802816901e-07, "loss": 1.381, "step": 55 }, { "epoch": 0.07168573485878871, "grad_norm": 70.44213104248047, "learning_rate": 7.746478873239435e-07, "loss": 1.354, "step": 56 }, { "epoch": 0.07296583726698136, "grad_norm": 73.74153900146484, "learning_rate": 7.887323943661971e-07, "loss": 1.399, "step": 57 }, { "epoch": 0.07424593967517401, "grad_norm": 68.37332153320312, "learning_rate": 8.028169014084507e-07, "loss": 1.334, "step": 58 }, { "epoch": 0.07552604208336668, "grad_norm": 63.48308181762695, "learning_rate": 8.169014084507042e-07, "loss": 1.285, "step": 59 }, { "epoch": 0.07680614449155933, "grad_norm": 62.710479736328125, "learning_rate": 8.309859154929577e-07, "loss": 1.28, "step": 60 }, { "epoch": 0.07680614449155933, "eval_loss": 0.018979454413056374, "eval_runtime": 30.4098, "eval_samples_per_second": 16.311, "eval_steps_per_second": 2.039, "step": 60 }, { "epoch": 0.07808624689975198, "grad_norm": 66.81524658203125, "learning_rate": 8.450704225352112e-07, "loss": 1.322, "step": 61 }, { "epoch": 0.07936634930794463, "grad_norm": 67.27582550048828, "learning_rate": 8.591549295774648e-07, "loss": 1.332, "step": 62 }, { "epoch": 0.0806464517161373, "grad_norm": 64.89141845703125, "learning_rate": 8.732394366197182e-07, "loss": 1.314, "step": 63 }, { "epoch": 0.08192655412432995, "grad_norm": 68.0136947631836, "learning_rate": 8.873239436619718e-07, "loss": 1.337, "step": 64 }, { "epoch": 0.0832066565325226, "grad_norm": 60.67420959472656, "learning_rate": 9.014084507042253e-07, "loss": 1.253, "step": 65 }, { "epoch": 0.08448675894071525, "grad_norm": 62.739723205566406, "learning_rate": 9.154929577464788e-07, "loss": 1.279, "step": 66 }, { "epoch": 0.08576686134890792, "grad_norm": 53.43498992919922, "learning_rate": 9.295774647887324e-07, "loss": 1.193, "step": 67 }, { "epoch": 0.08704696375710057, "grad_norm": 8.628366470336914, "learning_rate": 9.436619718309859e-07, "loss": 1.039, "step": 68 }, { "epoch": 0.08832706616529322, "grad_norm": 5.244144916534424, "learning_rate": 9.577464788732393e-07, "loss": 1.04, "step": 69 }, { "epoch": 0.08960716857348588, "grad_norm": 5.3148040771484375, "learning_rate": 9.71830985915493e-07, "loss": 1.031, "step": 70 }, { "epoch": 0.09088727098167854, "grad_norm": 5.043527126312256, "learning_rate": 9.859154929577465e-07, "loss": 1.028, "step": 71 }, { "epoch": 0.09216737338987119, "grad_norm": 5.8993706703186035, "learning_rate": 1e-06, "loss": 1.051, "step": 72 }, { "epoch": 0.09344747579806384, "grad_norm": 6.306154727935791, "learning_rate": 9.999995709386524e-07, "loss": 1.035, "step": 73 }, { "epoch": 0.0947275782062565, "grad_norm": 5.04118013381958, "learning_rate": 9.999982837554276e-07, "loss": 1.021, "step": 74 }, { "epoch": 0.09600768061444916, "grad_norm": 4.97289514541626, "learning_rate": 9.999961384527803e-07, "loss": 1.011, "step": 75 }, { "epoch": 0.09728778302264181, "grad_norm": 5.3327155113220215, "learning_rate": 9.999931350348016e-07, "loss": 1.02, "step": 76 }, { "epoch": 0.09856788543083447, "grad_norm": 5.503681182861328, "learning_rate": 9.999892735072187e-07, "loss": 1.003, "step": 77 }, { "epoch": 0.09984798783902712, "grad_norm": 4.701115608215332, "learning_rate": 9.999845538773952e-07, "loss": 1.02, "step": 78 }, { "epoch": 0.10112809024721978, "grad_norm": 5.238461494445801, "learning_rate": 9.999789761543314e-07, "loss": 1.027, "step": 79 }, { "epoch": 0.10240819265541243, "grad_norm": 4.521968841552734, "learning_rate": 9.999725403486634e-07, "loss": 1.023, "step": 80 }, { "epoch": 0.1036882950636051, "grad_norm": 5.6925950050354, "learning_rate": 9.99965246472664e-07, "loss": 1.01, "step": 81 }, { "epoch": 0.10496839747179774, "grad_norm": 5.630208969116211, "learning_rate": 9.999570945402424e-07, "loss": 1.019, "step": 82 }, { "epoch": 0.1062484998799904, "grad_norm": 6.6519880294799805, "learning_rate": 9.999480845669434e-07, "loss": 1.001, "step": 83 }, { "epoch": 0.10752860228818305, "grad_norm": 6.040116310119629, "learning_rate": 9.999382165699487e-07, "loss": 0.9951, "step": 84 }, { "epoch": 0.10880870469637571, "grad_norm": 4.266111850738525, "learning_rate": 9.999274905680761e-07, "loss": 1.017, "step": 85 }, { "epoch": 0.11008880710456836, "grad_norm": 6.286097049713135, "learning_rate": 9.999159065817793e-07, "loss": 0.9917, "step": 86 }, { "epoch": 0.11136890951276102, "grad_norm": 5.067218780517578, "learning_rate": 9.999034646331483e-07, "loss": 1.005, "step": 87 }, { "epoch": 0.11264901192095368, "grad_norm": 4.550882816314697, "learning_rate": 9.998901647459091e-07, "loss": 1.018, "step": 88 }, { "epoch": 0.11392911432914633, "grad_norm": 4.814333915710449, "learning_rate": 9.998760069454238e-07, "loss": 0.9745, "step": 89 }, { "epoch": 0.11520921673733898, "grad_norm": 4.380150318145752, "learning_rate": 9.998609912586904e-07, "loss": 0.9911, "step": 90 }, { "epoch": 0.11520921673733898, "eval_loss": 0.023207776248455048, "eval_runtime": 44.8047, "eval_samples_per_second": 11.07, "eval_steps_per_second": 1.384, "step": 90 }, { "epoch": 0.11648931914553164, "grad_norm": 4.401810169219971, "learning_rate": 9.99845117714343e-07, "loss": 0.9839, "step": 91 }, { "epoch": 0.1177694215537243, "grad_norm": 3.8451356887817383, "learning_rate": 9.998283863426515e-07, "loss": 0.9846, "step": 92 }, { "epoch": 0.11904952396191695, "grad_norm": 3.8628361225128174, "learning_rate": 9.998107971755216e-07, "loss": 0.9863, "step": 93 }, { "epoch": 0.1203296263701096, "grad_norm": 7.448349952697754, "learning_rate": 9.997923502464944e-07, "loss": 1.02, "step": 94 }, { "epoch": 0.12160972877830227, "grad_norm": 3.927415609359741, "learning_rate": 9.997730455907478e-07, "loss": 0.9812, "step": 95 }, { "epoch": 0.12288983118649492, "grad_norm": 3.574800729751587, "learning_rate": 9.99752883245094e-07, "loss": 0.9837, "step": 96 }, { "epoch": 0.12416993359468757, "grad_norm": 4.026058673858643, "learning_rate": 9.997318632479816e-07, "loss": 0.9789, "step": 97 }, { "epoch": 0.12545003600288024, "grad_norm": 3.540062427520752, "learning_rate": 9.997099856394947e-07, "loss": 0.9664, "step": 98 }, { "epoch": 0.1267301384110729, "grad_norm": 3.4833474159240723, "learning_rate": 9.99687250461352e-07, "loss": 0.9657, "step": 99 }, { "epoch": 0.12801024081926554, "grad_norm": 3.66798734664917, "learning_rate": 9.996636577569086e-07, "loss": 0.9824, "step": 100 }, { "epoch": 0.1292903432274582, "grad_norm": 3.3922672271728516, "learning_rate": 9.99639207571154e-07, "loss": 0.984, "step": 101 }, { "epoch": 0.13057044563565084, "grad_norm": 3.4070188999176025, "learning_rate": 9.996138999507136e-07, "loss": 0.9753, "step": 102 }, { "epoch": 0.1318505480438435, "grad_norm": 3.329225778579712, "learning_rate": 9.995877349438472e-07, "loss": 0.9587, "step": 103 }, { "epoch": 0.13313065045203618, "grad_norm": 4.1257781982421875, "learning_rate": 9.9956071260045e-07, "loss": 0.9525, "step": 104 }, { "epoch": 0.13441075286022883, "grad_norm": 3.2900748252868652, "learning_rate": 9.995328329720518e-07, "loss": 0.9854, "step": 105 }, { "epoch": 0.13569085526842148, "grad_norm": 3.2690210342407227, "learning_rate": 9.995040961118178e-07, "loss": 0.9569, "step": 106 }, { "epoch": 0.13697095767661413, "grad_norm": 3.5365443229675293, "learning_rate": 9.99474502074547e-07, "loss": 0.9702, "step": 107 }, { "epoch": 0.13825106008480678, "grad_norm": 4.516208171844482, "learning_rate": 9.994440509166735e-07, "loss": 0.9345, "step": 108 }, { "epoch": 0.13953116249299943, "grad_norm": 4.867084503173828, "learning_rate": 9.99412742696266e-07, "loss": 0.9318, "step": 109 }, { "epoch": 0.14081126490119208, "grad_norm": 4.094684600830078, "learning_rate": 9.993805774730273e-07, "loss": 0.9321, "step": 110 }, { "epoch": 0.14209136730938476, "grad_norm": 4.318435192108154, "learning_rate": 9.993475553082943e-07, "loss": 0.933, "step": 111 }, { "epoch": 0.14337146971757742, "grad_norm": 3.1860666275024414, "learning_rate": 9.993136762650387e-07, "loss": 0.9377, "step": 112 }, { "epoch": 0.14465157212577007, "grad_norm": 3.622283458709717, "learning_rate": 9.992789404078654e-07, "loss": 0.9233, "step": 113 }, { "epoch": 0.14593167453396272, "grad_norm": 3.158676862716675, "learning_rate": 9.992433478030138e-07, "loss": 0.966, "step": 114 }, { "epoch": 0.14721177694215537, "grad_norm": 4.1204376220703125, "learning_rate": 9.992068985183568e-07, "loss": 0.9125, "step": 115 }, { "epoch": 0.14849187935034802, "grad_norm": 2.7736542224884033, "learning_rate": 9.99169592623401e-07, "loss": 0.9196, "step": 116 }, { "epoch": 0.14977198175854067, "grad_norm": 3.1565606594085693, "learning_rate": 9.991314301892862e-07, "loss": 0.9093, "step": 117 }, { "epoch": 0.15105208416673335, "grad_norm": 2.656991720199585, "learning_rate": 9.990924112887861e-07, "loss": 0.9267, "step": 118 }, { "epoch": 0.152332186574926, "grad_norm": 2.6313891410827637, "learning_rate": 9.990525359963074e-07, "loss": 0.9298, "step": 119 }, { "epoch": 0.15361228898311866, "grad_norm": 2.6163902282714844, "learning_rate": 9.990118043878898e-07, "loss": 0.918, "step": 120 }, { "epoch": 0.15361228898311866, "eval_loss": 0.022782953456044197, "eval_runtime": 43.9978, "eval_samples_per_second": 11.273, "eval_steps_per_second": 1.409, "step": 120 }, { "epoch": 0.1548923913913113, "grad_norm": 2.709054946899414, "learning_rate": 9.98970216541206e-07, "loss": 0.9157, "step": 121 }, { "epoch": 0.15617249379950396, "grad_norm": 2.9031691551208496, "learning_rate": 9.989277725355614e-07, "loss": 0.9187, "step": 122 }, { "epoch": 0.1574525962076966, "grad_norm": 3.7096519470214844, "learning_rate": 9.988844724518943e-07, "loss": 0.9463, "step": 123 }, { "epoch": 0.15873269861588926, "grad_norm": 3.543902635574341, "learning_rate": 9.988403163727754e-07, "loss": 0.9359, "step": 124 }, { "epoch": 0.1600128010240819, "grad_norm": 2.7904775142669678, "learning_rate": 9.987953043824074e-07, "loss": 0.9117, "step": 125 }, { "epoch": 0.1612929034322746, "grad_norm": 2.669631004333496, "learning_rate": 9.987494365666255e-07, "loss": 0.9388, "step": 126 }, { "epoch": 0.16257300584046724, "grad_norm": 2.4496877193450928, "learning_rate": 9.98702713012897e-07, "loss": 0.9322, "step": 127 }, { "epoch": 0.1638531082486599, "grad_norm": 3.281552314758301, "learning_rate": 9.986551338103207e-07, "loss": 0.9036, "step": 128 }, { "epoch": 0.16513321065685255, "grad_norm": 2.8566553592681885, "learning_rate": 9.986066990496276e-07, "loss": 0.917, "step": 129 }, { "epoch": 0.1664133130650452, "grad_norm": 2.7793703079223633, "learning_rate": 9.985574088231794e-07, "loss": 0.9322, "step": 130 }, { "epoch": 0.16769341547323785, "grad_norm": 2.7909038066864014, "learning_rate": 9.985072632249699e-07, "loss": 0.9331, "step": 131 }, { "epoch": 0.1689735178814305, "grad_norm": 2.245703935623169, "learning_rate": 9.984562623506234e-07, "loss": 0.9109, "step": 132 }, { "epoch": 0.17025362028962318, "grad_norm": 2.405684232711792, "learning_rate": 9.98404406297396e-07, "loss": 0.9503, "step": 133 }, { "epoch": 0.17153372269781583, "grad_norm": 2.4132938385009766, "learning_rate": 9.983516951641735e-07, "loss": 0.911, "step": 134 }, { "epoch": 0.17281382510600848, "grad_norm": 3.6359527111053467, "learning_rate": 9.982981290514728e-07, "loss": 0.876, "step": 135 }, { "epoch": 0.17409392751420114, "grad_norm": 2.5113465785980225, "learning_rate": 9.982437080614418e-07, "loss": 0.9094, "step": 136 }, { "epoch": 0.1753740299223938, "grad_norm": 3.1003623008728027, "learning_rate": 9.981884322978574e-07, "loss": 0.8854, "step": 137 }, { "epoch": 0.17665413233058644, "grad_norm": 2.6631550788879395, "learning_rate": 9.981323018661278e-07, "loss": 0.8892, "step": 138 }, { "epoch": 0.1779342347387791, "grad_norm": 2.3237149715423584, "learning_rate": 9.980753168732895e-07, "loss": 0.9148, "step": 139 }, { "epoch": 0.17921433714697177, "grad_norm": 2.307526111602783, "learning_rate": 9.980174774280102e-07, "loss": 0.8995, "step": 140 }, { "epoch": 0.18049443955516442, "grad_norm": 2.005488157272339, "learning_rate": 9.97958783640586e-07, "loss": 0.9026, "step": 141 }, { "epoch": 0.18177454196335707, "grad_norm": 2.0227253437042236, "learning_rate": 9.978992356229418e-07, "loss": 0.9003, "step": 142 }, { "epoch": 0.18305464437154972, "grad_norm": 2.1933484077453613, "learning_rate": 9.978388334886327e-07, "loss": 0.8969, "step": 143 }, { "epoch": 0.18433474677974238, "grad_norm": 2.384446144104004, "learning_rate": 9.97777577352842e-07, "loss": 0.926, "step": 144 }, { "epoch": 0.18561484918793503, "grad_norm": 1.8911229372024536, "learning_rate": 9.97715467332381e-07, "loss": 0.9025, "step": 145 }, { "epoch": 0.18689495159612768, "grad_norm": 2.0518460273742676, "learning_rate": 9.976525035456897e-07, "loss": 0.8883, "step": 146 }, { "epoch": 0.18817505400432036, "grad_norm": 2.1592671871185303, "learning_rate": 9.975886861128367e-07, "loss": 0.9198, "step": 147 }, { "epoch": 0.189455156412513, "grad_norm": 1.8952604532241821, "learning_rate": 9.975240151555175e-07, "loss": 0.9002, "step": 148 }, { "epoch": 0.19073525882070566, "grad_norm": 1.8142304420471191, "learning_rate": 9.97458490797056e-07, "loss": 0.9084, "step": 149 }, { "epoch": 0.1920153612288983, "grad_norm": 2.0199060440063477, "learning_rate": 9.973921131624032e-07, "loss": 0.8805, "step": 150 }, { "epoch": 0.1920153612288983, "eval_loss": 0.022802669554948807, "eval_runtime": 44.4671, "eval_samples_per_second": 11.154, "eval_steps_per_second": 1.394, "step": 150 }, { "epoch": 0.19329546363709096, "grad_norm": 3.749702215194702, "learning_rate": 9.97324882378137e-07, "loss": 0.8618, "step": 151 }, { "epoch": 0.19457556604528362, "grad_norm": 2.697976589202881, "learning_rate": 9.972567985724623e-07, "loss": 0.8912, "step": 152 }, { "epoch": 0.19585566845347627, "grad_norm": 3.2838237285614014, "learning_rate": 9.971878618752113e-07, "loss": 0.8968, "step": 153 }, { "epoch": 0.19713577086166895, "grad_norm": 3.5656795501708984, "learning_rate": 9.971180724178416e-07, "loss": 0.8815, "step": 154 }, { "epoch": 0.1984158732698616, "grad_norm": 2.693096399307251, "learning_rate": 9.970474303334375e-07, "loss": 0.8763, "step": 155 }, { "epoch": 0.19969597567805425, "grad_norm": 3.017617702484131, "learning_rate": 9.969759357567098e-07, "loss": 0.8765, "step": 156 }, { "epoch": 0.2009760780862469, "grad_norm": 2.185084104537964, "learning_rate": 9.969035888239937e-07, "loss": 0.8537, "step": 157 }, { "epoch": 0.20225618049443955, "grad_norm": 1.771836519241333, "learning_rate": 9.968303896732503e-07, "loss": 0.8778, "step": 158 }, { "epoch": 0.2035362829026322, "grad_norm": 1.7935428619384766, "learning_rate": 9.967563384440665e-07, "loss": 0.8734, "step": 159 }, { "epoch": 0.20481638531082486, "grad_norm": 1.6056727170944214, "learning_rate": 9.96681435277653e-07, "loss": 0.9014, "step": 160 }, { "epoch": 0.20609648771901753, "grad_norm": 1.964891791343689, "learning_rate": 9.96605680316846e-07, "loss": 0.8811, "step": 161 }, { "epoch": 0.2073765901272102, "grad_norm": 1.5828536748886108, "learning_rate": 9.96529073706105e-07, "loss": 0.8827, "step": 162 }, { "epoch": 0.20865669253540284, "grad_norm": 2.222461223602295, "learning_rate": 9.964516155915151e-07, "loss": 0.8871, "step": 163 }, { "epoch": 0.2099367949435955, "grad_norm": 1.9525026082992554, "learning_rate": 9.963733061207833e-07, "loss": 0.8649, "step": 164 }, { "epoch": 0.21121689735178814, "grad_norm": 1.738632082939148, "learning_rate": 9.962941454432415e-07, "loss": 0.886, "step": 165 }, { "epoch": 0.2124969997599808, "grad_norm": 1.4754188060760498, "learning_rate": 9.962141337098443e-07, "loss": 0.8786, "step": 166 }, { "epoch": 0.21377710216817344, "grad_norm": 1.4280140399932861, "learning_rate": 9.96133271073169e-07, "loss": 0.8735, "step": 167 }, { "epoch": 0.2150572045763661, "grad_norm": 2.2600882053375244, "learning_rate": 9.96051557687416e-07, "loss": 0.8606, "step": 168 }, { "epoch": 0.21633730698455877, "grad_norm": 1.6246693134307861, "learning_rate": 9.959689937084075e-07, "loss": 0.8666, "step": 169 }, { "epoch": 0.21761740939275143, "grad_norm": 1.8838411569595337, "learning_rate": 9.958855792935884e-07, "loss": 0.8508, "step": 170 }, { "epoch": 0.21889751180094408, "grad_norm": 2.526960849761963, "learning_rate": 9.958013146020242e-07, "loss": 0.884, "step": 171 }, { "epoch": 0.22017761420913673, "grad_norm": 1.6891247034072876, "learning_rate": 9.957161997944035e-07, "loss": 0.867, "step": 172 }, { "epoch": 0.22145771661732938, "grad_norm": 2.235750436782837, "learning_rate": 9.956302350330344e-07, "loss": 0.852, "step": 173 }, { "epoch": 0.22273781902552203, "grad_norm": 1.4422881603240967, "learning_rate": 9.955434204818465e-07, "loss": 0.8877, "step": 174 }, { "epoch": 0.22401792143371468, "grad_norm": 1.4766193628311157, "learning_rate": 9.954557563063903e-07, "loss": 0.8456, "step": 175 }, { "epoch": 0.22529802384190736, "grad_norm": 1.5677717924118042, "learning_rate": 9.953672426738357e-07, "loss": 0.8629, "step": 176 }, { "epoch": 0.22657812625010001, "grad_norm": 1.9499273300170898, "learning_rate": 9.95277879752973e-07, "loss": 0.8362, "step": 177 }, { "epoch": 0.22785822865829267, "grad_norm": 1.612680196762085, "learning_rate": 9.951876677142117e-07, "loss": 0.8564, "step": 178 }, { "epoch": 0.22913833106648532, "grad_norm": 1.945848822593689, "learning_rate": 9.95096606729581e-07, "loss": 0.8738, "step": 179 }, { "epoch": 0.23041843347467797, "grad_norm": 1.3156284093856812, "learning_rate": 9.950046969727283e-07, "loss": 0.8584, "step": 180 }, { "epoch": 0.23041843347467797, "eval_loss": 0.02226248010993004, "eval_runtime": 43.2299, "eval_samples_per_second": 11.474, "eval_steps_per_second": 1.434, "step": 180 }, { "epoch": 0.23169853588287062, "grad_norm": 1.4407130479812622, "learning_rate": 9.949119386189203e-07, "loss": 0.8723, "step": 181 }, { "epoch": 0.23297863829106327, "grad_norm": 1.2906721830368042, "learning_rate": 9.948183318450412e-07, "loss": 0.844, "step": 182 }, { "epoch": 0.23425874069925595, "grad_norm": 1.3693578243255615, "learning_rate": 9.947238768295934e-07, "loss": 0.856, "step": 183 }, { "epoch": 0.2355388431074486, "grad_norm": 1.3708984851837158, "learning_rate": 9.946285737526974e-07, "loss": 0.8513, "step": 184 }, { "epoch": 0.23681894551564125, "grad_norm": 2.781414270401001, "learning_rate": 9.9453242279609e-07, "loss": 0.8731, "step": 185 }, { "epoch": 0.2380990479238339, "grad_norm": 1.645175814628601, "learning_rate": 9.944354241431252e-07, "loss": 0.8577, "step": 186 }, { "epoch": 0.23937915033202656, "grad_norm": 1.4217957258224487, "learning_rate": 9.943375779787737e-07, "loss": 0.8696, "step": 187 }, { "epoch": 0.2406592527402192, "grad_norm": 1.3828089237213135, "learning_rate": 9.94238884489622e-07, "loss": 0.8511, "step": 188 }, { "epoch": 0.24193935514841186, "grad_norm": 1.4441511631011963, "learning_rate": 9.94139343863873e-07, "loss": 0.844, "step": 189 }, { "epoch": 0.24321945755660454, "grad_norm": 2.011765241622925, "learning_rate": 9.940389562913442e-07, "loss": 0.8429, "step": 190 }, { "epoch": 0.2444995599647972, "grad_norm": 1.425309181213379, "learning_rate": 9.93937721963469e-07, "loss": 0.8518, "step": 191 }, { "epoch": 0.24577966237298984, "grad_norm": 1.5233925580978394, "learning_rate": 9.938356410732945e-07, "loss": 0.8603, "step": 192 }, { "epoch": 0.2470597647811825, "grad_norm": 1.31742262840271, "learning_rate": 9.937327138154836e-07, "loss": 0.8558, "step": 193 }, { "epoch": 0.24833986718937515, "grad_norm": 1.62467360496521, "learning_rate": 9.936289403863117e-07, "loss": 0.8551, "step": 194 }, { "epoch": 0.2496199695975678, "grad_norm": 1.1902610063552856, "learning_rate": 9.935243209836685e-07, "loss": 0.8392, "step": 195 }, { "epoch": 0.2509000720057605, "grad_norm": 1.1721690893173218, "learning_rate": 9.934188558070572e-07, "loss": 0.8341, "step": 196 }, { "epoch": 0.25218017441395313, "grad_norm": 1.3493763208389282, "learning_rate": 9.933125450575931e-07, "loss": 0.8459, "step": 197 }, { "epoch": 0.2534602768221458, "grad_norm": 1.5009081363677979, "learning_rate": 9.932053889380046e-07, "loss": 0.8492, "step": 198 }, { "epoch": 0.25474037923033843, "grad_norm": 1.1350021362304688, "learning_rate": 9.93097387652632e-07, "loss": 0.8464, "step": 199 }, { "epoch": 0.2560204816385311, "grad_norm": 1.274184226989746, "learning_rate": 9.929885414074268e-07, "loss": 0.8418, "step": 200 }, { "epoch": 0.25730058404672373, "grad_norm": 1.0790811777114868, "learning_rate": 9.928788504099527e-07, "loss": 0.8523, "step": 201 }, { "epoch": 0.2585806864549164, "grad_norm": 1.09686279296875, "learning_rate": 9.927683148693833e-07, "loss": 0.8256, "step": 202 }, { "epoch": 0.25986078886310904, "grad_norm": 1.0662562847137451, "learning_rate": 9.926569349965034e-07, "loss": 0.8581, "step": 203 }, { "epoch": 0.2611408912713017, "grad_norm": 2.0700156688690186, "learning_rate": 9.925447110037076e-07, "loss": 0.8281, "step": 204 }, { "epoch": 0.26242099367949434, "grad_norm": 1.5738226175308228, "learning_rate": 9.924316431050005e-07, "loss": 0.8492, "step": 205 }, { "epoch": 0.263701096087687, "grad_norm": 1.041562795639038, "learning_rate": 9.923177315159954e-07, "loss": 0.8355, "step": 206 }, { "epoch": 0.26498119849587964, "grad_norm": 1.1305402517318726, "learning_rate": 9.922029764539148e-07, "loss": 0.8445, "step": 207 }, { "epoch": 0.26626130090407235, "grad_norm": 1.1217234134674072, "learning_rate": 9.920873781375897e-07, "loss": 0.8365, "step": 208 }, { "epoch": 0.267541403312265, "grad_norm": 1.102113127708435, "learning_rate": 9.919709367874592e-07, "loss": 0.8488, "step": 209 }, { "epoch": 0.26882150572045765, "grad_norm": 1.2842427492141724, "learning_rate": 9.918536526255698e-07, "loss": 0.8346, "step": 210 }, { "epoch": 0.26882150572045765, "eval_loss": 0.02212940901517868, "eval_runtime": 43.1862, "eval_samples_per_second": 11.485, "eval_steps_per_second": 1.436, "step": 210 }, { "epoch": 0.2701016081286503, "grad_norm": 1.0993727445602417, "learning_rate": 9.917355258755752e-07, "loss": 0.855, "step": 211 }, { "epoch": 0.27138171053684296, "grad_norm": 1.1041290760040283, "learning_rate": 9.91616556762736e-07, "loss": 0.8203, "step": 212 }, { "epoch": 0.2726618129450356, "grad_norm": 0.9839292168617249, "learning_rate": 9.914967455139191e-07, "loss": 0.8394, "step": 213 }, { "epoch": 0.27394191535322826, "grad_norm": 1.0422465801239014, "learning_rate": 9.913760923575972e-07, "loss": 0.8442, "step": 214 }, { "epoch": 0.2752220177614209, "grad_norm": 0.9453950524330139, "learning_rate": 9.912545975238489e-07, "loss": 0.8531, "step": 215 }, { "epoch": 0.27650212016961356, "grad_norm": 1.6943658590316772, "learning_rate": 9.91132261244357e-07, "loss": 0.8321, "step": 216 }, { "epoch": 0.2777822225778062, "grad_norm": 0.9965325593948364, "learning_rate": 9.910090837524098e-07, "loss": 0.8365, "step": 217 }, { "epoch": 0.27906232498599887, "grad_norm": 1.3208179473876953, "learning_rate": 9.908850652828989e-07, "loss": 0.8595, "step": 218 }, { "epoch": 0.2803424273941915, "grad_norm": 1.077359914779663, "learning_rate": 9.9076020607232e-07, "loss": 0.8092, "step": 219 }, { "epoch": 0.28162252980238417, "grad_norm": 1.236102819442749, "learning_rate": 9.906345063587724e-07, "loss": 0.8491, "step": 220 }, { "epoch": 0.2829026322105768, "grad_norm": 1.269243597984314, "learning_rate": 9.905079663819578e-07, "loss": 0.8419, "step": 221 }, { "epoch": 0.28418273461876953, "grad_norm": 1.7856619358062744, "learning_rate": 9.903805863831799e-07, "loss": 0.852, "step": 222 }, { "epoch": 0.2854628370269622, "grad_norm": 0.9859713315963745, "learning_rate": 9.902523666053447e-07, "loss": 0.8456, "step": 223 }, { "epoch": 0.28674293943515483, "grad_norm": 1.4276418685913086, "learning_rate": 9.901233072929597e-07, "loss": 0.8618, "step": 224 }, { "epoch": 0.2880230418433475, "grad_norm": 0.991123616695404, "learning_rate": 9.899934086921333e-07, "loss": 0.8162, "step": 225 }, { "epoch": 0.28930314425154013, "grad_norm": 0.9088144302368164, "learning_rate": 9.89862671050574e-07, "loss": 0.8294, "step": 226 }, { "epoch": 0.2905832466597328, "grad_norm": 1.0244677066802979, "learning_rate": 9.897310946175907e-07, "loss": 0.8146, "step": 227 }, { "epoch": 0.29186334906792544, "grad_norm": 1.0561277866363525, "learning_rate": 9.895986796440915e-07, "loss": 0.8001, "step": 228 }, { "epoch": 0.2931434514761181, "grad_norm": 0.9377354979515076, "learning_rate": 9.894654263825838e-07, "loss": 0.8254, "step": 229 }, { "epoch": 0.29442355388431074, "grad_norm": 1.2209163904190063, "learning_rate": 9.893313350871735e-07, "loss": 0.8287, "step": 230 }, { "epoch": 0.2957036562925034, "grad_norm": 0.9214802980422974, "learning_rate": 9.891964060135647e-07, "loss": 0.8068, "step": 231 }, { "epoch": 0.29698375870069604, "grad_norm": 1.857720136642456, "learning_rate": 9.890606394190588e-07, "loss": 0.8217, "step": 232 }, { "epoch": 0.2982638611088887, "grad_norm": 1.1422715187072754, "learning_rate": 9.889240355625542e-07, "loss": 0.8256, "step": 233 }, { "epoch": 0.29954396351708135, "grad_norm": 0.864855170249939, "learning_rate": 9.887865947045468e-07, "loss": 0.8423, "step": 234 }, { "epoch": 0.300824065925274, "grad_norm": 1.054294228553772, "learning_rate": 9.886483171071274e-07, "loss": 0.8068, "step": 235 }, { "epoch": 0.3021041683334667, "grad_norm": 1.5990568399429321, "learning_rate": 9.885092030339834e-07, "loss": 0.8285, "step": 236 }, { "epoch": 0.30338427074165936, "grad_norm": 0.8439202904701233, "learning_rate": 9.883692527503966e-07, "loss": 0.7954, "step": 237 }, { "epoch": 0.304664373149852, "grad_norm": 0.9036396741867065, "learning_rate": 9.88228466523244e-07, "loss": 0.7987, "step": 238 }, { "epoch": 0.30594447555804466, "grad_norm": 0.9020777344703674, "learning_rate": 9.880868446209961e-07, "loss": 0.8339, "step": 239 }, { "epoch": 0.3072245779662373, "grad_norm": 1.1989668607711792, "learning_rate": 9.879443873137174e-07, "loss": 0.812, "step": 240 }, { "epoch": 0.3072245779662373, "eval_loss": 0.021917186677455902, "eval_runtime": 42.9449, "eval_samples_per_second": 11.55, "eval_steps_per_second": 1.444, "step": 240 }, { "epoch": 0.30850468037442996, "grad_norm": 0.8450129628181458, "learning_rate": 9.878010948730653e-07, "loss": 0.8076, "step": 241 }, { "epoch": 0.3097847827826226, "grad_norm": 0.961158812046051, "learning_rate": 9.876569675722897e-07, "loss": 0.8249, "step": 242 }, { "epoch": 0.31106488519081527, "grad_norm": 1.1414752006530762, "learning_rate": 9.875120056862327e-07, "loss": 0.8211, "step": 243 }, { "epoch": 0.3123449875990079, "grad_norm": 1.155081033706665, "learning_rate": 9.87366209491328e-07, "loss": 0.7911, "step": 244 }, { "epoch": 0.31362509000720057, "grad_norm": 0.8352901339530945, "learning_rate": 9.872195792656e-07, "loss": 0.8327, "step": 245 }, { "epoch": 0.3149051924153932, "grad_norm": 0.8369143009185791, "learning_rate": 9.870721152886633e-07, "loss": 0.8295, "step": 246 }, { "epoch": 0.31618529482358587, "grad_norm": 0.8059689402580261, "learning_rate": 9.869238178417235e-07, "loss": 0.8028, "step": 247 }, { "epoch": 0.3174653972317785, "grad_norm": 1.0145469903945923, "learning_rate": 9.867746872075739e-07, "loss": 0.7888, "step": 248 }, { "epoch": 0.3187454996399712, "grad_norm": 0.8502800464630127, "learning_rate": 9.866247236705983e-07, "loss": 0.8306, "step": 249 }, { "epoch": 0.3200256020481638, "grad_norm": 1.2448238134384155, "learning_rate": 9.864739275167678e-07, "loss": 0.8362, "step": 250 }, { "epoch": 0.32130570445635653, "grad_norm": 0.8307976722717285, "learning_rate": 9.863222990336415e-07, "loss": 0.8268, "step": 251 }, { "epoch": 0.3225858068645492, "grad_norm": 1.115708351135254, "learning_rate": 9.861698385103658e-07, "loss": 0.7881, "step": 252 }, { "epoch": 0.32386590927274184, "grad_norm": 0.83074951171875, "learning_rate": 9.860165462376737e-07, "loss": 0.8163, "step": 253 }, { "epoch": 0.3251460116809345, "grad_norm": 0.8235610723495483, "learning_rate": 9.85862422507884e-07, "loss": 0.7756, "step": 254 }, { "epoch": 0.32642611408912714, "grad_norm": 0.8696281313896179, "learning_rate": 9.857074676149015e-07, "loss": 0.7932, "step": 255 }, { "epoch": 0.3277062164973198, "grad_norm": 1.2079825401306152, "learning_rate": 9.855516818542157e-07, "loss": 0.8088, "step": 256 }, { "epoch": 0.32898631890551244, "grad_norm": 1.0331051349639893, "learning_rate": 9.853950655229007e-07, "loss": 0.8166, "step": 257 }, { "epoch": 0.3302664213137051, "grad_norm": 0.8544551730155945, "learning_rate": 9.852376189196146e-07, "loss": 0.796, "step": 258 }, { "epoch": 0.33154652372189775, "grad_norm": 1.7888301610946655, "learning_rate": 9.850793423445977e-07, "loss": 0.7844, "step": 259 }, { "epoch": 0.3328266261300904, "grad_norm": 0.9609640836715698, "learning_rate": 9.849202360996746e-07, "loss": 0.8223, "step": 260 }, { "epoch": 0.33410672853828305, "grad_norm": 0.7650641798973083, "learning_rate": 9.84760300488251e-07, "loss": 0.798, "step": 261 }, { "epoch": 0.3353868309464757, "grad_norm": 1.247570514678955, "learning_rate": 9.845995358153145e-07, "loss": 0.8259, "step": 262 }, { "epoch": 0.33666693335466835, "grad_norm": 0.9482812285423279, "learning_rate": 9.844379423874331e-07, "loss": 0.79, "step": 263 }, { "epoch": 0.337947035762861, "grad_norm": 1.0385113954544067, "learning_rate": 9.842755205127562e-07, "loss": 0.7929, "step": 264 }, { "epoch": 0.3392271381710537, "grad_norm": 1.2172261476516724, "learning_rate": 9.841122705010124e-07, "loss": 0.7765, "step": 265 }, { "epoch": 0.34050724057924636, "grad_norm": 1.7421001195907593, "learning_rate": 9.839481926635096e-07, "loss": 0.8047, "step": 266 }, { "epoch": 0.341787342987439, "grad_norm": 1.3985625505447388, "learning_rate": 9.83783287313134e-07, "loss": 0.81, "step": 267 }, { "epoch": 0.34306744539563166, "grad_norm": 1.1961512565612793, "learning_rate": 9.836175547643502e-07, "loss": 0.8171, "step": 268 }, { "epoch": 0.3443475478038243, "grad_norm": 0.818731427192688, "learning_rate": 9.834509953332e-07, "loss": 0.796, "step": 269 }, { "epoch": 0.34562765021201697, "grad_norm": 1.7126835584640503, "learning_rate": 9.832836093373026e-07, "loss": 0.7969, "step": 270 }, { "epoch": 0.34562765021201697, "eval_loss": 0.02190336398780346, "eval_runtime": 43.1177, "eval_samples_per_second": 11.503, "eval_steps_per_second": 1.438, "step": 270 }, { "epoch": 0.3469077526202096, "grad_norm": 1.235481858253479, "learning_rate": 9.831153970958524e-07, "loss": 0.7915, "step": 271 }, { "epoch": 0.34818785502840227, "grad_norm": 0.7385391592979431, "learning_rate": 9.829463589296201e-07, "loss": 0.7921, "step": 272 }, { "epoch": 0.3494679574365949, "grad_norm": 1.6542584896087646, "learning_rate": 9.827764951609514e-07, "loss": 0.8093, "step": 273 }, { "epoch": 0.3507480598447876, "grad_norm": 1.8457363843917847, "learning_rate": 9.826058061137663e-07, "loss": 0.7709, "step": 274 }, { "epoch": 0.3520281622529802, "grad_norm": 1.2398396730422974, "learning_rate": 9.824342921135579e-07, "loss": 0.8227, "step": 275 }, { "epoch": 0.3533082646611729, "grad_norm": 0.7551895380020142, "learning_rate": 9.822619534873934e-07, "loss": 0.7772, "step": 276 }, { "epoch": 0.35458836706936553, "grad_norm": 0.8885154724121094, "learning_rate": 9.82088790563912e-07, "loss": 0.8015, "step": 277 }, { "epoch": 0.3558684694775582, "grad_norm": 0.9509640336036682, "learning_rate": 9.81914803673325e-07, "loss": 0.7934, "step": 278 }, { "epoch": 0.3571485718857509, "grad_norm": 0.9045248627662659, "learning_rate": 9.81739993147415e-07, "loss": 0.7939, "step": 279 }, { "epoch": 0.35842867429394354, "grad_norm": 2.870340585708618, "learning_rate": 9.815643593195345e-07, "loss": 0.7724, "step": 280 }, { "epoch": 0.3597087767021362, "grad_norm": 1.8291690349578857, "learning_rate": 9.81387902524607e-07, "loss": 0.782, "step": 281 }, { "epoch": 0.36098887911032884, "grad_norm": 1.435534119606018, "learning_rate": 9.812106230991248e-07, "loss": 0.8073, "step": 282 }, { "epoch": 0.3622689815185215, "grad_norm": 1.8294379711151123, "learning_rate": 9.810325213811489e-07, "loss": 0.7954, "step": 283 }, { "epoch": 0.36354908392671414, "grad_norm": 1.1028311252593994, "learning_rate": 9.808535977103086e-07, "loss": 0.7871, "step": 284 }, { "epoch": 0.3648291863349068, "grad_norm": 0.843399703502655, "learning_rate": 9.806738524278003e-07, "loss": 0.8058, "step": 285 }, { "epoch": 0.36610928874309945, "grad_norm": 1.9043854475021362, "learning_rate": 9.804932858763878e-07, "loss": 0.7937, "step": 286 }, { "epoch": 0.3673893911512921, "grad_norm": 2.0889906883239746, "learning_rate": 9.803118984004002e-07, "loss": 0.8011, "step": 287 }, { "epoch": 0.36866949355948475, "grad_norm": 2.2988035678863525, "learning_rate": 9.801296903457322e-07, "loss": 0.8157, "step": 288 }, { "epoch": 0.3699495959676774, "grad_norm": 0.9738537073135376, "learning_rate": 9.799466620598441e-07, "loss": 0.806, "step": 289 }, { "epoch": 0.37122969837587005, "grad_norm": 1.3052942752838135, "learning_rate": 9.797628138917593e-07, "loss": 0.7804, "step": 290 }, { "epoch": 0.3725098007840627, "grad_norm": 1.2379125356674194, "learning_rate": 9.795781461920652e-07, "loss": 0.799, "step": 291 }, { "epoch": 0.37378990319225536, "grad_norm": 1.0885727405548096, "learning_rate": 9.793926593129118e-07, "loss": 0.8097, "step": 292 }, { "epoch": 0.375070005600448, "grad_norm": 1.2893867492675781, "learning_rate": 9.792063536080114e-07, "loss": 0.7896, "step": 293 }, { "epoch": 0.3763501080086407, "grad_norm": 0.8981683850288391, "learning_rate": 9.790192294326378e-07, "loss": 0.7912, "step": 294 }, { "epoch": 0.37763021041683337, "grad_norm": 0.9252378940582275, "learning_rate": 9.788312871436254e-07, "loss": 0.7948, "step": 295 }, { "epoch": 0.378910312825026, "grad_norm": 0.6900148391723633, "learning_rate": 9.786425270993684e-07, "loss": 0.7845, "step": 296 }, { "epoch": 0.38019041523321867, "grad_norm": 0.7811844944953918, "learning_rate": 9.784529496598212e-07, "loss": 0.773, "step": 297 }, { "epoch": 0.3814705176414113, "grad_norm": 0.7559629082679749, "learning_rate": 9.782625551864964e-07, "loss": 0.7855, "step": 298 }, { "epoch": 0.382750620049604, "grad_norm": 0.7708130478858948, "learning_rate": 9.780713440424648e-07, "loss": 0.803, "step": 299 }, { "epoch": 0.3840307224577966, "grad_norm": 0.7201048135757446, "learning_rate": 9.77879316592354e-07, "loss": 0.7868, "step": 300 }, { "epoch": 0.3840307224577966, "eval_loss": 0.021626591682434082, "eval_runtime": 42.5137, "eval_samples_per_second": 11.667, "eval_steps_per_second": 1.458, "step": 300 }, { "epoch": 0.3853108248659893, "grad_norm": 1.1081997156143188, "learning_rate": 9.77686473202349e-07, "loss": 0.7901, "step": 301 }, { "epoch": 0.38659092727418193, "grad_norm": 0.6676652431488037, "learning_rate": 9.774928142401903e-07, "loss": 0.7949, "step": 302 }, { "epoch": 0.3878710296823746, "grad_norm": 1.385185718536377, "learning_rate": 9.77298340075174e-07, "loss": 0.7835, "step": 303 }, { "epoch": 0.38915113209056723, "grad_norm": 0.8051367998123169, "learning_rate": 9.771030510781505e-07, "loss": 0.7927, "step": 304 }, { "epoch": 0.3904312344987599, "grad_norm": 1.444473385810852, "learning_rate": 9.76906947621524e-07, "loss": 0.7737, "step": 305 }, { "epoch": 0.39171133690695253, "grad_norm": 1.1056404113769531, "learning_rate": 9.767100300792519e-07, "loss": 0.7812, "step": 306 }, { "epoch": 0.3929914393151452, "grad_norm": 0.6941848993301392, "learning_rate": 9.765122988268437e-07, "loss": 0.8061, "step": 307 }, { "epoch": 0.3942715417233379, "grad_norm": 0.6535438895225525, "learning_rate": 9.763137542413616e-07, "loss": 0.7977, "step": 308 }, { "epoch": 0.39555164413153054, "grad_norm": 0.7749496102333069, "learning_rate": 9.761143967014176e-07, "loss": 0.8036, "step": 309 }, { "epoch": 0.3968317465397232, "grad_norm": 0.9956401586532593, "learning_rate": 9.759142265871744e-07, "loss": 0.7839, "step": 310 }, { "epoch": 0.39811184894791585, "grad_norm": 0.7070454955101013, "learning_rate": 9.757132442803444e-07, "loss": 0.793, "step": 311 }, { "epoch": 0.3993919513561085, "grad_norm": 0.6864356398582458, "learning_rate": 9.755114501641885e-07, "loss": 0.7849, "step": 312 }, { "epoch": 0.40067205376430115, "grad_norm": 1.5150302648544312, "learning_rate": 9.75308844623516e-07, "loss": 0.7624, "step": 313 }, { "epoch": 0.4019521561724938, "grad_norm": 0.8884550333023071, "learning_rate": 9.751054280446837e-07, "loss": 0.7866, "step": 314 }, { "epoch": 0.40323225858068645, "grad_norm": 1.077107310295105, "learning_rate": 9.74901200815594e-07, "loss": 0.7832, "step": 315 }, { "epoch": 0.4045123609888791, "grad_norm": 0.7195938229560852, "learning_rate": 9.746961633256964e-07, "loss": 0.772, "step": 316 }, { "epoch": 0.40579246339707176, "grad_norm": 1.1745284795761108, "learning_rate": 9.744903159659844e-07, "loss": 0.8035, "step": 317 }, { "epoch": 0.4070725658052644, "grad_norm": 1.100885033607483, "learning_rate": 9.742836591289966e-07, "loss": 0.7717, "step": 318 }, { "epoch": 0.40835266821345706, "grad_norm": 1.1299428939819336, "learning_rate": 9.740761932088157e-07, "loss": 0.7961, "step": 319 }, { "epoch": 0.4096327706216497, "grad_norm": 0.8672587275505066, "learning_rate": 9.738679186010658e-07, "loss": 0.7548, "step": 320 }, { "epoch": 0.41091287302984236, "grad_norm": 1.502167820930481, "learning_rate": 9.73658835702914e-07, "loss": 0.7726, "step": 321 }, { "epoch": 0.41219297543803507, "grad_norm": 0.8918670415878296, "learning_rate": 9.734489449130695e-07, "loss": 0.779, "step": 322 }, { "epoch": 0.4134730778462277, "grad_norm": 1.2873344421386719, "learning_rate": 9.732382466317804e-07, "loss": 0.7835, "step": 323 }, { "epoch": 0.4147531802544204, "grad_norm": 0.8522046208381653, "learning_rate": 9.73026741260836e-07, "loss": 0.7738, "step": 324 }, { "epoch": 0.416033282662613, "grad_norm": 1.5762598514556885, "learning_rate": 9.728144292035638e-07, "loss": 0.7851, "step": 325 }, { "epoch": 0.4173133850708057, "grad_norm": 0.79217928647995, "learning_rate": 9.726013108648305e-07, "loss": 0.7734, "step": 326 }, { "epoch": 0.4185934874789983, "grad_norm": 0.7395232915878296, "learning_rate": 9.723873866510395e-07, "loss": 0.7549, "step": 327 }, { "epoch": 0.419873589887191, "grad_norm": 1.761189579963684, "learning_rate": 9.721726569701317e-07, "loss": 0.7734, "step": 328 }, { "epoch": 0.42115369229538363, "grad_norm": 1.9896551370620728, "learning_rate": 9.71957122231583e-07, "loss": 0.8012, "step": 329 }, { "epoch": 0.4224337947035763, "grad_norm": 0.8608530163764954, "learning_rate": 9.717407828464056e-07, "loss": 0.7853, "step": 330 }, { "epoch": 0.4224337947035763, "eval_loss": 0.021434079855680466, "eval_runtime": 42.2381, "eval_samples_per_second": 11.743, "eval_steps_per_second": 1.468, "step": 330 }, { "epoch": 0.42371389711176893, "grad_norm": 0.985016405582428, "learning_rate": 9.715236392271453e-07, "loss": 0.7786, "step": 331 }, { "epoch": 0.4249939995199616, "grad_norm": 0.6312138438224792, "learning_rate": 9.713056917878816e-07, "loss": 0.7997, "step": 332 }, { "epoch": 0.42627410192815424, "grad_norm": 0.6067633032798767, "learning_rate": 9.710869409442276e-07, "loss": 0.7969, "step": 333 }, { "epoch": 0.4275542043363469, "grad_norm": 0.6223033666610718, "learning_rate": 9.708673871133276e-07, "loss": 0.7992, "step": 334 }, { "epoch": 0.42883430674453954, "grad_norm": 0.9319964051246643, "learning_rate": 9.706470307138571e-07, "loss": 0.7687, "step": 335 }, { "epoch": 0.4301144091527322, "grad_norm": 0.7885686755180359, "learning_rate": 9.70425872166023e-07, "loss": 0.7844, "step": 336 }, { "epoch": 0.4313945115609249, "grad_norm": 0.7727945446968079, "learning_rate": 9.70203911891561e-07, "loss": 0.7455, "step": 337 }, { "epoch": 0.43267461396911755, "grad_norm": 0.9676743149757385, "learning_rate": 9.699811503137355e-07, "loss": 0.775, "step": 338 }, { "epoch": 0.4339547163773102, "grad_norm": 0.6573967337608337, "learning_rate": 9.697575878573399e-07, "loss": 0.7616, "step": 339 }, { "epoch": 0.43523481878550285, "grad_norm": 1.2237255573272705, "learning_rate": 9.695332249486939e-07, "loss": 0.7902, "step": 340 }, { "epoch": 0.4365149211936955, "grad_norm": 0.8275060057640076, "learning_rate": 9.69308062015644e-07, "loss": 0.7744, "step": 341 }, { "epoch": 0.43779502360188816, "grad_norm": 0.5850309133529663, "learning_rate": 9.69082099487562e-07, "loss": 0.7652, "step": 342 }, { "epoch": 0.4390751260100808, "grad_norm": 1.9193520545959473, "learning_rate": 9.688553377953453e-07, "loss": 0.7937, "step": 343 }, { "epoch": 0.44035522841827346, "grad_norm": 1.537428617477417, "learning_rate": 9.686277773714144e-07, "loss": 0.784, "step": 344 }, { "epoch": 0.4416353308264661, "grad_norm": 1.4273813962936401, "learning_rate": 9.683994186497132e-07, "loss": 0.7641, "step": 345 }, { "epoch": 0.44291543323465876, "grad_norm": 0.7208697199821472, "learning_rate": 9.681702620657078e-07, "loss": 0.7848, "step": 346 }, { "epoch": 0.4441955356428514, "grad_norm": 1.4960705041885376, "learning_rate": 9.67940308056386e-07, "loss": 0.7761, "step": 347 }, { "epoch": 0.44547563805104406, "grad_norm": 0.6143835186958313, "learning_rate": 9.677095570602563e-07, "loss": 0.7697, "step": 348 }, { "epoch": 0.4467557404592367, "grad_norm": 0.9813094735145569, "learning_rate": 9.674780095173466e-07, "loss": 0.7847, "step": 349 }, { "epoch": 0.44803584286742937, "grad_norm": 0.6809216737747192, "learning_rate": 9.672456658692042e-07, "loss": 0.7744, "step": 350 }, { "epoch": 0.4493159452756221, "grad_norm": 1.2698214054107666, "learning_rate": 9.670125265588943e-07, "loss": 0.7591, "step": 351 }, { "epoch": 0.4505960476838147, "grad_norm": 0.8428552746772766, "learning_rate": 9.667785920309993e-07, "loss": 0.7729, "step": 352 }, { "epoch": 0.4518761500920074, "grad_norm": 0.6046946048736572, "learning_rate": 9.665438627316184e-07, "loss": 0.7718, "step": 353 }, { "epoch": 0.45315625250020003, "grad_norm": 1.4922956228256226, "learning_rate": 9.663083391083658e-07, "loss": 0.7535, "step": 354 }, { "epoch": 0.4544363549083927, "grad_norm": 0.7376657724380493, "learning_rate": 9.66072021610371e-07, "loss": 0.7544, "step": 355 }, { "epoch": 0.45571645731658533, "grad_norm": 0.9707961678504944, "learning_rate": 9.658349106882773e-07, "loss": 0.7758, "step": 356 }, { "epoch": 0.456996559724778, "grad_norm": 1.1351879835128784, "learning_rate": 9.655970067942404e-07, "loss": 0.8008, "step": 357 }, { "epoch": 0.45827666213297064, "grad_norm": 0.58219313621521, "learning_rate": 9.65358310381929e-07, "loss": 0.7755, "step": 358 }, { "epoch": 0.4595567645411633, "grad_norm": 0.6028603911399841, "learning_rate": 9.65118821906522e-07, "loss": 0.7682, "step": 359 }, { "epoch": 0.46083686694935594, "grad_norm": 1.380950927734375, "learning_rate": 9.6487854182471e-07, "loss": 0.7758, "step": 360 }, { "epoch": 0.46083686694935594, "eval_loss": 0.021408675238490105, "eval_runtime": 42.4188, "eval_samples_per_second": 11.693, "eval_steps_per_second": 1.462, "step": 360 }, { "epoch": 0.4621169693575486, "grad_norm": 0.9132922887802124, "learning_rate": 9.646374705946925e-07, "loss": 0.7669, "step": 361 }, { "epoch": 0.46339707176574124, "grad_norm": 0.9454202651977539, "learning_rate": 9.643956086761777e-07, "loss": 0.761, "step": 362 }, { "epoch": 0.4646771741739339, "grad_norm": 1.2195969820022583, "learning_rate": 9.641529565303816e-07, "loss": 0.7674, "step": 363 }, { "epoch": 0.46595727658212654, "grad_norm": 0.8626465201377869, "learning_rate": 9.639095146200266e-07, "loss": 0.7736, "step": 364 }, { "epoch": 0.46723737899031925, "grad_norm": 0.5632688999176025, "learning_rate": 9.636652834093426e-07, "loss": 0.7728, "step": 365 }, { "epoch": 0.4685174813985119, "grad_norm": 0.5573896169662476, "learning_rate": 9.63420263364063e-07, "loss": 0.7476, "step": 366 }, { "epoch": 0.46979758380670456, "grad_norm": 0.7768682241439819, "learning_rate": 9.631744549514262e-07, "loss": 0.7509, "step": 367 }, { "epoch": 0.4710776862148972, "grad_norm": 0.5715169906616211, "learning_rate": 9.62927858640174e-07, "loss": 0.7609, "step": 368 }, { "epoch": 0.47235778862308986, "grad_norm": 0.6762582659721375, "learning_rate": 9.626804749005508e-07, "loss": 0.7537, "step": 369 }, { "epoch": 0.4736378910312825, "grad_norm": 0.7740899324417114, "learning_rate": 9.624323042043024e-07, "loss": 0.7724, "step": 370 }, { "epoch": 0.47491799343947516, "grad_norm": 1.3187012672424316, "learning_rate": 9.621833470246748e-07, "loss": 0.7659, "step": 371 }, { "epoch": 0.4761980958476678, "grad_norm": 0.6512274742126465, "learning_rate": 9.619336038364148e-07, "loss": 0.7746, "step": 372 }, { "epoch": 0.47747819825586046, "grad_norm": 0.7822607755661011, "learning_rate": 9.616830751157671e-07, "loss": 0.7866, "step": 373 }, { "epoch": 0.4787583006640531, "grad_norm": 0.8908462524414062, "learning_rate": 9.61431761340475e-07, "loss": 0.773, "step": 374 }, { "epoch": 0.48003840307224577, "grad_norm": 0.6075584888458252, "learning_rate": 9.611796629897785e-07, "loss": 0.7687, "step": 375 }, { "epoch": 0.4813185054804384, "grad_norm": 0.8187317848205566, "learning_rate": 9.60926780544414e-07, "loss": 0.76, "step": 376 }, { "epoch": 0.48259860788863107, "grad_norm": 0.5584650039672852, "learning_rate": 9.606731144866129e-07, "loss": 0.7611, "step": 377 }, { "epoch": 0.4838787102968237, "grad_norm": 0.6771740317344666, "learning_rate": 9.604186653001008e-07, "loss": 0.7694, "step": 378 }, { "epoch": 0.48515881270501643, "grad_norm": 1.1669390201568604, "learning_rate": 9.601634334700969e-07, "loss": 0.7567, "step": 379 }, { "epoch": 0.4864389151132091, "grad_norm": 1.2172741889953613, "learning_rate": 9.599074194833132e-07, "loss": 0.7643, "step": 380 }, { "epoch": 0.48771901752140173, "grad_norm": 0.7804280519485474, "learning_rate": 9.596506238279525e-07, "loss": 0.7605, "step": 381 }, { "epoch": 0.4889991199295944, "grad_norm": 0.6591628193855286, "learning_rate": 9.593930469937086e-07, "loss": 0.7684, "step": 382 }, { "epoch": 0.49027922233778704, "grad_norm": 0.9486355185508728, "learning_rate": 9.59134689471765e-07, "loss": 0.7673, "step": 383 }, { "epoch": 0.4915593247459797, "grad_norm": 0.5388826131820679, "learning_rate": 9.588755517547936e-07, "loss": 0.7751, "step": 384 }, { "epoch": 0.49283942715417234, "grad_norm": 0.6004676818847656, "learning_rate": 9.586156343369543e-07, "loss": 0.7503, "step": 385 }, { "epoch": 0.494119529562365, "grad_norm": 0.9401939511299133, "learning_rate": 9.58354937713894e-07, "loss": 0.7903, "step": 386 }, { "epoch": 0.49539963197055764, "grad_norm": 0.5513790845870972, "learning_rate": 9.580934623827454e-07, "loss": 0.7461, "step": 387 }, { "epoch": 0.4966797343787503, "grad_norm": 0.6497021317481995, "learning_rate": 9.57831208842126e-07, "loss": 0.7749, "step": 388 }, { "epoch": 0.49795983678694294, "grad_norm": 0.7385431528091431, "learning_rate": 9.575681775921375e-07, "loss": 0.7645, "step": 389 }, { "epoch": 0.4992399391951356, "grad_norm": 0.944419801235199, "learning_rate": 9.57304369134364e-07, "loss": 0.7574, "step": 390 }, { "epoch": 0.4992399391951356, "eval_loss": 0.021252252161502838, "eval_runtime": 42.2062, "eval_samples_per_second": 11.752, "eval_steps_per_second": 1.469, "step": 390 }, { "epoch": 0.5005200416033283, "grad_norm": 1.0767381191253662, "learning_rate": 9.57039783971873e-07, "loss": 0.7612, "step": 391 }, { "epoch": 0.501800144011521, "grad_norm": 0.540380597114563, "learning_rate": 9.56774422609212e-07, "loss": 0.7644, "step": 392 }, { "epoch": 0.5030802464197136, "grad_norm": 1.0154279470443726, "learning_rate": 9.565082855524088e-07, "loss": 0.7677, "step": 393 }, { "epoch": 0.5043603488279063, "grad_norm": 0.5781416296958923, "learning_rate": 9.56241373308971e-07, "loss": 0.7622, "step": 394 }, { "epoch": 0.5056404512360989, "grad_norm": 0.6233311891555786, "learning_rate": 9.559736863878838e-07, "loss": 0.7595, "step": 395 }, { "epoch": 0.5069205536442916, "grad_norm": 0.8441587686538696, "learning_rate": 9.5570522529961e-07, "loss": 0.7599, "step": 396 }, { "epoch": 0.5082006560524842, "grad_norm": 1.02420175075531, "learning_rate": 9.554359905560885e-07, "loss": 0.7547, "step": 397 }, { "epoch": 0.5094807584606769, "grad_norm": 1.3045917749404907, "learning_rate": 9.551659826707339e-07, "loss": 0.735, "step": 398 }, { "epoch": 0.5107608608688695, "grad_norm": 0.7551970481872559, "learning_rate": 9.548952021584347e-07, "loss": 0.7736, "step": 399 }, { "epoch": 0.5120409632770622, "grad_norm": 0.5530499219894409, "learning_rate": 9.546236495355527e-07, "loss": 0.7893, "step": 400 }, { "epoch": 0.5133210656852548, "grad_norm": 1.1218974590301514, "learning_rate": 9.543513253199225e-07, "loss": 0.7831, "step": 401 }, { "epoch": 0.5146011680934475, "grad_norm": 0.6517909169197083, "learning_rate": 9.5407823003085e-07, "loss": 0.7686, "step": 402 }, { "epoch": 0.5158812705016401, "grad_norm": 0.9001660943031311, "learning_rate": 9.53804364189111e-07, "loss": 0.7711, "step": 403 }, { "epoch": 0.5171613729098328, "grad_norm": 0.5411023497581482, "learning_rate": 9.53529728316951e-07, "loss": 0.7471, "step": 404 }, { "epoch": 0.5184414753180254, "grad_norm": 0.5554513335227966, "learning_rate": 9.532543229380844e-07, "loss": 0.7432, "step": 405 }, { "epoch": 0.5197215777262181, "grad_norm": 0.5336626768112183, "learning_rate": 9.529781485776922e-07, "loss": 0.7734, "step": 406 }, { "epoch": 0.5210016801344107, "grad_norm": 0.577154815196991, "learning_rate": 9.527012057624223e-07, "loss": 0.7399, "step": 407 }, { "epoch": 0.5222817825426034, "grad_norm": 1.0010712146759033, "learning_rate": 9.524234950203877e-07, "loss": 0.729, "step": 408 }, { "epoch": 0.523561884950796, "grad_norm": 0.5498564839363098, "learning_rate": 9.521450168811661e-07, "loss": 0.7677, "step": 409 }, { "epoch": 0.5248419873589887, "grad_norm": 0.51145339012146, "learning_rate": 9.518657718757984e-07, "loss": 0.7515, "step": 410 }, { "epoch": 0.5261220897671813, "grad_norm": 1.5682653188705444, "learning_rate": 9.515857605367876e-07, "loss": 0.7544, "step": 411 }, { "epoch": 0.527402192175374, "grad_norm": 0.6942523717880249, "learning_rate": 9.513049833980988e-07, "loss": 0.7423, "step": 412 }, { "epoch": 0.5286822945835666, "grad_norm": 0.541015088558197, "learning_rate": 9.510234409951566e-07, "loss": 0.7724, "step": 413 }, { "epoch": 0.5299623969917593, "grad_norm": 0.5375149250030518, "learning_rate": 9.507411338648454e-07, "loss": 0.7331, "step": 414 }, { "epoch": 0.531242499399952, "grad_norm": 0.9828507304191589, "learning_rate": 9.504580625455077e-07, "loss": 0.7703, "step": 415 }, { "epoch": 0.5325226018081447, "grad_norm": 0.7082284092903137, "learning_rate": 9.501742275769433e-07, "loss": 0.7653, "step": 416 }, { "epoch": 0.5338027042163374, "grad_norm": 0.5465125441551208, "learning_rate": 9.498896295004086e-07, "loss": 0.759, "step": 417 }, { "epoch": 0.53508280662453, "grad_norm": 1.2730739116668701, "learning_rate": 9.496042688586145e-07, "loss": 0.757, "step": 418 }, { "epoch": 0.5363629090327227, "grad_norm": 0.6074537038803101, "learning_rate": 9.493181461957265e-07, "loss": 0.741, "step": 419 }, { "epoch": 0.5376430114409153, "grad_norm": 0.6029033064842224, "learning_rate": 9.490312620573631e-07, "loss": 0.737, "step": 420 }, { "epoch": 0.5376430114409153, "eval_loss": 0.02122470550239086, "eval_runtime": 42.3146, "eval_samples_per_second": 11.722, "eval_steps_per_second": 1.465, "step": 420 }, { "epoch": 0.538923113849108, "grad_norm": 0.6610042452812195, "learning_rate": 9.487436169905953e-07, "loss": 0.7529, "step": 421 }, { "epoch": 0.5402032162573006, "grad_norm": 0.5507071018218994, "learning_rate": 9.484552115439444e-07, "loss": 0.7344, "step": 422 }, { "epoch": 0.5414833186654933, "grad_norm": 1.0446666479110718, "learning_rate": 9.481660462673823e-07, "loss": 0.7256, "step": 423 }, { "epoch": 0.5427634210736859, "grad_norm": 0.9385281801223755, "learning_rate": 9.478761217123295e-07, "loss": 0.7245, "step": 424 }, { "epoch": 0.5440435234818786, "grad_norm": 1.086734414100647, "learning_rate": 9.475854384316545e-07, "loss": 0.7484, "step": 425 }, { "epoch": 0.5453236258900712, "grad_norm": 0.5415538549423218, "learning_rate": 9.47293996979673e-07, "loss": 0.7556, "step": 426 }, { "epoch": 0.5466037282982639, "grad_norm": 0.7452684640884399, "learning_rate": 9.470017979121457e-07, "loss": 0.7473, "step": 427 }, { "epoch": 0.5478838307064565, "grad_norm": 1.1576873064041138, "learning_rate": 9.467088417862788e-07, "loss": 0.7513, "step": 428 }, { "epoch": 0.5491639331146492, "grad_norm": 1.2372891902923584, "learning_rate": 9.464151291607218e-07, "loss": 0.7317, "step": 429 }, { "epoch": 0.5504440355228418, "grad_norm": 0.5363456010818481, "learning_rate": 9.46120660595567e-07, "loss": 0.7582, "step": 430 }, { "epoch": 0.5517241379310345, "grad_norm": 0.5811115503311157, "learning_rate": 9.458254366523476e-07, "loss": 0.7422, "step": 431 }, { "epoch": 0.5530042403392271, "grad_norm": 0.5572993755340576, "learning_rate": 9.455294578940383e-07, "loss": 0.7691, "step": 432 }, { "epoch": 0.5542843427474198, "grad_norm": 0.7215147614479065, "learning_rate": 9.452327248850524e-07, "loss": 0.7518, "step": 433 }, { "epoch": 0.5555644451556124, "grad_norm": 0.5483352541923523, "learning_rate": 9.449352381912418e-07, "loss": 0.7443, "step": 434 }, { "epoch": 0.5568445475638051, "grad_norm": 0.5988831520080566, "learning_rate": 9.446369983798953e-07, "loss": 0.7471, "step": 435 }, { "epoch": 0.5581246499719977, "grad_norm": 0.5931683778762817, "learning_rate": 9.443380060197385e-07, "loss": 0.758, "step": 436 }, { "epoch": 0.5594047523801904, "grad_norm": 1.4560576677322388, "learning_rate": 9.440382616809316e-07, "loss": 0.7587, "step": 437 }, { "epoch": 0.560684854788383, "grad_norm": 0.6931043863296509, "learning_rate": 9.437377659350687e-07, "loss": 0.7488, "step": 438 }, { "epoch": 0.5619649571965757, "grad_norm": 0.7342694997787476, "learning_rate": 9.434365193551772e-07, "loss": 0.7392, "step": 439 }, { "epoch": 0.5632450596047683, "grad_norm": 0.5165682435035706, "learning_rate": 9.431345225157156e-07, "loss": 0.758, "step": 440 }, { "epoch": 0.564525162012961, "grad_norm": 0.9768834710121155, "learning_rate": 9.428317759925741e-07, "loss": 0.7419, "step": 441 }, { "epoch": 0.5658052644211536, "grad_norm": 2.350641965866089, "learning_rate": 9.425282803630717e-07, "loss": 0.749, "step": 442 }, { "epoch": 0.5670853668293463, "grad_norm": 0.9259938597679138, "learning_rate": 9.422240362059562e-07, "loss": 0.7588, "step": 443 }, { "epoch": 0.5683654692375391, "grad_norm": 1.1114170551300049, "learning_rate": 9.419190441014024e-07, "loss": 0.7616, "step": 444 }, { "epoch": 0.5696455716457317, "grad_norm": 0.5118194222450256, "learning_rate": 9.416133046310124e-07, "loss": 0.7636, "step": 445 }, { "epoch": 0.5709256740539244, "grad_norm": 0.5194180011749268, "learning_rate": 9.413068183778122e-07, "loss": 0.7734, "step": 446 }, { "epoch": 0.572205776462117, "grad_norm": 0.9125135540962219, "learning_rate": 9.409995859262529e-07, "loss": 0.7524, "step": 447 }, { "epoch": 0.5734858788703097, "grad_norm": 1.2486809492111206, "learning_rate": 9.40691607862208e-07, "loss": 0.7557, "step": 448 }, { "epoch": 0.5747659812785023, "grad_norm": 2.0603342056274414, "learning_rate": 9.403828847729729e-07, "loss": 0.7431, "step": 449 }, { "epoch": 0.576046083686695, "grad_norm": 0.6177510619163513, "learning_rate": 9.400734172472638e-07, "loss": 0.7711, "step": 450 }, { "epoch": 0.576046083686695, "eval_loss": 0.02118189074099064, "eval_runtime": 42.4517, "eval_samples_per_second": 11.684, "eval_steps_per_second": 1.46, "step": 450 }, { "epoch": 0.5773261860948876, "grad_norm": 0.5658496022224426, "learning_rate": 9.397632058752167e-07, "loss": 0.7371, "step": 451 }, { "epoch": 0.5786062885030803, "grad_norm": 0.5370561480522156, "learning_rate": 9.394522512483857e-07, "loss": 0.7273, "step": 452 }, { "epoch": 0.5798863909112729, "grad_norm": 0.7203813195228577, "learning_rate": 9.391405539597423e-07, "loss": 0.7542, "step": 453 }, { "epoch": 0.5811664933194656, "grad_norm": 0.48172512650489807, "learning_rate": 9.388281146036745e-07, "loss": 0.7251, "step": 454 }, { "epoch": 0.5824465957276582, "grad_norm": 0.8438817262649536, "learning_rate": 9.385149337759853e-07, "loss": 0.7527, "step": 455 }, { "epoch": 0.5837266981358509, "grad_norm": 0.7123280763626099, "learning_rate": 9.382010120738913e-07, "loss": 0.7298, "step": 456 }, { "epoch": 0.5850068005440435, "grad_norm": 0.6132833361625671, "learning_rate": 9.378863500960222e-07, "loss": 0.719, "step": 457 }, { "epoch": 0.5862869029522362, "grad_norm": 0.8068387508392334, "learning_rate": 9.375709484424193e-07, "loss": 0.7549, "step": 458 }, { "epoch": 0.5875670053604288, "grad_norm": 0.7438022494316101, "learning_rate": 9.372548077145343e-07, "loss": 0.7253, "step": 459 }, { "epoch": 0.5888471077686215, "grad_norm": 0.6478850245475769, "learning_rate": 9.369379285152287e-07, "loss": 0.7664, "step": 460 }, { "epoch": 0.5901272101768141, "grad_norm": 0.8622910380363464, "learning_rate": 9.366203114487717e-07, "loss": 0.7279, "step": 461 }, { "epoch": 0.5914073125850068, "grad_norm": 1.5068285465240479, "learning_rate": 9.363019571208397e-07, "loss": 0.7575, "step": 462 }, { "epoch": 0.5926874149931994, "grad_norm": 1.7766551971435547, "learning_rate": 9.359828661385152e-07, "loss": 0.7382, "step": 463 }, { "epoch": 0.5939675174013921, "grad_norm": 1.5634602308273315, "learning_rate": 9.356630391102855e-07, "loss": 0.7336, "step": 464 }, { "epoch": 0.5952476198095847, "grad_norm": 1.3918403387069702, "learning_rate": 9.353424766460409e-07, "loss": 0.7622, "step": 465 }, { "epoch": 0.5965277222177774, "grad_norm": 0.91881263256073, "learning_rate": 9.35021179357075e-07, "loss": 0.7488, "step": 466 }, { "epoch": 0.59780782462597, "grad_norm": 0.9959621429443359, "learning_rate": 9.346991478560819e-07, "loss": 0.7457, "step": 467 }, { "epoch": 0.5990879270341627, "grad_norm": 1.7366260290145874, "learning_rate": 9.343763827571566e-07, "loss": 0.7359, "step": 468 }, { "epoch": 0.6003680294423553, "grad_norm": 1.0561470985412598, "learning_rate": 9.340528846757921e-07, "loss": 0.7328, "step": 469 }, { "epoch": 0.601648131850548, "grad_norm": 1.4831304550170898, "learning_rate": 9.337286542288797e-07, "loss": 0.7575, "step": 470 }, { "epoch": 0.6029282342587406, "grad_norm": 0.5210456848144531, "learning_rate": 9.334036920347073e-07, "loss": 0.7282, "step": 471 }, { "epoch": 0.6042083366669334, "grad_norm": 0.8331632018089294, "learning_rate": 9.33077998712958e-07, "loss": 0.7281, "step": 472 }, { "epoch": 0.6054884390751261, "grad_norm": 0.5809465050697327, "learning_rate": 9.327515748847093e-07, "loss": 0.7526, "step": 473 }, { "epoch": 0.6067685414833187, "grad_norm": 0.5814153552055359, "learning_rate": 9.324244211724315e-07, "loss": 0.7105, "step": 474 }, { "epoch": 0.6080486438915114, "grad_norm": 0.6324211359024048, "learning_rate": 9.320965381999871e-07, "loss": 0.7417, "step": 475 }, { "epoch": 0.609328746299704, "grad_norm": 0.9844563007354736, "learning_rate": 9.317679265926289e-07, "loss": 0.7387, "step": 476 }, { "epoch": 0.6106088487078967, "grad_norm": 1.100724220275879, "learning_rate": 9.31438586976999e-07, "loss": 0.7351, "step": 477 }, { "epoch": 0.6118889511160893, "grad_norm": 1.1082884073257446, "learning_rate": 9.311085199811286e-07, "loss": 0.7522, "step": 478 }, { "epoch": 0.613169053524282, "grad_norm": 0.6220473647117615, "learning_rate": 9.307777262344351e-07, "loss": 0.7475, "step": 479 }, { "epoch": 0.6144491559324746, "grad_norm": 1.1218664646148682, "learning_rate": 9.304462063677222e-07, "loss": 0.753, "step": 480 }, { "epoch": 0.6144491559324746, "eval_loss": 0.021100390702486038, "eval_runtime": 42.1514, "eval_samples_per_second": 11.767, "eval_steps_per_second": 1.471, "step": 480 }, { "epoch": 0.6157292583406673, "grad_norm": 0.5440327525138855, "learning_rate": 9.301139610131783e-07, "loss": 0.7434, "step": 481 }, { "epoch": 0.6170093607488599, "grad_norm": 0.5020488500595093, "learning_rate": 9.297809908043749e-07, "loss": 0.739, "step": 482 }, { "epoch": 0.6182894631570526, "grad_norm": 0.8104184865951538, "learning_rate": 9.29447296376266e-07, "loss": 0.7571, "step": 483 }, { "epoch": 0.6195695655652452, "grad_norm": 0.4955035150051117, "learning_rate": 9.291128783651868e-07, "loss": 0.7407, "step": 484 }, { "epoch": 0.6208496679734379, "grad_norm": 0.9866591095924377, "learning_rate": 9.28777737408852e-07, "loss": 0.7333, "step": 485 }, { "epoch": 0.6221297703816305, "grad_norm": 0.4790208041667938, "learning_rate": 9.284418741463552e-07, "loss": 0.7373, "step": 486 }, { "epoch": 0.6234098727898232, "grad_norm": 0.6627092361450195, "learning_rate": 9.28105289218167e-07, "loss": 0.7487, "step": 487 }, { "epoch": 0.6246899751980158, "grad_norm": 1.1126811504364014, "learning_rate": 9.277679832661347e-07, "loss": 0.729, "step": 488 }, { "epoch": 0.6259700776062085, "grad_norm": 0.9420062303543091, "learning_rate": 9.274299569334802e-07, "loss": 0.745, "step": 489 }, { "epoch": 0.6272501800144011, "grad_norm": 1.1584370136260986, "learning_rate": 9.270912108647993e-07, "loss": 0.7388, "step": 490 }, { "epoch": 0.6285302824225938, "grad_norm": 0.5413680076599121, "learning_rate": 9.267517457060599e-07, "loss": 0.7552, "step": 491 }, { "epoch": 0.6298103848307864, "grad_norm": 0.8540847897529602, "learning_rate": 9.26411562104602e-07, "loss": 0.737, "step": 492 }, { "epoch": 0.6310904872389791, "grad_norm": 1.9764920473098755, "learning_rate": 9.260706607091346e-07, "loss": 0.7271, "step": 493 }, { "epoch": 0.6323705896471717, "grad_norm": 0.5290267467498779, "learning_rate": 9.257290421697362e-07, "loss": 0.7184, "step": 494 }, { "epoch": 0.6336506920553644, "grad_norm": 0.563903272151947, "learning_rate": 9.253867071378524e-07, "loss": 0.7368, "step": 495 }, { "epoch": 0.634930794463557, "grad_norm": 0.6023145318031311, "learning_rate": 9.250436562662956e-07, "loss": 0.7573, "step": 496 }, { "epoch": 0.6362108968717497, "grad_norm": 0.6099826097488403, "learning_rate": 9.246998902092428e-07, "loss": 0.7526, "step": 497 }, { "epoch": 0.6374909992799423, "grad_norm": 0.5186932682991028, "learning_rate": 9.243554096222351e-07, "loss": 0.7235, "step": 498 }, { "epoch": 0.638771101688135, "grad_norm": 0.5785353183746338, "learning_rate": 9.240102151621763e-07, "loss": 0.7478, "step": 499 }, { "epoch": 0.6400512040963277, "grad_norm": 0.5067083239555359, "learning_rate": 9.236643074873308e-07, "loss": 0.7283, "step": 500 }, { "epoch": 0.6413313065045204, "grad_norm": 0.7413318157196045, "learning_rate": 9.233176872573241e-07, "loss": 0.7214, "step": 501 }, { "epoch": 0.6426114089127131, "grad_norm": 0.9167243838310242, "learning_rate": 9.229703551331393e-07, "loss": 0.72, "step": 502 }, { "epoch": 0.6438915113209057, "grad_norm": 1.0522778034210205, "learning_rate": 9.226223117771183e-07, "loss": 0.7348, "step": 503 }, { "epoch": 0.6451716137290984, "grad_norm": 0.6642094850540161, "learning_rate": 9.222735578529583e-07, "loss": 0.736, "step": 504 }, { "epoch": 0.646451716137291, "grad_norm": 0.8887587189674377, "learning_rate": 9.219240940257121e-07, "loss": 0.7305, "step": 505 }, { "epoch": 0.6477318185454837, "grad_norm": 0.9729070663452148, "learning_rate": 9.215739209617857e-07, "loss": 0.7488, "step": 506 }, { "epoch": 0.6490119209536763, "grad_norm": 0.8241427540779114, "learning_rate": 9.212230393289384e-07, "loss": 0.7415, "step": 507 }, { "epoch": 0.650292023361869, "grad_norm": 0.5997843742370605, "learning_rate": 9.208714497962796e-07, "loss": 0.7386, "step": 508 }, { "epoch": 0.6515721257700616, "grad_norm": 0.6482121348381042, "learning_rate": 9.205191530342696e-07, "loss": 0.7582, "step": 509 }, { "epoch": 0.6528522281782543, "grad_norm": 0.7210831046104431, "learning_rate": 9.201661497147167e-07, "loss": 0.7378, "step": 510 }, { "epoch": 0.6528522281782543, "eval_loss": 0.021014181897044182, "eval_runtime": 42.1053, "eval_samples_per_second": 11.78, "eval_steps_per_second": 1.473, "step": 510 }, { "epoch": 0.6541323305864469, "grad_norm": 0.7056831121444702, "learning_rate": 9.198124405107772e-07, "loss": 0.74, "step": 511 }, { "epoch": 0.6554124329946396, "grad_norm": 1.1995331048965454, "learning_rate": 9.194580260969525e-07, "loss": 0.7303, "step": 512 }, { "epoch": 0.6566925354028322, "grad_norm": 1.5269051790237427, "learning_rate": 9.191029071490897e-07, "loss": 0.7632, "step": 513 }, { "epoch": 0.6579726378110249, "grad_norm": 0.5763581395149231, "learning_rate": 9.187470843443794e-07, "loss": 0.7402, "step": 514 }, { "epoch": 0.6592527402192175, "grad_norm": 1.1235899925231934, "learning_rate": 9.183905583613535e-07, "loss": 0.7267, "step": 515 }, { "epoch": 0.6605328426274102, "grad_norm": 1.478568434715271, "learning_rate": 9.180333298798858e-07, "loss": 0.7591, "step": 516 }, { "epoch": 0.6618129450356028, "grad_norm": 0.718687117099762, "learning_rate": 9.176753995811893e-07, "loss": 0.7147, "step": 517 }, { "epoch": 0.6630930474437955, "grad_norm": 0.5757226943969727, "learning_rate": 9.173167681478152e-07, "loss": 0.7463, "step": 518 }, { "epoch": 0.6643731498519881, "grad_norm": 0.5394216179847717, "learning_rate": 9.169574362636521e-07, "loss": 0.7404, "step": 519 }, { "epoch": 0.6656532522601808, "grad_norm": 0.5092488527297974, "learning_rate": 9.165974046139239e-07, "loss": 0.7111, "step": 520 }, { "epoch": 0.6669333546683734, "grad_norm": 0.8180265426635742, "learning_rate": 9.162366738851892e-07, "loss": 0.73, "step": 521 }, { "epoch": 0.6682134570765661, "grad_norm": 1.7370868921279907, "learning_rate": 9.158752447653397e-07, "loss": 0.7355, "step": 522 }, { "epoch": 0.6694935594847587, "grad_norm": 0.7390193343162537, "learning_rate": 9.155131179435985e-07, "loss": 0.7386, "step": 523 }, { "epoch": 0.6707736618929514, "grad_norm": 1.0305149555206299, "learning_rate": 9.151502941105198e-07, "loss": 0.7417, "step": 524 }, { "epoch": 0.672053764301144, "grad_norm": 0.49237629771232605, "learning_rate": 9.147867739579865e-07, "loss": 0.7133, "step": 525 }, { "epoch": 0.6733338667093367, "grad_norm": 0.5576760768890381, "learning_rate": 9.144225581792097e-07, "loss": 0.7431, "step": 526 }, { "epoch": 0.6746139691175294, "grad_norm": 1.8849859237670898, "learning_rate": 9.140576474687263e-07, "loss": 0.7209, "step": 527 }, { "epoch": 0.675894071525722, "grad_norm": 0.7206259369850159, "learning_rate": 9.136920425223993e-07, "loss": 0.7342, "step": 528 }, { "epoch": 0.6771741739339147, "grad_norm": 0.5466733574867249, "learning_rate": 9.133257440374149e-07, "loss": 0.7246, "step": 529 }, { "epoch": 0.6784542763421074, "grad_norm": 0.6503171324729919, "learning_rate": 9.129587527122824e-07, "loss": 0.7364, "step": 530 }, { "epoch": 0.6797343787503001, "grad_norm": 0.5716297030448914, "learning_rate": 9.125910692468316e-07, "loss": 0.7477, "step": 531 }, { "epoch": 0.6810144811584927, "grad_norm": 2.306088447570801, "learning_rate": 9.122226943422129e-07, "loss": 0.7239, "step": 532 }, { "epoch": 0.6822945835666854, "grad_norm": 0.7810466885566711, "learning_rate": 9.118536287008946e-07, "loss": 0.7281, "step": 533 }, { "epoch": 0.683574685974878, "grad_norm": 0.5522501468658447, "learning_rate": 9.114838730266627e-07, "loss": 0.7405, "step": 534 }, { "epoch": 0.6848547883830707, "grad_norm": 0.6078072786331177, "learning_rate": 9.111134280246188e-07, "loss": 0.7348, "step": 535 }, { "epoch": 0.6861348907912633, "grad_norm": 0.5471058487892151, "learning_rate": 9.10742294401179e-07, "loss": 0.721, "step": 536 }, { "epoch": 0.687414993199456, "grad_norm": 1.0469000339508057, "learning_rate": 9.103704728640725e-07, "loss": 0.7325, "step": 537 }, { "epoch": 0.6886950956076486, "grad_norm": 0.8831820487976074, "learning_rate": 9.099979641223407e-07, "loss": 0.715, "step": 538 }, { "epoch": 0.6899751980158413, "grad_norm": 0.6320680975914001, "learning_rate": 9.096247688863347e-07, "loss": 0.7291, "step": 539 }, { "epoch": 0.6912553004240339, "grad_norm": 0.9754980206489563, "learning_rate": 9.092508878677156e-07, "loss": 0.7564, "step": 540 }, { "epoch": 0.6912553004240339, "eval_loss": 0.021045604720711708, "eval_runtime": 42.2539, "eval_samples_per_second": 11.739, "eval_steps_per_second": 1.467, "step": 540 }, { "epoch": 0.6925354028322266, "grad_norm": 1.4117339849472046, "learning_rate": 9.088763217794518e-07, "loss": 0.7423, "step": 541 }, { "epoch": 0.6938155052404192, "grad_norm": 1.0038983821868896, "learning_rate": 9.085010713358177e-07, "loss": 0.7174, "step": 542 }, { "epoch": 0.6950956076486119, "grad_norm": 0.5433626174926758, "learning_rate": 9.081251372523934e-07, "loss": 0.7449, "step": 543 }, { "epoch": 0.6963757100568045, "grad_norm": 0.8172720670700073, "learning_rate": 9.077485202460626e-07, "loss": 0.7149, "step": 544 }, { "epoch": 0.6976558124649972, "grad_norm": 2.134445905685425, "learning_rate": 9.073712210350108e-07, "loss": 0.7299, "step": 545 }, { "epoch": 0.6989359148731898, "grad_norm": 1.660037636756897, "learning_rate": 9.069932403387247e-07, "loss": 0.733, "step": 546 }, { "epoch": 0.7002160172813825, "grad_norm": 1.5447118282318115, "learning_rate": 9.066145788779906e-07, "loss": 0.7274, "step": 547 }, { "epoch": 0.7014961196895751, "grad_norm": 0.4776293933391571, "learning_rate": 9.06235237374893e-07, "loss": 0.7332, "step": 548 }, { "epoch": 0.7027762220977678, "grad_norm": 0.5387712121009827, "learning_rate": 9.05855216552813e-07, "loss": 0.7292, "step": 549 }, { "epoch": 0.7040563245059605, "grad_norm": 1.151238203048706, "learning_rate": 9.054745171364275e-07, "loss": 0.738, "step": 550 }, { "epoch": 0.7053364269141531, "grad_norm": 1.0059211254119873, "learning_rate": 9.050931398517069e-07, "loss": 0.733, "step": 551 }, { "epoch": 0.7066165293223458, "grad_norm": 1.5007776021957397, "learning_rate": 9.047110854259146e-07, "loss": 0.6961, "step": 552 }, { "epoch": 0.7078966317305384, "grad_norm": 0.4643494784832001, "learning_rate": 9.043283545876054e-07, "loss": 0.7356, "step": 553 }, { "epoch": 0.7091767341387311, "grad_norm": 0.446883887052536, "learning_rate": 9.039449480666235e-07, "loss": 0.7157, "step": 554 }, { "epoch": 0.7104568365469237, "grad_norm": 0.7078633904457092, "learning_rate": 9.035608665941021e-07, "loss": 0.7395, "step": 555 }, { "epoch": 0.7117369389551164, "grad_norm": 0.4792153239250183, "learning_rate": 9.03176110902461e-07, "loss": 0.7171, "step": 556 }, { "epoch": 0.713017041363309, "grad_norm": 0.7218549847602844, "learning_rate": 9.027906817254063e-07, "loss": 0.7246, "step": 557 }, { "epoch": 0.7142971437715018, "grad_norm": 0.47100692987442017, "learning_rate": 9.024045797979279e-07, "loss": 0.7246, "step": 558 }, { "epoch": 0.7155772461796944, "grad_norm": 0.46910184621810913, "learning_rate": 9.020178058562988e-07, "loss": 0.7192, "step": 559 }, { "epoch": 0.7168573485878871, "grad_norm": 0.4550006687641144, "learning_rate": 9.016303606380732e-07, "loss": 0.721, "step": 560 }, { "epoch": 0.7181374509960797, "grad_norm": 0.4870290458202362, "learning_rate": 9.01242244882086e-07, "loss": 0.7312, "step": 561 }, { "epoch": 0.7194175534042724, "grad_norm": 0.48211103677749634, "learning_rate": 9.0085345932845e-07, "loss": 0.7042, "step": 562 }, { "epoch": 0.720697655812465, "grad_norm": 0.47238773107528687, "learning_rate": 9.00464004718556e-07, "loss": 0.7517, "step": 563 }, { "epoch": 0.7219777582206577, "grad_norm": 0.7546138763427734, "learning_rate": 9.000738817950701e-07, "loss": 0.7024, "step": 564 }, { "epoch": 0.7232578606288503, "grad_norm": 1.1235212087631226, "learning_rate": 8.996830913019331e-07, "loss": 0.6948, "step": 565 }, { "epoch": 0.724537963037043, "grad_norm": 1.2268662452697754, "learning_rate": 8.99291633984359e-07, "loss": 0.7124, "step": 566 }, { "epoch": 0.7258180654452356, "grad_norm": 0.5037409067153931, "learning_rate": 8.988995105888325e-07, "loss": 0.7034, "step": 567 }, { "epoch": 0.7270981678534283, "grad_norm": 0.46896108984947205, "learning_rate": 8.985067218631098e-07, "loss": 0.7161, "step": 568 }, { "epoch": 0.7283782702616209, "grad_norm": 0.7797430753707886, "learning_rate": 8.981132685562149e-07, "loss": 0.736, "step": 569 }, { "epoch": 0.7296583726698136, "grad_norm": 0.5098110437393188, "learning_rate": 8.977191514184394e-07, "loss": 0.7143, "step": 570 }, { "epoch": 0.7296583726698136, "eval_loss": 0.020963987335562706, "eval_runtime": 42.202, "eval_samples_per_second": 11.753, "eval_steps_per_second": 1.469, "step": 570 }, { "epoch": 0.7309384750780062, "grad_norm": 0.8123798370361328, "learning_rate": 8.973243712013406e-07, "loss": 0.7123, "step": 571 }, { "epoch": 0.7322185774861989, "grad_norm": 0.7426872849464417, "learning_rate": 8.969289286577407e-07, "loss": 0.7211, "step": 572 }, { "epoch": 0.7334986798943915, "grad_norm": 1.2957710027694702, "learning_rate": 8.965328245417245e-07, "loss": 0.7192, "step": 573 }, { "epoch": 0.7347787823025842, "grad_norm": 0.4550981819629669, "learning_rate": 8.961360596086386e-07, "loss": 0.7158, "step": 574 }, { "epoch": 0.7360588847107769, "grad_norm": 0.480466365814209, "learning_rate": 8.957386346150897e-07, "loss": 0.7347, "step": 575 }, { "epoch": 0.7373389871189695, "grad_norm": 1.2301396131515503, "learning_rate": 8.953405503189427e-07, "loss": 0.7257, "step": 576 }, { "epoch": 0.7386190895271622, "grad_norm": 0.7805120944976807, "learning_rate": 8.949418074793208e-07, "loss": 0.7206, "step": 577 }, { "epoch": 0.7398991919353548, "grad_norm": 1.688595175743103, "learning_rate": 8.945424068566019e-07, "loss": 0.7201, "step": 578 }, { "epoch": 0.7411792943435475, "grad_norm": 1.5483627319335938, "learning_rate": 8.941423492124193e-07, "loss": 0.7298, "step": 579 }, { "epoch": 0.7424593967517401, "grad_norm": 0.7737287878990173, "learning_rate": 8.937416353096582e-07, "loss": 0.7192, "step": 580 }, { "epoch": 0.7437394991599328, "grad_norm": 0.4787493646144867, "learning_rate": 8.933402659124557e-07, "loss": 0.7268, "step": 581 }, { "epoch": 0.7450196015681254, "grad_norm": 0.5913535952568054, "learning_rate": 8.92938241786199e-07, "loss": 0.7195, "step": 582 }, { "epoch": 0.7462997039763181, "grad_norm": 1.0094797611236572, "learning_rate": 8.92535563697524e-07, "loss": 0.7332, "step": 583 }, { "epoch": 0.7475798063845107, "grad_norm": 0.9704792499542236, "learning_rate": 8.921322324143129e-07, "loss": 0.7487, "step": 584 }, { "epoch": 0.7488599087927034, "grad_norm": 0.5868096947669983, "learning_rate": 8.917282487056943e-07, "loss": 0.7229, "step": 585 }, { "epoch": 0.750140011200896, "grad_norm": 0.4691717326641083, "learning_rate": 8.913236133420404e-07, "loss": 0.707, "step": 586 }, { "epoch": 0.7514201136090888, "grad_norm": 0.5251399278640747, "learning_rate": 8.909183270949667e-07, "loss": 0.7243, "step": 587 }, { "epoch": 0.7527002160172814, "grad_norm": 0.5538453459739685, "learning_rate": 8.905123907373289e-07, "loss": 0.7297, "step": 588 }, { "epoch": 0.7539803184254741, "grad_norm": 0.48969927430152893, "learning_rate": 8.901058050432234e-07, "loss": 0.7194, "step": 589 }, { "epoch": 0.7552604208336667, "grad_norm": 0.4564533531665802, "learning_rate": 8.896985707879844e-07, "loss": 0.7324, "step": 590 }, { "epoch": 0.7565405232418594, "grad_norm": 0.6064324378967285, "learning_rate": 8.892906887481828e-07, "loss": 0.7237, "step": 591 }, { "epoch": 0.757820625650052, "grad_norm": 0.7682381272315979, "learning_rate": 8.88882159701625e-07, "loss": 0.7391, "step": 592 }, { "epoch": 0.7591007280582447, "grad_norm": 1.681577444076538, "learning_rate": 8.884729844273509e-07, "loss": 0.7166, "step": 593 }, { "epoch": 0.7603808304664373, "grad_norm": 1.346693515777588, "learning_rate": 8.880631637056331e-07, "loss": 0.7153, "step": 594 }, { "epoch": 0.76166093287463, "grad_norm": 0.47442230582237244, "learning_rate": 8.876526983179749e-07, "loss": 0.7147, "step": 595 }, { "epoch": 0.7629410352828226, "grad_norm": 0.7667444348335266, "learning_rate": 8.872415890471089e-07, "loss": 0.7119, "step": 596 }, { "epoch": 0.7642211376910153, "grad_norm": 0.44476452469825745, "learning_rate": 8.868298366769954e-07, "loss": 0.7079, "step": 597 }, { "epoch": 0.765501240099208, "grad_norm": 1.343685507774353, "learning_rate": 8.864174419928213e-07, "loss": 0.7305, "step": 598 }, { "epoch": 0.7667813425074006, "grad_norm": 1.8725303411483765, "learning_rate": 8.860044057809981e-07, "loss": 0.722, "step": 599 }, { "epoch": 0.7680614449155932, "grad_norm": 0.7503852844238281, "learning_rate": 8.855907288291608e-07, "loss": 0.6865, "step": 600 }, { "epoch": 0.7680614449155932, "eval_loss": 0.020904021337628365, "eval_runtime": 42.1826, "eval_samples_per_second": 11.758, "eval_steps_per_second": 1.47, "step": 600 }, { "epoch": 0.7693415473237859, "grad_norm": 1.1681547164916992, "learning_rate": 8.851764119261666e-07, "loss": 0.707, "step": 601 }, { "epoch": 0.7706216497319786, "grad_norm": 1.4232583045959473, "learning_rate": 8.847614558620922e-07, "loss": 0.7351, "step": 602 }, { "epoch": 0.7719017521401712, "grad_norm": 2.3306655883789062, "learning_rate": 8.843458614282339e-07, "loss": 0.7207, "step": 603 }, { "epoch": 0.7731818545483639, "grad_norm": 2.485917806625366, "learning_rate": 8.83929629417105e-07, "loss": 0.7007, "step": 604 }, { "epoch": 0.7744619569565565, "grad_norm": 1.5995652675628662, "learning_rate": 8.835127606224347e-07, "loss": 0.695, "step": 605 }, { "epoch": 0.7757420593647492, "grad_norm": 0.7365001440048218, "learning_rate": 8.830952558391665e-07, "loss": 0.7108, "step": 606 }, { "epoch": 0.7770221617729418, "grad_norm": 0.43921002745628357, "learning_rate": 8.826771158634566e-07, "loss": 0.7179, "step": 607 }, { "epoch": 0.7783022641811345, "grad_norm": 0.5380148887634277, "learning_rate": 8.822583414926728e-07, "loss": 0.7096, "step": 608 }, { "epoch": 0.7795823665893271, "grad_norm": 2.004121780395508, "learning_rate": 8.818389335253922e-07, "loss": 0.7238, "step": 609 }, { "epoch": 0.7808624689975198, "grad_norm": 1.0534472465515137, "learning_rate": 8.814188927614004e-07, "loss": 0.737, "step": 610 }, { "epoch": 0.7821425714057124, "grad_norm": 0.4470048248767853, "learning_rate": 8.809982200016897e-07, "loss": 0.7108, "step": 611 }, { "epoch": 0.7834226738139051, "grad_norm": 0.5981615781784058, "learning_rate": 8.805769160484576e-07, "loss": 0.7215, "step": 612 }, { "epoch": 0.7847027762220977, "grad_norm": 1.2785091400146484, "learning_rate": 8.801549817051051e-07, "loss": 0.6946, "step": 613 }, { "epoch": 0.7859828786302904, "grad_norm": 1.0147285461425781, "learning_rate": 8.797324177762351e-07, "loss": 0.7352, "step": 614 }, { "epoch": 0.7872629810384831, "grad_norm": 1.4566447734832764, "learning_rate": 8.793092250676518e-07, "loss": 0.7145, "step": 615 }, { "epoch": 0.7885430834466758, "grad_norm": 1.7534832954406738, "learning_rate": 8.788854043863578e-07, "loss": 0.7098, "step": 616 }, { "epoch": 0.7898231858548684, "grad_norm": 0.7456167340278625, "learning_rate": 8.784609565405534e-07, "loss": 0.6876, "step": 617 }, { "epoch": 0.7911032882630611, "grad_norm": 0.4770120084285736, "learning_rate": 8.780358823396352e-07, "loss": 0.7202, "step": 618 }, { "epoch": 0.7923833906712537, "grad_norm": 1.1301631927490234, "learning_rate": 8.776101825941935e-07, "loss": 0.7315, "step": 619 }, { "epoch": 0.7936634930794464, "grad_norm": 1.1479843854904175, "learning_rate": 8.77183858116012e-07, "loss": 0.7104, "step": 620 }, { "epoch": 0.794943595487639, "grad_norm": 0.7247928977012634, "learning_rate": 8.767569097180658e-07, "loss": 0.7053, "step": 621 }, { "epoch": 0.7962236978958317, "grad_norm": 0.6144221425056458, "learning_rate": 8.763293382145193e-07, "loss": 0.7183, "step": 622 }, { "epoch": 0.7975038003040243, "grad_norm": 0.7315794229507446, "learning_rate": 8.759011444207257e-07, "loss": 0.7276, "step": 623 }, { "epoch": 0.798783902712217, "grad_norm": 0.46502548456192017, "learning_rate": 8.754723291532245e-07, "loss": 0.6886, "step": 624 }, { "epoch": 0.8000640051204096, "grad_norm": 0.8581224679946899, "learning_rate": 8.750428932297403e-07, "loss": 0.7048, "step": 625 }, { "epoch": 0.8013441075286023, "grad_norm": 1.4743561744689941, "learning_rate": 8.746128374691812e-07, "loss": 0.721, "step": 626 }, { "epoch": 0.802624209936795, "grad_norm": 0.47782769799232483, "learning_rate": 8.741821626916378e-07, "loss": 0.6966, "step": 627 }, { "epoch": 0.8039043123449876, "grad_norm": 1.0734385251998901, "learning_rate": 8.737508697183806e-07, "loss": 0.7256, "step": 628 }, { "epoch": 0.8051844147531803, "grad_norm": 0.4739302396774292, "learning_rate": 8.733189593718591e-07, "loss": 0.7109, "step": 629 }, { "epoch": 0.8064645171613729, "grad_norm": 0.46767228841781616, "learning_rate": 8.728864324757001e-07, "loss": 0.709, "step": 630 }, { "epoch": 0.8064645171613729, "eval_loss": 0.020846327766776085, "eval_runtime": 42.128, "eval_samples_per_second": 11.774, "eval_steps_per_second": 1.472, "step": 630 }, { "epoch": 0.8077446195695656, "grad_norm": 0.49929046630859375, "learning_rate": 8.724532898547064e-07, "loss": 0.6901, "step": 631 }, { "epoch": 0.8090247219777582, "grad_norm": 0.559801459312439, "learning_rate": 8.720195323348545e-07, "loss": 0.7107, "step": 632 }, { "epoch": 0.8103048243859509, "grad_norm": 0.45311835408210754, "learning_rate": 8.715851607432934e-07, "loss": 0.7216, "step": 633 }, { "epoch": 0.8115849267941435, "grad_norm": 0.430759072303772, "learning_rate": 8.711501759083439e-07, "loss": 0.7066, "step": 634 }, { "epoch": 0.8128650292023362, "grad_norm": 0.5016859173774719, "learning_rate": 8.707145786594953e-07, "loss": 0.7024, "step": 635 }, { "epoch": 0.8141451316105288, "grad_norm": 0.6638745665550232, "learning_rate": 8.702783698274053e-07, "loss": 0.7182, "step": 636 }, { "epoch": 0.8154252340187215, "grad_norm": 0.7069580554962158, "learning_rate": 8.698415502438976e-07, "loss": 0.7043, "step": 637 }, { "epoch": 0.8167053364269141, "grad_norm": 1.0888609886169434, "learning_rate": 8.694041207419607e-07, "loss": 0.7193, "step": 638 }, { "epoch": 0.8179854388351068, "grad_norm": 1.4110472202301025, "learning_rate": 8.689660821557462e-07, "loss": 0.6981, "step": 639 }, { "epoch": 0.8192655412432994, "grad_norm": 0.43904000520706177, "learning_rate": 8.685274353205667e-07, "loss": 0.6846, "step": 640 }, { "epoch": 0.8205456436514921, "grad_norm": 0.7627870440483093, "learning_rate": 8.680881810728957e-07, "loss": 0.6868, "step": 641 }, { "epoch": 0.8218257460596847, "grad_norm": 1.317055583000183, "learning_rate": 8.676483202503638e-07, "loss": 0.7147, "step": 642 }, { "epoch": 0.8231058484678774, "grad_norm": 1.6329659223556519, "learning_rate": 8.672078536917595e-07, "loss": 0.7211, "step": 643 }, { "epoch": 0.8243859508760701, "grad_norm": 1.2406091690063477, "learning_rate": 8.667667822370251e-07, "loss": 0.6931, "step": 644 }, { "epoch": 0.8256660532842628, "grad_norm": 1.26050865650177, "learning_rate": 8.663251067272578e-07, "loss": 0.7095, "step": 645 }, { "epoch": 0.8269461556924554, "grad_norm": 0.6402028203010559, "learning_rate": 8.658828280047056e-07, "loss": 0.6943, "step": 646 }, { "epoch": 0.8282262581006481, "grad_norm": 0.8078739643096924, "learning_rate": 8.654399469127672e-07, "loss": 0.7088, "step": 647 }, { "epoch": 0.8295063605088407, "grad_norm": 1.8825105428695679, "learning_rate": 8.6499646429599e-07, "loss": 0.7388, "step": 648 }, { "epoch": 0.8307864629170334, "grad_norm": 0.7009708285331726, "learning_rate": 8.645523810000685e-07, "loss": 0.7079, "step": 649 }, { "epoch": 0.832066565325226, "grad_norm": 0.7658326625823975, "learning_rate": 8.641076978718427e-07, "loss": 0.6796, "step": 650 }, { "epoch": 0.8333466677334187, "grad_norm": 2.1865885257720947, "learning_rate": 8.636624157592963e-07, "loss": 0.7026, "step": 651 }, { "epoch": 0.8346267701416114, "grad_norm": 0.48259398341178894, "learning_rate": 8.632165355115551e-07, "loss": 0.7203, "step": 652 }, { "epoch": 0.835906872549804, "grad_norm": 1.0302852392196655, "learning_rate": 8.627700579788857e-07, "loss": 0.7042, "step": 653 }, { "epoch": 0.8371869749579967, "grad_norm": 2.316915988922119, "learning_rate": 8.623229840126938e-07, "loss": 0.708, "step": 654 }, { "epoch": 0.8384670773661893, "grad_norm": 2.140012741088867, "learning_rate": 8.618753144655223e-07, "loss": 0.7121, "step": 655 }, { "epoch": 0.839747179774382, "grad_norm": 1.511641263961792, "learning_rate": 8.614270501910498e-07, "loss": 0.6954, "step": 656 }, { "epoch": 0.8410272821825746, "grad_norm": 2.2881247997283936, "learning_rate": 8.609781920440891e-07, "loss": 0.709, "step": 657 }, { "epoch": 0.8423073845907673, "grad_norm": 0.43974825739860535, "learning_rate": 8.605287408805853e-07, "loss": 0.7193, "step": 658 }, { "epoch": 0.8435874869989599, "grad_norm": 1.2356144189834595, "learning_rate": 8.600786975576149e-07, "loss": 0.7252, "step": 659 }, { "epoch": 0.8448675894071526, "grad_norm": 0.6315829753875732, "learning_rate": 8.596280629333828e-07, "loss": 0.7161, "step": 660 }, { "epoch": 0.8448675894071526, "eval_loss": 0.02066558413207531, "eval_runtime": 41.788, "eval_samples_per_second": 11.869, "eval_steps_per_second": 1.484, "step": 660 }, { "epoch": 0.8461476918153452, "grad_norm": 1.5567103624343872, "learning_rate": 8.591768378672221e-07, "loss": 0.6695, "step": 661 }, { "epoch": 0.8474277942235379, "grad_norm": 2.070467233657837, "learning_rate": 8.587250232195916e-07, "loss": 0.7043, "step": 662 }, { "epoch": 0.8487078966317305, "grad_norm": 1.451274037361145, "learning_rate": 8.582726198520744e-07, "loss": 0.7213, "step": 663 }, { "epoch": 0.8499879990399232, "grad_norm": 0.4336334764957428, "learning_rate": 8.578196286273761e-07, "loss": 0.6952, "step": 664 }, { "epoch": 0.8512681014481158, "grad_norm": 0.650758683681488, "learning_rate": 8.573660504093237e-07, "loss": 0.7169, "step": 665 }, { "epoch": 0.8525482038563085, "grad_norm": 1.487292766571045, "learning_rate": 8.569118860628632e-07, "loss": 0.7013, "step": 666 }, { "epoch": 0.8538283062645011, "grad_norm": 0.8874569535255432, "learning_rate": 8.564571364540587e-07, "loss": 0.6976, "step": 667 }, { "epoch": 0.8551084086726938, "grad_norm": 0.9208166003227234, "learning_rate": 8.560018024500898e-07, "loss": 0.7003, "step": 668 }, { "epoch": 0.8563885110808864, "grad_norm": 1.112074851989746, "learning_rate": 8.555458849192511e-07, "loss": 0.6992, "step": 669 }, { "epoch": 0.8576686134890791, "grad_norm": 1.0922183990478516, "learning_rate": 8.550893847309494e-07, "loss": 0.7247, "step": 670 }, { "epoch": 0.8589487158972717, "grad_norm": 0.9542738199234009, "learning_rate": 8.54632302755703e-07, "loss": 0.6641, "step": 671 }, { "epoch": 0.8602288183054644, "grad_norm": 0.43373188376426697, "learning_rate": 8.541746398651394e-07, "loss": 0.7027, "step": 672 }, { "epoch": 0.8615089207136571, "grad_norm": 1.45198655128479, "learning_rate": 8.537163969319941e-07, "loss": 0.7067, "step": 673 }, { "epoch": 0.8627890231218498, "grad_norm": 0.8665236830711365, "learning_rate": 8.532575748301085e-07, "loss": 0.7037, "step": 674 }, { "epoch": 0.8640691255300424, "grad_norm": 0.9434092044830322, "learning_rate": 8.527981744344285e-07, "loss": 0.6965, "step": 675 }, { "epoch": 0.8653492279382351, "grad_norm": 0.7929328083992004, "learning_rate": 8.523381966210029e-07, "loss": 0.6902, "step": 676 }, { "epoch": 0.8666293303464278, "grad_norm": 0.812193751335144, "learning_rate": 8.518776422669813e-07, "loss": 0.7193, "step": 677 }, { "epoch": 0.8679094327546204, "grad_norm": 0.4908401072025299, "learning_rate": 8.51416512250613e-07, "loss": 0.6984, "step": 678 }, { "epoch": 0.869189535162813, "grad_norm": 0.7368214130401611, "learning_rate": 8.509548074512448e-07, "loss": 0.6998, "step": 679 }, { "epoch": 0.8704696375710057, "grad_norm": 0.7631279826164246, "learning_rate": 8.504925287493201e-07, "loss": 0.7062, "step": 680 }, { "epoch": 0.8717497399791984, "grad_norm": 0.4298534095287323, "learning_rate": 8.500296770263761e-07, "loss": 0.6979, "step": 681 }, { "epoch": 0.873029842387391, "grad_norm": 0.7171966433525085, "learning_rate": 8.495662531650429e-07, "loss": 0.6987, "step": 682 }, { "epoch": 0.8743099447955837, "grad_norm": 0.7361424565315247, "learning_rate": 8.491022580490416e-07, "loss": 0.6965, "step": 683 }, { "epoch": 0.8755900472037763, "grad_norm": 1.069417953491211, "learning_rate": 8.486376925631829e-07, "loss": 0.6966, "step": 684 }, { "epoch": 0.876870149611969, "grad_norm": 1.014566421508789, "learning_rate": 8.481725575933651e-07, "loss": 0.7064, "step": 685 }, { "epoch": 0.8781502520201616, "grad_norm": 0.5789030194282532, "learning_rate": 8.477068540265722e-07, "loss": 0.6808, "step": 686 }, { "epoch": 0.8794303544283543, "grad_norm": 0.7499472498893738, "learning_rate": 8.472405827508726e-07, "loss": 0.6495, "step": 687 }, { "epoch": 0.8807104568365469, "grad_norm": 1.3741114139556885, "learning_rate": 8.467737446554175e-07, "loss": 0.6857, "step": 688 }, { "epoch": 0.8819905592447396, "grad_norm": 0.5105960369110107, "learning_rate": 8.463063406304388e-07, "loss": 0.682, "step": 689 }, { "epoch": 0.8832706616529322, "grad_norm": 1.9599547386169434, "learning_rate": 8.458383715672474e-07, "loss": 0.68, "step": 690 }, { "epoch": 0.8832706616529322, "eval_loss": 0.020671645179390907, "eval_runtime": 41.8896, "eval_samples_per_second": 11.841, "eval_steps_per_second": 1.48, "step": 690 }, { "epoch": 0.8845507640611249, "grad_norm": 1.9888514280319214, "learning_rate": 8.453698383582322e-07, "loss": 0.6892, "step": 691 }, { "epoch": 0.8858308664693175, "grad_norm": 0.470649391412735, "learning_rate": 8.449007418968574e-07, "loss": 0.6826, "step": 692 }, { "epoch": 0.8871109688775102, "grad_norm": 1.6899157762527466, "learning_rate": 8.444310830776615e-07, "loss": 0.6939, "step": 693 }, { "epoch": 0.8883910712857028, "grad_norm": 0.6090466380119324, "learning_rate": 8.439608627962555e-07, "loss": 0.722, "step": 694 }, { "epoch": 0.8896711736938955, "grad_norm": 1.117171287536621, "learning_rate": 8.434900819493208e-07, "loss": 0.7126, "step": 695 }, { "epoch": 0.8909512761020881, "grad_norm": 0.5952681303024292, "learning_rate": 8.430187414346081e-07, "loss": 0.707, "step": 696 }, { "epoch": 0.8922313785102808, "grad_norm": 0.7138329744338989, "learning_rate": 8.425468421509349e-07, "loss": 0.698, "step": 697 }, { "epoch": 0.8935114809184734, "grad_norm": 0.7613462805747986, "learning_rate": 8.420743849981846e-07, "loss": 0.7157, "step": 698 }, { "epoch": 0.8947915833266661, "grad_norm": 1.353546380996704, "learning_rate": 8.416013708773045e-07, "loss": 0.7067, "step": 699 }, { "epoch": 0.8960716857348587, "grad_norm": 1.7249506711959839, "learning_rate": 8.411278006903035e-07, "loss": 0.7181, "step": 700 }, { "epoch": 0.8973517881430515, "grad_norm": 0.4556410312652588, "learning_rate": 8.406536753402516e-07, "loss": 0.7055, "step": 701 }, { "epoch": 0.8986318905512442, "grad_norm": 0.6553078889846802, "learning_rate": 8.401789957312767e-07, "loss": 0.6982, "step": 702 }, { "epoch": 0.8999119929594368, "grad_norm": 0.610336184501648, "learning_rate": 8.397037627685642e-07, "loss": 0.7138, "step": 703 }, { "epoch": 0.9011920953676295, "grad_norm": 2.2346596717834473, "learning_rate": 8.392279773583548e-07, "loss": 0.7007, "step": 704 }, { "epoch": 0.9024721977758221, "grad_norm": 2.556217908859253, "learning_rate": 8.387516404079418e-07, "loss": 0.7014, "step": 705 }, { "epoch": 0.9037523001840148, "grad_norm": 1.461926817893982, "learning_rate": 8.382747528256712e-07, "loss": 0.6999, "step": 706 }, { "epoch": 0.9050324025922074, "grad_norm": 2.0974724292755127, "learning_rate": 8.377973155209387e-07, "loss": 0.6872, "step": 707 }, { "epoch": 0.9063125050004001, "grad_norm": 1.515280842781067, "learning_rate": 8.373193294041883e-07, "loss": 0.6979, "step": 708 }, { "epoch": 0.9075926074085927, "grad_norm": 0.5150478482246399, "learning_rate": 8.368407953869103e-07, "loss": 0.6961, "step": 709 }, { "epoch": 0.9088727098167854, "grad_norm": 1.1151423454284668, "learning_rate": 8.363617143816403e-07, "loss": 0.7083, "step": 710 }, { "epoch": 0.910152812224978, "grad_norm": 2.0105602741241455, "learning_rate": 8.358820873019566e-07, "loss": 0.6945, "step": 711 }, { "epoch": 0.9114329146331707, "grad_norm": 3.009431838989258, "learning_rate": 8.354019150624789e-07, "loss": 0.7127, "step": 712 }, { "epoch": 0.9127130170413633, "grad_norm": 2.1113877296447754, "learning_rate": 8.349211985788665e-07, "loss": 0.6989, "step": 713 }, { "epoch": 0.913993119449556, "grad_norm": 1.300072431564331, "learning_rate": 8.344399387678167e-07, "loss": 0.6921, "step": 714 }, { "epoch": 0.9152732218577486, "grad_norm": 0.668084442615509, "learning_rate": 8.339581365470628e-07, "loss": 0.6926, "step": 715 }, { "epoch": 0.9165533242659413, "grad_norm": 0.7307219505310059, "learning_rate": 8.334757928353721e-07, "loss": 0.7219, "step": 716 }, { "epoch": 0.9178334266741339, "grad_norm": 1.6746070384979248, "learning_rate": 8.32992908552545e-07, "loss": 0.6786, "step": 717 }, { "epoch": 0.9191135290823266, "grad_norm": 1.3060693740844727, "learning_rate": 8.325094846194125e-07, "loss": 0.7143, "step": 718 }, { "epoch": 0.9203936314905192, "grad_norm": 0.8237175345420837, "learning_rate": 8.320255219578348e-07, "loss": 0.7208, "step": 719 }, { "epoch": 0.9216737338987119, "grad_norm": 0.4684383273124695, "learning_rate": 8.31541021490699e-07, "loss": 0.6995, "step": 720 }, { "epoch": 0.9216737338987119, "eval_loss": 0.020728060975670815, "eval_runtime": 42.0998, "eval_samples_per_second": 11.782, "eval_steps_per_second": 1.473, "step": 720 }, { "epoch": 0.9229538363069045, "grad_norm": 0.7679601311683655, "learning_rate": 8.310559841419186e-07, "loss": 0.7004, "step": 721 }, { "epoch": 0.9242339387150972, "grad_norm": 2.2562859058380127, "learning_rate": 8.305704108364301e-07, "loss": 0.7278, "step": 722 }, { "epoch": 0.9255140411232898, "grad_norm": 1.769775390625, "learning_rate": 8.300843025001922e-07, "loss": 0.7002, "step": 723 }, { "epoch": 0.9267941435314825, "grad_norm": 1.0874029397964478, "learning_rate": 8.295976600601843e-07, "loss": 0.6757, "step": 724 }, { "epoch": 0.9280742459396751, "grad_norm": 0.5694004893302917, "learning_rate": 8.291104844444037e-07, "loss": 0.6945, "step": 725 }, { "epoch": 0.9293543483478678, "grad_norm": 0.6500946283340454, "learning_rate": 8.286227765818652e-07, "loss": 0.698, "step": 726 }, { "epoch": 0.9306344507560604, "grad_norm": 0.42796462774276733, "learning_rate": 8.281345374025975e-07, "loss": 0.6944, "step": 727 }, { "epoch": 0.9319145531642531, "grad_norm": 0.4301977753639221, "learning_rate": 8.276457678376435e-07, "loss": 0.6792, "step": 728 }, { "epoch": 0.9331946555724457, "grad_norm": 0.5018278956413269, "learning_rate": 8.27156468819057e-07, "loss": 0.6967, "step": 729 }, { "epoch": 0.9344747579806385, "grad_norm": 0.48157456517219543, "learning_rate": 8.266666412799015e-07, "loss": 0.7185, "step": 730 }, { "epoch": 0.9357548603888312, "grad_norm": 0.6853249073028564, "learning_rate": 8.261762861542484e-07, "loss": 0.7031, "step": 731 }, { "epoch": 0.9370349627970238, "grad_norm": 0.6446681618690491, "learning_rate": 8.256854043771753e-07, "loss": 0.689, "step": 732 }, { "epoch": 0.9383150652052165, "grad_norm": 0.42960432171821594, "learning_rate": 8.251939968847638e-07, "loss": 0.6707, "step": 733 }, { "epoch": 0.9395951676134091, "grad_norm": 0.6173332929611206, "learning_rate": 8.247020646140983e-07, "loss": 0.7159, "step": 734 }, { "epoch": 0.9408752700216018, "grad_norm": 1.5238192081451416, "learning_rate": 8.242096085032637e-07, "loss": 0.7032, "step": 735 }, { "epoch": 0.9421553724297944, "grad_norm": 0.4899429678916931, "learning_rate": 8.237166294913438e-07, "loss": 0.7158, "step": 736 }, { "epoch": 0.9434354748379871, "grad_norm": 0.4923379123210907, "learning_rate": 8.2322312851842e-07, "loss": 0.7051, "step": 737 }, { "epoch": 0.9447155772461797, "grad_norm": 0.41801315546035767, "learning_rate": 8.227291065255685e-07, "loss": 0.6934, "step": 738 }, { "epoch": 0.9459956796543724, "grad_norm": 0.6234742999076843, "learning_rate": 8.222345644548593e-07, "loss": 0.7116, "step": 739 }, { "epoch": 0.947275782062565, "grad_norm": 1.1815129518508911, "learning_rate": 8.217395032493541e-07, "loss": 0.6935, "step": 740 }, { "epoch": 0.9485558844707577, "grad_norm": 0.8116170167922974, "learning_rate": 8.212439238531044e-07, "loss": 0.711, "step": 741 }, { "epoch": 0.9498359868789503, "grad_norm": 0.934303343296051, "learning_rate": 8.207478272111505e-07, "loss": 0.7122, "step": 742 }, { "epoch": 0.951116089287143, "grad_norm": 0.4953675866127014, "learning_rate": 8.20251214269518e-07, "loss": 0.678, "step": 743 }, { "epoch": 0.9523961916953356, "grad_norm": 1.1606484651565552, "learning_rate": 8.197540859752182e-07, "loss": 0.7059, "step": 744 }, { "epoch": 0.9536762941035283, "grad_norm": 0.9235550165176392, "learning_rate": 8.192564432762444e-07, "loss": 0.696, "step": 745 }, { "epoch": 0.9549563965117209, "grad_norm": 0.7705326080322266, "learning_rate": 8.18758287121571e-07, "loss": 0.689, "step": 746 }, { "epoch": 0.9562364989199136, "grad_norm": 0.7169274687767029, "learning_rate": 8.182596184611513e-07, "loss": 0.6952, "step": 747 }, { "epoch": 0.9575166013281062, "grad_norm": 0.45125555992126465, "learning_rate": 8.177604382459166e-07, "loss": 0.7047, "step": 748 }, { "epoch": 0.9587967037362989, "grad_norm": 1.7524336576461792, "learning_rate": 8.17260747427773e-07, "loss": 0.6784, "step": 749 }, { "epoch": 0.9600768061444915, "grad_norm": 0.49168533086776733, "learning_rate": 8.16760546959601e-07, "loss": 0.681, "step": 750 }, { "epoch": 0.9600768061444915, "eval_loss": 0.02064095437526703, "eval_runtime": 42.0421, "eval_samples_per_second": 11.798, "eval_steps_per_second": 1.475, "step": 750 }, { "epoch": 0.9613569085526842, "grad_norm": 0.9633902311325073, "learning_rate": 8.16259837795252e-07, "loss": 0.6902, "step": 751 }, { "epoch": 0.9626370109608768, "grad_norm": 0.4495463967323303, "learning_rate": 8.157586208895483e-07, "loss": 0.7187, "step": 752 }, { "epoch": 0.9639171133690695, "grad_norm": 0.6116464138031006, "learning_rate": 8.152568971982799e-07, "loss": 0.6658, "step": 753 }, { "epoch": 0.9651972157772621, "grad_norm": 0.987603485584259, "learning_rate": 8.147546676782038e-07, "loss": 0.6987, "step": 754 }, { "epoch": 0.9664773181854548, "grad_norm": 0.7416115999221802, "learning_rate": 8.142519332870408e-07, "loss": 0.6825, "step": 755 }, { "epoch": 0.9677574205936474, "grad_norm": 0.7779791355133057, "learning_rate": 8.137486949834752e-07, "loss": 0.6906, "step": 756 }, { "epoch": 0.9690375230018401, "grad_norm": 0.9663521647453308, "learning_rate": 8.132449537271518e-07, "loss": 0.6684, "step": 757 }, { "epoch": 0.9703176254100329, "grad_norm": 1.8601329326629639, "learning_rate": 8.127407104786746e-07, "loss": 0.7114, "step": 758 }, { "epoch": 0.9715977278182255, "grad_norm": 2.383610725402832, "learning_rate": 8.122359661996046e-07, "loss": 0.6883, "step": 759 }, { "epoch": 0.9728778302264182, "grad_norm": 1.6185420751571655, "learning_rate": 8.117307218524591e-07, "loss": 0.7008, "step": 760 }, { "epoch": 0.9741579326346108, "grad_norm": 0.8225951790809631, "learning_rate": 8.11224978400708e-07, "loss": 0.688, "step": 761 }, { "epoch": 0.9754380350428035, "grad_norm": 0.632926881313324, "learning_rate": 8.107187368087735e-07, "loss": 0.6947, "step": 762 }, { "epoch": 0.9767181374509961, "grad_norm": 1.3217525482177734, "learning_rate": 8.102119980420277e-07, "loss": 0.6863, "step": 763 }, { "epoch": 0.9779982398591888, "grad_norm": 0.8353522419929504, "learning_rate": 8.097047630667904e-07, "loss": 0.6769, "step": 764 }, { "epoch": 0.9792783422673814, "grad_norm": 1.7969515323638916, "learning_rate": 8.091970328503282e-07, "loss": 0.7054, "step": 765 }, { "epoch": 0.9805584446755741, "grad_norm": 0.6397256851196289, "learning_rate": 8.086888083608515e-07, "loss": 0.682, "step": 766 }, { "epoch": 0.9818385470837667, "grad_norm": 0.8505901098251343, "learning_rate": 8.08180090567514e-07, "loss": 0.6891, "step": 767 }, { "epoch": 0.9831186494919594, "grad_norm": 1.239424467086792, "learning_rate": 8.076708804404093e-07, "loss": 0.7154, "step": 768 }, { "epoch": 0.984398751900152, "grad_norm": 1.5447685718536377, "learning_rate": 8.071611789505703e-07, "loss": 0.6849, "step": 769 }, { "epoch": 0.9856788543083447, "grad_norm": 0.405514121055603, "learning_rate": 8.066509870699671e-07, "loss": 0.6804, "step": 770 }, { "epoch": 0.9869589567165373, "grad_norm": 1.1980639696121216, "learning_rate": 8.061403057715042e-07, "loss": 0.7079, "step": 771 }, { "epoch": 0.98823905912473, "grad_norm": 0.48832324147224426, "learning_rate": 8.056291360290201e-07, "loss": 0.6898, "step": 772 }, { "epoch": 0.9895191615329226, "grad_norm": 0.44163626432418823, "learning_rate": 8.051174788172844e-07, "loss": 0.6892, "step": 773 }, { "epoch": 0.9907992639411153, "grad_norm": 0.786046028137207, "learning_rate": 8.046053351119965e-07, "loss": 0.6987, "step": 774 }, { "epoch": 0.9920793663493079, "grad_norm": 0.9036693572998047, "learning_rate": 8.040927058897832e-07, "loss": 0.7015, "step": 775 }, { "epoch": 0.9933594687575006, "grad_norm": 0.6999722123146057, "learning_rate": 8.035795921281974e-07, "loss": 0.6867, "step": 776 }, { "epoch": 0.9946395711656932, "grad_norm": 0.4138757586479187, "learning_rate": 8.03065994805716e-07, "loss": 0.7073, "step": 777 }, { "epoch": 0.9959196735738859, "grad_norm": 0.706631064414978, "learning_rate": 8.025519149017378e-07, "loss": 0.6754, "step": 778 }, { "epoch": 0.9971997759820785, "grad_norm": 0.6649022102355957, "learning_rate": 8.020373533965821e-07, "loss": 0.667, "step": 779 }, { "epoch": 0.9984798783902712, "grad_norm": 1.475054144859314, "learning_rate": 8.015223112714861e-07, "loss": 0.6938, "step": 780 }, { "epoch": 0.9984798783902712, "eval_loss": 0.020647402852773666, "eval_runtime": 42.1351, "eval_samples_per_second": 11.772, "eval_steps_per_second": 1.471, "step": 780 }, { "epoch": 0.9997599807984638, "grad_norm": 1.2930245399475098, "learning_rate": 8.010067895086043e-07, "loss": 0.6853, "step": 781 }, { "epoch": 1.0, "grad_norm": 1.3159685134887695, "learning_rate": 8.004907890910055e-07, "loss": 0.6796, "step": 782 }, { "epoch": 1.0012801024081928, "grad_norm": 0.5368277430534363, "learning_rate": 7.999743110026708e-07, "loss": 0.7092, "step": 783 }, { "epoch": 1.0025602048163853, "grad_norm": 0.4549940824508667, "learning_rate": 7.994573562284927e-07, "loss": 0.6915, "step": 784 }, { "epoch": 1.003840307224578, "grad_norm": 0.5101287961006165, "learning_rate": 7.989399257542728e-07, "loss": 0.6698, "step": 785 }, { "epoch": 1.0051204096327706, "grad_norm": 0.6423113346099854, "learning_rate": 7.984220205667192e-07, "loss": 0.6908, "step": 786 }, { "epoch": 1.0064005120409634, "grad_norm": 1.1199818849563599, "learning_rate": 7.979036416534461e-07, "loss": 0.6915, "step": 787 }, { "epoch": 1.007680614449156, "grad_norm": 0.8028132915496826, "learning_rate": 7.973847900029704e-07, "loss": 0.6731, "step": 788 }, { "epoch": 1.0089607168573487, "grad_norm": 0.5896822214126587, "learning_rate": 7.968654666047107e-07, "loss": 0.7043, "step": 789 }, { "epoch": 1.0102408192655412, "grad_norm": 0.8032567501068115, "learning_rate": 7.963456724489857e-07, "loss": 0.6985, "step": 790 }, { "epoch": 1.011520921673734, "grad_norm": 0.9771206974983215, "learning_rate": 7.958254085270105e-07, "loss": 0.6704, "step": 791 }, { "epoch": 1.0128010240819265, "grad_norm": 0.4267595708370209, "learning_rate": 7.953046758308973e-07, "loss": 0.7052, "step": 792 }, { "epoch": 1.0140811264901193, "grad_norm": 0.9158257246017456, "learning_rate": 7.947834753536518e-07, "loss": 0.6953, "step": 793 }, { "epoch": 1.0153612288983118, "grad_norm": 0.42117831110954285, "learning_rate": 7.942618080891714e-07, "loss": 0.6858, "step": 794 }, { "epoch": 1.0166413313065046, "grad_norm": 1.6845707893371582, "learning_rate": 7.937396750322442e-07, "loss": 0.6949, "step": 795 }, { "epoch": 1.0179214337146971, "grad_norm": 1.548080325126648, "learning_rate": 7.932170771785462e-07, "loss": 0.6953, "step": 796 }, { "epoch": 1.0192015361228899, "grad_norm": 0.41964584589004517, "learning_rate": 7.926940155246397e-07, "loss": 0.6711, "step": 797 }, { "epoch": 1.0204816385310824, "grad_norm": 0.500307559967041, "learning_rate": 7.921704910679714e-07, "loss": 0.6824, "step": 798 }, { "epoch": 1.0217617409392752, "grad_norm": 0.40395599603652954, "learning_rate": 7.916465048068711e-07, "loss": 0.7019, "step": 799 }, { "epoch": 1.0230418433474677, "grad_norm": 0.7821643352508545, "learning_rate": 7.911220577405484e-07, "loss": 0.6938, "step": 800 }, { "epoch": 1.0243219457556605, "grad_norm": 1.1643157005310059, "learning_rate": 7.905971508690923e-07, "loss": 0.6934, "step": 801 }, { "epoch": 1.025602048163853, "grad_norm": 1.992969036102295, "learning_rate": 7.900717851934681e-07, "loss": 0.6792, "step": 802 }, { "epoch": 1.0268821505720458, "grad_norm": 1.5031347274780273, "learning_rate": 7.895459617155168e-07, "loss": 0.6799, "step": 803 }, { "epoch": 1.0281622529802383, "grad_norm": 0.5260814428329468, "learning_rate": 7.890196814379512e-07, "loss": 0.7027, "step": 804 }, { "epoch": 1.029442355388431, "grad_norm": 0.41678398847579956, "learning_rate": 7.884929453643561e-07, "loss": 0.6998, "step": 805 }, { "epoch": 1.0307224577966236, "grad_norm": 0.8173002600669861, "learning_rate": 7.879657544991852e-07, "loss": 0.6819, "step": 806 }, { "epoch": 1.0320025602048164, "grad_norm": 0.9889504909515381, "learning_rate": 7.874381098477597e-07, "loss": 0.6828, "step": 807 }, { "epoch": 1.033282662613009, "grad_norm": 0.6382724642753601, "learning_rate": 7.869100124162656e-07, "loss": 0.7001, "step": 808 }, { "epoch": 1.0345627650212017, "grad_norm": 0.4228520095348358, "learning_rate": 7.863814632117531e-07, "loss": 0.6639, "step": 809 }, { "epoch": 1.0358428674293942, "grad_norm": 1.2064498662948608, "learning_rate": 7.858524632421333e-07, "loss": 0.6767, "step": 810 }, { "epoch": 1.0358428674293942, "eval_loss": 0.020557139068841934, "eval_runtime": 42.0148, "eval_samples_per_second": 11.805, "eval_steps_per_second": 1.476, "step": 810 }, { "epoch": 1.037122969837587, "grad_norm": 0.8042521476745605, "learning_rate": 7.853230135161765e-07, "loss": 0.6906, "step": 811 }, { "epoch": 1.0384030722457798, "grad_norm": 0.6035192608833313, "learning_rate": 7.847931150435122e-07, "loss": 0.6942, "step": 812 }, { "epoch": 1.0396831746539723, "grad_norm": 0.4148562252521515, "learning_rate": 7.842627688346238e-07, "loss": 0.7067, "step": 813 }, { "epoch": 1.040963277062165, "grad_norm": 0.9750702977180481, "learning_rate": 7.837319759008497e-07, "loss": 0.694, "step": 814 }, { "epoch": 1.0422433794703576, "grad_norm": 0.8575407862663269, "learning_rate": 7.832007372543797e-07, "loss": 0.6635, "step": 815 }, { "epoch": 1.0435234818785504, "grad_norm": 0.5474435687065125, "learning_rate": 7.826690539082539e-07, "loss": 0.6872, "step": 816 }, { "epoch": 1.044803584286743, "grad_norm": 0.6381425261497498, "learning_rate": 7.821369268763597e-07, "loss": 0.6725, "step": 817 }, { "epoch": 1.0460836866949357, "grad_norm": 1.992908239364624, "learning_rate": 7.816043571734316e-07, "loss": 0.6988, "step": 818 }, { "epoch": 1.0473637891031282, "grad_norm": 2.57561993598938, "learning_rate": 7.810713458150474e-07, "loss": 0.6794, "step": 819 }, { "epoch": 1.048643891511321, "grad_norm": 1.7567766904830933, "learning_rate": 7.805378938176275e-07, "loss": 0.6938, "step": 820 }, { "epoch": 1.0499239939195135, "grad_norm": 0.6404883861541748, "learning_rate": 7.800040021984325e-07, "loss": 0.6822, "step": 821 }, { "epoch": 1.0512040963277063, "grad_norm": 1.1196707487106323, "learning_rate": 7.794696719755611e-07, "loss": 0.6752, "step": 822 }, { "epoch": 1.0524841987358988, "grad_norm": 2.2272937297821045, "learning_rate": 7.789349041679489e-07, "loss": 0.687, "step": 823 }, { "epoch": 1.0537643011440916, "grad_norm": 1.86038339138031, "learning_rate": 7.783996997953656e-07, "loss": 0.6783, "step": 824 }, { "epoch": 1.0550444035522841, "grad_norm": 1.9092817306518555, "learning_rate": 7.778640598784136e-07, "loss": 0.6761, "step": 825 }, { "epoch": 1.056324505960477, "grad_norm": 0.75870281457901, "learning_rate": 7.773279854385255e-07, "loss": 0.6781, "step": 826 }, { "epoch": 1.0576046083686694, "grad_norm": 0.7749569416046143, "learning_rate": 7.767914774979627e-07, "loss": 0.6863, "step": 827 }, { "epoch": 1.0588847107768622, "grad_norm": 0.7584654688835144, "learning_rate": 7.762545370798134e-07, "loss": 0.6582, "step": 828 }, { "epoch": 1.0601648131850547, "grad_norm": 1.284524917602539, "learning_rate": 7.757171652079904e-07, "loss": 0.6884, "step": 829 }, { "epoch": 1.0614449155932475, "grad_norm": 0.41432639956474304, "learning_rate": 7.751793629072291e-07, "loss": 0.6802, "step": 830 }, { "epoch": 1.06272501800144, "grad_norm": 0.5820539593696594, "learning_rate": 7.746411312030861e-07, "loss": 0.6857, "step": 831 }, { "epoch": 1.0640051204096328, "grad_norm": 0.39010608196258545, "learning_rate": 7.741024711219365e-07, "loss": 0.6827, "step": 832 }, { "epoch": 1.0652852228178253, "grad_norm": 1.1412655115127563, "learning_rate": 7.735633836909723e-07, "loss": 0.6893, "step": 833 }, { "epoch": 1.066565325226018, "grad_norm": 0.4019696116447449, "learning_rate": 7.730238699382007e-07, "loss": 0.693, "step": 834 }, { "epoch": 1.0678454276342106, "grad_norm": 1.4895787239074707, "learning_rate": 7.724839308924416e-07, "loss": 0.6956, "step": 835 }, { "epoch": 1.0691255300424034, "grad_norm": 0.40033113956451416, "learning_rate": 7.719435675833258e-07, "loss": 0.6767, "step": 836 }, { "epoch": 1.070405632450596, "grad_norm": 0.6502126455307007, "learning_rate": 7.714027810412937e-07, "loss": 0.6803, "step": 837 }, { "epoch": 1.0716857348587887, "grad_norm": 0.6411004662513733, "learning_rate": 7.708615722975922e-07, "loss": 0.6801, "step": 838 }, { "epoch": 1.0729658372669815, "grad_norm": 0.47574731707572937, "learning_rate": 7.703199423842735e-07, "loss": 0.6943, "step": 839 }, { "epoch": 1.074245939675174, "grad_norm": 0.7577368021011353, "learning_rate": 7.697778923341931e-07, "loss": 0.6832, "step": 840 }, { "epoch": 1.074245939675174, "eval_loss": 0.020497383549809456, "eval_runtime": 42.0176, "eval_samples_per_second": 11.805, "eval_steps_per_second": 1.476, "step": 840 }, { "epoch": 1.0755260420833668, "grad_norm": 0.596855103969574, "learning_rate": 7.692354231810076e-07, "loss": 0.6833, "step": 841 }, { "epoch": 1.0768061444915593, "grad_norm": 0.4002991020679474, "learning_rate": 7.686925359591726e-07, "loss": 0.685, "step": 842 }, { "epoch": 1.078086246899752, "grad_norm": 0.5130592584609985, "learning_rate": 7.681492317039414e-07, "loss": 0.6914, "step": 843 }, { "epoch": 1.0793663493079446, "grad_norm": 0.5623389482498169, "learning_rate": 7.676055114513618e-07, "loss": 0.6892, "step": 844 }, { "epoch": 1.0806464517161374, "grad_norm": 1.1263748407363892, "learning_rate": 7.670613762382756e-07, "loss": 0.6699, "step": 845 }, { "epoch": 1.08192655412433, "grad_norm": 0.4972497224807739, "learning_rate": 7.665168271023155e-07, "loss": 0.6813, "step": 846 }, { "epoch": 1.0832066565325227, "grad_norm": 0.9748055338859558, "learning_rate": 7.659718650819039e-07, "loss": 0.6956, "step": 847 }, { "epoch": 1.0844867589407152, "grad_norm": 1.449137806892395, "learning_rate": 7.654264912162499e-07, "loss": 0.6856, "step": 848 }, { "epoch": 1.085766861348908, "grad_norm": 0.37270116806030273, "learning_rate": 7.648807065453489e-07, "loss": 0.6895, "step": 849 }, { "epoch": 1.0870469637571005, "grad_norm": 1.356169581413269, "learning_rate": 7.643345121099788e-07, "loss": 0.6755, "step": 850 }, { "epoch": 1.0883270661652933, "grad_norm": 0.8227845430374146, "learning_rate": 7.637879089516992e-07, "loss": 0.6938, "step": 851 }, { "epoch": 1.0896071685734858, "grad_norm": 0.9096874594688416, "learning_rate": 7.632408981128493e-07, "loss": 0.6683, "step": 852 }, { "epoch": 1.0908872709816786, "grad_norm": 1.1273614168167114, "learning_rate": 7.626934806365456e-07, "loss": 0.6676, "step": 853 }, { "epoch": 1.0921673733898711, "grad_norm": 1.7035897970199585, "learning_rate": 7.621456575666801e-07, "loss": 0.6977, "step": 854 }, { "epoch": 1.093447475798064, "grad_norm": 0.5126929879188538, "learning_rate": 7.615974299479179e-07, "loss": 0.6916, "step": 855 }, { "epoch": 1.0947275782062564, "grad_norm": 0.4571192264556885, "learning_rate": 7.610487988256959e-07, "loss": 0.685, "step": 856 }, { "epoch": 1.0960076806144492, "grad_norm": 0.4030444622039795, "learning_rate": 7.604997652462204e-07, "loss": 0.6973, "step": 857 }, { "epoch": 1.0972877830226417, "grad_norm": 0.8501233458518982, "learning_rate": 7.59950330256465e-07, "loss": 0.6756, "step": 858 }, { "epoch": 1.0985678854308345, "grad_norm": 0.39168065786361694, "learning_rate": 7.594004949041691e-07, "loss": 0.6581, "step": 859 }, { "epoch": 1.099847987839027, "grad_norm": 0.46270155906677246, "learning_rate": 7.588502602378353e-07, "loss": 0.6656, "step": 860 }, { "epoch": 1.1011280902472198, "grad_norm": 0.4052952229976654, "learning_rate": 7.582996273067276e-07, "loss": 0.683, "step": 861 }, { "epoch": 1.1024081926554123, "grad_norm": 0.781087338924408, "learning_rate": 7.577485971608698e-07, "loss": 0.6843, "step": 862 }, { "epoch": 1.103688295063605, "grad_norm": 1.425502896308899, "learning_rate": 7.571971708510426e-07, "loss": 0.6788, "step": 863 }, { "epoch": 1.1049683974717976, "grad_norm": 0.5255923867225647, "learning_rate": 7.566453494287829e-07, "loss": 0.6717, "step": 864 }, { "epoch": 1.1062484998799904, "grad_norm": 1.393507957458496, "learning_rate": 7.560931339463804e-07, "loss": 0.6828, "step": 865 }, { "epoch": 1.107528602288183, "grad_norm": 0.48503801226615906, "learning_rate": 7.555405254568766e-07, "loss": 0.675, "step": 866 }, { "epoch": 1.1088087046963757, "grad_norm": 0.764251708984375, "learning_rate": 7.549875250140624e-07, "loss": 0.69, "step": 867 }, { "epoch": 1.1100888071045683, "grad_norm": 0.8105603456497192, "learning_rate": 7.544341336724759e-07, "loss": 0.6709, "step": 868 }, { "epoch": 1.111368909512761, "grad_norm": 1.138421654701233, "learning_rate": 7.538803524874013e-07, "loss": 0.6732, "step": 869 }, { "epoch": 1.1126490119209538, "grad_norm": 0.7081236243247986, "learning_rate": 7.533261825148652e-07, "loss": 0.703, "step": 870 }, { "epoch": 1.1126490119209538, "eval_loss": 0.020532110705971718, "eval_runtime": 42.123, "eval_samples_per_second": 11.775, "eval_steps_per_second": 1.472, "step": 870 }, { "epoch": 1.1139291143291463, "grad_norm": 0.894440233707428, "learning_rate": 7.527716248116364e-07, "loss": 0.665, "step": 871 }, { "epoch": 1.115209216737339, "grad_norm": 0.4775767922401428, "learning_rate": 7.522166804352226e-07, "loss": 0.6683, "step": 872 }, { "epoch": 1.1164893191455316, "grad_norm": 0.4611867368221283, "learning_rate": 7.516613504438691e-07, "loss": 0.6981, "step": 873 }, { "epoch": 1.1177694215537244, "grad_norm": 0.7616720199584961, "learning_rate": 7.511056358965566e-07, "loss": 0.6584, "step": 874 }, { "epoch": 1.119049523961917, "grad_norm": 0.46075233817100525, "learning_rate": 7.50549537852999e-07, "loss": 0.6871, "step": 875 }, { "epoch": 1.1203296263701097, "grad_norm": 0.8921419382095337, "learning_rate": 7.499930573736415e-07, "loss": 0.6732, "step": 876 }, { "epoch": 1.1216097287783022, "grad_norm": 1.7196431159973145, "learning_rate": 7.494361955196586e-07, "loss": 0.7012, "step": 877 }, { "epoch": 1.122889831186495, "grad_norm": 1.0632987022399902, "learning_rate": 7.48878953352952e-07, "loss": 0.6646, "step": 878 }, { "epoch": 1.1241699335946875, "grad_norm": 0.4515886604785919, "learning_rate": 7.483213319361488e-07, "loss": 0.6806, "step": 879 }, { "epoch": 1.1254500360028803, "grad_norm": 0.5389161109924316, "learning_rate": 7.477633323325993e-07, "loss": 0.6694, "step": 880 }, { "epoch": 1.1267301384110728, "grad_norm": 0.4314780831336975, "learning_rate": 7.472049556063746e-07, "loss": 0.6808, "step": 881 }, { "epoch": 1.1280102408192656, "grad_norm": 0.7927844524383545, "learning_rate": 7.466462028222655e-07, "loss": 0.6859, "step": 882 }, { "epoch": 1.1292903432274581, "grad_norm": 0.4933050870895386, "learning_rate": 7.460870750457794e-07, "loss": 0.674, "step": 883 }, { "epoch": 1.130570445635651, "grad_norm": 0.4203268587589264, "learning_rate": 7.455275733431395e-07, "loss": 0.6667, "step": 884 }, { "epoch": 1.1318505480438434, "grad_norm": 1.8763399124145508, "learning_rate": 7.44967698781281e-07, "loss": 0.6637, "step": 885 }, { "epoch": 1.1331306504520362, "grad_norm": 0.8152745962142944, "learning_rate": 7.444074524278511e-07, "loss": 0.6916, "step": 886 }, { "epoch": 1.1344107528602287, "grad_norm": 0.40302833914756775, "learning_rate": 7.438468353512055e-07, "loss": 0.6773, "step": 887 }, { "epoch": 1.1356908552684215, "grad_norm": 0.49966704845428467, "learning_rate": 7.43285848620407e-07, "loss": 0.6943, "step": 888 }, { "epoch": 1.136970957676614, "grad_norm": 1.1931142807006836, "learning_rate": 7.427244933052233e-07, "loss": 0.6677, "step": 889 }, { "epoch": 1.1382510600848068, "grad_norm": 0.5937730669975281, "learning_rate": 7.421627704761246e-07, "loss": 0.6723, "step": 890 }, { "epoch": 1.1395311624929993, "grad_norm": 0.4531826674938202, "learning_rate": 7.416006812042827e-07, "loss": 0.6682, "step": 891 }, { "epoch": 1.1408112649011921, "grad_norm": 0.7853236198425293, "learning_rate": 7.410382265615674e-07, "loss": 0.6735, "step": 892 }, { "epoch": 1.1420913673093849, "grad_norm": 1.2373019456863403, "learning_rate": 7.404754076205459e-07, "loss": 0.6731, "step": 893 }, { "epoch": 1.1433714697175774, "grad_norm": 0.6332933306694031, "learning_rate": 7.399122254544794e-07, "loss": 0.6738, "step": 894 }, { "epoch": 1.14465157212577, "grad_norm": 1.1668685674667358, "learning_rate": 7.393486811373224e-07, "loss": 0.6952, "step": 895 }, { "epoch": 1.1459316745339627, "grad_norm": 0.5281875133514404, "learning_rate": 7.387847757437196e-07, "loss": 0.6781, "step": 896 }, { "epoch": 1.1472117769421555, "grad_norm": 0.7266621589660645, "learning_rate": 7.382205103490042e-07, "loss": 0.6844, "step": 897 }, { "epoch": 1.148491879350348, "grad_norm": 0.43718716502189636, "learning_rate": 7.376558860291965e-07, "loss": 0.6784, "step": 898 }, { "epoch": 1.1497719817585406, "grad_norm": 1.0780441761016846, "learning_rate": 7.370909038610005e-07, "loss": 0.6631, "step": 899 }, { "epoch": 1.1510520841667333, "grad_norm": 1.053000807762146, "learning_rate": 7.36525564921803e-07, "loss": 0.6991, "step": 900 }, { "epoch": 1.1510520841667333, "eval_loss": 0.020543841645121574, "eval_runtime": 42.2352, "eval_samples_per_second": 11.744, "eval_steps_per_second": 1.468, "step": 900 }, { "epoch": 1.152332186574926, "grad_norm": 2.3958194255828857, "learning_rate": 7.359598702896709e-07, "loss": 0.6762, "step": 901 }, { "epoch": 1.1536122889831186, "grad_norm": 0.7371974587440491, "learning_rate": 7.3539382104335e-07, "loss": 0.6823, "step": 902 }, { "epoch": 1.1548923913913114, "grad_norm": 1.5400575399398804, "learning_rate": 7.348274182622613e-07, "loss": 0.6802, "step": 903 }, { "epoch": 1.156172493799504, "grad_norm": 0.76230388879776, "learning_rate": 7.342606630265008e-07, "loss": 0.6836, "step": 904 }, { "epoch": 1.1574525962076967, "grad_norm": 0.7071508765220642, "learning_rate": 7.336935564168363e-07, "loss": 0.6904, "step": 905 }, { "epoch": 1.1587326986158892, "grad_norm": 0.568476140499115, "learning_rate": 7.331260995147057e-07, "loss": 0.6782, "step": 906 }, { "epoch": 1.160012801024082, "grad_norm": 0.5799767374992371, "learning_rate": 7.32558293402215e-07, "loss": 0.6694, "step": 907 }, { "epoch": 1.1612929034322745, "grad_norm": 0.43046560883522034, "learning_rate": 7.319901391621358e-07, "loss": 0.6834, "step": 908 }, { "epoch": 1.1625730058404673, "grad_norm": 0.48199447989463806, "learning_rate": 7.314216378779039e-07, "loss": 0.6879, "step": 909 }, { "epoch": 1.1638531082486598, "grad_norm": 1.060200810432434, "learning_rate": 7.308527906336167e-07, "loss": 0.6722, "step": 910 }, { "epoch": 1.1651332106568526, "grad_norm": 0.7335535883903503, "learning_rate": 7.302835985140315e-07, "loss": 0.6686, "step": 911 }, { "epoch": 1.1664133130650451, "grad_norm": 0.43378928303718567, "learning_rate": 7.297140626045629e-07, "loss": 0.6695, "step": 912 }, { "epoch": 1.167693415473238, "grad_norm": 0.5960014462471008, "learning_rate": 7.291441839912817e-07, "loss": 0.6514, "step": 913 }, { "epoch": 1.1689735178814304, "grad_norm": 1.2673043012619019, "learning_rate": 7.285739637609113e-07, "loss": 0.6808, "step": 914 }, { "epoch": 1.1702536202896232, "grad_norm": 0.40168991684913635, "learning_rate": 7.280034030008276e-07, "loss": 0.6681, "step": 915 }, { "epoch": 1.1715337226978157, "grad_norm": 1.0041136741638184, "learning_rate": 7.274325027990549e-07, "loss": 0.6796, "step": 916 }, { "epoch": 1.1728138251060085, "grad_norm": 0.37877488136291504, "learning_rate": 7.268612642442656e-07, "loss": 0.6814, "step": 917 }, { "epoch": 1.174093927514201, "grad_norm": 0.8861886262893677, "learning_rate": 7.262896884257768e-07, "loss": 0.6659, "step": 918 }, { "epoch": 1.1753740299223938, "grad_norm": 1.6074557304382324, "learning_rate": 7.25717776433549e-07, "loss": 0.6894, "step": 919 }, { "epoch": 1.1766541323305864, "grad_norm": 2.1874148845672607, "learning_rate": 7.251455293581835e-07, "loss": 0.6854, "step": 920 }, { "epoch": 1.1779342347387791, "grad_norm": 1.335900068283081, "learning_rate": 7.24572948290921e-07, "loss": 0.6897, "step": 921 }, { "epoch": 1.1792143371469717, "grad_norm": 2.0427908897399902, "learning_rate": 7.240000343236385e-07, "loss": 0.6767, "step": 922 }, { "epoch": 1.1804944395551644, "grad_norm": 0.5181105136871338, "learning_rate": 7.234267885488485e-07, "loss": 0.6844, "step": 923 }, { "epoch": 1.1817745419633572, "grad_norm": 0.4850052297115326, "learning_rate": 7.228532120596956e-07, "loss": 0.6779, "step": 924 }, { "epoch": 1.1830546443715497, "grad_norm": 3.076356887817383, "learning_rate": 7.222793059499558e-07, "loss": 0.6596, "step": 925 }, { "epoch": 1.1843347467797423, "grad_norm": 3.2298052310943604, "learning_rate": 7.217050713140328e-07, "loss": 0.6793, "step": 926 }, { "epoch": 1.185614849187935, "grad_norm": 3.4464282989501953, "learning_rate": 7.211305092469576e-07, "loss": 0.6685, "step": 927 }, { "epoch": 1.1868949515961278, "grad_norm": 4.43187952041626, "learning_rate": 7.205556208443847e-07, "loss": 0.6937, "step": 928 }, { "epoch": 1.1881750540043203, "grad_norm": 2.211535930633545, "learning_rate": 7.199804072025919e-07, "loss": 0.6767, "step": 929 }, { "epoch": 1.189455156412513, "grad_norm": 1.3217605352401733, "learning_rate": 7.194048694184763e-07, "loss": 0.6862, "step": 930 }, { "epoch": 1.189455156412513, "eval_loss": 0.020434025675058365, "eval_runtime": 42.0408, "eval_samples_per_second": 11.798, "eval_steps_per_second": 1.475, "step": 930 }, { "epoch": 1.1907352588207056, "grad_norm": 0.7160547375679016, "learning_rate": 7.18829008589554e-07, "loss": 0.6729, "step": 931 }, { "epoch": 1.1920153612288984, "grad_norm": 2.5587425231933594, "learning_rate": 7.182528258139561e-07, "loss": 0.6713, "step": 932 }, { "epoch": 1.193295463637091, "grad_norm": 2.934382915496826, "learning_rate": 7.176763221904286e-07, "loss": 0.6594, "step": 933 }, { "epoch": 1.1945755660452837, "grad_norm": 2.2905616760253906, "learning_rate": 7.170994988183289e-07, "loss": 0.6476, "step": 934 }, { "epoch": 1.1958556684534762, "grad_norm": 3.0419278144836426, "learning_rate": 7.165223567976239e-07, "loss": 0.6766, "step": 935 }, { "epoch": 1.197135770861669, "grad_norm": 3.3169689178466797, "learning_rate": 7.159448972288888e-07, "loss": 0.687, "step": 936 }, { "epoch": 1.1984158732698615, "grad_norm": 2.701469659805298, "learning_rate": 7.153671212133036e-07, "loss": 0.6729, "step": 937 }, { "epoch": 1.1996959756780543, "grad_norm": 1.5976871252059937, "learning_rate": 7.147890298526523e-07, "loss": 0.6502, "step": 938 }, { "epoch": 1.2009760780862468, "grad_norm": 0.6515759825706482, "learning_rate": 7.1421062424932e-07, "loss": 0.6644, "step": 939 }, { "epoch": 1.2022561804944396, "grad_norm": 2.639430046081543, "learning_rate": 7.136319055062911e-07, "loss": 0.6815, "step": 940 }, { "epoch": 1.2035362829026321, "grad_norm": 3.5913476943969727, "learning_rate": 7.130528747271471e-07, "loss": 0.668, "step": 941 }, { "epoch": 1.204816385310825, "grad_norm": 3.8594934940338135, "learning_rate": 7.124735330160647e-07, "loss": 0.6535, "step": 942 }, { "epoch": 1.2060964877190175, "grad_norm": 3.640683174133301, "learning_rate": 7.118938814778131e-07, "loss": 0.6794, "step": 943 }, { "epoch": 1.2073765901272102, "grad_norm": 4.632922649383545, "learning_rate": 7.113139212177529e-07, "loss": 0.6899, "step": 944 }, { "epoch": 1.2086566925354028, "grad_norm": 1.8212755918502808, "learning_rate": 7.107336533418329e-07, "loss": 0.6649, "step": 945 }, { "epoch": 1.2099367949435955, "grad_norm": 2.004613161087036, "learning_rate": 7.10153078956589e-07, "loss": 0.6899, "step": 946 }, { "epoch": 1.211216897351788, "grad_norm": 0.39641427993774414, "learning_rate": 7.09572199169141e-07, "loss": 0.6654, "step": 947 }, { "epoch": 1.2124969997599808, "grad_norm": 3.110231637954712, "learning_rate": 7.089910150871917e-07, "loss": 0.7036, "step": 948 }, { "epoch": 1.2137771021681734, "grad_norm": 3.191833257675171, "learning_rate": 7.084095278190236e-07, "loss": 0.67, "step": 949 }, { "epoch": 1.2150572045763661, "grad_norm": 2.9252684116363525, "learning_rate": 7.078277384734978e-07, "loss": 0.6701, "step": 950 }, { "epoch": 1.2163373069845589, "grad_norm": 4.220887660980225, "learning_rate": 7.072456481600516e-07, "loss": 0.6909, "step": 951 }, { "epoch": 1.2176174093927514, "grad_norm": 2.17702579498291, "learning_rate": 7.066632579886951e-07, "loss": 0.6944, "step": 952 }, { "epoch": 1.218897511800944, "grad_norm": 2.6868855953216553, "learning_rate": 7.060805690700119e-07, "loss": 0.6488, "step": 953 }, { "epoch": 1.2201776142091367, "grad_norm": 1.0425877571105957, "learning_rate": 7.054975825151539e-07, "loss": 0.6658, "step": 954 }, { "epoch": 1.2214577166173295, "grad_norm": 1.281869649887085, "learning_rate": 7.049142994358411e-07, "loss": 0.6666, "step": 955 }, { "epoch": 1.222737819025522, "grad_norm": 1.7749693393707275, "learning_rate": 7.043307209443591e-07, "loss": 0.6622, "step": 956 }, { "epoch": 1.2240179214337146, "grad_norm": 1.9906210899353027, "learning_rate": 7.037468481535566e-07, "loss": 0.658, "step": 957 }, { "epoch": 1.2252980238419073, "grad_norm": 3.294895887374878, "learning_rate": 7.031626821768436e-07, "loss": 0.6688, "step": 958 }, { "epoch": 1.2265781262501, "grad_norm": 2.4908313751220703, "learning_rate": 7.025782241281893e-07, "loss": 0.6918, "step": 959 }, { "epoch": 1.2278582286582926, "grad_norm": 0.8760585188865662, "learning_rate": 7.019934751221194e-07, "loss": 0.6715, "step": 960 }, { "epoch": 1.2278582286582926, "eval_loss": 0.0204321276396513, "eval_runtime": 42.1397, "eval_samples_per_second": 11.77, "eval_steps_per_second": 1.471, "step": 960 }, { "epoch": 1.2291383310664854, "grad_norm": 0.9686982035636902, "learning_rate": 7.014084362737152e-07, "loss": 0.6443, "step": 961 }, { "epoch": 1.230418433474678, "grad_norm": 0.6498221755027771, "learning_rate": 7.008231086986097e-07, "loss": 0.6757, "step": 962 }, { "epoch": 1.2316985358828707, "grad_norm": 0.954429030418396, "learning_rate": 7.002374935129878e-07, "loss": 0.6617, "step": 963 }, { "epoch": 1.2329786382910632, "grad_norm": 1.3566386699676514, "learning_rate": 6.996515918335814e-07, "loss": 0.6773, "step": 964 }, { "epoch": 1.234258740699256, "grad_norm": 0.9798348546028137, "learning_rate": 6.990654047776701e-07, "loss": 0.6804, "step": 965 }, { "epoch": 1.2355388431074485, "grad_norm": 0.36472949385643005, "learning_rate": 6.984789334630767e-07, "loss": 0.6941, "step": 966 }, { "epoch": 1.2368189455156413, "grad_norm": 0.6192675232887268, "learning_rate": 6.978921790081665e-07, "loss": 0.6587, "step": 967 }, { "epoch": 1.2380990479238339, "grad_norm": 1.8698980808258057, "learning_rate": 6.973051425318445e-07, "loss": 0.6798, "step": 968 }, { "epoch": 1.2393791503320266, "grad_norm": 2.300565004348755, "learning_rate": 6.967178251535538e-07, "loss": 0.6718, "step": 969 }, { "epoch": 1.2406592527402192, "grad_norm": 2.7261533737182617, "learning_rate": 6.961302279932729e-07, "loss": 0.6685, "step": 970 }, { "epoch": 1.241939355148412, "grad_norm": 3.2374720573425293, "learning_rate": 6.955423521715142e-07, "loss": 0.6662, "step": 971 }, { "epoch": 1.2432194575566045, "grad_norm": 2.060549020767212, "learning_rate": 6.949541988093207e-07, "loss": 0.6673, "step": 972 }, { "epoch": 1.2444995599647972, "grad_norm": 0.5342932343482971, "learning_rate": 6.943657690282656e-07, "loss": 0.6558, "step": 973 }, { "epoch": 1.2457796623729898, "grad_norm": 0.7281977534294128, "learning_rate": 6.937770639504487e-07, "loss": 0.6856, "step": 974 }, { "epoch": 1.2470597647811825, "grad_norm": 1.6199723482131958, "learning_rate": 6.931880846984949e-07, "loss": 0.6691, "step": 975 }, { "epoch": 1.248339867189375, "grad_norm": 3.3473904132843018, "learning_rate": 6.925988323955518e-07, "loss": 0.692, "step": 976 }, { "epoch": 1.2496199695975678, "grad_norm": 2.2117726802825928, "learning_rate": 6.920093081652878e-07, "loss": 0.6498, "step": 977 }, { "epoch": 1.2509000720057606, "grad_norm": 2.3039209842681885, "learning_rate": 6.914195131318898e-07, "loss": 0.6889, "step": 978 }, { "epoch": 1.2521801744139531, "grad_norm": 1.6228289604187012, "learning_rate": 6.908294484200612e-07, "loss": 0.6761, "step": 979 }, { "epoch": 1.2534602768221457, "grad_norm": 0.5737580060958862, "learning_rate": 6.902391151550196e-07, "loss": 0.6791, "step": 980 }, { "epoch": 1.2547403792303384, "grad_norm": 1.1989716291427612, "learning_rate": 6.896485144624948e-07, "loss": 0.6786, "step": 981 }, { "epoch": 1.2560204816385312, "grad_norm": 1.288958191871643, "learning_rate": 6.890576474687263e-07, "loss": 0.6789, "step": 982 }, { "epoch": 1.2573005840467237, "grad_norm": 1.6760433912277222, "learning_rate": 6.884665153004619e-07, "loss": 0.689, "step": 983 }, { "epoch": 1.2585806864549163, "grad_norm": 1.3740628957748413, "learning_rate": 6.878751190849542e-07, "loss": 0.6735, "step": 984 }, { "epoch": 1.259860788863109, "grad_norm": 0.9336888790130615, "learning_rate": 6.872834599499606e-07, "loss": 0.663, "step": 985 }, { "epoch": 1.2611408912713018, "grad_norm": 0.9038626551628113, "learning_rate": 6.866915390237387e-07, "loss": 0.6775, "step": 986 }, { "epoch": 1.2624209936794943, "grad_norm": 0.910187304019928, "learning_rate": 6.86099357435046e-07, "loss": 0.6748, "step": 987 }, { "epoch": 1.2637010960876869, "grad_norm": 0.3547734022140503, "learning_rate": 6.855069163131367e-07, "loss": 0.6734, "step": 988 }, { "epoch": 1.2649811984958796, "grad_norm": 0.5283913612365723, "learning_rate": 6.849142167877604e-07, "loss": 0.6577, "step": 989 }, { "epoch": 1.2662613009040724, "grad_norm": 0.5148858428001404, "learning_rate": 6.843212599891587e-07, "loss": 0.6642, "step": 990 }, { "epoch": 1.2662613009040724, "eval_loss": 0.020405089482665062, "eval_runtime": 42.0112, "eval_samples_per_second": 11.806, "eval_steps_per_second": 1.476, "step": 990 }, { "epoch": 1.267541403312265, "grad_norm": 0.4507172107696533, "learning_rate": 6.837280470480645e-07, "loss": 0.681, "step": 991 }, { "epoch": 1.2688215057204577, "grad_norm": 0.731308102607727, "learning_rate": 6.831345790956986e-07, "loss": 0.6729, "step": 992 }, { "epoch": 1.2701016081286503, "grad_norm": 0.41501274704933167, "learning_rate": 6.825408572637689e-07, "loss": 0.6541, "step": 993 }, { "epoch": 1.271381710536843, "grad_norm": 0.8684238195419312, "learning_rate": 6.819468826844665e-07, "loss": 0.6566, "step": 994 }, { "epoch": 1.2726618129450356, "grad_norm": 0.7077449560165405, "learning_rate": 6.813526564904651e-07, "loss": 0.6796, "step": 995 }, { "epoch": 1.2739419153532283, "grad_norm": 1.718634009361267, "learning_rate": 6.807581798149177e-07, "loss": 0.657, "step": 996 }, { "epoch": 1.2752220177614209, "grad_norm": 1.1301251649856567, "learning_rate": 6.801634537914555e-07, "loss": 0.6834, "step": 997 }, { "epoch": 1.2765021201696136, "grad_norm": 1.1063438653945923, "learning_rate": 6.795684795541847e-07, "loss": 0.6845, "step": 998 }, { "epoch": 1.2777822225778062, "grad_norm": 0.8343043923377991, "learning_rate": 6.789732582376854e-07, "loss": 0.656, "step": 999 }, { "epoch": 1.279062324985999, "grad_norm": 0.6101583242416382, "learning_rate": 6.783777909770083e-07, "loss": 0.6674, "step": 1000 }, { "epoch": 1.2803424273941915, "grad_norm": 0.6108996272087097, "learning_rate": 6.777820789076738e-07, "loss": 0.6364, "step": 1001 }, { "epoch": 1.2816225298023842, "grad_norm": 1.2212913036346436, "learning_rate": 6.771861231656678e-07, "loss": 0.6817, "step": 1002 }, { "epoch": 1.2829026322105768, "grad_norm": 0.42153313755989075, "learning_rate": 6.765899248874423e-07, "loss": 0.6568, "step": 1003 }, { "epoch": 1.2841827346187695, "grad_norm": 0.3836733102798462, "learning_rate": 6.759934852099113e-07, "loss": 0.6851, "step": 1004 }, { "epoch": 1.2854628370269623, "grad_norm": 1.8300576210021973, "learning_rate": 6.753968052704488e-07, "loss": 0.6568, "step": 1005 }, { "epoch": 1.2867429394351548, "grad_norm": 1.705394983291626, "learning_rate": 6.747998862068876e-07, "loss": 0.6838, "step": 1006 }, { "epoch": 1.2880230418433474, "grad_norm": 0.672909140586853, "learning_rate": 6.742027291575156e-07, "loss": 0.6802, "step": 1007 }, { "epoch": 1.2893031442515401, "grad_norm": 1.2077293395996094, "learning_rate": 6.736053352610755e-07, "loss": 0.6644, "step": 1008 }, { "epoch": 1.290583246659733, "grad_norm": 0.46573755145072937, "learning_rate": 6.730077056567611e-07, "loss": 0.6709, "step": 1009 }, { "epoch": 1.2918633490679254, "grad_norm": 1.2819255590438843, "learning_rate": 6.724098414842158e-07, "loss": 0.6706, "step": 1010 }, { "epoch": 1.293143451476118, "grad_norm": 2.720734119415283, "learning_rate": 6.718117438835302e-07, "loss": 0.6822, "step": 1011 }, { "epoch": 1.2944235538843107, "grad_norm": 3.2891242504119873, "learning_rate": 6.712134139952403e-07, "loss": 0.6718, "step": 1012 }, { "epoch": 1.2957036562925035, "grad_norm": 1.871261715888977, "learning_rate": 6.706148529603248e-07, "loss": 0.6786, "step": 1013 }, { "epoch": 1.296983758700696, "grad_norm": 1.8228929042816162, "learning_rate": 6.700160619202032e-07, "loss": 0.662, "step": 1014 }, { "epoch": 1.2982638611088886, "grad_norm": 0.42994123697280884, "learning_rate": 6.694170420167338e-07, "loss": 0.6654, "step": 1015 }, { "epoch": 1.2995439635170813, "grad_norm": 2.0840930938720703, "learning_rate": 6.688177943922112e-07, "loss": 0.6456, "step": 1016 }, { "epoch": 1.300824065925274, "grad_norm": 1.4526396989822388, "learning_rate": 6.68218320189364e-07, "loss": 0.6529, "step": 1017 }, { "epoch": 1.3021041683334666, "grad_norm": 3.9268534183502197, "learning_rate": 6.676186205513537e-07, "loss": 0.6979, "step": 1018 }, { "epoch": 1.3033842707416594, "grad_norm": 1.9589157104492188, "learning_rate": 6.670186966217704e-07, "loss": 0.673, "step": 1019 }, { "epoch": 1.304664373149852, "grad_norm": 0.386042058467865, "learning_rate": 6.664185495446334e-07, "loss": 0.6805, "step": 1020 }, { "epoch": 1.304664373149852, "eval_loss": 0.020405780524015427, "eval_runtime": 42.0416, "eval_samples_per_second": 11.798, "eval_steps_per_second": 1.475, "step": 1020 }, { "epoch": 1.3059444755580447, "grad_norm": 0.5376230478286743, "learning_rate": 6.658181804643861e-07, "loss": 0.6657, "step": 1021 }, { "epoch": 1.3072245779662373, "grad_norm": 1.1283172369003296, "learning_rate": 6.652175905258963e-07, "loss": 0.6462, "step": 1022 }, { "epoch": 1.30850468037443, "grad_norm": 1.3118997812271118, "learning_rate": 6.646167808744523e-07, "loss": 0.6652, "step": 1023 }, { "epoch": 1.3097847827826226, "grad_norm": 0.8177453875541687, "learning_rate": 6.640157526557618e-07, "loss": 0.6706, "step": 1024 }, { "epoch": 1.3110648851908153, "grad_norm": 0.35823681950569153, "learning_rate": 6.634145070159493e-07, "loss": 0.667, "step": 1025 }, { "epoch": 1.3123449875990079, "grad_norm": 0.8362091183662415, "learning_rate": 6.628130451015535e-07, "loss": 0.6555, "step": 1026 }, { "epoch": 1.3136250900072006, "grad_norm": 0.36832505464553833, "learning_rate": 6.622113680595258e-07, "loss": 0.6844, "step": 1027 }, { "epoch": 1.3149051924153932, "grad_norm": 0.4041096270084381, "learning_rate": 6.61609477037228e-07, "loss": 0.6783, "step": 1028 }, { "epoch": 1.316185294823586, "grad_norm": 0.3950030207633972, "learning_rate": 6.610073731824295e-07, "loss": 0.6543, "step": 1029 }, { "epoch": 1.3174653972317785, "grad_norm": 0.4062904715538025, "learning_rate": 6.604050576433062e-07, "loss": 0.677, "step": 1030 }, { "epoch": 1.3187454996399712, "grad_norm": 1.2352319955825806, "learning_rate": 6.598025315684368e-07, "loss": 0.6721, "step": 1031 }, { "epoch": 1.3200256020481638, "grad_norm": 1.1156471967697144, "learning_rate": 6.591997961068024e-07, "loss": 0.6665, "step": 1032 }, { "epoch": 1.3213057044563565, "grad_norm": 0.6422211527824402, "learning_rate": 6.585968524077826e-07, "loss": 0.6609, "step": 1033 }, { "epoch": 1.322585806864549, "grad_norm": 0.37219637632369995, "learning_rate": 6.579937016211547e-07, "loss": 0.668, "step": 1034 }, { "epoch": 1.3238659092727418, "grad_norm": 2.088963747024536, "learning_rate": 6.573903448970905e-07, "loss": 0.6595, "step": 1035 }, { "epoch": 1.3251460116809346, "grad_norm": 0.8334722518920898, "learning_rate": 6.567867833861548e-07, "loss": 0.6579, "step": 1036 }, { "epoch": 1.3264261140891271, "grad_norm": 0.6673969626426697, "learning_rate": 6.561830182393027e-07, "loss": 0.6843, "step": 1037 }, { "epoch": 1.3277062164973197, "grad_norm": 0.7796549201011658, "learning_rate": 6.555790506078775e-07, "loss": 0.6544, "step": 1038 }, { "epoch": 1.3289863189055124, "grad_norm": 1.3010609149932861, "learning_rate": 6.549748816436092e-07, "loss": 0.6744, "step": 1039 }, { "epoch": 1.3302664213137052, "grad_norm": 0.843010663986206, "learning_rate": 6.54370512498611e-07, "loss": 0.6538, "step": 1040 }, { "epoch": 1.3315465237218977, "grad_norm": 1.4334732294082642, "learning_rate": 6.537659443253787e-07, "loss": 0.686, "step": 1041 }, { "epoch": 1.3328266261300903, "grad_norm": 0.42318978905677795, "learning_rate": 6.531611782767866e-07, "loss": 0.6578, "step": 1042 }, { "epoch": 1.334106728538283, "grad_norm": 1.354992389678955, "learning_rate": 6.525562155060871e-07, "loss": 0.6876, "step": 1043 }, { "epoch": 1.3353868309464758, "grad_norm": 0.41942623257637024, "learning_rate": 6.519510571669075e-07, "loss": 0.6753, "step": 1044 }, { "epoch": 1.3366669333546684, "grad_norm": 1.0365906953811646, "learning_rate": 6.51345704413248e-07, "loss": 0.6917, "step": 1045 }, { "epoch": 1.337947035762861, "grad_norm": 0.7890437841415405, "learning_rate": 6.507401583994793e-07, "loss": 0.6911, "step": 1046 }, { "epoch": 1.3392271381710537, "grad_norm": 1.4339604377746582, "learning_rate": 6.501344202803414e-07, "loss": 0.6744, "step": 1047 }, { "epoch": 1.3405072405792464, "grad_norm": 1.0097036361694336, "learning_rate": 6.495284912109399e-07, "loss": 0.6539, "step": 1048 }, { "epoch": 1.341787342987439, "grad_norm": 1.587397575378418, "learning_rate": 6.489223723467447e-07, "loss": 0.6739, "step": 1049 }, { "epoch": 1.3430674453956317, "grad_norm": 0.8523529767990112, "learning_rate": 6.483160648435879e-07, "loss": 0.6742, "step": 1050 }, { "epoch": 1.3430674453956317, "eval_loss": 0.020404193550348282, "eval_runtime": 42.0933, "eval_samples_per_second": 11.783, "eval_steps_per_second": 1.473, "step": 1050 }, { "epoch": 1.3443475478038243, "grad_norm": 0.48347529768943787, "learning_rate": 6.477095698576608e-07, "loss": 0.6597, "step": 1051 }, { "epoch": 1.345627650212017, "grad_norm": 0.5454186201095581, "learning_rate": 6.471028885455127e-07, "loss": 0.6624, "step": 1052 }, { "epoch": 1.3469077526202096, "grad_norm": 0.7986537218093872, "learning_rate": 6.464960220640482e-07, "loss": 0.6814, "step": 1053 }, { "epoch": 1.3481878550284023, "grad_norm": 1.401473045349121, "learning_rate": 6.458889715705248e-07, "loss": 0.6605, "step": 1054 }, { "epoch": 1.3494679574365949, "grad_norm": 0.7585673928260803, "learning_rate": 6.452817382225506e-07, "loss": 0.6937, "step": 1055 }, { "epoch": 1.3507480598447876, "grad_norm": 0.8887014985084534, "learning_rate": 6.446743231780833e-07, "loss": 0.6603, "step": 1056 }, { "epoch": 1.3520281622529802, "grad_norm": 1.0830944776535034, "learning_rate": 6.440667275954262e-07, "loss": 0.682, "step": 1057 }, { "epoch": 1.353308264661173, "grad_norm": 0.38284140825271606, "learning_rate": 6.434589526332272e-07, "loss": 0.6526, "step": 1058 }, { "epoch": 1.3545883670693655, "grad_norm": 0.4562026858329773, "learning_rate": 6.428509994504765e-07, "loss": 0.6905, "step": 1059 }, { "epoch": 1.3558684694775582, "grad_norm": 1.7439802885055542, "learning_rate": 6.422428692065037e-07, "loss": 0.678, "step": 1060 }, { "epoch": 1.3571485718857508, "grad_norm": 0.4282066226005554, "learning_rate": 6.416345630609763e-07, "loss": 0.6585, "step": 1061 }, { "epoch": 1.3584286742939435, "grad_norm": 0.6055359840393066, "learning_rate": 6.410260821738973e-07, "loss": 0.6523, "step": 1062 }, { "epoch": 1.3597087767021363, "grad_norm": 0.34060728549957275, "learning_rate": 6.404174277056028e-07, "loss": 0.6639, "step": 1063 }, { "epoch": 1.3609888791103288, "grad_norm": 0.889231264591217, "learning_rate": 6.398086008167601e-07, "loss": 0.6584, "step": 1064 }, { "epoch": 1.3622689815185214, "grad_norm": 0.7120441198348999, "learning_rate": 6.391996026683648e-07, "loss": 0.6554, "step": 1065 }, { "epoch": 1.3635490839267141, "grad_norm": 0.4765358567237854, "learning_rate": 6.385904344217395e-07, "loss": 0.6637, "step": 1066 }, { "epoch": 1.364829186334907, "grad_norm": 0.9561916589736938, "learning_rate": 6.379810972385315e-07, "loss": 0.6777, "step": 1067 }, { "epoch": 1.3661092887430994, "grad_norm": 0.8768443465232849, "learning_rate": 6.373715922807092e-07, "loss": 0.659, "step": 1068 }, { "epoch": 1.367389391151292, "grad_norm": 1.495634913444519, "learning_rate": 6.36761920710562e-07, "loss": 0.6749, "step": 1069 }, { "epoch": 1.3686694935594848, "grad_norm": 1.2202892303466797, "learning_rate": 6.361520836906965e-07, "loss": 0.6734, "step": 1070 }, { "epoch": 1.3699495959676775, "grad_norm": 1.083799958229065, "learning_rate": 6.355420823840349e-07, "loss": 0.6655, "step": 1071 }, { "epoch": 1.37122969837587, "grad_norm": 1.4903268814086914, "learning_rate": 6.349319179538125e-07, "loss": 0.6636, "step": 1072 }, { "epoch": 1.3725098007840626, "grad_norm": 1.3371798992156982, "learning_rate": 6.343215915635761e-07, "loss": 0.6932, "step": 1073 }, { "epoch": 1.3737899031922554, "grad_norm": 1.57052743434906, "learning_rate": 6.337111043771809e-07, "loss": 0.6728, "step": 1074 }, { "epoch": 1.3750700056004481, "grad_norm": 0.6461338400840759, "learning_rate": 6.33100457558789e-07, "loss": 0.6722, "step": 1075 }, { "epoch": 1.3763501080086407, "grad_norm": 0.8064312934875488, "learning_rate": 6.32489652272867e-07, "loss": 0.6755, "step": 1076 }, { "epoch": 1.3776302104168334, "grad_norm": 0.6215510368347168, "learning_rate": 6.318786896841834e-07, "loss": 0.6661, "step": 1077 }, { "epoch": 1.378910312825026, "grad_norm": 1.7029057741165161, "learning_rate": 6.312675709578064e-07, "loss": 0.6797, "step": 1078 }, { "epoch": 1.3801904152332187, "grad_norm": 1.0701732635498047, "learning_rate": 6.30656297259103e-07, "loss": 0.664, "step": 1079 }, { "epoch": 1.3814705176414113, "grad_norm": 0.4341570734977722, "learning_rate": 6.300448697537345e-07, "loss": 0.6684, "step": 1080 }, { "epoch": 1.3814705176414113, "eval_loss": 0.020331211388111115, "eval_runtime": 42.044, "eval_samples_per_second": 11.797, "eval_steps_per_second": 1.475, "step": 1080 }, { "epoch": 1.382750620049604, "grad_norm": 0.5554323792457581, "learning_rate": 6.294332896076564e-07, "loss": 0.6613, "step": 1081 }, { "epoch": 1.3840307224577966, "grad_norm": 2.0100648403167725, "learning_rate": 6.288215579871148e-07, "loss": 0.6725, "step": 1082 }, { "epoch": 1.3853108248659893, "grad_norm": 1.90065336227417, "learning_rate": 6.282096760586447e-07, "loss": 0.6639, "step": 1083 }, { "epoch": 1.3865909272741819, "grad_norm": 3.765817403793335, "learning_rate": 6.275976449890679e-07, "loss": 0.6848, "step": 1084 }, { "epoch": 1.3878710296823746, "grad_norm": 3.0655605792999268, "learning_rate": 6.269854659454907e-07, "loss": 0.664, "step": 1085 }, { "epoch": 1.3891511320905672, "grad_norm": 1.8955802917480469, "learning_rate": 6.26373140095301e-07, "loss": 0.6505, "step": 1086 }, { "epoch": 1.39043123449876, "grad_norm": 1.1710799932479858, "learning_rate": 6.257606686061671e-07, "loss": 0.6724, "step": 1087 }, { "epoch": 1.3917113369069525, "grad_norm": 0.3802966773509979, "learning_rate": 6.251480526460356e-07, "loss": 0.6643, "step": 1088 }, { "epoch": 1.3929914393151452, "grad_norm": 2.213221549987793, "learning_rate": 6.245352933831271e-07, "loss": 0.6717, "step": 1089 }, { "epoch": 1.394271541723338, "grad_norm": 2.286634922027588, "learning_rate": 6.23922391985937e-07, "loss": 0.6598, "step": 1090 }, { "epoch": 1.3955516441315305, "grad_norm": 1.6092549562454224, "learning_rate": 6.233093496232305e-07, "loss": 0.6614, "step": 1091 }, { "epoch": 1.396831746539723, "grad_norm": 3.517232894897461, "learning_rate": 6.226961674640425e-07, "loss": 0.6691, "step": 1092 }, { "epoch": 1.3981118489479158, "grad_norm": 2.5525524616241455, "learning_rate": 6.220828466776742e-07, "loss": 0.7016, "step": 1093 }, { "epoch": 1.3993919513561086, "grad_norm": 1.5468311309814453, "learning_rate": 6.214693884336913e-07, "loss": 0.6493, "step": 1094 }, { "epoch": 1.4006720537643012, "grad_norm": 1.385180950164795, "learning_rate": 6.208557939019208e-07, "loss": 0.6755, "step": 1095 }, { "epoch": 1.4019521561724937, "grad_norm": 1.482412338256836, "learning_rate": 6.20242064252451e-07, "loss": 0.6753, "step": 1096 }, { "epoch": 1.4032322585806865, "grad_norm": 3.4137392044067383, "learning_rate": 6.196282006556265e-07, "loss": 0.6783, "step": 1097 }, { "epoch": 1.4045123609888792, "grad_norm": 2.346161365509033, "learning_rate": 6.190142042820483e-07, "loss": 0.666, "step": 1098 }, { "epoch": 1.4057924633970718, "grad_norm": 2.676950693130493, "learning_rate": 6.184000763025703e-07, "loss": 0.667, "step": 1099 }, { "epoch": 1.4070725658052643, "grad_norm": 2.321420907974243, "learning_rate": 6.177858178882967e-07, "loss": 0.6681, "step": 1100 }, { "epoch": 1.408352668213457, "grad_norm": 2.5199320316314697, "learning_rate": 6.171714302105818e-07, "loss": 0.6612, "step": 1101 }, { "epoch": 1.4096327706216498, "grad_norm": 0.7921889424324036, "learning_rate": 6.165569144410252e-07, "loss": 0.6931, "step": 1102 }, { "epoch": 1.4109128730298424, "grad_norm": 0.519821047782898, "learning_rate": 6.159422717514711e-07, "loss": 0.6743, "step": 1103 }, { "epoch": 1.4121929754380351, "grad_norm": 0.7353885769844055, "learning_rate": 6.153275033140062e-07, "loss": 0.6935, "step": 1104 }, { "epoch": 1.4134730778462277, "grad_norm": 2.9378724098205566, "learning_rate": 6.147126103009562e-07, "loss": 0.6797, "step": 1105 }, { "epoch": 1.4147531802544204, "grad_norm": 2.134580612182617, "learning_rate": 6.140975938848849e-07, "loss": 0.6755, "step": 1106 }, { "epoch": 1.416033282662613, "grad_norm": 1.632208228111267, "learning_rate": 6.134824552385914e-07, "loss": 0.6539, "step": 1107 }, { "epoch": 1.4173133850708057, "grad_norm": 0.9331590533256531, "learning_rate": 6.128671955351077e-07, "loss": 0.6859, "step": 1108 }, { "epoch": 1.4185934874789983, "grad_norm": 1.6567165851593018, "learning_rate": 6.122518159476967e-07, "loss": 0.6846, "step": 1109 }, { "epoch": 1.419873589887191, "grad_norm": 1.2426944971084595, "learning_rate": 6.1163631764985e-07, "loss": 0.6525, "step": 1110 }, { "epoch": 1.419873589887191, "eval_loss": 0.020281776785850525, "eval_runtime": 41.9773, "eval_samples_per_second": 11.816, "eval_steps_per_second": 1.477, "step": 1110 }, { "epoch": 1.4211536922953836, "grad_norm": 1.386154055595398, "learning_rate": 6.110207018152854e-07, "loss": 0.646, "step": 1111 }, { "epoch": 1.4224337947035763, "grad_norm": 0.7971065044403076, "learning_rate": 6.10404969617945e-07, "loss": 0.6446, "step": 1112 }, { "epoch": 1.4237138971117689, "grad_norm": 0.5663548111915588, "learning_rate": 6.097891222319928e-07, "loss": 0.6762, "step": 1113 }, { "epoch": 1.4249939995199616, "grad_norm": 1.0177338123321533, "learning_rate": 6.091731608318123e-07, "loss": 0.6438, "step": 1114 }, { "epoch": 1.4262741019281542, "grad_norm": 1.681946873664856, "learning_rate": 6.085570865920044e-07, "loss": 0.6851, "step": 1115 }, { "epoch": 1.427554204336347, "grad_norm": 0.41219356656074524, "learning_rate": 6.079409006873856e-07, "loss": 0.6692, "step": 1116 }, { "epoch": 1.4288343067445395, "grad_norm": 0.360147088766098, "learning_rate": 6.07324604292985e-07, "loss": 0.6573, "step": 1117 }, { "epoch": 1.4301144091527322, "grad_norm": 0.7511910796165466, "learning_rate": 6.067081985840421e-07, "loss": 0.657, "step": 1118 }, { "epoch": 1.4313945115609248, "grad_norm": 0.8758702874183655, "learning_rate": 6.060916847360055e-07, "loss": 0.6634, "step": 1119 }, { "epoch": 1.4326746139691175, "grad_norm": 1.2812691926956177, "learning_rate": 6.054750639245295e-07, "loss": 0.6555, "step": 1120 }, { "epoch": 1.4339547163773103, "grad_norm": 0.9138062000274658, "learning_rate": 6.048583373254727e-07, "loss": 0.6673, "step": 1121 }, { "epoch": 1.4352348187855029, "grad_norm": 0.8750235438346863, "learning_rate": 6.042415061148953e-07, "loss": 0.6702, "step": 1122 }, { "epoch": 1.4365149211936954, "grad_norm": 1.7591211795806885, "learning_rate": 6.03624571469057e-07, "loss": 0.6634, "step": 1123 }, { "epoch": 1.4377950236018882, "grad_norm": 2.2637319564819336, "learning_rate": 6.030075345644148e-07, "loss": 0.6344, "step": 1124 }, { "epoch": 1.439075126010081, "grad_norm": 2.218717336654663, "learning_rate": 6.023903965776203e-07, "loss": 0.6408, "step": 1125 }, { "epoch": 1.4403552284182735, "grad_norm": 1.3015824556350708, "learning_rate": 6.017731586855186e-07, "loss": 0.6728, "step": 1126 }, { "epoch": 1.441635330826466, "grad_norm": 1.400359869003296, "learning_rate": 6.011558220651445e-07, "loss": 0.6846, "step": 1127 }, { "epoch": 1.4429154332346588, "grad_norm": 0.9837814569473267, "learning_rate": 6.00538387893722e-07, "loss": 0.6692, "step": 1128 }, { "epoch": 1.4441955356428515, "grad_norm": 1.9228425025939941, "learning_rate": 5.999208573486602e-07, "loss": 0.6307, "step": 1129 }, { "epoch": 1.445475638051044, "grad_norm": 2.6433122158050537, "learning_rate": 5.993032316075525e-07, "loss": 0.6605, "step": 1130 }, { "epoch": 1.4467557404592366, "grad_norm": 2.544320583343506, "learning_rate": 5.986855118481735e-07, "loss": 0.6627, "step": 1131 }, { "epoch": 1.4480358428674294, "grad_norm": 2.4643025398254395, "learning_rate": 5.980676992484777e-07, "loss": 0.6527, "step": 1132 }, { "epoch": 1.4493159452756221, "grad_norm": 1.4606987237930298, "learning_rate": 5.974497949865961e-07, "loss": 0.671, "step": 1133 }, { "epoch": 1.4505960476838147, "grad_norm": 0.679926335811615, "learning_rate": 5.968318002408347e-07, "loss": 0.6786, "step": 1134 }, { "epoch": 1.4518761500920074, "grad_norm": 0.5531436204910278, "learning_rate": 5.962137161896714e-07, "loss": 0.6853, "step": 1135 }, { "epoch": 1.4531562525002, "grad_norm": 1.6512336730957031, "learning_rate": 5.955955440117559e-07, "loss": 0.663, "step": 1136 }, { "epoch": 1.4544363549083927, "grad_norm": 1.0797758102416992, "learning_rate": 5.949772848859042e-07, "loss": 0.6709, "step": 1137 }, { "epoch": 1.4557164573165853, "grad_norm": 1.055686116218567, "learning_rate": 5.943589399910996e-07, "loss": 0.6739, "step": 1138 }, { "epoch": 1.456996559724778, "grad_norm": 0.6718446612358093, "learning_rate": 5.937405105064879e-07, "loss": 0.6757, "step": 1139 }, { "epoch": 1.4582766621329706, "grad_norm": 0.7947307825088501, "learning_rate": 5.931219976113767e-07, "loss": 0.6595, "step": 1140 }, { "epoch": 1.4582766621329706, "eval_loss": 0.020231926813721657, "eval_runtime": 41.898, "eval_samples_per_second": 11.838, "eval_steps_per_second": 1.48, "step": 1140 }, { "epoch": 1.4595567645411633, "grad_norm": 2.217567205429077, "learning_rate": 5.925034024852327e-07, "loss": 0.647, "step": 1141 }, { "epoch": 1.4608368669493559, "grad_norm": 2.1660468578338623, "learning_rate": 5.918847263076791e-07, "loss": 0.6752, "step": 1142 }, { "epoch": 1.4621169693575486, "grad_norm": 2.45143461227417, "learning_rate": 5.912659702584938e-07, "loss": 0.657, "step": 1143 }, { "epoch": 1.4633970717657412, "grad_norm": 2.1579649448394775, "learning_rate": 5.90647135517607e-07, "loss": 0.6273, "step": 1144 }, { "epoch": 1.464677174173934, "grad_norm": 0.9146259427070618, "learning_rate": 5.900282232650994e-07, "loss": 0.6464, "step": 1145 }, { "epoch": 1.4659572765821265, "grad_norm": 0.7225512862205505, "learning_rate": 5.894092346811988e-07, "loss": 0.6646, "step": 1146 }, { "epoch": 1.4672373789903193, "grad_norm": 1.8353562355041504, "learning_rate": 5.887901709462787e-07, "loss": 0.671, "step": 1147 }, { "epoch": 1.468517481398512, "grad_norm": 2.3702549934387207, "learning_rate": 5.881710332408564e-07, "loss": 0.6659, "step": 1148 }, { "epoch": 1.4697975838067046, "grad_norm": 1.318329095840454, "learning_rate": 5.875518227455899e-07, "loss": 0.6695, "step": 1149 }, { "epoch": 1.471077686214897, "grad_norm": 1.2571388483047485, "learning_rate": 5.869325406412758e-07, "loss": 0.6593, "step": 1150 }, { "epoch": 1.4723577886230899, "grad_norm": 0.3515982925891876, "learning_rate": 5.863131881088477e-07, "loss": 0.6684, "step": 1151 }, { "epoch": 1.4736378910312826, "grad_norm": 1.0072952508926392, "learning_rate": 5.856937663293734e-07, "loss": 0.6645, "step": 1152 }, { "epoch": 1.4749179934394752, "grad_norm": 1.0054341554641724, "learning_rate": 5.850742764840524e-07, "loss": 0.6757, "step": 1153 }, { "epoch": 1.4761980958476677, "grad_norm": 1.1498204469680786, "learning_rate": 5.844547197542144e-07, "loss": 0.6792, "step": 1154 }, { "epoch": 1.4774781982558605, "grad_norm": 1.4466193914413452, "learning_rate": 5.838350973213164e-07, "loss": 0.6568, "step": 1155 }, { "epoch": 1.4787583006640532, "grad_norm": 0.849064290523529, "learning_rate": 5.832154103669408e-07, "loss": 0.641, "step": 1156 }, { "epoch": 1.4800384030722458, "grad_norm": 1.025129795074463, "learning_rate": 5.825956600727931e-07, "loss": 0.6759, "step": 1157 }, { "epoch": 1.4813185054804383, "grad_norm": 0.7013861536979675, "learning_rate": 5.819758476206995e-07, "loss": 0.6934, "step": 1158 }, { "epoch": 1.482598607888631, "grad_norm": 0.40306708216667175, "learning_rate": 5.813559741926045e-07, "loss": 0.6717, "step": 1159 }, { "epoch": 1.4838787102968238, "grad_norm": 0.9272669553756714, "learning_rate": 5.807360409705695e-07, "loss": 0.6368, "step": 1160 }, { "epoch": 1.4851588127050164, "grad_norm": 0.7975537180900574, "learning_rate": 5.801160491367693e-07, "loss": 0.6595, "step": 1161 }, { "epoch": 1.4864389151132091, "grad_norm": 2.527916431427002, "learning_rate": 5.794959998734907e-07, "loss": 0.6638, "step": 1162 }, { "epoch": 1.4877190175214017, "grad_norm": 2.931472063064575, "learning_rate": 5.788758943631301e-07, "loss": 0.6595, "step": 1163 }, { "epoch": 1.4889991199295944, "grad_norm": 3.970729351043701, "learning_rate": 5.78255733788191e-07, "loss": 0.6497, "step": 1164 }, { "epoch": 1.490279222337787, "grad_norm": 3.603180170059204, "learning_rate": 5.776355193312822e-07, "loss": 0.6458, "step": 1165 }, { "epoch": 1.4915593247459797, "grad_norm": 2.7362325191497803, "learning_rate": 5.770152521751147e-07, "loss": 0.6691, "step": 1166 }, { "epoch": 1.4928394271541723, "grad_norm": 2.2429797649383545, "learning_rate": 5.763949335025005e-07, "loss": 0.6464, "step": 1167 }, { "epoch": 1.494119529562365, "grad_norm": 0.7235007882118225, "learning_rate": 5.757745644963499e-07, "loss": 0.6657, "step": 1168 }, { "epoch": 1.4953996319705576, "grad_norm": 0.75119549036026, "learning_rate": 5.751541463396686e-07, "loss": 0.6506, "step": 1169 }, { "epoch": 1.4966797343787503, "grad_norm": 2.6939613819122314, "learning_rate": 5.745336802155566e-07, "loss": 0.6698, "step": 1170 }, { "epoch": 1.4966797343787503, "eval_loss": 0.02045726589858532, "eval_runtime": 42.3176, "eval_samples_per_second": 11.721, "eval_steps_per_second": 1.465, "step": 1170 }, { "epoch": 1.4979598367869429, "grad_norm": 2.579827070236206, "learning_rate": 5.739131673072048e-07, "loss": 0.6634, "step": 1171 }, { "epoch": 1.4992399391951357, "grad_norm": 1.8238277435302734, "learning_rate": 5.732926087978943e-07, "loss": 0.6612, "step": 1172 }, { "epoch": 1.5005200416033282, "grad_norm": 2.0525503158569336, "learning_rate": 5.726720058709918e-07, "loss": 0.6733, "step": 1173 }, { "epoch": 1.501800144011521, "grad_norm": 1.0010119676589966, "learning_rate": 5.720513597099501e-07, "loss": 0.6823, "step": 1174 }, { "epoch": 1.5030802464197137, "grad_norm": 0.3749968111515045, "learning_rate": 5.714306714983033e-07, "loss": 0.6593, "step": 1175 }, { "epoch": 1.5043603488279063, "grad_norm": 1.0137040615081787, "learning_rate": 5.708099424196662e-07, "loss": 0.6542, "step": 1176 }, { "epoch": 1.5056404512360988, "grad_norm": 1.182702898979187, "learning_rate": 5.701891736577317e-07, "loss": 0.6569, "step": 1177 }, { "epoch": 1.5069205536442916, "grad_norm": 1.961451530456543, "learning_rate": 5.695683663962682e-07, "loss": 0.6665, "step": 1178 }, { "epoch": 1.5082006560524843, "grad_norm": 1.380611777305603, "learning_rate": 5.689475218191169e-07, "loss": 0.6454, "step": 1179 }, { "epoch": 1.5094807584606769, "grad_norm": 1.4815675020217896, "learning_rate": 5.683266411101917e-07, "loss": 0.6751, "step": 1180 }, { "epoch": 1.5107608608688694, "grad_norm": 0.7939832210540771, "learning_rate": 5.677057254534736e-07, "loss": 0.6672, "step": 1181 }, { "epoch": 1.5120409632770622, "grad_norm": 0.4368623197078705, "learning_rate": 5.670847760330114e-07, "loss": 0.6662, "step": 1182 }, { "epoch": 1.513321065685255, "grad_norm": 1.385303020477295, "learning_rate": 5.66463794032918e-07, "loss": 0.6574, "step": 1183 }, { "epoch": 1.5146011680934475, "grad_norm": 0.5392059087753296, "learning_rate": 5.658427806373685e-07, "loss": 0.6636, "step": 1184 }, { "epoch": 1.51588127050164, "grad_norm": 0.45560914278030396, "learning_rate": 5.652217370305973e-07, "loss": 0.6685, "step": 1185 }, { "epoch": 1.5171613729098328, "grad_norm": 0.6280664801597595, "learning_rate": 5.646006643968974e-07, "loss": 0.6664, "step": 1186 }, { "epoch": 1.5184414753180255, "grad_norm": 1.4717463254928589, "learning_rate": 5.639795639206166e-07, "loss": 0.6747, "step": 1187 }, { "epoch": 1.519721577726218, "grad_norm": 1.4434207677841187, "learning_rate": 5.633584367861555e-07, "loss": 0.6552, "step": 1188 }, { "epoch": 1.5210016801344106, "grad_norm": 0.7542391419410706, "learning_rate": 5.627372841779659e-07, "loss": 0.6669, "step": 1189 }, { "epoch": 1.5222817825426034, "grad_norm": 0.4922533929347992, "learning_rate": 5.621161072805483e-07, "loss": 0.6533, "step": 1190 }, { "epoch": 1.5235618849507961, "grad_norm": 1.7764134407043457, "learning_rate": 5.614949072784492e-07, "loss": 0.6722, "step": 1191 }, { "epoch": 1.5248419873589887, "grad_norm": 0.9773665070533752, "learning_rate": 5.608736853562596e-07, "loss": 0.6604, "step": 1192 }, { "epoch": 1.5261220897671812, "grad_norm": 0.7025289535522461, "learning_rate": 5.602524426986117e-07, "loss": 0.6895, "step": 1193 }, { "epoch": 1.527402192175374, "grad_norm": 0.3457857668399811, "learning_rate": 5.596311804901777e-07, "loss": 0.6618, "step": 1194 }, { "epoch": 1.5286822945835667, "grad_norm": 0.5850967168807983, "learning_rate": 5.590098999156667e-07, "loss": 0.6717, "step": 1195 }, { "epoch": 1.5299623969917593, "grad_norm": 0.611171305179596, "learning_rate": 5.583886021598234e-07, "loss": 0.674, "step": 1196 }, { "epoch": 1.531242499399952, "grad_norm": 0.42724570631980896, "learning_rate": 5.577672884074249e-07, "loss": 0.6604, "step": 1197 }, { "epoch": 1.5325226018081448, "grad_norm": 0.770753026008606, "learning_rate": 5.571459598432786e-07, "loss": 0.6439, "step": 1198 }, { "epoch": 1.5338027042163374, "grad_norm": 1.2898622751235962, "learning_rate": 5.565246176522204e-07, "loss": 0.6761, "step": 1199 }, { "epoch": 1.53508280662453, "grad_norm": 2.31323504447937, "learning_rate": 5.559032630191123e-07, "loss": 0.6703, "step": 1200 }, { "epoch": 1.53508280662453, "eval_loss": 0.02037089504301548, "eval_runtime": 42.227, "eval_samples_per_second": 11.746, "eval_steps_per_second": 1.468, "step": 1200 }, { "epoch": 1.5363629090327227, "grad_norm": 1.2492107152938843, "learning_rate": 5.552818971288397e-07, "loss": 0.6561, "step": 1201 }, { "epoch": 1.5376430114409154, "grad_norm": 0.35306423902511597, "learning_rate": 5.546605211663099e-07, "loss": 0.6567, "step": 1202 }, { "epoch": 1.538923113849108, "grad_norm": 0.36753401160240173, "learning_rate": 5.540391363164491e-07, "loss": 0.6711, "step": 1203 }, { "epoch": 1.5402032162573005, "grad_norm": 1.5945085287094116, "learning_rate": 5.534177437642005e-07, "loss": 0.6884, "step": 1204 }, { "epoch": 1.5414833186654933, "grad_norm": 0.44810953736305237, "learning_rate": 5.527963446945215e-07, "loss": 0.6387, "step": 1205 }, { "epoch": 1.542763421073686, "grad_norm": 0.6199507713317871, "learning_rate": 5.521749402923832e-07, "loss": 0.662, "step": 1206 }, { "epoch": 1.5440435234818786, "grad_norm": 0.3312099277973175, "learning_rate": 5.515535317427657e-07, "loss": 0.6745, "step": 1207 }, { "epoch": 1.545323625890071, "grad_norm": 0.6081328988075256, "learning_rate": 5.509321202306573e-07, "loss": 0.6603, "step": 1208 }, { "epoch": 1.5466037282982639, "grad_norm": 0.36688658595085144, "learning_rate": 5.50310706941052e-07, "loss": 0.667, "step": 1209 }, { "epoch": 1.5478838307064566, "grad_norm": 0.568301796913147, "learning_rate": 5.496892930589479e-07, "loss": 0.6565, "step": 1210 }, { "epoch": 1.5491639331146492, "grad_norm": 0.3534736633300781, "learning_rate": 5.490678797693427e-07, "loss": 0.6608, "step": 1211 }, { "epoch": 1.5504440355228417, "grad_norm": 0.3959224224090576, "learning_rate": 5.484464682572345e-07, "loss": 0.6769, "step": 1212 }, { "epoch": 1.5517241379310345, "grad_norm": 0.5038546919822693, "learning_rate": 5.47825059707617e-07, "loss": 0.6431, "step": 1213 }, { "epoch": 1.5530042403392272, "grad_norm": 0.5618546009063721, "learning_rate": 5.472036553054786e-07, "loss": 0.6689, "step": 1214 }, { "epoch": 1.5542843427474198, "grad_norm": 1.3786736726760864, "learning_rate": 5.465822562357998e-07, "loss": 0.6809, "step": 1215 }, { "epoch": 1.5555644451556123, "grad_norm": 0.7807756662368774, "learning_rate": 5.459608636835509e-07, "loss": 0.6597, "step": 1216 }, { "epoch": 1.556844547563805, "grad_norm": 1.2260596752166748, "learning_rate": 5.4533947883369e-07, "loss": 0.6702, "step": 1217 }, { "epoch": 1.5581246499719978, "grad_norm": 1.7564269304275513, "learning_rate": 5.447181028711601e-07, "loss": 0.6625, "step": 1218 }, { "epoch": 1.5594047523801904, "grad_norm": 0.4762384593486786, "learning_rate": 5.440967369808878e-07, "loss": 0.6251, "step": 1219 }, { "epoch": 1.560684854788383, "grad_norm": 0.7580328583717346, "learning_rate": 5.434753823477797e-07, "loss": 0.6384, "step": 1220 }, { "epoch": 1.5619649571965757, "grad_norm": 0.5596209168434143, "learning_rate": 5.428540401567215e-07, "loss": 0.6758, "step": 1221 }, { "epoch": 1.5632450596047684, "grad_norm": 0.9199832081794739, "learning_rate": 5.422327115925752e-07, "loss": 0.6768, "step": 1222 }, { "epoch": 1.564525162012961, "grad_norm": 0.4001198709011078, "learning_rate": 5.416113978401765e-07, "loss": 0.6587, "step": 1223 }, { "epoch": 1.5658052644211535, "grad_norm": 0.45158153772354126, "learning_rate": 5.409901000843332e-07, "loss": 0.6693, "step": 1224 }, { "epoch": 1.5670853668293463, "grad_norm": 0.5261472463607788, "learning_rate": 5.403688195098225e-07, "loss": 0.6609, "step": 1225 }, { "epoch": 1.568365469237539, "grad_norm": 0.3869059085845947, "learning_rate": 5.397475573013883e-07, "loss": 0.6438, "step": 1226 }, { "epoch": 1.5696455716457316, "grad_norm": 0.375410795211792, "learning_rate": 5.391263146437406e-07, "loss": 0.6365, "step": 1227 }, { "epoch": 1.5709256740539244, "grad_norm": 0.8657992482185364, "learning_rate": 5.385050927215507e-07, "loss": 0.657, "step": 1228 }, { "epoch": 1.5722057764621171, "grad_norm": 0.5424736738204956, "learning_rate": 5.378838927194518e-07, "loss": 0.6416, "step": 1229 }, { "epoch": 1.5734858788703097, "grad_norm": 0.3917340934276581, "learning_rate": 5.372627158220342e-07, "loss": 0.6661, "step": 1230 }, { "epoch": 1.5734858788703097, "eval_loss": 0.02028779499232769, "eval_runtime": 42.104, "eval_samples_per_second": 11.78, "eval_steps_per_second": 1.473, "step": 1230 }, { "epoch": 1.5747659812785022, "grad_norm": 0.4967162311077118, "learning_rate": 5.366415632138446e-07, "loss": 0.6674, "step": 1231 }, { "epoch": 1.576046083686695, "grad_norm": 1.051540732383728, "learning_rate": 5.360204360793836e-07, "loss": 0.6492, "step": 1232 }, { "epoch": 1.5773261860948877, "grad_norm": 0.7986653447151184, "learning_rate": 5.353993356031025e-07, "loss": 0.6511, "step": 1233 }, { "epoch": 1.5786062885030803, "grad_norm": 0.3991658091545105, "learning_rate": 5.347782629694025e-07, "loss": 0.6605, "step": 1234 }, { "epoch": 1.5798863909112728, "grad_norm": 0.49220219254493713, "learning_rate": 5.341572193626315e-07, "loss": 0.6542, "step": 1235 }, { "epoch": 1.5811664933194656, "grad_norm": 0.3949640989303589, "learning_rate": 5.33536205967082e-07, "loss": 0.6573, "step": 1236 }, { "epoch": 1.5824465957276583, "grad_norm": 1.639223337173462, "learning_rate": 5.329152239669887e-07, "loss": 0.6751, "step": 1237 }, { "epoch": 1.5837266981358509, "grad_norm": 0.3700657784938812, "learning_rate": 5.322942745465265e-07, "loss": 0.6611, "step": 1238 }, { "epoch": 1.5850068005440434, "grad_norm": 0.8532276153564453, "learning_rate": 5.316733588898084e-07, "loss": 0.6816, "step": 1239 }, { "epoch": 1.5862869029522362, "grad_norm": 1.1979786157608032, "learning_rate": 5.310524781808829e-07, "loss": 0.6647, "step": 1240 }, { "epoch": 1.587567005360429, "grad_norm": 0.5176545977592468, "learning_rate": 5.304316336037319e-07, "loss": 0.655, "step": 1241 }, { "epoch": 1.5888471077686215, "grad_norm": 1.1874502897262573, "learning_rate": 5.298108263422685e-07, "loss": 0.6563, "step": 1242 }, { "epoch": 1.590127210176814, "grad_norm": 2.2317183017730713, "learning_rate": 5.291900575803337e-07, "loss": 0.658, "step": 1243 }, { "epoch": 1.5914073125850068, "grad_norm": 1.3642164468765259, "learning_rate": 5.285693285016969e-07, "loss": 0.6743, "step": 1244 }, { "epoch": 1.5926874149931995, "grad_norm": 0.3846205174922943, "learning_rate": 5.279486402900499e-07, "loss": 0.6662, "step": 1245 }, { "epoch": 1.593967517401392, "grad_norm": 0.7175666093826294, "learning_rate": 5.273279941290082e-07, "loss": 0.6516, "step": 1246 }, { "epoch": 1.5952476198095846, "grad_norm": 0.332341730594635, "learning_rate": 5.267073912021058e-07, "loss": 0.6949, "step": 1247 }, { "epoch": 1.5965277222177774, "grad_norm": 0.3692963719367981, "learning_rate": 5.26086832692795e-07, "loss": 0.6651, "step": 1248 }, { "epoch": 1.5978078246259702, "grad_norm": 0.3464144170284271, "learning_rate": 5.254663197844436e-07, "loss": 0.6712, "step": 1249 }, { "epoch": 1.5990879270341627, "grad_norm": 1.7411247491836548, "learning_rate": 5.248458536603314e-07, "loss": 0.6792, "step": 1250 }, { "epoch": 1.6003680294423552, "grad_norm": 1.1433019638061523, "learning_rate": 5.242254355036502e-07, "loss": 0.6512, "step": 1251 }, { "epoch": 1.601648131850548, "grad_norm": 1.2717899084091187, "learning_rate": 5.236050664974994e-07, "loss": 0.6698, "step": 1252 }, { "epoch": 1.6029282342587408, "grad_norm": 0.8765652775764465, "learning_rate": 5.229847478248853e-07, "loss": 0.6483, "step": 1253 }, { "epoch": 1.6042083366669333, "grad_norm": 0.4434972107410431, "learning_rate": 5.22364480668718e-07, "loss": 0.664, "step": 1254 }, { "epoch": 1.605488439075126, "grad_norm": 0.8709170818328857, "learning_rate": 5.21744266211809e-07, "loss": 0.6837, "step": 1255 }, { "epoch": 1.6067685414833188, "grad_norm": 0.8440918326377869, "learning_rate": 5.2112410563687e-07, "loss": 0.647, "step": 1256 }, { "epoch": 1.6080486438915114, "grad_norm": 0.7353412508964539, "learning_rate": 5.205040001265093e-07, "loss": 0.6572, "step": 1257 }, { "epoch": 1.609328746299704, "grad_norm": 1.8442965745925903, "learning_rate": 5.198839508632308e-07, "loss": 0.6641, "step": 1258 }, { "epoch": 1.6106088487078967, "grad_norm": 1.093870759010315, "learning_rate": 5.192639590294307e-07, "loss": 0.6373, "step": 1259 }, { "epoch": 1.6118889511160894, "grad_norm": 1.4169665575027466, "learning_rate": 5.186440258073954e-07, "loss": 0.6739, "step": 1260 }, { "epoch": 1.6118889511160894, "eval_loss": 0.02020900882780552, "eval_runtime": 41.9852, "eval_samples_per_second": 11.814, "eval_steps_per_second": 1.477, "step": 1260 }, { "epoch": 1.613169053524282, "grad_norm": 0.8725627660751343, "learning_rate": 5.180241523793007e-07, "loss": 0.6561, "step": 1261 }, { "epoch": 1.6144491559324745, "grad_norm": 0.683057963848114, "learning_rate": 5.17404339927207e-07, "loss": 0.6474, "step": 1262 }, { "epoch": 1.6157292583406673, "grad_norm": 0.5126512050628662, "learning_rate": 5.167845896330593e-07, "loss": 0.6474, "step": 1263 }, { "epoch": 1.61700936074886, "grad_norm": 1.1767605543136597, "learning_rate": 5.161649026786836e-07, "loss": 0.6577, "step": 1264 }, { "epoch": 1.6182894631570526, "grad_norm": 0.5155271291732788, "learning_rate": 5.155452802457857e-07, "loss": 0.6353, "step": 1265 }, { "epoch": 1.6195695655652451, "grad_norm": 0.9233950972557068, "learning_rate": 5.149257235159476e-07, "loss": 0.6518, "step": 1266 }, { "epoch": 1.6208496679734379, "grad_norm": 0.33516064286231995, "learning_rate": 5.143062336706266e-07, "loss": 0.6548, "step": 1267 }, { "epoch": 1.6221297703816306, "grad_norm": 0.34788066148757935, "learning_rate": 5.136868118911522e-07, "loss": 0.6637, "step": 1268 }, { "epoch": 1.6234098727898232, "grad_norm": 2.6949563026428223, "learning_rate": 5.130674593587242e-07, "loss": 0.6814, "step": 1269 }, { "epoch": 1.6246899751980157, "grad_norm": 2.327502727508545, "learning_rate": 5.124481772544102e-07, "loss": 0.669, "step": 1270 }, { "epoch": 1.6259700776062085, "grad_norm": 1.9316380023956299, "learning_rate": 5.118289667591436e-07, "loss": 0.6484, "step": 1271 }, { "epoch": 1.6272501800144012, "grad_norm": 0.8158658146858215, "learning_rate": 5.112098290537212e-07, "loss": 0.6591, "step": 1272 }, { "epoch": 1.6285302824225938, "grad_norm": 0.5413331985473633, "learning_rate": 5.105907653188013e-07, "loss": 0.6538, "step": 1273 }, { "epoch": 1.6298103848307863, "grad_norm": 0.6301608681678772, "learning_rate": 5.099717767349006e-07, "loss": 0.6436, "step": 1274 }, { "epoch": 1.631090487238979, "grad_norm": 1.2457534074783325, "learning_rate": 5.09352864482393e-07, "loss": 0.6582, "step": 1275 }, { "epoch": 1.6323705896471719, "grad_norm": 0.33607229590415955, "learning_rate": 5.087340297415062e-07, "loss": 0.6725, "step": 1276 }, { "epoch": 1.6336506920553644, "grad_norm": 0.5030390024185181, "learning_rate": 5.08115273692321e-07, "loss": 0.6369, "step": 1277 }, { "epoch": 1.634930794463557, "grad_norm": 0.5772480368614197, "learning_rate": 5.074965975147675e-07, "loss": 0.6621, "step": 1278 }, { "epoch": 1.6362108968717497, "grad_norm": 0.33523985743522644, "learning_rate": 5.068780023886232e-07, "loss": 0.6503, "step": 1279 }, { "epoch": 1.6374909992799425, "grad_norm": 0.765847384929657, "learning_rate": 5.062594894935121e-07, "loss": 0.6571, "step": 1280 }, { "epoch": 1.638771101688135, "grad_norm": 0.58742356300354, "learning_rate": 5.056410600089004e-07, "loss": 0.6552, "step": 1281 }, { "epoch": 1.6400512040963275, "grad_norm": 1.1437314748764038, "learning_rate": 5.050227151140958e-07, "loss": 0.6711, "step": 1282 }, { "epoch": 1.6413313065045205, "grad_norm": 0.3895093500614166, "learning_rate": 5.044044559882443e-07, "loss": 0.6475, "step": 1283 }, { "epoch": 1.642611408912713, "grad_norm": 0.34801262617111206, "learning_rate": 5.037862838103285e-07, "loss": 0.6379, "step": 1284 }, { "epoch": 1.6438915113209056, "grad_norm": 0.33929601311683655, "learning_rate": 5.031681997591656e-07, "loss": 0.6627, "step": 1285 }, { "epoch": 1.6451716137290984, "grad_norm": 0.4452283978462219, "learning_rate": 5.025502050134038e-07, "loss": 0.6347, "step": 1286 }, { "epoch": 1.6464517161372911, "grad_norm": 0.3652748167514801, "learning_rate": 5.019323007515222e-07, "loss": 0.6684, "step": 1287 }, { "epoch": 1.6477318185454837, "grad_norm": 0.5500005483627319, "learning_rate": 5.013144881518264e-07, "loss": 0.6443, "step": 1288 }, { "epoch": 1.6490119209536762, "grad_norm": 0.7883321642875671, "learning_rate": 5.006967683924476e-07, "loss": 0.6586, "step": 1289 }, { "epoch": 1.650292023361869, "grad_norm": 2.2128090858459473, "learning_rate": 5.0007914265134e-07, "loss": 0.6545, "step": 1290 }, { "epoch": 1.650292023361869, "eval_loss": 0.020203562453389168, "eval_runtime": 41.9377, "eval_samples_per_second": 11.827, "eval_steps_per_second": 1.478, "step": 1290 }, { "epoch": 1.6515721257700617, "grad_norm": 1.1714468002319336, "learning_rate": 4.99461612106278e-07, "loss": 0.6572, "step": 1291 }, { "epoch": 1.6528522281782543, "grad_norm": 0.9448105692863464, "learning_rate": 4.988441779348556e-07, "loss": 0.6473, "step": 1292 }, { "epoch": 1.6541323305864468, "grad_norm": 0.5074780583381653, "learning_rate": 4.982268413144814e-07, "loss": 0.6549, "step": 1293 }, { "epoch": 1.6554124329946396, "grad_norm": 0.34554415941238403, "learning_rate": 4.976096034223798e-07, "loss": 0.6577, "step": 1294 }, { "epoch": 1.6566925354028323, "grad_norm": 0.9859076142311096, "learning_rate": 4.969924654355854e-07, "loss": 0.6513, "step": 1295 }, { "epoch": 1.6579726378110249, "grad_norm": 1.565435528755188, "learning_rate": 4.96375428530943e-07, "loss": 0.6605, "step": 1296 }, { "epoch": 1.6592527402192174, "grad_norm": 0.3245958387851715, "learning_rate": 4.957584938851047e-07, "loss": 0.6524, "step": 1297 }, { "epoch": 1.6605328426274102, "grad_norm": 1.7261874675750732, "learning_rate": 4.951416626745271e-07, "loss": 0.6585, "step": 1298 }, { "epoch": 1.661812945035603, "grad_norm": 0.6510258913040161, "learning_rate": 4.945249360754706e-07, "loss": 0.6489, "step": 1299 }, { "epoch": 1.6630930474437955, "grad_norm": 0.4207313656806946, "learning_rate": 4.939083152639946e-07, "loss": 0.6433, "step": 1300 }, { "epoch": 1.664373149851988, "grad_norm": 0.4415533244609833, "learning_rate": 4.93291801415958e-07, "loss": 0.6449, "step": 1301 }, { "epoch": 1.6656532522601808, "grad_norm": 0.5641946196556091, "learning_rate": 4.926753957070151e-07, "loss": 0.6549, "step": 1302 }, { "epoch": 1.6669333546683736, "grad_norm": 0.3372059762477875, "learning_rate": 4.920590993126143e-07, "loss": 0.6584, "step": 1303 }, { "epoch": 1.668213457076566, "grad_norm": 1.317020297050476, "learning_rate": 4.914429134079956e-07, "loss": 0.6383, "step": 1304 }, { "epoch": 1.6694935594847586, "grad_norm": 0.9823401570320129, "learning_rate": 4.908268391681878e-07, "loss": 0.643, "step": 1305 }, { "epoch": 1.6707736618929514, "grad_norm": 1.6719224452972412, "learning_rate": 4.902108777680073e-07, "loss": 0.6738, "step": 1306 }, { "epoch": 1.6720537643011442, "grad_norm": 0.5438287258148193, "learning_rate": 4.895950303820552e-07, "loss": 0.6813, "step": 1307 }, { "epoch": 1.6733338667093367, "grad_norm": 1.4882230758666992, "learning_rate": 4.889792981847147e-07, "loss": 0.6296, "step": 1308 }, { "epoch": 1.6746139691175292, "grad_norm": 1.087120532989502, "learning_rate": 4.883636823501501e-07, "loss": 0.6553, "step": 1309 }, { "epoch": 1.675894071525722, "grad_norm": 0.30989930033683777, "learning_rate": 4.877481840523032e-07, "loss": 0.6519, "step": 1310 }, { "epoch": 1.6771741739339148, "grad_norm": 0.4575180411338806, "learning_rate": 4.871328044648924e-07, "loss": 0.6552, "step": 1311 }, { "epoch": 1.6784542763421073, "grad_norm": 0.3157932162284851, "learning_rate": 4.865175447614086e-07, "loss": 0.6477, "step": 1312 }, { "epoch": 1.6797343787503, "grad_norm": 0.3302938640117645, "learning_rate": 4.859024061151151e-07, "loss": 0.647, "step": 1313 }, { "epoch": 1.6810144811584928, "grad_norm": 0.32008451223373413, "learning_rate": 4.852873896990439e-07, "loss": 0.6685, "step": 1314 }, { "epoch": 1.6822945835666854, "grad_norm": 1.7048025131225586, "learning_rate": 4.846724966859938e-07, "loss": 0.6717, "step": 1315 }, { "epoch": 1.683574685974878, "grad_norm": 1.2926671504974365, "learning_rate": 4.840577282485289e-07, "loss": 0.6576, "step": 1316 }, { "epoch": 1.6848547883830707, "grad_norm": 1.6346619129180908, "learning_rate": 4.834430855589747e-07, "loss": 0.6621, "step": 1317 }, { "epoch": 1.6861348907912634, "grad_norm": 0.3772527873516083, "learning_rate": 4.828285697894182e-07, "loss": 0.6425, "step": 1318 }, { "epoch": 1.687414993199456, "grad_norm": 1.7590543031692505, "learning_rate": 4.822141821117032e-07, "loss": 0.6641, "step": 1319 }, { "epoch": 1.6886950956076485, "grad_norm": 1.0851612091064453, "learning_rate": 4.815999236974298e-07, "loss": 0.6325, "step": 1320 }, { "epoch": 1.6886950956076485, "eval_loss": 0.020313631743192673, "eval_runtime": 42.2724, "eval_samples_per_second": 11.733, "eval_steps_per_second": 1.467, "step": 1320 }, { "epoch": 1.6899751980158413, "grad_norm": 1.5504151582717896, "learning_rate": 4.809857957179517e-07, "loss": 0.6461, "step": 1321 }, { "epoch": 1.691255300424034, "grad_norm": 1.2824076414108276, "learning_rate": 4.803717993443733e-07, "loss": 0.6614, "step": 1322 }, { "epoch": 1.6925354028322266, "grad_norm": 0.32816481590270996, "learning_rate": 4.797579357475491e-07, "loss": 0.6592, "step": 1323 }, { "epoch": 1.6938155052404191, "grad_norm": 0.6346459984779358, "learning_rate": 4.791442060980793e-07, "loss": 0.6618, "step": 1324 }, { "epoch": 1.695095607648612, "grad_norm": 1.0189234018325806, "learning_rate": 4.785306115663088e-07, "loss": 0.6589, "step": 1325 }, { "epoch": 1.6963757100568047, "grad_norm": 0.3255029022693634, "learning_rate": 4.779171533223259e-07, "loss": 0.6634, "step": 1326 }, { "epoch": 1.6976558124649972, "grad_norm": 0.48204153776168823, "learning_rate": 4.773038325359573e-07, "loss": 0.6581, "step": 1327 }, { "epoch": 1.6989359148731897, "grad_norm": 1.1111605167388916, "learning_rate": 4.7669065037676956e-07, "loss": 0.673, "step": 1328 }, { "epoch": 1.7002160172813825, "grad_norm": 0.33687517046928406, "learning_rate": 4.7607760801406325e-07, "loss": 0.6796, "step": 1329 }, { "epoch": 1.7014961196895753, "grad_norm": 1.4620877504348755, "learning_rate": 4.754647066168729e-07, "loss": 0.6651, "step": 1330 }, { "epoch": 1.7027762220977678, "grad_norm": 1.102821707725525, "learning_rate": 4.748519473539645e-07, "loss": 0.6673, "step": 1331 }, { "epoch": 1.7040563245059603, "grad_norm": 1.53020441532135, "learning_rate": 4.742393313938327e-07, "loss": 0.6457, "step": 1332 }, { "epoch": 1.705336426914153, "grad_norm": 0.3985624611377716, "learning_rate": 4.73626859904699e-07, "loss": 0.6549, "step": 1333 }, { "epoch": 1.7066165293223459, "grad_norm": 1.3187754154205322, "learning_rate": 4.7301453405450933e-07, "loss": 0.6391, "step": 1334 }, { "epoch": 1.7078966317305384, "grad_norm": 0.5049701929092407, "learning_rate": 4.7240235501093206e-07, "loss": 0.6464, "step": 1335 }, { "epoch": 1.709176734138731, "grad_norm": 1.1826415061950684, "learning_rate": 4.7179032394135533e-07, "loss": 0.6743, "step": 1336 }, { "epoch": 1.7104568365469237, "grad_norm": 1.251682162284851, "learning_rate": 4.7117844201288515e-07, "loss": 0.6568, "step": 1337 }, { "epoch": 1.7117369389551165, "grad_norm": 0.8454403281211853, "learning_rate": 4.7056671039234364e-07, "loss": 0.6584, "step": 1338 }, { "epoch": 1.713017041363309, "grad_norm": 0.8246471285820007, "learning_rate": 4.6995513024626543e-07, "loss": 0.6586, "step": 1339 }, { "epoch": 1.7142971437715018, "grad_norm": 0.8950738906860352, "learning_rate": 4.693437027408971e-07, "loss": 0.6612, "step": 1340 }, { "epoch": 1.7155772461796945, "grad_norm": 0.38885048031806946, "learning_rate": 4.687324290421937e-07, "loss": 0.6791, "step": 1341 }, { "epoch": 1.716857348587887, "grad_norm": 1.3487435579299927, "learning_rate": 4.681213103158167e-07, "loss": 0.6593, "step": 1342 }, { "epoch": 1.7181374509960796, "grad_norm": 0.327681303024292, "learning_rate": 4.67510347727133e-07, "loss": 0.664, "step": 1343 }, { "epoch": 1.7194175534042724, "grad_norm": 0.5119345188140869, "learning_rate": 4.668995424412108e-07, "loss": 0.6608, "step": 1344 }, { "epoch": 1.7206976558124651, "grad_norm": 0.9584038257598877, "learning_rate": 4.6628889562281913e-07, "loss": 0.6455, "step": 1345 }, { "epoch": 1.7219777582206577, "grad_norm": 1.7702795267105103, "learning_rate": 4.656784084364238e-07, "loss": 0.6767, "step": 1346 }, { "epoch": 1.7232578606288502, "grad_norm": 1.1456806659698486, "learning_rate": 4.6506808204618754e-07, "loss": 0.6656, "step": 1347 }, { "epoch": 1.724537963037043, "grad_norm": 0.3220290541648865, "learning_rate": 4.644579176159652e-07, "loss": 0.6623, "step": 1348 }, { "epoch": 1.7258180654452357, "grad_norm": 0.6019139885902405, "learning_rate": 4.6384791630930353e-07, "loss": 0.6801, "step": 1349 }, { "epoch": 1.7270981678534283, "grad_norm": 0.7667902708053589, "learning_rate": 4.63238079289438e-07, "loss": 0.6698, "step": 1350 }, { "epoch": 1.7270981678534283, "eval_loss": 0.020237334072589874, "eval_runtime": 42.1433, "eval_samples_per_second": 11.769, "eval_steps_per_second": 1.471, "step": 1350 }, { "epoch": 1.7283782702616208, "grad_norm": 0.3756662607192993, "learning_rate": 4.626284077192908e-07, "loss": 0.6591, "step": 1351 }, { "epoch": 1.7296583726698136, "grad_norm": 0.6636763215065002, "learning_rate": 4.620189027614686e-07, "loss": 0.6515, "step": 1352 }, { "epoch": 1.7309384750780064, "grad_norm": 0.8751712441444397, "learning_rate": 4.614095655782605e-07, "loss": 0.6566, "step": 1353 }, { "epoch": 1.732218577486199, "grad_norm": 1.4636147022247314, "learning_rate": 4.608003973316352e-07, "loss": 0.6565, "step": 1354 }, { "epoch": 1.7334986798943914, "grad_norm": 0.6845710277557373, "learning_rate": 4.6019139918324e-07, "loss": 0.6661, "step": 1355 }, { "epoch": 1.7347787823025842, "grad_norm": 0.31287074089050293, "learning_rate": 4.595825722943971e-07, "loss": 0.656, "step": 1356 }, { "epoch": 1.736058884710777, "grad_norm": 0.6977277398109436, "learning_rate": 4.589739178261027e-07, "loss": 0.6556, "step": 1357 }, { "epoch": 1.7373389871189695, "grad_norm": 0.7792723774909973, "learning_rate": 4.5836543693902386e-07, "loss": 0.6517, "step": 1358 }, { "epoch": 1.738619089527162, "grad_norm": 1.2956465482711792, "learning_rate": 4.577571307934963e-07, "loss": 0.6516, "step": 1359 }, { "epoch": 1.7398991919353548, "grad_norm": 0.4135268032550812, "learning_rate": 4.5714900054952365e-07, "loss": 0.6615, "step": 1360 }, { "epoch": 1.7411792943435476, "grad_norm": 1.612348198890686, "learning_rate": 4.565410473667727e-07, "loss": 0.6353, "step": 1361 }, { "epoch": 1.74245939675174, "grad_norm": 0.43099555373191833, "learning_rate": 4.559332724045739e-07, "loss": 0.6753, "step": 1362 }, { "epoch": 1.7437394991599326, "grad_norm": 1.7151196002960205, "learning_rate": 4.553256768219166e-07, "loss": 0.6612, "step": 1363 }, { "epoch": 1.7450196015681254, "grad_norm": 1.2959682941436768, "learning_rate": 4.547182617774493e-07, "loss": 0.6333, "step": 1364 }, { "epoch": 1.7462997039763182, "grad_norm": 2.2411410808563232, "learning_rate": 4.5411102842947536e-07, "loss": 0.6609, "step": 1365 }, { "epoch": 1.7475798063845107, "grad_norm": 1.1098517179489136, "learning_rate": 4.535039779359517e-07, "loss": 0.6724, "step": 1366 }, { "epoch": 1.7488599087927033, "grad_norm": 0.5529669523239136, "learning_rate": 4.5289711145448727e-07, "loss": 0.6626, "step": 1367 }, { "epoch": 1.750140011200896, "grad_norm": 0.38661330938339233, "learning_rate": 4.5229043014233923e-07, "loss": 0.6333, "step": 1368 }, { "epoch": 1.7514201136090888, "grad_norm": 0.29972946643829346, "learning_rate": 4.516839351564122e-07, "loss": 0.6624, "step": 1369 }, { "epoch": 1.7527002160172813, "grad_norm": 1.3552956581115723, "learning_rate": 4.510776276532553e-07, "loss": 0.6722, "step": 1370 }, { "epoch": 1.753980318425474, "grad_norm": 1.4432309865951538, "learning_rate": 4.5047150878906005e-07, "loss": 0.6507, "step": 1371 }, { "epoch": 1.7552604208336668, "grad_norm": 0.44034600257873535, "learning_rate": 4.4986557971965856e-07, "loss": 0.6383, "step": 1372 }, { "epoch": 1.7565405232418594, "grad_norm": 0.8172222375869751, "learning_rate": 4.4925984160052057e-07, "loss": 0.635, "step": 1373 }, { "epoch": 1.757820625650052, "grad_norm": 0.8878439664840698, "learning_rate": 4.4865429558675206e-07, "loss": 0.6806, "step": 1374 }, { "epoch": 1.7591007280582447, "grad_norm": 0.6996995210647583, "learning_rate": 4.4804894283309234e-07, "loss": 0.6412, "step": 1375 }, { "epoch": 1.7603808304664375, "grad_norm": 1.6466293334960938, "learning_rate": 4.4744378449391286e-07, "loss": 0.6689, "step": 1376 }, { "epoch": 1.76166093287463, "grad_norm": 1.25215744972229, "learning_rate": 4.468388217232134e-07, "loss": 0.6502, "step": 1377 }, { "epoch": 1.7629410352828225, "grad_norm": 0.46423929929733276, "learning_rate": 4.4623405567462123e-07, "loss": 0.6652, "step": 1378 }, { "epoch": 1.7642211376910153, "grad_norm": 1.15656316280365, "learning_rate": 4.4562948750138886e-07, "loss": 0.6783, "step": 1379 }, { "epoch": 1.765501240099208, "grad_norm": 0.41009005904197693, "learning_rate": 4.450251183563908e-07, "loss": 0.6553, "step": 1380 }, { "epoch": 1.765501240099208, "eval_loss": 0.020284704864025116, "eval_runtime": 42.2086, "eval_samples_per_second": 11.751, "eval_steps_per_second": 1.469, "step": 1380 }, { "epoch": 1.7667813425074006, "grad_norm": 0.7415822148323059, "learning_rate": 4.444209493921225e-07, "loss": 0.6495, "step": 1381 }, { "epoch": 1.7680614449155931, "grad_norm": 1.7425875663757324, "learning_rate": 4.438169817606975e-07, "loss": 0.6502, "step": 1382 }, { "epoch": 1.769341547323786, "grad_norm": 0.5185986757278442, "learning_rate": 4.4321321661384523e-07, "loss": 0.6698, "step": 1383 }, { "epoch": 1.7706216497319787, "grad_norm": 1.4111460447311401, "learning_rate": 4.426096551029096e-07, "loss": 0.6525, "step": 1384 }, { "epoch": 1.7719017521401712, "grad_norm": 0.3655721843242645, "learning_rate": 4.4200629837884527e-07, "loss": 0.631, "step": 1385 }, { "epoch": 1.7731818545483637, "grad_norm": 0.5166422128677368, "learning_rate": 4.4140314759221743e-07, "loss": 0.6452, "step": 1386 }, { "epoch": 1.7744619569565565, "grad_norm": 1.761288046836853, "learning_rate": 4.408002038931977e-07, "loss": 0.6607, "step": 1387 }, { "epoch": 1.7757420593647493, "grad_norm": 2.015368938446045, "learning_rate": 4.4019746843156314e-07, "loss": 0.6648, "step": 1388 }, { "epoch": 1.7770221617729418, "grad_norm": 1.4947712421417236, "learning_rate": 4.395949423566938e-07, "loss": 0.6616, "step": 1389 }, { "epoch": 1.7783022641811344, "grad_norm": 0.4151802957057953, "learning_rate": 4.389926268175703e-07, "loss": 0.6586, "step": 1390 }, { "epoch": 1.7795823665893271, "grad_norm": 1.5793638229370117, "learning_rate": 4.38390522962772e-07, "loss": 0.6599, "step": 1391 }, { "epoch": 1.7808624689975199, "grad_norm": 0.5370101928710938, "learning_rate": 4.377886319404741e-07, "loss": 0.6617, "step": 1392 }, { "epoch": 1.7821425714057124, "grad_norm": 1.1976677179336548, "learning_rate": 4.371869548984466e-07, "loss": 0.6477, "step": 1393 }, { "epoch": 1.783422673813905, "grad_norm": 0.9538538455963135, "learning_rate": 4.3658549298405077e-07, "loss": 0.662, "step": 1394 }, { "epoch": 1.7847027762220977, "grad_norm": 0.46199288964271545, "learning_rate": 4.359842473442381e-07, "loss": 0.6482, "step": 1395 }, { "epoch": 1.7859828786302905, "grad_norm": 0.888530433177948, "learning_rate": 4.3538321912554775e-07, "loss": 0.6466, "step": 1396 }, { "epoch": 1.787262981038483, "grad_norm": 1.623777985572815, "learning_rate": 4.347824094741038e-07, "loss": 0.6561, "step": 1397 }, { "epoch": 1.7885430834466758, "grad_norm": 1.2217705249786377, "learning_rate": 4.3418181953561405e-07, "loss": 0.6352, "step": 1398 }, { "epoch": 1.7898231858548685, "grad_norm": 1.288587212562561, "learning_rate": 4.335814504553668e-07, "loss": 0.641, "step": 1399 }, { "epoch": 1.791103288263061, "grad_norm": 1.1777597665786743, "learning_rate": 4.3298130337822945e-07, "loss": 0.6534, "step": 1400 }, { "epoch": 1.7923833906712536, "grad_norm": 0.3725791275501251, "learning_rate": 4.323813794486464e-07, "loss": 0.6551, "step": 1401 }, { "epoch": 1.7936634930794464, "grad_norm": 1.6161917448043823, "learning_rate": 4.3178167981063586e-07, "loss": 0.6619, "step": 1402 }, { "epoch": 1.7949435954876392, "grad_norm": 1.4094892740249634, "learning_rate": 4.3118220560778884e-07, "loss": 0.6447, "step": 1403 }, { "epoch": 1.7962236978958317, "grad_norm": 1.8410543203353882, "learning_rate": 4.3058295798326614e-07, "loss": 0.6509, "step": 1404 }, { "epoch": 1.7975038003040242, "grad_norm": 1.322169303894043, "learning_rate": 4.2998393807979673e-07, "loss": 0.6509, "step": 1405 }, { "epoch": 1.798783902712217, "grad_norm": 0.830678403377533, "learning_rate": 4.293851470396753e-07, "loss": 0.6667, "step": 1406 }, { "epoch": 1.8000640051204098, "grad_norm": 0.42671477794647217, "learning_rate": 4.287865860047596e-07, "loss": 0.6466, "step": 1407 }, { "epoch": 1.8013441075286023, "grad_norm": 0.5033804178237915, "learning_rate": 4.281882561164698e-07, "loss": 0.6393, "step": 1408 }, { "epoch": 1.8026242099367948, "grad_norm": 1.2624613046646118, "learning_rate": 4.2759015851578406e-07, "loss": 0.654, "step": 1409 }, { "epoch": 1.8039043123449876, "grad_norm": 0.75972580909729, "learning_rate": 4.269922943432389e-07, "loss": 0.6622, "step": 1410 }, { "epoch": 1.8039043123449876, "eval_loss": 0.020134203135967255, "eval_runtime": 42.0173, "eval_samples_per_second": 11.805, "eval_steps_per_second": 1.476, "step": 1410 }, { "epoch": 1.8051844147531804, "grad_norm": 2.159752368927002, "learning_rate": 4.263946647389245e-07, "loss": 0.6395, "step": 1411 }, { "epoch": 1.806464517161373, "grad_norm": 1.3134266138076782, "learning_rate": 4.257972708424844e-07, "loss": 0.6381, "step": 1412 }, { "epoch": 1.8077446195695654, "grad_norm": 1.0190292596817017, "learning_rate": 4.252001137931125e-07, "loss": 0.6411, "step": 1413 }, { "epoch": 1.8090247219777582, "grad_norm": 0.39045262336730957, "learning_rate": 4.246031947295511e-07, "loss": 0.6529, "step": 1414 }, { "epoch": 1.810304824385951, "grad_norm": 0.7252090573310852, "learning_rate": 4.240065147900888e-07, "loss": 0.6543, "step": 1415 }, { "epoch": 1.8115849267941435, "grad_norm": 0.33401620388031006, "learning_rate": 4.2341007511255756e-07, "loss": 0.6536, "step": 1416 }, { "epoch": 1.812865029202336, "grad_norm": 0.640551745891571, "learning_rate": 4.228138768343322e-07, "loss": 0.6507, "step": 1417 }, { "epoch": 1.8141451316105288, "grad_norm": 2.3466696739196777, "learning_rate": 4.2221792109232644e-07, "loss": 0.6379, "step": 1418 }, { "epoch": 1.8154252340187216, "grad_norm": 0.35105660557746887, "learning_rate": 4.216222090229915e-07, "loss": 0.6569, "step": 1419 }, { "epoch": 1.8167053364269141, "grad_norm": 0.8996425867080688, "learning_rate": 4.2102674176231455e-07, "loss": 0.6481, "step": 1420 }, { "epoch": 1.8179854388351067, "grad_norm": 0.8135996460914612, "learning_rate": 4.204315204458152e-07, "loss": 0.6479, "step": 1421 }, { "epoch": 1.8192655412432994, "grad_norm": 0.7570270299911499, "learning_rate": 4.198365462085446e-07, "loss": 0.6574, "step": 1422 }, { "epoch": 1.8205456436514922, "grad_norm": 1.1389846801757812, "learning_rate": 4.192418201850825e-07, "loss": 0.6409, "step": 1423 }, { "epoch": 1.8218257460596847, "grad_norm": 0.3112352788448334, "learning_rate": 4.18647343509535e-07, "loss": 0.6567, "step": 1424 }, { "epoch": 1.8231058484678773, "grad_norm": 0.32075387239456177, "learning_rate": 4.1805311731553364e-07, "loss": 0.6539, "step": 1425 }, { "epoch": 1.8243859508760703, "grad_norm": 0.6961304545402527, "learning_rate": 4.174591427362311e-07, "loss": 0.6582, "step": 1426 }, { "epoch": 1.8256660532842628, "grad_norm": 0.7438198924064636, "learning_rate": 4.1686542090430133e-07, "loss": 0.6573, "step": 1427 }, { "epoch": 1.8269461556924553, "grad_norm": 0.4226982593536377, "learning_rate": 4.1627195295193564e-07, "loss": 0.6687, "step": 1428 }, { "epoch": 1.828226258100648, "grad_norm": 1.6463003158569336, "learning_rate": 4.1567874001084134e-07, "loss": 0.6593, "step": 1429 }, { "epoch": 1.8295063605088409, "grad_norm": 0.6133513450622559, "learning_rate": 4.1508578321223977e-07, "loss": 0.6579, "step": 1430 }, { "epoch": 1.8307864629170334, "grad_norm": 0.6251399517059326, "learning_rate": 4.144930836868632e-07, "loss": 0.6577, "step": 1431 }, { "epoch": 1.832066565325226, "grad_norm": 0.38442981243133545, "learning_rate": 4.1390064256495406e-07, "loss": 0.6497, "step": 1432 }, { "epoch": 1.8333466677334187, "grad_norm": 0.35492774844169617, "learning_rate": 4.133084609762613e-07, "loss": 0.647, "step": 1433 }, { "epoch": 1.8346267701416115, "grad_norm": 0.9149113893508911, "learning_rate": 4.127165400500394e-07, "loss": 0.6414, "step": 1434 }, { "epoch": 1.835906872549804, "grad_norm": 2.032224178314209, "learning_rate": 4.121248809150457e-07, "loss": 0.6367, "step": 1435 }, { "epoch": 1.8371869749579965, "grad_norm": 1.422893762588501, "learning_rate": 4.115334846995383e-07, "loss": 0.6425, "step": 1436 }, { "epoch": 1.8384670773661893, "grad_norm": 1.0627795457839966, "learning_rate": 4.1094235253127374e-07, "loss": 0.6433, "step": 1437 }, { "epoch": 1.839747179774382, "grad_norm": 0.4423734247684479, "learning_rate": 4.103514855375051e-07, "loss": 0.6477, "step": 1438 }, { "epoch": 1.8410272821825746, "grad_norm": 0.7080780863761902, "learning_rate": 4.097608848449803e-07, "loss": 0.6487, "step": 1439 }, { "epoch": 1.8423073845907671, "grad_norm": 0.5146299600601196, "learning_rate": 4.0917055157993883e-07, "loss": 0.6545, "step": 1440 }, { "epoch": 1.8423073845907671, "eval_loss": 0.02027849666774273, "eval_runtime": 42.2437, "eval_samples_per_second": 11.741, "eval_steps_per_second": 1.468, "step": 1440 }, { "epoch": 1.84358748699896, "grad_norm": 0.9809892773628235, "learning_rate": 4.085804868681101e-07, "loss": 0.655, "step": 1441 }, { "epoch": 1.8448675894071527, "grad_norm": 2.0757155418395996, "learning_rate": 4.0799069183471233e-07, "loss": 0.6273, "step": 1442 }, { "epoch": 1.8461476918153452, "grad_norm": 2.283313512802124, "learning_rate": 4.074011676044481e-07, "loss": 0.655, "step": 1443 }, { "epoch": 1.8474277942235378, "grad_norm": 1.3149728775024414, "learning_rate": 4.068119153015052e-07, "loss": 0.6607, "step": 1444 }, { "epoch": 1.8487078966317305, "grad_norm": 0.49532565474510193, "learning_rate": 4.0622293604955106e-07, "loss": 0.6469, "step": 1445 }, { "epoch": 1.8499879990399233, "grad_norm": 0.3583681881427765, "learning_rate": 4.056342309717343e-07, "loss": 0.6475, "step": 1446 }, { "epoch": 1.8512681014481158, "grad_norm": 0.4949761927127838, "learning_rate": 4.0504580119067935e-07, "loss": 0.6506, "step": 1447 }, { "epoch": 1.8525482038563084, "grad_norm": 0.29712027311325073, "learning_rate": 4.044576478284859e-07, "loss": 0.632, "step": 1448 }, { "epoch": 1.8538283062645011, "grad_norm": 0.3617751896381378, "learning_rate": 4.03869772006727e-07, "loss": 0.6317, "step": 1449 }, { "epoch": 1.8551084086726939, "grad_norm": 1.358906865119934, "learning_rate": 4.032821748464462e-07, "loss": 0.652, "step": 1450 }, { "epoch": 1.8563885110808864, "grad_norm": 0.5866574645042419, "learning_rate": 4.0269485746815543e-07, "loss": 0.6659, "step": 1451 }, { "epoch": 1.857668613489079, "grad_norm": 1.2951745986938477, "learning_rate": 4.021078209918336e-07, "loss": 0.6669, "step": 1452 }, { "epoch": 1.8589487158972717, "grad_norm": 0.7593936920166016, "learning_rate": 4.015210665369233e-07, "loss": 0.6683, "step": 1453 }, { "epoch": 1.8602288183054645, "grad_norm": 0.2940188944339752, "learning_rate": 4.0093459522232987e-07, "loss": 0.6774, "step": 1454 }, { "epoch": 1.861508920713657, "grad_norm": 1.2073087692260742, "learning_rate": 4.0034840816641837e-07, "loss": 0.6492, "step": 1455 }, { "epoch": 1.8627890231218498, "grad_norm": 0.6415184736251831, "learning_rate": 3.9976250648701225e-07, "loss": 0.6474, "step": 1456 }, { "epoch": 1.8640691255300426, "grad_norm": 0.49736320972442627, "learning_rate": 3.991768913013903e-07, "loss": 0.6657, "step": 1457 }, { "epoch": 1.865349227938235, "grad_norm": 1.4928420782089233, "learning_rate": 3.985915637262849e-07, "loss": 0.6617, "step": 1458 }, { "epoch": 1.8666293303464276, "grad_norm": 1.4371532201766968, "learning_rate": 3.9800652487788066e-07, "loss": 0.6652, "step": 1459 }, { "epoch": 1.8679094327546204, "grad_norm": 0.6963754892349243, "learning_rate": 3.974217758718107e-07, "loss": 0.674, "step": 1460 }, { "epoch": 1.8691895351628132, "grad_norm": 0.35544610023498535, "learning_rate": 3.968373178231564e-07, "loss": 0.6474, "step": 1461 }, { "epoch": 1.8704696375710057, "grad_norm": 2.491149425506592, "learning_rate": 3.9625315184644327e-07, "loss": 0.6498, "step": 1462 }, { "epoch": 1.8717497399791982, "grad_norm": 1.5386929512023926, "learning_rate": 3.9566927905564083e-07, "loss": 0.6576, "step": 1463 }, { "epoch": 1.873029842387391, "grad_norm": 1.0369929075241089, "learning_rate": 3.9508570056415893e-07, "loss": 0.6441, "step": 1464 }, { "epoch": 1.8743099447955838, "grad_norm": 1.8902573585510254, "learning_rate": 3.94502417484846e-07, "loss": 0.6435, "step": 1465 }, { "epoch": 1.8755900472037763, "grad_norm": 1.3084981441497803, "learning_rate": 3.9391943092998814e-07, "loss": 0.6346, "step": 1466 }, { "epoch": 1.8768701496119689, "grad_norm": 0.47784221172332764, "learning_rate": 3.9333674201130475e-07, "loss": 0.6489, "step": 1467 }, { "epoch": 1.8781502520201616, "grad_norm": 0.9221143126487732, "learning_rate": 3.9275435183994855e-07, "loss": 0.6523, "step": 1468 }, { "epoch": 1.8794303544283544, "grad_norm": 1.5181889533996582, "learning_rate": 3.9217226152650207e-07, "loss": 0.6543, "step": 1469 }, { "epoch": 1.880710456836547, "grad_norm": 0.3990873098373413, "learning_rate": 3.915904721809763e-07, "loss": 0.6636, "step": 1470 }, { "epoch": 1.880710456836547, "eval_loss": 0.020178191363811493, "eval_runtime": 42.1335, "eval_samples_per_second": 11.772, "eval_steps_per_second": 1.472, "step": 1470 }, { "epoch": 1.8819905592447395, "grad_norm": 0.8142790794372559, "learning_rate": 3.910089849128084e-07, "loss": 0.6707, "step": 1471 }, { "epoch": 1.8832706616529322, "grad_norm": 0.9272212982177734, "learning_rate": 3.904278008308589e-07, "loss": 0.6275, "step": 1472 }, { "epoch": 1.884550764061125, "grad_norm": 1.6707804203033447, "learning_rate": 3.89846921043411e-07, "loss": 0.6531, "step": 1473 }, { "epoch": 1.8858308664693175, "grad_norm": 2.0460212230682373, "learning_rate": 3.8926634665816707e-07, "loss": 0.6711, "step": 1474 }, { "epoch": 1.88711096887751, "grad_norm": 0.8614675402641296, "learning_rate": 3.8868607878224714e-07, "loss": 0.6419, "step": 1475 }, { "epoch": 1.8883910712857028, "grad_norm": 1.382861852645874, "learning_rate": 3.88106118522187e-07, "loss": 0.6461, "step": 1476 }, { "epoch": 1.8896711736938956, "grad_norm": 0.35682398080825806, "learning_rate": 3.875264669839353e-07, "loss": 0.6423, "step": 1477 }, { "epoch": 1.8909512761020881, "grad_norm": 0.4068925678730011, "learning_rate": 3.869471252728529e-07, "loss": 0.6272, "step": 1478 }, { "epoch": 1.8922313785102807, "grad_norm": 0.6481353044509888, "learning_rate": 3.863680944937088e-07, "loss": 0.6635, "step": 1479 }, { "epoch": 1.8935114809184734, "grad_norm": 1.3248523473739624, "learning_rate": 3.8578937575068006e-07, "loss": 0.6585, "step": 1480 }, { "epoch": 1.8947915833266662, "grad_norm": 1.5766288042068481, "learning_rate": 3.852109701473477e-07, "loss": 0.666, "step": 1481 }, { "epoch": 1.8960716857348587, "grad_norm": 0.30987825989723206, "learning_rate": 3.846328787866964e-07, "loss": 0.6501, "step": 1482 }, { "epoch": 1.8973517881430515, "grad_norm": 0.39504796266555786, "learning_rate": 3.840551027711113e-07, "loss": 0.6872, "step": 1483 }, { "epoch": 1.8986318905512443, "grad_norm": 1.0687555074691772, "learning_rate": 3.83477643202376e-07, "loss": 0.6699, "step": 1484 }, { "epoch": 1.8999119929594368, "grad_norm": 0.49148961901664734, "learning_rate": 3.829005011816712e-07, "loss": 0.6604, "step": 1485 }, { "epoch": 1.9011920953676293, "grad_norm": 0.4063304364681244, "learning_rate": 3.8232367780957143e-07, "loss": 0.671, "step": 1486 }, { "epoch": 1.902472197775822, "grad_norm": 0.651275634765625, "learning_rate": 3.8174717418604386e-07, "loss": 0.6629, "step": 1487 }, { "epoch": 1.9037523001840149, "grad_norm": 0.5661211013793945, "learning_rate": 3.811709914104461e-07, "loss": 0.6845, "step": 1488 }, { "epoch": 1.9050324025922074, "grad_norm": 1.1106001138687134, "learning_rate": 3.805951305815236e-07, "loss": 0.6574, "step": 1489 }, { "epoch": 1.9063125050004, "grad_norm": 0.7834218740463257, "learning_rate": 3.8001959279740813e-07, "loss": 0.6456, "step": 1490 }, { "epoch": 1.9075926074085927, "grad_norm": 0.3771151304244995, "learning_rate": 3.794443791556151e-07, "loss": 0.6581, "step": 1491 }, { "epoch": 1.9088727098167855, "grad_norm": 1.2670047283172607, "learning_rate": 3.788694907530425e-07, "loss": 0.6598, "step": 1492 }, { "epoch": 1.910152812224978, "grad_norm": 0.3163726329803467, "learning_rate": 3.782949286859672e-07, "loss": 0.6414, "step": 1493 }, { "epoch": 1.9114329146331706, "grad_norm": 0.35109463334083557, "learning_rate": 3.7772069405004424e-07, "loss": 0.6408, "step": 1494 }, { "epoch": 1.9127130170413633, "grad_norm": 0.857173502445221, "learning_rate": 3.771467879403044e-07, "loss": 0.6463, "step": 1495 }, { "epoch": 1.913993119449556, "grad_norm": 0.31337499618530273, "learning_rate": 3.765732114511516e-07, "loss": 0.656, "step": 1496 }, { "epoch": 1.9152732218577486, "grad_norm": 0.6555890440940857, "learning_rate": 3.759999656763615e-07, "loss": 0.6372, "step": 1497 }, { "epoch": 1.9165533242659412, "grad_norm": 0.34517669677734375, "learning_rate": 3.754270517090792e-07, "loss": 0.6565, "step": 1498 }, { "epoch": 1.917833426674134, "grad_norm": 0.761021077632904, "learning_rate": 3.748544706418165e-07, "loss": 0.6466, "step": 1499 }, { "epoch": 1.9191135290823267, "grad_norm": 0.8519187569618225, "learning_rate": 3.742822235664511e-07, "loss": 0.6666, "step": 1500 }, { "epoch": 1.9191135290823267, "eval_loss": 0.020136365666985512, "eval_runtime": 42.0089, "eval_samples_per_second": 11.807, "eval_steps_per_second": 1.476, "step": 1500 }, { "epoch": 1.9203936314905192, "grad_norm": 1.8772252798080444, "learning_rate": 3.7371031157422316e-07, "loss": 0.6474, "step": 1501 }, { "epoch": 1.9216737338987118, "grad_norm": 0.5060604810714722, "learning_rate": 3.731387357557344e-07, "loss": 0.6508, "step": 1502 }, { "epoch": 1.9229538363069045, "grad_norm": 0.4918056130409241, "learning_rate": 3.7256749720094494e-07, "loss": 0.6315, "step": 1503 }, { "epoch": 1.9242339387150973, "grad_norm": 1.119981050491333, "learning_rate": 3.7199659699917254e-07, "loss": 0.6301, "step": 1504 }, { "epoch": 1.9255140411232898, "grad_norm": 0.42985770106315613, "learning_rate": 3.7142603623908877e-07, "loss": 0.6469, "step": 1505 }, { "epoch": 1.9267941435314824, "grad_norm": 0.7651292681694031, "learning_rate": 3.708558160087183e-07, "loss": 0.6454, "step": 1506 }, { "epoch": 1.9280742459396751, "grad_norm": 0.687855064868927, "learning_rate": 3.702859373954371e-07, "loss": 0.6432, "step": 1507 }, { "epoch": 1.929354348347868, "grad_norm": 0.4252788722515106, "learning_rate": 3.697164014859685e-07, "loss": 0.6537, "step": 1508 }, { "epoch": 1.9306344507560604, "grad_norm": 0.31047073006629944, "learning_rate": 3.6914720936638334e-07, "loss": 0.6713, "step": 1509 }, { "epoch": 1.931914553164253, "grad_norm": 1.0734926462173462, "learning_rate": 3.685783621220961e-07, "loss": 0.6351, "step": 1510 }, { "epoch": 1.9331946555724457, "grad_norm": 1.112204909324646, "learning_rate": 3.6800986083786423e-07, "loss": 0.6547, "step": 1511 }, { "epoch": 1.9344747579806385, "grad_norm": 1.4943028688430786, "learning_rate": 3.674417065977852e-07, "loss": 0.6623, "step": 1512 }, { "epoch": 1.935754860388831, "grad_norm": 1.689070224761963, "learning_rate": 3.668739004852943e-07, "loss": 0.6626, "step": 1513 }, { "epoch": 1.9370349627970238, "grad_norm": 0.5321928858757019, "learning_rate": 3.663064435831639e-07, "loss": 0.6334, "step": 1514 }, { "epoch": 1.9383150652052166, "grad_norm": 0.34038230776786804, "learning_rate": 3.657393369734993e-07, "loss": 0.6379, "step": 1515 }, { "epoch": 1.939595167613409, "grad_norm": 0.8219080567359924, "learning_rate": 3.651725817377388e-07, "loss": 0.6649, "step": 1516 }, { "epoch": 1.9408752700216017, "grad_norm": 0.4399322271347046, "learning_rate": 3.646061789566501e-07, "loss": 0.6779, "step": 1517 }, { "epoch": 1.9421553724297944, "grad_norm": 0.3037623167037964, "learning_rate": 3.6404012971032894e-07, "loss": 0.6555, "step": 1518 }, { "epoch": 1.9434354748379872, "grad_norm": 0.4268603026866913, "learning_rate": 3.63474435078197e-07, "loss": 0.6662, "step": 1519 }, { "epoch": 1.9447155772461797, "grad_norm": 0.8760473728179932, "learning_rate": 3.6290909613899944e-07, "loss": 0.6691, "step": 1520 }, { "epoch": 1.9459956796543723, "grad_norm": 0.41986730694770813, "learning_rate": 3.6234411397080346e-07, "loss": 0.6501, "step": 1521 }, { "epoch": 1.947275782062565, "grad_norm": 0.7702023386955261, "learning_rate": 3.617794896509958e-07, "loss": 0.6547, "step": 1522 }, { "epoch": 1.9485558844707578, "grad_norm": 1.2464476823806763, "learning_rate": 3.612152242562805e-07, "loss": 0.6624, "step": 1523 }, { "epoch": 1.9498359868789503, "grad_norm": 0.4909172058105469, "learning_rate": 3.6065131886267765e-07, "loss": 0.6431, "step": 1524 }, { "epoch": 1.9511160892871429, "grad_norm": 0.3685779273509979, "learning_rate": 3.600877745455205e-07, "loss": 0.6464, "step": 1525 }, { "epoch": 1.9523961916953356, "grad_norm": 0.8982672095298767, "learning_rate": 3.595245923794542e-07, "loss": 0.6393, "step": 1526 }, { "epoch": 1.9536762941035284, "grad_norm": 0.7910873889923096, "learning_rate": 3.5896177343843257e-07, "loss": 0.6306, "step": 1527 }, { "epoch": 1.954956396511721, "grad_norm": 1.9237056970596313, "learning_rate": 3.5839931879571725e-07, "loss": 0.664, "step": 1528 }, { "epoch": 1.9562364989199135, "grad_norm": 0.5737236142158508, "learning_rate": 3.578372295238754e-07, "loss": 0.6519, "step": 1529 }, { "epoch": 1.9575166013281062, "grad_norm": 0.47908324003219604, "learning_rate": 3.572755066947768e-07, "loss": 0.6467, "step": 1530 }, { "epoch": 1.9575166013281062, "eval_loss": 0.02018653228878975, "eval_runtime": 42.125, "eval_samples_per_second": 11.774, "eval_steps_per_second": 1.472, "step": 1530 }, { "epoch": 1.958796703736299, "grad_norm": 0.8703590035438538, "learning_rate": 3.5671415137959304e-07, "loss": 0.6616, "step": 1531 }, { "epoch": 1.9600768061444915, "grad_norm": 0.8829367160797119, "learning_rate": 3.5615316464879443e-07, "loss": 0.6585, "step": 1532 }, { "epoch": 1.961356908552684, "grad_norm": 0.6368685960769653, "learning_rate": 3.5559254757214894e-07, "loss": 0.6373, "step": 1533 }, { "epoch": 1.9626370109608768, "grad_norm": 0.3699598014354706, "learning_rate": 3.550323012187192e-07, "loss": 0.6576, "step": 1534 }, { "epoch": 1.9639171133690696, "grad_norm": 0.33403944969177246, "learning_rate": 3.544724266568606e-07, "loss": 0.6445, "step": 1535 }, { "epoch": 1.9651972157772621, "grad_norm": 0.39014747738838196, "learning_rate": 3.5391292495422056e-07, "loss": 0.6608, "step": 1536 }, { "epoch": 1.9664773181854547, "grad_norm": 0.3596109449863434, "learning_rate": 3.533537971777345e-07, "loss": 0.6462, "step": 1537 }, { "epoch": 1.9677574205936474, "grad_norm": 0.5041800141334534, "learning_rate": 3.5279504439362553e-07, "loss": 0.6728, "step": 1538 }, { "epoch": 1.9690375230018402, "grad_norm": 0.6463397145271301, "learning_rate": 3.522366676674008e-07, "loss": 0.6587, "step": 1539 }, { "epoch": 1.9703176254100327, "grad_norm": 0.8549566864967346, "learning_rate": 3.5167866806385117e-07, "loss": 0.6699, "step": 1540 }, { "epoch": 1.9715977278182255, "grad_norm": 1.3436312675476074, "learning_rate": 3.511210466470481e-07, "loss": 0.6563, "step": 1541 }, { "epoch": 1.9728778302264183, "grad_norm": 0.7693657279014587, "learning_rate": 3.505638044803414e-07, "loss": 0.6469, "step": 1542 }, { "epoch": 1.9741579326346108, "grad_norm": 0.37262585759162903, "learning_rate": 3.5000694262635844e-07, "loss": 0.6453, "step": 1543 }, { "epoch": 1.9754380350428034, "grad_norm": 0.2784225642681122, "learning_rate": 3.4945046214700085e-07, "loss": 0.6543, "step": 1544 }, { "epoch": 1.9767181374509961, "grad_norm": 0.5659027099609375, "learning_rate": 3.4889436410344337e-07, "loss": 0.6448, "step": 1545 }, { "epoch": 1.9779982398591889, "grad_norm": 1.1660345792770386, "learning_rate": 3.4833864955613084e-07, "loss": 0.6297, "step": 1546 }, { "epoch": 1.9792783422673814, "grad_norm": 1.1339924335479736, "learning_rate": 3.477833195647773e-07, "loss": 0.6308, "step": 1547 }, { "epoch": 1.980558444675574, "grad_norm": 0.615590512752533, "learning_rate": 3.4722837518836366e-07, "loss": 0.6517, "step": 1548 }, { "epoch": 1.9818385470837667, "grad_norm": 1.4719653129577637, "learning_rate": 3.466738174851348e-07, "loss": 0.6662, "step": 1549 }, { "epoch": 1.9831186494919595, "grad_norm": 0.3114243745803833, "learning_rate": 3.461196475125986e-07, "loss": 0.6557, "step": 1550 }, { "epoch": 1.984398751900152, "grad_norm": 0.6217992901802063, "learning_rate": 3.4556586632752395e-07, "loss": 0.6568, "step": 1551 }, { "epoch": 1.9856788543083446, "grad_norm": 0.5350921750068665, "learning_rate": 3.4501247498593753e-07, "loss": 0.659, "step": 1552 }, { "epoch": 1.9869589567165373, "grad_norm": 0.3131371736526489, "learning_rate": 3.4445947454312345e-07, "loss": 0.6583, "step": 1553 }, { "epoch": 1.98823905912473, "grad_norm": 0.8939411044120789, "learning_rate": 3.439068660536197e-07, "loss": 0.6352, "step": 1554 }, { "epoch": 1.9895191615329226, "grad_norm": 0.3164510428905487, "learning_rate": 3.4335465057121715e-07, "loss": 0.6321, "step": 1555 }, { "epoch": 1.9907992639411152, "grad_norm": 0.7054875493049622, "learning_rate": 3.4280282914895754e-07, "loss": 0.6408, "step": 1556 }, { "epoch": 1.992079366349308, "grad_norm": 0.8006320595741272, "learning_rate": 3.4225140283913033e-07, "loss": 0.6457, "step": 1557 }, { "epoch": 1.9933594687575007, "grad_norm": 0.5207490921020508, "learning_rate": 3.4170037269327235e-07, "loss": 0.6471, "step": 1558 }, { "epoch": 1.9946395711656932, "grad_norm": 0.4709649384021759, "learning_rate": 3.411497397621646e-07, "loss": 0.652, "step": 1559 }, { "epoch": 1.9959196735738858, "grad_norm": 0.46237748861312866, "learning_rate": 3.405995050958308e-07, "loss": 0.6605, "step": 1560 }, { "epoch": 1.9959196735738858, "eval_loss": 0.020140517503023148, "eval_runtime": 42.0698, "eval_samples_per_second": 11.79, "eval_steps_per_second": 1.474, "step": 1560 }, { "epoch": 1.9971997759820785, "grad_norm": 0.6091731786727905, "learning_rate": 3.400496697435349e-07, "loss": 0.6774, "step": 1561 }, { "epoch": 1.9984798783902713, "grad_norm": 0.2919997572898865, "learning_rate": 3.395002347537796e-07, "loss": 0.6482, "step": 1562 }, { "epoch": 1.9997599807984638, "grad_norm": 0.7775795459747314, "learning_rate": 3.389512011743042e-07, "loss": 0.6577, "step": 1563 }, { "epoch": 2.0, "grad_norm": 1.7572511434555054, "learning_rate": 3.3840257005208217e-07, "loss": 0.5824, "step": 1564 }, { "epoch": 2.0012801024081925, "grad_norm": 0.9507853984832764, "learning_rate": 3.378543424333201e-07, "loss": 0.6623, "step": 1565 }, { "epoch": 2.0025602048163855, "grad_norm": 0.4480624496936798, "learning_rate": 3.3730651936345423e-07, "loss": 0.677, "step": 1566 }, { "epoch": 2.003840307224578, "grad_norm": 0.3929971158504486, "learning_rate": 3.367591018871506e-07, "loss": 0.6341, "step": 1567 }, { "epoch": 2.0051204096327706, "grad_norm": 0.33541080355644226, "learning_rate": 3.3621209104830087e-07, "loss": 0.6205, "step": 1568 }, { "epoch": 2.006400512040963, "grad_norm": 0.38718631863594055, "learning_rate": 3.3566548789002133e-07, "loss": 0.6591, "step": 1569 }, { "epoch": 2.007680614449156, "grad_norm": 0.38684767484664917, "learning_rate": 3.351192934546511e-07, "loss": 0.6578, "step": 1570 }, { "epoch": 2.0089607168573487, "grad_norm": 0.7610079646110535, "learning_rate": 3.3457350878375003e-07, "loss": 0.6586, "step": 1571 }, { "epoch": 2.010240819265541, "grad_norm": 0.7946922183036804, "learning_rate": 3.3402813491809625e-07, "loss": 0.6496, "step": 1572 }, { "epoch": 2.0115209216737338, "grad_norm": 1.0007370710372925, "learning_rate": 3.3348317289768447e-07, "loss": 0.6516, "step": 1573 }, { "epoch": 2.0128010240819267, "grad_norm": 0.650123119354248, "learning_rate": 3.3293862376172444e-07, "loss": 0.6708, "step": 1574 }, { "epoch": 2.0140811264901193, "grad_norm": 1.0918546915054321, "learning_rate": 3.3239448854863833e-07, "loss": 0.6492, "step": 1575 }, { "epoch": 2.015361228898312, "grad_norm": 1.0643458366394043, "learning_rate": 3.318507682960587e-07, "loss": 0.6509, "step": 1576 }, { "epoch": 2.0166413313065044, "grad_norm": 0.28287214040756226, "learning_rate": 3.313074640408273e-07, "loss": 0.6689, "step": 1577 }, { "epoch": 2.0179214337146973, "grad_norm": 0.32519668340682983, "learning_rate": 3.307645768189923e-07, "loss": 0.6397, "step": 1578 }, { "epoch": 2.01920153612289, "grad_norm": 2.0113062858581543, "learning_rate": 3.3022210766580683e-07, "loss": 0.6482, "step": 1579 }, { "epoch": 2.0204816385310824, "grad_norm": 1.2784104347229004, "learning_rate": 3.296800576157266e-07, "loss": 0.6557, "step": 1580 }, { "epoch": 2.021761740939275, "grad_norm": 0.8624829649925232, "learning_rate": 3.2913842770240774e-07, "loss": 0.6513, "step": 1581 }, { "epoch": 2.023041843347468, "grad_norm": 0.31694090366363525, "learning_rate": 3.2859721895870634e-07, "loss": 0.6398, "step": 1582 }, { "epoch": 2.0243219457556605, "grad_norm": 1.5329867601394653, "learning_rate": 3.2805643241667416e-07, "loss": 0.6382, "step": 1583 }, { "epoch": 2.025602048163853, "grad_norm": 0.9459407329559326, "learning_rate": 3.2751606910755856e-07, "loss": 0.64, "step": 1584 }, { "epoch": 2.0268821505720456, "grad_norm": 1.1838010549545288, "learning_rate": 3.2697613006179934e-07, "loss": 0.6603, "step": 1585 }, { "epoch": 2.0281622529802386, "grad_norm": 0.2843930423259735, "learning_rate": 3.2643661630902765e-07, "loss": 0.6555, "step": 1586 }, { "epoch": 2.029442355388431, "grad_norm": 0.39631158113479614, "learning_rate": 3.2589752887806363e-07, "loss": 0.6495, "step": 1587 }, { "epoch": 2.0307224577966236, "grad_norm": 1.081121802330017, "learning_rate": 3.2535886879691387e-07, "loss": 0.6439, "step": 1588 }, { "epoch": 2.032002560204816, "grad_norm": 0.867226243019104, "learning_rate": 3.2482063709277086e-07, "loss": 0.6448, "step": 1589 }, { "epoch": 2.033282662613009, "grad_norm": 0.5019204616546631, "learning_rate": 3.242828347920096e-07, "loss": 0.6559, "step": 1590 }, { "epoch": 2.033282662613009, "eval_loss": 0.020167594775557518, "eval_runtime": 42.0921, "eval_samples_per_second": 11.784, "eval_steps_per_second": 1.473, "step": 1590 }, { "epoch": 2.0345627650212017, "grad_norm": 0.7726768255233765, "learning_rate": 3.2374546292018666e-07, "loss": 0.6655, "step": 1591 }, { "epoch": 2.0358428674293942, "grad_norm": 0.3660649061203003, "learning_rate": 3.2320852250203736e-07, "loss": 0.6598, "step": 1592 }, { "epoch": 2.0371229698375872, "grad_norm": 0.3929210603237152, "learning_rate": 3.2267201456147455e-07, "loss": 0.6401, "step": 1593 }, { "epoch": 2.0384030722457798, "grad_norm": 0.49099859595298767, "learning_rate": 3.221359401215864e-07, "loss": 0.6689, "step": 1594 }, { "epoch": 2.0396831746539723, "grad_norm": 0.2908097505569458, "learning_rate": 3.2160030020463426e-07, "loss": 0.6673, "step": 1595 }, { "epoch": 2.040963277062165, "grad_norm": 0.28991639614105225, "learning_rate": 3.2106509583205094e-07, "loss": 0.6477, "step": 1596 }, { "epoch": 2.042243379470358, "grad_norm": 0.7449044585227966, "learning_rate": 3.205303280244389e-07, "loss": 0.6347, "step": 1597 }, { "epoch": 2.0435234818785504, "grad_norm": 0.3190125823020935, "learning_rate": 3.1999599780156765e-07, "loss": 0.6504, "step": 1598 }, { "epoch": 2.044803584286743, "grad_norm": 0.34263280034065247, "learning_rate": 3.194621061823727e-07, "loss": 0.6541, "step": 1599 }, { "epoch": 2.0460836866949355, "grad_norm": 0.6974402666091919, "learning_rate": 3.189286541849525e-07, "loss": 0.6445, "step": 1600 }, { "epoch": 2.0473637891031284, "grad_norm": 0.5479668974876404, "learning_rate": 3.183956428265684e-07, "loss": 0.6815, "step": 1601 }, { "epoch": 2.048643891511321, "grad_norm": 0.6569727659225464, "learning_rate": 3.178630731236402e-07, "loss": 0.6499, "step": 1602 }, { "epoch": 2.0499239939195135, "grad_norm": 0.44678768515586853, "learning_rate": 3.1733094609174626e-07, "loss": 0.6415, "step": 1603 }, { "epoch": 2.051204096327706, "grad_norm": 0.8797255158424377, "learning_rate": 3.1679926274562023e-07, "loss": 0.6766, "step": 1604 }, { "epoch": 2.052484198735899, "grad_norm": 0.34989097714424133, "learning_rate": 3.1626802409915023e-07, "loss": 0.6443, "step": 1605 }, { "epoch": 2.0537643011440916, "grad_norm": 0.5943762063980103, "learning_rate": 3.1573723116537626e-07, "loss": 0.618, "step": 1606 }, { "epoch": 2.055044403552284, "grad_norm": 1.8876229524612427, "learning_rate": 3.152068849564878e-07, "loss": 0.6389, "step": 1607 }, { "epoch": 2.0563245059604767, "grad_norm": 1.1450793743133545, "learning_rate": 3.1467698648382324e-07, "loss": 0.6329, "step": 1608 }, { "epoch": 2.0576046083686697, "grad_norm": 1.565260887145996, "learning_rate": 3.1414753675786685e-07, "loss": 0.6569, "step": 1609 }, { "epoch": 2.058884710776862, "grad_norm": 1.415553331375122, "learning_rate": 3.136185367882468e-07, "loss": 0.6619, "step": 1610 }, { "epoch": 2.0601648131850547, "grad_norm": 1.5406972169876099, "learning_rate": 3.130899875837342e-07, "loss": 0.6505, "step": 1611 }, { "epoch": 2.0614449155932473, "grad_norm": 1.2182635068893433, "learning_rate": 3.125618901522402e-07, "loss": 0.641, "step": 1612 }, { "epoch": 2.0627250180014403, "grad_norm": 0.47365105152130127, "learning_rate": 3.120342455008148e-07, "loss": 0.6303, "step": 1613 }, { "epoch": 2.064005120409633, "grad_norm": 1.782963752746582, "learning_rate": 3.1150705463564414e-07, "loss": 0.6414, "step": 1614 }, { "epoch": 2.0652852228178253, "grad_norm": 0.8268676996231079, "learning_rate": 3.1098031856204886e-07, "loss": 0.6369, "step": 1615 }, { "epoch": 2.066565325226018, "grad_norm": 0.3014861047267914, "learning_rate": 3.1045403828448333e-07, "loss": 0.6493, "step": 1616 }, { "epoch": 2.067845427634211, "grad_norm": 0.34252384305000305, "learning_rate": 3.0992821480653175e-07, "loss": 0.6848, "step": 1617 }, { "epoch": 2.0691255300424034, "grad_norm": 0.385826975107193, "learning_rate": 3.0940284913090774e-07, "loss": 0.6498, "step": 1618 }, { "epoch": 2.070405632450596, "grad_norm": 1.5567173957824707, "learning_rate": 3.0887794225945143e-07, "loss": 0.672, "step": 1619 }, { "epoch": 2.0716857348587885, "grad_norm": 1.0404150485992432, "learning_rate": 3.083534951931289e-07, "loss": 0.6658, "step": 1620 }, { "epoch": 2.0716857348587885, "eval_loss": 0.020138423889875412, "eval_runtime": 42.0892, "eval_samples_per_second": 11.784, "eval_steps_per_second": 1.473, "step": 1620 }, { "epoch": 2.0729658372669815, "grad_norm": 1.3907960653305054, "learning_rate": 3.078295089320286e-07, "loss": 0.6357, "step": 1621 }, { "epoch": 2.074245939675174, "grad_norm": 1.1349884271621704, "learning_rate": 3.073059844753604e-07, "loss": 0.6473, "step": 1622 }, { "epoch": 2.0755260420833666, "grad_norm": 0.47560665011405945, "learning_rate": 3.0678292282145383e-07, "loss": 0.6488, "step": 1623 }, { "epoch": 2.0768061444915595, "grad_norm": 0.39596259593963623, "learning_rate": 3.0626032496775574e-07, "loss": 0.6553, "step": 1624 }, { "epoch": 2.078086246899752, "grad_norm": 1.8026816844940186, "learning_rate": 3.057381919108286e-07, "loss": 0.6587, "step": 1625 }, { "epoch": 2.0793663493079446, "grad_norm": 1.008310317993164, "learning_rate": 3.052165246463483e-07, "loss": 0.657, "step": 1626 }, { "epoch": 2.080646451716137, "grad_norm": 1.8662000894546509, "learning_rate": 3.046953241691026e-07, "loss": 0.6332, "step": 1627 }, { "epoch": 2.08192655412433, "grad_norm": 0.8910163044929504, "learning_rate": 3.0417459147298964e-07, "loss": 0.6366, "step": 1628 }, { "epoch": 2.0832066565325227, "grad_norm": 0.3107927441596985, "learning_rate": 3.036543275510144e-07, "loss": 0.6579, "step": 1629 }, { "epoch": 2.0844867589407152, "grad_norm": 0.6364381313323975, "learning_rate": 3.0313453339528907e-07, "loss": 0.6542, "step": 1630 }, { "epoch": 2.0857668613489078, "grad_norm": 1.1081907749176025, "learning_rate": 3.0261520999702944e-07, "loss": 0.6468, "step": 1631 }, { "epoch": 2.0870469637571007, "grad_norm": 1.0331661701202393, "learning_rate": 3.020963583465539e-07, "loss": 0.6572, "step": 1632 }, { "epoch": 2.0883270661652933, "grad_norm": 1.2937402725219727, "learning_rate": 3.015779794332809e-07, "loss": 0.6376, "step": 1633 }, { "epoch": 2.089607168573486, "grad_norm": 1.2057676315307617, "learning_rate": 3.010600742457272e-07, "loss": 0.6459, "step": 1634 }, { "epoch": 2.0908872709816784, "grad_norm": 0.5116521716117859, "learning_rate": 3.0054264377150733e-07, "loss": 0.6214, "step": 1635 }, { "epoch": 2.0921673733898714, "grad_norm": 0.5011716485023499, "learning_rate": 3.0002568899732925e-07, "loss": 0.6454, "step": 1636 }, { "epoch": 2.093447475798064, "grad_norm": 0.7106552720069885, "learning_rate": 2.9950921090899474e-07, "loss": 0.6541, "step": 1637 }, { "epoch": 2.0947275782062564, "grad_norm": 0.8108429908752441, "learning_rate": 2.9899321049139563e-07, "loss": 0.6604, "step": 1638 }, { "epoch": 2.096007680614449, "grad_norm": 0.5725364685058594, "learning_rate": 2.9847768872851386e-07, "loss": 0.6431, "step": 1639 }, { "epoch": 2.097287783022642, "grad_norm": 0.8272321224212646, "learning_rate": 2.9796264660341814e-07, "loss": 0.6475, "step": 1640 }, { "epoch": 2.0985678854308345, "grad_norm": 0.5481138229370117, "learning_rate": 2.974480850982622e-07, "loss": 0.654, "step": 1641 }, { "epoch": 2.099847987839027, "grad_norm": 0.6039546728134155, "learning_rate": 2.96934005194284e-07, "loss": 0.6672, "step": 1642 }, { "epoch": 2.1011280902472196, "grad_norm": 0.7045806646347046, "learning_rate": 2.964204078718027e-07, "loss": 0.6532, "step": 1643 }, { "epoch": 2.1024081926554126, "grad_norm": 1.810629963874817, "learning_rate": 2.9590729411021676e-07, "loss": 0.6473, "step": 1644 }, { "epoch": 2.103688295063605, "grad_norm": 1.700823426246643, "learning_rate": 2.953946648880035e-07, "loss": 0.6411, "step": 1645 }, { "epoch": 2.1049683974717976, "grad_norm": 2.3987796306610107, "learning_rate": 2.948825211827155e-07, "loss": 0.6665, "step": 1646 }, { "epoch": 2.10624849987999, "grad_norm": 2.0299103260040283, "learning_rate": 2.9437086397097993e-07, "loss": 0.6486, "step": 1647 }, { "epoch": 2.107528602288183, "grad_norm": 1.6957327127456665, "learning_rate": 2.9385969422849583e-07, "loss": 0.6299, "step": 1648 }, { "epoch": 2.1088087046963757, "grad_norm": 0.7744299173355103, "learning_rate": 2.933490129300329e-07, "loss": 0.6477, "step": 1649 }, { "epoch": 2.1100888071045683, "grad_norm": 0.4386851489543915, "learning_rate": 2.928388210494296e-07, "loss": 0.645, "step": 1650 }, { "epoch": 2.1100888071045683, "eval_loss": 0.02020939625799656, "eval_runtime": 42.1638, "eval_samples_per_second": 11.764, "eval_steps_per_second": 1.47, "step": 1650 }, { "epoch": 2.111368909512761, "grad_norm": 0.41846761107444763, "learning_rate": 2.923291195595907e-07, "loss": 0.6313, "step": 1651 }, { "epoch": 2.112649011920954, "grad_norm": 2.6253652572631836, "learning_rate": 2.918199094324861e-07, "loss": 0.6643, "step": 1652 }, { "epoch": 2.1139291143291463, "grad_norm": 2.1426334381103516, "learning_rate": 2.9131119163914847e-07, "loss": 0.6237, "step": 1653 }, { "epoch": 2.115209216737339, "grad_norm": 2.255629301071167, "learning_rate": 2.9080296714967183e-07, "loss": 0.6174, "step": 1654 }, { "epoch": 2.116489319145532, "grad_norm": 1.0299196243286133, "learning_rate": 2.902952369332097e-07, "loss": 0.6234, "step": 1655 }, { "epoch": 2.1177694215537244, "grad_norm": 1.690022349357605, "learning_rate": 2.897880019579724e-07, "loss": 0.6496, "step": 1656 }, { "epoch": 2.119049523961917, "grad_norm": 1.1600192785263062, "learning_rate": 2.8928126319122646e-07, "loss": 0.6303, "step": 1657 }, { "epoch": 2.1203296263701095, "grad_norm": 0.393515944480896, "learning_rate": 2.887750215992919e-07, "loss": 0.6285, "step": 1658 }, { "epoch": 2.1216097287783025, "grad_norm": 0.9558416604995728, "learning_rate": 2.8826927814754096e-07, "loss": 0.6558, "step": 1659 }, { "epoch": 2.122889831186495, "grad_norm": 0.3670780658721924, "learning_rate": 2.8776403380039536e-07, "loss": 0.633, "step": 1660 }, { "epoch": 2.1241699335946875, "grad_norm": 2.515733480453491, "learning_rate": 2.872592895213255e-07, "loss": 0.6475, "step": 1661 }, { "epoch": 2.12545003600288, "grad_norm": 0.7478556036949158, "learning_rate": 2.8675504627284835e-07, "loss": 0.6287, "step": 1662 }, { "epoch": 2.126730138411073, "grad_norm": 1.8967583179473877, "learning_rate": 2.862513050165249e-07, "loss": 0.6593, "step": 1663 }, { "epoch": 2.1280102408192656, "grad_norm": 1.2329922914505005, "learning_rate": 2.857480667129591e-07, "loss": 0.6353, "step": 1664 }, { "epoch": 2.129290343227458, "grad_norm": 0.5741075873374939, "learning_rate": 2.852453323217961e-07, "loss": 0.6562, "step": 1665 }, { "epoch": 2.1305704456356507, "grad_norm": 0.4127102196216583, "learning_rate": 2.8474310280172004e-07, "loss": 0.641, "step": 1666 }, { "epoch": 2.1318505480438437, "grad_norm": 0.342703253030777, "learning_rate": 2.8424137911045186e-07, "loss": 0.6509, "step": 1667 }, { "epoch": 2.133130650452036, "grad_norm": 1.8009696006774902, "learning_rate": 2.8374016220474806e-07, "loss": 0.6432, "step": 1668 }, { "epoch": 2.1344107528602287, "grad_norm": 2.236605405807495, "learning_rate": 2.83239453040399e-07, "loss": 0.6525, "step": 1669 }, { "epoch": 2.1356908552684213, "grad_norm": 1.8374378681182861, "learning_rate": 2.8273925257222676e-07, "loss": 0.6534, "step": 1670 }, { "epoch": 2.1369709576766143, "grad_norm": 1.4547172784805298, "learning_rate": 2.822395617540834e-07, "loss": 0.6316, "step": 1671 }, { "epoch": 2.138251060084807, "grad_norm": 0.9597583413124084, "learning_rate": 2.817403815388486e-07, "loss": 0.637, "step": 1672 }, { "epoch": 2.1395311624929993, "grad_norm": 1.2263540029525757, "learning_rate": 2.8124171287842903e-07, "loss": 0.6572, "step": 1673 }, { "epoch": 2.140811264901192, "grad_norm": 0.3359643518924713, "learning_rate": 2.807435567237557e-07, "loss": 0.6653, "step": 1674 }, { "epoch": 2.142091367309385, "grad_norm": 0.6983374357223511, "learning_rate": 2.8024591402478184e-07, "loss": 0.6443, "step": 1675 }, { "epoch": 2.1433714697175774, "grad_norm": 0.4310856759548187, "learning_rate": 2.797487857304819e-07, "loss": 0.6506, "step": 1676 }, { "epoch": 2.14465157212577, "grad_norm": 0.9562615752220154, "learning_rate": 2.792521727888495e-07, "loss": 0.6348, "step": 1677 }, { "epoch": 2.145931674533963, "grad_norm": 1.2613625526428223, "learning_rate": 2.7875607614689557e-07, "loss": 0.6432, "step": 1678 }, { "epoch": 2.1472117769421555, "grad_norm": 0.378828763961792, "learning_rate": 2.7826049675064616e-07, "loss": 0.6462, "step": 1679 }, { "epoch": 2.148491879350348, "grad_norm": 0.6812713146209717, "learning_rate": 2.777654355451407e-07, "loss": 0.6475, "step": 1680 }, { "epoch": 2.148491879350348, "eval_loss": 0.02016257867217064, "eval_runtime": 42.1253, "eval_samples_per_second": 11.774, "eval_steps_per_second": 1.472, "step": 1680 }, { "epoch": 2.1497719817585406, "grad_norm": 0.4234199523925781, "learning_rate": 2.772708934744316e-07, "loss": 0.6331, "step": 1681 }, { "epoch": 2.1510520841667335, "grad_norm": 1.2147167921066284, "learning_rate": 2.7677687148157995e-07, "loss": 0.6522, "step": 1682 }, { "epoch": 2.152332186574926, "grad_norm": 1.3142248392105103, "learning_rate": 2.762833705086562e-07, "loss": 0.6716, "step": 1683 }, { "epoch": 2.1536122889831186, "grad_norm": 1.7250616550445557, "learning_rate": 2.757903914967364e-07, "loss": 0.66, "step": 1684 }, { "epoch": 2.154892391391311, "grad_norm": 1.1016346216201782, "learning_rate": 2.7529793538590176e-07, "loss": 0.636, "step": 1685 }, { "epoch": 2.156172493799504, "grad_norm": 0.8684314489364624, "learning_rate": 2.7480600311523626e-07, "loss": 0.6587, "step": 1686 }, { "epoch": 2.1574525962076967, "grad_norm": 0.4194318950176239, "learning_rate": 2.743145956228248e-07, "loss": 0.6315, "step": 1687 }, { "epoch": 2.1587326986158892, "grad_norm": 0.7812890410423279, "learning_rate": 2.738237138457515e-07, "loss": 0.6715, "step": 1688 }, { "epoch": 2.1600128010240818, "grad_norm": 0.8380625247955322, "learning_rate": 2.733333587200984e-07, "loss": 0.6703, "step": 1689 }, { "epoch": 2.1612929034322748, "grad_norm": 0.45093443989753723, "learning_rate": 2.7284353118094307e-07, "loss": 0.6445, "step": 1690 }, { "epoch": 2.1625730058404673, "grad_norm": 0.45473405718803406, "learning_rate": 2.7235423216235655e-07, "loss": 0.6636, "step": 1691 }, { "epoch": 2.16385310824866, "grad_norm": 0.3037528097629547, "learning_rate": 2.7186546259740245e-07, "loss": 0.6689, "step": 1692 }, { "epoch": 2.1651332106568524, "grad_norm": 0.3395703434944153, "learning_rate": 2.71377223418135e-07, "loss": 0.6447, "step": 1693 }, { "epoch": 2.1664133130650454, "grad_norm": 0.5670493245124817, "learning_rate": 2.7088951555559623e-07, "loss": 0.6509, "step": 1694 }, { "epoch": 2.167693415473238, "grad_norm": 1.1347262859344482, "learning_rate": 2.7040233993981567e-07, "loss": 0.6527, "step": 1695 }, { "epoch": 2.1689735178814304, "grad_norm": 0.281864732503891, "learning_rate": 2.699156974998078e-07, "loss": 0.6541, "step": 1696 }, { "epoch": 2.170253620289623, "grad_norm": 0.5861067175865173, "learning_rate": 2.6942958916356994e-07, "loss": 0.6492, "step": 1697 }, { "epoch": 2.171533722697816, "grad_norm": 0.4594270586967468, "learning_rate": 2.6894401585808146e-07, "loss": 0.6656, "step": 1698 }, { "epoch": 2.1728138251060085, "grad_norm": 1.157881259918213, "learning_rate": 2.6845897850930075e-07, "loss": 0.6273, "step": 1699 }, { "epoch": 2.174093927514201, "grad_norm": 0.7559251189231873, "learning_rate": 2.679744780421653e-07, "loss": 0.6368, "step": 1700 }, { "epoch": 2.1753740299223936, "grad_norm": 0.6006782054901123, "learning_rate": 2.674905153805874e-07, "loss": 0.6529, "step": 1701 }, { "epoch": 2.1766541323305866, "grad_norm": 0.621809184551239, "learning_rate": 2.670070914474551e-07, "loss": 0.6498, "step": 1702 }, { "epoch": 2.177934234738779, "grad_norm": 0.4362782835960388, "learning_rate": 2.66524207164628e-07, "loss": 0.6485, "step": 1703 }, { "epoch": 2.1792143371469717, "grad_norm": 0.45238354802131653, "learning_rate": 2.660418634529372e-07, "loss": 0.651, "step": 1704 }, { "epoch": 2.180494439555164, "grad_norm": 0.6232801675796509, "learning_rate": 2.6556006123218334e-07, "loss": 0.6282, "step": 1705 }, { "epoch": 2.181774541963357, "grad_norm": 0.37600013613700867, "learning_rate": 2.6507880142113343e-07, "loss": 0.6669, "step": 1706 }, { "epoch": 2.1830546443715497, "grad_norm": 0.5129969120025635, "learning_rate": 2.64598084937521e-07, "loss": 0.628, "step": 1707 }, { "epoch": 2.1843347467797423, "grad_norm": 0.3126087486743927, "learning_rate": 2.6411791269804346e-07, "loss": 0.6486, "step": 1708 }, { "epoch": 2.1856148491879352, "grad_norm": 0.6045825481414795, "learning_rate": 2.6363828561835964e-07, "loss": 0.6216, "step": 1709 }, { "epoch": 2.186894951596128, "grad_norm": 0.3571005165576935, "learning_rate": 2.631592046130896e-07, "loss": 0.6717, "step": 1710 }, { "epoch": 2.186894951596128, "eval_loss": 0.0201637614518404, "eval_runtime": 42.1562, "eval_samples_per_second": 11.766, "eval_steps_per_second": 1.471, "step": 1710 }, { "epoch": 2.1881750540043203, "grad_norm": 1.2080676555633545, "learning_rate": 2.6268067059581167e-07, "loss": 0.6336, "step": 1711 }, { "epoch": 2.189455156412513, "grad_norm": 0.5084894895553589, "learning_rate": 2.622026844790613e-07, "loss": 0.6457, "step": 1712 }, { "epoch": 2.190735258820706, "grad_norm": 0.2760125398635864, "learning_rate": 2.61725247174329e-07, "loss": 0.6543, "step": 1713 }, { "epoch": 2.1920153612288984, "grad_norm": 0.3985959589481354, "learning_rate": 2.6124835959205815e-07, "loss": 0.6456, "step": 1714 }, { "epoch": 2.193295463637091, "grad_norm": 0.510375440120697, "learning_rate": 2.6077202264164535e-07, "loss": 0.6357, "step": 1715 }, { "epoch": 2.1945755660452835, "grad_norm": 0.513554036617279, "learning_rate": 2.602962372314357e-07, "loss": 0.6494, "step": 1716 }, { "epoch": 2.1958556684534765, "grad_norm": 0.2993606925010681, "learning_rate": 2.598210042687233e-07, "loss": 0.6481, "step": 1717 }, { "epoch": 2.197135770861669, "grad_norm": 0.32825639843940735, "learning_rate": 2.593463246597483e-07, "loss": 0.6301, "step": 1718 }, { "epoch": 2.1984158732698615, "grad_norm": 0.4421074688434601, "learning_rate": 2.588721993096964e-07, "loss": 0.6351, "step": 1719 }, { "epoch": 2.199695975678054, "grad_norm": 0.793501079082489, "learning_rate": 2.583986291226956e-07, "loss": 0.6503, "step": 1720 }, { "epoch": 2.200976078086247, "grad_norm": 0.8071904182434082, "learning_rate": 2.579256150018154e-07, "loss": 0.6461, "step": 1721 }, { "epoch": 2.2022561804944396, "grad_norm": 0.5882528424263, "learning_rate": 2.5745315784906507e-07, "loss": 0.65, "step": 1722 }, { "epoch": 2.203536282902632, "grad_norm": 1.0173689126968384, "learning_rate": 2.5698125856539187e-07, "loss": 0.654, "step": 1723 }, { "epoch": 2.2048163853108247, "grad_norm": 0.3979182839393616, "learning_rate": 2.565099180506792e-07, "loss": 0.6728, "step": 1724 }, { "epoch": 2.2060964877190177, "grad_norm": 0.6809709668159485, "learning_rate": 2.5603913720374446e-07, "loss": 0.6424, "step": 1725 }, { "epoch": 2.20737659012721, "grad_norm": 0.37447798252105713, "learning_rate": 2.555689169223384e-07, "loss": 0.6367, "step": 1726 }, { "epoch": 2.2086566925354028, "grad_norm": 0.595008373260498, "learning_rate": 2.5509925810314263e-07, "loss": 0.649, "step": 1727 }, { "epoch": 2.2099367949435953, "grad_norm": 0.4547620117664337, "learning_rate": 2.5463016164176775e-07, "loss": 0.6324, "step": 1728 }, { "epoch": 2.2112168973517883, "grad_norm": 0.668886125087738, "learning_rate": 2.5416162843275244e-07, "loss": 0.6603, "step": 1729 }, { "epoch": 2.212496999759981, "grad_norm": 0.30635368824005127, "learning_rate": 2.536936593695611e-07, "loss": 0.6505, "step": 1730 }, { "epoch": 2.2137771021681734, "grad_norm": 0.6017919778823853, "learning_rate": 2.532262553445824e-07, "loss": 0.6103, "step": 1731 }, { "epoch": 2.215057204576366, "grad_norm": 1.049589991569519, "learning_rate": 2.527594172491274e-07, "loss": 0.6411, "step": 1732 }, { "epoch": 2.216337306984559, "grad_norm": 0.6042690277099609, "learning_rate": 2.5229314597342775e-07, "loss": 0.6476, "step": 1733 }, { "epoch": 2.2176174093927514, "grad_norm": 1.0028924942016602, "learning_rate": 2.518274424066349e-07, "loss": 0.6268, "step": 1734 }, { "epoch": 2.218897511800944, "grad_norm": 0.2927337884902954, "learning_rate": 2.5136230743681706e-07, "loss": 0.6425, "step": 1735 }, { "epoch": 2.2201776142091365, "grad_norm": 1.6567517518997192, "learning_rate": 2.508977419509586e-07, "loss": 0.633, "step": 1736 }, { "epoch": 2.2214577166173295, "grad_norm": 0.4849896728992462, "learning_rate": 2.504337468349573e-07, "loss": 0.6511, "step": 1737 }, { "epoch": 2.222737819025522, "grad_norm": 0.30732324719429016, "learning_rate": 2.4997032297362404e-07, "loss": 0.6561, "step": 1738 }, { "epoch": 2.2240179214337146, "grad_norm": 0.7090358138084412, "learning_rate": 2.4950747125068e-07, "loss": 0.6166, "step": 1739 }, { "epoch": 2.2252980238419076, "grad_norm": 0.9555342793464661, "learning_rate": 2.4904519254875516e-07, "loss": 0.6499, "step": 1740 }, { "epoch": 2.2252980238419076, "eval_loss": 0.020158497616648674, "eval_runtime": 42.173, "eval_samples_per_second": 11.761, "eval_steps_per_second": 1.47, "step": 1740 }, { "epoch": 2.2265781262501, "grad_norm": 0.5362710356712341, "learning_rate": 2.48583487749387e-07, "loss": 0.625, "step": 1741 }, { "epoch": 2.2278582286582926, "grad_norm": 0.32860302925109863, "learning_rate": 2.481223577330188e-07, "loss": 0.6407, "step": 1742 }, { "epoch": 2.229138331066485, "grad_norm": 0.36726707220077515, "learning_rate": 2.476618033789971e-07, "loss": 0.6376, "step": 1743 }, { "epoch": 2.230418433474678, "grad_norm": 0.528809130191803, "learning_rate": 2.472018255655714e-07, "loss": 0.6253, "step": 1744 }, { "epoch": 2.2316985358828707, "grad_norm": 0.41761714220046997, "learning_rate": 2.467424251698914e-07, "loss": 0.6488, "step": 1745 }, { "epoch": 2.2329786382910632, "grad_norm": 0.4091174602508545, "learning_rate": 2.462836030680059e-07, "loss": 0.6485, "step": 1746 }, { "epoch": 2.234258740699256, "grad_norm": 0.277052640914917, "learning_rate": 2.4582536013486054e-07, "loss": 0.6455, "step": 1747 }, { "epoch": 2.2355388431074488, "grad_norm": 0.8211119771003723, "learning_rate": 2.45367697244297e-07, "loss": 0.6452, "step": 1748 }, { "epoch": 2.2368189455156413, "grad_norm": 1.5637989044189453, "learning_rate": 2.449106152690507e-07, "loss": 0.6307, "step": 1749 }, { "epoch": 2.238099047923834, "grad_norm": 0.436737596988678, "learning_rate": 2.444541150807489e-07, "loss": 0.6856, "step": 1750 }, { "epoch": 2.2393791503320264, "grad_norm": 0.3942205011844635, "learning_rate": 2.4399819754991024e-07, "loss": 0.6482, "step": 1751 }, { "epoch": 2.2406592527402194, "grad_norm": 0.48517122864723206, "learning_rate": 2.4354286354594125e-07, "loss": 0.6437, "step": 1752 }, { "epoch": 2.241939355148412, "grad_norm": 0.397705614566803, "learning_rate": 2.4308811393713674e-07, "loss": 0.6446, "step": 1753 }, { "epoch": 2.2432194575566045, "grad_norm": 1.196399211883545, "learning_rate": 2.426339495906764e-07, "loss": 0.6583, "step": 1754 }, { "epoch": 2.244499559964797, "grad_norm": 0.7584346532821655, "learning_rate": 2.4218037137262397e-07, "loss": 0.6268, "step": 1755 }, { "epoch": 2.24577966237299, "grad_norm": 1.5611481666564941, "learning_rate": 2.417273801479257e-07, "loss": 0.6745, "step": 1756 }, { "epoch": 2.2470597647811825, "grad_norm": 0.4745704233646393, "learning_rate": 2.4127497678040845e-07, "loss": 0.6377, "step": 1757 }, { "epoch": 2.248339867189375, "grad_norm": 0.385536253452301, "learning_rate": 2.4082316213277796e-07, "loss": 0.653, "step": 1758 }, { "epoch": 2.2496199695975676, "grad_norm": 0.9994971752166748, "learning_rate": 2.403719370666172e-07, "loss": 0.6381, "step": 1759 }, { "epoch": 2.2509000720057606, "grad_norm": 0.7433024048805237, "learning_rate": 2.399213024423851e-07, "loss": 0.6528, "step": 1760 }, { "epoch": 2.252180174413953, "grad_norm": 0.3050110340118408, "learning_rate": 2.394712591194147e-07, "loss": 0.6661, "step": 1761 }, { "epoch": 2.2534602768221457, "grad_norm": 0.8573849201202393, "learning_rate": 2.390218079559109e-07, "loss": 0.6334, "step": 1762 }, { "epoch": 2.2547403792303387, "grad_norm": 0.940575122833252, "learning_rate": 2.385729498089502e-07, "loss": 0.6533, "step": 1763 }, { "epoch": 2.256020481638531, "grad_norm": 0.42652419209480286, "learning_rate": 2.381246855344776e-07, "loss": 0.6431, "step": 1764 }, { "epoch": 2.2573005840467237, "grad_norm": 0.32327961921691895, "learning_rate": 2.3767701598730615e-07, "loss": 0.6257, "step": 1765 }, { "epoch": 2.2585806864549163, "grad_norm": 0.3992592692375183, "learning_rate": 2.3722994202111435e-07, "loss": 0.642, "step": 1766 }, { "epoch": 2.259860788863109, "grad_norm": 0.6527149081230164, "learning_rate": 2.3678346448844483e-07, "loss": 0.6657, "step": 1767 }, { "epoch": 2.261140891271302, "grad_norm": 1.0382518768310547, "learning_rate": 2.3633758424070372e-07, "loss": 0.6281, "step": 1768 }, { "epoch": 2.2624209936794943, "grad_norm": 1.5223629474639893, "learning_rate": 2.358923021281571e-07, "loss": 0.6348, "step": 1769 }, { "epoch": 2.263701096087687, "grad_norm": 0.27793729305267334, "learning_rate": 2.3544761899993136e-07, "loss": 0.6533, "step": 1770 }, { "epoch": 2.263701096087687, "eval_loss": 0.02012365497648716, "eval_runtime": 42.0793, "eval_samples_per_second": 11.787, "eval_steps_per_second": 1.473, "step": 1770 }, { "epoch": 2.26498119849588, "grad_norm": 0.29933908581733704, "learning_rate": 2.3500353570400988e-07, "loss": 0.6327, "step": 1771 }, { "epoch": 2.2662613009040724, "grad_norm": 0.5139304399490356, "learning_rate": 2.3456005308723276e-07, "loss": 0.6492, "step": 1772 }, { "epoch": 2.267541403312265, "grad_norm": 0.5903033018112183, "learning_rate": 2.341171719952945e-07, "loss": 0.652, "step": 1773 }, { "epoch": 2.2688215057204575, "grad_norm": 0.8121602535247803, "learning_rate": 2.3367489327274227e-07, "loss": 0.629, "step": 1774 }, { "epoch": 2.2701016081286505, "grad_norm": 0.3843027651309967, "learning_rate": 2.3323321776297478e-07, "loss": 0.6317, "step": 1775 }, { "epoch": 2.271381710536843, "grad_norm": 0.7982187867164612, "learning_rate": 2.3279214630824052e-07, "loss": 0.636, "step": 1776 }, { "epoch": 2.2726618129450356, "grad_norm": 0.40144699811935425, "learning_rate": 2.3235167974963614e-07, "loss": 0.639, "step": 1777 }, { "epoch": 2.273941915353228, "grad_norm": 0.7816945910453796, "learning_rate": 2.3191181892710434e-07, "loss": 0.6281, "step": 1778 }, { "epoch": 2.275222017761421, "grad_norm": 0.2934492230415344, "learning_rate": 2.3147256467943316e-07, "loss": 0.6665, "step": 1779 }, { "epoch": 2.2765021201696136, "grad_norm": 0.8136604428291321, "learning_rate": 2.310339178442539e-07, "loss": 0.6292, "step": 1780 }, { "epoch": 2.277782222577806, "grad_norm": 0.45339545607566833, "learning_rate": 2.305958792580392e-07, "loss": 0.6539, "step": 1781 }, { "epoch": 2.2790623249859987, "grad_norm": 0.5785622000694275, "learning_rate": 2.3015844975610238e-07, "loss": 0.6457, "step": 1782 }, { "epoch": 2.2803424273941917, "grad_norm": 1.0654321908950806, "learning_rate": 2.2972163017259467e-07, "loss": 0.6603, "step": 1783 }, { "epoch": 2.2816225298023842, "grad_norm": 0.3077518343925476, "learning_rate": 2.2928542134050457e-07, "loss": 0.6581, "step": 1784 }, { "epoch": 2.2829026322105768, "grad_norm": 0.32112276554107666, "learning_rate": 2.2884982409165615e-07, "loss": 0.6318, "step": 1785 }, { "epoch": 2.2841827346187698, "grad_norm": 0.622465968132019, "learning_rate": 2.284148392567065e-07, "loss": 0.6363, "step": 1786 }, { "epoch": 2.2854628370269623, "grad_norm": 0.4420005977153778, "learning_rate": 2.2798046766514555e-07, "loss": 0.65, "step": 1787 }, { "epoch": 2.286742939435155, "grad_norm": 0.33567139506340027, "learning_rate": 2.2754671014529347e-07, "loss": 0.6298, "step": 1788 }, { "epoch": 2.2880230418433474, "grad_norm": 0.5566020011901855, "learning_rate": 2.2711356752429978e-07, "loss": 0.651, "step": 1789 }, { "epoch": 2.28930314425154, "grad_norm": 0.8339033722877502, "learning_rate": 2.2668104062814084e-07, "loss": 0.6603, "step": 1790 }, { "epoch": 2.290583246659733, "grad_norm": 1.1019378900527954, "learning_rate": 2.262491302816193e-07, "loss": 0.6372, "step": 1791 }, { "epoch": 2.2918633490679254, "grad_norm": 1.1420990228652954, "learning_rate": 2.2581783730836222e-07, "loss": 0.6542, "step": 1792 }, { "epoch": 2.293143451476118, "grad_norm": 0.39219775795936584, "learning_rate": 2.2538716253081875e-07, "loss": 0.6465, "step": 1793 }, { "epoch": 2.294423553884311, "grad_norm": 0.5957415103912354, "learning_rate": 2.2495710677025974e-07, "loss": 0.6213, "step": 1794 }, { "epoch": 2.2957036562925035, "grad_norm": 0.7786949872970581, "learning_rate": 2.2452767084677559e-07, "loss": 0.6439, "step": 1795 }, { "epoch": 2.296983758700696, "grad_norm": 1.0307668447494507, "learning_rate": 2.2409885557927427e-07, "loss": 0.6472, "step": 1796 }, { "epoch": 2.2982638611088886, "grad_norm": 1.162601351737976, "learning_rate": 2.236706617854807e-07, "loss": 0.6228, "step": 1797 }, { "epoch": 2.299543963517081, "grad_norm": 0.2867487370967865, "learning_rate": 2.2324309028193411e-07, "loss": 0.6392, "step": 1798 }, { "epoch": 2.300824065925274, "grad_norm": 0.30754393339157104, "learning_rate": 2.2281614188398795e-07, "loss": 0.6541, "step": 1799 }, { "epoch": 2.3021041683334666, "grad_norm": 0.8162621259689331, "learning_rate": 2.223898174058065e-07, "loss": 0.665, "step": 1800 }, { "epoch": 2.3021041683334666, "eval_loss": 0.02015284076333046, "eval_runtime": 42.1539, "eval_samples_per_second": 11.766, "eval_steps_per_second": 1.471, "step": 1800 }, { "epoch": 2.303384270741659, "grad_norm": 0.4854496121406555, "learning_rate": 2.2196411766036487e-07, "loss": 0.6539, "step": 1801 }, { "epoch": 2.304664373149852, "grad_norm": 0.3153534531593323, "learning_rate": 2.215390434594465e-07, "loss": 0.6312, "step": 1802 }, { "epoch": 2.3059444755580447, "grad_norm": 0.4862923324108124, "learning_rate": 2.2111459561364214e-07, "loss": 0.6612, "step": 1803 }, { "epoch": 2.3072245779662373, "grad_norm": 0.8877408504486084, "learning_rate": 2.2069077493234828e-07, "loss": 0.635, "step": 1804 }, { "epoch": 2.30850468037443, "grad_norm": 0.32969245314598083, "learning_rate": 2.2026758222376487e-07, "loss": 0.6496, "step": 1805 }, { "epoch": 2.309784782782623, "grad_norm": 0.4842302203178406, "learning_rate": 2.19845018294895e-07, "loss": 0.6378, "step": 1806 }, { "epoch": 2.3110648851908153, "grad_norm": 0.2898105978965759, "learning_rate": 2.1942308395154247e-07, "loss": 0.6399, "step": 1807 }, { "epoch": 2.312344987599008, "grad_norm": 0.5234752297401428, "learning_rate": 2.190017799983102e-07, "loss": 0.659, "step": 1808 }, { "epoch": 2.3136250900072004, "grad_norm": 1.0354506969451904, "learning_rate": 2.1858110723859945e-07, "loss": 0.6449, "step": 1809 }, { "epoch": 2.3149051924153934, "grad_norm": 2.200321912765503, "learning_rate": 2.181610664746077e-07, "loss": 0.6705, "step": 1810 }, { "epoch": 2.316185294823586, "grad_norm": 1.7531229257583618, "learning_rate": 2.1774165850732723e-07, "loss": 0.6559, "step": 1811 }, { "epoch": 2.3174653972317785, "grad_norm": 0.3324636220932007, "learning_rate": 2.1732288413654343e-07, "loss": 0.6529, "step": 1812 }, { "epoch": 2.318745499639971, "grad_norm": 0.6571164727210999, "learning_rate": 2.169047441608335e-07, "loss": 0.6681, "step": 1813 }, { "epoch": 2.320025602048164, "grad_norm": 0.400339812040329, "learning_rate": 2.164872393775654e-07, "loss": 0.6483, "step": 1814 }, { "epoch": 2.3213057044563565, "grad_norm": 0.2698453962802887, "learning_rate": 2.1607037058289506e-07, "loss": 0.6573, "step": 1815 }, { "epoch": 2.322585806864549, "grad_norm": 0.6890880465507507, "learning_rate": 2.1565413857176622e-07, "loss": 0.6482, "step": 1816 }, { "epoch": 2.323865909272742, "grad_norm": 0.28772851824760437, "learning_rate": 2.1523854413790774e-07, "loss": 0.6543, "step": 1817 }, { "epoch": 2.3251460116809346, "grad_norm": 0.6504804491996765, "learning_rate": 2.1482358807383343e-07, "loss": 0.6453, "step": 1818 }, { "epoch": 2.326426114089127, "grad_norm": 0.921272873878479, "learning_rate": 2.1440927117083916e-07, "loss": 0.6267, "step": 1819 }, { "epoch": 2.3277062164973197, "grad_norm": 0.4007938504219055, "learning_rate": 2.139955942190019e-07, "loss": 0.6349, "step": 1820 }, { "epoch": 2.328986318905512, "grad_norm": 0.30225899815559387, "learning_rate": 2.1358255800717874e-07, "loss": 0.6642, "step": 1821 }, { "epoch": 2.330266421313705, "grad_norm": 0.27912068367004395, "learning_rate": 2.1317016332300448e-07, "loss": 0.6353, "step": 1822 }, { "epoch": 2.3315465237218977, "grad_norm": 1.1977477073669434, "learning_rate": 2.1275841095289103e-07, "loss": 0.6121, "step": 1823 }, { "epoch": 2.3328266261300903, "grad_norm": 0.9994994401931763, "learning_rate": 2.1234730168202497e-07, "loss": 0.6363, "step": 1824 }, { "epoch": 2.3341067285382833, "grad_norm": 0.3838488757610321, "learning_rate": 2.1193683629436675e-07, "loss": 0.6278, "step": 1825 }, { "epoch": 2.335386830946476, "grad_norm": 0.5517988801002502, "learning_rate": 2.1152701557264913e-07, "loss": 0.6426, "step": 1826 }, { "epoch": 2.3366669333546684, "grad_norm": 0.6919355392456055, "learning_rate": 2.1111784029837509e-07, "loss": 0.6672, "step": 1827 }, { "epoch": 2.337947035762861, "grad_norm": 0.6093190908432007, "learning_rate": 2.1070931125181723e-07, "loss": 0.6386, "step": 1828 }, { "epoch": 2.339227138171054, "grad_norm": 1.0338945388793945, "learning_rate": 2.1030142921201554e-07, "loss": 0.649, "step": 1829 }, { "epoch": 2.3405072405792464, "grad_norm": 0.43368566036224365, "learning_rate": 2.0989419495677658e-07, "loss": 0.6447, "step": 1830 }, { "epoch": 2.3405072405792464, "eval_loss": 0.02010626532137394, "eval_runtime": 42.0908, "eval_samples_per_second": 11.784, "eval_steps_per_second": 1.473, "step": 1830 }, { "epoch": 2.341787342987439, "grad_norm": 0.6235509514808655, "learning_rate": 2.0948760926267118e-07, "loss": 0.6515, "step": 1831 }, { "epoch": 2.3430674453956315, "grad_norm": 1.3620926141738892, "learning_rate": 2.0908167290503326e-07, "loss": 0.6815, "step": 1832 }, { "epoch": 2.3443475478038245, "grad_norm": 0.5476362705230713, "learning_rate": 2.0867638665795948e-07, "loss": 0.6463, "step": 1833 }, { "epoch": 2.345627650212017, "grad_norm": 0.9010919332504272, "learning_rate": 2.0827175129430562e-07, "loss": 0.6424, "step": 1834 }, { "epoch": 2.3469077526202096, "grad_norm": 0.7875086665153503, "learning_rate": 2.0786776758568715e-07, "loss": 0.6387, "step": 1835 }, { "epoch": 2.348187855028402, "grad_norm": 0.40548086166381836, "learning_rate": 2.07464436302476e-07, "loss": 0.6341, "step": 1836 }, { "epoch": 2.349467957436595, "grad_norm": 0.5045724511146545, "learning_rate": 2.0706175821380088e-07, "loss": 0.6604, "step": 1837 }, { "epoch": 2.3507480598447876, "grad_norm": 0.28327035903930664, "learning_rate": 2.0665973408754434e-07, "loss": 0.6143, "step": 1838 }, { "epoch": 2.35202816225298, "grad_norm": 0.7128240466117859, "learning_rate": 2.062583646903419e-07, "loss": 0.6582, "step": 1839 }, { "epoch": 2.3533082646611727, "grad_norm": 1.006453037261963, "learning_rate": 2.0585765078758073e-07, "loss": 0.6578, "step": 1840 }, { "epoch": 2.3545883670693657, "grad_norm": 0.3793086111545563, "learning_rate": 2.05457593143398e-07, "loss": 0.6547, "step": 1841 }, { "epoch": 2.3558684694775582, "grad_norm": 0.2993364930152893, "learning_rate": 2.0505819252067924e-07, "loss": 0.6294, "step": 1842 }, { "epoch": 2.3571485718857508, "grad_norm": 0.3089614510536194, "learning_rate": 2.046594496810572e-07, "loss": 0.6536, "step": 1843 }, { "epoch": 2.3584286742939433, "grad_norm": 0.30341318249702454, "learning_rate": 2.0426136538491028e-07, "loss": 0.6429, "step": 1844 }, { "epoch": 2.3597087767021363, "grad_norm": 1.006575345993042, "learning_rate": 2.0386394039136135e-07, "loss": 0.6504, "step": 1845 }, { "epoch": 2.360988879110329, "grad_norm": 0.25898298621177673, "learning_rate": 2.0346717545827537e-07, "loss": 0.6641, "step": 1846 }, { "epoch": 2.3622689815185214, "grad_norm": 0.28283822536468506, "learning_rate": 2.0307107134225917e-07, "loss": 0.6379, "step": 1847 }, { "epoch": 2.3635490839267144, "grad_norm": 0.2747233808040619, "learning_rate": 2.0267562879865938e-07, "loss": 0.6539, "step": 1848 }, { "epoch": 2.364829186334907, "grad_norm": 0.34003594517707825, "learning_rate": 2.022808485815606e-07, "loss": 0.6524, "step": 1849 }, { "epoch": 2.3661092887430994, "grad_norm": 0.3853084444999695, "learning_rate": 2.018867314437852e-07, "loss": 0.6226, "step": 1850 }, { "epoch": 2.367389391151292, "grad_norm": 0.9650640487670898, "learning_rate": 2.014932781368901e-07, "loss": 0.6398, "step": 1851 }, { "epoch": 2.3686694935594845, "grad_norm": 0.8094896078109741, "learning_rate": 2.0110048941116744e-07, "loss": 0.6344, "step": 1852 }, { "epoch": 2.3699495959676775, "grad_norm": 0.5167139172554016, "learning_rate": 2.0070836601564123e-07, "loss": 0.65, "step": 1853 }, { "epoch": 2.37122969837587, "grad_norm": 0.3214775025844574, "learning_rate": 2.003169086980669e-07, "loss": 0.6513, "step": 1854 }, { "epoch": 2.3725098007840626, "grad_norm": 0.9151511192321777, "learning_rate": 1.9992611820492987e-07, "loss": 0.6614, "step": 1855 }, { "epoch": 2.3737899031922556, "grad_norm": 0.2876303791999817, "learning_rate": 1.9953599528144393e-07, "loss": 0.6448, "step": 1856 }, { "epoch": 2.375070005600448, "grad_norm": 0.9985367655754089, "learning_rate": 1.9914654067154996e-07, "loss": 0.64, "step": 1857 }, { "epoch": 2.3763501080086407, "grad_norm": 1.0177196264266968, "learning_rate": 1.9875775511791405e-07, "loss": 0.6351, "step": 1858 }, { "epoch": 2.377630210416833, "grad_norm": 0.8262308835983276, "learning_rate": 1.9836963936192668e-07, "loss": 0.6422, "step": 1859 }, { "epoch": 2.378910312825026, "grad_norm": 0.6126952767372131, "learning_rate": 1.9798219414370125e-07, "loss": 0.6483, "step": 1860 }, { "epoch": 2.378910312825026, "eval_loss": 0.02008889988064766, "eval_runtime": 42.0694, "eval_samples_per_second": 11.79, "eval_steps_per_second": 1.474, "step": 1860 }, { "epoch": 2.3801904152332187, "grad_norm": 0.39929261803627014, "learning_rate": 1.9759542020207208e-07, "loss": 0.6472, "step": 1861 }, { "epoch": 2.3814705176414113, "grad_norm": 0.349311888217926, "learning_rate": 1.972093182745936e-07, "loss": 0.645, "step": 1862 }, { "epoch": 2.382750620049604, "grad_norm": 0.6252041459083557, "learning_rate": 1.968238890975388e-07, "loss": 0.6548, "step": 1863 }, { "epoch": 2.384030722457797, "grad_norm": 0.5257276892662048, "learning_rate": 1.9643913340589796e-07, "loss": 0.6434, "step": 1864 }, { "epoch": 2.3853108248659893, "grad_norm": 0.5241679549217224, "learning_rate": 1.9605505193337656e-07, "loss": 0.6397, "step": 1865 }, { "epoch": 2.386590927274182, "grad_norm": 0.4854609966278076, "learning_rate": 1.9567164541239458e-07, "loss": 0.6457, "step": 1866 }, { "epoch": 2.3878710296823744, "grad_norm": 0.9014168977737427, "learning_rate": 1.9528891457408537e-07, "loss": 0.6368, "step": 1867 }, { "epoch": 2.3891511320905674, "grad_norm": 0.8353707194328308, "learning_rate": 1.949068601482931e-07, "loss": 0.6263, "step": 1868 }, { "epoch": 2.39043123449876, "grad_norm": 0.5165855884552002, "learning_rate": 1.9452548286357257e-07, "loss": 0.6397, "step": 1869 }, { "epoch": 2.3917113369069525, "grad_norm": 0.32406508922576904, "learning_rate": 1.9414478344718686e-07, "loss": 0.6502, "step": 1870 }, { "epoch": 2.392991439315145, "grad_norm": 1.0820974111557007, "learning_rate": 1.9376476262510693e-07, "loss": 0.66, "step": 1871 }, { "epoch": 2.394271541723338, "grad_norm": 0.47412022948265076, "learning_rate": 1.933854211220094e-07, "loss": 0.6517, "step": 1872 }, { "epoch": 2.3955516441315305, "grad_norm": 0.6075067520141602, "learning_rate": 1.930067596612753e-07, "loss": 0.6502, "step": 1873 }, { "epoch": 2.396831746539723, "grad_norm": 1.3067188262939453, "learning_rate": 1.9262877896498918e-07, "loss": 0.6407, "step": 1874 }, { "epoch": 2.3981118489479156, "grad_norm": 0.864513635635376, "learning_rate": 1.9225147975393729e-07, "loss": 0.6598, "step": 1875 }, { "epoch": 2.3993919513561086, "grad_norm": 0.708365797996521, "learning_rate": 1.9187486274760646e-07, "loss": 0.6525, "step": 1876 }, { "epoch": 2.400672053764301, "grad_norm": 0.5684159994125366, "learning_rate": 1.9149892866418227e-07, "loss": 0.6589, "step": 1877 }, { "epoch": 2.4019521561724937, "grad_norm": 0.7958438992500305, "learning_rate": 1.9112367822054825e-07, "loss": 0.6633, "step": 1878 }, { "epoch": 2.4032322585806867, "grad_norm": 1.810461163520813, "learning_rate": 1.9074911213228438e-07, "loss": 0.6418, "step": 1879 }, { "epoch": 2.404512360988879, "grad_norm": 1.2592270374298096, "learning_rate": 1.9037523111366523e-07, "loss": 0.6457, "step": 1880 }, { "epoch": 2.4057924633970718, "grad_norm": 1.924454689025879, "learning_rate": 1.9000203587765933e-07, "loss": 0.6351, "step": 1881 }, { "epoch": 2.4070725658052643, "grad_norm": 1.0833786725997925, "learning_rate": 1.896295271359275e-07, "loss": 0.639, "step": 1882 }, { "epoch": 2.408352668213457, "grad_norm": 1.5531961917877197, "learning_rate": 1.8925770559882103e-07, "loss": 0.6515, "step": 1883 }, { "epoch": 2.40963277062165, "grad_norm": 0.4649311304092407, "learning_rate": 1.8888657197538122e-07, "loss": 0.6405, "step": 1884 }, { "epoch": 2.4109128730298424, "grad_norm": 0.36879318952560425, "learning_rate": 1.8851612697333723e-07, "loss": 0.6512, "step": 1885 }, { "epoch": 2.412192975438035, "grad_norm": 0.32952210307121277, "learning_rate": 1.8814637129910533e-07, "loss": 0.6293, "step": 1886 }, { "epoch": 2.413473077846228, "grad_norm": 1.4149285554885864, "learning_rate": 1.8777730565778704e-07, "loss": 0.6734, "step": 1887 }, { "epoch": 2.4147531802544204, "grad_norm": 1.2685195207595825, "learning_rate": 1.8740893075316837e-07, "loss": 0.6497, "step": 1888 }, { "epoch": 2.416033282662613, "grad_norm": 1.7101200819015503, "learning_rate": 1.8704124728771765e-07, "loss": 0.657, "step": 1889 }, { "epoch": 2.4173133850708055, "grad_norm": 0.5529716610908508, "learning_rate": 1.8667425596258496e-07, "loss": 0.6414, "step": 1890 }, { "epoch": 2.4173133850708055, "eval_loss": 0.02006075717508793, "eval_runtime": 42.0208, "eval_samples_per_second": 11.804, "eval_steps_per_second": 1.475, "step": 1890 }, { "epoch": 2.4185934874789985, "grad_norm": 1.6830273866653442, "learning_rate": 1.8630795747760072e-07, "loss": 0.6208, "step": 1891 }, { "epoch": 2.419873589887191, "grad_norm": 0.35148826241493225, "learning_rate": 1.8594235253127372e-07, "loss": 0.6287, "step": 1892 }, { "epoch": 2.4211536922953836, "grad_norm": 0.4713979661464691, "learning_rate": 1.855774418207904e-07, "loss": 0.6293, "step": 1893 }, { "epoch": 2.422433794703576, "grad_norm": 0.6958292722702026, "learning_rate": 1.8521322604201345e-07, "loss": 0.6322, "step": 1894 }, { "epoch": 2.423713897111769, "grad_norm": 0.2775862514972687, "learning_rate": 1.8484970588948018e-07, "loss": 0.6341, "step": 1895 }, { "epoch": 2.4249939995199616, "grad_norm": 0.26912301778793335, "learning_rate": 1.8448688205640146e-07, "loss": 0.6446, "step": 1896 }, { "epoch": 2.426274101928154, "grad_norm": 0.5997962951660156, "learning_rate": 1.8412475523466031e-07, "loss": 0.6525, "step": 1897 }, { "epoch": 2.4275542043363467, "grad_norm": 0.8969947695732117, "learning_rate": 1.8376332611481084e-07, "loss": 0.6503, "step": 1898 }, { "epoch": 2.4288343067445397, "grad_norm": 0.3669740855693817, "learning_rate": 1.8340259538607622e-07, "loss": 0.6452, "step": 1899 }, { "epoch": 2.4301144091527322, "grad_norm": 1.053138256072998, "learning_rate": 1.83042563736348e-07, "loss": 0.634, "step": 1900 }, { "epoch": 2.431394511560925, "grad_norm": 0.9371493458747864, "learning_rate": 1.8268323185218483e-07, "loss": 0.6419, "step": 1901 }, { "epoch": 2.4326746139691178, "grad_norm": 0.30069494247436523, "learning_rate": 1.823246004188107e-07, "loss": 0.6548, "step": 1902 }, { "epoch": 2.4339547163773103, "grad_norm": 0.3713652193546295, "learning_rate": 1.8196667012011425e-07, "loss": 0.6549, "step": 1903 }, { "epoch": 2.435234818785503, "grad_norm": 0.3901284635066986, "learning_rate": 1.816094416386465e-07, "loss": 0.6644, "step": 1904 }, { "epoch": 2.4365149211936954, "grad_norm": 0.42883288860321045, "learning_rate": 1.8125291565562065e-07, "loss": 0.6213, "step": 1905 }, { "epoch": 2.437795023601888, "grad_norm": 0.7028409838676453, "learning_rate": 1.8089709285091027e-07, "loss": 0.6397, "step": 1906 }, { "epoch": 2.439075126010081, "grad_norm": 0.9829962849617004, "learning_rate": 1.8054197390304754e-07, "loss": 0.6446, "step": 1907 }, { "epoch": 2.4403552284182735, "grad_norm": 0.49874556064605713, "learning_rate": 1.8018755948922287e-07, "loss": 0.6511, "step": 1908 }, { "epoch": 2.441635330826466, "grad_norm": 0.7384973764419556, "learning_rate": 1.7983385028528314e-07, "loss": 0.6492, "step": 1909 }, { "epoch": 2.442915433234659, "grad_norm": 0.5218079686164856, "learning_rate": 1.7948084696573042e-07, "loss": 0.6221, "step": 1910 }, { "epoch": 2.4441955356428515, "grad_norm": 0.3272707760334015, "learning_rate": 1.7912855020372042e-07, "loss": 0.6335, "step": 1911 }, { "epoch": 2.445475638051044, "grad_norm": 1.4565428495407104, "learning_rate": 1.7877696067106156e-07, "loss": 0.649, "step": 1912 }, { "epoch": 2.4467557404592366, "grad_norm": 0.33118700981140137, "learning_rate": 1.7842607903821416e-07, "loss": 0.6471, "step": 1913 }, { "epoch": 2.448035842867429, "grad_norm": 0.3029654920101166, "learning_rate": 1.780759059742879e-07, "loss": 0.6325, "step": 1914 }, { "epoch": 2.449315945275622, "grad_norm": 0.2925473749637604, "learning_rate": 1.777264421470417e-07, "loss": 0.6441, "step": 1915 }, { "epoch": 2.4505960476838147, "grad_norm": 0.30991068482398987, "learning_rate": 1.773776882228816e-07, "loss": 0.6458, "step": 1916 }, { "epoch": 2.451876150092007, "grad_norm": 0.28182026743888855, "learning_rate": 1.770296448668606e-07, "loss": 0.6588, "step": 1917 }, { "epoch": 2.4531562525002, "grad_norm": 0.5878859162330627, "learning_rate": 1.766823127426761e-07, "loss": 0.6467, "step": 1918 }, { "epoch": 2.4544363549083927, "grad_norm": 0.2892199158668518, "learning_rate": 1.7633569251266917e-07, "loss": 0.668, "step": 1919 }, { "epoch": 2.4557164573165853, "grad_norm": 0.47324714064598083, "learning_rate": 1.7598978483782373e-07, "loss": 0.6538, "step": 1920 }, { "epoch": 2.4557164573165853, "eval_loss": 0.020135222002863884, "eval_runtime": 42.0901, "eval_samples_per_second": 11.784, "eval_steps_per_second": 1.473, "step": 1920 }, { "epoch": 2.456996559724778, "grad_norm": 0.9060631990432739, "learning_rate": 1.7564459037776473e-07, "loss": 0.645, "step": 1921 }, { "epoch": 2.458276662132971, "grad_norm": 0.37348079681396484, "learning_rate": 1.7530010979075718e-07, "loss": 0.6481, "step": 1922 }, { "epoch": 2.4595567645411633, "grad_norm": 0.31659358739852905, "learning_rate": 1.7495634373370443e-07, "loss": 0.63, "step": 1923 }, { "epoch": 2.460836866949356, "grad_norm": 0.3929433822631836, "learning_rate": 1.746132928621476e-07, "loss": 0.6291, "step": 1924 }, { "epoch": 2.4621169693575484, "grad_norm": 0.598603367805481, "learning_rate": 1.742709578302639e-07, "loss": 0.6541, "step": 1925 }, { "epoch": 2.4633970717657414, "grad_norm": 0.4392068088054657, "learning_rate": 1.739293392908654e-07, "loss": 0.6299, "step": 1926 }, { "epoch": 2.464677174173934, "grad_norm": 0.2982366383075714, "learning_rate": 1.7358843789539795e-07, "loss": 0.6717, "step": 1927 }, { "epoch": 2.4659572765821265, "grad_norm": 0.29809802770614624, "learning_rate": 1.7324825429393985e-07, "loss": 0.6564, "step": 1928 }, { "epoch": 2.467237378990319, "grad_norm": 0.44110092520713806, "learning_rate": 1.7290878913520068e-07, "loss": 0.6521, "step": 1929 }, { "epoch": 2.468517481398512, "grad_norm": 0.3481731414794922, "learning_rate": 1.725700430665198e-07, "loss": 0.6382, "step": 1930 }, { "epoch": 2.4697975838067046, "grad_norm": 0.26957058906555176, "learning_rate": 1.7223201673386522e-07, "loss": 0.6434, "step": 1931 }, { "epoch": 2.471077686214897, "grad_norm": 0.6669008731842041, "learning_rate": 1.71894710781833e-07, "loss": 0.6581, "step": 1932 }, { "epoch": 2.47235778862309, "grad_norm": 1.3197649717330933, "learning_rate": 1.7155812585364487e-07, "loss": 0.6667, "step": 1933 }, { "epoch": 2.4736378910312826, "grad_norm": 0.4848359227180481, "learning_rate": 1.7122226259114807e-07, "loss": 0.6314, "step": 1934 }, { "epoch": 2.474917993439475, "grad_norm": 0.3677651584148407, "learning_rate": 1.708871216348132e-07, "loss": 0.6271, "step": 1935 }, { "epoch": 2.4761980958476677, "grad_norm": 0.3303697109222412, "learning_rate": 1.7055270362373395e-07, "loss": 0.6494, "step": 1936 }, { "epoch": 2.4774781982558602, "grad_norm": 1.5756772756576538, "learning_rate": 1.702190091956252e-07, "loss": 0.6344, "step": 1937 }, { "epoch": 2.4787583006640532, "grad_norm": 0.3608613908290863, "learning_rate": 1.6988603898682175e-07, "loss": 0.645, "step": 1938 }, { "epoch": 2.4800384030722458, "grad_norm": 0.2569604218006134, "learning_rate": 1.6955379363227767e-07, "loss": 0.6626, "step": 1939 }, { "epoch": 2.4813185054804383, "grad_norm": 0.49216943979263306, "learning_rate": 1.6922227376556486e-07, "loss": 0.6532, "step": 1940 }, { "epoch": 2.4825986078886313, "grad_norm": 0.27307888865470886, "learning_rate": 1.6889148001887139e-07, "loss": 0.6493, "step": 1941 }, { "epoch": 2.483878710296824, "grad_norm": 1.0339336395263672, "learning_rate": 1.6856141302300087e-07, "loss": 0.6279, "step": 1942 }, { "epoch": 2.4851588127050164, "grad_norm": 0.7342440485954285, "learning_rate": 1.6823207340737115e-07, "loss": 0.6548, "step": 1943 }, { "epoch": 2.486438915113209, "grad_norm": 0.47728464007377625, "learning_rate": 1.679034618000129e-07, "loss": 0.6477, "step": 1944 }, { "epoch": 2.487719017521402, "grad_norm": 0.7339931130409241, "learning_rate": 1.6757557882756842e-07, "loss": 0.6381, "step": 1945 }, { "epoch": 2.4889991199295944, "grad_norm": 0.5934532880783081, "learning_rate": 1.6724842511529063e-07, "loss": 0.6552, "step": 1946 }, { "epoch": 2.490279222337787, "grad_norm": 0.32484838366508484, "learning_rate": 1.66922001287042e-07, "loss": 0.6645, "step": 1947 }, { "epoch": 2.4915593247459795, "grad_norm": 0.274696409702301, "learning_rate": 1.665963079652927e-07, "loss": 0.6305, "step": 1948 }, { "epoch": 2.4928394271541725, "grad_norm": 1.2078450918197632, "learning_rate": 1.662713457711204e-07, "loss": 0.6549, "step": 1949 }, { "epoch": 2.494119529562365, "grad_norm": 0.4069227874279022, "learning_rate": 1.6594711532420786e-07, "loss": 0.6358, "step": 1950 }, { "epoch": 2.494119529562365, "eval_loss": 0.020105183124542236, "eval_runtime": 42.1086, "eval_samples_per_second": 11.779, "eval_steps_per_second": 1.472, "step": 1950 }, { "epoch": 2.4953996319705576, "grad_norm": 0.4317651093006134, "learning_rate": 1.6562361724284346e-07, "loss": 0.6629, "step": 1951 }, { "epoch": 2.49667973437875, "grad_norm": 0.7961587905883789, "learning_rate": 1.6530085214391804e-07, "loss": 0.6489, "step": 1952 }, { "epoch": 2.497959836786943, "grad_norm": 0.2762162685394287, "learning_rate": 1.64978820642925e-07, "loss": 0.6363, "step": 1953 }, { "epoch": 2.4992399391951357, "grad_norm": 0.2738543152809143, "learning_rate": 1.6465752335395906e-07, "loss": 0.6448, "step": 1954 }, { "epoch": 2.500520041603328, "grad_norm": 0.35184672474861145, "learning_rate": 1.643369608897145e-07, "loss": 0.6431, "step": 1955 }, { "epoch": 2.501800144011521, "grad_norm": 0.40584972500801086, "learning_rate": 1.6401713386148477e-07, "loss": 0.645, "step": 1956 }, { "epoch": 2.5030802464197137, "grad_norm": 0.272732138633728, "learning_rate": 1.6369804287916025e-07, "loss": 0.6452, "step": 1957 }, { "epoch": 2.5043603488279063, "grad_norm": 0.30653154850006104, "learning_rate": 1.6337968855122827e-07, "loss": 0.6493, "step": 1958 }, { "epoch": 2.505640451236099, "grad_norm": 0.36809736490249634, "learning_rate": 1.630620714847713e-07, "loss": 0.6319, "step": 1959 }, { "epoch": 2.5069205536442913, "grad_norm": 0.2883507311344147, "learning_rate": 1.6274519228546562e-07, "loss": 0.6398, "step": 1960 }, { "epoch": 2.5082006560524843, "grad_norm": 0.30058497190475464, "learning_rate": 1.6242905155758072e-07, "loss": 0.6275, "step": 1961 }, { "epoch": 2.509480758460677, "grad_norm": 0.5942174196243286, "learning_rate": 1.6211364990397782e-07, "loss": 0.6454, "step": 1962 }, { "epoch": 2.5107608608688694, "grad_norm": 0.8409835696220398, "learning_rate": 1.6179898792610875e-07, "loss": 0.6408, "step": 1963 }, { "epoch": 2.5120409632770624, "grad_norm": 0.283600777387619, "learning_rate": 1.614850662240148e-07, "loss": 0.6463, "step": 1964 }, { "epoch": 2.513321065685255, "grad_norm": 0.34936267137527466, "learning_rate": 1.6117188539632538e-07, "loss": 0.6308, "step": 1965 }, { "epoch": 2.5146011680934475, "grad_norm": 0.9134256839752197, "learning_rate": 1.6085944604025765e-07, "loss": 0.6504, "step": 1966 }, { "epoch": 2.51588127050164, "grad_norm": 1.156744360923767, "learning_rate": 1.6054774875161434e-07, "loss": 0.6549, "step": 1967 }, { "epoch": 2.5171613729098326, "grad_norm": 0.35297149419784546, "learning_rate": 1.6023679412478336e-07, "loss": 0.6536, "step": 1968 }, { "epoch": 2.5184414753180255, "grad_norm": 0.8533351421356201, "learning_rate": 1.5992658275273618e-07, "loss": 0.6467, "step": 1969 }, { "epoch": 2.519721577726218, "grad_norm": 0.5023815035820007, "learning_rate": 1.5961711522702708e-07, "loss": 0.6331, "step": 1970 }, { "epoch": 2.5210016801344106, "grad_norm": 0.292744904756546, "learning_rate": 1.593083921377921e-07, "loss": 0.6521, "step": 1971 }, { "epoch": 2.5222817825426036, "grad_norm": 0.8255204558372498, "learning_rate": 1.5900041407374706e-07, "loss": 0.6605, "step": 1972 }, { "epoch": 2.523561884950796, "grad_norm": 0.2568628489971161, "learning_rate": 1.586931816221877e-07, "loss": 0.6509, "step": 1973 }, { "epoch": 2.5248419873589887, "grad_norm": 0.6833187937736511, "learning_rate": 1.583866953689876e-07, "loss": 0.6503, "step": 1974 }, { "epoch": 2.5261220897671812, "grad_norm": 0.4279085695743561, "learning_rate": 1.580809558985975e-07, "loss": 0.649, "step": 1975 }, { "epoch": 2.5274021921753738, "grad_norm": 0.4677436053752899, "learning_rate": 1.5777596379404386e-07, "loss": 0.6225, "step": 1976 }, { "epoch": 2.5286822945835667, "grad_norm": 0.45068204402923584, "learning_rate": 1.5747171963692826e-07, "loss": 0.6621, "step": 1977 }, { "epoch": 2.5299623969917593, "grad_norm": 0.3752884268760681, "learning_rate": 1.5716822400742587e-07, "loss": 0.6682, "step": 1978 }, { "epoch": 2.5312424993999523, "grad_norm": 0.8851690888404846, "learning_rate": 1.568654774842843e-07, "loss": 0.6589, "step": 1979 }, { "epoch": 2.532522601808145, "grad_norm": 1.1126904487609863, "learning_rate": 1.5656348064482283e-07, "loss": 0.6584, "step": 1980 }, { "epoch": 2.532522601808145, "eval_loss": 0.020100239664316177, "eval_runtime": 42.1841, "eval_samples_per_second": 11.758, "eval_steps_per_second": 1.47, "step": 1980 }, { "epoch": 2.5338027042163374, "grad_norm": 0.31389060616493225, "learning_rate": 1.5626223406493127e-07, "loss": 0.6569, "step": 1981 }, { "epoch": 2.53508280662453, "grad_norm": 0.3966534733772278, "learning_rate": 1.559617383190684e-07, "loss": 0.6622, "step": 1982 }, { "epoch": 2.5363629090327224, "grad_norm": 0.6878266930580139, "learning_rate": 1.5566199398026147e-07, "loss": 0.6325, "step": 1983 }, { "epoch": 2.5376430114409154, "grad_norm": 0.5802293419837952, "learning_rate": 1.5536300162010455e-07, "loss": 0.6589, "step": 1984 }, { "epoch": 2.538923113849108, "grad_norm": 1.3978415727615356, "learning_rate": 1.5506476180875825e-07, "loss": 0.6356, "step": 1985 }, { "epoch": 2.5402032162573005, "grad_norm": 0.5816534757614136, "learning_rate": 1.547672751149475e-07, "loss": 0.6425, "step": 1986 }, { "epoch": 2.5414833186654935, "grad_norm": 0.43562421202659607, "learning_rate": 1.5447054210596166e-07, "loss": 0.6389, "step": 1987 }, { "epoch": 2.542763421073686, "grad_norm": 0.3010362684726715, "learning_rate": 1.5417456334765228e-07, "loss": 0.6161, "step": 1988 }, { "epoch": 2.5440435234818786, "grad_norm": 0.699810266494751, "learning_rate": 1.5387933940443302e-07, "loss": 0.6409, "step": 1989 }, { "epoch": 2.545323625890071, "grad_norm": 0.6081046462059021, "learning_rate": 1.5358487083927816e-07, "loss": 0.638, "step": 1990 }, { "epoch": 2.5466037282982636, "grad_norm": 1.1989212036132812, "learning_rate": 1.5329115821372114e-07, "loss": 0.6363, "step": 1991 }, { "epoch": 2.5478838307064566, "grad_norm": 0.26108258962631226, "learning_rate": 1.5299820208785425e-07, "loss": 0.6491, "step": 1992 }, { "epoch": 2.549163933114649, "grad_norm": 1.3608566522598267, "learning_rate": 1.527060030203271e-07, "loss": 0.6456, "step": 1993 }, { "epoch": 2.5504440355228417, "grad_norm": 0.5607214570045471, "learning_rate": 1.5241456156834542e-07, "loss": 0.633, "step": 1994 }, { "epoch": 2.5517241379310347, "grad_norm": 0.3214998245239258, "learning_rate": 1.521238782876705e-07, "loss": 0.6415, "step": 1995 }, { "epoch": 2.5530042403392272, "grad_norm": 1.757861614227295, "learning_rate": 1.5183395373261767e-07, "loss": 0.6462, "step": 1996 }, { "epoch": 2.55428434274742, "grad_norm": 0.28445497155189514, "learning_rate": 1.5154478845605559e-07, "loss": 0.6606, "step": 1997 }, { "epoch": 2.5555644451556123, "grad_norm": 0.34707996249198914, "learning_rate": 1.5125638300940474e-07, "loss": 0.6353, "step": 1998 }, { "epoch": 2.556844547563805, "grad_norm": 0.29214709997177124, "learning_rate": 1.5096873794263671e-07, "loss": 0.6659, "step": 1999 }, { "epoch": 2.558124649971998, "grad_norm": 0.6082428693771362, "learning_rate": 1.506818538042735e-07, "loss": 0.629, "step": 2000 }, { "epoch": 2.5594047523801904, "grad_norm": 0.31330883502960205, "learning_rate": 1.503957311413855e-07, "loss": 0.6626, "step": 2001 }, { "epoch": 2.560684854788383, "grad_norm": 0.8802220821380615, "learning_rate": 1.5011037049959147e-07, "loss": 0.6589, "step": 2002 }, { "epoch": 2.561964957196576, "grad_norm": 0.7895910739898682, "learning_rate": 1.4982577242305664e-07, "loss": 0.6457, "step": 2003 }, { "epoch": 2.5632450596047684, "grad_norm": 0.37694650888442993, "learning_rate": 1.495419374544923e-07, "loss": 0.6426, "step": 2004 }, { "epoch": 2.564525162012961, "grad_norm": 0.6797393560409546, "learning_rate": 1.492588661351547e-07, "loss": 0.6587, "step": 2005 }, { "epoch": 2.5658052644211535, "grad_norm": 0.8739597797393799, "learning_rate": 1.4897655900484343e-07, "loss": 0.6471, "step": 2006 }, { "epoch": 2.567085366829346, "grad_norm": 0.643576443195343, "learning_rate": 1.4869501660190116e-07, "loss": 0.6731, "step": 2007 }, { "epoch": 2.568365469237539, "grad_norm": 0.9068968892097473, "learning_rate": 1.4841423946321224e-07, "loss": 0.6579, "step": 2008 }, { "epoch": 2.5696455716457316, "grad_norm": 1.8010550737380981, "learning_rate": 1.4813422812420163e-07, "loss": 0.6415, "step": 2009 }, { "epoch": 2.5709256740539246, "grad_norm": 0.8079454302787781, "learning_rate": 1.4785498311883379e-07, "loss": 0.6232, "step": 2010 }, { "epoch": 2.5709256740539246, "eval_loss": 0.020073214545845985, "eval_runtime": 42.0804, "eval_samples_per_second": 11.787, "eval_steps_per_second": 1.473, "step": 2010 }, { "epoch": 2.572205776462117, "grad_norm": 0.3770584166049957, "learning_rate": 1.4757650497961216e-07, "loss": 0.6395, "step": 2011 }, { "epoch": 2.5734858788703097, "grad_norm": 0.4250401556491852, "learning_rate": 1.4729879423757765e-07, "loss": 0.658, "step": 2012 }, { "epoch": 2.574765981278502, "grad_norm": 0.32617440819740295, "learning_rate": 1.470218514223077e-07, "loss": 0.6586, "step": 2013 }, { "epoch": 2.5760460836866947, "grad_norm": 0.845801830291748, "learning_rate": 1.4674567706191562e-07, "loss": 0.6599, "step": 2014 }, { "epoch": 2.5773261860948877, "grad_norm": 1.5616546869277954, "learning_rate": 1.4647027168304884e-07, "loss": 0.6508, "step": 2015 }, { "epoch": 2.5786062885030803, "grad_norm": 0.2734609842300415, "learning_rate": 1.4619563581088912e-07, "loss": 0.6527, "step": 2016 }, { "epoch": 2.579886390911273, "grad_norm": 0.29470905661582947, "learning_rate": 1.4592176996915017e-07, "loss": 0.6474, "step": 2017 }, { "epoch": 2.581166493319466, "grad_norm": 0.697109580039978, "learning_rate": 1.456486746800775e-07, "loss": 0.6349, "step": 2018 }, { "epoch": 2.5824465957276583, "grad_norm": 0.9615988731384277, "learning_rate": 1.4537635046444732e-07, "loss": 0.6394, "step": 2019 }, { "epoch": 2.583726698135851, "grad_norm": 0.3116724193096161, "learning_rate": 1.4510479784156536e-07, "loss": 0.6373, "step": 2020 }, { "epoch": 2.5850068005440434, "grad_norm": 0.7228888869285583, "learning_rate": 1.448340173292661e-07, "loss": 0.654, "step": 2021 }, { "epoch": 2.586286902952236, "grad_norm": 0.26621726155281067, "learning_rate": 1.4456400944391144e-07, "loss": 0.6639, "step": 2022 }, { "epoch": 2.587567005360429, "grad_norm": 0.6949889063835144, "learning_rate": 1.4429477470039e-07, "loss": 0.6215, "step": 2023 }, { "epoch": 2.5888471077686215, "grad_norm": 0.6114367842674255, "learning_rate": 1.440263136121163e-07, "loss": 0.6645, "step": 2024 }, { "epoch": 2.590127210176814, "grad_norm": 0.2784302234649658, "learning_rate": 1.4375862669102902e-07, "loss": 0.6497, "step": 2025 }, { "epoch": 2.591407312585007, "grad_norm": 0.5807334184646606, "learning_rate": 1.4349171444759116e-07, "loss": 0.6612, "step": 2026 }, { "epoch": 2.5926874149931995, "grad_norm": 0.28845226764678955, "learning_rate": 1.432255773907881e-07, "loss": 0.6408, "step": 2027 }, { "epoch": 2.593967517401392, "grad_norm": 1.5370500087738037, "learning_rate": 1.42960216028127e-07, "loss": 0.6622, "step": 2028 }, { "epoch": 2.5952476198095846, "grad_norm": 0.7225543260574341, "learning_rate": 1.4269563086563597e-07, "loss": 0.6421, "step": 2029 }, { "epoch": 2.596527722217777, "grad_norm": 0.7571536302566528, "learning_rate": 1.4243182240786262e-07, "loss": 0.6372, "step": 2030 }, { "epoch": 2.59780782462597, "grad_norm": 0.3931668996810913, "learning_rate": 1.4216879115787401e-07, "loss": 0.629, "step": 2031 }, { "epoch": 2.5990879270341627, "grad_norm": 0.6966521143913269, "learning_rate": 1.4190653761725458e-07, "loss": 0.6561, "step": 2032 }, { "epoch": 2.6003680294423552, "grad_norm": 0.7810983657836914, "learning_rate": 1.4164506228610595e-07, "loss": 0.6524, "step": 2033 }, { "epoch": 2.601648131850548, "grad_norm": 0.40300697088241577, "learning_rate": 1.4138436566304574e-07, "loss": 0.6531, "step": 2034 }, { "epoch": 2.6029282342587408, "grad_norm": 0.6950014233589172, "learning_rate": 1.4112444824520648e-07, "loss": 0.6425, "step": 2035 }, { "epoch": 2.6042083366669333, "grad_norm": 1.385738492012024, "learning_rate": 1.4086531052823515e-07, "loss": 0.6432, "step": 2036 }, { "epoch": 2.605488439075126, "grad_norm": 0.2667698264122009, "learning_rate": 1.4060695300629141e-07, "loss": 0.6361, "step": 2037 }, { "epoch": 2.606768541483319, "grad_norm": 1.029186487197876, "learning_rate": 1.4034937617204745e-07, "loss": 0.6563, "step": 2038 }, { "epoch": 2.6080486438915114, "grad_norm": 0.9542225003242493, "learning_rate": 1.4009258051668678e-07, "loss": 0.6434, "step": 2039 }, { "epoch": 2.609328746299704, "grad_norm": 0.8851271867752075, "learning_rate": 1.3983656652990296e-07, "loss": 0.6306, "step": 2040 }, { "epoch": 2.609328746299704, "eval_loss": 0.020110566169023514, "eval_runtime": 42.1071, "eval_samples_per_second": 11.779, "eval_steps_per_second": 1.472, "step": 2040 }, { "epoch": 2.610608848707897, "grad_norm": 1.1771515607833862, "learning_rate": 1.3958133469989923e-07, "loss": 0.6485, "step": 2041 }, { "epoch": 2.6118889511160894, "grad_norm": 0.6489231586456299, "learning_rate": 1.3932688551338717e-07, "loss": 0.6426, "step": 2042 }, { "epoch": 2.613169053524282, "grad_norm": 0.4497769773006439, "learning_rate": 1.3907321945558598e-07, "loss": 0.6486, "step": 2043 }, { "epoch": 2.6144491559324745, "grad_norm": 1.1315453052520752, "learning_rate": 1.3882033701022138e-07, "loss": 0.6535, "step": 2044 }, { "epoch": 2.615729258340667, "grad_norm": 0.2650417387485504, "learning_rate": 1.385682386595249e-07, "loss": 0.65, "step": 2045 }, { "epoch": 2.61700936074886, "grad_norm": 0.5155853033065796, "learning_rate": 1.3831692488423283e-07, "loss": 0.6284, "step": 2046 }, { "epoch": 2.6182894631570526, "grad_norm": 0.3587488532066345, "learning_rate": 1.3806639616358516e-07, "loss": 0.644, "step": 2047 }, { "epoch": 2.619569565565245, "grad_norm": 0.9130818843841553, "learning_rate": 1.378166529753251e-07, "loss": 0.6749, "step": 2048 }, { "epoch": 2.620849667973438, "grad_norm": 1.1361536979675293, "learning_rate": 1.3756769579569757e-07, "loss": 0.6607, "step": 2049 }, { "epoch": 2.6221297703816306, "grad_norm": 0.34557247161865234, "learning_rate": 1.3731952509944912e-07, "loss": 0.6224, "step": 2050 }, { "epoch": 2.623409872789823, "grad_norm": 0.8922829627990723, "learning_rate": 1.3707214135982596e-07, "loss": 0.6424, "step": 2051 }, { "epoch": 2.6246899751980157, "grad_norm": 1.022491693496704, "learning_rate": 1.3682554504857385e-07, "loss": 0.65, "step": 2052 }, { "epoch": 2.6259700776062083, "grad_norm": 1.3524134159088135, "learning_rate": 1.3657973663593708e-07, "loss": 0.6689, "step": 2053 }, { "epoch": 2.6272501800144012, "grad_norm": 0.38051751255989075, "learning_rate": 1.3633471659065737e-07, "loss": 0.6335, "step": 2054 }, { "epoch": 2.628530282422594, "grad_norm": 0.8873854279518127, "learning_rate": 1.360904853799732e-07, "loss": 0.6239, "step": 2055 }, { "epoch": 2.6298103848307863, "grad_norm": 0.813712477684021, "learning_rate": 1.3584704346961845e-07, "loss": 0.6341, "step": 2056 }, { "epoch": 2.6310904872389793, "grad_norm": 0.6309866905212402, "learning_rate": 1.3560439132382217e-07, "loss": 0.6192, "step": 2057 }, { "epoch": 2.632370589647172, "grad_norm": 1.087878704071045, "learning_rate": 1.3536252940530733e-07, "loss": 0.6348, "step": 2058 }, { "epoch": 2.6336506920553644, "grad_norm": 0.3924737572669983, "learning_rate": 1.351214581752899e-07, "loss": 0.6529, "step": 2059 }, { "epoch": 2.634930794463557, "grad_norm": 0.35310786962509155, "learning_rate": 1.3488117809347796e-07, "loss": 0.6602, "step": 2060 }, { "epoch": 2.6362108968717495, "grad_norm": 0.4035593867301941, "learning_rate": 1.346416896180712e-07, "loss": 0.655, "step": 2061 }, { "epoch": 2.6374909992799425, "grad_norm": 1.4132459163665771, "learning_rate": 1.3440299320575965e-07, "loss": 0.6629, "step": 2062 }, { "epoch": 2.638771101688135, "grad_norm": 1.1046189069747925, "learning_rate": 1.3416508931172283e-07, "loss": 0.6439, "step": 2063 }, { "epoch": 2.6400512040963275, "grad_norm": 0.7213155031204224, "learning_rate": 1.339279783896288e-07, "loss": 0.6512, "step": 2064 }, { "epoch": 2.6413313065045205, "grad_norm": 0.8375394344329834, "learning_rate": 1.3369166089163406e-07, "loss": 0.6455, "step": 2065 }, { "epoch": 2.642611408912713, "grad_norm": 0.4188143014907837, "learning_rate": 1.3345613726838156e-07, "loss": 0.6387, "step": 2066 }, { "epoch": 2.6438915113209056, "grad_norm": 1.2632055282592773, "learning_rate": 1.3322140796900063e-07, "loss": 0.6485, "step": 2067 }, { "epoch": 2.645171613729098, "grad_norm": 0.5636139512062073, "learning_rate": 1.329874734411057e-07, "loss": 0.6625, "step": 2068 }, { "epoch": 2.646451716137291, "grad_norm": 0.5707480907440186, "learning_rate": 1.3275433413079572e-07, "loss": 0.6407, "step": 2069 }, { "epoch": 2.6477318185454837, "grad_norm": 0.6409482955932617, "learning_rate": 1.3252199048265337e-07, "loss": 0.6486, "step": 2070 }, { "epoch": 2.6477318185454837, "eval_loss": 0.02007230557501316, "eval_runtime": 42.1234, "eval_samples_per_second": 11.775, "eval_steps_per_second": 1.472, "step": 2070 }, { "epoch": 2.649011920953676, "grad_norm": 0.36744558811187744, "learning_rate": 1.3229044293974374e-07, "loss": 0.6546, "step": 2071 }, { "epoch": 2.650292023361869, "grad_norm": 0.5668392181396484, "learning_rate": 1.3205969194361394e-07, "loss": 0.6388, "step": 2072 }, { "epoch": 2.6515721257700617, "grad_norm": 1.3150979280471802, "learning_rate": 1.318297379342922e-07, "loss": 0.6559, "step": 2073 }, { "epoch": 2.6528522281782543, "grad_norm": 1.2430988550186157, "learning_rate": 1.316005813502869e-07, "loss": 0.6478, "step": 2074 }, { "epoch": 2.654132330586447, "grad_norm": 0.32038238644599915, "learning_rate": 1.3137222262858562e-07, "loss": 0.6593, "step": 2075 }, { "epoch": 2.6554124329946394, "grad_norm": 0.48588600754737854, "learning_rate": 1.3114466220465456e-07, "loss": 0.648, "step": 2076 }, { "epoch": 2.6566925354028323, "grad_norm": 0.9980317950248718, "learning_rate": 1.3091790051243788e-07, "loss": 0.6553, "step": 2077 }, { "epoch": 2.657972637811025, "grad_norm": 0.7658243179321289, "learning_rate": 1.3069193798435607e-07, "loss": 0.6426, "step": 2078 }, { "epoch": 2.6592527402192174, "grad_norm": 0.39222031831741333, "learning_rate": 1.3046677505130606e-07, "loss": 0.6499, "step": 2079 }, { "epoch": 2.6605328426274104, "grad_norm": 0.9409124851226807, "learning_rate": 1.3024241214266006e-07, "loss": 0.6613, "step": 2080 }, { "epoch": 2.661812945035603, "grad_norm": 0.31442388892173767, "learning_rate": 1.3001884968626438e-07, "loss": 0.6574, "step": 2081 }, { "epoch": 2.6630930474437955, "grad_norm": 0.37446996569633484, "learning_rate": 1.297960881084391e-07, "loss": 0.6572, "step": 2082 }, { "epoch": 2.664373149851988, "grad_norm": 1.1007232666015625, "learning_rate": 1.2957412783397686e-07, "loss": 0.6536, "step": 2083 }, { "epoch": 2.6656532522601806, "grad_norm": 0.287696897983551, "learning_rate": 1.2935296928614276e-07, "loss": 0.6333, "step": 2084 }, { "epoch": 2.6669333546683736, "grad_norm": 0.9584454298019409, "learning_rate": 1.291326128866724e-07, "loss": 0.6513, "step": 2085 }, { "epoch": 2.668213457076566, "grad_norm": 0.2974662184715271, "learning_rate": 1.2891305905577237e-07, "loss": 0.6584, "step": 2086 }, { "epoch": 2.6694935594847586, "grad_norm": 1.1847333908081055, "learning_rate": 1.2869430821211826e-07, "loss": 0.6439, "step": 2087 }, { "epoch": 2.6707736618929516, "grad_norm": 0.38718274235725403, "learning_rate": 1.2847636077285478e-07, "loss": 0.6365, "step": 2088 }, { "epoch": 2.672053764301144, "grad_norm": 0.3305584490299225, "learning_rate": 1.2825921715359447e-07, "loss": 0.6555, "step": 2089 }, { "epoch": 2.6733338667093367, "grad_norm": 0.997892439365387, "learning_rate": 1.2804287776841697e-07, "loss": 0.6517, "step": 2090 }, { "epoch": 2.6746139691175292, "grad_norm": 0.6771605610847473, "learning_rate": 1.2782734302986842e-07, "loss": 0.6497, "step": 2091 }, { "epoch": 2.675894071525722, "grad_norm": 0.3155212998390198, "learning_rate": 1.2761261334896044e-07, "loss": 0.653, "step": 2092 }, { "epoch": 2.6771741739339148, "grad_norm": 1.4205725193023682, "learning_rate": 1.2739868913516957e-07, "loss": 0.643, "step": 2093 }, { "epoch": 2.6784542763421073, "grad_norm": 0.5671343803405762, "learning_rate": 1.2718557079643622e-07, "loss": 0.6334, "step": 2094 }, { "epoch": 2.6797343787503003, "grad_norm": 0.37014326453208923, "learning_rate": 1.2697325873916414e-07, "loss": 0.6425, "step": 2095 }, { "epoch": 2.681014481158493, "grad_norm": 0.2635645866394043, "learning_rate": 1.267617533682197e-07, "loss": 0.6311, "step": 2096 }, { "epoch": 2.6822945835666854, "grad_norm": 0.26906466484069824, "learning_rate": 1.2655105508693064e-07, "loss": 0.6438, "step": 2097 }, { "epoch": 2.683574685974878, "grad_norm": 0.28571176528930664, "learning_rate": 1.2634116429708573e-07, "loss": 0.6415, "step": 2098 }, { "epoch": 2.6848547883830705, "grad_norm": 1.2504156827926636, "learning_rate": 1.2613208139893426e-07, "loss": 0.6339, "step": 2099 }, { "epoch": 2.6861348907912634, "grad_norm": 0.34544482827186584, "learning_rate": 1.2592380679118435e-07, "loss": 0.6687, "step": 2100 }, { "epoch": 2.6861348907912634, "eval_loss": 0.020092330873012543, "eval_runtime": 42.1497, "eval_samples_per_second": 11.768, "eval_steps_per_second": 1.471, "step": 2100 }, { "epoch": 2.687414993199456, "grad_norm": 0.4327585697174072, "learning_rate": 1.2571634087100321e-07, "loss": 0.6427, "step": 2101 }, { "epoch": 2.6886950956076485, "grad_norm": 0.4953400194644928, "learning_rate": 1.2550968403401558e-07, "loss": 0.6646, "step": 2102 }, { "epoch": 2.6899751980158415, "grad_norm": 0.4877380430698395, "learning_rate": 1.2530383667430375e-07, "loss": 0.6541, "step": 2103 }, { "epoch": 2.691255300424034, "grad_norm": 0.4688189625740051, "learning_rate": 1.25098799184406e-07, "loss": 0.6586, "step": 2104 }, { "epoch": 2.6925354028322266, "grad_norm": 0.5246747136116028, "learning_rate": 1.2489457195531633e-07, "loss": 0.652, "step": 2105 }, { "epoch": 2.693815505240419, "grad_norm": 0.34565263986587524, "learning_rate": 1.2469115537648377e-07, "loss": 0.6326, "step": 2106 }, { "epoch": 2.6950956076486117, "grad_norm": 0.2795601487159729, "learning_rate": 1.2448854983581132e-07, "loss": 0.6417, "step": 2107 }, { "epoch": 2.6963757100568047, "grad_norm": 0.48766008019447327, "learning_rate": 1.2428675571965562e-07, "loss": 0.6258, "step": 2108 }, { "epoch": 2.697655812464997, "grad_norm": 0.29841724038124084, "learning_rate": 1.240857734128256e-07, "loss": 0.6526, "step": 2109 }, { "epoch": 2.6989359148731897, "grad_norm": 0.4421617388725281, "learning_rate": 1.238856032985824e-07, "loss": 0.6495, "step": 2110 }, { "epoch": 2.7002160172813827, "grad_norm": 0.5446280837059021, "learning_rate": 1.236862457586384e-07, "loss": 0.6568, "step": 2111 }, { "epoch": 2.7014961196895753, "grad_norm": 0.37962427735328674, "learning_rate": 1.2348770117315614e-07, "loss": 0.6455, "step": 2112 }, { "epoch": 2.702776222097768, "grad_norm": 0.3219340443611145, "learning_rate": 1.2328996992074811e-07, "loss": 0.6486, "step": 2113 }, { "epoch": 2.7040563245059603, "grad_norm": 1.2223472595214844, "learning_rate": 1.2309305237847595e-07, "loss": 0.6584, "step": 2114 }, { "epoch": 2.705336426914153, "grad_norm": 0.28701382875442505, "learning_rate": 1.2289694892184945e-07, "loss": 0.6321, "step": 2115 }, { "epoch": 2.706616529322346, "grad_norm": 0.3444139361381531, "learning_rate": 1.2270165992482598e-07, "loss": 0.6331, "step": 2116 }, { "epoch": 2.7078966317305384, "grad_norm": 1.5178614854812622, "learning_rate": 1.2250718575980963e-07, "loss": 0.6279, "step": 2117 }, { "epoch": 2.709176734138731, "grad_norm": 0.3234931528568268, "learning_rate": 1.2231352679765105e-07, "loss": 0.677, "step": 2118 }, { "epoch": 2.710456836546924, "grad_norm": 0.28122273087501526, "learning_rate": 1.2212068340764607e-07, "loss": 0.6314, "step": 2119 }, { "epoch": 2.7117369389551165, "grad_norm": 0.30400002002716064, "learning_rate": 1.2192865595753536e-07, "loss": 0.6458, "step": 2120 }, { "epoch": 2.713017041363309, "grad_norm": 0.2736770510673523, "learning_rate": 1.217374448135035e-07, "loss": 0.6349, "step": 2121 }, { "epoch": 2.7142971437715016, "grad_norm": 0.9443513751029968, "learning_rate": 1.2154705034017864e-07, "loss": 0.6313, "step": 2122 }, { "epoch": 2.7155772461796945, "grad_norm": 0.38654351234436035, "learning_rate": 1.2135747290063154e-07, "loss": 0.6596, "step": 2123 }, { "epoch": 2.716857348587887, "grad_norm": 1.1964975595474243, "learning_rate": 1.2116871285637472e-07, "loss": 0.6518, "step": 2124 }, { "epoch": 2.7181374509960796, "grad_norm": 1.687131404876709, "learning_rate": 1.2098077056736218e-07, "loss": 0.66, "step": 2125 }, { "epoch": 2.7194175534042726, "grad_norm": 0.4430772066116333, "learning_rate": 1.207936463919886e-07, "loss": 0.6545, "step": 2126 }, { "epoch": 2.720697655812465, "grad_norm": 0.7075240612030029, "learning_rate": 1.2060734068708825e-07, "loss": 0.6224, "step": 2127 }, { "epoch": 2.7219777582206577, "grad_norm": 0.5436376929283142, "learning_rate": 1.204218538079349e-07, "loss": 0.635, "step": 2128 }, { "epoch": 2.7232578606288502, "grad_norm": 0.45615154504776, "learning_rate": 1.202371861082407e-07, "loss": 0.6657, "step": 2129 }, { "epoch": 2.7245379630370428, "grad_norm": 1.546213150024414, "learning_rate": 1.2005333794015588e-07, "loss": 0.6434, "step": 2130 }, { "epoch": 2.7245379630370428, "eval_loss": 0.020118294283747673, "eval_runtime": 42.1126, "eval_samples_per_second": 11.778, "eval_steps_per_second": 1.472, "step": 2130 }, { "epoch": 2.7258180654452357, "grad_norm": 0.7086462378501892, "learning_rate": 1.198703096542676e-07, "loss": 0.6432, "step": 2131 }, { "epoch": 2.7270981678534283, "grad_norm": 0.9689601063728333, "learning_rate": 1.196881015995998e-07, "loss": 0.6536, "step": 2132 }, { "epoch": 2.728378270261621, "grad_norm": 0.31954434514045715, "learning_rate": 1.1950671412361208e-07, "loss": 0.6393, "step": 2133 }, { "epoch": 2.729658372669814, "grad_norm": 0.3902779519557953, "learning_rate": 1.1932614757219947e-07, "loss": 0.6556, "step": 2134 }, { "epoch": 2.7309384750780064, "grad_norm": 0.5591553449630737, "learning_rate": 1.1914640228969133e-07, "loss": 0.6462, "step": 2135 }, { "epoch": 2.732218577486199, "grad_norm": 0.5208947062492371, "learning_rate": 1.1896747861885107e-07, "loss": 0.6214, "step": 2136 }, { "epoch": 2.7334986798943914, "grad_norm": 0.5015496611595154, "learning_rate": 1.187893769008752e-07, "loss": 0.6423, "step": 2137 }, { "epoch": 2.734778782302584, "grad_norm": 0.5757572054862976, "learning_rate": 1.1861209747539304e-07, "loss": 0.6298, "step": 2138 }, { "epoch": 2.736058884710777, "grad_norm": 0.6351795792579651, "learning_rate": 1.1843564068046549e-07, "loss": 0.6456, "step": 2139 }, { "epoch": 2.7373389871189695, "grad_norm": 0.8434006571769714, "learning_rate": 1.1826000685258507e-07, "loss": 0.6337, "step": 2140 }, { "epoch": 2.738619089527162, "grad_norm": 0.6475664377212524, "learning_rate": 1.1808519632667484e-07, "loss": 0.6476, "step": 2141 }, { "epoch": 2.739899191935355, "grad_norm": 0.7432494759559631, "learning_rate": 1.1791120943608785e-07, "loss": 0.6276, "step": 2142 }, { "epoch": 2.7411792943435476, "grad_norm": 1.0871083736419678, "learning_rate": 1.1773804651260653e-07, "loss": 0.6625, "step": 2143 }, { "epoch": 2.74245939675174, "grad_norm": 0.757992684841156, "learning_rate": 1.1756570788644207e-07, "loss": 0.6348, "step": 2144 }, { "epoch": 2.7437394991599326, "grad_norm": 0.3062693774700165, "learning_rate": 1.1739419388623381e-07, "loss": 0.6413, "step": 2145 }, { "epoch": 2.745019601568125, "grad_norm": 0.9409393072128296, "learning_rate": 1.1722350483904849e-07, "loss": 0.6239, "step": 2146 }, { "epoch": 2.746299703976318, "grad_norm": 0.8624541163444519, "learning_rate": 1.1705364107037979e-07, "loss": 0.6187, "step": 2147 }, { "epoch": 2.7475798063845107, "grad_norm": 0.5095512866973877, "learning_rate": 1.1688460290414756e-07, "loss": 0.6427, "step": 2148 }, { "epoch": 2.7488599087927033, "grad_norm": 0.9675753712654114, "learning_rate": 1.1671639066269744e-07, "loss": 0.6738, "step": 2149 }, { "epoch": 2.7501400112008962, "grad_norm": 0.39443734288215637, "learning_rate": 1.165490046667999e-07, "loss": 0.6337, "step": 2150 }, { "epoch": 2.751420113609089, "grad_norm": 0.560065507888794, "learning_rate": 1.1638244523564986e-07, "loss": 0.6471, "step": 2151 }, { "epoch": 2.7527002160172813, "grad_norm": 0.2955935299396515, "learning_rate": 1.1621671268686605e-07, "loss": 0.6489, "step": 2152 }, { "epoch": 2.753980318425474, "grad_norm": 0.33874306082725525, "learning_rate": 1.1605180733649039e-07, "loss": 0.6302, "step": 2153 }, { "epoch": 2.755260420833667, "grad_norm": 0.7609798908233643, "learning_rate": 1.1588772949898742e-07, "loss": 0.6435, "step": 2154 }, { "epoch": 2.7565405232418594, "grad_norm": 0.3307383954524994, "learning_rate": 1.1572447948724361e-07, "loss": 0.6496, "step": 2155 }, { "epoch": 2.757820625650052, "grad_norm": 0.4271416664123535, "learning_rate": 1.1556205761256676e-07, "loss": 0.6498, "step": 2156 }, { "epoch": 2.759100728058245, "grad_norm": 0.6107046008110046, "learning_rate": 1.154004641846856e-07, "loss": 0.6548, "step": 2157 }, { "epoch": 2.7603808304664375, "grad_norm": 0.2714780867099762, "learning_rate": 1.1523969951174894e-07, "loss": 0.6572, "step": 2158 }, { "epoch": 2.76166093287463, "grad_norm": 0.7054845690727234, "learning_rate": 1.150797639003253e-07, "loss": 0.653, "step": 2159 }, { "epoch": 2.7629410352828225, "grad_norm": 0.2917812466621399, "learning_rate": 1.1492065765540216e-07, "loss": 0.654, "step": 2160 }, { "epoch": 2.7629410352828225, "eval_loss": 0.020075028762221336, "eval_runtime": 42.0874, "eval_samples_per_second": 11.785, "eval_steps_per_second": 1.473, "step": 2160 }, { "epoch": 2.764221137691015, "grad_norm": 0.5847063660621643, "learning_rate": 1.1476238108038554e-07, "loss": 0.6317, "step": 2161 }, { "epoch": 2.765501240099208, "grad_norm": 0.5979964137077332, "learning_rate": 1.1460493447709921e-07, "loss": 0.6442, "step": 2162 }, { "epoch": 2.7667813425074006, "grad_norm": 0.2768544554710388, "learning_rate": 1.1444831814578415e-07, "loss": 0.6493, "step": 2163 }, { "epoch": 2.768061444915593, "grad_norm": 0.625067949295044, "learning_rate": 1.1429253238509846e-07, "loss": 0.6508, "step": 2164 }, { "epoch": 2.769341547323786, "grad_norm": 0.40523001551628113, "learning_rate": 1.1413757749211602e-07, "loss": 0.6684, "step": 2165 }, { "epoch": 2.7706216497319787, "grad_norm": 0.33590465784072876, "learning_rate": 1.139834537623264e-07, "loss": 0.6386, "step": 2166 }, { "epoch": 2.771901752140171, "grad_norm": 0.2729111313819885, "learning_rate": 1.1383016148963414e-07, "loss": 0.6331, "step": 2167 }, { "epoch": 2.7731818545483637, "grad_norm": 0.5212605595588684, "learning_rate": 1.1367770096635839e-07, "loss": 0.65, "step": 2168 }, { "epoch": 2.7744619569565563, "grad_norm": 0.3095559775829315, "learning_rate": 1.1352607248323215e-07, "loss": 0.6618, "step": 2169 }, { "epoch": 2.7757420593647493, "grad_norm": 0.3293081820011139, "learning_rate": 1.1337527632940161e-07, "loss": 0.6569, "step": 2170 }, { "epoch": 2.777022161772942, "grad_norm": 0.48291870951652527, "learning_rate": 1.1322531279242598e-07, "loss": 0.6435, "step": 2171 }, { "epoch": 2.7783022641811344, "grad_norm": 0.5574477314949036, "learning_rate": 1.1307618215827659e-07, "loss": 0.6568, "step": 2172 }, { "epoch": 2.7795823665893273, "grad_norm": 0.6038992404937744, "learning_rate": 1.1292788471133654e-07, "loss": 0.6518, "step": 2173 }, { "epoch": 2.78086246899752, "grad_norm": 0.2844580113887787, "learning_rate": 1.1278042073440001e-07, "loss": 0.649, "step": 2174 }, { "epoch": 2.7821425714057124, "grad_norm": 0.31601741909980774, "learning_rate": 1.1263379050867195e-07, "loss": 0.6428, "step": 2175 }, { "epoch": 2.783422673813905, "grad_norm": 0.3326012194156647, "learning_rate": 1.1248799431376723e-07, "loss": 0.6337, "step": 2176 }, { "epoch": 2.7847027762220975, "grad_norm": 0.365177720785141, "learning_rate": 1.1234303242771029e-07, "loss": 0.6436, "step": 2177 }, { "epoch": 2.7859828786302905, "grad_norm": 0.4773918688297272, "learning_rate": 1.1219890512693478e-07, "loss": 0.6466, "step": 2178 }, { "epoch": 2.787262981038483, "grad_norm": 0.7270103693008423, "learning_rate": 1.120556126862827e-07, "loss": 0.6179, "step": 2179 }, { "epoch": 2.788543083446676, "grad_norm": 0.29453837871551514, "learning_rate": 1.1191315537900392e-07, "loss": 0.6331, "step": 2180 }, { "epoch": 2.7898231858548685, "grad_norm": 0.46061971783638, "learning_rate": 1.1177153347675606e-07, "loss": 0.6409, "step": 2181 }, { "epoch": 2.791103288263061, "grad_norm": 0.6121891736984253, "learning_rate": 1.1163074724960326e-07, "loss": 0.6381, "step": 2182 }, { "epoch": 2.7923833906712536, "grad_norm": 0.3224369287490845, "learning_rate": 1.1149079696601652e-07, "loss": 0.6476, "step": 2183 }, { "epoch": 2.793663493079446, "grad_norm": 0.7230015993118286, "learning_rate": 1.1135168289287241e-07, "loss": 0.6481, "step": 2184 }, { "epoch": 2.794943595487639, "grad_norm": 0.34099048376083374, "learning_rate": 1.1121340529545317e-07, "loss": 0.6152, "step": 2185 }, { "epoch": 2.7962236978958317, "grad_norm": 1.5147699117660522, "learning_rate": 1.1107596443744568e-07, "loss": 0.6531, "step": 2186 }, { "epoch": 2.7975038003040242, "grad_norm": 0.2872607409954071, "learning_rate": 1.1093936058094127e-07, "loss": 0.653, "step": 2187 }, { "epoch": 2.798783902712217, "grad_norm": 0.5864285826683044, "learning_rate": 1.1080359398643536e-07, "loss": 0.6341, "step": 2188 }, { "epoch": 2.8000640051204098, "grad_norm": 0.42131397128105164, "learning_rate": 1.1066866491282649e-07, "loss": 0.6095, "step": 2189 }, { "epoch": 2.8013441075286023, "grad_norm": 0.2504804730415344, "learning_rate": 1.1053457361741624e-07, "loss": 0.6481, "step": 2190 }, { "epoch": 2.8013441075286023, "eval_loss": 0.02010684460401535, "eval_runtime": 42.1314, "eval_samples_per_second": 11.773, "eval_steps_per_second": 1.472, "step": 2190 }, { "epoch": 2.802624209936795, "grad_norm": 0.3099571168422699, "learning_rate": 1.104013203559086e-07, "loss": 0.6536, "step": 2191 }, { "epoch": 2.8039043123449874, "grad_norm": 0.7082545161247253, "learning_rate": 1.1026890538240936e-07, "loss": 0.6151, "step": 2192 }, { "epoch": 2.8051844147531804, "grad_norm": 1.1165101528167725, "learning_rate": 1.1013732894942596e-07, "loss": 0.6421, "step": 2193 }, { "epoch": 2.806464517161373, "grad_norm": 0.2601620554924011, "learning_rate": 1.1000659130786663e-07, "loss": 0.6553, "step": 2194 }, { "epoch": 2.8077446195695654, "grad_norm": 0.8848174214363098, "learning_rate": 1.0987669270704018e-07, "loss": 0.6582, "step": 2195 }, { "epoch": 2.8090247219777584, "grad_norm": 0.5151593685150146, "learning_rate": 1.0974763339465529e-07, "loss": 0.652, "step": 2196 }, { "epoch": 2.810304824385951, "grad_norm": 0.2939353585243225, "learning_rate": 1.0961941361682011e-07, "loss": 0.6342, "step": 2197 }, { "epoch": 2.8115849267941435, "grad_norm": 1.5515726804733276, "learning_rate": 1.0949203361804223e-07, "loss": 0.6708, "step": 2198 }, { "epoch": 2.812865029202336, "grad_norm": 1.2032933235168457, "learning_rate": 1.0936549364122745e-07, "loss": 0.6557, "step": 2199 }, { "epoch": 2.8141451316105286, "grad_norm": 0.33010733127593994, "learning_rate": 1.0923979392767982e-07, "loss": 0.6734, "step": 2200 }, { "epoch": 2.8154252340187216, "grad_norm": 0.9063467979431152, "learning_rate": 1.0911493471710108e-07, "loss": 0.6448, "step": 2201 }, { "epoch": 2.816705336426914, "grad_norm": 1.4805728197097778, "learning_rate": 1.0899091624759019e-07, "loss": 0.6095, "step": 2202 }, { "epoch": 2.8179854388351067, "grad_norm": 1.0414221286773682, "learning_rate": 1.0886773875564284e-07, "loss": 0.6583, "step": 2203 }, { "epoch": 2.8192655412432996, "grad_norm": 0.3527986705303192, "learning_rate": 1.08745402476151e-07, "loss": 0.6344, "step": 2204 }, { "epoch": 2.820545643651492, "grad_norm": 0.8493846654891968, "learning_rate": 1.0862390764240257e-07, "loss": 0.6512, "step": 2205 }, { "epoch": 2.8218257460596847, "grad_norm": 0.9866908192634583, "learning_rate": 1.085032544860808e-07, "loss": 0.6576, "step": 2206 }, { "epoch": 2.8231058484678773, "grad_norm": 0.4657198190689087, "learning_rate": 1.0838344323726395e-07, "loss": 0.638, "step": 2207 }, { "epoch": 2.8243859508760703, "grad_norm": 1.1018624305725098, "learning_rate": 1.082644741244248e-07, "loss": 0.6349, "step": 2208 }, { "epoch": 2.825666053284263, "grad_norm": 0.4456295073032379, "learning_rate": 1.0814634737443024e-07, "loss": 0.6477, "step": 2209 }, { "epoch": 2.8269461556924553, "grad_norm": 0.8415900468826294, "learning_rate": 1.0802906321254085e-07, "loss": 0.6446, "step": 2210 }, { "epoch": 2.8282262581006483, "grad_norm": 1.4421777725219727, "learning_rate": 1.079126218624103e-07, "loss": 0.6701, "step": 2211 }, { "epoch": 2.829506360508841, "grad_norm": 0.5015147924423218, "learning_rate": 1.0779702354608525e-07, "loss": 0.6392, "step": 2212 }, { "epoch": 2.8307864629170334, "grad_norm": 1.0721427202224731, "learning_rate": 1.0768226848400465e-07, "loss": 0.6611, "step": 2213 }, { "epoch": 2.832066565325226, "grad_norm": 0.38133323192596436, "learning_rate": 1.0756835689499952e-07, "loss": 0.6486, "step": 2214 }, { "epoch": 2.8333466677334185, "grad_norm": 0.287044495344162, "learning_rate": 1.0745528899629228e-07, "loss": 0.6255, "step": 2215 }, { "epoch": 2.8346267701416115, "grad_norm": 0.8329699635505676, "learning_rate": 1.0734306500349653e-07, "loss": 0.6447, "step": 2216 }, { "epoch": 2.835906872549804, "grad_norm": 0.6404094696044922, "learning_rate": 1.0723168513061665e-07, "loss": 0.6379, "step": 2217 }, { "epoch": 2.8371869749579965, "grad_norm": 1.269181728363037, "learning_rate": 1.0712114959004729e-07, "loss": 0.6483, "step": 2218 }, { "epoch": 2.8384670773661895, "grad_norm": 1.1914838552474976, "learning_rate": 1.0701145859257309e-07, "loss": 0.6281, "step": 2219 }, { "epoch": 2.839747179774382, "grad_norm": 0.3412242829799652, "learning_rate": 1.0690261234736801e-07, "loss": 0.6291, "step": 2220 }, { "epoch": 2.839747179774382, "eval_loss": 0.02010653167963028, "eval_runtime": 42.1079, "eval_samples_per_second": 11.779, "eval_steps_per_second": 1.472, "step": 2220 }, { "epoch": 2.8410272821825746, "grad_norm": 0.6087857484817505, "learning_rate": 1.0679461106199524e-07, "loss": 0.6157, "step": 2221 }, { "epoch": 2.842307384590767, "grad_norm": 0.2712996006011963, "learning_rate": 1.0668745494240679e-07, "loss": 0.6626, "step": 2222 }, { "epoch": 2.8435874869989597, "grad_norm": 0.7269452810287476, "learning_rate": 1.0658114419294279e-07, "loss": 0.6433, "step": 2223 }, { "epoch": 2.8448675894071527, "grad_norm": 0.47443509101867676, "learning_rate": 1.0647567901633142e-07, "loss": 0.6392, "step": 2224 }, { "epoch": 2.846147691815345, "grad_norm": 0.8108417391777039, "learning_rate": 1.0637105961368836e-07, "loss": 0.6239, "step": 2225 }, { "epoch": 2.8474277942235378, "grad_norm": 0.5707200169563293, "learning_rate": 1.0626728618451647e-07, "loss": 0.6219, "step": 2226 }, { "epoch": 2.8487078966317307, "grad_norm": 0.7317054271697998, "learning_rate": 1.0616435892670531e-07, "loss": 0.6421, "step": 2227 }, { "epoch": 2.8499879990399233, "grad_norm": 0.8396162390708923, "learning_rate": 1.0606227803653105e-07, "loss": 0.6571, "step": 2228 }, { "epoch": 2.851268101448116, "grad_norm": 0.5900576114654541, "learning_rate": 1.0596104370865573e-07, "loss": 0.6692, "step": 2229 }, { "epoch": 2.8525482038563084, "grad_norm": 1.075056791305542, "learning_rate": 1.0586065613612695e-07, "loss": 0.6594, "step": 2230 }, { "epoch": 2.853828306264501, "grad_norm": 0.5356476902961731, "learning_rate": 1.0576111551037783e-07, "loss": 0.6276, "step": 2231 }, { "epoch": 2.855108408672694, "grad_norm": 0.7195831537246704, "learning_rate": 1.0566242202122628e-07, "loss": 0.65, "step": 2232 }, { "epoch": 2.8563885110808864, "grad_norm": 0.3165750503540039, "learning_rate": 1.0556457585687477e-07, "loss": 0.6199, "step": 2233 }, { "epoch": 2.857668613489079, "grad_norm": 0.38355469703674316, "learning_rate": 1.0546757720391002e-07, "loss": 0.6591, "step": 2234 }, { "epoch": 2.858948715897272, "grad_norm": 1.0184906721115112, "learning_rate": 1.0537142624730257e-07, "loss": 0.6486, "step": 2235 }, { "epoch": 2.8602288183054645, "grad_norm": 0.8666162490844727, "learning_rate": 1.0527612317040646e-07, "loss": 0.6475, "step": 2236 }, { "epoch": 2.861508920713657, "grad_norm": 0.41836732625961304, "learning_rate": 1.0518166815495888e-07, "loss": 0.6618, "step": 2237 }, { "epoch": 2.8627890231218496, "grad_norm": 0.2589111924171448, "learning_rate": 1.0508806138107978e-07, "loss": 0.6391, "step": 2238 }, { "epoch": 2.8640691255300426, "grad_norm": 1.23524010181427, "learning_rate": 1.0499530302727162e-07, "loss": 0.6584, "step": 2239 }, { "epoch": 2.865349227938235, "grad_norm": 0.8812917470932007, "learning_rate": 1.0490339327041903e-07, "loss": 0.6241, "step": 2240 }, { "epoch": 2.8666293303464276, "grad_norm": 0.2986970543861389, "learning_rate": 1.0481233228578823e-07, "loss": 0.6554, "step": 2241 }, { "epoch": 2.8679094327546206, "grad_norm": 1.0834957361221313, "learning_rate": 1.04722120247027e-07, "loss": 0.6274, "step": 2242 }, { "epoch": 2.869189535162813, "grad_norm": 0.41948211193084717, "learning_rate": 1.046327573261643e-07, "loss": 0.6498, "step": 2243 }, { "epoch": 2.8704696375710057, "grad_norm": 0.34662750363349915, "learning_rate": 1.0454424369360973e-07, "loss": 0.6444, "step": 2244 }, { "epoch": 2.8717497399791982, "grad_norm": 0.48483341932296753, "learning_rate": 1.0445657951815343e-07, "loss": 0.6433, "step": 2245 }, { "epoch": 2.873029842387391, "grad_norm": 1.1565371751785278, "learning_rate": 1.0436976496696571e-07, "loss": 0.6348, "step": 2246 }, { "epoch": 2.8743099447955838, "grad_norm": 1.0118498802185059, "learning_rate": 1.0428380020559657e-07, "loss": 0.6556, "step": 2247 }, { "epoch": 2.8755900472037763, "grad_norm": 1.3405448198318481, "learning_rate": 1.0419868539797565e-07, "loss": 0.6474, "step": 2248 }, { "epoch": 2.876870149611969, "grad_norm": 0.6180388331413269, "learning_rate": 1.0411442070641178e-07, "loss": 0.6396, "step": 2249 }, { "epoch": 2.878150252020162, "grad_norm": 0.261161208152771, "learning_rate": 1.0403100629159248e-07, "loss": 0.6425, "step": 2250 }, { "epoch": 2.878150252020162, "eval_loss": 0.02006879262626171, "eval_runtime": 42.1198, "eval_samples_per_second": 11.776, "eval_steps_per_second": 1.472, "step": 2250 }, { "epoch": 2.8794303544283544, "grad_norm": 0.3375232219696045, "learning_rate": 1.03948442312584e-07, "loss": 0.622, "step": 2251 }, { "epoch": 2.880710456836547, "grad_norm": 0.9228675961494446, "learning_rate": 1.0386672892683095e-07, "loss": 0.6401, "step": 2252 }, { "epoch": 2.8819905592447395, "grad_norm": 0.38941460847854614, "learning_rate": 1.0378586629015573e-07, "loss": 0.6376, "step": 2253 }, { "epoch": 2.883270661652932, "grad_norm": 0.8098536729812622, "learning_rate": 1.0370585455675845e-07, "loss": 0.6716, "step": 2254 }, { "epoch": 2.884550764061125, "grad_norm": 0.30574071407318115, "learning_rate": 1.0362669387921666e-07, "loss": 0.6562, "step": 2255 }, { "epoch": 2.8858308664693175, "grad_norm": 0.35651296377182007, "learning_rate": 1.0354838440848501e-07, "loss": 0.6405, "step": 2256 }, { "epoch": 2.88711096887751, "grad_norm": 0.3437579870223999, "learning_rate": 1.0347092629389483e-07, "loss": 0.6382, "step": 2257 }, { "epoch": 2.888391071285703, "grad_norm": 0.5851202011108398, "learning_rate": 1.0339431968315409e-07, "loss": 0.6553, "step": 2258 }, { "epoch": 2.8896711736938956, "grad_norm": 0.8172543048858643, "learning_rate": 1.0331856472234694e-07, "loss": 0.6499, "step": 2259 }, { "epoch": 2.890951276102088, "grad_norm": 0.7027254700660706, "learning_rate": 1.032436615559335e-07, "loss": 0.6402, "step": 2260 }, { "epoch": 2.8922313785102807, "grad_norm": 1.2736692428588867, "learning_rate": 1.0316961032674962e-07, "loss": 0.6371, "step": 2261 }, { "epoch": 2.893511480918473, "grad_norm": 0.32884854078292847, "learning_rate": 1.0309641117600635e-07, "loss": 0.6706, "step": 2262 }, { "epoch": 2.894791583326666, "grad_norm": 0.3352726101875305, "learning_rate": 1.0302406424329015e-07, "loss": 0.6549, "step": 2263 }, { "epoch": 2.8960716857348587, "grad_norm": 0.268131822347641, "learning_rate": 1.0295256966656222e-07, "loss": 0.6421, "step": 2264 }, { "epoch": 2.8973517881430517, "grad_norm": 0.3668014109134674, "learning_rate": 1.0288192758215837e-07, "loss": 0.6235, "step": 2265 }, { "epoch": 2.8986318905512443, "grad_norm": 1.1026606559753418, "learning_rate": 1.0281213812478874e-07, "loss": 0.6285, "step": 2266 }, { "epoch": 2.899911992959437, "grad_norm": 0.873980700969696, "learning_rate": 1.0274320142753759e-07, "loss": 0.6554, "step": 2267 }, { "epoch": 2.9011920953676293, "grad_norm": 0.46991366147994995, "learning_rate": 1.026751176218631e-07, "loss": 0.6276, "step": 2268 }, { "epoch": 2.902472197775822, "grad_norm": 1.3535581827163696, "learning_rate": 1.0260788683759685e-07, "loss": 0.6674, "step": 2269 }, { "epoch": 2.903752300184015, "grad_norm": 0.5768007636070251, "learning_rate": 1.0254150920294386e-07, "loss": 0.641, "step": 2270 }, { "epoch": 2.9050324025922074, "grad_norm": 0.5021919012069702, "learning_rate": 1.0247598484448239e-07, "loss": 0.6254, "step": 2271 }, { "epoch": 2.9063125050004, "grad_norm": 0.2904020845890045, "learning_rate": 1.0241131388716332e-07, "loss": 0.6506, "step": 2272 }, { "epoch": 2.907592607408593, "grad_norm": 0.2539806365966797, "learning_rate": 1.0234749645431021e-07, "loss": 0.633, "step": 2273 }, { "epoch": 2.9088727098167855, "grad_norm": 0.9190971851348877, "learning_rate": 1.0228453266761909e-07, "loss": 0.6383, "step": 2274 }, { "epoch": 2.910152812224978, "grad_norm": 0.661307692527771, "learning_rate": 1.0222242264715804e-07, "loss": 0.6389, "step": 2275 }, { "epoch": 2.9114329146331706, "grad_norm": 0.530551016330719, "learning_rate": 1.0216116651136716e-07, "loss": 0.658, "step": 2276 }, { "epoch": 2.912713017041363, "grad_norm": 0.32086044549942017, "learning_rate": 1.0210076437705812e-07, "loss": 0.6531, "step": 2277 }, { "epoch": 2.913993119449556, "grad_norm": 0.4508582651615143, "learning_rate": 1.0204121635941417e-07, "loss": 0.6273, "step": 2278 }, { "epoch": 2.9152732218577486, "grad_norm": 0.28816190361976624, "learning_rate": 1.0198252257198972e-07, "loss": 0.6499, "step": 2279 }, { "epoch": 2.916553324265941, "grad_norm": 0.7827352285385132, "learning_rate": 1.0192468312671037e-07, "loss": 0.6591, "step": 2280 }, { "epoch": 2.916553324265941, "eval_loss": 0.0201045423746109, "eval_runtime": 42.1529, "eval_samples_per_second": 11.767, "eval_steps_per_second": 1.471, "step": 2280 }, { "epoch": 2.917833426674134, "grad_norm": 0.2672688961029053, "learning_rate": 1.0186769813387225e-07, "loss": 0.6463, "step": 2281 }, { "epoch": 2.9191135290823267, "grad_norm": 0.439020574092865, "learning_rate": 1.0181156770214242e-07, "loss": 0.6474, "step": 2282 }, { "epoch": 2.9203936314905192, "grad_norm": 0.515463650226593, "learning_rate": 1.0175629193855824e-07, "loss": 0.6305, "step": 2283 }, { "epoch": 2.9216737338987118, "grad_norm": 0.2739676833152771, "learning_rate": 1.0170187094852709e-07, "loss": 0.6364, "step": 2284 }, { "epoch": 2.9229538363069043, "grad_norm": 1.2020562887191772, "learning_rate": 1.016483048358266e-07, "loss": 0.6339, "step": 2285 }, { "epoch": 2.9242339387150973, "grad_norm": 0.4133013188838959, "learning_rate": 1.0159559370260409e-07, "loss": 0.6365, "step": 2286 }, { "epoch": 2.92551404112329, "grad_norm": 0.912691593170166, "learning_rate": 1.0154373764937644e-07, "loss": 0.6346, "step": 2287 }, { "epoch": 2.9267941435314824, "grad_norm": 0.9713746309280396, "learning_rate": 1.0149273677503007e-07, "loss": 0.6637, "step": 2288 }, { "epoch": 2.9280742459396754, "grad_norm": 0.32678431272506714, "learning_rate": 1.014425911768205e-07, "loss": 0.6286, "step": 2289 }, { "epoch": 2.929354348347868, "grad_norm": 0.5092898607254028, "learning_rate": 1.0139330095037235e-07, "loss": 0.6623, "step": 2290 }, { "epoch": 2.9306344507560604, "grad_norm": 0.2719021141529083, "learning_rate": 1.0134486618967915e-07, "loss": 0.6389, "step": 2291 }, { "epoch": 2.931914553164253, "grad_norm": 0.9849359393119812, "learning_rate": 1.0129728698710294e-07, "loss": 0.6368, "step": 2292 }, { "epoch": 2.9331946555724455, "grad_norm": 0.9234448075294495, "learning_rate": 1.0125056343337446e-07, "loss": 0.6375, "step": 2293 }, { "epoch": 2.9344747579806385, "grad_norm": 0.9093217849731445, "learning_rate": 1.0120469561759268e-07, "loss": 0.64, "step": 2294 }, { "epoch": 2.935754860388831, "grad_norm": 1.1087493896484375, "learning_rate": 1.0115968362722468e-07, "loss": 0.6638, "step": 2295 }, { "epoch": 2.937034962797024, "grad_norm": 0.6836243867874146, "learning_rate": 1.0111552754810566e-07, "loss": 0.6499, "step": 2296 }, { "epoch": 2.9383150652052166, "grad_norm": 0.3947342038154602, "learning_rate": 1.010722274644386e-07, "loss": 0.6378, "step": 2297 }, { "epoch": 2.939595167613409, "grad_norm": 0.27283111214637756, "learning_rate": 1.0102978345879404e-07, "loss": 0.6553, "step": 2298 }, { "epoch": 2.9408752700216017, "grad_norm": 0.5560145378112793, "learning_rate": 1.0098819561211024e-07, "loss": 0.6317, "step": 2299 }, { "epoch": 2.942155372429794, "grad_norm": 0.5116812586784363, "learning_rate": 1.0094746400369259e-07, "loss": 0.6507, "step": 2300 }, { "epoch": 2.943435474837987, "grad_norm": 0.7335453629493713, "learning_rate": 1.0090758871121388e-07, "loss": 0.6246, "step": 2301 }, { "epoch": 2.9447155772461797, "grad_norm": 0.5693823099136353, "learning_rate": 1.008685698107138e-07, "loss": 0.6618, "step": 2302 }, { "epoch": 2.9459956796543723, "grad_norm": 0.4048636257648468, "learning_rate": 1.008304073765991e-07, "loss": 0.6341, "step": 2303 }, { "epoch": 2.9472757820625652, "grad_norm": 0.8174906969070435, "learning_rate": 1.0079310148164313e-07, "loss": 0.6685, "step": 2304 }, { "epoch": 2.948555884470758, "grad_norm": 0.31603822112083435, "learning_rate": 1.0075665219698608e-07, "loss": 0.6268, "step": 2305 }, { "epoch": 2.9498359868789503, "grad_norm": 0.3102402687072754, "learning_rate": 1.0072105959213451e-07, "loss": 0.6447, "step": 2306 }, { "epoch": 2.951116089287143, "grad_norm": 0.3637251853942871, "learning_rate": 1.0068632373496124e-07, "loss": 0.653, "step": 2307 }, { "epoch": 2.9523961916953354, "grad_norm": 0.40536120533943176, "learning_rate": 1.0065244469170558e-07, "loss": 0.6648, "step": 2308 }, { "epoch": 2.9536762941035284, "grad_norm": 0.8023518323898315, "learning_rate": 1.0061942252697273e-07, "loss": 0.6171, "step": 2309 }, { "epoch": 2.954956396511721, "grad_norm": 0.4299080967903137, "learning_rate": 1.0058725730373396e-07, "loss": 0.6426, "step": 2310 }, { "epoch": 2.954956396511721, "eval_loss": 0.020083000883460045, "eval_runtime": 42.1151, "eval_samples_per_second": 11.777, "eval_steps_per_second": 1.472, "step": 2310 }, { "epoch": 2.9562364989199135, "grad_norm": 0.5772362351417542, "learning_rate": 1.0055594908332647e-07, "loss": 0.636, "step": 2311 }, { "epoch": 2.9575166013281065, "grad_norm": 0.3647783696651459, "learning_rate": 1.00525497925453e-07, "loss": 0.649, "step": 2312 }, { "epoch": 2.958796703736299, "grad_norm": 0.27724897861480713, "learning_rate": 1.0049590388818224e-07, "loss": 0.6384, "step": 2313 }, { "epoch": 2.9600768061444915, "grad_norm": 0.5586848258972168, "learning_rate": 1.0046716702794808e-07, "loss": 0.6588, "step": 2314 }, { "epoch": 2.961356908552684, "grad_norm": 0.46139171719551086, "learning_rate": 1.0043928739954999e-07, "loss": 0.6595, "step": 2315 }, { "epoch": 2.9626370109608766, "grad_norm": 0.3093836009502411, "learning_rate": 1.0041226505615277e-07, "loss": 0.6579, "step": 2316 }, { "epoch": 2.9639171133690696, "grad_norm": 0.2686119079589844, "learning_rate": 1.0038610004928639e-07, "loss": 0.6305, "step": 2317 }, { "epoch": 2.965197215777262, "grad_norm": 0.39112165570259094, "learning_rate": 1.0036079242884591e-07, "loss": 0.6405, "step": 2318 }, { "epoch": 2.9664773181854547, "grad_norm": 0.26842445135116577, "learning_rate": 1.0033634224309143e-07, "loss": 0.6459, "step": 2319 }, { "epoch": 2.9677574205936477, "grad_norm": 0.6161180138587952, "learning_rate": 1.0031274953864799e-07, "loss": 0.6436, "step": 2320 }, { "epoch": 2.96903752300184, "grad_norm": 0.7368577718734741, "learning_rate": 1.0029001436050538e-07, "loss": 0.6354, "step": 2321 }, { "epoch": 2.9703176254100327, "grad_norm": 0.32090792059898376, "learning_rate": 1.0026813675201831e-07, "loss": 0.6474, "step": 2322 }, { "epoch": 2.9715977278182253, "grad_norm": 1.411336898803711, "learning_rate": 1.0024711675490596e-07, "loss": 0.6707, "step": 2323 }, { "epoch": 2.9728778302264183, "grad_norm": 1.18115234375, "learning_rate": 1.0022695440925222e-07, "loss": 0.6497, "step": 2324 }, { "epoch": 2.974157932634611, "grad_norm": 0.9594967365264893, "learning_rate": 1.0020764975350545e-07, "loss": 0.6556, "step": 2325 }, { "epoch": 2.9754380350428034, "grad_norm": 0.35163840651512146, "learning_rate": 1.001892028244785e-07, "loss": 0.6418, "step": 2326 }, { "epoch": 2.9767181374509963, "grad_norm": 0.3306455612182617, "learning_rate": 1.0017161365734851e-07, "loss": 0.6332, "step": 2327 }, { "epoch": 2.977998239859189, "grad_norm": 0.7934905290603638, "learning_rate": 1.00154882285657e-07, "loss": 0.6148, "step": 2328 }, { "epoch": 2.9792783422673814, "grad_norm": 0.6301752328872681, "learning_rate": 1.001390087413096e-07, "loss": 0.6455, "step": 2329 }, { "epoch": 2.980558444675574, "grad_norm": 0.2567738890647888, "learning_rate": 1.0012399305457622e-07, "loss": 0.6224, "step": 2330 }, { "epoch": 2.9818385470837665, "grad_norm": 0.5269167423248291, "learning_rate": 1.0010983525409086e-07, "loss": 0.6434, "step": 2331 }, { "epoch": 2.9831186494919595, "grad_norm": 0.3913140296936035, "learning_rate": 1.0009653536685168e-07, "loss": 0.6425, "step": 2332 }, { "epoch": 2.984398751900152, "grad_norm": 0.46846702694892883, "learning_rate": 1.000840934182206e-07, "loss": 0.6526, "step": 2333 }, { "epoch": 2.9856788543083446, "grad_norm": 0.3315781354904175, "learning_rate": 1.0007250943192381e-07, "loss": 0.662, "step": 2334 }, { "epoch": 2.9869589567165375, "grad_norm": 1.0006517171859741, "learning_rate": 1.0006178343005118e-07, "loss": 0.638, "step": 2335 }, { "epoch": 2.98823905912473, "grad_norm": 0.27513471245765686, "learning_rate": 1.0005191543305659e-07, "loss": 0.6604, "step": 2336 }, { "epoch": 2.9895191615329226, "grad_norm": 0.2785768210887909, "learning_rate": 1.0004290545975764e-07, "loss": 0.6237, "step": 2337 }, { "epoch": 2.990799263941115, "grad_norm": 0.2952953577041626, "learning_rate": 1.000347535273359e-07, "loss": 0.6508, "step": 2338 }, { "epoch": 2.9920793663493077, "grad_norm": 0.3556389808654785, "learning_rate": 1.0002745965133658e-07, "loss": 0.624, "step": 2339 }, { "epoch": 2.9933594687575007, "grad_norm": 1.2344200611114502, "learning_rate": 1.0002102384566857e-07, "loss": 0.6274, "step": 2340 }, { "epoch": 2.9933594687575007, "eval_loss": 0.020086178556084633, "eval_runtime": 42.1347, "eval_samples_per_second": 11.772, "eval_steps_per_second": 1.471, "step": 2340 }, { "epoch": 2.9946395711656932, "grad_norm": 0.3444899916648865, "learning_rate": 1.0001544612260471e-07, "loss": 0.6496, "step": 2341 }, { "epoch": 2.9959196735738858, "grad_norm": 0.26558321714401245, "learning_rate": 1.0001072649278125e-07, "loss": 0.6326, "step": 2342 }, { "epoch": 2.9971997759820788, "grad_norm": 0.2798824906349182, "learning_rate": 1.000068649651983e-07, "loss": 0.6276, "step": 2343 }, { "epoch": 2.9984798783902713, "grad_norm": 0.3596898317337036, "learning_rate": 1.0000386154721955e-07, "loss": 0.6416, "step": 2344 }, { "epoch": 2.999759980798464, "grad_norm": 0.3293759822845459, "learning_rate": 1.0000171624457236e-07, "loss": 0.6371, "step": 2345 }, { "epoch": 3.0, "grad_norm": 0.8627230525016785, "learning_rate": 1.0000042906134765e-07, "loss": 0.6206, "step": 2346 } ], "logging_steps": 1, "max_steps": 2346, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.342670915493167e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }