{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.09195402298850575, "eval_steps": 200, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 4.597701149425287e-05, "grad_norm": 29.670974731445312, "learning_rate": 0.0, "loss": 0.9156931638717651, "num_input_tokens_seen": 226, "step": 1, "train_runtime": 7.4708, "train_tokens_per_second": 30.251 }, { "epoch": 9.195402298850575e-05, "grad_norm": 24.900712966918945, "learning_rate": 4.000000000000001e-06, "loss": 0.9386992454528809, "num_input_tokens_seen": 540, "step": 2, "train_runtime": 9.438, "train_tokens_per_second": 57.216 }, { "epoch": 0.00013793103448275863, "grad_norm": 35.45130157470703, "learning_rate": 8.000000000000001e-06, "loss": 0.9111277461051941, "num_input_tokens_seen": 784, "step": 3, "train_runtime": 11.3773, "train_tokens_per_second": 68.909 }, { "epoch": 0.0001839080459770115, "grad_norm": 20.591541290283203, "learning_rate": 1.2e-05, "loss": 0.7331118583679199, "num_input_tokens_seen": 1050, "step": 4, "train_runtime": 13.2971, "train_tokens_per_second": 78.964 }, { "epoch": 0.00022988505747126436, "grad_norm": 15.996316909790039, "learning_rate": 1.6000000000000003e-05, "loss": 0.6205352544784546, "num_input_tokens_seen": 1360, "step": 5, "train_runtime": 15.2314, "train_tokens_per_second": 89.289 }, { "epoch": 0.00027586206896551725, "grad_norm": 15.900446891784668, "learning_rate": 2e-05, "loss": 0.5837218165397644, "num_input_tokens_seen": 1646, "step": 6, "train_runtime": 17.1596, "train_tokens_per_second": 95.923 }, { "epoch": 0.0003218390804597701, "grad_norm": 10.117097854614258, "learning_rate": 1.998997493734336e-05, "loss": 0.471426784992218, "num_input_tokens_seen": 1994, "step": 7, "train_runtime": 19.0879, "train_tokens_per_second": 104.464 }, { "epoch": 0.000367816091954023, "grad_norm": 13.1370210647583, "learning_rate": 1.997994987468672e-05, "loss": 0.5827452540397644, "num_input_tokens_seen": 2340, "step": 8, "train_runtime": 21.0482, "train_tokens_per_second": 111.173 }, { "epoch": 0.00041379310344827585, "grad_norm": 12.377201080322266, "learning_rate": 1.9969924812030075e-05, "loss": 0.6739121675491333, "num_input_tokens_seen": 2694, "step": 9, "train_runtime": 22.9885, "train_tokens_per_second": 117.189 }, { "epoch": 0.0004597701149425287, "grad_norm": 12.438722610473633, "learning_rate": 1.9959899749373436e-05, "loss": 0.5355566143989563, "num_input_tokens_seen": 3032, "step": 10, "train_runtime": 24.9747, "train_tokens_per_second": 121.403 }, { "epoch": 0.0005057471264367816, "grad_norm": 9.76511287689209, "learning_rate": 1.9949874686716792e-05, "loss": 0.6640444993972778, "num_input_tokens_seen": 3464, "step": 11, "train_runtime": 27.0217, "train_tokens_per_second": 128.193 }, { "epoch": 0.0005517241379310345, "grad_norm": 10.614198684692383, "learning_rate": 1.9939849624060153e-05, "loss": 0.5045055150985718, "num_input_tokens_seen": 3700, "step": 12, "train_runtime": 29.0095, "train_tokens_per_second": 127.545 }, { "epoch": 0.0005977011494252873, "grad_norm": 9.133809089660645, "learning_rate": 1.992982456140351e-05, "loss": 0.4403928518295288, "num_input_tokens_seen": 4022, "step": 13, "train_runtime": 30.9759, "train_tokens_per_second": 129.843 }, { "epoch": 0.0006436781609195402, "grad_norm": 11.173455238342285, "learning_rate": 1.991979949874687e-05, "loss": 0.6436553001403809, "num_input_tokens_seen": 4304, "step": 14, "train_runtime": 32.9504, "train_tokens_per_second": 130.621 }, { "epoch": 0.000689655172413793, "grad_norm": 10.636919975280762, "learning_rate": 1.9909774436090226e-05, "loss": 0.5784497261047363, "num_input_tokens_seen": 4642, "step": 15, "train_runtime": 34.9078, "train_tokens_per_second": 132.979 }, { "epoch": 0.000735632183908046, "grad_norm": 9.944845199584961, "learning_rate": 1.9899749373433587e-05, "loss": 0.6040048599243164, "num_input_tokens_seen": 5336, "step": 16, "train_runtime": 36.9248, "train_tokens_per_second": 144.51 }, { "epoch": 0.0007816091954022989, "grad_norm": 10.018655776977539, "learning_rate": 1.9889724310776943e-05, "loss": 0.43519648909568787, "num_input_tokens_seen": 5602, "step": 17, "train_runtime": 38.8536, "train_tokens_per_second": 144.182 }, { "epoch": 0.0008275862068965517, "grad_norm": 10.092058181762695, "learning_rate": 1.9879699248120303e-05, "loss": 0.6520774364471436, "num_input_tokens_seen": 6002, "step": 18, "train_runtime": 40.8317, "train_tokens_per_second": 146.994 }, { "epoch": 0.0008735632183908046, "grad_norm": 12.305459976196289, "learning_rate": 1.986967418546366e-05, "loss": 0.6159787178039551, "num_input_tokens_seen": 6300, "step": 19, "train_runtime": 42.7875, "train_tokens_per_second": 147.239 }, { "epoch": 0.0009195402298850574, "grad_norm": 8.482680320739746, "learning_rate": 1.9859649122807017e-05, "loss": 0.47896331548690796, "num_input_tokens_seen": 6586, "step": 20, "train_runtime": 44.7248, "train_tokens_per_second": 147.256 }, { "epoch": 0.0009655172413793104, "grad_norm": 9.402422904968262, "learning_rate": 1.9849624060150377e-05, "loss": 0.5928805470466614, "num_input_tokens_seen": 6918, "step": 21, "train_runtime": 46.7373, "train_tokens_per_second": 148.019 }, { "epoch": 0.0010114942528735632, "grad_norm": 12.021410942077637, "learning_rate": 1.9839598997493737e-05, "loss": 0.6990500092506409, "num_input_tokens_seen": 7338, "step": 22, "train_runtime": 48.7861, "train_tokens_per_second": 150.412 }, { "epoch": 0.0010574712643678162, "grad_norm": 9.270434379577637, "learning_rate": 1.9829573934837094e-05, "loss": 0.5009465217590332, "num_input_tokens_seen": 7698, "step": 23, "train_runtime": 50.7911, "train_tokens_per_second": 151.562 }, { "epoch": 0.001103448275862069, "grad_norm": 11.439963340759277, "learning_rate": 1.981954887218045e-05, "loss": 0.8264314532279968, "num_input_tokens_seen": 8072, "step": 24, "train_runtime": 52.751, "train_tokens_per_second": 153.021 }, { "epoch": 0.0011494252873563218, "grad_norm": 11.08813762664795, "learning_rate": 1.980952380952381e-05, "loss": 0.4600914716720581, "num_input_tokens_seen": 8340, "step": 25, "train_runtime": 54.6931, "train_tokens_per_second": 152.487 }, { "epoch": 0.0011954022988505746, "grad_norm": 9.795487403869629, "learning_rate": 1.9799498746867168e-05, "loss": 0.5551027059555054, "num_input_tokens_seen": 8680, "step": 26, "train_runtime": 56.6889, "train_tokens_per_second": 153.116 }, { "epoch": 0.0012413793103448277, "grad_norm": 10.223047256469727, "learning_rate": 1.9789473684210528e-05, "loss": 0.41297563910484314, "num_input_tokens_seen": 8928, "step": 27, "train_runtime": 58.6221, "train_tokens_per_second": 152.297 }, { "epoch": 0.0012873563218390805, "grad_norm": 9.74205493927002, "learning_rate": 1.977944862155389e-05, "loss": 0.5344108939170837, "num_input_tokens_seen": 9184, "step": 28, "train_runtime": 60.5843, "train_tokens_per_second": 151.59 }, { "epoch": 0.0013333333333333333, "grad_norm": 9.142971992492676, "learning_rate": 1.9769423558897245e-05, "loss": 0.45299530029296875, "num_input_tokens_seen": 9520, "step": 29, "train_runtime": 62.5418, "train_tokens_per_second": 152.218 }, { "epoch": 0.001379310344827586, "grad_norm": 11.530330657958984, "learning_rate": 1.9759398496240602e-05, "loss": 0.63418048620224, "num_input_tokens_seen": 9828, "step": 30, "train_runtime": 64.4704, "train_tokens_per_second": 152.442 }, { "epoch": 0.0014252873563218391, "grad_norm": 10.06902027130127, "learning_rate": 1.974937343358396e-05, "loss": 0.5002079010009766, "num_input_tokens_seen": 10140, "step": 31, "train_runtime": 81.028, "train_tokens_per_second": 125.142 }, { "epoch": 0.001471264367816092, "grad_norm": 10.205739974975586, "learning_rate": 1.973934837092732e-05, "loss": 0.6954036951065063, "num_input_tokens_seen": 10526, "step": 32, "train_runtime": 82.9924, "train_tokens_per_second": 126.831 }, { "epoch": 0.0015172413793103448, "grad_norm": 11.820531845092773, "learning_rate": 1.972932330827068e-05, "loss": 0.43554025888442993, "num_input_tokens_seen": 10756, "step": 33, "train_runtime": 84.9196, "train_tokens_per_second": 126.661 }, { "epoch": 0.0015632183908045978, "grad_norm": 8.295219421386719, "learning_rate": 1.9719298245614036e-05, "loss": 0.536799967288971, "num_input_tokens_seen": 11066, "step": 34, "train_runtime": 86.8693, "train_tokens_per_second": 127.387 }, { "epoch": 0.0016091954022988506, "grad_norm": 8.585680961608887, "learning_rate": 1.9709273182957396e-05, "loss": 0.3999759554862976, "num_input_tokens_seen": 11334, "step": 35, "train_runtime": 88.8176, "train_tokens_per_second": 127.61 }, { "epoch": 0.0016551724137931034, "grad_norm": 7.839630126953125, "learning_rate": 1.9699248120300753e-05, "loss": 0.6960058212280273, "num_input_tokens_seen": 12256, "step": 36, "train_runtime": 91.1022, "train_tokens_per_second": 134.53 }, { "epoch": 0.0017011494252873562, "grad_norm": 8.731598854064941, "learning_rate": 1.968922305764411e-05, "loss": 0.5457684397697449, "num_input_tokens_seen": 12564, "step": 37, "train_runtime": 93.0479, "train_tokens_per_second": 135.027 }, { "epoch": 0.0017471264367816092, "grad_norm": 9.757588386535645, "learning_rate": 1.967919799498747e-05, "loss": 0.5432316064834595, "num_input_tokens_seen": 12910, "step": 38, "train_runtime": 95.066, "train_tokens_per_second": 135.8 }, { "epoch": 0.001793103448275862, "grad_norm": 7.411613941192627, "learning_rate": 1.966917293233083e-05, "loss": 0.3205088675022125, "num_input_tokens_seen": 13254, "step": 39, "train_runtime": 97.0558, "train_tokens_per_second": 136.561 }, { "epoch": 0.0018390804597701149, "grad_norm": 9.789390563964844, "learning_rate": 1.9659147869674187e-05, "loss": 0.5437139272689819, "num_input_tokens_seen": 13612, "step": 40, "train_runtime": 98.9998, "train_tokens_per_second": 137.495 }, { "epoch": 0.001885057471264368, "grad_norm": 8.682579040527344, "learning_rate": 1.9649122807017544e-05, "loss": 0.3659517765045166, "num_input_tokens_seen": 13854, "step": 41, "train_runtime": 100.9294, "train_tokens_per_second": 137.264 }, { "epoch": 0.0019310344827586207, "grad_norm": 10.214683532714844, "learning_rate": 1.9639097744360904e-05, "loss": 0.5193214416503906, "num_input_tokens_seen": 14106, "step": 42, "train_runtime": 103.0205, "train_tokens_per_second": 136.924 }, { "epoch": 0.0019770114942528737, "grad_norm": 9.461170196533203, "learning_rate": 1.962907268170426e-05, "loss": 0.5038692951202393, "num_input_tokens_seen": 14548, "step": 43, "train_runtime": 105.1014, "train_tokens_per_second": 138.419 }, { "epoch": 0.0020229885057471263, "grad_norm": 10.129467010498047, "learning_rate": 1.961904761904762e-05, "loss": 0.5905882716178894, "num_input_tokens_seen": 14882, "step": 44, "train_runtime": 107.1422, "train_tokens_per_second": 138.9 }, { "epoch": 0.0020689655172413794, "grad_norm": 9.763384819030762, "learning_rate": 1.960902255639098e-05, "loss": 0.4151766002178192, "num_input_tokens_seen": 15164, "step": 45, "train_runtime": 109.1638, "train_tokens_per_second": 138.911 }, { "epoch": 0.0021149425287356324, "grad_norm": 10.556844711303711, "learning_rate": 1.9598997493734338e-05, "loss": 0.42272478342056274, "num_input_tokens_seen": 15464, "step": 46, "train_runtime": 111.1925, "train_tokens_per_second": 139.074 }, { "epoch": 0.002160919540229885, "grad_norm": 9.503744125366211, "learning_rate": 1.9588972431077695e-05, "loss": 0.522967517375946, "num_input_tokens_seen": 15754, "step": 47, "train_runtime": 113.199, "train_tokens_per_second": 139.171 }, { "epoch": 0.002206896551724138, "grad_norm": 8.815255165100098, "learning_rate": 1.9578947368421055e-05, "loss": 0.5505152344703674, "num_input_tokens_seen": 16132, "step": 48, "train_runtime": 115.2014, "train_tokens_per_second": 140.033 }, { "epoch": 0.0022528735632183906, "grad_norm": 9.219003677368164, "learning_rate": 1.956892230576441e-05, "loss": 0.7738328576087952, "num_input_tokens_seen": 16782, "step": 49, "train_runtime": 117.2265, "train_tokens_per_second": 143.159 }, { "epoch": 0.0022988505747126436, "grad_norm": 10.014391899108887, "learning_rate": 1.9558897243107772e-05, "loss": 0.5957150459289551, "num_input_tokens_seen": 17050, "step": 50, "train_runtime": 119.1627, "train_tokens_per_second": 143.082 }, { "epoch": 0.0023448275862068967, "grad_norm": 12.310578346252441, "learning_rate": 1.954887218045113e-05, "loss": 0.6443823575973511, "num_input_tokens_seen": 17384, "step": 51, "train_runtime": 121.1125, "train_tokens_per_second": 143.536 }, { "epoch": 0.0023908045977011493, "grad_norm": 9.436968803405762, "learning_rate": 1.953884711779449e-05, "loss": 0.5737659931182861, "num_input_tokens_seen": 17660, "step": 52, "train_runtime": 123.0371, "train_tokens_per_second": 143.534 }, { "epoch": 0.0024367816091954023, "grad_norm": 7.799676418304443, "learning_rate": 1.9528822055137845e-05, "loss": 0.4736555814743042, "num_input_tokens_seen": 17926, "step": 53, "train_runtime": 124.969, "train_tokens_per_second": 143.444 }, { "epoch": 0.0024827586206896553, "grad_norm": 10.809428215026855, "learning_rate": 1.9518796992481202e-05, "loss": 0.5015234351158142, "num_input_tokens_seen": 18186, "step": 54, "train_runtime": 126.9191, "train_tokens_per_second": 143.288 }, { "epoch": 0.002528735632183908, "grad_norm": 9.467635154724121, "learning_rate": 1.9508771929824562e-05, "loss": 0.6202517747879028, "num_input_tokens_seen": 18542, "step": 55, "train_runtime": 128.8986, "train_tokens_per_second": 143.85 }, { "epoch": 0.002574712643678161, "grad_norm": 9.191046714782715, "learning_rate": 1.9498746867167923e-05, "loss": 0.5081424117088318, "num_input_tokens_seen": 18892, "step": 56, "train_runtime": 130.848, "train_tokens_per_second": 144.381 }, { "epoch": 0.002620689655172414, "grad_norm": 8.688216209411621, "learning_rate": 1.948872180451128e-05, "loss": 0.44278833270072937, "num_input_tokens_seen": 19232, "step": 57, "train_runtime": 132.8132, "train_tokens_per_second": 144.805 }, { "epoch": 0.0026666666666666666, "grad_norm": 8.183144569396973, "learning_rate": 1.947869674185464e-05, "loss": 0.49157488346099854, "num_input_tokens_seen": 19502, "step": 58, "train_runtime": 134.7752, "train_tokens_per_second": 144.7 }, { "epoch": 0.0027126436781609196, "grad_norm": 9.218542098999023, "learning_rate": 1.9468671679197996e-05, "loss": 0.5725117921829224, "num_input_tokens_seen": 19910, "step": 59, "train_runtime": 136.7257, "train_tokens_per_second": 145.62 }, { "epoch": 0.002758620689655172, "grad_norm": 8.710495948791504, "learning_rate": 1.9458646616541353e-05, "loss": 0.4720567464828491, "num_input_tokens_seen": 20186, "step": 60, "train_runtime": 138.6459, "train_tokens_per_second": 145.594 }, { "epoch": 0.0028045977011494252, "grad_norm": 10.533473014831543, "learning_rate": 1.9448621553884713e-05, "loss": 0.438642680644989, "num_input_tokens_seen": 20454, "step": 61, "train_runtime": 153.9405, "train_tokens_per_second": 132.87 }, { "epoch": 0.0028505747126436783, "grad_norm": 8.03281021118164, "learning_rate": 1.9438596491228074e-05, "loss": 0.5351825952529907, "num_input_tokens_seen": 20798, "step": 62, "train_runtime": 155.8779, "train_tokens_per_second": 133.425 }, { "epoch": 0.002896551724137931, "grad_norm": 8.456392288208008, "learning_rate": 1.942857142857143e-05, "loss": 0.5822426676750183, "num_input_tokens_seen": 21272, "step": 63, "train_runtime": 157.885, "train_tokens_per_second": 134.731 }, { "epoch": 0.002942528735632184, "grad_norm": 11.524544715881348, "learning_rate": 1.9418546365914787e-05, "loss": 0.7060003280639648, "num_input_tokens_seen": 21562, "step": 64, "train_runtime": 159.8005, "train_tokens_per_second": 134.931 }, { "epoch": 0.002988505747126437, "grad_norm": 7.4113969802856445, "learning_rate": 1.9408521303258147e-05, "loss": 0.3441489338874817, "num_input_tokens_seen": 21814, "step": 65, "train_runtime": 161.7111, "train_tokens_per_second": 134.895 }, { "epoch": 0.0030344827586206895, "grad_norm": 8.198412895202637, "learning_rate": 1.9398496240601504e-05, "loss": 0.505254864692688, "num_input_tokens_seen": 22102, "step": 66, "train_runtime": 163.6425, "train_tokens_per_second": 135.063 }, { "epoch": 0.0030804597701149425, "grad_norm": 9.072737693786621, "learning_rate": 1.9388471177944864e-05, "loss": 0.5357642769813538, "num_input_tokens_seen": 22426, "step": 67, "train_runtime": 165.5707, "train_tokens_per_second": 135.447 }, { "epoch": 0.0031264367816091956, "grad_norm": 7.890419960021973, "learning_rate": 1.9378446115288224e-05, "loss": 0.5315457582473755, "num_input_tokens_seen": 22722, "step": 68, "train_runtime": 167.5015, "train_tokens_per_second": 135.653 }, { "epoch": 0.003172413793103448, "grad_norm": 9.176838874816895, "learning_rate": 1.936842105263158e-05, "loss": 0.6139141321182251, "num_input_tokens_seen": 23144, "step": 69, "train_runtime": 169.4794, "train_tokens_per_second": 136.559 }, { "epoch": 0.003218390804597701, "grad_norm": 9.316536903381348, "learning_rate": 1.9358395989974938e-05, "loss": 0.6673556566238403, "num_input_tokens_seen": 23446, "step": 70, "train_runtime": 171.4083, "train_tokens_per_second": 136.785 }, { "epoch": 0.0032643678160919542, "grad_norm": 10.201543807983398, "learning_rate": 1.9348370927318295e-05, "loss": 0.5292945504188538, "num_input_tokens_seen": 23768, "step": 71, "train_runtime": 173.3509, "train_tokens_per_second": 137.109 }, { "epoch": 0.003310344827586207, "grad_norm": 8.47014045715332, "learning_rate": 1.9338345864661655e-05, "loss": 0.41301482915878296, "num_input_tokens_seen": 23986, "step": 72, "train_runtime": 175.333, "train_tokens_per_second": 136.803 }, { "epoch": 0.00335632183908046, "grad_norm": 7.975886821746826, "learning_rate": 1.9328320802005015e-05, "loss": 0.46357280015945435, "num_input_tokens_seen": 24270, "step": 73, "train_runtime": 177.5143, "train_tokens_per_second": 136.721 }, { "epoch": 0.0034022988505747124, "grad_norm": 8.95450496673584, "learning_rate": 1.9318295739348372e-05, "loss": 0.5103389620780945, "num_input_tokens_seen": 24520, "step": 74, "train_runtime": 179.4746, "train_tokens_per_second": 136.621 }, { "epoch": 0.0034482758620689655, "grad_norm": 9.743664741516113, "learning_rate": 1.9308270676691732e-05, "loss": 0.6401261687278748, "num_input_tokens_seen": 24800, "step": 75, "train_runtime": 181.3884, "train_tokens_per_second": 136.723 }, { "epoch": 0.0034942528735632185, "grad_norm": 9.316505432128906, "learning_rate": 1.929824561403509e-05, "loss": 0.4908076524734497, "num_input_tokens_seen": 25068, "step": 76, "train_runtime": 183.292, "train_tokens_per_second": 136.765 }, { "epoch": 0.003540229885057471, "grad_norm": 7.853257179260254, "learning_rate": 1.9288220551378446e-05, "loss": 0.4684579372406006, "num_input_tokens_seen": 25304, "step": 77, "train_runtime": 185.2082, "train_tokens_per_second": 136.625 }, { "epoch": 0.003586206896551724, "grad_norm": 9.16893196105957, "learning_rate": 1.9278195488721806e-05, "loss": 0.5689425468444824, "num_input_tokens_seen": 25570, "step": 78, "train_runtime": 187.1387, "train_tokens_per_second": 136.637 }, { "epoch": 0.003632183908045977, "grad_norm": 9.800451278686523, "learning_rate": 1.9268170426065166e-05, "loss": 0.5715272426605225, "num_input_tokens_seen": 25864, "step": 79, "train_runtime": 189.0995, "train_tokens_per_second": 136.775 }, { "epoch": 0.0036781609195402297, "grad_norm": 9.618143081665039, "learning_rate": 1.9258145363408523e-05, "loss": 0.5264904499053955, "num_input_tokens_seen": 26140, "step": 80, "train_runtime": 191.0752, "train_tokens_per_second": 136.805 }, { "epoch": 0.0037241379310344828, "grad_norm": 8.853523254394531, "learning_rate": 1.924812030075188e-05, "loss": 0.41909778118133545, "num_input_tokens_seen": 26420, "step": 81, "train_runtime": 192.9847, "train_tokens_per_second": 136.902 }, { "epoch": 0.003770114942528736, "grad_norm": 10.117783546447754, "learning_rate": 1.923809523809524e-05, "loss": 0.5639157891273499, "num_input_tokens_seen": 26702, "step": 82, "train_runtime": 194.9084, "train_tokens_per_second": 136.998 }, { "epoch": 0.0038160919540229884, "grad_norm": 8.727978706359863, "learning_rate": 1.9228070175438597e-05, "loss": 0.5927528142929077, "num_input_tokens_seen": 27088, "step": 83, "train_runtime": 196.8634, "train_tokens_per_second": 137.598 }, { "epoch": 0.0038620689655172414, "grad_norm": 8.757131576538086, "learning_rate": 1.9218045112781957e-05, "loss": 0.5949188470840454, "num_input_tokens_seen": 27510, "step": 84, "train_runtime": 198.8064, "train_tokens_per_second": 138.376 }, { "epoch": 0.003908045977011494, "grad_norm": 7.067785739898682, "learning_rate": 1.9208020050125317e-05, "loss": 0.4642144739627838, "num_input_tokens_seen": 27988, "step": 85, "train_runtime": 200.7676, "train_tokens_per_second": 139.405 }, { "epoch": 0.0039540229885057475, "grad_norm": 8.996391296386719, "learning_rate": 1.9197994987468674e-05, "loss": 0.421725869178772, "num_input_tokens_seen": 28210, "step": 86, "train_runtime": 202.6595, "train_tokens_per_second": 139.199 }, { "epoch": 0.004, "grad_norm": 8.663325309753418, "learning_rate": 1.918796992481203e-05, "loss": 0.560427188873291, "num_input_tokens_seen": 28532, "step": 87, "train_runtime": 204.5835, "train_tokens_per_second": 139.464 }, { "epoch": 0.004045977011494253, "grad_norm": 10.188467979431152, "learning_rate": 1.917794486215539e-05, "loss": 0.5534644722938538, "num_input_tokens_seen": 28828, "step": 88, "train_runtime": 206.5008, "train_tokens_per_second": 139.602 }, { "epoch": 0.004091954022988506, "grad_norm": 9.026497840881348, "learning_rate": 1.9167919799498748e-05, "loss": 0.6749687194824219, "num_input_tokens_seen": 29260, "step": 89, "train_runtime": 208.4575, "train_tokens_per_second": 140.364 }, { "epoch": 0.004137931034482759, "grad_norm": 8.981388092041016, "learning_rate": 1.9157894736842108e-05, "loss": 0.48772114515304565, "num_input_tokens_seen": 29562, "step": 90, "train_runtime": 210.3843, "train_tokens_per_second": 140.514 }, { "epoch": 0.004183908045977011, "grad_norm": 9.265682220458984, "learning_rate": 1.9147869674185465e-05, "loss": 0.5756199359893799, "num_input_tokens_seen": 29832, "step": 91, "train_runtime": 224.6014, "train_tokens_per_second": 132.822 }, { "epoch": 0.004229885057471265, "grad_norm": 7.933191299438477, "learning_rate": 1.9137844611528825e-05, "loss": 0.6041742563247681, "num_input_tokens_seen": 30484, "step": 92, "train_runtime": 226.6451, "train_tokens_per_second": 134.501 }, { "epoch": 0.004275862068965517, "grad_norm": 9.629735946655273, "learning_rate": 1.912781954887218e-05, "loss": 0.6612107157707214, "num_input_tokens_seen": 30942, "step": 93, "train_runtime": 228.6489, "train_tokens_per_second": 135.325 }, { "epoch": 0.00432183908045977, "grad_norm": 8.997493743896484, "learning_rate": 1.911779448621554e-05, "loss": 0.5092484951019287, "num_input_tokens_seen": 31340, "step": 94, "train_runtime": 230.7289, "train_tokens_per_second": 135.83 }, { "epoch": 0.004367816091954023, "grad_norm": 8.316047668457031, "learning_rate": 1.91077694235589e-05, "loss": 0.46212780475616455, "num_input_tokens_seen": 31596, "step": 95, "train_runtime": 232.8291, "train_tokens_per_second": 135.705 }, { "epoch": 0.004413793103448276, "grad_norm": 9.808420181274414, "learning_rate": 1.909774436090226e-05, "loss": 0.541647732257843, "num_input_tokens_seen": 32008, "step": 96, "train_runtime": 234.8559, "train_tokens_per_second": 136.288 }, { "epoch": 0.004459770114942529, "grad_norm": 8.325944900512695, "learning_rate": 1.9087719298245616e-05, "loss": 0.6134788990020752, "num_input_tokens_seen": 32284, "step": 97, "train_runtime": 236.785, "train_tokens_per_second": 136.343 }, { "epoch": 0.004505747126436781, "grad_norm": 9.541683197021484, "learning_rate": 1.9077694235588976e-05, "loss": 0.5184969305992126, "num_input_tokens_seen": 32520, "step": 98, "train_runtime": 238.7158, "train_tokens_per_second": 136.229 }, { "epoch": 0.004551724137931035, "grad_norm": 8.778630256652832, "learning_rate": 1.9067669172932333e-05, "loss": 0.5224044322967529, "num_input_tokens_seen": 32756, "step": 99, "train_runtime": 240.6471, "train_tokens_per_second": 136.116 }, { "epoch": 0.004597701149425287, "grad_norm": 8.830920219421387, "learning_rate": 1.905764411027569e-05, "loss": 0.6011303067207336, "num_input_tokens_seen": 33066, "step": 100, "train_runtime": 242.5824, "train_tokens_per_second": 136.308 }, { "epoch": 0.00464367816091954, "grad_norm": 8.93142032623291, "learning_rate": 1.904761904761905e-05, "loss": 0.4904657006263733, "num_input_tokens_seen": 33342, "step": 101, "train_runtime": 244.5372, "train_tokens_per_second": 136.347 }, { "epoch": 0.004689655172413793, "grad_norm": 11.11080265045166, "learning_rate": 1.903759398496241e-05, "loss": 0.5706338286399841, "num_input_tokens_seen": 33664, "step": 102, "train_runtime": 246.4553, "train_tokens_per_second": 136.593 }, { "epoch": 0.004735632183908046, "grad_norm": 7.9319353103637695, "learning_rate": 1.9027568922305766e-05, "loss": 0.4006994664669037, "num_input_tokens_seen": 33900, "step": 103, "train_runtime": 248.3577, "train_tokens_per_second": 136.497 }, { "epoch": 0.0047816091954022985, "grad_norm": 11.371949195861816, "learning_rate": 1.9017543859649123e-05, "loss": 0.5322912335395813, "num_input_tokens_seen": 34194, "step": 104, "train_runtime": 250.2764, "train_tokens_per_second": 136.625 }, { "epoch": 0.004827586206896552, "grad_norm": 8.555707931518555, "learning_rate": 1.9007518796992483e-05, "loss": 0.4682633876800537, "num_input_tokens_seen": 34756, "step": 105, "train_runtime": 252.2596, "train_tokens_per_second": 137.779 }, { "epoch": 0.004873563218390805, "grad_norm": 12.503046989440918, "learning_rate": 1.899749373433584e-05, "loss": 0.43531227111816406, "num_input_tokens_seen": 35054, "step": 106, "train_runtime": 254.1754, "train_tokens_per_second": 137.913 }, { "epoch": 0.004919540229885057, "grad_norm": 8.476236343383789, "learning_rate": 1.89874686716792e-05, "loss": 0.3929433822631836, "num_input_tokens_seen": 35300, "step": 107, "train_runtime": 256.0932, "train_tokens_per_second": 137.84 }, { "epoch": 0.004965517241379311, "grad_norm": 9.59035873413086, "learning_rate": 1.8977443609022557e-05, "loss": 0.6225996017456055, "num_input_tokens_seen": 35600, "step": 108, "train_runtime": 258.0261, "train_tokens_per_second": 137.971 }, { "epoch": 0.005011494252873563, "grad_norm": 8.283434867858887, "learning_rate": 1.8967418546365917e-05, "loss": 0.5337879657745361, "num_input_tokens_seen": 35966, "step": 109, "train_runtime": 259.9956, "train_tokens_per_second": 138.333 }, { "epoch": 0.005057471264367816, "grad_norm": 7.715997219085693, "learning_rate": 1.8957393483709274e-05, "loss": 0.5463548898696899, "num_input_tokens_seen": 36406, "step": 110, "train_runtime": 261.9563, "train_tokens_per_second": 138.977 }, { "epoch": 0.005103448275862069, "grad_norm": 8.812264442443848, "learning_rate": 1.894736842105263e-05, "loss": 0.6220695972442627, "num_input_tokens_seen": 37082, "step": 111, "train_runtime": 264.0358, "train_tokens_per_second": 140.443 }, { "epoch": 0.005149425287356322, "grad_norm": 8.751511573791504, "learning_rate": 1.893734335839599e-05, "loss": 0.4591900706291199, "num_input_tokens_seen": 37384, "step": 112, "train_runtime": 265.9926, "train_tokens_per_second": 140.545 }, { "epoch": 0.0051954022988505745, "grad_norm": 8.574929237365723, "learning_rate": 1.892731829573935e-05, "loss": 0.5448266267776489, "num_input_tokens_seen": 37634, "step": 113, "train_runtime": 267.9425, "train_tokens_per_second": 140.456 }, { "epoch": 0.005241379310344828, "grad_norm": 9.245474815368652, "learning_rate": 1.8917293233082708e-05, "loss": 0.643197774887085, "num_input_tokens_seen": 37920, "step": 114, "train_runtime": 269.9313, "train_tokens_per_second": 140.48 }, { "epoch": 0.0052873563218390806, "grad_norm": 8.642900466918945, "learning_rate": 1.890726817042607e-05, "loss": 0.49965792894363403, "num_input_tokens_seen": 38218, "step": 115, "train_runtime": 271.993, "train_tokens_per_second": 140.511 }, { "epoch": 0.005333333333333333, "grad_norm": 10.202279090881348, "learning_rate": 1.8897243107769425e-05, "loss": 0.5130624771118164, "num_input_tokens_seen": 38542, "step": 116, "train_runtime": 273.9988, "train_tokens_per_second": 140.665 }, { "epoch": 0.005379310344827587, "grad_norm": 6.849987030029297, "learning_rate": 1.8887218045112782e-05, "loss": 0.35125046968460083, "num_input_tokens_seen": 38800, "step": 117, "train_runtime": 275.9216, "train_tokens_per_second": 140.62 }, { "epoch": 0.005425287356321839, "grad_norm": 9.680569648742676, "learning_rate": 1.8877192982456142e-05, "loss": 0.5921655297279358, "num_input_tokens_seen": 39094, "step": 118, "train_runtime": 277.894, "train_tokens_per_second": 140.68 }, { "epoch": 0.005471264367816092, "grad_norm": 9.317355155944824, "learning_rate": 1.88671679197995e-05, "loss": 0.5994471311569214, "num_input_tokens_seen": 39378, "step": 119, "train_runtime": 279.809, "train_tokens_per_second": 140.732 }, { "epoch": 0.005517241379310344, "grad_norm": 9.860715866088867, "learning_rate": 1.885714285714286e-05, "loss": 0.40653514862060547, "num_input_tokens_seen": 39632, "step": 120, "train_runtime": 281.7164, "train_tokens_per_second": 140.681 }, { "epoch": 0.005563218390804598, "grad_norm": 8.424166679382324, "learning_rate": 1.8847117794486216e-05, "loss": 0.4481711983680725, "num_input_tokens_seen": 40052, "step": 121, "train_runtime": 296.5872, "train_tokens_per_second": 135.043 }, { "epoch": 0.0056091954022988505, "grad_norm": 7.983243942260742, "learning_rate": 1.8837092731829576e-05, "loss": 0.5721695423126221, "num_input_tokens_seen": 40526, "step": 122, "train_runtime": 298.5699, "train_tokens_per_second": 135.734 }, { "epoch": 0.005655172413793103, "grad_norm": 9.069170951843262, "learning_rate": 1.8827067669172933e-05, "loss": 0.4698539972305298, "num_input_tokens_seen": 40772, "step": 123, "train_runtime": 300.4958, "train_tokens_per_second": 135.682 }, { "epoch": 0.0057011494252873565, "grad_norm": 8.430562973022461, "learning_rate": 1.8817042606516293e-05, "loss": 0.49493882060050964, "num_input_tokens_seen": 41018, "step": 124, "train_runtime": 302.5117, "train_tokens_per_second": 135.591 }, { "epoch": 0.005747126436781609, "grad_norm": 9.015573501586914, "learning_rate": 1.880701754385965e-05, "loss": 0.5125147700309753, "num_input_tokens_seen": 41288, "step": 125, "train_runtime": 304.4739, "train_tokens_per_second": 135.604 }, { "epoch": 0.005793103448275862, "grad_norm": 9.86005973815918, "learning_rate": 1.879699248120301e-05, "loss": 0.4860873818397522, "num_input_tokens_seen": 41610, "step": 126, "train_runtime": 306.5398, "train_tokens_per_second": 135.741 }, { "epoch": 0.005839080459770115, "grad_norm": 9.298399925231934, "learning_rate": 1.8786967418546367e-05, "loss": 0.4224809408187866, "num_input_tokens_seen": 41880, "step": 127, "train_runtime": 308.5124, "train_tokens_per_second": 135.748 }, { "epoch": 0.005885057471264368, "grad_norm": 9.295427322387695, "learning_rate": 1.8776942355889727e-05, "loss": 0.5424748659133911, "num_input_tokens_seen": 42238, "step": 128, "train_runtime": 310.5302, "train_tokens_per_second": 136.019 }, { "epoch": 0.00593103448275862, "grad_norm": 9.500751495361328, "learning_rate": 1.8766917293233084e-05, "loss": 0.4178183078765869, "num_input_tokens_seen": 42520, "step": 129, "train_runtime": 312.4986, "train_tokens_per_second": 136.065 }, { "epoch": 0.005977011494252874, "grad_norm": 7.819894313812256, "learning_rate": 1.8756892230576444e-05, "loss": 0.38070225715637207, "num_input_tokens_seen": 42782, "step": 130, "train_runtime": 314.4247, "train_tokens_per_second": 136.064 }, { "epoch": 0.006022988505747126, "grad_norm": 7.9321513175964355, "learning_rate": 1.87468671679198e-05, "loss": 0.39679110050201416, "num_input_tokens_seen": 43024, "step": 131, "train_runtime": 316.3573, "train_tokens_per_second": 135.998 }, { "epoch": 0.006068965517241379, "grad_norm": 8.515424728393555, "learning_rate": 1.873684210526316e-05, "loss": 0.49936944246292114, "num_input_tokens_seen": 43340, "step": 132, "train_runtime": 318.2971, "train_tokens_per_second": 136.162 }, { "epoch": 0.0061149425287356325, "grad_norm": 10.381828308105469, "learning_rate": 1.8726817042606518e-05, "loss": 0.6803163290023804, "num_input_tokens_seen": 43844, "step": 133, "train_runtime": 320.4357, "train_tokens_per_second": 136.826 }, { "epoch": 0.006160919540229885, "grad_norm": 8.881560325622559, "learning_rate": 1.8716791979949875e-05, "loss": 0.4254298806190491, "num_input_tokens_seen": 44104, "step": 134, "train_runtime": 322.6003, "train_tokens_per_second": 136.714 }, { "epoch": 0.006206896551724138, "grad_norm": 8.319070816040039, "learning_rate": 1.8706766917293235e-05, "loss": 0.30514371395111084, "num_input_tokens_seen": 44342, "step": 135, "train_runtime": 324.7113, "train_tokens_per_second": 136.558 }, { "epoch": 0.006252873563218391, "grad_norm": 8.256769180297852, "learning_rate": 1.869674185463659e-05, "loss": 0.40613967180252075, "num_input_tokens_seen": 44628, "step": 136, "train_runtime": 326.8512, "train_tokens_per_second": 136.539 }, { "epoch": 0.006298850574712644, "grad_norm": 9.814496994018555, "learning_rate": 1.868671679197995e-05, "loss": 0.40587806701660156, "num_input_tokens_seen": 44894, "step": 137, "train_runtime": 328.814, "train_tokens_per_second": 136.533 }, { "epoch": 0.006344827586206896, "grad_norm": 9.767206192016602, "learning_rate": 1.8676691729323312e-05, "loss": 0.39910808205604553, "num_input_tokens_seen": 45126, "step": 138, "train_runtime": 330.7651, "train_tokens_per_second": 136.429 }, { "epoch": 0.00639080459770115, "grad_norm": 8.380473136901855, "learning_rate": 1.866666666666667e-05, "loss": 0.5884116291999817, "num_input_tokens_seen": 45448, "step": 139, "train_runtime": 332.7571, "train_tokens_per_second": 136.58 }, { "epoch": 0.006436781609195402, "grad_norm": 7.716179847717285, "learning_rate": 1.8656641604010025e-05, "loss": 0.49266794323921204, "num_input_tokens_seen": 45766, "step": 140, "train_runtime": 334.7245, "train_tokens_per_second": 136.727 }, { "epoch": 0.006482758620689655, "grad_norm": 9.636268615722656, "learning_rate": 1.8646616541353386e-05, "loss": 0.5481572151184082, "num_input_tokens_seen": 46080, "step": 141, "train_runtime": 336.6869, "train_tokens_per_second": 136.863 }, { "epoch": 0.0065287356321839084, "grad_norm": 8.68143081665039, "learning_rate": 1.8636591478696742e-05, "loss": 0.629855751991272, "num_input_tokens_seen": 46476, "step": 142, "train_runtime": 338.6892, "train_tokens_per_second": 137.223 }, { "epoch": 0.006574712643678161, "grad_norm": 9.662667274475098, "learning_rate": 1.8626566416040103e-05, "loss": 0.529405951499939, "num_input_tokens_seen": 46708, "step": 143, "train_runtime": 340.6349, "train_tokens_per_second": 137.12 }, { "epoch": 0.006620689655172414, "grad_norm": 10.860309600830078, "learning_rate": 1.861654135338346e-05, "loss": 0.41112494468688965, "num_input_tokens_seen": 47002, "step": 144, "train_runtime": 342.6129, "train_tokens_per_second": 137.187 }, { "epoch": 0.006666666666666667, "grad_norm": 8.208048820495605, "learning_rate": 1.860651629072682e-05, "loss": 0.4882567524909973, "num_input_tokens_seen": 47324, "step": 145, "train_runtime": 344.617, "train_tokens_per_second": 137.323 }, { "epoch": 0.00671264367816092, "grad_norm": 8.881811141967773, "learning_rate": 1.8596491228070176e-05, "loss": 0.48573899269104004, "num_input_tokens_seen": 47620, "step": 146, "train_runtime": 346.5379, "train_tokens_per_second": 137.416 }, { "epoch": 0.006758620689655172, "grad_norm": 9.245759963989258, "learning_rate": 1.8586466165413533e-05, "loss": 0.44191601872444153, "num_input_tokens_seen": 48142, "step": 147, "train_runtime": 348.5843, "train_tokens_per_second": 138.107 }, { "epoch": 0.006804597701149425, "grad_norm": 8.131628036499023, "learning_rate": 1.8576441102756893e-05, "loss": 0.4785696268081665, "num_input_tokens_seen": 48756, "step": 148, "train_runtime": 350.6028, "train_tokens_per_second": 139.063 }, { "epoch": 0.006850574712643678, "grad_norm": 10.151355743408203, "learning_rate": 1.8566416040100254e-05, "loss": 0.6337138414382935, "num_input_tokens_seen": 49072, "step": 149, "train_runtime": 352.5517, "train_tokens_per_second": 139.191 }, { "epoch": 0.006896551724137931, "grad_norm": 10.633296012878418, "learning_rate": 1.855639097744361e-05, "loss": 0.5732593536376953, "num_input_tokens_seen": 49412, "step": 150, "train_runtime": 354.4895, "train_tokens_per_second": 139.389 }, { "epoch": 0.0069425287356321835, "grad_norm": 9.780455589294434, "learning_rate": 1.8546365914786967e-05, "loss": 0.43314051628112793, "num_input_tokens_seen": 49680, "step": 151, "train_runtime": 368.6791, "train_tokens_per_second": 134.751 }, { "epoch": 0.006988505747126437, "grad_norm": 7.924914836883545, "learning_rate": 1.8536340852130327e-05, "loss": 0.45942002534866333, "num_input_tokens_seen": 49990, "step": 152, "train_runtime": 370.611, "train_tokens_per_second": 134.885 }, { "epoch": 0.00703448275862069, "grad_norm": 7.610330104827881, "learning_rate": 1.8526315789473684e-05, "loss": 0.5856990218162537, "num_input_tokens_seen": 50302, "step": 153, "train_runtime": 372.5391, "train_tokens_per_second": 135.025 }, { "epoch": 0.007080459770114942, "grad_norm": 8.95278549194336, "learning_rate": 1.8516290726817044e-05, "loss": 0.5225367546081543, "num_input_tokens_seen": 50570, "step": 154, "train_runtime": 374.5819, "train_tokens_per_second": 135.004 }, { "epoch": 0.007126436781609196, "grad_norm": 8.637958526611328, "learning_rate": 1.8506265664160404e-05, "loss": 0.5034955739974976, "num_input_tokens_seen": 50962, "step": 155, "train_runtime": 376.7162, "train_tokens_per_second": 135.28 }, { "epoch": 0.007172413793103448, "grad_norm": 8.947890281677246, "learning_rate": 1.849624060150376e-05, "loss": 0.4520954489707947, "num_input_tokens_seen": 51234, "step": 156, "train_runtime": 378.6622, "train_tokens_per_second": 135.303 }, { "epoch": 0.007218390804597701, "grad_norm": 8.568826675415039, "learning_rate": 1.8486215538847118e-05, "loss": 0.4783710241317749, "num_input_tokens_seen": 51550, "step": 157, "train_runtime": 380.5796, "train_tokens_per_second": 135.451 }, { "epoch": 0.007264367816091954, "grad_norm": 7.674930572509766, "learning_rate": 1.8476190476190478e-05, "loss": 0.5886533260345459, "num_input_tokens_seen": 52198, "step": 158, "train_runtime": 382.5782, "train_tokens_per_second": 136.437 }, { "epoch": 0.007310344827586207, "grad_norm": 8.045730590820312, "learning_rate": 1.8466165413533835e-05, "loss": 0.5183379054069519, "num_input_tokens_seen": 52594, "step": 159, "train_runtime": 384.5283, "train_tokens_per_second": 136.775 }, { "epoch": 0.0073563218390804595, "grad_norm": 11.347859382629395, "learning_rate": 1.8456140350877195e-05, "loss": 0.4976785182952881, "num_input_tokens_seen": 52876, "step": 160, "train_runtime": 386.4424, "train_tokens_per_second": 136.828 }, { "epoch": 0.007402298850574713, "grad_norm": 7.577949047088623, "learning_rate": 1.8446115288220552e-05, "loss": 0.4495604336261749, "num_input_tokens_seen": 53224, "step": 161, "train_runtime": 388.3505, "train_tokens_per_second": 137.051 }, { "epoch": 0.0074482758620689656, "grad_norm": 11.509404182434082, "learning_rate": 1.8436090225563912e-05, "loss": 0.37604063749313354, "num_input_tokens_seen": 53454, "step": 162, "train_runtime": 390.2515, "train_tokens_per_second": 136.973 }, { "epoch": 0.007494252873563218, "grad_norm": 8.486335754394531, "learning_rate": 1.842606516290727e-05, "loss": 0.5968654155731201, "num_input_tokens_seen": 53916, "step": 163, "train_runtime": 392.2164, "train_tokens_per_second": 137.465 }, { "epoch": 0.007540229885057472, "grad_norm": 9.746296882629395, "learning_rate": 1.8416040100250626e-05, "loss": 0.5125172734260559, "num_input_tokens_seen": 54222, "step": 164, "train_runtime": 394.1474, "train_tokens_per_second": 137.568 }, { "epoch": 0.007586206896551724, "grad_norm": 8.613889694213867, "learning_rate": 1.8406015037593986e-05, "loss": 0.5511026382446289, "num_input_tokens_seen": 54706, "step": 165, "train_runtime": 396.1306, "train_tokens_per_second": 138.101 }, { "epoch": 0.007632183908045977, "grad_norm": 8.980238914489746, "learning_rate": 1.8395989974937346e-05, "loss": 0.511992335319519, "num_input_tokens_seen": 54992, "step": 166, "train_runtime": 398.0508, "train_tokens_per_second": 138.153 }, { "epoch": 0.00767816091954023, "grad_norm": 7.981934070587158, "learning_rate": 1.8385964912280703e-05, "loss": 0.4814477264881134, "num_input_tokens_seen": 55798, "step": 167, "train_runtime": 400.1758, "train_tokens_per_second": 139.434 }, { "epoch": 0.007724137931034483, "grad_norm": 9.586648941040039, "learning_rate": 1.8375939849624063e-05, "loss": 0.4873974323272705, "num_input_tokens_seen": 56136, "step": 168, "train_runtime": 402.1064, "train_tokens_per_second": 139.605 }, { "epoch": 0.0077701149425287355, "grad_norm": 8.589614868164062, "learning_rate": 1.836591478696742e-05, "loss": 0.5130251049995422, "num_input_tokens_seen": 56516, "step": 169, "train_runtime": 404.0908, "train_tokens_per_second": 139.86 }, { "epoch": 0.007816091954022988, "grad_norm": 10.078131675720215, "learning_rate": 1.8355889724310777e-05, "loss": 0.5906585454940796, "num_input_tokens_seen": 56804, "step": 170, "train_runtime": 406.0306, "train_tokens_per_second": 139.901 }, { "epoch": 0.00786206896551724, "grad_norm": 9.921672821044922, "learning_rate": 1.8345864661654137e-05, "loss": 0.4799719452857971, "num_input_tokens_seen": 57094, "step": 171, "train_runtime": 407.9674, "train_tokens_per_second": 139.947 }, { "epoch": 0.007908045977011495, "grad_norm": 7.844490051269531, "learning_rate": 1.8335839598997497e-05, "loss": 0.597183346748352, "num_input_tokens_seen": 57430, "step": 172, "train_runtime": 409.9136, "train_tokens_per_second": 140.103 }, { "epoch": 0.007954022988505748, "grad_norm": 9.238640785217285, "learning_rate": 1.8325814536340854e-05, "loss": 0.4416566491127014, "num_input_tokens_seen": 57660, "step": 173, "train_runtime": 411.8262, "train_tokens_per_second": 140.011 }, { "epoch": 0.008, "grad_norm": 8.418259620666504, "learning_rate": 1.831578947368421e-05, "loss": 0.4849053621292114, "num_input_tokens_seen": 57982, "step": 174, "train_runtime": 413.7912, "train_tokens_per_second": 140.124 }, { "epoch": 0.008045977011494253, "grad_norm": 7.610781669616699, "learning_rate": 1.830576441102757e-05, "loss": 0.41063031554222107, "num_input_tokens_seen": 58264, "step": 175, "train_runtime": 415.766, "train_tokens_per_second": 140.137 }, { "epoch": 0.008091954022988505, "grad_norm": 7.702761650085449, "learning_rate": 1.8295739348370928e-05, "loss": 0.3769613802433014, "num_input_tokens_seen": 58524, "step": 176, "train_runtime": 417.77, "train_tokens_per_second": 140.087 }, { "epoch": 0.008137931034482758, "grad_norm": 9.193915367126465, "learning_rate": 1.8285714285714288e-05, "loss": 0.5968765616416931, "num_input_tokens_seen": 58908, "step": 177, "train_runtime": 419.7369, "train_tokens_per_second": 140.345 }, { "epoch": 0.008183908045977012, "grad_norm": 7.960973739624023, "learning_rate": 1.8275689223057648e-05, "loss": 0.6170963644981384, "num_input_tokens_seen": 59560, "step": 178, "train_runtime": 421.7529, "train_tokens_per_second": 141.22 }, { "epoch": 0.008229885057471265, "grad_norm": 7.9756035804748535, "learning_rate": 1.8265664160401005e-05, "loss": 0.47514936327934265, "num_input_tokens_seen": 59860, "step": 179, "train_runtime": 423.7014, "train_tokens_per_second": 141.279 }, { "epoch": 0.008275862068965517, "grad_norm": 7.550826549530029, "learning_rate": 1.825563909774436e-05, "loss": 0.4637778699398041, "num_input_tokens_seen": 60178, "step": 180, "train_runtime": 425.6629, "train_tokens_per_second": 141.375 }, { "epoch": 0.00832183908045977, "grad_norm": 8.703726768493652, "learning_rate": 1.824561403508772e-05, "loss": 0.41379302740097046, "num_input_tokens_seen": 60442, "step": 181, "train_runtime": 440.0628, "train_tokens_per_second": 137.349 }, { "epoch": 0.008367816091954023, "grad_norm": 8.947075843811035, "learning_rate": 1.823558897243108e-05, "loss": 0.46399661898612976, "num_input_tokens_seen": 60822, "step": 182, "train_runtime": 442.0168, "train_tokens_per_second": 137.601 }, { "epoch": 0.008413793103448275, "grad_norm": 9.358521461486816, "learning_rate": 1.822556390977444e-05, "loss": 0.6975663900375366, "num_input_tokens_seen": 61202, "step": 183, "train_runtime": 443.9751, "train_tokens_per_second": 137.85 }, { "epoch": 0.00845977011494253, "grad_norm": 6.9549689292907715, "learning_rate": 1.8215538847117796e-05, "loss": 0.32578420639038086, "num_input_tokens_seen": 61468, "step": 184, "train_runtime": 445.9064, "train_tokens_per_second": 137.85 }, { "epoch": 0.008505747126436782, "grad_norm": 8.928411483764648, "learning_rate": 1.8205513784461156e-05, "loss": 0.4039687514305115, "num_input_tokens_seen": 61766, "step": 185, "train_runtime": 447.8816, "train_tokens_per_second": 137.907 }, { "epoch": 0.008551724137931035, "grad_norm": 8.656428337097168, "learning_rate": 1.8195488721804512e-05, "loss": 0.5474002361297607, "num_input_tokens_seen": 62068, "step": 186, "train_runtime": 449.8232, "train_tokens_per_second": 137.983 }, { "epoch": 0.008597701149425287, "grad_norm": 7.867074012756348, "learning_rate": 1.818546365914787e-05, "loss": 0.2982150912284851, "num_input_tokens_seen": 62318, "step": 187, "train_runtime": 451.7609, "train_tokens_per_second": 137.945 }, { "epoch": 0.00864367816091954, "grad_norm": 7.8986287117004395, "learning_rate": 1.817543859649123e-05, "loss": 0.3921367824077606, "num_input_tokens_seen": 62572, "step": 188, "train_runtime": 453.6977, "train_tokens_per_second": 137.916 }, { "epoch": 0.008689655172413793, "grad_norm": 7.843879699707031, "learning_rate": 1.816541353383459e-05, "loss": 0.36684906482696533, "num_input_tokens_seen": 62842, "step": 189, "train_runtime": 455.6408, "train_tokens_per_second": 137.92 }, { "epoch": 0.008735632183908045, "grad_norm": 10.188214302062988, "learning_rate": 1.8155388471177946e-05, "loss": 0.6560608744621277, "num_input_tokens_seen": 63174, "step": 190, "train_runtime": 457.5784, "train_tokens_per_second": 138.062 }, { "epoch": 0.0087816091954023, "grad_norm": 7.0697712898254395, "learning_rate": 1.8145363408521303e-05, "loss": 0.2936539053916931, "num_input_tokens_seen": 63402, "step": 191, "train_runtime": 459.4785, "train_tokens_per_second": 137.987 }, { "epoch": 0.008827586206896552, "grad_norm": 9.822193145751953, "learning_rate": 1.8135338345864663e-05, "loss": 0.5231074690818787, "num_input_tokens_seen": 63744, "step": 192, "train_runtime": 461.4404, "train_tokens_per_second": 138.141 }, { "epoch": 0.008873563218390805, "grad_norm": 8.857881546020508, "learning_rate": 1.812531328320802e-05, "loss": 0.5226064920425415, "num_input_tokens_seen": 64048, "step": 193, "train_runtime": 463.4527, "train_tokens_per_second": 138.197 }, { "epoch": 0.008919540229885057, "grad_norm": 8.514666557312012, "learning_rate": 1.811528822055138e-05, "loss": 0.370896577835083, "num_input_tokens_seen": 64300, "step": 194, "train_runtime": 465.41, "train_tokens_per_second": 138.158 }, { "epoch": 0.00896551724137931, "grad_norm": 9.272273063659668, "learning_rate": 1.810526315789474e-05, "loss": 0.5460460186004639, "num_input_tokens_seen": 64596, "step": 195, "train_runtime": 467.3302, "train_tokens_per_second": 138.223 }, { "epoch": 0.009011494252873562, "grad_norm": 8.173891067504883, "learning_rate": 1.8095238095238097e-05, "loss": 0.43280303478240967, "num_input_tokens_seen": 64906, "step": 196, "train_runtime": 469.2914, "train_tokens_per_second": 138.306 }, { "epoch": 0.009057471264367817, "grad_norm": 9.298201560974121, "learning_rate": 1.8085213032581454e-05, "loss": 0.43618613481521606, "num_input_tokens_seen": 65220, "step": 197, "train_runtime": 471.2687, "train_tokens_per_second": 138.392 }, { "epoch": 0.00910344827586207, "grad_norm": 7.345490455627441, "learning_rate": 1.8075187969924814e-05, "loss": 0.5126155614852905, "num_input_tokens_seen": 65574, "step": 198, "train_runtime": 473.2274, "train_tokens_per_second": 138.568 }, { "epoch": 0.009149425287356322, "grad_norm": 7.111669063568115, "learning_rate": 1.806516290726817e-05, "loss": 0.2610500752925873, "num_input_tokens_seen": 65814, "step": 199, "train_runtime": 475.1321, "train_tokens_per_second": 138.517 }, { "epoch": 0.009195402298850575, "grad_norm": 8.334724426269531, "learning_rate": 1.805513784461153e-05, "loss": 0.4848451316356659, "num_input_tokens_seen": 66088, "step": 200, "train_runtime": 477.042, "train_tokens_per_second": 138.537 }, { "epoch": 0.009195402298850575, "eval_loss": 1.8940600156784058, "eval_runtime": 54.1829, "eval_samples_per_second": 18.456, "eval_steps_per_second": 9.228, "num_input_tokens_seen": 66088, "step": 200 }, { "epoch": 0.009241379310344827, "grad_norm": 9.731633186340332, "learning_rate": 1.8045112781954888e-05, "loss": 0.5664269924163818, "num_input_tokens_seen": 66364, "step": 201, "train_runtime": 533.1769, "train_tokens_per_second": 124.469 }, { "epoch": 0.00928735632183908, "grad_norm": 10.086454391479492, "learning_rate": 1.8035087719298248e-05, "loss": 0.5216547250747681, "num_input_tokens_seen": 66678, "step": 202, "train_runtime": 535.0951, "train_tokens_per_second": 124.61 }, { "epoch": 0.009333333333333334, "grad_norm": 9.126751899719238, "learning_rate": 1.8025062656641605e-05, "loss": 0.6206774115562439, "num_input_tokens_seen": 66944, "step": 203, "train_runtime": 537.0143, "train_tokens_per_second": 124.66 }, { "epoch": 0.009379310344827587, "grad_norm": 7.979254722595215, "learning_rate": 1.8015037593984962e-05, "loss": 0.39576491713523865, "num_input_tokens_seen": 67204, "step": 204, "train_runtime": 538.9277, "train_tokens_per_second": 124.699 }, { "epoch": 0.00942528735632184, "grad_norm": 9.559494972229004, "learning_rate": 1.8005012531328322e-05, "loss": 0.5241124629974365, "num_input_tokens_seen": 67520, "step": 205, "train_runtime": 540.8486, "train_tokens_per_second": 124.841 }, { "epoch": 0.009471264367816092, "grad_norm": 9.92201042175293, "learning_rate": 1.7994987468671682e-05, "loss": 0.5017831921577454, "num_input_tokens_seen": 67792, "step": 206, "train_runtime": 542.751, "train_tokens_per_second": 124.904 }, { "epoch": 0.009517241379310344, "grad_norm": 8.381772994995117, "learning_rate": 1.798496240601504e-05, "loss": 0.4413483440876007, "num_input_tokens_seen": 68060, "step": 207, "train_runtime": 544.6632, "train_tokens_per_second": 124.958 }, { "epoch": 0.009563218390804597, "grad_norm": 9.174842834472656, "learning_rate": 1.79749373433584e-05, "loss": 0.4749239683151245, "num_input_tokens_seen": 68334, "step": 208, "train_runtime": 546.5773, "train_tokens_per_second": 125.022 }, { "epoch": 0.009609195402298851, "grad_norm": 9.39853286743164, "learning_rate": 1.7964912280701756e-05, "loss": 0.45542603731155396, "num_input_tokens_seen": 68588, "step": 209, "train_runtime": 548.4819, "train_tokens_per_second": 125.051 }, { "epoch": 0.009655172413793104, "grad_norm": 9.451595306396484, "learning_rate": 1.7954887218045113e-05, "loss": 0.6160299777984619, "num_input_tokens_seen": 68944, "step": 210, "train_runtime": 550.3957, "train_tokens_per_second": 125.263 }, { "epoch": 0.009701149425287357, "grad_norm": 11.262086868286133, "learning_rate": 1.7944862155388473e-05, "loss": 0.5597932934761047, "num_input_tokens_seen": 69172, "step": 211, "train_runtime": 565.0919, "train_tokens_per_second": 122.408 }, { "epoch": 0.00974712643678161, "grad_norm": 11.364030838012695, "learning_rate": 1.7934837092731833e-05, "loss": 0.6930623650550842, "num_input_tokens_seen": 69440, "step": 212, "train_runtime": 567.0488, "train_tokens_per_second": 122.459 }, { "epoch": 0.009793103448275862, "grad_norm": 12.371257781982422, "learning_rate": 1.792481203007519e-05, "loss": 0.5638558268547058, "num_input_tokens_seen": 69754, "step": 213, "train_runtime": 568.9985, "train_tokens_per_second": 122.591 }, { "epoch": 0.009839080459770114, "grad_norm": 10.8510160446167, "learning_rate": 1.7914786967418547e-05, "loss": 0.567751407623291, "num_input_tokens_seen": 70054, "step": 214, "train_runtime": 570.9281, "train_tokens_per_second": 122.702 }, { "epoch": 0.009885057471264367, "grad_norm": 8.684098243713379, "learning_rate": 1.7904761904761907e-05, "loss": 0.5753757357597351, "num_input_tokens_seen": 70450, "step": 215, "train_runtime": 572.8701, "train_tokens_per_second": 122.977 }, { "epoch": 0.009931034482758621, "grad_norm": 9.463613510131836, "learning_rate": 1.7894736842105264e-05, "loss": 0.5026508569717407, "num_input_tokens_seen": 70746, "step": 216, "train_runtime": 574.8099, "train_tokens_per_second": 123.077 }, { "epoch": 0.009977011494252874, "grad_norm": 9.900351524353027, "learning_rate": 1.7884711779448624e-05, "loss": 0.648265540599823, "num_input_tokens_seen": 71298, "step": 217, "train_runtime": 576.7914, "train_tokens_per_second": 123.611 }, { "epoch": 0.010022988505747127, "grad_norm": 8.408405303955078, "learning_rate": 1.7874686716791984e-05, "loss": 0.5788682103157043, "num_input_tokens_seen": 71618, "step": 218, "train_runtime": 578.7088, "train_tokens_per_second": 123.755 }, { "epoch": 0.010068965517241379, "grad_norm": 8.421172142028809, "learning_rate": 1.786466165413534e-05, "loss": 0.5744531154632568, "num_input_tokens_seen": 71920, "step": 219, "train_runtime": 580.6368, "train_tokens_per_second": 123.864 }, { "epoch": 0.010114942528735632, "grad_norm": 7.934989929199219, "learning_rate": 1.7854636591478698e-05, "loss": 0.6625332832336426, "num_input_tokens_seen": 72472, "step": 220, "train_runtime": 582.6318, "train_tokens_per_second": 124.387 }, { "epoch": 0.010160919540229884, "grad_norm": 8.542694091796875, "learning_rate": 1.7844611528822054e-05, "loss": 0.580016553401947, "num_input_tokens_seen": 72848, "step": 221, "train_runtime": 584.5837, "train_tokens_per_second": 124.615 }, { "epoch": 0.010206896551724139, "grad_norm": 8.42661190032959, "learning_rate": 1.7834586466165415e-05, "loss": 0.5382593274116516, "num_input_tokens_seen": 73170, "step": 222, "train_runtime": 586.531, "train_tokens_per_second": 124.75 }, { "epoch": 0.010252873563218391, "grad_norm": 8.81701374053955, "learning_rate": 1.7824561403508775e-05, "loss": 0.41666749119758606, "num_input_tokens_seen": 73432, "step": 223, "train_runtime": 588.6068, "train_tokens_per_second": 124.756 }, { "epoch": 0.010298850574712644, "grad_norm": 9.079622268676758, "learning_rate": 1.781453634085213e-05, "loss": 0.6324032545089722, "num_input_tokens_seen": 73754, "step": 224, "train_runtime": 590.5476, "train_tokens_per_second": 124.891 }, { "epoch": 0.010344827586206896, "grad_norm": 9.136917114257812, "learning_rate": 1.7804511278195492e-05, "loss": 0.6062464118003845, "num_input_tokens_seen": 74080, "step": 225, "train_runtime": 592.4978, "train_tokens_per_second": 125.03 }, { "epoch": 0.010390804597701149, "grad_norm": 7.6709980964660645, "learning_rate": 1.779448621553885e-05, "loss": 0.44233664870262146, "num_input_tokens_seen": 74330, "step": 226, "train_runtime": 594.437, "train_tokens_per_second": 125.043 }, { "epoch": 0.010436781609195402, "grad_norm": 8.36764907836914, "learning_rate": 1.7784461152882205e-05, "loss": 0.5167356133460999, "num_input_tokens_seen": 74582, "step": 227, "train_runtime": 596.4444, "train_tokens_per_second": 125.044 }, { "epoch": 0.010482758620689656, "grad_norm": 6.792186260223389, "learning_rate": 1.7774436090225566e-05, "loss": 0.4979870915412903, "num_input_tokens_seen": 75022, "step": 228, "train_runtime": 598.4481, "train_tokens_per_second": 125.361 }, { "epoch": 0.010528735632183909, "grad_norm": 9.433555603027344, "learning_rate": 1.7764411027568926e-05, "loss": 0.5935546159744263, "num_input_tokens_seen": 75376, "step": 229, "train_runtime": 600.5684, "train_tokens_per_second": 125.508 }, { "epoch": 0.010574712643678161, "grad_norm": 8.143898010253906, "learning_rate": 1.7754385964912283e-05, "loss": 0.4781757593154907, "num_input_tokens_seen": 75634, "step": 230, "train_runtime": 602.5668, "train_tokens_per_second": 125.52 }, { "epoch": 0.010620689655172414, "grad_norm": 7.581504821777344, "learning_rate": 1.774436090225564e-05, "loss": 0.39986687898635864, "num_input_tokens_seen": 75914, "step": 231, "train_runtime": 604.489, "train_tokens_per_second": 125.584 }, { "epoch": 0.010666666666666666, "grad_norm": 8.80359935760498, "learning_rate": 1.7734335839599e-05, "loss": 0.4914165139198303, "num_input_tokens_seen": 76178, "step": 232, "train_runtime": 606.4381, "train_tokens_per_second": 125.615 }, { "epoch": 0.010712643678160919, "grad_norm": 8.052352905273438, "learning_rate": 1.7724310776942356e-05, "loss": 0.5605274438858032, "num_input_tokens_seen": 76612, "step": 233, "train_runtime": 608.4309, "train_tokens_per_second": 125.917 }, { "epoch": 0.010758620689655173, "grad_norm": 7.698636531829834, "learning_rate": 1.7714285714285717e-05, "loss": 0.31394222378730774, "num_input_tokens_seen": 76950, "step": 234, "train_runtime": 610.4578, "train_tokens_per_second": 126.053 }, { "epoch": 0.010804597701149426, "grad_norm": 8.41732120513916, "learning_rate": 1.7704260651629073e-05, "loss": 0.5563385486602783, "num_input_tokens_seen": 77250, "step": 235, "train_runtime": 612.4796, "train_tokens_per_second": 126.127 }, { "epoch": 0.010850574712643678, "grad_norm": 9.47237777709961, "learning_rate": 1.7694235588972433e-05, "loss": 0.6081884503364563, "num_input_tokens_seen": 77526, "step": 236, "train_runtime": 614.459, "train_tokens_per_second": 126.17 }, { "epoch": 0.010896551724137931, "grad_norm": 8.935263633728027, "learning_rate": 1.768421052631579e-05, "loss": 0.6447509527206421, "num_input_tokens_seen": 77850, "step": 237, "train_runtime": 616.4103, "train_tokens_per_second": 126.296 }, { "epoch": 0.010942528735632184, "grad_norm": 10.19480037689209, "learning_rate": 1.767418546365915e-05, "loss": 0.47084376215934753, "num_input_tokens_seen": 78160, "step": 238, "train_runtime": 618.3501, "train_tokens_per_second": 126.401 }, { "epoch": 0.010988505747126436, "grad_norm": 7.387281894683838, "learning_rate": 1.7664160401002507e-05, "loss": 0.41510701179504395, "num_input_tokens_seen": 78438, "step": 239, "train_runtime": 620.2698, "train_tokens_per_second": 126.458 }, { "epoch": 0.011034482758620689, "grad_norm": 8.466607093811035, "learning_rate": 1.7654135338345867e-05, "loss": 0.4125990867614746, "num_input_tokens_seen": 78710, "step": 240, "train_runtime": 622.196, "train_tokens_per_second": 126.504 }, { "epoch": 0.011080459770114943, "grad_norm": 9.628037452697754, "learning_rate": 1.7644110275689224e-05, "loss": 0.5155237317085266, "num_input_tokens_seen": 79176, "step": 241, "train_runtime": 637.8479, "train_tokens_per_second": 124.13 }, { "epoch": 0.011126436781609196, "grad_norm": 7.532957077026367, "learning_rate": 1.7634085213032584e-05, "loss": 0.5341253280639648, "num_input_tokens_seen": 79764, "step": 242, "train_runtime": 639.8913, "train_tokens_per_second": 124.652 }, { "epoch": 0.011172413793103448, "grad_norm": 7.834677696228027, "learning_rate": 1.762406015037594e-05, "loss": 0.5943319797515869, "num_input_tokens_seen": 80424, "step": 243, "train_runtime": 642.1863, "train_tokens_per_second": 125.235 }, { "epoch": 0.011218390804597701, "grad_norm": 8.330830574035645, "learning_rate": 1.7614035087719298e-05, "loss": 0.6359134912490845, "num_input_tokens_seen": 80886, "step": 244, "train_runtime": 644.3059, "train_tokens_per_second": 125.54 }, { "epoch": 0.011264367816091954, "grad_norm": 7.60586404800415, "learning_rate": 1.7604010025062658e-05, "loss": 0.39419102668762207, "num_input_tokens_seen": 81144, "step": 245, "train_runtime": 646.2392, "train_tokens_per_second": 125.563 }, { "epoch": 0.011310344827586206, "grad_norm": 8.247746467590332, "learning_rate": 1.7593984962406015e-05, "loss": 0.38935500383377075, "num_input_tokens_seen": 81372, "step": 246, "train_runtime": 648.145, "train_tokens_per_second": 125.546 }, { "epoch": 0.01135632183908046, "grad_norm": 10.329381942749023, "learning_rate": 1.7583959899749375e-05, "loss": 0.47521886229515076, "num_input_tokens_seen": 81656, "step": 247, "train_runtime": 650.0725, "train_tokens_per_second": 125.611 }, { "epoch": 0.011402298850574713, "grad_norm": 8.573349952697754, "learning_rate": 1.7573934837092735e-05, "loss": 0.5382678508758545, "num_input_tokens_seen": 81930, "step": 248, "train_runtime": 652.0055, "train_tokens_per_second": 125.658 }, { "epoch": 0.011448275862068966, "grad_norm": 9.41952133178711, "learning_rate": 1.7563909774436092e-05, "loss": 0.4593239426612854, "num_input_tokens_seen": 82202, "step": 249, "train_runtime": 653.9525, "train_tokens_per_second": 125.7 }, { "epoch": 0.011494252873563218, "grad_norm": 7.771377086639404, "learning_rate": 1.755388471177945e-05, "loss": 0.4767267107963562, "num_input_tokens_seen": 82492, "step": 250, "train_runtime": 655.9119, "train_tokens_per_second": 125.767 }, { "epoch": 0.01154022988505747, "grad_norm": 8.981367111206055, "learning_rate": 1.754385964912281e-05, "loss": 0.5896744132041931, "num_input_tokens_seen": 82810, "step": 251, "train_runtime": 657.9051, "train_tokens_per_second": 125.869 }, { "epoch": 0.011586206896551723, "grad_norm": 8.728583335876465, "learning_rate": 1.7533834586466166e-05, "loss": 0.5037809014320374, "num_input_tokens_seen": 83116, "step": 252, "train_runtime": 659.8608, "train_tokens_per_second": 125.96 }, { "epoch": 0.011632183908045978, "grad_norm": 7.11443567276001, "learning_rate": 1.7523809523809526e-05, "loss": 0.4327583909034729, "num_input_tokens_seen": 83444, "step": 253, "train_runtime": 661.7819, "train_tokens_per_second": 126.09 }, { "epoch": 0.01167816091954023, "grad_norm": 8.682472229003906, "learning_rate": 1.7513784461152883e-05, "loss": 0.44737380743026733, "num_input_tokens_seen": 83728, "step": 254, "train_runtime": 663.7561, "train_tokens_per_second": 126.143 }, { "epoch": 0.011724137931034483, "grad_norm": 8.399706840515137, "learning_rate": 1.7503759398496243e-05, "loss": 0.5722436904907227, "num_input_tokens_seen": 84356, "step": 255, "train_runtime": 665.8361, "train_tokens_per_second": 126.692 }, { "epoch": 0.011770114942528736, "grad_norm": 7.891780853271484, "learning_rate": 1.74937343358396e-05, "loss": 0.42720746994018555, "num_input_tokens_seen": 84672, "step": 256, "train_runtime": 667.7623, "train_tokens_per_second": 126.8 }, { "epoch": 0.011816091954022988, "grad_norm": 9.670726776123047, "learning_rate": 1.7483709273182957e-05, "loss": 0.4248063862323761, "num_input_tokens_seen": 84942, "step": 257, "train_runtime": 669.7404, "train_tokens_per_second": 126.828 }, { "epoch": 0.01186206896551724, "grad_norm": 7.518779277801514, "learning_rate": 1.7473684210526317e-05, "loss": 0.44924628734588623, "num_input_tokens_seen": 85242, "step": 258, "train_runtime": 671.6717, "train_tokens_per_second": 126.91 }, { "epoch": 0.011908045977011495, "grad_norm": 7.856861591339111, "learning_rate": 1.7463659147869677e-05, "loss": 0.43991750478744507, "num_input_tokens_seen": 85640, "step": 259, "train_runtime": 673.6511, "train_tokens_per_second": 127.128 }, { "epoch": 0.011954022988505748, "grad_norm": 8.80428409576416, "learning_rate": 1.7453634085213034e-05, "loss": 0.5700347423553467, "num_input_tokens_seen": 86002, "step": 260, "train_runtime": 675.5867, "train_tokens_per_second": 127.3 }, { "epoch": 0.012, "grad_norm": 7.360157012939453, "learning_rate": 1.744360902255639e-05, "loss": 0.37258443236351013, "num_input_tokens_seen": 86264, "step": 261, "train_runtime": 677.6028, "train_tokens_per_second": 127.308 }, { "epoch": 0.012045977011494253, "grad_norm": 8.775689125061035, "learning_rate": 1.743358395989975e-05, "loss": 0.5349915623664856, "num_input_tokens_seen": 86546, "step": 262, "train_runtime": 679.5822, "train_tokens_per_second": 127.352 }, { "epoch": 0.012091954022988505, "grad_norm": 7.555972576141357, "learning_rate": 1.7423558897243108e-05, "loss": 0.438320517539978, "num_input_tokens_seen": 86822, "step": 263, "train_runtime": 681.6542, "train_tokens_per_second": 127.37 }, { "epoch": 0.012137931034482758, "grad_norm": 7.634513854980469, "learning_rate": 1.7413533834586468e-05, "loss": 0.45846620202064514, "num_input_tokens_seen": 87164, "step": 264, "train_runtime": 683.6555, "train_tokens_per_second": 127.497 }, { "epoch": 0.01218390804597701, "grad_norm": 7.4254350662231445, "learning_rate": 1.7403508771929828e-05, "loss": 0.4867999255657196, "num_input_tokens_seen": 87676, "step": 265, "train_runtime": 685.6908, "train_tokens_per_second": 127.865 }, { "epoch": 0.012229885057471265, "grad_norm": 7.971969127655029, "learning_rate": 1.7393483709273185e-05, "loss": 0.45510679483413696, "num_input_tokens_seen": 87938, "step": 266, "train_runtime": 687.6036, "train_tokens_per_second": 127.891 }, { "epoch": 0.012275862068965518, "grad_norm": 9.114470481872559, "learning_rate": 1.738345864661654e-05, "loss": 0.3985937237739563, "num_input_tokens_seen": 88246, "step": 267, "train_runtime": 689.5433, "train_tokens_per_second": 127.977 }, { "epoch": 0.01232183908045977, "grad_norm": 7.794116020202637, "learning_rate": 1.7373433583959902e-05, "loss": 0.5491940379142761, "num_input_tokens_seen": 88640, "step": 268, "train_runtime": 691.516, "train_tokens_per_second": 128.182 }, { "epoch": 0.012367816091954023, "grad_norm": 6.931571960449219, "learning_rate": 1.736340852130326e-05, "loss": 0.476431667804718, "num_input_tokens_seen": 88986, "step": 269, "train_runtime": 693.4528, "train_tokens_per_second": 128.323 }, { "epoch": 0.012413793103448275, "grad_norm": 9.618606567382812, "learning_rate": 1.735338345864662e-05, "loss": 0.5247324705123901, "num_input_tokens_seen": 89268, "step": 270, "train_runtime": 695.4365, "train_tokens_per_second": 128.363 }, { "epoch": 0.012459770114942528, "grad_norm": 5.826930999755859, "learning_rate": 1.7343358395989975e-05, "loss": 0.317282497882843, "num_input_tokens_seen": 89584, "step": 271, "train_runtime": 711.4524, "train_tokens_per_second": 125.917 }, { "epoch": 0.012505747126436782, "grad_norm": 8.20704460144043, "learning_rate": 1.7333333333333336e-05, "loss": 0.6090211272239685, "num_input_tokens_seen": 89970, "step": 272, "train_runtime": 713.6346, "train_tokens_per_second": 126.073 }, { "epoch": 0.012551724137931035, "grad_norm": 9.9144868850708, "learning_rate": 1.7323308270676692e-05, "loss": 0.47073376178741455, "num_input_tokens_seen": 90290, "step": 273, "train_runtime": 715.5598, "train_tokens_per_second": 126.181 }, { "epoch": 0.012597701149425287, "grad_norm": 8.592867851257324, "learning_rate": 1.731328320802005e-05, "loss": 0.4184023439884186, "num_input_tokens_seen": 90638, "step": 274, "train_runtime": 717.6489, "train_tokens_per_second": 126.299 }, { "epoch": 0.01264367816091954, "grad_norm": 8.979439735412598, "learning_rate": 1.730325814536341e-05, "loss": 0.6420491337776184, "num_input_tokens_seen": 91084, "step": 275, "train_runtime": 719.6293, "train_tokens_per_second": 126.571 }, { "epoch": 0.012689655172413793, "grad_norm": 9.092283248901367, "learning_rate": 1.729323308270677e-05, "loss": 0.5877478122711182, "num_input_tokens_seen": 91372, "step": 276, "train_runtime": 721.5768, "train_tokens_per_second": 126.628 }, { "epoch": 0.012735632183908045, "grad_norm": 8.461853981018066, "learning_rate": 1.7283208020050126e-05, "loss": 0.4582377076148987, "num_input_tokens_seen": 91686, "step": 277, "train_runtime": 723.5234, "train_tokens_per_second": 126.722 }, { "epoch": 0.0127816091954023, "grad_norm": 8.02602767944336, "learning_rate": 1.7273182957393487e-05, "loss": 0.37842997908592224, "num_input_tokens_seen": 91922, "step": 278, "train_runtime": 725.4315, "train_tokens_per_second": 126.714 }, { "epoch": 0.012827586206896552, "grad_norm": 9.255718231201172, "learning_rate": 1.7263157894736843e-05, "loss": 0.4739605784416199, "num_input_tokens_seen": 92214, "step": 279, "train_runtime": 727.3498, "train_tokens_per_second": 126.781 }, { "epoch": 0.012873563218390805, "grad_norm": 7.671210765838623, "learning_rate": 1.72531328320802e-05, "loss": 0.49289393424987793, "num_input_tokens_seen": 92466, "step": 280, "train_runtime": 729.2645, "train_tokens_per_second": 126.794 }, { "epoch": 0.012919540229885057, "grad_norm": 9.932632446289062, "learning_rate": 1.724310776942356e-05, "loss": 0.6571778059005737, "num_input_tokens_seen": 92786, "step": 281, "train_runtime": 731.2261, "train_tokens_per_second": 126.891 }, { "epoch": 0.01296551724137931, "grad_norm": 8.414435386657715, "learning_rate": 1.723308270676692e-05, "loss": 0.44216346740722656, "num_input_tokens_seen": 93148, "step": 282, "train_runtime": 733.235, "train_tokens_per_second": 127.037 }, { "epoch": 0.013011494252873563, "grad_norm": 7.832511901855469, "learning_rate": 1.7223057644110277e-05, "loss": 0.46839600801467896, "num_input_tokens_seen": 93472, "step": 283, "train_runtime": 735.225, "train_tokens_per_second": 127.134 }, { "epoch": 0.013057471264367817, "grad_norm": 7.626879692077637, "learning_rate": 1.7213032581453634e-05, "loss": 0.5550291538238525, "num_input_tokens_seen": 93986, "step": 284, "train_runtime": 737.2216, "train_tokens_per_second": 127.487 }, { "epoch": 0.01310344827586207, "grad_norm": 7.270344257354736, "learning_rate": 1.7203007518796994e-05, "loss": 0.43810874223709106, "num_input_tokens_seen": 94284, "step": 285, "train_runtime": 739.1505, "train_tokens_per_second": 127.557 }, { "epoch": 0.013149425287356322, "grad_norm": 6.669817924499512, "learning_rate": 1.719298245614035e-05, "loss": 0.41238388419151306, "num_input_tokens_seen": 94694, "step": 286, "train_runtime": 741.1069, "train_tokens_per_second": 127.774 }, { "epoch": 0.013195402298850575, "grad_norm": 9.237834930419922, "learning_rate": 1.718295739348371e-05, "loss": 0.551144540309906, "num_input_tokens_seen": 94988, "step": 287, "train_runtime": 743.0385, "train_tokens_per_second": 127.837 }, { "epoch": 0.013241379310344827, "grad_norm": 7.017147064208984, "learning_rate": 1.717293233082707e-05, "loss": 0.5644881129264832, "num_input_tokens_seen": 95292, "step": 288, "train_runtime": 744.9691, "train_tokens_per_second": 127.914 }, { "epoch": 0.01328735632183908, "grad_norm": 9.167874336242676, "learning_rate": 1.7162907268170428e-05, "loss": 0.47601842880249023, "num_input_tokens_seen": 95566, "step": 289, "train_runtime": 746.8893, "train_tokens_per_second": 127.952 }, { "epoch": 0.013333333333333334, "grad_norm": 7.763336658477783, "learning_rate": 1.7152882205513785e-05, "loss": 0.6520231366157532, "num_input_tokens_seen": 96018, "step": 290, "train_runtime": 748.8527, "train_tokens_per_second": 128.22 }, { "epoch": 0.013379310344827587, "grad_norm": 13.905603408813477, "learning_rate": 1.7142857142857142e-05, "loss": 0.4207511246204376, "num_input_tokens_seen": 96266, "step": 291, "train_runtime": 750.7788, "train_tokens_per_second": 128.222 }, { "epoch": 0.01342528735632184, "grad_norm": 7.5040507316589355, "learning_rate": 1.7132832080200502e-05, "loss": 0.4394516944885254, "num_input_tokens_seen": 96552, "step": 292, "train_runtime": 752.6971, "train_tokens_per_second": 128.275 }, { "epoch": 0.013471264367816092, "grad_norm": 7.481922626495361, "learning_rate": 1.7122807017543862e-05, "loss": 0.33811718225479126, "num_input_tokens_seen": 96764, "step": 293, "train_runtime": 754.6065, "train_tokens_per_second": 128.231 }, { "epoch": 0.013517241379310345, "grad_norm": 7.259603977203369, "learning_rate": 1.711278195488722e-05, "loss": 0.42554327845573425, "num_input_tokens_seen": 97044, "step": 294, "train_runtime": 756.5344, "train_tokens_per_second": 128.274 }, { "epoch": 0.013563218390804597, "grad_norm": 10.953673362731934, "learning_rate": 1.710275689223058e-05, "loss": 0.4624016284942627, "num_input_tokens_seen": 97312, "step": 295, "train_runtime": 758.457, "train_tokens_per_second": 128.303 }, { "epoch": 0.01360919540229885, "grad_norm": 8.060202598571777, "learning_rate": 1.7092731829573936e-05, "loss": 0.5388157367706299, "num_input_tokens_seen": 97582, "step": 296, "train_runtime": 760.3841, "train_tokens_per_second": 128.333 }, { "epoch": 0.013655172413793104, "grad_norm": 8.586666107177734, "learning_rate": 1.7082706766917293e-05, "loss": 0.49518680572509766, "num_input_tokens_seen": 97874, "step": 297, "train_runtime": 762.3113, "train_tokens_per_second": 128.391 }, { "epoch": 0.013701149425287357, "grad_norm": 8.171697616577148, "learning_rate": 1.7072681704260653e-05, "loss": 0.5041380524635315, "num_input_tokens_seen": 98134, "step": 298, "train_runtime": 764.2276, "train_tokens_per_second": 128.409 }, { "epoch": 0.01374712643678161, "grad_norm": 8.097844123840332, "learning_rate": 1.7062656641604013e-05, "loss": 0.4328901767730713, "num_input_tokens_seen": 98426, "step": 299, "train_runtime": 766.1514, "train_tokens_per_second": 128.468 }, { "epoch": 0.013793103448275862, "grad_norm": 10.759598731994629, "learning_rate": 1.705263157894737e-05, "loss": 0.378260999917984, "num_input_tokens_seen": 98770, "step": 300, "train_runtime": 768.0928, "train_tokens_per_second": 128.591 }, { "epoch": 0.013839080459770114, "grad_norm": 8.365592956542969, "learning_rate": 1.7042606516290727e-05, "loss": 0.6392844319343567, "num_input_tokens_seen": 99046, "step": 301, "train_runtime": 783.4775, "train_tokens_per_second": 126.418 }, { "epoch": 0.013885057471264367, "grad_norm": 8.994288444519043, "learning_rate": 1.7032581453634087e-05, "loss": 0.5737530589103699, "num_input_tokens_seen": 99326, "step": 302, "train_runtime": 785.3924, "train_tokens_per_second": 126.467 }, { "epoch": 0.013931034482758621, "grad_norm": 7.944206237792969, "learning_rate": 1.7022556390977444e-05, "loss": 0.4733693301677704, "num_input_tokens_seen": 99582, "step": 303, "train_runtime": 787.2968, "train_tokens_per_second": 126.486 }, { "epoch": 0.013977011494252874, "grad_norm": 10.713095664978027, "learning_rate": 1.7012531328320804e-05, "loss": 0.41429686546325684, "num_input_tokens_seen": 99890, "step": 304, "train_runtime": 789.2387, "train_tokens_per_second": 126.565 }, { "epoch": 0.014022988505747127, "grad_norm": 8.32962703704834, "learning_rate": 1.7002506265664164e-05, "loss": 0.4429081678390503, "num_input_tokens_seen": 100146, "step": 305, "train_runtime": 791.1459, "train_tokens_per_second": 126.583 }, { "epoch": 0.01406896551724138, "grad_norm": 8.988188743591309, "learning_rate": 1.699248120300752e-05, "loss": 0.5631526708602905, "num_input_tokens_seen": 100492, "step": 306, "train_runtime": 793.0648, "train_tokens_per_second": 126.713 }, { "epoch": 0.014114942528735632, "grad_norm": 7.367366313934326, "learning_rate": 1.6982456140350878e-05, "loss": 0.5590333342552185, "num_input_tokens_seen": 100898, "step": 307, "train_runtime": 795.0135, "train_tokens_per_second": 126.914 }, { "epoch": 0.014160919540229884, "grad_norm": 9.300395965576172, "learning_rate": 1.6972431077694238e-05, "loss": 0.4675888419151306, "num_input_tokens_seen": 101212, "step": 308, "train_runtime": 796.9417, "train_tokens_per_second": 127.001 }, { "epoch": 0.014206896551724139, "grad_norm": 9.40662956237793, "learning_rate": 1.6962406015037595e-05, "loss": 0.48680806159973145, "num_input_tokens_seen": 101478, "step": 309, "train_runtime": 798.8809, "train_tokens_per_second": 127.025 }, { "epoch": 0.014252873563218391, "grad_norm": 8.786764144897461, "learning_rate": 1.6952380952380955e-05, "loss": 0.4684376120567322, "num_input_tokens_seen": 101804, "step": 310, "train_runtime": 800.8359, "train_tokens_per_second": 127.122 }, { "epoch": 0.014298850574712644, "grad_norm": 8.8251314163208, "learning_rate": 1.694235588972431e-05, "loss": 0.5090711712837219, "num_input_tokens_seen": 102078, "step": 311, "train_runtime": 802.8359, "train_tokens_per_second": 127.147 }, { "epoch": 0.014344827586206896, "grad_norm": 9.90039348602295, "learning_rate": 1.6932330827067672e-05, "loss": 0.4405490458011627, "num_input_tokens_seen": 102402, "step": 312, "train_runtime": 804.7714, "train_tokens_per_second": 127.244 }, { "epoch": 0.014390804597701149, "grad_norm": 9.395299911499023, "learning_rate": 1.692230576441103e-05, "loss": 0.520408570766449, "num_input_tokens_seen": 102676, "step": 313, "train_runtime": 806.7197, "train_tokens_per_second": 127.276 }, { "epoch": 0.014436781609195402, "grad_norm": 7.501882553100586, "learning_rate": 1.6912280701754385e-05, "loss": 0.4870721101760864, "num_input_tokens_seen": 103136, "step": 314, "train_runtime": 808.8103, "train_tokens_per_second": 127.516 }, { "epoch": 0.014482758620689656, "grad_norm": 9.068699836730957, "learning_rate": 1.6902255639097746e-05, "loss": 0.5614039301872253, "num_input_tokens_seen": 103436, "step": 315, "train_runtime": 810.7864, "train_tokens_per_second": 127.575 }, { "epoch": 0.014528735632183909, "grad_norm": 9.348381996154785, "learning_rate": 1.6892230576441106e-05, "loss": 0.6185885667800903, "num_input_tokens_seen": 103808, "step": 316, "train_runtime": 812.7838, "train_tokens_per_second": 127.719 }, { "epoch": 0.014574712643678161, "grad_norm": 8.946013450622559, "learning_rate": 1.6882205513784463e-05, "loss": 0.643990159034729, "num_input_tokens_seen": 104166, "step": 317, "train_runtime": 814.7717, "train_tokens_per_second": 127.847 }, { "epoch": 0.014620689655172414, "grad_norm": 7.907708168029785, "learning_rate": 1.6872180451127823e-05, "loss": 0.37308964133262634, "num_input_tokens_seen": 104450, "step": 318, "train_runtime": 816.7446, "train_tokens_per_second": 127.886 }, { "epoch": 0.014666666666666666, "grad_norm": 9.479870796203613, "learning_rate": 1.686215538847118e-05, "loss": 0.5713379383087158, "num_input_tokens_seen": 104776, "step": 319, "train_runtime": 818.7124, "train_tokens_per_second": 127.977 }, { "epoch": 0.014712643678160919, "grad_norm": 6.283615589141846, "learning_rate": 1.6852130325814536e-05, "loss": 0.3166767954826355, "num_input_tokens_seen": 105032, "step": 320, "train_runtime": 820.6333, "train_tokens_per_second": 127.989 }, { "epoch": 0.014758620689655172, "grad_norm": 7.925952434539795, "learning_rate": 1.6842105263157896e-05, "loss": 0.44178274273872375, "num_input_tokens_seen": 105318, "step": 321, "train_runtime": 822.5648, "train_tokens_per_second": 128.036 }, { "epoch": 0.014804597701149426, "grad_norm": 8.26136589050293, "learning_rate": 1.6832080200501257e-05, "loss": 0.544378936290741, "num_input_tokens_seen": 105596, "step": 322, "train_runtime": 824.4826, "train_tokens_per_second": 128.075 }, { "epoch": 0.014850574712643679, "grad_norm": 9.990446090698242, "learning_rate": 1.6822055137844613e-05, "loss": 0.610353410243988, "num_input_tokens_seen": 105872, "step": 323, "train_runtime": 826.437, "train_tokens_per_second": 128.107 }, { "epoch": 0.014896551724137931, "grad_norm": 7.083834171295166, "learning_rate": 1.681203007518797e-05, "loss": 0.3682815730571747, "num_input_tokens_seen": 106104, "step": 324, "train_runtime": 828.4051, "train_tokens_per_second": 128.082 }, { "epoch": 0.014942528735632184, "grad_norm": 7.654078483581543, "learning_rate": 1.680200501253133e-05, "loss": 0.35451170802116394, "num_input_tokens_seen": 106348, "step": 325, "train_runtime": 830.3205, "train_tokens_per_second": 128.081 }, { "epoch": 0.014988505747126436, "grad_norm": 7.1275634765625, "learning_rate": 1.6791979949874687e-05, "loss": 0.44117680191993713, "num_input_tokens_seen": 106656, "step": 326, "train_runtime": 832.2674, "train_tokens_per_second": 128.151 }, { "epoch": 0.015034482758620689, "grad_norm": 11.717792510986328, "learning_rate": 1.6781954887218047e-05, "loss": 0.5222866535186768, "num_input_tokens_seen": 106952, "step": 327, "train_runtime": 834.2345, "train_tokens_per_second": 128.204 }, { "epoch": 0.015080459770114943, "grad_norm": 8.47635555267334, "learning_rate": 1.6771929824561408e-05, "loss": 0.556428849697113, "num_input_tokens_seen": 107250, "step": 328, "train_runtime": 836.2166, "train_tokens_per_second": 128.256 }, { "epoch": 0.015126436781609196, "grad_norm": 9.061455726623535, "learning_rate": 1.6761904761904764e-05, "loss": 0.6142518520355225, "num_input_tokens_seen": 107688, "step": 329, "train_runtime": 838.2193, "train_tokens_per_second": 128.472 }, { "epoch": 0.015172413793103448, "grad_norm": 7.577719211578369, "learning_rate": 1.675187969924812e-05, "loss": 0.44597262144088745, "num_input_tokens_seen": 108310, "step": 330, "train_runtime": 840.2549, "train_tokens_per_second": 128.901 }, { "epoch": 0.015218390804597701, "grad_norm": 8.179983139038086, "learning_rate": 1.6741854636591478e-05, "loss": 0.45987093448638916, "num_input_tokens_seen": 108608, "step": 331, "train_runtime": 855.6631, "train_tokens_per_second": 126.928 }, { "epoch": 0.015264367816091954, "grad_norm": 8.76684856414795, "learning_rate": 1.6731829573934838e-05, "loss": 0.47345876693725586, "num_input_tokens_seen": 108880, "step": 332, "train_runtime": 857.7949, "train_tokens_per_second": 126.93 }, { "epoch": 0.015310344827586206, "grad_norm": 9.098061561584473, "learning_rate": 1.67218045112782e-05, "loss": 0.4772406816482544, "num_input_tokens_seen": 109184, "step": 333, "train_runtime": 859.9185, "train_tokens_per_second": 126.97 }, { "epoch": 0.01535632183908046, "grad_norm": 10.331489562988281, "learning_rate": 1.6711779448621555e-05, "loss": 0.6067453026771545, "num_input_tokens_seen": 109548, "step": 334, "train_runtime": 861.9056, "train_tokens_per_second": 127.1 }, { "epoch": 0.015402298850574713, "grad_norm": 8.581093788146973, "learning_rate": 1.6701754385964915e-05, "loss": 0.36510738730430603, "num_input_tokens_seen": 109778, "step": 335, "train_runtime": 863.8217, "train_tokens_per_second": 127.084 }, { "epoch": 0.015448275862068966, "grad_norm": 8.387250900268555, "learning_rate": 1.6691729323308272e-05, "loss": 0.5398239493370056, "num_input_tokens_seen": 110126, "step": 336, "train_runtime": 865.7672, "train_tokens_per_second": 127.2 }, { "epoch": 0.015494252873563218, "grad_norm": 8.926971435546875, "learning_rate": 1.668170426065163e-05, "loss": 0.4762512147426605, "num_input_tokens_seen": 110434, "step": 337, "train_runtime": 867.7732, "train_tokens_per_second": 127.261 }, { "epoch": 0.015540229885057471, "grad_norm": 7.646859169006348, "learning_rate": 1.667167919799499e-05, "loss": 0.4378516674041748, "num_input_tokens_seen": 110776, "step": 338, "train_runtime": 869.7589, "train_tokens_per_second": 127.364 }, { "epoch": 0.015586206896551724, "grad_norm": 8.107491493225098, "learning_rate": 1.666165413533835e-05, "loss": 0.5538474917411804, "num_input_tokens_seen": 111070, "step": 339, "train_runtime": 871.7858, "train_tokens_per_second": 127.405 }, { "epoch": 0.015632183908045976, "grad_norm": 11.101648330688477, "learning_rate": 1.6651629072681706e-05, "loss": 0.6063014268875122, "num_input_tokens_seen": 111402, "step": 340, "train_runtime": 873.7629, "train_tokens_per_second": 127.497 }, { "epoch": 0.01567816091954023, "grad_norm": 9.16617488861084, "learning_rate": 1.6641604010025063e-05, "loss": 0.5937843918800354, "num_input_tokens_seen": 111790, "step": 341, "train_runtime": 875.6943, "train_tokens_per_second": 127.659 }, { "epoch": 0.01572413793103448, "grad_norm": 7.617735862731934, "learning_rate": 1.6631578947368423e-05, "loss": 0.39564117789268494, "num_input_tokens_seen": 112048, "step": 342, "train_runtime": 877.6145, "train_tokens_per_second": 127.673 }, { "epoch": 0.015770114942528737, "grad_norm": 8.599608421325684, "learning_rate": 1.662155388471178e-05, "loss": 0.5022115707397461, "num_input_tokens_seen": 112352, "step": 343, "train_runtime": 879.5625, "train_tokens_per_second": 127.736 }, { "epoch": 0.01581609195402299, "grad_norm": 8.8609037399292, "learning_rate": 1.661152882205514e-05, "loss": 0.39528289437294006, "num_input_tokens_seen": 112638, "step": 344, "train_runtime": 881.4772, "train_tokens_per_second": 127.783 }, { "epoch": 0.015862068965517243, "grad_norm": 8.134845733642578, "learning_rate": 1.6601503759398497e-05, "loss": 0.5726451277732849, "num_input_tokens_seen": 112888, "step": 345, "train_runtime": 883.3984, "train_tokens_per_second": 127.788 }, { "epoch": 0.015908045977011495, "grad_norm": 6.8687286376953125, "learning_rate": 1.6591478696741857e-05, "loss": 0.3758698105812073, "num_input_tokens_seen": 113156, "step": 346, "train_runtime": 885.4027, "train_tokens_per_second": 127.802 }, { "epoch": 0.015954022988505748, "grad_norm": 7.754480361938477, "learning_rate": 1.6581453634085214e-05, "loss": 0.4603171944618225, "num_input_tokens_seen": 113532, "step": 347, "train_runtime": 887.3867, "train_tokens_per_second": 127.94 }, { "epoch": 0.016, "grad_norm": 8.390192985534668, "learning_rate": 1.6571428571428574e-05, "loss": 0.505501925945282, "num_input_tokens_seen": 113836, "step": 348, "train_runtime": 889.3595, "train_tokens_per_second": 127.998 }, { "epoch": 0.016045977011494253, "grad_norm": 7.221319198608398, "learning_rate": 1.656140350877193e-05, "loss": 0.475628137588501, "num_input_tokens_seen": 114130, "step": 349, "train_runtime": 891.4636, "train_tokens_per_second": 128.025 }, { "epoch": 0.016091954022988506, "grad_norm": 8.97022819519043, "learning_rate": 1.655137844611529e-05, "loss": 0.44890573620796204, "num_input_tokens_seen": 114394, "step": 350, "train_runtime": 893.4071, "train_tokens_per_second": 128.042 }, { "epoch": 0.016137931034482758, "grad_norm": 10.288277626037598, "learning_rate": 1.6541353383458648e-05, "loss": 0.6184815168380737, "num_input_tokens_seen": 114748, "step": 351, "train_runtime": 895.3702, "train_tokens_per_second": 128.157 }, { "epoch": 0.01618390804597701, "grad_norm": 8.24072551727295, "learning_rate": 1.6531328320802008e-05, "loss": 0.5375922322273254, "num_input_tokens_seen": 115160, "step": 352, "train_runtime": 897.3642, "train_tokens_per_second": 128.331 }, { "epoch": 0.016229885057471263, "grad_norm": 8.401235580444336, "learning_rate": 1.6521303258145365e-05, "loss": 0.5189110636711121, "num_input_tokens_seen": 115512, "step": 353, "train_runtime": 899.3421, "train_tokens_per_second": 128.441 }, { "epoch": 0.016275862068965516, "grad_norm": 8.033496856689453, "learning_rate": 1.651127819548872e-05, "loss": 0.42611074447631836, "num_input_tokens_seen": 115792, "step": 354, "train_runtime": 901.273, "train_tokens_per_second": 128.476 }, { "epoch": 0.01632183908045977, "grad_norm": 8.075447082519531, "learning_rate": 1.650125313283208e-05, "loss": 0.5030648708343506, "num_input_tokens_seen": 116042, "step": 355, "train_runtime": 903.1993, "train_tokens_per_second": 128.479 }, { "epoch": 0.016367816091954025, "grad_norm": 8.209312438964844, "learning_rate": 1.649122807017544e-05, "loss": 0.4906337857246399, "num_input_tokens_seen": 116326, "step": 356, "train_runtime": 905.1097, "train_tokens_per_second": 128.521 }, { "epoch": 0.016413793103448277, "grad_norm": 8.38083553314209, "learning_rate": 1.64812030075188e-05, "loss": 0.39616087079048157, "num_input_tokens_seen": 116580, "step": 357, "train_runtime": 907.0758, "train_tokens_per_second": 128.523 }, { "epoch": 0.01645977011494253, "grad_norm": 7.717851638793945, "learning_rate": 1.647117794486216e-05, "loss": 0.5361239314079285, "num_input_tokens_seen": 117006, "step": 358, "train_runtime": 909.1606, "train_tokens_per_second": 128.697 }, { "epoch": 0.016505747126436782, "grad_norm": 7.047603130340576, "learning_rate": 1.6461152882205516e-05, "loss": 0.46394774317741394, "num_input_tokens_seen": 117400, "step": 359, "train_runtime": 911.1297, "train_tokens_per_second": 128.851 }, { "epoch": 0.016551724137931035, "grad_norm": 8.65599250793457, "learning_rate": 1.6451127819548872e-05, "loss": 0.5242359638214111, "num_input_tokens_seen": 117698, "step": 360, "train_runtime": 913.0502, "train_tokens_per_second": 128.906 }, { "epoch": 0.016597701149425288, "grad_norm": 8.625332832336426, "learning_rate": 1.6441102756892233e-05, "loss": 0.5002393126487732, "num_input_tokens_seen": 117944, "step": 361, "train_runtime": 928.4831, "train_tokens_per_second": 127.029 }, { "epoch": 0.01664367816091954, "grad_norm": 8.352180480957031, "learning_rate": 1.643107769423559e-05, "loss": 0.5270761847496033, "num_input_tokens_seen": 118240, "step": 362, "train_runtime": 930.4629, "train_tokens_per_second": 127.077 }, { "epoch": 0.016689655172413793, "grad_norm": 9.43403148651123, "learning_rate": 1.642105263157895e-05, "loss": 0.5236190557479858, "num_input_tokens_seen": 118514, "step": 363, "train_runtime": 932.4238, "train_tokens_per_second": 127.103 }, { "epoch": 0.016735632183908045, "grad_norm": 8.648951530456543, "learning_rate": 1.6411027568922306e-05, "loss": 0.6613885164260864, "num_input_tokens_seen": 118822, "step": 364, "train_runtime": 934.3426, "train_tokens_per_second": 127.172 }, { "epoch": 0.016781609195402298, "grad_norm": 7.909249782562256, "learning_rate": 1.6401002506265667e-05, "loss": 0.5001586675643921, "num_input_tokens_seen": 119082, "step": 365, "train_runtime": 936.2579, "train_tokens_per_second": 127.189 }, { "epoch": 0.01682758620689655, "grad_norm": 7.648731708526611, "learning_rate": 1.6390977443609023e-05, "loss": 0.5139956474304199, "num_input_tokens_seen": 119444, "step": 366, "train_runtime": 938.2199, "train_tokens_per_second": 127.309 }, { "epoch": 0.016873563218390803, "grad_norm": 6.9863972663879395, "learning_rate": 1.6380952380952384e-05, "loss": 0.452639102935791, "num_input_tokens_seen": 119800, "step": 367, "train_runtime": 940.173, "train_tokens_per_second": 127.423 }, { "epoch": 0.01691954022988506, "grad_norm": 8.20292854309082, "learning_rate": 1.637092731829574e-05, "loss": 0.5598886013031006, "num_input_tokens_seen": 120176, "step": 368, "train_runtime": 942.1221, "train_tokens_per_second": 127.559 }, { "epoch": 0.016965517241379312, "grad_norm": 9.673002243041992, "learning_rate": 1.63609022556391e-05, "loss": 0.5143294334411621, "num_input_tokens_seen": 120440, "step": 369, "train_runtime": 944.0387, "train_tokens_per_second": 127.58 }, { "epoch": 0.017011494252873564, "grad_norm": 9.281442642211914, "learning_rate": 1.6350877192982457e-05, "loss": 0.4952996075153351, "num_input_tokens_seen": 120712, "step": 370, "train_runtime": 945.9497, "train_tokens_per_second": 127.609 }, { "epoch": 0.017057471264367817, "grad_norm": 7.510295867919922, "learning_rate": 1.6340852130325814e-05, "loss": 0.44082415103912354, "num_input_tokens_seen": 121034, "step": 371, "train_runtime": 947.9804, "train_tokens_per_second": 127.676 }, { "epoch": 0.01710344827586207, "grad_norm": 9.4686279296875, "learning_rate": 1.6330827067669174e-05, "loss": 0.6736571788787842, "num_input_tokens_seen": 121364, "step": 372, "train_runtime": 949.925, "train_tokens_per_second": 127.762 }, { "epoch": 0.017149425287356322, "grad_norm": 8.580607414245605, "learning_rate": 1.632080200501253e-05, "loss": 0.43911564350128174, "num_input_tokens_seen": 121612, "step": 373, "train_runtime": 951.8563, "train_tokens_per_second": 127.763 }, { "epoch": 0.017195402298850575, "grad_norm": 8.830676078796387, "learning_rate": 1.631077694235589e-05, "loss": 0.5348225235939026, "num_input_tokens_seen": 121974, "step": 374, "train_runtime": 953.975, "train_tokens_per_second": 127.859 }, { "epoch": 0.017241379310344827, "grad_norm": 7.836789131164551, "learning_rate": 1.630075187969925e-05, "loss": 0.5751879215240479, "num_input_tokens_seen": 122574, "step": 375, "train_runtime": 956.0011, "train_tokens_per_second": 128.215 }, { "epoch": 0.01728735632183908, "grad_norm": 7.419215679168701, "learning_rate": 1.6290726817042608e-05, "loss": 0.5154892802238464, "num_input_tokens_seen": 122868, "step": 376, "train_runtime": 957.9278, "train_tokens_per_second": 128.264 }, { "epoch": 0.017333333333333333, "grad_norm": 5.741374492645264, "learning_rate": 1.6280701754385965e-05, "loss": 0.39768892526626587, "num_input_tokens_seen": 123364, "step": 377, "train_runtime": 959.8945, "train_tokens_per_second": 128.518 }, { "epoch": 0.017379310344827585, "grad_norm": 8.026482582092285, "learning_rate": 1.6270676691729325e-05, "loss": 0.4915647506713867, "num_input_tokens_seen": 123676, "step": 378, "train_runtime": 961.815, "train_tokens_per_second": 128.586 }, { "epoch": 0.017425287356321838, "grad_norm": 7.1091790199279785, "learning_rate": 1.6260651629072682e-05, "loss": 0.36034339666366577, "num_input_tokens_seen": 123956, "step": 379, "train_runtime": 963.735, "train_tokens_per_second": 128.62 }, { "epoch": 0.01747126436781609, "grad_norm": 7.859342575073242, "learning_rate": 1.6250626566416042e-05, "loss": 0.5458072423934937, "num_input_tokens_seen": 124324, "step": 380, "train_runtime": 965.6798, "train_tokens_per_second": 128.742 }, { "epoch": 0.017517241379310346, "grad_norm": 7.662074565887451, "learning_rate": 1.62406015037594e-05, "loss": 0.40609803795814514, "num_input_tokens_seen": 124660, "step": 381, "train_runtime": 967.5932, "train_tokens_per_second": 128.835 }, { "epoch": 0.0175632183908046, "grad_norm": 9.377715110778809, "learning_rate": 1.623057644110276e-05, "loss": 0.48562780022621155, "num_input_tokens_seen": 124928, "step": 382, "train_runtime": 969.5044, "train_tokens_per_second": 128.858 }, { "epoch": 0.01760919540229885, "grad_norm": 6.903769016265869, "learning_rate": 1.6220551378446116e-05, "loss": 0.4790268540382385, "num_input_tokens_seen": 125410, "step": 383, "train_runtime": 971.4774, "train_tokens_per_second": 129.092 }, { "epoch": 0.017655172413793104, "grad_norm": 9.729009628295898, "learning_rate": 1.6210526315789473e-05, "loss": 0.45791855454444885, "num_input_tokens_seen": 125714, "step": 384, "train_runtime": 973.4006, "train_tokens_per_second": 129.149 }, { "epoch": 0.017701149425287357, "grad_norm": 8.090932846069336, "learning_rate": 1.6200501253132833e-05, "loss": 0.5926223993301392, "num_input_tokens_seen": 125990, "step": 385, "train_runtime": 975.3097, "train_tokens_per_second": 129.179 }, { "epoch": 0.01774712643678161, "grad_norm": 8.990884780883789, "learning_rate": 1.6190476190476193e-05, "loss": 0.502015233039856, "num_input_tokens_seen": 126296, "step": 386, "train_runtime": 977.2341, "train_tokens_per_second": 129.238 }, { "epoch": 0.017793103448275862, "grad_norm": 11.029932022094727, "learning_rate": 1.618045112781955e-05, "loss": 0.49521729350090027, "num_input_tokens_seen": 126564, "step": 387, "train_runtime": 979.1455, "train_tokens_per_second": 129.26 }, { "epoch": 0.017839080459770115, "grad_norm": 7.295618057250977, "learning_rate": 1.617042606516291e-05, "loss": 0.4368196725845337, "num_input_tokens_seen": 126802, "step": 388, "train_runtime": 981.0589, "train_tokens_per_second": 129.25 }, { "epoch": 0.017885057471264367, "grad_norm": 7.750117301940918, "learning_rate": 1.6160401002506267e-05, "loss": 0.43421801924705505, "num_input_tokens_seen": 127106, "step": 389, "train_runtime": 983.0081, "train_tokens_per_second": 129.303 }, { "epoch": 0.01793103448275862, "grad_norm": 8.780847549438477, "learning_rate": 1.6150375939849624e-05, "loss": 0.5297210216522217, "num_input_tokens_seen": 127348, "step": 390, "train_runtime": 984.9338, "train_tokens_per_second": 129.296 }, { "epoch": 0.017977011494252872, "grad_norm": 8.037254333496094, "learning_rate": 1.6140350877192984e-05, "loss": 0.460166871547699, "num_input_tokens_seen": 127628, "step": 391, "train_runtime": 1000.0858, "train_tokens_per_second": 127.617 }, { "epoch": 0.018022988505747125, "grad_norm": 8.30826473236084, "learning_rate": 1.6130325814536344e-05, "loss": 0.5625733137130737, "num_input_tokens_seen": 127920, "step": 392, "train_runtime": 1002.0399, "train_tokens_per_second": 127.66 }, { "epoch": 0.01806896551724138, "grad_norm": 8.45525074005127, "learning_rate": 1.61203007518797e-05, "loss": 0.4925714135169983, "num_input_tokens_seen": 128208, "step": 393, "train_runtime": 1003.9933, "train_tokens_per_second": 127.698 }, { "epoch": 0.018114942528735634, "grad_norm": 7.612026691436768, "learning_rate": 1.6110275689223058e-05, "loss": 0.2628011703491211, "num_input_tokens_seen": 128440, "step": 394, "train_runtime": 1005.9157, "train_tokens_per_second": 127.685 }, { "epoch": 0.018160919540229886, "grad_norm": 7.3546833992004395, "learning_rate": 1.6100250626566418e-05, "loss": 0.4682520925998688, "num_input_tokens_seen": 128752, "step": 395, "train_runtime": 1007.9693, "train_tokens_per_second": 127.734 }, { "epoch": 0.01820689655172414, "grad_norm": 8.364006996154785, "learning_rate": 1.6090225563909775e-05, "loss": 0.43775445222854614, "num_input_tokens_seen": 129068, "step": 396, "train_runtime": 1009.9523, "train_tokens_per_second": 127.796 }, { "epoch": 0.01825287356321839, "grad_norm": 9.414189338684082, "learning_rate": 1.6080200501253135e-05, "loss": 0.4796205163002014, "num_input_tokens_seen": 129402, "step": 397, "train_runtime": 1011.8954, "train_tokens_per_second": 127.881 }, { "epoch": 0.018298850574712644, "grad_norm": 7.125086307525635, "learning_rate": 1.6070175438596495e-05, "loss": 0.46837103366851807, "num_input_tokens_seen": 129590, "step": 398, "train_runtime": 1013.8308, "train_tokens_per_second": 127.822 }, { "epoch": 0.018344827586206897, "grad_norm": 10.200335502624512, "learning_rate": 1.6060150375939852e-05, "loss": 0.6392890810966492, "num_input_tokens_seen": 129860, "step": 399, "train_runtime": 1015.7951, "train_tokens_per_second": 127.841 }, { "epoch": 0.01839080459770115, "grad_norm": 8.488134384155273, "learning_rate": 1.605012531328321e-05, "loss": 0.47278720140457153, "num_input_tokens_seen": 130184, "step": 400, "train_runtime": 1017.7361, "train_tokens_per_second": 127.915 }, { "epoch": 0.01839080459770115, "eval_loss": 1.83921217918396, "eval_runtime": 54.5857, "eval_samples_per_second": 18.32, "eval_steps_per_second": 9.16, "num_input_tokens_seen": 130184, "step": 400 }, { "epoch": 0.018436781609195402, "grad_norm": 10.583003044128418, "learning_rate": 1.6040100250626565e-05, "loss": 0.664654016494751, "num_input_tokens_seen": 130504, "step": 401, "train_runtime": 1074.343, "train_tokens_per_second": 121.473 }, { "epoch": 0.018482758620689654, "grad_norm": 9.928531646728516, "learning_rate": 1.6030075187969926e-05, "loss": 0.4345932602882385, "num_input_tokens_seen": 130760, "step": 402, "train_runtime": 1076.3619, "train_tokens_per_second": 121.483 }, { "epoch": 0.018528735632183907, "grad_norm": 8.73652458190918, "learning_rate": 1.6020050125313286e-05, "loss": 0.5674711465835571, "num_input_tokens_seen": 131072, "step": 403, "train_runtime": 1078.2913, "train_tokens_per_second": 121.555 }, { "epoch": 0.01857471264367816, "grad_norm": 8.819191932678223, "learning_rate": 1.6010025062656642e-05, "loss": 0.5101428627967834, "num_input_tokens_seen": 131360, "step": 404, "train_runtime": 1080.2613, "train_tokens_per_second": 121.6 }, { "epoch": 0.018620689655172412, "grad_norm": 11.008004188537598, "learning_rate": 1.6000000000000003e-05, "loss": 0.664053201675415, "num_input_tokens_seen": 131736, "step": 405, "train_runtime": 1082.2012, "train_tokens_per_second": 121.73 }, { "epoch": 0.018666666666666668, "grad_norm": 8.193777084350586, "learning_rate": 1.598997493734336e-05, "loss": 0.524330198764801, "num_input_tokens_seen": 132174, "step": 406, "train_runtime": 1084.1663, "train_tokens_per_second": 121.913 }, { "epoch": 0.01871264367816092, "grad_norm": 8.529227256774902, "learning_rate": 1.5979949874686716e-05, "loss": 0.31128376722335815, "num_input_tokens_seen": 132404, "step": 407, "train_runtime": 1086.1, "train_tokens_per_second": 121.908 }, { "epoch": 0.018758620689655173, "grad_norm": 7.439627170562744, "learning_rate": 1.5969924812030076e-05, "loss": 0.45540714263916016, "num_input_tokens_seen": 132660, "step": 408, "train_runtime": 1088.101, "train_tokens_per_second": 121.919 }, { "epoch": 0.018804597701149426, "grad_norm": 7.563625335693359, "learning_rate": 1.5959899749373437e-05, "loss": 0.40846192836761475, "num_input_tokens_seen": 132908, "step": 409, "train_runtime": 1090.0297, "train_tokens_per_second": 121.931 }, { "epoch": 0.01885057471264368, "grad_norm": 7.777848720550537, "learning_rate": 1.5949874686716793e-05, "loss": 0.5753679275512695, "num_input_tokens_seen": 133400, "step": 410, "train_runtime": 1092.0325, "train_tokens_per_second": 122.158 }, { "epoch": 0.01889655172413793, "grad_norm": 8.254167556762695, "learning_rate": 1.593984962406015e-05, "loss": 0.5449351072311401, "num_input_tokens_seen": 133720, "step": 411, "train_runtime": 1093.9714, "train_tokens_per_second": 122.234 }, { "epoch": 0.018942528735632184, "grad_norm": 10.308324813842773, "learning_rate": 1.592982456140351e-05, "loss": 0.500423789024353, "num_input_tokens_seen": 133996, "step": 412, "train_runtime": 1095.9362, "train_tokens_per_second": 122.266 }, { "epoch": 0.018988505747126436, "grad_norm": 6.994194507598877, "learning_rate": 1.5919799498746867e-05, "loss": 0.5234413146972656, "num_input_tokens_seen": 134572, "step": 413, "train_runtime": 1098.0558, "train_tokens_per_second": 122.555 }, { "epoch": 0.01903448275862069, "grad_norm": 9.316163063049316, "learning_rate": 1.5909774436090227e-05, "loss": 0.5487146377563477, "num_input_tokens_seen": 134854, "step": 414, "train_runtime": 1100.0275, "train_tokens_per_second": 122.591 }, { "epoch": 0.01908045977011494, "grad_norm": 7.727750778198242, "learning_rate": 1.5899749373433588e-05, "loss": 0.3887421488761902, "num_input_tokens_seen": 135158, "step": 415, "train_runtime": 1102.0303, "train_tokens_per_second": 122.645 }, { "epoch": 0.019126436781609194, "grad_norm": 6.617283344268799, "learning_rate": 1.5889724310776944e-05, "loss": 0.4084390699863434, "num_input_tokens_seen": 135414, "step": 416, "train_runtime": 1103.9422, "train_tokens_per_second": 122.664 }, { "epoch": 0.019172413793103447, "grad_norm": 8.78074836730957, "learning_rate": 1.58796992481203e-05, "loss": 0.5863832831382751, "num_input_tokens_seen": 135808, "step": 417, "train_runtime": 1105.899, "train_tokens_per_second": 122.803 }, { "epoch": 0.019218390804597703, "grad_norm": 8.403968811035156, "learning_rate": 1.5869674185463658e-05, "loss": 0.4228143095970154, "num_input_tokens_seen": 136044, "step": 418, "train_runtime": 1107.8257, "train_tokens_per_second": 122.803 }, { "epoch": 0.019264367816091955, "grad_norm": 11.255876541137695, "learning_rate": 1.5859649122807018e-05, "loss": 0.418620765209198, "num_input_tokens_seen": 136322, "step": 419, "train_runtime": 1109.7699, "train_tokens_per_second": 122.838 }, { "epoch": 0.019310344827586208, "grad_norm": 9.40054702758789, "learning_rate": 1.5849624060150378e-05, "loss": 0.5212907791137695, "num_input_tokens_seen": 136602, "step": 420, "train_runtime": 1111.696, "train_tokens_per_second": 122.877 }, { "epoch": 0.01935632183908046, "grad_norm": 8.371843338012695, "learning_rate": 1.5839598997493735e-05, "loss": 0.5342715978622437, "num_input_tokens_seen": 136842, "step": 421, "train_runtime": 1127.3407, "train_tokens_per_second": 121.385 }, { "epoch": 0.019402298850574713, "grad_norm": 7.767118453979492, "learning_rate": 1.5829573934837095e-05, "loss": 0.4537525773048401, "num_input_tokens_seen": 137110, "step": 422, "train_runtime": 1129.271, "train_tokens_per_second": 121.415 }, { "epoch": 0.019448275862068966, "grad_norm": 7.4775261878967285, "learning_rate": 1.5819548872180452e-05, "loss": 0.5792855620384216, "num_input_tokens_seen": 137550, "step": 423, "train_runtime": 1131.2949, "train_tokens_per_second": 121.586 }, { "epoch": 0.01949425287356322, "grad_norm": 8.903519630432129, "learning_rate": 1.580952380952381e-05, "loss": 0.5991487503051758, "num_input_tokens_seen": 137820, "step": 424, "train_runtime": 1133.2398, "train_tokens_per_second": 121.616 }, { "epoch": 0.01954022988505747, "grad_norm": 6.718785285949707, "learning_rate": 1.579949874686717e-05, "loss": 0.32860735058784485, "num_input_tokens_seen": 138092, "step": 425, "train_runtime": 1135.1767, "train_tokens_per_second": 121.648 }, { "epoch": 0.019586206896551724, "grad_norm": 9.034529685974121, "learning_rate": 1.578947368421053e-05, "loss": 0.5332455635070801, "num_input_tokens_seen": 138342, "step": 426, "train_runtime": 1137.1264, "train_tokens_per_second": 121.659 }, { "epoch": 0.019632183908045976, "grad_norm": 8.134893417358398, "learning_rate": 1.5779448621553886e-05, "loss": 0.34569254517555237, "num_input_tokens_seen": 138584, "step": 427, "train_runtime": 1139.0641, "train_tokens_per_second": 121.665 }, { "epoch": 0.01967816091954023, "grad_norm": 7.84832239151001, "learning_rate": 1.5769423558897243e-05, "loss": 0.5754497051239014, "num_input_tokens_seen": 138904, "step": 428, "train_runtime": 1141.019, "train_tokens_per_second": 121.737 }, { "epoch": 0.01972413793103448, "grad_norm": 8.042332649230957, "learning_rate": 1.5759398496240603e-05, "loss": 0.5238772034645081, "num_input_tokens_seen": 139274, "step": 429, "train_runtime": 1143.0173, "train_tokens_per_second": 121.848 }, { "epoch": 0.019770114942528734, "grad_norm": 8.774839401245117, "learning_rate": 1.574937343358396e-05, "loss": 0.5461223125457764, "num_input_tokens_seen": 139716, "step": 430, "train_runtime": 1145.026, "train_tokens_per_second": 122.02 }, { "epoch": 0.01981609195402299, "grad_norm": 9.017069816589355, "learning_rate": 1.573934837092732e-05, "loss": 0.45460045337677, "num_input_tokens_seen": 139990, "step": 431, "train_runtime": 1147.0367, "train_tokens_per_second": 122.045 }, { "epoch": 0.019862068965517243, "grad_norm": 7.076886177062988, "learning_rate": 1.572932330827068e-05, "loss": 0.45128387212753296, "num_input_tokens_seen": 140418, "step": 432, "train_runtime": 1149.0105, "train_tokens_per_second": 122.208 }, { "epoch": 0.019908045977011495, "grad_norm": 8.149660110473633, "learning_rate": 1.5719298245614037e-05, "loss": 0.5153030157089233, "num_input_tokens_seen": 140734, "step": 433, "train_runtime": 1150.9352, "train_tokens_per_second": 122.278 }, { "epoch": 0.019954022988505748, "grad_norm": 7.91249418258667, "learning_rate": 1.5709273182957394e-05, "loss": 0.4741940200328827, "num_input_tokens_seen": 141004, "step": 434, "train_runtime": 1152.8614, "train_tokens_per_second": 122.308 }, { "epoch": 0.02, "grad_norm": 9.027854919433594, "learning_rate": 1.5699248120300754e-05, "loss": 0.5704158544540405, "num_input_tokens_seen": 141316, "step": 435, "train_runtime": 1154.7862, "train_tokens_per_second": 122.374 }, { "epoch": 0.020045977011494253, "grad_norm": 7.727769374847412, "learning_rate": 1.568922305764411e-05, "loss": 0.3855794370174408, "num_input_tokens_seen": 141574, "step": 436, "train_runtime": 1156.7188, "train_tokens_per_second": 122.393 }, { "epoch": 0.020091954022988506, "grad_norm": 7.8650593757629395, "learning_rate": 1.567919799498747e-05, "loss": 0.39530476927757263, "num_input_tokens_seen": 141808, "step": 437, "train_runtime": 1158.6305, "train_tokens_per_second": 122.393 }, { "epoch": 0.020137931034482758, "grad_norm": 8.397459983825684, "learning_rate": 1.5669172932330828e-05, "loss": 0.4957209825515747, "num_input_tokens_seen": 142082, "step": 438, "train_runtime": 1160.5466, "train_tokens_per_second": 122.427 }, { "epoch": 0.02018390804597701, "grad_norm": 7.495139122009277, "learning_rate": 1.5659147869674188e-05, "loss": 0.4659573435783386, "num_input_tokens_seen": 142390, "step": 439, "train_runtime": 1162.4756, "train_tokens_per_second": 122.489 }, { "epoch": 0.020229885057471263, "grad_norm": 9.757864952087402, "learning_rate": 1.5649122807017545e-05, "loss": 0.553784966468811, "num_input_tokens_seen": 142764, "step": 440, "train_runtime": 1164.41, "train_tokens_per_second": 122.606 }, { "epoch": 0.020275862068965516, "grad_norm": 8.840959548950195, "learning_rate": 1.56390977443609e-05, "loss": 0.4977976083755493, "num_input_tokens_seen": 143074, "step": 441, "train_runtime": 1166.4194, "train_tokens_per_second": 122.661 }, { "epoch": 0.02032183908045977, "grad_norm": 8.150773048400879, "learning_rate": 1.562907268170426e-05, "loss": 0.5242696404457092, "num_input_tokens_seen": 143474, "step": 442, "train_runtime": 1168.4102, "train_tokens_per_second": 122.794 }, { "epoch": 0.020367816091954025, "grad_norm": 8.866066932678223, "learning_rate": 1.5619047619047622e-05, "loss": 0.641364574432373, "num_input_tokens_seen": 143864, "step": 443, "train_runtime": 1170.3661, "train_tokens_per_second": 122.922 }, { "epoch": 0.020413793103448277, "grad_norm": 8.029109001159668, "learning_rate": 1.560902255639098e-05, "loss": 0.5271466374397278, "num_input_tokens_seen": 144184, "step": 444, "train_runtime": 1172.2926, "train_tokens_per_second": 122.993 }, { "epoch": 0.02045977011494253, "grad_norm": 6.696882724761963, "learning_rate": 1.559899749373434e-05, "loss": 0.29163163900375366, "num_input_tokens_seen": 144416, "step": 445, "train_runtime": 1174.2064, "train_tokens_per_second": 122.99 }, { "epoch": 0.020505747126436782, "grad_norm": 8.14375114440918, "learning_rate": 1.5588972431077696e-05, "loss": 0.469174325466156, "num_input_tokens_seen": 144744, "step": 446, "train_runtime": 1176.1654, "train_tokens_per_second": 123.064 }, { "epoch": 0.020551724137931035, "grad_norm": 8.158989906311035, "learning_rate": 1.5578947368421052e-05, "loss": 0.4768478274345398, "num_input_tokens_seen": 145042, "step": 447, "train_runtime": 1178.1014, "train_tokens_per_second": 123.115 }, { "epoch": 0.020597701149425288, "grad_norm": 7.018171310424805, "learning_rate": 1.5568922305764413e-05, "loss": 0.3784666061401367, "num_input_tokens_seen": 145354, "step": 448, "train_runtime": 1180.0288, "train_tokens_per_second": 123.178 }, { "epoch": 0.02064367816091954, "grad_norm": 9.718257904052734, "learning_rate": 1.5558897243107773e-05, "loss": 0.431374192237854, "num_input_tokens_seen": 145630, "step": 449, "train_runtime": 1181.9543, "train_tokens_per_second": 123.211 }, { "epoch": 0.020689655172413793, "grad_norm": 8.367993354797363, "learning_rate": 1.554887218045113e-05, "loss": 0.503094494342804, "num_input_tokens_seen": 145952, "step": 450, "train_runtime": 1183.8786, "train_tokens_per_second": 123.283 }, { "epoch": 0.020735632183908045, "grad_norm": 8.881491661071777, "learning_rate": 1.5538847117794486e-05, "loss": 0.6508010625839233, "num_input_tokens_seen": 146236, "step": 451, "train_runtime": 1200.4898, "train_tokens_per_second": 121.814 }, { "epoch": 0.020781609195402298, "grad_norm": 8.647028923034668, "learning_rate": 1.5528822055137847e-05, "loss": 0.5306245684623718, "num_input_tokens_seen": 146644, "step": 452, "train_runtime": 1202.4537, "train_tokens_per_second": 121.954 }, { "epoch": 0.02082758620689655, "grad_norm": 9.862062454223633, "learning_rate": 1.5518796992481203e-05, "loss": 0.5040091276168823, "num_input_tokens_seen": 146924, "step": 453, "train_runtime": 1204.3853, "train_tokens_per_second": 121.991 }, { "epoch": 0.020873563218390803, "grad_norm": 7.58740234375, "learning_rate": 1.5508771929824563e-05, "loss": 0.3113386929035187, "num_input_tokens_seen": 147174, "step": 454, "train_runtime": 1206.2932, "train_tokens_per_second": 122.005 }, { "epoch": 0.020919540229885056, "grad_norm": 7.78328800201416, "learning_rate": 1.5498746867167924e-05, "loss": 0.4073692858219147, "num_input_tokens_seen": 147410, "step": 455, "train_runtime": 1208.2038, "train_tokens_per_second": 122.008 }, { "epoch": 0.020965517241379312, "grad_norm": 7.565345764160156, "learning_rate": 1.548872180451128e-05, "loss": 0.40836089849472046, "num_input_tokens_seen": 147656, "step": 456, "train_runtime": 1210.1109, "train_tokens_per_second": 122.019 }, { "epoch": 0.021011494252873564, "grad_norm": 7.796747207641602, "learning_rate": 1.5478696741854637e-05, "loss": 0.5215970277786255, "num_input_tokens_seen": 148002, "step": 457, "train_runtime": 1212.0942, "train_tokens_per_second": 122.104 }, { "epoch": 0.021057471264367817, "grad_norm": 7.469287872314453, "learning_rate": 1.5468671679197994e-05, "loss": 0.4521618187427521, "num_input_tokens_seen": 148314, "step": 458, "train_runtime": 1214.1412, "train_tokens_per_second": 122.155 }, { "epoch": 0.02110344827586207, "grad_norm": 8.264181137084961, "learning_rate": 1.5458646616541354e-05, "loss": 0.4832594692707062, "num_input_tokens_seen": 148574, "step": 459, "train_runtime": 1216.2168, "train_tokens_per_second": 122.161 }, { "epoch": 0.021149425287356322, "grad_norm": 8.08668041229248, "learning_rate": 1.5448621553884714e-05, "loss": 0.46651777625083923, "num_input_tokens_seen": 148954, "step": 460, "train_runtime": 1218.2745, "train_tokens_per_second": 122.266 }, { "epoch": 0.021195402298850575, "grad_norm": 8.778621673583984, "learning_rate": 1.543859649122807e-05, "loss": 0.46269941329956055, "num_input_tokens_seen": 149236, "step": 461, "train_runtime": 1220.2478, "train_tokens_per_second": 122.3 }, { "epoch": 0.021241379310344827, "grad_norm": 7.521136283874512, "learning_rate": 1.542857142857143e-05, "loss": 0.39253920316696167, "num_input_tokens_seen": 149522, "step": 462, "train_runtime": 1222.3107, "train_tokens_per_second": 122.327 }, { "epoch": 0.02128735632183908, "grad_norm": 9.666208267211914, "learning_rate": 1.5418546365914788e-05, "loss": 0.5184369087219238, "num_input_tokens_seen": 149780, "step": 463, "train_runtime": 1224.2963, "train_tokens_per_second": 122.34 }, { "epoch": 0.021333333333333333, "grad_norm": 6.660348892211914, "learning_rate": 1.5408521303258145e-05, "loss": 0.43838030099868774, "num_input_tokens_seen": 150366, "step": 464, "train_runtime": 1226.3605, "train_tokens_per_second": 122.612 }, { "epoch": 0.021379310344827585, "grad_norm": 7.8536529541015625, "learning_rate": 1.5398496240601505e-05, "loss": 0.4633280038833618, "num_input_tokens_seen": 150656, "step": 465, "train_runtime": 1228.346, "train_tokens_per_second": 122.649 }, { "epoch": 0.021425287356321838, "grad_norm": 9.269664764404297, "learning_rate": 1.5388471177944865e-05, "loss": 0.4660486578941345, "num_input_tokens_seen": 150930, "step": 466, "train_runtime": 1230.3816, "train_tokens_per_second": 122.669 }, { "epoch": 0.02147126436781609, "grad_norm": 8.85814094543457, "learning_rate": 1.5378446115288222e-05, "loss": 0.6247583627700806, "num_input_tokens_seen": 151268, "step": 467, "train_runtime": 1232.4881, "train_tokens_per_second": 122.734 }, { "epoch": 0.021517241379310346, "grad_norm": 7.665519714355469, "learning_rate": 1.536842105263158e-05, "loss": 0.49776655435562134, "num_input_tokens_seen": 151534, "step": 468, "train_runtime": 1234.4868, "train_tokens_per_second": 122.751 }, { "epoch": 0.0215632183908046, "grad_norm": 8.703502655029297, "learning_rate": 1.535839598997494e-05, "loss": 0.4543405771255493, "num_input_tokens_seen": 151818, "step": 469, "train_runtime": 1236.4857, "train_tokens_per_second": 122.782 }, { "epoch": 0.02160919540229885, "grad_norm": 9.28618335723877, "learning_rate": 1.5348370927318296e-05, "loss": 0.5027074217796326, "num_input_tokens_seen": 152176, "step": 470, "train_runtime": 1238.5203, "train_tokens_per_second": 122.869 }, { "epoch": 0.021655172413793104, "grad_norm": 8.177092552185059, "learning_rate": 1.5338345864661656e-05, "loss": 0.5191943049430847, "num_input_tokens_seen": 152496, "step": 471, "train_runtime": 1240.5355, "train_tokens_per_second": 122.928 }, { "epoch": 0.021701149425287357, "grad_norm": 9.28865909576416, "learning_rate": 1.5328320802005013e-05, "loss": 0.4770624041557312, "num_input_tokens_seen": 152886, "step": 472, "train_runtime": 1242.6231, "train_tokens_per_second": 123.035 }, { "epoch": 0.02174712643678161, "grad_norm": 8.051939010620117, "learning_rate": 1.5318295739348373e-05, "loss": 0.468537300825119, "num_input_tokens_seen": 153142, "step": 473, "train_runtime": 1244.6413, "train_tokens_per_second": 123.041 }, { "epoch": 0.021793103448275862, "grad_norm": 7.96160888671875, "learning_rate": 1.530827067669173e-05, "loss": 0.47067826986312866, "num_input_tokens_seen": 153408, "step": 474, "train_runtime": 1246.6788, "train_tokens_per_second": 123.053 }, { "epoch": 0.021839080459770115, "grad_norm": 7.926995754241943, "learning_rate": 1.529824561403509e-05, "loss": 0.5530025959014893, "num_input_tokens_seen": 153868, "step": 475, "train_runtime": 1248.7781, "train_tokens_per_second": 123.215 }, { "epoch": 0.021885057471264367, "grad_norm": 7.6453022956848145, "learning_rate": 1.5288220551378447e-05, "loss": 0.46475687623023987, "num_input_tokens_seen": 154140, "step": 476, "train_runtime": 1250.7882, "train_tokens_per_second": 123.234 }, { "epoch": 0.02193103448275862, "grad_norm": 6.370632171630859, "learning_rate": 1.5278195488721807e-05, "loss": 0.3243369460105896, "num_input_tokens_seen": 154390, "step": 477, "train_runtime": 1252.8214, "train_tokens_per_second": 123.234 }, { "epoch": 0.021977011494252872, "grad_norm": 8.575563430786133, "learning_rate": 1.5268170426065164e-05, "loss": 0.5438640713691711, "num_input_tokens_seen": 154672, "step": 478, "train_runtime": 1254.8355, "train_tokens_per_second": 123.261 }, { "epoch": 0.022022988505747125, "grad_norm": 8.427260398864746, "learning_rate": 1.5258145363408522e-05, "loss": 0.4582708179950714, "num_input_tokens_seen": 154988, "step": 479, "train_runtime": 1256.8219, "train_tokens_per_second": 123.317 }, { "epoch": 0.022068965517241378, "grad_norm": 7.727510452270508, "learning_rate": 1.524812030075188e-05, "loss": 0.4847640097141266, "num_input_tokens_seen": 155260, "step": 480, "train_runtime": 1258.7875, "train_tokens_per_second": 123.341 }, { "epoch": 0.022114942528735634, "grad_norm": 8.2589111328125, "learning_rate": 1.523809523809524e-05, "loss": 0.4815359115600586, "num_input_tokens_seen": 155586, "step": 481, "train_runtime": 1273.9387, "train_tokens_per_second": 122.13 }, { "epoch": 0.022160919540229886, "grad_norm": 6.174463748931885, "learning_rate": 1.5228070175438598e-05, "loss": 0.5501198172569275, "num_input_tokens_seen": 156492, "step": 482, "train_runtime": 1276.1628, "train_tokens_per_second": 122.627 }, { "epoch": 0.02220689655172414, "grad_norm": 8.82485580444336, "learning_rate": 1.5218045112781956e-05, "loss": 0.45321643352508545, "num_input_tokens_seen": 156780, "step": 483, "train_runtime": 1278.1967, "train_tokens_per_second": 122.657 }, { "epoch": 0.02225287356321839, "grad_norm": 6.12175178527832, "learning_rate": 1.5208020050125315e-05, "loss": 0.3978089690208435, "num_input_tokens_seen": 157088, "step": 484, "train_runtime": 1280.2145, "train_tokens_per_second": 122.704 }, { "epoch": 0.022298850574712644, "grad_norm": 8.363214492797852, "learning_rate": 1.5197994987468673e-05, "loss": 0.5779292583465576, "num_input_tokens_seen": 157444, "step": 485, "train_runtime": 1282.2865, "train_tokens_per_second": 122.784 }, { "epoch": 0.022344827586206897, "grad_norm": 7.858548164367676, "learning_rate": 1.5187969924812032e-05, "loss": 0.4645827114582062, "num_input_tokens_seen": 157718, "step": 486, "train_runtime": 1284.2629, "train_tokens_per_second": 122.808 }, { "epoch": 0.02239080459770115, "grad_norm": 8.053011894226074, "learning_rate": 1.5177944862155388e-05, "loss": 0.5309751033782959, "num_input_tokens_seen": 158040, "step": 487, "train_runtime": 1286.332, "train_tokens_per_second": 122.861 }, { "epoch": 0.022436781609195402, "grad_norm": 8.499578475952148, "learning_rate": 1.5167919799498747e-05, "loss": 0.5499032139778137, "num_input_tokens_seen": 158352, "step": 488, "train_runtime": 1288.3653, "train_tokens_per_second": 122.909 }, { "epoch": 0.022482758620689654, "grad_norm": 8.27188491821289, "learning_rate": 1.5157894736842107e-05, "loss": 0.5076043009757996, "num_input_tokens_seen": 158756, "step": 489, "train_runtime": 1290.469, "train_tokens_per_second": 123.022 }, { "epoch": 0.022528735632183907, "grad_norm": 9.326817512512207, "learning_rate": 1.5147869674185464e-05, "loss": 0.5182700157165527, "num_input_tokens_seen": 159020, "step": 490, "train_runtime": 1292.4903, "train_tokens_per_second": 123.034 }, { "epoch": 0.02257471264367816, "grad_norm": 8.826271057128906, "learning_rate": 1.5137844611528822e-05, "loss": 0.491726279258728, "num_input_tokens_seen": 159272, "step": 491, "train_runtime": 1294.603, "train_tokens_per_second": 123.028 }, { "epoch": 0.022620689655172412, "grad_norm": 8.384391784667969, "learning_rate": 1.5127819548872183e-05, "loss": 0.6266180276870728, "num_input_tokens_seen": 159538, "step": 492, "train_runtime": 1296.5724, "train_tokens_per_second": 123.046 }, { "epoch": 0.02266666666666667, "grad_norm": 9.36903190612793, "learning_rate": 1.511779448621554e-05, "loss": 0.48814085125923157, "num_input_tokens_seen": 159798, "step": 493, "train_runtime": 1298.5435, "train_tokens_per_second": 123.059 }, { "epoch": 0.02271264367816092, "grad_norm": 8.908138275146484, "learning_rate": 1.5107769423558898e-05, "loss": 0.6812343597412109, "num_input_tokens_seen": 160200, "step": 494, "train_runtime": 1300.7681, "train_tokens_per_second": 123.158 }, { "epoch": 0.022758620689655173, "grad_norm": 8.59496784210205, "learning_rate": 1.5097744360902258e-05, "loss": 0.4920065104961395, "num_input_tokens_seen": 160482, "step": 495, "train_runtime": 1302.7478, "train_tokens_per_second": 123.187 }, { "epoch": 0.022804597701149426, "grad_norm": 7.333454132080078, "learning_rate": 1.5087719298245615e-05, "loss": 0.4726922810077667, "num_input_tokens_seen": 160778, "step": 496, "train_runtime": 1304.7802, "train_tokens_per_second": 123.222 }, { "epoch": 0.02285057471264368, "grad_norm": 6.41697883605957, "learning_rate": 1.5077694235588973e-05, "loss": 0.4380318522453308, "num_input_tokens_seen": 161048, "step": 497, "train_runtime": 1306.7805, "train_tokens_per_second": 123.24 }, { "epoch": 0.02289655172413793, "grad_norm": 8.461562156677246, "learning_rate": 1.506766917293233e-05, "loss": 0.48116976022720337, "num_input_tokens_seen": 161414, "step": 498, "train_runtime": 1308.7561, "train_tokens_per_second": 123.334 }, { "epoch": 0.022942528735632184, "grad_norm": 7.610356330871582, "learning_rate": 1.505764411027569e-05, "loss": 0.5558478236198425, "num_input_tokens_seen": 161802, "step": 499, "train_runtime": 1310.7941, "train_tokens_per_second": 123.438 }, { "epoch": 0.022988505747126436, "grad_norm": 7.735250949859619, "learning_rate": 1.5047619047619049e-05, "loss": 0.49599307775497437, "num_input_tokens_seen": 162112, "step": 500, "train_runtime": 1312.7596, "train_tokens_per_second": 123.489 }, { "epoch": 0.02303448275862069, "grad_norm": 9.797597885131836, "learning_rate": 1.5037593984962406e-05, "loss": 0.4995342195034027, "num_input_tokens_seen": 162346, "step": 501, "train_runtime": 1314.8405, "train_tokens_per_second": 123.472 }, { "epoch": 0.02308045977011494, "grad_norm": 7.869985103607178, "learning_rate": 1.5027568922305766e-05, "loss": 0.4657493531703949, "num_input_tokens_seen": 162578, "step": 502, "train_runtime": 1316.8643, "train_tokens_per_second": 123.458 }, { "epoch": 0.023126436781609194, "grad_norm": 10.171713829040527, "learning_rate": 1.5017543859649124e-05, "loss": 0.5351496934890747, "num_input_tokens_seen": 162992, "step": 503, "train_runtime": 1318.9091, "train_tokens_per_second": 123.581 }, { "epoch": 0.023172413793103447, "grad_norm": 10.212080955505371, "learning_rate": 1.5007518796992481e-05, "loss": 0.4960668087005615, "num_input_tokens_seen": 163262, "step": 504, "train_runtime": 1320.9201, "train_tokens_per_second": 123.597 }, { "epoch": 0.0232183908045977, "grad_norm": 7.753813743591309, "learning_rate": 1.4997493734335841e-05, "loss": 0.5769193172454834, "num_input_tokens_seen": 163516, "step": 505, "train_runtime": 1322.9128, "train_tokens_per_second": 123.603 }, { "epoch": 0.023264367816091956, "grad_norm": 7.388118267059326, "learning_rate": 1.49874686716792e-05, "loss": 0.39474964141845703, "num_input_tokens_seen": 163770, "step": 506, "train_runtime": 1324.8763, "train_tokens_per_second": 123.612 }, { "epoch": 0.023310344827586208, "grad_norm": 7.857269287109375, "learning_rate": 1.4977443609022557e-05, "loss": 0.4135737419128418, "num_input_tokens_seen": 164132, "step": 507, "train_runtime": 1326.922, "train_tokens_per_second": 123.694 }, { "epoch": 0.02335632183908046, "grad_norm": 9.931657791137695, "learning_rate": 1.4967418546365915e-05, "loss": 0.5334938168525696, "num_input_tokens_seen": 164442, "step": 508, "train_runtime": 1328.9535, "train_tokens_per_second": 123.738 }, { "epoch": 0.023402298850574713, "grad_norm": 7.529313087463379, "learning_rate": 1.4957393483709275e-05, "loss": 0.5453150272369385, "num_input_tokens_seen": 164852, "step": 509, "train_runtime": 1330.952, "train_tokens_per_second": 123.86 }, { "epoch": 0.023448275862068966, "grad_norm": 8.382284164428711, "learning_rate": 1.4947368421052632e-05, "loss": 0.5961440205574036, "num_input_tokens_seen": 165228, "step": 510, "train_runtime": 1332.9383, "train_tokens_per_second": 123.958 }, { "epoch": 0.02349425287356322, "grad_norm": 8.244186401367188, "learning_rate": 1.493734335839599e-05, "loss": 0.6272380948066711, "num_input_tokens_seen": 165700, "step": 511, "train_runtime": 1347.7563, "train_tokens_per_second": 122.945 }, { "epoch": 0.02354022988505747, "grad_norm": 6.809892177581787, "learning_rate": 1.492731829573935e-05, "loss": 0.40072810649871826, "num_input_tokens_seen": 165926, "step": 512, "train_runtime": 1349.6926, "train_tokens_per_second": 122.936 }, { "epoch": 0.023586206896551724, "grad_norm": 6.770306587219238, "learning_rate": 1.4917293233082707e-05, "loss": 0.34396111965179443, "num_input_tokens_seen": 166178, "step": 513, "train_runtime": 1351.6389, "train_tokens_per_second": 122.946 }, { "epoch": 0.023632183908045976, "grad_norm": 8.51698112487793, "learning_rate": 1.4907268170426066e-05, "loss": 0.44032377004623413, "num_input_tokens_seen": 166540, "step": 514, "train_runtime": 1353.6505, "train_tokens_per_second": 123.03 }, { "epoch": 0.02367816091954023, "grad_norm": 7.331808567047119, "learning_rate": 1.4897243107769426e-05, "loss": 0.4877912700176239, "num_input_tokens_seen": 166802, "step": 515, "train_runtime": 1355.853, "train_tokens_per_second": 123.024 }, { "epoch": 0.02372413793103448, "grad_norm": 7.553277492523193, "learning_rate": 1.4887218045112783e-05, "loss": 0.5095426440238953, "num_input_tokens_seen": 167146, "step": 516, "train_runtime": 1357.8276, "train_tokens_per_second": 123.098 }, { "epoch": 0.023770114942528734, "grad_norm": 9.049818992614746, "learning_rate": 1.4877192982456141e-05, "loss": 0.5703203678131104, "num_input_tokens_seen": 167454, "step": 517, "train_runtime": 1359.7847, "train_tokens_per_second": 123.147 }, { "epoch": 0.02381609195402299, "grad_norm": 8.191668510437012, "learning_rate": 1.4867167919799498e-05, "loss": 0.4943529963493347, "num_input_tokens_seen": 167748, "step": 518, "train_runtime": 1361.7375, "train_tokens_per_second": 123.187 }, { "epoch": 0.023862068965517243, "grad_norm": 8.651224136352539, "learning_rate": 1.4857142857142858e-05, "loss": 0.5686701536178589, "num_input_tokens_seen": 168030, "step": 519, "train_runtime": 1363.6875, "train_tokens_per_second": 123.217 }, { "epoch": 0.023908045977011495, "grad_norm": 7.486079692840576, "learning_rate": 1.4847117794486217e-05, "loss": 0.6263479590415955, "num_input_tokens_seen": 168316, "step": 520, "train_runtime": 1365.641, "train_tokens_per_second": 123.251 }, { "epoch": 0.023954022988505748, "grad_norm": 7.435495853424072, "learning_rate": 1.4837092731829574e-05, "loss": 0.463203102350235, "num_input_tokens_seen": 168730, "step": 521, "train_runtime": 1367.6218, "train_tokens_per_second": 123.375 }, { "epoch": 0.024, "grad_norm": 9.241541862487793, "learning_rate": 1.4827067669172934e-05, "loss": 0.31005528569221497, "num_input_tokens_seen": 168992, "step": 522, "train_runtime": 1369.5807, "train_tokens_per_second": 123.39 }, { "epoch": 0.024045977011494253, "grad_norm": 7.447315692901611, "learning_rate": 1.4817042606516292e-05, "loss": 0.5688130259513855, "num_input_tokens_seen": 169278, "step": 523, "train_runtime": 1371.5402, "train_tokens_per_second": 123.422 }, { "epoch": 0.024091954022988506, "grad_norm": 8.900172233581543, "learning_rate": 1.4807017543859649e-05, "loss": 0.4629487991333008, "num_input_tokens_seen": 169518, "step": 524, "train_runtime": 1373.4644, "train_tokens_per_second": 123.424 }, { "epoch": 0.02413793103448276, "grad_norm": 7.42686653137207, "learning_rate": 1.479699248120301e-05, "loss": 0.677523672580719, "num_input_tokens_seen": 170060, "step": 525, "train_runtime": 1375.4921, "train_tokens_per_second": 123.636 }, { "epoch": 0.02418390804597701, "grad_norm": 7.977572917938232, "learning_rate": 1.4786967418546368e-05, "loss": 0.4927060902118683, "num_input_tokens_seen": 170368, "step": 526, "train_runtime": 1377.4365, "train_tokens_per_second": 123.685 }, { "epoch": 0.024229885057471263, "grad_norm": 7.594063758850098, "learning_rate": 1.4776942355889725e-05, "loss": 0.5512229204177856, "num_input_tokens_seen": 170688, "step": 527, "train_runtime": 1379.438, "train_tokens_per_second": 123.737 }, { "epoch": 0.024275862068965516, "grad_norm": 10.225115776062012, "learning_rate": 1.4766917293233083e-05, "loss": 0.45086759328842163, "num_input_tokens_seen": 170938, "step": 528, "train_runtime": 1381.404, "train_tokens_per_second": 123.742 }, { "epoch": 0.02432183908045977, "grad_norm": 8.310455322265625, "learning_rate": 1.4756892230576443e-05, "loss": 0.5467156767845154, "num_input_tokens_seen": 171270, "step": 529, "train_runtime": 1383.3557, "train_tokens_per_second": 123.808 }, { "epoch": 0.02436781609195402, "grad_norm": 8.420825004577637, "learning_rate": 1.47468671679198e-05, "loss": 0.5078372955322266, "num_input_tokens_seen": 171548, "step": 530, "train_runtime": 1385.3145, "train_tokens_per_second": 123.833 }, { "epoch": 0.024413793103448277, "grad_norm": 6.346220016479492, "learning_rate": 1.4736842105263159e-05, "loss": 0.3089922368526459, "num_input_tokens_seen": 171804, "step": 531, "train_runtime": 1387.2652, "train_tokens_per_second": 123.844 }, { "epoch": 0.02445977011494253, "grad_norm": 7.621101379394531, "learning_rate": 1.4726817042606519e-05, "loss": 0.5899746417999268, "num_input_tokens_seen": 172092, "step": 532, "train_runtime": 1389.2172, "train_tokens_per_second": 123.877 }, { "epoch": 0.024505747126436783, "grad_norm": 9.290635108947754, "learning_rate": 1.4716791979949876e-05, "loss": 0.43958860635757446, "num_input_tokens_seen": 172364, "step": 533, "train_runtime": 1391.169, "train_tokens_per_second": 123.899 }, { "epoch": 0.024551724137931035, "grad_norm": 6.2526445388793945, "learning_rate": 1.4706766917293234e-05, "loss": 0.41999557614326477, "num_input_tokens_seen": 172768, "step": 534, "train_runtime": 1393.1593, "train_tokens_per_second": 124.012 }, { "epoch": 0.024597701149425288, "grad_norm": 7.623930931091309, "learning_rate": 1.4696741854636594e-05, "loss": 0.4332103133201599, "num_input_tokens_seen": 173244, "step": 535, "train_runtime": 1395.1728, "train_tokens_per_second": 124.174 }, { "epoch": 0.02464367816091954, "grad_norm": 7.97459077835083, "learning_rate": 1.4686716791979951e-05, "loss": 0.5894046425819397, "num_input_tokens_seen": 173594, "step": 536, "train_runtime": 1397.1384, "train_tokens_per_second": 124.25 }, { "epoch": 0.024689655172413793, "grad_norm": 8.448247909545898, "learning_rate": 1.467669172932331e-05, "loss": 0.3817816376686096, "num_input_tokens_seen": 173896, "step": 537, "train_runtime": 1399.0896, "train_tokens_per_second": 124.292 }, { "epoch": 0.024735632183908045, "grad_norm": 9.263516426086426, "learning_rate": 1.4666666666666666e-05, "loss": 0.5733354091644287, "num_input_tokens_seen": 174264, "step": 538, "train_runtime": 1401.0423, "train_tokens_per_second": 124.382 }, { "epoch": 0.024781609195402298, "grad_norm": 8.889558792114258, "learning_rate": 1.4656641604010026e-05, "loss": 0.5188465118408203, "num_input_tokens_seen": 174560, "step": 539, "train_runtime": 1402.999, "train_tokens_per_second": 124.419 }, { "epoch": 0.02482758620689655, "grad_norm": 6.875885963439941, "learning_rate": 1.4646616541353385e-05, "loss": 0.4254898130893707, "num_input_tokens_seen": 174834, "step": 540, "train_runtime": 1404.9637, "train_tokens_per_second": 124.44 }, { "epoch": 0.024873563218390803, "grad_norm": 8.637484550476074, "learning_rate": 1.4636591478696742e-05, "loss": 0.6016808748245239, "num_input_tokens_seen": 175226, "step": 541, "train_runtime": 1420.1909, "train_tokens_per_second": 123.382 }, { "epoch": 0.024919540229885056, "grad_norm": 8.453070640563965, "learning_rate": 1.4626566416040102e-05, "loss": 0.5227655172348022, "num_input_tokens_seen": 175528, "step": 542, "train_runtime": 1422.1567, "train_tokens_per_second": 123.424 }, { "epoch": 0.024965517241379312, "grad_norm": 7.210037708282471, "learning_rate": 1.461654135338346e-05, "loss": 0.46860626339912415, "num_input_tokens_seen": 175844, "step": 543, "train_runtime": 1424.1666, "train_tokens_per_second": 123.472 }, { "epoch": 0.025011494252873565, "grad_norm": 7.584609508514404, "learning_rate": 1.4606516290726817e-05, "loss": 0.49540987610816956, "num_input_tokens_seen": 176076, "step": 544, "train_runtime": 1426.1361, "train_tokens_per_second": 123.464 }, { "epoch": 0.025057471264367817, "grad_norm": 10.090349197387695, "learning_rate": 1.4596491228070177e-05, "loss": 0.6143651008605957, "num_input_tokens_seen": 176392, "step": 545, "train_runtime": 1428.0895, "train_tokens_per_second": 123.516 }, { "epoch": 0.02510344827586207, "grad_norm": 7.89303731918335, "learning_rate": 1.4586466165413536e-05, "loss": 0.4946277141571045, "num_input_tokens_seen": 176704, "step": 546, "train_runtime": 1430.0562, "train_tokens_per_second": 123.564 }, { "epoch": 0.025149425287356322, "grad_norm": 8.414692878723145, "learning_rate": 1.4576441102756893e-05, "loss": 0.3559797406196594, "num_input_tokens_seen": 176988, "step": 547, "train_runtime": 1432.1087, "train_tokens_per_second": 123.586 }, { "epoch": 0.025195402298850575, "grad_norm": 9.346529006958008, "learning_rate": 1.4566416040100251e-05, "loss": 0.5622787475585938, "num_input_tokens_seen": 177306, "step": 548, "train_runtime": 1434.0917, "train_tokens_per_second": 123.636 }, { "epoch": 0.025241379310344828, "grad_norm": 8.749399185180664, "learning_rate": 1.4556390977443611e-05, "loss": 0.5060253143310547, "num_input_tokens_seen": 177578, "step": 549, "train_runtime": 1436.0715, "train_tokens_per_second": 123.655 }, { "epoch": 0.02528735632183908, "grad_norm": 7.449631214141846, "learning_rate": 1.4546365914786968e-05, "loss": 0.46381819248199463, "num_input_tokens_seen": 177886, "step": 550, "train_runtime": 1438.0329, "train_tokens_per_second": 123.701 }, { "epoch": 0.025333333333333333, "grad_norm": 6.663496017456055, "learning_rate": 1.4536340852130327e-05, "loss": 0.42148929834365845, "num_input_tokens_seen": 178454, "step": 551, "train_runtime": 1440.0625, "train_tokens_per_second": 123.921 }, { "epoch": 0.025379310344827585, "grad_norm": 7.610936164855957, "learning_rate": 1.4526315789473687e-05, "loss": 0.42065486311912537, "num_input_tokens_seen": 178674, "step": 552, "train_runtime": 1442.0126, "train_tokens_per_second": 123.906 }, { "epoch": 0.025425287356321838, "grad_norm": 7.692618370056152, "learning_rate": 1.4516290726817044e-05, "loss": 0.5608479976654053, "num_input_tokens_seen": 179156, "step": 553, "train_runtime": 1444.0085, "train_tokens_per_second": 124.069 }, { "epoch": 0.02547126436781609, "grad_norm": 8.434357643127441, "learning_rate": 1.4506265664160402e-05, "loss": 0.4691472053527832, "num_input_tokens_seen": 179438, "step": 554, "train_runtime": 1446.0222, "train_tokens_per_second": 124.091 }, { "epoch": 0.025517241379310347, "grad_norm": 8.212077140808105, "learning_rate": 1.4496240601503762e-05, "loss": 0.42718926072120667, "num_input_tokens_seen": 179764, "step": 555, "train_runtime": 1448.1529, "train_tokens_per_second": 124.133 }, { "epoch": 0.0255632183908046, "grad_norm": 10.93320083618164, "learning_rate": 1.4486215538847119e-05, "loss": 0.5911573171615601, "num_input_tokens_seen": 180104, "step": 556, "train_runtime": 1450.1192, "train_tokens_per_second": 124.199 }, { "epoch": 0.025609195402298852, "grad_norm": 8.527013778686523, "learning_rate": 1.4476190476190478e-05, "loss": 0.44520294666290283, "num_input_tokens_seen": 180362, "step": 557, "train_runtime": 1452.0722, "train_tokens_per_second": 124.21 }, { "epoch": 0.025655172413793104, "grad_norm": 8.891039848327637, "learning_rate": 1.4466165413533834e-05, "loss": 0.6029215455055237, "num_input_tokens_seen": 180728, "step": 558, "train_runtime": 1454.036, "train_tokens_per_second": 124.294 }, { "epoch": 0.025701149425287357, "grad_norm": 9.30233097076416, "learning_rate": 1.4456140350877195e-05, "loss": 0.42037826776504517, "num_input_tokens_seen": 181030, "step": 559, "train_runtime": 1456.0526, "train_tokens_per_second": 124.329 }, { "epoch": 0.02574712643678161, "grad_norm": 8.955443382263184, "learning_rate": 1.4446115288220553e-05, "loss": 0.5944176316261292, "num_input_tokens_seen": 181490, "step": 560, "train_runtime": 1458.045, "train_tokens_per_second": 124.475 }, { "epoch": 0.025793103448275862, "grad_norm": 7.375617504119873, "learning_rate": 1.443609022556391e-05, "loss": 0.5741697549819946, "num_input_tokens_seen": 181822, "step": 561, "train_runtime": 1460.0485, "train_tokens_per_second": 124.531 }, { "epoch": 0.025839080459770115, "grad_norm": 8.91295337677002, "learning_rate": 1.442606516290727e-05, "loss": 0.6684648990631104, "num_input_tokens_seen": 182246, "step": 562, "train_runtime": 1462.0756, "train_tokens_per_second": 124.649 }, { "epoch": 0.025885057471264367, "grad_norm": 10.833512306213379, "learning_rate": 1.4416040100250628e-05, "loss": 0.496807724237442, "num_input_tokens_seen": 182530, "step": 563, "train_runtime": 1464.0502, "train_tokens_per_second": 124.675 }, { "epoch": 0.02593103448275862, "grad_norm": 10.345937728881836, "learning_rate": 1.4406015037593985e-05, "loss": 0.5157930254936218, "num_input_tokens_seen": 182780, "step": 564, "train_runtime": 1466.012, "train_tokens_per_second": 124.678 }, { "epoch": 0.025977011494252873, "grad_norm": 9.86699104309082, "learning_rate": 1.4395989974937345e-05, "loss": 0.4712110161781311, "num_input_tokens_seen": 183010, "step": 565, "train_runtime": 1467.9732, "train_tokens_per_second": 124.668 }, { "epoch": 0.026022988505747125, "grad_norm": 9.507144927978516, "learning_rate": 1.4385964912280704e-05, "loss": 0.5361157655715942, "num_input_tokens_seen": 183318, "step": 566, "train_runtime": 1469.9285, "train_tokens_per_second": 124.712 }, { "epoch": 0.026068965517241378, "grad_norm": 6.866785526275635, "learning_rate": 1.437593984962406e-05, "loss": 0.47417891025543213, "num_input_tokens_seen": 183616, "step": 567, "train_runtime": 1471.8777, "train_tokens_per_second": 124.749 }, { "epoch": 0.026114942528735634, "grad_norm": 7.958737373352051, "learning_rate": 1.436591478696742e-05, "loss": 0.4230140149593353, "num_input_tokens_seen": 183896, "step": 568, "train_runtime": 1473.9123, "train_tokens_per_second": 124.767 }, { "epoch": 0.026160919540229886, "grad_norm": 8.128926277160645, "learning_rate": 1.435588972431078e-05, "loss": 0.44361788034439087, "num_input_tokens_seen": 184138, "step": 569, "train_runtime": 1475.8843, "train_tokens_per_second": 124.765 }, { "epoch": 0.02620689655172414, "grad_norm": 7.628896236419678, "learning_rate": 1.4345864661654136e-05, "loss": 0.5449480414390564, "num_input_tokens_seen": 184428, "step": 570, "train_runtime": 1477.8452, "train_tokens_per_second": 124.795 }, { "epoch": 0.02625287356321839, "grad_norm": 7.5131988525390625, "learning_rate": 1.4335839598997495e-05, "loss": 0.4566008150577545, "num_input_tokens_seen": 184716, "step": 571, "train_runtime": 1492.8443, "train_tokens_per_second": 123.734 }, { "epoch": 0.026298850574712644, "grad_norm": 8.671358108520508, "learning_rate": 1.4325814536340855e-05, "loss": 0.4438135027885437, "num_input_tokens_seen": 185020, "step": 572, "train_runtime": 1494.9389, "train_tokens_per_second": 123.764 }, { "epoch": 0.026344827586206897, "grad_norm": 7.389676570892334, "learning_rate": 1.4315789473684212e-05, "loss": 0.48613792657852173, "num_input_tokens_seen": 185470, "step": 573, "train_runtime": 1497.0691, "train_tokens_per_second": 123.889 }, { "epoch": 0.02639080459770115, "grad_norm": 6.6500139236450195, "learning_rate": 1.430576441102757e-05, "loss": 0.3395925760269165, "num_input_tokens_seen": 185710, "step": 574, "train_runtime": 1499.023, "train_tokens_per_second": 123.887 }, { "epoch": 0.026436781609195402, "grad_norm": 8.409253120422363, "learning_rate": 1.4295739348370929e-05, "loss": 0.5716714859008789, "num_input_tokens_seen": 186002, "step": 575, "train_runtime": 1501.1847, "train_tokens_per_second": 123.903 }, { "epoch": 0.026482758620689655, "grad_norm": 6.835357666015625, "learning_rate": 1.4285714285714287e-05, "loss": 0.4041152596473694, "num_input_tokens_seen": 186314, "step": 576, "train_runtime": 1503.2963, "train_tokens_per_second": 123.937 }, { "epoch": 0.026528735632183907, "grad_norm": 9.923406600952148, "learning_rate": 1.4275689223057646e-05, "loss": 0.43302974104881287, "num_input_tokens_seen": 186570, "step": 577, "train_runtime": 1505.3873, "train_tokens_per_second": 123.935 }, { "epoch": 0.02657471264367816, "grad_norm": 7.4889655113220215, "learning_rate": 1.4265664160401002e-05, "loss": 0.4781152009963989, "num_input_tokens_seen": 186848, "step": 578, "train_runtime": 1507.4908, "train_tokens_per_second": 123.946 }, { "epoch": 0.026620689655172412, "grad_norm": 6.901342391967773, "learning_rate": 1.4255639097744363e-05, "loss": 0.4876782298088074, "num_input_tokens_seen": 187148, "step": 579, "train_runtime": 1509.4421, "train_tokens_per_second": 123.985 }, { "epoch": 0.02666666666666667, "grad_norm": 7.2897257804870605, "learning_rate": 1.4245614035087721e-05, "loss": 0.4617875814437866, "num_input_tokens_seen": 187454, "step": 580, "train_runtime": 1511.411, "train_tokens_per_second": 124.026 }, { "epoch": 0.02671264367816092, "grad_norm": 7.180599212646484, "learning_rate": 1.4235588972431078e-05, "loss": 0.42690128087997437, "num_input_tokens_seen": 187736, "step": 581, "train_runtime": 1513.3662, "train_tokens_per_second": 124.052 }, { "epoch": 0.026758620689655174, "grad_norm": 7.27871561050415, "learning_rate": 1.4225563909774438e-05, "loss": 0.4229961931705475, "num_input_tokens_seen": 188106, "step": 582, "train_runtime": 1515.3431, "train_tokens_per_second": 124.134 }, { "epoch": 0.026804597701149426, "grad_norm": 8.241268157958984, "learning_rate": 1.4215538847117797e-05, "loss": 0.3600757122039795, "num_input_tokens_seen": 188354, "step": 583, "train_runtime": 1517.3128, "train_tokens_per_second": 124.137 }, { "epoch": 0.02685057471264368, "grad_norm": 8.746855735778809, "learning_rate": 1.4205513784461153e-05, "loss": 0.6030400991439819, "num_input_tokens_seen": 188624, "step": 584, "train_runtime": 1519.2549, "train_tokens_per_second": 124.156 }, { "epoch": 0.02689655172413793, "grad_norm": 8.419955253601074, "learning_rate": 1.4195488721804514e-05, "loss": 0.473530650138855, "num_input_tokens_seen": 188890, "step": 585, "train_runtime": 1521.1927, "train_tokens_per_second": 124.172 }, { "epoch": 0.026942528735632184, "grad_norm": 6.791111469268799, "learning_rate": 1.4185463659147872e-05, "loss": 0.4334329664707184, "num_input_tokens_seen": 189168, "step": 586, "train_runtime": 1523.136, "train_tokens_per_second": 124.196 }, { "epoch": 0.026988505747126437, "grad_norm": 8.257518768310547, "learning_rate": 1.4175438596491229e-05, "loss": 0.4887130856513977, "num_input_tokens_seen": 189486, "step": 587, "train_runtime": 1525.0838, "train_tokens_per_second": 124.246 }, { "epoch": 0.02703448275862069, "grad_norm": 7.643197059631348, "learning_rate": 1.4165413533834587e-05, "loss": 0.45197662711143494, "num_input_tokens_seen": 189752, "step": 588, "train_runtime": 1527.0541, "train_tokens_per_second": 124.26 }, { "epoch": 0.027080459770114942, "grad_norm": 7.756775379180908, "learning_rate": 1.4155388471177946e-05, "loss": 0.33536070585250854, "num_input_tokens_seen": 189996, "step": 589, "train_runtime": 1529.0022, "train_tokens_per_second": 124.261 }, { "epoch": 0.027126436781609194, "grad_norm": 8.067883491516113, "learning_rate": 1.4145363408521304e-05, "loss": 0.438079297542572, "num_input_tokens_seen": 190362, "step": 590, "train_runtime": 1530.98, "train_tokens_per_second": 124.34 }, { "epoch": 0.027172413793103447, "grad_norm": 8.168673515319824, "learning_rate": 1.4135338345864663e-05, "loss": 0.48280560970306396, "num_input_tokens_seen": 190668, "step": 591, "train_runtime": 1532.9365, "train_tokens_per_second": 124.381 }, { "epoch": 0.0272183908045977, "grad_norm": 8.670255661010742, "learning_rate": 1.4125313283208021e-05, "loss": 0.2864142954349518, "num_input_tokens_seen": 190886, "step": 592, "train_runtime": 1534.8748, "train_tokens_per_second": 124.366 }, { "epoch": 0.027264367816091956, "grad_norm": 7.708620548248291, "learning_rate": 1.411528822055138e-05, "loss": 0.5283160209655762, "num_input_tokens_seen": 191146, "step": 593, "train_runtime": 1536.9675, "train_tokens_per_second": 124.366 }, { "epoch": 0.027310344827586208, "grad_norm": 6.311042785644531, "learning_rate": 1.4105263157894738e-05, "loss": 0.3583904206752777, "num_input_tokens_seen": 191414, "step": 594, "train_runtime": 1538.9637, "train_tokens_per_second": 124.379 }, { "epoch": 0.02735632183908046, "grad_norm": 7.285036563873291, "learning_rate": 1.4095238095238097e-05, "loss": 0.48402440547943115, "num_input_tokens_seen": 191676, "step": 595, "train_runtime": 1540.9128, "train_tokens_per_second": 124.391 }, { "epoch": 0.027402298850574713, "grad_norm": 7.623536586761475, "learning_rate": 1.4085213032581455e-05, "loss": 0.513954222202301, "num_input_tokens_seen": 191994, "step": 596, "train_runtime": 1542.8809, "train_tokens_per_second": 124.439 }, { "epoch": 0.027448275862068966, "grad_norm": 9.271323204040527, "learning_rate": 1.4075187969924814e-05, "loss": 0.542148232460022, "num_input_tokens_seen": 192296, "step": 597, "train_runtime": 1544.8451, "train_tokens_per_second": 124.476 }, { "epoch": 0.02749425287356322, "grad_norm": 8.006948471069336, "learning_rate": 1.406516290726817e-05, "loss": 0.32228660583496094, "num_input_tokens_seen": 192524, "step": 598, "train_runtime": 1546.8082, "train_tokens_per_second": 124.465 }, { "epoch": 0.02754022988505747, "grad_norm": 7.93782377243042, "learning_rate": 1.405513784461153e-05, "loss": 0.46611687541007996, "num_input_tokens_seen": 192918, "step": 599, "train_runtime": 1548.8247, "train_tokens_per_second": 124.558 }, { "epoch": 0.027586206896551724, "grad_norm": 8.049100875854492, "learning_rate": 1.4045112781954887e-05, "loss": 0.5331852436065674, "num_input_tokens_seen": 193350, "step": 600, "train_runtime": 1550.823, "train_tokens_per_second": 124.676 }, { "epoch": 0.027586206896551724, "eval_loss": 1.7835500240325928, "eval_runtime": 54.7603, "eval_samples_per_second": 18.261, "eval_steps_per_second": 9.131, "num_input_tokens_seen": 193350, "step": 600 }, { "epoch": 0.027632183908045976, "grad_norm": 7.058294773101807, "learning_rate": 1.4035087719298246e-05, "loss": 0.38884398341178894, "num_input_tokens_seen": 193646, "step": 601, "train_runtime": 1620.5228, "train_tokens_per_second": 119.496 }, { "epoch": 0.02767816091954023, "grad_norm": 7.018427848815918, "learning_rate": 1.4025062656641606e-05, "loss": 0.35183781385421753, "num_input_tokens_seen": 193842, "step": 602, "train_runtime": 1622.4683, "train_tokens_per_second": 119.474 }, { "epoch": 0.02772413793103448, "grad_norm": 7.211747169494629, "learning_rate": 1.4015037593984963e-05, "loss": 0.5095769166946411, "num_input_tokens_seen": 194138, "step": 603, "train_runtime": 1624.4303, "train_tokens_per_second": 119.511 }, { "epoch": 0.027770114942528734, "grad_norm": 6.4296064376831055, "learning_rate": 1.4005012531328321e-05, "loss": 0.3702557682991028, "num_input_tokens_seen": 194386, "step": 604, "train_runtime": 1626.3889, "train_tokens_per_second": 119.52 }, { "epoch": 0.02781609195402299, "grad_norm": 7.240848064422607, "learning_rate": 1.3994987468671682e-05, "loss": 0.47583869099617004, "num_input_tokens_seen": 194768, "step": 605, "train_runtime": 1628.4039, "train_tokens_per_second": 119.607 }, { "epoch": 0.027862068965517243, "grad_norm": 7.305069923400879, "learning_rate": 1.3984962406015038e-05, "loss": 0.3479224443435669, "num_input_tokens_seen": 195064, "step": 606, "train_runtime": 1630.4025, "train_tokens_per_second": 119.642 }, { "epoch": 0.027908045977011495, "grad_norm": 13.084811210632324, "learning_rate": 1.3974937343358397e-05, "loss": 0.6538516879081726, "num_input_tokens_seen": 195348, "step": 607, "train_runtime": 1632.362, "train_tokens_per_second": 119.672 }, { "epoch": 0.027954022988505748, "grad_norm": 6.224904537200928, "learning_rate": 1.3964912280701755e-05, "loss": 0.34925347566604614, "num_input_tokens_seen": 195622, "step": 608, "train_runtime": 1634.3551, "train_tokens_per_second": 119.694 }, { "epoch": 0.028, "grad_norm": 8.950102806091309, "learning_rate": 1.3954887218045114e-05, "loss": 0.4487617611885071, "num_input_tokens_seen": 195882, "step": 609, "train_runtime": 1636.3192, "train_tokens_per_second": 119.709 }, { "epoch": 0.028045977011494253, "grad_norm": 5.966568946838379, "learning_rate": 1.3944862155388472e-05, "loss": 0.3355112671852112, "num_input_tokens_seen": 196228, "step": 610, "train_runtime": 1638.3262, "train_tokens_per_second": 119.773 }, { "epoch": 0.028091954022988506, "grad_norm": 11.133930206298828, "learning_rate": 1.3934837092731829e-05, "loss": 0.5155819654464722, "num_input_tokens_seen": 196598, "step": 611, "train_runtime": 1640.3305, "train_tokens_per_second": 119.853 }, { "epoch": 0.02813793103448276, "grad_norm": 7.472561836242676, "learning_rate": 1.392481203007519e-05, "loss": 0.5794181227684021, "num_input_tokens_seen": 196916, "step": 612, "train_runtime": 1642.3962, "train_tokens_per_second": 119.896 }, { "epoch": 0.02818390804597701, "grad_norm": 7.21183967590332, "learning_rate": 1.3914786967418548e-05, "loss": 0.4837031662464142, "num_input_tokens_seen": 197190, "step": 613, "train_runtime": 1644.549, "train_tokens_per_second": 119.905 }, { "epoch": 0.028229885057471264, "grad_norm": 9.273664474487305, "learning_rate": 1.3904761904761905e-05, "loss": 0.3903869390487671, "num_input_tokens_seen": 197480, "step": 614, "train_runtime": 1646.6588, "train_tokens_per_second": 119.928 }, { "epoch": 0.028275862068965516, "grad_norm": 9.718978881835938, "learning_rate": 1.3894736842105265e-05, "loss": 0.6804496049880981, "num_input_tokens_seen": 197816, "step": 615, "train_runtime": 1648.6269, "train_tokens_per_second": 119.988 }, { "epoch": 0.02832183908045977, "grad_norm": 8.028841972351074, "learning_rate": 1.3884711779448623e-05, "loss": 0.47770822048187256, "num_input_tokens_seen": 198178, "step": 616, "train_runtime": 1650.6149, "train_tokens_per_second": 120.063 }, { "epoch": 0.02836781609195402, "grad_norm": 9.076641082763672, "learning_rate": 1.387468671679198e-05, "loss": 0.4381833076477051, "num_input_tokens_seen": 198434, "step": 617, "train_runtime": 1652.564, "train_tokens_per_second": 120.076 }, { "epoch": 0.028413793103448277, "grad_norm": 8.21583080291748, "learning_rate": 1.3864661654135339e-05, "loss": 0.48954522609710693, "num_input_tokens_seen": 198828, "step": 618, "train_runtime": 1654.5543, "train_tokens_per_second": 120.17 }, { "epoch": 0.02845977011494253, "grad_norm": 8.827544212341309, "learning_rate": 1.3854636591478699e-05, "loss": 0.47703176736831665, "num_input_tokens_seen": 199120, "step": 619, "train_runtime": 1656.5184, "train_tokens_per_second": 120.204 }, { "epoch": 0.028505747126436783, "grad_norm": 6.700578212738037, "learning_rate": 1.3844611528822056e-05, "loss": 0.44256260991096497, "num_input_tokens_seen": 199418, "step": 620, "train_runtime": 1658.4664, "train_tokens_per_second": 120.242 }, { "epoch": 0.028551724137931035, "grad_norm": 10.429258346557617, "learning_rate": 1.3834586466165414e-05, "loss": 0.5015515089035034, "num_input_tokens_seen": 199744, "step": 621, "train_runtime": 1660.5068, "train_tokens_per_second": 120.291 }, { "epoch": 0.028597701149425288, "grad_norm": 6.868889331817627, "learning_rate": 1.3824561403508774e-05, "loss": 0.43400683999061584, "num_input_tokens_seen": 200088, "step": 622, "train_runtime": 1662.5546, "train_tokens_per_second": 120.35 }, { "epoch": 0.02864367816091954, "grad_norm": 8.866421699523926, "learning_rate": 1.3814536340852131e-05, "loss": 0.3786638677120209, "num_input_tokens_seen": 200356, "step": 623, "train_runtime": 1664.5177, "train_tokens_per_second": 120.369 }, { "epoch": 0.028689655172413793, "grad_norm": 7.716616153717041, "learning_rate": 1.380451127819549e-05, "loss": 0.5063319206237793, "num_input_tokens_seen": 200636, "step": 624, "train_runtime": 1666.4893, "train_tokens_per_second": 120.394 }, { "epoch": 0.028735632183908046, "grad_norm": 7.845930576324463, "learning_rate": 1.379448621553885e-05, "loss": 0.5226324796676636, "num_input_tokens_seen": 201086, "step": 625, "train_runtime": 1668.502, "train_tokens_per_second": 120.519 }, { "epoch": 0.028781609195402298, "grad_norm": 8.0442476272583, "learning_rate": 1.3784461152882206e-05, "loss": 0.5390662550926208, "num_input_tokens_seen": 201526, "step": 626, "train_runtime": 1670.499, "train_tokens_per_second": 120.638 }, { "epoch": 0.02882758620689655, "grad_norm": 7.399601459503174, "learning_rate": 1.3774436090225565e-05, "loss": 0.42423149943351746, "num_input_tokens_seen": 201884, "step": 627, "train_runtime": 1672.4675, "train_tokens_per_second": 120.71 }, { "epoch": 0.028873563218390803, "grad_norm": 7.964285850524902, "learning_rate": 1.3764411027568922e-05, "loss": 0.4824962019920349, "num_input_tokens_seen": 202188, "step": 628, "train_runtime": 1674.4263, "train_tokens_per_second": 120.751 }, { "epoch": 0.028919540229885056, "grad_norm": 8.684676170349121, "learning_rate": 1.3754385964912282e-05, "loss": 0.587040901184082, "num_input_tokens_seen": 202648, "step": 629, "train_runtime": 1676.4966, "train_tokens_per_second": 120.876 }, { "epoch": 0.028965517241379312, "grad_norm": 7.471075057983398, "learning_rate": 1.374436090225564e-05, "loss": 0.48896095156669617, "num_input_tokens_seen": 202972, "step": 630, "train_runtime": 1678.4583, "train_tokens_per_second": 120.928 }, { "epoch": 0.029011494252873565, "grad_norm": 7.523292541503906, "learning_rate": 1.3734335839598997e-05, "loss": 0.49141925573349, "num_input_tokens_seen": 203302, "step": 631, "train_runtime": 1693.1094, "train_tokens_per_second": 120.076 }, { "epoch": 0.029057471264367817, "grad_norm": 7.045520782470703, "learning_rate": 1.3724310776942357e-05, "loss": 0.515127420425415, "num_input_tokens_seen": 203906, "step": 632, "train_runtime": 1695.2235, "train_tokens_per_second": 120.283 }, { "epoch": 0.02910344827586207, "grad_norm": 6.967346668243408, "learning_rate": 1.3714285714285716e-05, "loss": 0.4676874876022339, "num_input_tokens_seen": 204196, "step": 633, "train_runtime": 1697.2192, "train_tokens_per_second": 120.312 }, { "epoch": 0.029149425287356322, "grad_norm": 7.842945575714111, "learning_rate": 1.3704260651629073e-05, "loss": 0.5667434334754944, "num_input_tokens_seen": 204538, "step": 634, "train_runtime": 1699.2623, "train_tokens_per_second": 120.369 }, { "epoch": 0.029195402298850575, "grad_norm": 10.040627479553223, "learning_rate": 1.3694235588972433e-05, "loss": 0.28221577405929565, "num_input_tokens_seen": 204780, "step": 635, "train_runtime": 1701.2622, "train_tokens_per_second": 120.369 }, { "epoch": 0.029241379310344828, "grad_norm": 8.622676849365234, "learning_rate": 1.3684210526315791e-05, "loss": 0.5731203556060791, "num_input_tokens_seen": 205136, "step": 636, "train_runtime": 1703.31, "train_tokens_per_second": 120.434 }, { "epoch": 0.02928735632183908, "grad_norm": 9.108221054077148, "learning_rate": 1.3674185463659148e-05, "loss": 0.5550015568733215, "num_input_tokens_seen": 205418, "step": 637, "train_runtime": 1705.2624, "train_tokens_per_second": 120.461 }, { "epoch": 0.029333333333333333, "grad_norm": 6.611140251159668, "learning_rate": 1.3664160401002507e-05, "loss": 0.3855544924736023, "num_input_tokens_seen": 205746, "step": 638, "train_runtime": 1707.3309, "train_tokens_per_second": 120.507 }, { "epoch": 0.029379310344827585, "grad_norm": 6.947152137756348, "learning_rate": 1.3654135338345867e-05, "loss": 0.399821937084198, "num_input_tokens_seen": 206056, "step": 639, "train_runtime": 1709.3312, "train_tokens_per_second": 120.548 }, { "epoch": 0.029425287356321838, "grad_norm": 7.046751022338867, "learning_rate": 1.3644110275689224e-05, "loss": 0.6221940517425537, "num_input_tokens_seen": 206572, "step": 640, "train_runtime": 1711.3431, "train_tokens_per_second": 120.708 }, { "epoch": 0.02947126436781609, "grad_norm": 8.085256576538086, "learning_rate": 1.3634085213032582e-05, "loss": 0.5442467927932739, "num_input_tokens_seen": 206826, "step": 641, "train_runtime": 1713.276, "train_tokens_per_second": 120.72 }, { "epoch": 0.029517241379310343, "grad_norm": 9.777151107788086, "learning_rate": 1.3624060150375942e-05, "loss": 0.5079631209373474, "num_input_tokens_seen": 207134, "step": 642, "train_runtime": 1715.221, "train_tokens_per_second": 120.762 }, { "epoch": 0.0295632183908046, "grad_norm": 8.128308296203613, "learning_rate": 1.3614035087719299e-05, "loss": 0.4377592206001282, "num_input_tokens_seen": 207388, "step": 643, "train_runtime": 1717.174, "train_tokens_per_second": 120.773 }, { "epoch": 0.029609195402298852, "grad_norm": 7.2447662353515625, "learning_rate": 1.3604010025062658e-05, "loss": 0.6402813792228699, "num_input_tokens_seen": 207848, "step": 644, "train_runtime": 1719.1667, "train_tokens_per_second": 120.9 }, { "epoch": 0.029655172413793104, "grad_norm": 6.542693614959717, "learning_rate": 1.3593984962406018e-05, "loss": 0.3917843997478485, "num_input_tokens_seen": 208120, "step": 645, "train_runtime": 1721.1133, "train_tokens_per_second": 120.922 }, { "epoch": 0.029701149425287357, "grad_norm": 9.332645416259766, "learning_rate": 1.3583959899749374e-05, "loss": 0.3541853129863739, "num_input_tokens_seen": 208334, "step": 646, "train_runtime": 1723.0478, "train_tokens_per_second": 120.91 }, { "epoch": 0.02974712643678161, "grad_norm": 8.380578994750977, "learning_rate": 1.3573934837092733e-05, "loss": 0.49306660890579224, "num_input_tokens_seen": 208630, "step": 647, "train_runtime": 1725.0058, "train_tokens_per_second": 120.945 }, { "epoch": 0.029793103448275862, "grad_norm": 7.993964195251465, "learning_rate": 1.356390977443609e-05, "loss": 0.4118781089782715, "num_input_tokens_seen": 208944, "step": 648, "train_runtime": 1726.986, "train_tokens_per_second": 120.988 }, { "epoch": 0.029839080459770115, "grad_norm": 7.586103439331055, "learning_rate": 1.355388471177945e-05, "loss": 0.4668120741844177, "num_input_tokens_seen": 209338, "step": 649, "train_runtime": 1728.9893, "train_tokens_per_second": 121.075 }, { "epoch": 0.029885057471264367, "grad_norm": 6.804312229156494, "learning_rate": 1.3543859649122808e-05, "loss": 0.4309317171573639, "num_input_tokens_seen": 209632, "step": 650, "train_runtime": 1731.0188, "train_tokens_per_second": 121.103 }, { "epoch": 0.02993103448275862, "grad_norm": 8.213543891906738, "learning_rate": 1.3533834586466165e-05, "loss": 0.4724840521812439, "num_input_tokens_seen": 210066, "step": 651, "train_runtime": 1733.0485, "train_tokens_per_second": 121.212 }, { "epoch": 0.029977011494252873, "grad_norm": 7.234861373901367, "learning_rate": 1.3523809523809525e-05, "loss": 0.4469287693500519, "num_input_tokens_seen": 210416, "step": 652, "train_runtime": 1735.0305, "train_tokens_per_second": 121.275 }, { "epoch": 0.030022988505747125, "grad_norm": 8.447935104370117, "learning_rate": 1.3513784461152884e-05, "loss": 0.4970450699329376, "num_input_tokens_seen": 210684, "step": 653, "train_runtime": 1737.0663, "train_tokens_per_second": 121.287 }, { "epoch": 0.030068965517241378, "grad_norm": 6.736108303070068, "learning_rate": 1.350375939849624e-05, "loss": 0.42876240611076355, "num_input_tokens_seen": 211004, "step": 654, "train_runtime": 1739.0767, "train_tokens_per_second": 121.331 }, { "epoch": 0.030114942528735634, "grad_norm": 8.359664916992188, "learning_rate": 1.3493734335839601e-05, "loss": 0.4727824330329895, "num_input_tokens_seen": 211294, "step": 655, "train_runtime": 1741.0635, "train_tokens_per_second": 121.359 }, { "epoch": 0.030160919540229886, "grad_norm": 6.793044090270996, "learning_rate": 1.348370927318296e-05, "loss": 0.4805864095687866, "num_input_tokens_seen": 211812, "step": 656, "train_runtime": 1743.0757, "train_tokens_per_second": 121.516 }, { "epoch": 0.03020689655172414, "grad_norm": 8.12999153137207, "learning_rate": 1.3473684210526316e-05, "loss": 0.5290884971618652, "num_input_tokens_seen": 212122, "step": 657, "train_runtime": 1745.1085, "train_tokens_per_second": 121.552 }, { "epoch": 0.03025287356321839, "grad_norm": 9.024924278259277, "learning_rate": 1.3463659147869675e-05, "loss": 0.4053267240524292, "num_input_tokens_seen": 212400, "step": 658, "train_runtime": 1747.0701, "train_tokens_per_second": 121.575 }, { "epoch": 0.030298850574712644, "grad_norm": 7.814553260803223, "learning_rate": 1.3453634085213035e-05, "loss": 0.41010433435440063, "num_input_tokens_seen": 212696, "step": 659, "train_runtime": 1749.0533, "train_tokens_per_second": 121.606 }, { "epoch": 0.030344827586206897, "grad_norm": 7.647894859313965, "learning_rate": 1.3443609022556392e-05, "loss": 0.5449205040931702, "num_input_tokens_seen": 213122, "step": 660, "train_runtime": 1751.0473, "train_tokens_per_second": 121.711 }, { "epoch": 0.03039080459770115, "grad_norm": 7.343043327331543, "learning_rate": 1.343358395989975e-05, "loss": 0.4413844645023346, "num_input_tokens_seen": 213422, "step": 661, "train_runtime": 1766.4526, "train_tokens_per_second": 120.82 }, { "epoch": 0.030436781609195402, "grad_norm": 7.271646976470947, "learning_rate": 1.342355889724311e-05, "loss": 0.4377230107784271, "num_input_tokens_seen": 213646, "step": 662, "train_runtime": 1768.5021, "train_tokens_per_second": 120.806 }, { "epoch": 0.030482758620689655, "grad_norm": 9.043072700500488, "learning_rate": 1.3413533834586467e-05, "loss": 0.6550434231758118, "num_input_tokens_seen": 213968, "step": 663, "train_runtime": 1770.4631, "train_tokens_per_second": 120.854 }, { "epoch": 0.030528735632183907, "grad_norm": 7.99835205078125, "learning_rate": 1.3403508771929826e-05, "loss": 0.4773554503917694, "num_input_tokens_seen": 214184, "step": 664, "train_runtime": 1772.4789, "train_tokens_per_second": 120.839 }, { "epoch": 0.03057471264367816, "grad_norm": 7.9440484046936035, "learning_rate": 1.3393483709273186e-05, "loss": 0.43905895948410034, "num_input_tokens_seen": 214490, "step": 665, "train_runtime": 1774.4847, "train_tokens_per_second": 120.875 }, { "epoch": 0.030620689655172412, "grad_norm": 9.001914024353027, "learning_rate": 1.3383458646616543e-05, "loss": 0.4448626637458801, "num_input_tokens_seen": 214836, "step": 666, "train_runtime": 1776.5169, "train_tokens_per_second": 120.931 }, { "epoch": 0.030666666666666665, "grad_norm": 6.8270487785339355, "learning_rate": 1.3373433583959901e-05, "loss": 0.31435269117355347, "num_input_tokens_seen": 215078, "step": 667, "train_runtime": 1778.4645, "train_tokens_per_second": 120.935 }, { "epoch": 0.03071264367816092, "grad_norm": 6.213423252105713, "learning_rate": 1.3363408521303258e-05, "loss": 0.41751205921173096, "num_input_tokens_seen": 215408, "step": 668, "train_runtime": 1780.4957, "train_tokens_per_second": 120.982 }, { "epoch": 0.030758620689655174, "grad_norm": 8.144896507263184, "learning_rate": 1.3353383458646618e-05, "loss": 0.439815878868103, "num_input_tokens_seen": 215810, "step": 669, "train_runtime": 1782.4866, "train_tokens_per_second": 121.072 }, { "epoch": 0.030804597701149426, "grad_norm": 6.508113861083984, "learning_rate": 1.3343358395989977e-05, "loss": 0.44854140281677246, "num_input_tokens_seen": 216114, "step": 670, "train_runtime": 1784.4499, "train_tokens_per_second": 121.11 }, { "epoch": 0.03085057471264368, "grad_norm": 7.181475639343262, "learning_rate": 1.3333333333333333e-05, "loss": 0.458507776260376, "num_input_tokens_seen": 216458, "step": 671, "train_runtime": 1786.4038, "train_tokens_per_second": 121.17 }, { "epoch": 0.03089655172413793, "grad_norm": 7.080460071563721, "learning_rate": 1.3323308270676693e-05, "loss": 0.4886537790298462, "num_input_tokens_seen": 216726, "step": 672, "train_runtime": 1788.3541, "train_tokens_per_second": 121.187 }, { "epoch": 0.030942528735632184, "grad_norm": 8.234830856323242, "learning_rate": 1.3313283208020052e-05, "loss": 0.4340991973876953, "num_input_tokens_seen": 217042, "step": 673, "train_runtime": 1790.3403, "train_tokens_per_second": 121.229 }, { "epoch": 0.030988505747126437, "grad_norm": 7.746073246002197, "learning_rate": 1.3303258145363409e-05, "loss": 0.4000415802001953, "num_input_tokens_seen": 217282, "step": 674, "train_runtime": 1792.3022, "train_tokens_per_second": 121.231 }, { "epoch": 0.03103448275862069, "grad_norm": 6.61154842376709, "learning_rate": 1.3293233082706769e-05, "loss": 0.4018608033657074, "num_input_tokens_seen": 217612, "step": 675, "train_runtime": 1794.2664, "train_tokens_per_second": 121.282 }, { "epoch": 0.031080459770114942, "grad_norm": 6.929211616516113, "learning_rate": 1.3283208020050127e-05, "loss": 0.4212467074394226, "num_input_tokens_seen": 217870, "step": 676, "train_runtime": 1796.2241, "train_tokens_per_second": 121.293 }, { "epoch": 0.031126436781609194, "grad_norm": 7.709577560424805, "learning_rate": 1.3273182957393484e-05, "loss": 0.5369236469268799, "num_input_tokens_seen": 218218, "step": 677, "train_runtime": 1798.1968, "train_tokens_per_second": 121.354 }, { "epoch": 0.031172413793103447, "grad_norm": 7.48252534866333, "learning_rate": 1.3263157894736843e-05, "loss": 0.44973501563072205, "num_input_tokens_seen": 218512, "step": 678, "train_runtime": 1800.1588, "train_tokens_per_second": 121.385 }, { "epoch": 0.0312183908045977, "grad_norm": 9.012537956237793, "learning_rate": 1.3253132832080203e-05, "loss": 0.49290916323661804, "num_input_tokens_seen": 218816, "step": 679, "train_runtime": 1802.1136, "train_tokens_per_second": 121.422 }, { "epoch": 0.03126436781609195, "grad_norm": 6.668360710144043, "learning_rate": 1.324310776942356e-05, "loss": 0.4302211105823517, "num_input_tokens_seen": 219348, "step": 680, "train_runtime": 1804.1024, "train_tokens_per_second": 121.583 }, { "epoch": 0.031310344827586205, "grad_norm": 7.369109630584717, "learning_rate": 1.3233082706766918e-05, "loss": 0.42139798402786255, "num_input_tokens_seen": 219638, "step": 681, "train_runtime": 1806.0623, "train_tokens_per_second": 121.612 }, { "epoch": 0.03135632183908046, "grad_norm": 7.988426208496094, "learning_rate": 1.3223057644110278e-05, "loss": 0.47020840644836426, "num_input_tokens_seen": 219914, "step": 682, "train_runtime": 1808.0479, "train_tokens_per_second": 121.631 }, { "epoch": 0.03140229885057471, "grad_norm": 7.562366962432861, "learning_rate": 1.3213032581453635e-05, "loss": 0.43431341648101807, "num_input_tokens_seen": 220154, "step": 683, "train_runtime": 1810.007, "train_tokens_per_second": 121.632 }, { "epoch": 0.03144827586206896, "grad_norm": 7.61648416519165, "learning_rate": 1.3203007518796994e-05, "loss": 0.49406546354293823, "num_input_tokens_seen": 220442, "step": 684, "train_runtime": 1811.9616, "train_tokens_per_second": 121.659 }, { "epoch": 0.031494252873563215, "grad_norm": 6.642371654510498, "learning_rate": 1.3192982456140354e-05, "loss": 0.4200516641139984, "num_input_tokens_seen": 220808, "step": 685, "train_runtime": 1813.9428, "train_tokens_per_second": 121.728 }, { "epoch": 0.031540229885057475, "grad_norm": 7.991518020629883, "learning_rate": 1.318295739348371e-05, "loss": 0.3903042674064636, "num_input_tokens_seen": 221096, "step": 686, "train_runtime": 1815.8973, "train_tokens_per_second": 121.756 }, { "epoch": 0.03158620689655173, "grad_norm": 8.292240142822266, "learning_rate": 1.3172932330827069e-05, "loss": 0.4748704135417938, "num_input_tokens_seen": 221604, "step": 687, "train_runtime": 1817.9524, "train_tokens_per_second": 121.898 }, { "epoch": 0.03163218390804598, "grad_norm": 8.80848503112793, "learning_rate": 1.3162907268170426e-05, "loss": 0.5277791619300842, "num_input_tokens_seen": 221920, "step": 688, "train_runtime": 1819.9307, "train_tokens_per_second": 121.939 }, { "epoch": 0.03167816091954023, "grad_norm": 11.570622444152832, "learning_rate": 1.3152882205513786e-05, "loss": 0.4864501953125, "num_input_tokens_seen": 222230, "step": 689, "train_runtime": 1821.917, "train_tokens_per_second": 121.976 }, { "epoch": 0.031724137931034485, "grad_norm": 9.256178855895996, "learning_rate": 1.3142857142857145e-05, "loss": 0.5053106546401978, "num_input_tokens_seen": 222514, "step": 690, "train_runtime": 1823.933, "train_tokens_per_second": 121.997 }, { "epoch": 0.03177011494252874, "grad_norm": 7.844667911529541, "learning_rate": 1.3132832080200501e-05, "loss": 0.5310298800468445, "num_input_tokens_seen": 222826, "step": 691, "train_runtime": 1838.7833, "train_tokens_per_second": 121.181 }, { "epoch": 0.03181609195402299, "grad_norm": 8.256976127624512, "learning_rate": 1.3122807017543862e-05, "loss": 0.48716580867767334, "num_input_tokens_seen": 223188, "step": 692, "train_runtime": 1840.7512, "train_tokens_per_second": 121.248 }, { "epoch": 0.03186206896551724, "grad_norm": 7.259397983551025, "learning_rate": 1.311278195488722e-05, "loss": 0.36275187134742737, "num_input_tokens_seen": 223438, "step": 693, "train_runtime": 1842.7643, "train_tokens_per_second": 121.252 }, { "epoch": 0.031908045977011495, "grad_norm": 7.258387565612793, "learning_rate": 1.3102756892230577e-05, "loss": 0.45881396532058716, "num_input_tokens_seen": 223742, "step": 694, "train_runtime": 1844.7174, "train_tokens_per_second": 121.288 }, { "epoch": 0.03195402298850575, "grad_norm": 9.610076904296875, "learning_rate": 1.3092731829573937e-05, "loss": 0.48475897312164307, "num_input_tokens_seen": 224166, "step": 695, "train_runtime": 1846.714, "train_tokens_per_second": 121.386 }, { "epoch": 0.032, "grad_norm": 8.098437309265137, "learning_rate": 1.3082706766917295e-05, "loss": 0.5809595584869385, "num_input_tokens_seen": 224542, "step": 696, "train_runtime": 1848.7338, "train_tokens_per_second": 121.457 }, { "epoch": 0.03204597701149425, "grad_norm": 8.92160415649414, "learning_rate": 1.3072681704260652e-05, "loss": 0.5239991545677185, "num_input_tokens_seen": 224844, "step": 697, "train_runtime": 1850.6894, "train_tokens_per_second": 121.492 }, { "epoch": 0.032091954022988506, "grad_norm": 7.095712184906006, "learning_rate": 1.306265664160401e-05, "loss": 0.3632602095603943, "num_input_tokens_seen": 225148, "step": 698, "train_runtime": 1852.6457, "train_tokens_per_second": 121.528 }, { "epoch": 0.03213793103448276, "grad_norm": 7.637246608734131, "learning_rate": 1.305263157894737e-05, "loss": 0.34871622920036316, "num_input_tokens_seen": 225412, "step": 699, "train_runtime": 1854.6345, "train_tokens_per_second": 121.54 }, { "epoch": 0.03218390804597701, "grad_norm": 8.343865394592285, "learning_rate": 1.3042606516290728e-05, "loss": 0.44183212518692017, "num_input_tokens_seen": 225652, "step": 700, "train_runtime": 1856.5783, "train_tokens_per_second": 121.542 }, { "epoch": 0.032229885057471264, "grad_norm": 8.810320854187012, "learning_rate": 1.3032581453634086e-05, "loss": 0.43702125549316406, "num_input_tokens_seen": 225910, "step": 701, "train_runtime": 1858.5502, "train_tokens_per_second": 121.552 }, { "epoch": 0.032275862068965516, "grad_norm": 7.387729167938232, "learning_rate": 1.3022556390977445e-05, "loss": 0.4800367057323456, "num_input_tokens_seen": 226198, "step": 702, "train_runtime": 1860.6122, "train_tokens_per_second": 121.572 }, { "epoch": 0.03232183908045977, "grad_norm": 7.299515724182129, "learning_rate": 1.3012531328320803e-05, "loss": 0.5099941492080688, "num_input_tokens_seen": 226596, "step": 703, "train_runtime": 1862.7084, "train_tokens_per_second": 121.649 }, { "epoch": 0.03236781609195402, "grad_norm": 7.442165374755859, "learning_rate": 1.3002506265664162e-05, "loss": 0.43732163310050964, "num_input_tokens_seen": 226820, "step": 704, "train_runtime": 1864.6852, "train_tokens_per_second": 121.64 }, { "epoch": 0.032413793103448274, "grad_norm": 7.282296657562256, "learning_rate": 1.299248120300752e-05, "loss": 0.5136317014694214, "num_input_tokens_seen": 227138, "step": 705, "train_runtime": 1866.6787, "train_tokens_per_second": 121.68 }, { "epoch": 0.03245977011494253, "grad_norm": 7.085516452789307, "learning_rate": 1.2982456140350879e-05, "loss": 0.5167177319526672, "num_input_tokens_seen": 227500, "step": 706, "train_runtime": 1868.7934, "train_tokens_per_second": 121.736 }, { "epoch": 0.03250574712643678, "grad_norm": 7.478757381439209, "learning_rate": 1.2972431077694237e-05, "loss": 0.6133139133453369, "num_input_tokens_seen": 227880, "step": 707, "train_runtime": 1870.8257, "train_tokens_per_second": 121.807 }, { "epoch": 0.03255172413793103, "grad_norm": 7.987599849700928, "learning_rate": 1.2962406015037594e-05, "loss": 0.5924161076545715, "num_input_tokens_seen": 228290, "step": 708, "train_runtime": 1872.8476, "train_tokens_per_second": 121.895 }, { "epoch": 0.032597701149425284, "grad_norm": 7.35952615737915, "learning_rate": 1.2952380952380954e-05, "loss": 0.37251582741737366, "num_input_tokens_seen": 228566, "step": 709, "train_runtime": 1874.7947, "train_tokens_per_second": 121.915 }, { "epoch": 0.03264367816091954, "grad_norm": 8.810981750488281, "learning_rate": 1.2942355889724313e-05, "loss": 0.47795727849006653, "num_input_tokens_seen": 228802, "step": 710, "train_runtime": 1876.7411, "train_tokens_per_second": 121.915 }, { "epoch": 0.0326896551724138, "grad_norm": 7.858730316162109, "learning_rate": 1.293233082706767e-05, "loss": 0.5269241333007812, "num_input_tokens_seen": 229110, "step": 711, "train_runtime": 1878.7187, "train_tokens_per_second": 121.95 }, { "epoch": 0.03273563218390805, "grad_norm": 8.294468879699707, "learning_rate": 1.292230576441103e-05, "loss": 0.45605868101119995, "num_input_tokens_seen": 229390, "step": 712, "train_runtime": 1880.6647, "train_tokens_per_second": 121.973 }, { "epoch": 0.0327816091954023, "grad_norm": 10.320055961608887, "learning_rate": 1.2912280701754386e-05, "loss": 0.5948427319526672, "num_input_tokens_seen": 229800, "step": 713, "train_runtime": 1882.6606, "train_tokens_per_second": 122.061 }, { "epoch": 0.032827586206896554, "grad_norm": 7.579660892486572, "learning_rate": 1.2902255639097745e-05, "loss": 0.550399899482727, "num_input_tokens_seen": 230112, "step": 714, "train_runtime": 1884.6154, "train_tokens_per_second": 122.1 }, { "epoch": 0.03287356321839081, "grad_norm": 6.343344211578369, "learning_rate": 1.2892230576441105e-05, "loss": 0.4625878930091858, "num_input_tokens_seen": 230484, "step": 715, "train_runtime": 1886.5964, "train_tokens_per_second": 122.169 }, { "epoch": 0.03291954022988506, "grad_norm": 6.889019966125488, "learning_rate": 1.2882205513784462e-05, "loss": 0.4150872230529785, "num_input_tokens_seen": 230778, "step": 716, "train_runtime": 1888.5437, "train_tokens_per_second": 122.199 }, { "epoch": 0.03296551724137931, "grad_norm": 7.413138389587402, "learning_rate": 1.287218045112782e-05, "loss": 0.4648476243019104, "num_input_tokens_seen": 231080, "step": 717, "train_runtime": 1890.5258, "train_tokens_per_second": 122.231 }, { "epoch": 0.033011494252873565, "grad_norm": 5.9188995361328125, "learning_rate": 1.2862155388471179e-05, "loss": 0.27306920289993286, "num_input_tokens_seen": 231318, "step": 718, "train_runtime": 1892.4846, "train_tokens_per_second": 122.23 }, { "epoch": 0.03305747126436782, "grad_norm": 7.059986114501953, "learning_rate": 1.2852130325814537e-05, "loss": 0.4230448305606842, "num_input_tokens_seen": 231628, "step": 719, "train_runtime": 1894.4493, "train_tokens_per_second": 122.267 }, { "epoch": 0.03310344827586207, "grad_norm": 8.006654739379883, "learning_rate": 1.2842105263157896e-05, "loss": 0.5292198061943054, "num_input_tokens_seen": 231958, "step": 720, "train_runtime": 1896.4044, "train_tokens_per_second": 122.315 }, { "epoch": 0.03314942528735632, "grad_norm": 8.713791847229004, "learning_rate": 1.2832080200501254e-05, "loss": 0.4419120252132416, "num_input_tokens_seen": 232242, "step": 721, "train_runtime": 1911.0895, "train_tokens_per_second": 121.523 }, { "epoch": 0.033195402298850575, "grad_norm": 7.501795768737793, "learning_rate": 1.2822055137844613e-05, "loss": 0.47290876507759094, "num_input_tokens_seen": 232524, "step": 722, "train_runtime": 1913.0366, "train_tokens_per_second": 121.547 }, { "epoch": 0.03324137931034483, "grad_norm": 6.713019847869873, "learning_rate": 1.2812030075187971e-05, "loss": 0.5273690223693848, "num_input_tokens_seen": 233128, "step": 723, "train_runtime": 1915.0886, "train_tokens_per_second": 121.732 }, { "epoch": 0.03328735632183908, "grad_norm": 6.822129249572754, "learning_rate": 1.2802005012531328e-05, "loss": 0.4337116479873657, "num_input_tokens_seen": 233550, "step": 724, "train_runtime": 1917.1347, "train_tokens_per_second": 121.822 }, { "epoch": 0.03333333333333333, "grad_norm": 6.972231388092041, "learning_rate": 1.2791979949874688e-05, "loss": 0.4706537127494812, "num_input_tokens_seen": 233794, "step": 725, "train_runtime": 1919.1695, "train_tokens_per_second": 121.82 }, { "epoch": 0.033379310344827585, "grad_norm": 6.156042575836182, "learning_rate": 1.2781954887218047e-05, "loss": 0.3718259334564209, "num_input_tokens_seen": 234110, "step": 726, "train_runtime": 1921.183, "train_tokens_per_second": 121.857 }, { "epoch": 0.03342528735632184, "grad_norm": 7.888618469238281, "learning_rate": 1.2771929824561404e-05, "loss": 0.36061882972717285, "num_input_tokens_seen": 234418, "step": 727, "train_runtime": 1923.2046, "train_tokens_per_second": 121.889 }, { "epoch": 0.03347126436781609, "grad_norm": 7.973721981048584, "learning_rate": 1.2761904761904762e-05, "loss": 0.3296748399734497, "num_input_tokens_seen": 234710, "step": 728, "train_runtime": 1925.1532, "train_tokens_per_second": 121.918 }, { "epoch": 0.03351724137931034, "grad_norm": 6.52110481262207, "learning_rate": 1.2751879699248122e-05, "loss": 0.454277902841568, "num_input_tokens_seen": 234990, "step": 729, "train_runtime": 1927.1264, "train_tokens_per_second": 121.938 }, { "epoch": 0.033563218390804596, "grad_norm": 7.006773948669434, "learning_rate": 1.2741854636591479e-05, "loss": 0.4588077664375305, "num_input_tokens_seen": 235280, "step": 730, "train_runtime": 1929.1047, "train_tokens_per_second": 121.963 }, { "epoch": 0.03360919540229885, "grad_norm": 7.811942100524902, "learning_rate": 1.2731829573934837e-05, "loss": 0.5093876123428345, "num_input_tokens_seen": 235590, "step": 731, "train_runtime": 1931.0677, "train_tokens_per_second": 122.0 }, { "epoch": 0.0336551724137931, "grad_norm": 9.06869125366211, "learning_rate": 1.2721804511278198e-05, "loss": 0.501866340637207, "num_input_tokens_seen": 235878, "step": 732, "train_runtime": 1933.0266, "train_tokens_per_second": 122.025 }, { "epoch": 0.033701149425287354, "grad_norm": 7.744815349578857, "learning_rate": 1.2711779448621554e-05, "loss": 0.5169853568077087, "num_input_tokens_seen": 236118, "step": 733, "train_runtime": 1934.9909, "train_tokens_per_second": 122.025 }, { "epoch": 0.033747126436781606, "grad_norm": 8.02056884765625, "learning_rate": 1.2701754385964913e-05, "loss": 0.4525764286518097, "num_input_tokens_seen": 236362, "step": 734, "train_runtime": 1936.9662, "train_tokens_per_second": 122.027 }, { "epoch": 0.03379310344827586, "grad_norm": 7.841916561126709, "learning_rate": 1.2691729323308273e-05, "loss": 0.44451504945755005, "num_input_tokens_seen": 236674, "step": 735, "train_runtime": 1938.9437, "train_tokens_per_second": 122.063 }, { "epoch": 0.03383908045977012, "grad_norm": 8.466221809387207, "learning_rate": 1.268170426065163e-05, "loss": 0.5051043033599854, "num_input_tokens_seen": 236960, "step": 736, "train_runtime": 1940.9267, "train_tokens_per_second": 122.086 }, { "epoch": 0.03388505747126437, "grad_norm": 8.845619201660156, "learning_rate": 1.2671679197994988e-05, "loss": 0.5814340710639954, "num_input_tokens_seen": 237332, "step": 737, "train_runtime": 1942.9296, "train_tokens_per_second": 122.152 }, { "epoch": 0.033931034482758624, "grad_norm": 8.570676803588867, "learning_rate": 1.2661654135338345e-05, "loss": 0.42572882771492004, "num_input_tokens_seen": 237562, "step": 738, "train_runtime": 1944.9096, "train_tokens_per_second": 122.146 }, { "epoch": 0.033977011494252876, "grad_norm": 8.907341957092285, "learning_rate": 1.2651629072681705e-05, "loss": 0.32531145215034485, "num_input_tokens_seen": 237810, "step": 739, "train_runtime": 1946.8737, "train_tokens_per_second": 122.15 }, { "epoch": 0.03402298850574713, "grad_norm": 7.892190933227539, "learning_rate": 1.2641604010025064e-05, "loss": 0.39891165494918823, "num_input_tokens_seen": 238072, "step": 740, "train_runtime": 1948.8155, "train_tokens_per_second": 122.162 }, { "epoch": 0.03406896551724138, "grad_norm": 8.642949104309082, "learning_rate": 1.263157894736842e-05, "loss": 0.4310913383960724, "num_input_tokens_seen": 238384, "step": 741, "train_runtime": 1950.807, "train_tokens_per_second": 122.198 }, { "epoch": 0.034114942528735634, "grad_norm": 7.021979331970215, "learning_rate": 1.262155388471178e-05, "loss": 0.30681487917900085, "num_input_tokens_seen": 238654, "step": 742, "train_runtime": 1952.7593, "train_tokens_per_second": 122.214 }, { "epoch": 0.034160919540229887, "grad_norm": 8.602571487426758, "learning_rate": 1.261152882205514e-05, "loss": 0.56992107629776, "num_input_tokens_seen": 239044, "step": 743, "train_runtime": 1954.7455, "train_tokens_per_second": 122.289 }, { "epoch": 0.03420689655172414, "grad_norm": 8.6575927734375, "learning_rate": 1.2601503759398496e-05, "loss": 0.5144814252853394, "num_input_tokens_seen": 239334, "step": 744, "train_runtime": 1956.7685, "train_tokens_per_second": 122.311 }, { "epoch": 0.03425287356321839, "grad_norm": 7.739847660064697, "learning_rate": 1.2591478696741856e-05, "loss": 0.43455153703689575, "num_input_tokens_seen": 239608, "step": 745, "train_runtime": 1958.8685, "train_tokens_per_second": 122.32 }, { "epoch": 0.034298850574712644, "grad_norm": 8.102360725402832, "learning_rate": 1.2581453634085215e-05, "loss": 0.5057243704795837, "num_input_tokens_seen": 239894, "step": 746, "train_runtime": 1960.9181, "train_tokens_per_second": 122.338 }, { "epoch": 0.0343448275862069, "grad_norm": 7.547651290893555, "learning_rate": 1.2571428571428572e-05, "loss": 0.5827213525772095, "num_input_tokens_seen": 240464, "step": 747, "train_runtime": 1962.9819, "train_tokens_per_second": 122.499 }, { "epoch": 0.03439080459770115, "grad_norm": 8.792771339416504, "learning_rate": 1.256140350877193e-05, "loss": 0.5615402460098267, "num_input_tokens_seen": 240774, "step": 748, "train_runtime": 1964.9332, "train_tokens_per_second": 122.535 }, { "epoch": 0.0344367816091954, "grad_norm": 9.596569061279297, "learning_rate": 1.255137844611529e-05, "loss": 0.3781774640083313, "num_input_tokens_seen": 241046, "step": 749, "train_runtime": 1966.9508, "train_tokens_per_second": 122.548 }, { "epoch": 0.034482758620689655, "grad_norm": 8.446516036987305, "learning_rate": 1.2541353383458647e-05, "loss": 0.5088064074516296, "num_input_tokens_seen": 241522, "step": 750, "train_runtime": 1968.9682, "train_tokens_per_second": 122.664 }, { "epoch": 0.03452873563218391, "grad_norm": 7.82168436050415, "learning_rate": 1.2531328320802006e-05, "loss": 0.4287633001804352, "num_input_tokens_seen": 241790, "step": 751, "train_runtime": 1983.9727, "train_tokens_per_second": 121.872 }, { "epoch": 0.03457471264367816, "grad_norm": 7.16981840133667, "learning_rate": 1.2521303258145366e-05, "loss": 0.486166775226593, "num_input_tokens_seen": 242142, "step": 752, "train_runtime": 1985.9572, "train_tokens_per_second": 121.927 }, { "epoch": 0.03462068965517241, "grad_norm": 8.633017539978027, "learning_rate": 1.2511278195488723e-05, "loss": 0.39653506875038147, "num_input_tokens_seen": 242408, "step": 753, "train_runtime": 1987.9791, "train_tokens_per_second": 121.937 }, { "epoch": 0.034666666666666665, "grad_norm": 8.903992652893066, "learning_rate": 1.2501253132832081e-05, "loss": 0.4707050323486328, "num_input_tokens_seen": 242926, "step": 754, "train_runtime": 1990.017, "train_tokens_per_second": 122.072 }, { "epoch": 0.03471264367816092, "grad_norm": 10.9977388381958, "learning_rate": 1.2491228070175441e-05, "loss": 0.3755106031894684, "num_input_tokens_seen": 243162, "step": 755, "train_runtime": 1992.034, "train_tokens_per_second": 122.067 }, { "epoch": 0.03475862068965517, "grad_norm": 8.29912281036377, "learning_rate": 1.2481203007518798e-05, "loss": 0.5001455545425415, "num_input_tokens_seen": 243460, "step": 756, "train_runtime": 1994.0761, "train_tokens_per_second": 122.092 }, { "epoch": 0.03480459770114942, "grad_norm": 7.330634117126465, "learning_rate": 1.2471177944862156e-05, "loss": 0.529636561870575, "num_input_tokens_seen": 243786, "step": 757, "train_runtime": 1996.0372, "train_tokens_per_second": 122.135 }, { "epoch": 0.034850574712643675, "grad_norm": 6.908694267272949, "learning_rate": 1.2461152882205513e-05, "loss": 0.287724107503891, "num_input_tokens_seen": 244026, "step": 758, "train_runtime": 1998.0191, "train_tokens_per_second": 122.134 }, { "epoch": 0.03489655172413793, "grad_norm": 7.529731750488281, "learning_rate": 1.2451127819548873e-05, "loss": 0.5130578875541687, "num_input_tokens_seen": 244366, "step": 759, "train_runtime": 2000.0437, "train_tokens_per_second": 122.18 }, { "epoch": 0.03494252873563218, "grad_norm": 8.070693016052246, "learning_rate": 1.2441102756892232e-05, "loss": 0.39174437522888184, "num_input_tokens_seen": 244746, "step": 760, "train_runtime": 2002.1149, "train_tokens_per_second": 122.244 }, { "epoch": 0.03498850574712644, "grad_norm": 8.24476432800293, "learning_rate": 1.2431077694235589e-05, "loss": 0.5158138275146484, "num_input_tokens_seen": 245056, "step": 761, "train_runtime": 2004.1891, "train_tokens_per_second": 122.272 }, { "epoch": 0.03503448275862069, "grad_norm": 6.291467189788818, "learning_rate": 1.2421052631578949e-05, "loss": 0.3103332817554474, "num_input_tokens_seen": 245382, "step": 762, "train_runtime": 2006.1648, "train_tokens_per_second": 122.314 }, { "epoch": 0.035080459770114945, "grad_norm": 7.742890357971191, "learning_rate": 1.2411027568922307e-05, "loss": 0.5137875080108643, "num_input_tokens_seen": 245714, "step": 763, "train_runtime": 2008.1302, "train_tokens_per_second": 122.36 }, { "epoch": 0.0351264367816092, "grad_norm": 6.73689079284668, "learning_rate": 1.2401002506265664e-05, "loss": 0.3042636811733246, "num_input_tokens_seen": 245956, "step": 764, "train_runtime": 2010.2565, "train_tokens_per_second": 122.351 }, { "epoch": 0.03517241379310345, "grad_norm": 8.467912673950195, "learning_rate": 1.2390977443609024e-05, "loss": 0.5755658745765686, "num_input_tokens_seen": 246240, "step": 765, "train_runtime": 2012.2645, "train_tokens_per_second": 122.37 }, { "epoch": 0.0352183908045977, "grad_norm": 7.699549674987793, "learning_rate": 1.2380952380952383e-05, "loss": 0.5804579257965088, "num_input_tokens_seen": 246638, "step": 766, "train_runtime": 2014.2625, "train_tokens_per_second": 122.446 }, { "epoch": 0.035264367816091956, "grad_norm": 7.961452484130859, "learning_rate": 1.237092731829574e-05, "loss": 0.4314732253551483, "num_input_tokens_seen": 246968, "step": 767, "train_runtime": 2016.2306, "train_tokens_per_second": 122.49 }, { "epoch": 0.03531034482758621, "grad_norm": 7.277204990386963, "learning_rate": 1.2360902255639098e-05, "loss": 0.5331660509109497, "num_input_tokens_seen": 247258, "step": 768, "train_runtime": 2018.2055, "train_tokens_per_second": 122.514 }, { "epoch": 0.03535632183908046, "grad_norm": 5.924410820007324, "learning_rate": 1.2350877192982458e-05, "loss": 0.37716495990753174, "num_input_tokens_seen": 247624, "step": 769, "train_runtime": 2020.1989, "train_tokens_per_second": 122.574 }, { "epoch": 0.035402298850574714, "grad_norm": 8.82693862915039, "learning_rate": 1.2340852130325815e-05, "loss": 0.4919133186340332, "num_input_tokens_seen": 247862, "step": 770, "train_runtime": 2022.162, "train_tokens_per_second": 122.573 }, { "epoch": 0.035448275862068966, "grad_norm": 10.985586166381836, "learning_rate": 1.2330827067669174e-05, "loss": 0.4656320810317993, "num_input_tokens_seen": 248190, "step": 771, "train_runtime": 2024.1127, "train_tokens_per_second": 122.617 }, { "epoch": 0.03549425287356322, "grad_norm": 9.225574493408203, "learning_rate": 1.2320802005012534e-05, "loss": 0.6084414124488831, "num_input_tokens_seen": 248462, "step": 772, "train_runtime": 2026.0559, "train_tokens_per_second": 122.633 }, { "epoch": 0.03554022988505747, "grad_norm": 7.783392429351807, "learning_rate": 1.231077694235589e-05, "loss": 0.4332180917263031, "num_input_tokens_seen": 248776, "step": 773, "train_runtime": 2028.0009, "train_tokens_per_second": 122.671 }, { "epoch": 0.035586206896551724, "grad_norm": 7.647105693817139, "learning_rate": 1.2300751879699249e-05, "loss": 0.4509713649749756, "num_input_tokens_seen": 249078, "step": 774, "train_runtime": 2029.9753, "train_tokens_per_second": 122.7 }, { "epoch": 0.035632183908045977, "grad_norm": 6.6883625984191895, "learning_rate": 1.229072681704261e-05, "loss": 0.43819460272789, "num_input_tokens_seen": 249340, "step": 775, "train_runtime": 2031.9451, "train_tokens_per_second": 122.71 }, { "epoch": 0.03567816091954023, "grad_norm": 8.419464111328125, "learning_rate": 1.2280701754385966e-05, "loss": 0.6304515600204468, "num_input_tokens_seen": 249640, "step": 776, "train_runtime": 2033.9021, "train_tokens_per_second": 122.739 }, { "epoch": 0.03572413793103448, "grad_norm": 6.70818567276001, "learning_rate": 1.2270676691729325e-05, "loss": 0.36638951301574707, "num_input_tokens_seen": 249950, "step": 777, "train_runtime": 2035.8967, "train_tokens_per_second": 122.771 }, { "epoch": 0.035770114942528734, "grad_norm": 8.973495483398438, "learning_rate": 1.2260651629072681e-05, "loss": 0.4474521279335022, "num_input_tokens_seen": 250274, "step": 778, "train_runtime": 2037.9072, "train_tokens_per_second": 122.809 }, { "epoch": 0.03581609195402299, "grad_norm": 7.661665916442871, "learning_rate": 1.2250626566416041e-05, "loss": 0.424831360578537, "num_input_tokens_seen": 250566, "step": 779, "train_runtime": 2039.9066, "train_tokens_per_second": 122.832 }, { "epoch": 0.03586206896551724, "grad_norm": 7.2076897621154785, "learning_rate": 1.22406015037594e-05, "loss": 0.46515989303588867, "num_input_tokens_seen": 250874, "step": 780, "train_runtime": 2041.9398, "train_tokens_per_second": 122.861 }, { "epoch": 0.03590804597701149, "grad_norm": 8.688509941101074, "learning_rate": 1.2230576441102757e-05, "loss": 0.5213080048561096, "num_input_tokens_seen": 251220, "step": 781, "train_runtime": 2056.584, "train_tokens_per_second": 122.154 }, { "epoch": 0.035954022988505745, "grad_norm": 7.395033836364746, "learning_rate": 1.2220551378446117e-05, "loss": 0.5273518562316895, "num_input_tokens_seen": 251498, "step": 782, "train_runtime": 2058.5801, "train_tokens_per_second": 122.171 }, { "epoch": 0.036, "grad_norm": 7.278432846069336, "learning_rate": 1.2210526315789475e-05, "loss": 0.4046718180179596, "num_input_tokens_seen": 251790, "step": 783, "train_runtime": 2060.5337, "train_tokens_per_second": 122.196 }, { "epoch": 0.03604597701149425, "grad_norm": 7.578866481781006, "learning_rate": 1.2200501253132832e-05, "loss": 0.407046914100647, "num_input_tokens_seen": 252110, "step": 784, "train_runtime": 2062.4952, "train_tokens_per_second": 122.235 }, { "epoch": 0.0360919540229885, "grad_norm": 7.994529724121094, "learning_rate": 1.2190476190476192e-05, "loss": 0.4625910818576813, "num_input_tokens_seen": 252400, "step": 785, "train_runtime": 2064.5309, "train_tokens_per_second": 122.255 }, { "epoch": 0.03613793103448276, "grad_norm": 7.406494140625, "learning_rate": 1.2180451127819551e-05, "loss": 0.40049877762794495, "num_input_tokens_seen": 252644, "step": 786, "train_runtime": 2066.563, "train_tokens_per_second": 122.253 }, { "epoch": 0.036183908045977015, "grad_norm": 7.816009998321533, "learning_rate": 1.2170426065162908e-05, "loss": 0.43142542243003845, "num_input_tokens_seen": 252940, "step": 787, "train_runtime": 2068.5445, "train_tokens_per_second": 122.279 }, { "epoch": 0.03622988505747127, "grad_norm": 7.505245685577393, "learning_rate": 1.2160401002506266e-05, "loss": 0.5745660066604614, "num_input_tokens_seen": 253202, "step": 788, "train_runtime": 2070.5511, "train_tokens_per_second": 122.287 }, { "epoch": 0.03627586206896552, "grad_norm": 8.933348655700684, "learning_rate": 1.2150375939849626e-05, "loss": 0.4125485420227051, "num_input_tokens_seen": 253450, "step": 789, "train_runtime": 2072.5072, "train_tokens_per_second": 122.291 }, { "epoch": 0.03632183908045977, "grad_norm": 7.910968780517578, "learning_rate": 1.2140350877192983e-05, "loss": 0.42910078167915344, "num_input_tokens_seen": 253722, "step": 790, "train_runtime": 2074.4758, "train_tokens_per_second": 122.307 }, { "epoch": 0.036367816091954025, "grad_norm": 6.820565700531006, "learning_rate": 1.2130325814536342e-05, "loss": 0.43786799907684326, "num_input_tokens_seen": 254020, "step": 791, "train_runtime": 2076.4855, "train_tokens_per_second": 122.332 }, { "epoch": 0.03641379310344828, "grad_norm": 8.971982955932617, "learning_rate": 1.2120300751879702e-05, "loss": 0.46482279896736145, "num_input_tokens_seen": 254282, "step": 792, "train_runtime": 2078.4249, "train_tokens_per_second": 122.344 }, { "epoch": 0.03645977011494253, "grad_norm": 7.097390174865723, "learning_rate": 1.2110275689223059e-05, "loss": 0.5560008883476257, "num_input_tokens_seen": 254906, "step": 793, "train_runtime": 2080.4848, "train_tokens_per_second": 122.522 }, { "epoch": 0.03650574712643678, "grad_norm": 7.8160881996154785, "learning_rate": 1.2100250626566417e-05, "loss": 0.5623802542686462, "num_input_tokens_seen": 255222, "step": 794, "train_runtime": 2082.4285, "train_tokens_per_second": 122.56 }, { "epoch": 0.036551724137931035, "grad_norm": 8.788517951965332, "learning_rate": 1.2090225563909777e-05, "loss": 0.4851282835006714, "num_input_tokens_seen": 255614, "step": 795, "train_runtime": 2084.4044, "train_tokens_per_second": 122.632 }, { "epoch": 0.03659770114942529, "grad_norm": 7.661938190460205, "learning_rate": 1.2080200501253134e-05, "loss": 0.4763977527618408, "num_input_tokens_seen": 256134, "step": 796, "train_runtime": 2086.4251, "train_tokens_per_second": 122.762 }, { "epoch": 0.03664367816091954, "grad_norm": 7.841512680053711, "learning_rate": 1.2070175438596493e-05, "loss": 0.4477618932723999, "num_input_tokens_seen": 256392, "step": 797, "train_runtime": 2088.3741, "train_tokens_per_second": 122.771 }, { "epoch": 0.03668965517241379, "grad_norm": 8.038578987121582, "learning_rate": 1.206015037593985e-05, "loss": 0.4073207974433899, "num_input_tokens_seen": 256756, "step": 798, "train_runtime": 2090.3709, "train_tokens_per_second": 122.828 }, { "epoch": 0.036735632183908046, "grad_norm": 7.738718032836914, "learning_rate": 1.205012531328321e-05, "loss": 0.5579912662506104, "num_input_tokens_seen": 257056, "step": 799, "train_runtime": 2092.3563, "train_tokens_per_second": 122.855 }, { "epoch": 0.0367816091954023, "grad_norm": 12.660835266113281, "learning_rate": 1.2040100250626568e-05, "loss": 0.6363130211830139, "num_input_tokens_seen": 257392, "step": 800, "train_runtime": 2094.3382, "train_tokens_per_second": 122.899 }, { "epoch": 0.0367816091954023, "eval_loss": 1.7513116598129272, "eval_runtime": 54.1869, "eval_samples_per_second": 18.455, "eval_steps_per_second": 9.227, "num_input_tokens_seen": 257392, "step": 800 }, { "epoch": 0.03682758620689655, "grad_norm": 8.01834487915039, "learning_rate": 1.2030075187969925e-05, "loss": 0.40306514501571655, "num_input_tokens_seen": 257638, "step": 801, "train_runtime": 2150.5794, "train_tokens_per_second": 119.799 }, { "epoch": 0.036873563218390804, "grad_norm": 8.324341773986816, "learning_rate": 1.2020050125313285e-05, "loss": 0.4507819712162018, "num_input_tokens_seen": 258164, "step": 802, "train_runtime": 2152.578, "train_tokens_per_second": 119.932 }, { "epoch": 0.036919540229885056, "grad_norm": 7.941473484039307, "learning_rate": 1.2010025062656644e-05, "loss": 0.4734458029270172, "num_input_tokens_seen": 258454, "step": 803, "train_runtime": 2154.57, "train_tokens_per_second": 119.956 }, { "epoch": 0.03696551724137931, "grad_norm": 7.906909465789795, "learning_rate": 1.2e-05, "loss": 0.3462047576904297, "num_input_tokens_seen": 258712, "step": 804, "train_runtime": 2156.5256, "train_tokens_per_second": 119.967 }, { "epoch": 0.03701149425287356, "grad_norm": 7.4157843589782715, "learning_rate": 1.1989974937343359e-05, "loss": 0.45490097999572754, "num_input_tokens_seen": 258970, "step": 805, "train_runtime": 2158.4846, "train_tokens_per_second": 119.978 }, { "epoch": 0.037057471264367814, "grad_norm": 6.880097389221191, "learning_rate": 1.1979949874686719e-05, "loss": 0.5047414302825928, "num_input_tokens_seen": 259248, "step": 806, "train_runtime": 2160.4505, "train_tokens_per_second": 119.997 }, { "epoch": 0.037103448275862067, "grad_norm": 8.169018745422363, "learning_rate": 1.1969924812030076e-05, "loss": 0.4830625057220459, "num_input_tokens_seen": 259530, "step": 807, "train_runtime": 2162.4594, "train_tokens_per_second": 120.016 }, { "epoch": 0.03714942528735632, "grad_norm": 7.684258937835693, "learning_rate": 1.1959899749373434e-05, "loss": 0.5238369107246399, "num_input_tokens_seen": 259846, "step": 808, "train_runtime": 2164.4497, "train_tokens_per_second": 120.052 }, { "epoch": 0.03719540229885057, "grad_norm": 6.430134296417236, "learning_rate": 1.1949874686716794e-05, "loss": 0.3272133767604828, "num_input_tokens_seen": 260084, "step": 809, "train_runtime": 2166.3968, "train_tokens_per_second": 120.054 }, { "epoch": 0.037241379310344824, "grad_norm": 7.486498832702637, "learning_rate": 1.1939849624060151e-05, "loss": 0.3699163496494293, "num_input_tokens_seen": 260340, "step": 810, "train_runtime": 2168.3539, "train_tokens_per_second": 120.063 }, { "epoch": 0.037287356321839084, "grad_norm": 7.046302795410156, "learning_rate": 1.192982456140351e-05, "loss": 0.4449416995048523, "num_input_tokens_seen": 260596, "step": 811, "train_runtime": 2183.5737, "train_tokens_per_second": 119.344 }, { "epoch": 0.037333333333333336, "grad_norm": 7.615978240966797, "learning_rate": 1.1919799498746868e-05, "loss": 0.39871329069137573, "num_input_tokens_seen": 260892, "step": 812, "train_runtime": 2185.5393, "train_tokens_per_second": 119.372 }, { "epoch": 0.03737931034482759, "grad_norm": 8.0755615234375, "learning_rate": 1.1909774436090227e-05, "loss": 0.5120543241500854, "num_input_tokens_seen": 261184, "step": 813, "train_runtime": 2187.5246, "train_tokens_per_second": 119.397 }, { "epoch": 0.03742528735632184, "grad_norm": 7.727443695068359, "learning_rate": 1.1899749373433585e-05, "loss": 0.4481019079685211, "num_input_tokens_seen": 261510, "step": 814, "train_runtime": 2189.4837, "train_tokens_per_second": 119.439 }, { "epoch": 0.037471264367816094, "grad_norm": 7.489780902862549, "learning_rate": 1.1889724310776942e-05, "loss": 0.5464756488800049, "num_input_tokens_seen": 261832, "step": 815, "train_runtime": 2191.4881, "train_tokens_per_second": 119.477 }, { "epoch": 0.03751724137931035, "grad_norm": 7.514716625213623, "learning_rate": 1.1879699248120302e-05, "loss": 0.40943312644958496, "num_input_tokens_seen": 262070, "step": 816, "train_runtime": 2193.4286, "train_tokens_per_second": 119.48 }, { "epoch": 0.0375632183908046, "grad_norm": 7.514858245849609, "learning_rate": 1.186967418546366e-05, "loss": 0.4800604581832886, "num_input_tokens_seen": 262358, "step": 817, "train_runtime": 2195.3865, "train_tokens_per_second": 119.504 }, { "epoch": 0.03760919540229885, "grad_norm": 7.993260860443115, "learning_rate": 1.1859649122807017e-05, "loss": 0.4908154010772705, "num_input_tokens_seen": 262650, "step": 818, "train_runtime": 2197.3534, "train_tokens_per_second": 119.53 }, { "epoch": 0.037655172413793105, "grad_norm": 6.254027366638184, "learning_rate": 1.1849624060150378e-05, "loss": 0.378743976354599, "num_input_tokens_seen": 262892, "step": 819, "train_runtime": 2199.2982, "train_tokens_per_second": 119.534 }, { "epoch": 0.03770114942528736, "grad_norm": 7.698431491851807, "learning_rate": 1.1839598997493736e-05, "loss": 0.4918335974216461, "num_input_tokens_seen": 263186, "step": 820, "train_runtime": 2201.2494, "train_tokens_per_second": 119.562 }, { "epoch": 0.03774712643678161, "grad_norm": 7.610840320587158, "learning_rate": 1.1829573934837093e-05, "loss": 0.4648166596889496, "num_input_tokens_seen": 263482, "step": 821, "train_runtime": 2203.1831, "train_tokens_per_second": 119.592 }, { "epoch": 0.03779310344827586, "grad_norm": 7.461253643035889, "learning_rate": 1.1819548872180453e-05, "loss": 0.5091919898986816, "num_input_tokens_seen": 263802, "step": 822, "train_runtime": 2205.1372, "train_tokens_per_second": 119.631 }, { "epoch": 0.037839080459770115, "grad_norm": 7.983728408813477, "learning_rate": 1.180952380952381e-05, "loss": 0.40278542041778564, "num_input_tokens_seen": 264092, "step": 823, "train_runtime": 2207.1388, "train_tokens_per_second": 119.654 }, { "epoch": 0.03788505747126437, "grad_norm": 8.200235366821289, "learning_rate": 1.1799498746867168e-05, "loss": 0.5143745541572571, "num_input_tokens_seen": 264348, "step": 824, "train_runtime": 2209.1144, "train_tokens_per_second": 119.662 }, { "epoch": 0.03793103448275862, "grad_norm": 7.840239524841309, "learning_rate": 1.1789473684210527e-05, "loss": 0.4168047606945038, "num_input_tokens_seen": 264574, "step": 825, "train_runtime": 2211.0468, "train_tokens_per_second": 119.66 }, { "epoch": 0.03797701149425287, "grad_norm": 6.6527791023254395, "learning_rate": 1.1779448621553885e-05, "loss": 0.3283456563949585, "num_input_tokens_seen": 264806, "step": 826, "train_runtime": 2212.9852, "train_tokens_per_second": 119.66 }, { "epoch": 0.038022988505747125, "grad_norm": 8.250972747802734, "learning_rate": 1.1769423558897244e-05, "loss": 0.530316948890686, "num_input_tokens_seen": 265078, "step": 827, "train_runtime": 2214.9409, "train_tokens_per_second": 119.677 }, { "epoch": 0.03806896551724138, "grad_norm": 7.472963333129883, "learning_rate": 1.1759398496240602e-05, "loss": 0.4070558547973633, "num_input_tokens_seen": 265378, "step": 828, "train_runtime": 2216.8972, "train_tokens_per_second": 119.707 }, { "epoch": 0.03811494252873563, "grad_norm": 7.2969069480896, "learning_rate": 1.174937343358396e-05, "loss": 0.4591655433177948, "num_input_tokens_seen": 265692, "step": 829, "train_runtime": 2218.856, "train_tokens_per_second": 119.743 }, { "epoch": 0.03816091954022988, "grad_norm": 8.33116626739502, "learning_rate": 1.173934837092732e-05, "loss": 0.4876357913017273, "num_input_tokens_seen": 266040, "step": 830, "train_runtime": 2220.8274, "train_tokens_per_second": 119.793 }, { "epoch": 0.038206896551724136, "grad_norm": 7.567378997802734, "learning_rate": 1.1729323308270678e-05, "loss": 0.40954798460006714, "num_input_tokens_seen": 266276, "step": 831, "train_runtime": 2222.7668, "train_tokens_per_second": 119.795 }, { "epoch": 0.03825287356321839, "grad_norm": 7.296380043029785, "learning_rate": 1.1719298245614036e-05, "loss": 0.5455539226531982, "num_input_tokens_seen": 266548, "step": 832, "train_runtime": 2224.7492, "train_tokens_per_second": 119.81 }, { "epoch": 0.03829885057471264, "grad_norm": 7.5871453285217285, "learning_rate": 1.1709273182957395e-05, "loss": 0.4466758370399475, "num_input_tokens_seen": 266902, "step": 833, "train_runtime": 2226.7381, "train_tokens_per_second": 119.862 }, { "epoch": 0.038344827586206894, "grad_norm": 7.718501567840576, "learning_rate": 1.1699248120300753e-05, "loss": 0.4605112671852112, "num_input_tokens_seen": 267194, "step": 834, "train_runtime": 2228.7241, "train_tokens_per_second": 119.887 }, { "epoch": 0.038390804597701146, "grad_norm": 8.58492660522461, "learning_rate": 1.168922305764411e-05, "loss": 0.4204022288322449, "num_input_tokens_seen": 267506, "step": 835, "train_runtime": 2230.6938, "train_tokens_per_second": 119.921 }, { "epoch": 0.038436781609195406, "grad_norm": 7.482681751251221, "learning_rate": 1.167919799498747e-05, "loss": 0.35398271679878235, "num_input_tokens_seen": 267818, "step": 836, "train_runtime": 2232.6484, "train_tokens_per_second": 119.955 }, { "epoch": 0.03848275862068966, "grad_norm": 10.523682594299316, "learning_rate": 1.1669172932330827e-05, "loss": 0.36216866970062256, "num_input_tokens_seen": 268074, "step": 837, "train_runtime": 2234.5813, "train_tokens_per_second": 119.966 }, { "epoch": 0.03852873563218391, "grad_norm": 8.485894203186035, "learning_rate": 1.1659147869674185e-05, "loss": 0.4826376140117645, "num_input_tokens_seen": 268360, "step": 838, "train_runtime": 2236.5648, "train_tokens_per_second": 119.988 }, { "epoch": 0.03857471264367816, "grad_norm": 7.533479690551758, "learning_rate": 1.1649122807017546e-05, "loss": 0.41024893522262573, "num_input_tokens_seen": 268596, "step": 839, "train_runtime": 2238.5326, "train_tokens_per_second": 119.988 }, { "epoch": 0.038620689655172416, "grad_norm": 7.251370429992676, "learning_rate": 1.1639097744360902e-05, "loss": 0.43169522285461426, "num_input_tokens_seen": 268908, "step": 840, "train_runtime": 2240.5802, "train_tokens_per_second": 120.017 }, { "epoch": 0.03866666666666667, "grad_norm": 6.323627471923828, "learning_rate": 1.1629072681704261e-05, "loss": 0.38648054003715515, "num_input_tokens_seen": 269244, "step": 841, "train_runtime": 2254.3827, "train_tokens_per_second": 119.431 }, { "epoch": 0.03871264367816092, "grad_norm": 6.9223737716674805, "learning_rate": 1.1619047619047621e-05, "loss": 0.35775619745254517, "num_input_tokens_seen": 269566, "step": 842, "train_runtime": 2256.3703, "train_tokens_per_second": 119.469 }, { "epoch": 0.038758620689655174, "grad_norm": 6.996086597442627, "learning_rate": 1.1609022556390978e-05, "loss": 0.3565095365047455, "num_input_tokens_seen": 269794, "step": 843, "train_runtime": 2258.435, "train_tokens_per_second": 119.461 }, { "epoch": 0.038804597701149426, "grad_norm": 8.16794490814209, "learning_rate": 1.1598997493734336e-05, "loss": 0.5579286813735962, "num_input_tokens_seen": 270066, "step": 844, "train_runtime": 2260.4194, "train_tokens_per_second": 119.476 }, { "epoch": 0.03885057471264368, "grad_norm": 7.90415096282959, "learning_rate": 1.1588972431077695e-05, "loss": 0.37357866764068604, "num_input_tokens_seen": 270376, "step": 845, "train_runtime": 2262.5671, "train_tokens_per_second": 119.5 }, { "epoch": 0.03889655172413793, "grad_norm": 6.86454963684082, "learning_rate": 1.1578947368421053e-05, "loss": 0.37914904952049255, "num_input_tokens_seen": 270630, "step": 846, "train_runtime": 2264.5082, "train_tokens_per_second": 119.509 }, { "epoch": 0.038942528735632184, "grad_norm": 7.4026007652282715, "learning_rate": 1.1568922305764412e-05, "loss": 0.50594562292099, "num_input_tokens_seen": 270982, "step": 847, "train_runtime": 2266.4979, "train_tokens_per_second": 119.56 }, { "epoch": 0.03898850574712644, "grad_norm": 8.02122974395752, "learning_rate": 1.1558897243107769e-05, "loss": 0.6458178758621216, "num_input_tokens_seen": 271352, "step": 848, "train_runtime": 2268.456, "train_tokens_per_second": 119.62 }, { "epoch": 0.03903448275862069, "grad_norm": 10.095008850097656, "learning_rate": 1.1548872180451129e-05, "loss": 0.48162248730659485, "num_input_tokens_seen": 271590, "step": 849, "train_runtime": 2270.3935, "train_tokens_per_second": 119.622 }, { "epoch": 0.03908045977011494, "grad_norm": 7.111009120941162, "learning_rate": 1.1538847117794487e-05, "loss": 0.4771837592124939, "num_input_tokens_seen": 271902, "step": 850, "train_runtime": 2272.35, "train_tokens_per_second": 119.657 }, { "epoch": 0.039126436781609195, "grad_norm": 8.130017280578613, "learning_rate": 1.1528822055137844e-05, "loss": 0.39255622029304504, "num_input_tokens_seen": 272218, "step": 851, "train_runtime": 2274.2978, "train_tokens_per_second": 119.693 }, { "epoch": 0.03917241379310345, "grad_norm": 7.996945381164551, "learning_rate": 1.1518796992481204e-05, "loss": 0.496831476688385, "num_input_tokens_seen": 272484, "step": 852, "train_runtime": 2276.2473, "train_tokens_per_second": 119.708 }, { "epoch": 0.0392183908045977, "grad_norm": 9.667489051818848, "learning_rate": 1.1508771929824563e-05, "loss": 0.528260350227356, "num_input_tokens_seen": 272852, "step": 853, "train_runtime": 2278.2113, "train_tokens_per_second": 119.766 }, { "epoch": 0.03926436781609195, "grad_norm": 8.4678955078125, "learning_rate": 1.149874686716792e-05, "loss": 0.4786686301231384, "num_input_tokens_seen": 273258, "step": 854, "train_runtime": 2280.318, "train_tokens_per_second": 119.833 }, { "epoch": 0.039310344827586205, "grad_norm": 8.95380973815918, "learning_rate": 1.1488721804511278e-05, "loss": 0.5270786285400391, "num_input_tokens_seen": 273560, "step": 855, "train_runtime": 2282.2789, "train_tokens_per_second": 119.863 }, { "epoch": 0.03935632183908046, "grad_norm": 8.605949401855469, "learning_rate": 1.1478696741854638e-05, "loss": 0.48096340894699097, "num_input_tokens_seen": 273866, "step": 856, "train_runtime": 2284.2383, "train_tokens_per_second": 119.894 }, { "epoch": 0.03940229885057471, "grad_norm": 7.588695526123047, "learning_rate": 1.1468671679197995e-05, "loss": 0.42437565326690674, "num_input_tokens_seen": 274128, "step": 857, "train_runtime": 2286.1711, "train_tokens_per_second": 119.907 }, { "epoch": 0.03944827586206896, "grad_norm": 7.444614410400391, "learning_rate": 1.1458646616541354e-05, "loss": 0.40262681245803833, "num_input_tokens_seen": 274414, "step": 858, "train_runtime": 2288.1158, "train_tokens_per_second": 119.93 }, { "epoch": 0.039494252873563215, "grad_norm": 5.969850063323975, "learning_rate": 1.1448621553884714e-05, "loss": 0.32492494583129883, "num_input_tokens_seen": 274716, "step": 859, "train_runtime": 2290.0704, "train_tokens_per_second": 119.96 }, { "epoch": 0.03954022988505747, "grad_norm": 10.765917778015137, "learning_rate": 1.143859649122807e-05, "loss": 0.4458027482032776, "num_input_tokens_seen": 275008, "step": 860, "train_runtime": 2292.0179, "train_tokens_per_second": 119.985 }, { "epoch": 0.03958620689655173, "grad_norm": 7.071032524108887, "learning_rate": 1.1428571428571429e-05, "loss": 0.3341474235057831, "num_input_tokens_seen": 275294, "step": 861, "train_runtime": 2293.9718, "train_tokens_per_second": 120.008 }, { "epoch": 0.03963218390804598, "grad_norm": 8.292301177978516, "learning_rate": 1.141854636591479e-05, "loss": 0.45281994342803955, "num_input_tokens_seen": 275578, "step": 862, "train_runtime": 2295.9487, "train_tokens_per_second": 120.028 }, { "epoch": 0.03967816091954023, "grad_norm": 7.089531898498535, "learning_rate": 1.1408521303258146e-05, "loss": 0.4461163282394409, "num_input_tokens_seen": 275854, "step": 863, "train_runtime": 2297.9113, "train_tokens_per_second": 120.046 }, { "epoch": 0.039724137931034485, "grad_norm": 8.957581520080566, "learning_rate": 1.1398496240601504e-05, "loss": 0.5779985189437866, "num_input_tokens_seen": 276178, "step": 864, "train_runtime": 2299.8734, "train_tokens_per_second": 120.084 }, { "epoch": 0.03977011494252874, "grad_norm": 6.947776794433594, "learning_rate": 1.1388471177944861e-05, "loss": 0.4939615726470947, "num_input_tokens_seen": 276454, "step": 865, "train_runtime": 2301.8316, "train_tokens_per_second": 120.102 }, { "epoch": 0.03981609195402299, "grad_norm": 7.037495136260986, "learning_rate": 1.1378446115288221e-05, "loss": 0.4288913905620575, "num_input_tokens_seen": 276780, "step": 866, "train_runtime": 2303.7821, "train_tokens_per_second": 120.142 }, { "epoch": 0.03986206896551724, "grad_norm": 7.895960330963135, "learning_rate": 1.136842105263158e-05, "loss": 0.4161183536052704, "num_input_tokens_seen": 277064, "step": 867, "train_runtime": 2305.7235, "train_tokens_per_second": 120.164 }, { "epoch": 0.039908045977011496, "grad_norm": 8.328717231750488, "learning_rate": 1.1358395989974937e-05, "loss": 0.5347382426261902, "num_input_tokens_seen": 277346, "step": 868, "train_runtime": 2307.6615, "train_tokens_per_second": 120.185 }, { "epoch": 0.03995402298850575, "grad_norm": 7.7827372550964355, "learning_rate": 1.1348370927318297e-05, "loss": 0.45566022396087646, "num_input_tokens_seen": 277628, "step": 869, "train_runtime": 2309.6053, "train_tokens_per_second": 120.206 }, { "epoch": 0.04, "grad_norm": 7.058058261871338, "learning_rate": 1.1338345864661655e-05, "loss": 0.5263017416000366, "num_input_tokens_seen": 278352, "step": 870, "train_runtime": 2311.646, "train_tokens_per_second": 120.413 }, { "epoch": 0.04004597701149425, "grad_norm": 9.117223739624023, "learning_rate": 1.1328320802005012e-05, "loss": 0.6244474649429321, "num_input_tokens_seen": 278674, "step": 871, "train_runtime": 2327.0496, "train_tokens_per_second": 119.754 }, { "epoch": 0.040091954022988506, "grad_norm": 7.346180438995361, "learning_rate": 1.1318295739348372e-05, "loss": 0.5163547396659851, "num_input_tokens_seen": 279032, "step": 872, "train_runtime": 2329.0357, "train_tokens_per_second": 119.806 }, { "epoch": 0.04013793103448276, "grad_norm": 9.150981903076172, "learning_rate": 1.1308270676691731e-05, "loss": 0.560847282409668, "num_input_tokens_seen": 279340, "step": 873, "train_runtime": 2331.085, "train_tokens_per_second": 119.833 }, { "epoch": 0.04018390804597701, "grad_norm": 7.573378562927246, "learning_rate": 1.1298245614035088e-05, "loss": 0.4473652243614197, "num_input_tokens_seen": 279662, "step": 874, "train_runtime": 2333.0629, "train_tokens_per_second": 119.869 }, { "epoch": 0.040229885057471264, "grad_norm": 8.060361862182617, "learning_rate": 1.1288220551378446e-05, "loss": 0.5227193236351013, "num_input_tokens_seen": 280008, "step": 875, "train_runtime": 2335.0286, "train_tokens_per_second": 119.916 }, { "epoch": 0.040275862068965516, "grad_norm": 8.859715461730957, "learning_rate": 1.1278195488721806e-05, "loss": 0.5025198459625244, "num_input_tokens_seen": 280276, "step": 876, "train_runtime": 2336.9747, "train_tokens_per_second": 119.931 }, { "epoch": 0.04032183908045977, "grad_norm": 7.789861679077148, "learning_rate": 1.1268170426065163e-05, "loss": 0.4694594144821167, "num_input_tokens_seen": 280654, "step": 877, "train_runtime": 2338.9943, "train_tokens_per_second": 119.989 }, { "epoch": 0.04036781609195402, "grad_norm": 7.73496675491333, "learning_rate": 1.1258145363408522e-05, "loss": 0.47190093994140625, "num_input_tokens_seen": 280980, "step": 878, "train_runtime": 2340.9878, "train_tokens_per_second": 120.026 }, { "epoch": 0.040413793103448274, "grad_norm": 7.591188907623291, "learning_rate": 1.1248120300751882e-05, "loss": 0.4663242995738983, "num_input_tokens_seen": 281300, "step": 879, "train_runtime": 2342.9632, "train_tokens_per_second": 120.062 }, { "epoch": 0.04045977011494253, "grad_norm": 8.221147537231445, "learning_rate": 1.1238095238095239e-05, "loss": 0.40577393770217896, "num_input_tokens_seen": 281588, "step": 880, "train_runtime": 2344.9185, "train_tokens_per_second": 120.084 }, { "epoch": 0.04050574712643678, "grad_norm": 7.800092697143555, "learning_rate": 1.1228070175438597e-05, "loss": 0.532424807548523, "num_input_tokens_seen": 281884, "step": 881, "train_runtime": 2346.9048, "train_tokens_per_second": 120.109 }, { "epoch": 0.04055172413793103, "grad_norm": 7.333950519561768, "learning_rate": 1.1218045112781957e-05, "loss": 0.37188905477523804, "num_input_tokens_seen": 282176, "step": 882, "train_runtime": 2348.9234, "train_tokens_per_second": 120.13 }, { "epoch": 0.040597701149425285, "grad_norm": 11.310759544372559, "learning_rate": 1.1208020050125314e-05, "loss": 0.4371299147605896, "num_input_tokens_seen": 282428, "step": 883, "train_runtime": 2350.8924, "train_tokens_per_second": 120.137 }, { "epoch": 0.04064367816091954, "grad_norm": 7.542466163635254, "learning_rate": 1.1197994987468673e-05, "loss": 0.40072888135910034, "num_input_tokens_seen": 282724, "step": 884, "train_runtime": 2352.8432, "train_tokens_per_second": 120.163 }, { "epoch": 0.04068965517241379, "grad_norm": 9.259745597839355, "learning_rate": 1.118796992481203e-05, "loss": 0.355293869972229, "num_input_tokens_seen": 282978, "step": 885, "train_runtime": 2354.7723, "train_tokens_per_second": 120.172 }, { "epoch": 0.04073563218390805, "grad_norm": 7.640303611755371, "learning_rate": 1.117794486215539e-05, "loss": 0.5113065838813782, "num_input_tokens_seen": 283250, "step": 886, "train_runtime": 2356.7209, "train_tokens_per_second": 120.188 }, { "epoch": 0.0407816091954023, "grad_norm": 6.655959606170654, "learning_rate": 1.1167919799498748e-05, "loss": 0.45531749725341797, "num_input_tokens_seen": 283712, "step": 887, "train_runtime": 2358.7731, "train_tokens_per_second": 120.279 }, { "epoch": 0.040827586206896554, "grad_norm": 7.468194484710693, "learning_rate": 1.1157894736842105e-05, "loss": 0.5452451109886169, "num_input_tokens_seen": 284258, "step": 888, "train_runtime": 2360.8264, "train_tokens_per_second": 120.406 }, { "epoch": 0.04087356321839081, "grad_norm": 9.536760330200195, "learning_rate": 1.1147869674185465e-05, "loss": 0.5002374649047852, "num_input_tokens_seen": 284534, "step": 889, "train_runtime": 2362.8485, "train_tokens_per_second": 120.42 }, { "epoch": 0.04091954022988506, "grad_norm": 8.694121360778809, "learning_rate": 1.1137844611528823e-05, "loss": 0.5382827520370483, "num_input_tokens_seen": 284830, "step": 890, "train_runtime": 2364.8225, "train_tokens_per_second": 120.445 }, { "epoch": 0.04096551724137931, "grad_norm": 7.214402198791504, "learning_rate": 1.112781954887218e-05, "loss": 0.5347087383270264, "num_input_tokens_seen": 285268, "step": 891, "train_runtime": 2366.9102, "train_tokens_per_second": 120.523 }, { "epoch": 0.041011494252873565, "grad_norm": 8.898858070373535, "learning_rate": 1.111779448621554e-05, "loss": 0.6471966505050659, "num_input_tokens_seen": 285612, "step": 892, "train_runtime": 2368.8961, "train_tokens_per_second": 120.568 }, { "epoch": 0.04105747126436782, "grad_norm": 8.152880668640137, "learning_rate": 1.1107769423558899e-05, "loss": 0.42676907777786255, "num_input_tokens_seen": 285870, "step": 893, "train_runtime": 2371.0213, "train_tokens_per_second": 120.568 }, { "epoch": 0.04110344827586207, "grad_norm": 7.1052069664001465, "learning_rate": 1.1097744360902256e-05, "loss": 0.25924891233444214, "num_input_tokens_seen": 286108, "step": 894, "train_runtime": 2373.0105, "train_tokens_per_second": 120.568 }, { "epoch": 0.04114942528735632, "grad_norm": 6.890835285186768, "learning_rate": 1.1087719298245614e-05, "loss": 0.29447272419929504, "num_input_tokens_seen": 286324, "step": 895, "train_runtime": 2374.944, "train_tokens_per_second": 120.56 }, { "epoch": 0.041195402298850575, "grad_norm": 9.2092866897583, "learning_rate": 1.1077694235588974e-05, "loss": 0.4511667490005493, "num_input_tokens_seen": 286624, "step": 896, "train_runtime": 2376.8871, "train_tokens_per_second": 120.588 }, { "epoch": 0.04124137931034483, "grad_norm": 7.098134517669678, "learning_rate": 1.1067669172932331e-05, "loss": 0.44858479499816895, "num_input_tokens_seen": 286898, "step": 897, "train_runtime": 2378.8327, "train_tokens_per_second": 120.605 }, { "epoch": 0.04128735632183908, "grad_norm": 8.426091194152832, "learning_rate": 1.105764411027569e-05, "loss": 0.450019896030426, "num_input_tokens_seen": 287224, "step": 898, "train_runtime": 2380.7909, "train_tokens_per_second": 120.642 }, { "epoch": 0.04133333333333333, "grad_norm": 7.69377326965332, "learning_rate": 1.104761904761905e-05, "loss": 0.4973233938217163, "num_input_tokens_seen": 287490, "step": 899, "train_runtime": 2382.7414, "train_tokens_per_second": 120.655 }, { "epoch": 0.041379310344827586, "grad_norm": 7.684279441833496, "learning_rate": 1.1037593984962407e-05, "loss": 0.44500482082366943, "num_input_tokens_seen": 287906, "step": 900, "train_runtime": 2384.7822, "train_tokens_per_second": 120.726 }, { "epoch": 0.04142528735632184, "grad_norm": 7.631931304931641, "learning_rate": 1.1027568922305765e-05, "loss": 0.46322792768478394, "num_input_tokens_seen": 288130, "step": 901, "train_runtime": 2400.0767, "train_tokens_per_second": 120.05 }, { "epoch": 0.04147126436781609, "grad_norm": 6.782238483428955, "learning_rate": 1.1017543859649125e-05, "loss": 0.3592989444732666, "num_input_tokens_seen": 288456, "step": 902, "train_runtime": 2402.0953, "train_tokens_per_second": 120.085 }, { "epoch": 0.04151724137931034, "grad_norm": 8.23485279083252, "learning_rate": 1.1007518796992482e-05, "loss": 0.630439281463623, "num_input_tokens_seen": 288722, "step": 903, "train_runtime": 2404.0699, "train_tokens_per_second": 120.097 }, { "epoch": 0.041563218390804596, "grad_norm": 8.228728294372559, "learning_rate": 1.099749373433584e-05, "loss": 0.4678223133087158, "num_input_tokens_seen": 289046, "step": 904, "train_runtime": 2406.0529, "train_tokens_per_second": 120.133 }, { "epoch": 0.04160919540229885, "grad_norm": 7.0378499031066895, "learning_rate": 1.0987468671679197e-05, "loss": 0.42920780181884766, "num_input_tokens_seen": 289366, "step": 905, "train_runtime": 2408.0205, "train_tokens_per_second": 120.168 }, { "epoch": 0.0416551724137931, "grad_norm": 8.889481544494629, "learning_rate": 1.0977443609022558e-05, "loss": 0.4088243246078491, "num_input_tokens_seen": 289702, "step": 906, "train_runtime": 2409.987, "train_tokens_per_second": 120.209 }, { "epoch": 0.041701149425287354, "grad_norm": 9.026168823242188, "learning_rate": 1.0967418546365916e-05, "loss": 0.34462451934814453, "num_input_tokens_seen": 289954, "step": 907, "train_runtime": 2411.9324, "train_tokens_per_second": 120.216 }, { "epoch": 0.041747126436781606, "grad_norm": 7.272502899169922, "learning_rate": 1.0957393483709273e-05, "loss": 0.4410274624824524, "num_input_tokens_seen": 290284, "step": 908, "train_runtime": 2413.8913, "train_tokens_per_second": 120.256 }, { "epoch": 0.04179310344827586, "grad_norm": 7.197849273681641, "learning_rate": 1.0947368421052633e-05, "loss": 0.380460262298584, "num_input_tokens_seen": 290576, "step": 909, "train_runtime": 2415.8372, "train_tokens_per_second": 120.28 }, { "epoch": 0.04183908045977011, "grad_norm": 7.162438869476318, "learning_rate": 1.0937343358395992e-05, "loss": 0.4622759222984314, "num_input_tokens_seen": 290928, "step": 910, "train_runtime": 2417.8277, "train_tokens_per_second": 120.326 }, { "epoch": 0.04188505747126437, "grad_norm": 7.091503143310547, "learning_rate": 1.0927318295739348e-05, "loss": 0.3691563308238983, "num_input_tokens_seen": 291200, "step": 911, "train_runtime": 2419.7731, "train_tokens_per_second": 120.342 }, { "epoch": 0.041931034482758624, "grad_norm": 7.902462482452393, "learning_rate": 1.0917293233082709e-05, "loss": 0.5885430574417114, "num_input_tokens_seen": 291552, "step": 912, "train_runtime": 2421.7607, "train_tokens_per_second": 120.388 }, { "epoch": 0.041977011494252876, "grad_norm": 8.314557075500488, "learning_rate": 1.0907268170426067e-05, "loss": 0.4684392213821411, "num_input_tokens_seen": 291806, "step": 913, "train_runtime": 2423.6947, "train_tokens_per_second": 120.397 }, { "epoch": 0.04202298850574713, "grad_norm": 8.574982643127441, "learning_rate": 1.0897243107769424e-05, "loss": 0.4393140375614166, "num_input_tokens_seen": 292054, "step": 914, "train_runtime": 2425.6381, "train_tokens_per_second": 120.403 }, { "epoch": 0.04206896551724138, "grad_norm": 6.826984882354736, "learning_rate": 1.0887218045112782e-05, "loss": 0.3470788598060608, "num_input_tokens_seen": 292344, "step": 915, "train_runtime": 2427.5802, "train_tokens_per_second": 120.426 }, { "epoch": 0.042114942528735634, "grad_norm": 7.039104461669922, "learning_rate": 1.0877192982456142e-05, "loss": 0.35542216897010803, "num_input_tokens_seen": 292608, "step": 916, "train_runtime": 2429.5518, "train_tokens_per_second": 120.437 }, { "epoch": 0.04216091954022989, "grad_norm": 8.844517707824707, "learning_rate": 1.08671679197995e-05, "loss": 0.5223974585533142, "num_input_tokens_seen": 292898, "step": 917, "train_runtime": 2431.5009, "train_tokens_per_second": 120.46 }, { "epoch": 0.04220689655172414, "grad_norm": 9.181806564331055, "learning_rate": 1.0857142857142858e-05, "loss": 0.337760865688324, "num_input_tokens_seen": 293172, "step": 918, "train_runtime": 2433.4407, "train_tokens_per_second": 120.476 }, { "epoch": 0.04225287356321839, "grad_norm": 7.520045280456543, "learning_rate": 1.0847117794486218e-05, "loss": 0.44798052310943604, "num_input_tokens_seen": 293460, "step": 919, "train_runtime": 2435.384, "train_tokens_per_second": 120.498 }, { "epoch": 0.042298850574712644, "grad_norm": 8.774689674377441, "learning_rate": 1.0837092731829575e-05, "loss": 0.4620504379272461, "num_input_tokens_seen": 293752, "step": 920, "train_runtime": 2437.3368, "train_tokens_per_second": 120.522 }, { "epoch": 0.0423448275862069, "grad_norm": 7.388124465942383, "learning_rate": 1.0827067669172933e-05, "loss": 0.4084808826446533, "num_input_tokens_seen": 294076, "step": 921, "train_runtime": 2439.2907, "train_tokens_per_second": 120.558 }, { "epoch": 0.04239080459770115, "grad_norm": 8.380356788635254, "learning_rate": 1.0817042606516293e-05, "loss": 0.43804672360420227, "num_input_tokens_seen": 294346, "step": 922, "train_runtime": 2441.2794, "train_tokens_per_second": 120.57 }, { "epoch": 0.0424367816091954, "grad_norm": 8.176957130432129, "learning_rate": 1.080701754385965e-05, "loss": 0.39138269424438477, "num_input_tokens_seen": 294646, "step": 923, "train_runtime": 2443.2453, "train_tokens_per_second": 120.596 }, { "epoch": 0.042482758620689655, "grad_norm": 8.583574295043945, "learning_rate": 1.0796992481203009e-05, "loss": 0.5286657810211182, "num_input_tokens_seen": 294962, "step": 924, "train_runtime": 2445.2019, "train_tokens_per_second": 120.629 }, { "epoch": 0.04252873563218391, "grad_norm": 7.618959903717041, "learning_rate": 1.0786967418546365e-05, "loss": 0.4618549942970276, "num_input_tokens_seen": 295252, "step": 925, "train_runtime": 2447.1606, "train_tokens_per_second": 120.651 }, { "epoch": 0.04257471264367816, "grad_norm": 6.271094799041748, "learning_rate": 1.0776942355889726e-05, "loss": 0.5403990745544434, "num_input_tokens_seen": 296004, "step": 926, "train_runtime": 2449.3437, "train_tokens_per_second": 120.85 }, { "epoch": 0.04262068965517241, "grad_norm": 7.08641242980957, "learning_rate": 1.0766917293233084e-05, "loss": 0.49688249826431274, "num_input_tokens_seen": 296336, "step": 927, "train_runtime": 2451.3155, "train_tokens_per_second": 120.889 }, { "epoch": 0.042666666666666665, "grad_norm": 7.1499762535095215, "learning_rate": 1.0756892230576441e-05, "loss": 0.4259389042854309, "num_input_tokens_seen": 296658, "step": 928, "train_runtime": 2453.3065, "train_tokens_per_second": 120.922 }, { "epoch": 0.04271264367816092, "grad_norm": 10.639947891235352, "learning_rate": 1.0746867167919801e-05, "loss": 0.5289331674575806, "num_input_tokens_seen": 297002, "step": 929, "train_runtime": 2455.2521, "train_tokens_per_second": 120.966 }, { "epoch": 0.04275862068965517, "grad_norm": 8.506094932556152, "learning_rate": 1.073684210526316e-05, "loss": 0.3833962082862854, "num_input_tokens_seen": 297270, "step": 930, "train_runtime": 2457.256, "train_tokens_per_second": 120.976 }, { "epoch": 0.04280459770114942, "grad_norm": 7.21469783782959, "learning_rate": 1.0726817042606516e-05, "loss": 0.46723437309265137, "num_input_tokens_seen": 297520, "step": 931, "train_runtime": 2472.0078, "train_tokens_per_second": 120.356 }, { "epoch": 0.042850574712643676, "grad_norm": 9.229071617126465, "learning_rate": 1.0716791979949877e-05, "loss": 0.5288851261138916, "num_input_tokens_seen": 297830, "step": 932, "train_runtime": 2474.085, "train_tokens_per_second": 120.38 }, { "epoch": 0.04289655172413793, "grad_norm": 7.219783782958984, "learning_rate": 1.0706766917293235e-05, "loss": 0.38349175453186035, "num_input_tokens_seen": 298080, "step": 933, "train_runtime": 2476.1395, "train_tokens_per_second": 120.381 }, { "epoch": 0.04294252873563218, "grad_norm": 8.181379318237305, "learning_rate": 1.0696741854636592e-05, "loss": 0.43957898020744324, "num_input_tokens_seen": 298350, "step": 934, "train_runtime": 2478.1833, "train_tokens_per_second": 120.391 }, { "epoch": 0.04298850574712643, "grad_norm": 6.5870866775512695, "learning_rate": 1.068671679197995e-05, "loss": 0.4357609152793884, "num_input_tokens_seen": 298650, "step": 935, "train_runtime": 2480.148, "train_tokens_per_second": 120.416 }, { "epoch": 0.04303448275862069, "grad_norm": 9.388429641723633, "learning_rate": 1.0676691729323309e-05, "loss": 0.47772032022476196, "num_input_tokens_seen": 298952, "step": 936, "train_runtime": 2482.158, "train_tokens_per_second": 120.44 }, { "epoch": 0.043080459770114946, "grad_norm": 7.635393142700195, "learning_rate": 1.0666666666666667e-05, "loss": 0.46329423785209656, "num_input_tokens_seen": 299284, "step": 937, "train_runtime": 2484.2258, "train_tokens_per_second": 120.474 }, { "epoch": 0.0431264367816092, "grad_norm": 8.625504493713379, "learning_rate": 1.0656641604010026e-05, "loss": 0.5440782308578491, "num_input_tokens_seen": 299538, "step": 938, "train_runtime": 2486.2547, "train_tokens_per_second": 120.478 }, { "epoch": 0.04317241379310345, "grad_norm": 8.2759428024292, "learning_rate": 1.0646616541353384e-05, "loss": 0.5514028668403625, "num_input_tokens_seen": 299882, "step": 939, "train_runtime": 2488.2888, "train_tokens_per_second": 120.517 }, { "epoch": 0.0432183908045977, "grad_norm": 9.492950439453125, "learning_rate": 1.0636591478696743e-05, "loss": 0.3638257682323456, "num_input_tokens_seen": 300106, "step": 940, "train_runtime": 2490.3154, "train_tokens_per_second": 120.509 }, { "epoch": 0.043264367816091956, "grad_norm": 8.512650489807129, "learning_rate": 1.0626566416040101e-05, "loss": 0.6001561880111694, "num_input_tokens_seen": 300458, "step": 941, "train_runtime": 2492.3559, "train_tokens_per_second": 120.552 }, { "epoch": 0.04331034482758621, "grad_norm": 7.094176292419434, "learning_rate": 1.061654135338346e-05, "loss": 0.3695550262928009, "num_input_tokens_seen": 300726, "step": 942, "train_runtime": 2494.3025, "train_tokens_per_second": 120.565 }, { "epoch": 0.04335632183908046, "grad_norm": 7.242445468902588, "learning_rate": 1.0606516290726818e-05, "loss": 0.3477405607700348, "num_input_tokens_seen": 301004, "step": 943, "train_runtime": 2496.4506, "train_tokens_per_second": 120.573 }, { "epoch": 0.043402298850574714, "grad_norm": 8.440631866455078, "learning_rate": 1.0596491228070177e-05, "loss": 0.5115600824356079, "num_input_tokens_seen": 301344, "step": 944, "train_runtime": 2498.4938, "train_tokens_per_second": 120.61 }, { "epoch": 0.043448275862068966, "grad_norm": 7.042312145233154, "learning_rate": 1.0586466165413534e-05, "loss": 0.3534718155860901, "num_input_tokens_seen": 301626, "step": 945, "train_runtime": 2500.5479, "train_tokens_per_second": 120.624 }, { "epoch": 0.04349425287356322, "grad_norm": 6.0229668617248535, "learning_rate": 1.0576441102756894e-05, "loss": 0.3125123381614685, "num_input_tokens_seen": 301920, "step": 946, "train_runtime": 2502.5541, "train_tokens_per_second": 120.645 }, { "epoch": 0.04354022988505747, "grad_norm": 6.676801681518555, "learning_rate": 1.0566416040100252e-05, "loss": 0.4015813171863556, "num_input_tokens_seen": 302176, "step": 947, "train_runtime": 2504.5478, "train_tokens_per_second": 120.651 }, { "epoch": 0.043586206896551724, "grad_norm": 8.421010971069336, "learning_rate": 1.0556390977443609e-05, "loss": 0.4361885190010071, "num_input_tokens_seen": 302488, "step": 948, "train_runtime": 2506.6159, "train_tokens_per_second": 120.676 }, { "epoch": 0.04363218390804598, "grad_norm": 8.230731010437012, "learning_rate": 1.054636591478697e-05, "loss": 0.48423004150390625, "num_input_tokens_seen": 302742, "step": 949, "train_runtime": 2508.6251, "train_tokens_per_second": 120.68 }, { "epoch": 0.04367816091954023, "grad_norm": 10.06833267211914, "learning_rate": 1.0536340852130326e-05, "loss": 0.6311561465263367, "num_input_tokens_seen": 303026, "step": 950, "train_runtime": 2510.6008, "train_tokens_per_second": 120.699 }, { "epoch": 0.04372413793103448, "grad_norm": 6.6952738761901855, "learning_rate": 1.0526315789473684e-05, "loss": 0.3988801836967468, "num_input_tokens_seen": 303292, "step": 951, "train_runtime": 2512.5476, "train_tokens_per_second": 120.711 }, { "epoch": 0.043770114942528734, "grad_norm": 8.504010200500488, "learning_rate": 1.0516290726817045e-05, "loss": 0.6308104991912842, "num_input_tokens_seen": 303608, "step": 952, "train_runtime": 2514.5226, "train_tokens_per_second": 120.742 }, { "epoch": 0.04381609195402299, "grad_norm": 7.483700275421143, "learning_rate": 1.0506265664160401e-05, "loss": 0.46924853324890137, "num_input_tokens_seen": 303850, "step": 953, "train_runtime": 2516.4748, "train_tokens_per_second": 120.744 }, { "epoch": 0.04386206896551724, "grad_norm": 6.958237171173096, "learning_rate": 1.049624060150376e-05, "loss": 0.43178248405456543, "num_input_tokens_seen": 304108, "step": 954, "train_runtime": 2518.4213, "train_tokens_per_second": 120.753 }, { "epoch": 0.04390804597701149, "grad_norm": 6.699312686920166, "learning_rate": 1.0486215538847118e-05, "loss": 0.3953361511230469, "num_input_tokens_seen": 304424, "step": 955, "train_runtime": 2520.4513, "train_tokens_per_second": 120.782 }, { "epoch": 0.043954022988505745, "grad_norm": 6.884195804595947, "learning_rate": 1.0476190476190477e-05, "loss": 0.46768489480018616, "num_input_tokens_seen": 304944, "step": 956, "train_runtime": 2522.5017, "train_tokens_per_second": 120.89 }, { "epoch": 0.044, "grad_norm": 8.453701972961426, "learning_rate": 1.0466165413533835e-05, "loss": 0.49336737394332886, "num_input_tokens_seen": 305222, "step": 957, "train_runtime": 2524.4489, "train_tokens_per_second": 120.906 }, { "epoch": 0.04404597701149425, "grad_norm": 7.046376705169678, "learning_rate": 1.0456140350877194e-05, "loss": 0.4264727830886841, "num_input_tokens_seen": 305522, "step": 958, "train_runtime": 2526.4038, "train_tokens_per_second": 120.932 }, { "epoch": 0.0440919540229885, "grad_norm": 6.419041156768799, "learning_rate": 1.0446115288220552e-05, "loss": 0.39340972900390625, "num_input_tokens_seen": 305974, "step": 959, "train_runtime": 2528.4093, "train_tokens_per_second": 121.014 }, { "epoch": 0.044137931034482755, "grad_norm": 7.852453231811523, "learning_rate": 1.043609022556391e-05, "loss": 0.5217800140380859, "num_input_tokens_seen": 306238, "step": 960, "train_runtime": 2530.3805, "train_tokens_per_second": 121.024 }, { "epoch": 0.044183908045977015, "grad_norm": 7.855498313903809, "learning_rate": 1.0426065162907268e-05, "loss": 0.41073358058929443, "num_input_tokens_seen": 306538, "step": 961, "train_runtime": 2545.1014, "train_tokens_per_second": 120.442 }, { "epoch": 0.04422988505747127, "grad_norm": 9.012527465820312, "learning_rate": 1.0416040100250628e-05, "loss": 0.606840968132019, "num_input_tokens_seen": 306788, "step": 962, "train_runtime": 2547.0491, "train_tokens_per_second": 120.448 }, { "epoch": 0.04427586206896552, "grad_norm": 6.915031433105469, "learning_rate": 1.0406015037593986e-05, "loss": 0.2802923321723938, "num_input_tokens_seen": 307022, "step": 963, "train_runtime": 2549.002, "train_tokens_per_second": 120.448 }, { "epoch": 0.04432183908045977, "grad_norm": 8.415030479431152, "learning_rate": 1.0395989974937343e-05, "loss": 0.5813425779342651, "num_input_tokens_seen": 307332, "step": 964, "train_runtime": 2551.0138, "train_tokens_per_second": 120.474 }, { "epoch": 0.044367816091954025, "grad_norm": 6.746933460235596, "learning_rate": 1.0385964912280702e-05, "loss": 0.3976888954639435, "num_input_tokens_seen": 307602, "step": 965, "train_runtime": 2552.9589, "train_tokens_per_second": 120.488 }, { "epoch": 0.04441379310344828, "grad_norm": 7.740719795227051, "learning_rate": 1.0375939849624062e-05, "loss": 0.4100640118122101, "num_input_tokens_seen": 307882, "step": 966, "train_runtime": 2555.0131, "train_tokens_per_second": 120.501 }, { "epoch": 0.04445977011494253, "grad_norm": 7.349896430969238, "learning_rate": 1.0365914786967419e-05, "loss": 0.35742422938346863, "num_input_tokens_seen": 308236, "step": 967, "train_runtime": 2557.119, "train_tokens_per_second": 120.54 }, { "epoch": 0.04450574712643678, "grad_norm": 7.031965732574463, "learning_rate": 1.0355889724310777e-05, "loss": 0.5171423554420471, "num_input_tokens_seen": 308604, "step": 968, "train_runtime": 2559.168, "train_tokens_per_second": 120.588 }, { "epoch": 0.044551724137931036, "grad_norm": 7.60201358795166, "learning_rate": 1.0345864661654137e-05, "loss": 0.30621081590652466, "num_input_tokens_seen": 308816, "step": 969, "train_runtime": 2561.1545, "train_tokens_per_second": 120.577 }, { "epoch": 0.04459770114942529, "grad_norm": 6.667523384094238, "learning_rate": 1.0335839598997494e-05, "loss": 0.39199793338775635, "num_input_tokens_seen": 309152, "step": 970, "train_runtime": 2563.1336, "train_tokens_per_second": 120.615 }, { "epoch": 0.04464367816091954, "grad_norm": 8.55335807800293, "learning_rate": 1.0325814536340853e-05, "loss": 0.4693825840950012, "num_input_tokens_seen": 309474, "step": 971, "train_runtime": 2565.0905, "train_tokens_per_second": 120.648 }, { "epoch": 0.04468965517241379, "grad_norm": 11.010098457336426, "learning_rate": 1.0315789473684213e-05, "loss": 0.5334758758544922, "num_input_tokens_seen": 309782, "step": 972, "train_runtime": 2567.0642, "train_tokens_per_second": 120.676 }, { "epoch": 0.044735632183908046, "grad_norm": 7.299499034881592, "learning_rate": 1.030576441102757e-05, "loss": 0.692724883556366, "num_input_tokens_seen": 310288, "step": 973, "train_runtime": 2569.0533, "train_tokens_per_second": 120.779 }, { "epoch": 0.0447816091954023, "grad_norm": 7.25387716293335, "learning_rate": 1.0295739348370928e-05, "loss": 0.5500563979148865, "num_input_tokens_seen": 310646, "step": 974, "train_runtime": 2571.0177, "train_tokens_per_second": 120.826 }, { "epoch": 0.04482758620689655, "grad_norm": 7.856181621551514, "learning_rate": 1.0285714285714285e-05, "loss": 0.5135598182678223, "num_input_tokens_seen": 310980, "step": 975, "train_runtime": 2573.1115, "train_tokens_per_second": 120.858 }, { "epoch": 0.044873563218390804, "grad_norm": 10.145916938781738, "learning_rate": 1.0275689223057645e-05, "loss": 0.5267456769943237, "num_input_tokens_seen": 311268, "step": 976, "train_runtime": 2575.0716, "train_tokens_per_second": 120.877 }, { "epoch": 0.044919540229885056, "grad_norm": 7.2765913009643555, "learning_rate": 1.0265664160401003e-05, "loss": 0.34480470418930054, "num_input_tokens_seen": 311602, "step": 977, "train_runtime": 2577.067, "train_tokens_per_second": 120.913 }, { "epoch": 0.04496551724137931, "grad_norm": 6.886968612670898, "learning_rate": 1.025563909774436e-05, "loss": 0.39189067482948303, "num_input_tokens_seen": 311864, "step": 978, "train_runtime": 2579.019, "train_tokens_per_second": 120.923 }, { "epoch": 0.04501149425287356, "grad_norm": 8.318005561828613, "learning_rate": 1.024561403508772e-05, "loss": 0.44863125681877136, "num_input_tokens_seen": 312140, "step": 979, "train_runtime": 2580.9644, "train_tokens_per_second": 120.939 }, { "epoch": 0.045057471264367814, "grad_norm": 8.14795207977295, "learning_rate": 1.0235588972431079e-05, "loss": 0.5619063377380371, "num_input_tokens_seen": 312410, "step": 980, "train_runtime": 2582.9212, "train_tokens_per_second": 120.952 }, { "epoch": 0.04510344827586207, "grad_norm": 7.044286251068115, "learning_rate": 1.0225563909774436e-05, "loss": 0.4981921911239624, "num_input_tokens_seen": 312826, "step": 981, "train_runtime": 2584.9074, "train_tokens_per_second": 121.02 }, { "epoch": 0.04514942528735632, "grad_norm": 7.485442161560059, "learning_rate": 1.0215538847117796e-05, "loss": 0.513433575630188, "num_input_tokens_seen": 313166, "step": 982, "train_runtime": 2586.9505, "train_tokens_per_second": 121.056 }, { "epoch": 0.04519540229885057, "grad_norm": 7.272876739501953, "learning_rate": 1.0205513784461154e-05, "loss": 0.4137285053730011, "num_input_tokens_seen": 313438, "step": 983, "train_runtime": 2588.914, "train_tokens_per_second": 121.069 }, { "epoch": 0.045241379310344824, "grad_norm": 7.248037815093994, "learning_rate": 1.0195488721804511e-05, "loss": 0.4240766167640686, "num_input_tokens_seen": 313780, "step": 984, "train_runtime": 2590.935, "train_tokens_per_second": 121.107 }, { "epoch": 0.04528735632183908, "grad_norm": 9.385568618774414, "learning_rate": 1.018546365914787e-05, "loss": 0.6178704500198364, "num_input_tokens_seen": 314138, "step": 985, "train_runtime": 2592.9684, "train_tokens_per_second": 121.15 }, { "epoch": 0.04533333333333334, "grad_norm": 8.061515808105469, "learning_rate": 1.017543859649123e-05, "loss": 0.44137874245643616, "num_input_tokens_seen": 314496, "step": 986, "train_runtime": 2594.9659, "train_tokens_per_second": 121.195 }, { "epoch": 0.04537931034482759, "grad_norm": 7.891003131866455, "learning_rate": 1.0165413533834587e-05, "loss": 0.45911043882369995, "num_input_tokens_seen": 314790, "step": 987, "train_runtime": 2596.919, "train_tokens_per_second": 121.217 }, { "epoch": 0.04542528735632184, "grad_norm": 7.65133810043335, "learning_rate": 1.0155388471177945e-05, "loss": 0.39683860540390015, "num_input_tokens_seen": 315008, "step": 988, "train_runtime": 2598.8565, "train_tokens_per_second": 121.21 }, { "epoch": 0.045471264367816094, "grad_norm": 6.9997076988220215, "learning_rate": 1.0145363408521305e-05, "loss": 0.40674012899398804, "num_input_tokens_seen": 315338, "step": 989, "train_runtime": 2600.8158, "train_tokens_per_second": 121.246 }, { "epoch": 0.04551724137931035, "grad_norm": 9.910818099975586, "learning_rate": 1.0135338345864662e-05, "loss": 0.5541273355484009, "num_input_tokens_seen": 315702, "step": 990, "train_runtime": 2602.7546, "train_tokens_per_second": 121.295 }, { "epoch": 0.0455632183908046, "grad_norm": 7.932651519775391, "learning_rate": 1.012531328320802e-05, "loss": 0.44719380140304565, "num_input_tokens_seen": 316008, "step": 991, "train_runtime": 2617.923, "train_tokens_per_second": 120.709 }, { "epoch": 0.04560919540229885, "grad_norm": 8.502070426940918, "learning_rate": 1.011528822055138e-05, "loss": 0.59912109375, "num_input_tokens_seen": 316354, "step": 992, "train_runtime": 2619.9059, "train_tokens_per_second": 120.75 }, { "epoch": 0.045655172413793105, "grad_norm": 8.09085464477539, "learning_rate": 1.0105263157894738e-05, "loss": 0.5389885306358337, "num_input_tokens_seen": 316728, "step": 993, "train_runtime": 2621.892, "train_tokens_per_second": 120.801 }, { "epoch": 0.04570114942528736, "grad_norm": 6.942469596862793, "learning_rate": 1.0095238095238096e-05, "loss": 0.3687466084957123, "num_input_tokens_seen": 316986, "step": 994, "train_runtime": 2623.8331, "train_tokens_per_second": 120.81 }, { "epoch": 0.04574712643678161, "grad_norm": 7.85964298248291, "learning_rate": 1.0085213032581453e-05, "loss": 0.6065055131912231, "num_input_tokens_seen": 317410, "step": 995, "train_runtime": 2625.9026, "train_tokens_per_second": 120.877 }, { "epoch": 0.04579310344827586, "grad_norm": 6.808088779449463, "learning_rate": 1.0075187969924813e-05, "loss": 0.42792007327079773, "num_input_tokens_seen": 317712, "step": 996, "train_runtime": 2627.9333, "train_tokens_per_second": 120.898 }, { "epoch": 0.045839080459770115, "grad_norm": 7.471822261810303, "learning_rate": 1.0065162907268171e-05, "loss": 0.5098698735237122, "num_input_tokens_seen": 318052, "step": 997, "train_runtime": 2629.9432, "train_tokens_per_second": 120.935 }, { "epoch": 0.04588505747126437, "grad_norm": 8.29421615600586, "learning_rate": 1.0055137844611528e-05, "loss": 0.4087499976158142, "num_input_tokens_seen": 318288, "step": 998, "train_runtime": 2631.9251, "train_tokens_per_second": 120.934 }, { "epoch": 0.04593103448275862, "grad_norm": 8.272956848144531, "learning_rate": 1.0045112781954888e-05, "loss": 0.640299379825592, "num_input_tokens_seen": 318644, "step": 999, "train_runtime": 2633.9459, "train_tokens_per_second": 120.976 }, { "epoch": 0.04597701149425287, "grad_norm": 7.522319316864014, "learning_rate": 1.0035087719298247e-05, "loss": 0.47425469756126404, "num_input_tokens_seen": 318948, "step": 1000, "train_runtime": 2635.9461, "train_tokens_per_second": 120.999 }, { "epoch": 0.04597701149425287, "eval_loss": 1.7173823118209839, "eval_runtime": 55.1446, "eval_samples_per_second": 18.134, "eval_steps_per_second": 9.067, "num_input_tokens_seen": 318948, "step": 1000 }, { "epoch": 0.046022988505747126, "grad_norm": 6.9273600578308105, "learning_rate": 1.0025062656641604e-05, "loss": 0.46524420380592346, "num_input_tokens_seen": 319260, "step": 1001, "train_runtime": 2693.2393, "train_tokens_per_second": 118.541 }, { "epoch": 0.04606896551724138, "grad_norm": 13.683260917663574, "learning_rate": 1.0015037593984964e-05, "loss": 0.5733553171157837, "num_input_tokens_seen": 319556, "step": 1002, "train_runtime": 2695.2467, "train_tokens_per_second": 118.563 }, { "epoch": 0.04611494252873563, "grad_norm": 7.395852088928223, "learning_rate": 1.0005012531328322e-05, "loss": 0.4862205684185028, "num_input_tokens_seen": 319984, "step": 1003, "train_runtime": 2697.3607, "train_tokens_per_second": 118.629 }, { "epoch": 0.04616091954022988, "grad_norm": 6.674742698669434, "learning_rate": 9.99498746867168e-06, "loss": 0.4223348796367645, "num_input_tokens_seen": 320264, "step": 1004, "train_runtime": 2699.3785, "train_tokens_per_second": 118.644 }, { "epoch": 0.046206896551724136, "grad_norm": 7.067044734954834, "learning_rate": 9.984962406015038e-06, "loss": 0.36694225668907166, "num_input_tokens_seen": 320532, "step": 1005, "train_runtime": 2701.4024, "train_tokens_per_second": 118.654 }, { "epoch": 0.04625287356321839, "grad_norm": 7.723959922790527, "learning_rate": 9.974937343358396e-06, "loss": 0.4250967800617218, "num_input_tokens_seen": 320852, "step": 1006, "train_runtime": 2703.3783, "train_tokens_per_second": 118.686 }, { "epoch": 0.04629885057471264, "grad_norm": 6.667568206787109, "learning_rate": 9.964912280701755e-06, "loss": 0.3907022178173065, "num_input_tokens_seen": 321148, "step": 1007, "train_runtime": 2705.3199, "train_tokens_per_second": 118.71 }, { "epoch": 0.046344827586206894, "grad_norm": 7.259830951690674, "learning_rate": 9.954887218045113e-06, "loss": 0.37166735529899597, "num_input_tokens_seen": 321460, "step": 1008, "train_runtime": 2707.2957, "train_tokens_per_second": 118.738 }, { "epoch": 0.046390804597701146, "grad_norm": 8.259964942932129, "learning_rate": 9.944862155388472e-06, "loss": 0.4947519898414612, "num_input_tokens_seen": 321724, "step": 1009, "train_runtime": 2709.2475, "train_tokens_per_second": 118.75 }, { "epoch": 0.0464367816091954, "grad_norm": 6.72380256652832, "learning_rate": 9.93483709273183e-06, "loss": 0.2749987840652466, "num_input_tokens_seen": 321966, "step": 1010, "train_runtime": 2711.1998, "train_tokens_per_second": 118.754 }, { "epoch": 0.04648275862068966, "grad_norm": 7.118277072906494, "learning_rate": 9.924812030075189e-06, "loss": 0.3629249036312103, "num_input_tokens_seen": 322232, "step": 1011, "train_runtime": 2713.1547, "train_tokens_per_second": 118.767 }, { "epoch": 0.04652873563218391, "grad_norm": 6.580169677734375, "learning_rate": 9.914786967418547e-06, "loss": 0.35471388697624207, "num_input_tokens_seen": 322632, "step": 1012, "train_runtime": 2715.1573, "train_tokens_per_second": 118.826 }, { "epoch": 0.046574712643678164, "grad_norm": 7.097537994384766, "learning_rate": 9.904761904761906e-06, "loss": 0.3747185170650482, "num_input_tokens_seen": 322882, "step": 1013, "train_runtime": 2717.1019, "train_tokens_per_second": 118.833 }, { "epoch": 0.046620689655172416, "grad_norm": 6.884876251220703, "learning_rate": 9.894736842105264e-06, "loss": 0.49874210357666016, "num_input_tokens_seen": 323314, "step": 1014, "train_runtime": 2719.1045, "train_tokens_per_second": 118.905 }, { "epoch": 0.04666666666666667, "grad_norm": 8.016444206237793, "learning_rate": 9.884711779448623e-06, "loss": 0.5174450278282166, "num_input_tokens_seen": 323672, "step": 1015, "train_runtime": 2721.096, "train_tokens_per_second": 118.949 }, { "epoch": 0.04671264367816092, "grad_norm": 9.015275001525879, "learning_rate": 9.87468671679198e-06, "loss": 0.3318605422973633, "num_input_tokens_seen": 323916, "step": 1016, "train_runtime": 2723.0452, "train_tokens_per_second": 118.954 }, { "epoch": 0.046758620689655174, "grad_norm": 7.451302528381348, "learning_rate": 9.86466165413534e-06, "loss": 0.35202082991600037, "num_input_tokens_seen": 324194, "step": 1017, "train_runtime": 2725.0022, "train_tokens_per_second": 118.97 }, { "epoch": 0.04680459770114943, "grad_norm": 6.906904697418213, "learning_rate": 9.854636591478698e-06, "loss": 0.5809968709945679, "num_input_tokens_seen": 324726, "step": 1018, "train_runtime": 2727.0309, "train_tokens_per_second": 119.077 }, { "epoch": 0.04685057471264368, "grad_norm": 7.594064235687256, "learning_rate": 9.844611528822055e-06, "loss": 0.43761134147644043, "num_input_tokens_seen": 325010, "step": 1019, "train_runtime": 2729.0043, "train_tokens_per_second": 119.095 }, { "epoch": 0.04689655172413793, "grad_norm": 7.633775234222412, "learning_rate": 9.834586466165415e-06, "loss": 0.3381976783275604, "num_input_tokens_seen": 325346, "step": 1020, "train_runtime": 2731.1163, "train_tokens_per_second": 119.126 }, { "epoch": 0.046942528735632184, "grad_norm": 7.1371002197265625, "learning_rate": 9.824561403508772e-06, "loss": 0.5091744065284729, "num_input_tokens_seen": 326268, "step": 1021, "train_runtime": 2746.5022, "train_tokens_per_second": 118.794 }, { "epoch": 0.04698850574712644, "grad_norm": 7.4820051193237305, "learning_rate": 9.81453634085213e-06, "loss": 0.45310309529304504, "num_input_tokens_seen": 326540, "step": 1022, "train_runtime": 2748.5398, "train_tokens_per_second": 118.805 }, { "epoch": 0.04703448275862069, "grad_norm": 7.082658767700195, "learning_rate": 9.80451127819549e-06, "loss": 0.36116427183151245, "num_input_tokens_seen": 326768, "step": 1023, "train_runtime": 2750.5045, "train_tokens_per_second": 118.803 }, { "epoch": 0.04708045977011494, "grad_norm": 5.537309169769287, "learning_rate": 9.794486215538847e-06, "loss": 0.3114401698112488, "num_input_tokens_seen": 326992, "step": 1024, "train_runtime": 2752.4864, "train_tokens_per_second": 118.799 }, { "epoch": 0.047126436781609195, "grad_norm": 8.36307144165039, "learning_rate": 9.784461152882206e-06, "loss": 0.355997771024704, "num_input_tokens_seen": 327218, "step": 1025, "train_runtime": 2754.4641, "train_tokens_per_second": 118.796 }, { "epoch": 0.04717241379310345, "grad_norm": 7.312787055969238, "learning_rate": 9.774436090225564e-06, "loss": 0.3455454707145691, "num_input_tokens_seen": 327508, "step": 1026, "train_runtime": 2756.4876, "train_tokens_per_second": 118.814 }, { "epoch": 0.0472183908045977, "grad_norm": 7.130361557006836, "learning_rate": 9.764411027568923e-06, "loss": 0.4309677183628082, "num_input_tokens_seen": 327826, "step": 1027, "train_runtime": 2758.4651, "train_tokens_per_second": 118.844 }, { "epoch": 0.04726436781609195, "grad_norm": 7.263982772827148, "learning_rate": 9.754385964912281e-06, "loss": 0.39605748653411865, "num_input_tokens_seen": 328062, "step": 1028, "train_runtime": 2760.4029, "train_tokens_per_second": 118.846 }, { "epoch": 0.047310344827586205, "grad_norm": 6.753585338592529, "learning_rate": 9.74436090225564e-06, "loss": 0.3983078896999359, "num_input_tokens_seen": 328386, "step": 1029, "train_runtime": 2762.4619, "train_tokens_per_second": 118.874 }, { "epoch": 0.04735632183908046, "grad_norm": 7.322591781616211, "learning_rate": 9.734335839598998e-06, "loss": 0.3312835395336151, "num_input_tokens_seen": 328610, "step": 1030, "train_runtime": 2764.4537, "train_tokens_per_second": 118.87 }, { "epoch": 0.04740229885057471, "grad_norm": 7.22749137878418, "learning_rate": 9.724310776942357e-06, "loss": 0.377351850271225, "num_input_tokens_seen": 328878, "step": 1031, "train_runtime": 2766.4086, "train_tokens_per_second": 118.883 }, { "epoch": 0.04744827586206896, "grad_norm": 7.166253089904785, "learning_rate": 9.714285714285715e-06, "loss": 0.43618372082710266, "num_input_tokens_seen": 329226, "step": 1032, "train_runtime": 2768.3822, "train_tokens_per_second": 118.924 }, { "epoch": 0.047494252873563216, "grad_norm": 7.763054847717285, "learning_rate": 9.704260651629074e-06, "loss": 0.48253417015075684, "num_input_tokens_seen": 329488, "step": 1033, "train_runtime": 2770.3245, "train_tokens_per_second": 118.935 }, { "epoch": 0.04754022988505747, "grad_norm": 7.806169033050537, "learning_rate": 9.694235588972432e-06, "loss": 0.40141862630844116, "num_input_tokens_seen": 329786, "step": 1034, "train_runtime": 2772.3003, "train_tokens_per_second": 118.958 }, { "epoch": 0.04758620689655172, "grad_norm": 7.727939605712891, "learning_rate": 9.68421052631579e-06, "loss": 0.43414315581321716, "num_input_tokens_seen": 330084, "step": 1035, "train_runtime": 2774.2547, "train_tokens_per_second": 118.981 }, { "epoch": 0.04763218390804598, "grad_norm": 9.545808792114258, "learning_rate": 9.674185463659147e-06, "loss": 0.6307319402694702, "num_input_tokens_seen": 330398, "step": 1036, "train_runtime": 2776.2079, "train_tokens_per_second": 119.011 }, { "epoch": 0.04767816091954023, "grad_norm": 11.138605117797852, "learning_rate": 9.664160401002508e-06, "loss": 0.518451452255249, "num_input_tokens_seen": 330694, "step": 1037, "train_runtime": 2778.272, "train_tokens_per_second": 119.029 }, { "epoch": 0.047724137931034485, "grad_norm": 7.458420276641846, "learning_rate": 9.654135338345866e-06, "loss": 0.5234805941581726, "num_input_tokens_seen": 331048, "step": 1038, "train_runtime": 2780.2557, "train_tokens_per_second": 119.071 }, { "epoch": 0.04777011494252874, "grad_norm": 7.09022855758667, "learning_rate": 9.644110275689223e-06, "loss": 0.40761256217956543, "num_input_tokens_seen": 331406, "step": 1039, "train_runtime": 2782.298, "train_tokens_per_second": 119.112 }, { "epoch": 0.04781609195402299, "grad_norm": 11.615792274475098, "learning_rate": 9.634085213032583e-06, "loss": 0.46781405806541443, "num_input_tokens_seen": 331688, "step": 1040, "train_runtime": 2784.2822, "train_tokens_per_second": 119.129 }, { "epoch": 0.04786206896551724, "grad_norm": 5.815955638885498, "learning_rate": 9.62406015037594e-06, "loss": 0.2744513154029846, "num_input_tokens_seen": 331908, "step": 1041, "train_runtime": 2786.2316, "train_tokens_per_second": 119.124 }, { "epoch": 0.047908045977011496, "grad_norm": 8.99447250366211, "learning_rate": 9.614035087719298e-06, "loss": 0.3928970694541931, "num_input_tokens_seen": 332148, "step": 1042, "train_runtime": 2788.1834, "train_tokens_per_second": 119.127 }, { "epoch": 0.04795402298850575, "grad_norm": 8.52641773223877, "learning_rate": 9.604010025062659e-06, "loss": 0.4255361557006836, "num_input_tokens_seen": 332452, "step": 1043, "train_runtime": 2790.2292, "train_tokens_per_second": 119.149 }, { "epoch": 0.048, "grad_norm": 6.427272319793701, "learning_rate": 9.593984962406015e-06, "loss": 0.28434616327285767, "num_input_tokens_seen": 332712, "step": 1044, "train_runtime": 2792.2759, "train_tokens_per_second": 119.154 }, { "epoch": 0.048045977011494254, "grad_norm": 8.600190162658691, "learning_rate": 9.583959899749374e-06, "loss": 0.44470202922821045, "num_input_tokens_seen": 332982, "step": 1045, "train_runtime": 2794.3692, "train_tokens_per_second": 119.162 }, { "epoch": 0.048091954022988506, "grad_norm": 7.377002716064453, "learning_rate": 9.573934837092732e-06, "loss": 0.42285972833633423, "num_input_tokens_seen": 333386, "step": 1046, "train_runtime": 2796.3878, "train_tokens_per_second": 119.22 }, { "epoch": 0.04813793103448276, "grad_norm": 8.298364639282227, "learning_rate": 9.56390977443609e-06, "loss": 0.5232506990432739, "num_input_tokens_seen": 333702, "step": 1047, "train_runtime": 2798.5052, "train_tokens_per_second": 119.243 }, { "epoch": 0.04818390804597701, "grad_norm": 9.52237606048584, "learning_rate": 9.55388471177945e-06, "loss": 0.4316413998603821, "num_input_tokens_seen": 334004, "step": 1048, "train_runtime": 2800.5729, "train_tokens_per_second": 119.263 }, { "epoch": 0.048229885057471264, "grad_norm": 8.141901969909668, "learning_rate": 9.543859649122808e-06, "loss": 0.36646947264671326, "num_input_tokens_seen": 334246, "step": 1049, "train_runtime": 2802.565, "train_tokens_per_second": 119.264 }, { "epoch": 0.04827586206896552, "grad_norm": 8.07127857208252, "learning_rate": 9.533834586466166e-06, "loss": 0.49001407623291016, "num_input_tokens_seen": 334584, "step": 1050, "train_runtime": 2804.5894, "train_tokens_per_second": 119.299 }, { "epoch": 0.04832183908045977, "grad_norm": 8.100993156433105, "learning_rate": 9.523809523809525e-06, "loss": 0.45338425040245056, "num_input_tokens_seen": 334854, "step": 1051, "train_runtime": 2820.4966, "train_tokens_per_second": 118.722 }, { "epoch": 0.04836781609195402, "grad_norm": 8.30936336517334, "learning_rate": 9.513784461152883e-06, "loss": 0.43239009380340576, "num_input_tokens_seen": 335062, "step": 1052, "train_runtime": 2822.5391, "train_tokens_per_second": 118.709 }, { "epoch": 0.048413793103448274, "grad_norm": 10.822750091552734, "learning_rate": 9.503759398496242e-06, "loss": 0.5045852661132812, "num_input_tokens_seen": 335386, "step": 1053, "train_runtime": 2824.5594, "train_tokens_per_second": 118.739 }, { "epoch": 0.04845977011494253, "grad_norm": 7.888216972351074, "learning_rate": 9.4937343358396e-06, "loss": 0.47344547510147095, "num_input_tokens_seen": 335774, "step": 1054, "train_runtime": 2826.614, "train_tokens_per_second": 118.79 }, { "epoch": 0.04850574712643678, "grad_norm": 8.200318336486816, "learning_rate": 9.483709273182959e-06, "loss": 0.590822160243988, "num_input_tokens_seen": 336072, "step": 1055, "train_runtime": 2828.6399, "train_tokens_per_second": 118.81 }, { "epoch": 0.04855172413793103, "grad_norm": 8.955785751342773, "learning_rate": 9.473684210526315e-06, "loss": 0.5345810055732727, "num_input_tokens_seen": 336352, "step": 1056, "train_runtime": 2830.597, "train_tokens_per_second": 118.827 }, { "epoch": 0.048597701149425285, "grad_norm": 7.858545303344727, "learning_rate": 9.463659147869676e-06, "loss": 0.4652344584465027, "num_input_tokens_seen": 336634, "step": 1057, "train_runtime": 2832.5933, "train_tokens_per_second": 118.843 }, { "epoch": 0.04864367816091954, "grad_norm": 6.894465446472168, "learning_rate": 9.453634085213034e-06, "loss": 0.37855982780456543, "num_input_tokens_seen": 336922, "step": 1058, "train_runtime": 2834.5698, "train_tokens_per_second": 118.862 }, { "epoch": 0.04868965517241379, "grad_norm": 8.946717262268066, "learning_rate": 9.443609022556391e-06, "loss": 0.5390365123748779, "num_input_tokens_seen": 337180, "step": 1059, "train_runtime": 2836.6011, "train_tokens_per_second": 118.868 }, { "epoch": 0.04873563218390804, "grad_norm": 8.382868766784668, "learning_rate": 9.43358395989975e-06, "loss": 0.5391836762428284, "num_input_tokens_seen": 337460, "step": 1060, "train_runtime": 2838.5884, "train_tokens_per_second": 118.883 }, { "epoch": 0.0487816091954023, "grad_norm": 7.397761821746826, "learning_rate": 9.423558897243108e-06, "loss": 0.40352505445480347, "num_input_tokens_seen": 337818, "step": 1061, "train_runtime": 2840.6271, "train_tokens_per_second": 118.924 }, { "epoch": 0.048827586206896555, "grad_norm": 9.155498504638672, "learning_rate": 9.413533834586466e-06, "loss": 0.5041525959968567, "num_input_tokens_seen": 338152, "step": 1062, "train_runtime": 2842.6538, "train_tokens_per_second": 118.956 }, { "epoch": 0.04887356321839081, "grad_norm": 8.839866638183594, "learning_rate": 9.403508771929825e-06, "loss": 0.5147091150283813, "num_input_tokens_seen": 338490, "step": 1063, "train_runtime": 2844.726, "train_tokens_per_second": 118.989 }, { "epoch": 0.04891954022988506, "grad_norm": 7.973474502563477, "learning_rate": 9.393483709273183e-06, "loss": 0.47533437609672546, "num_input_tokens_seen": 338778, "step": 1064, "train_runtime": 2846.6857, "train_tokens_per_second": 119.008 }, { "epoch": 0.04896551724137931, "grad_norm": 7.850538730621338, "learning_rate": 9.383458646616542e-06, "loss": 0.3330311179161072, "num_input_tokens_seen": 339058, "step": 1065, "train_runtime": 2848.6412, "train_tokens_per_second": 119.024 }, { "epoch": 0.049011494252873565, "grad_norm": 7.935583114624023, "learning_rate": 9.3734335839599e-06, "loss": 0.4993591904640198, "num_input_tokens_seen": 339354, "step": 1066, "train_runtime": 2850.6322, "train_tokens_per_second": 119.045 }, { "epoch": 0.04905747126436782, "grad_norm": 8.978984832763672, "learning_rate": 9.363408521303259e-06, "loss": 0.5230007171630859, "num_input_tokens_seen": 339706, "step": 1067, "train_runtime": 2852.6395, "train_tokens_per_second": 119.085 }, { "epoch": 0.04910344827586207, "grad_norm": 9.016287803649902, "learning_rate": 9.353383458646617e-06, "loss": 0.4591520130634308, "num_input_tokens_seen": 339994, "step": 1068, "train_runtime": 2854.609, "train_tokens_per_second": 119.104 }, { "epoch": 0.04914942528735632, "grad_norm": 7.878653526306152, "learning_rate": 9.343358395989976e-06, "loss": 0.38075506687164307, "num_input_tokens_seen": 340262, "step": 1069, "train_runtime": 2856.6093, "train_tokens_per_second": 119.114 }, { "epoch": 0.049195402298850575, "grad_norm": 15.90587043762207, "learning_rate": 9.333333333333334e-06, "loss": 0.45033928751945496, "num_input_tokens_seen": 340498, "step": 1070, "train_runtime": 2858.5511, "train_tokens_per_second": 119.116 }, { "epoch": 0.04924137931034483, "grad_norm": 8.365623474121094, "learning_rate": 9.323308270676693e-06, "loss": 0.46389204263687134, "num_input_tokens_seen": 340732, "step": 1071, "train_runtime": 2860.4917, "train_tokens_per_second": 119.117 }, { "epoch": 0.04928735632183908, "grad_norm": 7.068108558654785, "learning_rate": 9.313283208020051e-06, "loss": 0.40667521953582764, "num_input_tokens_seen": 341012, "step": 1072, "train_runtime": 2862.4885, "train_tokens_per_second": 119.131 }, { "epoch": 0.04933333333333333, "grad_norm": 6.176692485809326, "learning_rate": 9.30325814536341e-06, "loss": 0.25460129976272583, "num_input_tokens_seen": 341244, "step": 1073, "train_runtime": 2864.4842, "train_tokens_per_second": 119.129 }, { "epoch": 0.049379310344827586, "grad_norm": 8.334495544433594, "learning_rate": 9.293233082706767e-06, "loss": 0.42830508947372437, "num_input_tokens_seen": 341490, "step": 1074, "train_runtime": 2866.439, "train_tokens_per_second": 119.134 }, { "epoch": 0.04942528735632184, "grad_norm": 8.23608112335205, "learning_rate": 9.283208020050127e-06, "loss": 0.5677105784416199, "num_input_tokens_seen": 341828, "step": 1075, "train_runtime": 2868.4276, "train_tokens_per_second": 119.169 }, { "epoch": 0.04947126436781609, "grad_norm": 15.787196159362793, "learning_rate": 9.273182957393484e-06, "loss": 0.5085170269012451, "num_input_tokens_seen": 342084, "step": 1076, "train_runtime": 2870.3745, "train_tokens_per_second": 119.177 }, { "epoch": 0.049517241379310344, "grad_norm": 7.366590976715088, "learning_rate": 9.263157894736842e-06, "loss": 0.4475935101509094, "num_input_tokens_seen": 342496, "step": 1077, "train_runtime": 2872.4136, "train_tokens_per_second": 119.236 }, { "epoch": 0.049563218390804596, "grad_norm": 8.59300708770752, "learning_rate": 9.253132832080202e-06, "loss": 0.40707725286483765, "num_input_tokens_seen": 342794, "step": 1078, "train_runtime": 2874.4167, "train_tokens_per_second": 119.257 }, { "epoch": 0.04960919540229885, "grad_norm": 7.537459850311279, "learning_rate": 9.243107769423559e-06, "loss": 0.2980315089225769, "num_input_tokens_seen": 343024, "step": 1079, "train_runtime": 2876.3932, "train_tokens_per_second": 119.255 }, { "epoch": 0.0496551724137931, "grad_norm": 8.121476173400879, "learning_rate": 9.233082706766918e-06, "loss": 0.37251514196395874, "num_input_tokens_seen": 343362, "step": 1080, "train_runtime": 2878.349, "train_tokens_per_second": 119.291 }, { "epoch": 0.049701149425287354, "grad_norm": 6.9334940910339355, "learning_rate": 9.223057644110276e-06, "loss": 0.3058217763900757, "num_input_tokens_seen": 343578, "step": 1081, "train_runtime": 2893.554, "train_tokens_per_second": 118.739 }, { "epoch": 0.04974712643678161, "grad_norm": 7.499663352966309, "learning_rate": 9.213032581453634e-06, "loss": 0.43159013986587524, "num_input_tokens_seen": 343852, "step": 1082, "train_runtime": 2895.5143, "train_tokens_per_second": 118.753 }, { "epoch": 0.04979310344827586, "grad_norm": 7.372053146362305, "learning_rate": 9.203007518796993e-06, "loss": 0.3495287597179413, "num_input_tokens_seen": 344100, "step": 1083, "train_runtime": 2897.5735, "train_tokens_per_second": 118.755 }, { "epoch": 0.04983908045977011, "grad_norm": 6.331181049346924, "learning_rate": 9.192982456140351e-06, "loss": 0.42055273056030273, "num_input_tokens_seen": 344528, "step": 1084, "train_runtime": 2899.5819, "train_tokens_per_second": 118.82 }, { "epoch": 0.049885057471264364, "grad_norm": 7.463900566101074, "learning_rate": 9.18295739348371e-06, "loss": 0.510176956653595, "num_input_tokens_seen": 344788, "step": 1085, "train_runtime": 2901.5421, "train_tokens_per_second": 118.829 }, { "epoch": 0.049931034482758624, "grad_norm": 9.023658752441406, "learning_rate": 9.172932330827068e-06, "loss": 0.45956721901893616, "num_input_tokens_seen": 345018, "step": 1086, "train_runtime": 2903.489, "train_tokens_per_second": 118.829 }, { "epoch": 0.049977011494252876, "grad_norm": 7.309625148773193, "learning_rate": 9.162907268170427e-06, "loss": 0.47155243158340454, "num_input_tokens_seen": 345366, "step": 1087, "train_runtime": 2905.5344, "train_tokens_per_second": 118.865 }, { "epoch": 0.05002298850574713, "grad_norm": 7.602726936340332, "learning_rate": 9.152882205513785e-06, "loss": 0.3295368254184723, "num_input_tokens_seen": 345568, "step": 1088, "train_runtime": 2907.5286, "train_tokens_per_second": 118.853 }, { "epoch": 0.05006896551724138, "grad_norm": 10.183154106140137, "learning_rate": 9.142857142857144e-06, "loss": 0.4740368127822876, "num_input_tokens_seen": 345860, "step": 1089, "train_runtime": 2909.4781, "train_tokens_per_second": 118.874 }, { "epoch": 0.050114942528735634, "grad_norm": 8.111772537231445, "learning_rate": 9.132832080200502e-06, "loss": 0.48555850982666016, "num_input_tokens_seen": 346158, "step": 1090, "train_runtime": 2911.4362, "train_tokens_per_second": 118.896 }, { "epoch": 0.05016091954022989, "grad_norm": 8.932589530944824, "learning_rate": 9.12280701754386e-06, "loss": 0.5541291832923889, "num_input_tokens_seen": 346458, "step": 1091, "train_runtime": 2913.395, "train_tokens_per_second": 118.919 }, { "epoch": 0.05020689655172414, "grad_norm": 6.192288875579834, "learning_rate": 9.11278195488722e-06, "loss": 0.3381243348121643, "num_input_tokens_seen": 346682, "step": 1092, "train_runtime": 2915.3275, "train_tokens_per_second": 118.917 }, { "epoch": 0.05025287356321839, "grad_norm": 7.6365485191345215, "learning_rate": 9.102756892230578e-06, "loss": 0.3119629919528961, "num_input_tokens_seen": 346906, "step": 1093, "train_runtime": 2917.3278, "train_tokens_per_second": 118.912 }, { "epoch": 0.050298850574712645, "grad_norm": 8.041963577270508, "learning_rate": 9.092731829573935e-06, "loss": 0.3600906729698181, "num_input_tokens_seen": 347214, "step": 1094, "train_runtime": 2919.3592, "train_tokens_per_second": 118.935 }, { "epoch": 0.0503448275862069, "grad_norm": 7.429046630859375, "learning_rate": 9.082706766917295e-06, "loss": 0.44096723198890686, "num_input_tokens_seen": 347524, "step": 1095, "train_runtime": 2921.3277, "train_tokens_per_second": 118.961 }, { "epoch": 0.05039080459770115, "grad_norm": 8.05813980102539, "learning_rate": 9.072681704260652e-06, "loss": 0.6170783042907715, "num_input_tokens_seen": 347912, "step": 1096, "train_runtime": 2923.3265, "train_tokens_per_second": 119.012 }, { "epoch": 0.0504367816091954, "grad_norm": 9.138258934020996, "learning_rate": 9.06265664160401e-06, "loss": 0.6430239677429199, "num_input_tokens_seen": 348210, "step": 1097, "train_runtime": 2925.2762, "train_tokens_per_second": 119.035 }, { "epoch": 0.050482758620689655, "grad_norm": 7.271088123321533, "learning_rate": 9.05263157894737e-06, "loss": 0.3724372088909149, "num_input_tokens_seen": 348472, "step": 1098, "train_runtime": 2927.2245, "train_tokens_per_second": 119.045 }, { "epoch": 0.05052873563218391, "grad_norm": 9.22109317779541, "learning_rate": 9.042606516290727e-06, "loss": 0.5635727643966675, "num_input_tokens_seen": 348792, "step": 1099, "train_runtime": 2929.1772, "train_tokens_per_second": 119.075 }, { "epoch": 0.05057471264367816, "grad_norm": 7.555117130279541, "learning_rate": 9.032581453634086e-06, "loss": 0.46877145767211914, "num_input_tokens_seen": 349152, "step": 1100, "train_runtime": 2931.1636, "train_tokens_per_second": 119.117 }, { "epoch": 0.05062068965517241, "grad_norm": 7.465952396392822, "learning_rate": 9.022556390977444e-06, "loss": 0.414106547832489, "num_input_tokens_seen": 349442, "step": 1101, "train_runtime": 2933.1308, "train_tokens_per_second": 119.136 }, { "epoch": 0.050666666666666665, "grad_norm": 8.254798889160156, "learning_rate": 9.012531328320803e-06, "loss": 0.5444568395614624, "num_input_tokens_seen": 349754, "step": 1102, "train_runtime": 2935.0995, "train_tokens_per_second": 119.163 }, { "epoch": 0.05071264367816092, "grad_norm": 7.881249904632568, "learning_rate": 9.002506265664161e-06, "loss": 0.44626545906066895, "num_input_tokens_seen": 350048, "step": 1103, "train_runtime": 2937.0817, "train_tokens_per_second": 119.182 }, { "epoch": 0.05075862068965517, "grad_norm": 7.48320198059082, "learning_rate": 8.99248120300752e-06, "loss": 0.3517981469631195, "num_input_tokens_seen": 350280, "step": 1104, "train_runtime": 2939.0352, "train_tokens_per_second": 119.182 }, { "epoch": 0.05080459770114942, "grad_norm": 8.440960884094238, "learning_rate": 8.982456140350878e-06, "loss": 0.4097956418991089, "num_input_tokens_seen": 350572, "step": 1105, "train_runtime": 2940.995, "train_tokens_per_second": 119.202 }, { "epoch": 0.050850574712643676, "grad_norm": 8.25269603729248, "learning_rate": 8.972431077694236e-06, "loss": 0.48889172077178955, "num_input_tokens_seen": 350902, "step": 1106, "train_runtime": 2942.9575, "train_tokens_per_second": 119.234 }, { "epoch": 0.05089655172413793, "grad_norm": 7.786253452301025, "learning_rate": 8.962406015037595e-06, "loss": 0.395815908908844, "num_input_tokens_seen": 351170, "step": 1107, "train_runtime": 2944.9076, "train_tokens_per_second": 119.247 }, { "epoch": 0.05094252873563218, "grad_norm": 9.107592582702637, "learning_rate": 8.952380952380953e-06, "loss": 0.4389643967151642, "num_input_tokens_seen": 351470, "step": 1108, "train_runtime": 2946.8827, "train_tokens_per_second": 119.268 }, { "epoch": 0.050988505747126434, "grad_norm": 7.5205769538879395, "learning_rate": 8.942355889724312e-06, "loss": 0.4152507781982422, "num_input_tokens_seen": 351762, "step": 1109, "train_runtime": 2948.8932, "train_tokens_per_second": 119.286 }, { "epoch": 0.05103448275862069, "grad_norm": 7.165195465087891, "learning_rate": 8.93233082706767e-06, "loss": 0.30179163813591003, "num_input_tokens_seen": 352052, "step": 1110, "train_runtime": 2950.8661, "train_tokens_per_second": 119.305 }, { "epoch": 0.051080459770114946, "grad_norm": 6.335844993591309, "learning_rate": 8.922305764411027e-06, "loss": 0.3719693422317505, "num_input_tokens_seen": 352372, "step": 1111, "train_runtime": 2965.7246, "train_tokens_per_second": 118.815 }, { "epoch": 0.0511264367816092, "grad_norm": 7.419812202453613, "learning_rate": 8.912280701754387e-06, "loss": 0.4624994397163391, "num_input_tokens_seen": 352686, "step": 1112, "train_runtime": 2967.9535, "train_tokens_per_second": 118.831 }, { "epoch": 0.05117241379310345, "grad_norm": 6.95173454284668, "learning_rate": 8.902255639097746e-06, "loss": 0.4526553153991699, "num_input_tokens_seen": 353018, "step": 1113, "train_runtime": 2970.0208, "train_tokens_per_second": 118.86 }, { "epoch": 0.051218390804597703, "grad_norm": 8.418750762939453, "learning_rate": 8.892230576441103e-06, "loss": 0.511723518371582, "num_input_tokens_seen": 353334, "step": 1114, "train_runtime": 2971.9865, "train_tokens_per_second": 118.888 }, { "epoch": 0.051264367816091956, "grad_norm": 10.712956428527832, "learning_rate": 8.882205513784463e-06, "loss": 0.5056782960891724, "num_input_tokens_seen": 353550, "step": 1115, "train_runtime": 2973.9452, "train_tokens_per_second": 118.882 }, { "epoch": 0.05131034482758621, "grad_norm": 8.346527099609375, "learning_rate": 8.87218045112782e-06, "loss": 0.46319133043289185, "num_input_tokens_seen": 353906, "step": 1116, "train_runtime": 2975.9605, "train_tokens_per_second": 118.922 }, { "epoch": 0.05135632183908046, "grad_norm": 8.855955123901367, "learning_rate": 8.862155388471178e-06, "loss": 0.5140814185142517, "num_input_tokens_seen": 354200, "step": 1117, "train_runtime": 2977.9194, "train_tokens_per_second": 118.942 }, { "epoch": 0.051402298850574714, "grad_norm": 8.370678901672363, "learning_rate": 8.852130325814537e-06, "loss": 0.4319264888763428, "num_input_tokens_seen": 354460, "step": 1118, "train_runtime": 2979.8993, "train_tokens_per_second": 118.95 }, { "epoch": 0.051448275862068966, "grad_norm": 7.829343795776367, "learning_rate": 8.842105263157895e-06, "loss": 0.4126385450363159, "num_input_tokens_seen": 354706, "step": 1119, "train_runtime": 2981.8373, "train_tokens_per_second": 118.956 }, { "epoch": 0.05149425287356322, "grad_norm": 7.9071269035339355, "learning_rate": 8.832080200501254e-06, "loss": 0.5065313577651978, "num_input_tokens_seen": 355032, "step": 1120, "train_runtime": 2983.8669, "train_tokens_per_second": 118.984 }, { "epoch": 0.05154022988505747, "grad_norm": 9.05221176147461, "learning_rate": 8.822055137844612e-06, "loss": 0.4188013970851898, "num_input_tokens_seen": 355404, "step": 1121, "train_runtime": 2985.9206, "train_tokens_per_second": 119.027 }, { "epoch": 0.051586206896551724, "grad_norm": 7.693556308746338, "learning_rate": 8.81203007518797e-06, "loss": 0.4153413474559784, "num_input_tokens_seen": 355678, "step": 1122, "train_runtime": 2987.9234, "train_tokens_per_second": 119.039 }, { "epoch": 0.05163218390804598, "grad_norm": 6.513828754425049, "learning_rate": 8.802005012531329e-06, "loss": 0.5046350955963135, "num_input_tokens_seen": 356220, "step": 1123, "train_runtime": 2989.9668, "train_tokens_per_second": 119.138 }, { "epoch": 0.05167816091954023, "grad_norm": 8.505133628845215, "learning_rate": 8.791979949874688e-06, "loss": 0.5596924424171448, "num_input_tokens_seen": 356826, "step": 1124, "train_runtime": 2992.0902, "train_tokens_per_second": 119.256 }, { "epoch": 0.05172413793103448, "grad_norm": 9.080416679382324, "learning_rate": 8.781954887218046e-06, "loss": 0.4769168794155121, "num_input_tokens_seen": 357114, "step": 1125, "train_runtime": 2994.0474, "train_tokens_per_second": 119.275 }, { "epoch": 0.051770114942528735, "grad_norm": 7.264612197875977, "learning_rate": 8.771929824561405e-06, "loss": 0.3889122009277344, "num_input_tokens_seen": 357362, "step": 1126, "train_runtime": 2995.9843, "train_tokens_per_second": 119.28 }, { "epoch": 0.05181609195402299, "grad_norm": 7.490901470184326, "learning_rate": 8.761904761904763e-06, "loss": 0.42194709181785583, "num_input_tokens_seen": 357730, "step": 1127, "train_runtime": 2997.9807, "train_tokens_per_second": 119.324 }, { "epoch": 0.05186206896551724, "grad_norm": 7.1191205978393555, "learning_rate": 8.751879699248122e-06, "loss": 0.37631088495254517, "num_input_tokens_seen": 358026, "step": 1128, "train_runtime": 2999.9522, "train_tokens_per_second": 119.344 }, { "epoch": 0.05190804597701149, "grad_norm": 7.080322265625, "learning_rate": 8.741854636591478e-06, "loss": 0.36222198605537415, "num_input_tokens_seen": 358358, "step": 1129, "train_runtime": 3001.8958, "train_tokens_per_second": 119.377 }, { "epoch": 0.051954022988505745, "grad_norm": 7.011504173278809, "learning_rate": 8.731829573934839e-06, "loss": 0.445604145526886, "num_input_tokens_seen": 358802, "step": 1130, "train_runtime": 3003.8914, "train_tokens_per_second": 119.446 }, { "epoch": 0.052, "grad_norm": 6.998114585876465, "learning_rate": 8.721804511278195e-06, "loss": 0.34580928087234497, "num_input_tokens_seen": 359086, "step": 1131, "train_runtime": 3005.8366, "train_tokens_per_second": 119.463 }, { "epoch": 0.05204597701149425, "grad_norm": 6.779391765594482, "learning_rate": 8.711779448621554e-06, "loss": 0.3365050256252289, "num_input_tokens_seen": 359336, "step": 1132, "train_runtime": 3007.7775, "train_tokens_per_second": 119.469 }, { "epoch": 0.0520919540229885, "grad_norm": 7.664047718048096, "learning_rate": 8.701754385964914e-06, "loss": 0.4866427779197693, "num_input_tokens_seen": 359644, "step": 1133, "train_runtime": 3009.7348, "train_tokens_per_second": 119.494 }, { "epoch": 0.052137931034482755, "grad_norm": 6.811913967132568, "learning_rate": 8.69172932330827e-06, "loss": 0.46658676862716675, "num_input_tokens_seen": 359962, "step": 1134, "train_runtime": 3011.6919, "train_tokens_per_second": 119.522 }, { "epoch": 0.052183908045977015, "grad_norm": 6.3152360916137695, "learning_rate": 8.68170426065163e-06, "loss": 0.4892335832118988, "num_input_tokens_seen": 360424, "step": 1135, "train_runtime": 3013.6881, "train_tokens_per_second": 119.596 }, { "epoch": 0.05222988505747127, "grad_norm": 7.800539016723633, "learning_rate": 8.671679197994988e-06, "loss": 0.426530659198761, "num_input_tokens_seen": 360686, "step": 1136, "train_runtime": 3015.6362, "train_tokens_per_second": 119.605 }, { "epoch": 0.05227586206896552, "grad_norm": 9.333327293395996, "learning_rate": 8.661654135338346e-06, "loss": 0.5790461301803589, "num_input_tokens_seen": 361040, "step": 1137, "train_runtime": 3017.5823, "train_tokens_per_second": 119.645 }, { "epoch": 0.05232183908045977, "grad_norm": 8.419378280639648, "learning_rate": 8.651629072681705e-06, "loss": 0.3921374976634979, "num_input_tokens_seen": 361310, "step": 1138, "train_runtime": 3019.53, "train_tokens_per_second": 119.658 }, { "epoch": 0.052367816091954025, "grad_norm": 7.641000747680664, "learning_rate": 8.641604010025063e-06, "loss": 0.32036256790161133, "num_input_tokens_seen": 361546, "step": 1139, "train_runtime": 3021.4694, "train_tokens_per_second": 119.659 }, { "epoch": 0.05241379310344828, "grad_norm": 8.194195747375488, "learning_rate": 8.631578947368422e-06, "loss": 0.3756909966468811, "num_input_tokens_seen": 361798, "step": 1140, "train_runtime": 3023.4163, "train_tokens_per_second": 119.665 }, { "epoch": 0.05245977011494253, "grad_norm": 9.875768661499023, "learning_rate": 8.62155388471178e-06, "loss": 0.4790947437286377, "num_input_tokens_seen": 362022, "step": 1141, "train_runtime": 3038.7437, "train_tokens_per_second": 119.135 }, { "epoch": 0.05250574712643678, "grad_norm": 8.130186080932617, "learning_rate": 8.611528822055139e-06, "loss": 0.3870607614517212, "num_input_tokens_seen": 362326, "step": 1142, "train_runtime": 3040.6917, "train_tokens_per_second": 119.159 }, { "epoch": 0.052551724137931036, "grad_norm": 6.7159013748168945, "learning_rate": 8.601503759398497e-06, "loss": 0.3064056634902954, "num_input_tokens_seen": 362580, "step": 1143, "train_runtime": 3042.6334, "train_tokens_per_second": 119.167 }, { "epoch": 0.05259770114942529, "grad_norm": 9.547625541687012, "learning_rate": 8.591478696741856e-06, "loss": 0.5110470652580261, "num_input_tokens_seen": 362902, "step": 1144, "train_runtime": 3044.58, "train_tokens_per_second": 119.196 }, { "epoch": 0.05264367816091954, "grad_norm": 7.9411468505859375, "learning_rate": 8.581453634085214e-06, "loss": 0.37716397643089294, "num_input_tokens_seen": 363178, "step": 1145, "train_runtime": 3046.5253, "train_tokens_per_second": 119.211 }, { "epoch": 0.052689655172413793, "grad_norm": 7.182112693786621, "learning_rate": 8.571428571428571e-06, "loss": 0.5067034363746643, "num_input_tokens_seen": 363608, "step": 1146, "train_runtime": 3048.5144, "train_tokens_per_second": 119.274 }, { "epoch": 0.052735632183908046, "grad_norm": 7.81766414642334, "learning_rate": 8.561403508771931e-06, "loss": 0.515543520450592, "num_input_tokens_seen": 363984, "step": 1147, "train_runtime": 3050.4733, "train_tokens_per_second": 119.321 }, { "epoch": 0.0527816091954023, "grad_norm": 6.620061874389648, "learning_rate": 8.55137844611529e-06, "loss": 0.3774106204509735, "num_input_tokens_seen": 364260, "step": 1148, "train_runtime": 3052.436, "train_tokens_per_second": 119.334 }, { "epoch": 0.05282758620689655, "grad_norm": 8.190850257873535, "learning_rate": 8.541353383458646e-06, "loss": 0.404315710067749, "num_input_tokens_seen": 364486, "step": 1149, "train_runtime": 3054.3736, "train_tokens_per_second": 119.332 }, { "epoch": 0.052873563218390804, "grad_norm": 6.6342010498046875, "learning_rate": 8.531328320802007e-06, "loss": 0.3467126786708832, "num_input_tokens_seen": 364750, "step": 1150, "train_runtime": 3056.3456, "train_tokens_per_second": 119.342 }, { "epoch": 0.052919540229885056, "grad_norm": 6.534978866577148, "learning_rate": 8.521303258145363e-06, "loss": 0.4126523733139038, "num_input_tokens_seen": 365032, "step": 1151, "train_runtime": 3058.4116, "train_tokens_per_second": 119.353 }, { "epoch": 0.05296551724137931, "grad_norm": 10.278910636901855, "learning_rate": 8.511278195488722e-06, "loss": 0.5738921761512756, "num_input_tokens_seen": 365358, "step": 1152, "train_runtime": 3060.487, "train_tokens_per_second": 119.379 }, { "epoch": 0.05301149425287356, "grad_norm": 7.18212366104126, "learning_rate": 8.501253132832082e-06, "loss": 0.4024466276168823, "num_input_tokens_seen": 365600, "step": 1153, "train_runtime": 3062.4906, "train_tokens_per_second": 119.38 }, { "epoch": 0.053057471264367814, "grad_norm": 8.520891189575195, "learning_rate": 8.491228070175439e-06, "loss": 0.6133989095687866, "num_input_tokens_seen": 366018, "step": 1154, "train_runtime": 3064.5452, "train_tokens_per_second": 119.436 }, { "epoch": 0.05310344827586207, "grad_norm": 7.127443313598633, "learning_rate": 8.481203007518797e-06, "loss": 0.36948350071907043, "num_input_tokens_seen": 366268, "step": 1155, "train_runtime": 3066.6832, "train_tokens_per_second": 119.435 }, { "epoch": 0.05314942528735632, "grad_norm": 6.519278049468994, "learning_rate": 8.471177944862156e-06, "loss": 0.33019205927848816, "num_input_tokens_seen": 366556, "step": 1156, "train_runtime": 3068.7022, "train_tokens_per_second": 119.45 }, { "epoch": 0.05319540229885057, "grad_norm": 7.162330150604248, "learning_rate": 8.461152882205514e-06, "loss": 0.485843300819397, "num_input_tokens_seen": 367108, "step": 1157, "train_runtime": 3070.7748, "train_tokens_per_second": 119.549 }, { "epoch": 0.053241379310344825, "grad_norm": 8.591348648071289, "learning_rate": 8.451127819548873e-06, "loss": 0.44043344259262085, "num_input_tokens_seen": 367422, "step": 1158, "train_runtime": 3072.7318, "train_tokens_per_second": 119.575 }, { "epoch": 0.05328735632183908, "grad_norm": 7.478002071380615, "learning_rate": 8.441102756892231e-06, "loss": 0.49568963050842285, "num_input_tokens_seen": 367746, "step": 1159, "train_runtime": 3074.6878, "train_tokens_per_second": 119.604 }, { "epoch": 0.05333333333333334, "grad_norm": 9.927587509155273, "learning_rate": 8.43107769423559e-06, "loss": 0.6322132349014282, "num_input_tokens_seen": 368220, "step": 1160, "train_runtime": 3076.6903, "train_tokens_per_second": 119.681 }, { "epoch": 0.05337931034482759, "grad_norm": 8.052186012268066, "learning_rate": 8.421052631578948e-06, "loss": 0.48395630717277527, "num_input_tokens_seen": 368488, "step": 1161, "train_runtime": 3078.6659, "train_tokens_per_second": 119.691 }, { "epoch": 0.05342528735632184, "grad_norm": 8.77470874786377, "learning_rate": 8.411027568922307e-06, "loss": 0.43330156803131104, "num_input_tokens_seen": 368712, "step": 1162, "train_runtime": 3080.7208, "train_tokens_per_second": 119.684 }, { "epoch": 0.053471264367816095, "grad_norm": 8.309282302856445, "learning_rate": 8.401002506265665e-06, "loss": 0.4578382074832916, "num_input_tokens_seen": 369070, "step": 1163, "train_runtime": 3082.8172, "train_tokens_per_second": 119.718 }, { "epoch": 0.05351724137931035, "grad_norm": 7.133829593658447, "learning_rate": 8.390977443609024e-06, "loss": 0.39338231086730957, "num_input_tokens_seen": 369306, "step": 1164, "train_runtime": 3084.7634, "train_tokens_per_second": 119.719 }, { "epoch": 0.0535632183908046, "grad_norm": 7.313564300537109, "learning_rate": 8.380952380952382e-06, "loss": 0.3970176577568054, "num_input_tokens_seen": 369636, "step": 1165, "train_runtime": 3086.7139, "train_tokens_per_second": 119.751 }, { "epoch": 0.05360919540229885, "grad_norm": 8.829938888549805, "learning_rate": 8.370927318295739e-06, "loss": 0.7930089831352234, "num_input_tokens_seen": 370028, "step": 1166, "train_runtime": 3088.7001, "train_tokens_per_second": 119.801 }, { "epoch": 0.053655172413793105, "grad_norm": 7.2194061279296875, "learning_rate": 8.3609022556391e-06, "loss": 0.4449452757835388, "num_input_tokens_seen": 370412, "step": 1167, "train_runtime": 3090.8028, "train_tokens_per_second": 119.843 }, { "epoch": 0.05370114942528736, "grad_norm": 8.99480152130127, "learning_rate": 8.350877192982458e-06, "loss": 0.32509714365005493, "num_input_tokens_seen": 370656, "step": 1168, "train_runtime": 3092.8992, "train_tokens_per_second": 119.841 }, { "epoch": 0.05374712643678161, "grad_norm": 7.847662448883057, "learning_rate": 8.340852130325814e-06, "loss": 0.5404742956161499, "num_input_tokens_seen": 370992, "step": 1169, "train_runtime": 3094.8838, "train_tokens_per_second": 119.873 }, { "epoch": 0.05379310344827586, "grad_norm": 7.609344005584717, "learning_rate": 8.330827067669175e-06, "loss": 0.48472529649734497, "num_input_tokens_seen": 371248, "step": 1170, "train_runtime": 3096.8275, "train_tokens_per_second": 119.88 }, { "epoch": 0.053839080459770115, "grad_norm": 7.672946453094482, "learning_rate": 8.320802005012531e-06, "loss": 0.5179246664047241, "num_input_tokens_seen": 371696, "step": 1171, "train_runtime": 3110.6778, "train_tokens_per_second": 119.49 }, { "epoch": 0.05388505747126437, "grad_norm": 7.6113128662109375, "learning_rate": 8.31077694235589e-06, "loss": 0.5013529062271118, "num_input_tokens_seen": 371990, "step": 1172, "train_runtime": 3112.6332, "train_tokens_per_second": 119.51 }, { "epoch": 0.05393103448275862, "grad_norm": 7.152410984039307, "learning_rate": 8.300751879699248e-06, "loss": 0.4111625552177429, "num_input_tokens_seen": 372308, "step": 1173, "train_runtime": 3114.6851, "train_tokens_per_second": 119.533 }, { "epoch": 0.05397701149425287, "grad_norm": 6.6777825355529785, "learning_rate": 8.290726817042607e-06, "loss": 0.3815338611602783, "num_input_tokens_seen": 372556, "step": 1174, "train_runtime": 3116.7387, "train_tokens_per_second": 119.534 }, { "epoch": 0.054022988505747126, "grad_norm": 6.369187831878662, "learning_rate": 8.280701754385965e-06, "loss": 0.3696746528148651, "num_input_tokens_seen": 372790, "step": 1175, "train_runtime": 3118.7573, "train_tokens_per_second": 119.532 }, { "epoch": 0.05406896551724138, "grad_norm": 8.142765998840332, "learning_rate": 8.270676691729324e-06, "loss": 0.5129543542861938, "num_input_tokens_seen": 373122, "step": 1176, "train_runtime": 3120.7294, "train_tokens_per_second": 119.562 }, { "epoch": 0.05411494252873563, "grad_norm": 7.096915245056152, "learning_rate": 8.260651629072682e-06, "loss": 0.419854074716568, "num_input_tokens_seen": 373386, "step": 1177, "train_runtime": 3122.699, "train_tokens_per_second": 119.572 }, { "epoch": 0.054160919540229883, "grad_norm": 7.837054252624512, "learning_rate": 8.25062656641604e-06, "loss": 0.4381014406681061, "num_input_tokens_seen": 373642, "step": 1178, "train_runtime": 3124.6539, "train_tokens_per_second": 119.579 }, { "epoch": 0.054206896551724136, "grad_norm": 8.150774002075195, "learning_rate": 8.2406015037594e-06, "loss": 0.4414655864238739, "num_input_tokens_seen": 373980, "step": 1179, "train_runtime": 3126.6275, "train_tokens_per_second": 119.611 }, { "epoch": 0.05425287356321839, "grad_norm": 7.266263484954834, "learning_rate": 8.230576441102758e-06, "loss": 0.3821980059146881, "num_input_tokens_seen": 374272, "step": 1180, "train_runtime": 3128.5834, "train_tokens_per_second": 119.63 }, { "epoch": 0.05429885057471264, "grad_norm": 9.496729850769043, "learning_rate": 8.220551378446116e-06, "loss": 0.52981036901474, "num_input_tokens_seen": 374554, "step": 1181, "train_runtime": 3130.5408, "train_tokens_per_second": 119.645 }, { "epoch": 0.054344827586206894, "grad_norm": 7.736052989959717, "learning_rate": 8.210526315789475e-06, "loss": 0.5340881943702698, "num_input_tokens_seen": 374940, "step": 1182, "train_runtime": 3132.5336, "train_tokens_per_second": 119.692 }, { "epoch": 0.054390804597701146, "grad_norm": 6.161796569824219, "learning_rate": 8.200501253132833e-06, "loss": 0.39382392168045044, "num_input_tokens_seen": 375326, "step": 1183, "train_runtime": 3134.5148, "train_tokens_per_second": 119.74 }, { "epoch": 0.0544367816091954, "grad_norm": 7.190888404846191, "learning_rate": 8.190476190476192e-06, "loss": 0.3610159456729889, "num_input_tokens_seen": 375574, "step": 1184, "train_runtime": 3136.4564, "train_tokens_per_second": 119.745 }, { "epoch": 0.05448275862068966, "grad_norm": 7.161884784698486, "learning_rate": 8.18045112781955e-06, "loss": 0.48947563767433167, "num_input_tokens_seen": 375918, "step": 1185, "train_runtime": 3138.4192, "train_tokens_per_second": 119.779 }, { "epoch": 0.05452873563218391, "grad_norm": 7.510371685028076, "learning_rate": 8.170426065162907e-06, "loss": 0.4124743342399597, "num_input_tokens_seen": 376164, "step": 1186, "train_runtime": 3140.3846, "train_tokens_per_second": 119.783 }, { "epoch": 0.054574712643678164, "grad_norm": 6.725326061248779, "learning_rate": 8.160401002506266e-06, "loss": 0.36423835158348083, "num_input_tokens_seen": 376406, "step": 1187, "train_runtime": 3142.3379, "train_tokens_per_second": 119.785 }, { "epoch": 0.054620689655172416, "grad_norm": 6.782083034515381, "learning_rate": 8.150375939849626e-06, "loss": 0.36468422412872314, "num_input_tokens_seen": 376692, "step": 1188, "train_runtime": 3144.3041, "train_tokens_per_second": 119.801 }, { "epoch": 0.05466666666666667, "grad_norm": 7.643582344055176, "learning_rate": 8.140350877192983e-06, "loss": 0.4475553631782532, "num_input_tokens_seen": 377160, "step": 1189, "train_runtime": 3146.3364, "train_tokens_per_second": 119.873 }, { "epoch": 0.05471264367816092, "grad_norm": 8.300542831420898, "learning_rate": 8.130325814536341e-06, "loss": 0.4346177577972412, "num_input_tokens_seen": 377426, "step": 1190, "train_runtime": 3148.2823, "train_tokens_per_second": 119.883 }, { "epoch": 0.054758620689655174, "grad_norm": 14.15939998626709, "learning_rate": 8.1203007518797e-06, "loss": 0.47130388021469116, "num_input_tokens_seen": 377728, "step": 1191, "train_runtime": 3150.2485, "train_tokens_per_second": 119.904 }, { "epoch": 0.05480459770114943, "grad_norm": 8.699316024780273, "learning_rate": 8.110275689223058e-06, "loss": 0.5361881256103516, "num_input_tokens_seen": 378066, "step": 1192, "train_runtime": 3152.2371, "train_tokens_per_second": 119.936 }, { "epoch": 0.05485057471264368, "grad_norm": 6.897034645080566, "learning_rate": 8.100250626566416e-06, "loss": 0.3854222595691681, "num_input_tokens_seen": 378412, "step": 1193, "train_runtime": 3154.2237, "train_tokens_per_second": 119.97 }, { "epoch": 0.05489655172413793, "grad_norm": 7.7607269287109375, "learning_rate": 8.090225563909775e-06, "loss": 0.3880585730075836, "num_input_tokens_seen": 378658, "step": 1194, "train_runtime": 3156.2065, "train_tokens_per_second": 119.973 }, { "epoch": 0.054942528735632185, "grad_norm": 6.789251327514648, "learning_rate": 8.080200501253133e-06, "loss": 0.3877938389778137, "num_input_tokens_seen": 378950, "step": 1195, "train_runtime": 3158.2332, "train_tokens_per_second": 119.988 }, { "epoch": 0.05498850574712644, "grad_norm": 7.403102397918701, "learning_rate": 8.070175438596492e-06, "loss": 0.507320761680603, "num_input_tokens_seen": 379220, "step": 1196, "train_runtime": 3160.2494, "train_tokens_per_second": 119.997 }, { "epoch": 0.05503448275862069, "grad_norm": 7.399575233459473, "learning_rate": 8.06015037593985e-06, "loss": 0.6930140852928162, "num_input_tokens_seen": 379848, "step": 1197, "train_runtime": 3162.448, "train_tokens_per_second": 120.112 }, { "epoch": 0.05508045977011494, "grad_norm": 6.599159240722656, "learning_rate": 8.050125313283209e-06, "loss": 0.46932291984558105, "num_input_tokens_seen": 380290, "step": 1198, "train_runtime": 3164.518, "train_tokens_per_second": 120.173 }, { "epoch": 0.055126436781609195, "grad_norm": 7.153855323791504, "learning_rate": 8.040100250626567e-06, "loss": 0.2693643569946289, "num_input_tokens_seen": 380506, "step": 1199, "train_runtime": 3166.4775, "train_tokens_per_second": 120.167 }, { "epoch": 0.05517241379310345, "grad_norm": 7.928609371185303, "learning_rate": 8.030075187969926e-06, "loss": 0.4285462498664856, "num_input_tokens_seen": 380884, "step": 1200, "train_runtime": 3168.5553, "train_tokens_per_second": 120.207 }, { "epoch": 0.05517241379310345, "eval_loss": 1.692144513130188, "eval_runtime": 54.5988, "eval_samples_per_second": 18.315, "eval_steps_per_second": 9.158, "num_input_tokens_seen": 380884, "step": 1200 }, { "epoch": 0.0552183908045977, "grad_norm": 7.031571388244629, "learning_rate": 8.020050125313283e-06, "loss": 0.3508245646953583, "num_input_tokens_seen": 381152, "step": 1201, "train_runtime": 3238.3257, "train_tokens_per_second": 117.7 }, { "epoch": 0.05526436781609195, "grad_norm": 7.969499111175537, "learning_rate": 8.010025062656643e-06, "loss": 0.5498538017272949, "num_input_tokens_seen": 381434, "step": 1202, "train_runtime": 3240.2813, "train_tokens_per_second": 117.716 }, { "epoch": 0.055310344827586205, "grad_norm": 8.85057258605957, "learning_rate": 8.000000000000001e-06, "loss": 0.5166440606117249, "num_input_tokens_seen": 381748, "step": 1203, "train_runtime": 3242.284, "train_tokens_per_second": 117.74 }, { "epoch": 0.05535632183908046, "grad_norm": 6.515604019165039, "learning_rate": 7.989974937343358e-06, "loss": 0.38619551062583923, "num_input_tokens_seen": 382004, "step": 1204, "train_runtime": 3244.2439, "train_tokens_per_second": 117.748 }, { "epoch": 0.05540229885057471, "grad_norm": 8.197484970092773, "learning_rate": 7.979949874686718e-06, "loss": 0.5534597039222717, "num_input_tokens_seen": 382364, "step": 1205, "train_runtime": 3246.2164, "train_tokens_per_second": 117.788 }, { "epoch": 0.05544827586206896, "grad_norm": 6.80437707901001, "learning_rate": 7.969924812030075e-06, "loss": 0.5063154697418213, "num_input_tokens_seen": 382746, "step": 1206, "train_runtime": 3248.2386, "train_tokens_per_second": 117.832 }, { "epoch": 0.055494252873563216, "grad_norm": 7.77208137512207, "learning_rate": 7.959899749373434e-06, "loss": 0.4124975800514221, "num_input_tokens_seen": 383006, "step": 1207, "train_runtime": 3250.3198, "train_tokens_per_second": 117.836 }, { "epoch": 0.05554022988505747, "grad_norm": 5.83624267578125, "learning_rate": 7.949874686716794e-06, "loss": 0.2796672582626343, "num_input_tokens_seen": 383234, "step": 1208, "train_runtime": 3252.3877, "train_tokens_per_second": 117.832 }, { "epoch": 0.05558620689655172, "grad_norm": 7.766402244567871, "learning_rate": 7.93984962406015e-06, "loss": 0.46150755882263184, "num_input_tokens_seen": 383550, "step": 1209, "train_runtime": 3254.4166, "train_tokens_per_second": 117.855 }, { "epoch": 0.05563218390804598, "grad_norm": 6.165184497833252, "learning_rate": 7.929824561403509e-06, "loss": 0.3527635335922241, "num_input_tokens_seen": 383886, "step": 1210, "train_runtime": 3256.5657, "train_tokens_per_second": 117.881 }, { "epoch": 0.05567816091954023, "grad_norm": 6.623737335205078, "learning_rate": 7.919799498746868e-06, "loss": 0.30056440830230713, "num_input_tokens_seen": 384140, "step": 1211, "train_runtime": 3258.5339, "train_tokens_per_second": 117.887 }, { "epoch": 0.055724137931034486, "grad_norm": 7.612054347991943, "learning_rate": 7.909774436090226e-06, "loss": 0.44327080249786377, "num_input_tokens_seen": 384442, "step": 1212, "train_runtime": 3260.504, "train_tokens_per_second": 117.909 }, { "epoch": 0.05577011494252874, "grad_norm": 8.566631317138672, "learning_rate": 7.899749373433585e-06, "loss": 0.49499887228012085, "num_input_tokens_seen": 384758, "step": 1213, "train_runtime": 3262.5097, "train_tokens_per_second": 117.933 }, { "epoch": 0.05581609195402299, "grad_norm": 9.735397338867188, "learning_rate": 7.889724310776943e-06, "loss": 0.47953516244888306, "num_input_tokens_seen": 385036, "step": 1214, "train_runtime": 3264.6896, "train_tokens_per_second": 117.94 }, { "epoch": 0.05586206896551724, "grad_norm": 13.594995498657227, "learning_rate": 7.879699248120301e-06, "loss": 0.36916059255599976, "num_input_tokens_seen": 385294, "step": 1215, "train_runtime": 3266.7717, "train_tokens_per_second": 117.943 }, { "epoch": 0.055908045977011496, "grad_norm": 7.692044258117676, "learning_rate": 7.86967418546366e-06, "loss": 0.49710947275161743, "num_input_tokens_seen": 385606, "step": 1216, "train_runtime": 3268.7645, "train_tokens_per_second": 117.967 }, { "epoch": 0.05595402298850575, "grad_norm": 7.8550615310668945, "learning_rate": 7.859649122807018e-06, "loss": 0.420956015586853, "num_input_tokens_seen": 385916, "step": 1217, "train_runtime": 3270.8602, "train_tokens_per_second": 117.986 }, { "epoch": 0.056, "grad_norm": 6.607285499572754, "learning_rate": 7.849624060150377e-06, "loss": 0.35990452766418457, "num_input_tokens_seen": 386266, "step": 1218, "train_runtime": 3272.8397, "train_tokens_per_second": 118.022 }, { "epoch": 0.056045977011494254, "grad_norm": 8.219738960266113, "learning_rate": 7.839598997493735e-06, "loss": 0.4552280306816101, "num_input_tokens_seen": 386618, "step": 1219, "train_runtime": 3274.8135, "train_tokens_per_second": 118.058 }, { "epoch": 0.056091954022988506, "grad_norm": 9.075862884521484, "learning_rate": 7.829573934837094e-06, "loss": 0.38085708022117615, "num_input_tokens_seen": 386878, "step": 1220, "train_runtime": 3276.779, "train_tokens_per_second": 118.067 }, { "epoch": 0.05613793103448276, "grad_norm": 7.036026954650879, "learning_rate": 7.81954887218045e-06, "loss": 0.44221633672714233, "num_input_tokens_seen": 387248, "step": 1221, "train_runtime": 3278.7603, "train_tokens_per_second": 118.108 }, { "epoch": 0.05618390804597701, "grad_norm": 7.284511089324951, "learning_rate": 7.809523809523811e-06, "loss": 0.47441187500953674, "num_input_tokens_seen": 387486, "step": 1222, "train_runtime": 3280.7017, "train_tokens_per_second": 118.111 }, { "epoch": 0.056229885057471264, "grad_norm": 7.1411824226379395, "learning_rate": 7.79949874686717e-06, "loss": 0.3490273356437683, "num_input_tokens_seen": 387746, "step": 1223, "train_runtime": 3282.6805, "train_tokens_per_second": 118.119 }, { "epoch": 0.05627586206896552, "grad_norm": 8.54399585723877, "learning_rate": 7.789473684210526e-06, "loss": 0.4305766522884369, "num_input_tokens_seen": 387976, "step": 1224, "train_runtime": 3284.6258, "train_tokens_per_second": 118.119 }, { "epoch": 0.05632183908045977, "grad_norm": 7.717691898345947, "learning_rate": 7.779448621553886e-06, "loss": 0.45238345861434937, "num_input_tokens_seen": 388232, "step": 1225, "train_runtime": 3286.5665, "train_tokens_per_second": 118.127 }, { "epoch": 0.05636781609195402, "grad_norm": 7.620163917541504, "learning_rate": 7.769423558897243e-06, "loss": 0.5245876908302307, "num_input_tokens_seen": 388628, "step": 1226, "train_runtime": 3288.5618, "train_tokens_per_second": 118.176 }, { "epoch": 0.056413793103448275, "grad_norm": 7.724833965301514, "learning_rate": 7.759398496240602e-06, "loss": 0.3621765673160553, "num_input_tokens_seen": 388890, "step": 1227, "train_runtime": 3290.5009, "train_tokens_per_second": 118.186 }, { "epoch": 0.05645977011494253, "grad_norm": 7.4883222579956055, "learning_rate": 7.749373433583962e-06, "loss": 0.5157286524772644, "num_input_tokens_seen": 389214, "step": 1228, "train_runtime": 3292.6802, "train_tokens_per_second": 118.206 }, { "epoch": 0.05650574712643678, "grad_norm": 7.155076026916504, "learning_rate": 7.739348370927319e-06, "loss": 0.4434982240200043, "num_input_tokens_seen": 389698, "step": 1229, "train_runtime": 3294.7445, "train_tokens_per_second": 118.279 }, { "epoch": 0.05655172413793103, "grad_norm": 8.831174850463867, "learning_rate": 7.729323308270677e-06, "loss": 0.39858779311180115, "num_input_tokens_seen": 389950, "step": 1230, "train_runtime": 3296.6909, "train_tokens_per_second": 118.285 }, { "epoch": 0.056597701149425285, "grad_norm": 9.107735633850098, "learning_rate": 7.719298245614036e-06, "loss": 0.4810582399368286, "num_input_tokens_seen": 390264, "step": 1231, "train_runtime": 3311.3898, "train_tokens_per_second": 117.855 }, { "epoch": 0.05664367816091954, "grad_norm": 7.23051643371582, "learning_rate": 7.709273182957394e-06, "loss": 0.3264503479003906, "num_input_tokens_seen": 390496, "step": 1232, "train_runtime": 3313.3228, "train_tokens_per_second": 117.856 }, { "epoch": 0.05668965517241379, "grad_norm": 7.617827892303467, "learning_rate": 7.699248120300753e-06, "loss": 0.3266094923019409, "num_input_tokens_seen": 390736, "step": 1233, "train_runtime": 3315.2535, "train_tokens_per_second": 117.86 }, { "epoch": 0.05673563218390804, "grad_norm": 6.893436431884766, "learning_rate": 7.689223057644111e-06, "loss": 0.3524739742279053, "num_input_tokens_seen": 391048, "step": 1234, "train_runtime": 3317.2784, "train_tokens_per_second": 117.882 }, { "epoch": 0.0567816091954023, "grad_norm": 8.767608642578125, "learning_rate": 7.67919799498747e-06, "loss": 0.6118502616882324, "num_input_tokens_seen": 391298, "step": 1235, "train_runtime": 3319.352, "train_tokens_per_second": 117.884 }, { "epoch": 0.056827586206896555, "grad_norm": 6.283548355102539, "learning_rate": 7.669172932330828e-06, "loss": 0.2690774202346802, "num_input_tokens_seen": 391556, "step": 1236, "train_runtime": 3321.4105, "train_tokens_per_second": 117.888 }, { "epoch": 0.05687356321839081, "grad_norm": 6.369739532470703, "learning_rate": 7.659147869674187e-06, "loss": 0.4399859309196472, "num_input_tokens_seen": 391930, "step": 1237, "train_runtime": 3323.3931, "train_tokens_per_second": 117.931 }, { "epoch": 0.05691954022988506, "grad_norm": 8.632977485656738, "learning_rate": 7.649122807017545e-06, "loss": 0.4601448178291321, "num_input_tokens_seen": 392238, "step": 1238, "train_runtime": 3325.3327, "train_tokens_per_second": 117.955 }, { "epoch": 0.05696551724137931, "grad_norm": 7.602078914642334, "learning_rate": 7.639097744360904e-06, "loss": 0.3859010934829712, "num_input_tokens_seen": 392522, "step": 1239, "train_runtime": 3327.2671, "train_tokens_per_second": 117.971 }, { "epoch": 0.057011494252873565, "grad_norm": 7.507519245147705, "learning_rate": 7.629072681704261e-06, "loss": 0.3987613916397095, "num_input_tokens_seen": 392774, "step": 1240, "train_runtime": 3329.2005, "train_tokens_per_second": 117.978 }, { "epoch": 0.05705747126436782, "grad_norm": 6.93795919418335, "learning_rate": 7.61904761904762e-06, "loss": 0.32270294427871704, "num_input_tokens_seen": 393050, "step": 1241, "train_runtime": 3331.1414, "train_tokens_per_second": 117.993 }, { "epoch": 0.05710344827586207, "grad_norm": 8.514482498168945, "learning_rate": 7.609022556390978e-06, "loss": 0.40500426292419434, "num_input_tokens_seen": 393290, "step": 1242, "train_runtime": 3333.0875, "train_tokens_per_second": 117.996 }, { "epoch": 0.05714942528735632, "grad_norm": 6.902530193328857, "learning_rate": 7.598997493734337e-06, "loss": 0.3956249952316284, "num_input_tokens_seen": 393654, "step": 1243, "train_runtime": 3335.0571, "train_tokens_per_second": 118.035 }, { "epoch": 0.057195402298850576, "grad_norm": 8.342933654785156, "learning_rate": 7.588972431077694e-06, "loss": 0.49615880846977234, "num_input_tokens_seen": 393926, "step": 1244, "train_runtime": 3336.9995, "train_tokens_per_second": 118.048 }, { "epoch": 0.05724137931034483, "grad_norm": 8.174407005310059, "learning_rate": 7.578947368421054e-06, "loss": 0.3771926760673523, "num_input_tokens_seen": 394208, "step": 1245, "train_runtime": 3338.9395, "train_tokens_per_second": 118.064 }, { "epoch": 0.05728735632183908, "grad_norm": 8.724871635437012, "learning_rate": 7.568922305764411e-06, "loss": 0.42995113134384155, "num_input_tokens_seen": 394508, "step": 1246, "train_runtime": 3340.8876, "train_tokens_per_second": 118.085 }, { "epoch": 0.05733333333333333, "grad_norm": 9.025880813598633, "learning_rate": 7.55889724310777e-06, "loss": 0.4564989507198334, "num_input_tokens_seen": 394840, "step": 1247, "train_runtime": 3342.8568, "train_tokens_per_second": 118.115 }, { "epoch": 0.057379310344827586, "grad_norm": 17.948413848876953, "learning_rate": 7.548872180451129e-06, "loss": 0.3961571455001831, "num_input_tokens_seen": 395110, "step": 1248, "train_runtime": 3344.8059, "train_tokens_per_second": 118.126 }, { "epoch": 0.05742528735632184, "grad_norm": 7.265836715698242, "learning_rate": 7.538847117794487e-06, "loss": 0.39476943016052246, "num_input_tokens_seen": 395366, "step": 1249, "train_runtime": 3346.7549, "train_tokens_per_second": 118.134 }, { "epoch": 0.05747126436781609, "grad_norm": 7.201603889465332, "learning_rate": 7.528822055137845e-06, "loss": 0.3717278838157654, "num_input_tokens_seen": 395590, "step": 1250, "train_runtime": 3348.6935, "train_tokens_per_second": 118.133 }, { "epoch": 0.057517241379310344, "grad_norm": 7.79808235168457, "learning_rate": 7.518796992481203e-06, "loss": 0.47616317868232727, "num_input_tokens_seen": 395896, "step": 1251, "train_runtime": 3350.7426, "train_tokens_per_second": 118.152 }, { "epoch": 0.057563218390804596, "grad_norm": 10.870890617370605, "learning_rate": 7.508771929824562e-06, "loss": 0.5085861682891846, "num_input_tokens_seen": 396272, "step": 1252, "train_runtime": 3352.7317, "train_tokens_per_second": 118.194 }, { "epoch": 0.05760919540229885, "grad_norm": 9.563769340515137, "learning_rate": 7.498746867167921e-06, "loss": 0.47975170612335205, "num_input_tokens_seen": 396506, "step": 1253, "train_runtime": 3354.6775, "train_tokens_per_second": 118.195 }, { "epoch": 0.0576551724137931, "grad_norm": 9.062041282653809, "learning_rate": 7.488721804511278e-06, "loss": 0.6291418671607971, "num_input_tokens_seen": 396770, "step": 1254, "train_runtime": 3356.6407, "train_tokens_per_second": 118.204 }, { "epoch": 0.057701149425287354, "grad_norm": 8.90355396270752, "learning_rate": 7.478696741854638e-06, "loss": 0.42996400594711304, "num_input_tokens_seen": 397032, "step": 1255, "train_runtime": 3358.5904, "train_tokens_per_second": 118.214 }, { "epoch": 0.05774712643678161, "grad_norm": 8.653199195861816, "learning_rate": 7.468671679197995e-06, "loss": 0.4824579954147339, "num_input_tokens_seen": 397330, "step": 1256, "train_runtime": 3360.5679, "train_tokens_per_second": 118.233 }, { "epoch": 0.05779310344827586, "grad_norm": 10.245847702026367, "learning_rate": 7.458646616541354e-06, "loss": 0.4312460422515869, "num_input_tokens_seen": 397664, "step": 1257, "train_runtime": 3362.5724, "train_tokens_per_second": 118.262 }, { "epoch": 0.05783908045977011, "grad_norm": 8.25611400604248, "learning_rate": 7.448621553884713e-06, "loss": 0.4436429738998413, "num_input_tokens_seen": 397976, "step": 1258, "train_runtime": 3364.5213, "train_tokens_per_second": 118.286 }, { "epoch": 0.057885057471264365, "grad_norm": 6.373208045959473, "learning_rate": 7.438596491228071e-06, "loss": 0.32305020093917847, "num_input_tokens_seen": 398216, "step": 1259, "train_runtime": 3366.458, "train_tokens_per_second": 118.289 }, { "epoch": 0.057931034482758624, "grad_norm": 8.443294525146484, "learning_rate": 7.428571428571429e-06, "loss": 0.38860228657722473, "num_input_tokens_seen": 398534, "step": 1260, "train_runtime": 3368.456, "train_tokens_per_second": 118.314 }, { "epoch": 0.05797701149425288, "grad_norm": 6.778960227966309, "learning_rate": 7.418546365914787e-06, "loss": 0.33598434925079346, "num_input_tokens_seen": 398812, "step": 1261, "train_runtime": 3384.1842, "train_tokens_per_second": 117.846 }, { "epoch": 0.05802298850574713, "grad_norm": 8.121769905090332, "learning_rate": 7.408521303258146e-06, "loss": 0.3616170883178711, "num_input_tokens_seen": 399044, "step": 1262, "train_runtime": 3386.2081, "train_tokens_per_second": 117.844 }, { "epoch": 0.05806896551724138, "grad_norm": 6.803779602050781, "learning_rate": 7.398496240601505e-06, "loss": 0.3750128149986267, "num_input_tokens_seen": 399300, "step": 1263, "train_runtime": 3388.2191, "train_tokens_per_second": 117.85 }, { "epoch": 0.058114942528735634, "grad_norm": 7.254236698150635, "learning_rate": 7.388471177944862e-06, "loss": 0.380276620388031, "num_input_tokens_seen": 399558, "step": 1264, "train_runtime": 3390.2946, "train_tokens_per_second": 117.853 }, { "epoch": 0.05816091954022989, "grad_norm": 7.822441101074219, "learning_rate": 7.378446115288222e-06, "loss": 0.5770272016525269, "num_input_tokens_seen": 399954, "step": 1265, "train_runtime": 3392.2616, "train_tokens_per_second": 117.902 }, { "epoch": 0.05820689655172414, "grad_norm": 8.614603042602539, "learning_rate": 7.368421052631579e-06, "loss": 0.3941013216972351, "num_input_tokens_seen": 400194, "step": 1266, "train_runtime": 3394.2646, "train_tokens_per_second": 117.903 }, { "epoch": 0.05825287356321839, "grad_norm": 9.3148775100708, "learning_rate": 7.358395989974938e-06, "loss": 0.5557112693786621, "num_input_tokens_seen": 400504, "step": 1267, "train_runtime": 3396.2218, "train_tokens_per_second": 117.926 }, { "epoch": 0.058298850574712645, "grad_norm": 7.287705898284912, "learning_rate": 7.348370927318297e-06, "loss": 0.37800031900405884, "num_input_tokens_seen": 400802, "step": 1268, "train_runtime": 3398.2005, "train_tokens_per_second": 117.945 }, { "epoch": 0.0583448275862069, "grad_norm": 7.846877574920654, "learning_rate": 7.338345864661655e-06, "loss": 0.46503913402557373, "num_input_tokens_seen": 401122, "step": 1269, "train_runtime": 3400.1976, "train_tokens_per_second": 117.97 }, { "epoch": 0.05839080459770115, "grad_norm": 6.571041584014893, "learning_rate": 7.328320802005013e-06, "loss": 0.27229586243629456, "num_input_tokens_seen": 401384, "step": 1270, "train_runtime": 3402.1572, "train_tokens_per_second": 117.979 }, { "epoch": 0.0584367816091954, "grad_norm": 8.546449661254883, "learning_rate": 7.318295739348371e-06, "loss": 0.4096136689186096, "num_input_tokens_seen": 401656, "step": 1271, "train_runtime": 3404.1099, "train_tokens_per_second": 117.991 }, { "epoch": 0.058482758620689655, "grad_norm": 8.082525253295898, "learning_rate": 7.30827067669173e-06, "loss": 0.4620562195777893, "num_input_tokens_seen": 401990, "step": 1272, "train_runtime": 3406.104, "train_tokens_per_second": 118.02 }, { "epoch": 0.05852873563218391, "grad_norm": 7.5269999504089355, "learning_rate": 7.298245614035089e-06, "loss": 0.37954992055892944, "num_input_tokens_seen": 402232, "step": 1273, "train_runtime": 3408.0767, "train_tokens_per_second": 118.023 }, { "epoch": 0.05857471264367816, "grad_norm": 8.238028526306152, "learning_rate": 7.288220551378446e-06, "loss": 0.4700665771961212, "num_input_tokens_seen": 402592, "step": 1274, "train_runtime": 3410.0529, "train_tokens_per_second": 118.06 }, { "epoch": 0.05862068965517241, "grad_norm": 7.085027694702148, "learning_rate": 7.278195488721806e-06, "loss": 0.2926819324493408, "num_input_tokens_seen": 402808, "step": 1275, "train_runtime": 3412.0022, "train_tokens_per_second": 118.056 }, { "epoch": 0.058666666666666666, "grad_norm": 7.41765832901001, "learning_rate": 7.268170426065163e-06, "loss": 0.43641120195388794, "num_input_tokens_seen": 403322, "step": 1276, "train_runtime": 3414.0155, "train_tokens_per_second": 118.137 }, { "epoch": 0.05871264367816092, "grad_norm": 7.371816635131836, "learning_rate": 7.258145363408522e-06, "loss": 0.34357935190200806, "num_input_tokens_seen": 403548, "step": 1277, "train_runtime": 3415.9485, "train_tokens_per_second": 118.136 }, { "epoch": 0.05875862068965517, "grad_norm": 6.794807434082031, "learning_rate": 7.248120300751881e-06, "loss": 0.39415302872657776, "num_input_tokens_seen": 403866, "step": 1278, "train_runtime": 3417.8982, "train_tokens_per_second": 118.162 }, { "epoch": 0.05880459770114942, "grad_norm": 14.13974380493164, "learning_rate": 7.238095238095239e-06, "loss": 0.5558474063873291, "num_input_tokens_seen": 404204, "step": 1279, "train_runtime": 3419.8535, "train_tokens_per_second": 118.193 }, { "epoch": 0.058850574712643676, "grad_norm": 9.345540046691895, "learning_rate": 7.228070175438597e-06, "loss": 0.4721265435218811, "num_input_tokens_seen": 404492, "step": 1280, "train_runtime": 3421.806, "train_tokens_per_second": 118.21 }, { "epoch": 0.05889655172413793, "grad_norm": 7.707251071929932, "learning_rate": 7.218045112781955e-06, "loss": 0.4041139781475067, "num_input_tokens_seen": 404760, "step": 1281, "train_runtime": 3423.7916, "train_tokens_per_second": 118.22 }, { "epoch": 0.05894252873563218, "grad_norm": 7.0474395751953125, "learning_rate": 7.208020050125314e-06, "loss": 0.44104093313217163, "num_input_tokens_seen": 405044, "step": 1282, "train_runtime": 3425.7389, "train_tokens_per_second": 118.236 }, { "epoch": 0.058988505747126434, "grad_norm": 8.901880264282227, "learning_rate": 7.197994987468673e-06, "loss": 0.526037871837616, "num_input_tokens_seen": 405300, "step": 1283, "train_runtime": 3427.6805, "train_tokens_per_second": 118.243 }, { "epoch": 0.059034482758620686, "grad_norm": 7.946100234985352, "learning_rate": 7.18796992481203e-06, "loss": 0.47331130504608154, "num_input_tokens_seen": 405610, "step": 1284, "train_runtime": 3429.6572, "train_tokens_per_second": 118.265 }, { "epoch": 0.059080459770114946, "grad_norm": 7.580421447753906, "learning_rate": 7.17794486215539e-06, "loss": 0.4234299957752228, "num_input_tokens_seen": 405962, "step": 1285, "train_runtime": 3431.6612, "train_tokens_per_second": 118.299 }, { "epoch": 0.0591264367816092, "grad_norm": 7.021231651306152, "learning_rate": 7.167919799498747e-06, "loss": 0.3952452838420868, "num_input_tokens_seen": 406498, "step": 1286, "train_runtime": 3433.7179, "train_tokens_per_second": 118.384 }, { "epoch": 0.05917241379310345, "grad_norm": 7.601665019989014, "learning_rate": 7.157894736842106e-06, "loss": 0.49580442905426025, "num_input_tokens_seen": 406828, "step": 1287, "train_runtime": 3435.7154, "train_tokens_per_second": 118.411 }, { "epoch": 0.059218390804597704, "grad_norm": 6.956839561462402, "learning_rate": 7.147869674185464e-06, "loss": 0.34600839018821716, "num_input_tokens_seen": 407066, "step": 1288, "train_runtime": 3437.6834, "train_tokens_per_second": 118.413 }, { "epoch": 0.059264367816091956, "grad_norm": 7.3096184730529785, "learning_rate": 7.137844611528823e-06, "loss": 0.489816278219223, "num_input_tokens_seen": 407428, "step": 1289, "train_runtime": 3439.6811, "train_tokens_per_second": 118.449 }, { "epoch": 0.05931034482758621, "grad_norm": 6.580732345581055, "learning_rate": 7.127819548872181e-06, "loss": 0.3271704316139221, "num_input_tokens_seen": 407730, "step": 1290, "train_runtime": 3441.6365, "train_tokens_per_second": 118.47 }, { "epoch": 0.05935632183908046, "grad_norm": 7.424761772155762, "learning_rate": 7.117794486215539e-06, "loss": 0.5078544616699219, "num_input_tokens_seen": 408040, "step": 1291, "train_runtime": 3456.7098, "train_tokens_per_second": 118.043 }, { "epoch": 0.059402298850574714, "grad_norm": 6.063399314880371, "learning_rate": 7.107769423558898e-06, "loss": 0.3531324565410614, "num_input_tokens_seen": 408322, "step": 1292, "train_runtime": 3458.8274, "train_tokens_per_second": 118.052 }, { "epoch": 0.05944827586206897, "grad_norm": 5.98874044418335, "learning_rate": 7.097744360902257e-06, "loss": 0.2616596519947052, "num_input_tokens_seen": 408570, "step": 1293, "train_runtime": 3460.8696, "train_tokens_per_second": 118.054 }, { "epoch": 0.05949425287356322, "grad_norm": 8.002218246459961, "learning_rate": 7.087719298245614e-06, "loss": 0.5409700870513916, "num_input_tokens_seen": 408980, "step": 1294, "train_runtime": 3462.8598, "train_tokens_per_second": 118.105 }, { "epoch": 0.05954022988505747, "grad_norm": 8.38762378692627, "learning_rate": 7.077694235588973e-06, "loss": 0.5406583547592163, "num_input_tokens_seen": 409380, "step": 1295, "train_runtime": 3464.8512, "train_tokens_per_second": 118.152 }, { "epoch": 0.059586206896551724, "grad_norm": 6.846781253814697, "learning_rate": 7.067669172932331e-06, "loss": 0.4995633065700531, "num_input_tokens_seen": 409840, "step": 1296, "train_runtime": 3466.8324, "train_tokens_per_second": 118.217 }, { "epoch": 0.05963218390804598, "grad_norm": 7.333960056304932, "learning_rate": 7.05764411027569e-06, "loss": 0.39683273434638977, "num_input_tokens_seen": 410066, "step": 1297, "train_runtime": 3468.7775, "train_tokens_per_second": 118.216 }, { "epoch": 0.05967816091954023, "grad_norm": 8.614952087402344, "learning_rate": 7.047619047619048e-06, "loss": 0.48535892367362976, "num_input_tokens_seen": 410390, "step": 1298, "train_runtime": 3470.7503, "train_tokens_per_second": 118.242 }, { "epoch": 0.05972413793103448, "grad_norm": 7.655506134033203, "learning_rate": 7.037593984962407e-06, "loss": 0.3905705511569977, "num_input_tokens_seen": 410762, "step": 1299, "train_runtime": 3472.7062, "train_tokens_per_second": 118.283 }, { "epoch": 0.059770114942528735, "grad_norm": 6.981317043304443, "learning_rate": 7.027568922305765e-06, "loss": 0.3227069079875946, "num_input_tokens_seen": 411000, "step": 1300, "train_runtime": 3474.6614, "train_tokens_per_second": 118.285 }, { "epoch": 0.05981609195402299, "grad_norm": 7.703155517578125, "learning_rate": 7.017543859649123e-06, "loss": 0.4682047963142395, "num_input_tokens_seen": 411256, "step": 1301, "train_runtime": 3476.606, "train_tokens_per_second": 118.292 }, { "epoch": 0.05986206896551724, "grad_norm": 7.655060768127441, "learning_rate": 7.0075187969924815e-06, "loss": 0.4079965353012085, "num_input_tokens_seen": 411528, "step": 1302, "train_runtime": 3478.5598, "train_tokens_per_second": 118.304 }, { "epoch": 0.05990804597701149, "grad_norm": 10.578437805175781, "learning_rate": 6.997493734335841e-06, "loss": 0.5338407754898071, "num_input_tokens_seen": 411888, "step": 1303, "train_runtime": 3480.5568, "train_tokens_per_second": 118.34 }, { "epoch": 0.059954022988505745, "grad_norm": 9.146214485168457, "learning_rate": 6.9874686716791984e-06, "loss": 0.5038683414459229, "num_input_tokens_seen": 412268, "step": 1304, "train_runtime": 3482.5921, "train_tokens_per_second": 118.38 }, { "epoch": 0.06, "grad_norm": 8.496904373168945, "learning_rate": 6.977443609022557e-06, "loss": 0.5401176810264587, "num_input_tokens_seen": 412628, "step": 1305, "train_runtime": 3484.591, "train_tokens_per_second": 118.415 }, { "epoch": 0.06004597701149425, "grad_norm": 7.559762477874756, "learning_rate": 6.9674185463659146e-06, "loss": 0.6347652673721313, "num_input_tokens_seen": 412996, "step": 1306, "train_runtime": 3486.5571, "train_tokens_per_second": 118.454 }, { "epoch": 0.0600919540229885, "grad_norm": 7.396735191345215, "learning_rate": 6.957393483709274e-06, "loss": 0.483487606048584, "num_input_tokens_seen": 413252, "step": 1307, "train_runtime": 3488.6458, "train_tokens_per_second": 118.456 }, { "epoch": 0.060137931034482756, "grad_norm": 7.182208061218262, "learning_rate": 6.947368421052632e-06, "loss": 0.3920372426509857, "num_input_tokens_seen": 413554, "step": 1308, "train_runtime": 3490.5904, "train_tokens_per_second": 118.477 }, { "epoch": 0.06018390804597701, "grad_norm": 10.241389274597168, "learning_rate": 6.93734335839599e-06, "loss": 0.42586126923561096, "num_input_tokens_seen": 413836, "step": 1309, "train_runtime": 3492.5411, "train_tokens_per_second": 118.491 }, { "epoch": 0.06022988505747127, "grad_norm": 7.382781028747559, "learning_rate": 6.927318295739349e-06, "loss": 0.4327068030834198, "num_input_tokens_seen": 414068, "step": 1310, "train_runtime": 3494.4816, "train_tokens_per_second": 118.492 }, { "epoch": 0.06027586206896552, "grad_norm": 7.766989231109619, "learning_rate": 6.917293233082707e-06, "loss": 0.43942388892173767, "num_input_tokens_seen": 414360, "step": 1311, "train_runtime": 3496.4585, "train_tokens_per_second": 118.508 }, { "epoch": 0.06032183908045977, "grad_norm": 8.081896781921387, "learning_rate": 6.9072681704260655e-06, "loss": 0.5534281134605408, "num_input_tokens_seen": 414716, "step": 1312, "train_runtime": 3498.4216, "train_tokens_per_second": 118.544 }, { "epoch": 0.060367816091954025, "grad_norm": 8.45753002166748, "learning_rate": 6.897243107769425e-06, "loss": 0.4607003331184387, "num_input_tokens_seen": 414934, "step": 1313, "train_runtime": 3500.3525, "train_tokens_per_second": 118.541 }, { "epoch": 0.06041379310344828, "grad_norm": 7.786255836486816, "learning_rate": 6.8872180451127825e-06, "loss": 0.4713561534881592, "num_input_tokens_seen": 415214, "step": 1314, "train_runtime": 3502.3008, "train_tokens_per_second": 118.555 }, { "epoch": 0.06045977011494253, "grad_norm": 7.114749908447266, "learning_rate": 6.877192982456141e-06, "loss": 0.4207516014575958, "num_input_tokens_seen": 415576, "step": 1315, "train_runtime": 3504.2469, "train_tokens_per_second": 118.592 }, { "epoch": 0.06050574712643678, "grad_norm": 6.800426959991455, "learning_rate": 6.867167919799499e-06, "loss": 0.3828384578227997, "num_input_tokens_seen": 415894, "step": 1316, "train_runtime": 3506.1857, "train_tokens_per_second": 118.617 }, { "epoch": 0.060551724137931036, "grad_norm": 5.2941060066223145, "learning_rate": 6.857142857142858e-06, "loss": 0.3798636794090271, "num_input_tokens_seen": 416944, "step": 1317, "train_runtime": 3508.3295, "train_tokens_per_second": 118.844 }, { "epoch": 0.06059770114942529, "grad_norm": 7.210157871246338, "learning_rate": 6.847117794486216e-06, "loss": 0.428189754486084, "num_input_tokens_seen": 417384, "step": 1318, "train_runtime": 3510.3183, "train_tokens_per_second": 118.902 }, { "epoch": 0.06064367816091954, "grad_norm": 7.294408798217773, "learning_rate": 6.837092731829574e-06, "loss": 0.42618033289909363, "num_input_tokens_seen": 417738, "step": 1319, "train_runtime": 3512.2878, "train_tokens_per_second": 118.936 }, { "epoch": 0.060689655172413794, "grad_norm": 7.582489013671875, "learning_rate": 6.827067669172933e-06, "loss": 0.34816285967826843, "num_input_tokens_seen": 417996, "step": 1320, "train_runtime": 3514.2285, "train_tokens_per_second": 118.944 }, { "epoch": 0.060735632183908046, "grad_norm": 6.12922477722168, "learning_rate": 6.817042606516291e-06, "loss": 0.3263629674911499, "num_input_tokens_seen": 418246, "step": 1321, "train_runtime": 3529.3064, "train_tokens_per_second": 118.507 }, { "epoch": 0.0607816091954023, "grad_norm": 10.189580917358398, "learning_rate": 6.8070175438596495e-06, "loss": 0.6183764338493347, "num_input_tokens_seen": 418528, "step": 1322, "train_runtime": 3531.4512, "train_tokens_per_second": 118.514 }, { "epoch": 0.06082758620689655, "grad_norm": 7.070530414581299, "learning_rate": 6.796992481203009e-06, "loss": 0.3519631624221802, "num_input_tokens_seen": 418774, "step": 1323, "train_runtime": 3533.4149, "train_tokens_per_second": 118.518 }, { "epoch": 0.060873563218390804, "grad_norm": 7.724711894989014, "learning_rate": 6.7869674185463665e-06, "loss": 0.4881995618343353, "num_input_tokens_seen": 419070, "step": 1324, "train_runtime": 3535.3752, "train_tokens_per_second": 118.536 }, { "epoch": 0.06091954022988506, "grad_norm": 5.729980945587158, "learning_rate": 6.776942355889725e-06, "loss": 0.29812783002853394, "num_input_tokens_seen": 419334, "step": 1325, "train_runtime": 3537.3324, "train_tokens_per_second": 118.545 }, { "epoch": 0.06096551724137931, "grad_norm": 8.302903175354004, "learning_rate": 6.766917293233083e-06, "loss": 0.48672789335250854, "num_input_tokens_seen": 419648, "step": 1326, "train_runtime": 3539.3059, "train_tokens_per_second": 118.568 }, { "epoch": 0.06101149425287356, "grad_norm": 7.919209003448486, "learning_rate": 6.756892230576442e-06, "loss": 0.6153263449668884, "num_input_tokens_seen": 419968, "step": 1327, "train_runtime": 3541.2637, "train_tokens_per_second": 118.593 }, { "epoch": 0.061057471264367814, "grad_norm": 7.529419422149658, "learning_rate": 6.7468671679198004e-06, "loss": 0.48105958104133606, "num_input_tokens_seen": 420248, "step": 1328, "train_runtime": 3543.2024, "train_tokens_per_second": 118.607 }, { "epoch": 0.06110344827586207, "grad_norm": 7.931469917297363, "learning_rate": 6.736842105263158e-06, "loss": 0.49645185470581055, "num_input_tokens_seen": 420516, "step": 1329, "train_runtime": 3545.1423, "train_tokens_per_second": 118.618 }, { "epoch": 0.06114942528735632, "grad_norm": 7.305312156677246, "learning_rate": 6.726817042606517e-06, "loss": 0.434931218624115, "num_input_tokens_seen": 420802, "step": 1330, "train_runtime": 3547.092, "train_tokens_per_second": 118.633 }, { "epoch": 0.06119540229885057, "grad_norm": 8.194070816040039, "learning_rate": 6.716791979949875e-06, "loss": 0.5417882204055786, "num_input_tokens_seen": 421060, "step": 1331, "train_runtime": 3549.0343, "train_tokens_per_second": 118.641 }, { "epoch": 0.061241379310344825, "grad_norm": 11.66019058227539, "learning_rate": 6.7067669172932335e-06, "loss": 0.35559171438217163, "num_input_tokens_seen": 421304, "step": 1332, "train_runtime": 3550.9941, "train_tokens_per_second": 118.644 }, { "epoch": 0.06128735632183908, "grad_norm": 6.619271755218506, "learning_rate": 6.696741854636593e-06, "loss": 0.40130195021629333, "num_input_tokens_seen": 421586, "step": 1333, "train_runtime": 3552.9545, "train_tokens_per_second": 118.658 }, { "epoch": 0.06133333333333333, "grad_norm": 8.271845817565918, "learning_rate": 6.6867167919799505e-06, "loss": 0.5244696736335754, "num_input_tokens_seen": 421912, "step": 1334, "train_runtime": 3554.9245, "train_tokens_per_second": 118.684 }, { "epoch": 0.06137931034482759, "grad_norm": 8.006850242614746, "learning_rate": 6.676691729323309e-06, "loss": 0.48754143714904785, "num_input_tokens_seen": 422202, "step": 1335, "train_runtime": 3556.8743, "train_tokens_per_second": 118.7 }, { "epoch": 0.06142528735632184, "grad_norm": 5.9052276611328125, "learning_rate": 6.666666666666667e-06, "loss": 0.334730863571167, "num_input_tokens_seen": 422486, "step": 1336, "train_runtime": 3558.8205, "train_tokens_per_second": 118.715 }, { "epoch": 0.061471264367816095, "grad_norm": 7.1550068855285645, "learning_rate": 6.656641604010026e-06, "loss": 0.357038676738739, "num_input_tokens_seen": 422766, "step": 1337, "train_runtime": 3560.7693, "train_tokens_per_second": 118.729 }, { "epoch": 0.06151724137931035, "grad_norm": 7.906791687011719, "learning_rate": 6.6466165413533845e-06, "loss": 0.4327539801597595, "num_input_tokens_seen": 423062, "step": 1338, "train_runtime": 3562.756, "train_tokens_per_second": 118.746 }, { "epoch": 0.0615632183908046, "grad_norm": 8.896774291992188, "learning_rate": 6.636591478696742e-06, "loss": 0.5419115424156189, "num_input_tokens_seen": 423436, "step": 1339, "train_runtime": 3564.7422, "train_tokens_per_second": 118.784 }, { "epoch": 0.06160919540229885, "grad_norm": 8.44174861907959, "learning_rate": 6.6265664160401014e-06, "loss": 0.49105167388916016, "num_input_tokens_seen": 423758, "step": 1340, "train_runtime": 3566.7401, "train_tokens_per_second": 118.808 }, { "epoch": 0.061655172413793105, "grad_norm": 8.32571792602539, "learning_rate": 6.616541353383459e-06, "loss": 0.44149884581565857, "num_input_tokens_seen": 424096, "step": 1341, "train_runtime": 3568.7361, "train_tokens_per_second": 118.836 }, { "epoch": 0.06170114942528736, "grad_norm": 8.409771919250488, "learning_rate": 6.6065162907268176e-06, "loss": 0.3973810076713562, "num_input_tokens_seen": 424368, "step": 1342, "train_runtime": 3570.73, "train_tokens_per_second": 118.846 }, { "epoch": 0.06174712643678161, "grad_norm": 8.931021690368652, "learning_rate": 6.596491228070177e-06, "loss": 0.468519926071167, "num_input_tokens_seen": 424676, "step": 1343, "train_runtime": 3572.7194, "train_tokens_per_second": 118.866 }, { "epoch": 0.06179310344827586, "grad_norm": 7.6605401039123535, "learning_rate": 6.5864661654135345e-06, "loss": 0.5063818693161011, "num_input_tokens_seen": 425054, "step": 1344, "train_runtime": 3574.7079, "train_tokens_per_second": 118.906 }, { "epoch": 0.061839080459770115, "grad_norm": 6.713517665863037, "learning_rate": 6.576441102756893e-06, "loss": 0.500751256942749, "num_input_tokens_seen": 425386, "step": 1345, "train_runtime": 3576.6605, "train_tokens_per_second": 118.934 }, { "epoch": 0.06188505747126437, "grad_norm": 7.185019493103027, "learning_rate": 6.566416040100251e-06, "loss": 0.47278982400894165, "num_input_tokens_seen": 425668, "step": 1346, "train_runtime": 3578.6073, "train_tokens_per_second": 118.948 }, { "epoch": 0.06193103448275862, "grad_norm": 7.3665771484375, "learning_rate": 6.55639097744361e-06, "loss": 0.47877997159957886, "num_input_tokens_seen": 426030, "step": 1347, "train_runtime": 3580.6381, "train_tokens_per_second": 118.982 }, { "epoch": 0.06197701149425287, "grad_norm": 6.61741828918457, "learning_rate": 6.5463659147869685e-06, "loss": 0.4474172294139862, "num_input_tokens_seen": 426364, "step": 1348, "train_runtime": 3582.669, "train_tokens_per_second": 119.007 }, { "epoch": 0.062022988505747126, "grad_norm": 8.149283409118652, "learning_rate": 6.536340852130326e-06, "loss": 0.4722183644771576, "num_input_tokens_seen": 426662, "step": 1349, "train_runtime": 3584.6178, "train_tokens_per_second": 119.026 }, { "epoch": 0.06206896551724138, "grad_norm": 8.140104293823242, "learning_rate": 6.526315789473685e-06, "loss": 0.4514812231063843, "num_input_tokens_seen": 426914, "step": 1350, "train_runtime": 3586.5856, "train_tokens_per_second": 119.031 }, { "epoch": 0.06211494252873563, "grad_norm": 8.069449424743652, "learning_rate": 6.516290726817043e-06, "loss": 0.49403613805770874, "num_input_tokens_seen": 427176, "step": 1351, "train_runtime": 3600.8129, "train_tokens_per_second": 118.633 }, { "epoch": 0.062160919540229884, "grad_norm": 8.522804260253906, "learning_rate": 6.506265664160402e-06, "loss": 0.5751454830169678, "num_input_tokens_seen": 427578, "step": 1352, "train_runtime": 3602.8636, "train_tokens_per_second": 118.677 }, { "epoch": 0.062206896551724136, "grad_norm": 7.504092216491699, "learning_rate": 6.49624060150376e-06, "loss": 0.47312673926353455, "num_input_tokens_seen": 427856, "step": 1353, "train_runtime": 3604.8132, "train_tokens_per_second": 118.69 }, { "epoch": 0.06225287356321839, "grad_norm": 5.708718299865723, "learning_rate": 6.486215538847119e-06, "loss": 0.4190950393676758, "num_input_tokens_seen": 428516, "step": 1354, "train_runtime": 3606.855, "train_tokens_per_second": 118.806 }, { "epoch": 0.06229885057471264, "grad_norm": 8.364093780517578, "learning_rate": 6.476190476190477e-06, "loss": 0.4656526446342468, "num_input_tokens_seen": 428836, "step": 1355, "train_runtime": 3608.8256, "train_tokens_per_second": 118.83 }, { "epoch": 0.062344827586206894, "grad_norm": 7.833532333374023, "learning_rate": 6.466165413533835e-06, "loss": 0.5170052647590637, "num_input_tokens_seen": 429170, "step": 1356, "train_runtime": 3610.8219, "train_tokens_per_second": 118.857 }, { "epoch": 0.06239080459770115, "grad_norm": 7.987048625946045, "learning_rate": 6.456140350877193e-06, "loss": 0.4124986529350281, "num_input_tokens_seen": 429470, "step": 1357, "train_runtime": 3612.8281, "train_tokens_per_second": 118.874 }, { "epoch": 0.0624367816091954, "grad_norm": 6.0981831550598145, "learning_rate": 6.4461152882205525e-06, "loss": 0.300201952457428, "num_input_tokens_seen": 429750, "step": 1358, "train_runtime": 3614.7847, "train_tokens_per_second": 118.887 }, { "epoch": 0.06248275862068965, "grad_norm": 7.8474507331848145, "learning_rate": 6.43609022556391e-06, "loss": 0.31665804982185364, "num_input_tokens_seen": 429990, "step": 1359, "train_runtime": 3616.7413, "train_tokens_per_second": 118.889 }, { "epoch": 0.0625287356321839, "grad_norm": 8.21008586883545, "learning_rate": 6.426065162907269e-06, "loss": 0.5030484795570374, "num_input_tokens_seen": 430508, "step": 1360, "train_runtime": 3618.7621, "train_tokens_per_second": 118.966 }, { "epoch": 0.06257471264367816, "grad_norm": 11.589370727539062, "learning_rate": 6.416040100250627e-06, "loss": 0.4762667119503021, "num_input_tokens_seen": 430838, "step": 1361, "train_runtime": 3620.7453, "train_tokens_per_second": 118.992 }, { "epoch": 0.06262068965517241, "grad_norm": 6.966498851776123, "learning_rate": 6.406015037593986e-06, "loss": 0.3605503737926483, "num_input_tokens_seen": 431164, "step": 1362, "train_runtime": 3622.7009, "train_tokens_per_second": 119.017 }, { "epoch": 0.06266666666666666, "grad_norm": 8.372251510620117, "learning_rate": 6.395989974937344e-06, "loss": 0.5541883111000061, "num_input_tokens_seen": 431522, "step": 1363, "train_runtime": 3624.7763, "train_tokens_per_second": 119.048 }, { "epoch": 0.06271264367816091, "grad_norm": 8.219268798828125, "learning_rate": 6.385964912280702e-06, "loss": 0.4730372130870819, "num_input_tokens_seen": 431852, "step": 1364, "train_runtime": 3626.7527, "train_tokens_per_second": 119.074 }, { "epoch": 0.06275862068965517, "grad_norm": 7.887789726257324, "learning_rate": 6.375939849624061e-06, "loss": 0.5083958506584167, "num_input_tokens_seen": 432178, "step": 1365, "train_runtime": 3628.7334, "train_tokens_per_second": 119.099 }, { "epoch": 0.06280459770114942, "grad_norm": 8.433984756469727, "learning_rate": 6.365914786967419e-06, "loss": 0.4906807243824005, "num_input_tokens_seen": 432400, "step": 1366, "train_runtime": 3630.6867, "train_tokens_per_second": 119.096 }, { "epoch": 0.06285057471264367, "grad_norm": 6.564528465270996, "learning_rate": 6.355889724310777e-06, "loss": 0.42632395029067993, "num_input_tokens_seen": 432766, "step": 1367, "train_runtime": 3632.6607, "train_tokens_per_second": 119.132 }, { "epoch": 0.06289655172413793, "grad_norm": 7.940859317779541, "learning_rate": 6.3458646616541366e-06, "loss": 0.38434866070747375, "num_input_tokens_seen": 433018, "step": 1368, "train_runtime": 3634.6848, "train_tokens_per_second": 119.135 }, { "epoch": 0.06294252873563218, "grad_norm": 15.380034446716309, "learning_rate": 6.335839598997494e-06, "loss": 0.43325796723365784, "num_input_tokens_seen": 433280, "step": 1369, "train_runtime": 3636.682, "train_tokens_per_second": 119.142 }, { "epoch": 0.06298850574712643, "grad_norm": 8.542527198791504, "learning_rate": 6.325814536340853e-06, "loss": 0.5187516212463379, "num_input_tokens_seen": 433534, "step": 1370, "train_runtime": 3638.6375, "train_tokens_per_second": 119.147 }, { "epoch": 0.06303448275862068, "grad_norm": 7.916285514831543, "learning_rate": 6.31578947368421e-06, "loss": 0.4286421537399292, "num_input_tokens_seen": 433842, "step": 1371, "train_runtime": 3640.6189, "train_tokens_per_second": 119.167 }, { "epoch": 0.06308045977011495, "grad_norm": 6.741034984588623, "learning_rate": 6.30576441102757e-06, "loss": 0.360577255487442, "num_input_tokens_seen": 434152, "step": 1372, "train_runtime": 3642.5855, "train_tokens_per_second": 119.188 }, { "epoch": 0.0631264367816092, "grad_norm": 6.093510150909424, "learning_rate": 6.295739348370928e-06, "loss": 0.3625005781650543, "num_input_tokens_seen": 434436, "step": 1373, "train_runtime": 3644.5764, "train_tokens_per_second": 119.201 }, { "epoch": 0.06317241379310345, "grad_norm": 7.795077323913574, "learning_rate": 6.285714285714286e-06, "loss": 0.5406826734542847, "num_input_tokens_seen": 434800, "step": 1374, "train_runtime": 3646.5783, "train_tokens_per_second": 119.235 }, { "epoch": 0.06321839080459771, "grad_norm": 8.354170799255371, "learning_rate": 6.275689223057645e-06, "loss": 0.47981852293014526, "num_input_tokens_seen": 435068, "step": 1375, "train_runtime": 3648.5481, "train_tokens_per_second": 119.244 }, { "epoch": 0.06326436781609196, "grad_norm": 7.820892333984375, "learning_rate": 6.265664160401003e-06, "loss": 0.5885209441184998, "num_input_tokens_seen": 435390, "step": 1376, "train_runtime": 3650.5505, "train_tokens_per_second": 119.267 }, { "epoch": 0.06331034482758621, "grad_norm": 8.482800483703613, "learning_rate": 6.255639097744361e-06, "loss": 0.49485084414482117, "num_input_tokens_seen": 435874, "step": 1377, "train_runtime": 3652.5762, "train_tokens_per_second": 119.333 }, { "epoch": 0.06335632183908046, "grad_norm": 9.001823425292969, "learning_rate": 6.245614035087721e-06, "loss": 0.41019052267074585, "num_input_tokens_seen": 436094, "step": 1378, "train_runtime": 3654.541, "train_tokens_per_second": 119.329 }, { "epoch": 0.06340229885057472, "grad_norm": 8.457934379577637, "learning_rate": 6.235588972431078e-06, "loss": 0.5790400505065918, "num_input_tokens_seen": 436438, "step": 1379, "train_runtime": 3656.5834, "train_tokens_per_second": 119.357 }, { "epoch": 0.06344827586206897, "grad_norm": 6.0701518058776855, "learning_rate": 6.225563909774437e-06, "loss": 0.4767570197582245, "num_input_tokens_seen": 437090, "step": 1380, "train_runtime": 3658.6915, "train_tokens_per_second": 119.466 }, { "epoch": 0.06349425287356322, "grad_norm": 7.297056198120117, "learning_rate": 6.215538847117794e-06, "loss": 0.5049152374267578, "num_input_tokens_seen": 437380, "step": 1381, "train_runtime": 3673.5632, "train_tokens_per_second": 119.062 }, { "epoch": 0.06354022988505748, "grad_norm": 7.5144171714782715, "learning_rate": 6.205513784461154e-06, "loss": 0.4231078624725342, "num_input_tokens_seen": 437678, "step": 1382, "train_runtime": 3675.5234, "train_tokens_per_second": 119.079 }, { "epoch": 0.06358620689655173, "grad_norm": 7.24461030960083, "learning_rate": 6.195488721804512e-06, "loss": 0.41516321897506714, "num_input_tokens_seen": 437950, "step": 1383, "train_runtime": 3677.4903, "train_tokens_per_second": 119.089 }, { "epoch": 0.06363218390804598, "grad_norm": 7.727677345275879, "learning_rate": 6.18546365914787e-06, "loss": 0.40505528450012207, "num_input_tokens_seen": 438206, "step": 1384, "train_runtime": 3679.4483, "train_tokens_per_second": 119.096 }, { "epoch": 0.06367816091954023, "grad_norm": 7.370773792266846, "learning_rate": 6.175438596491229e-06, "loss": 0.43799248337745667, "num_input_tokens_seen": 438468, "step": 1385, "train_runtime": 3681.4073, "train_tokens_per_second": 119.103 }, { "epoch": 0.06372413793103449, "grad_norm": 8.690412521362305, "learning_rate": 6.165413533834587e-06, "loss": 0.41677355766296387, "num_input_tokens_seen": 438742, "step": 1386, "train_runtime": 3683.3517, "train_tokens_per_second": 119.115 }, { "epoch": 0.06377011494252874, "grad_norm": 8.734532356262207, "learning_rate": 6.155388471177945e-06, "loss": 0.5436221361160278, "num_input_tokens_seen": 438994, "step": 1387, "train_runtime": 3685.285, "train_tokens_per_second": 119.121 }, { "epoch": 0.06381609195402299, "grad_norm": 9.047920227050781, "learning_rate": 6.145363408521305e-06, "loss": 0.3691633641719818, "num_input_tokens_seen": 439276, "step": 1388, "train_runtime": 3687.2795, "train_tokens_per_second": 119.133 }, { "epoch": 0.06386206896551724, "grad_norm": 7.246007442474365, "learning_rate": 6.135338345864662e-06, "loss": 0.4282595217227936, "num_input_tokens_seen": 439522, "step": 1389, "train_runtime": 3689.2213, "train_tokens_per_second": 119.137 }, { "epoch": 0.0639080459770115, "grad_norm": 7.2857441902160645, "learning_rate": 6.125313283208021e-06, "loss": 0.3658398687839508, "num_input_tokens_seen": 439784, "step": 1390, "train_runtime": 3691.1706, "train_tokens_per_second": 119.145 }, { "epoch": 0.06395402298850575, "grad_norm": 7.951290130615234, "learning_rate": 6.115288220551378e-06, "loss": 0.45302778482437134, "num_input_tokens_seen": 440146, "step": 1391, "train_runtime": 3693.1312, "train_tokens_per_second": 119.18 }, { "epoch": 0.064, "grad_norm": 9.196980476379395, "learning_rate": 6.105263157894738e-06, "loss": 0.5447526574134827, "num_input_tokens_seen": 440538, "step": 1392, "train_runtime": 3695.1157, "train_tokens_per_second": 119.222 }, { "epoch": 0.06404597701149425, "grad_norm": 8.422050476074219, "learning_rate": 6.095238095238096e-06, "loss": 0.5552542209625244, "num_input_tokens_seen": 440994, "step": 1393, "train_runtime": 3697.2557, "train_tokens_per_second": 119.276 }, { "epoch": 0.0640919540229885, "grad_norm": 6.602896213531494, "learning_rate": 6.085213032581454e-06, "loss": 0.3959818482398987, "num_input_tokens_seen": 441340, "step": 1394, "train_runtime": 3699.2815, "train_tokens_per_second": 119.304 }, { "epoch": 0.06413793103448276, "grad_norm": 7.989767074584961, "learning_rate": 6.075187969924813e-06, "loss": 0.5790979266166687, "num_input_tokens_seen": 441730, "step": 1395, "train_runtime": 3701.3001, "train_tokens_per_second": 119.345 }, { "epoch": 0.06418390804597701, "grad_norm": 7.779969692230225, "learning_rate": 6.065162907268171e-06, "loss": 0.543576717376709, "num_input_tokens_seen": 441974, "step": 1396, "train_runtime": 3703.2411, "train_tokens_per_second": 119.348 }, { "epoch": 0.06422988505747126, "grad_norm": 6.791033744812012, "learning_rate": 6.055137844611529e-06, "loss": 0.48290449380874634, "num_input_tokens_seen": 442536, "step": 1397, "train_runtime": 3705.2614, "train_tokens_per_second": 119.434 }, { "epoch": 0.06427586206896552, "grad_norm": 6.259047508239746, "learning_rate": 6.045112781954889e-06, "loss": 0.330578476190567, "num_input_tokens_seen": 442760, "step": 1398, "train_runtime": 3707.2204, "train_tokens_per_second": 119.432 }, { "epoch": 0.06432183908045977, "grad_norm": 9.04414176940918, "learning_rate": 6.035087719298246e-06, "loss": 0.40303677320480347, "num_input_tokens_seen": 443066, "step": 1399, "train_runtime": 3709.1908, "train_tokens_per_second": 119.451 }, { "epoch": 0.06436781609195402, "grad_norm": 6.998606204986572, "learning_rate": 6.025062656641605e-06, "loss": 0.4123372435569763, "num_input_tokens_seen": 443440, "step": 1400, "train_runtime": 3711.1837, "train_tokens_per_second": 119.487 }, { "epoch": 0.06436781609195402, "eval_loss": 1.6728938817977905, "eval_runtime": 53.9714, "eval_samples_per_second": 18.528, "eval_steps_per_second": 9.264, "num_input_tokens_seen": 443440, "step": 1400 }, { "epoch": 0.06441379310344827, "grad_norm": 9.046266555786133, "learning_rate": 6.015037593984962e-06, "loss": 0.5548663139343262, "num_input_tokens_seen": 443750, "step": 1401, "train_runtime": 3767.1391, "train_tokens_per_second": 117.795 }, { "epoch": 0.06445977011494253, "grad_norm": 6.469735145568848, "learning_rate": 6.005012531328322e-06, "loss": 0.5285234451293945, "num_input_tokens_seen": 444274, "step": 1402, "train_runtime": 3769.2767, "train_tokens_per_second": 117.867 }, { "epoch": 0.06450574712643678, "grad_norm": 7.658900737762451, "learning_rate": 5.994987468671679e-06, "loss": 0.5017580986022949, "num_input_tokens_seen": 444728, "step": 1403, "train_runtime": 3771.2683, "train_tokens_per_second": 117.925 }, { "epoch": 0.06455172413793103, "grad_norm": 7.396538734436035, "learning_rate": 5.984962406015038e-06, "loss": 0.450796902179718, "num_input_tokens_seen": 445066, "step": 1404, "train_runtime": 3773.2684, "train_tokens_per_second": 117.952 }, { "epoch": 0.06459770114942529, "grad_norm": 7.2905731201171875, "learning_rate": 5.974937343358397e-06, "loss": 0.4379667043685913, "num_input_tokens_seen": 445458, "step": 1405, "train_runtime": 3775.3061, "train_tokens_per_second": 117.993 }, { "epoch": 0.06464367816091954, "grad_norm": 7.959745407104492, "learning_rate": 5.964912280701755e-06, "loss": 0.5967686772346497, "num_input_tokens_seen": 445828, "step": 1406, "train_runtime": 3777.4003, "train_tokens_per_second": 118.025 }, { "epoch": 0.06468965517241379, "grad_norm": 7.209251880645752, "learning_rate": 5.954887218045113e-06, "loss": 0.5046592950820923, "num_input_tokens_seen": 446200, "step": 1407, "train_runtime": 3779.4699, "train_tokens_per_second": 118.059 }, { "epoch": 0.06473563218390804, "grad_norm": 7.277596473693848, "learning_rate": 5.944862155388471e-06, "loss": 0.4014708995819092, "num_input_tokens_seen": 446412, "step": 1408, "train_runtime": 3781.5794, "train_tokens_per_second": 118.049 }, { "epoch": 0.0647816091954023, "grad_norm": 8.122957229614258, "learning_rate": 5.93483709273183e-06, "loss": 0.6335501074790955, "num_input_tokens_seen": 446732, "step": 1409, "train_runtime": 3783.5476, "train_tokens_per_second": 118.072 }, { "epoch": 0.06482758620689655, "grad_norm": 7.2711501121521, "learning_rate": 5.924812030075189e-06, "loss": 0.496785044670105, "num_input_tokens_seen": 447034, "step": 1410, "train_runtime": 3785.6334, "train_tokens_per_second": 118.087 }, { "epoch": 0.0648735632183908, "grad_norm": 8.947657585144043, "learning_rate": 5.9147869674185465e-06, "loss": 0.4516250193119049, "num_input_tokens_seen": 447356, "step": 1411, "train_runtime": 3800.4686, "train_tokens_per_second": 117.711 }, { "epoch": 0.06491954022988505, "grad_norm": 7.818059921264648, "learning_rate": 5.904761904761905e-06, "loss": 0.44249919056892395, "num_input_tokens_seen": 447744, "step": 1412, "train_runtime": 3802.5779, "train_tokens_per_second": 117.747 }, { "epoch": 0.0649655172413793, "grad_norm": 8.84902286529541, "learning_rate": 5.8947368421052634e-06, "loss": 0.4483208954334259, "num_input_tokens_seen": 448048, "step": 1413, "train_runtime": 3804.5455, "train_tokens_per_second": 117.766 }, { "epoch": 0.06501149425287356, "grad_norm": 6.511317253112793, "learning_rate": 5.884711779448622e-06, "loss": 0.3982500433921814, "num_input_tokens_seen": 448366, "step": 1414, "train_runtime": 3806.5661, "train_tokens_per_second": 117.788 }, { "epoch": 0.06505747126436781, "grad_norm": 7.8486104011535645, "learning_rate": 5.87468671679198e-06, "loss": 0.44934552907943726, "num_input_tokens_seen": 448632, "step": 1415, "train_runtime": 3808.5896, "train_tokens_per_second": 117.795 }, { "epoch": 0.06510344827586206, "grad_norm": 6.668032169342041, "learning_rate": 5.864661654135339e-06, "loss": 0.37988215684890747, "num_input_tokens_seen": 448862, "step": 1416, "train_runtime": 3810.5591, "train_tokens_per_second": 117.794 }, { "epoch": 0.06514942528735632, "grad_norm": 7.805704116821289, "learning_rate": 5.854636591478697e-06, "loss": 0.4597431719303131, "num_input_tokens_seen": 449268, "step": 1417, "train_runtime": 3812.568, "train_tokens_per_second": 117.839 }, { "epoch": 0.06519540229885057, "grad_norm": 8.326112747192383, "learning_rate": 5.844611528822055e-06, "loss": 0.4880395829677582, "num_input_tokens_seen": 449592, "step": 1418, "train_runtime": 3814.5293, "train_tokens_per_second": 117.863 }, { "epoch": 0.06524137931034482, "grad_norm": 7.665692329406738, "learning_rate": 5.8345864661654135e-06, "loss": 0.4802709221839905, "num_input_tokens_seen": 449910, "step": 1419, "train_runtime": 3816.5481, "train_tokens_per_second": 117.884 }, { "epoch": 0.06528735632183907, "grad_norm": 6.744765281677246, "learning_rate": 5.824561403508773e-06, "loss": 0.2984175384044647, "num_input_tokens_seen": 450120, "step": 1420, "train_runtime": 3818.633, "train_tokens_per_second": 117.875 }, { "epoch": 0.06533333333333333, "grad_norm": 7.256897926330566, "learning_rate": 5.8145363408521305e-06, "loss": 0.44814056158065796, "num_input_tokens_seen": 450428, "step": 1421, "train_runtime": 3820.6895, "train_tokens_per_second": 117.892 }, { "epoch": 0.0653793103448276, "grad_norm": 8.124982833862305, "learning_rate": 5.804511278195489e-06, "loss": 0.49199938774108887, "num_input_tokens_seen": 450886, "step": 1422, "train_runtime": 3822.7805, "train_tokens_per_second": 117.947 }, { "epoch": 0.06542528735632185, "grad_norm": 8.14277458190918, "learning_rate": 5.7944862155388475e-06, "loss": 0.5476075410842896, "num_input_tokens_seen": 451228, "step": 1423, "train_runtime": 3824.7357, "train_tokens_per_second": 117.976 }, { "epoch": 0.0654712643678161, "grad_norm": 6.699192523956299, "learning_rate": 5.784461152882206e-06, "loss": 0.34197741746902466, "num_input_tokens_seen": 451444, "step": 1424, "train_runtime": 3826.7233, "train_tokens_per_second": 117.971 }, { "epoch": 0.06551724137931035, "grad_norm": 6.593231678009033, "learning_rate": 5.7744360902255644e-06, "loss": 0.3856680989265442, "num_input_tokens_seen": 451924, "step": 1425, "train_runtime": 3828.8333, "train_tokens_per_second": 118.032 }, { "epoch": 0.0655632183908046, "grad_norm": 7.20468282699585, "learning_rate": 5.764411027568922e-06, "loss": 0.3096913695335388, "num_input_tokens_seen": 452190, "step": 1426, "train_runtime": 3830.7791, "train_tokens_per_second": 118.041 }, { "epoch": 0.06560919540229886, "grad_norm": 7.313076972961426, "learning_rate": 5.754385964912281e-06, "loss": 0.5206544995307922, "num_input_tokens_seen": 452902, "step": 1427, "train_runtime": 3832.8397, "train_tokens_per_second": 118.164 }, { "epoch": 0.06565517241379311, "grad_norm": 8.288788795471191, "learning_rate": 5.744360902255639e-06, "loss": 0.42484205961227417, "num_input_tokens_seen": 453130, "step": 1428, "train_runtime": 3834.8345, "train_tokens_per_second": 118.162 }, { "epoch": 0.06570114942528736, "grad_norm": 7.632509231567383, "learning_rate": 5.7343358395989975e-06, "loss": 0.39699095487594604, "num_input_tokens_seen": 453416, "step": 1429, "train_runtime": 3836.7866, "train_tokens_per_second": 118.176 }, { "epoch": 0.06574712643678161, "grad_norm": 10.508520126342773, "learning_rate": 5.724310776942357e-06, "loss": 0.4499485194683075, "num_input_tokens_seen": 453692, "step": 1430, "train_runtime": 3838.7276, "train_tokens_per_second": 118.188 }, { "epoch": 0.06579310344827587, "grad_norm": 7.253719329833984, "learning_rate": 5.7142857142857145e-06, "loss": 0.43608686327934265, "num_input_tokens_seen": 454016, "step": 1431, "train_runtime": 3840.6975, "train_tokens_per_second": 118.212 }, { "epoch": 0.06583908045977012, "grad_norm": 7.344719886779785, "learning_rate": 5.704260651629073e-06, "loss": 0.4349340796470642, "num_input_tokens_seen": 454282, "step": 1432, "train_runtime": 3842.6286, "train_tokens_per_second": 118.222 }, { "epoch": 0.06588505747126437, "grad_norm": 11.343481063842773, "learning_rate": 5.694235588972431e-06, "loss": 0.45035284757614136, "num_input_tokens_seen": 454612, "step": 1433, "train_runtime": 3844.5751, "train_tokens_per_second": 118.248 }, { "epoch": 0.06593103448275862, "grad_norm": 8.23226261138916, "learning_rate": 5.68421052631579e-06, "loss": 0.4740956425666809, "num_input_tokens_seen": 454944, "step": 1434, "train_runtime": 3846.6047, "train_tokens_per_second": 118.272 }, { "epoch": 0.06597701149425288, "grad_norm": 9.180990219116211, "learning_rate": 5.6741854636591485e-06, "loss": 0.40841978788375854, "num_input_tokens_seen": 455174, "step": 1435, "train_runtime": 3848.5455, "train_tokens_per_second": 118.272 }, { "epoch": 0.06602298850574713, "grad_norm": 6.975395679473877, "learning_rate": 5.664160401002506e-06, "loss": 0.46920278668403625, "num_input_tokens_seen": 455482, "step": 1436, "train_runtime": 3850.5704, "train_tokens_per_second": 118.289 }, { "epoch": 0.06606896551724138, "grad_norm": 7.356271743774414, "learning_rate": 5.6541353383458654e-06, "loss": 0.4397551715373993, "num_input_tokens_seen": 455810, "step": 1437, "train_runtime": 3852.5505, "train_tokens_per_second": 118.314 }, { "epoch": 0.06611494252873563, "grad_norm": 8.738754272460938, "learning_rate": 5.644110275689223e-06, "loss": 0.4972565770149231, "num_input_tokens_seen": 456084, "step": 1438, "train_runtime": 3854.4924, "train_tokens_per_second": 118.325 }, { "epoch": 0.06616091954022989, "grad_norm": 7.6549577713012695, "learning_rate": 5.6340852130325816e-06, "loss": 0.5112255811691284, "num_input_tokens_seen": 456390, "step": 1439, "train_runtime": 3856.4504, "train_tokens_per_second": 118.345 }, { "epoch": 0.06620689655172414, "grad_norm": 8.52723503112793, "learning_rate": 5.624060150375941e-06, "loss": 0.479225218296051, "num_input_tokens_seen": 456660, "step": 1440, "train_runtime": 3858.4263, "train_tokens_per_second": 118.354 }, { "epoch": 0.06625287356321839, "grad_norm": 7.388975620269775, "learning_rate": 5.6140350877192985e-06, "loss": 0.2918142080307007, "num_input_tokens_seen": 456996, "step": 1441, "train_runtime": 3873.3897, "train_tokens_per_second": 117.983 }, { "epoch": 0.06629885057471264, "grad_norm": 7.529322147369385, "learning_rate": 5.604010025062657e-06, "loss": 0.46961405873298645, "num_input_tokens_seen": 457312, "step": 1442, "train_runtime": 3875.4377, "train_tokens_per_second": 118.003 }, { "epoch": 0.0663448275862069, "grad_norm": 9.43989372253418, "learning_rate": 5.593984962406015e-06, "loss": 0.5963732004165649, "num_input_tokens_seen": 457634, "step": 1443, "train_runtime": 3877.3831, "train_tokens_per_second": 118.027 }, { "epoch": 0.06639080459770115, "grad_norm": 12.360222816467285, "learning_rate": 5.583959899749374e-06, "loss": 0.3917125463485718, "num_input_tokens_seen": 457894, "step": 1444, "train_runtime": 3879.3161, "train_tokens_per_second": 118.035 }, { "epoch": 0.0664367816091954, "grad_norm": 8.409878730773926, "learning_rate": 5.5739348370927325e-06, "loss": 0.47330906987190247, "num_input_tokens_seen": 458194, "step": 1445, "train_runtime": 3881.2778, "train_tokens_per_second": 118.052 }, { "epoch": 0.06648275862068966, "grad_norm": 6.086939334869385, "learning_rate": 5.56390977443609e-06, "loss": 0.2741166651248932, "num_input_tokens_seen": 458408, "step": 1446, "train_runtime": 3883.2243, "train_tokens_per_second": 118.048 }, { "epoch": 0.06652873563218391, "grad_norm": 9.503534317016602, "learning_rate": 5.5538847117794495e-06, "loss": 0.4382116496562958, "num_input_tokens_seen": 458702, "step": 1447, "train_runtime": 3885.204, "train_tokens_per_second": 118.064 }, { "epoch": 0.06657471264367816, "grad_norm": 5.2927045822143555, "learning_rate": 5.543859649122807e-06, "loss": 0.3405531644821167, "num_input_tokens_seen": 459594, "step": 1448, "train_runtime": 3887.3512, "train_tokens_per_second": 118.228 }, { "epoch": 0.06662068965517241, "grad_norm": 7.682872295379639, "learning_rate": 5.533834586466166e-06, "loss": 0.44900932908058167, "num_input_tokens_seen": 459898, "step": 1449, "train_runtime": 3889.3072, "train_tokens_per_second": 118.247 }, { "epoch": 0.06666666666666667, "grad_norm": 6.594202995300293, "learning_rate": 5.523809523809525e-06, "loss": 0.2792794406414032, "num_input_tokens_seen": 460168, "step": 1450, "train_runtime": 3891.2575, "train_tokens_per_second": 118.257 }, { "epoch": 0.06671264367816092, "grad_norm": 6.011887073516846, "learning_rate": 5.5137844611528826e-06, "loss": 0.4249735474586487, "num_input_tokens_seen": 460784, "step": 1451, "train_runtime": 3893.3149, "train_tokens_per_second": 118.353 }, { "epoch": 0.06675862068965517, "grad_norm": 8.257855415344238, "learning_rate": 5.503759398496241e-06, "loss": 0.4575742185115814, "num_input_tokens_seen": 461102, "step": 1452, "train_runtime": 3895.2778, "train_tokens_per_second": 118.375 }, { "epoch": 0.06680459770114942, "grad_norm": 9.305832862854004, "learning_rate": 5.493734335839599e-06, "loss": 0.3868868350982666, "num_input_tokens_seen": 461374, "step": 1453, "train_runtime": 3897.367, "train_tokens_per_second": 118.381 }, { "epoch": 0.06685057471264368, "grad_norm": 7.448078155517578, "learning_rate": 5.483709273182958e-06, "loss": 0.4348413348197937, "num_input_tokens_seen": 461686, "step": 1454, "train_runtime": 3899.3302, "train_tokens_per_second": 118.401 }, { "epoch": 0.06689655172413793, "grad_norm": 8.324820518493652, "learning_rate": 5.4736842105263165e-06, "loss": 0.48474711179733276, "num_input_tokens_seen": 461928, "step": 1455, "train_runtime": 3901.2856, "train_tokens_per_second": 118.404 }, { "epoch": 0.06694252873563218, "grad_norm": 7.631561279296875, "learning_rate": 5.463659147869674e-06, "loss": 0.3665958344936371, "num_input_tokens_seen": 462180, "step": 1456, "train_runtime": 3903.2286, "train_tokens_per_second": 118.41 }, { "epoch": 0.06698850574712643, "grad_norm": 7.605569362640381, "learning_rate": 5.4536340852130335e-06, "loss": 0.3843117952346802, "num_input_tokens_seen": 462412, "step": 1457, "train_runtime": 3905.1744, "train_tokens_per_second": 118.41 }, { "epoch": 0.06703448275862069, "grad_norm": 7.717450141906738, "learning_rate": 5.443609022556391e-06, "loss": 0.42220956087112427, "num_input_tokens_seen": 462804, "step": 1458, "train_runtime": 3907.1775, "train_tokens_per_second": 118.45 }, { "epoch": 0.06708045977011494, "grad_norm": 8.893595695495605, "learning_rate": 5.43358395989975e-06, "loss": 0.4857786297798157, "num_input_tokens_seen": 463082, "step": 1459, "train_runtime": 3909.1257, "train_tokens_per_second": 118.462 }, { "epoch": 0.06712643678160919, "grad_norm": 8.317085266113281, "learning_rate": 5.423558897243109e-06, "loss": 0.40825778245925903, "num_input_tokens_seen": 463398, "step": 1460, "train_runtime": 3911.0823, "train_tokens_per_second": 118.483 }, { "epoch": 0.06717241379310344, "grad_norm": 7.586710453033447, "learning_rate": 5.413533834586467e-06, "loss": 0.49957364797592163, "num_input_tokens_seen": 463676, "step": 1461, "train_runtime": 3913.0305, "train_tokens_per_second": 118.495 }, { "epoch": 0.0672183908045977, "grad_norm": 7.044920444488525, "learning_rate": 5.403508771929825e-06, "loss": 0.39399638772010803, "num_input_tokens_seen": 463938, "step": 1462, "train_runtime": 3914.965, "train_tokens_per_second": 118.504 }, { "epoch": 0.06726436781609195, "grad_norm": 8.023091316223145, "learning_rate": 5.393483709273183e-06, "loss": 0.4946120083332062, "num_input_tokens_seen": 464396, "step": 1463, "train_runtime": 3917.1293, "train_tokens_per_second": 118.555 }, { "epoch": 0.0673103448275862, "grad_norm": 8.678879737854004, "learning_rate": 5.383458646616542e-06, "loss": 0.6020040512084961, "num_input_tokens_seen": 464842, "step": 1464, "train_runtime": 3919.1546, "train_tokens_per_second": 118.608 }, { "epoch": 0.06735632183908045, "grad_norm": 7.435107707977295, "learning_rate": 5.3734335839599006e-06, "loss": 0.5132777094841003, "num_input_tokens_seen": 465214, "step": 1465, "train_runtime": 3921.168, "train_tokens_per_second": 118.642 }, { "epoch": 0.06740229885057471, "grad_norm": 6.2644195556640625, "learning_rate": 5.363408521303258e-06, "loss": 0.3035534620285034, "num_input_tokens_seen": 465474, "step": 1466, "train_runtime": 3923.1102, "train_tokens_per_second": 118.649 }, { "epoch": 0.06744827586206896, "grad_norm": 9.018959045410156, "learning_rate": 5.3533834586466175e-06, "loss": 0.5224138498306274, "num_input_tokens_seen": 465714, "step": 1467, "train_runtime": 3925.0802, "train_tokens_per_second": 118.651 }, { "epoch": 0.06749425287356321, "grad_norm": 6.754763603210449, "learning_rate": 5.343358395989975e-06, "loss": 0.4327360987663269, "num_input_tokens_seen": 465968, "step": 1468, "train_runtime": 3927.0267, "train_tokens_per_second": 118.657 }, { "epoch": 0.06754022988505747, "grad_norm": 7.545434951782227, "learning_rate": 5.333333333333334e-06, "loss": 0.5524900555610657, "num_input_tokens_seen": 466276, "step": 1469, "train_runtime": 3928.9765, "train_tokens_per_second": 118.676 }, { "epoch": 0.06758620689655172, "grad_norm": 7.580416202545166, "learning_rate": 5.323308270676692e-06, "loss": 0.5965360403060913, "num_input_tokens_seen": 466738, "step": 1470, "train_runtime": 3930.9482, "train_tokens_per_second": 118.734 }, { "epoch": 0.06763218390804597, "grad_norm": 6.887581825256348, "learning_rate": 5.313283208020051e-06, "loss": 0.33703264594078064, "num_input_tokens_seen": 467014, "step": 1471, "train_runtime": 3946.3969, "train_tokens_per_second": 118.339 }, { "epoch": 0.06767816091954024, "grad_norm": 8.271141052246094, "learning_rate": 5.303258145363409e-06, "loss": 0.4208733141422272, "num_input_tokens_seen": 467310, "step": 1472, "train_runtime": 3948.3652, "train_tokens_per_second": 118.355 }, { "epoch": 0.06772413793103449, "grad_norm": 7.072446823120117, "learning_rate": 5.293233082706767e-06, "loss": 0.3233204483985901, "num_input_tokens_seen": 467548, "step": 1473, "train_runtime": 3950.2992, "train_tokens_per_second": 118.358 }, { "epoch": 0.06777011494252874, "grad_norm": 8.18366527557373, "learning_rate": 5.283208020050126e-06, "loss": 0.4296606779098511, "num_input_tokens_seen": 467876, "step": 1474, "train_runtime": 3952.2591, "train_tokens_per_second": 118.382 }, { "epoch": 0.067816091954023, "grad_norm": 8.32473087310791, "learning_rate": 5.273182957393485e-06, "loss": 0.38647186756134033, "num_input_tokens_seen": 468136, "step": 1475, "train_runtime": 3954.2163, "train_tokens_per_second": 118.389 }, { "epoch": 0.06786206896551725, "grad_norm": 7.680408000946045, "learning_rate": 5.263157894736842e-06, "loss": 0.4326077401638031, "num_input_tokens_seen": 468392, "step": 1476, "train_runtime": 3956.1621, "train_tokens_per_second": 118.396 }, { "epoch": 0.0679080459770115, "grad_norm": 6.291998386383057, "learning_rate": 5.253132832080201e-06, "loss": 0.379532128572464, "num_input_tokens_seen": 468698, "step": 1477, "train_runtime": 3958.1197, "train_tokens_per_second": 118.414 }, { "epoch": 0.06795402298850575, "grad_norm": 8.708852767944336, "learning_rate": 5.243107769423559e-06, "loss": 0.4702181816101074, "num_input_tokens_seen": 469026, "step": 1478, "train_runtime": 3960.0793, "train_tokens_per_second": 118.439 }, { "epoch": 0.068, "grad_norm": 7.804077625274658, "learning_rate": 5.233082706766918e-06, "loss": 0.406497061252594, "num_input_tokens_seen": 469274, "step": 1479, "train_runtime": 3962.0364, "train_tokens_per_second": 118.443 }, { "epoch": 0.06804597701149426, "grad_norm": 10.114439010620117, "learning_rate": 5.223057644110276e-06, "loss": 0.5118438601493835, "num_input_tokens_seen": 469602, "step": 1480, "train_runtime": 3963.9901, "train_tokens_per_second": 118.467 }, { "epoch": 0.06809195402298851, "grad_norm": 9.554535865783691, "learning_rate": 5.213032581453634e-06, "loss": 0.521860659122467, "num_input_tokens_seen": 469924, "step": 1481, "train_runtime": 3965.9423, "train_tokens_per_second": 118.49 }, { "epoch": 0.06813793103448276, "grad_norm": 10.086437225341797, "learning_rate": 5.203007518796993e-06, "loss": 0.5799345970153809, "num_input_tokens_seen": 470244, "step": 1482, "train_runtime": 3967.8889, "train_tokens_per_second": 118.512 }, { "epoch": 0.06818390804597702, "grad_norm": 8.745047569274902, "learning_rate": 5.192982456140351e-06, "loss": 0.4893014430999756, "num_input_tokens_seen": 470484, "step": 1483, "train_runtime": 3969.8344, "train_tokens_per_second": 118.515 }, { "epoch": 0.06822988505747127, "grad_norm": 8.214205741882324, "learning_rate": 5.182957393483709e-06, "loss": 0.3816409707069397, "num_input_tokens_seen": 470798, "step": 1484, "train_runtime": 3971.825, "train_tokens_per_second": 118.534 }, { "epoch": 0.06827586206896552, "grad_norm": 6.99646520614624, "learning_rate": 5.172932330827069e-06, "loss": 0.5191115140914917, "num_input_tokens_seen": 471250, "step": 1485, "train_runtime": 3973.8055, "train_tokens_per_second": 118.589 }, { "epoch": 0.06832183908045977, "grad_norm": 7.990946292877197, "learning_rate": 5.162907268170426e-06, "loss": 0.49176281690597534, "num_input_tokens_seen": 471494, "step": 1486, "train_runtime": 3975.7526, "train_tokens_per_second": 118.592 }, { "epoch": 0.06836781609195403, "grad_norm": 6.933746814727783, "learning_rate": 5.152882205513785e-06, "loss": 0.3267862796783447, "num_input_tokens_seen": 471750, "step": 1487, "train_runtime": 3977.7152, "train_tokens_per_second": 118.598 }, { "epoch": 0.06841379310344828, "grad_norm": 9.269936561584473, "learning_rate": 5.142857142857142e-06, "loss": 0.5424149036407471, "num_input_tokens_seen": 472076, "step": 1488, "train_runtime": 3979.7152, "train_tokens_per_second": 118.621 }, { "epoch": 0.06845977011494253, "grad_norm": 6.7744035720825195, "learning_rate": 5.132832080200502e-06, "loss": 0.3430073857307434, "num_input_tokens_seen": 472364, "step": 1489, "train_runtime": 3981.6783, "train_tokens_per_second": 118.634 }, { "epoch": 0.06850574712643678, "grad_norm": 7.776864051818848, "learning_rate": 5.12280701754386e-06, "loss": 0.3698754608631134, "num_input_tokens_seen": 472624, "step": 1490, "train_runtime": 3983.6629, "train_tokens_per_second": 118.641 }, { "epoch": 0.06855172413793104, "grad_norm": 7.676121234893799, "learning_rate": 5.112781954887218e-06, "loss": 0.5057390928268433, "num_input_tokens_seen": 473178, "step": 1491, "train_runtime": 3985.7442, "train_tokens_per_second": 118.718 }, { "epoch": 0.06859770114942529, "grad_norm": 6.1846418380737305, "learning_rate": 5.102756892230577e-06, "loss": 0.3319104313850403, "num_input_tokens_seen": 473548, "step": 1492, "train_runtime": 3987.727, "train_tokens_per_second": 118.751 }, { "epoch": 0.06864367816091954, "grad_norm": 8.331839561462402, "learning_rate": 5.092731829573935e-06, "loss": 0.6448594927787781, "num_input_tokens_seen": 473872, "step": 1493, "train_runtime": 3989.7313, "train_tokens_per_second": 118.773 }, { "epoch": 0.0686896551724138, "grad_norm": 9.190635681152344, "learning_rate": 5.082706766917293e-06, "loss": 0.5440618991851807, "num_input_tokens_seen": 474106, "step": 1494, "train_runtime": 3991.6556, "train_tokens_per_second": 118.774 }, { "epoch": 0.06873563218390805, "grad_norm": 10.09354305267334, "learning_rate": 5.072681704260653e-06, "loss": 0.34777310490608215, "num_input_tokens_seen": 474378, "step": 1495, "train_runtime": 3993.656, "train_tokens_per_second": 118.783 }, { "epoch": 0.0687816091954023, "grad_norm": 7.709604740142822, "learning_rate": 5.06265664160401e-06, "loss": 0.4458523988723755, "num_input_tokens_seen": 474652, "step": 1496, "train_runtime": 3995.6046, "train_tokens_per_second": 118.794 }, { "epoch": 0.06882758620689655, "grad_norm": 6.953578472137451, "learning_rate": 5.052631578947369e-06, "loss": 0.40357089042663574, "num_input_tokens_seen": 475020, "step": 1497, "train_runtime": 3997.676, "train_tokens_per_second": 118.824 }, { "epoch": 0.0688735632183908, "grad_norm": 8.717723846435547, "learning_rate": 5.042606516290726e-06, "loss": 0.5088080763816833, "num_input_tokens_seen": 475368, "step": 1498, "train_runtime": 3999.6783, "train_tokens_per_second": 118.852 }, { "epoch": 0.06891954022988506, "grad_norm": 6.654493808746338, "learning_rate": 5.032581453634086e-06, "loss": 0.5015754699707031, "num_input_tokens_seen": 475868, "step": 1499, "train_runtime": 4001.7448, "train_tokens_per_second": 118.915 }, { "epoch": 0.06896551724137931, "grad_norm": 7.362853050231934, "learning_rate": 5.022556390977444e-06, "loss": 0.46414509415626526, "num_input_tokens_seen": 476138, "step": 1500, "train_runtime": 4003.7518, "train_tokens_per_second": 118.923 }, { "epoch": 0.06901149425287356, "grad_norm": 7.295174598693848, "learning_rate": 5.012531328320802e-06, "loss": 0.44448113441467285, "num_input_tokens_seen": 476464, "step": 1501, "train_runtime": 4019.5965, "train_tokens_per_second": 118.535 }, { "epoch": 0.06905747126436781, "grad_norm": 8.375143051147461, "learning_rate": 5.002506265664161e-06, "loss": 0.395553320646286, "num_input_tokens_seen": 476832, "step": 1502, "train_runtime": 4021.7011, "train_tokens_per_second": 118.565 }, { "epoch": 0.06910344827586207, "grad_norm": 9.805458068847656, "learning_rate": 4.992481203007519e-06, "loss": 0.42004987597465515, "num_input_tokens_seen": 477098, "step": 1503, "train_runtime": 4023.7052, "train_tokens_per_second": 118.572 }, { "epoch": 0.06914942528735632, "grad_norm": 8.395523071289062, "learning_rate": 4.982456140350877e-06, "loss": 0.5958109498023987, "num_input_tokens_seen": 477516, "step": 1504, "train_runtime": 4025.7994, "train_tokens_per_second": 118.614 }, { "epoch": 0.06919540229885057, "grad_norm": 8.359265327453613, "learning_rate": 4.972431077694236e-06, "loss": 0.4998864531517029, "num_input_tokens_seen": 477846, "step": 1505, "train_runtime": 4027.7803, "train_tokens_per_second": 118.638 }, { "epoch": 0.06924137931034482, "grad_norm": 6.486353397369385, "learning_rate": 4.962406015037594e-06, "loss": 0.3851095139980316, "num_input_tokens_seen": 478138, "step": 1506, "train_runtime": 4029.8107, "train_tokens_per_second": 118.65 }, { "epoch": 0.06928735632183908, "grad_norm": 6.7579803466796875, "learning_rate": 4.952380952380953e-06, "loss": 0.355318158864975, "num_input_tokens_seen": 478414, "step": 1507, "train_runtime": 4031.8359, "train_tokens_per_second": 118.659 }, { "epoch": 0.06933333333333333, "grad_norm": 12.411815643310547, "learning_rate": 4.942355889724311e-06, "loss": 0.42763108015060425, "num_input_tokens_seen": 478646, "step": 1508, "train_runtime": 4033.7831, "train_tokens_per_second": 118.659 }, { "epoch": 0.06937931034482758, "grad_norm": 9.093607902526855, "learning_rate": 4.93233082706767e-06, "loss": 0.4881199598312378, "num_input_tokens_seen": 479012, "step": 1509, "train_runtime": 4035.8165, "train_tokens_per_second": 118.69 }, { "epoch": 0.06942528735632184, "grad_norm": 8.364423751831055, "learning_rate": 4.922305764411027e-06, "loss": 0.45255759358406067, "num_input_tokens_seen": 479384, "step": 1510, "train_runtime": 4037.8086, "train_tokens_per_second": 118.724 }, { "epoch": 0.06947126436781609, "grad_norm": 7.509194374084473, "learning_rate": 4.912280701754386e-06, "loss": 0.5315737128257751, "num_input_tokens_seen": 479778, "step": 1511, "train_runtime": 4039.8268, "train_tokens_per_second": 118.762 }, { "epoch": 0.06951724137931034, "grad_norm": 7.366269588470459, "learning_rate": 4.902255639097745e-06, "loss": 0.4919632077217102, "num_input_tokens_seen": 480118, "step": 1512, "train_runtime": 4041.7992, "train_tokens_per_second": 118.788 }, { "epoch": 0.0695632183908046, "grad_norm": 7.457450866699219, "learning_rate": 4.892230576441103e-06, "loss": 0.37449610233306885, "num_input_tokens_seen": 480422, "step": 1513, "train_runtime": 4043.7798, "train_tokens_per_second": 118.805 }, { "epoch": 0.06960919540229885, "grad_norm": 7.189851760864258, "learning_rate": 4.882205513784461e-06, "loss": 0.456065833568573, "num_input_tokens_seen": 480710, "step": 1514, "train_runtime": 4045.8441, "train_tokens_per_second": 118.816 }, { "epoch": 0.0696551724137931, "grad_norm": 7.268008708953857, "learning_rate": 4.87218045112782e-06, "loss": 0.4126277565956116, "num_input_tokens_seen": 480948, "step": 1515, "train_runtime": 4047.8221, "train_tokens_per_second": 118.816 }, { "epoch": 0.06970114942528735, "grad_norm": 6.931264877319336, "learning_rate": 4.862155388471178e-06, "loss": 0.35446545481681824, "num_input_tokens_seen": 481306, "step": 1516, "train_runtime": 4049.8866, "train_tokens_per_second": 118.844 }, { "epoch": 0.0697471264367816, "grad_norm": 9.292113304138184, "learning_rate": 4.852130325814537e-06, "loss": 0.34105855226516724, "num_input_tokens_seen": 481570, "step": 1517, "train_runtime": 4051.9034, "train_tokens_per_second": 118.85 }, { "epoch": 0.06979310344827586, "grad_norm": 8.461747169494629, "learning_rate": 4.842105263157895e-06, "loss": 0.5056231021881104, "num_input_tokens_seen": 481892, "step": 1518, "train_runtime": 4053.8728, "train_tokens_per_second": 118.872 }, { "epoch": 0.06983908045977011, "grad_norm": 7.729432582855225, "learning_rate": 4.832080200501254e-06, "loss": 0.5439703464508057, "num_input_tokens_seen": 482198, "step": 1519, "train_runtime": 4055.8291, "train_tokens_per_second": 118.89 }, { "epoch": 0.06988505747126436, "grad_norm": 7.601734161376953, "learning_rate": 4.8220551378446114e-06, "loss": 0.46440935134887695, "num_input_tokens_seen": 482550, "step": 1520, "train_runtime": 4057.8424, "train_tokens_per_second": 118.918 }, { "epoch": 0.06993103448275861, "grad_norm": 7.580126762390137, "learning_rate": 4.81203007518797e-06, "loss": 0.4427540898323059, "num_input_tokens_seen": 482938, "step": 1521, "train_runtime": 4059.9159, "train_tokens_per_second": 118.953 }, { "epoch": 0.06997701149425288, "grad_norm": 9.245956420898438, "learning_rate": 4.802005012531329e-06, "loss": 0.2203454077243805, "num_input_tokens_seen": 483178, "step": 1522, "train_runtime": 4061.8498, "train_tokens_per_second": 118.955 }, { "epoch": 0.07002298850574713, "grad_norm": 24.038677215576172, "learning_rate": 4.791979949874687e-06, "loss": 0.3537423014640808, "num_input_tokens_seen": 483402, "step": 1523, "train_runtime": 4063.7902, "train_tokens_per_second": 118.953 }, { "epoch": 0.07006896551724139, "grad_norm": 8.508315086364746, "learning_rate": 4.781954887218045e-06, "loss": 0.5330834984779358, "num_input_tokens_seen": 483802, "step": 1524, "train_runtime": 4065.7865, "train_tokens_per_second": 118.993 }, { "epoch": 0.07011494252873564, "grad_norm": 12.299150466918945, "learning_rate": 4.771929824561404e-06, "loss": 0.5105612277984619, "num_input_tokens_seen": 484070, "step": 1525, "train_runtime": 4067.7933, "train_tokens_per_second": 119.001 }, { "epoch": 0.07016091954022989, "grad_norm": 6.736196041107178, "learning_rate": 4.761904761904762e-06, "loss": 0.3398650586605072, "num_input_tokens_seen": 484344, "step": 1526, "train_runtime": 4069.7464, "train_tokens_per_second": 119.011 }, { "epoch": 0.07020689655172414, "grad_norm": 5.740973949432373, "learning_rate": 4.751879699248121e-06, "loss": 0.2813899517059326, "num_input_tokens_seen": 484544, "step": 1527, "train_runtime": 4071.7248, "train_tokens_per_second": 119.002 }, { "epoch": 0.0702528735632184, "grad_norm": 7.960937023162842, "learning_rate": 4.741854636591479e-06, "loss": 0.4507075250148773, "num_input_tokens_seen": 484866, "step": 1528, "train_runtime": 4073.7501, "train_tokens_per_second": 119.022 }, { "epoch": 0.07029885057471265, "grad_norm": 7.307352066040039, "learning_rate": 4.731829573934838e-06, "loss": 0.5230740308761597, "num_input_tokens_seen": 485206, "step": 1529, "train_runtime": 4075.8439, "train_tokens_per_second": 119.044 }, { "epoch": 0.0703448275862069, "grad_norm": 6.8969244956970215, "learning_rate": 4.7218045112781955e-06, "loss": 0.3683476448059082, "num_input_tokens_seen": 485502, "step": 1530, "train_runtime": 4077.7995, "train_tokens_per_second": 119.06 }, { "epoch": 0.07039080459770115, "grad_norm": 6.411011219024658, "learning_rate": 4.711779448621554e-06, "loss": 0.41447699069976807, "num_input_tokens_seen": 485962, "step": 1531, "train_runtime": 4092.7217, "train_tokens_per_second": 118.738 }, { "epoch": 0.0704367816091954, "grad_norm": 8.083466529846191, "learning_rate": 4.7017543859649125e-06, "loss": 0.5244938731193542, "num_input_tokens_seen": 486228, "step": 1532, "train_runtime": 4094.744, "train_tokens_per_second": 118.744 }, { "epoch": 0.07048275862068966, "grad_norm": 7.008942127227783, "learning_rate": 4.691729323308271e-06, "loss": 0.4396969974040985, "num_input_tokens_seen": 486514, "step": 1533, "train_runtime": 4096.7295, "train_tokens_per_second": 118.757 }, { "epoch": 0.07052873563218391, "grad_norm": 9.5209379196167, "learning_rate": 4.6817042606516294e-06, "loss": 0.38825932145118713, "num_input_tokens_seen": 486760, "step": 1534, "train_runtime": 4098.7097, "train_tokens_per_second": 118.759 }, { "epoch": 0.07057471264367816, "grad_norm": 6.287064075469971, "learning_rate": 4.671679197994988e-06, "loss": 0.33252447843551636, "num_input_tokens_seen": 487050, "step": 1535, "train_runtime": 4100.8288, "train_tokens_per_second": 118.769 }, { "epoch": 0.07062068965517242, "grad_norm": 7.780177116394043, "learning_rate": 4.661654135338346e-06, "loss": 0.40082573890686035, "num_input_tokens_seen": 487384, "step": 1536, "train_runtime": 4103.0639, "train_tokens_per_second": 118.785 }, { "epoch": 0.07066666666666667, "grad_norm": 6.677377700805664, "learning_rate": 4.651629072681705e-06, "loss": 0.4884091019630432, "num_input_tokens_seen": 488052, "step": 1537, "train_runtime": 4105.1073, "train_tokens_per_second": 118.889 }, { "epoch": 0.07071264367816092, "grad_norm": 10.25025463104248, "learning_rate": 4.641604010025063e-06, "loss": 0.3952670991420746, "num_input_tokens_seen": 488380, "step": 1538, "train_runtime": 4107.0889, "train_tokens_per_second": 118.911 }, { "epoch": 0.07075862068965517, "grad_norm": 8.572774887084961, "learning_rate": 4.631578947368421e-06, "loss": 0.7552651166915894, "num_input_tokens_seen": 488652, "step": 1539, "train_runtime": 4109.0954, "train_tokens_per_second": 118.92 }, { "epoch": 0.07080459770114943, "grad_norm": 7.492312431335449, "learning_rate": 4.6215538847117795e-06, "loss": 0.5208468437194824, "num_input_tokens_seen": 488996, "step": 1540, "train_runtime": 4111.1038, "train_tokens_per_second": 118.945 }, { "epoch": 0.07085057471264368, "grad_norm": 6.831908226013184, "learning_rate": 4.611528822055138e-06, "loss": 0.4159829914569855, "num_input_tokens_seen": 489436, "step": 1541, "train_runtime": 4113.081, "train_tokens_per_second": 118.995 }, { "epoch": 0.07089655172413793, "grad_norm": 6.706018447875977, "learning_rate": 4.6015037593984965e-06, "loss": 0.42937764525413513, "num_input_tokens_seen": 489840, "step": 1542, "train_runtime": 4115.2212, "train_tokens_per_second": 119.031 }, { "epoch": 0.07094252873563218, "grad_norm": 6.830271244049072, "learning_rate": 4.591478696741855e-06, "loss": 0.31548362970352173, "num_input_tokens_seen": 490070, "step": 1543, "train_runtime": 4117.2331, "train_tokens_per_second": 119.029 }, { "epoch": 0.07098850574712644, "grad_norm": 6.314537048339844, "learning_rate": 4.5814536340852135e-06, "loss": 0.3962181508541107, "num_input_tokens_seen": 490426, "step": 1544, "train_runtime": 4119.2344, "train_tokens_per_second": 119.058 }, { "epoch": 0.07103448275862069, "grad_norm": 7.005821704864502, "learning_rate": 4.571428571428572e-06, "loss": 0.35218262672424316, "num_input_tokens_seen": 490662, "step": 1545, "train_runtime": 4121.1795, "train_tokens_per_second": 119.059 }, { "epoch": 0.07108045977011494, "grad_norm": 7.298124313354492, "learning_rate": 4.56140350877193e-06, "loss": 0.40392208099365234, "num_input_tokens_seen": 490972, "step": 1546, "train_runtime": 4123.1469, "train_tokens_per_second": 119.077 }, { "epoch": 0.0711264367816092, "grad_norm": 7.718113899230957, "learning_rate": 4.551378446115289e-06, "loss": 0.4594915807247162, "num_input_tokens_seen": 491268, "step": 1547, "train_runtime": 4125.1073, "train_tokens_per_second": 119.092 }, { "epoch": 0.07117241379310345, "grad_norm": 8.686179161071777, "learning_rate": 4.541353383458647e-06, "loss": 0.4476366937160492, "num_input_tokens_seen": 491532, "step": 1548, "train_runtime": 4127.073, "train_tokens_per_second": 119.099 }, { "epoch": 0.0712183908045977, "grad_norm": 8.165818214416504, "learning_rate": 4.531328320802005e-06, "loss": 0.3883603811264038, "num_input_tokens_seen": 491782, "step": 1549, "train_runtime": 4129.0348, "train_tokens_per_second": 119.103 }, { "epoch": 0.07126436781609195, "grad_norm": 7.7750701904296875, "learning_rate": 4.5213032581453635e-06, "loss": 0.49869048595428467, "num_input_tokens_seen": 492204, "step": 1550, "train_runtime": 4131.1119, "train_tokens_per_second": 119.146 }, { "epoch": 0.0713103448275862, "grad_norm": 7.940079689025879, "learning_rate": 4.511278195488722e-06, "loss": 0.4624294340610504, "num_input_tokens_seen": 492568, "step": 1551, "train_runtime": 4133.0921, "train_tokens_per_second": 119.177 }, { "epoch": 0.07135632183908046, "grad_norm": 8.412528038024902, "learning_rate": 4.5012531328320805e-06, "loss": 0.44974592328071594, "num_input_tokens_seen": 492824, "step": 1552, "train_runtime": 4135.0591, "train_tokens_per_second": 119.182 }, { "epoch": 0.07140229885057471, "grad_norm": 6.750128746032715, "learning_rate": 4.491228070175439e-06, "loss": 0.26358163356781006, "num_input_tokens_seen": 493048, "step": 1553, "train_runtime": 4136.9973, "train_tokens_per_second": 119.18 }, { "epoch": 0.07144827586206896, "grad_norm": 6.663267135620117, "learning_rate": 4.4812030075187975e-06, "loss": 0.3788079023361206, "num_input_tokens_seen": 493430, "step": 1554, "train_runtime": 4138.9818, "train_tokens_per_second": 119.215 }, { "epoch": 0.07149425287356322, "grad_norm": 7.058904647827148, "learning_rate": 4.471177944862156e-06, "loss": 0.42675814032554626, "num_input_tokens_seen": 493704, "step": 1555, "train_runtime": 4140.9285, "train_tokens_per_second": 119.225 }, { "epoch": 0.07154022988505747, "grad_norm": 8.06811237335205, "learning_rate": 4.461152882205514e-06, "loss": 0.5106055736541748, "num_input_tokens_seen": 494120, "step": 1556, "train_runtime": 4142.8977, "train_tokens_per_second": 119.269 }, { "epoch": 0.07158620689655172, "grad_norm": 8.179754257202148, "learning_rate": 4.451127819548873e-06, "loss": 0.3482970893383026, "num_input_tokens_seen": 494372, "step": 1557, "train_runtime": 4144.8359, "train_tokens_per_second": 119.274 }, { "epoch": 0.07163218390804597, "grad_norm": 8.394057273864746, "learning_rate": 4.4411027568922314e-06, "loss": 0.5103639960289001, "num_input_tokens_seen": 494650, "step": 1558, "train_runtime": 4146.7879, "train_tokens_per_second": 119.285 }, { "epoch": 0.07167816091954023, "grad_norm": 7.490317344665527, "learning_rate": 4.431077694235589e-06, "loss": 0.3746236264705658, "num_input_tokens_seen": 494908, "step": 1559, "train_runtime": 4148.7421, "train_tokens_per_second": 119.291 }, { "epoch": 0.07172413793103448, "grad_norm": 9.055501937866211, "learning_rate": 4.4210526315789476e-06, "loss": 0.39659398794174194, "num_input_tokens_seen": 495170, "step": 1560, "train_runtime": 4150.6871, "train_tokens_per_second": 119.298 }, { "epoch": 0.07177011494252873, "grad_norm": 8.413995742797852, "learning_rate": 4.411027568922306e-06, "loss": 0.48551711440086365, "num_input_tokens_seen": 495452, "step": 1561, "train_runtime": 4165.543, "train_tokens_per_second": 118.941 }, { "epoch": 0.07181609195402298, "grad_norm": 7.30216121673584, "learning_rate": 4.4010025062656645e-06, "loss": 0.47951072454452515, "num_input_tokens_seen": 495762, "step": 1562, "train_runtime": 4167.6294, "train_tokens_per_second": 118.955 }, { "epoch": 0.07186206896551724, "grad_norm": 8.080525398254395, "learning_rate": 4.390977443609023e-06, "loss": 0.31800565123558044, "num_input_tokens_seen": 495974, "step": 1563, "train_runtime": 4169.5551, "train_tokens_per_second": 118.951 }, { "epoch": 0.07190804597701149, "grad_norm": 7.3906354904174805, "learning_rate": 4.3809523809523815e-06, "loss": 0.4231320023536682, "num_input_tokens_seen": 496294, "step": 1564, "train_runtime": 4171.5046, "train_tokens_per_second": 118.972 }, { "epoch": 0.07195402298850574, "grad_norm": 6.36199951171875, "learning_rate": 4.370927318295739e-06, "loss": 0.36958885192871094, "num_input_tokens_seen": 496808, "step": 1565, "train_runtime": 4173.5072, "train_tokens_per_second": 119.038 }, { "epoch": 0.072, "grad_norm": 7.268085956573486, "learning_rate": 4.360902255639098e-06, "loss": 0.34520044922828674, "num_input_tokens_seen": 497078, "step": 1566, "train_runtime": 4175.4481, "train_tokens_per_second": 119.048 }, { "epoch": 0.07204597701149425, "grad_norm": 6.480217933654785, "learning_rate": 4.350877192982457e-06, "loss": 0.3157622218132019, "num_input_tokens_seen": 497356, "step": 1567, "train_runtime": 4177.4065, "train_tokens_per_second": 119.059 }, { "epoch": 0.0720919540229885, "grad_norm": 8.270898818969727, "learning_rate": 4.340852130325815e-06, "loss": 0.5205401182174683, "num_input_tokens_seen": 497640, "step": 1568, "train_runtime": 4179.3743, "train_tokens_per_second": 119.07 }, { "epoch": 0.07213793103448275, "grad_norm": 6.635157108306885, "learning_rate": 4.330827067669173e-06, "loss": 0.449776828289032, "num_input_tokens_seen": 498084, "step": 1569, "train_runtime": 4181.3625, "train_tokens_per_second": 119.12 }, { "epoch": 0.072183908045977, "grad_norm": 7.485076904296875, "learning_rate": 4.320802005012532e-06, "loss": 0.5208253860473633, "num_input_tokens_seen": 498412, "step": 1570, "train_runtime": 4183.3179, "train_tokens_per_second": 119.143 }, { "epoch": 0.07222988505747126, "grad_norm": 7.9057841300964355, "learning_rate": 4.31077694235589e-06, "loss": 0.4355557858943939, "num_input_tokens_seen": 498670, "step": 1571, "train_runtime": 4185.2576, "train_tokens_per_second": 119.149 }, { "epoch": 0.07227586206896552, "grad_norm": 7.838947296142578, "learning_rate": 4.3007518796992486e-06, "loss": 0.42538976669311523, "num_input_tokens_seen": 498932, "step": 1572, "train_runtime": 4187.2155, "train_tokens_per_second": 119.156 }, { "epoch": 0.07232183908045978, "grad_norm": 7.784214496612549, "learning_rate": 4.290726817042607e-06, "loss": 0.4852614402770996, "num_input_tokens_seen": 499206, "step": 1573, "train_runtime": 4189.2225, "train_tokens_per_second": 119.164 }, { "epoch": 0.07236781609195403, "grad_norm": 7.158159255981445, "learning_rate": 4.2807017543859656e-06, "loss": 0.3924868702888489, "num_input_tokens_seen": 499530, "step": 1574, "train_runtime": 4191.2055, "train_tokens_per_second": 119.185 }, { "epoch": 0.07241379310344828, "grad_norm": 8.813111305236816, "learning_rate": 4.270676691729323e-06, "loss": 0.560117244720459, "num_input_tokens_seen": 499810, "step": 1575, "train_runtime": 4193.2386, "train_tokens_per_second": 119.194 }, { "epoch": 0.07245977011494253, "grad_norm": 8.600942611694336, "learning_rate": 4.260651629072682e-06, "loss": 0.3756157159805298, "num_input_tokens_seen": 500204, "step": 1576, "train_runtime": 4195.2333, "train_tokens_per_second": 119.232 }, { "epoch": 0.07250574712643679, "grad_norm": 8.5283203125, "learning_rate": 4.250626566416041e-06, "loss": 0.38206595182418823, "num_input_tokens_seen": 500500, "step": 1577, "train_runtime": 4197.236, "train_tokens_per_second": 119.245 }, { "epoch": 0.07255172413793104, "grad_norm": 7.617363452911377, "learning_rate": 4.240601503759399e-06, "loss": 0.41842153668403625, "num_input_tokens_seen": 500790, "step": 1578, "train_runtime": 4199.2371, "train_tokens_per_second": 119.257 }, { "epoch": 0.07259770114942529, "grad_norm": 8.498720169067383, "learning_rate": 4.230576441102757e-06, "loss": 0.5772629380226135, "num_input_tokens_seen": 501118, "step": 1579, "train_runtime": 4201.1981, "train_tokens_per_second": 119.28 }, { "epoch": 0.07264367816091954, "grad_norm": 6.475655555725098, "learning_rate": 4.220551378446116e-06, "loss": 0.27916771173477173, "num_input_tokens_seen": 501364, "step": 1580, "train_runtime": 4203.1483, "train_tokens_per_second": 119.283 }, { "epoch": 0.0726896551724138, "grad_norm": 7.510998725891113, "learning_rate": 4.210526315789474e-06, "loss": 0.41097086668014526, "num_input_tokens_seen": 501670, "step": 1581, "train_runtime": 4205.1098, "train_tokens_per_second": 119.3 }, { "epoch": 0.07273563218390805, "grad_norm": 7.724368095397949, "learning_rate": 4.200501253132833e-06, "loss": 0.33816516399383545, "num_input_tokens_seen": 501914, "step": 1582, "train_runtime": 4207.054, "train_tokens_per_second": 119.303 }, { "epoch": 0.0727816091954023, "grad_norm": 8.160489082336426, "learning_rate": 4.190476190476191e-06, "loss": 0.38364431262016296, "num_input_tokens_seen": 502148, "step": 1583, "train_runtime": 4208.99, "train_tokens_per_second": 119.304 }, { "epoch": 0.07282758620689656, "grad_norm": 7.687803268432617, "learning_rate": 4.18045112781955e-06, "loss": 0.4136406183242798, "num_input_tokens_seen": 502454, "step": 1584, "train_runtime": 4210.9467, "train_tokens_per_second": 119.321 }, { "epoch": 0.07287356321839081, "grad_norm": 7.2596611976623535, "learning_rate": 4.170426065162907e-06, "loss": 0.4339594542980194, "num_input_tokens_seen": 502748, "step": 1585, "train_runtime": 4212.8987, "train_tokens_per_second": 119.335 }, { "epoch": 0.07291954022988506, "grad_norm": 8.879612922668457, "learning_rate": 4.160401002506266e-06, "loss": 0.5420070290565491, "num_input_tokens_seen": 503038, "step": 1586, "train_runtime": 4214.8341, "train_tokens_per_second": 119.349 }, { "epoch": 0.07296551724137931, "grad_norm": 7.438442707061768, "learning_rate": 4.150375939849624e-06, "loss": 0.5225954055786133, "num_input_tokens_seen": 503402, "step": 1587, "train_runtime": 4216.821, "train_tokens_per_second": 119.38 }, { "epoch": 0.07301149425287357, "grad_norm": 8.286493301391602, "learning_rate": 4.140350877192983e-06, "loss": 0.6506780385971069, "num_input_tokens_seen": 503698, "step": 1588, "train_runtime": 4218.7745, "train_tokens_per_second": 119.394 }, { "epoch": 0.07305747126436782, "grad_norm": 7.63776969909668, "learning_rate": 4.130325814536341e-06, "loss": 0.4458877742290497, "num_input_tokens_seen": 504018, "step": 1589, "train_runtime": 4220.799, "train_tokens_per_second": 119.413 }, { "epoch": 0.07310344827586207, "grad_norm": 6.316173553466797, "learning_rate": 4.1203007518797e-06, "loss": 0.27364295721054077, "num_input_tokens_seen": 504274, "step": 1590, "train_runtime": 4222.7448, "train_tokens_per_second": 119.419 }, { "epoch": 0.07314942528735632, "grad_norm": 8.226495742797852, "learning_rate": 4.110275689223058e-06, "loss": 0.5500906705856323, "num_input_tokens_seen": 504668, "step": 1591, "train_runtime": 4237.9847, "train_tokens_per_second": 119.082 }, { "epoch": 0.07319540229885058, "grad_norm": 11.585219383239746, "learning_rate": 4.100250626566417e-06, "loss": 0.5101352334022522, "num_input_tokens_seen": 504918, "step": 1592, "train_runtime": 4239.9262, "train_tokens_per_second": 119.087 }, { "epoch": 0.07324137931034483, "grad_norm": 6.878238201141357, "learning_rate": 4.090225563909775e-06, "loss": 0.4139741063117981, "num_input_tokens_seen": 505274, "step": 1593, "train_runtime": 4241.8798, "train_tokens_per_second": 119.116 }, { "epoch": 0.07328735632183908, "grad_norm": 7.619193077087402, "learning_rate": 4.080200501253133e-06, "loss": 0.4343482553958893, "num_input_tokens_seen": 505582, "step": 1594, "train_runtime": 4243.86, "train_tokens_per_second": 119.133 }, { "epoch": 0.07333333333333333, "grad_norm": 7.207488059997559, "learning_rate": 4.070175438596491e-06, "loss": 0.39172735810279846, "num_input_tokens_seen": 505842, "step": 1595, "train_runtime": 4245.8827, "train_tokens_per_second": 119.137 }, { "epoch": 0.07337931034482759, "grad_norm": 7.104700565338135, "learning_rate": 4.06015037593985e-06, "loss": 0.4126981794834137, "num_input_tokens_seen": 506134, "step": 1596, "train_runtime": 4247.8396, "train_tokens_per_second": 119.151 }, { "epoch": 0.07342528735632184, "grad_norm": 6.772775650024414, "learning_rate": 4.050125313283208e-06, "loss": 0.38334089517593384, "num_input_tokens_seen": 506386, "step": 1597, "train_runtime": 4249.7922, "train_tokens_per_second": 119.155 }, { "epoch": 0.07347126436781609, "grad_norm": 6.416538715362549, "learning_rate": 4.040100250626567e-06, "loss": 0.3199250400066376, "num_input_tokens_seen": 506644, "step": 1598, "train_runtime": 4251.7539, "train_tokens_per_second": 119.161 }, { "epoch": 0.07351724137931034, "grad_norm": 6.789169788360596, "learning_rate": 4.030075187969925e-06, "loss": 0.3942154049873352, "num_input_tokens_seen": 507002, "step": 1599, "train_runtime": 4253.7232, "train_tokens_per_second": 119.19 }, { "epoch": 0.0735632183908046, "grad_norm": 7.095794200897217, "learning_rate": 4.020050125313284e-06, "loss": 0.366854190826416, "num_input_tokens_seen": 507254, "step": 1600, "train_runtime": 4255.8338, "train_tokens_per_second": 119.19 }, { "epoch": 0.0735632183908046, "eval_loss": 1.6636571884155273, "eval_runtime": 54.8262, "eval_samples_per_second": 18.239, "eval_steps_per_second": 9.12, "num_input_tokens_seen": 507254, "step": 1600 }, { "epoch": 0.07360919540229885, "grad_norm": 6.588114261627197, "learning_rate": 4.010025062656641e-06, "loss": 0.3823266923427582, "num_input_tokens_seen": 507560, "step": 1601, "train_runtime": 4312.6649, "train_tokens_per_second": 117.691 }, { "epoch": 0.0736551724137931, "grad_norm": 7.267997741699219, "learning_rate": 4.000000000000001e-06, "loss": 0.5816208720207214, "num_input_tokens_seen": 508014, "step": 1602, "train_runtime": 4314.6651, "train_tokens_per_second": 117.741 }, { "epoch": 0.07370114942528735, "grad_norm": 7.822113990783691, "learning_rate": 3.989974937343359e-06, "loss": 0.47935065627098083, "num_input_tokens_seen": 508328, "step": 1603, "train_runtime": 4316.6245, "train_tokens_per_second": 117.761 }, { "epoch": 0.07374712643678161, "grad_norm": 7.869327545166016, "learning_rate": 3.979949874686717e-06, "loss": 0.40576744079589844, "num_input_tokens_seen": 508564, "step": 1604, "train_runtime": 4318.5603, "train_tokens_per_second": 117.762 }, { "epoch": 0.07379310344827586, "grad_norm": 6.4306416511535645, "learning_rate": 3.969924812030075e-06, "loss": 0.3773975372314453, "num_input_tokens_seen": 508880, "step": 1605, "train_runtime": 4320.4984, "train_tokens_per_second": 117.783 }, { "epoch": 0.07383908045977011, "grad_norm": 7.573537826538086, "learning_rate": 3.959899749373434e-06, "loss": 0.3697569966316223, "num_input_tokens_seen": 509146, "step": 1606, "train_runtime": 4322.4401, "train_tokens_per_second": 117.791 }, { "epoch": 0.07388505747126436, "grad_norm": 6.8335113525390625, "learning_rate": 3.949874686716792e-06, "loss": 0.39870771765708923, "num_input_tokens_seen": 509522, "step": 1607, "train_runtime": 4324.4145, "train_tokens_per_second": 117.825 }, { "epoch": 0.07393103448275862, "grad_norm": 7.273937225341797, "learning_rate": 3.939849624060151e-06, "loss": 0.5059205889701843, "num_input_tokens_seen": 509876, "step": 1608, "train_runtime": 4326.3915, "train_tokens_per_second": 117.852 }, { "epoch": 0.07397701149425287, "grad_norm": 6.84849739074707, "learning_rate": 3.929824561403509e-06, "loss": 0.4065139889717102, "num_input_tokens_seen": 510130, "step": 1609, "train_runtime": 4328.3341, "train_tokens_per_second": 117.858 }, { "epoch": 0.07402298850574712, "grad_norm": 7.5032243728637695, "learning_rate": 3.919799498746868e-06, "loss": 0.4133743643760681, "num_input_tokens_seen": 510448, "step": 1610, "train_runtime": 4330.2833, "train_tokens_per_second": 117.879 }, { "epoch": 0.07406896551724138, "grad_norm": 8.283543586730957, "learning_rate": 3.909774436090225e-06, "loss": 0.5078597068786621, "num_input_tokens_seen": 510720, "step": 1611, "train_runtime": 4332.2275, "train_tokens_per_second": 117.889 }, { "epoch": 0.07411494252873563, "grad_norm": 8.472081184387207, "learning_rate": 3.899749373433585e-06, "loss": 0.5025591254234314, "num_input_tokens_seen": 511014, "step": 1612, "train_runtime": 4334.1848, "train_tokens_per_second": 117.903 }, { "epoch": 0.07416091954022988, "grad_norm": 11.184776306152344, "learning_rate": 3.889724310776943e-06, "loss": 0.44690465927124023, "num_input_tokens_seen": 511288, "step": 1613, "train_runtime": 4336.1508, "train_tokens_per_second": 117.913 }, { "epoch": 0.07420689655172413, "grad_norm": 10.022826194763184, "learning_rate": 3.879699248120301e-06, "loss": 0.5291357040405273, "num_input_tokens_seen": 511618, "step": 1614, "train_runtime": 4338.1104, "train_tokens_per_second": 117.936 }, { "epoch": 0.07425287356321839, "grad_norm": 10.145757675170898, "learning_rate": 3.869674185463659e-06, "loss": 0.41287463903427124, "num_input_tokens_seen": 511884, "step": 1615, "train_runtime": 4340.0839, "train_tokens_per_second": 117.943 }, { "epoch": 0.07429885057471264, "grad_norm": 7.911931037902832, "learning_rate": 3.859649122807018e-06, "loss": 0.5255659818649292, "num_input_tokens_seen": 512226, "step": 1616, "train_runtime": 4342.034, "train_tokens_per_second": 117.969 }, { "epoch": 0.07434482758620689, "grad_norm": 10.514172554016113, "learning_rate": 3.849624060150376e-06, "loss": 0.6998154520988464, "num_input_tokens_seen": 512526, "step": 1617, "train_runtime": 4343.9812, "train_tokens_per_second": 117.985 }, { "epoch": 0.07439080459770114, "grad_norm": 7.514682292938232, "learning_rate": 3.839598997493735e-06, "loss": 0.4628090262413025, "num_input_tokens_seen": 512828, "step": 1618, "train_runtime": 4345.9288, "train_tokens_per_second": 118.002 }, { "epoch": 0.0744367816091954, "grad_norm": 7.007578372955322, "learning_rate": 3.829573934837093e-06, "loss": 0.45868954062461853, "num_input_tokens_seen": 513192, "step": 1619, "train_runtime": 4347.9134, "train_tokens_per_second": 118.032 }, { "epoch": 0.07448275862068965, "grad_norm": 8.817955017089844, "learning_rate": 3.819548872180452e-06, "loss": 0.3704671859741211, "num_input_tokens_seen": 513440, "step": 1620, "train_runtime": 4349.8462, "train_tokens_per_second": 118.036 }, { "epoch": 0.0745287356321839, "grad_norm": 7.611793041229248, "learning_rate": 3.80952380952381e-06, "loss": 0.5009437203407288, "num_input_tokens_seen": 513798, "step": 1621, "train_runtime": 4364.426, "train_tokens_per_second": 117.724 }, { "epoch": 0.07457471264367817, "grad_norm": 6.247671127319336, "learning_rate": 3.7994987468671683e-06, "loss": 0.40714675188064575, "num_input_tokens_seen": 514212, "step": 1622, "train_runtime": 4366.4808, "train_tokens_per_second": 117.763 }, { "epoch": 0.07462068965517242, "grad_norm": 6.984149932861328, "learning_rate": 3.789473684210527e-06, "loss": 0.5318334102630615, "num_input_tokens_seen": 514582, "step": 1623, "train_runtime": 4368.4774, "train_tokens_per_second": 117.794 }, { "epoch": 0.07466666666666667, "grad_norm": 23.912731170654297, "learning_rate": 3.779448621553885e-06, "loss": 0.42978233098983765, "num_input_tokens_seen": 514854, "step": 1624, "train_runtime": 4370.4241, "train_tokens_per_second": 117.804 }, { "epoch": 0.07471264367816093, "grad_norm": 7.788239479064941, "learning_rate": 3.7694235588972433e-06, "loss": 0.36474743485450745, "num_input_tokens_seen": 515114, "step": 1625, "train_runtime": 4372.4536, "train_tokens_per_second": 117.809 }, { "epoch": 0.07475862068965518, "grad_norm": 8.246030807495117, "learning_rate": 3.7593984962406014e-06, "loss": 0.48351597785949707, "num_input_tokens_seen": 515414, "step": 1626, "train_runtime": 4374.4976, "train_tokens_per_second": 117.822 }, { "epoch": 0.07480459770114943, "grad_norm": 7.160177707672119, "learning_rate": 3.7493734335839603e-06, "loss": 0.3814699649810791, "num_input_tokens_seen": 515734, "step": 1627, "train_runtime": 4376.5191, "train_tokens_per_second": 117.841 }, { "epoch": 0.07485057471264368, "grad_norm": 9.433629035949707, "learning_rate": 3.739348370927319e-06, "loss": 0.4707894027233124, "num_input_tokens_seen": 516038, "step": 1628, "train_runtime": 4378.4914, "train_tokens_per_second": 117.857 }, { "epoch": 0.07489655172413794, "grad_norm": 7.79624080657959, "learning_rate": 3.729323308270677e-06, "loss": 0.32810497283935547, "num_input_tokens_seen": 516298, "step": 1629, "train_runtime": 4380.4961, "train_tokens_per_second": 117.863 }, { "epoch": 0.07494252873563219, "grad_norm": 7.606733322143555, "learning_rate": 3.7192982456140354e-06, "loss": 0.39508774876594543, "num_input_tokens_seen": 516614, "step": 1630, "train_runtime": 4382.4569, "train_tokens_per_second": 117.882 }, { "epoch": 0.07498850574712644, "grad_norm": 8.296076774597168, "learning_rate": 3.7092731829573934e-06, "loss": 0.3836243152618408, "num_input_tokens_seen": 516862, "step": 1631, "train_runtime": 4384.3844, "train_tokens_per_second": 117.887 }, { "epoch": 0.0750344827586207, "grad_norm": 7.348832130432129, "learning_rate": 3.6992481203007523e-06, "loss": 0.4283863306045532, "num_input_tokens_seen": 517120, "step": 1632, "train_runtime": 4386.3302, "train_tokens_per_second": 117.894 }, { "epoch": 0.07508045977011495, "grad_norm": 7.960624694824219, "learning_rate": 3.689223057644111e-06, "loss": 0.5945356488227844, "num_input_tokens_seen": 517486, "step": 1633, "train_runtime": 4388.3672, "train_tokens_per_second": 117.922 }, { "epoch": 0.0751264367816092, "grad_norm": 7.2380170822143555, "learning_rate": 3.679197994987469e-06, "loss": 0.38955235481262207, "num_input_tokens_seen": 517754, "step": 1634, "train_runtime": 4390.3855, "train_tokens_per_second": 117.929 }, { "epoch": 0.07517241379310345, "grad_norm": 7.709038734436035, "learning_rate": 3.6691729323308274e-06, "loss": 0.48962312936782837, "num_input_tokens_seen": 518088, "step": 1635, "train_runtime": 4392.3413, "train_tokens_per_second": 117.953 }, { "epoch": 0.0752183908045977, "grad_norm": 10.929262161254883, "learning_rate": 3.6591478696741854e-06, "loss": 0.4196699857711792, "num_input_tokens_seen": 518334, "step": 1636, "train_runtime": 4394.2835, "train_tokens_per_second": 117.956 }, { "epoch": 0.07526436781609196, "grad_norm": 7.947827339172363, "learning_rate": 3.6491228070175443e-06, "loss": 0.386614054441452, "num_input_tokens_seen": 518610, "step": 1637, "train_runtime": 4396.2272, "train_tokens_per_second": 117.967 }, { "epoch": 0.07531034482758621, "grad_norm": 7.691780090332031, "learning_rate": 3.639097744360903e-06, "loss": 0.40818464756011963, "num_input_tokens_seen": 518904, "step": 1638, "train_runtime": 4398.1819, "train_tokens_per_second": 117.981 }, { "epoch": 0.07535632183908046, "grad_norm": 7.336256980895996, "learning_rate": 3.629072681704261e-06, "loss": 0.432528018951416, "num_input_tokens_seen": 519132, "step": 1639, "train_runtime": 4400.1363, "train_tokens_per_second": 117.981 }, { "epoch": 0.07540229885057471, "grad_norm": 7.535099506378174, "learning_rate": 3.6190476190476194e-06, "loss": 0.45522022247314453, "num_input_tokens_seen": 519504, "step": 1640, "train_runtime": 4402.1352, "train_tokens_per_second": 118.012 }, { "epoch": 0.07544827586206897, "grad_norm": 7.481330871582031, "learning_rate": 3.6090225563909775e-06, "loss": 0.37103793025016785, "num_input_tokens_seen": 519748, "step": 1641, "train_runtime": 4404.0998, "train_tokens_per_second": 118.015 }, { "epoch": 0.07549425287356322, "grad_norm": 7.335155010223389, "learning_rate": 3.5989974937343364e-06, "loss": 0.4369334578514099, "num_input_tokens_seen": 519970, "step": 1642, "train_runtime": 4406.0395, "train_tokens_per_second": 118.013 }, { "epoch": 0.07554022988505747, "grad_norm": 6.278005599975586, "learning_rate": 3.588972431077695e-06, "loss": 0.4030069410800934, "num_input_tokens_seen": 520270, "step": 1643, "train_runtime": 4407.9919, "train_tokens_per_second": 118.029 }, { "epoch": 0.07558620689655172, "grad_norm": 6.86829137802124, "learning_rate": 3.578947368421053e-06, "loss": 0.43802517652511597, "num_input_tokens_seen": 520528, "step": 1644, "train_runtime": 4409.9382, "train_tokens_per_second": 118.035 }, { "epoch": 0.07563218390804598, "grad_norm": 7.912787437438965, "learning_rate": 3.5689223057644114e-06, "loss": 0.4219006896018982, "num_input_tokens_seen": 520860, "step": 1645, "train_runtime": 4411.8938, "train_tokens_per_second": 118.058 }, { "epoch": 0.07567816091954023, "grad_norm": 6.702023506164551, "learning_rate": 3.5588972431077695e-06, "loss": 0.37762436270713806, "num_input_tokens_seen": 521168, "step": 1646, "train_runtime": 4413.9059, "train_tokens_per_second": 118.074 }, { "epoch": 0.07572413793103448, "grad_norm": 8.325960159301758, "learning_rate": 3.5488721804511284e-06, "loss": 0.5221037268638611, "num_input_tokens_seen": 521564, "step": 1647, "train_runtime": 4415.9159, "train_tokens_per_second": 118.11 }, { "epoch": 0.07577011494252874, "grad_norm": 7.025114059448242, "learning_rate": 3.5388471177944864e-06, "loss": 0.4202582538127899, "num_input_tokens_seen": 521998, "step": 1648, "train_runtime": 4417.9148, "train_tokens_per_second": 118.155 }, { "epoch": 0.07581609195402299, "grad_norm": 8.078812599182129, "learning_rate": 3.528822055137845e-06, "loss": 0.45326465368270874, "num_input_tokens_seen": 522346, "step": 1649, "train_runtime": 4419.8877, "train_tokens_per_second": 118.181 }, { "epoch": 0.07586206896551724, "grad_norm": 7.274520397186279, "learning_rate": 3.5187969924812034e-06, "loss": 0.4773089289665222, "num_input_tokens_seen": 522732, "step": 1650, "train_runtime": 4421.8721, "train_tokens_per_second": 118.215 }, { "epoch": 0.07590804597701149, "grad_norm": 6.407050609588623, "learning_rate": 3.5087719298245615e-06, "loss": 0.38265374302864075, "num_input_tokens_seen": 523048, "step": 1651, "train_runtime": 4436.9042, "train_tokens_per_second": 117.886 }, { "epoch": 0.07595402298850575, "grad_norm": 7.074411392211914, "learning_rate": 3.4987468671679204e-06, "loss": 0.33349496126174927, "num_input_tokens_seen": 523358, "step": 1652, "train_runtime": 4438.9778, "train_tokens_per_second": 117.901 }, { "epoch": 0.076, "grad_norm": 6.719621658325195, "learning_rate": 3.4887218045112785e-06, "loss": 0.4396601915359497, "num_input_tokens_seen": 524056, "step": 1653, "train_runtime": 4441.0833, "train_tokens_per_second": 118.002 }, { "epoch": 0.07604597701149425, "grad_norm": 8.060017585754395, "learning_rate": 3.478696741854637e-06, "loss": 0.4098191261291504, "num_input_tokens_seen": 524378, "step": 1654, "train_runtime": 4443.3098, "train_tokens_per_second": 118.015 }, { "epoch": 0.0760919540229885, "grad_norm": 8.207612991333008, "learning_rate": 3.468671679197995e-06, "loss": 0.3707464933395386, "num_input_tokens_seen": 524608, "step": 1655, "train_runtime": 4445.3321, "train_tokens_per_second": 118.013 }, { "epoch": 0.07613793103448276, "grad_norm": 7.073892116546631, "learning_rate": 3.4586466165413535e-06, "loss": 0.4043232500553131, "num_input_tokens_seen": 524852, "step": 1656, "train_runtime": 4447.3285, "train_tokens_per_second": 118.015 }, { "epoch": 0.07618390804597701, "grad_norm": 13.12764835357666, "learning_rate": 3.4486215538847124e-06, "loss": 0.5430985689163208, "num_input_tokens_seen": 525186, "step": 1657, "train_runtime": 4449.3721, "train_tokens_per_second": 118.036 }, { "epoch": 0.07622988505747126, "grad_norm": 7.269232273101807, "learning_rate": 3.4385964912280705e-06, "loss": 0.5189374089241028, "num_input_tokens_seen": 525508, "step": 1658, "train_runtime": 4451.3422, "train_tokens_per_second": 118.056 }, { "epoch": 0.07627586206896551, "grad_norm": 9.399940490722656, "learning_rate": 3.428571428571429e-06, "loss": 0.6738297939300537, "num_input_tokens_seen": 525862, "step": 1659, "train_runtime": 4453.3401, "train_tokens_per_second": 118.083 }, { "epoch": 0.07632183908045977, "grad_norm": 7.022154331207275, "learning_rate": 3.418546365914787e-06, "loss": 0.34696778655052185, "num_input_tokens_seen": 526126, "step": 1660, "train_runtime": 4455.305, "train_tokens_per_second": 118.09 }, { "epoch": 0.07636781609195402, "grad_norm": 7.5776591300964355, "learning_rate": 3.4085213032581455e-06, "loss": 0.41206005215644836, "num_input_tokens_seen": 526376, "step": 1661, "train_runtime": 4457.2725, "train_tokens_per_second": 118.094 }, { "epoch": 0.07641379310344827, "grad_norm": 9.169903755187988, "learning_rate": 3.3984962406015044e-06, "loss": 0.470018595457077, "num_input_tokens_seen": 526666, "step": 1662, "train_runtime": 4459.2584, "train_tokens_per_second": 118.106 }, { "epoch": 0.07645977011494252, "grad_norm": 10.000397682189941, "learning_rate": 3.3884711779448625e-06, "loss": 0.6311056017875671, "num_input_tokens_seen": 526962, "step": 1663, "train_runtime": 4461.1953, "train_tokens_per_second": 118.121 }, { "epoch": 0.07650574712643678, "grad_norm": 7.303699970245361, "learning_rate": 3.378446115288221e-06, "loss": 0.43634146451950073, "num_input_tokens_seen": 527412, "step": 1664, "train_runtime": 4463.197, "train_tokens_per_second": 118.169 }, { "epoch": 0.07655172413793103, "grad_norm": 7.92708158493042, "learning_rate": 3.368421052631579e-06, "loss": 0.5328547954559326, "num_input_tokens_seen": 527810, "step": 1665, "train_runtime": 4465.1683, "train_tokens_per_second": 118.206 }, { "epoch": 0.07659770114942528, "grad_norm": 8.074692726135254, "learning_rate": 3.3583959899749375e-06, "loss": 0.4190375804901123, "num_input_tokens_seen": 528106, "step": 1666, "train_runtime": 4467.1239, "train_tokens_per_second": 118.221 }, { "epoch": 0.07664367816091953, "grad_norm": 6.452220916748047, "learning_rate": 3.3483709273182964e-06, "loss": 0.35974109172821045, "num_input_tokens_seen": 528402, "step": 1667, "train_runtime": 4469.0837, "train_tokens_per_second": 118.235 }, { "epoch": 0.07668965517241379, "grad_norm": 8.29507064819336, "learning_rate": 3.3383458646616545e-06, "loss": 0.4307975172996521, "num_input_tokens_seen": 528720, "step": 1668, "train_runtime": 4471.0318, "train_tokens_per_second": 118.255 }, { "epoch": 0.07673563218390804, "grad_norm": 7.829823017120361, "learning_rate": 3.328320802005013e-06, "loss": 0.582558274269104, "num_input_tokens_seen": 529026, "step": 1669, "train_runtime": 4472.9836, "train_tokens_per_second": 118.271 }, { "epoch": 0.07678160919540229, "grad_norm": 12.883645057678223, "learning_rate": 3.318295739348371e-06, "loss": 0.3684832751750946, "num_input_tokens_seen": 529286, "step": 1670, "train_runtime": 4474.9147, "train_tokens_per_second": 118.278 }, { "epoch": 0.07682758620689654, "grad_norm": 6.940089225769043, "learning_rate": 3.3082706766917295e-06, "loss": 0.3522677421569824, "num_input_tokens_seen": 529572, "step": 1671, "train_runtime": 4476.8712, "train_tokens_per_second": 118.291 }, { "epoch": 0.07687356321839081, "grad_norm": 10.376507759094238, "learning_rate": 3.2982456140350885e-06, "loss": 0.4347451329231262, "num_input_tokens_seen": 529850, "step": 1672, "train_runtime": 4478.8345, "train_tokens_per_second": 118.301 }, { "epoch": 0.07691954022988506, "grad_norm": 7.491230010986328, "learning_rate": 3.2882205513784465e-06, "loss": 0.4169405400753021, "num_input_tokens_seen": 530132, "step": 1673, "train_runtime": 4480.8406, "train_tokens_per_second": 118.311 }, { "epoch": 0.07696551724137932, "grad_norm": 7.8009843826293945, "learning_rate": 3.278195488721805e-06, "loss": 0.45866137742996216, "num_input_tokens_seen": 530396, "step": 1674, "train_runtime": 4482.8218, "train_tokens_per_second": 118.317 }, { "epoch": 0.07701149425287357, "grad_norm": 7.69118070602417, "learning_rate": 3.268170426065163e-06, "loss": 0.47137773036956787, "num_input_tokens_seen": 530702, "step": 1675, "train_runtime": 4484.827, "train_tokens_per_second": 118.333 }, { "epoch": 0.07705747126436782, "grad_norm": 9.579022407531738, "learning_rate": 3.2581453634085216e-06, "loss": 0.3288058042526245, "num_input_tokens_seen": 530946, "step": 1676, "train_runtime": 4486.777, "train_tokens_per_second": 118.336 }, { "epoch": 0.07710344827586207, "grad_norm": 7.989346981048584, "learning_rate": 3.24812030075188e-06, "loss": 0.4825642704963684, "num_input_tokens_seen": 531368, "step": 1677, "train_runtime": 4488.8358, "train_tokens_per_second": 118.375 }, { "epoch": 0.07714942528735633, "grad_norm": 8.046740531921387, "learning_rate": 3.2380952380952385e-06, "loss": 0.4609355032444, "num_input_tokens_seen": 531716, "step": 1678, "train_runtime": 4490.8579, "train_tokens_per_second": 118.4 }, { "epoch": 0.07719540229885058, "grad_norm": 7.730014324188232, "learning_rate": 3.2280701754385966e-06, "loss": 0.40114837884902954, "num_input_tokens_seen": 531972, "step": 1679, "train_runtime": 4492.826, "train_tokens_per_second": 118.405 }, { "epoch": 0.07724137931034483, "grad_norm": 8.52988338470459, "learning_rate": 3.218045112781955e-06, "loss": 0.4026782810688019, "num_input_tokens_seen": 532288, "step": 1680, "train_runtime": 4494.7758, "train_tokens_per_second": 118.424 }, { "epoch": 0.07728735632183908, "grad_norm": 8.861639976501465, "learning_rate": 3.2080200501253136e-06, "loss": 0.499417781829834, "num_input_tokens_seen": 532704, "step": 1681, "train_runtime": 4509.2897, "train_tokens_per_second": 118.135 }, { "epoch": 0.07733333333333334, "grad_norm": 8.764716148376465, "learning_rate": 3.197994987468672e-06, "loss": 0.4563250243663788, "num_input_tokens_seen": 533036, "step": 1682, "train_runtime": 4511.2534, "train_tokens_per_second": 118.157 }, { "epoch": 0.07737931034482759, "grad_norm": 6.531656265258789, "learning_rate": 3.1879699248120305e-06, "loss": 0.3374243974685669, "num_input_tokens_seen": 533296, "step": 1683, "train_runtime": 4513.2216, "train_tokens_per_second": 118.163 }, { "epoch": 0.07742528735632184, "grad_norm": 7.941148281097412, "learning_rate": 3.1779448621553886e-06, "loss": 0.413734495639801, "num_input_tokens_seen": 533566, "step": 1684, "train_runtime": 4515.2062, "train_tokens_per_second": 118.171 }, { "epoch": 0.0774712643678161, "grad_norm": 8.646973609924316, "learning_rate": 3.167919799498747e-06, "loss": 0.44844621419906616, "num_input_tokens_seen": 533830, "step": 1685, "train_runtime": 4517.1983, "train_tokens_per_second": 118.177 }, { "epoch": 0.07751724137931035, "grad_norm": 8.277411460876465, "learning_rate": 3.157894736842105e-06, "loss": 0.4859049618244171, "num_input_tokens_seen": 534216, "step": 1686, "train_runtime": 4519.2305, "train_tokens_per_second": 118.21 }, { "epoch": 0.0775632183908046, "grad_norm": 9.720200538635254, "learning_rate": 3.147869674185464e-06, "loss": 0.582287609577179, "num_input_tokens_seen": 534482, "step": 1687, "train_runtime": 4521.1968, "train_tokens_per_second": 118.217 }, { "epoch": 0.07760919540229885, "grad_norm": 8.369261741638184, "learning_rate": 3.1378446115288226e-06, "loss": 0.35591331124305725, "num_input_tokens_seen": 534746, "step": 1688, "train_runtime": 4523.1536, "train_tokens_per_second": 118.224 }, { "epoch": 0.0776551724137931, "grad_norm": 6.724172115325928, "learning_rate": 3.1278195488721806e-06, "loss": 0.5251051783561707, "num_input_tokens_seen": 535262, "step": 1689, "train_runtime": 4525.1722, "train_tokens_per_second": 118.285 }, { "epoch": 0.07770114942528736, "grad_norm": 8.139476776123047, "learning_rate": 3.117794486215539e-06, "loss": 0.4429723620414734, "num_input_tokens_seen": 535552, "step": 1690, "train_runtime": 4527.1279, "train_tokens_per_second": 118.298 }, { "epoch": 0.07774712643678161, "grad_norm": 7.223095417022705, "learning_rate": 3.107769423558897e-06, "loss": 0.4311490058898926, "num_input_tokens_seen": 535890, "step": 1691, "train_runtime": 4529.1251, "train_tokens_per_second": 118.321 }, { "epoch": 0.07779310344827586, "grad_norm": 8.413722038269043, "learning_rate": 3.097744360902256e-06, "loss": 0.5396718978881836, "num_input_tokens_seen": 536276, "step": 1692, "train_runtime": 4531.1699, "train_tokens_per_second": 118.353 }, { "epoch": 0.07783908045977012, "grad_norm": 8.579139709472656, "learning_rate": 3.0877192982456146e-06, "loss": 0.5883654356002808, "num_input_tokens_seen": 536528, "step": 1693, "train_runtime": 4533.1482, "train_tokens_per_second": 118.357 }, { "epoch": 0.07788505747126437, "grad_norm": 9.403660774230957, "learning_rate": 3.0776942355889726e-06, "loss": 0.4726146459579468, "num_input_tokens_seen": 536870, "step": 1694, "train_runtime": 4535.1176, "train_tokens_per_second": 118.381 }, { "epoch": 0.07793103448275862, "grad_norm": 9.025625228881836, "learning_rate": 3.067669172932331e-06, "loss": 0.545159101486206, "num_input_tokens_seen": 537198, "step": 1695, "train_runtime": 4537.1696, "train_tokens_per_second": 118.399 }, { "epoch": 0.07797701149425287, "grad_norm": 7.852901935577393, "learning_rate": 3.057644110275689e-06, "loss": 0.44690242409706116, "num_input_tokens_seen": 537492, "step": 1696, "train_runtime": 4539.1088, "train_tokens_per_second": 118.414 }, { "epoch": 0.07802298850574713, "grad_norm": 9.632786750793457, "learning_rate": 3.047619047619048e-06, "loss": 0.3916051983833313, "num_input_tokens_seen": 537736, "step": 1697, "train_runtime": 4541.0476, "train_tokens_per_second": 118.417 }, { "epoch": 0.07806896551724138, "grad_norm": 6.765559673309326, "learning_rate": 3.0375939849624066e-06, "loss": 0.3171115815639496, "num_input_tokens_seen": 537988, "step": 1698, "train_runtime": 4542.9782, "train_tokens_per_second": 118.422 }, { "epoch": 0.07811494252873563, "grad_norm": 7.956576824188232, "learning_rate": 3.0275689223057647e-06, "loss": 0.38876232504844666, "num_input_tokens_seen": 538274, "step": 1699, "train_runtime": 4544.9399, "train_tokens_per_second": 118.434 }, { "epoch": 0.07816091954022988, "grad_norm": 8.61601734161377, "learning_rate": 3.017543859649123e-06, "loss": 0.4542631506919861, "num_input_tokens_seen": 538530, "step": 1700, "train_runtime": 4546.8849, "train_tokens_per_second": 118.439 }, { "epoch": 0.07820689655172414, "grad_norm": 7.048073768615723, "learning_rate": 3.007518796992481e-06, "loss": 0.4090226888656616, "num_input_tokens_seen": 538766, "step": 1701, "train_runtime": 4548.8137, "train_tokens_per_second": 118.441 }, { "epoch": 0.07825287356321839, "grad_norm": 7.331066608428955, "learning_rate": 2.9974937343358397e-06, "loss": 0.31398913264274597, "num_input_tokens_seen": 539010, "step": 1702, "train_runtime": 4550.7477, "train_tokens_per_second": 118.444 }, { "epoch": 0.07829885057471264, "grad_norm": 7.632887840270996, "learning_rate": 2.9874686716791986e-06, "loss": 0.29063817858695984, "num_input_tokens_seen": 539254, "step": 1703, "train_runtime": 4552.6852, "train_tokens_per_second": 118.447 }, { "epoch": 0.0783448275862069, "grad_norm": 6.532099723815918, "learning_rate": 2.9774436090225567e-06, "loss": 0.36357584595680237, "num_input_tokens_seen": 539512, "step": 1704, "train_runtime": 4554.6408, "train_tokens_per_second": 118.453 }, { "epoch": 0.07839080459770115, "grad_norm": 6.803408145904541, "learning_rate": 2.967418546365915e-06, "loss": 0.36048248410224915, "num_input_tokens_seen": 539836, "step": 1705, "train_runtime": 4556.5982, "train_tokens_per_second": 118.473 }, { "epoch": 0.0784367816091954, "grad_norm": 7.635514259338379, "learning_rate": 2.9573934837092732e-06, "loss": 0.37317177653312683, "num_input_tokens_seen": 540176, "step": 1706, "train_runtime": 4558.5535, "train_tokens_per_second": 118.497 }, { "epoch": 0.07848275862068965, "grad_norm": 7.402206897735596, "learning_rate": 2.9473684210526317e-06, "loss": 0.32631269097328186, "num_input_tokens_seen": 540440, "step": 1707, "train_runtime": 4560.5148, "train_tokens_per_second": 118.504 }, { "epoch": 0.0785287356321839, "grad_norm": 7.177687168121338, "learning_rate": 2.93734335839599e-06, "loss": 0.31662577390670776, "num_input_tokens_seen": 540724, "step": 1708, "train_runtime": 4562.554, "train_tokens_per_second": 118.513 }, { "epoch": 0.07857471264367816, "grad_norm": 7.495624542236328, "learning_rate": 2.9273182957393487e-06, "loss": 0.46745815873146057, "num_input_tokens_seen": 541018, "step": 1709, "train_runtime": 4564.5109, "train_tokens_per_second": 118.527 }, { "epoch": 0.07862068965517241, "grad_norm": 7.3868327140808105, "learning_rate": 2.9172932330827068e-06, "loss": 0.4397212266921997, "num_input_tokens_seen": 541326, "step": 1710, "train_runtime": 4566.4711, "train_tokens_per_second": 118.544 }, { "epoch": 0.07866666666666666, "grad_norm": 6.463175296783447, "learning_rate": 2.9072681704260652e-06, "loss": 0.35786816477775574, "num_input_tokens_seen": 541606, "step": 1711, "train_runtime": 4580.9489, "train_tokens_per_second": 118.23 }, { "epoch": 0.07871264367816092, "grad_norm": 6.365063190460205, "learning_rate": 2.8972431077694237e-06, "loss": 0.36957696080207825, "num_input_tokens_seen": 541880, "step": 1712, "train_runtime": 4582.9043, "train_tokens_per_second": 118.239 }, { "epoch": 0.07875862068965517, "grad_norm": 7.89999532699585, "learning_rate": 2.8872180451127822e-06, "loss": 0.5105806589126587, "num_input_tokens_seen": 542188, "step": 1713, "train_runtime": 4584.8725, "train_tokens_per_second": 118.256 }, { "epoch": 0.07880459770114942, "grad_norm": 7.104886054992676, "learning_rate": 2.8771929824561407e-06, "loss": 0.42578667402267456, "num_input_tokens_seen": 542484, "step": 1714, "train_runtime": 4586.7943, "train_tokens_per_second": 118.271 }, { "epoch": 0.07885057471264367, "grad_norm": 8.263605117797852, "learning_rate": 2.8671679197994988e-06, "loss": 0.5237813591957092, "num_input_tokens_seen": 542846, "step": 1715, "train_runtime": 4588.7706, "train_tokens_per_second": 118.299 }, { "epoch": 0.07889655172413793, "grad_norm": 9.0348482131958, "learning_rate": 2.8571428571428573e-06, "loss": 0.4177630543708801, "num_input_tokens_seen": 543206, "step": 1716, "train_runtime": 4590.9383, "train_tokens_per_second": 118.321 }, { "epoch": 0.07894252873563218, "grad_norm": 8.561115264892578, "learning_rate": 2.8471177944862153e-06, "loss": 0.5585188865661621, "num_input_tokens_seen": 543490, "step": 1717, "train_runtime": 4593.0554, "train_tokens_per_second": 118.329 }, { "epoch": 0.07898850574712643, "grad_norm": 7.145869255065918, "learning_rate": 2.8370927318295742e-06, "loss": 0.40125787258148193, "num_input_tokens_seen": 543936, "step": 1718, "train_runtime": 4595.0332, "train_tokens_per_second": 118.375 }, { "epoch": 0.07903448275862068, "grad_norm": 6.850518226623535, "learning_rate": 2.8270676691729327e-06, "loss": 0.3150305449962616, "num_input_tokens_seen": 544194, "step": 1719, "train_runtime": 4596.9835, "train_tokens_per_second": 118.381 }, { "epoch": 0.07908045977011494, "grad_norm": 8.219104766845703, "learning_rate": 2.8170426065162908e-06, "loss": 0.4087820053100586, "num_input_tokens_seen": 544448, "step": 1720, "train_runtime": 4598.9388, "train_tokens_per_second": 118.386 }, { "epoch": 0.07912643678160919, "grad_norm": 7.8992133140563965, "learning_rate": 2.8070175438596493e-06, "loss": 0.47887152433395386, "num_input_tokens_seen": 544712, "step": 1721, "train_runtime": 4600.8891, "train_tokens_per_second": 118.393 }, { "epoch": 0.07917241379310345, "grad_norm": 7.767656326293945, "learning_rate": 2.7969924812030073e-06, "loss": 0.4307166039943695, "num_input_tokens_seen": 544992, "step": 1722, "train_runtime": 4602.8681, "train_tokens_per_second": 118.403 }, { "epoch": 0.07921839080459771, "grad_norm": 6.98056697845459, "learning_rate": 2.7869674185463662e-06, "loss": 0.38568735122680664, "num_input_tokens_seen": 545300, "step": 1723, "train_runtime": 4604.8485, "train_tokens_per_second": 118.419 }, { "epoch": 0.07926436781609196, "grad_norm": 7.0472259521484375, "learning_rate": 2.7769423558897247e-06, "loss": 0.43514782190322876, "num_input_tokens_seen": 545594, "step": 1724, "train_runtime": 4606.7906, "train_tokens_per_second": 118.433 }, { "epoch": 0.07931034482758621, "grad_norm": 6.9541120529174805, "learning_rate": 2.766917293233083e-06, "loss": 0.399605393409729, "num_input_tokens_seen": 545880, "step": 1725, "train_runtime": 4608.8016, "train_tokens_per_second": 118.443 }, { "epoch": 0.07935632183908047, "grad_norm": 8.352391242980957, "learning_rate": 2.7568922305764413e-06, "loss": 0.43901270627975464, "num_input_tokens_seen": 546150, "step": 1726, "train_runtime": 4610.7567, "train_tokens_per_second": 118.451 }, { "epoch": 0.07940229885057472, "grad_norm": 6.75828218460083, "learning_rate": 2.7468671679197994e-06, "loss": 0.3787592053413391, "num_input_tokens_seen": 546404, "step": 1727, "train_runtime": 4612.7529, "train_tokens_per_second": 118.455 }, { "epoch": 0.07944827586206897, "grad_norm": 8.66209888458252, "learning_rate": 2.7368421052631583e-06, "loss": 0.4774472117424011, "num_input_tokens_seen": 546698, "step": 1728, "train_runtime": 4614.7464, "train_tokens_per_second": 118.468 }, { "epoch": 0.07949425287356322, "grad_norm": 6.795530796051025, "learning_rate": 2.7268170426065167e-06, "loss": 0.3278595805168152, "num_input_tokens_seen": 546910, "step": 1729, "train_runtime": 4616.74, "train_tokens_per_second": 118.462 }, { "epoch": 0.07954022988505748, "grad_norm": 8.187334060668945, "learning_rate": 2.716791979949875e-06, "loss": 0.49100738763809204, "num_input_tokens_seen": 547170, "step": 1730, "train_runtime": 4618.6763, "train_tokens_per_second": 118.469 }, { "epoch": 0.07958620689655173, "grad_norm": 7.767502784729004, "learning_rate": 2.7067669172932333e-06, "loss": 0.39085710048675537, "num_input_tokens_seen": 547484, "step": 1731, "train_runtime": 4620.6439, "train_tokens_per_second": 118.487 }, { "epoch": 0.07963218390804598, "grad_norm": 7.032953262329102, "learning_rate": 2.6967418546365914e-06, "loss": 0.3649653196334839, "num_input_tokens_seen": 547756, "step": 1732, "train_runtime": 4622.6777, "train_tokens_per_second": 118.493 }, { "epoch": 0.07967816091954023, "grad_norm": 7.271172046661377, "learning_rate": 2.6867167919799503e-06, "loss": 0.26579615473747253, "num_input_tokens_seen": 547982, "step": 1733, "train_runtime": 4624.7391, "train_tokens_per_second": 118.489 }, { "epoch": 0.07972413793103449, "grad_norm": 7.960947513580322, "learning_rate": 2.6766917293233088e-06, "loss": 0.47854000329971313, "num_input_tokens_seen": 548272, "step": 1734, "train_runtime": 4626.71, "train_tokens_per_second": 118.501 }, { "epoch": 0.07977011494252874, "grad_norm": 8.42829418182373, "learning_rate": 2.666666666666667e-06, "loss": 0.5312048196792603, "num_input_tokens_seen": 548510, "step": 1735, "train_runtime": 4628.7365, "train_tokens_per_second": 118.501 }, { "epoch": 0.07981609195402299, "grad_norm": 6.893427848815918, "learning_rate": 2.6566416040100253e-06, "loss": 0.4053395390510559, "num_input_tokens_seen": 548808, "step": 1736, "train_runtime": 4630.6921, "train_tokens_per_second": 118.515 }, { "epoch": 0.07986206896551724, "grad_norm": 7.288859844207764, "learning_rate": 2.6466165413533834e-06, "loss": 0.3709200620651245, "num_input_tokens_seen": 549078, "step": 1737, "train_runtime": 4632.6999, "train_tokens_per_second": 118.522 }, { "epoch": 0.0799080459770115, "grad_norm": 7.377291679382324, "learning_rate": 2.6365914786967423e-06, "loss": 0.3193652331829071, "num_input_tokens_seen": 549364, "step": 1738, "train_runtime": 4634.6636, "train_tokens_per_second": 118.534 }, { "epoch": 0.07995402298850575, "grad_norm": 6.757475852966309, "learning_rate": 2.6265664160401004e-06, "loss": 0.4178864657878876, "num_input_tokens_seen": 549708, "step": 1739, "train_runtime": 4636.6359, "train_tokens_per_second": 118.558 }, { "epoch": 0.08, "grad_norm": 10.461713790893555, "learning_rate": 2.616541353383459e-06, "loss": 0.5244767665863037, "num_input_tokens_seen": 549980, "step": 1740, "train_runtime": 4638.6478, "train_tokens_per_second": 118.565 }, { "epoch": 0.08004597701149425, "grad_norm": 7.775877475738525, "learning_rate": 2.606516290726817e-06, "loss": 0.3699747622013092, "num_input_tokens_seen": 550286, "step": 1741, "train_runtime": 4652.6103, "train_tokens_per_second": 118.275 }, { "epoch": 0.0800919540229885, "grad_norm": 7.458606719970703, "learning_rate": 2.5964912280701754e-06, "loss": 0.48922139406204224, "num_input_tokens_seen": 550842, "step": 1742, "train_runtime": 4654.6736, "train_tokens_per_second": 118.342 }, { "epoch": 0.08013793103448276, "grad_norm": 7.654501914978027, "learning_rate": 2.5864661654135343e-06, "loss": 0.4521372318267822, "num_input_tokens_seen": 551142, "step": 1743, "train_runtime": 4656.6192, "train_tokens_per_second": 118.357 }, { "epoch": 0.08018390804597701, "grad_norm": 9.197833061218262, "learning_rate": 2.5764411027568924e-06, "loss": 0.44839343428611755, "num_input_tokens_seen": 551448, "step": 1744, "train_runtime": 4658.5871, "train_tokens_per_second": 118.372 }, { "epoch": 0.08022988505747126, "grad_norm": 6.440124988555908, "learning_rate": 2.566416040100251e-06, "loss": 0.3701336085796356, "num_input_tokens_seen": 551786, "step": 1745, "train_runtime": 4660.6495, "train_tokens_per_second": 118.393 }, { "epoch": 0.08027586206896552, "grad_norm": 7.900654315948486, "learning_rate": 2.556390977443609e-06, "loss": 0.5311776995658875, "num_input_tokens_seen": 552126, "step": 1746, "train_runtime": 4662.648, "train_tokens_per_second": 118.415 }, { "epoch": 0.08032183908045977, "grad_norm": 7.551472187042236, "learning_rate": 2.5463659147869674e-06, "loss": 0.4569704234600067, "num_input_tokens_seen": 552360, "step": 1747, "train_runtime": 4664.6816, "train_tokens_per_second": 118.413 }, { "epoch": 0.08036781609195402, "grad_norm": 9.04428482055664, "learning_rate": 2.5363408521303263e-06, "loss": 0.43082064390182495, "num_input_tokens_seen": 552640, "step": 1748, "train_runtime": 4666.6903, "train_tokens_per_second": 118.422 }, { "epoch": 0.08041379310344828, "grad_norm": 7.74245023727417, "learning_rate": 2.5263157894736844e-06, "loss": 0.4223887622356415, "num_input_tokens_seen": 552894, "step": 1749, "train_runtime": 4668.7186, "train_tokens_per_second": 118.425 }, { "epoch": 0.08045977011494253, "grad_norm": 5.408883571624756, "learning_rate": 2.516290726817043e-06, "loss": 0.2123432457447052, "num_input_tokens_seen": 553146, "step": 1750, "train_runtime": 4670.6825, "train_tokens_per_second": 118.429 }, { "epoch": 0.08050574712643678, "grad_norm": 7.574296951293945, "learning_rate": 2.506265664160401e-06, "loss": 0.4172983169555664, "num_input_tokens_seen": 553470, "step": 1751, "train_runtime": 4672.7165, "train_tokens_per_second": 118.447 }, { "epoch": 0.08055172413793103, "grad_norm": 8.019220352172852, "learning_rate": 2.4962406015037594e-06, "loss": 0.43811845779418945, "num_input_tokens_seen": 553784, "step": 1752, "train_runtime": 4674.6719, "train_tokens_per_second": 118.465 }, { "epoch": 0.08059770114942529, "grad_norm": 8.313697814941406, "learning_rate": 2.486215538847118e-06, "loss": 0.450636625289917, "num_input_tokens_seen": 554220, "step": 1753, "train_runtime": 4676.6844, "train_tokens_per_second": 118.507 }, { "epoch": 0.08064367816091954, "grad_norm": 7.183359146118164, "learning_rate": 2.4761904761904764e-06, "loss": 0.41533249616622925, "num_input_tokens_seen": 554530, "step": 1754, "train_runtime": 4678.6585, "train_tokens_per_second": 118.523 }, { "epoch": 0.08068965517241379, "grad_norm": 8.74924373626709, "learning_rate": 2.466165413533835e-06, "loss": 0.5330443978309631, "num_input_tokens_seen": 554792, "step": 1755, "train_runtime": 4680.6052, "train_tokens_per_second": 118.53 }, { "epoch": 0.08073563218390804, "grad_norm": 7.614817142486572, "learning_rate": 2.456140350877193e-06, "loss": 0.3097129166126251, "num_input_tokens_seen": 555046, "step": 1756, "train_runtime": 4682.5467, "train_tokens_per_second": 118.535 }, { "epoch": 0.0807816091954023, "grad_norm": 7.424604892730713, "learning_rate": 2.4461152882205514e-06, "loss": 0.37505459785461426, "num_input_tokens_seen": 555286, "step": 1757, "train_runtime": 4684.483, "train_tokens_per_second": 118.537 }, { "epoch": 0.08082758620689655, "grad_norm": 6.519960403442383, "learning_rate": 2.43609022556391e-06, "loss": 0.33945173025131226, "num_input_tokens_seen": 555576, "step": 1758, "train_runtime": 4686.431, "train_tokens_per_second": 118.55 }, { "epoch": 0.0808735632183908, "grad_norm": 7.936978816986084, "learning_rate": 2.4260651629072684e-06, "loss": 0.45852887630462646, "num_input_tokens_seen": 555886, "step": 1759, "train_runtime": 4688.3962, "train_tokens_per_second": 118.566 }, { "epoch": 0.08091954022988505, "grad_norm": 7.150357246398926, "learning_rate": 2.416040100250627e-06, "loss": 0.5692156553268433, "num_input_tokens_seen": 556340, "step": 1760, "train_runtime": 4690.5359, "train_tokens_per_second": 118.609 }, { "epoch": 0.0809655172413793, "grad_norm": 10.340112686157227, "learning_rate": 2.406015037593985e-06, "loss": 0.40212365984916687, "num_input_tokens_seen": 556622, "step": 1761, "train_runtime": 4692.5794, "train_tokens_per_second": 118.617 }, { "epoch": 0.08101149425287356, "grad_norm": 5.893184185028076, "learning_rate": 2.3959899749373435e-06, "loss": 0.2924824655056, "num_input_tokens_seen": 556964, "step": 1762, "train_runtime": 4694.6371, "train_tokens_per_second": 118.638 }, { "epoch": 0.08105747126436781, "grad_norm": 6.778119087219238, "learning_rate": 2.385964912280702e-06, "loss": 0.2572908103466034, "num_input_tokens_seen": 557278, "step": 1763, "train_runtime": 4696.5951, "train_tokens_per_second": 118.656 }, { "epoch": 0.08110344827586206, "grad_norm": 8.0773286819458, "learning_rate": 2.3759398496240604e-06, "loss": 0.40051108598709106, "num_input_tokens_seen": 557568, "step": 1764, "train_runtime": 4698.5756, "train_tokens_per_second": 118.667 }, { "epoch": 0.08114942528735632, "grad_norm": 7.1524577140808105, "learning_rate": 2.365914786967419e-06, "loss": 0.44823575019836426, "num_input_tokens_seen": 557982, "step": 1765, "train_runtime": 4700.5846, "train_tokens_per_second": 118.705 }, { "epoch": 0.08119540229885057, "grad_norm": 6.727236270904541, "learning_rate": 2.355889724310777e-06, "loss": 0.3018498718738556, "num_input_tokens_seen": 558242, "step": 1766, "train_runtime": 4702.5665, "train_tokens_per_second": 118.71 }, { "epoch": 0.08124137931034482, "grad_norm": 7.099841594696045, "learning_rate": 2.3458646616541355e-06, "loss": 0.4439983367919922, "num_input_tokens_seen": 558520, "step": 1767, "train_runtime": 4704.5323, "train_tokens_per_second": 118.72 }, { "epoch": 0.08128735632183907, "grad_norm": 7.709004878997803, "learning_rate": 2.335839598997494e-06, "loss": 0.3934343457221985, "num_input_tokens_seen": 558834, "step": 1768, "train_runtime": 4706.5099, "train_tokens_per_second": 118.736 }, { "epoch": 0.08133333333333333, "grad_norm": 7.746722221374512, "learning_rate": 2.3258145363408524e-06, "loss": 0.45177793502807617, "num_input_tokens_seen": 559120, "step": 1769, "train_runtime": 4708.4668, "train_tokens_per_second": 118.748 }, { "epoch": 0.08137931034482758, "grad_norm": 8.621835708618164, "learning_rate": 2.3157894736842105e-06, "loss": 0.454231858253479, "num_input_tokens_seen": 559408, "step": 1770, "train_runtime": 4710.4036, "train_tokens_per_second": 118.76 }, { "epoch": 0.08142528735632185, "grad_norm": 7.304722309112549, "learning_rate": 2.305764411027569e-06, "loss": 0.4125288724899292, "num_input_tokens_seen": 559714, "step": 1771, "train_runtime": 4726.2743, "train_tokens_per_second": 118.426 }, { "epoch": 0.0814712643678161, "grad_norm": 6.720957279205322, "learning_rate": 2.2957393483709275e-06, "loss": 0.4494350254535675, "num_input_tokens_seen": 560012, "step": 1772, "train_runtime": 4728.2414, "train_tokens_per_second": 118.44 }, { "epoch": 0.08151724137931035, "grad_norm": 6.90883731842041, "learning_rate": 2.285714285714286e-06, "loss": 0.3727937936782837, "num_input_tokens_seen": 560356, "step": 1773, "train_runtime": 4730.2751, "train_tokens_per_second": 118.462 }, { "epoch": 0.0815632183908046, "grad_norm": 7.366011619567871, "learning_rate": 2.2756892230576445e-06, "loss": 0.3889319896697998, "num_input_tokens_seen": 560642, "step": 1774, "train_runtime": 4732.2628, "train_tokens_per_second": 118.472 }, { "epoch": 0.08160919540229886, "grad_norm": 6.236909866333008, "learning_rate": 2.2656641604010025e-06, "loss": 0.32321351766586304, "num_input_tokens_seen": 561052, "step": 1775, "train_runtime": 4734.2775, "train_tokens_per_second": 118.508 }, { "epoch": 0.08165517241379311, "grad_norm": 7.311210632324219, "learning_rate": 2.255639097744361e-06, "loss": 0.33350884914398193, "num_input_tokens_seen": 561298, "step": 1776, "train_runtime": 4736.2756, "train_tokens_per_second": 118.51 }, { "epoch": 0.08170114942528736, "grad_norm": 8.70530891418457, "learning_rate": 2.2456140350877195e-06, "loss": 0.42279165983200073, "num_input_tokens_seen": 561548, "step": 1777, "train_runtime": 4738.2288, "train_tokens_per_second": 118.514 }, { "epoch": 0.08174712643678161, "grad_norm": 7.851328372955322, "learning_rate": 2.235588972431078e-06, "loss": 0.46526530385017395, "num_input_tokens_seen": 561814, "step": 1778, "train_runtime": 4740.2878, "train_tokens_per_second": 118.519 }, { "epoch": 0.08179310344827587, "grad_norm": 7.489623546600342, "learning_rate": 2.2255639097744365e-06, "loss": 0.4107331931591034, "num_input_tokens_seen": 562144, "step": 1779, "train_runtime": 4742.3276, "train_tokens_per_second": 118.538 }, { "epoch": 0.08183908045977012, "grad_norm": 8.210550308227539, "learning_rate": 2.2155388471177945e-06, "loss": 0.38923993706703186, "num_input_tokens_seen": 562398, "step": 1780, "train_runtime": 4744.4241, "train_tokens_per_second": 118.539 }, { "epoch": 0.08188505747126437, "grad_norm": 6.557780742645264, "learning_rate": 2.205513784461153e-06, "loss": 0.3759402930736542, "num_input_tokens_seen": 562630, "step": 1781, "train_runtime": 4746.3925, "train_tokens_per_second": 118.538 }, { "epoch": 0.08193103448275862, "grad_norm": 6.851749420166016, "learning_rate": 2.1954887218045115e-06, "loss": 0.37134015560150146, "num_input_tokens_seen": 562914, "step": 1782, "train_runtime": 4748.3343, "train_tokens_per_second": 118.55 }, { "epoch": 0.08197701149425288, "grad_norm": 8.408563613891602, "learning_rate": 2.1854636591478696e-06, "loss": 0.5807152986526489, "num_input_tokens_seen": 563260, "step": 1783, "train_runtime": 4750.3555, "train_tokens_per_second": 118.572 }, { "epoch": 0.08202298850574713, "grad_norm": 8.055425643920898, "learning_rate": 2.1754385964912285e-06, "loss": 0.43624207377433777, "num_input_tokens_seen": 563564, "step": 1784, "train_runtime": 4752.4042, "train_tokens_per_second": 118.585 }, { "epoch": 0.08206896551724138, "grad_norm": 11.250126838684082, "learning_rate": 2.1654135338345866e-06, "loss": 0.577454149723053, "num_input_tokens_seen": 563888, "step": 1785, "train_runtime": 4754.339, "train_tokens_per_second": 118.605 }, { "epoch": 0.08211494252873563, "grad_norm": 7.877490997314453, "learning_rate": 2.155388471177945e-06, "loss": 0.4524950385093689, "num_input_tokens_seen": 564144, "step": 1786, "train_runtime": 4756.2715, "train_tokens_per_second": 118.611 }, { "epoch": 0.08216091954022989, "grad_norm": 6.374622821807861, "learning_rate": 2.1453634085213035e-06, "loss": 0.361733615398407, "num_input_tokens_seen": 564424, "step": 1787, "train_runtime": 4758.2183, "train_tokens_per_second": 118.621 }, { "epoch": 0.08220689655172414, "grad_norm": 7.350593090057373, "learning_rate": 2.1353383458646616e-06, "loss": 0.4720909595489502, "num_input_tokens_seen": 564762, "step": 1788, "train_runtime": 4760.1879, "train_tokens_per_second": 118.643 }, { "epoch": 0.08225287356321839, "grad_norm": 7.337474346160889, "learning_rate": 2.1253132832080205e-06, "loss": 0.586622953414917, "num_input_tokens_seen": 565154, "step": 1789, "train_runtime": 4762.1594, "train_tokens_per_second": 118.676 }, { "epoch": 0.08229885057471265, "grad_norm": 7.515060901641846, "learning_rate": 2.1152882205513786e-06, "loss": 0.5617174506187439, "num_input_tokens_seen": 565478, "step": 1790, "train_runtime": 4764.1204, "train_tokens_per_second": 118.695 }, { "epoch": 0.0823448275862069, "grad_norm": 8.223000526428223, "learning_rate": 2.105263157894737e-06, "loss": 0.46494728326797485, "num_input_tokens_seen": 565770, "step": 1791, "train_runtime": 4766.0626, "train_tokens_per_second": 118.708 }, { "epoch": 0.08239080459770115, "grad_norm": 7.07399320602417, "learning_rate": 2.0952380952380955e-06, "loss": 0.3907439112663269, "num_input_tokens_seen": 566174, "step": 1792, "train_runtime": 4768.1724, "train_tokens_per_second": 118.74 }, { "epoch": 0.0824367816091954, "grad_norm": 7.540831089019775, "learning_rate": 2.0852130325814536e-06, "loss": 0.437356173992157, "num_input_tokens_seen": 566468, "step": 1793, "train_runtime": 4770.1422, "train_tokens_per_second": 118.753 }, { "epoch": 0.08248275862068966, "grad_norm": 8.21686840057373, "learning_rate": 2.075187969924812e-06, "loss": 0.5119478106498718, "num_input_tokens_seen": 566840, "step": 1794, "train_runtime": 4772.1541, "train_tokens_per_second": 118.781 }, { "epoch": 0.08252873563218391, "grad_norm": 8.327613830566406, "learning_rate": 2.0651629072681706e-06, "loss": 0.29968926310539246, "num_input_tokens_seen": 567078, "step": 1795, "train_runtime": 4774.1261, "train_tokens_per_second": 118.782 }, { "epoch": 0.08257471264367816, "grad_norm": 9.069775581359863, "learning_rate": 2.055137844611529e-06, "loss": 0.4626874029636383, "num_input_tokens_seen": 567354, "step": 1796, "train_runtime": 4776.0735, "train_tokens_per_second": 118.791 }, { "epoch": 0.08262068965517241, "grad_norm": 7.5980706214904785, "learning_rate": 2.0451127819548876e-06, "loss": 0.39771243929862976, "num_input_tokens_seen": 567706, "step": 1797, "train_runtime": 4778.0678, "train_tokens_per_second": 118.815 }, { "epoch": 0.08266666666666667, "grad_norm": 7.28903865814209, "learning_rate": 2.0350877192982456e-06, "loss": 0.3334161043167114, "num_input_tokens_seen": 567974, "step": 1798, "train_runtime": 4780.0528, "train_tokens_per_second": 118.822 }, { "epoch": 0.08271264367816092, "grad_norm": 7.9057536125183105, "learning_rate": 2.025062656641604e-06, "loss": 0.48750609159469604, "num_input_tokens_seen": 568244, "step": 1799, "train_runtime": 4782.0153, "train_tokens_per_second": 118.829 }, { "epoch": 0.08275862068965517, "grad_norm": 7.5187554359436035, "learning_rate": 2.0150375939849626e-06, "loss": 0.46189796924591064, "num_input_tokens_seen": 568570, "step": 1800, "train_runtime": 4784.0347, "train_tokens_per_second": 118.847 }, { "epoch": 0.08275862068965517, "eval_loss": 1.6565169095993042, "eval_runtime": 54.3567, "eval_samples_per_second": 18.397, "eval_steps_per_second": 9.198, "num_input_tokens_seen": 568570, "step": 1800 }, { "epoch": 0.08280459770114942, "grad_norm": 7.315585136413574, "learning_rate": 2.0050125313283207e-06, "loss": 0.3831065595149994, "num_input_tokens_seen": 568850, "step": 1801, "train_runtime": 4853.8606, "train_tokens_per_second": 117.195 }, { "epoch": 0.08285057471264368, "grad_norm": 8.172098159790039, "learning_rate": 1.9949874686716796e-06, "loss": 0.4771665930747986, "num_input_tokens_seen": 569132, "step": 1802, "train_runtime": 4855.9201, "train_tokens_per_second": 117.204 }, { "epoch": 0.08289655172413793, "grad_norm": 8.046319007873535, "learning_rate": 1.9849624060150376e-06, "loss": 0.41621360182762146, "num_input_tokens_seen": 569426, "step": 1803, "train_runtime": 4857.9495, "train_tokens_per_second": 117.215 }, { "epoch": 0.08294252873563218, "grad_norm": 7.207624912261963, "learning_rate": 1.974937343358396e-06, "loss": 0.4766409397125244, "num_input_tokens_seen": 569806, "step": 1804, "train_runtime": 4859.9565, "train_tokens_per_second": 117.245 }, { "epoch": 0.08298850574712643, "grad_norm": 7.081984996795654, "learning_rate": 1.9649122807017546e-06, "loss": 0.4001272916793823, "num_input_tokens_seen": 570082, "step": 1805, "train_runtime": 4861.9675, "train_tokens_per_second": 117.253 }, { "epoch": 0.08303448275862069, "grad_norm": 6.745321273803711, "learning_rate": 1.9548872180451127e-06, "loss": 0.3025839328765869, "num_input_tokens_seen": 570326, "step": 1806, "train_runtime": 4863.9405, "train_tokens_per_second": 117.256 }, { "epoch": 0.08308045977011494, "grad_norm": 7.696715354919434, "learning_rate": 1.9448621553884716e-06, "loss": 0.5356572866439819, "num_input_tokens_seen": 570696, "step": 1807, "train_runtime": 4865.9073, "train_tokens_per_second": 117.285 }, { "epoch": 0.08312643678160919, "grad_norm": 6.422617435455322, "learning_rate": 1.9348370927318297e-06, "loss": 0.3579423725605011, "num_input_tokens_seen": 571062, "step": 1808, "train_runtime": 4867.8939, "train_tokens_per_second": 117.312 }, { "epoch": 0.08317241379310344, "grad_norm": 8.224241256713867, "learning_rate": 1.924812030075188e-06, "loss": 0.468651682138443, "num_input_tokens_seen": 571330, "step": 1809, "train_runtime": 4869.8745, "train_tokens_per_second": 117.319 }, { "epoch": 0.0832183908045977, "grad_norm": 8.08243465423584, "learning_rate": 1.9147869674185466e-06, "loss": 0.4702770709991455, "num_input_tokens_seen": 571606, "step": 1810, "train_runtime": 4871.8252, "train_tokens_per_second": 117.329 }, { "epoch": 0.08326436781609195, "grad_norm": 7.297043323516846, "learning_rate": 1.904761904761905e-06, "loss": 0.4983699917793274, "num_input_tokens_seen": 572024, "step": 1811, "train_runtime": 4873.8609, "train_tokens_per_second": 117.366 }, { "epoch": 0.0833103448275862, "grad_norm": 8.084451675415039, "learning_rate": 1.8947368421052634e-06, "loss": 0.5442982316017151, "num_input_tokens_seen": 572358, "step": 1812, "train_runtime": 4875.8308, "train_tokens_per_second": 117.387 }, { "epoch": 0.08335632183908046, "grad_norm": 9.324164390563965, "learning_rate": 1.8847117794486217e-06, "loss": 0.43849676847457886, "num_input_tokens_seen": 572674, "step": 1813, "train_runtime": 4877.99, "train_tokens_per_second": 117.4 }, { "epoch": 0.08340229885057471, "grad_norm": 6.999230861663818, "learning_rate": 1.8746867167919802e-06, "loss": 0.4893054664134979, "num_input_tokens_seen": 572970, "step": 1814, "train_runtime": 4879.996, "train_tokens_per_second": 117.412 }, { "epoch": 0.08344827586206896, "grad_norm": 6.0354228019714355, "learning_rate": 1.8646616541353384e-06, "loss": 0.3791593611240387, "num_input_tokens_seen": 573376, "step": 1815, "train_runtime": 4881.9929, "train_tokens_per_second": 117.447 }, { "epoch": 0.08349425287356321, "grad_norm": 8.382869720458984, "learning_rate": 1.8546365914786967e-06, "loss": 0.4673730731010437, "num_input_tokens_seen": 573718, "step": 1816, "train_runtime": 4883.9513, "train_tokens_per_second": 117.47 }, { "epoch": 0.08354022988505747, "grad_norm": 8.546704292297363, "learning_rate": 1.8446115288220554e-06, "loss": 0.5125331878662109, "num_input_tokens_seen": 574024, "step": 1817, "train_runtime": 4885.9807, "train_tokens_per_second": 117.484 }, { "epoch": 0.08358620689655172, "grad_norm": 7.281277656555176, "learning_rate": 1.8345864661654137e-06, "loss": 0.4075167775154114, "num_input_tokens_seen": 574286, "step": 1818, "train_runtime": 4888.0502, "train_tokens_per_second": 117.488 }, { "epoch": 0.08363218390804597, "grad_norm": 9.473976135253906, "learning_rate": 1.8245614035087722e-06, "loss": 0.36136457324028015, "num_input_tokens_seen": 574578, "step": 1819, "train_runtime": 4889.9952, "train_tokens_per_second": 117.501 }, { "epoch": 0.08367816091954022, "grad_norm": 6.530069351196289, "learning_rate": 1.8145363408521305e-06, "loss": 0.3033841848373413, "num_input_tokens_seen": 574868, "step": 1820, "train_runtime": 4891.9461, "train_tokens_per_second": 117.513 }, { "epoch": 0.08372413793103449, "grad_norm": 6.166937828063965, "learning_rate": 1.8045112781954887e-06, "loss": 0.3236815333366394, "num_input_tokens_seen": 575116, "step": 1821, "train_runtime": 4893.8952, "train_tokens_per_second": 117.517 }, { "epoch": 0.08377011494252874, "grad_norm": 6.645321369171143, "learning_rate": 1.7944862155388474e-06, "loss": 0.38862884044647217, "num_input_tokens_seen": 575502, "step": 1822, "train_runtime": 4895.8832, "train_tokens_per_second": 117.548 }, { "epoch": 0.083816091954023, "grad_norm": 6.6288161277771, "learning_rate": 1.7844611528822057e-06, "loss": 0.43700075149536133, "num_input_tokens_seen": 575778, "step": 1823, "train_runtime": 4897.8428, "train_tokens_per_second": 117.557 }, { "epoch": 0.08386206896551725, "grad_norm": 7.225349426269531, "learning_rate": 1.7744360902255642e-06, "loss": 0.3360759913921356, "num_input_tokens_seen": 576008, "step": 1824, "train_runtime": 4899.8445, "train_tokens_per_second": 117.556 }, { "epoch": 0.0839080459770115, "grad_norm": 7.799300193786621, "learning_rate": 1.7644110275689225e-06, "loss": 0.5063899159431458, "num_input_tokens_seen": 576312, "step": 1825, "train_runtime": 4901.8442, "train_tokens_per_second": 117.57 }, { "epoch": 0.08395402298850575, "grad_norm": 7.065634727478027, "learning_rate": 1.7543859649122807e-06, "loss": 0.4996592700481415, "num_input_tokens_seen": 576820, "step": 1826, "train_runtime": 4903.8709, "train_tokens_per_second": 117.625 }, { "epoch": 0.084, "grad_norm": 7.042445659637451, "learning_rate": 1.7443609022556392e-06, "loss": 0.46579164266586304, "num_input_tokens_seen": 577132, "step": 1827, "train_runtime": 4905.8338, "train_tokens_per_second": 117.642 }, { "epoch": 0.08404597701149426, "grad_norm": 6.733147621154785, "learning_rate": 1.7343358395989975e-06, "loss": 0.36569154262542725, "num_input_tokens_seen": 577438, "step": 1828, "train_runtime": 4907.8546, "train_tokens_per_second": 117.656 }, { "epoch": 0.08409195402298851, "grad_norm": 7.03594970703125, "learning_rate": 1.7243107769423562e-06, "loss": 0.5295254588127136, "num_input_tokens_seen": 577744, "step": 1829, "train_runtime": 4909.9602, "train_tokens_per_second": 117.668 }, { "epoch": 0.08413793103448276, "grad_norm": 7.294963836669922, "learning_rate": 1.7142857142857145e-06, "loss": 0.375788152217865, "num_input_tokens_seen": 578076, "step": 1830, "train_runtime": 4911.939, "train_tokens_per_second": 117.688 }, { "epoch": 0.08418390804597702, "grad_norm": 7.433239459991455, "learning_rate": 1.7042606516290728e-06, "loss": 0.5001753568649292, "num_input_tokens_seen": 578482, "step": 1831, "train_runtime": 4926.6953, "train_tokens_per_second": 117.418 }, { "epoch": 0.08422988505747127, "grad_norm": 6.932636260986328, "learning_rate": 1.6942355889724312e-06, "loss": 0.4600294828414917, "num_input_tokens_seen": 578882, "step": 1832, "train_runtime": 4928.7787, "train_tokens_per_second": 117.449 }, { "epoch": 0.08427586206896552, "grad_norm": 8.25571346282959, "learning_rate": 1.6842105263157895e-06, "loss": 0.5654494166374207, "num_input_tokens_seen": 579196, "step": 1833, "train_runtime": 4930.7354, "train_tokens_per_second": 117.466 }, { "epoch": 0.08432183908045977, "grad_norm": 7.823970794677734, "learning_rate": 1.6741854636591482e-06, "loss": 0.3812708556652069, "num_input_tokens_seen": 579422, "step": 1834, "train_runtime": 4932.6728, "train_tokens_per_second": 117.466 }, { "epoch": 0.08436781609195403, "grad_norm": 6.841559886932373, "learning_rate": 1.6641604010025065e-06, "loss": 0.39847031235694885, "num_input_tokens_seen": 579706, "step": 1835, "train_runtime": 4934.6248, "train_tokens_per_second": 117.477 }, { "epoch": 0.08441379310344828, "grad_norm": 8.656652450561523, "learning_rate": 1.6541353383458648e-06, "loss": 0.43860891461372375, "num_input_tokens_seen": 580002, "step": 1836, "train_runtime": 4936.5727, "train_tokens_per_second": 117.491 }, { "epoch": 0.08445977011494253, "grad_norm": 7.259665489196777, "learning_rate": 1.6441102756892233e-06, "loss": 0.4278905689716339, "num_input_tokens_seen": 580286, "step": 1837, "train_runtime": 4938.5271, "train_tokens_per_second": 117.502 }, { "epoch": 0.08450574712643678, "grad_norm": 12.496138572692871, "learning_rate": 1.6340852130325815e-06, "loss": 0.31393980979919434, "num_input_tokens_seen": 580586, "step": 1838, "train_runtime": 4940.4933, "train_tokens_per_second": 117.516 }, { "epoch": 0.08455172413793104, "grad_norm": 8.727643013000488, "learning_rate": 1.62406015037594e-06, "loss": 0.49319982528686523, "num_input_tokens_seen": 580840, "step": 1839, "train_runtime": 4942.4492, "train_tokens_per_second": 117.521 }, { "epoch": 0.08459770114942529, "grad_norm": 8.640833854675293, "learning_rate": 1.6140350877192983e-06, "loss": 0.37768036127090454, "num_input_tokens_seen": 581104, "step": 1840, "train_runtime": 4944.4025, "train_tokens_per_second": 117.528 }, { "epoch": 0.08464367816091954, "grad_norm": 7.445074081420898, "learning_rate": 1.6040100250626568e-06, "loss": 0.49109211564064026, "num_input_tokens_seen": 581510, "step": 1841, "train_runtime": 4946.3893, "train_tokens_per_second": 117.563 }, { "epoch": 0.0846896551724138, "grad_norm": 7.998035907745361, "learning_rate": 1.5939849624060153e-06, "loss": 0.5314834713935852, "num_input_tokens_seen": 581792, "step": 1842, "train_runtime": 4948.3354, "train_tokens_per_second": 117.573 }, { "epoch": 0.08473563218390805, "grad_norm": 7.3700456619262695, "learning_rate": 1.5839598997493736e-06, "loss": 0.47153419256210327, "num_input_tokens_seen": 582100, "step": 1843, "train_runtime": 4950.3029, "train_tokens_per_second": 117.589 }, { "epoch": 0.0847816091954023, "grad_norm": 7.144804954528809, "learning_rate": 1.573934837092732e-06, "loss": 0.35979849100112915, "num_input_tokens_seen": 582374, "step": 1844, "train_runtime": 4952.2579, "train_tokens_per_second": 117.598 }, { "epoch": 0.08482758620689655, "grad_norm": 7.0776753425598145, "learning_rate": 1.5639097744360903e-06, "loss": 0.4229793846607208, "num_input_tokens_seen": 582718, "step": 1845, "train_runtime": 4954.2512, "train_tokens_per_second": 117.62 }, { "epoch": 0.0848735632183908, "grad_norm": 8.390013694763184, "learning_rate": 1.5538847117794486e-06, "loss": 0.3618282377719879, "num_input_tokens_seen": 582982, "step": 1846, "train_runtime": 4956.2201, "train_tokens_per_second": 117.626 }, { "epoch": 0.08491954022988506, "grad_norm": 9.31496524810791, "learning_rate": 1.5438596491228073e-06, "loss": 0.44351887702941895, "num_input_tokens_seen": 583306, "step": 1847, "train_runtime": 4958.2346, "train_tokens_per_second": 117.644 }, { "epoch": 0.08496551724137931, "grad_norm": 9.846113204956055, "learning_rate": 1.5338345864661656e-06, "loss": 0.5924310088157654, "num_input_tokens_seen": 583566, "step": 1848, "train_runtime": 4960.1792, "train_tokens_per_second": 117.65 }, { "epoch": 0.08501149425287356, "grad_norm": 7.809129238128662, "learning_rate": 1.523809523809524e-06, "loss": 0.4247511923313141, "num_input_tokens_seen": 583834, "step": 1849, "train_runtime": 4962.1238, "train_tokens_per_second": 117.658 }, { "epoch": 0.08505747126436781, "grad_norm": 8.016154289245605, "learning_rate": 1.5137844611528823e-06, "loss": 0.543587863445282, "num_input_tokens_seen": 584152, "step": 1850, "train_runtime": 4964.0897, "train_tokens_per_second": 117.676 }, { "epoch": 0.08510344827586207, "grad_norm": 9.180368423461914, "learning_rate": 1.5037593984962406e-06, "loss": 0.48159167170524597, "num_input_tokens_seen": 584422, "step": 1851, "train_runtime": 4966.0273, "train_tokens_per_second": 117.684 }, { "epoch": 0.08514942528735632, "grad_norm": 7.4745564460754395, "learning_rate": 1.4937343358395993e-06, "loss": 0.47470101714134216, "num_input_tokens_seen": 584712, "step": 1852, "train_runtime": 4967.9784, "train_tokens_per_second": 117.696 }, { "epoch": 0.08519540229885057, "grad_norm": 8.902558326721191, "learning_rate": 1.4837092731829576e-06, "loss": 0.44762665033340454, "num_input_tokens_seen": 585014, "step": 1853, "train_runtime": 4969.9345, "train_tokens_per_second": 117.711 }, { "epoch": 0.08524137931034483, "grad_norm": 7.327677249908447, "learning_rate": 1.4736842105263159e-06, "loss": 0.38496196269989014, "num_input_tokens_seen": 585294, "step": 1854, "train_runtime": 4971.8812, "train_tokens_per_second": 117.721 }, { "epoch": 0.08528735632183908, "grad_norm": 8.085262298583984, "learning_rate": 1.4636591478696743e-06, "loss": 0.3590407967567444, "num_input_tokens_seen": 585560, "step": 1855, "train_runtime": 4973.8233, "train_tokens_per_second": 117.728 }, { "epoch": 0.08533333333333333, "grad_norm": 7.7812676429748535, "learning_rate": 1.4536340852130326e-06, "loss": 0.38731035590171814, "num_input_tokens_seen": 585866, "step": 1856, "train_runtime": 4975.8074, "train_tokens_per_second": 117.743 }, { "epoch": 0.08537931034482758, "grad_norm": 8.900866508483887, "learning_rate": 1.4436090225563911e-06, "loss": 0.5512892603874207, "num_input_tokens_seen": 586138, "step": 1857, "train_runtime": 4977.7921, "train_tokens_per_second": 117.751 }, { "epoch": 0.08542528735632184, "grad_norm": 7.379859924316406, "learning_rate": 1.4335839598997494e-06, "loss": 0.5174167156219482, "num_input_tokens_seen": 586422, "step": 1858, "train_runtime": 4979.7679, "train_tokens_per_second": 117.761 }, { "epoch": 0.08547126436781609, "grad_norm": 6.956198692321777, "learning_rate": 1.4235588972431077e-06, "loss": 0.39228907227516174, "num_input_tokens_seen": 586712, "step": 1859, "train_runtime": 4981.7305, "train_tokens_per_second": 117.773 }, { "epoch": 0.08551724137931034, "grad_norm": 7.236478328704834, "learning_rate": 1.4135338345864664e-06, "loss": 0.36122918128967285, "num_input_tokens_seen": 586952, "step": 1860, "train_runtime": 4983.6668, "train_tokens_per_second": 117.775 }, { "epoch": 0.0855632183908046, "grad_norm": 8.94511604309082, "learning_rate": 1.4035087719298246e-06, "loss": 0.5683632493019104, "num_input_tokens_seen": 587284, "step": 1861, "train_runtime": 4998.5733, "train_tokens_per_second": 117.49 }, { "epoch": 0.08560919540229885, "grad_norm": 8.432382583618164, "learning_rate": 1.3934837092731831e-06, "loss": 0.4612915813922882, "num_input_tokens_seen": 587680, "step": 1862, "train_runtime": 5000.6149, "train_tokens_per_second": 117.522 }, { "epoch": 0.0856551724137931, "grad_norm": 7.545629501342773, "learning_rate": 1.3834586466165414e-06, "loss": 0.3651968836784363, "num_input_tokens_seen": 587916, "step": 1863, "train_runtime": 5002.5899, "train_tokens_per_second": 117.522 }, { "epoch": 0.08570114942528735, "grad_norm": 8.204903602600098, "learning_rate": 1.3734335839598997e-06, "loss": 0.2659253478050232, "num_input_tokens_seen": 588150, "step": 1864, "train_runtime": 5004.5266, "train_tokens_per_second": 117.524 }, { "epoch": 0.0857471264367816, "grad_norm": 6.838364124298096, "learning_rate": 1.3634085213032584e-06, "loss": 0.3213936984539032, "num_input_tokens_seen": 588402, "step": 1865, "train_runtime": 5006.467, "train_tokens_per_second": 117.528 }, { "epoch": 0.08579310344827586, "grad_norm": 6.686530590057373, "learning_rate": 1.3533834586466167e-06, "loss": 0.49802929162979126, "num_input_tokens_seen": 589038, "step": 1866, "train_runtime": 5008.5146, "train_tokens_per_second": 117.607 }, { "epoch": 0.08583908045977011, "grad_norm": 7.597280025482178, "learning_rate": 1.3433583959899751e-06, "loss": 0.47507423162460327, "num_input_tokens_seen": 589412, "step": 1867, "train_runtime": 5010.5024, "train_tokens_per_second": 117.635 }, { "epoch": 0.08588505747126436, "grad_norm": 8.68179988861084, "learning_rate": 1.3333333333333334e-06, "loss": 0.4467782974243164, "num_input_tokens_seen": 589702, "step": 1868, "train_runtime": 5012.4823, "train_tokens_per_second": 117.647 }, { "epoch": 0.08593103448275861, "grad_norm": 7.25511360168457, "learning_rate": 1.3233082706766917e-06, "loss": 0.4221172332763672, "num_input_tokens_seen": 589960, "step": 1869, "train_runtime": 5014.4225, "train_tokens_per_second": 117.653 }, { "epoch": 0.08597701149425287, "grad_norm": 8.154078483581543, "learning_rate": 1.3132832080200502e-06, "loss": 0.5756381154060364, "num_input_tokens_seen": 590244, "step": 1870, "train_runtime": 5016.3608, "train_tokens_per_second": 117.664 }, { "epoch": 0.08602298850574713, "grad_norm": 9.70241928100586, "learning_rate": 1.3032581453634085e-06, "loss": 0.3953090310096741, "num_input_tokens_seen": 590474, "step": 1871, "train_runtime": 5018.3019, "train_tokens_per_second": 117.664 }, { "epoch": 0.08606896551724139, "grad_norm": 7.584150791168213, "learning_rate": 1.2932330827067672e-06, "loss": 0.41417622566223145, "num_input_tokens_seen": 590734, "step": 1872, "train_runtime": 5020.2562, "train_tokens_per_second": 117.67 }, { "epoch": 0.08611494252873564, "grad_norm": 8.666409492492676, "learning_rate": 1.2832080200501254e-06, "loss": 0.37340855598449707, "num_input_tokens_seen": 590990, "step": 1873, "train_runtime": 5022.4241, "train_tokens_per_second": 117.67 }, { "epoch": 0.08616091954022989, "grad_norm": 6.290865421295166, "learning_rate": 1.2731829573934837e-06, "loss": 0.23415996134281158, "num_input_tokens_seen": 591214, "step": 1874, "train_runtime": 5024.4497, "train_tokens_per_second": 117.667 }, { "epoch": 0.08620689655172414, "grad_norm": 6.804515838623047, "learning_rate": 1.2631578947368422e-06, "loss": 0.4050792157649994, "num_input_tokens_seen": 591598, "step": 1875, "train_runtime": 5026.4811, "train_tokens_per_second": 117.696 }, { "epoch": 0.0862528735632184, "grad_norm": 6.425148963928223, "learning_rate": 1.2531328320802005e-06, "loss": 0.3941546082496643, "num_input_tokens_seen": 591914, "step": 1876, "train_runtime": 5028.4398, "train_tokens_per_second": 117.713 }, { "epoch": 0.08629885057471265, "grad_norm": 7.374588489532471, "learning_rate": 1.243107769423559e-06, "loss": 0.4062543213367462, "num_input_tokens_seen": 592212, "step": 1877, "train_runtime": 5030.3954, "train_tokens_per_second": 117.727 }, { "epoch": 0.0863448275862069, "grad_norm": 8.183197021484375, "learning_rate": 1.2330827067669174e-06, "loss": 0.5620994567871094, "num_input_tokens_seen": 592544, "step": 1878, "train_runtime": 5032.3515, "train_tokens_per_second": 117.747 }, { "epoch": 0.08639080459770115, "grad_norm": 6.94822883605957, "learning_rate": 1.2230576441102757e-06, "loss": 0.4957292377948761, "num_input_tokens_seen": 593032, "step": 1879, "train_runtime": 5034.4133, "train_tokens_per_second": 117.796 }, { "epoch": 0.0864367816091954, "grad_norm": 7.928312301635742, "learning_rate": 1.2130325814536342e-06, "loss": 0.4197303354740143, "num_input_tokens_seen": 593330, "step": 1880, "train_runtime": 5036.3615, "train_tokens_per_second": 117.809 }, { "epoch": 0.08648275862068966, "grad_norm": 9.07723331451416, "learning_rate": 1.2030075187969925e-06, "loss": 0.5152315497398376, "num_input_tokens_seen": 593664, "step": 1881, "train_runtime": 5038.3243, "train_tokens_per_second": 117.83 }, { "epoch": 0.08652873563218391, "grad_norm": 7.6124162673950195, "learning_rate": 1.192982456140351e-06, "loss": 0.47064727544784546, "num_input_tokens_seen": 593956, "step": 1882, "train_runtime": 5040.2788, "train_tokens_per_second": 117.842 }, { "epoch": 0.08657471264367816, "grad_norm": 7.852885723114014, "learning_rate": 1.1829573934837095e-06, "loss": 0.5047283172607422, "num_input_tokens_seen": 594282, "step": 1883, "train_runtime": 5042.2495, "train_tokens_per_second": 117.86 }, { "epoch": 0.08662068965517242, "grad_norm": 7.417337894439697, "learning_rate": 1.1729323308270677e-06, "loss": 0.3724783658981323, "num_input_tokens_seen": 594646, "step": 1884, "train_runtime": 5044.2823, "train_tokens_per_second": 117.885 }, { "epoch": 0.08666666666666667, "grad_norm": 7.350129127502441, "learning_rate": 1.1629072681704262e-06, "loss": 0.35512396693229675, "num_input_tokens_seen": 594942, "step": 1885, "train_runtime": 5046.2716, "train_tokens_per_second": 117.897 }, { "epoch": 0.08671264367816092, "grad_norm": 7.525505542755127, "learning_rate": 1.1528822055137845e-06, "loss": 0.33822762966156006, "num_input_tokens_seen": 595250, "step": 1886, "train_runtime": 5048.229, "train_tokens_per_second": 117.913 }, { "epoch": 0.08675862068965517, "grad_norm": 7.463708877563477, "learning_rate": 1.142857142857143e-06, "loss": 0.5150831937789917, "num_input_tokens_seen": 595512, "step": 1887, "train_runtime": 5050.1689, "train_tokens_per_second": 117.919 }, { "epoch": 0.08680459770114943, "grad_norm": 8.473981857299805, "learning_rate": 1.1328320802005013e-06, "loss": 0.5618161559104919, "num_input_tokens_seen": 595840, "step": 1888, "train_runtime": 5052.1223, "train_tokens_per_second": 117.939 }, { "epoch": 0.08685057471264368, "grad_norm": 7.199127197265625, "learning_rate": 1.1228070175438598e-06, "loss": 0.48283204436302185, "num_input_tokens_seen": 596104, "step": 1889, "train_runtime": 5054.0612, "train_tokens_per_second": 117.946 }, { "epoch": 0.08689655172413793, "grad_norm": 7.588725566864014, "learning_rate": 1.1127819548872182e-06, "loss": 0.4118557274341583, "num_input_tokens_seen": 596476, "step": 1890, "train_runtime": 5056.0368, "train_tokens_per_second": 117.973 }, { "epoch": 0.08694252873563219, "grad_norm": 8.241991996765137, "learning_rate": 1.1027568922305765e-06, "loss": 0.45901328325271606, "num_input_tokens_seen": 596710, "step": 1891, "train_runtime": 5072.0845, "train_tokens_per_second": 117.646 }, { "epoch": 0.08698850574712644, "grad_norm": 7.463146686553955, "learning_rate": 1.0927318295739348e-06, "loss": 0.3588930368423462, "num_input_tokens_seen": 596952, "step": 1892, "train_runtime": 5074.1848, "train_tokens_per_second": 117.645 }, { "epoch": 0.08703448275862069, "grad_norm": 7.683949947357178, "learning_rate": 1.0827067669172933e-06, "loss": 0.3187759518623352, "num_input_tokens_seen": 597184, "step": 1893, "train_runtime": 5076.1802, "train_tokens_per_second": 117.644 }, { "epoch": 0.08708045977011494, "grad_norm": 8.679635047912598, "learning_rate": 1.0726817042606518e-06, "loss": 0.5397830009460449, "num_input_tokens_seen": 597508, "step": 1894, "train_runtime": 5078.1416, "train_tokens_per_second": 117.663 }, { "epoch": 0.0871264367816092, "grad_norm": 8.731266975402832, "learning_rate": 1.0626566416040103e-06, "loss": 0.4531298875808716, "num_input_tokens_seen": 597800, "step": 1895, "train_runtime": 5080.1004, "train_tokens_per_second": 117.675 }, { "epoch": 0.08717241379310345, "grad_norm": 7.020224094390869, "learning_rate": 1.0526315789473685e-06, "loss": 0.3842434883117676, "num_input_tokens_seen": 598136, "step": 1896, "train_runtime": 5082.1025, "train_tokens_per_second": 117.695 }, { "epoch": 0.0872183908045977, "grad_norm": 8.90903377532959, "learning_rate": 1.0426065162907268e-06, "loss": 0.5930857062339783, "num_input_tokens_seen": 598476, "step": 1897, "train_runtime": 5084.0886, "train_tokens_per_second": 117.715 }, { "epoch": 0.08726436781609195, "grad_norm": 6.783843517303467, "learning_rate": 1.0325814536340853e-06, "loss": 0.32657402753829956, "num_input_tokens_seen": 598712, "step": 1898, "train_runtime": 5086.0794, "train_tokens_per_second": 117.716 }, { "epoch": 0.0873103448275862, "grad_norm": 7.516112804412842, "learning_rate": 1.0225563909774438e-06, "loss": 0.5041102766990662, "num_input_tokens_seen": 599018, "step": 1899, "train_runtime": 5088.0885, "train_tokens_per_second": 117.729 }, { "epoch": 0.08735632183908046, "grad_norm": 7.043312072753906, "learning_rate": 1.012531328320802e-06, "loss": 0.43204811215400696, "num_input_tokens_seen": 599366, "step": 1900, "train_runtime": 5090.0766, "train_tokens_per_second": 117.752 }, { "epoch": 0.08740229885057471, "grad_norm": 6.694372177124023, "learning_rate": 1.0025062656641603e-06, "loss": 0.33615103363990784, "num_input_tokens_seen": 599606, "step": 1901, "train_runtime": 5092.0391, "train_tokens_per_second": 117.754 }, { "epoch": 0.08744827586206896, "grad_norm": 8.443764686584473, "learning_rate": 9.924812030075188e-07, "loss": 0.5095217823982239, "num_input_tokens_seen": 599936, "step": 1902, "train_runtime": 5094.0233, "train_tokens_per_second": 117.773 }, { "epoch": 0.08749425287356322, "grad_norm": 7.17056131362915, "learning_rate": 9.824561403508773e-07, "loss": 0.5088427662849426, "num_input_tokens_seen": 600434, "step": 1903, "train_runtime": 5096.0214, "train_tokens_per_second": 117.824 }, { "epoch": 0.08754022988505747, "grad_norm": 8.491886138916016, "learning_rate": 9.724310776942358e-07, "loss": 0.5271230936050415, "num_input_tokens_seen": 600742, "step": 1904, "train_runtime": 5098.0065, "train_tokens_per_second": 117.839 }, { "epoch": 0.08758620689655172, "grad_norm": 7.883543968200684, "learning_rate": 9.62406015037594e-07, "loss": 0.3756459951400757, "num_input_tokens_seen": 601022, "step": 1905, "train_runtime": 5100.0065, "train_tokens_per_second": 117.847 }, { "epoch": 0.08763218390804597, "grad_norm": 8.870765686035156, "learning_rate": 9.523809523809525e-07, "loss": 0.5292370319366455, "num_input_tokens_seen": 601344, "step": 1906, "train_runtime": 5102.0018, "train_tokens_per_second": 117.864 }, { "epoch": 0.08767816091954023, "grad_norm": 8.045775413513184, "learning_rate": 9.423558897243108e-07, "loss": 0.37872469425201416, "num_input_tokens_seen": 601664, "step": 1907, "train_runtime": 5104.0149, "train_tokens_per_second": 117.881 }, { "epoch": 0.08772413793103448, "grad_norm": 6.757016658782959, "learning_rate": 9.323308270676692e-07, "loss": 0.42241162061691284, "num_input_tokens_seen": 601984, "step": 1908, "train_runtime": 5106.0276, "train_tokens_per_second": 117.897 }, { "epoch": 0.08777011494252873, "grad_norm": 7.576857089996338, "learning_rate": 9.223057644110277e-07, "loss": 0.3688413202762604, "num_input_tokens_seen": 602248, "step": 1909, "train_runtime": 5108.0042, "train_tokens_per_second": 117.903 }, { "epoch": 0.08781609195402298, "grad_norm": 8.834125518798828, "learning_rate": 9.122807017543861e-07, "loss": 0.41126561164855957, "num_input_tokens_seen": 602624, "step": 1910, "train_runtime": 5110.1223, "train_tokens_per_second": 117.928 }, { "epoch": 0.08786206896551724, "grad_norm": 6.076545238494873, "learning_rate": 9.022556390977444e-07, "loss": 0.34722718596458435, "num_input_tokens_seen": 602950, "step": 1911, "train_runtime": 5112.1099, "train_tokens_per_second": 117.945 }, { "epoch": 0.08790804597701149, "grad_norm": 7.597630023956299, "learning_rate": 8.922305764411029e-07, "loss": 0.5116064548492432, "num_input_tokens_seen": 603286, "step": 1912, "train_runtime": 5114.1567, "train_tokens_per_second": 117.964 }, { "epoch": 0.08795402298850574, "grad_norm": 7.749081134796143, "learning_rate": 8.822055137844612e-07, "loss": 0.39845266938209534, "num_input_tokens_seen": 603570, "step": 1913, "train_runtime": 5116.1182, "train_tokens_per_second": 117.974 }, { "epoch": 0.088, "grad_norm": 7.113033294677734, "learning_rate": 8.721804511278196e-07, "loss": 0.3241654336452484, "num_input_tokens_seen": 603972, "step": 1914, "train_runtime": 5118.1066, "train_tokens_per_second": 118.007 }, { "epoch": 0.08804597701149425, "grad_norm": 8.191364288330078, "learning_rate": 8.621553884711781e-07, "loss": 0.4271330237388611, "num_input_tokens_seen": 604316, "step": 1915, "train_runtime": 5120.072, "train_tokens_per_second": 118.029 }, { "epoch": 0.0880919540229885, "grad_norm": 7.335124492645264, "learning_rate": 8.521303258145364e-07, "loss": 0.3741306960582733, "num_input_tokens_seen": 604654, "step": 1916, "train_runtime": 5122.0937, "train_tokens_per_second": 118.048 }, { "epoch": 0.08813793103448275, "grad_norm": 7.051912307739258, "learning_rate": 8.421052631578948e-07, "loss": 0.3410656750202179, "num_input_tokens_seen": 604896, "step": 1917, "train_runtime": 5124.1377, "train_tokens_per_second": 118.048 }, { "epoch": 0.088183908045977, "grad_norm": 7.493203639984131, "learning_rate": 8.320802005012532e-07, "loss": 0.5200784206390381, "num_input_tokens_seen": 605164, "step": 1918, "train_runtime": 5126.1371, "train_tokens_per_second": 118.055 }, { "epoch": 0.08822988505747126, "grad_norm": 7.78281307220459, "learning_rate": 8.220551378446116e-07, "loss": 0.4933725893497467, "num_input_tokens_seen": 605422, "step": 1919, "train_runtime": 5128.0848, "train_tokens_per_second": 118.06 }, { "epoch": 0.08827586206896551, "grad_norm": 7.283194541931152, "learning_rate": 8.1203007518797e-07, "loss": 0.3743380010128021, "num_input_tokens_seen": 605828, "step": 1920, "train_runtime": 5130.1645, "train_tokens_per_second": 118.091 }, { "epoch": 0.08832183908045978, "grad_norm": 7.83817720413208, "learning_rate": 8.020050125313284e-07, "loss": 0.5046571493148804, "num_input_tokens_seen": 606094, "step": 1921, "train_runtime": 5144.6477, "train_tokens_per_second": 117.811 }, { "epoch": 0.08836781609195403, "grad_norm": 6.266878604888916, "learning_rate": 7.919799498746868e-07, "loss": 0.3677210211753845, "num_input_tokens_seen": 606382, "step": 1922, "train_runtime": 5146.6131, "train_tokens_per_second": 117.822 }, { "epoch": 0.08841379310344828, "grad_norm": 7.051089763641357, "learning_rate": 7.819548872180452e-07, "loss": 0.3863835036754608, "num_input_tokens_seen": 606682, "step": 1923, "train_runtime": 5148.556, "train_tokens_per_second": 117.835 }, { "epoch": 0.08845977011494253, "grad_norm": 8.699736595153809, "learning_rate": 7.719298245614036e-07, "loss": 0.47785136103630066, "num_input_tokens_seen": 607000, "step": 1924, "train_runtime": 5150.5086, "train_tokens_per_second": 117.852 }, { "epoch": 0.08850574712643679, "grad_norm": 7.745916366577148, "learning_rate": 7.61904761904762e-07, "loss": 0.4454568028450012, "num_input_tokens_seen": 607248, "step": 1925, "train_runtime": 5152.4522, "train_tokens_per_second": 117.856 }, { "epoch": 0.08855172413793104, "grad_norm": 9.198076248168945, "learning_rate": 7.518796992481203e-07, "loss": 0.3640105724334717, "num_input_tokens_seen": 607568, "step": 1926, "train_runtime": 5154.403, "train_tokens_per_second": 117.874 }, { "epoch": 0.08859770114942529, "grad_norm": 6.8515729904174805, "learning_rate": 7.418546365914788e-07, "loss": 0.3322884440422058, "num_input_tokens_seen": 607936, "step": 1927, "train_runtime": 5156.3833, "train_tokens_per_second": 117.9 }, { "epoch": 0.08864367816091955, "grad_norm": 6.681099891662598, "learning_rate": 7.318295739348372e-07, "loss": 0.5460650324821472, "num_input_tokens_seen": 608304, "step": 1928, "train_runtime": 5158.3551, "train_tokens_per_second": 117.926 }, { "epoch": 0.0886896551724138, "grad_norm": 7.97550106048584, "learning_rate": 7.218045112781956e-07, "loss": 0.42101067304611206, "num_input_tokens_seen": 608522, "step": 1929, "train_runtime": 5160.2828, "train_tokens_per_second": 117.924 }, { "epoch": 0.08873563218390805, "grad_norm": 5.614116191864014, "learning_rate": 7.117794486215538e-07, "loss": 0.3722851574420929, "num_input_tokens_seen": 609350, "step": 1930, "train_runtime": 5162.3601, "train_tokens_per_second": 118.037 }, { "epoch": 0.0887816091954023, "grad_norm": 7.282567977905273, "learning_rate": 7.017543859649123e-07, "loss": 0.49573031067848206, "num_input_tokens_seen": 609714, "step": 1931, "train_runtime": 5164.3322, "train_tokens_per_second": 118.063 }, { "epoch": 0.08882758620689656, "grad_norm": 8.980059623718262, "learning_rate": 6.917293233082707e-07, "loss": 0.545059084892273, "num_input_tokens_seen": 610050, "step": 1932, "train_runtime": 5166.3002, "train_tokens_per_second": 118.083 }, { "epoch": 0.08887356321839081, "grad_norm": 7.481197357177734, "learning_rate": 6.817042606516292e-07, "loss": 0.5490928888320923, "num_input_tokens_seen": 610360, "step": 1933, "train_runtime": 5168.2608, "train_tokens_per_second": 118.098 }, { "epoch": 0.08891954022988506, "grad_norm": 7.990349769592285, "learning_rate": 6.716791979949876e-07, "loss": 0.5157485604286194, "num_input_tokens_seen": 610642, "step": 1934, "train_runtime": 5170.231, "train_tokens_per_second": 118.107 }, { "epoch": 0.08896551724137931, "grad_norm": 8.92601203918457, "learning_rate": 6.616541353383458e-07, "loss": 0.349660187959671, "num_input_tokens_seen": 610958, "step": 1935, "train_runtime": 5172.3834, "train_tokens_per_second": 118.119 }, { "epoch": 0.08901149425287357, "grad_norm": 6.907639980316162, "learning_rate": 6.516290726817042e-07, "loss": 0.4537245035171509, "num_input_tokens_seen": 611284, "step": 1936, "train_runtime": 5174.3828, "train_tokens_per_second": 118.137 }, { "epoch": 0.08905747126436782, "grad_norm": 8.429737091064453, "learning_rate": 6.416040100250627e-07, "loss": 0.49810856580734253, "num_input_tokens_seen": 611564, "step": 1937, "train_runtime": 5176.3494, "train_tokens_per_second": 118.146 }, { "epoch": 0.08910344827586207, "grad_norm": 9.396894454956055, "learning_rate": 6.315789473684211e-07, "loss": 0.4992244839668274, "num_input_tokens_seen": 611804, "step": 1938, "train_runtime": 5178.3308, "train_tokens_per_second": 118.147 }, { "epoch": 0.08914942528735632, "grad_norm": 8.50183391571045, "learning_rate": 6.215538847117795e-07, "loss": 0.389660120010376, "num_input_tokens_seen": 612092, "step": 1939, "train_runtime": 5180.2942, "train_tokens_per_second": 118.158 }, { "epoch": 0.08919540229885058, "grad_norm": 7.522252559661865, "learning_rate": 6.115288220551379e-07, "loss": 0.4363986849784851, "num_input_tokens_seen": 612416, "step": 1940, "train_runtime": 5182.2591, "train_tokens_per_second": 118.175 }, { "epoch": 0.08924137931034483, "grad_norm": 7.143253326416016, "learning_rate": 6.015037593984962e-07, "loss": 0.4299575388431549, "num_input_tokens_seen": 612742, "step": 1941, "train_runtime": 5184.2142, "train_tokens_per_second": 118.194 }, { "epoch": 0.08928735632183908, "grad_norm": 7.878231525421143, "learning_rate": 5.914786967418547e-07, "loss": 0.5424295663833618, "num_input_tokens_seen": 613132, "step": 1942, "train_runtime": 5186.1972, "train_tokens_per_second": 118.224 }, { "epoch": 0.08933333333333333, "grad_norm": 7.318743705749512, "learning_rate": 5.814536340852131e-07, "loss": 0.3889036476612091, "num_input_tokens_seen": 613416, "step": 1943, "train_runtime": 5188.1402, "train_tokens_per_second": 118.234 }, { "epoch": 0.08937931034482759, "grad_norm": 7.778266429901123, "learning_rate": 5.714285714285715e-07, "loss": 0.44363105297088623, "num_input_tokens_seen": 613664, "step": 1944, "train_runtime": 5190.0768, "train_tokens_per_second": 118.238 }, { "epoch": 0.08942528735632184, "grad_norm": 8.16820240020752, "learning_rate": 5.614035087719299e-07, "loss": 0.4059368371963501, "num_input_tokens_seen": 613982, "step": 1945, "train_runtime": 5192.0434, "train_tokens_per_second": 118.254 }, { "epoch": 0.08947126436781609, "grad_norm": 7.664226055145264, "learning_rate": 5.513784461152883e-07, "loss": 0.4748205542564392, "num_input_tokens_seen": 614360, "step": 1946, "train_runtime": 5193.9873, "train_tokens_per_second": 118.283 }, { "epoch": 0.08951724137931034, "grad_norm": 8.522714614868164, "learning_rate": 5.413533834586466e-07, "loss": 0.3064422607421875, "num_input_tokens_seen": 614600, "step": 1947, "train_runtime": 5195.9205, "train_tokens_per_second": 118.285 }, { "epoch": 0.0895632183908046, "grad_norm": 6.944787502288818, "learning_rate": 5.313283208020051e-07, "loss": 0.5053823590278625, "num_input_tokens_seen": 614884, "step": 1948, "train_runtime": 5197.8832, "train_tokens_per_second": 118.295 }, { "epoch": 0.08960919540229885, "grad_norm": 7.006589889526367, "learning_rate": 5.213032581453634e-07, "loss": 0.5162798166275024, "num_input_tokens_seen": 615168, "step": 1949, "train_runtime": 5199.824, "train_tokens_per_second": 118.306 }, { "epoch": 0.0896551724137931, "grad_norm": 7.0208587646484375, "learning_rate": 5.112781954887219e-07, "loss": 0.3463684618473053, "num_input_tokens_seen": 615406, "step": 1950, "train_runtime": 5201.8173, "train_tokens_per_second": 118.306 }, { "epoch": 0.08970114942528735, "grad_norm": 8.017606735229492, "learning_rate": 5.012531328320802e-07, "loss": 0.4508306682109833, "num_input_tokens_seen": 615704, "step": 1951, "train_runtime": 5216.5198, "train_tokens_per_second": 118.03 }, { "epoch": 0.08974712643678161, "grad_norm": 7.9229607582092285, "learning_rate": 4.912280701754387e-07, "loss": 0.46270182728767395, "num_input_tokens_seen": 616054, "step": 1952, "train_runtime": 5218.5133, "train_tokens_per_second": 118.052 }, { "epoch": 0.08979310344827586, "grad_norm": 6.196159839630127, "learning_rate": 4.81203007518797e-07, "loss": 0.4044492840766907, "num_input_tokens_seen": 616488, "step": 1953, "train_runtime": 5220.5335, "train_tokens_per_second": 118.089 }, { "epoch": 0.08983908045977011, "grad_norm": 8.939637184143066, "learning_rate": 4.711779448621554e-07, "loss": 0.4814576208591461, "num_input_tokens_seen": 616764, "step": 1954, "train_runtime": 5222.5264, "train_tokens_per_second": 118.097 }, { "epoch": 0.08988505747126437, "grad_norm": 9.98863410949707, "learning_rate": 4.6115288220551385e-07, "loss": 0.44973185658454895, "num_input_tokens_seen": 617038, "step": 1955, "train_runtime": 5224.468, "train_tokens_per_second": 118.105 }, { "epoch": 0.08993103448275862, "grad_norm": 8.118160247802734, "learning_rate": 4.511278195488722e-07, "loss": 0.8060194253921509, "num_input_tokens_seen": 617458, "step": 1956, "train_runtime": 5226.5359, "train_tokens_per_second": 118.139 }, { "epoch": 0.08997701149425287, "grad_norm": 8.639585494995117, "learning_rate": 4.411027568922306e-07, "loss": 0.41593390703201294, "num_input_tokens_seen": 617768, "step": 1957, "train_runtime": 5228.726, "train_tokens_per_second": 118.149 }, { "epoch": 0.09002298850574712, "grad_norm": 6.963311672210693, "learning_rate": 4.3107769423558905e-07, "loss": 0.4132186770439148, "num_input_tokens_seen": 618078, "step": 1958, "train_runtime": 5230.6867, "train_tokens_per_second": 118.164 }, { "epoch": 0.09006896551724138, "grad_norm": 6.928063869476318, "learning_rate": 4.210526315789474e-07, "loss": 0.46738407015800476, "num_input_tokens_seen": 618374, "step": 1959, "train_runtime": 5232.6462, "train_tokens_per_second": 118.176 }, { "epoch": 0.09011494252873563, "grad_norm": 6.987063407897949, "learning_rate": 4.110275689223058e-07, "loss": 0.3887450695037842, "num_input_tokens_seen": 618640, "step": 1960, "train_runtime": 5234.6425, "train_tokens_per_second": 118.182 }, { "epoch": 0.09016091954022988, "grad_norm": 9.057330131530762, "learning_rate": 4.010025062656642e-07, "loss": 0.5830927491188049, "num_input_tokens_seen": 619014, "step": 1961, "train_runtime": 5236.6084, "train_tokens_per_second": 118.209 }, { "epoch": 0.09020689655172413, "grad_norm": 8.036870956420898, "learning_rate": 3.909774436090226e-07, "loss": 0.39967769384384155, "num_input_tokens_seen": 619272, "step": 1962, "train_runtime": 5238.6378, "train_tokens_per_second": 118.212 }, { "epoch": 0.09025287356321839, "grad_norm": 8.644590377807617, "learning_rate": 3.80952380952381e-07, "loss": 0.45566412806510925, "num_input_tokens_seen": 619544, "step": 1963, "train_runtime": 5240.6292, "train_tokens_per_second": 118.219 }, { "epoch": 0.09029885057471264, "grad_norm": 8.846774101257324, "learning_rate": 3.709273182957394e-07, "loss": 0.35211920738220215, "num_input_tokens_seen": 619796, "step": 1964, "train_runtime": 5242.6112, "train_tokens_per_second": 118.223 }, { "epoch": 0.09034482758620689, "grad_norm": 7.386560916900635, "learning_rate": 3.609022556390978e-07, "loss": 0.4106683135032654, "num_input_tokens_seen": 620070, "step": 1965, "train_runtime": 5244.601, "train_tokens_per_second": 118.23 }, { "epoch": 0.09039080459770114, "grad_norm": 7.662647247314453, "learning_rate": 3.5087719298245616e-07, "loss": 0.414768248796463, "num_input_tokens_seen": 620352, "step": 1966, "train_runtime": 5246.5551, "train_tokens_per_second": 118.24 }, { "epoch": 0.0904367816091954, "grad_norm": 7.379946708679199, "learning_rate": 3.408521303258146e-07, "loss": 0.5533338189125061, "num_input_tokens_seen": 620708, "step": 1967, "train_runtime": 5248.5732, "train_tokens_per_second": 118.262 }, { "epoch": 0.09048275862068965, "grad_norm": 5.688102722167969, "learning_rate": 3.308270676691729e-07, "loss": 0.30439692735671997, "num_input_tokens_seen": 621016, "step": 1968, "train_runtime": 5250.5572, "train_tokens_per_second": 118.276 }, { "epoch": 0.0905287356321839, "grad_norm": 7.519008636474609, "learning_rate": 3.2080200501253136e-07, "loss": 0.45001494884490967, "num_input_tokens_seen": 621292, "step": 1969, "train_runtime": 5252.5832, "train_tokens_per_second": 118.283 }, { "epoch": 0.09057471264367815, "grad_norm": 8.505365371704102, "learning_rate": 3.1077694235588974e-07, "loss": 0.4692716598510742, "num_input_tokens_seen": 621558, "step": 1970, "train_runtime": 5254.5359, "train_tokens_per_second": 118.29 }, { "epoch": 0.09062068965517242, "grad_norm": 7.983728408813477, "learning_rate": 3.007518796992481e-07, "loss": 0.4891626238822937, "num_input_tokens_seen": 621856, "step": 1971, "train_runtime": 5256.5377, "train_tokens_per_second": 118.301 }, { "epoch": 0.09066666666666667, "grad_norm": 7.890754699707031, "learning_rate": 2.9072681704260656e-07, "loss": 0.48190662264823914, "num_input_tokens_seen": 622162, "step": 1972, "train_runtime": 5258.4965, "train_tokens_per_second": 118.316 }, { "epoch": 0.09071264367816093, "grad_norm": 7.7978596687316895, "learning_rate": 2.8070175438596494e-07, "loss": 0.46703723073005676, "num_input_tokens_seen": 622446, "step": 1973, "train_runtime": 5260.4611, "train_tokens_per_second": 118.325 }, { "epoch": 0.09075862068965518, "grad_norm": 9.207006454467773, "learning_rate": 2.706766917293233e-07, "loss": 0.4706171154975891, "num_input_tokens_seen": 622830, "step": 1974, "train_runtime": 5262.4203, "train_tokens_per_second": 118.354 }, { "epoch": 0.09080459770114943, "grad_norm": 7.43474817276001, "learning_rate": 2.606516290726817e-07, "loss": 0.43948253989219666, "num_input_tokens_seen": 623100, "step": 1975, "train_runtime": 5264.3793, "train_tokens_per_second": 118.362 }, { "epoch": 0.09085057471264368, "grad_norm": 7.330848693847656, "learning_rate": 2.506265664160401e-07, "loss": 0.4305328130722046, "num_input_tokens_seen": 623370, "step": 1976, "train_runtime": 5266.3846, "train_tokens_per_second": 118.368 }, { "epoch": 0.09089655172413794, "grad_norm": 9.419845581054688, "learning_rate": 2.406015037593985e-07, "loss": 0.4397188127040863, "num_input_tokens_seen": 623682, "step": 1977, "train_runtime": 5268.3391, "train_tokens_per_second": 118.383 }, { "epoch": 0.09094252873563219, "grad_norm": 7.668386936187744, "learning_rate": 2.3057644110275693e-07, "loss": 0.3994528353214264, "num_input_tokens_seen": 624000, "step": 1978, "train_runtime": 5270.3557, "train_tokens_per_second": 118.398 }, { "epoch": 0.09098850574712644, "grad_norm": 9.285679817199707, "learning_rate": 2.205513784461153e-07, "loss": 0.6182694435119629, "num_input_tokens_seen": 624358, "step": 1979, "train_runtime": 5272.457, "train_tokens_per_second": 118.419 }, { "epoch": 0.0910344827586207, "grad_norm": 7.558021068572998, "learning_rate": 2.105263157894737e-07, "loss": 0.5416414141654968, "num_input_tokens_seen": 624646, "step": 1980, "train_runtime": 5274.4287, "train_tokens_per_second": 118.429 }, { "epoch": 0.09108045977011495, "grad_norm": 8.10972785949707, "learning_rate": 2.005012531328321e-07, "loss": 0.41339346766471863, "num_input_tokens_seen": 624996, "step": 1981, "train_runtime": 5290.1793, "train_tokens_per_second": 118.143 }, { "epoch": 0.0911264367816092, "grad_norm": 8.973311424255371, "learning_rate": 1.904761904761905e-07, "loss": 0.4418382942676544, "num_input_tokens_seen": 625278, "step": 1982, "train_runtime": 5292.1961, "train_tokens_per_second": 118.151 }, { "epoch": 0.09117241379310345, "grad_norm": 7.290642738342285, "learning_rate": 1.804511278195489e-07, "loss": 0.466846227645874, "num_input_tokens_seen": 625644, "step": 1983, "train_runtime": 5294.1789, "train_tokens_per_second": 118.176 }, { "epoch": 0.0912183908045977, "grad_norm": 7.393955707550049, "learning_rate": 1.704260651629073e-07, "loss": 0.42903000116348267, "num_input_tokens_seen": 625978, "step": 1984, "train_runtime": 5296.2594, "train_tokens_per_second": 118.192 }, { "epoch": 0.09126436781609196, "grad_norm": 7.702242851257324, "learning_rate": 1.6040100250626568e-07, "loss": 0.531277596950531, "num_input_tokens_seen": 626260, "step": 1985, "train_runtime": 5298.2079, "train_tokens_per_second": 118.202 }, { "epoch": 0.09131034482758621, "grad_norm": 8.941267967224121, "learning_rate": 1.5037593984962406e-07, "loss": 0.4884231388568878, "num_input_tokens_seen": 626542, "step": 1986, "train_runtime": 5300.164, "train_tokens_per_second": 118.212 }, { "epoch": 0.09135632183908046, "grad_norm": 7.654355049133301, "learning_rate": 1.4035087719298247e-07, "loss": 0.3853590488433838, "num_input_tokens_seen": 626866, "step": 1987, "train_runtime": 5302.1362, "train_tokens_per_second": 118.229 }, { "epoch": 0.09140229885057471, "grad_norm": 7.743011474609375, "learning_rate": 1.3032581453634085e-07, "loss": 0.4582059383392334, "num_input_tokens_seen": 627266, "step": 1988, "train_runtime": 5304.1709, "train_tokens_per_second": 118.259 }, { "epoch": 0.09144827586206897, "grad_norm": 6.894120216369629, "learning_rate": 1.2030075187969926e-07, "loss": 0.43101340532302856, "num_input_tokens_seen": 627574, "step": 1989, "train_runtime": 5306.1319, "train_tokens_per_second": 118.273 }, { "epoch": 0.09149425287356322, "grad_norm": 8.84626293182373, "learning_rate": 1.1027568922305765e-07, "loss": 0.598413348197937, "num_input_tokens_seen": 627888, "step": 1990, "train_runtime": 5308.1433, "train_tokens_per_second": 118.288 }, { "epoch": 0.09154022988505747, "grad_norm": 10.974281311035156, "learning_rate": 1.0025062656641605e-07, "loss": 0.4394698739051819, "num_input_tokens_seen": 628118, "step": 1991, "train_runtime": 5310.0853, "train_tokens_per_second": 118.288 }, { "epoch": 0.09158620689655173, "grad_norm": 6.511246681213379, "learning_rate": 9.022556390977444e-08, "loss": 0.41420939564704895, "num_input_tokens_seen": 628438, "step": 1992, "train_runtime": 5312.0269, "train_tokens_per_second": 118.305 }, { "epoch": 0.09163218390804598, "grad_norm": 6.606043815612793, "learning_rate": 8.020050125313284e-08, "loss": 0.3737097978591919, "num_input_tokens_seen": 628778, "step": 1993, "train_runtime": 5314.0027, "train_tokens_per_second": 118.325 }, { "epoch": 0.09167816091954023, "grad_norm": 6.390109539031982, "learning_rate": 7.017543859649123e-08, "loss": 0.4567974805831909, "num_input_tokens_seen": 629192, "step": 1994, "train_runtime": 5315.9833, "train_tokens_per_second": 118.359 }, { "epoch": 0.09172413793103448, "grad_norm": 9.456647872924805, "learning_rate": 6.015037593984963e-08, "loss": 0.5348672866821289, "num_input_tokens_seen": 629514, "step": 1995, "train_runtime": 5317.9562, "train_tokens_per_second": 118.375 }, { "epoch": 0.09177011494252874, "grad_norm": 7.294930458068848, "learning_rate": 5.0125313283208025e-08, "loss": 0.5476741790771484, "num_input_tokens_seen": 629936, "step": 1996, "train_runtime": 5319.9153, "train_tokens_per_second": 118.411 }, { "epoch": 0.09181609195402299, "grad_norm": 8.284785270690918, "learning_rate": 4.010025062656642e-08, "loss": 0.3866909146308899, "num_input_tokens_seen": 630230, "step": 1997, "train_runtime": 5321.8832, "train_tokens_per_second": 118.422 }, { "epoch": 0.09186206896551724, "grad_norm": 8.145447731018066, "learning_rate": 3.0075187969924815e-08, "loss": 0.4199717342853546, "num_input_tokens_seen": 630492, "step": 1998, "train_runtime": 5323.843, "train_tokens_per_second": 118.428 }, { "epoch": 0.0919080459770115, "grad_norm": 7.085546016693115, "learning_rate": 2.005012531328321e-08, "loss": 0.3851563036441803, "num_input_tokens_seen": 630840, "step": 1999, "train_runtime": 5325.8038, "train_tokens_per_second": 118.45 }, { "epoch": 0.09195402298850575, "grad_norm": 6.691437721252441, "learning_rate": 1.0025062656641605e-08, "loss": 0.3576313853263855, "num_input_tokens_seen": 631158, "step": 2000, "train_runtime": 5327.7708, "train_tokens_per_second": 118.466 }, { "epoch": 0.09195402298850575, "eval_loss": 1.6557446718215942, "eval_runtime": 53.863, "eval_samples_per_second": 18.566, "eval_steps_per_second": 9.283, "num_input_tokens_seen": 631158, "step": 2000 } ], "logging_steps": 1, "max_steps": 2000, "num_input_tokens_seen": 631158, "num_train_epochs": 1, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 6446608710499584.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }