{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.1839080459770115, "eval_steps": 200, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 9.195402298850575e-05, "grad_norm": 29.12846565246582, "learning_rate": 0.0, "loss": 1.0049550533294678, "num_input_tokens_seen": 592, "step": 1, "train_runtime": 7.3694, "train_tokens_per_second": 80.332 }, { "epoch": 0.0001839080459770115, "grad_norm": 28.490211486816406, "learning_rate": 4.000000000000001e-06, "loss": 1.0715882778167725, "num_input_tokens_seen": 1180, "step": 2, "train_runtime": 9.2983, "train_tokens_per_second": 126.904 }, { "epoch": 0.00027586206896551725, "grad_norm": 25.38025665283203, "learning_rate": 8.000000000000001e-06, "loss": 0.9221532344818115, "num_input_tokens_seen": 1864, "step": 3, "train_runtime": 11.2178, "train_tokens_per_second": 166.164 }, { "epoch": 0.000367816091954023, "grad_norm": 33.270748138427734, "learning_rate": 1.2e-05, "loss": 0.7833482623100281, "num_input_tokens_seen": 2712, "step": 4, "train_runtime": 13.1157, "train_tokens_per_second": 206.775 }, { "epoch": 0.0004597701149425287, "grad_norm": 20.2131290435791, "learning_rate": 1.6000000000000003e-05, "loss": 0.7940477132797241, "num_input_tokens_seen": 3504, "step": 5, "train_runtime": 15.0072, "train_tokens_per_second": 233.488 }, { "epoch": 0.0005517241379310345, "grad_norm": 17.375965118408203, "learning_rate": 2e-05, "loss": 0.6811378598213196, "num_input_tokens_seen": 4204, "step": 6, "train_runtime": 16.9237, "train_tokens_per_second": 248.41 }, { "epoch": 0.0006436781609195402, "grad_norm": 19.164548873901367, "learning_rate": 1.998997493734336e-05, "loss": 0.5850780010223389, "num_input_tokens_seen": 4872, "step": 7, "train_runtime": 18.8068, "train_tokens_per_second": 259.055 }, { "epoch": 0.000735632183908046, "grad_norm": 9.285567283630371, "learning_rate": 1.997994987468672e-05, "loss": 0.6868342161178589, "num_input_tokens_seen": 6356, "step": 8, "train_runtime": 20.7877, "train_tokens_per_second": 305.758 }, { "epoch": 0.0008275862068965517, "grad_norm": 11.42162036895752, "learning_rate": 1.9969924812030075e-05, "loss": 0.6028171181678772, "num_input_tokens_seen": 7144, "step": 9, "train_runtime": 22.6773, "train_tokens_per_second": 315.028 }, { "epoch": 0.0009195402298850574, "grad_norm": 10.177748680114746, "learning_rate": 1.9959899749373436e-05, "loss": 0.6105828881263733, "num_input_tokens_seen": 7820, "step": 10, "train_runtime": 24.5836, "train_tokens_per_second": 318.098 }, { "epoch": 0.0010114942528735632, "grad_norm": 9.14651107788086, "learning_rate": 1.9949874686716792e-05, "loss": 0.6887412071228027, "num_input_tokens_seen": 8676, "step": 11, "train_runtime": 26.5012, "train_tokens_per_second": 327.382 }, { "epoch": 0.001103448275862069, "grad_norm": 9.492165565490723, "learning_rate": 1.9939849624060153e-05, "loss": 0.7147798538208008, "num_input_tokens_seen": 9560, "step": 12, "train_runtime": 28.4657, "train_tokens_per_second": 335.843 }, { "epoch": 0.0011954022988505746, "grad_norm": 8.382616996765137, "learning_rate": 1.992982456140351e-05, "loss": 0.5508676171302795, "num_input_tokens_seen": 10224, "step": 13, "train_runtime": 30.3593, "train_tokens_per_second": 336.766 }, { "epoch": 0.0012873563218390805, "grad_norm": 8.802109718322754, "learning_rate": 1.991979949874687e-05, "loss": 0.5035771131515503, "num_input_tokens_seen": 10784, "step": 14, "train_runtime": 32.2457, "train_tokens_per_second": 334.433 }, { "epoch": 0.001379310344827586, "grad_norm": 8.765376091003418, "learning_rate": 1.9909774436090226e-05, "loss": 0.5817534327507019, "num_input_tokens_seen": 11580, "step": 15, "train_runtime": 34.1678, "train_tokens_per_second": 338.915 }, { "epoch": 0.001471264367816092, "grad_norm": 8.994365692138672, "learning_rate": 1.9899749373433587e-05, "loss": 0.6585532426834106, "num_input_tokens_seen": 12340, "step": 16, "train_runtime": 36.0534, "train_tokens_per_second": 342.27 }, { "epoch": 0.0015632183908045978, "grad_norm": 8.071599006652832, "learning_rate": 1.9889724310776943e-05, "loss": 0.5290766954421997, "num_input_tokens_seen": 12940, "step": 17, "train_runtime": 37.9406, "train_tokens_per_second": 341.06 }, { "epoch": 0.0016551724137931034, "grad_norm": 9.644457817077637, "learning_rate": 1.9879699248120303e-05, "loss": 0.7164220809936523, "num_input_tokens_seen": 14640, "step": 18, "train_runtime": 40.0076, "train_tokens_per_second": 365.93 }, { "epoch": 0.0017471264367816092, "grad_norm": 8.754335403442383, "learning_rate": 1.986967418546366e-05, "loss": 0.6070724725723267, "num_input_tokens_seen": 15492, "step": 19, "train_runtime": 41.9315, "train_tokens_per_second": 369.459 }, { "epoch": 0.0018390804597701149, "grad_norm": 8.747954368591309, "learning_rate": 1.9859649122807017e-05, "loss": 0.5036498308181763, "num_input_tokens_seen": 16340, "step": 20, "train_runtime": 43.8604, "train_tokens_per_second": 372.546 }, { "epoch": 0.0019310344827586207, "grad_norm": 8.61439323425293, "learning_rate": 1.9849624060150377e-05, "loss": 0.47874048352241516, "num_input_tokens_seen": 16896, "step": 21, "train_runtime": 45.741, "train_tokens_per_second": 369.384 }, { "epoch": 0.0020229885057471263, "grad_norm": 8.474122047424316, "learning_rate": 1.9839598997493737e-05, "loss": 0.5896688103675842, "num_input_tokens_seen": 17892, "step": 22, "train_runtime": 47.6675, "train_tokens_per_second": 375.35 }, { "epoch": 0.0021149425287356324, "grad_norm": 9.135046005249023, "learning_rate": 1.9829573934837094e-05, "loss": 0.4764246344566345, "num_input_tokens_seen": 18576, "step": 23, "train_runtime": 49.5549, "train_tokens_per_second": 374.857 }, { "epoch": 0.002206896551724138, "grad_norm": 8.152758598327637, "learning_rate": 1.981954887218045e-05, "loss": 0.5896083116531372, "num_input_tokens_seen": 19380, "step": 24, "train_runtime": 51.4758, "train_tokens_per_second": 376.488 }, { "epoch": 0.0022988505747126436, "grad_norm": 7.929178714752197, "learning_rate": 1.980952380952381e-05, "loss": 0.7542365789413452, "num_input_tokens_seen": 20720, "step": 25, "train_runtime": 53.4594, "train_tokens_per_second": 387.584 }, { "epoch": 0.0023908045977011493, "grad_norm": 9.76752758026123, "learning_rate": 1.9799498746867168e-05, "loss": 0.6881550550460815, "num_input_tokens_seen": 21436, "step": 26, "train_runtime": 55.3448, "train_tokens_per_second": 387.318 }, { "epoch": 0.0024827586206896553, "grad_norm": 8.284303665161133, "learning_rate": 1.9789473684210528e-05, "loss": 0.5384884476661682, "num_input_tokens_seen": 21988, "step": 27, "train_runtime": 57.228, "train_tokens_per_second": 384.218 }, { "epoch": 0.002574712643678161, "grad_norm": 7.906507968902588, "learning_rate": 1.977944862155389e-05, "loss": 0.635601282119751, "num_input_tokens_seen": 22812, "step": 28, "train_runtime": 59.15, "train_tokens_per_second": 385.663 }, { "epoch": 0.0026666666666666666, "grad_norm": 8.403658866882324, "learning_rate": 1.9769423558897245e-05, "loss": 0.5284605026245117, "num_input_tokens_seen": 23504, "step": 29, "train_runtime": 61.0362, "train_tokens_per_second": 385.083 }, { "epoch": 0.002758620689655172, "grad_norm": 8.070573806762695, "learning_rate": 1.9759398496240602e-05, "loss": 0.6003434658050537, "num_input_tokens_seen": 24304, "step": 30, "train_runtime": 62.9134, "train_tokens_per_second": 386.309 }, { "epoch": 0.0028505747126436783, "grad_norm": 7.809580326080322, "learning_rate": 1.974937343358396e-05, "loss": 0.5435101985931396, "num_input_tokens_seen": 24980, "step": 31, "train_runtime": 71.4956, "train_tokens_per_second": 349.392 }, { "epoch": 0.002942528735632184, "grad_norm": 9.469648361206055, "learning_rate": 1.973934837092732e-05, "loss": 0.6884284019470215, "num_input_tokens_seen": 25968, "step": 32, "train_runtime": 73.4456, "train_tokens_per_second": 353.568 }, { "epoch": 0.0030344827586206895, "grad_norm": 7.747436046600342, "learning_rate": 1.972932330827068e-05, "loss": 0.4698449969291687, "num_input_tokens_seen": 26592, "step": 33, "train_runtime": 75.3303, "train_tokens_per_second": 353.005 }, { "epoch": 0.0031264367816091956, "grad_norm": 8.132604598999023, "learning_rate": 1.9719298245614036e-05, "loss": 0.5784815549850464, "num_input_tokens_seen": 27296, "step": 34, "train_runtime": 77.2232, "train_tokens_per_second": 353.469 }, { "epoch": 0.003218390804597701, "grad_norm": 7.501383304595947, "learning_rate": 1.9709273182957396e-05, "loss": 0.7156097292900085, "num_input_tokens_seen": 28108, "step": 35, "train_runtime": 79.1498, "train_tokens_per_second": 355.124 }, { "epoch": 0.003310344827586207, "grad_norm": 8.279403686523438, "learning_rate": 1.9699248120300753e-05, "loss": 0.5377761125564575, "num_input_tokens_seen": 28740, "step": 36, "train_runtime": 81.0569, "train_tokens_per_second": 354.566 }, { "epoch": 0.0034022988505747124, "grad_norm": 7.578561305999756, "learning_rate": 1.968922305764411e-05, "loss": 0.5211909413337708, "num_input_tokens_seen": 29340, "step": 37, "train_runtime": 82.9417, "train_tokens_per_second": 353.742 }, { "epoch": 0.0034942528735632185, "grad_norm": 7.668713092803955, "learning_rate": 1.967919799498747e-05, "loss": 0.6027074456214905, "num_input_tokens_seen": 29956, "step": 38, "train_runtime": 84.8345, "train_tokens_per_second": 353.111 }, { "epoch": 0.003586206896551724, "grad_norm": 7.965372085571289, "learning_rate": 1.966917293233083e-05, "loss": 0.5476580262184143, "num_input_tokens_seen": 30508, "step": 39, "train_runtime": 86.723, "train_tokens_per_second": 351.787 }, { "epoch": 0.0036781609195402297, "grad_norm": 8.622340202331543, "learning_rate": 1.9659147869674187e-05, "loss": 0.599757730960846, "num_input_tokens_seen": 31160, "step": 40, "train_runtime": 88.6236, "train_tokens_per_second": 351.599 }, { "epoch": 0.003770114942528736, "grad_norm": 8.414080619812012, "learning_rate": 1.9649122807017544e-05, "loss": 0.5053638815879822, "num_input_tokens_seen": 31792, "step": 41, "train_runtime": 90.5165, "train_tokens_per_second": 351.229 }, { "epoch": 0.0038620689655172414, "grad_norm": 8.579339027404785, "learning_rate": 1.9639097744360904e-05, "loss": 0.6343808174133301, "num_input_tokens_seen": 32860, "step": 42, "train_runtime": 92.4696, "train_tokens_per_second": 355.36 }, { "epoch": 0.0039540229885057475, "grad_norm": 7.376124382019043, "learning_rate": 1.962907268170426e-05, "loss": 0.48202601075172424, "num_input_tokens_seen": 33820, "step": 43, "train_runtime": 94.4085, "train_tokens_per_second": 358.23 }, { "epoch": 0.004045977011494253, "grad_norm": 8.69480037689209, "learning_rate": 1.961904761904762e-05, "loss": 0.586205244064331, "num_input_tokens_seen": 34464, "step": 44, "train_runtime": 96.314, "train_tokens_per_second": 357.83 }, { "epoch": 0.004137931034482759, "grad_norm": 7.8471527099609375, "learning_rate": 1.960902255639098e-05, "loss": 0.6266012191772461, "num_input_tokens_seen": 35312, "step": 45, "train_runtime": 98.3444, "train_tokens_per_second": 359.065 }, { "epoch": 0.004229885057471265, "grad_norm": 9.146677017211914, "learning_rate": 1.9598997493734338e-05, "loss": 0.6910461187362671, "num_input_tokens_seen": 36540, "step": 46, "train_runtime": 100.3279, "train_tokens_per_second": 364.206 }, { "epoch": 0.00432183908045977, "grad_norm": 7.88541841506958, "learning_rate": 1.9588972431077695e-05, "loss": 0.6365747451782227, "num_input_tokens_seen": 37644, "step": 47, "train_runtime": 102.3224, "train_tokens_per_second": 367.896 }, { "epoch": 0.004413793103448276, "grad_norm": 8.206524848937988, "learning_rate": 1.9578947368421055e-05, "loss": 0.5315179228782654, "num_input_tokens_seen": 38412, "step": 48, "train_runtime": 104.2731, "train_tokens_per_second": 368.379 }, { "epoch": 0.004505747126436781, "grad_norm": 8.704801559448242, "learning_rate": 1.956892230576441e-05, "loss": 0.5973373055458069, "num_input_tokens_seen": 38976, "step": 49, "train_runtime": 106.1861, "train_tokens_per_second": 367.054 }, { "epoch": 0.004597701149425287, "grad_norm": 8.045174598693848, "learning_rate": 1.9558897243107772e-05, "loss": 0.6078757047653198, "num_input_tokens_seen": 39648, "step": 50, "train_runtime": 108.0766, "train_tokens_per_second": 366.851 }, { "epoch": 0.004689655172413793, "grad_norm": 9.606939315795898, "learning_rate": 1.954887218045113e-05, "loss": 0.5741446018218994, "num_input_tokens_seen": 40364, "step": 51, "train_runtime": 109.9935, "train_tokens_per_second": 366.967 }, { "epoch": 0.0047816091954022985, "grad_norm": 7.9645676612854, "learning_rate": 1.953884711779449e-05, "loss": 0.5054519176483154, "num_input_tokens_seen": 40972, "step": 52, "train_runtime": 111.8772, "train_tokens_per_second": 366.223 }, { "epoch": 0.004873563218390805, "grad_norm": 9.297037124633789, "learning_rate": 1.9528822055137845e-05, "loss": 0.5256612300872803, "num_input_tokens_seen": 42188, "step": 53, "train_runtime": 113.8307, "train_tokens_per_second": 370.621 }, { "epoch": 0.004965517241379311, "grad_norm": 8.875506401062012, "learning_rate": 1.9518796992481202e-05, "loss": 0.5609273314476013, "num_input_tokens_seen": 42772, "step": 54, "train_runtime": 115.7116, "train_tokens_per_second": 369.643 }, { "epoch": 0.005057471264367816, "grad_norm": 7.938648223876953, "learning_rate": 1.9508771929824562e-05, "loss": 0.6343899369239807, "num_input_tokens_seen": 43780, "step": 55, "train_runtime": 117.6838, "train_tokens_per_second": 372.014 }, { "epoch": 0.005149425287356322, "grad_norm": 7.548194408416748, "learning_rate": 1.9498746867167923e-05, "loss": 0.6220943331718445, "num_input_tokens_seen": 45076, "step": 56, "train_runtime": 119.6727, "train_tokens_per_second": 376.661 }, { "epoch": 0.005241379310344828, "grad_norm": 8.334528923034668, "learning_rate": 1.948872180451128e-05, "loss": 0.6186922788619995, "num_input_tokens_seen": 45728, "step": 57, "train_runtime": 121.5646, "train_tokens_per_second": 376.162 }, { "epoch": 0.005333333333333333, "grad_norm": 8.271797180175781, "learning_rate": 1.947869674185464e-05, "loss": 0.5532838702201843, "num_input_tokens_seen": 46460, "step": 58, "train_runtime": 123.4469, "train_tokens_per_second": 376.356 }, { "epoch": 0.005425287356321839, "grad_norm": 7.5711846351623535, "learning_rate": 1.9468671679197996e-05, "loss": 0.4910699129104614, "num_input_tokens_seen": 47132, "step": 59, "train_runtime": 125.3402, "train_tokens_per_second": 376.032 }, { "epoch": 0.005517241379310344, "grad_norm": 8.477574348449707, "learning_rate": 1.9458646616541353e-05, "loss": 0.5690719485282898, "num_input_tokens_seen": 47780, "step": 60, "train_runtime": 127.216, "train_tokens_per_second": 375.582 }, { "epoch": 0.0056091954022988505, "grad_norm": 7.364357948303223, "learning_rate": 1.9448621553884713e-05, "loss": 0.605834424495697, "num_input_tokens_seen": 48944, "step": 61, "train_runtime": 135.7442, "train_tokens_per_second": 360.561 }, { "epoch": 0.0057011494252873565, "grad_norm": 8.096819877624512, "learning_rate": 1.9438596491228074e-05, "loss": 0.49838387966156006, "num_input_tokens_seen": 49484, "step": 62, "train_runtime": 137.6251, "train_tokens_per_second": 359.556 }, { "epoch": 0.005793103448275862, "grad_norm": 8.219697952270508, "learning_rate": 1.942857142857143e-05, "loss": 0.5258055925369263, "num_input_tokens_seen": 50200, "step": 63, "train_runtime": 139.5812, "train_tokens_per_second": 359.647 }, { "epoch": 0.005885057471264368, "grad_norm": 8.2337007522583, "learning_rate": 1.9418546365914787e-05, "loss": 0.54833984375, "num_input_tokens_seen": 50980, "step": 64, "train_runtime": 141.5768, "train_tokens_per_second": 360.087 }, { "epoch": 0.005977011494252874, "grad_norm": 7.676711082458496, "learning_rate": 1.9408521303258147e-05, "loss": 0.43378540873527527, "num_input_tokens_seen": 51580, "step": 65, "train_runtime": 143.4945, "train_tokens_per_second": 359.456 }, { "epoch": 0.006068965517241379, "grad_norm": 8.562492370605469, "learning_rate": 1.9398496240601504e-05, "loss": 0.49912506341934204, "num_input_tokens_seen": 52200, "step": 66, "train_runtime": 145.421, "train_tokens_per_second": 358.958 }, { "epoch": 0.006160919540229885, "grad_norm": 9.452392578125, "learning_rate": 1.9388471177944864e-05, "loss": 0.6256085634231567, "num_input_tokens_seen": 53200, "step": 67, "train_runtime": 147.4133, "train_tokens_per_second": 360.89 }, { "epoch": 0.006252873563218391, "grad_norm": 7.979230880737305, "learning_rate": 1.9378446115288224e-05, "loss": 0.4097839593887329, "num_input_tokens_seen": 53780, "step": 68, "train_runtime": 149.2951, "train_tokens_per_second": 360.226 }, { "epoch": 0.006344827586206896, "grad_norm": 7.691853046417236, "learning_rate": 1.936842105263158e-05, "loss": 0.41319534182548523, "num_input_tokens_seen": 54340, "step": 69, "train_runtime": 151.2002, "train_tokens_per_second": 359.391 }, { "epoch": 0.006436781609195402, "grad_norm": 7.792855739593506, "learning_rate": 1.9358395989974938e-05, "loss": 0.5904505848884583, "num_input_tokens_seen": 55136, "step": 70, "train_runtime": 153.1216, "train_tokens_per_second": 360.08 }, { "epoch": 0.0065287356321839084, "grad_norm": 7.832664966583252, "learning_rate": 1.9348370927318295e-05, "loss": 0.6427686214447021, "num_input_tokens_seen": 55992, "step": 71, "train_runtime": 155.0516, "train_tokens_per_second": 361.118 }, { "epoch": 0.006620689655172414, "grad_norm": 9.28006649017334, "learning_rate": 1.9338345864661655e-05, "loss": 0.49627256393432617, "num_input_tokens_seen": 56600, "step": 72, "train_runtime": 156.9191, "train_tokens_per_second": 360.695 }, { "epoch": 0.00671264367816092, "grad_norm": 9.48000717163086, "learning_rate": 1.9328320802005015e-05, "loss": 0.5595530867576599, "num_input_tokens_seen": 57360, "step": 73, "train_runtime": 158.8057, "train_tokens_per_second": 361.196 }, { "epoch": 0.006804597701149425, "grad_norm": 7.642348289489746, "learning_rate": 1.9318295739348372e-05, "loss": 0.5516754388809204, "num_input_tokens_seen": 59168, "step": 74, "train_runtime": 160.8679, "train_tokens_per_second": 367.805 }, { "epoch": 0.006896551724137931, "grad_norm": 8.76455307006836, "learning_rate": 1.9308270676691732e-05, "loss": 0.6654430031776428, "num_input_tokens_seen": 59984, "step": 75, "train_runtime": 162.7537, "train_tokens_per_second": 368.557 }, { "epoch": 0.006988505747126437, "grad_norm": 8.426393508911133, "learning_rate": 1.929824561403509e-05, "loss": 0.5090984106063843, "num_input_tokens_seen": 60672, "step": 76, "train_runtime": 164.6432, "train_tokens_per_second": 368.506 }, { "epoch": 0.007080459770114942, "grad_norm": 7.846069812774658, "learning_rate": 1.9288220551378446e-05, "loss": 0.6218851804733276, "num_input_tokens_seen": 61332, "step": 77, "train_runtime": 166.5232, "train_tokens_per_second": 368.309 }, { "epoch": 0.007172413793103448, "grad_norm": 8.188020706176758, "learning_rate": 1.9278195488721806e-05, "loss": 0.5355145335197449, "num_input_tokens_seen": 62092, "step": 78, "train_runtime": 168.4406, "train_tokens_per_second": 368.629 }, { "epoch": 0.007264367816091954, "grad_norm": 7.9347429275512695, "learning_rate": 1.9268170426065166e-05, "loss": 0.6026157736778259, "num_input_tokens_seen": 63364, "step": 79, "train_runtime": 170.386, "train_tokens_per_second": 371.885 }, { "epoch": 0.0073563218390804595, "grad_norm": 8.449371337890625, "learning_rate": 1.9258145363408523e-05, "loss": 0.5600061416625977, "num_input_tokens_seen": 64152, "step": 80, "train_runtime": 172.2723, "train_tokens_per_second": 372.387 }, { "epoch": 0.0074482758620689656, "grad_norm": 8.201337814331055, "learning_rate": 1.924812030075188e-05, "loss": 0.4756973087787628, "num_input_tokens_seen": 64848, "step": 81, "train_runtime": 174.1521, "train_tokens_per_second": 372.364 }, { "epoch": 0.007540229885057472, "grad_norm": 7.353557586669922, "learning_rate": 1.923809523809524e-05, "loss": 0.6228072643280029, "num_input_tokens_seen": 65848, "step": 82, "train_runtime": 176.0762, "train_tokens_per_second": 373.974 }, { "epoch": 0.007632183908045977, "grad_norm": 7.903290748596191, "learning_rate": 1.9228070175438597e-05, "loss": 0.5884923934936523, "num_input_tokens_seen": 66920, "step": 83, "train_runtime": 178.0269, "train_tokens_per_second": 375.898 }, { "epoch": 0.007724137931034483, "grad_norm": 6.583453178405762, "learning_rate": 1.9218045112781957e-05, "loss": 0.5183554887771606, "num_input_tokens_seen": 68648, "step": 84, "train_runtime": 180.1074, "train_tokens_per_second": 381.15 }, { "epoch": 0.007816091954022988, "grad_norm": 7.549685955047607, "learning_rate": 1.9208020050125317e-05, "loss": 0.5646144151687622, "num_input_tokens_seen": 69404, "step": 85, "train_runtime": 182.0299, "train_tokens_per_second": 381.278 }, { "epoch": 0.007908045977011495, "grad_norm": 7.347597122192383, "learning_rate": 1.9197994987468674e-05, "loss": 0.5947625637054443, "num_input_tokens_seen": 70088, "step": 86, "train_runtime": 183.9222, "train_tokens_per_second": 381.074 }, { "epoch": 0.008, "grad_norm": 7.432178020477295, "learning_rate": 1.918796992481203e-05, "loss": 0.4872491955757141, "num_input_tokens_seen": 70704, "step": 87, "train_runtime": 185.8038, "train_tokens_per_second": 380.53 }, { "epoch": 0.008091954022988505, "grad_norm": 6.862610340118408, "learning_rate": 1.917794486215539e-05, "loss": 0.4244173765182495, "num_input_tokens_seen": 71380, "step": 88, "train_runtime": 187.691, "train_tokens_per_second": 380.306 }, { "epoch": 0.008183908045977012, "grad_norm": 8.37441635131836, "learning_rate": 1.9167919799498748e-05, "loss": 0.6755821704864502, "num_input_tokens_seen": 73004, "step": 89, "train_runtime": 189.712, "train_tokens_per_second": 384.815 }, { "epoch": 0.008275862068965517, "grad_norm": 7.625087261199951, "learning_rate": 1.9157894736842108e-05, "loss": 0.5150968432426453, "num_input_tokens_seen": 73688, "step": 90, "train_runtime": 191.614, "train_tokens_per_second": 384.565 }, { "epoch": 0.008367816091954023, "grad_norm": 7.352773189544678, "learning_rate": 1.9147869674185465e-05, "loss": 0.5014460682868958, "num_input_tokens_seen": 74528, "step": 91, "train_runtime": 199.7209, "train_tokens_per_second": 373.161 }, { "epoch": 0.00845977011494253, "grad_norm": 7.710674285888672, "learning_rate": 1.9137844611528825e-05, "loss": 0.5669783353805542, "num_input_tokens_seen": 75320, "step": 92, "train_runtime": 201.7281, "train_tokens_per_second": 373.374 }, { "epoch": 0.008551724137931035, "grad_norm": 8.01150131225586, "learning_rate": 1.912781954887218e-05, "loss": 0.515295147895813, "num_input_tokens_seen": 76000, "step": 93, "train_runtime": 203.6283, "train_tokens_per_second": 373.229 }, { "epoch": 0.00864367816091954, "grad_norm": 6.6490678787231445, "learning_rate": 1.911779448621554e-05, "loss": 0.3702370524406433, "num_input_tokens_seen": 76568, "step": 94, "train_runtime": 205.5128, "train_tokens_per_second": 372.57 }, { "epoch": 0.008735632183908045, "grad_norm": 7.624765872955322, "learning_rate": 1.91077694235589e-05, "loss": 0.5499355792999268, "num_input_tokens_seen": 77332, "step": 95, "train_runtime": 207.4163, "train_tokens_per_second": 372.835 }, { "epoch": 0.008827586206896552, "grad_norm": 8.19070816040039, "learning_rate": 1.909774436090226e-05, "loss": 0.4549538791179657, "num_input_tokens_seen": 77996, "step": 96, "train_runtime": 209.3374, "train_tokens_per_second": 372.585 }, { "epoch": 0.008919540229885057, "grad_norm": 7.147436141967773, "learning_rate": 1.9087719298245616e-05, "loss": 0.47513991594314575, "num_input_tokens_seen": 78568, "step": 97, "train_runtime": 211.23, "train_tokens_per_second": 371.955 }, { "epoch": 0.009011494252873562, "grad_norm": 7.666897773742676, "learning_rate": 1.9077694235588976e-05, "loss": 0.5075606107711792, "num_input_tokens_seen": 79212, "step": 98, "train_runtime": 213.1298, "train_tokens_per_second": 371.661 }, { "epoch": 0.00910344827586207, "grad_norm": 7.700671195983887, "learning_rate": 1.9067669172932333e-05, "loss": 0.5114626288414001, "num_input_tokens_seen": 79956, "step": 99, "train_runtime": 215.0445, "train_tokens_per_second": 371.811 }, { "epoch": 0.009195402298850575, "grad_norm": 8.367555618286133, "learning_rate": 1.905764411027569e-05, "loss": 0.4240979850292206, "num_input_tokens_seen": 80552, "step": 100, "train_runtime": 216.9449, "train_tokens_per_second": 371.302 }, { "epoch": 0.00928735632183908, "grad_norm": 8.55939769744873, "learning_rate": 1.904761904761905e-05, "loss": 0.5901445746421814, "num_input_tokens_seen": 81288, "step": 101, "train_runtime": 218.8644, "train_tokens_per_second": 371.408 }, { "epoch": 0.009379310344827587, "grad_norm": 7.81965446472168, "learning_rate": 1.903759398496241e-05, "loss": 0.5190936326980591, "num_input_tokens_seen": 81896, "step": 102, "train_runtime": 220.7905, "train_tokens_per_second": 370.922 }, { "epoch": 0.009471264367816092, "grad_norm": 13.143085479736328, "learning_rate": 1.9027568922305766e-05, "loss": 0.5595793724060059, "num_input_tokens_seen": 82568, "step": 103, "train_runtime": 222.687, "train_tokens_per_second": 370.781 }, { "epoch": 0.009563218390804597, "grad_norm": 8.601846694946289, "learning_rate": 1.9017543859649123e-05, "loss": 0.47885704040527344, "num_input_tokens_seen": 83164, "step": 104, "train_runtime": 224.5775, "train_tokens_per_second": 370.313 }, { "epoch": 0.009655172413793104, "grad_norm": 9.756768226623535, "learning_rate": 1.9007518796992483e-05, "loss": 0.5794239640235901, "num_input_tokens_seen": 83896, "step": 105, "train_runtime": 226.4862, "train_tokens_per_second": 370.424 }, { "epoch": 0.00974712643678161, "grad_norm": 10.664995193481445, "learning_rate": 1.899749373433584e-05, "loss": 0.651731014251709, "num_input_tokens_seen": 84464, "step": 106, "train_runtime": 228.3805, "train_tokens_per_second": 369.839 }, { "epoch": 0.009839080459770114, "grad_norm": 8.48730754852295, "learning_rate": 1.89874686716792e-05, "loss": 0.5737159848213196, "num_input_tokens_seen": 85132, "step": 107, "train_runtime": 230.3206, "train_tokens_per_second": 369.624 }, { "epoch": 0.009931034482758621, "grad_norm": 8.69455337524414, "learning_rate": 1.8977443609022557e-05, "loss": 0.5830780863761902, "num_input_tokens_seen": 85960, "step": 108, "train_runtime": 232.2347, "train_tokens_per_second": 370.143 }, { "epoch": 0.010022988505747127, "grad_norm": 8.370550155639648, "learning_rate": 1.8967418546365917e-05, "loss": 0.6618383526802063, "num_input_tokens_seen": 87276, "step": 109, "train_runtime": 234.1896, "train_tokens_per_second": 372.672 }, { "epoch": 0.010114942528735632, "grad_norm": 7.473726272583008, "learning_rate": 1.8957393483709274e-05, "loss": 0.6731764674186707, "num_input_tokens_seen": 88400, "step": 110, "train_runtime": 236.1578, "train_tokens_per_second": 374.326 }, { "epoch": 0.010206896551724139, "grad_norm": 8.688715934753418, "learning_rate": 1.894736842105263e-05, "loss": 0.596034049987793, "num_input_tokens_seen": 89320, "step": 111, "train_runtime": 238.0888, "train_tokens_per_second": 375.154 }, { "epoch": 0.010298850574712644, "grad_norm": 7.928012847900391, "learning_rate": 1.893734335839599e-05, "loss": 0.5787239074707031, "num_input_tokens_seen": 89964, "step": 112, "train_runtime": 239.9884, "train_tokens_per_second": 374.868 }, { "epoch": 0.010390804597701149, "grad_norm": 9.923861503601074, "learning_rate": 1.892731829573935e-05, "loss": 0.5914971232414246, "num_input_tokens_seen": 90668, "step": 113, "train_runtime": 241.8905, "train_tokens_per_second": 374.831 }, { "epoch": 0.010482758620689656, "grad_norm": 6.971408843994141, "learning_rate": 1.8917293233082708e-05, "loss": 0.5332297086715698, "num_input_tokens_seen": 91472, "step": 114, "train_runtime": 243.8157, "train_tokens_per_second": 375.169 }, { "epoch": 0.010574712643678161, "grad_norm": 8.14550495147705, "learning_rate": 1.890726817042607e-05, "loss": 0.6091741323471069, "num_input_tokens_seen": 92200, "step": 115, "train_runtime": 245.7518, "train_tokens_per_second": 375.175 }, { "epoch": 0.010666666666666666, "grad_norm": 6.912510395050049, "learning_rate": 1.8897243107769425e-05, "loss": 0.49012452363967896, "num_input_tokens_seen": 92828, "step": 116, "train_runtime": 247.633, "train_tokens_per_second": 374.861 }, { "epoch": 0.010758620689655173, "grad_norm": 7.863478660583496, "learning_rate": 1.8887218045112782e-05, "loss": 0.5282617211341858, "num_input_tokens_seen": 93792, "step": 117, "train_runtime": 249.5678, "train_tokens_per_second": 375.818 }, { "epoch": 0.010850574712643678, "grad_norm": 8.387312889099121, "learning_rate": 1.8877192982456142e-05, "loss": 0.6196162700653076, "num_input_tokens_seen": 94400, "step": 118, "train_runtime": 251.4511, "train_tokens_per_second": 375.421 }, { "epoch": 0.010942528735632184, "grad_norm": 9.462424278259277, "learning_rate": 1.88671679197995e-05, "loss": 0.6195122003555298, "num_input_tokens_seen": 95144, "step": 119, "train_runtime": 253.3371, "train_tokens_per_second": 375.563 }, { "epoch": 0.011034482758620689, "grad_norm": 7.591942310333252, "learning_rate": 1.885714285714286e-05, "loss": 0.4428488612174988, "num_input_tokens_seen": 95780, "step": 120, "train_runtime": 255.2228, "train_tokens_per_second": 375.28 }, { "epoch": 0.011126436781609196, "grad_norm": 7.117181777954102, "learning_rate": 1.8847117794486216e-05, "loss": 0.565083920955658, "num_input_tokens_seen": 97264, "step": 121, "train_runtime": 263.4535, "train_tokens_per_second": 369.188 }, { "epoch": 0.011218390804597701, "grad_norm": 7.480065822601318, "learning_rate": 1.8837092731829576e-05, "loss": 0.6817567348480225, "num_input_tokens_seen": 98964, "step": 122, "train_runtime": 265.617, "train_tokens_per_second": 372.582 }, { "epoch": 0.011310344827586206, "grad_norm": 7.171160697937012, "learning_rate": 1.8827067669172933e-05, "loss": 0.4195317029953003, "num_input_tokens_seen": 99484, "step": 123, "train_runtime": 267.4988, "train_tokens_per_second": 371.905 }, { "epoch": 0.011402298850574713, "grad_norm": 7.548673629760742, "learning_rate": 1.8817042606516293e-05, "loss": 0.512393593788147, "num_input_tokens_seen": 100088, "step": 124, "train_runtime": 269.4043, "train_tokens_per_second": 371.516 }, { "epoch": 0.011494252873563218, "grad_norm": 7.146829128265381, "learning_rate": 1.880701754385965e-05, "loss": 0.5014789700508118, "num_input_tokens_seen": 100696, "step": 125, "train_runtime": 271.2988, "train_tokens_per_second": 371.163 }, { "epoch": 0.011586206896551723, "grad_norm": 7.781763553619385, "learning_rate": 1.879699248120301e-05, "loss": 0.6027175784111023, "num_input_tokens_seen": 101424, "step": 126, "train_runtime": 273.1785, "train_tokens_per_second": 371.274 }, { "epoch": 0.01167816091954023, "grad_norm": 7.295479774475098, "learning_rate": 1.8786967418546367e-05, "loss": 0.5001509189605713, "num_input_tokens_seen": 102172, "step": 127, "train_runtime": 275.0744, "train_tokens_per_second": 371.434 }, { "epoch": 0.011770114942528736, "grad_norm": 7.57470703125, "learning_rate": 1.8776942355889727e-05, "loss": 0.5681148767471313, "num_input_tokens_seen": 103564, "step": 128, "train_runtime": 277.0633, "train_tokens_per_second": 373.792 }, { "epoch": 0.01186206896551724, "grad_norm": 7.474367141723633, "learning_rate": 1.8766917293233084e-05, "loss": 0.4590882658958435, "num_input_tokens_seen": 104224, "step": 129, "train_runtime": 278.9515, "train_tokens_per_second": 373.628 }, { "epoch": 0.011954022988505748, "grad_norm": 6.8280510902404785, "learning_rate": 1.8756892230576444e-05, "loss": 0.5731692910194397, "num_input_tokens_seen": 105212, "step": 130, "train_runtime": 280.8758, "train_tokens_per_second": 374.585 }, { "epoch": 0.012045977011494253, "grad_norm": 7.685474872589111, "learning_rate": 1.87468671679198e-05, "loss": 0.5310137271881104, "num_input_tokens_seen": 105796, "step": 131, "train_runtime": 282.7592, "train_tokens_per_second": 374.156 }, { "epoch": 0.012137931034482758, "grad_norm": 7.769192695617676, "learning_rate": 1.873684210526316e-05, "loss": 0.49234193563461304, "num_input_tokens_seen": 106456, "step": 132, "train_runtime": 284.6456, "train_tokens_per_second": 373.995 }, { "epoch": 0.012229885057471265, "grad_norm": 7.137904167175293, "learning_rate": 1.8726817042606518e-05, "loss": 0.49794071912765503, "num_input_tokens_seen": 107404, "step": 133, "train_runtime": 286.6011, "train_tokens_per_second": 374.751 }, { "epoch": 0.01232183908045977, "grad_norm": 7.115078926086426, "learning_rate": 1.8716791979949875e-05, "loss": 0.5229765176773071, "num_input_tokens_seen": 108220, "step": 134, "train_runtime": 288.5295, "train_tokens_per_second": 375.074 }, { "epoch": 0.012413793103448275, "grad_norm": 6.738773822784424, "learning_rate": 1.8706766917293235e-05, "loss": 0.5511250495910645, "num_input_tokens_seen": 108980, "step": 135, "train_runtime": 290.4219, "train_tokens_per_second": 375.247 }, { "epoch": 0.012505747126436782, "grad_norm": 7.377186298370361, "learning_rate": 1.869674185463659e-05, "loss": 0.54349684715271, "num_input_tokens_seen": 109844, "step": 136, "train_runtime": 292.3474, "train_tokens_per_second": 375.731 }, { "epoch": 0.012597701149425287, "grad_norm": 7.415782928466797, "learning_rate": 1.868671679197995e-05, "loss": 0.481075257062912, "num_input_tokens_seen": 110660, "step": 137, "train_runtime": 294.2855, "train_tokens_per_second": 376.029 }, { "epoch": 0.012689655172413793, "grad_norm": 7.624503135681152, "learning_rate": 1.8676691729323312e-05, "loss": 0.6776347160339355, "num_input_tokens_seen": 111668, "step": 138, "train_runtime": 296.2393, "train_tokens_per_second": 376.952 }, { "epoch": 0.0127816091954023, "grad_norm": 7.655098915100098, "learning_rate": 1.866666666666667e-05, "loss": 0.4513550102710724, "num_input_tokens_seen": 112296, "step": 139, "train_runtime": 298.1362, "train_tokens_per_second": 376.66 }, { "epoch": 0.012873563218390805, "grad_norm": 7.344651222229004, "learning_rate": 1.8656641604010025e-05, "loss": 0.5229818820953369, "num_input_tokens_seen": 112892, "step": 140, "train_runtime": 300.0228, "train_tokens_per_second": 376.278 }, { "epoch": 0.01296551724137931, "grad_norm": 7.522806167602539, "learning_rate": 1.8646616541353386e-05, "loss": 0.5736265778541565, "num_input_tokens_seen": 113760, "step": 141, "train_runtime": 301.9488, "train_tokens_per_second": 376.753 }, { "epoch": 0.013057471264367817, "grad_norm": 7.7204742431640625, "learning_rate": 1.8636591478696742e-05, "loss": 0.5658729672431946, "num_input_tokens_seen": 114956, "step": 142, "train_runtime": 303.9391, "train_tokens_per_second": 378.221 }, { "epoch": 0.013149425287356322, "grad_norm": 6.6276984214782715, "learning_rate": 1.8626566416040103e-05, "loss": 0.4700078070163727, "num_input_tokens_seen": 115932, "step": 143, "train_runtime": 305.8725, "train_tokens_per_second": 379.021 }, { "epoch": 0.013241379310344827, "grad_norm": 7.029630661010742, "learning_rate": 1.861654135338346e-05, "loss": 0.5873706340789795, "num_input_tokens_seen": 116604, "step": 144, "train_runtime": 307.7698, "train_tokens_per_second": 378.868 }, { "epoch": 0.013333333333333334, "grad_norm": 7.206961631774902, "learning_rate": 1.860651629072682e-05, "loss": 0.6351268291473389, "num_input_tokens_seen": 117608, "step": 145, "train_runtime": 309.72, "train_tokens_per_second": 379.724 }, { "epoch": 0.01342528735632184, "grad_norm": 6.574268817901611, "learning_rate": 1.8596491228070176e-05, "loss": 0.4774665832519531, "num_input_tokens_seen": 118228, "step": 146, "train_runtime": 311.6299, "train_tokens_per_second": 379.386 }, { "epoch": 0.013517241379310345, "grad_norm": 7.435815811157227, "learning_rate": 1.8586466165413533e-05, "loss": 0.43258947134017944, "num_input_tokens_seen": 118776, "step": 147, "train_runtime": 313.5359, "train_tokens_per_second": 378.827 }, { "epoch": 0.01360919540229885, "grad_norm": 7.4443888664245605, "learning_rate": 1.8576441102756893e-05, "loss": 0.5305068492889404, "num_input_tokens_seen": 119380, "step": 148, "train_runtime": 315.4398, "train_tokens_per_second": 378.456 }, { "epoch": 0.013701149425287357, "grad_norm": 7.344997882843018, "learning_rate": 1.8566416040100254e-05, "loss": 0.5557343363761902, "num_input_tokens_seen": 120012, "step": 149, "train_runtime": 317.3617, "train_tokens_per_second": 378.155 }, { "epoch": 0.013793103448275862, "grad_norm": 7.7498955726623535, "learning_rate": 1.855639097744361e-05, "loss": 0.46552395820617676, "num_input_tokens_seen": 120808, "step": 150, "train_runtime": 319.2852, "train_tokens_per_second": 378.37 }, { "epoch": 0.013885057471264367, "grad_norm": 8.965892791748047, "learning_rate": 1.8546365914786967e-05, "loss": 0.6639130115509033, "num_input_tokens_seen": 121472, "step": 151, "train_runtime": 327.5003, "train_tokens_per_second": 370.907 }, { "epoch": 0.013977011494252874, "grad_norm": 7.571508884429932, "learning_rate": 1.8536340852130327e-05, "loss": 0.4892725944519043, "num_input_tokens_seen": 122152, "step": 152, "train_runtime": 329.4378, "train_tokens_per_second": 370.789 }, { "epoch": 0.01406896551724138, "grad_norm": 8.367015838623047, "learning_rate": 1.8526315789473684e-05, "loss": 0.5385444760322571, "num_input_tokens_seen": 122776, "step": 153, "train_runtime": 331.3947, "train_tokens_per_second": 370.483 }, { "epoch": 0.014160919540229884, "grad_norm": 6.705316543579102, "learning_rate": 1.8516290726817044e-05, "loss": 0.5696083903312683, "num_input_tokens_seen": 123688, "step": 154, "train_runtime": 333.3162, "train_tokens_per_second": 371.083 }, { "epoch": 0.014252873563218391, "grad_norm": 7.952955722808838, "learning_rate": 1.8506265664160404e-05, "loss": 0.5096924901008606, "num_input_tokens_seen": 124320, "step": 155, "train_runtime": 335.2047, "train_tokens_per_second": 370.878 }, { "epoch": 0.014344827586206896, "grad_norm": 8.218250274658203, "learning_rate": 1.849624060150376e-05, "loss": 0.5339059829711914, "num_input_tokens_seen": 124964, "step": 156, "train_runtime": 337.0894, "train_tokens_per_second": 370.715 }, { "epoch": 0.014436781609195402, "grad_norm": 7.730725288391113, "learning_rate": 1.8486215538847118e-05, "loss": 0.5613219141960144, "num_input_tokens_seen": 125960, "step": 157, "train_runtime": 339.0384, "train_tokens_per_second": 371.521 }, { "epoch": 0.014528735632183909, "grad_norm": 7.79622220993042, "learning_rate": 1.8476190476190478e-05, "loss": 0.620633602142334, "num_input_tokens_seen": 126764, "step": 158, "train_runtime": 340.9557, "train_tokens_per_second": 371.79 }, { "epoch": 0.014620689655172414, "grad_norm": 7.506601810455322, "learning_rate": 1.8466165413533835e-05, "loss": 0.5521153211593628, "num_input_tokens_seen": 127476, "step": 159, "train_runtime": 342.8699, "train_tokens_per_second": 371.791 }, { "epoch": 0.014712643678160919, "grad_norm": 7.675780773162842, "learning_rate": 1.8456140350877195e-05, "loss": 0.5243714451789856, "num_input_tokens_seen": 128148, "step": 160, "train_runtime": 344.7562, "train_tokens_per_second": 371.706 }, { "epoch": 0.014804597701149426, "grad_norm": 7.011389255523682, "learning_rate": 1.8446115288220552e-05, "loss": 0.522988498210907, "num_input_tokens_seen": 128792, "step": 161, "train_runtime": 346.6336, "train_tokens_per_second": 371.551 }, { "epoch": 0.014896551724137931, "grad_norm": 9.304445266723633, "learning_rate": 1.8436090225563912e-05, "loss": 0.5413367748260498, "num_input_tokens_seen": 129340, "step": 162, "train_runtime": 348.4954, "train_tokens_per_second": 371.138 }, { "epoch": 0.014988505747126436, "grad_norm": 8.286294937133789, "learning_rate": 1.842606516290727e-05, "loss": 0.45945218205451965, "num_input_tokens_seen": 130000, "step": 163, "train_runtime": 350.3797, "train_tokens_per_second": 371.026 }, { "epoch": 0.015080459770114943, "grad_norm": 7.830119609832764, "learning_rate": 1.8416040100250626e-05, "loss": 0.5834083557128906, "num_input_tokens_seen": 130652, "step": 164, "train_runtime": 352.2848, "train_tokens_per_second": 370.87 }, { "epoch": 0.015172413793103448, "grad_norm": 6.1280012130737305, "learning_rate": 1.8406015037593986e-05, "loss": 0.5597648620605469, "num_input_tokens_seen": 132264, "step": 165, "train_runtime": 354.3074, "train_tokens_per_second": 373.303 }, { "epoch": 0.015264367816091954, "grad_norm": 6.631570816040039, "learning_rate": 1.8395989974937346e-05, "loss": 0.4796145558357239, "num_input_tokens_seen": 132920, "step": 166, "train_runtime": 356.2071, "train_tokens_per_second": 373.154 }, { "epoch": 0.01535632183908046, "grad_norm": 7.558768272399902, "learning_rate": 1.8385964912280703e-05, "loss": 0.5823076367378235, "num_input_tokens_seen": 133732, "step": 167, "train_runtime": 358.1485, "train_tokens_per_second": 373.398 }, { "epoch": 0.015448275862068966, "grad_norm": 8.231863021850586, "learning_rate": 1.8375939849624063e-05, "loss": 0.5344194173812866, "num_input_tokens_seen": 134456, "step": 168, "train_runtime": 360.0532, "train_tokens_per_second": 373.434 }, { "epoch": 0.015540229885057471, "grad_norm": 7.6874918937683105, "learning_rate": 1.836591478696742e-05, "loss": 0.49539342522621155, "num_input_tokens_seen": 135232, "step": 169, "train_runtime": 361.9481, "train_tokens_per_second": 373.623 }, { "epoch": 0.015632183908045976, "grad_norm": 7.448578834533691, "learning_rate": 1.8355889724310777e-05, "loss": 0.5806928873062134, "num_input_tokens_seen": 135920, "step": 170, "train_runtime": 363.8556, "train_tokens_per_second": 373.555 }, { "epoch": 0.01572413793103448, "grad_norm": 7.790022373199463, "learning_rate": 1.8345864661654137e-05, "loss": 0.5202723145484924, "num_input_tokens_seen": 136640, "step": 171, "train_runtime": 365.8044, "train_tokens_per_second": 373.533 }, { "epoch": 0.01581609195402299, "grad_norm": 8.534542083740234, "learning_rate": 1.8335839598997497e-05, "loss": 0.5159137845039368, "num_input_tokens_seen": 137316, "step": 172, "train_runtime": 367.7069, "train_tokens_per_second": 373.439 }, { "epoch": 0.015908045977011495, "grad_norm": 7.472785949707031, "learning_rate": 1.8325814536340854e-05, "loss": 0.5066118836402893, "num_input_tokens_seen": 137852, "step": 173, "train_runtime": 369.6042, "train_tokens_per_second": 372.972 }, { "epoch": 0.016, "grad_norm": 8.05160903930664, "learning_rate": 1.831578947368421e-05, "loss": 0.5389904975891113, "num_input_tokens_seen": 138592, "step": 174, "train_runtime": 371.4986, "train_tokens_per_second": 373.062 }, { "epoch": 0.016091954022988506, "grad_norm": 7.358802318572998, "learning_rate": 1.830576441102757e-05, "loss": 0.4707336723804474, "num_input_tokens_seen": 139180, "step": 175, "train_runtime": 373.3832, "train_tokens_per_second": 372.754 }, { "epoch": 0.01618390804597701, "grad_norm": 8.020739555358887, "learning_rate": 1.8295739348370928e-05, "loss": 0.6465672850608826, "num_input_tokens_seen": 140032, "step": 176, "train_runtime": 375.3123, "train_tokens_per_second": 373.108 }, { "epoch": 0.016275862068965516, "grad_norm": 8.557355880737305, "learning_rate": 1.8285714285714288e-05, "loss": 0.5434992909431458, "num_input_tokens_seen": 140760, "step": 177, "train_runtime": 377.2407, "train_tokens_per_second": 373.13 }, { "epoch": 0.016367816091954025, "grad_norm": 7.8487749099731445, "learning_rate": 1.8275689223057648e-05, "loss": 0.5491044521331787, "num_input_tokens_seen": 141376, "step": 178, "train_runtime": 379.1302, "train_tokens_per_second": 372.896 }, { "epoch": 0.01645977011494253, "grad_norm": 8.528973579406738, "learning_rate": 1.8265664160401005e-05, "loss": 0.5439373850822449, "num_input_tokens_seen": 142224, "step": 179, "train_runtime": 381.0765, "train_tokens_per_second": 373.216 }, { "epoch": 0.016551724137931035, "grad_norm": 8.664113998413086, "learning_rate": 1.825563909774436e-05, "loss": 0.5221170783042908, "num_input_tokens_seen": 143128, "step": 180, "train_runtime": 383.0288, "train_tokens_per_second": 373.674 }, { "epoch": 0.01664367816091954, "grad_norm": 7.165023326873779, "learning_rate": 1.824561403508772e-05, "loss": 0.5653952956199646, "num_input_tokens_seen": 143724, "step": 181, "train_runtime": 391.4096, "train_tokens_per_second": 367.196 }, { "epoch": 0.016735632183908045, "grad_norm": 7.648165702819824, "learning_rate": 1.823558897243108e-05, "loss": 0.6471481919288635, "num_input_tokens_seen": 144416, "step": 182, "train_runtime": 393.2982, "train_tokens_per_second": 367.192 }, { "epoch": 0.01682758620689655, "grad_norm": 7.569953918457031, "learning_rate": 1.822556390977444e-05, "loss": 0.5339801907539368, "num_input_tokens_seen": 145112, "step": 183, "train_runtime": 395.1992, "train_tokens_per_second": 367.187 }, { "epoch": 0.01691954022988506, "grad_norm": 6.800056457519531, "learning_rate": 1.8215538847117796e-05, "loss": 0.5550782084465027, "num_input_tokens_seen": 146044, "step": 184, "train_runtime": 397.1537, "train_tokens_per_second": 367.727 }, { "epoch": 0.017011494252873564, "grad_norm": 8.55329704284668, "learning_rate": 1.8205513784461156e-05, "loss": 0.5194864869117737, "num_input_tokens_seen": 146600, "step": 185, "train_runtime": 399.0518, "train_tokens_per_second": 367.371 }, { "epoch": 0.01710344827586207, "grad_norm": 7.240639686584473, "learning_rate": 1.8195488721804512e-05, "loss": 0.5830307006835938, "num_input_tokens_seen": 147380, "step": 186, "train_runtime": 401.0028, "train_tokens_per_second": 367.529 }, { "epoch": 0.017195402298850575, "grad_norm": 8.107155799865723, "learning_rate": 1.818546365914787e-05, "loss": 0.5524142980575562, "num_input_tokens_seen": 148104, "step": 187, "train_runtime": 402.964, "train_tokens_per_second": 367.537 }, { "epoch": 0.01728735632183908, "grad_norm": 7.435492038726807, "learning_rate": 1.817543859649123e-05, "loss": 0.6043378710746765, "num_input_tokens_seen": 149284, "step": 188, "train_runtime": 404.9412, "train_tokens_per_second": 368.656 }, { "epoch": 0.017379310344827585, "grad_norm": 6.442080020904541, "learning_rate": 1.816541353383459e-05, "loss": 0.46551936864852905, "num_input_tokens_seen": 150324, "step": 189, "train_runtime": 406.875, "train_tokens_per_second": 369.46 }, { "epoch": 0.01747126436781609, "grad_norm": 6.798178195953369, "learning_rate": 1.8155388471177946e-05, "loss": 0.49806857109069824, "num_input_tokens_seen": 151148, "step": 190, "train_runtime": 408.8109, "train_tokens_per_second": 369.726 }, { "epoch": 0.0175632183908046, "grad_norm": 7.303373336791992, "learning_rate": 1.8145363408521303e-05, "loss": 0.45829498767852783, "num_input_tokens_seen": 151860, "step": 191, "train_runtime": 410.7081, "train_tokens_per_second": 369.752 }, { "epoch": 0.017655172413793104, "grad_norm": 7.943329811096191, "learning_rate": 1.8135338345864663e-05, "loss": 0.5377188920974731, "num_input_tokens_seen": 152984, "step": 192, "train_runtime": 412.6619, "train_tokens_per_second": 370.725 }, { "epoch": 0.01774712643678161, "grad_norm": 7.833362579345703, "learning_rate": 1.812531328320802e-05, "loss": 0.5730334520339966, "num_input_tokens_seen": 153640, "step": 193, "train_runtime": 414.5476, "train_tokens_per_second": 370.621 }, { "epoch": 0.017839080459770115, "grad_norm": 7.654214382171631, "learning_rate": 1.811528822055138e-05, "loss": 0.5064957737922668, "num_input_tokens_seen": 154212, "step": 194, "train_runtime": 416.4986, "train_tokens_per_second": 370.258 }, { "epoch": 0.01793103448275862, "grad_norm": 7.190835952758789, "learning_rate": 1.810526315789474e-05, "loss": 0.498201847076416, "num_input_tokens_seen": 154832, "step": 195, "train_runtime": 418.3974, "train_tokens_per_second": 370.06 }, { "epoch": 0.018022988505747125, "grad_norm": 7.107874393463135, "learning_rate": 1.8095238095238097e-05, "loss": 0.547589123249054, "num_input_tokens_seen": 155480, "step": 196, "train_runtime": 420.3576, "train_tokens_per_second": 369.876 }, { "epoch": 0.018114942528735634, "grad_norm": 7.128254413604736, "learning_rate": 1.8085213032581454e-05, "loss": 0.4057043790817261, "num_input_tokens_seen": 156068, "step": 197, "train_runtime": 422.2485, "train_tokens_per_second": 369.612 }, { "epoch": 0.01820689655172414, "grad_norm": 6.993947982788086, "learning_rate": 1.8075187969924814e-05, "loss": 0.4971397817134857, "num_input_tokens_seen": 156796, "step": 198, "train_runtime": 424.1386, "train_tokens_per_second": 369.681 }, { "epoch": 0.018298850574712644, "grad_norm": 7.305413246154785, "learning_rate": 1.806516290726817e-05, "loss": 0.5406436920166016, "num_input_tokens_seen": 157392, "step": 199, "train_runtime": 426.0503, "train_tokens_per_second": 369.421 }, { "epoch": 0.01839080459770115, "grad_norm": 7.552101135253906, "learning_rate": 1.805513784461153e-05, "loss": 0.585086464881897, "num_input_tokens_seen": 158068, "step": 200, "train_runtime": 427.941, "train_tokens_per_second": 369.369 }, { "epoch": 0.01839080459770115, "eval_loss": 2.040510416030884, "eval_runtime": 28.0516, "eval_samples_per_second": 35.649, "eval_steps_per_second": 8.912, "num_input_tokens_seen": 158068, "step": 200 }, { "epoch": 0.018482758620689654, "grad_norm": 8.1217622756958, "learning_rate": 1.8045112781954888e-05, "loss": 0.5849893689155579, "num_input_tokens_seen": 158748, "step": 201, "train_runtime": 457.9204, "train_tokens_per_second": 346.672 }, { "epoch": 0.01857471264367816, "grad_norm": 7.835590839385986, "learning_rate": 1.8035087719298248e-05, "loss": 0.6012417674064636, "num_input_tokens_seen": 159464, "step": 202, "train_runtime": 459.8195, "train_tokens_per_second": 346.797 }, { "epoch": 0.018666666666666668, "grad_norm": 7.545464515686035, "learning_rate": 1.8025062656641605e-05, "loss": 0.6498401165008545, "num_input_tokens_seen": 160492, "step": 203, "train_runtime": 461.76, "train_tokens_per_second": 347.566 }, { "epoch": 0.018758620689655173, "grad_norm": 6.976754188537598, "learning_rate": 1.8015037593984962e-05, "loss": 0.4431565999984741, "num_input_tokens_seen": 161056, "step": 204, "train_runtime": 463.6636, "train_tokens_per_second": 347.355 }, { "epoch": 0.01885057471264368, "grad_norm": 7.590615749359131, "learning_rate": 1.8005012531328322e-05, "loss": 0.5572191476821899, "num_input_tokens_seen": 162040, "step": 205, "train_runtime": 465.6237, "train_tokens_per_second": 348.006 }, { "epoch": 0.018942528735632184, "grad_norm": 7.885451793670654, "learning_rate": 1.7994987468671682e-05, "loss": 0.5881732702255249, "num_input_tokens_seen": 162736, "step": 206, "train_runtime": 467.5271, "train_tokens_per_second": 348.078 }, { "epoch": 0.01903448275862069, "grad_norm": 7.598711013793945, "learning_rate": 1.798496240601504e-05, "loss": 0.5935019850730896, "num_input_tokens_seen": 163956, "step": 207, "train_runtime": 469.5279, "train_tokens_per_second": 349.193 }, { "epoch": 0.019126436781609194, "grad_norm": 6.595381736755371, "learning_rate": 1.79749373433584e-05, "loss": 0.4594612121582031, "num_input_tokens_seen": 164600, "step": 208, "train_runtime": 471.4212, "train_tokens_per_second": 349.157 }, { "epoch": 0.019218390804597703, "grad_norm": 8.24846076965332, "learning_rate": 1.7964912280701756e-05, "loss": 0.5824248194694519, "num_input_tokens_seen": 165280, "step": 209, "train_runtime": 473.3561, "train_tokens_per_second": 349.166 }, { "epoch": 0.019310344827586208, "grad_norm": 7.064051151275635, "learning_rate": 1.7954887218045113e-05, "loss": 0.4960821270942688, "num_input_tokens_seen": 165936, "step": 210, "train_runtime": 475.255, "train_tokens_per_second": 349.152 }, { "epoch": 0.019402298850574713, "grad_norm": 7.1449971199035645, "learning_rate": 1.7944862155388473e-05, "loss": 0.532036304473877, "num_input_tokens_seen": 166496, "step": 211, "train_runtime": 483.4971, "train_tokens_per_second": 344.358 }, { "epoch": 0.01949425287356322, "grad_norm": 7.421840667724609, "learning_rate": 1.7934837092731833e-05, "loss": 0.6296423077583313, "num_input_tokens_seen": 167480, "step": 212, "train_runtime": 485.468, "train_tokens_per_second": 344.987 }, { "epoch": 0.019586206896551724, "grad_norm": 7.221124649047852, "learning_rate": 1.792481203007519e-05, "loss": 0.47323280572891235, "num_input_tokens_seen": 168028, "step": 213, "train_runtime": 487.3766, "train_tokens_per_second": 344.76 }, { "epoch": 0.01967816091954023, "grad_norm": 7.000731468200684, "learning_rate": 1.7914786967418547e-05, "loss": 0.514447808265686, "num_input_tokens_seen": 168684, "step": 214, "train_runtime": 489.2893, "train_tokens_per_second": 344.753 }, { "epoch": 0.019770114942528734, "grad_norm": 7.600850582122803, "learning_rate": 1.7904761904761907e-05, "loss": 0.5671390891075134, "num_input_tokens_seen": 169720, "step": 215, "train_runtime": 491.264, "train_tokens_per_second": 345.476 }, { "epoch": 0.019862068965517243, "grad_norm": 7.677800178527832, "learning_rate": 1.7894736842105264e-05, "loss": 0.5139601826667786, "num_input_tokens_seen": 170640, "step": 216, "train_runtime": 493.1983, "train_tokens_per_second": 345.987 }, { "epoch": 0.019954022988505748, "grad_norm": 7.964269161224365, "learning_rate": 1.7884711779448624e-05, "loss": 0.5507964491844177, "num_input_tokens_seen": 171284, "step": 217, "train_runtime": 495.09, "train_tokens_per_second": 345.965 }, { "epoch": 0.020045977011494253, "grad_norm": 7.0535807609558105, "learning_rate": 1.7874686716791984e-05, "loss": 0.5258899331092834, "num_input_tokens_seen": 171928, "step": 218, "train_runtime": 496.9832, "train_tokens_per_second": 345.943 }, { "epoch": 0.020137931034482758, "grad_norm": 7.253530979156494, "learning_rate": 1.786466165413534e-05, "loss": 0.47745299339294434, "num_input_tokens_seen": 172484, "step": 219, "train_runtime": 498.8784, "train_tokens_per_second": 345.744 }, { "epoch": 0.020229885057471263, "grad_norm": 7.037721633911133, "learning_rate": 1.7854636591478698e-05, "loss": 0.5528386831283569, "num_input_tokens_seen": 173252, "step": 220, "train_runtime": 500.7811, "train_tokens_per_second": 345.964 }, { "epoch": 0.02032183908045977, "grad_norm": 8.044549942016602, "learning_rate": 1.7844611528822054e-05, "loss": 0.5703632831573486, "num_input_tokens_seen": 174108, "step": 221, "train_runtime": 502.7378, "train_tokens_per_second": 346.32 }, { "epoch": 0.020413793103448277, "grad_norm": 8.174488067626953, "learning_rate": 1.7834586466165415e-05, "loss": 0.647956132888794, "num_input_tokens_seen": 174944, "step": 222, "train_runtime": 504.6707, "train_tokens_per_second": 346.65 }, { "epoch": 0.020505747126436782, "grad_norm": 6.857749938964844, "learning_rate": 1.7824561403508775e-05, "loss": 0.42070627212524414, "num_input_tokens_seen": 175608, "step": 223, "train_runtime": 506.5865, "train_tokens_per_second": 346.65 }, { "epoch": 0.020597701149425288, "grad_norm": 7.1977972984313965, "learning_rate": 1.781453634085213e-05, "loss": 0.4759255647659302, "num_input_tokens_seen": 176304, "step": 224, "train_runtime": 508.5197, "train_tokens_per_second": 346.7 }, { "epoch": 0.020689655172413793, "grad_norm": 8.122084617614746, "learning_rate": 1.7804511278195492e-05, "loss": 0.5117164850234985, "num_input_tokens_seen": 176988, "step": 225, "train_runtime": 510.4634, "train_tokens_per_second": 346.72 }, { "epoch": 0.020781609195402298, "grad_norm": 8.753883361816406, "learning_rate": 1.779448621553885e-05, "loss": 0.6285914778709412, "num_input_tokens_seen": 177868, "step": 226, "train_runtime": 512.4213, "train_tokens_per_second": 347.113 }, { "epoch": 0.020873563218390803, "grad_norm": 8.017762184143066, "learning_rate": 1.7784461152882205e-05, "loss": 0.4385458827018738, "num_input_tokens_seen": 178496, "step": 227, "train_runtime": 514.3449, "train_tokens_per_second": 347.036 }, { "epoch": 0.020965517241379312, "grad_norm": 6.637861251831055, "learning_rate": 1.7774436090225566e-05, "loss": 0.41486579179763794, "num_input_tokens_seen": 179028, "step": 228, "train_runtime": 516.2433, "train_tokens_per_second": 346.79 }, { "epoch": 0.021057471264367817, "grad_norm": 7.022968769073486, "learning_rate": 1.7764411027568926e-05, "loss": 0.5290236473083496, "num_input_tokens_seen": 179752, "step": 229, "train_runtime": 518.1484, "train_tokens_per_second": 346.912 }, { "epoch": 0.021149425287356322, "grad_norm": 7.590112686157227, "learning_rate": 1.7754385964912283e-05, "loss": 0.5051460862159729, "num_input_tokens_seen": 180596, "step": 230, "train_runtime": 520.0747, "train_tokens_per_second": 347.25 }, { "epoch": 0.021241379310344827, "grad_norm": 7.5514702796936035, "learning_rate": 1.774436090225564e-05, "loss": 0.4634629189968109, "num_input_tokens_seen": 181284, "step": 231, "train_runtime": 521.9776, "train_tokens_per_second": 347.302 }, { "epoch": 0.021333333333333333, "grad_norm": 5.992765426635742, "learning_rate": 1.7734335839599e-05, "loss": 0.47778037190437317, "num_input_tokens_seen": 182468, "step": 232, "train_runtime": 523.9507, "train_tokens_per_second": 348.254 }, { "epoch": 0.021425287356321838, "grad_norm": 7.337306976318359, "learning_rate": 1.7724310776942356e-05, "loss": 0.5078150629997253, "num_input_tokens_seen": 183060, "step": 233, "train_runtime": 525.8389, "train_tokens_per_second": 348.129 }, { "epoch": 0.021517241379310346, "grad_norm": 8.190838813781738, "learning_rate": 1.7714285714285717e-05, "loss": 0.6096634864807129, "num_input_tokens_seen": 183764, "step": 234, "train_runtime": 527.7719, "train_tokens_per_second": 348.188 }, { "epoch": 0.02160919540229885, "grad_norm": 8.298602104187012, "learning_rate": 1.7704260651629073e-05, "loss": 0.5493342280387878, "num_input_tokens_seen": 184504, "step": 235, "train_runtime": 529.7032, "train_tokens_per_second": 348.316 }, { "epoch": 0.021701149425287357, "grad_norm": 6.748563766479492, "learning_rate": 1.7694235588972433e-05, "loss": 0.5589863061904907, "num_input_tokens_seen": 185332, "step": 236, "train_runtime": 531.6396, "train_tokens_per_second": 348.605 }, { "epoch": 0.021793103448275862, "grad_norm": 7.466015338897705, "learning_rate": 1.768421052631579e-05, "loss": 0.5016068816184998, "num_input_tokens_seen": 185900, "step": 237, "train_runtime": 533.5417, "train_tokens_per_second": 348.426 }, { "epoch": 0.021885057471264367, "grad_norm": 6.749599933624268, "learning_rate": 1.767418546365915e-05, "loss": 0.5446072220802307, "num_input_tokens_seen": 186916, "step": 238, "train_runtime": 535.5178, "train_tokens_per_second": 349.038 }, { "epoch": 0.021977011494252872, "grad_norm": 8.142538070678711, "learning_rate": 1.7664160401002507e-05, "loss": 0.47896608710289, "num_input_tokens_seen": 187520, "step": 239, "train_runtime": 537.467, "train_tokens_per_second": 348.896 }, { "epoch": 0.022068965517241378, "grad_norm": 7.028704643249512, "learning_rate": 1.7654135338345867e-05, "loss": 0.5260388255119324, "num_input_tokens_seen": 188244, "step": 240, "train_runtime": 539.4071, "train_tokens_per_second": 348.983 }, { "epoch": 0.022160919540229886, "grad_norm": 6.732629299163818, "learning_rate": 1.7644110275689224e-05, "loss": 0.6071557998657227, "num_input_tokens_seen": 190136, "step": 241, "train_runtime": 547.7035, "train_tokens_per_second": 347.151 }, { "epoch": 0.02225287356321839, "grad_norm": 6.396223545074463, "learning_rate": 1.7634085213032584e-05, "loss": 0.47636085748672485, "num_input_tokens_seen": 190776, "step": 242, "train_runtime": 549.6296, "train_tokens_per_second": 347.099 }, { "epoch": 0.022344827586206897, "grad_norm": 7.123258113861084, "learning_rate": 1.762406015037594e-05, "loss": 0.5651535987854004, "num_input_tokens_seen": 191492, "step": 243, "train_runtime": 551.6421, "train_tokens_per_second": 347.131 }, { "epoch": 0.022436781609195402, "grad_norm": 7.592582702636719, "learning_rate": 1.7614035087719298e-05, "loss": 0.5869500041007996, "num_input_tokens_seen": 192244, "step": 244, "train_runtime": 553.5882, "train_tokens_per_second": 347.269 }, { "epoch": 0.022528735632183907, "grad_norm": 7.659783363342285, "learning_rate": 1.7604010025062658e-05, "loss": 0.5372046232223511, "num_input_tokens_seen": 193056, "step": 245, "train_runtime": 555.5172, "train_tokens_per_second": 347.525 }, { "epoch": 0.022620689655172412, "grad_norm": 7.2951788902282715, "learning_rate": 1.7593984962406015e-05, "loss": 0.5913550853729248, "num_input_tokens_seen": 193632, "step": 246, "train_runtime": 557.4088, "train_tokens_per_second": 347.379 }, { "epoch": 0.02271264367816092, "grad_norm": 7.493248462677002, "learning_rate": 1.7583959899749375e-05, "loss": 0.648095428943634, "num_input_tokens_seen": 194468, "step": 247, "train_runtime": 559.366, "train_tokens_per_second": 347.658 }, { "epoch": 0.022804597701149426, "grad_norm": 6.816006183624268, "learning_rate": 1.7573934837092735e-05, "loss": 0.5106541514396667, "num_input_tokens_seen": 195100, "step": 248, "train_runtime": 561.2475, "train_tokens_per_second": 347.619 }, { "epoch": 0.02289655172413793, "grad_norm": 8.779420852661133, "learning_rate": 1.7563909774436092e-05, "loss": 0.5156307220458984, "num_input_tokens_seen": 195844, "step": 249, "train_runtime": 563.1295, "train_tokens_per_second": 347.778 }, { "epoch": 0.022988505747126436, "grad_norm": 6.330947399139404, "learning_rate": 1.755388471177945e-05, "loss": 0.566486656665802, "num_input_tokens_seen": 196664, "step": 250, "train_runtime": 565.074, "train_tokens_per_second": 348.032 }, { "epoch": 0.02308045977011494, "grad_norm": 7.991855621337891, "learning_rate": 1.754385964912281e-05, "loss": 0.5192869901657104, "num_input_tokens_seen": 197168, "step": 251, "train_runtime": 567.021, "train_tokens_per_second": 347.726 }, { "epoch": 0.023172413793103447, "grad_norm": 9.131534576416016, "learning_rate": 1.7533834586466166e-05, "loss": 0.5779814124107361, "num_input_tokens_seen": 198076, "step": 252, "train_runtime": 568.9457, "train_tokens_per_second": 348.146 }, { "epoch": 0.023264367816091956, "grad_norm": 6.700856685638428, "learning_rate": 1.7523809523809526e-05, "loss": 0.5244114398956299, "num_input_tokens_seen": 198616, "step": 253, "train_runtime": 570.8471, "train_tokens_per_second": 347.932 }, { "epoch": 0.02335632183908046, "grad_norm": 7.709068298339844, "learning_rate": 1.7513784461152883e-05, "loss": 0.5432565808296204, "num_input_tokens_seen": 199348, "step": 254, "train_runtime": 572.7795, "train_tokens_per_second": 348.036 }, { "epoch": 0.023448275862068966, "grad_norm": 7.840363502502441, "learning_rate": 1.7503759398496243e-05, "loss": 0.6463830471038818, "num_input_tokens_seen": 200348, "step": 255, "train_runtime": 574.7446, "train_tokens_per_second": 348.586 }, { "epoch": 0.02354022988505747, "grad_norm": 7.466499328613281, "learning_rate": 1.74937343358396e-05, "loss": 0.6219689249992371, "num_input_tokens_seen": 201288, "step": 256, "train_runtime": 576.7192, "train_tokens_per_second": 349.023 }, { "epoch": 0.023632183908045976, "grad_norm": 7.196322441101074, "learning_rate": 1.7483709273182957e-05, "loss": 0.4431312382221222, "num_input_tokens_seen": 202012, "step": 257, "train_runtime": 578.6366, "train_tokens_per_second": 349.117 }, { "epoch": 0.02372413793103448, "grad_norm": 6.883704662322998, "learning_rate": 1.7473684210526317e-05, "loss": 0.5374019742012024, "num_input_tokens_seen": 202716, "step": 258, "train_runtime": 580.5259, "train_tokens_per_second": 349.194 }, { "epoch": 0.02381609195402299, "grad_norm": 7.998088359832764, "learning_rate": 1.7463659147869677e-05, "loss": 0.5854915976524353, "num_input_tokens_seen": 203360, "step": 259, "train_runtime": 582.4157, "train_tokens_per_second": 349.166 }, { "epoch": 0.023908045977011495, "grad_norm": 7.955687999725342, "learning_rate": 1.7453634085213034e-05, "loss": 0.6497164964675903, "num_input_tokens_seen": 204056, "step": 260, "train_runtime": 584.2994, "train_tokens_per_second": 349.232 }, { "epoch": 0.024, "grad_norm": 7.1547322273254395, "learning_rate": 1.744360902255639e-05, "loss": 0.41980886459350586, "num_input_tokens_seen": 204944, "step": 261, "train_runtime": 586.2316, "train_tokens_per_second": 349.596 }, { "epoch": 0.024091954022988506, "grad_norm": 7.54673433303833, "learning_rate": 1.743358395989975e-05, "loss": 0.5536658763885498, "num_input_tokens_seen": 205500, "step": 262, "train_runtime": 588.1355, "train_tokens_per_second": 349.409 }, { "epoch": 0.02418390804597701, "grad_norm": 7.382690906524658, "learning_rate": 1.7423558897243108e-05, "loss": 0.6529373526573181, "num_input_tokens_seen": 206492, "step": 263, "train_runtime": 590.1008, "train_tokens_per_second": 349.927 }, { "epoch": 0.024275862068965516, "grad_norm": 7.5943098068237305, "learning_rate": 1.7413533834586468e-05, "loss": 0.5493870377540588, "num_input_tokens_seen": 207152, "step": 264, "train_runtime": 592.0444, "train_tokens_per_second": 349.893 }, { "epoch": 0.02436781609195402, "grad_norm": 7.41045618057251, "learning_rate": 1.7403508771929828e-05, "loss": 0.5508020520210266, "num_input_tokens_seen": 207860, "step": 265, "train_runtime": 593.9381, "train_tokens_per_second": 349.969 }, { "epoch": 0.02445977011494253, "grad_norm": 6.776822566986084, "learning_rate": 1.7393483709273185e-05, "loss": 0.5031247735023499, "num_input_tokens_seen": 208508, "step": 266, "train_runtime": 595.833, "train_tokens_per_second": 349.944 }, { "epoch": 0.024551724137931035, "grad_norm": 8.271478652954102, "learning_rate": 1.738345864661654e-05, "loss": 0.4709621071815491, "num_input_tokens_seen": 209376, "step": 267, "train_runtime": 597.7989, "train_tokens_per_second": 350.245 }, { "epoch": 0.02464367816091954, "grad_norm": 6.908759593963623, "learning_rate": 1.7373433583959902e-05, "loss": 0.5502421259880066, "num_input_tokens_seen": 210492, "step": 268, "train_runtime": 599.7666, "train_tokens_per_second": 350.957 }, { "epoch": 0.024735632183908045, "grad_norm": 7.29292106628418, "learning_rate": 1.736340852130326e-05, "loss": 0.557747483253479, "num_input_tokens_seen": 211200, "step": 269, "train_runtime": 601.663, "train_tokens_per_second": 351.027 }, { "epoch": 0.02482758620689655, "grad_norm": 6.774946689605713, "learning_rate": 1.735338345864662e-05, "loss": 0.5118838548660278, "num_input_tokens_seen": 211868, "step": 270, "train_runtime": 603.5524, "train_tokens_per_second": 351.035 }, { "epoch": 0.024919540229885056, "grad_norm": 7.238329887390137, "learning_rate": 1.7343358395989975e-05, "loss": 0.614051342010498, "num_input_tokens_seen": 212612, "step": 271, "train_runtime": 611.6827, "train_tokens_per_second": 347.585 }, { "epoch": 0.025011494252873565, "grad_norm": 6.524905204772949, "learning_rate": 1.7333333333333336e-05, "loss": 0.5046440362930298, "num_input_tokens_seen": 213204, "step": 272, "train_runtime": 613.9334, "train_tokens_per_second": 347.275 }, { "epoch": 0.02510344827586207, "grad_norm": 8.400614738464355, "learning_rate": 1.7323308270676692e-05, "loss": 0.6119961738586426, "num_input_tokens_seen": 213896, "step": 273, "train_runtime": 615.8391, "train_tokens_per_second": 347.324 }, { "epoch": 0.025195402298850575, "grad_norm": 7.2303900718688965, "learning_rate": 1.731328320802005e-05, "loss": 0.5299623608589172, "num_input_tokens_seen": 214556, "step": 274, "train_runtime": 617.7405, "train_tokens_per_second": 347.324 }, { "epoch": 0.02528735632183908, "grad_norm": 6.81049108505249, "learning_rate": 1.730325814536341e-05, "loss": 0.528329610824585, "num_input_tokens_seen": 215248, "step": 275, "train_runtime": 619.6613, "train_tokens_per_second": 347.364 }, { "epoch": 0.025379310344827585, "grad_norm": 7.140843868255615, "learning_rate": 1.729323308270677e-05, "loss": 0.4379081428050995, "num_input_tokens_seen": 216176, "step": 276, "train_runtime": 621.5847, "train_tokens_per_second": 347.782 }, { "epoch": 0.02547126436781609, "grad_norm": 8.193724632263184, "learning_rate": 1.7283208020050126e-05, "loss": 0.6148580312728882, "num_input_tokens_seen": 217052, "step": 277, "train_runtime": 623.5334, "train_tokens_per_second": 348.1 }, { "epoch": 0.0255632183908046, "grad_norm": 8.05411148071289, "learning_rate": 1.7273182957393487e-05, "loss": 0.5443435907363892, "num_input_tokens_seen": 217816, "step": 278, "train_runtime": 625.4334, "train_tokens_per_second": 348.264 }, { "epoch": 0.025655172413793104, "grad_norm": 7.705923080444336, "learning_rate": 1.7263157894736843e-05, "loss": 0.5824005603790283, "num_input_tokens_seen": 218520, "step": 279, "train_runtime": 627.3256, "train_tokens_per_second": 348.336 }, { "epoch": 0.02574712643678161, "grad_norm": 7.342845916748047, "learning_rate": 1.72531328320802e-05, "loss": 0.5593616962432861, "num_input_tokens_seen": 219480, "step": 280, "train_runtime": 629.2501, "train_tokens_per_second": 348.796 }, { "epoch": 0.025839080459770115, "grad_norm": 7.2280778884887695, "learning_rate": 1.724310776942356e-05, "loss": 0.6934468746185303, "num_input_tokens_seen": 220408, "step": 281, "train_runtime": 631.1774, "train_tokens_per_second": 349.201 }, { "epoch": 0.02593103448275862, "grad_norm": 9.139898300170898, "learning_rate": 1.723308270676692e-05, "loss": 0.5340681672096252, "num_input_tokens_seen": 220996, "step": 282, "train_runtime": 633.0838, "train_tokens_per_second": 349.079 }, { "epoch": 0.026022988505747125, "grad_norm": 7.518560409545898, "learning_rate": 1.7223057644110277e-05, "loss": 0.5287448763847351, "num_input_tokens_seen": 221592, "step": 283, "train_runtime": 634.9804, "train_tokens_per_second": 348.975 }, { "epoch": 0.026114942528735634, "grad_norm": 6.808462142944336, "learning_rate": 1.7213032581453634e-05, "loss": 0.47242191433906555, "num_input_tokens_seen": 222288, "step": 284, "train_runtime": 636.8682, "train_tokens_per_second": 349.033 }, { "epoch": 0.02620689655172414, "grad_norm": 7.224859714508057, "learning_rate": 1.7203007518796994e-05, "loss": 0.5434243679046631, "num_input_tokens_seen": 222948, "step": 285, "train_runtime": 638.777, "train_tokens_per_second": 349.023 }, { "epoch": 0.026298850574712644, "grad_norm": 7.309472560882568, "learning_rate": 1.719298245614035e-05, "loss": 0.49765464663505554, "num_input_tokens_seen": 223592, "step": 286, "train_runtime": 640.6969, "train_tokens_per_second": 348.982 }, { "epoch": 0.02639080459770115, "grad_norm": 7.0516862869262695, "learning_rate": 1.718295739348371e-05, "loss": 0.4650920629501343, "num_input_tokens_seen": 224504, "step": 287, "train_runtime": 642.6571, "train_tokens_per_second": 349.337 }, { "epoch": 0.026482758620689655, "grad_norm": 7.711924076080322, "learning_rate": 1.717293233082707e-05, "loss": 0.5413693189620972, "num_input_tokens_seen": 225156, "step": 288, "train_runtime": 644.5908, "train_tokens_per_second": 349.301 }, { "epoch": 0.02657471264367816, "grad_norm": 6.597391605377197, "learning_rate": 1.7162907268170428e-05, "loss": 0.47959834337234497, "num_input_tokens_seen": 225716, "step": 289, "train_runtime": 646.5015, "train_tokens_per_second": 349.135 }, { "epoch": 0.02666666666666667, "grad_norm": 6.937802314758301, "learning_rate": 1.7152882205513785e-05, "loss": 0.5246532559394836, "num_input_tokens_seen": 226472, "step": 290, "train_runtime": 648.4354, "train_tokens_per_second": 349.259 }, { "epoch": 0.026758620689655174, "grad_norm": 7.025156497955322, "learning_rate": 1.7142857142857142e-05, "loss": 0.4767950773239136, "num_input_tokens_seen": 227260, "step": 291, "train_runtime": 650.366, "train_tokens_per_second": 349.434 }, { "epoch": 0.02685057471264368, "grad_norm": 6.792970180511475, "learning_rate": 1.7132832080200502e-05, "loss": 0.4855608344078064, "num_input_tokens_seen": 227876, "step": 292, "train_runtime": 652.2724, "train_tokens_per_second": 349.357 }, { "epoch": 0.026942528735632184, "grad_norm": 6.304465293884277, "learning_rate": 1.7122807017543862e-05, "loss": 0.4634402394294739, "num_input_tokens_seen": 228468, "step": 293, "train_runtime": 654.1767, "train_tokens_per_second": 349.245 }, { "epoch": 0.02703448275862069, "grad_norm": 7.347883224487305, "learning_rate": 1.711278195488722e-05, "loss": 0.49251794815063477, "num_input_tokens_seen": 229120, "step": 294, "train_runtime": 656.0684, "train_tokens_per_second": 349.232 }, { "epoch": 0.027126436781609194, "grad_norm": 7.306178569793701, "learning_rate": 1.710275689223058e-05, "loss": 0.4296570420265198, "num_input_tokens_seen": 229800, "step": 295, "train_runtime": 657.9788, "train_tokens_per_second": 349.251 }, { "epoch": 0.0272183908045977, "grad_norm": 7.8655219078063965, "learning_rate": 1.7092731829573936e-05, "loss": 0.418113112449646, "num_input_tokens_seen": 230396, "step": 296, "train_runtime": 659.9753, "train_tokens_per_second": 349.098 }, { "epoch": 0.027310344827586208, "grad_norm": 6.831302642822266, "learning_rate": 1.7082706766917293e-05, "loss": 0.5011525750160217, "num_input_tokens_seen": 231020, "step": 297, "train_runtime": 661.8719, "train_tokens_per_second": 349.04 }, { "epoch": 0.027402298850574713, "grad_norm": 7.1317243576049805, "learning_rate": 1.7072681704260653e-05, "loss": 0.5581461787223816, "num_input_tokens_seen": 231636, "step": 298, "train_runtime": 663.7711, "train_tokens_per_second": 348.97 }, { "epoch": 0.02749425287356322, "grad_norm": 8.014022827148438, "learning_rate": 1.7062656641604013e-05, "loss": 0.4860498905181885, "num_input_tokens_seen": 232208, "step": 299, "train_runtime": 665.66, "train_tokens_per_second": 348.839 }, { "epoch": 0.027586206896551724, "grad_norm": 7.223250389099121, "learning_rate": 1.705263157894737e-05, "loss": 0.5932018756866455, "num_input_tokens_seen": 233212, "step": 300, "train_runtime": 667.6343, "train_tokens_per_second": 349.311 }, { "epoch": 0.02767816091954023, "grad_norm": 6.203488826751709, "learning_rate": 1.7042606516290727e-05, "loss": 0.4114920496940613, "num_input_tokens_seen": 233744, "step": 301, "train_runtime": 676.0733, "train_tokens_per_second": 345.738 }, { "epoch": 0.027770114942528734, "grad_norm": 7.068984508514404, "learning_rate": 1.7032581453634087e-05, "loss": 0.48409998416900635, "num_input_tokens_seen": 234376, "step": 302, "train_runtime": 678.0913, "train_tokens_per_second": 345.641 }, { "epoch": 0.027862068965517243, "grad_norm": 6.957635402679443, "learning_rate": 1.7022556390977444e-05, "loss": 0.5025308728218079, "num_input_tokens_seen": 235152, "step": 303, "train_runtime": 680.1595, "train_tokens_per_second": 345.731 }, { "epoch": 0.027954022988505748, "grad_norm": 7.4896650314331055, "learning_rate": 1.7012531328320804e-05, "loss": 0.5307778120040894, "num_input_tokens_seen": 235736, "step": 304, "train_runtime": 682.0385, "train_tokens_per_second": 345.634 }, { "epoch": 0.028045977011494253, "grad_norm": 6.645881652832031, "learning_rate": 1.7002506265664164e-05, "loss": 0.42069652676582336, "num_input_tokens_seen": 236504, "step": 305, "train_runtime": 683.9612, "train_tokens_per_second": 345.786 }, { "epoch": 0.02813793103448276, "grad_norm": 6.69299840927124, "learning_rate": 1.699248120300752e-05, "loss": 0.5573474764823914, "num_input_tokens_seen": 237360, "step": 306, "train_runtime": 685.9102, "train_tokens_per_second": 346.051 }, { "epoch": 0.028229885057471264, "grad_norm": 15.929272651672363, "learning_rate": 1.6982456140350878e-05, "loss": 0.475852906703949, "num_input_tokens_seen": 238012, "step": 307, "train_runtime": 687.8612, "train_tokens_per_second": 346.017 }, { "epoch": 0.02832183908045977, "grad_norm": 8.076292037963867, "learning_rate": 1.6972431077694238e-05, "loss": 0.6119599938392639, "num_input_tokens_seen": 238804, "step": 308, "train_runtime": 689.7721, "train_tokens_per_second": 346.207 }, { "epoch": 0.028413793103448277, "grad_norm": 7.994293212890625, "learning_rate": 1.6962406015037595e-05, "loss": 0.5304892659187317, "num_input_tokens_seen": 239544, "step": 309, "train_runtime": 691.7, "train_tokens_per_second": 346.312 }, { "epoch": 0.028505747126436783, "grad_norm": 7.314886093139648, "learning_rate": 1.6952380952380955e-05, "loss": 0.5019823908805847, "num_input_tokens_seen": 240252, "step": 310, "train_runtime": 693.5857, "train_tokens_per_second": 346.391 }, { "epoch": 0.028597701149425288, "grad_norm": 7.226398468017578, "learning_rate": 1.694235588972431e-05, "loss": 0.5056269764900208, "num_input_tokens_seen": 241092, "step": 311, "train_runtime": 695.5132, "train_tokens_per_second": 346.639 }, { "epoch": 0.028689655172413793, "grad_norm": 7.674276828765869, "learning_rate": 1.6932330827067672e-05, "loss": 0.5091602802276611, "num_input_tokens_seen": 241748, "step": 312, "train_runtime": 697.4204, "train_tokens_per_second": 346.632 }, { "epoch": 0.028781609195402298, "grad_norm": 7.352941989898682, "learning_rate": 1.692230576441103e-05, "loss": 0.6187993884086609, "num_input_tokens_seen": 242908, "step": 313, "train_runtime": 699.4205, "train_tokens_per_second": 347.299 }, { "epoch": 0.028873563218390803, "grad_norm": 6.615414619445801, "learning_rate": 1.6912280701754385e-05, "loss": 0.5045319199562073, "num_input_tokens_seen": 243740, "step": 314, "train_runtime": 701.3581, "train_tokens_per_second": 347.526 }, { "epoch": 0.028965517241379312, "grad_norm": 7.64569616317749, "learning_rate": 1.6902255639097746e-05, "loss": 0.5935924649238586, "num_input_tokens_seen": 244772, "step": 315, "train_runtime": 703.3276, "train_tokens_per_second": 348.02 }, { "epoch": 0.029057471264367817, "grad_norm": 7.15838623046875, "learning_rate": 1.6892230576441106e-05, "loss": 0.5581420063972473, "num_input_tokens_seen": 246072, "step": 316, "train_runtime": 705.331, "train_tokens_per_second": 348.874 }, { "epoch": 0.029149425287356322, "grad_norm": 7.60428524017334, "learning_rate": 1.6882205513784463e-05, "loss": 0.5789986848831177, "num_input_tokens_seen": 246808, "step": 317, "train_runtime": 707.2303, "train_tokens_per_second": 348.978 }, { "epoch": 0.029241379310344828, "grad_norm": 8.331788063049316, "learning_rate": 1.6872180451127823e-05, "loss": 0.4795679450035095, "num_input_tokens_seen": 247472, "step": 318, "train_runtime": 709.1367, "train_tokens_per_second": 348.976 }, { "epoch": 0.029333333333333333, "grad_norm": 6.896542549133301, "learning_rate": 1.686215538847118e-05, "loss": 0.49073925614356995, "num_input_tokens_seen": 248160, "step": 319, "train_runtime": 711.0311, "train_tokens_per_second": 349.014 }, { "epoch": 0.029425287356321838, "grad_norm": 6.418603420257568, "learning_rate": 1.6852130325814536e-05, "loss": 0.5961854457855225, "num_input_tokens_seen": 249272, "step": 320, "train_runtime": 712.9908, "train_tokens_per_second": 349.615 }, { "epoch": 0.029517241379310343, "grad_norm": 7.81927490234375, "learning_rate": 1.6842105263157896e-05, "loss": 0.5365660786628723, "num_input_tokens_seen": 249932, "step": 321, "train_runtime": 714.8848, "train_tokens_per_second": 349.612 }, { "epoch": 0.029609195402298852, "grad_norm": 6.75691032409668, "learning_rate": 1.6832080200501257e-05, "loss": 0.6306750774383545, "num_input_tokens_seen": 250836, "step": 322, "train_runtime": 716.8207, "train_tokens_per_second": 349.929 }, { "epoch": 0.029701149425287357, "grad_norm": 7.404897689819336, "learning_rate": 1.6822055137844613e-05, "loss": 0.3980158567428589, "num_input_tokens_seen": 251360, "step": 323, "train_runtime": 718.7182, "train_tokens_per_second": 349.734 }, { "epoch": 0.029793103448275862, "grad_norm": 7.205636024475098, "learning_rate": 1.681203007518797e-05, "loss": 0.49449974298477173, "num_input_tokens_seen": 252000, "step": 324, "train_runtime": 720.6201, "train_tokens_per_second": 349.699 }, { "epoch": 0.029885057471264367, "grad_norm": 6.470882415771484, "learning_rate": 1.680200501253133e-05, "loss": 0.4838469922542572, "num_input_tokens_seen": 252848, "step": 325, "train_runtime": 722.555, "train_tokens_per_second": 349.936 }, { "epoch": 0.029977011494252873, "grad_norm": 7.9414286613464355, "learning_rate": 1.6791979949874687e-05, "loss": 0.5206264853477478, "num_input_tokens_seen": 253912, "step": 326, "train_runtime": 724.5384, "train_tokens_per_second": 350.447 }, { "epoch": 0.030068965517241378, "grad_norm": 6.74638032913208, "learning_rate": 1.6781954887218047e-05, "loss": 0.48208141326904297, "num_input_tokens_seen": 254576, "step": 327, "train_runtime": 726.4314, "train_tokens_per_second": 350.447 }, { "epoch": 0.030160919540229886, "grad_norm": 6.492095470428467, "learning_rate": 1.6771929824561408e-05, "loss": 0.5265463590621948, "num_input_tokens_seen": 255440, "step": 328, "train_runtime": 728.3501, "train_tokens_per_second": 350.71 }, { "epoch": 0.03025287356321839, "grad_norm": 7.264855861663818, "learning_rate": 1.6761904761904764e-05, "loss": 0.5523508191108704, "num_input_tokens_seen": 256132, "step": 329, "train_runtime": 730.2381, "train_tokens_per_second": 350.751 }, { "epoch": 0.030344827586206897, "grad_norm": 7.530397891998291, "learning_rate": 1.675187969924812e-05, "loss": 0.524081826210022, "num_input_tokens_seen": 256948, "step": 330, "train_runtime": 732.1609, "train_tokens_per_second": 350.945 }, { "epoch": 0.030436781609195402, "grad_norm": 6.863246440887451, "learning_rate": 1.6741854636591478e-05, "loss": 0.4773816168308258, "num_input_tokens_seen": 257584, "step": 331, "train_runtime": 740.3818, "train_tokens_per_second": 347.907 }, { "epoch": 0.030528735632183907, "grad_norm": 7.0147294998168945, "learning_rate": 1.6731829573934838e-05, "loss": 0.6112295389175415, "num_input_tokens_seen": 258228, "step": 332, "train_runtime": 742.3362, "train_tokens_per_second": 347.859 }, { "epoch": 0.030620689655172412, "grad_norm": 8.865488052368164, "learning_rate": 1.67218045112782e-05, "loss": 0.48941272497177124, "num_input_tokens_seen": 259052, "step": 333, "train_runtime": 744.4107, "train_tokens_per_second": 347.996 }, { "epoch": 0.03071264367816092, "grad_norm": 6.03111457824707, "learning_rate": 1.6711779448621555e-05, "loss": 0.4099096953868866, "num_input_tokens_seen": 259704, "step": 334, "train_runtime": 746.3563, "train_tokens_per_second": 347.963 }, { "epoch": 0.030804597701149426, "grad_norm": 7.29164457321167, "learning_rate": 1.6701754385964915e-05, "loss": 0.5145337581634521, "num_input_tokens_seen": 260576, "step": 335, "train_runtime": 748.3101, "train_tokens_per_second": 348.219 }, { "epoch": 0.03089655172413793, "grad_norm": 7.4277777671813965, "learning_rate": 1.6691729323308272e-05, "loss": 0.49768251180648804, "num_input_tokens_seen": 261320, "step": 336, "train_runtime": 750.2052, "train_tokens_per_second": 348.331 }, { "epoch": 0.030988505747126437, "grad_norm": 6.960900783538818, "learning_rate": 1.668170426065163e-05, "loss": 0.4325927495956421, "num_input_tokens_seen": 261948, "step": 337, "train_runtime": 752.1629, "train_tokens_per_second": 348.26 }, { "epoch": 0.031080459770114942, "grad_norm": 6.691569805145264, "learning_rate": 1.667167919799499e-05, "loss": 0.4351831376552582, "num_input_tokens_seen": 262576, "step": 338, "train_runtime": 754.0653, "train_tokens_per_second": 348.214 }, { "epoch": 0.031172413793103447, "grad_norm": 6.913660049438477, "learning_rate": 1.666165413533835e-05, "loss": 0.5391501188278198, "num_input_tokens_seen": 263340, "step": 339, "train_runtime": 755.9776, "train_tokens_per_second": 348.344 }, { "epoch": 0.03126436781609195, "grad_norm": 6.391702651977539, "learning_rate": 1.6651629072681706e-05, "loss": 0.49873214960098267, "num_input_tokens_seen": 264336, "step": 340, "train_runtime": 757.913, "train_tokens_per_second": 348.768 }, { "epoch": 0.03135632183908046, "grad_norm": 7.701982498168945, "learning_rate": 1.6641604010025063e-05, "loss": 0.4868852198123932, "num_input_tokens_seen": 264988, "step": 341, "train_runtime": 759.803, "train_tokens_per_second": 348.759 }, { "epoch": 0.03144827586206896, "grad_norm": 7.031266689300537, "learning_rate": 1.6631578947368423e-05, "loss": 0.502269446849823, "num_input_tokens_seen": 265580, "step": 342, "train_runtime": 761.7374, "train_tokens_per_second": 348.65 }, { "epoch": 0.031540229885057475, "grad_norm": 6.966207027435303, "learning_rate": 1.662155388471178e-05, "loss": 0.4639718234539032, "num_input_tokens_seen": 266412, "step": 343, "train_runtime": 763.6914, "train_tokens_per_second": 348.848 }, { "epoch": 0.03163218390804598, "grad_norm": 7.524121284484863, "learning_rate": 1.661152882205514e-05, "loss": 0.5666488409042358, "num_input_tokens_seen": 267528, "step": 344, "train_runtime": 765.7296, "train_tokens_per_second": 349.377 }, { "epoch": 0.031724137931034485, "grad_norm": 7.829931259155273, "learning_rate": 1.6601503759398497e-05, "loss": 0.5500428676605225, "num_input_tokens_seen": 268236, "step": 345, "train_runtime": 767.6511, "train_tokens_per_second": 349.424 }, { "epoch": 0.03181609195402299, "grad_norm": 7.847830295562744, "learning_rate": 1.6591478696741857e-05, "loss": 0.5698979496955872, "num_input_tokens_seen": 268996, "step": 346, "train_runtime": 769.541, "train_tokens_per_second": 349.554 }, { "epoch": 0.031908045977011495, "grad_norm": 6.956431865692139, "learning_rate": 1.6581453634085214e-05, "loss": 0.46126455068588257, "num_input_tokens_seen": 269616, "step": 347, "train_runtime": 771.4533, "train_tokens_per_second": 349.491 }, { "epoch": 0.032, "grad_norm": 7.762545585632324, "learning_rate": 1.6571428571428574e-05, "loss": 0.5739911198616028, "num_input_tokens_seen": 270672, "step": 348, "train_runtime": 773.4333, "train_tokens_per_second": 349.962 }, { "epoch": 0.032091954022988506, "grad_norm": 7.1435699462890625, "learning_rate": 1.656140350877193e-05, "loss": 0.4908761978149414, "num_input_tokens_seen": 271392, "step": 349, "train_runtime": 775.3249, "train_tokens_per_second": 350.036 }, { "epoch": 0.03218390804597701, "grad_norm": 7.2212724685668945, "learning_rate": 1.655137844611529e-05, "loss": 0.4466068148612976, "num_input_tokens_seen": 271944, "step": 350, "train_runtime": 777.2137, "train_tokens_per_second": 349.896 }, { "epoch": 0.032275862068965516, "grad_norm": 7.709162712097168, "learning_rate": 1.6541353383458648e-05, "loss": 0.4983013868331909, "num_input_tokens_seen": 272548, "step": 351, "train_runtime": 779.1033, "train_tokens_per_second": 349.823 }, { "epoch": 0.03236781609195402, "grad_norm": 7.1974005699157715, "learning_rate": 1.6531328320802008e-05, "loss": 0.5227024555206299, "num_input_tokens_seen": 273388, "step": 352, "train_runtime": 781.0284, "train_tokens_per_second": 350.036 }, { "epoch": 0.03245977011494253, "grad_norm": 7.129546642303467, "learning_rate": 1.6521303258145365e-05, "loss": 0.5885041952133179, "num_input_tokens_seen": 274252, "step": 353, "train_runtime": 782.9604, "train_tokens_per_second": 350.276 }, { "epoch": 0.03255172413793103, "grad_norm": 7.138310432434082, "learning_rate": 1.651127819548872e-05, "loss": 0.6486871242523193, "num_input_tokens_seen": 275204, "step": 354, "train_runtime": 784.895, "train_tokens_per_second": 350.625 }, { "epoch": 0.03264367816091954, "grad_norm": 7.11072301864624, "learning_rate": 1.650125313283208e-05, "loss": 0.47041159868240356, "num_input_tokens_seen": 275812, "step": 355, "train_runtime": 786.7857, "train_tokens_per_second": 350.555 }, { "epoch": 0.03273563218390805, "grad_norm": 8.056539535522461, "learning_rate": 1.649122807017544e-05, "loss": 0.5420215725898743, "num_input_tokens_seen": 276460, "step": 356, "train_runtime": 788.6773, "train_tokens_per_second": 350.536 }, { "epoch": 0.032827586206896554, "grad_norm": 12.881464004516602, "learning_rate": 1.64812030075188e-05, "loss": 0.6470522880554199, "num_input_tokens_seen": 277332, "step": 357, "train_runtime": 790.6098, "train_tokens_per_second": 350.782 }, { "epoch": 0.03291954022988506, "grad_norm": 8.421309471130371, "learning_rate": 1.647117794486216e-05, "loss": 0.5130929946899414, "num_input_tokens_seen": 278088, "step": 358, "train_runtime": 792.5274, "train_tokens_per_second": 350.888 }, { "epoch": 0.033011494252873565, "grad_norm": 5.847091197967529, "learning_rate": 1.6461152882205516e-05, "loss": 0.39224687218666077, "num_input_tokens_seen": 278716, "step": 359, "train_runtime": 794.4104, "train_tokens_per_second": 350.846 }, { "epoch": 0.03310344827586207, "grad_norm": 7.019738674163818, "learning_rate": 1.6451127819548872e-05, "loss": 0.5132017135620117, "num_input_tokens_seen": 279480, "step": 360, "train_runtime": 796.319, "train_tokens_per_second": 350.965 }, { "epoch": 0.033195402298850575, "grad_norm": 6.658227443695068, "learning_rate": 1.6441102756892233e-05, "loss": 0.4876769781112671, "num_input_tokens_seen": 280152, "step": 361, "train_runtime": 804.5307, "train_tokens_per_second": 348.218 }, { "epoch": 0.03328735632183908, "grad_norm": 6.251015663146973, "learning_rate": 1.643107769423559e-05, "loss": 0.5464555621147156, "num_input_tokens_seen": 281624, "step": 362, "train_runtime": 806.5943, "train_tokens_per_second": 349.152 }, { "epoch": 0.033379310344827585, "grad_norm": 5.939515113830566, "learning_rate": 1.642105263157895e-05, "loss": 0.4470316767692566, "num_input_tokens_seen": 282292, "step": 363, "train_runtime": 808.5787, "train_tokens_per_second": 349.121 }, { "epoch": 0.03347126436781609, "grad_norm": 6.443390369415283, "learning_rate": 1.6411027568922306e-05, "loss": 0.388321191072464, "num_input_tokens_seen": 282944, "step": 364, "train_runtime": 810.4796, "train_tokens_per_second": 349.107 }, { "epoch": 0.033563218390804596, "grad_norm": 6.1911492347717285, "learning_rate": 1.6401002506265667e-05, "loss": 0.5065643191337585, "num_input_tokens_seen": 283636, "step": 365, "train_runtime": 812.4084, "train_tokens_per_second": 349.13 }, { "epoch": 0.0336551724137931, "grad_norm": 7.345110893249512, "learning_rate": 1.6390977443609023e-05, "loss": 0.5557699799537659, "num_input_tokens_seen": 284292, "step": 366, "train_runtime": 814.2967, "train_tokens_per_second": 349.126 }, { "epoch": 0.033747126436781606, "grad_norm": 6.9500226974487305, "learning_rate": 1.6380952380952384e-05, "loss": 0.5253832340240479, "num_input_tokens_seen": 284828, "step": 367, "train_runtime": 816.1715, "train_tokens_per_second": 348.981 }, { "epoch": 0.03383908045977012, "grad_norm": 7.6618523597717285, "learning_rate": 1.637092731829574e-05, "loss": 0.5470195412635803, "num_input_tokens_seen": 285500, "step": 368, "train_runtime": 818.051, "train_tokens_per_second": 349.0 }, { "epoch": 0.033931034482758624, "grad_norm": 7.579816818237305, "learning_rate": 1.63609022556391e-05, "loss": 0.5715543031692505, "num_input_tokens_seen": 286120, "step": 369, "train_runtime": 819.9256, "train_tokens_per_second": 348.958 }, { "epoch": 0.03402298850574713, "grad_norm": 7.251576900482178, "learning_rate": 1.6350877192982457e-05, "loss": 0.41737809777259827, "num_input_tokens_seen": 286676, "step": 370, "train_runtime": 821.7969, "train_tokens_per_second": 348.84 }, { "epoch": 0.034114942528735634, "grad_norm": 7.673832416534424, "learning_rate": 1.6340852130325814e-05, "loss": 0.4248308837413788, "num_input_tokens_seen": 287340, "step": 371, "train_runtime": 823.6856, "train_tokens_per_second": 348.847 }, { "epoch": 0.03420689655172414, "grad_norm": 7.723014831542969, "learning_rate": 1.6330827067669174e-05, "loss": 0.5945442914962769, "num_input_tokens_seen": 288192, "step": 372, "train_runtime": 825.6152, "train_tokens_per_second": 349.063 }, { "epoch": 0.034298850574712644, "grad_norm": 7.674216270446777, "learning_rate": 1.632080200501253e-05, "loss": 0.518921434879303, "num_input_tokens_seen": 288844, "step": 373, "train_runtime": 827.517, "train_tokens_per_second": 349.049 }, { "epoch": 0.03439080459770115, "grad_norm": 7.32497501373291, "learning_rate": 1.631077694235589e-05, "loss": 0.6034227609634399, "num_input_tokens_seen": 290068, "step": 374, "train_runtime": 829.4698, "train_tokens_per_second": 349.703 }, { "epoch": 0.034482758620689655, "grad_norm": 8.127471923828125, "learning_rate": 1.630075187969925e-05, "loss": 0.5146776437759399, "num_input_tokens_seen": 291048, "step": 375, "train_runtime": 831.3926, "train_tokens_per_second": 350.073 }, { "epoch": 0.03457471264367816, "grad_norm": 6.988226890563965, "learning_rate": 1.6290726817042608e-05, "loss": 0.4996544122695923, "num_input_tokens_seen": 291704, "step": 376, "train_runtime": 833.3642, "train_tokens_per_second": 350.032 }, { "epoch": 0.034666666666666665, "grad_norm": 6.708095550537109, "learning_rate": 1.6280701754385965e-05, "loss": 0.48568931221961975, "num_input_tokens_seen": 292804, "step": 377, "train_runtime": 835.3228, "train_tokens_per_second": 350.528 }, { "epoch": 0.03475862068965517, "grad_norm": 7.753971099853516, "learning_rate": 1.6270676691729325e-05, "loss": 0.5069139003753662, "num_input_tokens_seen": 293420, "step": 378, "train_runtime": 837.2175, "train_tokens_per_second": 350.47 }, { "epoch": 0.034850574712643675, "grad_norm": 6.488057613372803, "learning_rate": 1.6260651629072682e-05, "loss": 0.47667884826660156, "num_input_tokens_seen": 294024, "step": 379, "train_runtime": 839.1322, "train_tokens_per_second": 350.391 }, { "epoch": 0.03494252873563218, "grad_norm": 6.502963066101074, "learning_rate": 1.6250626566416042e-05, "loss": 0.48642775416374207, "num_input_tokens_seen": 294936, "step": 380, "train_runtime": 841.0563, "train_tokens_per_second": 350.673 }, { "epoch": 0.03503448275862069, "grad_norm": 7.4670562744140625, "learning_rate": 1.62406015037594e-05, "loss": 0.46354836225509644, "num_input_tokens_seen": 295632, "step": 381, "train_runtime": 842.9546, "train_tokens_per_second": 350.709 }, { "epoch": 0.0351264367816092, "grad_norm": 6.839841842651367, "learning_rate": 1.623057644110276e-05, "loss": 0.4796101450920105, "num_input_tokens_seen": 296268, "step": 382, "train_runtime": 844.8762, "train_tokens_per_second": 350.664 }, { "epoch": 0.0352183908045977, "grad_norm": 7.7321577072143555, "learning_rate": 1.6220551378446116e-05, "loss": 0.6368752717971802, "num_input_tokens_seen": 297088, "step": 383, "train_runtime": 846.7974, "train_tokens_per_second": 350.837 }, { "epoch": 0.03531034482758621, "grad_norm": 6.988363265991211, "learning_rate": 1.6210526315789473e-05, "loss": 0.5102667808532715, "num_input_tokens_seen": 297756, "step": 384, "train_runtime": 848.6868, "train_tokens_per_second": 350.843 }, { "epoch": 0.035402298850574714, "grad_norm": 5.6896586418151855, "learning_rate": 1.6200501253132833e-05, "loss": 0.4484521150588989, "num_input_tokens_seen": 298500, "step": 385, "train_runtime": 850.6177, "train_tokens_per_second": 350.921 }, { "epoch": 0.03549425287356322, "grad_norm": 6.464532852172852, "learning_rate": 1.6190476190476193e-05, "loss": 0.5552738904953003, "num_input_tokens_seen": 299140, "step": 386, "train_runtime": 852.5017, "train_tokens_per_second": 350.897 }, { "epoch": 0.035586206896551724, "grad_norm": 7.861773490905762, "learning_rate": 1.618045112781955e-05, "loss": 0.5233801007270813, "num_input_tokens_seen": 299820, "step": 387, "train_runtime": 854.3992, "train_tokens_per_second": 350.913 }, { "epoch": 0.03567816091954023, "grad_norm": 6.787221431732178, "learning_rate": 1.617042606516291e-05, "loss": 0.551461935043335, "num_input_tokens_seen": 300432, "step": 388, "train_runtime": 856.2855, "train_tokens_per_second": 350.855 }, { "epoch": 0.035770114942528734, "grad_norm": 6.840238094329834, "learning_rate": 1.6160401002506267e-05, "loss": 0.4511426091194153, "num_input_tokens_seen": 301136, "step": 389, "train_runtime": 858.1776, "train_tokens_per_second": 350.902 }, { "epoch": 0.03586206896551724, "grad_norm": 6.89091157913208, "learning_rate": 1.6150375939849624e-05, "loss": 0.49777084589004517, "num_input_tokens_seen": 301856, "step": 390, "train_runtime": 860.0736, "train_tokens_per_second": 350.965 }, { "epoch": 0.035954022988505745, "grad_norm": 7.600098133087158, "learning_rate": 1.6140350877192984e-05, "loss": 0.5933030247688293, "num_input_tokens_seen": 302624, "step": 391, "train_runtime": 868.2261, "train_tokens_per_second": 348.554 }, { "epoch": 0.03604597701149425, "grad_norm": 7.551762104034424, "learning_rate": 1.6130325814536344e-05, "loss": 0.46076130867004395, "num_input_tokens_seen": 303352, "step": 392, "train_runtime": 870.1267, "train_tokens_per_second": 348.63 }, { "epoch": 0.03613793103448276, "grad_norm": 6.803619861602783, "learning_rate": 1.61203007518797e-05, "loss": 0.4574781358242035, "num_input_tokens_seen": 303964, "step": 393, "train_runtime": 872.2061, "train_tokens_per_second": 348.5 }, { "epoch": 0.03622988505747127, "grad_norm": 6.719482898712158, "learning_rate": 1.6110275689223058e-05, "loss": 0.5644866228103638, "num_input_tokens_seen": 304624, "step": 394, "train_runtime": 874.0997, "train_tokens_per_second": 348.5 }, { "epoch": 0.03632183908045977, "grad_norm": 8.121594429016113, "learning_rate": 1.6100250626566418e-05, "loss": 0.4595955014228821, "num_input_tokens_seen": 305188, "step": 395, "train_runtime": 875.9938, "train_tokens_per_second": 348.391 }, { "epoch": 0.03641379310344828, "grad_norm": 6.627795219421387, "learning_rate": 1.6090225563909775e-05, "loss": 0.47989457845687866, "num_input_tokens_seen": 305804, "step": 396, "train_runtime": 877.891, "train_tokens_per_second": 348.339 }, { "epoch": 0.03650574712643678, "grad_norm": 7.286935806274414, "learning_rate": 1.6080200501253135e-05, "loss": 0.6367931365966797, "num_input_tokens_seen": 307136, "step": 397, "train_runtime": 879.8924, "train_tokens_per_second": 349.061 }, { "epoch": 0.03659770114942529, "grad_norm": 7.091745853424072, "learning_rate": 1.6070175438596495e-05, "loss": 0.5370696783065796, "num_input_tokens_seen": 308344, "step": 398, "train_runtime": 881.9306, "train_tokens_per_second": 349.624 }, { "epoch": 0.03668965517241379, "grad_norm": 6.8993377685546875, "learning_rate": 1.6060150375939852e-05, "loss": 0.47272491455078125, "num_input_tokens_seen": 309188, "step": 399, "train_runtime": 883.8732, "train_tokens_per_second": 349.81 }, { "epoch": 0.0367816091954023, "grad_norm": 9.172377586364746, "learning_rate": 1.605012531328321e-05, "loss": 0.6651483774185181, "num_input_tokens_seen": 309892, "step": 400, "train_runtime": 885.7652, "train_tokens_per_second": 349.858 }, { "epoch": 0.0367816091954023, "eval_loss": 1.9598596096038818, "eval_runtime": 27.5975, "eval_samples_per_second": 36.235, "eval_steps_per_second": 9.059, "num_input_tokens_seen": 309892, "step": 400 }, { "epoch": 0.036873563218390804, "grad_norm": 7.518550872802734, "learning_rate": 1.6040100250626565e-05, "loss": 0.45641279220581055, "num_input_tokens_seen": 310892, "step": 401, "train_runtime": 915.3197, "train_tokens_per_second": 339.654 }, { "epoch": 0.03696551724137931, "grad_norm": 6.781665325164795, "learning_rate": 1.6030075187969926e-05, "loss": 0.4673669636249542, "num_input_tokens_seen": 311500, "step": 402, "train_runtime": 917.2008, "train_tokens_per_second": 339.62 }, { "epoch": 0.037057471264367814, "grad_norm": 6.372986316680908, "learning_rate": 1.6020050125313286e-05, "loss": 0.5332642793655396, "num_input_tokens_seen": 312148, "step": 403, "train_runtime": 919.0813, "train_tokens_per_second": 339.63 }, { "epoch": 0.03714942528735632, "grad_norm": 6.82274866104126, "learning_rate": 1.6010025062656642e-05, "loss": 0.5302132368087769, "num_input_tokens_seen": 312844, "step": 404, "train_runtime": 920.9834, "train_tokens_per_second": 339.685 }, { "epoch": 0.037241379310344824, "grad_norm": 6.736145496368408, "learning_rate": 1.6000000000000003e-05, "loss": 0.39181384444236755, "num_input_tokens_seen": 313408, "step": 405, "train_runtime": 922.8715, "train_tokens_per_second": 339.601 }, { "epoch": 0.037333333333333336, "grad_norm": 6.29167366027832, "learning_rate": 1.598997493734336e-05, "loss": 0.4519786834716797, "num_input_tokens_seen": 314056, "step": 406, "train_runtime": 924.7587, "train_tokens_per_second": 339.609 }, { "epoch": 0.03742528735632184, "grad_norm": 6.830358028411865, "learning_rate": 1.5979949874686716e-05, "loss": 0.5322299003601074, "num_input_tokens_seen": 314756, "step": 407, "train_runtime": 926.6487, "train_tokens_per_second": 339.671 }, { "epoch": 0.03751724137931035, "grad_norm": 6.957012176513672, "learning_rate": 1.5969924812030076e-05, "loss": 0.5151546001434326, "num_input_tokens_seen": 315372, "step": 408, "train_runtime": 928.5232, "train_tokens_per_second": 339.649 }, { "epoch": 0.03760919540229885, "grad_norm": 7.0232930183410645, "learning_rate": 1.5959899749373437e-05, "loss": 0.5350349545478821, "num_input_tokens_seen": 316036, "step": 409, "train_runtime": 930.4045, "train_tokens_per_second": 339.676 }, { "epoch": 0.03770114942528736, "grad_norm": 6.103466033935547, "learning_rate": 1.5949874686716793e-05, "loss": 0.47409480810165405, "num_input_tokens_seen": 316632, "step": 410, "train_runtime": 932.2832, "train_tokens_per_second": 339.631 }, { "epoch": 0.03779310344827586, "grad_norm": 7.183594226837158, "learning_rate": 1.593984962406015e-05, "loss": 0.5453521013259888, "num_input_tokens_seen": 317320, "step": 411, "train_runtime": 934.1647, "train_tokens_per_second": 339.683 }, { "epoch": 0.03788505747126437, "grad_norm": 7.0533447265625, "learning_rate": 1.592982456140351e-05, "loss": 0.5170130729675293, "num_input_tokens_seen": 317928, "step": 412, "train_runtime": 936.0357, "train_tokens_per_second": 339.654 }, { "epoch": 0.03797701149425287, "grad_norm": 6.611300945281982, "learning_rate": 1.5919799498746867e-05, "loss": 0.3984178900718689, "num_input_tokens_seen": 318452, "step": 413, "train_runtime": 937.9105, "train_tokens_per_second": 339.533 }, { "epoch": 0.03806896551724138, "grad_norm": 7.702702045440674, "learning_rate": 1.5909774436090227e-05, "loss": 0.5222338438034058, "num_input_tokens_seen": 319132, "step": 414, "train_runtime": 939.7931, "train_tokens_per_second": 339.577 }, { "epoch": 0.03816091954022988, "grad_norm": 6.963353157043457, "learning_rate": 1.5899749373433588e-05, "loss": 0.5179736614227295, "num_input_tokens_seen": 319940, "step": 415, "train_runtime": 941.7035, "train_tokens_per_second": 339.746 }, { "epoch": 0.03825287356321839, "grad_norm": 6.797804832458496, "learning_rate": 1.5889724310776944e-05, "loss": 0.5295509099960327, "num_input_tokens_seen": 320552, "step": 416, "train_runtime": 943.5741, "train_tokens_per_second": 339.721 }, { "epoch": 0.038344827586206894, "grad_norm": 7.196625709533691, "learning_rate": 1.58796992481203e-05, "loss": 0.5286198854446411, "num_input_tokens_seen": 321352, "step": 417, "train_runtime": 945.4807, "train_tokens_per_second": 339.882 }, { "epoch": 0.038436781609195406, "grad_norm": 7.270211696624756, "learning_rate": 1.5869674185463658e-05, "loss": 0.4256896376609802, "num_input_tokens_seen": 322080, "step": 418, "train_runtime": 947.3712, "train_tokens_per_second": 339.972 }, { "epoch": 0.03852873563218391, "grad_norm": 7.343602657318115, "learning_rate": 1.5859649122807018e-05, "loss": 0.4776989817619324, "num_input_tokens_seen": 322700, "step": 419, "train_runtime": 949.2596, "train_tokens_per_second": 339.949 }, { "epoch": 0.038620689655172416, "grad_norm": 6.887912750244141, "learning_rate": 1.5849624060150378e-05, "loss": 0.45532381534576416, "num_input_tokens_seen": 323328, "step": 420, "train_runtime": 951.1473, "train_tokens_per_second": 339.935 }, { "epoch": 0.03871264367816092, "grad_norm": 6.504075050354004, "learning_rate": 1.5839598997493735e-05, "loss": 0.41847917437553406, "num_input_tokens_seen": 324092, "step": 421, "train_runtime": 959.2486, "train_tokens_per_second": 337.86 }, { "epoch": 0.038804597701149426, "grad_norm": 6.65957498550415, "learning_rate": 1.5829573934837095e-05, "loss": 0.4958955645561218, "num_input_tokens_seen": 324604, "step": 422, "train_runtime": 961.2212, "train_tokens_per_second": 337.7 }, { "epoch": 0.03889655172413793, "grad_norm": 6.565097808837891, "learning_rate": 1.5819548872180452e-05, "loss": 0.42420342564582825, "num_input_tokens_seen": 325232, "step": 423, "train_runtime": 963.1153, "train_tokens_per_second": 337.688 }, { "epoch": 0.03898850574712644, "grad_norm": 7.877225399017334, "learning_rate": 1.580952380952381e-05, "loss": 0.6448503732681274, "num_input_tokens_seen": 326136, "step": 424, "train_runtime": 965.0444, "train_tokens_per_second": 337.949 }, { "epoch": 0.03908045977011494, "grad_norm": 6.912954330444336, "learning_rate": 1.579949874686717e-05, "loss": 0.5450248122215271, "num_input_tokens_seen": 326740, "step": 425, "train_runtime": 966.9381, "train_tokens_per_second": 337.912 }, { "epoch": 0.03917241379310345, "grad_norm": 7.217955112457275, "learning_rate": 1.578947368421053e-05, "loss": 0.46079760789871216, "num_input_tokens_seen": 327380, "step": 426, "train_runtime": 968.8266, "train_tokens_per_second": 337.914 }, { "epoch": 0.03926436781609195, "grad_norm": 8.541083335876465, "learning_rate": 1.5779448621553886e-05, "loss": 0.5666900277137756, "num_input_tokens_seen": 328380, "step": 427, "train_runtime": 970.7469, "train_tokens_per_second": 338.276 }, { "epoch": 0.03935632183908046, "grad_norm": 7.42299222946167, "learning_rate": 1.5769423558897243e-05, "loss": 0.5644451379776001, "num_input_tokens_seen": 329068, "step": 428, "train_runtime": 972.6311, "train_tokens_per_second": 338.328 }, { "epoch": 0.03944827586206896, "grad_norm": 6.829087257385254, "learning_rate": 1.5759398496240603e-05, "loss": 0.46858036518096924, "num_input_tokens_seen": 329672, "step": 429, "train_runtime": 974.531, "train_tokens_per_second": 338.288 }, { "epoch": 0.03954022988505747, "grad_norm": 7.258794784545898, "learning_rate": 1.574937343358396e-05, "loss": 0.4189729690551758, "num_input_tokens_seen": 330316, "step": 430, "train_runtime": 976.4375, "train_tokens_per_second": 338.287 }, { "epoch": 0.03963218390804598, "grad_norm": 6.7284064292907715, "learning_rate": 1.573934837092732e-05, "loss": 0.4453396499156952, "num_input_tokens_seen": 330940, "step": 431, "train_runtime": 978.3328, "train_tokens_per_second": 338.269 }, { "epoch": 0.039724137931034485, "grad_norm": 7.023474216461182, "learning_rate": 1.572932330827068e-05, "loss": 0.5812249779701233, "num_input_tokens_seen": 331580, "step": 432, "train_runtime": 980.2252, "train_tokens_per_second": 338.269 }, { "epoch": 0.03981609195402299, "grad_norm": 6.450960159301758, "learning_rate": 1.5719298245614037e-05, "loss": 0.5113633871078491, "num_input_tokens_seen": 332208, "step": 433, "train_runtime": 982.122, "train_tokens_per_second": 338.255 }, { "epoch": 0.039908045977011496, "grad_norm": 6.986124038696289, "learning_rate": 1.5709273182957394e-05, "loss": 0.4958512783050537, "num_input_tokens_seen": 332816, "step": 434, "train_runtime": 984.0321, "train_tokens_per_second": 338.217 }, { "epoch": 0.04, "grad_norm": 6.635585308074951, "learning_rate": 1.5699248120300754e-05, "loss": 0.5527627468109131, "num_input_tokens_seen": 333972, "step": 435, "train_runtime": 986.0673, "train_tokens_per_second": 338.691 }, { "epoch": 0.040091954022988506, "grad_norm": 7.397719383239746, "learning_rate": 1.568922305764411e-05, "loss": 0.5977311730384827, "num_input_tokens_seen": 334836, "step": 436, "train_runtime": 988.0303, "train_tokens_per_second": 338.892 }, { "epoch": 0.04018390804597701, "grad_norm": 7.226812362670898, "learning_rate": 1.567919799498747e-05, "loss": 0.5547776222229004, "num_input_tokens_seen": 335580, "step": 437, "train_runtime": 989.9561, "train_tokens_per_second": 338.985 }, { "epoch": 0.040275862068965516, "grad_norm": 7.948246002197266, "learning_rate": 1.5669172932330828e-05, "loss": 0.571733295917511, "num_input_tokens_seen": 336312, "step": 438, "train_runtime": 991.8528, "train_tokens_per_second": 339.075 }, { "epoch": 0.04036781609195402, "grad_norm": 8.043785095214844, "learning_rate": 1.5659147869674188e-05, "loss": 0.5533593893051147, "num_input_tokens_seen": 337140, "step": 439, "train_runtime": 993.8152, "train_tokens_per_second": 339.238 }, { "epoch": 0.04045977011494253, "grad_norm": 6.651862144470215, "learning_rate": 1.5649122807017545e-05, "loss": 0.490252286195755, "num_input_tokens_seen": 337860, "step": 440, "train_runtime": 995.7001, "train_tokens_per_second": 339.319 }, { "epoch": 0.04055172413793103, "grad_norm": 6.687456130981445, "learning_rate": 1.56390977443609e-05, "loss": 0.5104302167892456, "num_input_tokens_seen": 338488, "step": 441, "train_runtime": 997.5875, "train_tokens_per_second": 339.307 }, { "epoch": 0.04064367816091954, "grad_norm": 7.131701469421387, "learning_rate": 1.562907268170426e-05, "loss": 0.47217661142349243, "num_input_tokens_seen": 339076, "step": 442, "train_runtime": 999.4676, "train_tokens_per_second": 339.257 }, { "epoch": 0.04073563218390805, "grad_norm": 7.258623123168945, "learning_rate": 1.5619047619047622e-05, "loss": 0.49841707944869995, "num_input_tokens_seen": 339704, "step": 443, "train_runtime": 1001.4076, "train_tokens_per_second": 339.227 }, { "epoch": 0.040827586206896554, "grad_norm": 6.1737961769104, "learning_rate": 1.560902255639098e-05, "loss": 0.5507537126541138, "num_input_tokens_seen": 341264, "step": 444, "train_runtime": 1003.4544, "train_tokens_per_second": 340.089 }, { "epoch": 0.04091954022988506, "grad_norm": 7.9596638679504395, "learning_rate": 1.559899749373434e-05, "loss": 0.543859601020813, "num_input_tokens_seen": 341904, "step": 445, "train_runtime": 1005.3426, "train_tokens_per_second": 340.087 }, { "epoch": 0.041011494252873565, "grad_norm": 7.282109260559082, "learning_rate": 1.5588972431077696e-05, "loss": 0.6562669277191162, "num_input_tokens_seen": 342880, "step": 446, "train_runtime": 1007.3023, "train_tokens_per_second": 340.394 }, { "epoch": 0.04110344827586207, "grad_norm": 6.994173526763916, "learning_rate": 1.5578947368421052e-05, "loss": 0.3848903179168701, "num_input_tokens_seen": 343408, "step": 447, "train_runtime": 1009.1897, "train_tokens_per_second": 340.281 }, { "epoch": 0.041195402298850575, "grad_norm": 6.728405952453613, "learning_rate": 1.5568922305764413e-05, "loss": 0.43232136964797974, "num_input_tokens_seen": 343996, "step": 448, "train_runtime": 1011.1096, "train_tokens_per_second": 340.216 }, { "epoch": 0.04128735632183908, "grad_norm": 7.072303295135498, "learning_rate": 1.5558897243107773e-05, "loss": 0.49546629190444946, "num_input_tokens_seen": 344668, "step": 449, "train_runtime": 1013.0351, "train_tokens_per_second": 340.233 }, { "epoch": 0.041379310344827586, "grad_norm": 6.667862415313721, "learning_rate": 1.554887218045113e-05, "loss": 0.5161006450653076, "num_input_tokens_seen": 345404, "step": 450, "train_runtime": 1014.9477, "train_tokens_per_second": 340.317 }, { "epoch": 0.04147126436781609, "grad_norm": 7.385157585144043, "learning_rate": 1.5538847117794486e-05, "loss": 0.46987441182136536, "num_input_tokens_seen": 346044, "step": 451, "train_runtime": 1023.0972, "train_tokens_per_second": 338.232 }, { "epoch": 0.041563218390804596, "grad_norm": 7.392758846282959, "learning_rate": 1.5528822055137847e-05, "loss": 0.571925163269043, "num_input_tokens_seen": 346728, "step": 452, "train_runtime": 1025.2028, "train_tokens_per_second": 338.204 }, { "epoch": 0.0416551724137931, "grad_norm": 6.2191572189331055, "learning_rate": 1.5518796992481203e-05, "loss": 0.480907678604126, "num_input_tokens_seen": 347488, "step": 453, "train_runtime": 1027.1362, "train_tokens_per_second": 338.308 }, { "epoch": 0.041747126436781606, "grad_norm": 7.119461536407471, "learning_rate": 1.5508771929824563e-05, "loss": 0.4267956614494324, "num_input_tokens_seen": 348148, "step": 454, "train_runtime": 1029.04, "train_tokens_per_second": 338.323 }, { "epoch": 0.04183908045977011, "grad_norm": 7.01524019241333, "learning_rate": 1.5498746867167924e-05, "loss": 0.4772740602493286, "num_input_tokens_seen": 348864, "step": 455, "train_runtime": 1030.959, "train_tokens_per_second": 338.388 }, { "epoch": 0.041931034482758624, "grad_norm": 7.350391387939453, "learning_rate": 1.548872180451128e-05, "loss": 0.5528818368911743, "num_input_tokens_seen": 349640, "step": 456, "train_runtime": 1032.9029, "train_tokens_per_second": 338.502 }, { "epoch": 0.04202298850574713, "grad_norm": 7.847813606262207, "learning_rate": 1.5478696741854637e-05, "loss": 0.48816895484924316, "num_input_tokens_seen": 350220, "step": 457, "train_runtime": 1034.8334, "train_tokens_per_second": 338.431 }, { "epoch": 0.042114942528735634, "grad_norm": 6.420209884643555, "learning_rate": 1.5468671679197994e-05, "loss": 0.3913109302520752, "num_input_tokens_seen": 350840, "step": 458, "train_runtime": 1036.7479, "train_tokens_per_second": 338.404 }, { "epoch": 0.04220689655172414, "grad_norm": 6.909530162811279, "learning_rate": 1.5458646616541354e-05, "loss": 0.47092413902282715, "num_input_tokens_seen": 351484, "step": 459, "train_runtime": 1038.6446, "train_tokens_per_second": 338.406 }, { "epoch": 0.042298850574712644, "grad_norm": 7.583240032196045, "learning_rate": 1.5448621553884714e-05, "loss": 0.5202780961990356, "num_input_tokens_seen": 352184, "step": 460, "train_runtime": 1040.5485, "train_tokens_per_second": 338.46 }, { "epoch": 0.04239080459770115, "grad_norm": 7.578042030334473, "learning_rate": 1.543859649122807e-05, "loss": 0.45263203978538513, "num_input_tokens_seen": 352828, "step": 461, "train_runtime": 1042.4493, "train_tokens_per_second": 338.461 }, { "epoch": 0.042482758620689655, "grad_norm": 8.038250923156738, "learning_rate": 1.542857142857143e-05, "loss": 0.5287742614746094, "num_input_tokens_seen": 353524, "step": 462, "train_runtime": 1044.3473, "train_tokens_per_second": 338.512 }, { "epoch": 0.04257471264367816, "grad_norm": 7.293453216552734, "learning_rate": 1.5418546365914788e-05, "loss": 0.5775200128555298, "num_input_tokens_seen": 354688, "step": 463, "train_runtime": 1046.3764, "train_tokens_per_second": 338.968 }, { "epoch": 0.042666666666666665, "grad_norm": 6.730240345001221, "learning_rate": 1.5408521303258145e-05, "loss": 0.5127347707748413, "num_input_tokens_seen": 355448, "step": 464, "train_runtime": 1048.2898, "train_tokens_per_second": 339.074 }, { "epoch": 0.04275862068965517, "grad_norm": 7.285630226135254, "learning_rate": 1.5398496240601505e-05, "loss": 0.5023565292358398, "num_input_tokens_seen": 356124, "step": 465, "train_runtime": 1050.1896, "train_tokens_per_second": 339.104 }, { "epoch": 0.042850574712643676, "grad_norm": 6.86665153503418, "learning_rate": 1.5388471177944865e-05, "loss": 0.5498976707458496, "num_input_tokens_seen": 356848, "step": 466, "train_runtime": 1052.0953, "train_tokens_per_second": 339.178 }, { "epoch": 0.04294252873563218, "grad_norm": 7.294552803039551, "learning_rate": 1.5378446115288222e-05, "loss": 0.44851136207580566, "num_input_tokens_seen": 357460, "step": 467, "train_runtime": 1053.9797, "train_tokens_per_second": 339.153 }, { "epoch": 0.04303448275862069, "grad_norm": 7.41213321685791, "learning_rate": 1.536842105263158e-05, "loss": 0.5168503522872925, "num_input_tokens_seen": 358144, "step": 468, "train_runtime": 1055.89, "train_tokens_per_second": 339.187 }, { "epoch": 0.0431264367816092, "grad_norm": 7.41863489151001, "learning_rate": 1.535839598997494e-05, "loss": 0.5424340963363647, "num_input_tokens_seen": 358816, "step": 469, "train_runtime": 1057.8372, "train_tokens_per_second": 339.198 }, { "epoch": 0.0432183908045977, "grad_norm": 8.371504783630371, "learning_rate": 1.5348370927318296e-05, "loss": 0.537324070930481, "num_input_tokens_seen": 359420, "step": 470, "train_runtime": 1059.7345, "train_tokens_per_second": 339.16 }, { "epoch": 0.04331034482758621, "grad_norm": 7.062784671783447, "learning_rate": 1.5338345864661656e-05, "loss": 0.5428791642189026, "num_input_tokens_seen": 360168, "step": 471, "train_runtime": 1061.657, "train_tokens_per_second": 339.251 }, { "epoch": 0.043402298850574714, "grad_norm": 6.576425075531006, "learning_rate": 1.5328320802005013e-05, "loss": 0.4823741614818573, "num_input_tokens_seen": 360840, "step": 472, "train_runtime": 1063.5554, "train_tokens_per_second": 339.277 }, { "epoch": 0.04349425287356322, "grad_norm": 6.060364246368408, "learning_rate": 1.5318295739348373e-05, "loss": 0.3691994547843933, "num_input_tokens_seen": 361532, "step": 473, "train_runtime": 1065.4594, "train_tokens_per_second": 339.32 }, { "epoch": 0.043586206896551724, "grad_norm": 6.288186550140381, "learning_rate": 1.530827067669173e-05, "loss": 0.4629441499710083, "num_input_tokens_seen": 362200, "step": 474, "train_runtime": 1067.341, "train_tokens_per_second": 339.348 }, { "epoch": 0.04367816091954023, "grad_norm": 7.6472554206848145, "learning_rate": 1.529824561403509e-05, "loss": 0.5968223810195923, "num_input_tokens_seen": 362824, "step": 475, "train_runtime": 1069.2298, "train_tokens_per_second": 339.332 }, { "epoch": 0.043770114942528734, "grad_norm": 9.063471794128418, "learning_rate": 1.5288220551378447e-05, "loss": 0.5535184741020203, "num_input_tokens_seen": 363520, "step": 476, "train_runtime": 1071.1651, "train_tokens_per_second": 339.369 }, { "epoch": 0.04386206896551724, "grad_norm": 6.4986572265625, "learning_rate": 1.5278195488721807e-05, "loss": 0.47492700815200806, "num_input_tokens_seen": 364088, "step": 477, "train_runtime": 1073.0609, "train_tokens_per_second": 339.299 }, { "epoch": 0.043954022988505745, "grad_norm": 6.825013637542725, "learning_rate": 1.5268170426065164e-05, "loss": 0.5102417469024658, "num_input_tokens_seen": 365156, "step": 478, "train_runtime": 1075.0211, "train_tokens_per_second": 339.673 }, { "epoch": 0.04404597701149425, "grad_norm": 6.955339431762695, "learning_rate": 1.5258145363408522e-05, "loss": 0.5035444498062134, "num_input_tokens_seen": 365840, "step": 479, "train_runtime": 1076.9043, "train_tokens_per_second": 339.714 }, { "epoch": 0.044137931034482755, "grad_norm": 7.432355880737305, "learning_rate": 1.524812030075188e-05, "loss": 0.5037747025489807, "num_input_tokens_seen": 366700, "step": 480, "train_runtime": 1078.8369, "train_tokens_per_second": 339.903 }, { "epoch": 0.04422988505747127, "grad_norm": 7.469895839691162, "learning_rate": 1.523809523809524e-05, "loss": 0.5288439393043518, "num_input_tokens_seen": 367300, "step": 481, "train_runtime": 1086.9333, "train_tokens_per_second": 337.923 }, { "epoch": 0.04432183908045977, "grad_norm": 7.748864650726318, "learning_rate": 1.5228070175438598e-05, "loss": 0.5014351010322571, "num_input_tokens_seen": 367876, "step": 482, "train_runtime": 1088.8175, "train_tokens_per_second": 337.867 }, { "epoch": 0.04441379310344828, "grad_norm": 6.835473537445068, "learning_rate": 1.5218045112781956e-05, "loss": 0.4579215347766876, "num_input_tokens_seen": 368536, "step": 483, "train_runtime": 1090.7755, "train_tokens_per_second": 337.866 }, { "epoch": 0.04450574712643678, "grad_norm": 6.053252220153809, "learning_rate": 1.5208020050125315e-05, "loss": 0.4907318353652954, "num_input_tokens_seen": 369384, "step": 484, "train_runtime": 1092.6799, "train_tokens_per_second": 338.053 }, { "epoch": 0.04459770114942529, "grad_norm": 7.192389488220215, "learning_rate": 1.5197994987468673e-05, "loss": 0.40747565031051636, "num_input_tokens_seen": 370044, "step": 485, "train_runtime": 1094.5944, "train_tokens_per_second": 338.065 }, { "epoch": 0.04468965517241379, "grad_norm": 8.78969669342041, "learning_rate": 1.5187969924812032e-05, "loss": 0.5660673975944519, "num_input_tokens_seen": 370748, "step": 486, "train_runtime": 1096.4827, "train_tokens_per_second": 338.125 }, { "epoch": 0.0447816091954023, "grad_norm": 6.862427711486816, "learning_rate": 1.5177944862155388e-05, "loss": 0.7227067947387695, "num_input_tokens_seen": 371808, "step": 487, "train_runtime": 1098.41, "train_tokens_per_second": 338.497 }, { "epoch": 0.044873563218390804, "grad_norm": 7.217940807342529, "learning_rate": 1.5167919799498747e-05, "loss": 0.5614221096038818, "num_input_tokens_seen": 372516, "step": 488, "train_runtime": 1100.3087, "train_tokens_per_second": 338.556 }, { "epoch": 0.04496551724137931, "grad_norm": 6.643126487731934, "learning_rate": 1.5157894736842107e-05, "loss": 0.43227484822273254, "num_input_tokens_seen": 373208, "step": 489, "train_runtime": 1102.2096, "train_tokens_per_second": 338.6 }, { "epoch": 0.045057471264367814, "grad_norm": 7.370142459869385, "learning_rate": 1.5147869674185464e-05, "loss": 0.5297635197639465, "num_input_tokens_seen": 373884, "step": 490, "train_runtime": 1104.107, "train_tokens_per_second": 338.63 }, { "epoch": 0.04514942528735632, "grad_norm": 6.208383560180664, "learning_rate": 1.5137844611528822e-05, "loss": 0.5463951230049133, "num_input_tokens_seen": 374784, "step": 491, "train_runtime": 1106.0678, "train_tokens_per_second": 338.844 }, { "epoch": 0.045241379310344824, "grad_norm": 7.913474082946777, "learning_rate": 1.5127819548872183e-05, "loss": 0.48958340287208557, "num_input_tokens_seen": 375484, "step": 492, "train_runtime": 1107.9672, "train_tokens_per_second": 338.895 }, { "epoch": 0.04533333333333334, "grad_norm": 6.947763442993164, "learning_rate": 1.511779448621554e-05, "loss": 0.5918217897415161, "num_input_tokens_seen": 376292, "step": 493, "train_runtime": 1109.9038, "train_tokens_per_second": 339.031 }, { "epoch": 0.04542528735632184, "grad_norm": 7.253250598907471, "learning_rate": 1.5107769423558898e-05, "loss": 0.48761123418807983, "num_input_tokens_seen": 376852, "step": 494, "train_runtime": 1111.8869, "train_tokens_per_second": 338.93 }, { "epoch": 0.04551724137931035, "grad_norm": 6.873199939727783, "learning_rate": 1.5097744360902258e-05, "loss": 0.5429773926734924, "num_input_tokens_seen": 377628, "step": 495, "train_runtime": 1113.7885, "train_tokens_per_second": 339.048 }, { "epoch": 0.04560919540229885, "grad_norm": 7.205342769622803, "learning_rate": 1.5087719298245615e-05, "loss": 0.5807958841323853, "num_input_tokens_seen": 378456, "step": 496, "train_runtime": 1115.7442, "train_tokens_per_second": 339.196 }, { "epoch": 0.04570114942528736, "grad_norm": 6.8208136558532715, "learning_rate": 1.5077694235588973e-05, "loss": 0.4977841377258301, "num_input_tokens_seen": 379240, "step": 497, "train_runtime": 1117.6718, "train_tokens_per_second": 339.312 }, { "epoch": 0.04579310344827586, "grad_norm": 6.9195122718811035, "learning_rate": 1.506766917293233e-05, "loss": 0.5864359140396118, "num_input_tokens_seen": 380128, "step": 498, "train_runtime": 1119.6232, "train_tokens_per_second": 339.514 }, { "epoch": 0.04588505747126437, "grad_norm": 6.805229187011719, "learning_rate": 1.505764411027569e-05, "loss": 0.5215876698493958, "num_input_tokens_seen": 380824, "step": 499, "train_runtime": 1121.5691, "train_tokens_per_second": 339.546 }, { "epoch": 0.04597701149425287, "grad_norm": 9.82595443725586, "learning_rate": 1.5047619047619049e-05, "loss": 0.5936279296875, "num_input_tokens_seen": 381636, "step": 500, "train_runtime": 1123.5033, "train_tokens_per_second": 339.684 }, { "epoch": 0.04606896551724138, "grad_norm": 7.440690040588379, "learning_rate": 1.5037593984962406e-05, "loss": 0.5643438100814819, "num_input_tokens_seen": 382312, "step": 501, "train_runtime": 1125.44, "train_tokens_per_second": 339.7 }, { "epoch": 0.04616091954022988, "grad_norm": 6.9187331199646, "learning_rate": 1.5027568922305766e-05, "loss": 0.5397284626960754, "num_input_tokens_seen": 383204, "step": 502, "train_runtime": 1127.3951, "train_tokens_per_second": 339.902 }, { "epoch": 0.04625287356321839, "grad_norm": 6.451259136199951, "learning_rate": 1.5017543859649124e-05, "loss": 0.44190657138824463, "num_input_tokens_seen": 383884, "step": 503, "train_runtime": 1129.3123, "train_tokens_per_second": 339.927 }, { "epoch": 0.046344827586206894, "grad_norm": 6.243966579437256, "learning_rate": 1.5007518796992481e-05, "loss": 0.41493821144104004, "num_input_tokens_seen": 384620, "step": 504, "train_runtime": 1131.2851, "train_tokens_per_second": 339.985 }, { "epoch": 0.0464367816091954, "grad_norm": 7.39512300491333, "learning_rate": 1.4997493734335841e-05, "loss": 0.44311580061912537, "num_input_tokens_seen": 385204, "step": 505, "train_runtime": 1133.1717, "train_tokens_per_second": 339.934 }, { "epoch": 0.04652873563218391, "grad_norm": 6.167356491088867, "learning_rate": 1.49874686716792e-05, "loss": 0.40335023403167725, "num_input_tokens_seen": 385972, "step": 506, "train_runtime": 1135.11, "train_tokens_per_second": 340.03 }, { "epoch": 0.046620689655172416, "grad_norm": 6.923739433288574, "learning_rate": 1.4977443609022557e-05, "loss": 0.5292226672172546, "num_input_tokens_seen": 386780, "step": 507, "train_runtime": 1137.033, "train_tokens_per_second": 340.166 }, { "epoch": 0.04671264367816092, "grad_norm": 6.463278770446777, "learning_rate": 1.4967418546365915e-05, "loss": 0.466069757938385, "num_input_tokens_seen": 387512, "step": 508, "train_runtime": 1138.9544, "train_tokens_per_second": 340.235 }, { "epoch": 0.04680459770114943, "grad_norm": 6.766587734222412, "learning_rate": 1.4957393483709275e-05, "loss": 0.5540851950645447, "num_input_tokens_seen": 388624, "step": 509, "train_runtime": 1140.9151, "train_tokens_per_second": 340.625 }, { "epoch": 0.04689655172413793, "grad_norm": 6.9168806076049805, "learning_rate": 1.4947368421052632e-05, "loss": 0.44126710295677185, "num_input_tokens_seen": 389448, "step": 510, "train_runtime": 1142.8088, "train_tokens_per_second": 340.781 }, { "epoch": 0.04698850574712644, "grad_norm": 7.043146133422852, "learning_rate": 1.493734335839599e-05, "loss": 0.5624634623527527, "num_input_tokens_seen": 391272, "step": 511, "train_runtime": 1151.2832, "train_tokens_per_second": 339.857 }, { "epoch": 0.04708045977011494, "grad_norm": 5.854249477386475, "learning_rate": 1.492731829573935e-05, "loss": 0.3640488088130951, "num_input_tokens_seen": 391788, "step": 512, "train_runtime": 1153.1669, "train_tokens_per_second": 339.75 }, { "epoch": 0.04717241379310345, "grad_norm": 6.783285617828369, "learning_rate": 1.4917293233082707e-05, "loss": 0.3959953784942627, "num_input_tokens_seen": 392368, "step": 513, "train_runtime": 1155.0514, "train_tokens_per_second": 339.697 }, { "epoch": 0.04726436781609195, "grad_norm": 6.844997406005859, "learning_rate": 1.4907268170426066e-05, "loss": 0.457014799118042, "num_input_tokens_seen": 392984, "step": 514, "train_runtime": 1156.9385, "train_tokens_per_second": 339.676 }, { "epoch": 0.04735632183908046, "grad_norm": 6.397000312805176, "learning_rate": 1.4897243107769426e-05, "loss": 0.4044094383716583, "num_input_tokens_seen": 393648, "step": 515, "train_runtime": 1158.8609, "train_tokens_per_second": 339.685 }, { "epoch": 0.04744827586206896, "grad_norm": 7.328312397003174, "learning_rate": 1.4887218045112783e-05, "loss": 0.480017751455307, "num_input_tokens_seen": 394428, "step": 516, "train_runtime": 1160.7991, "train_tokens_per_second": 339.79 }, { "epoch": 0.04754022988505747, "grad_norm": 7.213738441467285, "learning_rate": 1.4877192982456141e-05, "loss": 0.4687790274620056, "num_input_tokens_seen": 395116, "step": 517, "train_runtime": 1162.7129, "train_tokens_per_second": 339.822 }, { "epoch": 0.04763218390804598, "grad_norm": 7.760647296905518, "learning_rate": 1.4867167919799498e-05, "loss": 0.600262463092804, "num_input_tokens_seen": 395808, "step": 518, "train_runtime": 1164.6098, "train_tokens_per_second": 339.863 }, { "epoch": 0.047724137931034485, "grad_norm": 8.408520698547363, "learning_rate": 1.4857142857142858e-05, "loss": 0.5764064788818359, "num_input_tokens_seen": 396572, "step": 519, "train_runtime": 1166.5371, "train_tokens_per_second": 339.957 }, { "epoch": 0.04781609195402299, "grad_norm": 7.4145612716674805, "learning_rate": 1.4847117794486217e-05, "loss": 0.4971860945224762, "num_input_tokens_seen": 397400, "step": 520, "train_runtime": 1168.4576, "train_tokens_per_second": 340.106 }, { "epoch": 0.047908045977011496, "grad_norm": 6.525569915771484, "learning_rate": 1.4837092731829574e-05, "loss": 0.36636286973953247, "num_input_tokens_seen": 397920, "step": 521, "train_runtime": 1170.3383, "train_tokens_per_second": 340.004 }, { "epoch": 0.048, "grad_norm": 6.48974084854126, "learning_rate": 1.4827067669172934e-05, "loss": 0.3712833523750305, "num_input_tokens_seen": 398624, "step": 522, "train_runtime": 1172.223, "train_tokens_per_second": 340.058 }, { "epoch": 0.048091954022988506, "grad_norm": 6.563835620880127, "learning_rate": 1.4817042606516292e-05, "loss": 0.4676303565502167, "num_input_tokens_seen": 399460, "step": 523, "train_runtime": 1174.1338, "train_tokens_per_second": 340.217 }, { "epoch": 0.04818390804597701, "grad_norm": 7.273741245269775, "learning_rate": 1.4807017543859649e-05, "loss": 0.5030032992362976, "num_input_tokens_seen": 400264, "step": 524, "train_runtime": 1176.0418, "train_tokens_per_second": 340.348 }, { "epoch": 0.04827586206896552, "grad_norm": 6.6886115074157715, "learning_rate": 1.479699248120301e-05, "loss": 0.5100569725036621, "num_input_tokens_seen": 400944, "step": 525, "train_runtime": 1178.0781, "train_tokens_per_second": 340.337 }, { "epoch": 0.04836781609195402, "grad_norm": 7.2770233154296875, "learning_rate": 1.4786967418546368e-05, "loss": 0.4868226647377014, "num_input_tokens_seen": 401476, "step": 526, "train_runtime": 1179.9553, "train_tokens_per_second": 340.247 }, { "epoch": 0.04845977011494253, "grad_norm": 7.772225856781006, "learning_rate": 1.4776942355889725e-05, "loss": 0.5350745916366577, "num_input_tokens_seen": 402412, "step": 527, "train_runtime": 1181.8793, "train_tokens_per_second": 340.485 }, { "epoch": 0.04855172413793103, "grad_norm": 7.460968494415283, "learning_rate": 1.4766917293233083e-05, "loss": 0.6134611368179321, "num_input_tokens_seen": 403108, "step": 528, "train_runtime": 1183.7734, "train_tokens_per_second": 340.528 }, { "epoch": 0.04864367816091954, "grad_norm": 7.340336322784424, "learning_rate": 1.4756892230576443e-05, "loss": 0.46978676319122314, "num_input_tokens_seen": 403736, "step": 529, "train_runtime": 1185.6759, "train_tokens_per_second": 340.511 }, { "epoch": 0.04873563218390804, "grad_norm": 7.76758337020874, "learning_rate": 1.47468671679198e-05, "loss": 0.5982768535614014, "num_input_tokens_seen": 404300, "step": 530, "train_runtime": 1187.5791, "train_tokens_per_second": 340.44 }, { "epoch": 0.048827586206896555, "grad_norm": 6.966864109039307, "learning_rate": 1.4736842105263159e-05, "loss": 0.5222433805465698, "num_input_tokens_seen": 405168, "step": 531, "train_runtime": 1189.5104, "train_tokens_per_second": 340.617 }, { "epoch": 0.04891954022988506, "grad_norm": 7.772345542907715, "learning_rate": 1.4726817042606519e-05, "loss": 0.5692169666290283, "num_input_tokens_seen": 405864, "step": 532, "train_runtime": 1191.4174, "train_tokens_per_second": 340.656 }, { "epoch": 0.049011494252873565, "grad_norm": 7.645069122314453, "learning_rate": 1.4716791979949876e-05, "loss": 0.4851095676422119, "num_input_tokens_seen": 406556, "step": 533, "train_runtime": 1193.297, "train_tokens_per_second": 340.7 }, { "epoch": 0.04910344827586207, "grad_norm": 7.193717002868652, "learning_rate": 1.4706766917293234e-05, "loss": 0.5600373148918152, "num_input_tokens_seen": 407384, "step": 534, "train_runtime": 1195.2217, "train_tokens_per_second": 340.844 }, { "epoch": 0.049195402298850575, "grad_norm": 9.166099548339844, "learning_rate": 1.4696741854636594e-05, "loss": 0.48763924837112427, "num_input_tokens_seen": 407952, "step": 535, "train_runtime": 1197.1062, "train_tokens_per_second": 340.782 }, { "epoch": 0.04928735632183908, "grad_norm": 7.534561634063721, "learning_rate": 1.4686716791979951e-05, "loss": 0.47965383529663086, "num_input_tokens_seen": 408540, "step": 536, "train_runtime": 1198.9918, "train_tokens_per_second": 340.736 }, { "epoch": 0.049379310344827586, "grad_norm": 6.627105236053467, "learning_rate": 1.467669172932331e-05, "loss": 0.405030220746994, "num_input_tokens_seen": 409064, "step": 537, "train_runtime": 1200.8814, "train_tokens_per_second": 340.636 }, { "epoch": 0.04947126436781609, "grad_norm": 7.8374409675598145, "learning_rate": 1.4666666666666666e-05, "loss": 0.5932339429855347, "num_input_tokens_seen": 409784, "step": 538, "train_runtime": 1202.7989, "train_tokens_per_second": 340.692 }, { "epoch": 0.049563218390804596, "grad_norm": 6.745156764984131, "learning_rate": 1.4656641604010026e-05, "loss": 0.48866891860961914, "num_input_tokens_seen": 410744, "step": 539, "train_runtime": 1204.7106, "train_tokens_per_second": 340.948 }, { "epoch": 0.0496551724137931, "grad_norm": 7.251765251159668, "learning_rate": 1.4646616541353385e-05, "loss": 0.38917776942253113, "num_input_tokens_seen": 411364, "step": 540, "train_runtime": 1206.5887, "train_tokens_per_second": 340.931 }, { "epoch": 0.04974712643678161, "grad_norm": 6.308721542358398, "learning_rate": 1.4636591478696742e-05, "loss": 0.4285096526145935, "num_input_tokens_seen": 411964, "step": 541, "train_runtime": 1215.1066, "train_tokens_per_second": 339.035 }, { "epoch": 0.04983908045977011, "grad_norm": 6.954815864562988, "learning_rate": 1.4626566416040102e-05, "loss": 0.4781310558319092, "num_input_tokens_seen": 412772, "step": 542, "train_runtime": 1217.0158, "train_tokens_per_second": 339.167 }, { "epoch": 0.049931034482758624, "grad_norm": 6.529648780822754, "learning_rate": 1.461654135338346e-05, "loss": 0.5092747211456299, "num_input_tokens_seen": 413304, "step": 543, "train_runtime": 1218.8999, "train_tokens_per_second": 339.08 }, { "epoch": 0.05002298850574713, "grad_norm": 6.731094837188721, "learning_rate": 1.4606516290726817e-05, "loss": 0.46955224871635437, "num_input_tokens_seen": 413900, "step": 544, "train_runtime": 1220.9783, "train_tokens_per_second": 338.99 }, { "epoch": 0.050114942528735634, "grad_norm": 7.204357624053955, "learning_rate": 1.4596491228070177e-05, "loss": 0.5351137518882751, "num_input_tokens_seen": 414556, "step": 545, "train_runtime": 1222.8707, "train_tokens_per_second": 339.002 }, { "epoch": 0.05020689655172414, "grad_norm": 6.740512371063232, "learning_rate": 1.4586466165413536e-05, "loss": 0.4871787428855896, "num_input_tokens_seen": 415116, "step": 546, "train_runtime": 1224.7612, "train_tokens_per_second": 338.936 }, { "epoch": 0.050298850574712645, "grad_norm": 6.851949214935303, "learning_rate": 1.4576441102756893e-05, "loss": 0.3844849169254303, "num_input_tokens_seen": 415732, "step": 547, "train_runtime": 1226.6582, "train_tokens_per_second": 338.914 }, { "epoch": 0.05039080459770115, "grad_norm": 6.723283290863037, "learning_rate": 1.4566416040100251e-05, "loss": 0.5672256946563721, "num_input_tokens_seen": 416528, "step": 548, "train_runtime": 1228.6518, "train_tokens_per_second": 339.012 }, { "epoch": 0.050482758620689655, "grad_norm": 7.665659427642822, "learning_rate": 1.4556390977443611e-05, "loss": 0.5598821640014648, "num_input_tokens_seen": 417108, "step": 549, "train_runtime": 1230.5523, "train_tokens_per_second": 338.96 }, { "epoch": 0.05057471264367816, "grad_norm": 7.521910190582275, "learning_rate": 1.4546365914786968e-05, "loss": 0.5603845119476318, "num_input_tokens_seen": 417860, "step": 550, "train_runtime": 1232.4428, "train_tokens_per_second": 339.05 }, { "epoch": 0.050666666666666665, "grad_norm": 7.453955173492432, "learning_rate": 1.4536340852130327e-05, "loss": 0.5222201347351074, "num_input_tokens_seen": 418544, "step": 551, "train_runtime": 1234.36, "train_tokens_per_second": 339.078 }, { "epoch": 0.05075862068965517, "grad_norm": 7.16868782043457, "learning_rate": 1.4526315789473687e-05, "loss": 0.45393678545951843, "num_input_tokens_seen": 419120, "step": 552, "train_runtime": 1236.2603, "train_tokens_per_second": 339.022 }, { "epoch": 0.050850574712643676, "grad_norm": 8.150325775146484, "learning_rate": 1.4516290726817044e-05, "loss": 0.5021551847457886, "num_input_tokens_seen": 419832, "step": 553, "train_runtime": 1238.1494, "train_tokens_per_second": 339.08 }, { "epoch": 0.05094252873563218, "grad_norm": 8.25429630279541, "learning_rate": 1.4506265664160402e-05, "loss": 0.509451687335968, "num_input_tokens_seen": 420460, "step": 554, "train_runtime": 1240.0395, "train_tokens_per_second": 339.07 }, { "epoch": 0.05103448275862069, "grad_norm": 7.019073963165283, "learning_rate": 1.4496240601503762e-05, "loss": 0.4084882140159607, "num_input_tokens_seen": 421124, "step": 555, "train_runtime": 1241.981, "train_tokens_per_second": 339.074 }, { "epoch": 0.0511264367816092, "grad_norm": 6.161911964416504, "learning_rate": 1.4486215538847119e-05, "loss": 0.4584411382675171, "num_input_tokens_seen": 421816, "step": 556, "train_runtime": 1243.883, "train_tokens_per_second": 339.112 }, { "epoch": 0.051218390804597703, "grad_norm": 7.898520469665527, "learning_rate": 1.4476190476190478e-05, "loss": 0.5508074760437012, "num_input_tokens_seen": 422556, "step": 557, "train_runtime": 1245.7764, "train_tokens_per_second": 339.191 }, { "epoch": 0.05131034482758621, "grad_norm": 7.782658100128174, "learning_rate": 1.4466165413533834e-05, "loss": 0.5297361016273499, "num_input_tokens_seen": 423264, "step": 558, "train_runtime": 1247.6927, "train_tokens_per_second": 339.237 }, { "epoch": 0.051402298850574714, "grad_norm": 7.9233574867248535, "learning_rate": 1.4456140350877195e-05, "loss": 0.5354646444320679, "num_input_tokens_seen": 423932, "step": 559, "train_runtime": 1249.608, "train_tokens_per_second": 339.252 }, { "epoch": 0.05149425287356322, "grad_norm": 7.549014568328857, "learning_rate": 1.4446115288220553e-05, "loss": 0.5111515522003174, "num_input_tokens_seen": 424620, "step": 560, "train_runtime": 1251.4837, "train_tokens_per_second": 339.293 }, { "epoch": 0.051586206896551724, "grad_norm": 7.239883899688721, "learning_rate": 1.443609022556391e-05, "loss": 0.47565650939941406, "num_input_tokens_seen": 425456, "step": 561, "train_runtime": 1253.4081, "train_tokens_per_second": 339.439 }, { "epoch": 0.05167816091954023, "grad_norm": 7.050983428955078, "learning_rate": 1.442606516290727e-05, "loss": 0.6090424060821533, "num_input_tokens_seen": 427156, "step": 562, "train_runtime": 1255.4411, "train_tokens_per_second": 340.244 }, { "epoch": 0.051770114942528735, "grad_norm": 8.222979545593262, "learning_rate": 1.4416040100250628e-05, "loss": 0.48763030767440796, "num_input_tokens_seen": 427768, "step": 563, "train_runtime": 1257.3115, "train_tokens_per_second": 340.224 }, { "epoch": 0.05186206896551724, "grad_norm": 6.865083694458008, "learning_rate": 1.4406015037593985e-05, "loss": 0.45680394768714905, "num_input_tokens_seen": 428572, "step": 564, "train_runtime": 1259.246, "train_tokens_per_second": 340.34 }, { "epoch": 0.051954022988505745, "grad_norm": 6.205889701843262, "learning_rate": 1.4395989974937345e-05, "loss": 0.4514808654785156, "num_input_tokens_seen": 429556, "step": 565, "train_runtime": 1261.1552, "train_tokens_per_second": 340.605 }, { "epoch": 0.05204597701149425, "grad_norm": 6.261847496032715, "learning_rate": 1.4385964912280704e-05, "loss": 0.391244113445282, "num_input_tokens_seen": 430128, "step": 566, "train_runtime": 1263.0367, "train_tokens_per_second": 340.551 }, { "epoch": 0.052137931034482755, "grad_norm": 7.326925754547119, "learning_rate": 1.437593984962406e-05, "loss": 0.5507190823554993, "num_input_tokens_seen": 430912, "step": 567, "train_runtime": 1264.915, "train_tokens_per_second": 340.665 }, { "epoch": 0.05222988505747127, "grad_norm": 6.737486362457275, "learning_rate": 1.436591478696742e-05, "loss": 0.5284934639930725, "num_input_tokens_seen": 431840, "step": 568, "train_runtime": 1266.8229, "train_tokens_per_second": 340.884 }, { "epoch": 0.05232183908045977, "grad_norm": 7.514186382293701, "learning_rate": 1.435588972431078e-05, "loss": 0.5544549226760864, "num_input_tokens_seen": 432600, "step": 569, "train_runtime": 1268.7077, "train_tokens_per_second": 340.977 }, { "epoch": 0.05241379310344828, "grad_norm": 7.510397434234619, "learning_rate": 1.4345864661654136e-05, "loss": 0.41615110635757446, "num_input_tokens_seen": 433148, "step": 570, "train_runtime": 1270.5817, "train_tokens_per_second": 340.905 }, { "epoch": 0.05250574712643678, "grad_norm": 6.880468845367432, "learning_rate": 1.4335839598997495e-05, "loss": 0.4594903886318207, "num_input_tokens_seen": 433784, "step": 571, "train_runtime": 1279.5805, "train_tokens_per_second": 339.005 }, { "epoch": 0.05259770114942529, "grad_norm": 7.571253299713135, "learning_rate": 1.4325814536340855e-05, "loss": 0.5042752027511597, "num_input_tokens_seen": 434416, "step": 572, "train_runtime": 1281.5123, "train_tokens_per_second": 338.987 }, { "epoch": 0.052689655172413793, "grad_norm": 6.492729663848877, "learning_rate": 1.4315789473684212e-05, "loss": 0.48361361026763916, "num_input_tokens_seen": 435320, "step": 573, "train_runtime": 1283.4323, "train_tokens_per_second": 339.184 }, { "epoch": 0.0527816091954023, "grad_norm": 6.326514720916748, "learning_rate": 1.430576441102757e-05, "loss": 0.4741998016834259, "num_input_tokens_seen": 436088, "step": 574, "train_runtime": 1285.3277, "train_tokens_per_second": 339.282 }, { "epoch": 0.052873563218390804, "grad_norm": 6.165903568267822, "learning_rate": 1.4295739348370929e-05, "loss": 0.4289013147354126, "num_input_tokens_seen": 436632, "step": 575, "train_runtime": 1287.1992, "train_tokens_per_second": 339.211 }, { "epoch": 0.05296551724137931, "grad_norm": 7.48010778427124, "learning_rate": 1.4285714285714287e-05, "loss": 0.5268988013267517, "num_input_tokens_seen": 437312, "step": 576, "train_runtime": 1289.1189, "train_tokens_per_second": 339.233 }, { "epoch": 0.053057471264367814, "grad_norm": 7.232751369476318, "learning_rate": 1.4275689223057646e-05, "loss": 0.5748152136802673, "num_input_tokens_seen": 438096, "step": 577, "train_runtime": 1291.0259, "train_tokens_per_second": 339.339 }, { "epoch": 0.05314942528735632, "grad_norm": 5.850233554840088, "learning_rate": 1.4265664160401002e-05, "loss": 0.3801572620868683, "num_input_tokens_seen": 438744, "step": 578, "train_runtime": 1292.9025, "train_tokens_per_second": 339.348 }, { "epoch": 0.053241379310344825, "grad_norm": 7.358694553375244, "learning_rate": 1.4255639097744363e-05, "loss": 0.5200968384742737, "num_input_tokens_seen": 439996, "step": 579, "train_runtime": 1294.841, "train_tokens_per_second": 339.807 }, { "epoch": 0.05333333333333334, "grad_norm": 7.193248271942139, "learning_rate": 1.4245614035087721e-05, "loss": 0.6091095805168152, "num_input_tokens_seen": 441044, "step": 580, "train_runtime": 1296.7586, "train_tokens_per_second": 340.113 }, { "epoch": 0.05342528735632184, "grad_norm": 6.751431465148926, "learning_rate": 1.4235588972431078e-05, "loss": 0.5009475946426392, "num_input_tokens_seen": 441592, "step": 581, "train_runtime": 1298.6382, "train_tokens_per_second": 340.042 }, { "epoch": 0.05351724137931035, "grad_norm": 7.5356831550598145, "learning_rate": 1.4225563909774438e-05, "loss": 0.4519139528274536, "num_input_tokens_seen": 442288, "step": 582, "train_runtime": 1300.5207, "train_tokens_per_second": 340.085 }, { "epoch": 0.05360919540229885, "grad_norm": 6.881683826446533, "learning_rate": 1.4215538847117797e-05, "loss": 0.6669802069664001, "num_input_tokens_seen": 443224, "step": 583, "train_runtime": 1302.4548, "train_tokens_per_second": 340.299 }, { "epoch": 0.05370114942528736, "grad_norm": 7.067171096801758, "learning_rate": 1.4205513784461153e-05, "loss": 0.42816635966300964, "num_input_tokens_seen": 444032, "step": 584, "train_runtime": 1304.4902, "train_tokens_per_second": 340.387 }, { "epoch": 0.05379310344827586, "grad_norm": 6.609787464141846, "learning_rate": 1.4195488721804514e-05, "loss": 0.5364288091659546, "num_input_tokens_seen": 444736, "step": 585, "train_runtime": 1306.4324, "train_tokens_per_second": 340.42 }, { "epoch": 0.05388505747126437, "grad_norm": 7.067381858825684, "learning_rate": 1.4185463659147872e-05, "loss": 0.5622860193252563, "num_input_tokens_seen": 445672, "step": 586, "train_runtime": 1308.3677, "train_tokens_per_second": 340.632 }, { "epoch": 0.05397701149425287, "grad_norm": 6.087325096130371, "learning_rate": 1.4175438596491229e-05, "loss": 0.4185801148414612, "num_input_tokens_seen": 446316, "step": 587, "train_runtime": 1310.2514, "train_tokens_per_second": 340.634 }, { "epoch": 0.05406896551724138, "grad_norm": 6.607666015625, "learning_rate": 1.4165413533834587e-05, "loss": 0.4877302348613739, "num_input_tokens_seen": 446916, "step": 588, "train_runtime": 1312.1457, "train_tokens_per_second": 340.599 }, { "epoch": 0.054160919540229883, "grad_norm": 6.90864372253418, "learning_rate": 1.4155388471177946e-05, "loss": 0.4787876605987549, "num_input_tokens_seen": 447448, "step": 589, "train_runtime": 1314.0595, "train_tokens_per_second": 340.508 }, { "epoch": 0.05425287356321839, "grad_norm": 6.653378009796143, "learning_rate": 1.4145363408521304e-05, "loss": 0.45052623748779297, "num_input_tokens_seen": 448144, "step": 590, "train_runtime": 1315.9691, "train_tokens_per_second": 340.543 }, { "epoch": 0.054344827586206894, "grad_norm": 7.320746898651123, "learning_rate": 1.4135338345864663e-05, "loss": 0.5776675343513489, "num_input_tokens_seen": 448920, "step": 591, "train_runtime": 1317.9018, "train_tokens_per_second": 340.632 }, { "epoch": 0.0544367816091954, "grad_norm": 6.116318225860596, "learning_rate": 1.4125313283208021e-05, "loss": 0.4263470768928528, "num_input_tokens_seen": 449716, "step": 592, "train_runtime": 1319.8314, "train_tokens_per_second": 340.737 }, { "epoch": 0.05452873563218391, "grad_norm": 7.996311187744141, "learning_rate": 1.411528822055138e-05, "loss": 0.5323801040649414, "num_input_tokens_seen": 450356, "step": 593, "train_runtime": 1321.7236, "train_tokens_per_second": 340.734 }, { "epoch": 0.054620689655172416, "grad_norm": 6.50635290145874, "learning_rate": 1.4105263157894738e-05, "loss": 0.4133082628250122, "num_input_tokens_seen": 450952, "step": 594, "train_runtime": 1323.6055, "train_tokens_per_second": 340.7 }, { "epoch": 0.05471264367816092, "grad_norm": 6.741985321044922, "learning_rate": 1.4095238095238097e-05, "loss": 0.5009517669677734, "num_input_tokens_seen": 451908, "step": 595, "train_runtime": 1325.5491, "train_tokens_per_second": 340.921 }, { "epoch": 0.05480459770114943, "grad_norm": 7.827582359313965, "learning_rate": 1.4085213032581455e-05, "loss": 0.5611375570297241, "num_input_tokens_seen": 452680, "step": 596, "train_runtime": 1327.4278, "train_tokens_per_second": 341.02 }, { "epoch": 0.05489655172413793, "grad_norm": 7.473243236541748, "learning_rate": 1.4075187969924814e-05, "loss": 0.4487534165382385, "num_input_tokens_seen": 453380, "step": 597, "train_runtime": 1329.3336, "train_tokens_per_second": 341.058 }, { "epoch": 0.05498850574712644, "grad_norm": 11.061628341674805, "learning_rate": 1.406516290726817e-05, "loss": 0.48190802335739136, "num_input_tokens_seen": 454044, "step": 598, "train_runtime": 1331.2129, "train_tokens_per_second": 341.075 }, { "epoch": 0.05508045977011494, "grad_norm": 6.291112899780273, "learning_rate": 1.405513784461153e-05, "loss": 0.6732971668243408, "num_input_tokens_seen": 455540, "step": 599, "train_runtime": 1333.2299, "train_tokens_per_second": 341.681 }, { "epoch": 0.05517241379310345, "grad_norm": 6.915909767150879, "learning_rate": 1.4045112781954887e-05, "loss": 0.4161275625228882, "num_input_tokens_seen": 456248, "step": 600, "train_runtime": 1335.1361, "train_tokens_per_second": 341.724 }, { "epoch": 0.05517241379310345, "eval_loss": 1.9245530366897583, "eval_runtime": 27.8262, "eval_samples_per_second": 35.937, "eval_steps_per_second": 8.984, "num_input_tokens_seen": 456248, "step": 600 }, { "epoch": 0.05526436781609195, "grad_norm": 7.501951217651367, "learning_rate": 1.4035087719298246e-05, "loss": 0.5070131421089172, "num_input_tokens_seen": 456844, "step": 601, "train_runtime": 1371.7412, "train_tokens_per_second": 333.039 }, { "epoch": 0.05535632183908046, "grad_norm": 7.221893787384033, "learning_rate": 1.4025062656641606e-05, "loss": 0.500610888004303, "num_input_tokens_seen": 457516, "step": 602, "train_runtime": 1373.7721, "train_tokens_per_second": 333.036 }, { "epoch": 0.05544827586206896, "grad_norm": 7.347901821136475, "learning_rate": 1.4015037593984963e-05, "loss": 0.6231392025947571, "num_input_tokens_seen": 458384, "step": 603, "train_runtime": 1375.6946, "train_tokens_per_second": 333.202 }, { "epoch": 0.05554022988505747, "grad_norm": 6.535465240478516, "learning_rate": 1.4005012531328321e-05, "loss": 0.38742274045944214, "num_input_tokens_seen": 458928, "step": 604, "train_runtime": 1377.584, "train_tokens_per_second": 333.14 }, { "epoch": 0.05563218390804598, "grad_norm": 6.457494735717773, "learning_rate": 1.3994987468671682e-05, "loss": 0.47244036197662354, "num_input_tokens_seen": 459684, "step": 605, "train_runtime": 1379.5472, "train_tokens_per_second": 333.214 }, { "epoch": 0.055724137931034486, "grad_norm": 6.482058525085449, "learning_rate": 1.3984962406015038e-05, "loss": 0.429859459400177, "num_input_tokens_seen": 460348, "step": 606, "train_runtime": 1381.4705, "train_tokens_per_second": 333.23 }, { "epoch": 0.05581609195402299, "grad_norm": 8.471290588378906, "learning_rate": 1.3974937343358397e-05, "loss": 0.5313338041305542, "num_input_tokens_seen": 461072, "step": 607, "train_runtime": 1383.3572, "train_tokens_per_second": 333.299 }, { "epoch": 0.055908045977011496, "grad_norm": 6.4897003173828125, "learning_rate": 1.3964912280701755e-05, "loss": 0.4652232527732849, "num_input_tokens_seen": 461680, "step": 608, "train_runtime": 1385.2346, "train_tokens_per_second": 333.287 }, { "epoch": 0.056, "grad_norm": 7.194956302642822, "learning_rate": 1.3954887218045114e-05, "loss": 0.4530368447303772, "num_input_tokens_seen": 462492, "step": 609, "train_runtime": 1387.1447, "train_tokens_per_second": 333.413 }, { "epoch": 0.056091954022988506, "grad_norm": 7.285534858703613, "learning_rate": 1.3944862155388472e-05, "loss": 0.4804021120071411, "num_input_tokens_seen": 463204, "step": 610, "train_runtime": 1389.0595, "train_tokens_per_second": 333.466 }, { "epoch": 0.05618390804597701, "grad_norm": 6.3361687660217285, "learning_rate": 1.3934837092731829e-05, "loss": 0.47082218527793884, "num_input_tokens_seen": 463976, "step": 611, "train_runtime": 1390.989, "train_tokens_per_second": 333.558 }, { "epoch": 0.05627586206896552, "grad_norm": 6.84358549118042, "learning_rate": 1.392481203007519e-05, "loss": 0.4161568284034729, "num_input_tokens_seen": 464488, "step": 612, "train_runtime": 1392.8722, "train_tokens_per_second": 333.475 }, { "epoch": 0.05636781609195402, "grad_norm": 6.668210029602051, "learning_rate": 1.3914786967418548e-05, "loss": 0.5246766209602356, "num_input_tokens_seen": 465308, "step": 613, "train_runtime": 1394.8056, "train_tokens_per_second": 333.601 }, { "epoch": 0.05645977011494253, "grad_norm": 6.792135238647461, "learning_rate": 1.3904761904761905e-05, "loss": 0.502672016620636, "num_input_tokens_seen": 465952, "step": 614, "train_runtime": 1396.7219, "train_tokens_per_second": 333.604 }, { "epoch": 0.05655172413793103, "grad_norm": 8.083513259887695, "learning_rate": 1.3894736842105265e-05, "loss": 0.4832074046134949, "num_input_tokens_seen": 466960, "step": 615, "train_runtime": 1398.6947, "train_tokens_per_second": 333.854 }, { "epoch": 0.05664367816091954, "grad_norm": 7.883939266204834, "learning_rate": 1.3884711779448623e-05, "loss": 0.45869264006614685, "num_input_tokens_seen": 467584, "step": 616, "train_runtime": 1400.5931, "train_tokens_per_second": 333.847 }, { "epoch": 0.05673563218390804, "grad_norm": 6.502721309661865, "learning_rate": 1.387468671679198e-05, "loss": 0.3988117575645447, "num_input_tokens_seen": 468228, "step": 617, "train_runtime": 1402.4785, "train_tokens_per_second": 333.858 }, { "epoch": 0.056827586206896555, "grad_norm": 7.88711404800415, "learning_rate": 1.3864661654135339e-05, "loss": 0.48905035853385925, "num_input_tokens_seen": 468772, "step": 618, "train_runtime": 1404.4042, "train_tokens_per_second": 333.787 }, { "epoch": 0.05691954022988506, "grad_norm": 6.885398864746094, "learning_rate": 1.3854636591478699e-05, "loss": 0.5362621545791626, "num_input_tokens_seen": 469608, "step": 619, "train_runtime": 1406.3305, "train_tokens_per_second": 333.924 }, { "epoch": 0.057011494252873565, "grad_norm": 6.992614269256592, "learning_rate": 1.3844611528822056e-05, "loss": 0.43546825647354126, "num_input_tokens_seen": 470188, "step": 620, "train_runtime": 1408.2209, "train_tokens_per_second": 333.888 }, { "epoch": 0.05710344827586207, "grad_norm": 7.322522163391113, "learning_rate": 1.3834586466165414e-05, "loss": 0.40986236929893494, "num_input_tokens_seen": 470740, "step": 621, "train_runtime": 1410.1226, "train_tokens_per_second": 333.829 }, { "epoch": 0.057195402298850576, "grad_norm": 6.906339645385742, "learning_rate": 1.3824561403508774e-05, "loss": 0.48197853565216064, "num_input_tokens_seen": 471544, "step": 622, "train_runtime": 1412.0454, "train_tokens_per_second": 333.944 }, { "epoch": 0.05728735632183908, "grad_norm": 6.975005149841309, "learning_rate": 1.3814536340852131e-05, "loss": 0.45380908250808716, "num_input_tokens_seen": 472196, "step": 623, "train_runtime": 1413.9404, "train_tokens_per_second": 333.958 }, { "epoch": 0.057379310344827586, "grad_norm": 6.444450855255127, "learning_rate": 1.380451127819549e-05, "loss": 0.45575663447380066, "num_input_tokens_seen": 472880, "step": 624, "train_runtime": 1415.8372, "train_tokens_per_second": 333.993 }, { "epoch": 0.05747126436781609, "grad_norm": 6.794878005981445, "learning_rate": 1.379448621553885e-05, "loss": 0.41316524147987366, "num_input_tokens_seen": 473432, "step": 625, "train_runtime": 1417.7243, "train_tokens_per_second": 333.938 }, { "epoch": 0.057563218390804596, "grad_norm": 7.611130237579346, "learning_rate": 1.3784461152882206e-05, "loss": 0.5504496693611145, "num_input_tokens_seen": 474304, "step": 626, "train_runtime": 1419.7027, "train_tokens_per_second": 334.087 }, { "epoch": 0.0576551724137931, "grad_norm": 7.361907958984375, "learning_rate": 1.3774436090225565e-05, "loss": 0.603052020072937, "num_input_tokens_seen": 474832, "step": 627, "train_runtime": 1421.5911, "train_tokens_per_second": 334.014 }, { "epoch": 0.05774712643678161, "grad_norm": 7.018294811248779, "learning_rate": 1.3764411027568922e-05, "loss": 0.49843698740005493, "num_input_tokens_seen": 475436, "step": 628, "train_runtime": 1423.4811, "train_tokens_per_second": 333.995 }, { "epoch": 0.05783908045977011, "grad_norm": 6.863377571105957, "learning_rate": 1.3754385964912282e-05, "loss": 0.5012993216514587, "num_input_tokens_seen": 476196, "step": 629, "train_runtime": 1425.3856, "train_tokens_per_second": 334.082 }, { "epoch": 0.057931034482758624, "grad_norm": 7.29086446762085, "learning_rate": 1.374436090225564e-05, "loss": 0.41038984060287476, "num_input_tokens_seen": 476824, "step": 630, "train_runtime": 1427.2687, "train_tokens_per_second": 334.081 }, { "epoch": 0.05802298850574713, "grad_norm": 6.348538398742676, "learning_rate": 1.3734335839598997e-05, "loss": 0.41164064407348633, "num_input_tokens_seen": 477396, "step": 631, "train_runtime": 1436.0596, "train_tokens_per_second": 332.435 }, { "epoch": 0.058114942528735634, "grad_norm": 8.6748046875, "learning_rate": 1.3724310776942357e-05, "loss": 0.42310094833374023, "num_input_tokens_seen": 478000, "step": 632, "train_runtime": 1438.0276, "train_tokens_per_second": 332.4 }, { "epoch": 0.05820689655172414, "grad_norm": 7.081576824188232, "learning_rate": 1.3714285714285716e-05, "loss": 0.563265860080719, "num_input_tokens_seen": 478700, "step": 633, "train_runtime": 1439.9265, "train_tokens_per_second": 332.448 }, { "epoch": 0.058298850574712645, "grad_norm": 7.547027587890625, "learning_rate": 1.3704260651629073e-05, "loss": 0.5364609956741333, "num_input_tokens_seen": 479380, "step": 634, "train_runtime": 1441.9256, "train_tokens_per_second": 332.458 }, { "epoch": 0.05839080459770115, "grad_norm": 7.5485429763793945, "learning_rate": 1.3694235588972433e-05, "loss": 0.4307040572166443, "num_input_tokens_seen": 480088, "step": 635, "train_runtime": 1443.8814, "train_tokens_per_second": 332.498 }, { "epoch": 0.058482758620689655, "grad_norm": 8.463400840759277, "learning_rate": 1.3684210526315791e-05, "loss": 0.5067605376243591, "num_input_tokens_seen": 480764, "step": 636, "train_runtime": 1445.9187, "train_tokens_per_second": 332.497 }, { "epoch": 0.05857471264367816, "grad_norm": 6.971987247467041, "learning_rate": 1.3674185463659148e-05, "loss": 0.48865610361099243, "num_input_tokens_seen": 481488, "step": 637, "train_runtime": 1447.8676, "train_tokens_per_second": 332.55 }, { "epoch": 0.058666666666666666, "grad_norm": 6.737226963043213, "learning_rate": 1.3664160401002507e-05, "loss": 0.4488855302333832, "num_input_tokens_seen": 482432, "step": 638, "train_runtime": 1449.8477, "train_tokens_per_second": 332.747 }, { "epoch": 0.05875862068965517, "grad_norm": 6.816892623901367, "learning_rate": 1.3654135338345867e-05, "loss": 0.46124267578125, "num_input_tokens_seen": 483012, "step": 639, "train_runtime": 1451.7729, "train_tokens_per_second": 332.705 }, { "epoch": 0.058850574712643676, "grad_norm": 7.571601390838623, "learning_rate": 1.3644110275689224e-05, "loss": 0.5857945084571838, "num_input_tokens_seen": 483728, "step": 640, "train_runtime": 1453.692, "train_tokens_per_second": 332.758 }, { "epoch": 0.05894252873563218, "grad_norm": 6.198338508605957, "learning_rate": 1.3634085213032582e-05, "loss": 0.4566928446292877, "num_input_tokens_seen": 484372, "step": 641, "train_runtime": 1455.5907, "train_tokens_per_second": 332.767 }, { "epoch": 0.059034482758620686, "grad_norm": 7.301205635070801, "learning_rate": 1.3624060150375942e-05, "loss": 0.50412917137146, "num_input_tokens_seen": 484992, "step": 642, "train_runtime": 1457.4654, "train_tokens_per_second": 332.764 }, { "epoch": 0.0591264367816092, "grad_norm": 6.268556594848633, "learning_rate": 1.3614035087719299e-05, "loss": 0.45484834909439087, "num_input_tokens_seen": 486216, "step": 643, "train_runtime": 1459.4441, "train_tokens_per_second": 333.152 }, { "epoch": 0.059218390804597704, "grad_norm": 7.198829650878906, "learning_rate": 1.3604010025062658e-05, "loss": 0.4686107039451599, "num_input_tokens_seen": 486900, "step": 644, "train_runtime": 1461.3529, "train_tokens_per_second": 333.184 }, { "epoch": 0.05931034482758621, "grad_norm": 6.827565670013428, "learning_rate": 1.3593984962406018e-05, "loss": 0.46443143486976624, "num_input_tokens_seen": 487716, "step": 645, "train_runtime": 1463.2791, "train_tokens_per_second": 333.303 }, { "epoch": 0.059402298850574714, "grad_norm": 6.095017910003662, "learning_rate": 1.3583959899749374e-05, "loss": 0.46966350078582764, "num_input_tokens_seen": 488416, "step": 646, "train_runtime": 1465.1834, "train_tokens_per_second": 333.348 }, { "epoch": 0.05949425287356322, "grad_norm": 7.52510404586792, "learning_rate": 1.3573934837092733e-05, "loss": 0.5057723522186279, "num_input_tokens_seen": 489248, "step": 647, "train_runtime": 1467.1037, "train_tokens_per_second": 333.479 }, { "epoch": 0.059586206896551724, "grad_norm": 6.387228965759277, "learning_rate": 1.356390977443609e-05, "loss": 0.5528343915939331, "num_input_tokens_seen": 490452, "step": 648, "train_runtime": 1469.0557, "train_tokens_per_second": 333.855 }, { "epoch": 0.05967816091954023, "grad_norm": 7.294100284576416, "learning_rate": 1.355388471177945e-05, "loss": 0.5030719041824341, "num_input_tokens_seen": 491080, "step": 649, "train_runtime": 1470.9525, "train_tokens_per_second": 333.852 }, { "epoch": 0.059770114942528735, "grad_norm": 6.579063415527344, "learning_rate": 1.3543859649122808e-05, "loss": 0.41523224115371704, "num_input_tokens_seen": 491824, "step": 650, "train_runtime": 1472.8282, "train_tokens_per_second": 333.932 }, { "epoch": 0.05986206896551724, "grad_norm": 6.683007717132568, "learning_rate": 1.3533834586466165e-05, "loss": 0.48073697090148926, "num_input_tokens_seen": 492464, "step": 651, "train_runtime": 1474.7119, "train_tokens_per_second": 333.939 }, { "epoch": 0.059954022988505745, "grad_norm": 7.796069145202637, "learning_rate": 1.3523809523809525e-05, "loss": 0.6073784828186035, "num_input_tokens_seen": 493376, "step": 652, "train_runtime": 1476.6561, "train_tokens_per_second": 334.117 }, { "epoch": 0.06004597701149425, "grad_norm": 6.322948455810547, "learning_rate": 1.3513784461152884e-05, "loss": 0.6217048168182373, "num_input_tokens_seen": 494208, "step": 653, "train_runtime": 1478.6082, "train_tokens_per_second": 334.239 }, { "epoch": 0.060137931034482756, "grad_norm": 6.643691062927246, "learning_rate": 1.350375939849624e-05, "loss": 0.4755760729312897, "num_input_tokens_seen": 494820, "step": 654, "train_runtime": 1480.5004, "train_tokens_per_second": 334.225 }, { "epoch": 0.06022988505747127, "grad_norm": 6.905515670776367, "learning_rate": 1.3493734335839601e-05, "loss": 0.5002609491348267, "num_input_tokens_seen": 495404, "step": 655, "train_runtime": 1482.3805, "train_tokens_per_second": 334.195 }, { "epoch": 0.06032183908045977, "grad_norm": 7.0027666091918945, "learning_rate": 1.348370927318296e-05, "loss": 0.5450930595397949, "num_input_tokens_seen": 496092, "step": 656, "train_runtime": 1484.2702, "train_tokens_per_second": 334.233 }, { "epoch": 0.06041379310344828, "grad_norm": 6.325944900512695, "learning_rate": 1.3473684210526316e-05, "loss": 0.4743611812591553, "num_input_tokens_seen": 496636, "step": 657, "train_runtime": 1486.1459, "train_tokens_per_second": 334.177 }, { "epoch": 0.06050574712643678, "grad_norm": 7.365074157714844, "learning_rate": 1.3463659147869675e-05, "loss": 0.4588896632194519, "num_input_tokens_seen": 497492, "step": 658, "train_runtime": 1488.033, "train_tokens_per_second": 334.329 }, { "epoch": 0.06059770114942529, "grad_norm": 5.5434088706970215, "learning_rate": 1.3453634085213035e-05, "loss": 0.43437156081199646, "num_input_tokens_seen": 499976, "step": 659, "train_runtime": 1490.1784, "train_tokens_per_second": 335.514 }, { "epoch": 0.060689655172413794, "grad_norm": 6.805002689361572, "learning_rate": 1.3443609022556392e-05, "loss": 0.44768649339675903, "num_input_tokens_seen": 500716, "step": 660, "train_runtime": 1492.0889, "train_tokens_per_second": 335.581 }, { "epoch": 0.0607816091954023, "grad_norm": 7.561191082000732, "learning_rate": 1.343358395989975e-05, "loss": 0.5202498435974121, "num_input_tokens_seen": 501336, "step": 661, "train_runtime": 1500.5241, "train_tokens_per_second": 334.107 }, { "epoch": 0.060873563218390804, "grad_norm": 7.143009185791016, "learning_rate": 1.342355889724311e-05, "loss": 0.46148866415023804, "num_input_tokens_seen": 501952, "step": 662, "train_runtime": 1502.5227, "train_tokens_per_second": 334.073 }, { "epoch": 0.06096551724137931, "grad_norm": 6.5299859046936035, "learning_rate": 1.3413533834586467e-05, "loss": 0.4477870464324951, "num_input_tokens_seen": 502632, "step": 663, "train_runtime": 1504.4094, "train_tokens_per_second": 334.106 }, { "epoch": 0.061057471264367814, "grad_norm": 7.125858306884766, "learning_rate": 1.3403508771929826e-05, "loss": 0.6004577875137329, "num_input_tokens_seen": 503324, "step": 664, "train_runtime": 1506.3018, "train_tokens_per_second": 334.146 }, { "epoch": 0.06114942528735632, "grad_norm": 7.250263690948486, "learning_rate": 1.3393483709273186e-05, "loss": 0.4981212913990021, "num_input_tokens_seen": 503956, "step": 665, "train_runtime": 1508.1885, "train_tokens_per_second": 334.147 }, { "epoch": 0.061241379310344825, "grad_norm": 7.098365306854248, "learning_rate": 1.3383458646616543e-05, "loss": 0.510361909866333, "num_input_tokens_seen": 504520, "step": 666, "train_runtime": 1510.085, "train_tokens_per_second": 334.1 }, { "epoch": 0.06133333333333333, "grad_norm": 6.275176525115967, "learning_rate": 1.3373433583959901e-05, "loss": 0.4923957884311676, "num_input_tokens_seen": 505248, "step": 667, "train_runtime": 1511.9878, "train_tokens_per_second": 334.161 }, { "epoch": 0.06142528735632184, "grad_norm": 6.961394309997559, "learning_rate": 1.3363408521303258e-05, "loss": 0.48068487644195557, "num_input_tokens_seen": 505916, "step": 668, "train_runtime": 1513.8834, "train_tokens_per_second": 334.184 }, { "epoch": 0.06151724137931035, "grad_norm": 6.190309524536133, "learning_rate": 1.3353383458646618e-05, "loss": 0.4339936077594757, "num_input_tokens_seen": 506564, "step": 669, "train_runtime": 1515.7905, "train_tokens_per_second": 334.191 }, { "epoch": 0.06160919540229885, "grad_norm": 7.2936110496521, "learning_rate": 1.3343358395989977e-05, "loss": 0.5688676238059998, "num_input_tokens_seen": 507416, "step": 670, "train_runtime": 1517.72, "train_tokens_per_second": 334.328 }, { "epoch": 0.06170114942528736, "grad_norm": 8.014532089233398, "learning_rate": 1.3333333333333333e-05, "loss": 0.47973912954330444, "num_input_tokens_seen": 508124, "step": 671, "train_runtime": 1519.6395, "train_tokens_per_second": 334.371 }, { "epoch": 0.06179310344827586, "grad_norm": 7.369278907775879, "learning_rate": 1.3323308270676693e-05, "loss": 0.5662002563476562, "num_input_tokens_seen": 508928, "step": 672, "train_runtime": 1521.5806, "train_tokens_per_second": 334.473 }, { "epoch": 0.06188505747126437, "grad_norm": 6.326199531555176, "learning_rate": 1.3313283208020052e-05, "loss": 0.5147907733917236, "num_input_tokens_seen": 509632, "step": 673, "train_runtime": 1523.4741, "train_tokens_per_second": 334.52 }, { "epoch": 0.06197701149425287, "grad_norm": 6.8698015213012695, "learning_rate": 1.3303258145363409e-05, "loss": 0.521502673625946, "num_input_tokens_seen": 510564, "step": 674, "train_runtime": 1525.4458, "train_tokens_per_second": 334.698 }, { "epoch": 0.06206896551724138, "grad_norm": 7.055248260498047, "learning_rate": 1.3293233082706769e-05, "loss": 0.49516522884368896, "num_input_tokens_seen": 511180, "step": 675, "train_runtime": 1527.3351, "train_tokens_per_second": 334.688 }, { "epoch": 0.062160919540229884, "grad_norm": 7.518498420715332, "learning_rate": 1.3283208020050127e-05, "loss": 0.5852192044258118, "num_input_tokens_seen": 512044, "step": 676, "train_runtime": 1529.2661, "train_tokens_per_second": 334.83 }, { "epoch": 0.06225287356321839, "grad_norm": 5.807666301727295, "learning_rate": 1.3273182957393484e-05, "loss": 0.49576497077941895, "num_input_tokens_seen": 513420, "step": 677, "train_runtime": 1531.2502, "train_tokens_per_second": 335.295 }, { "epoch": 0.062344827586206894, "grad_norm": 8.027884483337402, "learning_rate": 1.3263157894736843e-05, "loss": 0.5500902533531189, "num_input_tokens_seen": 514204, "step": 678, "train_runtime": 1533.1688, "train_tokens_per_second": 335.386 }, { "epoch": 0.0624367816091954, "grad_norm": 6.813953399658203, "learning_rate": 1.3253132832080203e-05, "loss": 0.4119127690792084, "num_input_tokens_seen": 514844, "step": 679, "train_runtime": 1535.0529, "train_tokens_per_second": 335.392 }, { "epoch": 0.0625287356321839, "grad_norm": 7.3369011878967285, "learning_rate": 1.324310776942356e-05, "loss": 0.49944669008255005, "num_input_tokens_seen": 515852, "step": 680, "train_runtime": 1537.0046, "train_tokens_per_second": 335.622 }, { "epoch": 0.06262068965517241, "grad_norm": 6.819929122924805, "learning_rate": 1.3233082706766918e-05, "loss": 0.46720486879348755, "num_input_tokens_seen": 516672, "step": 681, "train_runtime": 1538.9407, "train_tokens_per_second": 335.732 }, { "epoch": 0.06271264367816091, "grad_norm": 7.631635665893555, "learning_rate": 1.3223057644110278e-05, "loss": 0.5723601579666138, "num_input_tokens_seen": 517516, "step": 682, "train_runtime": 1540.8935, "train_tokens_per_second": 335.854 }, { "epoch": 0.06280459770114942, "grad_norm": 6.981370449066162, "learning_rate": 1.3213032581453635e-05, "loss": 0.5557063221931458, "num_input_tokens_seen": 518096, "step": 683, "train_runtime": 1542.7841, "train_tokens_per_second": 335.819 }, { "epoch": 0.06289655172413793, "grad_norm": 6.457602500915527, "learning_rate": 1.3203007518796994e-05, "loss": 0.46246883273124695, "num_input_tokens_seen": 518796, "step": 684, "train_runtime": 1544.6934, "train_tokens_per_second": 335.857 }, { "epoch": 0.06298850574712643, "grad_norm": 7.061386585235596, "learning_rate": 1.3192982456140354e-05, "loss": 0.5143232345581055, "num_input_tokens_seen": 519392, "step": 685, "train_runtime": 1546.5914, "train_tokens_per_second": 335.83 }, { "epoch": 0.06308045977011495, "grad_norm": 7.075534343719482, "learning_rate": 1.318295739348371e-05, "loss": 0.42988720536231995, "num_input_tokens_seen": 520132, "step": 686, "train_runtime": 1548.4884, "train_tokens_per_second": 335.897 }, { "epoch": 0.06317241379310345, "grad_norm": 6.861327171325684, "learning_rate": 1.3172932330827069e-05, "loss": 0.5197246670722961, "num_input_tokens_seen": 520916, "step": 687, "train_runtime": 1550.4232, "train_tokens_per_second": 335.983 }, { "epoch": 0.06326436781609196, "grad_norm": 9.0070219039917, "learning_rate": 1.3162907268170426e-05, "loss": 0.5759735107421875, "num_input_tokens_seen": 521644, "step": 688, "train_runtime": 1552.3332, "train_tokens_per_second": 336.039 }, { "epoch": 0.06335632183908046, "grad_norm": 7.550922393798828, "learning_rate": 1.3152882205513786e-05, "loss": 0.4897928535938263, "num_input_tokens_seen": 522600, "step": 689, "train_runtime": 1554.3084, "train_tokens_per_second": 336.227 }, { "epoch": 0.06344827586206897, "grad_norm": 6.247206211090088, "learning_rate": 1.3142857142857145e-05, "loss": 0.5541774034500122, "num_input_tokens_seen": 523932, "step": 690, "train_runtime": 1556.3604, "train_tokens_per_second": 336.639 }, { "epoch": 0.06354022988505748, "grad_norm": 7.213705539703369, "learning_rate": 1.3132832080200501e-05, "loss": 0.4968850016593933, "num_input_tokens_seen": 524616, "step": 691, "train_runtime": 1565.1313, "train_tokens_per_second": 335.19 }, { "epoch": 0.06363218390804598, "grad_norm": 6.573073387145996, "learning_rate": 1.3122807017543862e-05, "loss": 0.4320947527885437, "num_input_tokens_seen": 525172, "step": 692, "train_runtime": 1567.1796, "train_tokens_per_second": 335.106 }, { "epoch": 0.06372413793103449, "grad_norm": 6.980879306793213, "learning_rate": 1.311278195488722e-05, "loss": 0.502927303314209, "num_input_tokens_seen": 525796, "step": 693, "train_runtime": 1569.0886, "train_tokens_per_second": 335.096 }, { "epoch": 0.06381609195402299, "grad_norm": 7.194272041320801, "learning_rate": 1.3102756892230577e-05, "loss": 0.4879305064678192, "num_input_tokens_seen": 526352, "step": 694, "train_runtime": 1571.0386, "train_tokens_per_second": 335.034 }, { "epoch": 0.0639080459770115, "grad_norm": 5.791599750518799, "learning_rate": 1.3092731829573937e-05, "loss": 0.4360908269882202, "num_input_tokens_seen": 526888, "step": 695, "train_runtime": 1572.9798, "train_tokens_per_second": 334.962 }, { "epoch": 0.064, "grad_norm": 7.671477317810059, "learning_rate": 1.3082706766917295e-05, "loss": 0.5835292935371399, "num_input_tokens_seen": 527900, "step": 696, "train_runtime": 1574.9703, "train_tokens_per_second": 335.181 }, { "epoch": 0.0640919540229885, "grad_norm": 7.398995876312256, "learning_rate": 1.3072681704260652e-05, "loss": 0.5330015420913696, "num_input_tokens_seen": 528808, "step": 697, "train_runtime": 1576.9475, "train_tokens_per_second": 335.336 }, { "epoch": 0.06418390804597701, "grad_norm": 6.887153148651123, "learning_rate": 1.306265664160401e-05, "loss": 0.6172720789909363, "num_input_tokens_seen": 529544, "step": 698, "train_runtime": 1578.9174, "train_tokens_per_second": 335.384 }, { "epoch": 0.06427586206896552, "grad_norm": 6.892273426055908, "learning_rate": 1.305263157894737e-05, "loss": 0.505545437335968, "num_input_tokens_seen": 530676, "step": 699, "train_runtime": 1580.9355, "train_tokens_per_second": 335.672 }, { "epoch": 0.06436781609195402, "grad_norm": 6.331185817718506, "learning_rate": 1.3042606516290728e-05, "loss": 0.4878854751586914, "num_input_tokens_seen": 531472, "step": 700, "train_runtime": 1582.9317, "train_tokens_per_second": 335.752 }, { "epoch": 0.06445977011494253, "grad_norm": 6.539681911468506, "learning_rate": 1.3032581453634086e-05, "loss": 0.5967066287994385, "num_input_tokens_seen": 532592, "step": 701, "train_runtime": 1585.0363, "train_tokens_per_second": 336.012 }, { "epoch": 0.06455172413793103, "grad_norm": 7.155969142913818, "learning_rate": 1.3022556390977445e-05, "loss": 0.5363156795501709, "num_input_tokens_seen": 533604, "step": 702, "train_runtime": 1587.0372, "train_tokens_per_second": 336.227 }, { "epoch": 0.06464367816091954, "grad_norm": 7.249508857727051, "learning_rate": 1.3012531328320803e-05, "loss": 0.570030927658081, "num_input_tokens_seen": 534604, "step": 703, "train_runtime": 1589.0663, "train_tokens_per_second": 336.426 }, { "epoch": 0.06473563218390804, "grad_norm": 6.429741859436035, "learning_rate": 1.3002506265664162e-05, "loss": 0.5177555084228516, "num_input_tokens_seen": 535212, "step": 704, "train_runtime": 1591.0705, "train_tokens_per_second": 336.385 }, { "epoch": 0.06482758620689655, "grad_norm": 6.571535110473633, "learning_rate": 1.299248120300752e-05, "loss": 0.584343433380127, "num_input_tokens_seen": 535956, "step": 705, "train_runtime": 1593.0127, "train_tokens_per_second": 336.442 }, { "epoch": 0.06491954022988505, "grad_norm": 7.391951084136963, "learning_rate": 1.2982456140350879e-05, "loss": 0.49518847465515137, "num_input_tokens_seen": 536788, "step": 706, "train_runtime": 1594.987, "train_tokens_per_second": 336.547 }, { "epoch": 0.06501149425287356, "grad_norm": 7.156089782714844, "learning_rate": 1.2972431077694237e-05, "loss": 0.48724111914634705, "num_input_tokens_seen": 537544, "step": 707, "train_runtime": 1596.9956, "train_tokens_per_second": 336.597 }, { "epoch": 0.06510344827586206, "grad_norm": 6.625319004058838, "learning_rate": 1.2962406015037594e-05, "loss": 0.47585195302963257, "num_input_tokens_seen": 538064, "step": 708, "train_runtime": 1598.9342, "train_tokens_per_second": 336.514 }, { "epoch": 0.06519540229885057, "grad_norm": 7.106809616088867, "learning_rate": 1.2952380952380954e-05, "loss": 0.520663857460022, "num_input_tokens_seen": 538956, "step": 709, "train_runtime": 1600.9127, "train_tokens_per_second": 336.655 }, { "epoch": 0.06528735632183907, "grad_norm": 6.606273174285889, "learning_rate": 1.2942355889724313e-05, "loss": 0.4652138948440552, "num_input_tokens_seen": 539504, "step": 710, "train_runtime": 1602.8735, "train_tokens_per_second": 336.586 }, { "epoch": 0.0653793103448276, "grad_norm": 6.744972229003906, "learning_rate": 1.293233082706767e-05, "loss": 0.5241913199424744, "num_input_tokens_seen": 540496, "step": 711, "train_runtime": 1604.9125, "train_tokens_per_second": 336.776 }, { "epoch": 0.0654712643678161, "grad_norm": 7.374359130859375, "learning_rate": 1.292230576441103e-05, "loss": 0.5033762454986572, "num_input_tokens_seen": 541140, "step": 712, "train_runtime": 1606.8829, "train_tokens_per_second": 336.764 }, { "epoch": 0.0655632183908046, "grad_norm": 6.294163227081299, "learning_rate": 1.2912280701754386e-05, "loss": 0.4169749617576599, "num_input_tokens_seen": 541992, "step": 713, "train_runtime": 1608.8905, "train_tokens_per_second": 336.873 }, { "epoch": 0.06565517241379311, "grad_norm": 6.865566253662109, "learning_rate": 1.2902255639097745e-05, "loss": 0.5325437188148499, "num_input_tokens_seen": 543256, "step": 714, "train_runtime": 1610.9148, "train_tokens_per_second": 337.234 }, { "epoch": 0.06574712643678161, "grad_norm": 6.749205589294434, "learning_rate": 1.2892230576441105e-05, "loss": 0.47279292345046997, "num_input_tokens_seen": 543916, "step": 715, "train_runtime": 1612.8835, "train_tokens_per_second": 337.232 }, { "epoch": 0.06583908045977012, "grad_norm": 6.720696449279785, "learning_rate": 1.2882205513784462e-05, "loss": 0.48280414938926697, "num_input_tokens_seen": 544688, "step": 716, "train_runtime": 1614.8576, "train_tokens_per_second": 337.298 }, { "epoch": 0.06593103448275862, "grad_norm": 8.794879913330078, "learning_rate": 1.287218045112782e-05, "loss": 0.5291348099708557, "num_input_tokens_seen": 545472, "step": 717, "train_runtime": 1616.8019, "train_tokens_per_second": 337.377 }, { "epoch": 0.06602298850574713, "grad_norm": 6.2707719802856445, "learning_rate": 1.2862155388471179e-05, "loss": 0.4864928126335144, "num_input_tokens_seen": 546060, "step": 718, "train_runtime": 1618.7249, "train_tokens_per_second": 337.34 }, { "epoch": 0.06611494252873563, "grad_norm": 7.030215740203857, "learning_rate": 1.2852130325814537e-05, "loss": 0.4947786331176758, "num_input_tokens_seen": 546808, "step": 719, "train_runtime": 1620.6869, "train_tokens_per_second": 337.393 }, { "epoch": 0.06620689655172414, "grad_norm": 6.65582799911499, "learning_rate": 1.2842105263157896e-05, "loss": 0.5161091089248657, "num_input_tokens_seen": 547440, "step": 720, "train_runtime": 1622.6139, "train_tokens_per_second": 337.382 }, { "epoch": 0.06629885057471264, "grad_norm": 6.280404090881348, "learning_rate": 1.2832080200501254e-05, "loss": 0.44713616371154785, "num_input_tokens_seen": 548160, "step": 721, "train_runtime": 1631.4892, "train_tokens_per_second": 335.988 }, { "epoch": 0.06639080459770115, "grad_norm": 7.807005882263184, "learning_rate": 1.2822055137844613e-05, "loss": 0.5657007694244385, "num_input_tokens_seen": 548812, "step": 722, "train_runtime": 1633.4444, "train_tokens_per_second": 335.984 }, { "epoch": 0.06648275862068966, "grad_norm": 6.831088066101074, "learning_rate": 1.2812030075187971e-05, "loss": 0.429911345243454, "num_input_tokens_seen": 549380, "step": 723, "train_runtime": 1635.368, "train_tokens_per_second": 335.937 }, { "epoch": 0.06657471264367816, "grad_norm": 5.718352317810059, "learning_rate": 1.2802005012531328e-05, "loss": 0.412373423576355, "num_input_tokens_seen": 551236, "step": 724, "train_runtime": 1637.4296, "train_tokens_per_second": 336.647 }, { "epoch": 0.06666666666666667, "grad_norm": 7.15751314163208, "learning_rate": 1.2791979949874688e-05, "loss": 0.40920761227607727, "num_input_tokens_seen": 551944, "step": 725, "train_runtime": 1639.3586, "train_tokens_per_second": 336.683 }, { "epoch": 0.06675862068965517, "grad_norm": 6.765956401824951, "learning_rate": 1.2781954887218047e-05, "loss": 0.4629984498023987, "num_input_tokens_seen": 553276, "step": 726, "train_runtime": 1641.4808, "train_tokens_per_second": 337.059 }, { "epoch": 0.06685057471264368, "grad_norm": 7.850322246551514, "learning_rate": 1.2771929824561404e-05, "loss": 0.46668586134910583, "num_input_tokens_seen": 553928, "step": 727, "train_runtime": 1643.4299, "train_tokens_per_second": 337.056 }, { "epoch": 0.06694252873563218, "grad_norm": 6.204847812652588, "learning_rate": 1.2761904761904762e-05, "loss": 0.45401400327682495, "num_input_tokens_seen": 554452, "step": 728, "train_runtime": 1645.3516, "train_tokens_per_second": 336.981 }, { "epoch": 0.06703448275862069, "grad_norm": 7.187865257263184, "learning_rate": 1.2751879699248122e-05, "loss": 0.4337291717529297, "num_input_tokens_seen": 555292, "step": 729, "train_runtime": 1647.3034, "train_tokens_per_second": 337.092 }, { "epoch": 0.06712643678160919, "grad_norm": 6.8617844581604, "learning_rate": 1.2741854636591479e-05, "loss": 0.5119789242744446, "num_input_tokens_seen": 555944, "step": 730, "train_runtime": 1649.2402, "train_tokens_per_second": 337.091 }, { "epoch": 0.0672183908045977, "grad_norm": 6.7105841636657715, "learning_rate": 1.2731829573934837e-05, "loss": 0.5011810064315796, "num_input_tokens_seen": 556584, "step": 731, "train_runtime": 1651.1496, "train_tokens_per_second": 337.089 }, { "epoch": 0.0673103448275862, "grad_norm": 7.510727882385254, "learning_rate": 1.2721804511278198e-05, "loss": 0.6270932555198669, "num_input_tokens_seen": 557844, "step": 732, "train_runtime": 1653.1757, "train_tokens_per_second": 337.438 }, { "epoch": 0.06740229885057471, "grad_norm": 6.8630595207214355, "learning_rate": 1.2711779448621554e-05, "loss": 0.4799724817276001, "num_input_tokens_seen": 558528, "step": 733, "train_runtime": 1655.108, "train_tokens_per_second": 337.457 }, { "epoch": 0.06749425287356321, "grad_norm": 6.472028732299805, "learning_rate": 1.2701754385964913e-05, "loss": 0.5073041915893555, "num_input_tokens_seen": 559064, "step": 734, "train_runtime": 1657.103, "train_tokens_per_second": 337.374 }, { "epoch": 0.06758620689655172, "grad_norm": 6.790537357330322, "learning_rate": 1.2691729323308273e-05, "loss": 0.6256628632545471, "num_input_tokens_seen": 560108, "step": 735, "train_runtime": 1659.1651, "train_tokens_per_second": 337.584 }, { "epoch": 0.06767816091954024, "grad_norm": 7.035492897033691, "learning_rate": 1.268170426065163e-05, "loss": 0.4381142556667328, "num_input_tokens_seen": 560728, "step": 736, "train_runtime": 1661.0869, "train_tokens_per_second": 337.567 }, { "epoch": 0.06777011494252874, "grad_norm": 7.550258159637451, "learning_rate": 1.2671679197994988e-05, "loss": 0.46850088238716125, "num_input_tokens_seen": 561380, "step": 737, "train_runtime": 1663.0278, "train_tokens_per_second": 337.565 }, { "epoch": 0.06786206896551725, "grad_norm": 6.153674125671387, "learning_rate": 1.2661654135338345e-05, "loss": 0.45343711972236633, "num_input_tokens_seen": 561984, "step": 738, "train_runtime": 1664.9469, "train_tokens_per_second": 337.539 }, { "epoch": 0.06795402298850575, "grad_norm": 7.199565410614014, "learning_rate": 1.2651629072681705e-05, "loss": 0.4830615520477295, "num_input_tokens_seen": 562680, "step": 739, "train_runtime": 1666.8798, "train_tokens_per_second": 337.565 }, { "epoch": 0.06804597701149426, "grad_norm": 7.291567325592041, "learning_rate": 1.2641604010025064e-05, "loss": 0.5234308242797852, "num_input_tokens_seen": 563344, "step": 740, "train_runtime": 1668.8178, "train_tokens_per_second": 337.571 }, { "epoch": 0.06813793103448276, "grad_norm": 7.292444705963135, "learning_rate": 1.263157894736842e-05, "loss": 0.565500020980835, "num_input_tokens_seen": 564068, "step": 741, "train_runtime": 1670.7482, "train_tokens_per_second": 337.614 }, { "epoch": 0.06822988505747127, "grad_norm": 7.037001132965088, "learning_rate": 1.262155388471178e-05, "loss": 0.46853190660476685, "num_input_tokens_seen": 564764, "step": 742, "train_runtime": 1672.7809, "train_tokens_per_second": 337.62 }, { "epoch": 0.06832183908045977, "grad_norm": 6.376340389251709, "learning_rate": 1.261152882205514e-05, "loss": 0.5655608177185059, "num_input_tokens_seen": 565700, "step": 743, "train_runtime": 1674.7417, "train_tokens_per_second": 337.783 }, { "epoch": 0.06841379310344828, "grad_norm": 7.177804470062256, "learning_rate": 1.2601503759398496e-05, "loss": 0.49037617444992065, "num_input_tokens_seen": 566368, "step": 744, "train_runtime": 1676.6737, "train_tokens_per_second": 337.793 }, { "epoch": 0.06850574712643678, "grad_norm": 6.068066596984863, "learning_rate": 1.2591478696741856e-05, "loss": 0.39159297943115234, "num_input_tokens_seen": 566976, "step": 745, "train_runtime": 1678.5987, "train_tokens_per_second": 337.767 }, { "epoch": 0.06859770114942529, "grad_norm": 6.261608600616455, "learning_rate": 1.2581453634085215e-05, "loss": 0.5073766708374023, "num_input_tokens_seen": 568312, "step": 746, "train_runtime": 1680.6311, "train_tokens_per_second": 338.154 }, { "epoch": 0.0686896551724138, "grad_norm": 8.0780668258667, "learning_rate": 1.2571428571428572e-05, "loss": 0.6464099287986755, "num_input_tokens_seen": 568928, "step": 747, "train_runtime": 1682.559, "train_tokens_per_second": 338.133 }, { "epoch": 0.0687816091954023, "grad_norm": 6.58332633972168, "learning_rate": 1.256140350877193e-05, "loss": 0.43471819162368774, "num_input_tokens_seen": 569544, "step": 748, "train_runtime": 1684.4879, "train_tokens_per_second": 338.111 }, { "epoch": 0.0688735632183908, "grad_norm": 6.317200183868408, "learning_rate": 1.255137844611529e-05, "loss": 0.4880402982234955, "num_input_tokens_seen": 570352, "step": 749, "train_runtime": 1686.4616, "train_tokens_per_second": 338.194 }, { "epoch": 0.06896551724137931, "grad_norm": 6.550645351409912, "learning_rate": 1.2541353383458647e-05, "loss": 0.5459703803062439, "num_input_tokens_seen": 571376, "step": 750, "train_runtime": 1688.4486, "train_tokens_per_second": 338.403 }, { "epoch": 0.06905747126436781, "grad_norm": 6.884756565093994, "learning_rate": 1.2531328320802006e-05, "loss": 0.4800689220428467, "num_input_tokens_seen": 572200, "step": 751, "train_runtime": 1697.3154, "train_tokens_per_second": 337.121 }, { "epoch": 0.06914942528735632, "grad_norm": 7.125977993011475, "learning_rate": 1.2521303258145366e-05, "loss": 0.5538926124572754, "num_input_tokens_seen": 572980, "step": 752, "train_runtime": 1699.3056, "train_tokens_per_second": 337.185 }, { "epoch": 0.06924137931034482, "grad_norm": 6.5595574378967285, "learning_rate": 1.2511278195488723e-05, "loss": 0.5036803483963013, "num_input_tokens_seen": 573712, "step": 753, "train_runtime": 1701.2344, "train_tokens_per_second": 337.233 }, { "epoch": 0.06933333333333333, "grad_norm": 6.945261478424072, "learning_rate": 1.2501253132832081e-05, "loss": 0.42304864525794983, "num_input_tokens_seen": 574240, "step": 754, "train_runtime": 1703.1613, "train_tokens_per_second": 337.161 }, { "epoch": 0.06942528735632184, "grad_norm": 8.34179973602295, "learning_rate": 1.2491228070175441e-05, "loss": 0.5464489459991455, "num_input_tokens_seen": 575192, "step": 755, "train_runtime": 1705.2184, "train_tokens_per_second": 337.313 }, { "epoch": 0.06951724137931034, "grad_norm": 7.022257328033447, "learning_rate": 1.2481203007518798e-05, "loss": 0.5530050992965698, "num_input_tokens_seen": 576100, "step": 756, "train_runtime": 1707.2174, "train_tokens_per_second": 337.45 }, { "epoch": 0.06960919540229885, "grad_norm": 6.397459506988525, "learning_rate": 1.2471177944862156e-05, "loss": 0.46334466338157654, "num_input_tokens_seen": 576744, "step": 757, "train_runtime": 1709.144, "train_tokens_per_second": 337.446 }, { "epoch": 0.06970114942528735, "grad_norm": 6.368110179901123, "learning_rate": 1.2461152882205513e-05, "loss": 0.43705421686172485, "num_input_tokens_seen": 577436, "step": 758, "train_runtime": 1711.1179, "train_tokens_per_second": 337.461 }, { "epoch": 0.06979310344827586, "grad_norm": 7.558487892150879, "learning_rate": 1.2451127819548873e-05, "loss": 0.4765796661376953, "num_input_tokens_seen": 578072, "step": 759, "train_runtime": 1713.0453, "train_tokens_per_second": 337.453 }, { "epoch": 0.06988505747126436, "grad_norm": 7.0516533851623535, "learning_rate": 1.2441102756892232e-05, "loss": 0.5368772745132446, "num_input_tokens_seen": 578868, "step": 760, "train_runtime": 1714.9924, "train_tokens_per_second": 337.534 }, { "epoch": 0.06997701149425288, "grad_norm": 6.277525424957275, "learning_rate": 1.2431077694235589e-05, "loss": 0.36886775493621826, "num_input_tokens_seen": 579620, "step": 761, "train_runtime": 1716.952, "train_tokens_per_second": 337.587 }, { "epoch": 0.07006896551724139, "grad_norm": 7.795188903808594, "learning_rate": 1.2421052631578949e-05, "loss": 0.4997369050979614, "num_input_tokens_seen": 580360, "step": 762, "train_runtime": 1718.9349, "train_tokens_per_second": 337.628 }, { "epoch": 0.07016091954022989, "grad_norm": 6.9216132164001465, "learning_rate": 1.2411027568922307e-05, "loss": 0.4790230393409729, "num_input_tokens_seen": 580980, "step": 763, "train_runtime": 1720.8851, "train_tokens_per_second": 337.605 }, { "epoch": 0.0702528735632184, "grad_norm": 6.596647262573242, "learning_rate": 1.2401002506265664e-05, "loss": 0.4051140546798706, "num_input_tokens_seen": 581576, "step": 764, "train_runtime": 1722.8138, "train_tokens_per_second": 337.573 }, { "epoch": 0.0703448275862069, "grad_norm": 7.1984076499938965, "learning_rate": 1.2390977443609024e-05, "loss": 0.4946567714214325, "num_input_tokens_seen": 582340, "step": 765, "train_runtime": 1724.7467, "train_tokens_per_second": 337.638 }, { "epoch": 0.0704367816091954, "grad_norm": 6.350241661071777, "learning_rate": 1.2380952380952383e-05, "loss": 0.5237550735473633, "num_input_tokens_seen": 583264, "step": 766, "train_runtime": 1726.7142, "train_tokens_per_second": 337.788 }, { "epoch": 0.07052873563218391, "grad_norm": 7.541025161743164, "learning_rate": 1.237092731829574e-05, "loss": 0.4568924605846405, "num_input_tokens_seen": 583896, "step": 767, "train_runtime": 1728.6403, "train_tokens_per_second": 337.778 }, { "epoch": 0.07062068965517242, "grad_norm": 6.652822017669678, "learning_rate": 1.2360902255639098e-05, "loss": 0.40945571660995483, "num_input_tokens_seen": 584680, "step": 768, "train_runtime": 1730.6044, "train_tokens_per_second": 337.847 }, { "epoch": 0.07071264367816092, "grad_norm": 6.930812835693359, "learning_rate": 1.2350877192982458e-05, "loss": 0.5204863548278809, "num_input_tokens_seen": 586168, "step": 769, "train_runtime": 1732.6709, "train_tokens_per_second": 338.303 }, { "epoch": 0.07080459770114943, "grad_norm": 7.797668933868408, "learning_rate": 1.2340852130325815e-05, "loss": 0.6980093717575073, "num_input_tokens_seen": 586836, "step": 770, "train_runtime": 1734.5988, "train_tokens_per_second": 338.312 }, { "epoch": 0.07089655172413793, "grad_norm": 6.9763898849487305, "learning_rate": 1.2330827067669174e-05, "loss": 0.4698995351791382, "num_input_tokens_seen": 588052, "step": 771, "train_runtime": 1736.5856, "train_tokens_per_second": 338.625 }, { "epoch": 0.07098850574712644, "grad_norm": 6.0939178466796875, "learning_rate": 1.2320802005012534e-05, "loss": 0.41389238834381104, "num_input_tokens_seen": 588796, "step": 772, "train_runtime": 1738.5425, "train_tokens_per_second": 338.672 }, { "epoch": 0.07108045977011494, "grad_norm": 6.996767520904541, "learning_rate": 1.231077694235589e-05, "loss": 0.4361867308616638, "num_input_tokens_seen": 589440, "step": 773, "train_runtime": 1740.4911, "train_tokens_per_second": 338.663 }, { "epoch": 0.07117241379310345, "grad_norm": 6.896433353424072, "learning_rate": 1.2300751879699249e-05, "loss": 0.4922274351119995, "num_input_tokens_seen": 590072, "step": 774, "train_runtime": 1742.4207, "train_tokens_per_second": 338.651 }, { "epoch": 0.07126436781609195, "grad_norm": 7.727783679962158, "learning_rate": 1.229072681704261e-05, "loss": 0.5629440546035767, "num_input_tokens_seen": 590904, "step": 775, "train_runtime": 1744.44, "train_tokens_per_second": 338.736 }, { "epoch": 0.07135632183908046, "grad_norm": 7.155002117156982, "learning_rate": 1.2280701754385966e-05, "loss": 0.4994778037071228, "num_input_tokens_seen": 591592, "step": 776, "train_runtime": 1746.3834, "train_tokens_per_second": 338.753 }, { "epoch": 0.07144827586206896, "grad_norm": 6.324461460113525, "learning_rate": 1.2270676691729325e-05, "loss": 0.3676263093948364, "num_input_tokens_seen": 592392, "step": 777, "train_runtime": 1748.3815, "train_tokens_per_second": 338.823 }, { "epoch": 0.07154022988505747, "grad_norm": 7.361177921295166, "learning_rate": 1.2260651629072681e-05, "loss": 0.5257224440574646, "num_input_tokens_seen": 593304, "step": 778, "train_runtime": 1750.3634, "train_tokens_per_second": 338.96 }, { "epoch": 0.07163218390804597, "grad_norm": 7.276780128479004, "learning_rate": 1.2250626566416041e-05, "loss": 0.4875470995903015, "num_input_tokens_seen": 593864, "step": 779, "train_runtime": 1752.2796, "train_tokens_per_second": 338.909 }, { "epoch": 0.07172413793103448, "grad_norm": 6.369472503662109, "learning_rate": 1.22406015037594e-05, "loss": 0.42024746537208557, "num_input_tokens_seen": 594428, "step": 780, "train_runtime": 1754.1979, "train_tokens_per_second": 338.86 }, { "epoch": 0.07181609195402298, "grad_norm": 6.957118988037109, "learning_rate": 1.2230576441102757e-05, "loss": 0.5289345979690552, "num_input_tokens_seen": 595080, "step": 781, "train_runtime": 1763.0355, "train_tokens_per_second": 337.531 }, { "epoch": 0.07190804597701149, "grad_norm": 6.785836696624756, "learning_rate": 1.2220551378446117e-05, "loss": 0.4399987757205963, "num_input_tokens_seen": 595692, "step": 782, "train_runtime": 1764.9625, "train_tokens_per_second": 337.51 }, { "epoch": 0.072, "grad_norm": 6.67493200302124, "learning_rate": 1.2210526315789475e-05, "loss": 0.4305074214935303, "num_input_tokens_seen": 596852, "step": 783, "train_runtime": 1766.9915, "train_tokens_per_second": 337.779 }, { "epoch": 0.0720919540229885, "grad_norm": 6.000429630279541, "learning_rate": 1.2200501253132832e-05, "loss": 0.45768213272094727, "num_input_tokens_seen": 597488, "step": 784, "train_runtime": 1768.9435, "train_tokens_per_second": 337.765 }, { "epoch": 0.072183908045977, "grad_norm": 5.904489517211914, "learning_rate": 1.2190476190476192e-05, "loss": 0.5369732975959778, "num_input_tokens_seen": 598436, "step": 785, "train_runtime": 1770.9035, "train_tokens_per_second": 337.927 }, { "epoch": 0.07227586206896552, "grad_norm": 7.443309783935547, "learning_rate": 1.2180451127819551e-05, "loss": 0.49624449014663696, "num_input_tokens_seen": 599000, "step": 786, "train_runtime": 1772.839, "train_tokens_per_second": 337.876 }, { "epoch": 0.07236781609195403, "grad_norm": 6.947629451751709, "learning_rate": 1.2170426065162908e-05, "loss": 0.47903862595558167, "num_input_tokens_seen": 599692, "step": 787, "train_runtime": 1774.7656, "train_tokens_per_second": 337.899 }, { "epoch": 0.07245977011494253, "grad_norm": 6.876119136810303, "learning_rate": 1.2160401002506266e-05, "loss": 0.5088704824447632, "num_input_tokens_seen": 600560, "step": 788, "train_runtime": 1776.7337, "train_tokens_per_second": 338.014 }, { "epoch": 0.07255172413793104, "grad_norm": 8.312402725219727, "learning_rate": 1.2150375939849626e-05, "loss": 0.46357420086860657, "num_input_tokens_seen": 601216, "step": 789, "train_runtime": 1778.7976, "train_tokens_per_second": 337.99 }, { "epoch": 0.07264367816091954, "grad_norm": 7.5309014320373535, "learning_rate": 1.2140350877192983e-05, "loss": 0.4875525236129761, "num_input_tokens_seen": 601828, "step": 790, "train_runtime": 1780.8088, "train_tokens_per_second": 337.952 }, { "epoch": 0.07273563218390805, "grad_norm": 6.479823112487793, "learning_rate": 1.2130325814536342e-05, "loss": 0.4365723431110382, "num_input_tokens_seen": 602428, "step": 791, "train_runtime": 1782.7738, "train_tokens_per_second": 337.916 }, { "epoch": 0.07282758620689656, "grad_norm": 6.727955341339111, "learning_rate": 1.2120300751879702e-05, "loss": 0.4399411678314209, "num_input_tokens_seen": 602992, "step": 792, "train_runtime": 1784.6858, "train_tokens_per_second": 337.87 }, { "epoch": 0.07291954022988506, "grad_norm": 7.448745250701904, "learning_rate": 1.2110275689223059e-05, "loss": 0.5305242538452148, "num_input_tokens_seen": 603716, "step": 793, "train_runtime": 1786.6041, "train_tokens_per_second": 337.913 }, { "epoch": 0.07301149425287357, "grad_norm": 7.2634806632995605, "learning_rate": 1.2100250626566417e-05, "loss": 0.6570507884025574, "num_input_tokens_seen": 604496, "step": 794, "train_runtime": 1788.5597, "train_tokens_per_second": 337.979 }, { "epoch": 0.07310344827586207, "grad_norm": 6.13576602935791, "learning_rate": 1.2090225563909777e-05, "loss": 0.41936028003692627, "num_input_tokens_seen": 605140, "step": 795, "train_runtime": 1790.4811, "train_tokens_per_second": 337.976 }, { "epoch": 0.07319540229885058, "grad_norm": 8.78651237487793, "learning_rate": 1.2080200501253134e-05, "loss": 0.5948994159698486, "num_input_tokens_seen": 605908, "step": 796, "train_runtime": 1792.4324, "train_tokens_per_second": 338.037 }, { "epoch": 0.07328735632183908, "grad_norm": 6.633975505828857, "learning_rate": 1.2070175438596493e-05, "loss": 0.4693654775619507, "num_input_tokens_seen": 606708, "step": 797, "train_runtime": 1794.3597, "train_tokens_per_second": 338.12 }, { "epoch": 0.07337931034482759, "grad_norm": 6.151555061340332, "learning_rate": 1.206015037593985e-05, "loss": 0.4316493570804596, "num_input_tokens_seen": 607320, "step": 798, "train_runtime": 1796.2865, "train_tokens_per_second": 338.098 }, { "epoch": 0.07347126436781609, "grad_norm": 6.873909950256348, "learning_rate": 1.205012531328321e-05, "loss": 0.3840366005897522, "num_input_tokens_seen": 607868, "step": 799, "train_runtime": 1798.2086, "train_tokens_per_second": 338.041 }, { "epoch": 0.0735632183908046, "grad_norm": 6.15745735168457, "learning_rate": 1.2040100250626568e-05, "loss": 0.43657514452934265, "num_input_tokens_seen": 608576, "step": 800, "train_runtime": 1800.1532, "train_tokens_per_second": 338.069 }, { "epoch": 0.0735632183908046, "eval_loss": 1.8885889053344727, "eval_runtime": 27.7822, "eval_samples_per_second": 35.994, "eval_steps_per_second": 8.999, "num_input_tokens_seen": 608576, "step": 800 }, { "epoch": 0.0736551724137931, "grad_norm": 6.745829105377197, "learning_rate": 1.2030075187969925e-05, "loss": 0.5598949193954468, "num_input_tokens_seen": 609524, "step": 801, "train_runtime": 1829.9183, "train_tokens_per_second": 333.088 }, { "epoch": 0.07374712643678161, "grad_norm": 6.7891435623168945, "learning_rate": 1.2020050125313285e-05, "loss": 0.4976637363433838, "num_input_tokens_seen": 610128, "step": 802, "train_runtime": 1831.8397, "train_tokens_per_second": 333.068 }, { "epoch": 0.07383908045977011, "grad_norm": 6.635828971862793, "learning_rate": 1.2010025062656644e-05, "loss": 0.42081525921821594, "num_input_tokens_seen": 610828, "step": 803, "train_runtime": 1833.7565, "train_tokens_per_second": 333.102 }, { "epoch": 0.07393103448275862, "grad_norm": 8.774009704589844, "learning_rate": 1.2e-05, "loss": 0.5076240301132202, "num_input_tokens_seen": 611836, "step": 804, "train_runtime": 1835.7381, "train_tokens_per_second": 333.292 }, { "epoch": 0.07402298850574712, "grad_norm": 6.756108283996582, "learning_rate": 1.1989974937343359e-05, "loss": 0.4481182098388672, "num_input_tokens_seen": 612480, "step": 805, "train_runtime": 1837.6441, "train_tokens_per_second": 333.296 }, { "epoch": 0.07411494252873563, "grad_norm": 8.837931632995605, "learning_rate": 1.1979949874686719e-05, "loss": 0.5549317598342896, "num_input_tokens_seen": 613136, "step": 806, "train_runtime": 1839.5563, "train_tokens_per_second": 333.306 }, { "epoch": 0.07420689655172413, "grad_norm": 8.184959411621094, "learning_rate": 1.1969924812030076e-05, "loss": 0.5435487031936646, "num_input_tokens_seen": 613828, "step": 807, "train_runtime": 1841.4644, "train_tokens_per_second": 333.337 }, { "epoch": 0.07429885057471264, "grad_norm": 8.38587760925293, "learning_rate": 1.1959899749373434e-05, "loss": 0.5304284691810608, "num_input_tokens_seen": 614508, "step": 808, "train_runtime": 1843.3763, "train_tokens_per_second": 333.36 }, { "epoch": 0.07439080459770114, "grad_norm": 8.372071266174316, "learning_rate": 1.1949874686716794e-05, "loss": 0.6614456176757812, "num_input_tokens_seen": 615200, "step": 809, "train_runtime": 1845.3267, "train_tokens_per_second": 333.383 }, { "epoch": 0.07448275862068965, "grad_norm": 8.287668228149414, "learning_rate": 1.1939849624060151e-05, "loss": 0.4698237478733063, "num_input_tokens_seen": 615896, "step": 810, "train_runtime": 1847.3082, "train_tokens_per_second": 333.402 }, { "epoch": 0.07457471264367817, "grad_norm": 6.464916229248047, "learning_rate": 1.192982456140351e-05, "loss": 0.5125246644020081, "num_input_tokens_seen": 616840, "step": 811, "train_runtime": 1856.0997, "train_tokens_per_second": 332.331 }, { "epoch": 0.07466666666666667, "grad_norm": 6.795294761657715, "learning_rate": 1.1919799498746868e-05, "loss": 0.5421081185340881, "num_input_tokens_seen": 617604, "step": 812, "train_runtime": 1858.0393, "train_tokens_per_second": 332.396 }, { "epoch": 0.07475862068965518, "grad_norm": 7.088548183441162, "learning_rate": 1.1909774436090227e-05, "loss": 0.467110276222229, "num_input_tokens_seen": 618220, "step": 813, "train_runtime": 1860.1864, "train_tokens_per_second": 332.343 }, { "epoch": 0.07485057471264368, "grad_norm": 7.344161510467529, "learning_rate": 1.1899749373433585e-05, "loss": 0.4739065170288086, "num_input_tokens_seen": 618972, "step": 814, "train_runtime": 1862.1494, "train_tokens_per_second": 332.397 }, { "epoch": 0.07494252873563219, "grad_norm": 7.0441484451293945, "learning_rate": 1.1889724310776942e-05, "loss": 0.45308488607406616, "num_input_tokens_seen": 619636, "step": 815, "train_runtime": 1864.0787, "train_tokens_per_second": 332.409 }, { "epoch": 0.0750344827586207, "grad_norm": 6.296428203582764, "learning_rate": 1.1879699248120302e-05, "loss": 0.42479604482650757, "num_input_tokens_seen": 620176, "step": 816, "train_runtime": 1865.9977, "train_tokens_per_second": 332.356 }, { "epoch": 0.0751264367816092, "grad_norm": 6.567066669464111, "learning_rate": 1.186967418546366e-05, "loss": 0.5601491332054138, "num_input_tokens_seen": 620900, "step": 817, "train_runtime": 1867.9469, "train_tokens_per_second": 332.397 }, { "epoch": 0.0752183908045977, "grad_norm": 6.935360908508301, "learning_rate": 1.1859649122807017e-05, "loss": 0.5025911927223206, "num_input_tokens_seen": 621528, "step": 818, "train_runtime": 1869.8617, "train_tokens_per_second": 332.392 }, { "epoch": 0.07531034482758621, "grad_norm": 6.330498218536377, "learning_rate": 1.1849624060150378e-05, "loss": 0.4385153651237488, "num_input_tokens_seen": 622152, "step": 819, "train_runtime": 1871.7717, "train_tokens_per_second": 332.387 }, { "epoch": 0.07540229885057471, "grad_norm": 6.7535552978515625, "learning_rate": 1.1839598997493736e-05, "loss": 0.4697404205799103, "num_input_tokens_seen": 622868, "step": 820, "train_runtime": 1873.7108, "train_tokens_per_second": 332.425 }, { "epoch": 0.07549425287356322, "grad_norm": 8.974464416503906, "learning_rate": 1.1829573934837093e-05, "loss": 0.445892333984375, "num_input_tokens_seen": 623364, "step": 821, "train_runtime": 1875.6189, "train_tokens_per_second": 332.351 }, { "epoch": 0.07558620689655172, "grad_norm": 5.514608860015869, "learning_rate": 1.1819548872180453e-05, "loss": 0.46127551794052124, "num_input_tokens_seen": 623996, "step": 822, "train_runtime": 1877.518, "train_tokens_per_second": 332.352 }, { "epoch": 0.07567816091954023, "grad_norm": 6.168216228485107, "learning_rate": 1.180952380952381e-05, "loss": 0.46345341205596924, "num_input_tokens_seen": 624712, "step": 823, "train_runtime": 1879.4229, "train_tokens_per_second": 332.396 }, { "epoch": 0.07577011494252874, "grad_norm": 6.788818836212158, "learning_rate": 1.1799498746867168e-05, "loss": 0.48941296339035034, "num_input_tokens_seen": 625888, "step": 824, "train_runtime": 1881.4051, "train_tokens_per_second": 332.671 }, { "epoch": 0.07586206896551724, "grad_norm": 7.571475982666016, "learning_rate": 1.1789473684210527e-05, "loss": 0.5315030813217163, "num_input_tokens_seen": 626768, "step": 825, "train_runtime": 1883.4487, "train_tokens_per_second": 332.777 }, { "epoch": 0.07595402298850575, "grad_norm": 6.428432941436768, "learning_rate": 1.1779448621553885e-05, "loss": 0.38236087560653687, "num_input_tokens_seen": 627548, "step": 826, "train_runtime": 1885.4018, "train_tokens_per_second": 332.846 }, { "epoch": 0.07604597701149425, "grad_norm": 6.466652870178223, "learning_rate": 1.1769423558897244e-05, "loss": 0.4763678312301636, "num_input_tokens_seen": 629068, "step": 827, "train_runtime": 1887.4518, "train_tokens_per_second": 333.29 }, { "epoch": 0.07613793103448276, "grad_norm": 6.652420997619629, "learning_rate": 1.1759398496240602e-05, "loss": 0.43790727853775024, "num_input_tokens_seen": 629608, "step": 828, "train_runtime": 1889.3464, "train_tokens_per_second": 333.241 }, { "epoch": 0.07622988505747126, "grad_norm": 7.144771575927734, "learning_rate": 1.174937343358396e-05, "loss": 0.5762131214141846, "num_input_tokens_seen": 630360, "step": 829, "train_runtime": 1891.2668, "train_tokens_per_second": 333.3 }, { "epoch": 0.07632183908045977, "grad_norm": 7.68195104598999, "learning_rate": 1.173934837092732e-05, "loss": 0.5741535425186157, "num_input_tokens_seen": 631076, "step": 830, "train_runtime": 1893.2182, "train_tokens_per_second": 333.335 }, { "epoch": 0.07641379310344827, "grad_norm": 7.149155139923096, "learning_rate": 1.1729323308270678e-05, "loss": 0.4585779905319214, "num_input_tokens_seen": 631732, "step": 831, "train_runtime": 1895.1613, "train_tokens_per_second": 333.339 }, { "epoch": 0.07650574712643678, "grad_norm": 7.119060516357422, "learning_rate": 1.1719298245614036e-05, "loss": 0.5880687236785889, "num_input_tokens_seen": 632812, "step": 832, "train_runtime": 1897.1405, "train_tokens_per_second": 333.561 }, { "epoch": 0.07659770114942528, "grad_norm": 7.2561750411987305, "learning_rate": 1.1709273182957395e-05, "loss": 0.5442973971366882, "num_input_tokens_seen": 633628, "step": 833, "train_runtime": 1899.1184, "train_tokens_per_second": 333.643 }, { "epoch": 0.07668965517241379, "grad_norm": 6.054276943206787, "learning_rate": 1.1699248120300753e-05, "loss": 0.4302482604980469, "num_input_tokens_seen": 634352, "step": 834, "train_runtime": 1901.0686, "train_tokens_per_second": 333.682 }, { "epoch": 0.07678160919540229, "grad_norm": 6.72073221206665, "learning_rate": 1.168922305764411e-05, "loss": 0.5162347555160522, "num_input_tokens_seen": 635000, "step": 835, "train_runtime": 1902.987, "train_tokens_per_second": 333.686 }, { "epoch": 0.07687356321839081, "grad_norm": 6.960562229156494, "learning_rate": 1.167919799498747e-05, "loss": 0.420468807220459, "num_input_tokens_seen": 635644, "step": 836, "train_runtime": 1904.9042, "train_tokens_per_second": 333.688 }, { "epoch": 0.07696551724137932, "grad_norm": 6.8537750244140625, "learning_rate": 1.1669172932330827e-05, "loss": 0.46297162771224976, "num_input_tokens_seen": 636256, "step": 837, "train_runtime": 1906.8568, "train_tokens_per_second": 333.667 }, { "epoch": 0.07705747126436782, "grad_norm": 6.908999919891357, "learning_rate": 1.1659147869674185e-05, "loss": 0.4330160617828369, "num_input_tokens_seen": 636920, "step": 838, "train_runtime": 1908.801, "train_tokens_per_second": 333.675 }, { "epoch": 0.07714942528735633, "grad_norm": 7.5881147384643555, "learning_rate": 1.1649122807017546e-05, "loss": 0.4976758062839508, "num_input_tokens_seen": 637816, "step": 839, "train_runtime": 1910.7814, "train_tokens_per_second": 333.799 }, { "epoch": 0.07724137931034483, "grad_norm": 7.4209747314453125, "learning_rate": 1.1639097744360902e-05, "loss": 0.44853490591049194, "num_input_tokens_seen": 638508, "step": 840, "train_runtime": 1912.7069, "train_tokens_per_second": 333.824 }, { "epoch": 0.07733333333333334, "grad_norm": 8.012955665588379, "learning_rate": 1.1629072681704261e-05, "loss": 0.5154711604118347, "num_input_tokens_seen": 639356, "step": 841, "train_runtime": 1921.2892, "train_tokens_per_second": 332.774 }, { "epoch": 0.07742528735632184, "grad_norm": 6.575119972229004, "learning_rate": 1.1619047619047621e-05, "loss": 0.41180163621902466, "num_input_tokens_seen": 639932, "step": 842, "train_runtime": 1923.2031, "train_tokens_per_second": 332.743 }, { "epoch": 0.07751724137931035, "grad_norm": 7.115898132324219, "learning_rate": 1.1609022556390978e-05, "loss": 0.5225002765655518, "num_input_tokens_seen": 640772, "step": 843, "train_runtime": 1925.3575, "train_tokens_per_second": 332.807 }, { "epoch": 0.07760919540229885, "grad_norm": 8.289604187011719, "learning_rate": 1.1598997493734336e-05, "loss": 0.5227071046829224, "num_input_tokens_seen": 641400, "step": 844, "train_runtime": 1927.2611, "train_tokens_per_second": 332.804 }, { "epoch": 0.07770114942528736, "grad_norm": 8.993541717529297, "learning_rate": 1.1588972431077695e-05, "loss": 0.5554720163345337, "num_input_tokens_seen": 642492, "step": 845, "train_runtime": 1929.2504, "train_tokens_per_second": 333.027 }, { "epoch": 0.07779310344827586, "grad_norm": 10.20373249053955, "learning_rate": 1.1578947368421053e-05, "loss": 0.5579010844230652, "num_input_tokens_seen": 643508, "step": 846, "train_runtime": 1931.2594, "train_tokens_per_second": 333.206 }, { "epoch": 0.07788505747126437, "grad_norm": 7.8156328201293945, "learning_rate": 1.1568922305764412e-05, "loss": 0.5619121789932251, "num_input_tokens_seen": 644208, "step": 847, "train_runtime": 1933.2068, "train_tokens_per_second": 333.233 }, { "epoch": 0.07797701149425287, "grad_norm": 7.236008167266846, "learning_rate": 1.1558897243107769e-05, "loss": 0.5577964186668396, "num_input_tokens_seen": 644920, "step": 848, "train_runtime": 1935.1306, "train_tokens_per_second": 333.269 }, { "epoch": 0.07806896551724138, "grad_norm": 6.673439025878906, "learning_rate": 1.1548872180451129e-05, "loss": 0.39545294642448425, "num_input_tokens_seen": 645452, "step": 849, "train_runtime": 1937.0371, "train_tokens_per_second": 333.216 }, { "epoch": 0.07816091954022988, "grad_norm": 8.605973243713379, "learning_rate": 1.1538847117794487e-05, "loss": 0.4736593961715698, "num_input_tokens_seen": 646036, "step": 850, "train_runtime": 1938.9508, "train_tokens_per_second": 333.188 }, { "epoch": 0.07825287356321839, "grad_norm": 6.712059020996094, "learning_rate": 1.1528822055137844e-05, "loss": 0.4098498821258545, "num_input_tokens_seen": 646576, "step": 851, "train_runtime": 1940.8521, "train_tokens_per_second": 333.14 }, { "epoch": 0.0783448275862069, "grad_norm": 6.2568206787109375, "learning_rate": 1.1518796992481204e-05, "loss": 0.3715309500694275, "num_input_tokens_seen": 647120, "step": 852, "train_runtime": 1942.7527, "train_tokens_per_second": 333.094 }, { "epoch": 0.0784367816091954, "grad_norm": 7.1600565910339355, "learning_rate": 1.1508771929824563e-05, "loss": 0.4333030581474304, "num_input_tokens_seen": 647904, "step": 853, "train_runtime": 1944.6604, "train_tokens_per_second": 333.171 }, { "epoch": 0.0785287356321839, "grad_norm": 6.429007053375244, "learning_rate": 1.149874686716792e-05, "loss": 0.3695297837257385, "num_input_tokens_seen": 648512, "step": 854, "train_runtime": 1946.5679, "train_tokens_per_second": 333.157 }, { "epoch": 0.07862068965517241, "grad_norm": 6.61116361618042, "learning_rate": 1.1488721804511278e-05, "loss": 0.5142643451690674, "num_input_tokens_seen": 649256, "step": 855, "train_runtime": 1948.4773, "train_tokens_per_second": 333.212 }, { "epoch": 0.07871264367816092, "grad_norm": 5.623296737670898, "learning_rate": 1.1478696741854638e-05, "loss": 0.38079267740249634, "num_input_tokens_seen": 649904, "step": 856, "train_runtime": 1950.3949, "train_tokens_per_second": 333.217 }, { "epoch": 0.07880459770114942, "grad_norm": 7.264566421508789, "learning_rate": 1.1468671679197995e-05, "loss": 0.5372199416160583, "num_input_tokens_seen": 650600, "step": 857, "train_runtime": 1952.2987, "train_tokens_per_second": 333.248 }, { "epoch": 0.07889655172413793, "grad_norm": 7.014410018920898, "learning_rate": 1.1458646616541354e-05, "loss": 0.5414127707481384, "num_input_tokens_seen": 651508, "step": 858, "train_runtime": 1954.2731, "train_tokens_per_second": 333.376 }, { "epoch": 0.07898850574712643, "grad_norm": 7.4664306640625, "learning_rate": 1.1448621553884714e-05, "loss": 0.5058953762054443, "num_input_tokens_seen": 652496, "step": 859, "train_runtime": 1956.2115, "train_tokens_per_second": 333.551 }, { "epoch": 0.07908045977011494, "grad_norm": 6.7541117668151855, "learning_rate": 1.143859649122807e-05, "loss": 0.39631015062332153, "num_input_tokens_seen": 653028, "step": 860, "train_runtime": 1958.105, "train_tokens_per_second": 333.5 }, { "epoch": 0.07917241379310345, "grad_norm": 7.931762218475342, "learning_rate": 1.1428571428571429e-05, "loss": 0.5153555274009705, "num_input_tokens_seen": 653676, "step": 861, "train_runtime": 1960.0172, "train_tokens_per_second": 333.505 }, { "epoch": 0.07926436781609196, "grad_norm": 6.375082015991211, "learning_rate": 1.141854636591479e-05, "loss": 0.4492836594581604, "num_input_tokens_seen": 654324, "step": 862, "train_runtime": 1961.9875, "train_tokens_per_second": 333.501 }, { "epoch": 0.07935632183908047, "grad_norm": 7.007679462432861, "learning_rate": 1.1408521303258146e-05, "loss": 0.45718562602996826, "num_input_tokens_seen": 655020, "step": 863, "train_runtime": 1963.8989, "train_tokens_per_second": 333.53 }, { "epoch": 0.07944827586206897, "grad_norm": 6.726501941680908, "learning_rate": 1.1398496240601504e-05, "loss": 0.47400668263435364, "num_input_tokens_seen": 655608, "step": 864, "train_runtime": 1965.8383, "train_tokens_per_second": 333.5 }, { "epoch": 0.07954022988505748, "grad_norm": 6.898266792297363, "learning_rate": 1.1388471177944861e-05, "loss": 0.47314706444740295, "num_input_tokens_seen": 656136, "step": 865, "train_runtime": 1967.7478, "train_tokens_per_second": 333.445 }, { "epoch": 0.07963218390804598, "grad_norm": 6.916375637054443, "learning_rate": 1.1378446115288221e-05, "loss": 0.40405744314193726, "num_input_tokens_seen": 656808, "step": 866, "train_runtime": 1969.6776, "train_tokens_per_second": 333.46 }, { "epoch": 0.07972413793103449, "grad_norm": 6.643969535827637, "learning_rate": 1.136842105263158e-05, "loss": 0.43459606170654297, "num_input_tokens_seen": 657364, "step": 867, "train_runtime": 1971.6123, "train_tokens_per_second": 333.414 }, { "epoch": 0.07981609195402299, "grad_norm": 7.246833801269531, "learning_rate": 1.1358395989974937e-05, "loss": 0.5171590447425842, "num_input_tokens_seen": 657992, "step": 868, "train_runtime": 1973.5583, "train_tokens_per_second": 333.404 }, { "epoch": 0.0799080459770115, "grad_norm": 6.035616874694824, "learning_rate": 1.1348370927318297e-05, "loss": 0.4002436399459839, "num_input_tokens_seen": 658644, "step": 869, "train_runtime": 1975.473, "train_tokens_per_second": 333.411 }, { "epoch": 0.08, "grad_norm": 6.385766983032227, "learning_rate": 1.1338345864661655e-05, "loss": 0.49872082471847534, "num_input_tokens_seen": 659340, "step": 870, "train_runtime": 1977.4045, "train_tokens_per_second": 333.437 }, { "epoch": 0.0800919540229885, "grad_norm": 6.394904613494873, "learning_rate": 1.1328320802005012e-05, "loss": 0.49301695823669434, "num_input_tokens_seen": 660572, "step": 871, "train_runtime": 1985.9584, "train_tokens_per_second": 332.621 }, { "epoch": 0.08018390804597701, "grad_norm": 6.4015092849731445, "learning_rate": 1.1318295739348372e-05, "loss": 0.46217477321624756, "num_input_tokens_seen": 661224, "step": 872, "train_runtime": 1987.8841, "train_tokens_per_second": 332.627 }, { "epoch": 0.08027586206896552, "grad_norm": 6.900290489196777, "learning_rate": 1.1308270676691731e-05, "loss": 0.5131678581237793, "num_input_tokens_seen": 661996, "step": 873, "train_runtime": 1989.8417, "train_tokens_per_second": 332.688 }, { "epoch": 0.08036781609195402, "grad_norm": 6.40717077255249, "learning_rate": 1.1298245614035088e-05, "loss": 0.47580698132514954, "num_input_tokens_seen": 662536, "step": 874, "train_runtime": 1991.7705, "train_tokens_per_second": 332.637 }, { "epoch": 0.08045977011494253, "grad_norm": 6.060063362121582, "learning_rate": 1.1288220551378446e-05, "loss": 0.37694984674453735, "num_input_tokens_seen": 663124, "step": 875, "train_runtime": 1993.6831, "train_tokens_per_second": 332.613 }, { "epoch": 0.08055172413793103, "grad_norm": 6.391973495483398, "learning_rate": 1.1278195488721806e-05, "loss": 0.4877256453037262, "num_input_tokens_seen": 663828, "step": 876, "train_runtime": 1995.6021, "train_tokens_per_second": 332.645 }, { "epoch": 0.08064367816091954, "grad_norm": 7.020805358886719, "learning_rate": 1.1268170426065163e-05, "loss": 0.4744494557380676, "num_input_tokens_seen": 664832, "step": 877, "train_runtime": 1997.5559, "train_tokens_per_second": 332.823 }, { "epoch": 0.08073563218390804, "grad_norm": 6.907968044281006, "learning_rate": 1.1258145363408522e-05, "loss": 0.44763144850730896, "num_input_tokens_seen": 665408, "step": 878, "train_runtime": 1999.4846, "train_tokens_per_second": 332.79 }, { "epoch": 0.08082758620689655, "grad_norm": 5.961269855499268, "learning_rate": 1.1248120300751882e-05, "loss": 0.38856619596481323, "num_input_tokens_seen": 665984, "step": 879, "train_runtime": 2001.4023, "train_tokens_per_second": 332.759 }, { "epoch": 0.08091954022988505, "grad_norm": 6.160533428192139, "learning_rate": 1.1238095238095239e-05, "loss": 0.5681909918785095, "num_input_tokens_seen": 666908, "step": 880, "train_runtime": 2003.3519, "train_tokens_per_second": 332.896 }, { "epoch": 0.08101149425287356, "grad_norm": 6.835758686065674, "learning_rate": 1.1228070175438597e-05, "loss": 0.41134172677993774, "num_input_tokens_seen": 667668, "step": 881, "train_runtime": 2005.289, "train_tokens_per_second": 332.954 }, { "epoch": 0.08110344827586206, "grad_norm": 6.545367240905762, "learning_rate": 1.1218045112781957e-05, "loss": 0.3771873116493225, "num_input_tokens_seen": 668372, "step": 882, "train_runtime": 2007.2165, "train_tokens_per_second": 332.985 }, { "epoch": 0.08119540229885057, "grad_norm": 6.41802453994751, "learning_rate": 1.1208020050125314e-05, "loss": 0.44758257269859314, "num_input_tokens_seen": 669256, "step": 883, "train_runtime": 2009.1714, "train_tokens_per_second": 333.101 }, { "epoch": 0.08128735632183907, "grad_norm": 6.513979434967041, "learning_rate": 1.1197994987468673e-05, "loss": 0.44916343688964844, "num_input_tokens_seen": 669952, "step": 884, "train_runtime": 2011.1194, "train_tokens_per_second": 333.124 }, { "epoch": 0.08137931034482758, "grad_norm": 6.685109615325928, "learning_rate": 1.118796992481203e-05, "loss": 0.49495604634284973, "num_input_tokens_seen": 670624, "step": 885, "train_runtime": 2013.0315, "train_tokens_per_second": 333.141 }, { "epoch": 0.0814712643678161, "grad_norm": 6.367468357086182, "learning_rate": 1.117794486215539e-05, "loss": 0.4811069965362549, "num_input_tokens_seen": 671316, "step": 886, "train_runtime": 2014.9433, "train_tokens_per_second": 333.169 }, { "epoch": 0.0815632183908046, "grad_norm": 6.819706916809082, "learning_rate": 1.1167919799498748e-05, "loss": 0.42282989621162415, "num_input_tokens_seen": 672064, "step": 887, "train_runtime": 2016.8867, "train_tokens_per_second": 333.219 }, { "epoch": 0.08165517241379311, "grad_norm": 5.85295295715332, "learning_rate": 1.1157894736842105e-05, "loss": 0.3618812561035156, "num_input_tokens_seen": 672880, "step": 888, "train_runtime": 2018.8282, "train_tokens_per_second": 333.302 }, { "epoch": 0.08174712643678161, "grad_norm": 6.7765913009643555, "learning_rate": 1.1147869674185465e-05, "loss": 0.46744728088378906, "num_input_tokens_seen": 673440, "step": 889, "train_runtime": 2020.7379, "train_tokens_per_second": 333.264 }, { "epoch": 0.08183908045977012, "grad_norm": 7.506669998168945, "learning_rate": 1.1137844611528823e-05, "loss": 0.47970443964004517, "num_input_tokens_seen": 674164, "step": 890, "train_runtime": 2022.6668, "train_tokens_per_second": 333.305 }, { "epoch": 0.08193103448275862, "grad_norm": 6.59580659866333, "learning_rate": 1.112781954887218e-05, "loss": 0.42027968168258667, "num_input_tokens_seen": 674772, "step": 891, "train_runtime": 2024.5891, "train_tokens_per_second": 333.288 }, { "epoch": 0.08202298850574713, "grad_norm": 7.922469139099121, "learning_rate": 1.111779448621554e-05, "loss": 0.5631629228591919, "num_input_tokens_seen": 675492, "step": 892, "train_runtime": 2026.5207, "train_tokens_per_second": 333.326 }, { "epoch": 0.08211494252873563, "grad_norm": 7.59067440032959, "learning_rate": 1.1107769423558899e-05, "loss": 0.5644431710243225, "num_input_tokens_seen": 676152, "step": 893, "train_runtime": 2028.4569, "train_tokens_per_second": 333.333 }, { "epoch": 0.08220689655172414, "grad_norm": 6.923701763153076, "learning_rate": 1.1097744360902256e-05, "loss": 0.46577513217926025, "num_input_tokens_seen": 676924, "step": 894, "train_runtime": 2030.3974, "train_tokens_per_second": 333.395 }, { "epoch": 0.08229885057471265, "grad_norm": 6.746239185333252, "learning_rate": 1.1087719298245614e-05, "loss": 0.6171218156814575, "num_input_tokens_seen": 677864, "step": 895, "train_runtime": 2032.4181, "train_tokens_per_second": 333.526 }, { "epoch": 0.08239080459770115, "grad_norm": 6.714953422546387, "learning_rate": 1.1077694235588974e-05, "loss": 0.4712778329849243, "num_input_tokens_seen": 678744, "step": 896, "train_runtime": 2034.359, "train_tokens_per_second": 333.64 }, { "epoch": 0.08248275862068966, "grad_norm": 7.062094211578369, "learning_rate": 1.1067669172932331e-05, "loss": 0.5276885032653809, "num_input_tokens_seen": 679472, "step": 897, "train_runtime": 2036.3004, "train_tokens_per_second": 333.68 }, { "epoch": 0.08257471264367816, "grad_norm": 6.546316623687744, "learning_rate": 1.105764411027569e-05, "loss": 0.40527454018592834, "num_input_tokens_seen": 680064, "step": 898, "train_runtime": 2038.3067, "train_tokens_per_second": 333.642 }, { "epoch": 0.08266666666666667, "grad_norm": 6.58282470703125, "learning_rate": 1.104761904761905e-05, "loss": 0.41458383202552795, "num_input_tokens_seen": 680804, "step": 899, "train_runtime": 2040.2651, "train_tokens_per_second": 333.684 }, { "epoch": 0.08275862068965517, "grad_norm": 6.260782718658447, "learning_rate": 1.1037593984962407e-05, "loss": 0.5471869111061096, "num_input_tokens_seen": 681448, "step": 900, "train_runtime": 2042.1806, "train_tokens_per_second": 333.686 }, { "epoch": 0.08285057471264368, "grad_norm": 7.149852752685547, "learning_rate": 1.1027568922305765e-05, "loss": 0.4660685658454895, "num_input_tokens_seen": 682076, "step": 901, "train_runtime": 2050.6772, "train_tokens_per_second": 332.61 }, { "epoch": 0.08294252873563218, "grad_norm": 6.504394054412842, "learning_rate": 1.1017543859649125e-05, "loss": 0.5031466484069824, "num_input_tokens_seen": 682968, "step": 902, "train_runtime": 2052.8674, "train_tokens_per_second": 332.69 }, { "epoch": 0.08303448275862069, "grad_norm": 6.417966842651367, "learning_rate": 1.1007518796992482e-05, "loss": 0.3842109441757202, "num_input_tokens_seen": 683544, "step": 903, "train_runtime": 2054.7968, "train_tokens_per_second": 332.658 }, { "epoch": 0.08312643678160919, "grad_norm": 5.998277187347412, "learning_rate": 1.099749373433584e-05, "loss": 0.5193146467208862, "num_input_tokens_seen": 684420, "step": 904, "train_runtime": 2056.7639, "train_tokens_per_second": 332.765 }, { "epoch": 0.0832183908045977, "grad_norm": 6.862845420837402, "learning_rate": 1.0987468671679197e-05, "loss": 0.4847695827484131, "num_input_tokens_seen": 685048, "step": 905, "train_runtime": 2058.7083, "train_tokens_per_second": 332.756 }, { "epoch": 0.0833103448275862, "grad_norm": 6.598841667175293, "learning_rate": 1.0977443609022558e-05, "loss": 0.5620836019515991, "num_input_tokens_seen": 685896, "step": 906, "train_runtime": 2060.6561, "train_tokens_per_second": 332.853 }, { "epoch": 0.08340229885057471, "grad_norm": 5.996801376342773, "learning_rate": 1.0967418546365916e-05, "loss": 0.4808143973350525, "num_input_tokens_seen": 686628, "step": 907, "train_runtime": 2062.5797, "train_tokens_per_second": 332.898 }, { "epoch": 0.08349425287356321, "grad_norm": 6.211836338043213, "learning_rate": 1.0957393483709273e-05, "loss": 0.49074992537498474, "num_input_tokens_seen": 687568, "step": 908, "train_runtime": 2064.5337, "train_tokens_per_second": 333.038 }, { "epoch": 0.08358620689655172, "grad_norm": 7.279179573059082, "learning_rate": 1.0947368421052633e-05, "loss": 0.5068899989128113, "num_input_tokens_seen": 688208, "step": 909, "train_runtime": 2066.4414, "train_tokens_per_second": 333.04 }, { "epoch": 0.08367816091954022, "grad_norm": 10.764835357666016, "learning_rate": 1.0937343358395992e-05, "loss": 0.3864727318286896, "num_input_tokens_seen": 688928, "step": 910, "train_runtime": 2068.3762, "train_tokens_per_second": 333.077 }, { "epoch": 0.08377011494252874, "grad_norm": 5.784451484680176, "learning_rate": 1.0927318295739348e-05, "loss": 0.38656336069107056, "num_input_tokens_seen": 689648, "step": 911, "train_runtime": 2070.3169, "train_tokens_per_second": 333.112 }, { "epoch": 0.08386206896551725, "grad_norm": 6.182672023773193, "learning_rate": 1.0917293233082709e-05, "loss": 0.42912742495536804, "num_input_tokens_seen": 690216, "step": 912, "train_runtime": 2072.2239, "train_tokens_per_second": 333.08 }, { "epoch": 0.08395402298850575, "grad_norm": 7.196264266967773, "learning_rate": 1.0907268170426067e-05, "loss": 0.5714797973632812, "num_input_tokens_seen": 691316, "step": 913, "train_runtime": 2074.1931, "train_tokens_per_second": 333.294 }, { "epoch": 0.08404597701149426, "grad_norm": 5.99977970123291, "learning_rate": 1.0897243107769424e-05, "loss": 0.4422471523284912, "num_input_tokens_seen": 692048, "step": 914, "train_runtime": 2076.1055, "train_tokens_per_second": 333.34 }, { "epoch": 0.08413793103448276, "grad_norm": 7.258148193359375, "learning_rate": 1.0887218045112782e-05, "loss": 0.508287250995636, "num_input_tokens_seen": 692848, "step": 915, "train_runtime": 2078.0763, "train_tokens_per_second": 333.408 }, { "epoch": 0.08422988505747127, "grad_norm": 7.077605247497559, "learning_rate": 1.0877192982456142e-05, "loss": 0.5383909940719604, "num_input_tokens_seen": 693920, "step": 916, "train_runtime": 2080.1235, "train_tokens_per_second": 333.596 }, { "epoch": 0.08432183908045977, "grad_norm": 7.42640495300293, "learning_rate": 1.08671679197995e-05, "loss": 0.5203660726547241, "num_input_tokens_seen": 694544, "step": 917, "train_runtime": 2082.0655, "train_tokens_per_second": 333.584 }, { "epoch": 0.08441379310344828, "grad_norm": 7.465845108032227, "learning_rate": 1.0857142857142858e-05, "loss": 0.48671990633010864, "num_input_tokens_seen": 695228, "step": 918, "train_runtime": 2084.0367, "train_tokens_per_second": 333.597 }, { "epoch": 0.08450574712643678, "grad_norm": 6.276941776275635, "learning_rate": 1.0847117794486218e-05, "loss": 0.39228111505508423, "num_input_tokens_seen": 695916, "step": 919, "train_runtime": 2085.9518, "train_tokens_per_second": 333.62 }, { "epoch": 0.08459770114942529, "grad_norm": 8.05283260345459, "learning_rate": 1.0837092731829575e-05, "loss": 0.49192559719085693, "num_input_tokens_seen": 696468, "step": 920, "train_runtime": 2087.88, "train_tokens_per_second": 333.577 }, { "epoch": 0.0846896551724138, "grad_norm": 7.042476177215576, "learning_rate": 1.0827067669172933e-05, "loss": 0.5734916925430298, "num_input_tokens_seen": 697356, "step": 921, "train_runtime": 2089.8969, "train_tokens_per_second": 333.68 }, { "epoch": 0.0847816091954023, "grad_norm": 6.639822959899902, "learning_rate": 1.0817042606516293e-05, "loss": 0.47092488408088684, "num_input_tokens_seen": 698036, "step": 922, "train_runtime": 2091.8192, "train_tokens_per_second": 333.698 }, { "epoch": 0.0848735632183908, "grad_norm": 7.225997447967529, "learning_rate": 1.080701754385965e-05, "loss": 0.4256677031517029, "num_input_tokens_seen": 698776, "step": 923, "train_runtime": 2093.9929, "train_tokens_per_second": 333.705 }, { "epoch": 0.08496551724137931, "grad_norm": 6.923762798309326, "learning_rate": 1.0796992481203009e-05, "loss": 0.5419110655784607, "num_input_tokens_seen": 699452, "step": 924, "train_runtime": 2096.0254, "train_tokens_per_second": 333.704 }, { "epoch": 0.08505747126436781, "grad_norm": 6.349163055419922, "learning_rate": 1.0786967418546365e-05, "loss": 0.5122674703598022, "num_input_tokens_seen": 700132, "step": 925, "train_runtime": 2097.9464, "train_tokens_per_second": 333.723 }, { "epoch": 0.08514942528735632, "grad_norm": 7.829336166381836, "learning_rate": 1.0776942355889726e-05, "loss": 0.522594690322876, "num_input_tokens_seen": 700764, "step": 926, "train_runtime": 2099.8556, "train_tokens_per_second": 333.72 }, { "epoch": 0.08524137931034483, "grad_norm": 7.369714260101318, "learning_rate": 1.0766917293233084e-05, "loss": 0.45676571130752563, "num_input_tokens_seen": 701408, "step": 927, "train_runtime": 2101.8478, "train_tokens_per_second": 333.71 }, { "epoch": 0.08533333333333333, "grad_norm": 6.920671463012695, "learning_rate": 1.0756892230576441e-05, "loss": 0.413580060005188, "num_input_tokens_seen": 702060, "step": 928, "train_runtime": 2103.7675, "train_tokens_per_second": 333.716 }, { "epoch": 0.08542528735632184, "grad_norm": 10.892513275146484, "learning_rate": 1.0746867167919801e-05, "loss": 0.5898758769035339, "num_input_tokens_seen": 702684, "step": 929, "train_runtime": 2105.6902, "train_tokens_per_second": 333.707 }, { "epoch": 0.08551724137931034, "grad_norm": 6.803252696990967, "learning_rate": 1.073684210526316e-05, "loss": 0.4193257689476013, "num_input_tokens_seen": 703260, "step": 930, "train_runtime": 2107.6118, "train_tokens_per_second": 333.676 }, { "epoch": 0.08560919540229885, "grad_norm": 6.986143112182617, "learning_rate": 1.0726817042606516e-05, "loss": 0.5487346649169922, "num_input_tokens_seen": 704160, "step": 931, "train_runtime": 2116.4739, "train_tokens_per_second": 332.704 }, { "epoch": 0.08570114942528735, "grad_norm": 7.126340866088867, "learning_rate": 1.0716791979949877e-05, "loss": 0.36908119916915894, "num_input_tokens_seen": 704704, "step": 932, "train_runtime": 2118.3939, "train_tokens_per_second": 332.66 }, { "epoch": 0.08579310344827586, "grad_norm": 6.432652473449707, "learning_rate": 1.0706766917293235e-05, "loss": 0.48489218950271606, "num_input_tokens_seen": 705972, "step": 933, "train_runtime": 2120.4204, "train_tokens_per_second": 332.94 }, { "epoch": 0.08588505747126436, "grad_norm": 7.483302593231201, "learning_rate": 1.0696741854636592e-05, "loss": 0.4927271902561188, "num_input_tokens_seen": 706736, "step": 934, "train_runtime": 2122.3768, "train_tokens_per_second": 332.993 }, { "epoch": 0.08597701149425287, "grad_norm": 7.03338098526001, "learning_rate": 1.068671679197995e-05, "loss": 0.5359400510787964, "num_input_tokens_seen": 707328, "step": 935, "train_runtime": 2124.2771, "train_tokens_per_second": 332.974 }, { "epoch": 0.08606896551724139, "grad_norm": 6.798832416534424, "learning_rate": 1.0676691729323309e-05, "loss": 0.456082284450531, "num_input_tokens_seen": 707852, "step": 936, "train_runtime": 2126.1803, "train_tokens_per_second": 332.922 }, { "epoch": 0.08616091954022989, "grad_norm": 6.522405624389648, "learning_rate": 1.0666666666666667e-05, "loss": 0.32978537678718567, "num_input_tokens_seen": 708380, "step": 937, "train_runtime": 2128.0939, "train_tokens_per_second": 332.871 }, { "epoch": 0.0862528735632184, "grad_norm": 5.998535633087158, "learning_rate": 1.0656641604010026e-05, "loss": 0.44136589765548706, "num_input_tokens_seen": 709296, "step": 938, "train_runtime": 2130.0448, "train_tokens_per_second": 332.996 }, { "epoch": 0.0863448275862069, "grad_norm": 7.186913013458252, "learning_rate": 1.0646616541353384e-05, "loss": 0.5467941761016846, "num_input_tokens_seen": 710024, "step": 939, "train_runtime": 2131.9635, "train_tokens_per_second": 333.038 }, { "epoch": 0.0864367816091954, "grad_norm": 7.097897529602051, "learning_rate": 1.0636591478696743e-05, "loss": 0.5385963320732117, "num_input_tokens_seen": 711136, "step": 940, "train_runtime": 2133.9513, "train_tokens_per_second": 333.248 }, { "epoch": 0.08652873563218391, "grad_norm": 7.345585346221924, "learning_rate": 1.0626566416040101e-05, "loss": 0.5527505278587341, "num_input_tokens_seen": 711860, "step": 941, "train_runtime": 2135.876, "train_tokens_per_second": 333.287 }, { "epoch": 0.08662068965517242, "grad_norm": 6.7262091636657715, "learning_rate": 1.061654135338346e-05, "loss": 0.47531142830848694, "num_input_tokens_seen": 712632, "step": 942, "train_runtime": 2137.8432, "train_tokens_per_second": 333.342 }, { "epoch": 0.08671264367816092, "grad_norm": 6.64491081237793, "learning_rate": 1.0606516290726818e-05, "loss": 0.39258521795272827, "num_input_tokens_seen": 713316, "step": 943, "train_runtime": 2139.7785, "train_tokens_per_second": 333.36 }, { "epoch": 0.08680459770114943, "grad_norm": 6.810537338256836, "learning_rate": 1.0596491228070177e-05, "loss": 0.6050618886947632, "num_input_tokens_seen": 714004, "step": 944, "train_runtime": 2141.7049, "train_tokens_per_second": 333.381 }, { "epoch": 0.08689655172413793, "grad_norm": 6.627172470092773, "learning_rate": 1.0586466165413534e-05, "loss": 0.46951693296432495, "num_input_tokens_seen": 714800, "step": 945, "train_runtime": 2143.6533, "train_tokens_per_second": 333.449 }, { "epoch": 0.08698850574712644, "grad_norm": 6.956730842590332, "learning_rate": 1.0576441102756894e-05, "loss": 0.4267975091934204, "num_input_tokens_seen": 715328, "step": 946, "train_runtime": 2145.6099, "train_tokens_per_second": 333.391 }, { "epoch": 0.08708045977011494, "grad_norm": 7.196598052978516, "learning_rate": 1.0566416040100252e-05, "loss": 0.4994352459907532, "num_input_tokens_seen": 715928, "step": 947, "train_runtime": 2147.5366, "train_tokens_per_second": 333.372 }, { "epoch": 0.08717241379310345, "grad_norm": 6.782207012176514, "learning_rate": 1.0556390977443609e-05, "loss": 0.4833005964756012, "num_input_tokens_seen": 716688, "step": 948, "train_runtime": 2149.4796, "train_tokens_per_second": 333.424 }, { "epoch": 0.08726436781609195, "grad_norm": 6.9549078941345215, "learning_rate": 1.054636591478697e-05, "loss": 0.5216882228851318, "num_input_tokens_seen": 717364, "step": 949, "train_runtime": 2151.4126, "train_tokens_per_second": 333.439 }, { "epoch": 0.08735632183908046, "grad_norm": 6.560072898864746, "learning_rate": 1.0536340852130326e-05, "loss": 0.5301787257194519, "num_input_tokens_seen": 718072, "step": 950, "train_runtime": 2153.3403, "train_tokens_per_second": 333.469 }, { "epoch": 0.08744827586206896, "grad_norm": 6.456213474273682, "learning_rate": 1.0526315789473684e-05, "loss": 0.4645478129386902, "num_input_tokens_seen": 718744, "step": 951, "train_runtime": 2155.2471, "train_tokens_per_second": 333.486 }, { "epoch": 0.08754022988505747, "grad_norm": 6.61658239364624, "learning_rate": 1.0516290726817045e-05, "loss": 0.5712957382202148, "num_input_tokens_seen": 719720, "step": 952, "train_runtime": 2157.194, "train_tokens_per_second": 333.637 }, { "epoch": 0.08763218390804597, "grad_norm": 7.224437713623047, "learning_rate": 1.0506265664160401e-05, "loss": 0.5404413938522339, "num_input_tokens_seen": 720388, "step": 953, "train_runtime": 2159.1051, "train_tokens_per_second": 333.651 }, { "epoch": 0.08772413793103448, "grad_norm": 6.876253128051758, "learning_rate": 1.049624060150376e-05, "loss": 0.4262760281562805, "num_input_tokens_seen": 721200, "step": 954, "train_runtime": 2161.1182, "train_tokens_per_second": 333.716 }, { "epoch": 0.08781609195402298, "grad_norm": 6.844622611999512, "learning_rate": 1.0486215538847118e-05, "loss": 0.40760573744773865, "num_input_tokens_seen": 722076, "step": 955, "train_runtime": 2163.0585, "train_tokens_per_second": 333.822 }, { "epoch": 0.08790804597701149, "grad_norm": 6.745266914367676, "learning_rate": 1.0476190476190477e-05, "loss": 0.49876174330711365, "num_input_tokens_seen": 722884, "step": 956, "train_runtime": 2164.9884, "train_tokens_per_second": 333.897 }, { "epoch": 0.088, "grad_norm": 7.548923969268799, "learning_rate": 1.0466165413533835e-05, "loss": 0.41772881150245667, "num_input_tokens_seen": 723728, "step": 957, "train_runtime": 2166.9611, "train_tokens_per_second": 333.983 }, { "epoch": 0.0880919540229885, "grad_norm": 6.423858642578125, "learning_rate": 1.0456140350877194e-05, "loss": 0.45678162574768066, "num_input_tokens_seen": 724616, "step": 958, "train_runtime": 2168.9082, "train_tokens_per_second": 334.093 }, { "epoch": 0.088183908045977, "grad_norm": 6.32468843460083, "learning_rate": 1.0446115288220552e-05, "loss": 0.4759761691093445, "num_input_tokens_seen": 725176, "step": 959, "train_runtime": 2170.8174, "train_tokens_per_second": 334.057 }, { "epoch": 0.08827586206896551, "grad_norm": 8.623871803283691, "learning_rate": 1.043609022556391e-05, "loss": 0.4497523307800293, "num_input_tokens_seen": 725992, "step": 960, "train_runtime": 2172.7712, "train_tokens_per_second": 334.132 }, { "epoch": 0.08836781609195403, "grad_norm": 6.408360481262207, "learning_rate": 1.0426065162907268e-05, "loss": 0.47394728660583496, "num_input_tokens_seen": 726620, "step": 961, "train_runtime": 2181.5509, "train_tokens_per_second": 333.075 }, { "epoch": 0.08845977011494253, "grad_norm": 7.175382614135742, "learning_rate": 1.0416040100250628e-05, "loss": 0.4901235103607178, "num_input_tokens_seen": 727352, "step": 962, "train_runtime": 2183.4621, "train_tokens_per_second": 333.119 }, { "epoch": 0.08855172413793104, "grad_norm": 6.749276161193848, "learning_rate": 1.0406015037593986e-05, "loss": 0.4491744041442871, "num_input_tokens_seen": 728012, "step": 963, "train_runtime": 2185.3676, "train_tokens_per_second": 333.13 }, { "epoch": 0.08864367816091955, "grad_norm": 6.454928398132324, "learning_rate": 1.0395989974937343e-05, "loss": 0.494658887386322, "num_input_tokens_seen": 729052, "step": 964, "train_runtime": 2187.3494, "train_tokens_per_second": 333.304 }, { "epoch": 0.08873563218390805, "grad_norm": 6.768080711364746, "learning_rate": 1.0385964912280702e-05, "loss": 0.4335147440433502, "num_input_tokens_seen": 730704, "step": 965, "train_runtime": 2189.3893, "train_tokens_per_second": 333.748 }, { "epoch": 0.08882758620689656, "grad_norm": 7.455011367797852, "learning_rate": 1.0375939849624062e-05, "loss": 0.5612114071846008, "num_input_tokens_seen": 731508, "step": 966, "train_runtime": 2191.3087, "train_tokens_per_second": 333.822 }, { "epoch": 0.08891954022988506, "grad_norm": 7.381419658660889, "learning_rate": 1.0365914786967419e-05, "loss": 0.5774643421173096, "num_input_tokens_seen": 732140, "step": 967, "train_runtime": 2193.2334, "train_tokens_per_second": 333.818 }, { "epoch": 0.08901149425287357, "grad_norm": 7.418336391448975, "learning_rate": 1.0355889724310777e-05, "loss": 0.4607248306274414, "num_input_tokens_seen": 732912, "step": 968, "train_runtime": 2195.1667, "train_tokens_per_second": 333.875 }, { "epoch": 0.08910344827586207, "grad_norm": 7.282698154449463, "learning_rate": 1.0345864661654137e-05, "loss": 0.5161183476448059, "num_input_tokens_seen": 733484, "step": 969, "train_runtime": 2197.0837, "train_tokens_per_second": 333.844 }, { "epoch": 0.08919540229885058, "grad_norm": 6.587283134460449, "learning_rate": 1.0335839598997494e-05, "loss": 0.4503616988658905, "num_input_tokens_seen": 734236, "step": 970, "train_runtime": 2199.1932, "train_tokens_per_second": 333.866 }, { "epoch": 0.08928735632183908, "grad_norm": 6.250298976898193, "learning_rate": 1.0325814536340853e-05, "loss": 0.5449129343032837, "num_input_tokens_seen": 735100, "step": 971, "train_runtime": 2201.1607, "train_tokens_per_second": 333.96 }, { "epoch": 0.08937931034482759, "grad_norm": 6.994154930114746, "learning_rate": 1.0315789473684213e-05, "loss": 0.4635671079158783, "num_input_tokens_seen": 735740, "step": 972, "train_runtime": 2203.0748, "train_tokens_per_second": 333.961 }, { "epoch": 0.08947126436781609, "grad_norm": 7.00700569152832, "learning_rate": 1.030576441102757e-05, "loss": 0.47756463289260864, "num_input_tokens_seen": 736600, "step": 973, "train_runtime": 2205.0136, "train_tokens_per_second": 334.057 }, { "epoch": 0.0895632183908046, "grad_norm": 6.1424126625061035, "learning_rate": 1.0295739348370928e-05, "loss": 0.457974910736084, "num_input_tokens_seen": 737128, "step": 974, "train_runtime": 2206.9115, "train_tokens_per_second": 334.009 }, { "epoch": 0.0896551724137931, "grad_norm": 6.277089595794678, "learning_rate": 1.0285714285714285e-05, "loss": 0.47886407375335693, "num_input_tokens_seen": 737712, "step": 975, "train_runtime": 2208.8354, "train_tokens_per_second": 333.982 }, { "epoch": 0.08974712643678161, "grad_norm": 7.152872085571289, "learning_rate": 1.0275689223057645e-05, "loss": 0.5071455836296082, "num_input_tokens_seen": 738496, "step": 976, "train_runtime": 2210.7804, "train_tokens_per_second": 334.043 }, { "epoch": 0.08983908045977011, "grad_norm": 6.826153755187988, "learning_rate": 1.0265664160401003e-05, "loss": 0.4909060001373291, "num_input_tokens_seen": 739424, "step": 977, "train_runtime": 2212.7298, "train_tokens_per_second": 334.168 }, { "epoch": 0.08993103448275862, "grad_norm": 7.014489650726318, "learning_rate": 1.025563909774436e-05, "loss": 0.7470390796661377, "num_input_tokens_seen": 740280, "step": 978, "train_runtime": 2214.6685, "train_tokens_per_second": 334.262 }, { "epoch": 0.09002298850574712, "grad_norm": 6.223145484924316, "learning_rate": 1.024561403508772e-05, "loss": 0.4532124102115631, "num_input_tokens_seen": 741056, "step": 979, "train_runtime": 2216.6006, "train_tokens_per_second": 334.321 }, { "epoch": 0.09011494252873563, "grad_norm": 6.236148357391357, "learning_rate": 1.0235588972431079e-05, "loss": 0.47539493441581726, "num_input_tokens_seen": 741672, "step": 980, "train_runtime": 2218.5179, "train_tokens_per_second": 334.31 }, { "epoch": 0.09020689655172413, "grad_norm": 7.284667491912842, "learning_rate": 1.0225563909774436e-05, "loss": 0.5616993308067322, "num_input_tokens_seen": 742476, "step": 981, "train_runtime": 2220.4934, "train_tokens_per_second": 334.374 }, { "epoch": 0.09029885057471264, "grad_norm": 7.2242865562438965, "learning_rate": 1.0215538847117796e-05, "loss": 0.44696980714797974, "num_input_tokens_seen": 743076, "step": 982, "train_runtime": 2222.4054, "train_tokens_per_second": 334.357 }, { "epoch": 0.09039080459770114, "grad_norm": 6.407309055328369, "learning_rate": 1.0205513784461154e-05, "loss": 0.45359712839126587, "num_input_tokens_seen": 743724, "step": 983, "train_runtime": 2224.3194, "train_tokens_per_second": 334.36 }, { "epoch": 0.09048275862068965, "grad_norm": 6.019703388214111, "learning_rate": 1.0195488721804511e-05, "loss": 0.4540659189224243, "num_input_tokens_seen": 744484, "step": 984, "train_runtime": 2226.2369, "train_tokens_per_second": 334.414 }, { "epoch": 0.09057471264367815, "grad_norm": 6.675520896911621, "learning_rate": 1.018546365914787e-05, "loss": 0.4840589761734009, "num_input_tokens_seen": 745088, "step": 985, "train_runtime": 2228.2202, "train_tokens_per_second": 334.387 }, { "epoch": 0.09066666666666667, "grad_norm": 7.436343193054199, "learning_rate": 1.017543859649123e-05, "loss": 0.544686496257782, "num_input_tokens_seen": 745768, "step": 986, "train_runtime": 2230.1297, "train_tokens_per_second": 334.406 }, { "epoch": 0.09075862068965518, "grad_norm": 6.213075160980225, "learning_rate": 1.0165413533834587e-05, "loss": 0.5067095160484314, "num_input_tokens_seen": 746480, "step": 987, "train_runtime": 2232.0565, "train_tokens_per_second": 334.436 }, { "epoch": 0.09085057471264368, "grad_norm": 6.276841640472412, "learning_rate": 1.0155388471177945e-05, "loss": 0.4725772738456726, "num_input_tokens_seen": 747052, "step": 988, "train_runtime": 2233.9724, "train_tokens_per_second": 334.405 }, { "epoch": 0.09094252873563219, "grad_norm": 6.9957685470581055, "learning_rate": 1.0145363408521305e-05, "loss": 0.46687793731689453, "num_input_tokens_seen": 747804, "step": 989, "train_runtime": 2235.8855, "train_tokens_per_second": 334.455 }, { "epoch": 0.0910344827586207, "grad_norm": 8.03308391571045, "learning_rate": 1.0135338345864662e-05, "loss": 0.6137831211090088, "num_input_tokens_seen": 748572, "step": 990, "train_runtime": 2237.7989, "train_tokens_per_second": 334.513 }, { "epoch": 0.0911264367816092, "grad_norm": 6.838526248931885, "learning_rate": 1.012531328320802e-05, "loss": 0.5152433514595032, "num_input_tokens_seen": 749308, "step": 991, "train_runtime": 2246.6315, "train_tokens_per_second": 333.525 }, { "epoch": 0.0912183908045977, "grad_norm": 6.151811599731445, "learning_rate": 1.011528822055138e-05, "loss": 0.4851880669593811, "num_input_tokens_seen": 750168, "step": 992, "train_runtime": 2248.5729, "train_tokens_per_second": 333.62 }, { "epoch": 0.09131034482758621, "grad_norm": 6.756059646606445, "learning_rate": 1.0105263157894738e-05, "loss": 0.5420541763305664, "num_input_tokens_seen": 750828, "step": 993, "train_runtime": 2250.5831, "train_tokens_per_second": 333.615 }, { "epoch": 0.09140229885057471, "grad_norm": 6.793330192565918, "learning_rate": 1.0095238095238096e-05, "loss": 0.4886292517185211, "num_input_tokens_seen": 751688, "step": 994, "train_runtime": 2252.5376, "train_tokens_per_second": 333.707 }, { "epoch": 0.09149425287356322, "grad_norm": 6.752333164215088, "learning_rate": 1.0085213032581453e-05, "loss": 0.5576735734939575, "num_input_tokens_seen": 752396, "step": 995, "train_runtime": 2254.4697, "train_tokens_per_second": 333.735 }, { "epoch": 0.09158620689655173, "grad_norm": 6.473622798919678, "learning_rate": 1.0075187969924813e-05, "loss": 0.44832098484039307, "num_input_tokens_seen": 753084, "step": 996, "train_runtime": 2256.4224, "train_tokens_per_second": 333.751 }, { "epoch": 0.09167816091954023, "grad_norm": 6.3503241539001465, "learning_rate": 1.0065162907268171e-05, "loss": 0.4546602964401245, "num_input_tokens_seen": 754052, "step": 997, "train_runtime": 2258.4717, "train_tokens_per_second": 333.877 }, { "epoch": 0.09177011494252874, "grad_norm": 7.291573524475098, "learning_rate": 1.0055137844611528e-05, "loss": 0.6066989898681641, "num_input_tokens_seen": 754880, "step": 998, "train_runtime": 2260.403, "train_tokens_per_second": 333.958 }, { "epoch": 0.09186206896551724, "grad_norm": 7.389471530914307, "learning_rate": 1.0045112781954888e-05, "loss": 0.41600704193115234, "num_input_tokens_seen": 755516, "step": 999, "train_runtime": 2262.3346, "train_tokens_per_second": 333.954 }, { "epoch": 0.09195402298850575, "grad_norm": 6.413146495819092, "learning_rate": 1.0035087719298247e-05, "loss": 0.39765024185180664, "num_input_tokens_seen": 756312, "step": 1000, "train_runtime": 2264.28, "train_tokens_per_second": 334.019 }, { "epoch": 0.09195402298850575, "eval_loss": 1.8523097038269043, "eval_runtime": 27.9112, "eval_samples_per_second": 35.828, "eval_steps_per_second": 8.957, "num_input_tokens_seen": 756312, "step": 1000 }, { "epoch": 0.09204597701149425, "grad_norm": 6.664978981018066, "learning_rate": 1.0025062656641604e-05, "loss": 0.5257925987243652, "num_input_tokens_seen": 756928, "step": 1001, "train_runtime": 2294.1764, "train_tokens_per_second": 329.935 }, { "epoch": 0.09213793103448276, "grad_norm": 7.344442844390869, "learning_rate": 1.0015037593984964e-05, "loss": 0.46458640694618225, "num_input_tokens_seen": 757640, "step": 1002, "train_runtime": 2296.1199, "train_tokens_per_second": 329.965 }, { "epoch": 0.09222988505747126, "grad_norm": 7.410263538360596, "learning_rate": 1.0005012531328322e-05, "loss": 0.5652271509170532, "num_input_tokens_seen": 758324, "step": 1003, "train_runtime": 2298.0398, "train_tokens_per_second": 329.987 }, { "epoch": 0.09232183908045977, "grad_norm": 8.379242897033691, "learning_rate": 9.99498746867168e-06, "loss": 0.5291005373001099, "num_input_tokens_seen": 758924, "step": 1004, "train_runtime": 2299.9606, "train_tokens_per_second": 329.973 }, { "epoch": 0.09241379310344827, "grad_norm": 8.128753662109375, "learning_rate": 9.984962406015038e-06, "loss": 0.6162893772125244, "num_input_tokens_seen": 759480, "step": 1005, "train_runtime": 2301.8825, "train_tokens_per_second": 329.939 }, { "epoch": 0.09250574712643678, "grad_norm": 6.83087682723999, "learning_rate": 9.974937343358396e-06, "loss": 0.4586988687515259, "num_input_tokens_seen": 760144, "step": 1006, "train_runtime": 2303.8003, "train_tokens_per_second": 329.952 }, { "epoch": 0.09259770114942528, "grad_norm": 6.153554439544678, "learning_rate": 9.964912280701755e-06, "loss": 0.4497118592262268, "num_input_tokens_seen": 760904, "step": 1007, "train_runtime": 2305.7437, "train_tokens_per_second": 330.004 }, { "epoch": 0.09268965517241379, "grad_norm": 6.233102321624756, "learning_rate": 9.954887218045113e-06, "loss": 0.4667837917804718, "num_input_tokens_seen": 761492, "step": 1008, "train_runtime": 2307.6686, "train_tokens_per_second": 329.983 }, { "epoch": 0.09278160919540229, "grad_norm": 6.957793235778809, "learning_rate": 9.944862155388472e-06, "loss": 0.4331594407558441, "num_input_tokens_seen": 762456, "step": 1009, "train_runtime": 2309.6656, "train_tokens_per_second": 330.115 }, { "epoch": 0.0928735632183908, "grad_norm": 9.187891006469727, "learning_rate": 9.93483709273183e-06, "loss": 0.5834053754806519, "num_input_tokens_seen": 763152, "step": 1010, "train_runtime": 2311.5771, "train_tokens_per_second": 330.143 }, { "epoch": 0.09296551724137932, "grad_norm": 7.78358268737793, "learning_rate": 9.924812030075189e-06, "loss": 0.46204400062561035, "num_input_tokens_seen": 763780, "step": 1011, "train_runtime": 2313.4962, "train_tokens_per_second": 330.141 }, { "epoch": 0.09305747126436782, "grad_norm": 6.727712631225586, "learning_rate": 9.914786967418547e-06, "loss": 0.3884506821632385, "num_input_tokens_seen": 764636, "step": 1012, "train_runtime": 2315.4506, "train_tokens_per_second": 330.232 }, { "epoch": 0.09314942528735633, "grad_norm": 6.322958946228027, "learning_rate": 9.904761904761906e-06, "loss": 0.42635682225227356, "num_input_tokens_seen": 765280, "step": 1013, "train_runtime": 2317.3708, "train_tokens_per_second": 330.236 }, { "epoch": 0.09324137931034483, "grad_norm": 6.7299909591674805, "learning_rate": 9.894736842105264e-06, "loss": 0.6027582883834839, "num_input_tokens_seen": 766368, "step": 1014, "train_runtime": 2319.357, "train_tokens_per_second": 330.423 }, { "epoch": 0.09333333333333334, "grad_norm": 6.988217830657959, "learning_rate": 9.884711779448623e-06, "loss": 0.4799932837486267, "num_input_tokens_seen": 767000, "step": 1015, "train_runtime": 2321.2654, "train_tokens_per_second": 330.423 }, { "epoch": 0.09342528735632184, "grad_norm": 6.878663539886475, "learning_rate": 9.87468671679198e-06, "loss": 0.5265244245529175, "num_input_tokens_seen": 767704, "step": 1016, "train_runtime": 2323.1791, "train_tokens_per_second": 330.454 }, { "epoch": 0.09351724137931035, "grad_norm": 6.759012222290039, "learning_rate": 9.86466165413534e-06, "loss": 0.41557538509368896, "num_input_tokens_seen": 768352, "step": 1017, "train_runtime": 2325.0907, "train_tokens_per_second": 330.461 }, { "epoch": 0.09360919540229885, "grad_norm": 7.261196613311768, "learning_rate": 9.854636591478698e-06, "loss": 0.5402182936668396, "num_input_tokens_seen": 769004, "step": 1018, "train_runtime": 2327.0003, "train_tokens_per_second": 330.47 }, { "epoch": 0.09370114942528736, "grad_norm": 7.715246677398682, "learning_rate": 9.844611528822055e-06, "loss": 0.5894691944122314, "num_input_tokens_seen": 769816, "step": 1019, "train_runtime": 2328.9826, "train_tokens_per_second": 330.537 }, { "epoch": 0.09379310344827586, "grad_norm": 9.650315284729004, "learning_rate": 9.834586466165415e-06, "loss": 0.48343488574028015, "num_input_tokens_seen": 770492, "step": 1020, "train_runtime": 2330.9136, "train_tokens_per_second": 330.554 }, { "epoch": 0.09388505747126437, "grad_norm": 12.389888763427734, "learning_rate": 9.824561403508772e-06, "loss": 0.49280035495758057, "num_input_tokens_seen": 771328, "step": 1021, "train_runtime": 2339.7748, "train_tokens_per_second": 329.659 }, { "epoch": 0.09397701149425287, "grad_norm": 6.612550735473633, "learning_rate": 9.81453634085213e-06, "loss": 0.48790669441223145, "num_input_tokens_seen": 772216, "step": 1022, "train_runtime": 2341.7279, "train_tokens_per_second": 329.763 }, { "epoch": 0.09406896551724138, "grad_norm": 6.0658440589904785, "learning_rate": 9.80451127819549e-06, "loss": 0.4938814640045166, "num_input_tokens_seen": 773264, "step": 1023, "train_runtime": 2343.8558, "train_tokens_per_second": 329.911 }, { "epoch": 0.09416091954022988, "grad_norm": 5.443805694580078, "learning_rate": 9.794486215538847e-06, "loss": 0.4375538229942322, "num_input_tokens_seen": 774336, "step": 1024, "train_runtime": 2345.8428, "train_tokens_per_second": 330.089 }, { "epoch": 0.09425287356321839, "grad_norm": 7.415752410888672, "learning_rate": 9.784461152882206e-06, "loss": 0.5282442569732666, "num_input_tokens_seen": 775188, "step": 1025, "train_runtime": 2347.7896, "train_tokens_per_second": 330.178 }, { "epoch": 0.0943448275862069, "grad_norm": 6.058030128479004, "learning_rate": 9.774436090225564e-06, "loss": 0.3603585958480835, "num_input_tokens_seen": 775800, "step": 1026, "train_runtime": 2349.6978, "train_tokens_per_second": 330.17 }, { "epoch": 0.0944367816091954, "grad_norm": 6.946608066558838, "learning_rate": 9.764411027568923e-06, "loss": 0.5203933715820312, "num_input_tokens_seen": 776552, "step": 1027, "train_runtime": 2351.6785, "train_tokens_per_second": 330.212 }, { "epoch": 0.0945287356321839, "grad_norm": 6.649303913116455, "learning_rate": 9.754385964912281e-06, "loss": 0.47817522287368774, "num_input_tokens_seen": 777548, "step": 1028, "train_runtime": 2353.6686, "train_tokens_per_second": 330.356 }, { "epoch": 0.09462068965517241, "grad_norm": 6.833725452423096, "learning_rate": 9.74436090225564e-06, "loss": 0.4406696856021881, "num_input_tokens_seen": 778188, "step": 1029, "train_runtime": 2355.5837, "train_tokens_per_second": 330.359 }, { "epoch": 0.09471264367816092, "grad_norm": 6.373605251312256, "learning_rate": 9.734335839598998e-06, "loss": 0.43867525458335876, "num_input_tokens_seen": 778788, "step": 1030, "train_runtime": 2357.4893, "train_tokens_per_second": 330.346 }, { "epoch": 0.09480459770114942, "grad_norm": 6.011414051055908, "learning_rate": 9.724310776942357e-06, "loss": 0.4227856993675232, "num_input_tokens_seen": 779704, "step": 1031, "train_runtime": 2359.4771, "train_tokens_per_second": 330.456 }, { "epoch": 0.09489655172413793, "grad_norm": 6.286978244781494, "learning_rate": 9.714285714285715e-06, "loss": 0.36833497881889343, "num_input_tokens_seen": 780308, "step": 1032, "train_runtime": 2361.3896, "train_tokens_per_second": 330.444 }, { "epoch": 0.09498850574712643, "grad_norm": 8.112756729125977, "learning_rate": 9.704260651629074e-06, "loss": 0.47532498836517334, "num_input_tokens_seen": 781060, "step": 1033, "train_runtime": 2363.3331, "train_tokens_per_second": 330.491 }, { "epoch": 0.09508045977011494, "grad_norm": 7.036821365356445, "learning_rate": 9.694235588972432e-06, "loss": 0.5230494737625122, "num_input_tokens_seen": 781756, "step": 1034, "train_runtime": 2365.243, "train_tokens_per_second": 330.518 }, { "epoch": 0.09517241379310344, "grad_norm": 8.099452018737793, "learning_rate": 9.68421052631579e-06, "loss": 0.503882884979248, "num_input_tokens_seen": 782404, "step": 1035, "train_runtime": 2367.1472, "train_tokens_per_second": 330.526 }, { "epoch": 0.09526436781609196, "grad_norm": 6.2233076095581055, "learning_rate": 9.674185463659147e-06, "loss": 0.43777409195899963, "num_input_tokens_seen": 783036, "step": 1036, "train_runtime": 2369.0585, "train_tokens_per_second": 330.526 }, { "epoch": 0.09535632183908047, "grad_norm": 7.426332473754883, "learning_rate": 9.664160401002508e-06, "loss": 0.4811877906322479, "num_input_tokens_seen": 783604, "step": 1037, "train_runtime": 2371.0943, "train_tokens_per_second": 330.482 }, { "epoch": 0.09544827586206897, "grad_norm": 7.485308647155762, "learning_rate": 9.654135338345866e-06, "loss": 0.5360345840454102, "num_input_tokens_seen": 784320, "step": 1038, "train_runtime": 2373.0419, "train_tokens_per_second": 330.512 }, { "epoch": 0.09554022988505748, "grad_norm": 7.009185314178467, "learning_rate": 9.644110275689223e-06, "loss": 0.5393097400665283, "num_input_tokens_seen": 785092, "step": 1039, "train_runtime": 2374.9493, "train_tokens_per_second": 330.572 }, { "epoch": 0.09563218390804598, "grad_norm": 6.129383563995361, "learning_rate": 9.634085213032583e-06, "loss": 0.4603983759880066, "num_input_tokens_seen": 785788, "step": 1040, "train_runtime": 2376.9207, "train_tokens_per_second": 330.591 }, { "epoch": 0.09572413793103449, "grad_norm": 6.2865519523620605, "learning_rate": 9.62406015037594e-06, "loss": 0.42140841484069824, "num_input_tokens_seen": 786404, "step": 1041, "train_runtime": 2378.8442, "train_tokens_per_second": 330.582 }, { "epoch": 0.09581609195402299, "grad_norm": 8.007585525512695, "learning_rate": 9.614035087719298e-06, "loss": 0.5779958367347717, "num_input_tokens_seen": 787304, "step": 1042, "train_runtime": 2380.7954, "train_tokens_per_second": 330.689 }, { "epoch": 0.0959080459770115, "grad_norm": 6.392016410827637, "learning_rate": 9.604010025062659e-06, "loss": 0.5943008661270142, "num_input_tokens_seen": 788388, "step": 1043, "train_runtime": 2382.7425, "train_tokens_per_second": 330.874 }, { "epoch": 0.096, "grad_norm": 6.230937957763672, "learning_rate": 9.593984962406015e-06, "loss": 0.5474150776863098, "num_input_tokens_seen": 790628, "step": 1044, "train_runtime": 2384.8541, "train_tokens_per_second": 331.52 }, { "epoch": 0.09609195402298851, "grad_norm": 7.178816318511963, "learning_rate": 9.583959899749374e-06, "loss": 0.46896564960479736, "num_input_tokens_seen": 791384, "step": 1045, "train_runtime": 2386.8215, "train_tokens_per_second": 331.564 }, { "epoch": 0.09618390804597701, "grad_norm": 6.814177513122559, "learning_rate": 9.573934837092732e-06, "loss": 0.4675101637840271, "num_input_tokens_seen": 792124, "step": 1046, "train_runtime": 2388.7697, "train_tokens_per_second": 331.603 }, { "epoch": 0.09627586206896552, "grad_norm": 8.564444541931152, "learning_rate": 9.56390977443609e-06, "loss": 0.4232885241508484, "num_input_tokens_seen": 792688, "step": 1047, "train_runtime": 2390.6854, "train_tokens_per_second": 331.574 }, { "epoch": 0.09636781609195402, "grad_norm": 10.102237701416016, "learning_rate": 9.55388471177945e-06, "loss": 0.4183449149131775, "num_input_tokens_seen": 793280, "step": 1048, "train_runtime": 2392.5987, "train_tokens_per_second": 331.556 }, { "epoch": 0.09645977011494253, "grad_norm": 7.193587779998779, "learning_rate": 9.543859649122808e-06, "loss": 0.5160861015319824, "num_input_tokens_seen": 794048, "step": 1049, "train_runtime": 2394.5092, "train_tokens_per_second": 331.612 }, { "epoch": 0.09655172413793103, "grad_norm": 7.2332024574279785, "learning_rate": 9.533834586466166e-06, "loss": 0.5566169023513794, "num_input_tokens_seen": 794764, "step": 1050, "train_runtime": 2396.4189, "train_tokens_per_second": 331.647 }, { "epoch": 0.09664367816091954, "grad_norm": 7.799232006072998, "learning_rate": 9.523809523809525e-06, "loss": 0.5159203410148621, "num_input_tokens_seen": 795508, "step": 1051, "train_runtime": 2405.4812, "train_tokens_per_second": 330.706 }, { "epoch": 0.09673563218390804, "grad_norm": 14.995935440063477, "learning_rate": 9.513784461152883e-06, "loss": 0.45017606019973755, "num_input_tokens_seen": 796120, "step": 1052, "train_runtime": 2407.388, "train_tokens_per_second": 330.699 }, { "epoch": 0.09682758620689655, "grad_norm": 6.2709503173828125, "learning_rate": 9.503759398496242e-06, "loss": 0.4437541365623474, "num_input_tokens_seen": 797056, "step": 1053, "train_runtime": 2409.3635, "train_tokens_per_second": 330.816 }, { "epoch": 0.09691954022988505, "grad_norm": 6.873055458068848, "learning_rate": 9.4937343358396e-06, "loss": 0.5023096799850464, "num_input_tokens_seen": 797724, "step": 1054, "train_runtime": 2411.2752, "train_tokens_per_second": 330.831 }, { "epoch": 0.09701149425287356, "grad_norm": 6.0630202293396, "learning_rate": 9.483709273182959e-06, "loss": 0.4279667139053345, "num_input_tokens_seen": 798576, "step": 1055, "train_runtime": 2413.2174, "train_tokens_per_second": 330.918 }, { "epoch": 0.09710344827586206, "grad_norm": 5.470777988433838, "learning_rate": 9.473684210526315e-06, "loss": 0.32489827275276184, "num_input_tokens_seen": 799192, "step": 1056, "train_runtime": 2415.1235, "train_tokens_per_second": 330.911 }, { "epoch": 0.09719540229885057, "grad_norm": 6.455587387084961, "learning_rate": 9.463659147869676e-06, "loss": 0.5397228002548218, "num_input_tokens_seen": 799772, "step": 1057, "train_runtime": 2417.0295, "train_tokens_per_second": 330.89 }, { "epoch": 0.09728735632183907, "grad_norm": 6.85917854309082, "learning_rate": 9.453634085213034e-06, "loss": 0.47662365436553955, "num_input_tokens_seen": 800536, "step": 1058, "train_runtime": 2418.9768, "train_tokens_per_second": 330.94 }, { "epoch": 0.09737931034482758, "grad_norm": 7.232198715209961, "learning_rate": 9.443609022556391e-06, "loss": 0.3814907670021057, "num_input_tokens_seen": 801092, "step": 1059, "train_runtime": 2420.8882, "train_tokens_per_second": 330.908 }, { "epoch": 0.09747126436781609, "grad_norm": 7.328190803527832, "learning_rate": 9.43358395989975e-06, "loss": 0.5666010975837708, "num_input_tokens_seen": 801832, "step": 1060, "train_runtime": 2422.8456, "train_tokens_per_second": 330.946 }, { "epoch": 0.0975632183908046, "grad_norm": 6.977006435394287, "learning_rate": 9.423558897243108e-06, "loss": 0.477314829826355, "num_input_tokens_seen": 802572, "step": 1061, "train_runtime": 2424.7861, "train_tokens_per_second": 330.987 }, { "epoch": 0.09765517241379311, "grad_norm": 7.465899467468262, "learning_rate": 9.413533834586466e-06, "loss": 0.44286948442459106, "num_input_tokens_seen": 803200, "step": 1062, "train_runtime": 2426.703, "train_tokens_per_second": 330.984 }, { "epoch": 0.09774712643678161, "grad_norm": 7.511911869049072, "learning_rate": 9.403508771929825e-06, "loss": 0.5399251580238342, "num_input_tokens_seen": 804012, "step": 1063, "train_runtime": 2428.6794, "train_tokens_per_second": 331.049 }, { "epoch": 0.09783908045977012, "grad_norm": 6.484589099884033, "learning_rate": 9.393483709273183e-06, "loss": 0.46299657225608826, "num_input_tokens_seen": 804604, "step": 1064, "train_runtime": 2430.745, "train_tokens_per_second": 331.011 }, { "epoch": 0.09793103448275862, "grad_norm": 7.001509189605713, "learning_rate": 9.383458646616542e-06, "loss": 0.5671294331550598, "num_input_tokens_seen": 805624, "step": 1065, "train_runtime": 2432.7273, "train_tokens_per_second": 331.161 }, { "epoch": 0.09802298850574713, "grad_norm": 6.694453716278076, "learning_rate": 9.3734335839599e-06, "loss": 0.4465494155883789, "num_input_tokens_seen": 806336, "step": 1066, "train_runtime": 2434.6512, "train_tokens_per_second": 331.192 }, { "epoch": 0.09811494252873564, "grad_norm": 8.25455379486084, "learning_rate": 9.363408521303259e-06, "loss": 0.4501800537109375, "num_input_tokens_seen": 807000, "step": 1067, "train_runtime": 2436.563, "train_tokens_per_second": 331.204 }, { "epoch": 0.09820689655172414, "grad_norm": 6.203482627868652, "learning_rate": 9.353383458646617e-06, "loss": 0.45742660760879517, "num_input_tokens_seen": 807544, "step": 1068, "train_runtime": 2438.4891, "train_tokens_per_second": 331.166 }, { "epoch": 0.09829885057471265, "grad_norm": 6.2609944343566895, "learning_rate": 9.343358395989976e-06, "loss": 0.454520583152771, "num_input_tokens_seen": 808232, "step": 1069, "train_runtime": 2440.4183, "train_tokens_per_second": 331.186 }, { "epoch": 0.09839080459770115, "grad_norm": 7.969869613647461, "learning_rate": 9.333333333333334e-06, "loss": 0.45502176880836487, "num_input_tokens_seen": 809000, "step": 1070, "train_runtime": 2442.3543, "train_tokens_per_second": 331.238 }, { "epoch": 0.09848275862068966, "grad_norm": 8.279662132263184, "learning_rate": 9.323308270676693e-06, "loss": 0.5213327407836914, "num_input_tokens_seen": 809616, "step": 1071, "train_runtime": 2444.2928, "train_tokens_per_second": 331.227 }, { "epoch": 0.09857471264367816, "grad_norm": 6.863427639007568, "learning_rate": 9.313283208020051e-06, "loss": 0.35063788294792175, "num_input_tokens_seen": 810140, "step": 1072, "train_runtime": 2446.2168, "train_tokens_per_second": 331.181 }, { "epoch": 0.09866666666666667, "grad_norm": 6.921423435211182, "learning_rate": 9.30325814536341e-06, "loss": 0.43684956431388855, "num_input_tokens_seen": 810724, "step": 1073, "train_runtime": 2448.15, "train_tokens_per_second": 331.158 }, { "epoch": 0.09875862068965517, "grad_norm": 8.909449577331543, "learning_rate": 9.293233082706767e-06, "loss": 0.3925761580467224, "num_input_tokens_seen": 811896, "step": 1074, "train_runtime": 2450.2017, "train_tokens_per_second": 331.359 }, { "epoch": 0.09885057471264368, "grad_norm": 7.516204833984375, "learning_rate": 9.283208020050127e-06, "loss": 0.4987984895706177, "num_input_tokens_seen": 812572, "step": 1075, "train_runtime": 2452.1206, "train_tokens_per_second": 331.375 }, { "epoch": 0.09894252873563218, "grad_norm": 6.935107707977295, "learning_rate": 9.273182957393484e-06, "loss": 0.4580703377723694, "num_input_tokens_seen": 813196, "step": 1076, "train_runtime": 2454.0342, "train_tokens_per_second": 331.371 }, { "epoch": 0.09903448275862069, "grad_norm": 5.472903728485107, "learning_rate": 9.263157894736842e-06, "loss": 0.37355905771255493, "num_input_tokens_seen": 813836, "step": 1077, "train_runtime": 2455.9524, "train_tokens_per_second": 331.373 }, { "epoch": 0.09912643678160919, "grad_norm": 6.800434589385986, "learning_rate": 9.253132832080202e-06, "loss": 0.4778006970882416, "num_input_tokens_seen": 814488, "step": 1078, "train_runtime": 2457.8663, "train_tokens_per_second": 331.38 }, { "epoch": 0.0992183908045977, "grad_norm": 6.6643290519714355, "learning_rate": 9.243107769423559e-06, "loss": 0.53313809633255, "num_input_tokens_seen": 815840, "step": 1079, "train_runtime": 2459.8754, "train_tokens_per_second": 331.659 }, { "epoch": 0.0993103448275862, "grad_norm": 6.268790245056152, "learning_rate": 9.233082706766918e-06, "loss": 0.4480176568031311, "num_input_tokens_seen": 816696, "step": 1080, "train_runtime": 2461.8252, "train_tokens_per_second": 331.744 }, { "epoch": 0.09940229885057471, "grad_norm": 6.700995445251465, "learning_rate": 9.223057644110276e-06, "loss": 0.3908253312110901, "num_input_tokens_seen": 817340, "step": 1081, "train_runtime": 2470.706, "train_tokens_per_second": 330.812 }, { "epoch": 0.09949425287356321, "grad_norm": 7.005143165588379, "learning_rate": 9.213032581453634e-06, "loss": 0.5249738693237305, "num_input_tokens_seen": 817884, "step": 1082, "train_runtime": 2472.6545, "train_tokens_per_second": 330.772 }, { "epoch": 0.09958620689655172, "grad_norm": 6.341146469116211, "learning_rate": 9.203007518796993e-06, "loss": 0.4519422650337219, "num_input_tokens_seen": 818568, "step": 1083, "train_runtime": 2474.5714, "train_tokens_per_second": 330.792 }, { "epoch": 0.09967816091954022, "grad_norm": 6.9556708335876465, "learning_rate": 9.192982456140351e-06, "loss": 0.5711106061935425, "num_input_tokens_seen": 819528, "step": 1084, "train_runtime": 2476.5501, "train_tokens_per_second": 330.915 }, { "epoch": 0.09977011494252873, "grad_norm": 6.9345269203186035, "learning_rate": 9.18295739348371e-06, "loss": 0.5837572813034058, "num_input_tokens_seen": 820140, "step": 1085, "train_runtime": 2478.641, "train_tokens_per_second": 330.883 }, { "epoch": 0.09986206896551725, "grad_norm": 7.81229305267334, "learning_rate": 9.172932330827068e-06, "loss": 0.5010105967521667, "num_input_tokens_seen": 820840, "step": 1086, "train_runtime": 2480.5816, "train_tokens_per_second": 330.906 }, { "epoch": 0.09995402298850575, "grad_norm": 6.963803768157959, "learning_rate": 9.162907268170427e-06, "loss": 0.45326730608940125, "num_input_tokens_seen": 821532, "step": 1087, "train_runtime": 2482.5694, "train_tokens_per_second": 330.92 }, { "epoch": 0.10004597701149426, "grad_norm": 6.994347095489502, "learning_rate": 9.152882205513785e-06, "loss": 0.6128959655761719, "num_input_tokens_seen": 822252, "step": 1088, "train_runtime": 2484.4887, "train_tokens_per_second": 330.954 }, { "epoch": 0.10013793103448276, "grad_norm": 6.74661111831665, "learning_rate": 9.142857142857144e-06, "loss": 0.49878284335136414, "num_input_tokens_seen": 822928, "step": 1089, "train_runtime": 2486.414, "train_tokens_per_second": 330.97 }, { "epoch": 0.10022988505747127, "grad_norm": 7.087134838104248, "learning_rate": 9.132832080200502e-06, "loss": 0.43717753887176514, "num_input_tokens_seen": 823580, "step": 1090, "train_runtime": 2488.4213, "train_tokens_per_second": 330.965 }, { "epoch": 0.10032183908045977, "grad_norm": 5.783131122589111, "learning_rate": 9.12280701754386e-06, "loss": 0.3840745687484741, "num_input_tokens_seen": 824268, "step": 1091, "train_runtime": 2490.3564, "train_tokens_per_second": 330.984 }, { "epoch": 0.10041379310344828, "grad_norm": 7.296253204345703, "learning_rate": 9.11278195488722e-06, "loss": 0.43705883622169495, "num_input_tokens_seen": 824904, "step": 1092, "train_runtime": 2492.3035, "train_tokens_per_second": 330.981 }, { "epoch": 0.10050574712643678, "grad_norm": 6.83408784866333, "learning_rate": 9.102756892230578e-06, "loss": 0.44784992933273315, "num_input_tokens_seen": 825472, "step": 1093, "train_runtime": 2494.2832, "train_tokens_per_second": 330.946 }, { "epoch": 0.10059770114942529, "grad_norm": 5.716932773590088, "learning_rate": 9.092731829573935e-06, "loss": 0.4516908526420593, "num_input_tokens_seen": 826596, "step": 1094, "train_runtime": 2496.2588, "train_tokens_per_second": 331.134 }, { "epoch": 0.1006896551724138, "grad_norm": 6.829396724700928, "learning_rate": 9.082706766917295e-06, "loss": 0.4212993085384369, "num_input_tokens_seen": 827232, "step": 1095, "train_runtime": 2498.1779, "train_tokens_per_second": 331.134 }, { "epoch": 0.1007816091954023, "grad_norm": 7.256698131561279, "learning_rate": 9.072681704260652e-06, "loss": 0.4646654427051544, "num_input_tokens_seen": 827912, "step": 1096, "train_runtime": 2500.1032, "train_tokens_per_second": 331.151 }, { "epoch": 0.1008735632183908, "grad_norm": 6.697038650512695, "learning_rate": 9.06265664160401e-06, "loss": 0.5193271040916443, "num_input_tokens_seen": 828964, "step": 1097, "train_runtime": 2502.0918, "train_tokens_per_second": 331.308 }, { "epoch": 0.10096551724137931, "grad_norm": 6.856689453125, "learning_rate": 9.05263157894737e-06, "loss": 0.5617572069168091, "num_input_tokens_seen": 829588, "step": 1098, "train_runtime": 2504.0147, "train_tokens_per_second": 331.303 }, { "epoch": 0.10105747126436782, "grad_norm": 6.135411739349365, "learning_rate": 9.042606516290727e-06, "loss": 0.3666629493236542, "num_input_tokens_seen": 830120, "step": 1099, "train_runtime": 2505.932, "train_tokens_per_second": 331.262 }, { "epoch": 0.10114942528735632, "grad_norm": 7.073989391326904, "learning_rate": 9.032581453634086e-06, "loss": 0.4835805296897888, "num_input_tokens_seen": 830876, "step": 1100, "train_runtime": 2507.882, "train_tokens_per_second": 331.306 }, { "epoch": 0.10124137931034483, "grad_norm": 6.260268211364746, "learning_rate": 9.022556390977444e-06, "loss": 0.5108278393745422, "num_input_tokens_seen": 831800, "step": 1101, "train_runtime": 2509.8337, "train_tokens_per_second": 331.416 }, { "epoch": 0.10133333333333333, "grad_norm": 6.927764892578125, "learning_rate": 9.012531328320803e-06, "loss": 0.43247172236442566, "num_input_tokens_seen": 832444, "step": 1102, "train_runtime": 2511.7489, "train_tokens_per_second": 331.42 }, { "epoch": 0.10142528735632184, "grad_norm": 7.856224536895752, "learning_rate": 9.002506265664161e-06, "loss": 0.45604825019836426, "num_input_tokens_seen": 833036, "step": 1103, "train_runtime": 2513.6687, "train_tokens_per_second": 331.402 }, { "epoch": 0.10151724137931034, "grad_norm": 5.877823352813721, "learning_rate": 8.99248120300752e-06, "loss": 0.40084534883499146, "num_input_tokens_seen": 833608, "step": 1104, "train_runtime": 2515.582, "train_tokens_per_second": 331.378 }, { "epoch": 0.10160919540229885, "grad_norm": 7.92399263381958, "learning_rate": 8.982456140350878e-06, "loss": 0.6011634469032288, "num_input_tokens_seen": 834436, "step": 1105, "train_runtime": 2517.5498, "train_tokens_per_second": 331.448 }, { "epoch": 0.10170114942528735, "grad_norm": 6.29843282699585, "learning_rate": 8.972431077694236e-06, "loss": 0.48987555503845215, "num_input_tokens_seen": 835324, "step": 1106, "train_runtime": 2519.4913, "train_tokens_per_second": 331.545 }, { "epoch": 0.10179310344827586, "grad_norm": 6.689895153045654, "learning_rate": 8.962406015037595e-06, "loss": 0.40902847051620483, "num_input_tokens_seen": 835936, "step": 1107, "train_runtime": 2521.4095, "train_tokens_per_second": 331.535 }, { "epoch": 0.10188505747126436, "grad_norm": 6.9143147468566895, "learning_rate": 8.952380952380953e-06, "loss": 0.5424303412437439, "num_input_tokens_seen": 836648, "step": 1108, "train_runtime": 2523.3206, "train_tokens_per_second": 331.566 }, { "epoch": 0.10197701149425287, "grad_norm": 7.003936290740967, "learning_rate": 8.942355889724312e-06, "loss": 0.44123268127441406, "num_input_tokens_seen": 837352, "step": 1109, "train_runtime": 2525.2621, "train_tokens_per_second": 331.59 }, { "epoch": 0.10206896551724139, "grad_norm": 6.4153008460998535, "learning_rate": 8.93233082706767e-06, "loss": 0.4268386960029602, "num_input_tokens_seen": 838628, "step": 1110, "train_runtime": 2527.2351, "train_tokens_per_second": 331.836 }, { "epoch": 0.10216091954022989, "grad_norm": 5.765989780426025, "learning_rate": 8.922305764411027e-06, "loss": 0.5652371644973755, "num_input_tokens_seen": 840140, "step": 1111, "train_runtime": 2536.2102, "train_tokens_per_second": 331.258 }, { "epoch": 0.1022528735632184, "grad_norm": 6.961856842041016, "learning_rate": 8.912280701754387e-06, "loss": 0.3952780067920685, "num_input_tokens_seen": 840828, "step": 1112, "train_runtime": 2538.1877, "train_tokens_per_second": 331.271 }, { "epoch": 0.1023448275862069, "grad_norm": 7.673656463623047, "learning_rate": 8.902255639097746e-06, "loss": 0.5512932538986206, "num_input_tokens_seen": 841480, "step": 1113, "train_runtime": 2540.1737, "train_tokens_per_second": 331.269 }, { "epoch": 0.10243678160919541, "grad_norm": 11.50959300994873, "learning_rate": 8.892230576441103e-06, "loss": 0.423117458820343, "num_input_tokens_seen": 842056, "step": 1114, "train_runtime": 2542.1072, "train_tokens_per_second": 331.243 }, { "epoch": 0.10252873563218391, "grad_norm": 6.463172912597656, "learning_rate": 8.882205513784463e-06, "loss": 0.4713388681411743, "num_input_tokens_seen": 842692, "step": 1115, "train_runtime": 2544.0231, "train_tokens_per_second": 331.244 }, { "epoch": 0.10262068965517242, "grad_norm": 6.369577407836914, "learning_rate": 8.87218045112782e-06, "loss": 0.4382193088531494, "num_input_tokens_seen": 843528, "step": 1116, "train_runtime": 2545.9715, "train_tokens_per_second": 331.319 }, { "epoch": 0.10271264367816092, "grad_norm": 6.405300617218018, "learning_rate": 8.862155388471178e-06, "loss": 0.4564143419265747, "num_input_tokens_seen": 844264, "step": 1117, "train_runtime": 2547.9274, "train_tokens_per_second": 331.353 }, { "epoch": 0.10280459770114943, "grad_norm": 6.811070442199707, "learning_rate": 8.852130325814537e-06, "loss": 0.602678120136261, "num_input_tokens_seen": 845160, "step": 1118, "train_runtime": 2549.8913, "train_tokens_per_second": 331.449 }, { "epoch": 0.10289655172413793, "grad_norm": 6.943862438201904, "learning_rate": 8.842105263157895e-06, "loss": 0.421866238117218, "num_input_tokens_seen": 845820, "step": 1119, "train_runtime": 2551.8374, "train_tokens_per_second": 331.455 }, { "epoch": 0.10298850574712644, "grad_norm": 6.22981071472168, "learning_rate": 8.832080200501254e-06, "loss": 0.4855208992958069, "num_input_tokens_seen": 846392, "step": 1120, "train_runtime": 2553.7755, "train_tokens_per_second": 331.428 }, { "epoch": 0.10308045977011494, "grad_norm": 9.345059394836426, "learning_rate": 8.822055137844612e-06, "loss": 0.5808264017105103, "num_input_tokens_seen": 848220, "step": 1121, "train_runtime": 2555.8766, "train_tokens_per_second": 331.87 }, { "epoch": 0.10317241379310345, "grad_norm": 6.821878433227539, "learning_rate": 8.81203007518797e-06, "loss": 0.4558633267879486, "num_input_tokens_seen": 848888, "step": 1122, "train_runtime": 2557.8287, "train_tokens_per_second": 331.878 }, { "epoch": 0.10326436781609195, "grad_norm": 7.337451457977295, "learning_rate": 8.802005012531329e-06, "loss": 0.49908947944641113, "num_input_tokens_seen": 849748, "step": 1123, "train_runtime": 2559.7814, "train_tokens_per_second": 331.961 }, { "epoch": 0.10335632183908046, "grad_norm": 6.414590835571289, "learning_rate": 8.791979949874688e-06, "loss": 0.45316675305366516, "num_input_tokens_seen": 850480, "step": 1124, "train_runtime": 2561.6977, "train_tokens_per_second": 331.999 }, { "epoch": 0.10344827586206896, "grad_norm": 5.787412166595459, "learning_rate": 8.781954887218046e-06, "loss": 0.37481051683425903, "num_input_tokens_seen": 851084, "step": 1125, "train_runtime": 2563.6018, "train_tokens_per_second": 331.988 }, { "epoch": 0.10354022988505747, "grad_norm": 6.6846842765808105, "learning_rate": 8.771929824561405e-06, "loss": 0.44032424688339233, "num_input_tokens_seen": 851752, "step": 1126, "train_runtime": 2565.5326, "train_tokens_per_second": 331.998 }, { "epoch": 0.10363218390804597, "grad_norm": 7.464715957641602, "learning_rate": 8.761904761904763e-06, "loss": 0.40682342648506165, "num_input_tokens_seen": 852344, "step": 1127, "train_runtime": 2567.4486, "train_tokens_per_second": 331.981 }, { "epoch": 0.10372413793103448, "grad_norm": 6.334898948669434, "learning_rate": 8.751879699248122e-06, "loss": 0.47571703791618347, "num_input_tokens_seen": 853560, "step": 1128, "train_runtime": 2569.4544, "train_tokens_per_second": 332.195 }, { "epoch": 0.10381609195402298, "grad_norm": 6.915487289428711, "learning_rate": 8.741854636591478e-06, "loss": 0.4608912169933319, "num_input_tokens_seen": 854812, "step": 1129, "train_runtime": 2571.4341, "train_tokens_per_second": 332.426 }, { "epoch": 0.10390804597701149, "grad_norm": 7.502654075622559, "learning_rate": 8.731829573934839e-06, "loss": 0.46037107706069946, "num_input_tokens_seen": 855540, "step": 1130, "train_runtime": 2573.4207, "train_tokens_per_second": 332.452 }, { "epoch": 0.104, "grad_norm": 6.771470546722412, "learning_rate": 8.721804511278195e-06, "loss": 0.5191470384597778, "num_input_tokens_seen": 856396, "step": 1131, "train_runtime": 2575.5216, "train_tokens_per_second": 332.514 }, { "epoch": 0.1040919540229885, "grad_norm": 6.378627777099609, "learning_rate": 8.711779448621554e-06, "loss": 0.4394569993019104, "num_input_tokens_seen": 857096, "step": 1132, "train_runtime": 2577.4414, "train_tokens_per_second": 332.538 }, { "epoch": 0.104183908045977, "grad_norm": 6.649139404296875, "learning_rate": 8.701754385964914e-06, "loss": 0.5085347890853882, "num_input_tokens_seen": 857760, "step": 1133, "train_runtime": 2579.3566, "train_tokens_per_second": 332.548 }, { "epoch": 0.10427586206896551, "grad_norm": 6.40639066696167, "learning_rate": 8.69172932330827e-06, "loss": 0.5946711301803589, "num_input_tokens_seen": 859220, "step": 1134, "train_runtime": 2581.3642, "train_tokens_per_second": 332.855 }, { "epoch": 0.10436781609195403, "grad_norm": 8.070779800415039, "learning_rate": 8.68170426065163e-06, "loss": 0.5779873132705688, "num_input_tokens_seen": 860148, "step": 1135, "train_runtime": 2583.3163, "train_tokens_per_second": 332.963 }, { "epoch": 0.10445977011494254, "grad_norm": 7.178983688354492, "learning_rate": 8.671679197994988e-06, "loss": 0.43063604831695557, "num_input_tokens_seen": 860680, "step": 1136, "train_runtime": 2585.2274, "train_tokens_per_second": 332.922 }, { "epoch": 0.10455172413793104, "grad_norm": 7.161444664001465, "learning_rate": 8.661654135338346e-06, "loss": 0.4682421088218689, "num_input_tokens_seen": 861344, "step": 1137, "train_runtime": 2587.1461, "train_tokens_per_second": 332.932 }, { "epoch": 0.10464367816091955, "grad_norm": 6.621373176574707, "learning_rate": 8.651629072681705e-06, "loss": 0.3778235614299774, "num_input_tokens_seen": 861904, "step": 1138, "train_runtime": 2589.0599, "train_tokens_per_second": 332.902 }, { "epoch": 0.10473563218390805, "grad_norm": 6.741207122802734, "learning_rate": 8.641604010025063e-06, "loss": 0.500791072845459, "num_input_tokens_seen": 862960, "step": 1139, "train_runtime": 2591.0595, "train_tokens_per_second": 333.053 }, { "epoch": 0.10482758620689656, "grad_norm": 7.26300048828125, "learning_rate": 8.631578947368422e-06, "loss": 0.5782602429389954, "num_input_tokens_seen": 863716, "step": 1140, "train_runtime": 2593.0137, "train_tokens_per_second": 333.094 }, { "epoch": 0.10491954022988506, "grad_norm": 7.038207530975342, "learning_rate": 8.62155388471178e-06, "loss": 0.46371889114379883, "num_input_tokens_seen": 864972, "step": 1141, "train_runtime": 2601.6965, "train_tokens_per_second": 332.465 }, { "epoch": 0.10501149425287357, "grad_norm": 6.5405192375183105, "learning_rate": 8.611528822055139e-06, "loss": 0.5100393891334534, "num_input_tokens_seen": 865836, "step": 1142, "train_runtime": 2603.6423, "train_tokens_per_second": 332.548 }, { "epoch": 0.10510344827586207, "grad_norm": 8.58717155456543, "learning_rate": 8.601503759398497e-06, "loss": 0.5306845307350159, "num_input_tokens_seen": 866456, "step": 1143, "train_runtime": 2605.6254, "train_tokens_per_second": 332.533 }, { "epoch": 0.10519540229885058, "grad_norm": 6.847975254058838, "learning_rate": 8.591478696741856e-06, "loss": 0.5252816081047058, "num_input_tokens_seen": 867268, "step": 1144, "train_runtime": 2607.5767, "train_tokens_per_second": 332.595 }, { "epoch": 0.10528735632183908, "grad_norm": 7.272277355194092, "learning_rate": 8.581453634085214e-06, "loss": 0.554922342300415, "num_input_tokens_seen": 868228, "step": 1145, "train_runtime": 2609.555, "train_tokens_per_second": 332.711 }, { "epoch": 0.10537931034482759, "grad_norm": 6.600028991699219, "learning_rate": 8.571428571428571e-06, "loss": 0.47623491287231445, "num_input_tokens_seen": 868812, "step": 1146, "train_runtime": 2611.4597, "train_tokens_per_second": 332.692 }, { "epoch": 0.10547126436781609, "grad_norm": 8.430718421936035, "learning_rate": 8.561403508771931e-06, "loss": 0.4833829998970032, "num_input_tokens_seen": 869404, "step": 1147, "train_runtime": 2613.4042, "train_tokens_per_second": 332.671 }, { "epoch": 0.1055632183908046, "grad_norm": 6.189053535461426, "learning_rate": 8.55137844611529e-06, "loss": 0.401858389377594, "num_input_tokens_seen": 870064, "step": 1148, "train_runtime": 2615.3139, "train_tokens_per_second": 332.681 }, { "epoch": 0.1056551724137931, "grad_norm": 8.391399383544922, "learning_rate": 8.541353383458646e-06, "loss": 0.534809410572052, "num_input_tokens_seen": 870740, "step": 1149, "train_runtime": 2617.2292, "train_tokens_per_second": 332.695 }, { "epoch": 0.10574712643678161, "grad_norm": 7.162993431091309, "learning_rate": 8.531328320802007e-06, "loss": 0.48639699816703796, "num_input_tokens_seen": 871544, "step": 1150, "train_runtime": 2619.1697, "train_tokens_per_second": 332.756 }, { "epoch": 0.10583908045977011, "grad_norm": 5.858705997467041, "learning_rate": 8.521303258145363e-06, "loss": 0.4374701976776123, "num_input_tokens_seen": 872508, "step": 1151, "train_runtime": 2621.1555, "train_tokens_per_second": 332.872 }, { "epoch": 0.10593103448275862, "grad_norm": 6.275646209716797, "learning_rate": 8.511278195488722e-06, "loss": 0.49831047654151917, "num_input_tokens_seen": 873292, "step": 1152, "train_runtime": 2623.0981, "train_tokens_per_second": 332.924 }, { "epoch": 0.10602298850574712, "grad_norm": 6.347123622894287, "learning_rate": 8.501253132832082e-06, "loss": 0.4552074074745178, "num_input_tokens_seen": 873944, "step": 1153, "train_runtime": 2625.0113, "train_tokens_per_second": 332.93 }, { "epoch": 0.10611494252873563, "grad_norm": 8.130861282348633, "learning_rate": 8.491228070175439e-06, "loss": 0.6418692469596863, "num_input_tokens_seen": 875456, "step": 1154, "train_runtime": 2627.0299, "train_tokens_per_second": 333.249 }, { "epoch": 0.10620689655172413, "grad_norm": 6.69249963760376, "learning_rate": 8.481203007518797e-06, "loss": 0.377086877822876, "num_input_tokens_seen": 876152, "step": 1155, "train_runtime": 2628.9819, "train_tokens_per_second": 333.267 }, { "epoch": 0.10629885057471264, "grad_norm": 5.914850234985352, "learning_rate": 8.471177944862156e-06, "loss": 0.4858471751213074, "num_input_tokens_seen": 877164, "step": 1156, "train_runtime": 2630.9646, "train_tokens_per_second": 333.4 }, { "epoch": 0.10639080459770114, "grad_norm": 6.8667168617248535, "learning_rate": 8.461152882205514e-06, "loss": 0.47280052304267883, "num_input_tokens_seen": 877992, "step": 1157, "train_runtime": 2632.9249, "train_tokens_per_second": 333.466 }, { "epoch": 0.10648275862068965, "grad_norm": 6.664647579193115, "learning_rate": 8.451127819548873e-06, "loss": 0.4369109869003296, "num_input_tokens_seen": 878632, "step": 1158, "train_runtime": 2634.8346, "train_tokens_per_second": 333.468 }, { "epoch": 0.10657471264367815, "grad_norm": 6.69909143447876, "learning_rate": 8.441102756892231e-06, "loss": 0.5258703231811523, "num_input_tokens_seen": 879296, "step": 1159, "train_runtime": 2636.7554, "train_tokens_per_second": 333.477 }, { "epoch": 0.10666666666666667, "grad_norm": 6.778830528259277, "learning_rate": 8.43107769423559e-06, "loss": 0.5211995244026184, "num_input_tokens_seen": 880040, "step": 1160, "train_runtime": 2638.674, "train_tokens_per_second": 333.516 }, { "epoch": 0.10675862068965518, "grad_norm": 7.172182559967041, "learning_rate": 8.421052631578948e-06, "loss": 0.49945908784866333, "num_input_tokens_seen": 880796, "step": 1161, "train_runtime": 2640.5989, "train_tokens_per_second": 333.559 }, { "epoch": 0.10685057471264368, "grad_norm": 6.542418479919434, "learning_rate": 8.411027568922307e-06, "loss": 0.5056060552597046, "num_input_tokens_seen": 881676, "step": 1162, "train_runtime": 2642.545, "train_tokens_per_second": 333.647 }, { "epoch": 0.10694252873563219, "grad_norm": 6.930642604827881, "learning_rate": 8.401002506265665e-06, "loss": 0.5065448880195618, "num_input_tokens_seen": 882676, "step": 1163, "train_runtime": 2644.5277, "train_tokens_per_second": 333.775 }, { "epoch": 0.1070344827586207, "grad_norm": 6.357349395751953, "learning_rate": 8.390977443609024e-06, "loss": 0.4251636266708374, "num_input_tokens_seen": 883556, "step": 1164, "train_runtime": 2646.4774, "train_tokens_per_second": 333.861 }, { "epoch": 0.1071264367816092, "grad_norm": 6.012309551239014, "learning_rate": 8.380952380952382e-06, "loss": 0.37506213784217834, "num_input_tokens_seen": 884100, "step": 1165, "train_runtime": 2648.4139, "train_tokens_per_second": 333.822 }, { "epoch": 0.1072183908045977, "grad_norm": 6.938154220581055, "learning_rate": 8.370927318295739e-06, "loss": 0.5116899609565735, "num_input_tokens_seen": 884892, "step": 1166, "train_runtime": 2650.356, "train_tokens_per_second": 333.877 }, { "epoch": 0.10731034482758621, "grad_norm": 5.789228916168213, "learning_rate": 8.3609022556391e-06, "loss": 0.47559186816215515, "num_input_tokens_seen": 886440, "step": 1167, "train_runtime": 2652.4012, "train_tokens_per_second": 334.203 }, { "epoch": 0.10740229885057472, "grad_norm": 7.105683326721191, "learning_rate": 8.350877192982458e-06, "loss": 0.4797236919403076, "num_input_tokens_seen": 887448, "step": 1168, "train_runtime": 2654.3786, "train_tokens_per_second": 334.334 }, { "epoch": 0.10749425287356322, "grad_norm": 6.87125825881958, "learning_rate": 8.340852130325814e-06, "loss": 0.4814605712890625, "num_input_tokens_seen": 888048, "step": 1169, "train_runtime": 2656.2971, "train_tokens_per_second": 334.318 }, { "epoch": 0.10758620689655173, "grad_norm": 6.2805986404418945, "learning_rate": 8.330827067669175e-06, "loss": 0.3974026143550873, "num_input_tokens_seen": 888680, "step": 1170, "train_runtime": 2658.2043, "train_tokens_per_second": 334.316 }, { "epoch": 0.10767816091954023, "grad_norm": 6.526704788208008, "learning_rate": 8.320802005012531e-06, "loss": 0.44288185238838196, "num_input_tokens_seen": 889284, "step": 1171, "train_runtime": 2667.0342, "train_tokens_per_second": 333.436 }, { "epoch": 0.10777011494252874, "grad_norm": 6.377283573150635, "learning_rate": 8.31077694235589e-06, "loss": 0.4232429265975952, "num_input_tokens_seen": 889836, "step": 1172, "train_runtime": 2668.9832, "train_tokens_per_second": 333.399 }, { "epoch": 0.10786206896551724, "grad_norm": 7.443594455718994, "learning_rate": 8.300751879699248e-06, "loss": 0.5917798280715942, "num_input_tokens_seen": 890616, "step": 1173, "train_runtime": 2670.9192, "train_tokens_per_second": 333.449 }, { "epoch": 0.10795402298850575, "grad_norm": 7.515342712402344, "learning_rate": 8.290726817042607e-06, "loss": 0.5746567845344543, "num_input_tokens_seen": 891592, "step": 1174, "train_runtime": 2672.8873, "train_tokens_per_second": 333.569 }, { "epoch": 0.10804597701149425, "grad_norm": 6.263985633850098, "learning_rate": 8.280701754385965e-06, "loss": 0.40477776527404785, "num_input_tokens_seen": 892196, "step": 1175, "train_runtime": 2674.7982, "train_tokens_per_second": 333.556 }, { "epoch": 0.10813793103448276, "grad_norm": 6.493422031402588, "learning_rate": 8.270676691729324e-06, "loss": 0.41471216082572937, "num_input_tokens_seen": 892932, "step": 1176, "train_runtime": 2676.731, "train_tokens_per_second": 333.59 }, { "epoch": 0.10822988505747126, "grad_norm": 10.124730110168457, "learning_rate": 8.260651629072682e-06, "loss": 0.5155556797981262, "num_input_tokens_seen": 893656, "step": 1177, "train_runtime": 2678.6435, "train_tokens_per_second": 333.623 }, { "epoch": 0.10832183908045977, "grad_norm": 6.713027477264404, "learning_rate": 8.25062656641604e-06, "loss": 0.4645010828971863, "num_input_tokens_seen": 894368, "step": 1178, "train_runtime": 2680.5852, "train_tokens_per_second": 333.647 }, { "epoch": 0.10841379310344827, "grad_norm": 7.475142002105713, "learning_rate": 8.2406015037594e-06, "loss": 0.3595820367336273, "num_input_tokens_seen": 894960, "step": 1179, "train_runtime": 2682.5029, "train_tokens_per_second": 333.629 }, { "epoch": 0.10850574712643678, "grad_norm": 8.378244400024414, "learning_rate": 8.230576441102758e-06, "loss": 0.4922295808792114, "num_input_tokens_seen": 895668, "step": 1180, "train_runtime": 2684.4189, "train_tokens_per_second": 333.654 }, { "epoch": 0.10859770114942528, "grad_norm": 7.011902332305908, "learning_rate": 8.220551378446116e-06, "loss": 0.4168221056461334, "num_input_tokens_seen": 896356, "step": 1181, "train_runtime": 2686.3328, "train_tokens_per_second": 333.673 }, { "epoch": 0.10868965517241379, "grad_norm": 7.045474052429199, "learning_rate": 8.210526315789475e-06, "loss": 0.5761998891830444, "num_input_tokens_seen": 897256, "step": 1182, "train_runtime": 2688.2752, "train_tokens_per_second": 333.766 }, { "epoch": 0.10878160919540229, "grad_norm": 7.988003730773926, "learning_rate": 8.200501253132833e-06, "loss": 0.53521728515625, "num_input_tokens_seen": 897932, "step": 1183, "train_runtime": 2690.2398, "train_tokens_per_second": 333.774 }, { "epoch": 0.1088735632183908, "grad_norm": 7.01152229309082, "learning_rate": 8.190476190476192e-06, "loss": 0.4423326551914215, "num_input_tokens_seen": 898776, "step": 1184, "train_runtime": 2692.2319, "train_tokens_per_second": 333.84 }, { "epoch": 0.10896551724137932, "grad_norm": 7.029073238372803, "learning_rate": 8.18045112781955e-06, "loss": 0.5665289163589478, "num_input_tokens_seen": 899572, "step": 1185, "train_runtime": 2694.2814, "train_tokens_per_second": 333.882 }, { "epoch": 0.10905747126436782, "grad_norm": 7.208654403686523, "learning_rate": 8.170426065162907e-06, "loss": 0.3946235775947571, "num_input_tokens_seen": 900160, "step": 1186, "train_runtime": 2696.1993, "train_tokens_per_second": 333.863 }, { "epoch": 0.10914942528735633, "grad_norm": 7.401321887969971, "learning_rate": 8.160401002506266e-06, "loss": 0.5328009724617004, "num_input_tokens_seen": 900812, "step": 1187, "train_runtime": 2698.1093, "train_tokens_per_second": 333.868 }, { "epoch": 0.10924137931034483, "grad_norm": 6.7505879402160645, "learning_rate": 8.150375939849626e-06, "loss": 0.5387961268424988, "num_input_tokens_seen": 901768, "step": 1188, "train_runtime": 2700.0659, "train_tokens_per_second": 333.98 }, { "epoch": 0.10933333333333334, "grad_norm": 6.317501544952393, "learning_rate": 8.140350877192983e-06, "loss": 0.5291674137115479, "num_input_tokens_seen": 902548, "step": 1189, "train_runtime": 2702.0193, "train_tokens_per_second": 334.027 }, { "epoch": 0.10942528735632184, "grad_norm": 7.332826614379883, "learning_rate": 8.130325814536341e-06, "loss": 0.509458601474762, "num_input_tokens_seen": 903644, "step": 1190, "train_runtime": 2704.0013, "train_tokens_per_second": 334.188 }, { "epoch": 0.10951724137931035, "grad_norm": 6.344303131103516, "learning_rate": 8.1203007518797e-06, "loss": 0.40950438380241394, "num_input_tokens_seen": 904380, "step": 1191, "train_runtime": 2705.9656, "train_tokens_per_second": 334.217 }, { "epoch": 0.10960919540229885, "grad_norm": 6.608860015869141, "learning_rate": 8.110275689223058e-06, "loss": 0.4933936893939972, "num_input_tokens_seen": 905072, "step": 1192, "train_runtime": 2707.9096, "train_tokens_per_second": 334.233 }, { "epoch": 0.10970114942528736, "grad_norm": 6.558511734008789, "learning_rate": 8.100250626566416e-06, "loss": 0.5003643035888672, "num_input_tokens_seen": 905848, "step": 1193, "train_runtime": 2709.869, "train_tokens_per_second": 334.277 }, { "epoch": 0.10979310344827586, "grad_norm": 6.844476699829102, "learning_rate": 8.090225563909775e-06, "loss": 0.5392162799835205, "num_input_tokens_seen": 906656, "step": 1194, "train_runtime": 2711.8417, "train_tokens_per_second": 334.332 }, { "epoch": 0.10988505747126437, "grad_norm": 6.837486267089844, "learning_rate": 8.080200501253133e-06, "loss": 0.46220025420188904, "num_input_tokens_seen": 907380, "step": 1195, "train_runtime": 2713.7757, "train_tokens_per_second": 334.361 }, { "epoch": 0.10997701149425287, "grad_norm": 6.648373603820801, "learning_rate": 8.070175438596492e-06, "loss": 0.5654021501541138, "num_input_tokens_seen": 908124, "step": 1196, "train_runtime": 2715.7471, "train_tokens_per_second": 334.392 }, { "epoch": 0.11006896551724138, "grad_norm": 6.451106548309326, "learning_rate": 8.06015037593985e-06, "loss": 0.4598565697669983, "num_input_tokens_seen": 908884, "step": 1197, "train_runtime": 2717.6835, "train_tokens_per_second": 334.433 }, { "epoch": 0.11016091954022988, "grad_norm": 6.6288957595825195, "learning_rate": 8.050125313283209e-06, "loss": 0.4231450855731964, "num_input_tokens_seen": 909656, "step": 1198, "train_runtime": 2719.5952, "train_tokens_per_second": 334.482 }, { "epoch": 0.11025287356321839, "grad_norm": 6.884613513946533, "learning_rate": 8.040100250626567e-06, "loss": 0.5025525689125061, "num_input_tokens_seen": 910616, "step": 1199, "train_runtime": 2721.5412, "train_tokens_per_second": 334.596 }, { "epoch": 0.1103448275862069, "grad_norm": 6.784577369689941, "learning_rate": 8.030075187969926e-06, "loss": 0.4666309356689453, "num_input_tokens_seen": 911164, "step": 1200, "train_runtime": 2723.4617, "train_tokens_per_second": 334.561 }, { "epoch": 0.1103448275862069, "eval_loss": 1.8325949907302856, "eval_runtime": 28.023, "eval_samples_per_second": 35.685, "eval_steps_per_second": 8.921, "num_input_tokens_seen": 911164, "step": 1200 }, { "epoch": 0.1104367816091954, "grad_norm": 7.389218807220459, "learning_rate": 8.020050125313283e-06, "loss": 0.4460408389568329, "num_input_tokens_seen": 911708, "step": 1201, "train_runtime": 2759.9673, "train_tokens_per_second": 330.333 }, { "epoch": 0.1105287356321839, "grad_norm": 6.948616981506348, "learning_rate": 8.010025062656643e-06, "loss": 0.4718795120716095, "num_input_tokens_seen": 912324, "step": 1202, "train_runtime": 2761.8909, "train_tokens_per_second": 330.326 }, { "epoch": 0.11062068965517241, "grad_norm": 6.183836936950684, "learning_rate": 8.000000000000001e-06, "loss": 0.37865975499153137, "num_input_tokens_seen": 913012, "step": 1203, "train_runtime": 2763.9892, "train_tokens_per_second": 330.324 }, { "epoch": 0.11071264367816092, "grad_norm": 6.418726921081543, "learning_rate": 7.989974937343358e-06, "loss": 0.43318432569503784, "num_input_tokens_seen": 913600, "step": 1204, "train_runtime": 2765.9107, "train_tokens_per_second": 330.307 }, { "epoch": 0.11080459770114942, "grad_norm": 6.6056742668151855, "learning_rate": 7.979949874686718e-06, "loss": 0.4426375925540924, "num_input_tokens_seen": 914228, "step": 1205, "train_runtime": 2767.8236, "train_tokens_per_second": 330.306 }, { "epoch": 0.11089655172413793, "grad_norm": 6.80130672454834, "learning_rate": 7.969924812030075e-06, "loss": 0.550324022769928, "num_input_tokens_seen": 914928, "step": 1206, "train_runtime": 2769.7346, "train_tokens_per_second": 330.331 }, { "epoch": 0.11098850574712643, "grad_norm": 6.935859680175781, "learning_rate": 7.959899749373434e-06, "loss": 0.5600872039794922, "num_input_tokens_seen": 915964, "step": 1207, "train_runtime": 2771.7074, "train_tokens_per_second": 330.469 }, { "epoch": 0.11108045977011494, "grad_norm": 6.1385087966918945, "learning_rate": 7.949874686716794e-06, "loss": 0.4273529052734375, "num_input_tokens_seen": 916872, "step": 1208, "train_runtime": 2773.6419, "train_tokens_per_second": 330.566 }, { "epoch": 0.11117241379310344, "grad_norm": 5.904097080230713, "learning_rate": 7.93984962406015e-06, "loss": 0.472692608833313, "num_input_tokens_seen": 917884, "step": 1209, "train_runtime": 2775.6237, "train_tokens_per_second": 330.695 }, { "epoch": 0.11126436781609196, "grad_norm": 7.022626876831055, "learning_rate": 7.929824561403509e-06, "loss": 0.4611586630344391, "num_input_tokens_seen": 918556, "step": 1210, "train_runtime": 2777.5339, "train_tokens_per_second": 330.709 }, { "epoch": 0.11135632183908047, "grad_norm": 6.110097408294678, "learning_rate": 7.919799498746868e-06, "loss": 0.45371317863464355, "num_input_tokens_seen": 919208, "step": 1211, "train_runtime": 2779.4778, "train_tokens_per_second": 330.712 }, { "epoch": 0.11144827586206897, "grad_norm": 6.828897476196289, "learning_rate": 7.909774436090226e-06, "loss": 0.44778716564178467, "num_input_tokens_seen": 919764, "step": 1212, "train_runtime": 2781.3898, "train_tokens_per_second": 330.685 }, { "epoch": 0.11154022988505748, "grad_norm": 7.322358131408691, "learning_rate": 7.899749373433585e-06, "loss": 0.4146677851676941, "num_input_tokens_seen": 920636, "step": 1213, "train_runtime": 2783.3356, "train_tokens_per_second": 330.767 }, { "epoch": 0.11163218390804598, "grad_norm": 7.033532619476318, "learning_rate": 7.889724310776943e-06, "loss": 0.5266438126564026, "num_input_tokens_seen": 921500, "step": 1214, "train_runtime": 2785.2893, "train_tokens_per_second": 330.845 }, { "epoch": 0.11172413793103449, "grad_norm": 6.854131698608398, "learning_rate": 7.879699248120301e-06, "loss": 0.38787639141082764, "num_input_tokens_seen": 922152, "step": 1215, "train_runtime": 2787.2151, "train_tokens_per_second": 330.851 }, { "epoch": 0.11181609195402299, "grad_norm": 5.913403034210205, "learning_rate": 7.86967418546366e-06, "loss": 0.4330481290817261, "num_input_tokens_seen": 922832, "step": 1216, "train_runtime": 2789.1347, "train_tokens_per_second": 330.867 }, { "epoch": 0.1119080459770115, "grad_norm": 6.958983421325684, "learning_rate": 7.859649122807018e-06, "loss": 0.5390165448188782, "num_input_tokens_seen": 924340, "step": 1217, "train_runtime": 2791.1779, "train_tokens_per_second": 331.165 }, { "epoch": 0.112, "grad_norm": 6.044406890869141, "learning_rate": 7.849624060150377e-06, "loss": 0.3765028715133667, "num_input_tokens_seen": 925084, "step": 1218, "train_runtime": 2793.1356, "train_tokens_per_second": 331.199 }, { "epoch": 0.11209195402298851, "grad_norm": 6.692909240722656, "learning_rate": 7.839598997493735e-06, "loss": 0.4812348484992981, "num_input_tokens_seen": 925720, "step": 1219, "train_runtime": 2795.0454, "train_tokens_per_second": 331.2 }, { "epoch": 0.11218390804597701, "grad_norm": 5.939342498779297, "learning_rate": 7.829573934837094e-06, "loss": 0.3884960412979126, "num_input_tokens_seen": 926544, "step": 1220, "train_runtime": 2796.9973, "train_tokens_per_second": 331.264 }, { "epoch": 0.11227586206896552, "grad_norm": 5.711117267608643, "learning_rate": 7.81954887218045e-06, "loss": 0.38959741592407227, "num_input_tokens_seen": 927772, "step": 1221, "train_runtime": 2799.0019, "train_tokens_per_second": 331.465 }, { "epoch": 0.11236781609195402, "grad_norm": 6.349226951599121, "learning_rate": 7.809523809523811e-06, "loss": 0.4741501212120056, "num_input_tokens_seen": 928452, "step": 1222, "train_runtime": 2800.9274, "train_tokens_per_second": 331.48 }, { "epoch": 0.11245977011494253, "grad_norm": 6.910517692565918, "learning_rate": 7.79949874686717e-06, "loss": 0.46652236580848694, "num_input_tokens_seen": 929504, "step": 1223, "train_runtime": 2802.9518, "train_tokens_per_second": 331.616 }, { "epoch": 0.11255172413793103, "grad_norm": 6.269015789031982, "learning_rate": 7.789473684210526e-06, "loss": 0.4816398620605469, "num_input_tokens_seen": 930964, "step": 1224, "train_runtime": 2804.9737, "train_tokens_per_second": 331.898 }, { "epoch": 0.11264367816091954, "grad_norm": 6.046663284301758, "learning_rate": 7.779448621553886e-06, "loss": 0.42682701349258423, "num_input_tokens_seen": 931808, "step": 1225, "train_runtime": 2806.9188, "train_tokens_per_second": 331.968 }, { "epoch": 0.11273563218390804, "grad_norm": 8.843550682067871, "learning_rate": 7.769423558897243e-06, "loss": 0.4442460238933563, "num_input_tokens_seen": 932388, "step": 1226, "train_runtime": 2808.826, "train_tokens_per_second": 331.949 }, { "epoch": 0.11282758620689655, "grad_norm": 7.7472357749938965, "learning_rate": 7.759398496240602e-06, "loss": 0.5236173868179321, "num_input_tokens_seen": 933988, "step": 1227, "train_runtime": 2810.8848, "train_tokens_per_second": 332.275 }, { "epoch": 0.11291954022988505, "grad_norm": 6.5638508796691895, "learning_rate": 7.749373433583962e-06, "loss": 0.45537734031677246, "num_input_tokens_seen": 934712, "step": 1228, "train_runtime": 2812.798, "train_tokens_per_second": 332.307 }, { "epoch": 0.11301149425287356, "grad_norm": 6.816479682922363, "learning_rate": 7.739348370927319e-06, "loss": 0.572117269039154, "num_input_tokens_seen": 935404, "step": 1229, "train_runtime": 2814.708, "train_tokens_per_second": 332.327 }, { "epoch": 0.11310344827586206, "grad_norm": 6.51023530960083, "learning_rate": 7.729323308270677e-06, "loss": 0.4204486906528473, "num_input_tokens_seen": 936116, "step": 1230, "train_runtime": 2816.6454, "train_tokens_per_second": 332.351 }, { "epoch": 0.11319540229885057, "grad_norm": 6.704290866851807, "learning_rate": 7.719298245614036e-06, "loss": 0.4270913600921631, "num_input_tokens_seen": 936816, "step": 1231, "train_runtime": 2825.1471, "train_tokens_per_second": 331.599 }, { "epoch": 0.11328735632183908, "grad_norm": 6.436280250549316, "learning_rate": 7.709273182957394e-06, "loss": 0.41451695561408997, "num_input_tokens_seen": 938312, "step": 1232, "train_runtime": 2827.191, "train_tokens_per_second": 331.888 }, { "epoch": 0.11337931034482758, "grad_norm": 5.83052921295166, "learning_rate": 7.699248120300753e-06, "loss": 0.38611364364624023, "num_input_tokens_seen": 938952, "step": 1233, "train_runtime": 2829.2456, "train_tokens_per_second": 331.874 }, { "epoch": 0.11347126436781609, "grad_norm": 6.24282169342041, "learning_rate": 7.689223057644111e-06, "loss": 0.36962324380874634, "num_input_tokens_seen": 939560, "step": 1234, "train_runtime": 2831.1614, "train_tokens_per_second": 331.864 }, { "epoch": 0.1135632183908046, "grad_norm": 5.778984069824219, "learning_rate": 7.67919799498747e-06, "loss": 0.3523557782173157, "num_input_tokens_seen": 940188, "step": 1235, "train_runtime": 2833.0813, "train_tokens_per_second": 331.861 }, { "epoch": 0.11365517241379311, "grad_norm": 7.877459526062012, "learning_rate": 7.669172932330828e-06, "loss": 0.6218960881233215, "num_input_tokens_seen": 940956, "step": 1236, "train_runtime": 2835.0017, "train_tokens_per_second": 331.907 }, { "epoch": 0.11374712643678161, "grad_norm": 6.774043560028076, "learning_rate": 7.659147869674187e-06, "loss": 0.42774122953414917, "num_input_tokens_seen": 941708, "step": 1237, "train_runtime": 2836.9211, "train_tokens_per_second": 331.947 }, { "epoch": 0.11383908045977012, "grad_norm": 6.163104057312012, "learning_rate": 7.649122807017545e-06, "loss": 0.42159563302993774, "num_input_tokens_seen": 942544, "step": 1238, "train_runtime": 2838.8814, "train_tokens_per_second": 332.012 }, { "epoch": 0.11393103448275863, "grad_norm": 7.027411937713623, "learning_rate": 7.639097744360904e-06, "loss": 0.4619765281677246, "num_input_tokens_seen": 943472, "step": 1239, "train_runtime": 2840.8528, "train_tokens_per_second": 332.109 }, { "epoch": 0.11402298850574713, "grad_norm": 6.717901229858398, "learning_rate": 7.629072681704261e-06, "loss": 0.4811328053474426, "num_input_tokens_seen": 944436, "step": 1240, "train_runtime": 2842.8124, "train_tokens_per_second": 332.219 }, { "epoch": 0.11411494252873564, "grad_norm": 7.712195873260498, "learning_rate": 7.61904761904762e-06, "loss": 0.4902462065219879, "num_input_tokens_seen": 945216, "step": 1241, "train_runtime": 2844.7583, "train_tokens_per_second": 332.266 }, { "epoch": 0.11420689655172414, "grad_norm": 6.58721399307251, "learning_rate": 7.609022556390978e-06, "loss": 0.41334906220436096, "num_input_tokens_seen": 945764, "step": 1242, "train_runtime": 2846.6615, "train_tokens_per_second": 332.236 }, { "epoch": 0.11429885057471265, "grad_norm": 5.698861122131348, "learning_rate": 7.598997493734337e-06, "loss": 0.3368165194988251, "num_input_tokens_seen": 946316, "step": 1243, "train_runtime": 2848.564, "train_tokens_per_second": 332.208 }, { "epoch": 0.11439080459770115, "grad_norm": 7.710287094116211, "learning_rate": 7.588972431077694e-06, "loss": 0.5103346705436707, "num_input_tokens_seen": 947040, "step": 1244, "train_runtime": 2850.4722, "train_tokens_per_second": 332.24 }, { "epoch": 0.11448275862068966, "grad_norm": 6.46506929397583, "learning_rate": 7.578947368421054e-06, "loss": 0.3795013129711151, "num_input_tokens_seen": 947764, "step": 1245, "train_runtime": 2852.3874, "train_tokens_per_second": 332.27 }, { "epoch": 0.11457471264367816, "grad_norm": 5.176570415496826, "learning_rate": 7.568922305764411e-06, "loss": 0.3259194791316986, "num_input_tokens_seen": 948872, "step": 1246, "train_runtime": 2854.3658, "train_tokens_per_second": 332.428 }, { "epoch": 0.11466666666666667, "grad_norm": 6.8006391525268555, "learning_rate": 7.55889724310777e-06, "loss": 0.487837016582489, "num_input_tokens_seen": 949640, "step": 1247, "train_runtime": 2856.3058, "train_tokens_per_second": 332.471 }, { "epoch": 0.11475862068965517, "grad_norm": 7.8169379234313965, "learning_rate": 7.548872180451129e-06, "loss": 0.47706305980682373, "num_input_tokens_seen": 950192, "step": 1248, "train_runtime": 2858.2077, "train_tokens_per_second": 332.443 }, { "epoch": 0.11485057471264368, "grad_norm": 7.041769027709961, "learning_rate": 7.538847117794487e-06, "loss": 0.5111751556396484, "num_input_tokens_seen": 952244, "step": 1249, "train_runtime": 2860.3189, "train_tokens_per_second": 332.915 }, { "epoch": 0.11494252873563218, "grad_norm": 8.484130859375, "learning_rate": 7.528822055137845e-06, "loss": 0.3944612145423889, "num_input_tokens_seen": 952840, "step": 1250, "train_runtime": 2862.29, "train_tokens_per_second": 332.894 }, { "epoch": 0.11503448275862069, "grad_norm": 7.208199977874756, "learning_rate": 7.518796992481203e-06, "loss": 0.453296035528183, "num_input_tokens_seen": 953632, "step": 1251, "train_runtime": 2864.3212, "train_tokens_per_second": 332.935 }, { "epoch": 0.11512643678160919, "grad_norm": 5.981998920440674, "learning_rate": 7.508771929824562e-06, "loss": 0.4200296700000763, "num_input_tokens_seen": 954248, "step": 1252, "train_runtime": 2866.3438, "train_tokens_per_second": 332.915 }, { "epoch": 0.1152183908045977, "grad_norm": 6.765686988830566, "learning_rate": 7.498746867167921e-06, "loss": 0.63531893491745, "num_input_tokens_seen": 955628, "step": 1253, "train_runtime": 2868.3814, "train_tokens_per_second": 333.159 }, { "epoch": 0.1153103448275862, "grad_norm": 6.0461578369140625, "learning_rate": 7.488721804511278e-06, "loss": 0.37273716926574707, "num_input_tokens_seen": 956296, "step": 1254, "train_runtime": 2870.2817, "train_tokens_per_second": 333.171 }, { "epoch": 0.11540229885057471, "grad_norm": 6.15737247467041, "learning_rate": 7.478696741854638e-06, "loss": 0.4166964590549469, "num_input_tokens_seen": 956992, "step": 1255, "train_runtime": 2872.2439, "train_tokens_per_second": 333.186 }, { "epoch": 0.11549425287356321, "grad_norm": 7.3590288162231445, "learning_rate": 7.468671679197995e-06, "loss": 0.48610079288482666, "num_input_tokens_seen": 957616, "step": 1256, "train_runtime": 2874.151, "train_tokens_per_second": 333.182 }, { "epoch": 0.11558620689655172, "grad_norm": 7.055130958557129, "learning_rate": 7.458646616541354e-06, "loss": 0.4384363889694214, "num_input_tokens_seen": 958360, "step": 1257, "train_runtime": 2876.094, "train_tokens_per_second": 333.216 }, { "epoch": 0.11567816091954022, "grad_norm": 6.699975967407227, "learning_rate": 7.448621553884713e-06, "loss": 0.5209221243858337, "num_input_tokens_seen": 958952, "step": 1258, "train_runtime": 2878.0156, "train_tokens_per_second": 333.199 }, { "epoch": 0.11577011494252873, "grad_norm": 6.583015441894531, "learning_rate": 7.438596491228071e-06, "loss": 0.49776387214660645, "num_input_tokens_seen": 959580, "step": 1259, "train_runtime": 2879.9265, "train_tokens_per_second": 333.196 }, { "epoch": 0.11586206896551725, "grad_norm": 7.058274745941162, "learning_rate": 7.428571428571429e-06, "loss": 0.5116837620735168, "num_input_tokens_seen": 960348, "step": 1260, "train_runtime": 2881.8483, "train_tokens_per_second": 333.24 }, { "epoch": 0.11595402298850575, "grad_norm": 8.371155738830566, "learning_rate": 7.418546365914787e-06, "loss": 0.6046146154403687, "num_input_tokens_seen": 961084, "step": 1261, "train_runtime": 2890.2659, "train_tokens_per_second": 332.524 }, { "epoch": 0.11604597701149426, "grad_norm": 6.7046427726745605, "learning_rate": 7.408521303258146e-06, "loss": 0.43961718678474426, "num_input_tokens_seen": 961840, "step": 1262, "train_runtime": 2892.1769, "train_tokens_per_second": 332.566 }, { "epoch": 0.11613793103448276, "grad_norm": 6.21190071105957, "learning_rate": 7.398496240601505e-06, "loss": 0.45463913679122925, "num_input_tokens_seen": 962788, "step": 1263, "train_runtime": 2894.2452, "train_tokens_per_second": 332.656 }, { "epoch": 0.11622988505747127, "grad_norm": 7.1875152587890625, "learning_rate": 7.388471177944862e-06, "loss": 0.5096670389175415, "num_input_tokens_seen": 963580, "step": 1264, "train_runtime": 2896.1827, "train_tokens_per_second": 332.707 }, { "epoch": 0.11632183908045977, "grad_norm": 6.639959812164307, "learning_rate": 7.378446115288222e-06, "loss": 0.49722224473953247, "num_input_tokens_seen": 964224, "step": 1265, "train_runtime": 2898.0953, "train_tokens_per_second": 332.71 }, { "epoch": 0.11641379310344828, "grad_norm": 6.688169002532959, "learning_rate": 7.368421052631579e-06, "loss": 0.45049408078193665, "num_input_tokens_seen": 964752, "step": 1266, "train_runtime": 2900.0519, "train_tokens_per_second": 332.667 }, { "epoch": 0.11650574712643678, "grad_norm": 5.245498180389404, "learning_rate": 7.358395989974938e-06, "loss": 0.35358959436416626, "num_input_tokens_seen": 965900, "step": 1267, "train_runtime": 2902.0334, "train_tokens_per_second": 332.836 }, { "epoch": 0.11659770114942529, "grad_norm": 6.420312404632568, "learning_rate": 7.348370927318297e-06, "loss": 0.3846766948699951, "num_input_tokens_seen": 966436, "step": 1268, "train_runtime": 2903.9291, "train_tokens_per_second": 332.803 }, { "epoch": 0.1166896551724138, "grad_norm": 5.828828811645508, "learning_rate": 7.338345864661655e-06, "loss": 0.39027321338653564, "num_input_tokens_seen": 967100, "step": 1269, "train_runtime": 2905.8341, "train_tokens_per_second": 332.813 }, { "epoch": 0.1167816091954023, "grad_norm": 7.703383445739746, "learning_rate": 7.328320802005013e-06, "loss": 0.5670377016067505, "num_input_tokens_seen": 968004, "step": 1270, "train_runtime": 2907.7779, "train_tokens_per_second": 332.902 }, { "epoch": 0.1168735632183908, "grad_norm": 7.101981163024902, "learning_rate": 7.318295739348371e-06, "loss": 0.5447335243225098, "num_input_tokens_seen": 968724, "step": 1271, "train_runtime": 2909.743, "train_tokens_per_second": 332.924 }, { "epoch": 0.11696551724137931, "grad_norm": 7.2557172775268555, "learning_rate": 7.30827067669173e-06, "loss": 0.4155055582523346, "num_input_tokens_seen": 969320, "step": 1272, "train_runtime": 2911.651, "train_tokens_per_second": 332.911 }, { "epoch": 0.11705747126436782, "grad_norm": 6.135560989379883, "learning_rate": 7.298245614035089e-06, "loss": 0.39388903975486755, "num_input_tokens_seen": 970140, "step": 1273, "train_runtime": 2913.5828, "train_tokens_per_second": 332.971 }, { "epoch": 0.11714942528735632, "grad_norm": 6.169620037078857, "learning_rate": 7.288220551378446e-06, "loss": 0.41742026805877686, "num_input_tokens_seen": 970768, "step": 1274, "train_runtime": 2915.4927, "train_tokens_per_second": 332.969 }, { "epoch": 0.11724137931034483, "grad_norm": 6.049920558929443, "learning_rate": 7.278195488721806e-06, "loss": 0.4158029854297638, "num_input_tokens_seen": 971812, "step": 1275, "train_runtime": 2917.4721, "train_tokens_per_second": 333.101 }, { "epoch": 0.11733333333333333, "grad_norm": 6.8199944496154785, "learning_rate": 7.268170426065163e-06, "loss": 0.4261828660964966, "num_input_tokens_seen": 972356, "step": 1276, "train_runtime": 2919.374, "train_tokens_per_second": 333.07 }, { "epoch": 0.11742528735632184, "grad_norm": 6.459235668182373, "learning_rate": 7.258145363408522e-06, "loss": 0.4272160828113556, "num_input_tokens_seen": 973120, "step": 1277, "train_runtime": 2921.3163, "train_tokens_per_second": 333.11 }, { "epoch": 0.11751724137931034, "grad_norm": 6.01685905456543, "learning_rate": 7.248120300751881e-06, "loss": 0.3409920632839203, "num_input_tokens_seen": 973756, "step": 1278, "train_runtime": 2923.2171, "train_tokens_per_second": 333.111 }, { "epoch": 0.11760919540229885, "grad_norm": 6.02919340133667, "learning_rate": 7.238095238095239e-06, "loss": 0.39888471364974976, "num_input_tokens_seen": 974424, "step": 1279, "train_runtime": 2925.1221, "train_tokens_per_second": 333.123 }, { "epoch": 0.11770114942528735, "grad_norm": 6.491978168487549, "learning_rate": 7.228070175438597e-06, "loss": 0.4698963463306427, "num_input_tokens_seen": 975280, "step": 1280, "train_runtime": 2927.059, "train_tokens_per_second": 333.195 }, { "epoch": 0.11779310344827586, "grad_norm": 7.6572418212890625, "learning_rate": 7.218045112781955e-06, "loss": 0.5386727452278137, "num_input_tokens_seen": 975904, "step": 1281, "train_runtime": 2928.9553, "train_tokens_per_second": 333.192 }, { "epoch": 0.11788505747126436, "grad_norm": 7.648731231689453, "learning_rate": 7.208020050125314e-06, "loss": 0.4813305735588074, "num_input_tokens_seen": 976560, "step": 1282, "train_runtime": 2930.8896, "train_tokens_per_second": 333.196 }, { "epoch": 0.11797701149425287, "grad_norm": 6.699535369873047, "learning_rate": 7.197994987468673e-06, "loss": 0.5627443194389343, "num_input_tokens_seen": 977800, "step": 1283, "train_runtime": 2932.8772, "train_tokens_per_second": 333.393 }, { "epoch": 0.11806896551724137, "grad_norm": 6.436405658721924, "learning_rate": 7.18796992481203e-06, "loss": 0.3652324676513672, "num_input_tokens_seen": 978380, "step": 1284, "train_runtime": 2934.78, "train_tokens_per_second": 333.374 }, { "epoch": 0.11816091954022989, "grad_norm": 6.360345363616943, "learning_rate": 7.17794486215539e-06, "loss": 0.41607725620269775, "num_input_tokens_seen": 979136, "step": 1285, "train_runtime": 2936.7313, "train_tokens_per_second": 333.41 }, { "epoch": 0.1182528735632184, "grad_norm": 7.502152919769287, "learning_rate": 7.167919799498747e-06, "loss": 0.47135108709335327, "num_input_tokens_seen": 979696, "step": 1286, "train_runtime": 2938.6534, "train_tokens_per_second": 333.383 }, { "epoch": 0.1183448275862069, "grad_norm": 7.678892612457275, "learning_rate": 7.157894736842106e-06, "loss": 0.5936618447303772, "num_input_tokens_seen": 980712, "step": 1287, "train_runtime": 2940.641, "train_tokens_per_second": 333.503 }, { "epoch": 0.11843678160919541, "grad_norm": 7.467742919921875, "learning_rate": 7.147869674185464e-06, "loss": 0.48023247718811035, "num_input_tokens_seen": 981540, "step": 1288, "train_runtime": 2942.6101, "train_tokens_per_second": 333.561 }, { "epoch": 0.11852873563218391, "grad_norm": 7.7129716873168945, "learning_rate": 7.137844611528823e-06, "loss": 0.4181150794029236, "num_input_tokens_seen": 982072, "step": 1289, "train_runtime": 2944.5141, "train_tokens_per_second": 333.526 }, { "epoch": 0.11862068965517242, "grad_norm": 5.898501873016357, "learning_rate": 7.127819548872181e-06, "loss": 0.405730277299881, "num_input_tokens_seen": 982752, "step": 1290, "train_runtime": 2946.4299, "train_tokens_per_second": 333.54 }, { "epoch": 0.11871264367816092, "grad_norm": 7.654778957366943, "learning_rate": 7.117794486215539e-06, "loss": 0.45681047439575195, "num_input_tokens_seen": 983404, "step": 1291, "train_runtime": 2954.6326, "train_tokens_per_second": 332.835 }, { "epoch": 0.11880459770114943, "grad_norm": 6.504164218902588, "learning_rate": 7.107769423558898e-06, "loss": 0.4210878014564514, "num_input_tokens_seen": 984096, "step": 1292, "train_runtime": 2956.5496, "train_tokens_per_second": 332.853 }, { "epoch": 0.11889655172413793, "grad_norm": 6.645524501800537, "learning_rate": 7.097744360902257e-06, "loss": 0.5178579092025757, "num_input_tokens_seen": 984968, "step": 1293, "train_runtime": 2958.6199, "train_tokens_per_second": 332.915 }, { "epoch": 0.11898850574712644, "grad_norm": 7.195277690887451, "learning_rate": 7.087719298245614e-06, "loss": 0.4999891519546509, "num_input_tokens_seen": 985684, "step": 1294, "train_runtime": 2960.5407, "train_tokens_per_second": 332.941 }, { "epoch": 0.11908045977011494, "grad_norm": 8.545036315917969, "learning_rate": 7.077694235588973e-06, "loss": 0.4457113444805145, "num_input_tokens_seen": 986236, "step": 1295, "train_runtime": 2962.4355, "train_tokens_per_second": 332.914 }, { "epoch": 0.11917241379310345, "grad_norm": 6.367618083953857, "learning_rate": 7.067669172932331e-06, "loss": 0.39394238591194153, "num_input_tokens_seen": 987160, "step": 1296, "train_runtime": 2964.3753, "train_tokens_per_second": 333.008 }, { "epoch": 0.11926436781609195, "grad_norm": 6.343026161193848, "learning_rate": 7.05764411027569e-06, "loss": 0.46257346868515015, "num_input_tokens_seen": 987916, "step": 1297, "train_runtime": 2966.2829, "train_tokens_per_second": 333.048 }, { "epoch": 0.11935632183908046, "grad_norm": 6.313677787780762, "learning_rate": 7.047619047619048e-06, "loss": 0.4674181342124939, "num_input_tokens_seen": 988696, "step": 1298, "train_runtime": 2968.2228, "train_tokens_per_second": 333.094 }, { "epoch": 0.11944827586206896, "grad_norm": 6.0055670738220215, "learning_rate": 7.037593984962407e-06, "loss": 0.4524652361869812, "num_input_tokens_seen": 989496, "step": 1299, "train_runtime": 2970.1839, "train_tokens_per_second": 333.143 }, { "epoch": 0.11954022988505747, "grad_norm": 7.333286285400391, "learning_rate": 7.027568922305765e-06, "loss": 0.501343846321106, "num_input_tokens_seen": 990224, "step": 1300, "train_runtime": 2972.139, "train_tokens_per_second": 333.169 }, { "epoch": 0.11963218390804597, "grad_norm": 6.726962089538574, "learning_rate": 7.017543859649123e-06, "loss": 0.42660602927207947, "num_input_tokens_seen": 991196, "step": 1301, "train_runtime": 2974.1136, "train_tokens_per_second": 333.274 }, { "epoch": 0.11972413793103448, "grad_norm": 7.37306022644043, "learning_rate": 7.0075187969924815e-06, "loss": 0.5156997442245483, "num_input_tokens_seen": 991896, "step": 1302, "train_runtime": 2976.0606, "train_tokens_per_second": 333.292 }, { "epoch": 0.11981609195402299, "grad_norm": 5.937094688415527, "learning_rate": 6.997493734335841e-06, "loss": 0.4371004104614258, "num_input_tokens_seen": 992536, "step": 1303, "train_runtime": 2978.0514, "train_tokens_per_second": 333.284 }, { "epoch": 0.11990804597701149, "grad_norm": 7.102948188781738, "learning_rate": 6.9874686716791984e-06, "loss": 0.5632842183113098, "num_input_tokens_seen": 993284, "step": 1304, "train_runtime": 2979.9936, "train_tokens_per_second": 333.317 }, { "epoch": 0.12, "grad_norm": 7.164879322052002, "learning_rate": 6.977443609022557e-06, "loss": 0.6001710891723633, "num_input_tokens_seen": 994356, "step": 1305, "train_runtime": 2981.9767, "train_tokens_per_second": 333.455 }, { "epoch": 0.1200919540229885, "grad_norm": 7.405031681060791, "learning_rate": 6.9674185463659146e-06, "loss": 0.5065048933029175, "num_input_tokens_seen": 995140, "step": 1306, "train_runtime": 2983.9312, "train_tokens_per_second": 333.5 }, { "epoch": 0.120183908045977, "grad_norm": 6.406159400939941, "learning_rate": 6.957393483709274e-06, "loss": 0.49356621503829956, "num_input_tokens_seen": 995996, "step": 1307, "train_runtime": 2985.8675, "train_tokens_per_second": 333.57 }, { "epoch": 0.12027586206896551, "grad_norm": 7.691381931304932, "learning_rate": 6.947368421052632e-06, "loss": 0.5442687273025513, "num_input_tokens_seen": 996680, "step": 1308, "train_runtime": 2987.7861, "train_tokens_per_second": 333.585 }, { "epoch": 0.12036781609195402, "grad_norm": 6.470928192138672, "learning_rate": 6.93734335839599e-06, "loss": 0.4957112669944763, "num_input_tokens_seen": 997352, "step": 1309, "train_runtime": 2989.7051, "train_tokens_per_second": 333.595 }, { "epoch": 0.12045977011494254, "grad_norm": 6.938445568084717, "learning_rate": 6.927318295739349e-06, "loss": 0.47365546226501465, "num_input_tokens_seen": 998180, "step": 1310, "train_runtime": 2991.6573, "train_tokens_per_second": 333.655 }, { "epoch": 0.12055172413793104, "grad_norm": 7.241644382476807, "learning_rate": 6.917293233082707e-06, "loss": 0.5160254240036011, "num_input_tokens_seen": 999008, "step": 1311, "train_runtime": 2993.5955, "train_tokens_per_second": 333.715 }, { "epoch": 0.12064367816091955, "grad_norm": 6.897066116333008, "learning_rate": 6.9072681704260655e-06, "loss": 0.41822683811187744, "num_input_tokens_seen": 999748, "step": 1312, "train_runtime": 2995.5064, "train_tokens_per_second": 333.749 }, { "epoch": 0.12073563218390805, "grad_norm": 6.118927955627441, "learning_rate": 6.897243107769425e-06, "loss": 0.4357345700263977, "num_input_tokens_seen": 1000256, "step": 1313, "train_runtime": 2997.4297, "train_tokens_per_second": 333.705 }, { "epoch": 0.12082758620689656, "grad_norm": 6.424326419830322, "learning_rate": 6.8872180451127825e-06, "loss": 0.40614956617355347, "num_input_tokens_seen": 1000924, "step": 1314, "train_runtime": 2999.3728, "train_tokens_per_second": 333.711 }, { "epoch": 0.12091954022988506, "grad_norm": 6.810154438018799, "learning_rate": 6.877192982456141e-06, "loss": 0.4233674108982086, "num_input_tokens_seen": 1001508, "step": 1315, "train_runtime": 3001.2942, "train_tokens_per_second": 333.692 }, { "epoch": 0.12101149425287357, "grad_norm": 7.00108528137207, "learning_rate": 6.867167919799499e-06, "loss": 0.5287919044494629, "num_input_tokens_seen": 1002272, "step": 1316, "train_runtime": 3003.2455, "train_tokens_per_second": 333.73 }, { "epoch": 0.12110344827586207, "grad_norm": 6.731994152069092, "learning_rate": 6.857142857142858e-06, "loss": 0.47859540581703186, "num_input_tokens_seen": 1002940, "step": 1317, "train_runtime": 3005.1695, "train_tokens_per_second": 333.738 }, { "epoch": 0.12119540229885058, "grad_norm": 6.614876747131348, "learning_rate": 6.847117794486216e-06, "loss": 0.4953509569168091, "num_input_tokens_seen": 1003656, "step": 1318, "train_runtime": 3007.118, "train_tokens_per_second": 333.76 }, { "epoch": 0.12128735632183908, "grad_norm": 6.834334373474121, "learning_rate": 6.837092731829574e-06, "loss": 0.45668864250183105, "num_input_tokens_seen": 1004560, "step": 1319, "train_runtime": 3009.0766, "train_tokens_per_second": 333.843 }, { "epoch": 0.12137931034482759, "grad_norm": 6.399694919586182, "learning_rate": 6.827067669172933e-06, "loss": 0.4552806615829468, "num_input_tokens_seen": 1005216, "step": 1320, "train_runtime": 3010.9833, "train_tokens_per_second": 333.85 }, { "epoch": 0.12147126436781609, "grad_norm": 6.645393371582031, "learning_rate": 6.817042606516291e-06, "loss": 0.4933241009712219, "num_input_tokens_seen": 1006024, "step": 1321, "train_runtime": 3019.5186, "train_tokens_per_second": 333.174 }, { "epoch": 0.1215632183908046, "grad_norm": 6.884487628936768, "learning_rate": 6.8070175438596495e-06, "loss": 0.5027730464935303, "num_input_tokens_seen": 1006796, "step": 1322, "train_runtime": 3021.5673, "train_tokens_per_second": 333.203 }, { "epoch": 0.1216551724137931, "grad_norm": 6.07246732711792, "learning_rate": 6.796992481203009e-06, "loss": 0.4355407953262329, "num_input_tokens_seen": 1007412, "step": 1323, "train_runtime": 3023.4839, "train_tokens_per_second": 333.196 }, { "epoch": 0.12174712643678161, "grad_norm": 6.737724304199219, "learning_rate": 6.7869674185463665e-06, "loss": 0.3820093274116516, "num_input_tokens_seen": 1008040, "step": 1324, "train_runtime": 3025.3977, "train_tokens_per_second": 333.193 }, { "epoch": 0.12183908045977011, "grad_norm": 6.211243152618408, "learning_rate": 6.776942355889725e-06, "loss": 0.41384297609329224, "num_input_tokens_seen": 1008664, "step": 1325, "train_runtime": 3027.3225, "train_tokens_per_second": 333.187 }, { "epoch": 0.12193103448275862, "grad_norm": 7.142533302307129, "learning_rate": 6.766917293233083e-06, "loss": 0.5230511426925659, "num_input_tokens_seen": 1009344, "step": 1326, "train_runtime": 3029.2401, "train_tokens_per_second": 333.2 }, { "epoch": 0.12202298850574712, "grad_norm": 7.864989280700684, "learning_rate": 6.756892230576442e-06, "loss": 0.48035430908203125, "num_input_tokens_seen": 1009924, "step": 1327, "train_runtime": 3031.1697, "train_tokens_per_second": 333.18 }, { "epoch": 0.12211494252873563, "grad_norm": 5.697092056274414, "learning_rate": 6.7468671679198004e-06, "loss": 0.35426461696624756, "num_input_tokens_seen": 1010496, "step": 1328, "train_runtime": 3033.1224, "train_tokens_per_second": 333.154 }, { "epoch": 0.12220689655172413, "grad_norm": 5.4057769775390625, "learning_rate": 6.736842105263158e-06, "loss": 0.36207208037376404, "num_input_tokens_seen": 1012652, "step": 1329, "train_runtime": 3035.3075, "train_tokens_per_second": 333.624 }, { "epoch": 0.12229885057471264, "grad_norm": 6.612935543060303, "learning_rate": 6.726817042606517e-06, "loss": 0.390036404132843, "num_input_tokens_seen": 1013384, "step": 1330, "train_runtime": 3037.2674, "train_tokens_per_second": 333.65 }, { "epoch": 0.12239080459770114, "grad_norm": 6.282397270202637, "learning_rate": 6.716791979949875e-06, "loss": 0.5557735562324524, "num_input_tokens_seen": 1014008, "step": 1331, "train_runtime": 3039.2309, "train_tokens_per_second": 333.64 }, { "epoch": 0.12248275862068965, "grad_norm": 7.2630205154418945, "learning_rate": 6.7067669172932335e-06, "loss": 0.5023081302642822, "num_input_tokens_seen": 1014708, "step": 1332, "train_runtime": 3041.2158, "train_tokens_per_second": 333.652 }, { "epoch": 0.12257471264367815, "grad_norm": 7.504981517791748, "learning_rate": 6.696741854636593e-06, "loss": 0.5782328248023987, "num_input_tokens_seen": 1015332, "step": 1333, "train_runtime": 3043.1424, "train_tokens_per_second": 333.646 }, { "epoch": 0.12266666666666666, "grad_norm": 7.2758469581604, "learning_rate": 6.6867167919799505e-06, "loss": 0.5410507917404175, "num_input_tokens_seen": 1016096, "step": 1334, "train_runtime": 3045.0864, "train_tokens_per_second": 333.684 }, { "epoch": 0.12275862068965518, "grad_norm": 6.432806491851807, "learning_rate": 6.676691729323309e-06, "loss": 0.4315190315246582, "num_input_tokens_seen": 1016772, "step": 1335, "train_runtime": 3047.0245, "train_tokens_per_second": 333.693 }, { "epoch": 0.12285057471264368, "grad_norm": 6.5717949867248535, "learning_rate": 6.666666666666667e-06, "loss": 0.4417974650859833, "num_input_tokens_seen": 1017432, "step": 1336, "train_runtime": 3048.9766, "train_tokens_per_second": 333.696 }, { "epoch": 0.12294252873563219, "grad_norm": 6.500550270080566, "learning_rate": 6.656641604010026e-06, "loss": 0.4049522578716278, "num_input_tokens_seen": 1018016, "step": 1337, "train_runtime": 3050.8932, "train_tokens_per_second": 333.678 }, { "epoch": 0.1230344827586207, "grad_norm": 6.5369133949279785, "learning_rate": 6.6466165413533845e-06, "loss": 0.5170691013336182, "num_input_tokens_seen": 1018748, "step": 1338, "train_runtime": 3052.8676, "train_tokens_per_second": 333.702 }, { "epoch": 0.1231264367816092, "grad_norm": 6.739131450653076, "learning_rate": 6.636591478696742e-06, "loss": 0.4723159372806549, "num_input_tokens_seen": 1019424, "step": 1339, "train_runtime": 3054.7944, "train_tokens_per_second": 333.713 }, { "epoch": 0.1232183908045977, "grad_norm": 6.277287006378174, "learning_rate": 6.6265664160401014e-06, "loss": 0.4405796527862549, "num_input_tokens_seen": 1020172, "step": 1340, "train_runtime": 3056.7242, "train_tokens_per_second": 333.747 }, { "epoch": 0.12331034482758621, "grad_norm": 7.16923189163208, "learning_rate": 6.616541353383459e-06, "loss": 0.5072904229164124, "num_input_tokens_seen": 1020976, "step": 1341, "train_runtime": 3058.6876, "train_tokens_per_second": 333.795 }, { "epoch": 0.12340229885057472, "grad_norm": 7.278201103210449, "learning_rate": 6.6065162907268176e-06, "loss": 0.5480138063430786, "num_input_tokens_seen": 1021620, "step": 1342, "train_runtime": 3060.6039, "train_tokens_per_second": 333.797 }, { "epoch": 0.12349425287356322, "grad_norm": 7.211563587188721, "learning_rate": 6.596491228070177e-06, "loss": 0.49704140424728394, "num_input_tokens_seen": 1022536, "step": 1343, "train_runtime": 3062.5565, "train_tokens_per_second": 333.883 }, { "epoch": 0.12358620689655173, "grad_norm": 5.980576992034912, "learning_rate": 6.5864661654135345e-06, "loss": 0.38621148467063904, "num_input_tokens_seen": 1023336, "step": 1344, "train_runtime": 3064.4769, "train_tokens_per_second": 333.935 }, { "epoch": 0.12367816091954023, "grad_norm": 6.77341365814209, "learning_rate": 6.576441102756893e-06, "loss": 0.3904351592063904, "num_input_tokens_seen": 1023992, "step": 1345, "train_runtime": 3066.47, "train_tokens_per_second": 333.932 }, { "epoch": 0.12377011494252874, "grad_norm": 6.9706315994262695, "learning_rate": 6.566416040100251e-06, "loss": 0.43598905205726624, "num_input_tokens_seen": 1024908, "step": 1346, "train_runtime": 3068.4171, "train_tokens_per_second": 334.018 }, { "epoch": 0.12386206896551724, "grad_norm": 6.686893463134766, "learning_rate": 6.55639097744361e-06, "loss": 0.4698653221130371, "num_input_tokens_seen": 1025832, "step": 1347, "train_runtime": 3070.416, "train_tokens_per_second": 334.102 }, { "epoch": 0.12395402298850575, "grad_norm": 6.886135101318359, "learning_rate": 6.5463659147869685e-06, "loss": 0.454531729221344, "num_input_tokens_seen": 1026528, "step": 1348, "train_runtime": 3072.3435, "train_tokens_per_second": 334.119 }, { "epoch": 0.12404597701149425, "grad_norm": 7.164763927459717, "learning_rate": 6.536340852130326e-06, "loss": 0.51418137550354, "num_input_tokens_seen": 1027468, "step": 1349, "train_runtime": 3074.3162, "train_tokens_per_second": 334.21 }, { "epoch": 0.12413793103448276, "grad_norm": 7.003333568572998, "learning_rate": 6.526315789473685e-06, "loss": 0.48889005184173584, "num_input_tokens_seen": 1028212, "step": 1350, "train_runtime": 3076.2264, "train_tokens_per_second": 334.245 }, { "epoch": 0.12422988505747126, "grad_norm": 6.748643398284912, "learning_rate": 6.516290726817043e-06, "loss": 0.4787951707839966, "num_input_tokens_seen": 1029088, "step": 1351, "train_runtime": 3084.7446, "train_tokens_per_second": 333.606 }, { "epoch": 0.12432183908045977, "grad_norm": 6.4219746589660645, "learning_rate": 6.506265664160402e-06, "loss": 0.5620080232620239, "num_input_tokens_seen": 1030104, "step": 1352, "train_runtime": 3086.7219, "train_tokens_per_second": 333.721 }, { "epoch": 0.12441379310344827, "grad_norm": 6.431827545166016, "learning_rate": 6.49624060150376e-06, "loss": 0.48305195569992065, "num_input_tokens_seen": 1030736, "step": 1353, "train_runtime": 3088.6306, "train_tokens_per_second": 333.719 }, { "epoch": 0.12450574712643678, "grad_norm": 5.823015213012695, "learning_rate": 6.486215538847119e-06, "loss": 0.4215491712093353, "num_input_tokens_seen": 1031332, "step": 1354, "train_runtime": 3090.5332, "train_tokens_per_second": 333.707 }, { "epoch": 0.12459770114942528, "grad_norm": 5.891067981719971, "learning_rate": 6.476190476190477e-06, "loss": 0.4833441376686096, "num_input_tokens_seen": 1032648, "step": 1355, "train_runtime": 3092.5848, "train_tokens_per_second": 333.911 }, { "epoch": 0.12468965517241379, "grad_norm": 6.960275650024414, "learning_rate": 6.466165413533835e-06, "loss": 0.45002007484436035, "num_input_tokens_seen": 1033300, "step": 1356, "train_runtime": 3094.5647, "train_tokens_per_second": 333.908 }, { "epoch": 0.1247816091954023, "grad_norm": 6.904165744781494, "learning_rate": 6.456140350877193e-06, "loss": 0.46605169773101807, "num_input_tokens_seen": 1033900, "step": 1357, "train_runtime": 3096.4978, "train_tokens_per_second": 333.893 }, { "epoch": 0.1248735632183908, "grad_norm": 7.494766712188721, "learning_rate": 6.4461152882205525e-06, "loss": 0.4720362424850464, "num_input_tokens_seen": 1034684, "step": 1358, "train_runtime": 3098.4558, "train_tokens_per_second": 333.935 }, { "epoch": 0.1249655172413793, "grad_norm": 8.161543846130371, "learning_rate": 6.43609022556391e-06, "loss": 0.5111762881278992, "num_input_tokens_seen": 1035332, "step": 1359, "train_runtime": 3100.4702, "train_tokens_per_second": 333.927 }, { "epoch": 0.1250574712643678, "grad_norm": 6.962998390197754, "learning_rate": 6.426065162907269e-06, "loss": 0.4295594394207001, "num_input_tokens_seen": 1035960, "step": 1360, "train_runtime": 3102.3911, "train_tokens_per_second": 333.923 }, { "epoch": 0.12514942528735631, "grad_norm": 6.188365459442139, "learning_rate": 6.416040100250627e-06, "loss": 0.4945793151855469, "num_input_tokens_seen": 1036708, "step": 1361, "train_runtime": 3104.3236, "train_tokens_per_second": 333.956 }, { "epoch": 0.12524137931034482, "grad_norm": 6.810634136199951, "learning_rate": 6.406015037593986e-06, "loss": 0.3978559374809265, "num_input_tokens_seen": 1037272, "step": 1362, "train_runtime": 3106.2332, "train_tokens_per_second": 333.932 }, { "epoch": 0.12533333333333332, "grad_norm": 5.729403495788574, "learning_rate": 6.395989974937344e-06, "loss": 0.35970085859298706, "num_input_tokens_seen": 1037856, "step": 1363, "train_runtime": 3108.1633, "train_tokens_per_second": 333.913 }, { "epoch": 0.12542528735632183, "grad_norm": 6.915588855743408, "learning_rate": 6.385964912280702e-06, "loss": 0.4961872100830078, "num_input_tokens_seen": 1038472, "step": 1364, "train_runtime": 3110.0953, "train_tokens_per_second": 333.904 }, { "epoch": 0.12551724137931033, "grad_norm": 7.976280689239502, "learning_rate": 6.375939849624061e-06, "loss": 0.4000566303730011, "num_input_tokens_seen": 1039248, "step": 1365, "train_runtime": 3112.0416, "train_tokens_per_second": 333.944 }, { "epoch": 0.12560919540229884, "grad_norm": 7.088489532470703, "learning_rate": 6.365914786967419e-06, "loss": 0.4856930375099182, "num_input_tokens_seen": 1039872, "step": 1366, "train_runtime": 3113.9685, "train_tokens_per_second": 333.938 }, { "epoch": 0.12570114942528735, "grad_norm": 5.9422526359558105, "learning_rate": 6.355889724310777e-06, "loss": 0.5661624670028687, "num_input_tokens_seen": 1041652, "step": 1367, "train_runtime": 3116.1218, "train_tokens_per_second": 334.278 }, { "epoch": 0.12579310344827585, "grad_norm": 6.923958778381348, "learning_rate": 6.3458646616541366e-06, "loss": 0.5581769943237305, "num_input_tokens_seen": 1042432, "step": 1368, "train_runtime": 3118.038, "train_tokens_per_second": 334.323 }, { "epoch": 0.12588505747126436, "grad_norm": 5.821872711181641, "learning_rate": 6.335839598997494e-06, "loss": 0.4299492835998535, "num_input_tokens_seen": 1043080, "step": 1369, "train_runtime": 3120.0305, "train_tokens_per_second": 334.317 }, { "epoch": 0.12597701149425286, "grad_norm": 7.4547905921936035, "learning_rate": 6.325814536340853e-06, "loss": 0.47298097610473633, "num_input_tokens_seen": 1043712, "step": 1370, "train_runtime": 3121.9499, "train_tokens_per_second": 334.314 }, { "epoch": 0.12606896551724137, "grad_norm": 7.124066352844238, "learning_rate": 6.31578947368421e-06, "loss": 0.5197014212608337, "num_input_tokens_seen": 1044508, "step": 1371, "train_runtime": 3123.8831, "train_tokens_per_second": 334.362 }, { "epoch": 0.1261609195402299, "grad_norm": 6.706704139709473, "learning_rate": 6.30576441102757e-06, "loss": 0.41323238611221313, "num_input_tokens_seen": 1045168, "step": 1372, "train_runtime": 3125.8614, "train_tokens_per_second": 334.362 }, { "epoch": 0.1262528735632184, "grad_norm": 6.124212265014648, "learning_rate": 6.295739348370928e-06, "loss": 0.40887323021888733, "num_input_tokens_seen": 1045792, "step": 1373, "train_runtime": 3127.8439, "train_tokens_per_second": 334.349 }, { "epoch": 0.1263448275862069, "grad_norm": 6.2818074226379395, "learning_rate": 6.285714285714286e-06, "loss": 0.3918152451515198, "num_input_tokens_seen": 1046396, "step": 1374, "train_runtime": 3129.7627, "train_tokens_per_second": 334.337 }, { "epoch": 0.12643678160919541, "grad_norm": 6.364823341369629, "learning_rate": 6.275689223057645e-06, "loss": 0.4632605314254761, "num_input_tokens_seen": 1047064, "step": 1375, "train_runtime": 3131.7139, "train_tokens_per_second": 334.342 }, { "epoch": 0.12652873563218392, "grad_norm": 6.550987720489502, "learning_rate": 6.265664160401003e-06, "loss": 0.593927800655365, "num_input_tokens_seen": 1047856, "step": 1376, "train_runtime": 3133.6698, "train_tokens_per_second": 334.386 }, { "epoch": 0.12662068965517242, "grad_norm": 6.433656692504883, "learning_rate": 6.255639097744361e-06, "loss": 0.4245767593383789, "num_input_tokens_seen": 1048368, "step": 1377, "train_runtime": 3135.5827, "train_tokens_per_second": 334.346 }, { "epoch": 0.12671264367816093, "grad_norm": 7.409817695617676, "learning_rate": 6.245614035087721e-06, "loss": 0.5045289397239685, "num_input_tokens_seen": 1049156, "step": 1378, "train_runtime": 3137.5306, "train_tokens_per_second": 334.389 }, { "epoch": 0.12680459770114944, "grad_norm": 7.645226001739502, "learning_rate": 6.235588972431078e-06, "loss": 0.46224796772003174, "num_input_tokens_seen": 1049816, "step": 1379, "train_runtime": 3139.4764, "train_tokens_per_second": 334.392 }, { "epoch": 0.12689655172413794, "grad_norm": 6.701642036437988, "learning_rate": 6.225563909774437e-06, "loss": 0.5383749604225159, "num_input_tokens_seen": 1050704, "step": 1380, "train_runtime": 3141.4453, "train_tokens_per_second": 334.465 }, { "epoch": 0.12698850574712645, "grad_norm": 6.478757858276367, "learning_rate": 6.215538847117794e-06, "loss": 0.3706413507461548, "num_input_tokens_seen": 1051476, "step": 1381, "train_runtime": 3150.0197, "train_tokens_per_second": 333.8 }, { "epoch": 0.12708045977011495, "grad_norm": 6.502756595611572, "learning_rate": 6.205513784461154e-06, "loss": 0.41397708654403687, "num_input_tokens_seen": 1052128, "step": 1382, "train_runtime": 3151.9402, "train_tokens_per_second": 333.803 }, { "epoch": 0.12717241379310346, "grad_norm": 8.47773551940918, "learning_rate": 6.195488721804512e-06, "loss": 0.40870481729507446, "num_input_tokens_seen": 1052760, "step": 1383, "train_runtime": 3153.8462, "train_tokens_per_second": 333.802 }, { "epoch": 0.12726436781609196, "grad_norm": 7.772322654724121, "learning_rate": 6.18546365914787e-06, "loss": 0.4777206480503082, "num_input_tokens_seen": 1053512, "step": 1384, "train_runtime": 3155.8053, "train_tokens_per_second": 333.833 }, { "epoch": 0.12735632183908047, "grad_norm": 7.561821460723877, "learning_rate": 6.175438596491229e-06, "loss": 0.5530266165733337, "num_input_tokens_seen": 1054304, "step": 1385, "train_runtime": 3157.7642, "train_tokens_per_second": 333.877 }, { "epoch": 0.12744827586206897, "grad_norm": 7.125812530517578, "learning_rate": 6.165413533834587e-06, "loss": 0.45317232608795166, "num_input_tokens_seen": 1054916, "step": 1386, "train_runtime": 3159.6935, "train_tokens_per_second": 333.867 }, { "epoch": 0.12754022988505748, "grad_norm": 6.858726501464844, "learning_rate": 6.155388471177945e-06, "loss": 0.4123727083206177, "num_input_tokens_seen": 1055588, "step": 1387, "train_runtime": 3161.6197, "train_tokens_per_second": 333.876 }, { "epoch": 0.12763218390804598, "grad_norm": 9.354341506958008, "learning_rate": 6.145363408521305e-06, "loss": 0.3369084298610687, "num_input_tokens_seen": 1056152, "step": 1388, "train_runtime": 3163.5271, "train_tokens_per_second": 333.853 }, { "epoch": 0.1277241379310345, "grad_norm": 8.496859550476074, "learning_rate": 6.135338345864662e-06, "loss": 0.5529747009277344, "num_input_tokens_seen": 1056916, "step": 1389, "train_runtime": 3165.4334, "train_tokens_per_second": 333.893 }, { "epoch": 0.127816091954023, "grad_norm": 7.04681921005249, "learning_rate": 6.125313283208021e-06, "loss": 0.4281120300292969, "num_input_tokens_seen": 1057568, "step": 1390, "train_runtime": 3167.3365, "train_tokens_per_second": 333.898 }, { "epoch": 0.1279080459770115, "grad_norm": 8.527612686157227, "learning_rate": 6.115288220551378e-06, "loss": 0.534282386302948, "num_input_tokens_seen": 1058232, "step": 1391, "train_runtime": 3169.2875, "train_tokens_per_second": 333.902 }, { "epoch": 0.128, "grad_norm": 7.677074909210205, "learning_rate": 6.105263157894738e-06, "loss": 0.47458934783935547, "num_input_tokens_seen": 1058864, "step": 1392, "train_runtime": 3171.2049, "train_tokens_per_second": 333.9 }, { "epoch": 0.1280919540229885, "grad_norm": 5.942317485809326, "learning_rate": 6.095238095238096e-06, "loss": 0.41658198833465576, "num_input_tokens_seen": 1059528, "step": 1393, "train_runtime": 3173.1436, "train_tokens_per_second": 333.905 }, { "epoch": 0.128183908045977, "grad_norm": 8.285112380981445, "learning_rate": 6.085213032581454e-06, "loss": 0.488636314868927, "num_input_tokens_seen": 1060264, "step": 1394, "train_runtime": 3175.0821, "train_tokens_per_second": 333.933 }, { "epoch": 0.12827586206896552, "grad_norm": 6.375500679016113, "learning_rate": 6.075187969924813e-06, "loss": 0.5229175090789795, "num_input_tokens_seen": 1061080, "step": 1395, "train_runtime": 3177.042, "train_tokens_per_second": 333.984 }, { "epoch": 0.12836781609195402, "grad_norm": 7.5325846672058105, "learning_rate": 6.065162907268171e-06, "loss": 0.5719152688980103, "num_input_tokens_seen": 1061732, "step": 1396, "train_runtime": 3179.0205, "train_tokens_per_second": 333.981 }, { "epoch": 0.12845977011494253, "grad_norm": 7.508668899536133, "learning_rate": 6.055137844611529e-06, "loss": 0.5196084976196289, "num_input_tokens_seen": 1062472, "step": 1397, "train_runtime": 3181.0075, "train_tokens_per_second": 334.005 }, { "epoch": 0.12855172413793103, "grad_norm": 6.6803178787231445, "learning_rate": 6.045112781954889e-06, "loss": 0.5810975432395935, "num_input_tokens_seen": 1063344, "step": 1398, "train_runtime": 3182.9884, "train_tokens_per_second": 334.071 }, { "epoch": 0.12864367816091954, "grad_norm": 6.288444995880127, "learning_rate": 6.035087719298246e-06, "loss": 0.45880621671676636, "num_input_tokens_seen": 1064348, "step": 1399, "train_runtime": 3184.9928, "train_tokens_per_second": 334.176 }, { "epoch": 0.12873563218390804, "grad_norm": 6.953741073608398, "learning_rate": 6.025062656641605e-06, "loss": 0.5626611709594727, "num_input_tokens_seen": 1065008, "step": 1400, "train_runtime": 3186.915, "train_tokens_per_second": 334.181 }, { "epoch": 0.12873563218390804, "eval_loss": 1.8145204782485962, "eval_runtime": 27.9342, "eval_samples_per_second": 35.798, "eval_steps_per_second": 8.95, "num_input_tokens_seen": 1065008, "step": 1400 }, { "epoch": 0.12882758620689655, "grad_norm": 6.97532844543457, "learning_rate": 6.015037593984962e-06, "loss": 0.41040074825286865, "num_input_tokens_seen": 1065768, "step": 1401, "train_runtime": 3216.7731, "train_tokens_per_second": 331.316 }, { "epoch": 0.12891954022988505, "grad_norm": 7.571268081665039, "learning_rate": 6.005012531328322e-06, "loss": 0.4846341609954834, "num_input_tokens_seen": 1066336, "step": 1402, "train_runtime": 3218.6692, "train_tokens_per_second": 331.297 }, { "epoch": 0.12901149425287356, "grad_norm": 5.804952144622803, "learning_rate": 5.994987468671679e-06, "loss": 0.38645362854003906, "num_input_tokens_seen": 1067176, "step": 1403, "train_runtime": 3220.63, "train_tokens_per_second": 331.356 }, { "epoch": 0.12910344827586206, "grad_norm": 6.866107940673828, "learning_rate": 5.984962406015038e-06, "loss": 0.425374299287796, "num_input_tokens_seen": 1067920, "step": 1404, "train_runtime": 3222.5848, "train_tokens_per_second": 331.386 }, { "epoch": 0.12919540229885057, "grad_norm": 7.225115776062012, "learning_rate": 5.974937343358397e-06, "loss": 0.47367221117019653, "num_input_tokens_seen": 1068652, "step": 1405, "train_runtime": 3224.5057, "train_tokens_per_second": 331.416 }, { "epoch": 0.12928735632183908, "grad_norm": 6.78947639465332, "learning_rate": 5.964912280701755e-06, "loss": 0.44649946689605713, "num_input_tokens_seen": 1069596, "step": 1406, "train_runtime": 3226.4587, "train_tokens_per_second": 331.508 }, { "epoch": 0.12937931034482758, "grad_norm": 6.747674465179443, "learning_rate": 5.954887218045113e-06, "loss": 0.5224787592887878, "num_input_tokens_seen": 1071032, "step": 1407, "train_runtime": 3228.5047, "train_tokens_per_second": 331.742 }, { "epoch": 0.12947126436781609, "grad_norm": 6.45105504989624, "learning_rate": 5.944862155388471e-06, "loss": 0.3473295569419861, "num_input_tokens_seen": 1071628, "step": 1408, "train_runtime": 3230.4364, "train_tokens_per_second": 331.729 }, { "epoch": 0.1295632183908046, "grad_norm": 7.346982002258301, "learning_rate": 5.93483709273183e-06, "loss": 0.6219696402549744, "num_input_tokens_seen": 1072356, "step": 1409, "train_runtime": 3232.3553, "train_tokens_per_second": 331.757 }, { "epoch": 0.1296551724137931, "grad_norm": 6.83197546005249, "learning_rate": 5.924812030075189e-06, "loss": 0.4776724576950073, "num_input_tokens_seen": 1073052, "step": 1410, "train_runtime": 3234.2946, "train_tokens_per_second": 331.773 }, { "epoch": 0.1297471264367816, "grad_norm": 6.5279645919799805, "learning_rate": 5.9147869674185465e-06, "loss": 0.4475386142730713, "num_input_tokens_seen": 1073656, "step": 1411, "train_runtime": 3243.2099, "train_tokens_per_second": 331.047 }, { "epoch": 0.1298390804597701, "grad_norm": 7.811605930328369, "learning_rate": 5.904761904761905e-06, "loss": 0.45823603868484497, "num_input_tokens_seen": 1074472, "step": 1412, "train_runtime": 3245.1291, "train_tokens_per_second": 331.103 }, { "epoch": 0.1299310344827586, "grad_norm": 7.085739612579346, "learning_rate": 5.8947368421052634e-06, "loss": 0.3285777270793915, "num_input_tokens_seen": 1075088, "step": 1413, "train_runtime": 3247.0345, "train_tokens_per_second": 331.098 }, { "epoch": 0.13002298850574712, "grad_norm": 6.5943922996521, "learning_rate": 5.884711779448622e-06, "loss": 0.5506067276000977, "num_input_tokens_seen": 1075848, "step": 1414, "train_runtime": 3248.9497, "train_tokens_per_second": 331.137 }, { "epoch": 0.13011494252873562, "grad_norm": 7.135017395019531, "learning_rate": 5.87468671679198e-06, "loss": 0.5625655055046082, "num_input_tokens_seen": 1076852, "step": 1415, "train_runtime": 3250.9387, "train_tokens_per_second": 331.243 }, { "epoch": 0.13020689655172413, "grad_norm": 6.710904598236084, "learning_rate": 5.864661654135339e-06, "loss": 0.5015382766723633, "num_input_tokens_seen": 1077540, "step": 1416, "train_runtime": 3252.8839, "train_tokens_per_second": 331.257 }, { "epoch": 0.13029885057471263, "grad_norm": 7.155866622924805, "learning_rate": 5.854636591478697e-06, "loss": 0.4337519109249115, "num_input_tokens_seen": 1078220, "step": 1417, "train_runtime": 3254.8314, "train_tokens_per_second": 331.268 }, { "epoch": 0.13039080459770114, "grad_norm": 5.431839942932129, "learning_rate": 5.844611528822055e-06, "loss": 0.33701545000076294, "num_input_tokens_seen": 1079056, "step": 1418, "train_runtime": 3256.7776, "train_tokens_per_second": 331.326 }, { "epoch": 0.13048275862068964, "grad_norm": 5.556149005889893, "learning_rate": 5.8345864661654135e-06, "loss": 0.4353293180465698, "num_input_tokens_seen": 1080212, "step": 1419, "train_runtime": 3258.7947, "train_tokens_per_second": 331.476 }, { "epoch": 0.13057471264367815, "grad_norm": 6.294834136962891, "learning_rate": 5.824561403508773e-06, "loss": 0.4655035138130188, "num_input_tokens_seen": 1081108, "step": 1420, "train_runtime": 3260.7419, "train_tokens_per_second": 331.553 }, { "epoch": 0.13066666666666665, "grad_norm": 6.818014621734619, "learning_rate": 5.8145363408521305e-06, "loss": 0.48076024651527405, "num_input_tokens_seen": 1081940, "step": 1421, "train_runtime": 3262.6997, "train_tokens_per_second": 331.609 }, { "epoch": 0.1307586206896552, "grad_norm": 7.0069780349731445, "learning_rate": 5.804511278195489e-06, "loss": 0.5017577409744263, "num_input_tokens_seen": 1082984, "step": 1422, "train_runtime": 3264.6856, "train_tokens_per_second": 331.727 }, { "epoch": 0.1308505747126437, "grad_norm": 5.750135898590088, "learning_rate": 5.7944862155388475e-06, "loss": 0.4967845678329468, "num_input_tokens_seen": 1084196, "step": 1423, "train_runtime": 3266.7676, "train_tokens_per_second": 331.886 }, { "epoch": 0.1309425287356322, "grad_norm": 6.643673419952393, "learning_rate": 5.784461152882206e-06, "loss": 0.5117744207382202, "num_input_tokens_seen": 1084892, "step": 1424, "train_runtime": 3268.6914, "train_tokens_per_second": 331.904 }, { "epoch": 0.1310344827586207, "grad_norm": 6.438128471374512, "learning_rate": 5.7744360902255644e-06, "loss": 0.4591602385044098, "num_input_tokens_seen": 1085880, "step": 1425, "train_runtime": 3270.6994, "train_tokens_per_second": 332.002 }, { "epoch": 0.1311264367816092, "grad_norm": 6.030606269836426, "learning_rate": 5.764411027568922e-06, "loss": 0.3998528718948364, "num_input_tokens_seen": 1086744, "step": 1426, "train_runtime": 3272.6995, "train_tokens_per_second": 332.063 }, { "epoch": 0.1312183908045977, "grad_norm": 6.707212448120117, "learning_rate": 5.754385964912281e-06, "loss": 0.4361865520477295, "num_input_tokens_seen": 1087456, "step": 1427, "train_runtime": 3274.6613, "train_tokens_per_second": 332.082 }, { "epoch": 0.13131034482758622, "grad_norm": 7.165959358215332, "learning_rate": 5.744360902255639e-06, "loss": 0.4381793737411499, "num_input_tokens_seen": 1087996, "step": 1428, "train_runtime": 3276.6011, "train_tokens_per_second": 332.05 }, { "epoch": 0.13140229885057472, "grad_norm": 7.175246715545654, "learning_rate": 5.7343358395989975e-06, "loss": 0.5065217614173889, "num_input_tokens_seen": 1088672, "step": 1429, "train_runtime": 3278.5122, "train_tokens_per_second": 332.063 }, { "epoch": 0.13149425287356323, "grad_norm": 7.289319038391113, "learning_rate": 5.724310776942357e-06, "loss": 0.4486909508705139, "num_input_tokens_seen": 1089216, "step": 1430, "train_runtime": 3280.4188, "train_tokens_per_second": 332.036 }, { "epoch": 0.13158620689655173, "grad_norm": 6.761407375335693, "learning_rate": 5.7142857142857145e-06, "loss": 0.39181989431381226, "num_input_tokens_seen": 1089864, "step": 1431, "train_runtime": 3282.3515, "train_tokens_per_second": 332.038 }, { "epoch": 0.13167816091954024, "grad_norm": 7.691015243530273, "learning_rate": 5.704260651629073e-06, "loss": 0.5006154775619507, "num_input_tokens_seen": 1090452, "step": 1432, "train_runtime": 3284.2545, "train_tokens_per_second": 332.024 }, { "epoch": 0.13177011494252874, "grad_norm": 6.98045539855957, "learning_rate": 5.694235588972431e-06, "loss": 0.47522953152656555, "num_input_tokens_seen": 1091132, "step": 1433, "train_runtime": 3286.1701, "train_tokens_per_second": 332.038 }, { "epoch": 0.13186206896551725, "grad_norm": 6.046480655670166, "learning_rate": 5.68421052631579e-06, "loss": 0.4338725209236145, "num_input_tokens_seen": 1091984, "step": 1434, "train_runtime": 3288.1176, "train_tokens_per_second": 332.1 }, { "epoch": 0.13195402298850575, "grad_norm": 6.246063709259033, "learning_rate": 5.6741854636591485e-06, "loss": 0.5645648241043091, "num_input_tokens_seen": 1093008, "step": 1435, "train_runtime": 3290.1026, "train_tokens_per_second": 332.211 }, { "epoch": 0.13204597701149426, "grad_norm": 6.03352165222168, "learning_rate": 5.664160401002506e-06, "loss": 0.37914758920669556, "num_input_tokens_seen": 1093928, "step": 1436, "train_runtime": 3292.0846, "train_tokens_per_second": 332.29 }, { "epoch": 0.13213793103448276, "grad_norm": 4.073951721191406, "learning_rate": 5.6541353383458654e-06, "loss": 0.3868598937988281, "num_input_tokens_seen": 1095212, "step": 1437, "train_runtime": 3294.0926, "train_tokens_per_second": 332.478 }, { "epoch": 0.13222988505747127, "grad_norm": 6.356463432312012, "learning_rate": 5.644110275689223e-06, "loss": 0.3895990252494812, "num_input_tokens_seen": 1095828, "step": 1438, "train_runtime": 3296.0003, "train_tokens_per_second": 332.472 }, { "epoch": 0.13232183908045977, "grad_norm": 6.292166233062744, "learning_rate": 5.6340852130325816e-06, "loss": 0.3632347881793976, "num_input_tokens_seen": 1096436, "step": 1439, "train_runtime": 3297.8967, "train_tokens_per_second": 332.465 }, { "epoch": 0.13241379310344828, "grad_norm": 10.279585838317871, "learning_rate": 5.624060150375941e-06, "loss": 0.4475225806236267, "num_input_tokens_seen": 1097008, "step": 1440, "train_runtime": 3299.8007, "train_tokens_per_second": 332.447 }, { "epoch": 0.13250574712643678, "grad_norm": 6.838550090789795, "learning_rate": 5.6140350877192985e-06, "loss": 0.6017982959747314, "num_input_tokens_seen": 1098320, "step": 1441, "train_runtime": 3308.3526, "train_tokens_per_second": 331.984 }, { "epoch": 0.1325977011494253, "grad_norm": 6.356078147888184, "learning_rate": 5.604010025062657e-06, "loss": 0.39076799154281616, "num_input_tokens_seen": 1098960, "step": 1442, "train_runtime": 3310.2583, "train_tokens_per_second": 331.986 }, { "epoch": 0.1326896551724138, "grad_norm": 6.0813117027282715, "learning_rate": 5.593984962406015e-06, "loss": 0.4393022656440735, "num_input_tokens_seen": 1099672, "step": 1443, "train_runtime": 3312.1681, "train_tokens_per_second": 332.01 }, { "epoch": 0.1327816091954023, "grad_norm": 7.3292646408081055, "learning_rate": 5.583959899749374e-06, "loss": 0.48649272322654724, "num_input_tokens_seen": 1100352, "step": 1444, "train_runtime": 3314.0728, "train_tokens_per_second": 332.024 }, { "epoch": 0.1328735632183908, "grad_norm": 6.762223243713379, "learning_rate": 5.5739348370927325e-06, "loss": 0.48952534794807434, "num_input_tokens_seen": 1101152, "step": 1445, "train_runtime": 3316.011, "train_tokens_per_second": 332.071 }, { "epoch": 0.1329655172413793, "grad_norm": 6.347455024719238, "learning_rate": 5.56390977443609e-06, "loss": 0.44791457056999207, "num_input_tokens_seen": 1101800, "step": 1446, "train_runtime": 3317.9347, "train_tokens_per_second": 332.074 }, { "epoch": 0.13305747126436782, "grad_norm": 6.447908401489258, "learning_rate": 5.5538847117794495e-06, "loss": 0.4292008876800537, "num_input_tokens_seen": 1102528, "step": 1447, "train_runtime": 3319.8907, "train_tokens_per_second": 332.098 }, { "epoch": 0.13314942528735632, "grad_norm": 6.4803466796875, "learning_rate": 5.543859649122807e-06, "loss": 0.49495232105255127, "num_input_tokens_seen": 1103204, "step": 1448, "train_runtime": 3321.8047, "train_tokens_per_second": 332.11 }, { "epoch": 0.13324137931034483, "grad_norm": 6.167976379394531, "learning_rate": 5.533834586466166e-06, "loss": 0.415465772151947, "num_input_tokens_seen": 1103792, "step": 1449, "train_runtime": 3323.7181, "train_tokens_per_second": 332.096 }, { "epoch": 0.13333333333333333, "grad_norm": 6.421348571777344, "learning_rate": 5.523809523809525e-06, "loss": 0.47656774520874023, "num_input_tokens_seen": 1104664, "step": 1450, "train_runtime": 3325.7162, "train_tokens_per_second": 332.158 }, { "epoch": 0.13342528735632184, "grad_norm": 6.786693572998047, "learning_rate": 5.5137844611528826e-06, "loss": 0.493723601102829, "num_input_tokens_seen": 1105940, "step": 1451, "train_runtime": 3327.7842, "train_tokens_per_second": 332.335 }, { "epoch": 0.13351724137931034, "grad_norm": 7.2511887550354, "learning_rate": 5.503759398496241e-06, "loss": 0.5468142628669739, "num_input_tokens_seen": 1106588, "step": 1452, "train_runtime": 3329.6941, "train_tokens_per_second": 332.339 }, { "epoch": 0.13360919540229885, "grad_norm": 7.076693534851074, "learning_rate": 5.493734335839599e-06, "loss": 0.4080525040626526, "num_input_tokens_seen": 1107224, "step": 1453, "train_runtime": 3331.6097, "train_tokens_per_second": 332.339 }, { "epoch": 0.13370114942528735, "grad_norm": 6.785010814666748, "learning_rate": 5.483709273182958e-06, "loss": 0.44463402032852173, "num_input_tokens_seen": 1108068, "step": 1454, "train_runtime": 3333.5742, "train_tokens_per_second": 332.396 }, { "epoch": 0.13379310344827586, "grad_norm": 8.230337142944336, "learning_rate": 5.4736842105263165e-06, "loss": 0.4688238203525543, "num_input_tokens_seen": 1108708, "step": 1455, "train_runtime": 3335.4783, "train_tokens_per_second": 332.399 }, { "epoch": 0.13388505747126436, "grad_norm": 7.023602485656738, "learning_rate": 5.463659147869674e-06, "loss": 0.4936160445213318, "num_input_tokens_seen": 1109428, "step": 1456, "train_runtime": 3337.3916, "train_tokens_per_second": 332.424 }, { "epoch": 0.13397701149425287, "grad_norm": 6.1114397048950195, "learning_rate": 5.4536340852130335e-06, "loss": 0.4492369294166565, "num_input_tokens_seen": 1110100, "step": 1457, "train_runtime": 3339.3358, "train_tokens_per_second": 332.431 }, { "epoch": 0.13406896551724137, "grad_norm": 6.5584492683410645, "learning_rate": 5.443609022556391e-06, "loss": 0.4723778963088989, "num_input_tokens_seen": 1111172, "step": 1458, "train_runtime": 3341.312, "train_tokens_per_second": 332.556 }, { "epoch": 0.13416091954022988, "grad_norm": 7.448948383331299, "learning_rate": 5.43358395989975e-06, "loss": 0.5321516990661621, "num_input_tokens_seen": 1111804, "step": 1459, "train_runtime": 3343.2311, "train_tokens_per_second": 332.554 }, { "epoch": 0.13425287356321838, "grad_norm": 5.970415115356445, "learning_rate": 5.423558897243109e-06, "loss": 0.43350765109062195, "num_input_tokens_seen": 1112456, "step": 1460, "train_runtime": 3345.1541, "train_tokens_per_second": 332.557 }, { "epoch": 0.1343448275862069, "grad_norm": 7.31071138381958, "learning_rate": 5.413533834586467e-06, "loss": 0.5078038573265076, "num_input_tokens_seen": 1113180, "step": 1461, "train_runtime": 3347.0855, "train_tokens_per_second": 332.582 }, { "epoch": 0.1344367816091954, "grad_norm": 7.171257019042969, "learning_rate": 5.403508771929825e-06, "loss": 0.43725284934043884, "num_input_tokens_seen": 1114100, "step": 1462, "train_runtime": 3349.0351, "train_tokens_per_second": 332.663 }, { "epoch": 0.1345287356321839, "grad_norm": 6.14492130279541, "learning_rate": 5.393483709273183e-06, "loss": 0.4269268214702606, "num_input_tokens_seen": 1114704, "step": 1463, "train_runtime": 3350.9637, "train_tokens_per_second": 332.652 }, { "epoch": 0.1346206896551724, "grad_norm": 8.483597755432129, "learning_rate": 5.383458646616542e-06, "loss": 0.4732326567173004, "num_input_tokens_seen": 1115376, "step": 1464, "train_runtime": 3352.8884, "train_tokens_per_second": 332.661 }, { "epoch": 0.1347126436781609, "grad_norm": 6.515466213226318, "learning_rate": 5.3734335839599006e-06, "loss": 0.5863065719604492, "num_input_tokens_seen": 1116764, "step": 1465, "train_runtime": 3354.9209, "train_tokens_per_second": 332.873 }, { "epoch": 0.13480459770114941, "grad_norm": 6.285518169403076, "learning_rate": 5.363408521303258e-06, "loss": 0.4715114235877991, "num_input_tokens_seen": 1117456, "step": 1466, "train_runtime": 3356.9176, "train_tokens_per_second": 332.882 }, { "epoch": 0.13489655172413792, "grad_norm": 6.65487003326416, "learning_rate": 5.3533834586466175e-06, "loss": 0.4476355314254761, "num_input_tokens_seen": 1118176, "step": 1467, "train_runtime": 3358.8734, "train_tokens_per_second": 332.902 }, { "epoch": 0.13498850574712642, "grad_norm": 6.075029373168945, "learning_rate": 5.343358395989975e-06, "loss": 0.44196251034736633, "num_input_tokens_seen": 1118932, "step": 1468, "train_runtime": 3360.7859, "train_tokens_per_second": 332.938 }, { "epoch": 0.13508045977011493, "grad_norm": 6.945167064666748, "learning_rate": 5.333333333333334e-06, "loss": 0.47767823934555054, "num_input_tokens_seen": 1119636, "step": 1469, "train_runtime": 3362.738, "train_tokens_per_second": 332.954 }, { "epoch": 0.13517241379310344, "grad_norm": 6.25655460357666, "learning_rate": 5.323308270676692e-06, "loss": 0.4757128655910492, "num_input_tokens_seen": 1120972, "step": 1470, "train_runtime": 3364.7111, "train_tokens_per_second": 333.156 }, { "epoch": 0.13526436781609194, "grad_norm": 6.348459720611572, "learning_rate": 5.313283208020051e-06, "loss": 0.3730282783508301, "num_input_tokens_seen": 1121584, "step": 1471, "train_runtime": 3372.9578, "train_tokens_per_second": 332.522 }, { "epoch": 0.13535632183908047, "grad_norm": 7.8312296867370605, "learning_rate": 5.303258145363409e-06, "loss": 0.5653750896453857, "num_input_tokens_seen": 1122280, "step": 1472, "train_runtime": 3374.8739, "train_tokens_per_second": 332.54 }, { "epoch": 0.13544827586206898, "grad_norm": 6.325518608093262, "learning_rate": 5.293233082706767e-06, "loss": 0.4348008930683136, "num_input_tokens_seen": 1122924, "step": 1473, "train_runtime": 3376.858, "train_tokens_per_second": 332.535 }, { "epoch": 0.13554022988505748, "grad_norm": 5.947680473327637, "learning_rate": 5.283208020050126e-06, "loss": 0.4743146002292633, "num_input_tokens_seen": 1124464, "step": 1474, "train_runtime": 3378.9075, "train_tokens_per_second": 332.789 }, { "epoch": 0.135632183908046, "grad_norm": 6.109054088592529, "learning_rate": 5.273182957393485e-06, "loss": 0.40196356177330017, "num_input_tokens_seen": 1124984, "step": 1475, "train_runtime": 3380.8153, "train_tokens_per_second": 332.755 }, { "epoch": 0.1357241379310345, "grad_norm": 6.539097309112549, "learning_rate": 5.263157894736842e-06, "loss": 0.4703242778778076, "num_input_tokens_seen": 1126252, "step": 1476, "train_runtime": 3382.8059, "train_tokens_per_second": 332.934 }, { "epoch": 0.135816091954023, "grad_norm": 6.725227355957031, "learning_rate": 5.253132832080201e-06, "loss": 0.4537864923477173, "num_input_tokens_seen": 1126984, "step": 1477, "train_runtime": 3384.8574, "train_tokens_per_second": 332.949 }, { "epoch": 0.1359080459770115, "grad_norm": 7.197235107421875, "learning_rate": 5.243107769423559e-06, "loss": 0.5095236301422119, "num_input_tokens_seen": 1127828, "step": 1478, "train_runtime": 3386.8172, "train_tokens_per_second": 333.005 }, { "epoch": 0.136, "grad_norm": 7.300252437591553, "learning_rate": 5.233082706766918e-06, "loss": 0.47199469804763794, "num_input_tokens_seen": 1128640, "step": 1479, "train_runtime": 3388.8044, "train_tokens_per_second": 333.05 }, { "epoch": 0.13609195402298851, "grad_norm": 6.9750471115112305, "learning_rate": 5.223057644110276e-06, "loss": 0.42595043778419495, "num_input_tokens_seen": 1129392, "step": 1480, "train_runtime": 3390.7721, "train_tokens_per_second": 333.078 }, { "epoch": 0.13618390804597702, "grad_norm": 5.77484130859375, "learning_rate": 5.213032581453634e-06, "loss": 0.47980445623397827, "num_input_tokens_seen": 1130524, "step": 1481, "train_runtime": 3392.7646, "train_tokens_per_second": 333.216 }, { "epoch": 0.13627586206896553, "grad_norm": 6.600121974945068, "learning_rate": 5.203007518796993e-06, "loss": 0.48391154408454895, "num_input_tokens_seen": 1131376, "step": 1482, "train_runtime": 3394.7547, "train_tokens_per_second": 333.272 }, { "epoch": 0.13636781609195403, "grad_norm": 6.862207412719727, "learning_rate": 5.192982456140351e-06, "loss": 0.5035004019737244, "num_input_tokens_seen": 1132288, "step": 1483, "train_runtime": 3396.7076, "train_tokens_per_second": 333.349 }, { "epoch": 0.13645977011494254, "grad_norm": 6.580876350402832, "learning_rate": 5.182957393483709e-06, "loss": 0.37613195180892944, "num_input_tokens_seen": 1132996, "step": 1484, "train_runtime": 3398.6231, "train_tokens_per_second": 333.369 }, { "epoch": 0.13655172413793104, "grad_norm": 6.477765083312988, "learning_rate": 5.172932330827069e-06, "loss": 0.42193272709846497, "num_input_tokens_seen": 1133580, "step": 1485, "train_runtime": 3400.5249, "train_tokens_per_second": 333.354 }, { "epoch": 0.13664367816091955, "grad_norm": 9.42302417755127, "learning_rate": 5.162907268170426e-06, "loss": 0.447000116109848, "num_input_tokens_seen": 1134152, "step": 1486, "train_runtime": 3402.432, "train_tokens_per_second": 333.336 }, { "epoch": 0.13673563218390805, "grad_norm": 7.284692764282227, "learning_rate": 5.152882205513785e-06, "loss": 0.5637538433074951, "num_input_tokens_seen": 1134840, "step": 1487, "train_runtime": 3404.3471, "train_tokens_per_second": 333.35 }, { "epoch": 0.13682758620689656, "grad_norm": 6.81699275970459, "learning_rate": 5.142857142857142e-06, "loss": 0.4707770347595215, "num_input_tokens_seen": 1135780, "step": 1488, "train_runtime": 3406.3034, "train_tokens_per_second": 333.435 }, { "epoch": 0.13691954022988506, "grad_norm": 7.516037940979004, "learning_rate": 5.132832080200502e-06, "loss": 0.5666313171386719, "num_input_tokens_seen": 1136524, "step": 1489, "train_runtime": 3408.3556, "train_tokens_per_second": 333.452 }, { "epoch": 0.13701149425287357, "grad_norm": 7.408823013305664, "learning_rate": 5.12280701754386e-06, "loss": 0.5359535217285156, "num_input_tokens_seen": 1137472, "step": 1490, "train_runtime": 3410.3086, "train_tokens_per_second": 333.539 }, { "epoch": 0.13710344827586207, "grad_norm": 7.798243045806885, "learning_rate": 5.112781954887218e-06, "loss": 0.5340937972068787, "num_input_tokens_seen": 1138068, "step": 1491, "train_runtime": 3412.2167, "train_tokens_per_second": 333.527 }, { "epoch": 0.13719540229885058, "grad_norm": 8.12541675567627, "learning_rate": 5.102756892230577e-06, "loss": 0.5569170713424683, "num_input_tokens_seen": 1138892, "step": 1492, "train_runtime": 3414.147, "train_tokens_per_second": 333.58 }, { "epoch": 0.13728735632183908, "grad_norm": 6.8189849853515625, "learning_rate": 5.092731829573935e-06, "loss": 0.5268915295600891, "num_input_tokens_seen": 1139696, "step": 1493, "train_runtime": 3416.1279, "train_tokens_per_second": 333.622 }, { "epoch": 0.1373793103448276, "grad_norm": 5.879248142242432, "learning_rate": 5.082706766917293e-06, "loss": 0.37678250670433044, "num_input_tokens_seen": 1140444, "step": 1494, "train_runtime": 3418.0696, "train_tokens_per_second": 333.651 }, { "epoch": 0.1374712643678161, "grad_norm": 6.807672500610352, "learning_rate": 5.072681704260653e-06, "loss": 0.5095071196556091, "num_input_tokens_seen": 1141212, "step": 1495, "train_runtime": 3419.9883, "train_tokens_per_second": 333.689 }, { "epoch": 0.1375632183908046, "grad_norm": 6.6341962814331055, "learning_rate": 5.06265664160401e-06, "loss": 0.5022022724151611, "num_input_tokens_seen": 1141796, "step": 1496, "train_runtime": 3421.9702, "train_tokens_per_second": 333.666 }, { "epoch": 0.1376551724137931, "grad_norm": 6.8143768310546875, "learning_rate": 5.052631578947369e-06, "loss": 0.41124725341796875, "num_input_tokens_seen": 1142496, "step": 1497, "train_runtime": 3423.8907, "train_tokens_per_second": 333.684 }, { "epoch": 0.1377471264367816, "grad_norm": 6.307721138000488, "learning_rate": 5.042606516290726e-06, "loss": 0.3924211263656616, "num_input_tokens_seen": 1143152, "step": 1498, "train_runtime": 3425.8133, "train_tokens_per_second": 333.688 }, { "epoch": 0.1378390804597701, "grad_norm": 6.788408279418945, "learning_rate": 5.032581453634086e-06, "loss": 0.3497253656387329, "num_input_tokens_seen": 1143712, "step": 1499, "train_runtime": 3427.7682, "train_tokens_per_second": 333.661 }, { "epoch": 0.13793103448275862, "grad_norm": 6.1640729904174805, "learning_rate": 5.022556390977444e-06, "loss": 0.4776795208454132, "num_input_tokens_seen": 1144672, "step": 1500, "train_runtime": 3429.7151, "train_tokens_per_second": 333.751 }, { "epoch": 0.13802298850574712, "grad_norm": 5.438903331756592, "learning_rate": 5.012531328320802e-06, "loss": 0.38507819175720215, "num_input_tokens_seen": 1146308, "step": 1501, "train_runtime": 3438.626, "train_tokens_per_second": 333.362 }, { "epoch": 0.13811494252873563, "grad_norm": 6.643701076507568, "learning_rate": 5.002506265664161e-06, "loss": 0.38595324754714966, "num_input_tokens_seen": 1146896, "step": 1502, "train_runtime": 3440.7643, "train_tokens_per_second": 333.326 }, { "epoch": 0.13820689655172413, "grad_norm": 7.118875980377197, "learning_rate": 4.992481203007519e-06, "loss": 0.6216070652008057, "num_input_tokens_seen": 1147648, "step": 1503, "train_runtime": 3442.6889, "train_tokens_per_second": 333.358 }, { "epoch": 0.13829885057471264, "grad_norm": 7.120995044708252, "learning_rate": 4.982456140350877e-06, "loss": 0.4311849772930145, "num_input_tokens_seen": 1148372, "step": 1504, "train_runtime": 3444.6044, "train_tokens_per_second": 333.383 }, { "epoch": 0.13839080459770114, "grad_norm": 5.9141764640808105, "learning_rate": 4.972431077694236e-06, "loss": 0.44043609499931335, "num_input_tokens_seen": 1149256, "step": 1505, "train_runtime": 3446.554, "train_tokens_per_second": 333.451 }, { "epoch": 0.13848275862068965, "grad_norm": 7.327331066131592, "learning_rate": 4.962406015037594e-06, "loss": 0.49830931425094604, "num_input_tokens_seen": 1150156, "step": 1506, "train_runtime": 3448.5009, "train_tokens_per_second": 333.523 }, { "epoch": 0.13857471264367816, "grad_norm": 6.454385757446289, "learning_rate": 4.952380952380953e-06, "loss": 0.4663582742214203, "num_input_tokens_seen": 1150828, "step": 1507, "train_runtime": 3450.4103, "train_tokens_per_second": 333.534 }, { "epoch": 0.13866666666666666, "grad_norm": 11.470450401306152, "learning_rate": 4.942355889724311e-06, "loss": 0.48851844668388367, "num_input_tokens_seen": 1151480, "step": 1508, "train_runtime": 3452.3403, "train_tokens_per_second": 333.536 }, { "epoch": 0.13875862068965517, "grad_norm": 6.839486122131348, "learning_rate": 4.93233082706767e-06, "loss": 0.493771493434906, "num_input_tokens_seen": 1152428, "step": 1509, "train_runtime": 3454.3209, "train_tokens_per_second": 333.619 }, { "epoch": 0.13885057471264367, "grad_norm": 7.617315292358398, "learning_rate": 4.922305764411027e-06, "loss": 0.5075865387916565, "num_input_tokens_seen": 1153192, "step": 1510, "train_runtime": 3456.2342, "train_tokens_per_second": 333.656 }, { "epoch": 0.13894252873563218, "grad_norm": 6.4050517082214355, "learning_rate": 4.912280701754386e-06, "loss": 0.5061872005462646, "num_input_tokens_seen": 1154952, "step": 1511, "train_runtime": 3458.3129, "train_tokens_per_second": 333.964 }, { "epoch": 0.13903448275862068, "grad_norm": 7.359883785247803, "learning_rate": 4.902255639097745e-06, "loss": 0.5475380420684814, "num_input_tokens_seen": 1156260, "step": 1512, "train_runtime": 3460.3238, "train_tokens_per_second": 334.148 }, { "epoch": 0.1391264367816092, "grad_norm": 7.349669933319092, "learning_rate": 4.892230576441103e-06, "loss": 0.525090217590332, "num_input_tokens_seen": 1156964, "step": 1513, "train_runtime": 3462.2457, "train_tokens_per_second": 334.166 }, { "epoch": 0.1392183908045977, "grad_norm": 7.001368045806885, "learning_rate": 4.882205513784461e-06, "loss": 0.4986392855644226, "num_input_tokens_seen": 1157840, "step": 1514, "train_runtime": 3464.2485, "train_tokens_per_second": 334.225 }, { "epoch": 0.1393103448275862, "grad_norm": 5.995524883270264, "learning_rate": 4.87218045112782e-06, "loss": 0.4127148389816284, "num_input_tokens_seen": 1158400, "step": 1515, "train_runtime": 3466.1629, "train_tokens_per_second": 334.202 }, { "epoch": 0.1394022988505747, "grad_norm": 6.9042816162109375, "learning_rate": 4.862155388471178e-06, "loss": 0.4874632656574249, "num_input_tokens_seen": 1159196, "step": 1516, "train_runtime": 3468.0995, "train_tokens_per_second": 334.245 }, { "epoch": 0.1394942528735632, "grad_norm": 7.804703235626221, "learning_rate": 4.852130325814537e-06, "loss": 0.6120208501815796, "num_input_tokens_seen": 1159880, "step": 1517, "train_runtime": 3470.0093, "train_tokens_per_second": 334.258 }, { "epoch": 0.1395862068965517, "grad_norm": 7.079176902770996, "learning_rate": 4.842105263157895e-06, "loss": 0.4638254940509796, "num_input_tokens_seen": 1160568, "step": 1518, "train_runtime": 3471.9284, "train_tokens_per_second": 334.272 }, { "epoch": 0.13967816091954022, "grad_norm": 6.242354393005371, "learning_rate": 4.832080200501254e-06, "loss": 0.3685902953147888, "num_input_tokens_seen": 1161184, "step": 1519, "train_runtime": 3473.8435, "train_tokens_per_second": 334.265 }, { "epoch": 0.13977011494252872, "grad_norm": 6.551645755767822, "learning_rate": 4.8220551378446114e-06, "loss": 0.55516517162323, "num_input_tokens_seen": 1162596, "step": 1520, "train_runtime": 3475.879, "train_tokens_per_second": 334.475 }, { "epoch": 0.13986206896551723, "grad_norm": 7.7210001945495605, "learning_rate": 4.81203007518797e-06, "loss": 0.4628271758556366, "num_input_tokens_seen": 1163356, "step": 1521, "train_runtime": 3477.8351, "train_tokens_per_second": 334.506 }, { "epoch": 0.13995402298850576, "grad_norm": 6.228600025177002, "learning_rate": 4.802005012531329e-06, "loss": 0.4215913414955139, "num_input_tokens_seen": 1164228, "step": 1522, "train_runtime": 3479.7951, "train_tokens_per_second": 334.568 }, { "epoch": 0.14004597701149427, "grad_norm": 7.540292739868164, "learning_rate": 4.791979949874687e-06, "loss": 0.5465987920761108, "num_input_tokens_seen": 1164936, "step": 1523, "train_runtime": 3481.7335, "train_tokens_per_second": 334.585 }, { "epoch": 0.14013793103448277, "grad_norm": 6.092329025268555, "learning_rate": 4.781954887218045e-06, "loss": 0.49597764015197754, "num_input_tokens_seen": 1165520, "step": 1524, "train_runtime": 3483.6633, "train_tokens_per_second": 334.567 }, { "epoch": 0.14022988505747128, "grad_norm": 6.8615007400512695, "learning_rate": 4.771929824561404e-06, "loss": 0.42225661873817444, "num_input_tokens_seen": 1166100, "step": 1525, "train_runtime": 3485.6299, "train_tokens_per_second": 334.545 }, { "epoch": 0.14032183908045978, "grad_norm": 6.486217975616455, "learning_rate": 4.761904761904762e-06, "loss": 0.5414251685142517, "num_input_tokens_seen": 1166908, "step": 1526, "train_runtime": 3487.5937, "train_tokens_per_second": 334.588 }, { "epoch": 0.1404137931034483, "grad_norm": 7.315220355987549, "learning_rate": 4.751879699248121e-06, "loss": 0.44345003366470337, "num_input_tokens_seen": 1167528, "step": 1527, "train_runtime": 3489.5024, "train_tokens_per_second": 334.583 }, { "epoch": 0.1405057471264368, "grad_norm": 6.64310884475708, "learning_rate": 4.741854636591479e-06, "loss": 0.42874985933303833, "num_input_tokens_seen": 1168108, "step": 1528, "train_runtime": 3491.4161, "train_tokens_per_second": 334.566 }, { "epoch": 0.1405977011494253, "grad_norm": 6.159165859222412, "learning_rate": 4.731829573934838e-06, "loss": 0.47418278455734253, "num_input_tokens_seen": 1168956, "step": 1529, "train_runtime": 3493.3878, "train_tokens_per_second": 334.62 }, { "epoch": 0.1406896551724138, "grad_norm": 6.183302879333496, "learning_rate": 4.7218045112781955e-06, "loss": 0.41782593727111816, "num_input_tokens_seen": 1169608, "step": 1530, "train_runtime": 3495.3093, "train_tokens_per_second": 334.622 }, { "epoch": 0.1407816091954023, "grad_norm": 7.021867275238037, "learning_rate": 4.711779448621554e-06, "loss": 0.5794481039047241, "num_input_tokens_seen": 1170272, "step": 1531, "train_runtime": 3503.8917, "train_tokens_per_second": 333.992 }, { "epoch": 0.1408735632183908, "grad_norm": 5.9288249015808105, "learning_rate": 4.7017543859649125e-06, "loss": 0.3630669414997101, "num_input_tokens_seen": 1170860, "step": 1532, "train_runtime": 3505.8235, "train_tokens_per_second": 333.976 }, { "epoch": 0.14096551724137932, "grad_norm": 7.3672075271606445, "learning_rate": 4.691729323308271e-06, "loss": 0.44522491097450256, "num_input_tokens_seen": 1171480, "step": 1533, "train_runtime": 3507.8212, "train_tokens_per_second": 333.962 }, { "epoch": 0.14105747126436782, "grad_norm": 6.494082927703857, "learning_rate": 4.6817042606516294e-06, "loss": 0.4364702105522156, "num_input_tokens_seen": 1172136, "step": 1534, "train_runtime": 3509.7465, "train_tokens_per_second": 333.966 }, { "epoch": 0.14114942528735633, "grad_norm": 6.911060810089111, "learning_rate": 4.671679197994988e-06, "loss": 0.3699270784854889, "num_input_tokens_seen": 1172648, "step": 1535, "train_runtime": 3511.6599, "train_tokens_per_second": 333.93 }, { "epoch": 0.14124137931034483, "grad_norm": 6.150845050811768, "learning_rate": 4.661654135338346e-06, "loss": 0.4344079792499542, "num_input_tokens_seen": 1173408, "step": 1536, "train_runtime": 3513.6082, "train_tokens_per_second": 333.961 }, { "epoch": 0.14133333333333334, "grad_norm": 6.985192775726318, "learning_rate": 4.651629072681705e-06, "loss": 0.4886764883995056, "num_input_tokens_seen": 1174080, "step": 1537, "train_runtime": 3515.5202, "train_tokens_per_second": 333.97 }, { "epoch": 0.14142528735632184, "grad_norm": 6.360936641693115, "learning_rate": 4.641604010025063e-06, "loss": 0.43858852982521057, "num_input_tokens_seen": 1175012, "step": 1538, "train_runtime": 3517.4758, "train_tokens_per_second": 334.05 }, { "epoch": 0.14151724137931035, "grad_norm": 7.028363227844238, "learning_rate": 4.631578947368421e-06, "loss": 0.4857777953147888, "num_input_tokens_seen": 1175724, "step": 1539, "train_runtime": 3519.4121, "train_tokens_per_second": 334.068 }, { "epoch": 0.14160919540229885, "grad_norm": 7.59266471862793, "learning_rate": 4.6215538847117795e-06, "loss": 0.4337865114212036, "num_input_tokens_seen": 1176348, "step": 1540, "train_runtime": 3521.3568, "train_tokens_per_second": 334.061 }, { "epoch": 0.14170114942528736, "grad_norm": 5.869190216064453, "learning_rate": 4.611528822055138e-06, "loss": 0.39313578605651855, "num_input_tokens_seen": 1177224, "step": 1541, "train_runtime": 3523.3102, "train_tokens_per_second": 334.124 }, { "epoch": 0.14179310344827586, "grad_norm": 7.339359283447266, "learning_rate": 4.6015037593984965e-06, "loss": 0.4942663908004761, "num_input_tokens_seen": 1177920, "step": 1542, "train_runtime": 3525.2401, "train_tokens_per_second": 334.139 }, { "epoch": 0.14188505747126437, "grad_norm": 7.112597942352295, "learning_rate": 4.591478696741855e-06, "loss": 0.5195597410202026, "num_input_tokens_seen": 1178672, "step": 1543, "train_runtime": 3527.1959, "train_tokens_per_second": 334.167 }, { "epoch": 0.14197701149425287, "grad_norm": 7.303198337554932, "learning_rate": 4.5814536340852135e-06, "loss": 0.5885412096977234, "num_input_tokens_seen": 1179356, "step": 1544, "train_runtime": 3529.1157, "train_tokens_per_second": 334.179 }, { "epoch": 0.14206896551724138, "grad_norm": 7.587347030639648, "learning_rate": 4.571428571428572e-06, "loss": 0.525458037853241, "num_input_tokens_seen": 1180028, "step": 1545, "train_runtime": 3531.0347, "train_tokens_per_second": 334.188 }, { "epoch": 0.14216091954022989, "grad_norm": 12.200189590454102, "learning_rate": 4.56140350877193e-06, "loss": 0.5025969743728638, "num_input_tokens_seen": 1180812, "step": 1546, "train_runtime": 3532.9971, "train_tokens_per_second": 334.224 }, { "epoch": 0.1422528735632184, "grad_norm": 7.2503204345703125, "learning_rate": 4.551378446115289e-06, "loss": 0.5418580770492554, "num_input_tokens_seen": 1181436, "step": 1547, "train_runtime": 3534.9114, "train_tokens_per_second": 334.219 }, { "epoch": 0.1423448275862069, "grad_norm": 7.234675407409668, "learning_rate": 4.541353383458647e-06, "loss": 0.5090577006340027, "num_input_tokens_seen": 1182200, "step": 1548, "train_runtime": 3536.8327, "train_tokens_per_second": 334.254 }, { "epoch": 0.1424367816091954, "grad_norm": 6.909221172332764, "learning_rate": 4.531328320802005e-06, "loss": 0.49349039793014526, "num_input_tokens_seen": 1182924, "step": 1549, "train_runtime": 3538.7775, "train_tokens_per_second": 334.275 }, { "epoch": 0.1425287356321839, "grad_norm": 6.639964580535889, "learning_rate": 4.5213032581453635e-06, "loss": 0.4774690270423889, "num_input_tokens_seen": 1183804, "step": 1550, "train_runtime": 3540.7258, "train_tokens_per_second": 334.339 }, { "epoch": 0.1426206896551724, "grad_norm": 6.520241737365723, "learning_rate": 4.511278195488722e-06, "loss": 0.5106967091560364, "num_input_tokens_seen": 1184504, "step": 1551, "train_runtime": 3542.6401, "train_tokens_per_second": 334.356 }, { "epoch": 0.14271264367816092, "grad_norm": 7.22974967956543, "learning_rate": 4.5012531328320805e-06, "loss": 0.4782262444496155, "num_input_tokens_seen": 1185184, "step": 1552, "train_runtime": 3544.56, "train_tokens_per_second": 334.367 }, { "epoch": 0.14280459770114942, "grad_norm": 7.263352870941162, "learning_rate": 4.491228070175439e-06, "loss": 0.4990386664867401, "num_input_tokens_seen": 1185924, "step": 1553, "train_runtime": 3546.4945, "train_tokens_per_second": 334.393 }, { "epoch": 0.14289655172413793, "grad_norm": 6.859169960021973, "learning_rate": 4.4812030075187975e-06, "loss": 0.4410400390625, "num_input_tokens_seen": 1186652, "step": 1554, "train_runtime": 3548.4061, "train_tokens_per_second": 334.418 }, { "epoch": 0.14298850574712643, "grad_norm": 7.173482894897461, "learning_rate": 4.471177944862156e-06, "loss": 0.4671162962913513, "num_input_tokens_seen": 1187328, "step": 1555, "train_runtime": 3550.3659, "train_tokens_per_second": 334.424 }, { "epoch": 0.14308045977011494, "grad_norm": 7.271553039550781, "learning_rate": 4.461152882205514e-06, "loss": 0.43279311060905457, "num_input_tokens_seen": 1188452, "step": 1556, "train_runtime": 3552.3551, "train_tokens_per_second": 334.553 }, { "epoch": 0.14317241379310344, "grad_norm": 6.336573123931885, "learning_rate": 4.451127819548873e-06, "loss": 0.3423529863357544, "num_input_tokens_seen": 1189056, "step": 1557, "train_runtime": 3554.2645, "train_tokens_per_second": 334.543 }, { "epoch": 0.14326436781609195, "grad_norm": 6.986931800842285, "learning_rate": 4.4411027568922314e-06, "loss": 0.5558561086654663, "num_input_tokens_seen": 1190140, "step": 1558, "train_runtime": 3556.2356, "train_tokens_per_second": 334.663 }, { "epoch": 0.14335632183908045, "grad_norm": 7.816788673400879, "learning_rate": 4.431077694235589e-06, "loss": 0.44449564814567566, "num_input_tokens_seen": 1190752, "step": 1559, "train_runtime": 3558.1463, "train_tokens_per_second": 334.655 }, { "epoch": 0.14344827586206896, "grad_norm": 8.101500511169434, "learning_rate": 4.4210526315789476e-06, "loss": 0.5737946033477783, "num_input_tokens_seen": 1191564, "step": 1560, "train_runtime": 3560.1087, "train_tokens_per_second": 334.699 }, { "epoch": 0.14354022988505746, "grad_norm": 9.103196144104004, "learning_rate": 4.411027568922306e-06, "loss": 0.5782645344734192, "num_input_tokens_seen": 1192240, "step": 1561, "train_runtime": 3568.6313, "train_tokens_per_second": 334.089 }, { "epoch": 0.14363218390804597, "grad_norm": 6.655757427215576, "learning_rate": 4.4010025062656645e-06, "loss": 0.467924028635025, "num_input_tokens_seen": 1192904, "step": 1562, "train_runtime": 3570.6484, "train_tokens_per_second": 334.086 }, { "epoch": 0.14372413793103447, "grad_norm": 5.992223739624023, "learning_rate": 4.390977443609023e-06, "loss": 0.45279771089553833, "num_input_tokens_seen": 1193492, "step": 1563, "train_runtime": 3572.5868, "train_tokens_per_second": 334.069 }, { "epoch": 0.14381609195402298, "grad_norm": 6.550340175628662, "learning_rate": 4.3809523809523815e-06, "loss": 0.431035578250885, "num_input_tokens_seen": 1194256, "step": 1564, "train_runtime": 3574.5055, "train_tokens_per_second": 334.104 }, { "epoch": 0.14390804597701148, "grad_norm": 7.314089775085449, "learning_rate": 4.370927318295739e-06, "loss": 0.5454208254814148, "num_input_tokens_seen": 1194996, "step": 1565, "train_runtime": 3576.4281, "train_tokens_per_second": 334.131 }, { "epoch": 0.144, "grad_norm": 7.040731430053711, "learning_rate": 4.360902255639098e-06, "loss": 0.48860985040664673, "num_input_tokens_seen": 1195740, "step": 1566, "train_runtime": 3578.3707, "train_tokens_per_second": 334.158 }, { "epoch": 0.1440919540229885, "grad_norm": 5.951720237731934, "learning_rate": 4.350877192982457e-06, "loss": 0.3874664306640625, "num_input_tokens_seen": 1196676, "step": 1567, "train_runtime": 3580.3276, "train_tokens_per_second": 334.236 }, { "epoch": 0.144183908045977, "grad_norm": 6.843580722808838, "learning_rate": 4.340852130325815e-06, "loss": 0.4062352776527405, "num_input_tokens_seen": 1197460, "step": 1568, "train_runtime": 3582.273, "train_tokens_per_second": 334.274 }, { "epoch": 0.1442758620689655, "grad_norm": 6.490946292877197, "learning_rate": 4.330827067669173e-06, "loss": 0.5126763582229614, "num_input_tokens_seen": 1198108, "step": 1569, "train_runtime": 3584.1927, "train_tokens_per_second": 334.276 }, { "epoch": 0.144367816091954, "grad_norm": 6.102653503417969, "learning_rate": 4.320802005012532e-06, "loss": 0.4109741449356079, "num_input_tokens_seen": 1198712, "step": 1570, "train_runtime": 3586.1048, "train_tokens_per_second": 334.266 }, { "epoch": 0.14445977011494252, "grad_norm": 6.025990962982178, "learning_rate": 4.31077694235589e-06, "loss": 0.3658444285392761, "num_input_tokens_seen": 1199516, "step": 1571, "train_runtime": 3588.0707, "train_tokens_per_second": 334.307 }, { "epoch": 0.14455172413793105, "grad_norm": 6.144662857055664, "learning_rate": 4.3007518796992486e-06, "loss": 0.413577675819397, "num_input_tokens_seen": 1200164, "step": 1572, "train_runtime": 3590.0099, "train_tokens_per_second": 334.307 }, { "epoch": 0.14464367816091955, "grad_norm": 7.419083118438721, "learning_rate": 4.290726817042607e-06, "loss": 0.4642472565174103, "num_input_tokens_seen": 1200740, "step": 1573, "train_runtime": 3591.9381, "train_tokens_per_second": 334.287 }, { "epoch": 0.14473563218390806, "grad_norm": 7.012404918670654, "learning_rate": 4.2807017543859656e-06, "loss": 0.4493465721607208, "num_input_tokens_seen": 1201628, "step": 1574, "train_runtime": 3593.8828, "train_tokens_per_second": 334.354 }, { "epoch": 0.14482758620689656, "grad_norm": 6.282637119293213, "learning_rate": 4.270676691729323e-06, "loss": 0.4151184856891632, "num_input_tokens_seen": 1202244, "step": 1575, "train_runtime": 3595.8076, "train_tokens_per_second": 334.346 }, { "epoch": 0.14491954022988507, "grad_norm": 6.75771951675415, "learning_rate": 4.260651629072682e-06, "loss": 0.4637143611907959, "num_input_tokens_seen": 1202884, "step": 1576, "train_runtime": 3597.7598, "train_tokens_per_second": 334.342 }, { "epoch": 0.14501149425287357, "grad_norm": 7.565665245056152, "learning_rate": 4.250626566416041e-06, "loss": 0.47488293051719666, "num_input_tokens_seen": 1203780, "step": 1577, "train_runtime": 3599.7262, "train_tokens_per_second": 334.409 }, { "epoch": 0.14510344827586208, "grad_norm": 8.024337768554688, "learning_rate": 4.240601503759399e-06, "loss": 0.4857102632522583, "num_input_tokens_seen": 1204544, "step": 1578, "train_runtime": 3601.6822, "train_tokens_per_second": 334.439 }, { "epoch": 0.14519540229885058, "grad_norm": 6.690497875213623, "learning_rate": 4.230576441102757e-06, "loss": 0.46639159321784973, "num_input_tokens_seen": 1205300, "step": 1579, "train_runtime": 3603.6109, "train_tokens_per_second": 334.47 }, { "epoch": 0.1452873563218391, "grad_norm": 6.756970405578613, "learning_rate": 4.220551378446116e-06, "loss": 0.49929511547088623, "num_input_tokens_seen": 1205904, "step": 1580, "train_runtime": 3605.6055, "train_tokens_per_second": 334.453 }, { "epoch": 0.1453793103448276, "grad_norm": 6.6091837882995605, "learning_rate": 4.210526315789474e-06, "loss": 0.4757223129272461, "num_input_tokens_seen": 1206556, "step": 1581, "train_runtime": 3607.5171, "train_tokens_per_second": 334.456 }, { "epoch": 0.1454712643678161, "grad_norm": 6.709166526794434, "learning_rate": 4.200501253132833e-06, "loss": 0.4480632543563843, "num_input_tokens_seen": 1207188, "step": 1582, "train_runtime": 3609.4438, "train_tokens_per_second": 334.453 }, { "epoch": 0.1455632183908046, "grad_norm": 6.548619747161865, "learning_rate": 4.190476190476191e-06, "loss": 0.5035223364830017, "num_input_tokens_seen": 1208300, "step": 1583, "train_runtime": 3611.4282, "train_tokens_per_second": 334.577 }, { "epoch": 0.1456551724137931, "grad_norm": 5.75042200088501, "learning_rate": 4.18045112781955e-06, "loss": 0.4471976161003113, "num_input_tokens_seen": 1209076, "step": 1584, "train_runtime": 3613.3671, "train_tokens_per_second": 334.612 }, { "epoch": 0.14574712643678162, "grad_norm": 7.029244899749756, "learning_rate": 4.170426065162907e-06, "loss": 0.5173816680908203, "num_input_tokens_seen": 1209928, "step": 1585, "train_runtime": 3615.3144, "train_tokens_per_second": 334.667 }, { "epoch": 0.14583908045977012, "grad_norm": 6.378706932067871, "learning_rate": 4.160401002506266e-06, "loss": 0.4809526205062866, "num_input_tokens_seen": 1210812, "step": 1586, "train_runtime": 3617.2616, "train_tokens_per_second": 334.732 }, { "epoch": 0.14593103448275863, "grad_norm": 6.754574298858643, "learning_rate": 4.150375939849624e-06, "loss": 0.4018881320953369, "num_input_tokens_seen": 1211568, "step": 1587, "train_runtime": 3619.1965, "train_tokens_per_second": 334.762 }, { "epoch": 0.14602298850574713, "grad_norm": 6.6122145652771, "learning_rate": 4.140350877192983e-06, "loss": 0.5332188606262207, "num_input_tokens_seen": 1214064, "step": 1588, "train_runtime": 3621.3748, "train_tokens_per_second": 335.249 }, { "epoch": 0.14611494252873564, "grad_norm": 6.535598278045654, "learning_rate": 4.130325814536341e-06, "loss": 0.46375539898872375, "num_input_tokens_seen": 1214812, "step": 1589, "train_runtime": 3623.3229, "train_tokens_per_second": 335.276 }, { "epoch": 0.14620689655172414, "grad_norm": 6.416146278381348, "learning_rate": 4.1203007518797e-06, "loss": 0.4666772186756134, "num_input_tokens_seen": 1215524, "step": 1590, "train_runtime": 3625.2421, "train_tokens_per_second": 335.295 }, { "epoch": 0.14629885057471265, "grad_norm": 6.42300271987915, "learning_rate": 4.110275689223058e-06, "loss": 0.4736384153366089, "num_input_tokens_seen": 1216204, "step": 1591, "train_runtime": 3633.8338, "train_tokens_per_second": 334.689 }, { "epoch": 0.14639080459770115, "grad_norm": 6.641760349273682, "learning_rate": 4.100250626566417e-06, "loss": 0.5206786394119263, "num_input_tokens_seen": 1217020, "step": 1592, "train_runtime": 3635.8077, "train_tokens_per_second": 334.732 }, { "epoch": 0.14648275862068966, "grad_norm": 6.356281280517578, "learning_rate": 4.090225563909775e-06, "loss": 0.47648727893829346, "num_input_tokens_seen": 1217760, "step": 1593, "train_runtime": 3637.7325, "train_tokens_per_second": 334.758 }, { "epoch": 0.14657471264367816, "grad_norm": 6.1111297607421875, "learning_rate": 4.080200501253133e-06, "loss": 0.4094933867454529, "num_input_tokens_seen": 1218356, "step": 1594, "train_runtime": 3639.6469, "train_tokens_per_second": 334.746 }, { "epoch": 0.14666666666666667, "grad_norm": 7.068531036376953, "learning_rate": 4.070175438596491e-06, "loss": 0.4315361976623535, "num_input_tokens_seen": 1219076, "step": 1595, "train_runtime": 3641.6063, "train_tokens_per_second": 334.763 }, { "epoch": 0.14675862068965517, "grad_norm": 7.483480930328369, "learning_rate": 4.06015037593985e-06, "loss": 0.5120396614074707, "num_input_tokens_seen": 1219760, "step": 1596, "train_runtime": 3643.5708, "train_tokens_per_second": 334.77 }, { "epoch": 0.14685057471264368, "grad_norm": 6.521261215209961, "learning_rate": 4.050125313283208e-06, "loss": 0.39161306619644165, "num_input_tokens_seen": 1220400, "step": 1597, "train_runtime": 3645.5029, "train_tokens_per_second": 334.769 }, { "epoch": 0.14694252873563218, "grad_norm": 6.332038879394531, "learning_rate": 4.040100250626567e-06, "loss": 0.4736579656600952, "num_input_tokens_seen": 1221100, "step": 1598, "train_runtime": 3647.4244, "train_tokens_per_second": 334.784 }, { "epoch": 0.1470344827586207, "grad_norm": 7.104672908782959, "learning_rate": 4.030075187969925e-06, "loss": 0.5967186689376831, "num_input_tokens_seen": 1221788, "step": 1599, "train_runtime": 3649.3519, "train_tokens_per_second": 334.796 }, { "epoch": 0.1471264367816092, "grad_norm": 6.8572587966918945, "learning_rate": 4.020050125313284e-06, "loss": 0.46505308151245117, "num_input_tokens_seen": 1222464, "step": 1600, "train_runtime": 3651.267, "train_tokens_per_second": 334.805 }, { "epoch": 0.1471264367816092, "eval_loss": 1.8033605813980103, "eval_runtime": 27.9632, "eval_samples_per_second": 35.761, "eval_steps_per_second": 8.94, "num_input_tokens_seen": 1222464, "step": 1600 }, { "epoch": 0.1472183908045977, "grad_norm": 6.851583480834961, "learning_rate": 4.010025062656641e-06, "loss": 0.5206998586654663, "num_input_tokens_seen": 1223332, "step": 1601, "train_runtime": 3681.1937, "train_tokens_per_second": 332.319 }, { "epoch": 0.1473103448275862, "grad_norm": 6.868015289306641, "learning_rate": 4.000000000000001e-06, "loss": 0.5103731155395508, "num_input_tokens_seen": 1224728, "step": 1602, "train_runtime": 3683.2062, "train_tokens_per_second": 332.517 }, { "epoch": 0.1474022988505747, "grad_norm": 6.602429389953613, "learning_rate": 3.989974937343359e-06, "loss": 0.5429903268814087, "num_input_tokens_seen": 1225460, "step": 1603, "train_runtime": 3685.1252, "train_tokens_per_second": 332.542 }, { "epoch": 0.14749425287356321, "grad_norm": 7.1812663078308105, "learning_rate": 3.979949874686717e-06, "loss": 0.5265251398086548, "num_input_tokens_seen": 1226144, "step": 1604, "train_runtime": 3687.0339, "train_tokens_per_second": 332.556 }, { "epoch": 0.14758620689655172, "grad_norm": 6.5239996910095215, "learning_rate": 3.969924812030075e-06, "loss": 0.3950444161891937, "num_input_tokens_seen": 1226792, "step": 1605, "train_runtime": 3688.9373, "train_tokens_per_second": 332.56 }, { "epoch": 0.14767816091954022, "grad_norm": 7.124094009399414, "learning_rate": 3.959899749373434e-06, "loss": 0.4906897246837616, "num_input_tokens_seen": 1227400, "step": 1606, "train_runtime": 3690.8455, "train_tokens_per_second": 332.553 }, { "epoch": 0.14777011494252873, "grad_norm": 6.652856349945068, "learning_rate": 3.949874686716792e-06, "loss": 0.4999001622200012, "num_input_tokens_seen": 1228192, "step": 1607, "train_runtime": 3692.7547, "train_tokens_per_second": 332.595 }, { "epoch": 0.14786206896551723, "grad_norm": 6.2461700439453125, "learning_rate": 3.939849624060151e-06, "loss": 0.37495970726013184, "num_input_tokens_seen": 1228728, "step": 1608, "train_runtime": 3694.6626, "train_tokens_per_second": 332.568 }, { "epoch": 0.14795402298850574, "grad_norm": 6.433096408843994, "learning_rate": 3.929824561403509e-06, "loss": 0.4584512710571289, "num_input_tokens_seen": 1229856, "step": 1609, "train_runtime": 3696.675, "train_tokens_per_second": 332.692 }, { "epoch": 0.14804597701149425, "grad_norm": 5.780365943908691, "learning_rate": 3.919799498746868e-06, "loss": 0.3628767728805542, "num_input_tokens_seen": 1230684, "step": 1610, "train_runtime": 3698.7181, "train_tokens_per_second": 332.733 }, { "epoch": 0.14813793103448275, "grad_norm": 5.993629455566406, "learning_rate": 3.909774436090225e-06, "loss": 0.47672876715660095, "num_input_tokens_seen": 1232252, "step": 1611, "train_runtime": 3700.7812, "train_tokens_per_second": 332.971 }, { "epoch": 0.14822988505747126, "grad_norm": 6.184093952178955, "learning_rate": 3.899749373433585e-06, "loss": 0.3732033371925354, "num_input_tokens_seen": 1233156, "step": 1612, "train_runtime": 3702.7595, "train_tokens_per_second": 333.037 }, { "epoch": 0.14832183908045976, "grad_norm": 6.4238810539245605, "learning_rate": 3.889724310776943e-06, "loss": 0.4720228910446167, "num_input_tokens_seen": 1233728, "step": 1613, "train_runtime": 3704.6676, "train_tokens_per_second": 333.02 }, { "epoch": 0.14841379310344827, "grad_norm": 6.06830358505249, "learning_rate": 3.879699248120301e-06, "loss": 0.3889967203140259, "num_input_tokens_seen": 1234312, "step": 1614, "train_runtime": 3706.5808, "train_tokens_per_second": 333.006 }, { "epoch": 0.14850574712643677, "grad_norm": 7.1693549156188965, "learning_rate": 3.869674185463659e-06, "loss": 0.6546400785446167, "num_input_tokens_seen": 1235508, "step": 1615, "train_runtime": 3708.565, "train_tokens_per_second": 333.15 }, { "epoch": 0.14859770114942528, "grad_norm": 7.182287216186523, "learning_rate": 3.859649122807018e-06, "loss": 0.5240688323974609, "num_input_tokens_seen": 1236284, "step": 1616, "train_runtime": 3710.4782, "train_tokens_per_second": 333.187 }, { "epoch": 0.14868965517241378, "grad_norm": 7.047788619995117, "learning_rate": 3.849624060150376e-06, "loss": 0.47436654567718506, "num_input_tokens_seen": 1236828, "step": 1617, "train_runtime": 3712.3814, "train_tokens_per_second": 333.163 }, { "epoch": 0.1487816091954023, "grad_norm": 6.530257225036621, "learning_rate": 3.839598997493735e-06, "loss": 0.40288904309272766, "num_input_tokens_seen": 1237548, "step": 1618, "train_runtime": 3714.3282, "train_tokens_per_second": 333.182 }, { "epoch": 0.1488735632183908, "grad_norm": 6.0984063148498535, "learning_rate": 3.829573934837093e-06, "loss": 0.5006040334701538, "num_input_tokens_seen": 1238564, "step": 1619, "train_runtime": 3716.3041, "train_tokens_per_second": 333.278 }, { "epoch": 0.1489655172413793, "grad_norm": 7.607024669647217, "learning_rate": 3.819548872180452e-06, "loss": 0.5643741488456726, "num_input_tokens_seen": 1239192, "step": 1620, "train_runtime": 3718.2229, "train_tokens_per_second": 333.275 }, { "epoch": 0.1490574712643678, "grad_norm": 7.06319522857666, "learning_rate": 3.80952380952381e-06, "loss": 0.5532639026641846, "num_input_tokens_seen": 1240556, "step": 1621, "train_runtime": 3727.1797, "train_tokens_per_second": 332.84 }, { "epoch": 0.14914942528735634, "grad_norm": 7.681368827819824, "learning_rate": 3.7994987468671683e-06, "loss": 0.48061004281044006, "num_input_tokens_seen": 1241332, "step": 1622, "train_runtime": 3729.2641, "train_tokens_per_second": 332.862 }, { "epoch": 0.14924137931034484, "grad_norm": 6.306829452514648, "learning_rate": 3.789473684210527e-06, "loss": 0.41942787170410156, "num_input_tokens_seen": 1241944, "step": 1623, "train_runtime": 3731.184, "train_tokens_per_second": 332.855 }, { "epoch": 0.14933333333333335, "grad_norm": 7.706522464752197, "learning_rate": 3.779448621553885e-06, "loss": 0.5494070053100586, "num_input_tokens_seen": 1242636, "step": 1624, "train_runtime": 3733.0925, "train_tokens_per_second": 332.87 }, { "epoch": 0.14942528735632185, "grad_norm": 6.535772323608398, "learning_rate": 3.7694235588972433e-06, "loss": 0.42592912912368774, "num_input_tokens_seen": 1243304, "step": 1625, "train_runtime": 3735.0027, "train_tokens_per_second": 332.879 }, { "epoch": 0.14951724137931036, "grad_norm": 8.192347526550293, "learning_rate": 3.7593984962406014e-06, "loss": 0.5597870945930481, "num_input_tokens_seen": 1244020, "step": 1626, "train_runtime": 3736.9427, "train_tokens_per_second": 332.898 }, { "epoch": 0.14960919540229886, "grad_norm": 7.159975528717041, "learning_rate": 3.7493734335839603e-06, "loss": 0.4892594814300537, "num_input_tokens_seen": 1244620, "step": 1627, "train_runtime": 3738.8571, "train_tokens_per_second": 332.888 }, { "epoch": 0.14970114942528737, "grad_norm": 6.74794864654541, "learning_rate": 3.739348370927319e-06, "loss": 0.5493437051773071, "num_input_tokens_seen": 1245312, "step": 1628, "train_runtime": 3740.8446, "train_tokens_per_second": 332.896 }, { "epoch": 0.14979310344827587, "grad_norm": 6.720531940460205, "learning_rate": 3.729323308270677e-06, "loss": 0.4282424747943878, "num_input_tokens_seen": 1246036, "step": 1629, "train_runtime": 3742.7615, "train_tokens_per_second": 332.919 }, { "epoch": 0.14988505747126438, "grad_norm": 6.940911769866943, "learning_rate": 3.7192982456140354e-06, "loss": 0.5560833811759949, "num_input_tokens_seen": 1246856, "step": 1630, "train_runtime": 3744.7369, "train_tokens_per_second": 332.962 }, { "epoch": 0.14997701149425288, "grad_norm": 6.8108415603637695, "learning_rate": 3.7092731829573934e-06, "loss": 0.4583231210708618, "num_input_tokens_seen": 1247520, "step": 1631, "train_runtime": 3746.6817, "train_tokens_per_second": 332.967 }, { "epoch": 0.1500689655172414, "grad_norm": 6.710882663726807, "learning_rate": 3.6992481203007523e-06, "loss": 0.458967000246048, "num_input_tokens_seen": 1248164, "step": 1632, "train_runtime": 3748.6007, "train_tokens_per_second": 332.968 }, { "epoch": 0.1501609195402299, "grad_norm": 5.969411849975586, "learning_rate": 3.689223057644111e-06, "loss": 0.42513519525527954, "num_input_tokens_seen": 1248828, "step": 1633, "train_runtime": 3750.5278, "train_tokens_per_second": 332.974 }, { "epoch": 0.1502528735632184, "grad_norm": 7.540334224700928, "learning_rate": 3.679197994987469e-06, "loss": 0.45841267704963684, "num_input_tokens_seen": 1249580, "step": 1634, "train_runtime": 3752.5442, "train_tokens_per_second": 332.995 }, { "epoch": 0.1503448275862069, "grad_norm": 7.294579029083252, "learning_rate": 3.6691729323308274e-06, "loss": 0.5723696947097778, "num_input_tokens_seen": 1250416, "step": 1635, "train_runtime": 3754.5019, "train_tokens_per_second": 333.044 }, { "epoch": 0.1504367816091954, "grad_norm": 6.645254135131836, "learning_rate": 3.6591478696741854e-06, "loss": 0.4086427092552185, "num_input_tokens_seen": 1251188, "step": 1636, "train_runtime": 3756.4271, "train_tokens_per_second": 333.079 }, { "epoch": 0.1505287356321839, "grad_norm": 7.079519748687744, "learning_rate": 3.6491228070175443e-06, "loss": 0.4305681586265564, "num_input_tokens_seen": 1251796, "step": 1637, "train_runtime": 3758.3346, "train_tokens_per_second": 333.072 }, { "epoch": 0.15062068965517242, "grad_norm": 6.369967937469482, "learning_rate": 3.639097744360903e-06, "loss": 0.47447091341018677, "num_input_tokens_seen": 1252368, "step": 1638, "train_runtime": 3760.2385, "train_tokens_per_second": 333.055 }, { "epoch": 0.15071264367816092, "grad_norm": 6.839728832244873, "learning_rate": 3.629072681704261e-06, "loss": 0.5020827651023865, "num_input_tokens_seen": 1252948, "step": 1639, "train_runtime": 3762.1563, "train_tokens_per_second": 333.04 }, { "epoch": 0.15080459770114943, "grad_norm": 6.284133434295654, "learning_rate": 3.6190476190476194e-06, "loss": 0.46222183108329773, "num_input_tokens_seen": 1254244, "step": 1640, "train_runtime": 3764.1381, "train_tokens_per_second": 333.209 }, { "epoch": 0.15089655172413793, "grad_norm": 5.810016632080078, "learning_rate": 3.6090225563909775e-06, "loss": 0.40370118618011475, "num_input_tokens_seen": 1255088, "step": 1641, "train_runtime": 3766.0907, "train_tokens_per_second": 333.26 }, { "epoch": 0.15098850574712644, "grad_norm": 7.57272481918335, "learning_rate": 3.5989974937343364e-06, "loss": 0.5796998143196106, "num_input_tokens_seen": 1255824, "step": 1642, "train_runtime": 3768.037, "train_tokens_per_second": 333.283 }, { "epoch": 0.15108045977011494, "grad_norm": 6.646892070770264, "learning_rate": 3.588972431077695e-06, "loss": 0.39232754707336426, "num_input_tokens_seen": 1256416, "step": 1643, "train_runtime": 3769.9477, "train_tokens_per_second": 333.271 }, { "epoch": 0.15117241379310345, "grad_norm": 6.2148308753967285, "learning_rate": 3.578947368421053e-06, "loss": 0.36920031905174255, "num_input_tokens_seen": 1257092, "step": 1644, "train_runtime": 3771.899, "train_tokens_per_second": 333.278 }, { "epoch": 0.15126436781609195, "grad_norm": 7.5221381187438965, "learning_rate": 3.5689223057644114e-06, "loss": 0.537412166595459, "num_input_tokens_seen": 1257668, "step": 1645, "train_runtime": 3773.8109, "train_tokens_per_second": 333.262 }, { "epoch": 0.15135632183908046, "grad_norm": 6.563010215759277, "learning_rate": 3.5588972431077695e-06, "loss": 0.4267057478427887, "num_input_tokens_seen": 1258424, "step": 1646, "train_runtime": 3775.7502, "train_tokens_per_second": 333.291 }, { "epoch": 0.15144827586206897, "grad_norm": 6.13692569732666, "learning_rate": 3.5488721804511284e-06, "loss": 0.3660619854927063, "num_input_tokens_seen": 1259052, "step": 1647, "train_runtime": 3777.7159, "train_tokens_per_second": 333.284 }, { "epoch": 0.15154022988505747, "grad_norm": 6.393582820892334, "learning_rate": 3.5388471177944864e-06, "loss": 0.4673348069190979, "num_input_tokens_seen": 1259824, "step": 1648, "train_runtime": 3779.6358, "train_tokens_per_second": 333.319 }, { "epoch": 0.15163218390804598, "grad_norm": 6.13256311416626, "learning_rate": 3.528822055137845e-06, "loss": 0.5436832308769226, "num_input_tokens_seen": 1260612, "step": 1649, "train_runtime": 3781.5531, "train_tokens_per_second": 333.358 }, { "epoch": 0.15172413793103448, "grad_norm": 6.178951740264893, "learning_rate": 3.5187969924812034e-06, "loss": 0.3987323045730591, "num_input_tokens_seen": 1261272, "step": 1650, "train_runtime": 3783.4813, "train_tokens_per_second": 333.363 }, { "epoch": 0.15181609195402299, "grad_norm": 6.734344482421875, "learning_rate": 3.5087719298245615e-06, "loss": 0.4014202952384949, "num_input_tokens_seen": 1261996, "step": 1651, "train_runtime": 3791.736, "train_tokens_per_second": 332.828 }, { "epoch": 0.1519080459770115, "grad_norm": 7.783940315246582, "learning_rate": 3.4987468671679204e-06, "loss": 0.4166038930416107, "num_input_tokens_seen": 1262660, "step": 1652, "train_runtime": 3793.6642, "train_tokens_per_second": 332.834 }, { "epoch": 0.152, "grad_norm": 7.206593990325928, "learning_rate": 3.4887218045112785e-06, "loss": 0.44669169187545776, "num_input_tokens_seen": 1263660, "step": 1653, "train_runtime": 3795.6258, "train_tokens_per_second": 332.925 }, { "epoch": 0.1520919540229885, "grad_norm": 7.104734897613525, "learning_rate": 3.478696741854637e-06, "loss": 0.524027407169342, "num_input_tokens_seen": 1264284, "step": 1654, "train_runtime": 3797.5657, "train_tokens_per_second": 332.92 }, { "epoch": 0.152183908045977, "grad_norm": 6.854971885681152, "learning_rate": 3.468671679197995e-06, "loss": 0.5613166093826294, "num_input_tokens_seen": 1265392, "step": 1655, "train_runtime": 3799.5672, "train_tokens_per_second": 333.036 }, { "epoch": 0.1522758620689655, "grad_norm": 7.128030300140381, "learning_rate": 3.4586466165413535e-06, "loss": 0.49357134103775024, "num_input_tokens_seen": 1266160, "step": 1656, "train_runtime": 3801.66, "train_tokens_per_second": 333.055 }, { "epoch": 0.15236781609195402, "grad_norm": 6.797114849090576, "learning_rate": 3.4486215538847124e-06, "loss": 0.49934589862823486, "num_input_tokens_seen": 1266788, "step": 1657, "train_runtime": 3803.5801, "train_tokens_per_second": 333.051 }, { "epoch": 0.15245977011494252, "grad_norm": 7.697146892547607, "learning_rate": 3.4385964912280705e-06, "loss": 0.5518667697906494, "num_input_tokens_seen": 1267528, "step": 1658, "train_runtime": 3805.5016, "train_tokens_per_second": 333.078 }, { "epoch": 0.15255172413793103, "grad_norm": 6.477298259735107, "learning_rate": 3.428571428571429e-06, "loss": 0.5126209855079651, "num_input_tokens_seen": 1268336, "step": 1659, "train_runtime": 3807.4633, "train_tokens_per_second": 333.118 }, { "epoch": 0.15264367816091953, "grad_norm": 6.133742809295654, "learning_rate": 3.418546365914787e-06, "loss": 0.44767650961875916, "num_input_tokens_seen": 1269216, "step": 1660, "train_runtime": 3809.4465, "train_tokens_per_second": 333.176 }, { "epoch": 0.15273563218390804, "grad_norm": 6.014475345611572, "learning_rate": 3.4085213032581455e-06, "loss": 0.43354594707489014, "num_input_tokens_seen": 1269892, "step": 1661, "train_runtime": 3811.3655, "train_tokens_per_second": 333.186 }, { "epoch": 0.15282758620689654, "grad_norm": 6.745570182800293, "learning_rate": 3.3984962406015044e-06, "loss": 0.4856205880641937, "num_input_tokens_seen": 1270536, "step": 1662, "train_runtime": 3813.2774, "train_tokens_per_second": 333.187 }, { "epoch": 0.15291954022988505, "grad_norm": 6.704166889190674, "learning_rate": 3.3884711779448625e-06, "loss": 0.5431050658226013, "num_input_tokens_seen": 1272424, "step": 1663, "train_runtime": 3815.3608, "train_tokens_per_second": 333.5 }, { "epoch": 0.15301149425287355, "grad_norm": 7.693567752838135, "learning_rate": 3.378446115288221e-06, "loss": 0.4961692690849304, "num_input_tokens_seen": 1273080, "step": 1664, "train_runtime": 3817.2807, "train_tokens_per_second": 333.504 }, { "epoch": 0.15310344827586206, "grad_norm": 7.393714904785156, "learning_rate": 3.368421052631579e-06, "loss": 0.5113829374313354, "num_input_tokens_seen": 1273956, "step": 1665, "train_runtime": 3819.2093, "train_tokens_per_second": 333.565 }, { "epoch": 0.15319540229885056, "grad_norm": 5.7330322265625, "learning_rate": 3.3583959899749375e-06, "loss": 0.4245642423629761, "num_input_tokens_seen": 1274964, "step": 1666, "train_runtime": 3821.1812, "train_tokens_per_second": 333.657 }, { "epoch": 0.15328735632183907, "grad_norm": 5.6045613288879395, "learning_rate": 3.3483709273182964e-06, "loss": 0.3708139657974243, "num_input_tokens_seen": 1276004, "step": 1667, "train_runtime": 3823.1514, "train_tokens_per_second": 333.757 }, { "epoch": 0.15337931034482757, "grad_norm": 7.3522562980651855, "learning_rate": 3.3383458646616545e-06, "loss": 0.5081470012664795, "num_input_tokens_seen": 1276692, "step": 1668, "train_runtime": 3825.055, "train_tokens_per_second": 333.771 }, { "epoch": 0.15347126436781608, "grad_norm": 6.863851070404053, "learning_rate": 3.328320802005013e-06, "loss": 0.4304991364479065, "num_input_tokens_seen": 1277384, "step": 1669, "train_runtime": 3826.9881, "train_tokens_per_second": 333.783 }, { "epoch": 0.15356321839080458, "grad_norm": 6.657381057739258, "learning_rate": 3.318295739348371e-06, "loss": 0.4671858847141266, "num_input_tokens_seen": 1278112, "step": 1670, "train_runtime": 3828.9231, "train_tokens_per_second": 333.805 }, { "epoch": 0.1536551724137931, "grad_norm": 6.320245265960693, "learning_rate": 3.3082706766917295e-06, "loss": 0.5130354166030884, "num_input_tokens_seen": 1278844, "step": 1671, "train_runtime": 3830.8603, "train_tokens_per_second": 333.827 }, { "epoch": 0.15374712643678162, "grad_norm": 6.49079704284668, "learning_rate": 3.2982456140350885e-06, "loss": 0.3779211640357971, "num_input_tokens_seen": 1279416, "step": 1672, "train_runtime": 3832.7608, "train_tokens_per_second": 333.811 }, { "epoch": 0.15383908045977013, "grad_norm": 7.564385414123535, "learning_rate": 3.2882205513784465e-06, "loss": 0.4618367552757263, "num_input_tokens_seen": 1280068, "step": 1673, "train_runtime": 3834.6726, "train_tokens_per_second": 333.814 }, { "epoch": 0.15393103448275863, "grad_norm": 6.59860897064209, "learning_rate": 3.278195488721805e-06, "loss": 0.4915279150009155, "num_input_tokens_seen": 1280784, "step": 1674, "train_runtime": 3836.6245, "train_tokens_per_second": 333.831 }, { "epoch": 0.15402298850574714, "grad_norm": 6.710583209991455, "learning_rate": 3.268170426065163e-06, "loss": 0.4566461741924286, "num_input_tokens_seen": 1281436, "step": 1675, "train_runtime": 3838.5341, "train_tokens_per_second": 333.835 }, { "epoch": 0.15411494252873564, "grad_norm": 7.710618019104004, "learning_rate": 3.2581453634085216e-06, "loss": 0.4616769850254059, "num_input_tokens_seen": 1282268, "step": 1676, "train_runtime": 3840.4893, "train_tokens_per_second": 333.881 }, { "epoch": 0.15420689655172415, "grad_norm": 8.413847923278809, "learning_rate": 3.24812030075188e-06, "loss": 0.5942468047142029, "num_input_tokens_seen": 1283328, "step": 1677, "train_runtime": 3842.5017, "train_tokens_per_second": 333.982 }, { "epoch": 0.15429885057471265, "grad_norm": 7.268781661987305, "learning_rate": 3.2380952380952385e-06, "loss": 0.5143240690231323, "num_input_tokens_seen": 1284144, "step": 1678, "train_runtime": 3844.5112, "train_tokens_per_second": 334.02 }, { "epoch": 0.15439080459770116, "grad_norm": 5.556809902191162, "learning_rate": 3.2280701754385966e-06, "loss": 0.46623244881629944, "num_input_tokens_seen": 1286216, "step": 1679, "train_runtime": 3846.6154, "train_tokens_per_second": 334.376 }, { "epoch": 0.15448275862068966, "grad_norm": 5.99680233001709, "learning_rate": 3.218045112781955e-06, "loss": 0.3869587779045105, "num_input_tokens_seen": 1287176, "step": 1680, "train_runtime": 3848.569, "train_tokens_per_second": 334.456 }, { "epoch": 0.15457471264367817, "grad_norm": 7.0454511642456055, "learning_rate": 3.2080200501253136e-06, "loss": 0.4825194180011749, "num_input_tokens_seen": 1287908, "step": 1681, "train_runtime": 3857.0651, "train_tokens_per_second": 333.909 }, { "epoch": 0.15466666666666667, "grad_norm": 6.443118095397949, "learning_rate": 3.197994987468672e-06, "loss": 0.44234657287597656, "num_input_tokens_seen": 1288496, "step": 1682, "train_runtime": 3859.1099, "train_tokens_per_second": 333.884 }, { "epoch": 0.15475862068965518, "grad_norm": 6.089779376983643, "learning_rate": 3.1879699248120305e-06, "loss": 0.42578399181365967, "num_input_tokens_seen": 1289044, "step": 1683, "train_runtime": 3861.0221, "train_tokens_per_second": 333.861 }, { "epoch": 0.15485057471264368, "grad_norm": 6.117355823516846, "learning_rate": 3.1779448621553886e-06, "loss": 0.44038915634155273, "num_input_tokens_seen": 1289704, "step": 1684, "train_runtime": 3862.9692, "train_tokens_per_second": 333.863 }, { "epoch": 0.1549425287356322, "grad_norm": 7.234719276428223, "learning_rate": 3.167919799498747e-06, "loss": 0.5101163387298584, "num_input_tokens_seen": 1290360, "step": 1685, "train_runtime": 3864.8826, "train_tokens_per_second": 333.868 }, { "epoch": 0.1550344827586207, "grad_norm": 7.175992012023926, "learning_rate": 3.157894736842105e-06, "loss": 0.5379934310913086, "num_input_tokens_seen": 1291124, "step": 1686, "train_runtime": 3866.8199, "train_tokens_per_second": 333.898 }, { "epoch": 0.1551264367816092, "grad_norm": 6.823253631591797, "learning_rate": 3.147869674185464e-06, "loss": 0.4339263439178467, "num_input_tokens_seen": 1292260, "step": 1687, "train_runtime": 3868.8297, "train_tokens_per_second": 334.018 }, { "epoch": 0.1552183908045977, "grad_norm": 7.68180513381958, "learning_rate": 3.1378446115288226e-06, "loss": 0.4064546823501587, "num_input_tokens_seen": 1293028, "step": 1688, "train_runtime": 3870.7742, "train_tokens_per_second": 334.049 }, { "epoch": 0.1553103448275862, "grad_norm": 6.098221302032471, "learning_rate": 3.1278195488721806e-06, "loss": 0.36478671431541443, "num_input_tokens_seen": 1293676, "step": 1689, "train_runtime": 3872.6901, "train_tokens_per_second": 334.051 }, { "epoch": 0.15540229885057472, "grad_norm": 5.838031768798828, "learning_rate": 3.117794486215539e-06, "loss": 0.40487241744995117, "num_input_tokens_seen": 1294560, "step": 1690, "train_runtime": 3874.6264, "train_tokens_per_second": 334.112 }, { "epoch": 0.15549425287356322, "grad_norm": 7.832051753997803, "learning_rate": 3.107769423558897e-06, "loss": 0.4227607548236847, "num_input_tokens_seen": 1295124, "step": 1691, "train_runtime": 3876.5207, "train_tokens_per_second": 334.094 }, { "epoch": 0.15558620689655173, "grad_norm": 6.668942928314209, "learning_rate": 3.097744360902256e-06, "loss": 0.4082091450691223, "num_input_tokens_seen": 1295636, "step": 1692, "train_runtime": 3878.4186, "train_tokens_per_second": 334.063 }, { "epoch": 0.15567816091954023, "grad_norm": 6.953184604644775, "learning_rate": 3.0877192982456146e-06, "loss": 0.5256580114364624, "num_input_tokens_seen": 1296284, "step": 1693, "train_runtime": 3880.3384, "train_tokens_per_second": 334.065 }, { "epoch": 0.15577011494252874, "grad_norm": 6.644675254821777, "learning_rate": 3.0776942355889726e-06, "loss": 0.41119199991226196, "num_input_tokens_seen": 1297164, "step": 1694, "train_runtime": 3882.2728, "train_tokens_per_second": 334.125 }, { "epoch": 0.15586206896551724, "grad_norm": 7.434882640838623, "learning_rate": 3.067669172932331e-06, "loss": 0.4734553396701813, "num_input_tokens_seen": 1297912, "step": 1695, "train_runtime": 3884.1855, "train_tokens_per_second": 334.153 }, { "epoch": 0.15595402298850575, "grad_norm": 7.21633768081665, "learning_rate": 3.057644110275689e-06, "loss": 0.48472291231155396, "num_input_tokens_seen": 1298624, "step": 1696, "train_runtime": 3886.0938, "train_tokens_per_second": 334.172 }, { "epoch": 0.15604597701149425, "grad_norm": 6.820037364959717, "learning_rate": 3.047619047619048e-06, "loss": 0.34785187244415283, "num_input_tokens_seen": 1299336, "step": 1697, "train_runtime": 3888.0263, "train_tokens_per_second": 334.189 }, { "epoch": 0.15613793103448276, "grad_norm": 6.0627007484436035, "learning_rate": 3.0375939849624066e-06, "loss": 0.3812011182308197, "num_input_tokens_seen": 1299880, "step": 1698, "train_runtime": 3889.9272, "train_tokens_per_second": 334.166 }, { "epoch": 0.15622988505747126, "grad_norm": 5.8618292808532715, "learning_rate": 3.0275689223057647e-06, "loss": 0.4859369099140167, "num_input_tokens_seen": 1300944, "step": 1699, "train_runtime": 3891.8991, "train_tokens_per_second": 334.27 }, { "epoch": 0.15632183908045977, "grad_norm": 6.807727336883545, "learning_rate": 3.017543859649123e-06, "loss": 0.4760059714317322, "num_input_tokens_seen": 1301612, "step": 1700, "train_runtime": 3893.8193, "train_tokens_per_second": 334.276 }, { "epoch": 0.15641379310344827, "grad_norm": 5.982649803161621, "learning_rate": 3.007518796992481e-06, "loss": 0.4735814929008484, "num_input_tokens_seen": 1302580, "step": 1701, "train_runtime": 3895.7661, "train_tokens_per_second": 334.358 }, { "epoch": 0.15650574712643678, "grad_norm": 6.831633567810059, "learning_rate": 2.9974937343358397e-06, "loss": 0.516548752784729, "num_input_tokens_seen": 1303332, "step": 1702, "train_runtime": 3897.7255, "train_tokens_per_second": 334.383 }, { "epoch": 0.15659770114942528, "grad_norm": 7.150908470153809, "learning_rate": 2.9874686716791986e-06, "loss": 0.5031217932701111, "num_input_tokens_seen": 1304004, "step": 1703, "train_runtime": 3899.6403, "train_tokens_per_second": 334.391 }, { "epoch": 0.1566896551724138, "grad_norm": 8.302416801452637, "learning_rate": 2.9774436090225567e-06, "loss": 0.5160796642303467, "num_input_tokens_seen": 1304632, "step": 1704, "train_runtime": 3901.5764, "train_tokens_per_second": 334.386 }, { "epoch": 0.1567816091954023, "grad_norm": 7.03695011138916, "learning_rate": 2.967418546365915e-06, "loss": 0.5238287448883057, "num_input_tokens_seen": 1305564, "step": 1705, "train_runtime": 3903.6113, "train_tokens_per_second": 334.45 }, { "epoch": 0.1568735632183908, "grad_norm": 7.0970258712768555, "learning_rate": 2.9573934837092732e-06, "loss": 0.48913565278053284, "num_input_tokens_seen": 1306148, "step": 1706, "train_runtime": 3905.5277, "train_tokens_per_second": 334.436 }, { "epoch": 0.1569655172413793, "grad_norm": 6.433727264404297, "learning_rate": 2.9473684210526317e-06, "loss": 0.5272034406661987, "num_input_tokens_seen": 1306844, "step": 1707, "train_runtime": 3907.463, "train_tokens_per_second": 334.448 }, { "epoch": 0.1570574712643678, "grad_norm": 5.6281914710998535, "learning_rate": 2.93734335839599e-06, "loss": 0.4618489146232605, "num_input_tokens_seen": 1307480, "step": 1708, "train_runtime": 3909.4034, "train_tokens_per_second": 334.445 }, { "epoch": 0.15714942528735631, "grad_norm": 7.447822570800781, "learning_rate": 2.9273182957393487e-06, "loss": 0.4627896845340729, "num_input_tokens_seen": 1308100, "step": 1709, "train_runtime": 3911.3177, "train_tokens_per_second": 334.44 }, { "epoch": 0.15724137931034482, "grad_norm": 6.788646221160889, "learning_rate": 2.9172932330827068e-06, "loss": 0.36336851119995117, "num_input_tokens_seen": 1308704, "step": 1710, "train_runtime": 3913.3065, "train_tokens_per_second": 334.424 }, { "epoch": 0.15733333333333333, "grad_norm": 6.882571697235107, "learning_rate": 2.9072681704260652e-06, "loss": 0.4588228762149811, "num_input_tokens_seen": 1309428, "step": 1711, "train_runtime": 3921.5543, "train_tokens_per_second": 333.905 }, { "epoch": 0.15742528735632183, "grad_norm": 5.915749549865723, "learning_rate": 2.8972431077694237e-06, "loss": 0.5249640941619873, "num_input_tokens_seen": 1311304, "step": 1712, "train_runtime": 3923.611, "train_tokens_per_second": 334.208 }, { "epoch": 0.15751724137931034, "grad_norm": 6.004611015319824, "learning_rate": 2.8872180451127822e-06, "loss": 0.37069863080978394, "num_input_tokens_seen": 1312204, "step": 1713, "train_runtime": 3925.5443, "train_tokens_per_second": 334.273 }, { "epoch": 0.15760919540229884, "grad_norm": 6.544671535491943, "learning_rate": 2.8771929824561407e-06, "loss": 0.47094351053237915, "num_input_tokens_seen": 1312992, "step": 1714, "train_runtime": 3927.4819, "train_tokens_per_second": 334.309 }, { "epoch": 0.15770114942528735, "grad_norm": 7.051267147064209, "learning_rate": 2.8671679197994988e-06, "loss": 0.5160407423973083, "num_input_tokens_seen": 1313932, "step": 1715, "train_runtime": 3929.4477, "train_tokens_per_second": 334.381 }, { "epoch": 0.15779310344827585, "grad_norm": 6.341228485107422, "learning_rate": 2.8571428571428573e-06, "loss": 0.4405323565006256, "num_input_tokens_seen": 1314560, "step": 1716, "train_runtime": 3931.3638, "train_tokens_per_second": 334.378 }, { "epoch": 0.15788505747126436, "grad_norm": 7.63276481628418, "learning_rate": 2.8471177944862153e-06, "loss": 0.5746864676475525, "num_input_tokens_seen": 1315328, "step": 1717, "train_runtime": 3933.2805, "train_tokens_per_second": 334.41 }, { "epoch": 0.15797701149425286, "grad_norm": 6.935079574584961, "learning_rate": 2.8370927318295742e-06, "loss": 0.4732591211795807, "num_input_tokens_seen": 1315996, "step": 1718, "train_runtime": 3935.2289, "train_tokens_per_second": 334.414 }, { "epoch": 0.15806896551724137, "grad_norm": 6.347714424133301, "learning_rate": 2.8270676691729327e-06, "loss": 0.47049689292907715, "num_input_tokens_seen": 1317108, "step": 1719, "train_runtime": 3937.247, "train_tokens_per_second": 334.525 }, { "epoch": 0.15816091954022987, "grad_norm": 7.859142780303955, "learning_rate": 2.8170426065162908e-06, "loss": 0.5596014261245728, "num_input_tokens_seen": 1317852, "step": 1720, "train_runtime": 3939.1807, "train_tokens_per_second": 334.55 }, { "epoch": 0.15825287356321838, "grad_norm": 6.996805667877197, "learning_rate": 2.8070175438596493e-06, "loss": 0.5160921812057495, "num_input_tokens_seen": 1318620, "step": 1721, "train_runtime": 3941.1569, "train_tokens_per_second": 334.577 }, { "epoch": 0.1583448275862069, "grad_norm": 7.523529529571533, "learning_rate": 2.7969924812030073e-06, "loss": 0.4985366463661194, "num_input_tokens_seen": 1319368, "step": 1722, "train_runtime": 3943.1009, "train_tokens_per_second": 334.602 }, { "epoch": 0.15843678160919542, "grad_norm": 7.76933479309082, "learning_rate": 2.7869674185463662e-06, "loss": 0.4792497158050537, "num_input_tokens_seen": 1320100, "step": 1723, "train_runtime": 3945.0247, "train_tokens_per_second": 334.624 }, { "epoch": 0.15852873563218392, "grad_norm": 7.034414291381836, "learning_rate": 2.7769423558897247e-06, "loss": 0.41507336497306824, "num_input_tokens_seen": 1320980, "step": 1724, "train_runtime": 3946.9731, "train_tokens_per_second": 334.682 }, { "epoch": 0.15862068965517243, "grad_norm": 6.495769500732422, "learning_rate": 2.766917293233083e-06, "loss": 0.5253562331199646, "num_input_tokens_seen": 1322188, "step": 1725, "train_runtime": 3949.049, "train_tokens_per_second": 334.812 }, { "epoch": 0.15871264367816093, "grad_norm": 8.071935653686523, "learning_rate": 2.7568922305764413e-06, "loss": 0.4798712134361267, "num_input_tokens_seen": 1322764, "step": 1726, "train_runtime": 3950.9752, "train_tokens_per_second": 334.794 }, { "epoch": 0.15880459770114944, "grad_norm": 7.1461992263793945, "learning_rate": 2.7468671679197994e-06, "loss": 0.6246401071548462, "num_input_tokens_seen": 1323480, "step": 1727, "train_runtime": 3952.8856, "train_tokens_per_second": 334.814 }, { "epoch": 0.15889655172413794, "grad_norm": 6.823047637939453, "learning_rate": 2.7368421052631583e-06, "loss": 0.35014140605926514, "num_input_tokens_seen": 1324044, "step": 1728, "train_runtime": 3954.7995, "train_tokens_per_second": 334.794 }, { "epoch": 0.15898850574712645, "grad_norm": 6.551754474639893, "learning_rate": 2.7268170426065167e-06, "loss": 0.5031850337982178, "num_input_tokens_seen": 1324724, "step": 1729, "train_runtime": 3956.7389, "train_tokens_per_second": 334.802 }, { "epoch": 0.15908045977011495, "grad_norm": 6.587690830230713, "learning_rate": 2.716791979949875e-06, "loss": 0.4396337568759918, "num_input_tokens_seen": 1325392, "step": 1730, "train_runtime": 3958.6609, "train_tokens_per_second": 334.808 }, { "epoch": 0.15917241379310346, "grad_norm": 6.230381965637207, "learning_rate": 2.7067669172932333e-06, "loss": 0.48301368951797485, "num_input_tokens_seen": 1326004, "step": 1731, "train_runtime": 3960.5856, "train_tokens_per_second": 334.8 }, { "epoch": 0.15926436781609196, "grad_norm": 6.516656398773193, "learning_rate": 2.6967418546365914e-06, "loss": 0.48590826988220215, "num_input_tokens_seen": 1326644, "step": 1732, "train_runtime": 3962.5059, "train_tokens_per_second": 334.799 }, { "epoch": 0.15935632183908047, "grad_norm": 8.143502235412598, "learning_rate": 2.6867167919799503e-06, "loss": 0.5189724564552307, "num_input_tokens_seen": 1327536, "step": 1733, "train_runtime": 3964.474, "train_tokens_per_second": 334.858 }, { "epoch": 0.15944827586206897, "grad_norm": 6.90491247177124, "learning_rate": 2.6766917293233088e-06, "loss": 0.5360757112503052, "num_input_tokens_seen": 1328192, "step": 1734, "train_runtime": 3966.3916, "train_tokens_per_second": 334.862 }, { "epoch": 0.15954022988505748, "grad_norm": 6.260725021362305, "learning_rate": 2.666666666666667e-06, "loss": 0.42252597212791443, "num_input_tokens_seen": 1328852, "step": 1735, "train_runtime": 3968.3117, "train_tokens_per_second": 334.866 }, { "epoch": 0.15963218390804598, "grad_norm": 5.750924110412598, "learning_rate": 2.6566416040100253e-06, "loss": 0.45929282903671265, "num_input_tokens_seen": 1330104, "step": 1736, "train_runtime": 3970.3284, "train_tokens_per_second": 335.011 }, { "epoch": 0.1597241379310345, "grad_norm": 7.40118408203125, "learning_rate": 2.6466165413533834e-06, "loss": 0.4813888967037201, "num_input_tokens_seen": 1330680, "step": 1737, "train_runtime": 3972.2401, "train_tokens_per_second": 334.995 }, { "epoch": 0.159816091954023, "grad_norm": 7.092006206512451, "learning_rate": 2.6365914786967423e-06, "loss": 0.4561431407928467, "num_input_tokens_seen": 1331332, "step": 1738, "train_runtime": 3974.1563, "train_tokens_per_second": 334.997 }, { "epoch": 0.1599080459770115, "grad_norm": 7.546247959136963, "learning_rate": 2.6265664160401004e-06, "loss": 0.4432491660118103, "num_input_tokens_seen": 1332064, "step": 1739, "train_runtime": 3976.0804, "train_tokens_per_second": 335.019 }, { "epoch": 0.16, "grad_norm": 7.441892147064209, "learning_rate": 2.616541353383459e-06, "loss": 0.46018320322036743, "num_input_tokens_seen": 1332656, "step": 1740, "train_runtime": 3977.9985, "train_tokens_per_second": 335.007 }, { "epoch": 0.1600919540229885, "grad_norm": 6.686703681945801, "learning_rate": 2.606516290726817e-06, "loss": 0.4715593457221985, "num_input_tokens_seen": 1333284, "step": 1741, "train_runtime": 3986.5354, "train_tokens_per_second": 334.447 }, { "epoch": 0.160183908045977, "grad_norm": 7.182392120361328, "learning_rate": 2.5964912280701754e-06, "loss": 0.5060937404632568, "num_input_tokens_seen": 1333896, "step": 1742, "train_runtime": 3988.4518, "train_tokens_per_second": 334.44 }, { "epoch": 0.16027586206896552, "grad_norm": 6.546034812927246, "learning_rate": 2.5864661654135343e-06, "loss": 0.41727566719055176, "num_input_tokens_seen": 1334504, "step": 1743, "train_runtime": 3990.4248, "train_tokens_per_second": 334.427 }, { "epoch": 0.16036781609195402, "grad_norm": 6.587306022644043, "learning_rate": 2.5764411027568924e-06, "loss": 0.43473294377326965, "num_input_tokens_seen": 1335188, "step": 1744, "train_runtime": 3992.3309, "train_tokens_per_second": 334.438 }, { "epoch": 0.16045977011494253, "grad_norm": 6.231787204742432, "learning_rate": 2.566416040100251e-06, "loss": 0.4099838137626648, "num_input_tokens_seen": 1335752, "step": 1745, "train_runtime": 3994.232, "train_tokens_per_second": 334.42 }, { "epoch": 0.16055172413793103, "grad_norm": 6.253069877624512, "learning_rate": 2.556390977443609e-06, "loss": 0.42506536841392517, "num_input_tokens_seen": 1336388, "step": 1746, "train_runtime": 3996.2888, "train_tokens_per_second": 334.407 }, { "epoch": 0.16064367816091954, "grad_norm": 9.03331470489502, "learning_rate": 2.5463659147869674e-06, "loss": 0.5423241853713989, "num_input_tokens_seen": 1337136, "step": 1747, "train_runtime": 3998.2712, "train_tokens_per_second": 334.429 }, { "epoch": 0.16073563218390804, "grad_norm": 7.214175224304199, "learning_rate": 2.5363408521303263e-06, "loss": 0.5407247543334961, "num_input_tokens_seen": 1337972, "step": 1748, "train_runtime": 4000.2375, "train_tokens_per_second": 334.473 }, { "epoch": 0.16082758620689655, "grad_norm": 6.139636993408203, "learning_rate": 2.5263157894736844e-06, "loss": 0.40379995107650757, "num_input_tokens_seen": 1338576, "step": 1749, "train_runtime": 4002.1723, "train_tokens_per_second": 334.462 }, { "epoch": 0.16091954022988506, "grad_norm": 6.8690385818481445, "learning_rate": 2.516290726817043e-06, "loss": 0.47756439447402954, "num_input_tokens_seen": 1339544, "step": 1750, "train_runtime": 4004.1659, "train_tokens_per_second": 334.538 }, { "epoch": 0.16101149425287356, "grad_norm": 7.211779594421387, "learning_rate": 2.506265664160401e-06, "loss": 0.4632889926433563, "num_input_tokens_seen": 1340204, "step": 1751, "train_runtime": 4006.1382, "train_tokens_per_second": 334.538 }, { "epoch": 0.16110344827586207, "grad_norm": 6.297443389892578, "learning_rate": 2.4962406015037594e-06, "loss": 0.45367634296417236, "num_input_tokens_seen": 1341040, "step": 1752, "train_runtime": 4008.128, "train_tokens_per_second": 334.58 }, { "epoch": 0.16119540229885057, "grad_norm": 5.939846992492676, "learning_rate": 2.486215538847118e-06, "loss": 0.372577965259552, "num_input_tokens_seen": 1341660, "step": 1753, "train_runtime": 4010.0567, "train_tokens_per_second": 334.574 }, { "epoch": 0.16128735632183908, "grad_norm": 6.601139545440674, "learning_rate": 2.4761904761904764e-06, "loss": 0.4091433882713318, "num_input_tokens_seen": 1342384, "step": 1754, "train_runtime": 4011.9916, "train_tokens_per_second": 334.593 }, { "epoch": 0.16137931034482758, "grad_norm": 6.731122970581055, "learning_rate": 2.466165413533835e-06, "loss": 0.44458529353141785, "num_input_tokens_seen": 1342952, "step": 1755, "train_runtime": 4013.9086, "train_tokens_per_second": 334.575 }, { "epoch": 0.1614712643678161, "grad_norm": 7.471959114074707, "learning_rate": 2.456140350877193e-06, "loss": 0.5619382858276367, "num_input_tokens_seen": 1343872, "step": 1756, "train_runtime": 4015.8825, "train_tokens_per_second": 334.639 }, { "epoch": 0.1615632183908046, "grad_norm": 6.827757835388184, "learning_rate": 2.4461152882205514e-06, "loss": 0.3854348361492157, "num_input_tokens_seen": 1344516, "step": 1757, "train_runtime": 4017.7989, "train_tokens_per_second": 334.64 }, { "epoch": 0.1616551724137931, "grad_norm": 6.161599159240723, "learning_rate": 2.43609022556391e-06, "loss": 0.49510788917541504, "num_input_tokens_seen": 1345892, "step": 1758, "train_runtime": 4019.8311, "train_tokens_per_second": 334.813 }, { "epoch": 0.1617471264367816, "grad_norm": 6.267351150512695, "learning_rate": 2.4260651629072684e-06, "loss": 0.4766969382762909, "num_input_tokens_seen": 1346696, "step": 1759, "train_runtime": 4021.7709, "train_tokens_per_second": 334.851 }, { "epoch": 0.1618390804597701, "grad_norm": 10.214824676513672, "learning_rate": 2.416040100250627e-06, "loss": 0.5045785307884216, "num_input_tokens_seen": 1347484, "step": 1760, "train_runtime": 4023.73, "train_tokens_per_second": 334.884 }, { "epoch": 0.1619310344827586, "grad_norm": 7.075687408447266, "learning_rate": 2.406015037593985e-06, "loss": 0.3947675824165344, "num_input_tokens_seen": 1348020, "step": 1761, "train_runtime": 4025.6301, "train_tokens_per_second": 334.859 }, { "epoch": 0.16202298850574712, "grad_norm": 6.410388946533203, "learning_rate": 2.3959899749373435e-06, "loss": 0.4875537157058716, "num_input_tokens_seen": 1348708, "step": 1762, "train_runtime": 4027.5379, "train_tokens_per_second": 334.872 }, { "epoch": 0.16211494252873562, "grad_norm": 6.277807712554932, "learning_rate": 2.385964912280702e-06, "loss": 0.4184660315513611, "num_input_tokens_seen": 1349424, "step": 1763, "train_runtime": 4029.4461, "train_tokens_per_second": 334.891 }, { "epoch": 0.16220689655172413, "grad_norm": 7.242740154266357, "learning_rate": 2.3759398496240604e-06, "loss": 0.49717608094215393, "num_input_tokens_seen": 1350448, "step": 1764, "train_runtime": 4031.4138, "train_tokens_per_second": 334.981 }, { "epoch": 0.16229885057471263, "grad_norm": 6.5039143562316895, "learning_rate": 2.365914786967419e-06, "loss": 0.424640953540802, "num_input_tokens_seen": 1351032, "step": 1765, "train_runtime": 4033.3334, "train_tokens_per_second": 334.967 }, { "epoch": 0.16239080459770114, "grad_norm": 7.855981349945068, "learning_rate": 2.355889724310777e-06, "loss": 0.4662795066833496, "num_input_tokens_seen": 1352144, "step": 1766, "train_runtime": 4035.3466, "train_tokens_per_second": 335.075 }, { "epoch": 0.16248275862068964, "grad_norm": 6.1420063972473145, "learning_rate": 2.3458646616541355e-06, "loss": 0.4422057867050171, "num_input_tokens_seen": 1352836, "step": 1767, "train_runtime": 4037.2767, "train_tokens_per_second": 335.086 }, { "epoch": 0.16257471264367815, "grad_norm": 7.944182395935059, "learning_rate": 2.335839598997494e-06, "loss": 0.476218044757843, "num_input_tokens_seen": 1353508, "step": 1768, "train_runtime": 4039.1875, "train_tokens_per_second": 335.094 }, { "epoch": 0.16266666666666665, "grad_norm": 6.096160411834717, "learning_rate": 2.3258145363408524e-06, "loss": 0.40059059858322144, "num_input_tokens_seen": 1354336, "step": 1769, "train_runtime": 4041.1302, "train_tokens_per_second": 335.138 }, { "epoch": 0.16275862068965516, "grad_norm": 6.71887731552124, "learning_rate": 2.3157894736842105e-06, "loss": 0.4041825532913208, "num_input_tokens_seen": 1354996, "step": 1770, "train_runtime": 4043.0408, "train_tokens_per_second": 335.143 }, { "epoch": 0.1628505747126437, "grad_norm": 6.223047733306885, "learning_rate": 2.305764411027569e-06, "loss": 0.4100489020347595, "num_input_tokens_seen": 1355584, "step": 1771, "train_runtime": 4051.5699, "train_tokens_per_second": 334.582 }, { "epoch": 0.1629425287356322, "grad_norm": 6.081003189086914, "learning_rate": 2.2957393483709275e-06, "loss": 0.41684621572494507, "num_input_tokens_seen": 1356148, "step": 1772, "train_runtime": 4053.6839, "train_tokens_per_second": 334.547 }, { "epoch": 0.1630344827586207, "grad_norm": 7.356428146362305, "learning_rate": 2.285714285714286e-06, "loss": 0.4125157594680786, "num_input_tokens_seen": 1356816, "step": 1773, "train_runtime": 4055.6857, "train_tokens_per_second": 334.547 }, { "epoch": 0.1631264367816092, "grad_norm": 6.269641399383545, "learning_rate": 2.2756892230576445e-06, "loss": 0.5003457069396973, "num_input_tokens_seen": 1357496, "step": 1774, "train_runtime": 4057.6035, "train_tokens_per_second": 334.556 }, { "epoch": 0.1632183908045977, "grad_norm": 6.636397838592529, "learning_rate": 2.2656641604010025e-06, "loss": 0.3927608132362366, "num_input_tokens_seen": 1358084, "step": 1775, "train_runtime": 4059.5124, "train_tokens_per_second": 334.544 }, { "epoch": 0.16331034482758622, "grad_norm": 6.633103370666504, "learning_rate": 2.255639097744361e-06, "loss": 0.5156530141830444, "num_input_tokens_seen": 1359024, "step": 1776, "train_runtime": 4061.4703, "train_tokens_per_second": 334.614 }, { "epoch": 0.16340229885057472, "grad_norm": 7.025842666625977, "learning_rate": 2.2456140350877195e-06, "loss": 0.42199695110321045, "num_input_tokens_seen": 1359540, "step": 1777, "train_runtime": 4063.3759, "train_tokens_per_second": 334.584 }, { "epoch": 0.16349425287356323, "grad_norm": 7.5587286949157715, "learning_rate": 2.235588972431078e-06, "loss": 0.4943675398826599, "num_input_tokens_seen": 1360224, "step": 1778, "train_runtime": 4065.3012, "train_tokens_per_second": 334.594 }, { "epoch": 0.16358620689655173, "grad_norm": 7.1349568367004395, "learning_rate": 2.2255639097744365e-06, "loss": 0.6079813241958618, "num_input_tokens_seen": 1361088, "step": 1779, "train_runtime": 4067.2138, "train_tokens_per_second": 334.649 }, { "epoch": 0.16367816091954024, "grad_norm": 5.987335205078125, "learning_rate": 2.2155388471177945e-06, "loss": 0.43679770827293396, "num_input_tokens_seen": 1361780, "step": 1780, "train_runtime": 4069.1329, "train_tokens_per_second": 334.661 }, { "epoch": 0.16377011494252874, "grad_norm": 5.992737293243408, "learning_rate": 2.205513784461153e-06, "loss": 0.367605060338974, "num_input_tokens_seen": 1362384, "step": 1781, "train_runtime": 4071.0538, "train_tokens_per_second": 334.651 }, { "epoch": 0.16386206896551725, "grad_norm": 7.0040283203125, "learning_rate": 2.1954887218045115e-06, "loss": 0.4569029211997986, "num_input_tokens_seen": 1363044, "step": 1782, "train_runtime": 4073.0035, "train_tokens_per_second": 334.653 }, { "epoch": 0.16395402298850575, "grad_norm": 6.85443639755249, "learning_rate": 2.1854636591478696e-06, "loss": 0.5083461403846741, "num_input_tokens_seen": 1363688, "step": 1783, "train_runtime": 4074.9377, "train_tokens_per_second": 334.652 }, { "epoch": 0.16404597701149426, "grad_norm": 6.63103723526001, "learning_rate": 2.1754385964912285e-06, "loss": 0.4410957396030426, "num_input_tokens_seen": 1364356, "step": 1784, "train_runtime": 4076.8597, "train_tokens_per_second": 334.659 }, { "epoch": 0.16413793103448276, "grad_norm": 6.289424419403076, "learning_rate": 2.1654135338345866e-06, "loss": 0.49302607774734497, "num_input_tokens_seen": 1365028, "step": 1785, "train_runtime": 4078.768, "train_tokens_per_second": 334.667 }, { "epoch": 0.16422988505747127, "grad_norm": 6.578011512756348, "learning_rate": 2.155388471177945e-06, "loss": 0.38957542181015015, "num_input_tokens_seen": 1365668, "step": 1786, "train_runtime": 4080.6737, "train_tokens_per_second": 334.667 }, { "epoch": 0.16432183908045978, "grad_norm": 7.1062798500061035, "learning_rate": 2.1453634085213035e-06, "loss": 0.41782549023628235, "num_input_tokens_seen": 1366204, "step": 1787, "train_runtime": 4082.5966, "train_tokens_per_second": 334.641 }, { "epoch": 0.16441379310344828, "grad_norm": 7.929337978363037, "learning_rate": 2.1353383458646616e-06, "loss": 0.4896957278251648, "num_input_tokens_seen": 1366752, "step": 1788, "train_runtime": 4084.5871, "train_tokens_per_second": 334.612 }, { "epoch": 0.16450574712643679, "grad_norm": 5.988348007202148, "learning_rate": 2.1253132832080205e-06, "loss": 0.4074459373950958, "num_input_tokens_seen": 1367320, "step": 1789, "train_runtime": 4086.4942, "train_tokens_per_second": 334.595 }, { "epoch": 0.1645977011494253, "grad_norm": 7.091726779937744, "learning_rate": 2.1152882205513786e-06, "loss": 0.4936490058898926, "num_input_tokens_seen": 1368120, "step": 1790, "train_runtime": 4088.4181, "train_tokens_per_second": 334.633 }, { "epoch": 0.1646896551724138, "grad_norm": 6.799236297607422, "learning_rate": 2.105263157894737e-06, "loss": 0.502659022808075, "num_input_tokens_seen": 1368840, "step": 1791, "train_runtime": 4090.3316, "train_tokens_per_second": 334.653 }, { "epoch": 0.1647816091954023, "grad_norm": 6.0580363273620605, "learning_rate": 2.0952380952380955e-06, "loss": 0.4692020118236542, "num_input_tokens_seen": 1369660, "step": 1792, "train_runtime": 4092.3518, "train_tokens_per_second": 334.688 }, { "epoch": 0.1648735632183908, "grad_norm": 6.381335735321045, "learning_rate": 2.0852130325814536e-06, "loss": 0.38795846700668335, "num_input_tokens_seen": 1370264, "step": 1793, "train_runtime": 4094.2678, "train_tokens_per_second": 334.679 }, { "epoch": 0.1649655172413793, "grad_norm": 6.306175708770752, "learning_rate": 2.075187969924812e-06, "loss": 0.6098124384880066, "num_input_tokens_seen": 1371552, "step": 1794, "train_runtime": 4096.2733, "train_tokens_per_second": 334.829 }, { "epoch": 0.16505747126436782, "grad_norm": 7.6732587814331055, "learning_rate": 2.0651629072681706e-06, "loss": 0.5691096782684326, "num_input_tokens_seen": 1372264, "step": 1795, "train_runtime": 4098.2038, "train_tokens_per_second": 334.845 }, { "epoch": 0.16514942528735632, "grad_norm": 6.454239845275879, "learning_rate": 2.055137844611529e-06, "loss": 0.4893447160720825, "num_input_tokens_seen": 1373100, "step": 1796, "train_runtime": 4100.2212, "train_tokens_per_second": 334.884 }, { "epoch": 0.16524137931034483, "grad_norm": 7.020412921905518, "learning_rate": 2.0451127819548876e-06, "loss": 0.49594277143478394, "num_input_tokens_seen": 1373912, "step": 1797, "train_runtime": 4102.1636, "train_tokens_per_second": 334.924 }, { "epoch": 0.16533333333333333, "grad_norm": 7.460563659667969, "learning_rate": 2.0350877192982456e-06, "loss": 0.4521038234233856, "num_input_tokens_seen": 1374544, "step": 1798, "train_runtime": 4104.0742, "train_tokens_per_second": 334.922 }, { "epoch": 0.16542528735632184, "grad_norm": 6.527820110321045, "learning_rate": 2.025062656641604e-06, "loss": 0.4866308271884918, "num_input_tokens_seen": 1375344, "step": 1799, "train_runtime": 4105.987, "train_tokens_per_second": 334.961 }, { "epoch": 0.16551724137931034, "grad_norm": 6.184874534606934, "learning_rate": 2.0150375939849626e-06, "loss": 0.4070171117782593, "num_input_tokens_seen": 1375940, "step": 1800, "train_runtime": 4107.9003, "train_tokens_per_second": 334.95 }, { "epoch": 0.16551724137931034, "eval_loss": 1.7983349561691284, "eval_runtime": 27.8808, "eval_samples_per_second": 35.867, "eval_steps_per_second": 8.967, "num_input_tokens_seen": 1375940, "step": 1800 }, { "epoch": 0.16560919540229885, "grad_norm": 6.80704402923584, "learning_rate": 2.0050125313283207e-06, "loss": 0.48958921432495117, "num_input_tokens_seen": 1376552, "step": 1801, "train_runtime": 4144.6166, "train_tokens_per_second": 332.13 }, { "epoch": 0.16570114942528735, "grad_norm": 6.7276835441589355, "learning_rate": 1.9949874686716796e-06, "loss": 0.47152501344680786, "num_input_tokens_seen": 1377364, "step": 1802, "train_runtime": 4146.5338, "train_tokens_per_second": 332.172 }, { "epoch": 0.16579310344827586, "grad_norm": 6.990015983581543, "learning_rate": 1.9849624060150376e-06, "loss": 0.36413344740867615, "num_input_tokens_seen": 1377880, "step": 1803, "train_runtime": 4148.44, "train_tokens_per_second": 332.144 }, { "epoch": 0.16588505747126436, "grad_norm": 6.266055583953857, "learning_rate": 1.974937343358396e-06, "loss": 0.467947393655777, "num_input_tokens_seen": 1379668, "step": 1804, "train_runtime": 4150.5003, "train_tokens_per_second": 332.41 }, { "epoch": 0.16597701149425287, "grad_norm": 7.12498664855957, "learning_rate": 1.9649122807017546e-06, "loss": 0.4401271343231201, "num_input_tokens_seen": 1380344, "step": 1805, "train_runtime": 4152.4249, "train_tokens_per_second": 332.419 }, { "epoch": 0.16606896551724137, "grad_norm": 7.541736602783203, "learning_rate": 1.9548872180451127e-06, "loss": 0.5291580557823181, "num_input_tokens_seen": 1381068, "step": 1806, "train_runtime": 4154.3356, "train_tokens_per_second": 332.44 }, { "epoch": 0.16616091954022988, "grad_norm": 6.489492416381836, "learning_rate": 1.9448621553884716e-06, "loss": 0.4885668158531189, "num_input_tokens_seen": 1381812, "step": 1807, "train_runtime": 4156.257, "train_tokens_per_second": 332.465 }, { "epoch": 0.16625287356321838, "grad_norm": 6.762707233428955, "learning_rate": 1.9348370927318297e-06, "loss": 0.5028106570243835, "num_input_tokens_seen": 1382684, "step": 1808, "train_runtime": 4158.1738, "train_tokens_per_second": 332.522 }, { "epoch": 0.1663448275862069, "grad_norm": 6.673324108123779, "learning_rate": 1.924812030075188e-06, "loss": 0.4497567415237427, "num_input_tokens_seen": 1383216, "step": 1809, "train_runtime": 4160.0875, "train_tokens_per_second": 332.497 }, { "epoch": 0.1664367816091954, "grad_norm": 6.737390518188477, "learning_rate": 1.9147869674185466e-06, "loss": 0.4985470175743103, "num_input_tokens_seen": 1384276, "step": 1810, "train_runtime": 4162.0671, "train_tokens_per_second": 332.593 }, { "epoch": 0.1665287356321839, "grad_norm": 6.969824314117432, "learning_rate": 1.904761904761905e-06, "loss": 0.4589076638221741, "num_input_tokens_seen": 1384988, "step": 1811, "train_runtime": 4163.9821, "train_tokens_per_second": 332.611 }, { "epoch": 0.1666206896551724, "grad_norm": 6.854494571685791, "learning_rate": 1.8947368421052634e-06, "loss": 0.5440043807029724, "num_input_tokens_seen": 1385884, "step": 1812, "train_runtime": 4165.9222, "train_tokens_per_second": 332.672 }, { "epoch": 0.1667126436781609, "grad_norm": 6.483313083648682, "learning_rate": 1.8847117794486217e-06, "loss": 0.39688774943351746, "num_input_tokens_seen": 1386504, "step": 1813, "train_runtime": 4167.8278, "train_tokens_per_second": 332.668 }, { "epoch": 0.16680459770114942, "grad_norm": 6.542842864990234, "learning_rate": 1.8746867167919802e-06, "loss": 0.43845048546791077, "num_input_tokens_seen": 1387280, "step": 1814, "train_runtime": 4169.8246, "train_tokens_per_second": 332.695 }, { "epoch": 0.16689655172413792, "grad_norm": 7.002591133117676, "learning_rate": 1.8646616541353384e-06, "loss": 0.5158287286758423, "num_input_tokens_seen": 1387924, "step": 1815, "train_runtime": 4171.7613, "train_tokens_per_second": 332.695 }, { "epoch": 0.16698850574712643, "grad_norm": 7.141075134277344, "learning_rate": 1.8546365914786967e-06, "loss": 0.5292612314224243, "num_input_tokens_seen": 1388844, "step": 1816, "train_runtime": 4173.7319, "train_tokens_per_second": 332.758 }, { "epoch": 0.16708045977011493, "grad_norm": 6.492411136627197, "learning_rate": 1.8446115288220554e-06, "loss": 0.4482610821723938, "num_input_tokens_seen": 1389604, "step": 1817, "train_runtime": 4175.6523, "train_tokens_per_second": 332.787 }, { "epoch": 0.16717241379310344, "grad_norm": 6.330272674560547, "learning_rate": 1.8345864661654137e-06, "loss": 0.39253392815589905, "num_input_tokens_seen": 1390692, "step": 1818, "train_runtime": 4177.6354, "train_tokens_per_second": 332.89 }, { "epoch": 0.16726436781609194, "grad_norm": 6.166111946105957, "learning_rate": 1.8245614035087722e-06, "loss": 0.46502041816711426, "num_input_tokens_seen": 1391364, "step": 1819, "train_runtime": 4179.5684, "train_tokens_per_second": 332.897 }, { "epoch": 0.16735632183908045, "grad_norm": 6.842964172363281, "learning_rate": 1.8145363408521305e-06, "loss": 0.6573138236999512, "num_input_tokens_seen": 1392472, "step": 1820, "train_runtime": 4181.5446, "train_tokens_per_second": 333.004 }, { "epoch": 0.16744827586206898, "grad_norm": 7.465213775634766, "learning_rate": 1.8045112781954887e-06, "loss": 0.4444107115268707, "num_input_tokens_seen": 1393228, "step": 1821, "train_runtime": 4183.5082, "train_tokens_per_second": 333.029 }, { "epoch": 0.16754022988505748, "grad_norm": 6.911365509033203, "learning_rate": 1.7944862155388474e-06, "loss": 0.36707374453544617, "num_input_tokens_seen": 1393876, "step": 1822, "train_runtime": 4185.4746, "train_tokens_per_second": 333.027 }, { "epoch": 0.167632183908046, "grad_norm": 7.916104793548584, "learning_rate": 1.7844611528822057e-06, "loss": 0.5797393321990967, "num_input_tokens_seen": 1394536, "step": 1823, "train_runtime": 4187.4005, "train_tokens_per_second": 333.031 }, { "epoch": 0.1677241379310345, "grad_norm": 6.57176399230957, "learning_rate": 1.7744360902255642e-06, "loss": 0.3756246268749237, "num_input_tokens_seen": 1395016, "step": 1824, "train_runtime": 4189.3225, "train_tokens_per_second": 332.993 }, { "epoch": 0.167816091954023, "grad_norm": 6.847811698913574, "learning_rate": 1.7644110275689225e-06, "loss": 0.513152003288269, "num_input_tokens_seen": 1395924, "step": 1825, "train_runtime": 4191.2987, "train_tokens_per_second": 333.053 }, { "epoch": 0.1679080459770115, "grad_norm": 6.873049259185791, "learning_rate": 1.7543859649122807e-06, "loss": 0.41355061531066895, "num_input_tokens_seen": 1396544, "step": 1826, "train_runtime": 4193.2885, "train_tokens_per_second": 333.043 }, { "epoch": 0.168, "grad_norm": 6.391554355621338, "learning_rate": 1.7443609022556392e-06, "loss": 0.472981333732605, "num_input_tokens_seen": 1397468, "step": 1827, "train_runtime": 4195.2428, "train_tokens_per_second": 333.108 }, { "epoch": 0.16809195402298852, "grad_norm": 6.501170635223389, "learning_rate": 1.7343358395989975e-06, "loss": 0.45052164793014526, "num_input_tokens_seen": 1398316, "step": 1828, "train_runtime": 4197.2152, "train_tokens_per_second": 333.153 }, { "epoch": 0.16818390804597702, "grad_norm": 6.45281982421875, "learning_rate": 1.7243107769423562e-06, "loss": 0.4184761941432953, "num_input_tokens_seen": 1398968, "step": 1829, "train_runtime": 4199.1346, "train_tokens_per_second": 333.156 }, { "epoch": 0.16827586206896553, "grad_norm": 6.822763442993164, "learning_rate": 1.7142857142857145e-06, "loss": 0.5204285383224487, "num_input_tokens_seen": 1399840, "step": 1830, "train_runtime": 4201.0664, "train_tokens_per_second": 333.211 }, { "epoch": 0.16836781609195403, "grad_norm": 9.192536354064941, "learning_rate": 1.7042606516290728e-06, "loss": 0.4176218807697296, "num_input_tokens_seen": 1400404, "step": 1831, "train_runtime": 4209.5387, "train_tokens_per_second": 332.674 }, { "epoch": 0.16845977011494254, "grad_norm": 6.564760208129883, "learning_rate": 1.6942355889724312e-06, "loss": 0.48810386657714844, "num_input_tokens_seen": 1401172, "step": 1832, "train_runtime": 4211.4808, "train_tokens_per_second": 332.703 }, { "epoch": 0.16855172413793104, "grad_norm": 7.919020175933838, "learning_rate": 1.6842105263157895e-06, "loss": 0.4304644465446472, "num_input_tokens_seen": 1402288, "step": 1833, "train_runtime": 4213.4952, "train_tokens_per_second": 332.809 }, { "epoch": 0.16864367816091955, "grad_norm": 6.425091743469238, "learning_rate": 1.6741854636591482e-06, "loss": 0.5326110124588013, "num_input_tokens_seen": 1403204, "step": 1834, "train_runtime": 4215.4436, "train_tokens_per_second": 332.872 }, { "epoch": 0.16873563218390805, "grad_norm": 7.043296813964844, "learning_rate": 1.6641604010025065e-06, "loss": 0.4600408375263214, "num_input_tokens_seen": 1403784, "step": 1835, "train_runtime": 4217.4279, "train_tokens_per_second": 332.853 }, { "epoch": 0.16882758620689656, "grad_norm": 6.777863025665283, "learning_rate": 1.6541353383458648e-06, "loss": 0.4287620782852173, "num_input_tokens_seen": 1404356, "step": 1836, "train_runtime": 4219.345, "train_tokens_per_second": 332.837 }, { "epoch": 0.16891954022988506, "grad_norm": 6.217686653137207, "learning_rate": 1.6441102756892233e-06, "loss": 0.41356709599494934, "num_input_tokens_seen": 1405220, "step": 1837, "train_runtime": 4221.298, "train_tokens_per_second": 332.888 }, { "epoch": 0.16901149425287357, "grad_norm": 6.92685079574585, "learning_rate": 1.6340852130325815e-06, "loss": 0.478983610868454, "num_input_tokens_seen": 1405900, "step": 1838, "train_runtime": 4223.2438, "train_tokens_per_second": 332.896 }, { "epoch": 0.16910344827586207, "grad_norm": 6.960223197937012, "learning_rate": 1.62406015037594e-06, "loss": 0.4747348725795746, "num_input_tokens_seen": 1406604, "step": 1839, "train_runtime": 4225.159, "train_tokens_per_second": 332.911 }, { "epoch": 0.16919540229885058, "grad_norm": 7.196669578552246, "learning_rate": 1.6140350877192983e-06, "loss": 0.5055457949638367, "num_input_tokens_seen": 1407376, "step": 1840, "train_runtime": 4227.0853, "train_tokens_per_second": 332.942 }, { "epoch": 0.16928735632183908, "grad_norm": 9.721369743347168, "learning_rate": 1.6040100250626568e-06, "loss": 0.4707803428173065, "num_input_tokens_seen": 1408240, "step": 1841, "train_runtime": 4229.0363, "train_tokens_per_second": 332.993 }, { "epoch": 0.1693793103448276, "grad_norm": 8.509045600891113, "learning_rate": 1.5939849624060153e-06, "loss": 0.44657400250434875, "num_input_tokens_seen": 1408852, "step": 1842, "train_runtime": 4230.9479, "train_tokens_per_second": 332.987 }, { "epoch": 0.1694712643678161, "grad_norm": 6.2532734870910645, "learning_rate": 1.5839598997493736e-06, "loss": 0.4338662028312683, "num_input_tokens_seen": 1409704, "step": 1843, "train_runtime": 4232.8889, "train_tokens_per_second": 333.036 }, { "epoch": 0.1695632183908046, "grad_norm": 7.739737510681152, "learning_rate": 1.573934837092732e-06, "loss": 0.47888562083244324, "num_input_tokens_seen": 1410332, "step": 1844, "train_runtime": 4234.7973, "train_tokens_per_second": 333.034 }, { "epoch": 0.1696551724137931, "grad_norm": 6.617823600769043, "learning_rate": 1.5639097744360903e-06, "loss": 0.49698400497436523, "num_input_tokens_seen": 1411516, "step": 1845, "train_runtime": 4236.7844, "train_tokens_per_second": 333.157 }, { "epoch": 0.1697471264367816, "grad_norm": 7.113321781158447, "learning_rate": 1.5538847117794486e-06, "loss": 0.5171873569488525, "num_input_tokens_seen": 1412100, "step": 1846, "train_runtime": 4238.7068, "train_tokens_per_second": 333.144 }, { "epoch": 0.16983908045977011, "grad_norm": 8.158944129943848, "learning_rate": 1.5438596491228073e-06, "loss": 0.42578595876693726, "num_input_tokens_seen": 1412776, "step": 1847, "train_runtime": 4240.6054, "train_tokens_per_second": 333.154 }, { "epoch": 0.16993103448275862, "grad_norm": 6.14885139465332, "learning_rate": 1.5338345864661656e-06, "loss": 0.4274827837944031, "num_input_tokens_seen": 1413512, "step": 1848, "train_runtime": 4242.5489, "train_tokens_per_second": 333.175 }, { "epoch": 0.17002298850574712, "grad_norm": 6.187997341156006, "learning_rate": 1.523809523809524e-06, "loss": 0.4465654194355011, "num_input_tokens_seen": 1414096, "step": 1849, "train_runtime": 4244.4692, "train_tokens_per_second": 333.162 }, { "epoch": 0.17011494252873563, "grad_norm": 7.026374816894531, "learning_rate": 1.5137844611528823e-06, "loss": 0.49688419699668884, "num_input_tokens_seen": 1414716, "step": 1850, "train_runtime": 4246.3862, "train_tokens_per_second": 333.158 }, { "epoch": 0.17020689655172414, "grad_norm": 6.23845911026001, "learning_rate": 1.5037593984962406e-06, "loss": 0.5111281871795654, "num_input_tokens_seen": 1415380, "step": 1851, "train_runtime": 4248.2976, "train_tokens_per_second": 333.164 }, { "epoch": 0.17029885057471264, "grad_norm": 6.714358329772949, "learning_rate": 1.4937343358395993e-06, "loss": 0.43978726863861084, "num_input_tokens_seen": 1416104, "step": 1852, "train_runtime": 4250.2254, "train_tokens_per_second": 333.183 }, { "epoch": 0.17039080459770115, "grad_norm": 5.875720500946045, "learning_rate": 1.4837092731829576e-06, "loss": 0.39047926664352417, "num_input_tokens_seen": 1416680, "step": 1853, "train_runtime": 4252.1336, "train_tokens_per_second": 333.169 }, { "epoch": 0.17048275862068965, "grad_norm": 6.088798999786377, "learning_rate": 1.4736842105263159e-06, "loss": 0.4593173861503601, "num_input_tokens_seen": 1417944, "step": 1854, "train_runtime": 4254.1453, "train_tokens_per_second": 333.309 }, { "epoch": 0.17057471264367816, "grad_norm": 6.431163311004639, "learning_rate": 1.4636591478696743e-06, "loss": 0.4786079227924347, "num_input_tokens_seen": 1419072, "step": 1855, "train_runtime": 4256.1238, "train_tokens_per_second": 333.419 }, { "epoch": 0.17066666666666666, "grad_norm": 6.588095664978027, "learning_rate": 1.4536340852130326e-06, "loss": 0.5038584470748901, "num_input_tokens_seen": 1419672, "step": 1856, "train_runtime": 4258.0316, "train_tokens_per_second": 333.41 }, { "epoch": 0.17075862068965517, "grad_norm": 6.476990222930908, "learning_rate": 1.4436090225563911e-06, "loss": 0.3907082676887512, "num_input_tokens_seen": 1420224, "step": 1857, "train_runtime": 4259.9294, "train_tokens_per_second": 333.391 }, { "epoch": 0.17085057471264367, "grad_norm": 6.375645637512207, "learning_rate": 1.4335839598997494e-06, "loss": 0.4861810505390167, "num_input_tokens_seen": 1421028, "step": 1858, "train_runtime": 4261.8695, "train_tokens_per_second": 333.428 }, { "epoch": 0.17094252873563218, "grad_norm": 7.222268104553223, "learning_rate": 1.4235588972431077e-06, "loss": 0.44973140954971313, "num_input_tokens_seen": 1421696, "step": 1859, "train_runtime": 4263.7807, "train_tokens_per_second": 333.436 }, { "epoch": 0.17103448275862068, "grad_norm": 5.898995399475098, "learning_rate": 1.4135338345864664e-06, "loss": 0.3670354187488556, "num_input_tokens_seen": 1422308, "step": 1860, "train_runtime": 4265.6906, "train_tokens_per_second": 333.43 }, { "epoch": 0.1711264367816092, "grad_norm": 6.76981258392334, "learning_rate": 1.4035087719298246e-06, "loss": 0.46958744525909424, "num_input_tokens_seen": 1423004, "step": 1861, "train_runtime": 4273.9514, "train_tokens_per_second": 332.948 }, { "epoch": 0.1712183908045977, "grad_norm": 6.871397495269775, "learning_rate": 1.3934837092731831e-06, "loss": 0.4450916647911072, "num_input_tokens_seen": 1423568, "step": 1862, "train_runtime": 4275.8633, "train_tokens_per_second": 332.931 }, { "epoch": 0.1713103448275862, "grad_norm": 7.244660377502441, "learning_rate": 1.3834586466165414e-06, "loss": 0.526885449886322, "num_input_tokens_seen": 1424176, "step": 1863, "train_runtime": 4277.7682, "train_tokens_per_second": 332.925 }, { "epoch": 0.1714022988505747, "grad_norm": 5.575239658355713, "learning_rate": 1.3734335839598997e-06, "loss": 0.4366419017314911, "num_input_tokens_seen": 1425632, "step": 1864, "train_runtime": 4279.7742, "train_tokens_per_second": 333.109 }, { "epoch": 0.1714942528735632, "grad_norm": 7.087784290313721, "learning_rate": 1.3634085213032584e-06, "loss": 0.6109887361526489, "num_input_tokens_seen": 1426364, "step": 1865, "train_runtime": 4281.6924, "train_tokens_per_second": 333.131 }, { "epoch": 0.1715862068965517, "grad_norm": 5.8095622062683105, "learning_rate": 1.3533834586466167e-06, "loss": 0.410519003868103, "num_input_tokens_seen": 1427044, "step": 1866, "train_runtime": 4283.6001, "train_tokens_per_second": 333.141 }, { "epoch": 0.17167816091954022, "grad_norm": 6.8906049728393555, "learning_rate": 1.3433583959899751e-06, "loss": 0.4923664331436157, "num_input_tokens_seen": 1427816, "step": 1867, "train_runtime": 4285.5524, "train_tokens_per_second": 333.17 }, { "epoch": 0.17177011494252872, "grad_norm": 6.780386924743652, "learning_rate": 1.3333333333333334e-06, "loss": 0.4736308455467224, "num_input_tokens_seen": 1428596, "step": 1868, "train_runtime": 4287.4774, "train_tokens_per_second": 333.202 }, { "epoch": 0.17186206896551723, "grad_norm": 7.154784679412842, "learning_rate": 1.3233082706766917e-06, "loss": 0.4392606317996979, "num_input_tokens_seen": 1429348, "step": 1869, "train_runtime": 4289.4581, "train_tokens_per_second": 333.223 }, { "epoch": 0.17195402298850573, "grad_norm": 8.420307159423828, "learning_rate": 1.3132832080200502e-06, "loss": 0.6212730407714844, "num_input_tokens_seen": 1430352, "step": 1870, "train_runtime": 4291.463, "train_tokens_per_second": 333.302 }, { "epoch": 0.17204597701149427, "grad_norm": 6.159582614898682, "learning_rate": 1.3032581453634085e-06, "loss": 0.42425036430358887, "num_input_tokens_seen": 1431124, "step": 1871, "train_runtime": 4293.4104, "train_tokens_per_second": 333.33 }, { "epoch": 0.17213793103448277, "grad_norm": 6.059912204742432, "learning_rate": 1.2932330827067672e-06, "loss": 0.4253976345062256, "num_input_tokens_seen": 1431800, "step": 1872, "train_runtime": 4295.3295, "train_tokens_per_second": 333.339 }, { "epoch": 0.17222988505747128, "grad_norm": 6.3949151039123535, "learning_rate": 1.2832080200501254e-06, "loss": 0.4122861623764038, "num_input_tokens_seen": 1432364, "step": 1873, "train_runtime": 4297.2456, "train_tokens_per_second": 333.321 }, { "epoch": 0.17232183908045978, "grad_norm": 6.341155529022217, "learning_rate": 1.2731829573934837e-06, "loss": 0.5156214237213135, "num_input_tokens_seen": 1433056, "step": 1874, "train_runtime": 4299.1578, "train_tokens_per_second": 333.334 }, { "epoch": 0.1724137931034483, "grad_norm": 6.808344841003418, "learning_rate": 1.2631578947368422e-06, "loss": 0.42363232374191284, "num_input_tokens_seen": 1433628, "step": 1875, "train_runtime": 4301.1184, "train_tokens_per_second": 333.315 }, { "epoch": 0.1725057471264368, "grad_norm": 6.694194316864014, "learning_rate": 1.2531328320802005e-06, "loss": 0.5186920166015625, "num_input_tokens_seen": 1434696, "step": 1876, "train_runtime": 4303.1378, "train_tokens_per_second": 333.407 }, { "epoch": 0.1725977011494253, "grad_norm": 7.251523971557617, "learning_rate": 1.243107769423559e-06, "loss": 0.44533511996269226, "num_input_tokens_seen": 1435452, "step": 1877, "train_runtime": 4305.0656, "train_tokens_per_second": 333.433 }, { "epoch": 0.1726896551724138, "grad_norm": 7.031600475311279, "learning_rate": 1.2330827067669174e-06, "loss": 0.4380522072315216, "num_input_tokens_seen": 1436260, "step": 1878, "train_runtime": 4307.008, "train_tokens_per_second": 333.47 }, { "epoch": 0.1727816091954023, "grad_norm": 6.173227310180664, "learning_rate": 1.2230576441102757e-06, "loss": 0.44876721501350403, "num_input_tokens_seen": 1437456, "step": 1879, "train_runtime": 4309.0007, "train_tokens_per_second": 333.594 }, { "epoch": 0.1728735632183908, "grad_norm": 6.372288703918457, "learning_rate": 1.2130325814536342e-06, "loss": 0.40218284726142883, "num_input_tokens_seen": 1438212, "step": 1880, "train_runtime": 4310.9523, "train_tokens_per_second": 333.618 }, { "epoch": 0.17296551724137932, "grad_norm": 6.622946739196777, "learning_rate": 1.2030075187969925e-06, "loss": 0.5180130004882812, "num_input_tokens_seen": 1438864, "step": 1881, "train_runtime": 4312.8761, "train_tokens_per_second": 333.621 }, { "epoch": 0.17305747126436782, "grad_norm": 5.832489967346191, "learning_rate": 1.192982456140351e-06, "loss": 0.40099936723709106, "num_input_tokens_seen": 1439488, "step": 1882, "train_runtime": 4314.7929, "train_tokens_per_second": 333.617 }, { "epoch": 0.17314942528735633, "grad_norm": 6.789658546447754, "learning_rate": 1.1829573934837095e-06, "loss": 0.4777843952178955, "num_input_tokens_seen": 1440096, "step": 1883, "train_runtime": 4316.7567, "train_tokens_per_second": 333.606 }, { "epoch": 0.17324137931034483, "grad_norm": 7.081912040710449, "learning_rate": 1.1729323308270677e-06, "loss": 0.47297799587249756, "num_input_tokens_seen": 1440636, "step": 1884, "train_runtime": 4318.6824, "train_tokens_per_second": 333.582 }, { "epoch": 0.17333333333333334, "grad_norm": 6.993490219116211, "learning_rate": 1.1629072681704262e-06, "loss": 0.45466509461402893, "num_input_tokens_seen": 1441284, "step": 1885, "train_runtime": 4320.637, "train_tokens_per_second": 333.581 }, { "epoch": 0.17342528735632184, "grad_norm": 6.9370036125183105, "learning_rate": 1.1528822055137845e-06, "loss": 0.4803755283355713, "num_input_tokens_seen": 1442008, "step": 1886, "train_runtime": 4322.5544, "train_tokens_per_second": 333.601 }, { "epoch": 0.17351724137931035, "grad_norm": 6.025440216064453, "learning_rate": 1.142857142857143e-06, "loss": 0.4667506217956543, "num_input_tokens_seen": 1443288, "step": 1887, "train_runtime": 4324.5947, "train_tokens_per_second": 333.739 }, { "epoch": 0.17360919540229885, "grad_norm": 6.843484878540039, "learning_rate": 1.1328320802005013e-06, "loss": 0.5556914806365967, "num_input_tokens_seen": 1443960, "step": 1888, "train_runtime": 4326.6468, "train_tokens_per_second": 333.737 }, { "epoch": 0.17370114942528736, "grad_norm": 6.687643527984619, "learning_rate": 1.1228070175438598e-06, "loss": 0.5455694198608398, "num_input_tokens_seen": 1444624, "step": 1889, "train_runtime": 4328.6036, "train_tokens_per_second": 333.739 }, { "epoch": 0.17379310344827587, "grad_norm": 7.248600006103516, "learning_rate": 1.1127819548872182e-06, "loss": 0.5499457716941833, "num_input_tokens_seen": 1445324, "step": 1890, "train_runtime": 4330.5272, "train_tokens_per_second": 333.752 }, { "epoch": 0.17388505747126437, "grad_norm": 6.184894561767578, "learning_rate": 1.1027568922305765e-06, "loss": 0.4898326098918915, "num_input_tokens_seen": 1446344, "step": 1891, "train_runtime": 4338.6872, "train_tokens_per_second": 333.36 }, { "epoch": 0.17397701149425288, "grad_norm": 6.2451324462890625, "learning_rate": 1.0927318295739348e-06, "loss": 0.45967888832092285, "num_input_tokens_seen": 1447104, "step": 1892, "train_runtime": 4340.6204, "train_tokens_per_second": 333.386 }, { "epoch": 0.17406896551724138, "grad_norm": 7.12343692779541, "learning_rate": 1.0827067669172933e-06, "loss": 0.515326976776123, "num_input_tokens_seen": 1447860, "step": 1893, "train_runtime": 4342.5987, "train_tokens_per_second": 333.409 }, { "epoch": 0.17416091954022989, "grad_norm": 7.140078544616699, "learning_rate": 1.0726817042606518e-06, "loss": 0.5173025727272034, "num_input_tokens_seen": 1448644, "step": 1894, "train_runtime": 4344.5177, "train_tokens_per_second": 333.442 }, { "epoch": 0.1742528735632184, "grad_norm": 4.653764724731445, "learning_rate": 1.0626566416040103e-06, "loss": 0.4386482238769531, "num_input_tokens_seen": 1450168, "step": 1895, "train_runtime": 4346.5598, "train_tokens_per_second": 333.636 }, { "epoch": 0.1743448275862069, "grad_norm": 7.022873401641846, "learning_rate": 1.0526315789473685e-06, "loss": 0.5092371702194214, "num_input_tokens_seen": 1450812, "step": 1896, "train_runtime": 4348.5637, "train_tokens_per_second": 333.63 }, { "epoch": 0.1744367816091954, "grad_norm": 6.802220344543457, "learning_rate": 1.0426065162907268e-06, "loss": 0.4958755075931549, "num_input_tokens_seen": 1451784, "step": 1897, "train_runtime": 4350.5302, "train_tokens_per_second": 333.703 }, { "epoch": 0.1745287356321839, "grad_norm": 7.149991035461426, "learning_rate": 1.0325814536340853e-06, "loss": 0.5435976386070251, "num_input_tokens_seen": 1452388, "step": 1898, "train_runtime": 4352.4419, "train_tokens_per_second": 333.695 }, { "epoch": 0.1746206896551724, "grad_norm": 6.909001350402832, "learning_rate": 1.0225563909774438e-06, "loss": 0.5135350227355957, "num_input_tokens_seen": 1453408, "step": 1899, "train_runtime": 4354.4128, "train_tokens_per_second": 333.778 }, { "epoch": 0.17471264367816092, "grad_norm": 6.813198089599609, "learning_rate": 1.012531328320802e-06, "loss": 0.6000266075134277, "num_input_tokens_seen": 1454436, "step": 1900, "train_runtime": 4356.359, "train_tokens_per_second": 333.865 }, { "epoch": 0.17480459770114942, "grad_norm": 6.590569019317627, "learning_rate": 1.0025062656641603e-06, "loss": 0.4507034718990326, "num_input_tokens_seen": 1455120, "step": 1901, "train_runtime": 4358.2723, "train_tokens_per_second": 333.875 }, { "epoch": 0.17489655172413793, "grad_norm": 6.074158191680908, "learning_rate": 9.924812030075188e-07, "loss": 0.447780042886734, "num_input_tokens_seen": 1456432, "step": 1902, "train_runtime": 4360.2807, "train_tokens_per_second": 334.023 }, { "epoch": 0.17498850574712643, "grad_norm": 6.893975257873535, "learning_rate": 9.824561403508773e-07, "loss": 0.5302909016609192, "num_input_tokens_seen": 1457548, "step": 1903, "train_runtime": 4362.2594, "train_tokens_per_second": 334.127 }, { "epoch": 0.17508045977011494, "grad_norm": 6.07625150680542, "learning_rate": 9.724310776942358e-07, "loss": 0.48071980476379395, "num_input_tokens_seen": 1458224, "step": 1904, "train_runtime": 4364.1914, "train_tokens_per_second": 334.134 }, { "epoch": 0.17517241379310344, "grad_norm": 6.833479881286621, "learning_rate": 9.62406015037594e-07, "loss": 0.5385992527008057, "num_input_tokens_seen": 1458908, "step": 1905, "train_runtime": 4366.1587, "train_tokens_per_second": 334.14 }, { "epoch": 0.17526436781609195, "grad_norm": 6.9142746925354, "learning_rate": 9.523809523809525e-07, "loss": 0.45336848497390747, "num_input_tokens_seen": 1459576, "step": 1906, "train_runtime": 4368.0715, "train_tokens_per_second": 334.147 }, { "epoch": 0.17535632183908045, "grad_norm": 6.9626078605651855, "learning_rate": 9.423558897243108e-07, "loss": 0.5101382732391357, "num_input_tokens_seen": 1460532, "step": 1907, "train_runtime": 4370.0204, "train_tokens_per_second": 334.216 }, { "epoch": 0.17544827586206896, "grad_norm": 8.040032386779785, "learning_rate": 9.323308270676692e-07, "loss": 0.475430428981781, "num_input_tokens_seen": 1461216, "step": 1908, "train_runtime": 4372.0137, "train_tokens_per_second": 334.22 }, { "epoch": 0.17554022988505746, "grad_norm": 8.253643035888672, "learning_rate": 9.223057644110277e-07, "loss": 0.5012615919113159, "num_input_tokens_seen": 1461920, "step": 1909, "train_runtime": 4373.9777, "train_tokens_per_second": 334.231 }, { "epoch": 0.17563218390804597, "grad_norm": 8.394492149353027, "learning_rate": 9.122807017543861e-07, "loss": 0.5508334636688232, "num_input_tokens_seen": 1462516, "step": 1910, "train_runtime": 4375.9422, "train_tokens_per_second": 334.217 }, { "epoch": 0.17572413793103447, "grad_norm": 6.01444149017334, "learning_rate": 9.022556390977444e-07, "loss": 0.39604777097702026, "num_input_tokens_seen": 1463240, "step": 1911, "train_runtime": 4377.8615, "train_tokens_per_second": 334.236 }, { "epoch": 0.17581609195402298, "grad_norm": 7.359145164489746, "learning_rate": 8.922305764411029e-07, "loss": 0.4897788166999817, "num_input_tokens_seen": 1463912, "step": 1912, "train_runtime": 4379.7753, "train_tokens_per_second": 334.244 }, { "epoch": 0.17590804597701148, "grad_norm": 7.1891069412231445, "learning_rate": 8.822055137844612e-07, "loss": 0.501335620880127, "num_input_tokens_seen": 1464624, "step": 1913, "train_runtime": 4381.7365, "train_tokens_per_second": 334.257 }, { "epoch": 0.176, "grad_norm": 6.721168041229248, "learning_rate": 8.721804511278196e-07, "loss": 0.4819718599319458, "num_input_tokens_seen": 1465268, "step": 1914, "train_runtime": 4383.6658, "train_tokens_per_second": 334.256 }, { "epoch": 0.1760919540229885, "grad_norm": 7.009974956512451, "learning_rate": 8.621553884711781e-07, "loss": 0.48692968487739563, "num_input_tokens_seen": 1465868, "step": 1915, "train_runtime": 4385.5697, "train_tokens_per_second": 334.248 }, { "epoch": 0.176183908045977, "grad_norm": 6.817626953125, "learning_rate": 8.521303258145364e-07, "loss": 0.4318804144859314, "num_input_tokens_seen": 1466640, "step": 1916, "train_runtime": 4387.4816, "train_tokens_per_second": 334.278 }, { "epoch": 0.1762758620689655, "grad_norm": 6.447076320648193, "learning_rate": 8.421052631578948e-07, "loss": 0.5303728580474854, "num_input_tokens_seen": 1467296, "step": 1917, "train_runtime": 4389.4097, "train_tokens_per_second": 334.281 }, { "epoch": 0.176367816091954, "grad_norm": 6.219639778137207, "learning_rate": 8.320802005012532e-07, "loss": 0.48713910579681396, "num_input_tokens_seen": 1468240, "step": 1918, "train_runtime": 4391.3562, "train_tokens_per_second": 334.348 }, { "epoch": 0.17645977011494252, "grad_norm": 6.238115310668945, "learning_rate": 8.220551378446116e-07, "loss": 0.46840783953666687, "num_input_tokens_seen": 1468892, "step": 1919, "train_runtime": 4393.2898, "train_tokens_per_second": 334.349 }, { "epoch": 0.17655172413793102, "grad_norm": 6.222463130950928, "learning_rate": 8.1203007518797e-07, "loss": 0.44472193717956543, "num_input_tokens_seen": 1469560, "step": 1920, "train_runtime": 4395.194, "train_tokens_per_second": 334.356 }, { "epoch": 0.17664367816091955, "grad_norm": 6.146585464477539, "learning_rate": 8.020050125313284e-07, "loss": 0.4363603889942169, "num_input_tokens_seen": 1470256, "step": 1921, "train_runtime": 4403.8036, "train_tokens_per_second": 333.86 }, { "epoch": 0.17673563218390806, "grad_norm": 7.714982986450195, "learning_rate": 7.919799498746868e-07, "loss": 0.4598209261894226, "num_input_tokens_seen": 1470884, "step": 1922, "train_runtime": 4405.7283, "train_tokens_per_second": 333.857 }, { "epoch": 0.17682758620689656, "grad_norm": 6.125604152679443, "learning_rate": 7.819548872180452e-07, "loss": 0.3589984178543091, "num_input_tokens_seen": 1471700, "step": 1923, "train_runtime": 4407.9266, "train_tokens_per_second": 333.876 }, { "epoch": 0.17691954022988507, "grad_norm": 6.287062168121338, "learning_rate": 7.719298245614036e-07, "loss": 0.4955197274684906, "num_input_tokens_seen": 1472448, "step": 1924, "train_runtime": 4409.8464, "train_tokens_per_second": 333.9 }, { "epoch": 0.17701149425287357, "grad_norm": 6.434872150421143, "learning_rate": 7.61904761904762e-07, "loss": 0.4396565556526184, "num_input_tokens_seen": 1473268, "step": 1925, "train_runtime": 4411.8362, "train_tokens_per_second": 333.935 }, { "epoch": 0.17710344827586208, "grad_norm": 7.826362609863281, "learning_rate": 7.518796992481203e-07, "loss": 0.4749208092689514, "num_input_tokens_seen": 1473976, "step": 1926, "train_runtime": 4413.7727, "train_tokens_per_second": 333.949 }, { "epoch": 0.17719540229885059, "grad_norm": 7.021556854248047, "learning_rate": 7.418546365914788e-07, "loss": 0.43029263615608215, "num_input_tokens_seen": 1474644, "step": 1927, "train_runtime": 4415.6815, "train_tokens_per_second": 333.956 }, { "epoch": 0.1772873563218391, "grad_norm": 6.2591047286987305, "learning_rate": 7.318295739348372e-07, "loss": 0.4811077117919922, "num_input_tokens_seen": 1475748, "step": 1928, "train_runtime": 4417.6511, "train_tokens_per_second": 334.057 }, { "epoch": 0.1773793103448276, "grad_norm": 6.473521709442139, "learning_rate": 7.218045112781956e-07, "loss": 0.4754500091075897, "num_input_tokens_seen": 1476600, "step": 1929, "train_runtime": 4419.6129, "train_tokens_per_second": 334.102 }, { "epoch": 0.1774712643678161, "grad_norm": 6.3368611335754395, "learning_rate": 7.117794486215538e-07, "loss": 0.4027555584907532, "num_input_tokens_seen": 1477272, "step": 1930, "train_runtime": 4421.5345, "train_tokens_per_second": 334.108 }, { "epoch": 0.1775632183908046, "grad_norm": 6.811783313751221, "learning_rate": 7.017543859649123e-07, "loss": 0.48822206258773804, "num_input_tokens_seen": 1478012, "step": 1931, "train_runtime": 4423.4457, "train_tokens_per_second": 334.131 }, { "epoch": 0.1776551724137931, "grad_norm": 7.439375400543213, "learning_rate": 6.917293233082707e-07, "loss": 0.3694459795951843, "num_input_tokens_seen": 1478664, "step": 1932, "train_runtime": 4425.3499, "train_tokens_per_second": 334.135 }, { "epoch": 0.17774712643678162, "grad_norm": 6.692470073699951, "learning_rate": 6.817042606516292e-07, "loss": 0.5403836369514465, "num_input_tokens_seen": 1479676, "step": 1933, "train_runtime": 4427.3233, "train_tokens_per_second": 334.215 }, { "epoch": 0.17783908045977012, "grad_norm": 7.127777576446533, "learning_rate": 6.716791979949876e-07, "loss": 0.48094385862350464, "num_input_tokens_seen": 1480384, "step": 1934, "train_runtime": 4429.25, "train_tokens_per_second": 334.229 }, { "epoch": 0.17793103448275863, "grad_norm": 6.633772373199463, "learning_rate": 6.616541353383458e-07, "loss": 0.4813235104084015, "num_input_tokens_seen": 1481416, "step": 1935, "train_runtime": 4431.2194, "train_tokens_per_second": 334.313 }, { "epoch": 0.17802298850574713, "grad_norm": 7.7599406242370605, "learning_rate": 6.516290726817042e-07, "loss": 0.5024576783180237, "num_input_tokens_seen": 1482040, "step": 1936, "train_runtime": 4433.1256, "train_tokens_per_second": 334.31 }, { "epoch": 0.17811494252873564, "grad_norm": 7.687955856323242, "learning_rate": 6.416040100250627e-07, "loss": 0.49235543608665466, "num_input_tokens_seen": 1482880, "step": 1937, "train_runtime": 4435.0401, "train_tokens_per_second": 334.355 }, { "epoch": 0.17820689655172414, "grad_norm": 6.23078727722168, "learning_rate": 6.315789473684211e-07, "loss": 0.40074771642684937, "num_input_tokens_seen": 1483476, "step": 1938, "train_runtime": 4436.9421, "train_tokens_per_second": 334.346 }, { "epoch": 0.17829885057471265, "grad_norm": 6.496601104736328, "learning_rate": 6.215538847117795e-07, "loss": 0.45595455169677734, "num_input_tokens_seen": 1484148, "step": 1939, "train_runtime": 4438.8462, "train_tokens_per_second": 334.354 }, { "epoch": 0.17839080459770115, "grad_norm": 7.491678237915039, "learning_rate": 6.115288220551379e-07, "loss": 0.6587531566619873, "num_input_tokens_seen": 1484968, "step": 1940, "train_runtime": 4440.8207, "train_tokens_per_second": 334.39 }, { "epoch": 0.17848275862068966, "grad_norm": 6.942194938659668, "learning_rate": 6.015037593984962e-07, "loss": 0.4629093408584595, "num_input_tokens_seen": 1485736, "step": 1941, "train_runtime": 4442.7364, "train_tokens_per_second": 334.419 }, { "epoch": 0.17857471264367816, "grad_norm": 7.357885837554932, "learning_rate": 5.914786967418547e-07, "loss": 0.4690327048301697, "num_input_tokens_seen": 1486344, "step": 1942, "train_runtime": 4444.6525, "train_tokens_per_second": 334.412 }, { "epoch": 0.17866666666666667, "grad_norm": 7.242325305938721, "learning_rate": 5.814536340852131e-07, "loss": 0.5480672121047974, "num_input_tokens_seen": 1487076, "step": 1943, "train_runtime": 4446.6194, "train_tokens_per_second": 334.428 }, { "epoch": 0.17875862068965517, "grad_norm": 6.363503932952881, "learning_rate": 5.714285714285715e-07, "loss": 0.4140477776527405, "num_input_tokens_seen": 1487680, "step": 1944, "train_runtime": 4448.524, "train_tokens_per_second": 334.421 }, { "epoch": 0.17885057471264368, "grad_norm": 6.547098636627197, "learning_rate": 5.614035087719299e-07, "loss": 0.5084044933319092, "num_input_tokens_seen": 1488312, "step": 1945, "train_runtime": 4450.4288, "train_tokens_per_second": 334.42 }, { "epoch": 0.17894252873563218, "grad_norm": 6.4081196784973145, "learning_rate": 5.513784461152883e-07, "loss": 0.517520546913147, "num_input_tokens_seen": 1489008, "step": 1946, "train_runtime": 4452.4153, "train_tokens_per_second": 334.427 }, { "epoch": 0.1790344827586207, "grad_norm": 6.37542724609375, "learning_rate": 5.413533834586466e-07, "loss": 0.5319074988365173, "num_input_tokens_seen": 1490272, "step": 1947, "train_runtime": 4454.3832, "train_tokens_per_second": 334.563 }, { "epoch": 0.1791264367816092, "grad_norm": 6.55473518371582, "learning_rate": 5.313283208020051e-07, "loss": 0.43775203824043274, "num_input_tokens_seen": 1490920, "step": 1948, "train_runtime": 4456.3222, "train_tokens_per_second": 334.563 }, { "epoch": 0.1792183908045977, "grad_norm": 6.583804607391357, "learning_rate": 5.213032581453634e-07, "loss": 0.4879281222820282, "num_input_tokens_seen": 1491816, "step": 1949, "train_runtime": 4458.2926, "train_tokens_per_second": 334.616 }, { "epoch": 0.1793103448275862, "grad_norm": 6.798384666442871, "learning_rate": 5.112781954887219e-07, "loss": 0.43789058923721313, "num_input_tokens_seen": 1492492, "step": 1950, "train_runtime": 4460.2035, "train_tokens_per_second": 334.624 }, { "epoch": 0.1794022988505747, "grad_norm": 6.2381815910339355, "learning_rate": 5.012531328320802e-07, "loss": 0.4565480351448059, "num_input_tokens_seen": 1493144, "step": 1951, "train_runtime": 4468.7669, "train_tokens_per_second": 334.129 }, { "epoch": 0.17949425287356321, "grad_norm": 6.779036045074463, "learning_rate": 4.912280701754387e-07, "loss": 0.49072062969207764, "num_input_tokens_seen": 1493928, "step": 1952, "train_runtime": 4470.6831, "train_tokens_per_second": 334.161 }, { "epoch": 0.17958620689655172, "grad_norm": 7.393740653991699, "learning_rate": 4.81203007518797e-07, "loss": 0.4488428831100464, "num_input_tokens_seen": 1494560, "step": 1953, "train_runtime": 4472.7891, "train_tokens_per_second": 334.145 }, { "epoch": 0.17967816091954023, "grad_norm": 5.62514591217041, "learning_rate": 4.711779448621554e-07, "loss": 0.4903565049171448, "num_input_tokens_seen": 1495944, "step": 1954, "train_runtime": 4474.8408, "train_tokens_per_second": 334.301 }, { "epoch": 0.17977011494252873, "grad_norm": 6.749486923217773, "learning_rate": 4.6115288220551385e-07, "loss": 0.40888097882270813, "num_input_tokens_seen": 1496692, "step": 1955, "train_runtime": 4476.8014, "train_tokens_per_second": 334.322 }, { "epoch": 0.17986206896551724, "grad_norm": 6.747584342956543, "learning_rate": 4.511278195488722e-07, "loss": 0.45244961977005005, "num_input_tokens_seen": 1497372, "step": 1956, "train_runtime": 4478.7444, "train_tokens_per_second": 334.329 }, { "epoch": 0.17995402298850574, "grad_norm": 7.246510982513428, "learning_rate": 4.411027568922306e-07, "loss": 0.48466747999191284, "num_input_tokens_seen": 1498084, "step": 1957, "train_runtime": 4480.6731, "train_tokens_per_second": 334.344 }, { "epoch": 0.18004597701149425, "grad_norm": 7.051685333251953, "learning_rate": 4.3107769423558905e-07, "loss": 0.5010166764259338, "num_input_tokens_seen": 1498816, "step": 1958, "train_runtime": 4482.5995, "train_tokens_per_second": 334.363 }, { "epoch": 0.18013793103448275, "grad_norm": 6.835502624511719, "learning_rate": 4.210526315789474e-07, "loss": 0.47410574555397034, "num_input_tokens_seen": 1499420, "step": 1959, "train_runtime": 4484.5147, "train_tokens_per_second": 334.355 }, { "epoch": 0.18022988505747126, "grad_norm": 6.855109691619873, "learning_rate": 4.110275689223058e-07, "loss": 0.44139620661735535, "num_input_tokens_seen": 1500072, "step": 1960, "train_runtime": 4486.4225, "train_tokens_per_second": 334.358 }, { "epoch": 0.18032183908045976, "grad_norm": 7.25023078918457, "learning_rate": 4.010025062656642e-07, "loss": 0.38036903738975525, "num_input_tokens_seen": 1500600, "step": 1961, "train_runtime": 4488.3333, "train_tokens_per_second": 334.333 }, { "epoch": 0.18041379310344827, "grad_norm": 6.056260585784912, "learning_rate": 3.909774436090226e-07, "loss": 0.39658379554748535, "num_input_tokens_seen": 1501240, "step": 1962, "train_runtime": 4490.2453, "train_tokens_per_second": 334.334 }, { "epoch": 0.18050574712643677, "grad_norm": 6.8434247970581055, "learning_rate": 3.80952380952381e-07, "loss": 0.6031206250190735, "num_input_tokens_seen": 1502648, "step": 1963, "train_runtime": 4492.2897, "train_tokens_per_second": 334.495 }, { "epoch": 0.18059770114942528, "grad_norm": 7.027190685272217, "learning_rate": 3.709273182957394e-07, "loss": 0.37974339723587036, "num_input_tokens_seen": 1503312, "step": 1964, "train_runtime": 4494.2092, "train_tokens_per_second": 334.5 }, { "epoch": 0.18068965517241378, "grad_norm": 6.077744483947754, "learning_rate": 3.609022556390978e-07, "loss": 0.44487810134887695, "num_input_tokens_seen": 1503856, "step": 1965, "train_runtime": 4496.1099, "train_tokens_per_second": 334.479 }, { "epoch": 0.1807816091954023, "grad_norm": 6.1048407554626465, "learning_rate": 3.5087719298245616e-07, "loss": 0.4310495853424072, "num_input_tokens_seen": 1504752, "step": 1966, "train_runtime": 4498.0547, "train_tokens_per_second": 334.534 }, { "epoch": 0.1808735632183908, "grad_norm": 6.022492408752441, "learning_rate": 3.408521303258146e-07, "loss": 0.5145743489265442, "num_input_tokens_seen": 1505404, "step": 1967, "train_runtime": 4499.9853, "train_tokens_per_second": 334.535 }, { "epoch": 0.1809655172413793, "grad_norm": 6.707273483276367, "learning_rate": 3.308270676691729e-07, "loss": 0.4110385477542877, "num_input_tokens_seen": 1506108, "step": 1968, "train_runtime": 4501.9056, "train_tokens_per_second": 334.549 }, { "epoch": 0.1810574712643678, "grad_norm": 5.941143035888672, "learning_rate": 3.2080200501253136e-07, "loss": 0.47294989228248596, "num_input_tokens_seen": 1507116, "step": 1969, "train_runtime": 4503.8798, "train_tokens_per_second": 334.626 }, { "epoch": 0.1811494252873563, "grad_norm": 6.705524444580078, "learning_rate": 3.1077694235588974e-07, "loss": 0.43166616559028625, "num_input_tokens_seen": 1507820, "step": 1970, "train_runtime": 4505.798, "train_tokens_per_second": 334.64 }, { "epoch": 0.18124137931034484, "grad_norm": 5.969166278839111, "learning_rate": 3.007518796992481e-07, "loss": 0.3799688220024109, "num_input_tokens_seen": 1508692, "step": 1971, "train_runtime": 4507.7712, "train_tokens_per_second": 334.687 }, { "epoch": 0.18133333333333335, "grad_norm": 6.527568340301514, "learning_rate": 2.9072681704260656e-07, "loss": 0.45936867594718933, "num_input_tokens_seen": 1509332, "step": 1972, "train_runtime": 4509.6779, "train_tokens_per_second": 334.687 }, { "epoch": 0.18142528735632185, "grad_norm": 6.620479583740234, "learning_rate": 2.8070175438596494e-07, "loss": 0.5485371351242065, "num_input_tokens_seen": 1510316, "step": 1973, "train_runtime": 4511.6165, "train_tokens_per_second": 334.762 }, { "epoch": 0.18151724137931036, "grad_norm": 6.678211212158203, "learning_rate": 2.706766917293233e-07, "loss": 0.4263443052768707, "num_input_tokens_seen": 1511044, "step": 1974, "train_runtime": 4513.5214, "train_tokens_per_second": 334.782 }, { "epoch": 0.18160919540229886, "grad_norm": 6.550446510314941, "learning_rate": 2.606516290726817e-07, "loss": 0.543639063835144, "num_input_tokens_seen": 1511860, "step": 1975, "train_runtime": 4515.4603, "train_tokens_per_second": 334.819 }, { "epoch": 0.18170114942528737, "grad_norm": 8.202722549438477, "learning_rate": 2.506265664160401e-07, "loss": 0.46255484223365784, "num_input_tokens_seen": 1512564, "step": 1976, "train_runtime": 4517.3681, "train_tokens_per_second": 334.833 }, { "epoch": 0.18179310344827587, "grad_norm": 6.744688987731934, "learning_rate": 2.406015037593985e-07, "loss": 0.5105394124984741, "num_input_tokens_seen": 1513328, "step": 1977, "train_runtime": 4519.2798, "train_tokens_per_second": 334.86 }, { "epoch": 0.18188505747126438, "grad_norm": 6.711732864379883, "learning_rate": 2.3057644110275693e-07, "loss": 0.5073504447937012, "num_input_tokens_seen": 1514244, "step": 1978, "train_runtime": 4521.2544, "train_tokens_per_second": 334.917 }, { "epoch": 0.18197701149425288, "grad_norm": 6.5366926193237305, "learning_rate": 2.205513784461153e-07, "loss": 0.48320409655570984, "num_input_tokens_seen": 1515112, "step": 1979, "train_runtime": 4523.237, "train_tokens_per_second": 334.962 }, { "epoch": 0.1820689655172414, "grad_norm": 6.033635139465332, "learning_rate": 2.105263157894737e-07, "loss": 0.4099450409412384, "num_input_tokens_seen": 1515796, "step": 1980, "train_runtime": 4525.1739, "train_tokens_per_second": 334.97 }, { "epoch": 0.1821609195402299, "grad_norm": 7.067359924316406, "learning_rate": 2.005012531328321e-07, "loss": 0.4702427089214325, "num_input_tokens_seen": 1516448, "step": 1981, "train_runtime": 4533.8924, "train_tokens_per_second": 334.469 }, { "epoch": 0.1822528735632184, "grad_norm": 6.445496559143066, "learning_rate": 1.904761904761905e-07, "loss": 0.5270073413848877, "num_input_tokens_seen": 1517276, "step": 1982, "train_runtime": 4535.8493, "train_tokens_per_second": 334.508 }, { "epoch": 0.1823448275862069, "grad_norm": 7.172682762145996, "learning_rate": 1.804511278195489e-07, "loss": 0.4619142413139343, "num_input_tokens_seen": 1517912, "step": 1983, "train_runtime": 4537.7494, "train_tokens_per_second": 334.508 }, { "epoch": 0.1824367816091954, "grad_norm": 5.525018692016602, "learning_rate": 1.704260651629073e-07, "loss": 0.40037378668785095, "num_input_tokens_seen": 1518664, "step": 1984, "train_runtime": 4539.7055, "train_tokens_per_second": 334.529 }, { "epoch": 0.1825287356321839, "grad_norm": 6.291981220245361, "learning_rate": 1.6040100250626568e-07, "loss": 0.4811934232711792, "num_input_tokens_seen": 1519408, "step": 1985, "train_runtime": 4541.6229, "train_tokens_per_second": 334.552 }, { "epoch": 0.18262068965517242, "grad_norm": 7.118106842041016, "learning_rate": 1.5037593984962406e-07, "loss": 0.485521525144577, "num_input_tokens_seen": 1520404, "step": 1986, "train_runtime": 4543.5949, "train_tokens_per_second": 334.626 }, { "epoch": 0.18271264367816092, "grad_norm": 8.06576156616211, "learning_rate": 1.4035087719298247e-07, "loss": 0.5489382147789001, "num_input_tokens_seen": 1521064, "step": 1987, "train_runtime": 4545.5171, "train_tokens_per_second": 334.629 }, { "epoch": 0.18280459770114943, "grad_norm": 5.893178939819336, "learning_rate": 1.3032581453634085e-07, "loss": 0.3916177749633789, "num_input_tokens_seen": 1521748, "step": 1988, "train_runtime": 4547.4392, "train_tokens_per_second": 334.638 }, { "epoch": 0.18289655172413793, "grad_norm": 7.13472843170166, "learning_rate": 1.2030075187969926e-07, "loss": 0.5219954252243042, "num_input_tokens_seen": 1522504, "step": 1989, "train_runtime": 4549.3946, "train_tokens_per_second": 334.661 }, { "epoch": 0.18298850574712644, "grad_norm": 7.152637004852295, "learning_rate": 1.1027568922305765e-07, "loss": 0.5631678700447083, "num_input_tokens_seen": 1523188, "step": 1990, "train_runtime": 4551.3117, "train_tokens_per_second": 334.67 }, { "epoch": 0.18308045977011494, "grad_norm": 7.595930576324463, "learning_rate": 1.0025062656641605e-07, "loss": 0.47467783093452454, "num_input_tokens_seen": 1523856, "step": 1991, "train_runtime": 4553.2606, "train_tokens_per_second": 334.674 }, { "epoch": 0.18317241379310345, "grad_norm": 7.325425624847412, "learning_rate": 9.022556390977444e-08, "loss": 0.5168801546096802, "num_input_tokens_seen": 1524544, "step": 1992, "train_runtime": 4555.1851, "train_tokens_per_second": 334.683 }, { "epoch": 0.18326436781609196, "grad_norm": 6.573004722595215, "learning_rate": 8.020050125313284e-08, "loss": 0.5315032005310059, "num_input_tokens_seen": 1525476, "step": 1993, "train_runtime": 4557.1357, "train_tokens_per_second": 334.744 }, { "epoch": 0.18335632183908046, "grad_norm": 8.198920249938965, "learning_rate": 7.017543859649123e-08, "loss": 0.39272958040237427, "num_input_tokens_seen": 1526056, "step": 1994, "train_runtime": 4559.085, "train_tokens_per_second": 334.729 }, { "epoch": 0.18344827586206897, "grad_norm": 6.335601806640625, "learning_rate": 6.015037593984963e-08, "loss": 0.48748651146888733, "num_input_tokens_seen": 1526836, "step": 1995, "train_runtime": 4561.0, "train_tokens_per_second": 334.759 }, { "epoch": 0.18354022988505747, "grad_norm": 6.505175590515137, "learning_rate": 5.0125313283208025e-08, "loss": 0.4721751809120178, "num_input_tokens_seen": 1527440, "step": 1996, "train_runtime": 4562.9113, "train_tokens_per_second": 334.751 }, { "epoch": 0.18363218390804598, "grad_norm": 5.909262180328369, "learning_rate": 4.010025062656642e-08, "loss": 0.40433812141418457, "num_input_tokens_seen": 1528240, "step": 1997, "train_runtime": 4565.0634, "train_tokens_per_second": 334.769 }, { "epoch": 0.18372413793103448, "grad_norm": 6.7515788078308105, "learning_rate": 3.0075187969924815e-08, "loss": 0.47629979252815247, "num_input_tokens_seen": 1528996, "step": 1998, "train_runtime": 4566.9845, "train_tokens_per_second": 334.793 }, { "epoch": 0.183816091954023, "grad_norm": 6.242720603942871, "learning_rate": 2.005012531328321e-08, "loss": 0.47347041964530945, "num_input_tokens_seen": 1529620, "step": 1999, "train_runtime": 4568.9079, "train_tokens_per_second": 334.789 }, { "epoch": 0.1839080459770115, "grad_norm": 8.364867210388184, "learning_rate": 1.0025062656641605e-08, "loss": 0.46602606773376465, "num_input_tokens_seen": 1530340, "step": 2000, "train_runtime": 4570.8216, "train_tokens_per_second": 334.806 }, { "epoch": 0.1839080459770115, "eval_loss": 1.7979987859725952, "eval_runtime": 27.7, "eval_samples_per_second": 36.101, "eval_steps_per_second": 9.025, "num_input_tokens_seen": 1530340, "step": 2000 } ], "logging_steps": 1, "max_steps": 2000, "num_input_tokens_seen": 1530340, "num_train_epochs": 1, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 5481097281246720.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }