{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 153.84615384615384, "eval_steps": 100, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0, "num_input_tokens_seen": 0, "step": 0, "train_accuracy": 0.001953125 }, { "epoch": 0.07692307692307693, "grad_norm": 113.0272216796875, "learning_rate": 0.0, "loss": 6.546019554138184, "num_input_tokens_seen": 4096, "step": 1, "train_runtime": 3.5976, "train_tokens_per_second": 1138.522 }, { "epoch": 0.07692307692307693, "num_input_tokens_seen": 4096, "step": 1, "train_accuracy": 0.005859375 }, { "epoch": 0.15384615384615385, "grad_norm": 113.77076721191406, "learning_rate": 0.001, "loss": 6.613107204437256, "num_input_tokens_seen": 8192, "step": 2, "train_runtime": 4.3771, "train_tokens_per_second": 1871.568 }, { "epoch": 0.15384615384615385, "num_input_tokens_seen": 8192, "step": 2, "train_accuracy": 0.0078125 }, { "epoch": 0.23076923076923078, "grad_norm": 116.1823959350586, "learning_rate": 0.002, "loss": 6.340221405029297, "num_input_tokens_seen": 12288, "step": 3, "train_runtime": 5.168, "train_tokens_per_second": 2377.707 }, { "epoch": 0.23076923076923078, "num_input_tokens_seen": 12288, "step": 3, "train_accuracy": 0.029296875 }, { "epoch": 0.3076923076923077, "grad_norm": 27.13140106201172, "learning_rate": 0.003, "loss": 8.609485626220703, "num_input_tokens_seen": 16384, "step": 4, "train_runtime": 5.9553, "train_tokens_per_second": 2751.168 }, { "epoch": 0.3076923076923077, "num_input_tokens_seen": 16384, "step": 4, "train_accuracy": 0.015625 }, { "epoch": 0.38461538461538464, "grad_norm": 24.710792541503906, "learning_rate": 0.004, "loss": 9.139598846435547, "num_input_tokens_seen": 20480, "step": 5, "train_runtime": 6.7415, "train_tokens_per_second": 3037.921 }, { "epoch": 0.38461538461538464, "num_input_tokens_seen": 20480, "step": 5, "train_accuracy": 0.0078125 }, { "epoch": 0.46153846153846156, "grad_norm": 35.96022033691406, "learning_rate": 0.005, "loss": 8.047222137451172, "num_input_tokens_seen": 24576, "step": 6, "train_runtime": 7.5328, "train_tokens_per_second": 3262.536 }, { "epoch": 0.46153846153846156, "num_input_tokens_seen": 24576, "step": 6, "train_accuracy": 0.009765625 }, { "epoch": 0.5384615384615384, "grad_norm": 35.30043029785156, "learning_rate": 0.006, "loss": 7.312543869018555, "num_input_tokens_seen": 28672, "step": 7, "train_runtime": 8.3242, "train_tokens_per_second": 3444.404 }, { "epoch": 0.5384615384615384, "num_input_tokens_seen": 28672, "step": 7, "train_accuracy": 0.01171875 }, { "epoch": 0.6153846153846154, "grad_norm": 59.60608673095703, "learning_rate": 0.006999999999999999, "loss": 8.326001167297363, "num_input_tokens_seen": 32768, "step": 8, "train_runtime": 9.1124, "train_tokens_per_second": 3595.981 }, { "epoch": 0.6153846153846154, "num_input_tokens_seen": 32768, "step": 8, "train_accuracy": 0.009765625 }, { "epoch": 0.6923076923076923, "grad_norm": 50.62687683105469, "learning_rate": 0.008, "loss": 11.003422737121582, "num_input_tokens_seen": 36864, "step": 9, "train_runtime": 9.9012, "train_tokens_per_second": 3723.169 }, { "epoch": 0.6923076923076923, "num_input_tokens_seen": 36864, "step": 9, "train_accuracy": 0.009765625 }, { "epoch": 0.7692307692307693, "grad_norm": 89.37097930908203, "learning_rate": 0.009000000000000001, "loss": 13.825056076049805, "num_input_tokens_seen": 40960, "step": 10, "train_runtime": 10.6904, "train_tokens_per_second": 3831.459 }, { "epoch": 0.7692307692307693, "num_input_tokens_seen": 40960, "step": 10, "train_accuracy": 0.013671875 }, { "epoch": 0.8461538461538461, "grad_norm": 90.11058807373047, "learning_rate": 0.01, "loss": 20.330724716186523, "num_input_tokens_seen": 45056, "step": 11, "train_runtime": 11.4806, "train_tokens_per_second": 3924.525 }, { "epoch": 0.8461538461538461, "num_input_tokens_seen": 45056, "step": 11, "train_accuracy": 0.009765625 }, { "epoch": 0.9230769230769231, "grad_norm": 98.63053894042969, "learning_rate": 0.01, "loss": 32.64373016357422, "num_input_tokens_seen": 49152, "step": 12, "train_runtime": 12.2648, "train_tokens_per_second": 4007.559 }, { "epoch": 0.9230769230769231, "num_input_tokens_seen": 49152, "step": 12, "train_accuracy": 0.019543973729014397 }, { "epoch": 1.0, "grad_norm": 59.70159149169922, "learning_rate": 0.01, "loss": 27.997303009033203, "num_input_tokens_seen": 51608, "step": 13, "train_runtime": 12.7652, "train_tokens_per_second": 4042.877 }, { "epoch": 1.0, "num_input_tokens_seen": 51608, "step": 13, "train_accuracy": 0.0234375 }, { "epoch": 1.0769230769230769, "grad_norm": 59.93867111206055, "learning_rate": 0.01, "loss": 26.742982864379883, "num_input_tokens_seen": 55704, "step": 14, "train_runtime": 13.5676, "train_tokens_per_second": 4105.655 }, { "epoch": 1.0769230769230769, "num_input_tokens_seen": 55704, "step": 14, "train_accuracy": 0.013671875 }, { "epoch": 1.1538461538461537, "grad_norm": 101.93472290039062, "learning_rate": 0.01, "loss": 30.33885955810547, "num_input_tokens_seen": 59800, "step": 15, "train_runtime": 14.3572, "train_tokens_per_second": 4165.166 }, { "epoch": 1.1538461538461537, "num_input_tokens_seen": 59800, "step": 15, "train_accuracy": 0.013671875 }, { "epoch": 1.2307692307692308, "grad_norm": 69.6849594116211, "learning_rate": 0.01, "loss": 33.29315948486328, "num_input_tokens_seen": 63896, "step": 16, "train_runtime": 15.153, "train_tokens_per_second": 4216.713 }, { "epoch": 1.2307692307692308, "num_input_tokens_seen": 63896, "step": 16, "train_accuracy": 0.009765625 }, { "epoch": 1.3076923076923077, "grad_norm": 104.34686279296875, "learning_rate": 0.01, "loss": 43.05381774902344, "num_input_tokens_seen": 67992, "step": 17, "train_runtime": 15.9433, "train_tokens_per_second": 4264.624 }, { "epoch": 1.3076923076923077, "num_input_tokens_seen": 67992, "step": 17, "train_accuracy": 0.009765625 }, { "epoch": 1.3846153846153846, "grad_norm": 102.8227767944336, "learning_rate": 0.01, "loss": 44.411582946777344, "num_input_tokens_seen": 72088, "step": 18, "train_runtime": 16.738, "train_tokens_per_second": 4306.855 }, { "epoch": 1.3846153846153846, "num_input_tokens_seen": 72088, "step": 18, "train_accuracy": 0.017578125 }, { "epoch": 1.4615384615384617, "grad_norm": 71.9914779663086, "learning_rate": 0.01, "loss": 41.01606750488281, "num_input_tokens_seen": 76184, "step": 19, "train_runtime": 17.5345, "train_tokens_per_second": 4344.796 }, { "epoch": 1.4615384615384617, "num_input_tokens_seen": 76184, "step": 19, "train_accuracy": 0.009765625 }, { "epoch": 1.5384615384615383, "grad_norm": 64.82003784179688, "learning_rate": 0.01, "loss": 39.845672607421875, "num_input_tokens_seen": 80280, "step": 20, "train_runtime": 18.3368, "train_tokens_per_second": 4378.077 }, { "epoch": 1.5384615384615383, "num_input_tokens_seen": 80280, "step": 20, "train_accuracy": 0.009765625 }, { "epoch": 1.6153846153846154, "grad_norm": 89.51396179199219, "learning_rate": 0.01, "loss": 43.63105010986328, "num_input_tokens_seen": 84376, "step": 21, "train_runtime": 19.132, "train_tokens_per_second": 4410.199 }, { "epoch": 1.6153846153846154, "num_input_tokens_seen": 84376, "step": 21, "train_accuracy": 0.013671875 }, { "epoch": 1.6923076923076923, "grad_norm": 84.98103332519531, "learning_rate": 0.01, "loss": 49.0236701965332, "num_input_tokens_seen": 88472, "step": 22, "train_runtime": 19.9279, "train_tokens_per_second": 4439.601 }, { "epoch": 1.6923076923076923, "num_input_tokens_seen": 88472, "step": 22, "train_accuracy": 0.01171875 }, { "epoch": 1.7692307692307692, "grad_norm": 55.64690017700195, "learning_rate": 0.01, "loss": 44.23743438720703, "num_input_tokens_seen": 92568, "step": 23, "train_runtime": 20.7215, "train_tokens_per_second": 4467.243 }, { "epoch": 1.7692307692307692, "num_input_tokens_seen": 92568, "step": 23, "train_accuracy": 0.005859375 }, { "epoch": 1.8461538461538463, "grad_norm": 41.61865234375, "learning_rate": 0.01, "loss": 41.33677673339844, "num_input_tokens_seen": 96664, "step": 24, "train_runtime": 21.5143, "train_tokens_per_second": 4493.016 }, { "epoch": 1.8461538461538463, "num_input_tokens_seen": 96664, "step": 24, "train_accuracy": 0.009765625 }, { "epoch": 1.9230769230769231, "grad_norm": 83.00218200683594, "learning_rate": 0.01, "loss": 35.780399322509766, "num_input_tokens_seen": 100760, "step": 25, "train_runtime": 22.3026, "train_tokens_per_second": 4517.851 }, { "epoch": 1.9230769230769231, "num_input_tokens_seen": 100760, "step": 25, "train_accuracy": 0.016286645084619522 }, { "epoch": 2.0, "grad_norm": 103.5835952758789, "learning_rate": 0.01, "loss": 60.61474609375, "num_input_tokens_seen": 103216, "step": 26, "train_runtime": 22.8053, "train_tokens_per_second": 4525.968 }, { "epoch": 2.0, "num_input_tokens_seen": 103216, "step": 26, "train_accuracy": 0.01953125 }, { "epoch": 2.076923076923077, "grad_norm": 89.98833465576172, "learning_rate": 0.01, "loss": 53.00630187988281, "num_input_tokens_seen": 107312, "step": 27, "train_runtime": 23.6097, "train_tokens_per_second": 4545.247 }, { "epoch": 2.076923076923077, "num_input_tokens_seen": 107312, "step": 27, "train_accuracy": 0.005859375 }, { "epoch": 2.1538461538461537, "grad_norm": 65.72506713867188, "learning_rate": 0.01, "loss": 58.71630859375, "num_input_tokens_seen": 111408, "step": 28, "train_runtime": 24.402, "train_tokens_per_second": 4565.527 }, { "epoch": 2.1538461538461537, "num_input_tokens_seen": 111408, "step": 28, "train_accuracy": 0.005859375 }, { "epoch": 2.230769230769231, "grad_norm": 100.10186004638672, "learning_rate": 0.01, "loss": 62.033809661865234, "num_input_tokens_seen": 115504, "step": 29, "train_runtime": 25.194, "train_tokens_per_second": 4584.588 }, { "epoch": 2.230769230769231, "num_input_tokens_seen": 115504, "step": 29, "train_accuracy": 0.01171875 }, { "epoch": 2.3076923076923075, "grad_norm": 72.38996124267578, "learning_rate": 0.01, "loss": 65.41529846191406, "num_input_tokens_seen": 119600, "step": 30, "train_runtime": 25.9882, "train_tokens_per_second": 4602.084 }, { "epoch": 2.3076923076923075, "num_input_tokens_seen": 119600, "step": 30, "train_accuracy": 0.0078125 }, { "epoch": 2.3846153846153846, "grad_norm": 94.2196273803711, "learning_rate": 0.01, "loss": 68.32504272460938, "num_input_tokens_seen": 123696, "step": 31, "train_runtime": 26.7814, "train_tokens_per_second": 4618.721 }, { "epoch": 2.3846153846153846, "num_input_tokens_seen": 123696, "step": 31, "train_accuracy": 0.005859375 }, { "epoch": 2.4615384615384617, "grad_norm": 96.7938232421875, "learning_rate": 0.01, "loss": 66.63648223876953, "num_input_tokens_seen": 127792, "step": 32, "train_runtime": 27.575, "train_tokens_per_second": 4634.345 }, { "epoch": 2.4615384615384617, "num_input_tokens_seen": 127792, "step": 32, "train_accuracy": 0.0078125 }, { "epoch": 2.5384615384615383, "grad_norm": 72.12036895751953, "learning_rate": 0.01, "loss": 66.71937561035156, "num_input_tokens_seen": 131888, "step": 33, "train_runtime": 28.3696, "train_tokens_per_second": 4648.921 }, { "epoch": 2.5384615384615383, "num_input_tokens_seen": 131888, "step": 33, "train_accuracy": 0.005859375 }, { "epoch": 2.6153846153846154, "grad_norm": 75.74029541015625, "learning_rate": 0.01, "loss": 67.44764709472656, "num_input_tokens_seen": 135984, "step": 34, "train_runtime": 29.1643, "train_tokens_per_second": 4662.687 }, { "epoch": 2.6153846153846154, "num_input_tokens_seen": 135984, "step": 34, "train_accuracy": 0.005859375 }, { "epoch": 2.6923076923076925, "grad_norm": 66.4405517578125, "learning_rate": 0.01, "loss": 59.08979034423828, "num_input_tokens_seen": 140080, "step": 35, "train_runtime": 29.958, "train_tokens_per_second": 4675.875 }, { "epoch": 2.6923076923076925, "num_input_tokens_seen": 140080, "step": 35, "train_accuracy": 0.015625 }, { "epoch": 2.769230769230769, "grad_norm": 66.96763610839844, "learning_rate": 0.01, "loss": 47.858978271484375, "num_input_tokens_seen": 144176, "step": 36, "train_runtime": 30.7536, "train_tokens_per_second": 4688.099 }, { "epoch": 2.769230769230769, "num_input_tokens_seen": 144176, "step": 36, "train_accuracy": 0.0078125 }, { "epoch": 2.8461538461538463, "grad_norm": 74.87189483642578, "learning_rate": 0.01, "loss": 49.067626953125, "num_input_tokens_seen": 148272, "step": 37, "train_runtime": 31.5492, "train_tokens_per_second": 4699.708 }, { "epoch": 2.8461538461538463, "num_input_tokens_seen": 148272, "step": 37, "train_accuracy": 0.005859375 }, { "epoch": 2.9230769230769234, "grad_norm": 96.19770050048828, "learning_rate": 0.01, "loss": 50.87727355957031, "num_input_tokens_seen": 152368, "step": 38, "train_runtime": 32.3421, "train_tokens_per_second": 4711.129 }, { "epoch": 2.9230769230769234, "num_input_tokens_seen": 152368, "step": 38, "train_accuracy": 0.0032573288772255182 }, { "epoch": 3.0, "grad_norm": 99.37137603759766, "learning_rate": 0.01, "loss": 60.30193328857422, "num_input_tokens_seen": 154824, "step": 39, "train_runtime": 32.8477, "train_tokens_per_second": 4713.394 }, { "epoch": 3.0, "num_input_tokens_seen": 154824, "step": 39, "train_accuracy": 0.009765625 }, { "epoch": 3.076923076923077, "grad_norm": 62.05854415893555, "learning_rate": 0.01, "loss": 67.73375701904297, "num_input_tokens_seen": 158920, "step": 40, "train_runtime": 33.6537, "train_tokens_per_second": 4722.218 }, { "epoch": 3.076923076923077, "num_input_tokens_seen": 158920, "step": 40, "train_accuracy": 0.015625 }, { "epoch": 3.1538461538461537, "grad_norm": 89.07279205322266, "learning_rate": 0.01, "loss": 68.0074462890625, "num_input_tokens_seen": 163016, "step": 41, "train_runtime": 34.4465, "train_tokens_per_second": 4732.441 }, { "epoch": 3.1538461538461537, "num_input_tokens_seen": 163016, "step": 41, "train_accuracy": 0.021484375 }, { "epoch": 3.230769230769231, "grad_norm": 90.51819610595703, "learning_rate": 0.01, "loss": 66.1943588256836, "num_input_tokens_seen": 167112, "step": 42, "train_runtime": 35.2426, "train_tokens_per_second": 4741.766 }, { "epoch": 3.230769230769231, "num_input_tokens_seen": 167112, "step": 42, "train_accuracy": 0.005859375 }, { "epoch": 3.3076923076923075, "grad_norm": 83.96027374267578, "learning_rate": 0.01, "loss": 60.99195098876953, "num_input_tokens_seen": 171208, "step": 43, "train_runtime": 36.0415, "train_tokens_per_second": 4750.296 }, { "epoch": 3.3076923076923075, "num_input_tokens_seen": 171208, "step": 43, "train_accuracy": 0.01171875 }, { "epoch": 3.3846153846153846, "grad_norm": 78.46168518066406, "learning_rate": 0.01, "loss": 59.39600372314453, "num_input_tokens_seen": 175304, "step": 44, "train_runtime": 36.8398, "train_tokens_per_second": 4758.543 }, { "epoch": 3.3846153846153846, "num_input_tokens_seen": 175304, "step": 44, "train_accuracy": 0.009765625 }, { "epoch": 3.4615384615384617, "grad_norm": 85.69463348388672, "learning_rate": 0.01, "loss": 70.74111938476562, "num_input_tokens_seen": 179400, "step": 45, "train_runtime": 37.6417, "train_tokens_per_second": 4765.991 }, { "epoch": 3.4615384615384617, "num_input_tokens_seen": 179400, "step": 45, "train_accuracy": 0.001953125 }, { "epoch": 3.5384615384615383, "grad_norm": 96.39139556884766, "learning_rate": 0.01, "loss": 88.665771484375, "num_input_tokens_seen": 183496, "step": 46, "train_runtime": 38.4405, "train_tokens_per_second": 4773.507 }, { "epoch": 3.5384615384615383, "num_input_tokens_seen": 183496, "step": 46, "train_accuracy": 0.00390625 }, { "epoch": 3.6153846153846154, "grad_norm": 57.92229080200195, "learning_rate": 0.01, "loss": 84.55277252197266, "num_input_tokens_seen": 187592, "step": 47, "train_runtime": 39.2363, "train_tokens_per_second": 4781.083 }, { "epoch": 3.6153846153846154, "num_input_tokens_seen": 187592, "step": 47, "train_accuracy": 0.005859375 }, { "epoch": 3.6923076923076925, "grad_norm": 77.67723846435547, "learning_rate": 0.01, "loss": 76.61539459228516, "num_input_tokens_seen": 191688, "step": 48, "train_runtime": 40.0342, "train_tokens_per_second": 4788.109 }, { "epoch": 3.6923076923076925, "num_input_tokens_seen": 191688, "step": 48, "train_accuracy": 0.013671875 }, { "epoch": 3.769230769230769, "grad_norm": 94.53797149658203, "learning_rate": 0.01, "loss": 90.10026550292969, "num_input_tokens_seen": 195784, "step": 49, "train_runtime": 40.8358, "train_tokens_per_second": 4794.421 }, { "epoch": 3.769230769230769, "num_input_tokens_seen": 195784, "step": 49, "train_accuracy": 0.0078125 }, { "epoch": 3.8461538461538463, "grad_norm": 88.79261779785156, "learning_rate": 0.01, "loss": 93.755126953125, "num_input_tokens_seen": 199880, "step": 50, "train_runtime": 41.6387, "train_tokens_per_second": 4800.338 }, { "epoch": 3.8461538461538463, "num_input_tokens_seen": 199880, "step": 50, "train_accuracy": 0.005859375 }, { "epoch": 3.9230769230769234, "grad_norm": 63.9875602722168, "learning_rate": 0.01, "loss": 87.74848175048828, "num_input_tokens_seen": 203976, "step": 51, "train_runtime": 42.4304, "train_tokens_per_second": 4807.307 }, { "epoch": 3.9230769230769234, "num_input_tokens_seen": 203976, "step": 51, "train_accuracy": 0.013029315508902073 }, { "epoch": 4.0, "grad_norm": 55.67214584350586, "learning_rate": 0.01, "loss": 92.73106384277344, "num_input_tokens_seen": 206432, "step": 52, "train_runtime": 42.9329, "train_tokens_per_second": 4808.249 }, { "epoch": 4.0, "num_input_tokens_seen": 206432, "step": 52, "train_accuracy": 0.01171875 }, { "epoch": 4.076923076923077, "grad_norm": 91.23143768310547, "learning_rate": 0.01, "loss": 100.60653686523438, "num_input_tokens_seen": 210528, "step": 53, "train_runtime": 43.7405, "train_tokens_per_second": 4813.117 }, { "epoch": 4.076923076923077, "num_input_tokens_seen": 210528, "step": 53, "train_accuracy": 0.015625 }, { "epoch": 4.153846153846154, "grad_norm": 60.825382232666016, "learning_rate": 0.01, "loss": 92.57173156738281, "num_input_tokens_seen": 214624, "step": 54, "train_runtime": 44.5422, "train_tokens_per_second": 4818.44 }, { "epoch": 4.153846153846154, "num_input_tokens_seen": 214624, "step": 54, "train_accuracy": 0.005859375 }, { "epoch": 4.230769230769231, "grad_norm": 91.31449127197266, "learning_rate": 0.01, "loss": 99.74507904052734, "num_input_tokens_seen": 218720, "step": 55, "train_runtime": 45.3388, "train_tokens_per_second": 4824.119 }, { "epoch": 4.230769230769231, "num_input_tokens_seen": 218720, "step": 55, "train_accuracy": 0.013671875 }, { "epoch": 4.3076923076923075, "grad_norm": 65.0865707397461, "learning_rate": 0.01, "loss": 97.59388732910156, "num_input_tokens_seen": 222816, "step": 56, "train_runtime": 46.1387, "train_tokens_per_second": 4829.261 }, { "epoch": 4.3076923076923075, "num_input_tokens_seen": 222816, "step": 56, "train_accuracy": 0.00390625 }, { "epoch": 4.384615384615385, "grad_norm": 56.028629302978516, "learning_rate": 0.01, "loss": 94.15910339355469, "num_input_tokens_seen": 226912, "step": 57, "train_runtime": 46.9361, "train_tokens_per_second": 4834.485 }, { "epoch": 4.384615384615385, "num_input_tokens_seen": 226912, "step": 57, "train_accuracy": 0.00390625 }, { "epoch": 4.461538461538462, "grad_norm": 90.6352767944336, "learning_rate": 0.01, "loss": 79.20365142822266, "num_input_tokens_seen": 231008, "step": 58, "train_runtime": 47.7351, "train_tokens_per_second": 4839.373 }, { "epoch": 4.461538461538462, "num_input_tokens_seen": 231008, "step": 58, "train_accuracy": 0.005859375 }, { "epoch": 4.538461538461538, "grad_norm": 73.205810546875, "learning_rate": 0.01, "loss": 82.34382629394531, "num_input_tokens_seen": 235104, "step": 59, "train_runtime": 48.5416, "train_tokens_per_second": 4843.35 }, { "epoch": 4.538461538461538, "num_input_tokens_seen": 235104, "step": 59, "train_accuracy": 0.017578125 }, { "epoch": 4.615384615384615, "grad_norm": 89.18135070800781, "learning_rate": 0.01, "loss": 81.22946166992188, "num_input_tokens_seen": 239200, "step": 60, "train_runtime": 49.34, "train_tokens_per_second": 4847.996 }, { "epoch": 4.615384615384615, "num_input_tokens_seen": 239200, "step": 60, "train_accuracy": 0.01953125 }, { "epoch": 4.6923076923076925, "grad_norm": 82.80770111083984, "learning_rate": 0.01, "loss": 89.39828491210938, "num_input_tokens_seen": 243296, "step": 61, "train_runtime": 50.1404, "train_tokens_per_second": 4852.295 }, { "epoch": 4.6923076923076925, "num_input_tokens_seen": 243296, "step": 61, "train_accuracy": 0.009765625 }, { "epoch": 4.769230769230769, "grad_norm": 80.53831481933594, "learning_rate": 0.01, "loss": 93.91964721679688, "num_input_tokens_seen": 247392, "step": 62, "train_runtime": 50.941, "train_tokens_per_second": 4856.442 }, { "epoch": 4.769230769230769, "num_input_tokens_seen": 247392, "step": 62, "train_accuracy": 0.015625 }, { "epoch": 4.846153846153846, "grad_norm": 87.39923858642578, "learning_rate": 0.01, "loss": 95.6671371459961, "num_input_tokens_seen": 251488, "step": 63, "train_runtime": 51.7384, "train_tokens_per_second": 4860.759 }, { "epoch": 4.846153846153846, "num_input_tokens_seen": 251488, "step": 63, "train_accuracy": 0.013671875 }, { "epoch": 4.923076923076923, "grad_norm": 80.83548736572266, "learning_rate": 0.01, "loss": 70.75057983398438, "num_input_tokens_seen": 255584, "step": 64, "train_runtime": 52.5359, "train_tokens_per_second": 4864.94 }, { "epoch": 4.923076923076923, "num_input_tokens_seen": 255584, "step": 64, "train_accuracy": 0.016286645084619522 }, { "epoch": 5.0, "grad_norm": 73.11419677734375, "learning_rate": 0.01, "loss": 68.34355926513672, "num_input_tokens_seen": 258040, "step": 65, "train_runtime": 53.0416, "train_tokens_per_second": 4864.857 }, { "epoch": 5.0, "num_input_tokens_seen": 258040, "step": 65, "train_accuracy": 0.0078125 }, { "epoch": 5.076923076923077, "grad_norm": 87.57298278808594, "learning_rate": 0.01, "loss": 68.34878540039062, "num_input_tokens_seen": 262136, "step": 66, "train_runtime": 53.8523, "train_tokens_per_second": 4867.689 }, { "epoch": 5.076923076923077, "num_input_tokens_seen": 262136, "step": 66, "train_accuracy": 0.009765625 }, { "epoch": 5.153846153846154, "grad_norm": 87.19989013671875, "learning_rate": 0.01, "loss": 71.25694274902344, "num_input_tokens_seen": 266232, "step": 67, "train_runtime": 54.6483, "train_tokens_per_second": 4871.735 }, { "epoch": 5.153846153846154, "num_input_tokens_seen": 266232, "step": 67, "train_accuracy": 0.009765625 }, { "epoch": 5.230769230769231, "grad_norm": 88.10555267333984, "learning_rate": 0.01, "loss": 75.13947296142578, "num_input_tokens_seen": 270328, "step": 68, "train_runtime": 55.4461, "train_tokens_per_second": 4875.512 }, { "epoch": 5.230769230769231, "num_input_tokens_seen": 270328, "step": 68, "train_accuracy": 0.0 }, { "epoch": 5.3076923076923075, "grad_norm": 86.66246795654297, "learning_rate": 0.01, "loss": 73.39552307128906, "num_input_tokens_seen": 274424, "step": 69, "train_runtime": 56.2446, "train_tokens_per_second": 4879.117 }, { "epoch": 5.3076923076923075, "num_input_tokens_seen": 274424, "step": 69, "train_accuracy": 0.015625 }, { "epoch": 5.384615384615385, "grad_norm": 61.33372116088867, "learning_rate": 0.01, "loss": 74.055419921875, "num_input_tokens_seen": 278520, "step": 70, "train_runtime": 57.0431, "train_tokens_per_second": 4882.626 }, { "epoch": 5.384615384615385, "num_input_tokens_seen": 278520, "step": 70, "train_accuracy": 0.00390625 }, { "epoch": 5.461538461538462, "grad_norm": 75.86312866210938, "learning_rate": 0.01, "loss": 74.29896545410156, "num_input_tokens_seen": 282616, "step": 71, "train_runtime": 57.8433, "train_tokens_per_second": 4885.888 }, { "epoch": 5.461538461538462, "num_input_tokens_seen": 282616, "step": 71, "train_accuracy": 0.01953125 }, { "epoch": 5.538461538461538, "grad_norm": 53.104637145996094, "learning_rate": 0.01, "loss": 61.737548828125, "num_input_tokens_seen": 286712, "step": 72, "train_runtime": 58.6464, "train_tokens_per_second": 4888.829 }, { "epoch": 5.538461538461538, "num_input_tokens_seen": 286712, "step": 72, "train_accuracy": 0.017578125 }, { "epoch": 5.615384615384615, "grad_norm": 81.82807922363281, "learning_rate": 0.01, "loss": 61.38819885253906, "num_input_tokens_seen": 290808, "step": 73, "train_runtime": 59.4482, "train_tokens_per_second": 4891.788 }, { "epoch": 5.615384615384615, "num_input_tokens_seen": 290808, "step": 73, "train_accuracy": 0.01171875 }, { "epoch": 5.6923076923076925, "grad_norm": 84.85137176513672, "learning_rate": 0.01, "loss": 70.53759002685547, "num_input_tokens_seen": 294904, "step": 74, "train_runtime": 60.2482, "train_tokens_per_second": 4894.816 }, { "epoch": 5.6923076923076925, "num_input_tokens_seen": 294904, "step": 74, "train_accuracy": 0.013671875 }, { "epoch": 5.769230769230769, "grad_norm": 68.4859390258789, "learning_rate": 0.01, "loss": 67.85568237304688, "num_input_tokens_seen": 299000, "step": 75, "train_runtime": 61.0482, "train_tokens_per_second": 4897.773 }, { "epoch": 5.769230769230769, "num_input_tokens_seen": 299000, "step": 75, "train_accuracy": 0.005859375 }, { "epoch": 5.846153846153846, "grad_norm": 83.89737701416016, "learning_rate": 0.01, "loss": 63.241065979003906, "num_input_tokens_seen": 303096, "step": 76, "train_runtime": 61.8504, "train_tokens_per_second": 4900.466 }, { "epoch": 5.846153846153846, "num_input_tokens_seen": 303096, "step": 76, "train_accuracy": 0.01171875 }, { "epoch": 5.923076923076923, "grad_norm": 84.33633422851562, "learning_rate": 0.01, "loss": 65.82176208496094, "num_input_tokens_seen": 307192, "step": 77, "train_runtime": 62.6481, "train_tokens_per_second": 4903.451 }, { "epoch": 5.923076923076923, "num_input_tokens_seen": 307192, "step": 77, "train_accuracy": 0.013029315508902073 }, { "epoch": 6.0, "grad_norm": 58.69049072265625, "learning_rate": 0.01, "loss": 58.87933349609375, "num_input_tokens_seen": 309648, "step": 78, "train_runtime": 63.1559, "train_tokens_per_second": 4902.914 }, { "epoch": 6.0, "num_input_tokens_seen": 309648, "step": 78, "train_accuracy": 0.009765625 }, { "epoch": 6.076923076923077, "grad_norm": 58.454830169677734, "learning_rate": 0.01, "loss": 60.6256217956543, "num_input_tokens_seen": 313744, "step": 79, "train_runtime": 63.9682, "train_tokens_per_second": 4904.684 }, { "epoch": 6.076923076923077, "num_input_tokens_seen": 313744, "step": 79, "train_accuracy": 0.00390625 }, { "epoch": 6.153846153846154, "grad_norm": 57.2540168762207, "learning_rate": 0.01, "loss": 58.05278396606445, "num_input_tokens_seen": 317840, "step": 80, "train_runtime": 64.7688, "train_tokens_per_second": 4907.303 }, { "epoch": 6.153846153846154, "num_input_tokens_seen": 317840, "step": 80, "train_accuracy": 0.0078125 }, { "epoch": 6.230769230769231, "grad_norm": 50.83211898803711, "learning_rate": 0.01, "loss": 51.120361328125, "num_input_tokens_seen": 321936, "step": 81, "train_runtime": 65.5698, "train_tokens_per_second": 4909.818 }, { "epoch": 6.230769230769231, "num_input_tokens_seen": 321936, "step": 81, "train_accuracy": 0.01171875 }, { "epoch": 6.3076923076923075, "grad_norm": 60.46956253051758, "learning_rate": 0.01, "loss": 52.14616394042969, "num_input_tokens_seen": 326032, "step": 82, "train_runtime": 66.371, "train_tokens_per_second": 4912.266 }, { "epoch": 6.3076923076923075, "num_input_tokens_seen": 326032, "step": 82, "train_accuracy": 0.0078125 }, { "epoch": 6.384615384615385, "grad_norm": 76.81056213378906, "learning_rate": 0.01, "loss": 54.78953170776367, "num_input_tokens_seen": 330128, "step": 83, "train_runtime": 67.1735, "train_tokens_per_second": 4914.559 }, { "epoch": 6.384615384615385, "num_input_tokens_seen": 330128, "step": 83, "train_accuracy": 0.01171875 }, { "epoch": 6.461538461538462, "grad_norm": 82.9794692993164, "learning_rate": 0.01, "loss": 65.67823028564453, "num_input_tokens_seen": 334224, "step": 84, "train_runtime": 67.9749, "train_tokens_per_second": 4916.872 }, { "epoch": 6.461538461538462, "num_input_tokens_seen": 334224, "step": 84, "train_accuracy": 0.0 }, { "epoch": 6.538461538461538, "grad_norm": 83.5008773803711, "learning_rate": 0.01, "loss": 68.018798828125, "num_input_tokens_seen": 338320, "step": 85, "train_runtime": 68.7761, "train_tokens_per_second": 4919.147 }, { "epoch": 6.538461538461538, "num_input_tokens_seen": 338320, "step": 85, "train_accuracy": 0.01171875 }, { "epoch": 6.615384615384615, "grad_norm": 69.92463684082031, "learning_rate": 0.01, "loss": 55.379913330078125, "num_input_tokens_seen": 342416, "step": 86, "train_runtime": 69.5783, "train_tokens_per_second": 4921.307 }, { "epoch": 6.615384615384615, "num_input_tokens_seen": 342416, "step": 86, "train_accuracy": 0.00390625 }, { "epoch": 6.6923076923076925, "grad_norm": 73.4237060546875, "learning_rate": 0.01, "loss": 67.15409851074219, "num_input_tokens_seen": 346512, "step": 87, "train_runtime": 70.3801, "train_tokens_per_second": 4923.435 }, { "epoch": 6.6923076923076925, "num_input_tokens_seen": 346512, "step": 87, "train_accuracy": 0.01953125 }, { "epoch": 6.769230769230769, "grad_norm": 60.570884704589844, "learning_rate": 0.01, "loss": 66.96223449707031, "num_input_tokens_seen": 350608, "step": 88, "train_runtime": 71.182, "train_tokens_per_second": 4925.515 }, { "epoch": 6.769230769230769, "num_input_tokens_seen": 350608, "step": 88, "train_accuracy": 0.017578125 }, { "epoch": 6.846153846153846, "grad_norm": 37.7768669128418, "learning_rate": 0.01, "loss": 66.39012145996094, "num_input_tokens_seen": 354704, "step": 89, "train_runtime": 71.9835, "train_tokens_per_second": 4927.574 }, { "epoch": 6.846153846153846, "num_input_tokens_seen": 354704, "step": 89, "train_accuracy": 0.005859375 }, { "epoch": 6.923076923076923, "grad_norm": 58.63819885253906, "learning_rate": 0.01, "loss": 64.41407775878906, "num_input_tokens_seen": 358800, "step": 90, "train_runtime": 72.7812, "train_tokens_per_second": 4929.841 }, { "epoch": 6.923076923076923, "num_input_tokens_seen": 358800, "step": 90, "train_accuracy": 0.009771986864507198 }, { "epoch": 7.0, "grad_norm": 54.507652282714844, "learning_rate": 0.01, "loss": 68.82718658447266, "num_input_tokens_seen": 361256, "step": 91, "train_runtime": 73.2899, "train_tokens_per_second": 4929.136 }, { "epoch": 7.0, "num_input_tokens_seen": 361256, "step": 91, "train_accuracy": 0.013671875 }, { "epoch": 7.076923076923077, "grad_norm": 68.39746856689453, "learning_rate": 0.01, "loss": 76.84484100341797, "num_input_tokens_seen": 365352, "step": 92, "train_runtime": 74.1037, "train_tokens_per_second": 4930.283 }, { "epoch": 7.076923076923077, "num_input_tokens_seen": 365352, "step": 92, "train_accuracy": 0.009765625 }, { "epoch": 7.153846153846154, "grad_norm": 68.6640853881836, "learning_rate": 0.01, "loss": 64.662353515625, "num_input_tokens_seen": 369448, "step": 93, "train_runtime": 74.9052, "train_tokens_per_second": 4932.207 }, { "epoch": 7.153846153846154, "num_input_tokens_seen": 369448, "step": 93, "train_accuracy": 0.01171875 }, { "epoch": 7.230769230769231, "grad_norm": 77.38482666015625, "learning_rate": 0.01, "loss": 70.11073303222656, "num_input_tokens_seen": 373544, "step": 94, "train_runtime": 75.7079, "train_tokens_per_second": 4934.018 }, { "epoch": 7.230769230769231, "num_input_tokens_seen": 373544, "step": 94, "train_accuracy": 0.0 }, { "epoch": 7.3076923076923075, "grad_norm": 76.43072509765625, "learning_rate": 0.01, "loss": 68.50315856933594, "num_input_tokens_seen": 377640, "step": 95, "train_runtime": 76.5101, "train_tokens_per_second": 4935.819 }, { "epoch": 7.3076923076923075, "num_input_tokens_seen": 377640, "step": 95, "train_accuracy": 0.015625 }, { "epoch": 7.384615384615385, "grad_norm": 36.90632247924805, "learning_rate": 0.01, "loss": 58.06911849975586, "num_input_tokens_seen": 381736, "step": 96, "train_runtime": 77.3124, "train_tokens_per_second": 4937.578 }, { "epoch": 7.384615384615385, "num_input_tokens_seen": 381736, "step": 96, "train_accuracy": 0.0078125 }, { "epoch": 7.461538461538462, "grad_norm": 78.21217346191406, "learning_rate": 0.01, "loss": 75.7255630493164, "num_input_tokens_seen": 385832, "step": 97, "train_runtime": 78.115, "train_tokens_per_second": 4939.282 }, { "epoch": 7.461538461538462, "num_input_tokens_seen": 385832, "step": 97, "train_accuracy": 0.017578125 }, { "epoch": 7.538461538461538, "grad_norm": 76.51519012451172, "learning_rate": 0.01, "loss": 70.77012634277344, "num_input_tokens_seen": 389928, "step": 98, "train_runtime": 78.9183, "train_tokens_per_second": 4940.909 }, { "epoch": 7.538461538461538, "num_input_tokens_seen": 389928, "step": 98, "train_accuracy": 0.00390625 }, { "epoch": 7.615384615384615, "grad_norm": 67.02277374267578, "learning_rate": 0.01, "loss": 57.284114837646484, "num_input_tokens_seen": 394024, "step": 99, "train_runtime": 79.7215, "train_tokens_per_second": 4942.508 }, { "epoch": 7.615384615384615, "num_input_tokens_seen": 394024, "step": 99, "train_accuracy": 0.005859375 }, { "epoch": 7.6923076923076925, "grad_norm": 69.74555206298828, "learning_rate": 0.01, "loss": 59.708221435546875, "num_input_tokens_seen": 398120, "step": 100, "train_runtime": 80.5242, "train_tokens_per_second": 4944.101 }, { "epoch": 7.6923076923076925, "eval_CMD_3_branch_eval_accuracy": 0.011211573236889693, "eval_CMD_3_branch_eval_loss": 63.77542495727539, "eval_CMD_3_branch_eval_runtime": 1.1333, "eval_CMD_3_branch_eval_samples_per_second": 2439.689, "eval_CMD_3_branch_eval_steps_per_second": 5.294, "num_input_tokens_seen": 398120, "step": 100 }, { "epoch": 7.6923076923076925, "num_input_tokens_seen": 398120, "step": 100, "train_accuracy": 0.009765625 }, { "epoch": 7.769230769230769, "grad_norm": 66.39517211914062, "learning_rate": 0.01, "loss": 63.51918029785156, "num_input_tokens_seen": 402216, "step": 101, "train_runtime": 82.4657, "train_tokens_per_second": 4877.374 }, { "epoch": 7.769230769230769, "num_input_tokens_seen": 402216, "step": 101, "train_accuracy": 0.01953125 }, { "epoch": 7.846153846153846, "grad_norm": 71.41845703125, "learning_rate": 0.01, "loss": 58.58770751953125, "num_input_tokens_seen": 406312, "step": 102, "train_runtime": 83.2683, "train_tokens_per_second": 4879.551 }, { "epoch": 7.846153846153846, "num_input_tokens_seen": 406312, "step": 102, "train_accuracy": 0.005859375 }, { "epoch": 7.923076923076923, "grad_norm": 63.093082427978516, "learning_rate": 0.01, "loss": 49.53801727294922, "num_input_tokens_seen": 410408, "step": 103, "train_runtime": 84.0684, "train_tokens_per_second": 4881.833 }, { "epoch": 7.923076923076923, "num_input_tokens_seen": 410408, "step": 103, "train_accuracy": 0.026058631017804146 }, { "epoch": 8.0, "grad_norm": 63.079898834228516, "learning_rate": 0.01, "loss": 62.99091339111328, "num_input_tokens_seen": 412864, "step": 104, "train_runtime": 84.5763, "train_tokens_per_second": 4881.559 }, { "epoch": 8.0, "num_input_tokens_seen": 412864, "step": 104, "train_accuracy": 0.013671875 }, { "epoch": 8.076923076923077, "grad_norm": 50.123836517333984, "learning_rate": 0.01, "loss": 59.246253967285156, "num_input_tokens_seen": 416960, "step": 105, "train_runtime": 85.3899, "train_tokens_per_second": 4883.013 }, { "epoch": 8.076923076923077, "num_input_tokens_seen": 416960, "step": 105, "train_accuracy": 0.009765625 }, { "epoch": 8.153846153846153, "grad_norm": 72.22982025146484, "learning_rate": 0.01, "loss": 57.421173095703125, "num_input_tokens_seen": 421056, "step": 106, "train_runtime": 86.1927, "train_tokens_per_second": 4885.055 }, { "epoch": 8.153846153846153, "num_input_tokens_seen": 421056, "step": 106, "train_accuracy": 0.013671875 }, { "epoch": 8.23076923076923, "grad_norm": 72.39375305175781, "learning_rate": 0.01, "loss": 55.41351318359375, "num_input_tokens_seen": 425152, "step": 107, "train_runtime": 86.9963, "train_tokens_per_second": 4887.013 }, { "epoch": 8.23076923076923, "num_input_tokens_seen": 425152, "step": 107, "train_accuracy": 0.0234375 }, { "epoch": 8.307692307692308, "grad_norm": 50.16789627075195, "learning_rate": 0.01, "loss": 59.79741668701172, "num_input_tokens_seen": 429248, "step": 108, "train_runtime": 87.8002, "train_tokens_per_second": 4888.92 }, { "epoch": 8.307692307692308, "num_input_tokens_seen": 429248, "step": 108, "train_accuracy": 0.01171875 }, { "epoch": 8.384615384615385, "grad_norm": 72.01069641113281, "learning_rate": 0.01, "loss": 60.06975173950195, "num_input_tokens_seen": 433344, "step": 109, "train_runtime": 88.6049, "train_tokens_per_second": 4890.745 }, { "epoch": 8.384615384615385, "num_input_tokens_seen": 433344, "step": 109, "train_accuracy": 0.0078125 }, { "epoch": 8.461538461538462, "grad_norm": 55.495506286621094, "learning_rate": 0.01, "loss": 57.364906311035156, "num_input_tokens_seen": 437440, "step": 110, "train_runtime": 89.4096, "train_tokens_per_second": 4892.539 }, { "epoch": 8.461538461538462, "num_input_tokens_seen": 437440, "step": 110, "train_accuracy": 0.005859375 }, { "epoch": 8.538461538461538, "grad_norm": 67.98399353027344, "learning_rate": 0.01, "loss": 66.41151428222656, "num_input_tokens_seen": 441536, "step": 111, "train_runtime": 90.2139, "train_tokens_per_second": 4894.325 }, { "epoch": 8.538461538461538, "num_input_tokens_seen": 441536, "step": 111, "train_accuracy": 0.005859375 }, { "epoch": 8.615384615384615, "grad_norm": 68.21734619140625, "learning_rate": 0.01, "loss": 65.20812225341797, "num_input_tokens_seen": 445632, "step": 112, "train_runtime": 91.0187, "train_tokens_per_second": 4896.051 }, { "epoch": 8.615384615384615, "num_input_tokens_seen": 445632, "step": 112, "train_accuracy": 0.005859375 }, { "epoch": 8.692307692307692, "grad_norm": 53.03721237182617, "learning_rate": 0.01, "loss": 56.20685577392578, "num_input_tokens_seen": 449728, "step": 113, "train_runtime": 91.8234, "train_tokens_per_second": 4897.748 }, { "epoch": 8.692307692307692, "num_input_tokens_seen": 449728, "step": 113, "train_accuracy": 0.00390625 }, { "epoch": 8.76923076923077, "grad_norm": 50.524742126464844, "learning_rate": 0.01, "loss": 61.24467849731445, "num_input_tokens_seen": 453824, "step": 114, "train_runtime": 92.628, "train_tokens_per_second": 4899.427 }, { "epoch": 8.76923076923077, "num_input_tokens_seen": 453824, "step": 114, "train_accuracy": 0.005859375 }, { "epoch": 8.846153846153847, "grad_norm": 56.96110916137695, "learning_rate": 0.01, "loss": 57.87140655517578, "num_input_tokens_seen": 457920, "step": 115, "train_runtime": 93.4345, "train_tokens_per_second": 4900.976 }, { "epoch": 8.846153846153847, "num_input_tokens_seen": 457920, "step": 115, "train_accuracy": 0.013671875 }, { "epoch": 8.923076923076923, "grad_norm": 40.74517822265625, "learning_rate": 0.01, "loss": 46.19894027709961, "num_input_tokens_seen": 462016, "step": 116, "train_runtime": 94.2377, "train_tokens_per_second": 4902.669 }, { "epoch": 8.923076923076923, "num_input_tokens_seen": 462016, "step": 116, "train_accuracy": 0.013029315508902073 }, { "epoch": 9.0, "grad_norm": 44.081607818603516, "learning_rate": 0.01, "loss": 46.22126388549805, "num_input_tokens_seen": 464472, "step": 117, "train_runtime": 94.7473, "train_tokens_per_second": 4902.221 }, { "epoch": 9.0, "num_input_tokens_seen": 464472, "step": 117, "train_accuracy": 0.0078125 }, { "epoch": 9.076923076923077, "grad_norm": 65.67768859863281, "learning_rate": 0.01, "loss": 51.726722717285156, "num_input_tokens_seen": 468568, "step": 118, "train_runtime": 95.5645, "train_tokens_per_second": 4903.162 }, { "epoch": 9.076923076923077, "num_input_tokens_seen": 468568, "step": 118, "train_accuracy": 0.0078125 }, { "epoch": 9.153846153846153, "grad_norm": 67.71527099609375, "learning_rate": 0.01, "loss": 52.51469421386719, "num_input_tokens_seen": 472664, "step": 119, "train_runtime": 96.3683, "train_tokens_per_second": 4904.764 }, { "epoch": 9.153846153846153, "num_input_tokens_seen": 472664, "step": 119, "train_accuracy": 0.013671875 }, { "epoch": 9.23076923076923, "grad_norm": 35.15571212768555, "learning_rate": 0.01, "loss": 48.70310592651367, "num_input_tokens_seen": 476760, "step": 120, "train_runtime": 97.1726, "train_tokens_per_second": 4906.322 }, { "epoch": 9.23076923076923, "num_input_tokens_seen": 476760, "step": 120, "train_accuracy": 0.009765625 }, { "epoch": 9.307692307692308, "grad_norm": 64.75183868408203, "learning_rate": 0.01, "loss": 52.49262237548828, "num_input_tokens_seen": 480856, "step": 121, "train_runtime": 97.9774, "train_tokens_per_second": 4907.825 }, { "epoch": 9.307692307692308, "num_input_tokens_seen": 480856, "step": 121, "train_accuracy": 0.017578125 }, { "epoch": 9.384615384615385, "grad_norm": 58.96760940551758, "learning_rate": 0.01, "loss": 48.93315124511719, "num_input_tokens_seen": 484952, "step": 122, "train_runtime": 98.7806, "train_tokens_per_second": 4909.384 }, { "epoch": 9.384615384615385, "num_input_tokens_seen": 484952, "step": 122, "train_accuracy": 0.00390625 }, { "epoch": 9.461538461538462, "grad_norm": 63.780548095703125, "learning_rate": 0.01, "loss": 44.274940490722656, "num_input_tokens_seen": 489048, "step": 123, "train_runtime": 99.5838, "train_tokens_per_second": 4910.922 }, { "epoch": 9.461538461538462, "num_input_tokens_seen": 489048, "step": 123, "train_accuracy": 0.009765625 }, { "epoch": 9.538461538461538, "grad_norm": 61.71628952026367, "learning_rate": 0.01, "loss": 49.18743133544922, "num_input_tokens_seen": 493144, "step": 124, "train_runtime": 100.3871, "train_tokens_per_second": 4912.423 }, { "epoch": 9.538461538461538, "num_input_tokens_seen": 493144, "step": 124, "train_accuracy": 0.0078125 }, { "epoch": 9.615384615384615, "grad_norm": 62.674835205078125, "learning_rate": 0.01, "loss": 49.97962951660156, "num_input_tokens_seen": 497240, "step": 125, "train_runtime": 101.1903, "train_tokens_per_second": 4913.908 }, { "epoch": 9.615384615384615, "num_input_tokens_seen": 497240, "step": 125, "train_accuracy": 0.013671875 }, { "epoch": 9.692307692307692, "grad_norm": 62.50501251220703, "learning_rate": 0.01, "loss": 50.329891204833984, "num_input_tokens_seen": 501336, "step": 126, "train_runtime": 101.9935, "train_tokens_per_second": 4915.373 }, { "epoch": 9.692307692307692, "num_input_tokens_seen": 501336, "step": 126, "train_accuracy": 0.013671875 }, { "epoch": 9.76923076923077, "grad_norm": 63.707183837890625, "learning_rate": 0.01, "loss": 52.13093566894531, "num_input_tokens_seen": 505432, "step": 127, "train_runtime": 102.7966, "train_tokens_per_second": 4916.816 }, { "epoch": 9.76923076923077, "num_input_tokens_seen": 505432, "step": 127, "train_accuracy": 0.0078125 }, { "epoch": 9.846153846153847, "grad_norm": 62.29219436645508, "learning_rate": 0.01, "loss": 55.159767150878906, "num_input_tokens_seen": 509528, "step": 128, "train_runtime": 103.6009, "train_tokens_per_second": 4918.18 }, { "epoch": 9.846153846153847, "num_input_tokens_seen": 509528, "step": 128, "train_accuracy": 0.01171875 }, { "epoch": 9.923076923076923, "grad_norm": 63.7969856262207, "learning_rate": 0.01, "loss": 59.77757263183594, "num_input_tokens_seen": 513624, "step": 129, "train_runtime": 104.4001, "train_tokens_per_second": 4919.765 }, { "epoch": 9.923076923076923, "num_input_tokens_seen": 513624, "step": 129, "train_accuracy": 0.009771986864507198 }, { "epoch": 10.0, "grad_norm": 61.75998306274414, "learning_rate": 0.01, "loss": 56.43214416503906, "num_input_tokens_seen": 516080, "step": 130, "train_runtime": 104.9091, "train_tokens_per_second": 4919.304 }, { "epoch": 10.0, "num_input_tokens_seen": 516080, "step": 130, "train_accuracy": 0.0078125 }, { "epoch": 10.076923076923077, "grad_norm": 45.13194274902344, "learning_rate": 0.01, "loss": 48.59112548828125, "num_input_tokens_seen": 520176, "step": 131, "train_runtime": 105.7249, "train_tokens_per_second": 4920.09 }, { "epoch": 10.076923076923077, "num_input_tokens_seen": 520176, "step": 131, "train_accuracy": 0.001953125 }, { "epoch": 10.153846153846153, "grad_norm": 43.682220458984375, "learning_rate": 0.01, "loss": 45.91192626953125, "num_input_tokens_seen": 524272, "step": 132, "train_runtime": 106.5299, "train_tokens_per_second": 4921.358 }, { "epoch": 10.153846153846153, "num_input_tokens_seen": 524272, "step": 132, "train_accuracy": 0.013671875 }, { "epoch": 10.23076923076923, "grad_norm": 62.21281814575195, "learning_rate": 0.01, "loss": 51.57979202270508, "num_input_tokens_seen": 528368, "step": 133, "train_runtime": 107.3341, "train_tokens_per_second": 4922.648 }, { "epoch": 10.23076923076923, "num_input_tokens_seen": 528368, "step": 133, "train_accuracy": 0.005859375 }, { "epoch": 10.307692307692308, "grad_norm": 51.02768325805664, "learning_rate": 0.01, "loss": 43.974334716796875, "num_input_tokens_seen": 532464, "step": 134, "train_runtime": 108.1456, "train_tokens_per_second": 4923.585 }, { "epoch": 10.307692307692308, "num_input_tokens_seen": 532464, "step": 134, "train_accuracy": 0.0078125 }, { "epoch": 10.384615384615385, "grad_norm": 54.074371337890625, "learning_rate": 0.01, "loss": 42.32614517211914, "num_input_tokens_seen": 536560, "step": 135, "train_runtime": 108.9535, "train_tokens_per_second": 4924.669 }, { "epoch": 10.384615384615385, "num_input_tokens_seen": 536560, "step": 135, "train_accuracy": 0.001953125 }, { "epoch": 10.461538461538462, "grad_norm": 44.661739349365234, "learning_rate": 0.01, "loss": 50.82025146484375, "num_input_tokens_seen": 540656, "step": 136, "train_runtime": 109.7591, "train_tokens_per_second": 4925.844 }, { "epoch": 10.461538461538462, "num_input_tokens_seen": 540656, "step": 136, "train_accuracy": 0.005859375 }, { "epoch": 10.538461538461538, "grad_norm": 53.57250213623047, "learning_rate": 0.01, "loss": 42.54605484008789, "num_input_tokens_seen": 544752, "step": 137, "train_runtime": 110.5639, "train_tokens_per_second": 4927.035 }, { "epoch": 10.538461538461538, "num_input_tokens_seen": 544752, "step": 137, "train_accuracy": 0.001953125 }, { "epoch": 10.615384615384615, "grad_norm": 52.8401985168457, "learning_rate": 0.01, "loss": 39.991355895996094, "num_input_tokens_seen": 548848, "step": 138, "train_runtime": 111.3689, "train_tokens_per_second": 4928.198 }, { "epoch": 10.615384615384615, "num_input_tokens_seen": 548848, "step": 138, "train_accuracy": 0.015625 }, { "epoch": 10.692307692307692, "grad_norm": 37.74988555908203, "learning_rate": 0.01, "loss": 40.31428909301758, "num_input_tokens_seen": 552944, "step": 139, "train_runtime": 112.1732, "train_tokens_per_second": 4929.376 }, { "epoch": 10.692307692307692, "num_input_tokens_seen": 552944, "step": 139, "train_accuracy": 0.001953125 }, { "epoch": 10.76923076923077, "grad_norm": 33.514705657958984, "learning_rate": 0.01, "loss": 42.767417907714844, "num_input_tokens_seen": 557040, "step": 140, "train_runtime": 112.978, "train_tokens_per_second": 4930.515 }, { "epoch": 10.76923076923077, "num_input_tokens_seen": 557040, "step": 140, "train_accuracy": 0.005859375 }, { "epoch": 10.846153846153847, "grad_norm": 43.23638916015625, "learning_rate": 0.01, "loss": 34.514678955078125, "num_input_tokens_seen": 561136, "step": 141, "train_runtime": 113.782, "train_tokens_per_second": 4931.678 }, { "epoch": 10.846153846153847, "num_input_tokens_seen": 561136, "step": 141, "train_accuracy": 0.00390625 }, { "epoch": 10.923076923076923, "grad_norm": 23.037885665893555, "learning_rate": 0.01, "loss": 30.216079711914062, "num_input_tokens_seen": 565232, "step": 142, "train_runtime": 114.5826, "train_tokens_per_second": 4932.967 }, { "epoch": 10.923076923076923, "num_input_tokens_seen": 565232, "step": 142, "train_accuracy": 0.026058631017804146 }, { "epoch": 11.0, "grad_norm": 53.58565139770508, "learning_rate": 0.01, "loss": 36.06959533691406, "num_input_tokens_seen": 567688, "step": 143, "train_runtime": 115.0933, "train_tokens_per_second": 4932.417 }, { "epoch": 11.0, "num_input_tokens_seen": 567688, "step": 143, "train_accuracy": 0.01171875 }, { "epoch": 11.076923076923077, "grad_norm": 53.94941711425781, "learning_rate": 0.01, "loss": 35.18943786621094, "num_input_tokens_seen": 571784, "step": 144, "train_runtime": 115.9083, "train_tokens_per_second": 4933.071 }, { "epoch": 11.076923076923077, "num_input_tokens_seen": 571784, "step": 144, "train_accuracy": 0.01171875 }, { "epoch": 11.153846153846153, "grad_norm": 42.16376495361328, "learning_rate": 0.01, "loss": 40.448516845703125, "num_input_tokens_seen": 575880, "step": 145, "train_runtime": 116.7126, "train_tokens_per_second": 4934.173 }, { "epoch": 11.153846153846153, "num_input_tokens_seen": 575880, "step": 145, "train_accuracy": 0.01171875 }, { "epoch": 11.23076923076923, "grad_norm": 50.17839813232422, "learning_rate": 0.01, "loss": 36.233680725097656, "num_input_tokens_seen": 579976, "step": 146, "train_runtime": 117.5175, "train_tokens_per_second": 4935.23 }, { "epoch": 11.23076923076923, "num_input_tokens_seen": 579976, "step": 146, "train_accuracy": 0.0078125 }, { "epoch": 11.307692307692308, "grad_norm": 26.932775497436523, "learning_rate": 0.01, "loss": 40.6314697265625, "num_input_tokens_seen": 584072, "step": 147, "train_runtime": 118.324, "train_tokens_per_second": 4936.21 }, { "epoch": 11.307692307692308, "num_input_tokens_seen": 584072, "step": 147, "train_accuracy": 0.00390625 }, { "epoch": 11.384615384615385, "grad_norm": 40.751590728759766, "learning_rate": 0.01, "loss": 38.37248992919922, "num_input_tokens_seen": 588168, "step": 148, "train_runtime": 119.1292, "train_tokens_per_second": 4937.226 }, { "epoch": 11.384615384615385, "num_input_tokens_seen": 588168, "step": 148, "train_accuracy": 0.005859375 }, { "epoch": 11.461538461538462, "grad_norm": 43.54330062866211, "learning_rate": 0.01, "loss": 36.76280975341797, "num_input_tokens_seen": 592264, "step": 149, "train_runtime": 119.9338, "train_tokens_per_second": 4938.259 }, { "epoch": 11.461538461538462, "num_input_tokens_seen": 592264, "step": 149, "train_accuracy": 0.0078125 }, { "epoch": 11.538461538461538, "grad_norm": 27.936599731445312, "learning_rate": 0.01, "loss": 33.58572769165039, "num_input_tokens_seen": 596360, "step": 150, "train_runtime": 120.7438, "train_tokens_per_second": 4939.053 }, { "epoch": 11.538461538461538, "num_input_tokens_seen": 596360, "step": 150, "train_accuracy": 0.00390625 }, { "epoch": 11.615384615384615, "grad_norm": 31.514619827270508, "learning_rate": 0.01, "loss": 33.77937316894531, "num_input_tokens_seen": 600456, "step": 151, "train_runtime": 121.551, "train_tokens_per_second": 4939.95 }, { "epoch": 11.615384615384615, "num_input_tokens_seen": 600456, "step": 151, "train_accuracy": 0.0078125 }, { "epoch": 11.692307692307692, "grad_norm": 28.991971969604492, "learning_rate": 0.01, "loss": 30.876453399658203, "num_input_tokens_seen": 604552, "step": 152, "train_runtime": 122.3575, "train_tokens_per_second": 4940.865 }, { "epoch": 11.692307692307692, "num_input_tokens_seen": 604552, "step": 152, "train_accuracy": 0.013671875 }, { "epoch": 11.76923076923077, "grad_norm": 17.685880661010742, "learning_rate": 0.01, "loss": 27.308061599731445, "num_input_tokens_seen": 608648, "step": 153, "train_runtime": 123.163, "train_tokens_per_second": 4941.807 }, { "epoch": 11.76923076923077, "num_input_tokens_seen": 608648, "step": 153, "train_accuracy": 0.00390625 }, { "epoch": 11.846153846153847, "grad_norm": 45.63172149658203, "learning_rate": 0.01, "loss": 32.146240234375, "num_input_tokens_seen": 612744, "step": 154, "train_runtime": 123.9664, "train_tokens_per_second": 4942.825 }, { "epoch": 11.846153846153847, "num_input_tokens_seen": 612744, "step": 154, "train_accuracy": 0.01171875 }, { "epoch": 11.923076923076923, "grad_norm": 18.520980834960938, "learning_rate": 0.01, "loss": 28.883460998535156, "num_input_tokens_seen": 616840, "step": 155, "train_runtime": 124.767, "train_tokens_per_second": 4943.935 }, { "epoch": 11.923076923076923, "num_input_tokens_seen": 616840, "step": 155, "train_accuracy": 0.016286645084619522 }, { "epoch": 12.0, "grad_norm": 25.246355056762695, "learning_rate": 0.01, "loss": 27.419111251831055, "num_input_tokens_seen": 619296, "step": 156, "train_runtime": 125.2769, "train_tokens_per_second": 4943.418 }, { "epoch": 12.0, "num_input_tokens_seen": 619296, "step": 156, "train_accuracy": 0.0234375 }, { "epoch": 12.076923076923077, "grad_norm": 31.113773345947266, "learning_rate": 0.01, "loss": 26.06835174560547, "num_input_tokens_seen": 623392, "step": 157, "train_runtime": 126.0934, "train_tokens_per_second": 4943.89 }, { "epoch": 12.076923076923077, "num_input_tokens_seen": 623392, "step": 157, "train_accuracy": 0.00390625 }, { "epoch": 12.153846153846153, "grad_norm": 41.25708770751953, "learning_rate": 0.01, "loss": 28.284313201904297, "num_input_tokens_seen": 627488, "step": 158, "train_runtime": 126.8996, "train_tokens_per_second": 4944.759 }, { "epoch": 12.153846153846153, "num_input_tokens_seen": 627488, "step": 158, "train_accuracy": 0.001953125 }, { "epoch": 12.23076923076923, "grad_norm": 23.370925903320312, "learning_rate": 0.01, "loss": 28.755294799804688, "num_input_tokens_seen": 631584, "step": 159, "train_runtime": 127.7051, "train_tokens_per_second": 4945.644 }, { "epoch": 12.23076923076923, "num_input_tokens_seen": 631584, "step": 159, "train_accuracy": 0.01171875 }, { "epoch": 12.307692307692308, "grad_norm": 21.386932373046875, "learning_rate": 0.01, "loss": 27.405820846557617, "num_input_tokens_seen": 635680, "step": 160, "train_runtime": 128.5108, "train_tokens_per_second": 4946.509 }, { "epoch": 12.307692307692308, "num_input_tokens_seen": 635680, "step": 160, "train_accuracy": 0.013671875 }, { "epoch": 12.384615384615385, "grad_norm": 23.117815017700195, "learning_rate": 0.01, "loss": 26.803756713867188, "num_input_tokens_seen": 639776, "step": 161, "train_runtime": 129.3174, "train_tokens_per_second": 4947.332 }, { "epoch": 12.384615384615385, "num_input_tokens_seen": 639776, "step": 161, "train_accuracy": 0.013671875 }, { "epoch": 12.461538461538462, "grad_norm": 17.937519073486328, "learning_rate": 0.01, "loss": 21.780914306640625, "num_input_tokens_seen": 643872, "step": 162, "train_runtime": 130.1236, "train_tokens_per_second": 4948.155 }, { "epoch": 12.461538461538462, "num_input_tokens_seen": 643872, "step": 162, "train_accuracy": 0.01171875 }, { "epoch": 12.538461538461538, "grad_norm": 19.52775764465332, "learning_rate": 0.01, "loss": 20.647687911987305, "num_input_tokens_seen": 647968, "step": 163, "train_runtime": 130.9334, "train_tokens_per_second": 4948.837 }, { "epoch": 12.538461538461538, "num_input_tokens_seen": 647968, "step": 163, "train_accuracy": 0.009765625 }, { "epoch": 12.615384615384615, "grad_norm": 30.54848861694336, "learning_rate": 0.01, "loss": 21.44734001159668, "num_input_tokens_seen": 652064, "step": 164, "train_runtime": 131.746, "train_tokens_per_second": 4949.403 }, { "epoch": 12.615384615384615, "num_input_tokens_seen": 652064, "step": 164, "train_accuracy": 0.0078125 }, { "epoch": 12.692307692307692, "grad_norm": 28.124404907226562, "learning_rate": 0.01, "loss": 20.266860961914062, "num_input_tokens_seen": 656160, "step": 165, "train_runtime": 132.5566, "train_tokens_per_second": 4950.038 }, { "epoch": 12.692307692307692, "num_input_tokens_seen": 656160, "step": 165, "train_accuracy": 0.009765625 }, { "epoch": 12.76923076923077, "grad_norm": 17.651201248168945, "learning_rate": 0.01, "loss": 18.141666412353516, "num_input_tokens_seen": 660256, "step": 166, "train_runtime": 133.3617, "train_tokens_per_second": 4950.866 }, { "epoch": 12.76923076923077, "num_input_tokens_seen": 660256, "step": 166, "train_accuracy": 0.01953125 }, { "epoch": 12.846153846153847, "grad_norm": 26.800312042236328, "learning_rate": 0.01, "loss": 19.31981658935547, "num_input_tokens_seen": 664352, "step": 167, "train_runtime": 134.1667, "train_tokens_per_second": 4951.691 }, { "epoch": 12.846153846153847, "num_input_tokens_seen": 664352, "step": 167, "train_accuracy": 0.0078125 }, { "epoch": 12.923076923076923, "grad_norm": 14.499151229858398, "learning_rate": 0.01, "loss": 18.218852996826172, "num_input_tokens_seen": 668448, "step": 168, "train_runtime": 134.968, "train_tokens_per_second": 4952.641 }, { "epoch": 12.923076923076923, "num_input_tokens_seen": 668448, "step": 168, "train_accuracy": 0.009771986864507198 }, { "epoch": 13.0, "grad_norm": 12.949419975280762, "learning_rate": 0.01, "loss": 17.60304832458496, "num_input_tokens_seen": 670904, "step": 169, "train_runtime": 135.4781, "train_tokens_per_second": 4952.12 }, { "epoch": 13.0, "num_input_tokens_seen": 670904, "step": 169, "train_accuracy": 0.00390625 }, { "epoch": 13.076923076923077, "grad_norm": 12.970791816711426, "learning_rate": 0.01, "loss": 16.74079704284668, "num_input_tokens_seen": 675000, "step": 170, "train_runtime": 136.2963, "train_tokens_per_second": 4952.447 }, { "epoch": 13.076923076923077, "num_input_tokens_seen": 675000, "step": 170, "train_accuracy": 0.01171875 }, { "epoch": 13.153846153846153, "grad_norm": 12.812407493591309, "learning_rate": 0.01, "loss": 15.077863693237305, "num_input_tokens_seen": 679096, "step": 171, "train_runtime": 137.1012, "train_tokens_per_second": 4953.248 }, { "epoch": 13.153846153846153, "num_input_tokens_seen": 679096, "step": 171, "train_accuracy": 0.01171875 }, { "epoch": 13.23076923076923, "grad_norm": 13.73751163482666, "learning_rate": 0.01, "loss": 14.415550231933594, "num_input_tokens_seen": 683192, "step": 172, "train_runtime": 137.9067, "train_tokens_per_second": 4954.018 }, { "epoch": 13.23076923076923, "num_input_tokens_seen": 683192, "step": 172, "train_accuracy": 0.0078125 }, { "epoch": 13.307692307692308, "grad_norm": 9.886204719543457, "learning_rate": 0.01, "loss": 13.83185863494873, "num_input_tokens_seen": 687288, "step": 173, "train_runtime": 138.712, "train_tokens_per_second": 4954.784 }, { "epoch": 13.307692307692308, "num_input_tokens_seen": 687288, "step": 173, "train_accuracy": 0.005859375 }, { "epoch": 13.384615384615385, "grad_norm": 11.833088874816895, "learning_rate": 0.01, "loss": 13.087343215942383, "num_input_tokens_seen": 691384, "step": 174, "train_runtime": 139.519, "train_tokens_per_second": 4955.481 }, { "epoch": 13.384615384615385, "num_input_tokens_seen": 691384, "step": 174, "train_accuracy": 0.00390625 }, { "epoch": 13.461538461538462, "grad_norm": 13.609389305114746, "learning_rate": 0.01, "loss": 12.435286521911621, "num_input_tokens_seen": 695480, "step": 175, "train_runtime": 140.3246, "train_tokens_per_second": 4956.222 }, { "epoch": 13.461538461538462, "num_input_tokens_seen": 695480, "step": 175, "train_accuracy": 0.01171875 }, { "epoch": 13.538461538461538, "grad_norm": 8.842402458190918, "learning_rate": 0.01, "loss": 11.198854446411133, "num_input_tokens_seen": 699576, "step": 176, "train_runtime": 141.1304, "train_tokens_per_second": 4956.947 }, { "epoch": 13.538461538461538, "num_input_tokens_seen": 699576, "step": 176, "train_accuracy": 0.015625 }, { "epoch": 13.615384615384615, "grad_norm": 9.526718139648438, "learning_rate": 0.01, "loss": 10.711845397949219, "num_input_tokens_seen": 703672, "step": 177, "train_runtime": 141.9408, "train_tokens_per_second": 4957.502 }, { "epoch": 13.615384615384615, "num_input_tokens_seen": 703672, "step": 177, "train_accuracy": 0.01171875 }, { "epoch": 13.692307692307692, "grad_norm": 9.6870756149292, "learning_rate": 0.01, "loss": 11.304187774658203, "num_input_tokens_seen": 707768, "step": 178, "train_runtime": 142.7496, "train_tokens_per_second": 4958.109 }, { "epoch": 13.692307692307692, "num_input_tokens_seen": 707768, "step": 178, "train_accuracy": 0.017578125 }, { "epoch": 13.76923076923077, "grad_norm": 8.219425201416016, "learning_rate": 0.01, "loss": 9.206737518310547, "num_input_tokens_seen": 711864, "step": 179, "train_runtime": 143.5558, "train_tokens_per_second": 4958.798 }, { "epoch": 13.76923076923077, "num_input_tokens_seen": 711864, "step": 179, "train_accuracy": 0.009765625 }, { "epoch": 13.846153846153847, "grad_norm": 6.607143402099609, "learning_rate": 0.01, "loss": 9.438591003417969, "num_input_tokens_seen": 715960, "step": 180, "train_runtime": 144.3617, "train_tokens_per_second": 4959.487 }, { "epoch": 13.846153846153847, "num_input_tokens_seen": 715960, "step": 180, "train_accuracy": 0.01953125 }, { "epoch": 13.923076923076923, "grad_norm": 7.296689033508301, "learning_rate": 0.01, "loss": 8.733935356140137, "num_input_tokens_seen": 720056, "step": 181, "train_runtime": 145.1628, "train_tokens_per_second": 4960.335 }, { "epoch": 13.923076923076923, "num_input_tokens_seen": 720056, "step": 181, "train_accuracy": 0.0065146577544510365 }, { "epoch": 14.0, "grad_norm": 8.992117881774902, "learning_rate": 0.01, "loss": 8.867663383483887, "num_input_tokens_seen": 722512, "step": 182, "train_runtime": 145.6733, "train_tokens_per_second": 4959.809 }, { "epoch": 14.0, "num_input_tokens_seen": 722512, "step": 182, "train_accuracy": 0.005859375 }, { "epoch": 14.076923076923077, "grad_norm": 6.970577239990234, "learning_rate": 0.01, "loss": 8.428256034851074, "num_input_tokens_seen": 726608, "step": 183, "train_runtime": 146.4902, "train_tokens_per_second": 4960.112 }, { "epoch": 14.076923076923077, "num_input_tokens_seen": 726608, "step": 183, "train_accuracy": 0.009765625 }, { "epoch": 14.153846153846153, "grad_norm": 6.69838809967041, "learning_rate": 0.01, "loss": 7.663095474243164, "num_input_tokens_seen": 730704, "step": 184, "train_runtime": 147.2963, "train_tokens_per_second": 4960.778 }, { "epoch": 14.153846153846153, "num_input_tokens_seen": 730704, "step": 184, "train_accuracy": 0.017578125 }, { "epoch": 14.23076923076923, "grad_norm": 7.49269962310791, "learning_rate": 0.01, "loss": 7.656740188598633, "num_input_tokens_seen": 734800, "step": 185, "train_runtime": 148.1016, "train_tokens_per_second": 4961.46 }, { "epoch": 14.23076923076923, "num_input_tokens_seen": 734800, "step": 185, "train_accuracy": 0.001953125 }, { "epoch": 14.307692307692308, "grad_norm": 4.829015731811523, "learning_rate": 0.01, "loss": 7.406508445739746, "num_input_tokens_seen": 738896, "step": 186, "train_runtime": 148.9071, "train_tokens_per_second": 4962.126 }, { "epoch": 14.307692307692308, "num_input_tokens_seen": 738896, "step": 186, "train_accuracy": 0.0078125 }, { "epoch": 14.384615384615385, "grad_norm": 5.506415367126465, "learning_rate": 0.01, "loss": 7.3244428634643555, "num_input_tokens_seen": 742992, "step": 187, "train_runtime": 149.7122, "train_tokens_per_second": 4962.802 }, { "epoch": 14.384615384615385, "num_input_tokens_seen": 742992, "step": 187, "train_accuracy": 0.0078125 }, { "epoch": 14.461538461538462, "grad_norm": 5.795366287231445, "learning_rate": 0.01, "loss": 7.266047954559326, "num_input_tokens_seen": 747088, "step": 188, "train_runtime": 150.5184, "train_tokens_per_second": 4963.432 }, { "epoch": 14.461538461538462, "num_input_tokens_seen": 747088, "step": 188, "train_accuracy": 0.01171875 }, { "epoch": 14.538461538461538, "grad_norm": 5.064494609832764, "learning_rate": 0.01, "loss": 6.987112998962402, "num_input_tokens_seen": 751184, "step": 189, "train_runtime": 151.3245, "train_tokens_per_second": 4964.062 }, { "epoch": 14.538461538461538, "num_input_tokens_seen": 751184, "step": 189, "train_accuracy": 0.017578125 }, { "epoch": 14.615384615384615, "grad_norm": 4.764325141906738, "learning_rate": 0.01, "loss": 7.1143083572387695, "num_input_tokens_seen": 755280, "step": 190, "train_runtime": 152.1302, "train_tokens_per_second": 4964.696 }, { "epoch": 14.615384615384615, "num_input_tokens_seen": 755280, "step": 190, "train_accuracy": 0.005859375 }, { "epoch": 14.692307692307692, "grad_norm": 5.380343437194824, "learning_rate": 0.01, "loss": 6.598371982574463, "num_input_tokens_seen": 759376, "step": 191, "train_runtime": 152.9372, "train_tokens_per_second": 4965.278 }, { "epoch": 14.692307692307692, "num_input_tokens_seen": 759376, "step": 191, "train_accuracy": 0.013671875 }, { "epoch": 14.76923076923077, "grad_norm": 4.394591808319092, "learning_rate": 0.01, "loss": 6.156771659851074, "num_input_tokens_seen": 763472, "step": 192, "train_runtime": 153.7488, "train_tokens_per_second": 4965.711 }, { "epoch": 14.76923076923077, "num_input_tokens_seen": 763472, "step": 192, "train_accuracy": 0.01171875 }, { "epoch": 14.846153846153847, "grad_norm": 4.73301887512207, "learning_rate": 0.01, "loss": 6.109883785247803, "num_input_tokens_seen": 767568, "step": 193, "train_runtime": 154.5554, "train_tokens_per_second": 4966.296 }, { "epoch": 14.846153846153847, "num_input_tokens_seen": 767568, "step": 193, "train_accuracy": 0.009765625 }, { "epoch": 14.923076923076923, "grad_norm": 5.311499118804932, "learning_rate": 0.01, "loss": 5.823588848114014, "num_input_tokens_seen": 771664, "step": 194, "train_runtime": 155.3568, "train_tokens_per_second": 4967.045 }, { "epoch": 14.923076923076923, "num_input_tokens_seen": 771664, "step": 194, "train_accuracy": 0.013029315508902073 }, { "epoch": 15.0, "grad_norm": 5.872067451477051, "learning_rate": 0.01, "loss": 6.032412052154541, "num_input_tokens_seen": 774120, "step": 195, "train_runtime": 155.8668, "train_tokens_per_second": 4966.549 }, { "epoch": 15.0, "num_input_tokens_seen": 774120, "step": 195, "train_accuracy": 0.01171875 }, { "epoch": 15.076923076923077, "grad_norm": 4.518616676330566, "learning_rate": 0.01, "loss": 5.693182468414307, "num_input_tokens_seen": 778216, "step": 196, "train_runtime": 156.6827, "train_tokens_per_second": 4966.828 }, { "epoch": 15.076923076923077, "num_input_tokens_seen": 778216, "step": 196, "train_accuracy": 0.001953125 }, { "epoch": 15.153846153846153, "grad_norm": 3.8842692375183105, "learning_rate": 0.01, "loss": 5.344891548156738, "num_input_tokens_seen": 782312, "step": 197, "train_runtime": 157.4886, "train_tokens_per_second": 4967.419 }, { "epoch": 15.153846153846153, "num_input_tokens_seen": 782312, "step": 197, "train_accuracy": 0.01171875 }, { "epoch": 15.23076923076923, "grad_norm": 3.7938222885131836, "learning_rate": 0.01, "loss": 5.419033527374268, "num_input_tokens_seen": 786408, "step": 198, "train_runtime": 158.2942, "train_tokens_per_second": 4968.014 }, { "epoch": 15.23076923076923, "num_input_tokens_seen": 786408, "step": 198, "train_accuracy": 0.01171875 }, { "epoch": 15.307692307692308, "grad_norm": 3.7228262424468994, "learning_rate": 0.01, "loss": 5.356511116027832, "num_input_tokens_seen": 790504, "step": 199, "train_runtime": 159.1005, "train_tokens_per_second": 4968.581 }, { "epoch": 15.307692307692308, "num_input_tokens_seen": 790504, "step": 199, "train_accuracy": 0.01171875 }, { "epoch": 15.384615384615385, "grad_norm": 3.548959970474243, "learning_rate": 0.01, "loss": 5.381818771362305, "num_input_tokens_seen": 794600, "step": 200, "train_runtime": 159.907, "train_tokens_per_second": 4969.139 }, { "epoch": 15.384615384615385, "eval_CMD_3_branch_eval_accuracy": 0.007594936708860759, "eval_CMD_3_branch_eval_loss": 5.368804931640625, "eval_CMD_3_branch_eval_runtime": 1.1297, "eval_CMD_3_branch_eval_samples_per_second": 2447.572, "eval_CMD_3_branch_eval_steps_per_second": 5.311, "num_input_tokens_seen": 794600, "step": 200 }, { "epoch": 15.384615384615385, "num_input_tokens_seen": 794600, "step": 200, "train_accuracy": 0.005859375 }, { "epoch": 15.461538461538462, "grad_norm": 3.4090161323547363, "learning_rate": 0.01, "loss": 5.308737754821777, "num_input_tokens_seen": 798696, "step": 201, "train_runtime": 161.8478, "train_tokens_per_second": 4934.86 }, { "epoch": 15.461538461538462, "num_input_tokens_seen": 798696, "step": 201, "train_accuracy": 0.009765625 }, { "epoch": 15.538461538461538, "grad_norm": 3.5405497550964355, "learning_rate": 0.01, "loss": 5.098702430725098, "num_input_tokens_seen": 802792, "step": 202, "train_runtime": 162.655, "train_tokens_per_second": 4935.55 }, { "epoch": 15.538461538461538, "num_input_tokens_seen": 802792, "step": 202, "train_accuracy": 0.00390625 }, { "epoch": 15.615384615384615, "grad_norm": 3.1300690174102783, "learning_rate": 0.01, "loss": 5.000946521759033, "num_input_tokens_seen": 806888, "step": 203, "train_runtime": 163.4623, "train_tokens_per_second": 4936.232 }, { "epoch": 15.615384615384615, "num_input_tokens_seen": 806888, "step": 203, "train_accuracy": 0.01171875 }, { "epoch": 15.692307692307692, "grad_norm": 3.1456973552703857, "learning_rate": 0.01, "loss": 5.021718502044678, "num_input_tokens_seen": 810984, "step": 204, "train_runtime": 164.2691, "train_tokens_per_second": 4936.922 }, { "epoch": 15.692307692307692, "num_input_tokens_seen": 810984, "step": 204, "train_accuracy": 0.005859375 }, { "epoch": 15.76923076923077, "grad_norm": 2.667361259460449, "learning_rate": 0.01, "loss": 4.919438362121582, "num_input_tokens_seen": 815080, "step": 205, "train_runtime": 165.077, "train_tokens_per_second": 4937.574 }, { "epoch": 15.76923076923077, "num_input_tokens_seen": 815080, "step": 205, "train_accuracy": 0.009765625 }, { "epoch": 15.846153846153847, "grad_norm": 2.7647666931152344, "learning_rate": 0.01, "loss": 4.9262847900390625, "num_input_tokens_seen": 819176, "step": 206, "train_runtime": 165.8829, "train_tokens_per_second": 4938.279 }, { "epoch": 15.846153846153847, "num_input_tokens_seen": 819176, "step": 206, "train_accuracy": 0.009765625 }, { "epoch": 15.923076923076923, "grad_norm": 3.502366065979004, "learning_rate": 0.01, "loss": 4.926443099975586, "num_input_tokens_seen": 823272, "step": 207, "train_runtime": 166.685, "train_tokens_per_second": 4939.09 }, { "epoch": 15.923076923076923, "num_input_tokens_seen": 823272, "step": 207, "train_accuracy": 0.0065146577544510365 }, { "epoch": 16.0, "grad_norm": 3.5238306522369385, "learning_rate": 0.01, "loss": 4.891132354736328, "num_input_tokens_seen": 825728, "step": 208, "train_runtime": 167.1958, "train_tokens_per_second": 4938.689 }, { "epoch": 16.0, "num_input_tokens_seen": 825728, "step": 208, "train_accuracy": 0.00390625 }, { "epoch": 16.076923076923077, "grad_norm": 3.013728141784668, "learning_rate": 0.01, "loss": 4.880594730377197, "num_input_tokens_seen": 829824, "step": 209, "train_runtime": 168.0142, "train_tokens_per_second": 4939.01 }, { "epoch": 16.076923076923077, "num_input_tokens_seen": 829824, "step": 209, "train_accuracy": 0.01953125 }, { "epoch": 16.153846153846153, "grad_norm": 2.7540860176086426, "learning_rate": 0.01, "loss": 4.831616401672363, "num_input_tokens_seen": 833920, "step": 210, "train_runtime": 168.82, "train_tokens_per_second": 4939.699 }, { "epoch": 16.153846153846153, "num_input_tokens_seen": 833920, "step": 210, "train_accuracy": 0.01171875 }, { "epoch": 16.23076923076923, "grad_norm": 2.9010918140411377, "learning_rate": 0.01, "loss": 4.833306312561035, "num_input_tokens_seen": 838016, "step": 211, "train_runtime": 169.6263, "train_tokens_per_second": 4940.366 }, { "epoch": 16.23076923076923, "num_input_tokens_seen": 838016, "step": 211, "train_accuracy": 0.009765625 }, { "epoch": 16.307692307692307, "grad_norm": 2.8716068267822266, "learning_rate": 0.01, "loss": 4.825284481048584, "num_input_tokens_seen": 842112, "step": 212, "train_runtime": 170.4342, "train_tokens_per_second": 4940.979 }, { "epoch": 16.307692307692307, "num_input_tokens_seen": 842112, "step": 212, "train_accuracy": 0.015625 }, { "epoch": 16.384615384615383, "grad_norm": 2.4198055267333984, "learning_rate": 0.01, "loss": 4.814431667327881, "num_input_tokens_seen": 846208, "step": 213, "train_runtime": 171.2416, "train_tokens_per_second": 4941.603 }, { "epoch": 16.384615384615383, "num_input_tokens_seen": 846208, "step": 213, "train_accuracy": 0.0078125 }, { "epoch": 16.46153846153846, "grad_norm": 2.166982412338257, "learning_rate": 0.01, "loss": 4.759323596954346, "num_input_tokens_seen": 850304, "step": 214, "train_runtime": 172.0481, "train_tokens_per_second": 4942.245 }, { "epoch": 16.46153846153846, "num_input_tokens_seen": 850304, "step": 214, "train_accuracy": 0.01171875 }, { "epoch": 16.53846153846154, "grad_norm": 2.081040620803833, "learning_rate": 0.01, "loss": 4.729094505310059, "num_input_tokens_seen": 854400, "step": 215, "train_runtime": 172.8552, "train_tokens_per_second": 4942.866 }, { "epoch": 16.53846153846154, "num_input_tokens_seen": 854400, "step": 215, "train_accuracy": 0.009765625 }, { "epoch": 16.615384615384617, "grad_norm": 2.177140951156616, "learning_rate": 0.01, "loss": 4.726467132568359, "num_input_tokens_seen": 858496, "step": 216, "train_runtime": 173.6631, "train_tokens_per_second": 4943.457 }, { "epoch": 16.615384615384617, "num_input_tokens_seen": 858496, "step": 216, "train_accuracy": 0.005859375 }, { "epoch": 16.692307692307693, "grad_norm": 2.091027021408081, "learning_rate": 0.01, "loss": 4.732223987579346, "num_input_tokens_seen": 862592, "step": 217, "train_runtime": 174.4692, "train_tokens_per_second": 4944.094 }, { "epoch": 16.692307692307693, "num_input_tokens_seen": 862592, "step": 217, "train_accuracy": 0.009765625 }, { "epoch": 16.76923076923077, "grad_norm": 1.9717937707901, "learning_rate": 0.01, "loss": 4.70272159576416, "num_input_tokens_seen": 866688, "step": 218, "train_runtime": 175.2753, "train_tokens_per_second": 4944.723 }, { "epoch": 16.76923076923077, "num_input_tokens_seen": 866688, "step": 218, "train_accuracy": 0.01953125 }, { "epoch": 16.846153846153847, "grad_norm": 2.0200533866882324, "learning_rate": 0.01, "loss": 4.724699974060059, "num_input_tokens_seen": 870784, "step": 219, "train_runtime": 176.0818, "train_tokens_per_second": 4945.339 }, { "epoch": 16.846153846153847, "num_input_tokens_seen": 870784, "step": 219, "train_accuracy": 0.015625 }, { "epoch": 16.923076923076923, "grad_norm": 2.4475533962249756, "learning_rate": 0.01, "loss": 4.796332359313965, "num_input_tokens_seen": 874880, "step": 220, "train_runtime": 176.8838, "train_tokens_per_second": 4946.071 }, { "epoch": 16.923076923076923, "num_input_tokens_seen": 874880, "step": 220, "train_accuracy": 0.0065146577544510365 }, { "epoch": 17.0, "grad_norm": 2.6400070190429688, "learning_rate": 0.01, "loss": 4.780521869659424, "num_input_tokens_seen": 877336, "step": 221, "train_runtime": 177.3948, "train_tokens_per_second": 4945.668 }, { "epoch": 17.0, "num_input_tokens_seen": 877336, "step": 221, "train_accuracy": 0.00390625 }, { "epoch": 17.076923076923077, "grad_norm": 2.774951457977295, "learning_rate": 0.01, "loss": 4.7688775062561035, "num_input_tokens_seen": 881432, "step": 222, "train_runtime": 178.2127, "train_tokens_per_second": 4945.956 }, { "epoch": 17.076923076923077, "num_input_tokens_seen": 881432, "step": 222, "train_accuracy": 0.015625 }, { "epoch": 17.153846153846153, "grad_norm": 2.80867338180542, "learning_rate": 0.01, "loss": 4.773642539978027, "num_input_tokens_seen": 885528, "step": 223, "train_runtime": 179.0195, "train_tokens_per_second": 4946.546 }, { "epoch": 17.153846153846153, "num_input_tokens_seen": 885528, "step": 223, "train_accuracy": 0.013671875 }, { "epoch": 17.23076923076923, "grad_norm": 1.7940993309020996, "learning_rate": 0.01, "loss": 4.654668807983398, "num_input_tokens_seen": 889624, "step": 224, "train_runtime": 179.8267, "train_tokens_per_second": 4947.119 }, { "epoch": 17.23076923076923, "num_input_tokens_seen": 889624, "step": 224, "train_accuracy": 0.005859375 }, { "epoch": 17.307692307692307, "grad_norm": 2.628485679626465, "learning_rate": 0.01, "loss": 4.76577091217041, "num_input_tokens_seen": 893720, "step": 225, "train_runtime": 180.6336, "train_tokens_per_second": 4947.696 }, { "epoch": 17.307692307692307, "num_input_tokens_seen": 893720, "step": 225, "train_accuracy": 0.005859375 }, { "epoch": 17.384615384615383, "grad_norm": 1.9633597135543823, "learning_rate": 0.01, "loss": 4.685235977172852, "num_input_tokens_seen": 897816, "step": 226, "train_runtime": 181.441, "train_tokens_per_second": 4948.252 }, { "epoch": 17.384615384615383, "num_input_tokens_seen": 897816, "step": 226, "train_accuracy": 0.001953125 }, { "epoch": 17.46153846153846, "grad_norm": 3.5501697063446045, "learning_rate": 0.01, "loss": 4.778290271759033, "num_input_tokens_seen": 901912, "step": 227, "train_runtime": 182.2475, "train_tokens_per_second": 4948.831 }, { "epoch": 17.46153846153846, "num_input_tokens_seen": 901912, "step": 227, "train_accuracy": 0.013671875 }, { "epoch": 17.53846153846154, "grad_norm": 1.8580361604690552, "learning_rate": 0.01, "loss": 4.6676788330078125, "num_input_tokens_seen": 906008, "step": 228, "train_runtime": 183.0547, "train_tokens_per_second": 4949.383 }, { "epoch": 17.53846153846154, "num_input_tokens_seen": 906008, "step": 228, "train_accuracy": 0.009765625 }, { "epoch": 17.615384615384617, "grad_norm": 2.9398105144500732, "learning_rate": 0.01, "loss": 4.755415916442871, "num_input_tokens_seen": 910104, "step": 229, "train_runtime": 183.8622, "train_tokens_per_second": 4949.924 }, { "epoch": 17.615384615384617, "num_input_tokens_seen": 910104, "step": 229, "train_accuracy": 0.0078125 }, { "epoch": 17.692307692307693, "grad_norm": 2.014890193939209, "learning_rate": 0.01, "loss": 4.652470111846924, "num_input_tokens_seen": 914200, "step": 230, "train_runtime": 184.6689, "train_tokens_per_second": 4950.482 }, { "epoch": 17.692307692307693, "num_input_tokens_seen": 914200, "step": 230, "train_accuracy": 0.0078125 }, { "epoch": 17.76923076923077, "grad_norm": 3.346104621887207, "learning_rate": 0.01, "loss": 4.73101282119751, "num_input_tokens_seen": 918296, "step": 231, "train_runtime": 185.4748, "train_tokens_per_second": 4951.055 }, { "epoch": 17.76923076923077, "num_input_tokens_seen": 918296, "step": 231, "train_accuracy": 0.00390625 }, { "epoch": 17.846153846153847, "grad_norm": 2.626401901245117, "learning_rate": 0.01, "loss": 4.7478346824646, "num_input_tokens_seen": 922392, "step": 232, "train_runtime": 186.2809, "train_tokens_per_second": 4951.618 }, { "epoch": 17.846153846153847, "num_input_tokens_seen": 922392, "step": 232, "train_accuracy": 0.0078125 }, { "epoch": 17.923076923076923, "grad_norm": 2.8272528648376465, "learning_rate": 0.01, "loss": 4.785407066345215, "num_input_tokens_seen": 926488, "step": 233, "train_runtime": 187.0832, "train_tokens_per_second": 4952.278 }, { "epoch": 17.923076923076923, "num_input_tokens_seen": 926488, "step": 233, "train_accuracy": 0.013029315508902073 }, { "epoch": 18.0, "grad_norm": 2.6225979328155518, "learning_rate": 0.01, "loss": 4.660401821136475, "num_input_tokens_seen": 928944, "step": 234, "train_runtime": 187.5948, "train_tokens_per_second": 4951.865 }, { "epoch": 18.0, "num_input_tokens_seen": 928944, "step": 234, "train_accuracy": 0.005859375 }, { "epoch": 18.076923076923077, "grad_norm": 4.465658187866211, "learning_rate": 0.01, "loss": 4.832589626312256, "num_input_tokens_seen": 933040, "step": 235, "train_runtime": 188.4125, "train_tokens_per_second": 4952.114 }, { "epoch": 18.076923076923077, "num_input_tokens_seen": 933040, "step": 235, "train_accuracy": 0.013671875 }, { "epoch": 18.153846153846153, "grad_norm": 2.2223477363586426, "learning_rate": 0.01, "loss": 4.696511268615723, "num_input_tokens_seen": 937136, "step": 236, "train_runtime": 189.2191, "train_tokens_per_second": 4952.651 }, { "epoch": 18.153846153846153, "num_input_tokens_seen": 937136, "step": 236, "train_accuracy": 0.01171875 }, { "epoch": 18.23076923076923, "grad_norm": 3.487868070602417, "learning_rate": 0.01, "loss": 4.8751912117004395, "num_input_tokens_seen": 941232, "step": 237, "train_runtime": 190.0255, "train_tokens_per_second": 4953.188 }, { "epoch": 18.23076923076923, "num_input_tokens_seen": 941232, "step": 237, "train_accuracy": 0.013671875 }, { "epoch": 18.307692307692307, "grad_norm": 2.3653151988983154, "learning_rate": 0.01, "loss": 4.719097137451172, "num_input_tokens_seen": 945328, "step": 238, "train_runtime": 190.833, "train_tokens_per_second": 4953.693 }, { "epoch": 18.307692307692307, "num_input_tokens_seen": 945328, "step": 238, "train_accuracy": 0.005859375 }, { "epoch": 18.384615384615383, "grad_norm": 2.1690564155578613, "learning_rate": 0.01, "loss": 4.701546669006348, "num_input_tokens_seen": 949424, "step": 239, "train_runtime": 191.6405, "train_tokens_per_second": 4954.192 }, { "epoch": 18.384615384615383, "num_input_tokens_seen": 949424, "step": 239, "train_accuracy": 0.005859375 }, { "epoch": 18.46153846153846, "grad_norm": 2.517916679382324, "learning_rate": 0.01, "loss": 4.731206893920898, "num_input_tokens_seen": 953520, "step": 240, "train_runtime": 192.447, "train_tokens_per_second": 4954.714 }, { "epoch": 18.46153846153846, "num_input_tokens_seen": 953520, "step": 240, "train_accuracy": 0.0078125 }, { "epoch": 18.53846153846154, "grad_norm": 2.1356940269470215, "learning_rate": 0.01, "loss": 4.752324104309082, "num_input_tokens_seen": 957616, "step": 241, "train_runtime": 193.2532, "train_tokens_per_second": 4955.241 }, { "epoch": 18.53846153846154, "num_input_tokens_seen": 957616, "step": 241, "train_accuracy": 0.01171875 }, { "epoch": 18.615384615384617, "grad_norm": 2.4131526947021484, "learning_rate": 0.01, "loss": 4.7234649658203125, "num_input_tokens_seen": 961712, "step": 242, "train_runtime": 194.0606, "train_tokens_per_second": 4955.729 }, { "epoch": 18.615384615384617, "num_input_tokens_seen": 961712, "step": 242, "train_accuracy": 0.0078125 }, { "epoch": 18.692307692307693, "grad_norm": 1.9735586643218994, "learning_rate": 0.01, "loss": 4.670131683349609, "num_input_tokens_seen": 965808, "step": 243, "train_runtime": 194.867, "train_tokens_per_second": 4956.243 }, { "epoch": 18.692307692307693, "num_input_tokens_seen": 965808, "step": 243, "train_accuracy": 0.009765625 }, { "epoch": 18.76923076923077, "grad_norm": 2.581371545791626, "learning_rate": 0.01, "loss": 4.725827217102051, "num_input_tokens_seen": 969904, "step": 244, "train_runtime": 195.6727, "train_tokens_per_second": 4956.766 }, { "epoch": 18.76923076923077, "num_input_tokens_seen": 969904, "step": 244, "train_accuracy": 0.009765625 }, { "epoch": 18.846153846153847, "grad_norm": 1.9495716094970703, "learning_rate": 0.01, "loss": 4.678308963775635, "num_input_tokens_seen": 974000, "step": 245, "train_runtime": 196.4791, "train_tokens_per_second": 4957.271 }, { "epoch": 18.846153846153847, "num_input_tokens_seen": 974000, "step": 245, "train_accuracy": 0.01171875 }, { "epoch": 18.923076923076923, "grad_norm": 2.1714582443237305, "learning_rate": 0.01, "loss": 4.677157402038574, "num_input_tokens_seen": 978096, "step": 246, "train_runtime": 197.2814, "train_tokens_per_second": 4957.874 }, { "epoch": 18.923076923076923, "num_input_tokens_seen": 978096, "step": 246, "train_accuracy": 0.016286645084619522 }, { "epoch": 19.0, "grad_norm": 2.327296495437622, "learning_rate": 0.01, "loss": 4.7444257736206055, "num_input_tokens_seen": 980552, "step": 247, "train_runtime": 197.7923, "train_tokens_per_second": 4957.483 }, { "epoch": 19.0, "num_input_tokens_seen": 980552, "step": 247, "train_accuracy": 0.01171875 }, { "epoch": 19.076923076923077, "grad_norm": 2.7381880283355713, "learning_rate": 0.01, "loss": 4.704586982727051, "num_input_tokens_seen": 984648, "step": 248, "train_runtime": 198.6105, "train_tokens_per_second": 4957.683 }, { "epoch": 19.076923076923077, "num_input_tokens_seen": 984648, "step": 248, "train_accuracy": 0.013671875 }, { "epoch": 19.153846153846153, "grad_norm": 1.770967721939087, "learning_rate": 0.01, "loss": 4.686239242553711, "num_input_tokens_seen": 988744, "step": 249, "train_runtime": 199.4176, "train_tokens_per_second": 4958.159 }, { "epoch": 19.153846153846153, "num_input_tokens_seen": 988744, "step": 249, "train_accuracy": 0.0078125 }, { "epoch": 19.23076923076923, "grad_norm": 2.8549108505249023, "learning_rate": 0.01, "loss": 4.693802356719971, "num_input_tokens_seen": 992840, "step": 250, "train_runtime": 200.2235, "train_tokens_per_second": 4958.658 }, { "epoch": 19.23076923076923, "num_input_tokens_seen": 992840, "step": 250, "train_accuracy": 0.01171875 }, { "epoch": 19.307692307692307, "grad_norm": 1.802127718925476, "learning_rate": 0.01, "loss": 4.626243591308594, "num_input_tokens_seen": 996936, "step": 251, "train_runtime": 201.0295, "train_tokens_per_second": 4959.152 }, { "epoch": 19.307692307692307, "num_input_tokens_seen": 996936, "step": 251, "train_accuracy": 0.021484375 }, { "epoch": 19.384615384615383, "grad_norm": 2.309999465942383, "learning_rate": 0.01, "loss": 4.71285343170166, "num_input_tokens_seen": 1001032, "step": 252, "train_runtime": 201.8378, "train_tokens_per_second": 4959.586 }, { "epoch": 19.384615384615383, "num_input_tokens_seen": 1001032, "step": 252, "train_accuracy": 0.0078125 }, { "epoch": 19.46153846153846, "grad_norm": 2.1743581295013428, "learning_rate": 0.01, "loss": 4.666388034820557, "num_input_tokens_seen": 1005128, "step": 253, "train_runtime": 202.6461, "train_tokens_per_second": 4960.018 }, { "epoch": 19.46153846153846, "num_input_tokens_seen": 1005128, "step": 253, "train_accuracy": 0.015625 }, { "epoch": 19.53846153846154, "grad_norm": 2.185983657836914, "learning_rate": 0.01, "loss": 4.637975692749023, "num_input_tokens_seen": 1009224, "step": 254, "train_runtime": 203.4532, "train_tokens_per_second": 4960.472 }, { "epoch": 19.53846153846154, "num_input_tokens_seen": 1009224, "step": 254, "train_accuracy": 0.0078125 }, { "epoch": 19.615384615384617, "grad_norm": 2.5004985332489014, "learning_rate": 0.01, "loss": 4.726057529449463, "num_input_tokens_seen": 1013320, "step": 255, "train_runtime": 204.2609, "train_tokens_per_second": 4960.91 }, { "epoch": 19.615384615384617, "num_input_tokens_seen": 1013320, "step": 255, "train_accuracy": 0.01171875 }, { "epoch": 19.692307692307693, "grad_norm": 1.7645424604415894, "learning_rate": 0.01, "loss": 4.638632774353027, "num_input_tokens_seen": 1017416, "step": 256, "train_runtime": 205.0687, "train_tokens_per_second": 4961.342 }, { "epoch": 19.692307692307693, "num_input_tokens_seen": 1017416, "step": 256, "train_accuracy": 0.009765625 }, { "epoch": 19.76923076923077, "grad_norm": 2.305911064147949, "learning_rate": 0.01, "loss": 4.699167251586914, "num_input_tokens_seen": 1021512, "step": 257, "train_runtime": 205.8757, "train_tokens_per_second": 4961.79 }, { "epoch": 19.76923076923077, "num_input_tokens_seen": 1021512, "step": 257, "train_accuracy": 0.00390625 }, { "epoch": 19.846153846153847, "grad_norm": 2.590080499649048, "learning_rate": 0.01, "loss": 4.735995292663574, "num_input_tokens_seen": 1025608, "step": 258, "train_runtime": 206.6829, "train_tokens_per_second": 4962.231 }, { "epoch": 19.846153846153847, "num_input_tokens_seen": 1025608, "step": 258, "train_accuracy": 0.00390625 }, { "epoch": 19.923076923076923, "grad_norm": 2.1151185035705566, "learning_rate": 0.01, "loss": 4.6779093742370605, "num_input_tokens_seen": 1029704, "step": 259, "train_runtime": 207.4854, "train_tokens_per_second": 4962.778 }, { "epoch": 19.923076923076923, "num_input_tokens_seen": 1029704, "step": 259, "train_accuracy": 0.0065146577544510365 }, { "epoch": 20.0, "grad_norm": 2.6231706142425537, "learning_rate": 0.01, "loss": 4.725683689117432, "num_input_tokens_seen": 1032160, "step": 260, "train_runtime": 207.9971, "train_tokens_per_second": 4962.377 }, { "epoch": 20.0, "num_input_tokens_seen": 1032160, "step": 260, "train_accuracy": 0.01171875 }, { "epoch": 20.076923076923077, "grad_norm": 1.8787047863006592, "learning_rate": 0.01, "loss": 4.62359619140625, "num_input_tokens_seen": 1036256, "step": 261, "train_runtime": 208.8157, "train_tokens_per_second": 4962.538 }, { "epoch": 20.076923076923077, "num_input_tokens_seen": 1036256, "step": 261, "train_accuracy": 0.005859375 }, { "epoch": 20.153846153846153, "grad_norm": 2.500467538833618, "learning_rate": 0.01, "loss": 4.736563682556152, "num_input_tokens_seen": 1040352, "step": 262, "train_runtime": 209.6247, "train_tokens_per_second": 4962.926 }, { "epoch": 20.153846153846153, "num_input_tokens_seen": 1040352, "step": 262, "train_accuracy": 0.01171875 }, { "epoch": 20.23076923076923, "grad_norm": 1.9345626831054688, "learning_rate": 0.01, "loss": 4.717474460601807, "num_input_tokens_seen": 1044448, "step": 263, "train_runtime": 210.4328, "train_tokens_per_second": 4963.332 }, { "epoch": 20.23076923076923, "num_input_tokens_seen": 1044448, "step": 263, "train_accuracy": 0.01171875 }, { "epoch": 20.307692307692307, "grad_norm": 2.108369827270508, "learning_rate": 0.01, "loss": 4.710242748260498, "num_input_tokens_seen": 1048544, "step": 264, "train_runtime": 211.2443, "train_tokens_per_second": 4963.655 }, { "epoch": 20.307692307692307, "num_input_tokens_seen": 1048544, "step": 264, "train_accuracy": 0.015625 }, { "epoch": 20.384615384615383, "grad_norm": 1.7605409622192383, "learning_rate": 0.01, "loss": 4.638559341430664, "num_input_tokens_seen": 1052640, "step": 265, "train_runtime": 212.0506, "train_tokens_per_second": 4964.099 }, { "epoch": 20.384615384615383, "num_input_tokens_seen": 1052640, "step": 265, "train_accuracy": 0.01171875 }, { "epoch": 20.46153846153846, "grad_norm": 2.7836520671844482, "learning_rate": 0.01, "loss": 4.789233207702637, "num_input_tokens_seen": 1056736, "step": 266, "train_runtime": 212.8608, "train_tokens_per_second": 4964.446 }, { "epoch": 20.46153846153846, "num_input_tokens_seen": 1056736, "step": 266, "train_accuracy": 0.01953125 }, { "epoch": 20.53846153846154, "grad_norm": 1.9727662801742554, "learning_rate": 0.01, "loss": 4.658707618713379, "num_input_tokens_seen": 1060832, "step": 267, "train_runtime": 213.6681, "train_tokens_per_second": 4964.859 }, { "epoch": 20.53846153846154, "num_input_tokens_seen": 1060832, "step": 267, "train_accuracy": 0.0078125 }, { "epoch": 20.615384615384617, "grad_norm": 2.9147422313690186, "learning_rate": 0.01, "loss": 4.785709381103516, "num_input_tokens_seen": 1064928, "step": 268, "train_runtime": 214.4745, "train_tokens_per_second": 4965.289 }, { "epoch": 20.615384615384617, "num_input_tokens_seen": 1064928, "step": 268, "train_accuracy": 0.013671875 }, { "epoch": 20.692307692307693, "grad_norm": 2.6022112369537354, "learning_rate": 0.01, "loss": 4.660740852355957, "num_input_tokens_seen": 1069024, "step": 269, "train_runtime": 215.2813, "train_tokens_per_second": 4965.707 }, { "epoch": 20.692307692307693, "num_input_tokens_seen": 1069024, "step": 269, "train_accuracy": 0.009765625 }, { "epoch": 20.76923076923077, "grad_norm": 2.548490524291992, "learning_rate": 0.01, "loss": 4.7107157707214355, "num_input_tokens_seen": 1073120, "step": 270, "train_runtime": 216.0872, "train_tokens_per_second": 4966.143 }, { "epoch": 20.76923076923077, "num_input_tokens_seen": 1073120, "step": 270, "train_accuracy": 0.009765625 }, { "epoch": 20.846153846153847, "grad_norm": 2.851895809173584, "learning_rate": 0.01, "loss": 4.749560356140137, "num_input_tokens_seen": 1077216, "step": 271, "train_runtime": 216.8951, "train_tokens_per_second": 4966.529 }, { "epoch": 20.846153846153847, "num_input_tokens_seen": 1077216, "step": 271, "train_accuracy": 0.01171875 }, { "epoch": 20.923076923076923, "grad_norm": 2.1356582641601562, "learning_rate": 0.01, "loss": 4.705930709838867, "num_input_tokens_seen": 1081312, "step": 272, "train_runtime": 217.6981, "train_tokens_per_second": 4967.024 }, { "epoch": 20.923076923076923, "num_input_tokens_seen": 1081312, "step": 272, "train_accuracy": 0.0065146577544510365 }, { "epoch": 21.0, "grad_norm": 3.311933994293213, "learning_rate": 0.01, "loss": 4.859829902648926, "num_input_tokens_seen": 1083768, "step": 273, "train_runtime": 218.2094, "train_tokens_per_second": 4966.642 }, { "epoch": 21.0, "num_input_tokens_seen": 1083768, "step": 273, "train_accuracy": 0.0078125 }, { "epoch": 21.076923076923077, "grad_norm": 2.1029155254364014, "learning_rate": 0.01, "loss": 4.697745323181152, "num_input_tokens_seen": 1087864, "step": 274, "train_runtime": 219.0285, "train_tokens_per_second": 4966.77 }, { "epoch": 21.076923076923077, "num_input_tokens_seen": 1087864, "step": 274, "train_accuracy": 0.009765625 }, { "epoch": 21.153846153846153, "grad_norm": 2.1796224117279053, "learning_rate": 0.01, "loss": 4.717341899871826, "num_input_tokens_seen": 1091960, "step": 275, "train_runtime": 219.8385, "train_tokens_per_second": 4967.101 }, { "epoch": 21.153846153846153, "num_input_tokens_seen": 1091960, "step": 275, "train_accuracy": 0.015625 }, { "epoch": 21.23076923076923, "grad_norm": 2.699026346206665, "learning_rate": 0.01, "loss": 4.845812797546387, "num_input_tokens_seen": 1096056, "step": 276, "train_runtime": 220.6475, "train_tokens_per_second": 4967.452 }, { "epoch": 21.23076923076923, "num_input_tokens_seen": 1096056, "step": 276, "train_accuracy": 0.0078125 }, { "epoch": 21.307692307692307, "grad_norm": 2.3528244495391846, "learning_rate": 0.01, "loss": 4.74075984954834, "num_input_tokens_seen": 1100152, "step": 277, "train_runtime": 221.4545, "train_tokens_per_second": 4967.847 }, { "epoch": 21.307692307692307, "num_input_tokens_seen": 1100152, "step": 277, "train_accuracy": 0.009765625 }, { "epoch": 21.384615384615383, "grad_norm": 2.3818016052246094, "learning_rate": 0.01, "loss": 4.771634101867676, "num_input_tokens_seen": 1104248, "step": 278, "train_runtime": 222.2667, "train_tokens_per_second": 4968.121 }, { "epoch": 21.384615384615383, "num_input_tokens_seen": 1104248, "step": 278, "train_accuracy": 0.015625 }, { "epoch": 21.46153846153846, "grad_norm": 2.1720387935638428, "learning_rate": 0.01, "loss": 4.709393501281738, "num_input_tokens_seen": 1108344, "step": 279, "train_runtime": 223.0734, "train_tokens_per_second": 4968.517 }, { "epoch": 21.46153846153846, "num_input_tokens_seen": 1108344, "step": 279, "train_accuracy": 0.0078125 }, { "epoch": 21.53846153846154, "grad_norm": 1.855604648590088, "learning_rate": 0.01, "loss": 4.684809684753418, "num_input_tokens_seen": 1112440, "step": 280, "train_runtime": 223.88, "train_tokens_per_second": 4968.913 }, { "epoch": 21.53846153846154, "num_input_tokens_seen": 1112440, "step": 280, "train_accuracy": 0.017578125 }, { "epoch": 21.615384615384617, "grad_norm": 2.3128485679626465, "learning_rate": 0.01, "loss": 4.782155990600586, "num_input_tokens_seen": 1116536, "step": 281, "train_runtime": 224.6864, "train_tokens_per_second": 4969.307 }, { "epoch": 21.615384615384617, "num_input_tokens_seen": 1116536, "step": 281, "train_accuracy": 0.005859375 }, { "epoch": 21.692307692307693, "grad_norm": 2.5007569789886475, "learning_rate": 0.01, "loss": 4.736386775970459, "num_input_tokens_seen": 1120632, "step": 282, "train_runtime": 225.4937, "train_tokens_per_second": 4969.682 }, { "epoch": 21.692307692307693, "num_input_tokens_seen": 1120632, "step": 282, "train_accuracy": 0.0234375 }, { "epoch": 21.76923076923077, "grad_norm": 1.760748267173767, "learning_rate": 0.01, "loss": 4.67552375793457, "num_input_tokens_seen": 1124728, "step": 283, "train_runtime": 226.3016, "train_tokens_per_second": 4970.039 }, { "epoch": 21.76923076923077, "num_input_tokens_seen": 1124728, "step": 283, "train_accuracy": 0.0078125 }, { "epoch": 21.846153846153847, "grad_norm": 2.350501775741577, "learning_rate": 0.01, "loss": 4.71092414855957, "num_input_tokens_seen": 1128824, "step": 284, "train_runtime": 227.1093, "train_tokens_per_second": 4970.4 }, { "epoch": 21.846153846153847, "num_input_tokens_seen": 1128824, "step": 284, "train_accuracy": 0.0078125 }, { "epoch": 21.923076923076923, "grad_norm": 2.3892035484313965, "learning_rate": 0.01, "loss": 4.7376708984375, "num_input_tokens_seen": 1132920, "step": 285, "train_runtime": 227.9131, "train_tokens_per_second": 4970.843 }, { "epoch": 21.923076923076923, "num_input_tokens_seen": 1132920, "step": 285, "train_accuracy": 0.009771986864507198 }, { "epoch": 22.0, "grad_norm": 3.1911215782165527, "learning_rate": 0.01, "loss": 4.834023952484131, "num_input_tokens_seen": 1135376, "step": 286, "train_runtime": 228.4242, "train_tokens_per_second": 4970.473 }, { "epoch": 22.0, "num_input_tokens_seen": 1135376, "step": 286, "train_accuracy": 0.0078125 }, { "epoch": 22.076923076923077, "grad_norm": 2.4082560539245605, "learning_rate": 0.01, "loss": 4.777586936950684, "num_input_tokens_seen": 1139472, "step": 287, "train_runtime": 229.2428, "train_tokens_per_second": 4970.59 }, { "epoch": 22.076923076923077, "num_input_tokens_seen": 1139472, "step": 287, "train_accuracy": 0.00390625 }, { "epoch": 22.153846153846153, "grad_norm": 2.413447618484497, "learning_rate": 0.01, "loss": 4.754624843597412, "num_input_tokens_seen": 1143568, "step": 288, "train_runtime": 230.0496, "train_tokens_per_second": 4970.962 }, { "epoch": 22.153846153846153, "num_input_tokens_seen": 1143568, "step": 288, "train_accuracy": 0.0078125 }, { "epoch": 22.23076923076923, "grad_norm": 2.6883504390716553, "learning_rate": 0.01, "loss": 4.817875385284424, "num_input_tokens_seen": 1147664, "step": 289, "train_runtime": 230.858, "train_tokens_per_second": 4971.299 }, { "epoch": 22.23076923076923, "num_input_tokens_seen": 1147664, "step": 289, "train_accuracy": 0.01171875 }, { "epoch": 22.307692307692307, "grad_norm": 3.0178632736206055, "learning_rate": 0.01, "loss": 4.860883712768555, "num_input_tokens_seen": 1151760, "step": 290, "train_runtime": 231.6672, "train_tokens_per_second": 4971.614 }, { "epoch": 22.307692307692307, "num_input_tokens_seen": 1151760, "step": 290, "train_accuracy": 0.01171875 }, { "epoch": 22.384615384615383, "grad_norm": 4.1211090087890625, "learning_rate": 0.01, "loss": 4.9048357009887695, "num_input_tokens_seen": 1155856, "step": 291, "train_runtime": 232.4733, "train_tokens_per_second": 4971.994 }, { "epoch": 22.384615384615383, "num_input_tokens_seen": 1155856, "step": 291, "train_accuracy": 0.01171875 }, { "epoch": 22.46153846153846, "grad_norm": 2.780254602432251, "learning_rate": 0.01, "loss": 4.758027076721191, "num_input_tokens_seen": 1159952, "step": 292, "train_runtime": 233.6182, "train_tokens_per_second": 4965.161 }, { "epoch": 22.46153846153846, "num_input_tokens_seen": 1159952, "step": 292, "train_accuracy": 0.0078125 }, { "epoch": 22.53846153846154, "grad_norm": 2.5430874824523926, "learning_rate": 0.01, "loss": 4.874720096588135, "num_input_tokens_seen": 1164048, "step": 293, "train_runtime": 234.4245, "train_tokens_per_second": 4965.556 }, { "epoch": 22.53846153846154, "num_input_tokens_seen": 1164048, "step": 293, "train_accuracy": 0.005859375 }, { "epoch": 22.615384615384617, "grad_norm": 2.681941032409668, "learning_rate": 0.01, "loss": 4.79051399230957, "num_input_tokens_seen": 1168144, "step": 294, "train_runtime": 235.232, "train_tokens_per_second": 4965.922 }, { "epoch": 22.615384615384617, "num_input_tokens_seen": 1168144, "step": 294, "train_accuracy": 0.009765625 }, { "epoch": 22.692307692307693, "grad_norm": 2.2946882247924805, "learning_rate": 0.01, "loss": 4.760282516479492, "num_input_tokens_seen": 1172240, "step": 295, "train_runtime": 236.0396, "train_tokens_per_second": 4966.286 }, { "epoch": 22.692307692307693, "num_input_tokens_seen": 1172240, "step": 295, "train_accuracy": 0.013671875 }, { "epoch": 22.76923076923077, "grad_norm": 2.588116407394409, "learning_rate": 0.01, "loss": 4.80474853515625, "num_input_tokens_seen": 1176336, "step": 296, "train_runtime": 236.8462, "train_tokens_per_second": 4966.666 }, { "epoch": 22.76923076923077, "num_input_tokens_seen": 1176336, "step": 296, "train_accuracy": 0.009765625 }, { "epoch": 22.846153846153847, "grad_norm": 2.5479612350463867, "learning_rate": 0.01, "loss": 4.77901029586792, "num_input_tokens_seen": 1180432, "step": 297, "train_runtime": 237.6532, "train_tokens_per_second": 4967.036 }, { "epoch": 22.846153846153847, "num_input_tokens_seen": 1180432, "step": 297, "train_accuracy": 0.0078125 }, { "epoch": 22.923076923076923, "grad_norm": 2.49416446685791, "learning_rate": 0.01, "loss": 4.781351089477539, "num_input_tokens_seen": 1184528, "step": 298, "train_runtime": 238.4562, "train_tokens_per_second": 4967.487 }, { "epoch": 22.923076923076923, "num_input_tokens_seen": 1184528, "step": 298, "train_accuracy": 0.0032573288772255182 }, { "epoch": 23.0, "grad_norm": 2.447633743286133, "learning_rate": 0.01, "loss": 4.748744487762451, "num_input_tokens_seen": 1186984, "step": 299, "train_runtime": 238.9676, "train_tokens_per_second": 4967.134 }, { "epoch": 23.0, "num_input_tokens_seen": 1186984, "step": 299, "train_accuracy": 0.013671875 }, { "epoch": 23.076923076923077, "grad_norm": 3.9213333129882812, "learning_rate": 0.01, "loss": 4.831058502197266, "num_input_tokens_seen": 1191080, "step": 300, "train_runtime": 239.7857, "train_tokens_per_second": 4967.269 }, { "epoch": 23.076923076923077, "eval_CMD_3_branch_eval_accuracy": 0.015189873417721518, "eval_CMD_3_branch_eval_loss": 4.984875679016113, "eval_CMD_3_branch_eval_runtime": 1.1324, "eval_CMD_3_branch_eval_samples_per_second": 2441.65, "eval_CMD_3_branch_eval_steps_per_second": 5.298, "num_input_tokens_seen": 1191080, "step": 300 }, { "epoch": 23.076923076923077, "num_input_tokens_seen": 1191080, "step": 300, "train_accuracy": 0.021484375 }, { "epoch": 23.153846153846153, "grad_norm": 3.7104413509368896, "learning_rate": 0.01, "loss": 4.880445957183838, "num_input_tokens_seen": 1195176, "step": 301, "train_runtime": 241.7296, "train_tokens_per_second": 4944.269 }, { "epoch": 23.153846153846153, "num_input_tokens_seen": 1195176, "step": 301, "train_accuracy": 0.0078125 }, { "epoch": 23.23076923076923, "grad_norm": 2.4190526008605957, "learning_rate": 0.01, "loss": 4.79976224899292, "num_input_tokens_seen": 1199272, "step": 302, "train_runtime": 242.5356, "train_tokens_per_second": 4944.726 }, { "epoch": 23.23076923076923, "num_input_tokens_seen": 1199272, "step": 302, "train_accuracy": 0.0078125 }, { "epoch": 23.307692307692307, "grad_norm": 2.964792013168335, "learning_rate": 0.01, "loss": 4.900379657745361, "num_input_tokens_seen": 1203368, "step": 303, "train_runtime": 243.3473, "train_tokens_per_second": 4945.065 }, { "epoch": 23.307692307692307, "num_input_tokens_seen": 1203368, "step": 303, "train_accuracy": 0.01171875 }, { "epoch": 23.384615384615383, "grad_norm": 2.890063762664795, "learning_rate": 0.01, "loss": 4.858273029327393, "num_input_tokens_seen": 1207464, "step": 304, "train_runtime": 244.1551, "train_tokens_per_second": 4945.48 }, { "epoch": 23.384615384615383, "num_input_tokens_seen": 1207464, "step": 304, "train_accuracy": 0.015625 }, { "epoch": 23.46153846153846, "grad_norm": 2.7856032848358154, "learning_rate": 0.01, "loss": 4.86794376373291, "num_input_tokens_seen": 1211560, "step": 305, "train_runtime": 244.9621, "train_tokens_per_second": 4945.908 }, { "epoch": 23.46153846153846, "num_input_tokens_seen": 1211560, "step": 305, "train_accuracy": 0.00390625 }, { "epoch": 23.53846153846154, "grad_norm": 3.326423406600952, "learning_rate": 0.01, "loss": 4.906798362731934, "num_input_tokens_seen": 1215656, "step": 306, "train_runtime": 245.7683, "train_tokens_per_second": 4946.35 }, { "epoch": 23.53846153846154, "num_input_tokens_seen": 1215656, "step": 306, "train_accuracy": 0.0078125 }, { "epoch": 23.615384615384617, "grad_norm": 2.812473773956299, "learning_rate": 0.01, "loss": 4.856661796569824, "num_input_tokens_seen": 1219752, "step": 307, "train_runtime": 246.5753, "train_tokens_per_second": 4946.772 }, { "epoch": 23.615384615384617, "num_input_tokens_seen": 1219752, "step": 307, "train_accuracy": 0.009765625 }, { "epoch": 23.692307692307693, "grad_norm": 3.1735622882843018, "learning_rate": 0.01, "loss": 4.842247009277344, "num_input_tokens_seen": 1223848, "step": 308, "train_runtime": 247.3828, "train_tokens_per_second": 4947.183 }, { "epoch": 23.692307692307693, "num_input_tokens_seen": 1223848, "step": 308, "train_accuracy": 0.01171875 }, { "epoch": 23.76923076923077, "grad_norm": 1.9832615852355957, "learning_rate": 0.01, "loss": 4.670631408691406, "num_input_tokens_seen": 1227944, "step": 309, "train_runtime": 248.1893, "train_tokens_per_second": 4947.61 }, { "epoch": 23.76923076923077, "num_input_tokens_seen": 1227944, "step": 309, "train_accuracy": 0.015625 }, { "epoch": 23.846153846153847, "grad_norm": 3.3848817348480225, "learning_rate": 0.01, "loss": 4.795812606811523, "num_input_tokens_seen": 1232040, "step": 310, "train_runtime": 248.9957, "train_tokens_per_second": 4948.038 }, { "epoch": 23.846153846153847, "num_input_tokens_seen": 1232040, "step": 310, "train_accuracy": 0.01171875 }, { "epoch": 23.923076923076923, "grad_norm": 2.17008638381958, "learning_rate": 0.01, "loss": 4.756107330322266, "num_input_tokens_seen": 1236136, "step": 311, "train_runtime": 249.7978, "train_tokens_per_second": 4948.547 }, { "epoch": 23.923076923076923, "num_input_tokens_seen": 1236136, "step": 311, "train_accuracy": 0.019543973729014397 }, { "epoch": 24.0, "grad_norm": 2.9384548664093018, "learning_rate": 0.01, "loss": 4.840476989746094, "num_input_tokens_seen": 1238592, "step": 312, "train_runtime": 250.3091, "train_tokens_per_second": 4948.249 }, { "epoch": 24.0, "num_input_tokens_seen": 1238592, "step": 312, "train_accuracy": 0.015625 }, { "epoch": 24.076923076923077, "grad_norm": 2.095926523208618, "learning_rate": 0.01, "loss": 4.775547027587891, "num_input_tokens_seen": 1242688, "step": 313, "train_runtime": 251.1277, "train_tokens_per_second": 4948.431 }, { "epoch": 24.076923076923077, "num_input_tokens_seen": 1242688, "step": 313, "train_accuracy": 0.0078125 }, { "epoch": 24.153846153846153, "grad_norm": 2.1713414192199707, "learning_rate": 0.01, "loss": 4.785286903381348, "num_input_tokens_seen": 1246784, "step": 314, "train_runtime": 251.9347, "train_tokens_per_second": 4948.838 }, { "epoch": 24.153846153846153, "num_input_tokens_seen": 1246784, "step": 314, "train_accuracy": 0.017578125 }, { "epoch": 24.23076923076923, "grad_norm": 2.2279763221740723, "learning_rate": 0.01, "loss": 4.751096248626709, "num_input_tokens_seen": 1250880, "step": 315, "train_runtime": 252.7423, "train_tokens_per_second": 4949.23 }, { "epoch": 24.23076923076923, "num_input_tokens_seen": 1250880, "step": 315, "train_accuracy": 0.0078125 }, { "epoch": 24.307692307692307, "grad_norm": 2.8324530124664307, "learning_rate": 0.01, "loss": 4.821085453033447, "num_input_tokens_seen": 1254976, "step": 316, "train_runtime": 253.55, "train_tokens_per_second": 4949.62 }, { "epoch": 24.307692307692307, "num_input_tokens_seen": 1254976, "step": 316, "train_accuracy": 0.0078125 }, { "epoch": 24.384615384615383, "grad_norm": 2.314676523208618, "learning_rate": 0.01, "loss": 4.786411285400391, "num_input_tokens_seen": 1259072, "step": 317, "train_runtime": 254.3573, "train_tokens_per_second": 4950.014 }, { "epoch": 24.384615384615383, "num_input_tokens_seen": 1259072, "step": 317, "train_accuracy": 0.00390625 }, { "epoch": 24.46153846153846, "grad_norm": 2.2938666343688965, "learning_rate": 0.01, "loss": 4.797077178955078, "num_input_tokens_seen": 1263168, "step": 318, "train_runtime": 255.1637, "train_tokens_per_second": 4950.422 }, { "epoch": 24.46153846153846, "num_input_tokens_seen": 1263168, "step": 318, "train_accuracy": 0.0078125 }, { "epoch": 24.53846153846154, "grad_norm": 2.1615288257598877, "learning_rate": 0.01, "loss": 4.717720985412598, "num_input_tokens_seen": 1267264, "step": 319, "train_runtime": 255.9706, "train_tokens_per_second": 4950.819 }, { "epoch": 24.53846153846154, "num_input_tokens_seen": 1267264, "step": 319, "train_accuracy": 0.009765625 }, { "epoch": 24.615384615384617, "grad_norm": 2.3392107486724854, "learning_rate": 0.01, "loss": 4.733541488647461, "num_input_tokens_seen": 1271360, "step": 320, "train_runtime": 256.7778, "train_tokens_per_second": 4951.207 }, { "epoch": 24.615384615384617, "num_input_tokens_seen": 1271360, "step": 320, "train_accuracy": 0.01171875 }, { "epoch": 24.692307692307693, "grad_norm": 2.0798051357269287, "learning_rate": 0.01, "loss": 4.784616470336914, "num_input_tokens_seen": 1275456, "step": 321, "train_runtime": 257.5861, "train_tokens_per_second": 4951.571 }, { "epoch": 24.692307692307693, "num_input_tokens_seen": 1275456, "step": 321, "train_accuracy": 0.017578125 }, { "epoch": 24.76923076923077, "grad_norm": 1.7728190422058105, "learning_rate": 0.01, "loss": 4.739435195922852, "num_input_tokens_seen": 1279552, "step": 322, "train_runtime": 258.3936, "train_tokens_per_second": 4951.949 }, { "epoch": 24.76923076923077, "num_input_tokens_seen": 1279552, "step": 322, "train_accuracy": 0.0 }, { "epoch": 24.846153846153847, "grad_norm": 2.3809309005737305, "learning_rate": 0.01, "loss": 4.806252479553223, "num_input_tokens_seen": 1283648, "step": 323, "train_runtime": 259.201, "train_tokens_per_second": 4952.326 }, { "epoch": 24.846153846153847, "num_input_tokens_seen": 1283648, "step": 323, "train_accuracy": 0.009765625 }, { "epoch": 24.923076923076923, "grad_norm": 2.374556064605713, "learning_rate": 0.01, "loss": 4.791336536407471, "num_input_tokens_seen": 1287744, "step": 324, "train_runtime": 260.005, "train_tokens_per_second": 4952.766 }, { "epoch": 24.923076923076923, "num_input_tokens_seen": 1287744, "step": 324, "train_accuracy": 0.0065146577544510365 }, { "epoch": 25.0, "grad_norm": 2.228682518005371, "learning_rate": 0.01, "loss": 4.765847206115723, "num_input_tokens_seen": 1290200, "step": 325, "train_runtime": 260.5169, "train_tokens_per_second": 4952.463 }, { "epoch": 25.0, "num_input_tokens_seen": 1290200, "step": 325, "train_accuracy": 0.0078125 }, { "epoch": 25.076923076923077, "grad_norm": 2.6056597232818604, "learning_rate": 0.01, "loss": 4.897510528564453, "num_input_tokens_seen": 1294296, "step": 326, "train_runtime": 261.336, "train_tokens_per_second": 4952.612 }, { "epoch": 25.076923076923077, "num_input_tokens_seen": 1294296, "step": 326, "train_accuracy": 0.015625 }, { "epoch": 25.153846153846153, "grad_norm": 2.3389954566955566, "learning_rate": 0.01, "loss": 4.76637077331543, "num_input_tokens_seen": 1298392, "step": 327, "train_runtime": 262.1438, "train_tokens_per_second": 4952.977 }, { "epoch": 25.153846153846153, "num_input_tokens_seen": 1298392, "step": 327, "train_accuracy": 0.015625 }, { "epoch": 25.23076923076923, "grad_norm": 2.6925578117370605, "learning_rate": 0.01, "loss": 4.770495891571045, "num_input_tokens_seen": 1302488, "step": 328, "train_runtime": 262.9515, "train_tokens_per_second": 4953.34 }, { "epoch": 25.23076923076923, "num_input_tokens_seen": 1302488, "step": 328, "train_accuracy": 0.013671875 }, { "epoch": 25.307692307692307, "grad_norm": 2.749713659286499, "learning_rate": 0.01, "loss": 4.881984710693359, "num_input_tokens_seen": 1306584, "step": 329, "train_runtime": 263.7588, "train_tokens_per_second": 4953.708 }, { "epoch": 25.307692307692307, "num_input_tokens_seen": 1306584, "step": 329, "train_accuracy": 0.005859375 }, { "epoch": 25.384615384615383, "grad_norm": 2.8878915309906006, "learning_rate": 0.01, "loss": 4.886727333068848, "num_input_tokens_seen": 1310680, "step": 330, "train_runtime": 264.5658, "train_tokens_per_second": 4954.08 }, { "epoch": 25.384615384615383, "num_input_tokens_seen": 1310680, "step": 330, "train_accuracy": 0.015625 }, { "epoch": 25.46153846153846, "grad_norm": 3.6340856552124023, "learning_rate": 0.01, "loss": 4.835007190704346, "num_input_tokens_seen": 1314776, "step": 331, "train_runtime": 265.3725, "train_tokens_per_second": 4954.456 }, { "epoch": 25.46153846153846, "num_input_tokens_seen": 1314776, "step": 331, "train_accuracy": 0.009765625 }, { "epoch": 25.53846153846154, "grad_norm": 3.042142391204834, "learning_rate": 0.01, "loss": 4.860703468322754, "num_input_tokens_seen": 1318872, "step": 332, "train_runtime": 266.1802, "train_tokens_per_second": 4954.81 }, { "epoch": 25.53846153846154, "num_input_tokens_seen": 1318872, "step": 332, "train_accuracy": 0.013671875 }, { "epoch": 25.615384615384617, "grad_norm": 2.693301200866699, "learning_rate": 0.01, "loss": 4.840606212615967, "num_input_tokens_seen": 1322968, "step": 333, "train_runtime": 266.9876, "train_tokens_per_second": 4955.167 }, { "epoch": 25.615384615384617, "num_input_tokens_seen": 1322968, "step": 333, "train_accuracy": 0.013671875 }, { "epoch": 25.692307692307693, "grad_norm": 2.5403964519500732, "learning_rate": 0.01, "loss": 4.798892498016357, "num_input_tokens_seen": 1327064, "step": 334, "train_runtime": 267.7941, "train_tokens_per_second": 4955.538 }, { "epoch": 25.692307692307693, "num_input_tokens_seen": 1327064, "step": 334, "train_accuracy": 0.01171875 }, { "epoch": 25.76923076923077, "grad_norm": 2.2730178833007812, "learning_rate": 0.01, "loss": 4.782463073730469, "num_input_tokens_seen": 1331160, "step": 335, "train_runtime": 268.6006, "train_tokens_per_second": 4955.908 }, { "epoch": 25.76923076923077, "num_input_tokens_seen": 1331160, "step": 335, "train_accuracy": 0.0078125 }, { "epoch": 25.846153846153847, "grad_norm": 2.9360063076019287, "learning_rate": 0.01, "loss": 4.909140110015869, "num_input_tokens_seen": 1335256, "step": 336, "train_runtime": 269.4078, "train_tokens_per_second": 4956.263 }, { "epoch": 25.846153846153847, "num_input_tokens_seen": 1335256, "step": 336, "train_accuracy": 0.013671875 }, { "epoch": 25.923076923076923, "grad_norm": 2.116119861602783, "learning_rate": 0.01, "loss": 4.812901496887207, "num_input_tokens_seen": 1339352, "step": 337, "train_runtime": 270.2115, "train_tokens_per_second": 4956.681 }, { "epoch": 25.923076923076923, "num_input_tokens_seen": 1339352, "step": 337, "train_accuracy": 0.02280130237340927 }, { "epoch": 26.0, "grad_norm": 3.5643439292907715, "learning_rate": 0.01, "loss": 4.895590305328369, "num_input_tokens_seen": 1341808, "step": 338, "train_runtime": 270.7232, "train_tokens_per_second": 4956.384 }, { "epoch": 26.0, "num_input_tokens_seen": 1341808, "step": 338, "train_accuracy": 0.005859375 }, { "epoch": 26.076923076923077, "grad_norm": 4.132648468017578, "learning_rate": 0.01, "loss": 5.072445869445801, "num_input_tokens_seen": 1345904, "step": 339, "train_runtime": 271.5418, "train_tokens_per_second": 4956.526 }, { "epoch": 26.076923076923077, "num_input_tokens_seen": 1345904, "step": 339, "train_accuracy": 0.013671875 }, { "epoch": 26.153846153846153, "grad_norm": 1.9905977249145508, "learning_rate": 0.01, "loss": 4.787455081939697, "num_input_tokens_seen": 1350000, "step": 340, "train_runtime": 272.3495, "train_tokens_per_second": 4956.867 }, { "epoch": 26.153846153846153, "num_input_tokens_seen": 1350000, "step": 340, "train_accuracy": 0.001953125 }, { "epoch": 26.23076923076923, "grad_norm": 2.674907684326172, "learning_rate": 0.01, "loss": 4.856403350830078, "num_input_tokens_seen": 1354096, "step": 341, "train_runtime": 273.1569, "train_tokens_per_second": 4957.21 }, { "epoch": 26.23076923076923, "num_input_tokens_seen": 1354096, "step": 341, "train_accuracy": 0.01171875 }, { "epoch": 26.307692307692307, "grad_norm": 1.9412745237350464, "learning_rate": 0.01, "loss": 4.798261642456055, "num_input_tokens_seen": 1358192, "step": 342, "train_runtime": 273.9636, "train_tokens_per_second": 4957.563 }, { "epoch": 26.307692307692307, "num_input_tokens_seen": 1358192, "step": 342, "train_accuracy": 0.0078125 }, { "epoch": 26.384615384615383, "grad_norm": 2.8431615829467773, "learning_rate": 0.01, "loss": 4.952361583709717, "num_input_tokens_seen": 1362288, "step": 343, "train_runtime": 274.7702, "train_tokens_per_second": 4957.917 }, { "epoch": 26.384615384615383, "num_input_tokens_seen": 1362288, "step": 343, "train_accuracy": 0.01171875 }, { "epoch": 26.46153846153846, "grad_norm": 2.662569761276245, "learning_rate": 0.01, "loss": 4.8351850509643555, "num_input_tokens_seen": 1366384, "step": 344, "train_runtime": 275.5778, "train_tokens_per_second": 4958.251 }, { "epoch": 26.46153846153846, "num_input_tokens_seen": 1366384, "step": 344, "train_accuracy": 0.01171875 }, { "epoch": 26.53846153846154, "grad_norm": 2.3961122035980225, "learning_rate": 0.01, "loss": 4.846569061279297, "num_input_tokens_seen": 1370480, "step": 345, "train_runtime": 276.3857, "train_tokens_per_second": 4958.578 }, { "epoch": 26.53846153846154, "num_input_tokens_seen": 1370480, "step": 345, "train_accuracy": 0.0078125 }, { "epoch": 26.615384615384617, "grad_norm": 2.540269136428833, "learning_rate": 0.01, "loss": 4.879981994628906, "num_input_tokens_seen": 1374576, "step": 346, "train_runtime": 277.1925, "train_tokens_per_second": 4958.922 }, { "epoch": 26.615384615384617, "num_input_tokens_seen": 1374576, "step": 346, "train_accuracy": 0.0078125 }, { "epoch": 26.692307692307693, "grad_norm": 2.8331077098846436, "learning_rate": 0.01, "loss": 4.893893718719482, "num_input_tokens_seen": 1378672, "step": 347, "train_runtime": 277.9992, "train_tokens_per_second": 4959.266 }, { "epoch": 26.692307692307693, "num_input_tokens_seen": 1378672, "step": 347, "train_accuracy": 0.009765625 }, { "epoch": 26.76923076923077, "grad_norm": 3.754427194595337, "learning_rate": 0.01, "loss": 5.022141933441162, "num_input_tokens_seen": 1382768, "step": 348, "train_runtime": 278.8062, "train_tokens_per_second": 4959.603 }, { "epoch": 26.76923076923077, "num_input_tokens_seen": 1382768, "step": 348, "train_accuracy": 0.00390625 }, { "epoch": 26.846153846153847, "grad_norm": 3.9744033813476562, "learning_rate": 0.01, "loss": 5.177316665649414, "num_input_tokens_seen": 1386864, "step": 349, "train_runtime": 279.6137, "train_tokens_per_second": 4959.928 }, { "epoch": 26.846153846153847, "num_input_tokens_seen": 1386864, "step": 349, "train_accuracy": 0.005859375 }, { "epoch": 26.923076923076923, "grad_norm": 3.872500419616699, "learning_rate": 0.01, "loss": 5.195061206817627, "num_input_tokens_seen": 1390960, "step": 350, "train_runtime": 280.4168, "train_tokens_per_second": 4960.331 }, { "epoch": 26.923076923076923, "num_input_tokens_seen": 1390960, "step": 350, "train_accuracy": 0.0032573288772255182 }, { "epoch": 27.0, "grad_norm": 3.184382200241089, "learning_rate": 0.01, "loss": 5.033001899719238, "num_input_tokens_seen": 1393416, "step": 351, "train_runtime": 280.9292, "train_tokens_per_second": 4960.025 }, { "epoch": 27.0, "num_input_tokens_seen": 1393416, "step": 351, "train_accuracy": 0.017578125 }, { "epoch": 27.076923076923077, "grad_norm": 5.33905553817749, "learning_rate": 0.01, "loss": 5.47437858581543, "num_input_tokens_seen": 1397512, "step": 352, "train_runtime": 281.7478, "train_tokens_per_second": 4960.153 }, { "epoch": 27.076923076923077, "num_input_tokens_seen": 1397512, "step": 352, "train_accuracy": 0.015625 }, { "epoch": 27.153846153846153, "grad_norm": 5.295461654663086, "learning_rate": 0.01, "loss": 5.488711357116699, "num_input_tokens_seen": 1401608, "step": 353, "train_runtime": 282.5549, "train_tokens_per_second": 4960.481 }, { "epoch": 27.153846153846153, "num_input_tokens_seen": 1401608, "step": 353, "train_accuracy": 0.01171875 }, { "epoch": 27.23076923076923, "grad_norm": 5.008157730102539, "learning_rate": 0.01, "loss": 5.523514270782471, "num_input_tokens_seen": 1405704, "step": 354, "train_runtime": 283.3614, "train_tokens_per_second": 4960.817 }, { "epoch": 27.23076923076923, "num_input_tokens_seen": 1405704, "step": 354, "train_accuracy": 0.01171875 }, { "epoch": 27.307692307692307, "grad_norm": 2.9176597595214844, "learning_rate": 0.01, "loss": 5.203047275543213, "num_input_tokens_seen": 1409800, "step": 355, "train_runtime": 284.1688, "train_tokens_per_second": 4961.136 }, { "epoch": 27.307692307692307, "num_input_tokens_seen": 1409800, "step": 355, "train_accuracy": 0.009765625 }, { "epoch": 27.384615384615383, "grad_norm": 3.083993673324585, "learning_rate": 0.01, "loss": 5.156909942626953, "num_input_tokens_seen": 1413896, "step": 356, "train_runtime": 284.978, "train_tokens_per_second": 4961.422 }, { "epoch": 27.384615384615383, "num_input_tokens_seen": 1413896, "step": 356, "train_accuracy": 0.00390625 }, { "epoch": 27.46153846153846, "grad_norm": 3.0954196453094482, "learning_rate": 0.01, "loss": 5.153910160064697, "num_input_tokens_seen": 1417992, "step": 357, "train_runtime": 285.7855, "train_tokens_per_second": 4961.736 }, { "epoch": 27.46153846153846, "num_input_tokens_seen": 1417992, "step": 357, "train_accuracy": 0.017578125 }, { "epoch": 27.53846153846154, "grad_norm": 3.142883777618408, "learning_rate": 0.01, "loss": 5.057559967041016, "num_input_tokens_seen": 1422088, "step": 358, "train_runtime": 286.5968, "train_tokens_per_second": 4961.981 }, { "epoch": 27.53846153846154, "num_input_tokens_seen": 1422088, "step": 358, "train_accuracy": 0.001953125 }, { "epoch": 27.615384615384617, "grad_norm": 3.245189905166626, "learning_rate": 0.01, "loss": 5.013225555419922, "num_input_tokens_seen": 1426184, "step": 359, "train_runtime": 287.4051, "train_tokens_per_second": 4962.278 }, { "epoch": 27.615384615384617, "num_input_tokens_seen": 1426184, "step": 359, "train_accuracy": 0.017578125 }, { "epoch": 27.692307692307693, "grad_norm": 2.5022335052490234, "learning_rate": 0.01, "loss": 4.944221496582031, "num_input_tokens_seen": 1430280, "step": 360, "train_runtime": 288.2127, "train_tokens_per_second": 4962.585 }, { "epoch": 27.692307692307693, "num_input_tokens_seen": 1430280, "step": 360, "train_accuracy": 0.009765625 }, { "epoch": 27.76923076923077, "grad_norm": 2.206346273422241, "learning_rate": 0.01, "loss": 4.890231132507324, "num_input_tokens_seen": 1434376, "step": 361, "train_runtime": 289.0203, "train_tokens_per_second": 4962.891 }, { "epoch": 27.76923076923077, "num_input_tokens_seen": 1434376, "step": 361, "train_accuracy": 0.01171875 }, { "epoch": 27.846153846153847, "grad_norm": 4.545768737792969, "learning_rate": 0.01, "loss": 5.098722457885742, "num_input_tokens_seen": 1438472, "step": 362, "train_runtime": 289.8279, "train_tokens_per_second": 4963.194 }, { "epoch": 27.846153846153847, "num_input_tokens_seen": 1438472, "step": 362, "train_accuracy": 0.009765625 }, { "epoch": 27.923076923076923, "grad_norm": 5.130817413330078, "learning_rate": 0.01, "loss": 5.554351806640625, "num_input_tokens_seen": 1442568, "step": 363, "train_runtime": 290.6321, "train_tokens_per_second": 4963.554 }, { "epoch": 27.923076923076923, "num_input_tokens_seen": 1442568, "step": 363, "train_accuracy": 0.0032573288772255182 }, { "epoch": 28.0, "grad_norm": 6.362403392791748, "learning_rate": 0.01, "loss": 5.701359748840332, "num_input_tokens_seen": 1445024, "step": 364, "train_runtime": 291.1439, "train_tokens_per_second": 4963.264 }, { "epoch": 28.0, "num_input_tokens_seen": 1445024, "step": 364, "train_accuracy": 0.01171875 }, { "epoch": 28.076923076923077, "grad_norm": 2.791771650314331, "learning_rate": 0.01, "loss": 5.103519439697266, "num_input_tokens_seen": 1449120, "step": 365, "train_runtime": 291.9634, "train_tokens_per_second": 4963.362 }, { "epoch": 28.076923076923077, "num_input_tokens_seen": 1449120, "step": 365, "train_accuracy": 0.017578125 }, { "epoch": 28.153846153846153, "grad_norm": 3.010110378265381, "learning_rate": 0.01, "loss": 5.303025245666504, "num_input_tokens_seen": 1453216, "step": 366, "train_runtime": 292.7707, "train_tokens_per_second": 4963.666 }, { "epoch": 28.153846153846153, "num_input_tokens_seen": 1453216, "step": 366, "train_accuracy": 0.013671875 }, { "epoch": 28.23076923076923, "grad_norm": 2.968033790588379, "learning_rate": 0.01, "loss": 5.217446804046631, "num_input_tokens_seen": 1457312, "step": 367, "train_runtime": 293.5782, "train_tokens_per_second": 4963.966 }, { "epoch": 28.23076923076923, "num_input_tokens_seen": 1457312, "step": 367, "train_accuracy": 0.01171875 }, { "epoch": 28.307692307692307, "grad_norm": 3.1182174682617188, "learning_rate": 0.01, "loss": 5.131748199462891, "num_input_tokens_seen": 1461408, "step": 368, "train_runtime": 294.3857, "train_tokens_per_second": 4964.262 }, { "epoch": 28.307692307692307, "num_input_tokens_seen": 1461408, "step": 368, "train_accuracy": 0.01953125 }, { "epoch": 28.384615384615383, "grad_norm": 2.7374229431152344, "learning_rate": 0.01, "loss": 5.119778156280518, "num_input_tokens_seen": 1465504, "step": 369, "train_runtime": 295.1924, "train_tokens_per_second": 4964.572 }, { "epoch": 28.384615384615383, "num_input_tokens_seen": 1465504, "step": 369, "train_accuracy": 0.013671875 }, { "epoch": 28.46153846153846, "grad_norm": 3.7106480598449707, "learning_rate": 0.01, "loss": 5.319789886474609, "num_input_tokens_seen": 1469600, "step": 370, "train_runtime": 295.9993, "train_tokens_per_second": 4964.876 }, { "epoch": 28.46153846153846, "num_input_tokens_seen": 1469600, "step": 370, "train_accuracy": 0.01171875 }, { "epoch": 28.53846153846154, "grad_norm": 3.287628650665283, "learning_rate": 0.01, "loss": 5.204777717590332, "num_input_tokens_seen": 1473696, "step": 371, "train_runtime": 296.8064, "train_tokens_per_second": 4965.177 }, { "epoch": 28.53846153846154, "num_input_tokens_seen": 1473696, "step": 371, "train_accuracy": 0.01171875 }, { "epoch": 28.615384615384617, "grad_norm": 6.909034252166748, "learning_rate": 0.01, "loss": 5.366301536560059, "num_input_tokens_seen": 1477792, "step": 372, "train_runtime": 297.6133, "train_tokens_per_second": 4965.478 }, { "epoch": 28.615384615384617, "num_input_tokens_seen": 1477792, "step": 372, "train_accuracy": 0.01171875 }, { "epoch": 28.692307692307693, "grad_norm": 3.6321017742156982, "learning_rate": 0.01, "loss": 5.42665958404541, "num_input_tokens_seen": 1481888, "step": 373, "train_runtime": 298.4201, "train_tokens_per_second": 4965.779 }, { "epoch": 28.692307692307693, "num_input_tokens_seen": 1481888, "step": 373, "train_accuracy": 0.009765625 }, { "epoch": 28.76923076923077, "grad_norm": 4.401106834411621, "learning_rate": 0.01, "loss": 5.725541114807129, "num_input_tokens_seen": 1485984, "step": 374, "train_runtime": 299.227, "train_tokens_per_second": 4966.076 }, { "epoch": 28.76923076923077, "num_input_tokens_seen": 1485984, "step": 374, "train_accuracy": 0.0078125 }, { "epoch": 28.846153846153847, "grad_norm": 2.99000883102417, "learning_rate": 0.01, "loss": 5.187654495239258, "num_input_tokens_seen": 1490080, "step": 375, "train_runtime": 300.0348, "train_tokens_per_second": 4966.358 }, { "epoch": 28.846153846153847, "num_input_tokens_seen": 1490080, "step": 375, "train_accuracy": 0.01171875 }, { "epoch": 28.923076923076923, "grad_norm": 4.467616558074951, "learning_rate": 0.01, "loss": 5.414639472961426, "num_input_tokens_seen": 1494176, "step": 376, "train_runtime": 300.8386, "train_tokens_per_second": 4966.703 }, { "epoch": 28.923076923076923, "num_input_tokens_seen": 1494176, "step": 376, "train_accuracy": 0.0032573288772255182 }, { "epoch": 29.0, "grad_norm": 3.196613073348999, "learning_rate": 0.01, "loss": 5.394354343414307, "num_input_tokens_seen": 1496632, "step": 377, "train_runtime": 301.3503, "train_tokens_per_second": 4966.42 }, { "epoch": 29.0, "num_input_tokens_seen": 1496632, "step": 377, "train_accuracy": 0.017578125 }, { "epoch": 29.076923076923077, "grad_norm": 3.0329129695892334, "learning_rate": 0.01, "loss": 5.178316116333008, "num_input_tokens_seen": 1500728, "step": 378, "train_runtime": 302.1683, "train_tokens_per_second": 4966.529 }, { "epoch": 29.076923076923077, "num_input_tokens_seen": 1500728, "step": 378, "train_accuracy": 0.013671875 }, { "epoch": 29.153846153846153, "grad_norm": 2.940192699432373, "learning_rate": 0.01, "loss": 5.279094219207764, "num_input_tokens_seen": 1504824, "step": 379, "train_runtime": 302.9755, "train_tokens_per_second": 4966.818 }, { "epoch": 29.153846153846153, "num_input_tokens_seen": 1504824, "step": 379, "train_accuracy": 0.01171875 }, { "epoch": 29.23076923076923, "grad_norm": 3.4374678134918213, "learning_rate": 0.01, "loss": 5.204883575439453, "num_input_tokens_seen": 1508920, "step": 380, "train_runtime": 303.7828, "train_tokens_per_second": 4967.101 }, { "epoch": 29.23076923076923, "num_input_tokens_seen": 1508920, "step": 380, "train_accuracy": 0.009765625 }, { "epoch": 29.307692307692307, "grad_norm": 2.811293363571167, "learning_rate": 0.01, "loss": 5.172276973724365, "num_input_tokens_seen": 1513016, "step": 381, "train_runtime": 304.5893, "train_tokens_per_second": 4967.397 }, { "epoch": 29.307692307692307, "num_input_tokens_seen": 1513016, "step": 381, "train_accuracy": 0.01171875 }, { "epoch": 29.384615384615383, "grad_norm": 3.0140793323516846, "learning_rate": 0.01, "loss": 5.2489399909973145, "num_input_tokens_seen": 1517112, "step": 382, "train_runtime": 305.3955, "train_tokens_per_second": 4967.696 }, { "epoch": 29.384615384615383, "num_input_tokens_seen": 1517112, "step": 382, "train_accuracy": 0.013671875 }, { "epoch": 29.46153846153846, "grad_norm": 4.041913032531738, "learning_rate": 0.01, "loss": 5.229885101318359, "num_input_tokens_seen": 1521208, "step": 383, "train_runtime": 306.2022, "train_tokens_per_second": 4967.984 }, { "epoch": 29.46153846153846, "num_input_tokens_seen": 1521208, "step": 383, "train_accuracy": 0.01953125 }, { "epoch": 29.53846153846154, "grad_norm": 2.427123785018921, "learning_rate": 0.01, "loss": 4.96853494644165, "num_input_tokens_seen": 1525304, "step": 384, "train_runtime": 307.009, "train_tokens_per_second": 4968.272 }, { "epoch": 29.53846153846154, "num_input_tokens_seen": 1525304, "step": 384, "train_accuracy": 0.013671875 }, { "epoch": 29.615384615384617, "grad_norm": 2.374685525894165, "learning_rate": 0.01, "loss": 5.0407915115356445, "num_input_tokens_seen": 1529400, "step": 385, "train_runtime": 307.8152, "train_tokens_per_second": 4968.566 }, { "epoch": 29.615384615384617, "num_input_tokens_seen": 1529400, "step": 385, "train_accuracy": 0.01171875 }, { "epoch": 29.692307692307693, "grad_norm": 2.529252529144287, "learning_rate": 0.01, "loss": 5.022377014160156, "num_input_tokens_seen": 1533496, "step": 386, "train_runtime": 308.621, "train_tokens_per_second": 4968.864 }, { "epoch": 29.692307692307693, "num_input_tokens_seen": 1533496, "step": 386, "train_accuracy": 0.015625 }, { "epoch": 29.76923076923077, "grad_norm": 2.575713872909546, "learning_rate": 0.01, "loss": 4.937716484069824, "num_input_tokens_seen": 1537592, "step": 387, "train_runtime": 309.4278, "train_tokens_per_second": 4969.146 }, { "epoch": 29.76923076923077, "num_input_tokens_seen": 1537592, "step": 387, "train_accuracy": 0.009765625 }, { "epoch": 29.846153846153847, "grad_norm": 1.810752511024475, "learning_rate": 0.01, "loss": 4.83278751373291, "num_input_tokens_seen": 1541688, "step": 388, "train_runtime": 310.2355, "train_tokens_per_second": 4969.412 }, { "epoch": 29.846153846153847, "num_input_tokens_seen": 1541688, "step": 388, "train_accuracy": 0.009765625 }, { "epoch": 29.923076923076923, "grad_norm": 2.1673622131347656, "learning_rate": 0.01, "loss": 4.854066848754883, "num_input_tokens_seen": 1545784, "step": 389, "train_runtime": 311.0383, "train_tokens_per_second": 4969.754 }, { "epoch": 29.923076923076923, "num_input_tokens_seen": 1545784, "step": 389, "train_accuracy": 0.013029315508902073 }, { "epoch": 30.0, "grad_norm": 2.0972650051116943, "learning_rate": 0.01, "loss": 4.779308795928955, "num_input_tokens_seen": 1548240, "step": 390, "train_runtime": 311.5498, "train_tokens_per_second": 4969.479 }, { "epoch": 30.0, "num_input_tokens_seen": 1548240, "step": 390, "train_accuracy": 0.0078125 }, { "epoch": 30.076923076923077, "grad_norm": 1.6017143726348877, "learning_rate": 0.01, "loss": 4.770463943481445, "num_input_tokens_seen": 1552336, "step": 391, "train_runtime": 312.3681, "train_tokens_per_second": 4969.573 }, { "epoch": 30.076923076923077, "num_input_tokens_seen": 1552336, "step": 391, "train_accuracy": 0.009765625 }, { "epoch": 30.153846153846153, "grad_norm": 1.9595004320144653, "learning_rate": 0.01, "loss": 4.839485168457031, "num_input_tokens_seen": 1556432, "step": 392, "train_runtime": 313.1744, "train_tokens_per_second": 4969.857 }, { "epoch": 30.153846153846153, "num_input_tokens_seen": 1556432, "step": 392, "train_accuracy": 0.005859375 }, { "epoch": 30.23076923076923, "grad_norm": 1.7008371353149414, "learning_rate": 0.01, "loss": 4.8051581382751465, "num_input_tokens_seen": 1560528, "step": 393, "train_runtime": 313.9811, "train_tokens_per_second": 4970.133 }, { "epoch": 30.23076923076923, "num_input_tokens_seen": 1560528, "step": 393, "train_accuracy": 0.021484375 }, { "epoch": 30.307692307692307, "grad_norm": 1.6570706367492676, "learning_rate": 0.01, "loss": 4.7867889404296875, "num_input_tokens_seen": 1564624, "step": 394, "train_runtime": 314.7875, "train_tokens_per_second": 4970.414 }, { "epoch": 30.307692307692307, "num_input_tokens_seen": 1564624, "step": 394, "train_accuracy": 0.013671875 }, { "epoch": 30.384615384615383, "grad_norm": 1.7845861911773682, "learning_rate": 0.01, "loss": 4.820751667022705, "num_input_tokens_seen": 1568720, "step": 395, "train_runtime": 315.5938, "train_tokens_per_second": 4970.693 }, { "epoch": 30.384615384615383, "num_input_tokens_seen": 1568720, "step": 395, "train_accuracy": 0.015625 }, { "epoch": 30.46153846153846, "grad_norm": 1.7581539154052734, "learning_rate": 0.01, "loss": 4.803133964538574, "num_input_tokens_seen": 1572816, "step": 396, "train_runtime": 316.4007, "train_tokens_per_second": 4970.962 }, { "epoch": 30.46153846153846, "num_input_tokens_seen": 1572816, "step": 396, "train_accuracy": 0.01171875 }, { "epoch": 30.53846153846154, "grad_norm": 1.7303351163864136, "learning_rate": 0.01, "loss": 4.776310920715332, "num_input_tokens_seen": 1576912, "step": 397, "train_runtime": 317.208, "train_tokens_per_second": 4971.224 }, { "epoch": 30.53846153846154, "num_input_tokens_seen": 1576912, "step": 397, "train_accuracy": 0.0 }, { "epoch": 30.615384615384617, "grad_norm": 1.5727354288101196, "learning_rate": 0.01, "loss": 4.699723243713379, "num_input_tokens_seen": 1581008, "step": 398, "train_runtime": 318.0155, "train_tokens_per_second": 4971.482 }, { "epoch": 30.615384615384617, "num_input_tokens_seen": 1581008, "step": 398, "train_accuracy": 0.017578125 }, { "epoch": 30.692307692307693, "grad_norm": 1.3687564134597778, "learning_rate": 0.01, "loss": 4.686312675476074, "num_input_tokens_seen": 1585104, "step": 399, "train_runtime": 318.8224, "train_tokens_per_second": 4971.746 }, { "epoch": 30.692307692307693, "num_input_tokens_seen": 1585104, "step": 399, "train_accuracy": 0.015625 }, { "epoch": 30.76923076923077, "grad_norm": 1.4996354579925537, "learning_rate": 0.01, "loss": 4.681853294372559, "num_input_tokens_seen": 1589200, "step": 400, "train_runtime": 319.6301, "train_tokens_per_second": 4971.997 }, { "epoch": 30.76923076923077, "eval_CMD_3_branch_eval_accuracy": 0.012296564195298372, "eval_CMD_3_branch_eval_loss": 4.700904369354248, "eval_CMD_3_branch_eval_runtime": 1.1322, "eval_CMD_3_branch_eval_samples_per_second": 2442.191, "eval_CMD_3_branch_eval_steps_per_second": 5.3, "num_input_tokens_seen": 1589200, "step": 400 }, { "epoch": 30.76923076923077, "num_input_tokens_seen": 1589200, "step": 400, "train_accuracy": 0.01171875 }, { "epoch": 30.846153846153847, "grad_norm": 1.5040349960327148, "learning_rate": 0.01, "loss": 4.673392295837402, "num_input_tokens_seen": 1593296, "step": 401, "train_runtime": 321.5745, "train_tokens_per_second": 4954.672 }, { "epoch": 30.846153846153847, "num_input_tokens_seen": 1593296, "step": 401, "train_accuracy": 0.00390625 }, { "epoch": 30.923076923076923, "grad_norm": 1.4539940357208252, "learning_rate": 0.01, "loss": 4.679933547973633, "num_input_tokens_seen": 1597392, "step": 402, "train_runtime": 322.3779, "train_tokens_per_second": 4955.029 }, { "epoch": 30.923076923076923, "num_input_tokens_seen": 1597392, "step": 402, "train_accuracy": 0.02280130237340927 }, { "epoch": 31.0, "grad_norm": 2.374574899673462, "learning_rate": 0.01, "loss": 4.776401042938232, "num_input_tokens_seen": 1599848, "step": 403, "train_runtime": 322.8894, "train_tokens_per_second": 4954.787 }, { "epoch": 31.0, "num_input_tokens_seen": 1599848, "step": 403, "train_accuracy": 0.01171875 }, { "epoch": 31.076923076923077, "grad_norm": 1.6019138097763062, "learning_rate": 0.01, "loss": 4.754836082458496, "num_input_tokens_seen": 1603944, "step": 404, "train_runtime": 323.7085, "train_tokens_per_second": 4954.902 }, { "epoch": 31.076923076923077, "num_input_tokens_seen": 1603944, "step": 404, "train_accuracy": 0.01171875 }, { "epoch": 31.153846153846153, "grad_norm": 1.9657342433929443, "learning_rate": 0.01, "loss": 4.811908721923828, "num_input_tokens_seen": 1608040, "step": 405, "train_runtime": 324.516, "train_tokens_per_second": 4955.194 }, { "epoch": 31.153846153846153, "num_input_tokens_seen": 1608040, "step": 405, "train_accuracy": 0.015625 }, { "epoch": 31.23076923076923, "grad_norm": 1.391027569770813, "learning_rate": 0.01, "loss": 4.7307233810424805, "num_input_tokens_seen": 1612136, "step": 406, "train_runtime": 325.3232, "train_tokens_per_second": 4955.49 }, { "epoch": 31.23076923076923, "num_input_tokens_seen": 1612136, "step": 406, "train_accuracy": 0.013671875 }, { "epoch": 31.307692307692307, "grad_norm": 2.3124053478240967, "learning_rate": 0.01, "loss": 4.804024696350098, "num_input_tokens_seen": 1616232, "step": 407, "train_runtime": 326.1304, "train_tokens_per_second": 4955.785 }, { "epoch": 31.307692307692307, "num_input_tokens_seen": 1616232, "step": 407, "train_accuracy": 0.009765625 }, { "epoch": 31.384615384615383, "grad_norm": 2.326469898223877, "learning_rate": 0.01, "loss": 4.806546211242676, "num_input_tokens_seen": 1620328, "step": 408, "train_runtime": 326.937, "train_tokens_per_second": 4956.086 }, { "epoch": 31.384615384615383, "num_input_tokens_seen": 1620328, "step": 408, "train_accuracy": 0.009765625 }, { "epoch": 31.46153846153846, "grad_norm": 2.2424123287200928, "learning_rate": 0.01, "loss": 4.892226219177246, "num_input_tokens_seen": 1624424, "step": 409, "train_runtime": 327.744, "train_tokens_per_second": 4956.38 }, { "epoch": 31.46153846153846, "num_input_tokens_seen": 1624424, "step": 409, "train_accuracy": 0.01171875 }, { "epoch": 31.53846153846154, "grad_norm": 2.089282274246216, "learning_rate": 0.01, "loss": 4.813840389251709, "num_input_tokens_seen": 1628520, "step": 410, "train_runtime": 328.5515, "train_tokens_per_second": 4956.666 }, { "epoch": 31.53846153846154, "num_input_tokens_seen": 1628520, "step": 410, "train_accuracy": 0.015625 }, { "epoch": 31.615384615384617, "grad_norm": 1.866958498954773, "learning_rate": 0.01, "loss": 4.844282627105713, "num_input_tokens_seen": 1632616, "step": 411, "train_runtime": 329.3581, "train_tokens_per_second": 4956.963 }, { "epoch": 31.615384615384617, "num_input_tokens_seen": 1632616, "step": 411, "train_accuracy": 0.01171875 }, { "epoch": 31.692307692307693, "grad_norm": 1.9325016736984253, "learning_rate": 0.01, "loss": 4.847882270812988, "num_input_tokens_seen": 1636712, "step": 412, "train_runtime": 330.1656, "train_tokens_per_second": 4957.245 }, { "epoch": 31.692307692307693, "num_input_tokens_seen": 1636712, "step": 412, "train_accuracy": 0.01953125 }, { "epoch": 31.76923076923077, "grad_norm": 1.4464740753173828, "learning_rate": 0.01, "loss": 4.749690055847168, "num_input_tokens_seen": 1640808, "step": 413, "train_runtime": 330.9725, "train_tokens_per_second": 4957.535 }, { "epoch": 31.76923076923077, "num_input_tokens_seen": 1640808, "step": 413, "train_accuracy": 0.0078125 }, { "epoch": 31.846153846153847, "grad_norm": 2.3502817153930664, "learning_rate": 0.01, "loss": 4.873184680938721, "num_input_tokens_seen": 1644904, "step": 414, "train_runtime": 331.7801, "train_tokens_per_second": 4957.814 }, { "epoch": 31.846153846153847, "num_input_tokens_seen": 1644904, "step": 414, "train_accuracy": 0.01171875 }, { "epoch": 31.923076923076923, "grad_norm": 2.0078091621398926, "learning_rate": 0.01, "loss": 4.7482452392578125, "num_input_tokens_seen": 1649000, "step": 415, "train_runtime": 332.5832, "train_tokens_per_second": 4958.157 }, { "epoch": 31.923076923076923, "num_input_tokens_seen": 1649000, "step": 415, "train_accuracy": 0.016286645084619522 }, { "epoch": 32.0, "grad_norm": 1.5769764184951782, "learning_rate": 0.01, "loss": 4.71989107131958, "num_input_tokens_seen": 1651456, "step": 416, "train_runtime": 333.0955, "train_tokens_per_second": 4957.906 }, { "epoch": 32.0, "num_input_tokens_seen": 1651456, "step": 416, "train_accuracy": 0.01171875 }, { "epoch": 32.07692307692308, "grad_norm": 2.7645392417907715, "learning_rate": 0.01, "loss": 4.84213924407959, "num_input_tokens_seen": 1655552, "step": 417, "train_runtime": 333.9141, "train_tokens_per_second": 4958.018 }, { "epoch": 32.07692307692308, "num_input_tokens_seen": 1655552, "step": 417, "train_accuracy": 0.009765625 }, { "epoch": 32.15384615384615, "grad_norm": 2.3278844356536865, "learning_rate": 0.01, "loss": 4.811976432800293, "num_input_tokens_seen": 1659648, "step": 418, "train_runtime": 334.722, "train_tokens_per_second": 4958.288 }, { "epoch": 32.15384615384615, "num_input_tokens_seen": 1659648, "step": 418, "train_accuracy": 0.017578125 }, { "epoch": 32.23076923076923, "grad_norm": 2.2258729934692383, "learning_rate": 0.01, "loss": 4.932866096496582, "num_input_tokens_seen": 1663744, "step": 419, "train_runtime": 335.5293, "train_tokens_per_second": 4958.565 }, { "epoch": 32.23076923076923, "num_input_tokens_seen": 1663744, "step": 419, "train_accuracy": 0.001953125 }, { "epoch": 32.30769230769231, "grad_norm": 2.404165506362915, "learning_rate": 0.01, "loss": 4.878048896789551, "num_input_tokens_seen": 1667840, "step": 420, "train_runtime": 336.3359, "train_tokens_per_second": 4958.852 }, { "epoch": 32.30769230769231, "num_input_tokens_seen": 1667840, "step": 420, "train_accuracy": 0.013671875 }, { "epoch": 32.38461538461539, "grad_norm": 2.28906512260437, "learning_rate": 0.01, "loss": 4.84922456741333, "num_input_tokens_seen": 1671936, "step": 421, "train_runtime": 337.1433, "train_tokens_per_second": 4959.125 }, { "epoch": 32.38461538461539, "num_input_tokens_seen": 1671936, "step": 421, "train_accuracy": 0.013671875 }, { "epoch": 32.46153846153846, "grad_norm": 2.0048649311065674, "learning_rate": 0.01, "loss": 4.9027628898620605, "num_input_tokens_seen": 1676032, "step": 422, "train_runtime": 337.9517, "train_tokens_per_second": 4959.384 }, { "epoch": 32.46153846153846, "num_input_tokens_seen": 1676032, "step": 422, "train_accuracy": 0.01953125 }, { "epoch": 32.53846153846154, "grad_norm": 2.3459694385528564, "learning_rate": 0.01, "loss": 4.852118492126465, "num_input_tokens_seen": 1680128, "step": 423, "train_runtime": 338.7586, "train_tokens_per_second": 4959.661 }, { "epoch": 32.53846153846154, "num_input_tokens_seen": 1680128, "step": 423, "train_accuracy": 0.009765625 }, { "epoch": 32.61538461538461, "grad_norm": 1.5540844202041626, "learning_rate": 0.01, "loss": 4.792023181915283, "num_input_tokens_seen": 1684224, "step": 424, "train_runtime": 339.566, "train_tokens_per_second": 4959.931 }, { "epoch": 32.61538461538461, "num_input_tokens_seen": 1684224, "step": 424, "train_accuracy": 0.0078125 }, { "epoch": 32.69230769230769, "grad_norm": 1.9204732179641724, "learning_rate": 0.01, "loss": 4.947464942932129, "num_input_tokens_seen": 1688320, "step": 425, "train_runtime": 340.3738, "train_tokens_per_second": 4960.194 }, { "epoch": 32.69230769230769, "num_input_tokens_seen": 1688320, "step": 425, "train_accuracy": 0.013671875 }, { "epoch": 32.76923076923077, "grad_norm": 1.775728702545166, "learning_rate": 0.01, "loss": 4.865842819213867, "num_input_tokens_seen": 1692416, "step": 426, "train_runtime": 341.1822, "train_tokens_per_second": 4960.446 }, { "epoch": 32.76923076923077, "num_input_tokens_seen": 1692416, "step": 426, "train_accuracy": 0.005859375 }, { "epoch": 32.84615384615385, "grad_norm": 1.7166199684143066, "learning_rate": 0.01, "loss": 4.792997360229492, "num_input_tokens_seen": 1696512, "step": 427, "train_runtime": 341.9897, "train_tokens_per_second": 4960.711 }, { "epoch": 32.84615384615385, "num_input_tokens_seen": 1696512, "step": 427, "train_accuracy": 0.0078125 }, { "epoch": 32.92307692307692, "grad_norm": 1.7444908618927002, "learning_rate": 0.01, "loss": 4.791705131530762, "num_input_tokens_seen": 1700608, "step": 428, "train_runtime": 342.7927, "train_tokens_per_second": 4961.04 }, { "epoch": 32.92307692307692, "num_input_tokens_seen": 1700608, "step": 428, "train_accuracy": 0.009771986864507198 }, { "epoch": 33.0, "grad_norm": 2.254854679107666, "learning_rate": 0.01, "loss": 4.896081924438477, "num_input_tokens_seen": 1703064, "step": 429, "train_runtime": 343.3042, "train_tokens_per_second": 4960.802 }, { "epoch": 33.0, "num_input_tokens_seen": 1703064, "step": 429, "train_accuracy": 0.009765625 }, { "epoch": 33.07692307692308, "grad_norm": 2.067108392715454, "learning_rate": 0.01, "loss": 4.808799743652344, "num_input_tokens_seen": 1707160, "step": 430, "train_runtime": 344.1245, "train_tokens_per_second": 4960.879 }, { "epoch": 33.07692307692308, "num_input_tokens_seen": 1707160, "step": 430, "train_accuracy": 0.009765625 }, { "epoch": 33.15384615384615, "grad_norm": 1.6360903978347778, "learning_rate": 0.01, "loss": 4.740631103515625, "num_input_tokens_seen": 1711256, "step": 431, "train_runtime": 344.9322, "train_tokens_per_second": 4961.137 }, { "epoch": 33.15384615384615, "num_input_tokens_seen": 1711256, "step": 431, "train_accuracy": 0.009765625 }, { "epoch": 33.23076923076923, "grad_norm": 1.8674015998840332, "learning_rate": 0.01, "loss": 4.924413681030273, "num_input_tokens_seen": 1715352, "step": 432, "train_runtime": 345.7395, "train_tokens_per_second": 4961.4 }, { "epoch": 33.23076923076923, "num_input_tokens_seen": 1715352, "step": 432, "train_accuracy": 0.01171875 }, { "epoch": 33.30769230769231, "grad_norm": 2.4183735847473145, "learning_rate": 0.01, "loss": 4.848052978515625, "num_input_tokens_seen": 1719448, "step": 433, "train_runtime": 346.5476, "train_tokens_per_second": 4961.65 }, { "epoch": 33.30769230769231, "num_input_tokens_seen": 1719448, "step": 433, "train_accuracy": 0.013671875 }, { "epoch": 33.38461538461539, "grad_norm": 2.2434303760528564, "learning_rate": 0.01, "loss": 4.9350810050964355, "num_input_tokens_seen": 1723544, "step": 434, "train_runtime": 347.3551, "train_tokens_per_second": 4961.908 }, { "epoch": 33.38461538461539, "num_input_tokens_seen": 1723544, "step": 434, "train_accuracy": 0.013671875 }, { "epoch": 33.46153846153846, "grad_norm": 1.9384300708770752, "learning_rate": 0.01, "loss": 4.879378795623779, "num_input_tokens_seen": 1727640, "step": 435, "train_runtime": 348.1631, "train_tokens_per_second": 4962.157 }, { "epoch": 33.46153846153846, "num_input_tokens_seen": 1727640, "step": 435, "train_accuracy": 0.015625 }, { "epoch": 33.53846153846154, "grad_norm": 2.2234044075012207, "learning_rate": 0.01, "loss": 4.843637466430664, "num_input_tokens_seen": 1731736, "step": 436, "train_runtime": 348.9708, "train_tokens_per_second": 4962.409 }, { "epoch": 33.53846153846154, "num_input_tokens_seen": 1731736, "step": 436, "train_accuracy": 0.01171875 }, { "epoch": 33.61538461538461, "grad_norm": 1.8920512199401855, "learning_rate": 0.01, "loss": 4.816337585449219, "num_input_tokens_seen": 1735832, "step": 437, "train_runtime": 349.7787, "train_tokens_per_second": 4962.658 }, { "epoch": 33.61538461538461, "num_input_tokens_seen": 1735832, "step": 437, "train_accuracy": 0.005859375 }, { "epoch": 33.69230769230769, "grad_norm": 1.9466722011566162, "learning_rate": 0.01, "loss": 4.822091102600098, "num_input_tokens_seen": 1739928, "step": 438, "train_runtime": 350.5862, "train_tokens_per_second": 4962.91 }, { "epoch": 33.69230769230769, "num_input_tokens_seen": 1739928, "step": 438, "train_accuracy": 0.013671875 }, { "epoch": 33.76923076923077, "grad_norm": 1.4665552377700806, "learning_rate": 0.01, "loss": 4.728626728057861, "num_input_tokens_seen": 1744024, "step": 439, "train_runtime": 351.3937, "train_tokens_per_second": 4963.163 }, { "epoch": 33.76923076923077, "num_input_tokens_seen": 1744024, "step": 439, "train_accuracy": 0.001953125 }, { "epoch": 33.84615384615385, "grad_norm": 1.747174859046936, "learning_rate": 0.01, "loss": 4.873631954193115, "num_input_tokens_seen": 1748120, "step": 440, "train_runtime": 352.2015, "train_tokens_per_second": 4963.409 }, { "epoch": 33.84615384615385, "num_input_tokens_seen": 1748120, "step": 440, "train_accuracy": 0.009765625 }, { "epoch": 33.92307692307692, "grad_norm": 1.3376929759979248, "learning_rate": 0.01, "loss": 4.754631042480469, "num_input_tokens_seen": 1752216, "step": 441, "train_runtime": 353.0056, "train_tokens_per_second": 4963.706 }, { "epoch": 33.92307692307692, "num_input_tokens_seen": 1752216, "step": 441, "train_accuracy": 0.0065146577544510365 }, { "epoch": 34.0, "grad_norm": 1.7214449644088745, "learning_rate": 0.01, "loss": 4.764516830444336, "num_input_tokens_seen": 1754672, "step": 442, "train_runtime": 353.5181, "train_tokens_per_second": 4963.457 }, { "epoch": 34.0, "num_input_tokens_seen": 1754672, "step": 442, "train_accuracy": 0.005859375 }, { "epoch": 34.07692307692308, "grad_norm": 2.1950595378875732, "learning_rate": 0.01, "loss": 4.860500812530518, "num_input_tokens_seen": 1758768, "step": 443, "train_runtime": 354.3391, "train_tokens_per_second": 4963.516 }, { "epoch": 34.07692307692308, "num_input_tokens_seen": 1758768, "step": 443, "train_accuracy": 0.009765625 }, { "epoch": 34.15384615384615, "grad_norm": 1.5873230695724487, "learning_rate": 0.01, "loss": 4.745871067047119, "num_input_tokens_seen": 1762864, "step": 444, "train_runtime": 355.1524, "train_tokens_per_second": 4963.684 }, { "epoch": 34.15384615384615, "num_input_tokens_seen": 1762864, "step": 444, "train_accuracy": 0.013671875 }, { "epoch": 34.23076923076923, "grad_norm": 1.554171085357666, "learning_rate": 0.01, "loss": 4.714781761169434, "num_input_tokens_seen": 1766960, "step": 445, "train_runtime": 355.9674, "train_tokens_per_second": 4963.826 }, { "epoch": 34.23076923076923, "num_input_tokens_seen": 1766960, "step": 445, "train_accuracy": 0.013671875 }, { "epoch": 34.30769230769231, "grad_norm": 1.4377801418304443, "learning_rate": 0.01, "loss": 4.710833549499512, "num_input_tokens_seen": 1771056, "step": 446, "train_runtime": 356.7789, "train_tokens_per_second": 4964.016 }, { "epoch": 34.30769230769231, "num_input_tokens_seen": 1771056, "step": 446, "train_accuracy": 0.015625 }, { "epoch": 34.38461538461539, "grad_norm": 1.4280403852462769, "learning_rate": 0.01, "loss": 4.760910987854004, "num_input_tokens_seen": 1775152, "step": 447, "train_runtime": 357.5907, "train_tokens_per_second": 4964.2 }, { "epoch": 34.38461538461539, "num_input_tokens_seen": 1775152, "step": 447, "train_accuracy": 0.021484375 }, { "epoch": 34.46153846153846, "grad_norm": 1.4387681484222412, "learning_rate": 0.01, "loss": 4.687384128570557, "num_input_tokens_seen": 1779248, "step": 448, "train_runtime": 358.4009, "train_tokens_per_second": 4964.407 }, { "epoch": 34.46153846153846, "num_input_tokens_seen": 1779248, "step": 448, "train_accuracy": 0.01171875 }, { "epoch": 34.53846153846154, "grad_norm": 1.6570788621902466, "learning_rate": 0.01, "loss": 4.7208967208862305, "num_input_tokens_seen": 1783344, "step": 449, "train_runtime": 359.2105, "train_tokens_per_second": 4964.621 }, { "epoch": 34.53846153846154, "num_input_tokens_seen": 1783344, "step": 449, "train_accuracy": 0.013671875 }, { "epoch": 34.61538461538461, "grad_norm": 1.4104818105697632, "learning_rate": 0.01, "loss": 4.730859279632568, "num_input_tokens_seen": 1787440, "step": 450, "train_runtime": 360.0197, "train_tokens_per_second": 4964.839 }, { "epoch": 34.61538461538461, "num_input_tokens_seen": 1787440, "step": 450, "train_accuracy": 0.013671875 }, { "epoch": 34.69230769230769, "grad_norm": 1.1465097665786743, "learning_rate": 0.01, "loss": 4.663358688354492, "num_input_tokens_seen": 1791536, "step": 451, "train_runtime": 360.8301, "train_tokens_per_second": 4965.04 }, { "epoch": 34.69230769230769, "num_input_tokens_seen": 1791536, "step": 451, "train_accuracy": 0.02734375 }, { "epoch": 34.76923076923077, "grad_norm": 1.5145927667617798, "learning_rate": 0.01, "loss": 4.749174118041992, "num_input_tokens_seen": 1795632, "step": 452, "train_runtime": 361.6427, "train_tokens_per_second": 4965.21 }, { "epoch": 34.76923076923077, "num_input_tokens_seen": 1795632, "step": 452, "train_accuracy": 0.01953125 }, { "epoch": 34.84615384615385, "grad_norm": 1.3290702104568481, "learning_rate": 0.01, "loss": 4.6947760581970215, "num_input_tokens_seen": 1799728, "step": 453, "train_runtime": 362.4524, "train_tokens_per_second": 4965.419 }, { "epoch": 34.84615384615385, "num_input_tokens_seen": 1799728, "step": 453, "train_accuracy": 0.01171875 }, { "epoch": 34.92307692307692, "grad_norm": 1.7186955213546753, "learning_rate": 0.01, "loss": 4.8016767501831055, "num_input_tokens_seen": 1803824, "step": 454, "train_runtime": 363.2566, "train_tokens_per_second": 4965.702 }, { "epoch": 34.92307692307692, "num_input_tokens_seen": 1803824, "step": 454, "train_accuracy": 0.0065146577544510365 }, { "epoch": 35.0, "grad_norm": 2.8009908199310303, "learning_rate": 0.01, "loss": 4.814508438110352, "num_input_tokens_seen": 1806280, "step": 455, "train_runtime": 363.7689, "train_tokens_per_second": 4965.461 }, { "epoch": 35.0, "num_input_tokens_seen": 1806280, "step": 455, "train_accuracy": 0.01171875 }, { "epoch": 35.07692307692308, "grad_norm": 2.6078543663024902, "learning_rate": 0.01, "loss": 4.882625579833984, "num_input_tokens_seen": 1810376, "step": 456, "train_runtime": 364.5894, "train_tokens_per_second": 4965.521 }, { "epoch": 35.07692307692308, "num_input_tokens_seen": 1810376, "step": 456, "train_accuracy": 0.0078125 }, { "epoch": 35.15384615384615, "grad_norm": 1.9776579141616821, "learning_rate": 0.01, "loss": 4.89740514755249, "num_input_tokens_seen": 1814472, "step": 457, "train_runtime": 365.3969, "train_tokens_per_second": 4965.757 }, { "epoch": 35.15384615384615, "num_input_tokens_seen": 1814472, "step": 457, "train_accuracy": 0.009765625 }, { "epoch": 35.23076923076923, "grad_norm": 1.7558856010437012, "learning_rate": 0.01, "loss": 4.8707356452941895, "num_input_tokens_seen": 1818568, "step": 458, "train_runtime": 366.2051, "train_tokens_per_second": 4965.982 }, { "epoch": 35.23076923076923, "num_input_tokens_seen": 1818568, "step": 458, "train_accuracy": 0.01953125 }, { "epoch": 35.30769230769231, "grad_norm": 1.9807605743408203, "learning_rate": 0.01, "loss": 4.846177101135254, "num_input_tokens_seen": 1822664, "step": 459, "train_runtime": 367.0126, "train_tokens_per_second": 4966.216 }, { "epoch": 35.30769230769231, "num_input_tokens_seen": 1822664, "step": 459, "train_accuracy": 0.00390625 }, { "epoch": 35.38461538461539, "grad_norm": 1.7133845090866089, "learning_rate": 0.01, "loss": 4.851652145385742, "num_input_tokens_seen": 1826760, "step": 460, "train_runtime": 367.8202, "train_tokens_per_second": 4966.449 }, { "epoch": 35.38461538461539, "num_input_tokens_seen": 1826760, "step": 460, "train_accuracy": 0.0078125 }, { "epoch": 35.46153846153846, "grad_norm": 1.8392632007598877, "learning_rate": 0.01, "loss": 4.925780296325684, "num_input_tokens_seen": 1830856, "step": 461, "train_runtime": 368.6273, "train_tokens_per_second": 4966.686 }, { "epoch": 35.46153846153846, "num_input_tokens_seen": 1830856, "step": 461, "train_accuracy": 0.005859375 }, { "epoch": 35.53846153846154, "grad_norm": 2.557321786880493, "learning_rate": 0.01, "loss": 4.94730281829834, "num_input_tokens_seen": 1834952, "step": 462, "train_runtime": 369.4351, "train_tokens_per_second": 4966.913 }, { "epoch": 35.53846153846154, "num_input_tokens_seen": 1834952, "step": 462, "train_accuracy": 0.009765625 }, { "epoch": 35.61538461538461, "grad_norm": 1.7267029285430908, "learning_rate": 0.01, "loss": 4.850793361663818, "num_input_tokens_seen": 1839048, "step": 463, "train_runtime": 370.2429, "train_tokens_per_second": 4967.139 }, { "epoch": 35.61538461538461, "num_input_tokens_seen": 1839048, "step": 463, "train_accuracy": 0.005859375 }, { "epoch": 35.69230769230769, "grad_norm": 1.9380431175231934, "learning_rate": 0.01, "loss": 4.896787643432617, "num_input_tokens_seen": 1843144, "step": 464, "train_runtime": 371.05, "train_tokens_per_second": 4967.373 }, { "epoch": 35.69230769230769, "num_input_tokens_seen": 1843144, "step": 464, "train_accuracy": 0.009765625 }, { "epoch": 35.76923076923077, "grad_norm": 1.9114341735839844, "learning_rate": 0.01, "loss": 4.811819076538086, "num_input_tokens_seen": 1847240, "step": 465, "train_runtime": 371.8608, "train_tokens_per_second": 4967.558 }, { "epoch": 35.76923076923077, "num_input_tokens_seen": 1847240, "step": 465, "train_accuracy": 0.009765625 }, { "epoch": 35.84615384615385, "grad_norm": 1.5461879968643188, "learning_rate": 0.01, "loss": 4.788661003112793, "num_input_tokens_seen": 1851336, "step": 466, "train_runtime": 372.6691, "train_tokens_per_second": 4967.775 }, { "epoch": 35.84615384615385, "num_input_tokens_seen": 1851336, "step": 466, "train_accuracy": 0.013671875 }, { "epoch": 35.92307692307692, "grad_norm": 2.167442560195923, "learning_rate": 0.01, "loss": 4.931826114654541, "num_input_tokens_seen": 1855432, "step": 467, "train_runtime": 373.4723, "train_tokens_per_second": 4968.059 }, { "epoch": 35.92307692307692, "num_input_tokens_seen": 1855432, "step": 467, "train_accuracy": 0.0065146577544510365 }, { "epoch": 36.0, "grad_norm": 1.7010177373886108, "learning_rate": 0.01, "loss": 4.761315822601318, "num_input_tokens_seen": 1857888, "step": 468, "train_runtime": 373.9844, "train_tokens_per_second": 4967.822 }, { "epoch": 36.0, "num_input_tokens_seen": 1857888, "step": 468, "train_accuracy": 0.00390625 }, { "epoch": 36.07692307692308, "grad_norm": 1.7015635967254639, "learning_rate": 0.01, "loss": 4.743702411651611, "num_input_tokens_seen": 1861984, "step": 469, "train_runtime": 374.8036, "train_tokens_per_second": 4967.893 }, { "epoch": 36.07692307692308, "num_input_tokens_seen": 1861984, "step": 469, "train_accuracy": 0.009765625 }, { "epoch": 36.15384615384615, "grad_norm": 1.6663355827331543, "learning_rate": 0.01, "loss": 4.780470371246338, "num_input_tokens_seen": 1866080, "step": 470, "train_runtime": 375.6103, "train_tokens_per_second": 4968.128 }, { "epoch": 36.15384615384615, "num_input_tokens_seen": 1866080, "step": 470, "train_accuracy": 0.013671875 }, { "epoch": 36.23076923076923, "grad_norm": 1.3687386512756348, "learning_rate": 0.01, "loss": 4.7952775955200195, "num_input_tokens_seen": 1870176, "step": 471, "train_runtime": 376.4165, "train_tokens_per_second": 4968.369 }, { "epoch": 36.23076923076923, "num_input_tokens_seen": 1870176, "step": 471, "train_accuracy": 0.015625 }, { "epoch": 36.30769230769231, "grad_norm": 2.32875657081604, "learning_rate": 0.01, "loss": 4.8694915771484375, "num_input_tokens_seen": 1874272, "step": 472, "train_runtime": 377.2236, "train_tokens_per_second": 4968.596 }, { "epoch": 36.30769230769231, "num_input_tokens_seen": 1874272, "step": 472, "train_accuracy": 0.009765625 }, { "epoch": 36.38461538461539, "grad_norm": 1.7562257051467896, "learning_rate": 0.01, "loss": 4.7543625831604, "num_input_tokens_seen": 1878368, "step": 473, "train_runtime": 378.03, "train_tokens_per_second": 4968.834 }, { "epoch": 36.38461538461539, "num_input_tokens_seen": 1878368, "step": 473, "train_accuracy": 0.01171875 }, { "epoch": 36.46153846153846, "grad_norm": 2.138751745223999, "learning_rate": 0.01, "loss": 4.800985336303711, "num_input_tokens_seen": 1882464, "step": 474, "train_runtime": 378.8384, "train_tokens_per_second": 4969.043 }, { "epoch": 36.46153846153846, "num_input_tokens_seen": 1882464, "step": 474, "train_accuracy": 0.00390625 }, { "epoch": 36.53846153846154, "grad_norm": 2.6692943572998047, "learning_rate": 0.01, "loss": 4.881521224975586, "num_input_tokens_seen": 1886560, "step": 475, "train_runtime": 379.6465, "train_tokens_per_second": 4969.255 }, { "epoch": 36.53846153846154, "num_input_tokens_seen": 1886560, "step": 475, "train_accuracy": 0.013671875 }, { "epoch": 36.61538461538461, "grad_norm": 1.1861162185668945, "learning_rate": 0.01, "loss": 4.710395336151123, "num_input_tokens_seen": 1890656, "step": 476, "train_runtime": 380.4533, "train_tokens_per_second": 4969.482 }, { "epoch": 36.61538461538461, "num_input_tokens_seen": 1890656, "step": 476, "train_accuracy": 0.00390625 }, { "epoch": 36.69230769230769, "grad_norm": 2.5071468353271484, "learning_rate": 0.01, "loss": 4.834889888763428, "num_input_tokens_seen": 1894752, "step": 477, "train_runtime": 381.2616, "train_tokens_per_second": 4969.69 }, { "epoch": 36.69230769230769, "num_input_tokens_seen": 1894752, "step": 477, "train_accuracy": 0.01171875 }, { "epoch": 36.76923076923077, "grad_norm": 1.7427690029144287, "learning_rate": 0.01, "loss": 4.781068325042725, "num_input_tokens_seen": 1898848, "step": 478, "train_runtime": 382.0678, "train_tokens_per_second": 4969.924 }, { "epoch": 36.76923076923077, "num_input_tokens_seen": 1898848, "step": 478, "train_accuracy": 0.0078125 }, { "epoch": 36.84615384615385, "grad_norm": 1.5795429944992065, "learning_rate": 0.01, "loss": 4.755626678466797, "num_input_tokens_seen": 1902944, "step": 479, "train_runtime": 382.8745, "train_tokens_per_second": 4970.151 }, { "epoch": 36.84615384615385, "num_input_tokens_seen": 1902944, "step": 479, "train_accuracy": 0.013671875 }, { "epoch": 36.92307692307692, "grad_norm": 1.9554100036621094, "learning_rate": 0.01, "loss": 4.753540515899658, "num_input_tokens_seen": 1907040, "step": 480, "train_runtime": 383.676, "train_tokens_per_second": 4970.444 }, { "epoch": 36.92307692307692, "num_input_tokens_seen": 1907040, "step": 480, "train_accuracy": 0.009771986864507198 }, { "epoch": 37.0, "grad_norm": 1.7874726057052612, "learning_rate": 0.01, "loss": 4.8236589431762695, "num_input_tokens_seen": 1909496, "step": 481, "train_runtime": 384.1885, "train_tokens_per_second": 4970.207 }, { "epoch": 37.0, "num_input_tokens_seen": 1909496, "step": 481, "train_accuracy": 0.0078125 }, { "epoch": 37.07692307692308, "grad_norm": 1.234984040260315, "learning_rate": 0.01, "loss": 4.683443069458008, "num_input_tokens_seen": 1913592, "step": 482, "train_runtime": 385.0094, "train_tokens_per_second": 4970.247 }, { "epoch": 37.07692307692308, "num_input_tokens_seen": 1913592, "step": 482, "train_accuracy": 0.00390625 }, { "epoch": 37.15384615384615, "grad_norm": 1.6579338312149048, "learning_rate": 0.01, "loss": 4.802212715148926, "num_input_tokens_seen": 1917688, "step": 483, "train_runtime": 385.816, "train_tokens_per_second": 4970.473 }, { "epoch": 37.15384615384615, "num_input_tokens_seen": 1917688, "step": 483, "train_accuracy": 0.0078125 }, { "epoch": 37.23076923076923, "grad_norm": 1.476696491241455, "learning_rate": 0.01, "loss": 4.762943744659424, "num_input_tokens_seen": 1921784, "step": 484, "train_runtime": 386.6225, "train_tokens_per_second": 4970.699 }, { "epoch": 37.23076923076923, "num_input_tokens_seen": 1921784, "step": 484, "train_accuracy": 0.009765625 }, { "epoch": 37.30769230769231, "grad_norm": 1.6325160264968872, "learning_rate": 0.01, "loss": 4.768425941467285, "num_input_tokens_seen": 1925880, "step": 485, "train_runtime": 387.4303, "train_tokens_per_second": 4970.908 }, { "epoch": 37.30769230769231, "num_input_tokens_seen": 1925880, "step": 485, "train_accuracy": 0.01171875 }, { "epoch": 37.38461538461539, "grad_norm": 1.5507967472076416, "learning_rate": 0.01, "loss": 4.717211723327637, "num_input_tokens_seen": 1929976, "step": 486, "train_runtime": 388.2393, "train_tokens_per_second": 4971.099 }, { "epoch": 37.38461538461539, "num_input_tokens_seen": 1929976, "step": 486, "train_accuracy": 0.005859375 }, { "epoch": 37.46153846153846, "grad_norm": 1.1237963438034058, "learning_rate": 0.01, "loss": 4.721593856811523, "num_input_tokens_seen": 1934072, "step": 487, "train_runtime": 389.0462, "train_tokens_per_second": 4971.317 }, { "epoch": 37.46153846153846, "num_input_tokens_seen": 1934072, "step": 487, "train_accuracy": 0.0078125 }, { "epoch": 37.53846153846154, "grad_norm": 1.5940783023834229, "learning_rate": 0.01, "loss": 4.7369537353515625, "num_input_tokens_seen": 1938168, "step": 488, "train_runtime": 389.853, "train_tokens_per_second": 4971.536 }, { "epoch": 37.53846153846154, "num_input_tokens_seen": 1938168, "step": 488, "train_accuracy": 0.009765625 }, { "epoch": 37.61538461538461, "grad_norm": 1.905720591545105, "learning_rate": 0.01, "loss": 4.750986576080322, "num_input_tokens_seen": 1942264, "step": 489, "train_runtime": 390.6602, "train_tokens_per_second": 4971.748 }, { "epoch": 37.61538461538461, "num_input_tokens_seen": 1942264, "step": 489, "train_accuracy": 0.00390625 }, { "epoch": 37.69230769230769, "grad_norm": 1.314231514930725, "learning_rate": 0.01, "loss": 4.731482028961182, "num_input_tokens_seen": 1946360, "step": 490, "train_runtime": 391.4694, "train_tokens_per_second": 4971.934 }, { "epoch": 37.69230769230769, "num_input_tokens_seen": 1946360, "step": 490, "train_accuracy": 0.015625 }, { "epoch": 37.76923076923077, "grad_norm": 1.5926564931869507, "learning_rate": 0.01, "loss": 4.735569000244141, "num_input_tokens_seen": 1950456, "step": 491, "train_runtime": 392.276, "train_tokens_per_second": 4972.152 }, { "epoch": 37.76923076923077, "num_input_tokens_seen": 1950456, "step": 491, "train_accuracy": 0.009765625 }, { "epoch": 37.84615384615385, "grad_norm": 1.6750179529190063, "learning_rate": 0.01, "loss": 4.661894798278809, "num_input_tokens_seen": 1954552, "step": 492, "train_runtime": 393.0829, "train_tokens_per_second": 4972.365 }, { "epoch": 37.84615384615385, "num_input_tokens_seen": 1954552, "step": 492, "train_accuracy": 0.0078125 }, { "epoch": 37.92307692307692, "grad_norm": 0.9824418425559998, "learning_rate": 0.01, "loss": 4.667640209197998, "num_input_tokens_seen": 1958648, "step": 493, "train_runtime": 393.8856, "train_tokens_per_second": 4972.631 }, { "epoch": 37.92307692307692, "num_input_tokens_seen": 1958648, "step": 493, "train_accuracy": 0.009771986864507198 }, { "epoch": 38.0, "grad_norm": 1.2208882570266724, "learning_rate": 0.01, "loss": 4.651348114013672, "num_input_tokens_seen": 1961104, "step": 494, "train_runtime": 394.3967, "train_tokens_per_second": 4972.415 }, { "epoch": 38.0, "num_input_tokens_seen": 1961104, "step": 494, "train_accuracy": 0.025390625 }, { "epoch": 38.07692307692308, "grad_norm": 0.9827911257743835, "learning_rate": 0.01, "loss": 4.64877986907959, "num_input_tokens_seen": 1965200, "step": 495, "train_runtime": 395.2155, "train_tokens_per_second": 4972.477 }, { "epoch": 38.07692307692308, "num_input_tokens_seen": 1965200, "step": 495, "train_accuracy": 0.009765625 }, { "epoch": 38.15384615384615, "grad_norm": 1.0729360580444336, "learning_rate": 0.01, "loss": 4.710212230682373, "num_input_tokens_seen": 1969296, "step": 496, "train_runtime": 396.0229, "train_tokens_per_second": 4972.683 }, { "epoch": 38.15384615384615, "num_input_tokens_seen": 1969296, "step": 496, "train_accuracy": 0.009765625 }, { "epoch": 38.23076923076923, "grad_norm": 1.2178171873092651, "learning_rate": 0.01, "loss": 4.728215217590332, "num_input_tokens_seen": 1973392, "step": 497, "train_runtime": 396.83, "train_tokens_per_second": 4972.89 }, { "epoch": 38.23076923076923, "num_input_tokens_seen": 1973392, "step": 497, "train_accuracy": 0.01171875 }, { "epoch": 38.30769230769231, "grad_norm": 1.2290719747543335, "learning_rate": 0.01, "loss": 4.712850570678711, "num_input_tokens_seen": 1977488, "step": 498, "train_runtime": 397.6383, "train_tokens_per_second": 4973.082 }, { "epoch": 38.30769230769231, "num_input_tokens_seen": 1977488, "step": 498, "train_accuracy": 0.017578125 }, { "epoch": 38.38461538461539, "grad_norm": 1.0520877838134766, "learning_rate": 0.01, "loss": 4.671808242797852, "num_input_tokens_seen": 1981584, "step": 499, "train_runtime": 398.4459, "train_tokens_per_second": 4973.283 }, { "epoch": 38.38461538461539, "num_input_tokens_seen": 1981584, "step": 499, "train_accuracy": 0.005859375 }, { "epoch": 38.46153846153846, "grad_norm": 1.0742777585983276, "learning_rate": 0.01, "loss": 4.665500164031982, "num_input_tokens_seen": 1985680, "step": 500, "train_runtime": 399.253, "train_tokens_per_second": 4973.488 }, { "epoch": 38.46153846153846, "eval_CMD_3_branch_eval_accuracy": 0.00867992766726944, "eval_CMD_3_branch_eval_loss": 4.6620869636535645, "eval_CMD_3_branch_eval_runtime": 1.1323, "eval_CMD_3_branch_eval_samples_per_second": 2441.958, "eval_CMD_3_branch_eval_steps_per_second": 5.299, "num_input_tokens_seen": 1985680, "step": 500 }, { "epoch": 38.46153846153846, "num_input_tokens_seen": 1985680, "step": 500, "train_accuracy": 0.009765625 }, { "epoch": 38.53846153846154, "grad_norm": 0.9039981961250305, "learning_rate": 0.01, "loss": 4.649762153625488, "num_input_tokens_seen": 1989776, "step": 501, "train_runtime": 401.1973, "train_tokens_per_second": 4959.595 }, { "epoch": 38.53846153846154, "num_input_tokens_seen": 1989776, "step": 501, "train_accuracy": 0.0078125 }, { "epoch": 38.61538461538461, "grad_norm": 1.0192108154296875, "learning_rate": 0.01, "loss": 4.667194366455078, "num_input_tokens_seen": 1993872, "step": 502, "train_runtime": 402.005, "train_tokens_per_second": 4959.819 }, { "epoch": 38.61538461538461, "num_input_tokens_seen": 1993872, "step": 502, "train_accuracy": 0.009765625 }, { "epoch": 38.69230769230769, "grad_norm": 0.995784342288971, "learning_rate": 0.01, "loss": 4.644425868988037, "num_input_tokens_seen": 1997968, "step": 503, "train_runtime": 402.813, "train_tokens_per_second": 4960.039 }, { "epoch": 38.69230769230769, "num_input_tokens_seen": 1997968, "step": 503, "train_accuracy": 0.01171875 }, { "epoch": 38.76923076923077, "grad_norm": 1.5907785892486572, "learning_rate": 0.01, "loss": 4.670411109924316, "num_input_tokens_seen": 2002064, "step": 504, "train_runtime": 403.6209, "train_tokens_per_second": 4960.259 }, { "epoch": 38.76923076923077, "num_input_tokens_seen": 2002064, "step": 504, "train_accuracy": 0.005859375 }, { "epoch": 38.84615384615385, "grad_norm": 1.2107726335525513, "learning_rate": 0.01, "loss": 4.697729587554932, "num_input_tokens_seen": 2006160, "step": 505, "train_runtime": 404.4293, "train_tokens_per_second": 4960.472 }, { "epoch": 38.84615384615385, "num_input_tokens_seen": 2006160, "step": 505, "train_accuracy": 0.015625 }, { "epoch": 38.92307692307692, "grad_norm": 1.4739183187484741, "learning_rate": 0.01, "loss": 4.691864013671875, "num_input_tokens_seen": 2010256, "step": 506, "train_runtime": 405.2324, "train_tokens_per_second": 4960.749 }, { "epoch": 38.92307692307692, "num_input_tokens_seen": 2010256, "step": 506, "train_accuracy": 0.0032573288772255182 }, { "epoch": 39.0, "grad_norm": 1.5223695039749146, "learning_rate": 0.01, "loss": 4.641530990600586, "num_input_tokens_seen": 2012712, "step": 507, "train_runtime": 405.7436, "train_tokens_per_second": 4960.551 }, { "epoch": 39.0, "num_input_tokens_seen": 2012712, "step": 507, "train_accuracy": 0.01171875 }, { "epoch": 39.07692307692308, "grad_norm": 1.0190341472625732, "learning_rate": 0.01, "loss": 4.653813362121582, "num_input_tokens_seen": 2016808, "step": 508, "train_runtime": 406.5634, "train_tokens_per_second": 4960.624 }, { "epoch": 39.07692307692308, "num_input_tokens_seen": 2016808, "step": 508, "train_accuracy": 0.009765625 }, { "epoch": 39.15384615384615, "grad_norm": 1.276046633720398, "learning_rate": 0.01, "loss": 4.758627891540527, "num_input_tokens_seen": 2020904, "step": 509, "train_runtime": 407.3709, "train_tokens_per_second": 4960.846 }, { "epoch": 39.15384615384615, "num_input_tokens_seen": 2020904, "step": 509, "train_accuracy": 0.005859375 }, { "epoch": 39.23076923076923, "grad_norm": 1.5082870721817017, "learning_rate": 0.01, "loss": 4.826314926147461, "num_input_tokens_seen": 2025000, "step": 510, "train_runtime": 408.1784, "train_tokens_per_second": 4961.066 }, { "epoch": 39.23076923076923, "num_input_tokens_seen": 2025000, "step": 510, "train_accuracy": 0.015625 }, { "epoch": 39.30769230769231, "grad_norm": 2.431363344192505, "learning_rate": 0.01, "loss": 4.795228481292725, "num_input_tokens_seen": 2029096, "step": 511, "train_runtime": 408.9855, "train_tokens_per_second": 4961.29 }, { "epoch": 39.30769230769231, "num_input_tokens_seen": 2029096, "step": 511, "train_accuracy": 0.01171875 }, { "epoch": 39.38461538461539, "grad_norm": 1.5774593353271484, "learning_rate": 0.01, "loss": 4.711262226104736, "num_input_tokens_seen": 2033192, "step": 512, "train_runtime": 409.7934, "train_tokens_per_second": 4961.505 }, { "epoch": 39.38461538461539, "num_input_tokens_seen": 2033192, "step": 512, "train_accuracy": 0.015625 }, { "epoch": 39.46153846153846, "grad_norm": 1.1461154222488403, "learning_rate": 0.01, "loss": 4.694036483764648, "num_input_tokens_seen": 2037288, "step": 513, "train_runtime": 410.6006, "train_tokens_per_second": 4961.726 }, { "epoch": 39.46153846153846, "num_input_tokens_seen": 2037288, "step": 513, "train_accuracy": 0.0078125 }, { "epoch": 39.53846153846154, "grad_norm": 1.1728637218475342, "learning_rate": 0.01, "loss": 4.677631378173828, "num_input_tokens_seen": 2041384, "step": 514, "train_runtime": 411.4092, "train_tokens_per_second": 4961.931 }, { "epoch": 39.53846153846154, "num_input_tokens_seen": 2041384, "step": 514, "train_accuracy": 0.01171875 }, { "epoch": 39.61538461538461, "grad_norm": 1.4426236152648926, "learning_rate": 0.01, "loss": 4.798910617828369, "num_input_tokens_seen": 2045480, "step": 515, "train_runtime": 412.2165, "train_tokens_per_second": 4962.15 }, { "epoch": 39.61538461538461, "num_input_tokens_seen": 2045480, "step": 515, "train_accuracy": 0.0078125 }, { "epoch": 39.69230769230769, "grad_norm": 1.2468035221099854, "learning_rate": 0.01, "loss": 4.738466262817383, "num_input_tokens_seen": 2049576, "step": 516, "train_runtime": 413.0238, "train_tokens_per_second": 4962.368 }, { "epoch": 39.69230769230769, "num_input_tokens_seen": 2049576, "step": 516, "train_accuracy": 0.00390625 }, { "epoch": 39.76923076923077, "grad_norm": 1.3579516410827637, "learning_rate": 0.01, "loss": 4.817930698394775, "num_input_tokens_seen": 2053672, "step": 517, "train_runtime": 413.8313, "train_tokens_per_second": 4962.582 }, { "epoch": 39.76923076923077, "num_input_tokens_seen": 2053672, "step": 517, "train_accuracy": 0.017578125 }, { "epoch": 39.84615384615385, "grad_norm": 0.9434919953346252, "learning_rate": 0.01, "loss": 4.678544998168945, "num_input_tokens_seen": 2057768, "step": 518, "train_runtime": 414.64, "train_tokens_per_second": 4962.783 }, { "epoch": 39.84615384615385, "num_input_tokens_seen": 2057768, "step": 518, "train_accuracy": 0.01171875 }, { "epoch": 39.92307692307692, "grad_norm": 2.377345323562622, "learning_rate": 0.01, "loss": 4.803607940673828, "num_input_tokens_seen": 2061864, "step": 519, "train_runtime": 415.4435, "train_tokens_per_second": 4963.043 }, { "epoch": 39.92307692307692, "num_input_tokens_seen": 2061864, "step": 519, "train_accuracy": 0.013029315508902073 }, { "epoch": 40.0, "grad_norm": 2.1644632816314697, "learning_rate": 0.01, "loss": 4.861001968383789, "num_input_tokens_seen": 2064320, "step": 520, "train_runtime": 415.9549, "train_tokens_per_second": 4962.846 }, { "epoch": 40.0, "num_input_tokens_seen": 2064320, "step": 520, "train_accuracy": 0.01171875 }, { "epoch": 40.07692307692308, "grad_norm": 1.0956887006759644, "learning_rate": 0.01, "loss": 4.702967643737793, "num_input_tokens_seen": 2068416, "step": 521, "train_runtime": 416.7749, "train_tokens_per_second": 4962.909 }, { "epoch": 40.07692307692308, "num_input_tokens_seen": 2068416, "step": 521, "train_accuracy": 0.01171875 }, { "epoch": 40.15384615384615, "grad_norm": 1.6368201971054077, "learning_rate": 0.01, "loss": 4.762077808380127, "num_input_tokens_seen": 2072512, "step": 522, "train_runtime": 417.5832, "train_tokens_per_second": 4963.111 }, { "epoch": 40.15384615384615, "num_input_tokens_seen": 2072512, "step": 522, "train_accuracy": 0.017578125 }, { "epoch": 40.23076923076923, "grad_norm": 0.9273180365562439, "learning_rate": 0.01, "loss": 4.668511390686035, "num_input_tokens_seen": 2076608, "step": 523, "train_runtime": 418.3917, "train_tokens_per_second": 4963.311 }, { "epoch": 40.23076923076923, "num_input_tokens_seen": 2076608, "step": 523, "train_accuracy": 0.005859375 }, { "epoch": 40.30769230769231, "grad_norm": 1.3700296878814697, "learning_rate": 0.01, "loss": 4.719908237457275, "num_input_tokens_seen": 2080704, "step": 524, "train_runtime": 419.199, "train_tokens_per_second": 4963.523 }, { "epoch": 40.30769230769231, "num_input_tokens_seen": 2080704, "step": 524, "train_accuracy": 0.017578125 }, { "epoch": 40.38461538461539, "grad_norm": 1.2383543252944946, "learning_rate": 0.01, "loss": 4.703868865966797, "num_input_tokens_seen": 2084800, "step": 525, "train_runtime": 420.0067, "train_tokens_per_second": 4963.73 }, { "epoch": 40.38461538461539, "num_input_tokens_seen": 2084800, "step": 525, "train_accuracy": 0.01953125 }, { "epoch": 40.46153846153846, "grad_norm": 0.9167964458465576, "learning_rate": 0.01, "loss": 4.673801422119141, "num_input_tokens_seen": 2088896, "step": 526, "train_runtime": 420.8142, "train_tokens_per_second": 4963.939 }, { "epoch": 40.46153846153846, "num_input_tokens_seen": 2088896, "step": 526, "train_accuracy": 0.013671875 }, { "epoch": 40.53846153846154, "grad_norm": 0.9295412302017212, "learning_rate": 0.01, "loss": 4.700968265533447, "num_input_tokens_seen": 2092992, "step": 527, "train_runtime": 421.6223, "train_tokens_per_second": 4964.14 }, { "epoch": 40.53846153846154, "num_input_tokens_seen": 2092992, "step": 527, "train_accuracy": 0.017578125 }, { "epoch": 40.61538461538461, "grad_norm": 1.023799180984497, "learning_rate": 0.01, "loss": 4.690126895904541, "num_input_tokens_seen": 2097088, "step": 528, "train_runtime": 422.4307, "train_tokens_per_second": 4964.336 }, { "epoch": 40.61538461538461, "num_input_tokens_seen": 2097088, "step": 528, "train_accuracy": 0.01171875 }, { "epoch": 40.69230769230769, "grad_norm": 0.9517922401428223, "learning_rate": 0.01, "loss": 4.7068867683410645, "num_input_tokens_seen": 2101184, "step": 529, "train_runtime": 423.2408, "train_tokens_per_second": 4964.512 }, { "epoch": 40.69230769230769, "num_input_tokens_seen": 2101184, "step": 529, "train_accuracy": 0.01953125 }, { "epoch": 40.76923076923077, "grad_norm": 0.964496910572052, "learning_rate": 0.01, "loss": 4.66574764251709, "num_input_tokens_seen": 2105280, "step": 530, "train_runtime": 424.0499, "train_tokens_per_second": 4964.699 }, { "epoch": 40.76923076923077, "num_input_tokens_seen": 2105280, "step": 530, "train_accuracy": 0.01171875 }, { "epoch": 40.84615384615385, "grad_norm": 0.8690102696418762, "learning_rate": 0.01, "loss": 4.646124839782715, "num_input_tokens_seen": 2109376, "step": 531, "train_runtime": 424.8589, "train_tokens_per_second": 4964.886 }, { "epoch": 40.84615384615385, "num_input_tokens_seen": 2109376, "step": 531, "train_accuracy": 0.0078125 }, { "epoch": 40.92307692307692, "grad_norm": 1.4332140684127808, "learning_rate": 0.01, "loss": 4.696255683898926, "num_input_tokens_seen": 2113472, "step": 532, "train_runtime": 425.6647, "train_tokens_per_second": 4965.11 }, { "epoch": 40.92307692307692, "num_input_tokens_seen": 2113472, "step": 532, "train_accuracy": 0.009771986864507198 }, { "epoch": 41.0, "grad_norm": 1.0811644792556763, "learning_rate": 0.01, "loss": 4.628419399261475, "num_input_tokens_seen": 2115928, "step": 533, "train_runtime": 426.1769, "train_tokens_per_second": 4964.905 }, { "epoch": 41.0, "num_input_tokens_seen": 2115928, "step": 533, "train_accuracy": 0.01953125 }, { "epoch": 41.07692307692308, "grad_norm": 0.9979619383811951, "learning_rate": 0.01, "loss": 4.636567115783691, "num_input_tokens_seen": 2120024, "step": 534, "train_runtime": 426.9968, "train_tokens_per_second": 4964.965 }, { "epoch": 41.07692307692308, "num_input_tokens_seen": 2120024, "step": 534, "train_accuracy": 0.009765625 }, { "epoch": 41.15384615384615, "grad_norm": 1.1204509735107422, "learning_rate": 0.01, "loss": 4.685849189758301, "num_input_tokens_seen": 2124120, "step": 535, "train_runtime": 427.8066, "train_tokens_per_second": 4965.14 }, { "epoch": 41.15384615384615, "num_input_tokens_seen": 2124120, "step": 535, "train_accuracy": 0.009765625 }, { "epoch": 41.23076923076923, "grad_norm": 0.9062981605529785, "learning_rate": 0.01, "loss": 4.69474983215332, "num_input_tokens_seen": 2128216, "step": 536, "train_runtime": 428.6166, "train_tokens_per_second": 4965.314 }, { "epoch": 41.23076923076923, "num_input_tokens_seen": 2128216, "step": 536, "train_accuracy": 0.009765625 }, { "epoch": 41.30769230769231, "grad_norm": 1.2395418882369995, "learning_rate": 0.01, "loss": 4.679404258728027, "num_input_tokens_seen": 2132312, "step": 537, "train_runtime": 429.4268, "train_tokens_per_second": 4965.484 }, { "epoch": 41.30769230769231, "num_input_tokens_seen": 2132312, "step": 537, "train_accuracy": 0.013671875 }, { "epoch": 41.38461538461539, "grad_norm": 1.0222333669662476, "learning_rate": 0.01, "loss": 4.672848701477051, "num_input_tokens_seen": 2136408, "step": 538, "train_runtime": 430.2378, "train_tokens_per_second": 4965.645 }, { "epoch": 41.38461538461539, "num_input_tokens_seen": 2136408, "step": 538, "train_accuracy": 0.009765625 }, { "epoch": 41.46153846153846, "grad_norm": 0.8877430558204651, "learning_rate": 0.01, "loss": 4.6610307693481445, "num_input_tokens_seen": 2140504, "step": 539, "train_runtime": 431.0489, "train_tokens_per_second": 4965.803 }, { "epoch": 41.46153846153846, "num_input_tokens_seen": 2140504, "step": 539, "train_accuracy": 0.005859375 }, { "epoch": 41.53846153846154, "grad_norm": 1.4405112266540527, "learning_rate": 0.01, "loss": 4.744627952575684, "num_input_tokens_seen": 2144600, "step": 540, "train_runtime": 431.86, "train_tokens_per_second": 4965.961 }, { "epoch": 41.53846153846154, "num_input_tokens_seen": 2144600, "step": 540, "train_accuracy": 0.0078125 }, { "epoch": 41.61538461538461, "grad_norm": 1.2398396730422974, "learning_rate": 0.01, "loss": 4.720105171203613, "num_input_tokens_seen": 2148696, "step": 541, "train_runtime": 432.6712, "train_tokens_per_second": 4966.118 }, { "epoch": 41.61538461538461, "num_input_tokens_seen": 2148696, "step": 541, "train_accuracy": 0.005859375 }, { "epoch": 41.69230769230769, "grad_norm": 1.0383821725845337, "learning_rate": 0.01, "loss": 4.685735702514648, "num_input_tokens_seen": 2152792, "step": 542, "train_runtime": 433.481, "train_tokens_per_second": 4966.289 }, { "epoch": 41.69230769230769, "num_input_tokens_seen": 2152792, "step": 542, "train_accuracy": 0.005859375 }, { "epoch": 41.76923076923077, "grad_norm": 1.4199179410934448, "learning_rate": 0.01, "loss": 4.653835296630859, "num_input_tokens_seen": 2156888, "step": 543, "train_runtime": 434.2917, "train_tokens_per_second": 4966.45 }, { "epoch": 41.76923076923077, "num_input_tokens_seen": 2156888, "step": 543, "train_accuracy": 0.00390625 }, { "epoch": 41.84615384615385, "grad_norm": 1.0380232334136963, "learning_rate": 0.01, "loss": 4.687129974365234, "num_input_tokens_seen": 2160984, "step": 544, "train_runtime": 435.1018, "train_tokens_per_second": 4966.617 }, { "epoch": 41.84615384615385, "num_input_tokens_seen": 2160984, "step": 544, "train_accuracy": 0.00390625 }, { "epoch": 41.92307692307692, "grad_norm": 1.3905823230743408, "learning_rate": 0.01, "loss": 4.661175727844238, "num_input_tokens_seen": 2165080, "step": 545, "train_runtime": 435.9083, "train_tokens_per_second": 4966.824 }, { "epoch": 41.92307692307692, "num_input_tokens_seen": 2165080, "step": 545, "train_accuracy": 0.019543973729014397 }, { "epoch": 42.0, "grad_norm": 1.2243058681488037, "learning_rate": 0.01, "loss": 4.706570148468018, "num_input_tokens_seen": 2167536, "step": 546, "train_runtime": 436.4222, "train_tokens_per_second": 4966.603 }, { "epoch": 42.0, "num_input_tokens_seen": 2167536, "step": 546, "train_accuracy": 0.009765625 }, { "epoch": 42.07692307692308, "grad_norm": 1.379681944847107, "learning_rate": 0.01, "loss": 4.6904377937316895, "num_input_tokens_seen": 2171632, "step": 547, "train_runtime": 437.2445, "train_tokens_per_second": 4966.63 }, { "epoch": 42.07692307692308, "num_input_tokens_seen": 2171632, "step": 547, "train_accuracy": 0.015625 }, { "epoch": 42.15384615384615, "grad_norm": 1.0322391986846924, "learning_rate": 0.01, "loss": 4.69384765625, "num_input_tokens_seen": 2175728, "step": 548, "train_runtime": 438.0548, "train_tokens_per_second": 4966.794 }, { "epoch": 42.15384615384615, "num_input_tokens_seen": 2175728, "step": 548, "train_accuracy": 0.015625 }, { "epoch": 42.23076923076923, "grad_norm": 1.4542628526687622, "learning_rate": 0.01, "loss": 4.700136661529541, "num_input_tokens_seen": 2179824, "step": 549, "train_runtime": 438.8669, "train_tokens_per_second": 4966.937 }, { "epoch": 42.23076923076923, "num_input_tokens_seen": 2179824, "step": 549, "train_accuracy": 0.015625 }, { "epoch": 42.30769230769231, "grad_norm": 1.1556236743927002, "learning_rate": 0.01, "loss": 4.677280426025391, "num_input_tokens_seen": 2183920, "step": 550, "train_runtime": 439.677, "train_tokens_per_second": 4967.101 }, { "epoch": 42.30769230769231, "num_input_tokens_seen": 2183920, "step": 550, "train_accuracy": 0.0 }, { "epoch": 42.38461538461539, "grad_norm": 1.9287383556365967, "learning_rate": 0.01, "loss": 4.783945083618164, "num_input_tokens_seen": 2188016, "step": 551, "train_runtime": 440.4864, "train_tokens_per_second": 4967.273 }, { "epoch": 42.38461538461539, "num_input_tokens_seen": 2188016, "step": 551, "train_accuracy": 0.001953125 }, { "epoch": 42.46153846153846, "grad_norm": 2.0787062644958496, "learning_rate": 0.01, "loss": 4.8121337890625, "num_input_tokens_seen": 2192112, "step": 552, "train_runtime": 441.2953, "train_tokens_per_second": 4967.45 }, { "epoch": 42.46153846153846, "num_input_tokens_seen": 2192112, "step": 552, "train_accuracy": 0.005859375 }, { "epoch": 42.53846153846154, "grad_norm": 0.8324519991874695, "learning_rate": 0.01, "loss": 4.6436543464660645, "num_input_tokens_seen": 2196208, "step": 553, "train_runtime": 442.1041, "train_tokens_per_second": 4967.627 }, { "epoch": 42.53846153846154, "num_input_tokens_seen": 2196208, "step": 553, "train_accuracy": 0.0078125 }, { "epoch": 42.61538461538461, "grad_norm": 1.7577073574066162, "learning_rate": 0.01, "loss": 4.760754585266113, "num_input_tokens_seen": 2200304, "step": 554, "train_runtime": 442.9132, "train_tokens_per_second": 4967.8 }, { "epoch": 42.61538461538461, "num_input_tokens_seen": 2200304, "step": 554, "train_accuracy": 0.00390625 }, { "epoch": 42.69230769230769, "grad_norm": 0.9620968699455261, "learning_rate": 0.01, "loss": 4.675868034362793, "num_input_tokens_seen": 2204400, "step": 555, "train_runtime": 443.7235, "train_tokens_per_second": 4967.958 }, { "epoch": 42.69230769230769, "num_input_tokens_seen": 2204400, "step": 555, "train_accuracy": 0.009765625 }, { "epoch": 42.76923076923077, "grad_norm": 0.7743176817893982, "learning_rate": 0.01, "loss": 4.648281097412109, "num_input_tokens_seen": 2208496, "step": 556, "train_runtime": 444.5325, "train_tokens_per_second": 4968.131 }, { "epoch": 42.76923076923077, "num_input_tokens_seen": 2208496, "step": 556, "train_accuracy": 0.00390625 }, { "epoch": 42.84615384615385, "grad_norm": 0.7625809907913208, "learning_rate": 0.01, "loss": 4.640504360198975, "num_input_tokens_seen": 2212592, "step": 557, "train_runtime": 445.3413, "train_tokens_per_second": 4968.307 }, { "epoch": 42.84615384615385, "num_input_tokens_seen": 2212592, "step": 557, "train_accuracy": 0.009765625 }, { "epoch": 42.92307692307692, "grad_norm": 0.9949125051498413, "learning_rate": 0.01, "loss": 4.657556056976318, "num_input_tokens_seen": 2216688, "step": 558, "train_runtime": 446.1452, "train_tokens_per_second": 4968.535 }, { "epoch": 42.92307692307692, "num_input_tokens_seen": 2216688, "step": 558, "train_accuracy": 0.016286645084619522 }, { "epoch": 43.0, "grad_norm": 0.904716968536377, "learning_rate": 0.01, "loss": 4.625843524932861, "num_input_tokens_seen": 2219144, "step": 559, "train_runtime": 446.6577, "train_tokens_per_second": 4968.333 }, { "epoch": 43.0, "num_input_tokens_seen": 2219144, "step": 559, "train_accuracy": 0.015625 }, { "epoch": 43.07692307692308, "grad_norm": 1.0351663827896118, "learning_rate": 0.01, "loss": 4.719288349151611, "num_input_tokens_seen": 2223240, "step": 560, "train_runtime": 447.4781, "train_tokens_per_second": 4968.377 }, { "epoch": 43.07692307692308, "num_input_tokens_seen": 2223240, "step": 560, "train_accuracy": 0.017578125 }, { "epoch": 43.15384615384615, "grad_norm": 0.7712958455085754, "learning_rate": 0.01, "loss": 4.643596172332764, "num_input_tokens_seen": 2227336, "step": 561, "train_runtime": 448.2873, "train_tokens_per_second": 4968.546 }, { "epoch": 43.15384615384615, "num_input_tokens_seen": 2227336, "step": 561, "train_accuracy": 0.013671875 }, { "epoch": 43.23076923076923, "grad_norm": 0.703096330165863, "learning_rate": 0.01, "loss": 4.656213283538818, "num_input_tokens_seen": 2231432, "step": 562, "train_runtime": 449.0965, "train_tokens_per_second": 4968.714 }, { "epoch": 43.23076923076923, "num_input_tokens_seen": 2231432, "step": 562, "train_accuracy": 0.021484375 }, { "epoch": 43.30769230769231, "grad_norm": 0.9262785315513611, "learning_rate": 0.01, "loss": 4.732090950012207, "num_input_tokens_seen": 2235528, "step": 563, "train_runtime": 449.906, "train_tokens_per_second": 4968.878 }, { "epoch": 43.30769230769231, "num_input_tokens_seen": 2235528, "step": 563, "train_accuracy": 0.013671875 }, { "epoch": 43.38461538461539, "grad_norm": 0.8662072420120239, "learning_rate": 0.01, "loss": 4.692700386047363, "num_input_tokens_seen": 2239624, "step": 564, "train_runtime": 450.7149, "train_tokens_per_second": 4969.048 }, { "epoch": 43.38461538461539, "num_input_tokens_seen": 2239624, "step": 564, "train_accuracy": 0.01171875 }, { "epoch": 43.46153846153846, "grad_norm": 0.7943282127380371, "learning_rate": 0.01, "loss": 4.661947250366211, "num_input_tokens_seen": 2243720, "step": 565, "train_runtime": 451.5245, "train_tokens_per_second": 4969.209 }, { "epoch": 43.46153846153846, "num_input_tokens_seen": 2243720, "step": 565, "train_accuracy": 0.01171875 }, { "epoch": 43.53846153846154, "grad_norm": 0.8779962658882141, "learning_rate": 0.01, "loss": 4.677492141723633, "num_input_tokens_seen": 2247816, "step": 566, "train_runtime": 452.3333, "train_tokens_per_second": 4969.38 }, { "epoch": 43.53846153846154, "num_input_tokens_seen": 2247816, "step": 566, "train_accuracy": 0.013671875 }, { "epoch": 43.61538461538461, "grad_norm": 0.7035842537879944, "learning_rate": 0.01, "loss": 4.659738540649414, "num_input_tokens_seen": 2251912, "step": 567, "train_runtime": 453.1423, "train_tokens_per_second": 4969.547 }, { "epoch": 43.61538461538461, "num_input_tokens_seen": 2251912, "step": 567, "train_accuracy": 0.013671875 }, { "epoch": 43.69230769230769, "grad_norm": 0.7953966856002808, "learning_rate": 0.01, "loss": 4.664793968200684, "num_input_tokens_seen": 2256008, "step": 568, "train_runtime": 453.9513, "train_tokens_per_second": 4969.713 }, { "epoch": 43.69230769230769, "num_input_tokens_seen": 2256008, "step": 568, "train_accuracy": 0.009765625 }, { "epoch": 43.76923076923077, "grad_norm": 0.7259625792503357, "learning_rate": 0.01, "loss": 4.659206390380859, "num_input_tokens_seen": 2260104, "step": 569, "train_runtime": 454.7604, "train_tokens_per_second": 4969.879 }, { "epoch": 43.76923076923077, "num_input_tokens_seen": 2260104, "step": 569, "train_accuracy": 0.001953125 }, { "epoch": 43.84615384615385, "grad_norm": 0.6541624069213867, "learning_rate": 0.01, "loss": 4.595702171325684, "num_input_tokens_seen": 2264200, "step": 570, "train_runtime": 455.5696, "train_tokens_per_second": 4970.042 }, { "epoch": 43.84615384615385, "num_input_tokens_seen": 2264200, "step": 570, "train_accuracy": 0.013671875 }, { "epoch": 43.92307692307692, "grad_norm": 0.5536810755729675, "learning_rate": 0.01, "loss": 4.600469589233398, "num_input_tokens_seen": 2268296, "step": 571, "train_runtime": 456.3751, "train_tokens_per_second": 4970.245 }, { "epoch": 43.92307692307692, "num_input_tokens_seen": 2268296, "step": 571, "train_accuracy": 0.02280130237340927 }, { "epoch": 44.0, "grad_norm": 0.7504650354385376, "learning_rate": 0.01, "loss": 4.601952075958252, "num_input_tokens_seen": 2270752, "step": 572, "train_runtime": 456.8879, "train_tokens_per_second": 4970.042 }, { "epoch": 44.0, "num_input_tokens_seen": 2270752, "step": 572, "train_accuracy": 0.005859375 }, { "epoch": 44.07692307692308, "grad_norm": 0.9998853206634521, "learning_rate": 0.01, "loss": 4.685545921325684, "num_input_tokens_seen": 2274848, "step": 573, "train_runtime": 457.7091, "train_tokens_per_second": 4970.074 }, { "epoch": 44.07692307692308, "num_input_tokens_seen": 2274848, "step": 573, "train_accuracy": 0.013671875 }, { "epoch": 44.15384615384615, "grad_norm": 0.8141763806343079, "learning_rate": 0.01, "loss": 4.6422014236450195, "num_input_tokens_seen": 2278944, "step": 574, "train_runtime": 458.5186, "train_tokens_per_second": 4970.233 }, { "epoch": 44.15384615384615, "num_input_tokens_seen": 2278944, "step": 574, "train_accuracy": 0.009765625 }, { "epoch": 44.23076923076923, "grad_norm": 0.8815345764160156, "learning_rate": 0.01, "loss": 4.654372692108154, "num_input_tokens_seen": 2283040, "step": 575, "train_runtime": 459.3279, "train_tokens_per_second": 4970.393 }, { "epoch": 44.23076923076923, "num_input_tokens_seen": 2283040, "step": 575, "train_accuracy": 0.005859375 }, { "epoch": 44.30769230769231, "grad_norm": 0.6858783960342407, "learning_rate": 0.01, "loss": 4.626808166503906, "num_input_tokens_seen": 2287136, "step": 576, "train_runtime": 460.136, "train_tokens_per_second": 4970.565 }, { "epoch": 44.30769230769231, "num_input_tokens_seen": 2287136, "step": 576, "train_accuracy": 0.021484375 }, { "epoch": 44.38461538461539, "grad_norm": 0.957760214805603, "learning_rate": 0.01, "loss": 4.706740379333496, "num_input_tokens_seen": 2291232, "step": 577, "train_runtime": 460.9444, "train_tokens_per_second": 4970.734 }, { "epoch": 44.38461538461539, "num_input_tokens_seen": 2291232, "step": 577, "train_accuracy": 0.009765625 }, { "epoch": 44.46153846153846, "grad_norm": 0.8295272588729858, "learning_rate": 0.01, "loss": 4.658412933349609, "num_input_tokens_seen": 2295328, "step": 578, "train_runtime": 461.7536, "train_tokens_per_second": 4970.894 }, { "epoch": 44.46153846153846, "num_input_tokens_seen": 2295328, "step": 578, "train_accuracy": 0.0078125 }, { "epoch": 44.53846153846154, "grad_norm": 0.8796570897102356, "learning_rate": 0.01, "loss": 4.714468002319336, "num_input_tokens_seen": 2299424, "step": 579, "train_runtime": 462.5619, "train_tokens_per_second": 4971.062 }, { "epoch": 44.53846153846154, "num_input_tokens_seen": 2299424, "step": 579, "train_accuracy": 0.015625 }, { "epoch": 44.61538461538461, "grad_norm": 0.8227230906486511, "learning_rate": 0.01, "loss": 4.655007362365723, "num_input_tokens_seen": 2303520, "step": 580, "train_runtime": 463.3708, "train_tokens_per_second": 4971.224 }, { "epoch": 44.61538461538461, "num_input_tokens_seen": 2303520, "step": 580, "train_accuracy": 0.009765625 }, { "epoch": 44.69230769230769, "grad_norm": 0.8670706748962402, "learning_rate": 0.01, "loss": 4.666321754455566, "num_input_tokens_seen": 2307616, "step": 581, "train_runtime": 464.1803, "train_tokens_per_second": 4971.378 }, { "epoch": 44.69230769230769, "num_input_tokens_seen": 2307616, "step": 581, "train_accuracy": 0.005859375 }, { "epoch": 44.76923076923077, "grad_norm": 0.955562949180603, "learning_rate": 0.01, "loss": 4.649089813232422, "num_input_tokens_seen": 2311712, "step": 582, "train_runtime": 464.9888, "train_tokens_per_second": 4971.544 }, { "epoch": 44.76923076923077, "num_input_tokens_seen": 2311712, "step": 582, "train_accuracy": 0.001953125 }, { "epoch": 44.84615384615385, "grad_norm": 0.906722903251648, "learning_rate": 0.01, "loss": 4.669605255126953, "num_input_tokens_seen": 2315808, "step": 583, "train_runtime": 465.7973, "train_tokens_per_second": 4971.708 }, { "epoch": 44.84615384615385, "num_input_tokens_seen": 2315808, "step": 583, "train_accuracy": 0.005859375 }, { "epoch": 44.92307692307692, "grad_norm": 0.9096651673316956, "learning_rate": 0.01, "loss": 4.6865081787109375, "num_input_tokens_seen": 2319904, "step": 584, "train_runtime": 466.6023, "train_tokens_per_second": 4971.909 }, { "epoch": 44.92307692307692, "num_input_tokens_seen": 2319904, "step": 584, "train_accuracy": 0.016286645084619522 }, { "epoch": 45.0, "grad_norm": 0.8906012773513794, "learning_rate": 0.01, "loss": 4.6353349685668945, "num_input_tokens_seen": 2322360, "step": 585, "train_runtime": 467.1148, "train_tokens_per_second": 4971.712 }, { "epoch": 45.0, "num_input_tokens_seen": 2322360, "step": 585, "train_accuracy": 0.00390625 }, { "epoch": 45.07692307692308, "grad_norm": 0.8796638250350952, "learning_rate": 0.01, "loss": 4.698246955871582, "num_input_tokens_seen": 2326456, "step": 586, "train_runtime": 467.9364, "train_tokens_per_second": 4971.736 }, { "epoch": 45.07692307692308, "num_input_tokens_seen": 2326456, "step": 586, "train_accuracy": 0.009765625 }, { "epoch": 45.15384615384615, "grad_norm": 1.1915932893753052, "learning_rate": 0.01, "loss": 4.661253929138184, "num_input_tokens_seen": 2330552, "step": 587, "train_runtime": 468.7458, "train_tokens_per_second": 4971.889 }, { "epoch": 45.15384615384615, "num_input_tokens_seen": 2330552, "step": 587, "train_accuracy": 0.009765625 }, { "epoch": 45.23076923076923, "grad_norm": 0.899604082107544, "learning_rate": 0.01, "loss": 4.670432090759277, "num_input_tokens_seen": 2334648, "step": 588, "train_runtime": 469.5557, "train_tokens_per_second": 4972.036 }, { "epoch": 45.23076923076923, "num_input_tokens_seen": 2334648, "step": 588, "train_accuracy": 0.00390625 }, { "epoch": 45.30769230769231, "grad_norm": 1.1505882740020752, "learning_rate": 0.01, "loss": 4.745501518249512, "num_input_tokens_seen": 2338744, "step": 589, "train_runtime": 470.3646, "train_tokens_per_second": 4972.193 }, { "epoch": 45.30769230769231, "num_input_tokens_seen": 2338744, "step": 589, "train_accuracy": 0.009765625 }, { "epoch": 45.38461538461539, "grad_norm": 1.0811315774917603, "learning_rate": 0.01, "loss": 4.690670013427734, "num_input_tokens_seen": 2342840, "step": 590, "train_runtime": 471.1758, "train_tokens_per_second": 4972.327 }, { "epoch": 45.38461538461539, "num_input_tokens_seen": 2342840, "step": 590, "train_accuracy": 0.013671875 }, { "epoch": 45.46153846153846, "grad_norm": 0.9773861169815063, "learning_rate": 0.01, "loss": 4.728013515472412, "num_input_tokens_seen": 2346936, "step": 591, "train_runtime": 471.9855, "train_tokens_per_second": 4972.474 }, { "epoch": 45.46153846153846, "num_input_tokens_seen": 2346936, "step": 591, "train_accuracy": 0.01171875 }, { "epoch": 45.53846153846154, "grad_norm": 1.1385358572006226, "learning_rate": 0.01, "loss": 4.697521209716797, "num_input_tokens_seen": 2351032, "step": 592, "train_runtime": 472.7948, "train_tokens_per_second": 4972.626 }, { "epoch": 45.53846153846154, "num_input_tokens_seen": 2351032, "step": 592, "train_accuracy": 0.009765625 }, { "epoch": 45.61538461538461, "grad_norm": 0.7973088026046753, "learning_rate": 0.01, "loss": 4.714956283569336, "num_input_tokens_seen": 2355128, "step": 593, "train_runtime": 473.604, "train_tokens_per_second": 4972.779 }, { "epoch": 45.61538461538461, "num_input_tokens_seen": 2355128, "step": 593, "train_accuracy": 0.0078125 }, { "epoch": 45.69230769230769, "grad_norm": 0.8927688598632812, "learning_rate": 0.01, "loss": 4.65383243560791, "num_input_tokens_seen": 2359224, "step": 594, "train_runtime": 474.4134, "train_tokens_per_second": 4972.929 }, { "epoch": 45.69230769230769, "num_input_tokens_seen": 2359224, "step": 594, "train_accuracy": 0.01171875 }, { "epoch": 45.76923076923077, "grad_norm": 0.79509037733078, "learning_rate": 0.01, "loss": 4.636276721954346, "num_input_tokens_seen": 2363320, "step": 595, "train_runtime": 475.2229, "train_tokens_per_second": 4973.077 }, { "epoch": 45.76923076923077, "num_input_tokens_seen": 2363320, "step": 595, "train_accuracy": 0.013671875 }, { "epoch": 45.84615384615385, "grad_norm": 0.9098619222640991, "learning_rate": 0.01, "loss": 4.748471260070801, "num_input_tokens_seen": 2367416, "step": 596, "train_runtime": 476.032, "train_tokens_per_second": 4973.229 }, { "epoch": 45.84615384615385, "num_input_tokens_seen": 2367416, "step": 596, "train_accuracy": 0.00390625 }, { "epoch": 45.92307692307692, "grad_norm": 0.6853192448616028, "learning_rate": 0.01, "loss": 4.684442520141602, "num_input_tokens_seen": 2371512, "step": 597, "train_runtime": 476.838, "train_tokens_per_second": 4973.413 }, { "epoch": 45.92307692307692, "num_input_tokens_seen": 2371512, "step": 597, "train_accuracy": 0.009771986864507198 }, { "epoch": 46.0, "grad_norm": 1.149055004119873, "learning_rate": 0.01, "loss": 4.697789192199707, "num_input_tokens_seen": 2373968, "step": 598, "train_runtime": 477.3504, "train_tokens_per_second": 4973.218 }, { "epoch": 46.0, "num_input_tokens_seen": 2373968, "step": 598, "train_accuracy": 0.017578125 }, { "epoch": 46.07692307692308, "grad_norm": 0.8396105766296387, "learning_rate": 0.01, "loss": 4.683511734008789, "num_input_tokens_seen": 2378064, "step": 599, "train_runtime": 478.1716, "train_tokens_per_second": 4973.244 }, { "epoch": 46.07692307692308, "num_input_tokens_seen": 2378064, "step": 599, "train_accuracy": 0.013671875 }, { "epoch": 46.15384615384615, "grad_norm": 0.7613953948020935, "learning_rate": 0.01, "loss": 4.631681442260742, "num_input_tokens_seen": 2382160, "step": 600, "train_runtime": 478.9815, "train_tokens_per_second": 4973.387 }, { "epoch": 46.15384615384615, "eval_CMD_3_branch_eval_accuracy": 0.007956600361663653, "eval_CMD_3_branch_eval_loss": 4.713253021240234, "eval_CMD_3_branch_eval_runtime": 1.1395, "eval_CMD_3_branch_eval_samples_per_second": 2426.455, "eval_CMD_3_branch_eval_steps_per_second": 5.265, "num_input_tokens_seen": 2382160, "step": 600 }, { "epoch": 46.15384615384615, "num_input_tokens_seen": 2382160, "step": 600, "train_accuracy": 0.009765625 }, { "epoch": 46.23076923076923, "grad_norm": 0.7381619811058044, "learning_rate": 0.01, "loss": 4.686368942260742, "num_input_tokens_seen": 2386256, "step": 601, "train_runtime": 480.9359, "train_tokens_per_second": 4961.693 }, { "epoch": 46.23076923076923, "num_input_tokens_seen": 2386256, "step": 601, "train_accuracy": 0.017578125 }, { "epoch": 46.30769230769231, "grad_norm": 0.5763469934463501, "learning_rate": 0.01, "loss": 4.618984222412109, "num_input_tokens_seen": 2390352, "step": 602, "train_runtime": 481.7451, "train_tokens_per_second": 4961.861 }, { "epoch": 46.30769230769231, "num_input_tokens_seen": 2390352, "step": 602, "train_accuracy": 0.0078125 }, { "epoch": 46.38461538461539, "grad_norm": 0.6603495478630066, "learning_rate": 0.01, "loss": 4.622781753540039, "num_input_tokens_seen": 2394448, "step": 603, "train_runtime": 482.5554, "train_tokens_per_second": 4962.017 }, { "epoch": 46.38461538461539, "num_input_tokens_seen": 2394448, "step": 603, "train_accuracy": 0.0078125 }, { "epoch": 46.46153846153846, "grad_norm": 1.2545437812805176, "learning_rate": 0.01, "loss": 4.671928405761719, "num_input_tokens_seen": 2398544, "step": 604, "train_runtime": 483.3655, "train_tokens_per_second": 4962.174 }, { "epoch": 46.46153846153846, "num_input_tokens_seen": 2398544, "step": 604, "train_accuracy": 0.005859375 }, { "epoch": 46.53846153846154, "grad_norm": 1.3104106187820435, "learning_rate": 0.01, "loss": 4.700450897216797, "num_input_tokens_seen": 2402640, "step": 605, "train_runtime": 484.1767, "train_tokens_per_second": 4962.32 }, { "epoch": 46.53846153846154, "num_input_tokens_seen": 2402640, "step": 605, "train_accuracy": 0.00390625 }, { "epoch": 46.61538461538461, "grad_norm": 0.7127174139022827, "learning_rate": 0.01, "loss": 4.673466205596924, "num_input_tokens_seen": 2406736, "step": 606, "train_runtime": 484.9871, "train_tokens_per_second": 4962.475 }, { "epoch": 46.61538461538461, "num_input_tokens_seen": 2406736, "step": 606, "train_accuracy": 0.009765625 }, { "epoch": 46.69230769230769, "grad_norm": 0.7060525417327881, "learning_rate": 0.01, "loss": 4.623709678649902, "num_input_tokens_seen": 2410832, "step": 607, "train_runtime": 485.797, "train_tokens_per_second": 4962.633 }, { "epoch": 46.69230769230769, "num_input_tokens_seen": 2410832, "step": 607, "train_accuracy": 0.0078125 }, { "epoch": 46.76923076923077, "grad_norm": 0.6495184302330017, "learning_rate": 0.01, "loss": 4.624743938446045, "num_input_tokens_seen": 2414928, "step": 608, "train_runtime": 486.6082, "train_tokens_per_second": 4962.777 }, { "epoch": 46.76923076923077, "num_input_tokens_seen": 2414928, "step": 608, "train_accuracy": 0.013671875 }, { "epoch": 46.84615384615385, "grad_norm": 0.6529079675674438, "learning_rate": 0.01, "loss": 4.624449729919434, "num_input_tokens_seen": 2419024, "step": 609, "train_runtime": 487.418, "train_tokens_per_second": 4962.935 }, { "epoch": 46.84615384615385, "num_input_tokens_seen": 2419024, "step": 609, "train_accuracy": 0.01171875 }, { "epoch": 46.92307692307692, "grad_norm": 0.888717532157898, "learning_rate": 0.01, "loss": 4.675288200378418, "num_input_tokens_seen": 2423120, "step": 610, "train_runtime": 488.2232, "train_tokens_per_second": 4963.139 }, { "epoch": 46.92307692307692, "num_input_tokens_seen": 2423120, "step": 610, "train_accuracy": 0.019543973729014397 }, { "epoch": 47.0, "grad_norm": 1.031438946723938, "learning_rate": 0.01, "loss": 4.670546054840088, "num_input_tokens_seen": 2425576, "step": 611, "train_runtime": 488.7364, "train_tokens_per_second": 4962.953 }, { "epoch": 47.0, "num_input_tokens_seen": 2425576, "step": 611, "train_accuracy": 0.01171875 }, { "epoch": 47.07692307692308, "grad_norm": 0.6399885416030884, "learning_rate": 0.01, "loss": 4.624326705932617, "num_input_tokens_seen": 2429672, "step": 612, "train_runtime": 489.558, "train_tokens_per_second": 4962.991 }, { "epoch": 47.07692307692308, "num_input_tokens_seen": 2429672, "step": 612, "train_accuracy": 0.005859375 }, { "epoch": 47.15384615384615, "grad_norm": 0.8436721563339233, "learning_rate": 0.01, "loss": 4.636343479156494, "num_input_tokens_seen": 2433768, "step": 613, "train_runtime": 490.3673, "train_tokens_per_second": 4963.154 }, { "epoch": 47.15384615384615, "num_input_tokens_seen": 2433768, "step": 613, "train_accuracy": 0.015625 }, { "epoch": 47.23076923076923, "grad_norm": 0.6118916273117065, "learning_rate": 0.01, "loss": 4.632634162902832, "num_input_tokens_seen": 2437864, "step": 614, "train_runtime": 491.1772, "train_tokens_per_second": 4963.309 }, { "epoch": 47.23076923076923, "num_input_tokens_seen": 2437864, "step": 614, "train_accuracy": 0.005859375 }, { "epoch": 47.30769230769231, "grad_norm": 0.922429084777832, "learning_rate": 0.01, "loss": 4.65765380859375, "num_input_tokens_seen": 2441960, "step": 615, "train_runtime": 491.9875, "train_tokens_per_second": 4963.46 }, { "epoch": 47.30769230769231, "num_input_tokens_seen": 2441960, "step": 615, "train_accuracy": 0.009765625 }, { "epoch": 47.38461538461539, "grad_norm": 0.5347769260406494, "learning_rate": 0.01, "loss": 4.66064453125, "num_input_tokens_seen": 2446056, "step": 616, "train_runtime": 492.7971, "train_tokens_per_second": 4963.617 }, { "epoch": 47.38461538461539, "num_input_tokens_seen": 2446056, "step": 616, "train_accuracy": 0.01953125 }, { "epoch": 47.46153846153846, "grad_norm": 1.1451373100280762, "learning_rate": 0.01, "loss": 4.636528968811035, "num_input_tokens_seen": 2450152, "step": 617, "train_runtime": 493.6084, "train_tokens_per_second": 4963.756 }, { "epoch": 47.46153846153846, "num_input_tokens_seen": 2450152, "step": 617, "train_accuracy": 0.00390625 }, { "epoch": 47.53846153846154, "grad_norm": 0.7594324350357056, "learning_rate": 0.01, "loss": 4.647350311279297, "num_input_tokens_seen": 2454248, "step": 618, "train_runtime": 494.418, "train_tokens_per_second": 4963.913 }, { "epoch": 47.53846153846154, "num_input_tokens_seen": 2454248, "step": 618, "train_accuracy": 0.021484375 }, { "epoch": 47.61538461538461, "grad_norm": 0.7688575387001038, "learning_rate": 0.01, "loss": 4.643795013427734, "num_input_tokens_seen": 2458344, "step": 619, "train_runtime": 495.2287, "train_tokens_per_second": 4964.058 }, { "epoch": 47.61538461538461, "num_input_tokens_seen": 2458344, "step": 619, "train_accuracy": 0.0078125 }, { "epoch": 47.69230769230769, "grad_norm": 0.571732759475708, "learning_rate": 0.01, "loss": 4.648545265197754, "num_input_tokens_seen": 2462440, "step": 620, "train_runtime": 496.0391, "train_tokens_per_second": 4964.205 }, { "epoch": 47.69230769230769, "num_input_tokens_seen": 2462440, "step": 620, "train_accuracy": 0.005859375 }, { "epoch": 47.76923076923077, "grad_norm": 0.9158742427825928, "learning_rate": 0.01, "loss": 4.65397834777832, "num_input_tokens_seen": 2466536, "step": 621, "train_runtime": 496.8495, "train_tokens_per_second": 4964.352 }, { "epoch": 47.76923076923077, "num_input_tokens_seen": 2466536, "step": 621, "train_accuracy": 0.001953125 }, { "epoch": 47.84615384615385, "grad_norm": 0.6186763048171997, "learning_rate": 0.01, "loss": 4.6529364585876465, "num_input_tokens_seen": 2470632, "step": 622, "train_runtime": 497.6592, "train_tokens_per_second": 4964.505 }, { "epoch": 47.84615384615385, "num_input_tokens_seen": 2470632, "step": 622, "train_accuracy": 0.01953125 }, { "epoch": 47.92307692307692, "grad_norm": 0.6545286774635315, "learning_rate": 0.01, "loss": 4.616402626037598, "num_input_tokens_seen": 2474728, "step": 623, "train_runtime": 498.4647, "train_tokens_per_second": 4964.701 }, { "epoch": 47.92307692307692, "num_input_tokens_seen": 2474728, "step": 623, "train_accuracy": 0.009771986864507198 }, { "epoch": 48.0, "grad_norm": 0.7522267699241638, "learning_rate": 0.01, "loss": 4.644376754760742, "num_input_tokens_seen": 2477184, "step": 624, "train_runtime": 498.9772, "train_tokens_per_second": 4964.523 }, { "epoch": 48.0, "num_input_tokens_seen": 2477184, "step": 624, "train_accuracy": 0.0078125 }, { "epoch": 48.07692307692308, "grad_norm": 0.6838968992233276, "learning_rate": 0.01, "loss": 4.639554023742676, "num_input_tokens_seen": 2481280, "step": 625, "train_runtime": 499.7983, "train_tokens_per_second": 4964.563 }, { "epoch": 48.07692307692308, "num_input_tokens_seen": 2481280, "step": 625, "train_accuracy": 0.015625 }, { "epoch": 48.15384615384615, "grad_norm": 0.8111297488212585, "learning_rate": 0.01, "loss": 4.663860321044922, "num_input_tokens_seen": 2485376, "step": 626, "train_runtime": 500.6081, "train_tokens_per_second": 4964.714 }, { "epoch": 48.15384615384615, "num_input_tokens_seen": 2485376, "step": 626, "train_accuracy": 0.013671875 }, { "epoch": 48.23076923076923, "grad_norm": 0.7217122912406921, "learning_rate": 0.01, "loss": 4.6131815910339355, "num_input_tokens_seen": 2489472, "step": 627, "train_runtime": 501.4182, "train_tokens_per_second": 4964.862 }, { "epoch": 48.23076923076923, "num_input_tokens_seen": 2489472, "step": 627, "train_accuracy": 0.017578125 }, { "epoch": 48.30769230769231, "grad_norm": 0.6450233459472656, "learning_rate": 0.01, "loss": 4.653800964355469, "num_input_tokens_seen": 2493568, "step": 628, "train_runtime": 502.8205, "train_tokens_per_second": 4959.161 }, { "epoch": 48.30769230769231, "num_input_tokens_seen": 2493568, "step": 628, "train_accuracy": 0.0078125 }, { "epoch": 48.38461538461539, "grad_norm": 0.6552592515945435, "learning_rate": 0.01, "loss": 4.636212348937988, "num_input_tokens_seen": 2497664, "step": 629, "train_runtime": 503.6295, "train_tokens_per_second": 4959.328 }, { "epoch": 48.38461538461539, "num_input_tokens_seen": 2497664, "step": 629, "train_accuracy": 0.01171875 }, { "epoch": 48.46153846153846, "grad_norm": 0.6383926868438721, "learning_rate": 0.01, "loss": 4.636415958404541, "num_input_tokens_seen": 2501760, "step": 630, "train_runtime": 504.4393, "train_tokens_per_second": 4959.487 }, { "epoch": 48.46153846153846, "num_input_tokens_seen": 2501760, "step": 630, "train_accuracy": 0.005859375 }, { "epoch": 48.53846153846154, "grad_norm": 0.7733830213546753, "learning_rate": 0.01, "loss": 4.661928176879883, "num_input_tokens_seen": 2505856, "step": 631, "train_runtime": 505.2491, "train_tokens_per_second": 4959.644 }, { "epoch": 48.53846153846154, "num_input_tokens_seen": 2505856, "step": 631, "train_accuracy": 0.015625 }, { "epoch": 48.61538461538461, "grad_norm": 0.5787567496299744, "learning_rate": 0.01, "loss": 4.6234893798828125, "num_input_tokens_seen": 2509952, "step": 632, "train_runtime": 506.0584, "train_tokens_per_second": 4959.807 }, { "epoch": 48.61538461538461, "num_input_tokens_seen": 2509952, "step": 632, "train_accuracy": 0.013671875 }, { "epoch": 48.69230769230769, "grad_norm": 1.2400026321411133, "learning_rate": 0.01, "loss": 4.647170066833496, "num_input_tokens_seen": 2514048, "step": 633, "train_runtime": 506.8688, "train_tokens_per_second": 4959.958 }, { "epoch": 48.69230769230769, "num_input_tokens_seen": 2514048, "step": 633, "train_accuracy": 0.0078125 }, { "epoch": 48.76923076923077, "grad_norm": 1.0741299390792847, "learning_rate": 0.01, "loss": 4.729347229003906, "num_input_tokens_seen": 2518144, "step": 634, "train_runtime": 507.6777, "train_tokens_per_second": 4960.123 }, { "epoch": 48.76923076923077, "num_input_tokens_seen": 2518144, "step": 634, "train_accuracy": 0.005859375 }, { "epoch": 48.84615384615385, "grad_norm": 1.0568114519119263, "learning_rate": 0.01, "loss": 4.669841766357422, "num_input_tokens_seen": 2522240, "step": 635, "train_runtime": 508.486, "train_tokens_per_second": 4960.293 }, { "epoch": 48.84615384615385, "num_input_tokens_seen": 2522240, "step": 635, "train_accuracy": 0.01171875 }, { "epoch": 48.92307692307692, "grad_norm": 0.9858353734016418, "learning_rate": 0.01, "loss": 4.701937198638916, "num_input_tokens_seen": 2526336, "step": 636, "train_runtime": 509.2909, "train_tokens_per_second": 4960.497 }, { "epoch": 48.92307692307692, "num_input_tokens_seen": 2526336, "step": 636, "train_accuracy": 0.026058631017804146 }, { "epoch": 49.0, "grad_norm": 1.1662908792495728, "learning_rate": 0.01, "loss": 4.6463212966918945, "num_input_tokens_seen": 2528792, "step": 637, "train_runtime": 509.8034, "train_tokens_per_second": 4960.328 }, { "epoch": 49.0, "num_input_tokens_seen": 2528792, "step": 637, "train_accuracy": 0.01171875 }, { "epoch": 49.07692307692308, "grad_norm": 0.9272441864013672, "learning_rate": 0.01, "loss": 4.6829328536987305, "num_input_tokens_seen": 2532888, "step": 638, "train_runtime": 510.625, "train_tokens_per_second": 4960.368 }, { "epoch": 49.07692307692308, "num_input_tokens_seen": 2532888, "step": 638, "train_accuracy": 0.005859375 }, { "epoch": 49.15384615384615, "grad_norm": 1.0570746660232544, "learning_rate": 0.01, "loss": 4.69055700302124, "num_input_tokens_seen": 2536984, "step": 639, "train_runtime": 511.4358, "train_tokens_per_second": 4960.513 }, { "epoch": 49.15384615384615, "num_input_tokens_seen": 2536984, "step": 639, "train_accuracy": 0.013671875 }, { "epoch": 49.23076923076923, "grad_norm": 1.1872737407684326, "learning_rate": 0.01, "loss": 4.695536136627197, "num_input_tokens_seen": 2541080, "step": 640, "train_runtime": 512.246, "train_tokens_per_second": 4960.664 }, { "epoch": 49.23076923076923, "num_input_tokens_seen": 2541080, "step": 640, "train_accuracy": 0.021484375 }, { "epoch": 49.30769230769231, "grad_norm": 0.7186793088912964, "learning_rate": 0.01, "loss": 4.674342155456543, "num_input_tokens_seen": 2545176, "step": 641, "train_runtime": 513.0556, "train_tokens_per_second": 4960.819 }, { "epoch": 49.30769230769231, "num_input_tokens_seen": 2545176, "step": 641, "train_accuracy": 0.005859375 }, { "epoch": 49.38461538461539, "grad_norm": 1.009905219078064, "learning_rate": 0.01, "loss": 4.646609306335449, "num_input_tokens_seen": 2549272, "step": 642, "train_runtime": 513.8658, "train_tokens_per_second": 4960.968 }, { "epoch": 49.38461538461539, "num_input_tokens_seen": 2549272, "step": 642, "train_accuracy": 0.009765625 }, { "epoch": 49.46153846153846, "grad_norm": 0.5971208214759827, "learning_rate": 0.01, "loss": 4.600564956665039, "num_input_tokens_seen": 2553368, "step": 643, "train_runtime": 514.6756, "train_tokens_per_second": 4961.121 }, { "epoch": 49.46153846153846, "num_input_tokens_seen": 2553368, "step": 643, "train_accuracy": 0.005859375 }, { "epoch": 49.53846153846154, "grad_norm": 0.8048012256622314, "learning_rate": 0.01, "loss": 4.6409101486206055, "num_input_tokens_seen": 2557464, "step": 644, "train_runtime": 515.4846, "train_tokens_per_second": 4961.281 }, { "epoch": 49.53846153846154, "num_input_tokens_seen": 2557464, "step": 644, "train_accuracy": 0.013671875 }, { "epoch": 49.61538461538461, "grad_norm": 0.7245068550109863, "learning_rate": 0.01, "loss": 4.6511125564575195, "num_input_tokens_seen": 2561560, "step": 645, "train_runtime": 516.2954, "train_tokens_per_second": 4961.424 }, { "epoch": 49.61538461538461, "num_input_tokens_seen": 2561560, "step": 645, "train_accuracy": 0.0078125 }, { "epoch": 49.69230769230769, "grad_norm": 0.6752263307571411, "learning_rate": 0.01, "loss": 4.658726692199707, "num_input_tokens_seen": 2565656, "step": 646, "train_runtime": 517.1067, "train_tokens_per_second": 4961.56 }, { "epoch": 49.69230769230769, "num_input_tokens_seen": 2565656, "step": 646, "train_accuracy": 0.009765625 }, { "epoch": 49.76923076923077, "grad_norm": 0.7821914553642273, "learning_rate": 0.01, "loss": 4.655362129211426, "num_input_tokens_seen": 2569752, "step": 647, "train_runtime": 517.9168, "train_tokens_per_second": 4961.708 }, { "epoch": 49.76923076923077, "num_input_tokens_seen": 2569752, "step": 647, "train_accuracy": 0.01171875 }, { "epoch": 49.84615384615385, "grad_norm": 0.6703137755393982, "learning_rate": 0.01, "loss": 4.617711067199707, "num_input_tokens_seen": 2573848, "step": 648, "train_runtime": 518.7273, "train_tokens_per_second": 4961.852 }, { "epoch": 49.84615384615385, "num_input_tokens_seen": 2573848, "step": 648, "train_accuracy": 0.009765625 }, { "epoch": 49.92307692307692, "grad_norm": 0.7096541523933411, "learning_rate": 0.01, "loss": 4.640897750854492, "num_input_tokens_seen": 2577944, "step": 649, "train_runtime": 519.5333, "train_tokens_per_second": 4962.038 }, { "epoch": 49.92307692307692, "num_input_tokens_seen": 2577944, "step": 649, "train_accuracy": 0.013029315508902073 }, { "epoch": 50.0, "grad_norm": 0.8702600598335266, "learning_rate": 0.01, "loss": 4.709993362426758, "num_input_tokens_seen": 2580400, "step": 650, "train_runtime": 520.0465, "train_tokens_per_second": 4961.864 }, { "epoch": 50.0, "num_input_tokens_seen": 2580400, "step": 650, "train_accuracy": 0.01171875 }, { "epoch": 50.07692307692308, "grad_norm": 0.42548519372940063, "learning_rate": 0.01, "loss": 4.5709357261657715, "num_input_tokens_seen": 2584496, "step": 651, "train_runtime": 520.8691, "train_tokens_per_second": 4961.892 }, { "epoch": 50.07692307692308, "num_input_tokens_seen": 2584496, "step": 651, "train_accuracy": 0.0078125 }, { "epoch": 50.15384615384615, "grad_norm": 0.5908008217811584, "learning_rate": 0.01, "loss": 4.604125499725342, "num_input_tokens_seen": 2588592, "step": 652, "train_runtime": 521.679, "train_tokens_per_second": 4962.04 }, { "epoch": 50.15384615384615, "num_input_tokens_seen": 2588592, "step": 652, "train_accuracy": 0.013671875 }, { "epoch": 50.23076923076923, "grad_norm": 0.4799763262271881, "learning_rate": 0.01, "loss": 4.620506286621094, "num_input_tokens_seen": 2592688, "step": 653, "train_runtime": 522.489, "train_tokens_per_second": 4962.187 }, { "epoch": 50.23076923076923, "num_input_tokens_seen": 2592688, "step": 653, "train_accuracy": 0.005859375 }, { "epoch": 50.30769230769231, "grad_norm": 0.5626305937767029, "learning_rate": 0.01, "loss": 4.628401756286621, "num_input_tokens_seen": 2596784, "step": 654, "train_runtime": 523.2995, "train_tokens_per_second": 4962.328 }, { "epoch": 50.30769230769231, "num_input_tokens_seen": 2596784, "step": 654, "train_accuracy": 0.013671875 }, { "epoch": 50.38461538461539, "grad_norm": 0.5553593635559082, "learning_rate": 0.01, "loss": 4.606263160705566, "num_input_tokens_seen": 2600880, "step": 655, "train_runtime": 524.1095, "train_tokens_per_second": 4962.475 }, { "epoch": 50.38461538461539, "num_input_tokens_seen": 2600880, "step": 655, "train_accuracy": 0.0234375 }, { "epoch": 50.46153846153846, "grad_norm": 0.4625200629234314, "learning_rate": 0.01, "loss": 4.608486175537109, "num_input_tokens_seen": 2604976, "step": 656, "train_runtime": 524.9193, "train_tokens_per_second": 4962.622 }, { "epoch": 50.46153846153846, "num_input_tokens_seen": 2604976, "step": 656, "train_accuracy": 0.01171875 }, { "epoch": 50.53846153846154, "grad_norm": 0.5337545275688171, "learning_rate": 0.01, "loss": 4.64743185043335, "num_input_tokens_seen": 2609072, "step": 657, "train_runtime": 525.7294, "train_tokens_per_second": 4962.766 }, { "epoch": 50.53846153846154, "num_input_tokens_seen": 2609072, "step": 657, "train_accuracy": 0.01171875 }, { "epoch": 50.61538461538461, "grad_norm": 0.4707218110561371, "learning_rate": 0.01, "loss": 4.617958068847656, "num_input_tokens_seen": 2613168, "step": 658, "train_runtime": 526.54, "train_tokens_per_second": 4962.905 }, { "epoch": 50.61538461538461, "num_input_tokens_seen": 2613168, "step": 658, "train_accuracy": 0.0078125 }, { "epoch": 50.69230769230769, "grad_norm": 0.5861688852310181, "learning_rate": 0.01, "loss": 4.668414115905762, "num_input_tokens_seen": 2617264, "step": 659, "train_runtime": 527.3512, "train_tokens_per_second": 4963.038 }, { "epoch": 50.69230769230769, "num_input_tokens_seen": 2617264, "step": 659, "train_accuracy": 0.009765625 }, { "epoch": 50.76923076923077, "grad_norm": 0.4923286736011505, "learning_rate": 0.01, "loss": 4.589829444885254, "num_input_tokens_seen": 2621360, "step": 660, "train_runtime": 528.1611, "train_tokens_per_second": 4963.182 }, { "epoch": 50.76923076923077, "num_input_tokens_seen": 2621360, "step": 660, "train_accuracy": 0.01171875 }, { "epoch": 50.84615384615385, "grad_norm": 0.4617142379283905, "learning_rate": 0.01, "loss": 4.619271278381348, "num_input_tokens_seen": 2625456, "step": 661, "train_runtime": 528.9712, "train_tokens_per_second": 4963.325 }, { "epoch": 50.84615384615385, "num_input_tokens_seen": 2625456, "step": 661, "train_accuracy": 0.015625 }, { "epoch": 50.92307692307692, "grad_norm": 0.6571746468544006, "learning_rate": 0.01, "loss": 4.60849666595459, "num_input_tokens_seen": 2629552, "step": 662, "train_runtime": 529.7773, "train_tokens_per_second": 4963.505 }, { "epoch": 50.92307692307692, "num_input_tokens_seen": 2629552, "step": 662, "train_accuracy": 0.0065146577544510365 }, { "epoch": 51.0, "grad_norm": 0.5296902656555176, "learning_rate": 0.01, "loss": 4.624043941497803, "num_input_tokens_seen": 2632008, "step": 663, "train_runtime": 530.2911, "train_tokens_per_second": 4963.326 }, { "epoch": 51.0, "num_input_tokens_seen": 2632008, "step": 663, "train_accuracy": 0.0078125 }, { "epoch": 51.07692307692308, "grad_norm": 0.4619719088077545, "learning_rate": 0.01, "loss": 4.613448143005371, "num_input_tokens_seen": 2636104, "step": 664, "train_runtime": 531.1132, "train_tokens_per_second": 4963.356 }, { "epoch": 51.07692307692308, "num_input_tokens_seen": 2636104, "step": 664, "train_accuracy": 0.013671875 }, { "epoch": 51.15384615384615, "grad_norm": 0.4793144166469574, "learning_rate": 0.01, "loss": 4.639217853546143, "num_input_tokens_seen": 2640200, "step": 665, "train_runtime": 531.9243, "train_tokens_per_second": 4963.488 }, { "epoch": 51.15384615384615, "num_input_tokens_seen": 2640200, "step": 665, "train_accuracy": 0.01171875 }, { "epoch": 51.23076923076923, "grad_norm": 0.43797430396080017, "learning_rate": 0.01, "loss": 4.610978126525879, "num_input_tokens_seen": 2644296, "step": 666, "train_runtime": 532.7351, "train_tokens_per_second": 4963.622 }, { "epoch": 51.23076923076923, "num_input_tokens_seen": 2644296, "step": 666, "train_accuracy": 0.01171875 }, { "epoch": 51.30769230769231, "grad_norm": 0.41927510499954224, "learning_rate": 0.01, "loss": 4.595067024230957, "num_input_tokens_seen": 2648392, "step": 667, "train_runtime": 533.5461, "train_tokens_per_second": 4963.754 }, { "epoch": 51.30769230769231, "num_input_tokens_seen": 2648392, "step": 667, "train_accuracy": 0.00390625 }, { "epoch": 51.38461538461539, "grad_norm": 0.532819390296936, "learning_rate": 0.01, "loss": 4.598370552062988, "num_input_tokens_seen": 2652488, "step": 668, "train_runtime": 534.3567, "train_tokens_per_second": 4963.89 }, { "epoch": 51.38461538461539, "num_input_tokens_seen": 2652488, "step": 668, "train_accuracy": 0.005859375 }, { "epoch": 51.46153846153846, "grad_norm": 0.6052037477493286, "learning_rate": 0.01, "loss": 4.617681503295898, "num_input_tokens_seen": 2656584, "step": 669, "train_runtime": 535.1672, "train_tokens_per_second": 4964.026 }, { "epoch": 51.46153846153846, "num_input_tokens_seen": 2656584, "step": 669, "train_accuracy": 0.013671875 }, { "epoch": 51.53846153846154, "grad_norm": 0.4389113485813141, "learning_rate": 0.01, "loss": 4.626598358154297, "num_input_tokens_seen": 2660680, "step": 670, "train_runtime": 535.9782, "train_tokens_per_second": 4964.157 }, { "epoch": 51.53846153846154, "num_input_tokens_seen": 2660680, "step": 670, "train_accuracy": 0.009765625 }, { "epoch": 51.61538461538461, "grad_norm": 0.639845609664917, "learning_rate": 0.01, "loss": 4.6394243240356445, "num_input_tokens_seen": 2664776, "step": 671, "train_runtime": 536.788, "train_tokens_per_second": 4964.298 }, { "epoch": 51.61538461538461, "num_input_tokens_seen": 2664776, "step": 671, "train_accuracy": 0.005859375 }, { "epoch": 51.69230769230769, "grad_norm": 0.560914933681488, "learning_rate": 0.01, "loss": 4.6167473793029785, "num_input_tokens_seen": 2668872, "step": 672, "train_runtime": 537.5985, "train_tokens_per_second": 4964.433 }, { "epoch": 51.69230769230769, "num_input_tokens_seen": 2668872, "step": 672, "train_accuracy": 0.01171875 }, { "epoch": 51.76923076923077, "grad_norm": 0.4604809880256653, "learning_rate": 0.01, "loss": 4.6317315101623535, "num_input_tokens_seen": 2672968, "step": 673, "train_runtime": 538.4093, "train_tokens_per_second": 4964.565 }, { "epoch": 51.76923076923077, "num_input_tokens_seen": 2672968, "step": 673, "train_accuracy": 0.017578125 }, { "epoch": 51.84615384615385, "grad_norm": 0.518646240234375, "learning_rate": 0.01, "loss": 4.621442794799805, "num_input_tokens_seen": 2677064, "step": 674, "train_runtime": 539.2199, "train_tokens_per_second": 4964.698 }, { "epoch": 51.84615384615385, "num_input_tokens_seen": 2677064, "step": 674, "train_accuracy": 0.005859375 }, { "epoch": 51.92307692307692, "grad_norm": 0.4244747459888458, "learning_rate": 0.01, "loss": 4.609426498413086, "num_input_tokens_seen": 2681160, "step": 675, "train_runtime": 540.0266, "train_tokens_per_second": 4964.867 }, { "epoch": 51.92307692307692, "num_input_tokens_seen": 2681160, "step": 675, "train_accuracy": 0.016286645084619522 }, { "epoch": 52.0, "grad_norm": 0.7208302021026611, "learning_rate": 0.01, "loss": 4.620415210723877, "num_input_tokens_seen": 2683616, "step": 676, "train_runtime": 540.5399, "train_tokens_per_second": 4964.696 }, { "epoch": 52.0, "num_input_tokens_seen": 2683616, "step": 676, "train_accuracy": 0.0078125 }, { "epoch": 52.07692307692308, "grad_norm": 0.6297442317008972, "learning_rate": 0.01, "loss": 4.6504974365234375, "num_input_tokens_seen": 2687712, "step": 677, "train_runtime": 541.3618, "train_tokens_per_second": 4964.724 }, { "epoch": 52.07692307692308, "num_input_tokens_seen": 2687712, "step": 677, "train_accuracy": 0.013671875 }, { "epoch": 52.15384615384615, "grad_norm": 0.5211429595947266, "learning_rate": 0.01, "loss": 4.601546287536621, "num_input_tokens_seen": 2691808, "step": 678, "train_runtime": 542.1729, "train_tokens_per_second": 4964.851 }, { "epoch": 52.15384615384615, "num_input_tokens_seen": 2691808, "step": 678, "train_accuracy": 0.017578125 }, { "epoch": 52.23076923076923, "grad_norm": 0.7010127902030945, "learning_rate": 0.01, "loss": 4.647871971130371, "num_input_tokens_seen": 2695904, "step": 679, "train_runtime": 542.9839, "train_tokens_per_second": 4964.98 }, { "epoch": 52.23076923076923, "num_input_tokens_seen": 2695904, "step": 679, "train_accuracy": 0.013671875 }, { "epoch": 52.30769230769231, "grad_norm": 0.6510889530181885, "learning_rate": 0.01, "loss": 4.646492958068848, "num_input_tokens_seen": 2700000, "step": 680, "train_runtime": 543.795, "train_tokens_per_second": 4965.106 }, { "epoch": 52.30769230769231, "num_input_tokens_seen": 2700000, "step": 680, "train_accuracy": 0.009765625 }, { "epoch": 52.38461538461539, "grad_norm": 0.616940438747406, "learning_rate": 0.01, "loss": 4.585207462310791, "num_input_tokens_seen": 2704096, "step": 681, "train_runtime": 544.6071, "train_tokens_per_second": 4965.224 }, { "epoch": 52.38461538461539, "num_input_tokens_seen": 2704096, "step": 681, "train_accuracy": 0.0078125 }, { "epoch": 52.46153846153846, "grad_norm": 0.4518240988254547, "learning_rate": 0.01, "loss": 4.583968639373779, "num_input_tokens_seen": 2708192, "step": 682, "train_runtime": 545.4181, "train_tokens_per_second": 4965.35 }, { "epoch": 52.46153846153846, "num_input_tokens_seen": 2708192, "step": 682, "train_accuracy": 0.0078125 }, { "epoch": 52.53846153846154, "grad_norm": 0.8632458448410034, "learning_rate": 0.01, "loss": 4.667637825012207, "num_input_tokens_seen": 2712288, "step": 683, "train_runtime": 546.2306, "train_tokens_per_second": 4965.464 }, { "epoch": 52.53846153846154, "num_input_tokens_seen": 2712288, "step": 683, "train_accuracy": 0.015625 }, { "epoch": 52.61538461538461, "grad_norm": 0.9562072157859802, "learning_rate": 0.01, "loss": 4.669644355773926, "num_input_tokens_seen": 2716384, "step": 684, "train_runtime": 547.0419, "train_tokens_per_second": 4965.587 }, { "epoch": 52.61538461538461, "num_input_tokens_seen": 2716384, "step": 684, "train_accuracy": 0.013671875 }, { "epoch": 52.69230769230769, "grad_norm": 0.48732319474220276, "learning_rate": 0.01, "loss": 4.63418436050415, "num_input_tokens_seen": 2720480, "step": 685, "train_runtime": 547.8534, "train_tokens_per_second": 4965.708 }, { "epoch": 52.69230769230769, "num_input_tokens_seen": 2720480, "step": 685, "train_accuracy": 0.009765625 }, { "epoch": 52.76923076923077, "grad_norm": 0.8183702826499939, "learning_rate": 0.01, "loss": 4.641991138458252, "num_input_tokens_seen": 2724576, "step": 686, "train_runtime": 548.6662, "train_tokens_per_second": 4965.817 }, { "epoch": 52.76923076923077, "num_input_tokens_seen": 2724576, "step": 686, "train_accuracy": 0.013671875 }, { "epoch": 52.84615384615385, "grad_norm": 0.4833761751651764, "learning_rate": 0.01, "loss": 4.62351131439209, "num_input_tokens_seen": 2728672, "step": 687, "train_runtime": 549.477, "train_tokens_per_second": 4965.944 }, { "epoch": 52.84615384615385, "num_input_tokens_seen": 2728672, "step": 687, "train_accuracy": 0.0078125 }, { "epoch": 52.92307692307692, "grad_norm": 0.9291377067565918, "learning_rate": 0.01, "loss": 4.693155288696289, "num_input_tokens_seen": 2732768, "step": 688, "train_runtime": 550.2834, "train_tokens_per_second": 4966.11 }, { "epoch": 52.92307692307692, "num_input_tokens_seen": 2732768, "step": 688, "train_accuracy": 0.009771986864507198 }, { "epoch": 53.0, "grad_norm": 0.6080514788627625, "learning_rate": 0.01, "loss": 4.683415412902832, "num_input_tokens_seen": 2735224, "step": 689, "train_runtime": 550.7971, "train_tokens_per_second": 4965.937 }, { "epoch": 53.0, "num_input_tokens_seen": 2735224, "step": 689, "train_accuracy": 0.0078125 }, { "epoch": 53.07692307692308, "grad_norm": 1.0228312015533447, "learning_rate": 0.01, "loss": 4.675637245178223, "num_input_tokens_seen": 2739320, "step": 690, "train_runtime": 551.6232, "train_tokens_per_second": 4965.926 }, { "epoch": 53.07692307692308, "num_input_tokens_seen": 2739320, "step": 690, "train_accuracy": 0.013671875 }, { "epoch": 53.15384615384615, "grad_norm": 0.5086424946784973, "learning_rate": 0.01, "loss": 4.654016971588135, "num_input_tokens_seen": 2743416, "step": 691, "train_runtime": 552.4341, "train_tokens_per_second": 4966.051 }, { "epoch": 53.15384615384615, "num_input_tokens_seen": 2743416, "step": 691, "train_accuracy": 0.015625 }, { "epoch": 53.23076923076923, "grad_norm": 0.929985523223877, "learning_rate": 0.01, "loss": 4.672959327697754, "num_input_tokens_seen": 2747512, "step": 692, "train_runtime": 553.2448, "train_tokens_per_second": 4966.178 }, { "epoch": 53.23076923076923, "num_input_tokens_seen": 2747512, "step": 692, "train_accuracy": 0.0078125 }, { "epoch": 53.30769230769231, "grad_norm": 0.49006387591362, "learning_rate": 0.01, "loss": 4.641401767730713, "num_input_tokens_seen": 2751608, "step": 693, "train_runtime": 554.0558, "train_tokens_per_second": 4966.301 }, { "epoch": 53.30769230769231, "num_input_tokens_seen": 2751608, "step": 693, "train_accuracy": 0.009765625 }, { "epoch": 53.38461538461539, "grad_norm": 1.072021245956421, "learning_rate": 0.01, "loss": 4.657723426818848, "num_input_tokens_seen": 2755704, "step": 694, "train_runtime": 554.8672, "train_tokens_per_second": 4966.421 }, { "epoch": 53.38461538461539, "num_input_tokens_seen": 2755704, "step": 694, "train_accuracy": 0.015625 }, { "epoch": 53.46153846153846, "grad_norm": 0.491686075925827, "learning_rate": 0.01, "loss": 4.653244972229004, "num_input_tokens_seen": 2759800, "step": 695, "train_runtime": 555.6775, "train_tokens_per_second": 4966.55 }, { "epoch": 53.46153846153846, "num_input_tokens_seen": 2759800, "step": 695, "train_accuracy": 0.01171875 }, { "epoch": 53.53846153846154, "grad_norm": 1.2374560832977295, "learning_rate": 0.01, "loss": 4.721195220947266, "num_input_tokens_seen": 2763896, "step": 696, "train_runtime": 556.4879, "train_tokens_per_second": 4966.677 }, { "epoch": 53.53846153846154, "num_input_tokens_seen": 2763896, "step": 696, "train_accuracy": 0.0078125 }, { "epoch": 53.61538461538461, "grad_norm": 0.61308753490448, "learning_rate": 0.01, "loss": 4.64759635925293, "num_input_tokens_seen": 2767992, "step": 697, "train_runtime": 557.2994, "train_tokens_per_second": 4966.795 }, { "epoch": 53.61538461538461, "num_input_tokens_seen": 2767992, "step": 697, "train_accuracy": 0.005859375 }, { "epoch": 53.69230769230769, "grad_norm": 0.5914096236228943, "learning_rate": 0.01, "loss": 4.6311354637146, "num_input_tokens_seen": 2772088, "step": 698, "train_runtime": 558.1101, "train_tokens_per_second": 4966.92 }, { "epoch": 53.69230769230769, "num_input_tokens_seen": 2772088, "step": 698, "train_accuracy": 0.013671875 }, { "epoch": 53.76923076923077, "grad_norm": 0.5452708601951599, "learning_rate": 0.01, "loss": 4.661554336547852, "num_input_tokens_seen": 2776184, "step": 699, "train_runtime": 558.9212, "train_tokens_per_second": 4967.04 }, { "epoch": 53.76923076923077, "num_input_tokens_seen": 2776184, "step": 699, "train_accuracy": 0.0078125 }, { "epoch": 53.84615384615385, "grad_norm": 0.8172363638877869, "learning_rate": 0.01, "loss": 4.6825737953186035, "num_input_tokens_seen": 2780280, "step": 700, "train_runtime": 559.7322, "train_tokens_per_second": 4967.161 }, { "epoch": 53.84615384615385, "eval_CMD_3_branch_eval_accuracy": 0.012658227848101266, "eval_CMD_3_branch_eval_loss": 4.668797016143799, "eval_CMD_3_branch_eval_runtime": 1.1401, "eval_CMD_3_branch_eval_samples_per_second": 2425.183, "eval_CMD_3_branch_eval_steps_per_second": 5.263, "num_input_tokens_seen": 2780280, "step": 700 }, { "epoch": 53.84615384615385, "num_input_tokens_seen": 2780280, "step": 700, "train_accuracy": 0.01171875 }, { "epoch": 53.92307692307692, "grad_norm": 0.7303228974342346, "learning_rate": 0.01, "loss": 4.647892951965332, "num_input_tokens_seen": 2784376, "step": 701, "train_runtime": 561.6836, "train_tokens_per_second": 4957.197 }, { "epoch": 53.92307692307692, "num_input_tokens_seen": 2784376, "step": 701, "train_accuracy": 0.013029315508902073 }, { "epoch": 54.0, "grad_norm": 0.6225734353065491, "learning_rate": 0.01, "loss": 4.695523738861084, "num_input_tokens_seen": 2786832, "step": 702, "train_runtime": 562.197, "train_tokens_per_second": 4957.038 }, { "epoch": 54.0, "num_input_tokens_seen": 2786832, "step": 702, "train_accuracy": 0.01171875 }, { "epoch": 54.07692307692308, "grad_norm": 0.3752252459526062, "learning_rate": 0.01, "loss": 4.623847007751465, "num_input_tokens_seen": 2790928, "step": 703, "train_runtime": 563.0201, "train_tokens_per_second": 4957.066 }, { "epoch": 54.07692307692308, "num_input_tokens_seen": 2790928, "step": 703, "train_accuracy": 0.0078125 }, { "epoch": 54.15384615384615, "grad_norm": 0.5645386576652527, "learning_rate": 0.01, "loss": 4.653515815734863, "num_input_tokens_seen": 2795024, "step": 704, "train_runtime": 563.8314, "train_tokens_per_second": 4957.198 }, { "epoch": 54.15384615384615, "num_input_tokens_seen": 2795024, "step": 704, "train_accuracy": 0.021484375 }, { "epoch": 54.23076923076923, "grad_norm": 0.6331173181533813, "learning_rate": 0.01, "loss": 4.634461402893066, "num_input_tokens_seen": 2799120, "step": 705, "train_runtime": 564.6431, "train_tokens_per_second": 4957.326 }, { "epoch": 54.23076923076923, "num_input_tokens_seen": 2799120, "step": 705, "train_accuracy": 0.015625 }, { "epoch": 54.30769230769231, "grad_norm": 0.655329704284668, "learning_rate": 0.01, "loss": 4.607893466949463, "num_input_tokens_seen": 2803216, "step": 706, "train_runtime": 565.4538, "train_tokens_per_second": 4957.462 }, { "epoch": 54.30769230769231, "num_input_tokens_seen": 2803216, "step": 706, "train_accuracy": 0.01171875 }, { "epoch": 54.38461538461539, "grad_norm": 0.5159600973129272, "learning_rate": 0.01, "loss": 4.5496978759765625, "num_input_tokens_seen": 2807312, "step": 707, "train_runtime": 566.2658, "train_tokens_per_second": 4957.587 }, { "epoch": 54.38461538461539, "num_input_tokens_seen": 2807312, "step": 707, "train_accuracy": 0.009765625 }, { "epoch": 54.46153846153846, "grad_norm": 0.529163122177124, "learning_rate": 0.01, "loss": 4.6628851890563965, "num_input_tokens_seen": 2811408, "step": 708, "train_runtime": 567.0773, "train_tokens_per_second": 4957.716 }, { "epoch": 54.46153846153846, "num_input_tokens_seen": 2811408, "step": 708, "train_accuracy": 0.01171875 }, { "epoch": 54.53846153846154, "grad_norm": 0.7172780632972717, "learning_rate": 0.01, "loss": 4.659363746643066, "num_input_tokens_seen": 2815504, "step": 709, "train_runtime": 567.8884, "train_tokens_per_second": 4957.847 }, { "epoch": 54.53846153846154, "num_input_tokens_seen": 2815504, "step": 709, "train_accuracy": 0.001953125 }, { "epoch": 54.61538461538461, "grad_norm": 0.5487365126609802, "learning_rate": 0.01, "loss": 4.644710540771484, "num_input_tokens_seen": 2819600, "step": 710, "train_runtime": 568.7011, "train_tokens_per_second": 4957.964 }, { "epoch": 54.61538461538461, "num_input_tokens_seen": 2819600, "step": 710, "train_accuracy": 0.01171875 }, { "epoch": 54.69230769230769, "grad_norm": 0.5705341100692749, "learning_rate": 0.01, "loss": 4.6619110107421875, "num_input_tokens_seen": 2823696, "step": 711, "train_runtime": 569.5132, "train_tokens_per_second": 4958.087 }, { "epoch": 54.69230769230769, "num_input_tokens_seen": 2823696, "step": 711, "train_accuracy": 0.01953125 }, { "epoch": 54.76923076923077, "grad_norm": 0.37892526388168335, "learning_rate": 0.01, "loss": 4.606176376342773, "num_input_tokens_seen": 2827792, "step": 712, "train_runtime": 570.3267, "train_tokens_per_second": 4958.197 }, { "epoch": 54.76923076923077, "num_input_tokens_seen": 2827792, "step": 712, "train_accuracy": 0.009765625 }, { "epoch": 54.84615384615385, "grad_norm": 0.8703420758247375, "learning_rate": 0.01, "loss": 4.640538692474365, "num_input_tokens_seen": 2831888, "step": 713, "train_runtime": 571.1386, "train_tokens_per_second": 4958.32 }, { "epoch": 54.84615384615385, "num_input_tokens_seen": 2831888, "step": 713, "train_accuracy": 0.0078125 }, { "epoch": 54.92307692307692, "grad_norm": 0.3756444752216339, "learning_rate": 0.01, "loss": 4.595385551452637, "num_input_tokens_seen": 2835984, "step": 714, "train_runtime": 571.9462, "train_tokens_per_second": 4958.48 }, { "epoch": 54.92307692307692, "num_input_tokens_seen": 2835984, "step": 714, "train_accuracy": 0.0032573288772255182 }, { "epoch": 55.0, "grad_norm": 0.9132266044616699, "learning_rate": 0.01, "loss": 4.677668571472168, "num_input_tokens_seen": 2838440, "step": 715, "train_runtime": 572.461, "train_tokens_per_second": 4958.311 }, { "epoch": 55.0, "num_input_tokens_seen": 2838440, "step": 715, "train_accuracy": 0.013671875 }, { "epoch": 55.07692307692308, "grad_norm": 0.4334953725337982, "learning_rate": 0.01, "loss": 4.614554405212402, "num_input_tokens_seen": 2842536, "step": 716, "train_runtime": 573.2851, "train_tokens_per_second": 4958.328 }, { "epoch": 55.07692307692308, "num_input_tokens_seen": 2842536, "step": 716, "train_accuracy": 0.021484375 }, { "epoch": 55.15384615384615, "grad_norm": 0.4798298478126526, "learning_rate": 0.01, "loss": 4.58780574798584, "num_input_tokens_seen": 2846632, "step": 717, "train_runtime": 574.0977, "train_tokens_per_second": 4958.445 }, { "epoch": 55.15384615384615, "num_input_tokens_seen": 2846632, "step": 717, "train_accuracy": 0.0078125 }, { "epoch": 55.23076923076923, "grad_norm": 0.592604398727417, "learning_rate": 0.01, "loss": 4.646493911743164, "num_input_tokens_seen": 2850728, "step": 718, "train_runtime": 574.909, "train_tokens_per_second": 4958.573 }, { "epoch": 55.23076923076923, "num_input_tokens_seen": 2850728, "step": 718, "train_accuracy": 0.0078125 }, { "epoch": 55.30769230769231, "grad_norm": 0.4955499470233917, "learning_rate": 0.01, "loss": 4.645220756530762, "num_input_tokens_seen": 2854824, "step": 719, "train_runtime": 575.7206, "train_tokens_per_second": 4958.697 }, { "epoch": 55.30769230769231, "num_input_tokens_seen": 2854824, "step": 719, "train_accuracy": 0.0078125 }, { "epoch": 55.38461538461539, "grad_norm": 0.785028874874115, "learning_rate": 0.01, "loss": 4.696919918060303, "num_input_tokens_seen": 2858920, "step": 720, "train_runtime": 576.5321, "train_tokens_per_second": 4958.822 }, { "epoch": 55.38461538461539, "num_input_tokens_seen": 2858920, "step": 720, "train_accuracy": 0.01171875 }, { "epoch": 55.46153846153846, "grad_norm": 0.42734456062316895, "learning_rate": 0.01, "loss": 4.600754737854004, "num_input_tokens_seen": 2863016, "step": 721, "train_runtime": 577.3449, "train_tokens_per_second": 4958.935 }, { "epoch": 55.46153846153846, "num_input_tokens_seen": 2863016, "step": 721, "train_accuracy": 0.01953125 }, { "epoch": 55.53846153846154, "grad_norm": 0.6232092976570129, "learning_rate": 0.01, "loss": 4.644918441772461, "num_input_tokens_seen": 2867112, "step": 722, "train_runtime": 578.1562, "train_tokens_per_second": 4959.061 }, { "epoch": 55.53846153846154, "num_input_tokens_seen": 2867112, "step": 722, "train_accuracy": 0.021484375 }, { "epoch": 55.61538461538461, "grad_norm": 0.5796198844909668, "learning_rate": 0.01, "loss": 4.643170356750488, "num_input_tokens_seen": 2871208, "step": 723, "train_runtime": 578.9673, "train_tokens_per_second": 4959.189 }, { "epoch": 55.61538461538461, "num_input_tokens_seen": 2871208, "step": 723, "train_accuracy": 0.013671875 }, { "epoch": 55.69230769230769, "grad_norm": 0.5011171698570251, "learning_rate": 0.01, "loss": 4.630743026733398, "num_input_tokens_seen": 2875304, "step": 724, "train_runtime": 579.779, "train_tokens_per_second": 4959.31 }, { "epoch": 55.69230769230769, "num_input_tokens_seen": 2875304, "step": 724, "train_accuracy": 0.009765625 }, { "epoch": 55.76923076923077, "grad_norm": 0.4246017038822174, "learning_rate": 0.01, "loss": 4.622054100036621, "num_input_tokens_seen": 2879400, "step": 725, "train_runtime": 580.5921, "train_tokens_per_second": 4959.42 }, { "epoch": 55.76923076923077, "num_input_tokens_seen": 2879400, "step": 725, "train_accuracy": 0.017578125 }, { "epoch": 55.84615384615385, "grad_norm": 0.3628958761692047, "learning_rate": 0.01, "loss": 4.581844329833984, "num_input_tokens_seen": 2883496, "step": 726, "train_runtime": 581.4058, "train_tokens_per_second": 4959.524 }, { "epoch": 55.84615384615385, "num_input_tokens_seen": 2883496, "step": 726, "train_accuracy": 0.0078125 }, { "epoch": 55.92307692307692, "grad_norm": 0.40375009179115295, "learning_rate": 0.01, "loss": 4.625261306762695, "num_input_tokens_seen": 2887592, "step": 727, "train_runtime": 582.2139, "train_tokens_per_second": 4959.676 }, { "epoch": 55.92307692307692, "num_input_tokens_seen": 2887592, "step": 727, "train_accuracy": 0.016286645084619522 }, { "epoch": 56.0, "grad_norm": 0.4562211036682129, "learning_rate": 0.01, "loss": 4.64891242980957, "num_input_tokens_seen": 2890048, "step": 728, "train_runtime": 582.7281, "train_tokens_per_second": 4959.514 }, { "epoch": 56.0, "num_input_tokens_seen": 2890048, "step": 728, "train_accuracy": 0.013671875 }, { "epoch": 56.07692307692308, "grad_norm": 0.4938841164112091, "learning_rate": 0.01, "loss": 4.630170822143555, "num_input_tokens_seen": 2894144, "step": 729, "train_runtime": 583.5544, "train_tokens_per_second": 4959.51 }, { "epoch": 56.07692307692308, "num_input_tokens_seen": 2894144, "step": 729, "train_accuracy": 0.017578125 }, { "epoch": 56.15384615384615, "grad_norm": 0.43323031067848206, "learning_rate": 0.01, "loss": 4.594569206237793, "num_input_tokens_seen": 2898240, "step": 730, "train_runtime": 584.3662, "train_tokens_per_second": 4959.63 }, { "epoch": 56.15384615384615, "num_input_tokens_seen": 2898240, "step": 730, "train_accuracy": 0.01171875 }, { "epoch": 56.23076923076923, "grad_norm": 0.41912975907325745, "learning_rate": 0.01, "loss": 4.605883598327637, "num_input_tokens_seen": 2902336, "step": 731, "train_runtime": 585.1772, "train_tokens_per_second": 4959.756 }, { "epoch": 56.23076923076923, "num_input_tokens_seen": 2902336, "step": 731, "train_accuracy": 0.01953125 }, { "epoch": 56.30769230769231, "grad_norm": 0.31143659353256226, "learning_rate": 0.01, "loss": 4.563133239746094, "num_input_tokens_seen": 2906432, "step": 732, "train_runtime": 585.9885, "train_tokens_per_second": 4959.879 }, { "epoch": 56.30769230769231, "num_input_tokens_seen": 2906432, "step": 732, "train_accuracy": 0.017578125 }, { "epoch": 56.38461538461539, "grad_norm": 0.6525051593780518, "learning_rate": 0.01, "loss": 4.656364917755127, "num_input_tokens_seen": 2910528, "step": 733, "train_runtime": 586.7999, "train_tokens_per_second": 4960.0 }, { "epoch": 56.38461538461539, "num_input_tokens_seen": 2910528, "step": 733, "train_accuracy": 0.009765625 }, { "epoch": 56.46153846153846, "grad_norm": 0.3329682946205139, "learning_rate": 0.01, "loss": 4.611915588378906, "num_input_tokens_seen": 2914624, "step": 734, "train_runtime": 587.6135, "train_tokens_per_second": 4960.104 }, { "epoch": 56.46153846153846, "num_input_tokens_seen": 2914624, "step": 734, "train_accuracy": 0.013671875 }, { "epoch": 56.53846153846154, "grad_norm": 0.640602707862854, "learning_rate": 0.01, "loss": 4.685609340667725, "num_input_tokens_seen": 2918720, "step": 735, "train_runtime": 588.4257, "train_tokens_per_second": 4960.219 }, { "epoch": 56.53846153846154, "num_input_tokens_seen": 2918720, "step": 735, "train_accuracy": 0.00390625 }, { "epoch": 56.61538461538461, "grad_norm": 0.47230076789855957, "learning_rate": 0.01, "loss": 4.608022689819336, "num_input_tokens_seen": 2922816, "step": 736, "train_runtime": 589.2396, "train_tokens_per_second": 4960.318 }, { "epoch": 56.61538461538461, "num_input_tokens_seen": 2922816, "step": 736, "train_accuracy": 0.0078125 }, { "epoch": 56.69230769230769, "grad_norm": 0.452637642621994, "learning_rate": 0.01, "loss": 4.626341819763184, "num_input_tokens_seen": 2926912, "step": 737, "train_runtime": 590.0542, "train_tokens_per_second": 4960.412 }, { "epoch": 56.69230769230769, "num_input_tokens_seen": 2926912, "step": 737, "train_accuracy": 0.013671875 }, { "epoch": 56.76923076923077, "grad_norm": 0.37576910853385925, "learning_rate": 0.01, "loss": 4.564453125, "num_input_tokens_seen": 2931008, "step": 738, "train_runtime": 590.8688, "train_tokens_per_second": 4960.506 }, { "epoch": 56.76923076923077, "num_input_tokens_seen": 2931008, "step": 738, "train_accuracy": 0.01171875 }, { "epoch": 56.84615384615385, "grad_norm": 0.4727272093296051, "learning_rate": 0.01, "loss": 4.6210150718688965, "num_input_tokens_seen": 2935104, "step": 739, "train_runtime": 591.6807, "train_tokens_per_second": 4960.622 }, { "epoch": 56.84615384615385, "num_input_tokens_seen": 2935104, "step": 739, "train_accuracy": 0.005859375 }, { "epoch": 56.92307692307692, "grad_norm": 1.8359097242355347, "learning_rate": 0.01, "loss": 4.627798080444336, "num_input_tokens_seen": 2939200, "step": 740, "train_runtime": 592.4882, "train_tokens_per_second": 4960.774 }, { "epoch": 56.92307692307692, "num_input_tokens_seen": 2939200, "step": 740, "train_accuracy": 0.013029315508902073 }, { "epoch": 57.0, "grad_norm": 0.823265552520752, "learning_rate": 0.01, "loss": 4.645924091339111, "num_input_tokens_seen": 2941656, "step": 741, "train_runtime": 593.0026, "train_tokens_per_second": 4960.612 }, { "epoch": 57.0, "num_input_tokens_seen": 2941656, "step": 741, "train_accuracy": 0.009765625 }, { "epoch": 57.07692307692308, "grad_norm": 0.4464469850063324, "learning_rate": 0.01, "loss": 4.5953593254089355, "num_input_tokens_seen": 2945752, "step": 742, "train_runtime": 593.8268, "train_tokens_per_second": 4960.625 }, { "epoch": 57.07692307692308, "num_input_tokens_seen": 2945752, "step": 742, "train_accuracy": 0.015625 }, { "epoch": 57.15384615384615, "grad_norm": 0.5173393487930298, "learning_rate": 0.01, "loss": 4.618371486663818, "num_input_tokens_seen": 2949848, "step": 743, "train_runtime": 594.6411, "train_tokens_per_second": 4960.72 }, { "epoch": 57.15384615384615, "num_input_tokens_seen": 2949848, "step": 743, "train_accuracy": 0.009765625 }, { "epoch": 57.23076923076923, "grad_norm": 0.6752522587776184, "learning_rate": 0.01, "loss": 4.671770095825195, "num_input_tokens_seen": 2953944, "step": 744, "train_runtime": 595.4542, "train_tokens_per_second": 4960.825 }, { "epoch": 57.23076923076923, "num_input_tokens_seen": 2953944, "step": 744, "train_accuracy": 0.013671875 }, { "epoch": 57.30769230769231, "grad_norm": 0.41735801100730896, "learning_rate": 0.01, "loss": 4.670845985412598, "num_input_tokens_seen": 2958040, "step": 745, "train_runtime": 596.2691, "train_tokens_per_second": 4960.915 }, { "epoch": 57.30769230769231, "num_input_tokens_seen": 2958040, "step": 745, "train_accuracy": 0.01171875 }, { "epoch": 57.38461538461539, "grad_norm": 3.265552520751953, "learning_rate": 0.01, "loss": 4.609025001525879, "num_input_tokens_seen": 2962136, "step": 746, "train_runtime": 597.0835, "train_tokens_per_second": 4961.008 }, { "epoch": 57.38461538461539, "num_input_tokens_seen": 2962136, "step": 746, "train_accuracy": 0.013671875 }, { "epoch": 57.46153846153846, "grad_norm": 0.4434090852737427, "learning_rate": 0.01, "loss": 4.605268955230713, "num_input_tokens_seen": 2966232, "step": 747, "train_runtime": 597.8969, "train_tokens_per_second": 4961.11 }, { "epoch": 57.46153846153846, "num_input_tokens_seen": 2966232, "step": 747, "train_accuracy": 0.017578125 }, { "epoch": 57.53846153846154, "grad_norm": 0.4303193986415863, "learning_rate": 0.01, "loss": 4.568668365478516, "num_input_tokens_seen": 2970328, "step": 748, "train_runtime": 598.7102, "train_tokens_per_second": 4961.212 }, { "epoch": 57.53846153846154, "num_input_tokens_seen": 2970328, "step": 748, "train_accuracy": 0.009765625 }, { "epoch": 57.61538461538461, "grad_norm": 0.5301846861839294, "learning_rate": 0.01, "loss": 4.630484580993652, "num_input_tokens_seen": 2974424, "step": 749, "train_runtime": 599.5228, "train_tokens_per_second": 4961.319 }, { "epoch": 57.61538461538461, "num_input_tokens_seen": 2974424, "step": 749, "train_accuracy": 0.029296875 }, { "epoch": 57.69230769230769, "grad_norm": 0.5873321890830994, "learning_rate": 0.01, "loss": 4.623235702514648, "num_input_tokens_seen": 2978520, "step": 750, "train_runtime": 600.3348, "train_tokens_per_second": 4961.431 }, { "epoch": 57.69230769230769, "num_input_tokens_seen": 2978520, "step": 750, "train_accuracy": 0.013671875 }, { "epoch": 57.76923076923077, "grad_norm": 0.4589889943599701, "learning_rate": 0.01, "loss": 4.675217628479004, "num_input_tokens_seen": 2982616, "step": 751, "train_runtime": 601.1469, "train_tokens_per_second": 4961.543 }, { "epoch": 57.76923076923077, "num_input_tokens_seen": 2982616, "step": 751, "train_accuracy": 0.013671875 }, { "epoch": 57.84615384615385, "grad_norm": 0.41689085960388184, "learning_rate": 0.01, "loss": 4.664083957672119, "num_input_tokens_seen": 2986712, "step": 752, "train_runtime": 601.9606, "train_tokens_per_second": 4961.641 }, { "epoch": 57.84615384615385, "num_input_tokens_seen": 2986712, "step": 752, "train_accuracy": 0.0078125 }, { "epoch": 57.92307692307692, "grad_norm": 0.38346293568611145, "learning_rate": 0.01, "loss": 4.640788555145264, "num_input_tokens_seen": 2990808, "step": 753, "train_runtime": 602.7696, "train_tokens_per_second": 4961.777 }, { "epoch": 57.92307692307692, "num_input_tokens_seen": 2990808, "step": 753, "train_accuracy": 0.016286645084619522 }, { "epoch": 58.0, "grad_norm": 0.5533782839775085, "learning_rate": 0.01, "loss": 4.685469627380371, "num_input_tokens_seen": 2993264, "step": 754, "train_runtime": 603.2851, "train_tokens_per_second": 4961.608 }, { "epoch": 58.0, "num_input_tokens_seen": 2993264, "step": 754, "train_accuracy": 0.009765625 }, { "epoch": 58.07692307692308, "grad_norm": 0.5619157552719116, "learning_rate": 0.01, "loss": 4.628260135650635, "num_input_tokens_seen": 2997360, "step": 755, "train_runtime": 604.1118, "train_tokens_per_second": 4961.598 }, { "epoch": 58.07692307692308, "num_input_tokens_seen": 2997360, "step": 755, "train_accuracy": 0.0078125 }, { "epoch": 58.15384615384615, "grad_norm": 0.5559141039848328, "learning_rate": 0.01, "loss": 4.6344099044799805, "num_input_tokens_seen": 3001456, "step": 756, "train_runtime": 604.9264, "train_tokens_per_second": 4961.688 }, { "epoch": 58.15384615384615, "num_input_tokens_seen": 3001456, "step": 756, "train_accuracy": 0.009765625 }, { "epoch": 58.23076923076923, "grad_norm": 0.4944635033607483, "learning_rate": 0.01, "loss": 4.611584186553955, "num_input_tokens_seen": 3005552, "step": 757, "train_runtime": 605.7408, "train_tokens_per_second": 4961.779 }, { "epoch": 58.23076923076923, "num_input_tokens_seen": 3005552, "step": 757, "train_accuracy": 0.013671875 }, { "epoch": 58.30769230769231, "grad_norm": 0.42360833287239075, "learning_rate": 0.01, "loss": 4.624504566192627, "num_input_tokens_seen": 3009648, "step": 758, "train_runtime": 606.5549, "train_tokens_per_second": 4961.873 }, { "epoch": 58.30769230769231, "num_input_tokens_seen": 3009648, "step": 758, "train_accuracy": 0.015625 }, { "epoch": 58.38461538461539, "grad_norm": 0.4611240327358246, "learning_rate": 0.01, "loss": 4.658176898956299, "num_input_tokens_seen": 3013744, "step": 759, "train_runtime": 607.3699, "train_tokens_per_second": 4961.958 }, { "epoch": 58.38461538461539, "num_input_tokens_seen": 3013744, "step": 759, "train_accuracy": 0.01953125 }, { "epoch": 58.46153846153846, "grad_norm": 0.3276404142379761, "learning_rate": 0.01, "loss": 4.597156524658203, "num_input_tokens_seen": 3017840, "step": 760, "train_runtime": 608.1852, "train_tokens_per_second": 4962.041 }, { "epoch": 58.46153846153846, "num_input_tokens_seen": 3017840, "step": 760, "train_accuracy": 0.01171875 }, { "epoch": 58.53846153846154, "grad_norm": 0.5247175097465515, "learning_rate": 0.01, "loss": 4.647055625915527, "num_input_tokens_seen": 3021936, "step": 761, "train_runtime": 608.9994, "train_tokens_per_second": 4962.133 }, { "epoch": 58.53846153846154, "num_input_tokens_seen": 3021936, "step": 761, "train_accuracy": 0.015625 }, { "epoch": 58.61538461538461, "grad_norm": 0.9190148711204529, "learning_rate": 0.01, "loss": 4.61857271194458, "num_input_tokens_seen": 3026032, "step": 762, "train_runtime": 609.8158, "train_tokens_per_second": 4962.207 }, { "epoch": 58.61538461538461, "num_input_tokens_seen": 3026032, "step": 762, "train_accuracy": 0.005859375 }, { "epoch": 58.69230769230769, "grad_norm": 0.41588884592056274, "learning_rate": 0.01, "loss": 4.630764007568359, "num_input_tokens_seen": 3030128, "step": 763, "train_runtime": 610.6304, "train_tokens_per_second": 4962.295 }, { "epoch": 58.69230769230769, "num_input_tokens_seen": 3030128, "step": 763, "train_accuracy": 0.015625 }, { "epoch": 58.76923076923077, "grad_norm": 0.4531322717666626, "learning_rate": 0.01, "loss": 4.6122589111328125, "num_input_tokens_seen": 3034224, "step": 764, "train_runtime": 611.4467, "train_tokens_per_second": 4962.369 }, { "epoch": 58.76923076923077, "num_input_tokens_seen": 3034224, "step": 764, "train_accuracy": 0.01171875 }, { "epoch": 58.84615384615385, "grad_norm": 0.5354483723640442, "learning_rate": 0.01, "loss": 4.611150741577148, "num_input_tokens_seen": 3038320, "step": 765, "train_runtime": 612.2621, "train_tokens_per_second": 4962.45 }, { "epoch": 58.84615384615385, "num_input_tokens_seen": 3038320, "step": 765, "train_accuracy": 0.005859375 }, { "epoch": 58.92307692307692, "grad_norm": 0.35458430647850037, "learning_rate": 0.01, "loss": 4.661350727081299, "num_input_tokens_seen": 3042416, "step": 766, "train_runtime": 613.0735, "train_tokens_per_second": 4962.563 }, { "epoch": 58.92307692307692, "num_input_tokens_seen": 3042416, "step": 766, "train_accuracy": 0.009771986864507198 }, { "epoch": 59.0, "grad_norm": 0.5755992531776428, "learning_rate": 0.01, "loss": 4.634483337402344, "num_input_tokens_seen": 3044872, "step": 767, "train_runtime": 613.5895, "train_tokens_per_second": 4962.392 }, { "epoch": 59.0, "num_input_tokens_seen": 3044872, "step": 767, "train_accuracy": 0.009765625 }, { "epoch": 59.07692307692308, "grad_norm": 0.6252405047416687, "learning_rate": 0.01, "loss": 4.6295247077941895, "num_input_tokens_seen": 3048968, "step": 768, "train_runtime": 614.4156, "train_tokens_per_second": 4962.387 }, { "epoch": 59.07692307692308, "num_input_tokens_seen": 3048968, "step": 768, "train_accuracy": 0.009765625 }, { "epoch": 59.15384615384615, "grad_norm": 0.6782728433609009, "learning_rate": 0.01, "loss": 4.613170623779297, "num_input_tokens_seen": 3053064, "step": 769, "train_runtime": 615.2305, "train_tokens_per_second": 4962.472 }, { "epoch": 59.15384615384615, "num_input_tokens_seen": 3053064, "step": 769, "train_accuracy": 0.013671875 }, { "epoch": 59.23076923076923, "grad_norm": 0.5422839522361755, "learning_rate": 0.01, "loss": 4.658756256103516, "num_input_tokens_seen": 3057160, "step": 770, "train_runtime": 616.0472, "train_tokens_per_second": 4962.542 }, { "epoch": 59.23076923076923, "num_input_tokens_seen": 3057160, "step": 770, "train_accuracy": 0.0234375 }, { "epoch": 59.30769230769231, "grad_norm": 0.7251322865486145, "learning_rate": 0.01, "loss": 4.618936538696289, "num_input_tokens_seen": 3061256, "step": 771, "train_runtime": 616.8623, "train_tokens_per_second": 4962.625 }, { "epoch": 59.30769230769231, "num_input_tokens_seen": 3061256, "step": 771, "train_accuracy": 0.015625 }, { "epoch": 59.38461538461539, "grad_norm": 0.47734972834587097, "learning_rate": 0.01, "loss": 4.614592552185059, "num_input_tokens_seen": 3065352, "step": 772, "train_runtime": 617.6782, "train_tokens_per_second": 4962.701 }, { "epoch": 59.38461538461539, "num_input_tokens_seen": 3065352, "step": 772, "train_accuracy": 0.013671875 }, { "epoch": 59.46153846153846, "grad_norm": 0.5645265579223633, "learning_rate": 0.01, "loss": 4.658867359161377, "num_input_tokens_seen": 3069448, "step": 773, "train_runtime": 618.4939, "train_tokens_per_second": 4962.778 }, { "epoch": 59.46153846153846, "num_input_tokens_seen": 3069448, "step": 773, "train_accuracy": 0.017578125 }, { "epoch": 59.53846153846154, "grad_norm": 0.5353477001190186, "learning_rate": 0.01, "loss": 4.621963024139404, "num_input_tokens_seen": 3073544, "step": 774, "train_runtime": 619.3092, "train_tokens_per_second": 4962.858 }, { "epoch": 59.53846153846154, "num_input_tokens_seen": 3073544, "step": 774, "train_accuracy": 0.015625 }, { "epoch": 59.61538461538461, "grad_norm": 0.3467482924461365, "learning_rate": 0.01, "loss": 4.559604644775391, "num_input_tokens_seen": 3077640, "step": 775, "train_runtime": 620.1247, "train_tokens_per_second": 4962.937 }, { "epoch": 59.61538461538461, "num_input_tokens_seen": 3077640, "step": 775, "train_accuracy": 0.01171875 }, { "epoch": 59.69230769230769, "grad_norm": 0.6668217778205872, "learning_rate": 0.01, "loss": 4.629401206970215, "num_input_tokens_seen": 3081736, "step": 776, "train_runtime": 620.9392, "train_tokens_per_second": 4963.023 }, { "epoch": 59.69230769230769, "num_input_tokens_seen": 3081736, "step": 776, "train_accuracy": 0.0078125 }, { "epoch": 59.76923076923077, "grad_norm": 0.5376278758049011, "learning_rate": 0.01, "loss": 4.66391658782959, "num_input_tokens_seen": 3085832, "step": 777, "train_runtime": 621.7551, "train_tokens_per_second": 4963.099 }, { "epoch": 59.76923076923077, "num_input_tokens_seen": 3085832, "step": 777, "train_accuracy": 0.021484375 }, { "epoch": 59.84615384615385, "grad_norm": 0.6031669974327087, "learning_rate": 0.01, "loss": 4.584033012390137, "num_input_tokens_seen": 3089928, "step": 778, "train_runtime": 622.5694, "train_tokens_per_second": 4963.187 }, { "epoch": 59.84615384615385, "num_input_tokens_seen": 3089928, "step": 778, "train_accuracy": 0.01953125 }, { "epoch": 59.92307692307692, "grad_norm": 0.4091344475746155, "learning_rate": 0.01, "loss": 4.601544380187988, "num_input_tokens_seen": 3094024, "step": 779, "train_runtime": 623.3806, "train_tokens_per_second": 4963.299 }, { "epoch": 59.92307692307692, "num_input_tokens_seen": 3094024, "step": 779, "train_accuracy": 0.009771986864507198 }, { "epoch": 60.0, "grad_norm": 0.769387423992157, "learning_rate": 0.01, "loss": 4.655564308166504, "num_input_tokens_seen": 3096480, "step": 780, "train_runtime": 623.8971, "train_tokens_per_second": 4963.126 }, { "epoch": 60.0, "num_input_tokens_seen": 3096480, "step": 780, "train_accuracy": 0.01171875 }, { "epoch": 60.07692307692308, "grad_norm": 1.0533069372177124, "learning_rate": 0.01, "loss": 4.592347621917725, "num_input_tokens_seen": 3100576, "step": 781, "train_runtime": 624.7232, "train_tokens_per_second": 4963.12 }, { "epoch": 60.07692307692308, "num_input_tokens_seen": 3100576, "step": 781, "train_accuracy": 0.017578125 }, { "epoch": 60.15384615384615, "grad_norm": 0.5696276426315308, "learning_rate": 0.01, "loss": 4.577451705932617, "num_input_tokens_seen": 3104672, "step": 782, "train_runtime": 625.5381, "train_tokens_per_second": 4963.202 }, { "epoch": 60.15384615384615, "num_input_tokens_seen": 3104672, "step": 782, "train_accuracy": 0.013671875 }, { "epoch": 60.23076923076923, "grad_norm": 0.4790893793106079, "learning_rate": 0.01, "loss": 4.570064544677734, "num_input_tokens_seen": 3108768, "step": 783, "train_runtime": 626.3531, "train_tokens_per_second": 4963.283 }, { "epoch": 60.23076923076923, "num_input_tokens_seen": 3108768, "step": 783, "train_accuracy": 0.0234375 }, { "epoch": 60.30769230769231, "grad_norm": 0.3884826600551605, "learning_rate": 0.01, "loss": 4.581583023071289, "num_input_tokens_seen": 3112864, "step": 784, "train_runtime": 627.1676, "train_tokens_per_second": 4963.369 }, { "epoch": 60.30769230769231, "num_input_tokens_seen": 3112864, "step": 784, "train_accuracy": 0.015625 }, { "epoch": 60.38461538461539, "grad_norm": 0.5839759707450867, "learning_rate": 0.01, "loss": 4.604778289794922, "num_input_tokens_seen": 3116960, "step": 785, "train_runtime": 627.9834, "train_tokens_per_second": 4963.444 }, { "epoch": 60.38461538461539, "num_input_tokens_seen": 3116960, "step": 785, "train_accuracy": 0.015625 }, { "epoch": 60.46153846153846, "grad_norm": 0.337950736284256, "learning_rate": 0.01, "loss": 4.588187217712402, "num_input_tokens_seen": 3121056, "step": 786, "train_runtime": 628.7993, "train_tokens_per_second": 4963.517 }, { "epoch": 60.46153846153846, "num_input_tokens_seen": 3121056, "step": 786, "train_accuracy": 0.009765625 }, { "epoch": 60.53846153846154, "grad_norm": 0.7020766735076904, "learning_rate": 0.01, "loss": 4.6410064697265625, "num_input_tokens_seen": 3125152, "step": 787, "train_runtime": 629.6208, "train_tokens_per_second": 4963.546 }, { "epoch": 60.53846153846154, "num_input_tokens_seen": 3125152, "step": 787, "train_accuracy": 0.013671875 }, { "epoch": 60.61538461538461, "grad_norm": 0.5368402600288391, "learning_rate": 0.01, "loss": 4.639837265014648, "num_input_tokens_seen": 3129248, "step": 788, "train_runtime": 630.4378, "train_tokens_per_second": 4963.611 }, { "epoch": 60.61538461538461, "num_input_tokens_seen": 3129248, "step": 788, "train_accuracy": 0.015625 }, { "epoch": 60.69230769230769, "grad_norm": 0.47061866521835327, "learning_rate": 0.01, "loss": 4.574796676635742, "num_input_tokens_seen": 3133344, "step": 789, "train_runtime": 631.2552, "train_tokens_per_second": 4963.672 }, { "epoch": 60.69230769230769, "num_input_tokens_seen": 3133344, "step": 789, "train_accuracy": 0.01953125 }, { "epoch": 60.76923076923077, "grad_norm": 0.4266293942928314, "learning_rate": 0.01, "loss": 4.553921699523926, "num_input_tokens_seen": 3137440, "step": 790, "train_runtime": 632.0714, "train_tokens_per_second": 4963.743 }, { "epoch": 60.76923076923077, "num_input_tokens_seen": 3137440, "step": 790, "train_accuracy": 0.021484375 }, { "epoch": 60.84615384615385, "grad_norm": 0.38818246126174927, "learning_rate": 0.01, "loss": 4.5928239822387695, "num_input_tokens_seen": 3141536, "step": 791, "train_runtime": 632.8886, "train_tokens_per_second": 4963.806 }, { "epoch": 60.84615384615385, "num_input_tokens_seen": 3141536, "step": 791, "train_accuracy": 0.009765625 }, { "epoch": 60.92307692307692, "grad_norm": 0.5804455280303955, "learning_rate": 0.01, "loss": 4.585761070251465, "num_input_tokens_seen": 3145632, "step": 792, "train_runtime": 633.7005, "train_tokens_per_second": 4963.91 }, { "epoch": 60.92307692307692, "num_input_tokens_seen": 3145632, "step": 792, "train_accuracy": 0.009771986864507198 }, { "epoch": 61.0, "grad_norm": 0.480523943901062, "learning_rate": 0.01, "loss": 4.664402961730957, "num_input_tokens_seen": 3148088, "step": 793, "train_runtime": 634.2165, "train_tokens_per_second": 4963.743 }, { "epoch": 61.0, "num_input_tokens_seen": 3148088, "step": 793, "train_accuracy": 0.01171875 }, { "epoch": 61.07692307692308, "grad_norm": 0.3555164933204651, "learning_rate": 0.01, "loss": 4.57891845703125, "num_input_tokens_seen": 3152184, "step": 794, "train_runtime": 635.0434, "train_tokens_per_second": 4963.73 }, { "epoch": 61.07692307692308, "num_input_tokens_seen": 3152184, "step": 794, "train_accuracy": 0.013671875 }, { "epoch": 61.15384615384615, "grad_norm": 0.4352375864982605, "learning_rate": 0.01, "loss": 4.668402194976807, "num_input_tokens_seen": 3156280, "step": 795, "train_runtime": 635.8599, "train_tokens_per_second": 4963.798 }, { "epoch": 61.15384615384615, "num_input_tokens_seen": 3156280, "step": 795, "train_accuracy": 0.013671875 }, { "epoch": 61.23076923076923, "grad_norm": 0.6781975626945496, "learning_rate": 0.01, "loss": 4.623663902282715, "num_input_tokens_seen": 3160376, "step": 796, "train_runtime": 636.6749, "train_tokens_per_second": 4963.877 }, { "epoch": 61.23076923076923, "num_input_tokens_seen": 3160376, "step": 796, "train_accuracy": 0.009765625 }, { "epoch": 61.30769230769231, "grad_norm": 0.47450610995292664, "learning_rate": 0.01, "loss": 4.609356880187988, "num_input_tokens_seen": 3164472, "step": 797, "train_runtime": 637.4895, "train_tokens_per_second": 4963.959 }, { "epoch": 61.30769230769231, "num_input_tokens_seen": 3164472, "step": 797, "train_accuracy": 0.025390625 }, { "epoch": 61.38461538461539, "grad_norm": 0.63689124584198, "learning_rate": 0.01, "loss": 4.566770553588867, "num_input_tokens_seen": 3168568, "step": 798, "train_runtime": 638.3052, "train_tokens_per_second": 4964.033 }, { "epoch": 61.38461538461539, "num_input_tokens_seen": 3168568, "step": 798, "train_accuracy": 0.03125 }, { "epoch": 61.46153846153846, "grad_norm": 0.2824016511440277, "learning_rate": 0.01, "loss": 4.541934013366699, "num_input_tokens_seen": 3172664, "step": 799, "train_runtime": 639.1201, "train_tokens_per_second": 4964.113 }, { "epoch": 61.46153846153846, "num_input_tokens_seen": 3172664, "step": 799, "train_accuracy": 0.01171875 }, { "epoch": 61.53846153846154, "grad_norm": 0.5654345154762268, "learning_rate": 0.01, "loss": 4.638147354125977, "num_input_tokens_seen": 3176760, "step": 800, "train_runtime": 639.9355, "train_tokens_per_second": 4964.188 }, { "epoch": 61.53846153846154, "eval_CMD_3_branch_eval_accuracy": 0.009403254972875226, "eval_CMD_3_branch_eval_loss": 4.673147678375244, "eval_CMD_3_branch_eval_runtime": 1.1525, "eval_CMD_3_branch_eval_samples_per_second": 2399.235, "eval_CMD_3_branch_eval_steps_per_second": 5.206, "num_input_tokens_seen": 3176760, "step": 800 }, { "epoch": 61.53846153846154, "num_input_tokens_seen": 3176760, "step": 800, "train_accuracy": 0.009765625 }, { "epoch": 61.61538461538461, "grad_norm": 0.4775870740413666, "learning_rate": 0.01, "loss": 4.564815521240234, "num_input_tokens_seen": 3180856, "step": 801, "train_runtime": 641.9086, "train_tokens_per_second": 4955.31 }, { "epoch": 61.61538461538461, "num_input_tokens_seen": 3180856, "step": 801, "train_accuracy": 0.01953125 }, { "epoch": 61.69230769230769, "grad_norm": 0.4272870421409607, "learning_rate": 0.01, "loss": 4.57087516784668, "num_input_tokens_seen": 3184952, "step": 802, "train_runtime": 642.724, "train_tokens_per_second": 4955.396 }, { "epoch": 61.69230769230769, "num_input_tokens_seen": 3184952, "step": 802, "train_accuracy": 0.015625 }, { "epoch": 61.76923076923077, "grad_norm": 0.44081181287765503, "learning_rate": 0.01, "loss": 4.596053123474121, "num_input_tokens_seen": 3189048, "step": 803, "train_runtime": 643.5392, "train_tokens_per_second": 4955.484 }, { "epoch": 61.76923076923077, "num_input_tokens_seen": 3189048, "step": 803, "train_accuracy": 0.015625 }, { "epoch": 61.84615384615385, "grad_norm": 0.8313249945640564, "learning_rate": 0.01, "loss": 4.604004859924316, "num_input_tokens_seen": 3193144, "step": 804, "train_runtime": 644.355, "train_tokens_per_second": 4955.566 }, { "epoch": 61.84615384615385, "num_input_tokens_seen": 3193144, "step": 804, "train_accuracy": 0.017578125 }, { "epoch": 61.92307692307692, "grad_norm": 0.40859705209732056, "learning_rate": 0.01, "loss": 4.617779731750488, "num_input_tokens_seen": 3197240, "step": 805, "train_runtime": 645.1682, "train_tokens_per_second": 4955.669 }, { "epoch": 61.92307692307692, "num_input_tokens_seen": 3197240, "step": 805, "train_accuracy": 0.013029315508902073 }, { "epoch": 62.0, "grad_norm": 0.8009452223777771, "learning_rate": 0.01, "loss": 4.670826435089111, "num_input_tokens_seen": 3199696, "step": 806, "train_runtime": 645.6839, "train_tokens_per_second": 4955.515 }, { "epoch": 62.0, "num_input_tokens_seen": 3199696, "step": 806, "train_accuracy": 0.015625 }, { "epoch": 62.07692307692308, "grad_norm": 0.4048238694667816, "learning_rate": 0.01, "loss": 4.574530601501465, "num_input_tokens_seen": 3203792, "step": 807, "train_runtime": 646.5116, "train_tokens_per_second": 4955.506 }, { "epoch": 62.07692307692308, "num_input_tokens_seen": 3203792, "step": 807, "train_accuracy": 0.017578125 }, { "epoch": 62.15384615384615, "grad_norm": 0.5081648230552673, "learning_rate": 0.01, "loss": 4.61641263961792, "num_input_tokens_seen": 3207888, "step": 808, "train_runtime": 647.3274, "train_tokens_per_second": 4955.588 }, { "epoch": 62.15384615384615, "num_input_tokens_seen": 3207888, "step": 808, "train_accuracy": 0.015625 }, { "epoch": 62.23076923076923, "grad_norm": 0.3222755491733551, "learning_rate": 0.01, "loss": 4.564643859863281, "num_input_tokens_seen": 3211984, "step": 809, "train_runtime": 648.144, "train_tokens_per_second": 4955.664 }, { "epoch": 62.23076923076923, "num_input_tokens_seen": 3211984, "step": 809, "train_accuracy": 0.017578125 }, { "epoch": 62.30769230769231, "grad_norm": 0.41443246603012085, "learning_rate": 0.01, "loss": 4.546332359313965, "num_input_tokens_seen": 3216080, "step": 810, "train_runtime": 648.9592, "train_tokens_per_second": 4955.75 }, { "epoch": 62.30769230769231, "num_input_tokens_seen": 3216080, "step": 810, "train_accuracy": 0.005859375 }, { "epoch": 62.38461538461539, "grad_norm": 0.39902424812316895, "learning_rate": 0.01, "loss": 4.5842790603637695, "num_input_tokens_seen": 3220176, "step": 811, "train_runtime": 649.7759, "train_tokens_per_second": 4955.826 }, { "epoch": 62.38461538461539, "num_input_tokens_seen": 3220176, "step": 811, "train_accuracy": 0.0078125 }, { "epoch": 62.46153846153846, "grad_norm": 0.7111110091209412, "learning_rate": 0.01, "loss": 4.599859237670898, "num_input_tokens_seen": 3224272, "step": 812, "train_runtime": 650.5915, "train_tokens_per_second": 4955.909 }, { "epoch": 62.46153846153846, "num_input_tokens_seen": 3224272, "step": 812, "train_accuracy": 0.005859375 }, { "epoch": 62.53846153846154, "grad_norm": 0.34514543414115906, "learning_rate": 0.01, "loss": 4.589466094970703, "num_input_tokens_seen": 3228368, "step": 813, "train_runtime": 651.4081, "train_tokens_per_second": 4955.984 }, { "epoch": 62.53846153846154, "num_input_tokens_seen": 3228368, "step": 813, "train_accuracy": 0.009765625 }, { "epoch": 62.61538461538461, "grad_norm": 0.36978796124458313, "learning_rate": 0.01, "loss": 4.593320846557617, "num_input_tokens_seen": 3232464, "step": 814, "train_runtime": 652.2257, "train_tokens_per_second": 4956.051 }, { "epoch": 62.61538461538461, "num_input_tokens_seen": 3232464, "step": 814, "train_accuracy": 0.021484375 }, { "epoch": 62.69230769230769, "grad_norm": 0.5854072570800781, "learning_rate": 0.01, "loss": 4.576139450073242, "num_input_tokens_seen": 3236560, "step": 815, "train_runtime": 653.044, "train_tokens_per_second": 4956.113 }, { "epoch": 62.69230769230769, "num_input_tokens_seen": 3236560, "step": 815, "train_accuracy": 0.013671875 }, { "epoch": 62.76923076923077, "grad_norm": 0.3284805417060852, "learning_rate": 0.01, "loss": 4.58418083190918, "num_input_tokens_seen": 3240656, "step": 816, "train_runtime": 653.8605, "train_tokens_per_second": 4956.189 }, { "epoch": 62.76923076923077, "num_input_tokens_seen": 3240656, "step": 816, "train_accuracy": 0.013671875 }, { "epoch": 62.84615384615385, "grad_norm": 0.5775055885314941, "learning_rate": 0.01, "loss": 4.60098934173584, "num_input_tokens_seen": 3244752, "step": 817, "train_runtime": 654.6787, "train_tokens_per_second": 4956.251 }, { "epoch": 62.84615384615385, "num_input_tokens_seen": 3244752, "step": 817, "train_accuracy": 0.01953125 }, { "epoch": 62.92307692307692, "grad_norm": 0.4311469495296478, "learning_rate": 0.01, "loss": 4.5810322761535645, "num_input_tokens_seen": 3248848, "step": 818, "train_runtime": 655.49, "train_tokens_per_second": 4956.365 }, { "epoch": 62.92307692307692, "num_input_tokens_seen": 3248848, "step": 818, "train_accuracy": 0.009771986864507198 }, { "epoch": 63.0, "grad_norm": 0.41363051533699036, "learning_rate": 0.01, "loss": 4.620242595672607, "num_input_tokens_seen": 3251304, "step": 819, "train_runtime": 656.007, "train_tokens_per_second": 4956.203 }, { "epoch": 63.0, "num_input_tokens_seen": 3251304, "step": 819, "train_accuracy": 0.013671875 }, { "epoch": 63.07692307692308, "grad_norm": 0.46569857001304626, "learning_rate": 0.01, "loss": 4.544882774353027, "num_input_tokens_seen": 3255400, "step": 820, "train_runtime": 656.8351, "train_tokens_per_second": 4956.191 }, { "epoch": 63.07692307692308, "num_input_tokens_seen": 3255400, "step": 820, "train_accuracy": 0.015625 }, { "epoch": 63.15384615384615, "grad_norm": 0.5212401151657104, "learning_rate": 0.01, "loss": 4.550348281860352, "num_input_tokens_seen": 3259496, "step": 821, "train_runtime": 657.653, "train_tokens_per_second": 4956.255 }, { "epoch": 63.15384615384615, "num_input_tokens_seen": 3259496, "step": 821, "train_accuracy": 0.01171875 }, { "epoch": 63.23076923076923, "grad_norm": 0.3535076975822449, "learning_rate": 0.01, "loss": 4.574855804443359, "num_input_tokens_seen": 3263592, "step": 822, "train_runtime": 658.4702, "train_tokens_per_second": 4956.325 }, { "epoch": 63.23076923076923, "num_input_tokens_seen": 3263592, "step": 822, "train_accuracy": 0.0234375 }, { "epoch": 63.30769230769231, "grad_norm": 0.31359365582466125, "learning_rate": 0.01, "loss": 4.522514820098877, "num_input_tokens_seen": 3267688, "step": 823, "train_runtime": 659.2856, "train_tokens_per_second": 4956.407 }, { "epoch": 63.30769230769231, "num_input_tokens_seen": 3267688, "step": 823, "train_accuracy": 0.021484375 }, { "epoch": 63.38461538461539, "grad_norm": 2.1746299266815186, "learning_rate": 0.01, "loss": 4.580921173095703, "num_input_tokens_seen": 3271784, "step": 824, "train_runtime": 660.1022, "train_tokens_per_second": 4956.481 }, { "epoch": 63.38461538461539, "num_input_tokens_seen": 3271784, "step": 824, "train_accuracy": 0.025390625 }, { "epoch": 63.46153846153846, "grad_norm": 0.36821866035461426, "learning_rate": 0.01, "loss": 4.554903984069824, "num_input_tokens_seen": 3275880, "step": 825, "train_runtime": 660.9182, "train_tokens_per_second": 4956.559 }, { "epoch": 63.46153846153846, "num_input_tokens_seen": 3275880, "step": 825, "train_accuracy": 0.013671875 }, { "epoch": 63.53846153846154, "grad_norm": 0.8334118127822876, "learning_rate": 0.01, "loss": 4.595179557800293, "num_input_tokens_seen": 3279976, "step": 826, "train_runtime": 661.7356, "train_tokens_per_second": 4956.626 }, { "epoch": 63.53846153846154, "num_input_tokens_seen": 3279976, "step": 826, "train_accuracy": 0.01171875 }, { "epoch": 63.61538461538461, "grad_norm": 0.459299236536026, "learning_rate": 0.01, "loss": 4.620095252990723, "num_input_tokens_seen": 3284072, "step": 827, "train_runtime": 662.554, "train_tokens_per_second": 4956.686 }, { "epoch": 63.61538461538461, "num_input_tokens_seen": 3284072, "step": 827, "train_accuracy": 0.021484375 }, { "epoch": 63.69230769230769, "grad_norm": 0.2941116392612457, "learning_rate": 0.01, "loss": 4.52593994140625, "num_input_tokens_seen": 3288168, "step": 828, "train_runtime": 663.3716, "train_tokens_per_second": 4956.751 }, { "epoch": 63.69230769230769, "num_input_tokens_seen": 3288168, "step": 828, "train_accuracy": 0.015625 }, { "epoch": 63.76923076923077, "grad_norm": 0.42291563749313354, "learning_rate": 0.01, "loss": 4.538573265075684, "num_input_tokens_seen": 3292264, "step": 829, "train_runtime": 664.188, "train_tokens_per_second": 4956.826 }, { "epoch": 63.76923076923077, "num_input_tokens_seen": 3292264, "step": 829, "train_accuracy": 0.00390625 }, { "epoch": 63.84615384615385, "grad_norm": 0.868320643901825, "learning_rate": 0.01, "loss": 4.574146747589111, "num_input_tokens_seen": 3296360, "step": 830, "train_runtime": 665.0058, "train_tokens_per_second": 4956.889 }, { "epoch": 63.84615384615385, "num_input_tokens_seen": 3296360, "step": 830, "train_accuracy": 0.01171875 }, { "epoch": 63.92307692307692, "grad_norm": 0.25749003887176514, "learning_rate": 0.01, "loss": 4.5796589851379395, "num_input_tokens_seen": 3300456, "step": 831, "train_runtime": 665.8176, "train_tokens_per_second": 4956.997 }, { "epoch": 63.92307692307692, "num_input_tokens_seen": 3300456, "step": 831, "train_accuracy": 0.013029315508902073 }, { "epoch": 64.0, "grad_norm": 0.52784663438797, "learning_rate": 0.01, "loss": 4.594731330871582, "num_input_tokens_seen": 3302912, "step": 832, "train_runtime": 666.3346, "train_tokens_per_second": 4956.837 }, { "epoch": 64.0, "num_input_tokens_seen": 3302912, "step": 832, "train_accuracy": 0.015625 }, { "epoch": 64.07692307692308, "grad_norm": 0.3691712021827698, "learning_rate": 0.01, "loss": 4.568826675415039, "num_input_tokens_seen": 3307008, "step": 833, "train_runtime": 667.1629, "train_tokens_per_second": 4956.823 }, { "epoch": 64.07692307692308, "num_input_tokens_seen": 3307008, "step": 833, "train_accuracy": 0.017578125 }, { "epoch": 64.15384615384616, "grad_norm": 0.35906437039375305, "learning_rate": 0.01, "loss": 4.541396141052246, "num_input_tokens_seen": 3311104, "step": 834, "train_runtime": 667.9803, "train_tokens_per_second": 4956.889 }, { "epoch": 64.15384615384616, "num_input_tokens_seen": 3311104, "step": 834, "train_accuracy": 0.029296875 }, { "epoch": 64.23076923076923, "grad_norm": 0.446509450674057, "learning_rate": 0.01, "loss": 4.571511268615723, "num_input_tokens_seen": 3315200, "step": 835, "train_runtime": 668.7963, "train_tokens_per_second": 4956.965 }, { "epoch": 64.23076923076923, "num_input_tokens_seen": 3315200, "step": 835, "train_accuracy": 0.013671875 }, { "epoch": 64.3076923076923, "grad_norm": 0.39407438039779663, "learning_rate": 0.01, "loss": 4.596895217895508, "num_input_tokens_seen": 3319296, "step": 836, "train_runtime": 669.6128, "train_tokens_per_second": 4957.038 }, { "epoch": 64.3076923076923, "num_input_tokens_seen": 3319296, "step": 836, "train_accuracy": 0.009765625 }, { "epoch": 64.38461538461539, "grad_norm": 0.29259923100471497, "learning_rate": 0.01, "loss": 4.561599254608154, "num_input_tokens_seen": 3323392, "step": 837, "train_runtime": 670.43, "train_tokens_per_second": 4957.105 }, { "epoch": 64.38461538461539, "num_input_tokens_seen": 3323392, "step": 837, "train_accuracy": 0.017578125 }, { "epoch": 64.46153846153847, "grad_norm": 0.3567143380641937, "learning_rate": 0.01, "loss": 4.5362067222595215, "num_input_tokens_seen": 3327488, "step": 838, "train_runtime": 671.2476, "train_tokens_per_second": 4957.169 }, { "epoch": 64.46153846153847, "num_input_tokens_seen": 3327488, "step": 838, "train_accuracy": 0.025390625 }, { "epoch": 64.53846153846153, "grad_norm": 0.5534819960594177, "learning_rate": 0.01, "loss": 4.5910515785217285, "num_input_tokens_seen": 3331584, "step": 839, "train_runtime": 672.0656, "train_tokens_per_second": 4957.23 }, { "epoch": 64.53846153846153, "num_input_tokens_seen": 3331584, "step": 839, "train_accuracy": 0.017578125 }, { "epoch": 64.61538461538461, "grad_norm": 0.3455497920513153, "learning_rate": 0.01, "loss": 4.5095014572143555, "num_input_tokens_seen": 3335680, "step": 840, "train_runtime": 672.883, "train_tokens_per_second": 4957.295 }, { "epoch": 64.61538461538461, "num_input_tokens_seen": 3335680, "step": 840, "train_accuracy": 0.01171875 }, { "epoch": 64.6923076923077, "grad_norm": 0.6076437830924988, "learning_rate": 0.01, "loss": 4.570412635803223, "num_input_tokens_seen": 3339776, "step": 841, "train_runtime": 673.7006, "train_tokens_per_second": 4957.359 }, { "epoch": 64.6923076923077, "num_input_tokens_seen": 3339776, "step": 841, "train_accuracy": 0.009765625 }, { "epoch": 64.76923076923077, "grad_norm": 0.6800243258476257, "learning_rate": 0.01, "loss": 4.616314888000488, "num_input_tokens_seen": 3343872, "step": 842, "train_runtime": 674.518, "train_tokens_per_second": 4957.425 }, { "epoch": 64.76923076923077, "num_input_tokens_seen": 3343872, "step": 842, "train_accuracy": 0.0234375 }, { "epoch": 64.84615384615384, "grad_norm": 0.741438627243042, "learning_rate": 0.01, "loss": 4.646421432495117, "num_input_tokens_seen": 3347968, "step": 843, "train_runtime": 675.3358, "train_tokens_per_second": 4957.486 }, { "epoch": 64.84615384615384, "num_input_tokens_seen": 3347968, "step": 843, "train_accuracy": 0.0078125 }, { "epoch": 64.92307692307692, "grad_norm": 1.0583053827285767, "learning_rate": 0.01, "loss": 4.638894081115723, "num_input_tokens_seen": 3352064, "step": 844, "train_runtime": 676.153, "train_tokens_per_second": 4957.553 }, { "epoch": 64.92307692307692, "num_input_tokens_seen": 3352064, "step": 844, "train_accuracy": 0.013029315508902073 }, { "epoch": 65.0, "grad_norm": 0.32858121395111084, "learning_rate": 0.01, "loss": 4.560145378112793, "num_input_tokens_seen": 3354520, "step": 845, "train_runtime": 676.6712, "train_tokens_per_second": 4957.385 }, { "epoch": 65.0, "num_input_tokens_seen": 3354520, "step": 845, "train_accuracy": 0.013671875 }, { "epoch": 65.07692307692308, "grad_norm": 0.6705158948898315, "learning_rate": 0.01, "loss": 4.5458149909973145, "num_input_tokens_seen": 3358616, "step": 846, "train_runtime": 677.5014, "train_tokens_per_second": 4957.356 }, { "epoch": 65.07692307692308, "num_input_tokens_seen": 3358616, "step": 846, "train_accuracy": 0.025390625 }, { "epoch": 65.15384615384616, "grad_norm": 0.3764450252056122, "learning_rate": 0.01, "loss": 4.460278511047363, "num_input_tokens_seen": 3362712, "step": 847, "train_runtime": 678.3184, "train_tokens_per_second": 4957.424 }, { "epoch": 65.15384615384616, "num_input_tokens_seen": 3362712, "step": 847, "train_accuracy": 0.009765625 }, { "epoch": 65.23076923076923, "grad_norm": 0.5173666477203369, "learning_rate": 0.01, "loss": 4.573984146118164, "num_input_tokens_seen": 3366808, "step": 848, "train_runtime": 679.1352, "train_tokens_per_second": 4957.493 }, { "epoch": 65.23076923076923, "num_input_tokens_seen": 3366808, "step": 848, "train_accuracy": 0.025390625 }, { "epoch": 65.3076923076923, "grad_norm": 0.3733808696269989, "learning_rate": 0.01, "loss": 4.59464168548584, "num_input_tokens_seen": 3370904, "step": 849, "train_runtime": 679.9537, "train_tokens_per_second": 4957.549 }, { "epoch": 65.3076923076923, "num_input_tokens_seen": 3370904, "step": 849, "train_accuracy": 0.0234375 }, { "epoch": 65.38461538461539, "grad_norm": 0.35254454612731934, "learning_rate": 0.01, "loss": 4.5532121658325195, "num_input_tokens_seen": 3375000, "step": 850, "train_runtime": 680.7718, "train_tokens_per_second": 4957.609 }, { "epoch": 65.38461538461539, "num_input_tokens_seen": 3375000, "step": 850, "train_accuracy": 0.025390625 }, { "epoch": 65.46153846153847, "grad_norm": 0.3959769010543823, "learning_rate": 0.01, "loss": 4.507648468017578, "num_input_tokens_seen": 3379096, "step": 851, "train_runtime": 681.589, "train_tokens_per_second": 4957.674 }, { "epoch": 65.46153846153847, "num_input_tokens_seen": 3379096, "step": 851, "train_accuracy": 0.01171875 }, { "epoch": 65.53846153846153, "grad_norm": 0.5590829849243164, "learning_rate": 0.01, "loss": 4.564872741699219, "num_input_tokens_seen": 3383192, "step": 852, "train_runtime": 682.4069, "train_tokens_per_second": 4957.734 }, { "epoch": 65.53846153846153, "num_input_tokens_seen": 3383192, "step": 852, "train_accuracy": 0.009765625 }, { "epoch": 65.61538461538461, "grad_norm": 0.3259311318397522, "learning_rate": 0.01, "loss": 4.633062362670898, "num_input_tokens_seen": 3387288, "step": 853, "train_runtime": 683.2256, "train_tokens_per_second": 4957.788 }, { "epoch": 65.61538461538461, "num_input_tokens_seen": 3387288, "step": 853, "train_accuracy": 0.0078125 }, { "epoch": 65.6923076923077, "grad_norm": 0.46478477120399475, "learning_rate": 0.01, "loss": 4.621218681335449, "num_input_tokens_seen": 3391384, "step": 854, "train_runtime": 684.0439, "train_tokens_per_second": 4957.845 }, { "epoch": 65.6923076923077, "num_input_tokens_seen": 3391384, "step": 854, "train_accuracy": 0.0234375 }, { "epoch": 65.76923076923077, "grad_norm": 0.31208330392837524, "learning_rate": 0.01, "loss": 4.556248664855957, "num_input_tokens_seen": 3395480, "step": 855, "train_runtime": 684.8618, "train_tokens_per_second": 4957.905 }, { "epoch": 65.76923076923077, "num_input_tokens_seen": 3395480, "step": 855, "train_accuracy": 0.013671875 }, { "epoch": 65.84615384615384, "grad_norm": 0.3860895037651062, "learning_rate": 0.01, "loss": 4.599390506744385, "num_input_tokens_seen": 3399576, "step": 856, "train_runtime": 685.6793, "train_tokens_per_second": 4957.968 }, { "epoch": 65.84615384615384, "num_input_tokens_seen": 3399576, "step": 856, "train_accuracy": 0.015625 }, { "epoch": 65.92307692307692, "grad_norm": 0.37738537788391113, "learning_rate": 0.01, "loss": 4.5208048820495605, "num_input_tokens_seen": 3403672, "step": 857, "train_runtime": 686.4916, "train_tokens_per_second": 4958.068 }, { "epoch": 65.92307692307692, "num_input_tokens_seen": 3403672, "step": 857, "train_accuracy": 0.0032573288772255182 }, { "epoch": 66.0, "grad_norm": 0.8981891870498657, "learning_rate": 0.01, "loss": 4.5489935874938965, "num_input_tokens_seen": 3406128, "step": 858, "train_runtime": 687.0093, "train_tokens_per_second": 4957.907 }, { "epoch": 66.0, "num_input_tokens_seen": 3406128, "step": 858, "train_accuracy": 0.029296875 }, { "epoch": 66.07692307692308, "grad_norm": 0.6242077946662903, "learning_rate": 0.01, "loss": 4.539294242858887, "num_input_tokens_seen": 3410224, "step": 859, "train_runtime": 687.8387, "train_tokens_per_second": 4957.883 }, { "epoch": 66.07692307692308, "num_input_tokens_seen": 3410224, "step": 859, "train_accuracy": 0.01171875 }, { "epoch": 66.15384615384616, "grad_norm": 0.7122806310653687, "learning_rate": 0.01, "loss": 4.606278419494629, "num_input_tokens_seen": 3414320, "step": 860, "train_runtime": 688.6663, "train_tokens_per_second": 4957.873 }, { "epoch": 66.15384615384616, "num_input_tokens_seen": 3414320, "step": 860, "train_accuracy": 0.0234375 }, { "epoch": 66.23076923076923, "grad_norm": 0.708748459815979, "learning_rate": 0.01, "loss": 4.507891654968262, "num_input_tokens_seen": 3418416, "step": 861, "train_runtime": 689.4846, "train_tokens_per_second": 4957.929 }, { "epoch": 66.23076923076923, "num_input_tokens_seen": 3418416, "step": 861, "train_accuracy": 0.017578125 }, { "epoch": 66.3076923076923, "grad_norm": 0.45489710569381714, "learning_rate": 0.01, "loss": 4.558891296386719, "num_input_tokens_seen": 3422512, "step": 862, "train_runtime": 690.3039, "train_tokens_per_second": 4957.979 }, { "epoch": 66.3076923076923, "num_input_tokens_seen": 3422512, "step": 862, "train_accuracy": 0.01953125 }, { "epoch": 66.38461538461539, "grad_norm": 0.7404343485832214, "learning_rate": 0.01, "loss": 4.598685264587402, "num_input_tokens_seen": 3426608, "step": 863, "train_runtime": 691.121, "train_tokens_per_second": 4958.043 }, { "epoch": 66.38461538461539, "num_input_tokens_seen": 3426608, "step": 863, "train_accuracy": 0.013671875 }, { "epoch": 66.46153846153847, "grad_norm": 0.5132432579994202, "learning_rate": 0.01, "loss": 4.531277656555176, "num_input_tokens_seen": 3430704, "step": 864, "train_runtime": 691.9398, "train_tokens_per_second": 4958.096 }, { "epoch": 66.46153846153847, "num_input_tokens_seen": 3430704, "step": 864, "train_accuracy": 0.02734375 }, { "epoch": 66.53846153846153, "grad_norm": 0.45672670006752014, "learning_rate": 0.01, "loss": 4.500669479370117, "num_input_tokens_seen": 3434800, "step": 865, "train_runtime": 692.7587, "train_tokens_per_second": 4958.148 }, { "epoch": 66.53846153846153, "num_input_tokens_seen": 3434800, "step": 865, "train_accuracy": 0.00390625 }, { "epoch": 66.61538461538461, "grad_norm": 0.8451108336448669, "learning_rate": 0.01, "loss": 4.559305191040039, "num_input_tokens_seen": 3438896, "step": 866, "train_runtime": 693.5777, "train_tokens_per_second": 4958.199 }, { "epoch": 66.61538461538461, "num_input_tokens_seen": 3438896, "step": 866, "train_accuracy": 0.021484375 }, { "epoch": 66.6923076923077, "grad_norm": 0.37316787242889404, "learning_rate": 0.01, "loss": 4.522036552429199, "num_input_tokens_seen": 3442992, "step": 867, "train_runtime": 694.395, "train_tokens_per_second": 4958.261 }, { "epoch": 66.6923076923077, "num_input_tokens_seen": 3442992, "step": 867, "train_accuracy": 0.013671875 }, { "epoch": 66.76923076923077, "grad_norm": 0.46986570954322815, "learning_rate": 0.01, "loss": 4.549263954162598, "num_input_tokens_seen": 3447088, "step": 868, "train_runtime": 695.2145, "train_tokens_per_second": 4958.309 }, { "epoch": 66.76923076923077, "num_input_tokens_seen": 3447088, "step": 868, "train_accuracy": 0.01953125 }, { "epoch": 66.84615384615384, "grad_norm": 0.42503783106803894, "learning_rate": 0.01, "loss": 4.543720245361328, "num_input_tokens_seen": 3451184, "step": 869, "train_runtime": 696.0316, "train_tokens_per_second": 4958.372 }, { "epoch": 66.84615384615384, "num_input_tokens_seen": 3451184, "step": 869, "train_accuracy": 0.021484375 }, { "epoch": 66.92307692307692, "grad_norm": 0.7722694873809814, "learning_rate": 0.01, "loss": 4.536430358886719, "num_input_tokens_seen": 3455280, "step": 870, "train_runtime": 696.8446, "train_tokens_per_second": 4958.465 }, { "epoch": 66.92307692307692, "num_input_tokens_seen": 3455280, "step": 870, "train_accuracy": 0.0065146577544510365 }, { "epoch": 67.0, "grad_norm": 0.5014510750770569, "learning_rate": 0.01, "loss": 4.531091690063477, "num_input_tokens_seen": 3457736, "step": 871, "train_runtime": 697.3616, "train_tokens_per_second": 4958.311 }, { "epoch": 67.0, "num_input_tokens_seen": 3457736, "step": 871, "train_accuracy": 0.0234375 }, { "epoch": 67.07692307692308, "grad_norm": 0.32843247056007385, "learning_rate": 0.01, "loss": 4.4693732261657715, "num_input_tokens_seen": 3461832, "step": 872, "train_runtime": 698.1915, "train_tokens_per_second": 4958.284 }, { "epoch": 67.07692307692308, "num_input_tokens_seen": 3461832, "step": 872, "train_accuracy": 0.017578125 }, { "epoch": 67.15384615384616, "grad_norm": 0.5785554051399231, "learning_rate": 0.01, "loss": 4.559943199157715, "num_input_tokens_seen": 3465928, "step": 873, "train_runtime": 699.01, "train_tokens_per_second": 4958.338 }, { "epoch": 67.15384615384616, "num_input_tokens_seen": 3465928, "step": 873, "train_accuracy": 0.0390625 }, { "epoch": 67.23076923076923, "grad_norm": 0.8781976699829102, "learning_rate": 0.01, "loss": 4.5055108070373535, "num_input_tokens_seen": 3470024, "step": 874, "train_runtime": 699.827, "train_tokens_per_second": 4958.403 }, { "epoch": 67.23076923076923, "num_input_tokens_seen": 3470024, "step": 874, "train_accuracy": 0.021484375 }, { "epoch": 67.3076923076923, "grad_norm": 0.439237117767334, "learning_rate": 0.01, "loss": 4.49114465713501, "num_input_tokens_seen": 3474120, "step": 875, "train_runtime": 700.6457, "train_tokens_per_second": 4958.455 }, { "epoch": 67.3076923076923, "num_input_tokens_seen": 3474120, "step": 875, "train_accuracy": 0.025390625 }, { "epoch": 67.38461538461539, "grad_norm": 0.4294290840625763, "learning_rate": 0.01, "loss": 4.490567207336426, "num_input_tokens_seen": 3478216, "step": 876, "train_runtime": 701.4635, "train_tokens_per_second": 4958.513 }, { "epoch": 67.38461538461539, "num_input_tokens_seen": 3478216, "step": 876, "train_accuracy": 0.021484375 }, { "epoch": 67.46153846153847, "grad_norm": 0.6100071668624878, "learning_rate": 0.01, "loss": 4.5203142166137695, "num_input_tokens_seen": 3482312, "step": 877, "train_runtime": 702.2855, "train_tokens_per_second": 4958.542 }, { "epoch": 67.46153846153847, "num_input_tokens_seen": 3482312, "step": 877, "train_accuracy": 0.017578125 }, { "epoch": 67.53846153846153, "grad_norm": 0.7818669676780701, "learning_rate": 0.01, "loss": 4.531253814697266, "num_input_tokens_seen": 3486408, "step": 878, "train_runtime": 703.1032, "train_tokens_per_second": 4958.601 }, { "epoch": 67.53846153846153, "num_input_tokens_seen": 3486408, "step": 878, "train_accuracy": 0.01171875 }, { "epoch": 67.61538461538461, "grad_norm": 0.3752618730068207, "learning_rate": 0.01, "loss": 4.493743896484375, "num_input_tokens_seen": 3490504, "step": 879, "train_runtime": 703.9239, "train_tokens_per_second": 4958.638 }, { "epoch": 67.61538461538461, "num_input_tokens_seen": 3490504, "step": 879, "train_accuracy": 0.013671875 }, { "epoch": 67.6923076923077, "grad_norm": 0.5436190366744995, "learning_rate": 0.01, "loss": 4.5386552810668945, "num_input_tokens_seen": 3494600, "step": 880, "train_runtime": 704.7419, "train_tokens_per_second": 4958.695 }, { "epoch": 67.6923076923077, "num_input_tokens_seen": 3494600, "step": 880, "train_accuracy": 0.0078125 }, { "epoch": 67.76923076923077, "grad_norm": 0.5620259642601013, "learning_rate": 0.01, "loss": 4.5473809242248535, "num_input_tokens_seen": 3498696, "step": 881, "train_runtime": 705.5662, "train_tokens_per_second": 4958.707 }, { "epoch": 67.76923076923077, "num_input_tokens_seen": 3498696, "step": 881, "train_accuracy": 0.013671875 }, { "epoch": 67.84615384615384, "grad_norm": 0.3890678584575653, "learning_rate": 0.01, "loss": 4.502055644989014, "num_input_tokens_seen": 3502792, "step": 882, "train_runtime": 706.385, "train_tokens_per_second": 4958.757 }, { "epoch": 67.84615384615384, "num_input_tokens_seen": 3502792, "step": 882, "train_accuracy": 0.03125 }, { "epoch": 67.92307692307692, "grad_norm": 0.3027574121952057, "learning_rate": 0.01, "loss": 4.52012300491333, "num_input_tokens_seen": 3506888, "step": 883, "train_runtime": 707.1973, "train_tokens_per_second": 4958.853 }, { "epoch": 67.92307692307692, "num_input_tokens_seen": 3506888, "step": 883, "train_accuracy": 0.0065146577544510365 }, { "epoch": 68.0, "grad_norm": 0.3700380325317383, "learning_rate": 0.01, "loss": 4.579263210296631, "num_input_tokens_seen": 3509344, "step": 884, "train_runtime": 707.7159, "train_tokens_per_second": 4958.69 }, { "epoch": 68.0, "num_input_tokens_seen": 3509344, "step": 884, "train_accuracy": 0.0234375 }, { "epoch": 68.07692307692308, "grad_norm": 0.48986291885375977, "learning_rate": 0.01, "loss": 4.526958465576172, "num_input_tokens_seen": 3513440, "step": 885, "train_runtime": 708.5483, "train_tokens_per_second": 4958.646 }, { "epoch": 68.07692307692308, "num_input_tokens_seen": 3513440, "step": 885, "train_accuracy": 0.013671875 }, { "epoch": 68.15384615384616, "grad_norm": 0.3456747233867645, "learning_rate": 0.01, "loss": 4.496724605560303, "num_input_tokens_seen": 3517536, "step": 886, "train_runtime": 709.3656, "train_tokens_per_second": 4958.707 }, { "epoch": 68.15384615384616, "num_input_tokens_seen": 3517536, "step": 886, "train_accuracy": 0.017578125 }, { "epoch": 68.23076923076923, "grad_norm": 0.8218653798103333, "learning_rate": 0.01, "loss": 4.564673900604248, "num_input_tokens_seen": 3521632, "step": 887, "train_runtime": 710.1841, "train_tokens_per_second": 4958.76 }, { "epoch": 68.23076923076923, "num_input_tokens_seen": 3521632, "step": 887, "train_accuracy": 0.01171875 }, { "epoch": 68.3076923076923, "grad_norm": 0.40607571601867676, "learning_rate": 0.01, "loss": 4.539470672607422, "num_input_tokens_seen": 3525728, "step": 888, "train_runtime": 711.0016, "train_tokens_per_second": 4958.819 }, { "epoch": 68.3076923076923, "num_input_tokens_seen": 3525728, "step": 888, "train_accuracy": 0.02734375 }, { "epoch": 68.38461538461539, "grad_norm": 1.5847623348236084, "learning_rate": 0.01, "loss": 4.538667678833008, "num_input_tokens_seen": 3529824, "step": 889, "train_runtime": 711.8206, "train_tokens_per_second": 4958.867 }, { "epoch": 68.38461538461539, "num_input_tokens_seen": 3529824, "step": 889, "train_accuracy": 0.0078125 }, { "epoch": 68.46153846153847, "grad_norm": 0.5893070697784424, "learning_rate": 0.01, "loss": 4.502369403839111, "num_input_tokens_seen": 3533920, "step": 890, "train_runtime": 712.639, "train_tokens_per_second": 4958.92 }, { "epoch": 68.46153846153847, "num_input_tokens_seen": 3533920, "step": 890, "train_accuracy": 0.013671875 }, { "epoch": 68.53846153846153, "grad_norm": 0.6661847233772278, "learning_rate": 0.01, "loss": 4.539044380187988, "num_input_tokens_seen": 3538016, "step": 891, "train_runtime": 713.4595, "train_tokens_per_second": 4958.958 }, { "epoch": 68.53846153846153, "num_input_tokens_seen": 3538016, "step": 891, "train_accuracy": 0.013671875 }, { "epoch": 68.61538461538461, "grad_norm": 0.5200782418251038, "learning_rate": 0.01, "loss": 4.511730194091797, "num_input_tokens_seen": 3542112, "step": 892, "train_runtime": 714.2787, "train_tokens_per_second": 4959.006 }, { "epoch": 68.61538461538461, "num_input_tokens_seen": 3542112, "step": 892, "train_accuracy": 0.01953125 }, { "epoch": 68.6923076923077, "grad_norm": 0.5108278393745422, "learning_rate": 0.01, "loss": 4.490791320800781, "num_input_tokens_seen": 3546208, "step": 893, "train_runtime": 715.0995, "train_tokens_per_second": 4959.041 }, { "epoch": 68.6923076923077, "num_input_tokens_seen": 3546208, "step": 893, "train_accuracy": 0.013671875 }, { "epoch": 68.76923076923077, "grad_norm": 0.7380408644676208, "learning_rate": 0.01, "loss": 4.563013553619385, "num_input_tokens_seen": 3550304, "step": 894, "train_runtime": 715.9188, "train_tokens_per_second": 4959.088 }, { "epoch": 68.76923076923077, "num_input_tokens_seen": 3550304, "step": 894, "train_accuracy": 0.01953125 }, { "epoch": 68.84615384615384, "grad_norm": 0.33585381507873535, "learning_rate": 0.01, "loss": 4.481448173522949, "num_input_tokens_seen": 3554400, "step": 895, "train_runtime": 716.7379, "train_tokens_per_second": 4959.135 }, { "epoch": 68.84615384615384, "num_input_tokens_seen": 3554400, "step": 895, "train_accuracy": 0.013671875 }, { "epoch": 68.92307692307692, "grad_norm": 0.43700939416885376, "learning_rate": 0.01, "loss": 4.583843231201172, "num_input_tokens_seen": 3558496, "step": 896, "train_runtime": 717.5513, "train_tokens_per_second": 4959.221 }, { "epoch": 68.92307692307692, "num_input_tokens_seen": 3558496, "step": 896, "train_accuracy": 0.019543973729014397 }, { "epoch": 69.0, "grad_norm": 0.6429909467697144, "learning_rate": 0.01, "loss": 4.469284534454346, "num_input_tokens_seen": 3560952, "step": 897, "train_runtime": 718.0693, "train_tokens_per_second": 4959.064 }, { "epoch": 69.0, "num_input_tokens_seen": 3560952, "step": 897, "train_accuracy": 0.01953125 }, { "epoch": 69.07692307692308, "grad_norm": 0.44672366976737976, "learning_rate": 0.01, "loss": 4.423923969268799, "num_input_tokens_seen": 3565048, "step": 898, "train_runtime": 718.8988, "train_tokens_per_second": 4959.04 }, { "epoch": 69.07692307692308, "num_input_tokens_seen": 3565048, "step": 898, "train_accuracy": 0.01953125 }, { "epoch": 69.15384615384616, "grad_norm": 0.4783729612827301, "learning_rate": 0.01, "loss": 4.454030990600586, "num_input_tokens_seen": 3569144, "step": 899, "train_runtime": 719.7174, "train_tokens_per_second": 4959.091 }, { "epoch": 69.15384615384616, "num_input_tokens_seen": 3569144, "step": 899, "train_accuracy": 0.029296875 }, { "epoch": 69.23076923076923, "grad_norm": 0.40234968066215515, "learning_rate": 0.01, "loss": 4.422664642333984, "num_input_tokens_seen": 3573240, "step": 900, "train_runtime": 720.536, "train_tokens_per_second": 4959.142 }, { "epoch": 69.23076923076923, "eval_CMD_3_branch_eval_accuracy": 0.010126582278481013, "eval_CMD_3_branch_eval_loss": 4.629105091094971, "eval_CMD_3_branch_eval_runtime": 1.1629, "eval_CMD_3_branch_eval_samples_per_second": 2377.736, "eval_CMD_3_branch_eval_steps_per_second": 5.16, "num_input_tokens_seen": 3573240, "step": 900 }, { "epoch": 69.23076923076923, "num_input_tokens_seen": 3573240, "step": 900, "train_accuracy": 0.033203125 }, { "epoch": 69.3076923076923, "grad_norm": 0.45272207260131836, "learning_rate": 0.01, "loss": 4.406930446624756, "num_input_tokens_seen": 3577336, "step": 901, "train_runtime": 722.5235, "train_tokens_per_second": 4951.169 }, { "epoch": 69.3076923076923, "num_input_tokens_seen": 3577336, "step": 901, "train_accuracy": 0.02734375 }, { "epoch": 69.38461538461539, "grad_norm": 0.4514341652393341, "learning_rate": 0.01, "loss": 4.4331464767456055, "num_input_tokens_seen": 3581432, "step": 902, "train_runtime": 723.3415, "train_tokens_per_second": 4951.233 }, { "epoch": 69.38461538461539, "num_input_tokens_seen": 3581432, "step": 902, "train_accuracy": 0.029296875 }, { "epoch": 69.46153846153847, "grad_norm": 0.3631833493709564, "learning_rate": 0.01, "loss": 4.447068691253662, "num_input_tokens_seen": 3585528, "step": 903, "train_runtime": 724.1645, "train_tokens_per_second": 4951.262 }, { "epoch": 69.46153846153847, "num_input_tokens_seen": 3585528, "step": 903, "train_accuracy": 0.021484375 }, { "epoch": 69.53846153846153, "grad_norm": 0.2641160786151886, "learning_rate": 0.01, "loss": 4.469538688659668, "num_input_tokens_seen": 3589624, "step": 904, "train_runtime": 724.9842, "train_tokens_per_second": 4951.313 }, { "epoch": 69.53846153846153, "num_input_tokens_seen": 3589624, "step": 904, "train_accuracy": 0.01953125 }, { "epoch": 69.61538461538461, "grad_norm": 1.2099906206130981, "learning_rate": 0.01, "loss": 4.496251106262207, "num_input_tokens_seen": 3593720, "step": 905, "train_runtime": 725.8041, "train_tokens_per_second": 4951.364 }, { "epoch": 69.61538461538461, "num_input_tokens_seen": 3593720, "step": 905, "train_accuracy": 0.015625 }, { "epoch": 69.6923076923077, "grad_norm": 0.33517658710479736, "learning_rate": 0.01, "loss": 4.484493732452393, "num_input_tokens_seen": 3597816, "step": 906, "train_runtime": 726.6217, "train_tokens_per_second": 4951.43 }, { "epoch": 69.6923076923077, "num_input_tokens_seen": 3597816, "step": 906, "train_accuracy": 0.0234375 }, { "epoch": 69.76923076923077, "grad_norm": 0.3322330415248871, "learning_rate": 0.01, "loss": 4.471845626831055, "num_input_tokens_seen": 3601912, "step": 907, "train_runtime": 727.4411, "train_tokens_per_second": 4951.483 }, { "epoch": 69.76923076923077, "num_input_tokens_seen": 3601912, "step": 907, "train_accuracy": 0.017578125 }, { "epoch": 69.84615384615384, "grad_norm": 0.29685264825820923, "learning_rate": 0.01, "loss": 4.48011589050293, "num_input_tokens_seen": 3606008, "step": 908, "train_runtime": 728.2599, "train_tokens_per_second": 4951.54 }, { "epoch": 69.84615384615384, "num_input_tokens_seen": 3606008, "step": 908, "train_accuracy": 0.017578125 }, { "epoch": 69.92307692307692, "grad_norm": 0.5841346979141235, "learning_rate": 0.01, "loss": 4.4899749755859375, "num_input_tokens_seen": 3610104, "step": 909, "train_runtime": 729.0733, "train_tokens_per_second": 4951.634 }, { "epoch": 69.92307692307692, "num_input_tokens_seen": 3610104, "step": 909, "train_accuracy": 0.02280130237340927 }, { "epoch": 70.0, "grad_norm": 0.9717252254486084, "learning_rate": 0.01, "loss": 4.529669284820557, "num_input_tokens_seen": 3612560, "step": 910, "train_runtime": 729.5916, "train_tokens_per_second": 4951.483 }, { "epoch": 70.0, "num_input_tokens_seen": 3612560, "step": 910, "train_accuracy": 0.02734375 }, { "epoch": 70.07692307692308, "grad_norm": 0.361969918012619, "learning_rate": 0.01, "loss": 4.41936731338501, "num_input_tokens_seen": 3616656, "step": 911, "train_runtime": 730.4236, "train_tokens_per_second": 4951.45 }, { "epoch": 70.07692307692308, "num_input_tokens_seen": 3616656, "step": 911, "train_accuracy": 0.0234375 }, { "epoch": 70.15384615384616, "grad_norm": 0.9180896878242493, "learning_rate": 0.01, "loss": 4.470214366912842, "num_input_tokens_seen": 3620752, "step": 912, "train_runtime": 731.2415, "train_tokens_per_second": 4951.513 }, { "epoch": 70.15384615384616, "num_input_tokens_seen": 3620752, "step": 912, "train_accuracy": 0.029296875 }, { "epoch": 70.23076923076923, "grad_norm": 0.5340433716773987, "learning_rate": 0.01, "loss": 4.378235816955566, "num_input_tokens_seen": 3624848, "step": 913, "train_runtime": 732.0595, "train_tokens_per_second": 4951.575 }, { "epoch": 70.23076923076923, "num_input_tokens_seen": 3624848, "step": 913, "train_accuracy": 0.015625 }, { "epoch": 70.3076923076923, "grad_norm": 1.6778451204299927, "learning_rate": 0.01, "loss": 4.447396755218506, "num_input_tokens_seen": 3628944, "step": 914, "train_runtime": 732.8801, "train_tokens_per_second": 4951.62 }, { "epoch": 70.3076923076923, "num_input_tokens_seen": 3628944, "step": 914, "train_accuracy": 0.03125 }, { "epoch": 70.38461538461539, "grad_norm": 0.616068422794342, "learning_rate": 0.01, "loss": 4.4343061447143555, "num_input_tokens_seen": 3633040, "step": 915, "train_runtime": 733.7009, "train_tokens_per_second": 4951.664 }, { "epoch": 70.38461538461539, "num_input_tokens_seen": 3633040, "step": 915, "train_accuracy": 0.01953125 }, { "epoch": 70.46153846153847, "grad_norm": 0.3702734410762787, "learning_rate": 0.01, "loss": 4.424246788024902, "num_input_tokens_seen": 3637136, "step": 916, "train_runtime": 734.5218, "train_tokens_per_second": 4951.706 }, { "epoch": 70.46153846153847, "num_input_tokens_seen": 3637136, "step": 916, "train_accuracy": 0.013671875 }, { "epoch": 70.53846153846153, "grad_norm": 0.5244331955909729, "learning_rate": 0.01, "loss": 4.418830871582031, "num_input_tokens_seen": 3641232, "step": 917, "train_runtime": 735.3397, "train_tokens_per_second": 4951.768 }, { "epoch": 70.53846153846153, "num_input_tokens_seen": 3641232, "step": 917, "train_accuracy": 0.029296875 }, { "epoch": 70.61538461538461, "grad_norm": 0.5785495042800903, "learning_rate": 0.01, "loss": 4.386415958404541, "num_input_tokens_seen": 3645328, "step": 918, "train_runtime": 736.1584, "train_tokens_per_second": 4951.826 }, { "epoch": 70.61538461538461, "num_input_tokens_seen": 3645328, "step": 918, "train_accuracy": 0.017578125 }, { "epoch": 70.6923076923077, "grad_norm": 0.44390246272087097, "learning_rate": 0.01, "loss": 4.42064094543457, "num_input_tokens_seen": 3649424, "step": 919, "train_runtime": 736.9773, "train_tokens_per_second": 4951.881 }, { "epoch": 70.6923076923077, "num_input_tokens_seen": 3649424, "step": 919, "train_accuracy": 0.021484375 }, { "epoch": 70.76923076923077, "grad_norm": 0.48718634247779846, "learning_rate": 0.01, "loss": 4.4073896408081055, "num_input_tokens_seen": 3653520, "step": 920, "train_runtime": 737.7959, "train_tokens_per_second": 4951.939 }, { "epoch": 70.76923076923077, "num_input_tokens_seen": 3653520, "step": 920, "train_accuracy": 0.021484375 }, { "epoch": 70.84615384615384, "grad_norm": 0.39334720373153687, "learning_rate": 0.01, "loss": 4.4013895988464355, "num_input_tokens_seen": 3657616, "step": 921, "train_runtime": 738.6148, "train_tokens_per_second": 4951.994 }, { "epoch": 70.84615384615384, "num_input_tokens_seen": 3657616, "step": 921, "train_accuracy": 0.025390625 }, { "epoch": 70.92307692307692, "grad_norm": 0.4572714865207672, "learning_rate": 0.01, "loss": 4.39383602142334, "num_input_tokens_seen": 3661712, "step": 922, "train_runtime": 739.4301, "train_tokens_per_second": 4952.073 }, { "epoch": 70.92307692307692, "num_input_tokens_seen": 3661712, "step": 922, "train_accuracy": 0.02280130237340927 }, { "epoch": 71.0, "grad_norm": 0.5256152749061584, "learning_rate": 0.01, "loss": 4.438015460968018, "num_input_tokens_seen": 3664168, "step": 923, "train_runtime": 739.948, "train_tokens_per_second": 4951.926 }, { "epoch": 71.0, "num_input_tokens_seen": 3664168, "step": 923, "train_accuracy": 0.029296875 }, { "epoch": 71.07692307692308, "grad_norm": 0.7388529181480408, "learning_rate": 0.01, "loss": 4.342407703399658, "num_input_tokens_seen": 3668264, "step": 924, "train_runtime": 740.7783, "train_tokens_per_second": 4951.905 }, { "epoch": 71.07692307692308, "num_input_tokens_seen": 3668264, "step": 924, "train_accuracy": 0.02734375 }, { "epoch": 71.15384615384616, "grad_norm": 0.7544814944267273, "learning_rate": 0.01, "loss": 4.366703510284424, "num_input_tokens_seen": 3672360, "step": 925, "train_runtime": 741.5977, "train_tokens_per_second": 4951.957 }, { "epoch": 71.15384615384616, "num_input_tokens_seen": 3672360, "step": 925, "train_accuracy": 0.017578125 }, { "epoch": 71.23076923076923, "grad_norm": 0.47264015674591064, "learning_rate": 0.01, "loss": 4.39190149307251, "num_input_tokens_seen": 3676456, "step": 926, "train_runtime": 742.4173, "train_tokens_per_second": 4952.007 }, { "epoch": 71.23076923076923, "num_input_tokens_seen": 3676456, "step": 926, "train_accuracy": 0.0234375 }, { "epoch": 71.3076923076923, "grad_norm": 0.7658267021179199, "learning_rate": 0.01, "loss": 4.420034408569336, "num_input_tokens_seen": 3680552, "step": 927, "train_runtime": 743.2371, "train_tokens_per_second": 4952.056 }, { "epoch": 71.3076923076923, "num_input_tokens_seen": 3680552, "step": 927, "train_accuracy": 0.017578125 }, { "epoch": 71.38461538461539, "grad_norm": 0.44571179151535034, "learning_rate": 0.01, "loss": 4.437005519866943, "num_input_tokens_seen": 3684648, "step": 928, "train_runtime": 744.063, "train_tokens_per_second": 4952.064 }, { "epoch": 71.38461538461539, "num_input_tokens_seen": 3684648, "step": 928, "train_accuracy": 0.017578125 }, { "epoch": 71.46153846153847, "grad_norm": 1.2002772092819214, "learning_rate": 0.01, "loss": 4.350293159484863, "num_input_tokens_seen": 3688744, "step": 929, "train_runtime": 744.8838, "train_tokens_per_second": 4952.106 }, { "epoch": 71.46153846153847, "num_input_tokens_seen": 3688744, "step": 929, "train_accuracy": 0.03515625 }, { "epoch": 71.53846153846153, "grad_norm": 0.8120535612106323, "learning_rate": 0.01, "loss": 4.378268241882324, "num_input_tokens_seen": 3692840, "step": 930, "train_runtime": 745.7028, "train_tokens_per_second": 4952.16 }, { "epoch": 71.53846153846153, "num_input_tokens_seen": 3692840, "step": 930, "train_accuracy": 0.029296875 }, { "epoch": 71.61538461538461, "grad_norm": 0.8198422193527222, "learning_rate": 0.01, "loss": 4.386263370513916, "num_input_tokens_seen": 3696936, "step": 931, "train_runtime": 746.5241, "train_tokens_per_second": 4952.199 }, { "epoch": 71.61538461538461, "num_input_tokens_seen": 3696936, "step": 931, "train_accuracy": 0.03515625 }, { "epoch": 71.6923076923077, "grad_norm": 0.4060828685760498, "learning_rate": 0.01, "loss": 4.37192964553833, "num_input_tokens_seen": 3701032, "step": 932, "train_runtime": 747.3444, "train_tokens_per_second": 4952.244 }, { "epoch": 71.6923076923077, "num_input_tokens_seen": 3701032, "step": 932, "train_accuracy": 0.029296875 }, { "epoch": 71.76923076923077, "grad_norm": 0.7270469665527344, "learning_rate": 0.01, "loss": 4.358577728271484, "num_input_tokens_seen": 3705128, "step": 933, "train_runtime": 748.1642, "train_tokens_per_second": 4952.293 }, { "epoch": 71.76923076923077, "num_input_tokens_seen": 3705128, "step": 933, "train_accuracy": 0.025390625 }, { "epoch": 71.84615384615384, "grad_norm": 0.4120619595050812, "learning_rate": 0.01, "loss": 4.354004383087158, "num_input_tokens_seen": 3709224, "step": 934, "train_runtime": 748.9849, "train_tokens_per_second": 4952.335 }, { "epoch": 71.84615384615384, "num_input_tokens_seen": 3709224, "step": 934, "train_accuracy": 0.025390625 }, { "epoch": 71.92307692307692, "grad_norm": 0.6477432250976562, "learning_rate": 0.01, "loss": 4.411651611328125, "num_input_tokens_seen": 3713320, "step": 935, "train_runtime": 749.7987, "train_tokens_per_second": 4952.423 }, { "epoch": 71.92307692307692, "num_input_tokens_seen": 3713320, "step": 935, "train_accuracy": 0.032573290169239044 }, { "epoch": 72.0, "grad_norm": 1.7840039730072021, "learning_rate": 0.01, "loss": 4.346638202667236, "num_input_tokens_seen": 3715776, "step": 936, "train_runtime": 750.3172, "train_tokens_per_second": 4952.274 }, { "epoch": 72.0, "num_input_tokens_seen": 3715776, "step": 936, "train_accuracy": 0.033203125 }, { "epoch": 72.07692307692308, "grad_norm": 1.114080786705017, "learning_rate": 0.01, "loss": 4.222871780395508, "num_input_tokens_seen": 3719872, "step": 937, "train_runtime": 751.1472, "train_tokens_per_second": 4952.254 }, { "epoch": 72.07692307692308, "num_input_tokens_seen": 3719872, "step": 937, "train_accuracy": 0.0234375 }, { "epoch": 72.15384615384616, "grad_norm": 0.4295608103275299, "learning_rate": 0.01, "loss": 4.352922439575195, "num_input_tokens_seen": 3723968, "step": 938, "train_runtime": 751.97, "train_tokens_per_second": 4952.283 }, { "epoch": 72.15384615384616, "num_input_tokens_seen": 3723968, "step": 938, "train_accuracy": 0.029296875 }, { "epoch": 72.23076923076923, "grad_norm": 0.5601105690002441, "learning_rate": 0.01, "loss": 4.34294319152832, "num_input_tokens_seen": 3728064, "step": 939, "train_runtime": 752.789, "train_tokens_per_second": 4952.336 }, { "epoch": 72.23076923076923, "num_input_tokens_seen": 3728064, "step": 939, "train_accuracy": 0.025390625 }, { "epoch": 72.3076923076923, "grad_norm": 2.131270170211792, "learning_rate": 0.01, "loss": 4.369997978210449, "num_input_tokens_seen": 3732160, "step": 940, "train_runtime": 753.608, "train_tokens_per_second": 4952.389 }, { "epoch": 72.3076923076923, "num_input_tokens_seen": 3732160, "step": 940, "train_accuracy": 0.029296875 }, { "epoch": 72.38461538461539, "grad_norm": 0.6599200367927551, "learning_rate": 0.01, "loss": 4.3323774337768555, "num_input_tokens_seen": 3736256, "step": 941, "train_runtime": 754.4262, "train_tokens_per_second": 4952.447 }, { "epoch": 72.38461538461539, "num_input_tokens_seen": 3736256, "step": 941, "train_accuracy": 0.0234375 }, { "epoch": 72.46153846153847, "grad_norm": 0.6697801947593689, "learning_rate": 0.01, "loss": 4.381878852844238, "num_input_tokens_seen": 3740352, "step": 942, "train_runtime": 755.2452, "train_tokens_per_second": 4952.5 }, { "epoch": 72.46153846153847, "num_input_tokens_seen": 3740352, "step": 942, "train_accuracy": 0.01953125 }, { "epoch": 72.53846153846153, "grad_norm": 2.5567116737365723, "learning_rate": 0.01, "loss": 4.386260986328125, "num_input_tokens_seen": 3744448, "step": 943, "train_runtime": 756.0642, "train_tokens_per_second": 4952.553 }, { "epoch": 72.53846153846153, "num_input_tokens_seen": 3744448, "step": 943, "train_accuracy": 0.03515625 }, { "epoch": 72.61538461538461, "grad_norm": 0.4510970413684845, "learning_rate": 0.01, "loss": 4.402202606201172, "num_input_tokens_seen": 3748544, "step": 944, "train_runtime": 756.8828, "train_tokens_per_second": 4952.608 }, { "epoch": 72.61538461538461, "num_input_tokens_seen": 3748544, "step": 944, "train_accuracy": 0.03125 }, { "epoch": 72.6923076923077, "grad_norm": 0.47819021344184875, "learning_rate": 0.01, "loss": 4.406796455383301, "num_input_tokens_seen": 3752640, "step": 945, "train_runtime": 757.7012, "train_tokens_per_second": 4952.665 }, { "epoch": 72.6923076923077, "num_input_tokens_seen": 3752640, "step": 945, "train_accuracy": 0.009765625 }, { "epoch": 72.76923076923077, "grad_norm": 0.8835750818252563, "learning_rate": 0.01, "loss": 4.430482387542725, "num_input_tokens_seen": 3756736, "step": 946, "train_runtime": 758.521, "train_tokens_per_second": 4952.712 }, { "epoch": 72.76923076923077, "num_input_tokens_seen": 3756736, "step": 946, "train_accuracy": 0.021484375 }, { "epoch": 72.84615384615384, "grad_norm": 1.2383958101272583, "learning_rate": 0.01, "loss": 4.416315078735352, "num_input_tokens_seen": 3760832, "step": 947, "train_runtime": 759.3402, "train_tokens_per_second": 4952.763 }, { "epoch": 72.84615384615384, "num_input_tokens_seen": 3760832, "step": 947, "train_accuracy": 0.009765625 }, { "epoch": 72.92307692307692, "grad_norm": 1.6494998931884766, "learning_rate": 0.01, "loss": 4.406277656555176, "num_input_tokens_seen": 3764928, "step": 948, "train_runtime": 760.1552, "train_tokens_per_second": 4952.841 }, { "epoch": 72.92307692307692, "num_input_tokens_seen": 3764928, "step": 948, "train_accuracy": 0.02280130237340927 }, { "epoch": 73.0, "grad_norm": 0.9242535829544067, "learning_rate": 0.01, "loss": 4.502875804901123, "num_input_tokens_seen": 3767384, "step": 949, "train_runtime": 760.6736, "train_tokens_per_second": 4952.695 }, { "epoch": 73.0, "num_input_tokens_seen": 3767384, "step": 949, "train_accuracy": 0.021484375 }, { "epoch": 73.07692307692308, "grad_norm": 0.8408144116401672, "learning_rate": 0.01, "loss": 4.431186676025391, "num_input_tokens_seen": 3771480, "step": 950, "train_runtime": 761.5042, "train_tokens_per_second": 4952.671 }, { "epoch": 73.07692307692308, "num_input_tokens_seen": 3771480, "step": 950, "train_accuracy": 0.041015625 }, { "epoch": 73.15384615384616, "grad_norm": 0.6841522455215454, "learning_rate": 0.01, "loss": 4.40715217590332, "num_input_tokens_seen": 3775576, "step": 951, "train_runtime": 762.3229, "train_tokens_per_second": 4952.725 }, { "epoch": 73.15384615384616, "num_input_tokens_seen": 3775576, "step": 951, "train_accuracy": 0.037109375 }, { "epoch": 73.23076923076923, "grad_norm": 0.39841896295547485, "learning_rate": 0.01, "loss": 4.319639682769775, "num_input_tokens_seen": 3779672, "step": 952, "train_runtime": 763.6838, "train_tokens_per_second": 4949.263 }, { "epoch": 73.23076923076923, "num_input_tokens_seen": 3779672, "step": 952, "train_accuracy": 0.033203125 }, { "epoch": 73.3076923076923, "grad_norm": 0.6825417876243591, "learning_rate": 0.01, "loss": 4.34348201751709, "num_input_tokens_seen": 3783768, "step": 953, "train_runtime": 764.5022, "train_tokens_per_second": 4949.323 }, { "epoch": 73.3076923076923, "num_input_tokens_seen": 3783768, "step": 953, "train_accuracy": 0.02734375 }, { "epoch": 73.38461538461539, "grad_norm": 0.6725438237190247, "learning_rate": 0.01, "loss": 4.354001998901367, "num_input_tokens_seen": 3787864, "step": 954, "train_runtime": 765.32, "train_tokens_per_second": 4949.386 }, { "epoch": 73.38461538461539, "num_input_tokens_seen": 3787864, "step": 954, "train_accuracy": 0.025390625 }, { "epoch": 73.46153846153847, "grad_norm": 1.6613304615020752, "learning_rate": 0.01, "loss": 4.371725559234619, "num_input_tokens_seen": 3791960, "step": 955, "train_runtime": 766.1378, "train_tokens_per_second": 4949.449 }, { "epoch": 73.46153846153847, "num_input_tokens_seen": 3791960, "step": 955, "train_accuracy": 0.029296875 }, { "epoch": 73.53846153846153, "grad_norm": 1.223771095275879, "learning_rate": 0.01, "loss": 4.372991561889648, "num_input_tokens_seen": 3796056, "step": 956, "train_runtime": 766.9556, "train_tokens_per_second": 4949.512 }, { "epoch": 73.53846153846153, "num_input_tokens_seen": 3796056, "step": 956, "train_accuracy": 0.017578125 }, { "epoch": 73.61538461538461, "grad_norm": 0.7996600866317749, "learning_rate": 0.01, "loss": 4.342113494873047, "num_input_tokens_seen": 3800152, "step": 957, "train_runtime": 767.7738, "train_tokens_per_second": 4949.572 }, { "epoch": 73.61538461538461, "num_input_tokens_seen": 3800152, "step": 957, "train_accuracy": 0.029296875 }, { "epoch": 73.6923076923077, "grad_norm": 1.256047010421753, "learning_rate": 0.01, "loss": 4.377371788024902, "num_input_tokens_seen": 3804248, "step": 958, "train_runtime": 768.5925, "train_tokens_per_second": 4949.629 }, { "epoch": 73.6923076923077, "num_input_tokens_seen": 3804248, "step": 958, "train_accuracy": 0.01953125 }, { "epoch": 73.76923076923077, "grad_norm": 0.7696335911750793, "learning_rate": 0.01, "loss": 4.350641250610352, "num_input_tokens_seen": 3808344, "step": 959, "train_runtime": 769.4112, "train_tokens_per_second": 4949.686 }, { "epoch": 73.76923076923077, "num_input_tokens_seen": 3808344, "step": 959, "train_accuracy": 0.01953125 }, { "epoch": 73.84615384615384, "grad_norm": 1.2821881771087646, "learning_rate": 0.01, "loss": 4.333581924438477, "num_input_tokens_seen": 3812440, "step": 960, "train_runtime": 770.2291, "train_tokens_per_second": 4949.748 }, { "epoch": 73.84615384615384, "num_input_tokens_seen": 3812440, "step": 960, "train_accuracy": 0.015625 }, { "epoch": 73.92307692307692, "grad_norm": 0.6806766986846924, "learning_rate": 0.01, "loss": 4.393897533416748, "num_input_tokens_seen": 3816536, "step": 961, "train_runtime": 771.0434, "train_tokens_per_second": 4949.833 }, { "epoch": 73.92307692307692, "num_input_tokens_seen": 3816536, "step": 961, "train_accuracy": 0.019543973729014397 }, { "epoch": 74.0, "grad_norm": 0.998210608959198, "learning_rate": 0.01, "loss": 4.358442783355713, "num_input_tokens_seen": 3818992, "step": 962, "train_runtime": 771.5609, "train_tokens_per_second": 4949.696 }, { "epoch": 74.0, "num_input_tokens_seen": 3818992, "step": 962, "train_accuracy": 0.015625 }, { "epoch": 74.07692307692308, "grad_norm": 0.5987136960029602, "learning_rate": 0.01, "loss": 4.374314308166504, "num_input_tokens_seen": 3823088, "step": 963, "train_runtime": 772.3907, "train_tokens_per_second": 4949.681 }, { "epoch": 74.07692307692308, "num_input_tokens_seen": 3823088, "step": 963, "train_accuracy": 0.021484375 }, { "epoch": 74.15384615384616, "grad_norm": 0.8599548935890198, "learning_rate": 0.01, "loss": 4.387784957885742, "num_input_tokens_seen": 3827184, "step": 964, "train_runtime": 773.2094, "train_tokens_per_second": 4949.738 }, { "epoch": 74.15384615384616, "num_input_tokens_seen": 3827184, "step": 964, "train_accuracy": 0.03125 }, { "epoch": 74.23076923076923, "grad_norm": 2.9651641845703125, "learning_rate": 0.01, "loss": 4.416442394256592, "num_input_tokens_seen": 3831280, "step": 965, "train_runtime": 774.0277, "train_tokens_per_second": 4949.797 }, { "epoch": 74.23076923076923, "num_input_tokens_seen": 3831280, "step": 965, "train_accuracy": 0.037109375 }, { "epoch": 74.3076923076923, "grad_norm": 0.8523027896881104, "learning_rate": 0.01, "loss": 4.401150703430176, "num_input_tokens_seen": 3835376, "step": 966, "train_runtime": 774.8466, "train_tokens_per_second": 4949.852 }, { "epoch": 74.3076923076923, "num_input_tokens_seen": 3835376, "step": 966, "train_accuracy": 0.017578125 }, { "epoch": 74.38461538461539, "grad_norm": 0.40367913246154785, "learning_rate": 0.01, "loss": 4.303525924682617, "num_input_tokens_seen": 3839472, "step": 967, "train_runtime": 775.6652, "train_tokens_per_second": 4949.909 }, { "epoch": 74.38461538461539, "num_input_tokens_seen": 3839472, "step": 967, "train_accuracy": 0.017578125 }, { "epoch": 74.46153846153847, "grad_norm": 1.1555758714675903, "learning_rate": 0.01, "loss": 4.327036380767822, "num_input_tokens_seen": 3843568, "step": 968, "train_runtime": 776.4845, "train_tokens_per_second": 4949.961 }, { "epoch": 74.46153846153847, "num_input_tokens_seen": 3843568, "step": 968, "train_accuracy": 0.01953125 }, { "epoch": 74.53846153846153, "grad_norm": 0.40165475010871887, "learning_rate": 0.01, "loss": 4.322185516357422, "num_input_tokens_seen": 3847664, "step": 969, "train_runtime": 777.3041, "train_tokens_per_second": 4950.011 }, { "epoch": 74.53846153846153, "num_input_tokens_seen": 3847664, "step": 969, "train_accuracy": 0.0234375 }, { "epoch": 74.61538461538461, "grad_norm": 14.481494903564453, "learning_rate": 0.01, "loss": 4.397060394287109, "num_input_tokens_seen": 3851760, "step": 970, "train_runtime": 778.1226, "train_tokens_per_second": 4950.068 }, { "epoch": 74.61538461538461, "num_input_tokens_seen": 3851760, "step": 970, "train_accuracy": 0.013671875 }, { "epoch": 74.6923076923077, "grad_norm": 1.5750373601913452, "learning_rate": 0.01, "loss": 4.374350070953369, "num_input_tokens_seen": 3855856, "step": 971, "train_runtime": 778.9408, "train_tokens_per_second": 4950.127 }, { "epoch": 74.6923076923077, "num_input_tokens_seen": 3855856, "step": 971, "train_accuracy": 0.01953125 }, { "epoch": 74.76923076923077, "grad_norm": 2.556546688079834, "learning_rate": 0.01, "loss": 4.3275556564331055, "num_input_tokens_seen": 3859952, "step": 972, "train_runtime": 779.7665, "train_tokens_per_second": 4950.138 }, { "epoch": 74.76923076923077, "num_input_tokens_seen": 3859952, "step": 972, "train_accuracy": 0.0234375 }, { "epoch": 74.84615384615384, "grad_norm": 0.40207862854003906, "learning_rate": 0.01, "loss": 4.291187286376953, "num_input_tokens_seen": 3864048, "step": 973, "train_runtime": 780.5871, "train_tokens_per_second": 4950.182 }, { "epoch": 74.84615384615384, "num_input_tokens_seen": 3864048, "step": 973, "train_accuracy": 0.01953125 }, { "epoch": 74.92307692307692, "grad_norm": 0.8552497029304504, "learning_rate": 0.01, "loss": 4.339695930480957, "num_input_tokens_seen": 3868144, "step": 974, "train_runtime": 781.4012, "train_tokens_per_second": 4950.266 }, { "epoch": 74.92307692307692, "num_input_tokens_seen": 3868144, "step": 974, "train_accuracy": 0.026058631017804146 }, { "epoch": 75.0, "grad_norm": 1.4550114870071411, "learning_rate": 0.01, "loss": 4.3495965003967285, "num_input_tokens_seen": 3870600, "step": 975, "train_runtime": 781.9189, "train_tokens_per_second": 4950.13 }, { "epoch": 75.0, "num_input_tokens_seen": 3870600, "step": 975, "train_accuracy": 0.04296875 }, { "epoch": 75.07692307692308, "grad_norm": 1.2355130910873413, "learning_rate": 0.01, "loss": 4.248445987701416, "num_input_tokens_seen": 3874696, "step": 976, "train_runtime": 782.7524, "train_tokens_per_second": 4950.092 }, { "epoch": 75.07692307692308, "num_input_tokens_seen": 3874696, "step": 976, "train_accuracy": 0.01953125 }, { "epoch": 75.15384615384616, "grad_norm": 1.122639536857605, "learning_rate": 0.01, "loss": 4.32548713684082, "num_input_tokens_seen": 3878792, "step": 977, "train_runtime": 783.5706, "train_tokens_per_second": 4950.15 }, { "epoch": 75.15384615384616, "num_input_tokens_seen": 3878792, "step": 977, "train_accuracy": 0.04296875 }, { "epoch": 75.23076923076923, "grad_norm": 0.5361711382865906, "learning_rate": 0.01, "loss": 4.248356342315674, "num_input_tokens_seen": 3882888, "step": 978, "train_runtime": 784.3897, "train_tokens_per_second": 4950.203 }, { "epoch": 75.23076923076923, "num_input_tokens_seen": 3882888, "step": 978, "train_accuracy": 0.021484375 }, { "epoch": 75.3076923076923, "grad_norm": 0.6754993200302124, "learning_rate": 0.01, "loss": 4.307168006896973, "num_input_tokens_seen": 3886984, "step": 979, "train_runtime": 785.209, "train_tokens_per_second": 4950.254 }, { "epoch": 75.3076923076923, "num_input_tokens_seen": 3886984, "step": 979, "train_accuracy": 0.025390625 }, { "epoch": 75.38461538461539, "grad_norm": 0.46616852283477783, "learning_rate": 0.01, "loss": 4.327777862548828, "num_input_tokens_seen": 3891080, "step": 980, "train_runtime": 786.0275, "train_tokens_per_second": 4950.31 }, { "epoch": 75.38461538461539, "num_input_tokens_seen": 3891080, "step": 980, "train_accuracy": 0.0390625 }, { "epoch": 75.46153846153847, "grad_norm": 1.2690057754516602, "learning_rate": 0.01, "loss": 4.262716293334961, "num_input_tokens_seen": 3895176, "step": 981, "train_runtime": 786.8466, "train_tokens_per_second": 4950.363 }, { "epoch": 75.46153846153847, "num_input_tokens_seen": 3895176, "step": 981, "train_accuracy": 0.017578125 }, { "epoch": 75.53846153846153, "grad_norm": 0.8771840333938599, "learning_rate": 0.01, "loss": 4.32326602935791, "num_input_tokens_seen": 3899272, "step": 982, "train_runtime": 787.6731, "train_tokens_per_second": 4950.368 }, { "epoch": 75.53846153846153, "num_input_tokens_seen": 3899272, "step": 982, "train_accuracy": 0.04296875 }, { "epoch": 75.61538461538461, "grad_norm": 7.643060207366943, "learning_rate": 0.01, "loss": 4.260503768920898, "num_input_tokens_seen": 3903368, "step": 983, "train_runtime": 788.4916, "train_tokens_per_second": 4950.425 }, { "epoch": 75.61538461538461, "num_input_tokens_seen": 3903368, "step": 983, "train_accuracy": 0.02734375 }, { "epoch": 75.6923076923077, "grad_norm": 0.5241610407829285, "learning_rate": 0.01, "loss": 4.345402240753174, "num_input_tokens_seen": 3907464, "step": 984, "train_runtime": 789.3117, "train_tokens_per_second": 4950.47 }, { "epoch": 75.6923076923077, "num_input_tokens_seen": 3907464, "step": 984, "train_accuracy": 0.029296875 }, { "epoch": 75.76923076923077, "grad_norm": 0.5066173672676086, "learning_rate": 0.01, "loss": 4.356078147888184, "num_input_tokens_seen": 3911560, "step": 985, "train_runtime": 790.1298, "train_tokens_per_second": 4950.528 }, { "epoch": 75.76923076923077, "num_input_tokens_seen": 3911560, "step": 985, "train_accuracy": 0.01953125 }, { "epoch": 75.84615384615384, "grad_norm": 0.6324288845062256, "learning_rate": 0.01, "loss": 4.339529037475586, "num_input_tokens_seen": 3915656, "step": 986, "train_runtime": 790.9508, "train_tokens_per_second": 4950.568 }, { "epoch": 75.84615384615384, "num_input_tokens_seen": 3915656, "step": 986, "train_accuracy": 0.0234375 }, { "epoch": 75.92307692307692, "grad_norm": 0.7764051556587219, "learning_rate": 0.01, "loss": 4.338321208953857, "num_input_tokens_seen": 3919752, "step": 987, "train_runtime": 791.7661, "train_tokens_per_second": 4950.644 }, { "epoch": 75.92307692307692, "num_input_tokens_seen": 3919752, "step": 987, "train_accuracy": 0.016286645084619522 }, { "epoch": 76.0, "grad_norm": 0.6350783109664917, "learning_rate": 0.01, "loss": 4.3816609382629395, "num_input_tokens_seen": 3922208, "step": 988, "train_runtime": 792.2841, "train_tokens_per_second": 4950.507 }, { "epoch": 76.0, "num_input_tokens_seen": 3922208, "step": 988, "train_accuracy": 0.03125 }, { "epoch": 76.07692307692308, "grad_norm": 2.2945821285247803, "learning_rate": 0.01, "loss": 4.2715864181518555, "num_input_tokens_seen": 3926304, "step": 989, "train_runtime": 793.116, "train_tokens_per_second": 4950.479 }, { "epoch": 76.07692307692308, "num_input_tokens_seen": 3926304, "step": 989, "train_accuracy": 0.0390625 }, { "epoch": 76.15384615384616, "grad_norm": 0.5859194397926331, "learning_rate": 0.01, "loss": 4.2348175048828125, "num_input_tokens_seen": 3930400, "step": 990, "train_runtime": 793.9358, "train_tokens_per_second": 4950.526 }, { "epoch": 76.15384615384616, "num_input_tokens_seen": 3930400, "step": 990, "train_accuracy": 0.04296875 }, { "epoch": 76.23076923076923, "grad_norm": 0.4957868754863739, "learning_rate": 0.01, "loss": 4.291881561279297, "num_input_tokens_seen": 3934496, "step": 991, "train_runtime": 794.7544, "train_tokens_per_second": 4950.581 }, { "epoch": 76.23076923076923, "num_input_tokens_seen": 3934496, "step": 991, "train_accuracy": 0.0390625 }, { "epoch": 76.3076923076923, "grad_norm": 0.5065727233886719, "learning_rate": 0.01, "loss": 4.309178829193115, "num_input_tokens_seen": 3938592, "step": 992, "train_runtime": 795.5729, "train_tokens_per_second": 4950.636 }, { "epoch": 76.3076923076923, "num_input_tokens_seen": 3938592, "step": 992, "train_accuracy": 0.029296875 }, { "epoch": 76.38461538461539, "grad_norm": 0.877784013748169, "learning_rate": 0.01, "loss": 4.307445049285889, "num_input_tokens_seen": 3942688, "step": 993, "train_runtime": 796.3908, "train_tokens_per_second": 4950.695 }, { "epoch": 76.38461538461539, "num_input_tokens_seen": 3942688, "step": 993, "train_accuracy": 0.03515625 }, { "epoch": 76.46153846153847, "grad_norm": 0.6491925120353699, "learning_rate": 0.01, "loss": 4.238561153411865, "num_input_tokens_seen": 3946784, "step": 994, "train_runtime": 797.2094, "train_tokens_per_second": 4950.749 }, { "epoch": 76.46153846153847, "num_input_tokens_seen": 3946784, "step": 994, "train_accuracy": 0.0234375 }, { "epoch": 76.53846153846153, "grad_norm": 0.8613327145576477, "learning_rate": 0.01, "loss": 4.259726047515869, "num_input_tokens_seen": 3950880, "step": 995, "train_runtime": 798.0284, "train_tokens_per_second": 4950.801 }, { "epoch": 76.53846153846153, "num_input_tokens_seen": 3950880, "step": 995, "train_accuracy": 0.033203125 }, { "epoch": 76.61538461538461, "grad_norm": 1.273020625114441, "learning_rate": 0.01, "loss": 4.271668910980225, "num_input_tokens_seen": 3954976, "step": 996, "train_runtime": 798.8477, "train_tokens_per_second": 4950.851 }, { "epoch": 76.61538461538461, "num_input_tokens_seen": 3954976, "step": 996, "train_accuracy": 0.029296875 }, { "epoch": 76.6923076923077, "grad_norm": 0.4400981664657593, "learning_rate": 0.01, "loss": 4.302046298980713, "num_input_tokens_seen": 3959072, "step": 997, "train_runtime": 799.6675, "train_tokens_per_second": 4950.898 }, { "epoch": 76.6923076923077, "num_input_tokens_seen": 3959072, "step": 997, "train_accuracy": 0.0234375 }, { "epoch": 76.76923076923077, "grad_norm": 0.5882481336593628, "learning_rate": 0.01, "loss": 4.22745418548584, "num_input_tokens_seen": 3963168, "step": 998, "train_runtime": 800.4862, "train_tokens_per_second": 4950.951 }, { "epoch": 76.76923076923077, "num_input_tokens_seen": 3963168, "step": 998, "train_accuracy": 0.04296875 }, { "epoch": 76.84615384615384, "grad_norm": 0.5601505637168884, "learning_rate": 0.01, "loss": 4.18474006652832, "num_input_tokens_seen": 3967264, "step": 999, "train_runtime": 801.305, "train_tokens_per_second": 4951.003 }, { "epoch": 76.84615384615384, "num_input_tokens_seen": 3967264, "step": 999, "train_accuracy": 0.0234375 }, { "epoch": 76.92307692307692, "grad_norm": 0.6990476250648499, "learning_rate": 0.01, "loss": 4.3541154861450195, "num_input_tokens_seen": 3971360, "step": 1000, "train_runtime": 802.1186, "train_tokens_per_second": 4951.088 }, { "epoch": 76.92307692307692, "eval_CMD_3_branch_eval_accuracy": 0.01735985533453888, "eval_CMD_3_branch_eval_loss": 4.395492076873779, "eval_CMD_3_branch_eval_runtime": 1.165, "eval_CMD_3_branch_eval_samples_per_second": 2373.337, "eval_CMD_3_branch_eval_steps_per_second": 5.15, "num_input_tokens_seen": 3971360, "step": 1000 }, { "epoch": 76.92307692307692, "num_input_tokens_seen": 3971360, "step": 1000, "train_accuracy": 0.06514658033847809 }, { "epoch": 77.0, "grad_norm": 0.8677210211753845, "learning_rate": 0.01, "loss": 4.1859660148620605, "num_input_tokens_seen": 3973816, "step": 1001, "train_runtime": 819.9952, "train_tokens_per_second": 4846.145 }, { "epoch": 77.0, "num_input_tokens_seen": 3973816, "step": 1001, "train_accuracy": 0.01953125 }, { "epoch": 77.07692307692308, "grad_norm": 0.6715117692947388, "learning_rate": 0.01, "loss": 4.3048624992370605, "num_input_tokens_seen": 3977912, "step": 1002, "train_runtime": 820.8133, "train_tokens_per_second": 4846.305 }, { "epoch": 77.07692307692308, "num_input_tokens_seen": 3977912, "step": 1002, "train_accuracy": 0.044921875 }, { "epoch": 77.15384615384616, "grad_norm": 1.224298119544983, "learning_rate": 0.01, "loss": 4.202672004699707, "num_input_tokens_seen": 3982008, "step": 1003, "train_runtime": 821.6194, "train_tokens_per_second": 4846.536 }, { "epoch": 77.15384615384616, "num_input_tokens_seen": 3982008, "step": 1003, "train_accuracy": 0.044921875 }, { "epoch": 77.23076923076923, "grad_norm": 0.4090309739112854, "learning_rate": 0.01, "loss": 4.234436988830566, "num_input_tokens_seen": 3986104, "step": 1004, "train_runtime": 822.4263, "train_tokens_per_second": 4846.761 }, { "epoch": 77.23076923076923, "num_input_tokens_seen": 3986104, "step": 1004, "train_accuracy": 0.015625 }, { "epoch": 77.3076923076923, "grad_norm": 0.587716281414032, "learning_rate": 0.01, "loss": 4.283956527709961, "num_input_tokens_seen": 3990200, "step": 1005, "train_runtime": 823.2341, "train_tokens_per_second": 4846.981 }, { "epoch": 77.3076923076923, "num_input_tokens_seen": 3990200, "step": 1005, "train_accuracy": 0.03125 }, { "epoch": 77.38461538461539, "grad_norm": 0.46258968114852905, "learning_rate": 0.01, "loss": 4.266878128051758, "num_input_tokens_seen": 3994296, "step": 1006, "train_runtime": 824.0426, "train_tokens_per_second": 4847.196 }, { "epoch": 77.38461538461539, "num_input_tokens_seen": 3994296, "step": 1006, "train_accuracy": 0.0390625 }, { "epoch": 77.46153846153847, "grad_norm": 0.8795014023780823, "learning_rate": 0.01, "loss": 4.294693946838379, "num_input_tokens_seen": 3998392, "step": 1007, "train_runtime": 824.8502, "train_tokens_per_second": 4847.416 }, { "epoch": 77.46153846153847, "num_input_tokens_seen": 3998392, "step": 1007, "train_accuracy": 0.025390625 }, { "epoch": 77.53846153846153, "grad_norm": 0.5326021313667297, "learning_rate": 0.01, "loss": 4.288190841674805, "num_input_tokens_seen": 4002488, "step": 1008, "train_runtime": 825.6595, "train_tokens_per_second": 4847.626 }, { "epoch": 77.53846153846153, "num_input_tokens_seen": 4002488, "step": 1008, "train_accuracy": 0.02734375 }, { "epoch": 77.61538461538461, "grad_norm": 0.44118621945381165, "learning_rate": 0.01, "loss": 4.2714433670043945, "num_input_tokens_seen": 4006584, "step": 1009, "train_runtime": 826.4689, "train_tokens_per_second": 4847.834 }, { "epoch": 77.61538461538461, "num_input_tokens_seen": 4006584, "step": 1009, "train_accuracy": 0.01953125 }, { "epoch": 77.6923076923077, "grad_norm": 0.47735729813575745, "learning_rate": 0.01, "loss": 4.25751256942749, "num_input_tokens_seen": 4010680, "step": 1010, "train_runtime": 827.2768, "train_tokens_per_second": 4848.051 }, { "epoch": 77.6923076923077, "num_input_tokens_seen": 4010680, "step": 1010, "train_accuracy": 0.021484375 }, { "epoch": 77.76923076923077, "grad_norm": 0.5568310022354126, "learning_rate": 0.01, "loss": 4.27866792678833, "num_input_tokens_seen": 4014776, "step": 1011, "train_runtime": 828.0854, "train_tokens_per_second": 4848.263 }, { "epoch": 77.76923076923077, "num_input_tokens_seen": 4014776, "step": 1011, "train_accuracy": 0.025390625 }, { "epoch": 77.84615384615384, "grad_norm": 0.47787994146347046, "learning_rate": 0.01, "loss": 4.250924110412598, "num_input_tokens_seen": 4018872, "step": 1012, "train_runtime": 828.8949, "train_tokens_per_second": 4848.47 }, { "epoch": 77.84615384615384, "num_input_tokens_seen": 4018872, "step": 1012, "train_accuracy": 0.046875 }, { "epoch": 77.92307692307692, "grad_norm": 0.5050224661827087, "learning_rate": 0.01, "loss": 4.301644802093506, "num_input_tokens_seen": 4022968, "step": 1013, "train_runtime": 829.7, "train_tokens_per_second": 4848.702 }, { "epoch": 77.92307692307692, "num_input_tokens_seen": 4022968, "step": 1013, "train_accuracy": 0.016286645084619522 }, { "epoch": 78.0, "grad_norm": 1.0325103998184204, "learning_rate": 0.01, "loss": 4.303225040435791, "num_input_tokens_seen": 4025424, "step": 1014, "train_runtime": 830.2129, "train_tokens_per_second": 4848.665 }, { "epoch": 78.0, "num_input_tokens_seen": 4025424, "step": 1014, "train_accuracy": 0.041015625 }, { "epoch": 78.07692307692308, "grad_norm": 0.42929312586784363, "learning_rate": 0.01, "loss": 4.242375373840332, "num_input_tokens_seen": 4029520, "step": 1015, "train_runtime": 831.0341, "train_tokens_per_second": 4848.802 }, { "epoch": 78.07692307692308, "num_input_tokens_seen": 4029520, "step": 1015, "train_accuracy": 0.0390625 }, { "epoch": 78.15384615384616, "grad_norm": 1.1013460159301758, "learning_rate": 0.01, "loss": 4.244626045227051, "num_input_tokens_seen": 4033616, "step": 1016, "train_runtime": 831.8509, "train_tokens_per_second": 4848.965 }, { "epoch": 78.15384615384616, "num_input_tokens_seen": 4033616, "step": 1016, "train_accuracy": 0.04296875 }, { "epoch": 78.23076923076923, "grad_norm": 0.7049079537391663, "learning_rate": 0.01, "loss": 4.299908638000488, "num_input_tokens_seen": 4037712, "step": 1017, "train_runtime": 832.6647, "train_tokens_per_second": 4849.145 }, { "epoch": 78.23076923076923, "num_input_tokens_seen": 4037712, "step": 1017, "train_accuracy": 0.03125 }, { "epoch": 78.3076923076923, "grad_norm": 7.399558067321777, "learning_rate": 0.01, "loss": 4.2371745109558105, "num_input_tokens_seen": 4041808, "step": 1018, "train_runtime": 833.4753, "train_tokens_per_second": 4849.343 }, { "epoch": 78.3076923076923, "num_input_tokens_seen": 4041808, "step": 1018, "train_accuracy": 0.033203125 }, { "epoch": 78.38461538461539, "grad_norm": 0.5494755506515503, "learning_rate": 0.01, "loss": 4.262982368469238, "num_input_tokens_seen": 4045904, "step": 1019, "train_runtime": 834.2875, "train_tokens_per_second": 4849.532 }, { "epoch": 78.38461538461539, "num_input_tokens_seen": 4045904, "step": 1019, "train_accuracy": 0.02734375 }, { "epoch": 78.46153846153847, "grad_norm": 0.7562094330787659, "learning_rate": 0.01, "loss": 4.380556106567383, "num_input_tokens_seen": 4050000, "step": 1020, "train_runtime": 835.0982, "train_tokens_per_second": 4849.729 }, { "epoch": 78.46153846153847, "num_input_tokens_seen": 4050000, "step": 1020, "train_accuracy": 0.041015625 }, { "epoch": 78.53846153846153, "grad_norm": 0.7579846978187561, "learning_rate": 0.01, "loss": 4.199994087219238, "num_input_tokens_seen": 4054096, "step": 1021, "train_runtime": 835.9089, "train_tokens_per_second": 4849.926 }, { "epoch": 78.53846153846153, "num_input_tokens_seen": 4054096, "step": 1021, "train_accuracy": 0.037109375 }, { "epoch": 78.61538461538461, "grad_norm": 0.7965441942214966, "learning_rate": 0.01, "loss": 4.252337455749512, "num_input_tokens_seen": 4058192, "step": 1022, "train_runtime": 836.7224, "train_tokens_per_second": 4850.105 }, { "epoch": 78.61538461538461, "num_input_tokens_seen": 4058192, "step": 1022, "train_accuracy": 0.029296875 }, { "epoch": 78.6923076923077, "grad_norm": 0.5306705236434937, "learning_rate": 0.01, "loss": 4.2623090744018555, "num_input_tokens_seen": 4062288, "step": 1023, "train_runtime": 837.5341, "train_tokens_per_second": 4850.295 }, { "epoch": 78.6923076923077, "num_input_tokens_seen": 4062288, "step": 1023, "train_accuracy": 0.021484375 }, { "epoch": 78.76923076923077, "grad_norm": 0.5631991028785706, "learning_rate": 0.01, "loss": 4.307033538818359, "num_input_tokens_seen": 4066384, "step": 1024, "train_runtime": 838.3458, "train_tokens_per_second": 4850.485 }, { "epoch": 78.76923076923077, "num_input_tokens_seen": 4066384, "step": 1024, "train_accuracy": 0.01953125 }, { "epoch": 78.84615384615384, "grad_norm": 0.9251755475997925, "learning_rate": 0.01, "loss": 4.3464860916137695, "num_input_tokens_seen": 4070480, "step": 1025, "train_runtime": 839.1571, "train_tokens_per_second": 4850.677 }, { "epoch": 78.84615384615384, "num_input_tokens_seen": 4070480, "step": 1025, "train_accuracy": 0.03515625 }, { "epoch": 78.92307692307692, "grad_norm": 3.4484596252441406, "learning_rate": 0.01, "loss": 4.21057653427124, "num_input_tokens_seen": 4074576, "step": 1026, "train_runtime": 839.9638, "train_tokens_per_second": 4850.895 }, { "epoch": 78.92307692307692, "num_input_tokens_seen": 4074576, "step": 1026, "train_accuracy": 0.02931595966219902 }, { "epoch": 79.0, "grad_norm": 0.8657160401344299, "learning_rate": 0.01, "loss": 4.253246784210205, "num_input_tokens_seen": 4077032, "step": 1027, "train_runtime": 840.4776, "train_tokens_per_second": 4850.851 }, { "epoch": 79.0, "num_input_tokens_seen": 4077032, "step": 1027, "train_accuracy": 0.025390625 }, { "epoch": 79.07692307692308, "grad_norm": 1.3953666687011719, "learning_rate": 0.01, "loss": 4.2584757804870605, "num_input_tokens_seen": 4081128, "step": 1028, "train_runtime": 841.3018, "train_tokens_per_second": 4850.968 }, { "epoch": 79.07692307692308, "num_input_tokens_seen": 4081128, "step": 1028, "train_accuracy": 0.041015625 }, { "epoch": 79.15384615384616, "grad_norm": 0.5391897559165955, "learning_rate": 0.01, "loss": 4.180985450744629, "num_input_tokens_seen": 4085224, "step": 1029, "train_runtime": 842.113, "train_tokens_per_second": 4851.159 }, { "epoch": 79.15384615384616, "num_input_tokens_seen": 4085224, "step": 1029, "train_accuracy": 0.041015625 }, { "epoch": 79.23076923076923, "grad_norm": 0.47898000478744507, "learning_rate": 0.01, "loss": 4.175528526306152, "num_input_tokens_seen": 4089320, "step": 1030, "train_runtime": 842.9248, "train_tokens_per_second": 4851.346 }, { "epoch": 79.23076923076923, "num_input_tokens_seen": 4089320, "step": 1030, "train_accuracy": 0.03125 }, { "epoch": 79.3076923076923, "grad_norm": 0.6484806537628174, "learning_rate": 0.01, "loss": 4.273150444030762, "num_input_tokens_seen": 4093416, "step": 1031, "train_runtime": 843.7382, "train_tokens_per_second": 4851.524 }, { "epoch": 79.3076923076923, "num_input_tokens_seen": 4093416, "step": 1031, "train_accuracy": 0.0546875 }, { "epoch": 79.38461538461539, "grad_norm": 0.8459232449531555, "learning_rate": 0.01, "loss": 4.244646072387695, "num_input_tokens_seen": 4097512, "step": 1032, "train_runtime": 844.5509, "train_tokens_per_second": 4851.705 }, { "epoch": 79.38461538461539, "num_input_tokens_seen": 4097512, "step": 1032, "train_accuracy": 0.03125 }, { "epoch": 79.46153846153847, "grad_norm": 0.4148889482021332, "learning_rate": 0.01, "loss": 4.248509407043457, "num_input_tokens_seen": 4101608, "step": 1033, "train_runtime": 845.3638, "train_tokens_per_second": 4851.885 }, { "epoch": 79.46153846153847, "num_input_tokens_seen": 4101608, "step": 1033, "train_accuracy": 0.044921875 }, { "epoch": 79.53846153846153, "grad_norm": 0.5211220383644104, "learning_rate": 0.01, "loss": 4.183545112609863, "num_input_tokens_seen": 4105704, "step": 1034, "train_runtime": 846.1766, "train_tokens_per_second": 4852.065 }, { "epoch": 79.53846153846153, "num_input_tokens_seen": 4105704, "step": 1034, "train_accuracy": 0.029296875 }, { "epoch": 79.61538461538461, "grad_norm": 0.6639049649238586, "learning_rate": 0.01, "loss": 4.243070602416992, "num_input_tokens_seen": 4109800, "step": 1035, "train_runtime": 846.9891, "train_tokens_per_second": 4852.247 }, { "epoch": 79.61538461538461, "num_input_tokens_seen": 4109800, "step": 1035, "train_accuracy": 0.015625 }, { "epoch": 79.6923076923077, "grad_norm": 1.5792025327682495, "learning_rate": 0.01, "loss": 4.212851047515869, "num_input_tokens_seen": 4113896, "step": 1036, "train_runtime": 847.801, "train_tokens_per_second": 4852.431 }, { "epoch": 79.6923076923077, "num_input_tokens_seen": 4113896, "step": 1036, "train_accuracy": 0.04296875 }, { "epoch": 79.76923076923077, "grad_norm": 0.7158578038215637, "learning_rate": 0.01, "loss": 4.255945682525635, "num_input_tokens_seen": 4117992, "step": 1037, "train_runtime": 848.6136, "train_tokens_per_second": 4852.611 }, { "epoch": 79.76923076923077, "num_input_tokens_seen": 4117992, "step": 1037, "train_accuracy": 0.046875 }, { "epoch": 79.84615384615384, "grad_norm": 0.35050055384635925, "learning_rate": 0.01, "loss": 4.240667343139648, "num_input_tokens_seen": 4122088, "step": 1038, "train_runtime": 849.4272, "train_tokens_per_second": 4852.786 }, { "epoch": 79.84615384615384, "num_input_tokens_seen": 4122088, "step": 1038, "train_accuracy": 0.0234375 }, { "epoch": 79.92307692307692, "grad_norm": 0.6327638030052185, "learning_rate": 0.01, "loss": 4.217525482177734, "num_input_tokens_seen": 4126184, "step": 1039, "train_runtime": 850.2363, "train_tokens_per_second": 4852.985 }, { "epoch": 79.92307692307692, "num_input_tokens_seen": 4126184, "step": 1039, "train_accuracy": 0.02280130237340927 }, { "epoch": 80.0, "grad_norm": 0.42952316999435425, "learning_rate": 0.01, "loss": 4.2495646476745605, "num_input_tokens_seen": 4128640, "step": 1040, "train_runtime": 850.7507, "train_tokens_per_second": 4852.937 }, { "epoch": 80.0, "num_input_tokens_seen": 4128640, "step": 1040, "train_accuracy": 0.044921875 }, { "epoch": 80.07692307692308, "grad_norm": 2.4387288093566895, "learning_rate": 0.01, "loss": 4.163417816162109, "num_input_tokens_seen": 4132736, "step": 1041, "train_runtime": 851.5759, "train_tokens_per_second": 4853.045 }, { "epoch": 80.07692307692308, "num_input_tokens_seen": 4132736, "step": 1041, "train_accuracy": 0.037109375 }, { "epoch": 80.15384615384616, "grad_norm": 0.8980920314788818, "learning_rate": 0.01, "loss": 4.2331037521362305, "num_input_tokens_seen": 4136832, "step": 1042, "train_runtime": 852.3892, "train_tokens_per_second": 4853.22 }, { "epoch": 80.15384615384616, "num_input_tokens_seen": 4136832, "step": 1042, "train_accuracy": 0.033203125 }, { "epoch": 80.23076923076923, "grad_norm": 1.5235867500305176, "learning_rate": 0.01, "loss": 4.24924373626709, "num_input_tokens_seen": 4140928, "step": 1043, "train_runtime": 853.2033, "train_tokens_per_second": 4853.389 }, { "epoch": 80.23076923076923, "num_input_tokens_seen": 4140928, "step": 1043, "train_accuracy": 0.044921875 }, { "epoch": 80.3076923076923, "grad_norm": 3.1564149856567383, "learning_rate": 0.01, "loss": 4.218427658081055, "num_input_tokens_seen": 4145024, "step": 1044, "train_runtime": 854.0173, "train_tokens_per_second": 4853.56 }, { "epoch": 80.3076923076923, "num_input_tokens_seen": 4145024, "step": 1044, "train_accuracy": 0.03515625 }, { "epoch": 80.38461538461539, "grad_norm": 0.7506723403930664, "learning_rate": 0.01, "loss": 4.248618125915527, "num_input_tokens_seen": 4149120, "step": 1045, "train_runtime": 854.8303, "train_tokens_per_second": 4853.735 }, { "epoch": 80.38461538461539, "num_input_tokens_seen": 4149120, "step": 1045, "train_accuracy": 0.0234375 }, { "epoch": 80.46153846153847, "grad_norm": 0.6711944937705994, "learning_rate": 0.01, "loss": 4.253600597381592, "num_input_tokens_seen": 4153216, "step": 1046, "train_runtime": 855.6443, "train_tokens_per_second": 4853.905 }, { "epoch": 80.46153846153847, "num_input_tokens_seen": 4153216, "step": 1046, "train_accuracy": 0.02734375 }, { "epoch": 80.53846153846153, "grad_norm": 0.5716758370399475, "learning_rate": 0.01, "loss": 4.272745132446289, "num_input_tokens_seen": 4157312, "step": 1047, "train_runtime": 856.4592, "train_tokens_per_second": 4854.069 }, { "epoch": 80.53846153846153, "num_input_tokens_seen": 4157312, "step": 1047, "train_accuracy": 0.041015625 }, { "epoch": 80.61538461538461, "grad_norm": 0.4625732898712158, "learning_rate": 0.01, "loss": 4.166475772857666, "num_input_tokens_seen": 4161408, "step": 1048, "train_runtime": 857.275, "train_tokens_per_second": 4854.228 }, { "epoch": 80.61538461538461, "num_input_tokens_seen": 4161408, "step": 1048, "train_accuracy": 0.041015625 }, { "epoch": 80.6923076923077, "grad_norm": 1.3532286882400513, "learning_rate": 0.01, "loss": 4.213746070861816, "num_input_tokens_seen": 4165504, "step": 1049, "train_runtime": 858.0885, "train_tokens_per_second": 4854.399 }, { "epoch": 80.6923076923077, "num_input_tokens_seen": 4165504, "step": 1049, "train_accuracy": 0.021484375 }, { "epoch": 80.76923076923077, "grad_norm": 0.7559223771095276, "learning_rate": 0.01, "loss": 4.3056559562683105, "num_input_tokens_seen": 4169600, "step": 1050, "train_runtime": 858.9036, "train_tokens_per_second": 4854.561 }, { "epoch": 80.76923076923077, "num_input_tokens_seen": 4169600, "step": 1050, "train_accuracy": 0.01953125 }, { "epoch": 80.84615384615384, "grad_norm": 2.033456325531006, "learning_rate": 0.01, "loss": 4.330817222595215, "num_input_tokens_seen": 4173696, "step": 1051, "train_runtime": 859.7179, "train_tokens_per_second": 4854.727 }, { "epoch": 80.84615384615384, "num_input_tokens_seen": 4173696, "step": 1051, "train_accuracy": 0.01953125 }, { "epoch": 80.92307692307692, "grad_norm": 2.785479784011841, "learning_rate": 0.01, "loss": 4.377662658691406, "num_input_tokens_seen": 4177792, "step": 1052, "train_runtime": 860.5279, "train_tokens_per_second": 4854.918 }, { "epoch": 80.92307692307692, "num_input_tokens_seen": 4177792, "step": 1052, "train_accuracy": 0.02931595966219902 }, { "epoch": 81.0, "grad_norm": 1.168498158454895, "learning_rate": 0.01, "loss": 4.308221340179443, "num_input_tokens_seen": 4180248, "step": 1053, "train_runtime": 861.0432, "train_tokens_per_second": 4854.864 }, { "epoch": 81.0, "num_input_tokens_seen": 4180248, "step": 1053, "train_accuracy": 0.029296875 }, { "epoch": 81.07692307692308, "grad_norm": 0.596804678440094, "learning_rate": 0.01, "loss": 4.257911205291748, "num_input_tokens_seen": 4184344, "step": 1054, "train_runtime": 861.8729, "train_tokens_per_second": 4854.943 }, { "epoch": 81.07692307692308, "num_input_tokens_seen": 4184344, "step": 1054, "train_accuracy": 0.029296875 }, { "epoch": 81.15384615384616, "grad_norm": 1.002935767173767, "learning_rate": 0.01, "loss": 4.293037414550781, "num_input_tokens_seen": 4188440, "step": 1055, "train_runtime": 862.687, "train_tokens_per_second": 4855.109 }, { "epoch": 81.15384615384616, "num_input_tokens_seen": 4188440, "step": 1055, "train_accuracy": 0.033203125 }, { "epoch": 81.23076923076923, "grad_norm": 0.7886541485786438, "learning_rate": 0.01, "loss": 4.286433219909668, "num_input_tokens_seen": 4192536, "step": 1056, "train_runtime": 863.5013, "train_tokens_per_second": 4855.274 }, { "epoch": 81.23076923076923, "num_input_tokens_seen": 4192536, "step": 1056, "train_accuracy": 0.029296875 }, { "epoch": 81.3076923076923, "grad_norm": 0.6340736150741577, "learning_rate": 0.01, "loss": 4.273266792297363, "num_input_tokens_seen": 4196632, "step": 1057, "train_runtime": 864.3156, "train_tokens_per_second": 4855.44 }, { "epoch": 81.3076923076923, "num_input_tokens_seen": 4196632, "step": 1057, "train_accuracy": 0.02734375 }, { "epoch": 81.38461538461539, "grad_norm": 1.1839436292648315, "learning_rate": 0.01, "loss": 4.253959655761719, "num_input_tokens_seen": 4200728, "step": 1058, "train_runtime": 865.1308, "train_tokens_per_second": 4855.599 }, { "epoch": 81.38461538461539, "num_input_tokens_seen": 4200728, "step": 1058, "train_accuracy": 0.037109375 }, { "epoch": 81.46153846153847, "grad_norm": 0.7244887948036194, "learning_rate": 0.01, "loss": 4.320132255554199, "num_input_tokens_seen": 4204824, "step": 1059, "train_runtime": 865.9461, "train_tokens_per_second": 4855.757 }, { "epoch": 81.46153846153847, "num_input_tokens_seen": 4204824, "step": 1059, "train_accuracy": 0.041015625 }, { "epoch": 81.53846153846153, "grad_norm": 4.3612847328186035, "learning_rate": 0.01, "loss": 4.247152805328369, "num_input_tokens_seen": 4208920, "step": 1060, "train_runtime": 866.7613, "train_tokens_per_second": 4855.916 }, { "epoch": 81.53846153846153, "num_input_tokens_seen": 4208920, "step": 1060, "train_accuracy": 0.021484375 }, { "epoch": 81.61538461538461, "grad_norm": 1.1570528745651245, "learning_rate": 0.01, "loss": 4.320521831512451, "num_input_tokens_seen": 4213016, "step": 1061, "train_runtime": 867.5766, "train_tokens_per_second": 4856.074 }, { "epoch": 81.61538461538461, "num_input_tokens_seen": 4213016, "step": 1061, "train_accuracy": 0.029296875 }, { "epoch": 81.6923076923077, "grad_norm": 0.8297848105430603, "learning_rate": 0.01, "loss": 4.2926530838012695, "num_input_tokens_seen": 4217112, "step": 1062, "train_runtime": 868.3917, "train_tokens_per_second": 4856.232 }, { "epoch": 81.6923076923077, "num_input_tokens_seen": 4217112, "step": 1062, "train_accuracy": 0.033203125 }, { "epoch": 81.76923076923077, "grad_norm": 1.384696364402771, "learning_rate": 0.01, "loss": 4.249601364135742, "num_input_tokens_seen": 4221208, "step": 1063, "train_runtime": 869.2062, "train_tokens_per_second": 4856.394 }, { "epoch": 81.76923076923077, "num_input_tokens_seen": 4221208, "step": 1063, "train_accuracy": 0.02734375 }, { "epoch": 81.84615384615384, "grad_norm": 0.4551432132720947, "learning_rate": 0.01, "loss": 4.318694114685059, "num_input_tokens_seen": 4225304, "step": 1064, "train_runtime": 870.0212, "train_tokens_per_second": 4856.553 }, { "epoch": 81.84615384615384, "num_input_tokens_seen": 4225304, "step": 1064, "train_accuracy": 0.029296875 }, { "epoch": 81.92307692307692, "grad_norm": 0.6914705038070679, "learning_rate": 0.01, "loss": 4.334219932556152, "num_input_tokens_seen": 4229400, "step": 1065, "train_runtime": 870.8319, "train_tokens_per_second": 4856.735 }, { "epoch": 81.92307692307692, "num_input_tokens_seen": 4229400, "step": 1065, "train_accuracy": 0.02280130237340927 }, { "epoch": 82.0, "grad_norm": 2.4079184532165527, "learning_rate": 0.01, "loss": 4.283096790313721, "num_input_tokens_seen": 4231856, "step": 1066, "train_runtime": 871.3474, "train_tokens_per_second": 4856.681 }, { "epoch": 82.0, "num_input_tokens_seen": 4231856, "step": 1066, "train_accuracy": 0.033203125 }, { "epoch": 82.07692307692308, "grad_norm": 1.5846831798553467, "learning_rate": 0.01, "loss": 4.151785850524902, "num_input_tokens_seen": 4235952, "step": 1067, "train_runtime": 872.1771, "train_tokens_per_second": 4856.757 }, { "epoch": 82.07692307692308, "num_input_tokens_seen": 4235952, "step": 1067, "train_accuracy": 0.037109375 }, { "epoch": 82.15384615384616, "grad_norm": 1.0147782564163208, "learning_rate": 0.01, "loss": 4.166957855224609, "num_input_tokens_seen": 4240048, "step": 1068, "train_runtime": 872.9922, "train_tokens_per_second": 4856.914 }, { "epoch": 82.15384615384616, "num_input_tokens_seen": 4240048, "step": 1068, "train_accuracy": 0.044921875 }, { "epoch": 82.23076923076923, "grad_norm": 1.1793670654296875, "learning_rate": 0.01, "loss": 4.211719989776611, "num_input_tokens_seen": 4244144, "step": 1069, "train_runtime": 873.8071, "train_tokens_per_second": 4857.072 }, { "epoch": 82.23076923076923, "num_input_tokens_seen": 4244144, "step": 1069, "train_accuracy": 0.02734375 }, { "epoch": 82.3076923076923, "grad_norm": 0.6302931904792786, "learning_rate": 0.01, "loss": 4.268909454345703, "num_input_tokens_seen": 4248240, "step": 1070, "train_runtime": 874.6225, "train_tokens_per_second": 4857.227 }, { "epoch": 82.3076923076923, "num_input_tokens_seen": 4248240, "step": 1070, "train_accuracy": 0.037109375 }, { "epoch": 82.38461538461539, "grad_norm": 0.5030584335327148, "learning_rate": 0.01, "loss": 4.18870210647583, "num_input_tokens_seen": 4252336, "step": 1071, "train_runtime": 875.4379, "train_tokens_per_second": 4857.382 }, { "epoch": 82.38461538461539, "num_input_tokens_seen": 4252336, "step": 1071, "train_accuracy": 0.025390625 }, { "epoch": 82.46153846153847, "grad_norm": 0.5036581754684448, "learning_rate": 0.01, "loss": 4.271892547607422, "num_input_tokens_seen": 4256432, "step": 1072, "train_runtime": 876.2539, "train_tokens_per_second": 4857.533 }, { "epoch": 82.46153846153847, "num_input_tokens_seen": 4256432, "step": 1072, "train_accuracy": 0.025390625 }, { "epoch": 82.53846153846153, "grad_norm": 0.5043556690216064, "learning_rate": 0.01, "loss": 4.25629997253418, "num_input_tokens_seen": 4260528, "step": 1073, "train_runtime": 877.0711, "train_tokens_per_second": 4857.677 }, { "epoch": 82.53846153846153, "num_input_tokens_seen": 4260528, "step": 1073, "train_accuracy": 0.025390625 }, { "epoch": 82.61538461538461, "grad_norm": 0.5362634658813477, "learning_rate": 0.01, "loss": 4.2652177810668945, "num_input_tokens_seen": 4264624, "step": 1074, "train_runtime": 877.8861, "train_tokens_per_second": 4857.833 }, { "epoch": 82.61538461538461, "num_input_tokens_seen": 4264624, "step": 1074, "train_accuracy": 0.029296875 }, { "epoch": 82.6923076923077, "grad_norm": 0.6997628211975098, "learning_rate": 0.01, "loss": 4.252917289733887, "num_input_tokens_seen": 4268720, "step": 1075, "train_runtime": 878.702, "train_tokens_per_second": 4857.984 }, { "epoch": 82.6923076923077, "num_input_tokens_seen": 4268720, "step": 1075, "train_accuracy": 0.037109375 }, { "epoch": 82.76923076923077, "grad_norm": 2.129366397857666, "learning_rate": 0.01, "loss": 4.2818684577941895, "num_input_tokens_seen": 4272816, "step": 1076, "train_runtime": 879.5181, "train_tokens_per_second": 4858.133 }, { "epoch": 82.76923076923077, "num_input_tokens_seen": 4272816, "step": 1076, "train_accuracy": 0.037109375 }, { "epoch": 82.84615384615384, "grad_norm": 0.822412371635437, "learning_rate": 0.01, "loss": 4.201027870178223, "num_input_tokens_seen": 4276912, "step": 1077, "train_runtime": 880.3335, "train_tokens_per_second": 4858.286 }, { "epoch": 82.84615384615384, "num_input_tokens_seen": 4276912, "step": 1077, "train_accuracy": 0.04296875 }, { "epoch": 82.92307692307692, "grad_norm": 0.6472997665405273, "learning_rate": 0.01, "loss": 4.227897644042969, "num_input_tokens_seen": 4281008, "step": 1078, "train_runtime": 881.1449, "train_tokens_per_second": 4858.461 }, { "epoch": 82.92307692307692, "num_input_tokens_seen": 4281008, "step": 1078, "train_accuracy": 0.032573290169239044 }, { "epoch": 83.0, "grad_norm": 5.376842021942139, "learning_rate": 0.01, "loss": 4.231244087219238, "num_input_tokens_seen": 4283464, "step": 1079, "train_runtime": 881.6618, "train_tokens_per_second": 4858.398 }, { "epoch": 83.0, "num_input_tokens_seen": 4283464, "step": 1079, "train_accuracy": 0.041015625 }, { "epoch": 83.07692307692308, "grad_norm": 1.4393701553344727, "learning_rate": 0.01, "loss": 4.188133716583252, "num_input_tokens_seen": 4287560, "step": 1080, "train_runtime": 882.4896, "train_tokens_per_second": 4858.482 }, { "epoch": 83.07692307692308, "num_input_tokens_seen": 4287560, "step": 1080, "train_accuracy": 0.052734375 }, { "epoch": 83.15384615384616, "grad_norm": 1.2249149084091187, "learning_rate": 0.01, "loss": 4.136630058288574, "num_input_tokens_seen": 4291656, "step": 1081, "train_runtime": 883.3058, "train_tokens_per_second": 4858.63 }, { "epoch": 83.15384615384616, "num_input_tokens_seen": 4291656, "step": 1081, "train_accuracy": 0.037109375 }, { "epoch": 83.23076923076923, "grad_norm": 0.4371238350868225, "learning_rate": 0.01, "loss": 4.125578880310059, "num_input_tokens_seen": 4295752, "step": 1082, "train_runtime": 884.1252, "train_tokens_per_second": 4858.76 }, { "epoch": 83.23076923076923, "num_input_tokens_seen": 4295752, "step": 1082, "train_accuracy": 0.037109375 }, { "epoch": 83.3076923076923, "grad_norm": 1.1341203451156616, "learning_rate": 0.01, "loss": 4.162911415100098, "num_input_tokens_seen": 4299848, "step": 1083, "train_runtime": 884.9411, "train_tokens_per_second": 4858.908 }, { "epoch": 83.3076923076923, "num_input_tokens_seen": 4299848, "step": 1083, "train_accuracy": 0.0390625 }, { "epoch": 83.38461538461539, "grad_norm": 1.4623558521270752, "learning_rate": 0.01, "loss": 4.171051979064941, "num_input_tokens_seen": 4303944, "step": 1084, "train_runtime": 885.7585, "train_tokens_per_second": 4859.049 }, { "epoch": 83.38461538461539, "num_input_tokens_seen": 4303944, "step": 1084, "train_accuracy": 0.03125 }, { "epoch": 83.46153846153847, "grad_norm": 1.3158528804779053, "learning_rate": 0.01, "loss": 4.242735862731934, "num_input_tokens_seen": 4308040, "step": 1085, "train_runtime": 886.5758, "train_tokens_per_second": 4859.19 }, { "epoch": 83.46153846153847, "num_input_tokens_seen": 4308040, "step": 1085, "train_accuracy": 0.029296875 }, { "epoch": 83.53846153846153, "grad_norm": 0.6823511123657227, "learning_rate": 0.01, "loss": 4.177392959594727, "num_input_tokens_seen": 4312136, "step": 1086, "train_runtime": 887.3927, "train_tokens_per_second": 4859.332 }, { "epoch": 83.53846153846153, "num_input_tokens_seen": 4312136, "step": 1086, "train_accuracy": 0.048828125 }, { "epoch": 83.61538461538461, "grad_norm": 0.42744797468185425, "learning_rate": 0.01, "loss": 4.140125751495361, "num_input_tokens_seen": 4316232, "step": 1087, "train_runtime": 888.2133, "train_tokens_per_second": 4859.454 }, { "epoch": 83.61538461538461, "num_input_tokens_seen": 4316232, "step": 1087, "train_accuracy": 0.03125 }, { "epoch": 83.6923076923077, "grad_norm": 1.4262641668319702, "learning_rate": 0.01, "loss": 4.256410121917725, "num_input_tokens_seen": 4320328, "step": 1088, "train_runtime": 889.0304, "train_tokens_per_second": 4859.595 }, { "epoch": 83.6923076923077, "num_input_tokens_seen": 4320328, "step": 1088, "train_accuracy": 0.0546875 }, { "epoch": 83.76923076923077, "grad_norm": 0.8702552914619446, "learning_rate": 0.01, "loss": 4.101435661315918, "num_input_tokens_seen": 4324424, "step": 1089, "train_runtime": 889.8488, "train_tokens_per_second": 4859.729 }, { "epoch": 83.76923076923077, "num_input_tokens_seen": 4324424, "step": 1089, "train_accuracy": 0.03125 }, { "epoch": 83.84615384615384, "grad_norm": 1.1348586082458496, "learning_rate": 0.01, "loss": 4.187271595001221, "num_input_tokens_seen": 4328520, "step": 1090, "train_runtime": 890.6691, "train_tokens_per_second": 4859.852 }, { "epoch": 83.84615384615384, "num_input_tokens_seen": 4328520, "step": 1090, "train_accuracy": 0.0390625 }, { "epoch": 83.92307692307692, "grad_norm": 1.5674711465835571, "learning_rate": 0.01, "loss": 4.217589378356934, "num_input_tokens_seen": 4332616, "step": 1091, "train_runtime": 891.4819, "train_tokens_per_second": 4860.016 }, { "epoch": 83.92307692307692, "num_input_tokens_seen": 4332616, "step": 1091, "train_accuracy": 0.03583061695098877 }, { "epoch": 84.0, "grad_norm": 0.7583575248718262, "learning_rate": 0.01, "loss": 4.197638511657715, "num_input_tokens_seen": 4335072, "step": 1092, "train_runtime": 891.9986, "train_tokens_per_second": 4859.954 }, { "epoch": 84.0, "num_input_tokens_seen": 4335072, "step": 1092, "train_accuracy": 0.044921875 }, { "epoch": 84.07692307692308, "grad_norm": 0.5050715804100037, "learning_rate": 0.01, "loss": 4.155641555786133, "num_input_tokens_seen": 4339168, "step": 1093, "train_runtime": 892.8272, "train_tokens_per_second": 4860.031 }, { "epoch": 84.07692307692308, "num_input_tokens_seen": 4339168, "step": 1093, "train_accuracy": 0.041015625 }, { "epoch": 84.15384615384616, "grad_norm": 0.6129341721534729, "learning_rate": 0.01, "loss": 4.215075492858887, "num_input_tokens_seen": 4343264, "step": 1094, "train_runtime": 893.6472, "train_tokens_per_second": 4860.155 }, { "epoch": 84.15384615384616, "num_input_tokens_seen": 4343264, "step": 1094, "train_accuracy": 0.03515625 }, { "epoch": 84.23076923076923, "grad_norm": 0.6293500065803528, "learning_rate": 0.01, "loss": 4.187466621398926, "num_input_tokens_seen": 4347360, "step": 1095, "train_runtime": 894.4682, "train_tokens_per_second": 4860.274 }, { "epoch": 84.23076923076923, "num_input_tokens_seen": 4347360, "step": 1095, "train_accuracy": 0.037109375 }, { "epoch": 84.3076923076923, "grad_norm": 1.3071644306182861, "learning_rate": 0.01, "loss": 4.187564373016357, "num_input_tokens_seen": 4351456, "step": 1096, "train_runtime": 895.2857, "train_tokens_per_second": 4860.411 }, { "epoch": 84.3076923076923, "num_input_tokens_seen": 4351456, "step": 1096, "train_accuracy": 0.03515625 }, { "epoch": 84.38461538461539, "grad_norm": 1.0470569133758545, "learning_rate": 0.01, "loss": 4.172420501708984, "num_input_tokens_seen": 4355552, "step": 1097, "train_runtime": 896.1034, "train_tokens_per_second": 4860.546 }, { "epoch": 84.38461538461539, "num_input_tokens_seen": 4355552, "step": 1097, "train_accuracy": 0.03515625 }, { "epoch": 84.46153846153847, "grad_norm": 0.9348244071006775, "learning_rate": 0.01, "loss": 4.170975685119629, "num_input_tokens_seen": 4359648, "step": 1098, "train_runtime": 896.9221, "train_tokens_per_second": 4860.676 }, { "epoch": 84.46153846153847, "num_input_tokens_seen": 4359648, "step": 1098, "train_accuracy": 0.0546875 }, { "epoch": 84.53846153846153, "grad_norm": 0.9920463562011719, "learning_rate": 0.01, "loss": 4.151240348815918, "num_input_tokens_seen": 4363744, "step": 1099, "train_runtime": 897.7409, "train_tokens_per_second": 4860.806 }, { "epoch": 84.53846153846153, "num_input_tokens_seen": 4363744, "step": 1099, "train_accuracy": 0.046875 }, { "epoch": 84.61538461538461, "grad_norm": 1.1034128665924072, "learning_rate": 0.01, "loss": 4.1717023849487305, "num_input_tokens_seen": 4367840, "step": 1100, "train_runtime": 898.5598, "train_tokens_per_second": 4860.934 }, { "epoch": 84.61538461538461, "eval_CMD_3_branch_eval_accuracy": 0.02061482820976492, "eval_CMD_3_branch_eval_loss": 4.35856294631958, "eval_CMD_3_branch_eval_runtime": 1.1583, "eval_CMD_3_branch_eval_samples_per_second": 2387.192, "eval_CMD_3_branch_eval_steps_per_second": 5.18, "num_input_tokens_seen": 4367840, "step": 1100 }, { "epoch": 84.61538461538461, "num_input_tokens_seen": 4367840, "step": 1100, "train_accuracy": 0.029296875 }, { "epoch": 84.6923076923077, "grad_norm": 0.9364305138587952, "learning_rate": 0.01, "loss": 4.090972900390625, "num_input_tokens_seen": 4371936, "step": 1101, "train_runtime": 900.5399, "train_tokens_per_second": 4854.794 }, { "epoch": 84.6923076923077, "num_input_tokens_seen": 4371936, "step": 1101, "train_accuracy": 0.029296875 }, { "epoch": 84.76923076923077, "grad_norm": 0.5586864948272705, "learning_rate": 0.01, "loss": 4.2509331703186035, "num_input_tokens_seen": 4376032, "step": 1102, "train_runtime": 901.3592, "train_tokens_per_second": 4854.926 }, { "epoch": 84.76923076923077, "num_input_tokens_seen": 4376032, "step": 1102, "train_accuracy": 0.033203125 }, { "epoch": 84.84615384615384, "grad_norm": 4.886346817016602, "learning_rate": 0.01, "loss": 4.229729652404785, "num_input_tokens_seen": 4380128, "step": 1103, "train_runtime": 902.1759, "train_tokens_per_second": 4855.071 }, { "epoch": 84.84615384615384, "num_input_tokens_seen": 4380128, "step": 1103, "train_accuracy": 0.03125 }, { "epoch": 84.92307692307692, "grad_norm": 0.8539766669273376, "learning_rate": 0.01, "loss": 4.093820571899414, "num_input_tokens_seen": 4384224, "step": 1104, "train_runtime": 902.9887, "train_tokens_per_second": 4855.237 }, { "epoch": 84.92307692307692, "num_input_tokens_seen": 4384224, "step": 1104, "train_accuracy": 0.03908794745802879 }, { "epoch": 85.0, "grad_norm": 0.5139070749282837, "learning_rate": 0.01, "loss": 4.261080265045166, "num_input_tokens_seen": 4386680, "step": 1105, "train_runtime": 903.506, "train_tokens_per_second": 4855.175 }, { "epoch": 85.0, "num_input_tokens_seen": 4386680, "step": 1105, "train_accuracy": 0.029296875 }, { "epoch": 85.07692307692308, "grad_norm": 1.144660234451294, "learning_rate": 0.01, "loss": 4.166398048400879, "num_input_tokens_seen": 4390776, "step": 1106, "train_runtime": 904.3353, "train_tokens_per_second": 4855.252 }, { "epoch": 85.07692307692308, "num_input_tokens_seen": 4390776, "step": 1106, "train_accuracy": 0.0390625 }, { "epoch": 85.15384615384616, "grad_norm": 0.8064528107643127, "learning_rate": 0.01, "loss": 4.142458438873291, "num_input_tokens_seen": 4394872, "step": 1107, "train_runtime": 905.1539, "train_tokens_per_second": 4855.387 }, { "epoch": 85.15384615384616, "num_input_tokens_seen": 4394872, "step": 1107, "train_accuracy": 0.041015625 }, { "epoch": 85.23076923076923, "grad_norm": 2.6371541023254395, "learning_rate": 0.01, "loss": 4.138216972351074, "num_input_tokens_seen": 4398968, "step": 1108, "train_runtime": 905.9709, "train_tokens_per_second": 4855.529 }, { "epoch": 85.23076923076923, "num_input_tokens_seen": 4398968, "step": 1108, "train_accuracy": 0.044921875 }, { "epoch": 85.3076923076923, "grad_norm": 0.7484170794487, "learning_rate": 0.01, "loss": 4.101762294769287, "num_input_tokens_seen": 4403064, "step": 1109, "train_runtime": 906.7888, "train_tokens_per_second": 4855.666 }, { "epoch": 85.3076923076923, "num_input_tokens_seen": 4403064, "step": 1109, "train_accuracy": 0.041015625 }, { "epoch": 85.38461538461539, "grad_norm": 1.0887620449066162, "learning_rate": 0.01, "loss": 4.148985385894775, "num_input_tokens_seen": 4407160, "step": 1110, "train_runtime": 907.6066, "train_tokens_per_second": 4855.804 }, { "epoch": 85.38461538461539, "num_input_tokens_seen": 4407160, "step": 1110, "train_accuracy": 0.03515625 }, { "epoch": 85.46153846153847, "grad_norm": 0.7943981885910034, "learning_rate": 0.01, "loss": 4.156397819519043, "num_input_tokens_seen": 4411256, "step": 1111, "train_runtime": 908.4247, "train_tokens_per_second": 4855.94 }, { "epoch": 85.46153846153847, "num_input_tokens_seen": 4411256, "step": 1111, "train_accuracy": 0.048828125 }, { "epoch": 85.53846153846153, "grad_norm": 0.9102615118026733, "learning_rate": 0.01, "loss": 4.130383491516113, "num_input_tokens_seen": 4415352, "step": 1112, "train_runtime": 909.2433, "train_tokens_per_second": 4856.073 }, { "epoch": 85.53846153846153, "num_input_tokens_seen": 4415352, "step": 1112, "train_accuracy": 0.048828125 }, { "epoch": 85.61538461538461, "grad_norm": 0.5536665916442871, "learning_rate": 0.01, "loss": 4.2096428871154785, "num_input_tokens_seen": 4419448, "step": 1113, "train_runtime": 910.0609, "train_tokens_per_second": 4856.212 }, { "epoch": 85.61538461538461, "num_input_tokens_seen": 4419448, "step": 1113, "train_accuracy": 0.025390625 }, { "epoch": 85.6923076923077, "grad_norm": 7.640713691711426, "learning_rate": 0.01, "loss": 4.195767402648926, "num_input_tokens_seen": 4423544, "step": 1114, "train_runtime": 910.8786, "train_tokens_per_second": 4856.348 }, { "epoch": 85.6923076923077, "num_input_tokens_seen": 4423544, "step": 1114, "train_accuracy": 0.033203125 }, { "epoch": 85.76923076923077, "grad_norm": 0.5668033361434937, "learning_rate": 0.01, "loss": 4.197161674499512, "num_input_tokens_seen": 4427640, "step": 1115, "train_runtime": 911.6979, "train_tokens_per_second": 4856.477 }, { "epoch": 85.76923076923077, "num_input_tokens_seen": 4427640, "step": 1115, "train_accuracy": 0.041015625 }, { "epoch": 85.84615384615384, "grad_norm": 1.2391166687011719, "learning_rate": 0.01, "loss": 4.19352912902832, "num_input_tokens_seen": 4431736, "step": 1116, "train_runtime": 912.5156, "train_tokens_per_second": 4856.614 }, { "epoch": 85.84615384615384, "num_input_tokens_seen": 4431736, "step": 1116, "train_accuracy": 0.0546875 }, { "epoch": 85.92307692307692, "grad_norm": 0.5270545482635498, "learning_rate": 0.01, "loss": 4.185867786407471, "num_input_tokens_seen": 4435832, "step": 1117, "train_runtime": 913.3308, "train_tokens_per_second": 4856.764 }, { "epoch": 85.92307692307692, "num_input_tokens_seen": 4435832, "step": 1117, "train_accuracy": 0.02931595966219902 }, { "epoch": 86.0, "grad_norm": 0.6924501657485962, "learning_rate": 0.01, "loss": 4.22587251663208, "num_input_tokens_seen": 4438288, "step": 1118, "train_runtime": 913.8483, "train_tokens_per_second": 4856.701 }, { "epoch": 86.0, "num_input_tokens_seen": 4438288, "step": 1118, "train_accuracy": 0.056640625 }, { "epoch": 86.07692307692308, "grad_norm": 1.070239543914795, "learning_rate": 0.01, "loss": 4.100295543670654, "num_input_tokens_seen": 4442384, "step": 1119, "train_runtime": 914.6796, "train_tokens_per_second": 4856.765 }, { "epoch": 86.07692307692308, "num_input_tokens_seen": 4442384, "step": 1119, "train_accuracy": 0.03515625 }, { "epoch": 86.15384615384616, "grad_norm": 1.8627127408981323, "learning_rate": 0.01, "loss": 4.123768329620361, "num_input_tokens_seen": 4446480, "step": 1120, "train_runtime": 915.4975, "train_tokens_per_second": 4856.9 }, { "epoch": 86.15384615384616, "num_input_tokens_seen": 4446480, "step": 1120, "train_accuracy": 0.05078125 }, { "epoch": 86.23076923076923, "grad_norm": 1.2123548984527588, "learning_rate": 0.01, "loss": 4.242486953735352, "num_input_tokens_seen": 4450576, "step": 1121, "train_runtime": 916.3143, "train_tokens_per_second": 4857.041 }, { "epoch": 86.23076923076923, "num_input_tokens_seen": 4450576, "step": 1121, "train_accuracy": 0.033203125 }, { "epoch": 86.3076923076923, "grad_norm": 0.9519500732421875, "learning_rate": 0.01, "loss": 4.170391082763672, "num_input_tokens_seen": 4454672, "step": 1122, "train_runtime": 917.1319, "train_tokens_per_second": 4857.177 }, { "epoch": 86.3076923076923, "num_input_tokens_seen": 4454672, "step": 1122, "train_accuracy": 0.03515625 }, { "epoch": 86.38461538461539, "grad_norm": 1.4011510610580444, "learning_rate": 0.01, "loss": 4.253750801086426, "num_input_tokens_seen": 4458768, "step": 1123, "train_runtime": 917.9483, "train_tokens_per_second": 4857.319 }, { "epoch": 86.38461538461539, "num_input_tokens_seen": 4458768, "step": 1123, "train_accuracy": 0.04296875 }, { "epoch": 86.46153846153847, "grad_norm": 1.1189138889312744, "learning_rate": 0.01, "loss": 4.405412673950195, "num_input_tokens_seen": 4462864, "step": 1124, "train_runtime": 918.765, "train_tokens_per_second": 4857.46 }, { "epoch": 86.46153846153847, "num_input_tokens_seen": 4462864, "step": 1124, "train_accuracy": 0.03515625 }, { "epoch": 86.53846153846153, "grad_norm": 11.288074493408203, "learning_rate": 0.01, "loss": 4.227231979370117, "num_input_tokens_seen": 4466960, "step": 1125, "train_runtime": 919.5836, "train_tokens_per_second": 4857.59 }, { "epoch": 86.53846153846153, "num_input_tokens_seen": 4466960, "step": 1125, "train_accuracy": 0.02734375 }, { "epoch": 86.61538461538461, "grad_norm": 0.8495609760284424, "learning_rate": 0.01, "loss": 4.3608198165893555, "num_input_tokens_seen": 4471056, "step": 1126, "train_runtime": 920.4005, "train_tokens_per_second": 4857.729 }, { "epoch": 86.61538461538461, "num_input_tokens_seen": 4471056, "step": 1126, "train_accuracy": 0.0234375 }, { "epoch": 86.6923076923077, "grad_norm": 0.7331825494766235, "learning_rate": 0.01, "loss": 4.32719087600708, "num_input_tokens_seen": 4475152, "step": 1127, "train_runtime": 921.2179, "train_tokens_per_second": 4857.865 }, { "epoch": 86.6923076923077, "num_input_tokens_seen": 4475152, "step": 1127, "train_accuracy": 0.025390625 }, { "epoch": 86.76923076923077, "grad_norm": 0.7106150388717651, "learning_rate": 0.01, "loss": 4.3882036209106445, "num_input_tokens_seen": 4479248, "step": 1128, "train_runtime": 922.0346, "train_tokens_per_second": 4858.004 }, { "epoch": 86.76923076923077, "num_input_tokens_seen": 4479248, "step": 1128, "train_accuracy": 0.03515625 }, { "epoch": 86.84615384615384, "grad_norm": 0.9769771099090576, "learning_rate": 0.01, "loss": 4.429689884185791, "num_input_tokens_seen": 4483344, "step": 1129, "train_runtime": 922.853, "train_tokens_per_second": 4858.134 }, { "epoch": 86.84615384615384, "num_input_tokens_seen": 4483344, "step": 1129, "train_accuracy": 0.02734375 }, { "epoch": 86.92307692307692, "grad_norm": 0.6609678268432617, "learning_rate": 0.01, "loss": 4.388575553894043, "num_input_tokens_seen": 4487440, "step": 1130, "train_runtime": 923.6671, "train_tokens_per_second": 4858.287 }, { "epoch": 86.92307692307692, "num_input_tokens_seen": 4487440, "step": 1130, "train_accuracy": 0.016286645084619522 }, { "epoch": 87.0, "grad_norm": 0.6923887133598328, "learning_rate": 0.01, "loss": 4.417357444763184, "num_input_tokens_seen": 4489896, "step": 1131, "train_runtime": 924.1832, "train_tokens_per_second": 4858.232 }, { "epoch": 87.0, "num_input_tokens_seen": 4489896, "step": 1131, "train_accuracy": 0.021484375 }, { "epoch": 87.07692307692308, "grad_norm": 2.304231643676758, "learning_rate": 0.01, "loss": 4.336197853088379, "num_input_tokens_seen": 4493992, "step": 1132, "train_runtime": 925.0116, "train_tokens_per_second": 4858.309 }, { "epoch": 87.07692307692308, "num_input_tokens_seen": 4493992, "step": 1132, "train_accuracy": 0.029296875 }, { "epoch": 87.15384615384616, "grad_norm": 1.368730068206787, "learning_rate": 0.01, "loss": 4.309045791625977, "num_input_tokens_seen": 4498088, "step": 1133, "train_runtime": 925.8289, "train_tokens_per_second": 4858.444 }, { "epoch": 87.15384615384616, "num_input_tokens_seen": 4498088, "step": 1133, "train_accuracy": 0.025390625 }, { "epoch": 87.23076923076923, "grad_norm": 1.7913775444030762, "learning_rate": 0.01, "loss": 4.4043869972229, "num_input_tokens_seen": 4502184, "step": 1134, "train_runtime": 926.647, "train_tokens_per_second": 4858.575 }, { "epoch": 87.23076923076923, "num_input_tokens_seen": 4502184, "step": 1134, "train_accuracy": 0.029296875 }, { "epoch": 87.3076923076923, "grad_norm": 2.1816532611846924, "learning_rate": 0.01, "loss": 4.301054954528809, "num_input_tokens_seen": 4506280, "step": 1135, "train_runtime": 927.4643, "train_tokens_per_second": 4858.71 }, { "epoch": 87.3076923076923, "num_input_tokens_seen": 4506280, "step": 1135, "train_accuracy": 0.0390625 }, { "epoch": 87.38461538461539, "grad_norm": 0.8795368075370789, "learning_rate": 0.01, "loss": 4.266789436340332, "num_input_tokens_seen": 4510376, "step": 1136, "train_runtime": 928.282, "train_tokens_per_second": 4858.843 }, { "epoch": 87.38461538461539, "num_input_tokens_seen": 4510376, "step": 1136, "train_accuracy": 0.033203125 }, { "epoch": 87.46153846153847, "grad_norm": 0.6091873645782471, "learning_rate": 0.01, "loss": 4.291828155517578, "num_input_tokens_seen": 4514472, "step": 1137, "train_runtime": 929.0994, "train_tokens_per_second": 4858.976 }, { "epoch": 87.46153846153847, "num_input_tokens_seen": 4514472, "step": 1137, "train_accuracy": 0.025390625 }, { "epoch": 87.53846153846153, "grad_norm": 0.9331724643707275, "learning_rate": 0.01, "loss": 4.287989139556885, "num_input_tokens_seen": 4518568, "step": 1138, "train_runtime": 929.9162, "train_tokens_per_second": 4859.113 }, { "epoch": 87.53846153846153, "num_input_tokens_seen": 4518568, "step": 1138, "train_accuracy": 0.02734375 }, { "epoch": 87.61538461538461, "grad_norm": 2.546476125717163, "learning_rate": 0.01, "loss": 4.350374221801758, "num_input_tokens_seen": 4522664, "step": 1139, "train_runtime": 930.7331, "train_tokens_per_second": 4859.249 }, { "epoch": 87.61538461538461, "num_input_tokens_seen": 4522664, "step": 1139, "train_accuracy": 0.0234375 }, { "epoch": 87.6923076923077, "grad_norm": 3.0142698287963867, "learning_rate": 0.01, "loss": 4.275198459625244, "num_input_tokens_seen": 4526760, "step": 1140, "train_runtime": 931.5505, "train_tokens_per_second": 4859.382 }, { "epoch": 87.6923076923077, "num_input_tokens_seen": 4526760, "step": 1140, "train_accuracy": 0.033203125 }, { "epoch": 87.76923076923077, "grad_norm": 0.6362144351005554, "learning_rate": 0.01, "loss": 4.3212080001831055, "num_input_tokens_seen": 4530856, "step": 1141, "train_runtime": 932.3678, "train_tokens_per_second": 4859.516 }, { "epoch": 87.76923076923077, "num_input_tokens_seen": 4530856, "step": 1141, "train_accuracy": 0.025390625 }, { "epoch": 87.84615384615384, "grad_norm": 0.9679552316665649, "learning_rate": 0.01, "loss": 4.337464332580566, "num_input_tokens_seen": 4534952, "step": 1142, "train_runtime": 933.1857, "train_tokens_per_second": 4859.646 }, { "epoch": 87.84615384615384, "num_input_tokens_seen": 4534952, "step": 1142, "train_accuracy": 0.029296875 }, { "epoch": 87.92307692307692, "grad_norm": 0.4788326621055603, "learning_rate": 0.01, "loss": 4.329340934753418, "num_input_tokens_seen": 4539048, "step": 1143, "train_runtime": 933.9975, "train_tokens_per_second": 4859.808 }, { "epoch": 87.92307692307692, "num_input_tokens_seen": 4539048, "step": 1143, "train_accuracy": 0.03583061695098877 }, { "epoch": 88.0, "grad_norm": 0.878277063369751, "learning_rate": 0.01, "loss": 4.35450553894043, "num_input_tokens_seen": 4541504, "step": 1144, "train_runtime": 934.5138, "train_tokens_per_second": 4859.751 }, { "epoch": 88.0, "num_input_tokens_seen": 4541504, "step": 1144, "train_accuracy": 0.037109375 }, { "epoch": 88.07692307692308, "grad_norm": 1.1310226917266846, "learning_rate": 0.01, "loss": 4.281495094299316, "num_input_tokens_seen": 4545600, "step": 1145, "train_runtime": 935.3421, "train_tokens_per_second": 4859.826 }, { "epoch": 88.07692307692308, "num_input_tokens_seen": 4545600, "step": 1145, "train_accuracy": 0.05078125 }, { "epoch": 88.15384615384616, "grad_norm": 0.765187680721283, "learning_rate": 0.01, "loss": 4.2237701416015625, "num_input_tokens_seen": 4549696, "step": 1146, "train_runtime": 936.16, "train_tokens_per_second": 4859.955 }, { "epoch": 88.15384615384616, "num_input_tokens_seen": 4549696, "step": 1146, "train_accuracy": 0.02734375 }, { "epoch": 88.23076923076923, "grad_norm": 0.8071278929710388, "learning_rate": 0.01, "loss": 4.272477149963379, "num_input_tokens_seen": 4553792, "step": 1147, "train_runtime": 936.9765, "train_tokens_per_second": 4860.092 }, { "epoch": 88.23076923076923, "num_input_tokens_seen": 4553792, "step": 1147, "train_accuracy": 0.03125 }, { "epoch": 88.3076923076923, "grad_norm": 0.5325653553009033, "learning_rate": 0.01, "loss": 4.258377552032471, "num_input_tokens_seen": 4557888, "step": 1148, "train_runtime": 937.7933, "train_tokens_per_second": 4860.227 }, { "epoch": 88.3076923076923, "num_input_tokens_seen": 4557888, "step": 1148, "train_accuracy": 0.021484375 }, { "epoch": 88.38461538461539, "grad_norm": 1.1729495525360107, "learning_rate": 0.01, "loss": 4.319500923156738, "num_input_tokens_seen": 4561984, "step": 1149, "train_runtime": 938.6102, "train_tokens_per_second": 4860.361 }, { "epoch": 88.38461538461539, "num_input_tokens_seen": 4561984, "step": 1149, "train_accuracy": 0.029296875 }, { "epoch": 88.46153846153847, "grad_norm": 0.8045989274978638, "learning_rate": 0.01, "loss": 4.301680564880371, "num_input_tokens_seen": 4566080, "step": 1150, "train_runtime": 939.4264, "train_tokens_per_second": 4860.498 }, { "epoch": 88.46153846153847, "num_input_tokens_seen": 4566080, "step": 1150, "train_accuracy": 0.0234375 }, { "epoch": 88.53846153846153, "grad_norm": 0.7991436719894409, "learning_rate": 0.01, "loss": 4.305707931518555, "num_input_tokens_seen": 4570176, "step": 1151, "train_runtime": 940.2443, "train_tokens_per_second": 4860.626 }, { "epoch": 88.53846153846153, "num_input_tokens_seen": 4570176, "step": 1151, "train_accuracy": 0.03125 }, { "epoch": 88.61538461538461, "grad_norm": 1.3253687620162964, "learning_rate": 0.01, "loss": 4.271323204040527, "num_input_tokens_seen": 4574272, "step": 1152, "train_runtime": 941.0624, "train_tokens_per_second": 4860.753 }, { "epoch": 88.61538461538461, "num_input_tokens_seen": 4574272, "step": 1152, "train_accuracy": 0.033203125 }, { "epoch": 88.6923076923077, "grad_norm": 1.1081411838531494, "learning_rate": 0.01, "loss": 4.294156074523926, "num_input_tokens_seen": 4578368, "step": 1153, "train_runtime": 941.8836, "train_tokens_per_second": 4860.864 }, { "epoch": 88.6923076923077, "num_input_tokens_seen": 4578368, "step": 1153, "train_accuracy": 0.01953125 }, { "epoch": 88.76923076923077, "grad_norm": 0.7775978446006775, "learning_rate": 0.01, "loss": 4.2814836502075195, "num_input_tokens_seen": 4582464, "step": 1154, "train_runtime": 942.7009, "train_tokens_per_second": 4860.995 }, { "epoch": 88.76923076923077, "num_input_tokens_seen": 4582464, "step": 1154, "train_accuracy": 0.02734375 }, { "epoch": 88.84615384615384, "grad_norm": 1.447250247001648, "learning_rate": 0.01, "loss": 4.294820785522461, "num_input_tokens_seen": 4586560, "step": 1155, "train_runtime": 943.5175, "train_tokens_per_second": 4861.128 }, { "epoch": 88.84615384615384, "num_input_tokens_seen": 4586560, "step": 1155, "train_accuracy": 0.013671875 }, { "epoch": 88.92307692307692, "grad_norm": 0.6836444139480591, "learning_rate": 0.01, "loss": 4.362523078918457, "num_input_tokens_seen": 4590656, "step": 1156, "train_runtime": 944.3298, "train_tokens_per_second": 4861.285 }, { "epoch": 88.92307692307692, "num_input_tokens_seen": 4590656, "step": 1156, "train_accuracy": 0.02931595966219902 }, { "epoch": 89.0, "grad_norm": 1.3853188753128052, "learning_rate": 0.01, "loss": 4.322265148162842, "num_input_tokens_seen": 4593112, "step": 1157, "train_runtime": 944.8459, "train_tokens_per_second": 4861.229 }, { "epoch": 89.0, "num_input_tokens_seen": 4593112, "step": 1157, "train_accuracy": 0.037109375 }, { "epoch": 89.07692307692308, "grad_norm": 1.3838152885437012, "learning_rate": 0.01, "loss": 4.244259834289551, "num_input_tokens_seen": 4597208, "step": 1158, "train_runtime": 945.6807, "train_tokens_per_second": 4861.269 }, { "epoch": 89.07692307692308, "num_input_tokens_seen": 4597208, "step": 1158, "train_accuracy": 0.0390625 }, { "epoch": 89.15384615384616, "grad_norm": 3.4085545539855957, "learning_rate": 0.01, "loss": 4.246095180511475, "num_input_tokens_seen": 4601304, "step": 1159, "train_runtime": 946.4989, "train_tokens_per_second": 4861.394 }, { "epoch": 89.15384615384616, "num_input_tokens_seen": 4601304, "step": 1159, "train_accuracy": 0.03515625 }, { "epoch": 89.23076923076923, "grad_norm": 0.8216474652290344, "learning_rate": 0.01, "loss": 4.261091232299805, "num_input_tokens_seen": 4605400, "step": 1160, "train_runtime": 947.318, "train_tokens_per_second": 4861.514 }, { "epoch": 89.23076923076923, "num_input_tokens_seen": 4605400, "step": 1160, "train_accuracy": 0.033203125 }, { "epoch": 89.3076923076923, "grad_norm": 2.4385972023010254, "learning_rate": 0.01, "loss": 4.18310022354126, "num_input_tokens_seen": 4609496, "step": 1161, "train_runtime": 948.1347, "train_tokens_per_second": 4861.647 }, { "epoch": 89.3076923076923, "num_input_tokens_seen": 4609496, "step": 1161, "train_accuracy": 0.033203125 }, { "epoch": 89.38461538461539, "grad_norm": 0.588120698928833, "learning_rate": 0.01, "loss": 4.27022123336792, "num_input_tokens_seen": 4613592, "step": 1162, "train_runtime": 948.9517, "train_tokens_per_second": 4861.778 }, { "epoch": 89.38461538461539, "num_input_tokens_seen": 4613592, "step": 1162, "train_accuracy": 0.03125 }, { "epoch": 89.46153846153847, "grad_norm": 0.4883492588996887, "learning_rate": 0.01, "loss": 4.272211074829102, "num_input_tokens_seen": 4617688, "step": 1163, "train_runtime": 949.7689, "train_tokens_per_second": 4861.907 }, { "epoch": 89.46153846153847, "num_input_tokens_seen": 4617688, "step": 1163, "train_accuracy": 0.0390625 }, { "epoch": 89.53846153846153, "grad_norm": 2.5225794315338135, "learning_rate": 0.01, "loss": 4.269200801849365, "num_input_tokens_seen": 4621784, "step": 1164, "train_runtime": 950.5863, "train_tokens_per_second": 4862.035 }, { "epoch": 89.53846153846153, "num_input_tokens_seen": 4621784, "step": 1164, "train_accuracy": 0.029296875 }, { "epoch": 89.61538461538461, "grad_norm": 8.58218002319336, "learning_rate": 0.01, "loss": 4.250087738037109, "num_input_tokens_seen": 4625880, "step": 1165, "train_runtime": 951.4028, "train_tokens_per_second": 4862.168 }, { "epoch": 89.61538461538461, "num_input_tokens_seen": 4625880, "step": 1165, "train_accuracy": 0.04296875 }, { "epoch": 89.6923076923077, "grad_norm": 1.266677737236023, "learning_rate": 0.01, "loss": 4.277984619140625, "num_input_tokens_seen": 4629976, "step": 1166, "train_runtime": 952.2202, "train_tokens_per_second": 4862.296 }, { "epoch": 89.6923076923077, "num_input_tokens_seen": 4629976, "step": 1166, "train_accuracy": 0.02734375 }, { "epoch": 89.76923076923077, "grad_norm": 0.9045878052711487, "learning_rate": 0.01, "loss": 4.283880233764648, "num_input_tokens_seen": 4634072, "step": 1167, "train_runtime": 953.0376, "train_tokens_per_second": 4862.423 }, { "epoch": 89.76923076923077, "num_input_tokens_seen": 4634072, "step": 1167, "train_accuracy": 0.0390625 }, { "epoch": 89.84615384615384, "grad_norm": 4.231438159942627, "learning_rate": 0.01, "loss": 4.293394088745117, "num_input_tokens_seen": 4638168, "step": 1168, "train_runtime": 953.8557, "train_tokens_per_second": 4862.547 }, { "epoch": 89.84615384615384, "num_input_tokens_seen": 4638168, "step": 1168, "train_accuracy": 0.02734375 }, { "epoch": 89.92307692307692, "grad_norm": 1.1969122886657715, "learning_rate": 0.01, "loss": 4.2695770263671875, "num_input_tokens_seen": 4642264, "step": 1169, "train_runtime": 954.6697, "train_tokens_per_second": 4862.691 }, { "epoch": 89.92307692307692, "num_input_tokens_seen": 4642264, "step": 1169, "train_accuracy": 0.02931595966219902 }, { "epoch": 90.0, "grad_norm": 0.8131340742111206, "learning_rate": 0.01, "loss": 4.261406898498535, "num_input_tokens_seen": 4644720, "step": 1170, "train_runtime": 955.1865, "train_tokens_per_second": 4862.632 }, { "epoch": 90.0, "num_input_tokens_seen": 4644720, "step": 1170, "train_accuracy": 0.04296875 }, { "epoch": 90.07692307692308, "grad_norm": 0.33925577998161316, "learning_rate": 0.01, "loss": 4.161164283752441, "num_input_tokens_seen": 4648816, "step": 1171, "train_runtime": 956.018, "train_tokens_per_second": 4862.687 }, { "epoch": 90.07692307692308, "num_input_tokens_seen": 4648816, "step": 1171, "train_accuracy": 0.044921875 }, { "epoch": 90.15384615384616, "grad_norm": 0.6678487062454224, "learning_rate": 0.01, "loss": 4.15652322769165, "num_input_tokens_seen": 4652912, "step": 1172, "train_runtime": 956.8349, "train_tokens_per_second": 4862.816 }, { "epoch": 90.15384615384616, "num_input_tokens_seen": 4652912, "step": 1172, "train_accuracy": 0.0390625 }, { "epoch": 90.23076923076923, "grad_norm": 1.120121955871582, "learning_rate": 0.01, "loss": 4.300291061401367, "num_input_tokens_seen": 4657008, "step": 1173, "train_runtime": 957.6523, "train_tokens_per_second": 4862.942 }, { "epoch": 90.23076923076923, "num_input_tokens_seen": 4657008, "step": 1173, "train_accuracy": 0.037109375 }, { "epoch": 90.3076923076923, "grad_norm": 6.495781421661377, "learning_rate": 0.01, "loss": 4.2706098556518555, "num_input_tokens_seen": 4661104, "step": 1174, "train_runtime": 958.4728, "train_tokens_per_second": 4863.053 }, { "epoch": 90.3076923076923, "num_input_tokens_seen": 4661104, "step": 1174, "train_accuracy": 0.03515625 }, { "epoch": 90.38461538461539, "grad_norm": 0.7740323543548584, "learning_rate": 0.01, "loss": 4.182338714599609, "num_input_tokens_seen": 4665200, "step": 1175, "train_runtime": 959.2896, "train_tokens_per_second": 4863.182 }, { "epoch": 90.38461538461539, "num_input_tokens_seen": 4665200, "step": 1175, "train_accuracy": 0.04296875 }, { "epoch": 90.46153846153847, "grad_norm": 0.553860604763031, "learning_rate": 0.01, "loss": 4.159100532531738, "num_input_tokens_seen": 4669296, "step": 1176, "train_runtime": 960.1061, "train_tokens_per_second": 4863.313 }, { "epoch": 90.46153846153847, "num_input_tokens_seen": 4669296, "step": 1176, "train_accuracy": 0.0234375 }, { "epoch": 90.53846153846153, "grad_norm": 0.43262046575546265, "learning_rate": 0.01, "loss": 4.254860877990723, "num_input_tokens_seen": 4673392, "step": 1177, "train_runtime": 960.9233, "train_tokens_per_second": 4863.439 }, { "epoch": 90.53846153846153, "num_input_tokens_seen": 4673392, "step": 1177, "train_accuracy": 0.0234375 }, { "epoch": 90.61538461538461, "grad_norm": 3.9053070545196533, "learning_rate": 0.01, "loss": 4.224895000457764, "num_input_tokens_seen": 4677488, "step": 1178, "train_runtime": 961.7407, "train_tokens_per_second": 4863.565 }, { "epoch": 90.61538461538461, "num_input_tokens_seen": 4677488, "step": 1178, "train_accuracy": 0.0390625 }, { "epoch": 90.6923076923077, "grad_norm": 1.961185336112976, "learning_rate": 0.01, "loss": 4.247408866882324, "num_input_tokens_seen": 4681584, "step": 1179, "train_runtime": 962.5576, "train_tokens_per_second": 4863.692 }, { "epoch": 90.6923076923077, "num_input_tokens_seen": 4681584, "step": 1179, "train_accuracy": 0.041015625 }, { "epoch": 90.76923076923077, "grad_norm": 0.4231705665588379, "learning_rate": 0.01, "loss": 4.19923734664917, "num_input_tokens_seen": 4685680, "step": 1180, "train_runtime": 963.3754, "train_tokens_per_second": 4863.815 }, { "epoch": 90.76923076923077, "num_input_tokens_seen": 4685680, "step": 1180, "train_accuracy": 0.044921875 }, { "epoch": 90.84615384615384, "grad_norm": 1.0635826587677002, "learning_rate": 0.01, "loss": 4.2024383544921875, "num_input_tokens_seen": 4689776, "step": 1181, "train_runtime": 964.192, "train_tokens_per_second": 4863.944 }, { "epoch": 90.84615384615384, "num_input_tokens_seen": 4689776, "step": 1181, "train_accuracy": 0.025390625 }, { "epoch": 90.92307692307692, "grad_norm": 0.7891145944595337, "learning_rate": 0.01, "loss": 4.261574745178223, "num_input_tokens_seen": 4693872, "step": 1182, "train_runtime": 965.0041, "train_tokens_per_second": 4864.095 }, { "epoch": 90.92307692307692, "num_input_tokens_seen": 4693872, "step": 1182, "train_accuracy": 0.026058631017804146 }, { "epoch": 91.0, "grad_norm": 1.3556636571884155, "learning_rate": 0.01, "loss": 4.212470531463623, "num_input_tokens_seen": 4696328, "step": 1183, "train_runtime": 965.5211, "train_tokens_per_second": 4864.035 }, { "epoch": 91.0, "num_input_tokens_seen": 4696328, "step": 1183, "train_accuracy": 0.041015625 }, { "epoch": 91.07692307692308, "grad_norm": 0.7309383749961853, "learning_rate": 0.01, "loss": 4.167816162109375, "num_input_tokens_seen": 4700424, "step": 1184, "train_runtime": 966.3509, "train_tokens_per_second": 4864.097 }, { "epoch": 91.07692307692308, "num_input_tokens_seen": 4700424, "step": 1184, "train_accuracy": 0.046875 }, { "epoch": 91.15384615384616, "grad_norm": 0.39610621333122253, "learning_rate": 0.01, "loss": 4.186983108520508, "num_input_tokens_seen": 4704520, "step": 1185, "train_runtime": 967.1719, "train_tokens_per_second": 4864.203 }, { "epoch": 91.15384615384616, "num_input_tokens_seen": 4704520, "step": 1185, "train_accuracy": 0.033203125 }, { "epoch": 91.23076923076923, "grad_norm": 0.5263922810554504, "learning_rate": 0.01, "loss": 4.1591973304748535, "num_input_tokens_seen": 4708616, "step": 1186, "train_runtime": 967.9892, "train_tokens_per_second": 4864.327 }, { "epoch": 91.23076923076923, "num_input_tokens_seen": 4708616, "step": 1186, "train_accuracy": 0.037109375 }, { "epoch": 91.3076923076923, "grad_norm": 0.4648636281490326, "learning_rate": 0.01, "loss": 4.180056571960449, "num_input_tokens_seen": 4712712, "step": 1187, "train_runtime": 968.8056, "train_tokens_per_second": 4864.456 }, { "epoch": 91.3076923076923, "num_input_tokens_seen": 4712712, "step": 1187, "train_accuracy": 0.04296875 }, { "epoch": 91.38461538461539, "grad_norm": 1.0477451086044312, "learning_rate": 0.01, "loss": 4.164782524108887, "num_input_tokens_seen": 4716808, "step": 1188, "train_runtime": 969.623, "train_tokens_per_second": 4864.579 }, { "epoch": 91.38461538461539, "num_input_tokens_seen": 4716808, "step": 1188, "train_accuracy": 0.029296875 }, { "epoch": 91.46153846153847, "grad_norm": 0.5782698392868042, "learning_rate": 0.01, "loss": 4.202156066894531, "num_input_tokens_seen": 4720904, "step": 1189, "train_runtime": 970.4405, "train_tokens_per_second": 4864.702 }, { "epoch": 91.46153846153847, "num_input_tokens_seen": 4720904, "step": 1189, "train_accuracy": 0.052734375 }, { "epoch": 91.53846153846153, "grad_norm": 1.6004842519760132, "learning_rate": 0.01, "loss": 4.210166931152344, "num_input_tokens_seen": 4725000, "step": 1190, "train_runtime": 971.2583, "train_tokens_per_second": 4864.823 }, { "epoch": 91.53846153846153, "num_input_tokens_seen": 4725000, "step": 1190, "train_accuracy": 0.029296875 }, { "epoch": 91.61538461538461, "grad_norm": 1.2771614789962769, "learning_rate": 0.01, "loss": 4.170170307159424, "num_input_tokens_seen": 4729096, "step": 1191, "train_runtime": 972.0773, "train_tokens_per_second": 4864.938 }, { "epoch": 91.61538461538461, "num_input_tokens_seen": 4729096, "step": 1191, "train_accuracy": 0.0234375 }, { "epoch": 91.6923076923077, "grad_norm": 0.6172093152999878, "learning_rate": 0.01, "loss": 4.237349987030029, "num_input_tokens_seen": 4733192, "step": 1192, "train_runtime": 972.8944, "train_tokens_per_second": 4865.062 }, { "epoch": 91.6923076923077, "num_input_tokens_seen": 4733192, "step": 1192, "train_accuracy": 0.03125 }, { "epoch": 91.76923076923077, "grad_norm": 1.2454875707626343, "learning_rate": 0.01, "loss": 4.218174457550049, "num_input_tokens_seen": 4737288, "step": 1193, "train_runtime": 973.7112, "train_tokens_per_second": 4865.188 }, { "epoch": 91.76923076923077, "num_input_tokens_seen": 4737288, "step": 1193, "train_accuracy": 0.05078125 }, { "epoch": 91.84615384615384, "grad_norm": 0.7239828109741211, "learning_rate": 0.01, "loss": 4.134560585021973, "num_input_tokens_seen": 4741384, "step": 1194, "train_runtime": 974.5288, "train_tokens_per_second": 4865.309 }, { "epoch": 91.84615384615384, "num_input_tokens_seen": 4741384, "step": 1194, "train_accuracy": 0.01953125 }, { "epoch": 91.92307692307692, "grad_norm": 1.593626856803894, "learning_rate": 0.01, "loss": 4.236126899719238, "num_input_tokens_seen": 4745480, "step": 1195, "train_runtime": 975.3411, "train_tokens_per_second": 4865.457 }, { "epoch": 91.92307692307692, "num_input_tokens_seen": 4745480, "step": 1195, "train_accuracy": 0.032573290169239044 }, { "epoch": 92.0, "grad_norm": 1.4044294357299805, "learning_rate": 0.01, "loss": 4.203438758850098, "num_input_tokens_seen": 4747936, "step": 1196, "train_runtime": 975.8595, "train_tokens_per_second": 4865.389 }, { "epoch": 92.0, "num_input_tokens_seen": 4747936, "step": 1196, "train_accuracy": 0.0390625 }, { "epoch": 92.07692307692308, "grad_norm": 1.451888084411621, "learning_rate": 0.01, "loss": 4.142299652099609, "num_input_tokens_seen": 4752032, "step": 1197, "train_runtime": 976.6879, "train_tokens_per_second": 4865.456 }, { "epoch": 92.07692307692308, "num_input_tokens_seen": 4752032, "step": 1197, "train_accuracy": 0.046875 }, { "epoch": 92.15384615384616, "grad_norm": 0.4934719502925873, "learning_rate": 0.01, "loss": 4.190487384796143, "num_input_tokens_seen": 4756128, "step": 1198, "train_runtime": 977.5047, "train_tokens_per_second": 4865.581 }, { "epoch": 92.15384615384616, "num_input_tokens_seen": 4756128, "step": 1198, "train_accuracy": 0.0390625 }, { "epoch": 92.23076923076923, "grad_norm": 0.6478560566902161, "learning_rate": 0.01, "loss": 4.193492889404297, "num_input_tokens_seen": 4760224, "step": 1199, "train_runtime": 978.3219, "train_tokens_per_second": 4865.703 }, { "epoch": 92.23076923076923, "num_input_tokens_seen": 4760224, "step": 1199, "train_accuracy": 0.04296875 }, { "epoch": 92.3076923076923, "grad_norm": 1.190477728843689, "learning_rate": 0.01, "loss": 4.161839485168457, "num_input_tokens_seen": 4764320, "step": 1200, "train_runtime": 979.1392, "train_tokens_per_second": 4865.825 }, { "epoch": 92.3076923076923, "eval_CMD_3_branch_eval_accuracy": 0.019891500904159132, "eval_CMD_3_branch_eval_loss": 4.357153415679932, "eval_CMD_3_branch_eval_runtime": 1.1592, "eval_CMD_3_branch_eval_samples_per_second": 2385.288, "eval_CMD_3_branch_eval_steps_per_second": 5.176, "num_input_tokens_seen": 4764320, "step": 1200 }, { "epoch": 92.3076923076923, "num_input_tokens_seen": 4764320, "step": 1200, "train_accuracy": 0.04296875 }, { "epoch": 92.38461538461539, "grad_norm": 0.6409584879875183, "learning_rate": 0.01, "loss": 4.188936233520508, "num_input_tokens_seen": 4768416, "step": 1201, "train_runtime": 981.1193, "train_tokens_per_second": 4860.18 }, { "epoch": 92.38461538461539, "num_input_tokens_seen": 4768416, "step": 1201, "train_accuracy": 0.041015625 }, { "epoch": 92.46153846153847, "grad_norm": 0.6553785800933838, "learning_rate": 0.01, "loss": 4.207437038421631, "num_input_tokens_seen": 4772512, "step": 1202, "train_runtime": 981.9361, "train_tokens_per_second": 4860.308 }, { "epoch": 92.46153846153847, "num_input_tokens_seen": 4772512, "step": 1202, "train_accuracy": 0.021484375 }, { "epoch": 92.53846153846153, "grad_norm": 0.4285067915916443, "learning_rate": 0.01, "loss": 4.174130916595459, "num_input_tokens_seen": 4776608, "step": 1203, "train_runtime": 982.7549, "train_tokens_per_second": 4860.427 }, { "epoch": 92.53846153846153, "num_input_tokens_seen": 4776608, "step": 1203, "train_accuracy": 0.033203125 }, { "epoch": 92.61538461538461, "grad_norm": 0.7696940898895264, "learning_rate": 0.01, "loss": 4.180700302124023, "num_input_tokens_seen": 4780704, "step": 1204, "train_runtime": 983.5726, "train_tokens_per_second": 4860.55 }, { "epoch": 92.61538461538461, "num_input_tokens_seen": 4780704, "step": 1204, "train_accuracy": 0.02734375 }, { "epoch": 92.6923076923077, "grad_norm": 0.4185137152671814, "learning_rate": 0.01, "loss": 4.337588310241699, "num_input_tokens_seen": 4784800, "step": 1205, "train_runtime": 984.3898, "train_tokens_per_second": 4860.676 }, { "epoch": 92.6923076923077, "num_input_tokens_seen": 4784800, "step": 1205, "train_accuracy": 0.03515625 }, { "epoch": 92.76923076923077, "grad_norm": 0.5836478471755981, "learning_rate": 0.01, "loss": 4.2482075691223145, "num_input_tokens_seen": 4788896, "step": 1206, "train_runtime": 985.2067, "train_tokens_per_second": 4860.803 }, { "epoch": 92.76923076923077, "num_input_tokens_seen": 4788896, "step": 1206, "train_accuracy": 0.0390625 }, { "epoch": 92.84615384615384, "grad_norm": 0.9326725006103516, "learning_rate": 0.01, "loss": 4.2536773681640625, "num_input_tokens_seen": 4792992, "step": 1207, "train_runtime": 986.0242, "train_tokens_per_second": 4860.927 }, { "epoch": 92.84615384615384, "num_input_tokens_seen": 4792992, "step": 1207, "train_accuracy": 0.017578125 }, { "epoch": 92.92307692307692, "grad_norm": 2.190541982650757, "learning_rate": 0.01, "loss": 4.291766166687012, "num_input_tokens_seen": 4797088, "step": 1208, "train_runtime": 986.8369, "train_tokens_per_second": 4861.075 }, { "epoch": 92.92307692307692, "num_input_tokens_seen": 4797088, "step": 1208, "train_accuracy": 0.032573290169239044 }, { "epoch": 93.0, "grad_norm": 0.9914067387580872, "learning_rate": 0.01, "loss": 4.260455131530762, "num_input_tokens_seen": 4799544, "step": 1209, "train_runtime": 987.354, "train_tokens_per_second": 4861.016 }, { "epoch": 93.0, "num_input_tokens_seen": 4799544, "step": 1209, "train_accuracy": 0.029296875 }, { "epoch": 93.07692307692308, "grad_norm": 1.1241073608398438, "learning_rate": 0.01, "loss": 4.217317581176758, "num_input_tokens_seen": 4803640, "step": 1210, "train_runtime": 988.1836, "train_tokens_per_second": 4861.08 }, { "epoch": 93.07692307692308, "num_input_tokens_seen": 4803640, "step": 1210, "train_accuracy": 0.046875 }, { "epoch": 93.15384615384616, "grad_norm": 0.898827850818634, "learning_rate": 0.01, "loss": 4.246952056884766, "num_input_tokens_seen": 4807736, "step": 1211, "train_runtime": 988.9996, "train_tokens_per_second": 4861.211 }, { "epoch": 93.15384615384616, "num_input_tokens_seen": 4807736, "step": 1211, "train_accuracy": 0.033203125 }, { "epoch": 93.23076923076923, "grad_norm": 0.7480000257492065, "learning_rate": 0.01, "loss": 4.2528276443481445, "num_input_tokens_seen": 4811832, "step": 1212, "train_runtime": 989.8158, "train_tokens_per_second": 4861.341 }, { "epoch": 93.23076923076923, "num_input_tokens_seen": 4811832, "step": 1212, "train_accuracy": 0.03515625 }, { "epoch": 93.3076923076923, "grad_norm": 2.9047458171844482, "learning_rate": 0.01, "loss": 4.243381023406982, "num_input_tokens_seen": 4815928, "step": 1213, "train_runtime": 990.632, "train_tokens_per_second": 4861.47 }, { "epoch": 93.3076923076923, "num_input_tokens_seen": 4815928, "step": 1213, "train_accuracy": 0.029296875 }, { "epoch": 93.38461538461539, "grad_norm": 0.5581874847412109, "learning_rate": 0.01, "loss": 4.258604049682617, "num_input_tokens_seen": 4820024, "step": 1214, "train_runtime": 991.4509, "train_tokens_per_second": 4861.586 }, { "epoch": 93.38461538461539, "num_input_tokens_seen": 4820024, "step": 1214, "train_accuracy": 0.029296875 }, { "epoch": 93.46153846153847, "grad_norm": 1.116030216217041, "learning_rate": 0.01, "loss": 4.252742767333984, "num_input_tokens_seen": 4824120, "step": 1215, "train_runtime": 992.2696, "train_tokens_per_second": 4861.703 }, { "epoch": 93.46153846153847, "num_input_tokens_seen": 4824120, "step": 1215, "train_accuracy": 0.041015625 }, { "epoch": 93.53846153846153, "grad_norm": 0.8851171731948853, "learning_rate": 0.01, "loss": 4.307258605957031, "num_input_tokens_seen": 4828216, "step": 1216, "train_runtime": 993.0861, "train_tokens_per_second": 4861.83 }, { "epoch": 93.53846153846153, "num_input_tokens_seen": 4828216, "step": 1216, "train_accuracy": 0.03515625 }, { "epoch": 93.61538461538461, "grad_norm": 0.4048510193824768, "learning_rate": 0.01, "loss": 4.233102798461914, "num_input_tokens_seen": 4832312, "step": 1217, "train_runtime": 993.9029, "train_tokens_per_second": 4861.956 }, { "epoch": 93.61538461538461, "num_input_tokens_seen": 4832312, "step": 1217, "train_accuracy": 0.02734375 }, { "epoch": 93.6923076923077, "grad_norm": 0.5768749117851257, "learning_rate": 0.01, "loss": 4.241782188415527, "num_input_tokens_seen": 4836408, "step": 1218, "train_runtime": 994.7203, "train_tokens_per_second": 4862.078 }, { "epoch": 93.6923076923077, "num_input_tokens_seen": 4836408, "step": 1218, "train_accuracy": 0.02734375 }, { "epoch": 93.76923076923077, "grad_norm": 0.7128937840461731, "learning_rate": 0.01, "loss": 4.259064674377441, "num_input_tokens_seen": 4840504, "step": 1219, "train_runtime": 995.5372, "train_tokens_per_second": 4862.203 }, { "epoch": 93.76923076923077, "num_input_tokens_seen": 4840504, "step": 1219, "train_accuracy": 0.03515625 }, { "epoch": 93.84615384615384, "grad_norm": 8.663732528686523, "learning_rate": 0.01, "loss": 4.251834392547607, "num_input_tokens_seen": 4844600, "step": 1220, "train_runtime": 996.3553, "train_tokens_per_second": 4862.322 }, { "epoch": 93.84615384615384, "num_input_tokens_seen": 4844600, "step": 1220, "train_accuracy": 0.029296875 }, { "epoch": 93.92307692307692, "grad_norm": 7.0520243644714355, "learning_rate": 0.01, "loss": 4.247310161590576, "num_input_tokens_seen": 4848696, "step": 1221, "train_runtime": 997.167, "train_tokens_per_second": 4862.471 }, { "epoch": 93.92307692307692, "num_input_tokens_seen": 4848696, "step": 1221, "train_accuracy": 0.009771986864507198 }, { "epoch": 94.0, "grad_norm": 1.0234301090240479, "learning_rate": 0.01, "loss": 4.274682998657227, "num_input_tokens_seen": 4851152, "step": 1222, "train_runtime": 997.6844, "train_tokens_per_second": 4862.411 }, { "epoch": 94.0, "num_input_tokens_seen": 4851152, "step": 1222, "train_accuracy": 0.033203125 }, { "epoch": 94.07692307692308, "grad_norm": 0.6315427422523499, "learning_rate": 0.01, "loss": 4.229619979858398, "num_input_tokens_seen": 4855248, "step": 1223, "train_runtime": 998.513, "train_tokens_per_second": 4862.478 }, { "epoch": 94.07692307692308, "num_input_tokens_seen": 4855248, "step": 1223, "train_accuracy": 0.041015625 }, { "epoch": 94.15384615384616, "grad_norm": 1.369253396987915, "learning_rate": 0.01, "loss": 4.144454479217529, "num_input_tokens_seen": 4859344, "step": 1224, "train_runtime": 999.33, "train_tokens_per_second": 4862.602 }, { "epoch": 94.15384615384616, "num_input_tokens_seen": 4859344, "step": 1224, "train_accuracy": 0.033203125 }, { "epoch": 94.23076923076923, "grad_norm": 1.8054120540618896, "learning_rate": 0.01, "loss": 4.198246002197266, "num_input_tokens_seen": 4863440, "step": 1225, "train_runtime": 1000.1484, "train_tokens_per_second": 4862.718 }, { "epoch": 94.23076923076923, "num_input_tokens_seen": 4863440, "step": 1225, "train_accuracy": 0.0546875 }, { "epoch": 94.3076923076923, "grad_norm": 1.6095513105392456, "learning_rate": 0.01, "loss": 4.210019588470459, "num_input_tokens_seen": 4867536, "step": 1226, "train_runtime": 1000.977, "train_tokens_per_second": 4862.785 }, { "epoch": 94.3076923076923, "num_input_tokens_seen": 4867536, "step": 1226, "train_accuracy": 0.0390625 }, { "epoch": 94.38461538461539, "grad_norm": 1.6851614713668823, "learning_rate": 0.01, "loss": 4.179011344909668, "num_input_tokens_seen": 4871632, "step": 1227, "train_runtime": 1001.7935, "train_tokens_per_second": 4862.91 }, { "epoch": 94.38461538461539, "num_input_tokens_seen": 4871632, "step": 1227, "train_accuracy": 0.044921875 }, { "epoch": 94.46153846153847, "grad_norm": 0.6386091113090515, "learning_rate": 0.01, "loss": 4.238643646240234, "num_input_tokens_seen": 4875728, "step": 1228, "train_runtime": 1002.6101, "train_tokens_per_second": 4863.035 }, { "epoch": 94.46153846153847, "num_input_tokens_seen": 4875728, "step": 1228, "train_accuracy": 0.029296875 }, { "epoch": 94.53846153846153, "grad_norm": 3.2731964588165283, "learning_rate": 0.01, "loss": 4.1840972900390625, "num_input_tokens_seen": 4879824, "step": 1229, "train_runtime": 1003.4266, "train_tokens_per_second": 4863.16 }, { "epoch": 94.53846153846153, "num_input_tokens_seen": 4879824, "step": 1229, "train_accuracy": 0.05859375 }, { "epoch": 94.61538461538461, "grad_norm": 0.926724374294281, "learning_rate": 0.01, "loss": 4.11090087890625, "num_input_tokens_seen": 4883920, "step": 1230, "train_runtime": 1004.2444, "train_tokens_per_second": 4863.278 }, { "epoch": 94.61538461538461, "num_input_tokens_seen": 4883920, "step": 1230, "train_accuracy": 0.025390625 }, { "epoch": 94.6923076923077, "grad_norm": 0.9720467329025269, "learning_rate": 0.01, "loss": 4.310583114624023, "num_input_tokens_seen": 4888016, "step": 1231, "train_runtime": 1005.0629, "train_tokens_per_second": 4863.393 }, { "epoch": 94.6923076923077, "num_input_tokens_seen": 4888016, "step": 1231, "train_accuracy": 0.037109375 }, { "epoch": 94.76923076923077, "grad_norm": 0.7912406921386719, "learning_rate": 0.01, "loss": 4.284384727478027, "num_input_tokens_seen": 4892112, "step": 1232, "train_runtime": 1005.8813, "train_tokens_per_second": 4863.508 }, { "epoch": 94.76923076923077, "num_input_tokens_seen": 4892112, "step": 1232, "train_accuracy": 0.013671875 }, { "epoch": 94.84615384615384, "grad_norm": 1.2726390361785889, "learning_rate": 0.01, "loss": 4.27509880065918, "num_input_tokens_seen": 4896208, "step": 1233, "train_runtime": 1006.6981, "train_tokens_per_second": 4863.631 }, { "epoch": 94.84615384615384, "num_input_tokens_seen": 4896208, "step": 1233, "train_accuracy": 0.041015625 }, { "epoch": 94.92307692307692, "grad_norm": 0.6728102564811707, "learning_rate": 0.01, "loss": 4.257051467895508, "num_input_tokens_seen": 4900304, "step": 1234, "train_runtime": 1007.5108, "train_tokens_per_second": 4863.773 }, { "epoch": 94.92307692307692, "num_input_tokens_seen": 4900304, "step": 1234, "train_accuracy": 0.04885993152856827 }, { "epoch": 95.0, "grad_norm": 1.2158743143081665, "learning_rate": 0.01, "loss": 4.241811752319336, "num_input_tokens_seen": 4902760, "step": 1235, "train_runtime": 1008.0279, "train_tokens_per_second": 4863.715 }, { "epoch": 95.0, "num_input_tokens_seen": 4902760, "step": 1235, "train_accuracy": 0.044921875 }, { "epoch": 95.07692307692308, "grad_norm": 0.5960951447486877, "learning_rate": 0.01, "loss": 4.13967227935791, "num_input_tokens_seen": 4906856, "step": 1236, "train_runtime": 1008.8579, "train_tokens_per_second": 4863.773 }, { "epoch": 95.07692307692308, "num_input_tokens_seen": 4906856, "step": 1236, "train_accuracy": 0.033203125 }, { "epoch": 95.15384615384616, "grad_norm": 0.6546602249145508, "learning_rate": 0.01, "loss": 4.273693084716797, "num_input_tokens_seen": 4910952, "step": 1237, "train_runtime": 1009.6769, "train_tokens_per_second": 4863.885 }, { "epoch": 95.15384615384616, "num_input_tokens_seen": 4910952, "step": 1237, "train_accuracy": 0.041015625 }, { "epoch": 95.23076923076923, "grad_norm": 0.6968697905540466, "learning_rate": 0.01, "loss": 4.230842590332031, "num_input_tokens_seen": 4915048, "step": 1238, "train_runtime": 1010.4945, "train_tokens_per_second": 4864.003 }, { "epoch": 95.23076923076923, "num_input_tokens_seen": 4915048, "step": 1238, "train_accuracy": 0.033203125 }, { "epoch": 95.3076923076923, "grad_norm": 1.1342315673828125, "learning_rate": 0.01, "loss": 4.240490436553955, "num_input_tokens_seen": 4919144, "step": 1239, "train_runtime": 1011.3106, "train_tokens_per_second": 4864.128 }, { "epoch": 95.3076923076923, "num_input_tokens_seen": 4919144, "step": 1239, "train_accuracy": 0.03125 }, { "epoch": 95.38461538461539, "grad_norm": 1.3191282749176025, "learning_rate": 0.01, "loss": 4.234597206115723, "num_input_tokens_seen": 4923240, "step": 1240, "train_runtime": 1012.1279, "train_tokens_per_second": 4864.247 }, { "epoch": 95.38461538461539, "num_input_tokens_seen": 4923240, "step": 1240, "train_accuracy": 0.0234375 }, { "epoch": 95.46153846153847, "grad_norm": 0.9121236801147461, "learning_rate": 0.01, "loss": 4.307871341705322, "num_input_tokens_seen": 4927336, "step": 1241, "train_runtime": 1012.9444, "train_tokens_per_second": 4864.369 }, { "epoch": 95.46153846153847, "num_input_tokens_seen": 4927336, "step": 1241, "train_accuracy": 0.03125 }, { "epoch": 95.53846153846153, "grad_norm": 0.9026360511779785, "learning_rate": 0.01, "loss": 4.26276969909668, "num_input_tokens_seen": 4931432, "step": 1242, "train_runtime": 1013.7636, "train_tokens_per_second": 4864.479 }, { "epoch": 95.53846153846153, "num_input_tokens_seen": 4931432, "step": 1242, "train_accuracy": 0.033203125 }, { "epoch": 95.61538461538461, "grad_norm": 1.45496666431427, "learning_rate": 0.01, "loss": 4.283936500549316, "num_input_tokens_seen": 4935528, "step": 1243, "train_runtime": 1014.5802, "train_tokens_per_second": 4864.601 }, { "epoch": 95.61538461538461, "num_input_tokens_seen": 4935528, "step": 1243, "train_accuracy": 0.03515625 }, { "epoch": 95.6923076923077, "grad_norm": 2.2112810611724854, "learning_rate": 0.01, "loss": 4.249178886413574, "num_input_tokens_seen": 4939624, "step": 1244, "train_runtime": 1015.3964, "train_tokens_per_second": 4864.725 }, { "epoch": 95.6923076923077, "num_input_tokens_seen": 4939624, "step": 1244, "train_accuracy": 0.029296875 }, { "epoch": 95.76923076923077, "grad_norm": 1.4071255922317505, "learning_rate": 0.01, "loss": 4.245018005371094, "num_input_tokens_seen": 4943720, "step": 1245, "train_runtime": 1016.2131, "train_tokens_per_second": 4864.846 }, { "epoch": 95.76923076923077, "num_input_tokens_seen": 4943720, "step": 1245, "train_accuracy": 0.025390625 }, { "epoch": 95.84615384615384, "grad_norm": 0.9206699132919312, "learning_rate": 0.01, "loss": 4.237589359283447, "num_input_tokens_seen": 4947816, "step": 1246, "train_runtime": 1017.0292, "train_tokens_per_second": 4864.969 }, { "epoch": 95.84615384615384, "num_input_tokens_seen": 4947816, "step": 1246, "train_accuracy": 0.025390625 }, { "epoch": 95.92307692307692, "grad_norm": 1.309809923171997, "learning_rate": 0.01, "loss": 4.217013359069824, "num_input_tokens_seen": 4951912, "step": 1247, "train_runtime": 1017.8425, "train_tokens_per_second": 4865.106 }, { "epoch": 95.92307692307692, "num_input_tokens_seen": 4951912, "step": 1247, "train_accuracy": 0.026058631017804146 }, { "epoch": 96.0, "grad_norm": 4.887404918670654, "learning_rate": 0.01, "loss": 4.300361156463623, "num_input_tokens_seen": 4954368, "step": 1248, "train_runtime": 1018.3623, "train_tokens_per_second": 4865.035 }, { "epoch": 96.0, "num_input_tokens_seen": 4954368, "step": 1248, "train_accuracy": 0.03515625 }, { "epoch": 96.07692307692308, "grad_norm": 1.9327681064605713, "learning_rate": 0.01, "loss": 4.225034713745117, "num_input_tokens_seen": 4958464, "step": 1249, "train_runtime": 1019.1909, "train_tokens_per_second": 4865.098 }, { "epoch": 96.07692307692308, "num_input_tokens_seen": 4958464, "step": 1249, "train_accuracy": 0.041015625 }, { "epoch": 96.15384615384616, "grad_norm": 0.612694501876831, "learning_rate": 0.01, "loss": 4.222924709320068, "num_input_tokens_seen": 4962560, "step": 1250, "train_runtime": 1020.0066, "train_tokens_per_second": 4865.224 }, { "epoch": 96.15384615384616, "num_input_tokens_seen": 4962560, "step": 1250, "train_accuracy": 0.0234375 }, { "epoch": 96.23076923076923, "grad_norm": 4.84871244430542, "learning_rate": 0.01, "loss": 4.2540507316589355, "num_input_tokens_seen": 4966656, "step": 1251, "train_runtime": 1020.8235, "train_tokens_per_second": 4865.342 }, { "epoch": 96.23076923076923, "num_input_tokens_seen": 4966656, "step": 1251, "train_accuracy": 0.025390625 }, { "epoch": 96.3076923076923, "grad_norm": 5.11841344833374, "learning_rate": 0.01, "loss": 4.731534957885742, "num_input_tokens_seen": 4970752, "step": 1252, "train_runtime": 1021.6401, "train_tokens_per_second": 4865.463 }, { "epoch": 96.3076923076923, "num_input_tokens_seen": 4970752, "step": 1252, "train_accuracy": 0.013671875 }, { "epoch": 96.38461538461539, "grad_norm": 1.5406798124313354, "learning_rate": 0.01, "loss": 4.5885820388793945, "num_input_tokens_seen": 4974848, "step": 1253, "train_runtime": 1022.4602, "train_tokens_per_second": 4865.566 }, { "epoch": 96.38461538461539, "num_input_tokens_seen": 4974848, "step": 1253, "train_accuracy": 0.021484375 }, { "epoch": 96.46153846153847, "grad_norm": 0.45561483502388, "learning_rate": 0.01, "loss": 4.525201797485352, "num_input_tokens_seen": 4978944, "step": 1254, "train_runtime": 1023.2769, "train_tokens_per_second": 4865.686 }, { "epoch": 96.46153846153847, "num_input_tokens_seen": 4978944, "step": 1254, "train_accuracy": 0.0078125 }, { "epoch": 96.53846153846153, "grad_norm": 4.504939079284668, "learning_rate": 0.01, "loss": 4.626739501953125, "num_input_tokens_seen": 4983040, "step": 1255, "train_runtime": 1024.0923, "train_tokens_per_second": 4865.811 }, { "epoch": 96.53846153846153, "num_input_tokens_seen": 4983040, "step": 1255, "train_accuracy": 0.0234375 }, { "epoch": 96.61538461538461, "grad_norm": 0.6294952034950256, "learning_rate": 0.01, "loss": 4.591184616088867, "num_input_tokens_seen": 4987136, "step": 1256, "train_runtime": 1024.9081, "train_tokens_per_second": 4865.935 }, { "epoch": 96.61538461538461, "num_input_tokens_seen": 4987136, "step": 1256, "train_accuracy": 0.013671875 }, { "epoch": 96.6923076923077, "grad_norm": 0.6702298521995544, "learning_rate": 0.01, "loss": 4.538229942321777, "num_input_tokens_seen": 4991232, "step": 1257, "train_runtime": 1025.725, "train_tokens_per_second": 4866.053 }, { "epoch": 96.6923076923077, "num_input_tokens_seen": 4991232, "step": 1257, "train_accuracy": 0.017578125 }, { "epoch": 96.76923076923077, "grad_norm": 1.0073717832565308, "learning_rate": 0.01, "loss": 4.5416107177734375, "num_input_tokens_seen": 4995328, "step": 1258, "train_runtime": 1026.5412, "train_tokens_per_second": 4866.174 }, { "epoch": 96.76923076923077, "num_input_tokens_seen": 4995328, "step": 1258, "train_accuracy": 0.01171875 }, { "epoch": 96.84615384615384, "grad_norm": 0.7780309915542603, "learning_rate": 0.01, "loss": 4.570990562438965, "num_input_tokens_seen": 4999424, "step": 1259, "train_runtime": 1027.3592, "train_tokens_per_second": 4866.286 }, { "epoch": 96.84615384615384, "num_input_tokens_seen": 4999424, "step": 1259, "train_accuracy": 0.015625 }, { "epoch": 96.92307692307692, "grad_norm": 7.325876712799072, "learning_rate": 0.01, "loss": 4.555654525756836, "num_input_tokens_seen": 5003520, "step": 1260, "train_runtime": 1028.1706, "train_tokens_per_second": 4866.43 }, { "epoch": 96.92307692307692, "num_input_tokens_seen": 5003520, "step": 1260, "train_accuracy": 0.009771986864507198 }, { "epoch": 97.0, "grad_norm": 1.0936717987060547, "learning_rate": 0.01, "loss": 4.580423831939697, "num_input_tokens_seen": 5005976, "step": 1261, "train_runtime": 1028.6866, "train_tokens_per_second": 4866.376 }, { "epoch": 97.0, "num_input_tokens_seen": 5005976, "step": 1261, "train_accuracy": 0.01171875 }, { "epoch": 97.07692307692308, "grad_norm": 9.796006202697754, "learning_rate": 0.01, "loss": 4.472999095916748, "num_input_tokens_seen": 5010072, "step": 1262, "train_runtime": 1029.514, "train_tokens_per_second": 4866.444 }, { "epoch": 97.07692307692308, "num_input_tokens_seen": 5010072, "step": 1262, "train_accuracy": 0.017578125 }, { "epoch": 97.15384615384616, "grad_norm": 1.7899651527404785, "learning_rate": 0.01, "loss": 4.557491779327393, "num_input_tokens_seen": 5014168, "step": 1263, "train_runtime": 1030.3311, "train_tokens_per_second": 4866.56 }, { "epoch": 97.15384615384616, "num_input_tokens_seen": 5014168, "step": 1263, "train_accuracy": 0.005859375 }, { "epoch": 97.23076923076923, "grad_norm": 0.8044832348823547, "learning_rate": 0.01, "loss": 4.589766979217529, "num_input_tokens_seen": 5018264, "step": 1264, "train_runtime": 1031.1464, "train_tokens_per_second": 4866.684 }, { "epoch": 97.23076923076923, "num_input_tokens_seen": 5018264, "step": 1264, "train_accuracy": 0.009765625 }, { "epoch": 97.3076923076923, "grad_norm": 0.7345467805862427, "learning_rate": 0.01, "loss": 4.575111389160156, "num_input_tokens_seen": 5022360, "step": 1265, "train_runtime": 1032.3531, "train_tokens_per_second": 4864.964 }, { "epoch": 97.3076923076923, "num_input_tokens_seen": 5022360, "step": 1265, "train_accuracy": 0.0234375 }, { "epoch": 97.38461538461539, "grad_norm": 1.5114500522613525, "learning_rate": 0.01, "loss": 4.474294662475586, "num_input_tokens_seen": 5026456, "step": 1266, "train_runtime": 1033.1672, "train_tokens_per_second": 4865.094 }, { "epoch": 97.38461538461539, "num_input_tokens_seen": 5026456, "step": 1266, "train_accuracy": 0.015625 }, { "epoch": 97.46153846153847, "grad_norm": 0.6166411638259888, "learning_rate": 0.01, "loss": 4.488404273986816, "num_input_tokens_seen": 5030552, "step": 1267, "train_runtime": 1033.9825, "train_tokens_per_second": 4865.219 }, { "epoch": 97.46153846153847, "num_input_tokens_seen": 5030552, "step": 1267, "train_accuracy": 0.01953125 }, { "epoch": 97.53846153846153, "grad_norm": 1.085659146308899, "learning_rate": 0.01, "loss": 4.550913333892822, "num_input_tokens_seen": 5034648, "step": 1268, "train_runtime": 1034.7978, "train_tokens_per_second": 4865.344 }, { "epoch": 97.53846153846153, "num_input_tokens_seen": 5034648, "step": 1268, "train_accuracy": 0.013671875 }, { "epoch": 97.61538461538461, "grad_norm": 0.6593523621559143, "learning_rate": 0.01, "loss": 4.613582611083984, "num_input_tokens_seen": 5038744, "step": 1269, "train_runtime": 1035.6128, "train_tokens_per_second": 4865.471 }, { "epoch": 97.61538461538461, "num_input_tokens_seen": 5038744, "step": 1269, "train_accuracy": 0.01171875 }, { "epoch": 97.6923076923077, "grad_norm": 0.41679027676582336, "learning_rate": 0.01, "loss": 4.539933681488037, "num_input_tokens_seen": 5042840, "step": 1270, "train_runtime": 1036.4274, "train_tokens_per_second": 4865.599 }, { "epoch": 97.6923076923077, "num_input_tokens_seen": 5042840, "step": 1270, "train_accuracy": 0.021484375 }, { "epoch": 97.76923076923077, "grad_norm": 0.3402726650238037, "learning_rate": 0.01, "loss": 4.557590484619141, "num_input_tokens_seen": 5046936, "step": 1271, "train_runtime": 1037.2435, "train_tokens_per_second": 4865.72 }, { "epoch": 97.76923076923077, "num_input_tokens_seen": 5046936, "step": 1271, "train_accuracy": 0.009765625 }, { "epoch": 97.84615384615384, "grad_norm": 0.5146462917327881, "learning_rate": 0.01, "loss": 4.5818963050842285, "num_input_tokens_seen": 5051032, "step": 1272, "train_runtime": 1038.0618, "train_tokens_per_second": 4865.83 }, { "epoch": 97.84615384615384, "num_input_tokens_seen": 5051032, "step": 1272, "train_accuracy": 0.01953125 }, { "epoch": 97.92307692307692, "grad_norm": 0.4620774984359741, "learning_rate": 0.01, "loss": 4.5395660400390625, "num_input_tokens_seen": 5055128, "step": 1273, "train_runtime": 1038.8735, "train_tokens_per_second": 4865.971 }, { "epoch": 97.92307692307692, "num_input_tokens_seen": 5055128, "step": 1273, "train_accuracy": 0.013029315508902073 }, { "epoch": 98.0, "grad_norm": 0.6541016697883606, "learning_rate": 0.01, "loss": 4.595381259918213, "num_input_tokens_seen": 5057584, "step": 1274, "train_runtime": 1039.3895, "train_tokens_per_second": 4865.918 }, { "epoch": 98.0, "num_input_tokens_seen": 5057584, "step": 1274, "train_accuracy": 0.0234375 }, { "epoch": 98.07692307692308, "grad_norm": 0.6528225541114807, "learning_rate": 0.01, "loss": 4.497180461883545, "num_input_tokens_seen": 5061680, "step": 1275, "train_runtime": 1040.2178, "train_tokens_per_second": 4865.981 }, { "epoch": 98.07692307692308, "num_input_tokens_seen": 5061680, "step": 1275, "train_accuracy": 0.01953125 }, { "epoch": 98.15384615384616, "grad_norm": 0.3280772566795349, "learning_rate": 0.01, "loss": 4.5014801025390625, "num_input_tokens_seen": 5065776, "step": 1276, "train_runtime": 1041.0325, "train_tokens_per_second": 4866.107 }, { "epoch": 98.15384615384616, "num_input_tokens_seen": 5065776, "step": 1276, "train_accuracy": 0.01171875 }, { "epoch": 98.23076923076923, "grad_norm": 0.6081762909889221, "learning_rate": 0.01, "loss": 4.539563179016113, "num_input_tokens_seen": 5069872, "step": 1277, "train_runtime": 1041.8497, "train_tokens_per_second": 4866.222 }, { "epoch": 98.23076923076923, "num_input_tokens_seen": 5069872, "step": 1277, "train_accuracy": 0.013671875 }, { "epoch": 98.3076923076923, "grad_norm": 0.46605730056762695, "learning_rate": 0.01, "loss": 4.5333404541015625, "num_input_tokens_seen": 5073968, "step": 1278, "train_runtime": 1042.6659, "train_tokens_per_second": 4866.341 }, { "epoch": 98.3076923076923, "num_input_tokens_seen": 5073968, "step": 1278, "train_accuracy": 0.0078125 }, { "epoch": 98.38461538461539, "grad_norm": 0.4803134500980377, "learning_rate": 0.01, "loss": 4.540291786193848, "num_input_tokens_seen": 5078064, "step": 1279, "train_runtime": 1043.4819, "train_tokens_per_second": 4866.461 }, { "epoch": 98.38461538461539, "num_input_tokens_seen": 5078064, "step": 1279, "train_accuracy": 0.0234375 }, { "epoch": 98.46153846153847, "grad_norm": 0.37552720308303833, "learning_rate": 0.01, "loss": 4.5177812576293945, "num_input_tokens_seen": 5082160, "step": 1280, "train_runtime": 1044.298, "train_tokens_per_second": 4866.58 }, { "epoch": 98.46153846153847, "num_input_tokens_seen": 5082160, "step": 1280, "train_accuracy": 0.01953125 }, { "epoch": 98.53846153846153, "grad_norm": 0.6628419160842896, "learning_rate": 0.01, "loss": 4.5339179039001465, "num_input_tokens_seen": 5086256, "step": 1281, "train_runtime": 1045.1136, "train_tokens_per_second": 4866.702 }, { "epoch": 98.53846153846153, "num_input_tokens_seen": 5086256, "step": 1281, "train_accuracy": 0.015625 }, { "epoch": 98.61538461538461, "grad_norm": 0.3709065914154053, "learning_rate": 0.01, "loss": 4.5074076652526855, "num_input_tokens_seen": 5090352, "step": 1282, "train_runtime": 1045.93, "train_tokens_per_second": 4866.819 }, { "epoch": 98.61538461538461, "num_input_tokens_seen": 5090352, "step": 1282, "train_accuracy": 0.015625 }, { "epoch": 98.6923076923077, "grad_norm": 1.0720301866531372, "learning_rate": 0.01, "loss": 4.541929244995117, "num_input_tokens_seen": 5094448, "step": 1283, "train_runtime": 1046.7458, "train_tokens_per_second": 4866.939 }, { "epoch": 98.6923076923077, "num_input_tokens_seen": 5094448, "step": 1283, "train_accuracy": 0.021484375 }, { "epoch": 98.76923076923077, "grad_norm": 0.4565328359603882, "learning_rate": 0.01, "loss": 4.486786842346191, "num_input_tokens_seen": 5098544, "step": 1284, "train_runtime": 1047.5621, "train_tokens_per_second": 4867.057 }, { "epoch": 98.76923076923077, "num_input_tokens_seen": 5098544, "step": 1284, "train_accuracy": 0.015625 }, { "epoch": 98.84615384615384, "grad_norm": 0.5800324082374573, "learning_rate": 0.01, "loss": 4.52537727355957, "num_input_tokens_seen": 5102640, "step": 1285, "train_runtime": 1048.3791, "train_tokens_per_second": 4867.171 }, { "epoch": 98.84615384615384, "num_input_tokens_seen": 5102640, "step": 1285, "train_accuracy": 0.0234375 }, { "epoch": 98.92307692307692, "grad_norm": 3.7269937992095947, "learning_rate": 0.01, "loss": 4.4630842208862305, "num_input_tokens_seen": 5106736, "step": 1286, "train_runtime": 1049.1917, "train_tokens_per_second": 4867.305 }, { "epoch": 98.92307692307692, "num_input_tokens_seen": 5106736, "step": 1286, "train_accuracy": 0.019543973729014397 }, { "epoch": 99.0, "grad_norm": 12.668912887573242, "learning_rate": 0.01, "loss": 4.502503395080566, "num_input_tokens_seen": 5109192, "step": 1287, "train_runtime": 1049.7089, "train_tokens_per_second": 4867.247 }, { "epoch": 99.0, "num_input_tokens_seen": 5109192, "step": 1287, "train_accuracy": 0.015625 }, { "epoch": 99.07692307692308, "grad_norm": 0.6205081343650818, "learning_rate": 0.01, "loss": 4.450595855712891, "num_input_tokens_seen": 5113288, "step": 1288, "train_runtime": 1050.5416, "train_tokens_per_second": 4867.288 }, { "epoch": 99.07692307692308, "num_input_tokens_seen": 5113288, "step": 1288, "train_accuracy": 0.021484375 }, { "epoch": 99.15384615384616, "grad_norm": 0.45831891894340515, "learning_rate": 0.01, "loss": 4.471729755401611, "num_input_tokens_seen": 5117384, "step": 1289, "train_runtime": 1051.3585, "train_tokens_per_second": 4867.402 }, { "epoch": 99.15384615384616, "num_input_tokens_seen": 5117384, "step": 1289, "train_accuracy": 0.025390625 }, { "epoch": 99.23076923076923, "grad_norm": 0.5405982136726379, "learning_rate": 0.01, "loss": 4.478852272033691, "num_input_tokens_seen": 5121480, "step": 1290, "train_runtime": 1052.1749, "train_tokens_per_second": 4867.518 }, { "epoch": 99.23076923076923, "num_input_tokens_seen": 5121480, "step": 1290, "train_accuracy": 0.02734375 }, { "epoch": 99.3076923076923, "grad_norm": 0.46504953503608704, "learning_rate": 0.01, "loss": 4.49061393737793, "num_input_tokens_seen": 5125576, "step": 1291, "train_runtime": 1052.9918, "train_tokens_per_second": 4867.631 }, { "epoch": 99.3076923076923, "num_input_tokens_seen": 5125576, "step": 1291, "train_accuracy": 0.0234375 }, { "epoch": 99.38461538461539, "grad_norm": 1.3747881650924683, "learning_rate": 0.01, "loss": 4.48637580871582, "num_input_tokens_seen": 5129672, "step": 1292, "train_runtime": 1053.8107, "train_tokens_per_second": 4867.736 }, { "epoch": 99.38461538461539, "num_input_tokens_seen": 5129672, "step": 1292, "train_accuracy": 0.01953125 }, { "epoch": 99.46153846153847, "grad_norm": 1.103324294090271, "learning_rate": 0.01, "loss": 4.496672630310059, "num_input_tokens_seen": 5133768, "step": 1293, "train_runtime": 1054.6266, "train_tokens_per_second": 4867.854 }, { "epoch": 99.46153846153847, "num_input_tokens_seen": 5133768, "step": 1293, "train_accuracy": 0.013671875 }, { "epoch": 99.53846153846153, "grad_norm": 1.8743489980697632, "learning_rate": 0.01, "loss": 4.473363876342773, "num_input_tokens_seen": 5137864, "step": 1294, "train_runtime": 1055.4449, "train_tokens_per_second": 4867.96 }, { "epoch": 99.53846153846153, "num_input_tokens_seen": 5137864, "step": 1294, "train_accuracy": 0.0078125 }, { "epoch": 99.61538461538461, "grad_norm": 0.6432539224624634, "learning_rate": 0.01, "loss": 4.562296390533447, "num_input_tokens_seen": 5141960, "step": 1295, "train_runtime": 1056.265, "train_tokens_per_second": 4868.059 }, { "epoch": 99.61538461538461, "num_input_tokens_seen": 5141960, "step": 1295, "train_accuracy": 0.0234375 }, { "epoch": 99.6923076923077, "grad_norm": 2.6819510459899902, "learning_rate": 0.01, "loss": 4.490937232971191, "num_input_tokens_seen": 5146056, "step": 1296, "train_runtime": 1057.0814, "train_tokens_per_second": 4868.174 }, { "epoch": 99.6923076923077, "num_input_tokens_seen": 5146056, "step": 1296, "train_accuracy": 0.013671875 }, { "epoch": 99.76923076923077, "grad_norm": 0.6963559985160828, "learning_rate": 0.01, "loss": 4.513890266418457, "num_input_tokens_seen": 5150152, "step": 1297, "train_runtime": 1057.8976, "train_tokens_per_second": 4868.29 }, { "epoch": 99.76923076923077, "num_input_tokens_seen": 5150152, "step": 1297, "train_accuracy": 0.009765625 }, { "epoch": 99.84615384615384, "grad_norm": 0.3832263946533203, "learning_rate": 0.01, "loss": 4.526019096374512, "num_input_tokens_seen": 5154248, "step": 1298, "train_runtime": 1058.7143, "train_tokens_per_second": 4868.403 }, { "epoch": 99.84615384615384, "num_input_tokens_seen": 5154248, "step": 1298, "train_accuracy": 0.0234375 }, { "epoch": 99.92307692307692, "grad_norm": 2.4339518547058105, "learning_rate": 0.01, "loss": 4.52780818939209, "num_input_tokens_seen": 5158344, "step": 1299, "train_runtime": 1059.5272, "train_tokens_per_second": 4868.534 }, { "epoch": 99.92307692307692, "num_input_tokens_seen": 5158344, "step": 1299, "train_accuracy": 0.016286645084619522 }, { "epoch": 100.0, "grad_norm": 1.640897512435913, "learning_rate": 0.01, "loss": 4.473927021026611, "num_input_tokens_seen": 5160800, "step": 1300, "train_runtime": 1060.0452, "train_tokens_per_second": 4868.472 }, { "epoch": 100.0, "eval_CMD_3_branch_eval_accuracy": 0.012296564195298372, "eval_CMD_3_branch_eval_loss": 4.5511088371276855, "eval_CMD_3_branch_eval_runtime": 1.1574, "eval_CMD_3_branch_eval_samples_per_second": 2389.023, "eval_CMD_3_branch_eval_steps_per_second": 5.184, "num_input_tokens_seen": 5160800, "step": 1300 }, { "epoch": 100.0, "num_input_tokens_seen": 5160800, "step": 1300, "train_accuracy": 0.01171875 }, { "epoch": 100.07692307692308, "grad_norm": 0.892929196357727, "learning_rate": 0.01, "loss": 4.47678279876709, "num_input_tokens_seen": 5164896, "step": 1301, "train_runtime": 1062.035, "train_tokens_per_second": 4863.207 }, { "epoch": 100.07692307692308, "num_input_tokens_seen": 5164896, "step": 1301, "train_accuracy": 0.0234375 }, { "epoch": 100.15384615384616, "grad_norm": 0.2669127583503723, "learning_rate": 0.01, "loss": 4.469684600830078, "num_input_tokens_seen": 5168992, "step": 1302, "train_runtime": 1062.8533, "train_tokens_per_second": 4863.316 }, { "epoch": 100.15384615384616, "num_input_tokens_seen": 5168992, "step": 1302, "train_accuracy": 0.013671875 }, { "epoch": 100.23076923076923, "grad_norm": 0.6381169557571411, "learning_rate": 0.01, "loss": 4.53653621673584, "num_input_tokens_seen": 5173088, "step": 1303, "train_runtime": 1063.67, "train_tokens_per_second": 4863.433 }, { "epoch": 100.23076923076923, "num_input_tokens_seen": 5173088, "step": 1303, "train_accuracy": 0.025390625 }, { "epoch": 100.3076923076923, "grad_norm": 0.6963146328926086, "learning_rate": 0.01, "loss": 4.516428470611572, "num_input_tokens_seen": 5177184, "step": 1304, "train_runtime": 1064.4852, "train_tokens_per_second": 4863.557 }, { "epoch": 100.3076923076923, "num_input_tokens_seen": 5177184, "step": 1304, "train_accuracy": 0.01171875 }, { "epoch": 100.38461538461539, "grad_norm": 0.42733877897262573, "learning_rate": 0.01, "loss": 4.487287521362305, "num_input_tokens_seen": 5181280, "step": 1305, "train_runtime": 1065.3018, "train_tokens_per_second": 4863.673 }, { "epoch": 100.38461538461539, "num_input_tokens_seen": 5181280, "step": 1305, "train_accuracy": 0.021484375 }, { "epoch": 100.46153846153847, "grad_norm": 0.500443160533905, "learning_rate": 0.01, "loss": 4.478186130523682, "num_input_tokens_seen": 5185376, "step": 1306, "train_runtime": 1066.1183, "train_tokens_per_second": 4863.79 }, { "epoch": 100.46153846153847, "num_input_tokens_seen": 5185376, "step": 1306, "train_accuracy": 0.013671875 }, { "epoch": 100.53846153846153, "grad_norm": 1.2631031274795532, "learning_rate": 0.01, "loss": 4.496086597442627, "num_input_tokens_seen": 5189472, "step": 1307, "train_runtime": 1066.935, "train_tokens_per_second": 4863.906 }, { "epoch": 100.53846153846153, "num_input_tokens_seen": 5189472, "step": 1307, "train_accuracy": 0.017578125 }, { "epoch": 100.61538461538461, "grad_norm": 0.4480014443397522, "learning_rate": 0.01, "loss": 4.502488136291504, "num_input_tokens_seen": 5193568, "step": 1308, "train_runtime": 1067.751, "train_tokens_per_second": 4864.026 }, { "epoch": 100.61538461538461, "num_input_tokens_seen": 5193568, "step": 1308, "train_accuracy": 0.02734375 }, { "epoch": 100.6923076923077, "grad_norm": 0.9957578778266907, "learning_rate": 0.01, "loss": 4.496293544769287, "num_input_tokens_seen": 5197664, "step": 1309, "train_runtime": 1068.568, "train_tokens_per_second": 4864.14 }, { "epoch": 100.6923076923077, "num_input_tokens_seen": 5197664, "step": 1309, "train_accuracy": 0.01171875 }, { "epoch": 100.76923076923077, "grad_norm": 0.6487727761268616, "learning_rate": 0.01, "loss": 4.521688461303711, "num_input_tokens_seen": 5201760, "step": 1310, "train_runtime": 1069.3839, "train_tokens_per_second": 4864.259 }, { "epoch": 100.76923076923077, "num_input_tokens_seen": 5201760, "step": 1310, "train_accuracy": 0.013671875 }, { "epoch": 100.84615384615384, "grad_norm": 0.38405242562294006, "learning_rate": 0.01, "loss": 4.537778854370117, "num_input_tokens_seen": 5205856, "step": 1311, "train_runtime": 1070.2009, "train_tokens_per_second": 4864.373 }, { "epoch": 100.84615384615384, "num_input_tokens_seen": 5205856, "step": 1311, "train_accuracy": 0.025390625 }, { "epoch": 100.92307692307692, "grad_norm": 0.465504914522171, "learning_rate": 0.01, "loss": 4.50172233581543, "num_input_tokens_seen": 5209952, "step": 1312, "train_runtime": 1071.0125, "train_tokens_per_second": 4864.511 }, { "epoch": 100.92307692307692, "num_input_tokens_seen": 5209952, "step": 1312, "train_accuracy": 0.013029315508902073 }, { "epoch": 101.0, "grad_norm": 0.4227706491947174, "learning_rate": 0.01, "loss": 4.505374431610107, "num_input_tokens_seen": 5212408, "step": 1313, "train_runtime": 1071.5284, "train_tokens_per_second": 4864.461 }, { "epoch": 101.0, "num_input_tokens_seen": 5212408, "step": 1313, "train_accuracy": 0.01171875 }, { "epoch": 101.07692307692308, "grad_norm": 0.5651357173919678, "learning_rate": 0.01, "loss": 4.4439520835876465, "num_input_tokens_seen": 5216504, "step": 1314, "train_runtime": 1072.3567, "train_tokens_per_second": 4864.523 }, { "epoch": 101.07692307692308, "num_input_tokens_seen": 5216504, "step": 1314, "train_accuracy": 0.021484375 }, { "epoch": 101.15384615384616, "grad_norm": 0.5506910085678101, "learning_rate": 0.01, "loss": 4.473283767700195, "num_input_tokens_seen": 5220600, "step": 1315, "train_runtime": 1073.1745, "train_tokens_per_second": 4864.633 }, { "epoch": 101.15384615384616, "num_input_tokens_seen": 5220600, "step": 1315, "train_accuracy": 0.0078125 }, { "epoch": 101.23076923076923, "grad_norm": 2.351944923400879, "learning_rate": 0.01, "loss": 4.432819366455078, "num_input_tokens_seen": 5224696, "step": 1316, "train_runtime": 1073.9905, "train_tokens_per_second": 4864.751 }, { "epoch": 101.23076923076923, "num_input_tokens_seen": 5224696, "step": 1316, "train_accuracy": 0.021484375 }, { "epoch": 101.3076923076923, "grad_norm": 1.3694813251495361, "learning_rate": 0.01, "loss": 4.481587886810303, "num_input_tokens_seen": 5228792, "step": 1317, "train_runtime": 1074.8067, "train_tokens_per_second": 4864.867 }, { "epoch": 101.3076923076923, "num_input_tokens_seen": 5228792, "step": 1317, "train_accuracy": 0.017578125 }, { "epoch": 101.38461538461539, "grad_norm": 0.8915128707885742, "learning_rate": 0.01, "loss": 4.507000923156738, "num_input_tokens_seen": 5232888, "step": 1318, "train_runtime": 1075.623, "train_tokens_per_second": 4864.983 }, { "epoch": 101.38461538461539, "num_input_tokens_seen": 5232888, "step": 1318, "train_accuracy": 0.013671875 }, { "epoch": 101.46153846153847, "grad_norm": 0.43306732177734375, "learning_rate": 0.01, "loss": 4.518030643463135, "num_input_tokens_seen": 5236984, "step": 1319, "train_runtime": 1076.4391, "train_tokens_per_second": 4865.1 }, { "epoch": 101.46153846153847, "num_input_tokens_seen": 5236984, "step": 1319, "train_accuracy": 0.029296875 }, { "epoch": 101.53846153846153, "grad_norm": 0.8570546507835388, "learning_rate": 0.01, "loss": 4.507914066314697, "num_input_tokens_seen": 5241080, "step": 1320, "train_runtime": 1077.257, "train_tokens_per_second": 4865.209 }, { "epoch": 101.53846153846153, "num_input_tokens_seen": 5241080, "step": 1320, "train_accuracy": 0.025390625 }, { "epoch": 101.61538461538461, "grad_norm": 4.387678623199463, "learning_rate": 0.01, "loss": 4.4336137771606445, "num_input_tokens_seen": 5245176, "step": 1321, "train_runtime": 1078.0734, "train_tokens_per_second": 4865.323 }, { "epoch": 101.61538461538461, "num_input_tokens_seen": 5245176, "step": 1321, "train_accuracy": 0.021484375 }, { "epoch": 101.6923076923077, "grad_norm": 0.5083701014518738, "learning_rate": 0.01, "loss": 4.486014366149902, "num_input_tokens_seen": 5249272, "step": 1322, "train_runtime": 1078.8906, "train_tokens_per_second": 4865.435 }, { "epoch": 101.6923076923077, "num_input_tokens_seen": 5249272, "step": 1322, "train_accuracy": 0.01953125 }, { "epoch": 101.76923076923077, "grad_norm": 0.6799424886703491, "learning_rate": 0.01, "loss": 4.509057998657227, "num_input_tokens_seen": 5253368, "step": 1323, "train_runtime": 1079.7068, "train_tokens_per_second": 4865.551 }, { "epoch": 101.76923076923077, "num_input_tokens_seen": 5253368, "step": 1323, "train_accuracy": 0.025390625 }, { "epoch": 101.84615384615384, "grad_norm": 0.2695162892341614, "learning_rate": 0.01, "loss": 4.512124061584473, "num_input_tokens_seen": 5257464, "step": 1324, "train_runtime": 1080.5231, "train_tokens_per_second": 4865.666 }, { "epoch": 101.84615384615384, "num_input_tokens_seen": 5257464, "step": 1324, "train_accuracy": 0.015625 }, { "epoch": 101.92307692307692, "grad_norm": 0.6636524796485901, "learning_rate": 0.01, "loss": 4.5006232261657715, "num_input_tokens_seen": 5261560, "step": 1325, "train_runtime": 1081.3348, "train_tokens_per_second": 4865.801 }, { "epoch": 101.92307692307692, "num_input_tokens_seen": 5261560, "step": 1325, "train_accuracy": 0.009771986864507198 }, { "epoch": 102.0, "grad_norm": 1.4672373533248901, "learning_rate": 0.01, "loss": 4.47036600112915, "num_input_tokens_seen": 5264016, "step": 1326, "train_runtime": 1081.8505, "train_tokens_per_second": 4865.752 }, { "epoch": 102.0, "num_input_tokens_seen": 5264016, "step": 1326, "train_accuracy": 0.04296875 }, { "epoch": 102.07692307692308, "grad_norm": 0.7811271548271179, "learning_rate": 0.01, "loss": 4.485345840454102, "num_input_tokens_seen": 5268112, "step": 1327, "train_runtime": 1082.6787, "train_tokens_per_second": 4865.813 }, { "epoch": 102.07692307692308, "num_input_tokens_seen": 5268112, "step": 1327, "train_accuracy": 0.025390625 }, { "epoch": 102.15384615384616, "grad_norm": 1.2522523403167725, "learning_rate": 0.01, "loss": 4.4972944259643555, "num_input_tokens_seen": 5272208, "step": 1328, "train_runtime": 1083.4943, "train_tokens_per_second": 4865.93 }, { "epoch": 102.15384615384616, "num_input_tokens_seen": 5272208, "step": 1328, "train_accuracy": 0.02734375 }, { "epoch": 102.23076923076923, "grad_norm": 0.5090000629425049, "learning_rate": 0.01, "loss": 4.478704452514648, "num_input_tokens_seen": 5276304, "step": 1329, "train_runtime": 1084.3101, "train_tokens_per_second": 4866.047 }, { "epoch": 102.23076923076923, "num_input_tokens_seen": 5276304, "step": 1329, "train_accuracy": 0.015625 }, { "epoch": 102.3076923076923, "grad_norm": 1.3681564331054688, "learning_rate": 0.01, "loss": 4.505438804626465, "num_input_tokens_seen": 5280400, "step": 1330, "train_runtime": 1085.126, "train_tokens_per_second": 4866.163 }, { "epoch": 102.3076923076923, "num_input_tokens_seen": 5280400, "step": 1330, "train_accuracy": 0.01953125 }, { "epoch": 102.38461538461539, "grad_norm": 0.4047395586967468, "learning_rate": 0.01, "loss": 4.525785446166992, "num_input_tokens_seen": 5284496, "step": 1331, "train_runtime": 1085.9414, "train_tokens_per_second": 4866.281 }, { "epoch": 102.38461538461539, "num_input_tokens_seen": 5284496, "step": 1331, "train_accuracy": 0.01171875 }, { "epoch": 102.46153846153847, "grad_norm": 0.3903910517692566, "learning_rate": 0.01, "loss": 4.525243759155273, "num_input_tokens_seen": 5288592, "step": 1332, "train_runtime": 1086.7583, "train_tokens_per_second": 4866.392 }, { "epoch": 102.46153846153847, "num_input_tokens_seen": 5288592, "step": 1332, "train_accuracy": 0.0078125 }, { "epoch": 102.53846153846153, "grad_norm": 0.5233359336853027, "learning_rate": 0.01, "loss": 4.5092363357543945, "num_input_tokens_seen": 5292688, "step": 1333, "train_runtime": 1087.5731, "train_tokens_per_second": 4866.512 }, { "epoch": 102.53846153846153, "num_input_tokens_seen": 5292688, "step": 1333, "train_accuracy": 0.02734375 }, { "epoch": 102.61538461538461, "grad_norm": 0.8171457648277283, "learning_rate": 0.01, "loss": 4.50815486907959, "num_input_tokens_seen": 5296784, "step": 1334, "train_runtime": 1088.3892, "train_tokens_per_second": 4866.627 }, { "epoch": 102.61538461538461, "num_input_tokens_seen": 5296784, "step": 1334, "train_accuracy": 0.01171875 }, { "epoch": 102.6923076923077, "grad_norm": 0.47790205478668213, "learning_rate": 0.01, "loss": 4.499876976013184, "num_input_tokens_seen": 5300880, "step": 1335, "train_runtime": 1089.2054, "train_tokens_per_second": 4866.74 }, { "epoch": 102.6923076923077, "num_input_tokens_seen": 5300880, "step": 1335, "train_accuracy": 0.01953125 }, { "epoch": 102.76923076923077, "grad_norm": 0.4069991111755371, "learning_rate": 0.01, "loss": 4.518918991088867, "num_input_tokens_seen": 5304976, "step": 1336, "train_runtime": 1090.0216, "train_tokens_per_second": 4866.854 }, { "epoch": 102.76923076923077, "num_input_tokens_seen": 5304976, "step": 1336, "train_accuracy": 0.013671875 }, { "epoch": 102.84615384615384, "grad_norm": 0.507952094078064, "learning_rate": 0.01, "loss": 4.630908012390137, "num_input_tokens_seen": 5309072, "step": 1337, "train_runtime": 1090.8369, "train_tokens_per_second": 4866.971 }, { "epoch": 102.84615384615384, "num_input_tokens_seen": 5309072, "step": 1337, "train_accuracy": 0.01953125 }, { "epoch": 102.92307692307692, "grad_norm": 0.5505064129829407, "learning_rate": 0.01, "loss": 4.5251851081848145, "num_input_tokens_seen": 5313168, "step": 1338, "train_runtime": 1091.6491, "train_tokens_per_second": 4867.102 }, { "epoch": 102.92307692307692, "num_input_tokens_seen": 5313168, "step": 1338, "train_accuracy": 0.019543973729014397 }, { "epoch": 103.0, "grad_norm": 1.5184812545776367, "learning_rate": 0.01, "loss": 4.507806777954102, "num_input_tokens_seen": 5315624, "step": 1339, "train_runtime": 1092.1656, "train_tokens_per_second": 4867.049 }, { "epoch": 103.0, "num_input_tokens_seen": 5315624, "step": 1339, "train_accuracy": 0.01953125 }, { "epoch": 103.07692307692308, "grad_norm": 0.5381852984428406, "learning_rate": 0.01, "loss": 4.502768516540527, "num_input_tokens_seen": 5319720, "step": 1340, "train_runtime": 1092.9927, "train_tokens_per_second": 4867.114 }, { "epoch": 103.07692307692308, "num_input_tokens_seen": 5319720, "step": 1340, "train_accuracy": 0.0234375 }, { "epoch": 103.15384615384616, "grad_norm": 1.031249761581421, "learning_rate": 0.01, "loss": 4.466507911682129, "num_input_tokens_seen": 5323816, "step": 1341, "train_runtime": 1093.8079, "train_tokens_per_second": 4867.231 }, { "epoch": 103.15384615384616, "num_input_tokens_seen": 5323816, "step": 1341, "train_accuracy": 0.013671875 }, { "epoch": 103.23076923076923, "grad_norm": 0.4926789402961731, "learning_rate": 0.01, "loss": 4.506186485290527, "num_input_tokens_seen": 5327912, "step": 1342, "train_runtime": 1094.6238, "train_tokens_per_second": 4867.345 }, { "epoch": 103.23076923076923, "num_input_tokens_seen": 5327912, "step": 1342, "train_accuracy": 0.017578125 }, { "epoch": 103.3076923076923, "grad_norm": 1.5908927917480469, "learning_rate": 0.01, "loss": 4.501346588134766, "num_input_tokens_seen": 5332008, "step": 1343, "train_runtime": 1095.4394, "train_tokens_per_second": 4867.461 }, { "epoch": 103.3076923076923, "num_input_tokens_seen": 5332008, "step": 1343, "train_accuracy": 0.01171875 }, { "epoch": 103.38461538461539, "grad_norm": 1.313116431236267, "learning_rate": 0.01, "loss": 4.512948036193848, "num_input_tokens_seen": 5336104, "step": 1344, "train_runtime": 1096.2558, "train_tokens_per_second": 4867.572 }, { "epoch": 103.38461538461539, "num_input_tokens_seen": 5336104, "step": 1344, "train_accuracy": 0.017578125 }, { "epoch": 103.46153846153847, "grad_norm": 0.5012454986572266, "learning_rate": 0.01, "loss": 4.510312080383301, "num_input_tokens_seen": 5340200, "step": 1345, "train_runtime": 1097.0737, "train_tokens_per_second": 4867.677 }, { "epoch": 103.46153846153847, "num_input_tokens_seen": 5340200, "step": 1345, "train_accuracy": 0.0234375 }, { "epoch": 103.53846153846153, "grad_norm": 0.806168258190155, "learning_rate": 0.01, "loss": 4.508563995361328, "num_input_tokens_seen": 5344296, "step": 1346, "train_runtime": 1097.8883, "train_tokens_per_second": 4867.796 }, { "epoch": 103.53846153846153, "num_input_tokens_seen": 5344296, "step": 1346, "train_accuracy": 0.017578125 }, { "epoch": 103.61538461538461, "grad_norm": 0.4300622045993805, "learning_rate": 0.01, "loss": 4.521967887878418, "num_input_tokens_seen": 5348392, "step": 1347, "train_runtime": 1098.7041, "train_tokens_per_second": 4867.909 }, { "epoch": 103.61538461538461, "num_input_tokens_seen": 5348392, "step": 1347, "train_accuracy": 0.013671875 }, { "epoch": 103.6923076923077, "grad_norm": 0.5178453326225281, "learning_rate": 0.01, "loss": 4.544081687927246, "num_input_tokens_seen": 5352488, "step": 1348, "train_runtime": 1099.5192, "train_tokens_per_second": 4868.026 }, { "epoch": 103.6923076923077, "num_input_tokens_seen": 5352488, "step": 1348, "train_accuracy": 0.013671875 }, { "epoch": 103.76923076923077, "grad_norm": 0.5010653734207153, "learning_rate": 0.01, "loss": 4.522707939147949, "num_input_tokens_seen": 5356584, "step": 1349, "train_runtime": 1100.3345, "train_tokens_per_second": 4868.141 }, { "epoch": 103.76923076923077, "num_input_tokens_seen": 5356584, "step": 1349, "train_accuracy": 0.015625 }, { "epoch": 103.84615384615384, "grad_norm": 0.40772804617881775, "learning_rate": 0.01, "loss": 4.531052589416504, "num_input_tokens_seen": 5360680, "step": 1350, "train_runtime": 1101.1514, "train_tokens_per_second": 4868.25 }, { "epoch": 103.84615384615384, "num_input_tokens_seen": 5360680, "step": 1350, "train_accuracy": 0.021484375 }, { "epoch": 103.92307692307692, "grad_norm": 1.338511347770691, "learning_rate": 0.01, "loss": 4.557485580444336, "num_input_tokens_seen": 5364776, "step": 1351, "train_runtime": 1101.9631, "train_tokens_per_second": 4868.381 }, { "epoch": 103.92307692307692, "num_input_tokens_seen": 5364776, "step": 1351, "train_accuracy": 0.013029315508902073 }, { "epoch": 104.0, "grad_norm": 1.1316109895706177, "learning_rate": 0.01, "loss": 4.522695541381836, "num_input_tokens_seen": 5367232, "step": 1352, "train_runtime": 1102.4797, "train_tokens_per_second": 4868.327 }, { "epoch": 104.0, "num_input_tokens_seen": 5367232, "step": 1352, "train_accuracy": 0.021484375 }, { "epoch": 104.07692307692308, "grad_norm": 0.2996485233306885, "learning_rate": 0.01, "loss": 4.48882532119751, "num_input_tokens_seen": 5371328, "step": 1353, "train_runtime": 1103.3075, "train_tokens_per_second": 4868.387 }, { "epoch": 104.07692307692308, "num_input_tokens_seen": 5371328, "step": 1353, "train_accuracy": 0.021484375 }, { "epoch": 104.15384615384616, "grad_norm": 1.3333604335784912, "learning_rate": 0.01, "loss": 4.502570629119873, "num_input_tokens_seen": 5375424, "step": 1354, "train_runtime": 1104.1237, "train_tokens_per_second": 4868.498 }, { "epoch": 104.15384615384616, "num_input_tokens_seen": 5375424, "step": 1354, "train_accuracy": 0.015625 }, { "epoch": 104.23076923076923, "grad_norm": 0.4529602527618408, "learning_rate": 0.01, "loss": 4.515133857727051, "num_input_tokens_seen": 5379520, "step": 1355, "train_runtime": 1104.9438, "train_tokens_per_second": 4868.592 }, { "epoch": 104.23076923076923, "num_input_tokens_seen": 5379520, "step": 1355, "train_accuracy": 0.021484375 }, { "epoch": 104.3076923076923, "grad_norm": 0.45579686760902405, "learning_rate": 0.01, "loss": 4.46575927734375, "num_input_tokens_seen": 5383616, "step": 1356, "train_runtime": 1105.7616, "train_tokens_per_second": 4868.695 }, { "epoch": 104.3076923076923, "num_input_tokens_seen": 5383616, "step": 1356, "train_accuracy": 0.025390625 }, { "epoch": 104.38461538461539, "grad_norm": 0.5557273030281067, "learning_rate": 0.01, "loss": 4.466312408447266, "num_input_tokens_seen": 5387712, "step": 1357, "train_runtime": 1106.5764, "train_tokens_per_second": 4868.812 }, { "epoch": 104.38461538461539, "num_input_tokens_seen": 5387712, "step": 1357, "train_accuracy": 0.015625 }, { "epoch": 104.46153846153847, "grad_norm": 0.46682295203208923, "learning_rate": 0.01, "loss": 4.481467247009277, "num_input_tokens_seen": 5391808, "step": 1358, "train_runtime": 1107.3915, "train_tokens_per_second": 4868.927 }, { "epoch": 104.46153846153847, "num_input_tokens_seen": 5391808, "step": 1358, "train_accuracy": 0.01171875 }, { "epoch": 104.53846153846153, "grad_norm": 0.6216288208961487, "learning_rate": 0.01, "loss": 4.555716037750244, "num_input_tokens_seen": 5395904, "step": 1359, "train_runtime": 1108.2062, "train_tokens_per_second": 4869.043 }, { "epoch": 104.53846153846153, "num_input_tokens_seen": 5395904, "step": 1359, "train_accuracy": 0.025390625 }, { "epoch": 104.61538461538461, "grad_norm": 0.5530970692634583, "learning_rate": 0.01, "loss": 4.535384178161621, "num_input_tokens_seen": 5400000, "step": 1360, "train_runtime": 1109.0219, "train_tokens_per_second": 4869.156 }, { "epoch": 104.61538461538461, "num_input_tokens_seen": 5400000, "step": 1360, "train_accuracy": 0.017578125 }, { "epoch": 104.6923076923077, "grad_norm": 0.2619735300540924, "learning_rate": 0.01, "loss": 4.543535232543945, "num_input_tokens_seen": 5404096, "step": 1361, "train_runtime": 1109.8376, "train_tokens_per_second": 4869.267 }, { "epoch": 104.6923076923077, "num_input_tokens_seen": 5404096, "step": 1361, "train_accuracy": 0.015625 }, { "epoch": 104.76923076923077, "grad_norm": 1.2103418111801147, "learning_rate": 0.01, "loss": 4.506714820861816, "num_input_tokens_seen": 5408192, "step": 1362, "train_runtime": 1110.6543, "train_tokens_per_second": 4869.375 }, { "epoch": 104.76923076923077, "num_input_tokens_seen": 5408192, "step": 1362, "train_accuracy": 0.013671875 }, { "epoch": 104.84615384615384, "grad_norm": 0.7848754525184631, "learning_rate": 0.01, "loss": 4.537437438964844, "num_input_tokens_seen": 5412288, "step": 1363, "train_runtime": 1111.4723, "train_tokens_per_second": 4869.476 }, { "epoch": 104.84615384615384, "num_input_tokens_seen": 5412288, "step": 1363, "train_accuracy": 0.015625 }, { "epoch": 104.92307692307692, "grad_norm": 1.4974429607391357, "learning_rate": 0.01, "loss": 4.492596626281738, "num_input_tokens_seen": 5416384, "step": 1364, "train_runtime": 1112.2834, "train_tokens_per_second": 4869.608 }, { "epoch": 104.92307692307692, "num_input_tokens_seen": 5416384, "step": 1364, "train_accuracy": 0.0032573288772255182 }, { "epoch": 105.0, "grad_norm": 0.6197435259819031, "learning_rate": 0.01, "loss": 4.542846202850342, "num_input_tokens_seen": 5418840, "step": 1365, "train_runtime": 1112.7997, "train_tokens_per_second": 4869.556 }, { "epoch": 105.0, "num_input_tokens_seen": 5418840, "step": 1365, "train_accuracy": 0.01953125 }, { "epoch": 105.07692307692308, "grad_norm": 5.34373140335083, "learning_rate": 0.01, "loss": 4.490141868591309, "num_input_tokens_seen": 5422936, "step": 1366, "train_runtime": 1113.6259, "train_tokens_per_second": 4869.621 }, { "epoch": 105.07692307692308, "num_input_tokens_seen": 5422936, "step": 1366, "train_accuracy": 0.021484375 }, { "epoch": 105.15384615384616, "grad_norm": 1.6519452333450317, "learning_rate": 0.01, "loss": 4.50926399230957, "num_input_tokens_seen": 5427032, "step": 1367, "train_runtime": 1114.4419, "train_tokens_per_second": 4869.731 }, { "epoch": 105.15384615384616, "num_input_tokens_seen": 5427032, "step": 1367, "train_accuracy": 0.021484375 }, { "epoch": 105.23076923076923, "grad_norm": 1.499245524406433, "learning_rate": 0.01, "loss": 4.476587295532227, "num_input_tokens_seen": 5431128, "step": 1368, "train_runtime": 1115.2575, "train_tokens_per_second": 4869.842 }, { "epoch": 105.23076923076923, "num_input_tokens_seen": 5431128, "step": 1368, "train_accuracy": 0.01171875 }, { "epoch": 105.3076923076923, "grad_norm": 0.3605392575263977, "learning_rate": 0.01, "loss": 4.499443054199219, "num_input_tokens_seen": 5435224, "step": 1369, "train_runtime": 1116.0729, "train_tokens_per_second": 4869.954 }, { "epoch": 105.3076923076923, "num_input_tokens_seen": 5435224, "step": 1369, "train_accuracy": 0.017578125 }, { "epoch": 105.38461538461539, "grad_norm": 0.5438734292984009, "learning_rate": 0.01, "loss": 4.489776611328125, "num_input_tokens_seen": 5439320, "step": 1370, "train_runtime": 1116.8867, "train_tokens_per_second": 4870.073 }, { "epoch": 105.38461538461539, "num_input_tokens_seen": 5439320, "step": 1370, "train_accuracy": 0.015625 }, { "epoch": 105.46153846153847, "grad_norm": 0.3976382613182068, "learning_rate": 0.01, "loss": 4.520956993103027, "num_input_tokens_seen": 5443416, "step": 1371, "train_runtime": 1117.7014, "train_tokens_per_second": 4870.188 }, { "epoch": 105.46153846153847, "num_input_tokens_seen": 5443416, "step": 1371, "train_accuracy": 0.025390625 }, { "epoch": 105.53846153846153, "grad_norm": 0.591706395149231, "learning_rate": 0.01, "loss": 4.4757585525512695, "num_input_tokens_seen": 5447512, "step": 1372, "train_runtime": 1118.5156, "train_tokens_per_second": 4870.305 }, { "epoch": 105.53846153846153, "num_input_tokens_seen": 5447512, "step": 1372, "train_accuracy": 0.021484375 }, { "epoch": 105.61538461538461, "grad_norm": 0.7065641283988953, "learning_rate": 0.01, "loss": 4.515710830688477, "num_input_tokens_seen": 5451608, "step": 1373, "train_runtime": 1119.3306, "train_tokens_per_second": 4870.418 }, { "epoch": 105.61538461538461, "num_input_tokens_seen": 5451608, "step": 1373, "train_accuracy": 0.017578125 }, { "epoch": 105.6923076923077, "grad_norm": 0.2678771913051605, "learning_rate": 0.01, "loss": 4.480876922607422, "num_input_tokens_seen": 5455704, "step": 1374, "train_runtime": 1120.145, "train_tokens_per_second": 4870.534 }, { "epoch": 105.6923076923077, "num_input_tokens_seen": 5455704, "step": 1374, "train_accuracy": 0.017578125 }, { "epoch": 105.76923076923077, "grad_norm": 0.9524516463279724, "learning_rate": 0.01, "loss": 4.506048202514648, "num_input_tokens_seen": 5459800, "step": 1375, "train_runtime": 1120.9612, "train_tokens_per_second": 4870.641 }, { "epoch": 105.76923076923077, "num_input_tokens_seen": 5459800, "step": 1375, "train_accuracy": 0.021484375 }, { "epoch": 105.84615384615384, "grad_norm": 1.7505069971084595, "learning_rate": 0.01, "loss": 4.470991611480713, "num_input_tokens_seen": 5463896, "step": 1376, "train_runtime": 1121.7753, "train_tokens_per_second": 4870.758 }, { "epoch": 105.84615384615384, "num_input_tokens_seen": 5463896, "step": 1376, "train_accuracy": 0.013671875 }, { "epoch": 105.92307692307692, "grad_norm": 3.8635685443878174, "learning_rate": 0.01, "loss": 4.509904861450195, "num_input_tokens_seen": 5467992, "step": 1377, "train_runtime": 1122.5855, "train_tokens_per_second": 4870.892 }, { "epoch": 105.92307692307692, "num_input_tokens_seen": 5467992, "step": 1377, "train_accuracy": 0.02280130237340927 }, { "epoch": 106.0, "grad_norm": 0.8702496290206909, "learning_rate": 0.01, "loss": 4.480625629425049, "num_input_tokens_seen": 5470448, "step": 1378, "train_runtime": 1123.1018, "train_tokens_per_second": 4870.839 }, { "epoch": 106.0, "num_input_tokens_seen": 5470448, "step": 1378, "train_accuracy": 0.021484375 }, { "epoch": 106.07692307692308, "grad_norm": 0.7744153141975403, "learning_rate": 0.01, "loss": 4.470782279968262, "num_input_tokens_seen": 5474544, "step": 1379, "train_runtime": 1123.9284, "train_tokens_per_second": 4870.901 }, { "epoch": 106.07692307692308, "num_input_tokens_seen": 5474544, "step": 1379, "train_accuracy": 0.017578125 }, { "epoch": 106.15384615384616, "grad_norm": 1.867272973060608, "learning_rate": 0.01, "loss": 4.535487174987793, "num_input_tokens_seen": 5478640, "step": 1380, "train_runtime": 1124.7423, "train_tokens_per_second": 4871.018 }, { "epoch": 106.15384615384616, "num_input_tokens_seen": 5478640, "step": 1380, "train_accuracy": 0.025390625 }, { "epoch": 106.23076923076923, "grad_norm": 0.63252854347229, "learning_rate": 0.01, "loss": 4.462093353271484, "num_input_tokens_seen": 5482736, "step": 1381, "train_runtime": 1125.5573, "train_tokens_per_second": 4871.13 }, { "epoch": 106.23076923076923, "num_input_tokens_seen": 5482736, "step": 1381, "train_accuracy": 0.013671875 }, { "epoch": 106.3076923076923, "grad_norm": 0.937783420085907, "learning_rate": 0.01, "loss": 4.492024898529053, "num_input_tokens_seen": 5486832, "step": 1382, "train_runtime": 1126.3719, "train_tokens_per_second": 4871.243 }, { "epoch": 106.3076923076923, "num_input_tokens_seen": 5486832, "step": 1382, "train_accuracy": 0.0234375 }, { "epoch": 106.38461538461539, "grad_norm": 0.43855607509613037, "learning_rate": 0.01, "loss": 4.493302822113037, "num_input_tokens_seen": 5490928, "step": 1383, "train_runtime": 1127.1865, "train_tokens_per_second": 4871.357 }, { "epoch": 106.38461538461539, "num_input_tokens_seen": 5490928, "step": 1383, "train_accuracy": 0.03125 }, { "epoch": 106.46153846153847, "grad_norm": 0.45569297671318054, "learning_rate": 0.01, "loss": 4.524416923522949, "num_input_tokens_seen": 5495024, "step": 1384, "train_runtime": 1128.0007, "train_tokens_per_second": 4871.472 }, { "epoch": 106.46153846153847, "num_input_tokens_seen": 5495024, "step": 1384, "train_accuracy": 0.015625 }, { "epoch": 106.53846153846153, "grad_norm": 1.6600298881530762, "learning_rate": 0.01, "loss": 4.5299072265625, "num_input_tokens_seen": 5499120, "step": 1385, "train_runtime": 1128.8157, "train_tokens_per_second": 4871.583 }, { "epoch": 106.53846153846153, "num_input_tokens_seen": 5499120, "step": 1385, "train_accuracy": 0.017578125 }, { "epoch": 106.61538461538461, "grad_norm": 1.8410983085632324, "learning_rate": 0.01, "loss": 4.5285539627075195, "num_input_tokens_seen": 5503216, "step": 1386, "train_runtime": 1129.6315, "train_tokens_per_second": 4871.691 }, { "epoch": 106.61538461538461, "num_input_tokens_seen": 5503216, "step": 1386, "train_accuracy": 0.01171875 }, { "epoch": 106.6923076923077, "grad_norm": 2.97233247756958, "learning_rate": 0.01, "loss": 4.5334272384643555, "num_input_tokens_seen": 5507312, "step": 1387, "train_runtime": 1130.4471, "train_tokens_per_second": 4871.8 }, { "epoch": 106.6923076923077, "num_input_tokens_seen": 5507312, "step": 1387, "train_accuracy": 0.013671875 }, { "epoch": 106.76923076923077, "grad_norm": 0.9362927675247192, "learning_rate": 0.01, "loss": 4.569294452667236, "num_input_tokens_seen": 5511408, "step": 1388, "train_runtime": 1131.2628, "train_tokens_per_second": 4871.908 }, { "epoch": 106.76923076923077, "num_input_tokens_seen": 5511408, "step": 1388, "train_accuracy": 0.015625 }, { "epoch": 106.84615384615384, "grad_norm": 0.379261314868927, "learning_rate": 0.01, "loss": 4.547344207763672, "num_input_tokens_seen": 5515504, "step": 1389, "train_runtime": 1132.0776, "train_tokens_per_second": 4872.019 }, { "epoch": 106.84615384615384, "num_input_tokens_seen": 5515504, "step": 1389, "train_accuracy": 0.0078125 }, { "epoch": 106.92307692307692, "grad_norm": 0.4333992600440979, "learning_rate": 0.01, "loss": 4.518441200256348, "num_input_tokens_seen": 5519600, "step": 1390, "train_runtime": 1132.8871, "train_tokens_per_second": 4872.154 }, { "epoch": 106.92307692307692, "num_input_tokens_seen": 5519600, "step": 1390, "train_accuracy": 0.016286645084619522 }, { "epoch": 107.0, "grad_norm": 1.052661418914795, "learning_rate": 0.01, "loss": 4.530174255371094, "num_input_tokens_seen": 5522056, "step": 1391, "train_runtime": 1133.4022, "train_tokens_per_second": 4872.106 }, { "epoch": 107.0, "num_input_tokens_seen": 5522056, "step": 1391, "train_accuracy": 0.01171875 }, { "epoch": 107.07692307692308, "grad_norm": 0.3952656686306, "learning_rate": 0.01, "loss": 4.527536392211914, "num_input_tokens_seen": 5526152, "step": 1392, "train_runtime": 1134.2269, "train_tokens_per_second": 4872.175 }, { "epoch": 107.07692307692308, "num_input_tokens_seen": 5526152, "step": 1392, "train_accuracy": 0.009765625 }, { "epoch": 107.15384615384616, "grad_norm": 0.43859216570854187, "learning_rate": 0.01, "loss": 4.522705554962158, "num_input_tokens_seen": 5530248, "step": 1393, "train_runtime": 1135.0413, "train_tokens_per_second": 4872.288 }, { "epoch": 107.15384615384616, "num_input_tokens_seen": 5530248, "step": 1393, "train_accuracy": 0.0078125 }, { "epoch": 107.23076923076923, "grad_norm": 0.5607250332832336, "learning_rate": 0.01, "loss": 4.516456604003906, "num_input_tokens_seen": 5534344, "step": 1394, "train_runtime": 1135.8572, "train_tokens_per_second": 4872.394 }, { "epoch": 107.23076923076923, "num_input_tokens_seen": 5534344, "step": 1394, "train_accuracy": 0.013671875 }, { "epoch": 107.3076923076923, "grad_norm": 0.3729170858860016, "learning_rate": 0.01, "loss": 4.525454998016357, "num_input_tokens_seen": 5538440, "step": 1395, "train_runtime": 1136.6725, "train_tokens_per_second": 4872.503 }, { "epoch": 107.3076923076923, "num_input_tokens_seen": 5538440, "step": 1395, "train_accuracy": 0.021484375 }, { "epoch": 107.38461538461539, "grad_norm": 0.334216445684433, "learning_rate": 0.01, "loss": 4.485908508300781, "num_input_tokens_seen": 5542536, "step": 1396, "train_runtime": 1137.4868, "train_tokens_per_second": 4872.616 }, { "epoch": 107.38461538461539, "num_input_tokens_seen": 5542536, "step": 1396, "train_accuracy": 0.021484375 }, { "epoch": 107.46153846153847, "grad_norm": 0.5450636744499207, "learning_rate": 0.01, "loss": 4.540503025054932, "num_input_tokens_seen": 5546632, "step": 1397, "train_runtime": 1138.3031, "train_tokens_per_second": 4872.72 }, { "epoch": 107.46153846153847, "num_input_tokens_seen": 5546632, "step": 1397, "train_accuracy": 0.01171875 }, { "epoch": 107.53846153846153, "grad_norm": 0.5269734859466553, "learning_rate": 0.01, "loss": 4.557070255279541, "num_input_tokens_seen": 5550728, "step": 1398, "train_runtime": 1139.118, "train_tokens_per_second": 4872.83 }, { "epoch": 107.53846153846153, "num_input_tokens_seen": 5550728, "step": 1398, "train_accuracy": 0.009765625 }, { "epoch": 107.61538461538461, "grad_norm": 0.5704514384269714, "learning_rate": 0.01, "loss": 4.560052871704102, "num_input_tokens_seen": 5554824, "step": 1399, "train_runtime": 1139.933, "train_tokens_per_second": 4872.939 }, { "epoch": 107.61538461538461, "num_input_tokens_seen": 5554824, "step": 1399, "train_accuracy": 0.025390625 }, { "epoch": 107.6923076923077, "grad_norm": 0.6849747896194458, "learning_rate": 0.01, "loss": 4.529512405395508, "num_input_tokens_seen": 5558920, "step": 1400, "train_runtime": 1140.7474, "train_tokens_per_second": 4873.051 }, { "epoch": 107.6923076923077, "eval_CMD_3_branch_eval_accuracy": 0.00976491862567812, "eval_CMD_3_branch_eval_loss": 4.564810276031494, "eval_CMD_3_branch_eval_runtime": 1.1518, "eval_CMD_3_branch_eval_samples_per_second": 2400.514, "eval_CMD_3_branch_eval_steps_per_second": 5.209, "num_input_tokens_seen": 5558920, "step": 1400 }, { "epoch": 107.6923076923077, "num_input_tokens_seen": 5558920, "step": 1400, "train_accuracy": 0.015625 }, { "epoch": 107.76923076923077, "grad_norm": 0.39933985471725464, "learning_rate": 0.01, "loss": 4.526744842529297, "num_input_tokens_seen": 5563016, "step": 1401, "train_runtime": 1142.7177, "train_tokens_per_second": 4868.233 }, { "epoch": 107.76923076923077, "num_input_tokens_seen": 5563016, "step": 1401, "train_accuracy": 0.01171875 }, { "epoch": 107.84615384615384, "grad_norm": 0.5478185415267944, "learning_rate": 0.01, "loss": 4.520236968994141, "num_input_tokens_seen": 5567112, "step": 1402, "train_runtime": 1143.5327, "train_tokens_per_second": 4868.345 }, { "epoch": 107.84615384615384, "num_input_tokens_seen": 5567112, "step": 1402, "train_accuracy": 0.015625 }, { "epoch": 107.92307692307692, "grad_norm": 0.36211809515953064, "learning_rate": 0.01, "loss": 4.5181403160095215, "num_input_tokens_seen": 5571208, "step": 1403, "train_runtime": 1144.3426, "train_tokens_per_second": 4868.479 }, { "epoch": 107.92307692307692, "num_input_tokens_seen": 5571208, "step": 1403, "train_accuracy": 0.009771986864507198 }, { "epoch": 108.0, "grad_norm": 0.6052718758583069, "learning_rate": 0.01, "loss": 4.526625633239746, "num_input_tokens_seen": 5573664, "step": 1404, "train_runtime": 1144.8593, "train_tokens_per_second": 4868.427 }, { "epoch": 108.0, "num_input_tokens_seen": 5573664, "step": 1404, "train_accuracy": 0.015625 }, { "epoch": 108.07692307692308, "grad_norm": 0.41202157735824585, "learning_rate": 0.01, "loss": 4.466943740844727, "num_input_tokens_seen": 5577760, "step": 1405, "train_runtime": 1145.687, "train_tokens_per_second": 4868.485 }, { "epoch": 108.07692307692308, "num_input_tokens_seen": 5577760, "step": 1405, "train_accuracy": 0.01171875 }, { "epoch": 108.15384615384616, "grad_norm": 0.4319964051246643, "learning_rate": 0.01, "loss": 4.516010284423828, "num_input_tokens_seen": 5581856, "step": 1406, "train_runtime": 1146.5027, "train_tokens_per_second": 4868.594 }, { "epoch": 108.15384615384616, "num_input_tokens_seen": 5581856, "step": 1406, "train_accuracy": 0.013671875 }, { "epoch": 108.23076923076923, "grad_norm": 0.34288203716278076, "learning_rate": 0.01, "loss": 4.507363796234131, "num_input_tokens_seen": 5585952, "step": 1407, "train_runtime": 1147.3191, "train_tokens_per_second": 4868.7 }, { "epoch": 108.23076923076923, "num_input_tokens_seen": 5585952, "step": 1407, "train_accuracy": 0.01953125 }, { "epoch": 108.3076923076923, "grad_norm": 0.7752683758735657, "learning_rate": 0.01, "loss": 4.497525215148926, "num_input_tokens_seen": 5590048, "step": 1408, "train_runtime": 1148.1337, "train_tokens_per_second": 4868.813 }, { "epoch": 108.3076923076923, "num_input_tokens_seen": 5590048, "step": 1408, "train_accuracy": 0.005859375 }, { "epoch": 108.38461538461539, "grad_norm": 1.1515727043151855, "learning_rate": 0.01, "loss": 4.53062105178833, "num_input_tokens_seen": 5594144, "step": 1409, "train_runtime": 1148.9479, "train_tokens_per_second": 4868.928 }, { "epoch": 108.38461538461539, "num_input_tokens_seen": 5594144, "step": 1409, "train_accuracy": 0.009765625 }, { "epoch": 108.46153846153847, "grad_norm": 0.6937203407287598, "learning_rate": 0.01, "loss": 4.519171237945557, "num_input_tokens_seen": 5598240, "step": 1410, "train_runtime": 1149.7623, "train_tokens_per_second": 4869.041 }, { "epoch": 108.46153846153847, "num_input_tokens_seen": 5598240, "step": 1410, "train_accuracy": 0.013671875 }, { "epoch": 108.53846153846153, "grad_norm": 0.5314910411834717, "learning_rate": 0.01, "loss": 4.530661106109619, "num_input_tokens_seen": 5602336, "step": 1411, "train_runtime": 1150.5771, "train_tokens_per_second": 4869.153 }, { "epoch": 108.53846153846153, "num_input_tokens_seen": 5602336, "step": 1411, "train_accuracy": 0.0078125 }, { "epoch": 108.61538461538461, "grad_norm": 1.1272478103637695, "learning_rate": 0.01, "loss": 4.53105354309082, "num_input_tokens_seen": 5606432, "step": 1412, "train_runtime": 1151.3918, "train_tokens_per_second": 4869.265 }, { "epoch": 108.61538461538461, "num_input_tokens_seen": 5606432, "step": 1412, "train_accuracy": 0.009765625 }, { "epoch": 108.6923076923077, "grad_norm": 0.9376735687255859, "learning_rate": 0.01, "loss": 4.627614498138428, "num_input_tokens_seen": 5610528, "step": 1413, "train_runtime": 1152.2063, "train_tokens_per_second": 4869.378 }, { "epoch": 108.6923076923077, "num_input_tokens_seen": 5610528, "step": 1413, "train_accuracy": 0.029296875 }, { "epoch": 108.76923076923077, "grad_norm": 0.747143566608429, "learning_rate": 0.01, "loss": 4.748932838439941, "num_input_tokens_seen": 5614624, "step": 1414, "train_runtime": 1153.0215, "train_tokens_per_second": 4869.488 }, { "epoch": 108.76923076923077, "num_input_tokens_seen": 5614624, "step": 1414, "train_accuracy": 0.017578125 }, { "epoch": 108.84615384615384, "grad_norm": 0.4503246247768402, "learning_rate": 0.01, "loss": 4.613273620605469, "num_input_tokens_seen": 5618720, "step": 1415, "train_runtime": 1153.8353, "train_tokens_per_second": 4869.603 }, { "epoch": 108.84615384615384, "num_input_tokens_seen": 5618720, "step": 1415, "train_accuracy": 0.01953125 }, { "epoch": 108.92307692307692, "grad_norm": 1.1499062776565552, "learning_rate": 0.01, "loss": 4.5845417976379395, "num_input_tokens_seen": 5622816, "step": 1416, "train_runtime": 1154.646, "train_tokens_per_second": 4869.732 }, { "epoch": 108.92307692307692, "num_input_tokens_seen": 5622816, "step": 1416, "train_accuracy": 0.013029315508902073 }, { "epoch": 109.0, "grad_norm": 0.33534467220306396, "learning_rate": 0.01, "loss": 4.5637311935424805, "num_input_tokens_seen": 5625272, "step": 1417, "train_runtime": 1155.1613, "train_tokens_per_second": 4869.685 }, { "epoch": 109.0, "num_input_tokens_seen": 5625272, "step": 1417, "train_accuracy": 0.015625 }, { "epoch": 109.07692307692308, "grad_norm": 0.4022475481033325, "learning_rate": 0.01, "loss": 4.535723686218262, "num_input_tokens_seen": 5629368, "step": 1418, "train_runtime": 1155.9864, "train_tokens_per_second": 4869.753 }, { "epoch": 109.07692307692308, "num_input_tokens_seen": 5629368, "step": 1418, "train_accuracy": 0.009765625 }, { "epoch": 109.15384615384616, "grad_norm": 0.2704116106033325, "learning_rate": 0.01, "loss": 4.557677268981934, "num_input_tokens_seen": 5633464, "step": 1419, "train_runtime": 1156.7996, "train_tokens_per_second": 4869.87 }, { "epoch": 109.15384615384616, "num_input_tokens_seen": 5633464, "step": 1419, "train_accuracy": 0.015625 }, { "epoch": 109.23076923076923, "grad_norm": 0.604241132736206, "learning_rate": 0.01, "loss": 4.562737464904785, "num_input_tokens_seen": 5637560, "step": 1420, "train_runtime": 1157.6133, "train_tokens_per_second": 4869.985 }, { "epoch": 109.23076923076923, "num_input_tokens_seen": 5637560, "step": 1420, "train_accuracy": 0.01953125 }, { "epoch": 109.3076923076923, "grad_norm": 0.5170044302940369, "learning_rate": 0.01, "loss": 4.5539093017578125, "num_input_tokens_seen": 5641656, "step": 1421, "train_runtime": 1158.4268, "train_tokens_per_second": 4870.101 }, { "epoch": 109.3076923076923, "num_input_tokens_seen": 5641656, "step": 1421, "train_accuracy": 0.0234375 }, { "epoch": 109.38461538461539, "grad_norm": 0.4709688723087311, "learning_rate": 0.01, "loss": 4.597808837890625, "num_input_tokens_seen": 5645752, "step": 1422, "train_runtime": 1159.2413, "train_tokens_per_second": 4870.213 }, { "epoch": 109.38461538461539, "num_input_tokens_seen": 5645752, "step": 1422, "train_accuracy": 0.01171875 }, { "epoch": 109.46153846153847, "grad_norm": 0.43736159801483154, "learning_rate": 0.01, "loss": 4.583188056945801, "num_input_tokens_seen": 5649848, "step": 1423, "train_runtime": 1160.0589, "train_tokens_per_second": 4870.312 }, { "epoch": 109.46153846153847, "num_input_tokens_seen": 5649848, "step": 1423, "train_accuracy": 0.01953125 }, { "epoch": 109.53846153846153, "grad_norm": 0.465040385723114, "learning_rate": 0.01, "loss": 4.599481582641602, "num_input_tokens_seen": 5653944, "step": 1424, "train_runtime": 1160.8744, "train_tokens_per_second": 4870.418 }, { "epoch": 109.53846153846153, "num_input_tokens_seen": 5653944, "step": 1424, "train_accuracy": 0.009765625 }, { "epoch": 109.61538461538461, "grad_norm": 0.5211769342422485, "learning_rate": 0.01, "loss": 4.568815231323242, "num_input_tokens_seen": 5658040, "step": 1425, "train_runtime": 1161.6874, "train_tokens_per_second": 4870.536 }, { "epoch": 109.61538461538461, "num_input_tokens_seen": 5658040, "step": 1425, "train_accuracy": 0.005859375 }, { "epoch": 109.6923076923077, "grad_norm": 0.398411363363266, "learning_rate": 0.01, "loss": 4.551018714904785, "num_input_tokens_seen": 5662136, "step": 1426, "train_runtime": 1162.505, "train_tokens_per_second": 4870.634 }, { "epoch": 109.6923076923077, "num_input_tokens_seen": 5662136, "step": 1426, "train_accuracy": 0.005859375 }, { "epoch": 109.76923076923077, "grad_norm": 4.086050510406494, "learning_rate": 0.01, "loss": 4.555219650268555, "num_input_tokens_seen": 5666232, "step": 1427, "train_runtime": 1163.3179, "train_tokens_per_second": 4870.751 }, { "epoch": 109.76923076923077, "num_input_tokens_seen": 5666232, "step": 1427, "train_accuracy": 0.0078125 }, { "epoch": 109.84615384615384, "grad_norm": 0.28065016865730286, "learning_rate": 0.01, "loss": 4.5995683670043945, "num_input_tokens_seen": 5670328, "step": 1428, "train_runtime": 1164.1324, "train_tokens_per_second": 4870.862 }, { "epoch": 109.84615384615384, "num_input_tokens_seen": 5670328, "step": 1428, "train_accuracy": 0.015625 }, { "epoch": 109.92307692307692, "grad_norm": 0.1984911561012268, "learning_rate": 0.01, "loss": 4.5547380447387695, "num_input_tokens_seen": 5674424, "step": 1429, "train_runtime": 1164.9414, "train_tokens_per_second": 4870.995 }, { "epoch": 109.92307692307692, "num_input_tokens_seen": 5674424, "step": 1429, "train_accuracy": 0.019543973729014397 }, { "epoch": 110.0, "grad_norm": 0.3055298328399658, "learning_rate": 0.01, "loss": 4.543587684631348, "num_input_tokens_seen": 5676880, "step": 1430, "train_runtime": 1165.4563, "train_tokens_per_second": 4870.951 }, { "epoch": 110.0, "num_input_tokens_seen": 5676880, "step": 1430, "train_accuracy": 0.01171875 }, { "epoch": 110.07692307692308, "grad_norm": 0.1978810727596283, "learning_rate": 0.01, "loss": 4.543689250946045, "num_input_tokens_seen": 5680976, "step": 1431, "train_runtime": 1166.2828, "train_tokens_per_second": 4871.011 }, { "epoch": 110.07692307692308, "num_input_tokens_seen": 5680976, "step": 1431, "train_accuracy": 0.013671875 }, { "epoch": 110.15384615384616, "grad_norm": 0.37786683440208435, "learning_rate": 0.01, "loss": 4.540652275085449, "num_input_tokens_seen": 5685072, "step": 1432, "train_runtime": 1167.0982, "train_tokens_per_second": 4871.117 }, { "epoch": 110.15384615384616, "num_input_tokens_seen": 5685072, "step": 1432, "train_accuracy": 0.013671875 }, { "epoch": 110.23076923076923, "grad_norm": 0.2681422531604767, "learning_rate": 0.01, "loss": 4.540897846221924, "num_input_tokens_seen": 5689168, "step": 1433, "train_runtime": 1167.9118, "train_tokens_per_second": 4871.231 }, { "epoch": 110.23076923076923, "num_input_tokens_seen": 5689168, "step": 1433, "train_accuracy": 0.025390625 }, { "epoch": 110.3076923076923, "grad_norm": 0.34770667552948, "learning_rate": 0.01, "loss": 4.5776166915893555, "num_input_tokens_seen": 5693264, "step": 1434, "train_runtime": 1168.7269, "train_tokens_per_second": 4871.338 }, { "epoch": 110.3076923076923, "num_input_tokens_seen": 5693264, "step": 1434, "train_accuracy": 0.015625 }, { "epoch": 110.38461538461539, "grad_norm": 0.35044267773628235, "learning_rate": 0.01, "loss": 4.558687210083008, "num_input_tokens_seen": 5697360, "step": 1435, "train_runtime": 1169.5418, "train_tokens_per_second": 4871.446 }, { "epoch": 110.38461538461539, "num_input_tokens_seen": 5697360, "step": 1435, "train_accuracy": 0.01953125 }, { "epoch": 110.46153846153847, "grad_norm": 0.27794668078422546, "learning_rate": 0.01, "loss": 4.535930156707764, "num_input_tokens_seen": 5701456, "step": 1436, "train_runtime": 1170.3581, "train_tokens_per_second": 4871.548 }, { "epoch": 110.46153846153847, "num_input_tokens_seen": 5701456, "step": 1436, "train_accuracy": 0.005859375 }, { "epoch": 110.53846153846153, "grad_norm": 0.39730581641197205, "learning_rate": 0.01, "loss": 4.593379974365234, "num_input_tokens_seen": 5705552, "step": 1437, "train_runtime": 1171.1722, "train_tokens_per_second": 4871.659 }, { "epoch": 110.53846153846153, "num_input_tokens_seen": 5705552, "step": 1437, "train_accuracy": 0.015625 }, { "epoch": 110.61538461538461, "grad_norm": 0.33294665813446045, "learning_rate": 0.01, "loss": 4.538558006286621, "num_input_tokens_seen": 5709648, "step": 1438, "train_runtime": 1171.986, "train_tokens_per_second": 4871.772 }, { "epoch": 110.61538461538461, "num_input_tokens_seen": 5709648, "step": 1438, "train_accuracy": 0.00390625 }, { "epoch": 110.6923076923077, "grad_norm": 0.33621513843536377, "learning_rate": 0.01, "loss": 4.540549278259277, "num_input_tokens_seen": 5713744, "step": 1439, "train_runtime": 1172.8, "train_tokens_per_second": 4871.883 }, { "epoch": 110.6923076923077, "num_input_tokens_seen": 5713744, "step": 1439, "train_accuracy": 0.015625 }, { "epoch": 110.76923076923077, "grad_norm": 0.3213450610637665, "learning_rate": 0.01, "loss": 4.538887977600098, "num_input_tokens_seen": 5717840, "step": 1440, "train_runtime": 1173.6146, "train_tokens_per_second": 4871.991 }, { "epoch": 110.76923076923077, "num_input_tokens_seen": 5717840, "step": 1440, "train_accuracy": 0.015625 }, { "epoch": 110.84615384615384, "grad_norm": 0.2600676417350769, "learning_rate": 0.01, "loss": 4.570079803466797, "num_input_tokens_seen": 5721936, "step": 1441, "train_runtime": 1174.4289, "train_tokens_per_second": 4872.101 }, { "epoch": 110.84615384615384, "num_input_tokens_seen": 5721936, "step": 1441, "train_accuracy": 0.01953125 }, { "epoch": 110.92307692307692, "grad_norm": 12.039423942565918, "learning_rate": 0.01, "loss": 4.559736728668213, "num_input_tokens_seen": 5726032, "step": 1442, "train_runtime": 1175.2394, "train_tokens_per_second": 4872.226 }, { "epoch": 110.92307692307692, "num_input_tokens_seen": 5726032, "step": 1442, "train_accuracy": 0.016286645084619522 }, { "epoch": 111.0, "grad_norm": 0.5153545141220093, "learning_rate": 0.01, "loss": 4.533757209777832, "num_input_tokens_seen": 5728488, "step": 1443, "train_runtime": 1175.7551, "train_tokens_per_second": 4872.178 }, { "epoch": 111.0, "num_input_tokens_seen": 5728488, "step": 1443, "train_accuracy": 0.01953125 }, { "epoch": 111.07692307692308, "grad_norm": 0.49407270550727844, "learning_rate": 0.01, "loss": 4.524785995483398, "num_input_tokens_seen": 5732584, "step": 1444, "train_runtime": 1176.5822, "train_tokens_per_second": 4872.234 }, { "epoch": 111.07692307692308, "num_input_tokens_seen": 5732584, "step": 1444, "train_accuracy": 0.015625 }, { "epoch": 111.15384615384616, "grad_norm": 4.117186546325684, "learning_rate": 0.01, "loss": 4.543494701385498, "num_input_tokens_seen": 5736680, "step": 1445, "train_runtime": 1177.3963, "train_tokens_per_second": 4872.344 }, { "epoch": 111.15384615384616, "num_input_tokens_seen": 5736680, "step": 1445, "train_accuracy": 0.0078125 }, { "epoch": 111.23076923076923, "grad_norm": 0.6634436249732971, "learning_rate": 0.01, "loss": 4.539254188537598, "num_input_tokens_seen": 5740776, "step": 1446, "train_runtime": 1178.2103, "train_tokens_per_second": 4872.455 }, { "epoch": 111.23076923076923, "num_input_tokens_seen": 5740776, "step": 1446, "train_accuracy": 0.015625 }, { "epoch": 111.3076923076923, "grad_norm": 0.4485829174518585, "learning_rate": 0.01, "loss": 4.550300598144531, "num_input_tokens_seen": 5744872, "step": 1447, "train_runtime": 1179.0239, "train_tokens_per_second": 4872.566 }, { "epoch": 111.3076923076923, "num_input_tokens_seen": 5744872, "step": 1447, "train_accuracy": 0.01953125 }, { "epoch": 111.38461538461539, "grad_norm": 0.3060574233531952, "learning_rate": 0.01, "loss": 4.542709827423096, "num_input_tokens_seen": 5748968, "step": 1448, "train_runtime": 1179.8382, "train_tokens_per_second": 4872.675 }, { "epoch": 111.38461538461539, "num_input_tokens_seen": 5748968, "step": 1448, "train_accuracy": 0.01171875 }, { "epoch": 111.46153846153847, "grad_norm": 1.7807625532150269, "learning_rate": 0.01, "loss": 4.533871650695801, "num_input_tokens_seen": 5753064, "step": 1449, "train_runtime": 1180.6555, "train_tokens_per_second": 4872.771 }, { "epoch": 111.46153846153847, "num_input_tokens_seen": 5753064, "step": 1449, "train_accuracy": 0.017578125 }, { "epoch": 111.53846153846153, "grad_norm": 0.7963235974311829, "learning_rate": 0.01, "loss": 4.5543951988220215, "num_input_tokens_seen": 5757160, "step": 1450, "train_runtime": 1181.4708, "train_tokens_per_second": 4872.875 }, { "epoch": 111.53846153846153, "num_input_tokens_seen": 5757160, "step": 1450, "train_accuracy": 0.009765625 }, { "epoch": 111.61538461538461, "grad_norm": 0.29571372270584106, "learning_rate": 0.01, "loss": 4.5262908935546875, "num_input_tokens_seen": 5761256, "step": 1451, "train_runtime": 1182.2854, "train_tokens_per_second": 4872.982 }, { "epoch": 111.61538461538461, "num_input_tokens_seen": 5761256, "step": 1451, "train_accuracy": 0.01171875 }, { "epoch": 111.6923076923077, "grad_norm": 0.38416430354118347, "learning_rate": 0.01, "loss": 4.546797752380371, "num_input_tokens_seen": 5765352, "step": 1452, "train_runtime": 1183.1004, "train_tokens_per_second": 4873.088 }, { "epoch": 111.6923076923077, "num_input_tokens_seen": 5765352, "step": 1452, "train_accuracy": 0.01171875 }, { "epoch": 111.76923076923077, "grad_norm": 0.24193359911441803, "learning_rate": 0.01, "loss": 4.554234981536865, "num_input_tokens_seen": 5769448, "step": 1453, "train_runtime": 1183.9152, "train_tokens_per_second": 4873.194 }, { "epoch": 111.76923076923077, "num_input_tokens_seen": 5769448, "step": 1453, "train_accuracy": 0.01171875 }, { "epoch": 111.84615384615384, "grad_norm": 0.5733964443206787, "learning_rate": 0.01, "loss": 4.5706682205200195, "num_input_tokens_seen": 5773544, "step": 1454, "train_runtime": 1184.7307, "train_tokens_per_second": 4873.296 }, { "epoch": 111.84615384615384, "num_input_tokens_seen": 5773544, "step": 1454, "train_accuracy": 0.015625 }, { "epoch": 111.92307692307692, "grad_norm": 0.2824409604072571, "learning_rate": 0.01, "loss": 4.55647087097168, "num_input_tokens_seen": 5777640, "step": 1455, "train_runtime": 1185.5406, "train_tokens_per_second": 4873.422 }, { "epoch": 111.92307692307692, "num_input_tokens_seen": 5777640, "step": 1455, "train_accuracy": 0.0032573288772255182 }, { "epoch": 112.0, "grad_norm": 0.31641995906829834, "learning_rate": 0.01, "loss": 4.55803108215332, "num_input_tokens_seen": 5780096, "step": 1456, "train_runtime": 1186.0571, "train_tokens_per_second": 4873.371 }, { "epoch": 112.0, "num_input_tokens_seen": 5780096, "step": 1456, "train_accuracy": 0.017578125 }, { "epoch": 112.07692307692308, "grad_norm": 0.21771086752414703, "learning_rate": 0.01, "loss": 4.534934043884277, "num_input_tokens_seen": 5784192, "step": 1457, "train_runtime": 1186.8848, "train_tokens_per_second": 4873.423 }, { "epoch": 112.07692307692308, "num_input_tokens_seen": 5784192, "step": 1457, "train_accuracy": 0.029296875 }, { "epoch": 112.15384615384616, "grad_norm": 0.29175636172294617, "learning_rate": 0.01, "loss": 4.509088516235352, "num_input_tokens_seen": 5788288, "step": 1458, "train_runtime": 1187.699, "train_tokens_per_second": 4873.531 }, { "epoch": 112.15384615384616, "num_input_tokens_seen": 5788288, "step": 1458, "train_accuracy": 0.0078125 }, { "epoch": 112.23076923076923, "grad_norm": 0.35472649335861206, "learning_rate": 0.01, "loss": 4.531649589538574, "num_input_tokens_seen": 5792384, "step": 1459, "train_runtime": 1188.5124, "train_tokens_per_second": 4873.642 }, { "epoch": 112.23076923076923, "num_input_tokens_seen": 5792384, "step": 1459, "train_accuracy": 0.009765625 }, { "epoch": 112.3076923076923, "grad_norm": 0.5154550075531006, "learning_rate": 0.01, "loss": 4.5805745124816895, "num_input_tokens_seen": 5796480, "step": 1460, "train_runtime": 1189.3254, "train_tokens_per_second": 4873.754 }, { "epoch": 112.3076923076923, "num_input_tokens_seen": 5796480, "step": 1460, "train_accuracy": 0.021484375 }, { "epoch": 112.38461538461539, "grad_norm": 0.5546479225158691, "learning_rate": 0.01, "loss": 4.542065143585205, "num_input_tokens_seen": 5800576, "step": 1461, "train_runtime": 1190.1392, "train_tokens_per_second": 4873.864 }, { "epoch": 112.38461538461539, "num_input_tokens_seen": 5800576, "step": 1461, "train_accuracy": 0.01171875 }, { "epoch": 112.46153846153847, "grad_norm": 0.4114753305912018, "learning_rate": 0.01, "loss": 4.521361351013184, "num_input_tokens_seen": 5804672, "step": 1462, "train_runtime": 1190.9546, "train_tokens_per_second": 4873.966 }, { "epoch": 112.46153846153847, "num_input_tokens_seen": 5804672, "step": 1462, "train_accuracy": 0.01171875 }, { "epoch": 112.53846153846153, "grad_norm": 0.3744247257709503, "learning_rate": 0.01, "loss": 4.540783882141113, "num_input_tokens_seen": 5808768, "step": 1463, "train_runtime": 1191.7683, "train_tokens_per_second": 4874.075 }, { "epoch": 112.53846153846153, "num_input_tokens_seen": 5808768, "step": 1463, "train_accuracy": 0.015625 }, { "epoch": 112.61538461538461, "grad_norm": 0.17463082075119019, "learning_rate": 0.01, "loss": 4.549612045288086, "num_input_tokens_seen": 5812864, "step": 1464, "train_runtime": 1192.5821, "train_tokens_per_second": 4874.184 }, { "epoch": 112.61538461538461, "num_input_tokens_seen": 5812864, "step": 1464, "train_accuracy": 0.015625 }, { "epoch": 112.6923076923077, "grad_norm": 0.4204837381839752, "learning_rate": 0.01, "loss": 4.537134170532227, "num_input_tokens_seen": 5816960, "step": 1465, "train_runtime": 1193.396, "train_tokens_per_second": 4874.291 }, { "epoch": 112.6923076923077, "num_input_tokens_seen": 5816960, "step": 1465, "train_accuracy": 0.01171875 }, { "epoch": 112.76923076923077, "grad_norm": 0.6896317005157471, "learning_rate": 0.01, "loss": 4.549983024597168, "num_input_tokens_seen": 5821056, "step": 1466, "train_runtime": 1194.2101, "train_tokens_per_second": 4874.398 }, { "epoch": 112.76923076923077, "num_input_tokens_seen": 5821056, "step": 1466, "train_accuracy": 0.017578125 }, { "epoch": 112.84615384615384, "grad_norm": 0.37896084785461426, "learning_rate": 0.01, "loss": 4.571794509887695, "num_input_tokens_seen": 5825152, "step": 1467, "train_runtime": 1195.0239, "train_tokens_per_second": 4874.507 }, { "epoch": 112.84615384615384, "num_input_tokens_seen": 5825152, "step": 1467, "train_accuracy": 0.005859375 }, { "epoch": 112.92307692307692, "grad_norm": 0.21988117694854736, "learning_rate": 0.01, "loss": 4.540635108947754, "num_input_tokens_seen": 5829248, "step": 1468, "train_runtime": 1195.8336, "train_tokens_per_second": 4874.631 }, { "epoch": 112.92307692307692, "num_input_tokens_seen": 5829248, "step": 1468, "train_accuracy": 0.0 }, { "epoch": 113.0, "grad_norm": 0.5901161432266235, "learning_rate": 0.01, "loss": 4.515387058258057, "num_input_tokens_seen": 5831704, "step": 1469, "train_runtime": 1196.348, "train_tokens_per_second": 4874.588 }, { "epoch": 113.0, "num_input_tokens_seen": 5831704, "step": 1469, "train_accuracy": 0.0078125 }, { "epoch": 113.07692307692308, "grad_norm": 0.3445182144641876, "learning_rate": 0.01, "loss": 4.550724983215332, "num_input_tokens_seen": 5835800, "step": 1470, "train_runtime": 1197.1769, "train_tokens_per_second": 4874.635 }, { "epoch": 113.07692307692308, "num_input_tokens_seen": 5835800, "step": 1470, "train_accuracy": 0.021484375 }, { "epoch": 113.15384615384616, "grad_norm": 1.3338204622268677, "learning_rate": 0.01, "loss": 4.518813610076904, "num_input_tokens_seen": 5839896, "step": 1471, "train_runtime": 1197.9906, "train_tokens_per_second": 4874.743 }, { "epoch": 113.15384615384616, "num_input_tokens_seen": 5839896, "step": 1471, "train_accuracy": 0.017578125 }, { "epoch": 113.23076923076923, "grad_norm": 0.37299713492393494, "learning_rate": 0.01, "loss": 4.526444911956787, "num_input_tokens_seen": 5843992, "step": 1472, "train_runtime": 1198.8038, "train_tokens_per_second": 4874.853 }, { "epoch": 113.23076923076923, "num_input_tokens_seen": 5843992, "step": 1472, "train_accuracy": 0.0078125 }, { "epoch": 113.3076923076923, "grad_norm": 0.4445403218269348, "learning_rate": 0.01, "loss": 4.503165245056152, "num_input_tokens_seen": 5848088, "step": 1473, "train_runtime": 1199.618, "train_tokens_per_second": 4874.959 }, { "epoch": 113.3076923076923, "num_input_tokens_seen": 5848088, "step": 1473, "train_accuracy": 0.021484375 }, { "epoch": 113.38461538461539, "grad_norm": 0.579134464263916, "learning_rate": 0.01, "loss": 4.5347747802734375, "num_input_tokens_seen": 5852184, "step": 1474, "train_runtime": 1200.4319, "train_tokens_per_second": 4875.065 }, { "epoch": 113.38461538461539, "num_input_tokens_seen": 5852184, "step": 1474, "train_accuracy": 0.009765625 }, { "epoch": 113.46153846153847, "grad_norm": 0.3748880922794342, "learning_rate": 0.01, "loss": 4.542248249053955, "num_input_tokens_seen": 5856280, "step": 1475, "train_runtime": 1201.2472, "train_tokens_per_second": 4875.166 }, { "epoch": 113.46153846153847, "num_input_tokens_seen": 5856280, "step": 1475, "train_accuracy": 0.021484375 }, { "epoch": 113.53846153846153, "grad_norm": 0.3015724718570709, "learning_rate": 0.01, "loss": 4.5192670822143555, "num_input_tokens_seen": 5860376, "step": 1476, "train_runtime": 1202.07, "train_tokens_per_second": 4875.237 }, { "epoch": 113.53846153846153, "num_input_tokens_seen": 5860376, "step": 1476, "train_accuracy": 0.017578125 }, { "epoch": 113.61538461538461, "grad_norm": 0.3007107079029083, "learning_rate": 0.01, "loss": 4.521328926086426, "num_input_tokens_seen": 5864472, "step": 1477, "train_runtime": 1202.8841, "train_tokens_per_second": 4875.343 }, { "epoch": 113.61538461538461, "num_input_tokens_seen": 5864472, "step": 1477, "train_accuracy": 0.015625 }, { "epoch": 113.6923076923077, "grad_norm": 0.42604634165763855, "learning_rate": 0.01, "loss": 4.530096054077148, "num_input_tokens_seen": 5868568, "step": 1478, "train_runtime": 1203.6976, "train_tokens_per_second": 4875.451 }, { "epoch": 113.6923076923077, "num_input_tokens_seen": 5868568, "step": 1478, "train_accuracy": 0.009765625 }, { "epoch": 113.76923076923077, "grad_norm": 0.37296631932258606, "learning_rate": 0.01, "loss": 4.533902645111084, "num_input_tokens_seen": 5872664, "step": 1479, "train_runtime": 1204.5124, "train_tokens_per_second": 4875.553 }, { "epoch": 113.76923076923077, "num_input_tokens_seen": 5872664, "step": 1479, "train_accuracy": 0.01171875 }, { "epoch": 113.84615384615384, "grad_norm": 0.2979356348514557, "learning_rate": 0.01, "loss": 4.533270835876465, "num_input_tokens_seen": 5876760, "step": 1480, "train_runtime": 1205.3272, "train_tokens_per_second": 4875.655 }, { "epoch": 113.84615384615384, "num_input_tokens_seen": 5876760, "step": 1480, "train_accuracy": 0.017578125 }, { "epoch": 113.92307692307692, "grad_norm": 0.414663165807724, "learning_rate": 0.01, "loss": 4.535632133483887, "num_input_tokens_seen": 5880856, "step": 1481, "train_runtime": 1206.1372, "train_tokens_per_second": 4875.777 }, { "epoch": 113.92307692307692, "num_input_tokens_seen": 5880856, "step": 1481, "train_accuracy": 0.0065146577544510365 }, { "epoch": 114.0, "grad_norm": 0.33322423696517944, "learning_rate": 0.01, "loss": 4.562551021575928, "num_input_tokens_seen": 5883312, "step": 1482, "train_runtime": 1206.6525, "train_tokens_per_second": 4875.73 }, { "epoch": 114.0, "num_input_tokens_seen": 5883312, "step": 1482, "train_accuracy": 0.013671875 }, { "epoch": 114.07692307692308, "grad_norm": 4.517330646514893, "learning_rate": 0.01, "loss": 4.516086578369141, "num_input_tokens_seen": 5887408, "step": 1483, "train_runtime": 1207.4785, "train_tokens_per_second": 4875.787 }, { "epoch": 114.07692307692308, "num_input_tokens_seen": 5887408, "step": 1483, "train_accuracy": 0.013671875 }, { "epoch": 114.15384615384616, "grad_norm": 0.2041095793247223, "learning_rate": 0.01, "loss": 4.498183250427246, "num_input_tokens_seen": 5891504, "step": 1484, "train_runtime": 1208.2922, "train_tokens_per_second": 4875.893 }, { "epoch": 114.15384615384616, "num_input_tokens_seen": 5891504, "step": 1484, "train_accuracy": 0.01171875 }, { "epoch": 114.23076923076923, "grad_norm": 0.6149014830589294, "learning_rate": 0.01, "loss": 4.543646812438965, "num_input_tokens_seen": 5895600, "step": 1485, "train_runtime": 1209.1061, "train_tokens_per_second": 4875.999 }, { "epoch": 114.23076923076923, "num_input_tokens_seen": 5895600, "step": 1485, "train_accuracy": 0.017578125 }, { "epoch": 114.3076923076923, "grad_norm": 0.29106220602989197, "learning_rate": 0.01, "loss": 4.506340980529785, "num_input_tokens_seen": 5899696, "step": 1486, "train_runtime": 1209.9198, "train_tokens_per_second": 4876.105 }, { "epoch": 114.3076923076923, "num_input_tokens_seen": 5899696, "step": 1486, "train_accuracy": 0.001953125 }, { "epoch": 114.38461538461539, "grad_norm": 0.44996026158332825, "learning_rate": 0.01, "loss": 4.5403008460998535, "num_input_tokens_seen": 5903792, "step": 1487, "train_runtime": 1210.7341, "train_tokens_per_second": 4876.209 }, { "epoch": 114.38461538461539, "num_input_tokens_seen": 5903792, "step": 1487, "train_accuracy": 0.015625 }, { "epoch": 114.46153846153847, "grad_norm": 0.2865310609340668, "learning_rate": 0.01, "loss": 4.520112991333008, "num_input_tokens_seen": 5907888, "step": 1488, "train_runtime": 1211.5477, "train_tokens_per_second": 4876.315 }, { "epoch": 114.46153846153847, "num_input_tokens_seen": 5907888, "step": 1488, "train_accuracy": 0.01171875 }, { "epoch": 114.53846153846153, "grad_norm": 0.42982539534568787, "learning_rate": 0.01, "loss": 4.546148777008057, "num_input_tokens_seen": 5911984, "step": 1489, "train_runtime": 1212.3627, "train_tokens_per_second": 4876.415 }, { "epoch": 114.53846153846153, "num_input_tokens_seen": 5911984, "step": 1489, "train_accuracy": 0.0078125 }, { "epoch": 114.61538461538461, "grad_norm": 0.4213695824146271, "learning_rate": 0.01, "loss": 4.540425777435303, "num_input_tokens_seen": 5916080, "step": 1490, "train_runtime": 1213.1755, "train_tokens_per_second": 4876.524 }, { "epoch": 114.61538461538461, "num_input_tokens_seen": 5916080, "step": 1490, "train_accuracy": 0.01171875 }, { "epoch": 114.6923076923077, "grad_norm": 0.24819839000701904, "learning_rate": 0.01, "loss": 4.515840530395508, "num_input_tokens_seen": 5920176, "step": 1491, "train_runtime": 1213.9879, "train_tokens_per_second": 4876.635 }, { "epoch": 114.6923076923077, "num_input_tokens_seen": 5920176, "step": 1491, "train_accuracy": 0.009765625 }, { "epoch": 114.76923076923077, "grad_norm": 1.2839123010635376, "learning_rate": 0.01, "loss": 4.551513671875, "num_input_tokens_seen": 5924272, "step": 1492, "train_runtime": 1214.8004, "train_tokens_per_second": 4876.745 }, { "epoch": 114.76923076923077, "num_input_tokens_seen": 5924272, "step": 1492, "train_accuracy": 0.00390625 }, { "epoch": 114.84615384615384, "grad_norm": 0.31538495421409607, "learning_rate": 0.01, "loss": 4.560274600982666, "num_input_tokens_seen": 5928368, "step": 1493, "train_runtime": 1215.6135, "train_tokens_per_second": 4876.853 }, { "epoch": 114.84615384615384, "num_input_tokens_seen": 5928368, "step": 1493, "train_accuracy": 0.009765625 }, { "epoch": 114.92307692307692, "grad_norm": 0.21700944006443024, "learning_rate": 0.01, "loss": 4.535152435302734, "num_input_tokens_seen": 5932464, "step": 1494, "train_runtime": 1216.4219, "train_tokens_per_second": 4876.979 }, { "epoch": 114.92307692307692, "num_input_tokens_seen": 5932464, "step": 1494, "train_accuracy": 0.013029315508902073 }, { "epoch": 115.0, "grad_norm": 4.251666069030762, "learning_rate": 0.01, "loss": 4.5423455238342285, "num_input_tokens_seen": 5934920, "step": 1495, "train_runtime": 1216.936, "train_tokens_per_second": 4876.937 }, { "epoch": 115.0, "num_input_tokens_seen": 5934920, "step": 1495, "train_accuracy": 0.01953125 }, { "epoch": 115.07692307692308, "grad_norm": 0.25329291820526123, "learning_rate": 0.01, "loss": 4.501167297363281, "num_input_tokens_seen": 5939016, "step": 1496, "train_runtime": 1217.7617, "train_tokens_per_second": 4876.994 }, { "epoch": 115.07692307692308, "num_input_tokens_seen": 5939016, "step": 1496, "train_accuracy": 0.017578125 }, { "epoch": 115.15384615384616, "grad_norm": 0.3199782371520996, "learning_rate": 0.01, "loss": 4.542051315307617, "num_input_tokens_seen": 5943112, "step": 1497, "train_runtime": 1218.5764, "train_tokens_per_second": 4877.094 }, { "epoch": 115.15384615384616, "num_input_tokens_seen": 5943112, "step": 1497, "train_accuracy": 0.01953125 }, { "epoch": 115.23076923076923, "grad_norm": 1.3273310661315918, "learning_rate": 0.01, "loss": 4.527716636657715, "num_input_tokens_seen": 5947208, "step": 1498, "train_runtime": 1219.3912, "train_tokens_per_second": 4877.194 }, { "epoch": 115.23076923076923, "num_input_tokens_seen": 5947208, "step": 1498, "train_accuracy": 0.017578125 }, { "epoch": 115.3076923076923, "grad_norm": 0.22500677406787872, "learning_rate": 0.01, "loss": 4.54163932800293, "num_input_tokens_seen": 5951304, "step": 1499, "train_runtime": 1220.2031, "train_tokens_per_second": 4877.306 }, { "epoch": 115.3076923076923, "num_input_tokens_seen": 5951304, "step": 1499, "train_accuracy": 0.013671875 }, { "epoch": 115.38461538461539, "grad_norm": 0.42557427287101746, "learning_rate": 0.01, "loss": 4.538112640380859, "num_input_tokens_seen": 5955400, "step": 1500, "train_runtime": 1221.0157, "train_tokens_per_second": 4877.415 }, { "epoch": 115.38461538461539, "eval_CMD_3_branch_eval_accuracy": 0.006871609403254973, "eval_CMD_3_branch_eval_loss": 4.5631232261657715, "eval_CMD_3_branch_eval_runtime": 1.1547, "eval_CMD_3_branch_eval_samples_per_second": 2394.649, "eval_CMD_3_branch_eval_steps_per_second": 5.196, "num_input_tokens_seen": 5955400, "step": 1500 }, { "epoch": 115.38461538461539, "num_input_tokens_seen": 5955400, "step": 1500, "train_accuracy": 0.015625 }, { "epoch": 115.46153846153847, "grad_norm": 0.6366361379623413, "learning_rate": 0.01, "loss": 4.517929553985596, "num_input_tokens_seen": 5959496, "step": 1501, "train_runtime": 1222.9858, "train_tokens_per_second": 4872.907 }, { "epoch": 115.46153846153847, "num_input_tokens_seen": 5959496, "step": 1501, "train_accuracy": 0.013671875 }, { "epoch": 115.53846153846153, "grad_norm": 0.578191876411438, "learning_rate": 0.01, "loss": 4.528219223022461, "num_input_tokens_seen": 5963592, "step": 1502, "train_runtime": 1223.7985, "train_tokens_per_second": 4873.018 }, { "epoch": 115.53846153846153, "num_input_tokens_seen": 5963592, "step": 1502, "train_accuracy": 0.015625 }, { "epoch": 115.61538461538461, "grad_norm": 0.2566545903682709, "learning_rate": 0.01, "loss": 4.548543453216553, "num_input_tokens_seen": 5967688, "step": 1503, "train_runtime": 1224.6105, "train_tokens_per_second": 4873.132 }, { "epoch": 115.61538461538461, "num_input_tokens_seen": 5967688, "step": 1503, "train_accuracy": 0.009765625 }, { "epoch": 115.6923076923077, "grad_norm": 0.41449329257011414, "learning_rate": 0.01, "loss": 4.538558006286621, "num_input_tokens_seen": 5971784, "step": 1504, "train_runtime": 1225.4234, "train_tokens_per_second": 4873.241 }, { "epoch": 115.6923076923077, "num_input_tokens_seen": 5971784, "step": 1504, "train_accuracy": 0.013671875 }, { "epoch": 115.76923076923077, "grad_norm": 2.3327584266662598, "learning_rate": 0.01, "loss": 4.521422386169434, "num_input_tokens_seen": 5975880, "step": 1505, "train_runtime": 1226.2365, "train_tokens_per_second": 4873.35 }, { "epoch": 115.76923076923077, "num_input_tokens_seen": 5975880, "step": 1505, "train_accuracy": 0.015625 }, { "epoch": 115.84615384615384, "grad_norm": 0.3173248767852783, "learning_rate": 0.01, "loss": 4.513408184051514, "num_input_tokens_seen": 5979976, "step": 1506, "train_runtime": 1227.0522, "train_tokens_per_second": 4873.449 }, { "epoch": 115.84615384615384, "num_input_tokens_seen": 5979976, "step": 1506, "train_accuracy": 0.01171875 }, { "epoch": 115.92307692307692, "grad_norm": 0.22287431359291077, "learning_rate": 0.01, "loss": 4.497661590576172, "num_input_tokens_seen": 5984072, "step": 1507, "train_runtime": 1227.8623, "train_tokens_per_second": 4873.569 }, { "epoch": 115.92307692307692, "num_input_tokens_seen": 5984072, "step": 1507, "train_accuracy": 0.019543973729014397 }, { "epoch": 116.0, "grad_norm": 0.6383256912231445, "learning_rate": 0.01, "loss": 4.531820774078369, "num_input_tokens_seen": 5986528, "step": 1508, "train_runtime": 1228.3769, "train_tokens_per_second": 4873.527 }, { "epoch": 116.0, "num_input_tokens_seen": 5986528, "step": 1508, "train_accuracy": 0.01953125 }, { "epoch": 116.07692307692308, "grad_norm": 0.3919311761856079, "learning_rate": 0.01, "loss": 4.509546279907227, "num_input_tokens_seen": 5990624, "step": 1509, "train_runtime": 1229.2043, "train_tokens_per_second": 4873.579 }, { "epoch": 116.07692307692308, "num_input_tokens_seen": 5990624, "step": 1509, "train_accuracy": 0.009765625 }, { "epoch": 116.15384615384616, "grad_norm": 25.548311233520508, "learning_rate": 0.01, "loss": 4.636435508728027, "num_input_tokens_seen": 5994720, "step": 1510, "train_runtime": 1230.0168, "train_tokens_per_second": 4873.69 }, { "epoch": 116.15384615384616, "num_input_tokens_seen": 5994720, "step": 1510, "train_accuracy": 0.025390625 }, { "epoch": 116.23076923076923, "grad_norm": 1.890404462814331, "learning_rate": 0.01, "loss": 4.6568450927734375, "num_input_tokens_seen": 5998816, "step": 1511, "train_runtime": 1230.8311, "train_tokens_per_second": 4873.793 }, { "epoch": 116.23076923076923, "num_input_tokens_seen": 5998816, "step": 1511, "train_accuracy": 0.009765625 }, { "epoch": 116.3076923076923, "grad_norm": 0.3822583556175232, "learning_rate": 0.01, "loss": 4.55836820602417, "num_input_tokens_seen": 6002912, "step": 1512, "train_runtime": 1231.6454, "train_tokens_per_second": 4873.896 }, { "epoch": 116.3076923076923, "num_input_tokens_seen": 6002912, "step": 1512, "train_accuracy": 0.015625 }, { "epoch": 116.38461538461539, "grad_norm": 0.28379833698272705, "learning_rate": 0.01, "loss": 4.556880950927734, "num_input_tokens_seen": 6007008, "step": 1513, "train_runtime": 1232.4596, "train_tokens_per_second": 4874.0 }, { "epoch": 116.38461538461539, "num_input_tokens_seen": 6007008, "step": 1513, "train_accuracy": 0.021484375 }, { "epoch": 116.46153846153847, "grad_norm": 0.6593945026397705, "learning_rate": 0.01, "loss": 4.567363739013672, "num_input_tokens_seen": 6011104, "step": 1514, "train_runtime": 1233.2732, "train_tokens_per_second": 4874.106 }, { "epoch": 116.46153846153847, "num_input_tokens_seen": 6011104, "step": 1514, "train_accuracy": 0.009765625 }, { "epoch": 116.53846153846153, "grad_norm": 0.5276172757148743, "learning_rate": 0.01, "loss": 4.560641765594482, "num_input_tokens_seen": 6015200, "step": 1515, "train_runtime": 1234.0845, "train_tokens_per_second": 4874.221 }, { "epoch": 116.53846153846153, "num_input_tokens_seen": 6015200, "step": 1515, "train_accuracy": 0.005859375 }, { "epoch": 116.61538461538461, "grad_norm": 1.2776269912719727, "learning_rate": 0.01, "loss": 4.544119834899902, "num_input_tokens_seen": 6019296, "step": 1516, "train_runtime": 1234.897, "train_tokens_per_second": 4874.33 }, { "epoch": 116.61538461538461, "num_input_tokens_seen": 6019296, "step": 1516, "train_accuracy": 0.015625 }, { "epoch": 116.6923076923077, "grad_norm": 0.8084747195243835, "learning_rate": 0.01, "loss": 4.5611724853515625, "num_input_tokens_seen": 6023392, "step": 1517, "train_runtime": 1235.7099, "train_tokens_per_second": 4874.439 }, { "epoch": 116.6923076923077, "num_input_tokens_seen": 6023392, "step": 1517, "train_accuracy": 0.013671875 }, { "epoch": 116.76923076923077, "grad_norm": 0.2594858705997467, "learning_rate": 0.01, "loss": 4.562878608703613, "num_input_tokens_seen": 6027488, "step": 1518, "train_runtime": 1236.5224, "train_tokens_per_second": 4874.548 }, { "epoch": 116.76923076923077, "num_input_tokens_seen": 6027488, "step": 1518, "train_accuracy": 0.017578125 }, { "epoch": 116.84615384615384, "grad_norm": 0.6123083829879761, "learning_rate": 0.01, "loss": 4.556002616882324, "num_input_tokens_seen": 6031584, "step": 1519, "train_runtime": 1237.335, "train_tokens_per_second": 4874.657 }, { "epoch": 116.84615384615384, "num_input_tokens_seen": 6031584, "step": 1519, "train_accuracy": 0.009765625 }, { "epoch": 116.92307692307692, "grad_norm": 0.2527475655078888, "learning_rate": 0.01, "loss": 4.575403213500977, "num_input_tokens_seen": 6035680, "step": 1520, "train_runtime": 1238.1428, "train_tokens_per_second": 4874.785 }, { "epoch": 116.92307692307692, "num_input_tokens_seen": 6035680, "step": 1520, "train_accuracy": 0.026058631017804146 }, { "epoch": 117.0, "grad_norm": 0.5278998017311096, "learning_rate": 0.01, "loss": 4.529703617095947, "num_input_tokens_seen": 6038136, "step": 1521, "train_runtime": 1238.6569, "train_tokens_per_second": 4874.745 }, { "epoch": 117.0, "num_input_tokens_seen": 6038136, "step": 1521, "train_accuracy": 0.0078125 }, { "epoch": 117.07692307692308, "grad_norm": 0.2524627149105072, "learning_rate": 0.01, "loss": 4.556354522705078, "num_input_tokens_seen": 6042232, "step": 1522, "train_runtime": 1239.4804, "train_tokens_per_second": 4874.81 }, { "epoch": 117.07692307692308, "num_input_tokens_seen": 6042232, "step": 1522, "train_accuracy": 0.01953125 }, { "epoch": 117.15384615384616, "grad_norm": 0.5767359137535095, "learning_rate": 0.01, "loss": 4.554250240325928, "num_input_tokens_seen": 6046328, "step": 1523, "train_runtime": 1240.2925, "train_tokens_per_second": 4874.921 }, { "epoch": 117.15384615384616, "num_input_tokens_seen": 6046328, "step": 1523, "train_accuracy": 0.015625 }, { "epoch": 117.23076923076923, "grad_norm": 0.40972158312797546, "learning_rate": 0.01, "loss": 4.57272481918335, "num_input_tokens_seen": 6050424, "step": 1524, "train_runtime": 1241.1045, "train_tokens_per_second": 4875.032 }, { "epoch": 117.23076923076923, "num_input_tokens_seen": 6050424, "step": 1524, "train_accuracy": 0.009765625 }, { "epoch": 117.3076923076923, "grad_norm": 0.4189790189266205, "learning_rate": 0.01, "loss": 4.536509037017822, "num_input_tokens_seen": 6054520, "step": 1525, "train_runtime": 1241.9162, "train_tokens_per_second": 4875.144 }, { "epoch": 117.3076923076923, "num_input_tokens_seen": 6054520, "step": 1525, "train_accuracy": 0.015625 }, { "epoch": 117.38461538461539, "grad_norm": 0.3326832950115204, "learning_rate": 0.01, "loss": 4.555102825164795, "num_input_tokens_seen": 6058616, "step": 1526, "train_runtime": 1242.7287, "train_tokens_per_second": 4875.252 }, { "epoch": 117.38461538461539, "num_input_tokens_seen": 6058616, "step": 1526, "train_accuracy": 0.025390625 }, { "epoch": 117.46153846153847, "grad_norm": 0.21425527334213257, "learning_rate": 0.01, "loss": 4.541358947753906, "num_input_tokens_seen": 6062712, "step": 1527, "train_runtime": 1243.5408, "train_tokens_per_second": 4875.362 }, { "epoch": 117.46153846153847, "num_input_tokens_seen": 6062712, "step": 1527, "train_accuracy": 0.013671875 }, { "epoch": 117.53846153846153, "grad_norm": 0.28938883543014526, "learning_rate": 0.01, "loss": 4.534416198730469, "num_input_tokens_seen": 6066808, "step": 1528, "train_runtime": 1244.3541, "train_tokens_per_second": 4875.468 }, { "epoch": 117.53846153846153, "num_input_tokens_seen": 6066808, "step": 1528, "train_accuracy": 0.009765625 }, { "epoch": 117.61538461538461, "grad_norm": 0.8966801166534424, "learning_rate": 0.01, "loss": 4.54386043548584, "num_input_tokens_seen": 6070904, "step": 1529, "train_runtime": 1245.167, "train_tokens_per_second": 4875.574 }, { "epoch": 117.61538461538461, "num_input_tokens_seen": 6070904, "step": 1529, "train_accuracy": 0.009765625 }, { "epoch": 117.6923076923077, "grad_norm": 0.39462676644325256, "learning_rate": 0.01, "loss": 4.542434215545654, "num_input_tokens_seen": 6075000, "step": 1530, "train_runtime": 1245.98, "train_tokens_per_second": 4875.68 }, { "epoch": 117.6923076923077, "num_input_tokens_seen": 6075000, "step": 1530, "train_accuracy": 0.01953125 }, { "epoch": 117.76923076923077, "grad_norm": 0.5106446146965027, "learning_rate": 0.01, "loss": 4.5446319580078125, "num_input_tokens_seen": 6079096, "step": 1531, "train_runtime": 1246.7934, "train_tokens_per_second": 4875.784 }, { "epoch": 117.76923076923077, "num_input_tokens_seen": 6079096, "step": 1531, "train_accuracy": 0.013671875 }, { "epoch": 117.84615384615384, "grad_norm": 0.5330077409744263, "learning_rate": 0.01, "loss": 4.5503411293029785, "num_input_tokens_seen": 6083192, "step": 1532, "train_runtime": 1247.6063, "train_tokens_per_second": 4875.891 }, { "epoch": 117.84615384615384, "num_input_tokens_seen": 6083192, "step": 1532, "train_accuracy": 0.0078125 }, { "epoch": 117.92307692307692, "grad_norm": 0.9235372543334961, "learning_rate": 0.01, "loss": 4.517930030822754, "num_input_tokens_seen": 6087288, "step": 1533, "train_runtime": 1248.4155, "train_tokens_per_second": 4876.011 }, { "epoch": 117.92307692307692, "num_input_tokens_seen": 6087288, "step": 1533, "train_accuracy": 0.0065146577544510365 }, { "epoch": 118.0, "grad_norm": 0.6051939725875854, "learning_rate": 0.01, "loss": 4.540765285491943, "num_input_tokens_seen": 6089744, "step": 1534, "train_runtime": 1248.9301, "train_tokens_per_second": 4875.968 }, { "epoch": 118.0, "num_input_tokens_seen": 6089744, "step": 1534, "train_accuracy": 0.01171875 }, { "epoch": 118.07692307692308, "grad_norm": 23.663299560546875, "learning_rate": 0.01, "loss": 4.546059608459473, "num_input_tokens_seen": 6093840, "step": 1535, "train_runtime": 1249.7557, "train_tokens_per_second": 4876.025 }, { "epoch": 118.07692307692308, "num_input_tokens_seen": 6093840, "step": 1535, "train_accuracy": 0.0078125 }, { "epoch": 118.15384615384616, "grad_norm": 0.5285918712615967, "learning_rate": 0.01, "loss": 4.551592826843262, "num_input_tokens_seen": 6097936, "step": 1536, "train_runtime": 1250.569, "train_tokens_per_second": 4876.129 }, { "epoch": 118.15384615384616, "num_input_tokens_seen": 6097936, "step": 1536, "train_accuracy": 0.013671875 }, { "epoch": 118.23076923076923, "grad_norm": 0.24745753407478333, "learning_rate": 0.01, "loss": 4.568268299102783, "num_input_tokens_seen": 6102032, "step": 1537, "train_runtime": 1251.3827, "train_tokens_per_second": 4876.232 }, { "epoch": 118.23076923076923, "num_input_tokens_seen": 6102032, "step": 1537, "train_accuracy": 0.017578125 }, { "epoch": 118.3076923076923, "grad_norm": 0.2812255620956421, "learning_rate": 0.01, "loss": 4.563979148864746, "num_input_tokens_seen": 6106128, "step": 1538, "train_runtime": 1252.196, "train_tokens_per_second": 4876.336 }, { "epoch": 118.3076923076923, "num_input_tokens_seen": 6106128, "step": 1538, "train_accuracy": 0.005859375 }, { "epoch": 118.38461538461539, "grad_norm": 0.2536022961139679, "learning_rate": 0.01, "loss": 4.585928916931152, "num_input_tokens_seen": 6110224, "step": 1539, "train_runtime": 1253.0086, "train_tokens_per_second": 4876.442 }, { "epoch": 118.38461538461539, "num_input_tokens_seen": 6110224, "step": 1539, "train_accuracy": 0.017578125 }, { "epoch": 118.46153846153847, "grad_norm": 0.2379070371389389, "learning_rate": 0.01, "loss": 4.58247709274292, "num_input_tokens_seen": 6114320, "step": 1540, "train_runtime": 1253.8218, "train_tokens_per_second": 4876.546 }, { "epoch": 118.46153846153847, "num_input_tokens_seen": 6114320, "step": 1540, "train_accuracy": 0.005859375 }, { "epoch": 118.53846153846153, "grad_norm": 0.2722030282020569, "learning_rate": 0.01, "loss": 4.601729869842529, "num_input_tokens_seen": 6118416, "step": 1541, "train_runtime": 1254.6355, "train_tokens_per_second": 4876.648 }, { "epoch": 118.53846153846153, "num_input_tokens_seen": 6118416, "step": 1541, "train_accuracy": 0.01171875 }, { "epoch": 118.61538461538461, "grad_norm": 0.3251706659793854, "learning_rate": 0.01, "loss": 4.564596652984619, "num_input_tokens_seen": 6122512, "step": 1542, "train_runtime": 1255.4519, "train_tokens_per_second": 4876.74 }, { "epoch": 118.61538461538461, "num_input_tokens_seen": 6122512, "step": 1542, "train_accuracy": 0.005859375 }, { "epoch": 118.6923076923077, "grad_norm": 0.36576464772224426, "learning_rate": 0.01, "loss": 4.585412502288818, "num_input_tokens_seen": 6126608, "step": 1543, "train_runtime": 1256.2656, "train_tokens_per_second": 4876.841 }, { "epoch": 118.6923076923077, "num_input_tokens_seen": 6126608, "step": 1543, "train_accuracy": 0.01953125 }, { "epoch": 118.76923076923077, "grad_norm": 0.2578296661376953, "learning_rate": 0.01, "loss": 4.5692644119262695, "num_input_tokens_seen": 6130704, "step": 1544, "train_runtime": 1257.0786, "train_tokens_per_second": 4876.946 }, { "epoch": 118.76923076923077, "num_input_tokens_seen": 6130704, "step": 1544, "train_accuracy": 0.005859375 }, { "epoch": 118.84615384615384, "grad_norm": 0.3710087239742279, "learning_rate": 0.01, "loss": 4.584305286407471, "num_input_tokens_seen": 6134800, "step": 1545, "train_runtime": 1257.8904, "train_tokens_per_second": 4877.055 }, { "epoch": 118.84615384615384, "num_input_tokens_seen": 6134800, "step": 1545, "train_accuracy": 0.005859375 }, { "epoch": 118.92307692307692, "grad_norm": 0.2943045496940613, "learning_rate": 0.01, "loss": 4.585121154785156, "num_input_tokens_seen": 6138896, "step": 1546, "train_runtime": 1258.6997, "train_tokens_per_second": 4877.173 }, { "epoch": 118.92307692307692, "num_input_tokens_seen": 6138896, "step": 1546, "train_accuracy": 0.02280130237340927 }, { "epoch": 119.0, "grad_norm": 1.1209063529968262, "learning_rate": 0.01, "loss": 4.567545413970947, "num_input_tokens_seen": 6141352, "step": 1547, "train_runtime": 1259.2139, "train_tokens_per_second": 4877.132 }, { "epoch": 119.0, "num_input_tokens_seen": 6141352, "step": 1547, "train_accuracy": 0.017578125 }, { "epoch": 119.07692307692308, "grad_norm": 0.3971582055091858, "learning_rate": 0.01, "loss": 4.567508697509766, "num_input_tokens_seen": 6145448, "step": 1548, "train_runtime": 1260.0386, "train_tokens_per_second": 4877.19 }, { "epoch": 119.07692307692308, "num_input_tokens_seen": 6145448, "step": 1548, "train_accuracy": 0.01171875 }, { "epoch": 119.15384615384616, "grad_norm": 0.2880050837993622, "learning_rate": 0.01, "loss": 4.574665546417236, "num_input_tokens_seen": 6149544, "step": 1549, "train_runtime": 1260.8528, "train_tokens_per_second": 4877.29 }, { "epoch": 119.15384615384616, "num_input_tokens_seen": 6149544, "step": 1549, "train_accuracy": 0.017578125 }, { "epoch": 119.23076923076923, "grad_norm": 0.2553396224975586, "learning_rate": 0.01, "loss": 4.554409980773926, "num_input_tokens_seen": 6153640, "step": 1550, "train_runtime": 1261.6679, "train_tokens_per_second": 4877.385 }, { "epoch": 119.23076923076923, "num_input_tokens_seen": 6153640, "step": 1550, "train_accuracy": 0.017578125 }, { "epoch": 119.3076923076923, "grad_norm": 0.6814112663269043, "learning_rate": 0.01, "loss": 4.573980331420898, "num_input_tokens_seen": 6157736, "step": 1551, "train_runtime": 1262.4817, "train_tokens_per_second": 4877.485 }, { "epoch": 119.3076923076923, "num_input_tokens_seen": 6157736, "step": 1551, "train_accuracy": 0.009765625 }, { "epoch": 119.38461538461539, "grad_norm": 0.2922833561897278, "learning_rate": 0.01, "loss": 4.581429958343506, "num_input_tokens_seen": 6161832, "step": 1552, "train_runtime": 1263.2957, "train_tokens_per_second": 4877.585 }, { "epoch": 119.38461538461539, "num_input_tokens_seen": 6161832, "step": 1552, "train_accuracy": 0.009765625 }, { "epoch": 119.46153846153847, "grad_norm": 0.27610599994659424, "learning_rate": 0.01, "loss": 4.571043968200684, "num_input_tokens_seen": 6165928, "step": 1553, "train_runtime": 1264.109, "train_tokens_per_second": 4877.687 }, { "epoch": 119.46153846153847, "num_input_tokens_seen": 6165928, "step": 1553, "train_accuracy": 0.0078125 }, { "epoch": 119.53846153846153, "grad_norm": 0.2627987563610077, "learning_rate": 0.01, "loss": 4.556126594543457, "num_input_tokens_seen": 6170024, "step": 1554, "train_runtime": 1264.922, "train_tokens_per_second": 4877.79 }, { "epoch": 119.53846153846153, "num_input_tokens_seen": 6170024, "step": 1554, "train_accuracy": 0.013671875 }, { "epoch": 119.61538461538461, "grad_norm": 0.36993029713630676, "learning_rate": 0.01, "loss": 4.565702438354492, "num_input_tokens_seen": 6174120, "step": 1555, "train_runtime": 1265.7352, "train_tokens_per_second": 4877.892 }, { "epoch": 119.61538461538461, "num_input_tokens_seen": 6174120, "step": 1555, "train_accuracy": 0.01171875 }, { "epoch": 119.6923076923077, "grad_norm": 0.2819044291973114, "learning_rate": 0.01, "loss": 4.570314884185791, "num_input_tokens_seen": 6178216, "step": 1556, "train_runtime": 1266.8144, "train_tokens_per_second": 4876.97 }, { "epoch": 119.6923076923077, "num_input_tokens_seen": 6178216, "step": 1556, "train_accuracy": 0.01171875 }, { "epoch": 119.76923076923077, "grad_norm": 0.3040362298488617, "learning_rate": 0.01, "loss": 4.568306922912598, "num_input_tokens_seen": 6182312, "step": 1557, "train_runtime": 1267.6271, "train_tokens_per_second": 4877.075 }, { "epoch": 119.76923076923077, "num_input_tokens_seen": 6182312, "step": 1557, "train_accuracy": 0.005859375 }, { "epoch": 119.84615384615384, "grad_norm": 0.393155574798584, "learning_rate": 0.01, "loss": 4.59574031829834, "num_input_tokens_seen": 6186408, "step": 1558, "train_runtime": 1268.4395, "train_tokens_per_second": 4877.18 }, { "epoch": 119.84615384615384, "num_input_tokens_seen": 6186408, "step": 1558, "train_accuracy": 0.0078125 }, { "epoch": 119.92307692307692, "grad_norm": 0.46554693579673767, "learning_rate": 0.01, "loss": 4.5911054611206055, "num_input_tokens_seen": 6190504, "step": 1559, "train_runtime": 1269.2489, "train_tokens_per_second": 4877.297 }, { "epoch": 119.92307692307692, "num_input_tokens_seen": 6190504, "step": 1559, "train_accuracy": 0.019543973729014397 }, { "epoch": 120.0, "grad_norm": 0.3963291049003601, "learning_rate": 0.01, "loss": 4.585737705230713, "num_input_tokens_seen": 6192960, "step": 1560, "train_runtime": 1269.7632, "train_tokens_per_second": 4877.256 }, { "epoch": 120.0, "num_input_tokens_seen": 6192960, "step": 1560, "train_accuracy": 0.013671875 }, { "epoch": 120.07692307692308, "grad_norm": 0.18459410965442657, "learning_rate": 0.01, "loss": 4.553705215454102, "num_input_tokens_seen": 6197056, "step": 1561, "train_runtime": 1270.5909, "train_tokens_per_second": 4877.302 }, { "epoch": 120.07692307692308, "num_input_tokens_seen": 6197056, "step": 1561, "train_accuracy": 0.015625 }, { "epoch": 120.15384615384616, "grad_norm": 0.27707549929618835, "learning_rate": 0.01, "loss": 4.553025245666504, "num_input_tokens_seen": 6201152, "step": 1562, "train_runtime": 1271.4035, "train_tokens_per_second": 4877.407 }, { "epoch": 120.15384615384616, "num_input_tokens_seen": 6201152, "step": 1562, "train_accuracy": 0.009765625 }, { "epoch": 120.23076923076923, "grad_norm": 0.3159920573234558, "learning_rate": 0.01, "loss": 4.586309432983398, "num_input_tokens_seen": 6205248, "step": 1563, "train_runtime": 1272.217, "train_tokens_per_second": 4877.507 }, { "epoch": 120.23076923076923, "num_input_tokens_seen": 6205248, "step": 1563, "train_accuracy": 0.00390625 }, { "epoch": 120.3076923076923, "grad_norm": 0.40838930010795593, "learning_rate": 0.01, "loss": 4.560218811035156, "num_input_tokens_seen": 6209344, "step": 1564, "train_runtime": 1273.03, "train_tokens_per_second": 4877.61 }, { "epoch": 120.3076923076923, "num_input_tokens_seen": 6209344, "step": 1564, "train_accuracy": 0.009765625 }, { "epoch": 120.38461538461539, "grad_norm": 0.36436623334884644, "learning_rate": 0.01, "loss": 4.558023929595947, "num_input_tokens_seen": 6213440, "step": 1565, "train_runtime": 1273.8434, "train_tokens_per_second": 4877.711 }, { "epoch": 120.38461538461539, "num_input_tokens_seen": 6213440, "step": 1565, "train_accuracy": 0.015625 }, { "epoch": 120.46153846153847, "grad_norm": 0.30659976601600647, "learning_rate": 0.01, "loss": 4.53167724609375, "num_input_tokens_seen": 6217536, "step": 1566, "train_runtime": 1274.6589, "train_tokens_per_second": 4877.804 }, { "epoch": 120.46153846153847, "num_input_tokens_seen": 6217536, "step": 1566, "train_accuracy": 0.013671875 }, { "epoch": 120.53846153846153, "grad_norm": 0.36716049909591675, "learning_rate": 0.01, "loss": 4.546405792236328, "num_input_tokens_seen": 6221632, "step": 1567, "train_runtime": 1275.474, "train_tokens_per_second": 4877.898 }, { "epoch": 120.53846153846153, "num_input_tokens_seen": 6221632, "step": 1567, "train_accuracy": 0.009765625 }, { "epoch": 120.61538461538461, "grad_norm": 0.19651320576667786, "learning_rate": 0.01, "loss": 4.566239356994629, "num_input_tokens_seen": 6225728, "step": 1568, "train_runtime": 1276.2858, "train_tokens_per_second": 4878.004 }, { "epoch": 120.61538461538461, "num_input_tokens_seen": 6225728, "step": 1568, "train_accuracy": 0.0078125 }, { "epoch": 120.6923076923077, "grad_norm": 0.18629644811153412, "learning_rate": 0.01, "loss": 4.558133125305176, "num_input_tokens_seen": 6229824, "step": 1569, "train_runtime": 1277.0979, "train_tokens_per_second": 4878.11 }, { "epoch": 120.6923076923077, "num_input_tokens_seen": 6229824, "step": 1569, "train_accuracy": 0.013671875 }, { "epoch": 120.76923076923077, "grad_norm": 0.26930102705955505, "learning_rate": 0.01, "loss": 4.562258720397949, "num_input_tokens_seen": 6233920, "step": 1570, "train_runtime": 1277.9112, "train_tokens_per_second": 4878.211 }, { "epoch": 120.76923076923077, "num_input_tokens_seen": 6233920, "step": 1570, "train_accuracy": 0.01171875 }, { "epoch": 120.84615384615384, "grad_norm": 0.3980523347854614, "learning_rate": 0.01, "loss": 4.559825420379639, "num_input_tokens_seen": 6238016, "step": 1571, "train_runtime": 1278.7232, "train_tokens_per_second": 4878.316 }, { "epoch": 120.84615384615384, "num_input_tokens_seen": 6238016, "step": 1571, "train_accuracy": 0.009765625 }, { "epoch": 120.92307692307692, "grad_norm": 0.3914523422718048, "learning_rate": 0.01, "loss": 4.574028968811035, "num_input_tokens_seen": 6242112, "step": 1572, "train_runtime": 1279.5318, "train_tokens_per_second": 4878.434 }, { "epoch": 120.92307692307692, "num_input_tokens_seen": 6242112, "step": 1572, "train_accuracy": 0.0065146577544510365 }, { "epoch": 121.0, "grad_norm": 0.30136576294898987, "learning_rate": 0.01, "loss": 4.564297199249268, "num_input_tokens_seen": 6244568, "step": 1573, "train_runtime": 1280.0471, "train_tokens_per_second": 4878.389 }, { "epoch": 121.0, "num_input_tokens_seen": 6244568, "step": 1573, "train_accuracy": 0.005859375 }, { "epoch": 121.07692307692308, "grad_norm": 0.21680454909801483, "learning_rate": 0.01, "loss": 4.55159854888916, "num_input_tokens_seen": 6248664, "step": 1574, "train_runtime": 1280.8751, "train_tokens_per_second": 4878.433 }, { "epoch": 121.07692307692308, "num_input_tokens_seen": 6248664, "step": 1574, "train_accuracy": 0.013671875 }, { "epoch": 121.15384615384616, "grad_norm": 0.230843186378479, "learning_rate": 0.01, "loss": 4.535984039306641, "num_input_tokens_seen": 6252760, "step": 1575, "train_runtime": 1281.6876, "train_tokens_per_second": 4878.537 }, { "epoch": 121.15384615384616, "num_input_tokens_seen": 6252760, "step": 1575, "train_accuracy": 0.0078125 }, { "epoch": 121.23076923076923, "grad_norm": 0.19835351407527924, "learning_rate": 0.01, "loss": 4.533585548400879, "num_input_tokens_seen": 6256856, "step": 1576, "train_runtime": 1282.5011, "train_tokens_per_second": 4878.636 }, { "epoch": 121.23076923076923, "num_input_tokens_seen": 6256856, "step": 1576, "train_accuracy": 0.015625 }, { "epoch": 121.3076923076923, "grad_norm": 0.5837871432304382, "learning_rate": 0.01, "loss": 4.528852939605713, "num_input_tokens_seen": 6260952, "step": 1577, "train_runtime": 1283.3139, "train_tokens_per_second": 4878.738 }, { "epoch": 121.3076923076923, "num_input_tokens_seen": 6260952, "step": 1577, "train_accuracy": 0.013671875 }, { "epoch": 121.38461538461539, "grad_norm": 0.8927022814750671, "learning_rate": 0.01, "loss": 4.5188751220703125, "num_input_tokens_seen": 6265048, "step": 1578, "train_runtime": 1284.1272, "train_tokens_per_second": 4878.837 }, { "epoch": 121.38461538461539, "num_input_tokens_seen": 6265048, "step": 1578, "train_accuracy": 0.017578125 }, { "epoch": 121.46153846153847, "grad_norm": 2.586885452270508, "learning_rate": 0.01, "loss": 4.525791168212891, "num_input_tokens_seen": 6269144, "step": 1579, "train_runtime": 1284.94, "train_tokens_per_second": 4878.939 }, { "epoch": 121.46153846153847, "num_input_tokens_seen": 6269144, "step": 1579, "train_accuracy": 0.01953125 }, { "epoch": 121.53846153846153, "grad_norm": 1.0155558586120605, "learning_rate": 0.01, "loss": 4.515064239501953, "num_input_tokens_seen": 6273240, "step": 1580, "train_runtime": 1285.7563, "train_tokens_per_second": 4879.027 }, { "epoch": 121.53846153846153, "num_input_tokens_seen": 6273240, "step": 1580, "train_accuracy": 0.017578125 }, { "epoch": 121.61538461538461, "grad_norm": 0.36298471689224243, "learning_rate": 0.01, "loss": 4.528317451477051, "num_input_tokens_seen": 6277336, "step": 1581, "train_runtime": 1286.5716, "train_tokens_per_second": 4879.119 }, { "epoch": 121.61538461538461, "num_input_tokens_seen": 6277336, "step": 1581, "train_accuracy": 0.005859375 }, { "epoch": 121.6923076923077, "grad_norm": 1.5292681455612183, "learning_rate": 0.01, "loss": 4.569167137145996, "num_input_tokens_seen": 6281432, "step": 1582, "train_runtime": 1287.3859, "train_tokens_per_second": 4879.214 }, { "epoch": 121.6923076923077, "num_input_tokens_seen": 6281432, "step": 1582, "train_accuracy": 0.015625 }, { "epoch": 121.76923076923077, "grad_norm": 0.34332823753356934, "learning_rate": 0.01, "loss": 4.535788536071777, "num_input_tokens_seen": 6285528, "step": 1583, "train_runtime": 1288.1992, "train_tokens_per_second": 4879.314 }, { "epoch": 121.76923076923077, "num_input_tokens_seen": 6285528, "step": 1583, "train_accuracy": 0.009765625 }, { "epoch": 121.84615384615384, "grad_norm": 0.4531383216381073, "learning_rate": 0.01, "loss": 4.5581207275390625, "num_input_tokens_seen": 6289624, "step": 1584, "train_runtime": 1289.0122, "train_tokens_per_second": 4879.414 }, { "epoch": 121.84615384615384, "num_input_tokens_seen": 6289624, "step": 1584, "train_accuracy": 0.015625 }, { "epoch": 121.92307692307692, "grad_norm": 0.27923622727394104, "learning_rate": 0.01, "loss": 4.559006690979004, "num_input_tokens_seen": 6293720, "step": 1585, "train_runtime": 1289.8213, "train_tokens_per_second": 4879.529 }, { "epoch": 121.92307692307692, "num_input_tokens_seen": 6293720, "step": 1585, "train_accuracy": 0.013029315508902073 }, { "epoch": 122.0, "grad_norm": 0.5589063167572021, "learning_rate": 0.01, "loss": 4.544114589691162, "num_input_tokens_seen": 6296176, "step": 1586, "train_runtime": 1290.3365, "train_tokens_per_second": 4879.484 }, { "epoch": 122.0, "num_input_tokens_seen": 6296176, "step": 1586, "train_accuracy": 0.013671875 }, { "epoch": 122.07692307692308, "grad_norm": 6.564464092254639, "learning_rate": 0.01, "loss": 4.536205768585205, "num_input_tokens_seen": 6300272, "step": 1587, "train_runtime": 1291.1625, "train_tokens_per_second": 4879.534 }, { "epoch": 122.07692307692308, "num_input_tokens_seen": 6300272, "step": 1587, "train_accuracy": 0.015625 }, { "epoch": 122.15384615384616, "grad_norm": 0.27498263120651245, "learning_rate": 0.01, "loss": 4.545239448547363, "num_input_tokens_seen": 6304368, "step": 1588, "train_runtime": 1291.9743, "train_tokens_per_second": 4879.639 }, { "epoch": 122.15384615384616, "num_input_tokens_seen": 6304368, "step": 1588, "train_accuracy": 0.015625 }, { "epoch": 122.23076923076923, "grad_norm": 0.24746458232402802, "learning_rate": 0.01, "loss": 4.548259735107422, "num_input_tokens_seen": 6308464, "step": 1589, "train_runtime": 1292.786, "train_tokens_per_second": 4879.743 }, { "epoch": 122.23076923076923, "num_input_tokens_seen": 6308464, "step": 1589, "train_accuracy": 0.0078125 }, { "epoch": 122.3076923076923, "grad_norm": 0.2766924798488617, "learning_rate": 0.01, "loss": 4.5435686111450195, "num_input_tokens_seen": 6312560, "step": 1590, "train_runtime": 1293.5982, "train_tokens_per_second": 4879.846 }, { "epoch": 122.3076923076923, "num_input_tokens_seen": 6312560, "step": 1590, "train_accuracy": 0.021484375 }, { "epoch": 122.38461538461539, "grad_norm": 0.45969757437705994, "learning_rate": 0.01, "loss": 4.556778907775879, "num_input_tokens_seen": 6316656, "step": 1591, "train_runtime": 1294.4097, "train_tokens_per_second": 4879.951 }, { "epoch": 122.38461538461539, "num_input_tokens_seen": 6316656, "step": 1591, "train_accuracy": 0.021484375 }, { "epoch": 122.46153846153847, "grad_norm": 0.3670724034309387, "learning_rate": 0.01, "loss": 4.519824981689453, "num_input_tokens_seen": 6320752, "step": 1592, "train_runtime": 1295.2225, "train_tokens_per_second": 4880.051 }, { "epoch": 122.46153846153847, "num_input_tokens_seen": 6320752, "step": 1592, "train_accuracy": 0.017578125 }, { "epoch": 122.53846153846153, "grad_norm": 0.39103612303733826, "learning_rate": 0.01, "loss": 4.520946025848389, "num_input_tokens_seen": 6324848, "step": 1593, "train_runtime": 1296.0353, "train_tokens_per_second": 4880.151 }, { "epoch": 122.53846153846153, "num_input_tokens_seen": 6324848, "step": 1593, "train_accuracy": 0.01171875 }, { "epoch": 122.61538461538461, "grad_norm": 0.3757348954677582, "learning_rate": 0.01, "loss": 4.541189670562744, "num_input_tokens_seen": 6328944, "step": 1594, "train_runtime": 1296.8499, "train_tokens_per_second": 4880.244 }, { "epoch": 122.61538461538461, "num_input_tokens_seen": 6328944, "step": 1594, "train_accuracy": 0.015625 }, { "epoch": 122.6923076923077, "grad_norm": 0.4918854534626007, "learning_rate": 0.01, "loss": 4.520682334899902, "num_input_tokens_seen": 6333040, "step": 1595, "train_runtime": 1297.6675, "train_tokens_per_second": 4880.326 }, { "epoch": 122.6923076923077, "num_input_tokens_seen": 6333040, "step": 1595, "train_accuracy": 0.0078125 }, { "epoch": 122.76923076923077, "grad_norm": 0.24628299474716187, "learning_rate": 0.01, "loss": 4.551218032836914, "num_input_tokens_seen": 6337136, "step": 1596, "train_runtime": 1298.4828, "train_tokens_per_second": 4880.416 }, { "epoch": 122.76923076923077, "num_input_tokens_seen": 6337136, "step": 1596, "train_accuracy": 0.00390625 }, { "epoch": 122.84615384615384, "grad_norm": 0.2693702280521393, "learning_rate": 0.01, "loss": 4.543005466461182, "num_input_tokens_seen": 6341232, "step": 1597, "train_runtime": 1299.2991, "train_tokens_per_second": 4880.502 }, { "epoch": 122.84615384615384, "num_input_tokens_seen": 6341232, "step": 1597, "train_accuracy": 0.013671875 }, { "epoch": 122.92307692307692, "grad_norm": 0.22442473471164703, "learning_rate": 0.01, "loss": 4.543325901031494, "num_input_tokens_seen": 6345328, "step": 1598, "train_runtime": 1300.1073, "train_tokens_per_second": 4880.619 }, { "epoch": 122.92307692307692, "num_input_tokens_seen": 6345328, "step": 1598, "train_accuracy": 0.009771986864507198 }, { "epoch": 123.0, "grad_norm": 0.2987178564071655, "learning_rate": 0.01, "loss": 4.5363359451293945, "num_input_tokens_seen": 6347784, "step": 1599, "train_runtime": 1300.6223, "train_tokens_per_second": 4880.575 }, { "epoch": 123.0, "num_input_tokens_seen": 6347784, "step": 1599, "train_accuracy": 0.021484375 }, { "epoch": 123.07692307692308, "grad_norm": 0.3728465139865875, "learning_rate": 0.01, "loss": 4.529542446136475, "num_input_tokens_seen": 6351880, "step": 1600, "train_runtime": 1301.447, "train_tokens_per_second": 4880.629 }, { "epoch": 123.07692307692308, "eval_CMD_3_branch_eval_accuracy": 0.00976491862567812, "eval_CMD_3_branch_eval_loss": 4.556027412414551, "eval_CMD_3_branch_eval_runtime": 1.1547, "eval_CMD_3_branch_eval_samples_per_second": 2394.554, "eval_CMD_3_branch_eval_steps_per_second": 5.196, "num_input_tokens_seen": 6351880, "step": 1600 }, { "epoch": 123.07692307692308, "num_input_tokens_seen": 6351880, "step": 1600, "train_accuracy": 0.009765625 }, { "epoch": 123.15384615384616, "grad_norm": 0.7718985676765442, "learning_rate": 0.01, "loss": 4.517962455749512, "num_input_tokens_seen": 6355976, "step": 1601, "train_runtime": 1303.4195, "train_tokens_per_second": 4876.385 }, { "epoch": 123.15384615384616, "num_input_tokens_seen": 6355976, "step": 1601, "train_accuracy": 0.01953125 }, { "epoch": 123.23076923076923, "grad_norm": 0.4242638945579529, "learning_rate": 0.01, "loss": 4.509787559509277, "num_input_tokens_seen": 6360072, "step": 1602, "train_runtime": 1304.2336, "train_tokens_per_second": 4876.482 }, { "epoch": 123.23076923076923, "num_input_tokens_seen": 6360072, "step": 1602, "train_accuracy": 0.017578125 }, { "epoch": 123.3076923076923, "grad_norm": 0.2297019511461258, "learning_rate": 0.01, "loss": 4.508452415466309, "num_input_tokens_seen": 6364168, "step": 1603, "train_runtime": 1305.0504, "train_tokens_per_second": 4876.569 }, { "epoch": 123.3076923076923, "num_input_tokens_seen": 6364168, "step": 1603, "train_accuracy": 0.015625 }, { "epoch": 123.38461538461539, "grad_norm": 3.918861150741577, "learning_rate": 0.01, "loss": 4.52266788482666, "num_input_tokens_seen": 6368264, "step": 1604, "train_runtime": 1305.8653, "train_tokens_per_second": 4876.662 }, { "epoch": 123.38461538461539, "num_input_tokens_seen": 6368264, "step": 1604, "train_accuracy": 0.013671875 }, { "epoch": 123.46153846153847, "grad_norm": 0.28163081407546997, "learning_rate": 0.01, "loss": 4.511225700378418, "num_input_tokens_seen": 6372360, "step": 1605, "train_runtime": 1306.6785, "train_tokens_per_second": 4876.762 }, { "epoch": 123.46153846153847, "num_input_tokens_seen": 6372360, "step": 1605, "train_accuracy": 0.009765625 }, { "epoch": 123.53846153846153, "grad_norm": 0.8108887672424316, "learning_rate": 0.01, "loss": 4.5190958976745605, "num_input_tokens_seen": 6376456, "step": 1606, "train_runtime": 1307.4919, "train_tokens_per_second": 4876.861 }, { "epoch": 123.53846153846153, "num_input_tokens_seen": 6376456, "step": 1606, "train_accuracy": 0.009765625 }, { "epoch": 123.61538461538461, "grad_norm": 0.43255141377449036, "learning_rate": 0.01, "loss": 4.543148517608643, "num_input_tokens_seen": 6380552, "step": 1607, "train_runtime": 1308.3067, "train_tokens_per_second": 4876.954 }, { "epoch": 123.61538461538461, "num_input_tokens_seen": 6380552, "step": 1607, "train_accuracy": 0.013671875 }, { "epoch": 123.6923076923077, "grad_norm": 0.43423449993133545, "learning_rate": 0.01, "loss": 4.50079345703125, "num_input_tokens_seen": 6384648, "step": 1608, "train_runtime": 1309.1205, "train_tokens_per_second": 4877.051 }, { "epoch": 123.6923076923077, "num_input_tokens_seen": 6384648, "step": 1608, "train_accuracy": 0.015625 }, { "epoch": 123.76923076923077, "grad_norm": 0.3461111783981323, "learning_rate": 0.01, "loss": 4.5239973068237305, "num_input_tokens_seen": 6388744, "step": 1609, "train_runtime": 1309.9338, "train_tokens_per_second": 4877.15 }, { "epoch": 123.76923076923077, "num_input_tokens_seen": 6388744, "step": 1609, "train_accuracy": 0.015625 }, { "epoch": 123.84615384615384, "grad_norm": 0.2603447139263153, "learning_rate": 0.01, "loss": 4.500923156738281, "num_input_tokens_seen": 6392840, "step": 1610, "train_runtime": 1310.7472, "train_tokens_per_second": 4877.249 }, { "epoch": 123.84615384615384, "num_input_tokens_seen": 6392840, "step": 1610, "train_accuracy": 0.0078125 }, { "epoch": 123.92307692307692, "grad_norm": 0.3868979513645172, "learning_rate": 0.01, "loss": 4.53810977935791, "num_input_tokens_seen": 6396936, "step": 1611, "train_runtime": 1311.5584, "train_tokens_per_second": 4877.355 }, { "epoch": 123.92307692307692, "num_input_tokens_seen": 6396936, "step": 1611, "train_accuracy": 0.0032573288772255182 }, { "epoch": 124.0, "grad_norm": 0.3463993966579437, "learning_rate": 0.01, "loss": 4.504649639129639, "num_input_tokens_seen": 6399392, "step": 1612, "train_runtime": 1312.0732, "train_tokens_per_second": 4877.313 }, { "epoch": 124.0, "num_input_tokens_seen": 6399392, "step": 1612, "train_accuracy": 0.021484375 }, { "epoch": 124.07692307692308, "grad_norm": 0.2502296566963196, "learning_rate": 0.01, "loss": 4.480804920196533, "num_input_tokens_seen": 6403488, "step": 1613, "train_runtime": 1312.8993, "train_tokens_per_second": 4877.364 }, { "epoch": 124.07692307692308, "num_input_tokens_seen": 6403488, "step": 1613, "train_accuracy": 0.00390625 }, { "epoch": 124.15384615384616, "grad_norm": 0.3520311117172241, "learning_rate": 0.01, "loss": 4.5011162757873535, "num_input_tokens_seen": 6407584, "step": 1614, "train_runtime": 1313.7128, "train_tokens_per_second": 4877.462 }, { "epoch": 124.15384615384616, "num_input_tokens_seen": 6407584, "step": 1614, "train_accuracy": 0.02734375 }, { "epoch": 124.23076923076923, "grad_norm": 0.31740519404411316, "learning_rate": 0.01, "loss": 4.49839973449707, "num_input_tokens_seen": 6411680, "step": 1615, "train_runtime": 1314.5269, "train_tokens_per_second": 4877.557 }, { "epoch": 124.23076923076923, "num_input_tokens_seen": 6411680, "step": 1615, "train_accuracy": 0.0234375 }, { "epoch": 124.3076923076923, "grad_norm": 1.2244733572006226, "learning_rate": 0.01, "loss": 4.507872104644775, "num_input_tokens_seen": 6415776, "step": 1616, "train_runtime": 1315.3402, "train_tokens_per_second": 4877.655 }, { "epoch": 124.3076923076923, "num_input_tokens_seen": 6415776, "step": 1616, "train_accuracy": 0.013671875 }, { "epoch": 124.38461538461539, "grad_norm": 0.23134058713912964, "learning_rate": 0.01, "loss": 4.503739356994629, "num_input_tokens_seen": 6419872, "step": 1617, "train_runtime": 1316.1544, "train_tokens_per_second": 4877.75 }, { "epoch": 124.38461538461539, "num_input_tokens_seen": 6419872, "step": 1617, "train_accuracy": 0.013671875 }, { "epoch": 124.46153846153847, "grad_norm": 0.23125620186328888, "learning_rate": 0.01, "loss": 4.487939834594727, "num_input_tokens_seen": 6423968, "step": 1618, "train_runtime": 1316.9681, "train_tokens_per_second": 4877.846 }, { "epoch": 124.46153846153847, "num_input_tokens_seen": 6423968, "step": 1618, "train_accuracy": 0.01171875 }, { "epoch": 124.53846153846153, "grad_norm": 0.38358980417251587, "learning_rate": 0.01, "loss": 4.493551254272461, "num_input_tokens_seen": 6428064, "step": 1619, "train_runtime": 1317.7821, "train_tokens_per_second": 4877.941 }, { "epoch": 124.53846153846153, "num_input_tokens_seen": 6428064, "step": 1619, "train_accuracy": 0.015625 }, { "epoch": 124.61538461538461, "grad_norm": 0.2873987555503845, "learning_rate": 0.01, "loss": 4.499876976013184, "num_input_tokens_seen": 6432160, "step": 1620, "train_runtime": 1318.5957, "train_tokens_per_second": 4878.038 }, { "epoch": 124.61538461538461, "num_input_tokens_seen": 6432160, "step": 1620, "train_accuracy": 0.013671875 }, { "epoch": 124.6923076923077, "grad_norm": 0.34333235025405884, "learning_rate": 0.01, "loss": 4.523139953613281, "num_input_tokens_seen": 6436256, "step": 1621, "train_runtime": 1319.4087, "train_tokens_per_second": 4878.137 }, { "epoch": 124.6923076923077, "num_input_tokens_seen": 6436256, "step": 1621, "train_accuracy": 0.01953125 }, { "epoch": 124.76923076923077, "grad_norm": 0.2574313282966614, "learning_rate": 0.01, "loss": 4.504465103149414, "num_input_tokens_seen": 6440352, "step": 1622, "train_runtime": 1320.2226, "train_tokens_per_second": 4878.232 }, { "epoch": 124.76923076923077, "num_input_tokens_seen": 6440352, "step": 1622, "train_accuracy": 0.017578125 }, { "epoch": 124.84615384615384, "grad_norm": 0.42629674077033997, "learning_rate": 0.01, "loss": 4.479188919067383, "num_input_tokens_seen": 6444448, "step": 1623, "train_runtime": 1321.0355, "train_tokens_per_second": 4878.331 }, { "epoch": 124.84615384615384, "num_input_tokens_seen": 6444448, "step": 1623, "train_accuracy": 0.01171875 }, { "epoch": 124.92307692307692, "grad_norm": 0.4172653257846832, "learning_rate": 0.01, "loss": 4.5147705078125, "num_input_tokens_seen": 6448544, "step": 1624, "train_runtime": 1321.8485, "train_tokens_per_second": 4878.429 }, { "epoch": 124.92307692307692, "num_input_tokens_seen": 6448544, "step": 1624, "train_accuracy": 0.013029315508902073 }, { "epoch": 125.0, "grad_norm": 0.489302396774292, "learning_rate": 0.01, "loss": 4.570430278778076, "num_input_tokens_seen": 6451000, "step": 1625, "train_runtime": 1322.3633, "train_tokens_per_second": 4878.387 }, { "epoch": 125.0, "num_input_tokens_seen": 6451000, "step": 1625, "train_accuracy": 0.025390625 }, { "epoch": 125.07692307692308, "grad_norm": 0.25735050439834595, "learning_rate": 0.01, "loss": 4.496250629425049, "num_input_tokens_seen": 6455096, "step": 1626, "train_runtime": 1323.1893, "train_tokens_per_second": 4878.437 }, { "epoch": 125.07692307692308, "num_input_tokens_seen": 6455096, "step": 1626, "train_accuracy": 0.01171875 }, { "epoch": 125.15384615384616, "grad_norm": 0.3413771390914917, "learning_rate": 0.01, "loss": 4.487084865570068, "num_input_tokens_seen": 6459192, "step": 1627, "train_runtime": 1324.0028, "train_tokens_per_second": 4878.534 }, { "epoch": 125.15384615384616, "num_input_tokens_seen": 6459192, "step": 1627, "train_accuracy": 0.017578125 }, { "epoch": 125.23076923076923, "grad_norm": 0.3020739257335663, "learning_rate": 0.01, "loss": 4.504093170166016, "num_input_tokens_seen": 6463288, "step": 1628, "train_runtime": 1324.817, "train_tokens_per_second": 4878.627 }, { "epoch": 125.23076923076923, "num_input_tokens_seen": 6463288, "step": 1628, "train_accuracy": 0.021484375 }, { "epoch": 125.3076923076923, "grad_norm": 0.5350129008293152, "learning_rate": 0.01, "loss": 4.505185127258301, "num_input_tokens_seen": 6467384, "step": 1629, "train_runtime": 1325.6306, "train_tokens_per_second": 4878.723 }, { "epoch": 125.3076923076923, "num_input_tokens_seen": 6467384, "step": 1629, "train_accuracy": 0.01953125 }, { "epoch": 125.38461538461539, "grad_norm": 0.29904764890670776, "learning_rate": 0.01, "loss": 4.511266231536865, "num_input_tokens_seen": 6471480, "step": 1630, "train_runtime": 1326.4447, "train_tokens_per_second": 4878.816 }, { "epoch": 125.38461538461539, "num_input_tokens_seen": 6471480, "step": 1630, "train_accuracy": 0.01171875 }, { "epoch": 125.46153846153847, "grad_norm": 0.3054788410663605, "learning_rate": 0.01, "loss": 4.485260009765625, "num_input_tokens_seen": 6475576, "step": 1631, "train_runtime": 1327.2603, "train_tokens_per_second": 4878.904 }, { "epoch": 125.46153846153847, "num_input_tokens_seen": 6475576, "step": 1631, "train_accuracy": 0.0234375 }, { "epoch": 125.53846153846153, "grad_norm": 0.34672224521636963, "learning_rate": 0.01, "loss": 4.496123790740967, "num_input_tokens_seen": 6479672, "step": 1632, "train_runtime": 1328.0741, "train_tokens_per_second": 4878.999 }, { "epoch": 125.53846153846153, "num_input_tokens_seen": 6479672, "step": 1632, "train_accuracy": 0.01171875 }, { "epoch": 125.61538461538461, "grad_norm": 0.33455249667167664, "learning_rate": 0.01, "loss": 4.514712333679199, "num_input_tokens_seen": 6483768, "step": 1633, "train_runtime": 1328.8871, "train_tokens_per_second": 4879.096 }, { "epoch": 125.61538461538461, "num_input_tokens_seen": 6483768, "step": 1633, "train_accuracy": 0.01953125 }, { "epoch": 125.6923076923077, "grad_norm": 0.3615611493587494, "learning_rate": 0.01, "loss": 4.473272800445557, "num_input_tokens_seen": 6487864, "step": 1634, "train_runtime": 1329.7004, "train_tokens_per_second": 4879.192 }, { "epoch": 125.6923076923077, "num_input_tokens_seen": 6487864, "step": 1634, "train_accuracy": 0.021484375 }, { "epoch": 125.76923076923077, "grad_norm": 0.3291076421737671, "learning_rate": 0.01, "loss": 4.481527805328369, "num_input_tokens_seen": 6491960, "step": 1635, "train_runtime": 1330.5145, "train_tokens_per_second": 4879.285 }, { "epoch": 125.76923076923077, "num_input_tokens_seen": 6491960, "step": 1635, "train_accuracy": 0.017578125 }, { "epoch": 125.84615384615384, "grad_norm": 0.27003857493400574, "learning_rate": 0.01, "loss": 4.5121259689331055, "num_input_tokens_seen": 6496056, "step": 1636, "train_runtime": 1331.3279, "train_tokens_per_second": 4879.381 }, { "epoch": 125.84615384615384, "num_input_tokens_seen": 6496056, "step": 1636, "train_accuracy": 0.0078125 }, { "epoch": 125.92307692307692, "grad_norm": 1.236617922782898, "learning_rate": 0.01, "loss": 4.4990410804748535, "num_input_tokens_seen": 6500152, "step": 1637, "train_runtime": 1332.1368, "train_tokens_per_second": 4879.493 }, { "epoch": 125.92307692307692, "num_input_tokens_seen": 6500152, "step": 1637, "train_accuracy": 0.009771986864507198 }, { "epoch": 126.0, "grad_norm": 0.4936729669570923, "learning_rate": 0.01, "loss": 4.497000217437744, "num_input_tokens_seen": 6502608, "step": 1638, "train_runtime": 1332.6521, "train_tokens_per_second": 4879.449 }, { "epoch": 126.0, "num_input_tokens_seen": 6502608, "step": 1638, "train_accuracy": 0.0234375 }, { "epoch": 126.07692307692308, "grad_norm": 1.1737216711044312, "learning_rate": 0.01, "loss": 4.479070663452148, "num_input_tokens_seen": 6506704, "step": 1639, "train_runtime": 1333.4797, "train_tokens_per_second": 4879.492 }, { "epoch": 126.07692307692308, "num_input_tokens_seen": 6506704, "step": 1639, "train_accuracy": 0.0234375 }, { "epoch": 126.15384615384616, "grad_norm": 0.24445922672748566, "learning_rate": 0.01, "loss": 4.45222282409668, "num_input_tokens_seen": 6510800, "step": 1640, "train_runtime": 1334.2924, "train_tokens_per_second": 4879.59 }, { "epoch": 126.15384615384616, "num_input_tokens_seen": 6510800, "step": 1640, "train_accuracy": 0.009765625 }, { "epoch": 126.23076923076923, "grad_norm": 0.37953752279281616, "learning_rate": 0.01, "loss": 4.512228488922119, "num_input_tokens_seen": 6514896, "step": 1641, "train_runtime": 1335.1062, "train_tokens_per_second": 4879.684 }, { "epoch": 126.23076923076923, "num_input_tokens_seen": 6514896, "step": 1641, "train_accuracy": 0.021484375 }, { "epoch": 126.3076923076923, "grad_norm": 0.27803337574005127, "learning_rate": 0.01, "loss": 4.438938140869141, "num_input_tokens_seen": 6518992, "step": 1642, "train_runtime": 1335.9201, "train_tokens_per_second": 4879.777 }, { "epoch": 126.3076923076923, "num_input_tokens_seen": 6518992, "step": 1642, "train_accuracy": 0.01953125 }, { "epoch": 126.38461538461539, "grad_norm": 0.5527097582817078, "learning_rate": 0.01, "loss": 4.486285209655762, "num_input_tokens_seen": 6523088, "step": 1643, "train_runtime": 1336.7334, "train_tokens_per_second": 4879.872 }, { "epoch": 126.38461538461539, "num_input_tokens_seen": 6523088, "step": 1643, "train_accuracy": 0.017578125 }, { "epoch": 126.46153846153847, "grad_norm": 0.2564176917076111, "learning_rate": 0.01, "loss": 4.4830732345581055, "num_input_tokens_seen": 6527184, "step": 1644, "train_runtime": 1337.5463, "train_tokens_per_second": 4879.969 }, { "epoch": 126.46153846153847, "num_input_tokens_seen": 6527184, "step": 1644, "train_accuracy": 0.013671875 }, { "epoch": 126.53846153846153, "grad_norm": 0.5148802995681763, "learning_rate": 0.01, "loss": 4.4817304611206055, "num_input_tokens_seen": 6531280, "step": 1645, "train_runtime": 1338.3606, "train_tokens_per_second": 4880.06 }, { "epoch": 126.53846153846153, "num_input_tokens_seen": 6531280, "step": 1645, "train_accuracy": 0.013671875 }, { "epoch": 126.61538461538461, "grad_norm": 0.3720771074295044, "learning_rate": 0.01, "loss": 4.476485252380371, "num_input_tokens_seen": 6535376, "step": 1646, "train_runtime": 1339.1734, "train_tokens_per_second": 4880.157 }, { "epoch": 126.61538461538461, "num_input_tokens_seen": 6535376, "step": 1646, "train_accuracy": 0.009765625 }, { "epoch": 126.6923076923077, "grad_norm": 0.225808784365654, "learning_rate": 0.01, "loss": 4.528336524963379, "num_input_tokens_seen": 6539472, "step": 1647, "train_runtime": 1339.9879, "train_tokens_per_second": 4880.247 }, { "epoch": 126.6923076923077, "num_input_tokens_seen": 6539472, "step": 1647, "train_accuracy": 0.01171875 }, { "epoch": 126.76923076923077, "grad_norm": 0.620141863822937, "learning_rate": 0.01, "loss": 4.514115333557129, "num_input_tokens_seen": 6543568, "step": 1648, "train_runtime": 1340.8025, "train_tokens_per_second": 4880.337 }, { "epoch": 126.76923076923077, "num_input_tokens_seen": 6543568, "step": 1648, "train_accuracy": 0.013671875 }, { "epoch": 126.84615384615384, "grad_norm": 0.39430055022239685, "learning_rate": 0.01, "loss": 4.453020095825195, "num_input_tokens_seen": 6547664, "step": 1649, "train_runtime": 1341.6178, "train_tokens_per_second": 4880.424 }, { "epoch": 126.84615384615384, "num_input_tokens_seen": 6547664, "step": 1649, "train_accuracy": 0.015625 }, { "epoch": 126.92307692307692, "grad_norm": 0.3218206465244293, "learning_rate": 0.01, "loss": 4.488650321960449, "num_input_tokens_seen": 6551760, "step": 1650, "train_runtime": 1342.4271, "train_tokens_per_second": 4880.533 }, { "epoch": 126.92307692307692, "num_input_tokens_seen": 6551760, "step": 1650, "train_accuracy": 0.016286645084619522 }, { "epoch": 127.0, "grad_norm": 0.4372219443321228, "learning_rate": 0.01, "loss": 4.472595691680908, "num_input_tokens_seen": 6554216, "step": 1651, "train_runtime": 1342.9429, "train_tokens_per_second": 4880.488 }, { "epoch": 127.0, "num_input_tokens_seen": 6554216, "step": 1651, "train_accuracy": 0.013671875 }, { "epoch": 127.07692307692308, "grad_norm": 0.565567135810852, "learning_rate": 0.01, "loss": 4.468566417694092, "num_input_tokens_seen": 6558312, "step": 1652, "train_runtime": 1343.7698, "train_tokens_per_second": 4880.532 }, { "epoch": 127.07692307692308, "num_input_tokens_seen": 6558312, "step": 1652, "train_accuracy": 0.0234375 }, { "epoch": 127.15384615384616, "grad_norm": 0.4018939435482025, "learning_rate": 0.01, "loss": 4.468479633331299, "num_input_tokens_seen": 6562408, "step": 1653, "train_runtime": 1344.5841, "train_tokens_per_second": 4880.623 }, { "epoch": 127.15384615384616, "num_input_tokens_seen": 6562408, "step": 1653, "train_accuracy": 0.01171875 }, { "epoch": 127.23076923076923, "grad_norm": 0.44568854570388794, "learning_rate": 0.01, "loss": 4.407977104187012, "num_input_tokens_seen": 6566504, "step": 1654, "train_runtime": 1345.3978, "train_tokens_per_second": 4880.716 }, { "epoch": 127.23076923076923, "num_input_tokens_seen": 6566504, "step": 1654, "train_accuracy": 0.015625 }, { "epoch": 127.3076923076923, "grad_norm": 0.45499709248542786, "learning_rate": 0.01, "loss": 4.49755334854126, "num_input_tokens_seen": 6570600, "step": 1655, "train_runtime": 1346.2113, "train_tokens_per_second": 4880.809 }, { "epoch": 127.3076923076923, "num_input_tokens_seen": 6570600, "step": 1655, "train_accuracy": 0.029296875 }, { "epoch": 127.38461538461539, "grad_norm": 0.35654014348983765, "learning_rate": 0.01, "loss": 4.417347431182861, "num_input_tokens_seen": 6574696, "step": 1656, "train_runtime": 1347.0263, "train_tokens_per_second": 4880.897 }, { "epoch": 127.38461538461539, "num_input_tokens_seen": 6574696, "step": 1656, "train_accuracy": 0.01953125 }, { "epoch": 127.46153846153847, "grad_norm": 1.5767470598220825, "learning_rate": 0.01, "loss": 4.4421610832214355, "num_input_tokens_seen": 6578792, "step": 1657, "train_runtime": 1347.8417, "train_tokens_per_second": 4880.983 }, { "epoch": 127.46153846153847, "num_input_tokens_seen": 6578792, "step": 1657, "train_accuracy": 0.021484375 }, { "epoch": 127.53846153846153, "grad_norm": 2.769388198852539, "learning_rate": 0.01, "loss": 4.470029830932617, "num_input_tokens_seen": 6582888, "step": 1658, "train_runtime": 1348.6593, "train_tokens_per_second": 4881.061 }, { "epoch": 127.53846153846153, "num_input_tokens_seen": 6582888, "step": 1658, "train_accuracy": 0.00390625 }, { "epoch": 127.61538461538461, "grad_norm": 0.3703688979148865, "learning_rate": 0.01, "loss": 4.554350852966309, "num_input_tokens_seen": 6586984, "step": 1659, "train_runtime": 1349.4813, "train_tokens_per_second": 4881.123 }, { "epoch": 127.61538461538461, "num_input_tokens_seen": 6586984, "step": 1659, "train_accuracy": 0.017578125 }, { "epoch": 127.6923076923077, "grad_norm": 0.28809821605682373, "learning_rate": 0.01, "loss": 4.53988790512085, "num_input_tokens_seen": 6591080, "step": 1660, "train_runtime": 1350.2957, "train_tokens_per_second": 4881.212 }, { "epoch": 127.6923076923077, "num_input_tokens_seen": 6591080, "step": 1660, "train_accuracy": 0.01171875 }, { "epoch": 127.76923076923077, "grad_norm": 0.20119811594486237, "learning_rate": 0.01, "loss": 4.546500205993652, "num_input_tokens_seen": 6595176, "step": 1661, "train_runtime": 1351.1102, "train_tokens_per_second": 4881.301 }, { "epoch": 127.76923076923077, "num_input_tokens_seen": 6595176, "step": 1661, "train_accuracy": 0.015625 }, { "epoch": 127.84615384615384, "grad_norm": 0.4292847514152527, "learning_rate": 0.01, "loss": 4.514669895172119, "num_input_tokens_seen": 6599272, "step": 1662, "train_runtime": 1351.9254, "train_tokens_per_second": 4881.388 }, { "epoch": 127.84615384615384, "num_input_tokens_seen": 6599272, "step": 1662, "train_accuracy": 0.013671875 }, { "epoch": 127.92307692307692, "grad_norm": 0.2840721309185028, "learning_rate": 0.01, "loss": 4.520134449005127, "num_input_tokens_seen": 6603368, "step": 1663, "train_runtime": 1352.7368, "train_tokens_per_second": 4881.488 }, { "epoch": 127.92307692307692, "num_input_tokens_seen": 6603368, "step": 1663, "train_accuracy": 0.009771986864507198 }, { "epoch": 128.0, "grad_norm": 0.2847785949707031, "learning_rate": 0.01, "loss": 4.505764961242676, "num_input_tokens_seen": 6605824, "step": 1664, "train_runtime": 1353.2521, "train_tokens_per_second": 4881.444 }, { "epoch": 128.0, "num_input_tokens_seen": 6605824, "step": 1664, "train_accuracy": 0.021484375 }, { "epoch": 128.07692307692307, "grad_norm": 0.2890031933784485, "learning_rate": 0.01, "loss": 4.50120735168457, "num_input_tokens_seen": 6609920, "step": 1665, "train_runtime": 1354.0795, "train_tokens_per_second": 4881.486 }, { "epoch": 128.07692307692307, "num_input_tokens_seen": 6609920, "step": 1665, "train_accuracy": 0.015625 }, { "epoch": 128.15384615384616, "grad_norm": 0.46287044882774353, "learning_rate": 0.01, "loss": 4.448619842529297, "num_input_tokens_seen": 6614016, "step": 1666, "train_runtime": 1354.8941, "train_tokens_per_second": 4881.574 }, { "epoch": 128.15384615384616, "num_input_tokens_seen": 6614016, "step": 1666, "train_accuracy": 0.01953125 }, { "epoch": 128.23076923076923, "grad_norm": 0.3689666986465454, "learning_rate": 0.01, "loss": 4.424829006195068, "num_input_tokens_seen": 6618112, "step": 1667, "train_runtime": 1355.7089, "train_tokens_per_second": 4881.661 }, { "epoch": 128.23076923076923, "num_input_tokens_seen": 6618112, "step": 1667, "train_accuracy": 0.015625 }, { "epoch": 128.30769230769232, "grad_norm": 0.36388009786605835, "learning_rate": 0.01, "loss": 4.468934059143066, "num_input_tokens_seen": 6622208, "step": 1668, "train_runtime": 1356.5239, "train_tokens_per_second": 4881.748 }, { "epoch": 128.30769230769232, "num_input_tokens_seen": 6622208, "step": 1668, "train_accuracy": 0.01953125 }, { "epoch": 128.3846153846154, "grad_norm": 0.8547375202178955, "learning_rate": 0.01, "loss": 4.457394599914551, "num_input_tokens_seen": 6626304, "step": 1669, "train_runtime": 1357.3392, "train_tokens_per_second": 4881.833 }, { "epoch": 128.3846153846154, "num_input_tokens_seen": 6626304, "step": 1669, "train_accuracy": 0.01953125 }, { "epoch": 128.46153846153845, "grad_norm": 0.9688699245452881, "learning_rate": 0.01, "loss": 4.502564907073975, "num_input_tokens_seen": 6630400, "step": 1670, "train_runtime": 1358.1563, "train_tokens_per_second": 4881.912 }, { "epoch": 128.46153846153845, "num_input_tokens_seen": 6630400, "step": 1670, "train_accuracy": 0.009765625 }, { "epoch": 128.53846153846155, "grad_norm": 0.8407202363014221, "learning_rate": 0.01, "loss": 4.473555088043213, "num_input_tokens_seen": 6634496, "step": 1671, "train_runtime": 1358.9712, "train_tokens_per_second": 4881.999 }, { "epoch": 128.53846153846155, "num_input_tokens_seen": 6634496, "step": 1671, "train_accuracy": 0.01953125 }, { "epoch": 128.6153846153846, "grad_norm": 3.261981964111328, "learning_rate": 0.01, "loss": 4.496661186218262, "num_input_tokens_seen": 6638592, "step": 1672, "train_runtime": 1359.7869, "train_tokens_per_second": 4882.083 }, { "epoch": 128.6153846153846, "num_input_tokens_seen": 6638592, "step": 1672, "train_accuracy": 0.005859375 }, { "epoch": 128.69230769230768, "grad_norm": 0.4284020662307739, "learning_rate": 0.01, "loss": 4.4803972244262695, "num_input_tokens_seen": 6642688, "step": 1673, "train_runtime": 1360.6013, "train_tokens_per_second": 4882.171 }, { "epoch": 128.69230769230768, "num_input_tokens_seen": 6642688, "step": 1673, "train_accuracy": 0.01171875 }, { "epoch": 128.76923076923077, "grad_norm": 0.5555926561355591, "learning_rate": 0.01, "loss": 4.493105888366699, "num_input_tokens_seen": 6646784, "step": 1674, "train_runtime": 1361.4161, "train_tokens_per_second": 4882.258 }, { "epoch": 128.76923076923077, "num_input_tokens_seen": 6646784, "step": 1674, "train_accuracy": 0.015625 }, { "epoch": 128.84615384615384, "grad_norm": 0.38842296600341797, "learning_rate": 0.01, "loss": 4.494626998901367, "num_input_tokens_seen": 6650880, "step": 1675, "train_runtime": 1362.23, "train_tokens_per_second": 4882.347 }, { "epoch": 128.84615384615384, "num_input_tokens_seen": 6650880, "step": 1675, "train_accuracy": 0.005859375 }, { "epoch": 128.92307692307693, "grad_norm": 0.278170108795166, "learning_rate": 0.01, "loss": 4.515069484710693, "num_input_tokens_seen": 6654976, "step": 1676, "train_runtime": 1363.0406, "train_tokens_per_second": 4882.449 }, { "epoch": 128.92307692307693, "num_input_tokens_seen": 6654976, "step": 1676, "train_accuracy": 0.0065146577544510365 }, { "epoch": 129.0, "grad_norm": 0.36831656098365784, "learning_rate": 0.01, "loss": 4.511685848236084, "num_input_tokens_seen": 6657432, "step": 1677, "train_runtime": 1363.5563, "train_tokens_per_second": 4882.403 }, { "epoch": 129.0, "num_input_tokens_seen": 6657432, "step": 1677, "train_accuracy": 0.017578125 }, { "epoch": 129.07692307692307, "grad_norm": 0.5876153111457825, "learning_rate": 0.01, "loss": 4.464977264404297, "num_input_tokens_seen": 6661528, "step": 1678, "train_runtime": 1364.3856, "train_tokens_per_second": 4882.438 }, { "epoch": 129.07692307692307, "num_input_tokens_seen": 6661528, "step": 1678, "train_accuracy": 0.01171875 }, { "epoch": 129.15384615384616, "grad_norm": 0.46501055359840393, "learning_rate": 0.01, "loss": 4.496500015258789, "num_input_tokens_seen": 6665624, "step": 1679, "train_runtime": 1365.1985, "train_tokens_per_second": 4882.531 }, { "epoch": 129.15384615384616, "num_input_tokens_seen": 6665624, "step": 1679, "train_accuracy": 0.013671875 }, { "epoch": 129.23076923076923, "grad_norm": 0.42770761251449585, "learning_rate": 0.01, "loss": 4.488858222961426, "num_input_tokens_seen": 6669720, "step": 1680, "train_runtime": 1366.0122, "train_tokens_per_second": 4882.621 }, { "epoch": 129.23076923076923, "num_input_tokens_seen": 6669720, "step": 1680, "train_accuracy": 0.01171875 }, { "epoch": 129.30769230769232, "grad_norm": 0.3145144283771515, "learning_rate": 0.01, "loss": 4.476947784423828, "num_input_tokens_seen": 6673816, "step": 1681, "train_runtime": 1366.8265, "train_tokens_per_second": 4882.709 }, { "epoch": 129.30769230769232, "num_input_tokens_seen": 6673816, "step": 1681, "train_accuracy": 0.021484375 }, { "epoch": 129.3846153846154, "grad_norm": 0.47921332716941833, "learning_rate": 0.01, "loss": 4.460630416870117, "num_input_tokens_seen": 6677912, "step": 1682, "train_runtime": 1367.6421, "train_tokens_per_second": 4882.792 }, { "epoch": 129.3846153846154, "num_input_tokens_seen": 6677912, "step": 1682, "train_accuracy": 0.009765625 }, { "epoch": 129.46153846153845, "grad_norm": 1.500560998916626, "learning_rate": 0.01, "loss": 4.608785629272461, "num_input_tokens_seen": 6682008, "step": 1683, "train_runtime": 1368.4605, "train_tokens_per_second": 4882.865 }, { "epoch": 129.46153846153845, "num_input_tokens_seen": 6682008, "step": 1683, "train_accuracy": 0.005859375 }, { "epoch": 129.53846153846155, "grad_norm": 0.43431711196899414, "learning_rate": 0.01, "loss": 4.492959022521973, "num_input_tokens_seen": 6686104, "step": 1684, "train_runtime": 1369.2764, "train_tokens_per_second": 4882.947 }, { "epoch": 129.53846153846155, "num_input_tokens_seen": 6686104, "step": 1684, "train_accuracy": 0.015625 }, { "epoch": 129.6153846153846, "grad_norm": 0.39037230610847473, "learning_rate": 0.01, "loss": 4.5267791748046875, "num_input_tokens_seen": 6690200, "step": 1685, "train_runtime": 1370.0904, "train_tokens_per_second": 4883.035 }, { "epoch": 129.6153846153846, "num_input_tokens_seen": 6690200, "step": 1685, "train_accuracy": 0.015625 }, { "epoch": 129.69230769230768, "grad_norm": 0.47450190782546997, "learning_rate": 0.01, "loss": 4.51047420501709, "num_input_tokens_seen": 6694296, "step": 1686, "train_runtime": 1370.9053, "train_tokens_per_second": 4883.121 }, { "epoch": 129.69230769230768, "num_input_tokens_seen": 6694296, "step": 1686, "train_accuracy": 0.021484375 }, { "epoch": 129.76923076923077, "grad_norm": 0.4482632279396057, "learning_rate": 0.01, "loss": 4.5030364990234375, "num_input_tokens_seen": 6698392, "step": 1687, "train_runtime": 1371.7198, "train_tokens_per_second": 4883.207 }, { "epoch": 129.76923076923077, "num_input_tokens_seen": 6698392, "step": 1687, "train_accuracy": 0.009765625 }, { "epoch": 129.84615384615384, "grad_norm": 3.1814825534820557, "learning_rate": 0.01, "loss": 4.50639009475708, "num_input_tokens_seen": 6702488, "step": 1688, "train_runtime": 1372.5346, "train_tokens_per_second": 4883.293 }, { "epoch": 129.84615384615384, "num_input_tokens_seen": 6702488, "step": 1688, "train_accuracy": 0.021484375 }, { "epoch": 129.92307692307693, "grad_norm": 0.31933286786079407, "learning_rate": 0.01, "loss": 4.529560089111328, "num_input_tokens_seen": 6706584, "step": 1689, "train_runtime": 1373.3442, "train_tokens_per_second": 4883.396 }, { "epoch": 129.92307692307693, "num_input_tokens_seen": 6706584, "step": 1689, "train_accuracy": 0.019543973729014397 }, { "epoch": 130.0, "grad_norm": 0.2602151930332184, "learning_rate": 0.01, "loss": 4.536754131317139, "num_input_tokens_seen": 6709040, "step": 1690, "train_runtime": 1373.8607, "train_tokens_per_second": 4883.348 }, { "epoch": 130.0, "num_input_tokens_seen": 6709040, "step": 1690, "train_accuracy": 0.021484375 }, { "epoch": 130.07692307692307, "grad_norm": 0.2738721966743469, "learning_rate": 0.01, "loss": 4.500980854034424, "num_input_tokens_seen": 6713136, "step": 1691, "train_runtime": 1374.6886, "train_tokens_per_second": 4883.387 }, { "epoch": 130.07692307692307, "num_input_tokens_seen": 6713136, "step": 1691, "train_accuracy": 0.025390625 }, { "epoch": 130.15384615384616, "grad_norm": 0.39055389165878296, "learning_rate": 0.01, "loss": 4.494011878967285, "num_input_tokens_seen": 6717232, "step": 1692, "train_runtime": 1375.505, "train_tokens_per_second": 4883.466 }, { "epoch": 130.15384615384616, "num_input_tokens_seen": 6717232, "step": 1692, "train_accuracy": 0.017578125 }, { "epoch": 130.23076923076923, "grad_norm": 0.28793901205062866, "learning_rate": 0.01, "loss": 4.490740776062012, "num_input_tokens_seen": 6721328, "step": 1693, "train_runtime": 1376.3196, "train_tokens_per_second": 4883.552 }, { "epoch": 130.23076923076923, "num_input_tokens_seen": 6721328, "step": 1693, "train_accuracy": 0.017578125 }, { "epoch": 130.30769230769232, "grad_norm": 0.8072336912155151, "learning_rate": 0.01, "loss": 4.515347480773926, "num_input_tokens_seen": 6725424, "step": 1694, "train_runtime": 1377.1347, "train_tokens_per_second": 4883.636 }, { "epoch": 130.30769230769232, "num_input_tokens_seen": 6725424, "step": 1694, "train_accuracy": 0.01171875 }, { "epoch": 130.3846153846154, "grad_norm": 0.5644285082817078, "learning_rate": 0.01, "loss": 4.502502918243408, "num_input_tokens_seen": 6729520, "step": 1695, "train_runtime": 1377.9489, "train_tokens_per_second": 4883.723 }, { "epoch": 130.3846153846154, "num_input_tokens_seen": 6729520, "step": 1695, "train_accuracy": 0.015625 }, { "epoch": 130.46153846153845, "grad_norm": 2.5769872665405273, "learning_rate": 0.01, "loss": 4.527018070220947, "num_input_tokens_seen": 6733616, "step": 1696, "train_runtime": 1378.7649, "train_tokens_per_second": 4883.803 }, { "epoch": 130.46153846153845, "num_input_tokens_seen": 6733616, "step": 1696, "train_accuracy": 0.029296875 }, { "epoch": 130.53846153846155, "grad_norm": 0.38207435607910156, "learning_rate": 0.01, "loss": 4.5115509033203125, "num_input_tokens_seen": 6737712, "step": 1697, "train_runtime": 1379.5795, "train_tokens_per_second": 4883.888 }, { "epoch": 130.53846153846155, "num_input_tokens_seen": 6737712, "step": 1697, "train_accuracy": 0.009765625 }, { "epoch": 130.6153846153846, "grad_norm": 0.3670922815799713, "learning_rate": 0.01, "loss": 4.5531768798828125, "num_input_tokens_seen": 6741808, "step": 1698, "train_runtime": 1380.3946, "train_tokens_per_second": 4883.972 }, { "epoch": 130.6153846153846, "num_input_tokens_seen": 6741808, "step": 1698, "train_accuracy": 0.009765625 }, { "epoch": 130.69230769230768, "grad_norm": 0.7520430684089661, "learning_rate": 0.01, "loss": 4.529556751251221, "num_input_tokens_seen": 6745904, "step": 1699, "train_runtime": 1381.2083, "train_tokens_per_second": 4884.06 }, { "epoch": 130.69230769230768, "num_input_tokens_seen": 6745904, "step": 1699, "train_accuracy": 0.015625 }, { "epoch": 130.76923076923077, "grad_norm": 0.993793785572052, "learning_rate": 0.01, "loss": 4.509443283081055, "num_input_tokens_seen": 6750000, "step": 1700, "train_runtime": 1382.0215, "train_tokens_per_second": 4884.15 }, { "epoch": 130.76923076923077, "eval_CMD_3_branch_eval_accuracy": 0.00976491862567812, "eval_CMD_3_branch_eval_loss": 4.546371936798096, "eval_CMD_3_branch_eval_runtime": 1.1534, "eval_CMD_3_branch_eval_samples_per_second": 2397.362, "eval_CMD_3_branch_eval_steps_per_second": 5.202, "num_input_tokens_seen": 6750000, "step": 1700 }, { "epoch": 130.76923076923077, "num_input_tokens_seen": 6750000, "step": 1700, "train_accuracy": 0.02734375 }, { "epoch": 130.84615384615384, "grad_norm": 0.4083004891872406, "learning_rate": 0.01, "loss": 4.506755828857422, "num_input_tokens_seen": 6754096, "step": 1701, "train_runtime": 1383.9929, "train_tokens_per_second": 4880.152 }, { "epoch": 130.84615384615384, "num_input_tokens_seen": 6754096, "step": 1701, "train_accuracy": 0.009765625 }, { "epoch": 130.92307692307693, "grad_norm": 0.3738880455493927, "learning_rate": 0.01, "loss": 4.514200210571289, "num_input_tokens_seen": 6758192, "step": 1702, "train_runtime": 1384.8029, "train_tokens_per_second": 4880.256 }, { "epoch": 130.92307692307693, "num_input_tokens_seen": 6758192, "step": 1702, "train_accuracy": 0.009771986864507198 }, { "epoch": 131.0, "grad_norm": 1.534274935722351, "learning_rate": 0.01, "loss": 4.540097713470459, "num_input_tokens_seen": 6760648, "step": 1703, "train_runtime": 1385.3176, "train_tokens_per_second": 4880.215 }, { "epoch": 131.0, "num_input_tokens_seen": 6760648, "step": 1703, "train_accuracy": 0.021484375 }, { "epoch": 131.07692307692307, "grad_norm": 0.7651125192642212, "learning_rate": 0.01, "loss": 4.548482894897461, "num_input_tokens_seen": 6764744, "step": 1704, "train_runtime": 1386.1445, "train_tokens_per_second": 4880.259 }, { "epoch": 131.07692307692307, "num_input_tokens_seen": 6764744, "step": 1704, "train_accuracy": 0.00390625 }, { "epoch": 131.15384615384616, "grad_norm": 0.36869847774505615, "learning_rate": 0.01, "loss": 4.5239410400390625, "num_input_tokens_seen": 6768840, "step": 1705, "train_runtime": 1386.9647, "train_tokens_per_second": 4880.326 }, { "epoch": 131.15384615384616, "num_input_tokens_seen": 6768840, "step": 1705, "train_accuracy": 0.015625 }, { "epoch": 131.23076923076923, "grad_norm": 0.2955624759197235, "learning_rate": 0.01, "loss": 4.503084182739258, "num_input_tokens_seen": 6772936, "step": 1706, "train_runtime": 1387.7791, "train_tokens_per_second": 4880.414 }, { "epoch": 131.23076923076923, "num_input_tokens_seen": 6772936, "step": 1706, "train_accuracy": 0.021484375 }, { "epoch": 131.30769230769232, "grad_norm": 0.39183342456817627, "learning_rate": 0.01, "loss": 4.5019731521606445, "num_input_tokens_seen": 6777032, "step": 1707, "train_runtime": 1388.5941, "train_tokens_per_second": 4880.499 }, { "epoch": 131.30769230769232, "num_input_tokens_seen": 6777032, "step": 1707, "train_accuracy": 0.013671875 }, { "epoch": 131.3846153846154, "grad_norm": 0.3188590407371521, "learning_rate": 0.01, "loss": 4.503392219543457, "num_input_tokens_seen": 6781128, "step": 1708, "train_runtime": 1389.4072, "train_tokens_per_second": 4880.591 }, { "epoch": 131.3846153846154, "num_input_tokens_seen": 6781128, "step": 1708, "train_accuracy": 0.009765625 }, { "epoch": 131.46153846153845, "grad_norm": 0.32286202907562256, "learning_rate": 0.01, "loss": 4.52543830871582, "num_input_tokens_seen": 6785224, "step": 1709, "train_runtime": 1390.2221, "train_tokens_per_second": 4880.676 }, { "epoch": 131.46153846153845, "num_input_tokens_seen": 6785224, "step": 1709, "train_accuracy": 0.009765625 }, { "epoch": 131.53846153846155, "grad_norm": 0.3742615580558777, "learning_rate": 0.01, "loss": 4.537827491760254, "num_input_tokens_seen": 6789320, "step": 1710, "train_runtime": 1391.0365, "train_tokens_per_second": 4880.763 }, { "epoch": 131.53846153846155, "num_input_tokens_seen": 6789320, "step": 1710, "train_accuracy": 0.015625 }, { "epoch": 131.6153846153846, "grad_norm": 0.2734524607658386, "learning_rate": 0.01, "loss": 4.555187225341797, "num_input_tokens_seen": 6793416, "step": 1711, "train_runtime": 1391.8522, "train_tokens_per_second": 4880.846 }, { "epoch": 131.6153846153846, "num_input_tokens_seen": 6793416, "step": 1711, "train_accuracy": 0.0078125 }, { "epoch": 131.69230769230768, "grad_norm": 0.4041428864002228, "learning_rate": 0.01, "loss": 4.540947437286377, "num_input_tokens_seen": 6797512, "step": 1712, "train_runtime": 1392.6674, "train_tokens_per_second": 4880.93 }, { "epoch": 131.69230769230768, "num_input_tokens_seen": 6797512, "step": 1712, "train_accuracy": 0.017578125 }, { "epoch": 131.76923076923077, "grad_norm": 1.1585386991500854, "learning_rate": 0.01, "loss": 4.52167272567749, "num_input_tokens_seen": 6801608, "step": 1713, "train_runtime": 1393.4821, "train_tokens_per_second": 4881.016 }, { "epoch": 131.76923076923077, "num_input_tokens_seen": 6801608, "step": 1713, "train_accuracy": 0.017578125 }, { "epoch": 131.84615384615384, "grad_norm": 1.229591727256775, "learning_rate": 0.01, "loss": 4.545475006103516, "num_input_tokens_seen": 6805704, "step": 1714, "train_runtime": 1394.2963, "train_tokens_per_second": 4881.103 }, { "epoch": 131.84615384615384, "num_input_tokens_seen": 6805704, "step": 1714, "train_accuracy": 0.025390625 }, { "epoch": 131.92307692307693, "grad_norm": 0.4838937819004059, "learning_rate": 0.01, "loss": 4.523252487182617, "num_input_tokens_seen": 6809800, "step": 1715, "train_runtime": 1395.107, "train_tokens_per_second": 4881.203 }, { "epoch": 131.92307692307693, "num_input_tokens_seen": 6809800, "step": 1715, "train_accuracy": 0.009771986864507198 }, { "epoch": 132.0, "grad_norm": 0.3217167258262634, "learning_rate": 0.01, "loss": 4.476624488830566, "num_input_tokens_seen": 6812256, "step": 1716, "train_runtime": 1395.6229, "train_tokens_per_second": 4881.158 }, { "epoch": 132.0, "num_input_tokens_seen": 6812256, "step": 1716, "train_accuracy": 0.025390625 }, { "epoch": 132.07692307692307, "grad_norm": 0.3933837115764618, "learning_rate": 0.01, "loss": 4.501726150512695, "num_input_tokens_seen": 6816352, "step": 1717, "train_runtime": 1396.4515, "train_tokens_per_second": 4881.195 }, { "epoch": 132.07692307692307, "num_input_tokens_seen": 6816352, "step": 1717, "train_accuracy": 0.01953125 }, { "epoch": 132.15384615384616, "grad_norm": 0.74774569272995, "learning_rate": 0.01, "loss": 4.478212356567383, "num_input_tokens_seen": 6820448, "step": 1718, "train_runtime": 1397.2654, "train_tokens_per_second": 4881.283 }, { "epoch": 132.15384615384616, "num_input_tokens_seen": 6820448, "step": 1718, "train_accuracy": 0.015625 }, { "epoch": 132.23076923076923, "grad_norm": 0.578484058380127, "learning_rate": 0.01, "loss": 4.514402389526367, "num_input_tokens_seen": 6824544, "step": 1719, "train_runtime": 1398.0798, "train_tokens_per_second": 4881.37 }, { "epoch": 132.23076923076923, "num_input_tokens_seen": 6824544, "step": 1719, "train_accuracy": 0.01171875 }, { "epoch": 132.30769230769232, "grad_norm": 0.7361067533493042, "learning_rate": 0.01, "loss": 4.499946594238281, "num_input_tokens_seen": 6828640, "step": 1720, "train_runtime": 1398.8941, "train_tokens_per_second": 4881.456 }, { "epoch": 132.30769230769232, "num_input_tokens_seen": 6828640, "step": 1720, "train_accuracy": 0.017578125 }, { "epoch": 132.3846153846154, "grad_norm": 1.0104666948318481, "learning_rate": 0.01, "loss": 4.525514125823975, "num_input_tokens_seen": 6832736, "step": 1721, "train_runtime": 1399.7085, "train_tokens_per_second": 4881.542 }, { "epoch": 132.3846153846154, "num_input_tokens_seen": 6832736, "step": 1721, "train_accuracy": 0.015625 }, { "epoch": 132.46153846153845, "grad_norm": 0.2834595739841461, "learning_rate": 0.01, "loss": 4.531540870666504, "num_input_tokens_seen": 6836832, "step": 1722, "train_runtime": 1400.5231, "train_tokens_per_second": 4881.627 }, { "epoch": 132.46153846153845, "num_input_tokens_seen": 6836832, "step": 1722, "train_accuracy": 0.017578125 }, { "epoch": 132.53846153846155, "grad_norm": 0.5259590744972229, "learning_rate": 0.01, "loss": 4.53350830078125, "num_input_tokens_seen": 6840928, "step": 1723, "train_runtime": 1401.3372, "train_tokens_per_second": 4881.714 }, { "epoch": 132.53846153846155, "num_input_tokens_seen": 6840928, "step": 1723, "train_accuracy": 0.005859375 }, { "epoch": 132.6153846153846, "grad_norm": 0.33686336874961853, "learning_rate": 0.01, "loss": 4.540597438812256, "num_input_tokens_seen": 6845024, "step": 1724, "train_runtime": 1402.1517, "train_tokens_per_second": 4881.8 }, { "epoch": 132.6153846153846, "num_input_tokens_seen": 6845024, "step": 1724, "train_accuracy": 0.013671875 }, { "epoch": 132.69230769230768, "grad_norm": 1.2727960348129272, "learning_rate": 0.01, "loss": 4.526486396789551, "num_input_tokens_seen": 6849120, "step": 1725, "train_runtime": 1402.9655, "train_tokens_per_second": 4881.888 }, { "epoch": 132.69230769230768, "num_input_tokens_seen": 6849120, "step": 1725, "train_accuracy": 0.015625 }, { "epoch": 132.76923076923077, "grad_norm": 0.23274320363998413, "learning_rate": 0.01, "loss": 4.526761531829834, "num_input_tokens_seen": 6853216, "step": 1726, "train_runtime": 1403.7797, "train_tokens_per_second": 4881.974 }, { "epoch": 132.76923076923077, "num_input_tokens_seen": 6853216, "step": 1726, "train_accuracy": 0.009765625 }, { "epoch": 132.84615384615384, "grad_norm": 0.22988763451576233, "learning_rate": 0.01, "loss": 4.542788505554199, "num_input_tokens_seen": 6857312, "step": 1727, "train_runtime": 1404.5943, "train_tokens_per_second": 4882.059 }, { "epoch": 132.84615384615384, "num_input_tokens_seen": 6857312, "step": 1727, "train_accuracy": 0.0078125 }, { "epoch": 132.92307692307693, "grad_norm": 0.47999700903892517, "learning_rate": 0.01, "loss": 4.517338752746582, "num_input_tokens_seen": 6861408, "step": 1728, "train_runtime": 1405.404, "train_tokens_per_second": 4882.16 }, { "epoch": 132.92307692307693, "num_input_tokens_seen": 6861408, "step": 1728, "train_accuracy": 0.019543973729014397 }, { "epoch": 133.0, "grad_norm": 0.39151906967163086, "learning_rate": 0.01, "loss": 4.529682636260986, "num_input_tokens_seen": 6863864, "step": 1729, "train_runtime": 1405.9191, "train_tokens_per_second": 4882.119 }, { "epoch": 133.0, "num_input_tokens_seen": 6863864, "step": 1729, "train_accuracy": 0.013671875 }, { "epoch": 133.07692307692307, "grad_norm": 0.6525077223777771, "learning_rate": 0.01, "loss": 4.528639316558838, "num_input_tokens_seen": 6867960, "step": 1730, "train_runtime": 1406.7438, "train_tokens_per_second": 4882.168 }, { "epoch": 133.07692307692307, "num_input_tokens_seen": 6867960, "step": 1730, "train_accuracy": 0.015625 }, { "epoch": 133.15384615384616, "grad_norm": 0.3770185708999634, "learning_rate": 0.01, "loss": 4.490137100219727, "num_input_tokens_seen": 6872056, "step": 1731, "train_runtime": 1407.5578, "train_tokens_per_second": 4882.255 }, { "epoch": 133.15384615384616, "num_input_tokens_seen": 6872056, "step": 1731, "train_accuracy": 0.0234375 }, { "epoch": 133.23076923076923, "grad_norm": 0.49798017740249634, "learning_rate": 0.01, "loss": 4.516364574432373, "num_input_tokens_seen": 6876152, "step": 1732, "train_runtime": 1408.373, "train_tokens_per_second": 4882.337 }, { "epoch": 133.23076923076923, "num_input_tokens_seen": 6876152, "step": 1732, "train_accuracy": 0.03125 }, { "epoch": 133.30769230769232, "grad_norm": 0.2344183474779129, "learning_rate": 0.01, "loss": 4.481263637542725, "num_input_tokens_seen": 6880248, "step": 1733, "train_runtime": 1409.1878, "train_tokens_per_second": 4882.421 }, { "epoch": 133.30769230769232, "num_input_tokens_seen": 6880248, "step": 1733, "train_accuracy": 0.009765625 }, { "epoch": 133.3846153846154, "grad_norm": 0.3261810839176178, "learning_rate": 0.01, "loss": 4.528553009033203, "num_input_tokens_seen": 6884344, "step": 1734, "train_runtime": 1410.002, "train_tokens_per_second": 4882.507 }, { "epoch": 133.3846153846154, "num_input_tokens_seen": 6884344, "step": 1734, "train_accuracy": 0.01953125 }, { "epoch": 133.46153846153845, "grad_norm": 0.25679534673690796, "learning_rate": 0.01, "loss": 4.499446868896484, "num_input_tokens_seen": 6888440, "step": 1735, "train_runtime": 1410.8196, "train_tokens_per_second": 4882.58 }, { "epoch": 133.46153846153845, "num_input_tokens_seen": 6888440, "step": 1735, "train_accuracy": 0.009765625 }, { "epoch": 133.53846153846155, "grad_norm": 0.2007618248462677, "learning_rate": 0.01, "loss": 4.516724586486816, "num_input_tokens_seen": 6892536, "step": 1736, "train_runtime": 1411.6327, "train_tokens_per_second": 4882.67 }, { "epoch": 133.53846153846155, "num_input_tokens_seen": 6892536, "step": 1736, "train_accuracy": 0.00390625 }, { "epoch": 133.6153846153846, "grad_norm": 0.6148881316184998, "learning_rate": 0.01, "loss": 4.537455081939697, "num_input_tokens_seen": 6896632, "step": 1737, "train_runtime": 1412.4481, "train_tokens_per_second": 4882.751 }, { "epoch": 133.6153846153846, "num_input_tokens_seen": 6896632, "step": 1737, "train_accuracy": 0.015625 }, { "epoch": 133.69230769230768, "grad_norm": 0.28915512561798096, "learning_rate": 0.01, "loss": 4.51920223236084, "num_input_tokens_seen": 6900728, "step": 1738, "train_runtime": 1413.2709, "train_tokens_per_second": 4882.806 }, { "epoch": 133.69230769230768, "num_input_tokens_seen": 6900728, "step": 1738, "train_accuracy": 0.01953125 }, { "epoch": 133.76923076923077, "grad_norm": 0.2960025370121002, "learning_rate": 0.01, "loss": 4.52116584777832, "num_input_tokens_seen": 6904824, "step": 1739, "train_runtime": 1414.0848, "train_tokens_per_second": 4882.892 }, { "epoch": 133.76923076923077, "num_input_tokens_seen": 6904824, "step": 1739, "train_accuracy": 0.01171875 }, { "epoch": 133.84615384615384, "grad_norm": 0.27149006724357605, "learning_rate": 0.01, "loss": 4.521803855895996, "num_input_tokens_seen": 6908920, "step": 1740, "train_runtime": 1414.899, "train_tokens_per_second": 4882.977 }, { "epoch": 133.84615384615384, "num_input_tokens_seen": 6908920, "step": 1740, "train_accuracy": 0.015625 }, { "epoch": 133.92307692307693, "grad_norm": 0.26008468866348267, "learning_rate": 0.01, "loss": 4.5001749992370605, "num_input_tokens_seen": 6913016, "step": 1741, "train_runtime": 1415.7098, "train_tokens_per_second": 4883.074 }, { "epoch": 133.92307692307693, "num_input_tokens_seen": 6913016, "step": 1741, "train_accuracy": 0.0065146577544510365 }, { "epoch": 134.0, "grad_norm": 0.32249686121940613, "learning_rate": 0.01, "loss": 4.509130954742432, "num_input_tokens_seen": 6915472, "step": 1742, "train_runtime": 1416.2248, "train_tokens_per_second": 4883.033 }, { "epoch": 134.0, "num_input_tokens_seen": 6915472, "step": 1742, "train_accuracy": 0.01953125 }, { "epoch": 134.07692307692307, "grad_norm": 2.5880963802337646, "learning_rate": 0.01, "loss": 4.508394718170166, "num_input_tokens_seen": 6919568, "step": 1743, "train_runtime": 1417.0524, "train_tokens_per_second": 4883.071 }, { "epoch": 134.07692307692307, "num_input_tokens_seen": 6919568, "step": 1743, "train_accuracy": 0.029296875 }, { "epoch": 134.15384615384616, "grad_norm": 5.311941146850586, "learning_rate": 0.01, "loss": 4.494456768035889, "num_input_tokens_seen": 6923664, "step": 1744, "train_runtime": 1417.8671, "train_tokens_per_second": 4883.154 }, { "epoch": 134.15384615384616, "num_input_tokens_seen": 6923664, "step": 1744, "train_accuracy": 0.005859375 }, { "epoch": 134.23076923076923, "grad_norm": 0.3410141170024872, "learning_rate": 0.01, "loss": 4.491735458374023, "num_input_tokens_seen": 6927760, "step": 1745, "train_runtime": 1418.6872, "train_tokens_per_second": 4883.219 }, { "epoch": 134.23076923076923, "num_input_tokens_seen": 6927760, "step": 1745, "train_accuracy": 0.015625 }, { "epoch": 134.30769230769232, "grad_norm": 0.31180036067962646, "learning_rate": 0.01, "loss": 4.476294040679932, "num_input_tokens_seen": 6931856, "step": 1746, "train_runtime": 1419.5048, "train_tokens_per_second": 4883.292 }, { "epoch": 134.30769230769232, "num_input_tokens_seen": 6931856, "step": 1746, "train_accuracy": 0.01953125 }, { "epoch": 134.3846153846154, "grad_norm": 0.7802852988243103, "learning_rate": 0.01, "loss": 4.52705192565918, "num_input_tokens_seen": 6935952, "step": 1747, "train_runtime": 1420.3185, "train_tokens_per_second": 4883.378 }, { "epoch": 134.3846153846154, "num_input_tokens_seen": 6935952, "step": 1747, "train_accuracy": 0.017578125 }, { "epoch": 134.46153846153845, "grad_norm": 0.41046053171157837, "learning_rate": 0.01, "loss": 4.528984546661377, "num_input_tokens_seen": 6940048, "step": 1748, "train_runtime": 1421.1322, "train_tokens_per_second": 4883.464 }, { "epoch": 134.46153846153845, "num_input_tokens_seen": 6940048, "step": 1748, "train_accuracy": 0.01171875 }, { "epoch": 134.53846153846155, "grad_norm": 1.0420804023742676, "learning_rate": 0.01, "loss": 4.518743515014648, "num_input_tokens_seen": 6944144, "step": 1749, "train_runtime": 1421.9475, "train_tokens_per_second": 4883.545 }, { "epoch": 134.53846153846155, "num_input_tokens_seen": 6944144, "step": 1749, "train_accuracy": 0.01171875 }, { "epoch": 134.6153846153846, "grad_norm": 0.2821536064147949, "learning_rate": 0.01, "loss": 4.530234336853027, "num_input_tokens_seen": 6948240, "step": 1750, "train_runtime": 1422.7625, "train_tokens_per_second": 4883.626 }, { "epoch": 134.6153846153846, "num_input_tokens_seen": 6948240, "step": 1750, "train_accuracy": 0.009765625 }, { "epoch": 134.69230769230768, "grad_norm": 0.5711707472801208, "learning_rate": 0.01, "loss": 4.520828723907471, "num_input_tokens_seen": 6952336, "step": 1751, "train_runtime": 1423.5769, "train_tokens_per_second": 4883.71 }, { "epoch": 134.69230769230768, "num_input_tokens_seen": 6952336, "step": 1751, "train_accuracy": 0.015625 }, { "epoch": 134.76923076923077, "grad_norm": 0.22541077435016632, "learning_rate": 0.01, "loss": 4.508856296539307, "num_input_tokens_seen": 6956432, "step": 1752, "train_runtime": 1424.3914, "train_tokens_per_second": 4883.792 }, { "epoch": 134.76923076923077, "num_input_tokens_seen": 6956432, "step": 1752, "train_accuracy": 0.021484375 }, { "epoch": 134.84615384615384, "grad_norm": 0.2409822940826416, "learning_rate": 0.01, "loss": 4.5196943283081055, "num_input_tokens_seen": 6960528, "step": 1753, "train_runtime": 1425.2052, "train_tokens_per_second": 4883.878 }, { "epoch": 134.84615384615384, "num_input_tokens_seen": 6960528, "step": 1753, "train_accuracy": 0.0078125 }, { "epoch": 134.92307692307693, "grad_norm": 0.30738699436187744, "learning_rate": 0.01, "loss": 4.521076202392578, "num_input_tokens_seen": 6964624, "step": 1754, "train_runtime": 1426.0142, "train_tokens_per_second": 4883.979 }, { "epoch": 134.92307692307693, "num_input_tokens_seen": 6964624, "step": 1754, "train_accuracy": 0.009771986864507198 }, { "epoch": 135.0, "grad_norm": 0.3633999824523926, "learning_rate": 0.01, "loss": 4.502272605895996, "num_input_tokens_seen": 6967080, "step": 1755, "train_runtime": 1426.5293, "train_tokens_per_second": 4883.938 }, { "epoch": 135.0, "num_input_tokens_seen": 6967080, "step": 1755, "train_accuracy": 0.017578125 }, { "epoch": 135.07692307692307, "grad_norm": 0.45537644624710083, "learning_rate": 0.01, "loss": 4.493215560913086, "num_input_tokens_seen": 6971176, "step": 1756, "train_runtime": 1427.364, "train_tokens_per_second": 4883.951 }, { "epoch": 135.07692307692307, "num_input_tokens_seen": 6971176, "step": 1756, "train_accuracy": 0.021484375 }, { "epoch": 135.15384615384616, "grad_norm": 0.909066379070282, "learning_rate": 0.01, "loss": 4.514348030090332, "num_input_tokens_seen": 6975272, "step": 1757, "train_runtime": 1428.1779, "train_tokens_per_second": 4884.036 }, { "epoch": 135.15384615384616, "num_input_tokens_seen": 6975272, "step": 1757, "train_accuracy": 0.015625 }, { "epoch": 135.23076923076923, "grad_norm": 0.3726130723953247, "learning_rate": 0.01, "loss": 4.503530502319336, "num_input_tokens_seen": 6979368, "step": 1758, "train_runtime": 1428.9931, "train_tokens_per_second": 4884.116 }, { "epoch": 135.23076923076923, "num_input_tokens_seen": 6979368, "step": 1758, "train_accuracy": 0.017578125 }, { "epoch": 135.30769230769232, "grad_norm": 0.30177444219589233, "learning_rate": 0.01, "loss": 4.507753372192383, "num_input_tokens_seen": 6983464, "step": 1759, "train_runtime": 1429.8073, "train_tokens_per_second": 4884.199 }, { "epoch": 135.30769230769232, "num_input_tokens_seen": 6983464, "step": 1759, "train_accuracy": 0.0234375 }, { "epoch": 135.3846153846154, "grad_norm": 0.39806854724884033, "learning_rate": 0.01, "loss": 4.487634658813477, "num_input_tokens_seen": 6987560, "step": 1760, "train_runtime": 1430.621, "train_tokens_per_second": 4884.285 }, { "epoch": 135.3846153846154, "num_input_tokens_seen": 6987560, "step": 1760, "train_accuracy": 0.01953125 }, { "epoch": 135.46153846153845, "grad_norm": 0.353312611579895, "learning_rate": 0.01, "loss": 4.508077621459961, "num_input_tokens_seen": 6991656, "step": 1761, "train_runtime": 1431.4341, "train_tokens_per_second": 4884.371 }, { "epoch": 135.46153846153845, "num_input_tokens_seen": 6991656, "step": 1761, "train_accuracy": 0.013671875 }, { "epoch": 135.53846153846155, "grad_norm": 0.37810611724853516, "learning_rate": 0.01, "loss": 4.5164103507995605, "num_input_tokens_seen": 6995752, "step": 1762, "train_runtime": 1432.2494, "train_tokens_per_second": 4884.451 }, { "epoch": 135.53846153846155, "num_input_tokens_seen": 6995752, "step": 1762, "train_accuracy": 0.029296875 }, { "epoch": 135.6153846153846, "grad_norm": 0.2685927152633667, "learning_rate": 0.01, "loss": 4.478910446166992, "num_input_tokens_seen": 6999848, "step": 1763, "train_runtime": 1433.0636, "train_tokens_per_second": 4884.534 }, { "epoch": 135.6153846153846, "num_input_tokens_seen": 6999848, "step": 1763, "train_accuracy": 0.013671875 }, { "epoch": 135.69230769230768, "grad_norm": 0.48998892307281494, "learning_rate": 0.01, "loss": 4.526169300079346, "num_input_tokens_seen": 7003944, "step": 1764, "train_runtime": 1433.8791, "train_tokens_per_second": 4884.613 }, { "epoch": 135.69230769230768, "num_input_tokens_seen": 7003944, "step": 1764, "train_accuracy": 0.0078125 }, { "epoch": 135.76923076923077, "grad_norm": 0.24435654282569885, "learning_rate": 0.01, "loss": 4.500778675079346, "num_input_tokens_seen": 7008040, "step": 1765, "train_runtime": 1434.6929, "train_tokens_per_second": 4884.697 }, { "epoch": 135.76923076923077, "num_input_tokens_seen": 7008040, "step": 1765, "train_accuracy": 0.005859375 }, { "epoch": 135.84615384615384, "grad_norm": 0.5288189053535461, "learning_rate": 0.01, "loss": 4.510227203369141, "num_input_tokens_seen": 7012136, "step": 1766, "train_runtime": 1435.507, "train_tokens_per_second": 4884.78 }, { "epoch": 135.84615384615384, "num_input_tokens_seen": 7012136, "step": 1766, "train_accuracy": 0.009765625 }, { "epoch": 135.92307692307693, "grad_norm": 0.6351887583732605, "learning_rate": 0.01, "loss": 4.50391149520874, "num_input_tokens_seen": 7016232, "step": 1767, "train_runtime": 1436.3172, "train_tokens_per_second": 4884.877 }, { "epoch": 135.92307692307693, "num_input_tokens_seen": 7016232, "step": 1767, "train_accuracy": 0.04560260474681854 }, { "epoch": 136.0, "grad_norm": 0.6438477635383606, "learning_rate": 0.01, "loss": 4.502982139587402, "num_input_tokens_seen": 7018688, "step": 1768, "train_runtime": 1436.8311, "train_tokens_per_second": 4884.839 }, { "epoch": 136.0, "num_input_tokens_seen": 7018688, "step": 1768, "train_accuracy": 0.017578125 }, { "epoch": 136.07692307692307, "grad_norm": 0.27569079399108887, "learning_rate": 0.01, "loss": 4.499819755554199, "num_input_tokens_seen": 7022784, "step": 1769, "train_runtime": 1437.6571, "train_tokens_per_second": 4884.881 }, { "epoch": 136.07692307692307, "num_input_tokens_seen": 7022784, "step": 1769, "train_accuracy": 0.015625 }, { "epoch": 136.15384615384616, "grad_norm": 0.5427327156066895, "learning_rate": 0.01, "loss": 4.490644454956055, "num_input_tokens_seen": 7026880, "step": 1770, "train_runtime": 1438.4713, "train_tokens_per_second": 4884.964 }, { "epoch": 136.15384615384616, "num_input_tokens_seen": 7026880, "step": 1770, "train_accuracy": 0.01171875 }, { "epoch": 136.23076923076923, "grad_norm": 0.2863885462284088, "learning_rate": 0.01, "loss": 4.516340732574463, "num_input_tokens_seen": 7030976, "step": 1771, "train_runtime": 1439.2844, "train_tokens_per_second": 4885.05 }, { "epoch": 136.23076923076923, "num_input_tokens_seen": 7030976, "step": 1771, "train_accuracy": 0.015625 }, { "epoch": 136.30769230769232, "grad_norm": 0.1990378051996231, "learning_rate": 0.01, "loss": 4.494849681854248, "num_input_tokens_seen": 7035072, "step": 1772, "train_runtime": 1440.0979, "train_tokens_per_second": 4885.135 }, { "epoch": 136.30769230769232, "num_input_tokens_seen": 7035072, "step": 1772, "train_accuracy": 0.015625 }, { "epoch": 136.3846153846154, "grad_norm": 0.2878986597061157, "learning_rate": 0.01, "loss": 4.487600803375244, "num_input_tokens_seen": 7039168, "step": 1773, "train_runtime": 1440.9111, "train_tokens_per_second": 4885.22 }, { "epoch": 136.3846153846154, "num_input_tokens_seen": 7039168, "step": 1773, "train_accuracy": 0.015625 }, { "epoch": 136.46153846153845, "grad_norm": 0.3415122330188751, "learning_rate": 0.01, "loss": 4.510580539703369, "num_input_tokens_seen": 7043264, "step": 1774, "train_runtime": 1441.7254, "train_tokens_per_second": 4885.302 }, { "epoch": 136.46153846153845, "num_input_tokens_seen": 7043264, "step": 1774, "train_accuracy": 0.01953125 }, { "epoch": 136.53846153846155, "grad_norm": 0.2500530183315277, "learning_rate": 0.01, "loss": 4.51226282119751, "num_input_tokens_seen": 7047360, "step": 1775, "train_runtime": 1442.5399, "train_tokens_per_second": 4885.383 }, { "epoch": 136.53846153846155, "num_input_tokens_seen": 7047360, "step": 1775, "train_accuracy": 0.015625 }, { "epoch": 136.6153846153846, "grad_norm": 0.31919777393341064, "learning_rate": 0.01, "loss": 4.492679595947266, "num_input_tokens_seen": 7051456, "step": 1776, "train_runtime": 1443.354, "train_tokens_per_second": 4885.465 }, { "epoch": 136.6153846153846, "num_input_tokens_seen": 7051456, "step": 1776, "train_accuracy": 0.005859375 }, { "epoch": 136.69230769230768, "grad_norm": 1.1813175678253174, "learning_rate": 0.01, "loss": 4.50545597076416, "num_input_tokens_seen": 7055552, "step": 1777, "train_runtime": 1444.1677, "train_tokens_per_second": 4885.549 }, { "epoch": 136.69230769230768, "num_input_tokens_seen": 7055552, "step": 1777, "train_accuracy": 0.01171875 }, { "epoch": 136.76923076923077, "grad_norm": 0.2754706144332886, "learning_rate": 0.01, "loss": 4.506965160369873, "num_input_tokens_seen": 7059648, "step": 1778, "train_runtime": 1444.9817, "train_tokens_per_second": 4885.631 }, { "epoch": 136.76923076923077, "num_input_tokens_seen": 7059648, "step": 1778, "train_accuracy": 0.009765625 }, { "epoch": 136.84615384615384, "grad_norm": 0.22163443267345428, "learning_rate": 0.01, "loss": 4.506715297698975, "num_input_tokens_seen": 7063744, "step": 1779, "train_runtime": 1445.7946, "train_tokens_per_second": 4885.718 }, { "epoch": 136.84615384615384, "num_input_tokens_seen": 7063744, "step": 1779, "train_accuracy": 0.021484375 }, { "epoch": 136.92307692307693, "grad_norm": 0.2083691954612732, "learning_rate": 0.01, "loss": 4.498074531555176, "num_input_tokens_seen": 7067840, "step": 1780, "train_runtime": 1446.6031, "train_tokens_per_second": 4885.819 }, { "epoch": 136.92307692307693, "num_input_tokens_seen": 7067840, "step": 1780, "train_accuracy": 0.0065146577544510365 }, { "epoch": 137.0, "grad_norm": 0.557692289352417, "learning_rate": 0.01, "loss": 4.558379173278809, "num_input_tokens_seen": 7070296, "step": 1781, "train_runtime": 1447.1173, "train_tokens_per_second": 4885.779 }, { "epoch": 137.0, "num_input_tokens_seen": 7070296, "step": 1781, "train_accuracy": 0.01953125 }, { "epoch": 137.07692307692307, "grad_norm": 0.31935107707977295, "learning_rate": 0.01, "loss": 4.525882244110107, "num_input_tokens_seen": 7074392, "step": 1782, "train_runtime": 1447.9424, "train_tokens_per_second": 4885.824 }, { "epoch": 137.07692307692307, "num_input_tokens_seen": 7074392, "step": 1782, "train_accuracy": 0.015625 }, { "epoch": 137.15384615384616, "grad_norm": 0.675654947757721, "learning_rate": 0.01, "loss": 4.525753974914551, "num_input_tokens_seen": 7078488, "step": 1783, "train_runtime": 1448.7568, "train_tokens_per_second": 4885.905 }, { "epoch": 137.15384615384616, "num_input_tokens_seen": 7078488, "step": 1783, "train_accuracy": 0.021484375 }, { "epoch": 137.23076923076923, "grad_norm": 1.5541125535964966, "learning_rate": 0.01, "loss": 4.4922380447387695, "num_input_tokens_seen": 7082584, "step": 1784, "train_runtime": 1449.5691, "train_tokens_per_second": 4885.993 }, { "epoch": 137.23076923076923, "num_input_tokens_seen": 7082584, "step": 1784, "train_accuracy": 0.013671875 }, { "epoch": 137.30769230769232, "grad_norm": 0.3508233428001404, "learning_rate": 0.01, "loss": 4.518599987030029, "num_input_tokens_seen": 7086680, "step": 1785, "train_runtime": 1450.3817, "train_tokens_per_second": 4886.079 }, { "epoch": 137.30769230769232, "num_input_tokens_seen": 7086680, "step": 1785, "train_accuracy": 0.0234375 }, { "epoch": 137.3846153846154, "grad_norm": 0.20834478735923767, "learning_rate": 0.01, "loss": 4.44829797744751, "num_input_tokens_seen": 7090776, "step": 1786, "train_runtime": 1451.1961, "train_tokens_per_second": 4886.16 }, { "epoch": 137.3846153846154, "num_input_tokens_seen": 7090776, "step": 1786, "train_accuracy": 0.01171875 }, { "epoch": 137.46153846153845, "grad_norm": 1.0349732637405396, "learning_rate": 0.01, "loss": 4.531538009643555, "num_input_tokens_seen": 7094872, "step": 1787, "train_runtime": 1452.0082, "train_tokens_per_second": 4886.248 }, { "epoch": 137.46153846153845, "num_input_tokens_seen": 7094872, "step": 1787, "train_accuracy": 0.017578125 }, { "epoch": 137.53846153846155, "grad_norm": 0.3144688308238983, "learning_rate": 0.01, "loss": 4.505922317504883, "num_input_tokens_seen": 7098968, "step": 1788, "train_runtime": 1452.8218, "train_tokens_per_second": 4886.331 }, { "epoch": 137.53846153846155, "num_input_tokens_seen": 7098968, "step": 1788, "train_accuracy": 0.009765625 }, { "epoch": 137.6153846153846, "grad_norm": 0.3917436897754669, "learning_rate": 0.01, "loss": 4.52239990234375, "num_input_tokens_seen": 7103064, "step": 1789, "train_runtime": 1453.6347, "train_tokens_per_second": 4886.416 }, { "epoch": 137.6153846153846, "num_input_tokens_seen": 7103064, "step": 1789, "train_accuracy": 0.013671875 }, { "epoch": 137.69230769230768, "grad_norm": 0.5549172163009644, "learning_rate": 0.01, "loss": 4.514933109283447, "num_input_tokens_seen": 7107160, "step": 1790, "train_runtime": 1454.4497, "train_tokens_per_second": 4886.494 }, { "epoch": 137.69230769230768, "num_input_tokens_seen": 7107160, "step": 1790, "train_accuracy": 0.017578125 }, { "epoch": 137.76923076923077, "grad_norm": 5.873458385467529, "learning_rate": 0.01, "loss": 4.490239143371582, "num_input_tokens_seen": 7111256, "step": 1791, "train_runtime": 1455.2627, "train_tokens_per_second": 4886.579 }, { "epoch": 137.76923076923077, "num_input_tokens_seen": 7111256, "step": 1791, "train_accuracy": 0.0234375 }, { "epoch": 137.84615384615384, "grad_norm": 0.34059423208236694, "learning_rate": 0.01, "loss": 4.488921642303467, "num_input_tokens_seen": 7115352, "step": 1792, "train_runtime": 1456.0767, "train_tokens_per_second": 4886.66 }, { "epoch": 137.84615384615384, "num_input_tokens_seen": 7115352, "step": 1792, "train_accuracy": 0.009765625 }, { "epoch": 137.92307692307693, "grad_norm": 0.2996807396411896, "learning_rate": 0.01, "loss": 4.529014587402344, "num_input_tokens_seen": 7119448, "step": 1793, "train_runtime": 1456.8846, "train_tokens_per_second": 4886.762 }, { "epoch": 137.92307692307693, "num_input_tokens_seen": 7119448, "step": 1793, "train_accuracy": 0.013029315508902073 }, { "epoch": 138.0, "grad_norm": 0.34790003299713135, "learning_rate": 0.01, "loss": 4.576231479644775, "num_input_tokens_seen": 7121904, "step": 1794, "train_runtime": 1457.3992, "train_tokens_per_second": 4886.721 }, { "epoch": 138.0, "num_input_tokens_seen": 7121904, "step": 1794, "train_accuracy": 0.01953125 }, { "epoch": 138.07692307692307, "grad_norm": 0.42401421070098877, "learning_rate": 0.01, "loss": 4.517054557800293, "num_input_tokens_seen": 7126000, "step": 1795, "train_runtime": 1458.2251, "train_tokens_per_second": 4886.763 }, { "epoch": 138.07692307692307, "num_input_tokens_seen": 7126000, "step": 1795, "train_accuracy": 0.017578125 }, { "epoch": 138.15384615384616, "grad_norm": 0.24705839157104492, "learning_rate": 0.01, "loss": 4.490913391113281, "num_input_tokens_seen": 7130096, "step": 1796, "train_runtime": 1459.0385, "train_tokens_per_second": 4886.846 }, { "epoch": 138.15384615384616, "num_input_tokens_seen": 7130096, "step": 1796, "train_accuracy": 0.017578125 }, { "epoch": 138.23076923076923, "grad_norm": 0.40457087755203247, "learning_rate": 0.01, "loss": 4.516879081726074, "num_input_tokens_seen": 7134192, "step": 1797, "train_runtime": 1459.8552, "train_tokens_per_second": 4886.918 }, { "epoch": 138.23076923076923, "num_input_tokens_seen": 7134192, "step": 1797, "train_accuracy": 0.013671875 }, { "epoch": 138.30769230769232, "grad_norm": 0.22481785714626312, "learning_rate": 0.01, "loss": 4.499124050140381, "num_input_tokens_seen": 7138288, "step": 1798, "train_runtime": 1460.6694, "train_tokens_per_second": 4886.998 }, { "epoch": 138.30769230769232, "num_input_tokens_seen": 7138288, "step": 1798, "train_accuracy": 0.01953125 }, { "epoch": 138.3846153846154, "grad_norm": 0.24027518928050995, "learning_rate": 0.01, "loss": 4.458518028259277, "num_input_tokens_seen": 7142384, "step": 1799, "train_runtime": 1461.482, "train_tokens_per_second": 4887.083 }, { "epoch": 138.3846153846154, "num_input_tokens_seen": 7142384, "step": 1799, "train_accuracy": 0.015625 }, { "epoch": 138.46153846153845, "grad_norm": 0.7147669792175293, "learning_rate": 0.01, "loss": 4.481321334838867, "num_input_tokens_seen": 7146480, "step": 1800, "train_runtime": 1462.2949, "train_tokens_per_second": 4887.167 }, { "epoch": 138.46153846153845, "eval_CMD_3_branch_eval_accuracy": 0.0108499095840868, "eval_CMD_3_branch_eval_loss": 4.5855488777160645, "eval_CMD_3_branch_eval_runtime": 1.1503, "eval_CMD_3_branch_eval_samples_per_second": 2403.647, "eval_CMD_3_branch_eval_steps_per_second": 5.216, "num_input_tokens_seen": 7146480, "step": 1800 }, { "epoch": 138.46153846153845, "num_input_tokens_seen": 7146480, "step": 1800, "train_accuracy": 0.01171875 }, { "epoch": 138.53846153846155, "grad_norm": 0.4119090735912323, "learning_rate": 0.01, "loss": 4.541964054107666, "num_input_tokens_seen": 7150576, "step": 1801, "train_runtime": 1464.262, "train_tokens_per_second": 4883.399 }, { "epoch": 138.53846153846155, "num_input_tokens_seen": 7150576, "step": 1801, "train_accuracy": 0.013671875 }, { "epoch": 138.6153846153846, "grad_norm": 0.42758357524871826, "learning_rate": 0.01, "loss": 4.5123772621154785, "num_input_tokens_seen": 7154672, "step": 1802, "train_runtime": 1465.076, "train_tokens_per_second": 4883.482 }, { "epoch": 138.6153846153846, "num_input_tokens_seen": 7154672, "step": 1802, "train_accuracy": 0.015625 }, { "epoch": 138.69230769230768, "grad_norm": 0.47022491693496704, "learning_rate": 0.01, "loss": 4.535153388977051, "num_input_tokens_seen": 7158768, "step": 1803, "train_runtime": 1465.8945, "train_tokens_per_second": 4883.549 }, { "epoch": 138.69230769230768, "num_input_tokens_seen": 7158768, "step": 1803, "train_accuracy": 0.01171875 }, { "epoch": 138.76923076923077, "grad_norm": 0.2832880914211273, "learning_rate": 0.01, "loss": 4.516087532043457, "num_input_tokens_seen": 7162864, "step": 1804, "train_runtime": 1466.7075, "train_tokens_per_second": 4883.635 }, { "epoch": 138.76923076923077, "num_input_tokens_seen": 7162864, "step": 1804, "train_accuracy": 0.009765625 }, { "epoch": 138.84615384615384, "grad_norm": 0.37242209911346436, "learning_rate": 0.01, "loss": 4.56517219543457, "num_input_tokens_seen": 7166960, "step": 1805, "train_runtime": 1467.5209, "train_tokens_per_second": 4883.719 }, { "epoch": 138.84615384615384, "num_input_tokens_seen": 7166960, "step": 1805, "train_accuracy": 0.009765625 }, { "epoch": 138.92307692307693, "grad_norm": 0.8365891575813293, "learning_rate": 0.01, "loss": 4.533134460449219, "num_input_tokens_seen": 7171056, "step": 1806, "train_runtime": 1468.3307, "train_tokens_per_second": 4883.815 }, { "epoch": 138.92307692307693, "num_input_tokens_seen": 7171056, "step": 1806, "train_accuracy": 0.009771986864507198 }, { "epoch": 139.0, "grad_norm": 0.3855971693992615, "learning_rate": 0.01, "loss": 4.516770362854004, "num_input_tokens_seen": 7173512, "step": 1807, "train_runtime": 1468.8459, "train_tokens_per_second": 4883.774 }, { "epoch": 139.0, "num_input_tokens_seen": 7173512, "step": 1807, "train_accuracy": 0.01953125 }, { "epoch": 139.07692307692307, "grad_norm": 0.24986007809638977, "learning_rate": 0.01, "loss": 4.495937347412109, "num_input_tokens_seen": 7177608, "step": 1808, "train_runtime": 1469.6755, "train_tokens_per_second": 4883.805 }, { "epoch": 139.07692307692307, "num_input_tokens_seen": 7177608, "step": 1808, "train_accuracy": 0.02734375 }, { "epoch": 139.15384615384616, "grad_norm": 0.25552403926849365, "learning_rate": 0.01, "loss": 4.464908599853516, "num_input_tokens_seen": 7181704, "step": 1809, "train_runtime": 1470.4878, "train_tokens_per_second": 4883.892 }, { "epoch": 139.15384615384616, "num_input_tokens_seen": 7181704, "step": 1809, "train_accuracy": 0.005859375 }, { "epoch": 139.23076923076923, "grad_norm": 0.3772503137588501, "learning_rate": 0.01, "loss": 4.537103176116943, "num_input_tokens_seen": 7185800, "step": 1810, "train_runtime": 1471.3026, "train_tokens_per_second": 4883.971 }, { "epoch": 139.23076923076923, "num_input_tokens_seen": 7185800, "step": 1810, "train_accuracy": 0.017578125 }, { "epoch": 139.30769230769232, "grad_norm": 0.5765798091888428, "learning_rate": 0.01, "loss": 4.488556861877441, "num_input_tokens_seen": 7189896, "step": 1811, "train_runtime": 1472.117, "train_tokens_per_second": 4884.052 }, { "epoch": 139.30769230769232, "num_input_tokens_seen": 7189896, "step": 1811, "train_accuracy": 0.025390625 }, { "epoch": 139.3846153846154, "grad_norm": 0.5421313643455505, "learning_rate": 0.01, "loss": 4.506270885467529, "num_input_tokens_seen": 7193992, "step": 1812, "train_runtime": 1472.9323, "train_tokens_per_second": 4884.129 }, { "epoch": 139.3846153846154, "num_input_tokens_seen": 7193992, "step": 1812, "train_accuracy": 0.009765625 }, { "epoch": 139.46153846153845, "grad_norm": 0.34154364466667175, "learning_rate": 0.01, "loss": 4.489664077758789, "num_input_tokens_seen": 7198088, "step": 1813, "train_runtime": 1473.746, "train_tokens_per_second": 4884.212 }, { "epoch": 139.46153846153845, "num_input_tokens_seen": 7198088, "step": 1813, "train_accuracy": 0.017578125 }, { "epoch": 139.53846153846155, "grad_norm": 0.35041114687919617, "learning_rate": 0.01, "loss": 4.497374534606934, "num_input_tokens_seen": 7202184, "step": 1814, "train_runtime": 1474.5596, "train_tokens_per_second": 4884.295 }, { "epoch": 139.53846153846155, "num_input_tokens_seen": 7202184, "step": 1814, "train_accuracy": 0.015625 }, { "epoch": 139.6153846153846, "grad_norm": 0.3379485309123993, "learning_rate": 0.01, "loss": 4.500453472137451, "num_input_tokens_seen": 7206280, "step": 1815, "train_runtime": 1475.3731, "train_tokens_per_second": 4884.378 }, { "epoch": 139.6153846153846, "num_input_tokens_seen": 7206280, "step": 1815, "train_accuracy": 0.015625 }, { "epoch": 139.69230769230768, "grad_norm": 0.3296959400177002, "learning_rate": 0.01, "loss": 4.494850158691406, "num_input_tokens_seen": 7210376, "step": 1816, "train_runtime": 1476.1901, "train_tokens_per_second": 4884.449 }, { "epoch": 139.69230769230768, "num_input_tokens_seen": 7210376, "step": 1816, "train_accuracy": 0.009765625 }, { "epoch": 139.76923076923077, "grad_norm": 0.23183205723762512, "learning_rate": 0.01, "loss": 4.489829063415527, "num_input_tokens_seen": 7214472, "step": 1817, "train_runtime": 1477.0032, "train_tokens_per_second": 4884.534 }, { "epoch": 139.76923076923077, "num_input_tokens_seen": 7214472, "step": 1817, "train_accuracy": 0.013671875 }, { "epoch": 139.84615384615384, "grad_norm": 0.3803265392780304, "learning_rate": 0.01, "loss": 4.482579231262207, "num_input_tokens_seen": 7218568, "step": 1818, "train_runtime": 1477.8179, "train_tokens_per_second": 4884.613 }, { "epoch": 139.84615384615384, "num_input_tokens_seen": 7218568, "step": 1818, "train_accuracy": 0.015625 }, { "epoch": 139.92307692307693, "grad_norm": 0.4867537021636963, "learning_rate": 0.01, "loss": 4.499177932739258, "num_input_tokens_seen": 7222664, "step": 1819, "train_runtime": 1478.627, "train_tokens_per_second": 4884.71 }, { "epoch": 139.92307692307693, "num_input_tokens_seen": 7222664, "step": 1819, "train_accuracy": 0.016286645084619522 }, { "epoch": 140.0, "grad_norm": 0.4574130177497864, "learning_rate": 0.01, "loss": 4.492845058441162, "num_input_tokens_seen": 7225120, "step": 1820, "train_runtime": 1479.1424, "train_tokens_per_second": 4884.668 }, { "epoch": 140.0, "num_input_tokens_seen": 7225120, "step": 1820, "train_accuracy": 0.0234375 }, { "epoch": 140.07692307692307, "grad_norm": 0.23928667604923248, "learning_rate": 0.01, "loss": 4.489180088043213, "num_input_tokens_seen": 7229216, "step": 1821, "train_runtime": 1479.9686, "train_tokens_per_second": 4884.709 }, { "epoch": 140.07692307692307, "num_input_tokens_seen": 7229216, "step": 1821, "train_accuracy": 0.021484375 }, { "epoch": 140.15384615384616, "grad_norm": 0.9181494116783142, "learning_rate": 0.01, "loss": 4.458590507507324, "num_input_tokens_seen": 7233312, "step": 1822, "train_runtime": 1480.7825, "train_tokens_per_second": 4884.79 }, { "epoch": 140.15384615384616, "num_input_tokens_seen": 7233312, "step": 1822, "train_accuracy": 0.01953125 }, { "epoch": 140.23076923076923, "grad_norm": 0.28248587250709534, "learning_rate": 0.01, "loss": 4.466012477874756, "num_input_tokens_seen": 7237408, "step": 1823, "train_runtime": 1481.5969, "train_tokens_per_second": 4884.87 }, { "epoch": 140.23076923076923, "num_input_tokens_seen": 7237408, "step": 1823, "train_accuracy": 0.01953125 }, { "epoch": 140.30769230769232, "grad_norm": 0.9355012774467468, "learning_rate": 0.01, "loss": 4.448394298553467, "num_input_tokens_seen": 7241504, "step": 1824, "train_runtime": 1482.4101, "train_tokens_per_second": 4884.953 }, { "epoch": 140.30769230769232, "num_input_tokens_seen": 7241504, "step": 1824, "train_accuracy": 0.021484375 }, { "epoch": 140.3846153846154, "grad_norm": 0.3071248233318329, "learning_rate": 0.01, "loss": 4.461729526519775, "num_input_tokens_seen": 7245600, "step": 1825, "train_runtime": 1483.224, "train_tokens_per_second": 4885.034 }, { "epoch": 140.3846153846154, "num_input_tokens_seen": 7245600, "step": 1825, "train_accuracy": 0.009765625 }, { "epoch": 140.46153846153845, "grad_norm": 0.470536470413208, "learning_rate": 0.01, "loss": 4.476644515991211, "num_input_tokens_seen": 7249696, "step": 1826, "train_runtime": 1484.0388, "train_tokens_per_second": 4885.112 }, { "epoch": 140.46153846153845, "num_input_tokens_seen": 7249696, "step": 1826, "train_accuracy": 0.017578125 }, { "epoch": 140.53846153846155, "grad_norm": 0.7882267236709595, "learning_rate": 0.01, "loss": 4.481664180755615, "num_input_tokens_seen": 7253792, "step": 1827, "train_runtime": 1484.8533, "train_tokens_per_second": 4885.191 }, { "epoch": 140.53846153846155, "num_input_tokens_seen": 7253792, "step": 1827, "train_accuracy": 0.025390625 }, { "epoch": 140.6153846153846, "grad_norm": 0.32621821761131287, "learning_rate": 0.01, "loss": 4.481396198272705, "num_input_tokens_seen": 7257888, "step": 1828, "train_runtime": 1485.6684, "train_tokens_per_second": 4885.268 }, { "epoch": 140.6153846153846, "num_input_tokens_seen": 7257888, "step": 1828, "train_accuracy": 0.015625 }, { "epoch": 140.69230769230768, "grad_norm": 0.3387461006641388, "learning_rate": 0.01, "loss": 4.483463287353516, "num_input_tokens_seen": 7261984, "step": 1829, "train_runtime": 1486.4823, "train_tokens_per_second": 4885.348 }, { "epoch": 140.69230769230768, "num_input_tokens_seen": 7261984, "step": 1829, "train_accuracy": 0.01171875 }, { "epoch": 140.76923076923077, "grad_norm": 0.2903681993484497, "learning_rate": 0.01, "loss": 4.483816146850586, "num_input_tokens_seen": 7266080, "step": 1830, "train_runtime": 1487.2961, "train_tokens_per_second": 4885.429 }, { "epoch": 140.76923076923077, "num_input_tokens_seen": 7266080, "step": 1830, "train_accuracy": 0.013671875 }, { "epoch": 140.84615384615384, "grad_norm": 22.36224937438965, "learning_rate": 0.01, "loss": 4.496723175048828, "num_input_tokens_seen": 7270176, "step": 1831, "train_runtime": 1488.1108, "train_tokens_per_second": 4885.507 }, { "epoch": 140.84615384615384, "num_input_tokens_seen": 7270176, "step": 1831, "train_accuracy": 0.01171875 }, { "epoch": 140.92307692307693, "grad_norm": 0.5034341216087341, "learning_rate": 0.01, "loss": 4.457123279571533, "num_input_tokens_seen": 7274272, "step": 1832, "train_runtime": 1488.9209, "train_tokens_per_second": 4885.6 }, { "epoch": 140.92307692307693, "num_input_tokens_seen": 7274272, "step": 1832, "train_accuracy": 0.019543973729014397 }, { "epoch": 141.0, "grad_norm": 0.33878347277641296, "learning_rate": 0.01, "loss": 4.451435089111328, "num_input_tokens_seen": 7276728, "step": 1833, "train_runtime": 1489.4364, "train_tokens_per_second": 4885.558 }, { "epoch": 141.0, "num_input_tokens_seen": 7276728, "step": 1833, "train_accuracy": 0.017578125 }, { "epoch": 141.07692307692307, "grad_norm": 3.739004611968994, "learning_rate": 0.01, "loss": 4.433147430419922, "num_input_tokens_seen": 7280824, "step": 1834, "train_runtime": 1490.2632, "train_tokens_per_second": 4885.596 }, { "epoch": 141.07692307692307, "num_input_tokens_seen": 7280824, "step": 1834, "train_accuracy": 0.021484375 }, { "epoch": 141.15384615384616, "grad_norm": 0.5243370532989502, "learning_rate": 0.01, "loss": 4.409680366516113, "num_input_tokens_seen": 7284920, "step": 1835, "train_runtime": 1491.0781, "train_tokens_per_second": 4885.673 }, { "epoch": 141.15384615384616, "num_input_tokens_seen": 7284920, "step": 1835, "train_accuracy": 0.025390625 }, { "epoch": 141.23076923076923, "grad_norm": 0.9010217785835266, "learning_rate": 0.01, "loss": 4.446295261383057, "num_input_tokens_seen": 7289016, "step": 1836, "train_runtime": 1491.8915, "train_tokens_per_second": 4885.755 }, { "epoch": 141.23076923076923, "num_input_tokens_seen": 7289016, "step": 1836, "train_accuracy": 0.015625 }, { "epoch": 141.30769230769232, "grad_norm": 0.6142174601554871, "learning_rate": 0.01, "loss": 4.417339324951172, "num_input_tokens_seen": 7293112, "step": 1837, "train_runtime": 1492.7059, "train_tokens_per_second": 4885.833 }, { "epoch": 141.30769230769232, "num_input_tokens_seen": 7293112, "step": 1837, "train_accuracy": 0.029296875 }, { "epoch": 141.3846153846154, "grad_norm": 0.3696889877319336, "learning_rate": 0.01, "loss": 4.461832523345947, "num_input_tokens_seen": 7297208, "step": 1838, "train_runtime": 1493.5192, "train_tokens_per_second": 4885.915 }, { "epoch": 141.3846153846154, "num_input_tokens_seen": 7297208, "step": 1838, "train_accuracy": 0.0234375 }, { "epoch": 141.46153846153845, "grad_norm": 0.4366854429244995, "learning_rate": 0.01, "loss": 4.467984199523926, "num_input_tokens_seen": 7301304, "step": 1839, "train_runtime": 1494.334, "train_tokens_per_second": 4885.992 }, { "epoch": 141.46153846153845, "num_input_tokens_seen": 7301304, "step": 1839, "train_accuracy": 0.01953125 }, { "epoch": 141.53846153846155, "grad_norm": 1.5263376235961914, "learning_rate": 0.01, "loss": 4.44230318069458, "num_input_tokens_seen": 7305400, "step": 1840, "train_runtime": 1495.1485, "train_tokens_per_second": 4886.07 }, { "epoch": 141.53846153846155, "num_input_tokens_seen": 7305400, "step": 1840, "train_accuracy": 0.01171875 }, { "epoch": 141.6153846153846, "grad_norm": 0.508631706237793, "learning_rate": 0.01, "loss": 4.566743850708008, "num_input_tokens_seen": 7309496, "step": 1841, "train_runtime": 1495.965, "train_tokens_per_second": 4886.141 }, { "epoch": 141.6153846153846, "num_input_tokens_seen": 7309496, "step": 1841, "train_accuracy": 0.00390625 }, { "epoch": 141.69230769230768, "grad_norm": 0.3965621888637543, "learning_rate": 0.01, "loss": 4.438959121704102, "num_input_tokens_seen": 7313592, "step": 1842, "train_runtime": 1496.7792, "train_tokens_per_second": 4886.22 }, { "epoch": 141.69230769230768, "num_input_tokens_seen": 7313592, "step": 1842, "train_accuracy": 0.013671875 }, { "epoch": 141.76923076923077, "grad_norm": 0.2859092652797699, "learning_rate": 0.01, "loss": 4.481933116912842, "num_input_tokens_seen": 7317688, "step": 1843, "train_runtime": 1497.5936, "train_tokens_per_second": 4886.298 }, { "epoch": 141.76923076923077, "num_input_tokens_seen": 7317688, "step": 1843, "train_accuracy": 0.009765625 }, { "epoch": 141.84615384615384, "grad_norm": 0.3808438777923584, "learning_rate": 0.01, "loss": 4.477018356323242, "num_input_tokens_seen": 7321784, "step": 1844, "train_runtime": 1498.4079, "train_tokens_per_second": 4886.376 }, { "epoch": 141.84615384615384, "num_input_tokens_seen": 7321784, "step": 1844, "train_accuracy": 0.015625 }, { "epoch": 141.92307692307693, "grad_norm": 0.37763315439224243, "learning_rate": 0.01, "loss": 4.482439041137695, "num_input_tokens_seen": 7325880, "step": 1845, "train_runtime": 1499.2177, "train_tokens_per_second": 4886.468 }, { "epoch": 141.92307692307693, "num_input_tokens_seen": 7325880, "step": 1845, "train_accuracy": 0.0032573288772255182 }, { "epoch": 142.0, "grad_norm": 0.4352462589740753, "learning_rate": 0.01, "loss": 4.516756534576416, "num_input_tokens_seen": 7328336, "step": 1846, "train_runtime": 1499.7329, "train_tokens_per_second": 4886.427 }, { "epoch": 142.0, "num_input_tokens_seen": 7328336, "step": 1846, "train_accuracy": 0.021484375 }, { "epoch": 142.07692307692307, "grad_norm": 2.7508509159088135, "learning_rate": 0.01, "loss": 4.431884288787842, "num_input_tokens_seen": 7332432, "step": 1847, "train_runtime": 1500.5597, "train_tokens_per_second": 4886.465 }, { "epoch": 142.07692307692307, "num_input_tokens_seen": 7332432, "step": 1847, "train_accuracy": 0.025390625 }, { "epoch": 142.15384615384616, "grad_norm": 0.295866459608078, "learning_rate": 0.01, "loss": 4.467733383178711, "num_input_tokens_seen": 7336528, "step": 1848, "train_runtime": 1501.3742, "train_tokens_per_second": 4886.542 }, { "epoch": 142.15384615384616, "num_input_tokens_seen": 7336528, "step": 1848, "train_accuracy": 0.017578125 }, { "epoch": 142.23076923076923, "grad_norm": 1.1448103189468384, "learning_rate": 0.01, "loss": 4.491855144500732, "num_input_tokens_seen": 7340624, "step": 1849, "train_runtime": 1502.1883, "train_tokens_per_second": 4886.621 }, { "epoch": 142.23076923076923, "num_input_tokens_seen": 7340624, "step": 1849, "train_accuracy": 0.021484375 }, { "epoch": 142.30769230769232, "grad_norm": 0.5820721387863159, "learning_rate": 0.01, "loss": 4.487109184265137, "num_input_tokens_seen": 7344720, "step": 1850, "train_runtime": 1503.0034, "train_tokens_per_second": 4886.695 }, { "epoch": 142.30769230769232, "num_input_tokens_seen": 7344720, "step": 1850, "train_accuracy": 0.025390625 }, { "epoch": 142.3846153846154, "grad_norm": 0.3473348319530487, "learning_rate": 0.01, "loss": 4.461572647094727, "num_input_tokens_seen": 7348816, "step": 1851, "train_runtime": 1504.1069, "train_tokens_per_second": 4885.834 }, { "epoch": 142.3846153846154, "num_input_tokens_seen": 7348816, "step": 1851, "train_accuracy": 0.01953125 }, { "epoch": 142.46153846153845, "grad_norm": 0.3015472888946533, "learning_rate": 0.01, "loss": 4.4767165184021, "num_input_tokens_seen": 7352912, "step": 1852, "train_runtime": 1504.9196, "train_tokens_per_second": 4885.917 }, { "epoch": 142.46153846153845, "num_input_tokens_seen": 7352912, "step": 1852, "train_accuracy": 0.025390625 }, { "epoch": 142.53846153846155, "grad_norm": 0.26307594776153564, "learning_rate": 0.01, "loss": 4.494818687438965, "num_input_tokens_seen": 7357008, "step": 1853, "train_runtime": 1505.734, "train_tokens_per_second": 4885.995 }, { "epoch": 142.53846153846155, "num_input_tokens_seen": 7357008, "step": 1853, "train_accuracy": 0.03125 }, { "epoch": 142.6153846153846, "grad_norm": 0.7070944309234619, "learning_rate": 0.01, "loss": 4.474040508270264, "num_input_tokens_seen": 7361104, "step": 1854, "train_runtime": 1506.5515, "train_tokens_per_second": 4886.062 }, { "epoch": 142.6153846153846, "num_input_tokens_seen": 7361104, "step": 1854, "train_accuracy": 0.01171875 }, { "epoch": 142.69230769230768, "grad_norm": 0.29785415530204773, "learning_rate": 0.01, "loss": 4.507839202880859, "num_input_tokens_seen": 7365200, "step": 1855, "train_runtime": 1507.3658, "train_tokens_per_second": 4886.14 }, { "epoch": 142.69230769230768, "num_input_tokens_seen": 7365200, "step": 1855, "train_accuracy": 0.0234375 }, { "epoch": 142.76923076923077, "grad_norm": 0.325640469789505, "learning_rate": 0.01, "loss": 4.453739166259766, "num_input_tokens_seen": 7369296, "step": 1856, "train_runtime": 1508.1782, "train_tokens_per_second": 4886.224 }, { "epoch": 142.76923076923077, "num_input_tokens_seen": 7369296, "step": 1856, "train_accuracy": 0.005859375 }, { "epoch": 142.84615384615384, "grad_norm": 0.3849063813686371, "learning_rate": 0.01, "loss": 4.478244781494141, "num_input_tokens_seen": 7373392, "step": 1857, "train_runtime": 1508.9918, "train_tokens_per_second": 4886.304 }, { "epoch": 142.84615384615384, "num_input_tokens_seen": 7373392, "step": 1857, "train_accuracy": 0.009765625 }, { "epoch": 142.92307692307693, "grad_norm": 0.7774139642715454, "learning_rate": 0.01, "loss": 4.486651420593262, "num_input_tokens_seen": 7377488, "step": 1858, "train_runtime": 1509.8016, "train_tokens_per_second": 4886.396 }, { "epoch": 142.92307692307693, "num_input_tokens_seen": 7377488, "step": 1858, "train_accuracy": 0.0065146577544510365 }, { "epoch": 143.0, "grad_norm": 0.4661296010017395, "learning_rate": 0.01, "loss": 4.5151286125183105, "num_input_tokens_seen": 7379944, "step": 1859, "train_runtime": 1510.3161, "train_tokens_per_second": 4886.357 }, { "epoch": 143.0, "num_input_tokens_seen": 7379944, "step": 1859, "train_accuracy": 0.02734375 }, { "epoch": 143.07692307692307, "grad_norm": 0.27720293402671814, "learning_rate": 0.01, "loss": 4.443074703216553, "num_input_tokens_seen": 7384040, "step": 1860, "train_runtime": 1511.1415, "train_tokens_per_second": 4886.399 }, { "epoch": 143.07692307692307, "num_input_tokens_seen": 7384040, "step": 1860, "train_accuracy": 0.025390625 }, { "epoch": 143.15384615384616, "grad_norm": 0.24767735600471497, "learning_rate": 0.01, "loss": 4.409014701843262, "num_input_tokens_seen": 7388136, "step": 1861, "train_runtime": 1511.9548, "train_tokens_per_second": 4886.479 }, { "epoch": 143.15384615384616, "num_input_tokens_seen": 7388136, "step": 1861, "train_accuracy": 0.01953125 }, { "epoch": 143.23076923076923, "grad_norm": 0.7404224276542664, "learning_rate": 0.01, "loss": 4.457136154174805, "num_input_tokens_seen": 7392232, "step": 1862, "train_runtime": 1512.7678, "train_tokens_per_second": 4886.561 }, { "epoch": 143.23076923076923, "num_input_tokens_seen": 7392232, "step": 1862, "train_accuracy": 0.01171875 }, { "epoch": 143.30769230769232, "grad_norm": 0.29068946838378906, "learning_rate": 0.01, "loss": 4.466084003448486, "num_input_tokens_seen": 7396328, "step": 1863, "train_runtime": 1513.5829, "train_tokens_per_second": 4886.636 }, { "epoch": 143.30769230769232, "num_input_tokens_seen": 7396328, "step": 1863, "train_accuracy": 0.009765625 }, { "epoch": 143.3846153846154, "grad_norm": 0.3846644163131714, "learning_rate": 0.01, "loss": 4.4552001953125, "num_input_tokens_seen": 7400424, "step": 1864, "train_runtime": 1514.401, "train_tokens_per_second": 4886.701 }, { "epoch": 143.3846153846154, "num_input_tokens_seen": 7400424, "step": 1864, "train_accuracy": 0.01953125 }, { "epoch": 143.46153846153845, "grad_norm": 0.726744532585144, "learning_rate": 0.01, "loss": 4.420228958129883, "num_input_tokens_seen": 7404520, "step": 1865, "train_runtime": 1515.2135, "train_tokens_per_second": 4886.783 }, { "epoch": 143.46153846153845, "num_input_tokens_seen": 7404520, "step": 1865, "train_accuracy": 0.015625 }, { "epoch": 143.53846153846155, "grad_norm": 0.26240605115890503, "learning_rate": 0.01, "loss": 4.4455461502075195, "num_input_tokens_seen": 7408616, "step": 1866, "train_runtime": 1516.0269, "train_tokens_per_second": 4886.863 }, { "epoch": 143.53846153846155, "num_input_tokens_seen": 7408616, "step": 1866, "train_accuracy": 0.015625 }, { "epoch": 143.6153846153846, "grad_norm": 0.7446892857551575, "learning_rate": 0.01, "loss": 4.444561004638672, "num_input_tokens_seen": 7412712, "step": 1867, "train_runtime": 1516.8401, "train_tokens_per_second": 4886.944 }, { "epoch": 143.6153846153846, "num_input_tokens_seen": 7412712, "step": 1867, "train_accuracy": 0.015625 }, { "epoch": 143.69230769230768, "grad_norm": 0.29408547282218933, "learning_rate": 0.01, "loss": 4.4721174240112305, "num_input_tokens_seen": 7416808, "step": 1868, "train_runtime": 1517.6542, "train_tokens_per_second": 4887.021 }, { "epoch": 143.69230769230768, "num_input_tokens_seen": 7416808, "step": 1868, "train_accuracy": 0.0078125 }, { "epoch": 143.76923076923077, "grad_norm": 0.22807541489601135, "learning_rate": 0.01, "loss": 4.449373245239258, "num_input_tokens_seen": 7420904, "step": 1869, "train_runtime": 1518.4691, "train_tokens_per_second": 4887.096 }, { "epoch": 143.76923076923077, "num_input_tokens_seen": 7420904, "step": 1869, "train_accuracy": 0.01171875 }, { "epoch": 143.84615384615384, "grad_norm": 0.357966810464859, "learning_rate": 0.01, "loss": 4.463508605957031, "num_input_tokens_seen": 7425000, "step": 1870, "train_runtime": 1519.2833, "train_tokens_per_second": 4887.173 }, { "epoch": 143.84615384615384, "num_input_tokens_seen": 7425000, "step": 1870, "train_accuracy": 0.01953125 }, { "epoch": 143.92307692307693, "grad_norm": 0.27506953477859497, "learning_rate": 0.01, "loss": 4.448062896728516, "num_input_tokens_seen": 7429096, "step": 1871, "train_runtime": 1520.0926, "train_tokens_per_second": 4887.265 }, { "epoch": 143.92307692307693, "num_input_tokens_seen": 7429096, "step": 1871, "train_accuracy": 0.026058631017804146 }, { "epoch": 144.0, "grad_norm": 0.5646443367004395, "learning_rate": 0.01, "loss": 4.415185928344727, "num_input_tokens_seen": 7431552, "step": 1872, "train_runtime": 1520.6075, "train_tokens_per_second": 4887.226 }, { "epoch": 144.0, "num_input_tokens_seen": 7431552, "step": 1872, "train_accuracy": 0.02734375 }, { "epoch": 144.07692307692307, "grad_norm": 0.3606163263320923, "learning_rate": 0.01, "loss": 4.352210998535156, "num_input_tokens_seen": 7435648, "step": 1873, "train_runtime": 1521.4334, "train_tokens_per_second": 4887.265 }, { "epoch": 144.07692307692307, "num_input_tokens_seen": 7435648, "step": 1873, "train_accuracy": 0.017578125 }, { "epoch": 144.15384615384616, "grad_norm": 0.5210484266281128, "learning_rate": 0.01, "loss": 4.4506659507751465, "num_input_tokens_seen": 7439744, "step": 1874, "train_runtime": 1522.2486, "train_tokens_per_second": 4887.338 }, { "epoch": 144.15384615384616, "num_input_tokens_seen": 7439744, "step": 1874, "train_accuracy": 0.015625 }, { "epoch": 144.23076923076923, "grad_norm": 1.2244443893432617, "learning_rate": 0.01, "loss": 4.372976303100586, "num_input_tokens_seen": 7443840, "step": 1875, "train_runtime": 1523.0628, "train_tokens_per_second": 4887.415 }, { "epoch": 144.23076923076923, "num_input_tokens_seen": 7443840, "step": 1875, "train_accuracy": 0.01171875 }, { "epoch": 144.30769230769232, "grad_norm": 0.552419900894165, "learning_rate": 0.01, "loss": 4.419890403747559, "num_input_tokens_seen": 7447936, "step": 1876, "train_runtime": 1523.8779, "train_tokens_per_second": 4887.489 }, { "epoch": 144.30769230769232, "num_input_tokens_seen": 7447936, "step": 1876, "train_accuracy": 0.03515625 }, { "epoch": 144.3846153846154, "grad_norm": 0.389026015996933, "learning_rate": 0.01, "loss": 4.421940803527832, "num_input_tokens_seen": 7452032, "step": 1877, "train_runtime": 1524.6914, "train_tokens_per_second": 4887.568 }, { "epoch": 144.3846153846154, "num_input_tokens_seen": 7452032, "step": 1877, "train_accuracy": 0.025390625 }, { "epoch": 144.46153846153845, "grad_norm": 0.4070936441421509, "learning_rate": 0.01, "loss": 4.416196346282959, "num_input_tokens_seen": 7456128, "step": 1878, "train_runtime": 1525.505, "train_tokens_per_second": 4887.646 }, { "epoch": 144.46153846153845, "num_input_tokens_seen": 7456128, "step": 1878, "train_accuracy": 0.013671875 }, { "epoch": 144.53846153846155, "grad_norm": 0.5539480447769165, "learning_rate": 0.01, "loss": 4.417213439941406, "num_input_tokens_seen": 7460224, "step": 1879, "train_runtime": 1526.319, "train_tokens_per_second": 4887.723 }, { "epoch": 144.53846153846155, "num_input_tokens_seen": 7460224, "step": 1879, "train_accuracy": 0.013671875 }, { "epoch": 144.6153846153846, "grad_norm": 0.509876549243927, "learning_rate": 0.01, "loss": 4.399030685424805, "num_input_tokens_seen": 7464320, "step": 1880, "train_runtime": 1527.1336, "train_tokens_per_second": 4887.798 }, { "epoch": 144.6153846153846, "num_input_tokens_seen": 7464320, "step": 1880, "train_accuracy": 0.017578125 }, { "epoch": 144.69230769230768, "grad_norm": 0.31289342045783997, "learning_rate": 0.01, "loss": 4.391263008117676, "num_input_tokens_seen": 7468416, "step": 1881, "train_runtime": 1527.9479, "train_tokens_per_second": 4887.873 }, { "epoch": 144.69230769230768, "num_input_tokens_seen": 7468416, "step": 1881, "train_accuracy": 0.015625 }, { "epoch": 144.76923076923077, "grad_norm": 0.9623465538024902, "learning_rate": 0.01, "loss": 4.368143081665039, "num_input_tokens_seen": 7472512, "step": 1882, "train_runtime": 1528.7631, "train_tokens_per_second": 4887.946 }, { "epoch": 144.76923076923077, "num_input_tokens_seen": 7472512, "step": 1882, "train_accuracy": 0.01953125 }, { "epoch": 144.84615384615384, "grad_norm": 1.9266918897628784, "learning_rate": 0.01, "loss": 4.450263977050781, "num_input_tokens_seen": 7476608, "step": 1883, "train_runtime": 1529.577, "train_tokens_per_second": 4888.023 }, { "epoch": 144.84615384615384, "num_input_tokens_seen": 7476608, "step": 1883, "train_accuracy": 0.0234375 }, { "epoch": 144.92307692307693, "grad_norm": 0.6616586446762085, "learning_rate": 0.01, "loss": 4.446620464324951, "num_input_tokens_seen": 7480704, "step": 1884, "train_runtime": 1530.3873, "train_tokens_per_second": 4888.112 }, { "epoch": 144.92307692307693, "num_input_tokens_seen": 7480704, "step": 1884, "train_accuracy": 0.013029315508902073 }, { "epoch": 145.0, "grad_norm": 0.4342552125453949, "learning_rate": 0.01, "loss": 4.474233150482178, "num_input_tokens_seen": 7483160, "step": 1885, "train_runtime": 1530.904, "train_tokens_per_second": 4888.066 }, { "epoch": 145.0, "num_input_tokens_seen": 7483160, "step": 1885, "train_accuracy": 0.015625 }, { "epoch": 145.07692307692307, "grad_norm": 0.269889771938324, "learning_rate": 0.01, "loss": 4.450728416442871, "num_input_tokens_seen": 7487256, "step": 1886, "train_runtime": 1531.7306, "train_tokens_per_second": 4888.102 }, { "epoch": 145.07692307692307, "num_input_tokens_seen": 7487256, "step": 1886, "train_accuracy": 0.01171875 }, { "epoch": 145.15384615384616, "grad_norm": 0.32820841670036316, "learning_rate": 0.01, "loss": 4.453962326049805, "num_input_tokens_seen": 7491352, "step": 1887, "train_runtime": 1532.5447, "train_tokens_per_second": 4888.178 }, { "epoch": 145.15384615384616, "num_input_tokens_seen": 7491352, "step": 1887, "train_accuracy": 0.01953125 }, { "epoch": 145.23076923076923, "grad_norm": 3.949856758117676, "learning_rate": 0.01, "loss": 4.493199348449707, "num_input_tokens_seen": 7495448, "step": 1888, "train_runtime": 1533.3602, "train_tokens_per_second": 4888.25 }, { "epoch": 145.23076923076923, "num_input_tokens_seen": 7495448, "step": 1888, "train_accuracy": 0.025390625 }, { "epoch": 145.30769230769232, "grad_norm": 0.3343822956085205, "learning_rate": 0.01, "loss": 4.399847030639648, "num_input_tokens_seen": 7499544, "step": 1889, "train_runtime": 1534.1748, "train_tokens_per_second": 4888.324 }, { "epoch": 145.30769230769232, "num_input_tokens_seen": 7499544, "step": 1889, "train_accuracy": 0.017578125 }, { "epoch": 145.3846153846154, "grad_norm": 0.39394888281822205, "learning_rate": 0.01, "loss": 4.4716997146606445, "num_input_tokens_seen": 7503640, "step": 1890, "train_runtime": 1534.9893, "train_tokens_per_second": 4888.399 }, { "epoch": 145.3846153846154, "num_input_tokens_seen": 7503640, "step": 1890, "train_accuracy": 0.015625 }, { "epoch": 145.46153846153845, "grad_norm": 0.32070469856262207, "learning_rate": 0.01, "loss": 4.444943428039551, "num_input_tokens_seen": 7507736, "step": 1891, "train_runtime": 1535.8039, "train_tokens_per_second": 4888.473 }, { "epoch": 145.46153846153845, "num_input_tokens_seen": 7507736, "step": 1891, "train_accuracy": 0.017578125 }, { "epoch": 145.53846153846155, "grad_norm": 2.3454792499542236, "learning_rate": 0.01, "loss": 4.485935211181641, "num_input_tokens_seen": 7511832, "step": 1892, "train_runtime": 1536.6191, "train_tokens_per_second": 4888.545 }, { "epoch": 145.53846153846155, "num_input_tokens_seen": 7511832, "step": 1892, "train_accuracy": 0.017578125 }, { "epoch": 145.6153846153846, "grad_norm": 0.4269157648086548, "learning_rate": 0.01, "loss": 4.4301228523254395, "num_input_tokens_seen": 7515928, "step": 1893, "train_runtime": 1537.4332, "train_tokens_per_second": 4888.621 }, { "epoch": 145.6153846153846, "num_input_tokens_seen": 7515928, "step": 1893, "train_accuracy": 0.009765625 }, { "epoch": 145.69230769230768, "grad_norm": 0.8848997354507446, "learning_rate": 0.01, "loss": 4.462418556213379, "num_input_tokens_seen": 7520024, "step": 1894, "train_runtime": 1538.2493, "train_tokens_per_second": 4888.69 }, { "epoch": 145.69230769230768, "num_input_tokens_seen": 7520024, "step": 1894, "train_accuracy": 0.01171875 }, { "epoch": 145.76923076923077, "grad_norm": 0.4912108778953552, "learning_rate": 0.01, "loss": 4.469257831573486, "num_input_tokens_seen": 7524120, "step": 1895, "train_runtime": 1539.0637, "train_tokens_per_second": 4888.765 }, { "epoch": 145.76923076923077, "num_input_tokens_seen": 7524120, "step": 1895, "train_accuracy": 0.021484375 }, { "epoch": 145.84615384615384, "grad_norm": 1.5754284858703613, "learning_rate": 0.01, "loss": 4.464353084564209, "num_input_tokens_seen": 7528216, "step": 1896, "train_runtime": 1539.8779, "train_tokens_per_second": 4888.839 }, { "epoch": 145.84615384615384, "num_input_tokens_seen": 7528216, "step": 1896, "train_accuracy": 0.029296875 }, { "epoch": 145.92307692307693, "grad_norm": 4.208193302154541, "learning_rate": 0.01, "loss": 4.438633918762207, "num_input_tokens_seen": 7532312, "step": 1897, "train_runtime": 1540.6878, "train_tokens_per_second": 4888.928 }, { "epoch": 145.92307692307693, "num_input_tokens_seen": 7532312, "step": 1897, "train_accuracy": 0.0065146577544510365 }, { "epoch": 146.0, "grad_norm": 0.3978414237499237, "learning_rate": 0.01, "loss": 4.482831001281738, "num_input_tokens_seen": 7534768, "step": 1898, "train_runtime": 1541.2029, "train_tokens_per_second": 4888.888 }, { "epoch": 146.0, "num_input_tokens_seen": 7534768, "step": 1898, "train_accuracy": 0.0078125 }, { "epoch": 146.07692307692307, "grad_norm": 0.5319635272026062, "learning_rate": 0.01, "loss": 4.4385271072387695, "num_input_tokens_seen": 7538864, "step": 1899, "train_runtime": 1542.0326, "train_tokens_per_second": 4888.913 }, { "epoch": 146.07692307692307, "num_input_tokens_seen": 7538864, "step": 1899, "train_accuracy": 0.015625 }, { "epoch": 146.15384615384616, "grad_norm": 0.4587706923484802, "learning_rate": 0.01, "loss": 4.444916725158691, "num_input_tokens_seen": 7542960, "step": 1900, "train_runtime": 1542.851, "train_tokens_per_second": 4888.975 }, { "epoch": 146.15384615384616, "eval_CMD_3_branch_eval_accuracy": 0.011934900542495479, "eval_CMD_3_branch_eval_loss": 4.494749546051025, "eval_CMD_3_branch_eval_runtime": 1.1543, "eval_CMD_3_branch_eval_samples_per_second": 2395.338, "eval_CMD_3_branch_eval_steps_per_second": 5.198, "num_input_tokens_seen": 7542960, "step": 1900 }, { "epoch": 146.15384615384616, "num_input_tokens_seen": 7542960, "step": 1900, "train_accuracy": 0.009765625 }, { "epoch": 146.23076923076923, "grad_norm": 0.8114116787910461, "learning_rate": 0.01, "loss": 4.4554595947265625, "num_input_tokens_seen": 7547056, "step": 1901, "train_runtime": 1544.8254, "train_tokens_per_second": 4885.378 }, { "epoch": 146.23076923076923, "num_input_tokens_seen": 7547056, "step": 1901, "train_accuracy": 0.0234375 }, { "epoch": 146.30769230769232, "grad_norm": 0.2652541399002075, "learning_rate": 0.01, "loss": 4.4496169090271, "num_input_tokens_seen": 7551152, "step": 1902, "train_runtime": 1545.6419, "train_tokens_per_second": 4885.447 }, { "epoch": 146.30769230769232, "num_input_tokens_seen": 7551152, "step": 1902, "train_accuracy": 0.01953125 }, { "epoch": 146.3846153846154, "grad_norm": 2.1605048179626465, "learning_rate": 0.01, "loss": 4.47141695022583, "num_input_tokens_seen": 7555248, "step": 1903, "train_runtime": 1546.4649, "train_tokens_per_second": 4885.496 }, { "epoch": 146.3846153846154, "num_input_tokens_seen": 7555248, "step": 1903, "train_accuracy": 0.013671875 }, { "epoch": 146.46153846153845, "grad_norm": 0.5354732871055603, "learning_rate": 0.01, "loss": 4.465007781982422, "num_input_tokens_seen": 7559344, "step": 1904, "train_runtime": 1547.2808, "train_tokens_per_second": 4885.567 }, { "epoch": 146.46153846153845, "num_input_tokens_seen": 7559344, "step": 1904, "train_accuracy": 0.017578125 }, { "epoch": 146.53846153846155, "grad_norm": 0.6656928658485413, "learning_rate": 0.01, "loss": 4.482838153839111, "num_input_tokens_seen": 7563440, "step": 1905, "train_runtime": 1548.0968, "train_tokens_per_second": 4885.638 }, { "epoch": 146.53846153846155, "num_input_tokens_seen": 7563440, "step": 1905, "train_accuracy": 0.017578125 }, { "epoch": 146.6153846153846, "grad_norm": 2.222104072570801, "learning_rate": 0.01, "loss": 4.4592742919921875, "num_input_tokens_seen": 7567536, "step": 1906, "train_runtime": 1548.9114, "train_tokens_per_second": 4885.713 }, { "epoch": 146.6153846153846, "num_input_tokens_seen": 7567536, "step": 1906, "train_accuracy": 0.0234375 }, { "epoch": 146.69230769230768, "grad_norm": 0.7789755463600159, "learning_rate": 0.01, "loss": 4.525387763977051, "num_input_tokens_seen": 7571632, "step": 1907, "train_runtime": 1549.7265, "train_tokens_per_second": 4885.786 }, { "epoch": 146.69230769230768, "num_input_tokens_seen": 7571632, "step": 1907, "train_accuracy": 0.015625 }, { "epoch": 146.76923076923077, "grad_norm": 0.37413662672042847, "learning_rate": 0.01, "loss": 4.4984517097473145, "num_input_tokens_seen": 7575728, "step": 1908, "train_runtime": 1550.5421, "train_tokens_per_second": 4885.858 }, { "epoch": 146.76923076923077, "num_input_tokens_seen": 7575728, "step": 1908, "train_accuracy": 0.0078125 }, { "epoch": 146.84615384615384, "grad_norm": 0.33064937591552734, "learning_rate": 0.01, "loss": 4.53651237487793, "num_input_tokens_seen": 7579824, "step": 1909, "train_runtime": 1551.3579, "train_tokens_per_second": 4885.929 }, { "epoch": 146.84615384615384, "num_input_tokens_seen": 7579824, "step": 1909, "train_accuracy": 0.017578125 }, { "epoch": 146.92307692307693, "grad_norm": 0.8711787462234497, "learning_rate": 0.01, "loss": 4.535449028015137, "num_input_tokens_seen": 7583920, "step": 1910, "train_runtime": 1552.1685, "train_tokens_per_second": 4886.016 }, { "epoch": 146.92307692307693, "num_input_tokens_seen": 7583920, "step": 1910, "train_accuracy": 0.013029315508902073 }, { "epoch": 147.0, "grad_norm": 0.39004987478256226, "learning_rate": 0.01, "loss": 4.533785343170166, "num_input_tokens_seen": 7586376, "step": 1911, "train_runtime": 1552.684, "train_tokens_per_second": 4885.975 }, { "epoch": 147.0, "num_input_tokens_seen": 7586376, "step": 1911, "train_accuracy": 0.01171875 }, { "epoch": 147.07692307692307, "grad_norm": 0.3635663688182831, "learning_rate": 0.01, "loss": 4.534843921661377, "num_input_tokens_seen": 7590472, "step": 1912, "train_runtime": 1553.511, "train_tokens_per_second": 4886.011 }, { "epoch": 147.07692307692307, "num_input_tokens_seen": 7590472, "step": 1912, "train_accuracy": 0.013671875 }, { "epoch": 147.15384615384616, "grad_norm": 0.2025507241487503, "learning_rate": 0.01, "loss": 4.535642623901367, "num_input_tokens_seen": 7594568, "step": 1913, "train_runtime": 1554.3274, "train_tokens_per_second": 4886.08 }, { "epoch": 147.15384615384616, "num_input_tokens_seen": 7594568, "step": 1913, "train_accuracy": 0.009765625 }, { "epoch": 147.23076923076923, "grad_norm": 0.2537078857421875, "learning_rate": 0.01, "loss": 4.543508529663086, "num_input_tokens_seen": 7598664, "step": 1914, "train_runtime": 1555.1428, "train_tokens_per_second": 4886.152 }, { "epoch": 147.23076923076923, "num_input_tokens_seen": 7598664, "step": 1914, "train_accuracy": 0.013671875 }, { "epoch": 147.30769230769232, "grad_norm": 0.25231072306632996, "learning_rate": 0.01, "loss": 4.54705810546875, "num_input_tokens_seen": 7602760, "step": 1915, "train_runtime": 1555.9582, "train_tokens_per_second": 4886.224 }, { "epoch": 147.30769230769232, "num_input_tokens_seen": 7602760, "step": 1915, "train_accuracy": 0.005859375 }, { "epoch": 147.3846153846154, "grad_norm": 0.2876351773738861, "learning_rate": 0.01, "loss": 4.552492141723633, "num_input_tokens_seen": 7606856, "step": 1916, "train_runtime": 1556.7733, "train_tokens_per_second": 4886.296 }, { "epoch": 147.3846153846154, "num_input_tokens_seen": 7606856, "step": 1916, "train_accuracy": 0.01953125 }, { "epoch": 147.46153846153845, "grad_norm": 0.2483632117509842, "learning_rate": 0.01, "loss": 4.564187049865723, "num_input_tokens_seen": 7610952, "step": 1917, "train_runtime": 1557.5879, "train_tokens_per_second": 4886.371 }, { "epoch": 147.46153846153845, "num_input_tokens_seen": 7610952, "step": 1917, "train_accuracy": 0.021484375 }, { "epoch": 147.53846153846155, "grad_norm": 0.2530250549316406, "learning_rate": 0.01, "loss": 4.551231384277344, "num_input_tokens_seen": 7615048, "step": 1918, "train_runtime": 1558.4031, "train_tokens_per_second": 4886.443 }, { "epoch": 147.53846153846155, "num_input_tokens_seen": 7615048, "step": 1918, "train_accuracy": 0.013671875 }, { "epoch": 147.6153846153846, "grad_norm": 0.21836470067501068, "learning_rate": 0.01, "loss": 4.567032814025879, "num_input_tokens_seen": 7619144, "step": 1919, "train_runtime": 1559.2185, "train_tokens_per_second": 4886.515 }, { "epoch": 147.6153846153846, "num_input_tokens_seen": 7619144, "step": 1919, "train_accuracy": 0.013671875 }, { "epoch": 147.69230769230768, "grad_norm": 0.30134090781211853, "learning_rate": 0.01, "loss": 4.554921627044678, "num_input_tokens_seen": 7623240, "step": 1920, "train_runtime": 1560.0346, "train_tokens_per_second": 4886.584 }, { "epoch": 147.69230769230768, "num_input_tokens_seen": 7623240, "step": 1920, "train_accuracy": 0.01171875 }, { "epoch": 147.76923076923077, "grad_norm": 0.39850473403930664, "learning_rate": 0.01, "loss": 4.575058937072754, "num_input_tokens_seen": 7627336, "step": 1921, "train_runtime": 1560.8497, "train_tokens_per_second": 4886.656 }, { "epoch": 147.76923076923077, "num_input_tokens_seen": 7627336, "step": 1921, "train_accuracy": 0.013671875 }, { "epoch": 147.84615384615384, "grad_norm": 0.4197423458099365, "learning_rate": 0.01, "loss": 4.550651550292969, "num_input_tokens_seen": 7631432, "step": 1922, "train_runtime": 1561.6643, "train_tokens_per_second": 4886.73 }, { "epoch": 147.84615384615384, "num_input_tokens_seen": 7631432, "step": 1922, "train_accuracy": 0.009765625 }, { "epoch": 147.92307692307693, "grad_norm": 0.2957670986652374, "learning_rate": 0.01, "loss": 4.577169418334961, "num_input_tokens_seen": 7635528, "step": 1923, "train_runtime": 1562.4753, "train_tokens_per_second": 4886.815 }, { "epoch": 147.92307692307693, "num_input_tokens_seen": 7635528, "step": 1923, "train_accuracy": 0.009771986864507198 }, { "epoch": 148.0, "grad_norm": 0.34968140721321106, "learning_rate": 0.01, "loss": 4.567928314208984, "num_input_tokens_seen": 7637984, "step": 1924, "train_runtime": 1562.9904, "train_tokens_per_second": 4886.776 }, { "epoch": 148.0, "num_input_tokens_seen": 7637984, "step": 1924, "train_accuracy": 0.01953125 }, { "epoch": 148.07692307692307, "grad_norm": 0.21659724414348602, "learning_rate": 0.01, "loss": 4.5482177734375, "num_input_tokens_seen": 7642080, "step": 1925, "train_runtime": 1563.8208, "train_tokens_per_second": 4886.8 }, { "epoch": 148.07692307692307, "num_input_tokens_seen": 7642080, "step": 1925, "train_accuracy": 0.009765625 }, { "epoch": 148.15384615384616, "grad_norm": 0.5055199265480042, "learning_rate": 0.01, "loss": 4.555220603942871, "num_input_tokens_seen": 7646176, "step": 1926, "train_runtime": 1564.6357, "train_tokens_per_second": 4886.873 }, { "epoch": 148.15384615384616, "num_input_tokens_seen": 7646176, "step": 1926, "train_accuracy": 0.00390625 }, { "epoch": 148.23076923076923, "grad_norm": 0.39798504114151, "learning_rate": 0.01, "loss": 4.528914928436279, "num_input_tokens_seen": 7650272, "step": 1927, "train_runtime": 1565.4526, "train_tokens_per_second": 4886.939 }, { "epoch": 148.23076923076923, "num_input_tokens_seen": 7650272, "step": 1927, "train_accuracy": 0.013671875 }, { "epoch": 148.30769230769232, "grad_norm": 0.267161101102829, "learning_rate": 0.01, "loss": 4.556334018707275, "num_input_tokens_seen": 7654368, "step": 1928, "train_runtime": 1566.2679, "train_tokens_per_second": 4887.011 }, { "epoch": 148.30769230769232, "num_input_tokens_seen": 7654368, "step": 1928, "train_accuracy": 0.013671875 }, { "epoch": 148.3846153846154, "grad_norm": 0.337952196598053, "learning_rate": 0.01, "loss": 4.570736885070801, "num_input_tokens_seen": 7658464, "step": 1929, "train_runtime": 1567.0834, "train_tokens_per_second": 4887.081 }, { "epoch": 148.3846153846154, "num_input_tokens_seen": 7658464, "step": 1929, "train_accuracy": 0.0078125 }, { "epoch": 148.46153846153845, "grad_norm": 0.2820669412612915, "learning_rate": 0.01, "loss": 4.561923980712891, "num_input_tokens_seen": 7662560, "step": 1930, "train_runtime": 1567.8978, "train_tokens_per_second": 4887.155 }, { "epoch": 148.46153846153845, "num_input_tokens_seen": 7662560, "step": 1930, "train_accuracy": 0.0078125 }, { "epoch": 148.53846153846155, "grad_norm": 0.2407274842262268, "learning_rate": 0.01, "loss": 4.524092674255371, "num_input_tokens_seen": 7666656, "step": 1931, "train_runtime": 1568.714, "train_tokens_per_second": 4887.223 }, { "epoch": 148.53846153846155, "num_input_tokens_seen": 7666656, "step": 1931, "train_accuracy": 0.01953125 }, { "epoch": 148.6153846153846, "grad_norm": 0.24104392528533936, "learning_rate": 0.01, "loss": 4.526534080505371, "num_input_tokens_seen": 7670752, "step": 1932, "train_runtime": 1569.5302, "train_tokens_per_second": 4887.292 }, { "epoch": 148.6153846153846, "num_input_tokens_seen": 7670752, "step": 1932, "train_accuracy": 0.00390625 }, { "epoch": 148.69230769230768, "grad_norm": 0.31010931730270386, "learning_rate": 0.01, "loss": 4.554614067077637, "num_input_tokens_seen": 7674848, "step": 1933, "train_runtime": 1570.3486, "train_tokens_per_second": 4887.353 }, { "epoch": 148.69230769230768, "num_input_tokens_seen": 7674848, "step": 1933, "train_accuracy": 0.01171875 }, { "epoch": 148.76923076923077, "grad_norm": 0.1968391090631485, "learning_rate": 0.01, "loss": 4.527078628540039, "num_input_tokens_seen": 7678944, "step": 1934, "train_runtime": 1571.1653, "train_tokens_per_second": 4887.419 }, { "epoch": 148.76923076923077, "num_input_tokens_seen": 7678944, "step": 1934, "train_accuracy": 0.00390625 }, { "epoch": 148.84615384615384, "grad_norm": 0.263007789850235, "learning_rate": 0.01, "loss": 4.539289951324463, "num_input_tokens_seen": 7683040, "step": 1935, "train_runtime": 1571.9799, "train_tokens_per_second": 4887.493 }, { "epoch": 148.84615384615384, "num_input_tokens_seen": 7683040, "step": 1935, "train_accuracy": 0.005859375 }, { "epoch": 148.92307692307693, "grad_norm": 0.2502298951148987, "learning_rate": 0.01, "loss": 4.544886589050293, "num_input_tokens_seen": 7687136, "step": 1936, "train_runtime": 1572.7907, "train_tokens_per_second": 4887.577 }, { "epoch": 148.92307692307693, "num_input_tokens_seen": 7687136, "step": 1936, "train_accuracy": 0.013029315508902073 }, { "epoch": 149.0, "grad_norm": 0.3240714371204376, "learning_rate": 0.01, "loss": 4.544671535491943, "num_input_tokens_seen": 7689592, "step": 1937, "train_runtime": 1573.3074, "train_tokens_per_second": 4887.533 }, { "epoch": 149.0, "num_input_tokens_seen": 7689592, "step": 1937, "train_accuracy": 0.009765625 }, { "epoch": 149.07692307692307, "grad_norm": 0.2039574384689331, "learning_rate": 0.01, "loss": 4.522834777832031, "num_input_tokens_seen": 7693688, "step": 1938, "train_runtime": 1574.1368, "train_tokens_per_second": 4887.56 }, { "epoch": 149.07692307692307, "num_input_tokens_seen": 7693688, "step": 1938, "train_accuracy": 0.01953125 }, { "epoch": 149.15384615384616, "grad_norm": 1.0362766981124878, "learning_rate": 0.01, "loss": 4.514573097229004, "num_input_tokens_seen": 7697784, "step": 1939, "train_runtime": 1574.9517, "train_tokens_per_second": 4887.632 }, { "epoch": 149.15384615384616, "num_input_tokens_seen": 7697784, "step": 1939, "train_accuracy": 0.025390625 }, { "epoch": 149.23076923076923, "grad_norm": 0.29704248905181885, "learning_rate": 0.01, "loss": 4.513667106628418, "num_input_tokens_seen": 7701880, "step": 1940, "train_runtime": 1575.7694, "train_tokens_per_second": 4887.695 }, { "epoch": 149.23076923076923, "num_input_tokens_seen": 7701880, "step": 1940, "train_accuracy": 0.015625 }, { "epoch": 149.30769230769232, "grad_norm": 0.4148108959197998, "learning_rate": 0.01, "loss": 4.529236316680908, "num_input_tokens_seen": 7705976, "step": 1941, "train_runtime": 1576.5853, "train_tokens_per_second": 4887.764 }, { "epoch": 149.30769230769232, "num_input_tokens_seen": 7705976, "step": 1941, "train_accuracy": 0.015625 }, { "epoch": 149.3846153846154, "grad_norm": 0.3442012369632721, "learning_rate": 0.01, "loss": 4.504043102264404, "num_input_tokens_seen": 7710072, "step": 1942, "train_runtime": 1577.3992, "train_tokens_per_second": 4887.838 }, { "epoch": 149.3846153846154, "num_input_tokens_seen": 7710072, "step": 1942, "train_accuracy": 0.005859375 }, { "epoch": 149.46153846153845, "grad_norm": 0.2795056700706482, "learning_rate": 0.01, "loss": 4.526984691619873, "num_input_tokens_seen": 7714168, "step": 1943, "train_runtime": 1578.2143, "train_tokens_per_second": 4887.909 }, { "epoch": 149.46153846153845, "num_input_tokens_seen": 7714168, "step": 1943, "train_accuracy": 0.013671875 }, { "epoch": 149.53846153846155, "grad_norm": 0.25076037645339966, "learning_rate": 0.01, "loss": 4.546579360961914, "num_input_tokens_seen": 7718264, "step": 1944, "train_runtime": 1579.0301, "train_tokens_per_second": 4887.978 }, { "epoch": 149.53846153846155, "num_input_tokens_seen": 7718264, "step": 1944, "train_accuracy": 0.009765625 }, { "epoch": 149.6153846153846, "grad_norm": 0.25393232703208923, "learning_rate": 0.01, "loss": 4.53092622756958, "num_input_tokens_seen": 7722360, "step": 1945, "train_runtime": 1579.8478, "train_tokens_per_second": 4888.041 }, { "epoch": 149.6153846153846, "num_input_tokens_seen": 7722360, "step": 1945, "train_accuracy": 0.013671875 }, { "epoch": 149.69230769230768, "grad_norm": 0.3227154314517975, "learning_rate": 0.01, "loss": 4.532125473022461, "num_input_tokens_seen": 7726456, "step": 1946, "train_runtime": 1580.6623, "train_tokens_per_second": 4888.113 }, { "epoch": 149.69230769230768, "num_input_tokens_seen": 7726456, "step": 1946, "train_accuracy": 0.0078125 }, { "epoch": 149.76923076923077, "grad_norm": 1.8587673902511597, "learning_rate": 0.01, "loss": 4.552395343780518, "num_input_tokens_seen": 7730552, "step": 1947, "train_runtime": 1581.4791, "train_tokens_per_second": 4888.178 }, { "epoch": 149.76923076923077, "num_input_tokens_seen": 7730552, "step": 1947, "train_accuracy": 0.009765625 }, { "epoch": 149.84615384615384, "grad_norm": 0.2996019124984741, "learning_rate": 0.01, "loss": 4.536066055297852, "num_input_tokens_seen": 7734648, "step": 1948, "train_runtime": 1582.296, "train_tokens_per_second": 4888.243 }, { "epoch": 149.84615384615384, "num_input_tokens_seen": 7734648, "step": 1948, "train_accuracy": 0.0078125 }, { "epoch": 149.92307692307693, "grad_norm": 0.2963835895061493, "learning_rate": 0.01, "loss": 4.584995269775391, "num_input_tokens_seen": 7738744, "step": 1949, "train_runtime": 1583.1078, "train_tokens_per_second": 4888.324 }, { "epoch": 149.92307692307693, "num_input_tokens_seen": 7738744, "step": 1949, "train_accuracy": 0.009771986864507198 }, { "epoch": 150.0, "grad_norm": 0.5054681897163391, "learning_rate": 0.01, "loss": 4.556207656860352, "num_input_tokens_seen": 7741200, "step": 1950, "train_runtime": 1583.6243, "train_tokens_per_second": 4888.281 }, { "epoch": 150.0, "num_input_tokens_seen": 7741200, "step": 1950, "train_accuracy": 0.009765625 }, { "epoch": 150.07692307692307, "grad_norm": 0.3328983783721924, "learning_rate": 0.01, "loss": 4.530587196350098, "num_input_tokens_seen": 7745296, "step": 1951, "train_runtime": 1584.454, "train_tokens_per_second": 4888.306 }, { "epoch": 150.07692307692307, "num_input_tokens_seen": 7745296, "step": 1951, "train_accuracy": 0.013671875 }, { "epoch": 150.15384615384616, "grad_norm": 0.38532009720802307, "learning_rate": 0.01, "loss": 4.567971706390381, "num_input_tokens_seen": 7749392, "step": 1952, "train_runtime": 1585.2715, "train_tokens_per_second": 4888.369 }, { "epoch": 150.15384615384616, "num_input_tokens_seen": 7749392, "step": 1952, "train_accuracy": 0.009765625 }, { "epoch": 150.23076923076923, "grad_norm": 0.427386611700058, "learning_rate": 0.01, "loss": 4.555583953857422, "num_input_tokens_seen": 7753488, "step": 1953, "train_runtime": 1586.087, "train_tokens_per_second": 4888.438 }, { "epoch": 150.23076923076923, "num_input_tokens_seen": 7753488, "step": 1953, "train_accuracy": 0.01171875 }, { "epoch": 150.30769230769232, "grad_norm": 0.28484898805618286, "learning_rate": 0.01, "loss": 4.55283260345459, "num_input_tokens_seen": 7757584, "step": 1954, "train_runtime": 1586.9021, "train_tokens_per_second": 4888.508 }, { "epoch": 150.30769230769232, "num_input_tokens_seen": 7757584, "step": 1954, "train_accuracy": 0.0234375 }, { "epoch": 150.3846153846154, "grad_norm": 0.27168798446655273, "learning_rate": 0.01, "loss": 4.511292457580566, "num_input_tokens_seen": 7761680, "step": 1955, "train_runtime": 1587.7182, "train_tokens_per_second": 4888.575 }, { "epoch": 150.3846153846154, "num_input_tokens_seen": 7761680, "step": 1955, "train_accuracy": 0.015625 }, { "epoch": 150.46153846153845, "grad_norm": 0.275595486164093, "learning_rate": 0.01, "loss": 4.548511505126953, "num_input_tokens_seen": 7765776, "step": 1956, "train_runtime": 1588.5354, "train_tokens_per_second": 4888.639 }, { "epoch": 150.46153846153845, "num_input_tokens_seen": 7765776, "step": 1956, "train_accuracy": 0.009765625 }, { "epoch": 150.53846153846155, "grad_norm": 0.4258243441581726, "learning_rate": 0.01, "loss": 4.549992084503174, "num_input_tokens_seen": 7769872, "step": 1957, "train_runtime": 1589.3506, "train_tokens_per_second": 4888.709 }, { "epoch": 150.53846153846155, "num_input_tokens_seen": 7769872, "step": 1957, "train_accuracy": 0.009765625 }, { "epoch": 150.6153846153846, "grad_norm": 0.3259783089160919, "learning_rate": 0.01, "loss": 4.542173385620117, "num_input_tokens_seen": 7773968, "step": 1958, "train_runtime": 1590.1668, "train_tokens_per_second": 4888.775 }, { "epoch": 150.6153846153846, "num_input_tokens_seen": 7773968, "step": 1958, "train_accuracy": 0.01171875 }, { "epoch": 150.69230769230768, "grad_norm": 1.607349157333374, "learning_rate": 0.01, "loss": 4.520785331726074, "num_input_tokens_seen": 7778064, "step": 1959, "train_runtime": 1590.9819, "train_tokens_per_second": 4888.845 }, { "epoch": 150.69230769230768, "num_input_tokens_seen": 7778064, "step": 1959, "train_accuracy": 0.015625 }, { "epoch": 150.76923076923077, "grad_norm": 0.285757839679718, "learning_rate": 0.01, "loss": 4.542995452880859, "num_input_tokens_seen": 7782160, "step": 1960, "train_runtime": 1591.7968, "train_tokens_per_second": 4888.915 }, { "epoch": 150.76923076923077, "num_input_tokens_seen": 7782160, "step": 1960, "train_accuracy": 0.013671875 }, { "epoch": 150.84615384615384, "grad_norm": 0.7893608808517456, "learning_rate": 0.01, "loss": 4.516138076782227, "num_input_tokens_seen": 7786256, "step": 1961, "train_runtime": 1592.6111, "train_tokens_per_second": 4888.988 }, { "epoch": 150.84615384615384, "num_input_tokens_seen": 7786256, "step": 1961, "train_accuracy": 0.013671875 }, { "epoch": 150.92307692307693, "grad_norm": 0.37208184599876404, "learning_rate": 0.01, "loss": 4.5633158683776855, "num_input_tokens_seen": 7790352, "step": 1962, "train_runtime": 1593.4234, "train_tokens_per_second": 4889.066 }, { "epoch": 150.92307692307693, "num_input_tokens_seen": 7790352, "step": 1962, "train_accuracy": 0.016286645084619522 }, { "epoch": 151.0, "grad_norm": 0.6915590167045593, "learning_rate": 0.01, "loss": 4.537909984588623, "num_input_tokens_seen": 7792808, "step": 1963, "train_runtime": 1593.9393, "train_tokens_per_second": 4889.024 }, { "epoch": 151.0, "num_input_tokens_seen": 7792808, "step": 1963, "train_accuracy": 0.009765625 }, { "epoch": 151.07692307692307, "grad_norm": 2.010768175125122, "learning_rate": 0.01, "loss": 4.547728538513184, "num_input_tokens_seen": 7796904, "step": 1964, "train_runtime": 1594.7667, "train_tokens_per_second": 4889.056 }, { "epoch": 151.07692307692307, "num_input_tokens_seen": 7796904, "step": 1964, "train_accuracy": 0.013671875 }, { "epoch": 151.15384615384616, "grad_norm": 0.3066599667072296, "learning_rate": 0.01, "loss": 4.548813819885254, "num_input_tokens_seen": 7801000, "step": 1965, "train_runtime": 1595.5812, "train_tokens_per_second": 4889.128 }, { "epoch": 151.15384615384616, "num_input_tokens_seen": 7801000, "step": 1965, "train_accuracy": 0.0078125 }, { "epoch": 151.23076923076923, "grad_norm": 0.2867196798324585, "learning_rate": 0.01, "loss": 4.550006866455078, "num_input_tokens_seen": 7805096, "step": 1966, "train_runtime": 1596.3964, "train_tokens_per_second": 4889.197 }, { "epoch": 151.23076923076923, "num_input_tokens_seen": 7805096, "step": 1966, "train_accuracy": 0.015625 }, { "epoch": 151.30769230769232, "grad_norm": 0.27043581008911133, "learning_rate": 0.01, "loss": 4.536755561828613, "num_input_tokens_seen": 7809192, "step": 1967, "train_runtime": 1597.2101, "train_tokens_per_second": 4889.27 }, { "epoch": 151.30769230769232, "num_input_tokens_seen": 7809192, "step": 1967, "train_accuracy": 0.015625 }, { "epoch": 151.3846153846154, "grad_norm": 0.2750074863433838, "learning_rate": 0.01, "loss": 4.558106422424316, "num_input_tokens_seen": 7813288, "step": 1968, "train_runtime": 1598.0251, "train_tokens_per_second": 4889.34 }, { "epoch": 151.3846153846154, "num_input_tokens_seen": 7813288, "step": 1968, "train_accuracy": 0.013671875 }, { "epoch": 151.46153846153845, "grad_norm": 0.3051276206970215, "learning_rate": 0.01, "loss": 4.566568374633789, "num_input_tokens_seen": 7817384, "step": 1969, "train_runtime": 1598.8393, "train_tokens_per_second": 4889.412 }, { "epoch": 151.46153846153845, "num_input_tokens_seen": 7817384, "step": 1969, "train_accuracy": 0.00390625 }, { "epoch": 151.53846153846155, "grad_norm": 0.26743951439857483, "learning_rate": 0.01, "loss": 4.548969745635986, "num_input_tokens_seen": 7821480, "step": 1970, "train_runtime": 1599.6544, "train_tokens_per_second": 4889.481 }, { "epoch": 151.53846153846155, "num_input_tokens_seen": 7821480, "step": 1970, "train_accuracy": 0.013671875 }, { "epoch": 151.6153846153846, "grad_norm": 0.3997062146663666, "learning_rate": 0.01, "loss": 4.54901123046875, "num_input_tokens_seen": 7825576, "step": 1971, "train_runtime": 1600.4709, "train_tokens_per_second": 4889.546 }, { "epoch": 151.6153846153846, "num_input_tokens_seen": 7825576, "step": 1971, "train_accuracy": 0.015625 }, { "epoch": 151.69230769230768, "grad_norm": 1.5198040008544922, "learning_rate": 0.01, "loss": 4.561570167541504, "num_input_tokens_seen": 7829672, "step": 1972, "train_runtime": 1601.2849, "train_tokens_per_second": 4889.618 }, { "epoch": 151.69230769230768, "num_input_tokens_seen": 7829672, "step": 1972, "train_accuracy": 0.0078125 }, { "epoch": 151.76923076923077, "grad_norm": 0.2400762289762497, "learning_rate": 0.01, "loss": 4.562237739562988, "num_input_tokens_seen": 7833768, "step": 1973, "train_runtime": 1602.0994, "train_tokens_per_second": 4889.689 }, { "epoch": 151.76923076923077, "num_input_tokens_seen": 7833768, "step": 1973, "train_accuracy": 0.013671875 }, { "epoch": 151.84615384615384, "grad_norm": 0.38551050424575806, "learning_rate": 0.01, "loss": 4.566306114196777, "num_input_tokens_seen": 7837864, "step": 1974, "train_runtime": 1602.9143, "train_tokens_per_second": 4889.759 }, { "epoch": 151.84615384615384, "num_input_tokens_seen": 7837864, "step": 1974, "train_accuracy": 0.017578125 }, { "epoch": 151.92307692307693, "grad_norm": 0.2782340347766876, "learning_rate": 0.01, "loss": 4.544930458068848, "num_input_tokens_seen": 7841960, "step": 1975, "train_runtime": 1603.7244, "train_tokens_per_second": 4889.843 }, { "epoch": 151.92307692307693, "num_input_tokens_seen": 7841960, "step": 1975, "train_accuracy": 0.016286645084619522 }, { "epoch": 152.0, "grad_norm": 0.3305472433567047, "learning_rate": 0.01, "loss": 4.587853908538818, "num_input_tokens_seen": 7844416, "step": 1976, "train_runtime": 1604.2395, "train_tokens_per_second": 4889.804 }, { "epoch": 152.0, "num_input_tokens_seen": 7844416, "step": 1976, "train_accuracy": 0.013671875 }, { "epoch": 152.07692307692307, "grad_norm": 0.5381389856338501, "learning_rate": 0.01, "loss": 4.540996551513672, "num_input_tokens_seen": 7848512, "step": 1977, "train_runtime": 1605.0668, "train_tokens_per_second": 4889.835 }, { "epoch": 152.07692307692307, "num_input_tokens_seen": 7848512, "step": 1977, "train_accuracy": 0.021484375 }, { "epoch": 152.15384615384616, "grad_norm": 0.2174607664346695, "learning_rate": 0.01, "loss": 4.534534931182861, "num_input_tokens_seen": 7852608, "step": 1978, "train_runtime": 1605.8822, "train_tokens_per_second": 4889.903 }, { "epoch": 152.15384615384616, "num_input_tokens_seen": 7852608, "step": 1978, "train_accuracy": 0.017578125 }, { "epoch": 152.23076923076923, "grad_norm": 0.26913097500801086, "learning_rate": 0.01, "loss": 4.543195724487305, "num_input_tokens_seen": 7856704, "step": 1979, "train_runtime": 1606.6973, "train_tokens_per_second": 4889.971 }, { "epoch": 152.23076923076923, "num_input_tokens_seen": 7856704, "step": 1979, "train_accuracy": 0.00390625 }, { "epoch": 152.30769230769232, "grad_norm": 0.28455042839050293, "learning_rate": 0.01, "loss": 4.569001197814941, "num_input_tokens_seen": 7860800, "step": 1980, "train_runtime": 1607.5115, "train_tokens_per_second": 4890.043 }, { "epoch": 152.30769230769232, "num_input_tokens_seen": 7860800, "step": 1980, "train_accuracy": 0.015625 }, { "epoch": 152.3846153846154, "grad_norm": 0.37407955527305603, "learning_rate": 0.01, "loss": 4.567748069763184, "num_input_tokens_seen": 7864896, "step": 1981, "train_runtime": 1608.326, "train_tokens_per_second": 4890.113 }, { "epoch": 152.3846153846154, "num_input_tokens_seen": 7864896, "step": 1981, "train_accuracy": 0.0078125 }, { "epoch": 152.46153846153845, "grad_norm": 0.40064266324043274, "learning_rate": 0.01, "loss": 4.55222225189209, "num_input_tokens_seen": 7868992, "step": 1982, "train_runtime": 1609.1415, "train_tokens_per_second": 4890.18 }, { "epoch": 152.46153846153845, "num_input_tokens_seen": 7868992, "step": 1982, "train_accuracy": 0.009765625 }, { "epoch": 152.53846153846155, "grad_norm": 0.25044623017311096, "learning_rate": 0.01, "loss": 4.574286460876465, "num_input_tokens_seen": 7873088, "step": 1983, "train_runtime": 1609.9555, "train_tokens_per_second": 4890.252 }, { "epoch": 152.53846153846155, "num_input_tokens_seen": 7873088, "step": 1983, "train_accuracy": 0.009765625 }, { "epoch": 152.6153846153846, "grad_norm": 0.2382778376340866, "learning_rate": 0.01, "loss": 4.558467864990234, "num_input_tokens_seen": 7877184, "step": 1984, "train_runtime": 1610.7705, "train_tokens_per_second": 4890.32 }, { "epoch": 152.6153846153846, "num_input_tokens_seen": 7877184, "step": 1984, "train_accuracy": 0.0078125 }, { "epoch": 152.69230769230768, "grad_norm": 0.2806725800037384, "learning_rate": 0.01, "loss": 4.548799514770508, "num_input_tokens_seen": 7881280, "step": 1985, "train_runtime": 1611.5854, "train_tokens_per_second": 4890.389 }, { "epoch": 152.69230769230768, "num_input_tokens_seen": 7881280, "step": 1985, "train_accuracy": 0.015625 }, { "epoch": 152.76923076923077, "grad_norm": 0.24032214283943176, "learning_rate": 0.01, "loss": 4.5399017333984375, "num_input_tokens_seen": 7885376, "step": 1986, "train_runtime": 1612.3997, "train_tokens_per_second": 4890.46 }, { "epoch": 152.76923076923077, "num_input_tokens_seen": 7885376, "step": 1986, "train_accuracy": 0.00390625 }, { "epoch": 152.84615384615384, "grad_norm": 0.2893168032169342, "learning_rate": 0.01, "loss": 4.548337936401367, "num_input_tokens_seen": 7889472, "step": 1987, "train_runtime": 1613.2143, "train_tokens_per_second": 4890.529 }, { "epoch": 152.84615384615384, "num_input_tokens_seen": 7889472, "step": 1987, "train_accuracy": 0.00390625 }, { "epoch": 152.92307692307693, "grad_norm": 0.34196656942367554, "learning_rate": 0.01, "loss": 4.555220127105713, "num_input_tokens_seen": 7893568, "step": 1988, "train_runtime": 1614.0252, "train_tokens_per_second": 4890.61 }, { "epoch": 152.92307692307693, "num_input_tokens_seen": 7893568, "step": 1988, "train_accuracy": 0.0065146577544510365 }, { "epoch": 153.0, "grad_norm": 0.3127935826778412, "learning_rate": 0.01, "loss": 4.5469441413879395, "num_input_tokens_seen": 7896024, "step": 1989, "train_runtime": 1614.5406, "train_tokens_per_second": 4890.57 }, { "epoch": 153.0, "num_input_tokens_seen": 7896024, "step": 1989, "train_accuracy": 0.025390625 }, { "epoch": 153.07692307692307, "grad_norm": 0.2148197442293167, "learning_rate": 0.01, "loss": 4.529175758361816, "num_input_tokens_seen": 7900120, "step": 1990, "train_runtime": 1615.369, "train_tokens_per_second": 4890.598 }, { "epoch": 153.07692307692307, "num_input_tokens_seen": 7900120, "step": 1990, "train_accuracy": 0.013671875 }, { "epoch": 153.15384615384616, "grad_norm": 0.2560349702835083, "learning_rate": 0.01, "loss": 4.532726287841797, "num_input_tokens_seen": 7904216, "step": 1991, "train_runtime": 1616.1844, "train_tokens_per_second": 4890.665 }, { "epoch": 153.15384615384616, "num_input_tokens_seen": 7904216, "step": 1991, "train_accuracy": 0.01171875 }, { "epoch": 153.23076923076923, "grad_norm": 0.19809867441654205, "learning_rate": 0.01, "loss": 4.539192199707031, "num_input_tokens_seen": 7908312, "step": 1992, "train_runtime": 1616.9998, "train_tokens_per_second": 4890.732 }, { "epoch": 153.23076923076923, "num_input_tokens_seen": 7908312, "step": 1992, "train_accuracy": 0.013671875 }, { "epoch": 153.30769230769232, "grad_norm": 0.29816627502441406, "learning_rate": 0.01, "loss": 4.561485767364502, "num_input_tokens_seen": 7912408, "step": 1993, "train_runtime": 1617.8159, "train_tokens_per_second": 4890.796 }, { "epoch": 153.30769230769232, "num_input_tokens_seen": 7912408, "step": 1993, "train_accuracy": 0.0078125 }, { "epoch": 153.3846153846154, "grad_norm": 0.26226750016212463, "learning_rate": 0.01, "loss": 4.529763221740723, "num_input_tokens_seen": 7916504, "step": 1994, "train_runtime": 1618.6308, "train_tokens_per_second": 4890.864 }, { "epoch": 153.3846153846154, "num_input_tokens_seen": 7916504, "step": 1994, "train_accuracy": 0.009765625 }, { "epoch": 153.46153846153845, "grad_norm": 0.25887763500213623, "learning_rate": 0.01, "loss": 4.545772552490234, "num_input_tokens_seen": 7920600, "step": 1995, "train_runtime": 1619.4517, "train_tokens_per_second": 4890.915 }, { "epoch": 153.46153846153845, "num_input_tokens_seen": 7920600, "step": 1995, "train_accuracy": 0.01171875 }, { "epoch": 153.53846153846155, "grad_norm": 0.24705550074577332, "learning_rate": 0.01, "loss": 4.547776699066162, "num_input_tokens_seen": 7924696, "step": 1996, "train_runtime": 1620.2668, "train_tokens_per_second": 4890.982 }, { "epoch": 153.53846153846155, "num_input_tokens_seen": 7924696, "step": 1996, "train_accuracy": 0.017578125 }, { "epoch": 153.6153846153846, "grad_norm": 0.29341304302215576, "learning_rate": 0.01, "loss": 4.559391021728516, "num_input_tokens_seen": 7928792, "step": 1997, "train_runtime": 1621.083, "train_tokens_per_second": 4891.046 }, { "epoch": 153.6153846153846, "num_input_tokens_seen": 7928792, "step": 1997, "train_accuracy": 0.01171875 }, { "epoch": 153.69230769230768, "grad_norm": 0.276309609413147, "learning_rate": 0.01, "loss": 4.530332565307617, "num_input_tokens_seen": 7932888, "step": 1998, "train_runtime": 1621.8971, "train_tokens_per_second": 4891.117 }, { "epoch": 153.69230769230768, "num_input_tokens_seen": 7932888, "step": 1998, "train_accuracy": 0.0078125 }, { "epoch": 153.76923076923077, "grad_norm": 0.20727954804897308, "learning_rate": 0.01, "loss": 4.541828155517578, "num_input_tokens_seen": 7936984, "step": 1999, "train_runtime": 1622.7117, "train_tokens_per_second": 4891.186 }, { "epoch": 153.76923076923077, "num_input_tokens_seen": 7936984, "step": 1999, "train_accuracy": 0.015625 }, { "epoch": 153.84615384615384, "grad_norm": 0.2459501475095749, "learning_rate": 0.01, "loss": 4.527507781982422, "num_input_tokens_seen": 7941080, "step": 2000, "train_runtime": 1623.527, "train_tokens_per_second": 4891.252 }, { "epoch": 153.84615384615384, "eval_CMD_3_branch_eval_accuracy": 0.011211573236889693, "eval_CMD_3_branch_eval_loss": 4.569759368896484, "eval_CMD_3_branch_eval_runtime": 1.1547, "eval_CMD_3_branch_eval_samples_per_second": 2394.655, "eval_CMD_3_branch_eval_steps_per_second": 5.196, "num_input_tokens_seen": 7941080, "step": 2000 } ], "logging_steps": 1, "max_steps": 1300000000, "num_input_tokens_seen": 7941080, "num_train_epochs": 100000000, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4.636698676248576e+16, "train_batch_size": 512, "trial_name": null, "trial_params": null }