| {"loss": 0.55994308, "token_acc": 0.81876833, "grad_norm": 3.8709129, "learning_rate": 9e-08, "memory(GiB)": 49.34, "train_speed(iter/s)": 0.052629, "epoch": 0.0012945, "global_step/max_steps": "1/2316", "percentage": "0.04%", "elapsed_time": "10s", "remaining_time": "6h 56m 9s"} |
| {"loss": 0.57598734, "token_acc": 0.83481046, "grad_norm": 4.1645969, "learning_rate": 4.3e-07, "memory(GiB)": 53.11, "train_speed(iter/s)": 0.133884, "epoch": 0.00647249, "global_step/max_steps": "5/2316", "percentage": "0.22%", "elapsed_time": "29s", "remaining_time": "3h 44m 22s"} |
| {"loss": 0.53366785, "token_acc": 0.83257919, "grad_norm": 5.05690584, "learning_rate": 8.6e-07, "memory(GiB)": 53.11, "train_speed(iter/s)": 0.174693, "epoch": 0.01294498, "global_step/max_steps": "10/2316", "percentage": "0.43%", "elapsed_time": "49s", "remaining_time": "3h 8m 25s"} |
| {"loss": 0.51718788, "token_acc": 0.83897428, "grad_norm": 3.27864603, "learning_rate": 1.29e-06, "memory(GiB)": 53.11, "train_speed(iter/s)": 0.189679, "epoch": 0.01941748, "global_step/max_steps": "15/2316", "percentage": "0.65%", "elapsed_time": "1m 10s", "remaining_time": "3h 1m 10s"} |
| {"loss": 0.43119245, "token_acc": 0.85499789, "grad_norm": 2.57339534, "learning_rate": 1.72e-06, "memory(GiB)": 53.11, "train_speed(iter/s)": 0.199795, "epoch": 0.02588997, "global_step/max_steps": "20/2316", "percentage": "0.86%", "elapsed_time": "1m 31s", "remaining_time": "2h 55m 48s"} |
| {"loss": 0.37806678, "token_acc": 0.87345211, "grad_norm": 2.25942363, "learning_rate": 2.16e-06, "memory(GiB)": 53.11, "train_speed(iter/s)": 0.206297, "epoch": 0.03236246, "global_step/max_steps": "25/2316", "percentage": "1.08%", "elapsed_time": "1m 52s", "remaining_time": "2h 52m 32s"} |
| {"loss": 0.36746361, "token_acc": 0.87286498, "grad_norm": 2.09853438, "learning_rate": 2.59e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.208609, "epoch": 0.03883495, "global_step/max_steps": "30/2316", "percentage": "1.30%", "elapsed_time": "2m 15s", "remaining_time": "2h 52m 12s"} |
| {"loss": 0.35918381, "token_acc": 0.87347208, "grad_norm": 1.83218556, "learning_rate": 3.02e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.211384, "epoch": 0.04530744, "global_step/max_steps": "35/2316", "percentage": "1.51%", "elapsed_time": "2m 37s", "remaining_time": "2h 50m 55s"} |
| {"loss": 0.31155162, "token_acc": 0.89921397, "grad_norm": 1.67454611, "learning_rate": 3.45e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.214329, "epoch": 0.05177994, "global_step/max_steps": "40/2316", "percentage": "1.73%", "elapsed_time": "2m 58s", "remaining_time": "2h 49m 11s"} |
| {"loss": 0.28461545, "token_acc": 0.91191827, "grad_norm": 1.55359186, "learning_rate": 3.88e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.218575, "epoch": 0.05825243, "global_step/max_steps": "45/2316", "percentage": "1.94%", "elapsed_time": "3m 17s", "remaining_time": "2h 46m 15s"} |
| {"loss": 0.25164244, "token_acc": 0.9087658, "grad_norm": 1.6496265, "learning_rate": 4.31e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.22195, "epoch": 0.06472492, "global_step/max_steps": "50/2316", "percentage": "2.16%", "elapsed_time": "3m 37s", "remaining_time": "2h 43m 57s"} |
| {"loss": 0.26541057, "token_acc": 0.88597278, "grad_norm": 2.32244373, "learning_rate": 4.74e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.222751, "epoch": 0.07119741, "global_step/max_steps": "55/2316", "percentage": "2.37%", "elapsed_time": "3m 58s", "remaining_time": "2h 43m 32s"} |
| {"loss": 0.31407049, "token_acc": 0.89962434, "grad_norm": 1.61291072, "learning_rate": 5.17e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.221038, "epoch": 0.0776699, "global_step/max_steps": "60/2316", "percentage": "2.59%", "elapsed_time": "4m 23s", "remaining_time": "2h 44m 57s"} |
| {"loss": 0.27332029, "token_acc": 0.91707605, "grad_norm": 1.63121593, "learning_rate": 5.6e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.22247, "epoch": 0.08414239, "global_step/max_steps": "65/2316", "percentage": "2.81%", "elapsed_time": "4m 43s", "remaining_time": "2h 43m 53s"} |
| {"loss": 0.25296345, "token_acc": 0.90365308, "grad_norm": 1.83022454, "learning_rate": 6.03e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.224848, "epoch": 0.09061489, "global_step/max_steps": "70/2316", "percentage": "3.02%", "elapsed_time": "5m 3s", "remaining_time": "2h 42m 5s"} |
| {"loss": 0.2715539, "token_acc": 0.91063922, "grad_norm": 1.82339325, "learning_rate": 6.47e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.228013, "epoch": 0.09708738, "global_step/max_steps": "75/2316", "percentage": "3.24%", "elapsed_time": "5m 20s", "remaining_time": "2h 39m 42s"} |
| {"loss": 0.29560997, "token_acc": 0.88815877, "grad_norm": 1.89403693, "learning_rate": 6.9e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.22905, "epoch": 0.10355987, "global_step/max_steps": "80/2316", "percentage": "3.45%", "elapsed_time": "5m 41s", "remaining_time": "2h 38m 52s"} |
| {"loss": 0.30338883, "token_acc": 0.89297125, "grad_norm": 1.84501713, "learning_rate": 7.33e-06, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.228957, "epoch": 0.11003236, "global_step/max_steps": "85/2316", "percentage": "3.67%", "elapsed_time": "6m 3s", "remaining_time": "2h 38m 48s"} |
| {"loss": 0.26382592, "token_acc": 0.88783427, "grad_norm": 1.68254948, "learning_rate": 7.76e-06, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.228605, "epoch": 0.11650485, "global_step/max_steps": "90/2316", "percentage": "3.89%", "elapsed_time": "6m 25s", "remaining_time": "2h 38m 54s"} |
| {"loss": 0.27912974, "token_acc": 0.89557459, "grad_norm": 1.58723399, "learning_rate": 8.19e-06, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.229698, "epoch": 0.12297735, "global_step/max_steps": "95/2316", "percentage": "4.10%", "elapsed_time": "6m 45s", "remaining_time": "2h 37m 57s"} |
| {"loss": 0.26341858, "token_acc": 0.8982752, "grad_norm": 1.47320177, "learning_rate": 8.62e-06, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.230764, "epoch": 0.12944984, "global_step/max_steps": "100/2316", "percentage": "4.32%", "elapsed_time": "7m 5s", "remaining_time": "2h 37m 0s"} |
| {"loss": 0.29945352, "token_acc": 0.90026971, "grad_norm": 1.61751302, "learning_rate": 9.05e-06, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.231825, "epoch": 0.13592233, "global_step/max_steps": "105/2316", "percentage": "4.53%", "elapsed_time": "7m 24s", "remaining_time": "2h 36m 4s"} |
| {"loss": 0.29081869, "token_acc": 0.88404803, "grad_norm": 1.56120055, "learning_rate": 9.48e-06, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.231911, "epoch": 0.14239482, "global_step/max_steps": "110/2316", "percentage": "4.75%", "elapsed_time": "7m 46s", "remaining_time": "2h 35m 47s"} |
| {"loss": 0.28914781, "token_acc": 0.91069584, "grad_norm": 1.80025153, "learning_rate": 9.91e-06, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.232002, "epoch": 0.14886731, "global_step/max_steps": "115/2316", "percentage": "4.97%", "elapsed_time": "8m 7s", "remaining_time": "2h 35m 29s"} |
| {"loss": 0.30170317, "token_acc": 0.89247449, "grad_norm": 1.6814029, "learning_rate": 1e-05, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.231998, "epoch": 0.15533981, "global_step/max_steps": "120/2316", "percentage": "5.18%", "elapsed_time": "8m 29s", "remaining_time": "2h 35m 15s"} |
| {"loss": 0.33611746, "token_acc": 0.87096558, "grad_norm": 1.75129769, "learning_rate": 1e-05, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.232224, "epoch": 0.1618123, "global_step/max_steps": "125/2316", "percentage": "5.40%", "elapsed_time": "8m 50s", "remaining_time": "2h 34m 50s"} |
| {"loss": 0.27847095, "token_acc": 0.87725206, "grad_norm": 1.69937337, "learning_rate": 1e-05, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232968, "epoch": 0.16828479, "global_step/max_steps": "130/2316", "percentage": "5.61%", "elapsed_time": "9m 9s", "remaining_time": "2h 34m 5s"} |
| {"loss": 0.29213047, "token_acc": 0.89309594, "grad_norm": 1.25844556, "learning_rate": 1e-05, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232797, "epoch": 0.17475728, "global_step/max_steps": "135/2316", "percentage": "5.83%", "elapsed_time": "9m 31s", "remaining_time": "2h 33m 55s"} |
| {"loss": 0.28781126, "token_acc": 0.89162924, "grad_norm": 1.45016729, "learning_rate": 1e-05, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.233664, "epoch": 0.18122977, "global_step/max_steps": "140/2316", "percentage": "6.04%", "elapsed_time": "9m 50s", "remaining_time": "2h 33m 4s"} |
| {"loss": 0.30176616, "token_acc": 0.86401705, "grad_norm": 1.7447308, "learning_rate": 1e-05, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.234057, "epoch": 0.18770227, "global_step/max_steps": "145/2316", "percentage": "6.26%", "elapsed_time": "10m 11s", "remaining_time": "2h 32m 32s"} |
| {"loss": 0.29514494, "token_acc": 0.90829115, "grad_norm": 1.57819907, "learning_rate": 9.99e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.234734, "epoch": 0.19417476, "global_step/max_steps": "150/2316", "percentage": "6.48%", "elapsed_time": "10m 30s", "remaining_time": "2h 31m 48s"} |
| {"loss": 0.27290375, "token_acc": 0.91010066, "grad_norm": 1.52933377, "learning_rate": 9.99e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.23464, "epoch": 0.20064725, "global_step/max_steps": "155/2316", "percentage": "6.69%", "elapsed_time": "10m 52s", "remaining_time": "2h 31m 35s"} |
| {"loss": 0.26852996, "token_acc": 0.89605929, "grad_norm": 1.86314077, "learning_rate": 9.99e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.235317, "epoch": 0.20711974, "global_step/max_steps": "160/2316", "percentage": "6.91%", "elapsed_time": "11m 11s", "remaining_time": "2h 30m 51s"} |
| {"loss": 0.30762825, "token_acc": 0.91018019, "grad_norm": 1.54389727, "learning_rate": 9.99e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.234947, "epoch": 0.21359223, "global_step/max_steps": "165/2316", "percentage": "7.12%", "elapsed_time": "11m 34s", "remaining_time": "2h 30m 48s"} |
| {"loss": 0.28140585, "token_acc": 0.92493653, "grad_norm": 1.44917696, "learning_rate": 9.99e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.235827, "epoch": 0.22006472, "global_step/max_steps": "170/2316", "percentage": "7.34%", "elapsed_time": "11m 52s", "remaining_time": "2h 29m 56s"} |
| {"loss": 0.3198813, "token_acc": 0.88053639, "grad_norm": 1.34633788, "learning_rate": 9.98e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.235301, "epoch": 0.22653722, "global_step/max_steps": "175/2316", "percentage": "7.56%", "elapsed_time": "12m 15s", "remaining_time": "2h 29m 58s"} |
| {"loss": 0.29875154, "token_acc": 0.91754567, "grad_norm": 1.52491256, "learning_rate": 9.98e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.235286, "epoch": 0.23300971, "global_step/max_steps": "180/2316", "percentage": "7.77%", "elapsed_time": "12m 36s", "remaining_time": "2h 29m 40s"} |
| {"loss": 0.29140525, "token_acc": 0.90224405, "grad_norm": 1.49809167, "learning_rate": 9.98e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.234933, "epoch": 0.2394822, "global_step/max_steps": "185/2316", "percentage": "7.99%", "elapsed_time": "12m 59s", "remaining_time": "2h 29m 36s"} |
| {"loss": 0.26933846, "token_acc": 0.90105376, "grad_norm": 1.53163001, "learning_rate": 9.97e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.235065, "epoch": 0.24595469, "global_step/max_steps": "190/2316", "percentage": "8.20%", "elapsed_time": "13m 20s", "remaining_time": "2h 29m 12s"} |
| {"loss": 0.31088517, "token_acc": 0.88710672, "grad_norm": 1.24238415, "learning_rate": 9.97e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.234661, "epoch": 0.25242718, "global_step/max_steps": "195/2316", "percentage": "8.42%", "elapsed_time": "13m 42s", "remaining_time": "2h 29m 9s"} |
| {"loss": 0.27449756, "token_acc": 0.8796514, "grad_norm": 1.41268256, "learning_rate": 9.96e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.23488, "epoch": 0.25889968, "global_step/max_steps": "200/2316", "percentage": "8.64%", "elapsed_time": "14m 3s", "remaining_time": "2h 28m 41s"} |
| {"eval_loss": 0.2772547, "eval_token_acc": 0.89017467, "eval_runtime": 10.3443, "eval_samples_per_second": 5.994, "eval_steps_per_second": 1.547, "epoch": 0.25889968, "global_step/max_steps": "200/2316", "percentage": "8.64%", "elapsed_time": "14m 13s", "remaining_time": "2h 30m 31s"} |
| {"loss": 0.28078539, "token_acc": 0.89992874, "grad_norm": 1.63335906, "learning_rate": 9.96e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232257, "epoch": 0.26537217, "global_step/max_steps": "205/2316", "percentage": "8.85%", "elapsed_time": "14m 34s", "remaining_time": "2h 30m 4s"} |
| {"loss": 0.27331915, "token_acc": 0.89805367, "grad_norm": 1.4820925, "learning_rate": 9.96e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.23236, "epoch": 0.27184466, "global_step/max_steps": "210/2316", "percentage": "9.07%", "elapsed_time": "14m 55s", "remaining_time": "2h 29m 41s"} |
| {"loss": 0.31939635, "token_acc": 0.8720578, "grad_norm": 1.60013808, "learning_rate": 9.95e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232461, "epoch": 0.27831715, "global_step/max_steps": "215/2316", "percentage": "9.28%", "elapsed_time": "15m 16s", "remaining_time": "2h 29m 17s"} |
| {"loss": 0.26338606, "token_acc": 0.90083102, "grad_norm": 1.28522314, "learning_rate": 9.94e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232653, "epoch": 0.28478964, "global_step/max_steps": "220/2316", "percentage": "9.50%", "elapsed_time": "15m 37s", "remaining_time": "2h 28m 50s"} |
| {"loss": 0.27063227, "token_acc": 0.91425361, "grad_norm": 1.37911806, "learning_rate": 9.94e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232782, "epoch": 0.29126214, "global_step/max_steps": "225/2316", "percentage": "9.72%", "elapsed_time": "15m 58s", "remaining_time": "2h 28m 26s"} |
| {"loss": 0.28856478, "token_acc": 0.8967242, "grad_norm": 1.66175465, "learning_rate": 9.93e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232492, "epoch": 0.29773463, "global_step/max_steps": "230/2316", "percentage": "9.93%", "elapsed_time": "16m 21s", "remaining_time": "2h 28m 17s"} |
| {"loss": 0.27562988, "token_acc": 0.87996067, "grad_norm": 1.34372712, "learning_rate": 9.93e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232117, "epoch": 0.30420712, "global_step/max_steps": "235/2316", "percentage": "10.15%", "elapsed_time": "16m 44s", "remaining_time": "2h 28m 12s"} |
| {"loss": 0.26765175, "token_acc": 0.92357384, "grad_norm": 1.29898124, "learning_rate": 9.92e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.231934, "epoch": 0.31067961, "global_step/max_steps": "240/2316", "percentage": "10.36%", "elapsed_time": "17m 6s", "remaining_time": "2h 27m 59s"} |
| {"loss": 0.28638191, "token_acc": 0.90135754, "grad_norm": 1.44652842, "learning_rate": 9.92e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.23203, "epoch": 0.3171521, "global_step/max_steps": "245/2316", "percentage": "10.58%", "elapsed_time": "17m 27s", "remaining_time": "2h 27m 36s"} |
| {"loss": 0.26107254, "token_acc": 0.90419675, "grad_norm": 1.22716395, "learning_rate": 9.91e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232057, "epoch": 0.3236246, "global_step/max_steps": "250/2316", "percentage": "10.79%", "elapsed_time": "17m 49s", "remaining_time": "2h 27m 15s"} |
| {"loss": 0.27872639, "token_acc": 0.89976634, "grad_norm": 1.33664061, "learning_rate": 9.9e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232188, "epoch": 0.33009709, "global_step/max_steps": "255/2316", "percentage": "11.01%", "elapsed_time": "18m 10s", "remaining_time": "2h 26m 50s"} |
| {"loss": 0.25652719, "token_acc": 0.9212053, "grad_norm": 1.30365287, "learning_rate": 9.89e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232057, "epoch": 0.33656958, "global_step/max_steps": "260/2316", "percentage": "11.23%", "elapsed_time": "18m 32s", "remaining_time": "2h 26m 34s"} |
| {"loss": 0.27486787, "token_acc": 0.90494421, "grad_norm": 1.51396253, "learning_rate": 9.89e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232252, "epoch": 0.34304207, "global_step/max_steps": "265/2316", "percentage": "11.44%", "elapsed_time": "18m 52s", "remaining_time": "2h 26m 7s"} |
| {"loss": 0.2757062, "token_acc": 0.88770674, "grad_norm": 1.4878958, "learning_rate": 9.88e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232779, "epoch": 0.34951456, "global_step/max_steps": "270/2316", "percentage": "11.66%", "elapsed_time": "19m 11s", "remaining_time": "2h 25m 27s"} |
| {"loss": 0.2906261, "token_acc": 0.90582229, "grad_norm": 1.32229724, "learning_rate": 9.87e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232879, "epoch": 0.35598706, "global_step/max_steps": "275/2316", "percentage": "11.87%", "elapsed_time": "19m 32s", "remaining_time": "2h 25m 3s"} |
| {"loss": 0.25289137, "token_acc": 0.90188862, "grad_norm": 1.36676692, "learning_rate": 9.86e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.233138, "epoch": 0.36245955, "global_step/max_steps": "280/2316", "percentage": "12.09%", "elapsed_time": "19m 52s", "remaining_time": "2h 24m 33s"} |
| {"loss": 0.29717717, "token_acc": 0.9053704, "grad_norm": 1.28656431, "learning_rate": 9.86e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.233263, "epoch": 0.36893204, "global_step/max_steps": "285/2316", "percentage": "12.31%", "elapsed_time": "20m 13s", "remaining_time": "2h 24m 8s"} |
| {"loss": 0.28815408, "token_acc": 0.89783195, "grad_norm": 1.55389321, "learning_rate": 9.85e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232784, "epoch": 0.37540453, "global_step/max_steps": "290/2316", "percentage": "12.52%", "elapsed_time": "20m 37s", "remaining_time": "2h 24m 5s"} |
| {"loss": 0.29243944, "token_acc": 0.89363047, "grad_norm": 1.21052316, "learning_rate": 9.84e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.23252, "epoch": 0.38187702, "global_step/max_steps": "295/2316", "percentage": "12.74%", "elapsed_time": "21m 0s", "remaining_time": "2h 23m 55s"} |
| {"loss": 0.249862, "token_acc": 0.88317019, "grad_norm": 1.49073069, "learning_rate": 9.83e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232702, "epoch": 0.38834951, "global_step/max_steps": "300/2316", "percentage": "12.95%", "elapsed_time": "21m 20s", "remaining_time": "2h 23m 28s"} |
| {"loss": 0.24675424, "token_acc": 0.90816754, "grad_norm": 1.42566506, "learning_rate": 9.82e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232717, "epoch": 0.39482201, "global_step/max_steps": "305/2316", "percentage": "13.17%", "elapsed_time": "21m 42s", "remaining_time": "2h 23m 7s"} |
| {"loss": 0.24478939, "token_acc": 0.91117479, "grad_norm": 1.26051487, "learning_rate": 9.81e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.233036, "epoch": 0.4012945, "global_step/max_steps": "310/2316", "percentage": "13.39%", "elapsed_time": "22m 2s", "remaining_time": "2h 22m 34s"} |
| {"loss": 0.26903296, "token_acc": 0.89583003, "grad_norm": 1.25648958, "learning_rate": 9.8e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232977, "epoch": 0.40776699, "global_step/max_steps": "315/2316", "percentage": "13.60%", "elapsed_time": "22m 23s", "remaining_time": "2h 22m 16s"} |
| {"loss": 0.26741886, "token_acc": 0.89152737, "grad_norm": 1.23006845, "learning_rate": 9.79e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232759, "epoch": 0.41423948, "global_step/max_steps": "320/2316", "percentage": "13.82%", "elapsed_time": "22m 46s", "remaining_time": "2h 22m 4s"} |
| {"loss": 0.25241306, "token_acc": 0.91323424, "grad_norm": 1.12225877, "learning_rate": 9.78e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.233061, "epoch": 0.42071197, "global_step/max_steps": "325/2316", "percentage": "14.03%", "elapsed_time": "23m 6s", "remaining_time": "2h 21m 32s"} |
| {"loss": 0.2643873, "token_acc": 0.90970232, "grad_norm": 1.36093275, "learning_rate": 9.77e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.233038, "epoch": 0.42718447, "global_step/max_steps": "330/2316", "percentage": "14.25%", "elapsed_time": "23m 27s", "remaining_time": "2h 21m 12s"} |
| {"loss": 0.27757707, "token_acc": 0.89713532, "grad_norm": 1.40112425, "learning_rate": 9.76e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.233241, "epoch": 0.43365696, "global_step/max_steps": "335/2316", "percentage": "14.46%", "elapsed_time": "23m 48s", "remaining_time": "2h 20m 44s"} |
| {"loss": 0.24376159, "token_acc": 0.89507187, "grad_norm": 1.51374167, "learning_rate": 9.75e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.233146, "epoch": 0.44012945, "global_step/max_steps": "340/2316", "percentage": "14.68%", "elapsed_time": "24m 10s", "remaining_time": "2h 20m 27s"} |
| {"loss": 0.26277299, "token_acc": 0.90352923, "grad_norm": 1.47999514, "learning_rate": 9.74e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.233165, "epoch": 0.44660194, "global_step/max_steps": "345/2316", "percentage": "14.90%", "elapsed_time": "24m 31s", "remaining_time": "2h 20m 6s"} |
| {"loss": 0.25033398, "token_acc": 0.8914871, "grad_norm": 1.2671924, "learning_rate": 9.72e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.233204, "epoch": 0.45307443, "global_step/max_steps": "350/2316", "percentage": "15.11%", "elapsed_time": "24m 52s", "remaining_time": "2h 19m 44s"} |
| {"loss": 0.28876343, "token_acc": 0.88277995, "grad_norm": 1.43320044, "learning_rate": 9.71e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232949, "epoch": 0.45954693, "global_step/max_steps": "355/2316", "percentage": "15.33%", "elapsed_time": "25m 15s", "remaining_time": "2h 19m 32s"} |
| {"loss": 0.29701598, "token_acc": 0.86092058, "grad_norm": 1.11644997, "learning_rate": 9.7e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232653, "epoch": 0.46601942, "global_step/max_steps": "360/2316", "percentage": "15.54%", "elapsed_time": "25m 39s", "remaining_time": "2h 19m 22s"} |
| {"loss": 0.27694955, "token_acc": 0.88576549, "grad_norm": 1.34389411, "learning_rate": 9.69e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232896, "epoch": 0.47249191, "global_step/max_steps": "365/2316", "percentage": "15.76%", "elapsed_time": "25m 59s", "remaining_time": "2h 18m 53s"} |
| {"loss": 0.23632426, "token_acc": 0.91989283, "grad_norm": 1.33000872, "learning_rate": 9.67e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232997, "epoch": 0.4789644, "global_step/max_steps": "370/2316", "percentage": "15.98%", "elapsed_time": "26m 19s", "remaining_time": "2h 18m 28s"} |
| {"loss": 0.25744386, "token_acc": 0.89455929, "grad_norm": 1.32488024, "learning_rate": 9.66e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.23284, "epoch": 0.48543689, "global_step/max_steps": "375/2316", "percentage": "16.19%", "elapsed_time": "26m 42s", "remaining_time": "2h 18m 13s"} |
| {"loss": 0.26578906, "token_acc": 0.90649933, "grad_norm": 1.38224082, "learning_rate": 9.65e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232721, "epoch": 0.49190939, "global_step/max_steps": "380/2316", "percentage": "16.41%", "elapsed_time": "27m 4s", "remaining_time": "2h 17m 57s"} |
| {"loss": 0.24774408, "token_acc": 0.8979648, "grad_norm": 1.1919246, "learning_rate": 9.64e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232675, "epoch": 0.49838188, "global_step/max_steps": "385/2316", "percentage": "16.62%", "elapsed_time": "27m 26s", "remaining_time": "2h 17m 37s"} |
| {"loss": 0.2514677, "token_acc": 0.90425532, "grad_norm": 1.26101574, "learning_rate": 9.62e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232724, "epoch": 0.50485437, "global_step/max_steps": "390/2316", "percentage": "16.84%", "elapsed_time": "27m 47s", "remaining_time": "2h 17m 15s"} |
| {"loss": 0.26253493, "token_acc": 0.88643533, "grad_norm": 1.31844807, "learning_rate": 9.61e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232872, "epoch": 0.51132686, "global_step/max_steps": "395/2316", "percentage": "17.06%", "elapsed_time": "28m 7s", "remaining_time": "2h 16m 49s"} |
| {"loss": 0.25187716, "token_acc": 0.90221334, "grad_norm": 1.24915421, "learning_rate": 9.59e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.233366, "epoch": 0.51779935, "global_step/max_steps": "400/2316", "percentage": "17.27%", "elapsed_time": "28m 25s", "remaining_time": "2h 16m 10s"} |
| {"eval_loss": 0.26467851, "eval_token_acc": 0.89566896, "eval_runtime": 10.6017, "eval_samples_per_second": 5.848, "eval_steps_per_second": 1.509, "epoch": 0.51779935, "global_step/max_steps": "400/2316", "percentage": "17.27%", "elapsed_time": "28m 36s", "remaining_time": "2h 17m 1s"} |
| {"loss": 0.29769235, "token_acc": 0.89985169, "grad_norm": 1.37245406, "learning_rate": 9.58e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231481, "epoch": 0.52427184, "global_step/max_steps": "405/2316", "percentage": "17.49%", "elapsed_time": "29m 1s", "remaining_time": "2h 16m 56s"} |
| {"loss": 0.26252964, "token_acc": 0.90914695, "grad_norm": 1.17604884, "learning_rate": 9.57e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231702, "epoch": 0.53074434, "global_step/max_steps": "410/2316", "percentage": "17.70%", "elapsed_time": "29m 21s", "remaining_time": "2h 16m 27s"} |
| {"loss": 0.30316572, "token_acc": 0.88258941, "grad_norm": 1.22938785, "learning_rate": 9.55e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231606, "epoch": 0.53721683, "global_step/max_steps": "415/2316", "percentage": "17.92%", "elapsed_time": "29m 43s", "remaining_time": "2h 16m 10s"} |
| {"loss": 0.23727922, "token_acc": 0.90501395, "grad_norm": 1.17479283, "learning_rate": 9.54e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231719, "epoch": 0.54368932, "global_step/max_steps": "420/2316", "percentage": "18.13%", "elapsed_time": "30m 4s", "remaining_time": "2h 15m 45s"} |
| {"loss": 0.27974436, "token_acc": 0.90939428, "grad_norm": 1.25588545, "learning_rate": 9.52e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232035, "epoch": 0.55016181, "global_step/max_steps": "425/2316", "percentage": "18.35%", "elapsed_time": "30m 23s", "remaining_time": "2h 15m 13s"} |
| {"loss": 0.24871361, "token_acc": 0.88628216, "grad_norm": 1.16916417, "learning_rate": 9.51e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232068, "epoch": 0.5566343, "global_step/max_steps": "430/2316", "percentage": "18.57%", "elapsed_time": "30m 44s", "remaining_time": "2h 14m 50s"} |
| {"loss": 0.3010299, "token_acc": 0.87728195, "grad_norm": 1.34265233, "learning_rate": 9.49e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231983, "epoch": 0.5631068, "global_step/max_steps": "435/2316", "percentage": "18.78%", "elapsed_time": "31m 6s", "remaining_time": "2h 14m 32s"} |
| {"loss": 0.22319808, "token_acc": 0.91370167, "grad_norm": 1.3016042, "learning_rate": 9.47e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231904, "epoch": 0.56957929, "global_step/max_steps": "440/2316", "percentage": "19.00%", "elapsed_time": "31m 29s", "remaining_time": "2h 14m 14s"} |
| {"loss": 0.26847644, "token_acc": 0.8966266, "grad_norm": 1.32506833, "learning_rate": 9.46e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231773, "epoch": 0.57605178, "global_step/max_steps": "445/2316", "percentage": "19.21%", "elapsed_time": "31m 51s", "remaining_time": "2h 13m 58s"} |
| {"loss": 0.26132059, "token_acc": 0.90012198, "grad_norm": 1.76542024, "learning_rate": 9.44e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231888, "epoch": 0.58252427, "global_step/max_steps": "450/2316", "percentage": "19.43%", "elapsed_time": "32m 12s", "remaining_time": "2h 13m 32s"} |
| {"loss": 0.21109428, "token_acc": 0.93593074, "grad_norm": 1.03639344, "learning_rate": 9.43e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231986, "epoch": 0.58899676, "global_step/max_steps": "455/2316", "percentage": "19.65%", "elapsed_time": "32m 33s", "remaining_time": "2h 13m 8s"} |
| {"loss": 0.30587316, "token_acc": 0.88938619, "grad_norm": 1.26552213, "learning_rate": 9.41e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.23216, "epoch": 0.59546926, "global_step/max_steps": "460/2316", "percentage": "19.86%", "elapsed_time": "32m 53s", "remaining_time": "2h 12m 41s"} |
| {"loss": 0.2870976, "token_acc": 0.88992747, "grad_norm": 1.26005981, "learning_rate": 9.39e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232118, "epoch": 0.60194175, "global_step/max_steps": "465/2316", "percentage": "20.08%", "elapsed_time": "33m 15s", "remaining_time": "2h 12m 21s"} |
| {"loss": 0.23429494, "token_acc": 0.90918842, "grad_norm": 1.16677394, "learning_rate": 9.37e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232319, "epoch": 0.60841424, "global_step/max_steps": "470/2316", "percentage": "20.29%", "elapsed_time": "33m 34s", "remaining_time": "2h 11m 53s"} |
| {"loss": 0.27404904, "token_acc": 0.89931693, "grad_norm": 1.51228458, "learning_rate": 9.36e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232384, "epoch": 0.61488673, "global_step/max_steps": "475/2316", "percentage": "20.51%", "elapsed_time": "33m 55s", "remaining_time": "2h 11m 30s"} |
| {"loss": 0.27533658, "token_acc": 0.88807983, "grad_norm": 1.20889125, "learning_rate": 9.34e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232403, "epoch": 0.62135922, "global_step/max_steps": "480/2316", "percentage": "20.73%", "elapsed_time": "34m 17s", "remaining_time": "2h 11m 8s"} |
| {"loss": 0.24256644, "token_acc": 0.9005807, "grad_norm": 1.31483466, "learning_rate": 9.32e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232507, "epoch": 0.62783172, "global_step/max_steps": "485/2316", "percentage": "20.94%", "elapsed_time": "34m 37s", "remaining_time": "2h 10m 44s"} |
| {"loss": 0.26380749, "token_acc": 0.89883328, "grad_norm": 1.22782176, "learning_rate": 9.3e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232519, "epoch": 0.63430421, "global_step/max_steps": "490/2316", "percentage": "21.16%", "elapsed_time": "34m 59s", "remaining_time": "2h 10m 22s"} |
| {"loss": 0.25248773, "token_acc": 0.89002778, "grad_norm": 1.2818838, "learning_rate": 9.29e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232881, "epoch": 0.6407767, "global_step/max_steps": "495/2316", "percentage": "21.37%", "elapsed_time": "35m 17s", "remaining_time": "2h 9m 49s"} |
| {"loss": 0.25669923, "token_acc": 0.9067371, "grad_norm": 1.15767285, "learning_rate": 9.27e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232861, "epoch": 0.64724919, "global_step/max_steps": "500/2316", "percentage": "21.59%", "elapsed_time": "35m 38s", "remaining_time": "2h 9m 28s"} |
| {"loss": 0.27313867, "token_acc": 0.90593697, "grad_norm": 1.44846388, "learning_rate": 9.25e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.233046, "epoch": 0.65372168, "global_step/max_steps": "505/2316", "percentage": "21.80%", "elapsed_time": "35m 58s", "remaining_time": "2h 9m 1s"} |
| {"loss": 0.26606019, "token_acc": 0.89968826, "grad_norm": 1.21673379, "learning_rate": 9.23e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232906, "epoch": 0.66019417, "global_step/max_steps": "510/2316", "percentage": "22.02%", "elapsed_time": "36m 21s", "remaining_time": "2h 8m 45s"} |
| {"loss": 0.27887456, "token_acc": 0.90318837, "grad_norm": 1.23934156, "learning_rate": 9.21e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232953, "epoch": 0.66666667, "global_step/max_steps": "515/2316", "percentage": "22.24%", "elapsed_time": "36m 42s", "remaining_time": "2h 8m 22s"} |
| {"loss": 0.27913296, "token_acc": 0.89300174, "grad_norm": 1.14492448, "learning_rate": 9.19e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.233085, "epoch": 0.67313916, "global_step/max_steps": "520/2316", "percentage": "22.45%", "elapsed_time": "37m 2s", "remaining_time": "2h 7m 56s"} |
| {"loss": 0.24025269, "token_acc": 0.8949115, "grad_norm": 1.45885025, "learning_rate": 9.17e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232972, "epoch": 0.67961165, "global_step/max_steps": "525/2316", "percentage": "22.67%", "elapsed_time": "37m 25s", "remaining_time": "2h 7m 39s"} |
| {"loss": 0.25027494, "token_acc": 0.92216838, "grad_norm": 1.11386319, "learning_rate": 9.15e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232859, "epoch": 0.68608414, "global_step/max_steps": "530/2316", "percentage": "22.88%", "elapsed_time": "37m 47s", "remaining_time": "2h 7m 22s"} |
| {"loss": 0.26178768, "token_acc": 0.89105494, "grad_norm": 1.29743202, "learning_rate": 9.13e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.233065, "epoch": 0.69255663, "global_step/max_steps": "535/2316", "percentage": "23.10%", "elapsed_time": "38m 7s", "remaining_time": "2h 6m 54s"} |
| {"loss": 0.24454012, "token_acc": 0.91778149, "grad_norm": 1.17590181, "learning_rate": 9.11e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.23299, "epoch": 0.69902913, "global_step/max_steps": "540/2316", "percentage": "23.32%", "elapsed_time": "38m 29s", "remaining_time": "2h 6m 35s"} |
| {"loss": 0.25968049, "token_acc": 0.9127299, "grad_norm": 1.12868637, "learning_rate": 9.09e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232722, "epoch": 0.70550162, "global_step/max_steps": "545/2316", "percentage": "23.53%", "elapsed_time": "38m 53s", "remaining_time": "2h 6m 23s"} |
| {"loss": 0.2745899, "token_acc": 0.90108893, "grad_norm": 1.21841042, "learning_rate": 9.07e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.23284, "epoch": 0.71197411, "global_step/max_steps": "550/2316", "percentage": "23.75%", "elapsed_time": "39m 13s", "remaining_time": "2h 5m 58s"} |
| {"loss": 0.24724989, "token_acc": 0.89628751, "grad_norm": 1.16892058, "learning_rate": 9.05e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.23287, "epoch": 0.7184466, "global_step/max_steps": "555/2316", "percentage": "23.96%", "elapsed_time": "39m 35s", "remaining_time": "2h 5m 36s"} |
| {"loss": 0.26168504, "token_acc": 0.90987386, "grad_norm": 1.22756274, "learning_rate": 9.03e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232862, "epoch": 0.72491909, "global_step/max_steps": "560/2316", "percentage": "24.18%", "elapsed_time": "39m 56s", "remaining_time": "2h 5m 15s"} |
| {"loss": 0.25820611, "token_acc": 0.90252568, "grad_norm": 1.2171766, "learning_rate": 9.01e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232978, "epoch": 0.73139159, "global_step/max_steps": "565/2316", "percentage": "24.40%", "elapsed_time": "40m 16s", "remaining_time": "2h 4m 50s"} |
| {"loss": 0.25631933, "token_acc": 0.89856649, "grad_norm": 1.19198688, "learning_rate": 8.99e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.233014, "epoch": 0.73786408, "global_step/max_steps": "570/2316", "percentage": "24.61%", "elapsed_time": "40m 37s", "remaining_time": "2h 4m 27s"} |
| {"loss": 0.29077477, "token_acc": 0.89177828, "grad_norm": 1.45806062, "learning_rate": 8.96e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232708, "epoch": 0.74433657, "global_step/max_steps": "575/2316", "percentage": "24.83%", "elapsed_time": "41m 2s", "remaining_time": "2h 4m 16s"} |
| {"loss": 0.24793003, "token_acc": 0.88312614, "grad_norm": 1.25433138, "learning_rate": 8.94e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232797, "epoch": 0.75080906, "global_step/max_steps": "580/2316", "percentage": "25.04%", "elapsed_time": "41m 23s", "remaining_time": "2h 3m 52s"} |
| {"loss": 0.23632793, "token_acc": 0.89432485, "grad_norm": 1.12767617, "learning_rate": 8.92e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232902, "epoch": 0.75728155, "global_step/max_steps": "585/2316", "percentage": "25.26%", "elapsed_time": "41m 43s", "remaining_time": "2h 3m 27s"} |
| {"loss": 0.22642453, "token_acc": 0.90514686, "grad_norm": 1.26347777, "learning_rate": 8.9e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.23298, "epoch": 0.76375405, "global_step/max_steps": "590/2316", "percentage": "25.47%", "elapsed_time": "42m 4s", "remaining_time": "2h 3m 4s"} |
| {"loss": 0.24426589, "token_acc": 0.89524615, "grad_norm": 1.2522438, "learning_rate": 8.88e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.233038, "epoch": 0.77022654, "global_step/max_steps": "595/2316", "percentage": "25.69%", "elapsed_time": "42m 25s", "remaining_time": "2h 2m 41s"} |
| {"loss": 0.26595755, "token_acc": 0.8918477, "grad_norm": 1.3071289, "learning_rate": 8.85e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232998, "epoch": 0.77669903, "global_step/max_steps": "600/2316", "percentage": "25.91%", "elapsed_time": "42m 46s", "remaining_time": "2h 2m 21s"} |
| {"eval_loss": 0.24792229, "eval_token_acc": 0.89948768, "eval_runtime": 10.4072, "eval_samples_per_second": 5.957, "eval_steps_per_second": 1.537, "epoch": 0.77669903, "global_step/max_steps": "600/2316", "percentage": "25.91%", "elapsed_time": "42m 57s", "remaining_time": "2h 2m 51s"} |
| {"loss": 0.25225456, "token_acc": 0.91056725, "grad_norm": 1.19690526, "learning_rate": 8.83e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232037, "epoch": 0.78317152, "global_step/max_steps": "605/2316", "percentage": "26.12%", "elapsed_time": "43m 19s", "remaining_time": "2h 2m 30s"} |
| {"loss": 0.243383, "token_acc": 0.90179697, "grad_norm": 1.12713046, "learning_rate": 8.81e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.231985, "epoch": 0.78964401, "global_step/max_steps": "610/2316", "percentage": "26.34%", "elapsed_time": "43m 41s", "remaining_time": "2h 2m 10s"} |
| {"loss": 0.25238817, "token_acc": 0.88407265, "grad_norm": 1.14690146, "learning_rate": 8.78e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232051, "epoch": 0.7961165, "global_step/max_steps": "615/2316", "percentage": "26.55%", "elapsed_time": "44m 2s", "remaining_time": "2h 1m 47s"} |
| {"loss": 0.22257187, "token_acc": 0.91488896, "grad_norm": 1.40925581, "learning_rate": 8.76e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232305, "epoch": 0.802589, "global_step/max_steps": "620/2316", "percentage": "26.77%", "elapsed_time": "44m 20s", "remaining_time": "2h 1m 18s"} |
| {"loss": 0.28744996, "token_acc": 0.86891958, "grad_norm": 1.32861219, "learning_rate": 8.74e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232151, "epoch": 0.80906149, "global_step/max_steps": "625/2316", "percentage": "26.99%", "elapsed_time": "44m 43s", "remaining_time": "2h 1m 1s"} |
| {"loss": 0.27193141, "token_acc": 0.89371409, "grad_norm": 1.08200469, "learning_rate": 8.71e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.2319, "epoch": 0.81553398, "global_step/max_steps": "630/2316", "percentage": "27.20%", "elapsed_time": "45m 8s", "remaining_time": "2h 0m 48s"} |
| {"loss": 0.23849459, "token_acc": 0.91800675, "grad_norm": 1.26136793, "learning_rate": 8.69e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.231911, "epoch": 0.82200647, "global_step/max_steps": "635/2316", "percentage": "27.42%", "elapsed_time": "45m 29s", "remaining_time": "2h 0m 26s"} |
| {"loss": 0.23839798, "token_acc": 0.90941817, "grad_norm": 1.27526375, "learning_rate": 8.66e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.231945, "epoch": 0.82847896, "global_step/max_steps": "640/2316", "percentage": "27.63%", "elapsed_time": "45m 51s", "remaining_time": "2h 0m 4s"} |
| {"loss": 0.2149358, "token_acc": 0.91593172, "grad_norm": 1.18413967, "learning_rate": 8.64e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.231873, "epoch": 0.83495146, "global_step/max_steps": "645/2316", "percentage": "27.85%", "elapsed_time": "46m 13s", "remaining_time": "1h 59m 45s"} |
| {"loss": 0.22516031, "token_acc": 0.91679828, "grad_norm": 1.15764556, "learning_rate": 8.62e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.231788, "epoch": 0.84142395, "global_step/max_steps": "650/2316", "percentage": "28.07%", "elapsed_time": "46m 36s", "remaining_time": "1h 59m 26s"} |
| {"loss": 0.26212187, "token_acc": 0.89980354, "grad_norm": 1.16836049, "learning_rate": 8.59e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.231857, "epoch": 0.84789644, "global_step/max_steps": "655/2316", "percentage": "28.28%", "elapsed_time": "46m 56s", "remaining_time": "1h 59m 3s"} |
| {"loss": 0.24789062, "token_acc": 0.89849654, "grad_norm": 1.36207609, "learning_rate": 8.57e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.231965, "epoch": 0.85436893, "global_step/max_steps": "660/2316", "percentage": "28.50%", "elapsed_time": "47m 17s", "remaining_time": "1h 58m 38s"} |
| {"loss": 0.21802032, "token_acc": 0.91525424, "grad_norm": 1.05003255, "learning_rate": 8.54e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232025, "epoch": 0.86084142, "global_step/max_steps": "665/2316", "percentage": "28.71%", "elapsed_time": "47m 37s", "remaining_time": "1h 58m 15s"} |
| {"loss": 0.25951514, "token_acc": 0.88075701, "grad_norm": 1.31187327, "learning_rate": 8.52e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231837, "epoch": 0.86731392, "global_step/max_steps": "670/2316", "percentage": "28.93%", "elapsed_time": "48m 1s", "remaining_time": "1h 57m 59s"} |
| {"loss": 0.24524059, "token_acc": 0.89774078, "grad_norm": 1.18251628, "learning_rate": 8.49e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231897, "epoch": 0.87378641, "global_step/max_steps": "675/2316", "percentage": "29.15%", "elapsed_time": "48m 22s", "remaining_time": "1h 57m 36s"} |
| {"loss": 0.24305639, "token_acc": 0.91144401, "grad_norm": 1.20175394, "learning_rate": 8.46e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231891, "epoch": 0.8802589, "global_step/max_steps": "680/2316", "percentage": "29.36%", "elapsed_time": "48m 44s", "remaining_time": "1h 57m 15s"} |
| {"loss": 0.24873006, "token_acc": 0.90213852, "grad_norm": 1.30824236, "learning_rate": 8.44e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231976, "epoch": 0.88673139, "global_step/max_steps": "685/2316", "percentage": "29.58%", "elapsed_time": "49m 4s", "remaining_time": "1h 56m 51s"} |
| {"loss": 0.23204641, "token_acc": 0.91442632, "grad_norm": 1.11925106, "learning_rate": 8.41e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232141, "epoch": 0.89320388, "global_step/max_steps": "690/2316", "percentage": "29.79%", "elapsed_time": "49m 24s", "remaining_time": "1h 56m 25s"} |
| {"loss": 0.24607749, "token_acc": 0.89844852, "grad_norm": 1.20402296, "learning_rate": 8.39e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232177, "epoch": 0.89967638, "global_step/max_steps": "695/2316", "percentage": "30.01%", "elapsed_time": "49m 45s", "remaining_time": "1h 56m 2s"} |
| {"loss": 0.23296933, "token_acc": 0.90642897, "grad_norm": 1.26329378, "learning_rate": 8.36e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232171, "epoch": 0.90614887, "global_step/max_steps": "700/2316", "percentage": "30.22%", "elapsed_time": "50m 6s", "remaining_time": "1h 55m 41s"} |
| {"loss": 0.21826701, "token_acc": 0.91614907, "grad_norm": 1.31637677, "learning_rate": 8.33e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232102, "epoch": 0.91262136, "global_step/max_steps": "705/2316", "percentage": "30.44%", "elapsed_time": "50m 29s", "remaining_time": "1h 55m 22s"} |
| {"loss": 0.22841978, "token_acc": 0.93335596, "grad_norm": 1.19883707, "learning_rate": 8.31e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232182, "epoch": 0.91909385, "global_step/max_steps": "710/2316", "percentage": "30.66%", "elapsed_time": "50m 49s", "remaining_time": "1h 54m 58s"} |
| {"loss": 0.24874771, "token_acc": 0.91148899, "grad_norm": 1.28071415, "learning_rate": 8.28e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232298, "epoch": 0.92556634, "global_step/max_steps": "715/2316", "percentage": "30.87%", "elapsed_time": "51m 9s", "remaining_time": "1h 54m 33s"} |
| {"loss": 0.25080385, "token_acc": 0.91365155, "grad_norm": 1.2801996, "learning_rate": 8.25e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232119, "epoch": 0.93203883, "global_step/max_steps": "720/2316", "percentage": "31.09%", "elapsed_time": "51m 33s", "remaining_time": "1h 54m 17s"} |
| {"loss": 0.26421883, "token_acc": 0.89561337, "grad_norm": 1.05233791, "learning_rate": 8.23e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231981, "epoch": 0.93851133, "global_step/max_steps": "725/2316", "percentage": "31.30%", "elapsed_time": "51m 57s", "remaining_time": "1h 54m 0s"} |
| {"loss": 0.24255903, "token_acc": 0.9007564, "grad_norm": 1.12023055, "learning_rate": 8.2e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232029, "epoch": 0.94498382, "global_step/max_steps": "730/2316", "percentage": "31.52%", "elapsed_time": "52m 17s", "remaining_time": "1h 53m 37s"} |
| {"loss": 0.24859657, "token_acc": 0.89980311, "grad_norm": 1.20915235, "learning_rate": 8.17e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232068, "epoch": 0.95145631, "global_step/max_steps": "735/2316", "percentage": "31.74%", "elapsed_time": "52m 38s", "remaining_time": "1h 53m 14s"} |
| {"loss": 0.22349007, "token_acc": 0.91287466, "grad_norm": 1.157717, "learning_rate": 8.14e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232085, "epoch": 0.9579288, "global_step/max_steps": "740/2316", "percentage": "31.95%", "elapsed_time": "53m 0s", "remaining_time": "1h 52m 53s"} |
| {"loss": 0.25259361, "token_acc": 0.91205609, "grad_norm": 1.09512948, "learning_rate": 8.12e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232132, "epoch": 0.96440129, "global_step/max_steps": "745/2316", "percentage": "32.17%", "elapsed_time": "53m 21s", "remaining_time": "1h 52m 30s"} |
| {"loss": 0.21585426, "token_acc": 0.93446289, "grad_norm": 1.19121375, "learning_rate": 8.09e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232183, "epoch": 0.97087379, "global_step/max_steps": "750/2316", "percentage": "32.38%", "elapsed_time": "53m 41s", "remaining_time": "1h 52m 7s"} |
| {"loss": 0.21867204, "token_acc": 0.8962148, "grad_norm": 1.39245129, "learning_rate": 8.06e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232175, "epoch": 0.97734628, "global_step/max_steps": "755/2316", "percentage": "32.60%", "elapsed_time": "54m 3s", "remaining_time": "1h 51m 46s"} |
| {"loss": 0.25070786, "token_acc": 0.90303748, "grad_norm": 1.32237759, "learning_rate": 8.03e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232096, "epoch": 0.98381877, "global_step/max_steps": "760/2316", "percentage": "32.82%", "elapsed_time": "54m 26s", "remaining_time": "1h 51m 27s"} |
| {"loss": 0.25486846, "token_acc": 0.91281839, "grad_norm": 1.36147981, "learning_rate": 8e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232229, "epoch": 0.99029126, "global_step/max_steps": "765/2316", "percentage": "33.03%", "elapsed_time": "54m 45s", "remaining_time": "1h 51m 2s"} |
| {"loss": 0.23898923, "token_acc": 0.89108755, "grad_norm": 1.27495219, "learning_rate": 7.97e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232272, "epoch": 0.99676375, "global_step/max_steps": "770/2316", "percentage": "33.25%", "elapsed_time": "55m 6s", "remaining_time": "1h 50m 39s"} |
| {"loss": 0.18653586, "token_acc": 0.930398, "grad_norm": 1.02408953, "learning_rate": 7.94e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232492, "epoch": 1.002589, "global_step/max_steps": "775/2316", "percentage": "33.46%", "elapsed_time": "55m 25s", "remaining_time": "1h 50m 11s"} |
| {"loss": 0.15345871, "token_acc": 0.94100234, "grad_norm": 1.4255109, "learning_rate": 7.92e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232446, "epoch": 1.00906149, "global_step/max_steps": "780/2316", "percentage": "33.68%", "elapsed_time": "55m 47s", "remaining_time": "1h 49m 51s"} |
| {"loss": 0.15263861, "token_acc": 0.94293929, "grad_norm": 1.15357111, "learning_rate": 7.89e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232601, "epoch": 1.01553398, "global_step/max_steps": "785/2316", "percentage": "33.89%", "elapsed_time": "56m 6s", "remaining_time": "1h 49m 26s"} |
| {"loss": 0.13757938, "token_acc": 0.94386335, "grad_norm": 1.05877899, "learning_rate": 7.86e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232685, "epoch": 1.02200647, "global_step/max_steps": "790/2316", "percentage": "34.11%", "elapsed_time": "56m 26s", "remaining_time": "1h 49m 2s"} |
| {"loss": 0.16445314, "token_acc": 0.93513721, "grad_norm": 1.04931086, "learning_rate": 7.83e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232755, "epoch": 1.02847896, "global_step/max_steps": "795/2316", "percentage": "34.33%", "elapsed_time": "56m 47s", "remaining_time": "1h 48m 39s"} |
| {"loss": 0.13584902, "token_acc": 0.96813231, "grad_norm": 1.14701963, "learning_rate": 7.8e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232795, "epoch": 1.03495146, "global_step/max_steps": "800/2316", "percentage": "34.54%", "elapsed_time": "57m 8s", "remaining_time": "1h 48m 16s"} |
| {"eval_loss": 0.24885324, "eval_token_acc": 0.9029483, "eval_runtime": 10.4415, "eval_samples_per_second": 5.938, "eval_steps_per_second": 1.532, "epoch": 1.03495146, "global_step/max_steps": "800/2316", "percentage": "34.54%", "elapsed_time": "57m 18s", "remaining_time": "1h 48m 36s"} |
| {"loss": 0.1449914, "token_acc": 0.94498352, "grad_norm": 1.15353235, "learning_rate": 7.77e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232009, "epoch": 1.04142395, "global_step/max_steps": "805/2316", "percentage": "34.76%", "elapsed_time": "57m 41s", "remaining_time": "1h 48m 17s"} |
| {"loss": 0.13386303, "token_acc": 0.93617194, "grad_norm": 0.94460468, "learning_rate": 7.74e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232008, "epoch": 1.04789644, "global_step/max_steps": "810/2316", "percentage": "34.97%", "elapsed_time": "58m 3s", "remaining_time": "1h 47m 55s"} |
| {"loss": 0.15911262, "token_acc": 0.93593291, "grad_norm": 1.1796068, "learning_rate": 7.71e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23215, "epoch": 1.05436893, "global_step/max_steps": "815/2316", "percentage": "35.19%", "elapsed_time": "58m 22s", "remaining_time": "1h 47m 30s"} |
| {"loss": 0.14746063, "token_acc": 0.94578954, "grad_norm": 1.1828836, "learning_rate": 7.68e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232139, "epoch": 1.06084142, "global_step/max_steps": "820/2316", "percentage": "35.41%", "elapsed_time": "58m 44s", "remaining_time": "1h 47m 9s"} |
| {"loss": 0.14977206, "token_acc": 0.93491609, "grad_norm": 1.14249437, "learning_rate": 7.65e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232178, "epoch": 1.06731392, "global_step/max_steps": "825/2316", "percentage": "35.62%", "elapsed_time": "59m 5s", "remaining_time": "1h 46m 46s"} |
| {"loss": 0.15143678, "token_acc": 0.94465156, "grad_norm": 1.32210273, "learning_rate": 7.62e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232201, "epoch": 1.07378641, "global_step/max_steps": "830/2316", "percentage": "35.84%", "elapsed_time": "59m 26s", "remaining_time": "1h 46m 24s"} |
| {"loss": 0.15559604, "token_acc": 0.93573336, "grad_norm": 1.4186847, "learning_rate": 7.59e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232129, "epoch": 1.0802589, "global_step/max_steps": "835/2316", "percentage": "36.05%", "elapsed_time": "59m 48s", "remaining_time": "1h 46m 5s"} |
| {"loss": 0.1465324, "token_acc": 0.93395142, "grad_norm": 1.13420921, "learning_rate": 7.56e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232092, "epoch": 1.08673139, "global_step/max_steps": "840/2316", "percentage": "36.27%", "elapsed_time": "1h 0m 11s", "remaining_time": "1h 45m 45s"} |
| {"loss": 0.13536108, "token_acc": 0.94080708, "grad_norm": 1.1883032, "learning_rate": 7.53e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232066, "epoch": 1.09320388, "global_step/max_steps": "845/2316", "percentage": "36.49%", "elapsed_time": "1h 0m 32s", "remaining_time": "1h 45m 24s"} |
| {"loss": 0.15880249, "token_acc": 0.93746831, "grad_norm": 1.21307571, "learning_rate": 7.5e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23206, "epoch": 1.09967638, "global_step/max_steps": "850/2316", "percentage": "36.70%", "elapsed_time": "1h 0m 54s", "remaining_time": "1h 45m 3s"} |
| {"loss": 0.16497662, "token_acc": 0.91813337, "grad_norm": 1.61607648, "learning_rate": 7.46e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231987, "epoch": 1.10614887, "global_step/max_steps": "855/2316", "percentage": "36.92%", "elapsed_time": "1h 1m 17s", "remaining_time": "1h 44m 43s"} |
| {"loss": 0.17314398, "token_acc": 0.92856641, "grad_norm": 1.01837654, "learning_rate": 7.43e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231922, "epoch": 1.11262136, "global_step/max_steps": "860/2316", "percentage": "37.13%", "elapsed_time": "1h 1m 39s", "remaining_time": "1h 44m 24s"} |
| {"loss": 0.17320786, "token_acc": 0.92562324, "grad_norm": 1.2590888, "learning_rate": 7.4e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231941, "epoch": 1.11909385, "global_step/max_steps": "865/2316", "percentage": "37.35%", "elapsed_time": "1h 2m 1s", "remaining_time": "1h 44m 2s"} |
| {"loss": 0.17218266, "token_acc": 0.91998102, "grad_norm": 0.90529234, "learning_rate": 7.37e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232022, "epoch": 1.12556634, "global_step/max_steps": "870/2316", "percentage": "37.56%", "elapsed_time": "1h 2m 21s", "remaining_time": "1h 43m 38s"} |
| {"loss": 0.15341914, "token_acc": 0.94314858, "grad_norm": 1.33851052, "learning_rate": 7.34e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232218, "epoch": 1.13203883, "global_step/max_steps": "875/2316", "percentage": "37.78%", "elapsed_time": "1h 2m 39s", "remaining_time": "1h 43m 11s"} |
| {"loss": 0.14459639, "token_acc": 0.95566402, "grad_norm": 1.3169373, "learning_rate": 7.31e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232248, "epoch": 1.13851133, "global_step/max_steps": "880/2316", "percentage": "38.00%", "elapsed_time": "1h 3m 0s", "remaining_time": "1h 42m 49s"} |
| {"loss": 0.1469681, "token_acc": 0.94467257, "grad_norm": 0.97367057, "learning_rate": 7.28e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232144, "epoch": 1.14498382, "global_step/max_steps": "885/2316", "percentage": "38.21%", "elapsed_time": "1h 3m 24s", "remaining_time": "1h 42m 30s"} |
| {"loss": 0.15163915, "token_acc": 0.94320938, "grad_norm": 1.11646247, "learning_rate": 7.24e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232197, "epoch": 1.15145631, "global_step/max_steps": "890/2316", "percentage": "38.43%", "elapsed_time": "1h 3m 44s", "remaining_time": "1h 42m 8s"} |
| {"loss": 0.1508213, "token_acc": 0.95305075, "grad_norm": 1.28944126, "learning_rate": 7.21e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232254, "epoch": 1.1579288, "global_step/max_steps": "895/2316", "percentage": "38.64%", "elapsed_time": "1h 4m 5s", "remaining_time": "1h 41m 45s"} |
| {"loss": 0.16508399, "token_acc": 0.9284097, "grad_norm": 0.98874913, "learning_rate": 7.18e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232218, "epoch": 1.16440129, "global_step/max_steps": "900/2316", "percentage": "38.86%", "elapsed_time": "1h 4m 27s", "remaining_time": "1h 41m 24s"} |
| {"loss": 0.15763776, "token_acc": 0.9406016, "grad_norm": 1.32923214, "learning_rate": 7.15e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23225, "epoch": 1.17087379, "global_step/max_steps": "905/2316", "percentage": "39.08%", "elapsed_time": "1h 4m 48s", "remaining_time": "1h 41m 2s"} |
| {"loss": 0.15624495, "token_acc": 0.9456136, "grad_norm": 1.23677751, "learning_rate": 7.12e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232188, "epoch": 1.17734628, "global_step/max_steps": "910/2316", "percentage": "39.29%", "elapsed_time": "1h 5m 11s", "remaining_time": "1h 40m 42s"} |
| {"loss": 0.13360332, "token_acc": 0.93826446, "grad_norm": 1.15280505, "learning_rate": 7.08e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232238, "epoch": 1.18381877, "global_step/max_steps": "915/2316", "percentage": "39.51%", "elapsed_time": "1h 5m 31s", "remaining_time": "1h 40m 20s"} |
| {"loss": 0.14021143, "token_acc": 0.95154506, "grad_norm": 1.09979425, "learning_rate": 7.05e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232282, "epoch": 1.19029126, "global_step/max_steps": "920/2316", "percentage": "39.72%", "elapsed_time": "1h 5m 52s", "remaining_time": "1h 39m 57s"} |
| {"loss": 0.16748379, "token_acc": 0.93400737, "grad_norm": 1.54159649, "learning_rate": 7.02e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232309, "epoch": 1.19676375, "global_step/max_steps": "925/2316", "percentage": "39.94%", "elapsed_time": "1h 6m 13s", "remaining_time": "1h 39m 35s"} |
| {"loss": 0.14355829, "token_acc": 0.95702903, "grad_norm": 1.16128759, "learning_rate": 6.99e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232242, "epoch": 1.20323625, "global_step/max_steps": "930/2316", "percentage": "40.16%", "elapsed_time": "1h 6m 36s", "remaining_time": "1h 39m 15s"} |
| {"loss": 0.14788196, "token_acc": 0.94016191, "grad_norm": 1.12279091, "learning_rate": 6.95e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232318, "epoch": 1.20970874, "global_step/max_steps": "935/2316", "percentage": "40.37%", "elapsed_time": "1h 6m 56s", "remaining_time": "1h 38m 52s"} |
| {"loss": 0.12309618, "token_acc": 0.94555927, "grad_norm": 1.13821357, "learning_rate": 6.92e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232428, "epoch": 1.21618123, "global_step/max_steps": "940/2316", "percentage": "40.59%", "elapsed_time": "1h 7m 16s", "remaining_time": "1h 38m 28s"} |
| {"loss": 0.14437463, "token_acc": 0.93904681, "grad_norm": 1.04065475, "learning_rate": 6.89e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232477, "epoch": 1.22265372, "global_step/max_steps": "945/2316", "percentage": "40.80%", "elapsed_time": "1h 7m 36s", "remaining_time": "1h 38m 5s"} |
| {"loss": 0.16489348, "token_acc": 0.91830792, "grad_norm": 1.23056134, "learning_rate": 6.85e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232432, "epoch": 1.22912621, "global_step/max_steps": "950/2316", "percentage": "41.02%", "elapsed_time": "1h 7m 59s", "remaining_time": "1h 37m 45s"} |
| {"loss": 0.16526212, "token_acc": 0.93893012, "grad_norm": 0.84954368, "learning_rate": 6.82e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232494, "epoch": 1.23559871, "global_step/max_steps": "955/2316", "percentage": "41.23%", "elapsed_time": "1h 8m 19s", "remaining_time": "1h 37m 22s"} |
| {"loss": 0.16566269, "token_acc": 0.93977425, "grad_norm": 1.22430553, "learning_rate": 6.79e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232488, "epoch": 1.2420712, "global_step/max_steps": "960/2316", "percentage": "41.45%", "elapsed_time": "1h 8m 41s", "remaining_time": "1h 37m 0s"} |
| {"loss": 0.16845071, "token_acc": 0.93491573, "grad_norm": 1.10183115, "learning_rate": 6.75e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232394, "epoch": 1.24854369, "global_step/max_steps": "965/2316", "percentage": "41.67%", "elapsed_time": "1h 9m 4s", "remaining_time": "1h 36m 41s"} |
| {"loss": 0.16712919, "token_acc": 0.94555556, "grad_norm": 1.4316386, "learning_rate": 6.72e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232355, "epoch": 1.25501618, "global_step/max_steps": "970/2316", "percentage": "41.88%", "elapsed_time": "1h 9m 26s", "remaining_time": "1h 36m 21s"} |
| {"loss": 0.14253237, "token_acc": 0.92382633, "grad_norm": 1.08345596, "learning_rate": 6.69e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232331, "epoch": 1.26148867, "global_step/max_steps": "975/2316", "percentage": "42.10%", "elapsed_time": "1h 9m 48s", "remaining_time": "1h 36m 0s"} |
| {"loss": 0.12632759, "token_acc": 0.96505906, "grad_norm": 1.13427148, "learning_rate": 6.65e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232438, "epoch": 1.26796117, "global_step/max_steps": "980/2316", "percentage": "42.31%", "elapsed_time": "1h 10m 7s", "remaining_time": "1h 35m 36s"} |
| {"loss": 0.14012575, "token_acc": 0.93494394, "grad_norm": 1.60616161, "learning_rate": 6.62e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232521, "epoch": 1.27443366, "global_step/max_steps": "985/2316", "percentage": "42.53%", "elapsed_time": "1h 10m 27s", "remaining_time": "1h 35m 13s"} |
| {"loss": 0.15757035, "token_acc": 0.93629908, "grad_norm": 1.12722348, "learning_rate": 6.59e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232568, "epoch": 1.28090615, "global_step/max_steps": "990/2316", "percentage": "42.75%", "elapsed_time": "1h 10m 48s", "remaining_time": "1h 34m 50s"} |
| {"loss": 0.13624853, "token_acc": 0.93859097, "grad_norm": 1.16669023, "learning_rate": 6.55e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23265, "epoch": 1.28737864, "global_step/max_steps": "995/2316", "percentage": "42.96%", "elapsed_time": "1h 11m 8s", "remaining_time": "1h 34m 27s"} |
| {"loss": 0.16542966, "token_acc": 0.93791293, "grad_norm": 1.09202252, "learning_rate": 6.52e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232624, "epoch": 1.29385113, "global_step/max_steps": "1000/2316", "percentage": "43.18%", "elapsed_time": "1h 11m 30s", "remaining_time": "1h 34m 6s"} |
| {"eval_loss": 0.23033369, "eval_token_acc": 0.90587343, "eval_runtime": 10.7559, "eval_samples_per_second": 5.764, "eval_steps_per_second": 1.488, "epoch": 1.29385113, "global_step/max_steps": "1000/2316", "percentage": "43.18%", "elapsed_time": "1h 11m 41s", "remaining_time": "1h 34m 20s"} |
| {"loss": 0.14434555, "token_acc": 0.95045859, "grad_norm": 1.2384942, "learning_rate": 6.48e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232032, "epoch": 1.30032362, "global_step/max_steps": "1005/2316", "percentage": "43.39%", "elapsed_time": "1h 12m 3s", "remaining_time": "1h 33m 59s"} |
| {"loss": 0.14424937, "token_acc": 0.94365198, "grad_norm": 1.14406373, "learning_rate": 6.45e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232085, "epoch": 1.30679612, "global_step/max_steps": "1010/2316", "percentage": "43.61%", "elapsed_time": "1h 12m 23s", "remaining_time": "1h 33m 36s"} |
| {"loss": 0.15775502, "token_acc": 0.94290629, "grad_norm": 1.29818051, "learning_rate": 6.42e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232056, "epoch": 1.31326861, "global_step/max_steps": "1015/2316", "percentage": "43.83%", "elapsed_time": "1h 12m 45s", "remaining_time": "1h 33m 15s"} |
| {"loss": 0.14200583, "token_acc": 0.95143412, "grad_norm": 1.02217737, "learning_rate": 6.38e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232063, "epoch": 1.3197411, "global_step/max_steps": "1020/2316", "percentage": "44.04%", "elapsed_time": "1h 13m 7s", "remaining_time": "1h 32m 54s"} |
| {"loss": 0.15405276, "token_acc": 0.94074757, "grad_norm": 0.98507837, "learning_rate": 6.35e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232039, "epoch": 1.32621359, "global_step/max_steps": "1025/2316", "percentage": "44.26%", "elapsed_time": "1h 13m 29s", "remaining_time": "1h 32m 33s"} |
| {"loss": 0.15107574, "token_acc": 0.95005934, "grad_norm": 1.06497958, "learning_rate": 6.31e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232114, "epoch": 1.33268608, "global_step/max_steps": "1030/2316", "percentage": "44.47%", "elapsed_time": "1h 13m 49s", "remaining_time": "1h 32m 10s"} |
| {"loss": 0.14106839, "token_acc": 0.93092764, "grad_norm": 0.94001516, "learning_rate": 6.28e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232116, "epoch": 1.33915858, "global_step/max_steps": "1035/2316", "percentage": "44.69%", "elapsed_time": "1h 14m 10s", "remaining_time": "1h 31m 48s"} |
| {"loss": 0.14803498, "token_acc": 0.944, "grad_norm": 1.4225463, "learning_rate": 6.24e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232104, "epoch": 1.34563107, "global_step/max_steps": "1040/2316", "percentage": "44.91%", "elapsed_time": "1h 14m 32s", "remaining_time": "1h 31m 27s"} |
| {"loss": 0.16803299, "token_acc": 0.91486404, "grad_norm": 1.06422041, "learning_rate": 6.21e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232031, "epoch": 1.35210356, "global_step/max_steps": "1045/2316", "percentage": "45.12%", "elapsed_time": "1h 14m 55s", "remaining_time": "1h 31m 7s"} |
| {"loss": 0.14065527, "token_acc": 0.9575244, "grad_norm": 1.07180582, "learning_rate": 6.17e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232042, "epoch": 1.35857605, "global_step/max_steps": "1050/2316", "percentage": "45.34%", "elapsed_time": "1h 15m 16s", "remaining_time": "1h 30m 46s"} |
| {"loss": 0.13676614, "token_acc": 0.95875128, "grad_norm": 1.24230063, "learning_rate": 6.14e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232221, "epoch": 1.36504854, "global_step/max_steps": "1055/2316", "percentage": "45.55%", "elapsed_time": "1h 15m 34s", "remaining_time": "1h 30m 20s"} |
| {"loss": 0.16725906, "token_acc": 0.94851466, "grad_norm": 1.42949495, "learning_rate": 6.1e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232263, "epoch": 1.37152104, "global_step/max_steps": "1060/2316", "percentage": "45.77%", "elapsed_time": "1h 15m 55s", "remaining_time": "1h 29m 57s"} |
| {"loss": 0.14485841, "token_acc": 0.94672477, "grad_norm": 1.17817271, "learning_rate": 6.07e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232206, "epoch": 1.37799353, "global_step/max_steps": "1065/2316", "percentage": "45.98%", "elapsed_time": "1h 16m 18s", "remaining_time": "1h 29m 37s"} |
| {"loss": 0.15031464, "token_acc": 0.94374075, "grad_norm": 1.20874807, "learning_rate": 6.03e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232226, "epoch": 1.38446602, "global_step/max_steps": "1070/2316", "percentage": "46.20%", "elapsed_time": "1h 16m 39s", "remaining_time": "1h 29m 15s"} |
| {"loss": 0.1526109, "token_acc": 0.94733528, "grad_norm": 1.28185, "learning_rate": 6e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232166, "epoch": 1.39093851, "global_step/max_steps": "1075/2316", "percentage": "46.42%", "elapsed_time": "1h 17m 2s", "remaining_time": "1h 28m 55s"} |
| {"loss": 0.14637314, "token_acc": 0.94930088, "grad_norm": 1.09844975, "learning_rate": 5.96e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232314, "epoch": 1.397411, "global_step/max_steps": "1080/2316", "percentage": "46.63%", "elapsed_time": "1h 17m 20s", "remaining_time": "1h 28m 30s"} |
| {"loss": 0.15002662, "token_acc": 0.94092684, "grad_norm": 1.23335451, "learning_rate": 5.93e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232318, "epoch": 1.4038835, "global_step/max_steps": "1085/2316", "percentage": "46.85%", "elapsed_time": "1h 17m 42s", "remaining_time": "1h 28m 9s"} |
| {"loss": 0.1417031, "token_acc": 0.94462078, "grad_norm": 1.20755433, "learning_rate": 5.89e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232381, "epoch": 1.41035599, "global_step/max_steps": "1090/2316", "percentage": "47.06%", "elapsed_time": "1h 18m 2s", "remaining_time": "1h 27m 46s"} |
| {"loss": 0.16042575, "token_acc": 0.93849602, "grad_norm": 1.46912254, "learning_rate": 5.86e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232352, "epoch": 1.41682848, "global_step/max_steps": "1095/2316", "percentage": "47.28%", "elapsed_time": "1h 18m 24s", "remaining_time": "1h 27m 25s"} |
| {"loss": 0.1459147, "token_acc": 0.94611814, "grad_norm": 1.31884908, "learning_rate": 5.82e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232374, "epoch": 1.42330097, "global_step/max_steps": "1100/2316", "percentage": "47.50%", "elapsed_time": "1h 18m 45s", "remaining_time": "1h 27m 3s"} |
| {"loss": 0.1547477, "token_acc": 0.94395847, "grad_norm": 1.26059905, "learning_rate": 5.79e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232379, "epoch": 1.42977346, "global_step/max_steps": "1105/2316", "percentage": "47.71%", "elapsed_time": "1h 19m 6s", "remaining_time": "1h 26m 42s"} |
| {"loss": 0.15129278, "token_acc": 0.963646, "grad_norm": 1.25000823, "learning_rate": 5.75e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232348, "epoch": 1.43624595, "global_step/max_steps": "1110/2316", "percentage": "47.93%", "elapsed_time": "1h 19m 29s", "remaining_time": "1h 26m 21s"} |
| {"loss": 0.1579402, "token_acc": 0.92974079, "grad_norm": 1.35120665, "learning_rate": 5.72e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232319, "epoch": 1.44271845, "global_step/max_steps": "1115/2316", "percentage": "48.14%", "elapsed_time": "1h 19m 51s", "remaining_time": "1h 26m 0s"} |
| {"loss": 0.13439696, "token_acc": 0.93164135, "grad_norm": 1.30285039, "learning_rate": 5.68e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23227, "epoch": 1.44919094, "global_step/max_steps": "1120/2316", "percentage": "48.36%", "elapsed_time": "1h 20m 13s", "remaining_time": "1h 25m 40s"} |
| {"loss": 0.13236558, "token_acc": 0.94693362, "grad_norm": 1.23102366, "learning_rate": 5.65e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232403, "epoch": 1.45566343, "global_step/max_steps": "1125/2316", "percentage": "48.58%", "elapsed_time": "1h 20m 32s", "remaining_time": "1h 25m 16s"} |
| {"loss": 0.15234294, "token_acc": 0.94607801, "grad_norm": 1.09941204, "learning_rate": 5.61e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232538, "epoch": 1.46213592, "global_step/max_steps": "1130/2316", "percentage": "48.79%", "elapsed_time": "1h 20m 51s", "remaining_time": "1h 24m 51s"} |
| {"loss": 0.12578456, "token_acc": 0.95159516, "grad_norm": 1.19801568, "learning_rate": 5.58e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232622, "epoch": 1.46860841, "global_step/max_steps": "1135/2316", "percentage": "49.01%", "elapsed_time": "1h 21m 10s", "remaining_time": "1h 24m 28s"} |
| {"loss": 0.16113465, "token_acc": 0.92392792, "grad_norm": 1.03993319, "learning_rate": 5.54e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232519, "epoch": 1.47508091, "global_step/max_steps": "1140/2316", "percentage": "49.22%", "elapsed_time": "1h 21m 34s", "remaining_time": "1h 24m 9s"} |
| {"loss": 0.12549162, "token_acc": 0.94847683, "grad_norm": 1.07757523, "learning_rate": 5.51e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232612, "epoch": 1.4815534, "global_step/max_steps": "1145/2316", "percentage": "49.44%", "elapsed_time": "1h 21m 54s", "remaining_time": "1h 23m 45s"} |
| {"loss": 0.15377481, "token_acc": 0.91960218, "grad_norm": 1.21938388, "learning_rate": 5.47e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232674, "epoch": 1.48802589, "global_step/max_steps": "1150/2316", "percentage": "49.65%", "elapsed_time": "1h 22m 14s", "remaining_time": "1h 23m 22s"} |
| {"loss": 0.13875941, "token_acc": 0.93488995, "grad_norm": 1.21609909, "learning_rate": 5.43e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232804, "epoch": 1.49449838, "global_step/max_steps": "1155/2316", "percentage": "49.87%", "elapsed_time": "1h 22m 33s", "remaining_time": "1h 22m 58s"} |
| {"loss": 0.14159017, "token_acc": 0.94478795, "grad_norm": 1.23965238, "learning_rate": 5.4e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232734, "epoch": 1.50097087, "global_step/max_steps": "1160/2316", "percentage": "50.09%", "elapsed_time": "1h 22m 56s", "remaining_time": "1h 22m 38s"} |
| {"loss": 0.15291476, "token_acc": 0.94281858, "grad_norm": 1.15845348, "learning_rate": 5.36e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232734, "epoch": 1.50744337, "global_step/max_steps": "1165/2316", "percentage": "50.30%", "elapsed_time": "1h 23m 17s", "remaining_time": "1h 22m 17s"} |
| {"loss": 0.15192903, "token_acc": 0.94456241, "grad_norm": 1.11886023, "learning_rate": 5.33e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232643, "epoch": 1.51391586, "global_step/max_steps": "1170/2316", "percentage": "50.52%", "elapsed_time": "1h 23m 40s", "remaining_time": "1h 21m 57s"} |
| {"loss": 0.13454955, "token_acc": 0.95750272, "grad_norm": 1.22832735, "learning_rate": 5.29e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232598, "epoch": 1.52038835, "global_step/max_steps": "1175/2316", "percentage": "50.73%", "elapsed_time": "1h 24m 3s", "remaining_time": "1h 21m 37s"} |
| {"loss": 0.15219941, "token_acc": 0.92927144, "grad_norm": 1.31894933, "learning_rate": 5.26e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232589, "epoch": 1.52686084, "global_step/max_steps": "1180/2316", "percentage": "50.95%", "elapsed_time": "1h 24m 25s", "remaining_time": "1h 21m 16s"} |
| {"loss": 0.16253856, "token_acc": 0.93020794, "grad_norm": 1.25054694, "learning_rate": 5.22e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232499, "epoch": 1.53333333, "global_step/max_steps": "1185/2316", "percentage": "51.17%", "elapsed_time": "1h 24m 48s", "remaining_time": "1h 20m 56s"} |
| {"loss": 0.11098604, "token_acc": 0.96666667, "grad_norm": 1.18759835, "learning_rate": 5.19e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232529, "epoch": 1.53980583, "global_step/max_steps": "1190/2316", "percentage": "51.38%", "elapsed_time": "1h 25m 9s", "remaining_time": "1h 20m 34s"} |
| {"loss": 0.17014005, "token_acc": 0.92037671, "grad_norm": 1.26036864, "learning_rate": 5.15e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232511, "epoch": 1.54627832, "global_step/max_steps": "1195/2316", "percentage": "51.60%", "elapsed_time": "1h 25m 31s", "remaining_time": "1h 20m 13s"} |
| {"loss": 0.13573467, "token_acc": 0.9516525, "grad_norm": 1.22050824, "learning_rate": 5.11e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232518, "epoch": 1.55275081, "global_step/max_steps": "1200/2316", "percentage": "51.81%", "elapsed_time": "1h 25m 52s", "remaining_time": "1h 19m 51s"} |
| {"eval_loss": 0.22833616, "eval_token_acc": 0.9079014, "eval_runtime": 11.3314, "eval_samples_per_second": 5.472, "eval_steps_per_second": 1.412, "epoch": 1.55275081, "global_step/max_steps": "1200/2316", "percentage": "51.81%", "elapsed_time": "1h 26m 4s", "remaining_time": "1h 20m 2s"} |
| {"loss": 0.12960266, "token_acc": 0.95358888, "grad_norm": 1.2180858, "learning_rate": 5.08e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23206, "epoch": 1.5592233, "global_step/max_steps": "1205/2316", "percentage": "52.03%", "elapsed_time": "1h 26m 24s", "remaining_time": "1h 19m 39s"} |
| {"loss": 0.13594601, "token_acc": 0.95343295, "grad_norm": 1.23648953, "learning_rate": 5.04e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232154, "epoch": 1.56569579, "global_step/max_steps": "1210/2316", "percentage": "52.25%", "elapsed_time": "1h 26m 43s", "remaining_time": "1h 19m 16s"} |
| {"loss": 0.1503763, "token_acc": 0.94460332, "grad_norm": 1.37258919, "learning_rate": 5.01e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232222, "epoch": 1.57216828, "global_step/max_steps": "1215/2316", "percentage": "52.46%", "elapsed_time": "1h 27m 3s", "remaining_time": "1h 18m 53s"} |
| {"loss": 0.13618231, "token_acc": 0.94837068, "grad_norm": 1.11039118, "learning_rate": 4.97e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232205, "epoch": 1.57864078, "global_step/max_steps": "1220/2316", "percentage": "52.68%", "elapsed_time": "1h 27m 25s", "remaining_time": "1h 18m 32s"} |
| {"loss": 0.15404176, "token_acc": 0.94720708, "grad_norm": 1.08915896, "learning_rate": 4.94e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232166, "epoch": 1.58511327, "global_step/max_steps": "1225/2316", "percentage": "52.89%", "elapsed_time": "1h 27m 48s", "remaining_time": "1h 18m 11s"} |
| {"loss": 0.15092902, "token_acc": 0.93834141, "grad_norm": 1.02588916, "learning_rate": 4.9e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232164, "epoch": 1.59158576, "global_step/max_steps": "1230/2316", "percentage": "53.11%", "elapsed_time": "1h 28m 9s", "remaining_time": "1h 17m 50s"} |
| {"loss": 0.14530941, "token_acc": 0.95238095, "grad_norm": 1.17073917, "learning_rate": 4.86e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232156, "epoch": 1.59805825, "global_step/max_steps": "1235/2316", "percentage": "53.32%", "elapsed_time": "1h 28m 31s", "remaining_time": "1h 17m 29s"} |
| {"loss": 0.14811773, "token_acc": 0.94482331, "grad_norm": 1.1919823, "learning_rate": 4.83e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232162, "epoch": 1.60453074, "global_step/max_steps": "1240/2316", "percentage": "53.54%", "elapsed_time": "1h 28m 52s", "remaining_time": "1h 17m 7s"} |
| {"loss": 0.13772547, "token_acc": 0.93067877, "grad_norm": 1.43746126, "learning_rate": 4.79e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232127, "epoch": 1.61100324, "global_step/max_steps": "1245/2316", "percentage": "53.76%", "elapsed_time": "1h 29m 15s", "remaining_time": "1h 16m 46s"} |
| {"loss": 0.13388219, "token_acc": 0.94704312, "grad_norm": 1.10357798, "learning_rate": 4.76e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232131, "epoch": 1.61747573, "global_step/max_steps": "1250/2316", "percentage": "53.97%", "elapsed_time": "1h 29m 36s", "remaining_time": "1h 16m 25s"} |
| {"loss": 0.13607364, "token_acc": 0.92408047, "grad_norm": 1.03903513, "learning_rate": 4.72e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232145, "epoch": 1.62394822, "global_step/max_steps": "1255/2316", "percentage": "54.19%", "elapsed_time": "1h 29m 57s", "remaining_time": "1h 16m 3s"} |
| {"loss": 0.14130905, "token_acc": 0.95069767, "grad_norm": 1.18077137, "learning_rate": 4.69e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232108, "epoch": 1.63042071, "global_step/max_steps": "1260/2316", "percentage": "54.40%", "elapsed_time": "1h 30m 20s", "remaining_time": "1h 15m 42s"} |
| {"loss": 0.13713672, "token_acc": 0.95171574, "grad_norm": 1.10553446, "learning_rate": 4.65e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232081, "epoch": 1.6368932, "global_step/max_steps": "1265/2316", "percentage": "54.62%", "elapsed_time": "1h 30m 42s", "remaining_time": "1h 15m 21s"} |
| {"loss": 0.12464081, "token_acc": 0.95633188, "grad_norm": 1.10994834, "learning_rate": 4.61e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232135, "epoch": 1.6433657, "global_step/max_steps": "1270/2316", "percentage": "54.84%", "elapsed_time": "1h 31m 2s", "remaining_time": "1h 14m 59s"} |
| {"loss": 0.13826616, "token_acc": 0.95532787, "grad_norm": 1.08957346, "learning_rate": 4.58e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23228, "epoch": 1.64983819, "global_step/max_steps": "1275/2316", "percentage": "55.05%", "elapsed_time": "1h 31m 20s", "remaining_time": "1h 14m 34s"} |
| {"loss": 0.1364417, "token_acc": 0.95420073, "grad_norm": 1.23127107, "learning_rate": 4.54e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232295, "epoch": 1.65631068, "global_step/max_steps": "1280/2316", "percentage": "55.27%", "elapsed_time": "1h 31m 42s", "remaining_time": "1h 14m 13s"} |
| {"loss": 0.14990467, "token_acc": 0.93704784, "grad_norm": 1.13559322, "learning_rate": 4.51e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232353, "epoch": 1.66278317, "global_step/max_steps": "1285/2316", "percentage": "55.48%", "elapsed_time": "1h 32m 2s", "remaining_time": "1h 13m 50s"} |
| {"loss": 0.14617527, "token_acc": 0.94716146, "grad_norm": 1.09549043, "learning_rate": 4.47e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232352, "epoch": 1.66925566, "global_step/max_steps": "1290/2316", "percentage": "55.70%", "elapsed_time": "1h 32m 23s", "remaining_time": "1h 13m 29s"} |
| {"loss": 0.15028341, "token_acc": 0.94341479, "grad_norm": 1.06932366, "learning_rate": 4.44e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232394, "epoch": 1.67572816, "global_step/max_steps": "1295/2316", "percentage": "55.92%", "elapsed_time": "1h 32m 44s", "remaining_time": "1h 13m 6s"} |
| {"loss": 0.15468287, "token_acc": 0.92177743, "grad_norm": 1.26802177, "learning_rate": 4.4e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232344, "epoch": 1.68220065, "global_step/max_steps": "1300/2316", "percentage": "56.13%", "elapsed_time": "1h 33m 6s", "remaining_time": "1h 12m 46s"} |
| {"loss": 0.16579792, "token_acc": 0.94235216, "grad_norm": 1.15636528, "learning_rate": 4.37e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232403, "epoch": 1.68867314, "global_step/max_steps": "1305/2316", "percentage": "56.35%", "elapsed_time": "1h 33m 27s", "remaining_time": "1h 12m 23s"} |
| {"loss": 0.14126024, "token_acc": 0.94890983, "grad_norm": 1.1842855, "learning_rate": 4.33e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232325, "epoch": 1.69514563, "global_step/max_steps": "1310/2316", "percentage": "56.56%", "elapsed_time": "1h 33m 50s", "remaining_time": "1h 12m 3s"} |
| {"loss": 0.17292037, "token_acc": 0.91324073, "grad_norm": 1.37329261, "learning_rate": 4.3e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232227, "epoch": 1.70161812, "global_step/max_steps": "1315/2316", "percentage": "56.78%", "elapsed_time": "1h 34m 14s", "remaining_time": "1h 11m 44s"} |
| {"loss": 0.14038984, "token_acc": 0.93239238, "grad_norm": 1.08879276, "learning_rate": 4.26e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232177, "epoch": 1.70809061, "global_step/max_steps": "1320/2316", "percentage": "56.99%", "elapsed_time": "1h 34m 37s", "remaining_time": "1h 11m 23s"} |
| {"loss": 0.13201141, "token_acc": 0.94986164, "grad_norm": 1.03785167, "learning_rate": 4.22e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232234, "epoch": 1.71456311, "global_step/max_steps": "1325/2316", "percentage": "57.21%", "elapsed_time": "1h 34m 57s", "remaining_time": "1h 11m 1s"} |
| {"loss": 0.12792009, "token_acc": 0.95227303, "grad_norm": 1.18868647, "learning_rate": 4.19e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232349, "epoch": 1.7210356, "global_step/max_steps": "1330/2316", "percentage": "57.43%", "elapsed_time": "1h 35m 15s", "remaining_time": "1h 10m 37s"} |
| {"loss": 0.13054893, "token_acc": 0.94334947, "grad_norm": 1.11957457, "learning_rate": 4.15e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232397, "epoch": 1.72750809, "global_step/max_steps": "1335/2316", "percentage": "57.64%", "elapsed_time": "1h 35m 36s", "remaining_time": "1h 10m 15s"} |
| {"loss": 0.13422401, "token_acc": 0.94408661, "grad_norm": 1.19440373, "learning_rate": 4.12e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23242, "epoch": 1.73398058, "global_step/max_steps": "1340/2316", "percentage": "57.86%", "elapsed_time": "1h 35m 57s", "remaining_time": "1h 9m 53s"} |
| {"loss": 0.14994818, "token_acc": 0.93075993, "grad_norm": 1.39742496, "learning_rate": 4.08e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232473, "epoch": 1.74045307, "global_step/max_steps": "1345/2316", "percentage": "58.07%", "elapsed_time": "1h 36m 17s", "remaining_time": "1h 9m 30s"} |
| {"loss": 0.14254911, "token_acc": 0.95276785, "grad_norm": 1.32135143, "learning_rate": 4.05e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232452, "epoch": 1.74692557, "global_step/max_steps": "1350/2316", "percentage": "58.29%", "elapsed_time": "1h 36m 39s", "remaining_time": "1h 9m 9s"} |
| {"loss": 0.13440341, "token_acc": 0.94065376, "grad_norm": 1.29082662, "learning_rate": 4.01e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232584, "epoch": 1.75339806, "global_step/max_steps": "1355/2316", "percentage": "58.51%", "elapsed_time": "1h 36m 57s", "remaining_time": "1h 8m 46s"} |
| {"loss": 0.12804188, "token_acc": 0.94616088, "grad_norm": 1.24387296, "learning_rate": 3.98e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232609, "epoch": 1.75987055, "global_step/max_steps": "1360/2316", "percentage": "58.72%", "elapsed_time": "1h 37m 18s", "remaining_time": "1h 8m 24s"} |
| {"loss": 0.15814323, "token_acc": 0.9418493, "grad_norm": 1.31128197, "learning_rate": 3.94e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232424, "epoch": 1.76634304, "global_step/max_steps": "1365/2316", "percentage": "58.94%", "elapsed_time": "1h 37m 44s", "remaining_time": "1h 8m 5s"} |
| {"loss": 0.13499727, "token_acc": 0.93462272, "grad_norm": 1.01742053, "learning_rate": 3.91e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232322, "epoch": 1.77281553, "global_step/max_steps": "1370/2316", "percentage": "59.15%", "elapsed_time": "1h 38m 8s", "remaining_time": "1h 7m 46s"} |
| {"loss": 0.12530887, "token_acc": 0.9510694, "grad_norm": 1.10982606, "learning_rate": 3.87e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232379, "epoch": 1.77928803, "global_step/max_steps": "1375/2316", "percentage": "59.37%", "elapsed_time": "1h 38m 28s", "remaining_time": "1h 7m 23s"} |
| {"loss": 0.11976063, "token_acc": 0.93774585, "grad_norm": 1.24830881, "learning_rate": 3.84e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232388, "epoch": 1.78576052, "global_step/max_steps": "1380/2316", "percentage": "59.59%", "elapsed_time": "1h 38m 50s", "remaining_time": "1h 7m 2s"} |
| {"loss": 0.12904413, "token_acc": 0.95311442, "grad_norm": 1.27003977, "learning_rate": 3.81e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232421, "epoch": 1.79223301, "global_step/max_steps": "1385/2316", "percentage": "59.80%", "elapsed_time": "1h 39m 10s", "remaining_time": "1h 6m 40s"} |
| {"loss": 0.12810664, "token_acc": 0.94958718, "grad_norm": 1.24577932, "learning_rate": 3.77e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232447, "epoch": 1.7987055, "global_step/max_steps": "1390/2316", "percentage": "60.02%", "elapsed_time": "1h 39m 31s", "remaining_time": "1h 6m 18s"} |
| {"loss": 0.12906048, "token_acc": 0.94499006, "grad_norm": 1.09189758, "learning_rate": 3.74e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232478, "epoch": 1.80517799, "global_step/max_steps": "1395/2316", "percentage": "60.23%", "elapsed_time": "1h 39m 52s", "remaining_time": "1h 5m 56s"} |
| {"loss": 0.13099806, "token_acc": 0.94970482, "grad_norm": 1.33622492, "learning_rate": 3.7e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232505, "epoch": 1.81165049, "global_step/max_steps": "1400/2316", "percentage": "60.45%", "elapsed_time": "1h 40m 13s", "remaining_time": "1h 5m 34s"} |
| {"eval_loss": 0.22171998, "eval_token_acc": 0.90875364, "eval_runtime": 10.2295, "eval_samples_per_second": 6.061, "eval_steps_per_second": 1.564, "epoch": 1.81165049, "global_step/max_steps": "1400/2316", "percentage": "60.45%", "elapsed_time": "1h 40m 23s", "remaining_time": "1h 5m 41s"} |
| {"loss": 0.11891184, "token_acc": 0.95977113, "grad_norm": 1.24174564, "learning_rate": 3.67e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232174, "epoch": 1.81812298, "global_step/max_steps": "1405/2316", "percentage": "60.66%", "elapsed_time": "1h 40m 43s", "remaining_time": "1h 5m 18s"} |
| {"loss": 0.16938546, "token_acc": 0.91753919, "grad_norm": 1.18744005, "learning_rate": 3.63e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232113, "epoch": 1.82459547, "global_step/max_steps": "1410/2316", "percentage": "60.88%", "elapsed_time": "1h 41m 6s", "remaining_time": "1h 4m 57s"} |
| {"loss": 0.13332188, "token_acc": 0.95006325, "grad_norm": 1.03465621, "learning_rate": 3.6e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232155, "epoch": 1.83106796, "global_step/max_steps": "1415/2316", "percentage": "61.10%", "elapsed_time": "1h 41m 26s", "remaining_time": "1h 4m 35s"} |
| {"loss": 0.12574079, "token_acc": 0.95884392, "grad_norm": 1.02544319, "learning_rate": 3.56e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232181, "epoch": 1.83754045, "global_step/max_steps": "1420/2316", "percentage": "61.31%", "elapsed_time": "1h 41m 47s", "remaining_time": "1h 4m 13s"} |
| {"loss": 0.12838275, "token_acc": 0.95250351, "grad_norm": 1.23648779, "learning_rate": 3.53e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232146, "epoch": 1.84401294, "global_step/max_steps": "1425/2316", "percentage": "61.53%", "elapsed_time": "1h 42m 10s", "remaining_time": "1h 3m 52s"} |
| {"loss": 0.11218019, "token_acc": 0.95996006, "grad_norm": 1.4058506, "learning_rate": 3.5e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232115, "epoch": 1.85048544, "global_step/max_steps": "1430/2316", "percentage": "61.74%", "elapsed_time": "1h 42m 32s", "remaining_time": "1h 3m 31s"} |
| {"loss": 0.13867826, "token_acc": 0.9507865, "grad_norm": 1.28729691, "learning_rate": 3.46e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232101, "epoch": 1.85695793, "global_step/max_steps": "1435/2316", "percentage": "61.96%", "elapsed_time": "1h 42m 54s", "remaining_time": "1h 3m 10s"} |
| {"loss": 0.12011986, "token_acc": 0.9739304, "grad_norm": 1.09802991, "learning_rate": 3.43e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232169, "epoch": 1.86343042, "global_step/max_steps": "1440/2316", "percentage": "62.18%", "elapsed_time": "1h 43m 14s", "remaining_time": "1h 2m 48s"} |
| {"loss": 0.14790295, "token_acc": 0.91417397, "grad_norm": 1.09737094, "learning_rate": 3.39e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232206, "epoch": 1.86990291, "global_step/max_steps": "1445/2316", "percentage": "62.39%", "elapsed_time": "1h 43m 34s", "remaining_time": "1h 2m 26s"} |
| {"loss": 0.14544033, "token_acc": 0.95155331, "grad_norm": 1.32100818, "learning_rate": 3.36e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232185, "epoch": 1.8763754, "global_step/max_steps": "1450/2316", "percentage": "62.61%", "elapsed_time": "1h 43m 56s", "remaining_time": "1h 2m 4s"} |
| {"loss": 0.12079251, "token_acc": 0.95115143, "grad_norm": 1.13276404, "learning_rate": 3.33e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232168, "epoch": 1.8828479, "global_step/max_steps": "1455/2316", "percentage": "62.82%", "elapsed_time": "1h 44m 18s", "remaining_time": "1h 1m 43s"} |
| {"loss": 0.1467132, "token_acc": 0.93916525, "grad_norm": 1.01281807, "learning_rate": 3.29e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232099, "epoch": 1.88932039, "global_step/max_steps": "1460/2316", "percentage": "63.04%", "elapsed_time": "1h 44m 42s", "remaining_time": "1h 1m 23s"} |
| {"loss": 0.15085415, "token_acc": 0.91901126, "grad_norm": 1.03489683, "learning_rate": 3.26e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232113, "epoch": 1.89579288, "global_step/max_steps": "1465/2316", "percentage": "63.26%", "elapsed_time": "1h 45m 3s", "remaining_time": "1h 1m 1s"} |
| {"loss": 0.14026722, "token_acc": 0.93177799, "grad_norm": 1.20401578, "learning_rate": 3.23e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232177, "epoch": 1.90226537, "global_step/max_steps": "1470/2316", "percentage": "63.47%", "elapsed_time": "1h 45m 23s", "remaining_time": "1h 0m 39s"} |
| {"loss": 0.13346016, "token_acc": 0.95430565, "grad_norm": 1.27530848, "learning_rate": 3.19e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232207, "epoch": 1.90873786, "global_step/max_steps": "1475/2316", "percentage": "63.69%", "elapsed_time": "1h 45m 43s", "remaining_time": "1h 0m 17s"} |
| {"loss": 0.12732252, "token_acc": 0.95729843, "grad_norm": 1.18556722, "learning_rate": 3.16e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232163, "epoch": 1.91521036, "global_step/max_steps": "1480/2316", "percentage": "63.90%", "elapsed_time": "1h 46m 6s", "remaining_time": "59m 56s"} |
| {"loss": 0.1419986, "token_acc": 0.94827427, "grad_norm": 1.48675284, "learning_rate": 3.13e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232115, "epoch": 1.92168285, "global_step/max_steps": "1485/2316", "percentage": "64.12%", "elapsed_time": "1h 46m 29s", "remaining_time": "59m 35s"} |
| {"loss": 0.11828438, "token_acc": 0.95158753, "grad_norm": 1.31952409, "learning_rate": 3.09e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232165, "epoch": 1.92815534, "global_step/max_steps": "1490/2316", "percentage": "64.34%", "elapsed_time": "1h 46m 49s", "remaining_time": "59m 13s"} |
| {"loss": 0.12930368, "token_acc": 0.93818966, "grad_norm": 1.2989895, "learning_rate": 3.06e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232247, "epoch": 1.93462783, "global_step/max_steps": "1495/2316", "percentage": "64.55%", "elapsed_time": "1h 47m 8s", "remaining_time": "58m 50s"} |
| {"loss": 0.11242288, "token_acc": 0.94434279, "grad_norm": 1.13367056, "learning_rate": 3.03e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232252, "epoch": 1.94110032, "global_step/max_steps": "1500/2316", "percentage": "64.77%", "elapsed_time": "1h 47m 30s", "remaining_time": "58m 28s"} |
| {"loss": 0.1473212, "token_acc": 0.93894536, "grad_norm": 1.31092187, "learning_rate": 2.99e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23222, "epoch": 1.94757282, "global_step/max_steps": "1505/2316", "percentage": "64.98%", "elapsed_time": "1h 47m 52s", "remaining_time": "58m 7s"} |
| {"loss": 0.13486187, "token_acc": 0.95555556, "grad_norm": 1.06198734, "learning_rate": 2.96e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232245, "epoch": 1.95404531, "global_step/max_steps": "1510/2316", "percentage": "65.20%", "elapsed_time": "1h 48m 13s", "remaining_time": "57m 46s"} |
| {"loss": 0.12884085, "token_acc": 0.96185439, "grad_norm": 1.18269832, "learning_rate": 2.93e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232286, "epoch": 1.9605178, "global_step/max_steps": "1515/2316", "percentage": "65.41%", "elapsed_time": "1h 48m 33s", "remaining_time": "57m 23s"} |
| {"loss": 0.13765714, "token_acc": 0.9504092, "grad_norm": 1.15382508, "learning_rate": 2.9e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232286, "epoch": 1.96699029, "global_step/max_steps": "1520/2316", "percentage": "65.63%", "elapsed_time": "1h 48m 55s", "remaining_time": "57m 2s"} |
| {"loss": 0.10905037, "token_acc": 0.95820722, "grad_norm": 0.88016807, "learning_rate": 2.86e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232238, "epoch": 1.97346278, "global_step/max_steps": "1525/2316", "percentage": "65.85%", "elapsed_time": "1h 49m 18s", "remaining_time": "56m 41s"} |
| {"loss": 0.14443563, "token_acc": 0.94925047, "grad_norm": 0.92729274, "learning_rate": 2.83e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232207, "epoch": 1.97993528, "global_step/max_steps": "1530/2316", "percentage": "66.06%", "elapsed_time": "1h 49m 40s", "remaining_time": "56m 20s"} |
| {"loss": 0.13352565, "token_acc": 0.95220212, "grad_norm": 1.33532484, "learning_rate": 2.8e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232195, "epoch": 1.98640777, "global_step/max_steps": "1535/2316", "percentage": "66.28%", "elapsed_time": "1h 50m 2s", "remaining_time": "55m 59s"} |
| {"loss": 0.13129565, "token_acc": 0.94669949, "grad_norm": 1.21642995, "learning_rate": 2.77e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232184, "epoch": 1.99288026, "global_step/max_steps": "1540/2316", "percentage": "66.49%", "elapsed_time": "1h 50m 24s", "remaining_time": "55m 38s"} |
| {"loss": 0.1243582, "token_acc": 0.95788055, "grad_norm": 1.22622749, "learning_rate": 2.74e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232206, "epoch": 1.99935275, "global_step/max_steps": "1545/2316", "percentage": "66.71%", "elapsed_time": "1h 50m 45s", "remaining_time": "55m 16s"} |
| {"loss": 0.07365645, "token_acc": 0.97649, "grad_norm": 0.92890312, "learning_rate": 2.7e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232279, "epoch": 2.00517799, "global_step/max_steps": "1550/2316", "percentage": "66.93%", "elapsed_time": "1h 51m 4s", "remaining_time": "54m 53s"} |
| {"loss": 0.0711202, "token_acc": 0.9690823, "grad_norm": 1.30272945, "learning_rate": 2.67e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232338, "epoch": 2.01165049, "global_step/max_steps": "1555/2316", "percentage": "67.14%", "elapsed_time": "1h 51m 24s", "remaining_time": "54m 31s"} |
| {"loss": 0.06058176, "token_acc": 0.96315611, "grad_norm": 1.11602349, "learning_rate": 2.64e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232252, "epoch": 2.01812298, "global_step/max_steps": "1560/2316", "percentage": "67.36%", "elapsed_time": "1h 51m 48s", "remaining_time": "54m 11s"} |
| {"loss": 0.05537449, "token_acc": 0.98565551, "grad_norm": 1.37237662, "learning_rate": 2.61e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232266, "epoch": 2.02459547, "global_step/max_steps": "1565/2316", "percentage": "67.57%", "elapsed_time": "1h 52m 9s", "remaining_time": "53m 49s"} |
| {"loss": 0.07059065, "token_acc": 0.97395428, "grad_norm": 1.1127424, "learning_rate": 2.58e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232328, "epoch": 2.03106796, "global_step/max_steps": "1570/2316", "percentage": "67.79%", "elapsed_time": "1h 52m 29s", "remaining_time": "53m 27s"} |
| {"loss": 0.04989112, "token_acc": 0.97591436, "grad_norm": 1.05181141, "learning_rate": 2.55e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232285, "epoch": 2.03754045, "global_step/max_steps": "1575/2316", "percentage": "68.01%", "elapsed_time": "1h 52m 52s", "remaining_time": "53m 6s"} |
| {"loss": 0.05531135, "token_acc": 0.98617946, "grad_norm": 1.11492627, "learning_rate": 2.52e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232218, "epoch": 2.04401294, "global_step/max_steps": "1580/2316", "percentage": "68.22%", "elapsed_time": "1h 53m 15s", "remaining_time": "52m 45s"} |
| {"loss": 0.07008842, "token_acc": 0.98145941, "grad_norm": 0.99759381, "learning_rate": 2.49e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232159, "epoch": 2.05048544, "global_step/max_steps": "1585/2316", "percentage": "68.44%", "elapsed_time": "1h 53m 39s", "remaining_time": "52m 24s"} |
| {"loss": 0.05895654, "token_acc": 0.96890762, "grad_norm": 1.16681174, "learning_rate": 2.45e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232198, "epoch": 2.05695793, "global_step/max_steps": "1590/2316", "percentage": "68.65%", "elapsed_time": "1h 53m 59s", "remaining_time": "52m 2s"} |
| {"loss": 0.07212085, "token_acc": 0.97545757, "grad_norm": 1.25387299, "learning_rate": 2.42e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232173, "epoch": 2.06343042, "global_step/max_steps": "1595/2316", "percentage": "68.87%", "elapsed_time": "1h 54m 21s", "remaining_time": "51m 41s"} |
| {"loss": 0.07641272, "token_acc": 0.9718516, "grad_norm": 1.12641392, "learning_rate": 2.39e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232179, "epoch": 2.06990291, "global_step/max_steps": "1600/2316", "percentage": "69.08%", "elapsed_time": "1h 54m 43s", "remaining_time": "51m 20s"} |
| {"eval_loss": 0.22962764, "eval_token_acc": 0.91184633, "eval_runtime": 10.3586, "eval_samples_per_second": 5.985, "eval_steps_per_second": 1.545, "epoch": 2.06990291, "global_step/max_steps": "1600/2316", "percentage": "69.08%", "elapsed_time": "1h 54m 53s", "remaining_time": "51m 24s"} |
| {"loss": 0.05252328, "token_acc": 0.98193237, "grad_norm": 1.14544316, "learning_rate": 2.36e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231825, "epoch": 2.0763754, "global_step/max_steps": "1605/2316", "percentage": "69.30%", "elapsed_time": "1h 55m 15s", "remaining_time": "51m 3s"} |
| {"loss": 0.06322978, "token_acc": 0.96972018, "grad_norm": 1.09769542, "learning_rate": 2.33e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23188, "epoch": 2.0828479, "global_step/max_steps": "1610/2316", "percentage": "69.52%", "elapsed_time": "1h 55m 35s", "remaining_time": "50m 41s"} |
| {"loss": 0.05085161, "token_acc": 0.97622148, "grad_norm": 1.02017901, "learning_rate": 2.3e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231923, "epoch": 2.08932039, "global_step/max_steps": "1615/2316", "percentage": "69.73%", "elapsed_time": "1h 55m 55s", "remaining_time": "50m 18s"} |
| {"loss": 0.05541039, "token_acc": 0.97036372, "grad_norm": 0.97338642, "learning_rate": 2.27e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231982, "epoch": 2.09579288, "global_step/max_steps": "1620/2316", "percentage": "69.95%", "elapsed_time": "1h 56m 15s", "remaining_time": "49m 56s"} |
| {"loss": 0.06219807, "token_acc": 0.98845493, "grad_norm": 1.26971864, "learning_rate": 2.24e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231997, "epoch": 2.10226537, "global_step/max_steps": "1625/2316", "percentage": "70.16%", "elapsed_time": "1h 56m 36s", "remaining_time": "49m 34s"} |
| {"loss": 0.05788746, "token_acc": 0.97897007, "grad_norm": 1.19268645, "learning_rate": 2.21e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232016, "epoch": 2.10873786, "global_step/max_steps": "1630/2316", "percentage": "70.38%", "elapsed_time": "1h 56m 57s", "remaining_time": "49m 13s"} |
| {"loss": 0.0689474, "token_acc": 0.97432452, "grad_norm": 1.16416043, "learning_rate": 2.18e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231988, "epoch": 2.11521036, "global_step/max_steps": "1635/2316", "percentage": "70.60%", "elapsed_time": "1h 57m 19s", "remaining_time": "48m 52s"} |
| {"loss": 0.05749773, "token_acc": 0.97991851, "grad_norm": 1.07955589, "learning_rate": 2.15e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231994, "epoch": 2.12168285, "global_step/max_steps": "1640/2316", "percentage": "70.81%", "elapsed_time": "1h 57m 40s", "remaining_time": "48m 30s"} |
| {"loss": 0.06683923, "token_acc": 0.97019195, "grad_norm": 1.22436606, "learning_rate": 2.12e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232017, "epoch": 2.12815534, "global_step/max_steps": "1645/2316", "percentage": "71.03%", "elapsed_time": "1h 58m 1s", "remaining_time": "48m 8s"} |
| {"loss": 0.06786704, "token_acc": 0.97290749, "grad_norm": 1.23819463, "learning_rate": 2.1e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231961, "epoch": 2.13462783, "global_step/max_steps": "1650/2316", "percentage": "71.24%", "elapsed_time": "1h 58m 25s", "remaining_time": "47m 47s"} |
| {"loss": 0.06208003, "token_acc": 0.97347517, "grad_norm": 1.24140345, "learning_rate": 2.07e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231979, "epoch": 2.14110032, "global_step/max_steps": "1655/2316", "percentage": "71.46%", "elapsed_time": "1h 58m 46s", "remaining_time": "47m 26s"} |
| {"loss": 0.06261314, "token_acc": 0.98339483, "grad_norm": 1.17386401, "learning_rate": 2.04e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231969, "epoch": 2.14757282, "global_step/max_steps": "1660/2316", "percentage": "71.68%", "elapsed_time": "1h 59m 7s", "remaining_time": "47m 4s"} |
| {"loss": 0.06931127, "token_acc": 0.97311475, "grad_norm": 1.06529511, "learning_rate": 2.01e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232014, "epoch": 2.15404531, "global_step/max_steps": "1665/2316", "percentage": "71.89%", "elapsed_time": "1h 59m 28s", "remaining_time": "46m 42s"} |
| {"loss": 0.05684927, "token_acc": 0.9760449, "grad_norm": 1.18397411, "learning_rate": 1.98e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232038, "epoch": 2.1605178, "global_step/max_steps": "1670/2316", "percentage": "72.11%", "elapsed_time": "1h 59m 48s", "remaining_time": "46m 20s"} |
| {"loss": 0.06705078, "token_acc": 0.9780211, "grad_norm": 1.2420988, "learning_rate": 1.95e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231991, "epoch": 2.16699029, "global_step/max_steps": "1675/2316", "percentage": "72.32%", "elapsed_time": "2h 0m 11s", "remaining_time": "45m 59s"} |
| {"loss": 0.0680685, "token_acc": 0.97530171, "grad_norm": 1.20868509, "learning_rate": 1.92e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231979, "epoch": 2.17346278, "global_step/max_steps": "1680/2316", "percentage": "72.54%", "elapsed_time": "2h 0m 33s", "remaining_time": "45m 38s"} |
| {"loss": 0.06323795, "token_acc": 0.97718062, "grad_norm": 1.19282921, "learning_rate": 1.9e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23194, "epoch": 2.17993528, "global_step/max_steps": "1685/2316", "percentage": "72.75%", "elapsed_time": "2h 0m 56s", "remaining_time": "45m 17s"} |
| {"loss": 0.06180158, "token_acc": 0.9703268, "grad_norm": 1.13938066, "learning_rate": 1.87e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23196, "epoch": 2.18640777, "global_step/max_steps": "1690/2316", "percentage": "72.97%", "elapsed_time": "2h 1m 17s", "remaining_time": "44m 55s"} |
| {"loss": 0.05491001, "token_acc": 0.96770954, "grad_norm": 1.03108583, "learning_rate": 1.84e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231969, "epoch": 2.19288026, "global_step/max_steps": "1695/2316", "percentage": "73.19%", "elapsed_time": "2h 1m 38s", "remaining_time": "44m 34s"} |
| {"loss": 0.05857166, "token_acc": 0.96354315, "grad_norm": 1.2798691, "learning_rate": 1.81e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231927, "epoch": 2.19935275, "global_step/max_steps": "1700/2316", "percentage": "73.40%", "elapsed_time": "2h 2m 1s", "remaining_time": "44m 13s"} |
| {"loss": 0.07229179, "token_acc": 0.97516319, "grad_norm": 1.10503993, "learning_rate": 1.79e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231975, "epoch": 2.20582524, "global_step/max_steps": "1705/2316", "percentage": "73.62%", "elapsed_time": "2h 2m 21s", "remaining_time": "43m 50s"} |
| {"loss": 0.04233477, "token_acc": 0.98684775, "grad_norm": 1.99740346, "learning_rate": 1.76e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232014, "epoch": 2.21229773, "global_step/max_steps": "1710/2316", "percentage": "73.83%", "elapsed_time": "2h 2m 42s", "remaining_time": "43m 29s"} |
| {"loss": 0.06760261, "token_acc": 0.97423115, "grad_norm": 1.2668605, "learning_rate": 1.73e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231999, "epoch": 2.21877023, "global_step/max_steps": "1715/2316", "percentage": "74.05%", "elapsed_time": "2h 3m 4s", "remaining_time": "43m 7s"} |
| {"loss": 0.0463111, "token_acc": 0.97904522, "grad_norm": 1.04937158, "learning_rate": 1.7e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232023, "epoch": 2.22524272, "global_step/max_steps": "1720/2316", "percentage": "74.27%", "elapsed_time": "2h 3m 24s", "remaining_time": "42m 45s"} |
| {"loss": 0.05172126, "token_acc": 0.98218003, "grad_norm": 1.23434514, "learning_rate": 1.68e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232065, "epoch": 2.23171521, "global_step/max_steps": "1725/2316", "percentage": "74.48%", "elapsed_time": "2h 3m 45s", "remaining_time": "42m 23s"} |
| {"loss": 0.05147182, "token_acc": 0.97163067, "grad_norm": 1.21551266, "learning_rate": 1.65e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23211, "epoch": 2.2381877, "global_step/max_steps": "1730/2316", "percentage": "74.70%", "elapsed_time": "2h 4m 5s", "remaining_time": "42m 1s"} |
| {"loss": 0.0570636, "token_acc": 0.97976006, "grad_norm": 1.17468274, "learning_rate": 1.62e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23213, "epoch": 2.24466019, "global_step/max_steps": "1735/2316", "percentage": "74.91%", "elapsed_time": "2h 4m 26s", "remaining_time": "41m 40s"} |
| {"loss": 0.06071429, "token_acc": 0.96690616, "grad_norm": 1.04532639, "learning_rate": 1.6e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232175, "epoch": 2.25113269, "global_step/max_steps": "1740/2316", "percentage": "75.13%", "elapsed_time": "2h 4m 46s", "remaining_time": "41m 18s"} |
| {"loss": 0.05594822, "token_acc": 0.98317252, "grad_norm": 1.10269206, "learning_rate": 1.57e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23217, "epoch": 2.25760518, "global_step/max_steps": "1745/2316", "percentage": "75.35%", "elapsed_time": "2h 5m 7s", "remaining_time": "40m 56s"} |
| {"loss": 0.06535891, "token_acc": 0.96459392, "grad_norm": 1.13438346, "learning_rate": 1.55e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232233, "epoch": 2.26407767, "global_step/max_steps": "1750/2316", "percentage": "75.56%", "elapsed_time": "2h 5m 27s", "remaining_time": "40m 34s"} |
| {"loss": 0.05375389, "token_acc": 0.97076173, "grad_norm": 0.95231049, "learning_rate": 1.52e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232218, "epoch": 2.27055016, "global_step/max_steps": "1755/2316", "percentage": "75.78%", "elapsed_time": "2h 5m 49s", "remaining_time": "40m 13s"} |
| {"loss": 0.06480455, "token_acc": 0.96646174, "grad_norm": 1.10312869, "learning_rate": 1.49e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232172, "epoch": 2.27702265, "global_step/max_steps": "1760/2316", "percentage": "75.99%", "elapsed_time": "2h 6m 12s", "remaining_time": "39m 52s"} |
| {"loss": 0.05339223, "token_acc": 0.9727481, "grad_norm": 1.23708888, "learning_rate": 1.47e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232244, "epoch": 2.28349515, "global_step/max_steps": "1765/2316", "percentage": "76.21%", "elapsed_time": "2h 6m 31s", "remaining_time": "39m 29s"} |
| {"loss": 0.05288401, "token_acc": 0.98033997, "grad_norm": 1.17376896, "learning_rate": 1.44e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23226, "epoch": 2.28996764, "global_step/max_steps": "1770/2316", "percentage": "76.42%", "elapsed_time": "2h 6m 52s", "remaining_time": "39m 8s"} |
| {"loss": 0.06786959, "token_acc": 0.98269339, "grad_norm": 1.10125274, "learning_rate": 1.42e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232262, "epoch": 2.29644013, "global_step/max_steps": "1775/2316", "percentage": "76.64%", "elapsed_time": "2h 7m 14s", "remaining_time": "38m 46s"} |
| {"loss": 0.05762594, "token_acc": 0.97859224, "grad_norm": 1.07203566, "learning_rate": 1.39e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232355, "epoch": 2.30291262, "global_step/max_steps": "1780/2316", "percentage": "76.86%", "elapsed_time": "2h 7m 32s", "remaining_time": "38m 24s"} |
| {"loss": 0.07335728, "token_acc": 0.95879671, "grad_norm": 1.01552122, "learning_rate": 1.37e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232278, "epoch": 2.30938511, "global_step/max_steps": "1785/2316", "percentage": "77.07%", "elapsed_time": "2h 7m 56s", "remaining_time": "38m 3s"} |
| {"loss": 0.04738302, "token_acc": 0.9750515, "grad_norm": 0.94524227, "learning_rate": 1.35e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232294, "epoch": 2.31585761, "global_step/max_steps": "1790/2316", "percentage": "77.29%", "elapsed_time": "2h 8m 17s", "remaining_time": "37m 41s"} |
| {"loss": 0.05384417, "token_acc": 0.98708182, "grad_norm": 1.04532047, "learning_rate": 1.32e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232289, "epoch": 2.3223301, "global_step/max_steps": "1795/2316", "percentage": "77.50%", "elapsed_time": "2h 8m 39s", "remaining_time": "37m 20s"} |
| {"loss": 0.06021912, "token_acc": 0.97804266, "grad_norm": 1.02121176, "learning_rate": 1.3e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232305, "epoch": 2.32880259, "global_step/max_steps": "1800/2316", "percentage": "77.72%", "elapsed_time": "2h 9m 0s", "remaining_time": "36m 58s"} |
| {"eval_loss": 0.23024005, "eval_token_acc": 0.91284504, "eval_runtime": 10.2529, "eval_samples_per_second": 6.047, "eval_steps_per_second": 1.561, "epoch": 2.32880259, "global_step/max_steps": "1800/2316", "percentage": "77.72%", "elapsed_time": "2h 9m 10s", "remaining_time": "37m 1s"} |
| {"loss": 0.05350653, "token_acc": 0.97715399, "grad_norm": 1.0919965, "learning_rate": 1.27e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232015, "epoch": 2.33527508, "global_step/max_steps": "1805/2316", "percentage": "77.94%", "elapsed_time": "2h 9m 31s", "remaining_time": "36m 40s"} |
| {"loss": 0.04785424, "token_acc": 0.98509892, "grad_norm": 1.39232055, "learning_rate": 1.25e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232039, "epoch": 2.34174757, "global_step/max_steps": "1810/2316", "percentage": "78.15%", "elapsed_time": "2h 9m 52s", "remaining_time": "36m 18s"} |
| {"loss": 0.06161107, "token_acc": 0.97351787, "grad_norm": 1.10697191, "learning_rate": 1.23e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232092, "epoch": 2.34822006, "global_step/max_steps": "1815/2316", "percentage": "78.37%", "elapsed_time": "2h 10m 11s", "remaining_time": "35m 56s"} |
| {"loss": 0.05525978, "token_acc": 0.97093416, "grad_norm": 1.26713391, "learning_rate": 1.2e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232126, "epoch": 2.35469256, "global_step/max_steps": "1820/2316", "percentage": "78.58%", "elapsed_time": "2h 10m 32s", "remaining_time": "35m 34s"} |
| {"loss": 0.0460418, "token_acc": 0.9830721, "grad_norm": 1.10846306, "learning_rate": 1.18e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232147, "epoch": 2.36116505, "global_step/max_steps": "1825/2316", "percentage": "78.80%", "elapsed_time": "2h 10m 53s", "remaining_time": "35m 12s"} |
| {"loss": 0.06369654, "token_acc": 0.97371956, "grad_norm": 1.26479234, "learning_rate": 1.16e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232139, "epoch": 2.36763754, "global_step/max_steps": "1830/2316", "percentage": "79.02%", "elapsed_time": "2h 11m 15s", "remaining_time": "34m 51s"} |
| {"loss": 0.05510446, "token_acc": 0.97686734, "grad_norm": 1.26247179, "learning_rate": 1.13e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232216, "epoch": 2.37411003, "global_step/max_steps": "1835/2316", "percentage": "79.23%", "elapsed_time": "2h 11m 33s", "remaining_time": "34m 29s"} |
| {"loss": 0.06397057, "token_acc": 0.97045472, "grad_norm": 1.27004564, "learning_rate": 1.11e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232186, "epoch": 2.38058252, "global_step/max_steps": "1840/2316", "percentage": "79.45%", "elapsed_time": "2h 11m 56s", "remaining_time": "34m 7s"} |
| {"loss": 0.05866835, "token_acc": 0.96944253, "grad_norm": 1.28177437, "learning_rate": 1.09e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232186, "epoch": 2.38705502, "global_step/max_steps": "1845/2316", "percentage": "79.66%", "elapsed_time": "2h 12m 18s", "remaining_time": "33m 46s"} |
| {"loss": 0.07035577, "token_acc": 0.95597855, "grad_norm": 1.24727197, "learning_rate": 1.07e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232199, "epoch": 2.39352751, "global_step/max_steps": "1850/2316", "percentage": "79.88%", "elapsed_time": "2h 12m 39s", "remaining_time": "33m 24s"} |
| {"loss": 0.05114807, "token_acc": 0.97296365, "grad_norm": 1.13342212, "learning_rate": 1.04e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232168, "epoch": 2.4, "global_step/max_steps": "1855/2316", "percentage": "80.09%", "elapsed_time": "2h 13m 1s", "remaining_time": "33m 3s"} |
| {"loss": 0.04253451, "token_acc": 0.98597319, "grad_norm": 1.08671055, "learning_rate": 1.02e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232245, "epoch": 2.40647249, "global_step/max_steps": "1860/2316", "percentage": "80.31%", "elapsed_time": "2h 13m 20s", "remaining_time": "32m 41s"} |
| {"loss": 0.05450019, "token_acc": 0.98924731, "grad_norm": 1.15752552, "learning_rate": 1e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232276, "epoch": 2.41294498, "global_step/max_steps": "1865/2316", "percentage": "80.53%", "elapsed_time": "2h 13m 41s", "remaining_time": "32m 19s"} |
| {"loss": 0.05493462, "token_acc": 0.9767826, "grad_norm": 1.13323318, "learning_rate": 9.8e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232313, "epoch": 2.41941748, "global_step/max_steps": "1870/2316", "percentage": "80.74%", "elapsed_time": "2h 14m 1s", "remaining_time": "31m 57s"} |
| {"loss": 0.05804875, "token_acc": 0.97368092, "grad_norm": 0.9797051, "learning_rate": 9.6e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232325, "epoch": 2.42588997, "global_step/max_steps": "1875/2316", "percentage": "80.96%", "elapsed_time": "2h 14m 22s", "remaining_time": "31m 36s"} |
| {"loss": 0.04671145, "token_acc": 0.9743099, "grad_norm": 1.25479626, "learning_rate": 9.4e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232385, "epoch": 2.43236246, "global_step/max_steps": "1880/2316", "percentage": "81.17%", "elapsed_time": "2h 14m 41s", "remaining_time": "31m 14s"} |
| {"loss": 0.06558808, "token_acc": 0.98406546, "grad_norm": 1.27901287, "learning_rate": 9.2e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232315, "epoch": 2.43883495, "global_step/max_steps": "1885/2316", "percentage": "81.39%", "elapsed_time": "2h 15m 5s", "remaining_time": "30m 53s"} |
| {"loss": 0.0439234, "token_acc": 0.98061442, "grad_norm": 0.91453797, "learning_rate": 9e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232296, "epoch": 2.44530744, "global_step/max_steps": "1890/2316", "percentage": "81.61%", "elapsed_time": "2h 15m 27s", "remaining_time": "30m 32s"} |
| {"loss": 0.05420974, "token_acc": 0.98049587, "grad_norm": 1.06833885, "learning_rate": 8.8e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232315, "epoch": 2.45177994, "global_step/max_steps": "1895/2316", "percentage": "81.82%", "elapsed_time": "2h 15m 48s", "remaining_time": "30m 10s"} |
| {"loss": 0.06509415, "token_acc": 0.97567314, "grad_norm": 1.21650596, "learning_rate": 8.6e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232359, "epoch": 2.45825243, "global_step/max_steps": "1900/2316", "percentage": "82.04%", "elapsed_time": "2h 16m 8s", "remaining_time": "29m 48s"} |
| {"loss": 0.05637261, "token_acc": 0.97291387, "grad_norm": 1.10046784, "learning_rate": 8.4e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232357, "epoch": 2.46472492, "global_step/max_steps": "1905/2316", "percentage": "82.25%", "elapsed_time": "2h 16m 30s", "remaining_time": "29m 27s"} |
| {"loss": 0.05308201, "token_acc": 0.98477067, "grad_norm": 1.24486985, "learning_rate": 8.2e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232348, "epoch": 2.47119741, "global_step/max_steps": "1910/2316", "percentage": "82.47%", "elapsed_time": "2h 16m 52s", "remaining_time": "29m 5s"} |
| {"loss": 0.05518274, "token_acc": 0.98773915, "grad_norm": 0.91681428, "learning_rate": 8e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232331, "epoch": 2.4776699, "global_step/max_steps": "1915/2316", "percentage": "82.69%", "elapsed_time": "2h 17m 14s", "remaining_time": "28m 44s"} |
| {"loss": 0.06261972, "token_acc": 0.97458227, "grad_norm": 1.37949986, "learning_rate": 7.8e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232323, "epoch": 2.48414239, "global_step/max_steps": "1920/2316", "percentage": "82.90%", "elapsed_time": "2h 17m 36s", "remaining_time": "28m 22s"} |
| {"loss": 0.04601987, "token_acc": 0.98776078, "grad_norm": 0.98705123, "learning_rate": 7.6e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232312, "epoch": 2.49061489, "global_step/max_steps": "1925/2316", "percentage": "83.12%", "elapsed_time": "2h 17m 58s", "remaining_time": "28m 1s"} |
| {"loss": 0.06714773, "token_acc": 0.98049887, "grad_norm": 1.16223751, "learning_rate": 7.4e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23232, "epoch": 2.49708738, "global_step/max_steps": "1930/2316", "percentage": "83.33%", "elapsed_time": "2h 18m 19s", "remaining_time": "27m 39s"} |
| {"loss": 0.05411076, "token_acc": 0.97645335, "grad_norm": 1.0925193, "learning_rate": 7.2e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232324, "epoch": 2.50355987, "global_step/max_steps": "1935/2316", "percentage": "83.55%", "elapsed_time": "2h 18m 40s", "remaining_time": "27m 18s"} |
| {"loss": 0.04667757, "token_acc": 0.98369508, "grad_norm": 0.9869283, "learning_rate": 7e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232378, "epoch": 2.51003236, "global_step/max_steps": "1940/2316", "percentage": "83.77%", "elapsed_time": "2h 19m 0s", "remaining_time": "26m 56s"} |
| {"loss": 0.04229389, "token_acc": 0.98330789, "grad_norm": 1.03846054, "learning_rate": 6.9e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23244, "epoch": 2.51650485, "global_step/max_steps": "1945/2316", "percentage": "83.98%", "elapsed_time": "2h 19m 19s", "remaining_time": "26m 34s"} |
| {"loss": 0.04936951, "token_acc": 0.9805124, "grad_norm": 1.07021118, "learning_rate": 6.7e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232418, "epoch": 2.52297735, "global_step/max_steps": "1950/2316", "percentage": "84.20%", "elapsed_time": "2h 19m 41s", "remaining_time": "26m 13s"} |
| {"loss": 0.05218223, "token_acc": 0.98357611, "grad_norm": 1.17736613, "learning_rate": 6.5e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232431, "epoch": 2.52944984, "global_step/max_steps": "1955/2316", "percentage": "84.41%", "elapsed_time": "2h 20m 2s", "remaining_time": "25m 51s"} |
| {"loss": 0.05572572, "token_acc": 0.97487437, "grad_norm": 1.29332759, "learning_rate": 6.3e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232436, "epoch": 2.53592233, "global_step/max_steps": "1960/2316", "percentage": "84.63%", "elapsed_time": "2h 20m 24s", "remaining_time": "25m 30s"} |
| {"loss": 0.05939957, "token_acc": 0.97640818, "grad_norm": 1.21222379, "learning_rate": 6.2e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232422, "epoch": 2.54239482, "global_step/max_steps": "1965/2316", "percentage": "84.84%", "elapsed_time": "2h 20m 46s", "remaining_time": "25m 8s"} |
| {"loss": 0.05654957, "token_acc": 0.97012493, "grad_norm": 1.3082934, "learning_rate": 6e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232486, "epoch": 2.54886731, "global_step/max_steps": "1970/2316", "percentage": "85.06%", "elapsed_time": "2h 21m 5s", "remaining_time": "24m 46s"} |
| {"loss": 0.04402643, "token_acc": 0.98410933, "grad_norm": 1.20439615, "learning_rate": 5.8e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232451, "epoch": 2.55533981, "global_step/max_steps": "1975/2316", "percentage": "85.28%", "elapsed_time": "2h 21m 28s", "remaining_time": "24m 25s"} |
| {"loss": 0.05042751, "token_acc": 0.98690543, "grad_norm": 1.05419312, "learning_rate": 5.6e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232477, "epoch": 2.5618123, "global_step/max_steps": "1980/2316", "percentage": "85.49%", "elapsed_time": "2h 21m 48s", "remaining_time": "24m 3s"} |
| {"loss": 0.07950358, "token_acc": 0.96932431, "grad_norm": 1.33024361, "learning_rate": 5.5e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232421, "epoch": 2.56828479, "global_step/max_steps": "1985/2316", "percentage": "85.71%", "elapsed_time": "2h 22m 12s", "remaining_time": "23m 42s"} |
| {"loss": 0.05211693, "token_acc": 0.97732662, "grad_norm": 1.10541385, "learning_rate": 5.3e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232428, "epoch": 2.57475728, "global_step/max_steps": "1990/2316", "percentage": "85.92%", "elapsed_time": "2h 22m 33s", "remaining_time": "23m 21s"} |
| {"loss": 0.0444499, "token_acc": 0.97924227, "grad_norm": 0.99568134, "learning_rate": 5.2e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232445, "epoch": 2.58122977, "global_step/max_steps": "1995/2316", "percentage": "86.14%", "elapsed_time": "2h 22m 54s", "remaining_time": "22m 59s"} |
| {"loss": 0.05526681, "token_acc": 0.97542176, "grad_norm": 1.26071559, "learning_rate": 5e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232475, "epoch": 2.58770227, "global_step/max_steps": "2000/2316", "percentage": "86.36%", "elapsed_time": "2h 23m 14s", "remaining_time": "22m 37s"} |
| {"eval_loss": 0.2284326, "eval_token_acc": 0.91310932, "eval_runtime": 10.3467, "eval_samples_per_second": 5.992, "eval_steps_per_second": 1.546, "epoch": 2.58770227, "global_step/max_steps": "2000/2316", "percentage": "86.36%", "elapsed_time": "2h 23m 25s", "remaining_time": "22m 39s"} |
| {"loss": 0.06419377, "token_acc": 0.98810044, "grad_norm": 0.98823023, "learning_rate": 4.9e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231349, "epoch": 2.59417476, "global_step/max_steps": "2005/2316", "percentage": "86.57%", "elapsed_time": "2h 24m 18s", "remaining_time": "22m 23s"} |
| {"loss": 0.04595627, "token_acc": 0.98058762, "grad_norm": 1.35178612, "learning_rate": 4.7e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23139, "epoch": 2.60064725, "global_step/max_steps": "2010/2316", "percentage": "86.79%", "elapsed_time": "2h 24m 38s", "remaining_time": "22m 1s"} |
| {"loss": 0.05577208, "token_acc": 0.98751549, "grad_norm": 1.16841039, "learning_rate": 4.5e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231412, "epoch": 2.60711974, "global_step/max_steps": "2015/2316", "percentage": "87.00%", "elapsed_time": "2h 24m 59s", "remaining_time": "21m 39s"} |
| {"loss": 0.05177082, "token_acc": 0.97929297, "grad_norm": 1.09357776, "learning_rate": 4.4e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231423, "epoch": 2.61359223, "global_step/max_steps": "2020/2316", "percentage": "87.22%", "elapsed_time": "2h 25m 20s", "remaining_time": "21m 17s"} |
| {"loss": 0.05546314, "token_acc": 0.96841194, "grad_norm": 1.1416835, "learning_rate": 4.3e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231415, "epoch": 2.62006472, "global_step/max_steps": "2025/2316", "percentage": "87.44%", "elapsed_time": "2h 25m 42s", "remaining_time": "20m 56s"} |
| {"loss": 0.05987669, "token_acc": 0.98102608, "grad_norm": 1.19735088, "learning_rate": 4.1e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231407, "epoch": 2.62653722, "global_step/max_steps": "2030/2316", "percentage": "87.65%", "elapsed_time": "2h 26m 4s", "remaining_time": "20m 34s"} |
| {"loss": 0.06473002, "token_acc": 0.97879032, "grad_norm": 1.07338827, "learning_rate": 4e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231404, "epoch": 2.63300971, "global_step/max_steps": "2035/2316", "percentage": "87.87%", "elapsed_time": "2h 26m 25s", "remaining_time": "20m 13s"} |
| {"loss": 0.05041903, "token_acc": 0.97339754, "grad_norm": 1.12016612, "learning_rate": 3.8e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231412, "epoch": 2.6394822, "global_step/max_steps": "2040/2316", "percentage": "88.08%", "elapsed_time": "2h 26m 47s", "remaining_time": "19m 51s"} |
| {"loss": 0.05965894, "token_acc": 0.95979827, "grad_norm": 1.34770464, "learning_rate": 3.7e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231412, "epoch": 2.64595469, "global_step/max_steps": "2045/2316", "percentage": "88.30%", "elapsed_time": "2h 27m 8s", "remaining_time": "19m 29s"} |
| {"loss": 0.06632623, "token_acc": 0.97342216, "grad_norm": 1.03658282, "learning_rate": 3.6e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231417, "epoch": 2.65242718, "global_step/max_steps": "2050/2316", "percentage": "88.51%", "elapsed_time": "2h 27m 30s", "remaining_time": "19m 8s"} |
| {"loss": 0.04067239, "token_acc": 0.98153479, "grad_norm": 1.06117225, "learning_rate": 3.4e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231426, "epoch": 2.65889968, "global_step/max_steps": "2055/2316", "percentage": "88.73%", "elapsed_time": "2h 27m 51s", "remaining_time": "18m 46s"} |
| {"loss": 0.06558018, "token_acc": 0.95664988, "grad_norm": 1.02351899, "learning_rate": 3.3e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231359, "epoch": 2.66537217, "global_step/max_steps": "2060/2316", "percentage": "88.95%", "elapsed_time": "2h 28m 15s", "remaining_time": "18m 25s"} |
| {"loss": 0.05222757, "token_acc": 0.98260084, "grad_norm": 1.16396578, "learning_rate": 3.2e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231423, "epoch": 2.67184466, "global_step/max_steps": "2065/2316", "percentage": "89.16%", "elapsed_time": "2h 28m 34s", "remaining_time": "18m 3s"} |
| {"loss": 0.05125296, "token_acc": 0.98124721, "grad_norm": 1.0395275, "learning_rate": 3.1e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231439, "epoch": 2.67831715, "global_step/max_steps": "2070/2316", "percentage": "89.38%", "elapsed_time": "2h 28m 55s", "remaining_time": "17m 41s"} |
| {"loss": 0.05001325, "token_acc": 0.98309238, "grad_norm": 1.29197274, "learning_rate": 2.9e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231497, "epoch": 2.68478964, "global_step/max_steps": "2075/2316", "percentage": "89.59%", "elapsed_time": "2h 29m 15s", "remaining_time": "17m 20s"} |
| {"loss": 0.04461967, "token_acc": 0.98833735, "grad_norm": 1.08738674, "learning_rate": 2.8e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231573, "epoch": 2.69126214, "global_step/max_steps": "2080/2316", "percentage": "89.81%", "elapsed_time": "2h 29m 33s", "remaining_time": "16m 58s"} |
| {"loss": 0.06092172, "token_acc": 0.97115662, "grad_norm": 1.20832174, "learning_rate": 2.7e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231591, "epoch": 2.69773463, "global_step/max_steps": "2085/2316", "percentage": "90.03%", "elapsed_time": "2h 29m 54s", "remaining_time": "16m 36s"} |
| {"loss": 0.05340697, "token_acc": 0.97921749, "grad_norm": 1.12697922, "learning_rate": 2.6e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231573, "epoch": 2.70420712, "global_step/max_steps": "2090/2316", "percentage": "90.24%", "elapsed_time": "2h 30m 17s", "remaining_time": "16m 15s"} |
| {"loss": 0.05033125, "token_acc": 0.9759762, "grad_norm": 0.98447738, "learning_rate": 2.5e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231611, "epoch": 2.71067961, "global_step/max_steps": "2095/2316", "percentage": "90.46%", "elapsed_time": "2h 30m 37s", "remaining_time": "15m 53s"} |
| {"loss": 0.04627192, "token_acc": 0.98179095, "grad_norm": 1.31664219, "learning_rate": 2.4e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231665, "epoch": 2.7171521, "global_step/max_steps": "2100/2316", "percentage": "90.67%", "elapsed_time": "2h 30m 56s", "remaining_time": "15m 31s"} |
| {"loss": 0.04924712, "token_acc": 0.977447, "grad_norm": 1.06134864, "learning_rate": 2.3e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231699, "epoch": 2.7236246, "global_step/max_steps": "2105/2316", "percentage": "90.89%", "elapsed_time": "2h 31m 16s", "remaining_time": "15m 9s"} |
| {"loss": 0.05652419, "token_acc": 0.98957247, "grad_norm": 0.86405789, "learning_rate": 2.1e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231691, "epoch": 2.73009709, "global_step/max_steps": "2110/2316", "percentage": "91.11%", "elapsed_time": "2h 31m 38s", "remaining_time": "14m 48s"} |
| {"loss": 0.05103685, "token_acc": 0.9784312, "grad_norm": 1.26685352, "learning_rate": 2e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231721, "epoch": 2.73656958, "global_step/max_steps": "2115/2316", "percentage": "91.32%", "elapsed_time": "2h 31m 59s", "remaining_time": "14m 26s"} |
| {"loss": 0.06472486, "token_acc": 0.97591362, "grad_norm": 1.1767006, "learning_rate": 1.9e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231688, "epoch": 2.74304207, "global_step/max_steps": "2120/2316", "percentage": "91.54%", "elapsed_time": "2h 32m 22s", "remaining_time": "14m 5s"} |
| {"loss": 0.05363949, "token_acc": 0.98568548, "grad_norm": 1.06163196, "learning_rate": 1.8e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231719, "epoch": 2.74951456, "global_step/max_steps": "2125/2316", "percentage": "91.75%", "elapsed_time": "2h 32m 42s", "remaining_time": "13m 43s"} |
| {"loss": 0.05469687, "token_acc": 0.96159237, "grad_norm": 0.98991535, "learning_rate": 1.8e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231722, "epoch": 2.75598706, "global_step/max_steps": "2130/2316", "percentage": "91.97%", "elapsed_time": "2h 33m 3s", "remaining_time": "13m 21s"} |
| {"loss": 0.06133481, "token_acc": 0.97562924, "grad_norm": 1.13283288, "learning_rate": 1.7e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231665, "epoch": 2.76245955, "global_step/max_steps": "2135/2316", "percentage": "92.18%", "elapsed_time": "2h 33m 27s", "remaining_time": "13m 0s"} |
| {"loss": 0.04211564, "token_acc": 0.97762742, "grad_norm": 1.02180684, "learning_rate": 1.6e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231679, "epoch": 2.76893204, "global_step/max_steps": "2140/2316", "percentage": "92.40%", "elapsed_time": "2h 33m 48s", "remaining_time": "12m 38s"} |
| {"loss": 0.07040737, "token_acc": 0.9612553, "grad_norm": 1.3145747, "learning_rate": 1.5e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231677, "epoch": 2.77540453, "global_step/max_steps": "2145/2316", "percentage": "92.62%", "elapsed_time": "2h 34m 10s", "remaining_time": "12m 17s"} |
| {"loss": 0.04796244, "token_acc": 0.98442831, "grad_norm": 1.04346431, "learning_rate": 1.4e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231728, "epoch": 2.78187702, "global_step/max_steps": "2150/2316", "percentage": "92.83%", "elapsed_time": "2h 34m 29s", "remaining_time": "11m 55s"} |
| {"loss": 0.04958099, "token_acc": 0.98188913, "grad_norm": 1.13238582, "learning_rate": 1.3e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231737, "epoch": 2.78834951, "global_step/max_steps": "2155/2316", "percentage": "93.05%", "elapsed_time": "2h 34m 51s", "remaining_time": "11m 34s"} |
| {"loss": 0.05162687, "token_acc": 0.98539232, "grad_norm": 0.82735816, "learning_rate": 1.2e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231767, "epoch": 2.79482201, "global_step/max_steps": "2160/2316", "percentage": "93.26%", "elapsed_time": "2h 35m 11s", "remaining_time": "11m 12s"} |
| {"loss": 0.05173174, "token_acc": 0.97926507, "grad_norm": 1.06918062, "learning_rate": 1.2e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231745, "epoch": 2.8012945, "global_step/max_steps": "2165/2316", "percentage": "93.48%", "elapsed_time": "2h 35m 33s", "remaining_time": "10m 51s"} |
| {"loss": 0.05220184, "token_acc": 0.97534797, "grad_norm": 1.10112961, "learning_rate": 1.1e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23172, "epoch": 2.80776699, "global_step/max_steps": "2170/2316", "percentage": "93.70%", "elapsed_time": "2h 35m 56s", "remaining_time": "10m 29s"} |
| {"loss": 0.05935395, "token_acc": 0.98451499, "grad_norm": 1.20234043, "learning_rate": 1e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231749, "epoch": 2.81423948, "global_step/max_steps": "2175/2316", "percentage": "93.91%", "elapsed_time": "2h 36m 16s", "remaining_time": "10m 7s"} |
| {"loss": 0.04429291, "token_acc": 0.98108227, "grad_norm": 1.24831991, "learning_rate": 9e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231769, "epoch": 2.82071197, "global_step/max_steps": "2180/2316", "percentage": "94.13%", "elapsed_time": "2h 36m 37s", "remaining_time": "9m 46s"} |
| {"loss": 0.05107999, "token_acc": 0.9747603, "grad_norm": 0.96460204, "learning_rate": 9e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.2318, "epoch": 2.82718447, "global_step/max_steps": "2185/2316", "percentage": "94.34%", "elapsed_time": "2h 36m 57s", "remaining_time": "9m 24s"} |
| {"loss": 0.0401224, "token_acc": 0.98442084, "grad_norm": 1.04166724, "learning_rate": 8e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231835, "epoch": 2.83365696, "global_step/max_steps": "2190/2316", "percentage": "94.56%", "elapsed_time": "2h 37m 18s", "remaining_time": "9m 3s"} |
| {"loss": 0.03888007, "token_acc": 0.98951182, "grad_norm": 1.02043447, "learning_rate": 7e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231873, "epoch": 2.84012945, "global_step/max_steps": "2195/2316", "percentage": "94.78%", "elapsed_time": "2h 37m 38s", "remaining_time": "8m 41s"} |
| {"loss": 0.05567454, "token_acc": 0.98152392, "grad_norm": 1.24309182, "learning_rate": 7e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231813, "epoch": 2.84660194, "global_step/max_steps": "2200/2316", "percentage": "94.99%", "elapsed_time": "2h 38m 2s", "remaining_time": "8m 19s"} |
| {"eval_loss": 0.23267488, "eval_token_acc": 0.91228659, "eval_runtime": 10.6735, "eval_samples_per_second": 5.809, "eval_steps_per_second": 1.499, "epoch": 2.84660194, "global_step/max_steps": "2200/2316", "percentage": "94.99%", "elapsed_time": "2h 38m 12s", "remaining_time": "8m 20s"} |
| {"loss": 0.04770828, "token_acc": 0.97810031, "grad_norm": 1.12258122, "learning_rate": 6e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231565, "epoch": 2.85307443, "global_step/max_steps": "2205/2316", "percentage": "95.21%", "elapsed_time": "2h 38m 33s", "remaining_time": "7m 58s"} |
| {"loss": 0.06230595, "token_acc": 0.98645366, "grad_norm": 1.08873923, "learning_rate": 6e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231557, "epoch": 2.85954693, "global_step/max_steps": "2210/2316", "percentage": "95.42%", "elapsed_time": "2h 38m 55s", "remaining_time": "7m 37s"} |
| {"loss": 0.04867231, "token_acc": 0.98562898, "grad_norm": 1.29144863, "learning_rate": 5e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231567, "epoch": 2.86601942, "global_step/max_steps": "2215/2316", "percentage": "95.64%", "elapsed_time": "2h 39m 17s", "remaining_time": "7m 15s"} |
| {"loss": 0.04508602, "token_acc": 0.97552131, "grad_norm": 1.17556888, "learning_rate": 5e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231609, "epoch": 2.87249191, "global_step/max_steps": "2220/2316", "percentage": "95.85%", "elapsed_time": "2h 39m 36s", "remaining_time": "6m 54s"} |
| {"loss": 0.05770103, "token_acc": 0.96978702, "grad_norm": 1.16297953, "learning_rate": 4e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231671, "epoch": 2.8789644, "global_step/max_steps": "2225/2316", "percentage": "96.07%", "elapsed_time": "2h 39m 55s", "remaining_time": "6m 32s"} |
| {"loss": 0.05874813, "token_acc": 0.98259901, "grad_norm": 0.94242967, "learning_rate": 4e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231672, "epoch": 2.88543689, "global_step/max_steps": "2230/2316", "percentage": "96.29%", "elapsed_time": "2h 40m 17s", "remaining_time": "6m 10s"} |
| {"loss": 0.06532167, "token_acc": 0.95626982, "grad_norm": 1.09061389, "learning_rate": 3e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231666, "epoch": 2.89190939, "global_step/max_steps": "2235/2316", "percentage": "96.50%", "elapsed_time": "2h 40m 39s", "remaining_time": "5m 49s"} |
| {"loss": 0.07255517, "token_acc": 0.9790121, "grad_norm": 1.16835225, "learning_rate": 3e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231666, "epoch": 2.89838188, "global_step/max_steps": "2240/2316", "percentage": "96.72%", "elapsed_time": "2h 41m 0s", "remaining_time": "5m 27s"} |
| {"loss": 0.04564666, "token_acc": 0.98750801, "grad_norm": 1.1098126, "learning_rate": 3e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231662, "epoch": 2.90485437, "global_step/max_steps": "2245/2316", "percentage": "96.93%", "elapsed_time": "2h 41m 22s", "remaining_time": "5m 6s"} |
| {"loss": 0.05291151, "token_acc": 0.97715668, "grad_norm": 1.14879776, "learning_rate": 2e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231623, "epoch": 2.91132686, "global_step/max_steps": "2250/2316", "percentage": "97.15%", "elapsed_time": "2h 41m 45s", "remaining_time": "4m 44s"} |
| {"loss": 0.04553242, "token_acc": 0.98566351, "grad_norm": 1.20887869, "learning_rate": 2e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231605, "epoch": 2.91779935, "global_step/max_steps": "2255/2316", "percentage": "97.37%", "elapsed_time": "2h 42m 8s", "remaining_time": "4m 23s"} |
| {"loss": 0.05101571, "token_acc": 0.97548194, "grad_norm": 1.08378851, "learning_rate": 2e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231638, "epoch": 2.92427184, "global_step/max_steps": "2260/2316", "percentage": "97.58%", "elapsed_time": "2h 42m 28s", "remaining_time": "4m 1s"} |
| {"loss": 0.05651815, "token_acc": 0.97313761, "grad_norm": 1.24759984, "learning_rate": 1e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231608, "epoch": 2.93074434, "global_step/max_steps": "2265/2316", "percentage": "97.80%", "elapsed_time": "2h 42m 51s", "remaining_time": "3m 40s"} |
| {"loss": 0.05204303, "token_acc": 0.97807018, "grad_norm": 1.24430321, "learning_rate": 1e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231621, "epoch": 2.93721683, "global_step/max_steps": "2270/2316", "percentage": "98.01%", "elapsed_time": "2h 43m 12s", "remaining_time": "3m 18s"} |
| {"loss": 0.05655676, "token_acc": 0.96548783, "grad_norm": 1.09449267, "learning_rate": 1e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23159, "epoch": 2.94368932, "global_step/max_steps": "2275/2316", "percentage": "98.23%", "elapsed_time": "2h 43m 35s", "remaining_time": "2m 56s"} |
| {"loss": 0.05090644, "token_acc": 0.97978669, "grad_norm": 1.09287083, "learning_rate": 1e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231594, "epoch": 2.95016181, "global_step/max_steps": "2280/2316", "percentage": "98.45%", "elapsed_time": "2h 43m 56s", "remaining_time": "2m 35s"} |
| {"loss": 0.04956932, "token_acc": 0.97643025, "grad_norm": 1.10229907, "learning_rate": 0.0, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231609, "epoch": 2.9566343, "global_step/max_steps": "2285/2316", "percentage": "98.66%", "elapsed_time": "2h 44m 17s", "remaining_time": "2m 13s"} |
| {"loss": 0.05385318, "token_acc": 0.9727327, "grad_norm": 0.98491843, "learning_rate": 0.0, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231571, "epoch": 2.9631068, "global_step/max_steps": "2290/2316", "percentage": "98.88%", "elapsed_time": "2h 44m 40s", "remaining_time": "1m 52s"} |
| {"loss": 0.05933799, "token_acc": 0.97737099, "grad_norm": 1.19731529, "learning_rate": 0.0, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231527, "epoch": 2.96957929, "global_step/max_steps": "2295/2316", "percentage": "99.09%", "elapsed_time": "2h 45m 4s", "remaining_time": "1m 30s"} |
| {"loss": 0.05716931, "token_acc": 0.9713254, "grad_norm": 1.43661603, "learning_rate": 0.0, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231553, "epoch": 2.97605178, "global_step/max_steps": "2300/2316", "percentage": "99.31%", "elapsed_time": "2h 45m 24s", "remaining_time": "1m 9s"} |
| {"loss": 0.04889261, "token_acc": 0.9822542, "grad_norm": 1.08358372, "learning_rate": 0.0, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231535, "epoch": 2.98252427, "global_step/max_steps": "2305/2316", "percentage": "99.53%", "elapsed_time": "2h 45m 47s", "remaining_time": "47s"} |
| {"loss": 0.0531967, "token_acc": 0.9798741, "grad_norm": 1.08408436, "learning_rate": 0.0, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23154, "epoch": 2.98899676, "global_step/max_steps": "2310/2316", "percentage": "99.74%", "elapsed_time": "2h 46m 8s", "remaining_time": "25s"} |
| {"loss": 0.04757577, "token_acc": 0.98493664, "grad_norm": 1.23433447, "learning_rate": 0.0, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231555, "epoch": 2.99546926, "global_step/max_steps": "2315/2316", "percentage": "99.96%", "elapsed_time": "2h 46m 29s", "remaining_time": "4s"} |
| {"eval_loss": 0.22719234, "eval_token_acc": 0.91350989, "eval_runtime": 10.2297, "eval_samples_per_second": 6.061, "eval_steps_per_second": 1.564, "epoch": 2.99676375, "global_step/max_steps": "2316/2316", "percentage": "100.00%", "elapsed_time": "2h 46m 45s", "remaining_time": "0s"} |
| {"train_runtime": 10035.8195, "train_samples_per_second": 1.848, "train_steps_per_second": 0.231, "total_flos": 6.192887594095739e+17, "train_loss": 0.15794229, "epoch": 2.99676375, "global_step/max_steps": "2316/2316", "percentage": "100.00%", "elapsed_time": "2h 47m 15s", "remaining_time": "0s"} |
| {"model_parameter_info": "InternVLChatModel: 7944.3738M Params (7612.8210M Trainable [95.8266%]), 0.0001M Buffers.", "last_model_checkpoint": "/workspace/shinannan/R1-Multimodal-Journey-main/ms-swift-main/examples/train/full/output/InternVL3-8B-6243/v1-20250829-210708/checkpoint-2316", "best_model_checkpoint": null, "best_metric": 0.22171998, "global_step": 2316, "log_history": [{"loss": 0.5599430799484253, "token_acc": 0.8187683284457478, "grad_norm": 3.8709128968577815, "learning_rate": 8.620689655172414e-08, "memory(GiB)": 49.34, "train_speed(iter/s)": 0.052629, "epoch": 0.0012944983818770227, "step": 1}, {"loss": 0.5759873390197754, "token_acc": 0.8348104644954618, "grad_norm": 4.16459690137374, "learning_rate": 4.3103448275862073e-07, "memory(GiB)": 53.11, "train_speed(iter/s)": 0.133884, "epoch": 0.006472491909385114, "step": 5}, {"loss": 0.5336678504943848, "token_acc": 0.832579185520362, "grad_norm": 5.05690583577044, "learning_rate": 8.620689655172415e-07, "memory(GiB)": 53.11, "train_speed(iter/s)": 0.174693, "epoch": 0.012944983818770227, "step": 10}, {"loss": 0.5171878814697266, "token_acc": 0.8389742772955324, "grad_norm": 3.2786460329864133, "learning_rate": 1.2931034482758623e-06, "memory(GiB)": 53.11, "train_speed(iter/s)": 0.189679, "epoch": 0.019417475728155338, "step": 15}, {"loss": 0.43119244575500487, "token_acc": 0.8549978911851539, "grad_norm": 2.5733953444817366, "learning_rate": 1.724137931034483e-06, "memory(GiB)": 53.11, "train_speed(iter/s)": 0.199795, "epoch": 0.025889967637540454, "step": 20}, {"loss": 0.3780667781829834, "token_acc": 0.8734521051370137, "grad_norm": 2.259423628996772, "learning_rate": 2.1551724137931035e-06, "memory(GiB)": 53.11, "train_speed(iter/s)": 0.206297, "epoch": 0.032362459546925564, "step": 25}, {"loss": 0.36746361255645754, "token_acc": 0.8728649818378545, "grad_norm": 2.098534377749257, "learning_rate": 2.5862068965517246e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.208609, "epoch": 0.038834951456310676, "step": 30}, {"loss": 0.3591838121414185, "token_acc": 0.8734720845721837, "grad_norm": 1.8321855620545004, "learning_rate": 3.017241379310345e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.211384, "epoch": 0.045307443365695796, "step": 35}, {"loss": 0.3115516185760498, "token_acc": 0.8992139737991266, "grad_norm": 1.6745461102208596, "learning_rate": 3.448275862068966e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.214329, "epoch": 0.05177993527508091, "step": 40}, {"loss": 0.2846154451370239, "token_acc": 0.9119182746878547, "grad_norm": 1.5535918576557464, "learning_rate": 3.8793103448275865e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.218575, "epoch": 0.05825242718446602, "step": 45}, {"loss": 0.25164244174957273, "token_acc": 0.9087658017298735, "grad_norm": 1.6496264970987704, "learning_rate": 4.310344827586207e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.22195, "epoch": 0.06472491909385113, "step": 50}, {"loss": 0.2654105663299561, "token_acc": 0.8859727769174341, "grad_norm": 2.3224437344009217, "learning_rate": 4.741379310344828e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.222751, "epoch": 0.07119741100323625, "step": 55}, {"loss": 0.3140704870223999, "token_acc": 0.8996243425995493, "grad_norm": 1.6129107205316084, "learning_rate": 5.172413793103449e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.221038, "epoch": 0.07766990291262135, "step": 60}, {"loss": 0.27332029342651365, "token_acc": 0.9170760463745333, "grad_norm": 1.6312159340620462, "learning_rate": 5.603448275862069e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.22247, "epoch": 0.08414239482200647, "step": 65}, {"loss": 0.2529634475708008, "token_acc": 0.9036530836075255, "grad_norm": 1.8302245360724219, "learning_rate": 6.03448275862069e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.224848, "epoch": 0.09061488673139159, "step": 70}, {"loss": 0.27155389785766604, "token_acc": 0.9106392152635551, "grad_norm": 1.823393247577574, "learning_rate": 6.465517241379311e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.228013, "epoch": 0.0970873786407767, "step": 75}, {"loss": 0.29560997486114504, "token_acc": 0.8881587680870835, "grad_norm": 1.8940369250028737, "learning_rate": 6.896551724137932e-06, "memory(GiB)": 56.78, "train_speed(iter/s)": 0.22905, "epoch": 0.10355987055016182, "step": 80}, {"loss": 0.3033888339996338, "token_acc": 0.8929712460063898, "grad_norm": 1.8450171345929887, "learning_rate": 7.327586206896552e-06, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.228957, "epoch": 0.11003236245954692, "step": 85}, {"loss": 0.26382591724395754, "token_acc": 0.8878342687355563, "grad_norm": 1.6825494839786577, "learning_rate": 7.758620689655173e-06, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.228605, "epoch": 0.11650485436893204, "step": 90}, {"loss": 0.2791297435760498, "token_acc": 0.8955745895788723, "grad_norm": 1.587233988658457, "learning_rate": 8.189655172413794e-06, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.229698, "epoch": 0.12297734627831715, "step": 95}, {"loss": 0.2634185791015625, "token_acc": 0.8982752012265236, "grad_norm": 1.47320176704239, "learning_rate": 8.620689655172414e-06, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.230764, "epoch": 0.12944983818770225, "step": 100}, {"loss": 0.29945352077484133, "token_acc": 0.9002697148728487, "grad_norm": 1.6175130155194632, "learning_rate": 9.051724137931036e-06, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.231825, "epoch": 0.13592233009708737, "step": 105}, {"loss": 0.2908186912536621, "token_acc": 0.8840480274442538, "grad_norm": 1.5612005537543736, "learning_rate": 9.482758620689655e-06, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.231911, "epoch": 0.1423948220064725, "step": 110}, {"loss": 0.28914780616760255, "token_acc": 0.9106958399849752, "grad_norm": 1.800251525603444, "learning_rate": 9.913793103448277e-06, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.232002, "epoch": 0.1488673139158576, "step": 115}, {"loss": 0.30170316696166993, "token_acc": 0.8924744897959184, "grad_norm": 1.6814028976955682, "learning_rate": 9.999918433243253e-06, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.231998, "epoch": 0.1553398058252427, "step": 120}, {"loss": 0.33611745834350587, "token_acc": 0.8709655818936655, "grad_norm": 1.7512976937369131, "learning_rate": 9.999587072854989e-06, "memory(GiB)": 69.66, "train_speed(iter/s)": 0.232224, "epoch": 0.16181229773462782, "step": 125}, {"loss": 0.2784709453582764, "token_acc": 0.8772520626368076, "grad_norm": 1.6993733657274217, "learning_rate": 9.99900083779239e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232968, "epoch": 0.16828478964401294, "step": 130}, {"loss": 0.2921304702758789, "token_acc": 0.8930959356922846, "grad_norm": 1.2584455626591011, "learning_rate": 9.998159757941219e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232797, "epoch": 0.17475728155339806, "step": 135}, {"loss": 0.28781125545501707, "token_acc": 0.8916292424353972, "grad_norm": 1.4501672889282144, "learning_rate": 9.997063876179007e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.233664, "epoch": 0.18122977346278318, "step": 140}, {"loss": 0.30176615715026855, "token_acc": 0.8640170474255414, "grad_norm": 1.7447308006491287, "learning_rate": 9.99571324837287e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.234057, "epoch": 0.18770226537216828, "step": 145}, {"loss": 0.29514493942260744, "token_acc": 0.908291154495059, "grad_norm": 1.5781990655181752, "learning_rate": 9.994107943376654e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.234734, "epoch": 0.1941747572815534, "step": 150}, {"loss": 0.27290375232696534, "token_acc": 0.9101006594932315, "grad_norm": 1.5293337685199968, "learning_rate": 9.992248043027441e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.23464, "epoch": 0.20064724919093851, "step": 155}, {"loss": 0.2685299634933472, "token_acc": 0.896059291395517, "grad_norm": 1.863140772042864, "learning_rate": 9.990133642141359e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.235317, "epoch": 0.20711974110032363, "step": 160}, {"loss": 0.3076282501220703, "token_acc": 0.9101801884203786, "grad_norm": 1.5438972679781442, "learning_rate": 9.987764848508756e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.234947, "epoch": 0.21359223300970873, "step": 165}, {"loss": 0.2814058542251587, "token_acc": 0.9249365272105089, "grad_norm": 1.4491769579655331, "learning_rate": 9.985141782888705e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.235827, "epoch": 0.22006472491909385, "step": 170}, {"loss": 0.3198812961578369, "token_acc": 0.8805363899399066, "grad_norm": 1.3463378796994598, "learning_rate": 9.982264579002853e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.235301, "epoch": 0.22653721682847897, "step": 175}, {"loss": 0.2987515449523926, "token_acc": 0.9175456650373038, "grad_norm": 1.5249125641029049, "learning_rate": 9.979133383528591e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.235286, "epoch": 0.23300970873786409, "step": 180}, {"loss": 0.29140524864196776, "token_acc": 0.9022440527785803, "grad_norm": 1.498091667469487, "learning_rate": 9.975748356091589e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.234933, "epoch": 0.23948220064724918, "step": 185}, {"loss": 0.26933846473693845, "token_acc": 0.9010537595999285, "grad_norm": 1.5316300109592675, "learning_rate": 9.972109669257645e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.235065, "epoch": 0.2459546925566343, "step": 190}, {"loss": 0.3108851671218872, "token_acc": 0.8871067242442936, "grad_norm": 1.242384148365128, "learning_rate": 9.968217508523913e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.234661, "epoch": 0.2524271844660194, "step": 195}, {"loss": 0.27449755668640136, "token_acc": 0.8796514040669525, "grad_norm": 1.4126825621288357, "learning_rate": 9.964072072309412e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.23488, "epoch": 0.2588996763754045, "step": 200}, {"eval_loss": 0.27725470066070557, "eval_token_acc": 0.8901746650064543, "eval_runtime": 10.3443, "eval_samples_per_second": 5.994, "eval_steps_per_second": 1.547, "epoch": 0.2588996763754045, "step": 200}, {"loss": 0.2807853937149048, "token_acc": 0.8999287386745394, "grad_norm": 1.6333590627868821, "learning_rate": 9.959673571944939e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232257, "epoch": 0.26537216828478966, "step": 205}, {"loss": 0.273319149017334, "token_acc": 0.8980536659108088, "grad_norm": 1.4820924955727979, "learning_rate": 9.955022231662282e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.23236, "epoch": 0.27184466019417475, "step": 210}, {"loss": 0.3193963527679443, "token_acc": 0.872057795385691, "grad_norm": 1.600138080815179, "learning_rate": 9.95011828858279e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232461, "epoch": 0.2783171521035599, "step": 215}, {"loss": 0.26338605880737304, "token_acc": 0.900831024930748, "grad_norm": 1.28522314338427, "learning_rate": 9.944961992705288e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232653, "epoch": 0.284789644012945, "step": 220}, {"loss": 0.270632266998291, "token_acc": 0.91425360878209, "grad_norm": 1.379118055551948, "learning_rate": 9.939553606893334e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232782, "epoch": 0.2912621359223301, "step": 225}, {"loss": 0.28856477737426756, "token_acc": 0.8967241986615005, "grad_norm": 1.6617546535345866, "learning_rate": 9.933893406861808e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232492, "epoch": 0.2977346278317152, "step": 230}, {"loss": 0.2756298780441284, "token_acc": 0.8799606721487307, "grad_norm": 1.3437271168265839, "learning_rate": 9.927981681162873e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232117, "epoch": 0.3042071197411003, "step": 235}, {"loss": 0.2676517486572266, "token_acc": 0.9235738421784934, "grad_norm": 1.298981235773768, "learning_rate": 9.921818731171249e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.231934, "epoch": 0.3106796116504854, "step": 240}, {"loss": 0.2863819122314453, "token_acc": 0.9013575387581332, "grad_norm": 1.4465284245396064, "learning_rate": 9.915404871068855e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.23203, "epoch": 0.31715210355987056, "step": 245}, {"loss": 0.26107254028320315, "token_acc": 0.9041967541288339, "grad_norm": 1.2271639468880504, "learning_rate": 9.9087404278288e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232057, "epoch": 0.32362459546925565, "step": 250}, {"loss": 0.27872638702392577, "token_acc": 0.8997663363145597, "grad_norm": 1.3366406114353129, "learning_rate": 9.901825741198697e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232188, "epoch": 0.3300970873786408, "step": 255}, {"loss": 0.2565271854400635, "token_acc": 0.9212052991601004, "grad_norm": 1.3036528730249315, "learning_rate": 9.894661163683361e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232057, "epoch": 0.3365695792880259, "step": 260}, {"loss": 0.2748678684234619, "token_acc": 0.9049442135200175, "grad_norm": 1.5139625286754728, "learning_rate": 9.887247060526827e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232252, "epoch": 0.343042071197411, "step": 265}, {"loss": 0.27570619583129885, "token_acc": 0.8877067414643582, "grad_norm": 1.4878958033068537, "learning_rate": 9.879583809693737e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232779, "epoch": 0.34951456310679613, "step": 270}, {"loss": 0.29062609672546386, "token_acc": 0.9058222898109928, "grad_norm": 1.322297236239471, "learning_rate": 9.871671801850065e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232879, "epoch": 0.3559870550161812, "step": 275}, {"loss": 0.2528913736343384, "token_acc": 0.9018886198547216, "grad_norm": 1.366766918034962, "learning_rate": 9.863511440343206e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.233138, "epoch": 0.36245954692556637, "step": 280}, {"loss": 0.2971771717071533, "token_acc": 0.9053704023484718, "grad_norm": 1.2865643066020156, "learning_rate": 9.855103141181412e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.233263, "epoch": 0.36893203883495146, "step": 285}, {"loss": 0.28815407752990724, "token_acc": 0.8978319531031916, "grad_norm": 1.5538932067193103, "learning_rate": 9.846447333012587e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232784, "epoch": 0.37540453074433655, "step": 290}, {"loss": 0.2924394369125366, "token_acc": 0.893630472577841, "grad_norm": 1.2105231596837065, "learning_rate": 9.837544457102428e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.23252, "epoch": 0.3818770226537217, "step": 295}, {"loss": 0.249862003326416, "token_acc": 0.883170192611304, "grad_norm": 1.4907306933193507, "learning_rate": 9.82839496731194e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232702, "epoch": 0.3883495145631068, "step": 300}, {"loss": 0.24675424098968507, "token_acc": 0.9081675392670157, "grad_norm": 1.4256650626834904, "learning_rate": 9.818999330074288e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.232717, "epoch": 0.3948220064724919, "step": 305}, {"loss": 0.24478938579559326, "token_acc": 0.9111747851002865, "grad_norm": 1.260514868497486, "learning_rate": 9.809358024371025e-06, "memory(GiB)": 74.09, "train_speed(iter/s)": 0.233036, "epoch": 0.40129449838187703, "step": 310}, {"loss": 0.26903295516967773, "token_acc": 0.8958300301252576, "grad_norm": 1.2564895833829968, "learning_rate": 9.799471541707672e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232977, "epoch": 0.4077669902912621, "step": 315}, {"loss": 0.26741886138916016, "token_acc": 0.8915273692517397, "grad_norm": 1.2300684456189985, "learning_rate": 9.789340386088663e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232759, "epoch": 0.41423948220064727, "step": 320}, {"loss": 0.25241305828094485, "token_acc": 0.9132342406876791, "grad_norm": 1.122258771482236, "learning_rate": 9.778965073991652e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.233061, "epoch": 0.42071197411003236, "step": 325}, {"loss": 0.26438729763031005, "token_acc": 0.909702315325248, "grad_norm": 1.3609327541423577, "learning_rate": 9.768346134341174e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.233038, "epoch": 0.42718446601941745, "step": 330}, {"loss": 0.2775770664215088, "token_acc": 0.8971353155810884, "grad_norm": 1.4011242535190545, "learning_rate": 9.757484108481695e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.233241, "epoch": 0.4336569579288026, "step": 335}, {"loss": 0.24376158714294432, "token_acc": 0.8950718685831622, "grad_norm": 1.5137416698958326, "learning_rate": 9.74637955015001e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.233146, "epoch": 0.4401294498381877, "step": 340}, {"loss": 0.2627729892730713, "token_acc": 0.9035292347053955, "grad_norm": 1.4799951419060189, "learning_rate": 9.735033025447e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.233165, "epoch": 0.44660194174757284, "step": 345}, {"loss": 0.2503339767456055, "token_acc": 0.8914871002029181, "grad_norm": 1.2671923974660513, "learning_rate": 9.723445112808802e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.233204, "epoch": 0.45307443365695793, "step": 350}, {"loss": 0.288763427734375, "token_acc": 0.8827799520262594, "grad_norm": 1.433200437436853, "learning_rate": 9.71161640297729e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232949, "epoch": 0.459546925566343, "step": 355}, {"loss": 0.29701597690582277, "token_acc": 0.8609205776173285, "grad_norm": 1.1164499690912304, "learning_rate": 9.699547498969978e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232653, "epoch": 0.46601941747572817, "step": 360}, {"loss": 0.2769495487213135, "token_acc": 0.8857654938213376, "grad_norm": 1.3438941124281905, "learning_rate": 9.687239016049275e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232896, "epoch": 0.47249190938511326, "step": 365}, {"loss": 0.23632426261901857, "token_acc": 0.9198928332217012, "grad_norm": 1.3300087206835718, "learning_rate": 9.674691581691114e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232997, "epoch": 0.47896440129449835, "step": 370}, {"loss": 0.2574438571929932, "token_acc": 0.8945592879701407, "grad_norm": 1.3248802355641385, "learning_rate": 9.661905835552974e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.23284, "epoch": 0.4854368932038835, "step": 375}, {"loss": 0.2657890558242798, "token_acc": 0.9064993276557598, "grad_norm": 1.3822408218041264, "learning_rate": 9.648882429441258e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232721, "epoch": 0.4919093851132686, "step": 380}, {"loss": 0.24774408340454102, "token_acc": 0.897964796479648, "grad_norm": 1.191924601708995, "learning_rate": 9.635622027278076e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232675, "epoch": 0.49838187702265374, "step": 385}, {"loss": 0.2514677047729492, "token_acc": 0.9042553191489362, "grad_norm": 1.261015741946281, "learning_rate": 9.622125305067394e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232724, "epoch": 0.5048543689320388, "step": 390}, {"loss": 0.2625349283218384, "token_acc": 0.886435331230284, "grad_norm": 1.3184480707163528, "learning_rate": 9.608392950860568e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232872, "epoch": 0.511326860841424, "step": 395}, {"loss": 0.2518771648406982, "token_acc": 0.9022133392553112, "grad_norm": 1.2491542116194823, "learning_rate": 9.594425664721275e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.233366, "epoch": 0.517799352750809, "step": 400}, {"eval_loss": 0.2646785080432892, "eval_token_acc": 0.8956689561219277, "eval_runtime": 10.6017, "eval_samples_per_second": 5.848, "eval_steps_per_second": 1.509, "epoch": 0.517799352750809, "step": 400}, {"loss": 0.29769234657287597, "token_acc": 0.8998516899539458, "grad_norm": 1.372454059823598, "learning_rate": 9.580224158689821e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231481, "epoch": 0.5242718446601942, "step": 405}, {"loss": 0.26252963542938235, "token_acc": 0.9091469523002235, "grad_norm": 1.1760488368205386, "learning_rate": 9.565789156746843e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231702, "epoch": 0.5307443365695793, "step": 410}, {"loss": 0.30316572189331054, "token_acc": 0.8825894094815636, "grad_norm": 1.2293878491584167, "learning_rate": 9.551121394776395e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231606, "epoch": 0.5372168284789643, "step": 415}, {"loss": 0.23727922439575194, "token_acc": 0.9050139475001788, "grad_norm": 1.1747928276092237, "learning_rate": 9.536221620528442e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231719, "epoch": 0.5436893203883495, "step": 420}, {"loss": 0.2797443628311157, "token_acc": 0.9093942764688038, "grad_norm": 1.2558854512527236, "learning_rate": 9.521090593580737e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232035, "epoch": 0.5501618122977346, "step": 425}, {"loss": 0.24871361255645752, "token_acc": 0.8862821561104473, "grad_norm": 1.1691641667897708, "learning_rate": 9.505729085300098e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232068, "epoch": 0.5566343042071198, "step": 430}, {"loss": 0.301029896736145, "token_acc": 0.8772819472616633, "grad_norm": 1.342652328467868, "learning_rate": 9.490137878803078e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231983, "epoch": 0.5631067961165048, "step": 435}, {"loss": 0.2231980800628662, "token_acc": 0.9137016681130075, "grad_norm": 1.3016041952991328, "learning_rate": 9.47431776891606e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231904, "epoch": 0.56957928802589, "step": 440}, {"loss": 0.2684764385223389, "token_acc": 0.896626599457154, "grad_norm": 1.325068332892662, "learning_rate": 9.458269562134717e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231773, "epoch": 0.5760517799352751, "step": 445}, {"loss": 0.2613205909729004, "token_acc": 0.9001219774700437, "grad_norm": 1.7654202433688764, "learning_rate": 9.441994076582907e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231888, "epoch": 0.5825242718446602, "step": 450}, {"loss": 0.21109428405761718, "token_acc": 0.935930735930736, "grad_norm": 1.0363934440332732, "learning_rate": 9.425492141970973e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.231986, "epoch": 0.5889967637540453, "step": 455}, {"loss": 0.30587315559387207, "token_acc": 0.889386189258312, "grad_norm": 1.2655221271322739, "learning_rate": 9.408764599553429e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.23216, "epoch": 0.5954692556634305, "step": 460}, {"loss": 0.2870975971221924, "token_acc": 0.889927465789277, "grad_norm": 1.2600598133379974, "learning_rate": 9.391812302086088e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232118, "epoch": 0.6019417475728155, "step": 465}, {"loss": 0.23429493904113768, "token_acc": 0.9091884161601717, "grad_norm": 1.1667739382057893, "learning_rate": 9.374636113782576e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232319, "epoch": 0.6084142394822006, "step": 470}, {"loss": 0.2740490436553955, "token_acc": 0.899316927107701, "grad_norm": 1.5122845832311997, "learning_rate": 9.357236910270292e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232384, "epoch": 0.6148867313915858, "step": 475}, {"loss": 0.2753365755081177, "token_acc": 0.8880798274002157, "grad_norm": 1.2088912472887026, "learning_rate": 9.339615578545753e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232403, "epoch": 0.6213592233009708, "step": 480}, {"loss": 0.24256644248962403, "token_acc": 0.900580703841041, "grad_norm": 1.3148346580882295, "learning_rate": 9.321773016929382e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232507, "epoch": 0.627831715210356, "step": 485}, {"loss": 0.263807487487793, "token_acc": 0.8988332821614983, "grad_norm": 1.227821763874487, "learning_rate": 9.30371013501972e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232519, "epoch": 0.6343042071197411, "step": 490}, {"loss": 0.25248773097991944, "token_acc": 0.8900277804387393, "grad_norm": 1.2818837985643752, "learning_rate": 9.285427853647038e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232881, "epoch": 0.6407766990291263, "step": 495}, {"loss": 0.2566992282867432, "token_acc": 0.9067370973328714, "grad_norm": 1.1576728453088951, "learning_rate": 9.26692710482641e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.232861, "epoch": 0.6472491909385113, "step": 500}, {"loss": 0.2731386661529541, "token_acc": 0.9059369655509406, "grad_norm": 1.448463882343857, "learning_rate": 9.248208831710195e-06, "memory(GiB)": 74.3, "train_speed(iter/s)": 0.233046, "epoch": 0.6537216828478964, "step": 505}, {"loss": 0.2660601854324341, "token_acc": 0.8996882577069623, "grad_norm": 1.2167337860696599, "learning_rate": 9.229273988539951e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232906, "epoch": 0.6601941747572816, "step": 510}, {"loss": 0.2788745641708374, "token_acc": 0.9031883703884681, "grad_norm": 1.239341561905042, "learning_rate": 9.210123540597792e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232953, "epoch": 0.6666666666666666, "step": 515}, {"loss": 0.2791329622268677, "token_acc": 0.8930017351069983, "grad_norm": 1.144924477915443, "learning_rate": 9.190758464157184e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.233085, "epoch": 0.6731391585760518, "step": 520}, {"loss": 0.240252685546875, "token_acc": 0.8949115044247787, "grad_norm": 1.4588502496680564, "learning_rate": 9.171179746433164e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232972, "epoch": 0.6796116504854369, "step": 525}, {"loss": 0.2502749443054199, "token_acc": 0.922168382798304, "grad_norm": 1.1138631923256865, "learning_rate": 9.151388385532022e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232859, "epoch": 0.686084142394822, "step": 530}, {"loss": 0.2617876768112183, "token_acc": 0.8910549389049529, "grad_norm": 1.297432018769172, "learning_rate": 9.131385390400417e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.233065, "epoch": 0.6925566343042071, "step": 535}, {"loss": 0.24454011917114257, "token_acc": 0.9177814938684504, "grad_norm": 1.1759018148466631, "learning_rate": 9.111171780773938e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.23299, "epoch": 0.6990291262135923, "step": 540}, {"loss": 0.2596804857254028, "token_acc": 0.9127298954201226, "grad_norm": 1.1286863694005411, "learning_rate": 9.090748587125118e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232722, "epoch": 0.7055016181229773, "step": 545}, {"loss": 0.2745898962020874, "token_acc": 0.9010889292196007, "grad_norm": 1.2184104245655745, "learning_rate": 9.070116850610911e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.23284, "epoch": 0.7119741100323624, "step": 550}, {"loss": 0.24724988937377929, "token_acc": 0.8962875125421873, "grad_norm": 1.1689205760481578, "learning_rate": 9.049277623019603e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.23287, "epoch": 0.7184466019417476, "step": 555}, {"loss": 0.26168503761291506, "token_acc": 0.9098738581992171, "grad_norm": 1.2275627381454333, "learning_rate": 9.0282319667172e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232862, "epoch": 0.7249190938511327, "step": 560}, {"loss": 0.25820610523223875, "token_acc": 0.9025256816250868, "grad_norm": 1.2171765951467515, "learning_rate": 9.006980954593262e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232978, "epoch": 0.7313915857605178, "step": 565}, {"loss": 0.2563193321228027, "token_acc": 0.8985664854176965, "grad_norm": 1.1919868773965865, "learning_rate": 8.985525670006225e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.233014, "epoch": 0.7378640776699029, "step": 570}, {"loss": 0.2907747745513916, "token_acc": 0.8917782844115133, "grad_norm": 1.4580606165300956, "learning_rate": 8.963867206728147e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232708, "epoch": 0.7443365695792881, "step": 575}, {"loss": 0.24793002605438233, "token_acc": 0.8831261382532267, "grad_norm": 1.254331375894124, "learning_rate": 8.942006668888972e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232797, "epoch": 0.7508090614886731, "step": 580}, {"loss": 0.2363279342651367, "token_acc": 0.8943248532289628, "grad_norm": 1.1276761745123758, "learning_rate": 8.919945170920224e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232902, "epoch": 0.7572815533980582, "step": 585}, {"loss": 0.22642452716827394, "token_acc": 0.9051468606844516, "grad_norm": 1.2634777732005944, "learning_rate": 8.89768383749821e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.23298, "epoch": 0.7637540453074434, "step": 590}, {"loss": 0.24426589012145997, "token_acc": 0.8952461480646373, "grad_norm": 1.2522438035041787, "learning_rate": 8.875223803486674e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.233038, "epoch": 0.7702265372168284, "step": 595}, {"loss": 0.26595754623413087, "token_acc": 0.8918476991357159, "grad_norm": 1.3071288984608462, "learning_rate": 8.852566213878947e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232998, "epoch": 0.7766990291262136, "step": 600}, {"eval_loss": 0.24792228639125824, "eval_token_acc": 0.899487682705583, "eval_runtime": 10.4072, "eval_samples_per_second": 5.957, "eval_steps_per_second": 1.537, "epoch": 0.7766990291262136, "step": 600}, {"loss": 0.2522545576095581, "token_acc": 0.9105672461116194, "grad_norm": 1.1969052567910596, "learning_rate": 8.829712223739574e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232037, "epoch": 0.7831715210355987, "step": 605}, {"loss": 0.24338300228118898, "token_acc": 0.901796973518285, "grad_norm": 1.1271304634124986, "learning_rate": 8.80666299814543e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.231985, "epoch": 0.7896440129449838, "step": 610}, {"loss": 0.2523881673812866, "token_acc": 0.8840726535928793, "grad_norm": 1.1469014638064081, "learning_rate": 8.783419712126335e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232051, "epoch": 0.7961165048543689, "step": 615}, {"loss": 0.22257187366485595, "token_acc": 0.9148889618203697, "grad_norm": 1.4092558066164618, "learning_rate": 8.759983550605132e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232305, "epoch": 0.8025889967637541, "step": 620}, {"loss": 0.2874499559402466, "token_acc": 0.868919575324405, "grad_norm": 1.3286121909742352, "learning_rate": 8.736355708337298e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232151, "epoch": 0.8090614886731392, "step": 625}, {"loss": 0.27193140983581543, "token_acc": 0.8937140925988509, "grad_norm": 1.0820046896525524, "learning_rate": 8.71253738985003e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.2319, "epoch": 0.8155339805825242, "step": 630}, {"loss": 0.2384945869445801, "token_acc": 0.9180067500496327, "grad_norm": 1.2613679308955852, "learning_rate": 8.688529809380843e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.231911, "epoch": 0.8220064724919094, "step": 635}, {"loss": 0.23839797973632812, "token_acc": 0.9094181665969024, "grad_norm": 1.2752637485206202, "learning_rate": 8.66433419081566e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.231945, "epoch": 0.8284789644012945, "step": 640}, {"loss": 0.2149358034133911, "token_acc": 0.9159317211948791, "grad_norm": 1.1841396670281572, "learning_rate": 8.639951767626429e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.231873, "epoch": 0.8349514563106796, "step": 645}, {"loss": 0.2251603126525879, "token_acc": 0.9167982770997847, "grad_norm": 1.1576455610522889, "learning_rate": 8.615383782808238e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.231788, "epoch": 0.8414239482200647, "step": 650}, {"loss": 0.26212186813354493, "token_acc": 0.899803536345776, "grad_norm": 1.1683604947564241, "learning_rate": 8.590631488815945e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.231857, "epoch": 0.8478964401294499, "step": 655}, {"loss": 0.24789061546325683, "token_acc": 0.898496539654761, "grad_norm": 1.362076088006881, "learning_rate": 8.565696147500338e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.231965, "epoch": 0.8543689320388349, "step": 660}, {"loss": 0.21802031993865967, "token_acc": 0.9152542372881356, "grad_norm": 1.0500325475300003, "learning_rate": 8.540579030043795e-06, "memory(GiB)": 75.67, "train_speed(iter/s)": 0.232025, "epoch": 0.86084142394822, "step": 665}, {"loss": 0.2595151424407959, "token_acc": 0.880757008015937, "grad_norm": 1.3118732716027068, "learning_rate": 8.515281416895489e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231837, "epoch": 0.8673139158576052, "step": 670}, {"loss": 0.24524059295654296, "token_acc": 0.8977407847800237, "grad_norm": 1.182516275781166, "learning_rate": 8.48980459770611e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231897, "epoch": 0.8737864077669902, "step": 675}, {"loss": 0.24305639266967774, "token_acc": 0.9114440125154072, "grad_norm": 1.2017539368087242, "learning_rate": 8.464149871262118e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231891, "epoch": 0.8802588996763754, "step": 680}, {"loss": 0.24873006343841553, "token_acc": 0.9021385197571063, "grad_norm": 1.3082423595209687, "learning_rate": 8.43831854541953e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231976, "epoch": 0.8867313915857605, "step": 685}, {"loss": 0.23204641342163085, "token_acc": 0.9144263191469971, "grad_norm": 1.1192510615948026, "learning_rate": 8.412311937037255e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232141, "epoch": 0.8932038834951457, "step": 690}, {"loss": 0.24607748985290528, "token_acc": 0.8984485190409027, "grad_norm": 1.2040229603126178, "learning_rate": 8.386131371909948e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232177, "epoch": 0.8996763754045307, "step": 695}, {"loss": 0.232969331741333, "token_acc": 0.9064289673009421, "grad_norm": 1.2632937805680828, "learning_rate": 8.35977818470044e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232171, "epoch": 0.9061488673139159, "step": 700}, {"loss": 0.21826701164245604, "token_acc": 0.9161490683229814, "grad_norm": 1.3163767711133172, "learning_rate": 8.33325371887168e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232102, "epoch": 0.912621359223301, "step": 705}, {"loss": 0.22841978073120117, "token_acc": 0.9333559628875311, "grad_norm": 1.1988370690402812, "learning_rate": 8.30655932661826e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232182, "epoch": 0.919093851132686, "step": 710}, {"loss": 0.24874770641326904, "token_acc": 0.9114889906256812, "grad_norm": 1.2807141508077682, "learning_rate": 8.279696368797471e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232298, "epoch": 0.9255663430420712, "step": 715}, {"loss": 0.25080385208129885, "token_acc": 0.9136515486099315, "grad_norm": 1.2801995952097518, "learning_rate": 8.252666214859936e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232119, "epoch": 0.9320388349514563, "step": 720}, {"loss": 0.2642188310623169, "token_acc": 0.8956133667138347, "grad_norm": 1.0523379065047156, "learning_rate": 8.225470242779791e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231981, "epoch": 0.9385113268608414, "step": 725}, {"loss": 0.24255902767181398, "token_acc": 0.9007564020778274, "grad_norm": 1.120230545274873, "learning_rate": 8.19810983898444e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232029, "epoch": 0.9449838187702265, "step": 730}, {"loss": 0.24859657287597656, "token_acc": 0.8998031065412383, "grad_norm": 1.2091523492488994, "learning_rate": 8.170586398283878e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232068, "epoch": 0.9514563106796117, "step": 735}, {"loss": 0.2234900712966919, "token_acc": 0.9128746594005449, "grad_norm": 1.1577169986215616, "learning_rate": 8.142901323799578e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232085, "epoch": 0.9579288025889967, "step": 740}, {"loss": 0.2525936126708984, "token_acc": 0.9120560890108215, "grad_norm": 1.0951294827124767, "learning_rate": 8.115056026892965e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232132, "epoch": 0.9644012944983819, "step": 745}, {"loss": 0.21585426330566407, "token_acc": 0.9344628881052722, "grad_norm": 1.1912137461599037, "learning_rate": 8.08705192709347e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232183, "epoch": 0.970873786407767, "step": 750}, {"loss": 0.2186720371246338, "token_acc": 0.8962147959602594, "grad_norm": 1.3924512877504733, "learning_rate": 8.058890452026155e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232175, "epoch": 0.9773462783171522, "step": 755}, {"loss": 0.25070786476135254, "token_acc": 0.9030374820204755, "grad_norm": 1.3223775908107522, "learning_rate": 8.030573037338942e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232096, "epoch": 0.9838187702265372, "step": 760}, {"loss": 0.2548684597015381, "token_acc": 0.9128183889003935, "grad_norm": 1.3614798126921928, "learning_rate": 8.002101126629422e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232229, "epoch": 0.9902912621359223, "step": 765}, {"loss": 0.2389892339706421, "token_acc": 0.8910875539850804, "grad_norm": 1.274952190675227, "learning_rate": 7.973476171371255e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232272, "epoch": 0.9967637540453075, "step": 770}, {"loss": 0.18653585910797119, "token_acc": 0.9303980003845415, "grad_norm": 1.0240895306818407, "learning_rate": 7.94469963084019e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232492, "epoch": 1.002588996763754, "step": 775}, {"loss": 0.15345871448516846, "token_acc": 0.9410023406305934, "grad_norm": 1.4255109014013911, "learning_rate": 7.91577297203966e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232446, "epoch": 1.009061488673139, "step": 780}, {"loss": 0.15263861417770386, "token_acc": 0.9429392900586089, "grad_norm": 1.153571112888121, "learning_rate": 7.886697669625995e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232601, "epoch": 1.0155339805825243, "step": 785}, {"loss": 0.13757938146591187, "token_acc": 0.9438633528452164, "grad_norm": 1.0587789922292525, "learning_rate": 7.857475205833255e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232685, "epoch": 1.0220064724919093, "step": 790}, {"loss": 0.16445313692092894, "token_acc": 0.9351372097486087, "grad_norm": 1.0493108550135073, "learning_rate": 7.828107070397657e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232755, "epoch": 1.0284789644012946, "step": 795}, {"loss": 0.1358490228652954, "token_acc": 0.9681323114158935, "grad_norm": 1.1470196341969017, "learning_rate": 7.798594760481639e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232795, "epoch": 1.0349514563106796, "step": 800}, {"eval_loss": 0.24885323643684387, "eval_token_acc": 0.9029483032474233, "eval_runtime": 10.4415, "eval_samples_per_second": 5.938, "eval_steps_per_second": 1.532, "epoch": 1.0349514563106796, "step": 800}, {"loss": 0.14499139785766602, "token_acc": 0.9449835225192237, "grad_norm": 1.153532348056558, "learning_rate": 7.768939780597523e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232009, "epoch": 1.0414239482200647, "step": 805}, {"loss": 0.13386303186416626, "token_acc": 0.9361719449645852, "grad_norm": 0.9446046835436639, "learning_rate": 7.739143642530833e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232008, "epoch": 1.04789644012945, "step": 810}, {"loss": 0.15911262035369872, "token_acc": 0.9359329140461216, "grad_norm": 1.1796068003277127, "learning_rate": 7.70920786526321e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23215, "epoch": 1.054368932038835, "step": 815}, {"loss": 0.14746062755584716, "token_acc": 0.9457895437009445, "grad_norm": 1.1828836005882588, "learning_rate": 7.679133974894984e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232139, "epoch": 1.06084142394822, "step": 820}, {"loss": 0.14977205991744996, "token_acc": 0.934916086778551, "grad_norm": 1.142494371058509, "learning_rate": 7.648923504567374e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232178, "epoch": 1.0673139158576053, "step": 825}, {"loss": 0.15143678188323975, "token_acc": 0.9446515629480929, "grad_norm": 1.3221027326391486, "learning_rate": 7.618577994384324e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232201, "epoch": 1.0737864077669903, "step": 830}, {"loss": 0.15559604167938232, "token_acc": 0.9357333630091254, "grad_norm": 1.4186846983946861, "learning_rate": 7.588098991334001e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232129, "epoch": 1.0802588996763753, "step": 835}, {"loss": 0.14653240442276, "token_acc": 0.933951415840161, "grad_norm": 1.134209210877182, "learning_rate": 7.557488049209921e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232092, "epoch": 1.0867313915857606, "step": 840}, {"loss": 0.13536107540130615, "token_acc": 0.9408070825612518, "grad_norm": 1.1883032034240089, "learning_rate": 7.52674672853174e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232066, "epoch": 1.0932038834951456, "step": 845}, {"loss": 0.15880248546600342, "token_acc": 0.9374683116444144, "grad_norm": 1.2130757091840871, "learning_rate": 7.495876596465703e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23206, "epoch": 1.0996763754045307, "step": 850}, {"loss": 0.1649766206741333, "token_acc": 0.9181333663857214, "grad_norm": 1.6160764793069753, "learning_rate": 7.464879226744748e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231987, "epoch": 1.106148867313916, "step": 855}, {"loss": 0.17314398288726807, "token_acc": 0.9285664065246432, "grad_norm": 1.0183765365309032, "learning_rate": 7.433756199588282e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231922, "epoch": 1.112621359223301, "step": 860}, {"loss": 0.17320785522460938, "token_acc": 0.9256232401620768, "grad_norm": 1.2590887970407432, "learning_rate": 7.402509101621618e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231941, "epoch": 1.119093851132686, "step": 865}, {"loss": 0.17218265533447266, "token_acc": 0.9199810231675496, "grad_norm": 0.9052923381483162, "learning_rate": 7.371139525795094e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232022, "epoch": 1.1255663430420713, "step": 870}, {"loss": 0.1534191370010376, "token_acc": 0.9431485787144679, "grad_norm": 1.3385105152792978, "learning_rate": 7.3396490713028674e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232218, "epoch": 1.1320388349514563, "step": 875}, {"loss": 0.14459638595581054, "token_acc": 0.9556640227781167, "grad_norm": 1.3169373040829015, "learning_rate": 7.308039343501381e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232248, "epoch": 1.1385113268608413, "step": 880}, {"loss": 0.14696810245513917, "token_acc": 0.9446725740220445, "grad_norm": 0.973670573178615, "learning_rate": 7.276311953827533e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232144, "epoch": 1.1449838187702266, "step": 885}, {"loss": 0.15163915157318114, "token_acc": 0.9432093775262732, "grad_norm": 1.1164624679421524, "learning_rate": 7.244468519716521e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232197, "epoch": 1.1514563106796116, "step": 890}, {"loss": 0.15082130432128907, "token_acc": 0.9530507508078312, "grad_norm": 1.2894412603868977, "learning_rate": 7.212510664519391e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232254, "epoch": 1.1579288025889967, "step": 895}, {"loss": 0.16508399248123168, "token_acc": 0.9284096963239211, "grad_norm": 0.9887491343816041, "learning_rate": 7.180440017420277e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232218, "epoch": 1.164401294498382, "step": 900}, {"loss": 0.15763776302337645, "token_acc": 0.9406015991877141, "grad_norm": 1.3292321383630559, "learning_rate": 7.148258213353347e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23225, "epoch": 1.170873786407767, "step": 905}, {"loss": 0.15624494552612306, "token_acc": 0.9456136007262523, "grad_norm": 1.2367775127353078, "learning_rate": 7.115966892919459e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232188, "epoch": 1.177346278317152, "step": 910}, {"loss": 0.13360332250595092, "token_acc": 0.9382644628099174, "grad_norm": 1.1528050529793377, "learning_rate": 7.083567702302517e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232238, "epoch": 1.1838187702265373, "step": 915}, {"loss": 0.14021142721176147, "token_acc": 0.9515450574340721, "grad_norm": 1.0997942485107082, "learning_rate": 7.05106229318556e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232282, "epoch": 1.1902912621359223, "step": 920}, {"loss": 0.16748379468917846, "token_acc": 0.9340073673485383, "grad_norm": 1.5415964854504864, "learning_rate": 7.018452322666549e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232309, "epoch": 1.1967637540453073, "step": 925}, {"loss": 0.14355828762054443, "token_acc": 0.9570290267501423, "grad_norm": 1.1612875858499718, "learning_rate": 6.985739453173903e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232242, "epoch": 1.2032362459546926, "step": 930}, {"loss": 0.14788196086883545, "token_acc": 0.9401619148187258, "grad_norm": 1.1227909095690538, "learning_rate": 6.9529253523817396e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232318, "epoch": 1.2097087378640776, "step": 935}, {"loss": 0.1230961799621582, "token_acc": 0.9455592716462282, "grad_norm": 1.1382135710927148, "learning_rate": 6.9200116931248575e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232428, "epoch": 1.2161812297734629, "step": 940}, {"loss": 0.14437463283538818, "token_acc": 0.9390468109178334, "grad_norm": 1.0406547530735029, "learning_rate": 6.887000153313468e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232477, "epoch": 1.222653721682848, "step": 945}, {"loss": 0.1648934841156006, "token_acc": 0.9183079163154265, "grad_norm": 1.230561344711952, "learning_rate": 6.853892415847645e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232432, "epoch": 1.229126213592233, "step": 950}, {"loss": 0.16526211500167848, "token_acc": 0.9389301175015461, "grad_norm": 0.8495436775633471, "learning_rate": 6.8206901685315366e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232494, "epoch": 1.2355987055016182, "step": 955}, {"loss": 0.16566269397735595, "token_acc": 0.9397742521114532, "grad_norm": 1.2243055262836056, "learning_rate": 6.787395103987323e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232488, "epoch": 1.2420711974110032, "step": 960}, {"loss": 0.1684507131576538, "token_acc": 0.9349157346019535, "grad_norm": 1.1018311465202173, "learning_rate": 6.754008919568927e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232394, "epoch": 1.2485436893203883, "step": 965}, {"loss": 0.16712919473648072, "token_acc": 0.9455555555555556, "grad_norm": 1.4316385971837047, "learning_rate": 6.72053331727549e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232355, "epoch": 1.2550161812297735, "step": 970}, {"loss": 0.1425323724746704, "token_acc": 0.9238263270942006, "grad_norm": 1.0834559638270733, "learning_rate": 6.686970003664588e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232331, "epoch": 1.2614886731391586, "step": 975}, {"loss": 0.12632758617401124, "token_acc": 0.9650590551181102, "grad_norm": 1.134271480526079, "learning_rate": 6.653320689765257e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232438, "epoch": 1.2679611650485436, "step": 980}, {"loss": 0.14012575149536133, "token_acc": 0.9349439444181272, "grad_norm": 1.6061616087254107, "learning_rate": 6.619587090990748e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232521, "epoch": 1.2744336569579289, "step": 985}, {"loss": 0.1575703501701355, "token_acc": 0.9362990810359232, "grad_norm": 1.1272234809977866, "learning_rate": 6.585770927051085e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232568, "epoch": 1.280906148867314, "step": 990}, {"loss": 0.13624852895736694, "token_acc": 0.9385909734234943, "grad_norm": 1.166690230317881, "learning_rate": 6.551873921865393e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23265, "epoch": 1.287378640776699, "step": 995}, {"loss": 0.1654296636581421, "token_acc": 0.937912933297131, "grad_norm": 1.0920225192557076, "learning_rate": 6.517897803474011e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232624, "epoch": 1.2938511326860842, "step": 1000}, {"eval_loss": 0.23033368587493896, "eval_token_acc": 0.9058734334256143, "eval_runtime": 10.7559, "eval_samples_per_second": 5.764, "eval_steps_per_second": 1.488, "epoch": 1.2938511326860842, "step": 1000}, {"loss": 0.1443455457687378, "token_acc": 0.9504585927562429, "grad_norm": 1.2384941950184332, "learning_rate": 6.483844303950411e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232032, "epoch": 1.3003236245954692, "step": 1005}, {"loss": 0.1442493677139282, "token_acc": 0.9436519764388617, "grad_norm": 1.1440637343331406, "learning_rate": 6.4497151593128795e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232085, "epoch": 1.3067961165048545, "step": 1010}, {"loss": 0.1577550172805786, "token_acc": 0.9429062909567497, "grad_norm": 1.2981805088061613, "learning_rate": 6.415512109436031e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232056, "epoch": 1.3132686084142395, "step": 1015}, {"loss": 0.1420058250427246, "token_acc": 0.9514341218146497, "grad_norm": 1.0221773692371607, "learning_rate": 6.381236897962102e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232063, "epoch": 1.3197411003236246, "step": 1020}, {"loss": 0.1540527582168579, "token_acc": 0.9407475695608448, "grad_norm": 0.9850783716869805, "learning_rate": 6.3468912722120715e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232039, "epoch": 1.3262135922330098, "step": 1025}, {"loss": 0.15107574462890624, "token_acc": 0.950059335443038, "grad_norm": 1.0649795846301677, "learning_rate": 6.312476983096573e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232114, "epoch": 1.3326860841423949, "step": 1030}, {"loss": 0.14106838703155516, "token_acc": 0.9309276354012007, "grad_norm": 0.9400151569393098, "learning_rate": 6.277995785026642e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232116, "epoch": 1.33915857605178, "step": 1035}, {"loss": 0.14803497791290282, "token_acc": 0.944, "grad_norm": 1.4225463030804237, "learning_rate": 6.243449435824276e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232104, "epoch": 1.3456310679611652, "step": 1040}, {"loss": 0.1680329918861389, "token_acc": 0.9148640382583552, "grad_norm": 1.0642204084012346, "learning_rate": 6.2088396966328155e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232031, "epoch": 1.3521035598705502, "step": 1045}, {"loss": 0.14065526723861693, "token_acc": 0.9575244020165183, "grad_norm": 1.0718058230782705, "learning_rate": 6.174168331827179e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232042, "epoch": 1.3585760517799352, "step": 1050}, {"loss": 0.13676613569259644, "token_acc": 0.9587512794268168, "grad_norm": 1.242300630039521, "learning_rate": 6.139437108923898e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232221, "epoch": 1.3650485436893205, "step": 1055}, {"loss": 0.16725906133651733, "token_acc": 0.9485146623364218, "grad_norm": 1.4294949488240984, "learning_rate": 6.1046477984910215e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232263, "epoch": 1.3715210355987055, "step": 1060}, {"loss": 0.14485840797424315, "token_acc": 0.9467247680629745, "grad_norm": 1.1781727139578793, "learning_rate": 6.069802174057849e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232206, "epoch": 1.3779935275080906, "step": 1065}, {"loss": 0.15031464099884034, "token_acc": 0.9437407468333607, "grad_norm": 1.208748067477697, "learning_rate": 6.034902012024521e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232226, "epoch": 1.3844660194174758, "step": 1070}, {"loss": 0.1526108980178833, "token_acc": 0.9473352751318587, "grad_norm": 1.2818500011922347, "learning_rate": 5.999949091571462e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232166, "epoch": 1.3909385113268609, "step": 1075}, {"loss": 0.14637314081192015, "token_acc": 0.9493008751634644, "grad_norm": 1.0984497484397004, "learning_rate": 5.964945194568669e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232314, "epoch": 1.397411003236246, "step": 1080}, {"loss": 0.1500266194343567, "token_acc": 0.9409268375488032, "grad_norm": 1.2333545097158853, "learning_rate": 5.9298921054848826e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232318, "epoch": 1.4038834951456312, "step": 1085}, {"loss": 0.14170310497283936, "token_acc": 0.9446207818242566, "grad_norm": 1.2075543252236138, "learning_rate": 5.894791611296614e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232381, "epoch": 1.4103559870550162, "step": 1090}, {"loss": 0.16042574644088745, "token_acc": 0.938496015936255, "grad_norm": 1.469122543095312, "learning_rate": 5.859645501397048e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232352, "epoch": 1.4168284789644012, "step": 1095}, {"loss": 0.14591469764709472, "token_acc": 0.9461181396195504, "grad_norm": 1.3188490830233008, "learning_rate": 5.824455567504817e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232374, "epoch": 1.4233009708737865, "step": 1100}, {"loss": 0.15474770069122315, "token_acc": 0.9439584735172546, "grad_norm": 1.2605990475448985, "learning_rate": 5.789223603572663e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232379, "epoch": 1.4297734627831715, "step": 1105}, {"loss": 0.1512927770614624, "token_acc": 0.9636459989401166, "grad_norm": 1.2500082306617835, "learning_rate": 5.753951405695981e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232348, "epoch": 1.4362459546925566, "step": 1110}, {"loss": 0.15794019699096679, "token_acc": 0.9297407912687585, "grad_norm": 1.3512066492367167, "learning_rate": 5.7186407720212655e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232319, "epoch": 1.4427184466019418, "step": 1115}, {"loss": 0.13439695835113524, "token_acc": 0.9316413486476472, "grad_norm": 1.3028503860550125, "learning_rate": 5.683293502654429e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23227, "epoch": 1.4491909385113269, "step": 1120}, {"loss": 0.13236558437347412, "token_acc": 0.9469336184274468, "grad_norm": 1.2310236613488197, "learning_rate": 5.647911399569043e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232403, "epoch": 1.455663430420712, "step": 1125}, {"loss": 0.15234293937683105, "token_acc": 0.9460780111444492, "grad_norm": 1.099412036499219, "learning_rate": 5.612496266514468e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232538, "epoch": 1.4621359223300971, "step": 1130}, {"loss": 0.1257845640182495, "token_acc": 0.9515951595159516, "grad_norm": 1.1980156780730131, "learning_rate": 5.577049908923912e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232622, "epoch": 1.4686084142394822, "step": 1135}, {"loss": 0.16113464832305907, "token_acc": 0.9239279197080292, "grad_norm": 1.0399331927453936, "learning_rate": 5.541574133822374e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232519, "epoch": 1.4750809061488672, "step": 1140}, {"loss": 0.12549161911010742, "token_acc": 0.948476834165932, "grad_norm": 1.0775752296962142, "learning_rate": 5.506070749734539e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232612, "epoch": 1.4815533980582525, "step": 1145}, {"loss": 0.15377480983734132, "token_acc": 0.9196021752976337, "grad_norm": 1.2193838758771607, "learning_rate": 5.470541566592573e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232674, "epoch": 1.4880258899676375, "step": 1150}, {"loss": 0.13875941038131714, "token_acc": 0.9348899489497029, "grad_norm": 1.2160990873635522, "learning_rate": 5.434988395643852e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232804, "epoch": 1.4944983818770226, "step": 1155}, {"loss": 0.14159016609191893, "token_acc": 0.9447879474005051, "grad_norm": 1.2396523762974436, "learning_rate": 5.3994130493586385e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232734, "epoch": 1.5009708737864078, "step": 1160}, {"loss": 0.15291476249694824, "token_acc": 0.9428185821849695, "grad_norm": 1.1584534806689348, "learning_rate": 5.363817341337665e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232734, "epoch": 1.5074433656957928, "step": 1165}, {"loss": 0.1519290328025818, "token_acc": 0.9445624146822388, "grad_norm": 1.1188602258955895, "learning_rate": 5.328203086219693e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232643, "epoch": 1.5139158576051779, "step": 1170}, {"loss": 0.13454954624176024, "token_acc": 0.9575027183762232, "grad_norm": 1.2283273481596066, "learning_rate": 5.292572099588998e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232598, "epoch": 1.5203883495145631, "step": 1175}, {"loss": 0.1521994113922119, "token_acc": 0.9292714426802401, "grad_norm": 1.3189493317551466, "learning_rate": 5.2569261978828155e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232589, "epoch": 1.5268608414239482, "step": 1180}, {"loss": 0.16253856420516968, "token_acc": 0.9302079395085067, "grad_norm": 1.2505469447954134, "learning_rate": 5.221267198298738e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232499, "epoch": 1.5333333333333332, "step": 1185}, {"loss": 0.11098604202270508, "token_acc": 0.9666666666666667, "grad_norm": 1.1875983473084128, "learning_rate": 5.185596918702072e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232529, "epoch": 1.5398058252427185, "step": 1190}, {"loss": 0.17014005184173583, "token_acc": 0.9203767123287672, "grad_norm": 1.2603686370864546, "learning_rate": 5.1499171775331754e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232511, "epoch": 1.5462783171521035, "step": 1195}, {"loss": 0.13573466539382933, "token_acc": 0.9516525023607176, "grad_norm": 1.220508238003415, "learning_rate": 5.114229793714749e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232518, "epoch": 1.5527508090614885, "step": 1200}, {"eval_loss": 0.2283361554145813, "eval_token_acc": 0.9079013984676485, "eval_runtime": 11.3314, "eval_samples_per_second": 5.472, "eval_steps_per_second": 1.412, "epoch": 1.5527508090614885, "step": 1200}, {"loss": 0.1296026587486267, "token_acc": 0.9535888763622699, "grad_norm": 1.218085804801381, "learning_rate": 5.078536586559104e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23206, "epoch": 1.5592233009708738, "step": 1205}, {"loss": 0.13594601154327393, "token_acc": 0.9534329452745439, "grad_norm": 1.2364895340781716, "learning_rate": 5.042839375675425e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232154, "epoch": 1.565695792880259, "step": 1210}, {"loss": 0.150376296043396, "token_acc": 0.9446033172644824, "grad_norm": 1.3725891945604562, "learning_rate": 5.0071399808770015e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232222, "epoch": 1.5721682847896439, "step": 1215}, {"loss": 0.13618230819702148, "token_acc": 0.9483706804563736, "grad_norm": 1.11039117692682, "learning_rate": 4.971440222088459e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232205, "epoch": 1.5786407766990291, "step": 1220}, {"loss": 0.15404175519943236, "token_acc": 0.9472070844686649, "grad_norm": 1.089158963241629, "learning_rate": 4.935741919252973e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232166, "epoch": 1.5851132686084144, "step": 1225}, {"loss": 0.15092902183532714, "token_acc": 0.9383414108777598, "grad_norm": 1.0258891554963419, "learning_rate": 4.900046892239507e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232164, "epoch": 1.5915857605177992, "step": 1230}, {"loss": 0.14530941247940063, "token_acc": 0.9523809523809523, "grad_norm": 1.1707391739986897, "learning_rate": 4.864356960750011e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232156, "epoch": 1.5980582524271845, "step": 1235}, {"loss": 0.148117733001709, "token_acc": 0.9448233106013639, "grad_norm": 1.1919822982246309, "learning_rate": 4.828673944226684e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232162, "epoch": 1.6045307443365697, "step": 1240}, {"loss": 0.13772547245025635, "token_acc": 0.9306787703734268, "grad_norm": 1.43746126346075, "learning_rate": 4.792999661759196e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232127, "epoch": 1.6110032362459545, "step": 1245}, {"loss": 0.13388218879699706, "token_acc": 0.9470431240342745, "grad_norm": 1.1035779786852877, "learning_rate": 4.757335931991965e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232131, "epoch": 1.6174757281553398, "step": 1250}, {"loss": 0.13607363700866698, "token_acc": 0.9240804692210711, "grad_norm": 1.0390351323743414, "learning_rate": 4.721684573031447e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232145, "epoch": 1.623948220064725, "step": 1255}, {"loss": 0.1413090467453003, "token_acc": 0.9506976744186046, "grad_norm": 1.1807713743917343, "learning_rate": 4.686047402353433e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232108, "epoch": 1.6304207119741099, "step": 1260}, {"loss": 0.13713672161102294, "token_acc": 0.9517157389497815, "grad_norm": 1.105534462175061, "learning_rate": 4.650426236710421e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232081, "epoch": 1.6368932038834951, "step": 1265}, {"loss": 0.12464081048965454, "token_acc": 0.9563318777292577, "grad_norm": 1.10994833880215, "learning_rate": 4.614822892038974e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232135, "epoch": 1.6433656957928804, "step": 1270}, {"loss": 0.13826615810394288, "token_acc": 0.955327868852459, "grad_norm": 1.0895734560234998, "learning_rate": 4.579239183367166e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23228, "epoch": 1.6498381877022654, "step": 1275}, {"loss": 0.13644169569015502, "token_acc": 0.9542007288486162, "grad_norm": 1.2312710667779252, "learning_rate": 4.543676924722042e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232295, "epoch": 1.6563106796116505, "step": 1280}, {"loss": 0.14990466833114624, "token_acc": 0.9370478350070187, "grad_norm": 1.1355932182164155, "learning_rate": 4.508137929037138e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232353, "epoch": 1.6627831715210357, "step": 1285}, {"loss": 0.14617526531219482, "token_acc": 0.9471614647333497, "grad_norm": 1.095490426676918, "learning_rate": 4.472624008060071e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232352, "epoch": 1.6692556634304208, "step": 1290}, {"loss": 0.15028340816497804, "token_acc": 0.9434147941610628, "grad_norm": 1.069323663082481, "learning_rate": 4.437136972260168e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232394, "epoch": 1.6757281553398058, "step": 1295}, {"loss": 0.15468287467956543, "token_acc": 0.9217774272004207, "grad_norm": 1.2680217694851994, "learning_rate": 4.401678630736172e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232344, "epoch": 1.682200647249191, "step": 1300}, {"loss": 0.16579792499542237, "token_acc": 0.9423521638586059, "grad_norm": 1.1563652809696707, "learning_rate": 4.366250791124017e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232403, "epoch": 1.688673139158576, "step": 1305}, {"loss": 0.1412602424621582, "token_acc": 0.9489098250336474, "grad_norm": 1.1842854951399855, "learning_rate": 4.330855259504676e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232325, "epoch": 1.6951456310679611, "step": 1310}, {"loss": 0.1729203701019287, "token_acc": 0.9132407303685449, "grad_norm": 1.373292611796667, "learning_rate": 4.295493840312087e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232227, "epoch": 1.7016181229773464, "step": 1315}, {"loss": 0.14038983583450318, "token_acc": 0.932392378263938, "grad_norm": 1.0887927621624893, "learning_rate": 4.260168336241169e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232177, "epoch": 1.7080906148867314, "step": 1320}, {"loss": 0.13201141357421875, "token_acc": 0.9498616418500461, "grad_norm": 1.0378516748827575, "learning_rate": 4.224880548155913e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232234, "epoch": 1.7145631067961165, "step": 1325}, {"loss": 0.12792009115219116, "token_acc": 0.9522730302626317, "grad_norm": 1.1886864663492744, "learning_rate": 4.1896322749975885e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232349, "epoch": 1.7210355987055017, "step": 1330}, {"loss": 0.13054893016815186, "token_acc": 0.9433494698017519, "grad_norm": 1.1195745666552135, "learning_rate": 4.154425313693018e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232397, "epoch": 1.7275080906148867, "step": 1335}, {"loss": 0.134224009513855, "token_acc": 0.9440866109360011, "grad_norm": 1.1944037340993543, "learning_rate": 4.119261459062992e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23242, "epoch": 1.7339805825242718, "step": 1340}, {"loss": 0.14994817972183228, "token_acc": 0.9307599345987062, "grad_norm": 1.397424962123841, "learning_rate": 4.084142503730754e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232473, "epoch": 1.740453074433657, "step": 1345}, {"loss": 0.14254910945892335, "token_acc": 0.9527678474704799, "grad_norm": 1.3213514295124362, "learning_rate": 4.049070238030618e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232452, "epoch": 1.746925566343042, "step": 1350}, {"loss": 0.13440340757369995, "token_acc": 0.9406537607108855, "grad_norm": 1.2908266224314828, "learning_rate": 4.014046449916703e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232584, "epoch": 1.7533980582524271, "step": 1355}, {"loss": 0.12804187536239625, "token_acc": 0.9461608775137111, "grad_norm": 1.2438729627207807, "learning_rate": 3.979072924871784e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232609, "epoch": 1.7598705501618124, "step": 1360}, {"loss": 0.1581432342529297, "token_acc": 0.9418493041113422, "grad_norm": 1.3112819668727607, "learning_rate": 3.944151445816265e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232424, "epoch": 1.7663430420711974, "step": 1365}, {"loss": 0.13499727249145507, "token_acc": 0.9346227186052847, "grad_norm": 1.0174205269740582, "learning_rate": 3.909283793017289e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232322, "epoch": 1.7728155339805824, "step": 1370}, {"loss": 0.12530887126922607, "token_acc": 0.9510693952915833, "grad_norm": 1.1098260627803993, "learning_rate": 3.874471743997983e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232379, "epoch": 1.7792880258899677, "step": 1375}, {"loss": 0.11976063251495361, "token_acc": 0.9377458525739696, "grad_norm": 1.2483088074357966, "learning_rate": 3.839717073446842e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232388, "epoch": 1.7857605177993527, "step": 1380}, {"loss": 0.12904412746429444, "token_acc": 0.9531144211238998, "grad_norm": 1.2700397707184905, "learning_rate": 3.80502155312726e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232421, "epoch": 1.7922330097087378, "step": 1385}, {"loss": 0.12810664176940917, "token_acc": 0.949587178241865, "grad_norm": 1.245779324119151, "learning_rate": 3.770386951787193e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232447, "epoch": 1.798705501618123, "step": 1390}, {"loss": 0.1290604829788208, "token_acc": 0.9449900619665614, "grad_norm": 1.091897575397769, "learning_rate": 3.735815035069007e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232478, "epoch": 1.805177993527508, "step": 1395}, {"loss": 0.13099806308746337, "token_acc": 0.9497048225101588, "grad_norm": 1.3362249225618934, "learning_rate": 3.7013075654194586e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232505, "epoch": 1.811650485436893, "step": 1400}, {"eval_loss": 0.22171998023986816, "eval_token_acc": 0.9087536369831157, "eval_runtime": 10.2295, "eval_samples_per_second": 6.061, "eval_steps_per_second": 1.564, "epoch": 1.811650485436893, "step": 1400}, {"loss": 0.11891183853149415, "token_acc": 0.9597711267605634, "grad_norm": 1.2417456360885093, "learning_rate": 3.666866301999843e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232174, "epoch": 1.8181229773462784, "step": 1405}, {"loss": 0.1693854570388794, "token_acc": 0.917539192936782, "grad_norm": 1.1874400538748984, "learning_rate": 3.6324930005963256e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232113, "epoch": 1.8245954692556634, "step": 1410}, {"loss": 0.1333218812942505, "token_acc": 0.9500632492018554, "grad_norm": 1.0346562108903188, "learning_rate": 3.5981894135304207e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232155, "epoch": 1.8310679611650484, "step": 1415}, {"loss": 0.12574079036712646, "token_acc": 0.958843916326278, "grad_norm": 1.0254431872271912, "learning_rate": 3.563957289569669e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232181, "epoch": 1.8375404530744337, "step": 1420}, {"loss": 0.1283827543258667, "token_acc": 0.9525035095928872, "grad_norm": 1.2364877908922134, "learning_rate": 3.5297983738384813e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232146, "epoch": 1.8440129449838187, "step": 1425}, {"loss": 0.11218018531799316, "token_acc": 0.9599600599101348, "grad_norm": 1.4058506016801964, "learning_rate": 3.495714407729174e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232115, "epoch": 1.8504854368932038, "step": 1430}, {"loss": 0.13867826461791993, "token_acc": 0.9507864961825039, "grad_norm": 1.2872969143358153, "learning_rate": 3.461707128813201e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232101, "epoch": 1.856957928802589, "step": 1435}, {"loss": 0.12011985778808594, "token_acc": 0.973930397904453, "grad_norm": 1.0980299094321901, "learning_rate": 3.427778270752561e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232169, "epoch": 1.863430420711974, "step": 1440}, {"loss": 0.14790295362472533, "token_acc": 0.9141739657356911, "grad_norm": 1.0973709389721307, "learning_rate": 3.3939295632114313e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232206, "epoch": 1.869902912621359, "step": 1445}, {"loss": 0.1454403281211853, "token_acc": 0.9515533050499521, "grad_norm": 1.321008178421876, "learning_rate": 3.3601627317679832e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232185, "epoch": 1.8763754045307444, "step": 1450}, {"loss": 0.12079250812530518, "token_acc": 0.9511514305652478, "grad_norm": 1.1327640396885106, "learning_rate": 3.326479497826409e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232168, "epoch": 1.8828478964401294, "step": 1455}, {"loss": 0.14671319723129272, "token_acc": 0.9391652548898815, "grad_norm": 1.0128180664823434, "learning_rate": 3.292881578529179e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232099, "epoch": 1.8893203883495144, "step": 1460}, {"loss": 0.1508541464805603, "token_acc": 0.9190112647482782, "grad_norm": 1.0348968312578848, "learning_rate": 3.2593706866694934e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232113, "epoch": 1.8957928802588997, "step": 1465}, {"loss": 0.14026721715927123, "token_acc": 0.9317779932690662, "grad_norm": 1.2040157817070225, "learning_rate": 3.225948530603965e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232177, "epoch": 1.902265372168285, "step": 1470}, {"loss": 0.1334601640701294, "token_acc": 0.9543056501021103, "grad_norm": 1.2753084836039965, "learning_rate": 3.192616814165537e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232207, "epoch": 1.9087378640776698, "step": 1475}, {"loss": 0.127322518825531, "token_acc": 0.957298433320596, "grad_norm": 1.1855672153534478, "learning_rate": 3.1593772365766107e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232163, "epoch": 1.915210355987055, "step": 1480}, {"loss": 0.14199860095977784, "token_acc": 0.9482742666790044, "grad_norm": 1.4867528438084694, "learning_rate": 3.126231492362435e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232115, "epoch": 1.9216828478964403, "step": 1485}, {"loss": 0.11828438043594361, "token_acc": 0.951587528604119, "grad_norm": 1.3195240923028841, "learning_rate": 3.0931812712647107e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232165, "epoch": 1.928155339805825, "step": 1490}, {"loss": 0.12930368185043334, "token_acc": 0.9381896551724138, "grad_norm": 1.2989894980788734, "learning_rate": 3.0602282581554498e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232247, "epoch": 1.9346278317152104, "step": 1495}, {"loss": 0.1124228835105896, "token_acc": 0.9443427874351936, "grad_norm": 1.1336705556869524, "learning_rate": 3.0273741329510852e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232252, "epoch": 1.9411003236245956, "step": 1500}, {"loss": 0.14732120037078858, "token_acc": 0.9389453621346887, "grad_norm": 1.310921866246041, "learning_rate": 2.9946205705268337e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23222, "epoch": 1.9475728155339804, "step": 1505}, {"loss": 0.1348618745803833, "token_acc": 0.9555555555555556, "grad_norm": 1.0619873440570242, "learning_rate": 2.9619692406312983e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232245, "epoch": 1.9540453074433657, "step": 1510}, {"loss": 0.12884085178375243, "token_acc": 0.9618543940587375, "grad_norm": 1.1826983192653366, "learning_rate": 2.929421807801364e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232286, "epoch": 1.960517799352751, "step": 1515}, {"loss": 0.13765714168548585, "token_acc": 0.9504091971940763, "grad_norm": 1.1538250770076042, "learning_rate": 2.8969799312773263e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232286, "epoch": 1.9669902912621358, "step": 1520}, {"loss": 0.10905036926269532, "token_acc": 0.9582072176949942, "grad_norm": 0.8801680687947109, "learning_rate": 2.8646452649183132e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232238, "epoch": 1.973462783171521, "step": 1525}, {"loss": 0.1444356322288513, "token_acc": 0.9492504684572143, "grad_norm": 0.9272927353683482, "learning_rate": 2.8324194571179696e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232207, "epoch": 1.9799352750809063, "step": 1530}, {"loss": 0.13352564573287964, "token_acc": 0.9522021167634005, "grad_norm": 1.33532483807938, "learning_rate": 2.800304150720424e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232195, "epoch": 1.9864077669902913, "step": 1535}, {"loss": 0.131295645236969, "token_acc": 0.9466994942773489, "grad_norm": 1.21642995083882, "learning_rate": 2.7683009829365417e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232184, "epoch": 1.9928802588996763, "step": 1540}, {"loss": 0.1243582010269165, "token_acc": 0.957880549237638, "grad_norm": 1.2262274928989523, "learning_rate": 2.736411585260445e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232206, "epoch": 1.9993527508090616, "step": 1545}, {"loss": 0.07365645170211792, "token_acc": 0.9764899979377191, "grad_norm": 0.9289031209496951, "learning_rate": 2.704637583386369e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232279, "epoch": 2.005177993527508, "step": 1550}, {"loss": 0.07112020254135132, "token_acc": 0.9690823037679022, "grad_norm": 1.3027294465476835, "learning_rate": 2.672980597125764e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232338, "epoch": 2.0116504854368933, "step": 1555}, {"loss": 0.060581755638122556, "token_acc": 0.9631561095565165, "grad_norm": 1.116023487863946, "learning_rate": 2.6414422403247174e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232252, "epoch": 2.018122977346278, "step": 1560}, {"loss": 0.0553744912147522, "token_acc": 0.9856555098409875, "grad_norm": 1.3723766159247552, "learning_rate": 2.610024120781694e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232266, "epoch": 2.0245954692556634, "step": 1565}, {"loss": 0.07059065103530884, "token_acc": 0.9739542839371793, "grad_norm": 1.1127424049390076, "learning_rate": 2.5787278401655714e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232328, "epoch": 2.0310679611650486, "step": 1570}, {"loss": 0.04989112019538879, "token_acc": 0.975914362176628, "grad_norm": 1.0518114068608306, "learning_rate": 2.5475549939339716e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232285, "epoch": 2.037540453074434, "step": 1575}, {"loss": 0.055311352014541626, "token_acc": 0.9861794576484137, "grad_norm": 1.1149262738382293, "learning_rate": 2.5165071712519447e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232218, "epoch": 2.0440129449838187, "step": 1580}, {"loss": 0.0700884222984314, "token_acc": 0.981459409349755, "grad_norm": 0.9975938092589104, "learning_rate": 2.4855859549109446e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232159, "epoch": 2.050485436893204, "step": 1585}, {"loss": 0.05895653963088989, "token_acc": 0.9689076210875424, "grad_norm": 1.166811735902966, "learning_rate": 2.4547929212481436e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232198, "epoch": 2.056957928802589, "step": 1590}, {"loss": 0.07212084531784058, "token_acc": 0.9754575707154742, "grad_norm": 1.2538729927763557, "learning_rate": 2.4241296400660696e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232173, "epoch": 2.063430420711974, "step": 1595}, {"loss": 0.07641271948814392, "token_acc": 0.9718515967977963, "grad_norm": 1.126413918263622, "learning_rate": 2.39359767455258e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232179, "epoch": 2.0699029126213593, "step": 1600}, {"eval_loss": 0.22962763905525208, "eval_token_acc": 0.9118463277868506, "eval_runtime": 10.3586, "eval_samples_per_second": 5.985, "eval_steps_per_second": 1.545, "epoch": 2.0699029126213593, "step": 1600}, {"loss": 0.05252327919006348, "token_acc": 0.9819323671497584, "grad_norm": 1.1454431607576694, "learning_rate": 2.3631985812011736e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231825, "epoch": 2.0763754045307445, "step": 1605}, {"loss": 0.06322978138923645, "token_acc": 0.9697201797385621, "grad_norm": 1.09769542278717, "learning_rate": 2.332933909731635e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23188, "epoch": 2.0828478964401294, "step": 1610}, {"loss": 0.05085160732269287, "token_acc": 0.9762214760501611, "grad_norm": 1.0201790094322425, "learning_rate": 2.302805203011039e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231923, "epoch": 2.0893203883495146, "step": 1615}, {"loss": 0.055410391092300414, "token_acc": 0.9703637180062865, "grad_norm": 0.9733864221993475, "learning_rate": 2.2728139969751005e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231982, "epoch": 2.0957928802589, "step": 1620}, {"loss": 0.06219807267189026, "token_acc": 0.988454925079833, "grad_norm": 1.2697186390418769, "learning_rate": 2.2429618205498543e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231997, "epoch": 2.1022653721682847, "step": 1625}, {"loss": 0.05788746476173401, "token_acc": 0.9789700727959019, "grad_norm": 1.192686447856454, "learning_rate": 2.213250195573734e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232016, "epoch": 2.10873786407767, "step": 1630}, {"loss": 0.06894739866256713, "token_acc": 0.9743245154901683, "grad_norm": 1.1641604328074058, "learning_rate": 2.1836806367199763e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231988, "epoch": 2.115210355987055, "step": 1635}, {"loss": 0.05749773383140564, "token_acc": 0.979918509895227, "grad_norm": 1.0795558854517513, "learning_rate": 2.1542546514194103e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231994, "epoch": 2.12168284789644, "step": 1640}, {"loss": 0.06683923006057739, "token_acc": 0.9701919458035378, "grad_norm": 1.2243660636093547, "learning_rate": 2.124973739783609e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232017, "epoch": 2.1281553398058253, "step": 1645}, {"loss": 0.06786704063415527, "token_acc": 0.9729074889867841, "grad_norm": 1.2381946286718226, "learning_rate": 2.0958393945284074e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231961, "epoch": 2.1346278317152105, "step": 1650}, {"loss": 0.0620800256729126, "token_acc": 0.9734751675070802, "grad_norm": 1.241403451141934, "learning_rate": 2.066853100897822e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231979, "epoch": 2.1411003236245953, "step": 1655}, {"loss": 0.06261314153671264, "token_acc": 0.9833948339483395, "grad_norm": 1.1738640073858981, "learning_rate": 2.0380163365883188e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231969, "epoch": 2.1475728155339806, "step": 1660}, {"loss": 0.06931127309799194, "token_acc": 0.9731147540983607, "grad_norm": 1.065295106708313, "learning_rate": 2.0093305716734814e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232014, "epoch": 2.154045307443366, "step": 1665}, {"loss": 0.05684926509857178, "token_acc": 0.9760449032775383, "grad_norm": 1.1839741085984141, "learning_rate": 1.9807972685290843e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232038, "epoch": 2.1605177993527507, "step": 1670}, {"loss": 0.0670507788658142, "token_acc": 0.9780210997442456, "grad_norm": 1.2420987973960562, "learning_rate": 1.952417881758526e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231991, "epoch": 2.166990291262136, "step": 1675}, {"loss": 0.06806849837303161, "token_acc": 0.9753017120404154, "grad_norm": 1.2086850910000355, "learning_rate": 1.9241938581186766e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231979, "epoch": 2.173462783171521, "step": 1680}, {"loss": 0.06323795318603516, "token_acc": 0.9771806167400882, "grad_norm": 1.1928292123643494, "learning_rate": 1.8961266364461306e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23194, "epoch": 2.179935275080906, "step": 1685}, {"loss": 0.061801576614379884, "token_acc": 0.9703267973856209, "grad_norm": 1.1393806603407186, "learning_rate": 1.868217647583852e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23196, "epoch": 2.1864077669902913, "step": 1690}, {"loss": 0.05491001009941101, "token_acc": 0.9677095444456189, "grad_norm": 1.0310858323697252, "learning_rate": 1.8404683143082309e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231969, "epoch": 2.1928802588996765, "step": 1695}, {"loss": 0.05857166051864624, "token_acc": 0.9635431500996867, "grad_norm": 1.279869097309594, "learning_rate": 1.8128800512565514e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231927, "epoch": 2.1993527508090613, "step": 1700}, {"loss": 0.07229178547859191, "token_acc": 0.9751631905747492, "grad_norm": 1.1050399277856437, "learning_rate": 1.7854542648548773e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231975, "epoch": 2.2058252427184466, "step": 1705}, {"loss": 0.04233476519584656, "token_acc": 0.9868477483917084, "grad_norm": 1.9974034630903625, "learning_rate": 1.7581923532463507e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232014, "epoch": 2.212297734627832, "step": 1710}, {"loss": 0.06760261058807374, "token_acc": 0.9742311526957589, "grad_norm": 1.2668604987449381, "learning_rate": 1.731095706219914e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231999, "epoch": 2.2187702265372167, "step": 1715}, {"loss": 0.04631110429763794, "token_acc": 0.9790452182133291, "grad_norm": 1.049371575580757, "learning_rate": 1.7041657051394645e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232023, "epoch": 2.225242718446602, "step": 1720}, {"loss": 0.05172126293182373, "token_acc": 0.9821800316429344, "grad_norm": 1.2343451382000987, "learning_rate": 1.6774037228734375e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232065, "epoch": 2.231715210355987, "step": 1725}, {"loss": 0.051471817493438723, "token_acc": 0.9716306719843479, "grad_norm": 1.215512661303168, "learning_rate": 1.650811123724802e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23211, "epoch": 2.238187702265372, "step": 1730}, {"loss": 0.05706359744071961, "token_acc": 0.9797600587611197, "grad_norm": 1.174682742726191, "learning_rate": 1.6243892633615272e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23213, "epoch": 2.2446601941747573, "step": 1735}, {"loss": 0.06071429252624512, "token_acc": 0.966906161550185, "grad_norm": 1.0453263914240178, "learning_rate": 1.598139488747467e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232175, "epoch": 2.2511326860841425, "step": 1740}, {"loss": 0.0559482216835022, "token_acc": 0.983172520262447, "grad_norm": 1.102692057179975, "learning_rate": 1.5720631380736839e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23217, "epoch": 2.2576051779935273, "step": 1745}, {"loss": 0.0653589129447937, "token_acc": 0.9645939188644246, "grad_norm": 1.1343834620050668, "learning_rate": 1.5461615406902414e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232233, "epoch": 2.2640776699029126, "step": 1750}, {"loss": 0.05375389456748962, "token_acc": 0.9707617337778918, "grad_norm": 0.9523104942700487, "learning_rate": 1.5204360170384286e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232218, "epoch": 2.270550161812298, "step": 1755}, {"loss": 0.0648045539855957, "token_acc": 0.966461744476231, "grad_norm": 1.1031286858876281, "learning_rate": 1.4948878785834453e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232172, "epoch": 2.2770226537216827, "step": 1760}, {"loss": 0.053392231464385986, "token_acc": 0.9727481008079103, "grad_norm": 1.2370888758126215, "learning_rate": 1.4695184277475482e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232244, "epoch": 2.283495145631068, "step": 1765}, {"loss": 0.05288400650024414, "token_acc": 0.9803399725274725, "grad_norm": 1.1737689591470362, "learning_rate": 1.4443289578436459e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23226, "epoch": 2.289967637540453, "step": 1770}, {"loss": 0.06786958575248718, "token_acc": 0.9826933912903485, "grad_norm": 1.101252743117922, "learning_rate": 1.4193207530093806e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232262, "epoch": 2.296440129449838, "step": 1775}, {"loss": 0.05762593746185303, "token_acc": 0.9785922438915041, "grad_norm": 1.072035662154418, "learning_rate": 1.3944950881416541e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232355, "epoch": 2.3029126213592233, "step": 1780}, {"loss": 0.07335728406906128, "token_acc": 0.9587967081850534, "grad_norm": 1.0155212206122965, "learning_rate": 1.369853228831632e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232278, "epoch": 2.3093851132686085, "step": 1785}, {"loss": 0.04738302230834961, "token_acc": 0.9750514991989013, "grad_norm": 0.9452422747210877, "learning_rate": 1.3453964313002337e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232294, "epoch": 2.3158576051779933, "step": 1790}, {"loss": 0.05384417176246643, "token_acc": 0.9870818151705862, "grad_norm": 1.0453204711249882, "learning_rate": 1.3211259423340882e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232289, "epoch": 2.3223300970873786, "step": 1795}, {"loss": 0.0602191150188446, "token_acc": 0.9780426599749059, "grad_norm": 1.021211762772537, "learning_rate": 1.2970429992219714e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232305, "epoch": 2.328802588996764, "step": 1800}, {"eval_loss": 0.23024004697799683, "eval_token_acc": 0.9128450386857202, "eval_runtime": 10.2529, "eval_samples_per_second": 6.047, "eval_steps_per_second": 1.561, "epoch": 2.328802588996764, "step": 1800}, {"loss": 0.053506529331207274, "token_acc": 0.9771539891968476, "grad_norm": 1.091996503204976, "learning_rate": 1.2731488296917315e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232015, "epoch": 2.3352750809061487, "step": 1805}, {"loss": 0.047854235768318175, "token_acc": 0.985098923115452, "grad_norm": 1.3923205507237184, "learning_rate": 1.2494446518477022e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232039, "epoch": 2.341747572815534, "step": 1810}, {"loss": 0.061611068248748777, "token_acc": 0.9735178654601104, "grad_norm": 1.106971914028288, "learning_rate": 1.2259316741086052e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232092, "epoch": 2.348220064724919, "step": 1815}, {"loss": 0.05525977611541748, "token_acc": 0.9709341624983101, "grad_norm": 1.2671339116076528, "learning_rate": 1.2026110951459364e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232126, "epoch": 2.354692556634304, "step": 1820}, {"loss": 0.04604179859161377, "token_acc": 0.9830721003134796, "grad_norm": 1.1084630607602335, "learning_rate": 1.1794841038228772e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232147, "epoch": 2.3611650485436892, "step": 1825}, {"loss": 0.06369653940200806, "token_acc": 0.9737195633921075, "grad_norm": 1.2647923425337235, "learning_rate": 1.156551879133672e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232139, "epoch": 2.3676375404530745, "step": 1830}, {"loss": 0.05510445833206177, "token_acc": 0.9768673355629878, "grad_norm": 1.2624717913675743, "learning_rate": 1.133815590143525e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232216, "epoch": 2.3741100323624593, "step": 1835}, {"loss": 0.06397056579589844, "token_acc": 0.9704547203200738, "grad_norm": 1.2700456438504508, "learning_rate": 1.1112763959290102e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232186, "epoch": 2.3805825242718446, "step": 1840}, {"loss": 0.05866835117340088, "token_acc": 0.9694425326909841, "grad_norm": 1.2817743749236248, "learning_rate": 1.088935445518981e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232186, "epoch": 2.38705501618123, "step": 1845}, {"loss": 0.07035576701164245, "token_acc": 0.9559785522788203, "grad_norm": 1.247271968878297, "learning_rate": 1.0667938778359838e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232199, "epoch": 2.3935275080906147, "step": 1850}, {"loss": 0.051148068904876706, "token_acc": 0.9729636526657011, "grad_norm": 1.1334221181290518, "learning_rate": 1.0448528216382103e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232168, "epoch": 2.4, "step": 1855}, {"loss": 0.04253450930118561, "token_acc": 0.9859731876861966, "grad_norm": 1.0867105539802522, "learning_rate": 1.0231133954619449e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232245, "epoch": 2.406472491909385, "step": 1860}, {"loss": 0.05450018644332886, "token_acc": 0.989247311827957, "grad_norm": 1.1575255183670843, "learning_rate": 1.0015767075645472e-06, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232276, "epoch": 2.41294498381877, "step": 1865}, {"loss": 0.05493462085723877, "token_acc": 0.9767826007157934, "grad_norm": 1.1332331779794778, "learning_rate": 9.802438558679529e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232313, "epoch": 2.4194174757281552, "step": 1870}, {"loss": 0.05804874897003174, "token_acc": 0.9736809202300575, "grad_norm": 0.9797050958467529, "learning_rate": 9.591159279027014e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232325, "epoch": 2.4258899676375405, "step": 1875}, {"loss": 0.046711453795433046, "token_acc": 0.9743099006256901, "grad_norm": 1.254796264133123, "learning_rate": 9.381940007524975e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232385, "epoch": 2.4323624595469258, "step": 1880}, {"loss": 0.06558808088302612, "token_acc": 0.9840654608096469, "grad_norm": 1.2790128678181054, "learning_rate": 9.174791409992962e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232315, "epoch": 2.4388349514563106, "step": 1885}, {"loss": 0.04392340183258057, "token_acc": 0.9806144241826844, "grad_norm": 0.9145379739054997, "learning_rate": 8.969724046689371e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232296, "epoch": 2.445307443365696, "step": 1890}, {"loss": 0.05420974493026733, "token_acc": 0.980495867768595, "grad_norm": 1.0683388496072503, "learning_rate": 8.766748371773081e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232315, "epoch": 2.451779935275081, "step": 1895}, {"loss": 0.06509414911270142, "token_acc": 0.9756731393921895, "grad_norm": 1.2165059615592475, "learning_rate": 8.565874732770429e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232359, "epoch": 2.458252427184466, "step": 1900}, {"loss": 0.056372612714767456, "token_acc": 0.9729138745855964, "grad_norm": 1.1004678439938993, "learning_rate": 8.367113370047785e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232357, "epoch": 2.464724919093851, "step": 1905}, {"loss": 0.05308201313018799, "token_acc": 0.9847706746945281, "grad_norm": 1.2448698456963794, "learning_rate": 8.170474416289492e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232348, "epoch": 2.4711974110032364, "step": 1910}, {"loss": 0.05518274307250977, "token_acc": 0.9877391538668823, "grad_norm": 0.9168142813898628, "learning_rate": 7.97596789598128e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232331, "epoch": 2.4776699029126212, "step": 1915}, {"loss": 0.06261971592903137, "token_acc": 0.9745822713112433, "grad_norm": 1.3794998626883719, "learning_rate": 7.783603724899258e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232323, "epoch": 2.4841423948220065, "step": 1920}, {"loss": 0.046019870042800906, "token_acc": 0.9877607788595271, "grad_norm": 0.9870512303789161, "learning_rate": 7.59339170960437e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232312, "epoch": 2.4906148867313918, "step": 1925}, {"loss": 0.06714773178100586, "token_acc": 0.980498866213152, "grad_norm": 1.162237508965422, "learning_rate": 7.405341546942562e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23232, "epoch": 2.4970873786407766, "step": 1930}, {"loss": 0.054110759496688844, "token_acc": 0.9764533463605276, "grad_norm": 1.092519297811141, "learning_rate": 7.219462823550333e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232324, "epoch": 2.503559870550162, "step": 1935}, {"loss": 0.04667757451534271, "token_acc": 0.9836950767601905, "grad_norm": 0.9869283041368845, "learning_rate": 7.035765015366047e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232378, "epoch": 2.510032362459547, "step": 1940}, {"loss": 0.04229388833045959, "token_acc": 0.9833078880407125, "grad_norm": 1.0384605358969219, "learning_rate": 6.854257487146943e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23244, "epoch": 2.516504854368932, "step": 1945}, {"loss": 0.04936951398849487, "token_acc": 0.9805124011992369, "grad_norm": 1.0702111831284966, "learning_rate": 6.674949491991616e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232418, "epoch": 2.522977346278317, "step": 1950}, {"loss": 0.05218222737312317, "token_acc": 0.9835761071463486, "grad_norm": 1.17736612733419, "learning_rate": 6.497850170868325e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232431, "epoch": 2.5294498381877024, "step": 1955}, {"loss": 0.055725717544555665, "token_acc": 0.9748743718592965, "grad_norm": 1.2933275863122955, "learning_rate": 6.322968552149056e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232436, "epoch": 2.5359223300970872, "step": 1960}, {"loss": 0.059399574995040894, "token_acc": 0.9764081803587632, "grad_norm": 1.212223787964765, "learning_rate": 6.150313551149212e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232422, "epoch": 2.5423948220064725, "step": 1965}, {"loss": 0.056549572944641115, "token_acc": 0.9701249321021184, "grad_norm": 1.3082934014007968, "learning_rate": 5.979893969673117e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232486, "epoch": 2.5488673139158577, "step": 1970}, {"loss": 0.04402643442153931, "token_acc": 0.984109327824567, "grad_norm": 1.2043961501926719, "learning_rate": 5.811718495565327e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232451, "epoch": 2.5553398058252426, "step": 1975}, {"loss": 0.05042751431465149, "token_acc": 0.986905428091774, "grad_norm": 1.0541931227045562, "learning_rate": 5.645795702267731e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232477, "epoch": 2.561812297734628, "step": 1980}, {"loss": 0.07950357794761657, "token_acc": 0.9693243056515131, "grad_norm": 1.3302436109580127, "learning_rate": 5.482134048382465e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232421, "epoch": 2.568284789644013, "step": 1985}, {"loss": 0.05211693048477173, "token_acc": 0.9773266152934202, "grad_norm": 1.1054138530092033, "learning_rate": 5.320741877240704e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232428, "epoch": 2.574757281553398, "step": 1990}, {"loss": 0.04444989562034607, "token_acc": 0.9792422702859631, "grad_norm": 0.9956813390445619, "learning_rate": 5.161627416477338e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232445, "epoch": 2.581229773462783, "step": 1995}, {"loss": 0.055266809463500974, "token_acc": 0.9754217568353694, "grad_norm": 1.2607155883620114, "learning_rate": 5.004798777611564e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.232475, "epoch": 2.5877022653721684, "step": 2000}, {"eval_loss": 0.22843259572982788, "eval_token_acc": 0.913109318893618, "eval_runtime": 10.3467, "eval_samples_per_second": 5.992, "eval_steps_per_second": 1.546, "epoch": 2.5877022653721684, "step": 2000}, {"loss": 0.06419377326965332, "token_acc": 0.9881004366812227, "grad_norm": 0.9882302253354311, "learning_rate": 4.850263955633273e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231349, "epoch": 2.5941747572815537, "step": 2005}, {"loss": 0.0459562748670578, "token_acc": 0.9805876180482687, "grad_norm": 1.351786119403278, "learning_rate": 4.698030828595568e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23139, "epoch": 2.6006472491909385, "step": 2010}, {"loss": 0.05577208399772644, "token_acc": 0.9875154949530724, "grad_norm": 1.1684103855936847, "learning_rate": 4.5481071572131217e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231412, "epoch": 2.6071197411003237, "step": 2015}, {"loss": 0.05177081823348999, "token_acc": 0.9792929690575545, "grad_norm": 1.0935777593528908, "learning_rate": 4.400500584466505e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231423, "epoch": 2.613592233009709, "step": 2020}, {"loss": 0.05546313524246216, "token_acc": 0.9684119428818693, "grad_norm": 1.1416834979866257, "learning_rate": 4.2552186352125936e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231415, "epoch": 2.620064724919094, "step": 2025}, {"loss": 0.059876686334609984, "token_acc": 0.9810260758956965, "grad_norm": 1.1973508846753906, "learning_rate": 4.112268715800943e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231407, "epoch": 2.626537216828479, "step": 2030}, {"loss": 0.06473002433776856, "token_acc": 0.9787903166825129, "grad_norm": 1.0733882703490476, "learning_rate": 3.971658113696225e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231404, "epoch": 2.6330097087378643, "step": 2035}, {"loss": 0.05041903257369995, "token_acc": 0.9733975371013578, "grad_norm": 1.1201661237339993, "learning_rate": 3.833393997106727e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231412, "epoch": 2.639482200647249, "step": 2040}, {"loss": 0.059658944606781006, "token_acc": 0.9597982708933718, "grad_norm": 1.347704642648761, "learning_rate": 3.6974834146188633e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231412, "epoch": 2.6459546925566344, "step": 2045}, {"loss": 0.06632623076438904, "token_acc": 0.9734221649115267, "grad_norm": 1.0365828167867908, "learning_rate": 3.5639332948379566e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231417, "epoch": 2.6524271844660197, "step": 2050}, {"loss": 0.040672394633293155, "token_acc": 0.9815347890191674, "grad_norm": 1.0611722459538586, "learning_rate": 3.432750446034927e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231426, "epoch": 2.6588996763754045, "step": 2055}, {"loss": 0.06558017730712891, "token_acc": 0.95664988333538, "grad_norm": 1.0235189933671507, "learning_rate": 3.303941555799223e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231359, "epoch": 2.6653721682847897, "step": 2060}, {"loss": 0.05222757458686829, "token_acc": 0.9826008360637216, "grad_norm": 1.1639657813728685, "learning_rate": 3.1775131906979564e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231423, "epoch": 2.671844660194175, "step": 2065}, {"loss": 0.051252955198287965, "token_acc": 0.9812472094061616, "grad_norm": 1.039527504625151, "learning_rate": 3.0534717959410764e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231439, "epoch": 2.67831715210356, "step": 2070}, {"loss": 0.05001325011253357, "token_acc": 0.9830923793187945, "grad_norm": 1.2919727412158266, "learning_rate": 2.931823695052832e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231497, "epoch": 2.684789644012945, "step": 2075}, {"loss": 0.04461966753005982, "token_acc": 0.9883373493975903, "grad_norm": 1.0873867422849022, "learning_rate": 2.812575089549402e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231573, "epoch": 2.6912621359223303, "step": 2080}, {"loss": 0.06092171669006348, "token_acc": 0.9711566195558119, "grad_norm": 1.2083217377025166, "learning_rate": 2.6957320586227354e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231591, "epoch": 2.697734627831715, "step": 2085}, {"loss": 0.05340696573257446, "token_acc": 0.9792174934489924, "grad_norm": 1.1269792193394585, "learning_rate": 2.581300558830657e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231573, "epoch": 2.7042071197411004, "step": 2090}, {"loss": 0.050331252813339236, "token_acc": 0.9759761993306062, "grad_norm": 0.9844773762320971, "learning_rate": 2.46928642379316e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231611, "epoch": 2.7106796116504857, "step": 2095}, {"loss": 0.046271917223930356, "token_acc": 0.9817909506542646, "grad_norm": 1.316642194395261, "learning_rate": 2.3596953638951093e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231665, "epoch": 2.7171521035598705, "step": 2100}, {"loss": 0.04924711585044861, "token_acc": 0.97744700045106, "grad_norm": 1.0613486358428506, "learning_rate": 2.2525329659950244e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231699, "epoch": 2.7236245954692557, "step": 2105}, {"loss": 0.05652419328689575, "token_acc": 0.9895724713242962, "grad_norm": 0.864057894659719, "learning_rate": 2.1478046931403262e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231691, "epoch": 2.730097087378641, "step": 2110}, {"loss": 0.05103684663772583, "token_acc": 0.9784311999295713, "grad_norm": 1.2668535177395919, "learning_rate": 2.0455158842888124e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231721, "epoch": 2.736569579288026, "step": 2115}, {"loss": 0.064724862575531, "token_acc": 0.9759136212624585, "grad_norm": 1.1767005962962092, "learning_rate": 1.9456717540365267e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231688, "epoch": 2.743042071197411, "step": 2120}, {"loss": 0.05363948941230774, "token_acc": 0.9856854838709678, "grad_norm": 1.0616319571302308, "learning_rate": 1.8482773923518383e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231719, "epoch": 2.7495145631067963, "step": 2125}, {"loss": 0.05469686985015869, "token_acc": 0.9615923745444351, "grad_norm": 0.9899153474922842, "learning_rate": 1.7533377643160488e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231722, "epoch": 2.755987055016181, "step": 2130}, {"loss": 0.061334806680679324, "token_acc": 0.9756292449061127, "grad_norm": 1.1328328848925524, "learning_rate": 1.6608577098702172e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231665, "epoch": 2.7624595469255664, "step": 2135}, {"loss": 0.04211564362049103, "token_acc": 0.9776274244474515, "grad_norm": 1.0218068449498787, "learning_rate": 1.5708419435684463e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231679, "epoch": 2.7689320388349516, "step": 2140}, {"loss": 0.07040736675262452, "token_acc": 0.9612553032193661, "grad_norm": 1.3145747034670707, "learning_rate": 1.4832950543375412e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231677, "epoch": 2.7754045307443365, "step": 2145}, {"loss": 0.04796243906021118, "token_acc": 0.9844283089843409, "grad_norm": 1.0434643057841324, "learning_rate": 1.3982215052430636e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231728, "epoch": 2.7818770226537217, "step": 2150}, {"loss": 0.04958098530769348, "token_acc": 0.9818891261135243, "grad_norm": 1.1323858229094845, "learning_rate": 1.3156256332618077e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231737, "epoch": 2.788349514563107, "step": 2155}, {"loss": 0.05162686705589294, "token_acc": 0.9853923205342237, "grad_norm": 0.8273581550576481, "learning_rate": 1.235511649060711e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231767, "epoch": 2.794822006472492, "step": 2160}, {"loss": 0.05173174142837524, "token_acc": 0.9792650708510128, "grad_norm": 1.069180621093003, "learning_rate": 1.1578836367821756e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231745, "epoch": 2.801294498381877, "step": 2165}, {"loss": 0.05220184326171875, "token_acc": 0.975347967592272, "grad_norm": 1.1011296072420238, "learning_rate": 1.0827455538359177e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23172, "epoch": 2.8077669902912623, "step": 2170}, {"loss": 0.05935395359992981, "token_acc": 0.9845149872801682, "grad_norm": 1.202340427842819, "learning_rate": 1.0101012306971524e-07, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231749, "epoch": 2.814239482200647, "step": 2175}, {"loss": 0.044292914867401126, "token_acc": 0.9810822701275846, "grad_norm": 1.2483199116180494, "learning_rate": 9.399543707113601e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231769, "epoch": 2.8207119741100324, "step": 2180}, {"loss": 0.05107998847961426, "token_acc": 0.9747603048430714, "grad_norm": 0.9646020423861975, "learning_rate": 8.723085499054873e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.2318, "epoch": 2.8271844660194176, "step": 2185}, {"loss": 0.040122398734092714, "token_acc": 0.9844208396560445, "grad_norm": 1.0416672429837763, "learning_rate": 8.071672168056488e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231835, "epoch": 2.8336569579288025, "step": 2190}, {"loss": 0.0388800710439682, "token_acc": 0.9895118230358505, "grad_norm": 1.0204344656162618, "learning_rate": 7.445336922613067e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231873, "epoch": 2.8401294498381877, "step": 2195}, {"loss": 0.055674540996551516, "token_acc": 0.9815239186479519, "grad_norm": 1.2430918214916662, "learning_rate": 6.844111692759836e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231813, "epoch": 2.846601941747573, "step": 2200}, {"eval_loss": 0.23267488181591034, "eval_token_acc": 0.9122865863884883, "eval_runtime": 10.6735, "eval_samples_per_second": 5.809, "eval_steps_per_second": 1.499, "epoch": 2.846601941747573, "step": 2200}, {"loss": 0.04770828485488891, "token_acc": 0.9781003091721058, "grad_norm": 1.1225812245772513, "learning_rate": 6.268027128445098e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231565, "epoch": 2.853074433656958, "step": 2205}, {"loss": 0.06230595111846924, "token_acc": 0.9864536621823617, "grad_norm": 1.0887392250624557, "learning_rate": 5.717112597967311e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231557, "epoch": 2.859546925566343, "step": 2210}, {"loss": 0.04867230951786041, "token_acc": 0.9856289849205546, "grad_norm": 1.2914486265829896, "learning_rate": 5.1913961864781816e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231567, "epoch": 2.8660194174757283, "step": 2215}, {"loss": 0.045086023211479184, "token_acc": 0.9755213055303718, "grad_norm": 1.1755688841458534, "learning_rate": 4.690904694550913e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231609, "epoch": 2.872491909385113, "step": 2220}, {"loss": 0.05770102739334106, "token_acc": 0.9697870232788509, "grad_norm": 1.162979527704314, "learning_rate": 4.215663636813916e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231671, "epoch": 2.8789644012944984, "step": 2225}, {"loss": 0.05874812602996826, "token_acc": 0.9825990056574662, "grad_norm": 0.9424296724058848, "learning_rate": 3.765697240649846e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231672, "epoch": 2.8854368932038836, "step": 2230}, {"loss": 0.06532167196273804, "token_acc": 0.9562698152399693, "grad_norm": 1.0906138857415595, "learning_rate": 3.341028444960981e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231666, "epoch": 2.8919093851132684, "step": 2235}, {"loss": 0.0725551724433899, "token_acc": 0.9790121046466224, "grad_norm": 1.1683522483774813, "learning_rate": 2.941678898999378e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231666, "epoch": 2.8983818770226537, "step": 2240}, {"loss": 0.0456466555595398, "token_acc": 0.9875080076873799, "grad_norm": 1.10981260404731, "learning_rate": 2.5676689612634253e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231662, "epoch": 2.904854368932039, "step": 2245}, {"loss": 0.05291150808334351, "token_acc": 0.9771566783122816, "grad_norm": 1.1487977593632033, "learning_rate": 2.219017698460002e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231623, "epoch": 2.911326860841424, "step": 2250}, {"loss": 0.04553242325782776, "token_acc": 0.9856635071090047, "grad_norm": 1.208878693165683, "learning_rate": 1.89574288453237e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231605, "epoch": 2.917799352750809, "step": 2255}, {"loss": 0.051015710830688475, "token_acc": 0.9754819389855887, "grad_norm": 1.0837885072934585, "learning_rate": 1.5978609997542306e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231638, "epoch": 2.9242718446601943, "step": 2260}, {"loss": 0.056518149375915525, "token_acc": 0.973137614678899, "grad_norm": 1.2475998368977392, "learning_rate": 1.32538722988923e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231608, "epoch": 2.930744336569579, "step": 2265}, {"loss": 0.052043032646179196, "token_acc": 0.9780701754385965, "grad_norm": 1.244303213274886, "learning_rate": 1.0783354654173016e-08, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231621, "epoch": 2.9372168284789644, "step": 2270}, {"loss": 0.056556761264801025, "token_acc": 0.9654878288826193, "grad_norm": 1.0944926679348244, "learning_rate": 8.567183008261204e-09, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23159, "epoch": 2.9436893203883496, "step": 2275}, {"loss": 0.05090644359588623, "token_acc": 0.9797866850163427, "grad_norm": 1.0928708275781602, "learning_rate": 6.605470339692832e-09, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231594, "epoch": 2.9501618122977344, "step": 2280}, {"loss": 0.049569320678710935, "token_acc": 0.976430254981787, "grad_norm": 1.102299068167728, "learning_rate": 4.898316654902146e-09, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231609, "epoch": 2.9566343042071197, "step": 2285}, {"loss": 0.05385318398475647, "token_acc": 0.972732700855835, "grad_norm": 0.9849184252433923, "learning_rate": 3.4458089831251873e-09, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231571, "epoch": 2.963106796116505, "step": 2290}, {"loss": 0.05933798551559448, "token_acc": 0.9773709921949576, "grad_norm": 1.1973152912936933, "learning_rate": 2.2480213719600073e-09, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231527, "epoch": 2.9695792880258898, "step": 2295}, {"loss": 0.05716930627822876, "token_acc": 0.9713254035683943, "grad_norm": 1.4366160282528384, "learning_rate": 1.305014883595801e-09, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231553, "epoch": 2.976051779935275, "step": 2300}, {"loss": 0.048892608284950255, "token_acc": 0.9822541966426859, "grad_norm": 1.0835837160491903, "learning_rate": 6.168375916970615e-10, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231535, "epoch": 2.9825242718446603, "step": 2305}, {"loss": 0.053196704387664794, "token_acc": 0.9798741023140349, "grad_norm": 1.0840843646982987, "learning_rate": 1.835245789533202e-10, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.23154, "epoch": 2.988996763754045, "step": 2310}, {"loss": 0.047575768828392026, "token_acc": 0.9849366382402168, "grad_norm": 1.2343344654360977, "learning_rate": 5.097935291131784e-12, "memory(GiB)": 76.64, "train_speed(iter/s)": 0.231555, "epoch": 2.9954692556634304, "step": 2315}, {"eval_loss": 0.22719234228134155, "eval_token_acc": 0.9135098893731143, "eval_runtime": 10.2297, "eval_samples_per_second": 6.061, "eval_steps_per_second": 1.564, "epoch": 2.9967637540453076, "step": 2316}, {"train_runtime": 10035.8195, "train_samples_per_second": 1.848, "train_steps_per_second": 0.231, "total_flos": 6.192887594095739e+17, "train_loss": 0.15794228620840067, "epoch": 2.9967637540453076, "step": 2316}], "memory": 76.642578125} |
|
|