{ "best_global_step": 2931, "best_metric": 1.456993818283081, "best_model_checkpoint": "/workspace/MT_En_Russian/checkpoint-2931", "epoch": 3.0, "eval_steps": 5000, "global_step": 2931, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.01024, "grad_norm": 1.3203125, "learning_rate": 4.9977515176118345e-05, "loss": 0.9742774963378906, "num_input_tokens_seen": 2055872, "step": 10, "train_runtime": 80.1213, "train_tokens_per_second": 25659.479 }, { "epoch": 0.02048, "grad_norm": 0.82421875, "learning_rate": 4.9952567580506e-05, "loss": 0.7722540855407715, "num_input_tokens_seen": 4033984, "step": 20, "train_runtime": 149.3376, "train_tokens_per_second": 27012.507 }, { "epoch": 0.03072, "grad_norm": 0.83203125, "learning_rate": 4.992765730738634e-05, "loss": 0.7429269313812256, "num_input_tokens_seen": 6010880, "step": 30, "train_runtime": 217.0261, "train_tokens_per_second": 27696.574 }, { "epoch": 0.04096, "grad_norm": 0.7578125, "learning_rate": 4.9902784263792476e-05, "loss": 0.7194486618041992, "num_input_tokens_seen": 7999872, "step": 40, "train_runtime": 285.3869, "train_tokens_per_second": 28031.677 }, { "epoch": 0.0512, "grad_norm": 0.8046875, "learning_rate": 4.987794835708133e-05, "loss": 0.7071797370910644, "num_input_tokens_seen": 10049984, "step": 50, "train_runtime": 362.3108, "train_tokens_per_second": 27738.575 }, { "epoch": 0.06144, "grad_norm": 0.7109375, "learning_rate": 4.985314949493234e-05, "loss": 0.6854294776916504, "num_input_tokens_seen": 12056320, "step": 60, "train_runtime": 434.4414, "train_tokens_per_second": 27751.317 }, { "epoch": 0.07168, "grad_norm": 0.78125, "learning_rate": 4.982838758534584e-05, "loss": 0.6797103881835938, "num_input_tokens_seen": 14026240, "step": 70, "train_runtime": 503.3773, "train_tokens_per_second": 27864.269 }, { "epoch": 0.08192, "grad_norm": 0.74609375, "learning_rate": 4.980366253664179e-05, "loss": 0.6712788581848145, "num_input_tokens_seen": 16040128, "step": 80, "train_runtime": 573.4812, "train_tokens_per_second": 27969.755 }, { "epoch": 0.09216, "grad_norm": 0.7265625, "learning_rate": 4.977897425745825e-05, "loss": 0.6637749671936035, "num_input_tokens_seen": 18062848, "step": 90, "train_runtime": 645.8153, "train_tokens_per_second": 27969.061 }, { "epoch": 0.1024, "grad_norm": 0.703125, "learning_rate": 4.975432265674997e-05, "loss": 0.6546947479248046, "num_input_tokens_seen": 20042944, "step": 100, "train_runtime": 712.4646, "train_tokens_per_second": 28131.846 }, { "epoch": 0.11264, "grad_norm": 0.80859375, "learning_rate": 4.972970764378705e-05, "loss": 0.6477886199951172, "num_input_tokens_seen": 22080512, "step": 110, "train_runtime": 786.5413, "train_tokens_per_second": 28072.921 }, { "epoch": 0.12288, "grad_norm": 0.71875, "learning_rate": 4.970512912815344e-05, "loss": 0.6376790046691895, "num_input_tokens_seen": 24069056, "step": 120, "train_runtime": 856.9353, "train_tokens_per_second": 28087.366 }, { "epoch": 0.13312, "grad_norm": 0.6953125, "learning_rate": 4.968058701974564e-05, "loss": 0.6336091518402099, "num_input_tokens_seen": 26065472, "step": 130, "train_runtime": 928.6902, "train_tokens_per_second": 28066.918 }, { "epoch": 0.14336, "grad_norm": 0.7578125, "learning_rate": 4.96560812287712e-05, "loss": 0.6247911930084229, "num_input_tokens_seen": 28056704, "step": 140, "train_runtime": 998.2602, "train_tokens_per_second": 28105.601 }, { "epoch": 0.1536, "grad_norm": 0.71875, "learning_rate": 4.963161166574748e-05, "loss": 0.628913402557373, "num_input_tokens_seen": 30080064, "step": 150, "train_runtime": 1072.5324, "train_tokens_per_second": 28045.833 }, { "epoch": 0.16384, "grad_norm": 0.68359375, "learning_rate": 4.960717824150013e-05, "loss": 0.6165059089660645, "num_input_tokens_seen": 32061312, "step": 160, "train_runtime": 1144.3017, "train_tokens_per_second": 28018.234 }, { "epoch": 0.17408, "grad_norm": 0.7109375, "learning_rate": 4.9582780867161893e-05, "loss": 0.6091556549072266, "num_input_tokens_seen": 34045312, "step": 170, "train_runtime": 1213.0324, "train_tokens_per_second": 28066.285 }, { "epoch": 0.18432, "grad_norm": 0.78515625, "learning_rate": 4.955841945417105e-05, "loss": 0.6014857292175293, "num_input_tokens_seen": 36041984, "step": 180, "train_runtime": 1284.4625, "train_tokens_per_second": 28059.973 }, { "epoch": 0.19456, "grad_norm": 0.796875, "learning_rate": 4.953409391427024e-05, "loss": 0.6027495384216308, "num_input_tokens_seen": 38059520, "step": 190, "train_runtime": 1357.0611, "train_tokens_per_second": 28045.547 }, { "epoch": 0.2048, "grad_norm": 0.6953125, "learning_rate": 4.950980415950502e-05, "loss": 0.5953609943389893, "num_input_tokens_seen": 40065728, "step": 200, "train_runtime": 1427.2344, "train_tokens_per_second": 28072.282 }, { "epoch": 0.21504, "grad_norm": 0.69921875, "learning_rate": 4.9485550102222575e-05, "loss": 0.591309928894043, "num_input_tokens_seen": 42083968, "step": 210, "train_runtime": 1501.0913, "train_tokens_per_second": 28035.582 }, { "epoch": 0.22528, "grad_norm": 0.73046875, "learning_rate": 4.946133165507037e-05, "loss": 0.5896960258483886, "num_input_tokens_seen": 44073920, "step": 220, "train_runtime": 1569.5078, "train_tokens_per_second": 28081.364 }, { "epoch": 0.23552, "grad_norm": 0.72265625, "learning_rate": 4.943714873099483e-05, "loss": 0.5793526649475098, "num_input_tokens_seen": 46068544, "step": 230, "train_runtime": 1641.5574, "train_tokens_per_second": 28063.925 }, { "epoch": 0.24576, "grad_norm": 0.69921875, "learning_rate": 4.9413001243240024e-05, "loss": 0.5720966339111329, "num_input_tokens_seen": 48050304, "step": 240, "train_runtime": 1709.9005, "train_tokens_per_second": 28101.228 }, { "epoch": 0.256, "grad_norm": 0.765625, "learning_rate": 4.938888910534637e-05, "loss": 0.5646713256835938, "num_input_tokens_seen": 50064064, "step": 250, "train_runtime": 1781.3025, "train_tokens_per_second": 28105.313 }, { "epoch": 0.26624, "grad_norm": 0.7265625, "learning_rate": 4.936481223114932e-05, "loss": 0.5561185359954834, "num_input_tokens_seen": 52031040, "step": 260, "train_runtime": 1851.0666, "train_tokens_per_second": 28108.681 }, { "epoch": 0.27648, "grad_norm": 0.703125, "learning_rate": 4.934077053477808e-05, "loss": 0.5607205390930176, "num_input_tokens_seen": 54084992, "step": 270, "train_runtime": 1927.1749, "train_tokens_per_second": 28064.392 }, { "epoch": 0.28672, "grad_norm": 0.7734375, "learning_rate": 4.931676393065431e-05, "loss": 0.5556824207305908, "num_input_tokens_seen": 56127680, "step": 280, "train_runtime": 2002.628, "train_tokens_per_second": 28027.013 }, { "epoch": 0.29696, "grad_norm": 0.83984375, "learning_rate": 4.929279233349088e-05, "loss": 0.5448642253875733, "num_input_tokens_seen": 58121600, "step": 290, "train_runtime": 2075.5184, "train_tokens_per_second": 28003.414 }, { "epoch": 0.3072, "grad_norm": 0.75390625, "learning_rate": 4.926885565829051e-05, "loss": 0.5425375461578369, "num_input_tokens_seen": 60109120, "step": 300, "train_runtime": 2144.3013, "train_tokens_per_second": 28032.031 }, { "epoch": 0.31744, "grad_norm": 0.77734375, "learning_rate": 4.924495382034461e-05, "loss": 0.5364805221557617, "num_input_tokens_seen": 62133824, "step": 310, "train_runtime": 2217.0864, "train_tokens_per_second": 28024.989 }, { "epoch": 0.32768, "grad_norm": 0.7578125, "learning_rate": 4.9221086735231975e-05, "loss": 0.5378639221191406, "num_input_tokens_seen": 64119488, "step": 320, "train_runtime": 2287.4996, "train_tokens_per_second": 28030.382 }, { "epoch": 0.33792, "grad_norm": 0.73046875, "learning_rate": 4.919725431881751e-05, "loss": 0.5275018692016602, "num_input_tokens_seen": 66128448, "step": 330, "train_runtime": 2358.2459, "train_tokens_per_second": 28041.371 }, { "epoch": 0.34816, "grad_norm": 0.8125, "learning_rate": 4.917345648725101e-05, "loss": 0.5153440475463867, "num_input_tokens_seen": 68116544, "step": 340, "train_runtime": 2428.0793, "train_tokens_per_second": 28053.674 }, { "epoch": 0.3584, "grad_norm": 0.76171875, "learning_rate": 4.914969315696596e-05, "loss": 0.5185441493988037, "num_input_tokens_seen": 70149184, "step": 350, "train_runtime": 2501.5845, "train_tokens_per_second": 28041.901 }, { "epoch": 0.36864, "grad_norm": 0.77734375, "learning_rate": 4.912596424467818e-05, "loss": 0.5040504455566406, "num_input_tokens_seen": 72165696, "step": 360, "train_runtime": 2574.6205, "train_tokens_per_second": 28029.644 }, { "epoch": 0.37888, "grad_norm": 0.80078125, "learning_rate": 4.910226966738475e-05, "loss": 0.5027976989746094, "num_input_tokens_seen": 74176064, "step": 370, "train_runtime": 2644.8094, "train_tokens_per_second": 28045.902 }, { "epoch": 0.38912, "grad_norm": 0.796875, "learning_rate": 4.9078609342362666e-05, "loss": 0.5017495155334473, "num_input_tokens_seen": 76208256, "step": 380, "train_runtime": 2720.5861, "train_tokens_per_second": 28011.705 }, { "epoch": 0.39936, "grad_norm": 0.796875, "learning_rate": 4.905498318716775e-05, "loss": 0.49234929084777834, "num_input_tokens_seen": 78227520, "step": 390, "train_runtime": 2795.2918, "train_tokens_per_second": 27985.458 }, { "epoch": 0.4096, "grad_norm": 0.7578125, "learning_rate": 4.9031391119633295e-05, "loss": 0.484727144241333, "num_input_tokens_seen": 80247232, "step": 400, "train_runtime": 2869.3909, "train_tokens_per_second": 27966.644 }, { "epoch": 0.41984, "grad_norm": 0.828125, "learning_rate": 4.9007833057869e-05, "loss": 0.4728262901306152, "num_input_tokens_seen": 82212032, "step": 410, "train_runtime": 2936.8857, "train_tokens_per_second": 27992.928 }, { "epoch": 0.43008, "grad_norm": 0.8125, "learning_rate": 4.898430892025967e-05, "loss": 0.46816487312316896, "num_input_tokens_seen": 84214528, "step": 420, "train_runtime": 3010.5759, "train_tokens_per_second": 27972.897 }, { "epoch": 0.44032, "grad_norm": 0.796875, "learning_rate": 4.896081862546415e-05, "loss": 0.4631038665771484, "num_input_tokens_seen": 86207424, "step": 430, "train_runtime": 3081.7088, "train_tokens_per_second": 27973.904 }, { "epoch": 0.45056, "grad_norm": 0.828125, "learning_rate": 4.8937362092414e-05, "loss": 0.461610221862793, "num_input_tokens_seen": 88220096, "step": 440, "train_runtime": 3153.0068, "train_tokens_per_second": 27979.672 }, { "epoch": 0.4608, "grad_norm": 0.828125, "learning_rate": 4.891393924031244e-05, "loss": 0.4538113594055176, "num_input_tokens_seen": 90255296, "step": 450, "train_runtime": 3226.7084, "train_tokens_per_second": 27971.321 }, { "epoch": 0.47104, "grad_norm": 0.8671875, "learning_rate": 4.8890549988633095e-05, "loss": 0.44371371269226073, "num_input_tokens_seen": 92284992, "step": 460, "train_runtime": 3302.3683, "train_tokens_per_second": 27945.094 }, { "epoch": 0.48128, "grad_norm": 0.828125, "learning_rate": 4.8867194257118907e-05, "loss": 0.43736696243286133, "num_input_tokens_seen": 94290304, "step": 470, "train_runtime": 3372.562, "train_tokens_per_second": 27958.064 }, { "epoch": 0.49152, "grad_norm": 0.8828125, "learning_rate": 4.884387196578093e-05, "loss": 0.4319791793823242, "num_input_tokens_seen": 96299392, "step": 480, "train_runtime": 3444.2699, "train_tokens_per_second": 27959.305 }, { "epoch": 0.50176, "grad_norm": 0.828125, "learning_rate": 4.882058303489718e-05, "loss": 0.42551512718200685, "num_input_tokens_seen": 98281856, "step": 490, "train_runtime": 3512.8617, "train_tokens_per_second": 27977.719 }, { "epoch": 0.512, "grad_norm": 0.93359375, "learning_rate": 4.8797327385011496e-05, "loss": 0.4181091785430908, "num_input_tokens_seen": 100274880, "step": 500, "train_runtime": 3583.7895, "train_tokens_per_second": 27980.125 }, { "epoch": 0.52224, "grad_norm": 0.93359375, "learning_rate": 4.8774104936932425e-05, "loss": 0.41173620223999025, "num_input_tokens_seen": 102286784, "step": 510, "train_runtime": 3656.7659, "train_tokens_per_second": 27971.926 }, { "epoch": 0.53248, "grad_norm": 0.90234375, "learning_rate": 4.8750915611732076e-05, "loss": 0.4068614959716797, "num_input_tokens_seen": 104322752, "step": 520, "train_runtime": 3731.2961, "train_tokens_per_second": 27958.851 }, { "epoch": 0.54272, "grad_norm": 0.89453125, "learning_rate": 4.8727759330744986e-05, "loss": 0.39957451820373535, "num_input_tokens_seen": 106331264, "step": 530, "train_runtime": 3804.5982, "train_tokens_per_second": 27948.093 }, { "epoch": 0.55296, "grad_norm": 0.90234375, "learning_rate": 4.870463601556696e-05, "loss": 0.39169912338256835, "num_input_tokens_seen": 108363392, "step": 540, "train_runtime": 3878.5043, "train_tokens_per_second": 27939.48 }, { "epoch": 0.5632, "grad_norm": 0.96875, "learning_rate": 4.8681545588054075e-05, "loss": 0.39029181003570557, "num_input_tokens_seen": 110375744, "step": 550, "train_runtime": 3951.3561, "train_tokens_per_second": 27933.636 }, { "epoch": 0.57344, "grad_norm": 0.88671875, "learning_rate": 4.8658487970321404e-05, "loss": 0.37695889472961425, "num_input_tokens_seen": 112386624, "step": 560, "train_runtime": 4021.0522, "train_tokens_per_second": 27949.556 }, { "epoch": 0.58368, "grad_norm": 0.9296875, "learning_rate": 4.863546308474209e-05, "loss": 0.3717223644256592, "num_input_tokens_seen": 114487616, "step": 570, "train_runtime": 4102.2077, "train_tokens_per_second": 27908.781 }, { "epoch": 0.59392, "grad_norm": 1.0078125, "learning_rate": 4.86124708539461e-05, "loss": 0.36314547061920166, "num_input_tokens_seen": 116502464, "step": 580, "train_runtime": 4172.9104, "train_tokens_per_second": 27918.755 }, { "epoch": 0.60416, "grad_norm": 0.96484375, "learning_rate": 4.8589511200819216e-05, "loss": 0.35808553695678713, "num_input_tokens_seen": 118472896, "step": 590, "train_runtime": 4242.4324, "train_tokens_per_second": 27925.7 }, { "epoch": 0.6144, "grad_norm": 1.0234375, "learning_rate": 4.8566584048501926e-05, "loss": 0.354917311668396, "num_input_tokens_seen": 120475328, "step": 600, "train_runtime": 4312.8827, "train_tokens_per_second": 27933.829 }, { "epoch": 0.62464, "grad_norm": 1.140625, "learning_rate": 4.854368932038835e-05, "loss": 0.3452127456665039, "num_input_tokens_seen": 122458496, "step": 610, "train_runtime": 4383.9692, "train_tokens_per_second": 27933.247 }, { "epoch": 0.63488, "grad_norm": 0.9765625, "learning_rate": 4.8520826940125144e-05, "loss": 0.3381240129470825, "num_input_tokens_seen": 124439360, "step": 620, "train_runtime": 4453.0594, "train_tokens_per_second": 27944.689 }, { "epoch": 0.64512, "grad_norm": 1.0234375, "learning_rate": 4.849799683161046e-05, "loss": 0.3313805818557739, "num_input_tokens_seen": 126467840, "step": 630, "train_runtime": 4528.0794, "train_tokens_per_second": 27929.687 }, { "epoch": 0.65536, "grad_norm": 0.9921875, "learning_rate": 4.8475198918992835e-05, "loss": 0.3252664566040039, "num_input_tokens_seen": 128480448, "step": 640, "train_runtime": 4598.842, "train_tokens_per_second": 27937.565 }, { "epoch": 0.6656, "grad_norm": 1.03125, "learning_rate": 4.845243312667023e-05, "loss": 0.3170381784439087, "num_input_tokens_seen": 130479232, "step": 650, "train_runtime": 4670.9911, "train_tokens_per_second": 27933.95 }, { "epoch": 0.67584, "grad_norm": 1.0390625, "learning_rate": 4.842969937928884e-05, "loss": 0.3079851150512695, "num_input_tokens_seen": 132478912, "step": 660, "train_runtime": 4743.4655, "train_tokens_per_second": 27928.719 }, { "epoch": 0.68608, "grad_norm": 0.95703125, "learning_rate": 4.840699760174217e-05, "loss": 0.3024315357208252, "num_input_tokens_seen": 134473408, "step": 670, "train_runtime": 4814.1152, "train_tokens_per_second": 27933.151 }, { "epoch": 0.69632, "grad_norm": 0.9921875, "learning_rate": 4.8384327719169906e-05, "loss": 0.29927806854248046, "num_input_tokens_seen": 136482944, "step": 680, "train_runtime": 4885.2798, "train_tokens_per_second": 27937.59 }, { "epoch": 0.70656, "grad_norm": 1.03125, "learning_rate": 4.836168965695694e-05, "loss": 0.2894315242767334, "num_input_tokens_seen": 138476544, "step": 690, "train_runtime": 4954.8336, "train_tokens_per_second": 27947.769 }, { "epoch": 0.7168, "grad_norm": 1.0546875, "learning_rate": 4.8339083340732304e-05, "loss": 0.2819934129714966, "num_input_tokens_seen": 140478784, "step": 700, "train_runtime": 5026.8737, "train_tokens_per_second": 27945.557 }, { "epoch": 0.72704, "grad_norm": 1.0078125, "learning_rate": 4.8316508696368154e-05, "loss": 0.2754687309265137, "num_input_tokens_seen": 142543936, "step": 710, "train_runtime": 5103.5664, "train_tokens_per_second": 27930.26 }, { "epoch": 0.73728, "grad_norm": 1.03125, "learning_rate": 4.8293965649978714e-05, "loss": 0.2691352367401123, "num_input_tokens_seen": 144565184, "step": 720, "train_runtime": 5175.4661, "train_tokens_per_second": 27932.785 }, { "epoch": 0.74752, "grad_norm": 0.98046875, "learning_rate": 4.8271454127919364e-05, "loss": 0.2596245765686035, "num_input_tokens_seen": 146591872, "step": 730, "train_runtime": 5247.7226, "train_tokens_per_second": 27934.379 }, { "epoch": 0.75776, "grad_norm": 1.0390625, "learning_rate": 4.824897405678549e-05, "loss": 0.253094482421875, "num_input_tokens_seen": 148609728, "step": 740, "train_runtime": 5319.8801, "train_tokens_per_second": 27934.789 }, { "epoch": 0.768, "grad_norm": 1.0546875, "learning_rate": 4.8226525363411576e-05, "loss": 0.24751272201538085, "num_input_tokens_seen": 150619520, "step": 750, "train_runtime": 5392.3341, "train_tokens_per_second": 27932.156 }, { "epoch": 0.77824, "grad_norm": 1.09375, "learning_rate": 4.820410797487017e-05, "loss": 0.2425351619720459, "num_input_tokens_seen": 152618560, "step": 760, "train_runtime": 5463.9119, "train_tokens_per_second": 27932.105 }, { "epoch": 0.78848, "grad_norm": 1.046875, "learning_rate": 4.818172181847091e-05, "loss": 0.2338550090789795, "num_input_tokens_seen": 154616256, "step": 770, "train_runtime": 5536.4143, "train_tokens_per_second": 27927.147 }, { "epoch": 0.79872, "grad_norm": 1.0625, "learning_rate": 4.81593668217595e-05, "loss": 0.23002958297729492, "num_input_tokens_seen": 156632640, "step": 780, "train_runtime": 5609.7259, "train_tokens_per_second": 27921.621 }, { "epoch": 0.80896, "grad_norm": 1.0859375, "learning_rate": 4.813704291251675e-05, "loss": 0.22488293647766114, "num_input_tokens_seen": 158627584, "step": 790, "train_runtime": 5679.5407, "train_tokens_per_second": 27929.65 }, { "epoch": 0.8192, "grad_norm": 1.0859375, "learning_rate": 4.811475001875759e-05, "loss": 0.21674442291259766, "num_input_tokens_seen": 160628608, "step": 800, "train_runtime": 5751.3102, "train_tokens_per_second": 27929.046 }, { "epoch": 0.82944, "grad_norm": 1.046875, "learning_rate": 4.8092488068730105e-05, "loss": 0.21201133728027344, "num_input_tokens_seen": 162631040, "step": 810, "train_runtime": 5823.6015, "train_tokens_per_second": 27926.197 }, { "epoch": 0.83968, "grad_norm": 1.0703125, "learning_rate": 4.807025699091452e-05, "loss": 0.20578887462615966, "num_input_tokens_seen": 164655936, "step": 820, "train_runtime": 5896.4283, "train_tokens_per_second": 27924.691 }, { "epoch": 0.84992, "grad_norm": 1.0546875, "learning_rate": 4.8048056714022325e-05, "loss": 0.20376951694488527, "num_input_tokens_seen": 166635648, "step": 830, "train_runtime": 5965.7043, "train_tokens_per_second": 27932.267 }, { "epoch": 0.86016, "grad_norm": 1.015625, "learning_rate": 4.802588716699519e-05, "loss": 0.19258487224578857, "num_input_tokens_seen": 168677504, "step": 840, "train_runtime": 6039.5258, "train_tokens_per_second": 27928.932 }, { "epoch": 0.8704, "grad_norm": 1.0390625, "learning_rate": 4.8003748279004156e-05, "loss": 0.18773103952407838, "num_input_tokens_seen": 170712320, "step": 850, "train_runtime": 6113.2217, "train_tokens_per_second": 27925.099 }, { "epoch": 0.88064, "grad_norm": 1.0546875, "learning_rate": 4.798163997944854e-05, "loss": 0.1815708875656128, "num_input_tokens_seen": 172726592, "step": 860, "train_runtime": 6185.6798, "train_tokens_per_second": 27923.623 }, { "epoch": 0.89088, "grad_norm": 1.0234375, "learning_rate": 4.79595621979551e-05, "loss": 0.17781240940093995, "num_input_tokens_seen": 174723904, "step": 870, "train_runtime": 6257.3588, "train_tokens_per_second": 27922.948 }, { "epoch": 0.90112, "grad_norm": 1.0546875, "learning_rate": 4.793751486437702e-05, "loss": 0.1705024003982544, "num_input_tokens_seen": 176724608, "step": 880, "train_runtime": 6327.7475, "train_tokens_per_second": 27928.518 }, { "epoch": 0.91136, "grad_norm": 1.0703125, "learning_rate": 4.7915497908793064e-05, "loss": 0.1674124240875244, "num_input_tokens_seen": 178766720, "step": 890, "train_runtime": 6403.1314, "train_tokens_per_second": 27918.64 }, { "epoch": 0.9216, "grad_norm": 1.0234375, "learning_rate": 4.7893511261506516e-05, "loss": 0.1599474549293518, "num_input_tokens_seen": 180780864, "step": 900, "train_runtime": 6474.1823, "train_tokens_per_second": 27923.351 }, { "epoch": 0.93184, "grad_norm": 1.015625, "learning_rate": 4.787155485304435e-05, "loss": 0.1556488037109375, "num_input_tokens_seen": 182756544, "step": 910, "train_runtime": 6543.9244, "train_tokens_per_second": 27927.667 }, { "epoch": 0.94208, "grad_norm": 1.0078125, "learning_rate": 4.784962861415629e-05, "loss": 0.14749314785003662, "num_input_tokens_seen": 184760448, "step": 920, "train_runtime": 6614.61, "train_tokens_per_second": 27932.175 }, { "epoch": 0.95232, "grad_norm": 1.0078125, "learning_rate": 4.7827732475813884e-05, "loss": 0.14295361042022706, "num_input_tokens_seen": 186755072, "step": 930, "train_runtime": 6683.9789, "train_tokens_per_second": 27940.703 }, { "epoch": 0.96256, "grad_norm": 1.0625, "learning_rate": 4.7805866369209576e-05, "loss": 0.13959715366363526, "num_input_tokens_seen": 188760896, "step": 940, "train_runtime": 6755.7296, "train_tokens_per_second": 27940.86 }, { "epoch": 0.9728, "grad_norm": 0.94921875, "learning_rate": 4.778403022575583e-05, "loss": 0.13509231805801392, "num_input_tokens_seen": 190778560, "step": 950, "train_runtime": 6828.6224, "train_tokens_per_second": 27938.074 }, { "epoch": 0.98304, "grad_norm": 1.03125, "learning_rate": 4.7762223977084195e-05, "loss": 0.12972679138183593, "num_input_tokens_seen": 192799232, "step": 960, "train_runtime": 6901.063, "train_tokens_per_second": 27937.614 }, { "epoch": 0.99328, "grad_norm": 1.0234375, "learning_rate": 4.774044755504444e-05, "loss": 0.12503955364227295, "num_input_tokens_seen": 194792768, "step": 970, "train_runtime": 6970.347, "train_tokens_per_second": 27945.921 }, { "epoch": 1.003072, "grad_norm": 0.81640625, "learning_rate": 4.7718700891703616e-05, "loss": 0.10986135005950928, "num_input_tokens_seen": 196668032, "step": 980, "train_runtime": 7035.0779, "train_tokens_per_second": 27955.345 }, { "epoch": 1.013312, "grad_norm": 0.8671875, "learning_rate": 4.7696983919345215e-05, "loss": 0.08115079402923583, "num_input_tokens_seen": 198703552, "step": 990, "train_runtime": 7109.6942, "train_tokens_per_second": 27948.256 }, { "epoch": 1.023552, "grad_norm": 0.7890625, "learning_rate": 4.7675296570468216e-05, "loss": 0.07811311483383179, "num_input_tokens_seen": 200721088, "step": 1000, "train_runtime": 7182.0942, "train_tokens_per_second": 27947.432 }, { "epoch": 1.033792, "grad_norm": 0.83203125, "learning_rate": 4.76536387777863e-05, "loss": 0.07646113634109497, "num_input_tokens_seen": 202724032, "step": 1010, "train_runtime": 7255.6602, "train_tokens_per_second": 27940.122 }, { "epoch": 1.044032, "grad_norm": 0.8203125, "learning_rate": 4.7632010474226915e-05, "loss": 0.07352162599563598, "num_input_tokens_seen": 204720448, "step": 1020, "train_runtime": 7325.7825, "train_tokens_per_second": 27945.199 }, { "epoch": 1.054272, "grad_norm": 0.80078125, "learning_rate": 4.761041159293035e-05, "loss": 0.07193953990936279, "num_input_tokens_seen": 206747072, "step": 1030, "train_runtime": 7398.5275, "train_tokens_per_second": 27944.354 }, { "epoch": 1.064512, "grad_norm": 0.78515625, "learning_rate": 4.7588842067249e-05, "loss": 0.07109384536743164, "num_input_tokens_seen": 208767168, "step": 1040, "train_runtime": 7471.9759, "train_tokens_per_second": 27940.022 }, { "epoch": 1.074752, "grad_norm": 0.8125, "learning_rate": 4.756730183074637e-05, "loss": 0.06862571239471435, "num_input_tokens_seen": 210755648, "step": 1050, "train_runtime": 7542.5772, "train_tokens_per_second": 27942.127 }, { "epoch": 1.084992, "grad_norm": 0.75390625, "learning_rate": 4.7545790817196314e-05, "loss": 0.06509301662445069, "num_input_tokens_seen": 212746688, "step": 1060, "train_runtime": 7611.2774, "train_tokens_per_second": 27951.509 }, { "epoch": 1.095232, "grad_norm": 0.7421875, "learning_rate": 4.752430896058212e-05, "loss": 0.06395751237869263, "num_input_tokens_seen": 214772352, "step": 1070, "train_runtime": 7684.2744, "train_tokens_per_second": 27949.594 }, { "epoch": 1.105472, "grad_norm": 0.73046875, "learning_rate": 4.750285619509567e-05, "loss": 0.06260917186737061, "num_input_tokens_seen": 216773568, "step": 1080, "train_runtime": 7754.914, "train_tokens_per_second": 27953.059 }, { "epoch": 1.115712, "grad_norm": 0.73828125, "learning_rate": 4.7481432455136644e-05, "loss": 0.062073934078216556, "num_input_tokens_seen": 218764928, "step": 1090, "train_runtime": 7826.8462, "train_tokens_per_second": 27950.585 }, { "epoch": 1.125952, "grad_norm": 0.83984375, "learning_rate": 4.7460037675311584e-05, "loss": 0.057993775606155394, "num_input_tokens_seen": 220755776, "step": 1100, "train_runtime": 7897.56, "train_tokens_per_second": 27952.403 }, { "epoch": 1.136192, "grad_norm": 0.69921875, "learning_rate": 4.7438671790433126e-05, "loss": 0.05776026248931885, "num_input_tokens_seen": 222748608, "step": 1110, "train_runtime": 7967.3823, "train_tokens_per_second": 27957.565 }, { "epoch": 1.146432, "grad_norm": 0.703125, "learning_rate": 4.741733473551915e-05, "loss": 0.05773916840553284, "num_input_tokens_seen": 224784512, "step": 1120, "train_runtime": 8041.8087, "train_tokens_per_second": 27951.984 }, { "epoch": 1.156672, "grad_norm": 0.734375, "learning_rate": 4.7396026445791966e-05, "loss": 0.05507153272628784, "num_input_tokens_seen": 226813120, "step": 1130, "train_runtime": 8115.4978, "train_tokens_per_second": 27948.146 }, { "epoch": 1.166912, "grad_norm": 0.75390625, "learning_rate": 4.737474685667742e-05, "loss": 0.05341644287109375, "num_input_tokens_seen": 228815232, "step": 1140, "train_runtime": 8187.3704, "train_tokens_per_second": 27947.341 }, { "epoch": 1.177152, "grad_norm": 0.73828125, "learning_rate": 4.7353495903804165e-05, "loss": 0.05063482522964478, "num_input_tokens_seen": 230880320, "step": 1150, "train_runtime": 8264.2254, "train_tokens_per_second": 27937.321 }, { "epoch": 1.187392, "grad_norm": 0.69140625, "learning_rate": 4.733227352300277e-05, "loss": 0.050589507818222045, "num_input_tokens_seen": 232907904, "step": 1160, "train_runtime": 8338.7653, "train_tokens_per_second": 27930.742 }, { "epoch": 1.197632, "grad_norm": 0.671875, "learning_rate": 4.731107965030496e-05, "loss": 0.04946887493133545, "num_input_tokens_seen": 234922176, "step": 1170, "train_runtime": 8410.7105, "train_tokens_per_second": 27931.312 }, { "epoch": 1.207872, "grad_norm": 0.70703125, "learning_rate": 4.728991422194278e-05, "loss": 0.04885604977607727, "num_input_tokens_seen": 236912128, "step": 1180, "train_runtime": 8481.0624, "train_tokens_per_second": 27934.251 }, { "epoch": 1.218112, "grad_norm": 0.671875, "learning_rate": 4.726877717434773e-05, "loss": 0.048174849152565, "num_input_tokens_seen": 238900864, "step": 1190, "train_runtime": 8551.1679, "train_tokens_per_second": 27937.805 }, { "epoch": 1.228352, "grad_norm": 0.6328125, "learning_rate": 4.724766844415013e-05, "loss": 0.04597228169441223, "num_input_tokens_seen": 240960448, "step": 1200, "train_runtime": 8627.7254, "train_tokens_per_second": 27928.618 }, { "epoch": 1.238592, "grad_norm": 0.67578125, "learning_rate": 4.722658796817813e-05, "loss": 0.04480882287025452, "num_input_tokens_seen": 242998848, "step": 1210, "train_runtime": 8702.6979, "train_tokens_per_second": 27922.243 }, { "epoch": 1.248832, "grad_norm": 0.6328125, "learning_rate": 4.7205535683457044e-05, "loss": 0.04354588389396667, "num_input_tokens_seen": 244947776, "step": 1220, "train_runtime": 8767.6922, "train_tokens_per_second": 27937.543 }, { "epoch": 1.259072, "grad_norm": 0.68359375, "learning_rate": 4.7184511527208484e-05, "loss": 0.041252422332763675, "num_input_tokens_seen": 246951744, "step": 1230, "train_runtime": 8838.7543, "train_tokens_per_second": 27939.655 }, { "epoch": 1.269312, "grad_norm": 0.58984375, "learning_rate": 4.7163515436849644e-05, "loss": 0.03930726945400238, "num_input_tokens_seen": 248987840, "step": 1240, "train_runtime": 8912.5272, "train_tokens_per_second": 27936.839 }, { "epoch": 1.279552, "grad_norm": 0.6171875, "learning_rate": 4.714254734999245e-05, "loss": 0.03749307096004486, "num_input_tokens_seen": 250972928, "step": 1250, "train_runtime": 8981.968, "train_tokens_per_second": 27941.864 }, { "epoch": 1.289792, "grad_norm": 0.63671875, "learning_rate": 4.712160720444284e-05, "loss": 0.03726911842823029, "num_input_tokens_seen": 252991744, "step": 1260, "train_runtime": 9053.9267, "train_tokens_per_second": 27942.765 }, { "epoch": 1.300032, "grad_norm": 0.59765625, "learning_rate": 4.710069493819992e-05, "loss": 0.03688657283782959, "num_input_tokens_seen": 254978432, "step": 1270, "train_runtime": 9124.0045, "train_tokens_per_second": 27945.891 }, { "epoch": 1.3102719999999999, "grad_norm": 0.6484375, "learning_rate": 4.70798104894553e-05, "loss": 0.03622893989086151, "num_input_tokens_seen": 256958912, "step": 1280, "train_runtime": 9192.9137, "train_tokens_per_second": 27951.847 }, { "epoch": 1.320512, "grad_norm": 0.640625, "learning_rate": 4.705895379659219e-05, "loss": 0.03448793888092041, "num_input_tokens_seen": 258927104, "step": 1290, "train_runtime": 9261.8009, "train_tokens_per_second": 27956.453 }, { "epoch": 1.330752, "grad_norm": 0.62890625, "learning_rate": 4.7038124798184766e-05, "loss": 0.03333508670330047, "num_input_tokens_seen": 260902016, "step": 1300, "train_runtime": 9331.4024, "train_tokens_per_second": 27959.572 }, { "epoch": 1.340992, "grad_norm": 0.5625, "learning_rate": 4.7017323432997304e-05, "loss": 0.032725405693054196, "num_input_tokens_seen": 262909696, "step": 1310, "train_runtime": 9403.9992, "train_tokens_per_second": 27957.222 }, { "epoch": 1.351232, "grad_norm": 0.56640625, "learning_rate": 4.6996549639983506e-05, "loss": 0.03168002963066101, "num_input_tokens_seen": 264930176, "step": 1320, "train_runtime": 9476.4205, "train_tokens_per_second": 27956.777 }, { "epoch": 1.361472, "grad_norm": 0.55078125, "learning_rate": 4.697580335828569e-05, "loss": 0.02995384335517883, "num_input_tokens_seen": 266964480, "step": 1330, "train_runtime": 9550.7511, "train_tokens_per_second": 27952.197 }, { "epoch": 1.371712, "grad_norm": 0.6015625, "learning_rate": 4.6955084527234076e-05, "loss": 0.030216827988624573, "num_input_tokens_seen": 268993664, "step": 1340, "train_runtime": 9623.3266, "train_tokens_per_second": 27952.254 }, { "epoch": 1.381952, "grad_norm": 0.56640625, "learning_rate": 4.6934393086346034e-05, "loss": 0.028735750913619997, "num_input_tokens_seen": 270981248, "step": 1350, "train_runtime": 9691.2828, "train_tokens_per_second": 27961.339 }, { "epoch": 1.392192, "grad_norm": 0.55859375, "learning_rate": 4.6913728975325324e-05, "loss": 0.026437461376190186, "num_input_tokens_seen": 272987712, "step": 1360, "train_runtime": 9762.0951, "train_tokens_per_second": 27964.05 }, { "epoch": 1.4024320000000001, "grad_norm": 0.58984375, "learning_rate": 4.6893092134061393e-05, "loss": 0.02681639790534973, "num_input_tokens_seen": 275016192, "step": 1370, "train_runtime": 9836.7175, "train_tokens_per_second": 27958.127 }, { "epoch": 1.412672, "grad_norm": 0.46875, "learning_rate": 4.687248250262859e-05, "loss": 0.02621593475341797, "num_input_tokens_seen": 277001984, "step": 1380, "train_runtime": 9907.0035, "train_tokens_per_second": 27960.219 }, { "epoch": 1.422912, "grad_norm": 0.59375, "learning_rate": 4.685190002128548e-05, "loss": 0.025581035017967223, "num_input_tokens_seen": 279033856, "step": 1390, "train_runtime": 9982.0945, "train_tokens_per_second": 27953.438 }, { "epoch": 1.433152, "grad_norm": 0.55078125, "learning_rate": 4.6831344630474114e-05, "loss": 0.02472420036792755, "num_input_tokens_seen": 281106624, "step": 1400, "train_runtime": 10061.1573, "train_tokens_per_second": 27939.79 }, { "epoch": 1.443392, "grad_norm": 0.51953125, "learning_rate": 4.6810816270819276e-05, "loss": 0.023309352993965148, "num_input_tokens_seen": 283099072, "step": 1410, "train_runtime": 10129.2372, "train_tokens_per_second": 27948.706 }, { "epoch": 1.453632, "grad_norm": 0.494140625, "learning_rate": 4.679031488312777e-05, "loss": 0.0234044149518013, "num_input_tokens_seen": 285122560, "step": 1420, "train_runtime": 10204.0696, "train_tokens_per_second": 27942.044 }, { "epoch": 1.463872, "grad_norm": 0.64453125, "learning_rate": 4.6769840408387717e-05, "loss": 0.021864794194698334, "num_input_tokens_seen": 287115584, "step": 1430, "train_runtime": 10275.7948, "train_tokens_per_second": 27940.961 }, { "epoch": 1.4741119999999999, "grad_norm": 0.40234375, "learning_rate": 4.674939278776787e-05, "loss": 0.022062216699123383, "num_input_tokens_seen": 289142976, "step": 1440, "train_runtime": 10348.4017, "train_tokens_per_second": 27940.834 }, { "epoch": 1.484352, "grad_norm": 0.421875, "learning_rate": 4.672897196261683e-05, "loss": 0.020946532487869263, "num_input_tokens_seen": 291151552, "step": 1450, "train_runtime": 10420.2833, "train_tokens_per_second": 27940.848 }, { "epoch": 1.494592, "grad_norm": 0.4921875, "learning_rate": 4.670857787446238e-05, "loss": 0.021855458617210388, "num_input_tokens_seen": 293175936, "step": 1460, "train_runtime": 10494.1522, "train_tokens_per_second": 27937.077 }, { "epoch": 1.504832, "grad_norm": 0.427734375, "learning_rate": 4.668821046501082e-05, "loss": 0.019446633756160736, "num_input_tokens_seen": 295201984, "step": 1470, "train_runtime": 10566.8511, "train_tokens_per_second": 27936.609 }, { "epoch": 1.515072, "grad_norm": 0.447265625, "learning_rate": 4.6667869676146194e-05, "loss": 0.018910986185073853, "num_input_tokens_seen": 297239808, "step": 1480, "train_runtime": 10643.302, "train_tokens_per_second": 27927.405 }, { "epoch": 1.525312, "grad_norm": 0.416015625, "learning_rate": 4.6647555449929645e-05, "loss": 0.0188526451587677, "num_input_tokens_seen": 299265024, "step": 1490, "train_runtime": 10718.5795, "train_tokens_per_second": 27920.213 }, { "epoch": 1.535552, "grad_norm": 0.55859375, "learning_rate": 4.662726772859869e-05, "loss": 0.0179020956158638, "num_input_tokens_seen": 301289600, "step": 1500, "train_runtime": 10791.2591, "train_tokens_per_second": 27919.782 }, { "epoch": 1.545792, "grad_norm": 0.455078125, "learning_rate": 4.660700645456655e-05, "loss": 0.017698875069618224, "num_input_tokens_seen": 303298944, "step": 1510, "train_runtime": 10861.9474, "train_tokens_per_second": 27923.072 }, { "epoch": 1.556032, "grad_norm": 0.423828125, "learning_rate": 4.658677157042149e-05, "loss": 0.016229704022407532, "num_input_tokens_seen": 305301120, "step": 1520, "train_runtime": 10932.2024, "train_tokens_per_second": 27926.772 }, { "epoch": 1.566272, "grad_norm": 0.490234375, "learning_rate": 4.656656301892605e-05, "loss": 0.015268620848655701, "num_input_tokens_seen": 307290560, "step": 1530, "train_runtime": 11005.3403, "train_tokens_per_second": 27921.95 }, { "epoch": 1.5765120000000001, "grad_norm": 0.4453125, "learning_rate": 4.6546380743016465e-05, "loss": 0.016469526290893554, "num_input_tokens_seen": 309270848, "step": 1540, "train_runtime": 11074.3719, "train_tokens_per_second": 27926.717 }, { "epoch": 1.5867520000000002, "grad_norm": 0.4296875, "learning_rate": 4.652622468580193e-05, "loss": 0.015096321702003479, "num_input_tokens_seen": 311299328, "step": 1550, "train_runtime": 11146.7209, "train_tokens_per_second": 27927.435 }, { "epoch": 1.596992, "grad_norm": 0.349609375, "learning_rate": 4.650609479056392e-05, "loss": 0.015387380123138427, "num_input_tokens_seen": 313267840, "step": 1560, "train_runtime": 11214.5505, "train_tokens_per_second": 27934.052 }, { "epoch": 1.607232, "grad_norm": 0.365234375, "learning_rate": 4.648599100075556e-05, "loss": 0.014029040932655334, "num_input_tokens_seen": 315284992, "step": 1570, "train_runtime": 11285.1706, "train_tokens_per_second": 27937.991 }, { "epoch": 1.617472, "grad_norm": 0.35546875, "learning_rate": 4.6465913260000945e-05, "loss": 0.014028981328010559, "num_input_tokens_seen": 317306816, "step": 1580, "train_runtime": 11358.4592, "train_tokens_per_second": 27935.727 }, { "epoch": 1.627712, "grad_norm": 0.458984375, "learning_rate": 4.644586151209444e-05, "loss": 0.013350155949592591, "num_input_tokens_seen": 319310464, "step": 1590, "train_runtime": 11429.0808, "train_tokens_per_second": 27938.42 }, { "epoch": 1.6379519999999999, "grad_norm": 0.3515625, "learning_rate": 4.6425835701000084e-05, "loss": 0.013065680861473083, "num_input_tokens_seen": 321328896, "step": 1600, "train_runtime": 11500.7908, "train_tokens_per_second": 27939.722 }, { "epoch": 1.6481919999999999, "grad_norm": 0.31640625, "learning_rate": 4.640583577085084e-05, "loss": 0.012181369960308075, "num_input_tokens_seen": 323339008, "step": 1610, "train_runtime": 11573.5451, "train_tokens_per_second": 27937.767 }, { "epoch": 1.658432, "grad_norm": 0.33203125, "learning_rate": 4.638586166594806e-05, "loss": 0.012439670413732529, "num_input_tokens_seen": 325311936, "step": 1620, "train_runtime": 11642.5518, "train_tokens_per_second": 27941.635 }, { "epoch": 1.668672, "grad_norm": 0.322265625, "learning_rate": 4.6365913330760726e-05, "loss": 0.01156621277332306, "num_input_tokens_seen": 327330944, "step": 1630, "train_runtime": 11714.6579, "train_tokens_per_second": 27941.998 }, { "epoch": 1.678912, "grad_norm": 0.28515625, "learning_rate": 4.6345990709924855e-05, "loss": 0.011320900171995163, "num_input_tokens_seen": 329349504, "step": 1640, "train_runtime": 11785.6649, "train_tokens_per_second": 27944.924 }, { "epoch": 1.689152, "grad_norm": 0.298828125, "learning_rate": 4.632609374824284e-05, "loss": 0.011535357683897018, "num_input_tokens_seen": 331350144, "step": 1650, "train_runtime": 11854.516, "train_tokens_per_second": 27951.385 }, { "epoch": 1.699392, "grad_norm": 0.30859375, "learning_rate": 4.630622239068285e-05, "loss": 0.010813712328672408, "num_input_tokens_seen": 333357824, "step": 1660, "train_runtime": 11927.1145, "train_tokens_per_second": 27949.579 }, { "epoch": 1.709632, "grad_norm": 0.28515625, "learning_rate": 4.628637658237808e-05, "loss": 0.010460171103477477, "num_input_tokens_seen": 335369856, "step": 1670, "train_runtime": 11998.7216, "train_tokens_per_second": 27950.466 }, { "epoch": 1.719872, "grad_norm": 0.298828125, "learning_rate": 4.626655626862625e-05, "loss": 0.0098984993994236, "num_input_tokens_seen": 337365952, "step": 1680, "train_runtime": 12069.3316, "train_tokens_per_second": 27952.331 }, { "epoch": 1.730112, "grad_norm": 0.302734375, "learning_rate": 4.624676139488888e-05, "loss": 0.009945446252822876, "num_input_tokens_seen": 339410240, "step": 1690, "train_runtime": 12145.3379, "train_tokens_per_second": 27945.722 }, { "epoch": 1.7403520000000001, "grad_norm": 0.267578125, "learning_rate": 4.6226991906790686e-05, "loss": 0.009306684136390686, "num_input_tokens_seen": 341428992, "step": 1700, "train_runtime": 12215.6261, "train_tokens_per_second": 27950.184 }, { "epoch": 1.7505920000000001, "grad_norm": 0.2734375, "learning_rate": 4.620724775011897e-05, "loss": 0.009691517055034637, "num_input_tokens_seen": 343457216, "step": 1710, "train_runtime": 12288.8723, "train_tokens_per_second": 27948.636 }, { "epoch": 1.760832, "grad_norm": 0.255859375, "learning_rate": 4.618752887082297e-05, "loss": 0.008967689424753188, "num_input_tokens_seen": 345431232, "step": 1720, "train_runtime": 12357.6624, "train_tokens_per_second": 27952.797 }, { "epoch": 1.771072, "grad_norm": 0.2119140625, "learning_rate": 4.616783521501325e-05, "loss": 0.008772896230220794, "num_input_tokens_seen": 347450176, "step": 1730, "train_runtime": 12432.9551, "train_tokens_per_second": 27945.904 }, { "epoch": 1.781312, "grad_norm": 0.21484375, "learning_rate": 4.614816672896108e-05, "loss": 0.008689258992671967, "num_input_tokens_seen": 349421504, "step": 1740, "train_runtime": 12502.1965, "train_tokens_per_second": 27948.809 }, { "epoch": 1.791552, "grad_norm": 0.31640625, "learning_rate": 4.612852335909782e-05, "loss": 0.008518567681312561, "num_input_tokens_seen": 351366656, "step": 1750, "train_runtime": 12567.8285, "train_tokens_per_second": 27957.626 }, { "epoch": 1.8017919999999998, "grad_norm": 0.201171875, "learning_rate": 4.6108905052014323e-05, "loss": 0.008236590027809142, "num_input_tokens_seen": 353376960, "step": 1760, "train_runtime": 12639.0225, "train_tokens_per_second": 27959.2 }, { "epoch": 1.8120319999999999, "grad_norm": 0.205078125, "learning_rate": 4.608931175446027e-05, "loss": 0.007975803315639496, "num_input_tokens_seen": 355372096, "step": 1770, "train_runtime": 12707.5835, "train_tokens_per_second": 27965.356 }, { "epoch": 1.822272, "grad_norm": 0.2392578125, "learning_rate": 4.606974341334367e-05, "loss": 0.008116719126701356, "num_input_tokens_seen": 357352000, "step": 1780, "train_runtime": 12776.464, "train_tokens_per_second": 27969.554 }, { "epoch": 1.832512, "grad_norm": 0.2080078125, "learning_rate": 4.605019997573011e-05, "loss": 0.007819350808858871, "num_input_tokens_seen": 359375232, "step": 1790, "train_runtime": 12849.3423, "train_tokens_per_second": 27968.376 }, { "epoch": 1.842752, "grad_norm": 0.19140625, "learning_rate": 4.603068138884229e-05, "loss": 0.008013889193534851, "num_input_tokens_seen": 361425216, "step": 1800, "train_runtime": 12924.9298, "train_tokens_per_second": 27963.418 }, { "epoch": 1.852992, "grad_norm": 0.1669921875, "learning_rate": 4.6011187600059345e-05, "loss": 0.007500405609607697, "num_input_tokens_seen": 363422336, "step": 1810, "train_runtime": 12995.3355, "train_tokens_per_second": 27965.598 }, { "epoch": 1.863232, "grad_norm": 0.1669921875, "learning_rate": 4.599171855691629e-05, "loss": 0.007371760904788971, "num_input_tokens_seen": 365459840, "step": 1820, "train_runtime": 13073.2818, "train_tokens_per_second": 27954.713 }, { "epoch": 1.873472, "grad_norm": 0.14453125, "learning_rate": 4.597227420710335e-05, "loss": 0.007434654235839844, "num_input_tokens_seen": 367456320, "step": 1830, "train_runtime": 13143.2432, "train_tokens_per_second": 27957.812 }, { "epoch": 1.883712, "grad_norm": 0.154296875, "learning_rate": 4.595285449846551e-05, "loss": 0.007234874367713928, "num_input_tokens_seen": 369417920, "step": 1840, "train_runtime": 13211.8674, "train_tokens_per_second": 27961.068 }, { "epoch": 1.893952, "grad_norm": 0.1298828125, "learning_rate": 4.593345937900178e-05, "loss": 0.007048602402210236, "num_input_tokens_seen": 371435072, "step": 1850, "train_runtime": 13282.1544, "train_tokens_per_second": 27964.972 }, { "epoch": 1.904192, "grad_norm": 0.1708984375, "learning_rate": 4.591408879686472e-05, "loss": 0.007115562260150909, "num_input_tokens_seen": 373413504, "step": 1860, "train_runtime": 13349.1486, "train_tokens_per_second": 27972.833 }, { "epoch": 1.9144320000000001, "grad_norm": 0.12158203125, "learning_rate": 4.5894742700359775e-05, "loss": 0.0069166868925094604, "num_input_tokens_seen": 375452096, "step": 1870, "train_runtime": 13423.4693, "train_tokens_per_second": 27969.826 }, { "epoch": 1.9246720000000002, "grad_norm": 0.1474609375, "learning_rate": 4.587542103794477e-05, "loss": 0.006946581602096558, "num_input_tokens_seen": 377457408, "step": 1880, "train_runtime": 13494.4, "train_tokens_per_second": 27971.411 }, { "epoch": 1.934912, "grad_norm": 0.17578125, "learning_rate": 4.5856123758229247e-05, "loss": 0.006722895056009292, "num_input_tokens_seen": 379465216, "step": 1890, "train_runtime": 13564.8206, "train_tokens_per_second": 27974.216 }, { "epoch": 1.945152, "grad_norm": 0.134765625, "learning_rate": 4.5836850809973993e-05, "loss": 0.006712291389703751, "num_input_tokens_seen": 381443840, "step": 1900, "train_runtime": 13633.4473, "train_tokens_per_second": 27978.532 }, { "epoch": 1.955392, "grad_norm": 0.1435546875, "learning_rate": 4.5817602142090385e-05, "loss": 0.006593970954418183, "num_input_tokens_seen": 383492032, "step": 1910, "train_runtime": 13708.6021, "train_tokens_per_second": 27974.554 }, { "epoch": 1.965632, "grad_norm": 0.11181640625, "learning_rate": 4.579837770363989e-05, "loss": 0.006644654273986817, "num_input_tokens_seen": 385522624, "step": 1920, "train_runtime": 13781.8681, "train_tokens_per_second": 27973.176 }, { "epoch": 1.9758719999999999, "grad_norm": 0.146484375, "learning_rate": 4.57791774438334e-05, "loss": 0.006544043123722076, "num_input_tokens_seen": 387554240, "step": 1930, "train_runtime": 13856.7855, "train_tokens_per_second": 27968.553 }, { "epoch": 1.9861119999999999, "grad_norm": 0.12255859375, "learning_rate": 4.576000131203078e-05, "loss": 0.006355230510234833, "num_input_tokens_seen": 389552960, "step": 1940, "train_runtime": 13928.6465, "train_tokens_per_second": 27967.754 }, { "epoch": 1.996352, "grad_norm": 0.2099609375, "learning_rate": 4.574084925774023e-05, "loss": 0.006281337141990662, "num_input_tokens_seen": 391574656, "step": 1950, "train_runtime": 14002.5979, "train_tokens_per_second": 27964.429 }, { "epoch": 2.006144, "grad_norm": 0.10498046875, "learning_rate": 4.5721721230617795e-05, "loss": 0.005665350705385208, "num_input_tokens_seen": 393515200, "step": 1960, "train_runtime": 14072.0648, "train_tokens_per_second": 27964.283 }, { "epoch": 2.016384, "grad_norm": 0.1064453125, "learning_rate": 4.57026171804667e-05, "loss": 0.00525745153427124, "num_input_tokens_seen": 395529664, "step": 1970, "train_runtime": 14144.06, "train_tokens_per_second": 27964.366 }, { "epoch": 2.026624, "grad_norm": 0.07958984375, "learning_rate": 4.568353705723692e-05, "loss": 0.005201469361782074, "num_input_tokens_seen": 397487424, "step": 1980, "train_runtime": 14210.1189, "train_tokens_per_second": 27972.139 }, { "epoch": 2.036864, "grad_norm": 0.07373046875, "learning_rate": 4.566448081102455e-05, "loss": 0.005276227742433548, "num_input_tokens_seen": 399499776, "step": 1990, "train_runtime": 14282.3392, "train_tokens_per_second": 27971.593 }, { "epoch": 2.047104, "grad_norm": 0.1162109375, "learning_rate": 4.564544839207128e-05, "loss": 0.005213438719511032, "num_input_tokens_seen": 401505216, "step": 2000, "train_runtime": 14353.452, "train_tokens_per_second": 27972.729 }, { "epoch": 2.057344, "grad_norm": 0.1259765625, "learning_rate": 4.562643975076387e-05, "loss": 0.005236967653036118, "num_input_tokens_seen": 403493888, "step": 2010, "train_runtime": 14424.0273, "train_tokens_per_second": 27973.733 }, { "epoch": 2.067584, "grad_norm": 0.080078125, "learning_rate": 4.560745483763357e-05, "loss": 0.0052146721631288525, "num_input_tokens_seen": 405488704, "step": 2020, "train_runtime": 14494.4078, "train_tokens_per_second": 27975.527 }, { "epoch": 2.077824, "grad_norm": 0.0859375, "learning_rate": 4.5588493603355595e-05, "loss": 0.005139049887657165, "num_input_tokens_seen": 407464640, "step": 2030, "train_runtime": 14564.8182, "train_tokens_per_second": 27975.951 }, { "epoch": 2.088064, "grad_norm": 0.123046875, "learning_rate": 4.556955599874859e-05, "loss": 0.005121592432260513, "num_input_tokens_seen": 409450432, "step": 2040, "train_runtime": 14633.3791, "train_tokens_per_second": 27980.58 }, { "epoch": 2.098304, "grad_norm": 0.07861328125, "learning_rate": 4.555064197477409e-05, "loss": 0.0051218770444393154, "num_input_tokens_seen": 411460480, "step": 2050, "train_runtime": 14706.8322, "train_tokens_per_second": 27977.506 }, { "epoch": 2.108544, "grad_norm": 0.08642578125, "learning_rate": 4.5531751482536e-05, "loss": 0.005105789378285408, "num_input_tokens_seen": 413451776, "step": 2060, "train_runtime": 14777.0731, "train_tokens_per_second": 27979.274 }, { "epoch": 2.118784, "grad_norm": 0.07568359375, "learning_rate": 4.5512884473280024e-05, "loss": 0.005103696137666702, "num_input_tokens_seen": 415470592, "step": 2070, "train_runtime": 14849.8325, "train_tokens_per_second": 27978.133 }, { "epoch": 2.129024, "grad_norm": 0.0771484375, "learning_rate": 4.549404089839322e-05, "loss": 0.005021055787801742, "num_input_tokens_seen": 417460160, "step": 2080, "train_runtime": 14921.786, "train_tokens_per_second": 27976.555 }, { "epoch": 2.139264, "grad_norm": 0.076171875, "learning_rate": 4.547522070940335e-05, "loss": 0.005071662366390228, "num_input_tokens_seen": 419456640, "step": 2090, "train_runtime": 14992.2778, "train_tokens_per_second": 27978.18 }, { "epoch": 2.149504, "grad_norm": 0.08056640625, "learning_rate": 4.545642385797848e-05, "loss": 0.005032730847597122, "num_input_tokens_seen": 421486912, "step": 2100, "train_runtime": 15067.0008, "train_tokens_per_second": 27974.175 }, { "epoch": 2.159744, "grad_norm": 0.07421875, "learning_rate": 4.543765029592637e-05, "loss": 0.00504358783364296, "num_input_tokens_seen": 423541056, "step": 2110, "train_runtime": 15145.0393, "train_tokens_per_second": 27965.662 }, { "epoch": 2.169984, "grad_norm": 0.09033203125, "learning_rate": 4.541889997519403e-05, "loss": 0.0049100361764431, "num_input_tokens_seen": 425501760, "step": 2120, "train_runtime": 15212.0789, "train_tokens_per_second": 27971.309 }, { "epoch": 2.180224, "grad_norm": 0.11767578125, "learning_rate": 4.5400172847867095e-05, "loss": 0.005002960935235024, "num_input_tokens_seen": 427472320, "step": 2130, "train_runtime": 15279.4866, "train_tokens_per_second": 27976.877 }, { "epoch": 2.190464, "grad_norm": 0.08544921875, "learning_rate": 4.5381468866169466e-05, "loss": 0.005049411952495575, "num_input_tokens_seen": 429492544, "step": 2140, "train_runtime": 15350.0001, "train_tokens_per_second": 27979.97 }, { "epoch": 2.200704, "grad_norm": 0.08251953125, "learning_rate": 4.5362787982462616e-05, "loss": 0.004954206943511963, "num_input_tokens_seen": 431474560, "step": 2150, "train_runtime": 15417.1753, "train_tokens_per_second": 27986.616 }, { "epoch": 2.210944, "grad_norm": 0.080078125, "learning_rate": 4.5344130149245275e-05, "loss": 0.004945812746882439, "num_input_tokens_seen": 433476224, "step": 2160, "train_runtime": 15487.2137, "train_tokens_per_second": 27989.297 }, { "epoch": 2.221184, "grad_norm": 0.091796875, "learning_rate": 4.5325495319152715e-05, "loss": 0.004998266696929932, "num_input_tokens_seen": 435507776, "step": 2170, "train_runtime": 15558.3021, "train_tokens_per_second": 27991.986 }, { "epoch": 2.231424, "grad_norm": 0.0703125, "learning_rate": 4.530688344495644e-05, "loss": 0.00497533455491066, "num_input_tokens_seen": 437550336, "step": 2180, "train_runtime": 15634.0068, "train_tokens_per_second": 27987.089 }, { "epoch": 2.241664, "grad_norm": 0.07470703125, "learning_rate": 4.528829447956357e-05, "loss": 0.004857704415917397, "num_input_tokens_seen": 439513280, "step": 2190, "train_runtime": 15700.438, "train_tokens_per_second": 27993.696 }, { "epoch": 2.251904, "grad_norm": 0.078125, "learning_rate": 4.526972837601633e-05, "loss": 0.004866150766611099, "num_input_tokens_seen": 441508032, "step": 2200, "train_runtime": 15771.6893, "train_tokens_per_second": 27993.706 }, { "epoch": 2.262144, "grad_norm": 0.0771484375, "learning_rate": 4.525118508749165e-05, "loss": 0.004855437949299812, "num_input_tokens_seen": 443485504, "step": 2210, "train_runtime": 15840.4155, "train_tokens_per_second": 27997.088 }, { "epoch": 2.272384, "grad_norm": 0.07373046875, "learning_rate": 4.5232664567300546e-05, "loss": 0.0049121581017971035, "num_input_tokens_seen": 445490048, "step": 2220, "train_runtime": 15912.3409, "train_tokens_per_second": 27996.512 }, { "epoch": 2.282624, "grad_norm": 0.07177734375, "learning_rate": 4.521416676888773e-05, "loss": 0.004935600981116295, "num_input_tokens_seen": 447501248, "step": 2230, "train_runtime": 15984.4843, "train_tokens_per_second": 27995.977 }, { "epoch": 2.292864, "grad_norm": 0.06787109375, "learning_rate": 4.519569164583107e-05, "loss": 0.004881329089403153, "num_input_tokens_seen": 449501312, "step": 2240, "train_runtime": 16056.2463, "train_tokens_per_second": 27995.417 }, { "epoch": 2.303104, "grad_norm": 0.07763671875, "learning_rate": 4.517723915184109e-05, "loss": 0.004859179258346558, "num_input_tokens_seen": 451525888, "step": 2250, "train_runtime": 16130.4768, "train_tokens_per_second": 27992.098 }, { "epoch": 2.313344, "grad_norm": 0.0732421875, "learning_rate": 4.5158809240760506e-05, "loss": 0.0048702418804168705, "num_input_tokens_seen": 453539456, "step": 2260, "train_runtime": 16203.083, "train_tokens_per_second": 27990.936 }, { "epoch": 2.323584, "grad_norm": 0.06591796875, "learning_rate": 4.514040186656375e-05, "loss": 0.004770452529191971, "num_input_tokens_seen": 455540800, "step": 2270, "train_runtime": 16275.7088, "train_tokens_per_second": 27988.999 }, { "epoch": 2.333824, "grad_norm": 0.07080078125, "learning_rate": 4.512201698335644e-05, "loss": 0.004840082675218582, "num_input_tokens_seen": 457537984, "step": 2280, "train_runtime": 16346.6271, "train_tokens_per_second": 27989.749 }, { "epoch": 2.344064, "grad_norm": 0.0869140625, "learning_rate": 4.510365454537496e-05, "loss": 0.004802238196134567, "num_input_tokens_seen": 459519040, "step": 2290, "train_runtime": 16414.8718, "train_tokens_per_second": 27994.068 }, { "epoch": 2.354304, "grad_norm": 0.072265625, "learning_rate": 4.5085314506985945e-05, "loss": 0.0047688383609056475, "num_input_tokens_seen": 461504320, "step": 2300, "train_runtime": 16484.446, "train_tokens_per_second": 27996.35 }, { "epoch": 2.364544, "grad_norm": 0.0732421875, "learning_rate": 4.50669968226858e-05, "loss": 0.004731994122266769, "num_input_tokens_seen": 463484608, "step": 2310, "train_runtime": 16552.5783, "train_tokens_per_second": 28000.75 }, { "epoch": 2.374784, "grad_norm": 0.06884765625, "learning_rate": 4.504870144710027e-05, "loss": 0.004760279133915901, "num_input_tokens_seen": 465478912, "step": 2320, "train_runtime": 16623.4024, "train_tokens_per_second": 28001.422 }, { "epoch": 2.385024, "grad_norm": 0.076171875, "learning_rate": 4.5030428334983884e-05, "loss": 0.004723610356450081, "num_input_tokens_seen": 467551232, "step": 2330, "train_runtime": 16699.1593, "train_tokens_per_second": 27998.489 }, { "epoch": 2.395264, "grad_norm": 0.0654296875, "learning_rate": 4.501217744121959e-05, "loss": 0.004661402851343155, "num_input_tokens_seen": 469581568, "step": 2340, "train_runtime": 16773.939, "train_tokens_per_second": 27994.711 }, { "epoch": 2.405504, "grad_norm": 0.0712890625, "learning_rate": 4.499394872081821e-05, "loss": 0.004748685657978058, "num_input_tokens_seen": 471585152, "step": 2350, "train_runtime": 16845.2785, "train_tokens_per_second": 27995.094 }, { "epoch": 2.415744, "grad_norm": 0.0732421875, "learning_rate": 4.4975742128918e-05, "loss": 0.004757498577237129, "num_input_tokens_seen": 473578176, "step": 2360, "train_runtime": 16915.4571, "train_tokens_per_second": 27996.771 }, { "epoch": 2.425984, "grad_norm": 0.076171875, "learning_rate": 4.495755762078418e-05, "loss": 0.004699341207742691, "num_input_tokens_seen": 475608960, "step": 2370, "train_runtime": 16989.857, "train_tokens_per_second": 27993.7 }, { "epoch": 2.436224, "grad_norm": 0.06982421875, "learning_rate": 4.49393951518085e-05, "loss": 0.004687727242708206, "num_input_tokens_seen": 477675968, "step": 2380, "train_runtime": 17066.5009, "train_tokens_per_second": 27989.098 }, { "epoch": 2.446464, "grad_norm": 0.0693359375, "learning_rate": 4.4921254677508716e-05, "loss": 0.004727355390787125, "num_input_tokens_seen": 479688000, "step": 2390, "train_runtime": 17137.3138, "train_tokens_per_second": 27990.851 }, { "epoch": 2.456704, "grad_norm": 0.0712890625, "learning_rate": 4.490313615352821e-05, "loss": 0.004683735221624375, "num_input_tokens_seen": 481709440, "step": 2400, "train_runtime": 17210.3486, "train_tokens_per_second": 27989.523 }, { "epoch": 2.466944, "grad_norm": 0.083984375, "learning_rate": 4.48850395356355e-05, "loss": 0.0046593818813562395, "num_input_tokens_seen": 483715648, "step": 2410, "train_runtime": 17282.5834, "train_tokens_per_second": 27988.619 }, { "epoch": 2.477184, "grad_norm": 0.0654296875, "learning_rate": 4.486696477972375e-05, "loss": 0.004705347865819931, "num_input_tokens_seen": 485743040, "step": 2420, "train_runtime": 17356.521, "train_tokens_per_second": 27986.198 }, { "epoch": 2.487424, "grad_norm": 0.2197265625, "learning_rate": 4.484891184181041e-05, "loss": 0.004584659263491631, "num_input_tokens_seen": 487766208, "step": 2430, "train_runtime": 17429.6709, "train_tokens_per_second": 27984.82 }, { "epoch": 2.497664, "grad_norm": 0.08984375, "learning_rate": 4.483088067803662e-05, "loss": 0.0046070806682109834, "num_input_tokens_seen": 489803136, "step": 2440, "train_runtime": 17505.2822, "train_tokens_per_second": 27980.305 }, { "epoch": 2.507904, "grad_norm": 0.06689453125, "learning_rate": 4.481287124466697e-05, "loss": 0.004666749015450477, "num_input_tokens_seen": 491769280, "step": 2450, "train_runtime": 17572.5264, "train_tokens_per_second": 27985.121 }, { "epoch": 2.518144, "grad_norm": 0.0654296875, "learning_rate": 4.479488349808885e-05, "loss": 0.0045741736888885495, "num_input_tokens_seen": 493764288, "step": 2460, "train_runtime": 17640.503, "train_tokens_per_second": 27990.375 }, { "epoch": 2.528384, "grad_norm": 0.06787109375, "learning_rate": 4.4776917394812114e-05, "loss": 0.004661215096712112, "num_input_tokens_seen": 495765184, "step": 2470, "train_runtime": 17712.7955, "train_tokens_per_second": 27989.099 }, { "epoch": 2.538624, "grad_norm": 0.08154296875, "learning_rate": 4.475897289146862e-05, "loss": 0.004575810208916664, "num_input_tokens_seen": 497788736, "step": 2480, "train_runtime": 17786.4235, "train_tokens_per_second": 27987.006 }, { "epoch": 2.548864, "grad_norm": 0.0654296875, "learning_rate": 4.4741049944811806e-05, "loss": 0.0045924406498670575, "num_input_tokens_seen": 499810304, "step": 2490, "train_runtime": 17859.0861, "train_tokens_per_second": 27986.332 }, { "epoch": 2.559104, "grad_norm": 0.0703125, "learning_rate": 4.472314851171621e-05, "loss": 0.004592006653547287, "num_input_tokens_seen": 501800576, "step": 2500, "train_runtime": 17928.9445, "train_tokens_per_second": 27988.294 }, { "epoch": 2.569344, "grad_norm": 0.08251953125, "learning_rate": 4.4705268549177084e-05, "loss": 0.004537731781601906, "num_input_tokens_seen": 503798656, "step": 2510, "train_runtime": 18000.9507, "train_tokens_per_second": 27987.336 }, { "epoch": 2.579584, "grad_norm": 0.06591796875, "learning_rate": 4.468741001430989e-05, "loss": 0.004587111622095108, "num_input_tokens_seen": 505787584, "step": 2520, "train_runtime": 18070.7008, "train_tokens_per_second": 27989.373 }, { "epoch": 2.589824, "grad_norm": 0.06787109375, "learning_rate": 4.466957286434997e-05, "loss": 0.004565178602933884, "num_input_tokens_seen": 507778304, "step": 2530, "train_runtime": 18139.8689, "train_tokens_per_second": 27992.391 }, { "epoch": 2.600064, "grad_norm": 0.0732421875, "learning_rate": 4.4651757056652e-05, "loss": 0.004532522708177567, "num_input_tokens_seen": 509777024, "step": 2540, "train_runtime": 18210.7065, "train_tokens_per_second": 27993.259 }, { "epoch": 2.610304, "grad_norm": 0.06884765625, "learning_rate": 4.463396254868968e-05, "loss": 0.004580499976873398, "num_input_tokens_seen": 511806464, "step": 2550, "train_runtime": 18285.3626, "train_tokens_per_second": 27989.954 }, { "epoch": 2.6205439999999998, "grad_norm": 0.09619140625, "learning_rate": 4.461618929805519e-05, "loss": 0.0044912703335285185, "num_input_tokens_seen": 513789760, "step": 2560, "train_runtime": 18355.1328, "train_tokens_per_second": 27991.612 }, { "epoch": 2.6307840000000002, "grad_norm": 0.06884765625, "learning_rate": 4.459843726245888e-05, "loss": 0.0045277226716279985, "num_input_tokens_seen": 515820928, "step": 2570, "train_runtime": 18429.0204, "train_tokens_per_second": 27989.601 }, { "epoch": 2.641024, "grad_norm": 0.08056640625, "learning_rate": 4.458070639972875e-05, "loss": 0.004519717395305633, "num_input_tokens_seen": 517852160, "step": 2580, "train_runtime": 18502.377, "train_tokens_per_second": 27988.413 }, { "epoch": 2.651264, "grad_norm": 0.0703125, "learning_rate": 4.456299666781007e-05, "loss": 0.004499278962612152, "num_input_tokens_seen": 519837056, "step": 2590, "train_runtime": 18571.4439, "train_tokens_per_second": 27991.203 }, { "epoch": 2.661504, "grad_norm": 0.07177734375, "learning_rate": 4.4545308024764984e-05, "loss": 0.004471401870250702, "num_input_tokens_seen": 521829760, "step": 2600, "train_runtime": 18641.848, "train_tokens_per_second": 27992.384 }, { "epoch": 2.671744, "grad_norm": 0.076171875, "learning_rate": 4.452764042877207e-05, "loss": 0.004468469694256782, "num_input_tokens_seen": 523852928, "step": 2610, "train_runtime": 18714.0275, "train_tokens_per_second": 27992.527 }, { "epoch": 2.681984, "grad_norm": 0.087890625, "learning_rate": 4.45099938381259e-05, "loss": 0.0044468618929386135, "num_input_tokens_seen": 525863616, "step": 2620, "train_runtime": 18785.1898, "train_tokens_per_second": 27993.522 }, { "epoch": 2.692224, "grad_norm": 0.06884765625, "learning_rate": 4.449236821123667e-05, "loss": 0.004445591568946838, "num_input_tokens_seen": 527876672, "step": 2630, "train_runtime": 18856.6021, "train_tokens_per_second": 27994.263 }, { "epoch": 2.702464, "grad_norm": 0.06201171875, "learning_rate": 4.447476350662976e-05, "loss": 0.004489725083112716, "num_input_tokens_seen": 529852736, "step": 2640, "train_runtime": 18924.4151, "train_tokens_per_second": 27998.368 }, { "epoch": 2.712704, "grad_norm": 0.0654296875, "learning_rate": 4.4457179682945346e-05, "loss": 0.004479191452264786, "num_input_tokens_seen": 531877632, "step": 2650, "train_runtime": 18996.9669, "train_tokens_per_second": 27998.029 }, { "epoch": 2.722944, "grad_norm": 0.0654296875, "learning_rate": 4.443961669893798e-05, "loss": 0.004402218014001846, "num_input_tokens_seen": 533900416, "step": 2660, "train_runtime": 19070.1423, "train_tokens_per_second": 27996.667 }, { "epoch": 2.733184, "grad_norm": 0.06103515625, "learning_rate": 4.4422074513476155e-05, "loss": 0.004445427656173706, "num_input_tokens_seen": 535930112, "step": 2670, "train_runtime": 19141.6215, "train_tokens_per_second": 27998.156 }, { "epoch": 2.743424, "grad_norm": 0.07080078125, "learning_rate": 4.4404553085541955e-05, "loss": 0.004417391866445542, "num_input_tokens_seen": 537917952, "step": 2680, "train_runtime": 19212.531, "train_tokens_per_second": 27998.287 }, { "epoch": 2.753664, "grad_norm": 0.068359375, "learning_rate": 4.438705237423063e-05, "loss": 0.004418341070413589, "num_input_tokens_seen": 539928000, "step": 2690, "train_runtime": 19284.2139, "train_tokens_per_second": 27998.445 }, { "epoch": 2.763904, "grad_norm": 0.072265625, "learning_rate": 4.436957233875017e-05, "loss": 0.00445760264992714, "num_input_tokens_seen": 541990336, "step": 2700, "train_runtime": 19361.2012, "train_tokens_per_second": 27993.632 }, { "epoch": 2.774144, "grad_norm": 0.058349609375, "learning_rate": 4.4352112938420956e-05, "loss": 0.00442219078540802, "num_input_tokens_seen": 543993664, "step": 2710, "train_runtime": 19434.2897, "train_tokens_per_second": 27991.435 }, { "epoch": 2.784384, "grad_norm": 0.06689453125, "learning_rate": 4.433467413267529e-05, "loss": 0.004379033669829368, "num_input_tokens_seen": 545968128, "step": 2720, "train_runtime": 19501.9205, "train_tokens_per_second": 27995.608 }, { "epoch": 2.7946239999999998, "grad_norm": 0.07373046875, "learning_rate": 4.431725588105708e-05, "loss": 0.00442984439432621, "num_input_tokens_seen": 547993536, "step": 2730, "train_runtime": 19575.6782, "train_tokens_per_second": 27993.591 }, { "epoch": 2.8048640000000002, "grad_norm": 0.0712890625, "learning_rate": 4.4299858143221377e-05, "loss": 0.004416907578706742, "num_input_tokens_seen": 549978176, "step": 2740, "train_runtime": 19646.1077, "train_tokens_per_second": 27994.256 }, { "epoch": 2.815104, "grad_norm": 0.06787109375, "learning_rate": 4.4282480878934065e-05, "loss": 0.004360169917345047, "num_input_tokens_seen": 551979968, "step": 2750, "train_runtime": 19715.949, "train_tokens_per_second": 27996.622 }, { "epoch": 2.825344, "grad_norm": 0.06298828125, "learning_rate": 4.4265124048071346e-05, "loss": 0.00443723276257515, "num_input_tokens_seen": 554008768, "step": 2760, "train_runtime": 19790.2131, "train_tokens_per_second": 27994.078 }, { "epoch": 2.835584, "grad_norm": 0.0634765625, "learning_rate": 4.4247787610619477e-05, "loss": 0.004331726580858231, "num_input_tokens_seen": 556008704, "step": 2770, "train_runtime": 19861.2979, "train_tokens_per_second": 27994.581 }, { "epoch": 2.845824, "grad_norm": 0.06494140625, "learning_rate": 4.42304715266743e-05, "loss": 0.004372353851795197, "num_input_tokens_seen": 557996544, "step": 2780, "train_runtime": 19933.1706, "train_tokens_per_second": 27993.366 }, { "epoch": 2.856064, "grad_norm": 0.07177734375, "learning_rate": 4.421317575644092e-05, "loss": 0.004349645972251892, "num_input_tokens_seen": 559980992, "step": 2790, "train_runtime": 20003.345, "train_tokens_per_second": 27994.367 }, { "epoch": 2.866304, "grad_norm": 0.08251953125, "learning_rate": 4.419590026023325e-05, "loss": 0.004384344071149826, "num_input_tokens_seen": 561990848, "step": 2800, "train_runtime": 20074.5573, "train_tokens_per_second": 27995.18 }, { "epoch": 2.876544, "grad_norm": 0.06298828125, "learning_rate": 4.417864499847368e-05, "loss": 0.004311569407582283, "num_input_tokens_seen": 564012800, "step": 2810, "train_runtime": 20146.4854, "train_tokens_per_second": 27995.593 }, { "epoch": 2.886784, "grad_norm": 0.06982421875, "learning_rate": 4.4161409931692676e-05, "loss": 0.004370152205228806, "num_input_tokens_seen": 566014592, "step": 2820, "train_runtime": 20215.9782, "train_tokens_per_second": 27998.378 }, { "epoch": 2.897024, "grad_norm": 0.06787109375, "learning_rate": 4.414419502052841e-05, "loss": 0.004308675229549408, "num_input_tokens_seen": 568045312, "step": 2830, "train_runtime": 20291.0419, "train_tokens_per_second": 27994.881 }, { "epoch": 2.907264, "grad_norm": 0.08203125, "learning_rate": 4.412700022572637e-05, "loss": 0.0044147070497274395, "num_input_tokens_seen": 570100864, "step": 2840, "train_runtime": 20365.9712, "train_tokens_per_second": 27992.815 }, { "epoch": 2.917504, "grad_norm": 0.06884765625, "learning_rate": 4.410982550813902e-05, "loss": 0.004334438592195511, "num_input_tokens_seen": 572089472, "step": 2850, "train_runtime": 20434.147, "train_tokens_per_second": 27996.739 }, { "epoch": 2.927744, "grad_norm": 0.05908203125, "learning_rate": 4.409267082872535e-05, "loss": 0.004324203729629517, "num_input_tokens_seen": 574117952, "step": 2860, "train_runtime": 20507.6918, "train_tokens_per_second": 27995.25 }, { "epoch": 2.937984, "grad_norm": 0.06201171875, "learning_rate": 4.407553614855059e-05, "loss": 0.0042998895049095156, "num_input_tokens_seen": 576123392, "step": 2870, "train_runtime": 20581.5585, "train_tokens_per_second": 27992.214 }, { "epoch": 2.9482239999999997, "grad_norm": 0.064453125, "learning_rate": 4.405842142878579e-05, "loss": 0.004281196743249893, "num_input_tokens_seen": 578142144, "step": 2880, "train_runtime": 20653.4078, "train_tokens_per_second": 27992.579 }, { "epoch": 2.958464, "grad_norm": 0.0634765625, "learning_rate": 4.404132663070745e-05, "loss": 0.004318735748529434, "num_input_tokens_seen": 580136512, "step": 2890, "train_runtime": 20724.2011, "train_tokens_per_second": 27993.191 }, { "epoch": 2.968704, "grad_norm": 0.07958984375, "learning_rate": 4.402425171569716e-05, "loss": 0.004320795089006424, "num_input_tokens_seen": 582175680, "step": 2900, "train_runtime": 20799.0882, "train_tokens_per_second": 27990.442 }, { "epoch": 2.9789440000000003, "grad_norm": 0.0595703125, "learning_rate": 4.400719664524127e-05, "loss": 0.004287149757146835, "num_input_tokens_seen": 584189120, "step": 2910, "train_runtime": 20871.3369, "train_tokens_per_second": 27990.019 }, { "epoch": 2.989184, "grad_norm": 0.064453125, "learning_rate": 4.399016138093044e-05, "loss": 0.0043055802583694455, "num_input_tokens_seen": 586222400, "step": 2920, "train_runtime": 20945.292, "train_tokens_per_second": 27988.266 }, { "epoch": 2.999424, "grad_norm": 0.078125, "learning_rate": 4.397314588445937e-05, "loss": 0.004327042400836945, "num_input_tokens_seen": 588266880, "step": 2930, "train_runtime": 21020.7033, "train_tokens_per_second": 27985.119 }, { "epoch": 3.0, "eval_loss": 1.456993818283081, "eval_runtime": 1.1117, "eval_samples_per_second": 896.787, "eval_steps_per_second": 7.196, "num_input_tokens_seen": 588389376, "step": 2931 }, { "epoch": 3.0, "num_input_tokens_seen": 588389376, "step": 2931, "total_flos": 9.795884421293801e+18, "train_loss": 0.15086554328385768, "train_runtime": 21047.8725, "train_samples_per_second": 142.532, "train_steps_per_second": 0.139 } ], "logging_steps": 10, "max_steps": 2931, "num_input_tokens_seen": 588389376, "num_train_epochs": 3, "save_steps": 5000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 9.795884421293801e+18, "train_batch_size": 8, "trial_name": null, "trial_params": null }