{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 15.0, "eval_steps": 20, "global_step": 15000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.01, "grad_norm": 5.837451934814453, "learning_rate": 6.000000000000001e-08, "loss": 3.4955215454101562, "step": 10 }, { "epoch": 0.02, "grad_norm": 4.863423824310303, "learning_rate": 1.2666666666666666e-07, "loss": 3.45260009765625, "step": 20 }, { "epoch": 0.02, "eval_0_to_0": 1, "eval_0_to_1": 10038, "eval_1_to_0": 0, "eval_1_to_1": 9961, "eval_accuracy": 0.4981, "eval_loss": 0.6961461305618286, "eval_runtime": 176.496, "eval_samples_per_second": 113.317, "eval_steps_per_second": 7.082, "step": 20 }, { "epoch": 0.03, "grad_norm": 3.543813467025757, "learning_rate": 1.9333333333333337e-07, "loss": 3.4964569091796873, "step": 30 }, { "epoch": 0.04, "grad_norm": 2.6731295585632324, "learning_rate": 2.6e-07, "loss": 3.5083938598632813, "step": 40 }, { "epoch": 0.04, "eval_0_to_0": 16, "eval_0_to_1": 10023, "eval_1_to_0": 13, "eval_1_to_1": 9948, "eval_accuracy": 0.4982, "eval_loss": 0.6935256123542786, "eval_runtime": 166.7041, "eval_samples_per_second": 119.973, "eval_steps_per_second": 7.498, "step": 40 }, { "epoch": 0.05, "grad_norm": 2.837085247039795, "learning_rate": 3.266666666666667e-07, "loss": 3.505364990234375, "step": 50 }, { "epoch": 0.06, "grad_norm": 2.9840452671051025, "learning_rate": 3.9333333333333336e-07, "loss": 3.4940582275390626, "step": 60 }, { "epoch": 0.06, "eval_0_to_0": 2510, "eval_0_to_1": 7529, "eval_1_to_0": 1140, "eval_1_to_1": 8821, "eval_accuracy": 0.56655, "eval_loss": 0.687375009059906, "eval_runtime": 142.8746, "eval_samples_per_second": 139.983, "eval_steps_per_second": 8.749, "step": 60 }, { "epoch": 0.07, "grad_norm": 5.594034194946289, "learning_rate": 4.6000000000000004e-07, "loss": 3.4860076904296875, "step": 70 }, { "epoch": 0.08, "grad_norm": 6.155296325683594, "learning_rate": 5.266666666666667e-07, "loss": 3.4398590087890626, "step": 80 }, { "epoch": 0.08, "eval_0_to_0": 7984, "eval_0_to_1": 2055, "eval_1_to_0": 4394, "eval_1_to_1": 5567, "eval_accuracy": 0.67755, "eval_loss": 0.6749752163887024, "eval_runtime": 122.9618, "eval_samples_per_second": 162.652, "eval_steps_per_second": 10.166, "step": 80 }, { "epoch": 0.09, "grad_norm": 4.2220916748046875, "learning_rate": 5.933333333333334e-07, "loss": 3.4248321533203123, "step": 90 }, { "epoch": 0.1, "grad_norm": 4.007363319396973, "learning_rate": 6.6e-07, "loss": 3.366021728515625, "step": 100 }, { "epoch": 0.1, "eval_0_to_0": 7672, "eval_0_to_1": 2367, "eval_1_to_0": 2461, "eval_1_to_1": 7500, "eval_accuracy": 0.7586, "eval_loss": 0.6487452387809753, "eval_runtime": 156.3269, "eval_samples_per_second": 127.937, "eval_steps_per_second": 7.996, "step": 100 }, { "epoch": 0.11, "grad_norm": 4.93192720413208, "learning_rate": 7.266666666666668e-07, "loss": 3.281585693359375, "step": 110 }, { "epoch": 0.12, "grad_norm": 6.602995872497559, "learning_rate": 7.933333333333335e-07, "loss": 3.1683670043945313, "step": 120 }, { "epoch": 0.12, "eval_0_to_0": 8902, "eval_0_to_1": 1137, "eval_1_to_0": 3000, "eval_1_to_1": 6961, "eval_accuracy": 0.79315, "eval_loss": 0.5825260281562805, "eval_runtime": 154.9159, "eval_samples_per_second": 129.102, "eval_steps_per_second": 8.069, "step": 120 }, { "epoch": 0.13, "grad_norm": 9.320093154907227, "learning_rate": 8.6e-07, "loss": 2.968352508544922, "step": 130 }, { "epoch": 0.14, "grad_norm": 7.99703311920166, "learning_rate": 9.266666666666667e-07, "loss": 2.7218887329101564, "step": 140 }, { "epoch": 0.14, "eval_0_to_0": 8790, "eval_0_to_1": 1249, "eval_1_to_0": 2265, "eval_1_to_1": 7696, "eval_accuracy": 0.8243, "eval_loss": 0.48248428106307983, "eval_runtime": 133.277, "eval_samples_per_second": 150.063, "eval_steps_per_second": 9.379, "step": 140 }, { "epoch": 0.15, "grad_norm": 9.873712539672852, "learning_rate": 9.933333333333333e-07, "loss": 2.481693649291992, "step": 150 }, { "epoch": 0.16, "grad_norm": 7.95600700378418, "learning_rate": 1.06e-06, "loss": 2.2958095550537108, "step": 160 }, { "epoch": 0.16, "eval_0_to_0": 9115, "eval_0_to_1": 924, "eval_1_to_0": 2233, "eval_1_to_1": 7728, "eval_accuracy": 0.84215, "eval_loss": 0.404913067817688, "eval_runtime": 166.9484, "eval_samples_per_second": 119.797, "eval_steps_per_second": 7.487, "step": 160 }, { "epoch": 0.17, "grad_norm": 9.35830020904541, "learning_rate": 1.1266666666666667e-06, "loss": 2.1087871551513673, "step": 170 }, { "epoch": 0.18, "grad_norm": 13.281872749328613, "learning_rate": 1.1933333333333335e-06, "loss": 1.925070571899414, "step": 180 }, { "epoch": 0.18, "eval_0_to_0": 8940, "eval_0_to_1": 1099, "eval_1_to_0": 1701, "eval_1_to_1": 8260, "eval_accuracy": 0.86, "eval_loss": 0.3443446159362793, "eval_runtime": 180.118, "eval_samples_per_second": 111.038, "eval_steps_per_second": 6.94, "step": 180 }, { "epoch": 0.19, "grad_norm": 11.012375831604004, "learning_rate": 1.26e-06, "loss": 1.8475690841674806, "step": 190 }, { "epoch": 0.2, "grad_norm": 16.632164001464844, "learning_rate": 1.3266666666666667e-06, "loss": 1.6189449310302735, "step": 200 }, { "epoch": 0.2, "eval_0_to_0": 9295, "eval_0_to_1": 744, "eval_1_to_0": 2060, "eval_1_to_1": 7901, "eval_accuracy": 0.8598, "eval_loss": 0.3337651491165161, "eval_runtime": 180.7798, "eval_samples_per_second": 110.632, "eval_steps_per_second": 6.914, "step": 200 }, { "epoch": 0.21, "grad_norm": 13.2937593460083, "learning_rate": 1.3933333333333335e-06, "loss": 1.5011748313903808, "step": 210 }, { "epoch": 0.22, "grad_norm": 6.960549831390381, "learning_rate": 1.46e-06, "loss": 1.510852336883545, "step": 220 }, { "epoch": 0.22, "eval_0_to_0": 9372, "eval_0_to_1": 667, "eval_1_to_0": 2053, "eval_1_to_1": 7908, "eval_accuracy": 0.864, "eval_loss": 0.3302750587463379, "eval_runtime": 176.3347, "eval_samples_per_second": 113.421, "eval_steps_per_second": 7.089, "step": 220 }, { "epoch": 0.23, "grad_norm": 10.905738830566406, "learning_rate": 1.526666666666667e-06, "loss": 1.5876852989196777, "step": 230 }, { "epoch": 0.24, "grad_norm": 9.92120361328125, "learning_rate": 1.5933333333333335e-06, "loss": 1.3632417678833009, "step": 240 }, { "epoch": 0.24, "eval_0_to_0": 9171, "eval_0_to_1": 868, "eval_1_to_0": 1550, "eval_1_to_1": 8411, "eval_accuracy": 0.8791, "eval_loss": 0.29169273376464844, "eval_runtime": 183.5473, "eval_samples_per_second": 108.964, "eval_steps_per_second": 6.81, "step": 240 }, { "epoch": 0.25, "grad_norm": 8.129840850830078, "learning_rate": 1.6600000000000002e-06, "loss": 1.4718170166015625, "step": 250 }, { "epoch": 0.26, "grad_norm": 9.313729286193848, "learning_rate": 1.7266666666666667e-06, "loss": 1.5609713554382325, "step": 260 }, { "epoch": 0.26, "eval_0_to_0": 9070, "eval_0_to_1": 969, "eval_1_to_0": 1334, "eval_1_to_1": 8627, "eval_accuracy": 0.88485, "eval_loss": 0.27700164914131165, "eval_runtime": 178.7584, "eval_samples_per_second": 111.883, "eval_steps_per_second": 6.993, "step": 260 }, { "epoch": 0.27, "grad_norm": 10.178702354431152, "learning_rate": 1.7933333333333337e-06, "loss": 1.472367286682129, "step": 270 }, { "epoch": 0.28, "grad_norm": 11.937307357788086, "learning_rate": 1.8600000000000002e-06, "loss": 1.571978759765625, "step": 280 }, { "epoch": 0.28, "eval_0_to_0": 9282, "eval_0_to_1": 757, "eval_1_to_0": 1605, "eval_1_to_1": 8356, "eval_accuracy": 0.8819, "eval_loss": 0.2818259596824646, "eval_runtime": 146.2638, "eval_samples_per_second": 136.739, "eval_steps_per_second": 8.546, "step": 280 }, { "epoch": 0.29, "grad_norm": 8.357309341430664, "learning_rate": 1.926666666666667e-06, "loss": 1.4824767112731934, "step": 290 }, { "epoch": 0.3, "grad_norm": 14.17270278930664, "learning_rate": 1.9933333333333334e-06, "loss": 1.4148941040039062, "step": 300 }, { "epoch": 0.3, "eval_0_to_0": 9271, "eval_0_to_1": 768, "eval_1_to_0": 1467, "eval_1_to_1": 8494, "eval_accuracy": 0.88825, "eval_loss": 0.26671937108039856, "eval_runtime": 141.1674, "eval_samples_per_second": 141.676, "eval_steps_per_second": 8.855, "step": 300 }, { "epoch": 0.31, "grad_norm": 16.209667205810547, "learning_rate": 2.06e-06, "loss": 1.324738121032715, "step": 310 }, { "epoch": 0.32, "grad_norm": 20.076763153076172, "learning_rate": 2.126666666666667e-06, "loss": 1.3838441848754883, "step": 320 }, { "epoch": 0.32, "eval_0_to_0": 9218, "eval_0_to_1": 821, "eval_1_to_0": 1322, "eval_1_to_1": 8639, "eval_accuracy": 0.89285, "eval_loss": 0.26503121852874756, "eval_runtime": 143.3735, "eval_samples_per_second": 139.496, "eval_steps_per_second": 8.718, "step": 320 }, { "epoch": 0.33, "grad_norm": 14.800923347473145, "learning_rate": 2.1933333333333332e-06, "loss": 1.2242856979370118, "step": 330 }, { "epoch": 0.34, "grad_norm": 10.447818756103516, "learning_rate": 2.2600000000000004e-06, "loss": 1.3612082481384278, "step": 340 }, { "epoch": 0.34, "eval_0_to_0": 9014, "eval_0_to_1": 1025, "eval_1_to_0": 1089, "eval_1_to_1": 8872, "eval_accuracy": 0.8943, "eval_loss": 0.2525891661643982, "eval_runtime": 146.4066, "eval_samples_per_second": 136.606, "eval_steps_per_second": 8.538, "step": 340 }, { "epoch": 0.35, "grad_norm": 14.836370468139648, "learning_rate": 2.3266666666666667e-06, "loss": 1.46075382232666, "step": 350 }, { "epoch": 0.36, "grad_norm": 21.675491333007812, "learning_rate": 2.3933333333333334e-06, "loss": 1.353489875793457, "step": 360 }, { "epoch": 0.36, "eval_0_to_0": 9022, "eval_0_to_1": 1017, "eval_1_to_0": 1038, "eval_1_to_1": 8923, "eval_accuracy": 0.89725, "eval_loss": 0.25124114751815796, "eval_runtime": 153.0837, "eval_samples_per_second": 130.647, "eval_steps_per_second": 8.165, "step": 360 }, { "epoch": 0.37, "grad_norm": 9.699962615966797, "learning_rate": 2.46e-06, "loss": 1.2580957412719727, "step": 370 }, { "epoch": 0.38, "grad_norm": 12.062620162963867, "learning_rate": 2.526666666666667e-06, "loss": 1.2765159606933594, "step": 380 }, { "epoch": 0.38, "eval_0_to_0": 9342, "eval_0_to_1": 697, "eval_1_to_0": 1363, "eval_1_to_1": 8598, "eval_accuracy": 0.897, "eval_loss": 0.24976007640361786, "eval_runtime": 154.6543, "eval_samples_per_second": 129.321, "eval_steps_per_second": 8.083, "step": 380 }, { "epoch": 0.39, "grad_norm": 6.953458786010742, "learning_rate": 2.5933333333333336e-06, "loss": 1.0196543693542481, "step": 390 }, { "epoch": 0.4, "grad_norm": 11.444792747497559, "learning_rate": 2.6600000000000004e-06, "loss": 1.2003541946411134, "step": 400 }, { "epoch": 0.4, "eval_0_to_0": 9304, "eval_0_to_1": 735, "eval_1_to_0": 1294, "eval_1_to_1": 8667, "eval_accuracy": 0.89855, "eval_loss": 0.25217410922050476, "eval_runtime": 154.5112, "eval_samples_per_second": 129.44, "eval_steps_per_second": 8.09, "step": 400 }, { "epoch": 0.41, "grad_norm": 9.508902549743652, "learning_rate": 2.726666666666667e-06, "loss": 1.2353105545043945, "step": 410 }, { "epoch": 0.42, "grad_norm": 7.775336265563965, "learning_rate": 2.7933333333333334e-06, "loss": 1.204998779296875, "step": 420 }, { "epoch": 0.42, "eval_0_to_0": 9408, "eval_0_to_1": 631, "eval_1_to_0": 1365, "eval_1_to_1": 8596, "eval_accuracy": 0.9002, "eval_loss": 0.24327072501182556, "eval_runtime": 152.7749, "eval_samples_per_second": 130.912, "eval_steps_per_second": 8.182, "step": 420 }, { "epoch": 0.43, "grad_norm": 21.83246612548828, "learning_rate": 2.86e-06, "loss": 1.328392791748047, "step": 430 }, { "epoch": 0.44, "grad_norm": 13.273889541625977, "learning_rate": 2.9266666666666673e-06, "loss": 1.020184326171875, "step": 440 }, { "epoch": 0.44, "eval_0_to_0": 9541, "eval_0_to_1": 498, "eval_1_to_0": 1601, "eval_1_to_1": 8360, "eval_accuracy": 0.89505, "eval_loss": 0.27976319193840027, "eval_runtime": 138.5787, "eval_samples_per_second": 144.322, "eval_steps_per_second": 9.02, "step": 440 }, { "epoch": 0.45, "grad_norm": 10.00835132598877, "learning_rate": 2.9933333333333336e-06, "loss": 1.4513050079345704, "step": 450 }, { "epoch": 0.46, "grad_norm": 10.941272735595703, "learning_rate": 3.0600000000000003e-06, "loss": 1.2129112243652345, "step": 460 }, { "epoch": 0.46, "eval_0_to_0": 9666, "eval_0_to_1": 373, "eval_1_to_0": 1783, "eval_1_to_1": 8178, "eval_accuracy": 0.8922, "eval_loss": 0.2810022234916687, "eval_runtime": 151.9401, "eval_samples_per_second": 131.631, "eval_steps_per_second": 8.227, "step": 460 }, { "epoch": 0.47, "grad_norm": 9.602926254272461, "learning_rate": 3.1266666666666667e-06, "loss": 1.0213088989257812, "step": 470 }, { "epoch": 0.48, "grad_norm": 7.400985240936279, "learning_rate": 3.193333333333334e-06, "loss": 1.0750060081481934, "step": 480 }, { "epoch": 0.48, "eval_0_to_0": 9216, "eval_0_to_1": 823, "eval_1_to_0": 1028, "eval_1_to_1": 8933, "eval_accuracy": 0.90745, "eval_loss": 0.22723889350891113, "eval_runtime": 137.6552, "eval_samples_per_second": 145.291, "eval_steps_per_second": 9.081, "step": 480 }, { "epoch": 0.49, "grad_norm": 7.83695650100708, "learning_rate": 3.2600000000000006e-06, "loss": 0.9688671112060547, "step": 490 }, { "epoch": 0.5, "grad_norm": 9.564067840576172, "learning_rate": 3.326666666666667e-06, "loss": 1.2452627182006837, "step": 500 }, { "epoch": 0.5, "eval_0_to_0": 9306, "eval_0_to_1": 733, "eval_1_to_0": 1081, "eval_1_to_1": 8880, "eval_accuracy": 0.9093, "eval_loss": 0.2250109165906906, "eval_runtime": 152.7267, "eval_samples_per_second": 130.953, "eval_steps_per_second": 8.185, "step": 500 }, { "epoch": 0.51, "grad_norm": 12.704121589660645, "learning_rate": 3.3933333333333336e-06, "loss": 1.2263564109802245, "step": 510 }, { "epoch": 0.52, "grad_norm": 9.583096504211426, "learning_rate": 3.46e-06, "loss": 1.1775829315185546, "step": 520 }, { "epoch": 0.52, "eval_0_to_0": 9489, "eval_0_to_1": 550, "eval_1_to_0": 1338, "eval_1_to_1": 8623, "eval_accuracy": 0.9056, "eval_loss": 0.23581719398498535, "eval_runtime": 152.7981, "eval_samples_per_second": 130.892, "eval_steps_per_second": 8.181, "step": 520 }, { "epoch": 0.53, "grad_norm": 8.732056617736816, "learning_rate": 3.526666666666667e-06, "loss": 1.0570709228515625, "step": 530 }, { "epoch": 0.54, "grad_norm": 8.69921588897705, "learning_rate": 3.593333333333334e-06, "loss": 1.1108779907226562, "step": 540 }, { "epoch": 0.54, "eval_0_to_0": 9304, "eval_0_to_1": 735, "eval_1_to_0": 1114, "eval_1_to_1": 8847, "eval_accuracy": 0.90755, "eval_loss": 0.2238471955060959, "eval_runtime": 152.5486, "eval_samples_per_second": 131.106, "eval_steps_per_second": 8.194, "step": 540 }, { "epoch": 0.55, "grad_norm": 6.160991668701172, "learning_rate": 3.66e-06, "loss": 1.0624429702758789, "step": 550 }, { "epoch": 0.56, "grad_norm": 16.39417839050293, "learning_rate": 3.726666666666667e-06, "loss": 1.204234790802002, "step": 560 }, { "epoch": 0.56, "eval_0_to_0": 9441, "eval_0_to_1": 598, "eval_1_to_0": 1246, "eval_1_to_1": 8715, "eval_accuracy": 0.9078, "eval_loss": 0.23201562464237213, "eval_runtime": 150.8995, "eval_samples_per_second": 132.539, "eval_steps_per_second": 8.284, "step": 560 }, { "epoch": 0.57, "grad_norm": 12.524333953857422, "learning_rate": 3.793333333333334e-06, "loss": 1.0269967079162599, "step": 570 }, { "epoch": 0.58, "grad_norm": 13.393942832946777, "learning_rate": 3.86e-06, "loss": 1.0348186492919922, "step": 580 }, { "epoch": 0.58, "eval_0_to_0": 9536, "eval_0_to_1": 503, "eval_1_to_0": 1366, "eval_1_to_1": 8595, "eval_accuracy": 0.90655, "eval_loss": 0.23811733722686768, "eval_runtime": 154.0964, "eval_samples_per_second": 129.789, "eval_steps_per_second": 8.112, "step": 580 }, { "epoch": 0.59, "grad_norm": 12.462431907653809, "learning_rate": 3.926666666666667e-06, "loss": 1.077809715270996, "step": 590 }, { "epoch": 0.6, "grad_norm": 9.286818504333496, "learning_rate": 3.993333333333334e-06, "loss": 1.0350862503051759, "step": 600 }, { "epoch": 0.6, "eval_0_to_0": 9230, "eval_0_to_1": 809, "eval_1_to_0": 985, "eval_1_to_1": 8976, "eval_accuracy": 0.9103, "eval_loss": 0.22740356624126434, "eval_runtime": 153.4063, "eval_samples_per_second": 130.373, "eval_steps_per_second": 8.148, "step": 600 }, { "epoch": 0.61, "grad_norm": 8.459355354309082, "learning_rate": 4.060000000000001e-06, "loss": 0.958552074432373, "step": 610 }, { "epoch": 0.62, "grad_norm": 13.077685356140137, "learning_rate": 4.126666666666667e-06, "loss": 1.1396503448486328, "step": 620 }, { "epoch": 0.62, "eval_0_to_0": 9643, "eval_0_to_1": 396, "eval_1_to_0": 1575, "eval_1_to_1": 8386, "eval_accuracy": 0.90145, "eval_loss": 0.2556374967098236, "eval_runtime": 155.1219, "eval_samples_per_second": 128.931, "eval_steps_per_second": 8.058, "step": 620 }, { "epoch": 0.63, "grad_norm": 9.300798416137695, "learning_rate": 4.1933333333333336e-06, "loss": 1.02322359085083, "step": 630 }, { "epoch": 0.64, "grad_norm": 10.027143478393555, "learning_rate": 4.26e-06, "loss": 1.0911742210388184, "step": 640 }, { "epoch": 0.64, "eval_0_to_0": 9376, "eval_0_to_1": 663, "eval_1_to_0": 1083, "eval_1_to_1": 8878, "eval_accuracy": 0.9127, "eval_loss": 0.214858278632164, "eval_runtime": 154.9581, "eval_samples_per_second": 129.067, "eval_steps_per_second": 8.067, "step": 640 }, { "epoch": 0.65, "grad_norm": 17.53773307800293, "learning_rate": 4.326666666666667e-06, "loss": 1.121927833557129, "step": 650 }, { "epoch": 0.66, "grad_norm": 5.79686975479126, "learning_rate": 4.393333333333334e-06, "loss": 1.294024658203125, "step": 660 }, { "epoch": 0.66, "eval_0_to_0": 9231, "eval_0_to_1": 808, "eval_1_to_0": 924, "eval_1_to_1": 9037, "eval_accuracy": 0.9134, "eval_loss": 0.21243076026439667, "eval_runtime": 155.772, "eval_samples_per_second": 128.393, "eval_steps_per_second": 8.025, "step": 660 }, { "epoch": 0.67, "grad_norm": 25.431882858276367, "learning_rate": 4.4600000000000005e-06, "loss": 1.2451085090637206, "step": 670 }, { "epoch": 0.68, "grad_norm": 7.330904960632324, "learning_rate": 4.526666666666667e-06, "loss": 1.076869297027588, "step": 680 }, { "epoch": 0.68, "eval_0_to_0": 9589, "eval_0_to_1": 450, "eval_1_to_0": 1424, "eval_1_to_1": 8537, "eval_accuracy": 0.9063, "eval_loss": 0.2287440150976181, "eval_runtime": 153.8691, "eval_samples_per_second": 129.981, "eval_steps_per_second": 8.124, "step": 680 }, { "epoch": 0.69, "grad_norm": 10.016022682189941, "learning_rate": 4.593333333333333e-06, "loss": 1.0452801704406738, "step": 690 }, { "epoch": 0.7, "grad_norm": 11.861017227172852, "learning_rate": 4.66e-06, "loss": 0.8902493476867676, "step": 700 }, { "epoch": 0.7, "eval_0_to_0": 9386, "eval_0_to_1": 653, "eval_1_to_0": 1064, "eval_1_to_1": 8897, "eval_accuracy": 0.91415, "eval_loss": 0.22340086102485657, "eval_runtime": 153.8045, "eval_samples_per_second": 130.035, "eval_steps_per_second": 8.127, "step": 700 }, { "epoch": 0.71, "grad_norm": 7.343953609466553, "learning_rate": 4.7266666666666674e-06, "loss": 1.2734143257141113, "step": 710 }, { "epoch": 0.72, "grad_norm": 10.372359275817871, "learning_rate": 4.793333333333334e-06, "loss": 1.1034511566162108, "step": 720 }, { "epoch": 0.72, "eval_0_to_0": 9356, "eval_0_to_1": 683, "eval_1_to_0": 972, "eval_1_to_1": 8989, "eval_accuracy": 0.91725, "eval_loss": 0.20269177854061127, "eval_runtime": 154.2569, "eval_samples_per_second": 129.654, "eval_steps_per_second": 8.103, "step": 720 }, { "epoch": 0.73, "grad_norm": 12.354387283325195, "learning_rate": 4.86e-06, "loss": 0.9585480690002441, "step": 730 }, { "epoch": 0.74, "grad_norm": 16.500886917114258, "learning_rate": 4.926666666666667e-06, "loss": 1.06026029586792, "step": 740 }, { "epoch": 0.74, "eval_0_to_0": 9155, "eval_0_to_1": 884, "eval_1_to_0": 794, "eval_1_to_1": 9167, "eval_accuracy": 0.9161, "eval_loss": 0.21781589090824127, "eval_runtime": 147.3302, "eval_samples_per_second": 135.749, "eval_steps_per_second": 8.484, "step": 740 }, { "epoch": 0.75, "grad_norm": 12.187803268432617, "learning_rate": 4.9933333333333335e-06, "loss": 1.0864809036254883, "step": 750 }, { "epoch": 0.76, "grad_norm": 10.306998252868652, "learning_rate": 5.060000000000001e-06, "loss": 1.0301403045654296, "step": 760 }, { "epoch": 0.76, "eval_0_to_0": 9249, "eval_0_to_1": 790, "eval_1_to_0": 885, "eval_1_to_1": 9076, "eval_accuracy": 0.91625, "eval_loss": 0.20324458181858063, "eval_runtime": 147.1627, "eval_samples_per_second": 135.904, "eval_steps_per_second": 8.494, "step": 760 }, { "epoch": 0.77, "grad_norm": 15.375038146972656, "learning_rate": 5.126666666666668e-06, "loss": 0.9830222129821777, "step": 770 }, { "epoch": 0.78, "grad_norm": 10.70894718170166, "learning_rate": 5.193333333333333e-06, "loss": 1.0222167015075683, "step": 780 }, { "epoch": 0.78, "eval_0_to_0": 9101, "eval_0_to_1": 938, "eval_1_to_0": 683, "eval_1_to_1": 9278, "eval_accuracy": 0.91895, "eval_loss": 0.21197493374347687, "eval_runtime": 146.2893, "eval_samples_per_second": 136.715, "eval_steps_per_second": 8.545, "step": 780 }, { "epoch": 0.79, "grad_norm": 8.742527961730957, "learning_rate": 5.2600000000000005e-06, "loss": 1.0674936294555664, "step": 790 }, { "epoch": 0.8, "grad_norm": 8.27136516571045, "learning_rate": 5.326666666666667e-06, "loss": 1.094324779510498, "step": 800 }, { "epoch": 0.8, "eval_0_to_0": 9415, "eval_0_to_1": 624, "eval_1_to_0": 1052, "eval_1_to_1": 8909, "eval_accuracy": 0.9162, "eval_loss": 0.2081681191921234, "eval_runtime": 144.5902, "eval_samples_per_second": 138.322, "eval_steps_per_second": 8.645, "step": 800 }, { "epoch": 0.81, "grad_norm": 11.97116470336914, "learning_rate": 5.393333333333334e-06, "loss": 1.0903322219848632, "step": 810 }, { "epoch": 0.82, "grad_norm": 9.853927612304688, "learning_rate": 5.460000000000001e-06, "loss": 1.0303427696228027, "step": 820 }, { "epoch": 0.82, "eval_0_to_0": 9172, "eval_0_to_1": 867, "eval_1_to_0": 796, "eval_1_to_1": 9165, "eval_accuracy": 0.91685, "eval_loss": 0.20049230754375458, "eval_runtime": 143.6498, "eval_samples_per_second": 139.227, "eval_steps_per_second": 8.702, "step": 820 }, { "epoch": 0.83, "grad_norm": 8.914313316345215, "learning_rate": 5.5266666666666666e-06, "loss": 1.035728645324707, "step": 830 }, { "epoch": 0.84, "grad_norm": 12.645090103149414, "learning_rate": 5.593333333333334e-06, "loss": 1.1785711288452148, "step": 840 }, { "epoch": 0.84, "eval_0_to_0": 9187, "eval_0_to_1": 852, "eval_1_to_0": 798, "eval_1_to_1": 9163, "eval_accuracy": 0.9175, "eval_loss": 0.20384344458580017, "eval_runtime": 143.3836, "eval_samples_per_second": 139.486, "eval_steps_per_second": 8.718, "step": 840 }, { "epoch": 0.85, "grad_norm": 12.406015396118164, "learning_rate": 5.66e-06, "loss": 1.1995235443115235, "step": 850 }, { "epoch": 0.86, "grad_norm": 6.803390026092529, "learning_rate": 5.726666666666667e-06, "loss": 1.0753606796264648, "step": 860 }, { "epoch": 0.86, "eval_0_to_0": 9396, "eval_0_to_1": 643, "eval_1_to_0": 1008, "eval_1_to_1": 8953, "eval_accuracy": 0.91745, "eval_loss": 0.19610625505447388, "eval_runtime": 143.2437, "eval_samples_per_second": 139.622, "eval_steps_per_second": 8.726, "step": 860 }, { "epoch": 0.87, "grad_norm": 6.968998908996582, "learning_rate": 5.793333333333334e-06, "loss": 0.893736457824707, "step": 870 }, { "epoch": 0.88, "grad_norm": 13.486199378967285, "learning_rate": 5.86e-06, "loss": 0.9531659126281739, "step": 880 }, { "epoch": 0.88, "eval_0_to_0": 9633, "eval_0_to_1": 406, "eval_1_to_0": 1335, "eval_1_to_1": 8626, "eval_accuracy": 0.91295, "eval_loss": 0.22873657941818237, "eval_runtime": 140.5415, "eval_samples_per_second": 142.307, "eval_steps_per_second": 8.894, "step": 880 }, { "epoch": 0.89, "grad_norm": 12.512264251708984, "learning_rate": 5.926666666666667e-06, "loss": 1.027621364593506, "step": 890 }, { "epoch": 0.9, "grad_norm": 19.82262420654297, "learning_rate": 5.993333333333334e-06, "loss": 1.0127410888671875, "step": 900 }, { "epoch": 0.9, "eval_0_to_0": 9134, "eval_0_to_1": 905, "eval_1_to_0": 700, "eval_1_to_1": 9261, "eval_accuracy": 0.91975, "eval_loss": 0.2058851569890976, "eval_runtime": 142.0753, "eval_samples_per_second": 140.77, "eval_steps_per_second": 8.798, "step": 900 }, { "epoch": 0.91, "grad_norm": 9.223892211914062, "learning_rate": 6.0600000000000004e-06, "loss": 1.0001230239868164, "step": 910 }, { "epoch": 0.92, "grad_norm": 8.020139694213867, "learning_rate": 6.126666666666668e-06, "loss": 1.0177064895629884, "step": 920 }, { "epoch": 0.92, "eval_0_to_0": 9439, "eval_0_to_1": 600, "eval_1_to_0": 1021, "eval_1_to_1": 8940, "eval_accuracy": 0.91895, "eval_loss": 0.19757065176963806, "eval_runtime": 131.0473, "eval_samples_per_second": 152.617, "eval_steps_per_second": 9.539, "step": 920 }, { "epoch": 0.93, "grad_norm": 8.604352951049805, "learning_rate": 6.193333333333333e-06, "loss": 1.1154321670532226, "step": 930 }, { "epoch": 0.94, "grad_norm": 23.35120391845703, "learning_rate": 6.26e-06, "loss": 0.8480206489562988, "step": 940 }, { "epoch": 0.94, "eval_0_to_0": 9493, "eval_0_to_1": 546, "eval_1_to_0": 1095, "eval_1_to_1": 8866, "eval_accuracy": 0.91795, "eval_loss": 0.20529809594154358, "eval_runtime": 97.6232, "eval_samples_per_second": 204.869, "eval_steps_per_second": 12.804, "step": 940 }, { "epoch": 0.95, "grad_norm": 10.983294486999512, "learning_rate": 6.326666666666667e-06, "loss": 1.1315244674682616, "step": 950 }, { "epoch": 0.96, "grad_norm": 7.14150333404541, "learning_rate": 6.393333333333334e-06, "loss": 1.013873291015625, "step": 960 }, { "epoch": 0.96, "eval_0_to_0": 9567, "eval_0_to_1": 472, "eval_1_to_0": 1210, "eval_1_to_1": 8751, "eval_accuracy": 0.9159, "eval_loss": 0.2058362513780594, "eval_runtime": 96.9354, "eval_samples_per_second": 206.323, "eval_steps_per_second": 12.895, "step": 960 }, { "epoch": 0.97, "grad_norm": 19.931720733642578, "learning_rate": 6.460000000000001e-06, "loss": 1.1109324455261231, "step": 970 }, { "epoch": 0.98, "grad_norm": 7.949002742767334, "learning_rate": 6.526666666666666e-06, "loss": 1.0851213455200195, "step": 980 }, { "epoch": 0.98, "eval_0_to_0": 9160, "eval_0_to_1": 879, "eval_1_to_0": 693, "eval_1_to_1": 9268, "eval_accuracy": 0.9214, "eval_loss": 0.1895197331905365, "eval_runtime": 97.1307, "eval_samples_per_second": 205.908, "eval_steps_per_second": 12.869, "step": 980 }, { "epoch": 0.99, "grad_norm": 4.769026756286621, "learning_rate": 6.5933333333333335e-06, "loss": 0.8639727592468261, "step": 990 }, { "epoch": 1.0, "grad_norm": 12.571009635925293, "learning_rate": 6.660000000000001e-06, "loss": 0.9905485153198242, "step": 1000 }, { "epoch": 1.0, "eval_0_to_0": 8759, "eval_0_to_1": 1280, "eval_1_to_0": 460, "eval_1_to_1": 9501, "eval_accuracy": 0.913, "eval_loss": 0.2222493439912796, "eval_runtime": 96.6469, "eval_samples_per_second": 206.939, "eval_steps_per_second": 12.934, "step": 1000 }, { "epoch": 1.01, "grad_norm": 9.548188209533691, "learning_rate": 6.726666666666667e-06, "loss": 0.8627056121826172, "step": 1010 }, { "epoch": 1.02, "grad_norm": 5.755829811096191, "learning_rate": 6.793333333333334e-06, "loss": 0.8212664604187012, "step": 1020 }, { "epoch": 1.02, "eval_0_to_0": 9503, "eval_0_to_1": 536, "eval_1_to_0": 1071, "eval_1_to_1": 8890, "eval_accuracy": 0.91965, "eval_loss": 0.20535312592983246, "eval_runtime": 96.8228, "eval_samples_per_second": 206.563, "eval_steps_per_second": 12.91, "step": 1020 }, { "epoch": 1.03, "grad_norm": 10.846151351928711, "learning_rate": 6.860000000000001e-06, "loss": 0.9367273330688477, "step": 1030 }, { "epoch": 1.04, "grad_norm": 11.550578117370605, "learning_rate": 6.926666666666667e-06, "loss": 0.930204200744629, "step": 1040 }, { "epoch": 1.04, "eval_0_to_0": 9175, "eval_0_to_1": 864, "eval_1_to_0": 692, "eval_1_to_1": 9269, "eval_accuracy": 0.9222, "eval_loss": 0.1923637092113495, "eval_runtime": 97.2796, "eval_samples_per_second": 205.593, "eval_steps_per_second": 12.85, "step": 1040 }, { "epoch": 1.05, "grad_norm": 14.124927520751953, "learning_rate": 6.993333333333334e-06, "loss": 0.7875213623046875, "step": 1050 }, { "epoch": 1.06, "grad_norm": 7.725718975067139, "learning_rate": 7.06e-06, "loss": 0.925318717956543, "step": 1060 }, { "epoch": 1.06, "eval_0_to_0": 9088, "eval_0_to_1": 951, "eval_1_to_0": 652, "eval_1_to_1": 9309, "eval_accuracy": 0.91985, "eval_loss": 0.19735600054264069, "eval_runtime": 98.9518, "eval_samples_per_second": 202.119, "eval_steps_per_second": 12.632, "step": 1060 }, { "epoch": 1.07, "grad_norm": 4.769575595855713, "learning_rate": 7.126666666666667e-06, "loss": 0.8377066612243652, "step": 1070 }, { "epoch": 1.08, "grad_norm": 22.374685287475586, "learning_rate": 7.1933333333333345e-06, "loss": 0.9260210037231446, "step": 1080 }, { "epoch": 1.08, "eval_0_to_0": 9478, "eval_0_to_1": 561, "eval_1_to_0": 998, "eval_1_to_1": 8963, "eval_accuracy": 0.92205, "eval_loss": 0.2103579342365265, "eval_runtime": 97.3428, "eval_samples_per_second": 205.459, "eval_steps_per_second": 12.841, "step": 1080 }, { "epoch": 1.09, "grad_norm": 12.878731727600098, "learning_rate": 7.260000000000001e-06, "loss": 0.9920706748962402, "step": 1090 }, { "epoch": 1.1, "grad_norm": 8.157943725585938, "learning_rate": 7.326666666666667e-06, "loss": 0.6387374401092529, "step": 1100 }, { "epoch": 1.1, "eval_0_to_0": 9486, "eval_0_to_1": 553, "eval_1_to_0": 1009, "eval_1_to_1": 8952, "eval_accuracy": 0.9219, "eval_loss": 0.21049867570400238, "eval_runtime": 98.5528, "eval_samples_per_second": 202.937, "eval_steps_per_second": 12.684, "step": 1100 }, { "epoch": 1.11, "grad_norm": 6.255701065063477, "learning_rate": 7.393333333333333e-06, "loss": 0.9712568283081054, "step": 1110 }, { "epoch": 1.12, "grad_norm": 7.218482971191406, "learning_rate": 7.4600000000000006e-06, "loss": 0.8062179565429688, "step": 1120 }, { "epoch": 1.12, "eval_0_to_0": 9331, "eval_0_to_1": 708, "eval_1_to_0": 854, "eval_1_to_1": 9107, "eval_accuracy": 0.9219, "eval_loss": 0.2070700228214264, "eval_runtime": 98.2882, "eval_samples_per_second": 203.483, "eval_steps_per_second": 12.718, "step": 1120 }, { "epoch": 1.13, "grad_norm": 11.006665229797363, "learning_rate": 7.526666666666668e-06, "loss": 0.785050344467163, "step": 1130 }, { "epoch": 1.1400000000000001, "grad_norm": 18.275014877319336, "learning_rate": 7.593333333333334e-06, "loss": 1.0750404357910157, "step": 1140 }, { "epoch": 1.1400000000000001, "eval_0_to_0": 9707, "eval_0_to_1": 332, "eval_1_to_0": 1472, "eval_1_to_1": 8489, "eval_accuracy": 0.9098, "eval_loss": 0.21553601324558258, "eval_runtime": 98.861, "eval_samples_per_second": 202.304, "eval_steps_per_second": 12.644, "step": 1140 }, { "epoch": 1.15, "grad_norm": 12.301077842712402, "learning_rate": 7.660000000000001e-06, "loss": 0.9330018997192383, "step": 1150 }, { "epoch": 1.16, "grad_norm": 10.883600234985352, "learning_rate": 7.726666666666667e-06, "loss": 0.9575928688049317, "step": 1160 }, { "epoch": 1.16, "eval_0_to_0": 9324, "eval_0_to_1": 715, "eval_1_to_0": 825, "eval_1_to_1": 9136, "eval_accuracy": 0.923, "eval_loss": 0.20219968259334564, "eval_runtime": 98.1673, "eval_samples_per_second": 203.734, "eval_steps_per_second": 12.733, "step": 1160 }, { "epoch": 1.17, "grad_norm": 6.054111003875732, "learning_rate": 7.793333333333334e-06, "loss": 0.9175711631774902, "step": 1170 }, { "epoch": 1.18, "grad_norm": 8.070836067199707, "learning_rate": 7.860000000000001e-06, "loss": 0.7933511734008789, "step": 1180 }, { "epoch": 1.18, "eval_0_to_0": 9576, "eval_0_to_1": 463, "eval_1_to_0": 1136, "eval_1_to_1": 8825, "eval_accuracy": 0.92005, "eval_loss": 0.20487619936466217, "eval_runtime": 97.833, "eval_samples_per_second": 204.43, "eval_steps_per_second": 12.777, "step": 1180 }, { "epoch": 1.19, "grad_norm": 7.890456199645996, "learning_rate": 7.926666666666666e-06, "loss": 0.8416905403137207, "step": 1190 }, { "epoch": 1.2, "grad_norm": 9.347284317016602, "learning_rate": 7.993333333333334e-06, "loss": 0.8422119140625, "step": 1200 }, { "epoch": 1.2, "eval_0_to_0": 9254, "eval_0_to_1": 785, "eval_1_to_0": 772, "eval_1_to_1": 9189, "eval_accuracy": 0.92215, "eval_loss": 0.20016713440418243, "eval_runtime": 97.2077, "eval_samples_per_second": 205.745, "eval_steps_per_second": 12.859, "step": 1200 }, { "epoch": 1.21, "grad_norm": 9.015935897827148, "learning_rate": 8.06e-06, "loss": 1.0206162452697753, "step": 1210 }, { "epoch": 1.22, "grad_norm": 9.105796813964844, "learning_rate": 8.126666666666668e-06, "loss": 0.8897556304931641, "step": 1220 }, { "epoch": 1.22, "eval_0_to_0": 9335, "eval_0_to_1": 704, "eval_1_to_0": 871, "eval_1_to_1": 9090, "eval_accuracy": 0.92125, "eval_loss": 0.19975876808166504, "eval_runtime": 98.0612, "eval_samples_per_second": 203.954, "eval_steps_per_second": 12.747, "step": 1220 }, { "epoch": 1.23, "grad_norm": 8.042919158935547, "learning_rate": 8.193333333333335e-06, "loss": 0.8286808967590332, "step": 1230 }, { "epoch": 1.24, "grad_norm": 9.980459213256836, "learning_rate": 8.26e-06, "loss": 1.0563092231750488, "step": 1240 }, { "epoch": 1.24, "eval_0_to_0": 8805, "eval_0_to_1": 1234, "eval_1_to_0": 479, "eval_1_to_1": 9482, "eval_accuracy": 0.91435, "eval_loss": 0.21279919147491455, "eval_runtime": 97.9545, "eval_samples_per_second": 204.176, "eval_steps_per_second": 12.761, "step": 1240 }, { "epoch": 1.25, "grad_norm": 7.544905662536621, "learning_rate": 8.326666666666668e-06, "loss": 0.932545280456543, "step": 1250 }, { "epoch": 1.26, "grad_norm": 8.03132152557373, "learning_rate": 8.393333333333335e-06, "loss": 1.0393267631530763, "step": 1260 }, { "epoch": 1.26, "eval_0_to_0": 9414, "eval_0_to_1": 625, "eval_1_to_0": 891, "eval_1_to_1": 9070, "eval_accuracy": 0.9242, "eval_loss": 0.19507575035095215, "eval_runtime": 97.2193, "eval_samples_per_second": 205.72, "eval_steps_per_second": 12.858, "step": 1260 }, { "epoch": 1.27, "grad_norm": 6.510592460632324, "learning_rate": 8.46e-06, "loss": 0.9591614723205566, "step": 1270 }, { "epoch": 1.28, "grad_norm": 4.576834678649902, "learning_rate": 8.526666666666667e-06, "loss": 0.8381454467773437, "step": 1280 }, { "epoch": 1.28, "eval_0_to_0": 9345, "eval_0_to_1": 694, "eval_1_to_0": 798, "eval_1_to_1": 9163, "eval_accuracy": 0.9254, "eval_loss": 0.1843441128730774, "eval_runtime": 96.9488, "eval_samples_per_second": 206.294, "eval_steps_per_second": 12.893, "step": 1280 }, { "epoch": 1.29, "grad_norm": 9.3822660446167, "learning_rate": 8.593333333333333e-06, "loss": 0.7929884910583496, "step": 1290 }, { "epoch": 1.3, "grad_norm": 7.41011381149292, "learning_rate": 8.66e-06, "loss": 0.8222143173217773, "step": 1300 }, { "epoch": 1.3, "eval_0_to_0": 9061, "eval_0_to_1": 978, "eval_1_to_0": 577, "eval_1_to_1": 9384, "eval_accuracy": 0.92225, "eval_loss": 0.21553413569927216, "eval_runtime": 98.3777, "eval_samples_per_second": 203.298, "eval_steps_per_second": 12.706, "step": 1300 }, { "epoch": 1.31, "grad_norm": 7.830503940582275, "learning_rate": 8.726666666666667e-06, "loss": 0.9841746330261231, "step": 1310 }, { "epoch": 1.32, "grad_norm": 11.811213493347168, "learning_rate": 8.793333333333334e-06, "loss": 0.6671288013458252, "step": 1320 }, { "epoch": 1.32, "eval_0_to_0": 9476, "eval_0_to_1": 563, "eval_1_to_0": 895, "eval_1_to_1": 9066, "eval_accuracy": 0.9271, "eval_loss": 0.19968979060649872, "eval_runtime": 98.3147, "eval_samples_per_second": 203.428, "eval_steps_per_second": 12.714, "step": 1320 }, { "epoch": 1.33, "grad_norm": 12.288426399230957, "learning_rate": 8.860000000000002e-06, "loss": 0.8630924224853516, "step": 1330 }, { "epoch": 1.34, "grad_norm": 5.608919620513916, "learning_rate": 8.926666666666669e-06, "loss": 0.946479606628418, "step": 1340 }, { "epoch": 1.34, "eval_0_to_0": 9372, "eval_0_to_1": 667, "eval_1_to_0": 814, "eval_1_to_1": 9147, "eval_accuracy": 0.92595, "eval_loss": 0.1878405064344406, "eval_runtime": 97.4107, "eval_samples_per_second": 205.316, "eval_steps_per_second": 12.832, "step": 1340 }, { "epoch": 1.35, "grad_norm": 6.199465751647949, "learning_rate": 8.993333333333334e-06, "loss": 0.8136900901794434, "step": 1350 }, { "epoch": 1.3599999999999999, "grad_norm": 7.214879035949707, "learning_rate": 9.060000000000001e-06, "loss": 0.855317497253418, "step": 1360 }, { "epoch": 1.3599999999999999, "eval_0_to_0": 9639, "eval_0_to_1": 400, "eval_1_to_0": 1193, "eval_1_to_1": 8768, "eval_accuracy": 0.92035, "eval_loss": 0.21617856621742249, "eval_runtime": 97.7595, "eval_samples_per_second": 204.584, "eval_steps_per_second": 12.786, "step": 1360 }, { "epoch": 1.37, "grad_norm": 19.4871826171875, "learning_rate": 9.126666666666667e-06, "loss": 0.9157630920410156, "step": 1370 }, { "epoch": 1.38, "grad_norm": 9.184164047241211, "learning_rate": 9.193333333333334e-06, "loss": 1.2046463012695312, "step": 1380 }, { "epoch": 1.38, "eval_0_to_0": 9199, "eval_0_to_1": 840, "eval_1_to_0": 699, "eval_1_to_1": 9262, "eval_accuracy": 0.92305, "eval_loss": 0.19361603260040283, "eval_runtime": 97.5835, "eval_samples_per_second": 204.953, "eval_steps_per_second": 12.81, "step": 1380 }, { "epoch": 1.3900000000000001, "grad_norm": 4.106681823730469, "learning_rate": 9.260000000000001e-06, "loss": 0.9741597175598145, "step": 1390 }, { "epoch": 1.4, "grad_norm": 8.417256355285645, "learning_rate": 9.326666666666667e-06, "loss": 1.0066558837890625, "step": 1400 }, { "epoch": 1.4, "eval_0_to_0": 9531, "eval_0_to_1": 508, "eval_1_to_0": 1051, "eval_1_to_1": 8910, "eval_accuracy": 0.92205, "eval_loss": 0.19862237572669983, "eval_runtime": 96.6955, "eval_samples_per_second": 206.835, "eval_steps_per_second": 12.927, "step": 1400 }, { "epoch": 1.41, "grad_norm": 6.5152268409729, "learning_rate": 9.393333333333334e-06, "loss": 1.037283706665039, "step": 1410 }, { "epoch": 1.42, "grad_norm": 6.797024726867676, "learning_rate": 9.460000000000001e-06, "loss": 0.9552536010742188, "step": 1420 }, { "epoch": 1.42, "eval_0_to_0": 9195, "eval_0_to_1": 844, "eval_1_to_0": 654, "eval_1_to_1": 9307, "eval_accuracy": 0.9251, "eval_loss": 0.17994804680347443, "eval_runtime": 97.597, "eval_samples_per_second": 204.924, "eval_steps_per_second": 12.808, "step": 1420 }, { "epoch": 1.43, "grad_norm": 6.795649528503418, "learning_rate": 9.526666666666668e-06, "loss": 0.9587939262390137, "step": 1430 }, { "epoch": 1.44, "grad_norm": 11.101421356201172, "learning_rate": 9.593333333333335e-06, "loss": 0.7823525428771972, "step": 1440 }, { "epoch": 1.44, "eval_0_to_0": 9489, "eval_0_to_1": 550, "eval_1_to_0": 909, "eval_1_to_1": 9052, "eval_accuracy": 0.92705, "eval_loss": 0.1938629448413849, "eval_runtime": 96.7602, "eval_samples_per_second": 206.697, "eval_steps_per_second": 12.919, "step": 1440 }, { "epoch": 1.45, "grad_norm": 7.756502151489258, "learning_rate": 9.66e-06, "loss": 0.9800934791564941, "step": 1450 }, { "epoch": 1.46, "grad_norm": 5.214425086975098, "learning_rate": 9.726666666666668e-06, "loss": 0.8638940811157226, "step": 1460 }, { "epoch": 1.46, "eval_0_to_0": 9398, "eval_0_to_1": 641, "eval_1_to_0": 843, "eval_1_to_1": 9118, "eval_accuracy": 0.9258, "eval_loss": 0.184081569314003, "eval_runtime": 97.9384, "eval_samples_per_second": 204.21, "eval_steps_per_second": 12.763, "step": 1460 }, { "epoch": 1.47, "grad_norm": 8.617888450622559, "learning_rate": 9.793333333333333e-06, "loss": 0.9186227798461915, "step": 1470 }, { "epoch": 1.48, "grad_norm": 11.225737571716309, "learning_rate": 9.86e-06, "loss": 1.0048918724060059, "step": 1480 }, { "epoch": 1.48, "eval_0_to_0": 9341, "eval_0_to_1": 698, "eval_1_to_0": 856, "eval_1_to_1": 9105, "eval_accuracy": 0.9223, "eval_loss": 0.198923259973526, "eval_runtime": 96.9102, "eval_samples_per_second": 206.377, "eval_steps_per_second": 12.899, "step": 1480 }, { "epoch": 1.49, "grad_norm": 10.853110313415527, "learning_rate": 9.926666666666668e-06, "loss": 0.8526774406433105, "step": 1490 }, { "epoch": 1.5, "grad_norm": 8.656189918518066, "learning_rate": 9.993333333333333e-06, "loss": 0.7670225620269775, "step": 1500 }, { "epoch": 1.5, "eval_0_to_0": 9467, "eval_0_to_1": 572, "eval_1_to_0": 924, "eval_1_to_1": 9037, "eval_accuracy": 0.9252, "eval_loss": 0.19649381935596466, "eval_runtime": 97.703, "eval_samples_per_second": 204.702, "eval_steps_per_second": 12.794, "step": 1500 }, { "epoch": 1.51, "grad_norm": 18.508031845092773, "learning_rate": 9.993333333333333e-06, "loss": 0.9336189270019531, "step": 1510 }, { "epoch": 1.52, "grad_norm": 6.894880294799805, "learning_rate": 9.985925925925927e-06, "loss": 0.9381028175354004, "step": 1520 }, { "epoch": 1.52, "eval_0_to_0": 9432, "eval_0_to_1": 607, "eval_1_to_0": 907, "eval_1_to_1": 9054, "eval_accuracy": 0.9243, "eval_loss": 0.17941950261592865, "eval_runtime": 96.9556, "eval_samples_per_second": 206.28, "eval_steps_per_second": 12.892, "step": 1520 }, { "epoch": 1.53, "grad_norm": 4.754528045654297, "learning_rate": 9.97851851851852e-06, "loss": 0.7382461071014405, "step": 1530 }, { "epoch": 1.54, "grad_norm": 9.808503150939941, "learning_rate": 9.97111111111111e-06, "loss": 0.9231479644775391, "step": 1540 }, { "epoch": 1.54, "eval_0_to_0": 9488, "eval_0_to_1": 551, "eval_1_to_0": 927, "eval_1_to_1": 9034, "eval_accuracy": 0.9261, "eval_loss": 0.18723444640636444, "eval_runtime": 97.5798, "eval_samples_per_second": 204.96, "eval_steps_per_second": 12.81, "step": 1540 }, { "epoch": 1.55, "grad_norm": 8.071449279785156, "learning_rate": 9.963703703703704e-06, "loss": 0.8092551231384277, "step": 1550 }, { "epoch": 1.56, "grad_norm": 8.208584785461426, "learning_rate": 9.956296296296298e-06, "loss": 0.9196621894836425, "step": 1560 }, { "epoch": 1.56, "eval_0_to_0": 8877, "eval_0_to_1": 1162, "eval_1_to_0": 438, "eval_1_to_1": 9523, "eval_accuracy": 0.92, "eval_loss": 0.19277916848659515, "eval_runtime": 96.7035, "eval_samples_per_second": 206.818, "eval_steps_per_second": 12.926, "step": 1560 }, { "epoch": 1.5699999999999998, "grad_norm": 6.592662811279297, "learning_rate": 9.94888888888889e-06, "loss": 0.765935754776001, "step": 1570 }, { "epoch": 1.58, "grad_norm": 5.894466876983643, "learning_rate": 9.941481481481482e-06, "loss": 0.7902498722076416, "step": 1580 }, { "epoch": 1.58, "eval_0_to_0": 9488, "eval_0_to_1": 551, "eval_1_to_0": 922, "eval_1_to_1": 9039, "eval_accuracy": 0.92635, "eval_loss": 0.1852365881204605, "eval_runtime": 97.6615, "eval_samples_per_second": 204.789, "eval_steps_per_second": 12.799, "step": 1580 }, { "epoch": 1.5899999999999999, "grad_norm": 6.537148952484131, "learning_rate": 9.934074074074076e-06, "loss": 0.8348127365112304, "step": 1590 }, { "epoch": 1.6, "grad_norm": 10.9349365234375, "learning_rate": 9.926666666666668e-06, "loss": 0.951177978515625, "step": 1600 }, { "epoch": 1.6, "eval_0_to_0": 9028, "eval_0_to_1": 1011, "eval_1_to_0": 562, "eval_1_to_1": 9399, "eval_accuracy": 0.92135, "eval_loss": 0.188204824924469, "eval_runtime": 96.8031, "eval_samples_per_second": 206.605, "eval_steps_per_second": 12.913, "step": 1600 }, { "epoch": 1.6099999999999999, "grad_norm": 6.715347766876221, "learning_rate": 9.91925925925926e-06, "loss": 1.032254123687744, "step": 1610 }, { "epoch": 1.62, "grad_norm": 11.844467163085938, "learning_rate": 9.911851851851853e-06, "loss": 1.0564508438110352, "step": 1620 }, { "epoch": 1.62, "eval_0_to_0": 9651, "eval_0_to_1": 388, "eval_1_to_0": 1161, "eval_1_to_1": 8800, "eval_accuracy": 0.92255, "eval_loss": 0.18540292978286743, "eval_runtime": 97.5419, "eval_samples_per_second": 205.04, "eval_steps_per_second": 12.815, "step": 1620 }, { "epoch": 1.63, "grad_norm": 8.452465057373047, "learning_rate": 9.904444444444445e-06, "loss": 0.8001560211181641, "step": 1630 }, { "epoch": 1.6400000000000001, "grad_norm": 6.3244452476501465, "learning_rate": 9.897037037037039e-06, "loss": 0.920355224609375, "step": 1640 }, { "epoch": 1.6400000000000001, "eval_0_to_0": 9237, "eval_0_to_1": 802, "eval_1_to_0": 711, "eval_1_to_1": 9250, "eval_accuracy": 0.92435, "eval_loss": 0.18924885988235474, "eval_runtime": 97.2216, "eval_samples_per_second": 205.716, "eval_steps_per_second": 12.857, "step": 1640 }, { "epoch": 1.65, "grad_norm": 6.441288948059082, "learning_rate": 9.889629629629631e-06, "loss": 0.8416326522827149, "step": 1650 }, { "epoch": 1.6600000000000001, "grad_norm": 7.8611979484558105, "learning_rate": 9.882222222222223e-06, "loss": 0.881014347076416, "step": 1660 }, { "epoch": 1.6600000000000001, "eval_0_to_0": 9657, "eval_0_to_1": 382, "eval_1_to_0": 1210, "eval_1_to_1": 8751, "eval_accuracy": 0.9204, "eval_loss": 0.20671188831329346, "eval_runtime": 96.9524, "eval_samples_per_second": 206.287, "eval_steps_per_second": 12.893, "step": 1660 }, { "epoch": 1.67, "grad_norm": 7.642369747161865, "learning_rate": 9.874814814814817e-06, "loss": 0.9258264541625977, "step": 1670 }, { "epoch": 1.6800000000000002, "grad_norm": 8.992392539978027, "learning_rate": 9.867407407407408e-06, "loss": 1.0505446434020995, "step": 1680 }, { "epoch": 1.6800000000000002, "eval_0_to_0": 9369, "eval_0_to_1": 670, "eval_1_to_0": 813, "eval_1_to_1": 9148, "eval_accuracy": 0.92585, "eval_loss": 0.18727856874465942, "eval_runtime": 96.6651, "eval_samples_per_second": 206.9, "eval_steps_per_second": 12.931, "step": 1680 }, { "epoch": 1.69, "grad_norm": 13.41158390045166, "learning_rate": 9.86e-06, "loss": 0.946995735168457, "step": 1690 }, { "epoch": 1.7, "grad_norm": 8.813283920288086, "learning_rate": 9.852592592592594e-06, "loss": 0.9233298301696777, "step": 1700 }, { "epoch": 1.7, "eval_0_to_0": 9229, "eval_0_to_1": 810, "eval_1_to_0": 639, "eval_1_to_1": 9322, "eval_accuracy": 0.92755, "eval_loss": 0.18229462206363678, "eval_runtime": 96.2326, "eval_samples_per_second": 207.83, "eval_steps_per_second": 12.989, "step": 1700 }, { "epoch": 1.71, "grad_norm": 4.288189888000488, "learning_rate": 9.845185185185186e-06, "loss": 0.8852403640747071, "step": 1710 }, { "epoch": 1.72, "grad_norm": 9.201218605041504, "learning_rate": 9.837777777777778e-06, "loss": 0.9039773941040039, "step": 1720 }, { "epoch": 1.72, "eval_0_to_0": 9640, "eval_0_to_1": 399, "eval_1_to_0": 1139, "eval_1_to_1": 8822, "eval_accuracy": 0.9231, "eval_loss": 0.2115851789712906, "eval_runtime": 96.3128, "eval_samples_per_second": 207.657, "eval_steps_per_second": 12.979, "step": 1720 }, { "epoch": 1.73, "grad_norm": 6.766139030456543, "learning_rate": 9.830370370370372e-06, "loss": 0.7335227966308594, "step": 1730 }, { "epoch": 1.74, "grad_norm": 6.9149885177612305, "learning_rate": 9.822962962962964e-06, "loss": 0.923591136932373, "step": 1740 }, { "epoch": 1.74, "eval_0_to_0": 9166, "eval_0_to_1": 873, "eval_1_to_0": 606, "eval_1_to_1": 9355, "eval_accuracy": 0.92605, "eval_loss": 0.17920632660388947, "eval_runtime": 96.183, "eval_samples_per_second": 207.937, "eval_steps_per_second": 12.996, "step": 1740 }, { "epoch": 1.75, "grad_norm": 4.597909450531006, "learning_rate": 9.815555555555556e-06, "loss": 0.7875788688659668, "step": 1750 }, { "epoch": 1.76, "grad_norm": 7.597878456115723, "learning_rate": 9.80814814814815e-06, "loss": 0.8508902549743652, "step": 1760 }, { "epoch": 1.76, "eval_0_to_0": 9381, "eval_0_to_1": 658, "eval_1_to_0": 793, "eval_1_to_1": 9168, "eval_accuracy": 0.92745, "eval_loss": 0.19594353437423706, "eval_runtime": 94.6512, "eval_samples_per_second": 211.302, "eval_steps_per_second": 13.206, "step": 1760 }, { "epoch": 1.77, "grad_norm": 7.298484802246094, "learning_rate": 9.800740740740741e-06, "loss": 1.0011483192443849, "step": 1770 }, { "epoch": 1.78, "grad_norm": 5.903456211090088, "learning_rate": 9.793333333333333e-06, "loss": 0.8880718231201172, "step": 1780 }, { "epoch": 1.78, "eval_0_to_0": 9132, "eval_0_to_1": 907, "eval_1_to_0": 535, "eval_1_to_1": 9426, "eval_accuracy": 0.9279, "eval_loss": 0.175894632935524, "eval_runtime": 94.7769, "eval_samples_per_second": 211.022, "eval_steps_per_second": 13.189, "step": 1780 }, { "epoch": 1.79, "grad_norm": 8.339759826660156, "learning_rate": 9.785925925925927e-06, "loss": 0.7609918594360352, "step": 1790 }, { "epoch": 1.8, "grad_norm": 4.508332252502441, "learning_rate": 9.778518518518519e-06, "loss": 0.7626521587371826, "step": 1800 }, { "epoch": 1.8, "eval_0_to_0": 9132, "eval_0_to_1": 907, "eval_1_to_0": 535, "eval_1_to_1": 9426, "eval_accuracy": 0.9279, "eval_loss": 0.18710820376873016, "eval_runtime": 94.7797, "eval_samples_per_second": 211.016, "eval_steps_per_second": 13.188, "step": 1800 }, { "epoch": 1.81, "grad_norm": 4.797223091125488, "learning_rate": 9.771111111111113e-06, "loss": 0.7681895732879639, "step": 1810 }, { "epoch": 1.8199999999999998, "grad_norm": 13.138893127441406, "learning_rate": 9.763703703703705e-06, "loss": 0.9573493003845215, "step": 1820 }, { "epoch": 1.8199999999999998, "eval_0_to_0": 9660, "eval_0_to_1": 379, "eval_1_to_0": 1212, "eval_1_to_1": 8749, "eval_accuracy": 0.92045, "eval_loss": 0.20597314834594727, "eval_runtime": 94.8468, "eval_samples_per_second": 210.866, "eval_steps_per_second": 13.179, "step": 1820 }, { "epoch": 1.83, "grad_norm": 4.96630859375, "learning_rate": 9.756296296296297e-06, "loss": 0.8394744873046875, "step": 1830 }, { "epoch": 1.8399999999999999, "grad_norm": 10.532071113586426, "learning_rate": 9.74888888888889e-06, "loss": 0.9739195823669433, "step": 1840 }, { "epoch": 1.8399999999999999, "eval_0_to_0": 9457, "eval_0_to_1": 582, "eval_1_to_0": 805, "eval_1_to_1": 9156, "eval_accuracy": 0.93065, "eval_loss": 0.17650125920772552, "eval_runtime": 95.3604, "eval_samples_per_second": 209.731, "eval_steps_per_second": 13.108, "step": 1840 }, { "epoch": 1.85, "grad_norm": 5.61600923538208, "learning_rate": 9.741481481481482e-06, "loss": 0.8449163436889648, "step": 1850 }, { "epoch": 1.8599999999999999, "grad_norm": 6.41193962097168, "learning_rate": 9.734074074074074e-06, "loss": 0.757649278640747, "step": 1860 }, { "epoch": 1.8599999999999999, "eval_0_to_0": 9576, "eval_0_to_1": 463, "eval_1_to_0": 1004, "eval_1_to_1": 8957, "eval_accuracy": 0.92665, "eval_loss": 0.19417712092399597, "eval_runtime": 95.4804, "eval_samples_per_second": 209.467, "eval_steps_per_second": 13.092, "step": 1860 }, { "epoch": 1.87, "grad_norm": 8.162829399108887, "learning_rate": 9.726666666666668e-06, "loss": 0.7096567630767823, "step": 1870 }, { "epoch": 1.88, "grad_norm": 5.436959743499756, "learning_rate": 9.71925925925926e-06, "loss": 0.8351683616638184, "step": 1880 }, { "epoch": 1.88, "eval_0_to_0": 9535, "eval_0_to_1": 504, "eval_1_to_0": 896, "eval_1_to_1": 9065, "eval_accuracy": 0.93, "eval_loss": 0.17791272699832916, "eval_runtime": 95.3785, "eval_samples_per_second": 209.691, "eval_steps_per_second": 13.106, "step": 1880 }, { "epoch": 1.8900000000000001, "grad_norm": 3.8867077827453613, "learning_rate": 9.711851851851852e-06, "loss": 0.7939999580383301, "step": 1890 }, { "epoch": 1.9, "grad_norm": 5.9428815841674805, "learning_rate": 9.704444444444445e-06, "loss": 0.7181871414184571, "step": 1900 }, { "epoch": 1.9, "eval_0_to_0": 9447, "eval_0_to_1": 592, "eval_1_to_0": 815, "eval_1_to_1": 9146, "eval_accuracy": 0.92965, "eval_loss": 0.19810250401496887, "eval_runtime": 94.7411, "eval_samples_per_second": 211.102, "eval_steps_per_second": 13.194, "step": 1900 }, { "epoch": 1.9100000000000001, "grad_norm": 7.616575717926025, "learning_rate": 9.697037037037037e-06, "loss": 0.7901614665985107, "step": 1910 }, { "epoch": 1.92, "grad_norm": 6.068014621734619, "learning_rate": 9.68962962962963e-06, "loss": 0.8548122406005859, "step": 1920 }, { "epoch": 1.92, "eval_0_to_0": 9567, "eval_0_to_1": 472, "eval_1_to_0": 959, "eval_1_to_1": 9002, "eval_accuracy": 0.92845, "eval_loss": 0.18932300806045532, "eval_runtime": 95.5143, "eval_samples_per_second": 209.393, "eval_steps_per_second": 13.087, "step": 1920 }, { "epoch": 1.9300000000000002, "grad_norm": 10.111082077026367, "learning_rate": 9.682222222222223e-06, "loss": 1.0807427406311034, "step": 1930 }, { "epoch": 1.94, "grad_norm": 5.76358699798584, "learning_rate": 9.674814814814815e-06, "loss": 0.8722275733947754, "step": 1940 }, { "epoch": 1.94, "eval_0_to_0": 9428, "eval_0_to_1": 611, "eval_1_to_0": 782, "eval_1_to_1": 9179, "eval_accuracy": 0.93035, "eval_loss": 0.1763191670179367, "eval_runtime": 95.0393, "eval_samples_per_second": 210.439, "eval_steps_per_second": 13.152, "step": 1940 }, { "epoch": 1.95, "grad_norm": 6.4535017013549805, "learning_rate": 9.667407407407409e-06, "loss": 0.7490505695343017, "step": 1950 }, { "epoch": 1.96, "grad_norm": 5.925605297088623, "learning_rate": 9.66e-06, "loss": 1.0138107299804688, "step": 1960 }, { "epoch": 1.96, "eval_0_to_0": 9659, "eval_0_to_1": 380, "eval_1_to_0": 1062, "eval_1_to_1": 8899, "eval_accuracy": 0.9279, "eval_loss": 0.17433497309684753, "eval_runtime": 94.9037, "eval_samples_per_second": 210.74, "eval_steps_per_second": 13.171, "step": 1960 }, { "epoch": 1.97, "grad_norm": 4.089773654937744, "learning_rate": 9.652592592592593e-06, "loss": 0.8145974159240723, "step": 1970 }, { "epoch": 1.98, "grad_norm": 19.203739166259766, "learning_rate": 9.645185185185186e-06, "loss": 0.8800396919250488, "step": 1980 }, { "epoch": 1.98, "eval_0_to_0": 9074, "eval_0_to_1": 965, "eval_1_to_0": 507, "eval_1_to_1": 9454, "eval_accuracy": 0.9264, "eval_loss": 0.21773816645145416, "eval_runtime": 94.9629, "eval_samples_per_second": 210.609, "eval_steps_per_second": 13.163, "step": 1980 }, { "epoch": 1.99, "grad_norm": 7.898519992828369, "learning_rate": 9.637777777777778e-06, "loss": 1.0461490631103516, "step": 1990 }, { "epoch": 2.0, "grad_norm": 4.981967449188232, "learning_rate": 9.63037037037037e-06, "loss": 0.844471549987793, "step": 2000 }, { "epoch": 2.0, "eval_0_to_0": 9605, "eval_0_to_1": 434, "eval_1_to_0": 1023, "eval_1_to_1": 8938, "eval_accuracy": 0.92715, "eval_loss": 0.18548282980918884, "eval_runtime": 94.8906, "eval_samples_per_second": 210.769, "eval_steps_per_second": 13.173, "step": 2000 }, { "epoch": 2.01, "grad_norm": 7.460784912109375, "learning_rate": 9.622962962962964e-06, "loss": 0.6091363430023193, "step": 2010 }, { "epoch": 2.02, "grad_norm": 3.9483695030212402, "learning_rate": 9.615555555555558e-06, "loss": 0.5073812961578369, "step": 2020 }, { "epoch": 2.02, "eval_0_to_0": 9470, "eval_0_to_1": 569, "eval_1_to_0": 777, "eval_1_to_1": 9184, "eval_accuracy": 0.9327, "eval_loss": 0.22119103372097015, "eval_runtime": 94.6307, "eval_samples_per_second": 211.348, "eval_steps_per_second": 13.209, "step": 2020 }, { "epoch": 2.03, "grad_norm": 6.50008487701416, "learning_rate": 9.608148148148148e-06, "loss": 0.6069861888885498, "step": 2030 }, { "epoch": 2.04, "grad_norm": 9.61160945892334, "learning_rate": 9.600740740740742e-06, "loss": 0.6352587699890136, "step": 2040 }, { "epoch": 2.04, "eval_0_to_0": 9283, "eval_0_to_1": 756, "eval_1_to_0": 644, "eval_1_to_1": 9317, "eval_accuracy": 0.93, "eval_loss": 0.19368937611579895, "eval_runtime": 95.9521, "eval_samples_per_second": 208.437, "eval_steps_per_second": 13.027, "step": 2040 }, { "epoch": 2.05, "grad_norm": 8.399759292602539, "learning_rate": 9.593333333333335e-06, "loss": 0.5166998863220215, "step": 2050 }, { "epoch": 2.06, "grad_norm": 4.318264484405518, "learning_rate": 9.585925925925926e-06, "loss": 0.5867427825927735, "step": 2060 }, { "epoch": 2.06, "eval_0_to_0": 9548, "eval_0_to_1": 491, "eval_1_to_0": 896, "eval_1_to_1": 9065, "eval_accuracy": 0.93065, "eval_loss": 0.1978129893541336, "eval_runtime": 95.5173, "eval_samples_per_second": 209.386, "eval_steps_per_second": 13.087, "step": 2060 }, { "epoch": 2.07, "grad_norm": 4.546568870544434, "learning_rate": 9.57851851851852e-06, "loss": 0.5705870151519775, "step": 2070 }, { "epoch": 2.08, "grad_norm": 8.084410667419434, "learning_rate": 9.571111111111113e-06, "loss": 0.6491015911102295, "step": 2080 }, { "epoch": 2.08, "eval_0_to_0": 9751, "eval_0_to_1": 288, "eval_1_to_0": 1306, "eval_1_to_1": 8655, "eval_accuracy": 0.9203, "eval_loss": 0.21690602600574493, "eval_runtime": 94.7292, "eval_samples_per_second": 211.128, "eval_steps_per_second": 13.196, "step": 2080 }, { "epoch": 2.09, "grad_norm": 5.5644612312316895, "learning_rate": 9.563703703703703e-06, "loss": 0.5980065822601318, "step": 2090 }, { "epoch": 2.1, "grad_norm": 5.44895076751709, "learning_rate": 9.556296296296297e-06, "loss": 0.41556129455566404, "step": 2100 }, { "epoch": 2.1, "eval_0_to_0": 9531, "eval_0_to_1": 508, "eval_1_to_0": 803, "eval_1_to_1": 9158, "eval_accuracy": 0.93445, "eval_loss": 0.21151229739189148, "eval_runtime": 95.8395, "eval_samples_per_second": 208.682, "eval_steps_per_second": 13.043, "step": 2100 }, { "epoch": 2.11, "grad_norm": 12.11681842803955, "learning_rate": 9.54888888888889e-06, "loss": 0.5641345500946044, "step": 2110 }, { "epoch": 2.12, "grad_norm": 4.424150466918945, "learning_rate": 9.541481481481482e-06, "loss": 0.4131570339202881, "step": 2120 }, { "epoch": 2.12, "eval_0_to_0": 9214, "eval_0_to_1": 825, "eval_1_to_0": 563, "eval_1_to_1": 9398, "eval_accuracy": 0.9306, "eval_loss": 0.2087515890598297, "eval_runtime": 95.7015, "eval_samples_per_second": 208.983, "eval_steps_per_second": 13.061, "step": 2120 }, { "epoch": 2.13, "grad_norm": 10.711043357849121, "learning_rate": 9.534074074074074e-06, "loss": 0.7425378322601318, "step": 2130 }, { "epoch": 2.14, "grad_norm": 12.378499031066895, "learning_rate": 9.526666666666668e-06, "loss": 0.7151143074035644, "step": 2140 }, { "epoch": 2.14, "eval_0_to_0": 9217, "eval_0_to_1": 822, "eval_1_to_0": 586, "eval_1_to_1": 9375, "eval_accuracy": 0.9296, "eval_loss": 0.18297237157821655, "eval_runtime": 95.5068, "eval_samples_per_second": 209.409, "eval_steps_per_second": 13.088, "step": 2140 }, { "epoch": 2.15, "grad_norm": 4.784491539001465, "learning_rate": 9.51925925925926e-06, "loss": 0.6744821071624756, "step": 2150 }, { "epoch": 2.16, "grad_norm": 6.902181148529053, "learning_rate": 9.511851851851852e-06, "loss": 0.5114306926727294, "step": 2160 }, { "epoch": 2.16, "eval_0_to_0": 9124, "eval_0_to_1": 915, "eval_1_to_0": 527, "eval_1_to_1": 9434, "eval_accuracy": 0.9279, "eval_loss": 0.20923975110054016, "eval_runtime": 94.9712, "eval_samples_per_second": 210.59, "eval_steps_per_second": 13.162, "step": 2160 }, { "epoch": 2.17, "grad_norm": 7.621180057525635, "learning_rate": 9.504444444444446e-06, "loss": 0.5667724609375, "step": 2170 }, { "epoch": 2.18, "grad_norm": 9.829768180847168, "learning_rate": 9.497037037037038e-06, "loss": 0.6836455345153809, "step": 2180 }, { "epoch": 2.18, "eval_0_to_0": 9102, "eval_0_to_1": 937, "eval_1_to_0": 513, "eval_1_to_1": 9448, "eval_accuracy": 0.9275, "eval_loss": 0.1985635608434677, "eval_runtime": 95.3888, "eval_samples_per_second": 209.668, "eval_steps_per_second": 13.104, "step": 2180 }, { "epoch": 2.19, "grad_norm": 5.015073299407959, "learning_rate": 9.489629629629631e-06, "loss": 0.5993427753448486, "step": 2190 }, { "epoch": 2.2, "grad_norm": 10.645644187927246, "learning_rate": 9.482222222222223e-06, "loss": 0.57111496925354, "step": 2200 }, { "epoch": 2.2, "eval_0_to_0": 9337, "eval_0_to_1": 702, "eval_1_to_0": 741, "eval_1_to_1": 9220, "eval_accuracy": 0.92785, "eval_loss": 0.2162381410598755, "eval_runtime": 94.5944, "eval_samples_per_second": 211.429, "eval_steps_per_second": 13.214, "step": 2200 }, { "epoch": 2.21, "grad_norm": 6.569232940673828, "learning_rate": 9.474814814814815e-06, "loss": 0.4713266849517822, "step": 2210 }, { "epoch": 2.22, "grad_norm": 10.39619255065918, "learning_rate": 9.467407407407409e-06, "loss": 0.5230387687683106, "step": 2220 }, { "epoch": 2.22, "eval_0_to_0": 9496, "eval_0_to_1": 543, "eval_1_to_0": 856, "eval_1_to_1": 9105, "eval_accuracy": 0.93005, "eval_loss": 0.22509746253490448, "eval_runtime": 94.8557, "eval_samples_per_second": 210.847, "eval_steps_per_second": 13.178, "step": 2220 }, { "epoch": 2.23, "grad_norm": 7.406115531921387, "learning_rate": 9.460000000000001e-06, "loss": 0.7423370361328125, "step": 2230 }, { "epoch": 2.24, "grad_norm": 5.465859889984131, "learning_rate": 9.452592592592593e-06, "loss": 0.5022745132446289, "step": 2240 }, { "epoch": 2.24, "eval_0_to_0": 9209, "eval_0_to_1": 830, "eval_1_to_0": 551, "eval_1_to_1": 9410, "eval_accuracy": 0.93095, "eval_loss": 0.19361892342567444, "eval_runtime": 95.0596, "eval_samples_per_second": 210.394, "eval_steps_per_second": 13.15, "step": 2240 }, { "epoch": 2.25, "grad_norm": 7.193978786468506, "learning_rate": 9.445185185185187e-06, "loss": 0.6062870979309082, "step": 2250 }, { "epoch": 2.26, "grad_norm": 10.455349922180176, "learning_rate": 9.437777777777779e-06, "loss": 0.4640629768371582, "step": 2260 }, { "epoch": 2.26, "eval_0_to_0": 9233, "eval_0_to_1": 806, "eval_1_to_0": 592, "eval_1_to_1": 9369, "eval_accuracy": 0.9301, "eval_loss": 0.20996712148189545, "eval_runtime": 95.8348, "eval_samples_per_second": 208.692, "eval_steps_per_second": 13.043, "step": 2260 }, { "epoch": 2.27, "grad_norm": 5.517762660980225, "learning_rate": 9.43037037037037e-06, "loss": 0.6792084693908691, "step": 2270 }, { "epoch": 2.2800000000000002, "grad_norm": 8.462328910827637, "learning_rate": 9.422962962962964e-06, "loss": 0.5107593536376953, "step": 2280 }, { "epoch": 2.2800000000000002, "eval_0_to_0": 9767, "eval_0_to_1": 272, "eval_1_to_0": 1301, "eval_1_to_1": 8660, "eval_accuracy": 0.92135, "eval_loss": 0.25522762537002563, "eval_runtime": 95.9308, "eval_samples_per_second": 208.484, "eval_steps_per_second": 13.03, "step": 2280 }, { "epoch": 2.29, "grad_norm": 10.848752975463867, "learning_rate": 9.415555555555556e-06, "loss": 0.8187835693359375, "step": 2290 }, { "epoch": 2.3, "grad_norm": 7.1002302169799805, "learning_rate": 9.408148148148148e-06, "loss": 0.717153787612915, "step": 2300 }, { "epoch": 2.3, "eval_0_to_0": 9460, "eval_0_to_1": 579, "eval_1_to_0": 830, "eval_1_to_1": 9131, "eval_accuracy": 0.92955, "eval_loss": 0.19621188938617706, "eval_runtime": 95.5403, "eval_samples_per_second": 209.336, "eval_steps_per_second": 13.083, "step": 2300 }, { "epoch": 2.31, "grad_norm": 10.812705993652344, "learning_rate": 9.400740740740742e-06, "loss": 0.5326683044433593, "step": 2310 }, { "epoch": 2.32, "grad_norm": 17.305400848388672, "learning_rate": 9.393333333333334e-06, "loss": 0.5487436771392822, "step": 2320 }, { "epoch": 2.32, "eval_0_to_0": 9331, "eval_0_to_1": 708, "eval_1_to_0": 701, "eval_1_to_1": 9260, "eval_accuracy": 0.92955, "eval_loss": 0.2166135311126709, "eval_runtime": 96.3799, "eval_samples_per_second": 207.512, "eval_steps_per_second": 12.97, "step": 2320 }, { "epoch": 2.33, "grad_norm": 7.201786041259766, "learning_rate": 9.385925925925927e-06, "loss": 0.4880497455596924, "step": 2330 }, { "epoch": 2.34, "grad_norm": 5.342504501342773, "learning_rate": 9.37851851851852e-06, "loss": 0.5916942119598388, "step": 2340 }, { "epoch": 2.34, "eval_0_to_0": 9045, "eval_0_to_1": 994, "eval_1_to_0": 447, "eval_1_to_1": 9514, "eval_accuracy": 0.92795, "eval_loss": 0.1972454935312271, "eval_runtime": 96.0177, "eval_samples_per_second": 208.295, "eval_steps_per_second": 13.018, "step": 2340 }, { "epoch": 2.35, "grad_norm": 7.336770534515381, "learning_rate": 9.371111111111111e-06, "loss": 0.6217350482940673, "step": 2350 }, { "epoch": 2.36, "grad_norm": 12.341031074523926, "learning_rate": 9.363703703703705e-06, "loss": 0.6831212520599366, "step": 2360 }, { "epoch": 2.36, "eval_0_to_0": 9529, "eval_0_to_1": 510, "eval_1_to_0": 882, "eval_1_to_1": 9079, "eval_accuracy": 0.9304, "eval_loss": 0.18714934587478638, "eval_runtime": 95.1596, "eval_samples_per_second": 210.173, "eval_steps_per_second": 13.136, "step": 2360 }, { "epoch": 2.37, "grad_norm": 8.414613723754883, "learning_rate": 9.356296296296297e-06, "loss": 0.5264273166656495, "step": 2370 }, { "epoch": 2.38, "grad_norm": 9.706707000732422, "learning_rate": 9.348888888888889e-06, "loss": 0.4856362819671631, "step": 2380 }, { "epoch": 2.38, "eval_0_to_0": 8791, "eval_0_to_1": 1248, "eval_1_to_0": 354, "eval_1_to_1": 9607, "eval_accuracy": 0.9199, "eval_loss": 0.2385108470916748, "eval_runtime": 95.5389, "eval_samples_per_second": 209.339, "eval_steps_per_second": 13.084, "step": 2380 }, { "epoch": 2.39, "grad_norm": 4.845064163208008, "learning_rate": 9.341481481481483e-06, "loss": 0.6946516513824463, "step": 2390 }, { "epoch": 2.4, "grad_norm": 7.9665632247924805, "learning_rate": 9.334074074074075e-06, "loss": 0.7606473445892334, "step": 2400 }, { "epoch": 2.4, "eval_0_to_0": 9004, "eval_0_to_1": 1035, "eval_1_to_0": 406, "eval_1_to_1": 9555, "eval_accuracy": 0.92795, "eval_loss": 0.19436506927013397, "eval_runtime": 94.5981, "eval_samples_per_second": 211.421, "eval_steps_per_second": 13.214, "step": 2400 }, { "epoch": 2.41, "grad_norm": 11.427267074584961, "learning_rate": 9.326666666666667e-06, "loss": 0.6064732074737549, "step": 2410 }, { "epoch": 2.42, "grad_norm": 9.507243156433105, "learning_rate": 9.31925925925926e-06, "loss": 0.49828948974609377, "step": 2420 }, { "epoch": 2.42, "eval_0_to_0": 9452, "eval_0_to_1": 587, "eval_1_to_0": 765, "eval_1_to_1": 9196, "eval_accuracy": 0.9324, "eval_loss": 0.21018674969673157, "eval_runtime": 94.7131, "eval_samples_per_second": 211.164, "eval_steps_per_second": 13.198, "step": 2420 }, { "epoch": 2.43, "grad_norm": 8.460349082946777, "learning_rate": 9.311851851851852e-06, "loss": 0.7350780963897705, "step": 2430 }, { "epoch": 2.44, "grad_norm": 4.776440143585205, "learning_rate": 9.304444444444444e-06, "loss": 0.7397513389587402, "step": 2440 }, { "epoch": 2.44, "eval_0_to_0": 9455, "eval_0_to_1": 584, "eval_1_to_0": 803, "eval_1_to_1": 9158, "eval_accuracy": 0.93065, "eval_loss": 0.1809895634651184, "eval_runtime": 95.1811, "eval_samples_per_second": 210.126, "eval_steps_per_second": 13.133, "step": 2440 }, { "epoch": 2.45, "grad_norm": 5.248861312866211, "learning_rate": 9.297037037037038e-06, "loss": 0.49302020072937014, "step": 2450 }, { "epoch": 2.46, "grad_norm": 16.2982234954834, "learning_rate": 9.28962962962963e-06, "loss": 0.5346555233001709, "step": 2460 }, { "epoch": 2.46, "eval_0_to_0": 9684, "eval_0_to_1": 355, "eval_1_to_0": 1261, "eval_1_to_1": 8700, "eval_accuracy": 0.9192, "eval_loss": 0.259805291891098, "eval_runtime": 95.0596, "eval_samples_per_second": 210.394, "eval_steps_per_second": 13.15, "step": 2460 }, { "epoch": 2.4699999999999998, "grad_norm": 9.38904094696045, "learning_rate": 9.282222222222222e-06, "loss": 0.7552540302276611, "step": 2470 }, { "epoch": 2.48, "grad_norm": 7.518335342407227, "learning_rate": 9.274814814814815e-06, "loss": 0.6056636810302735, "step": 2480 }, { "epoch": 2.48, "eval_0_to_0": 9643, "eval_0_to_1": 396, "eval_1_to_0": 1048, "eval_1_to_1": 8913, "eval_accuracy": 0.9278, "eval_loss": 0.2027001678943634, "eval_runtime": 94.5778, "eval_samples_per_second": 211.466, "eval_steps_per_second": 13.217, "step": 2480 }, { "epoch": 2.49, "grad_norm": 3.84792160987854, "learning_rate": 9.267407407407407e-06, "loss": 0.44101104736328123, "step": 2490 }, { "epoch": 2.5, "grad_norm": 7.670607089996338, "learning_rate": 9.260000000000001e-06, "loss": 0.5701048851013184, "step": 2500 }, { "epoch": 2.5, "eval_0_to_0": 9229, "eval_0_to_1": 810, "eval_1_to_0": 553, "eval_1_to_1": 9408, "eval_accuracy": 0.93185, "eval_loss": 0.2115451693534851, "eval_runtime": 95.0777, "eval_samples_per_second": 210.354, "eval_steps_per_second": 13.147, "step": 2500 }, { "epoch": 2.51, "grad_norm": 3.5492238998413086, "learning_rate": 9.252592592592593e-06, "loss": 0.5352516174316406, "step": 2510 }, { "epoch": 2.52, "grad_norm": 7.667317867279053, "learning_rate": 9.245185185185187e-06, "loss": 0.6167850494384766, "step": 2520 }, { "epoch": 2.52, "eval_0_to_0": 9402, "eval_0_to_1": 637, "eval_1_to_0": 711, "eval_1_to_1": 9250, "eval_accuracy": 0.9326, "eval_loss": 0.1912088841199875, "eval_runtime": 94.7086, "eval_samples_per_second": 211.174, "eval_steps_per_second": 13.198, "step": 2520 }, { "epoch": 2.5300000000000002, "grad_norm": 5.434122562408447, "learning_rate": 9.237777777777779e-06, "loss": 0.47311878204345703, "step": 2530 }, { "epoch": 2.54, "grad_norm": 8.248917579650879, "learning_rate": 9.23037037037037e-06, "loss": 0.5200250625610352, "step": 2540 }, { "epoch": 2.54, "eval_0_to_0": 9223, "eval_0_to_1": 816, "eval_1_to_0": 565, "eval_1_to_1": 9396, "eval_accuracy": 0.93095, "eval_loss": 0.2098025381565094, "eval_runtime": 93.6385, "eval_samples_per_second": 213.587, "eval_steps_per_second": 13.349, "step": 2540 }, { "epoch": 2.55, "grad_norm": 7.7074971199035645, "learning_rate": 9.222962962962964e-06, "loss": 0.6500988483428956, "step": 2550 }, { "epoch": 2.56, "grad_norm": 7.103867053985596, "learning_rate": 9.215555555555556e-06, "loss": 0.5033397674560547, "step": 2560 }, { "epoch": 2.56, "eval_0_to_0": 9547, "eval_0_to_1": 492, "eval_1_to_0": 931, "eval_1_to_1": 9030, "eval_accuracy": 0.92885, "eval_loss": 0.1945328563451767, "eval_runtime": 93.6914, "eval_samples_per_second": 213.467, "eval_steps_per_second": 13.342, "step": 2560 }, { "epoch": 2.57, "grad_norm": 7.159485340118408, "learning_rate": 9.20814814814815e-06, "loss": 0.5560158252716064, "step": 2570 }, { "epoch": 2.58, "grad_norm": 9.506207466125488, "learning_rate": 9.200740740740742e-06, "loss": 0.5477660179138184, "step": 2580 }, { "epoch": 2.58, "eval_0_to_0": 9439, "eval_0_to_1": 600, "eval_1_to_0": 732, "eval_1_to_1": 9229, "eval_accuracy": 0.9334, "eval_loss": 0.1869308054447174, "eval_runtime": 95.884, "eval_samples_per_second": 208.585, "eval_steps_per_second": 13.037, "step": 2580 }, { "epoch": 2.59, "grad_norm": 8.125874519348145, "learning_rate": 9.193333333333334e-06, "loss": 0.5672760009765625, "step": 2590 }, { "epoch": 2.6, "grad_norm": 5.592207908630371, "learning_rate": 9.185925925925928e-06, "loss": 0.440602970123291, "step": 2600 }, { "epoch": 2.6, "eval_0_to_0": 9493, "eval_0_to_1": 546, "eval_1_to_0": 848, "eval_1_to_1": 9113, "eval_accuracy": 0.9303, "eval_loss": 0.20141339302062988, "eval_runtime": 96.124, "eval_samples_per_second": 208.065, "eval_steps_per_second": 13.004, "step": 2600 }, { "epoch": 2.61, "grad_norm": 5.091989040374756, "learning_rate": 9.17851851851852e-06, "loss": 0.6466684818267823, "step": 2610 }, { "epoch": 2.62, "grad_norm": 10.577057838439941, "learning_rate": 9.171111111111112e-06, "loss": 0.7990130424499512, "step": 2620 }, { "epoch": 2.62, "eval_0_to_0": 9151, "eval_0_to_1": 888, "eval_1_to_0": 480, "eval_1_to_1": 9481, "eval_accuracy": 0.9316, "eval_loss": 0.18609721958637238, "eval_runtime": 95.5376, "eval_samples_per_second": 209.342, "eval_steps_per_second": 13.084, "step": 2620 }, { "epoch": 2.63, "grad_norm": 9.42254638671875, "learning_rate": 9.163703703703705e-06, "loss": 0.6506913185119629, "step": 2630 }, { "epoch": 2.64, "grad_norm": 3.9936370849609375, "learning_rate": 9.156296296296297e-06, "loss": 0.5139788627624512, "step": 2640 }, { "epoch": 2.64, "eval_0_to_0": 9152, "eval_0_to_1": 887, "eval_1_to_0": 519, "eval_1_to_1": 9442, "eval_accuracy": 0.9297, "eval_loss": 0.19829902052879333, "eval_runtime": 95.9749, "eval_samples_per_second": 208.388, "eval_steps_per_second": 13.024, "step": 2640 }, { "epoch": 2.65, "grad_norm": 8.452199935913086, "learning_rate": 9.14888888888889e-06, "loss": 0.6591789245605468, "step": 2650 }, { "epoch": 2.66, "grad_norm": 14.760972023010254, "learning_rate": 9.141481481481483e-06, "loss": 0.6267857551574707, "step": 2660 }, { "epoch": 2.66, "eval_0_to_0": 9115, "eval_0_to_1": 924, "eval_1_to_0": 473, "eval_1_to_1": 9488, "eval_accuracy": 0.93015, "eval_loss": 0.2077585905790329, "eval_runtime": 94.9213, "eval_samples_per_second": 210.701, "eval_steps_per_second": 13.169, "step": 2660 }, { "epoch": 2.67, "grad_norm": 11.285577774047852, "learning_rate": 9.134074074074075e-06, "loss": 0.592226791381836, "step": 2670 }, { "epoch": 2.68, "grad_norm": 8.44962215423584, "learning_rate": 9.126666666666667e-06, "loss": 0.6545314788818359, "step": 2680 }, { "epoch": 2.68, "eval_0_to_0": 9532, "eval_0_to_1": 507, "eval_1_to_0": 837, "eval_1_to_1": 9124, "eval_accuracy": 0.9328, "eval_loss": 0.19588589668273926, "eval_runtime": 96.3846, "eval_samples_per_second": 207.502, "eval_steps_per_second": 12.969, "step": 2680 }, { "epoch": 2.69, "grad_norm": 8.51264762878418, "learning_rate": 9.11925925925926e-06, "loss": 0.5490888595581055, "step": 2690 }, { "epoch": 2.7, "grad_norm": 7.7431135177612305, "learning_rate": 9.111851851851852e-06, "loss": 0.4572620391845703, "step": 2700 }, { "epoch": 2.7, "eval_0_to_0": 9427, "eval_0_to_1": 612, "eval_1_to_0": 751, "eval_1_to_1": 9210, "eval_accuracy": 0.93185, "eval_loss": 0.19771137833595276, "eval_runtime": 95.4147, "eval_samples_per_second": 209.611, "eval_steps_per_second": 13.101, "step": 2700 }, { "epoch": 2.71, "grad_norm": 9.949167251586914, "learning_rate": 9.104444444444444e-06, "loss": 0.7553203105926514, "step": 2710 }, { "epoch": 2.7199999999999998, "grad_norm": 3.0176918506622314, "learning_rate": 9.097037037037038e-06, "loss": 0.55758638381958, "step": 2720 }, { "epoch": 2.7199999999999998, "eval_0_to_0": 9432, "eval_0_to_1": 607, "eval_1_to_0": 744, "eval_1_to_1": 9217, "eval_accuracy": 0.93245, "eval_loss": 0.1837911158800125, "eval_runtime": 95.5036, "eval_samples_per_second": 209.416, "eval_steps_per_second": 13.089, "step": 2720 }, { "epoch": 2.73, "grad_norm": 4.520053863525391, "learning_rate": 9.08962962962963e-06, "loss": 0.5584455490112304, "step": 2730 }, { "epoch": 2.74, "grad_norm": 7.689911842346191, "learning_rate": 9.082222222222224e-06, "loss": 0.5054067611694336, "step": 2740 }, { "epoch": 2.74, "eval_0_to_0": 9348, "eval_0_to_1": 691, "eval_1_to_0": 635, "eval_1_to_1": 9326, "eval_accuracy": 0.9337, "eval_loss": 0.2014799565076828, "eval_runtime": 95.1116, "eval_samples_per_second": 210.279, "eval_steps_per_second": 13.142, "step": 2740 }, { "epoch": 2.75, "grad_norm": 6.679114818572998, "learning_rate": 9.074814814814816e-06, "loss": 0.5775113582611084, "step": 2750 }, { "epoch": 2.76, "grad_norm": 8.51785945892334, "learning_rate": 9.067407407407408e-06, "loss": 0.4991010665893555, "step": 2760 }, { "epoch": 2.76, "eval_0_to_0": 9453, "eval_0_to_1": 586, "eval_1_to_0": 728, "eval_1_to_1": 9233, "eval_accuracy": 0.9343, "eval_loss": 0.1943826675415039, "eval_runtime": 94.9319, "eval_samples_per_second": 210.677, "eval_steps_per_second": 13.167, "step": 2760 }, { "epoch": 2.77, "grad_norm": 12.464170455932617, "learning_rate": 9.060000000000001e-06, "loss": 0.7394177436828613, "step": 2770 }, { "epoch": 2.7800000000000002, "grad_norm": 6.553550720214844, "learning_rate": 9.052592592592593e-06, "loss": 0.5422329425811767, "step": 2780 }, { "epoch": 2.7800000000000002, "eval_0_to_0": 9572, "eval_0_to_1": 467, "eval_1_to_0": 889, "eval_1_to_1": 9072, "eval_accuracy": 0.9322, "eval_loss": 0.18641966581344604, "eval_runtime": 94.3982, "eval_samples_per_second": 211.868, "eval_steps_per_second": 13.242, "step": 2780 }, { "epoch": 2.79, "grad_norm": 7.035796165466309, "learning_rate": 9.045185185185185e-06, "loss": 0.7107777118682861, "step": 2790 }, { "epoch": 2.8, "grad_norm": 5.070230007171631, "learning_rate": 9.037777777777779e-06, "loss": 0.5471320629119873, "step": 2800 }, { "epoch": 2.8, "eval_0_to_0": 9302, "eval_0_to_1": 737, "eval_1_to_0": 591, "eval_1_to_1": 9370, "eval_accuracy": 0.9336, "eval_loss": 0.18336166441440582, "eval_runtime": 94.5614, "eval_samples_per_second": 211.503, "eval_steps_per_second": 13.219, "step": 2800 }, { "epoch": 2.81, "grad_norm": 7.721627712249756, "learning_rate": 9.030370370370371e-06, "loss": 0.49155120849609374, "step": 2810 }, { "epoch": 2.82, "grad_norm": 9.578051567077637, "learning_rate": 9.022962962962963e-06, "loss": 0.5872142314910889, "step": 2820 }, { "epoch": 2.82, "eval_0_to_0": 9676, "eval_0_to_1": 363, "eval_1_to_0": 1071, "eval_1_to_1": 8890, "eval_accuracy": 0.9283, "eval_loss": 0.22526729106903076, "eval_runtime": 93.9461, "eval_samples_per_second": 212.888, "eval_steps_per_second": 13.305, "step": 2820 }, { "epoch": 2.83, "grad_norm": 9.892667770385742, "learning_rate": 9.015555555555557e-06, "loss": 0.6089344024658203, "step": 2830 }, { "epoch": 2.84, "grad_norm": 8.235193252563477, "learning_rate": 9.008148148148149e-06, "loss": 0.6444014549255371, "step": 2840 }, { "epoch": 2.84, "eval_0_to_0": 9541, "eval_0_to_1": 498, "eval_1_to_0": 831, "eval_1_to_1": 9130, "eval_accuracy": 0.93355, "eval_loss": 0.1818721741437912, "eval_runtime": 94.8006, "eval_samples_per_second": 210.969, "eval_steps_per_second": 13.186, "step": 2840 }, { "epoch": 2.85, "grad_norm": 4.069358825683594, "learning_rate": 9.00074074074074e-06, "loss": 0.5273394584655762, "step": 2850 }, { "epoch": 2.86, "grad_norm": 6.277520656585693, "learning_rate": 8.993333333333334e-06, "loss": 0.48998322486877444, "step": 2860 }, { "epoch": 2.86, "eval_0_to_0": 9386, "eval_0_to_1": 653, "eval_1_to_0": 703, "eval_1_to_1": 9258, "eval_accuracy": 0.9322, "eval_loss": 0.20800068974494934, "eval_runtime": 95.5566, "eval_samples_per_second": 209.3, "eval_steps_per_second": 13.081, "step": 2860 }, { "epoch": 2.87, "grad_norm": 8.826696395874023, "learning_rate": 8.985925925925926e-06, "loss": 0.45378780364990234, "step": 2870 }, { "epoch": 2.88, "grad_norm": 8.999438285827637, "learning_rate": 8.97851851851852e-06, "loss": 0.6531513214111329, "step": 2880 }, { "epoch": 2.88, "eval_0_to_0": 9251, "eval_0_to_1": 788, "eval_1_to_0": 578, "eval_1_to_1": 9383, "eval_accuracy": 0.9317, "eval_loss": 0.2048557847738266, "eval_runtime": 95.6801, "eval_samples_per_second": 209.03, "eval_steps_per_second": 13.064, "step": 2880 }, { "epoch": 2.89, "grad_norm": 17.21841812133789, "learning_rate": 8.971111111111112e-06, "loss": 0.6345098495483399, "step": 2890 }, { "epoch": 2.9, "grad_norm": 10.82502555847168, "learning_rate": 8.963703703703704e-06, "loss": 0.7667971611022949, "step": 2900 }, { "epoch": 2.9, "eval_0_to_0": 9547, "eval_0_to_1": 492, "eval_1_to_0": 858, "eval_1_to_1": 9103, "eval_accuracy": 0.9325, "eval_loss": 0.18678200244903564, "eval_runtime": 94.4956, "eval_samples_per_second": 211.65, "eval_steps_per_second": 13.228, "step": 2900 }, { "epoch": 2.91, "grad_norm": 3.368309259414673, "learning_rate": 8.956296296296297e-06, "loss": 0.6640207767486572, "step": 2910 }, { "epoch": 2.92, "grad_norm": 9.614599227905273, "learning_rate": 8.94888888888889e-06, "loss": 0.5673943519592285, "step": 2920 }, { "epoch": 2.92, "eval_0_to_0": 9565, "eval_0_to_1": 474, "eval_1_to_0": 891, "eval_1_to_1": 9070, "eval_accuracy": 0.93175, "eval_loss": 0.19421817362308502, "eval_runtime": 94.8425, "eval_samples_per_second": 210.876, "eval_steps_per_second": 13.18, "step": 2920 }, { "epoch": 2.93, "grad_norm": 6.315657615661621, "learning_rate": 8.941481481481481e-06, "loss": 0.7589742183685303, "step": 2930 }, { "epoch": 2.94, "grad_norm": 3.880070686340332, "learning_rate": 8.934074074074075e-06, "loss": 0.6295429706573487, "step": 2940 }, { "epoch": 2.94, "eval_0_to_0": 9549, "eval_0_to_1": 490, "eval_1_to_0": 842, "eval_1_to_1": 9119, "eval_accuracy": 0.9334, "eval_loss": 0.1813150942325592, "eval_runtime": 95.2623, "eval_samples_per_second": 209.947, "eval_steps_per_second": 13.122, "step": 2940 }, { "epoch": 2.95, "grad_norm": 6.44234561920166, "learning_rate": 8.926666666666669e-06, "loss": 0.6474379539489746, "step": 2950 }, { "epoch": 2.96, "grad_norm": 26.70078468322754, "learning_rate": 8.919259259259259e-06, "loss": 0.6438134670257568, "step": 2960 }, { "epoch": 2.96, "eval_0_to_0": 9128, "eval_0_to_1": 911, "eval_1_to_0": 482, "eval_1_to_1": 9479, "eval_accuracy": 0.93035, "eval_loss": 0.18122367560863495, "eval_runtime": 92.719, "eval_samples_per_second": 215.705, "eval_steps_per_second": 13.482, "step": 2960 }, { "epoch": 2.9699999999999998, "grad_norm": 4.53579044342041, "learning_rate": 8.911851851851853e-06, "loss": 0.8345800399780273, "step": 2970 }, { "epoch": 2.98, "grad_norm": 9.812292098999023, "learning_rate": 8.904444444444446e-06, "loss": 0.7597450733184814, "step": 2980 }, { "epoch": 2.98, "eval_0_to_0": 9073, "eval_0_to_1": 966, "eval_1_to_0": 457, "eval_1_to_1": 9504, "eval_accuracy": 0.92885, "eval_loss": 0.18561023473739624, "eval_runtime": 95.785, "eval_samples_per_second": 208.801, "eval_steps_per_second": 13.05, "step": 2980 }, { "epoch": 2.99, "grad_norm": 5.4306254386901855, "learning_rate": 8.897037037037037e-06, "loss": 0.6350045680999756, "step": 2990 }, { "epoch": 3.0, "grad_norm": 8.835311889648438, "learning_rate": 8.88962962962963e-06, "loss": 0.603657865524292, "step": 3000 }, { "epoch": 3.0, "eval_0_to_0": 9155, "eval_0_to_1": 884, "eval_1_to_0": 476, "eval_1_to_1": 9485, "eval_accuracy": 0.932, "eval_loss": 0.17832832038402557, "eval_runtime": 94.7637, "eval_samples_per_second": 211.051, "eval_steps_per_second": 13.191, "step": 3000 }, { "epoch": 3.01, "grad_norm": 4.206456184387207, "learning_rate": 8.882222222222224e-06, "loss": 0.4155711650848389, "step": 3010 }, { "epoch": 3.02, "grad_norm": 7.36455774307251, "learning_rate": 8.874814814814814e-06, "loss": 0.33185269832611086, "step": 3020 }, { "epoch": 3.02, "eval_0_to_0": 9364, "eval_0_to_1": 675, "eval_1_to_0": 630, "eval_1_to_1": 9331, "eval_accuracy": 0.93475, "eval_loss": 0.23258976638317108, "eval_runtime": 95.104, "eval_samples_per_second": 210.296, "eval_steps_per_second": 13.144, "step": 3020 }, { "epoch": 3.03, "grad_norm": 13.130237579345703, "learning_rate": 8.867407407407408e-06, "loss": 0.36589879989624025, "step": 3030 }, { "epoch": 3.04, "grad_norm": 7.018111228942871, "learning_rate": 8.860000000000002e-06, "loss": 0.35030536651611327, "step": 3040 }, { "epoch": 3.04, "eval_0_to_0": 9500, "eval_0_to_1": 539, "eval_1_to_0": 775, "eval_1_to_1": 9186, "eval_accuracy": 0.9343, "eval_loss": 0.24993708729743958, "eval_runtime": 94.934, "eval_samples_per_second": 210.673, "eval_steps_per_second": 13.167, "step": 3040 }, { "epoch": 3.05, "grad_norm": 5.392736434936523, "learning_rate": 8.852592592592594e-06, "loss": 0.24870197772979735, "step": 3050 }, { "epoch": 3.06, "grad_norm": 5.3151068687438965, "learning_rate": 8.845185185185186e-06, "loss": 0.20693488121032716, "step": 3060 }, { "epoch": 3.06, "eval_0_to_0": 9413, "eval_0_to_1": 626, "eval_1_to_0": 669, "eval_1_to_1": 9292, "eval_accuracy": 0.93525, "eval_loss": 0.2618772089481354, "eval_runtime": 96.2251, "eval_samples_per_second": 207.846, "eval_steps_per_second": 12.99, "step": 3060 }, { "epoch": 3.07, "grad_norm": 7.440441131591797, "learning_rate": 8.83777777777778e-06, "loss": 0.2978097915649414, "step": 3070 }, { "epoch": 3.08, "grad_norm": 5.4390387535095215, "learning_rate": 8.830370370370371e-06, "loss": 0.2490896224975586, "step": 3080 }, { "epoch": 3.08, "eval_0_to_0": 9479, "eval_0_to_1": 560, "eval_1_to_0": 757, "eval_1_to_1": 9204, "eval_accuracy": 0.93415, "eval_loss": 0.26681816577911377, "eval_runtime": 93.1844, "eval_samples_per_second": 214.628, "eval_steps_per_second": 13.414, "step": 3080 }, { "epoch": 3.09, "grad_norm": 2.880063533782959, "learning_rate": 8.822962962962963e-06, "loss": 0.23912813663482665, "step": 3090 }, { "epoch": 3.1, "grad_norm": 7.581027984619141, "learning_rate": 8.815555555555557e-06, "loss": 0.3460343837738037, "step": 3100 }, { "epoch": 3.1, "eval_0_to_0": 9214, "eval_0_to_1": 825, "eval_1_to_0": 530, "eval_1_to_1": 9431, "eval_accuracy": 0.93225, "eval_loss": 0.25733253359794617, "eval_runtime": 97.534, "eval_samples_per_second": 205.057, "eval_steps_per_second": 12.816, "step": 3100 }, { "epoch": 3.11, "grad_norm": 14.343932151794434, "learning_rate": 8.808148148148149e-06, "loss": 0.4191941738128662, "step": 3110 }, { "epoch": 3.12, "grad_norm": 10.111908912658691, "learning_rate": 8.800740740740742e-06, "loss": 0.19216886758804322, "step": 3120 }, { "epoch": 3.12, "eval_0_to_0": 9127, "eval_0_to_1": 912, "eval_1_to_0": 504, "eval_1_to_1": 9457, "eval_accuracy": 0.9292, "eval_loss": 0.27870428562164307, "eval_runtime": 90.8902, "eval_samples_per_second": 220.046, "eval_steps_per_second": 13.753, "step": 3120 }, { "epoch": 3.13, "grad_norm": 11.071399688720703, "learning_rate": 8.793333333333334e-06, "loss": 0.44095516204833984, "step": 3130 }, { "epoch": 3.14, "grad_norm": 15.747858047485352, "learning_rate": 8.785925925925926e-06, "loss": 0.3079092025756836, "step": 3140 }, { "epoch": 3.14, "eval_0_to_0": 9291, "eval_0_to_1": 748, "eval_1_to_0": 588, "eval_1_to_1": 9373, "eval_accuracy": 0.9332, "eval_loss": 0.2541196644306183, "eval_runtime": 93.7585, "eval_samples_per_second": 213.314, "eval_steps_per_second": 13.332, "step": 3140 }, { "epoch": 3.15, "grad_norm": 8.479247093200684, "learning_rate": 8.77851851851852e-06, "loss": 0.56061692237854, "step": 3150 }, { "epoch": 3.16, "grad_norm": 10.540404319763184, "learning_rate": 8.771111111111112e-06, "loss": 0.46531176567077637, "step": 3160 }, { "epoch": 3.16, "eval_0_to_0": 9146, "eval_0_to_1": 893, "eval_1_to_0": 484, "eval_1_to_1": 9477, "eval_accuracy": 0.93115, "eval_loss": 0.22909404337406158, "eval_runtime": 94.4448, "eval_samples_per_second": 211.764, "eval_steps_per_second": 13.235, "step": 3160 }, { "epoch": 3.17, "grad_norm": 12.141901016235352, "learning_rate": 8.763703703703704e-06, "loss": 0.3742190361022949, "step": 3170 }, { "epoch": 3.18, "grad_norm": 2.9644789695739746, "learning_rate": 8.756296296296298e-06, "loss": 0.24968304634094238, "step": 3180 }, { "epoch": 3.18, "eval_0_to_0": 9362, "eval_0_to_1": 677, "eval_1_to_0": 683, "eval_1_to_1": 9278, "eval_accuracy": 0.932, "eval_loss": 0.22446276247501373, "eval_runtime": 92.648, "eval_samples_per_second": 215.871, "eval_steps_per_second": 13.492, "step": 3180 }, { "epoch": 3.19, "grad_norm": 6.26128625869751, "learning_rate": 8.74888888888889e-06, "loss": 0.4048445224761963, "step": 3190 }, { "epoch": 3.2, "grad_norm": 9.942864418029785, "learning_rate": 8.741481481481482e-06, "loss": 0.3552515983581543, "step": 3200 }, { "epoch": 3.2, "eval_0_to_0": 9387, "eval_0_to_1": 652, "eval_1_to_0": 702, "eval_1_to_1": 9259, "eval_accuracy": 0.9323, "eval_loss": 0.23014020919799805, "eval_runtime": 95.1996, "eval_samples_per_second": 210.085, "eval_steps_per_second": 13.13, "step": 3200 }, { "epoch": 3.21, "grad_norm": 9.269095420837402, "learning_rate": 8.734074074074075e-06, "loss": 0.4702507495880127, "step": 3210 }, { "epoch": 3.22, "grad_norm": 1.721657395362854, "learning_rate": 8.726666666666667e-06, "loss": 0.367267107963562, "step": 3220 }, { "epoch": 3.22, "eval_0_to_0": 9331, "eval_0_to_1": 708, "eval_1_to_0": 609, "eval_1_to_1": 9352, "eval_accuracy": 0.93415, "eval_loss": 0.21566137671470642, "eval_runtime": 95.2123, "eval_samples_per_second": 210.057, "eval_steps_per_second": 13.129, "step": 3220 }, { "epoch": 3.23, "grad_norm": 3.62774658203125, "learning_rate": 8.71925925925926e-06, "loss": 0.29600541591644286, "step": 3230 }, { "epoch": 3.24, "grad_norm": 8.93895149230957, "learning_rate": 8.711851851851853e-06, "loss": 0.3149475812911987, "step": 3240 }, { "epoch": 3.24, "eval_0_to_0": 9263, "eval_0_to_1": 776, "eval_1_to_0": 561, "eval_1_to_1": 9400, "eval_accuracy": 0.93315, "eval_loss": 0.22824329137802124, "eval_runtime": 94.7094, "eval_samples_per_second": 211.172, "eval_steps_per_second": 13.198, "step": 3240 }, { "epoch": 3.25, "grad_norm": 16.260944366455078, "learning_rate": 8.704444444444445e-06, "loss": 0.41240220069885253, "step": 3250 }, { "epoch": 3.26, "grad_norm": 2.695100784301758, "learning_rate": 8.697037037037039e-06, "loss": 0.28796098232269285, "step": 3260 }, { "epoch": 3.26, "eval_0_to_0": 9465, "eval_0_to_1": 574, "eval_1_to_0": 767, "eval_1_to_1": 9194, "eval_accuracy": 0.93295, "eval_loss": 0.2394711673259735, "eval_runtime": 94.769, "eval_samples_per_second": 211.039, "eval_steps_per_second": 13.19, "step": 3260 }, { "epoch": 3.27, "grad_norm": 8.332597732543945, "learning_rate": 8.68962962962963e-06, "loss": 0.26467874050140383, "step": 3270 }, { "epoch": 3.2800000000000002, "grad_norm": 6.600466251373291, "learning_rate": 8.682222222222222e-06, "loss": 0.4344740867614746, "step": 3280 }, { "epoch": 3.2800000000000002, "eval_0_to_0": 9087, "eval_0_to_1": 952, "eval_1_to_0": 451, "eval_1_to_1": 9510, "eval_accuracy": 0.92985, "eval_loss": 0.22566372156143188, "eval_runtime": 96.2948, "eval_samples_per_second": 207.695, "eval_steps_per_second": 12.981, "step": 3280 }, { "epoch": 3.29, "grad_norm": 8.708234786987305, "learning_rate": 8.674814814814816e-06, "loss": 0.3726881265640259, "step": 3290 }, { "epoch": 3.3, "grad_norm": 7.681765079498291, "learning_rate": 8.667407407407408e-06, "loss": 0.30925440788269043, "step": 3300 }, { "epoch": 3.3, "eval_0_to_0": 9372, "eval_0_to_1": 667, "eval_1_to_0": 701, "eval_1_to_1": 9260, "eval_accuracy": 0.9316, "eval_loss": 0.23340696096420288, "eval_runtime": 95.3933, "eval_samples_per_second": 209.658, "eval_steps_per_second": 13.104, "step": 3300 }, { "epoch": 3.31, "grad_norm": 12.424239158630371, "learning_rate": 8.66e-06, "loss": 0.2880850791931152, "step": 3310 }, { "epoch": 3.32, "grad_norm": 16.674489974975586, "learning_rate": 8.652592592592594e-06, "loss": 0.6951731681823731, "step": 3320 }, { "epoch": 3.32, "eval_0_to_0": 8980, "eval_0_to_1": 1059, "eval_1_to_0": 442, "eval_1_to_1": 9519, "eval_accuracy": 0.92495, "eval_loss": 0.2722987234592438, "eval_runtime": 95.8789, "eval_samples_per_second": 208.596, "eval_steps_per_second": 13.037, "step": 3320 }, { "epoch": 3.33, "grad_norm": 22.301694869995117, "learning_rate": 8.645185185185186e-06, "loss": 0.4403273582458496, "step": 3330 }, { "epoch": 3.34, "grad_norm": 9.121699333190918, "learning_rate": 8.637777777777778e-06, "loss": 0.41053500175476076, "step": 3340 }, { "epoch": 3.34, "eval_0_to_0": 9328, "eval_0_to_1": 711, "eval_1_to_0": 690, "eval_1_to_1": 9271, "eval_accuracy": 0.92995, "eval_loss": 0.21663135290145874, "eval_runtime": 95.3647, "eval_samples_per_second": 209.721, "eval_steps_per_second": 13.108, "step": 3340 }, { "epoch": 3.35, "grad_norm": 8.064468383789062, "learning_rate": 8.630370370370371e-06, "loss": 0.40297551155090333, "step": 3350 }, { "epoch": 3.36, "grad_norm": 16.2889461517334, "learning_rate": 8.622962962962963e-06, "loss": 0.3376019954681396, "step": 3360 }, { "epoch": 3.36, "eval_0_to_0": 9447, "eval_0_to_1": 592, "eval_1_to_0": 735, "eval_1_to_1": 9226, "eval_accuracy": 0.93365, "eval_loss": 0.22752350568771362, "eval_runtime": 95.6877, "eval_samples_per_second": 209.013, "eval_steps_per_second": 13.063, "step": 3360 }, { "epoch": 3.37, "grad_norm": 15.439523696899414, "learning_rate": 8.615555555555555e-06, "loss": 0.5911276340484619, "step": 3370 }, { "epoch": 3.38, "grad_norm": 5.947486877441406, "learning_rate": 8.608148148148149e-06, "loss": 0.37164490222930907, "step": 3380 }, { "epoch": 3.38, "eval_0_to_0": 9431, "eval_0_to_1": 608, "eval_1_to_0": 706, "eval_1_to_1": 9255, "eval_accuracy": 0.9343, "eval_loss": 0.21352140605449677, "eval_runtime": 95.6361, "eval_samples_per_second": 209.126, "eval_steps_per_second": 13.07, "step": 3380 }, { "epoch": 3.39, "grad_norm": 10.571341514587402, "learning_rate": 8.600740740740741e-06, "loss": 0.31804599761962893, "step": 3390 }, { "epoch": 3.4, "grad_norm": 9.56916332244873, "learning_rate": 8.593333333333333e-06, "loss": 0.386637282371521, "step": 3400 }, { "epoch": 3.4, "eval_0_to_0": 9499, "eval_0_to_1": 540, "eval_1_to_0": 761, "eval_1_to_1": 9200, "eval_accuracy": 0.93495, "eval_loss": 0.22481569647789001, "eval_runtime": 95.7169, "eval_samples_per_second": 208.95, "eval_steps_per_second": 13.059, "step": 3400 }, { "epoch": 3.41, "grad_norm": 10.375005722045898, "learning_rate": 8.585925925925927e-06, "loss": 0.32169673442840574, "step": 3410 }, { "epoch": 3.42, "grad_norm": 4.5204548835754395, "learning_rate": 8.578518518518519e-06, "loss": 0.2830935001373291, "step": 3420 }, { "epoch": 3.42, "eval_0_to_0": 9347, "eval_0_to_1": 692, "eval_1_to_0": 638, "eval_1_to_1": 9323, "eval_accuracy": 0.9335, "eval_loss": 0.23913657665252686, "eval_runtime": 95.3917, "eval_samples_per_second": 209.662, "eval_steps_per_second": 13.104, "step": 3420 }, { "epoch": 3.43, "grad_norm": 13.32667064666748, "learning_rate": 8.571111111111112e-06, "loss": 0.47341022491455076, "step": 3430 }, { "epoch": 3.44, "grad_norm": 11.718513488769531, "learning_rate": 8.563703703703704e-06, "loss": 0.5159108638763428, "step": 3440 }, { "epoch": 3.44, "eval_0_to_0": 9614, "eval_0_to_1": 425, "eval_1_to_0": 960, "eval_1_to_1": 9001, "eval_accuracy": 0.93075, "eval_loss": 0.24343466758728027, "eval_runtime": 95.6586, "eval_samples_per_second": 209.077, "eval_steps_per_second": 13.067, "step": 3440 }, { "epoch": 3.45, "grad_norm": 8.12898063659668, "learning_rate": 8.556296296296296e-06, "loss": 0.4196006774902344, "step": 3450 }, { "epoch": 3.46, "grad_norm": 8.00537109375, "learning_rate": 8.54888888888889e-06, "loss": 0.41099181175231936, "step": 3460 }, { "epoch": 3.46, "eval_0_to_0": 9494, "eval_0_to_1": 545, "eval_1_to_0": 794, "eval_1_to_1": 9167, "eval_accuracy": 0.93305, "eval_loss": 0.2038128525018692, "eval_runtime": 93.3191, "eval_samples_per_second": 214.318, "eval_steps_per_second": 13.395, "step": 3460 }, { "epoch": 3.4699999999999998, "grad_norm": 11.935649871826172, "learning_rate": 8.541481481481482e-06, "loss": 0.31739215850830077, "step": 3470 }, { "epoch": 3.48, "grad_norm": 12.686882019042969, "learning_rate": 8.534074074074074e-06, "loss": 0.34763762950897215, "step": 3480 }, { "epoch": 3.48, "eval_0_to_0": 9524, "eval_0_to_1": 515, "eval_1_to_0": 813, "eval_1_to_1": 9148, "eval_accuracy": 0.9336, "eval_loss": 0.229974165558815, "eval_runtime": 94.5655, "eval_samples_per_second": 211.494, "eval_steps_per_second": 13.218, "step": 3480 }, { "epoch": 3.49, "grad_norm": 11.877165794372559, "learning_rate": 8.526666666666667e-06, "loss": 0.3925299882888794, "step": 3490 }, { "epoch": 3.5, "grad_norm": 17.237449645996094, "learning_rate": 8.519259259259261e-06, "loss": 0.3368776559829712, "step": 3500 }, { "epoch": 3.5, "eval_0_to_0": 9544, "eval_0_to_1": 495, "eval_1_to_0": 818, "eval_1_to_1": 9143, "eval_accuracy": 0.93435, "eval_loss": 0.2333303540945053, "eval_runtime": 94.8975, "eval_samples_per_second": 210.754, "eval_steps_per_second": 13.172, "step": 3500 }, { "epoch": 3.51, "grad_norm": 1.5593194961547852, "learning_rate": 8.511851851851851e-06, "loss": 0.35467674732208254, "step": 3510 }, { "epoch": 3.52, "grad_norm": 6.576176643371582, "learning_rate": 8.504444444444445e-06, "loss": 0.34594120979309084, "step": 3520 }, { "epoch": 3.52, "eval_0_to_0": 9368, "eval_0_to_1": 671, "eval_1_to_0": 656, "eval_1_to_1": 9305, "eval_accuracy": 0.93365, "eval_loss": 0.24526357650756836, "eval_runtime": 95.0584, "eval_samples_per_second": 210.397, "eval_steps_per_second": 13.15, "step": 3520 }, { "epoch": 3.5300000000000002, "grad_norm": 15.661018371582031, "learning_rate": 8.497037037037039e-06, "loss": 0.29284884929656985, "step": 3530 }, { "epoch": 3.54, "grad_norm": 9.46108627319336, "learning_rate": 8.48962962962963e-06, "loss": 0.3449459791183472, "step": 3540 }, { "epoch": 3.54, "eval_0_to_0": 9297, "eval_0_to_1": 742, "eval_1_to_0": 615, "eval_1_to_1": 9346, "eval_accuracy": 0.93215, "eval_loss": 0.24717245995998383, "eval_runtime": 95.6228, "eval_samples_per_second": 209.155, "eval_steps_per_second": 13.072, "step": 3540 }, { "epoch": 3.55, "grad_norm": 9.630675315856934, "learning_rate": 8.482222222222223e-06, "loss": 0.21321096420288085, "step": 3550 }, { "epoch": 3.56, "grad_norm": 10.077099800109863, "learning_rate": 8.474814814814816e-06, "loss": 0.34675381183624265, "step": 3560 }, { "epoch": 3.56, "eval_0_to_0": 9658, "eval_0_to_1": 381, "eval_1_to_0": 1015, "eval_1_to_1": 8946, "eval_accuracy": 0.9302, "eval_loss": 0.2647031247615814, "eval_runtime": 95.8279, "eval_samples_per_second": 208.708, "eval_steps_per_second": 13.044, "step": 3560 }, { "epoch": 3.57, "grad_norm": 17.407424926757812, "learning_rate": 8.467407407407408e-06, "loss": 0.46629724502563474, "step": 3570 }, { "epoch": 3.58, "grad_norm": 6.385161399841309, "learning_rate": 8.46e-06, "loss": 0.31166791915893555, "step": 3580 }, { "epoch": 3.58, "eval_0_to_0": 9496, "eval_0_to_1": 543, "eval_1_to_0": 800, "eval_1_to_1": 9161, "eval_accuracy": 0.93285, "eval_loss": 0.22165176272392273, "eval_runtime": 95.4869, "eval_samples_per_second": 209.453, "eval_steps_per_second": 13.091, "step": 3580 }, { "epoch": 3.59, "grad_norm": 8.26134967803955, "learning_rate": 8.452592592592594e-06, "loss": 0.4734868049621582, "step": 3590 }, { "epoch": 3.6, "grad_norm": 8.509686470031738, "learning_rate": 8.445185185185186e-06, "loss": 0.4011552333831787, "step": 3600 }, { "epoch": 3.6, "eval_0_to_0": 9480, "eval_0_to_1": 559, "eval_1_to_0": 758, "eval_1_to_1": 9203, "eval_accuracy": 0.93415, "eval_loss": 0.20413853228092194, "eval_runtime": 95.4271, "eval_samples_per_second": 209.584, "eval_steps_per_second": 13.099, "step": 3600 }, { "epoch": 3.61, "grad_norm": 4.629177570343018, "learning_rate": 8.437777777777778e-06, "loss": 0.28006811141967775, "step": 3610 }, { "epoch": 3.62, "grad_norm": 6.576757431030273, "learning_rate": 8.430370370370372e-06, "loss": 0.3898457527160645, "step": 3620 }, { "epoch": 3.62, "eval_0_to_0": 9538, "eval_0_to_1": 501, "eval_1_to_0": 826, "eval_1_to_1": 9135, "eval_accuracy": 0.93365, "eval_loss": 0.24736084043979645, "eval_runtime": 95.6588, "eval_samples_per_second": 209.076, "eval_steps_per_second": 13.067, "step": 3620 }, { "epoch": 3.63, "grad_norm": 19.62872886657715, "learning_rate": 8.422962962962964e-06, "loss": 0.39706101417541506, "step": 3630 }, { "epoch": 3.64, "grad_norm": 12.11449146270752, "learning_rate": 8.415555555555556e-06, "loss": 0.3483243942260742, "step": 3640 }, { "epoch": 3.64, "eval_0_to_0": 9611, "eval_0_to_1": 428, "eval_1_to_0": 976, "eval_1_to_1": 8985, "eval_accuracy": 0.9298, "eval_loss": 0.2540542483329773, "eval_runtime": 95.8705, "eval_samples_per_second": 208.615, "eval_steps_per_second": 13.038, "step": 3640 }, { "epoch": 3.65, "grad_norm": 12.201719284057617, "learning_rate": 8.40814814814815e-06, "loss": 0.3881973743438721, "step": 3650 }, { "epoch": 3.66, "grad_norm": 8.491182327270508, "learning_rate": 8.400740740740741e-06, "loss": 0.42789206504821775, "step": 3660 }, { "epoch": 3.66, "eval_0_to_0": 9649, "eval_0_to_1": 390, "eval_1_to_0": 1002, "eval_1_to_1": 8959, "eval_accuracy": 0.9304, "eval_loss": 0.22935712337493896, "eval_runtime": 93.2346, "eval_samples_per_second": 214.513, "eval_steps_per_second": 13.407, "step": 3660 }, { "epoch": 3.67, "grad_norm": 5.534629821777344, "learning_rate": 8.393333333333335e-06, "loss": 0.4097436428070068, "step": 3670 }, { "epoch": 3.68, "grad_norm": 4.64667272567749, "learning_rate": 8.385925925925927e-06, "loss": 0.31755530834198, "step": 3680 }, { "epoch": 3.68, "eval_0_to_0": 9513, "eval_0_to_1": 526, "eval_1_to_0": 886, "eval_1_to_1": 9075, "eval_accuracy": 0.9294, "eval_loss": 0.26477447152137756, "eval_runtime": 95.5353, "eval_samples_per_second": 209.347, "eval_steps_per_second": 13.084, "step": 3680 }, { "epoch": 3.69, "grad_norm": 10.772167205810547, "learning_rate": 8.378518518518519e-06, "loss": 0.4182613372802734, "step": 3690 }, { "epoch": 3.7, "grad_norm": 16.17129135131836, "learning_rate": 8.371111111111112e-06, "loss": 0.48155665397644043, "step": 3700 }, { "epoch": 3.7, "eval_0_to_0": 9626, "eval_0_to_1": 413, "eval_1_to_0": 980, "eval_1_to_1": 8981, "eval_accuracy": 0.93035, "eval_loss": 0.2735936939716339, "eval_runtime": 94.3843, "eval_samples_per_second": 211.9, "eval_steps_per_second": 13.244, "step": 3700 }, { "epoch": 3.71, "grad_norm": 10.586590766906738, "learning_rate": 8.363703703703704e-06, "loss": 0.3573652744293213, "step": 3710 }, { "epoch": 3.7199999999999998, "grad_norm": 0.9299007058143616, "learning_rate": 8.356296296296296e-06, "loss": 0.3696452140808105, "step": 3720 }, { "epoch": 3.7199999999999998, "eval_0_to_0": 9420, "eval_0_to_1": 619, "eval_1_to_0": 699, "eval_1_to_1": 9262, "eval_accuracy": 0.9341, "eval_loss": 0.21588286757469177, "eval_runtime": 95.6609, "eval_samples_per_second": 209.072, "eval_steps_per_second": 13.067, "step": 3720 }, { "epoch": 3.73, "grad_norm": 2.717588424682617, "learning_rate": 8.34888888888889e-06, "loss": 0.3462883472442627, "step": 3730 }, { "epoch": 3.74, "grad_norm": 20.47396469116211, "learning_rate": 8.341481481481482e-06, "loss": 0.31731059551239016, "step": 3740 }, { "epoch": 3.74, "eval_0_to_0": 9266, "eval_0_to_1": 773, "eval_1_to_0": 567, "eval_1_to_1": 9394, "eval_accuracy": 0.933, "eval_loss": 0.23574380576610565, "eval_runtime": 109.121, "eval_samples_per_second": 183.283, "eval_steps_per_second": 11.455, "step": 3740 }, { "epoch": 3.75, "grad_norm": 11.963643074035645, "learning_rate": 8.334074074074074e-06, "loss": 0.31571140289306643, "step": 3750 }, { "epoch": 3.76, "grad_norm": 5.380266189575195, "learning_rate": 8.326666666666668e-06, "loss": 0.3691321849822998, "step": 3760 }, { "epoch": 3.76, "eval_0_to_0": 9371, "eval_0_to_1": 668, "eval_1_to_0": 680, "eval_1_to_1": 9281, "eval_accuracy": 0.9326, "eval_loss": 0.22685083746910095, "eval_runtime": 172.0295, "eval_samples_per_second": 116.259, "eval_steps_per_second": 7.266, "step": 3760 }, { "epoch": 3.77, "grad_norm": 11.508161544799805, "learning_rate": 8.31925925925926e-06, "loss": 0.39347732067108154, "step": 3770 }, { "epoch": 3.7800000000000002, "grad_norm": 11.319441795349121, "learning_rate": 8.311851851851852e-06, "loss": 0.29541356563568116, "step": 3780 }, { "epoch": 3.7800000000000002, "eval_0_to_0": 9413, "eval_0_to_1": 626, "eval_1_to_0": 685, "eval_1_to_1": 9276, "eval_accuracy": 0.93445, "eval_loss": 0.23536992073059082, "eval_runtime": 174.6007, "eval_samples_per_second": 114.547, "eval_steps_per_second": 7.159, "step": 3780 }, { "epoch": 3.79, "grad_norm": 8.432875633239746, "learning_rate": 8.304444444444445e-06, "loss": 0.5744902133941651, "step": 3790 }, { "epoch": 3.8, "grad_norm": 17.310302734375, "learning_rate": 8.297037037037037e-06, "loss": 0.4692892074584961, "step": 3800 }, { "epoch": 3.8, "eval_0_to_0": 9681, "eval_0_to_1": 358, "eval_1_to_0": 1058, "eval_1_to_1": 8903, "eval_accuracy": 0.9292, "eval_loss": 0.24159057438373566, "eval_runtime": 175.4728, "eval_samples_per_second": 113.978, "eval_steps_per_second": 7.124, "step": 3800 }, { "epoch": 3.81, "grad_norm": 8.970247268676758, "learning_rate": 8.289629629629631e-06, "loss": 0.498637056350708, "step": 3810 }, { "epoch": 3.82, "grad_norm": 5.695001125335693, "learning_rate": 8.282222222222223e-06, "loss": 0.38565673828125, "step": 3820 }, { "epoch": 3.82, "eval_0_to_0": 9546, "eval_0_to_1": 493, "eval_1_to_0": 864, "eval_1_to_1": 9097, "eval_accuracy": 0.93215, "eval_loss": 0.22276811301708221, "eval_runtime": 147.83, "eval_samples_per_second": 135.291, "eval_steps_per_second": 8.456, "step": 3820 }, { "epoch": 3.83, "grad_norm": 3.5317540168762207, "learning_rate": 8.274814814814815e-06, "loss": 0.5268195152282715, "step": 3830 }, { "epoch": 3.84, "grad_norm": 6.8774189949035645, "learning_rate": 8.267407407407409e-06, "loss": 0.4420497894287109, "step": 3840 }, { "epoch": 3.84, "eval_0_to_0": 9365, "eval_0_to_1": 674, "eval_1_to_0": 606, "eval_1_to_1": 9355, "eval_accuracy": 0.936, "eval_loss": 0.20346586406230927, "eval_runtime": 157.8839, "eval_samples_per_second": 126.675, "eval_steps_per_second": 7.917, "step": 3840 }, { "epoch": 3.85, "grad_norm": 6.995968341827393, "learning_rate": 8.26e-06, "loss": 0.28583550453186035, "step": 3850 }, { "epoch": 3.86, "grad_norm": 6.424768447875977, "learning_rate": 8.252592592592593e-06, "loss": 0.31606159210205076, "step": 3860 }, { "epoch": 3.86, "eval_0_to_0": 9309, "eval_0_to_1": 730, "eval_1_to_0": 612, "eval_1_to_1": 9349, "eval_accuracy": 0.9329, "eval_loss": 0.21275795996189117, "eval_runtime": 175.4067, "eval_samples_per_second": 114.021, "eval_steps_per_second": 7.126, "step": 3860 }, { "epoch": 3.87, "grad_norm": 12.810035705566406, "learning_rate": 8.245185185185186e-06, "loss": 0.2693817615509033, "step": 3870 }, { "epoch": 3.88, "grad_norm": 6.88468599319458, "learning_rate": 8.237777777777778e-06, "loss": 0.3520361423492432, "step": 3880 }, { "epoch": 3.88, "eval_0_to_0": 9266, "eval_0_to_1": 773, "eval_1_to_0": 589, "eval_1_to_1": 9372, "eval_accuracy": 0.9319, "eval_loss": 0.2324284166097641, "eval_runtime": 174.3016, "eval_samples_per_second": 114.744, "eval_steps_per_second": 7.171, "step": 3880 }, { "epoch": 3.89, "grad_norm": 3.6559414863586426, "learning_rate": 8.23037037037037e-06, "loss": 0.28123862743377687, "step": 3890 }, { "epoch": 3.9, "grad_norm": 11.419905662536621, "learning_rate": 8.222962962962964e-06, "loss": 0.5230641841888428, "step": 3900 }, { "epoch": 3.9, "eval_0_to_0": 9512, "eval_0_to_1": 527, "eval_1_to_0": 791, "eval_1_to_1": 9170, "eval_accuracy": 0.9341, "eval_loss": 0.2166866660118103, "eval_runtime": 179.1537, "eval_samples_per_second": 111.636, "eval_steps_per_second": 6.977, "step": 3900 }, { "epoch": 3.91, "grad_norm": 7.083553314208984, "learning_rate": 8.215555555555557e-06, "loss": 0.474929666519165, "step": 3910 }, { "epoch": 3.92, "grad_norm": 6.755453586578369, "learning_rate": 8.208148148148148e-06, "loss": 0.43173832893371583, "step": 3920 }, { "epoch": 3.92, "eval_0_to_0": 9602, "eval_0_to_1": 437, "eval_1_to_0": 894, "eval_1_to_1": 9067, "eval_accuracy": 0.93345, "eval_loss": 0.20770180225372314, "eval_runtime": 139.405, "eval_samples_per_second": 143.467, "eval_steps_per_second": 8.967, "step": 3920 }, { "epoch": 3.93, "grad_norm": 7.519883632659912, "learning_rate": 8.200740740740741e-06, "loss": 0.3350250005722046, "step": 3930 }, { "epoch": 3.94, "grad_norm": 11.25727653503418, "learning_rate": 8.193333333333335e-06, "loss": 0.3870545864105225, "step": 3940 }, { "epoch": 3.94, "eval_0_to_0": 9276, "eval_0_to_1": 763, "eval_1_to_0": 574, "eval_1_to_1": 9387, "eval_accuracy": 0.93315, "eval_loss": 0.22362211346626282, "eval_runtime": 162.0498, "eval_samples_per_second": 123.419, "eval_steps_per_second": 7.714, "step": 3940 }, { "epoch": 3.95, "grad_norm": 7.848867893218994, "learning_rate": 8.185925925925925e-06, "loss": 0.29991512298583983, "step": 3950 }, { "epoch": 3.96, "grad_norm": 12.686187744140625, "learning_rate": 8.178518518518519e-06, "loss": 0.43624053001403806, "step": 3960 }, { "epoch": 3.96, "eval_0_to_0": 9386, "eval_0_to_1": 653, "eval_1_to_0": 637, "eval_1_to_1": 9324, "eval_accuracy": 0.9355, "eval_loss": 0.2210005670785904, "eval_runtime": 167.7134, "eval_samples_per_second": 119.251, "eval_steps_per_second": 7.453, "step": 3960 }, { "epoch": 3.9699999999999998, "grad_norm": 4.606715202331543, "learning_rate": 8.171111111111113e-06, "loss": 0.3633121967315674, "step": 3970 }, { "epoch": 3.98, "grad_norm": 13.287696838378906, "learning_rate": 8.163703703703705e-06, "loss": 0.3484961748123169, "step": 3980 }, { "epoch": 3.98, "eval_0_to_0": 9181, "eval_0_to_1": 858, "eval_1_to_0": 504, "eval_1_to_1": 9457, "eval_accuracy": 0.9319, "eval_loss": 0.2346847951412201, "eval_runtime": 164.3115, "eval_samples_per_second": 121.72, "eval_steps_per_second": 7.608, "step": 3980 }, { "epoch": 3.99, "grad_norm": 12.288594245910645, "learning_rate": 8.156296296296297e-06, "loss": 0.27303712368011473, "step": 3990 }, { "epoch": 4.0, "grad_norm": 7.321376800537109, "learning_rate": 8.14888888888889e-06, "loss": 0.35471091270446775, "step": 4000 }, { "epoch": 4.0, "eval_0_to_0": 9374, "eval_0_to_1": 665, "eval_1_to_0": 641, "eval_1_to_1": 9320, "eval_accuracy": 0.9347, "eval_loss": 0.22787973284721375, "eval_runtime": 123.9082, "eval_samples_per_second": 161.41, "eval_steps_per_second": 10.088, "step": 4000 }, { "epoch": 4.01, "grad_norm": 8.083176612854004, "learning_rate": 8.141481481481482e-06, "loss": 0.22534315586090087, "step": 4010 }, { "epoch": 4.02, "grad_norm": 6.0160369873046875, "learning_rate": 8.134074074074074e-06, "loss": 0.283454442024231, "step": 4020 }, { "epoch": 4.02, "eval_0_to_0": 9363, "eval_0_to_1": 676, "eval_1_to_0": 657, "eval_1_to_1": 9304, "eval_accuracy": 0.93335, "eval_loss": 0.2781471312046051, "eval_runtime": 116.0586, "eval_samples_per_second": 172.327, "eval_steps_per_second": 10.77, "step": 4020 }, { "epoch": 4.03, "grad_norm": 13.445456504821777, "learning_rate": 8.126666666666668e-06, "loss": 0.2631768465042114, "step": 4030 }, { "epoch": 4.04, "grad_norm": 18.717195510864258, "learning_rate": 8.11925925925926e-06, "loss": 0.36792855262756347, "step": 4040 }, { "epoch": 4.04, "eval_0_to_0": 9323, "eval_0_to_1": 716, "eval_1_to_0": 617, "eval_1_to_1": 9344, "eval_accuracy": 0.93335, "eval_loss": 0.26855459809303284, "eval_runtime": 153.304, "eval_samples_per_second": 130.46, "eval_steps_per_second": 8.154, "step": 4040 }, { "epoch": 4.05, "grad_norm": 9.14444351196289, "learning_rate": 8.111851851851854e-06, "loss": 0.1590546488761902, "step": 4050 }, { "epoch": 4.06, "grad_norm": 0.7126569747924805, "learning_rate": 8.104444444444446e-06, "loss": 0.18997623920440673, "step": 4060 }, { "epoch": 4.06, "eval_0_to_0": 9299, "eval_0_to_1": 740, "eval_1_to_0": 617, "eval_1_to_1": 9344, "eval_accuracy": 0.93215, "eval_loss": 0.28245800733566284, "eval_runtime": 150.944, "eval_samples_per_second": 132.499, "eval_steps_per_second": 8.281, "step": 4060 }, { "epoch": 4.07, "grad_norm": 18.668649673461914, "learning_rate": 8.097037037037038e-06, "loss": 0.2097066879272461, "step": 4070 }, { "epoch": 4.08, "grad_norm": 21.56473731994629, "learning_rate": 8.089629629629631e-06, "loss": 0.3546102523803711, "step": 4080 }, { "epoch": 4.08, "eval_0_to_0": 9514, "eval_0_to_1": 525, "eval_1_to_0": 802, "eval_1_to_1": 9159, "eval_accuracy": 0.93365, "eval_loss": 0.3031712472438812, "eval_runtime": 155.53, "eval_samples_per_second": 128.593, "eval_steps_per_second": 8.037, "step": 4080 }, { "epoch": 4.09, "grad_norm": 13.883224487304688, "learning_rate": 8.082222222222223e-06, "loss": 0.4333822250366211, "step": 4090 }, { "epoch": 4.1, "grad_norm": 6.652897834777832, "learning_rate": 8.074814814814815e-06, "loss": 0.2717947006225586, "step": 4100 }, { "epoch": 4.1, "eval_0_to_0": 9485, "eval_0_to_1": 554, "eval_1_to_0": 770, "eval_1_to_1": 9191, "eval_accuracy": 0.9338, "eval_loss": 0.2656031847000122, "eval_runtime": 150.9372, "eval_samples_per_second": 132.505, "eval_steps_per_second": 8.282, "step": 4100 }, { "epoch": 4.11, "grad_norm": 11.011683464050293, "learning_rate": 8.067407407407409e-06, "loss": 0.22114572525024415, "step": 4110 }, { "epoch": 4.12, "grad_norm": 13.98350715637207, "learning_rate": 8.06e-06, "loss": 0.24022626876831055, "step": 4120 }, { "epoch": 4.12, "eval_0_to_0": 9396, "eval_0_to_1": 643, "eval_1_to_0": 691, "eval_1_to_1": 9270, "eval_accuracy": 0.9333, "eval_loss": 0.2663116455078125, "eval_runtime": 147.8166, "eval_samples_per_second": 135.303, "eval_steps_per_second": 8.456, "step": 4120 }, { "epoch": 4.13, "grad_norm": 4.409120559692383, "learning_rate": 8.052592592592593e-06, "loss": 0.24989054203033448, "step": 4130 }, { "epoch": 4.14, "grad_norm": 11.276653289794922, "learning_rate": 8.045185185185186e-06, "loss": 0.22602975368499756, "step": 4140 }, { "epoch": 4.14, "eval_0_to_0": 9581, "eval_0_to_1": 458, "eval_1_to_0": 910, "eval_1_to_1": 9051, "eval_accuracy": 0.9316, "eval_loss": 0.2728051245212555, "eval_runtime": 155.4373, "eval_samples_per_second": 128.669, "eval_steps_per_second": 8.042, "step": 4140 }, { "epoch": 4.15, "grad_norm": 9.991480827331543, "learning_rate": 8.037777777777778e-06, "loss": 0.2595658302307129, "step": 4150 }, { "epoch": 4.16, "grad_norm": 0.7406190037727356, "learning_rate": 8.03037037037037e-06, "loss": 0.14956446886062622, "step": 4160 }, { "epoch": 4.16, "eval_0_to_0": 9308, "eval_0_to_1": 731, "eval_1_to_0": 595, "eval_1_to_1": 9366, "eval_accuracy": 0.9337, "eval_loss": 0.2753278911113739, "eval_runtime": 150.6025, "eval_samples_per_second": 132.8, "eval_steps_per_second": 8.3, "step": 4160 }, { "epoch": 4.17, "grad_norm": 10.1621675491333, "learning_rate": 8.022962962962964e-06, "loss": 0.09138429164886475, "step": 4170 }, { "epoch": 4.18, "grad_norm": 6.536482334136963, "learning_rate": 8.015555555555556e-06, "loss": 0.28918535709381105, "step": 4180 }, { "epoch": 4.18, "eval_0_to_0": 9422, "eval_0_to_1": 617, "eval_1_to_0": 681, "eval_1_to_1": 9280, "eval_accuracy": 0.9351, "eval_loss": 0.33193692564964294, "eval_runtime": 130.6886, "eval_samples_per_second": 153.036, "eval_steps_per_second": 9.565, "step": 4180 }, { "epoch": 4.19, "grad_norm": 19.562841415405273, "learning_rate": 8.00814814814815e-06, "loss": 0.3873646974563599, "step": 4190 }, { "epoch": 4.2, "grad_norm": 18.964622497558594, "learning_rate": 8.000740740740742e-06, "loss": 0.2343676805496216, "step": 4200 }, { "epoch": 4.2, "eval_0_to_0": 9581, "eval_0_to_1": 458, "eval_1_to_0": 851, "eval_1_to_1": 9110, "eval_accuracy": 0.93455, "eval_loss": 0.2743990123271942, "eval_runtime": 120.4077, "eval_samples_per_second": 166.102, "eval_steps_per_second": 10.381, "step": 4200 }, { "epoch": 4.21, "grad_norm": 2.42193603515625, "learning_rate": 7.993333333333334e-06, "loss": 0.21606011390686036, "step": 4210 }, { "epoch": 4.22, "grad_norm": 16.596616744995117, "learning_rate": 7.985925925925927e-06, "loss": 0.30704317092895506, "step": 4220 }, { "epoch": 4.22, "eval_0_to_0": 9470, "eval_0_to_1": 569, "eval_1_to_0": 773, "eval_1_to_1": 9188, "eval_accuracy": 0.9329, "eval_loss": 0.26310041546821594, "eval_runtime": 87.0762, "eval_samples_per_second": 229.684, "eval_steps_per_second": 14.355, "step": 4220 }, { "epoch": 4.23, "grad_norm": 0.19053027033805847, "learning_rate": 7.97851851851852e-06, "loss": 0.1704532265663147, "step": 4230 }, { "epoch": 4.24, "grad_norm": 10.050971031188965, "learning_rate": 7.971111111111111e-06, "loss": 0.19479057788848878, "step": 4240 }, { "epoch": 4.24, "eval_0_to_0": 9415, "eval_0_to_1": 624, "eval_1_to_0": 681, "eval_1_to_1": 9280, "eval_accuracy": 0.93475, "eval_loss": 0.2754285931587219, "eval_runtime": 85.7998, "eval_samples_per_second": 233.101, "eval_steps_per_second": 14.569, "step": 4240 }, { "epoch": 4.25, "grad_norm": 6.512021064758301, "learning_rate": 7.963703703703705e-06, "loss": 0.14376248121261598, "step": 4250 }, { "epoch": 4.26, "grad_norm": 5.780026912689209, "learning_rate": 7.956296296296297e-06, "loss": 0.20256924629211426, "step": 4260 }, { "epoch": 4.26, "eval_0_to_0": 9505, "eval_0_to_1": 534, "eval_1_to_0": 818, "eval_1_to_1": 9143, "eval_accuracy": 0.9324, "eval_loss": 0.30414247512817383, "eval_runtime": 93.793, "eval_samples_per_second": 213.235, "eval_steps_per_second": 13.327, "step": 4260 }, { "epoch": 4.27, "grad_norm": 13.401482582092285, "learning_rate": 7.948888888888889e-06, "loss": 0.21926684379577638, "step": 4270 }, { "epoch": 4.28, "grad_norm": 8.165571212768555, "learning_rate": 7.941481481481482e-06, "loss": 0.19445226192474366, "step": 4280 }, { "epoch": 4.28, "eval_0_to_0": 9412, "eval_0_to_1": 627, "eval_1_to_0": 718, "eval_1_to_1": 9243, "eval_accuracy": 0.93275, "eval_loss": 0.3006284534931183, "eval_runtime": 139.4807, "eval_samples_per_second": 143.389, "eval_steps_per_second": 8.962, "step": 4280 }, { "epoch": 4.29, "grad_norm": 17.07703971862793, "learning_rate": 7.934074074074074e-06, "loss": 0.4403989315032959, "step": 4290 }, { "epoch": 4.3, "grad_norm": 10.254364013671875, "learning_rate": 7.926666666666666e-06, "loss": 0.2627612352371216, "step": 4300 }, { "epoch": 4.3, "eval_0_to_0": 9362, "eval_0_to_1": 677, "eval_1_to_0": 679, "eval_1_to_1": 9282, "eval_accuracy": 0.9322, "eval_loss": 0.2787367105484009, "eval_runtime": 84.4444, "eval_samples_per_second": 236.842, "eval_steps_per_second": 14.803, "step": 4300 }, { "epoch": 4.31, "grad_norm": 3.7736077308654785, "learning_rate": 7.91925925925926e-06, "loss": 0.1825045108795166, "step": 4310 }, { "epoch": 4.32, "grad_norm": 15.642234802246094, "learning_rate": 7.911851851851852e-06, "loss": 0.1853209614753723, "step": 4320 }, { "epoch": 4.32, "eval_0_to_0": 9441, "eval_0_to_1": 598, "eval_1_to_0": 707, "eval_1_to_1": 9254, "eval_accuracy": 0.93475, "eval_loss": 0.2776266038417816, "eval_runtime": 101.2962, "eval_samples_per_second": 197.441, "eval_steps_per_second": 12.34, "step": 4320 }, { "epoch": 4.33, "grad_norm": 11.729385375976562, "learning_rate": 7.904444444444444e-06, "loss": 0.3093045949935913, "step": 4330 }, { "epoch": 4.34, "grad_norm": 14.605279922485352, "learning_rate": 7.897037037037038e-06, "loss": 0.2776920318603516, "step": 4340 }, { "epoch": 4.34, "eval_0_to_0": 9402, "eval_0_to_1": 637, "eval_1_to_0": 684, "eval_1_to_1": 9277, "eval_accuracy": 0.93395, "eval_loss": 0.2675863206386566, "eval_runtime": 114.7991, "eval_samples_per_second": 174.217, "eval_steps_per_second": 10.889, "step": 4340 }, { "epoch": 4.35, "grad_norm": 11.747673988342285, "learning_rate": 7.88962962962963e-06, "loss": 0.25316896438598635, "step": 4350 }, { "epoch": 4.36, "grad_norm": 6.686873912811279, "learning_rate": 7.882222222222223e-06, "loss": 0.18142480850219728, "step": 4360 }, { "epoch": 4.36, "eval_0_to_0": 9395, "eval_0_to_1": 644, "eval_1_to_0": 670, "eval_1_to_1": 9291, "eval_accuracy": 0.9343, "eval_loss": 0.26197779178619385, "eval_runtime": 121.5971, "eval_samples_per_second": 164.478, "eval_steps_per_second": 10.28, "step": 4360 }, { "epoch": 4.37, "grad_norm": 19.199417114257812, "learning_rate": 7.874814814814815e-06, "loss": 0.2675651788711548, "step": 4370 }, { "epoch": 4.38, "grad_norm": 12.163260459899902, "learning_rate": 7.867407407407407e-06, "loss": 0.14583239555358887, "step": 4380 }, { "epoch": 4.38, "eval_0_to_0": 9383, "eval_0_to_1": 656, "eval_1_to_0": 641, "eval_1_to_1": 9320, "eval_accuracy": 0.93515, "eval_loss": 0.28493958711624146, "eval_runtime": 126.0739, "eval_samples_per_second": 158.637, "eval_steps_per_second": 9.915, "step": 4380 }, { "epoch": 4.39, "grad_norm": 0.2625693082809448, "learning_rate": 7.860000000000001e-06, "loss": 0.16978055238723755, "step": 4390 }, { "epoch": 4.4, "grad_norm": 11.702610969543457, "learning_rate": 7.852592592592593e-06, "loss": 0.26253519058227537, "step": 4400 }, { "epoch": 4.4, "eval_0_to_0": 9312, "eval_0_to_1": 727, "eval_1_to_0": 615, "eval_1_to_1": 9346, "eval_accuracy": 0.9329, "eval_loss": 0.3013799488544464, "eval_runtime": 150.1359, "eval_samples_per_second": 133.213, "eval_steps_per_second": 8.326, "step": 4400 }, { "epoch": 4.41, "grad_norm": 10.898186683654785, "learning_rate": 7.845185185185185e-06, "loss": 0.32822964191436765, "step": 4410 }, { "epoch": 4.42, "grad_norm": 17.051128387451172, "learning_rate": 7.837777777777779e-06, "loss": 0.31463119983673093, "step": 4420 }, { "epoch": 4.42, "eval_0_to_0": 9511, "eval_0_to_1": 528, "eval_1_to_0": 803, "eval_1_to_1": 9158, "eval_accuracy": 0.93345, "eval_loss": 0.27672654390335083, "eval_runtime": 143.1445, "eval_samples_per_second": 139.719, "eval_steps_per_second": 8.732, "step": 4420 }, { "epoch": 4.43, "grad_norm": 8.178820610046387, "learning_rate": 7.830370370370372e-06, "loss": 0.22880220413208008, "step": 4430 }, { "epoch": 4.44, "grad_norm": 8.9729585647583, "learning_rate": 7.822962962962963e-06, "loss": 0.34703056812286376, "step": 4440 }, { "epoch": 4.44, "eval_0_to_0": 9368, "eval_0_to_1": 671, "eval_1_to_0": 740, "eval_1_to_1": 9221, "eval_accuracy": 0.92945, "eval_loss": 0.274247407913208, "eval_runtime": 138.8155, "eval_samples_per_second": 144.076, "eval_steps_per_second": 9.005, "step": 4440 }, { "epoch": 4.45, "grad_norm": 5.311227798461914, "learning_rate": 7.815555555555556e-06, "loss": 0.22525451183319092, "step": 4450 }, { "epoch": 4.46, "grad_norm": 6.258935451507568, "learning_rate": 7.80814814814815e-06, "loss": 0.2935174942016602, "step": 4460 }, { "epoch": 4.46, "eval_0_to_0": 9370, "eval_0_to_1": 669, "eval_1_to_0": 691, "eval_1_to_1": 9270, "eval_accuracy": 0.932, "eval_loss": 0.2575429081916809, "eval_runtime": 127.702, "eval_samples_per_second": 156.615, "eval_steps_per_second": 9.788, "step": 4460 }, { "epoch": 4.47, "grad_norm": 8.215232849121094, "learning_rate": 7.80074074074074e-06, "loss": 0.14526911973953247, "step": 4470 }, { "epoch": 4.48, "grad_norm": 23.41021156311035, "learning_rate": 7.793333333333334e-06, "loss": 0.1941887617111206, "step": 4480 }, { "epoch": 4.48, "eval_0_to_0": 9529, "eval_0_to_1": 510, "eval_1_to_0": 861, "eval_1_to_1": 9100, "eval_accuracy": 0.93145, "eval_loss": 0.2817891240119934, "eval_runtime": 123.4665, "eval_samples_per_second": 161.987, "eval_steps_per_second": 10.124, "step": 4480 }, { "epoch": 4.49, "grad_norm": 12.664379119873047, "learning_rate": 7.785925925925927e-06, "loss": 0.15171632766723633, "step": 4490 }, { "epoch": 4.5, "grad_norm": 15.81264591217041, "learning_rate": 7.77851851851852e-06, "loss": 0.23894271850585938, "step": 4500 }, { "epoch": 4.5, "eval_0_to_0": 9463, "eval_0_to_1": 576, "eval_1_to_0": 764, "eval_1_to_1": 9197, "eval_accuracy": 0.933, "eval_loss": 0.301587849855423, "eval_runtime": 127.2092, "eval_samples_per_second": 157.221, "eval_steps_per_second": 9.826, "step": 4500 }, { "epoch": 4.51, "grad_norm": 4.270336627960205, "learning_rate": 7.771111111111111e-06, "loss": 0.20344703197479247, "step": 4510 }, { "epoch": 4.52, "grad_norm": 24.433561325073242, "learning_rate": 7.763703703703705e-06, "loss": 0.26279637813568113, "step": 4520 }, { "epoch": 4.52, "eval_0_to_0": 9355, "eval_0_to_1": 684, "eval_1_to_0": 646, "eval_1_to_1": 9315, "eval_accuracy": 0.9335, "eval_loss": 0.29526644945144653, "eval_runtime": 123.9564, "eval_samples_per_second": 161.347, "eval_steps_per_second": 10.084, "step": 4520 }, { "epoch": 4.53, "grad_norm": 12.37267017364502, "learning_rate": 7.756296296296297e-06, "loss": 0.17675257921218873, "step": 4530 }, { "epoch": 4.54, "grad_norm": 3.7725830078125, "learning_rate": 7.748888888888889e-06, "loss": 0.13918373584747315, "step": 4540 }, { "epoch": 4.54, "eval_0_to_0": 9280, "eval_0_to_1": 759, "eval_1_to_0": 573, "eval_1_to_1": 9388, "eval_accuracy": 0.9334, "eval_loss": 0.299266517162323, "eval_runtime": 129.4776, "eval_samples_per_second": 154.467, "eval_steps_per_second": 9.654, "step": 4540 }, { "epoch": 4.55, "grad_norm": 2.0648293495178223, "learning_rate": 7.741481481481483e-06, "loss": 0.2559913396835327, "step": 4550 }, { "epoch": 4.5600000000000005, "grad_norm": 1.002275824546814, "learning_rate": 7.734074074074075e-06, "loss": 0.1377122163772583, "step": 4560 }, { "epoch": 4.5600000000000005, "eval_0_to_0": 9374, "eval_0_to_1": 665, "eval_1_to_0": 671, "eval_1_to_1": 9290, "eval_accuracy": 0.9332, "eval_loss": 0.30457139015197754, "eval_runtime": 118.9758, "eval_samples_per_second": 168.101, "eval_steps_per_second": 10.506, "step": 4560 }, { "epoch": 4.57, "grad_norm": 11.332201957702637, "learning_rate": 7.726666666666667e-06, "loss": 0.24633734226226806, "step": 4570 }, { "epoch": 4.58, "grad_norm": 4.57489538192749, "learning_rate": 7.71925925925926e-06, "loss": 0.24808793067932128, "step": 4580 }, { "epoch": 4.58, "eval_0_to_0": 9409, "eval_0_to_1": 630, "eval_1_to_0": 693, "eval_1_to_1": 9268, "eval_accuracy": 0.93385, "eval_loss": 0.31001126766204834, "eval_runtime": 120.1443, "eval_samples_per_second": 166.467, "eval_steps_per_second": 10.404, "step": 4580 }, { "epoch": 4.59, "grad_norm": 2.3998522758483887, "learning_rate": 7.711851851851852e-06, "loss": 0.20940787792205812, "step": 4590 }, { "epoch": 4.6, "grad_norm": 10.142114639282227, "learning_rate": 7.704444444444446e-06, "loss": 0.24253246784210206, "step": 4600 }, { "epoch": 4.6, "eval_0_to_0": 9540, "eval_0_to_1": 499, "eval_1_to_0": 847, "eval_1_to_1": 9114, "eval_accuracy": 0.9327, "eval_loss": 0.3316441476345062, "eval_runtime": 120.0248, "eval_samples_per_second": 166.632, "eval_steps_per_second": 10.415, "step": 4600 }, { "epoch": 4.61, "grad_norm": 14.259239196777344, "learning_rate": 7.697037037037038e-06, "loss": 0.30009775161743163, "step": 4610 }, { "epoch": 4.62, "grad_norm": 6.704137802124023, "learning_rate": 7.68962962962963e-06, "loss": 0.18444652557373048, "step": 4620 }, { "epoch": 4.62, "eval_0_to_0": 9286, "eval_0_to_1": 753, "eval_1_to_0": 597, "eval_1_to_1": 9364, "eval_accuracy": 0.9325, "eval_loss": 0.30197861790657043, "eval_runtime": 119.377, "eval_samples_per_second": 167.536, "eval_steps_per_second": 10.471, "step": 4620 }, { "epoch": 4.63, "grad_norm": 14.263866424560547, "learning_rate": 7.682222222222224e-06, "loss": 0.20122020244598388, "step": 4630 }, { "epoch": 4.64, "grad_norm": 2.605531692504883, "learning_rate": 7.674814814814816e-06, "loss": 0.2912621974945068, "step": 4640 }, { "epoch": 4.64, "eval_0_to_0": 9324, "eval_0_to_1": 715, "eval_1_to_0": 620, "eval_1_to_1": 9341, "eval_accuracy": 0.93325, "eval_loss": 0.298778235912323, "eval_runtime": 118.7791, "eval_samples_per_second": 168.38, "eval_steps_per_second": 10.524, "step": 4640 }, { "epoch": 4.65, "grad_norm": 3.7884469032287598, "learning_rate": 7.667407407407408e-06, "loss": 0.36045081615448, "step": 4650 }, { "epoch": 4.66, "grad_norm": 10.437675476074219, "learning_rate": 7.660000000000001e-06, "loss": 0.17059998512268065, "step": 4660 }, { "epoch": 4.66, "eval_0_to_0": 9471, "eval_0_to_1": 568, "eval_1_to_0": 762, "eval_1_to_1": 9199, "eval_accuracy": 0.9335, "eval_loss": 0.27499037981033325, "eval_runtime": 144.3773, "eval_samples_per_second": 138.526, "eval_steps_per_second": 8.658, "step": 4660 }, { "epoch": 4.67, "grad_norm": 7.773613452911377, "learning_rate": 7.652592592592593e-06, "loss": 0.21010470390319824, "step": 4670 }, { "epoch": 4.68, "grad_norm": 6.801275730133057, "learning_rate": 7.645185185185185e-06, "loss": 0.35298035144805906, "step": 4680 }, { "epoch": 4.68, "eval_0_to_0": 9608, "eval_0_to_1": 431, "eval_1_to_0": 956, "eval_1_to_1": 9005, "eval_accuracy": 0.93065, "eval_loss": 0.28206881880760193, "eval_runtime": 148.3358, "eval_samples_per_second": 134.829, "eval_steps_per_second": 8.427, "step": 4680 }, { "epoch": 4.6899999999999995, "grad_norm": 2.6242423057556152, "learning_rate": 7.637777777777779e-06, "loss": 0.1695307970046997, "step": 4690 }, { "epoch": 4.7, "grad_norm": 1.9372498989105225, "learning_rate": 7.63037037037037e-06, "loss": 0.17095630168914794, "step": 4700 }, { "epoch": 4.7, "eval_0_to_0": 9521, "eval_0_to_1": 518, "eval_1_to_0": 851, "eval_1_to_1": 9110, "eval_accuracy": 0.93155, "eval_loss": 0.29320406913757324, "eval_runtime": 146.8455, "eval_samples_per_second": 136.198, "eval_steps_per_second": 8.512, "step": 4700 }, { "epoch": 4.71, "grad_norm": 11.201943397521973, "learning_rate": 7.622962962962963e-06, "loss": 0.12580031156539917, "step": 4710 }, { "epoch": 4.72, "grad_norm": 11.86982250213623, "learning_rate": 7.6155555555555564e-06, "loss": 0.15369014739990233, "step": 4720 }, { "epoch": 4.72, "eval_0_to_0": 9546, "eval_0_to_1": 493, "eval_1_to_0": 856, "eval_1_to_1": 9105, "eval_accuracy": 0.93255, "eval_loss": 0.33680444955825806, "eval_runtime": 151.5721, "eval_samples_per_second": 131.95, "eval_steps_per_second": 8.247, "step": 4720 }, { "epoch": 4.73, "grad_norm": 10.401944160461426, "learning_rate": 7.608148148148149e-06, "loss": 0.2332449197769165, "step": 4730 }, { "epoch": 4.74, "grad_norm": 11.749406814575195, "learning_rate": 7.600740740740742e-06, "loss": 0.36640379428863523, "step": 4740 }, { "epoch": 4.74, "eval_0_to_0": 9089, "eval_0_to_1": 950, "eval_1_to_0": 471, "eval_1_to_1": 9490, "eval_accuracy": 0.92895, "eval_loss": 0.30841025710105896, "eval_runtime": 147.3048, "eval_samples_per_second": 135.773, "eval_steps_per_second": 8.486, "step": 4740 }, { "epoch": 4.75, "grad_norm": 4.069319725036621, "learning_rate": 7.593333333333334e-06, "loss": 0.18251899480819703, "step": 4750 }, { "epoch": 4.76, "grad_norm": 6.180703639984131, "learning_rate": 7.585925925925927e-06, "loss": 0.2209322452545166, "step": 4760 }, { "epoch": 4.76, "eval_0_to_0": 9293, "eval_0_to_1": 746, "eval_1_to_0": 587, "eval_1_to_1": 9374, "eval_accuracy": 0.93335, "eval_loss": 0.2799868881702423, "eval_runtime": 133.5829, "eval_samples_per_second": 149.72, "eval_steps_per_second": 9.357, "step": 4760 }, { "epoch": 4.77, "grad_norm": 16.63945960998535, "learning_rate": 7.57851851851852e-06, "loss": 0.19504289627075194, "step": 4770 }, { "epoch": 4.78, "grad_norm": 2.895456314086914, "learning_rate": 7.571111111111112e-06, "loss": 0.21956722736358641, "step": 4780 }, { "epoch": 4.78, "eval_0_to_0": 9489, "eval_0_to_1": 550, "eval_1_to_0": 810, "eval_1_to_1": 9151, "eval_accuracy": 0.932, "eval_loss": 0.29770705103874207, "eval_runtime": 119.8635, "eval_samples_per_second": 166.856, "eval_steps_per_second": 10.429, "step": 4780 }, { "epoch": 4.79, "grad_norm": 14.759697914123535, "learning_rate": 7.5637037037037045e-06, "loss": 0.38081324100494385, "step": 4790 }, { "epoch": 4.8, "grad_norm": 13.803539276123047, "learning_rate": 7.556296296296297e-06, "loss": 0.24246525764465332, "step": 4800 }, { "epoch": 4.8, "eval_0_to_0": 9501, "eval_0_to_1": 538, "eval_1_to_0": 758, "eval_1_to_1": 9203, "eval_accuracy": 0.9352, "eval_loss": 0.26859524846076965, "eval_runtime": 127.2184, "eval_samples_per_second": 157.21, "eval_steps_per_second": 9.826, "step": 4800 }, { "epoch": 4.8100000000000005, "grad_norm": 7.187395095825195, "learning_rate": 7.54888888888889e-06, "loss": 0.20165598392486572, "step": 4810 }, { "epoch": 4.82, "grad_norm": 15.874652862548828, "learning_rate": 7.541481481481482e-06, "loss": 0.21950602531433105, "step": 4820 }, { "epoch": 4.82, "eval_0_to_0": 9398, "eval_0_to_1": 641, "eval_1_to_0": 682, "eval_1_to_1": 9279, "eval_accuracy": 0.93385, "eval_loss": 0.2815108001232147, "eval_runtime": 125.599, "eval_samples_per_second": 159.237, "eval_steps_per_second": 9.952, "step": 4820 }, { "epoch": 4.83, "grad_norm": 0.31682199239730835, "learning_rate": 7.534074074074075e-06, "loss": 0.3495494365692139, "step": 4830 }, { "epoch": 4.84, "grad_norm": 8.7249755859375, "learning_rate": 7.526666666666668e-06, "loss": 0.2997498273849487, "step": 4840 }, { "epoch": 4.84, "eval_0_to_0": 9403, "eval_0_to_1": 636, "eval_1_to_0": 664, "eval_1_to_1": 9297, "eval_accuracy": 0.935, "eval_loss": 0.2592184841632843, "eval_runtime": 126.8596, "eval_samples_per_second": 157.655, "eval_steps_per_second": 9.853, "step": 4840 }, { "epoch": 4.85, "grad_norm": 18.05508804321289, "learning_rate": 7.51925925925926e-06, "loss": 0.2915520668029785, "step": 4850 }, { "epoch": 4.86, "grad_norm": 7.2655229568481445, "learning_rate": 7.5118518518518525e-06, "loss": 0.2051389694213867, "step": 4860 }, { "epoch": 4.86, "eval_0_to_0": 9513, "eval_0_to_1": 526, "eval_1_to_0": 786, "eval_1_to_1": 9175, "eval_accuracy": 0.9344, "eval_loss": 0.25622767210006714, "eval_runtime": 123.6848, "eval_samples_per_second": 161.701, "eval_steps_per_second": 10.106, "step": 4860 }, { "epoch": 4.87, "grad_norm": 13.89260196685791, "learning_rate": 7.504444444444445e-06, "loss": 0.17880960702896118, "step": 4870 }, { "epoch": 4.88, "grad_norm": 4.398935794830322, "learning_rate": 7.497037037037037e-06, "loss": 0.18199297189712524, "step": 4880 }, { "epoch": 4.88, "eval_0_to_0": 9391, "eval_0_to_1": 648, "eval_1_to_0": 703, "eval_1_to_1": 9258, "eval_accuracy": 0.93245, "eval_loss": 0.2768850326538086, "eval_runtime": 125.8564, "eval_samples_per_second": 158.911, "eval_steps_per_second": 9.932, "step": 4880 }, { "epoch": 4.89, "grad_norm": 11.616331100463867, "learning_rate": 7.48962962962963e-06, "loss": 0.26293656826019285, "step": 4890 }, { "epoch": 4.9, "grad_norm": 2.80887770652771, "learning_rate": 7.482222222222223e-06, "loss": 0.13500174283981323, "step": 4900 }, { "epoch": 4.9, "eval_0_to_0": 9520, "eval_0_to_1": 519, "eval_1_to_0": 819, "eval_1_to_1": 9142, "eval_accuracy": 0.9331, "eval_loss": 0.29235562682151794, "eval_runtime": 125.123, "eval_samples_per_second": 159.843, "eval_steps_per_second": 9.99, "step": 4900 }, { "epoch": 4.91, "grad_norm": 9.614130973815918, "learning_rate": 7.474814814814816e-06, "loss": 0.19764045476913453, "step": 4910 }, { "epoch": 4.92, "grad_norm": 13.817730903625488, "learning_rate": 7.467407407407408e-06, "loss": 0.2485124111175537, "step": 4920 }, { "epoch": 4.92, "eval_0_to_0": 9587, "eval_0_to_1": 452, "eval_1_to_0": 921, "eval_1_to_1": 9040, "eval_accuracy": 0.93135, "eval_loss": 0.3281388580799103, "eval_runtime": 124.5613, "eval_samples_per_second": 160.564, "eval_steps_per_second": 10.035, "step": 4920 }, { "epoch": 4.93, "grad_norm": 5.9583940505981445, "learning_rate": 7.4600000000000006e-06, "loss": 0.21969494819641114, "step": 4930 }, { "epoch": 4.9399999999999995, "grad_norm": 4.110809326171875, "learning_rate": 7.452592592592593e-06, "loss": 0.17825032472610475, "step": 4940 }, { "epoch": 4.9399999999999995, "eval_0_to_0": 9438, "eval_0_to_1": 601, "eval_1_to_0": 710, "eval_1_to_1": 9251, "eval_accuracy": 0.93445, "eval_loss": 0.2846965491771698, "eval_runtime": 106.5181, "eval_samples_per_second": 187.762, "eval_steps_per_second": 11.735, "step": 4940 }, { "epoch": 4.95, "grad_norm": 4.586197376251221, "learning_rate": 7.445185185185185e-06, "loss": 0.2915563344955444, "step": 4950 }, { "epoch": 4.96, "grad_norm": 13.467039108276367, "learning_rate": 7.437777777777778e-06, "loss": 0.2598043203353882, "step": 4960 }, { "epoch": 4.96, "eval_0_to_0": 9648, "eval_0_to_1": 391, "eval_1_to_0": 979, "eval_1_to_1": 8982, "eval_accuracy": 0.9315, "eval_loss": 0.28601327538490295, "eval_runtime": 107.6208, "eval_samples_per_second": 185.838, "eval_steps_per_second": 11.615, "step": 4960 }, { "epoch": 4.97, "grad_norm": 7.169388294219971, "learning_rate": 7.430370370370371e-06, "loss": 0.19877411127090455, "step": 4970 }, { "epoch": 4.98, "grad_norm": 6.297631740570068, "learning_rate": 7.422962962962964e-06, "loss": 0.24775829315185546, "step": 4980 }, { "epoch": 4.98, "eval_0_to_0": 9562, "eval_0_to_1": 477, "eval_1_to_0": 844, "eval_1_to_1": 9117, "eval_accuracy": 0.93395, "eval_loss": 0.26159560680389404, "eval_runtime": 106.9709, "eval_samples_per_second": 186.967, "eval_steps_per_second": 11.685, "step": 4980 }, { "epoch": 4.99, "grad_norm": 0.5238126516342163, "learning_rate": 7.415555555555556e-06, "loss": 0.13573911190032958, "step": 4990 }, { "epoch": 5.0, "grad_norm": 5.3713812828063965, "learning_rate": 7.408148148148149e-06, "loss": 0.18530534505844115, "step": 5000 }, { "epoch": 5.0, "eval_0_to_0": 9450, "eval_0_to_1": 589, "eval_1_to_0": 773, "eval_1_to_1": 9188, "eval_accuracy": 0.9319, "eval_loss": 0.2919982075691223, "eval_runtime": 109.4632, "eval_samples_per_second": 182.71, "eval_steps_per_second": 11.419, "step": 5000 }, { "epoch": 5.01, "grad_norm": 20.097667694091797, "learning_rate": 7.4007407407407414e-06, "loss": 0.10755336284637451, "step": 5010 }, { "epoch": 5.02, "grad_norm": 10.572213172912598, "learning_rate": 7.393333333333333e-06, "loss": 0.11348153352737426, "step": 5020 }, { "epoch": 5.02, "eval_0_to_0": 9410, "eval_0_to_1": 629, "eval_1_to_0": 708, "eval_1_to_1": 9253, "eval_accuracy": 0.93315, "eval_loss": 0.32926225662231445, "eval_runtime": 109.3111, "eval_samples_per_second": 182.964, "eval_steps_per_second": 11.435, "step": 5020 }, { "epoch": 5.03, "grad_norm": 6.446899890899658, "learning_rate": 7.385925925925926e-06, "loss": 0.10427887439727783, "step": 5030 }, { "epoch": 5.04, "grad_norm": 0.12750926613807678, "learning_rate": 7.378518518518519e-06, "loss": 0.1783403992652893, "step": 5040 }, { "epoch": 5.04, "eval_0_to_0": 9383, "eval_0_to_1": 656, "eval_1_to_0": 649, "eval_1_to_1": 9312, "eval_accuracy": 0.93475, "eval_loss": 0.34460535645484924, "eval_runtime": 110.0135, "eval_samples_per_second": 181.796, "eval_steps_per_second": 11.362, "step": 5040 }, { "epoch": 5.05, "grad_norm": 12.837818145751953, "learning_rate": 7.371111111111112e-06, "loss": 0.0875612735748291, "step": 5050 }, { "epoch": 5.06, "grad_norm": 0.402608186006546, "learning_rate": 7.363703703703704e-06, "loss": 0.09485273361206055, "step": 5060 }, { "epoch": 5.06, "eval_0_to_0": 9536, "eval_0_to_1": 503, "eval_1_to_0": 822, "eval_1_to_1": 9139, "eval_accuracy": 0.93375, "eval_loss": 0.3836284279823303, "eval_runtime": 108.462, "eval_samples_per_second": 184.396, "eval_steps_per_second": 11.525, "step": 5060 }, { "epoch": 5.07, "grad_norm": 14.536727905273438, "learning_rate": 7.356296296296297e-06, "loss": 0.1389439582824707, "step": 5070 }, { "epoch": 5.08, "grad_norm": 1.6879788637161255, "learning_rate": 7.3488888888888895e-06, "loss": 0.06877506971359253, "step": 5080 }, { "epoch": 5.08, "eval_0_to_0": 9376, "eval_0_to_1": 663, "eval_1_to_0": 653, "eval_1_to_1": 9308, "eval_accuracy": 0.9342, "eval_loss": 0.37942835688591003, "eval_runtime": 111.3117, "eval_samples_per_second": 179.676, "eval_steps_per_second": 11.23, "step": 5080 }, { "epoch": 5.09, "grad_norm": 9.914868354797363, "learning_rate": 7.3414814814814815e-06, "loss": 0.2323007345199585, "step": 5090 }, { "epoch": 5.1, "grad_norm": 14.550490379333496, "learning_rate": 7.334074074074074e-06, "loss": 0.19071054458618164, "step": 5100 }, { "epoch": 5.1, "eval_0_to_0": 9415, "eval_0_to_1": 624, "eval_1_to_0": 668, "eval_1_to_1": 9293, "eval_accuracy": 0.9354, "eval_loss": 0.3569653034210205, "eval_runtime": 115.8996, "eval_samples_per_second": 172.563, "eval_steps_per_second": 10.785, "step": 5100 }, { "epoch": 5.11, "grad_norm": 10.923523902893066, "learning_rate": 7.326666666666667e-06, "loss": 0.16690678596496583, "step": 5110 }, { "epoch": 5.12, "grad_norm": 2.6266050338745117, "learning_rate": 7.319259259259261e-06, "loss": 0.11336420774459839, "step": 5120 }, { "epoch": 5.12, "eval_0_to_0": 9557, "eval_0_to_1": 482, "eval_1_to_0": 868, "eval_1_to_1": 9093, "eval_accuracy": 0.9325, "eval_loss": 0.3687921464443207, "eval_runtime": 122.6931, "eval_samples_per_second": 163.008, "eval_steps_per_second": 10.188, "step": 5120 }, { "epoch": 5.13, "grad_norm": 0.025262480601668358, "learning_rate": 7.311851851851852e-06, "loss": 0.14945169687271118, "step": 5130 }, { "epoch": 5.14, "grad_norm": 2.7804174423217773, "learning_rate": 7.304444444444445e-06, "loss": 0.2028651475906372, "step": 5140 }, { "epoch": 5.14, "eval_0_to_0": 9348, "eval_0_to_1": 691, "eval_1_to_0": 624, "eval_1_to_1": 9337, "eval_accuracy": 0.93425, "eval_loss": 0.33813783526420593, "eval_runtime": 126.8311, "eval_samples_per_second": 157.69, "eval_steps_per_second": 9.856, "step": 5140 }, { "epoch": 5.15, "grad_norm": 16.98586654663086, "learning_rate": 7.297037037037038e-06, "loss": 0.14137470722198486, "step": 5150 }, { "epoch": 5.16, "grad_norm": 20.47452163696289, "learning_rate": 7.2896296296296295e-06, "loss": 0.162093186378479, "step": 5160 }, { "epoch": 5.16, "eval_0_to_0": 9666, "eval_0_to_1": 373, "eval_1_to_0": 1037, "eval_1_to_1": 8924, "eval_accuracy": 0.9295, "eval_loss": 0.40730780363082886, "eval_runtime": 125.1046, "eval_samples_per_second": 159.866, "eval_steps_per_second": 9.992, "step": 5160 }, { "epoch": 5.17, "grad_norm": 24.55071449279785, "learning_rate": 7.282222222222222e-06, "loss": 0.17254506349563598, "step": 5170 }, { "epoch": 5.18, "grad_norm": 0.222653329372406, "learning_rate": 7.274814814814816e-06, "loss": 0.06506738662719727, "step": 5180 }, { "epoch": 5.18, "eval_0_to_0": 9267, "eval_0_to_1": 772, "eval_1_to_0": 553, "eval_1_to_1": 9408, "eval_accuracy": 0.93375, "eval_loss": 0.38873258233070374, "eval_runtime": 122.9988, "eval_samples_per_second": 162.603, "eval_steps_per_second": 10.163, "step": 5180 }, { "epoch": 5.19, "grad_norm": 4.926771640777588, "learning_rate": 7.267407407407407e-06, "loss": 0.20863692760467528, "step": 5190 }, { "epoch": 5.2, "grad_norm": 0.27157050371170044, "learning_rate": 7.260000000000001e-06, "loss": 0.09929659366607665, "step": 5200 }, { "epoch": 5.2, "eval_0_to_0": 9451, "eval_0_to_1": 588, "eval_1_to_0": 739, "eval_1_to_1": 9222, "eval_accuracy": 0.93365, "eval_loss": 0.3622560501098633, "eval_runtime": 118.3752, "eval_samples_per_second": 168.954, "eval_steps_per_second": 10.56, "step": 5200 }, { "epoch": 5.21, "grad_norm": 4.432737827301025, "learning_rate": 7.252592592592594e-06, "loss": 0.0796833574771881, "step": 5210 }, { "epoch": 5.22, "grad_norm": 8.75485897064209, "learning_rate": 7.2451851851851864e-06, "loss": 0.15072016716003417, "step": 5220 }, { "epoch": 5.22, "eval_0_to_0": 9293, "eval_0_to_1": 746, "eval_1_to_0": 609, "eval_1_to_1": 9352, "eval_accuracy": 0.93225, "eval_loss": 0.37863779067993164, "eval_runtime": 118.6453, "eval_samples_per_second": 168.57, "eval_steps_per_second": 10.536, "step": 5220 }, { "epoch": 5.23, "grad_norm": 20.900196075439453, "learning_rate": 7.237777777777778e-06, "loss": 0.3067746162414551, "step": 5230 }, { "epoch": 5.24, "grad_norm": 3.0537056922912598, "learning_rate": 7.230370370370371e-06, "loss": 0.20311181545257567, "step": 5240 }, { "epoch": 5.24, "eval_0_to_0": 9103, "eval_0_to_1": 936, "eval_1_to_0": 471, "eval_1_to_1": 9490, "eval_accuracy": 0.92965, "eval_loss": 0.3390163779258728, "eval_runtime": 114.7967, "eval_samples_per_second": 174.221, "eval_steps_per_second": 10.889, "step": 5240 }, { "epoch": 5.25, "grad_norm": 1.2545825242996216, "learning_rate": 7.222962962962964e-06, "loss": 0.19966994524002074, "step": 5250 }, { "epoch": 5.26, "grad_norm": 10.097319602966309, "learning_rate": 7.215555555555556e-06, "loss": 0.05252949595451355, "step": 5260 }, { "epoch": 5.26, "eval_0_to_0": 9346, "eval_0_to_1": 693, "eval_1_to_0": 683, "eval_1_to_1": 9278, "eval_accuracy": 0.9312, "eval_loss": 0.3506799340248108, "eval_runtime": 112.7482, "eval_samples_per_second": 177.386, "eval_steps_per_second": 11.087, "step": 5260 }, { "epoch": 5.27, "grad_norm": 5.491738319396973, "learning_rate": 7.208148148148149e-06, "loss": 0.22816674709320067, "step": 5270 }, { "epoch": 5.28, "grad_norm": 23.62122917175293, "learning_rate": 7.200740740740742e-06, "loss": 0.2504230737686157, "step": 5280 }, { "epoch": 5.28, "eval_0_to_0": 9429, "eval_0_to_1": 610, "eval_1_to_0": 740, "eval_1_to_1": 9221, "eval_accuracy": 0.9325, "eval_loss": 0.3526431620121002, "eval_runtime": 94.0732, "eval_samples_per_second": 212.6, "eval_steps_per_second": 13.288, "step": 5280 }, { "epoch": 5.29, "grad_norm": 0.2577284872531891, "learning_rate": 7.1933333333333345e-06, "loss": 0.09695883393287659, "step": 5290 }, { "epoch": 5.3, "grad_norm": 5.925982475280762, "learning_rate": 7.1859259259259265e-06, "loss": 0.2034376859664917, "step": 5300 }, { "epoch": 5.3, "eval_0_to_0": 9427, "eval_0_to_1": 612, "eval_1_to_0": 722, "eval_1_to_1": 9239, "eval_accuracy": 0.9333, "eval_loss": 0.3617412745952606, "eval_runtime": 85.6978, "eval_samples_per_second": 233.378, "eval_steps_per_second": 14.586, "step": 5300 }, { "epoch": 5.31, "grad_norm": 0.2005104422569275, "learning_rate": 7.178518518518519e-06, "loss": 0.1779039740562439, "step": 5310 }, { "epoch": 5.32, "grad_norm": 9.7496976852417, "learning_rate": 7.171111111111112e-06, "loss": 0.058990228176116946, "step": 5320 }, { "epoch": 5.32, "eval_0_to_0": 9322, "eval_0_to_1": 717, "eval_1_to_0": 595, "eval_1_to_1": 9366, "eval_accuracy": 0.9344, "eval_loss": 0.35160917043685913, "eval_runtime": 90.5257, "eval_samples_per_second": 220.932, "eval_steps_per_second": 13.808, "step": 5320 }, { "epoch": 5.33, "grad_norm": 11.594542503356934, "learning_rate": 7.163703703703704e-06, "loss": 0.20534765720367432, "step": 5330 }, { "epoch": 5.34, "grad_norm": 8.420044898986816, "learning_rate": 7.156296296296297e-06, "loss": 0.2737236261367798, "step": 5340 }, { "epoch": 5.34, "eval_0_to_0": 9459, "eval_0_to_1": 580, "eval_1_to_0": 760, "eval_1_to_1": 9201, "eval_accuracy": 0.933, "eval_loss": 0.3146916925907135, "eval_runtime": 91.6901, "eval_samples_per_second": 218.126, "eval_steps_per_second": 13.633, "step": 5340 }, { "epoch": 5.35, "grad_norm": 8.040779113769531, "learning_rate": 7.14888888888889e-06, "loss": 0.2035320520401001, "step": 5350 }, { "epoch": 5.36, "grad_norm": 1.1123179197311401, "learning_rate": 7.1414814814814825e-06, "loss": 0.15158226490020751, "step": 5360 }, { "epoch": 5.36, "eval_0_to_0": 9321, "eval_0_to_1": 718, "eval_1_to_0": 634, "eval_1_to_1": 9327, "eval_accuracy": 0.9324, "eval_loss": 0.2857793867588043, "eval_runtime": 87.3221, "eval_samples_per_second": 229.037, "eval_steps_per_second": 14.315, "step": 5360 }, { "epoch": 5.37, "grad_norm": 8.912142753601074, "learning_rate": 7.1340740740740745e-06, "loss": 0.1913581132888794, "step": 5370 }, { "epoch": 5.38, "grad_norm": 0.6912229657173157, "learning_rate": 7.126666666666667e-06, "loss": 0.15958584547042848, "step": 5380 }, { "epoch": 5.38, "eval_0_to_0": 9395, "eval_0_to_1": 644, "eval_1_to_0": 677, "eval_1_to_1": 9284, "eval_accuracy": 0.93395, "eval_loss": 0.3389630615711212, "eval_runtime": 86.0263, "eval_samples_per_second": 232.487, "eval_steps_per_second": 14.53, "step": 5380 }, { "epoch": 5.39, "grad_norm": 0.04298854246735573, "learning_rate": 7.11925925925926e-06, "loss": 0.1415708065032959, "step": 5390 }, { "epoch": 5.4, "grad_norm": 19.741031646728516, "learning_rate": 7.111851851851852e-06, "loss": 0.15648149251937865, "step": 5400 }, { "epoch": 5.4, "eval_0_to_0": 9538, "eval_0_to_1": 501, "eval_1_to_0": 812, "eval_1_to_1": 9149, "eval_accuracy": 0.93435, "eval_loss": 0.369709312915802, "eval_runtime": 104.5618, "eval_samples_per_second": 191.274, "eval_steps_per_second": 11.955, "step": 5400 }, { "epoch": 5.41, "grad_norm": 17.799821853637695, "learning_rate": 7.104444444444445e-06, "loss": 0.21212306022644042, "step": 5410 }, { "epoch": 5.42, "grad_norm": 5.882123947143555, "learning_rate": 7.097037037037038e-06, "loss": 0.1134712815284729, "step": 5420 }, { "epoch": 5.42, "eval_0_to_0": 9459, "eval_0_to_1": 580, "eval_1_to_0": 725, "eval_1_to_1": 9236, "eval_accuracy": 0.93475, "eval_loss": 0.36223849654197693, "eval_runtime": 79.2852, "eval_samples_per_second": 252.254, "eval_steps_per_second": 15.766, "step": 5420 }, { "epoch": 5.43, "grad_norm": 14.214719772338867, "learning_rate": 7.089629629629631e-06, "loss": 0.16508214473724364, "step": 5430 }, { "epoch": 5.44, "grad_norm": 21.620502471923828, "learning_rate": 7.0822222222222226e-06, "loss": 0.15313106775283813, "step": 5440 }, { "epoch": 5.44, "eval_0_to_0": 9515, "eval_0_to_1": 524, "eval_1_to_0": 829, "eval_1_to_1": 9132, "eval_accuracy": 0.93235, "eval_loss": 0.38039571046829224, "eval_runtime": 90.7954, "eval_samples_per_second": 220.275, "eval_steps_per_second": 13.767, "step": 5440 }, { "epoch": 5.45, "grad_norm": 0.10536528378725052, "learning_rate": 7.074814814814815e-06, "loss": 0.16042745113372803, "step": 5450 }, { "epoch": 5.46, "grad_norm": 13.700453758239746, "learning_rate": 7.067407407407408e-06, "loss": 0.14590654373168946, "step": 5460 }, { "epoch": 5.46, "eval_0_to_0": 9147, "eval_0_to_1": 892, "eval_1_to_0": 508, "eval_1_to_1": 9453, "eval_accuracy": 0.93, "eval_loss": 0.36914893984794617, "eval_runtime": 92.4421, "eval_samples_per_second": 216.352, "eval_steps_per_second": 13.522, "step": 5460 }, { "epoch": 5.47, "grad_norm": 21.819114685058594, "learning_rate": 7.06e-06, "loss": 0.22575802803039552, "step": 5470 }, { "epoch": 5.48, "grad_norm": 1.5630266666412354, "learning_rate": 7.052592592592593e-06, "loss": 0.1527420997619629, "step": 5480 }, { "epoch": 5.48, "eval_0_to_0": 9245, "eval_0_to_1": 794, "eval_1_to_0": 561, "eval_1_to_1": 9400, "eval_accuracy": 0.93225, "eval_loss": 0.3506992757320404, "eval_runtime": 95.0302, "eval_samples_per_second": 210.459, "eval_steps_per_second": 13.154, "step": 5480 }, { "epoch": 5.49, "grad_norm": 14.844158172607422, "learning_rate": 7.045185185185186e-06, "loss": 0.17450883388519287, "step": 5490 }, { "epoch": 5.5, "grad_norm": 5.167379856109619, "learning_rate": 7.037777777777778e-06, "loss": 0.10184673070907593, "step": 5500 }, { "epoch": 5.5, "eval_0_to_0": 9546, "eval_0_to_1": 493, "eval_1_to_0": 845, "eval_1_to_1": 9116, "eval_accuracy": 0.9331, "eval_loss": 0.38361331820487976, "eval_runtime": 95.2847, "eval_samples_per_second": 209.897, "eval_steps_per_second": 13.119, "step": 5500 }, { "epoch": 5.51, "grad_norm": 0.2529657185077667, "learning_rate": 7.030370370370371e-06, "loss": 0.211714768409729, "step": 5510 }, { "epoch": 5.52, "grad_norm": 0.1228504627943039, "learning_rate": 7.022962962962963e-06, "loss": 0.10821448564529419, "step": 5520 }, { "epoch": 5.52, "eval_0_to_0": 9458, "eval_0_to_1": 581, "eval_1_to_0": 733, "eval_1_to_1": 9228, "eval_accuracy": 0.9343, "eval_loss": 0.35779982805252075, "eval_runtime": 93.5308, "eval_samples_per_second": 213.833, "eval_steps_per_second": 13.365, "step": 5520 }, { "epoch": 5.53, "grad_norm": 1.549738883972168, "learning_rate": 7.015555555555556e-06, "loss": 0.1920827031135559, "step": 5530 }, { "epoch": 5.54, "grad_norm": 8.394462585449219, "learning_rate": 7.008148148148148e-06, "loss": 0.13689981698989867, "step": 5540 }, { "epoch": 5.54, "eval_0_to_0": 9445, "eval_0_to_1": 594, "eval_1_to_0": 731, "eval_1_to_1": 9230, "eval_accuracy": 0.93375, "eval_loss": 0.3457103371620178, "eval_runtime": 93.782, "eval_samples_per_second": 213.261, "eval_steps_per_second": 13.329, "step": 5540 }, { "epoch": 5.55, "grad_norm": 14.96572494506836, "learning_rate": 7.000740740740741e-06, "loss": 0.15125302076339722, "step": 5550 }, { "epoch": 5.5600000000000005, "grad_norm": 14.156939506530762, "learning_rate": 6.993333333333334e-06, "loss": 0.13798000812530517, "step": 5560 }, { "epoch": 5.5600000000000005, "eval_0_to_0": 9399, "eval_0_to_1": 640, "eval_1_to_0": 687, "eval_1_to_1": 9274, "eval_accuracy": 0.93365, "eval_loss": 0.34580475091934204, "eval_runtime": 94.1553, "eval_samples_per_second": 212.415, "eval_steps_per_second": 13.276, "step": 5560 }, { "epoch": 5.57, "grad_norm": 4.256115436553955, "learning_rate": 6.985925925925926e-06, "loss": 0.09486213326454163, "step": 5570 }, { "epoch": 5.58, "grad_norm": 17.457353591918945, "learning_rate": 6.978518518518519e-06, "loss": 0.27388222217559816, "step": 5580 }, { "epoch": 5.58, "eval_0_to_0": 9443, "eval_0_to_1": 596, "eval_1_to_0": 747, "eval_1_to_1": 9214, "eval_accuracy": 0.93285, "eval_loss": 0.3472805321216583, "eval_runtime": 94.7818, "eval_samples_per_second": 211.011, "eval_steps_per_second": 13.188, "step": 5580 }, { "epoch": 5.59, "grad_norm": 11.865690231323242, "learning_rate": 6.9711111111111115e-06, "loss": 0.16066170930862428, "step": 5590 }, { "epoch": 5.6, "grad_norm": 5.605213642120361, "learning_rate": 6.963703703703705e-06, "loss": 0.30421156883239747, "step": 5600 }, { "epoch": 5.6, "eval_0_to_0": 9256, "eval_0_to_1": 783, "eval_1_to_0": 570, "eval_1_to_1": 9391, "eval_accuracy": 0.93235, "eval_loss": 0.33375805616378784, "eval_runtime": 95.1914, "eval_samples_per_second": 210.103, "eval_steps_per_second": 13.131, "step": 5600 }, { "epoch": 5.61, "grad_norm": 0.7249194383621216, "learning_rate": 6.956296296296296e-06, "loss": 0.16170504093170165, "step": 5610 }, { "epoch": 5.62, "grad_norm": 10.873623847961426, "learning_rate": 6.948888888888889e-06, "loss": 0.23867218494415282, "step": 5620 }, { "epoch": 5.62, "eval_0_to_0": 9466, "eval_0_to_1": 573, "eval_1_to_0": 801, "eval_1_to_1": 9160, "eval_accuracy": 0.9313, "eval_loss": 0.3455149531364441, "eval_runtime": 95.0316, "eval_samples_per_second": 210.456, "eval_steps_per_second": 13.154, "step": 5620 }, { "epoch": 5.63, "grad_norm": 6.51597261428833, "learning_rate": 6.941481481481483e-06, "loss": 0.1313917875289917, "step": 5630 }, { "epoch": 5.64, "grad_norm": 0.5852938890457153, "learning_rate": 6.934074074074074e-06, "loss": 0.05798838138580322, "step": 5640 }, { "epoch": 5.64, "eval_0_to_0": 9260, "eval_0_to_1": 779, "eval_1_to_0": 551, "eval_1_to_1": 9410, "eval_accuracy": 0.9335, "eval_loss": 0.34499531984329224, "eval_runtime": 94.7508, "eval_samples_per_second": 211.08, "eval_steps_per_second": 13.193, "step": 5640 }, { "epoch": 5.65, "grad_norm": 1.5383373498916626, "learning_rate": 6.926666666666667e-06, "loss": 0.10789810419082642, "step": 5650 }, { "epoch": 5.66, "grad_norm": 17.786151885986328, "learning_rate": 6.91925925925926e-06, "loss": 0.29785010814666746, "step": 5660 }, { "epoch": 5.66, "eval_0_to_0": 9273, "eval_0_to_1": 766, "eval_1_to_0": 599, "eval_1_to_1": 9362, "eval_accuracy": 0.93175, "eval_loss": 0.37795475125312805, "eval_runtime": 95.3793, "eval_samples_per_second": 209.689, "eval_steps_per_second": 13.106, "step": 5660 }, { "epoch": 5.67, "grad_norm": 14.997891426086426, "learning_rate": 6.911851851851853e-06, "loss": 0.14432506561279296, "step": 5670 }, { "epoch": 5.68, "grad_norm": 0.06248088926076889, "learning_rate": 6.904444444444444e-06, "loss": 0.039877676963806154, "step": 5680 }, { "epoch": 5.68, "eval_0_to_0": 9420, "eval_0_to_1": 619, "eval_1_to_0": 694, "eval_1_to_1": 9267, "eval_accuracy": 0.93435, "eval_loss": 0.34688863158226013, "eval_runtime": 94.9918, "eval_samples_per_second": 210.545, "eval_steps_per_second": 13.159, "step": 5680 }, { "epoch": 5.6899999999999995, "grad_norm": 26.661453247070312, "learning_rate": 6.897037037037038e-06, "loss": 0.09951510429382324, "step": 5690 }, { "epoch": 5.7, "grad_norm": 9.133118629455566, "learning_rate": 6.889629629629631e-06, "loss": 0.2660579442977905, "step": 5700 }, { "epoch": 5.7, "eval_0_to_0": 9353, "eval_0_to_1": 686, "eval_1_to_0": 663, "eval_1_to_1": 9298, "eval_accuracy": 0.93255, "eval_loss": 0.36464327573776245, "eval_runtime": 93.802, "eval_samples_per_second": 213.215, "eval_steps_per_second": 13.326, "step": 5700 }, { "epoch": 5.71, "grad_norm": 33.536808013916016, "learning_rate": 6.882222222222223e-06, "loss": 0.2600142002105713, "step": 5710 }, { "epoch": 5.72, "grad_norm": 24.343822479248047, "learning_rate": 6.874814814814816e-06, "loss": 0.1485803484916687, "step": 5720 }, { "epoch": 5.72, "eval_0_to_0": 9434, "eval_0_to_1": 605, "eval_1_to_0": 748, "eval_1_to_1": 9213, "eval_accuracy": 0.93235, "eval_loss": 0.35769224166870117, "eval_runtime": 95.2869, "eval_samples_per_second": 209.893, "eval_steps_per_second": 13.118, "step": 5720 }, { "epoch": 5.73, "grad_norm": 0.19571934640407562, "learning_rate": 6.867407407407408e-06, "loss": 0.29325017929077146, "step": 5730 }, { "epoch": 5.74, "grad_norm": 21.039419174194336, "learning_rate": 6.860000000000001e-06, "loss": 0.1592987895011902, "step": 5740 }, { "epoch": 5.74, "eval_0_to_0": 9410, "eval_0_to_1": 629, "eval_1_to_0": 715, "eval_1_to_1": 9246, "eval_accuracy": 0.9328, "eval_loss": 0.36407262086868286, "eval_runtime": 94.8894, "eval_samples_per_second": 210.772, "eval_steps_per_second": 13.173, "step": 5740 }, { "epoch": 5.75, "grad_norm": 0.57957524061203, "learning_rate": 6.852592592592593e-06, "loss": 0.09169984459877015, "step": 5750 }, { "epoch": 5.76, "grad_norm": 23.3554744720459, "learning_rate": 6.845185185185186e-06, "loss": 0.25827641487121583, "step": 5760 }, { "epoch": 5.76, "eval_0_to_0": 9304, "eval_0_to_1": 735, "eval_1_to_0": 633, "eval_1_to_1": 9328, "eval_accuracy": 0.9316, "eval_loss": 0.3550976514816284, "eval_runtime": 95.0386, "eval_samples_per_second": 210.441, "eval_steps_per_second": 13.153, "step": 5760 }, { "epoch": 5.77, "grad_norm": 24.274967193603516, "learning_rate": 6.837777777777779e-06, "loss": 0.23075103759765625, "step": 5770 }, { "epoch": 5.78, "grad_norm": 0.4021131694316864, "learning_rate": 6.830370370370371e-06, "loss": 0.2834925651550293, "step": 5780 }, { "epoch": 5.78, "eval_0_to_0": 9336, "eval_0_to_1": 703, "eval_1_to_0": 690, "eval_1_to_1": 9271, "eval_accuracy": 0.93035, "eval_loss": 0.34167760610580444, "eval_runtime": 95.1755, "eval_samples_per_second": 210.138, "eval_steps_per_second": 13.134, "step": 5780 }, { "epoch": 5.79, "grad_norm": 22.727956771850586, "learning_rate": 6.822962962962964e-06, "loss": 0.25888805389404296, "step": 5790 }, { "epoch": 5.8, "grad_norm": 4.639570713043213, "learning_rate": 6.8155555555555565e-06, "loss": 0.11421682834625244, "step": 5800 }, { "epoch": 5.8, "eval_0_to_0": 9535, "eval_0_to_1": 504, "eval_1_to_0": 855, "eval_1_to_1": 9106, "eval_accuracy": 0.93205, "eval_loss": 0.3102840185165405, "eval_runtime": 93.9389, "eval_samples_per_second": 212.904, "eval_steps_per_second": 13.307, "step": 5800 }, { "epoch": 5.8100000000000005, "grad_norm": 13.414340019226074, "learning_rate": 6.8081481481481484e-06, "loss": 0.1876748323440552, "step": 5810 }, { "epoch": 5.82, "grad_norm": 2.2608680725097656, "learning_rate": 6.800740740740741e-06, "loss": 0.11815435886383056, "step": 5820 }, { "epoch": 5.82, "eval_0_to_0": 9389, "eval_0_to_1": 650, "eval_1_to_0": 678, "eval_1_to_1": 9283, "eval_accuracy": 0.9336, "eval_loss": 0.3034173250198364, "eval_runtime": 94.2745, "eval_samples_per_second": 212.146, "eval_steps_per_second": 13.259, "step": 5820 }, { "epoch": 5.83, "grad_norm": 16.62137222290039, "learning_rate": 6.793333333333334e-06, "loss": 0.21158013343811036, "step": 5830 }, { "epoch": 5.84, "grad_norm": 13.383184432983398, "learning_rate": 6.785925925925927e-06, "loss": 0.2201824426651001, "step": 5840 }, { "epoch": 5.84, "eval_0_to_0": 9482, "eval_0_to_1": 557, "eval_1_to_0": 771, "eval_1_to_1": 9190, "eval_accuracy": 0.9336, "eval_loss": 0.29886481165885925, "eval_runtime": 93.9903, "eval_samples_per_second": 212.788, "eval_steps_per_second": 13.299, "step": 5840 }, { "epoch": 5.85, "grad_norm": 3.629464626312256, "learning_rate": 6.778518518518519e-06, "loss": 0.13295830488204957, "step": 5850 }, { "epoch": 5.86, "grad_norm": 3.020341396331787, "learning_rate": 6.771111111111112e-06, "loss": 0.20769546031951905, "step": 5860 }, { "epoch": 5.86, "eval_0_to_0": 9406, "eval_0_to_1": 633, "eval_1_to_0": 675, "eval_1_to_1": 9286, "eval_accuracy": 0.9346, "eval_loss": 0.2949528396129608, "eval_runtime": 94.0563, "eval_samples_per_second": 212.639, "eval_steps_per_second": 13.29, "step": 5860 }, { "epoch": 5.87, "grad_norm": 3.5033838748931885, "learning_rate": 6.7637037037037045e-06, "loss": 0.10478932857513427, "step": 5870 }, { "epoch": 5.88, "grad_norm": 1.5453730821609497, "learning_rate": 6.7562962962962965e-06, "loss": 0.06431984305381774, "step": 5880 }, { "epoch": 5.88, "eval_0_to_0": 9533, "eval_0_to_1": 506, "eval_1_to_0": 869, "eval_1_to_1": 9092, "eval_accuracy": 0.93125, "eval_loss": 0.3384305536746979, "eval_runtime": 94.5302, "eval_samples_per_second": 211.573, "eval_steps_per_second": 13.223, "step": 5880 }, { "epoch": 5.89, "grad_norm": 0.21333660185337067, "learning_rate": 6.748888888888889e-06, "loss": 0.13843040466308593, "step": 5890 }, { "epoch": 5.9, "grad_norm": 34.640968322753906, "learning_rate": 6.741481481481482e-06, "loss": 0.20939629077911376, "step": 5900 }, { "epoch": 5.9, "eval_0_to_0": 9537, "eval_0_to_1": 502, "eval_1_to_0": 831, "eval_1_to_1": 9130, "eval_accuracy": 0.93335, "eval_loss": 0.35999569296836853, "eval_runtime": 94.1737, "eval_samples_per_second": 212.374, "eval_steps_per_second": 13.273, "step": 5900 }, { "epoch": 5.91, "grad_norm": 0.35070255398750305, "learning_rate": 6.734074074074075e-06, "loss": 0.1383660316467285, "step": 5910 }, { "epoch": 5.92, "grad_norm": 24.94243812561035, "learning_rate": 6.726666666666667e-06, "loss": 0.2592116355895996, "step": 5920 }, { "epoch": 5.92, "eval_0_to_0": 9506, "eval_0_to_1": 533, "eval_1_to_0": 809, "eval_1_to_1": 9152, "eval_accuracy": 0.9329, "eval_loss": 0.36024075746536255, "eval_runtime": 94.4148, "eval_samples_per_second": 211.831, "eval_steps_per_second": 13.239, "step": 5920 }, { "epoch": 5.93, "grad_norm": 10.519620895385742, "learning_rate": 6.71925925925926e-06, "loss": 0.2575842380523682, "step": 5930 }, { "epoch": 5.9399999999999995, "grad_norm": 22.910015106201172, "learning_rate": 6.7118518518518526e-06, "loss": 0.27145264148712156, "step": 5940 }, { "epoch": 5.9399999999999995, "eval_0_to_0": 9221, "eval_0_to_1": 818, "eval_1_to_0": 542, "eval_1_to_1": 9419, "eval_accuracy": 0.932, "eval_loss": 0.341335266828537, "eval_runtime": 94.1232, "eval_samples_per_second": 212.487, "eval_steps_per_second": 13.28, "step": 5940 }, { "epoch": 5.95, "grad_norm": 8.539569854736328, "learning_rate": 6.7044444444444445e-06, "loss": 0.20258073806762694, "step": 5950 }, { "epoch": 5.96, "grad_norm": 2.107661247253418, "learning_rate": 6.697037037037037e-06, "loss": 0.23241012096405028, "step": 5960 }, { "epoch": 5.96, "eval_0_to_0": 9391, "eval_0_to_1": 648, "eval_1_to_0": 702, "eval_1_to_1": 9259, "eval_accuracy": 0.9325, "eval_loss": 0.3155854344367981, "eval_runtime": 95.2123, "eval_samples_per_second": 210.057, "eval_steps_per_second": 13.129, "step": 5960 }, { "epoch": 5.97, "grad_norm": 5.630735397338867, "learning_rate": 6.68962962962963e-06, "loss": 0.3072513103485107, "step": 5970 }, { "epoch": 5.98, "grad_norm": 7.625113010406494, "learning_rate": 6.682222222222223e-06, "loss": 0.2085899829864502, "step": 5980 }, { "epoch": 5.98, "eval_0_to_0": 9421, "eval_0_to_1": 618, "eval_1_to_0": 725, "eval_1_to_1": 9236, "eval_accuracy": 0.93285, "eval_loss": 0.2940608263015747, "eval_runtime": 94.6733, "eval_samples_per_second": 211.253, "eval_steps_per_second": 13.203, "step": 5980 }, { "epoch": 5.99, "grad_norm": 0.650473952293396, "learning_rate": 6.674814814814815e-06, "loss": 0.10603876113891601, "step": 5990 }, { "epoch": 6.0, "grad_norm": 28.638532638549805, "learning_rate": 6.667407407407408e-06, "loss": 0.17588032484054567, "step": 6000 }, { "epoch": 6.0, "eval_0_to_0": 9203, "eval_0_to_1": 836, "eval_1_to_0": 516, "eval_1_to_1": 9445, "eval_accuracy": 0.9324, "eval_loss": 0.317870169878006, "eval_runtime": 95.3265, "eval_samples_per_second": 209.805, "eval_steps_per_second": 13.113, "step": 6000 }, { "epoch": 6.01, "grad_norm": 0.33300647139549255, "learning_rate": 6.660000000000001e-06, "loss": 0.0878216028213501, "step": 6010 }, { "epoch": 6.02, "grad_norm": 37.48774337768555, "learning_rate": 6.652592592592593e-06, "loss": 0.17933526039123535, "step": 6020 }, { "epoch": 6.02, "eval_0_to_0": 9509, "eval_0_to_1": 530, "eval_1_to_0": 810, "eval_1_to_1": 9151, "eval_accuracy": 0.933, "eval_loss": 0.3823387920856476, "eval_runtime": 91.0824, "eval_samples_per_second": 219.581, "eval_steps_per_second": 13.724, "step": 6020 }, { "epoch": 6.03, "grad_norm": 0.3869132995605469, "learning_rate": 6.645185185185185e-06, "loss": 0.11091688871383668, "step": 6030 }, { "epoch": 6.04, "grad_norm": 0.3250800371170044, "learning_rate": 6.637777777777778e-06, "loss": 0.22090110778808594, "step": 6040 }, { "epoch": 6.04, "eval_0_to_0": 9467, "eval_0_to_1": 572, "eval_1_to_0": 771, "eval_1_to_1": 9190, "eval_accuracy": 0.93285, "eval_loss": 0.3833599090576172, "eval_runtime": 94.6403, "eval_samples_per_second": 211.326, "eval_steps_per_second": 13.208, "step": 6040 }, { "epoch": 6.05, "grad_norm": 0.061518821865320206, "learning_rate": 6.630370370370371e-06, "loss": 0.031808263063430785, "step": 6050 }, { "epoch": 6.06, "grad_norm": 9.76391315460205, "learning_rate": 6.622962962962963e-06, "loss": 0.09423593282699586, "step": 6060 }, { "epoch": 6.06, "eval_0_to_0": 9223, "eval_0_to_1": 816, "eval_1_to_0": 550, "eval_1_to_1": 9411, "eval_accuracy": 0.9317, "eval_loss": 0.38630396127700806, "eval_runtime": 94.1383, "eval_samples_per_second": 212.453, "eval_steps_per_second": 13.278, "step": 6060 }, { "epoch": 6.07, "grad_norm": 0.6653281450271606, "learning_rate": 6.615555555555556e-06, "loss": 0.02006518542766571, "step": 6070 }, { "epoch": 6.08, "grad_norm": 1.7752130031585693, "learning_rate": 6.6081481481481495e-06, "loss": 0.0384695827960968, "step": 6080 }, { "epoch": 6.08, "eval_0_to_0": 9361, "eval_0_to_1": 678, "eval_1_to_0": 646, "eval_1_to_1": 9315, "eval_accuracy": 0.9338, "eval_loss": 0.40833422541618347, "eval_runtime": 94.2536, "eval_samples_per_second": 212.193, "eval_steps_per_second": 13.262, "step": 6080 }, { "epoch": 6.09, "grad_norm": 0.021112753078341484, "learning_rate": 6.600740740740741e-06, "loss": 0.05903210043907166, "step": 6090 }, { "epoch": 6.1, "grad_norm": 0.13945280015468597, "learning_rate": 6.5933333333333335e-06, "loss": 0.10755997896194458, "step": 6100 }, { "epoch": 6.1, "eval_0_to_0": 9457, "eval_0_to_1": 582, "eval_1_to_0": 699, "eval_1_to_1": 9262, "eval_accuracy": 0.93595, "eval_loss": 0.4312843680381775, "eval_runtime": 93.5472, "eval_samples_per_second": 213.796, "eval_steps_per_second": 13.362, "step": 6100 }, { "epoch": 6.11, "grad_norm": 53.55064010620117, "learning_rate": 6.585925925925927e-06, "loss": 0.35248115062713625, "step": 6110 }, { "epoch": 6.12, "grad_norm": 6.2794060707092285, "learning_rate": 6.578518518518518e-06, "loss": 0.07018719911575318, "step": 6120 }, { "epoch": 6.12, "eval_0_to_0": 9481, "eval_0_to_1": 558, "eval_1_to_0": 781, "eval_1_to_1": 9180, "eval_accuracy": 0.93305, "eval_loss": 0.4150276482105255, "eval_runtime": 93.9591, "eval_samples_per_second": 212.859, "eval_steps_per_second": 13.304, "step": 6120 }, { "epoch": 6.13, "grad_norm": 17.951858520507812, "learning_rate": 6.571111111111111e-06, "loss": 0.07929565906524658, "step": 6130 }, { "epoch": 6.14, "grad_norm": 1.0906572341918945, "learning_rate": 6.563703703703705e-06, "loss": 0.049240493774414064, "step": 6140 }, { "epoch": 6.14, "eval_0_to_0": 9513, "eval_0_to_1": 526, "eval_1_to_0": 796, "eval_1_to_1": 9165, "eval_accuracy": 0.9339, "eval_loss": 0.42736849188804626, "eval_runtime": 93.8879, "eval_samples_per_second": 213.02, "eval_steps_per_second": 13.314, "step": 6140 }, { "epoch": 6.15, "grad_norm": 1.4781908988952637, "learning_rate": 6.5562962962962976e-06, "loss": 0.17749193906784058, "step": 6150 }, { "epoch": 6.16, "grad_norm": 31.902507781982422, "learning_rate": 6.548888888888889e-06, "loss": 0.10246127843856812, "step": 6160 }, { "epoch": 6.16, "eval_0_to_0": 9370, "eval_0_to_1": 669, "eval_1_to_0": 659, "eval_1_to_1": 9302, "eval_accuracy": 0.9336, "eval_loss": 0.42507117986679077, "eval_runtime": 94.8498, "eval_samples_per_second": 210.86, "eval_steps_per_second": 13.179, "step": 6160 }, { "epoch": 6.17, "grad_norm": 13.323847770690918, "learning_rate": 6.541481481481482e-06, "loss": 0.18478081226348878, "step": 6170 }, { "epoch": 6.18, "grad_norm": 0.14052166044712067, "learning_rate": 6.534074074074075e-06, "loss": 0.08424566984176636, "step": 6180 }, { "epoch": 6.18, "eval_0_to_0": 9415, "eval_0_to_1": 624, "eval_1_to_0": 706, "eval_1_to_1": 9255, "eval_accuracy": 0.9335, "eval_loss": 0.4178765118122101, "eval_runtime": 91.601, "eval_samples_per_second": 218.338, "eval_steps_per_second": 13.646, "step": 6180 }, { "epoch": 6.19, "grad_norm": 12.136540412902832, "learning_rate": 6.526666666666666e-06, "loss": 0.047687608003616336, "step": 6190 }, { "epoch": 6.2, "grad_norm": 0.011459971778094769, "learning_rate": 6.51925925925926e-06, "loss": 0.09677663445472717, "step": 6200 }, { "epoch": 6.2, "eval_0_to_0": 9374, "eval_0_to_1": 665, "eval_1_to_0": 700, "eval_1_to_1": 9261, "eval_accuracy": 0.93175, "eval_loss": 0.43716543912887573, "eval_runtime": 92.6288, "eval_samples_per_second": 215.916, "eval_steps_per_second": 13.495, "step": 6200 }, { "epoch": 6.21, "grad_norm": 15.408357620239258, "learning_rate": 6.511851851851853e-06, "loss": 0.21669647693634034, "step": 6210 }, { "epoch": 6.22, "grad_norm": 0.07072807103395462, "learning_rate": 6.504444444444446e-06, "loss": 0.16768840551376343, "step": 6220 }, { "epoch": 6.22, "eval_0_to_0": 9372, "eval_0_to_1": 667, "eval_1_to_0": 656, "eval_1_to_1": 9305, "eval_accuracy": 0.93385, "eval_loss": 0.3939917981624603, "eval_runtime": 92.7839, "eval_samples_per_second": 215.555, "eval_steps_per_second": 13.472, "step": 6220 }, { "epoch": 6.23, "grad_norm": 16.659305572509766, "learning_rate": 6.4970370370370376e-06, "loss": 0.05939224362373352, "step": 6230 }, { "epoch": 6.24, "grad_norm": 8.377394676208496, "learning_rate": 6.48962962962963e-06, "loss": 0.1390227794647217, "step": 6240 }, { "epoch": 6.24, "eval_0_to_0": 9404, "eval_0_to_1": 635, "eval_1_to_0": 683, "eval_1_to_1": 9278, "eval_accuracy": 0.9341, "eval_loss": 0.36765384674072266, "eval_runtime": 93.015, "eval_samples_per_second": 215.019, "eval_steps_per_second": 13.439, "step": 6240 }, { "epoch": 6.25, "grad_norm": 6.5304765701293945, "learning_rate": 6.482222222222223e-06, "loss": 0.15956971645355225, "step": 6250 }, { "epoch": 6.26, "grad_norm": 0.17357206344604492, "learning_rate": 6.474814814814815e-06, "loss": 0.16807098388671876, "step": 6260 }, { "epoch": 6.26, "eval_0_to_0": 9499, "eval_0_to_1": 540, "eval_1_to_0": 809, "eval_1_to_1": 9152, "eval_accuracy": 0.93255, "eval_loss": 0.3737093210220337, "eval_runtime": 89.4896, "eval_samples_per_second": 223.49, "eval_steps_per_second": 13.968, "step": 6260 }, { "epoch": 6.27, "grad_norm": 0.4650168716907501, "learning_rate": 6.467407407407408e-06, "loss": 0.02801431715488434, "step": 6270 }, { "epoch": 6.28, "grad_norm": 0.10913728177547455, "learning_rate": 6.460000000000001e-06, "loss": 0.16178498268127442, "step": 6280 }, { "epoch": 6.28, "eval_0_to_0": 9430, "eval_0_to_1": 609, "eval_1_to_0": 749, "eval_1_to_1": 9212, "eval_accuracy": 0.9321, "eval_loss": 0.4064750373363495, "eval_runtime": 93.3812, "eval_samples_per_second": 214.176, "eval_steps_per_second": 13.386, "step": 6280 }, { "epoch": 6.29, "grad_norm": 0.3866354823112488, "learning_rate": 6.452592592592594e-06, "loss": 0.09872792363166809, "step": 6290 }, { "epoch": 6.3, "grad_norm": 7.414914608001709, "learning_rate": 6.445185185185186e-06, "loss": 0.06261829733848571, "step": 6300 }, { "epoch": 6.3, "eval_0_to_0": 9329, "eval_0_to_1": 710, "eval_1_to_0": 646, "eval_1_to_1": 9315, "eval_accuracy": 0.9322, "eval_loss": 0.4224109947681427, "eval_runtime": 93.428, "eval_samples_per_second": 214.069, "eval_steps_per_second": 13.379, "step": 6300 }, { "epoch": 6.31, "grad_norm": 23.03287124633789, "learning_rate": 6.4377777777777784e-06, "loss": 0.06347211003303528, "step": 6310 }, { "epoch": 6.32, "grad_norm": 0.26060932874679565, "learning_rate": 6.430370370370371e-06, "loss": 0.10006952285766602, "step": 6320 }, { "epoch": 6.32, "eval_0_to_0": 9554, "eval_0_to_1": 485, "eval_1_to_0": 889, "eval_1_to_1": 9072, "eval_accuracy": 0.9313, "eval_loss": 0.4505341649055481, "eval_runtime": 93.2504, "eval_samples_per_second": 214.476, "eval_steps_per_second": 13.405, "step": 6320 }, { "epoch": 6.33, "grad_norm": 66.48705291748047, "learning_rate": 6.422962962962963e-06, "loss": 0.16884942054748536, "step": 6330 }, { "epoch": 6.34, "grad_norm": 23.837434768676758, "learning_rate": 6.415555555555556e-06, "loss": 0.21718475818634034, "step": 6340 }, { "epoch": 6.34, "eval_0_to_0": 9284, "eval_0_to_1": 755, "eval_1_to_0": 581, "eval_1_to_1": 9380, "eval_accuracy": 0.9332, "eval_loss": 0.38820216059684753, "eval_runtime": 93.6337, "eval_samples_per_second": 213.598, "eval_steps_per_second": 13.35, "step": 6340 }, { "epoch": 6.35, "grad_norm": 0.6719968318939209, "learning_rate": 6.408148148148149e-06, "loss": 0.14212146997451783, "step": 6350 }, { "epoch": 6.36, "grad_norm": 0.9548164010047913, "learning_rate": 6.400740740740742e-06, "loss": 0.1090391755104065, "step": 6360 }, { "epoch": 6.36, "eval_0_to_0": 9450, "eval_0_to_1": 589, "eval_1_to_0": 754, "eval_1_to_1": 9207, "eval_accuracy": 0.93285, "eval_loss": 0.4129789173603058, "eval_runtime": 92.7328, "eval_samples_per_second": 215.673, "eval_steps_per_second": 13.48, "step": 6360 }, { "epoch": 6.37, "grad_norm": 20.55489158630371, "learning_rate": 6.393333333333334e-06, "loss": 0.15327053070068358, "step": 6370 }, { "epoch": 6.38, "grad_norm": 0.2538582682609558, "learning_rate": 6.3859259259259265e-06, "loss": 0.16292121410369872, "step": 6380 }, { "epoch": 6.38, "eval_0_to_0": 9333, "eval_0_to_1": 706, "eval_1_to_0": 673, "eval_1_to_1": 9288, "eval_accuracy": 0.93105, "eval_loss": 0.4218962788581848, "eval_runtime": 93.1104, "eval_samples_per_second": 214.799, "eval_steps_per_second": 13.425, "step": 6380 }, { "epoch": 6.39, "grad_norm": 0.0410192497074604, "learning_rate": 6.378518518518519e-06, "loss": 0.16388182640075682, "step": 6390 }, { "epoch": 6.4, "grad_norm": 0.20557180047035217, "learning_rate": 6.371111111111111e-06, "loss": 0.04275112748146057, "step": 6400 }, { "epoch": 6.4, "eval_0_to_0": 9479, "eval_0_to_1": 560, "eval_1_to_0": 814, "eval_1_to_1": 9147, "eval_accuracy": 0.9313, "eval_loss": 0.40248966217041016, "eval_runtime": 90.6705, "eval_samples_per_second": 220.579, "eval_steps_per_second": 13.786, "step": 6400 }, { "epoch": 6.41, "grad_norm": 15.346537590026855, "learning_rate": 6.363703703703704e-06, "loss": 0.10699378252029419, "step": 6410 }, { "epoch": 6.42, "grad_norm": 21.425491333007812, "learning_rate": 6.356296296296297e-06, "loss": 0.2257444143295288, "step": 6420 }, { "epoch": 6.42, "eval_0_to_0": 9526, "eval_0_to_1": 513, "eval_1_to_0": 832, "eval_1_to_1": 9129, "eval_accuracy": 0.93275, "eval_loss": 0.4055386185646057, "eval_runtime": 92.5013, "eval_samples_per_second": 216.213, "eval_steps_per_second": 13.513, "step": 6420 }, { "epoch": 6.43, "grad_norm": 32.32218551635742, "learning_rate": 6.348888888888889e-06, "loss": 0.13335103988647462, "step": 6430 }, { "epoch": 6.44, "grad_norm": 21.39863395690918, "learning_rate": 6.341481481481482e-06, "loss": 0.15582364797592163, "step": 6440 }, { "epoch": 6.44, "eval_0_to_0": 9375, "eval_0_to_1": 664, "eval_1_to_0": 682, "eval_1_to_1": 9279, "eval_accuracy": 0.9327, "eval_loss": 0.37668344378471375, "eval_runtime": 93.6657, "eval_samples_per_second": 213.525, "eval_steps_per_second": 13.345, "step": 6440 }, { "epoch": 6.45, "grad_norm": 3.9379751682281494, "learning_rate": 6.3340740740740745e-06, "loss": 0.15786464214324952, "step": 6450 }, { "epoch": 6.46, "grad_norm": 12.512483596801758, "learning_rate": 6.326666666666667e-06, "loss": 0.05852822661399841, "step": 6460 }, { "epoch": 6.46, "eval_0_to_0": 9352, "eval_0_to_1": 687, "eval_1_to_0": 680, "eval_1_to_1": 9281, "eval_accuracy": 0.93165, "eval_loss": 0.3968997001647949, "eval_runtime": 94.121, "eval_samples_per_second": 212.492, "eval_steps_per_second": 13.281, "step": 6460 }, { "epoch": 6.47, "grad_norm": 5.281322956085205, "learning_rate": 6.319259259259259e-06, "loss": 0.22029683589935303, "step": 6470 }, { "epoch": 6.48, "grad_norm": 23.835487365722656, "learning_rate": 6.311851851851852e-06, "loss": 0.09737342000007629, "step": 6480 }, { "epoch": 6.48, "eval_0_to_0": 9487, "eval_0_to_1": 552, "eval_1_to_0": 782, "eval_1_to_1": 9179, "eval_accuracy": 0.9333, "eval_loss": 0.3939475417137146, "eval_runtime": 93.5915, "eval_samples_per_second": 213.695, "eval_steps_per_second": 13.356, "step": 6480 }, { "epoch": 6.49, "grad_norm": 0.19229602813720703, "learning_rate": 6.304444444444445e-06, "loss": 0.1063474178314209, "step": 6490 }, { "epoch": 6.5, "grad_norm": 3.262195587158203, "learning_rate": 6.297037037037037e-06, "loss": 0.0399673730134964, "step": 6500 }, { "epoch": 6.5, "eval_0_to_0": 9524, "eval_0_to_1": 515, "eval_1_to_0": 826, "eval_1_to_1": 9135, "eval_accuracy": 0.93295, "eval_loss": 0.42177242040634155, "eval_runtime": 93.9728, "eval_samples_per_second": 212.827, "eval_steps_per_second": 13.302, "step": 6500 }, { "epoch": 6.51, "grad_norm": 36.920921325683594, "learning_rate": 6.28962962962963e-06, "loss": 0.21476297378540038, "step": 6510 }, { "epoch": 6.52, "grad_norm": 2.1048381328582764, "learning_rate": 6.282222222222223e-06, "loss": 0.20722172260284424, "step": 6520 }, { "epoch": 6.52, "eval_0_to_0": 9386, "eval_0_to_1": 653, "eval_1_to_0": 678, "eval_1_to_1": 9283, "eval_accuracy": 0.93345, "eval_loss": 0.412569135427475, "eval_runtime": 92.96, "eval_samples_per_second": 215.146, "eval_steps_per_second": 13.447, "step": 6520 }, { "epoch": 6.53, "grad_norm": 11.007078170776367, "learning_rate": 6.274814814814815e-06, "loss": 0.1425804615020752, "step": 6530 }, { "epoch": 6.54, "grad_norm": 48.1101188659668, "learning_rate": 6.267407407407407e-06, "loss": 0.1381992816925049, "step": 6540 }, { "epoch": 6.54, "eval_0_to_0": 9455, "eval_0_to_1": 584, "eval_1_to_0": 759, "eval_1_to_1": 9202, "eval_accuracy": 0.93285, "eval_loss": 0.4223489761352539, "eval_runtime": 91.0964, "eval_samples_per_second": 219.548, "eval_steps_per_second": 13.722, "step": 6540 }, { "epoch": 6.55, "grad_norm": 11.93028450012207, "learning_rate": 6.26e-06, "loss": 0.2659343481063843, "step": 6550 }, { "epoch": 6.5600000000000005, "grad_norm": 11.686984062194824, "learning_rate": 6.252592592592593e-06, "loss": 0.06536984443664551, "step": 6560 }, { "epoch": 6.5600000000000005, "eval_0_to_0": 9616, "eval_0_to_1": 423, "eval_1_to_0": 928, "eval_1_to_1": 9033, "eval_accuracy": 0.93245, "eval_loss": 0.423263818025589, "eval_runtime": 92.6195, "eval_samples_per_second": 215.937, "eval_steps_per_second": 13.496, "step": 6560 }, { "epoch": 6.57, "grad_norm": 6.198612213134766, "learning_rate": 6.245185185185185e-06, "loss": 0.07921228408813477, "step": 6570 }, { "epoch": 6.58, "grad_norm": 0.03671817481517792, "learning_rate": 6.237777777777778e-06, "loss": 0.10239248275756836, "step": 6580 }, { "epoch": 6.58, "eval_0_to_0": 9517, "eval_0_to_1": 522, "eval_1_to_0": 805, "eval_1_to_1": 9156, "eval_accuracy": 0.93365, "eval_loss": 0.42630672454833984, "eval_runtime": 93.219, "eval_samples_per_second": 214.549, "eval_steps_per_second": 13.409, "step": 6580 }, { "epoch": 6.59, "grad_norm": 1.8029452562332153, "learning_rate": 6.2303703703703715e-06, "loss": 0.15814269781112672, "step": 6590 }, { "epoch": 6.6, "grad_norm": 1.1801702976226807, "learning_rate": 6.222962962962964e-06, "loss": 0.25433399677276614, "step": 6600 }, { "epoch": 6.6, "eval_0_to_0": 9415, "eval_0_to_1": 624, "eval_1_to_0": 694, "eval_1_to_1": 9267, "eval_accuracy": 0.9341, "eval_loss": 0.3774901032447815, "eval_runtime": 92.5269, "eval_samples_per_second": 216.153, "eval_steps_per_second": 13.51, "step": 6600 }, { "epoch": 6.61, "grad_norm": 38.96644592285156, "learning_rate": 6.2155555555555554e-06, "loss": 0.1808849334716797, "step": 6610 }, { "epoch": 6.62, "grad_norm": 0.7084115743637085, "learning_rate": 6.208148148148149e-06, "loss": 0.15739210844039916, "step": 6620 }, { "epoch": 6.62, "eval_0_to_0": 9571, "eval_0_to_1": 468, "eval_1_to_0": 859, "eval_1_to_1": 9102, "eval_accuracy": 0.93365, "eval_loss": 0.3630235493183136, "eval_runtime": 93.333, "eval_samples_per_second": 214.287, "eval_steps_per_second": 13.393, "step": 6620 }, { "epoch": 6.63, "grad_norm": 13.133023262023926, "learning_rate": 6.200740740740742e-06, "loss": 0.19715442657470703, "step": 6630 }, { "epoch": 6.64, "grad_norm": 5.445053577423096, "learning_rate": 6.193333333333333e-06, "loss": 0.13556911945343017, "step": 6640 }, { "epoch": 6.64, "eval_0_to_0": 9535, "eval_0_to_1": 504, "eval_1_to_0": 831, "eval_1_to_1": 9130, "eval_accuracy": 0.93325, "eval_loss": 0.3252865672111511, "eval_runtime": 93.6884, "eval_samples_per_second": 213.474, "eval_steps_per_second": 13.342, "step": 6640 }, { "epoch": 6.65, "grad_norm": 6.80938720703125, "learning_rate": 6.185925925925927e-06, "loss": 0.11313620805740357, "step": 6650 }, { "epoch": 6.66, "grad_norm": 5.3282880783081055, "learning_rate": 6.1785185185185195e-06, "loss": 0.05008586049079895, "step": 6660 }, { "epoch": 6.66, "eval_0_to_0": 9414, "eval_0_to_1": 625, "eval_1_to_0": 701, "eval_1_to_1": 9260, "eval_accuracy": 0.9337, "eval_loss": 0.3663921058177948, "eval_runtime": 93.0383, "eval_samples_per_second": 214.965, "eval_steps_per_second": 13.435, "step": 6660 }, { "epoch": 6.67, "grad_norm": 6.420688629150391, "learning_rate": 6.171111111111112e-06, "loss": 0.13253226280212402, "step": 6670 }, { "epoch": 6.68, "grad_norm": 21.96860694885254, "learning_rate": 6.163703703703704e-06, "loss": 0.1800671935081482, "step": 6680 }, { "epoch": 6.68, "eval_0_to_0": 9569, "eval_0_to_1": 470, "eval_1_to_0": 880, "eval_1_to_1": 9081, "eval_accuracy": 0.9325, "eval_loss": 0.4161411225795746, "eval_runtime": 92.4842, "eval_samples_per_second": 216.253, "eval_steps_per_second": 13.516, "step": 6680 }, { "epoch": 6.6899999999999995, "grad_norm": 0.6892911195755005, "learning_rate": 6.156296296296297e-06, "loss": 0.17626174688339233, "step": 6690 }, { "epoch": 6.7, "grad_norm": 0.28302374482154846, "learning_rate": 6.14888888888889e-06, "loss": 0.05228341221809387, "step": 6700 }, { "epoch": 6.7, "eval_0_to_0": 9618, "eval_0_to_1": 421, "eval_1_to_0": 925, "eval_1_to_1": 9036, "eval_accuracy": 0.9327, "eval_loss": 0.4213772416114807, "eval_runtime": 93.1218, "eval_samples_per_second": 214.773, "eval_steps_per_second": 13.423, "step": 6700 }, { "epoch": 6.71, "grad_norm": 32.823524475097656, "learning_rate": 6.141481481481482e-06, "loss": 0.1076075553894043, "step": 6710 }, { "epoch": 6.72, "grad_norm": 16.62516975402832, "learning_rate": 6.134074074074075e-06, "loss": 0.1253389835357666, "step": 6720 }, { "epoch": 6.72, "eval_0_to_0": 9563, "eval_0_to_1": 476, "eval_1_to_0": 882, "eval_1_to_1": 9079, "eval_accuracy": 0.9321, "eval_loss": 0.4307612180709839, "eval_runtime": 93.0488, "eval_samples_per_second": 214.941, "eval_steps_per_second": 13.434, "step": 6720 }, { "epoch": 6.73, "grad_norm": 0.07337532192468643, "learning_rate": 6.126666666666668e-06, "loss": 0.21326794624328613, "step": 6730 }, { "epoch": 6.74, "grad_norm": 0.12018103897571564, "learning_rate": 6.1192592592592596e-06, "loss": 0.19149940013885497, "step": 6740 }, { "epoch": 6.74, "eval_0_to_0": 9520, "eval_0_to_1": 519, "eval_1_to_0": 791, "eval_1_to_1": 9170, "eval_accuracy": 0.9345, "eval_loss": 0.3966992199420929, "eval_runtime": 93.3654, "eval_samples_per_second": 214.212, "eval_steps_per_second": 13.388, "step": 6740 }, { "epoch": 6.75, "grad_norm": 16.469987869262695, "learning_rate": 6.111851851851852e-06, "loss": 0.18103036880493165, "step": 6750 }, { "epoch": 6.76, "grad_norm": 0.5244126915931702, "learning_rate": 6.104444444444445e-06, "loss": 0.1994452953338623, "step": 6760 }, { "epoch": 6.76, "eval_0_to_0": 9319, "eval_0_to_1": 720, "eval_1_to_0": 602, "eval_1_to_1": 9359, "eval_accuracy": 0.9339, "eval_loss": 0.36054375767707825, "eval_runtime": 92.7203, "eval_samples_per_second": 215.703, "eval_steps_per_second": 13.481, "step": 6760 }, { "epoch": 6.77, "grad_norm": 15.059585571289062, "learning_rate": 6.097037037037038e-06, "loss": 0.12405345439910889, "step": 6770 }, { "epoch": 6.78, "grad_norm": 29.108657836914062, "learning_rate": 6.08962962962963e-06, "loss": 0.10666215419769287, "step": 6780 }, { "epoch": 6.78, "eval_0_to_0": 9259, "eval_0_to_1": 780, "eval_1_to_0": 547, "eval_1_to_1": 9414, "eval_accuracy": 0.93365, "eval_loss": 0.3620997965335846, "eval_runtime": 93.9221, "eval_samples_per_second": 212.942, "eval_steps_per_second": 13.309, "step": 6780 }, { "epoch": 6.79, "grad_norm": 0.023550115525722504, "learning_rate": 6.082222222222223e-06, "loss": 0.07166959643363953, "step": 6790 }, { "epoch": 6.8, "grad_norm": 34.837215423583984, "learning_rate": 6.074814814814816e-06, "loss": 0.07140226364135742, "step": 6800 }, { "epoch": 6.8, "eval_0_to_0": 9507, "eval_0_to_1": 532, "eval_1_to_0": 769, "eval_1_to_1": 9192, "eval_accuracy": 0.93495, "eval_loss": 0.4140719771385193, "eval_runtime": 92.5175, "eval_samples_per_second": 216.175, "eval_steps_per_second": 13.511, "step": 6800 }, { "epoch": 6.8100000000000005, "grad_norm": 0.1132609099149704, "learning_rate": 6.067407407407408e-06, "loss": 0.1717611074447632, "step": 6810 }, { "epoch": 6.82, "grad_norm": 21.178085327148438, "learning_rate": 6.0600000000000004e-06, "loss": 0.05639617443084717, "step": 6820 }, { "epoch": 6.82, "eval_0_to_0": 9511, "eval_0_to_1": 528, "eval_1_to_0": 781, "eval_1_to_1": 9180, "eval_accuracy": 0.93455, "eval_loss": 0.4241226017475128, "eval_runtime": 93.1636, "eval_samples_per_second": 214.676, "eval_steps_per_second": 13.417, "step": 6820 }, { "epoch": 6.83, "grad_norm": 0.05058826133608818, "learning_rate": 6.052592592592593e-06, "loss": 0.1230302095413208, "step": 6830 }, { "epoch": 6.84, "grad_norm": 12.237857818603516, "learning_rate": 6.045185185185186e-06, "loss": 0.09052350521087646, "step": 6840 }, { "epoch": 6.84, "eval_0_to_0": 9484, "eval_0_to_1": 555, "eval_1_to_0": 750, "eval_1_to_1": 9211, "eval_accuracy": 0.93475, "eval_loss": 0.4115731418132782, "eval_runtime": 92.3479, "eval_samples_per_second": 216.572, "eval_steps_per_second": 13.536, "step": 6840 }, { "epoch": 6.85, "grad_norm": 15.840740203857422, "learning_rate": 6.037777777777778e-06, "loss": 0.21748590469360352, "step": 6850 }, { "epoch": 6.86, "grad_norm": 0.06504153460264206, "learning_rate": 6.030370370370371e-06, "loss": 0.168937349319458, "step": 6860 }, { "epoch": 6.86, "eval_0_to_0": 9399, "eval_0_to_1": 640, "eval_1_to_0": 679, "eval_1_to_1": 9282, "eval_accuracy": 0.93405, "eval_loss": 0.3715667128562927, "eval_runtime": 93.0249, "eval_samples_per_second": 214.996, "eval_steps_per_second": 13.437, "step": 6860 }, { "epoch": 6.87, "grad_norm": 0.11553400009870529, "learning_rate": 6.022962962962964e-06, "loss": 0.18984992504119874, "step": 6870 }, { "epoch": 6.88, "grad_norm": 0.04778674989938736, "learning_rate": 6.015555555555556e-06, "loss": 0.08720197677612304, "step": 6880 }, { "epoch": 6.88, "eval_0_to_0": 9515, "eval_0_to_1": 524, "eval_1_to_0": 808, "eval_1_to_1": 9153, "eval_accuracy": 0.9334, "eval_loss": 0.3752904534339905, "eval_runtime": 91.525, "eval_samples_per_second": 218.52, "eval_steps_per_second": 13.657, "step": 6880 }, { "epoch": 6.89, "grad_norm": 10.358989715576172, "learning_rate": 6.0081481481481485e-06, "loss": 0.04157475531101227, "step": 6890 }, { "epoch": 6.9, "grad_norm": 2.9248242378234863, "learning_rate": 6.000740740740741e-06, "loss": 0.16831845045089722, "step": 6900 }, { "epoch": 6.9, "eval_0_to_0": 9422, "eval_0_to_1": 617, "eval_1_to_0": 722, "eval_1_to_1": 9239, "eval_accuracy": 0.93305, "eval_loss": 0.37167099118232727, "eval_runtime": 92.1166, "eval_samples_per_second": 217.116, "eval_steps_per_second": 13.57, "step": 6900 }, { "epoch": 6.91, "grad_norm": 0.16723330318927765, "learning_rate": 5.993333333333334e-06, "loss": 0.17110604047775269, "step": 6910 }, { "epoch": 6.92, "grad_norm": 3.105388641357422, "learning_rate": 5.985925925925926e-06, "loss": 0.2192833185195923, "step": 6920 }, { "epoch": 6.92, "eval_0_to_0": 9533, "eval_0_to_1": 506, "eval_1_to_0": 831, "eval_1_to_1": 9130, "eval_accuracy": 0.93315, "eval_loss": 0.36910003423690796, "eval_runtime": 93.0208, "eval_samples_per_second": 215.006, "eval_steps_per_second": 13.438, "step": 6920 }, { "epoch": 6.93, "grad_norm": 0.07485170662403107, "learning_rate": 5.978518518518519e-06, "loss": 0.15482547283172607, "step": 6930 }, { "epoch": 6.9399999999999995, "grad_norm": 11.37649917602539, "learning_rate": 5.971111111111112e-06, "loss": 0.1445184588432312, "step": 6940 }, { "epoch": 6.9399999999999995, "eval_0_to_0": 9252, "eval_0_to_1": 787, "eval_1_to_0": 563, "eval_1_to_1": 9398, "eval_accuracy": 0.9325, "eval_loss": 0.356514036655426, "eval_runtime": 93.1858, "eval_samples_per_second": 214.625, "eval_steps_per_second": 13.414, "step": 6940 }, { "epoch": 6.95, "grad_norm": 12.214701652526855, "learning_rate": 5.963703703703704e-06, "loss": 0.09812177419662475, "step": 6950 }, { "epoch": 6.96, "grad_norm": 0.16252878308296204, "learning_rate": 5.9562962962962965e-06, "loss": 0.14602586030960082, "step": 6960 }, { "epoch": 6.96, "eval_0_to_0": 9532, "eval_0_to_1": 507, "eval_1_to_0": 814, "eval_1_to_1": 9147, "eval_accuracy": 0.93395, "eval_loss": 0.3527146875858307, "eval_runtime": 93.649, "eval_samples_per_second": 213.564, "eval_steps_per_second": 13.348, "step": 6960 }, { "epoch": 6.97, "grad_norm": 4.601169109344482, "learning_rate": 5.948888888888889e-06, "loss": 0.14576213359832763, "step": 6970 }, { "epoch": 6.98, "grad_norm": 17.870397567749023, "learning_rate": 5.941481481481482e-06, "loss": 0.08507874011993408, "step": 6980 }, { "epoch": 6.98, "eval_0_to_0": 9504, "eval_0_to_1": 535, "eval_1_to_0": 761, "eval_1_to_1": 9200, "eval_accuracy": 0.9352, "eval_loss": 0.34743985533714294, "eval_runtime": 92.687, "eval_samples_per_second": 215.78, "eval_steps_per_second": 13.486, "step": 6980 }, { "epoch": 6.99, "grad_norm": 21.139482498168945, "learning_rate": 5.934074074074074e-06, "loss": 0.12202141284942628, "step": 6990 }, { "epoch": 7.0, "grad_norm": 8.451261520385742, "learning_rate": 5.926666666666667e-06, "loss": 0.324936842918396, "step": 7000 }, { "epoch": 7.0, "eval_0_to_0": 9360, "eval_0_to_1": 679, "eval_1_to_0": 640, "eval_1_to_1": 9321, "eval_accuracy": 0.93405, "eval_loss": 0.3568791151046753, "eval_runtime": 93.8228, "eval_samples_per_second": 213.168, "eval_steps_per_second": 13.323, "step": 7000 }, { "epoch": 7.01, "grad_norm": 5.434672832489014, "learning_rate": 5.91925925925926e-06, "loss": 0.12369931936264038, "step": 7010 }, { "epoch": 7.02, "grad_norm": 12.37552261352539, "learning_rate": 5.911851851851852e-06, "loss": 0.10918130874633789, "step": 7020 }, { "epoch": 7.02, "eval_0_to_0": 9368, "eval_0_to_1": 671, "eval_1_to_0": 711, "eval_1_to_1": 9250, "eval_accuracy": 0.9309, "eval_loss": 0.3801940679550171, "eval_runtime": 92.9769, "eval_samples_per_second": 215.107, "eval_steps_per_second": 13.444, "step": 7020 }, { "epoch": 7.03, "grad_norm": 0.21163257956504822, "learning_rate": 5.9044444444444446e-06, "loss": 0.18488430976867676, "step": 7030 }, { "epoch": 7.04, "grad_norm": 0.1852421760559082, "learning_rate": 5.897037037037037e-06, "loss": 0.019738301634788513, "step": 7040 }, { "epoch": 7.04, "eval_0_to_0": 9492, "eval_0_to_1": 547, "eval_1_to_0": 770, "eval_1_to_1": 9191, "eval_accuracy": 0.93415, "eval_loss": 0.3768678605556488, "eval_runtime": 92.3844, "eval_samples_per_second": 216.487, "eval_steps_per_second": 13.53, "step": 7040 }, { "epoch": 7.05, "grad_norm": 21.321945190429688, "learning_rate": 5.889629629629629e-06, "loss": 0.08577380776405334, "step": 7050 }, { "epoch": 7.06, "grad_norm": 0.5683309435844421, "learning_rate": 5.882222222222222e-06, "loss": 0.1492944121360779, "step": 7060 }, { "epoch": 7.06, "eval_0_to_0": 9341, "eval_0_to_1": 698, "eval_1_to_0": 622, "eval_1_to_1": 9339, "eval_accuracy": 0.934, "eval_loss": 0.3899901211261749, "eval_runtime": 93.9846, "eval_samples_per_second": 212.801, "eval_steps_per_second": 13.3, "step": 7060 }, { "epoch": 7.07, "grad_norm": 1.220065712928772, "learning_rate": 5.874814814814815e-06, "loss": 0.12452819347381591, "step": 7070 }, { "epoch": 7.08, "grad_norm": 0.16997551918029785, "learning_rate": 5.867407407407409e-06, "loss": 0.10687931776046752, "step": 7080 }, { "epoch": 7.08, "eval_0_to_0": 9367, "eval_0_to_1": 672, "eval_1_to_0": 641, "eval_1_to_1": 9320, "eval_accuracy": 0.93435, "eval_loss": 0.38336998224258423, "eval_runtime": 93.4787, "eval_samples_per_second": 213.952, "eval_steps_per_second": 13.372, "step": 7080 }, { "epoch": 7.09, "grad_norm": 9.80803108215332, "learning_rate": 5.86e-06, "loss": 0.08291296362876892, "step": 7090 }, { "epoch": 7.1, "grad_norm": 0.053377915173769, "learning_rate": 5.8525925925925935e-06, "loss": 0.11063463687896728, "step": 7100 }, { "epoch": 7.1, "eval_0_to_0": 9566, "eval_0_to_1": 473, "eval_1_to_0": 861, "eval_1_to_1": 9100, "eval_accuracy": 0.9333, "eval_loss": 0.4054582417011261, "eval_runtime": 93.4815, "eval_samples_per_second": 213.946, "eval_steps_per_second": 13.372, "step": 7100 }, { "epoch": 7.11, "grad_norm": 0.312412828207016, "learning_rate": 5.845185185185186e-06, "loss": 0.12034515142440796, "step": 7110 }, { "epoch": 7.12, "grad_norm": 0.37504127621650696, "learning_rate": 5.837777777777777e-06, "loss": 0.12964913845062256, "step": 7120 }, { "epoch": 7.12, "eval_0_to_0": 9411, "eval_0_to_1": 628, "eval_1_to_0": 685, "eval_1_to_1": 9276, "eval_accuracy": 0.93435, "eval_loss": 0.37730872631073, "eval_runtime": 93.059, "eval_samples_per_second": 214.917, "eval_steps_per_second": 13.432, "step": 7120 }, { "epoch": 7.13, "grad_norm": 6.510350227355957, "learning_rate": 5.830370370370371e-06, "loss": 0.06944916248321534, "step": 7130 }, { "epoch": 7.14, "grad_norm": 3.6921167373657227, "learning_rate": 5.822962962962964e-06, "loss": 0.0933513343334198, "step": 7140 }, { "epoch": 7.14, "eval_0_to_0": 9601, "eval_0_to_1": 438, "eval_1_to_0": 899, "eval_1_to_1": 9062, "eval_accuracy": 0.93315, "eval_loss": 0.40974804759025574, "eval_runtime": 93.2967, "eval_samples_per_second": 214.37, "eval_steps_per_second": 13.398, "step": 7140 }, { "epoch": 7.15, "grad_norm": 16.663497924804688, "learning_rate": 5.815555555555557e-06, "loss": 0.17751363515853882, "step": 7150 }, { "epoch": 7.16, "grad_norm": 10.488624572753906, "learning_rate": 5.808148148148149e-06, "loss": 0.04529846906661987, "step": 7160 }, { "epoch": 7.16, "eval_0_to_0": 9441, "eval_0_to_1": 598, "eval_1_to_0": 699, "eval_1_to_1": 9262, "eval_accuracy": 0.93515, "eval_loss": 0.37068331241607666, "eval_runtime": 92.0536, "eval_samples_per_second": 217.265, "eval_steps_per_second": 13.579, "step": 7160 }, { "epoch": 7.17, "grad_norm": 0.27922940254211426, "learning_rate": 5.8007407407407415e-06, "loss": 0.006985472887754441, "step": 7170 }, { "epoch": 7.18, "grad_norm": 14.39402961730957, "learning_rate": 5.793333333333334e-06, "loss": 0.10653746128082275, "step": 7180 }, { "epoch": 7.18, "eval_0_to_0": 9381, "eval_0_to_1": 658, "eval_1_to_0": 630, "eval_1_to_1": 9331, "eval_accuracy": 0.9356, "eval_loss": 0.4062545597553253, "eval_runtime": 92.5264, "eval_samples_per_second": 216.154, "eval_steps_per_second": 13.51, "step": 7180 }, { "epoch": 7.19, "grad_norm": 0.017937324941158295, "learning_rate": 5.785925925925926e-06, "loss": 0.11720832586288452, "step": 7190 }, { "epoch": 7.2, "grad_norm": 21.443252563476562, "learning_rate": 5.778518518518519e-06, "loss": 0.1983393907546997, "step": 7200 }, { "epoch": 7.2, "eval_0_to_0": 9501, "eval_0_to_1": 538, "eval_1_to_0": 816, "eval_1_to_1": 9145, "eval_accuracy": 0.9323, "eval_loss": 0.4314802587032318, "eval_runtime": 92.5242, "eval_samples_per_second": 216.16, "eval_steps_per_second": 13.51, "step": 7200 }, { "epoch": 7.21, "grad_norm": 0.22763775289058685, "learning_rate": 5.771111111111112e-06, "loss": 0.016809341311454774, "step": 7210 }, { "epoch": 7.22, "grad_norm": 1.5874382257461548, "learning_rate": 5.763703703703705e-06, "loss": 0.06177629828453064, "step": 7220 }, { "epoch": 7.22, "eval_0_to_0": 9455, "eval_0_to_1": 584, "eval_1_to_0": 738, "eval_1_to_1": 9223, "eval_accuracy": 0.9339, "eval_loss": 0.4280523955821991, "eval_runtime": 92.3768, "eval_samples_per_second": 216.504, "eval_steps_per_second": 13.532, "step": 7220 }, { "epoch": 7.23, "grad_norm": 0.04428406432271004, "learning_rate": 5.756296296296297e-06, "loss": 0.12019052505493164, "step": 7230 }, { "epoch": 7.24, "grad_norm": 0.04362867772579193, "learning_rate": 5.7488888888888896e-06, "loss": 0.06233817934989929, "step": 7240 }, { "epoch": 7.24, "eval_0_to_0": 9471, "eval_0_to_1": 568, "eval_1_to_0": 759, "eval_1_to_1": 9202, "eval_accuracy": 0.93365, "eval_loss": 0.4408617615699768, "eval_runtime": 92.5732, "eval_samples_per_second": 216.045, "eval_steps_per_second": 13.503, "step": 7240 }, { "epoch": 7.25, "grad_norm": 15.49526309967041, "learning_rate": 5.741481481481482e-06, "loss": 0.0062414206564426426, "step": 7250 }, { "epoch": 7.26, "grad_norm": 0.197068989276886, "learning_rate": 5.734074074074074e-06, "loss": 0.030412209033966065, "step": 7260 }, { "epoch": 7.26, "eval_0_to_0": 9432, "eval_0_to_1": 607, "eval_1_to_0": 679, "eval_1_to_1": 9282, "eval_accuracy": 0.9357, "eval_loss": 0.4355814456939697, "eval_runtime": 93.2259, "eval_samples_per_second": 214.533, "eval_steps_per_second": 13.408, "step": 7260 }, { "epoch": 7.27, "grad_norm": 72.54180145263672, "learning_rate": 5.726666666666667e-06, "loss": 0.02833656072616577, "step": 7270 }, { "epoch": 7.28, "grad_norm": 28.945560455322266, "learning_rate": 5.71925925925926e-06, "loss": 0.010978450626134872, "step": 7280 }, { "epoch": 7.28, "eval_0_to_0": 9457, "eval_0_to_1": 582, "eval_1_to_0": 685, "eval_1_to_1": 9276, "eval_accuracy": 0.93665, "eval_loss": 0.4540453255176544, "eval_runtime": 93.1731, "eval_samples_per_second": 214.654, "eval_steps_per_second": 13.416, "step": 7280 }, { "epoch": 7.29, "grad_norm": 40.074920654296875, "learning_rate": 5.711851851851853e-06, "loss": 0.11209632158279419, "step": 7290 }, { "epoch": 7.3, "grad_norm": 0.741782546043396, "learning_rate": 5.704444444444445e-06, "loss": 0.1371869683265686, "step": 7300 }, { "epoch": 7.3, "eval_0_to_0": 9535, "eval_0_to_1": 504, "eval_1_to_0": 797, "eval_1_to_1": 9164, "eval_accuracy": 0.93495, "eval_loss": 0.4743299186229706, "eval_runtime": 93.4677, "eval_samples_per_second": 213.978, "eval_steps_per_second": 13.374, "step": 7300 }, { "epoch": 7.31, "grad_norm": 21.07460594177246, "learning_rate": 5.697037037037038e-06, "loss": 0.24155540466308595, "step": 7310 }, { "epoch": 7.32, "grad_norm": 5.092589855194092, "learning_rate": 5.6896296296296304e-06, "loss": 0.14513726234436036, "step": 7320 }, { "epoch": 7.32, "eval_0_to_0": 9416, "eval_0_to_1": 623, "eval_1_to_0": 663, "eval_1_to_1": 9298, "eval_accuracy": 0.9357, "eval_loss": 0.387266606092453, "eval_runtime": 93.4289, "eval_samples_per_second": 214.066, "eval_steps_per_second": 13.379, "step": 7320 }, { "epoch": 7.33, "grad_norm": 2.6521246433258057, "learning_rate": 5.682222222222222e-06, "loss": 0.19383150339126587, "step": 7330 }, { "epoch": 7.34, "grad_norm": 31.178876876831055, "learning_rate": 5.674814814814815e-06, "loss": 0.1418292760848999, "step": 7340 }, { "epoch": 7.34, "eval_0_to_0": 9324, "eval_0_to_1": 715, "eval_1_to_0": 608, "eval_1_to_1": 9353, "eval_accuracy": 0.93385, "eval_loss": 0.34946388006210327, "eval_runtime": 93.4106, "eval_samples_per_second": 214.108, "eval_steps_per_second": 13.382, "step": 7340 }, { "epoch": 7.35, "grad_norm": 30.23699378967285, "learning_rate": 5.667407407407408e-06, "loss": 0.04940693974494934, "step": 7350 }, { "epoch": 7.36, "grad_norm": 2.343447208404541, "learning_rate": 5.66e-06, "loss": 0.09207149147987366, "step": 7360 }, { "epoch": 7.36, "eval_0_to_0": 9592, "eval_0_to_1": 447, "eval_1_to_0": 891, "eval_1_to_1": 9070, "eval_accuracy": 0.9331, "eval_loss": 0.410847008228302, "eval_runtime": 91.9043, "eval_samples_per_second": 217.618, "eval_steps_per_second": 13.601, "step": 7360 }, { "epoch": 7.37, "grad_norm": 22.308012008666992, "learning_rate": 5.652592592592593e-06, "loss": 0.3078962564468384, "step": 7370 }, { "epoch": 7.38, "grad_norm": 5.850389003753662, "learning_rate": 5.645185185185186e-06, "loss": 0.023442554473876952, "step": 7380 }, { "epoch": 7.38, "eval_0_to_0": 9350, "eval_0_to_1": 689, "eval_1_to_0": 607, "eval_1_to_1": 9354, "eval_accuracy": 0.9352, "eval_loss": 0.39010727405548096, "eval_runtime": 93.5857, "eval_samples_per_second": 213.708, "eval_steps_per_second": 13.357, "step": 7380 }, { "epoch": 7.39, "grad_norm": 0.09387645125389099, "learning_rate": 5.6377777777777785e-06, "loss": 0.11789729595184326, "step": 7390 }, { "epoch": 7.4, "grad_norm": 29.53145408630371, "learning_rate": 5.6303703703703705e-06, "loss": 0.1579986572265625, "step": 7400 }, { "epoch": 7.4, "eval_0_to_0": 9478, "eval_0_to_1": 561, "eval_1_to_0": 767, "eval_1_to_1": 9194, "eval_accuracy": 0.9336, "eval_loss": 0.4146113693714142, "eval_runtime": 93.4151, "eval_samples_per_second": 214.098, "eval_steps_per_second": 13.381, "step": 7400 }, { "epoch": 7.41, "grad_norm": 41.354854583740234, "learning_rate": 5.622962962962963e-06, "loss": 0.04353410303592682, "step": 7410 }, { "epoch": 7.42, "grad_norm": 0.7559128999710083, "learning_rate": 5.615555555555556e-06, "loss": 0.016860127449035645, "step": 7420 }, { "epoch": 7.42, "eval_0_to_0": 9430, "eval_0_to_1": 609, "eval_1_to_0": 697, "eval_1_to_1": 9264, "eval_accuracy": 0.9347, "eval_loss": 0.41643622517585754, "eval_runtime": 93.4986, "eval_samples_per_second": 213.907, "eval_steps_per_second": 13.369, "step": 7420 }, { "epoch": 7.43, "grad_norm": 13.649600982666016, "learning_rate": 5.608148148148148e-06, "loss": 0.10369597673416138, "step": 7430 }, { "epoch": 7.44, "grad_norm": 0.0757410079240799, "learning_rate": 5.600740740740741e-06, "loss": 0.12426482439041138, "step": 7440 }, { "epoch": 7.44, "eval_0_to_0": 9498, "eval_0_to_1": 541, "eval_1_to_0": 763, "eval_1_to_1": 9198, "eval_accuracy": 0.9348, "eval_loss": 0.4110303223133087, "eval_runtime": 93.4362, "eval_samples_per_second": 214.05, "eval_steps_per_second": 13.378, "step": 7440 }, { "epoch": 7.45, "grad_norm": 0.10457304865121841, "learning_rate": 5.593333333333334e-06, "loss": 0.08585971593856812, "step": 7450 }, { "epoch": 7.46, "grad_norm": 0.24535997211933136, "learning_rate": 5.5859259259259265e-06, "loss": 0.12736134529113768, "step": 7460 }, { "epoch": 7.46, "eval_0_to_0": 9366, "eval_0_to_1": 673, "eval_1_to_0": 630, "eval_1_to_1": 9331, "eval_accuracy": 0.93485, "eval_loss": 0.3668779134750366, "eval_runtime": 94.0703, "eval_samples_per_second": 212.607, "eval_steps_per_second": 13.288, "step": 7460 }, { "epoch": 7.47, "grad_norm": 0.5396771430969238, "learning_rate": 5.5785185185185185e-06, "loss": 0.08283145427703857, "step": 7470 }, { "epoch": 7.48, "grad_norm": 20.296770095825195, "learning_rate": 5.571111111111111e-06, "loss": 0.11879926919937134, "step": 7480 }, { "epoch": 7.48, "eval_0_to_0": 9315, "eval_0_to_1": 724, "eval_1_to_0": 582, "eval_1_to_1": 9379, "eval_accuracy": 0.9347, "eval_loss": 0.3548794984817505, "eval_runtime": 93.2187, "eval_samples_per_second": 214.549, "eval_steps_per_second": 13.409, "step": 7480 }, { "epoch": 7.49, "grad_norm": 3.7416775226593018, "learning_rate": 5.563703703703704e-06, "loss": 0.030941441655158997, "step": 7490 }, { "epoch": 7.5, "grad_norm": 0.8615913391113281, "learning_rate": 5.556296296296296e-06, "loss": 0.08536978960037231, "step": 7500 }, { "epoch": 7.5, "eval_0_to_0": 9415, "eval_0_to_1": 624, "eval_1_to_0": 687, "eval_1_to_1": 9274, "eval_accuracy": 0.93445, "eval_loss": 0.3640095591545105, "eval_runtime": 93.4535, "eval_samples_per_second": 214.01, "eval_steps_per_second": 13.376, "step": 7500 }, { "epoch": 7.51, "grad_norm": 2.3133647441864014, "learning_rate": 5.548888888888889e-06, "loss": 0.03107055127620697, "step": 7510 }, { "epoch": 7.52, "grad_norm": 37.03534698486328, "learning_rate": 5.541481481481482e-06, "loss": 0.17061116695404052, "step": 7520 }, { "epoch": 7.52, "eval_0_to_0": 9394, "eval_0_to_1": 645, "eval_1_to_0": 651, "eval_1_to_1": 9310, "eval_accuracy": 0.9352, "eval_loss": 0.3792080581188202, "eval_runtime": 93.6137, "eval_samples_per_second": 213.644, "eval_steps_per_second": 13.353, "step": 7520 }, { "epoch": 7.53, "grad_norm": 10.507098197937012, "learning_rate": 5.5340740740740754e-06, "loss": 0.10308263301849366, "step": 7530 }, { "epoch": 7.54, "grad_norm": 50.91277313232422, "learning_rate": 5.5266666666666666e-06, "loss": 0.11387042999267578, "step": 7540 }, { "epoch": 7.54, "eval_0_to_0": 9538, "eval_0_to_1": 501, "eval_1_to_0": 816, "eval_1_to_1": 9145, "eval_accuracy": 0.93415, "eval_loss": 0.41831475496292114, "eval_runtime": 93.2752, "eval_samples_per_second": 214.419, "eval_steps_per_second": 13.401, "step": 7540 }, { "epoch": 7.55, "grad_norm": 6.805718898773193, "learning_rate": 5.519259259259259e-06, "loss": 0.1381365180015564, "step": 7550 }, { "epoch": 7.5600000000000005, "grad_norm": 0.04340885579586029, "learning_rate": 5.511851851851853e-06, "loss": 0.025563326478004456, "step": 7560 }, { "epoch": 7.5600000000000005, "eval_0_to_0": 9268, "eval_0_to_1": 771, "eval_1_to_0": 563, "eval_1_to_1": 9398, "eval_accuracy": 0.9333, "eval_loss": 0.41363954544067383, "eval_runtime": 92.6103, "eval_samples_per_second": 215.959, "eval_steps_per_second": 13.497, "step": 7560 }, { "epoch": 7.57, "grad_norm": 0.23071959614753723, "learning_rate": 5.504444444444444e-06, "loss": 0.11723817586898803, "step": 7570 }, { "epoch": 7.58, "grad_norm": 34.80360794067383, "learning_rate": 5.497037037037037e-06, "loss": 0.1660943388938904, "step": 7580 }, { "epoch": 7.58, "eval_0_to_0": 9368, "eval_0_to_1": 671, "eval_1_to_0": 653, "eval_1_to_1": 9308, "eval_accuracy": 0.9338, "eval_loss": 0.42370155453681946, "eval_runtime": 93.6478, "eval_samples_per_second": 213.566, "eval_steps_per_second": 13.348, "step": 7580 }, { "epoch": 7.59, "grad_norm": 0.036988116800785065, "learning_rate": 5.489629629629631e-06, "loss": 0.1807691216468811, "step": 7590 }, { "epoch": 7.6, "grad_norm": 48.49715042114258, "learning_rate": 5.4822222222222235e-06, "loss": 0.20825574398040772, "step": 7600 }, { "epoch": 7.6, "eval_0_to_0": 9500, "eval_0_to_1": 539, "eval_1_to_0": 793, "eval_1_to_1": 9168, "eval_accuracy": 0.9334, "eval_loss": 0.4191111922264099, "eval_runtime": 93.458, "eval_samples_per_second": 214.0, "eval_steps_per_second": 13.375, "step": 7600 }, { "epoch": 7.61, "grad_norm": 0.4900936484336853, "learning_rate": 5.4748148148148154e-06, "loss": 0.15560828447341918, "step": 7610 }, { "epoch": 7.62, "grad_norm": 0.24480664730072021, "learning_rate": 5.467407407407408e-06, "loss": 0.11268841028213501, "step": 7620 }, { "epoch": 7.62, "eval_0_to_0": 9575, "eval_0_to_1": 464, "eval_1_to_0": 861, "eval_1_to_1": 9100, "eval_accuracy": 0.93375, "eval_loss": 0.41699886322021484, "eval_runtime": 93.7106, "eval_samples_per_second": 213.423, "eval_steps_per_second": 13.339, "step": 7620 }, { "epoch": 7.63, "grad_norm": 56.738399505615234, "learning_rate": 5.460000000000001e-06, "loss": 0.1976263403892517, "step": 7630 }, { "epoch": 7.64, "grad_norm": 0.31005704402923584, "learning_rate": 5.452592592592593e-06, "loss": 0.06162638664245605, "step": 7640 }, { "epoch": 7.64, "eval_0_to_0": 9303, "eval_0_to_1": 736, "eval_1_to_0": 573, "eval_1_to_1": 9388, "eval_accuracy": 0.93455, "eval_loss": 0.3787228763103485, "eval_runtime": 92.757, "eval_samples_per_second": 215.617, "eval_steps_per_second": 13.476, "step": 7640 }, { "epoch": 7.65, "grad_norm": 27.806013107299805, "learning_rate": 5.445185185185186e-06, "loss": 0.05262110829353332, "step": 7650 }, { "epoch": 7.66, "grad_norm": 0.06654947251081467, "learning_rate": 5.437777777777779e-06, "loss": 0.10460976362228394, "step": 7660 }, { "epoch": 7.66, "eval_0_to_0": 9343, "eval_0_to_1": 696, "eval_1_to_0": 612, "eval_1_to_1": 9349, "eval_accuracy": 0.9346, "eval_loss": 0.39468061923980713, "eval_runtime": 92.557, "eval_samples_per_second": 216.083, "eval_steps_per_second": 13.505, "step": 7660 }, { "epoch": 7.67, "grad_norm": 0.18754428625106812, "learning_rate": 5.430370370370371e-06, "loss": 0.19219870567321778, "step": 7670 }, { "epoch": 7.68, "grad_norm": 0.7588456869125366, "learning_rate": 5.4229629629629635e-06, "loss": 0.1633303642272949, "step": 7680 }, { "epoch": 7.68, "eval_0_to_0": 9498, "eval_0_to_1": 541, "eval_1_to_0": 788, "eval_1_to_1": 9173, "eval_accuracy": 0.93355, "eval_loss": 0.3744734823703766, "eval_runtime": 92.467, "eval_samples_per_second": 216.293, "eval_steps_per_second": 13.518, "step": 7680 }, { "epoch": 7.6899999999999995, "grad_norm": 1.888541579246521, "learning_rate": 5.415555555555556e-06, "loss": 0.12019336223602295, "step": 7690 }, { "epoch": 7.7, "grad_norm": 15.968310356140137, "learning_rate": 5.408148148148149e-06, "loss": 0.16240313053131103, "step": 7700 }, { "epoch": 7.7, "eval_0_to_0": 9320, "eval_0_to_1": 719, "eval_1_to_0": 585, "eval_1_to_1": 9376, "eval_accuracy": 0.9348, "eval_loss": 0.34424877166748047, "eval_runtime": 92.4117, "eval_samples_per_second": 216.423, "eval_steps_per_second": 13.526, "step": 7700 }, { "epoch": 7.71, "grad_norm": 1.9321647882461548, "learning_rate": 5.400740740740741e-06, "loss": 0.036682435870170595, "step": 7710 }, { "epoch": 7.72, "grad_norm": 19.48761749267578, "learning_rate": 5.393333333333334e-06, "loss": 0.04436431527137756, "step": 7720 }, { "epoch": 7.72, "eval_0_to_0": 9386, "eval_0_to_1": 653, "eval_1_to_0": 662, "eval_1_to_1": 9299, "eval_accuracy": 0.93425, "eval_loss": 0.3890265226364136, "eval_runtime": 93.0962, "eval_samples_per_second": 214.832, "eval_steps_per_second": 13.427, "step": 7720 }, { "epoch": 7.73, "grad_norm": 0.05082673951983452, "learning_rate": 5.385925925925927e-06, "loss": 0.14315398931503295, "step": 7730 }, { "epoch": 7.74, "grad_norm": 1.1058636903762817, "learning_rate": 5.378518518518519e-06, "loss": 0.0949928343296051, "step": 7740 }, { "epoch": 7.74, "eval_0_to_0": 9347, "eval_0_to_1": 692, "eval_1_to_0": 635, "eval_1_to_1": 9326, "eval_accuracy": 0.93365, "eval_loss": 0.40575098991394043, "eval_runtime": 93.4656, "eval_samples_per_second": 213.982, "eval_steps_per_second": 13.374, "step": 7740 }, { "epoch": 7.75, "grad_norm": 1.3468029499053955, "learning_rate": 5.3711111111111115e-06, "loss": 0.008348648995161056, "step": 7750 }, { "epoch": 7.76, "grad_norm": 0.39856356382369995, "learning_rate": 5.363703703703704e-06, "loss": 0.13423620462417601, "step": 7760 }, { "epoch": 7.76, "eval_0_to_0": 9255, "eval_0_to_1": 784, "eval_1_to_0": 558, "eval_1_to_1": 9403, "eval_accuracy": 0.9329, "eval_loss": 0.4071560502052307, "eval_runtime": 91.3362, "eval_samples_per_second": 218.971, "eval_steps_per_second": 13.686, "step": 7760 }, { "epoch": 7.77, "grad_norm": 0.02757469192147255, "learning_rate": 5.356296296296297e-06, "loss": 0.14349104166030885, "step": 7770 }, { "epoch": 7.78, "grad_norm": 0.19562992453575134, "learning_rate": 5.348888888888889e-06, "loss": 0.009107113629579545, "step": 7780 }, { "epoch": 7.78, "eval_0_to_0": 9324, "eval_0_to_1": 715, "eval_1_to_0": 598, "eval_1_to_1": 9363, "eval_accuracy": 0.93435, "eval_loss": 0.40434518456459045, "eval_runtime": 92.7288, "eval_samples_per_second": 215.683, "eval_steps_per_second": 13.48, "step": 7780 }, { "epoch": 7.79, "grad_norm": 0.5606553554534912, "learning_rate": 5.341481481481482e-06, "loss": 0.18174033164978026, "step": 7790 }, { "epoch": 7.8, "grad_norm": 19.64327621459961, "learning_rate": 5.334074074074075e-06, "loss": 0.17056801319122314, "step": 7800 }, { "epoch": 7.8, "eval_0_to_0": 9373, "eval_0_to_1": 666, "eval_1_to_0": 644, "eval_1_to_1": 9317, "eval_accuracy": 0.9345, "eval_loss": 0.3952100872993469, "eval_runtime": 92.1434, "eval_samples_per_second": 217.053, "eval_steps_per_second": 13.566, "step": 7800 }, { "epoch": 7.8100000000000005, "grad_norm": 0.03511868789792061, "learning_rate": 5.326666666666667e-06, "loss": 0.15940943956375123, "step": 7810 }, { "epoch": 7.82, "grad_norm": 0.43385905027389526, "learning_rate": 5.31925925925926e-06, "loss": 0.10831845998764038, "step": 7820 }, { "epoch": 7.82, "eval_0_to_0": 9537, "eval_0_to_1": 502, "eval_1_to_0": 814, "eval_1_to_1": 9147, "eval_accuracy": 0.9342, "eval_loss": 0.41609638929367065, "eval_runtime": 93.2512, "eval_samples_per_second": 214.475, "eval_steps_per_second": 13.405, "step": 7820 }, { "epoch": 7.83, "grad_norm": 0.04485149681568146, "learning_rate": 5.311851851851852e-06, "loss": 0.16230918169021608, "step": 7830 }, { "epoch": 7.84, "grad_norm": 2.198333263397217, "learning_rate": 5.304444444444445e-06, "loss": 0.07694526314735413, "step": 7840 }, { "epoch": 7.84, "eval_0_to_0": 9350, "eval_0_to_1": 689, "eval_1_to_0": 632, "eval_1_to_1": 9329, "eval_accuracy": 0.93395, "eval_loss": 0.40168118476867676, "eval_runtime": 93.1617, "eval_samples_per_second": 214.681, "eval_steps_per_second": 13.418, "step": 7840 }, { "epoch": 7.85, "grad_norm": 0.09204980731010437, "learning_rate": 5.297037037037037e-06, "loss": 0.1437104821205139, "step": 7850 }, { "epoch": 7.86, "grad_norm": 0.46383485198020935, "learning_rate": 5.28962962962963e-06, "loss": 0.04598914980888367, "step": 7860 }, { "epoch": 7.86, "eval_0_to_0": 9352, "eval_0_to_1": 687, "eval_1_to_0": 643, "eval_1_to_1": 9318, "eval_accuracy": 0.9335, "eval_loss": 0.36057159304618835, "eval_runtime": 93.5024, "eval_samples_per_second": 213.898, "eval_steps_per_second": 13.369, "step": 7860 }, { "epoch": 7.87, "grad_norm": 0.05469353497028351, "learning_rate": 5.282222222222223e-06, "loss": 0.07908767461776733, "step": 7870 }, { "epoch": 7.88, "grad_norm": 0.03720348700881004, "learning_rate": 5.274814814814815e-06, "loss": 0.011920115351676941, "step": 7880 }, { "epoch": 7.88, "eval_0_to_0": 9492, "eval_0_to_1": 547, "eval_1_to_0": 782, "eval_1_to_1": 9179, "eval_accuracy": 0.93355, "eval_loss": 0.41851675510406494, "eval_runtime": 92.6342, "eval_samples_per_second": 215.903, "eval_steps_per_second": 13.494, "step": 7880 }, { "epoch": 7.89, "grad_norm": 0.1274174302816391, "learning_rate": 5.267407407407408e-06, "loss": 0.10167516469955444, "step": 7890 }, { "epoch": 7.9, "grad_norm": 28.511911392211914, "learning_rate": 5.2600000000000005e-06, "loss": 0.05203817486763, "step": 7900 }, { "epoch": 7.9, "eval_0_to_0": 9475, "eval_0_to_1": 564, "eval_1_to_0": 757, "eval_1_to_1": 9204, "eval_accuracy": 0.93395, "eval_loss": 0.422133207321167, "eval_runtime": 92.7505, "eval_samples_per_second": 215.632, "eval_steps_per_second": 13.477, "step": 7900 }, { "epoch": 7.91, "grad_norm": 26.823123931884766, "learning_rate": 5.252592592592593e-06, "loss": 0.14965615272521973, "step": 7910 }, { "epoch": 7.92, "grad_norm": 0.033275578171014786, "learning_rate": 5.245185185185185e-06, "loss": 0.15091173648834227, "step": 7920 }, { "epoch": 7.92, "eval_0_to_0": 9428, "eval_0_to_1": 611, "eval_1_to_0": 676, "eval_1_to_1": 9285, "eval_accuracy": 0.93565, "eval_loss": 0.4233691394329071, "eval_runtime": 92.8456, "eval_samples_per_second": 215.411, "eval_steps_per_second": 13.463, "step": 7920 }, { "epoch": 7.93, "grad_norm": 4.559348106384277, "learning_rate": 5.237777777777778e-06, "loss": 0.09896253347396851, "step": 7930 }, { "epoch": 7.9399999999999995, "grad_norm": 0.050407085567712784, "learning_rate": 5.230370370370371e-06, "loss": 0.10085823535919189, "step": 7940 }, { "epoch": 7.9399999999999995, "eval_0_to_0": 9548, "eval_0_to_1": 491, "eval_1_to_0": 840, "eval_1_to_1": 9121, "eval_accuracy": 0.93345, "eval_loss": 0.436352014541626, "eval_runtime": 91.4099, "eval_samples_per_second": 218.795, "eval_steps_per_second": 13.675, "step": 7940 }, { "epoch": 7.95, "grad_norm": 34.473419189453125, "learning_rate": 5.222962962962963e-06, "loss": 0.17069097757339477, "step": 7950 }, { "epoch": 7.96, "grad_norm": 9.478092193603516, "learning_rate": 5.215555555555556e-06, "loss": 0.27489187717437746, "step": 7960 }, { "epoch": 7.96, "eval_0_to_0": 9162, "eval_0_to_1": 877, "eval_1_to_0": 474, "eval_1_to_1": 9487, "eval_accuracy": 0.93245, "eval_loss": 0.3939579427242279, "eval_runtime": 93.2726, "eval_samples_per_second": 214.425, "eval_steps_per_second": 13.402, "step": 7960 }, { "epoch": 7.97, "grad_norm": 49.7479133605957, "learning_rate": 5.2081481481481485e-06, "loss": 0.10114464759826661, "step": 7970 }, { "epoch": 7.98, "grad_norm": 12.874560356140137, "learning_rate": 5.2007407407407405e-06, "loss": 0.09085421562194824, "step": 7980 }, { "epoch": 7.98, "eval_0_to_0": 9444, "eval_0_to_1": 595, "eval_1_to_0": 713, "eval_1_to_1": 9248, "eval_accuracy": 0.9346, "eval_loss": 0.40413349866867065, "eval_runtime": 93.1288, "eval_samples_per_second": 214.756, "eval_steps_per_second": 13.422, "step": 7980 }, { "epoch": 7.99, "grad_norm": 0.11414586752653122, "learning_rate": 5.193333333333333e-06, "loss": 0.09656457304954529, "step": 7990 }, { "epoch": 8.0, "grad_norm": 0.5050733685493469, "learning_rate": 5.185925925925926e-06, "loss": 0.14168187379837036, "step": 8000 }, { "epoch": 8.0, "eval_0_to_0": 9255, "eval_0_to_1": 784, "eval_1_to_0": 570, "eval_1_to_1": 9391, "eval_accuracy": 0.9323, "eval_loss": 0.4110682010650635, "eval_runtime": 92.6993, "eval_samples_per_second": 215.751, "eval_steps_per_second": 13.484, "step": 8000 }, { "epoch": 8.01, "grad_norm": 95.66304016113281, "learning_rate": 5.17851851851852e-06, "loss": 0.05214024782180786, "step": 8010 }, { "epoch": 8.02, "grad_norm": 7.323845863342285, "learning_rate": 5.171111111111111e-06, "loss": 0.015108674764633179, "step": 8020 }, { "epoch": 8.02, "eval_0_to_0": 9529, "eval_0_to_1": 510, "eval_1_to_0": 828, "eval_1_to_1": 9133, "eval_accuracy": 0.9331, "eval_loss": 0.4435372054576874, "eval_runtime": 91.9167, "eval_samples_per_second": 217.588, "eval_steps_per_second": 13.599, "step": 8020 }, { "epoch": 8.03, "grad_norm": 0.01836836338043213, "learning_rate": 5.163703703703704e-06, "loss": 0.03085116744041443, "step": 8030 }, { "epoch": 8.04, "grad_norm": 0.016290441155433655, "learning_rate": 5.156296296296297e-06, "loss": 0.0775158703327179, "step": 8040 }, { "epoch": 8.04, "eval_0_to_0": 9530, "eval_0_to_1": 509, "eval_1_to_0": 837, "eval_1_to_1": 9124, "eval_accuracy": 0.9327, "eval_loss": 0.46469932794570923, "eval_runtime": 91.9992, "eval_samples_per_second": 217.393, "eval_steps_per_second": 13.587, "step": 8040 }, { "epoch": 8.05, "grad_norm": 22.005298614501953, "learning_rate": 5.1488888888888885e-06, "loss": 0.12467787265777588, "step": 8050 }, { "epoch": 8.06, "grad_norm": 0.020804161205887794, "learning_rate": 5.141481481481481e-06, "loss": 0.048396772146224974, "step": 8060 }, { "epoch": 8.06, "eval_0_to_0": 9285, "eval_0_to_1": 754, "eval_1_to_0": 556, "eval_1_to_1": 9405, "eval_accuracy": 0.9345, "eval_loss": 0.41823408007621765, "eval_runtime": 92.187, "eval_samples_per_second": 216.95, "eval_steps_per_second": 13.559, "step": 8060 }, { "epoch": 8.07, "grad_norm": 3.6732442378997803, "learning_rate": 5.134074074074075e-06, "loss": 0.11683740615844726, "step": 8070 }, { "epoch": 8.08, "grad_norm": 16.720630645751953, "learning_rate": 5.126666666666668e-06, "loss": 0.10792297124862671, "step": 8080 }, { "epoch": 8.08, "eval_0_to_0": 9518, "eval_0_to_1": 521, "eval_1_to_0": 816, "eval_1_to_1": 9145, "eval_accuracy": 0.93315, "eval_loss": 0.40978240966796875, "eval_runtime": 93.3611, "eval_samples_per_second": 214.222, "eval_steps_per_second": 13.389, "step": 8080 }, { "epoch": 8.09, "grad_norm": 0.06266198307275772, "learning_rate": 5.119259259259259e-06, "loss": 0.09858633279800415, "step": 8090 }, { "epoch": 8.1, "grad_norm": 0.35663551092147827, "learning_rate": 5.111851851851853e-06, "loss": 0.10696675777435302, "step": 8100 }, { "epoch": 8.1, "eval_0_to_0": 9336, "eval_0_to_1": 703, "eval_1_to_0": 615, "eval_1_to_1": 9346, "eval_accuracy": 0.9341, "eval_loss": 0.36031436920166016, "eval_runtime": 92.6779, "eval_samples_per_second": 215.801, "eval_steps_per_second": 13.488, "step": 8100 }, { "epoch": 8.11, "grad_norm": 8.324825286865234, "learning_rate": 5.1044444444444455e-06, "loss": 0.104362154006958, "step": 8110 }, { "epoch": 8.12, "grad_norm": 20.178983688354492, "learning_rate": 5.0970370370370374e-06, "loss": 0.15418758392333984, "step": 8120 }, { "epoch": 8.12, "eval_0_to_0": 9446, "eval_0_to_1": 593, "eval_1_to_0": 701, "eval_1_to_1": 9260, "eval_accuracy": 0.9353, "eval_loss": 0.3876294791698456, "eval_runtime": 93.9875, "eval_samples_per_second": 212.794, "eval_steps_per_second": 13.3, "step": 8120 }, { "epoch": 8.13, "grad_norm": 0.02725459821522236, "learning_rate": 5.08962962962963e-06, "loss": 0.004968344420194626, "step": 8130 }, { "epoch": 8.14, "grad_norm": 57.75223159790039, "learning_rate": 5.082222222222223e-06, "loss": 0.031175026297569276, "step": 8140 }, { "epoch": 8.14, "eval_0_to_0": 9478, "eval_0_to_1": 561, "eval_1_to_0": 760, "eval_1_to_1": 9201, "eval_accuracy": 0.93395, "eval_loss": 0.42212724685668945, "eval_runtime": 93.3794, "eval_samples_per_second": 214.18, "eval_steps_per_second": 13.386, "step": 8140 }, { "epoch": 8.15, "grad_norm": 17.948833465576172, "learning_rate": 5.074814814814816e-06, "loss": 0.06773221492767334, "step": 8150 }, { "epoch": 8.16, "grad_norm": 0.5203471779823303, "learning_rate": 5.067407407407408e-06, "loss": 0.11530669927597045, "step": 8160 }, { "epoch": 8.16, "eval_0_to_0": 9472, "eval_0_to_1": 567, "eval_1_to_0": 753, "eval_1_to_1": 9208, "eval_accuracy": 0.934, "eval_loss": 0.4364384710788727, "eval_runtime": 94.0808, "eval_samples_per_second": 212.583, "eval_steps_per_second": 13.286, "step": 8160 }, { "epoch": 8.17, "grad_norm": 0.04286449775099754, "learning_rate": 5.060000000000001e-06, "loss": 0.050340890884399414, "step": 8170 }, { "epoch": 8.18, "grad_norm": 0.1548864245414734, "learning_rate": 5.0525925925925935e-06, "loss": 0.10423105955123901, "step": 8180 }, { "epoch": 8.18, "eval_0_to_0": 9451, "eval_0_to_1": 588, "eval_1_to_0": 738, "eval_1_to_1": 9223, "eval_accuracy": 0.9337, "eval_loss": 0.43035897612571716, "eval_runtime": 93.8967, "eval_samples_per_second": 213.0, "eval_steps_per_second": 13.313, "step": 8180 }, { "epoch": 8.19, "grad_norm": 18.45691680908203, "learning_rate": 5.0451851851851855e-06, "loss": 0.16348179578781127, "step": 8190 }, { "epoch": 8.2, "grad_norm": 7.592238426208496, "learning_rate": 5.037777777777778e-06, "loss": 0.08608757853507995, "step": 8200 }, { "epoch": 8.2, "eval_0_to_0": 9275, "eval_0_to_1": 764, "eval_1_to_0": 569, "eval_1_to_1": 9392, "eval_accuracy": 0.93335, "eval_loss": 0.42467236518859863, "eval_runtime": 93.925, "eval_samples_per_second": 212.936, "eval_steps_per_second": 13.308, "step": 8200 }, { "epoch": 8.21, "grad_norm": 25.685617446899414, "learning_rate": 5.030370370370371e-06, "loss": 0.10015180110931396, "step": 8210 }, { "epoch": 8.22, "grad_norm": 0.5143706798553467, "learning_rate": 5.022962962962964e-06, "loss": 0.06283799409866334, "step": 8220 }, { "epoch": 8.22, "eval_0_to_0": 9326, "eval_0_to_1": 713, "eval_1_to_0": 601, "eval_1_to_1": 9360, "eval_accuracy": 0.9343, "eval_loss": 0.4258265495300293, "eval_runtime": 93.4998, "eval_samples_per_second": 213.904, "eval_steps_per_second": 13.369, "step": 8220 }, { "epoch": 8.23, "grad_norm": 0.019797716289758682, "learning_rate": 5.015555555555556e-06, "loss": 0.04744371473789215, "step": 8230 }, { "epoch": 8.24, "grad_norm": 0.011664895340800285, "learning_rate": 5.008148148148149e-06, "loss": 0.03684619069099426, "step": 8240 }, { "epoch": 8.24, "eval_0_to_0": 9452, "eval_0_to_1": 587, "eval_1_to_0": 709, "eval_1_to_1": 9252, "eval_accuracy": 0.9352, "eval_loss": 0.43925121426582336, "eval_runtime": 94.4222, "eval_samples_per_second": 211.815, "eval_steps_per_second": 13.238, "step": 8240 }, { "epoch": 8.25, "grad_norm": 0.018817884847521782, "learning_rate": 5.0007407407407416e-06, "loss": 0.046592137217521666, "step": 8250 }, { "epoch": 8.26, "grad_norm": 6.4147539138793945, "learning_rate": 4.9933333333333335e-06, "loss": 0.26133630275726316, "step": 8260 }, { "epoch": 8.26, "eval_0_to_0": 9449, "eval_0_to_1": 590, "eval_1_to_0": 695, "eval_1_to_1": 9266, "eval_accuracy": 0.93575, "eval_loss": 0.41609683632850647, "eval_runtime": 93.8292, "eval_samples_per_second": 213.153, "eval_steps_per_second": 13.322, "step": 8260 }, { "epoch": 8.27, "grad_norm": 0.6944484114646912, "learning_rate": 4.985925925925926e-06, "loss": 0.12085078954696656, "step": 8270 }, { "epoch": 8.28, "grad_norm": 0.029980899766087532, "learning_rate": 4.978518518518519e-06, "loss": 0.016715213656425476, "step": 8280 }, { "epoch": 8.28, "eval_0_to_0": 9376, "eval_0_to_1": 663, "eval_1_to_0": 621, "eval_1_to_1": 9340, "eval_accuracy": 0.9358, "eval_loss": 0.3876890540122986, "eval_runtime": 94.0575, "eval_samples_per_second": 212.636, "eval_steps_per_second": 13.29, "step": 8280 }, { "epoch": 8.29, "grad_norm": 0.038843583315610886, "learning_rate": 4.971111111111111e-06, "loss": 0.033573442697525026, "step": 8290 }, { "epoch": 8.3, "grad_norm": 0.019211310893297195, "learning_rate": 4.963703703703704e-06, "loss": 0.24271416664123535, "step": 8300 }, { "epoch": 8.3, "eval_0_to_0": 9435, "eval_0_to_1": 604, "eval_1_to_0": 695, "eval_1_to_1": 9266, "eval_accuracy": 0.93505, "eval_loss": 0.3939970135688782, "eval_runtime": 93.5884, "eval_samples_per_second": 213.702, "eval_steps_per_second": 13.356, "step": 8300 }, { "epoch": 8.31, "grad_norm": 0.060816314071416855, "learning_rate": 4.956296296296297e-06, "loss": 0.06294141411781311, "step": 8310 }, { "epoch": 8.32, "grad_norm": 0.19283832609653473, "learning_rate": 4.94888888888889e-06, "loss": 0.17308778762817384, "step": 8320 }, { "epoch": 8.32, "eval_0_to_0": 9518, "eval_0_to_1": 521, "eval_1_to_0": 792, "eval_1_to_1": 9169, "eval_accuracy": 0.93435, "eval_loss": 0.3833971619606018, "eval_runtime": 93.7965, "eval_samples_per_second": 213.228, "eval_steps_per_second": 13.327, "step": 8320 }, { "epoch": 8.33, "grad_norm": 0.6313427686691284, "learning_rate": 4.941481481481482e-06, "loss": 0.09381005764007569, "step": 8330 }, { "epoch": 8.34, "grad_norm": 0.059010762721300125, "learning_rate": 4.934074074074074e-06, "loss": 0.04046604931354523, "step": 8340 }, { "epoch": 8.34, "eval_0_to_0": 9446, "eval_0_to_1": 593, "eval_1_to_0": 700, "eval_1_to_1": 9261, "eval_accuracy": 0.93535, "eval_loss": 0.37181851267814636, "eval_runtime": 93.9732, "eval_samples_per_second": 212.827, "eval_steps_per_second": 13.302, "step": 8340 }, { "epoch": 8.35, "grad_norm": 1.283286213874817, "learning_rate": 4.926666666666667e-06, "loss": 0.08523943424224853, "step": 8350 }, { "epoch": 8.36, "grad_norm": 0.09640305489301682, "learning_rate": 4.91925925925926e-06, "loss": 0.1154876708984375, "step": 8360 }, { "epoch": 8.36, "eval_0_to_0": 9430, "eval_0_to_1": 609, "eval_1_to_0": 676, "eval_1_to_1": 9285, "eval_accuracy": 0.93575, "eval_loss": 0.3804360628128052, "eval_runtime": 93.8123, "eval_samples_per_second": 213.192, "eval_steps_per_second": 13.324, "step": 8360 }, { "epoch": 8.37, "grad_norm": 0.031667616218328476, "learning_rate": 4.911851851851852e-06, "loss": 0.02493678331375122, "step": 8370 }, { "epoch": 8.38, "grad_norm": 16.843626022338867, "learning_rate": 4.904444444444445e-06, "loss": 0.06576581597328186, "step": 8380 }, { "epoch": 8.38, "eval_0_to_0": 9443, "eval_0_to_1": 596, "eval_1_to_0": 696, "eval_1_to_1": 9265, "eval_accuracy": 0.9354, "eval_loss": 0.40820103883743286, "eval_runtime": 92.6282, "eval_samples_per_second": 215.917, "eval_steps_per_second": 13.495, "step": 8380 }, { "epoch": 8.39, "grad_norm": 0.01944066770374775, "learning_rate": 4.897037037037038e-06, "loss": 0.02921442687511444, "step": 8390 }, { "epoch": 8.4, "grad_norm": 0.05076967552304268, "learning_rate": 4.8896296296296305e-06, "loss": 0.18757528066635132, "step": 8400 }, { "epoch": 8.4, "eval_0_to_0": 9429, "eval_0_to_1": 610, "eval_1_to_0": 672, "eval_1_to_1": 9289, "eval_accuracy": 0.9359, "eval_loss": 0.4140012562274933, "eval_runtime": 93.6213, "eval_samples_per_second": 213.627, "eval_steps_per_second": 13.352, "step": 8400 }, { "epoch": 8.41, "grad_norm": 0.2520618736743927, "learning_rate": 4.8822222222222224e-06, "loss": 0.1087133526802063, "step": 8410 }, { "epoch": 8.42, "grad_norm": 0.0450657494366169, "learning_rate": 4.874814814814815e-06, "loss": 0.1601580023765564, "step": 8420 }, { "epoch": 8.42, "eval_0_to_0": 9409, "eval_0_to_1": 630, "eval_1_to_0": 663, "eval_1_to_1": 9298, "eval_accuracy": 0.93535, "eval_loss": 0.39020660519599915, "eval_runtime": 93.1465, "eval_samples_per_second": 214.716, "eval_steps_per_second": 13.42, "step": 8420 }, { "epoch": 8.43, "grad_norm": 2.871760368347168, "learning_rate": 4.867407407407408e-06, "loss": 0.21497507095336915, "step": 8430 }, { "epoch": 8.44, "grad_norm": 0.11523840576410294, "learning_rate": 4.86e-06, "loss": 0.1339960813522339, "step": 8440 }, { "epoch": 8.44, "eval_0_to_0": 9584, "eval_0_to_1": 455, "eval_1_to_0": 858, "eval_1_to_1": 9103, "eval_accuracy": 0.93435, "eval_loss": 0.3946479558944702, "eval_runtime": 92.5352, "eval_samples_per_second": 216.134, "eval_steps_per_second": 13.508, "step": 8440 }, { "epoch": 8.45, "grad_norm": 0.12979498505592346, "learning_rate": 4.852592592592593e-06, "loss": 0.18212130069732665, "step": 8450 }, { "epoch": 8.46, "grad_norm": 4.566530227661133, "learning_rate": 4.845185185185186e-06, "loss": 0.14857351779937744, "step": 8460 }, { "epoch": 8.46, "eval_0_to_0": 9312, "eval_0_to_1": 727, "eval_1_to_0": 590, "eval_1_to_1": 9371, "eval_accuracy": 0.93415, "eval_loss": 0.3618268668651581, "eval_runtime": 91.8531, "eval_samples_per_second": 217.739, "eval_steps_per_second": 13.609, "step": 8460 }, { "epoch": 8.47, "grad_norm": 0.13161860406398773, "learning_rate": 4.837777777777778e-06, "loss": 0.060126090049743654, "step": 8470 }, { "epoch": 8.48, "grad_norm": 0.10419636219739914, "learning_rate": 4.8303703703703705e-06, "loss": 0.006725540757179261, "step": 8480 }, { "epoch": 8.48, "eval_0_to_0": 9524, "eval_0_to_1": 515, "eval_1_to_0": 773, "eval_1_to_1": 9188, "eval_accuracy": 0.9356, "eval_loss": 0.40630292892456055, "eval_runtime": 92.7211, "eval_samples_per_second": 215.701, "eval_steps_per_second": 13.481, "step": 8480 }, { "epoch": 8.49, "grad_norm": 0.02278752066195011, "learning_rate": 4.822962962962963e-06, "loss": 0.032081395387649536, "step": 8490 }, { "epoch": 8.5, "grad_norm": 49.427303314208984, "learning_rate": 4.815555555555556e-06, "loss": 0.0249783918261528, "step": 8500 }, { "epoch": 8.5, "eval_0_to_0": 9397, "eval_0_to_1": 642, "eval_1_to_0": 644, "eval_1_to_1": 9317, "eval_accuracy": 0.9357, "eval_loss": 0.4140169024467468, "eval_runtime": 93.0496, "eval_samples_per_second": 214.939, "eval_steps_per_second": 13.434, "step": 8500 }, { "epoch": 8.51, "grad_norm": 0.021286573261022568, "learning_rate": 4.808148148148148e-06, "loss": 0.008033148199319839, "step": 8510 }, { "epoch": 8.52, "grad_norm": 0.022754637524485588, "learning_rate": 4.800740740740742e-06, "loss": 0.06419197916984558, "step": 8520 }, { "epoch": 8.52, "eval_0_to_0": 9482, "eval_0_to_1": 557, "eval_1_to_0": 719, "eval_1_to_1": 9242, "eval_accuracy": 0.9362, "eval_loss": 0.4407358765602112, "eval_runtime": 92.1073, "eval_samples_per_second": 217.138, "eval_steps_per_second": 13.571, "step": 8520 }, { "epoch": 8.53, "grad_norm": 0.18050174415111542, "learning_rate": 4.793333333333334e-06, "loss": 0.14807618856430055, "step": 8530 }, { "epoch": 8.54, "grad_norm": 0.02697792835533619, "learning_rate": 4.785925925925926e-06, "loss": 0.004927684366703033, "step": 8540 }, { "epoch": 8.54, "eval_0_to_0": 9507, "eval_0_to_1": 532, "eval_1_to_0": 747, "eval_1_to_1": 9214, "eval_accuracy": 0.93605, "eval_loss": 0.4361318349838257, "eval_runtime": 92.2462, "eval_samples_per_second": 216.811, "eval_steps_per_second": 13.551, "step": 8540 }, { "epoch": 8.55, "grad_norm": 20.375595092773438, "learning_rate": 4.778518518518519e-06, "loss": 0.06316580772399902, "step": 8550 }, { "epoch": 8.56, "grad_norm": 0.021177120506763458, "learning_rate": 4.771111111111111e-06, "loss": 0.021351510286331178, "step": 8560 }, { "epoch": 8.56, "eval_0_to_0": 9549, "eval_0_to_1": 490, "eval_1_to_0": 805, "eval_1_to_1": 9156, "eval_accuracy": 0.93525, "eval_loss": 0.4548335373401642, "eval_runtime": 93.009, "eval_samples_per_second": 215.033, "eval_steps_per_second": 13.44, "step": 8560 }, { "epoch": 8.57, "grad_norm": 21.519405364990234, "learning_rate": 4.763703703703704e-06, "loss": 0.06949214339256286, "step": 8570 }, { "epoch": 8.58, "grad_norm": 43.971981048583984, "learning_rate": 4.756296296296297e-06, "loss": 0.1761234164237976, "step": 8580 }, { "epoch": 8.58, "eval_0_to_0": 9307, "eval_0_to_1": 732, "eval_1_to_0": 560, "eval_1_to_1": 9401, "eval_accuracy": 0.9354, "eval_loss": 0.4369303584098816, "eval_runtime": 92.0562, "eval_samples_per_second": 217.259, "eval_steps_per_second": 13.579, "step": 8580 }, { "epoch": 8.59, "grad_norm": 3.935023307800293, "learning_rate": 4.74888888888889e-06, "loss": 0.06293410062789917, "step": 8590 }, { "epoch": 8.6, "grad_norm": 0.09330309182405472, "learning_rate": 4.741481481481482e-06, "loss": 0.038195240497589114, "step": 8600 }, { "epoch": 8.6, "eval_0_to_0": 9504, "eval_0_to_1": 535, "eval_1_to_0": 737, "eval_1_to_1": 9224, "eval_accuracy": 0.9364, "eval_loss": 0.44049564003944397, "eval_runtime": 93.0358, "eval_samples_per_second": 214.971, "eval_steps_per_second": 13.436, "step": 8600 }, { "epoch": 8.61, "grad_norm": 32.04252243041992, "learning_rate": 4.734074074074075e-06, "loss": 0.09978620409965515, "step": 8610 }, { "epoch": 8.62, "grad_norm": 0.0314035639166832, "learning_rate": 4.7266666666666674e-06, "loss": 0.027844995260238647, "step": 8620 }, { "epoch": 8.62, "eval_0_to_0": 9464, "eval_0_to_1": 575, "eval_1_to_0": 719, "eval_1_to_1": 9242, "eval_accuracy": 0.9353, "eval_loss": 0.4336124062538147, "eval_runtime": 92.9799, "eval_samples_per_second": 215.1, "eval_steps_per_second": 13.444, "step": 8620 }, { "epoch": 8.63, "grad_norm": 0.20905065536499023, "learning_rate": 4.719259259259259e-06, "loss": 0.12646983861923217, "step": 8630 }, { "epoch": 8.64, "grad_norm": 0.06560508906841278, "learning_rate": 4.711851851851852e-06, "loss": 0.07045324444770813, "step": 8640 }, { "epoch": 8.64, "eval_0_to_0": 9495, "eval_0_to_1": 544, "eval_1_to_0": 768, "eval_1_to_1": 9193, "eval_accuracy": 0.9344, "eval_loss": 0.42353203892707825, "eval_runtime": 93.3148, "eval_samples_per_second": 214.328, "eval_steps_per_second": 13.396, "step": 8640 }, { "epoch": 8.65, "grad_norm": 0.647568941116333, "learning_rate": 4.704444444444445e-06, "loss": 0.04913415908813477, "step": 8650 }, { "epoch": 8.66, "grad_norm": 0.046795111149549484, "learning_rate": 4.697037037037037e-06, "loss": 0.09028835892677307, "step": 8660 }, { "epoch": 8.66, "eval_0_to_0": 9369, "eval_0_to_1": 670, "eval_1_to_0": 660, "eval_1_to_1": 9301, "eval_accuracy": 0.9335, "eval_loss": 0.4275696873664856, "eval_runtime": 92.7157, "eval_samples_per_second": 215.713, "eval_steps_per_second": 13.482, "step": 8660 }, { "epoch": 8.67, "grad_norm": 0.021591750904917717, "learning_rate": 4.68962962962963e-06, "loss": 0.11379988193511963, "step": 8670 }, { "epoch": 8.68, "grad_norm": 0.1371515542268753, "learning_rate": 4.682222222222223e-06, "loss": 0.02256028950214386, "step": 8680 }, { "epoch": 8.68, "eval_0_to_0": 9437, "eval_0_to_1": 602, "eval_1_to_0": 674, "eval_1_to_1": 9287, "eval_accuracy": 0.9362, "eval_loss": 0.418317586183548, "eval_runtime": 90.5674, "eval_samples_per_second": 220.83, "eval_steps_per_second": 13.802, "step": 8680 }, { "epoch": 8.69, "grad_norm": 0.010555029846727848, "learning_rate": 4.6748148148148155e-06, "loss": 0.07735119462013244, "step": 8690 }, { "epoch": 8.7, "grad_norm": 0.11483616381883621, "learning_rate": 4.6674074074074075e-06, "loss": 0.1908152461051941, "step": 8700 }, { "epoch": 8.7, "eval_0_to_0": 9646, "eval_0_to_1": 393, "eval_1_to_0": 961, "eval_1_to_1": 9000, "eval_accuracy": 0.9323, "eval_loss": 0.4658186137676239, "eval_runtime": 92.7889, "eval_samples_per_second": 215.543, "eval_steps_per_second": 13.471, "step": 8700 }, { "epoch": 8.71, "grad_norm": 1.0230069160461426, "learning_rate": 4.66e-06, "loss": 0.11074630022048951, "step": 8710 }, { "epoch": 8.72, "grad_norm": 3.4864022731781006, "learning_rate": 4.652592592592593e-06, "loss": 0.09862948656082153, "step": 8720 }, { "epoch": 8.72, "eval_0_to_0": 9466, "eval_0_to_1": 573, "eval_1_to_0": 721, "eval_1_to_1": 9240, "eval_accuracy": 0.9353, "eval_loss": 0.4091320335865021, "eval_runtime": 92.6364, "eval_samples_per_second": 215.898, "eval_steps_per_second": 13.494, "step": 8720 }, { "epoch": 8.73, "grad_norm": 0.06559723615646362, "learning_rate": 4.645185185185185e-06, "loss": 0.04457792639732361, "step": 8730 }, { "epoch": 8.74, "grad_norm": 0.24163813889026642, "learning_rate": 4.637777777777778e-06, "loss": 0.052196729183197024, "step": 8740 }, { "epoch": 8.74, "eval_0_to_0": 9571, "eval_0_to_1": 468, "eval_1_to_0": 884, "eval_1_to_1": 9077, "eval_accuracy": 0.9324, "eval_loss": 0.40703141689300537, "eval_runtime": 93.5093, "eval_samples_per_second": 213.883, "eval_steps_per_second": 13.368, "step": 8740 }, { "epoch": 8.75, "grad_norm": 49.37374496459961, "learning_rate": 4.630370370370371e-06, "loss": 0.0904555857181549, "step": 8750 }, { "epoch": 8.76, "grad_norm": 23.05645179748535, "learning_rate": 4.6229629629629635e-06, "loss": 0.1364337682723999, "step": 8760 }, { "epoch": 8.76, "eval_0_to_0": 9383, "eval_0_to_1": 656, "eval_1_to_0": 653, "eval_1_to_1": 9308, "eval_accuracy": 0.93455, "eval_loss": 0.4032471776008606, "eval_runtime": 93.5848, "eval_samples_per_second": 213.71, "eval_steps_per_second": 13.357, "step": 8760 }, { "epoch": 8.77, "grad_norm": 0.5725924968719482, "learning_rate": 4.6155555555555555e-06, "loss": 0.0291716068983078, "step": 8770 }, { "epoch": 8.78, "grad_norm": 0.03627276048064232, "learning_rate": 4.608148148148148e-06, "loss": 0.03740999698638916, "step": 8780 }, { "epoch": 8.78, "eval_0_to_0": 9475, "eval_0_to_1": 564, "eval_1_to_0": 769, "eval_1_to_1": 9192, "eval_accuracy": 0.93335, "eval_loss": 0.43220365047454834, "eval_runtime": 93.3864, "eval_samples_per_second": 214.164, "eval_steps_per_second": 13.385, "step": 8780 }, { "epoch": 8.79, "grad_norm": 0.8905227780342102, "learning_rate": 4.600740740740741e-06, "loss": 0.0344774067401886, "step": 8790 }, { "epoch": 8.8, "grad_norm": 0.022729480639100075, "learning_rate": 4.593333333333333e-06, "loss": 0.07579755783081055, "step": 8800 }, { "epoch": 8.8, "eval_0_to_0": 9330, "eval_0_to_1": 709, "eval_1_to_0": 605, "eval_1_to_1": 9356, "eval_accuracy": 0.9343, "eval_loss": 0.4361327290534973, "eval_runtime": 91.7387, "eval_samples_per_second": 218.011, "eval_steps_per_second": 13.626, "step": 8800 }, { "epoch": 8.81, "grad_norm": 0.5570326447486877, "learning_rate": 4.585925925925927e-06, "loss": 0.08043375611305237, "step": 8810 }, { "epoch": 8.82, "grad_norm": 34.81125259399414, "learning_rate": 4.578518518518519e-06, "loss": 0.03199209868907928, "step": 8820 }, { "epoch": 8.82, "eval_0_to_0": 9444, "eval_0_to_1": 595, "eval_1_to_0": 714, "eval_1_to_1": 9247, "eval_accuracy": 0.93455, "eval_loss": 0.4394899010658264, "eval_runtime": 92.4501, "eval_samples_per_second": 216.333, "eval_steps_per_second": 13.521, "step": 8820 }, { "epoch": 8.83, "grad_norm": 0.6370372176170349, "learning_rate": 4.571111111111112e-06, "loss": 0.11574833393096924, "step": 8830 }, { "epoch": 8.84, "grad_norm": 50.008079528808594, "learning_rate": 4.563703703703704e-06, "loss": 0.04036916196346283, "step": 8840 }, { "epoch": 8.84, "eval_0_to_0": 9480, "eval_0_to_1": 559, "eval_1_to_0": 752, "eval_1_to_1": 9209, "eval_accuracy": 0.93445, "eval_loss": 0.43981611728668213, "eval_runtime": 91.3131, "eval_samples_per_second": 219.027, "eval_steps_per_second": 13.689, "step": 8840 }, { "epoch": 8.85, "grad_norm": 0.02098100073635578, "learning_rate": 4.556296296296296e-06, "loss": 0.11416983604431152, "step": 8850 }, { "epoch": 8.86, "grad_norm": 0.023428304120898247, "learning_rate": 4.548888888888889e-06, "loss": 0.16090387105941772, "step": 8860 }, { "epoch": 8.86, "eval_0_to_0": 9267, "eval_0_to_1": 772, "eval_1_to_0": 559, "eval_1_to_1": 9402, "eval_accuracy": 0.93345, "eval_loss": 0.4334752857685089, "eval_runtime": 91.8224, "eval_samples_per_second": 217.812, "eval_steps_per_second": 13.613, "step": 8860 }, { "epoch": 8.87, "grad_norm": 0.06362823396921158, "learning_rate": 4.541481481481482e-06, "loss": 0.13441052436828613, "step": 8870 }, { "epoch": 8.88, "grad_norm": 0.1639249324798584, "learning_rate": 4.534074074074075e-06, "loss": 0.04966021478176117, "step": 8880 }, { "epoch": 8.88, "eval_0_to_0": 9596, "eval_0_to_1": 443, "eval_1_to_0": 884, "eval_1_to_1": 9077, "eval_accuracy": 0.93365, "eval_loss": 0.44888925552368164, "eval_runtime": 93.1403, "eval_samples_per_second": 214.73, "eval_steps_per_second": 13.421, "step": 8880 }, { "epoch": 8.89, "grad_norm": 4.453224182128906, "learning_rate": 4.526666666666667e-06, "loss": 0.05992469787597656, "step": 8890 }, { "epoch": 8.9, "grad_norm": 1.3709988594055176, "learning_rate": 4.51925925925926e-06, "loss": 0.10515556335449219, "step": 8900 }, { "epoch": 8.9, "eval_0_to_0": 9436, "eval_0_to_1": 603, "eval_1_to_0": 692, "eval_1_to_1": 9269, "eval_accuracy": 0.93525, "eval_loss": 0.4261397421360016, "eval_runtime": 93.4959, "eval_samples_per_second": 213.913, "eval_steps_per_second": 13.37, "step": 8900 }, { "epoch": 8.91, "grad_norm": 1.470996379852295, "learning_rate": 4.5118518518518524e-06, "loss": 0.06508074998855591, "step": 8910 }, { "epoch": 8.92, "grad_norm": 10.61303997039795, "learning_rate": 4.504444444444444e-06, "loss": 0.08794039487838745, "step": 8920 }, { "epoch": 8.92, "eval_0_to_0": 9568, "eval_0_to_1": 471, "eval_1_to_0": 827, "eval_1_to_1": 9134, "eval_accuracy": 0.9351, "eval_loss": 0.44898927211761475, "eval_runtime": 91.3594, "eval_samples_per_second": 218.916, "eval_steps_per_second": 13.682, "step": 8920 }, { "epoch": 8.93, "grad_norm": 26.09644889831543, "learning_rate": 4.497037037037037e-06, "loss": 0.09527374505996704, "step": 8930 }, { "epoch": 8.94, "grad_norm": 8.369417190551758, "learning_rate": 4.48962962962963e-06, "loss": 0.08992313742637634, "step": 8940 }, { "epoch": 8.94, "eval_0_to_0": 9438, "eval_0_to_1": 601, "eval_1_to_0": 672, "eval_1_to_1": 9289, "eval_accuracy": 0.93635, "eval_loss": 0.4238879978656769, "eval_runtime": 92.3239, "eval_samples_per_second": 216.629, "eval_steps_per_second": 13.539, "step": 8940 }, { "epoch": 8.95, "grad_norm": 26.197500228881836, "learning_rate": 4.482222222222223e-06, "loss": 0.08664152622222901, "step": 8950 }, { "epoch": 8.96, "grad_norm": 0.03515566885471344, "learning_rate": 4.474814814814815e-06, "loss": 0.04896900355815888, "step": 8960 }, { "epoch": 8.96, "eval_0_to_0": 9483, "eval_0_to_1": 556, "eval_1_to_0": 723, "eval_1_to_1": 9238, "eval_accuracy": 0.93605, "eval_loss": 0.4244285523891449, "eval_runtime": 92.1975, "eval_samples_per_second": 216.926, "eval_steps_per_second": 13.558, "step": 8960 }, { "epoch": 8.97, "grad_norm": 0.5145961046218872, "learning_rate": 4.467407407407408e-06, "loss": 0.11290903091430664, "step": 8970 }, { "epoch": 8.98, "grad_norm": 0.7277855277061462, "learning_rate": 4.4600000000000005e-06, "loss": 0.017337454855442046, "step": 8980 }, { "epoch": 8.98, "eval_0_to_0": 9442, "eval_0_to_1": 597, "eval_1_to_0": 700, "eval_1_to_1": 9261, "eval_accuracy": 0.93515, "eval_loss": 0.4204281270503998, "eval_runtime": 92.6212, "eval_samples_per_second": 215.933, "eval_steps_per_second": 13.496, "step": 8980 }, { "epoch": 8.99, "grad_norm": 89.8812484741211, "learning_rate": 4.4525925925925925e-06, "loss": 0.06948169469833373, "step": 8990 }, { "epoch": 9.0, "grad_norm": 0.05756022036075592, "learning_rate": 4.445185185185185e-06, "loss": 0.013305923342704773, "step": 9000 }, { "epoch": 9.0, "eval_0_to_0": 9522, "eval_0_to_1": 517, "eval_1_to_0": 810, "eval_1_to_1": 9151, "eval_accuracy": 0.93365, "eval_loss": 0.4524049758911133, "eval_runtime": 91.7015, "eval_samples_per_second": 218.099, "eval_steps_per_second": 13.631, "step": 9000 }, { "epoch": 9.01, "grad_norm": 23.715185165405273, "learning_rate": 4.437777777777778e-06, "loss": 0.17529966831207275, "step": 9010 }, { "epoch": 9.02, "grad_norm": 17.1651611328125, "learning_rate": 4.430370370370371e-06, "loss": 0.04054993391036987, "step": 9020 }, { "epoch": 9.02, "eval_0_to_0": 9309, "eval_0_to_1": 730, "eval_1_to_0": 589, "eval_1_to_1": 9372, "eval_accuracy": 0.93405, "eval_loss": 0.41438281536102295, "eval_runtime": 92.4928, "eval_samples_per_second": 216.233, "eval_steps_per_second": 13.515, "step": 9020 }, { "epoch": 9.03, "grad_norm": 8.165834426879883, "learning_rate": 4.422962962962964e-06, "loss": 0.040076008439064024, "step": 9030 }, { "epoch": 9.04, "grad_norm": 0.1872337907552719, "learning_rate": 4.415555555555556e-06, "loss": 0.00666632354259491, "step": 9040 }, { "epoch": 9.04, "eval_0_to_0": 9470, "eval_0_to_1": 569, "eval_1_to_0": 722, "eval_1_to_1": 9239, "eval_accuracy": 0.93545, "eval_loss": 0.4282764196395874, "eval_runtime": 93.2935, "eval_samples_per_second": 214.377, "eval_steps_per_second": 13.399, "step": 9040 }, { "epoch": 9.05, "grad_norm": 0.011608686298131943, "learning_rate": 4.4081481481481485e-06, "loss": 0.006823042780160904, "step": 9050 }, { "epoch": 9.06, "grad_norm": 29.498563766479492, "learning_rate": 4.400740740740741e-06, "loss": 0.06289355158805847, "step": 9060 }, { "epoch": 9.06, "eval_0_to_0": 9561, "eval_0_to_1": 478, "eval_1_to_0": 838, "eval_1_to_1": 9123, "eval_accuracy": 0.9342, "eval_loss": 0.46977564692497253, "eval_runtime": 93.9268, "eval_samples_per_second": 212.932, "eval_steps_per_second": 13.308, "step": 9060 }, { "epoch": 9.07, "grad_norm": 1.6494626998901367, "learning_rate": 4.393333333333334e-06, "loss": 0.07806366682052612, "step": 9070 }, { "epoch": 9.08, "grad_norm": 18.072933197021484, "learning_rate": 4.385925925925926e-06, "loss": 0.05189768075942993, "step": 9080 }, { "epoch": 9.08, "eval_0_to_0": 9466, "eval_0_to_1": 573, "eval_1_to_0": 735, "eval_1_to_1": 9226, "eval_accuracy": 0.9346, "eval_loss": 0.45175838470458984, "eval_runtime": 93.4934, "eval_samples_per_second": 213.919, "eval_steps_per_second": 13.37, "step": 9080 }, { "epoch": 9.09, "grad_norm": 10.213774681091309, "learning_rate": 4.378518518518519e-06, "loss": 0.009520862996578217, "step": 9090 }, { "epoch": 9.1, "grad_norm": 9.454246520996094, "learning_rate": 4.371111111111112e-06, "loss": 0.05361487865447998, "step": 9100 }, { "epoch": 9.1, "eval_0_to_0": 9489, "eval_0_to_1": 550, "eval_1_to_0": 736, "eval_1_to_1": 9225, "eval_accuracy": 0.9357, "eval_loss": 0.4607219696044922, "eval_runtime": 92.2864, "eval_samples_per_second": 216.717, "eval_steps_per_second": 13.545, "step": 9100 }, { "epoch": 9.11, "grad_norm": 0.09214556217193604, "learning_rate": 4.363703703703704e-06, "loss": 0.030974435806274413, "step": 9110 }, { "epoch": 9.12, "grad_norm": 0.09187602996826172, "learning_rate": 4.356296296296297e-06, "loss": 0.04336623251438141, "step": 9120 }, { "epoch": 9.12, "eval_0_to_0": 9382, "eval_0_to_1": 657, "eval_1_to_0": 628, "eval_1_to_1": 9333, "eval_accuracy": 0.93575, "eval_loss": 0.4489728510379791, "eval_runtime": 92.4197, "eval_samples_per_second": 216.404, "eval_steps_per_second": 13.525, "step": 9120 }, { "epoch": 9.13, "grad_norm": 37.713905334472656, "learning_rate": 4.348888888888889e-06, "loss": 0.0255010187625885, "step": 9130 }, { "epoch": 9.14, "grad_norm": 11.969860076904297, "learning_rate": 4.341481481481482e-06, "loss": 0.09682964086532593, "step": 9140 }, { "epoch": 9.14, "eval_0_to_0": 9573, "eval_0_to_1": 466, "eval_1_to_0": 910, "eval_1_to_1": 9051, "eval_accuracy": 0.9312, "eval_loss": 0.5043309926986694, "eval_runtime": 92.4047, "eval_samples_per_second": 216.439, "eval_steps_per_second": 13.527, "step": 9140 }, { "epoch": 9.15, "grad_norm": 0.03890665993094444, "learning_rate": 4.334074074074074e-06, "loss": 0.07830659747123718, "step": 9150 }, { "epoch": 9.16, "grad_norm": 0.009461983107030392, "learning_rate": 4.326666666666667e-06, "loss": 0.051520466804504395, "step": 9160 }, { "epoch": 9.16, "eval_0_to_0": 9440, "eval_0_to_1": 599, "eval_1_to_0": 736, "eval_1_to_1": 9225, "eval_accuracy": 0.93325, "eval_loss": 0.4718877971172333, "eval_runtime": 91.7375, "eval_samples_per_second": 218.013, "eval_steps_per_second": 13.626, "step": 9160 }, { "epoch": 9.17, "grad_norm": 26.17775535583496, "learning_rate": 4.31925925925926e-06, "loss": 0.0945026159286499, "step": 9170 }, { "epoch": 9.18, "grad_norm": 0.16353784501552582, "learning_rate": 4.311851851851852e-06, "loss": 0.1121518611907959, "step": 9180 }, { "epoch": 9.18, "eval_0_to_0": 9570, "eval_0_to_1": 469, "eval_1_to_0": 913, "eval_1_to_1": 9048, "eval_accuracy": 0.9309, "eval_loss": 0.4968145489692688, "eval_runtime": 91.7331, "eval_samples_per_second": 218.024, "eval_steps_per_second": 13.626, "step": 9180 }, { "epoch": 9.19, "grad_norm": 6.256767272949219, "learning_rate": 4.304444444444445e-06, "loss": 0.10497798919677734, "step": 9190 }, { "epoch": 9.2, "grad_norm": 0.051196806132793427, "learning_rate": 4.2970370370370375e-06, "loss": 0.05336521863937378, "step": 9200 }, { "epoch": 9.2, "eval_0_to_0": 9294, "eval_0_to_1": 745, "eval_1_to_0": 574, "eval_1_to_1": 9387, "eval_accuracy": 0.93405, "eval_loss": 0.4280942380428314, "eval_runtime": 91.1205, "eval_samples_per_second": 219.489, "eval_steps_per_second": 13.718, "step": 9200 }, { "epoch": 9.21, "grad_norm": 12.329030990600586, "learning_rate": 4.28962962962963e-06, "loss": 0.09339405298233032, "step": 9210 }, { "epoch": 9.22, "grad_norm": 11.608688354492188, "learning_rate": 4.282222222222222e-06, "loss": 0.1000781536102295, "step": 9220 }, { "epoch": 9.22, "eval_0_to_0": 9495, "eval_0_to_1": 544, "eval_1_to_0": 778, "eval_1_to_1": 9183, "eval_accuracy": 0.9339, "eval_loss": 0.4577655792236328, "eval_runtime": 90.3652, "eval_samples_per_second": 221.324, "eval_steps_per_second": 13.833, "step": 9220 }, { "epoch": 9.23, "grad_norm": 0.05642690882086754, "learning_rate": 4.274814814814815e-06, "loss": 0.017809668183326723, "step": 9230 }, { "epoch": 9.24, "grad_norm": 0.041361887007951736, "learning_rate": 4.267407407407408e-06, "loss": 0.017308494448661803, "step": 9240 }, { "epoch": 9.24, "eval_0_to_0": 9417, "eval_0_to_1": 622, "eval_1_to_0": 670, "eval_1_to_1": 9291, "eval_accuracy": 0.9354, "eval_loss": 0.44168901443481445, "eval_runtime": 91.8963, "eval_samples_per_second": 217.637, "eval_steps_per_second": 13.602, "step": 9240 }, { "epoch": 9.25, "grad_norm": 0.012964296154677868, "learning_rate": 4.26e-06, "loss": 0.07549129128456115, "step": 9250 }, { "epoch": 9.26, "grad_norm": 0.20590780675411224, "learning_rate": 4.2525925925925935e-06, "loss": 0.1596836805343628, "step": 9260 }, { "epoch": 9.26, "eval_0_to_0": 9428, "eval_0_to_1": 611, "eval_1_to_0": 693, "eval_1_to_1": 9268, "eval_accuracy": 0.9348, "eval_loss": 0.4480459988117218, "eval_runtime": 90.9557, "eval_samples_per_second": 219.887, "eval_steps_per_second": 13.743, "step": 9260 }, { "epoch": 9.27, "grad_norm": 19.89851951599121, "learning_rate": 4.2451851851851855e-06, "loss": 0.04915849268436432, "step": 9270 }, { "epoch": 9.28, "grad_norm": 0.0151065057143569, "learning_rate": 4.2377777777777775e-06, "loss": 0.05664674639701843, "step": 9280 }, { "epoch": 9.28, "eval_0_to_0": 9411, "eval_0_to_1": 628, "eval_1_to_0": 680, "eval_1_to_1": 9281, "eval_accuracy": 0.9346, "eval_loss": 0.45141708850860596, "eval_runtime": 92.2331, "eval_samples_per_second": 216.842, "eval_steps_per_second": 13.553, "step": 9280 }, { "epoch": 9.29, "grad_norm": 9.803900718688965, "learning_rate": 4.230370370370371e-06, "loss": 0.013882097601890565, "step": 9290 }, { "epoch": 9.3, "grad_norm": 0.048922955989837646, "learning_rate": 4.222962962962963e-06, "loss": 0.10435889959335327, "step": 9300 }, { "epoch": 9.3, "eval_0_to_0": 9402, "eval_0_to_1": 637, "eval_1_to_0": 677, "eval_1_to_1": 9284, "eval_accuracy": 0.9343, "eval_loss": 0.451600581407547, "eval_runtime": 91.8664, "eval_samples_per_second": 217.708, "eval_steps_per_second": 13.607, "step": 9300 }, { "epoch": 9.31, "grad_norm": 31.480499267578125, "learning_rate": 4.215555555555556e-06, "loss": 0.08188260197639466, "step": 9310 }, { "epoch": 9.32, "grad_norm": 0.011472636833786964, "learning_rate": 4.208148148148149e-06, "loss": 0.0046682566404342655, "step": 9320 }, { "epoch": 9.32, "eval_0_to_0": 9609, "eval_0_to_1": 430, "eval_1_to_0": 912, "eval_1_to_1": 9049, "eval_accuracy": 0.9329, "eval_loss": 0.4897388815879822, "eval_runtime": 93.128, "eval_samples_per_second": 214.758, "eval_steps_per_second": 13.422, "step": 9320 }, { "epoch": 9.33, "grad_norm": 0.27396124601364136, "learning_rate": 4.200740740740742e-06, "loss": 0.08211560845375061, "step": 9330 }, { "epoch": 9.34, "grad_norm": 20.97091293334961, "learning_rate": 4.1933333333333336e-06, "loss": 0.035475289821624754, "step": 9340 }, { "epoch": 9.34, "eval_0_to_0": 9482, "eval_0_to_1": 557, "eval_1_to_0": 743, "eval_1_to_1": 9218, "eval_accuracy": 0.935, "eval_loss": 0.4500306248664856, "eval_runtime": 96.8486, "eval_samples_per_second": 206.508, "eval_steps_per_second": 12.907, "step": 9340 }, { "epoch": 9.35, "grad_norm": 1.745186686515808, "learning_rate": 4.185925925925926e-06, "loss": 0.10070270299911499, "step": 9350 }, { "epoch": 9.36, "grad_norm": 25.899364471435547, "learning_rate": 4.178518518518519e-06, "loss": 0.00628800243139267, "step": 9360 }, { "epoch": 9.36, "eval_0_to_0": 9387, "eval_0_to_1": 652, "eval_1_to_0": 635, "eval_1_to_1": 9326, "eval_accuracy": 0.93565, "eval_loss": 0.4344092309474945, "eval_runtime": 114.8419, "eval_samples_per_second": 174.153, "eval_steps_per_second": 10.885, "step": 9360 }, { "epoch": 9.37, "grad_norm": 0.009589385241270065, "learning_rate": 4.171111111111111e-06, "loss": 0.062020570039749146, "step": 9370 }, { "epoch": 9.38, "grad_norm": 26.72266960144043, "learning_rate": 4.163703703703704e-06, "loss": 0.0318879097700119, "step": 9380 }, { "epoch": 9.38, "eval_0_to_0": 9434, "eval_0_to_1": 605, "eval_1_to_0": 691, "eval_1_to_1": 9270, "eval_accuracy": 0.9352, "eval_loss": 0.4407658278942108, "eval_runtime": 92.6292, "eval_samples_per_second": 215.915, "eval_steps_per_second": 13.495, "step": 9380 }, { "epoch": 9.39, "grad_norm": 33.82360076904297, "learning_rate": 4.156296296296297e-06, "loss": 0.04191101789474487, "step": 9390 }, { "epoch": 9.4, "grad_norm": 8.35073184967041, "learning_rate": 4.148888888888889e-06, "loss": 0.11546816825866699, "step": 9400 }, { "epoch": 9.4, "eval_0_to_0": 9468, "eval_0_to_1": 571, "eval_1_to_0": 758, "eval_1_to_1": 9203, "eval_accuracy": 0.93355, "eval_loss": 0.46891435980796814, "eval_runtime": 94.954, "eval_samples_per_second": 210.628, "eval_steps_per_second": 13.164, "step": 9400 }, { "epoch": 9.41, "grad_norm": 29.726619720458984, "learning_rate": 4.141481481481482e-06, "loss": 0.03487232625484467, "step": 9410 }, { "epoch": 9.42, "grad_norm": 0.09538722783327103, "learning_rate": 4.1340740740740744e-06, "loss": 0.03050555884838104, "step": 9420 }, { "epoch": 9.42, "eval_0_to_0": 9395, "eval_0_to_1": 644, "eval_1_to_0": 625, "eval_1_to_1": 9336, "eval_accuracy": 0.93655, "eval_loss": 0.43699854612350464, "eval_runtime": 94.818, "eval_samples_per_second": 210.93, "eval_steps_per_second": 13.183, "step": 9420 }, { "epoch": 9.43, "grad_norm": 2.468236207962036, "learning_rate": 4.126666666666667e-06, "loss": 0.09037278294563293, "step": 9430 }, { "epoch": 9.44, "grad_norm": 0.049547404050827026, "learning_rate": 4.119259259259259e-06, "loss": 0.0704456627368927, "step": 9440 }, { "epoch": 9.44, "eval_0_to_0": 9447, "eval_0_to_1": 592, "eval_1_to_0": 682, "eval_1_to_1": 9279, "eval_accuracy": 0.9363, "eval_loss": 0.4107097089290619, "eval_runtime": 94.1703, "eval_samples_per_second": 212.381, "eval_steps_per_second": 13.274, "step": 9440 }, { "epoch": 9.45, "grad_norm": 0.03821723163127899, "learning_rate": 4.111851851851852e-06, "loss": 0.04810449182987213, "step": 9450 }, { "epoch": 9.46, "grad_norm": 0.13242186605930328, "learning_rate": 4.104444444444445e-06, "loss": 0.04557179510593414, "step": 9460 }, { "epoch": 9.46, "eval_0_to_0": 9480, "eval_0_to_1": 559, "eval_1_to_0": 739, "eval_1_to_1": 9222, "eval_accuracy": 0.9351, "eval_loss": 0.43136751651763916, "eval_runtime": 93.3984, "eval_samples_per_second": 214.136, "eval_steps_per_second": 13.384, "step": 9460 }, { "epoch": 9.47, "grad_norm": 2.5716116428375244, "learning_rate": 4.097037037037037e-06, "loss": 0.042055335640907285, "step": 9470 }, { "epoch": 9.48, "grad_norm": 3.0749399662017822, "learning_rate": 4.08962962962963e-06, "loss": 0.006769496947526932, "step": 9480 }, { "epoch": 9.48, "eval_0_to_0": 9494, "eval_0_to_1": 545, "eval_1_to_0": 776, "eval_1_to_1": 9185, "eval_accuracy": 0.93395, "eval_loss": 0.46304062008857727, "eval_runtime": 94.2335, "eval_samples_per_second": 212.239, "eval_steps_per_second": 13.265, "step": 9480 }, { "epoch": 9.49, "grad_norm": 0.05047750473022461, "learning_rate": 4.0822222222222225e-06, "loss": 0.007121921330690384, "step": 9490 }, { "epoch": 9.5, "grad_norm": 0.7541494965553284, "learning_rate": 4.074814814814815e-06, "loss": 0.07414296865463257, "step": 9500 }, { "epoch": 9.5, "eval_0_to_0": 9485, "eval_0_to_1": 554, "eval_1_to_0": 747, "eval_1_to_1": 9214, "eval_accuracy": 0.93495, "eval_loss": 0.4747779667377472, "eval_runtime": 91.4587, "eval_samples_per_second": 218.678, "eval_steps_per_second": 13.667, "step": 9500 }, { "epoch": 9.51, "grad_norm": 0.016165701672434807, "learning_rate": 4.067407407407407e-06, "loss": 0.006266534328460693, "step": 9510 }, { "epoch": 9.52, "grad_norm": 1.2579504251480103, "learning_rate": 4.060000000000001e-06, "loss": 0.0817486047744751, "step": 9520 }, { "epoch": 9.52, "eval_0_to_0": 9501, "eval_0_to_1": 538, "eval_1_to_0": 752, "eval_1_to_1": 9209, "eval_accuracy": 0.9355, "eval_loss": 0.4669340252876282, "eval_runtime": 93.6326, "eval_samples_per_second": 213.601, "eval_steps_per_second": 13.35, "step": 9520 }, { "epoch": 9.53, "grad_norm": 38.248504638671875, "learning_rate": 4.052592592592593e-06, "loss": 0.01302196979522705, "step": 9530 }, { "epoch": 9.54, "grad_norm": 0.6808532476425171, "learning_rate": 4.045185185185186e-06, "loss": 0.1313488721847534, "step": 9540 }, { "epoch": 9.54, "eval_0_to_0": 9513, "eval_0_to_1": 526, "eval_1_to_0": 738, "eval_1_to_1": 9223, "eval_accuracy": 0.9368, "eval_loss": 0.4631807506084442, "eval_runtime": 110.103, "eval_samples_per_second": 181.648, "eval_steps_per_second": 11.353, "step": 9540 }, { "epoch": 9.55, "grad_norm": 0.028011547401547432, "learning_rate": 4.0377777777777786e-06, "loss": 0.09452152848243714, "step": 9550 }, { "epoch": 9.56, "grad_norm": 44.45155715942383, "learning_rate": 4.0303703703703705e-06, "loss": 0.07090818881988525, "step": 9560 }, { "epoch": 9.56, "eval_0_to_0": 9564, "eval_0_to_1": 475, "eval_1_to_0": 822, "eval_1_to_1": 9139, "eval_accuracy": 0.93515, "eval_loss": 0.474531352519989, "eval_runtime": 92.4202, "eval_samples_per_second": 216.403, "eval_steps_per_second": 13.525, "step": 9560 }, { "epoch": 9.57, "grad_norm": 0.04130911827087402, "learning_rate": 4.022962962962963e-06, "loss": 0.027876448631286622, "step": 9570 }, { "epoch": 9.58, "grad_norm": 0.0233683492988348, "learning_rate": 4.015555555555556e-06, "loss": 0.06370439529418945, "step": 9580 }, { "epoch": 9.58, "eval_0_to_0": 9476, "eval_0_to_1": 563, "eval_1_to_0": 710, "eval_1_to_1": 9251, "eval_accuracy": 0.93635, "eval_loss": 0.46443647146224976, "eval_runtime": 103.8431, "eval_samples_per_second": 192.598, "eval_steps_per_second": 12.037, "step": 9580 }, { "epoch": 9.59, "grad_norm": 0.37261343002319336, "learning_rate": 4.008148148148148e-06, "loss": 0.0049039296805858616, "step": 9590 }, { "epoch": 9.6, "grad_norm": 0.031252335757017136, "learning_rate": 4.000740740740741e-06, "loss": 0.028020089864730834, "step": 9600 }, { "epoch": 9.6, "eval_0_to_0": 9552, "eval_0_to_1": 487, "eval_1_to_0": 810, "eval_1_to_1": 9151, "eval_accuracy": 0.93515, "eval_loss": 0.5057425498962402, "eval_runtime": 143.3227, "eval_samples_per_second": 139.545, "eval_steps_per_second": 8.722, "step": 9600 }, { "epoch": 9.61, "grad_norm": 0.016851317137479782, "learning_rate": 3.993333333333334e-06, "loss": 0.10313737392425537, "step": 9610 }, { "epoch": 9.62, "grad_norm": 0.5938634276390076, "learning_rate": 3.985925925925927e-06, "loss": 0.10994081497192383, "step": 9620 }, { "epoch": 9.62, "eval_0_to_0": 9417, "eval_0_to_1": 622, "eval_1_to_0": 654, "eval_1_to_1": 9307, "eval_accuracy": 0.9362, "eval_loss": 0.4671383798122406, "eval_runtime": 148.7561, "eval_samples_per_second": 134.448, "eval_steps_per_second": 8.403, "step": 9620 }, { "epoch": 9.63, "grad_norm": 70.85047149658203, "learning_rate": 3.9785185185185186e-06, "loss": 0.1697132706642151, "step": 9630 }, { "epoch": 9.64, "grad_norm": 0.05039924755692482, "learning_rate": 3.971111111111111e-06, "loss": 0.09409177899360657, "step": 9640 }, { "epoch": 9.64, "eval_0_to_0": 9555, "eval_0_to_1": 484, "eval_1_to_0": 816, "eval_1_to_1": 9145, "eval_accuracy": 0.935, "eval_loss": 0.47520941495895386, "eval_runtime": 175.019, "eval_samples_per_second": 114.273, "eval_steps_per_second": 7.142, "step": 9640 }, { "epoch": 9.65, "grad_norm": 0.022771064192056656, "learning_rate": 3.963703703703704e-06, "loss": 0.02820209264755249, "step": 9650 }, { "epoch": 9.66, "grad_norm": 0.01235144678503275, "learning_rate": 3.956296296296296e-06, "loss": 0.03709450662136078, "step": 9660 }, { "epoch": 9.66, "eval_0_to_0": 9459, "eval_0_to_1": 580, "eval_1_to_0": 719, "eval_1_to_1": 9242, "eval_accuracy": 0.93505, "eval_loss": 0.46354424953460693, "eval_runtime": 145.6441, "eval_samples_per_second": 137.321, "eval_steps_per_second": 8.583, "step": 9660 }, { "epoch": 9.67, "grad_norm": 0.012652198784053326, "learning_rate": 3.948888888888889e-06, "loss": 0.0891032099723816, "step": 9670 }, { "epoch": 9.68, "grad_norm": 0.009782884269952774, "learning_rate": 3.941481481481482e-06, "loss": 0.02976822853088379, "step": 9680 }, { "epoch": 9.68, "eval_0_to_0": 9338, "eval_0_to_1": 701, "eval_1_to_0": 605, "eval_1_to_1": 9356, "eval_accuracy": 0.9347, "eval_loss": 0.4543122947216034, "eval_runtime": 139.2964, "eval_samples_per_second": 143.579, "eval_steps_per_second": 8.974, "step": 9680 }, { "epoch": 9.69, "grad_norm": 0.037573982030153275, "learning_rate": 3.934074074074075e-06, "loss": 0.012556436657905578, "step": 9690 }, { "epoch": 9.7, "grad_norm": 39.49894714355469, "learning_rate": 3.926666666666667e-06, "loss": 0.1210399866104126, "step": 9700 }, { "epoch": 9.7, "eval_0_to_0": 9359, "eval_0_to_1": 680, "eval_1_to_0": 619, "eval_1_to_1": 9342, "eval_accuracy": 0.93505, "eval_loss": 0.456821471452713, "eval_runtime": 190.6902, "eval_samples_per_second": 104.882, "eval_steps_per_second": 6.555, "step": 9700 }, { "epoch": 9.71, "grad_norm": 0.02657516486942768, "learning_rate": 3.9192592592592594e-06, "loss": 0.008039826899766922, "step": 9710 }, { "epoch": 9.72, "grad_norm": 73.40648651123047, "learning_rate": 3.911851851851852e-06, "loss": 0.10453883409500123, "step": 9720 }, { "epoch": 9.72, "eval_0_to_0": 9537, "eval_0_to_1": 502, "eval_1_to_0": 781, "eval_1_to_1": 9180, "eval_accuracy": 0.93585, "eval_loss": 0.4800821840763092, "eval_runtime": 171.7656, "eval_samples_per_second": 116.438, "eval_steps_per_second": 7.277, "step": 9720 }, { "epoch": 9.73, "grad_norm": 31.422075271606445, "learning_rate": 3.904444444444444e-06, "loss": 0.008305110782384873, "step": 9730 }, { "epoch": 9.74, "grad_norm": 17.39505958557129, "learning_rate": 3.897037037037038e-06, "loss": 0.11831494569778442, "step": 9740 }, { "epoch": 9.74, "eval_0_to_0": 9360, "eval_0_to_1": 679, "eval_1_to_0": 634, "eval_1_to_1": 9327, "eval_accuracy": 0.93435, "eval_loss": 0.4623337984085083, "eval_runtime": 191.5913, "eval_samples_per_second": 104.389, "eval_steps_per_second": 6.524, "step": 9740 }, { "epoch": 9.75, "grad_norm": 7.947699069976807, "learning_rate": 3.88962962962963e-06, "loss": 0.220090651512146, "step": 9750 }, { "epoch": 9.76, "grad_norm": 1.332796335220337, "learning_rate": 3.882222222222223e-06, "loss": 0.09201158285140991, "step": 9760 }, { "epoch": 9.76, "eval_0_to_0": 9509, "eval_0_to_1": 530, "eval_1_to_0": 775, "eval_1_to_1": 9186, "eval_accuracy": 0.93475, "eval_loss": 0.4454822838306427, "eval_runtime": 143.3544, "eval_samples_per_second": 139.514, "eval_steps_per_second": 8.72, "step": 9760 }, { "epoch": 9.77, "grad_norm": 0.2727357745170593, "learning_rate": 3.8748148148148155e-06, "loss": 0.08009881973266601, "step": 9770 }, { "epoch": 9.78, "grad_norm": 43.47481918334961, "learning_rate": 3.8674074074074075e-06, "loss": 0.0795818567276001, "step": 9780 }, { "epoch": 9.78, "eval_0_to_0": 9482, "eval_0_to_1": 557, "eval_1_to_0": 748, "eval_1_to_1": 9213, "eval_accuracy": 0.93475, "eval_loss": 0.4378434121608734, "eval_runtime": 158.4239, "eval_samples_per_second": 126.244, "eval_steps_per_second": 7.89, "step": 9780 }, { "epoch": 9.79, "grad_norm": 0.07165214419364929, "learning_rate": 3.86e-06, "loss": 0.004804180562496185, "step": 9790 }, { "epoch": 9.8, "grad_norm": 0.09448885172605515, "learning_rate": 3.852592592592593e-06, "loss": 0.06987434029579162, "step": 9800 }, { "epoch": 9.8, "eval_0_to_0": 9348, "eval_0_to_1": 691, "eval_1_to_0": 602, "eval_1_to_1": 9359, "eval_accuracy": 0.93535, "eval_loss": 0.4319204092025757, "eval_runtime": 184.5514, "eval_samples_per_second": 108.371, "eval_steps_per_second": 6.773, "step": 9800 }, { "epoch": 9.81, "grad_norm": 0.2711888253688812, "learning_rate": 3.845185185185186e-06, "loss": 0.039270812273025514, "step": 9810 }, { "epoch": 9.82, "grad_norm": 0.5468360781669617, "learning_rate": 3.837777777777778e-06, "loss": 0.03779047429561615, "step": 9820 }, { "epoch": 9.82, "eval_0_to_0": 9444, "eval_0_to_1": 595, "eval_1_to_0": 689, "eval_1_to_1": 9272, "eval_accuracy": 0.9358, "eval_loss": 0.4457463026046753, "eval_runtime": 184.8546, "eval_samples_per_second": 108.193, "eval_steps_per_second": 6.762, "step": 9820 }, { "epoch": 9.83, "grad_norm": 0.12112054973840714, "learning_rate": 3.830370370370371e-06, "loss": 0.021555621922016144, "step": 9830 }, { "epoch": 9.84, "grad_norm": 0.656047523021698, "learning_rate": 3.8229629629629636e-06, "loss": 0.027552813291549683, "step": 9840 }, { "epoch": 9.84, "eval_0_to_0": 9460, "eval_0_to_1": 579, "eval_1_to_0": 715, "eval_1_to_1": 9246, "eval_accuracy": 0.9353, "eval_loss": 0.46748989820480347, "eval_runtime": 182.5755, "eval_samples_per_second": 109.544, "eval_steps_per_second": 6.846, "step": 9840 }, { "epoch": 9.85, "grad_norm": 0.04925117641687393, "learning_rate": 3.8155555555555555e-06, "loss": 0.04354100525379181, "step": 9850 }, { "epoch": 9.86, "grad_norm": 0.011820663698017597, "learning_rate": 3.8081481481481488e-06, "loss": 0.003859686106443405, "step": 9860 }, { "epoch": 9.86, "eval_0_to_0": 9501, "eval_0_to_1": 538, "eval_1_to_0": 765, "eval_1_to_1": 9196, "eval_accuracy": 0.93485, "eval_loss": 0.48305508494377136, "eval_runtime": 156.6682, "eval_samples_per_second": 127.658, "eval_steps_per_second": 7.979, "step": 9860 }, { "epoch": 9.87, "grad_norm": 0.02195373736321926, "learning_rate": 3.8007407407407408e-06, "loss": 0.0752475082874298, "step": 9870 }, { "epoch": 9.88, "grad_norm": 0.01190050970762968, "learning_rate": 3.793333333333334e-06, "loss": 0.05753538608551025, "step": 9880 }, { "epoch": 9.88, "eval_0_to_0": 9548, "eval_0_to_1": 491, "eval_1_to_0": 810, "eval_1_to_1": 9151, "eval_accuracy": 0.93495, "eval_loss": 0.4934690296649933, "eval_runtime": 141.9771, "eval_samples_per_second": 140.868, "eval_steps_per_second": 8.804, "step": 9880 }, { "epoch": 9.89, "grad_norm": 36.55857849121094, "learning_rate": 3.7859259259259264e-06, "loss": 0.060456264019012454, "step": 9890 }, { "epoch": 9.9, "grad_norm": 38.66615676879883, "learning_rate": 3.778518518518519e-06, "loss": 0.17785404920578002, "step": 9900 }, { "epoch": 9.9, "eval_0_to_0": 9387, "eval_0_to_1": 652, "eval_1_to_0": 654, "eval_1_to_1": 9307, "eval_accuracy": 0.9347, "eval_loss": 0.4685487449169159, "eval_runtime": 169.7325, "eval_samples_per_second": 117.832, "eval_steps_per_second": 7.365, "step": 9900 }, { "epoch": 9.91, "grad_norm": 3.1753387451171875, "learning_rate": 3.7711111111111116e-06, "loss": 0.06460355520248413, "step": 9910 }, { "epoch": 9.92, "grad_norm": 0.9590281844139099, "learning_rate": 3.763703703703704e-06, "loss": 0.05536364316940308, "step": 9920 }, { "epoch": 9.92, "eval_0_to_0": 9543, "eval_0_to_1": 496, "eval_1_to_0": 837, "eval_1_to_1": 9124, "eval_accuracy": 0.93335, "eval_loss": 0.4872199296951294, "eval_runtime": 176.2582, "eval_samples_per_second": 113.47, "eval_steps_per_second": 7.092, "step": 9920 }, { "epoch": 9.93, "grad_norm": 0.04491984099149704, "learning_rate": 3.756296296296297e-06, "loss": 0.15968540906906128, "step": 9930 }, { "epoch": 9.94, "grad_norm": 11.834546089172363, "learning_rate": 3.7488888888888892e-06, "loss": 0.012013906240463256, "step": 9940 }, { "epoch": 9.94, "eval_0_to_0": 9572, "eval_0_to_1": 467, "eval_1_to_0": 874, "eval_1_to_1": 9087, "eval_accuracy": 0.93295, "eval_loss": 0.48237138986587524, "eval_runtime": 172.0011, "eval_samples_per_second": 116.278, "eval_steps_per_second": 7.267, "step": 9940 }, { "epoch": 9.95, "grad_norm": 0.02646159566938877, "learning_rate": 3.741481481481482e-06, "loss": 0.019828855991363525, "step": 9950 }, { "epoch": 9.96, "grad_norm": 0.07005517929792404, "learning_rate": 3.7340740740740744e-06, "loss": 0.006413515657186508, "step": 9960 }, { "epoch": 9.96, "eval_0_to_0": 9387, "eval_0_to_1": 652, "eval_1_to_0": 634, "eval_1_to_1": 9327, "eval_accuracy": 0.9357, "eval_loss": 0.45282095670700073, "eval_runtime": 175.5539, "eval_samples_per_second": 113.925, "eval_steps_per_second": 7.12, "step": 9960 }, { "epoch": 9.97, "grad_norm": 0.018428705632686615, "learning_rate": 3.726666666666667e-06, "loss": 0.002595273405313492, "step": 9970 }, { "epoch": 9.98, "grad_norm": 0.03473570570349693, "learning_rate": 3.7192592592592597e-06, "loss": 0.015987077355384828, "step": 9980 }, { "epoch": 9.98, "eval_0_to_0": 9513, "eval_0_to_1": 526, "eval_1_to_0": 782, "eval_1_to_1": 9179, "eval_accuracy": 0.9346, "eval_loss": 0.4883706569671631, "eval_runtime": 177.8338, "eval_samples_per_second": 112.465, "eval_steps_per_second": 7.029, "step": 9980 }, { "epoch": 9.99, "grad_norm": 38.7341194152832, "learning_rate": 3.711851851851852e-06, "loss": 0.01113753318786621, "step": 9990 }, { "epoch": 10.0, "grad_norm": 0.009603732265532017, "learning_rate": 3.704444444444445e-06, "loss": 0.11518144607543945, "step": 10000 }, { "epoch": 10.0, "eval_0_to_0": 9339, "eval_0_to_1": 700, "eval_1_to_0": 578, "eval_1_to_1": 9383, "eval_accuracy": 0.9361, "eval_loss": 0.475230872631073, "eval_runtime": 177.1929, "eval_samples_per_second": 112.871, "eval_steps_per_second": 7.054, "step": 10000 }, { "epoch": 10.01, "grad_norm": 46.42864990234375, "learning_rate": 3.6970370370370373e-06, "loss": 0.09119834303855896, "step": 10010 }, { "epoch": 10.02, "grad_norm": 0.10198986530303955, "learning_rate": 3.6896296296296297e-06, "loss": 0.049066150188446046, "step": 10020 }, { "epoch": 10.02, "eval_0_to_0": 9506, "eval_0_to_1": 533, "eval_1_to_0": 742, "eval_1_to_1": 9219, "eval_accuracy": 0.93625, "eval_loss": 0.48371392488479614, "eval_runtime": 180.2927, "eval_samples_per_second": 110.931, "eval_steps_per_second": 6.933, "step": 10020 }, { "epoch": 10.03, "grad_norm": 0.007205006200820208, "learning_rate": 3.6822222222222225e-06, "loss": 0.001325024664402008, "step": 10030 }, { "epoch": 10.04, "grad_norm": 0.05116040259599686, "learning_rate": 3.674814814814815e-06, "loss": 0.008586893230676651, "step": 10040 }, { "epoch": 10.04, "eval_0_to_0": 9483, "eval_0_to_1": 556, "eval_1_to_0": 714, "eval_1_to_1": 9247, "eval_accuracy": 0.9365, "eval_loss": 0.48605379462242126, "eval_runtime": 178.868, "eval_samples_per_second": 111.814, "eval_steps_per_second": 6.988, "step": 10040 }, { "epoch": 10.05, "grad_norm": 0.006320476066321135, "learning_rate": 3.6674074074074077e-06, "loss": 0.041235074400901794, "step": 10050 }, { "epoch": 10.06, "grad_norm": 0.014763792045414448, "learning_rate": 3.66e-06, "loss": 0.022563758492469787, "step": 10060 }, { "epoch": 10.06, "eval_0_to_0": 9473, "eval_0_to_1": 566, "eval_1_to_0": 717, "eval_1_to_1": 9244, "eval_accuracy": 0.93585, "eval_loss": 0.49254775047302246, "eval_runtime": 181.0849, "eval_samples_per_second": 110.445, "eval_steps_per_second": 6.903, "step": 10060 }, { "epoch": 10.07, "grad_norm": 0.007536661811172962, "learning_rate": 3.652592592592593e-06, "loss": 0.004485498368740082, "step": 10070 }, { "epoch": 10.08, "grad_norm": 0.8950139284133911, "learning_rate": 3.6451851851851853e-06, "loss": 0.1477535128593445, "step": 10080 }, { "epoch": 10.08, "eval_0_to_0": 9478, "eval_0_to_1": 561, "eval_1_to_0": 709, "eval_1_to_1": 9252, "eval_accuracy": 0.9365, "eval_loss": 0.49368056654930115, "eval_runtime": 182.1429, "eval_samples_per_second": 109.804, "eval_steps_per_second": 6.863, "step": 10080 }, { "epoch": 10.09, "grad_norm": 0.012612748891115189, "learning_rate": 3.6377777777777777e-06, "loss": 0.01839434951543808, "step": 10090 }, { "epoch": 10.1, "grad_norm": 54.16396713256836, "learning_rate": 3.630370370370371e-06, "loss": 0.018978384137153626, "step": 10100 }, { "epoch": 10.1, "eval_0_to_0": 9465, "eval_0_to_1": 574, "eval_1_to_0": 697, "eval_1_to_1": 9264, "eval_accuracy": 0.93645, "eval_loss": 0.47815361618995667, "eval_runtime": 173.8631, "eval_samples_per_second": 115.033, "eval_steps_per_second": 7.19, "step": 10100 }, { "epoch": 10.11, "grad_norm": 0.019014937803149223, "learning_rate": 3.622962962962963e-06, "loss": 0.04573335647583008, "step": 10110 }, { "epoch": 10.12, "grad_norm": 0.05078417807817459, "learning_rate": 3.615555555555556e-06, "loss": 0.019017350673675538, "step": 10120 }, { "epoch": 10.12, "eval_0_to_0": 9540, "eval_0_to_1": 499, "eval_1_to_0": 804, "eval_1_to_1": 9157, "eval_accuracy": 0.93485, "eval_loss": 0.5028063058853149, "eval_runtime": 145.6401, "eval_samples_per_second": 137.325, "eval_steps_per_second": 8.583, "step": 10120 }, { "epoch": 10.13, "grad_norm": 0.00913172122091055, "learning_rate": 3.6081481481481486e-06, "loss": 0.03872579336166382, "step": 10130 }, { "epoch": 10.14, "grad_norm": 0.12147367745637894, "learning_rate": 3.6007407407407406e-06, "loss": 0.033552145957946776, "step": 10140 }, { "epoch": 10.14, "eval_0_to_0": 9490, "eval_0_to_1": 549, "eval_1_to_0": 734, "eval_1_to_1": 9227, "eval_accuracy": 0.93585, "eval_loss": 0.4956953227519989, "eval_runtime": 171.0596, "eval_samples_per_second": 116.918, "eval_steps_per_second": 7.307, "step": 10140 }, { "epoch": 10.15, "grad_norm": 0.10711715370416641, "learning_rate": 3.593333333333334e-06, "loss": 0.030558818578720094, "step": 10150 }, { "epoch": 10.16, "grad_norm": Infinity, "learning_rate": 3.585925925925926e-06, "loss": 0.16229192018508912, "step": 10160 }, { "epoch": 10.16, "eval_0_to_0": 9390, "eval_0_to_1": 649, "eval_1_to_0": 632, "eval_1_to_1": 9329, "eval_accuracy": 0.93595, "eval_loss": 0.48696786165237427, "eval_runtime": 182.043, "eval_samples_per_second": 109.864, "eval_steps_per_second": 6.867, "step": 10160 }, { "epoch": 10.17, "grad_norm": 0.012284855358302593, "learning_rate": 3.578518518518519e-06, "loss": 0.025617536902427674, "step": 10170 }, { "epoch": 10.18, "grad_norm": 0.4279566705226898, "learning_rate": 3.5711111111111114e-06, "loss": 0.008544334024190903, "step": 10180 }, { "epoch": 10.18, "eval_0_to_0": 9488, "eval_0_to_1": 551, "eval_1_to_0": 748, "eval_1_to_1": 9213, "eval_accuracy": 0.93505, "eval_loss": 0.49628573656082153, "eval_runtime": 183.213, "eval_samples_per_second": 109.163, "eval_steps_per_second": 6.823, "step": 10180 }, { "epoch": 10.19, "grad_norm": 0.022116106003522873, "learning_rate": 3.5637037037037042e-06, "loss": 0.04870196282863617, "step": 10190 }, { "epoch": 10.2, "grad_norm": 0.008081021718680859, "learning_rate": 3.5562962962962966e-06, "loss": 0.004516600072383881, "step": 10200 }, { "epoch": 10.2, "eval_0_to_0": 9421, "eval_0_to_1": 618, "eval_1_to_0": 664, "eval_1_to_1": 9297, "eval_accuracy": 0.9359, "eval_loss": 0.48502835631370544, "eval_runtime": 169.8689, "eval_samples_per_second": 117.738, "eval_steps_per_second": 7.359, "step": 10200 }, { "epoch": 10.21, "grad_norm": 1.4980579614639282, "learning_rate": 3.548888888888889e-06, "loss": 0.06337935924530029, "step": 10210 }, { "epoch": 10.22, "grad_norm": 0.1940983682870865, "learning_rate": 3.541481481481482e-06, "loss": 0.005212465673685074, "step": 10220 }, { "epoch": 10.22, "eval_0_to_0": 9541, "eval_0_to_1": 498, "eval_1_to_0": 791, "eval_1_to_1": 9170, "eval_accuracy": 0.93555, "eval_loss": 0.5010062456130981, "eval_runtime": 88.3819, "eval_samples_per_second": 226.291, "eval_steps_per_second": 14.143, "step": 10220 }, { "epoch": 10.23, "grad_norm": 6.395559787750244, "learning_rate": 3.5340740740740742e-06, "loss": 0.12627644538879396, "step": 10230 }, { "epoch": 10.24, "grad_norm": 0.005722919944673777, "learning_rate": 3.526666666666667e-06, "loss": 0.023253713548183442, "step": 10240 }, { "epoch": 10.24, "eval_0_to_0": 9455, "eval_0_to_1": 584, "eval_1_to_0": 685, "eval_1_to_1": 9276, "eval_accuracy": 0.93655, "eval_loss": 0.4823873043060303, "eval_runtime": 137.971, "eval_samples_per_second": 144.958, "eval_steps_per_second": 9.06, "step": 10240 }, { "epoch": 10.25, "grad_norm": 0.06879085302352905, "learning_rate": 3.5192592592592595e-06, "loss": 0.0017400801181793213, "step": 10250 }, { "epoch": 10.26, "grad_norm": 10.39999008178711, "learning_rate": 3.5118518518518523e-06, "loss": 0.06598047018051148, "step": 10260 }, { "epoch": 10.26, "eval_0_to_0": 9419, "eval_0_to_1": 620, "eval_1_to_0": 645, "eval_1_to_1": 9316, "eval_accuracy": 0.93675, "eval_loss": 0.48305410146713257, "eval_runtime": 125.348, "eval_samples_per_second": 159.556, "eval_steps_per_second": 9.972, "step": 10260 }, { "epoch": 10.27, "grad_norm": 0.03880198299884796, "learning_rate": 3.5044444444444447e-06, "loss": 0.04183244407176971, "step": 10270 }, { "epoch": 10.28, "grad_norm": 0.005268667358905077, "learning_rate": 3.497037037037037e-06, "loss": 0.06589322090148926, "step": 10280 }, { "epoch": 10.28, "eval_0_to_0": 9545, "eval_0_to_1": 494, "eval_1_to_0": 786, "eval_1_to_1": 9175, "eval_accuracy": 0.936, "eval_loss": 0.5049213171005249, "eval_runtime": 139.7332, "eval_samples_per_second": 143.13, "eval_steps_per_second": 8.946, "step": 10280 }, { "epoch": 10.29, "grad_norm": 0.02355794422328472, "learning_rate": 3.48962962962963e-06, "loss": 0.0016449719667434692, "step": 10290 }, { "epoch": 10.3, "grad_norm": 51.158573150634766, "learning_rate": 3.4822222222222223e-06, "loss": 0.01729557812213898, "step": 10300 }, { "epoch": 10.3, "eval_0_to_0": 9475, "eval_0_to_1": 564, "eval_1_to_0": 688, "eval_1_to_1": 9273, "eval_accuracy": 0.9374, "eval_loss": 0.4945749044418335, "eval_runtime": 131.4468, "eval_samples_per_second": 152.153, "eval_steps_per_second": 9.51, "step": 10300 }, { "epoch": 10.31, "grad_norm": 22.491756439208984, "learning_rate": 3.474814814814815e-06, "loss": 0.08120222091674804, "step": 10310 }, { "epoch": 10.32, "grad_norm": 0.004713436122983694, "learning_rate": 3.4674074074074075e-06, "loss": 0.047521504759788516, "step": 10320 }, { "epoch": 10.32, "eval_0_to_0": 9459, "eval_0_to_1": 580, "eval_1_to_0": 679, "eval_1_to_1": 9282, "eval_accuracy": 0.93705, "eval_loss": 0.4859059154987335, "eval_runtime": 124.8312, "eval_samples_per_second": 160.216, "eval_steps_per_second": 10.014, "step": 10320 }, { "epoch": 10.33, "grad_norm": 0.006811641156673431, "learning_rate": 3.46e-06, "loss": 0.047345733642578124, "step": 10330 }, { "epoch": 10.34, "grad_norm": 0.011793725192546844, "learning_rate": 3.452592592592593e-06, "loss": 0.11802475452423096, "step": 10340 }, { "epoch": 10.34, "eval_0_to_0": 9518, "eval_0_to_1": 521, "eval_1_to_0": 766, "eval_1_to_1": 9195, "eval_accuracy": 0.93565, "eval_loss": 0.4935480058193207, "eval_runtime": 106.9237, "eval_samples_per_second": 187.049, "eval_steps_per_second": 11.691, "step": 10340 }, { "epoch": 10.35, "grad_norm": 0.014699463732540607, "learning_rate": 3.445185185185185e-06, "loss": 0.061616575717926024, "step": 10350 }, { "epoch": 10.36, "grad_norm": 0.05655979737639427, "learning_rate": 3.4377777777777784e-06, "loss": 0.03656442761421204, "step": 10360 }, { "epoch": 10.36, "eval_0_to_0": 9520, "eval_0_to_1": 519, "eval_1_to_0": 771, "eval_1_to_1": 9190, "eval_accuracy": 0.9355, "eval_loss": 0.48406845331192017, "eval_runtime": 123.7456, "eval_samples_per_second": 161.622, "eval_steps_per_second": 10.101, "step": 10360 }, { "epoch": 10.37, "grad_norm": 0.012565642595291138, "learning_rate": 3.4303703703703708e-06, "loss": 0.002892162650823593, "step": 10370 }, { "epoch": 10.38, "grad_norm": 0.01199919544160366, "learning_rate": 3.4229629629629636e-06, "loss": 0.008271464705467224, "step": 10380 }, { "epoch": 10.38, "eval_0_to_0": 9477, "eval_0_to_1": 562, "eval_1_to_0": 706, "eval_1_to_1": 9255, "eval_accuracy": 0.9366, "eval_loss": 0.4847159683704376, "eval_runtime": 116.7108, "eval_samples_per_second": 171.364, "eval_steps_per_second": 10.71, "step": 10380 }, { "epoch": 10.39, "grad_norm": 0.06334927678108215, "learning_rate": 3.415555555555556e-06, "loss": 0.030763328075408936, "step": 10390 }, { "epoch": 10.4, "grad_norm": 0.30291569232940674, "learning_rate": 3.4081481481481484e-06, "loss": 0.08439694046974182, "step": 10400 }, { "epoch": 10.4, "eval_0_to_0": 9521, "eval_0_to_1": 518, "eval_1_to_0": 771, "eval_1_to_1": 9190, "eval_accuracy": 0.93555, "eval_loss": 0.49751004576683044, "eval_runtime": 133.9087, "eval_samples_per_second": 149.355, "eval_steps_per_second": 9.335, "step": 10400 }, { "epoch": 10.41, "grad_norm": 0.10836343467235565, "learning_rate": 3.400740740740741e-06, "loss": 0.0897245705127716, "step": 10410 }, { "epoch": 10.42, "grad_norm": 0.4504110813140869, "learning_rate": 3.3933333333333336e-06, "loss": 0.04881498515605927, "step": 10420 }, { "epoch": 10.42, "eval_0_to_0": 9528, "eval_0_to_1": 511, "eval_1_to_0": 788, "eval_1_to_1": 9173, "eval_accuracy": 0.93505, "eval_loss": 0.48788076639175415, "eval_runtime": 162.3686, "eval_samples_per_second": 123.177, "eval_steps_per_second": 7.699, "step": 10420 }, { "epoch": 10.43, "grad_norm": 14.59723949432373, "learning_rate": 3.3859259259259264e-06, "loss": 0.0843444287776947, "step": 10430 }, { "epoch": 10.44, "grad_norm": 27.387514114379883, "learning_rate": 3.378518518518519e-06, "loss": 0.011459664255380631, "step": 10440 }, { "epoch": 10.44, "eval_0_to_0": 9455, "eval_0_to_1": 584, "eval_1_to_0": 694, "eval_1_to_1": 9267, "eval_accuracy": 0.9361, "eval_loss": 0.4825979471206665, "eval_runtime": 177.5694, "eval_samples_per_second": 112.632, "eval_steps_per_second": 7.04, "step": 10440 }, { "epoch": 10.45, "grad_norm": 0.7195100784301758, "learning_rate": 3.371111111111111e-06, "loss": 0.16302220821380614, "step": 10450 }, { "epoch": 10.46, "grad_norm": 0.025322644039988518, "learning_rate": 3.363703703703704e-06, "loss": 0.04800354838371277, "step": 10460 }, { "epoch": 10.46, "eval_0_to_0": 9584, "eval_0_to_1": 455, "eval_1_to_0": 858, "eval_1_to_1": 9103, "eval_accuracy": 0.93435, "eval_loss": 0.49695733189582825, "eval_runtime": 169.9781, "eval_samples_per_second": 117.662, "eval_steps_per_second": 7.354, "step": 10460 }, { "epoch": 10.47, "grad_norm": 0.030354462563991547, "learning_rate": 3.3562962962962964e-06, "loss": 0.11057718992233276, "step": 10470 }, { "epoch": 10.48, "grad_norm": 0.05402304232120514, "learning_rate": 3.3488888888888892e-06, "loss": 0.05336005091667175, "step": 10480 }, { "epoch": 10.48, "eval_0_to_0": 9524, "eval_0_to_1": 515, "eval_1_to_0": 781, "eval_1_to_1": 9180, "eval_accuracy": 0.9352, "eval_loss": 0.47746041417121887, "eval_runtime": 169.2561, "eval_samples_per_second": 118.164, "eval_steps_per_second": 7.385, "step": 10480 }, { "epoch": 10.49, "grad_norm": 0.013811680488288403, "learning_rate": 3.3414814814814816e-06, "loss": 0.004609758406877518, "step": 10490 }, { "epoch": 10.5, "grad_norm": 0.019046423956751823, "learning_rate": 3.3340740740740745e-06, "loss": 0.06428434252738953, "step": 10500 }, { "epoch": 10.5, "eval_0_to_0": 9469, "eval_0_to_1": 570, "eval_1_to_0": 706, "eval_1_to_1": 9255, "eval_accuracy": 0.9362, "eval_loss": 0.47226518392562866, "eval_runtime": 140.4606, "eval_samples_per_second": 142.389, "eval_steps_per_second": 8.899, "step": 10500 }, { "epoch": 10.51, "grad_norm": 0.01129050925374031, "learning_rate": 3.326666666666667e-06, "loss": 0.030716443061828615, "step": 10510 }, { "epoch": 10.52, "grad_norm": 0.022978749126195908, "learning_rate": 3.3192592592592593e-06, "loss": 0.0461887001991272, "step": 10520 }, { "epoch": 10.52, "eval_0_to_0": 9479, "eval_0_to_1": 560, "eval_1_to_0": 753, "eval_1_to_1": 9208, "eval_accuracy": 0.93435, "eval_loss": 0.4900722801685333, "eval_runtime": 131.9128, "eval_samples_per_second": 151.615, "eval_steps_per_second": 9.476, "step": 10520 }, { "epoch": 10.53, "grad_norm": 0.011549761518836021, "learning_rate": 3.311851851851852e-06, "loss": 0.022999057173728944, "step": 10530 }, { "epoch": 10.54, "grad_norm": 37.86668395996094, "learning_rate": 3.3044444444444445e-06, "loss": 0.12799259424209594, "step": 10540 }, { "epoch": 10.54, "eval_0_to_0": 9346, "eval_0_to_1": 693, "eval_1_to_0": 591, "eval_1_to_1": 9370, "eval_accuracy": 0.9358, "eval_loss": 0.4715059995651245, "eval_runtime": 128.9191, "eval_samples_per_second": 155.136, "eval_steps_per_second": 9.696, "step": 10540 }, { "epoch": 10.55, "grad_norm": 0.017285572364926338, "learning_rate": 3.2970370370370373e-06, "loss": 0.09006285667419434, "step": 10550 }, { "epoch": 10.56, "grad_norm": 0.011903662234544754, "learning_rate": 3.2896296296296297e-06, "loss": 0.026325249671936037, "step": 10560 }, { "epoch": 10.56, "eval_0_to_0": 9418, "eval_0_to_1": 621, "eval_1_to_0": 660, "eval_1_to_1": 9301, "eval_accuracy": 0.93595, "eval_loss": 0.46994468569755554, "eval_runtime": 133.8479, "eval_samples_per_second": 149.423, "eval_steps_per_second": 9.339, "step": 10560 }, { "epoch": 10.57, "grad_norm": 0.01343617495149374, "learning_rate": 3.282222222222223e-06, "loss": 0.0774861991405487, "step": 10570 }, { "epoch": 10.58, "grad_norm": 1.5774128437042236, "learning_rate": 3.274814814814815e-06, "loss": 0.1273782730102539, "step": 10580 }, { "epoch": 10.58, "eval_0_to_0": 9491, "eval_0_to_1": 548, "eval_1_to_0": 744, "eval_1_to_1": 9217, "eval_accuracy": 0.9354, "eval_loss": 0.48186513781547546, "eval_runtime": 128.1106, "eval_samples_per_second": 156.115, "eval_steps_per_second": 9.757, "step": 10580 }, { "epoch": 10.59, "grad_norm": 0.011405929923057556, "learning_rate": 3.2674074074074073e-06, "loss": 0.006890787184238434, "step": 10590 }, { "epoch": 10.6, "grad_norm": 31.409000396728516, "learning_rate": 3.2600000000000006e-06, "loss": 0.052280640602111815, "step": 10600 }, { "epoch": 10.6, "eval_0_to_0": 9373, "eval_0_to_1": 666, "eval_1_to_0": 601, "eval_1_to_1": 9360, "eval_accuracy": 0.93665, "eval_loss": 0.47433334589004517, "eval_runtime": 131.0946, "eval_samples_per_second": 152.562, "eval_steps_per_second": 9.535, "step": 10600 }, { "epoch": 10.61, "grad_norm": 0.009981144219636917, "learning_rate": 3.252592592592593e-06, "loss": 0.012905511260032653, "step": 10610 }, { "epoch": 10.62, "grad_norm": 6.367273330688477, "learning_rate": 3.2451851851851858e-06, "loss": 0.07088429927825927, "step": 10620 }, { "epoch": 10.62, "eval_0_to_0": 9347, "eval_0_to_1": 692, "eval_1_to_0": 581, "eval_1_to_1": 9380, "eval_accuracy": 0.93635, "eval_loss": 0.4794960021972656, "eval_runtime": 133.7263, "eval_samples_per_second": 149.559, "eval_steps_per_second": 9.347, "step": 10620 }, { "epoch": 10.63, "grad_norm": 11.873690605163574, "learning_rate": 3.237777777777778e-06, "loss": 0.049156269431114195, "step": 10630 }, { "epoch": 10.64, "grad_norm": 45.480953216552734, "learning_rate": 3.2303703703703706e-06, "loss": 0.05470517873764038, "step": 10640 }, { "epoch": 10.64, "eval_0_to_0": 9437, "eval_0_to_1": 602, "eval_1_to_0": 701, "eval_1_to_1": 9260, "eval_accuracy": 0.93485, "eval_loss": 0.4905804693698883, "eval_runtime": 134.2053, "eval_samples_per_second": 149.025, "eval_steps_per_second": 9.314, "step": 10640 }, { "epoch": 10.65, "grad_norm": 0.7584062218666077, "learning_rate": 3.2229629629629634e-06, "loss": 0.035958418250083925, "step": 10650 }, { "epoch": 10.66, "grad_norm": 31.393064498901367, "learning_rate": 3.2155555555555558e-06, "loss": 0.06459892988204956, "step": 10660 }, { "epoch": 10.66, "eval_0_to_0": 9425, "eval_0_to_1": 614, "eval_1_to_0": 686, "eval_1_to_1": 9275, "eval_accuracy": 0.935, "eval_loss": 0.48562484979629517, "eval_runtime": 140.558, "eval_samples_per_second": 142.29, "eval_steps_per_second": 8.893, "step": 10660 }, { "epoch": 10.67, "grad_norm": 4.27782678604126, "learning_rate": 3.2081481481481486e-06, "loss": 0.0535123884677887, "step": 10670 }, { "epoch": 10.68, "grad_norm": 0.17634226381778717, "learning_rate": 3.200740740740741e-06, "loss": 0.03636197447776794, "step": 10680 }, { "epoch": 10.68, "eval_0_to_0": 9514, "eval_0_to_1": 525, "eval_1_to_0": 767, "eval_1_to_1": 9194, "eval_accuracy": 0.9354, "eval_loss": 0.49628573656082153, "eval_runtime": 141.2088, "eval_samples_per_second": 141.634, "eval_steps_per_second": 8.852, "step": 10680 }, { "epoch": 10.69, "grad_norm": 38.33904266357422, "learning_rate": 3.193333333333334e-06, "loss": 0.07080591917037964, "step": 10690 }, { "epoch": 10.7, "grad_norm": 0.08762826770544052, "learning_rate": 3.1859259259259262e-06, "loss": 0.09986441731452941, "step": 10700 }, { "epoch": 10.7, "eval_0_to_0": 9327, "eval_0_to_1": 712, "eval_1_to_0": 581, "eval_1_to_1": 9380, "eval_accuracy": 0.93535, "eval_loss": 0.4775598645210266, "eval_runtime": 138.7985, "eval_samples_per_second": 144.094, "eval_steps_per_second": 9.006, "step": 10700 }, { "epoch": 10.71, "grad_norm": 0.008677657693624496, "learning_rate": 3.1785185185185186e-06, "loss": 0.091959547996521, "step": 10710 }, { "epoch": 10.72, "grad_norm": 0.2110625058412552, "learning_rate": 3.1711111111111114e-06, "loss": 0.12454512119293212, "step": 10720 }, { "epoch": 10.72, "eval_0_to_0": 9522, "eval_0_to_1": 517, "eval_1_to_0": 768, "eval_1_to_1": 9193, "eval_accuracy": 0.93575, "eval_loss": 0.49382030963897705, "eval_runtime": 143.6911, "eval_samples_per_second": 139.187, "eval_steps_per_second": 8.699, "step": 10720 }, { "epoch": 10.73, "grad_norm": 0.013134286738932133, "learning_rate": 3.163703703703704e-06, "loss": 0.057116901874542235, "step": 10730 }, { "epoch": 10.74, "grad_norm": 0.616253137588501, "learning_rate": 3.1562962962962966e-06, "loss": 0.0778805136680603, "step": 10740 }, { "epoch": 10.74, "eval_0_to_0": 9445, "eval_0_to_1": 594, "eval_1_to_0": 687, "eval_1_to_1": 9274, "eval_accuracy": 0.93595, "eval_loss": 0.4701705574989319, "eval_runtime": 141.2208, "eval_samples_per_second": 141.622, "eval_steps_per_second": 8.851, "step": 10740 }, { "epoch": 10.75, "grad_norm": 0.7195430397987366, "learning_rate": 3.148888888888889e-06, "loss": 0.05396987199783325, "step": 10750 }, { "epoch": 10.76, "grad_norm": 0.014045313000679016, "learning_rate": 3.1414814814814814e-06, "loss": 0.07403391003608703, "step": 10760 }, { "epoch": 10.76, "eval_0_to_0": 9398, "eval_0_to_1": 641, "eval_1_to_0": 635, "eval_1_to_1": 9326, "eval_accuracy": 0.9362, "eval_loss": 0.43881019949913025, "eval_runtime": 139.7607, "eval_samples_per_second": 143.102, "eval_steps_per_second": 8.944, "step": 10760 }, { "epoch": 10.77, "grad_norm": 15.11378288269043, "learning_rate": 3.1340740740740743e-06, "loss": 0.07983015775680542, "step": 10770 }, { "epoch": 10.78, "grad_norm": 0.11333008855581284, "learning_rate": 3.1266666666666667e-06, "loss": 0.030860978364944457, "step": 10780 }, { "epoch": 10.78, "eval_0_to_0": 9553, "eval_0_to_1": 486, "eval_1_to_0": 816, "eval_1_to_1": 9145, "eval_accuracy": 0.9349, "eval_loss": 0.46308258175849915, "eval_runtime": 141.7784, "eval_samples_per_second": 141.065, "eval_steps_per_second": 8.817, "step": 10780 }, { "epoch": 10.79, "grad_norm": 1.4154497385025024, "learning_rate": 3.1192592592592595e-06, "loss": 0.03292688429355621, "step": 10790 }, { "epoch": 10.8, "grad_norm": 0.010715593583881855, "learning_rate": 3.111851851851852e-06, "loss": 0.024732473492622375, "step": 10800 }, { "epoch": 10.8, "eval_0_to_0": 9440, "eval_0_to_1": 599, "eval_1_to_0": 670, "eval_1_to_1": 9291, "eval_accuracy": 0.93655, "eval_loss": 0.45742300152778625, "eval_runtime": 138.2894, "eval_samples_per_second": 144.624, "eval_steps_per_second": 9.039, "step": 10800 }, { "epoch": 10.81, "grad_norm": 0.010622447356581688, "learning_rate": 3.104444444444445e-06, "loss": 0.015437814593315124, "step": 10810 }, { "epoch": 10.82, "grad_norm": 0.021291915327310562, "learning_rate": 3.097037037037037e-06, "loss": 0.08786075711250305, "step": 10820 }, { "epoch": 10.82, "eval_0_to_0": 9475, "eval_0_to_1": 564, "eval_1_to_0": 714, "eval_1_to_1": 9247, "eval_accuracy": 0.9361, "eval_loss": 0.4679734408855438, "eval_runtime": 139.0453, "eval_samples_per_second": 143.838, "eval_steps_per_second": 8.99, "step": 10820 }, { "epoch": 10.83, "grad_norm": 0.0170587245374918, "learning_rate": 3.0896296296296295e-06, "loss": 0.001965728402137756, "step": 10830 }, { "epoch": 10.84, "grad_norm": 0.013137049973011017, "learning_rate": 3.0822222222222227e-06, "loss": 0.02093752324581146, "step": 10840 }, { "epoch": 10.84, "eval_0_to_0": 9435, "eval_0_to_1": 604, "eval_1_to_0": 670, "eval_1_to_1": 9291, "eval_accuracy": 0.9363, "eval_loss": 0.46813660860061646, "eval_runtime": 144.9483, "eval_samples_per_second": 137.98, "eval_steps_per_second": 8.624, "step": 10840 }, { "epoch": 10.85, "grad_norm": 14.302163124084473, "learning_rate": 3.0748148148148147e-06, "loss": 0.0030877277255058288, "step": 10850 }, { "epoch": 10.86, "grad_norm": 0.016576474532485008, "learning_rate": 3.067407407407408e-06, "loss": 0.038271749019622804, "step": 10860 }, { "epoch": 10.86, "eval_0_to_0": 9557, "eval_0_to_1": 482, "eval_1_to_0": 821, "eval_1_to_1": 9140, "eval_accuracy": 0.93485, "eval_loss": 0.5037041306495667, "eval_runtime": 142.7928, "eval_samples_per_second": 140.063, "eval_steps_per_second": 8.754, "step": 10860 }, { "epoch": 10.87, "grad_norm": 0.009829731658101082, "learning_rate": 3.0600000000000003e-06, "loss": 0.10933215618133545, "step": 10870 }, { "epoch": 10.88, "grad_norm": 0.09212014079093933, "learning_rate": 3.052592592592593e-06, "loss": 0.0012693248689174652, "step": 10880 }, { "epoch": 10.88, "eval_0_to_0": 9475, "eval_0_to_1": 564, "eval_1_to_0": 723, "eval_1_to_1": 9238, "eval_accuracy": 0.93565, "eval_loss": 0.491291880607605, "eval_runtime": 148.459, "eval_samples_per_second": 134.717, "eval_steps_per_second": 8.42, "step": 10880 }, { "epoch": 10.89, "grad_norm": 0.008601855486631393, "learning_rate": 3.0451851851851856e-06, "loss": 0.07533761858940125, "step": 10890 }, { "epoch": 10.9, "grad_norm": 0.007450163830071688, "learning_rate": 3.037777777777778e-06, "loss": 0.01869824677705765, "step": 10900 }, { "epoch": 10.9, "eval_0_to_0": 9338, "eval_0_to_1": 701, "eval_1_to_0": 574, "eval_1_to_1": 9387, "eval_accuracy": 0.93625, "eval_loss": 0.47863203287124634, "eval_runtime": 104.1666, "eval_samples_per_second": 192.0, "eval_steps_per_second": 12.0, "step": 10900 }, { "epoch": 10.91, "grad_norm": 0.006352544296532869, "learning_rate": 3.0303703703703708e-06, "loss": 0.020674073696136476, "step": 10910 }, { "epoch": 10.92, "grad_norm": 0.011843200773000717, "learning_rate": 3.022962962962963e-06, "loss": 0.04408887028694153, "step": 10920 }, { "epoch": 10.92, "eval_0_to_0": 9563, "eval_0_to_1": 476, "eval_1_to_0": 842, "eval_1_to_1": 9119, "eval_accuracy": 0.9341, "eval_loss": 0.523328423500061, "eval_runtime": 103.3423, "eval_samples_per_second": 193.532, "eval_steps_per_second": 12.096, "step": 10920 }, { "epoch": 10.93, "grad_norm": 1.1290390491485596, "learning_rate": 3.015555555555556e-06, "loss": 0.1060360312461853, "step": 10930 }, { "epoch": 10.94, "grad_norm": 9.152841567993164, "learning_rate": 3.0081481481481484e-06, "loss": 0.03055618405342102, "step": 10940 }, { "epoch": 10.94, "eval_0_to_0": 9472, "eval_0_to_1": 567, "eval_1_to_0": 726, "eval_1_to_1": 9235, "eval_accuracy": 0.93535, "eval_loss": 0.4969606399536133, "eval_runtime": 117.5494, "eval_samples_per_second": 170.141, "eval_steps_per_second": 10.634, "step": 10940 }, { "epoch": 10.95, "grad_norm": 18.629201889038086, "learning_rate": 3.000740740740741e-06, "loss": 0.056796425580978395, "step": 10950 }, { "epoch": 10.96, "grad_norm": 0.018442315980792046, "learning_rate": 2.9933333333333336e-06, "loss": 0.05735313296318054, "step": 10960 }, { "epoch": 10.96, "eval_0_to_0": 9414, "eval_0_to_1": 625, "eval_1_to_0": 650, "eval_1_to_1": 9311, "eval_accuracy": 0.93625, "eval_loss": 0.4776165187358856, "eval_runtime": 146.6413, "eval_samples_per_second": 136.387, "eval_steps_per_second": 8.524, "step": 10960 }, { "epoch": 10.97, "grad_norm": 0.017317337915301323, "learning_rate": 2.985925925925926e-06, "loss": 0.10868381261825562, "step": 10970 }, { "epoch": 10.98, "grad_norm": 0.14994890987873077, "learning_rate": 2.978518518518519e-06, "loss": 0.0553175687789917, "step": 10980 }, { "epoch": 10.98, "eval_0_to_0": 9541, "eval_0_to_1": 498, "eval_1_to_0": 794, "eval_1_to_1": 9167, "eval_accuracy": 0.9354, "eval_loss": 0.48390138149261475, "eval_runtime": 146.3985, "eval_samples_per_second": 136.613, "eval_steps_per_second": 8.538, "step": 10980 }, { "epoch": 10.99, "grad_norm": 0.011294138617813587, "learning_rate": 2.9711111111111112e-06, "loss": 0.035421821475028994, "step": 10990 }, { "epoch": 11.0, "grad_norm": 0.031091991811990738, "learning_rate": 2.963703703703704e-06, "loss": 0.061625683307647706, "step": 11000 }, { "epoch": 11.0, "eval_0_to_0": 9354, "eval_0_to_1": 685, "eval_1_to_0": 611, "eval_1_to_1": 9350, "eval_accuracy": 0.9352, "eval_loss": 0.46811121702194214, "eval_runtime": 150.0227, "eval_samples_per_second": 133.313, "eval_steps_per_second": 8.332, "step": 11000 }, { "epoch": 11.01, "grad_norm": 0.013020487502217293, "learning_rate": 2.9562962962962964e-06, "loss": 0.0469273179769516, "step": 11010 }, { "epoch": 11.02, "grad_norm": 0.03366532921791077, "learning_rate": 2.948888888888889e-06, "loss": 0.0015286125242710113, "step": 11020 }, { "epoch": 11.02, "eval_0_to_0": 9427, "eval_0_to_1": 612, "eval_1_to_0": 667, "eval_1_to_1": 9294, "eval_accuracy": 0.93605, "eval_loss": 0.4746021628379822, "eval_runtime": 147.3627, "eval_samples_per_second": 135.72, "eval_steps_per_second": 8.482, "step": 11020 }, { "epoch": 11.03, "grad_norm": 0.009587498381733894, "learning_rate": 2.9414814814814817e-06, "loss": 0.0016923069953918457, "step": 11030 }, { "epoch": 11.04, "grad_norm": 0.023854855448007584, "learning_rate": 2.934074074074074e-06, "loss": 0.03782569468021393, "step": 11040 }, { "epoch": 11.04, "eval_0_to_0": 9488, "eval_0_to_1": 551, "eval_1_to_0": 714, "eval_1_to_1": 9247, "eval_accuracy": 0.93675, "eval_loss": 0.486265629529953, "eval_runtime": 146.3345, "eval_samples_per_second": 136.673, "eval_steps_per_second": 8.542, "step": 11040 }, { "epoch": 11.05, "grad_norm": 0.008146917447447777, "learning_rate": 2.9266666666666673e-06, "loss": 0.0424528568983078, "step": 11050 }, { "epoch": 11.06, "grad_norm": 0.006298539228737354, "learning_rate": 2.9192592592592593e-06, "loss": 0.06812627911567688, "step": 11060 }, { "epoch": 11.06, "eval_0_to_0": 9573, "eval_0_to_1": 466, "eval_1_to_0": 835, "eval_1_to_1": 9126, "eval_accuracy": 0.93495, "eval_loss": 0.5074352025985718, "eval_runtime": 104.3825, "eval_samples_per_second": 191.603, "eval_steps_per_second": 11.975, "step": 11060 }, { "epoch": 11.07, "grad_norm": 0.0717451423406601, "learning_rate": 2.9118518518518517e-06, "loss": 0.09229936599731445, "step": 11070 }, { "epoch": 11.08, "grad_norm": 0.03554629161953926, "learning_rate": 2.904444444444445e-06, "loss": 0.05163751840591431, "step": 11080 }, { "epoch": 11.08, "eval_0_to_0": 9478, "eval_0_to_1": 561, "eval_1_to_0": 717, "eval_1_to_1": 9244, "eval_accuracy": 0.9361, "eval_loss": 0.4717314541339874, "eval_runtime": 148.3691, "eval_samples_per_second": 134.799, "eval_steps_per_second": 8.425, "step": 11080 }, { "epoch": 11.09, "grad_norm": 0.023143943399190903, "learning_rate": 2.897037037037037e-06, "loss": 0.006267029792070389, "step": 11090 }, { "epoch": 11.1, "grad_norm": 37.665321350097656, "learning_rate": 2.88962962962963e-06, "loss": 0.0628022313117981, "step": 11100 }, { "epoch": 11.1, "eval_0_to_0": 9523, "eval_0_to_1": 516, "eval_1_to_0": 794, "eval_1_to_1": 9167, "eval_accuracy": 0.9345, "eval_loss": 0.48271656036376953, "eval_runtime": 144.266, "eval_samples_per_second": 138.633, "eval_steps_per_second": 8.665, "step": 11100 }, { "epoch": 11.11, "grad_norm": 0.010569942183792591, "learning_rate": 2.8822222222222225e-06, "loss": 0.0027124181389808653, "step": 11110 }, { "epoch": 11.12, "grad_norm": 0.07362549751996994, "learning_rate": 2.8748148148148154e-06, "loss": 0.05966692566871643, "step": 11120 }, { "epoch": 11.12, "eval_0_to_0": 9456, "eval_0_to_1": 583, "eval_1_to_0": 698, "eval_1_to_1": 9263, "eval_accuracy": 0.93595, "eval_loss": 0.4742696285247803, "eval_runtime": 148.3268, "eval_samples_per_second": 134.837, "eval_steps_per_second": 8.427, "step": 11120 }, { "epoch": 11.13, "grad_norm": 0.010838274843990803, "learning_rate": 2.8674074074074077e-06, "loss": 0.05947636365890503, "step": 11130 }, { "epoch": 11.14, "grad_norm": 0.012739980593323708, "learning_rate": 2.86e-06, "loss": 0.03681508898735046, "step": 11140 }, { "epoch": 11.14, "eval_0_to_0": 9450, "eval_0_to_1": 589, "eval_1_to_0": 701, "eval_1_to_1": 9260, "eval_accuracy": 0.9355, "eval_loss": 0.48114463686943054, "eval_runtime": 148.3674, "eval_samples_per_second": 134.801, "eval_steps_per_second": 8.425, "step": 11140 }, { "epoch": 11.15, "grad_norm": 0.02510843053460121, "learning_rate": 2.852592592592593e-06, "loss": 0.03915455043315887, "step": 11150 }, { "epoch": 11.16, "grad_norm": 0.006159004755318165, "learning_rate": 2.8451851851851854e-06, "loss": 0.05954076647758484, "step": 11160 }, { "epoch": 11.16, "eval_0_to_0": 9463, "eval_0_to_1": 576, "eval_1_to_0": 710, "eval_1_to_1": 9251, "eval_accuracy": 0.9357, "eval_loss": 0.482133686542511, "eval_runtime": 148.0476, "eval_samples_per_second": 135.092, "eval_steps_per_second": 8.443, "step": 11160 }, { "epoch": 11.17, "grad_norm": 0.02013818547129631, "learning_rate": 2.837777777777778e-06, "loss": 0.038756123185157774, "step": 11170 }, { "epoch": 11.18, "grad_norm": 0.03204504773020744, "learning_rate": 2.8303703703703706e-06, "loss": 0.002287793904542923, "step": 11180 }, { "epoch": 11.18, "eval_0_to_0": 9377, "eval_0_to_1": 662, "eval_1_to_0": 607, "eval_1_to_1": 9354, "eval_accuracy": 0.93655, "eval_loss": 0.4744465947151184, "eval_runtime": 125.5282, "eval_samples_per_second": 159.327, "eval_steps_per_second": 9.958, "step": 11180 }, { "epoch": 11.19, "grad_norm": 1.7375012636184692, "learning_rate": 2.8229629629629634e-06, "loss": 0.0018397435545921327, "step": 11190 }, { "epoch": 11.2, "grad_norm": 43.556758880615234, "learning_rate": 2.815555555555556e-06, "loss": 0.02029099762439728, "step": 11200 }, { "epoch": 11.2, "eval_0_to_0": 9476, "eval_0_to_1": 563, "eval_1_to_0": 704, "eval_1_to_1": 9257, "eval_accuracy": 0.93665, "eval_loss": 0.4910026490688324, "eval_runtime": 107.3847, "eval_samples_per_second": 186.246, "eval_steps_per_second": 11.64, "step": 11200 }, { "epoch": 11.21, "grad_norm": 24.347396850585938, "learning_rate": 2.808148148148148e-06, "loss": 0.039490386843681335, "step": 11210 }, { "epoch": 11.22, "grad_norm": 1.8732120990753174, "learning_rate": 2.800740740740741e-06, "loss": 0.005655660480260849, "step": 11220 }, { "epoch": 11.22, "eval_0_to_0": 9441, "eval_0_to_1": 598, "eval_1_to_0": 660, "eval_1_to_1": 9301, "eval_accuracy": 0.9371, "eval_loss": 0.4937230050563812, "eval_runtime": 107.2022, "eval_samples_per_second": 186.563, "eval_steps_per_second": 11.66, "step": 11220 }, { "epoch": 11.23, "grad_norm": 0.006065865978598595, "learning_rate": 2.7933333333333334e-06, "loss": 0.0011770248413085938, "step": 11230 }, { "epoch": 11.24, "grad_norm": 0.006583553738892078, "learning_rate": 2.7859259259259262e-06, "loss": 0.04816292822360992, "step": 11240 }, { "epoch": 11.24, "eval_0_to_0": 9480, "eval_0_to_1": 559, "eval_1_to_0": 718, "eval_1_to_1": 9243, "eval_accuracy": 0.93615, "eval_loss": 0.5093908309936523, "eval_runtime": 107.0813, "eval_samples_per_second": 186.774, "eval_steps_per_second": 11.673, "step": 11240 }, { "epoch": 11.25, "grad_norm": 0.005464194342494011, "learning_rate": 2.7785185185185186e-06, "loss": 0.10989372730255127, "step": 11250 }, { "epoch": 11.26, "grad_norm": 0.0050214785151183605, "learning_rate": 2.771111111111111e-06, "loss": 0.0011750318109989167, "step": 11260 }, { "epoch": 11.26, "eval_0_to_0": 9437, "eval_0_to_1": 602, "eval_1_to_0": 665, "eval_1_to_1": 9296, "eval_accuracy": 0.93665, "eval_loss": 0.5062216520309448, "eval_runtime": 107.2253, "eval_samples_per_second": 186.523, "eval_steps_per_second": 11.658, "step": 11260 }, { "epoch": 11.27, "grad_norm": 35.67811965942383, "learning_rate": 2.763703703703704e-06, "loss": 0.024387584626674653, "step": 11270 }, { "epoch": 11.28, "grad_norm": 35.096256256103516, "learning_rate": 2.7562962962962962e-06, "loss": 0.034210553765296935, "step": 11280 }, { "epoch": 11.28, "eval_0_to_0": 9511, "eval_0_to_1": 528, "eval_1_to_0": 764, "eval_1_to_1": 9197, "eval_accuracy": 0.9354, "eval_loss": 0.5204076766967773, "eval_runtime": 105.6483, "eval_samples_per_second": 189.307, "eval_steps_per_second": 11.832, "step": 11280 }, { "epoch": 11.29, "grad_norm": 0.06618940830230713, "learning_rate": 2.748888888888889e-06, "loss": 0.0006706647574901581, "step": 11290 }, { "epoch": 11.3, "grad_norm": 0.19355960190296173, "learning_rate": 2.7414814814814815e-06, "loss": 0.1101908802986145, "step": 11300 }, { "epoch": 11.3, "eval_0_to_0": 9383, "eval_0_to_1": 656, "eval_1_to_0": 631, "eval_1_to_1": 9330, "eval_accuracy": 0.93565, "eval_loss": 0.4991162121295929, "eval_runtime": 106.0683, "eval_samples_per_second": 188.558, "eval_steps_per_second": 11.785, "step": 11300 }, { "epoch": 11.31, "grad_norm": 57.384735107421875, "learning_rate": 2.7340740740740747e-06, "loss": 0.10136977434158326, "step": 11310 }, { "epoch": 11.32, "grad_norm": 0.0097116120159626, "learning_rate": 2.726666666666667e-06, "loss": 0.0037944607436656954, "step": 11320 }, { "epoch": 11.32, "eval_0_to_0": 9405, "eval_0_to_1": 634, "eval_1_to_0": 653, "eval_1_to_1": 9308, "eval_accuracy": 0.93565, "eval_loss": 0.49125584959983826, "eval_runtime": 107.9677, "eval_samples_per_second": 185.241, "eval_steps_per_second": 11.578, "step": 11320 }, { "epoch": 11.33, "grad_norm": 0.016204429790377617, "learning_rate": 2.719259259259259e-06, "loss": 0.0029763758182525637, "step": 11330 }, { "epoch": 11.34, "grad_norm": 0.006854207254946232, "learning_rate": 2.7118518518518523e-06, "loss": 0.021301868557929992, "step": 11340 }, { "epoch": 11.34, "eval_0_to_0": 9504, "eval_0_to_1": 535, "eval_1_to_0": 778, "eval_1_to_1": 9183, "eval_accuracy": 0.93435, "eval_loss": 0.5142064690589905, "eval_runtime": 107.1329, "eval_samples_per_second": 186.684, "eval_steps_per_second": 11.668, "step": 11340 }, { "epoch": 11.35, "grad_norm": 0.11253400146961212, "learning_rate": 2.7044444444444447e-06, "loss": 0.0011680230498313903, "step": 11350 }, { "epoch": 11.36, "grad_norm": 0.11487174034118652, "learning_rate": 2.6970370370370375e-06, "loss": 0.01028672456741333, "step": 11360 }, { "epoch": 11.36, "eval_0_to_0": 9416, "eval_0_to_1": 623, "eval_1_to_0": 647, "eval_1_to_1": 9314, "eval_accuracy": 0.9365, "eval_loss": 0.49921634793281555, "eval_runtime": 105.519, "eval_samples_per_second": 189.539, "eval_steps_per_second": 11.846, "step": 11360 }, { "epoch": 11.37, "grad_norm": 0.03933445364236832, "learning_rate": 2.68962962962963e-06, "loss": 0.037384188175201415, "step": 11370 }, { "epoch": 11.38, "grad_norm": 0.02355515956878662, "learning_rate": 2.6822222222222223e-06, "loss": 0.04789400100708008, "step": 11380 }, { "epoch": 11.38, "eval_0_to_0": 9435, "eval_0_to_1": 604, "eval_1_to_0": 658, "eval_1_to_1": 9303, "eval_accuracy": 0.9369, "eval_loss": 0.4993683099746704, "eval_runtime": 107.8971, "eval_samples_per_second": 185.362, "eval_steps_per_second": 11.585, "step": 11380 }, { "epoch": 11.39, "grad_norm": 0.35950779914855957, "learning_rate": 2.674814814814815e-06, "loss": 0.003113313764333725, "step": 11390 }, { "epoch": 11.4, "grad_norm": 0.008560671471059322, "learning_rate": 2.6674074074074075e-06, "loss": 0.01426762193441391, "step": 11400 }, { "epoch": 11.4, "eval_0_to_0": 9444, "eval_0_to_1": 595, "eval_1_to_0": 695, "eval_1_to_1": 9266, "eval_accuracy": 0.9355, "eval_loss": 0.5135928988456726, "eval_runtime": 130.7365, "eval_samples_per_second": 152.979, "eval_steps_per_second": 9.561, "step": 11400 }, { "epoch": 11.41, "grad_norm": 0.00864754430949688, "learning_rate": 2.6600000000000004e-06, "loss": 0.04562863111495972, "step": 11410 }, { "epoch": 11.42, "grad_norm": 0.11137008666992188, "learning_rate": 2.6525925925925928e-06, "loss": 0.0008349135518074035, "step": 11420 }, { "epoch": 11.42, "eval_0_to_0": 9499, "eval_0_to_1": 540, "eval_1_to_0": 761, "eval_1_to_1": 9200, "eval_accuracy": 0.93495, "eval_loss": 0.5309893488883972, "eval_runtime": 151.9319, "eval_samples_per_second": 131.638, "eval_steps_per_second": 8.227, "step": 11420 }, { "epoch": 11.43, "grad_norm": 0.009059912525117397, "learning_rate": 2.6451851851851856e-06, "loss": 0.0007705286145210267, "step": 11430 }, { "epoch": 11.44, "grad_norm": 0.004386010579764843, "learning_rate": 2.637777777777778e-06, "loss": 0.041251960396766665, "step": 11440 }, { "epoch": 11.44, "eval_0_to_0": 9445, "eval_0_to_1": 594, "eval_1_to_0": 703, "eval_1_to_1": 9258, "eval_accuracy": 0.93515, "eval_loss": 0.5259790420532227, "eval_runtime": 152.296, "eval_samples_per_second": 131.323, "eval_steps_per_second": 8.208, "step": 11440 }, { "epoch": 11.45, "grad_norm": 7.449676513671875, "learning_rate": 2.6303703703703704e-06, "loss": 0.08219911456108094, "step": 11450 }, { "epoch": 11.46, "grad_norm": 0.008567564189434052, "learning_rate": 2.622962962962963e-06, "loss": 0.0022639289498329164, "step": 11460 }, { "epoch": 11.46, "eval_0_to_0": 9484, "eval_0_to_1": 555, "eval_1_to_0": 734, "eval_1_to_1": 9227, "eval_accuracy": 0.93555, "eval_loss": 0.5294228792190552, "eval_runtime": 154.4442, "eval_samples_per_second": 129.497, "eval_steps_per_second": 8.094, "step": 11460 }, { "epoch": 11.47, "grad_norm": 1.3283367156982422, "learning_rate": 2.6155555555555556e-06, "loss": 0.056289398670196535, "step": 11470 }, { "epoch": 11.48, "grad_norm": 0.03252328559756279, "learning_rate": 2.6081481481481484e-06, "loss": 0.052693134546279906, "step": 11480 }, { "epoch": 11.48, "eval_0_to_0": 9458, "eval_0_to_1": 581, "eval_1_to_0": 703, "eval_1_to_1": 9258, "eval_accuracy": 0.9358, "eval_loss": 0.5148423910140991, "eval_runtime": 151.1669, "eval_samples_per_second": 132.304, "eval_steps_per_second": 8.269, "step": 11480 }, { "epoch": 11.49, "grad_norm": 0.01250401884317398, "learning_rate": 2.600740740740741e-06, "loss": 0.031084084510803224, "step": 11490 }, { "epoch": 11.5, "grad_norm": 36.85783004760742, "learning_rate": 2.5933333333333336e-06, "loss": 0.14265507459640503, "step": 11500 }, { "epoch": 11.5, "eval_0_to_0": 9567, "eval_0_to_1": 472, "eval_1_to_0": 840, "eval_1_to_1": 9121, "eval_accuracy": 0.9344, "eval_loss": 0.5322693586349487, "eval_runtime": 139.9164, "eval_samples_per_second": 142.943, "eval_steps_per_second": 8.934, "step": 11500 }, { "epoch": 11.51, "grad_norm": 0.022648602724075317, "learning_rate": 2.585925925925926e-06, "loss": 0.08665004968643189, "step": 11510 }, { "epoch": 11.52, "grad_norm": 0.05115775391459465, "learning_rate": 2.5785185185185184e-06, "loss": 0.01345735639333725, "step": 11520 }, { "epoch": 11.52, "eval_0_to_0": 9413, "eval_0_to_1": 626, "eval_1_to_0": 659, "eval_1_to_1": 9302, "eval_accuracy": 0.93575, "eval_loss": 0.4981171786785126, "eval_runtime": 78.6356, "eval_samples_per_second": 254.338, "eval_steps_per_second": 15.896, "step": 11520 }, { "epoch": 11.53, "grad_norm": 25.55598258972168, "learning_rate": 2.5711111111111112e-06, "loss": 0.03834057152271271, "step": 11530 }, { "epoch": 11.54, "grad_norm": 7.235098838806152, "learning_rate": 2.5637037037037036e-06, "loss": 0.05705171823501587, "step": 11540 }, { "epoch": 11.54, "eval_0_to_0": 9321, "eval_0_to_1": 718, "eval_1_to_0": 599, "eval_1_to_1": 9362, "eval_accuracy": 0.93415, "eval_loss": 0.49940821528434753, "eval_runtime": 59.842, "eval_samples_per_second": 334.214, "eval_steps_per_second": 20.888, "step": 11540 }, { "epoch": 11.55, "grad_norm": 0.012156430631875992, "learning_rate": 2.556296296296297e-06, "loss": 0.06037247776985168, "step": 11550 }, { "epoch": 11.56, "grad_norm": 0.018621988594532013, "learning_rate": 2.5488888888888893e-06, "loss": 0.0010603152215480805, "step": 11560 }, { "epoch": 11.56, "eval_0_to_0": 9486, "eval_0_to_1": 553, "eval_1_to_0": 734, "eval_1_to_1": 9227, "eval_accuracy": 0.93565, "eval_loss": 0.5104216933250427, "eval_runtime": 67.9264, "eval_samples_per_second": 294.436, "eval_steps_per_second": 18.402, "step": 11560 }, { "epoch": 11.57, "grad_norm": 0.009142967872321606, "learning_rate": 2.5414814814814813e-06, "loss": 0.023054946959018708, "step": 11570 }, { "epoch": 11.58, "grad_norm": 0.00959931593388319, "learning_rate": 2.5340740740740745e-06, "loss": 0.055179363489151, "step": 11580 }, { "epoch": 11.58, "eval_0_to_0": 9477, "eval_0_to_1": 562, "eval_1_to_0": 713, "eval_1_to_1": 9248, "eval_accuracy": 0.93625, "eval_loss": 0.5084747076034546, "eval_runtime": 70.4883, "eval_samples_per_second": 283.735, "eval_steps_per_second": 17.733, "step": 11580 }, { "epoch": 11.59, "grad_norm": 0.006177751813083887, "learning_rate": 2.526666666666667e-06, "loss": 0.0669553518295288, "step": 11590 }, { "epoch": 11.6, "grad_norm": 0.07993147522211075, "learning_rate": 2.5192592592592597e-06, "loss": 0.08213176131248474, "step": 11600 }, { "epoch": 11.6, "eval_0_to_0": 9507, "eval_0_to_1": 532, "eval_1_to_0": 759, "eval_1_to_1": 9202, "eval_accuracy": 0.93545, "eval_loss": 0.5104625225067139, "eval_runtime": 60.3163, "eval_samples_per_second": 331.585, "eval_steps_per_second": 20.724, "step": 11600 }, { "epoch": 11.61, "grad_norm": 0.01633399724960327, "learning_rate": 2.511851851851852e-06, "loss": 0.013580778241157531, "step": 11610 }, { "epoch": 11.62, "grad_norm": 29.076705932617188, "learning_rate": 2.504444444444445e-06, "loss": 0.04926639795303345, "step": 11620 }, { "epoch": 11.62, "eval_0_to_0": 9515, "eval_0_to_1": 524, "eval_1_to_0": 764, "eval_1_to_1": 9197, "eval_accuracy": 0.9356, "eval_loss": 0.5079311728477478, "eval_runtime": 60.4575, "eval_samples_per_second": 330.811, "eval_steps_per_second": 20.676, "step": 11620 }, { "epoch": 11.63, "grad_norm": 0.023019688203930855, "learning_rate": 2.4970370370370373e-06, "loss": 0.001186239719390869, "step": 11630 }, { "epoch": 11.64, "grad_norm": 0.007373001426458359, "learning_rate": 2.4896296296296297e-06, "loss": 0.0009701095521450042, "step": 11640 }, { "epoch": 11.64, "eval_0_to_0": 9566, "eval_0_to_1": 473, "eval_1_to_0": 819, "eval_1_to_1": 9142, "eval_accuracy": 0.9354, "eval_loss": 0.5209604501724243, "eval_runtime": 59.853, "eval_samples_per_second": 334.152, "eval_steps_per_second": 20.885, "step": 11640 }, { "epoch": 11.65, "grad_norm": 0.007654887158423662, "learning_rate": 2.4822222222222225e-06, "loss": 0.07398051023483276, "step": 11650 }, { "epoch": 11.66, "grad_norm": 0.05948075279593468, "learning_rate": 2.474814814814815e-06, "loss": 0.1510694980621338, "step": 11660 }, { "epoch": 11.66, "eval_0_to_0": 9439, "eval_0_to_1": 600, "eval_1_to_0": 658, "eval_1_to_1": 9303, "eval_accuracy": 0.9371, "eval_loss": 0.48855048418045044, "eval_runtime": 59.6864, "eval_samples_per_second": 335.085, "eval_steps_per_second": 20.943, "step": 11660 }, { "epoch": 11.67, "grad_norm": 0.8338013291358948, "learning_rate": 2.4674074074074073e-06, "loss": 0.00313478410243988, "step": 11670 }, { "epoch": 11.68, "grad_norm": 0.025429485365748405, "learning_rate": 2.46e-06, "loss": 0.08500757813453674, "step": 11680 }, { "epoch": 11.68, "eval_0_to_0": 9534, "eval_0_to_1": 505, "eval_1_to_0": 780, "eval_1_to_1": 9181, "eval_accuracy": 0.93575, "eval_loss": 0.49026864767074585, "eval_runtime": 59.4989, "eval_samples_per_second": 336.141, "eval_steps_per_second": 21.009, "step": 11680 }, { "epoch": 11.69, "grad_norm": 0.08026034384965897, "learning_rate": 2.452592592592593e-06, "loss": 0.024329674243927003, "step": 11690 }, { "epoch": 11.7, "grad_norm": 0.029364310204982758, "learning_rate": 2.4451851851851854e-06, "loss": 0.0026109136641025545, "step": 11700 }, { "epoch": 11.7, "eval_0_to_0": 9475, "eval_0_to_1": 564, "eval_1_to_0": 712, "eval_1_to_1": 9249, "eval_accuracy": 0.9362, "eval_loss": 0.4842020869255066, "eval_runtime": 59.4714, "eval_samples_per_second": 336.296, "eval_steps_per_second": 21.018, "step": 11700 }, { "epoch": 11.71, "grad_norm": 0.020996812731027603, "learning_rate": 2.437777777777778e-06, "loss": 0.06507392525672913, "step": 11710 }, { "epoch": 11.72, "grad_norm": 0.02626553550362587, "learning_rate": 2.4303703703703706e-06, "loss": 0.0028071537613868713, "step": 11720 }, { "epoch": 11.72, "eval_0_to_0": 9425, "eval_0_to_1": 614, "eval_1_to_0": 649, "eval_1_to_1": 9312, "eval_accuracy": 0.93685, "eval_loss": 0.4860149323940277, "eval_runtime": 59.1264, "eval_samples_per_second": 338.259, "eval_steps_per_second": 21.141, "step": 11720 }, { "epoch": 11.73, "grad_norm": 0.03430541604757309, "learning_rate": 2.422962962962963e-06, "loss": 0.0010307490825653075, "step": 11730 }, { "epoch": 11.74, "grad_norm": 0.005277999676764011, "learning_rate": 2.415555555555556e-06, "loss": 0.0008131995797157288, "step": 11740 }, { "epoch": 11.74, "eval_0_to_0": 9488, "eval_0_to_1": 551, "eval_1_to_0": 727, "eval_1_to_1": 9234, "eval_accuracy": 0.9361, "eval_loss": 0.5049183964729309, "eval_runtime": 59.8202, "eval_samples_per_second": 334.335, "eval_steps_per_second": 20.896, "step": 11740 }, { "epoch": 11.75, "grad_norm": 0.04122419282793999, "learning_rate": 2.4081481481481482e-06, "loss": 0.007275016605854034, "step": 11750 }, { "epoch": 11.76, "grad_norm": 0.004642113111913204, "learning_rate": 2.400740740740741e-06, "loss": 0.0030780866742134093, "step": 11760 }, { "epoch": 11.76, "eval_0_to_0": 9356, "eval_0_to_1": 683, "eval_1_to_0": 603, "eval_1_to_1": 9358, "eval_accuracy": 0.9357, "eval_loss": 0.5008697509765625, "eval_runtime": 59.1959, "eval_samples_per_second": 337.861, "eval_steps_per_second": 21.116, "step": 11760 }, { "epoch": 11.77, "grad_norm": 0.006936392281204462, "learning_rate": 2.3933333333333334e-06, "loss": 0.06285472512245179, "step": 11770 }, { "epoch": 11.78, "grad_norm": 0.003958950750529766, "learning_rate": 2.3859259259259263e-06, "loss": 0.0179930716753006, "step": 11780 }, { "epoch": 11.78, "eval_0_to_0": 9537, "eval_0_to_1": 502, "eval_1_to_0": 788, "eval_1_to_1": 9173, "eval_accuracy": 0.9355, "eval_loss": 0.5240128636360168, "eval_runtime": 80.9297, "eval_samples_per_second": 247.128, "eval_steps_per_second": 15.446, "step": 11780 }, { "epoch": 11.79, "grad_norm": 0.040798742324113846, "learning_rate": 2.3785185185185186e-06, "loss": 0.045887550711631774, "step": 11790 }, { "epoch": 11.8, "grad_norm": 0.0058241914957761765, "learning_rate": 2.371111111111111e-06, "loss": 0.12175391912460327, "step": 11800 }, { "epoch": 11.8, "eval_0_to_0": 9593, "eval_0_to_1": 446, "eval_1_to_0": 849, "eval_1_to_1": 9112, "eval_accuracy": 0.93525, "eval_loss": 0.5395684838294983, "eval_runtime": 59.8783, "eval_samples_per_second": 334.011, "eval_steps_per_second": 20.876, "step": 11800 }, { "epoch": 11.81, "grad_norm": 0.005350231193006039, "learning_rate": 2.363703703703704e-06, "loss": 0.0833046555519104, "step": 11810 }, { "epoch": 11.82, "grad_norm": 0.3578232526779175, "learning_rate": 2.3562962962962967e-06, "loss": 0.0007050462067127228, "step": 11820 }, { "epoch": 11.82, "eval_0_to_0": 9495, "eval_0_to_1": 544, "eval_1_to_0": 720, "eval_1_to_1": 9241, "eval_accuracy": 0.9368, "eval_loss": 0.5056632161140442, "eval_runtime": 59.8563, "eval_samples_per_second": 334.133, "eval_steps_per_second": 20.883, "step": 11820 }, { "epoch": 11.83, "grad_norm": 0.004023501183837652, "learning_rate": 2.348888888888889e-06, "loss": 0.004809891432523727, "step": 11830 }, { "epoch": 11.84, "grad_norm": 0.005757517646998167, "learning_rate": 2.341481481481482e-06, "loss": 0.06353347897529601, "step": 11840 }, { "epoch": 11.84, "eval_0_to_0": 9504, "eval_0_to_1": 535, "eval_1_to_0": 736, "eval_1_to_1": 9225, "eval_accuracy": 0.93645, "eval_loss": 0.5113571882247925, "eval_runtime": 59.6135, "eval_samples_per_second": 335.495, "eval_steps_per_second": 20.968, "step": 11840 }, { "epoch": 11.85, "grad_norm": 0.022380929440259933, "learning_rate": 2.3340740740740743e-06, "loss": 0.018210753798484802, "step": 11850 }, { "epoch": 11.86, "grad_norm": 0.022699739784002304, "learning_rate": 2.3266666666666667e-06, "loss": 0.024023362994194032, "step": 11860 }, { "epoch": 11.86, "eval_0_to_0": 9414, "eval_0_to_1": 625, "eval_1_to_0": 625, "eval_1_to_1": 9336, "eval_accuracy": 0.9375, "eval_loss": 0.504008948802948, "eval_runtime": 59.7184, "eval_samples_per_second": 334.905, "eval_steps_per_second": 20.932, "step": 11860 }, { "epoch": 11.87, "grad_norm": 0.00964110717177391, "learning_rate": 2.3192592592592595e-06, "loss": 0.0009114615619182587, "step": 11870 }, { "epoch": 11.88, "grad_norm": 10.830622673034668, "learning_rate": 2.311851851851852e-06, "loss": 0.0020339354872703553, "step": 11880 }, { "epoch": 11.88, "eval_0_to_0": 9426, "eval_0_to_1": 613, "eval_1_to_0": 635, "eval_1_to_1": 9326, "eval_accuracy": 0.9376, "eval_loss": 0.5082970261573792, "eval_runtime": 60.1324, "eval_samples_per_second": 332.599, "eval_steps_per_second": 20.787, "step": 11880 }, { "epoch": 11.89, "grad_norm": 0.002537025138735771, "learning_rate": 2.3044444444444447e-06, "loss": 0.02397069036960602, "step": 11890 }, { "epoch": 11.9, "grad_norm": 0.004974278621375561, "learning_rate": 2.2970370370370376e-06, "loss": 0.034735456109046936, "step": 11900 }, { "epoch": 11.9, "eval_0_to_0": 9405, "eval_0_to_1": 634, "eval_1_to_0": 627, "eval_1_to_1": 9334, "eval_accuracy": 0.93695, "eval_loss": 0.5125138163566589, "eval_runtime": 60.6576, "eval_samples_per_second": 329.72, "eval_steps_per_second": 20.607, "step": 11900 }, { "epoch": 11.91, "grad_norm": 0.06587546318769455, "learning_rate": 2.2896296296296295e-06, "loss": 0.04390057921409607, "step": 11910 }, { "epoch": 11.92, "grad_norm": 0.0021769467275589705, "learning_rate": 2.2822222222222223e-06, "loss": 0.0003759503364562988, "step": 11920 }, { "epoch": 11.92, "eval_0_to_0": 9448, "eval_0_to_1": 591, "eval_1_to_0": 669, "eval_1_to_1": 9292, "eval_accuracy": 0.937, "eval_loss": 0.5178016424179077, "eval_runtime": 60.5653, "eval_samples_per_second": 330.222, "eval_steps_per_second": 20.639, "step": 11920 }, { "epoch": 11.93, "grad_norm": 0.02610855922102928, "learning_rate": 2.274814814814815e-06, "loss": 0.09669926166534423, "step": 11930 }, { "epoch": 11.94, "grad_norm": 0.2395300716161728, "learning_rate": 2.2674074074074076e-06, "loss": 0.0004602566361427307, "step": 11940 }, { "epoch": 11.94, "eval_0_to_0": 9415, "eval_0_to_1": 624, "eval_1_to_0": 644, "eval_1_to_1": 9317, "eval_accuracy": 0.9366, "eval_loss": 0.5169689059257507, "eval_runtime": 60.224, "eval_samples_per_second": 332.093, "eval_steps_per_second": 20.756, "step": 11940 }, { "epoch": 11.95, "grad_norm": 0.003981083631515503, "learning_rate": 2.2600000000000004e-06, "loss": 0.013666680455207825, "step": 11950 }, { "epoch": 11.96, "grad_norm": 0.003641855902969837, "learning_rate": 2.2525925925925928e-06, "loss": 0.06591833233833314, "step": 11960 }, { "epoch": 11.96, "eval_0_to_0": 9354, "eval_0_to_1": 685, "eval_1_to_0": 590, "eval_1_to_1": 9371, "eval_accuracy": 0.93625, "eval_loss": 0.5121898055076599, "eval_runtime": 59.7228, "eval_samples_per_second": 334.88, "eval_steps_per_second": 20.93, "step": 11960 }, { "epoch": 11.97, "grad_norm": 0.061033718287944794, "learning_rate": 2.245185185185185e-06, "loss": 0.08359957337379456, "step": 11970 }, { "epoch": 11.98, "grad_norm": 52.030391693115234, "learning_rate": 2.237777777777778e-06, "loss": 0.15066051483154297, "step": 11980 }, { "epoch": 11.98, "eval_0_to_0": 9531, "eval_0_to_1": 508, "eval_1_to_0": 766, "eval_1_to_1": 9195, "eval_accuracy": 0.9363, "eval_loss": 0.5120214819908142, "eval_runtime": 88.5854, "eval_samples_per_second": 225.771, "eval_steps_per_second": 14.111, "step": 11980 }, { "epoch": 11.99, "grad_norm": 19.327272415161133, "learning_rate": 2.2303703703703704e-06, "loss": 0.00826091468334198, "step": 11990 }, { "epoch": 12.0, "grad_norm": 0.13604764640331268, "learning_rate": 2.2229629629629632e-06, "loss": 0.04897560179233551, "step": 12000 }, { "epoch": 12.0, "eval_0_to_0": 9498, "eval_0_to_1": 541, "eval_1_to_0": 728, "eval_1_to_1": 9233, "eval_accuracy": 0.93655, "eval_loss": 0.49754810333251953, "eval_runtime": 60.1541, "eval_samples_per_second": 332.48, "eval_steps_per_second": 20.78, "step": 12000 }, { "epoch": 12.01, "grad_norm": 0.0724397674202919, "learning_rate": 2.2155555555555556e-06, "loss": 0.0071398340165615085, "step": 12010 }, { "epoch": 12.02, "grad_norm": 0.010816550813615322, "learning_rate": 2.2081481481481484e-06, "loss": 0.043632298707962036, "step": 12020 }, { "epoch": 12.02, "eval_0_to_0": 9477, "eval_0_to_1": 562, "eval_1_to_0": 726, "eval_1_to_1": 9235, "eval_accuracy": 0.9356, "eval_loss": 0.5046652555465698, "eval_runtime": 60.1177, "eval_samples_per_second": 332.681, "eval_steps_per_second": 20.793, "step": 12020 }, { "epoch": 12.03, "grad_norm": 0.00992609653621912, "learning_rate": 2.200740740740741e-06, "loss": 0.03725685477256775, "step": 12030 }, { "epoch": 12.04, "grad_norm": 12.166139602661133, "learning_rate": 2.1933333333333332e-06, "loss": 0.0027857445180416106, "step": 12040 }, { "epoch": 12.04, "eval_0_to_0": 9463, "eval_0_to_1": 576, "eval_1_to_0": 692, "eval_1_to_1": 9269, "eval_accuracy": 0.9366, "eval_loss": 0.5039086937904358, "eval_runtime": 59.792, "eval_samples_per_second": 334.493, "eval_steps_per_second": 20.906, "step": 12040 }, { "epoch": 12.05, "grad_norm": 1.1222747564315796, "learning_rate": 2.185925925925926e-06, "loss": 0.026977673172950745, "step": 12050 }, { "epoch": 12.06, "grad_norm": 0.009961044415831566, "learning_rate": 2.178518518518519e-06, "loss": 0.0006972603499889374, "step": 12060 }, { "epoch": 12.06, "eval_0_to_0": 9551, "eval_0_to_1": 488, "eval_1_to_0": 771, "eval_1_to_1": 9190, "eval_accuracy": 0.93705, "eval_loss": 0.517250120639801, "eval_runtime": 59.8968, "eval_samples_per_second": 333.908, "eval_steps_per_second": 20.869, "step": 12060 }, { "epoch": 12.07, "grad_norm": 0.004056219011545181, "learning_rate": 2.1711111111111113e-06, "loss": 0.003307734429836273, "step": 12070 }, { "epoch": 12.08, "grad_norm": 0.005718663800507784, "learning_rate": 2.163703703703704e-06, "loss": 0.0007808059453964233, "step": 12080 }, { "epoch": 12.08, "eval_0_to_0": 9519, "eval_0_to_1": 520, "eval_1_to_0": 746, "eval_1_to_1": 9215, "eval_accuracy": 0.9367, "eval_loss": 0.5169218182563782, "eval_runtime": 59.8895, "eval_samples_per_second": 333.948, "eval_steps_per_second": 20.872, "step": 12080 }, { "epoch": 12.09, "grad_norm": 5.616327285766602, "learning_rate": 2.1562962962962965e-06, "loss": 0.043594980239868165, "step": 12090 }, { "epoch": 12.1, "grad_norm": 0.012097339145839214, "learning_rate": 2.148888888888889e-06, "loss": 0.000502786785364151, "step": 12100 }, { "epoch": 12.1, "eval_0_to_0": 9440, "eval_0_to_1": 599, "eval_1_to_0": 652, "eval_1_to_1": 9309, "eval_accuracy": 0.93745, "eval_loss": 0.506263017654419, "eval_runtime": 59.3551, "eval_samples_per_second": 336.955, "eval_steps_per_second": 21.06, "step": 12100 }, { "epoch": 12.11, "grad_norm": 0.0029168156906962395, "learning_rate": 2.1414814814814817e-06, "loss": 0.0394674152135849, "step": 12110 }, { "epoch": 12.12, "grad_norm": 0.0037420233711600304, "learning_rate": 2.134074074074074e-06, "loss": 0.055394822359085084, "step": 12120 }, { "epoch": 12.12, "eval_0_to_0": 9511, "eval_0_to_1": 528, "eval_1_to_0": 719, "eval_1_to_1": 9242, "eval_accuracy": 0.93765, "eval_loss": 0.5163881778717041, "eval_runtime": 134.3088, "eval_samples_per_second": 148.911, "eval_steps_per_second": 9.307, "step": 12120 }, { "epoch": 12.13, "grad_norm": 0.007318310905247927, "learning_rate": 2.126666666666667e-06, "loss": 0.10907357931137085, "step": 12130 }, { "epoch": 12.14, "grad_norm": 0.004044190049171448, "learning_rate": 2.1192592592592593e-06, "loss": 0.040826189517974856, "step": 12140 }, { "epoch": 12.14, "eval_0_to_0": 9394, "eval_0_to_1": 645, "eval_1_to_0": 609, "eval_1_to_1": 9352, "eval_accuracy": 0.9373, "eval_loss": 0.5022658705711365, "eval_runtime": 128.1572, "eval_samples_per_second": 156.058, "eval_steps_per_second": 9.754, "step": 12140 }, { "epoch": 12.15, "grad_norm": 0.009972241707146168, "learning_rate": 2.111851851851852e-06, "loss": 0.015845602750778197, "step": 12150 }, { "epoch": 12.16, "grad_norm": 0.017645085230469704, "learning_rate": 2.1044444444444445e-06, "loss": 0.0025252893567085264, "step": 12160 }, { "epoch": 12.16, "eval_0_to_0": 9387, "eval_0_to_1": 652, "eval_1_to_0": 602, "eval_1_to_1": 9359, "eval_accuracy": 0.9373, "eval_loss": 0.49945566058158875, "eval_runtime": 125.8205, "eval_samples_per_second": 158.957, "eval_steps_per_second": 9.935, "step": 12160 }, { "epoch": 12.17, "grad_norm": 0.006004078779369593, "learning_rate": 2.0970370370370374e-06, "loss": 0.003350086510181427, "step": 12170 }, { "epoch": 12.18, "grad_norm": 0.006245344411581755, "learning_rate": 2.0896296296296297e-06, "loss": 0.0029299892485141754, "step": 12180 }, { "epoch": 12.18, "eval_0_to_0": 9488, "eval_0_to_1": 551, "eval_1_to_0": 702, "eval_1_to_1": 9259, "eval_accuracy": 0.93735, "eval_loss": 0.5094539523124695, "eval_runtime": 125.7968, "eval_samples_per_second": 158.987, "eval_steps_per_second": 9.937, "step": 12180 }, { "epoch": 12.19, "grad_norm": 106.74710083007812, "learning_rate": 2.0822222222222226e-06, "loss": 0.03248343467712402, "step": 12190 }, { "epoch": 12.2, "grad_norm": 0.006050940603017807, "learning_rate": 2.074814814814815e-06, "loss": 0.0004270508885383606, "step": 12200 }, { "epoch": 12.2, "eval_0_to_0": 9337, "eval_0_to_1": 702, "eval_1_to_0": 575, "eval_1_to_1": 9386, "eval_accuracy": 0.93615, "eval_loss": 0.5128539800643921, "eval_runtime": 128.9993, "eval_samples_per_second": 155.04, "eval_steps_per_second": 9.69, "step": 12200 }, { "epoch": 12.21, "grad_norm": 0.004807727411389351, "learning_rate": 2.0674074074074078e-06, "loss": 0.027291855216026305, "step": 12210 }, { "epoch": 12.22, "grad_norm": 0.022072702646255493, "learning_rate": 2.06e-06, "loss": 0.00038778185844421385, "step": 12220 }, { "epoch": 12.22, "eval_0_to_0": 9368, "eval_0_to_1": 671, "eval_1_to_0": 601, "eval_1_to_1": 9360, "eval_accuracy": 0.9364, "eval_loss": 0.5139499306678772, "eval_runtime": 126.3559, "eval_samples_per_second": 158.283, "eval_steps_per_second": 9.893, "step": 12220 }, { "epoch": 12.23, "grad_norm": 0.055137187242507935, "learning_rate": 2.0525925925925926e-06, "loss": 0.021004936099052428, "step": 12230 }, { "epoch": 12.24, "grad_norm": 0.00999461580067873, "learning_rate": 2.0451851851851854e-06, "loss": 0.024137167632579802, "step": 12240 }, { "epoch": 12.24, "eval_0_to_0": 9439, "eval_0_to_1": 600, "eval_1_to_0": 658, "eval_1_to_1": 9303, "eval_accuracy": 0.9371, "eval_loss": 0.5153567790985107, "eval_runtime": 127.6502, "eval_samples_per_second": 156.678, "eval_steps_per_second": 9.792, "step": 12240 }, { "epoch": 12.25, "grad_norm": 0.004474221263080835, "learning_rate": 2.037777777777778e-06, "loss": 0.00047479644417762755, "step": 12250 }, { "epoch": 12.26, "grad_norm": 0.002104370854794979, "learning_rate": 2.0303703703703706e-06, "loss": 0.0008513443171977997, "step": 12260 }, { "epoch": 12.26, "eval_0_to_0": 9479, "eval_0_to_1": 560, "eval_1_to_0": 697, "eval_1_to_1": 9264, "eval_accuracy": 0.93715, "eval_loss": 0.5181705951690674, "eval_runtime": 129.3708, "eval_samples_per_second": 154.594, "eval_steps_per_second": 9.662, "step": 12260 }, { "epoch": 12.27, "grad_norm": 0.00183614541310817, "learning_rate": 2.0229629629629634e-06, "loss": 0.00034607350826263426, "step": 12270 }, { "epoch": 12.28, "grad_norm": 0.003687411081045866, "learning_rate": 2.0155555555555554e-06, "loss": 0.0010053999722003937, "step": 12280 }, { "epoch": 12.28, "eval_0_to_0": 9513, "eval_0_to_1": 526, "eval_1_to_0": 730, "eval_1_to_1": 9231, "eval_accuracy": 0.9372, "eval_loss": 0.5259357690811157, "eval_runtime": 129.5344, "eval_samples_per_second": 154.399, "eval_steps_per_second": 9.65, "step": 12280 }, { "epoch": 12.29, "grad_norm": 1.5147804021835327, "learning_rate": 2.0081481481481482e-06, "loss": 0.11309733390808105, "step": 12290 }, { "epoch": 12.3, "grad_norm": 0.015488344244658947, "learning_rate": 2.000740740740741e-06, "loss": 0.0485792726278305, "step": 12300 }, { "epoch": 12.3, "eval_0_to_0": 9564, "eval_0_to_1": 475, "eval_1_to_0": 776, "eval_1_to_1": 9185, "eval_accuracy": 0.93745, "eval_loss": 0.5254876613616943, "eval_runtime": 128.6591, "eval_samples_per_second": 155.45, "eval_steps_per_second": 9.716, "step": 12300 }, { "epoch": 12.31, "grad_norm": 0.0065346332266926765, "learning_rate": 1.9933333333333334e-06, "loss": 0.041250354051589964, "step": 12310 }, { "epoch": 12.32, "grad_norm": 0.027812693268060684, "learning_rate": 1.9859259259259263e-06, "loss": 0.12746696472167968, "step": 12320 }, { "epoch": 12.32, "eval_0_to_0": 9534, "eval_0_to_1": 505, "eval_1_to_0": 751, "eval_1_to_1": 9210, "eval_accuracy": 0.9372, "eval_loss": 0.514129638671875, "eval_runtime": 127.8897, "eval_samples_per_second": 156.385, "eval_steps_per_second": 9.774, "step": 12320 }, { "epoch": 12.33, "grad_norm": 0.032376181334257126, "learning_rate": 1.9785185185185187e-06, "loss": 0.008490785956382751, "step": 12330 }, { "epoch": 12.34, "grad_norm": 13.196786880493164, "learning_rate": 1.971111111111111e-06, "loss": 0.07623605728149414, "step": 12340 }, { "epoch": 12.34, "eval_0_to_0": 9489, "eval_0_to_1": 550, "eval_1_to_0": 701, "eval_1_to_1": 9260, "eval_accuracy": 0.93745, "eval_loss": 0.5064353346824646, "eval_runtime": 127.6415, "eval_samples_per_second": 156.689, "eval_steps_per_second": 9.793, "step": 12340 }, { "epoch": 12.35, "grad_norm": 0.017041558399796486, "learning_rate": 1.963703703703704e-06, "loss": 0.02583451271057129, "step": 12350 }, { "epoch": 12.36, "grad_norm": 2.1799840927124023, "learning_rate": 1.9562962962962963e-06, "loss": 0.0010540932416915894, "step": 12360 }, { "epoch": 12.36, "eval_0_to_0": 9530, "eval_0_to_1": 509, "eval_1_to_0": 759, "eval_1_to_1": 9202, "eval_accuracy": 0.9366, "eval_loss": 0.5152592062950134, "eval_runtime": 130.6969, "eval_samples_per_second": 153.026, "eval_steps_per_second": 9.564, "step": 12360 }, { "epoch": 12.37, "grad_norm": 0.012370969168841839, "learning_rate": 1.948888888888889e-06, "loss": 0.004691407829523086, "step": 12370 }, { "epoch": 12.38, "grad_norm": 0.26840654015541077, "learning_rate": 1.9414814814814815e-06, "loss": 0.053583383560180664, "step": 12380 }, { "epoch": 12.38, "eval_0_to_0": 9500, "eval_0_to_1": 539, "eval_1_to_0": 724, "eval_1_to_1": 9237, "eval_accuracy": 0.93685, "eval_loss": 0.5085068345069885, "eval_runtime": 128.2383, "eval_samples_per_second": 155.96, "eval_steps_per_second": 9.747, "step": 12380 }, { "epoch": 12.39, "grad_norm": 0.010386684909462929, "learning_rate": 1.9340740740740743e-06, "loss": 0.001951291412115097, "step": 12390 }, { "epoch": 12.4, "grad_norm": 34.43218994140625, "learning_rate": 1.926666666666667e-06, "loss": 0.05850326418876648, "step": 12400 }, { "epoch": 12.4, "eval_0_to_0": 9471, "eval_0_to_1": 568, "eval_1_to_0": 691, "eval_1_to_1": 9270, "eval_accuracy": 0.93705, "eval_loss": 0.5069584846496582, "eval_runtime": 129.4515, "eval_samples_per_second": 154.498, "eval_steps_per_second": 9.656, "step": 12400 }, { "epoch": 12.41, "grad_norm": 0.009924179874360561, "learning_rate": 1.919259259259259e-06, "loss": 0.019648796319961546, "step": 12410 }, { "epoch": 12.42, "grad_norm": 0.014381413348019123, "learning_rate": 1.911851851851852e-06, "loss": 0.03327776193618774, "step": 12420 }, { "epoch": 12.42, "eval_0_to_0": 9413, "eval_0_to_1": 626, "eval_1_to_0": 643, "eval_1_to_1": 9318, "eval_accuracy": 0.93655, "eval_loss": 0.5030924081802368, "eval_runtime": 127.8137, "eval_samples_per_second": 156.478, "eval_steps_per_second": 9.78, "step": 12420 }, { "epoch": 12.43, "grad_norm": 0.008081049658358097, "learning_rate": 1.9044444444444445e-06, "loss": 0.001007494330406189, "step": 12430 }, { "epoch": 12.44, "grad_norm": 0.017298758029937744, "learning_rate": 1.8970370370370371e-06, "loss": 0.0025679446756839753, "step": 12440 }, { "epoch": 12.44, "eval_0_to_0": 9430, "eval_0_to_1": 609, "eval_1_to_0": 645, "eval_1_to_1": 9316, "eval_accuracy": 0.9373, "eval_loss": 0.5066362619400024, "eval_runtime": 125.3803, "eval_samples_per_second": 159.515, "eval_steps_per_second": 9.97, "step": 12440 }, { "epoch": 12.45, "grad_norm": 0.007380092982202768, "learning_rate": 1.88962962962963e-06, "loss": 0.06698558926582336, "step": 12450 }, { "epoch": 12.46, "grad_norm": 2.151066303253174, "learning_rate": 1.8822222222222226e-06, "loss": 0.04783016145229339, "step": 12460 }, { "epoch": 12.46, "eval_0_to_0": 9458, "eval_0_to_1": 581, "eval_1_to_0": 671, "eval_1_to_1": 9290, "eval_accuracy": 0.9374, "eval_loss": 0.5080729722976685, "eval_runtime": 124.6125, "eval_samples_per_second": 160.498, "eval_steps_per_second": 10.031, "step": 12460 }, { "epoch": 12.47, "grad_norm": 0.013659095391631126, "learning_rate": 1.8748148148148148e-06, "loss": 0.024844089150428773, "step": 12470 }, { "epoch": 12.48, "grad_norm": 0.23633335530757904, "learning_rate": 1.8674074074074076e-06, "loss": 0.039778131246566775, "step": 12480 }, { "epoch": 12.48, "eval_0_to_0": 9459, "eval_0_to_1": 580, "eval_1_to_0": 668, "eval_1_to_1": 9293, "eval_accuracy": 0.9376, "eval_loss": 0.5017130970954895, "eval_runtime": 124.8776, "eval_samples_per_second": 160.157, "eval_steps_per_second": 10.01, "step": 12480 }, { "epoch": 12.49, "grad_norm": 0.0915217325091362, "learning_rate": 1.8600000000000002e-06, "loss": 0.04445440173149109, "step": 12490 }, { "epoch": 12.5, "grad_norm": 0.05058787018060684, "learning_rate": 1.8525925925925928e-06, "loss": 0.04231067299842835, "step": 12500 }, { "epoch": 12.5, "eval_0_to_0": 9510, "eval_0_to_1": 529, "eval_1_to_0": 732, "eval_1_to_1": 9229, "eval_accuracy": 0.93695, "eval_loss": 0.5137093663215637, "eval_runtime": 124.7905, "eval_samples_per_second": 160.269, "eval_steps_per_second": 10.017, "step": 12500 }, { "epoch": 12.51, "grad_norm": 0.08954427391290665, "learning_rate": 1.8451851851851854e-06, "loss": 0.017630457878112793, "step": 12510 }, { "epoch": 12.52, "grad_norm": 0.043875399976968765, "learning_rate": 1.837777777777778e-06, "loss": 0.024853907525539398, "step": 12520 }, { "epoch": 12.52, "eval_0_to_0": 9459, "eval_0_to_1": 580, "eval_1_to_0": 686, "eval_1_to_1": 9275, "eval_accuracy": 0.9367, "eval_loss": 0.512823224067688, "eval_runtime": 125.1029, "eval_samples_per_second": 159.868, "eval_steps_per_second": 9.992, "step": 12520 }, { "epoch": 12.53, "grad_norm": 0.1665221005678177, "learning_rate": 1.8303703703703704e-06, "loss": 0.03509292006492615, "step": 12530 }, { "epoch": 12.54, "grad_norm": 0.01652892306447029, "learning_rate": 1.822962962962963e-06, "loss": 0.031739482283592226, "step": 12540 }, { "epoch": 12.54, "eval_0_to_0": 9347, "eval_0_to_1": 692, "eval_1_to_0": 591, "eval_1_to_1": 9370, "eval_accuracy": 0.93585, "eval_loss": 0.5106732249259949, "eval_runtime": 125.4665, "eval_samples_per_second": 159.405, "eval_steps_per_second": 9.963, "step": 12540 }, { "epoch": 12.55, "grad_norm": 0.02159924991428852, "learning_rate": 1.8155555555555556e-06, "loss": 0.0007437802851200104, "step": 12550 }, { "epoch": 12.56, "grad_norm": 0.014272920787334442, "learning_rate": 1.8081481481481482e-06, "loss": 0.0009586438536643982, "step": 12560 }, { "epoch": 12.56, "eval_0_to_0": 9433, "eval_0_to_1": 606, "eval_1_to_0": 655, "eval_1_to_1": 9306, "eval_accuracy": 0.93695, "eval_loss": 0.5176247358322144, "eval_runtime": 125.3695, "eval_samples_per_second": 159.528, "eval_steps_per_second": 9.971, "step": 12560 }, { "epoch": 12.57, "grad_norm": 0.0038967628497630358, "learning_rate": 1.800740740740741e-06, "loss": 0.01789948493242264, "step": 12570 }, { "epoch": 12.58, "grad_norm": 0.040583934634923935, "learning_rate": 1.7933333333333337e-06, "loss": 0.01180986613035202, "step": 12580 }, { "epoch": 12.58, "eval_0_to_0": 9575, "eval_0_to_1": 464, "eval_1_to_0": 827, "eval_1_to_1": 9134, "eval_accuracy": 0.93545, "eval_loss": 0.5479580760002136, "eval_runtime": 125.0688, "eval_samples_per_second": 159.912, "eval_steps_per_second": 9.994, "step": 12580 }, { "epoch": 12.59, "grad_norm": 0.009973032400012016, "learning_rate": 1.7859259259259259e-06, "loss": 0.03760495185852051, "step": 12590 }, { "epoch": 12.6, "grad_norm": 0.00528656505048275, "learning_rate": 1.7785185185185187e-06, "loss": 0.0006017267704010009, "step": 12600 }, { "epoch": 12.6, "eval_0_to_0": 9502, "eval_0_to_1": 537, "eval_1_to_0": 718, "eval_1_to_1": 9243, "eval_accuracy": 0.93725, "eval_loss": 0.5309868454933167, "eval_runtime": 125.3977, "eval_samples_per_second": 159.493, "eval_steps_per_second": 9.968, "step": 12600 }, { "epoch": 12.61, "grad_norm": 0.5162851214408875, "learning_rate": 1.7711111111111113e-06, "loss": 0.09707964658737182, "step": 12610 }, { "epoch": 12.62, "grad_norm": 4.285152912139893, "learning_rate": 1.7637037037037039e-06, "loss": 0.005072926729917526, "step": 12620 }, { "epoch": 12.62, "eval_0_to_0": 9465, "eval_0_to_1": 574, "eval_1_to_0": 685, "eval_1_to_1": 9276, "eval_accuracy": 0.93705, "eval_loss": 0.5164214968681335, "eval_runtime": 125.295, "eval_samples_per_second": 159.623, "eval_steps_per_second": 9.976, "step": 12620 }, { "epoch": 12.63, "grad_norm": 47.602725982666016, "learning_rate": 1.7562962962962965e-06, "loss": 0.01457175612449646, "step": 12630 }, { "epoch": 12.64, "grad_norm": 0.011679953895509243, "learning_rate": 1.7488888888888891e-06, "loss": 0.0011175356805324555, "step": 12640 }, { "epoch": 12.64, "eval_0_to_0": 9369, "eval_0_to_1": 670, "eval_1_to_0": 608, "eval_1_to_1": 9353, "eval_accuracy": 0.9361, "eval_loss": 0.5190005898475647, "eval_runtime": 125.1262, "eval_samples_per_second": 159.839, "eval_steps_per_second": 9.99, "step": 12640 }, { "epoch": 12.65, "grad_norm": 0.01889054663479328, "learning_rate": 1.7414814814814815e-06, "loss": 0.03509917259216309, "step": 12650 }, { "epoch": 12.66, "grad_norm": 0.017065025866031647, "learning_rate": 1.7340740740740741e-06, "loss": 0.013214872777462005, "step": 12660 }, { "epoch": 12.66, "eval_0_to_0": 9459, "eval_0_to_1": 580, "eval_1_to_0": 674, "eval_1_to_1": 9287, "eval_accuracy": 0.9373, "eval_loss": 0.5210551619529724, "eval_runtime": 124.7321, "eval_samples_per_second": 160.344, "eval_steps_per_second": 10.021, "step": 12660 }, { "epoch": 12.67, "grad_norm": 0.029501182958483696, "learning_rate": 1.7266666666666667e-06, "loss": 0.0016662172973155975, "step": 12670 }, { "epoch": 12.68, "grad_norm": 0.07106950879096985, "learning_rate": 1.7192592592592593e-06, "loss": 0.0069459758698940275, "step": 12680 }, { "epoch": 12.68, "eval_0_to_0": 9486, "eval_0_to_1": 553, "eval_1_to_0": 700, "eval_1_to_1": 9261, "eval_accuracy": 0.93735, "eval_loss": 0.5294158458709717, "eval_runtime": 120.6236, "eval_samples_per_second": 165.805, "eval_steps_per_second": 10.363, "step": 12680 }, { "epoch": 12.69, "grad_norm": 0.013056216761469841, "learning_rate": 1.711851851851852e-06, "loss": 0.024598488211631776, "step": 12690 }, { "epoch": 12.7, "grad_norm": 0.01288336981087923, "learning_rate": 1.7044444444444448e-06, "loss": 0.06557945013046265, "step": 12700 }, { "epoch": 12.7, "eval_0_to_0": 9544, "eval_0_to_1": 495, "eval_1_to_0": 757, "eval_1_to_1": 9204, "eval_accuracy": 0.9374, "eval_loss": 0.5396151542663574, "eval_runtime": 115.1969, "eval_samples_per_second": 173.616, "eval_steps_per_second": 10.851, "step": 12700 }, { "epoch": 12.71, "grad_norm": 0.03029964119195938, "learning_rate": 1.697037037037037e-06, "loss": 0.0006464935839176178, "step": 12710 }, { "epoch": 12.72, "grad_norm": 0.00960961077362299, "learning_rate": 1.6896296296296298e-06, "loss": 0.026335620880126955, "step": 12720 }, { "epoch": 12.72, "eval_0_to_0": 9507, "eval_0_to_1": 532, "eval_1_to_0": 722, "eval_1_to_1": 9239, "eval_accuracy": 0.9373, "eval_loss": 0.5309389233589172, "eval_runtime": 113.7137, "eval_samples_per_second": 175.88, "eval_steps_per_second": 10.993, "step": 12720 }, { "epoch": 12.73, "grad_norm": 0.01262795738875866, "learning_rate": 1.6822222222222224e-06, "loss": 0.0012387841939926147, "step": 12730 }, { "epoch": 12.74, "grad_norm": 0.031598642468452454, "learning_rate": 1.674814814814815e-06, "loss": 0.09672800302505494, "step": 12740 }, { "epoch": 12.74, "eval_0_to_0": 9422, "eval_0_to_1": 617, "eval_1_to_0": 640, "eval_1_to_1": 9321, "eval_accuracy": 0.93715, "eval_loss": 0.525152862071991, "eval_runtime": 113.1391, "eval_samples_per_second": 176.773, "eval_steps_per_second": 11.048, "step": 12740 }, { "epoch": 12.75, "grad_norm": 0.033513784408569336, "learning_rate": 1.6674074074074076e-06, "loss": 0.007438556849956512, "step": 12750 }, { "epoch": 12.76, "grad_norm": 0.04710749164223671, "learning_rate": 1.6600000000000002e-06, "loss": 0.0005372852087020874, "step": 12760 }, { "epoch": 12.76, "eval_0_to_0": 9494, "eval_0_to_1": 545, "eval_1_to_0": 711, "eval_1_to_1": 9250, "eval_accuracy": 0.9372, "eval_loss": 0.5309886932373047, "eval_runtime": 112.0494, "eval_samples_per_second": 178.493, "eval_steps_per_second": 11.156, "step": 12760 }, { "epoch": 12.77, "grad_norm": 0.08010058850049973, "learning_rate": 1.6525925925925928e-06, "loss": 0.002297704666852951, "step": 12770 }, { "epoch": 12.78, "grad_norm": 0.00342345773242414, "learning_rate": 1.6451851851851852e-06, "loss": 0.02864390015602112, "step": 12780 }, { "epoch": 12.78, "eval_0_to_0": 9465, "eval_0_to_1": 574, "eval_1_to_0": 691, "eval_1_to_1": 9270, "eval_accuracy": 0.93675, "eval_loss": 0.5299339890480042, "eval_runtime": 111.3674, "eval_samples_per_second": 179.586, "eval_steps_per_second": 11.224, "step": 12780 }, { "epoch": 12.79, "grad_norm": 17.660810470581055, "learning_rate": 1.6377777777777778e-06, "loss": 0.002637137472629547, "step": 12790 }, { "epoch": 12.8, "grad_norm": 0.015483150258660316, "learning_rate": 1.6303703703703704e-06, "loss": 0.10056387186050415, "step": 12800 }, { "epoch": 12.8, "eval_0_to_0": 9499, "eval_0_to_1": 540, "eval_1_to_0": 713, "eval_1_to_1": 9248, "eval_accuracy": 0.93735, "eval_loss": 0.5308607220649719, "eval_runtime": 110.863, "eval_samples_per_second": 180.403, "eval_steps_per_second": 11.275, "step": 12800 }, { "epoch": 12.81, "grad_norm": 4.837775230407715, "learning_rate": 1.622962962962963e-06, "loss": 0.03846010267734527, "step": 12810 }, { "epoch": 12.82, "grad_norm": 0.011670227162539959, "learning_rate": 1.6155555555555559e-06, "loss": 0.056523317098617555, "step": 12820 }, { "epoch": 12.82, "eval_0_to_0": 9537, "eval_0_to_1": 502, "eval_1_to_0": 753, "eval_1_to_1": 9208, "eval_accuracy": 0.93725, "eval_loss": 0.5337839126586914, "eval_runtime": 110.4374, "eval_samples_per_second": 181.098, "eval_steps_per_second": 11.319, "step": 12820 }, { "epoch": 12.83, "grad_norm": 0.0712142214179039, "learning_rate": 1.6081481481481485e-06, "loss": 0.004195954650640488, "step": 12830 }, { "epoch": 12.84, "grad_norm": 0.2596810758113861, "learning_rate": 1.6007407407407409e-06, "loss": 0.025444722175598143, "step": 12840 }, { "epoch": 12.84, "eval_0_to_0": 9445, "eval_0_to_1": 594, "eval_1_to_0": 669, "eval_1_to_1": 9292, "eval_accuracy": 0.93685, "eval_loss": 0.5273686051368713, "eval_runtime": 113.2871, "eval_samples_per_second": 176.543, "eval_steps_per_second": 11.034, "step": 12840 }, { "epoch": 12.85, "grad_norm": 2.7887203693389893, "learning_rate": 1.5933333333333335e-06, "loss": 0.0013049393892288208, "step": 12850 }, { "epoch": 12.86, "grad_norm": 0.005201930180191994, "learning_rate": 1.585925925925926e-06, "loss": 0.0015712887048721313, "step": 12860 }, { "epoch": 12.86, "eval_0_to_0": 9399, "eval_0_to_1": 640, "eval_1_to_0": 619, "eval_1_to_1": 9342, "eval_accuracy": 0.93705, "eval_loss": 0.5274052023887634, "eval_runtime": 110.9206, "eval_samples_per_second": 180.309, "eval_steps_per_second": 11.269, "step": 12860 }, { "epoch": 12.87, "grad_norm": 0.006039765663444996, "learning_rate": 1.5785185185185187e-06, "loss": 0.06907334327697753, "step": 12870 }, { "epoch": 12.88, "grad_norm": 1.4372186660766602, "learning_rate": 1.5711111111111113e-06, "loss": 0.01386217623949051, "step": 12880 }, { "epoch": 12.88, "eval_0_to_0": 9433, "eval_0_to_1": 606, "eval_1_to_0": 657, "eval_1_to_1": 9304, "eval_accuracy": 0.93685, "eval_loss": 0.531859815120697, "eval_runtime": 109.8379, "eval_samples_per_second": 182.087, "eval_steps_per_second": 11.38, "step": 12880 }, { "epoch": 12.89, "grad_norm": 0.0065902117639780045, "learning_rate": 1.563703703703704e-06, "loss": 0.0690610408782959, "step": 12890 }, { "epoch": 12.9, "grad_norm": 0.007031960878521204, "learning_rate": 1.5562962962962963e-06, "loss": 0.0016799896955490112, "step": 12900 }, { "epoch": 12.9, "eval_0_to_0": 9453, "eval_0_to_1": 586, "eval_1_to_0": 675, "eval_1_to_1": 9286, "eval_accuracy": 0.93695, "eval_loss": 0.5296370983123779, "eval_runtime": 109.6755, "eval_samples_per_second": 182.356, "eval_steps_per_second": 11.397, "step": 12900 }, { "epoch": 12.91, "grad_norm": 0.01806604117155075, "learning_rate": 1.548888888888889e-06, "loss": 0.05396152138710022, "step": 12910 }, { "epoch": 12.92, "grad_norm": 0.013727959245443344, "learning_rate": 1.5414814814814815e-06, "loss": 0.02363404929637909, "step": 12920 }, { "epoch": 12.92, "eval_0_to_0": 9376, "eval_0_to_1": 663, "eval_1_to_0": 611, "eval_1_to_1": 9350, "eval_accuracy": 0.9363, "eval_loss": 0.5254623889923096, "eval_runtime": 109.3645, "eval_samples_per_second": 182.875, "eval_steps_per_second": 11.43, "step": 12920 }, { "epoch": 12.93, "grad_norm": 0.013972440734505653, "learning_rate": 1.5340740740740741e-06, "loss": 0.04460202157497406, "step": 12930 }, { "epoch": 12.94, "grad_norm": 0.0975113958120346, "learning_rate": 1.526666666666667e-06, "loss": 0.01649205982685089, "step": 12940 }, { "epoch": 12.94, "eval_0_to_0": 9441, "eval_0_to_1": 598, "eval_1_to_0": 677, "eval_1_to_1": 9284, "eval_accuracy": 0.93625, "eval_loss": 0.5328867435455322, "eval_runtime": 109.4302, "eval_samples_per_second": 182.765, "eval_steps_per_second": 11.423, "step": 12940 }, { "epoch": 12.95, "grad_norm": 0.16304278373718262, "learning_rate": 1.5192592592592596e-06, "loss": 0.0013848230242729186, "step": 12950 }, { "epoch": 12.96, "grad_norm": 0.0086172204464674, "learning_rate": 1.511851851851852e-06, "loss": 0.041888684034347534, "step": 12960 }, { "epoch": 12.96, "eval_0_to_0": 9470, "eval_0_to_1": 569, "eval_1_to_0": 707, "eval_1_to_1": 9254, "eval_accuracy": 0.9362, "eval_loss": 0.5340883731842041, "eval_runtime": 109.0168, "eval_samples_per_second": 183.458, "eval_steps_per_second": 11.466, "step": 12960 }, { "epoch": 12.97, "grad_norm": 0.005271091591566801, "learning_rate": 1.5044444444444446e-06, "loss": 0.0307108074426651, "step": 12970 }, { "epoch": 12.98, "grad_norm": 0.05549793690443039, "learning_rate": 1.4970370370370372e-06, "loss": 0.0012025095522403717, "step": 12980 }, { "epoch": 12.98, "eval_0_to_0": 9508, "eval_0_to_1": 531, "eval_1_to_0": 755, "eval_1_to_1": 9206, "eval_accuracy": 0.9357, "eval_loss": 0.5413098335266113, "eval_runtime": 108.8764, "eval_samples_per_second": 183.695, "eval_steps_per_second": 11.481, "step": 12980 }, { "epoch": 12.99, "grad_norm": 0.0029058712534606457, "learning_rate": 1.4896296296296298e-06, "loss": 0.0011189639568328857, "step": 12990 }, { "epoch": 13.0, "grad_norm": 0.17158004641532898, "learning_rate": 1.4822222222222224e-06, "loss": 0.0007570400834083557, "step": 13000 }, { "epoch": 13.0, "eval_0_to_0": 9406, "eval_0_to_1": 633, "eval_1_to_0": 650, "eval_1_to_1": 9311, "eval_accuracy": 0.93585, "eval_loss": 0.529241144657135, "eval_runtime": 108.7265, "eval_samples_per_second": 183.948, "eval_steps_per_second": 11.497, "step": 13000 }, { "epoch": 13.01, "grad_norm": 0.010821014642715454, "learning_rate": 1.474814814814815e-06, "loss": 0.0019031129777431488, "step": 13010 }, { "epoch": 13.02, "grad_norm": 1.9201605319976807, "learning_rate": 1.4674074074074074e-06, "loss": 0.09188791513442993, "step": 13020 }, { "epoch": 13.02, "eval_0_to_0": 9409, "eval_0_to_1": 630, "eval_1_to_0": 645, "eval_1_to_1": 9316, "eval_accuracy": 0.93625, "eval_loss": 0.5331646800041199, "eval_runtime": 108.7463, "eval_samples_per_second": 183.914, "eval_steps_per_second": 11.495, "step": 13020 }, { "epoch": 13.03, "grad_norm": 0.01832224614918232, "learning_rate": 1.46e-06, "loss": 0.0005443766713142395, "step": 13030 }, { "epoch": 13.04, "grad_norm": 0.0020495234057307243, "learning_rate": 1.4525925925925926e-06, "loss": 0.000780729204416275, "step": 13040 }, { "epoch": 13.04, "eval_0_to_0": 9463, "eval_0_to_1": 576, "eval_1_to_0": 697, "eval_1_to_1": 9264, "eval_accuracy": 0.93635, "eval_loss": 0.5408433079719543, "eval_runtime": 108.6971, "eval_samples_per_second": 183.998, "eval_steps_per_second": 11.5, "step": 13040 }, { "epoch": 13.05, "grad_norm": 41.304176330566406, "learning_rate": 1.4451851851851852e-06, "loss": 0.042659726738929746, "step": 13050 }, { "epoch": 13.06, "grad_norm": 0.019126851111650467, "learning_rate": 1.437777777777778e-06, "loss": 0.00046627968549728394, "step": 13060 }, { "epoch": 13.06, "eval_0_to_0": 9449, "eval_0_to_1": 590, "eval_1_to_0": 680, "eval_1_to_1": 9281, "eval_accuracy": 0.9365, "eval_loss": 0.5387261509895325, "eval_runtime": 108.3753, "eval_samples_per_second": 184.544, "eval_steps_per_second": 11.534, "step": 13060 }, { "epoch": 13.07, "grad_norm": 0.16794393956661224, "learning_rate": 1.4303703703703706e-06, "loss": 0.024711406230926512, "step": 13070 }, { "epoch": 13.08, "grad_norm": 81.30717468261719, "learning_rate": 1.4229629629629633e-06, "loss": 0.020767125487327575, "step": 13080 }, { "epoch": 13.08, "eval_0_to_0": 9510, "eval_0_to_1": 529, "eval_1_to_0": 750, "eval_1_to_1": 9211, "eval_accuracy": 0.93605, "eval_loss": 0.5516039133071899, "eval_runtime": 108.4887, "eval_samples_per_second": 184.351, "eval_steps_per_second": 11.522, "step": 13080 }, { "epoch": 13.09, "grad_norm": 0.004520077258348465, "learning_rate": 1.4155555555555556e-06, "loss": 0.009555802494287492, "step": 13090 }, { "epoch": 13.1, "grad_norm": 0.006514236330986023, "learning_rate": 1.4081481481481483e-06, "loss": 0.051292026042938234, "step": 13100 }, { "epoch": 13.1, "eval_0_to_0": 9494, "eval_0_to_1": 545, "eval_1_to_0": 724, "eval_1_to_1": 9237, "eval_accuracy": 0.93655, "eval_loss": 0.550136923789978, "eval_runtime": 108.512, "eval_samples_per_second": 184.311, "eval_steps_per_second": 11.519, "step": 13100 }, { "epoch": 13.11, "grad_norm": 0.009171939454972744, "learning_rate": 1.4007407407407409e-06, "loss": 0.07239119410514831, "step": 13110 }, { "epoch": 13.12, "grad_norm": 0.005620433948934078, "learning_rate": 1.3933333333333335e-06, "loss": 0.0013237379491329194, "step": 13120 }, { "epoch": 13.12, "eval_0_to_0": 9478, "eval_0_to_1": 561, "eval_1_to_0": 722, "eval_1_to_1": 9239, "eval_accuracy": 0.93585, "eval_loss": 0.5459301471710205, "eval_runtime": 108.5657, "eval_samples_per_second": 184.22, "eval_steps_per_second": 11.514, "step": 13120 }, { "epoch": 13.13, "grad_norm": 0.02826572395861149, "learning_rate": 1.385925925925926e-06, "loss": 0.027071920037269593, "step": 13130 }, { "epoch": 13.14, "grad_norm": 0.011649726890027523, "learning_rate": 1.3785185185185187e-06, "loss": 0.002605106681585312, "step": 13140 }, { "epoch": 13.14, "eval_0_to_0": 9423, "eval_0_to_1": 616, "eval_1_to_0": 652, "eval_1_to_1": 9309, "eval_accuracy": 0.9366, "eval_loss": 0.5422273874282837, "eval_runtime": 108.3199, "eval_samples_per_second": 184.638, "eval_steps_per_second": 11.54, "step": 13140 }, { "epoch": 13.15, "grad_norm": 53.81744384765625, "learning_rate": 1.371111111111111e-06, "loss": 0.018860718607902525, "step": 13150 }, { "epoch": 13.16, "grad_norm": 0.0015237092738971114, "learning_rate": 1.3637037037037037e-06, "loss": 0.007891935110092164, "step": 13160 }, { "epoch": 13.16, "eval_0_to_0": 9449, "eval_0_to_1": 590, "eval_1_to_0": 691, "eval_1_to_1": 9270, "eval_accuracy": 0.93595, "eval_loss": 0.5515620112419128, "eval_runtime": 107.993, "eval_samples_per_second": 185.197, "eval_steps_per_second": 11.575, "step": 13160 }, { "epoch": 13.17, "grad_norm": 0.0018842879217118025, "learning_rate": 1.3562962962962963e-06, "loss": 0.002995011210441589, "step": 13170 }, { "epoch": 13.18, "grad_norm": 0.028600551187992096, "learning_rate": 1.3488888888888891e-06, "loss": 0.00028666183352470397, "step": 13180 }, { "epoch": 13.18, "eval_0_to_0": 9518, "eval_0_to_1": 521, "eval_1_to_0": 772, "eval_1_to_1": 9189, "eval_accuracy": 0.93535, "eval_loss": 0.5631992816925049, "eval_runtime": 108.0448, "eval_samples_per_second": 185.108, "eval_steps_per_second": 11.569, "step": 13180 }, { "epoch": 13.19, "grad_norm": 1.3041455745697021, "learning_rate": 1.3414814814814817e-06, "loss": 0.039427328109741214, "step": 13190 }, { "epoch": 13.2, "grad_norm": 0.001963510410860181, "learning_rate": 1.3340740740740743e-06, "loss": 0.0011279411613941193, "step": 13200 }, { "epoch": 13.2, "eval_0_to_0": 9510, "eval_0_to_1": 529, "eval_1_to_0": 770, "eval_1_to_1": 9191, "eval_accuracy": 0.93505, "eval_loss": 0.563887894153595, "eval_runtime": 108.0694, "eval_samples_per_second": 185.066, "eval_steps_per_second": 11.567, "step": 13200 }, { "epoch": 13.21, "grad_norm": 0.0013953972375020385, "learning_rate": 1.3266666666666667e-06, "loss": 0.0002848312258720398, "step": 13210 }, { "epoch": 13.22, "grad_norm": 0.7114841938018799, "learning_rate": 1.3192592592592593e-06, "loss": 0.04566204845905304, "step": 13220 }, { "epoch": 13.22, "eval_0_to_0": 9455, "eval_0_to_1": 584, "eval_1_to_0": 711, "eval_1_to_1": 9250, "eval_accuracy": 0.93525, "eval_loss": 0.5572540163993835, "eval_runtime": 108.3865, "eval_samples_per_second": 184.525, "eval_steps_per_second": 11.533, "step": 13220 }, { "epoch": 13.23, "grad_norm": 0.002419886412099004, "learning_rate": 1.311851851851852e-06, "loss": 0.0005850374698638916, "step": 13230 }, { "epoch": 13.24, "grad_norm": 0.001223695115186274, "learning_rate": 1.3044444444444446e-06, "loss": 0.033515903353691104, "step": 13240 }, { "epoch": 13.24, "eval_0_to_0": 9391, "eval_0_to_1": 648, "eval_1_to_0": 644, "eval_1_to_1": 9317, "eval_accuracy": 0.9354, "eval_loss": 0.552330732345581, "eval_runtime": 107.9367, "eval_samples_per_second": 185.294, "eval_steps_per_second": 11.581, "step": 13240 }, { "epoch": 13.25, "grad_norm": 0.04801860824227333, "learning_rate": 1.2970370370370372e-06, "loss": 0.033504849672317503, "step": 13250 }, { "epoch": 13.26, "grad_norm": 0.004821116104722023, "learning_rate": 1.2896296296296298e-06, "loss": 0.00035359486937522886, "step": 13260 }, { "epoch": 13.26, "eval_0_to_0": 9427, "eval_0_to_1": 612, "eval_1_to_0": 671, "eval_1_to_1": 9290, "eval_accuracy": 0.93585, "eval_loss": 0.5497241020202637, "eval_runtime": 108.0218, "eval_samples_per_second": 185.148, "eval_steps_per_second": 11.572, "step": 13260 }, { "epoch": 13.27, "grad_norm": 0.0762353166937828, "learning_rate": 1.2822222222222222e-06, "loss": 0.0024418972432613375, "step": 13270 }, { "epoch": 13.28, "grad_norm": 0.03662581369280815, "learning_rate": 1.2748148148148148e-06, "loss": 0.03885634541511536, "step": 13280 }, { "epoch": 13.28, "eval_0_to_0": 9465, "eval_0_to_1": 574, "eval_1_to_0": 717, "eval_1_to_1": 9244, "eval_accuracy": 0.93545, "eval_loss": 0.5532448291778564, "eval_runtime": 109.3863, "eval_samples_per_second": 182.838, "eval_steps_per_second": 11.427, "step": 13280 }, { "epoch": 13.29, "grad_norm": 103.40413665771484, "learning_rate": 1.2674074074074074e-06, "loss": 0.024525988101959228, "step": 13290 }, { "epoch": 13.3, "grad_norm": 0.14862585067749023, "learning_rate": 1.26e-06, "loss": 0.02103506922721863, "step": 13300 }, { "epoch": 13.3, "eval_0_to_0": 9427, "eval_0_to_1": 612, "eval_1_to_0": 665, "eval_1_to_1": 9296, "eval_accuracy": 0.93615, "eval_loss": 0.5481566190719604, "eval_runtime": 109.6152, "eval_samples_per_second": 182.456, "eval_steps_per_second": 11.404, "step": 13300 }, { "epoch": 13.31, "grad_norm": 0.04608692228794098, "learning_rate": 1.2525925925925928e-06, "loss": 0.0018957488238811493, "step": 13310 }, { "epoch": 13.32, "grad_norm": 0.01625022664666176, "learning_rate": 1.2451851851851852e-06, "loss": 0.03168185949325562, "step": 13320 }, { "epoch": 13.32, "eval_0_to_0": 9383, "eval_0_to_1": 656, "eval_1_to_0": 618, "eval_1_to_1": 9343, "eval_accuracy": 0.9363, "eval_loss": 0.5444285869598389, "eval_runtime": 109.6662, "eval_samples_per_second": 182.372, "eval_steps_per_second": 11.398, "step": 13320 }, { "epoch": 13.33, "grad_norm": 0.041470110416412354, "learning_rate": 1.2377777777777778e-06, "loss": 0.0008310139179229737, "step": 13330 }, { "epoch": 13.34, "grad_norm": 0.14168789982795715, "learning_rate": 1.2303703703703704e-06, "loss": 0.03283644914627075, "step": 13340 }, { "epoch": 13.34, "eval_0_to_0": 9423, "eval_0_to_1": 616, "eval_1_to_0": 657, "eval_1_to_1": 9304, "eval_accuracy": 0.93635, "eval_loss": 0.5461515784263611, "eval_runtime": 108.7959, "eval_samples_per_second": 183.831, "eval_steps_per_second": 11.489, "step": 13340 }, { "epoch": 13.35, "grad_norm": 0.23431676626205444, "learning_rate": 1.222962962962963e-06, "loss": 0.014013570547103883, "step": 13350 }, { "epoch": 13.36, "grad_norm": 0.0028722425922751427, "learning_rate": 1.2155555555555557e-06, "loss": 0.00029827877879142763, "step": 13360 }, { "epoch": 13.36, "eval_0_to_0": 9442, "eval_0_to_1": 597, "eval_1_to_0": 679, "eval_1_to_1": 9282, "eval_accuracy": 0.9362, "eval_loss": 0.5482156276702881, "eval_runtime": 108.0783, "eval_samples_per_second": 185.051, "eval_steps_per_second": 11.566, "step": 13360 }, { "epoch": 13.37, "grad_norm": 0.020947255194187164, "learning_rate": 1.2081481481481483e-06, "loss": 0.06793732643127441, "step": 13370 }, { "epoch": 13.38, "grad_norm": 0.006043447647243738, "learning_rate": 1.2007407407407409e-06, "loss": 0.03986048698425293, "step": 13380 }, { "epoch": 13.38, "eval_0_to_0": 9495, "eval_0_to_1": 544, "eval_1_to_0": 725, "eval_1_to_1": 9236, "eval_accuracy": 0.93655, "eval_loss": 0.554332971572876, "eval_runtime": 107.9162, "eval_samples_per_second": 185.329, "eval_steps_per_second": 11.583, "step": 13380 }, { "epoch": 13.39, "grad_norm": 0.002261217450723052, "learning_rate": 1.1933333333333335e-06, "loss": 0.08144963383674622, "step": 13390 }, { "epoch": 13.4, "grad_norm": 0.04932105541229248, "learning_rate": 1.185925925925926e-06, "loss": 0.0005584605038166046, "step": 13400 }, { "epoch": 13.4, "eval_0_to_0": 9441, "eval_0_to_1": 598, "eval_1_to_0": 672, "eval_1_to_1": 9289, "eval_accuracy": 0.9365, "eval_loss": 0.5450689196586609, "eval_runtime": 108.2193, "eval_samples_per_second": 184.81, "eval_steps_per_second": 11.551, "step": 13400 }, { "epoch": 13.41, "grad_norm": 0.017364345490932465, "learning_rate": 1.1785185185185185e-06, "loss": 0.007972268760204316, "step": 13410 }, { "epoch": 13.42, "grad_norm": 0.011559573002159595, "learning_rate": 1.171111111111111e-06, "loss": 0.0003910370171070099, "step": 13420 }, { "epoch": 13.42, "eval_0_to_0": 9344, "eval_0_to_1": 695, "eval_1_to_0": 578, "eval_1_to_1": 9383, "eval_accuracy": 0.93635, "eval_loss": 0.5456675887107849, "eval_runtime": 107.9694, "eval_samples_per_second": 185.238, "eval_steps_per_second": 11.577, "step": 13420 }, { "epoch": 13.43, "grad_norm": 0.06615772098302841, "learning_rate": 1.163703703703704e-06, "loss": 0.016613566875457765, "step": 13430 }, { "epoch": 13.44, "grad_norm": 0.0036409972235560417, "learning_rate": 1.1562962962962963e-06, "loss": 0.09318026304244995, "step": 13440 }, { "epoch": 13.44, "eval_0_to_0": 9379, "eval_0_to_1": 660, "eval_1_to_0": 607, "eval_1_to_1": 9354, "eval_accuracy": 0.93665, "eval_loss": 0.5412625670433044, "eval_runtime": 107.9521, "eval_samples_per_second": 185.267, "eval_steps_per_second": 11.579, "step": 13440 }, { "epoch": 13.45, "grad_norm": 0.008209668099880219, "learning_rate": 1.148888888888889e-06, "loss": 0.020195508003234865, "step": 13450 }, { "epoch": 13.46, "grad_norm": 0.009517654776573181, "learning_rate": 1.1414814814814815e-06, "loss": 0.0013734638690948487, "step": 13460 }, { "epoch": 13.46, "eval_0_to_0": 9526, "eval_0_to_1": 513, "eval_1_to_0": 772, "eval_1_to_1": 9189, "eval_accuracy": 0.93575, "eval_loss": 0.5575709342956543, "eval_runtime": 107.8872, "eval_samples_per_second": 185.379, "eval_steps_per_second": 11.586, "step": 13460 }, { "epoch": 13.47, "grad_norm": 0.023560883477330208, "learning_rate": 1.1340740740740741e-06, "loss": 0.005767878144979477, "step": 13470 }, { "epoch": 13.48, "grad_norm": 0.008838809095323086, "learning_rate": 1.1266666666666667e-06, "loss": 0.004282259941101074, "step": 13480 }, { "epoch": 13.48, "eval_0_to_0": 9532, "eval_0_to_1": 507, "eval_1_to_0": 780, "eval_1_to_1": 9181, "eval_accuracy": 0.93565, "eval_loss": 0.561179518699646, "eval_runtime": 107.7543, "eval_samples_per_second": 185.607, "eval_steps_per_second": 11.6, "step": 13480 }, { "epoch": 13.49, "grad_norm": 0.016677577048540115, "learning_rate": 1.1192592592592594e-06, "loss": 0.06143615245819092, "step": 13490 }, { "epoch": 13.5, "grad_norm": 0.04166121035814285, "learning_rate": 1.111851851851852e-06, "loss": 0.00041025876998901367, "step": 13500 }, { "epoch": 13.5, "eval_0_to_0": 9425, "eval_0_to_1": 614, "eval_1_to_0": 656, "eval_1_to_1": 9305, "eval_accuracy": 0.9365, "eval_loss": 0.5419491529464722, "eval_runtime": 108.2946, "eval_samples_per_second": 184.681, "eval_steps_per_second": 11.543, "step": 13500 }, { "epoch": 13.51, "grad_norm": 0.006185913924127817, "learning_rate": 1.1044444444444446e-06, "loss": 0.0003792472183704376, "step": 13510 }, { "epoch": 13.52, "grad_norm": 0.007936866953969002, "learning_rate": 1.0970370370370372e-06, "loss": 0.0012305848300457, "step": 13520 }, { "epoch": 13.52, "eval_0_to_0": 9431, "eval_0_to_1": 608, "eval_1_to_0": 659, "eval_1_to_1": 9302, "eval_accuracy": 0.93665, "eval_loss": 0.5440512895584106, "eval_runtime": 107.7079, "eval_samples_per_second": 185.687, "eval_steps_per_second": 11.605, "step": 13520 }, { "epoch": 13.53, "grad_norm": 0.044294536113739014, "learning_rate": 1.0896296296296298e-06, "loss": 0.0002667374908924103, "step": 13530 }, { "epoch": 13.54, "grad_norm": 0.003843395970761776, "learning_rate": 1.0822222222222222e-06, "loss": 0.0005759283900260926, "step": 13540 }, { "epoch": 13.54, "eval_0_to_0": 9443, "eval_0_to_1": 596, "eval_1_to_0": 671, "eval_1_to_1": 9290, "eval_accuracy": 0.93665, "eval_loss": 0.5482152104377747, "eval_runtime": 107.4456, "eval_samples_per_second": 186.141, "eval_steps_per_second": 11.634, "step": 13540 }, { "epoch": 13.55, "grad_norm": 31.742250442504883, "learning_rate": 1.074814814814815e-06, "loss": 0.041138637065887454, "step": 13550 }, { "epoch": 13.56, "grad_norm": 0.007635558024048805, "learning_rate": 1.0674074074074076e-06, "loss": 0.04017797112464905, "step": 13560 }, { "epoch": 13.56, "eval_0_to_0": 9446, "eval_0_to_1": 593, "eval_1_to_0": 680, "eval_1_to_1": 9281, "eval_accuracy": 0.93635, "eval_loss": 0.549431562423706, "eval_runtime": 107.4368, "eval_samples_per_second": 186.156, "eval_steps_per_second": 11.635, "step": 13560 }, { "epoch": 13.57, "grad_norm": 0.04609834402799606, "learning_rate": 1.06e-06, "loss": 0.05946164131164551, "step": 13570 }, { "epoch": 13.58, "grad_norm": 0.009985057637095451, "learning_rate": 1.0525925925925926e-06, "loss": 0.00044136419892311097, "step": 13580 }, { "epoch": 13.58, "eval_0_to_0": 9416, "eval_0_to_1": 623, "eval_1_to_0": 648, "eval_1_to_1": 9313, "eval_accuracy": 0.93645, "eval_loss": 0.5455363392829895, "eval_runtime": 108.2311, "eval_samples_per_second": 184.79, "eval_steps_per_second": 11.549, "step": 13580 }, { "epoch": 13.59, "grad_norm": 0.0018405505688861012, "learning_rate": 1.0451851851851852e-06, "loss": 0.0010615170001983642, "step": 13590 }, { "epoch": 13.6, "grad_norm": 0.008558271452784538, "learning_rate": 1.0377777777777778e-06, "loss": 0.00026162639260292054, "step": 13600 }, { "epoch": 13.6, "eval_0_to_0": 9436, "eval_0_to_1": 603, "eval_1_to_0": 673, "eval_1_to_1": 9288, "eval_accuracy": 0.9362, "eval_loss": 0.5506173372268677, "eval_runtime": 108.3703, "eval_samples_per_second": 184.552, "eval_steps_per_second": 11.535, "step": 13600 }, { "epoch": 13.61, "grad_norm": 0.0028233625926077366, "learning_rate": 1.0303703703703705e-06, "loss": 0.014170940220355987, "step": 13610 }, { "epoch": 13.62, "grad_norm": 0.0021499255672097206, "learning_rate": 1.022962962962963e-06, "loss": 0.03851082921028137, "step": 13620 }, { "epoch": 13.62, "eval_0_to_0": 9524, "eval_0_to_1": 515, "eval_1_to_0": 765, "eval_1_to_1": 9196, "eval_accuracy": 0.936, "eval_loss": 0.5626494884490967, "eval_runtime": 108.9469, "eval_samples_per_second": 183.576, "eval_steps_per_second": 11.473, "step": 13620 }, { "epoch": 13.63, "grad_norm": 0.002652304945513606, "learning_rate": 1.0155555555555557e-06, "loss": 0.011573000252246857, "step": 13630 }, { "epoch": 13.64, "grad_norm": 14.188724517822266, "learning_rate": 1.0081481481481483e-06, "loss": 0.003232119232416153, "step": 13640 }, { "epoch": 13.64, "eval_0_to_0": 9550, "eval_0_to_1": 489, "eval_1_to_0": 798, "eval_1_to_1": 9163, "eval_accuracy": 0.93565, "eval_loss": 0.5700722932815552, "eval_runtime": 108.92, "eval_samples_per_second": 183.621, "eval_steps_per_second": 11.476, "step": 13640 }, { "epoch": 13.65, "grad_norm": 0.07833924144506454, "learning_rate": 1.0007407407407409e-06, "loss": 0.014963963627815246, "step": 13650 }, { "epoch": 13.66, "grad_norm": 8.053224563598633, "learning_rate": 9.933333333333333e-07, "loss": 0.08113605380058289, "step": 13660 }, { "epoch": 13.66, "eval_0_to_0": 9562, "eval_0_to_1": 477, "eval_1_to_0": 811, "eval_1_to_1": 9150, "eval_accuracy": 0.9356, "eval_loss": 0.5772743225097656, "eval_runtime": 109.1496, "eval_samples_per_second": 183.235, "eval_steps_per_second": 11.452, "step": 13660 }, { "epoch": 13.67, "grad_norm": 0.249950110912323, "learning_rate": 9.85925925925926e-07, "loss": 0.0003715388476848602, "step": 13670 }, { "epoch": 13.68, "grad_norm": 0.004200088791549206, "learning_rate": 9.785185185185187e-07, "loss": 0.03112407326698303, "step": 13680 }, { "epoch": 13.68, "eval_0_to_0": 9540, "eval_0_to_1": 499, "eval_1_to_0": 794, "eval_1_to_1": 9167, "eval_accuracy": 0.93535, "eval_loss": 0.571996808052063, "eval_runtime": 109.3624, "eval_samples_per_second": 182.878, "eval_steps_per_second": 11.43, "step": 13680 }, { "epoch": 13.69, "grad_norm": 53.16846466064453, "learning_rate": 9.711111111111111e-07, "loss": 0.05822874903678894, "step": 13690 }, { "epoch": 13.7, "grad_norm": 0.004326276946812868, "learning_rate": 9.637037037037037e-07, "loss": 0.031003305315971376, "step": 13700 }, { "epoch": 13.7, "eval_0_to_0": 9499, "eval_0_to_1": 540, "eval_1_to_0": 741, "eval_1_to_1": 9220, "eval_accuracy": 0.93595, "eval_loss": 0.5607360601425171, "eval_runtime": 109.9076, "eval_samples_per_second": 181.971, "eval_steps_per_second": 11.373, "step": 13700 }, { "epoch": 13.71, "grad_norm": 0.008182407356798649, "learning_rate": 9.562962962962963e-07, "loss": 0.00027804821729660034, "step": 13710 }, { "epoch": 13.72, "grad_norm": 0.016184600070118904, "learning_rate": 9.488888888888889e-07, "loss": 0.014517584443092346, "step": 13720 }, { "epoch": 13.72, "eval_0_to_0": 9473, "eval_0_to_1": 566, "eval_1_to_0": 708, "eval_1_to_1": 9253, "eval_accuracy": 0.9363, "eval_loss": 0.5560895800590515, "eval_runtime": 109.9997, "eval_samples_per_second": 181.819, "eval_steps_per_second": 11.364, "step": 13720 }, { "epoch": 13.73, "grad_norm": 0.0091652637347579, "learning_rate": 9.414814814814815e-07, "loss": 0.011850550025701522, "step": 13730 }, { "epoch": 13.74, "grad_norm": 6.6921067237854, "learning_rate": 9.340740740740742e-07, "loss": 0.03348456919193268, "step": 13740 }, { "epoch": 13.74, "eval_0_to_0": 9503, "eval_0_to_1": 536, "eval_1_to_0": 743, "eval_1_to_1": 9218, "eval_accuracy": 0.93605, "eval_loss": 0.5605497360229492, "eval_runtime": 108.2862, "eval_samples_per_second": 184.696, "eval_steps_per_second": 11.543, "step": 13740 }, { "epoch": 13.75, "grad_norm": 0.020268823951482773, "learning_rate": 9.266666666666667e-07, "loss": 0.04928363561630249, "step": 13750 }, { "epoch": 13.76, "grad_norm": 79.91051483154297, "learning_rate": 9.192592592592594e-07, "loss": 0.02013465166091919, "step": 13760 }, { "epoch": 13.76, "eval_0_to_0": 9539, "eval_0_to_1": 500, "eval_1_to_0": 791, "eval_1_to_1": 9170, "eval_accuracy": 0.93545, "eval_loss": 0.565965473651886, "eval_runtime": 107.9106, "eval_samples_per_second": 185.339, "eval_steps_per_second": 11.584, "step": 13760 }, { "epoch": 13.77, "grad_norm": 0.21854065358638763, "learning_rate": 9.11851851851852e-07, "loss": 0.0009611360728740692, "step": 13770 }, { "epoch": 13.78, "grad_norm": 4.65297794342041, "learning_rate": 9.044444444444445e-07, "loss": 0.004548914730548859, "step": 13780 }, { "epoch": 13.78, "eval_0_to_0": 9534, "eval_0_to_1": 505, "eval_1_to_0": 788, "eval_1_to_1": 9173, "eval_accuracy": 0.93535, "eval_loss": 0.5679972767829895, "eval_runtime": 107.8139, "eval_samples_per_second": 185.505, "eval_steps_per_second": 11.594, "step": 13780 }, { "epoch": 13.79, "grad_norm": 0.20851604640483856, "learning_rate": 8.970370370370371e-07, "loss": 0.05511997938156128, "step": 13790 }, { "epoch": 13.8, "grad_norm": 0.01773938350379467, "learning_rate": 8.896296296296297e-07, "loss": 0.00040621235966682435, "step": 13800 }, { "epoch": 13.8, "eval_0_to_0": 9492, "eval_0_to_1": 547, "eval_1_to_0": 734, "eval_1_to_1": 9227, "eval_accuracy": 0.93595, "eval_loss": 0.5621579885482788, "eval_runtime": 107.7291, "eval_samples_per_second": 185.651, "eval_steps_per_second": 11.603, "step": 13800 }, { "epoch": 13.81, "grad_norm": 0.004732814617455006, "learning_rate": 8.822222222222222e-07, "loss": 0.0005449026823043824, "step": 13810 }, { "epoch": 13.82, "grad_norm": 0.0025187351275235415, "learning_rate": 8.748148148148149e-07, "loss": 0.002107471227645874, "step": 13820 }, { "epoch": 13.82, "eval_0_to_0": 9455, "eval_0_to_1": 584, "eval_1_to_0": 703, "eval_1_to_1": 9258, "eval_accuracy": 0.93565, "eval_loss": 0.5595434904098511, "eval_runtime": 107.9029, "eval_samples_per_second": 185.352, "eval_steps_per_second": 11.584, "step": 13820 }, { "epoch": 13.83, "grad_norm": 0.004037392791360617, "learning_rate": 8.674074074074075e-07, "loss": 0.0016890838742256165, "step": 13830 }, { "epoch": 13.84, "grad_norm": 0.02467244118452072, "learning_rate": 8.6e-07, "loss": 0.00027360692620277406, "step": 13840 }, { "epoch": 13.84, "eval_0_to_0": 9441, "eval_0_to_1": 598, "eval_1_to_0": 689, "eval_1_to_1": 9272, "eval_accuracy": 0.93565, "eval_loss": 0.5589100122451782, "eval_runtime": 107.1673, "eval_samples_per_second": 186.624, "eval_steps_per_second": 11.664, "step": 13840 }, { "epoch": 13.85, "grad_norm": 0.00244165793992579, "learning_rate": 8.525925925925926e-07, "loss": 0.0002453342080116272, "step": 13850 }, { "epoch": 13.86, "grad_norm": 0.006086554378271103, "learning_rate": 8.451851851851852e-07, "loss": 0.05424246788024902, "step": 13860 }, { "epoch": 13.86, "eval_0_to_0": 9440, "eval_0_to_1": 599, "eval_1_to_0": 688, "eval_1_to_1": 9273, "eval_accuracy": 0.93565, "eval_loss": 0.5587103366851807, "eval_runtime": 107.3683, "eval_samples_per_second": 186.275, "eval_steps_per_second": 11.642, "step": 13860 }, { "epoch": 13.87, "grad_norm": 0.012626233510673046, "learning_rate": 8.37777777777778e-07, "loss": 0.045393428206443785, "step": 13870 }, { "epoch": 13.88, "grad_norm": 0.005050296895205975, "learning_rate": 8.303703703703705e-07, "loss": 0.041231793165206906, "step": 13880 }, { "epoch": 13.88, "eval_0_to_0": 9424, "eval_0_to_1": 615, "eval_1_to_0": 668, "eval_1_to_1": 9293, "eval_accuracy": 0.93585, "eval_loss": 0.5547247529029846, "eval_runtime": 107.5158, "eval_samples_per_second": 186.019, "eval_steps_per_second": 11.626, "step": 13880 }, { "epoch": 13.89, "grad_norm": 0.005977481137961149, "learning_rate": 8.229629629629631e-07, "loss": 0.03217102289199829, "step": 13890 }, { "epoch": 13.9, "grad_norm": 0.5155578851699829, "learning_rate": 8.155555555555557e-07, "loss": 0.015500721335411072, "step": 13900 }, { "epoch": 13.9, "eval_0_to_0": 9444, "eval_0_to_1": 595, "eval_1_to_0": 693, "eval_1_to_1": 9268, "eval_accuracy": 0.9356, "eval_loss": 0.5531479120254517, "eval_runtime": 107.5001, "eval_samples_per_second": 186.046, "eval_steps_per_second": 11.628, "step": 13900 }, { "epoch": 13.91, "grad_norm": 0.04930556192994118, "learning_rate": 8.081481481481482e-07, "loss": 0.0017816193401813507, "step": 13910 }, { "epoch": 13.92, "grad_norm": 0.004136282484978437, "learning_rate": 8.007407407407408e-07, "loss": 0.000538654625415802, "step": 13920 }, { "epoch": 13.92, "eval_0_to_0": 9496, "eval_0_to_1": 543, "eval_1_to_0": 756, "eval_1_to_1": 9205, "eval_accuracy": 0.93505, "eval_loss": 0.5605230927467346, "eval_runtime": 107.6939, "eval_samples_per_second": 185.711, "eval_steps_per_second": 11.607, "step": 13920 }, { "epoch": 13.93, "grad_norm": 3.6548869609832764, "learning_rate": 7.933333333333335e-07, "loss": 0.027262550592422486, "step": 13930 }, { "epoch": 13.94, "grad_norm": 0.006038022227585316, "learning_rate": 7.85925925925926e-07, "loss": 0.0015125676989555358, "step": 13940 }, { "epoch": 13.94, "eval_0_to_0": 9529, "eval_0_to_1": 510, "eval_1_to_0": 786, "eval_1_to_1": 9175, "eval_accuracy": 0.9352, "eval_loss": 0.5718443393707275, "eval_runtime": 107.4128, "eval_samples_per_second": 186.197, "eval_steps_per_second": 11.637, "step": 13940 }, { "epoch": 13.95, "grad_norm": 0.004742157179862261, "learning_rate": 7.785185185185186e-07, "loss": 0.002103570103645325, "step": 13950 }, { "epoch": 13.96, "grad_norm": 0.05831047520041466, "learning_rate": 7.711111111111112e-07, "loss": 0.016560515761375426, "step": 13960 }, { "epoch": 13.96, "eval_0_to_0": 9510, "eval_0_to_1": 529, "eval_1_to_0": 764, "eval_1_to_1": 9197, "eval_accuracy": 0.93535, "eval_loss": 0.570343554019928, "eval_runtime": 107.2754, "eval_samples_per_second": 186.436, "eval_steps_per_second": 11.652, "step": 13960 }, { "epoch": 13.97, "grad_norm": 0.08213341981172562, "learning_rate": 7.637037037037037e-07, "loss": 0.020936763286590575, "step": 13970 }, { "epoch": 13.98, "grad_norm": 0.035107873380184174, "learning_rate": 7.562962962962963e-07, "loss": 0.011199840903282165, "step": 13980 }, { "epoch": 13.98, "eval_0_to_0": 9492, "eval_0_to_1": 547, "eval_1_to_0": 743, "eval_1_to_1": 9218, "eval_accuracy": 0.9355, "eval_loss": 0.5681455135345459, "eval_runtime": 107.0721, "eval_samples_per_second": 186.79, "eval_steps_per_second": 11.674, "step": 13980 }, { "epoch": 13.99, "grad_norm": 0.008276867680251598, "learning_rate": 7.48888888888889e-07, "loss": 0.0008130036294460297, "step": 13990 }, { "epoch": 14.0, "grad_norm": 0.03885001316666603, "learning_rate": 7.414814814814814e-07, "loss": 0.0014248907566070557, "step": 14000 }, { "epoch": 14.0, "eval_0_to_0": 9433, "eval_0_to_1": 606, "eval_1_to_0": 684, "eval_1_to_1": 9277, "eval_accuracy": 0.9355, "eval_loss": 0.5621954202651978, "eval_runtime": 107.6287, "eval_samples_per_second": 185.824, "eval_steps_per_second": 11.614, "step": 14000 }, { "epoch": 14.01, "grad_norm": 0.021607980132102966, "learning_rate": 7.340740740740742e-07, "loss": 0.0006822340190410614, "step": 14010 }, { "epoch": 14.02, "grad_norm": 0.7846871018409729, "learning_rate": 7.266666666666668e-07, "loss": 0.000353742390871048, "step": 14020 }, { "epoch": 14.02, "eval_0_to_0": 9408, "eval_0_to_1": 631, "eval_1_to_0": 662, "eval_1_to_1": 9299, "eval_accuracy": 0.93535, "eval_loss": 0.5639524459838867, "eval_runtime": 107.5089, "eval_samples_per_second": 186.031, "eval_steps_per_second": 11.627, "step": 14020 }, { "epoch": 14.03, "grad_norm": 0.005693970713764429, "learning_rate": 7.192592592592593e-07, "loss": 0.00046597644686698916, "step": 14030 }, { "epoch": 14.04, "grad_norm": 0.003311425680294633, "learning_rate": 7.118518518518519e-07, "loss": 0.027047181129455568, "step": 14040 }, { "epoch": 14.04, "eval_0_to_0": 9420, "eval_0_to_1": 619, "eval_1_to_0": 678, "eval_1_to_1": 9283, "eval_accuracy": 0.93515, "eval_loss": 0.5656170845031738, "eval_runtime": 107.0719, "eval_samples_per_second": 186.79, "eval_steps_per_second": 11.674, "step": 14040 }, { "epoch": 14.05, "grad_norm": 0.006372371688485146, "learning_rate": 7.044444444444446e-07, "loss": 0.0002492763102054596, "step": 14050 }, { "epoch": 14.06, "grad_norm": 0.005074634682387114, "learning_rate": 6.97037037037037e-07, "loss": 0.00033840090036392213, "step": 14060 }, { "epoch": 14.06, "eval_0_to_0": 9450, "eval_0_to_1": 589, "eval_1_to_0": 698, "eval_1_to_1": 9263, "eval_accuracy": 0.93565, "eval_loss": 0.568996012210846, "eval_runtime": 107.0326, "eval_samples_per_second": 186.859, "eval_steps_per_second": 11.679, "step": 14060 }, { "epoch": 14.07, "grad_norm": 0.04212485998868942, "learning_rate": 6.896296296296297e-07, "loss": 0.04074406623840332, "step": 14070 }, { "epoch": 14.08, "grad_norm": 0.0028894005808979273, "learning_rate": 6.822222222222223e-07, "loss": 0.059154242277145386, "step": 14080 }, { "epoch": 14.08, "eval_0_to_0": 9450, "eval_0_to_1": 589, "eval_1_to_0": 691, "eval_1_to_1": 9270, "eval_accuracy": 0.936, "eval_loss": 0.5659690499305725, "eval_runtime": 107.7995, "eval_samples_per_second": 185.53, "eval_steps_per_second": 11.596, "step": 14080 }, { "epoch": 14.09, "grad_norm": 0.010337376035749912, "learning_rate": 6.748148148148148e-07, "loss": 0.00026068761944770814, "step": 14090 }, { "epoch": 14.1, "grad_norm": 0.002147360472008586, "learning_rate": 6.674074074074074e-07, "loss": 0.04503931999206543, "step": 14100 }, { "epoch": 14.1, "eval_0_to_0": 9424, "eval_0_to_1": 615, "eval_1_to_0": 665, "eval_1_to_1": 9296, "eval_accuracy": 0.936, "eval_loss": 0.5627204179763794, "eval_runtime": 107.8798, "eval_samples_per_second": 185.391, "eval_steps_per_second": 11.587, "step": 14100 }, { "epoch": 14.11, "grad_norm": 0.005933412816375494, "learning_rate": 6.6e-07, "loss": 0.00035461410880088806, "step": 14110 }, { "epoch": 14.12, "grad_norm": 0.0022739823907613754, "learning_rate": 6.525925925925925e-07, "loss": 0.026041612029075623, "step": 14120 }, { "epoch": 14.12, "eval_0_to_0": 9459, "eval_0_to_1": 580, "eval_1_to_0": 692, "eval_1_to_1": 9269, "eval_accuracy": 0.9364, "eval_loss": 0.5654451251029968, "eval_runtime": 107.5024, "eval_samples_per_second": 186.042, "eval_steps_per_second": 11.628, "step": 14120 }, { "epoch": 14.13, "grad_norm": 0.013620062731206417, "learning_rate": 6.451851851851853e-07, "loss": 0.033239877223968504, "step": 14130 }, { "epoch": 14.14, "grad_norm": 57.29309844970703, "learning_rate": 6.377777777777779e-07, "loss": 0.006978275626897812, "step": 14140 }, { "epoch": 14.14, "eval_0_to_0": 9496, "eval_0_to_1": 543, "eval_1_to_0": 740, "eval_1_to_1": 9221, "eval_accuracy": 0.93585, "eval_loss": 0.571122944355011, "eval_runtime": 108.1712, "eval_samples_per_second": 184.892, "eval_steps_per_second": 11.556, "step": 14140 }, { "epoch": 14.15, "grad_norm": 0.003848930587992072, "learning_rate": 6.303703703703704e-07, "loss": 0.06875805854797364, "step": 14150 }, { "epoch": 14.16, "grad_norm": 0.007039480376988649, "learning_rate": 6.22962962962963e-07, "loss": 0.0008504889905452728, "step": 14160 }, { "epoch": 14.16, "eval_0_to_0": 9479, "eval_0_to_1": 560, "eval_1_to_0": 725, "eval_1_to_1": 9236, "eval_accuracy": 0.93575, "eval_loss": 0.5710839033126831, "eval_runtime": 108.0859, "eval_samples_per_second": 185.038, "eval_steps_per_second": 11.565, "step": 14160 }, { "epoch": 14.17, "grad_norm": 0.005278915166854858, "learning_rate": 6.155555555555556e-07, "loss": 0.0003421865403652191, "step": 14170 }, { "epoch": 14.18, "grad_norm": 0.002469352912157774, "learning_rate": 6.081481481481482e-07, "loss": 0.0001906171441078186, "step": 14180 }, { "epoch": 14.18, "eval_0_to_0": 9468, "eval_0_to_1": 571, "eval_1_to_0": 721, "eval_1_to_1": 9240, "eval_accuracy": 0.9354, "eval_loss": 0.5715459585189819, "eval_runtime": 107.6365, "eval_samples_per_second": 185.811, "eval_steps_per_second": 11.613, "step": 14180 }, { "epoch": 14.19, "grad_norm": 22.522686004638672, "learning_rate": 6.007407407407408e-07, "loss": 0.05083136558532715, "step": 14190 }, { "epoch": 14.2, "grad_norm": 0.013476979918777943, "learning_rate": 5.933333333333334e-07, "loss": 0.03461107909679413, "step": 14200 }, { "epoch": 14.2, "eval_0_to_0": 9459, "eval_0_to_1": 580, "eval_1_to_0": 707, "eval_1_to_1": 9254, "eval_accuracy": 0.93565, "eval_loss": 0.5683971047401428, "eval_runtime": 107.6994, "eval_samples_per_second": 185.702, "eval_steps_per_second": 11.606, "step": 14200 }, { "epoch": 14.21, "grad_norm": 0.009379694238305092, "learning_rate": 5.85925925925926e-07, "loss": 0.00034845024347305296, "step": 14210 }, { "epoch": 14.22, "grad_norm": 0.003046527272090316, "learning_rate": 5.785185185185185e-07, "loss": 0.0008568890392780304, "step": 14220 }, { "epoch": 14.22, "eval_0_to_0": 9479, "eval_0_to_1": 560, "eval_1_to_0": 732, "eval_1_to_1": 9229, "eval_accuracy": 0.9354, "eval_loss": 0.5710858106613159, "eval_runtime": 107.2712, "eval_samples_per_second": 186.443, "eval_steps_per_second": 11.653, "step": 14220 }, { "epoch": 14.23, "grad_norm": 0.023774895817041397, "learning_rate": 5.711111111111111e-07, "loss": 0.000735752284526825, "step": 14230 }, { "epoch": 14.24, "grad_norm": 0.004116409923881292, "learning_rate": 5.637037037037037e-07, "loss": 0.0015463456511497498, "step": 14240 }, { "epoch": 14.24, "eval_0_to_0": 9512, "eval_0_to_1": 527, "eval_1_to_0": 763, "eval_1_to_1": 9198, "eval_accuracy": 0.9355, "eval_loss": 0.5746404528617859, "eval_runtime": 107.1468, "eval_samples_per_second": 186.66, "eval_steps_per_second": 11.666, "step": 14240 }, { "epoch": 14.25, "grad_norm": 0.3112563490867615, "learning_rate": 5.562962962962963e-07, "loss": 0.002183534950017929, "step": 14250 }, { "epoch": 14.26, "grad_norm": 0.016952183097600937, "learning_rate": 5.48888888888889e-07, "loss": 0.0012942098081111908, "step": 14260 }, { "epoch": 14.26, "eval_0_to_0": 9519, "eval_0_to_1": 520, "eval_1_to_0": 775, "eval_1_to_1": 9186, "eval_accuracy": 0.93525, "eval_loss": 0.5762277245521545, "eval_runtime": 107.8925, "eval_samples_per_second": 185.37, "eval_steps_per_second": 11.586, "step": 14260 }, { "epoch": 14.27, "grad_norm": 0.07050162553787231, "learning_rate": 5.414814814814816e-07, "loss": 0.035889407992362975, "step": 14270 }, { "epoch": 14.28, "grad_norm": 0.0016506216488778591, "learning_rate": 5.340740740740742e-07, "loss": 0.003475266695022583, "step": 14280 }, { "epoch": 14.28, "eval_0_to_0": 9511, "eval_0_to_1": 528, "eval_1_to_0": 763, "eval_1_to_1": 9198, "eval_accuracy": 0.93545, "eval_loss": 0.5752502083778381, "eval_runtime": 108.8881, "eval_samples_per_second": 183.675, "eval_steps_per_second": 11.48, "step": 14280 }, { "epoch": 14.29, "grad_norm": 0.0010124489199370146, "learning_rate": 5.266666666666667e-07, "loss": 0.03916063010692596, "step": 14290 }, { "epoch": 14.3, "grad_norm": 0.05108195170760155, "learning_rate": 5.192592592592593e-07, "loss": 0.0018709361553192138, "step": 14300 }, { "epoch": 14.3, "eval_0_to_0": 9515, "eval_0_to_1": 524, "eval_1_to_0": 766, "eval_1_to_1": 9195, "eval_accuracy": 0.9355, "eval_loss": 0.5771448016166687, "eval_runtime": 108.8971, "eval_samples_per_second": 183.66, "eval_steps_per_second": 11.479, "step": 14300 }, { "epoch": 14.31, "grad_norm": 0.022906748577952385, "learning_rate": 5.118518518518519e-07, "loss": 0.0019450664520263671, "step": 14310 }, { "epoch": 14.32, "grad_norm": 0.002037453232333064, "learning_rate": 5.044444444444445e-07, "loss": 0.0002224951982498169, "step": 14320 }, { "epoch": 14.32, "eval_0_to_0": 9525, "eval_0_to_1": 514, "eval_1_to_0": 769, "eval_1_to_1": 9192, "eval_accuracy": 0.93585, "eval_loss": 0.5786238312721252, "eval_runtime": 108.709, "eval_samples_per_second": 183.977, "eval_steps_per_second": 11.499, "step": 14320 }, { "epoch": 14.33, "grad_norm": 0.006423173006623983, "learning_rate": 4.970370370370371e-07, "loss": 0.06614415645599366, "step": 14330 }, { "epoch": 14.34, "grad_norm": 0.004086603876203299, "learning_rate": 4.896296296296297e-07, "loss": 0.00040988773107528684, "step": 14340 }, { "epoch": 14.34, "eval_0_to_0": 9522, "eval_0_to_1": 517, "eval_1_to_0": 775, "eval_1_to_1": 9186, "eval_accuracy": 0.9354, "eval_loss": 0.578685462474823, "eval_runtime": 108.7842, "eval_samples_per_second": 183.85, "eval_steps_per_second": 11.491, "step": 14340 }, { "epoch": 14.35, "grad_norm": 0.002256168518215418, "learning_rate": 4.822222222222222e-07, "loss": 0.042428651452064516, "step": 14350 }, { "epoch": 14.36, "grad_norm": 0.06187468767166138, "learning_rate": 4.748148148148148e-07, "loss": 0.072993803024292, "step": 14360 }, { "epoch": 14.36, "eval_0_to_0": 9524, "eval_0_to_1": 515, "eval_1_to_0": 776, "eval_1_to_1": 9185, "eval_accuracy": 0.93545, "eval_loss": 0.5765743255615234, "eval_runtime": 108.9508, "eval_samples_per_second": 183.569, "eval_steps_per_second": 11.473, "step": 14360 }, { "epoch": 14.37, "grad_norm": 0.0018402893329039216, "learning_rate": 4.674074074074075e-07, "loss": 0.00288035050034523, "step": 14370 }, { "epoch": 14.38, "grad_norm": 0.0026339495088905096, "learning_rate": 4.6000000000000004e-07, "loss": 0.007132177799940109, "step": 14380 }, { "epoch": 14.38, "eval_0_to_0": 9474, "eval_0_to_1": 565, "eval_1_to_0": 726, "eval_1_to_1": 9235, "eval_accuracy": 0.93545, "eval_loss": 0.5665817260742188, "eval_runtime": 109.6811, "eval_samples_per_second": 182.347, "eval_steps_per_second": 11.397, "step": 14380 }, { "epoch": 14.39, "grad_norm": 0.0027180276811122894, "learning_rate": 4.525925925925926e-07, "loss": 0.0029917173087596893, "step": 14390 }, { "epoch": 14.4, "grad_norm": 0.12536005675792694, "learning_rate": 4.4518518518518526e-07, "loss": 0.0002711698412895203, "step": 14400 }, { "epoch": 14.4, "eval_0_to_0": 9455, "eval_0_to_1": 584, "eval_1_to_0": 703, "eval_1_to_1": 9258, "eval_accuracy": 0.93565, "eval_loss": 0.5662322640419006, "eval_runtime": 109.2657, "eval_samples_per_second": 183.04, "eval_steps_per_second": 11.44, "step": 14400 }, { "epoch": 14.41, "grad_norm": 0.005506474990397692, "learning_rate": 4.377777777777778e-07, "loss": 0.0017204955220222473, "step": 14410 }, { "epoch": 14.42, "grad_norm": 51.40557861328125, "learning_rate": 4.303703703703704e-07, "loss": 0.00811886265873909, "step": 14420 }, { "epoch": 14.42, "eval_0_to_0": 9456, "eval_0_to_1": 583, "eval_1_to_0": 703, "eval_1_to_1": 9258, "eval_accuracy": 0.9357, "eval_loss": 0.5670852065086365, "eval_runtime": 108.9962, "eval_samples_per_second": 183.493, "eval_steps_per_second": 11.468, "step": 14420 }, { "epoch": 14.43, "grad_norm": 0.012359436601400375, "learning_rate": 4.22962962962963e-07, "loss": 0.023941712081432344, "step": 14430 }, { "epoch": 14.44, "grad_norm": 0.006118941120803356, "learning_rate": 4.155555555555556e-07, "loss": 0.003629820793867111, "step": 14440 }, { "epoch": 14.44, "eval_0_to_0": 9461, "eval_0_to_1": 578, "eval_1_to_0": 712, "eval_1_to_1": 9249, "eval_accuracy": 0.9355, "eval_loss": 0.5672248601913452, "eval_runtime": 109.0976, "eval_samples_per_second": 183.322, "eval_steps_per_second": 11.458, "step": 14440 }, { "epoch": 14.45, "grad_norm": 0.006350050680339336, "learning_rate": 4.081481481481482e-07, "loss": 0.00023443102836608886, "step": 14450 }, { "epoch": 14.46, "grad_norm": 0.01616443321108818, "learning_rate": 4.0074074074074075e-07, "loss": 0.02719046175479889, "step": 14460 }, { "epoch": 14.46, "eval_0_to_0": 9466, "eval_0_to_1": 573, "eval_1_to_0": 719, "eval_1_to_1": 9242, "eval_accuracy": 0.9354, "eval_loss": 0.569343090057373, "eval_runtime": 109.3607, "eval_samples_per_second": 182.881, "eval_steps_per_second": 11.43, "step": 14460 }, { "epoch": 14.47, "grad_norm": 0.007420164532959461, "learning_rate": 3.9333333333333336e-07, "loss": 0.0011657238006591796, "step": 14470 }, { "epoch": 14.48, "grad_norm": 0.00627601332962513, "learning_rate": 3.8592592592592597e-07, "loss": 0.008610769361257552, "step": 14480 }, { "epoch": 14.48, "eval_0_to_0": 9463, "eval_0_to_1": 576, "eval_1_to_0": 715, "eval_1_to_1": 9246, "eval_accuracy": 0.93545, "eval_loss": 0.5709326863288879, "eval_runtime": 109.5241, "eval_samples_per_second": 182.608, "eval_steps_per_second": 11.413, "step": 14480 }, { "epoch": 14.49, "grad_norm": 0.014549699611961842, "learning_rate": 3.785185185185185e-07, "loss": 0.0029754020273685456, "step": 14490 }, { "epoch": 14.5, "grad_norm": 0.002166848396882415, "learning_rate": 3.7111111111111113e-07, "loss": 0.0004873588681221008, "step": 14500 }, { "epoch": 14.5, "eval_0_to_0": 9456, "eval_0_to_1": 583, "eval_1_to_0": 700, "eval_1_to_1": 9261, "eval_accuracy": 0.93585, "eval_loss": 0.5705522298812866, "eval_runtime": 109.7074, "eval_samples_per_second": 182.303, "eval_steps_per_second": 11.394, "step": 14500 }, { "epoch": 14.51, "grad_norm": 0.004491740372031927, "learning_rate": 3.6370370370370374e-07, "loss": 0.011504694074392318, "step": 14510 }, { "epoch": 14.52, "grad_norm": 0.021007472649216652, "learning_rate": 3.562962962962963e-07, "loss": 0.0005722448229789733, "step": 14520 }, { "epoch": 14.52, "eval_0_to_0": 9458, "eval_0_to_1": 581, "eval_1_to_0": 698, "eval_1_to_1": 9263, "eval_accuracy": 0.93605, "eval_loss": 0.5709826350212097, "eval_runtime": 109.0081, "eval_samples_per_second": 183.473, "eval_steps_per_second": 11.467, "step": 14520 }, { "epoch": 14.53, "grad_norm": 0.009526616893708706, "learning_rate": 3.488888888888889e-07, "loss": 0.000226583331823349, "step": 14530 }, { "epoch": 14.54, "grad_norm": 0.0031170216389000416, "learning_rate": 3.414814814814815e-07, "loss": 0.051203829050064084, "step": 14540 }, { "epoch": 14.54, "eval_0_to_0": 9457, "eval_0_to_1": 582, "eval_1_to_0": 703, "eval_1_to_1": 9258, "eval_accuracy": 0.93575, "eval_loss": 0.5715907216072083, "eval_runtime": 109.5535, "eval_samples_per_second": 182.559, "eval_steps_per_second": 11.41, "step": 14540 }, { "epoch": 14.55, "grad_norm": 1.1200031042099, "learning_rate": 3.3407407407407407e-07, "loss": 0.0014854699373245239, "step": 14550 }, { "epoch": 14.56, "grad_norm": 3.0845959186553955, "learning_rate": 3.266666666666667e-07, "loss": 0.017072001099586488, "step": 14560 }, { "epoch": 14.56, "eval_0_to_0": 9445, "eval_0_to_1": 594, "eval_1_to_0": 688, "eval_1_to_1": 9273, "eval_accuracy": 0.9359, "eval_loss": 0.569507360458374, "eval_runtime": 109.3344, "eval_samples_per_second": 182.925, "eval_steps_per_second": 11.433, "step": 14560 }, { "epoch": 14.57, "grad_norm": 2.5705316066741943, "learning_rate": 3.192592592592593e-07, "loss": 0.011387581378221512, "step": 14570 }, { "epoch": 14.58, "grad_norm": 0.003717740997672081, "learning_rate": 3.1185185185185184e-07, "loss": 0.05621030926704407, "step": 14580 }, { "epoch": 14.58, "eval_0_to_0": 9454, "eval_0_to_1": 585, "eval_1_to_0": 700, "eval_1_to_1": 9261, "eval_accuracy": 0.93575, "eval_loss": 0.5691035985946655, "eval_runtime": 109.18, "eval_samples_per_second": 183.184, "eval_steps_per_second": 11.449, "step": 14580 }, { "epoch": 14.59, "grad_norm": 0.0012179289478808641, "learning_rate": 3.0444444444444445e-07, "loss": 0.029537910223007204, "step": 14590 }, { "epoch": 14.6, "grad_norm": 4.929560661315918, "learning_rate": 2.9703703703703706e-07, "loss": 0.009741115570068359, "step": 14600 }, { "epoch": 14.6, "eval_0_to_0": 9474, "eval_0_to_1": 565, "eval_1_to_0": 726, "eval_1_to_1": 9235, "eval_accuracy": 0.93545, "eval_loss": 0.5727049708366394, "eval_runtime": 108.8095, "eval_samples_per_second": 183.807, "eval_steps_per_second": 11.488, "step": 14600 }, { "epoch": 14.61, "grad_norm": 0.014814702793955803, "learning_rate": 2.8962962962962967e-07, "loss": 0.0009653672575950622, "step": 14610 }, { "epoch": 14.62, "grad_norm": 0.08099174499511719, "learning_rate": 2.822222222222222e-07, "loss": 0.015234307944774627, "step": 14620 }, { "epoch": 14.62, "eval_0_to_0": 9472, "eval_0_to_1": 567, "eval_1_to_0": 719, "eval_1_to_1": 9242, "eval_accuracy": 0.9357, "eval_loss": 0.5713216066360474, "eval_runtime": 107.7792, "eval_samples_per_second": 185.565, "eval_steps_per_second": 11.598, "step": 14620 }, { "epoch": 14.63, "grad_norm": 0.0013890765840187669, "learning_rate": 2.7481481481481483e-07, "loss": 0.030587589740753172, "step": 14630 }, { "epoch": 14.64, "grad_norm": 0.001759647042490542, "learning_rate": 2.6740740740740744e-07, "loss": 0.01992284655570984, "step": 14640 }, { "epoch": 14.64, "eval_0_to_0": 9468, "eval_0_to_1": 571, "eval_1_to_0": 704, "eval_1_to_1": 9257, "eval_accuracy": 0.93625, "eval_loss": 0.5688064694404602, "eval_runtime": 107.545, "eval_samples_per_second": 185.969, "eval_steps_per_second": 11.623, "step": 14640 }, { "epoch": 14.65, "grad_norm": 0.003541228361427784, "learning_rate": 2.6e-07, "loss": 0.014682656526565552, "step": 14650 }, { "epoch": 14.66, "grad_norm": 0.14947040379047394, "learning_rate": 2.525925925925926e-07, "loss": 0.026873356103897093, "step": 14660 }, { "epoch": 14.66, "eval_0_to_0": 9473, "eval_0_to_1": 566, "eval_1_to_0": 717, "eval_1_to_1": 9244, "eval_accuracy": 0.93585, "eval_loss": 0.5703344941139221, "eval_runtime": 107.5831, "eval_samples_per_second": 185.903, "eval_steps_per_second": 11.619, "step": 14660 }, { "epoch": 14.67, "grad_norm": 0.008443569764494896, "learning_rate": 2.451851851851852e-07, "loss": 0.01217588633298874, "step": 14670 }, { "epoch": 14.68, "grad_norm": 0.003839188953861594, "learning_rate": 2.3777777777777777e-07, "loss": 0.046043294668197635, "step": 14680 }, { "epoch": 14.68, "eval_0_to_0": 9471, "eval_0_to_1": 568, "eval_1_to_0": 708, "eval_1_to_1": 9253, "eval_accuracy": 0.9362, "eval_loss": 0.5692386031150818, "eval_runtime": 108.2313, "eval_samples_per_second": 184.789, "eval_steps_per_second": 11.549, "step": 14680 }, { "epoch": 14.69, "grad_norm": 0.029173487797379494, "learning_rate": 2.3037037037037038e-07, "loss": 0.000282210111618042, "step": 14690 }, { "epoch": 14.7, "grad_norm": 46.95602798461914, "learning_rate": 2.22962962962963e-07, "loss": 0.03964303135871887, "step": 14700 }, { "epoch": 14.7, "eval_0_to_0": 9469, "eval_0_to_1": 570, "eval_1_to_0": 707, "eval_1_to_1": 9254, "eval_accuracy": 0.93615, "eval_loss": 0.5690714716911316, "eval_runtime": 107.261, "eval_samples_per_second": 186.461, "eval_steps_per_second": 11.654, "step": 14700 }, { "epoch": 14.71, "grad_norm": 0.005464480724185705, "learning_rate": 2.155555555555556e-07, "loss": 0.00018482729792594909, "step": 14710 }, { "epoch": 14.72, "grad_norm": 0.003937767818570137, "learning_rate": 2.0814814814814815e-07, "loss": 0.0011898666620254517, "step": 14720 }, { "epoch": 14.72, "eval_0_to_0": 9476, "eval_0_to_1": 563, "eval_1_to_0": 723, "eval_1_to_1": 9238, "eval_accuracy": 0.9357, "eval_loss": 0.5711960196495056, "eval_runtime": 107.2663, "eval_samples_per_second": 186.452, "eval_steps_per_second": 11.653, "step": 14720 }, { "epoch": 14.73, "grad_norm": 0.07368577271699905, "learning_rate": 2.0074074074074076e-07, "loss": 0.00032992884516716006, "step": 14730 }, { "epoch": 14.74, "grad_norm": 0.0020475387573242188, "learning_rate": 1.9333333333333337e-07, "loss": 0.0003965213894844055, "step": 14740 }, { "epoch": 14.74, "eval_0_to_0": 9480, "eval_0_to_1": 559, "eval_1_to_0": 729, "eval_1_to_1": 9232, "eval_accuracy": 0.9356, "eval_loss": 0.5726655721664429, "eval_runtime": 107.3268, "eval_samples_per_second": 186.347, "eval_steps_per_second": 11.647, "step": 14740 }, { "epoch": 14.75, "grad_norm": 0.05278853327035904, "learning_rate": 1.8592592592592593e-07, "loss": 0.0008230350911617279, "step": 14750 }, { "epoch": 14.76, "grad_norm": 0.0013537771301344037, "learning_rate": 1.7851851851851853e-07, "loss": 0.00015901327133178712, "step": 14760 }, { "epoch": 14.76, "eval_0_to_0": 9478, "eval_0_to_1": 561, "eval_1_to_0": 726, "eval_1_to_1": 9235, "eval_accuracy": 0.93565, "eval_loss": 0.5724831819534302, "eval_runtime": 107.6369, "eval_samples_per_second": 185.81, "eval_steps_per_second": 11.613, "step": 14760 }, { "epoch": 14.77, "grad_norm": 0.0014014082262292504, "learning_rate": 1.7111111111111114e-07, "loss": 0.015306366980075837, "step": 14770 }, { "epoch": 14.78, "grad_norm": 0.006343543529510498, "learning_rate": 1.6370370370370373e-07, "loss": 0.022642965614795684, "step": 14780 }, { "epoch": 14.78, "eval_0_to_0": 9472, "eval_0_to_1": 567, "eval_1_to_0": 717, "eval_1_to_1": 9244, "eval_accuracy": 0.9358, "eval_loss": 0.5718001127243042, "eval_runtime": 107.1695, "eval_samples_per_second": 186.62, "eval_steps_per_second": 11.664, "step": 14780 }, { "epoch": 14.79, "grad_norm": 0.0016158168436959386, "learning_rate": 1.562962962962963e-07, "loss": 0.057637184858322144, "step": 14790 }, { "epoch": 14.8, "grad_norm": 0.002299543470144272, "learning_rate": 1.488888888888889e-07, "loss": 0.01807112991809845, "step": 14800 }, { "epoch": 14.8, "eval_0_to_0": 9459, "eval_0_to_1": 580, "eval_1_to_0": 699, "eval_1_to_1": 9262, "eval_accuracy": 0.93605, "eval_loss": 0.570067822933197, "eval_runtime": 106.9601, "eval_samples_per_second": 186.986, "eval_steps_per_second": 11.687, "step": 14800 }, { "epoch": 14.81, "grad_norm": 0.004952805116772652, "learning_rate": 1.414814814814815e-07, "loss": 0.027576228976249693, "step": 14810 }, { "epoch": 14.82, "grad_norm": 0.008432455360889435, "learning_rate": 1.3407407407407408e-07, "loss": 0.00023176968097686766, "step": 14820 }, { "epoch": 14.82, "eval_0_to_0": 9463, "eval_0_to_1": 576, "eval_1_to_0": 704, "eval_1_to_1": 9257, "eval_accuracy": 0.936, "eval_loss": 0.5705469250679016, "eval_runtime": 107.0621, "eval_samples_per_second": 186.808, "eval_steps_per_second": 11.675, "step": 14820 }, { "epoch": 14.83, "grad_norm": 0.06044705957174301, "learning_rate": 1.2666666666666666e-07, "loss": 0.00033814385533332826, "step": 14830 }, { "epoch": 14.84, "grad_norm": 0.018525971099734306, "learning_rate": 1.1925925925925927e-07, "loss": 0.0004036054015159607, "step": 14840 }, { "epoch": 14.84, "eval_0_to_0": 9464, "eval_0_to_1": 575, "eval_1_to_0": 708, "eval_1_to_1": 9253, "eval_accuracy": 0.93585, "eval_loss": 0.5710820555686951, "eval_runtime": 107.2205, "eval_samples_per_second": 186.531, "eval_steps_per_second": 11.658, "step": 14840 }, { "epoch": 14.85, "grad_norm": 0.0016767787747085094, "learning_rate": 1.1185185185185187e-07, "loss": 0.00021882951259613037, "step": 14850 }, { "epoch": 14.86, "grad_norm": 0.0020645244512706995, "learning_rate": 1.0444444444444445e-07, "loss": 0.00015410482883453368, "step": 14860 }, { "epoch": 14.86, "eval_0_to_0": 9465, "eval_0_to_1": 574, "eval_1_to_0": 709, "eval_1_to_1": 9252, "eval_accuracy": 0.93585, "eval_loss": 0.5714698433876038, "eval_runtime": 107.6985, "eval_samples_per_second": 185.704, "eval_steps_per_second": 11.606, "step": 14860 }, { "epoch": 14.87, "grad_norm": 0.0029674635734409094, "learning_rate": 9.703703703703704e-08, "loss": 0.00019254162907600403, "step": 14870 }, { "epoch": 14.88, "grad_norm": 0.0030732029117643833, "learning_rate": 8.962962962962963e-08, "loss": 0.00024805665016174315, "step": 14880 }, { "epoch": 14.88, "eval_0_to_0": 9466, "eval_0_to_1": 573, "eval_1_to_0": 710, "eval_1_to_1": 9251, "eval_accuracy": 0.93585, "eval_loss": 0.5718342065811157, "eval_runtime": 107.2106, "eval_samples_per_second": 186.549, "eval_steps_per_second": 11.659, "step": 14880 }, { "epoch": 14.89, "grad_norm": 0.01480776909738779, "learning_rate": 8.222222222222223e-08, "loss": 0.0033100016415119173, "step": 14890 }, { "epoch": 14.9, "grad_norm": 0.0014764376683160663, "learning_rate": 7.481481481481482e-08, "loss": 0.00027778148651123045, "step": 14900 }, { "epoch": 14.9, "eval_0_to_0": 9467, "eval_0_to_1": 572, "eval_1_to_0": 710, "eval_1_to_1": 9251, "eval_accuracy": 0.9359, "eval_loss": 0.5722641348838806, "eval_runtime": 106.9563, "eval_samples_per_second": 186.992, "eval_steps_per_second": 11.687, "step": 14900 }, { "epoch": 14.91, "grad_norm": 0.004346600268036127, "learning_rate": 6.740740740740741e-08, "loss": 0.0002376645803451538, "step": 14910 }, { "epoch": 14.92, "grad_norm": 0.004164547193795443, "learning_rate": 6.000000000000001e-08, "loss": 0.004358676820993423, "step": 14920 }, { "epoch": 14.92, "eval_0_to_0": 9466, "eval_0_to_1": 573, "eval_1_to_0": 709, "eval_1_to_1": 9252, "eval_accuracy": 0.9359, "eval_loss": 0.5723270773887634, "eval_runtime": 107.5325, "eval_samples_per_second": 185.99, "eval_steps_per_second": 11.624, "step": 14920 }, { "epoch": 14.93, "grad_norm": 0.0021367687731981277, "learning_rate": 5.2592592592592597e-08, "loss": 0.0002818271517753601, "step": 14930 }, { "epoch": 14.94, "grad_norm": 0.002305025700479746, "learning_rate": 4.518518518518519e-08, "loss": 0.0016917668282985688, "step": 14940 }, { "epoch": 14.94, "eval_0_to_0": 9466, "eval_0_to_1": 573, "eval_1_to_0": 708, "eval_1_to_1": 9253, "eval_accuracy": 0.93595, "eval_loss": 0.5722901821136475, "eval_runtime": 107.4411, "eval_samples_per_second": 186.148, "eval_steps_per_second": 11.634, "step": 14940 }, { "epoch": 14.95, "grad_norm": 0.03406720981001854, "learning_rate": 3.777777777777778e-08, "loss": 0.015002650022506715, "step": 14950 }, { "epoch": 14.96, "grad_norm": 0.0035469892900437117, "learning_rate": 3.037037037037037e-08, "loss": 0.0040864221751689914, "step": 14960 }, { "epoch": 14.96, "eval_0_to_0": 9464, "eval_0_to_1": 575, "eval_1_to_0": 708, "eval_1_to_1": 9253, "eval_accuracy": 0.93585, "eval_loss": 0.5720401406288147, "eval_runtime": 107.4055, "eval_samples_per_second": 186.21, "eval_steps_per_second": 11.638, "step": 14960 }, { "epoch": 14.97, "grad_norm": 0.001586054335348308, "learning_rate": 2.2962962962962965e-08, "loss": 0.00014096051454544068, "step": 14970 }, { "epoch": 14.98, "grad_norm": 0.0020179906859993935, "learning_rate": 1.5555555555555557e-08, "loss": 0.013604606688022613, "step": 14980 }, { "epoch": 14.98, "eval_0_to_0": 9464, "eval_0_to_1": 575, "eval_1_to_0": 708, "eval_1_to_1": 9253, "eval_accuracy": 0.93585, "eval_loss": 0.5720572471618652, "eval_runtime": 107.014, "eval_samples_per_second": 186.891, "eval_steps_per_second": 11.681, "step": 14980 }, { "epoch": 14.99, "grad_norm": 0.0046332161873579025, "learning_rate": 8.148148148148149e-09, "loss": 0.0016956858336925507, "step": 14990 }, { "epoch": 15.0, "grad_norm": 0.009781447239220142, "learning_rate": 7.407407407407408e-10, "loss": 0.0009538218379020691, "step": 15000 }, { "epoch": 15.0, "eval_0_to_0": 9464, "eval_0_to_1": 575, "eval_1_to_0": 708, "eval_1_to_1": 9253, "eval_accuracy": 0.93585, "eval_loss": 0.5719918608665466, "eval_runtime": 107.0355, "eval_samples_per_second": 186.854, "eval_steps_per_second": 11.678, "step": 15000 }, { "epoch": 15.0, "step": 15000, "total_flos": 1.1183176359936e+18, "train_loss": 0.2879694655368725, "train_runtime": 108889.4327, "train_samples_per_second": 11.02, "train_steps_per_second": 0.138 } ], "logging_steps": 10, "max_steps": 15000, "num_input_tokens_seen": 0, "num_train_epochs": 15, "save_steps": 20, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.1183176359936e+18, "train_batch_size": 16, "trial_name": null, "trial_params": null }