| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 25.512, |
| "eval_steps": 500, |
| "global_step": 5000, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "balancing_entropy": 1.0907, |
| "balancing_loss": 1.1417, |
| "epoch": 0.0512, |
| "grad_norm": 1.015625, |
| "learning_rate": 3.076923076923077e-05, |
| "loss": 12.4636, |
| "router_z_loss": 1.3718, |
| "step": 10 |
| }, |
| { |
| "balancing_entropy": 1.0804, |
| "balancing_loss": 1.1423, |
| "epoch": 0.1024, |
| "grad_norm": 0.91015625, |
| "learning_rate": 6.153846153846154e-05, |
| "loss": 12.2249, |
| "router_z_loss": 1.3676, |
| "step": 20 |
| }, |
| { |
| "balancing_entropy": 1.0952, |
| "balancing_loss": 1.1429, |
| "epoch": 0.1536, |
| "grad_norm": 0.8515625, |
| "learning_rate": 9.230769230769232e-05, |
| "loss": 11.7705, |
| "router_z_loss": 1.3434, |
| "step": 30 |
| }, |
| { |
| "balancing_entropy": 1.0779, |
| "balancing_loss": 1.144, |
| "epoch": 0.2048, |
| "grad_norm": 0.828125, |
| "learning_rate": 0.00012307692307692307, |
| "loss": 11.111, |
| "router_z_loss": 1.2754, |
| "step": 40 |
| }, |
| { |
| "balancing_entropy": 1.0905, |
| "balancing_loss": 1.1422, |
| "epoch": 0.256, |
| "grad_norm": 1.046875, |
| "learning_rate": 0.00015384615384615385, |
| "loss": 10.1841, |
| "router_z_loss": 1.2004, |
| "step": 50 |
| }, |
| { |
| "balancing_entropy": 1.0915, |
| "balancing_loss": 1.1419, |
| "epoch": 0.3072, |
| "grad_norm": 0.63671875, |
| "learning_rate": 0.00018461538461538463, |
| "loss": 9.2971, |
| "router_z_loss": 1.1388, |
| "step": 60 |
| }, |
| { |
| "balancing_entropy": 1.0865, |
| "balancing_loss": 1.1409, |
| "epoch": 0.3584, |
| "grad_norm": 0.73828125, |
| "learning_rate": 0.0002153846153846154, |
| "loss": 8.6456, |
| "router_z_loss": 1.1099, |
| "step": 70 |
| }, |
| { |
| "balancing_entropy": 1.0621, |
| "balancing_loss": 1.1474, |
| "epoch": 0.4096, |
| "grad_norm": 2.71875, |
| "learning_rate": 0.00024615384615384614, |
| "loss": 8.2519, |
| "router_z_loss": 1.0139, |
| "step": 80 |
| }, |
| { |
| "balancing_entropy": 1.0621, |
| "balancing_loss": 1.1455, |
| "epoch": 0.4608, |
| "grad_norm": 1.0703125, |
| "learning_rate": 0.00027692307692307695, |
| "loss": 7.9354, |
| "router_z_loss": 0.8722, |
| "step": 90 |
| }, |
| { |
| "balancing_entropy": 1.0783, |
| "balancing_loss": 1.1375, |
| "epoch": 0.512, |
| "grad_norm": 0.765625, |
| "learning_rate": 0.0003076923076923077, |
| "loss": 7.5548, |
| "router_z_loss": 0.7341, |
| "step": 100 |
| }, |
| { |
| "balancing_entropy": 1.0898, |
| "balancing_loss": 1.1312, |
| "epoch": 0.5632, |
| "grad_norm": 0.91015625, |
| "learning_rate": 0.00033846153846153846, |
| "loss": 7.0768, |
| "router_z_loss": 0.6111, |
| "step": 110 |
| }, |
| { |
| "balancing_entropy": 1.0923, |
| "balancing_loss": 1.131, |
| "epoch": 0.6144, |
| "grad_norm": 0.65234375, |
| "learning_rate": 0.00036923076923076927, |
| "loss": 6.5868, |
| "router_z_loss": 0.4137, |
| "step": 120 |
| }, |
| { |
| "balancing_entropy": 1.0932, |
| "balancing_loss": 1.1305, |
| "epoch": 0.6656, |
| "grad_norm": 0.458984375, |
| "learning_rate": 0.0004, |
| "loss": 6.2033, |
| "router_z_loss": 0.2772, |
| "step": 130 |
| }, |
| { |
| "balancing_entropy": 1.0953, |
| "balancing_loss": 1.1305, |
| "epoch": 0.7168, |
| "grad_norm": 1.421875, |
| "learning_rate": 0.0004307692307692308, |
| "loss": 5.9507, |
| "router_z_loss": 0.2233, |
| "step": 140 |
| }, |
| { |
| "balancing_entropy": 1.0941, |
| "balancing_loss": 1.1261, |
| "epoch": 0.768, |
| "grad_norm": 1.0234375, |
| "learning_rate": 0.0004615384615384616, |
| "loss": 5.7447, |
| "router_z_loss": 0.1919, |
| "step": 150 |
| }, |
| { |
| "balancing_entropy": 1.0942, |
| "balancing_loss": 1.1258, |
| "epoch": 0.8192, |
| "grad_norm": 0.625, |
| "learning_rate": 0.0004923076923076923, |
| "loss": 5.5495, |
| "router_z_loss": 0.14, |
| "step": 160 |
| }, |
| { |
| "balancing_entropy": 1.0947, |
| "balancing_loss": 1.1259, |
| "epoch": 0.8704, |
| "grad_norm": 0.61328125, |
| "learning_rate": 0.0005230769230769231, |
| "loss": 5.3746, |
| "router_z_loss": 0.1123, |
| "step": 170 |
| }, |
| { |
| "balancing_entropy": 1.0951, |
| "balancing_loss": 1.1255, |
| "epoch": 0.9216, |
| "grad_norm": 1.1328125, |
| "learning_rate": 0.0005538461538461539, |
| "loss": 5.2159, |
| "router_z_loss": 0.0839, |
| "step": 180 |
| }, |
| { |
| "balancing_entropy": 1.0916, |
| "balancing_loss": 1.1175, |
| "epoch": 0.9728, |
| "grad_norm": 1.4140625, |
| "learning_rate": 0.0005846153846153846, |
| "loss": 5.0335, |
| "router_z_loss": 0.071, |
| "step": 190 |
| }, |
| { |
| "balancing_entropy": 1.0491, |
| "balancing_loss": 1.1153, |
| "epoch": 1.02048, |
| "grad_norm": 0.7578125, |
| "learning_rate": 0.0006153846153846154, |
| "loss": 4.9021, |
| "router_z_loss": 0.064, |
| "step": 200 |
| }, |
| { |
| "balancing_entropy": 1.0888, |
| "balancing_loss": 1.1112, |
| "epoch": 1.07168, |
| "grad_norm": 1.046875, |
| "learning_rate": 0.0006461538461538462, |
| "loss": 4.7524, |
| "router_z_loss": 0.0585, |
| "step": 210 |
| }, |
| { |
| "balancing_entropy": 1.0875, |
| "balancing_loss": 1.1083, |
| "epoch": 1.12288, |
| "grad_norm": 1.2109375, |
| "learning_rate": 0.0006769230769230769, |
| "loss": 4.6408, |
| "router_z_loss": 0.0605, |
| "step": 220 |
| }, |
| { |
| "balancing_entropy": 1.0884, |
| "balancing_loss": 1.1063, |
| "epoch": 1.17408, |
| "grad_norm": 0.9453125, |
| "learning_rate": 0.0007076923076923077, |
| "loss": 4.53, |
| "router_z_loss": 0.0596, |
| "step": 230 |
| }, |
| { |
| "balancing_entropy": 1.0853, |
| "balancing_loss": 1.1053, |
| "epoch": 1.22528, |
| "grad_norm": 1.0546875, |
| "learning_rate": 0.0007384615384615385, |
| "loss": 4.3935, |
| "router_z_loss": 0.054, |
| "step": 240 |
| }, |
| { |
| "balancing_entropy": 1.0895, |
| "balancing_loss": 1.1085, |
| "epoch": 1.27648, |
| "grad_norm": 1.0390625, |
| "learning_rate": 0.0007692307692307692, |
| "loss": 4.3076, |
| "router_z_loss": 0.064, |
| "step": 250 |
| }, |
| { |
| "balancing_entropy": 1.0829, |
| "balancing_loss": 1.1033, |
| "epoch": 1.32768, |
| "grad_norm": 0.7265625, |
| "learning_rate": 0.0008, |
| "loss": 4.2385, |
| "router_z_loss": 0.0581, |
| "step": 260 |
| }, |
| { |
| "balancing_entropy": 1.0855, |
| "balancing_loss": 1.1075, |
| "epoch": 1.37888, |
| "grad_norm": 0.6484375, |
| "learning_rate": 0.0008307692307692308, |
| "loss": 4.1286, |
| "router_z_loss": 0.0563, |
| "step": 270 |
| }, |
| { |
| "balancing_entropy": 1.0869, |
| "balancing_loss": 1.0988, |
| "epoch": 1.43008, |
| "grad_norm": 0.734375, |
| "learning_rate": 0.0008615384615384615, |
| "loss": 4.0637, |
| "router_z_loss": 0.0596, |
| "step": 280 |
| }, |
| { |
| "balancing_entropy": 1.0885, |
| "balancing_loss": 1.1019, |
| "epoch": 1.48128, |
| "grad_norm": 1.015625, |
| "learning_rate": 0.0008923076923076924, |
| "loss": 3.9922, |
| "router_z_loss": 0.0532, |
| "step": 290 |
| }, |
| { |
| "balancing_entropy": 1.084, |
| "balancing_loss": 1.103, |
| "epoch": 1.53248, |
| "grad_norm": 0.9765625, |
| "learning_rate": 0.0009230769230769232, |
| "loss": 3.9192, |
| "router_z_loss": 0.0501, |
| "step": 300 |
| }, |
| { |
| "balancing_entropy": 1.086, |
| "balancing_loss": 1.0974, |
| "epoch": 1.58368, |
| "grad_norm": 0.57421875, |
| "learning_rate": 0.0009538461538461538, |
| "loss": 3.8677, |
| "router_z_loss": 0.0553, |
| "step": 310 |
| }, |
| { |
| "balancing_entropy": 1.0875, |
| "balancing_loss": 1.1006, |
| "epoch": 1.6348799999999999, |
| "grad_norm": 0.78125, |
| "learning_rate": 0.0009846153846153846, |
| "loss": 3.8262, |
| "router_z_loss": 0.0528, |
| "step": 320 |
| }, |
| { |
| "balancing_entropy": 1.0874, |
| "balancing_loss": 1.1033, |
| "epoch": 1.68608, |
| "grad_norm": 0.53515625, |
| "learning_rate": 0.0010153846153846155, |
| "loss": 3.7606, |
| "router_z_loss": 0.053, |
| "step": 330 |
| }, |
| { |
| "balancing_entropy": 1.0766, |
| "balancing_loss": 1.1084, |
| "epoch": 1.7372800000000002, |
| "grad_norm": 0.7890625, |
| "learning_rate": 0.0010461538461538462, |
| "loss": 3.6967, |
| "router_z_loss": 0.0483, |
| "step": 340 |
| }, |
| { |
| "balancing_entropy": 1.0786, |
| "balancing_loss": 1.0986, |
| "epoch": 1.7884799999999998, |
| "grad_norm": 0.80078125, |
| "learning_rate": 0.0010769230769230769, |
| "loss": 3.684, |
| "router_z_loss": 0.0669, |
| "step": 350 |
| }, |
| { |
| "balancing_entropy": 1.0872, |
| "balancing_loss": 1.0975, |
| "epoch": 1.83968, |
| "grad_norm": 0.75, |
| "learning_rate": 0.0011076923076923078, |
| "loss": 3.6041, |
| "router_z_loss": 0.0526, |
| "step": 360 |
| }, |
| { |
| "balancing_entropy": 1.0866, |
| "balancing_loss": 1.106, |
| "epoch": 1.8908800000000001, |
| "grad_norm": 0.88671875, |
| "learning_rate": 0.0011384615384615385, |
| "loss": 3.5964, |
| "router_z_loss": 0.0513, |
| "step": 370 |
| }, |
| { |
| "balancing_entropy": 1.0801, |
| "balancing_loss": 1.0959, |
| "epoch": 1.94208, |
| "grad_norm": 0.453125, |
| "learning_rate": 0.0011692307692307692, |
| "loss": 3.5742, |
| "router_z_loss": 0.0519, |
| "step": 380 |
| }, |
| { |
| "balancing_entropy": 1.0785, |
| "balancing_loss": 1.1051, |
| "epoch": 1.99328, |
| "grad_norm": 0.65234375, |
| "learning_rate": 0.0012000000000000001, |
| "loss": 3.5006, |
| "router_z_loss": 0.0563, |
| "step": 390 |
| }, |
| { |
| "balancing_entropy": 1.0483, |
| "balancing_loss": 1.0966, |
| "epoch": 2.04096, |
| "grad_norm": 1.0390625, |
| "learning_rate": 0.0012307692307692308, |
| "loss": 3.4658, |
| "router_z_loss": 0.0533, |
| "step": 400 |
| }, |
| { |
| "balancing_entropy": 1.0882, |
| "balancing_loss": 1.1001, |
| "epoch": 2.09216, |
| "grad_norm": 0.4609375, |
| "learning_rate": 0.0012615384615384615, |
| "loss": 3.4427, |
| "router_z_loss": 0.0443, |
| "step": 410 |
| }, |
| { |
| "balancing_entropy": 1.0891, |
| "balancing_loss": 1.0997, |
| "epoch": 2.14336, |
| "grad_norm": 0.76171875, |
| "learning_rate": 0.0012923076923076924, |
| "loss": 3.4206, |
| "router_z_loss": 0.0417, |
| "step": 420 |
| }, |
| { |
| "balancing_entropy": 1.088, |
| "balancing_loss": 1.0989, |
| "epoch": 2.19456, |
| "grad_norm": 0.8125, |
| "learning_rate": 0.0013230769230769231, |
| "loss": 3.3869, |
| "router_z_loss": 0.0436, |
| "step": 430 |
| }, |
| { |
| "balancing_entropy": 1.0683, |
| "balancing_loss": 1.1073, |
| "epoch": 2.24576, |
| "grad_norm": 0.62890625, |
| "learning_rate": 0.0013538461538461538, |
| "loss": 3.3571, |
| "router_z_loss": 0.0491, |
| "step": 440 |
| }, |
| { |
| "balancing_entropy": 1.0751, |
| "balancing_loss": 1.0967, |
| "epoch": 2.29696, |
| "grad_norm": 0.55859375, |
| "learning_rate": 0.0013846153846153847, |
| "loss": 3.3558, |
| "router_z_loss": 0.053, |
| "step": 450 |
| }, |
| { |
| "balancing_entropy": 1.0669, |
| "balancing_loss": 1.1059, |
| "epoch": 2.34816, |
| "grad_norm": 0.609375, |
| "learning_rate": 0.0014153846153846154, |
| "loss": 3.3114, |
| "router_z_loss": 0.0561, |
| "step": 460 |
| }, |
| { |
| "balancing_entropy": 1.0747, |
| "balancing_loss": 1.0934, |
| "epoch": 2.39936, |
| "grad_norm": 0.490234375, |
| "learning_rate": 0.0014461538461538461, |
| "loss": 3.3037, |
| "router_z_loss": 0.0516, |
| "step": 470 |
| }, |
| { |
| "balancing_entropy": 1.0815, |
| "balancing_loss": 1.0988, |
| "epoch": 2.45056, |
| "grad_norm": 0.66796875, |
| "learning_rate": 0.001476923076923077, |
| "loss": 3.2948, |
| "router_z_loss": 0.0525, |
| "step": 480 |
| }, |
| { |
| "balancing_entropy": 1.0909, |
| "balancing_loss": 1.1038, |
| "epoch": 2.50176, |
| "grad_norm": 0.49609375, |
| "learning_rate": 0.0015076923076923078, |
| "loss": 3.2504, |
| "router_z_loss": 0.0423, |
| "step": 490 |
| }, |
| { |
| "balancing_entropy": 1.0772, |
| "balancing_loss": 1.1019, |
| "epoch": 2.55296, |
| "grad_norm": 0.4921875, |
| "learning_rate": 0.0015384615384615385, |
| "loss": 3.2454, |
| "router_z_loss": 0.0377, |
| "step": 500 |
| }, |
| { |
| "balancing_entropy": 1.082, |
| "balancing_loss": 1.0907, |
| "epoch": 2.6041600000000003, |
| "grad_norm": 0.7578125, |
| "learning_rate": 0.0015692307692307694, |
| "loss": 3.2209, |
| "router_z_loss": 0.0374, |
| "step": 510 |
| }, |
| { |
| "balancing_entropy": 1.0875, |
| "balancing_loss": 1.104, |
| "epoch": 2.65536, |
| "grad_norm": 0.443359375, |
| "learning_rate": 0.0016, |
| "loss": 3.2235, |
| "router_z_loss": 0.0341, |
| "step": 520 |
| }, |
| { |
| "balancing_entropy": 1.0829, |
| "balancing_loss": 1.1012, |
| "epoch": 2.70656, |
| "grad_norm": 0.8359375, |
| "learning_rate": 0.0016307692307692308, |
| "loss": 3.1925, |
| "router_z_loss": 0.0327, |
| "step": 530 |
| }, |
| { |
| "balancing_entropy": 1.0765, |
| "balancing_loss": 1.1007, |
| "epoch": 2.75776, |
| "grad_norm": 0.326171875, |
| "learning_rate": 0.0016615384615384617, |
| "loss": 3.2021, |
| "router_z_loss": 0.0391, |
| "step": 540 |
| }, |
| { |
| "balancing_entropy": 1.0868, |
| "balancing_loss": 1.0972, |
| "epoch": 2.80896, |
| "grad_norm": 0.4375, |
| "learning_rate": 0.0016923076923076924, |
| "loss": 3.1871, |
| "router_z_loss": 0.0459, |
| "step": 550 |
| }, |
| { |
| "balancing_entropy": 1.0733, |
| "balancing_loss": 1.0959, |
| "epoch": 2.86016, |
| "grad_norm": 0.48046875, |
| "learning_rate": 0.001723076923076923, |
| "loss": 3.1595, |
| "router_z_loss": 0.0345, |
| "step": 560 |
| }, |
| { |
| "balancing_entropy": 1.077, |
| "balancing_loss": 1.1003, |
| "epoch": 2.91136, |
| "grad_norm": 0.482421875, |
| "learning_rate": 0.001753846153846154, |
| "loss": 3.1634, |
| "router_z_loss": 0.0334, |
| "step": 570 |
| }, |
| { |
| "balancing_entropy": 1.088, |
| "balancing_loss": 1.0995, |
| "epoch": 2.96256, |
| "grad_norm": 0.390625, |
| "learning_rate": 0.0017846153846153847, |
| "loss": 3.1342, |
| "router_z_loss": 0.0411, |
| "step": 580 |
| }, |
| { |
| "balancing_entropy": 1.0335, |
| "balancing_loss": 1.1026, |
| "epoch": 3.01024, |
| "grad_norm": 0.58984375, |
| "learning_rate": 0.0018153846153846154, |
| "loss": 3.13, |
| "router_z_loss": 0.0393, |
| "step": 590 |
| }, |
| { |
| "balancing_entropy": 1.0877, |
| "balancing_loss": 1.1057, |
| "epoch": 3.06144, |
| "grad_norm": 0.37109375, |
| "learning_rate": 0.0018461538461538463, |
| "loss": 3.1095, |
| "router_z_loss": 0.0361, |
| "step": 600 |
| }, |
| { |
| "balancing_entropy": 1.0627, |
| "balancing_loss": 1.0867, |
| "epoch": 3.11264, |
| "grad_norm": 0.5859375, |
| "learning_rate": 0.001876923076923077, |
| "loss": 3.1136, |
| "router_z_loss": 0.0396, |
| "step": 610 |
| }, |
| { |
| "balancing_entropy": 1.0767, |
| "balancing_loss": 1.1135, |
| "epoch": 3.16384, |
| "grad_norm": 0.294921875, |
| "learning_rate": 0.0019076923076923075, |
| "loss": 3.0938, |
| "router_z_loss": 0.0543, |
| "step": 620 |
| }, |
| { |
| "balancing_entropy": 1.0881, |
| "balancing_loss": 1.092, |
| "epoch": 3.21504, |
| "grad_norm": 0.40234375, |
| "learning_rate": 0.0019384615384615386, |
| "loss": 3.0719, |
| "router_z_loss": 0.0355, |
| "step": 630 |
| }, |
| { |
| "balancing_entropy": 1.08, |
| "balancing_loss": 1.0957, |
| "epoch": 3.26624, |
| "grad_norm": 0.443359375, |
| "learning_rate": 0.001969230769230769, |
| "loss": 3.0781, |
| "router_z_loss": 0.033, |
| "step": 640 |
| }, |
| { |
| "balancing_entropy": 1.0757, |
| "balancing_loss": 1.0982, |
| "epoch": 3.31744, |
| "grad_norm": 0.443359375, |
| "learning_rate": 0.002, |
| "loss": 3.0823, |
| "router_z_loss": 0.0554, |
| "step": 650 |
| }, |
| { |
| "balancing_entropy": 1.0748, |
| "balancing_loss": 1.0967, |
| "epoch": 3.36864, |
| "grad_norm": 0.30078125, |
| "learning_rate": 0.002030769230769231, |
| "loss": 3.0585, |
| "router_z_loss": 0.0474, |
| "step": 660 |
| }, |
| { |
| "balancing_entropy": 1.0867, |
| "balancing_loss": 1.0972, |
| "epoch": 3.4198399999999998, |
| "grad_norm": 0.37109375, |
| "learning_rate": 0.0020615384615384614, |
| "loss": 3.0622, |
| "router_z_loss": 0.0297, |
| "step": 670 |
| }, |
| { |
| "balancing_entropy": 1.0796, |
| "balancing_loss": 1.1021, |
| "epoch": 3.47104, |
| "grad_norm": 0.5234375, |
| "learning_rate": 0.0020923076923076924, |
| "loss": 3.0576, |
| "router_z_loss": 0.033, |
| "step": 680 |
| }, |
| { |
| "balancing_entropy": 1.0829, |
| "balancing_loss": 1.096, |
| "epoch": 3.52224, |
| "grad_norm": 0.345703125, |
| "learning_rate": 0.0021230769230769233, |
| "loss": 3.0549, |
| "router_z_loss": 0.0452, |
| "step": 690 |
| }, |
| { |
| "balancing_entropy": 1.0569, |
| "balancing_loss": 1.1113, |
| "epoch": 3.5734399999999997, |
| "grad_norm": 0.58203125, |
| "learning_rate": 0.0021538461538461538, |
| "loss": 3.0211, |
| "router_z_loss": 0.0321, |
| "step": 700 |
| }, |
| { |
| "balancing_entropy": 1.0693, |
| "balancing_loss": 1.0886, |
| "epoch": 3.62464, |
| "grad_norm": 0.498046875, |
| "learning_rate": 0.0021846153846153847, |
| "loss": 3.0315, |
| "router_z_loss": 0.0772, |
| "step": 710 |
| }, |
| { |
| "balancing_entropy": 1.0871, |
| "balancing_loss": 1.1029, |
| "epoch": 3.67584, |
| "grad_norm": 0.2734375, |
| "learning_rate": 0.0022153846153846156, |
| "loss": 3.0335, |
| "router_z_loss": 0.0542, |
| "step": 720 |
| }, |
| { |
| "balancing_entropy": 1.0822, |
| "balancing_loss": 1.0957, |
| "epoch": 3.72704, |
| "grad_norm": 0.412109375, |
| "learning_rate": 0.002246153846153846, |
| "loss": 3.023, |
| "router_z_loss": 0.0253, |
| "step": 730 |
| }, |
| { |
| "balancing_entropy": 1.0735, |
| "balancing_loss": 1.095, |
| "epoch": 3.7782400000000003, |
| "grad_norm": 0.35546875, |
| "learning_rate": 0.002276923076923077, |
| "loss": 3.0195, |
| "router_z_loss": 0.0519, |
| "step": 740 |
| }, |
| { |
| "balancing_entropy": 1.0694, |
| "balancing_loss": 1.1025, |
| "epoch": 3.82944, |
| "grad_norm": 0.4140625, |
| "learning_rate": 0.002307692307692308, |
| "loss": 3.0002, |
| "router_z_loss": 0.0451, |
| "step": 750 |
| }, |
| { |
| "balancing_entropy": 1.0771, |
| "balancing_loss": 1.0982, |
| "epoch": 3.88064, |
| "grad_norm": 0.328125, |
| "learning_rate": 0.0023384615384615384, |
| "loss": 3.0, |
| "router_z_loss": 0.0436, |
| "step": 760 |
| }, |
| { |
| "balancing_entropy": 1.0773, |
| "balancing_loss": 1.0907, |
| "epoch": 3.9318400000000002, |
| "grad_norm": 0.30859375, |
| "learning_rate": 0.0023692307692307693, |
| "loss": 2.989, |
| "router_z_loss": 0.0405, |
| "step": 770 |
| }, |
| { |
| "balancing_entropy": 1.0698, |
| "balancing_loss": 1.112, |
| "epoch": 3.98304, |
| "grad_norm": 0.337890625, |
| "learning_rate": 0.0024000000000000002, |
| "loss": 2.9775, |
| "router_z_loss": 0.0363, |
| "step": 780 |
| }, |
| { |
| "balancing_entropy": 1.0339, |
| "balancing_loss": 1.0875, |
| "epoch": 4.03072, |
| "grad_norm": 0.44140625, |
| "learning_rate": 0.0024307692307692307, |
| "loss": 2.9959, |
| "router_z_loss": 0.0587, |
| "step": 790 |
| }, |
| { |
| "balancing_entropy": 1.0776, |
| "balancing_loss": 1.0943, |
| "epoch": 4.08192, |
| "grad_norm": 0.267578125, |
| "learning_rate": 0.0024615384615384616, |
| "loss": 2.965, |
| "router_z_loss": 0.0367, |
| "step": 800 |
| }, |
| { |
| "balancing_entropy": 1.0624, |
| "balancing_loss": 1.1087, |
| "epoch": 4.13312, |
| "grad_norm": 0.373046875, |
| "learning_rate": 0.0024923076923076925, |
| "loss": 2.9649, |
| "router_z_loss": 0.0522, |
| "step": 810 |
| }, |
| { |
| "balancing_entropy": 1.0813, |
| "balancing_loss": 1.1016, |
| "epoch": 4.18432, |
| "grad_norm": 0.287109375, |
| "learning_rate": 0.002523076923076923, |
| "loss": 2.953, |
| "router_z_loss": 0.055, |
| "step": 820 |
| }, |
| { |
| "balancing_entropy": 1.0713, |
| "balancing_loss": 1.1215, |
| "epoch": 4.23552, |
| "grad_norm": 0.33203125, |
| "learning_rate": 0.002553846153846154, |
| "loss": 2.9571, |
| "router_z_loss": 0.068, |
| "step": 830 |
| }, |
| { |
| "balancing_entropy": 1.0691, |
| "balancing_loss": 1.0899, |
| "epoch": 4.28672, |
| "grad_norm": 0.30078125, |
| "learning_rate": 0.002584615384615385, |
| "loss": 2.9438, |
| "router_z_loss": 0.0722, |
| "step": 840 |
| }, |
| { |
| "balancing_entropy": 1.0766, |
| "balancing_loss": 1.1022, |
| "epoch": 4.33792, |
| "grad_norm": 0.4140625, |
| "learning_rate": 0.0026153846153846153, |
| "loss": 2.959, |
| "router_z_loss": 0.0367, |
| "step": 850 |
| }, |
| { |
| "balancing_entropy": 1.0748, |
| "balancing_loss": 1.0939, |
| "epoch": 4.38912, |
| "grad_norm": 0.369140625, |
| "learning_rate": 0.0026461538461538463, |
| "loss": 2.9531, |
| "router_z_loss": 0.0574, |
| "step": 860 |
| }, |
| { |
| "balancing_entropy": 1.0741, |
| "balancing_loss": 1.0957, |
| "epoch": 4.44032, |
| "grad_norm": 0.30078125, |
| "learning_rate": 0.002676923076923077, |
| "loss": 2.9278, |
| "router_z_loss": 0.067, |
| "step": 870 |
| }, |
| { |
| "balancing_entropy": 1.0788, |
| "balancing_loss": 1.0995, |
| "epoch": 4.49152, |
| "grad_norm": 0.376953125, |
| "learning_rate": 0.0027076923076923077, |
| "loss": 2.9105, |
| "router_z_loss": 0.0408, |
| "step": 880 |
| }, |
| { |
| "balancing_entropy": 1.0742, |
| "balancing_loss": 1.0967, |
| "epoch": 4.54272, |
| "grad_norm": 0.36328125, |
| "learning_rate": 0.0027384615384615386, |
| "loss": 2.9266, |
| "router_z_loss": 0.0403, |
| "step": 890 |
| }, |
| { |
| "balancing_entropy": 1.0653, |
| "balancing_loss": 1.095, |
| "epoch": 4.59392, |
| "grad_norm": 0.2470703125, |
| "learning_rate": 0.0027692307692307695, |
| "loss": 2.9362, |
| "router_z_loss": 0.0709, |
| "step": 900 |
| }, |
| { |
| "balancing_entropy": 1.0863, |
| "balancing_loss": 1.115, |
| "epoch": 4.64512, |
| "grad_norm": 0.29296875, |
| "learning_rate": 0.0028, |
| "loss": 2.9221, |
| "router_z_loss": 0.0481, |
| "step": 910 |
| }, |
| { |
| "balancing_entropy": 1.0608, |
| "balancing_loss": 1.1215, |
| "epoch": 4.69632, |
| "grad_norm": 0.34375, |
| "learning_rate": 0.002830769230769231, |
| "loss": 2.919, |
| "router_z_loss": 0.0382, |
| "step": 920 |
| }, |
| { |
| "balancing_entropy": 1.059, |
| "balancing_loss": 1.0758, |
| "epoch": 4.74752, |
| "grad_norm": 0.251953125, |
| "learning_rate": 0.002861538461538462, |
| "loss": 2.9262, |
| "router_z_loss": 0.1472, |
| "step": 930 |
| }, |
| { |
| "balancing_entropy": 1.0388, |
| "balancing_loss": 1.1026, |
| "epoch": 4.79872, |
| "grad_norm": 0.298828125, |
| "learning_rate": 0.0028923076923076923, |
| "loss": 2.9038, |
| "router_z_loss": 0.1057, |
| "step": 940 |
| }, |
| { |
| "balancing_entropy": 1.0384, |
| "balancing_loss": 1.1249, |
| "epoch": 4.84992, |
| "grad_norm": 0.294921875, |
| "learning_rate": 0.002923076923076923, |
| "loss": 2.9105, |
| "router_z_loss": 0.0981, |
| "step": 950 |
| }, |
| { |
| "balancing_entropy": 1.0729, |
| "balancing_loss": 1.1026, |
| "epoch": 4.90112, |
| "grad_norm": 0.28125, |
| "learning_rate": 0.002953846153846154, |
| "loss": 2.8872, |
| "router_z_loss": 0.1501, |
| "step": 960 |
| }, |
| { |
| "balancing_entropy": 1.0843, |
| "balancing_loss": 1.1123, |
| "epoch": 4.95232, |
| "grad_norm": 0.271484375, |
| "learning_rate": 0.0029846153846153846, |
| "loss": 2.9128, |
| "router_z_loss": 0.0492, |
| "step": 970 |
| }, |
| { |
| "balancing_entropy": 1.0237, |
| "balancing_loss": 1.1246, |
| "epoch": 5.0, |
| "grad_norm": 0.55859375, |
| "learning_rate": 0.003, |
| "loss": 2.8729, |
| "router_z_loss": 0.0501, |
| "step": 980 |
| }, |
| { |
| "balancing_entropy": 1.0714, |
| "balancing_loss": 1.0844, |
| "epoch": 5.0512, |
| "grad_norm": 0.25, |
| "learning_rate": 0.003, |
| "loss": 2.8925, |
| "router_z_loss": 0.1031, |
| "step": 990 |
| }, |
| { |
| "balancing_entropy": 1.0844, |
| "balancing_loss": 1.1099, |
| "epoch": 5.1024, |
| "grad_norm": 0.314453125, |
| "learning_rate": 0.003, |
| "loss": 2.8403, |
| "router_z_loss": 0.079, |
| "step": 1000 |
| }, |
| { |
| "balancing_entropy": 1.0786, |
| "balancing_loss": 1.096, |
| "epoch": 5.1536, |
| "grad_norm": 0.2412109375, |
| "learning_rate": 0.003, |
| "loss": 2.8647, |
| "router_z_loss": 0.0456, |
| "step": 1010 |
| }, |
| { |
| "balancing_entropy": 1.0676, |
| "balancing_loss": 1.108, |
| "epoch": 5.2048, |
| "grad_norm": 0.275390625, |
| "learning_rate": 0.003, |
| "loss": 2.8194, |
| "router_z_loss": 0.0442, |
| "step": 1020 |
| }, |
| { |
| "balancing_entropy": 1.0733, |
| "balancing_loss": 1.1015, |
| "epoch": 5.256, |
| "grad_norm": 0.40625, |
| "learning_rate": 0.003, |
| "loss": 2.8276, |
| "router_z_loss": 0.0402, |
| "step": 1030 |
| }, |
| { |
| "balancing_entropy": 1.0855, |
| "balancing_loss": 1.1128, |
| "epoch": 5.3072, |
| "grad_norm": 0.2421875, |
| "learning_rate": 0.003, |
| "loss": 2.8414, |
| "router_z_loss": 0.0399, |
| "step": 1040 |
| }, |
| { |
| "balancing_entropy": 1.0807, |
| "balancing_loss": 1.104, |
| "epoch": 5.3584, |
| "grad_norm": 0.279296875, |
| "learning_rate": 0.003, |
| "loss": 2.8114, |
| "router_z_loss": 0.0427, |
| "step": 1050 |
| }, |
| { |
| "balancing_entropy": 1.0881, |
| "balancing_loss": 1.1114, |
| "epoch": 5.4096, |
| "grad_norm": 0.291015625, |
| "learning_rate": 0.003, |
| "loss": 2.8032, |
| "router_z_loss": 0.0286, |
| "step": 1060 |
| }, |
| { |
| "balancing_entropy": 1.0567, |
| "balancing_loss": 1.1257, |
| "epoch": 5.4608, |
| "grad_norm": 0.3046875, |
| "learning_rate": 0.003, |
| "loss": 2.796, |
| "router_z_loss": 0.0563, |
| "step": 1070 |
| }, |
| { |
| "balancing_entropy": 1.0871, |
| "balancing_loss": 1.098, |
| "epoch": 5.5120000000000005, |
| "grad_norm": 0.37109375, |
| "learning_rate": 0.003, |
| "loss": 2.7893, |
| "router_z_loss": 0.0573, |
| "step": 1080 |
| }, |
| { |
| "balancing_entropy": 1.0589, |
| "balancing_loss": 1.1092, |
| "epoch": 5.5632, |
| "grad_norm": 0.330078125, |
| "learning_rate": 0.003, |
| "loss": 2.7915, |
| "router_z_loss": 0.0361, |
| "step": 1090 |
| }, |
| { |
| "balancing_entropy": 1.0779, |
| "balancing_loss": 1.121, |
| "epoch": 5.6144, |
| "grad_norm": 0.31640625, |
| "learning_rate": 0.003, |
| "loss": 2.7814, |
| "router_z_loss": 0.0575, |
| "step": 1100 |
| }, |
| { |
| "balancing_entropy": 1.0739, |
| "balancing_loss": 1.1173, |
| "epoch": 5.6655999999999995, |
| "grad_norm": 0.3046875, |
| "learning_rate": 0.003, |
| "loss": 2.7735, |
| "router_z_loss": 0.0452, |
| "step": 1110 |
| }, |
| { |
| "balancing_entropy": 1.0798, |
| "balancing_loss": 1.108, |
| "epoch": 5.7168, |
| "grad_norm": 0.224609375, |
| "learning_rate": 0.003, |
| "loss": 2.7718, |
| "router_z_loss": 0.0369, |
| "step": 1120 |
| }, |
| { |
| "balancing_entropy": 1.0562, |
| "balancing_loss": 1.1132, |
| "epoch": 5.768, |
| "grad_norm": 0.294921875, |
| "learning_rate": 0.003, |
| "loss": 2.7737, |
| "router_z_loss": 0.0553, |
| "step": 1130 |
| }, |
| { |
| "balancing_entropy": 1.049, |
| "balancing_loss": 1.1171, |
| "epoch": 5.8192, |
| "grad_norm": 1.625, |
| "learning_rate": 0.003, |
| "loss": 2.8174, |
| "router_z_loss": 0.154, |
| "step": 1140 |
| }, |
| { |
| "balancing_entropy": 1.0838, |
| "balancing_loss": 1.0896, |
| "epoch": 5.8704, |
| "grad_norm": 0.546875, |
| "learning_rate": 0.003, |
| "loss": 2.8409, |
| "router_z_loss": 0.3276, |
| "step": 1150 |
| }, |
| { |
| "balancing_entropy": 1.0754, |
| "balancing_loss": 1.0922, |
| "epoch": 5.9216, |
| "grad_norm": 0.41796875, |
| "learning_rate": 0.003, |
| "loss": 2.8197, |
| "router_z_loss": 0.2162, |
| "step": 1160 |
| }, |
| { |
| "balancing_entropy": 1.084, |
| "balancing_loss": 1.1066, |
| "epoch": 5.9728, |
| "grad_norm": 0.345703125, |
| "learning_rate": 0.003, |
| "loss": 2.7698, |
| "router_z_loss": 0.0843, |
| "step": 1170 |
| }, |
| { |
| "balancing_entropy": 1.0194, |
| "balancing_loss": 1.1086, |
| "epoch": 6.02048, |
| "grad_norm": 0.3125, |
| "learning_rate": 0.003, |
| "loss": 2.7488, |
| "router_z_loss": 0.0517, |
| "step": 1180 |
| }, |
| { |
| "balancing_entropy": 1.0724, |
| "balancing_loss": 1.1055, |
| "epoch": 6.07168, |
| "grad_norm": 0.296875, |
| "learning_rate": 0.003, |
| "loss": 2.73, |
| "router_z_loss": 0.0522, |
| "step": 1190 |
| }, |
| { |
| "balancing_entropy": 1.0264, |
| "balancing_loss": 1.1178, |
| "epoch": 6.12288, |
| "grad_norm": 0.37890625, |
| "learning_rate": 0.003, |
| "loss": 2.727, |
| "router_z_loss": 0.0499, |
| "step": 1200 |
| }, |
| { |
| "balancing_entropy": 1.0858, |
| "balancing_loss": 1.1043, |
| "epoch": 6.17408, |
| "grad_norm": 0.240234375, |
| "learning_rate": 0.003, |
| "loss": 2.7092, |
| "router_z_loss": 0.0643, |
| "step": 1210 |
| }, |
| { |
| "balancing_entropy": 1.0403, |
| "balancing_loss": 1.127, |
| "epoch": 6.22528, |
| "grad_norm": 0.265625, |
| "learning_rate": 0.003, |
| "loss": 2.706, |
| "router_z_loss": 0.0392, |
| "step": 1220 |
| }, |
| { |
| "balancing_entropy": 1.0836, |
| "balancing_loss": 1.1099, |
| "epoch": 6.27648, |
| "grad_norm": 0.330078125, |
| "learning_rate": 0.003, |
| "loss": 2.7024, |
| "router_z_loss": 0.0519, |
| "step": 1230 |
| }, |
| { |
| "balancing_entropy": 1.0788, |
| "balancing_loss": 1.1085, |
| "epoch": 6.32768, |
| "grad_norm": 0.291015625, |
| "learning_rate": 0.003, |
| "loss": 2.7044, |
| "router_z_loss": 0.0326, |
| "step": 1240 |
| }, |
| { |
| "balancing_entropy": 1.0207, |
| "balancing_loss": 1.1099, |
| "epoch": 6.37888, |
| "grad_norm": 0.384765625, |
| "learning_rate": 0.003, |
| "loss": 2.6874, |
| "router_z_loss": 0.0592, |
| "step": 1250 |
| }, |
| { |
| "balancing_entropy": 1.0006, |
| "balancing_loss": 1.1272, |
| "epoch": 6.43008, |
| "grad_norm": 0.296875, |
| "learning_rate": 0.003, |
| "loss": 2.7091, |
| "router_z_loss": 0.1513, |
| "step": 1260 |
| }, |
| { |
| "balancing_entropy": 1.0775, |
| "balancing_loss": 1.108, |
| "epoch": 6.48128, |
| "grad_norm": 0.28515625, |
| "learning_rate": 0.003, |
| "loss": 2.6821, |
| "router_z_loss": 0.106, |
| "step": 1270 |
| }, |
| { |
| "balancing_entropy": 1.0368, |
| "balancing_loss": 1.1091, |
| "epoch": 6.53248, |
| "grad_norm": 0.38671875, |
| "learning_rate": 0.003, |
| "loss": 2.6736, |
| "router_z_loss": 0.0363, |
| "step": 1280 |
| }, |
| { |
| "balancing_entropy": 0.9919, |
| "balancing_loss": 1.1228, |
| "epoch": 6.58368, |
| "grad_norm": 0.46484375, |
| "learning_rate": 0.003, |
| "loss": 2.6844, |
| "router_z_loss": 0.0494, |
| "step": 1290 |
| }, |
| { |
| "balancing_entropy": 1.0121, |
| "balancing_loss": 1.1238, |
| "epoch": 6.63488, |
| "grad_norm": 0.412109375, |
| "learning_rate": 0.003, |
| "loss": 2.675, |
| "router_z_loss": 0.1156, |
| "step": 1300 |
| }, |
| { |
| "balancing_entropy": 1.0146, |
| "balancing_loss": 1.0942, |
| "epoch": 6.6860800000000005, |
| "grad_norm": 0.330078125, |
| "learning_rate": 0.003, |
| "loss": 2.6669, |
| "router_z_loss": 0.1085, |
| "step": 1310 |
| }, |
| { |
| "balancing_entropy": 1.051, |
| "balancing_loss": 1.1207, |
| "epoch": 6.73728, |
| "grad_norm": 0.2412109375, |
| "learning_rate": 0.003, |
| "loss": 2.6719, |
| "router_z_loss": 0.0844, |
| "step": 1320 |
| }, |
| { |
| "balancing_entropy": 1.0765, |
| "balancing_loss": 1.1175, |
| "epoch": 6.78848, |
| "grad_norm": 0.267578125, |
| "learning_rate": 0.003, |
| "loss": 2.6575, |
| "router_z_loss": 0.0487, |
| "step": 1330 |
| }, |
| { |
| "balancing_entropy": 1.0473, |
| "balancing_loss": 1.1171, |
| "epoch": 6.8396799999999995, |
| "grad_norm": 0.37890625, |
| "learning_rate": 0.003, |
| "loss": 2.6567, |
| "router_z_loss": 0.035, |
| "step": 1340 |
| }, |
| { |
| "balancing_entropy": 1.018, |
| "balancing_loss": 1.1165, |
| "epoch": 6.89088, |
| "grad_norm": 0.30078125, |
| "learning_rate": 0.003, |
| "loss": 2.6607, |
| "router_z_loss": 0.0385, |
| "step": 1350 |
| }, |
| { |
| "balancing_entropy": 1.0763, |
| "balancing_loss": 1.1156, |
| "epoch": 6.94208, |
| "grad_norm": 0.271484375, |
| "learning_rate": 0.003, |
| "loss": 2.6576, |
| "router_z_loss": 0.058, |
| "step": 1360 |
| }, |
| { |
| "balancing_entropy": 1.0217, |
| "balancing_loss": 1.1241, |
| "epoch": 6.99328, |
| "grad_norm": 0.51953125, |
| "learning_rate": 0.003, |
| "loss": 2.6491, |
| "router_z_loss": 0.0383, |
| "step": 1370 |
| }, |
| { |
| "balancing_entropy": 1.0177, |
| "balancing_loss": 1.1123, |
| "epoch": 7.04096, |
| "grad_norm": 0.427734375, |
| "learning_rate": 0.003, |
| "loss": 2.643, |
| "router_z_loss": 0.0347, |
| "step": 1380 |
| }, |
| { |
| "balancing_entropy": 1.0424, |
| "balancing_loss": 1.1078, |
| "epoch": 7.09216, |
| "grad_norm": 0.310546875, |
| "learning_rate": 0.003, |
| "loss": 2.6393, |
| "router_z_loss": 0.0356, |
| "step": 1390 |
| }, |
| { |
| "balancing_entropy": 1.0827, |
| "balancing_loss": 1.1167, |
| "epoch": 7.14336, |
| "grad_norm": 0.396484375, |
| "learning_rate": 0.003, |
| "loss": 2.6262, |
| "router_z_loss": 0.03, |
| "step": 1400 |
| }, |
| { |
| "balancing_entropy": 1.0365, |
| "balancing_loss": 1.1101, |
| "epoch": 7.19456, |
| "grad_norm": 0.37890625, |
| "learning_rate": 0.003, |
| "loss": 2.6217, |
| "router_z_loss": 0.0242, |
| "step": 1410 |
| }, |
| { |
| "balancing_entropy": 1.0052, |
| "balancing_loss": 1.1091, |
| "epoch": 7.24576, |
| "grad_norm": 0.419921875, |
| "learning_rate": 0.003, |
| "loss": 2.6217, |
| "router_z_loss": 0.0437, |
| "step": 1420 |
| }, |
| { |
| "balancing_entropy": 1.0175, |
| "balancing_loss": 1.1232, |
| "epoch": 7.29696, |
| "grad_norm": 0.330078125, |
| "learning_rate": 0.003, |
| "loss": 2.6106, |
| "router_z_loss": 0.0484, |
| "step": 1430 |
| }, |
| { |
| "balancing_entropy": 1.0869, |
| "balancing_loss": 1.1058, |
| "epoch": 7.34816, |
| "grad_norm": 0.240234375, |
| "learning_rate": 0.003, |
| "loss": 2.6125, |
| "router_z_loss": 0.0338, |
| "step": 1440 |
| }, |
| { |
| "balancing_entropy": 1.0047, |
| "balancing_loss": 1.1259, |
| "epoch": 7.39936, |
| "grad_norm": 0.54296875, |
| "learning_rate": 0.003, |
| "loss": 2.621, |
| "router_z_loss": 0.0265, |
| "step": 1450 |
| }, |
| { |
| "balancing_entropy": 1.028, |
| "balancing_loss": 1.1028, |
| "epoch": 7.45056, |
| "grad_norm": 0.302734375, |
| "learning_rate": 0.003, |
| "loss": 2.6191, |
| "router_z_loss": 0.0488, |
| "step": 1460 |
| }, |
| { |
| "balancing_entropy": 1.0321, |
| "balancing_loss": 1.1041, |
| "epoch": 7.50176, |
| "grad_norm": 0.298828125, |
| "learning_rate": 0.003, |
| "loss": 2.606, |
| "router_z_loss": 0.0444, |
| "step": 1470 |
| }, |
| { |
| "balancing_entropy": 1.019, |
| "balancing_loss": 1.1233, |
| "epoch": 7.55296, |
| "grad_norm": 0.2431640625, |
| "learning_rate": 0.003, |
| "loss": 2.6033, |
| "router_z_loss": 0.0494, |
| "step": 1480 |
| }, |
| { |
| "balancing_entropy": 1.0257, |
| "balancing_loss": 1.1108, |
| "epoch": 7.60416, |
| "grad_norm": 0.34765625, |
| "learning_rate": 0.003, |
| "loss": 2.6137, |
| "router_z_loss": 0.0487, |
| "step": 1490 |
| }, |
| { |
| "balancing_entropy": 1.0655, |
| "balancing_loss": 1.1121, |
| "epoch": 7.65536, |
| "grad_norm": 0.333984375, |
| "learning_rate": 0.003, |
| "loss": 2.6068, |
| "router_z_loss": 0.0404, |
| "step": 1500 |
| }, |
| { |
| "balancing_entropy": 1.0208, |
| "balancing_loss": 1.1163, |
| "epoch": 7.70656, |
| "grad_norm": 0.64453125, |
| "learning_rate": 0.003, |
| "loss": 2.5948, |
| "router_z_loss": 0.0314, |
| "step": 1510 |
| }, |
| { |
| "balancing_entropy": 1.0572, |
| "balancing_loss": 1.1362, |
| "epoch": 7.75776, |
| "grad_norm": 0.396484375, |
| "learning_rate": 0.003, |
| "loss": 2.6933, |
| "router_z_loss": 0.0492, |
| "step": 1520 |
| }, |
| { |
| "balancing_entropy": 1.0672, |
| "balancing_loss": 1.1019, |
| "epoch": 7.80896, |
| "grad_norm": 0.28125, |
| "learning_rate": 0.003, |
| "loss": 2.6223, |
| "router_z_loss": 0.084, |
| "step": 1530 |
| }, |
| { |
| "balancing_entropy": 1.0573, |
| "balancing_loss": 1.113, |
| "epoch": 7.8601600000000005, |
| "grad_norm": 0.4296875, |
| "learning_rate": 0.003, |
| "loss": 2.594, |
| "router_z_loss": 0.0642, |
| "step": 1540 |
| }, |
| { |
| "balancing_entropy": 1.0319, |
| "balancing_loss": 1.1006, |
| "epoch": 7.91136, |
| "grad_norm": 0.29296875, |
| "learning_rate": 0.003, |
| "loss": 2.5974, |
| "router_z_loss": 0.0273, |
| "step": 1550 |
| }, |
| { |
| "balancing_entropy": 1.0552, |
| "balancing_loss": 1.1065, |
| "epoch": 7.96256, |
| "grad_norm": 0.466796875, |
| "learning_rate": 0.003, |
| "loss": 2.588, |
| "router_z_loss": 0.0336, |
| "step": 1560 |
| }, |
| { |
| "balancing_entropy": 0.9985, |
| "balancing_loss": 1.1163, |
| "epoch": 8.01024, |
| "grad_norm": 0.255859375, |
| "learning_rate": 0.003, |
| "loss": 2.5919, |
| "router_z_loss": 0.0381, |
| "step": 1570 |
| }, |
| { |
| "balancing_entropy": 1.0203, |
| "balancing_loss": 1.1204, |
| "epoch": 8.06144, |
| "grad_norm": 0.41796875, |
| "learning_rate": 0.003, |
| "loss": 2.5741, |
| "router_z_loss": 0.0349, |
| "step": 1580 |
| }, |
| { |
| "balancing_entropy": 1.0091, |
| "balancing_loss": 1.1065, |
| "epoch": 8.11264, |
| "grad_norm": 0.37890625, |
| "learning_rate": 0.003, |
| "loss": 2.5686, |
| "router_z_loss": 0.0629, |
| "step": 1590 |
| }, |
| { |
| "balancing_entropy": 1.0637, |
| "balancing_loss": 1.1064, |
| "epoch": 8.16384, |
| "grad_norm": 0.4140625, |
| "learning_rate": 0.003, |
| "loss": 2.6053, |
| "router_z_loss": 0.0668, |
| "step": 1600 |
| }, |
| { |
| "balancing_entropy": 1.0708, |
| "balancing_loss": 1.1157, |
| "epoch": 8.21504, |
| "grad_norm": 0.34765625, |
| "learning_rate": 0.003, |
| "loss": 2.6375, |
| "router_z_loss": 0.0948, |
| "step": 1610 |
| }, |
| { |
| "balancing_entropy": 1.0865, |
| "balancing_loss": 1.1038, |
| "epoch": 8.26624, |
| "grad_norm": 0.2470703125, |
| "learning_rate": 0.003, |
| "loss": 2.571, |
| "router_z_loss": 0.0649, |
| "step": 1620 |
| }, |
| { |
| "balancing_entropy": 0.9924, |
| "balancing_loss": 1.1054, |
| "epoch": 8.31744, |
| "grad_norm": 0.38671875, |
| "learning_rate": 0.003, |
| "loss": 2.568, |
| "router_z_loss": 0.0954, |
| "step": 1630 |
| }, |
| { |
| "balancing_entropy": 1.0115, |
| "balancing_loss": 1.1369, |
| "epoch": 8.36864, |
| "grad_norm": 0.294921875, |
| "learning_rate": 0.003, |
| "loss": 2.5658, |
| "router_z_loss": 0.1433, |
| "step": 1640 |
| }, |
| { |
| "balancing_entropy": 1.0557, |
| "balancing_loss": 1.1104, |
| "epoch": 8.41984, |
| "grad_norm": 0.408203125, |
| "learning_rate": 0.003, |
| "loss": 2.555, |
| "router_z_loss": 0.0909, |
| "step": 1650 |
| }, |
| { |
| "balancing_entropy": 1.0746, |
| "balancing_loss": 1.1058, |
| "epoch": 8.47104, |
| "grad_norm": 0.279296875, |
| "learning_rate": 0.003, |
| "loss": 2.5576, |
| "router_z_loss": 0.0468, |
| "step": 1660 |
| }, |
| { |
| "balancing_entropy": 1.0082, |
| "balancing_loss": 1.1245, |
| "epoch": 8.52224, |
| "grad_norm": 0.38671875, |
| "learning_rate": 0.003, |
| "loss": 2.5513, |
| "router_z_loss": 0.0396, |
| "step": 1670 |
| }, |
| { |
| "balancing_entropy": 1.0213, |
| "balancing_loss": 1.1082, |
| "epoch": 8.57344, |
| "grad_norm": 0.357421875, |
| "learning_rate": 0.003, |
| "loss": 2.5526, |
| "router_z_loss": 0.0496, |
| "step": 1680 |
| }, |
| { |
| "balancing_entropy": 1.0084, |
| "balancing_loss": 1.1091, |
| "epoch": 8.62464, |
| "grad_norm": 0.361328125, |
| "learning_rate": 0.003, |
| "loss": 2.5538, |
| "router_z_loss": 0.0603, |
| "step": 1690 |
| }, |
| { |
| "balancing_entropy": 1.0497, |
| "balancing_loss": 1.1201, |
| "epoch": 8.67584, |
| "grad_norm": 0.37890625, |
| "learning_rate": 0.003, |
| "loss": 2.5532, |
| "router_z_loss": 0.0448, |
| "step": 1700 |
| }, |
| { |
| "balancing_entropy": 1.0661, |
| "balancing_loss": 1.1298, |
| "epoch": 8.72704, |
| "grad_norm": 0.33203125, |
| "learning_rate": 0.003, |
| "loss": 2.5535, |
| "router_z_loss": 0.029, |
| "step": 1710 |
| }, |
| { |
| "balancing_entropy": 1.0572, |
| "balancing_loss": 1.1157, |
| "epoch": 8.77824, |
| "grad_norm": 0.400390625, |
| "learning_rate": 0.003, |
| "loss": 2.5401, |
| "router_z_loss": 0.028, |
| "step": 1720 |
| }, |
| { |
| "balancing_entropy": 1.0082, |
| "balancing_loss": 1.1206, |
| "epoch": 8.82944, |
| "grad_norm": 0.5625, |
| "learning_rate": 0.003, |
| "loss": 2.5493, |
| "router_z_loss": 0.0464, |
| "step": 1730 |
| }, |
| { |
| "balancing_entropy": 0.9829, |
| "balancing_loss": 1.1311, |
| "epoch": 8.88064, |
| "grad_norm": 0.55859375, |
| "learning_rate": 0.003, |
| "loss": 2.5463, |
| "router_z_loss": 0.0731, |
| "step": 1740 |
| }, |
| { |
| "balancing_entropy": 0.9818, |
| "balancing_loss": 1.0975, |
| "epoch": 8.93184, |
| "grad_norm": 0.40234375, |
| "learning_rate": 0.003, |
| "loss": 2.5466, |
| "router_z_loss": 0.0922, |
| "step": 1750 |
| }, |
| { |
| "balancing_entropy": 0.9662, |
| "balancing_loss": 1.1181, |
| "epoch": 8.98304, |
| "grad_norm": 0.53515625, |
| "learning_rate": 0.003, |
| "loss": 2.5468, |
| "router_z_loss": 0.1385, |
| "step": 1760 |
| }, |
| { |
| "balancing_entropy": 0.9867, |
| "balancing_loss": 1.1122, |
| "epoch": 9.03072, |
| "grad_norm": 0.328125, |
| "learning_rate": 0.003, |
| "loss": 2.535, |
| "router_z_loss": 0.1179, |
| "step": 1770 |
| }, |
| { |
| "balancing_entropy": 1.0826, |
| "balancing_loss": 1.1173, |
| "epoch": 9.08192, |
| "grad_norm": 0.244140625, |
| "learning_rate": 0.003, |
| "loss": 2.5266, |
| "router_z_loss": 0.0579, |
| "step": 1780 |
| }, |
| { |
| "balancing_entropy": 1.0822, |
| "balancing_loss": 1.1131, |
| "epoch": 9.13312, |
| "grad_norm": 0.419921875, |
| "learning_rate": 0.003, |
| "loss": 2.5131, |
| "router_z_loss": 0.0238, |
| "step": 1790 |
| }, |
| { |
| "balancing_entropy": 1.0277, |
| "balancing_loss": 1.1195, |
| "epoch": 9.18432, |
| "grad_norm": 0.43359375, |
| "learning_rate": 0.003, |
| "loss": 2.5199, |
| "router_z_loss": 0.0258, |
| "step": 1800 |
| }, |
| { |
| "balancing_entropy": 1.0267, |
| "balancing_loss": 1.1139, |
| "epoch": 9.23552, |
| "grad_norm": 0.369140625, |
| "learning_rate": 0.003, |
| "loss": 2.5239, |
| "router_z_loss": 0.0403, |
| "step": 1810 |
| }, |
| { |
| "balancing_entropy": 1.0592, |
| "balancing_loss": 1.1117, |
| "epoch": 9.28672, |
| "grad_norm": 0.2470703125, |
| "learning_rate": 0.003, |
| "loss": 2.5115, |
| "router_z_loss": 0.0464, |
| "step": 1820 |
| }, |
| { |
| "balancing_entropy": 1.0239, |
| "balancing_loss": 1.1188, |
| "epoch": 9.33792, |
| "grad_norm": 0.451171875, |
| "learning_rate": 0.003, |
| "loss": 2.5205, |
| "router_z_loss": 0.0388, |
| "step": 1830 |
| }, |
| { |
| "balancing_entropy": 1.0223, |
| "balancing_loss": 1.1197, |
| "epoch": 9.38912, |
| "grad_norm": 0.263671875, |
| "learning_rate": 0.003, |
| "loss": 2.5123, |
| "router_z_loss": 0.0429, |
| "step": 1840 |
| }, |
| { |
| "balancing_entropy": 1.019, |
| "balancing_loss": 1.1136, |
| "epoch": 9.44032, |
| "grad_norm": 0.443359375, |
| "learning_rate": 0.003, |
| "loss": 2.516, |
| "router_z_loss": 0.0368, |
| "step": 1850 |
| }, |
| { |
| "balancing_entropy": 1.0178, |
| "balancing_loss": 1.1196, |
| "epoch": 9.49152, |
| "grad_norm": 0.35546875, |
| "learning_rate": 0.003, |
| "loss": 2.5151, |
| "router_z_loss": 0.0431, |
| "step": 1860 |
| }, |
| { |
| "balancing_entropy": 1.0814, |
| "balancing_loss": 1.1081, |
| "epoch": 9.54272, |
| "grad_norm": 0.30078125, |
| "learning_rate": 0.003, |
| "loss": 2.5211, |
| "router_z_loss": 0.0501, |
| "step": 1870 |
| }, |
| { |
| "balancing_entropy": 0.9928, |
| "balancing_loss": 1.1233, |
| "epoch": 9.59392, |
| "grad_norm": 0.69140625, |
| "learning_rate": 0.003, |
| "loss": 2.5209, |
| "router_z_loss": 0.0337, |
| "step": 1880 |
| }, |
| { |
| "balancing_entropy": 1.0207, |
| "balancing_loss": 1.1074, |
| "epoch": 9.64512, |
| "grad_norm": 0.3671875, |
| "learning_rate": 0.003, |
| "loss": 2.5146, |
| "router_z_loss": 0.0517, |
| "step": 1890 |
| }, |
| { |
| "balancing_entropy": 1.0687, |
| "balancing_loss": 1.1196, |
| "epoch": 9.69632, |
| "grad_norm": 0.416015625, |
| "learning_rate": 0.003, |
| "loss": 2.5184, |
| "router_z_loss": 0.0367, |
| "step": 1900 |
| }, |
| { |
| "balancing_entropy": 1.0487, |
| "balancing_loss": 1.1062, |
| "epoch": 9.74752, |
| "grad_norm": 0.24609375, |
| "learning_rate": 0.003, |
| "loss": 2.503, |
| "router_z_loss": 0.0273, |
| "step": 1910 |
| }, |
| { |
| "balancing_entropy": 0.9857, |
| "balancing_loss": 1.1337, |
| "epoch": 9.79872, |
| "grad_norm": 0.67578125, |
| "learning_rate": 0.003, |
| "loss": 2.5109, |
| "router_z_loss": 0.0492, |
| "step": 1920 |
| }, |
| { |
| "balancing_entropy": 0.9915, |
| "balancing_loss": 1.1136, |
| "epoch": 9.849920000000001, |
| "grad_norm": 0.70703125, |
| "learning_rate": 0.003, |
| "loss": 2.5021, |
| "router_z_loss": 0.0534, |
| "step": 1930 |
| }, |
| { |
| "balancing_entropy": 1.0633, |
| "balancing_loss": 1.1074, |
| "epoch": 9.90112, |
| "grad_norm": 0.376953125, |
| "learning_rate": 0.003, |
| "loss": 2.4996, |
| "router_z_loss": 0.0403, |
| "step": 1940 |
| }, |
| { |
| "balancing_entropy": 1.0538, |
| "balancing_loss": 1.1198, |
| "epoch": 9.95232, |
| "grad_norm": 0.61328125, |
| "learning_rate": 0.003, |
| "loss": 2.5085, |
| "router_z_loss": 0.0385, |
| "step": 1950 |
| }, |
| { |
| "balancing_entropy": 0.9821, |
| "balancing_loss": 1.1029, |
| "epoch": 10.0, |
| "grad_norm": 0.451171875, |
| "learning_rate": 0.003, |
| "loss": 2.5148, |
| "router_z_loss": 0.0379, |
| "step": 1960 |
| }, |
| { |
| "balancing_entropy": 1.0062, |
| "balancing_loss": 1.1191, |
| "epoch": 10.0512, |
| "grad_norm": 0.41015625, |
| "learning_rate": 0.003, |
| "loss": 2.4998, |
| "router_z_loss": 0.0559, |
| "step": 1970 |
| }, |
| { |
| "balancing_entropy": 1.0499, |
| "balancing_loss": 1.1164, |
| "epoch": 10.1024, |
| "grad_norm": 0.41015625, |
| "learning_rate": 0.003, |
| "loss": 2.4899, |
| "router_z_loss": 0.0644, |
| "step": 1980 |
| }, |
| { |
| "balancing_entropy": 1.0214, |
| "balancing_loss": 1.1198, |
| "epoch": 10.1536, |
| "grad_norm": 0.376953125, |
| "learning_rate": 0.003, |
| "loss": 2.4876, |
| "router_z_loss": 0.0488, |
| "step": 1990 |
| }, |
| { |
| "balancing_entropy": 1.0141, |
| "balancing_loss": 1.1119, |
| "epoch": 10.2048, |
| "grad_norm": 0.376953125, |
| "learning_rate": 0.003, |
| "loss": 2.4804, |
| "router_z_loss": 0.0389, |
| "step": 2000 |
| }, |
| { |
| "balancing_entropy": 1.0504, |
| "balancing_loss": 1.1147, |
| "epoch": 10.256, |
| "grad_norm": 0.369140625, |
| "learning_rate": 0.003, |
| "loss": 2.4727, |
| "router_z_loss": 0.0339, |
| "step": 2010 |
| }, |
| { |
| "balancing_entropy": 1.0434, |
| "balancing_loss": 1.1201, |
| "epoch": 10.3072, |
| "grad_norm": 0.259765625, |
| "learning_rate": 0.003, |
| "loss": 2.4821, |
| "router_z_loss": 0.0339, |
| "step": 2020 |
| }, |
| { |
| "balancing_entropy": 1.0804, |
| "balancing_loss": 1.1231, |
| "epoch": 10.3584, |
| "grad_norm": 0.482421875, |
| "learning_rate": 0.003, |
| "loss": 2.4744, |
| "router_z_loss": 0.0293, |
| "step": 2030 |
| }, |
| { |
| "balancing_entropy": 1.0201, |
| "balancing_loss": 1.1236, |
| "epoch": 10.4096, |
| "grad_norm": 0.462890625, |
| "learning_rate": 0.003, |
| "loss": 2.4822, |
| "router_z_loss": 0.0252, |
| "step": 2040 |
| }, |
| { |
| "balancing_entropy": 1.0087, |
| "balancing_loss": 1.1096, |
| "epoch": 10.4608, |
| "grad_norm": 0.60546875, |
| "learning_rate": 0.003, |
| "loss": 2.4801, |
| "router_z_loss": 0.0467, |
| "step": 2050 |
| }, |
| { |
| "balancing_entropy": 1.0379, |
| "balancing_loss": 1.1063, |
| "epoch": 10.512, |
| "grad_norm": 0.271484375, |
| "learning_rate": 0.003, |
| "loss": 2.4788, |
| "router_z_loss": 0.0539, |
| "step": 2060 |
| }, |
| { |
| "balancing_entropy": 1.0472, |
| "balancing_loss": 1.1284, |
| "epoch": 10.5632, |
| "grad_norm": 0.58203125, |
| "learning_rate": 0.003, |
| "loss": 2.4724, |
| "router_z_loss": 0.0393, |
| "step": 2070 |
| }, |
| { |
| "balancing_entropy": 1.0403, |
| "balancing_loss": 1.1089, |
| "epoch": 10.6144, |
| "grad_norm": 0.388671875, |
| "learning_rate": 0.003, |
| "loss": 2.4766, |
| "router_z_loss": 0.037, |
| "step": 2080 |
| }, |
| { |
| "balancing_entropy": 1.0502, |
| "balancing_loss": 1.1247, |
| "epoch": 10.6656, |
| "grad_norm": 0.30078125, |
| "learning_rate": 0.003, |
| "loss": 2.4805, |
| "router_z_loss": 0.0467, |
| "step": 2090 |
| }, |
| { |
| "balancing_entropy": 1.0292, |
| "balancing_loss": 1.1186, |
| "epoch": 10.7168, |
| "grad_norm": 0.28515625, |
| "learning_rate": 0.003, |
| "loss": 2.4705, |
| "router_z_loss": 0.0413, |
| "step": 2100 |
| }, |
| { |
| "balancing_entropy": 1.0256, |
| "balancing_loss": 1.1288, |
| "epoch": 10.768, |
| "grad_norm": 0.451171875, |
| "learning_rate": 0.003, |
| "loss": 2.4778, |
| "router_z_loss": 0.0372, |
| "step": 2110 |
| }, |
| { |
| "balancing_entropy": 0.9658, |
| "balancing_loss": 1.1134, |
| "epoch": 10.8192, |
| "grad_norm": 0.61328125, |
| "learning_rate": 0.003, |
| "loss": 2.4722, |
| "router_z_loss": 0.0691, |
| "step": 2120 |
| }, |
| { |
| "balancing_entropy": 1.0158, |
| "balancing_loss": 1.1165, |
| "epoch": 10.8704, |
| "grad_norm": 0.353515625, |
| "learning_rate": 0.003, |
| "loss": 2.4797, |
| "router_z_loss": 0.1036, |
| "step": 2130 |
| }, |
| { |
| "balancing_entropy": 1.0527, |
| "balancing_loss": 1.1179, |
| "epoch": 10.9216, |
| "grad_norm": 0.298828125, |
| "learning_rate": 0.003, |
| "loss": 2.4655, |
| "router_z_loss": 0.063, |
| "step": 2140 |
| }, |
| { |
| "balancing_entropy": 0.9936, |
| "balancing_loss": 1.1211, |
| "epoch": 10.9728, |
| "grad_norm": 0.466796875, |
| "learning_rate": 0.003, |
| "loss": 2.472, |
| "router_z_loss": 0.0412, |
| "step": 2150 |
| }, |
| { |
| "balancing_entropy": 1.0006, |
| "balancing_loss": 1.1217, |
| "epoch": 11.02048, |
| "grad_norm": 0.28515625, |
| "learning_rate": 0.003, |
| "loss": 2.4673, |
| "router_z_loss": 0.0796, |
| "step": 2160 |
| }, |
| { |
| "balancing_entropy": 1.0244, |
| "balancing_loss": 1.1241, |
| "epoch": 11.07168, |
| "grad_norm": 0.62109375, |
| "learning_rate": 0.003, |
| "loss": 2.451, |
| "router_z_loss": 0.0559, |
| "step": 2170 |
| }, |
| { |
| "balancing_entropy": 1.0295, |
| "balancing_loss": 1.1085, |
| "epoch": 11.12288, |
| "grad_norm": 0.251953125, |
| "learning_rate": 0.003, |
| "loss": 2.4513, |
| "router_z_loss": 0.037, |
| "step": 2180 |
| }, |
| { |
| "balancing_entropy": 1.0277, |
| "balancing_loss": 1.1275, |
| "epoch": 11.17408, |
| "grad_norm": 0.474609375, |
| "learning_rate": 0.003, |
| "loss": 2.4505, |
| "router_z_loss": 0.0443, |
| "step": 2190 |
| }, |
| { |
| "balancing_entropy": 1.0403, |
| "balancing_loss": 1.1076, |
| "epoch": 11.22528, |
| "grad_norm": 0.41796875, |
| "learning_rate": 0.003, |
| "loss": 2.4475, |
| "router_z_loss": 0.0465, |
| "step": 2200 |
| }, |
| { |
| "balancing_entropy": 1.0119, |
| "balancing_loss": 1.136, |
| "epoch": 11.27648, |
| "grad_norm": 0.48046875, |
| "learning_rate": 0.003, |
| "loss": 2.4474, |
| "router_z_loss": 0.045, |
| "step": 2210 |
| }, |
| { |
| "balancing_entropy": 1.0212, |
| "balancing_loss": 1.1097, |
| "epoch": 11.32768, |
| "grad_norm": 0.341796875, |
| "learning_rate": 0.003, |
| "loss": 2.4514, |
| "router_z_loss": 0.0385, |
| "step": 2220 |
| }, |
| { |
| "balancing_entropy": 1.0304, |
| "balancing_loss": 1.1152, |
| "epoch": 11.37888, |
| "grad_norm": 0.439453125, |
| "learning_rate": 0.003, |
| "loss": 2.4514, |
| "router_z_loss": 0.0473, |
| "step": 2230 |
| }, |
| { |
| "balancing_entropy": 0.9808, |
| "balancing_loss": 1.1144, |
| "epoch": 11.43008, |
| "grad_norm": 0.40625, |
| "learning_rate": 0.003, |
| "loss": 2.4499, |
| "router_z_loss": 0.0555, |
| "step": 2240 |
| }, |
| { |
| "balancing_entropy": 0.9706, |
| "balancing_loss": 1.1172, |
| "epoch": 11.48128, |
| "grad_norm": 0.48828125, |
| "learning_rate": 0.003, |
| "loss": 2.4532, |
| "router_z_loss": 0.091, |
| "step": 2250 |
| }, |
| { |
| "balancing_entropy": 1.0049, |
| "balancing_loss": 1.1161, |
| "epoch": 11.53248, |
| "grad_norm": 0.6328125, |
| "learning_rate": 0.003, |
| "loss": 2.4548, |
| "router_z_loss": 0.0768, |
| "step": 2260 |
| }, |
| { |
| "balancing_entropy": 0.9899, |
| "balancing_loss": 1.1088, |
| "epoch": 11.58368, |
| "grad_norm": 0.447265625, |
| "learning_rate": 0.003, |
| "loss": 2.4523, |
| "router_z_loss": 0.0716, |
| "step": 2270 |
| }, |
| { |
| "balancing_entropy": 1.0056, |
| "balancing_loss": 1.1271, |
| "epoch": 11.63488, |
| "grad_norm": 0.65234375, |
| "learning_rate": 0.003, |
| "loss": 2.4482, |
| "router_z_loss": 0.0687, |
| "step": 2280 |
| }, |
| { |
| "balancing_entropy": 1.0395, |
| "balancing_loss": 1.0932, |
| "epoch": 11.68608, |
| "grad_norm": 0.275390625, |
| "learning_rate": 0.003, |
| "loss": 2.4506, |
| "router_z_loss": 0.0497, |
| "step": 2290 |
| }, |
| { |
| "balancing_entropy": 1.0304, |
| "balancing_loss": 1.1269, |
| "epoch": 11.73728, |
| "grad_norm": 0.38671875, |
| "learning_rate": 0.003, |
| "loss": 2.4434, |
| "router_z_loss": 0.0444, |
| "step": 2300 |
| }, |
| { |
| "balancing_entropy": 1.0463, |
| "balancing_loss": 1.1166, |
| "epoch": 11.78848, |
| "grad_norm": 0.27734375, |
| "learning_rate": 0.003, |
| "loss": 2.4431, |
| "router_z_loss": 0.0363, |
| "step": 2310 |
| }, |
| { |
| "balancing_entropy": 1.0447, |
| "balancing_loss": 1.1075, |
| "epoch": 11.83968, |
| "grad_norm": 0.25390625, |
| "learning_rate": 0.003, |
| "loss": 2.4445, |
| "router_z_loss": 0.0276, |
| "step": 2320 |
| }, |
| { |
| "balancing_entropy": 1.0158, |
| "balancing_loss": 1.1308, |
| "epoch": 11.89088, |
| "grad_norm": 0.6875, |
| "learning_rate": 0.003, |
| "loss": 2.4363, |
| "router_z_loss": 0.0328, |
| "step": 2330 |
| }, |
| { |
| "balancing_entropy": 1.015, |
| "balancing_loss": 1.1161, |
| "epoch": 11.94208, |
| "grad_norm": 0.3203125, |
| "learning_rate": 0.003, |
| "loss": 2.4422, |
| "router_z_loss": 0.036, |
| "step": 2340 |
| }, |
| { |
| "balancing_entropy": 1.0664, |
| "balancing_loss": 1.1223, |
| "epoch": 11.99328, |
| "grad_norm": 0.259765625, |
| "learning_rate": 0.003, |
| "loss": 2.4426, |
| "router_z_loss": 0.0341, |
| "step": 2350 |
| }, |
| { |
| "balancing_entropy": 0.944, |
| "balancing_loss": 1.1002, |
| "epoch": 12.04096, |
| "grad_norm": 0.30859375, |
| "learning_rate": 0.003, |
| "loss": 2.4367, |
| "router_z_loss": 0.0372, |
| "step": 2360 |
| }, |
| { |
| "balancing_entropy": 1.0224, |
| "balancing_loss": 1.1204, |
| "epoch": 12.09216, |
| "grad_norm": 0.341796875, |
| "learning_rate": 0.003, |
| "loss": 2.4344, |
| "router_z_loss": 0.0938, |
| "step": 2370 |
| }, |
| { |
| "balancing_entropy": 1.0214, |
| "balancing_loss": 1.1327, |
| "epoch": 12.14336, |
| "grad_norm": 0.515625, |
| "learning_rate": 0.003, |
| "loss": 2.4187, |
| "router_z_loss": 0.0592, |
| "step": 2380 |
| }, |
| { |
| "balancing_entropy": 1.0196, |
| "balancing_loss": 1.1121, |
| "epoch": 12.19456, |
| "grad_norm": 0.59765625, |
| "learning_rate": 0.003, |
| "loss": 2.4272, |
| "router_z_loss": 0.0354, |
| "step": 2390 |
| }, |
| { |
| "balancing_entropy": 1.0091, |
| "balancing_loss": 1.1254, |
| "epoch": 12.24576, |
| "grad_norm": 0.470703125, |
| "learning_rate": 0.003, |
| "loss": 2.4314, |
| "router_z_loss": 0.0379, |
| "step": 2400 |
| }, |
| { |
| "balancing_entropy": 0.992, |
| "balancing_loss": 1.1081, |
| "epoch": 12.29696, |
| "grad_norm": 0.5703125, |
| "learning_rate": 0.003, |
| "loss": 2.4272, |
| "router_z_loss": 0.0551, |
| "step": 2410 |
| }, |
| { |
| "balancing_entropy": 0.9963, |
| "balancing_loss": 1.1102, |
| "epoch": 12.34816, |
| "grad_norm": 0.451171875, |
| "learning_rate": 0.003, |
| "loss": 2.4226, |
| "router_z_loss": 0.08, |
| "step": 2420 |
| }, |
| { |
| "balancing_entropy": 0.99, |
| "balancing_loss": 1.143, |
| "epoch": 12.39936, |
| "grad_norm": 0.357421875, |
| "learning_rate": 0.003, |
| "loss": 2.4212, |
| "router_z_loss": 0.0813, |
| "step": 2430 |
| }, |
| { |
| "balancing_entropy": 1.0642, |
| "balancing_loss": 1.1199, |
| "epoch": 12.45056, |
| "grad_norm": 0.359375, |
| "learning_rate": 0.003, |
| "loss": 2.4275, |
| "router_z_loss": 0.0756, |
| "step": 2440 |
| }, |
| { |
| "balancing_entropy": 1.0786, |
| "balancing_loss": 1.1085, |
| "epoch": 12.50176, |
| "grad_norm": 0.3046875, |
| "learning_rate": 0.003, |
| "loss": 2.4182, |
| "router_z_loss": 0.0467, |
| "step": 2450 |
| }, |
| { |
| "balancing_entropy": 1.0734, |
| "balancing_loss": 1.1245, |
| "epoch": 12.55296, |
| "grad_norm": 0.291015625, |
| "learning_rate": 0.003, |
| "loss": 2.4249, |
| "router_z_loss": 0.03, |
| "step": 2460 |
| }, |
| { |
| "balancing_entropy": 1.0276, |
| "balancing_loss": 1.1172, |
| "epoch": 12.60416, |
| "grad_norm": 0.41015625, |
| "learning_rate": 0.003, |
| "loss": 2.425, |
| "router_z_loss": 0.0253, |
| "step": 2470 |
| }, |
| { |
| "balancing_entropy": 1.003, |
| "balancing_loss": 1.1415, |
| "epoch": 12.65536, |
| "grad_norm": 0.67578125, |
| "learning_rate": 0.003, |
| "loss": 2.4115, |
| "router_z_loss": 0.0395, |
| "step": 2480 |
| }, |
| { |
| "balancing_entropy": 0.9809, |
| "balancing_loss": 1.1129, |
| "epoch": 12.70656, |
| "grad_norm": 0.6640625, |
| "learning_rate": 0.003, |
| "loss": 2.4177, |
| "router_z_loss": 0.0565, |
| "step": 2490 |
| }, |
| { |
| "balancing_entropy": 0.9666, |
| "balancing_loss": 1.1129, |
| "epoch": 12.75776, |
| "grad_norm": 0.458984375, |
| "learning_rate": 0.003, |
| "loss": 2.4214, |
| "router_z_loss": 0.0859, |
| "step": 2500 |
| }, |
| { |
| "balancing_entropy": 0.9593, |
| "balancing_loss": 1.1282, |
| "epoch": 12.80896, |
| "grad_norm": 0.416015625, |
| "learning_rate": 0.003, |
| "loss": 2.4237, |
| "router_z_loss": 0.0815, |
| "step": 2510 |
| }, |
| { |
| "balancing_entropy": 1.0344, |
| "balancing_loss": 1.1142, |
| "epoch": 12.86016, |
| "grad_norm": 0.45703125, |
| "learning_rate": 0.003, |
| "loss": 2.4229, |
| "router_z_loss": 0.0826, |
| "step": 2520 |
| }, |
| { |
| "balancing_entropy": 1.0866, |
| "balancing_loss": 1.118, |
| "epoch": 12.91136, |
| "grad_norm": 0.296875, |
| "learning_rate": 0.003, |
| "loss": 2.4288, |
| "router_z_loss": 0.0598, |
| "step": 2530 |
| }, |
| { |
| "balancing_entropy": 0.9846, |
| "balancing_loss": 1.13, |
| "epoch": 12.96256, |
| "grad_norm": 0.6953125, |
| "learning_rate": 0.003, |
| "loss": 2.4165, |
| "router_z_loss": 0.0325, |
| "step": 2540 |
| }, |
| { |
| "balancing_entropy": 0.9752, |
| "balancing_loss": 1.1213, |
| "epoch": 13.01024, |
| "grad_norm": 0.455078125, |
| "learning_rate": 0.003, |
| "loss": 2.4166, |
| "router_z_loss": 0.0626, |
| "step": 2550 |
| }, |
| { |
| "balancing_entropy": 0.9882, |
| "balancing_loss": 1.1267, |
| "epoch": 13.06144, |
| "grad_norm": 0.42578125, |
| "learning_rate": 0.003, |
| "loss": 2.4076, |
| "router_z_loss": 0.082, |
| "step": 2560 |
| }, |
| { |
| "balancing_entropy": 1.0058, |
| "balancing_loss": 1.1276, |
| "epoch": 13.11264, |
| "grad_norm": 0.337890625, |
| "learning_rate": 0.003, |
| "loss": 2.4044, |
| "router_z_loss": 0.0598, |
| "step": 2570 |
| }, |
| { |
| "balancing_entropy": 1.0118, |
| "balancing_loss": 1.1163, |
| "epoch": 13.16384, |
| "grad_norm": 0.341796875, |
| "learning_rate": 0.003, |
| "loss": 2.404, |
| "router_z_loss": 0.0412, |
| "step": 2580 |
| }, |
| { |
| "balancing_entropy": 1.0178, |
| "balancing_loss": 1.1228, |
| "epoch": 13.21504, |
| "grad_norm": 0.328125, |
| "learning_rate": 0.003, |
| "loss": 2.3999, |
| "router_z_loss": 0.0427, |
| "step": 2590 |
| }, |
| { |
| "balancing_entropy": 1.05, |
| "balancing_loss": 1.1239, |
| "epoch": 13.26624, |
| "grad_norm": 0.47265625, |
| "learning_rate": 0.003, |
| "loss": 2.3926, |
| "router_z_loss": 0.0324, |
| "step": 2600 |
| }, |
| { |
| "balancing_entropy": 1.011, |
| "balancing_loss": 1.118, |
| "epoch": 13.31744, |
| "grad_norm": 0.40234375, |
| "learning_rate": 0.003, |
| "loss": 2.4006, |
| "router_z_loss": 0.0336, |
| "step": 2610 |
| }, |
| { |
| "balancing_entropy": 1.0196, |
| "balancing_loss": 1.1216, |
| "epoch": 13.36864, |
| "grad_norm": 0.40625, |
| "learning_rate": 0.003, |
| "loss": 2.3974, |
| "router_z_loss": 0.0571, |
| "step": 2620 |
| }, |
| { |
| "balancing_entropy": 1.0709, |
| "balancing_loss": 1.1224, |
| "epoch": 13.41984, |
| "grad_norm": 0.265625, |
| "learning_rate": 0.003, |
| "loss": 2.4011, |
| "router_z_loss": 0.042, |
| "step": 2630 |
| }, |
| { |
| "balancing_entropy": 1.0066, |
| "balancing_loss": 1.1253, |
| "epoch": 13.47104, |
| "grad_norm": 0.734375, |
| "learning_rate": 0.003, |
| "loss": 2.4045, |
| "router_z_loss": 0.0282, |
| "step": 2640 |
| }, |
| { |
| "balancing_entropy": 0.9824, |
| "balancing_loss": 1.1105, |
| "epoch": 13.52224, |
| "grad_norm": 0.71875, |
| "learning_rate": 0.003, |
| "loss": 2.4038, |
| "router_z_loss": 0.051, |
| "step": 2650 |
| }, |
| { |
| "balancing_entropy": 0.9804, |
| "balancing_loss": 1.1256, |
| "epoch": 13.57344, |
| "grad_norm": 0.35546875, |
| "learning_rate": 0.003, |
| "loss": 2.4069, |
| "router_z_loss": 0.0928, |
| "step": 2660 |
| }, |
| { |
| "balancing_entropy": 1.0275, |
| "balancing_loss": 1.1105, |
| "epoch": 13.62464, |
| "grad_norm": 0.38671875, |
| "learning_rate": 0.003, |
| "loss": 2.3963, |
| "router_z_loss": 0.0814, |
| "step": 2670 |
| }, |
| { |
| "balancing_entropy": 1.064, |
| "balancing_loss": 1.1226, |
| "epoch": 13.67584, |
| "grad_norm": 0.38671875, |
| "learning_rate": 0.003, |
| "loss": 2.4008, |
| "router_z_loss": 0.0438, |
| "step": 2680 |
| }, |
| { |
| "balancing_entropy": 1.0209, |
| "balancing_loss": 1.1104, |
| "epoch": 13.72704, |
| "grad_norm": 0.259765625, |
| "learning_rate": 0.003, |
| "loss": 2.4065, |
| "router_z_loss": 0.0316, |
| "step": 2690 |
| }, |
| { |
| "balancing_entropy": 1.0391, |
| "balancing_loss": 1.1213, |
| "epoch": 13.77824, |
| "grad_norm": 0.34765625, |
| "learning_rate": 0.003, |
| "loss": 2.3987, |
| "router_z_loss": 0.0457, |
| "step": 2700 |
| }, |
| { |
| "balancing_entropy": 1.0793, |
| "balancing_loss": 1.1361, |
| "epoch": 13.82944, |
| "grad_norm": 0.279296875, |
| "learning_rate": 0.003, |
| "loss": 2.4013, |
| "router_z_loss": 0.0471, |
| "step": 2710 |
| }, |
| { |
| "balancing_entropy": 1.047, |
| "balancing_loss": 1.1196, |
| "epoch": 13.88064, |
| "grad_norm": 0.38671875, |
| "learning_rate": 0.003, |
| "loss": 2.3992, |
| "router_z_loss": 0.0285, |
| "step": 2720 |
| }, |
| { |
| "balancing_entropy": 1.019, |
| "balancing_loss": 1.1264, |
| "epoch": 13.93184, |
| "grad_norm": 0.41015625, |
| "learning_rate": 0.003, |
| "loss": 2.3928, |
| "router_z_loss": 0.0323, |
| "step": 2730 |
| }, |
| { |
| "balancing_entropy": 0.9814, |
| "balancing_loss": 1.1301, |
| "epoch": 13.98304, |
| "grad_norm": 0.72265625, |
| "learning_rate": 0.003, |
| "loss": 2.3967, |
| "router_z_loss": 0.0577, |
| "step": 2740 |
| }, |
| { |
| "balancing_entropy": 0.9678, |
| "balancing_loss": 1.11, |
| "epoch": 14.03072, |
| "grad_norm": 0.47265625, |
| "learning_rate": 0.003, |
| "loss": 2.3944, |
| "router_z_loss": 0.0776, |
| "step": 2750 |
| }, |
| { |
| "balancing_entropy": 0.9596, |
| "balancing_loss": 1.1404, |
| "epoch": 14.08192, |
| "grad_norm": 0.4140625, |
| "learning_rate": 0.003, |
| "loss": 2.3871, |
| "router_z_loss": 0.0686, |
| "step": 2760 |
| }, |
| { |
| "balancing_entropy": 0.9881, |
| "balancing_loss": 1.1024, |
| "epoch": 14.13312, |
| "grad_norm": 0.318359375, |
| "learning_rate": 0.003, |
| "loss": 2.3799, |
| "router_z_loss": 0.0882, |
| "step": 2770 |
| }, |
| { |
| "balancing_entropy": 1.0414, |
| "balancing_loss": 1.1325, |
| "epoch": 14.18432, |
| "grad_norm": 0.2890625, |
| "learning_rate": 0.003, |
| "loss": 2.38, |
| "router_z_loss": 0.0758, |
| "step": 2780 |
| }, |
| { |
| "balancing_entropy": 1.0355, |
| "balancing_loss": 1.1196, |
| "epoch": 14.23552, |
| "grad_norm": 0.2578125, |
| "learning_rate": 0.003, |
| "loss": 2.3779, |
| "router_z_loss": 0.0412, |
| "step": 2790 |
| }, |
| { |
| "balancing_entropy": 0.9692, |
| "balancing_loss": 1.1301, |
| "epoch": 14.28672, |
| "grad_norm": 0.6484375, |
| "learning_rate": 0.003, |
| "loss": 2.3772, |
| "router_z_loss": 0.0479, |
| "step": 2800 |
| }, |
| { |
| "balancing_entropy": 0.998, |
| "balancing_loss": 1.102, |
| "epoch": 14.33792, |
| "grad_norm": 0.412109375, |
| "learning_rate": 0.003, |
| "loss": 2.3862, |
| "router_z_loss": 0.0857, |
| "step": 2810 |
| }, |
| { |
| "balancing_entropy": 0.949, |
| "balancing_loss": 1.1283, |
| "epoch": 14.38912, |
| "grad_norm": 0.490234375, |
| "learning_rate": 0.003, |
| "loss": 2.3829, |
| "router_z_loss": 0.0815, |
| "step": 2820 |
| }, |
| { |
| "balancing_entropy": 0.9766, |
| "balancing_loss": 1.1072, |
| "epoch": 14.44032, |
| "grad_norm": 0.39453125, |
| "learning_rate": 0.003, |
| "loss": 2.3862, |
| "router_z_loss": 0.0777, |
| "step": 2830 |
| }, |
| { |
| "balancing_entropy": 0.9713, |
| "balancing_loss": 1.1353, |
| "epoch": 14.49152, |
| "grad_norm": 0.423828125, |
| "learning_rate": 0.003, |
| "loss": 2.3861, |
| "router_z_loss": 0.1315, |
| "step": 2840 |
| }, |
| { |
| "balancing_entropy": 1.0357, |
| "balancing_loss": 1.1127, |
| "epoch": 14.54272, |
| "grad_norm": 0.384765625, |
| "learning_rate": 0.003, |
| "loss": 2.3811, |
| "router_z_loss": 0.069, |
| "step": 2850 |
| }, |
| { |
| "balancing_entropy": 1.0359, |
| "balancing_loss": 1.126, |
| "epoch": 14.59392, |
| "grad_norm": 0.5546875, |
| "learning_rate": 0.003, |
| "loss": 2.3896, |
| "router_z_loss": 0.0412, |
| "step": 2860 |
| }, |
| { |
| "balancing_entropy": 0.9815, |
| "balancing_loss": 1.1256, |
| "epoch": 14.64512, |
| "grad_norm": 0.6953125, |
| "learning_rate": 0.003, |
| "loss": 2.3858, |
| "router_z_loss": 0.0503, |
| "step": 2870 |
| }, |
| { |
| "balancing_entropy": 0.9612, |
| "balancing_loss": 1.1326, |
| "epoch": 14.69632, |
| "grad_norm": 0.494140625, |
| "learning_rate": 0.003, |
| "loss": 2.3799, |
| "router_z_loss": 0.1111, |
| "step": 2880 |
| }, |
| { |
| "balancing_entropy": 0.9821, |
| "balancing_loss": 1.106, |
| "epoch": 14.74752, |
| "grad_norm": 0.333984375, |
| "learning_rate": 0.003, |
| "loss": 2.387, |
| "router_z_loss": 0.0991, |
| "step": 2890 |
| }, |
| { |
| "balancing_entropy": 1.0261, |
| "balancing_loss": 1.1278, |
| "epoch": 14.79872, |
| "grad_norm": 0.345703125, |
| "learning_rate": 0.003, |
| "loss": 2.3844, |
| "router_z_loss": 0.0964, |
| "step": 2900 |
| }, |
| { |
| "balancing_entropy": 1.0827, |
| "balancing_loss": 1.1216, |
| "epoch": 14.849920000000001, |
| "grad_norm": 0.263671875, |
| "learning_rate": 0.003, |
| "loss": 2.3813, |
| "router_z_loss": 0.0442, |
| "step": 2910 |
| }, |
| { |
| "balancing_entropy": 1.0436, |
| "balancing_loss": 1.1264, |
| "epoch": 14.90112, |
| "grad_norm": 0.45703125, |
| "learning_rate": 0.003, |
| "loss": 2.3793, |
| "router_z_loss": 0.0359, |
| "step": 2920 |
| }, |
| { |
| "balancing_entropy": 1.0291, |
| "balancing_loss": 1.1204, |
| "epoch": 14.95232, |
| "grad_norm": 0.33203125, |
| "learning_rate": 0.003, |
| "loss": 2.387, |
| "router_z_loss": 0.0347, |
| "step": 2930 |
| }, |
| { |
| "balancing_entropy": 1.039, |
| "balancing_loss": 1.1301, |
| "epoch": 15.0, |
| "grad_norm": 0.4296875, |
| "learning_rate": 0.003, |
| "loss": 2.3943, |
| "router_z_loss": 0.0519, |
| "step": 2940 |
| }, |
| { |
| "balancing_entropy": 1.0275, |
| "balancing_loss": 1.1044, |
| "epoch": 15.0512, |
| "grad_norm": 0.341796875, |
| "learning_rate": 0.003, |
| "loss": 2.3809, |
| "router_z_loss": 0.0406, |
| "step": 2950 |
| }, |
| { |
| "balancing_entropy": 1.0025, |
| "balancing_loss": 1.124, |
| "epoch": 15.1024, |
| "grad_norm": 0.4609375, |
| "learning_rate": 0.003, |
| "loss": 2.3748, |
| "router_z_loss": 0.0633, |
| "step": 2960 |
| }, |
| { |
| "balancing_entropy": 1.021, |
| "balancing_loss": 1.1146, |
| "epoch": 15.1536, |
| "grad_norm": 0.498046875, |
| "learning_rate": 0.003, |
| "loss": 2.3658, |
| "router_z_loss": 0.0651, |
| "step": 2970 |
| }, |
| { |
| "balancing_entropy": 0.979, |
| "balancing_loss": 1.1244, |
| "epoch": 15.2048, |
| "grad_norm": 0.439453125, |
| "learning_rate": 0.003, |
| "loss": 2.3574, |
| "router_z_loss": 0.0579, |
| "step": 2980 |
| }, |
| { |
| "balancing_entropy": 1.0096, |
| "balancing_loss": 1.1257, |
| "epoch": 15.256, |
| "grad_norm": 0.2734375, |
| "learning_rate": 0.003, |
| "loss": 2.3704, |
| "router_z_loss": 0.0645, |
| "step": 2990 |
| }, |
| { |
| "balancing_entropy": 1.0429, |
| "balancing_loss": 1.1309, |
| "epoch": 15.3072, |
| "grad_norm": 0.41015625, |
| "learning_rate": 0.003, |
| "loss": 2.3594, |
| "router_z_loss": 0.0378, |
| "step": 3000 |
| }, |
| { |
| "balancing_entropy": 1.0138, |
| "balancing_loss": 1.1322, |
| "epoch": 15.3584, |
| "grad_norm": 0.4453125, |
| "learning_rate": 0.003, |
| "loss": 2.3669, |
| "router_z_loss": 0.0305, |
| "step": 3010 |
| }, |
| { |
| "balancing_entropy": 1.0301, |
| "balancing_loss": 1.1319, |
| "epoch": 15.4096, |
| "grad_norm": 0.28515625, |
| "learning_rate": 0.003, |
| "loss": 2.3596, |
| "router_z_loss": 0.0437, |
| "step": 3020 |
| }, |
| { |
| "balancing_entropy": 1.0507, |
| "balancing_loss": 1.1013, |
| "epoch": 15.4608, |
| "grad_norm": 0.43359375, |
| "learning_rate": 0.003, |
| "loss": 2.3651, |
| "router_z_loss": 0.0399, |
| "step": 3030 |
| }, |
| { |
| "balancing_entropy": 0.9875, |
| "balancing_loss": 1.1303, |
| "epoch": 15.512, |
| "grad_norm": 0.36328125, |
| "learning_rate": 0.003, |
| "loss": 2.3655, |
| "router_z_loss": 0.0457, |
| "step": 3040 |
| }, |
| { |
| "balancing_entropy": 1.0375, |
| "balancing_loss": 1.1243, |
| "epoch": 15.5632, |
| "grad_norm": 0.466796875, |
| "learning_rate": 0.003, |
| "loss": 2.3694, |
| "router_z_loss": 0.0559, |
| "step": 3050 |
| }, |
| { |
| "balancing_entropy": 0.9945, |
| "balancing_loss": 1.1211, |
| "epoch": 15.6144, |
| "grad_norm": 0.4375, |
| "learning_rate": 0.003, |
| "loss": 2.3678, |
| "router_z_loss": 0.05, |
| "step": 3060 |
| }, |
| { |
| "balancing_entropy": 1.0451, |
| "balancing_loss": 1.1335, |
| "epoch": 15.6656, |
| "grad_norm": 0.376953125, |
| "learning_rate": 0.003, |
| "loss": 2.3664, |
| "router_z_loss": 0.0664, |
| "step": 3070 |
| }, |
| { |
| "balancing_entropy": 1.0456, |
| "balancing_loss": 1.1062, |
| "epoch": 15.7168, |
| "grad_norm": 0.29296875, |
| "learning_rate": 0.003, |
| "loss": 2.3696, |
| "router_z_loss": 0.0416, |
| "step": 3080 |
| }, |
| { |
| "balancing_entropy": 0.9843, |
| "balancing_loss": 1.1241, |
| "epoch": 15.768, |
| "grad_norm": 0.404296875, |
| "learning_rate": 0.003, |
| "loss": 2.3568, |
| "router_z_loss": 0.0287, |
| "step": 3090 |
| }, |
| { |
| "balancing_entropy": 1.0232, |
| "balancing_loss": 1.1357, |
| "epoch": 15.8192, |
| "grad_norm": 0.30078125, |
| "learning_rate": 0.003, |
| "loss": 2.361, |
| "router_z_loss": 0.051, |
| "step": 3100 |
| }, |
| { |
| "balancing_entropy": 1.0529, |
| "balancing_loss": 1.1139, |
| "epoch": 15.8704, |
| "grad_norm": 0.4140625, |
| "learning_rate": 0.003, |
| "loss": 2.3668, |
| "router_z_loss": 0.0397, |
| "step": 3110 |
| }, |
| { |
| "balancing_entropy": 0.9659, |
| "balancing_loss": 1.1444, |
| "epoch": 15.9216, |
| "grad_norm": 0.57421875, |
| "learning_rate": 0.003, |
| "loss": 2.3664, |
| "router_z_loss": 0.0447, |
| "step": 3120 |
| }, |
| { |
| "balancing_entropy": 1.0293, |
| "balancing_loss": 1.101, |
| "epoch": 15.9728, |
| "grad_norm": 0.384765625, |
| "learning_rate": 0.003, |
| "loss": 2.3643, |
| "router_z_loss": 0.0909, |
| "step": 3130 |
| }, |
| { |
| "balancing_entropy": 1.0103, |
| "balancing_loss": 1.1374, |
| "epoch": 16.02048, |
| "grad_norm": 0.34765625, |
| "learning_rate": 0.003, |
| "loss": 2.3554, |
| "router_z_loss": 0.0587, |
| "step": 3140 |
| }, |
| { |
| "balancing_entropy": 1.0656, |
| "balancing_loss": 1.1193, |
| "epoch": 16.07168, |
| "grad_norm": 0.353515625, |
| "learning_rate": 0.003, |
| "loss": 2.3467, |
| "router_z_loss": 0.0355, |
| "step": 3150 |
| }, |
| { |
| "balancing_entropy": 1.0487, |
| "balancing_loss": 1.1401, |
| "epoch": 16.12288, |
| "grad_norm": 0.474609375, |
| "learning_rate": 0.003, |
| "loss": 2.3467, |
| "router_z_loss": 0.0391, |
| "step": 3160 |
| }, |
| { |
| "balancing_entropy": 1.0587, |
| "balancing_loss": 1.1202, |
| "epoch": 16.17408, |
| "grad_norm": 0.251953125, |
| "learning_rate": 0.003, |
| "loss": 2.3492, |
| "router_z_loss": 0.0381, |
| "step": 3170 |
| }, |
| { |
| "balancing_entropy": 1.031, |
| "balancing_loss": 1.1273, |
| "epoch": 16.22528, |
| "grad_norm": 0.76953125, |
| "learning_rate": 0.003, |
| "loss": 2.3497, |
| "router_z_loss": 0.0332, |
| "step": 3180 |
| }, |
| { |
| "balancing_entropy": 1.0183, |
| "balancing_loss": 1.1255, |
| "epoch": 16.27648, |
| "grad_norm": 0.337890625, |
| "learning_rate": 0.003, |
| "loss": 2.3481, |
| "router_z_loss": 0.0449, |
| "step": 3190 |
| }, |
| { |
| "balancing_entropy": 1.0169, |
| "balancing_loss": 1.1111, |
| "epoch": 16.32768, |
| "grad_norm": 0.5703125, |
| "learning_rate": 0.003, |
| "loss": 2.3593, |
| "router_z_loss": 0.0457, |
| "step": 3200 |
| }, |
| { |
| "balancing_entropy": 1.0312, |
| "balancing_loss": 1.1087, |
| "epoch": 16.37888, |
| "grad_norm": 0.287109375, |
| "learning_rate": 0.003, |
| "loss": 2.3548, |
| "router_z_loss": 0.0534, |
| "step": 3210 |
| }, |
| { |
| "balancing_entropy": 1.0515, |
| "balancing_loss": 1.1123, |
| "epoch": 16.43008, |
| "grad_norm": 0.318359375, |
| "learning_rate": 0.003, |
| "loss": 2.3556, |
| "router_z_loss": 0.0416, |
| "step": 3220 |
| }, |
| { |
| "balancing_entropy": 1.0469, |
| "balancing_loss": 1.1226, |
| "epoch": 16.48128, |
| "grad_norm": 0.2890625, |
| "learning_rate": 0.003, |
| "loss": 2.3427, |
| "router_z_loss": 0.0486, |
| "step": 3230 |
| }, |
| { |
| "balancing_entropy": 1.0252, |
| "balancing_loss": 1.1283, |
| "epoch": 16.53248, |
| "grad_norm": 0.6953125, |
| "learning_rate": 0.003, |
| "loss": 2.3534, |
| "router_z_loss": 0.0483, |
| "step": 3240 |
| }, |
| { |
| "balancing_entropy": 1.0217, |
| "balancing_loss": 1.114, |
| "epoch": 16.58368, |
| "grad_norm": 0.421875, |
| "learning_rate": 0.003, |
| "loss": 2.356, |
| "router_z_loss": 0.0623, |
| "step": 3250 |
| }, |
| { |
| "balancing_entropy": 1.0573, |
| "balancing_loss": 1.1287, |
| "epoch": 16.63488, |
| "grad_norm": 0.26171875, |
| "learning_rate": 0.003, |
| "loss": 2.3487, |
| "router_z_loss": 0.0699, |
| "step": 3260 |
| }, |
| { |
| "balancing_entropy": 1.0375, |
| "balancing_loss": 1.134, |
| "epoch": 16.68608, |
| "grad_norm": 0.318359375, |
| "learning_rate": 0.003, |
| "loss": 2.3549, |
| "router_z_loss": 0.042, |
| "step": 3270 |
| }, |
| { |
| "balancing_entropy": 1.04, |
| "balancing_loss": 1.1358, |
| "epoch": 16.73728, |
| "grad_norm": 0.8203125, |
| "learning_rate": 0.003, |
| "loss": 2.3604, |
| "router_z_loss": 0.0331, |
| "step": 3280 |
| }, |
| { |
| "balancing_entropy": 0.9718, |
| "balancing_loss": 1.117, |
| "epoch": 16.78848, |
| "grad_norm": 0.83203125, |
| "learning_rate": 0.003, |
| "loss": 2.3529, |
| "router_z_loss": 0.0523, |
| "step": 3290 |
| }, |
| { |
| "balancing_entropy": 1.0086, |
| "balancing_loss": 1.1137, |
| "epoch": 16.83968, |
| "grad_norm": 0.451171875, |
| "learning_rate": 0.003, |
| "loss": 2.352, |
| "router_z_loss": 0.0803, |
| "step": 3300 |
| }, |
| { |
| "balancing_entropy": 1.0514, |
| "balancing_loss": 1.14, |
| "epoch": 16.89088, |
| "grad_norm": 0.283203125, |
| "learning_rate": 0.003, |
| "loss": 2.3564, |
| "router_z_loss": 0.0418, |
| "step": 3310 |
| }, |
| { |
| "balancing_entropy": 1.0892, |
| "balancing_loss": 1.1227, |
| "epoch": 16.94208, |
| "grad_norm": 0.259765625, |
| "learning_rate": 0.003, |
| "loss": 2.3526, |
| "router_z_loss": 0.0308, |
| "step": 3320 |
| }, |
| { |
| "balancing_entropy": 1.0845, |
| "balancing_loss": 1.1338, |
| "epoch": 16.99328, |
| "grad_norm": 0.30078125, |
| "learning_rate": 0.003, |
| "loss": 2.353, |
| "router_z_loss": 0.0393, |
| "step": 3330 |
| }, |
| { |
| "balancing_entropy": 1.0336, |
| "balancing_loss": 1.1332, |
| "epoch": 17.04096, |
| "grad_norm": 0.330078125, |
| "learning_rate": 0.003, |
| "loss": 2.3431, |
| "router_z_loss": 0.0401, |
| "step": 3340 |
| }, |
| { |
| "balancing_entropy": 1.0514, |
| "balancing_loss": 1.1366, |
| "epoch": 17.09216, |
| "grad_norm": 0.28515625, |
| "learning_rate": 0.003, |
| "loss": 2.339, |
| "router_z_loss": 0.0411, |
| "step": 3350 |
| }, |
| { |
| "balancing_entropy": 0.9933, |
| "balancing_loss": 1.1317, |
| "epoch": 17.14336, |
| "grad_norm": 0.55859375, |
| "learning_rate": 0.003, |
| "loss": 2.331, |
| "router_z_loss": 0.0535, |
| "step": 3360 |
| }, |
| { |
| "balancing_entropy": 1.0034, |
| "balancing_loss": 1.1198, |
| "epoch": 17.19456, |
| "grad_norm": 0.326171875, |
| "learning_rate": 0.003, |
| "loss": 2.3471, |
| "router_z_loss": 0.0803, |
| "step": 3370 |
| }, |
| { |
| "balancing_entropy": 1.056, |
| "balancing_loss": 1.1265, |
| "epoch": 17.24576, |
| "grad_norm": 0.47265625, |
| "learning_rate": 0.003, |
| "loss": 2.341, |
| "router_z_loss": 0.0498, |
| "step": 3380 |
| }, |
| { |
| "balancing_entropy": 1.0427, |
| "balancing_loss": 1.1375, |
| "epoch": 17.29696, |
| "grad_norm": 0.4765625, |
| "learning_rate": 0.003, |
| "loss": 2.3335, |
| "router_z_loss": 0.0433, |
| "step": 3390 |
| }, |
| { |
| "balancing_entropy": 1.0325, |
| "balancing_loss": 1.1195, |
| "epoch": 17.34816, |
| "grad_norm": 0.53125, |
| "learning_rate": 0.003, |
| "loss": 2.344, |
| "router_z_loss": 0.0626, |
| "step": 3400 |
| }, |
| { |
| "balancing_entropy": 1.0441, |
| "balancing_loss": 1.1184, |
| "epoch": 17.39936, |
| "grad_norm": 0.33984375, |
| "learning_rate": 0.003, |
| "loss": 2.3477, |
| "router_z_loss": 0.042, |
| "step": 3410 |
| }, |
| { |
| "balancing_entropy": 1.033, |
| "balancing_loss": 1.1332, |
| "epoch": 17.45056, |
| "grad_norm": 0.3203125, |
| "learning_rate": 0.003, |
| "loss": 2.3299, |
| "router_z_loss": 0.0311, |
| "step": 3420 |
| }, |
| { |
| "balancing_entropy": 1.0314, |
| "balancing_loss": 1.1342, |
| "epoch": 17.50176, |
| "grad_norm": 0.63671875, |
| "learning_rate": 0.003, |
| "loss": 2.338, |
| "router_z_loss": 0.0438, |
| "step": 3430 |
| }, |
| { |
| "balancing_entropy": 1.0458, |
| "balancing_loss": 1.1274, |
| "epoch": 17.55296, |
| "grad_norm": 0.431640625, |
| "learning_rate": 0.003, |
| "loss": 2.3454, |
| "router_z_loss": 0.0437, |
| "step": 3440 |
| }, |
| { |
| "balancing_entropy": 1.046, |
| "balancing_loss": 1.1204, |
| "epoch": 17.60416, |
| "grad_norm": 0.5390625, |
| "learning_rate": 0.003, |
| "loss": 2.3413, |
| "router_z_loss": 0.0402, |
| "step": 3450 |
| }, |
| { |
| "balancing_entropy": 1.0101, |
| "balancing_loss": 1.117, |
| "epoch": 17.65536, |
| "grad_norm": 0.4453125, |
| "learning_rate": 0.003, |
| "loss": 2.339, |
| "router_z_loss": 0.0383, |
| "step": 3460 |
| }, |
| { |
| "balancing_entropy": 1.0508, |
| "balancing_loss": 1.1372, |
| "epoch": 17.70656, |
| "grad_norm": 0.36328125, |
| "learning_rate": 0.003, |
| "loss": 2.3426, |
| "router_z_loss": 0.0731, |
| "step": 3470 |
| }, |
| { |
| "balancing_entropy": 1.0491, |
| "balancing_loss": 1.1222, |
| "epoch": 17.75776, |
| "grad_norm": 0.56640625, |
| "learning_rate": 0.003, |
| "loss": 2.3409, |
| "router_z_loss": 0.0513, |
| "step": 3480 |
| }, |
| { |
| "balancing_entropy": 1.0475, |
| "balancing_loss": 1.1388, |
| "epoch": 17.80896, |
| "grad_norm": 0.31640625, |
| "learning_rate": 0.003, |
| "loss": 2.3349, |
| "router_z_loss": 0.0452, |
| "step": 3490 |
| }, |
| { |
| "balancing_entropy": 1.0364, |
| "balancing_loss": 1.1411, |
| "epoch": 17.86016, |
| "grad_norm": 0.65625, |
| "learning_rate": 0.003, |
| "loss": 2.3313, |
| "router_z_loss": 0.0513, |
| "step": 3500 |
| }, |
| { |
| "balancing_entropy": 1.017, |
| "balancing_loss": 1.1236, |
| "epoch": 17.91136, |
| "grad_norm": 0.51953125, |
| "learning_rate": 0.003, |
| "loss": 2.3363, |
| "router_z_loss": 0.05, |
| "step": 3510 |
| }, |
| { |
| "balancing_entropy": 1.0213, |
| "balancing_loss": 1.1387, |
| "epoch": 17.96256, |
| "grad_norm": 0.474609375, |
| "learning_rate": 0.003, |
| "loss": 2.3405, |
| "router_z_loss": 0.0683, |
| "step": 3520 |
| }, |
| { |
| "balancing_entropy": 0.9772, |
| "balancing_loss": 1.13, |
| "epoch": 18.01024, |
| "grad_norm": 0.58984375, |
| "learning_rate": 0.003, |
| "loss": 2.3404, |
| "router_z_loss": 0.0417, |
| "step": 3530 |
| }, |
| { |
| "balancing_entropy": 1.0304, |
| "balancing_loss": 1.1341, |
| "epoch": 18.06144, |
| "grad_norm": 0.56640625, |
| "learning_rate": 0.003, |
| "loss": 2.3337, |
| "router_z_loss": 0.0499, |
| "step": 3540 |
| }, |
| { |
| "balancing_entropy": 1.0296, |
| "balancing_loss": 1.1121, |
| "epoch": 18.11264, |
| "grad_norm": 0.3671875, |
| "learning_rate": 0.003, |
| "loss": 2.3267, |
| "router_z_loss": 0.0403, |
| "step": 3550 |
| }, |
| { |
| "balancing_entropy": 1.066, |
| "balancing_loss": 1.1384, |
| "epoch": 18.16384, |
| "grad_norm": 0.396484375, |
| "learning_rate": 0.003, |
| "loss": 2.3238, |
| "router_z_loss": 0.04, |
| "step": 3560 |
| }, |
| { |
| "balancing_entropy": 1.0454, |
| "balancing_loss": 1.1299, |
| "epoch": 18.21504, |
| "grad_norm": 0.330078125, |
| "learning_rate": 0.003, |
| "loss": 2.3202, |
| "router_z_loss": 0.0293, |
| "step": 3570 |
| }, |
| { |
| "balancing_entropy": 1.0453, |
| "balancing_loss": 1.1245, |
| "epoch": 18.26624, |
| "grad_norm": 0.54296875, |
| "learning_rate": 0.003, |
| "loss": 2.3229, |
| "router_z_loss": 0.037, |
| "step": 3580 |
| }, |
| { |
| "balancing_entropy": 0.9897, |
| "balancing_loss": 1.1545, |
| "epoch": 18.31744, |
| "grad_norm": 0.427734375, |
| "learning_rate": 0.003, |
| "loss": 2.3246, |
| "router_z_loss": 0.0563, |
| "step": 3590 |
| }, |
| { |
| "balancing_entropy": 1.0073, |
| "balancing_loss": 1.1369, |
| "epoch": 18.36864, |
| "grad_norm": 0.66796875, |
| "learning_rate": 0.003, |
| "loss": 2.3236, |
| "router_z_loss": 0.0663, |
| "step": 3600 |
| }, |
| { |
| "balancing_entropy": 1.0421, |
| "balancing_loss": 1.1096, |
| "epoch": 18.41984, |
| "grad_norm": 0.400390625, |
| "learning_rate": 0.003, |
| "loss": 2.3281, |
| "router_z_loss": 0.0518, |
| "step": 3610 |
| }, |
| { |
| "balancing_entropy": 1.0917, |
| "balancing_loss": 1.1235, |
| "epoch": 18.47104, |
| "grad_norm": 0.330078125, |
| "learning_rate": 0.003, |
| "loss": 2.3293, |
| "router_z_loss": 0.0377, |
| "step": 3620 |
| }, |
| { |
| "balancing_entropy": 1.0374, |
| "balancing_loss": 1.1221, |
| "epoch": 18.52224, |
| "grad_norm": 0.48046875, |
| "learning_rate": 0.003, |
| "loss": 2.3308, |
| "router_z_loss": 0.0354, |
| "step": 3630 |
| }, |
| { |
| "balancing_entropy": 1.0252, |
| "balancing_loss": 1.1258, |
| "epoch": 18.57344, |
| "grad_norm": 0.455078125, |
| "learning_rate": 0.003, |
| "loss": 2.327, |
| "router_z_loss": 0.0604, |
| "step": 3640 |
| }, |
| { |
| "balancing_entropy": 1.0403, |
| "balancing_loss": 1.1386, |
| "epoch": 18.62464, |
| "grad_norm": 0.466796875, |
| "learning_rate": 0.003, |
| "loss": 2.3345, |
| "router_z_loss": 0.0517, |
| "step": 3650 |
| }, |
| { |
| "balancing_entropy": 1.0527, |
| "balancing_loss": 1.1294, |
| "epoch": 18.67584, |
| "grad_norm": 0.4375, |
| "learning_rate": 0.003, |
| "loss": 2.3365, |
| "router_z_loss": 0.035, |
| "step": 3660 |
| }, |
| { |
| "balancing_entropy": 1.0151, |
| "balancing_loss": 1.1301, |
| "epoch": 18.72704, |
| "grad_norm": 0.53125, |
| "learning_rate": 0.003, |
| "loss": 2.3304, |
| "router_z_loss": 0.0367, |
| "step": 3670 |
| }, |
| { |
| "balancing_entropy": 1.0685, |
| "balancing_loss": 1.1199, |
| "epoch": 18.77824, |
| "grad_norm": 0.28515625, |
| "learning_rate": 0.003, |
| "loss": 2.3308, |
| "router_z_loss": 0.0512, |
| "step": 3680 |
| }, |
| { |
| "balancing_entropy": 1.0582, |
| "balancing_loss": 1.1277, |
| "epoch": 18.829439999999998, |
| "grad_norm": 0.302734375, |
| "learning_rate": 0.003, |
| "loss": 2.3248, |
| "router_z_loss": 0.0356, |
| "step": 3690 |
| }, |
| { |
| "balancing_entropy": 1.0744, |
| "balancing_loss": 1.1132, |
| "epoch": 18.88064, |
| "grad_norm": 0.2392578125, |
| "learning_rate": 0.003, |
| "loss": 2.3329, |
| "router_z_loss": 0.0338, |
| "step": 3700 |
| }, |
| { |
| "balancing_entropy": 1.0843, |
| "balancing_loss": 1.1303, |
| "epoch": 18.93184, |
| "grad_norm": 0.35546875, |
| "learning_rate": 0.003, |
| "loss": 2.33, |
| "router_z_loss": 0.0418, |
| "step": 3710 |
| }, |
| { |
| "balancing_entropy": 1.0871, |
| "balancing_loss": 1.1295, |
| "epoch": 18.98304, |
| "grad_norm": 0.353515625, |
| "learning_rate": 0.003, |
| "loss": 2.3322, |
| "router_z_loss": 0.0367, |
| "step": 3720 |
| }, |
| { |
| "balancing_entropy": 1.0513, |
| "balancing_loss": 1.123, |
| "epoch": 19.03072, |
| "grad_norm": 0.267578125, |
| "learning_rate": 0.003, |
| "loss": 2.3312, |
| "router_z_loss": 0.0394, |
| "step": 3730 |
| }, |
| { |
| "balancing_entropy": 1.0894, |
| "balancing_loss": 1.1285, |
| "epoch": 19.08192, |
| "grad_norm": 0.283203125, |
| "learning_rate": 0.003, |
| "loss": 2.3185, |
| "router_z_loss": 0.0432, |
| "step": 3740 |
| }, |
| { |
| "balancing_entropy": 1.0925, |
| "balancing_loss": 1.1308, |
| "epoch": 19.13312, |
| "grad_norm": 0.33203125, |
| "learning_rate": 0.003, |
| "loss": 2.3206, |
| "router_z_loss": 0.0477, |
| "step": 3750 |
| }, |
| { |
| "balancing_entropy": 1.0879, |
| "balancing_loss": 1.1238, |
| "epoch": 19.18432, |
| "grad_norm": 0.3125, |
| "learning_rate": 0.003, |
| "loss": 2.3233, |
| "router_z_loss": 0.0395, |
| "step": 3760 |
| }, |
| { |
| "balancing_entropy": 1.0722, |
| "balancing_loss": 1.1328, |
| "epoch": 19.23552, |
| "grad_norm": 0.31640625, |
| "learning_rate": 0.003, |
| "loss": 2.324, |
| "router_z_loss": 0.0377, |
| "step": 3770 |
| }, |
| { |
| "balancing_entropy": 1.0895, |
| "balancing_loss": 1.1288, |
| "epoch": 19.28672, |
| "grad_norm": 0.283203125, |
| "learning_rate": 0.003, |
| "loss": 2.3119, |
| "router_z_loss": 0.0484, |
| "step": 3780 |
| }, |
| { |
| "balancing_entropy": 1.0912, |
| "balancing_loss": 1.1208, |
| "epoch": 19.33792, |
| "grad_norm": 0.28515625, |
| "learning_rate": 0.003, |
| "loss": 2.3251, |
| "router_z_loss": 0.0429, |
| "step": 3790 |
| }, |
| { |
| "balancing_entropy": 1.0661, |
| "balancing_loss": 1.1277, |
| "epoch": 19.38912, |
| "grad_norm": 0.37109375, |
| "learning_rate": 0.003, |
| "loss": 2.3286, |
| "router_z_loss": 0.0364, |
| "step": 3800 |
| }, |
| { |
| "balancing_entropy": 1.0604, |
| "balancing_loss": 1.128, |
| "epoch": 19.44032, |
| "grad_norm": 0.4609375, |
| "learning_rate": 0.003, |
| "loss": 2.3202, |
| "router_z_loss": 0.0522, |
| "step": 3810 |
| }, |
| { |
| "balancing_entropy": 1.0644, |
| "balancing_loss": 1.1246, |
| "epoch": 19.49152, |
| "grad_norm": 0.30078125, |
| "learning_rate": 0.003, |
| "loss": 2.3231, |
| "router_z_loss": 0.0577, |
| "step": 3820 |
| }, |
| { |
| "balancing_entropy": 1.0396, |
| "balancing_loss": 1.1341, |
| "epoch": 19.54272, |
| "grad_norm": 0.478515625, |
| "learning_rate": 0.003, |
| "loss": 2.3307, |
| "router_z_loss": 0.0406, |
| "step": 3830 |
| }, |
| { |
| "balancing_entropy": 1.0122, |
| "balancing_loss": 1.1193, |
| "epoch": 19.59392, |
| "grad_norm": 0.458984375, |
| "learning_rate": 0.003, |
| "loss": 2.3299, |
| "router_z_loss": 0.0519, |
| "step": 3840 |
| }, |
| { |
| "balancing_entropy": 1.0458, |
| "balancing_loss": 1.1171, |
| "epoch": 19.64512, |
| "grad_norm": 0.271484375, |
| "learning_rate": 0.003, |
| "loss": 2.3236, |
| "router_z_loss": 0.0475, |
| "step": 3850 |
| }, |
| { |
| "balancing_entropy": 0.9796, |
| "balancing_loss": 1.1462, |
| "epoch": 19.69632, |
| "grad_norm": 0.6015625, |
| "learning_rate": 0.003, |
| "loss": 2.3271, |
| "router_z_loss": 0.0477, |
| "step": 3860 |
| }, |
| { |
| "balancing_entropy": 1.0068, |
| "balancing_loss": 1.0965, |
| "epoch": 19.74752, |
| "grad_norm": 0.365234375, |
| "learning_rate": 0.003, |
| "loss": 2.3292, |
| "router_z_loss": 0.0887, |
| "step": 3870 |
| }, |
| { |
| "balancing_entropy": 1.0699, |
| "balancing_loss": 1.1434, |
| "epoch": 19.79872, |
| "grad_norm": 0.46875, |
| "learning_rate": 0.003, |
| "loss": 2.3255, |
| "router_z_loss": 0.068, |
| "step": 3880 |
| }, |
| { |
| "balancing_entropy": 1.0937, |
| "balancing_loss": 1.1337, |
| "epoch": 19.84992, |
| "grad_norm": 0.2421875, |
| "learning_rate": 0.003, |
| "loss": 2.3212, |
| "router_z_loss": 0.0444, |
| "step": 3890 |
| }, |
| { |
| "balancing_entropy": 1.0607, |
| "balancing_loss": 1.1281, |
| "epoch": 19.90112, |
| "grad_norm": 0.56640625, |
| "learning_rate": 0.003, |
| "loss": 2.3333, |
| "router_z_loss": 0.032, |
| "step": 3900 |
| }, |
| { |
| "balancing_entropy": 1.0434, |
| "balancing_loss": 1.1199, |
| "epoch": 19.95232, |
| "grad_norm": 0.2890625, |
| "learning_rate": 0.003, |
| "loss": 2.3279, |
| "router_z_loss": 0.0464, |
| "step": 3910 |
| }, |
| { |
| "balancing_entropy": 1.0229, |
| "balancing_loss": 1.132, |
| "epoch": 20.0, |
| "grad_norm": 0.78125, |
| "learning_rate": 0.003, |
| "loss": 2.3329, |
| "router_z_loss": 0.0448, |
| "step": 3920 |
| }, |
| { |
| "balancing_entropy": 1.0142, |
| "balancing_loss": 1.1257, |
| "epoch": 20.0512, |
| "grad_norm": 0.72265625, |
| "learning_rate": 0.003, |
| "loss": 2.3077, |
| "router_z_loss": 0.049, |
| "step": 3930 |
| }, |
| { |
| "balancing_entropy": 1.0025, |
| "balancing_loss": 1.1225, |
| "epoch": 20.1024, |
| "grad_norm": 0.6015625, |
| "learning_rate": 0.003, |
| "loss": 2.3138, |
| "router_z_loss": 0.0816, |
| "step": 3940 |
| }, |
| { |
| "balancing_entropy": 1.0195, |
| "balancing_loss": 1.1433, |
| "epoch": 20.1536, |
| "grad_norm": 0.6640625, |
| "learning_rate": 0.003, |
| "loss": 2.313, |
| "router_z_loss": 0.087, |
| "step": 3950 |
| }, |
| { |
| "balancing_entropy": 1.0725, |
| "balancing_loss": 1.1381, |
| "epoch": 20.2048, |
| "grad_norm": 0.271484375, |
| "learning_rate": 0.003, |
| "loss": 2.3157, |
| "router_z_loss": 0.0779, |
| "step": 3960 |
| }, |
| { |
| "balancing_entropy": 1.0654, |
| "balancing_loss": 1.1203, |
| "epoch": 20.256, |
| "grad_norm": 0.33984375, |
| "learning_rate": 0.003, |
| "loss": 2.3124, |
| "router_z_loss": 0.0429, |
| "step": 3970 |
| }, |
| { |
| "balancing_entropy": 1.0739, |
| "balancing_loss": 1.1384, |
| "epoch": 20.3072, |
| "grad_norm": 0.361328125, |
| "learning_rate": 0.003, |
| "loss": 2.3125, |
| "router_z_loss": 0.05, |
| "step": 3980 |
| }, |
| { |
| "balancing_entropy": 1.0768, |
| "balancing_loss": 1.134, |
| "epoch": 20.3584, |
| "grad_norm": 0.50390625, |
| "learning_rate": 0.003, |
| "loss": 2.313, |
| "router_z_loss": 0.0368, |
| "step": 3990 |
| }, |
| { |
| "balancing_entropy": 1.0431, |
| "balancing_loss": 1.1251, |
| "epoch": 20.4096, |
| "grad_norm": 0.61328125, |
| "learning_rate": 0.003, |
| "loss": 2.3163, |
| "router_z_loss": 0.0372, |
| "step": 4000 |
| }, |
| { |
| "balancing_entropy": 1.0229, |
| "balancing_loss": 1.1299, |
| "epoch": 20.4608, |
| "grad_norm": 0.56640625, |
| "learning_rate": 0.003, |
| "loss": 2.3179, |
| "router_z_loss": 0.0571, |
| "step": 4010 |
| }, |
| { |
| "balancing_entropy": 1.0859, |
| "balancing_loss": 1.1238, |
| "epoch": 20.512, |
| "grad_norm": 0.26953125, |
| "learning_rate": 0.003, |
| "loss": 2.3196, |
| "router_z_loss": 0.0571, |
| "step": 4020 |
| }, |
| { |
| "balancing_entropy": 1.0828, |
| "balancing_loss": 1.1359, |
| "epoch": 20.5632, |
| "grad_norm": 0.29296875, |
| "learning_rate": 0.003, |
| "loss": 2.3168, |
| "router_z_loss": 0.0353, |
| "step": 4030 |
| }, |
| { |
| "balancing_entropy": 1.0532, |
| "balancing_loss": 1.133, |
| "epoch": 20.6144, |
| "grad_norm": 0.416015625, |
| "learning_rate": 0.003, |
| "loss": 2.3206, |
| "router_z_loss": 0.0357, |
| "step": 4040 |
| }, |
| { |
| "balancing_entropy": 1.0563, |
| "balancing_loss": 1.1198, |
| "epoch": 20.6656, |
| "grad_norm": 0.294921875, |
| "learning_rate": 0.003, |
| "loss": 2.3145, |
| "router_z_loss": 0.055, |
| "step": 4050 |
| }, |
| { |
| "balancing_entropy": 1.0531, |
| "balancing_loss": 1.1521, |
| "epoch": 20.7168, |
| "grad_norm": 0.48828125, |
| "learning_rate": 0.003, |
| "loss": 2.3216, |
| "router_z_loss": 0.06, |
| "step": 4060 |
| }, |
| { |
| "balancing_entropy": 1.0252, |
| "balancing_loss": 1.1323, |
| "epoch": 20.768, |
| "grad_norm": 0.314453125, |
| "learning_rate": 0.003, |
| "loss": 2.3264, |
| "router_z_loss": 0.0396, |
| "step": 4070 |
| }, |
| { |
| "balancing_entropy": 1.0652, |
| "balancing_loss": 1.129, |
| "epoch": 20.8192, |
| "grad_norm": 0.298828125, |
| "learning_rate": 0.003, |
| "loss": 2.3155, |
| "router_z_loss": 0.05, |
| "step": 4080 |
| }, |
| { |
| "balancing_entropy": 1.0933, |
| "balancing_loss": 1.134, |
| "epoch": 20.8704, |
| "grad_norm": 0.2578125, |
| "learning_rate": 0.003, |
| "loss": 2.3148, |
| "router_z_loss": 0.036, |
| "step": 4090 |
| }, |
| { |
| "balancing_entropy": 1.0958, |
| "balancing_loss": 1.128, |
| "epoch": 20.9216, |
| "grad_norm": 0.35546875, |
| "learning_rate": 0.003, |
| "loss": 2.3119, |
| "router_z_loss": 0.0301, |
| "step": 4100 |
| }, |
| { |
| "balancing_entropy": 1.0887, |
| "balancing_loss": 1.1354, |
| "epoch": 20.9728, |
| "grad_norm": 0.2197265625, |
| "learning_rate": 0.003, |
| "loss": 2.3083, |
| "router_z_loss": 0.0324, |
| "step": 4110 |
| }, |
| { |
| "balancing_entropy": 1.0297, |
| "balancing_loss": 1.1405, |
| "epoch": 21.02048, |
| "grad_norm": 0.65625, |
| "learning_rate": 0.003, |
| "loss": 2.3102, |
| "router_z_loss": 0.0326, |
| "step": 4120 |
| }, |
| { |
| "balancing_entropy": 1.0745, |
| "balancing_loss": 1.139, |
| "epoch": 21.07168, |
| "grad_norm": 0.4921875, |
| "learning_rate": 0.003, |
| "loss": 2.3082, |
| "router_z_loss": 0.0506, |
| "step": 4130 |
| }, |
| { |
| "balancing_entropy": 1.0805, |
| "balancing_loss": 1.1195, |
| "epoch": 21.12288, |
| "grad_norm": 0.30859375, |
| "learning_rate": 0.003, |
| "loss": 2.2994, |
| "router_z_loss": 0.0352, |
| "step": 4140 |
| }, |
| { |
| "balancing_entropy": 1.0906, |
| "balancing_loss": 1.1368, |
| "epoch": 21.17408, |
| "grad_norm": 0.30078125, |
| "learning_rate": 0.003, |
| "loss": 2.298, |
| "router_z_loss": 0.0352, |
| "step": 4150 |
| }, |
| { |
| "balancing_entropy": 1.0787, |
| "balancing_loss": 1.1367, |
| "epoch": 21.22528, |
| "grad_norm": 0.234375, |
| "learning_rate": 0.003, |
| "loss": 2.2971, |
| "router_z_loss": 0.0368, |
| "step": 4160 |
| }, |
| { |
| "balancing_entropy": 1.0896, |
| "balancing_loss": 1.1229, |
| "epoch": 21.27648, |
| "grad_norm": 0.34375, |
| "learning_rate": 0.003, |
| "loss": 2.2993, |
| "router_z_loss": 0.0319, |
| "step": 4170 |
| }, |
| { |
| "balancing_entropy": 1.0083, |
| "balancing_loss": 1.1473, |
| "epoch": 21.32768, |
| "grad_norm": 0.578125, |
| "learning_rate": 0.003, |
| "loss": 2.3058, |
| "router_z_loss": 0.0505, |
| "step": 4180 |
| }, |
| { |
| "balancing_entropy": 1.0559, |
| "balancing_loss": 1.1424, |
| "epoch": 21.37888, |
| "grad_norm": 0.56640625, |
| "learning_rate": 0.003, |
| "loss": 2.3025, |
| "router_z_loss": 0.0774, |
| "step": 4190 |
| }, |
| { |
| "balancing_entropy": 1.0491, |
| "balancing_loss": 1.1169, |
| "epoch": 21.43008, |
| "grad_norm": 0.328125, |
| "learning_rate": 0.003, |
| "loss": 2.3018, |
| "router_z_loss": 0.043, |
| "step": 4200 |
| }, |
| { |
| "balancing_entropy": 1.0295, |
| "balancing_loss": 1.1264, |
| "epoch": 21.48128, |
| "grad_norm": 0.38671875, |
| "learning_rate": 0.003, |
| "loss": 2.3103, |
| "router_z_loss": 0.0752, |
| "step": 4210 |
| }, |
| { |
| "balancing_entropy": 1.0557, |
| "balancing_loss": 1.119, |
| "epoch": 21.53248, |
| "grad_norm": 0.5625, |
| "learning_rate": 0.003, |
| "loss": 2.3019, |
| "router_z_loss": 0.0842, |
| "step": 4220 |
| }, |
| { |
| "balancing_entropy": 1.0386, |
| "balancing_loss": 1.1247, |
| "epoch": 21.58368, |
| "grad_norm": 0.35546875, |
| "learning_rate": 0.003, |
| "loss": 2.3054, |
| "router_z_loss": 0.0546, |
| "step": 4230 |
| }, |
| { |
| "balancing_entropy": 1.0632, |
| "balancing_loss": 1.1399, |
| "epoch": 21.63488, |
| "grad_norm": 0.400390625, |
| "learning_rate": 0.003, |
| "loss": 2.307, |
| "router_z_loss": 0.0554, |
| "step": 4240 |
| }, |
| { |
| "balancing_entropy": 1.0652, |
| "balancing_loss": 1.1398, |
| "epoch": 21.68608, |
| "grad_norm": 0.37890625, |
| "learning_rate": 0.003, |
| "loss": 2.2999, |
| "router_z_loss": 0.0542, |
| "step": 4250 |
| }, |
| { |
| "balancing_entropy": 1.051, |
| "balancing_loss": 1.1272, |
| "epoch": 21.73728, |
| "grad_norm": 0.310546875, |
| "learning_rate": 0.003, |
| "loss": 2.3111, |
| "router_z_loss": 0.0523, |
| "step": 4260 |
| }, |
| { |
| "balancing_entropy": 1.0284, |
| "balancing_loss": 1.1418, |
| "epoch": 21.78848, |
| "grad_norm": 0.6953125, |
| "learning_rate": 0.003, |
| "loss": 2.3119, |
| "router_z_loss": 0.0507, |
| "step": 4270 |
| }, |
| { |
| "balancing_entropy": 1.0015, |
| "balancing_loss": 1.11, |
| "epoch": 21.83968, |
| "grad_norm": 0.54296875, |
| "learning_rate": 0.003, |
| "loss": 2.3048, |
| "router_z_loss": 0.0512, |
| "step": 4280 |
| }, |
| { |
| "balancing_entropy": 1.0566, |
| "balancing_loss": 1.1091, |
| "epoch": 21.89088, |
| "grad_norm": 0.3359375, |
| "learning_rate": 0.003, |
| "loss": 2.3144, |
| "router_z_loss": 0.0598, |
| "step": 4290 |
| }, |
| { |
| "balancing_entropy": 1.0463, |
| "balancing_loss": 1.1171, |
| "epoch": 21.94208, |
| "grad_norm": 0.546875, |
| "learning_rate": 0.003, |
| "loss": 2.3107, |
| "router_z_loss": 0.0398, |
| "step": 4300 |
| }, |
| { |
| "balancing_entropy": 1.0103, |
| "balancing_loss": 1.1259, |
| "epoch": 21.99328, |
| "grad_norm": 0.73046875, |
| "learning_rate": 0.003, |
| "loss": 2.3131, |
| "router_z_loss": 0.0561, |
| "step": 4310 |
| }, |
| { |
| "balancing_entropy": 1.035, |
| "balancing_loss": 1.1451, |
| "epoch": 22.04096, |
| "grad_norm": 0.283203125, |
| "learning_rate": 0.003, |
| "loss": 2.2944, |
| "router_z_loss": 0.0544, |
| "step": 4320 |
| }, |
| { |
| "balancing_entropy": 1.0442, |
| "balancing_loss": 1.1572, |
| "epoch": 22.09216, |
| "grad_norm": 0.53515625, |
| "learning_rate": 0.003, |
| "loss": 2.2986, |
| "router_z_loss": 0.0582, |
| "step": 4330 |
| }, |
| { |
| "balancing_entropy": 1.0668, |
| "balancing_loss": 1.1234, |
| "epoch": 22.14336, |
| "grad_norm": 0.3671875, |
| "learning_rate": 0.003, |
| "loss": 2.2902, |
| "router_z_loss": 0.0543, |
| "step": 4340 |
| }, |
| { |
| "balancing_entropy": 1.0114, |
| "balancing_loss": 1.1257, |
| "epoch": 22.19456, |
| "grad_norm": 0.578125, |
| "learning_rate": 0.003, |
| "loss": 2.2964, |
| "router_z_loss": 0.053, |
| "step": 4350 |
| }, |
| { |
| "balancing_entropy": 1.0688, |
| "balancing_loss": 1.1459, |
| "epoch": 22.24576, |
| "grad_norm": 0.318359375, |
| "learning_rate": 0.003, |
| "loss": 2.2852, |
| "router_z_loss": 0.0609, |
| "step": 4360 |
| }, |
| { |
| "balancing_entropy": 1.0939, |
| "balancing_loss": 1.1498, |
| "epoch": 22.29696, |
| "grad_norm": 0.279296875, |
| "learning_rate": 0.003, |
| "loss": 2.2868, |
| "router_z_loss": 0.0383, |
| "step": 4370 |
| }, |
| { |
| "balancing_entropy": 1.0894, |
| "balancing_loss": 1.1373, |
| "epoch": 22.34816, |
| "grad_norm": 0.3828125, |
| "learning_rate": 0.003, |
| "loss": 2.2948, |
| "router_z_loss": 0.0366, |
| "step": 4380 |
| }, |
| { |
| "balancing_entropy": 1.0741, |
| "balancing_loss": 1.13, |
| "epoch": 22.39936, |
| "grad_norm": 0.55078125, |
| "learning_rate": 0.003, |
| "loss": 2.2896, |
| "router_z_loss": 0.0337, |
| "step": 4390 |
| }, |
| { |
| "balancing_entropy": 1.0656, |
| "balancing_loss": 1.1352, |
| "epoch": 22.45056, |
| "grad_norm": 0.55859375, |
| "learning_rate": 0.003, |
| "loss": 2.2973, |
| "router_z_loss": 0.0445, |
| "step": 4400 |
| }, |
| { |
| "balancing_entropy": 1.021, |
| "balancing_loss": 1.1298, |
| "epoch": 22.50176, |
| "grad_norm": 0.5, |
| "learning_rate": 0.003, |
| "loss": 2.3002, |
| "router_z_loss": 0.0504, |
| "step": 4410 |
| }, |
| { |
| "balancing_entropy": 1.0723, |
| "balancing_loss": 1.145, |
| "epoch": 22.55296, |
| "grad_norm": 0.373046875, |
| "learning_rate": 0.003, |
| "loss": 2.2945, |
| "router_z_loss": 0.0491, |
| "step": 4420 |
| }, |
| { |
| "balancing_entropy": 1.0332, |
| "balancing_loss": 1.1362, |
| "epoch": 22.60416, |
| "grad_norm": 0.3828125, |
| "learning_rate": 0.003, |
| "loss": 2.2972, |
| "router_z_loss": 0.0441, |
| "step": 4430 |
| }, |
| { |
| "balancing_entropy": 0.9803, |
| "balancing_loss": 1.1438, |
| "epoch": 22.65536, |
| "grad_norm": 0.71484375, |
| "learning_rate": 0.003, |
| "loss": 2.3051, |
| "router_z_loss": 0.0522, |
| "step": 4440 |
| }, |
| { |
| "balancing_entropy": 1.0601, |
| "balancing_loss": 1.1232, |
| "epoch": 22.70656, |
| "grad_norm": 0.46484375, |
| "learning_rate": 0.003, |
| "loss": 2.2975, |
| "router_z_loss": 0.0611, |
| "step": 4450 |
| }, |
| { |
| "balancing_entropy": 1.007, |
| "balancing_loss": 1.1101, |
| "epoch": 22.75776, |
| "grad_norm": 0.67578125, |
| "learning_rate": 0.003, |
| "loss": 2.2998, |
| "router_z_loss": 0.0452, |
| "step": 4460 |
| }, |
| { |
| "balancing_entropy": 1.0561, |
| "balancing_loss": 1.1192, |
| "epoch": 22.80896, |
| "grad_norm": 0.365234375, |
| "learning_rate": 0.003, |
| "loss": 2.2935, |
| "router_z_loss": 0.0554, |
| "step": 4470 |
| }, |
| { |
| "balancing_entropy": 1.0627, |
| "balancing_loss": 1.1333, |
| "epoch": 22.86016, |
| "grad_norm": 0.64453125, |
| "learning_rate": 0.003, |
| "loss": 2.2923, |
| "router_z_loss": 0.0465, |
| "step": 4480 |
| }, |
| { |
| "balancing_entropy": 1.06, |
| "balancing_loss": 1.1433, |
| "epoch": 22.91136, |
| "grad_norm": 0.36328125, |
| "learning_rate": 0.003, |
| "loss": 2.2996, |
| "router_z_loss": 0.0432, |
| "step": 4490 |
| }, |
| { |
| "balancing_entropy": 1.0649, |
| "balancing_loss": 1.1329, |
| "epoch": 22.96256, |
| "grad_norm": 0.58203125, |
| "learning_rate": 0.003, |
| "loss": 2.297, |
| "router_z_loss": 0.0527, |
| "step": 4500 |
| }, |
| { |
| "balancing_entropy": 1.0084, |
| "balancing_loss": 1.163, |
| "epoch": 23.01024, |
| "grad_norm": 0.494140625, |
| "learning_rate": 0.003, |
| "loss": 2.2983, |
| "router_z_loss": 0.0448, |
| "step": 4510 |
| }, |
| { |
| "balancing_entropy": 1.0353, |
| "balancing_loss": 1.1122, |
| "epoch": 23.06144, |
| "grad_norm": 0.265625, |
| "learning_rate": 0.003, |
| "loss": 2.2864, |
| "router_z_loss": 0.0556, |
| "step": 4520 |
| }, |
| { |
| "balancing_entropy": 1.0281, |
| "balancing_loss": 1.1533, |
| "epoch": 23.11264, |
| "grad_norm": 0.546875, |
| "learning_rate": 0.003, |
| "loss": 2.2755, |
| "router_z_loss": 0.0569, |
| "step": 4530 |
| }, |
| { |
| "balancing_entropy": 1.0706, |
| "balancing_loss": 1.1579, |
| "epoch": 23.16384, |
| "grad_norm": 0.35546875, |
| "learning_rate": 0.003, |
| "loss": 2.288, |
| "router_z_loss": 0.0515, |
| "step": 4540 |
| }, |
| { |
| "balancing_entropy": 1.0586, |
| "balancing_loss": 1.1544, |
| "epoch": 23.21504, |
| "grad_norm": 0.53515625, |
| "learning_rate": 0.003, |
| "loss": 2.2825, |
| "router_z_loss": 0.0532, |
| "step": 4550 |
| }, |
| { |
| "balancing_entropy": 1.0204, |
| "balancing_loss": 1.1167, |
| "epoch": 23.26624, |
| "grad_norm": 0.625, |
| "learning_rate": 0.003, |
| "loss": 2.2936, |
| "router_z_loss": 0.0474, |
| "step": 4560 |
| }, |
| { |
| "balancing_entropy": 1.0752, |
| "balancing_loss": 1.1596, |
| "epoch": 23.31744, |
| "grad_norm": 0.59765625, |
| "learning_rate": 0.003, |
| "loss": 2.2838, |
| "router_z_loss": 0.063, |
| "step": 4570 |
| }, |
| { |
| "balancing_entropy": 0.9842, |
| "balancing_loss": 1.1321, |
| "epoch": 23.36864, |
| "grad_norm": 0.421875, |
| "learning_rate": 0.003, |
| "loss": 2.2884, |
| "router_z_loss": 0.0563, |
| "step": 4580 |
| }, |
| { |
| "balancing_entropy": 1.0403, |
| "balancing_loss": 1.1547, |
| "epoch": 23.41984, |
| "grad_norm": 0.43359375, |
| "learning_rate": 0.003, |
| "loss": 2.2874, |
| "router_z_loss": 0.082, |
| "step": 4590 |
| }, |
| { |
| "balancing_entropy": 1.0761, |
| "balancing_loss": 1.14, |
| "epoch": 23.47104, |
| "grad_norm": 0.302734375, |
| "learning_rate": 0.003, |
| "loss": 2.2872, |
| "router_z_loss": 0.0696, |
| "step": 4600 |
| }, |
| { |
| "balancing_entropy": 1.0439, |
| "balancing_loss": 1.1381, |
| "epoch": 23.52224, |
| "grad_norm": 0.52734375, |
| "learning_rate": 0.003, |
| "loss": 2.2864, |
| "router_z_loss": 0.0576, |
| "step": 4610 |
| }, |
| { |
| "balancing_entropy": 1.0911, |
| "balancing_loss": 1.1326, |
| "epoch": 23.57344, |
| "grad_norm": 0.287109375, |
| "learning_rate": 0.003, |
| "loss": 2.2905, |
| "router_z_loss": 0.0555, |
| "step": 4620 |
| }, |
| { |
| "balancing_entropy": 1.0703, |
| "balancing_loss": 1.1211, |
| "epoch": 23.62464, |
| "grad_norm": 0.46875, |
| "learning_rate": 0.003, |
| "loss": 2.2932, |
| "router_z_loss": 0.0454, |
| "step": 4630 |
| }, |
| { |
| "balancing_entropy": 1.0509, |
| "balancing_loss": 1.1415, |
| "epoch": 23.67584, |
| "grad_norm": 0.6796875, |
| "learning_rate": 0.003, |
| "loss": 2.2851, |
| "router_z_loss": 0.0415, |
| "step": 4640 |
| }, |
| { |
| "balancing_entropy": 1.0814, |
| "balancing_loss": 1.139, |
| "epoch": 23.72704, |
| "grad_norm": 0.416015625, |
| "learning_rate": 0.003, |
| "loss": 2.2815, |
| "router_z_loss": 0.0463, |
| "step": 4650 |
| }, |
| { |
| "balancing_entropy": 1.0366, |
| "balancing_loss": 1.1473, |
| "epoch": 23.77824, |
| "grad_norm": 0.2890625, |
| "learning_rate": 0.003, |
| "loss": 2.2927, |
| "router_z_loss": 0.0513, |
| "step": 4660 |
| }, |
| { |
| "balancing_entropy": 1.0449, |
| "balancing_loss": 1.1243, |
| "epoch": 23.829439999999998, |
| "grad_norm": 0.51953125, |
| "learning_rate": 0.003, |
| "loss": 2.2838, |
| "router_z_loss": 0.0461, |
| "step": 4670 |
| }, |
| { |
| "balancing_entropy": 1.0811, |
| "balancing_loss": 1.1359, |
| "epoch": 23.88064, |
| "grad_norm": 0.330078125, |
| "learning_rate": 0.003, |
| "loss": 2.2877, |
| "router_z_loss": 0.0451, |
| "step": 4680 |
| }, |
| { |
| "balancing_entropy": 1.0638, |
| "balancing_loss": 1.1632, |
| "epoch": 23.93184, |
| "grad_norm": 0.498046875, |
| "learning_rate": 0.003, |
| "loss": 2.2878, |
| "router_z_loss": 0.0387, |
| "step": 4690 |
| }, |
| { |
| "balancing_entropy": 1.0699, |
| "balancing_loss": 1.1294, |
| "epoch": 23.98304, |
| "grad_norm": 0.56640625, |
| "learning_rate": 0.003, |
| "loss": 2.2858, |
| "router_z_loss": 0.0398, |
| "step": 4700 |
| }, |
| { |
| "balancing_entropy": 1.0435, |
| "balancing_loss": 1.1169, |
| "epoch": 24.03072, |
| "grad_norm": 0.4375, |
| "learning_rate": 0.003, |
| "loss": 2.289, |
| "router_z_loss": 0.0401, |
| "step": 4710 |
| }, |
| { |
| "balancing_entropy": 1.0646, |
| "balancing_loss": 1.1232, |
| "epoch": 24.08192, |
| "grad_norm": 0.25390625, |
| "learning_rate": 0.003, |
| "loss": 2.2828, |
| "router_z_loss": 0.0396, |
| "step": 4720 |
| }, |
| { |
| "balancing_entropy": 1.0821, |
| "balancing_loss": 1.1243, |
| "epoch": 24.13312, |
| "grad_norm": 0.578125, |
| "learning_rate": 0.003, |
| "loss": 2.2779, |
| "router_z_loss": 0.0406, |
| "step": 4730 |
| }, |
| { |
| "balancing_entropy": 1.0832, |
| "balancing_loss": 1.1521, |
| "epoch": 24.18432, |
| "grad_norm": 0.439453125, |
| "learning_rate": 0.003, |
| "loss": 2.2733, |
| "router_z_loss": 0.0439, |
| "step": 4740 |
| }, |
| { |
| "balancing_entropy": 1.0704, |
| "balancing_loss": 1.1228, |
| "epoch": 24.23552, |
| "grad_norm": 0.3125, |
| "learning_rate": 0.003, |
| "loss": 2.2775, |
| "router_z_loss": 0.0462, |
| "step": 4750 |
| }, |
| { |
| "balancing_entropy": 1.0795, |
| "balancing_loss": 1.1359, |
| "epoch": 24.28672, |
| "grad_norm": 0.314453125, |
| "learning_rate": 0.003, |
| "loss": 2.2688, |
| "router_z_loss": 0.043, |
| "step": 4760 |
| }, |
| { |
| "balancing_entropy": 1.0511, |
| "balancing_loss": 1.1325, |
| "epoch": 24.33792, |
| "grad_norm": 0.2421875, |
| "learning_rate": 0.003, |
| "loss": 2.28, |
| "router_z_loss": 0.0428, |
| "step": 4770 |
| }, |
| { |
| "balancing_entropy": 1.037, |
| "balancing_loss": 1.1263, |
| "epoch": 24.38912, |
| "grad_norm": 0.83984375, |
| "learning_rate": 0.003, |
| "loss": 2.2732, |
| "router_z_loss": 0.0447, |
| "step": 4780 |
| }, |
| { |
| "balancing_entropy": 1.0001, |
| "balancing_loss": 1.1322, |
| "epoch": 24.44032, |
| "grad_norm": 0.79296875, |
| "learning_rate": 0.003, |
| "loss": 2.2847, |
| "router_z_loss": 0.0459, |
| "step": 4790 |
| }, |
| { |
| "balancing_entropy": 1.039, |
| "balancing_loss": 1.1448, |
| "epoch": 24.49152, |
| "grad_norm": 0.39453125, |
| "learning_rate": 0.003, |
| "loss": 2.2863, |
| "router_z_loss": 0.0461, |
| "step": 4800 |
| }, |
| { |
| "balancing_entropy": 1.0218, |
| "balancing_loss": 1.1421, |
| "epoch": 24.54272, |
| "grad_norm": 0.515625, |
| "learning_rate": 0.003, |
| "loss": 2.2808, |
| "router_z_loss": 0.0468, |
| "step": 4810 |
| }, |
| { |
| "balancing_entropy": 1.0368, |
| "balancing_loss": 1.145, |
| "epoch": 24.59392, |
| "grad_norm": 0.404296875, |
| "learning_rate": 0.003, |
| "loss": 2.2825, |
| "router_z_loss": 0.0523, |
| "step": 4820 |
| }, |
| { |
| "balancing_entropy": 1.0493, |
| "balancing_loss": 1.1353, |
| "epoch": 24.64512, |
| "grad_norm": 0.298828125, |
| "learning_rate": 0.003, |
| "loss": 2.2823, |
| "router_z_loss": 0.0485, |
| "step": 4830 |
| }, |
| { |
| "balancing_entropy": 1.0598, |
| "balancing_loss": 1.1165, |
| "epoch": 24.69632, |
| "grad_norm": 0.40234375, |
| "learning_rate": 0.003, |
| "loss": 2.2776, |
| "router_z_loss": 0.0428, |
| "step": 4840 |
| }, |
| { |
| "balancing_entropy": 1.0402, |
| "balancing_loss": 1.1347, |
| "epoch": 24.74752, |
| "grad_norm": 0.26171875, |
| "learning_rate": 0.003, |
| "loss": 2.2834, |
| "router_z_loss": 0.0458, |
| "step": 4850 |
| }, |
| { |
| "balancing_entropy": 1.0102, |
| "balancing_loss": 1.1622, |
| "epoch": 24.79872, |
| "grad_norm": 0.625, |
| "learning_rate": 0.003, |
| "loss": 2.2829, |
| "router_z_loss": 0.0509, |
| "step": 4860 |
| }, |
| { |
| "balancing_entropy": 0.9894, |
| "balancing_loss": 1.1695, |
| "epoch": 24.84992, |
| "grad_norm": 0.86328125, |
| "learning_rate": 0.003, |
| "loss": 2.2829, |
| "router_z_loss": 0.0572, |
| "step": 4870 |
| }, |
| { |
| "balancing_entropy": 1.044, |
| "balancing_loss": 1.1283, |
| "epoch": 24.90112, |
| "grad_norm": 0.55078125, |
| "learning_rate": 0.003, |
| "loss": 2.2855, |
| "router_z_loss": 0.0592, |
| "step": 4880 |
| }, |
| { |
| "balancing_entropy": 1.084, |
| "balancing_loss": 1.1366, |
| "epoch": 24.95232, |
| "grad_norm": 0.28125, |
| "learning_rate": 0.003, |
| "loss": 2.279, |
| "router_z_loss": 0.0519, |
| "step": 4890 |
| }, |
| { |
| "balancing_entropy": 1.0463, |
| "balancing_loss": 1.1289, |
| "epoch": 25.0, |
| "grad_norm": 0.310546875, |
| "learning_rate": 0.003, |
| "loss": 2.281, |
| "router_z_loss": 0.0457, |
| "step": 4900 |
| }, |
| { |
| "balancing_entropy": 1.0756, |
| "balancing_loss": 1.1409, |
| "epoch": 25.0512, |
| "grad_norm": 0.2890625, |
| "learning_rate": 0.003, |
| "loss": 2.2624, |
| "router_z_loss": 0.0432, |
| "step": 4910 |
| }, |
| { |
| "balancing_entropy": 1.0128, |
| "balancing_loss": 1.1419, |
| "epoch": 25.1024, |
| "grad_norm": 0.435546875, |
| "learning_rate": 0.003, |
| "loss": 2.2761, |
| "router_z_loss": 0.043, |
| "step": 4920 |
| }, |
| { |
| "balancing_entropy": 1.0785, |
| "balancing_loss": 1.1306, |
| "epoch": 25.1536, |
| "grad_norm": 0.326171875, |
| "learning_rate": 0.003, |
| "loss": 2.2716, |
| "router_z_loss": 0.0464, |
| "step": 4930 |
| }, |
| { |
| "balancing_entropy": 1.0723, |
| "balancing_loss": 1.1443, |
| "epoch": 25.2048, |
| "grad_norm": 0.3359375, |
| "learning_rate": 0.003, |
| "loss": 2.2666, |
| "router_z_loss": 0.0451, |
| "step": 4940 |
| }, |
| { |
| "balancing_entropy": 1.0652, |
| "balancing_loss": 1.1235, |
| "epoch": 25.256, |
| "grad_norm": 0.625, |
| "learning_rate": 0.003, |
| "loss": 2.27, |
| "router_z_loss": 0.0429, |
| "step": 4950 |
| }, |
| { |
| "balancing_entropy": 1.0634, |
| "balancing_loss": 1.1462, |
| "epoch": 25.3072, |
| "grad_norm": 0.314453125, |
| "learning_rate": 0.003, |
| "loss": 2.2702, |
| "router_z_loss": 0.0448, |
| "step": 4960 |
| }, |
| { |
| "balancing_entropy": 1.0723, |
| "balancing_loss": 1.1268, |
| "epoch": 25.3584, |
| "grad_norm": 0.314453125, |
| "learning_rate": 0.003, |
| "loss": 2.2745, |
| "router_z_loss": 0.0429, |
| "step": 4970 |
| }, |
| { |
| "balancing_entropy": 1.0726, |
| "balancing_loss": 1.1487, |
| "epoch": 25.4096, |
| "grad_norm": 0.56640625, |
| "learning_rate": 0.003, |
| "loss": 2.2655, |
| "router_z_loss": 0.04, |
| "step": 4980 |
| }, |
| { |
| "balancing_entropy": 1.0657, |
| "balancing_loss": 1.1231, |
| "epoch": 25.4608, |
| "grad_norm": 0.65625, |
| "learning_rate": 0.003, |
| "loss": 2.2679, |
| "router_z_loss": 0.0376, |
| "step": 4990 |
| }, |
| { |
| "balancing_entropy": 1.0308, |
| "balancing_loss": 1.1208, |
| "epoch": 25.512, |
| "grad_norm": 0.38671875, |
| "learning_rate": 0.003, |
| "loss": 2.2698, |
| "router_z_loss": 0.039, |
| "step": 5000 |
| } |
| ], |
| "logging_steps": 10, |
| "max_steps": 19500, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 100, |
| "save_steps": 5000, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 3.17699824084992e+17, |
| "train_batch_size": 8, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|