{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 25.512, "eval_steps": 500, "global_step": 5000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "balancing_entropy": 1.0907, "balancing_loss": 1.1417, "epoch": 0.0512, "grad_norm": 1.015625, "learning_rate": 3.076923076923077e-05, "loss": 12.4636, "router_z_loss": 1.3718, "step": 10 }, { "balancing_entropy": 1.0804, "balancing_loss": 1.1423, "epoch": 0.1024, "grad_norm": 0.91015625, "learning_rate": 6.153846153846154e-05, "loss": 12.2249, "router_z_loss": 1.3676, "step": 20 }, { "balancing_entropy": 1.0952, "balancing_loss": 1.1429, "epoch": 0.1536, "grad_norm": 0.8515625, "learning_rate": 9.230769230769232e-05, "loss": 11.7705, "router_z_loss": 1.3434, "step": 30 }, { "balancing_entropy": 1.0779, "balancing_loss": 1.144, "epoch": 0.2048, "grad_norm": 0.828125, "learning_rate": 0.00012307692307692307, "loss": 11.111, "router_z_loss": 1.2754, "step": 40 }, { "balancing_entropy": 1.0905, "balancing_loss": 1.1422, "epoch": 0.256, "grad_norm": 1.046875, "learning_rate": 0.00015384615384615385, "loss": 10.1841, "router_z_loss": 1.2004, "step": 50 }, { "balancing_entropy": 1.0915, "balancing_loss": 1.1419, "epoch": 0.3072, "grad_norm": 0.63671875, "learning_rate": 0.00018461538461538463, "loss": 9.2971, "router_z_loss": 1.1388, "step": 60 }, { "balancing_entropy": 1.0865, "balancing_loss": 1.1409, "epoch": 0.3584, "grad_norm": 0.73828125, "learning_rate": 0.0002153846153846154, "loss": 8.6456, "router_z_loss": 1.1099, "step": 70 }, { "balancing_entropy": 1.0621, "balancing_loss": 1.1474, "epoch": 0.4096, "grad_norm": 2.71875, "learning_rate": 0.00024615384615384614, "loss": 8.2519, "router_z_loss": 1.0139, "step": 80 }, { "balancing_entropy": 1.0621, "balancing_loss": 1.1455, "epoch": 0.4608, "grad_norm": 1.0703125, "learning_rate": 0.00027692307692307695, "loss": 7.9354, "router_z_loss": 0.8722, "step": 90 }, { "balancing_entropy": 1.0783, "balancing_loss": 1.1375, "epoch": 0.512, "grad_norm": 0.765625, "learning_rate": 0.0003076923076923077, "loss": 7.5548, "router_z_loss": 0.7341, "step": 100 }, { "balancing_entropy": 1.0898, "balancing_loss": 1.1312, "epoch": 0.5632, "grad_norm": 0.91015625, "learning_rate": 0.00033846153846153846, "loss": 7.0768, "router_z_loss": 0.6111, "step": 110 }, { "balancing_entropy": 1.0923, "balancing_loss": 1.131, "epoch": 0.6144, "grad_norm": 0.65234375, "learning_rate": 0.00036923076923076927, "loss": 6.5868, "router_z_loss": 0.4137, "step": 120 }, { "balancing_entropy": 1.0932, "balancing_loss": 1.1305, "epoch": 0.6656, "grad_norm": 0.458984375, "learning_rate": 0.0004, "loss": 6.2033, "router_z_loss": 0.2772, "step": 130 }, { "balancing_entropy": 1.0953, "balancing_loss": 1.1305, "epoch": 0.7168, "grad_norm": 1.421875, "learning_rate": 0.0004307692307692308, "loss": 5.9507, "router_z_loss": 0.2233, "step": 140 }, { "balancing_entropy": 1.0941, "balancing_loss": 1.1261, "epoch": 0.768, "grad_norm": 1.0234375, "learning_rate": 0.0004615384615384616, "loss": 5.7447, "router_z_loss": 0.1919, "step": 150 }, { "balancing_entropy": 1.0942, "balancing_loss": 1.1258, "epoch": 0.8192, "grad_norm": 0.625, "learning_rate": 0.0004923076923076923, "loss": 5.5495, "router_z_loss": 0.14, "step": 160 }, { "balancing_entropy": 1.0947, "balancing_loss": 1.1259, "epoch": 0.8704, "grad_norm": 0.61328125, "learning_rate": 0.0005230769230769231, "loss": 5.3746, "router_z_loss": 0.1123, "step": 170 }, { "balancing_entropy": 1.0951, "balancing_loss": 1.1255, "epoch": 0.9216, "grad_norm": 1.1328125, "learning_rate": 0.0005538461538461539, "loss": 5.2159, "router_z_loss": 0.0839, "step": 180 }, { "balancing_entropy": 1.0916, "balancing_loss": 1.1175, "epoch": 0.9728, "grad_norm": 1.4140625, "learning_rate": 0.0005846153846153846, "loss": 5.0335, "router_z_loss": 0.071, "step": 190 }, { "balancing_entropy": 1.0491, "balancing_loss": 1.1153, "epoch": 1.02048, "grad_norm": 0.7578125, "learning_rate": 0.0006153846153846154, "loss": 4.9021, "router_z_loss": 0.064, "step": 200 }, { "balancing_entropy": 1.0888, "balancing_loss": 1.1112, "epoch": 1.07168, "grad_norm": 1.046875, "learning_rate": 0.0006461538461538462, "loss": 4.7524, "router_z_loss": 0.0585, "step": 210 }, { "balancing_entropy": 1.0875, "balancing_loss": 1.1083, "epoch": 1.12288, "grad_norm": 1.2109375, "learning_rate": 0.0006769230769230769, "loss": 4.6408, "router_z_loss": 0.0605, "step": 220 }, { "balancing_entropy": 1.0884, "balancing_loss": 1.1063, "epoch": 1.17408, "grad_norm": 0.9453125, "learning_rate": 0.0007076923076923077, "loss": 4.53, "router_z_loss": 0.0596, "step": 230 }, { "balancing_entropy": 1.0853, "balancing_loss": 1.1053, "epoch": 1.22528, "grad_norm": 1.0546875, "learning_rate": 0.0007384615384615385, "loss": 4.3935, "router_z_loss": 0.054, "step": 240 }, { "balancing_entropy": 1.0895, "balancing_loss": 1.1085, "epoch": 1.27648, "grad_norm": 1.0390625, "learning_rate": 0.0007692307692307692, "loss": 4.3076, "router_z_loss": 0.064, "step": 250 }, { "balancing_entropy": 1.0829, "balancing_loss": 1.1033, "epoch": 1.32768, "grad_norm": 0.7265625, "learning_rate": 0.0008, "loss": 4.2385, "router_z_loss": 0.0581, "step": 260 }, { "balancing_entropy": 1.0855, "balancing_loss": 1.1075, "epoch": 1.37888, "grad_norm": 0.6484375, "learning_rate": 0.0008307692307692308, "loss": 4.1286, "router_z_loss": 0.0563, "step": 270 }, { "balancing_entropy": 1.0869, "balancing_loss": 1.0988, "epoch": 1.43008, "grad_norm": 0.734375, "learning_rate": 0.0008615384615384615, "loss": 4.0637, "router_z_loss": 0.0596, "step": 280 }, { "balancing_entropy": 1.0885, "balancing_loss": 1.1019, "epoch": 1.48128, "grad_norm": 1.015625, "learning_rate": 0.0008923076923076924, "loss": 3.9922, "router_z_loss": 0.0532, "step": 290 }, { "balancing_entropy": 1.084, "balancing_loss": 1.103, "epoch": 1.53248, "grad_norm": 0.9765625, "learning_rate": 0.0009230769230769232, "loss": 3.9192, "router_z_loss": 0.0501, "step": 300 }, { "balancing_entropy": 1.086, "balancing_loss": 1.0974, "epoch": 1.58368, "grad_norm": 0.57421875, "learning_rate": 0.0009538461538461538, "loss": 3.8677, "router_z_loss": 0.0553, "step": 310 }, { "balancing_entropy": 1.0875, "balancing_loss": 1.1006, "epoch": 1.6348799999999999, "grad_norm": 0.78125, "learning_rate": 0.0009846153846153846, "loss": 3.8262, "router_z_loss": 0.0528, "step": 320 }, { "balancing_entropy": 1.0874, "balancing_loss": 1.1033, "epoch": 1.68608, "grad_norm": 0.53515625, "learning_rate": 0.0010153846153846155, "loss": 3.7606, "router_z_loss": 0.053, "step": 330 }, { "balancing_entropy": 1.0766, "balancing_loss": 1.1084, "epoch": 1.7372800000000002, "grad_norm": 0.7890625, "learning_rate": 0.0010461538461538462, "loss": 3.6967, "router_z_loss": 0.0483, "step": 340 }, { "balancing_entropy": 1.0786, "balancing_loss": 1.0986, "epoch": 1.7884799999999998, "grad_norm": 0.80078125, "learning_rate": 0.0010769230769230769, "loss": 3.684, "router_z_loss": 0.0669, "step": 350 }, { "balancing_entropy": 1.0872, "balancing_loss": 1.0975, "epoch": 1.83968, "grad_norm": 0.75, "learning_rate": 0.0011076923076923078, "loss": 3.6041, "router_z_loss": 0.0526, "step": 360 }, { "balancing_entropy": 1.0866, "balancing_loss": 1.106, "epoch": 1.8908800000000001, "grad_norm": 0.88671875, "learning_rate": 0.0011384615384615385, "loss": 3.5964, "router_z_loss": 0.0513, "step": 370 }, { "balancing_entropy": 1.0801, "balancing_loss": 1.0959, "epoch": 1.94208, "grad_norm": 0.453125, "learning_rate": 0.0011692307692307692, "loss": 3.5742, "router_z_loss": 0.0519, "step": 380 }, { "balancing_entropy": 1.0785, "balancing_loss": 1.1051, "epoch": 1.99328, "grad_norm": 0.65234375, "learning_rate": 0.0012000000000000001, "loss": 3.5006, "router_z_loss": 0.0563, "step": 390 }, { "balancing_entropy": 1.0483, "balancing_loss": 1.0966, "epoch": 2.04096, "grad_norm": 1.0390625, "learning_rate": 0.0012307692307692308, "loss": 3.4658, "router_z_loss": 0.0533, "step": 400 }, { "balancing_entropy": 1.0882, "balancing_loss": 1.1001, "epoch": 2.09216, "grad_norm": 0.4609375, "learning_rate": 0.0012615384615384615, "loss": 3.4427, "router_z_loss": 0.0443, "step": 410 }, { "balancing_entropy": 1.0891, "balancing_loss": 1.0997, "epoch": 2.14336, "grad_norm": 0.76171875, "learning_rate": 0.0012923076923076924, "loss": 3.4206, "router_z_loss": 0.0417, "step": 420 }, { "balancing_entropy": 1.088, "balancing_loss": 1.0989, "epoch": 2.19456, "grad_norm": 0.8125, "learning_rate": 0.0013230769230769231, "loss": 3.3869, "router_z_loss": 0.0436, "step": 430 }, { "balancing_entropy": 1.0683, "balancing_loss": 1.1073, "epoch": 2.24576, "grad_norm": 0.62890625, "learning_rate": 0.0013538461538461538, "loss": 3.3571, "router_z_loss": 0.0491, "step": 440 }, { "balancing_entropy": 1.0751, "balancing_loss": 1.0967, "epoch": 2.29696, "grad_norm": 0.55859375, "learning_rate": 0.0013846153846153847, "loss": 3.3558, "router_z_loss": 0.053, "step": 450 }, { "balancing_entropy": 1.0669, "balancing_loss": 1.1059, "epoch": 2.34816, "grad_norm": 0.609375, "learning_rate": 0.0014153846153846154, "loss": 3.3114, "router_z_loss": 0.0561, "step": 460 }, { "balancing_entropy": 1.0747, "balancing_loss": 1.0934, "epoch": 2.39936, "grad_norm": 0.490234375, "learning_rate": 0.0014461538461538461, "loss": 3.3037, "router_z_loss": 0.0516, "step": 470 }, { "balancing_entropy": 1.0815, "balancing_loss": 1.0988, "epoch": 2.45056, "grad_norm": 0.66796875, "learning_rate": 0.001476923076923077, "loss": 3.2948, "router_z_loss": 0.0525, "step": 480 }, { "balancing_entropy": 1.0909, "balancing_loss": 1.1038, "epoch": 2.50176, "grad_norm": 0.49609375, "learning_rate": 0.0015076923076923078, "loss": 3.2504, "router_z_loss": 0.0423, "step": 490 }, { "balancing_entropy": 1.0772, "balancing_loss": 1.1019, "epoch": 2.55296, "grad_norm": 0.4921875, "learning_rate": 0.0015384615384615385, "loss": 3.2454, "router_z_loss": 0.0377, "step": 500 }, { "balancing_entropy": 1.082, "balancing_loss": 1.0907, "epoch": 2.6041600000000003, "grad_norm": 0.7578125, "learning_rate": 0.0015692307692307694, "loss": 3.2209, "router_z_loss": 0.0374, "step": 510 }, { "balancing_entropy": 1.0875, "balancing_loss": 1.104, "epoch": 2.65536, "grad_norm": 0.443359375, "learning_rate": 0.0016, "loss": 3.2235, "router_z_loss": 0.0341, "step": 520 }, { "balancing_entropy": 1.0829, "balancing_loss": 1.1012, "epoch": 2.70656, "grad_norm": 0.8359375, "learning_rate": 0.0016307692307692308, "loss": 3.1925, "router_z_loss": 0.0327, "step": 530 }, { "balancing_entropy": 1.0765, "balancing_loss": 1.1007, "epoch": 2.75776, "grad_norm": 0.326171875, "learning_rate": 0.0016615384615384617, "loss": 3.2021, "router_z_loss": 0.0391, "step": 540 }, { "balancing_entropy": 1.0868, "balancing_loss": 1.0972, "epoch": 2.80896, "grad_norm": 0.4375, "learning_rate": 0.0016923076923076924, "loss": 3.1871, "router_z_loss": 0.0459, "step": 550 }, { "balancing_entropy": 1.0733, "balancing_loss": 1.0959, "epoch": 2.86016, "grad_norm": 0.48046875, "learning_rate": 0.001723076923076923, "loss": 3.1595, "router_z_loss": 0.0345, "step": 560 }, { "balancing_entropy": 1.077, "balancing_loss": 1.1003, "epoch": 2.91136, "grad_norm": 0.482421875, "learning_rate": 0.001753846153846154, "loss": 3.1634, "router_z_loss": 0.0334, "step": 570 }, { "balancing_entropy": 1.088, "balancing_loss": 1.0995, "epoch": 2.96256, "grad_norm": 0.390625, "learning_rate": 0.0017846153846153847, "loss": 3.1342, "router_z_loss": 0.0411, "step": 580 }, { "balancing_entropy": 1.0335, "balancing_loss": 1.1026, "epoch": 3.01024, "grad_norm": 0.58984375, "learning_rate": 0.0018153846153846154, "loss": 3.13, "router_z_loss": 0.0393, "step": 590 }, { "balancing_entropy": 1.0877, "balancing_loss": 1.1057, "epoch": 3.06144, "grad_norm": 0.37109375, "learning_rate": 0.0018461538461538463, "loss": 3.1095, "router_z_loss": 0.0361, "step": 600 }, { "balancing_entropy": 1.0627, "balancing_loss": 1.0867, "epoch": 3.11264, "grad_norm": 0.5859375, "learning_rate": 0.001876923076923077, "loss": 3.1136, "router_z_loss": 0.0396, "step": 610 }, { "balancing_entropy": 1.0767, "balancing_loss": 1.1135, "epoch": 3.16384, "grad_norm": 0.294921875, "learning_rate": 0.0019076923076923075, "loss": 3.0938, "router_z_loss": 0.0543, "step": 620 }, { "balancing_entropy": 1.0881, "balancing_loss": 1.092, "epoch": 3.21504, "grad_norm": 0.40234375, "learning_rate": 0.0019384615384615386, "loss": 3.0719, "router_z_loss": 0.0355, "step": 630 }, { "balancing_entropy": 1.08, "balancing_loss": 1.0957, "epoch": 3.26624, "grad_norm": 0.443359375, "learning_rate": 0.001969230769230769, "loss": 3.0781, "router_z_loss": 0.033, "step": 640 }, { "balancing_entropy": 1.0757, "balancing_loss": 1.0982, "epoch": 3.31744, "grad_norm": 0.443359375, "learning_rate": 0.002, "loss": 3.0823, "router_z_loss": 0.0554, "step": 650 }, { "balancing_entropy": 1.0748, "balancing_loss": 1.0967, "epoch": 3.36864, "grad_norm": 0.30078125, "learning_rate": 0.002030769230769231, "loss": 3.0585, "router_z_loss": 0.0474, "step": 660 }, { "balancing_entropy": 1.0867, "balancing_loss": 1.0972, "epoch": 3.4198399999999998, "grad_norm": 0.37109375, "learning_rate": 0.0020615384615384614, "loss": 3.0622, "router_z_loss": 0.0297, "step": 670 }, { "balancing_entropy": 1.0796, "balancing_loss": 1.1021, "epoch": 3.47104, "grad_norm": 0.5234375, "learning_rate": 0.0020923076923076924, "loss": 3.0576, "router_z_loss": 0.033, "step": 680 }, { "balancing_entropy": 1.0829, "balancing_loss": 1.096, "epoch": 3.52224, "grad_norm": 0.345703125, "learning_rate": 0.0021230769230769233, "loss": 3.0549, "router_z_loss": 0.0452, "step": 690 }, { "balancing_entropy": 1.0569, "balancing_loss": 1.1113, "epoch": 3.5734399999999997, "grad_norm": 0.58203125, "learning_rate": 0.0021538461538461538, "loss": 3.0211, "router_z_loss": 0.0321, "step": 700 }, { "balancing_entropy": 1.0693, "balancing_loss": 1.0886, "epoch": 3.62464, "grad_norm": 0.498046875, "learning_rate": 0.0021846153846153847, "loss": 3.0315, "router_z_loss": 0.0772, "step": 710 }, { "balancing_entropy": 1.0871, "balancing_loss": 1.1029, "epoch": 3.67584, "grad_norm": 0.2734375, "learning_rate": 0.0022153846153846156, "loss": 3.0335, "router_z_loss": 0.0542, "step": 720 }, { "balancing_entropy": 1.0822, "balancing_loss": 1.0957, "epoch": 3.72704, "grad_norm": 0.412109375, "learning_rate": 0.002246153846153846, "loss": 3.023, "router_z_loss": 0.0253, "step": 730 }, { "balancing_entropy": 1.0735, "balancing_loss": 1.095, "epoch": 3.7782400000000003, "grad_norm": 0.35546875, "learning_rate": 0.002276923076923077, "loss": 3.0195, "router_z_loss": 0.0519, "step": 740 }, { "balancing_entropy": 1.0694, "balancing_loss": 1.1025, "epoch": 3.82944, "grad_norm": 0.4140625, "learning_rate": 0.002307692307692308, "loss": 3.0002, "router_z_loss": 0.0451, "step": 750 }, { "balancing_entropy": 1.0771, "balancing_loss": 1.0982, "epoch": 3.88064, "grad_norm": 0.328125, "learning_rate": 0.0023384615384615384, "loss": 3.0, "router_z_loss": 0.0436, "step": 760 }, { "balancing_entropy": 1.0773, "balancing_loss": 1.0907, "epoch": 3.9318400000000002, "grad_norm": 0.30859375, "learning_rate": 0.0023692307692307693, "loss": 2.989, "router_z_loss": 0.0405, "step": 770 }, { "balancing_entropy": 1.0698, "balancing_loss": 1.112, "epoch": 3.98304, "grad_norm": 0.337890625, "learning_rate": 0.0024000000000000002, "loss": 2.9775, "router_z_loss": 0.0363, "step": 780 }, { "balancing_entropy": 1.0339, "balancing_loss": 1.0875, "epoch": 4.03072, "grad_norm": 0.44140625, "learning_rate": 0.0024307692307692307, "loss": 2.9959, "router_z_loss": 0.0587, "step": 790 }, { "balancing_entropy": 1.0776, "balancing_loss": 1.0943, "epoch": 4.08192, "grad_norm": 0.267578125, "learning_rate": 0.0024615384615384616, "loss": 2.965, "router_z_loss": 0.0367, "step": 800 }, { "balancing_entropy": 1.0624, "balancing_loss": 1.1087, "epoch": 4.13312, "grad_norm": 0.373046875, "learning_rate": 0.0024923076923076925, "loss": 2.9649, "router_z_loss": 0.0522, "step": 810 }, { "balancing_entropy": 1.0813, "balancing_loss": 1.1016, "epoch": 4.18432, "grad_norm": 0.287109375, "learning_rate": 0.002523076923076923, "loss": 2.953, "router_z_loss": 0.055, "step": 820 }, { "balancing_entropy": 1.0713, "balancing_loss": 1.1215, "epoch": 4.23552, "grad_norm": 0.33203125, "learning_rate": 0.002553846153846154, "loss": 2.9571, "router_z_loss": 0.068, "step": 830 }, { "balancing_entropy": 1.0691, "balancing_loss": 1.0899, "epoch": 4.28672, "grad_norm": 0.30078125, "learning_rate": 0.002584615384615385, "loss": 2.9438, "router_z_loss": 0.0722, "step": 840 }, { "balancing_entropy": 1.0766, "balancing_loss": 1.1022, "epoch": 4.33792, "grad_norm": 0.4140625, "learning_rate": 0.0026153846153846153, "loss": 2.959, "router_z_loss": 0.0367, "step": 850 }, { "balancing_entropy": 1.0748, "balancing_loss": 1.0939, "epoch": 4.38912, "grad_norm": 0.369140625, "learning_rate": 0.0026461538461538463, "loss": 2.9531, "router_z_loss": 0.0574, "step": 860 }, { "balancing_entropy": 1.0741, "balancing_loss": 1.0957, "epoch": 4.44032, "grad_norm": 0.30078125, "learning_rate": 0.002676923076923077, "loss": 2.9278, "router_z_loss": 0.067, "step": 870 }, { "balancing_entropy": 1.0788, "balancing_loss": 1.0995, "epoch": 4.49152, "grad_norm": 0.376953125, "learning_rate": 0.0027076923076923077, "loss": 2.9105, "router_z_loss": 0.0408, "step": 880 }, { "balancing_entropy": 1.0742, "balancing_loss": 1.0967, "epoch": 4.54272, "grad_norm": 0.36328125, "learning_rate": 0.0027384615384615386, "loss": 2.9266, "router_z_loss": 0.0403, "step": 890 }, { "balancing_entropy": 1.0653, "balancing_loss": 1.095, "epoch": 4.59392, "grad_norm": 0.2470703125, "learning_rate": 0.0027692307692307695, "loss": 2.9362, "router_z_loss": 0.0709, "step": 900 }, { "balancing_entropy": 1.0863, "balancing_loss": 1.115, "epoch": 4.64512, "grad_norm": 0.29296875, "learning_rate": 0.0028, "loss": 2.9221, "router_z_loss": 0.0481, "step": 910 }, { "balancing_entropy": 1.0608, "balancing_loss": 1.1215, "epoch": 4.69632, "grad_norm": 0.34375, "learning_rate": 0.002830769230769231, "loss": 2.919, "router_z_loss": 0.0382, "step": 920 }, { "balancing_entropy": 1.059, "balancing_loss": 1.0758, "epoch": 4.74752, "grad_norm": 0.251953125, "learning_rate": 0.002861538461538462, "loss": 2.9262, "router_z_loss": 0.1472, "step": 930 }, { "balancing_entropy": 1.0388, "balancing_loss": 1.1026, "epoch": 4.79872, "grad_norm": 0.298828125, "learning_rate": 0.0028923076923076923, "loss": 2.9038, "router_z_loss": 0.1057, "step": 940 }, { "balancing_entropy": 1.0384, "balancing_loss": 1.1249, "epoch": 4.84992, "grad_norm": 0.294921875, "learning_rate": 0.002923076923076923, "loss": 2.9105, "router_z_loss": 0.0981, "step": 950 }, { "balancing_entropy": 1.0729, "balancing_loss": 1.1026, "epoch": 4.90112, "grad_norm": 0.28125, "learning_rate": 0.002953846153846154, "loss": 2.8872, "router_z_loss": 0.1501, "step": 960 }, { "balancing_entropy": 1.0843, "balancing_loss": 1.1123, "epoch": 4.95232, "grad_norm": 0.271484375, "learning_rate": 0.0029846153846153846, "loss": 2.9128, "router_z_loss": 0.0492, "step": 970 }, { "balancing_entropy": 1.0237, "balancing_loss": 1.1246, "epoch": 5.0, "grad_norm": 0.55859375, "learning_rate": 0.003, "loss": 2.8729, "router_z_loss": 0.0501, "step": 980 }, { "balancing_entropy": 1.0714, "balancing_loss": 1.0844, "epoch": 5.0512, "grad_norm": 0.25, "learning_rate": 0.003, "loss": 2.8925, "router_z_loss": 0.1031, "step": 990 }, { "balancing_entropy": 1.0844, "balancing_loss": 1.1099, "epoch": 5.1024, "grad_norm": 0.314453125, "learning_rate": 0.003, "loss": 2.8403, "router_z_loss": 0.079, "step": 1000 }, { "balancing_entropy": 1.0786, "balancing_loss": 1.096, "epoch": 5.1536, "grad_norm": 0.2412109375, "learning_rate": 0.003, "loss": 2.8647, "router_z_loss": 0.0456, "step": 1010 }, { "balancing_entropy": 1.0676, "balancing_loss": 1.108, "epoch": 5.2048, "grad_norm": 0.275390625, "learning_rate": 0.003, "loss": 2.8194, "router_z_loss": 0.0442, "step": 1020 }, { "balancing_entropy": 1.0733, "balancing_loss": 1.1015, "epoch": 5.256, "grad_norm": 0.40625, "learning_rate": 0.003, "loss": 2.8276, "router_z_loss": 0.0402, "step": 1030 }, { "balancing_entropy": 1.0855, "balancing_loss": 1.1128, "epoch": 5.3072, "grad_norm": 0.2421875, "learning_rate": 0.003, "loss": 2.8414, "router_z_loss": 0.0399, "step": 1040 }, { "balancing_entropy": 1.0807, "balancing_loss": 1.104, "epoch": 5.3584, "grad_norm": 0.279296875, "learning_rate": 0.003, "loss": 2.8114, "router_z_loss": 0.0427, "step": 1050 }, { "balancing_entropy": 1.0881, "balancing_loss": 1.1114, "epoch": 5.4096, "grad_norm": 0.291015625, "learning_rate": 0.003, "loss": 2.8032, "router_z_loss": 0.0286, "step": 1060 }, { "balancing_entropy": 1.0567, "balancing_loss": 1.1257, "epoch": 5.4608, "grad_norm": 0.3046875, "learning_rate": 0.003, "loss": 2.796, "router_z_loss": 0.0563, "step": 1070 }, { "balancing_entropy": 1.0871, "balancing_loss": 1.098, "epoch": 5.5120000000000005, "grad_norm": 0.37109375, "learning_rate": 0.003, "loss": 2.7893, "router_z_loss": 0.0573, "step": 1080 }, { "balancing_entropy": 1.0589, "balancing_loss": 1.1092, "epoch": 5.5632, "grad_norm": 0.330078125, "learning_rate": 0.003, "loss": 2.7915, "router_z_loss": 0.0361, "step": 1090 }, { "balancing_entropy": 1.0779, "balancing_loss": 1.121, "epoch": 5.6144, "grad_norm": 0.31640625, "learning_rate": 0.003, "loss": 2.7814, "router_z_loss": 0.0575, "step": 1100 }, { "balancing_entropy": 1.0739, "balancing_loss": 1.1173, "epoch": 5.6655999999999995, "grad_norm": 0.3046875, "learning_rate": 0.003, "loss": 2.7735, "router_z_loss": 0.0452, "step": 1110 }, { "balancing_entropy": 1.0798, "balancing_loss": 1.108, "epoch": 5.7168, "grad_norm": 0.224609375, "learning_rate": 0.003, "loss": 2.7718, "router_z_loss": 0.0369, "step": 1120 }, { "balancing_entropy": 1.0562, "balancing_loss": 1.1132, "epoch": 5.768, "grad_norm": 0.294921875, "learning_rate": 0.003, "loss": 2.7737, "router_z_loss": 0.0553, "step": 1130 }, { "balancing_entropy": 1.049, "balancing_loss": 1.1171, "epoch": 5.8192, "grad_norm": 1.625, "learning_rate": 0.003, "loss": 2.8174, "router_z_loss": 0.154, "step": 1140 }, { "balancing_entropy": 1.0838, "balancing_loss": 1.0896, "epoch": 5.8704, "grad_norm": 0.546875, "learning_rate": 0.003, "loss": 2.8409, "router_z_loss": 0.3276, "step": 1150 }, { "balancing_entropy": 1.0754, "balancing_loss": 1.0922, "epoch": 5.9216, "grad_norm": 0.41796875, "learning_rate": 0.003, "loss": 2.8197, "router_z_loss": 0.2162, "step": 1160 }, { "balancing_entropy": 1.084, "balancing_loss": 1.1066, "epoch": 5.9728, "grad_norm": 0.345703125, "learning_rate": 0.003, "loss": 2.7698, "router_z_loss": 0.0843, "step": 1170 }, { "balancing_entropy": 1.0194, "balancing_loss": 1.1086, "epoch": 6.02048, "grad_norm": 0.3125, "learning_rate": 0.003, "loss": 2.7488, "router_z_loss": 0.0517, "step": 1180 }, { "balancing_entropy": 1.0724, "balancing_loss": 1.1055, "epoch": 6.07168, "grad_norm": 0.296875, "learning_rate": 0.003, "loss": 2.73, "router_z_loss": 0.0522, "step": 1190 }, { "balancing_entropy": 1.0264, "balancing_loss": 1.1178, "epoch": 6.12288, "grad_norm": 0.37890625, "learning_rate": 0.003, "loss": 2.727, "router_z_loss": 0.0499, "step": 1200 }, { "balancing_entropy": 1.0858, "balancing_loss": 1.1043, "epoch": 6.17408, "grad_norm": 0.240234375, "learning_rate": 0.003, "loss": 2.7092, "router_z_loss": 0.0643, "step": 1210 }, { "balancing_entropy": 1.0403, "balancing_loss": 1.127, "epoch": 6.22528, "grad_norm": 0.265625, "learning_rate": 0.003, "loss": 2.706, "router_z_loss": 0.0392, "step": 1220 }, { "balancing_entropy": 1.0836, "balancing_loss": 1.1099, "epoch": 6.27648, "grad_norm": 0.330078125, "learning_rate": 0.003, "loss": 2.7024, "router_z_loss": 0.0519, "step": 1230 }, { "balancing_entropy": 1.0788, "balancing_loss": 1.1085, "epoch": 6.32768, "grad_norm": 0.291015625, "learning_rate": 0.003, "loss": 2.7044, "router_z_loss": 0.0326, "step": 1240 }, { "balancing_entropy": 1.0207, "balancing_loss": 1.1099, "epoch": 6.37888, "grad_norm": 0.384765625, "learning_rate": 0.003, "loss": 2.6874, "router_z_loss": 0.0592, "step": 1250 }, { "balancing_entropy": 1.0006, "balancing_loss": 1.1272, "epoch": 6.43008, "grad_norm": 0.296875, "learning_rate": 0.003, "loss": 2.7091, "router_z_loss": 0.1513, "step": 1260 }, { "balancing_entropy": 1.0775, "balancing_loss": 1.108, "epoch": 6.48128, "grad_norm": 0.28515625, "learning_rate": 0.003, "loss": 2.6821, "router_z_loss": 0.106, "step": 1270 }, { "balancing_entropy": 1.0368, "balancing_loss": 1.1091, "epoch": 6.53248, "grad_norm": 0.38671875, "learning_rate": 0.003, "loss": 2.6736, "router_z_loss": 0.0363, "step": 1280 }, { "balancing_entropy": 0.9919, "balancing_loss": 1.1228, "epoch": 6.58368, "grad_norm": 0.46484375, "learning_rate": 0.003, "loss": 2.6844, "router_z_loss": 0.0494, "step": 1290 }, { "balancing_entropy": 1.0121, "balancing_loss": 1.1238, "epoch": 6.63488, "grad_norm": 0.412109375, "learning_rate": 0.003, "loss": 2.675, "router_z_loss": 0.1156, "step": 1300 }, { "balancing_entropy": 1.0146, "balancing_loss": 1.0942, "epoch": 6.6860800000000005, "grad_norm": 0.330078125, "learning_rate": 0.003, "loss": 2.6669, "router_z_loss": 0.1085, "step": 1310 }, { "balancing_entropy": 1.051, "balancing_loss": 1.1207, "epoch": 6.73728, "grad_norm": 0.2412109375, "learning_rate": 0.003, "loss": 2.6719, "router_z_loss": 0.0844, "step": 1320 }, { "balancing_entropy": 1.0765, "balancing_loss": 1.1175, "epoch": 6.78848, "grad_norm": 0.267578125, "learning_rate": 0.003, "loss": 2.6575, "router_z_loss": 0.0487, "step": 1330 }, { "balancing_entropy": 1.0473, "balancing_loss": 1.1171, "epoch": 6.8396799999999995, "grad_norm": 0.37890625, "learning_rate": 0.003, "loss": 2.6567, "router_z_loss": 0.035, "step": 1340 }, { "balancing_entropy": 1.018, "balancing_loss": 1.1165, "epoch": 6.89088, "grad_norm": 0.30078125, "learning_rate": 0.003, "loss": 2.6607, "router_z_loss": 0.0385, "step": 1350 }, { "balancing_entropy": 1.0763, "balancing_loss": 1.1156, "epoch": 6.94208, "grad_norm": 0.271484375, "learning_rate": 0.003, "loss": 2.6576, "router_z_loss": 0.058, "step": 1360 }, { "balancing_entropy": 1.0217, "balancing_loss": 1.1241, "epoch": 6.99328, "grad_norm": 0.51953125, "learning_rate": 0.003, "loss": 2.6491, "router_z_loss": 0.0383, "step": 1370 }, { "balancing_entropy": 1.0177, "balancing_loss": 1.1123, "epoch": 7.04096, "grad_norm": 0.427734375, "learning_rate": 0.003, "loss": 2.643, "router_z_loss": 0.0347, "step": 1380 }, { "balancing_entropy": 1.0424, "balancing_loss": 1.1078, "epoch": 7.09216, "grad_norm": 0.310546875, "learning_rate": 0.003, "loss": 2.6393, "router_z_loss": 0.0356, "step": 1390 }, { "balancing_entropy": 1.0827, "balancing_loss": 1.1167, "epoch": 7.14336, "grad_norm": 0.396484375, "learning_rate": 0.003, "loss": 2.6262, "router_z_loss": 0.03, "step": 1400 }, { "balancing_entropy": 1.0365, "balancing_loss": 1.1101, "epoch": 7.19456, "grad_norm": 0.37890625, "learning_rate": 0.003, "loss": 2.6217, "router_z_loss": 0.0242, "step": 1410 }, { "balancing_entropy": 1.0052, "balancing_loss": 1.1091, "epoch": 7.24576, "grad_norm": 0.419921875, "learning_rate": 0.003, "loss": 2.6217, "router_z_loss": 0.0437, "step": 1420 }, { "balancing_entropy": 1.0175, "balancing_loss": 1.1232, "epoch": 7.29696, "grad_norm": 0.330078125, "learning_rate": 0.003, "loss": 2.6106, "router_z_loss": 0.0484, "step": 1430 }, { "balancing_entropy": 1.0869, "balancing_loss": 1.1058, "epoch": 7.34816, "grad_norm": 0.240234375, "learning_rate": 0.003, "loss": 2.6125, "router_z_loss": 0.0338, "step": 1440 }, { "balancing_entropy": 1.0047, "balancing_loss": 1.1259, "epoch": 7.39936, "grad_norm": 0.54296875, "learning_rate": 0.003, "loss": 2.621, "router_z_loss": 0.0265, "step": 1450 }, { "balancing_entropy": 1.028, "balancing_loss": 1.1028, "epoch": 7.45056, "grad_norm": 0.302734375, "learning_rate": 0.003, "loss": 2.6191, "router_z_loss": 0.0488, "step": 1460 }, { "balancing_entropy": 1.0321, "balancing_loss": 1.1041, "epoch": 7.50176, "grad_norm": 0.298828125, "learning_rate": 0.003, "loss": 2.606, "router_z_loss": 0.0444, "step": 1470 }, { "balancing_entropy": 1.019, "balancing_loss": 1.1233, "epoch": 7.55296, "grad_norm": 0.2431640625, "learning_rate": 0.003, "loss": 2.6033, "router_z_loss": 0.0494, "step": 1480 }, { "balancing_entropy": 1.0257, "balancing_loss": 1.1108, "epoch": 7.60416, "grad_norm": 0.34765625, "learning_rate": 0.003, "loss": 2.6137, "router_z_loss": 0.0487, "step": 1490 }, { "balancing_entropy": 1.0655, "balancing_loss": 1.1121, "epoch": 7.65536, "grad_norm": 0.333984375, "learning_rate": 0.003, "loss": 2.6068, "router_z_loss": 0.0404, "step": 1500 }, { "balancing_entropy": 1.0208, "balancing_loss": 1.1163, "epoch": 7.70656, "grad_norm": 0.64453125, "learning_rate": 0.003, "loss": 2.5948, "router_z_loss": 0.0314, "step": 1510 }, { "balancing_entropy": 1.0572, "balancing_loss": 1.1362, "epoch": 7.75776, "grad_norm": 0.396484375, "learning_rate": 0.003, "loss": 2.6933, "router_z_loss": 0.0492, "step": 1520 }, { "balancing_entropy": 1.0672, "balancing_loss": 1.1019, "epoch": 7.80896, "grad_norm": 0.28125, "learning_rate": 0.003, "loss": 2.6223, "router_z_loss": 0.084, "step": 1530 }, { "balancing_entropy": 1.0573, "balancing_loss": 1.113, "epoch": 7.8601600000000005, "grad_norm": 0.4296875, "learning_rate": 0.003, "loss": 2.594, "router_z_loss": 0.0642, "step": 1540 }, { "balancing_entropy": 1.0319, "balancing_loss": 1.1006, "epoch": 7.91136, "grad_norm": 0.29296875, "learning_rate": 0.003, "loss": 2.5974, "router_z_loss": 0.0273, "step": 1550 }, { "balancing_entropy": 1.0552, "balancing_loss": 1.1065, "epoch": 7.96256, "grad_norm": 0.466796875, "learning_rate": 0.003, "loss": 2.588, "router_z_loss": 0.0336, "step": 1560 }, { "balancing_entropy": 0.9985, "balancing_loss": 1.1163, "epoch": 8.01024, "grad_norm": 0.255859375, "learning_rate": 0.003, "loss": 2.5919, "router_z_loss": 0.0381, "step": 1570 }, { "balancing_entropy": 1.0203, "balancing_loss": 1.1204, "epoch": 8.06144, "grad_norm": 0.41796875, "learning_rate": 0.003, "loss": 2.5741, "router_z_loss": 0.0349, "step": 1580 }, { "balancing_entropy": 1.0091, "balancing_loss": 1.1065, "epoch": 8.11264, "grad_norm": 0.37890625, "learning_rate": 0.003, "loss": 2.5686, "router_z_loss": 0.0629, "step": 1590 }, { "balancing_entropy": 1.0637, "balancing_loss": 1.1064, "epoch": 8.16384, "grad_norm": 0.4140625, "learning_rate": 0.003, "loss": 2.6053, "router_z_loss": 0.0668, "step": 1600 }, { "balancing_entropy": 1.0708, "balancing_loss": 1.1157, "epoch": 8.21504, "grad_norm": 0.34765625, "learning_rate": 0.003, "loss": 2.6375, "router_z_loss": 0.0948, "step": 1610 }, { "balancing_entropy": 1.0865, "balancing_loss": 1.1038, "epoch": 8.26624, "grad_norm": 0.2470703125, "learning_rate": 0.003, "loss": 2.571, "router_z_loss": 0.0649, "step": 1620 }, { "balancing_entropy": 0.9924, "balancing_loss": 1.1054, "epoch": 8.31744, "grad_norm": 0.38671875, "learning_rate": 0.003, "loss": 2.568, "router_z_loss": 0.0954, "step": 1630 }, { "balancing_entropy": 1.0115, "balancing_loss": 1.1369, "epoch": 8.36864, "grad_norm": 0.294921875, "learning_rate": 0.003, "loss": 2.5658, "router_z_loss": 0.1433, "step": 1640 }, { "balancing_entropy": 1.0557, "balancing_loss": 1.1104, "epoch": 8.41984, "grad_norm": 0.408203125, "learning_rate": 0.003, "loss": 2.555, "router_z_loss": 0.0909, "step": 1650 }, { "balancing_entropy": 1.0746, "balancing_loss": 1.1058, "epoch": 8.47104, "grad_norm": 0.279296875, "learning_rate": 0.003, "loss": 2.5576, "router_z_loss": 0.0468, "step": 1660 }, { "balancing_entropy": 1.0082, "balancing_loss": 1.1245, "epoch": 8.52224, "grad_norm": 0.38671875, "learning_rate": 0.003, "loss": 2.5513, "router_z_loss": 0.0396, "step": 1670 }, { "balancing_entropy": 1.0213, "balancing_loss": 1.1082, "epoch": 8.57344, "grad_norm": 0.357421875, "learning_rate": 0.003, "loss": 2.5526, "router_z_loss": 0.0496, "step": 1680 }, { "balancing_entropy": 1.0084, "balancing_loss": 1.1091, "epoch": 8.62464, "grad_norm": 0.361328125, "learning_rate": 0.003, "loss": 2.5538, "router_z_loss": 0.0603, "step": 1690 }, { "balancing_entropy": 1.0497, "balancing_loss": 1.1201, "epoch": 8.67584, "grad_norm": 0.37890625, "learning_rate": 0.003, "loss": 2.5532, "router_z_loss": 0.0448, "step": 1700 }, { "balancing_entropy": 1.0661, "balancing_loss": 1.1298, "epoch": 8.72704, "grad_norm": 0.33203125, "learning_rate": 0.003, "loss": 2.5535, "router_z_loss": 0.029, "step": 1710 }, { "balancing_entropy": 1.0572, "balancing_loss": 1.1157, "epoch": 8.77824, "grad_norm": 0.400390625, "learning_rate": 0.003, "loss": 2.5401, "router_z_loss": 0.028, "step": 1720 }, { "balancing_entropy": 1.0082, "balancing_loss": 1.1206, "epoch": 8.82944, "grad_norm": 0.5625, "learning_rate": 0.003, "loss": 2.5493, "router_z_loss": 0.0464, "step": 1730 }, { "balancing_entropy": 0.9829, "balancing_loss": 1.1311, "epoch": 8.88064, "grad_norm": 0.55859375, "learning_rate": 0.003, "loss": 2.5463, "router_z_loss": 0.0731, "step": 1740 }, { "balancing_entropy": 0.9818, "balancing_loss": 1.0975, "epoch": 8.93184, "grad_norm": 0.40234375, "learning_rate": 0.003, "loss": 2.5466, "router_z_loss": 0.0922, "step": 1750 }, { "balancing_entropy": 0.9662, "balancing_loss": 1.1181, "epoch": 8.98304, "grad_norm": 0.53515625, "learning_rate": 0.003, "loss": 2.5468, "router_z_loss": 0.1385, "step": 1760 }, { "balancing_entropy": 0.9867, "balancing_loss": 1.1122, "epoch": 9.03072, "grad_norm": 0.328125, "learning_rate": 0.003, "loss": 2.535, "router_z_loss": 0.1179, "step": 1770 }, { "balancing_entropy": 1.0826, "balancing_loss": 1.1173, "epoch": 9.08192, "grad_norm": 0.244140625, "learning_rate": 0.003, "loss": 2.5266, "router_z_loss": 0.0579, "step": 1780 }, { "balancing_entropy": 1.0822, "balancing_loss": 1.1131, "epoch": 9.13312, "grad_norm": 0.419921875, "learning_rate": 0.003, "loss": 2.5131, "router_z_loss": 0.0238, "step": 1790 }, { "balancing_entropy": 1.0277, "balancing_loss": 1.1195, "epoch": 9.18432, "grad_norm": 0.43359375, "learning_rate": 0.003, "loss": 2.5199, "router_z_loss": 0.0258, "step": 1800 }, { "balancing_entropy": 1.0267, "balancing_loss": 1.1139, "epoch": 9.23552, "grad_norm": 0.369140625, "learning_rate": 0.003, "loss": 2.5239, "router_z_loss": 0.0403, "step": 1810 }, { "balancing_entropy": 1.0592, "balancing_loss": 1.1117, "epoch": 9.28672, "grad_norm": 0.2470703125, "learning_rate": 0.003, "loss": 2.5115, "router_z_loss": 0.0464, "step": 1820 }, { "balancing_entropy": 1.0239, "balancing_loss": 1.1188, "epoch": 9.33792, "grad_norm": 0.451171875, "learning_rate": 0.003, "loss": 2.5205, "router_z_loss": 0.0388, "step": 1830 }, { "balancing_entropy": 1.0223, "balancing_loss": 1.1197, "epoch": 9.38912, "grad_norm": 0.263671875, "learning_rate": 0.003, "loss": 2.5123, "router_z_loss": 0.0429, "step": 1840 }, { "balancing_entropy": 1.019, "balancing_loss": 1.1136, "epoch": 9.44032, "grad_norm": 0.443359375, "learning_rate": 0.003, "loss": 2.516, "router_z_loss": 0.0368, "step": 1850 }, { "balancing_entropy": 1.0178, "balancing_loss": 1.1196, "epoch": 9.49152, "grad_norm": 0.35546875, "learning_rate": 0.003, "loss": 2.5151, "router_z_loss": 0.0431, "step": 1860 }, { "balancing_entropy": 1.0814, "balancing_loss": 1.1081, "epoch": 9.54272, "grad_norm": 0.30078125, "learning_rate": 0.003, "loss": 2.5211, "router_z_loss": 0.0501, "step": 1870 }, { "balancing_entropy": 0.9928, "balancing_loss": 1.1233, "epoch": 9.59392, "grad_norm": 0.69140625, "learning_rate": 0.003, "loss": 2.5209, "router_z_loss": 0.0337, "step": 1880 }, { "balancing_entropy": 1.0207, "balancing_loss": 1.1074, "epoch": 9.64512, "grad_norm": 0.3671875, "learning_rate": 0.003, "loss": 2.5146, "router_z_loss": 0.0517, "step": 1890 }, { "balancing_entropy": 1.0687, "balancing_loss": 1.1196, "epoch": 9.69632, "grad_norm": 0.416015625, "learning_rate": 0.003, "loss": 2.5184, "router_z_loss": 0.0367, "step": 1900 }, { "balancing_entropy": 1.0487, "balancing_loss": 1.1062, "epoch": 9.74752, "grad_norm": 0.24609375, "learning_rate": 0.003, "loss": 2.503, "router_z_loss": 0.0273, "step": 1910 }, { "balancing_entropy": 0.9857, "balancing_loss": 1.1337, "epoch": 9.79872, "grad_norm": 0.67578125, "learning_rate": 0.003, "loss": 2.5109, "router_z_loss": 0.0492, "step": 1920 }, { "balancing_entropy": 0.9915, "balancing_loss": 1.1136, "epoch": 9.849920000000001, "grad_norm": 0.70703125, "learning_rate": 0.003, "loss": 2.5021, "router_z_loss": 0.0534, "step": 1930 }, { "balancing_entropy": 1.0633, "balancing_loss": 1.1074, "epoch": 9.90112, "grad_norm": 0.376953125, "learning_rate": 0.003, "loss": 2.4996, "router_z_loss": 0.0403, "step": 1940 }, { "balancing_entropy": 1.0538, "balancing_loss": 1.1198, "epoch": 9.95232, "grad_norm": 0.61328125, "learning_rate": 0.003, "loss": 2.5085, "router_z_loss": 0.0385, "step": 1950 }, { "balancing_entropy": 0.9821, "balancing_loss": 1.1029, "epoch": 10.0, "grad_norm": 0.451171875, "learning_rate": 0.003, "loss": 2.5148, "router_z_loss": 0.0379, "step": 1960 }, { "balancing_entropy": 1.0062, "balancing_loss": 1.1191, "epoch": 10.0512, "grad_norm": 0.41015625, "learning_rate": 0.003, "loss": 2.4998, "router_z_loss": 0.0559, "step": 1970 }, { "balancing_entropy": 1.0499, "balancing_loss": 1.1164, "epoch": 10.1024, "grad_norm": 0.41015625, "learning_rate": 0.003, "loss": 2.4899, "router_z_loss": 0.0644, "step": 1980 }, { "balancing_entropy": 1.0214, "balancing_loss": 1.1198, "epoch": 10.1536, "grad_norm": 0.376953125, "learning_rate": 0.003, "loss": 2.4876, "router_z_loss": 0.0488, "step": 1990 }, { "balancing_entropy": 1.0141, "balancing_loss": 1.1119, "epoch": 10.2048, "grad_norm": 0.376953125, "learning_rate": 0.003, "loss": 2.4804, "router_z_loss": 0.0389, "step": 2000 }, { "balancing_entropy": 1.0504, "balancing_loss": 1.1147, "epoch": 10.256, "grad_norm": 0.369140625, "learning_rate": 0.003, "loss": 2.4727, "router_z_loss": 0.0339, "step": 2010 }, { "balancing_entropy": 1.0434, "balancing_loss": 1.1201, "epoch": 10.3072, "grad_norm": 0.259765625, "learning_rate": 0.003, "loss": 2.4821, "router_z_loss": 0.0339, "step": 2020 }, { "balancing_entropy": 1.0804, "balancing_loss": 1.1231, "epoch": 10.3584, "grad_norm": 0.482421875, "learning_rate": 0.003, "loss": 2.4744, "router_z_loss": 0.0293, "step": 2030 }, { "balancing_entropy": 1.0201, "balancing_loss": 1.1236, "epoch": 10.4096, "grad_norm": 0.462890625, "learning_rate": 0.003, "loss": 2.4822, "router_z_loss": 0.0252, "step": 2040 }, { "balancing_entropy": 1.0087, "balancing_loss": 1.1096, "epoch": 10.4608, "grad_norm": 0.60546875, "learning_rate": 0.003, "loss": 2.4801, "router_z_loss": 0.0467, "step": 2050 }, { "balancing_entropy": 1.0379, "balancing_loss": 1.1063, "epoch": 10.512, "grad_norm": 0.271484375, "learning_rate": 0.003, "loss": 2.4788, "router_z_loss": 0.0539, "step": 2060 }, { "balancing_entropy": 1.0472, "balancing_loss": 1.1284, "epoch": 10.5632, "grad_norm": 0.58203125, "learning_rate": 0.003, "loss": 2.4724, "router_z_loss": 0.0393, "step": 2070 }, { "balancing_entropy": 1.0403, "balancing_loss": 1.1089, "epoch": 10.6144, "grad_norm": 0.388671875, "learning_rate": 0.003, "loss": 2.4766, "router_z_loss": 0.037, "step": 2080 }, { "balancing_entropy": 1.0502, "balancing_loss": 1.1247, "epoch": 10.6656, "grad_norm": 0.30078125, "learning_rate": 0.003, "loss": 2.4805, "router_z_loss": 0.0467, "step": 2090 }, { "balancing_entropy": 1.0292, "balancing_loss": 1.1186, "epoch": 10.7168, "grad_norm": 0.28515625, "learning_rate": 0.003, "loss": 2.4705, "router_z_loss": 0.0413, "step": 2100 }, { "balancing_entropy": 1.0256, "balancing_loss": 1.1288, "epoch": 10.768, "grad_norm": 0.451171875, "learning_rate": 0.003, "loss": 2.4778, "router_z_loss": 0.0372, "step": 2110 }, { "balancing_entropy": 0.9658, "balancing_loss": 1.1134, "epoch": 10.8192, "grad_norm": 0.61328125, "learning_rate": 0.003, "loss": 2.4722, "router_z_loss": 0.0691, "step": 2120 }, { "balancing_entropy": 1.0158, "balancing_loss": 1.1165, "epoch": 10.8704, "grad_norm": 0.353515625, "learning_rate": 0.003, "loss": 2.4797, "router_z_loss": 0.1036, "step": 2130 }, { "balancing_entropy": 1.0527, "balancing_loss": 1.1179, "epoch": 10.9216, "grad_norm": 0.298828125, "learning_rate": 0.003, "loss": 2.4655, "router_z_loss": 0.063, "step": 2140 }, { "balancing_entropy": 0.9936, "balancing_loss": 1.1211, "epoch": 10.9728, "grad_norm": 0.466796875, "learning_rate": 0.003, "loss": 2.472, "router_z_loss": 0.0412, "step": 2150 }, { "balancing_entropy": 1.0006, "balancing_loss": 1.1217, "epoch": 11.02048, "grad_norm": 0.28515625, "learning_rate": 0.003, "loss": 2.4673, "router_z_loss": 0.0796, "step": 2160 }, { "balancing_entropy": 1.0244, "balancing_loss": 1.1241, "epoch": 11.07168, "grad_norm": 0.62109375, "learning_rate": 0.003, "loss": 2.451, "router_z_loss": 0.0559, "step": 2170 }, { "balancing_entropy": 1.0295, "balancing_loss": 1.1085, "epoch": 11.12288, "grad_norm": 0.251953125, "learning_rate": 0.003, "loss": 2.4513, "router_z_loss": 0.037, "step": 2180 }, { "balancing_entropy": 1.0277, "balancing_loss": 1.1275, "epoch": 11.17408, "grad_norm": 0.474609375, "learning_rate": 0.003, "loss": 2.4505, "router_z_loss": 0.0443, "step": 2190 }, { "balancing_entropy": 1.0403, "balancing_loss": 1.1076, "epoch": 11.22528, "grad_norm": 0.41796875, "learning_rate": 0.003, "loss": 2.4475, "router_z_loss": 0.0465, "step": 2200 }, { "balancing_entropy": 1.0119, "balancing_loss": 1.136, "epoch": 11.27648, "grad_norm": 0.48046875, "learning_rate": 0.003, "loss": 2.4474, "router_z_loss": 0.045, "step": 2210 }, { "balancing_entropy": 1.0212, "balancing_loss": 1.1097, "epoch": 11.32768, "grad_norm": 0.341796875, "learning_rate": 0.003, "loss": 2.4514, "router_z_loss": 0.0385, "step": 2220 }, { "balancing_entropy": 1.0304, "balancing_loss": 1.1152, "epoch": 11.37888, "grad_norm": 0.439453125, "learning_rate": 0.003, "loss": 2.4514, "router_z_loss": 0.0473, "step": 2230 }, { "balancing_entropy": 0.9808, "balancing_loss": 1.1144, "epoch": 11.43008, "grad_norm": 0.40625, "learning_rate": 0.003, "loss": 2.4499, "router_z_loss": 0.0555, "step": 2240 }, { "balancing_entropy": 0.9706, "balancing_loss": 1.1172, "epoch": 11.48128, "grad_norm": 0.48828125, "learning_rate": 0.003, "loss": 2.4532, "router_z_loss": 0.091, "step": 2250 }, { "balancing_entropy": 1.0049, "balancing_loss": 1.1161, "epoch": 11.53248, "grad_norm": 0.6328125, "learning_rate": 0.003, "loss": 2.4548, "router_z_loss": 0.0768, "step": 2260 }, { "balancing_entropy": 0.9899, "balancing_loss": 1.1088, "epoch": 11.58368, "grad_norm": 0.447265625, "learning_rate": 0.003, "loss": 2.4523, "router_z_loss": 0.0716, "step": 2270 }, { "balancing_entropy": 1.0056, "balancing_loss": 1.1271, "epoch": 11.63488, "grad_norm": 0.65234375, "learning_rate": 0.003, "loss": 2.4482, "router_z_loss": 0.0687, "step": 2280 }, { "balancing_entropy": 1.0395, "balancing_loss": 1.0932, "epoch": 11.68608, "grad_norm": 0.275390625, "learning_rate": 0.003, "loss": 2.4506, "router_z_loss": 0.0497, "step": 2290 }, { "balancing_entropy": 1.0304, "balancing_loss": 1.1269, "epoch": 11.73728, "grad_norm": 0.38671875, "learning_rate": 0.003, "loss": 2.4434, "router_z_loss": 0.0444, "step": 2300 }, { "balancing_entropy": 1.0463, "balancing_loss": 1.1166, "epoch": 11.78848, "grad_norm": 0.27734375, "learning_rate": 0.003, "loss": 2.4431, "router_z_loss": 0.0363, "step": 2310 }, { "balancing_entropy": 1.0447, "balancing_loss": 1.1075, "epoch": 11.83968, "grad_norm": 0.25390625, "learning_rate": 0.003, "loss": 2.4445, "router_z_loss": 0.0276, "step": 2320 }, { "balancing_entropy": 1.0158, "balancing_loss": 1.1308, "epoch": 11.89088, "grad_norm": 0.6875, "learning_rate": 0.003, "loss": 2.4363, "router_z_loss": 0.0328, "step": 2330 }, { "balancing_entropy": 1.015, "balancing_loss": 1.1161, "epoch": 11.94208, "grad_norm": 0.3203125, "learning_rate": 0.003, "loss": 2.4422, "router_z_loss": 0.036, "step": 2340 }, { "balancing_entropy": 1.0664, "balancing_loss": 1.1223, "epoch": 11.99328, "grad_norm": 0.259765625, "learning_rate": 0.003, "loss": 2.4426, "router_z_loss": 0.0341, "step": 2350 }, { "balancing_entropy": 0.944, "balancing_loss": 1.1002, "epoch": 12.04096, "grad_norm": 0.30859375, "learning_rate": 0.003, "loss": 2.4367, "router_z_loss": 0.0372, "step": 2360 }, { "balancing_entropy": 1.0224, "balancing_loss": 1.1204, "epoch": 12.09216, "grad_norm": 0.341796875, "learning_rate": 0.003, "loss": 2.4344, "router_z_loss": 0.0938, "step": 2370 }, { "balancing_entropy": 1.0214, "balancing_loss": 1.1327, "epoch": 12.14336, "grad_norm": 0.515625, "learning_rate": 0.003, "loss": 2.4187, "router_z_loss": 0.0592, "step": 2380 }, { "balancing_entropy": 1.0196, "balancing_loss": 1.1121, "epoch": 12.19456, "grad_norm": 0.59765625, "learning_rate": 0.003, "loss": 2.4272, "router_z_loss": 0.0354, "step": 2390 }, { "balancing_entropy": 1.0091, "balancing_loss": 1.1254, "epoch": 12.24576, "grad_norm": 0.470703125, "learning_rate": 0.003, "loss": 2.4314, "router_z_loss": 0.0379, "step": 2400 }, { "balancing_entropy": 0.992, "balancing_loss": 1.1081, "epoch": 12.29696, "grad_norm": 0.5703125, "learning_rate": 0.003, "loss": 2.4272, "router_z_loss": 0.0551, "step": 2410 }, { "balancing_entropy": 0.9963, "balancing_loss": 1.1102, "epoch": 12.34816, "grad_norm": 0.451171875, "learning_rate": 0.003, "loss": 2.4226, "router_z_loss": 0.08, "step": 2420 }, { "balancing_entropy": 0.99, "balancing_loss": 1.143, "epoch": 12.39936, "grad_norm": 0.357421875, "learning_rate": 0.003, "loss": 2.4212, "router_z_loss": 0.0813, "step": 2430 }, { "balancing_entropy": 1.0642, "balancing_loss": 1.1199, "epoch": 12.45056, "grad_norm": 0.359375, "learning_rate": 0.003, "loss": 2.4275, "router_z_loss": 0.0756, "step": 2440 }, { "balancing_entropy": 1.0786, "balancing_loss": 1.1085, "epoch": 12.50176, "grad_norm": 0.3046875, "learning_rate": 0.003, "loss": 2.4182, "router_z_loss": 0.0467, "step": 2450 }, { "balancing_entropy": 1.0734, "balancing_loss": 1.1245, "epoch": 12.55296, "grad_norm": 0.291015625, "learning_rate": 0.003, "loss": 2.4249, "router_z_loss": 0.03, "step": 2460 }, { "balancing_entropy": 1.0276, "balancing_loss": 1.1172, "epoch": 12.60416, "grad_norm": 0.41015625, "learning_rate": 0.003, "loss": 2.425, "router_z_loss": 0.0253, "step": 2470 }, { "balancing_entropy": 1.003, "balancing_loss": 1.1415, "epoch": 12.65536, "grad_norm": 0.67578125, "learning_rate": 0.003, "loss": 2.4115, "router_z_loss": 0.0395, "step": 2480 }, { "balancing_entropy": 0.9809, "balancing_loss": 1.1129, "epoch": 12.70656, "grad_norm": 0.6640625, "learning_rate": 0.003, "loss": 2.4177, "router_z_loss": 0.0565, "step": 2490 }, { "balancing_entropy": 0.9666, "balancing_loss": 1.1129, "epoch": 12.75776, "grad_norm": 0.458984375, "learning_rate": 0.003, "loss": 2.4214, "router_z_loss": 0.0859, "step": 2500 }, { "balancing_entropy": 0.9593, "balancing_loss": 1.1282, "epoch": 12.80896, "grad_norm": 0.416015625, "learning_rate": 0.003, "loss": 2.4237, "router_z_loss": 0.0815, "step": 2510 }, { "balancing_entropy": 1.0344, "balancing_loss": 1.1142, "epoch": 12.86016, "grad_norm": 0.45703125, "learning_rate": 0.003, "loss": 2.4229, "router_z_loss": 0.0826, "step": 2520 }, { "balancing_entropy": 1.0866, "balancing_loss": 1.118, "epoch": 12.91136, "grad_norm": 0.296875, "learning_rate": 0.003, "loss": 2.4288, "router_z_loss": 0.0598, "step": 2530 }, { "balancing_entropy": 0.9846, "balancing_loss": 1.13, "epoch": 12.96256, "grad_norm": 0.6953125, "learning_rate": 0.003, "loss": 2.4165, "router_z_loss": 0.0325, "step": 2540 }, { "balancing_entropy": 0.9752, "balancing_loss": 1.1213, "epoch": 13.01024, "grad_norm": 0.455078125, "learning_rate": 0.003, "loss": 2.4166, "router_z_loss": 0.0626, "step": 2550 }, { "balancing_entropy": 0.9882, "balancing_loss": 1.1267, "epoch": 13.06144, "grad_norm": 0.42578125, "learning_rate": 0.003, "loss": 2.4076, "router_z_loss": 0.082, "step": 2560 }, { "balancing_entropy": 1.0058, "balancing_loss": 1.1276, "epoch": 13.11264, "grad_norm": 0.337890625, "learning_rate": 0.003, "loss": 2.4044, "router_z_loss": 0.0598, "step": 2570 }, { "balancing_entropy": 1.0118, "balancing_loss": 1.1163, "epoch": 13.16384, "grad_norm": 0.341796875, "learning_rate": 0.003, "loss": 2.404, "router_z_loss": 0.0412, "step": 2580 }, { "balancing_entropy": 1.0178, "balancing_loss": 1.1228, "epoch": 13.21504, "grad_norm": 0.328125, "learning_rate": 0.003, "loss": 2.3999, "router_z_loss": 0.0427, "step": 2590 }, { "balancing_entropy": 1.05, "balancing_loss": 1.1239, "epoch": 13.26624, "grad_norm": 0.47265625, "learning_rate": 0.003, "loss": 2.3926, "router_z_loss": 0.0324, "step": 2600 }, { "balancing_entropy": 1.011, "balancing_loss": 1.118, "epoch": 13.31744, "grad_norm": 0.40234375, "learning_rate": 0.003, "loss": 2.4006, "router_z_loss": 0.0336, "step": 2610 }, { "balancing_entropy": 1.0196, "balancing_loss": 1.1216, "epoch": 13.36864, "grad_norm": 0.40625, "learning_rate": 0.003, "loss": 2.3974, "router_z_loss": 0.0571, "step": 2620 }, { "balancing_entropy": 1.0709, "balancing_loss": 1.1224, "epoch": 13.41984, "grad_norm": 0.265625, "learning_rate": 0.003, "loss": 2.4011, "router_z_loss": 0.042, "step": 2630 }, { "balancing_entropy": 1.0066, "balancing_loss": 1.1253, "epoch": 13.47104, "grad_norm": 0.734375, "learning_rate": 0.003, "loss": 2.4045, "router_z_loss": 0.0282, "step": 2640 }, { "balancing_entropy": 0.9824, "balancing_loss": 1.1105, "epoch": 13.52224, "grad_norm": 0.71875, "learning_rate": 0.003, "loss": 2.4038, "router_z_loss": 0.051, "step": 2650 }, { "balancing_entropy": 0.9804, "balancing_loss": 1.1256, "epoch": 13.57344, "grad_norm": 0.35546875, "learning_rate": 0.003, "loss": 2.4069, "router_z_loss": 0.0928, "step": 2660 }, { "balancing_entropy": 1.0275, "balancing_loss": 1.1105, "epoch": 13.62464, "grad_norm": 0.38671875, "learning_rate": 0.003, "loss": 2.3963, "router_z_loss": 0.0814, "step": 2670 }, { "balancing_entropy": 1.064, "balancing_loss": 1.1226, "epoch": 13.67584, "grad_norm": 0.38671875, "learning_rate": 0.003, "loss": 2.4008, "router_z_loss": 0.0438, "step": 2680 }, { "balancing_entropy": 1.0209, "balancing_loss": 1.1104, "epoch": 13.72704, "grad_norm": 0.259765625, "learning_rate": 0.003, "loss": 2.4065, "router_z_loss": 0.0316, "step": 2690 }, { "balancing_entropy": 1.0391, "balancing_loss": 1.1213, "epoch": 13.77824, "grad_norm": 0.34765625, "learning_rate": 0.003, "loss": 2.3987, "router_z_loss": 0.0457, "step": 2700 }, { "balancing_entropy": 1.0793, "balancing_loss": 1.1361, "epoch": 13.82944, "grad_norm": 0.279296875, "learning_rate": 0.003, "loss": 2.4013, "router_z_loss": 0.0471, "step": 2710 }, { "balancing_entropy": 1.047, "balancing_loss": 1.1196, "epoch": 13.88064, "grad_norm": 0.38671875, "learning_rate": 0.003, "loss": 2.3992, "router_z_loss": 0.0285, "step": 2720 }, { "balancing_entropy": 1.019, "balancing_loss": 1.1264, "epoch": 13.93184, "grad_norm": 0.41015625, "learning_rate": 0.003, "loss": 2.3928, "router_z_loss": 0.0323, "step": 2730 }, { "balancing_entropy": 0.9814, "balancing_loss": 1.1301, "epoch": 13.98304, "grad_norm": 0.72265625, "learning_rate": 0.003, "loss": 2.3967, "router_z_loss": 0.0577, "step": 2740 }, { "balancing_entropy": 0.9678, "balancing_loss": 1.11, "epoch": 14.03072, "grad_norm": 0.47265625, "learning_rate": 0.003, "loss": 2.3944, "router_z_loss": 0.0776, "step": 2750 }, { "balancing_entropy": 0.9596, "balancing_loss": 1.1404, "epoch": 14.08192, "grad_norm": 0.4140625, "learning_rate": 0.003, "loss": 2.3871, "router_z_loss": 0.0686, "step": 2760 }, { "balancing_entropy": 0.9881, "balancing_loss": 1.1024, "epoch": 14.13312, "grad_norm": 0.318359375, "learning_rate": 0.003, "loss": 2.3799, "router_z_loss": 0.0882, "step": 2770 }, { "balancing_entropy": 1.0414, "balancing_loss": 1.1325, "epoch": 14.18432, "grad_norm": 0.2890625, "learning_rate": 0.003, "loss": 2.38, "router_z_loss": 0.0758, "step": 2780 }, { "balancing_entropy": 1.0355, "balancing_loss": 1.1196, "epoch": 14.23552, "grad_norm": 0.2578125, "learning_rate": 0.003, "loss": 2.3779, "router_z_loss": 0.0412, "step": 2790 }, { "balancing_entropy": 0.9692, "balancing_loss": 1.1301, "epoch": 14.28672, "grad_norm": 0.6484375, "learning_rate": 0.003, "loss": 2.3772, "router_z_loss": 0.0479, "step": 2800 }, { "balancing_entropy": 0.998, "balancing_loss": 1.102, "epoch": 14.33792, "grad_norm": 0.412109375, "learning_rate": 0.003, "loss": 2.3862, "router_z_loss": 0.0857, "step": 2810 }, { "balancing_entropy": 0.949, "balancing_loss": 1.1283, "epoch": 14.38912, "grad_norm": 0.490234375, "learning_rate": 0.003, "loss": 2.3829, "router_z_loss": 0.0815, "step": 2820 }, { "balancing_entropy": 0.9766, "balancing_loss": 1.1072, "epoch": 14.44032, "grad_norm": 0.39453125, "learning_rate": 0.003, "loss": 2.3862, "router_z_loss": 0.0777, "step": 2830 }, { "balancing_entropy": 0.9713, "balancing_loss": 1.1353, "epoch": 14.49152, "grad_norm": 0.423828125, "learning_rate": 0.003, "loss": 2.3861, "router_z_loss": 0.1315, "step": 2840 }, { "balancing_entropy": 1.0357, "balancing_loss": 1.1127, "epoch": 14.54272, "grad_norm": 0.384765625, "learning_rate": 0.003, "loss": 2.3811, "router_z_loss": 0.069, "step": 2850 }, { "balancing_entropy": 1.0359, "balancing_loss": 1.126, "epoch": 14.59392, "grad_norm": 0.5546875, "learning_rate": 0.003, "loss": 2.3896, "router_z_loss": 0.0412, "step": 2860 }, { "balancing_entropy": 0.9815, "balancing_loss": 1.1256, "epoch": 14.64512, "grad_norm": 0.6953125, "learning_rate": 0.003, "loss": 2.3858, "router_z_loss": 0.0503, "step": 2870 }, { "balancing_entropy": 0.9612, "balancing_loss": 1.1326, "epoch": 14.69632, "grad_norm": 0.494140625, "learning_rate": 0.003, "loss": 2.3799, "router_z_loss": 0.1111, "step": 2880 }, { "balancing_entropy": 0.9821, "balancing_loss": 1.106, "epoch": 14.74752, "grad_norm": 0.333984375, "learning_rate": 0.003, "loss": 2.387, "router_z_loss": 0.0991, "step": 2890 }, { "balancing_entropy": 1.0261, "balancing_loss": 1.1278, "epoch": 14.79872, "grad_norm": 0.345703125, "learning_rate": 0.003, "loss": 2.3844, "router_z_loss": 0.0964, "step": 2900 }, { "balancing_entropy": 1.0827, "balancing_loss": 1.1216, "epoch": 14.849920000000001, "grad_norm": 0.263671875, "learning_rate": 0.003, "loss": 2.3813, "router_z_loss": 0.0442, "step": 2910 }, { "balancing_entropy": 1.0436, "balancing_loss": 1.1264, "epoch": 14.90112, "grad_norm": 0.45703125, "learning_rate": 0.003, "loss": 2.3793, "router_z_loss": 0.0359, "step": 2920 }, { "balancing_entropy": 1.0291, "balancing_loss": 1.1204, "epoch": 14.95232, "grad_norm": 0.33203125, "learning_rate": 0.003, "loss": 2.387, "router_z_loss": 0.0347, "step": 2930 }, { "balancing_entropy": 1.039, "balancing_loss": 1.1301, "epoch": 15.0, "grad_norm": 0.4296875, "learning_rate": 0.003, "loss": 2.3943, "router_z_loss": 0.0519, "step": 2940 }, { "balancing_entropy": 1.0275, "balancing_loss": 1.1044, "epoch": 15.0512, "grad_norm": 0.341796875, "learning_rate": 0.003, "loss": 2.3809, "router_z_loss": 0.0406, "step": 2950 }, { "balancing_entropy": 1.0025, "balancing_loss": 1.124, "epoch": 15.1024, "grad_norm": 0.4609375, "learning_rate": 0.003, "loss": 2.3748, "router_z_loss": 0.0633, "step": 2960 }, { "balancing_entropy": 1.021, "balancing_loss": 1.1146, "epoch": 15.1536, "grad_norm": 0.498046875, "learning_rate": 0.003, "loss": 2.3658, "router_z_loss": 0.0651, "step": 2970 }, { "balancing_entropy": 0.979, "balancing_loss": 1.1244, "epoch": 15.2048, "grad_norm": 0.439453125, "learning_rate": 0.003, "loss": 2.3574, "router_z_loss": 0.0579, "step": 2980 }, { "balancing_entropy": 1.0096, "balancing_loss": 1.1257, "epoch": 15.256, "grad_norm": 0.2734375, "learning_rate": 0.003, "loss": 2.3704, "router_z_loss": 0.0645, "step": 2990 }, { "balancing_entropy": 1.0429, "balancing_loss": 1.1309, "epoch": 15.3072, "grad_norm": 0.41015625, "learning_rate": 0.003, "loss": 2.3594, "router_z_loss": 0.0378, "step": 3000 }, { "balancing_entropy": 1.0138, "balancing_loss": 1.1322, "epoch": 15.3584, "grad_norm": 0.4453125, "learning_rate": 0.003, "loss": 2.3669, "router_z_loss": 0.0305, "step": 3010 }, { "balancing_entropy": 1.0301, "balancing_loss": 1.1319, "epoch": 15.4096, "grad_norm": 0.28515625, "learning_rate": 0.003, "loss": 2.3596, "router_z_loss": 0.0437, "step": 3020 }, { "balancing_entropy": 1.0507, "balancing_loss": 1.1013, "epoch": 15.4608, "grad_norm": 0.43359375, "learning_rate": 0.003, "loss": 2.3651, "router_z_loss": 0.0399, "step": 3030 }, { "balancing_entropy": 0.9875, "balancing_loss": 1.1303, "epoch": 15.512, "grad_norm": 0.36328125, "learning_rate": 0.003, "loss": 2.3655, "router_z_loss": 0.0457, "step": 3040 }, { "balancing_entropy": 1.0375, "balancing_loss": 1.1243, "epoch": 15.5632, "grad_norm": 0.466796875, "learning_rate": 0.003, "loss": 2.3694, "router_z_loss": 0.0559, "step": 3050 }, { "balancing_entropy": 0.9945, "balancing_loss": 1.1211, "epoch": 15.6144, "grad_norm": 0.4375, "learning_rate": 0.003, "loss": 2.3678, "router_z_loss": 0.05, "step": 3060 }, { "balancing_entropy": 1.0451, "balancing_loss": 1.1335, "epoch": 15.6656, "grad_norm": 0.376953125, "learning_rate": 0.003, "loss": 2.3664, "router_z_loss": 0.0664, "step": 3070 }, { "balancing_entropy": 1.0456, "balancing_loss": 1.1062, "epoch": 15.7168, "grad_norm": 0.29296875, "learning_rate": 0.003, "loss": 2.3696, "router_z_loss": 0.0416, "step": 3080 }, { "balancing_entropy": 0.9843, "balancing_loss": 1.1241, "epoch": 15.768, "grad_norm": 0.404296875, "learning_rate": 0.003, "loss": 2.3568, "router_z_loss": 0.0287, "step": 3090 }, { "balancing_entropy": 1.0232, "balancing_loss": 1.1357, "epoch": 15.8192, "grad_norm": 0.30078125, "learning_rate": 0.003, "loss": 2.361, "router_z_loss": 0.051, "step": 3100 }, { "balancing_entropy": 1.0529, "balancing_loss": 1.1139, "epoch": 15.8704, "grad_norm": 0.4140625, "learning_rate": 0.003, "loss": 2.3668, "router_z_loss": 0.0397, "step": 3110 }, { "balancing_entropy": 0.9659, "balancing_loss": 1.1444, "epoch": 15.9216, "grad_norm": 0.57421875, "learning_rate": 0.003, "loss": 2.3664, "router_z_loss": 0.0447, "step": 3120 }, { "balancing_entropy": 1.0293, "balancing_loss": 1.101, "epoch": 15.9728, "grad_norm": 0.384765625, "learning_rate": 0.003, "loss": 2.3643, "router_z_loss": 0.0909, "step": 3130 }, { "balancing_entropy": 1.0103, "balancing_loss": 1.1374, "epoch": 16.02048, "grad_norm": 0.34765625, "learning_rate": 0.003, "loss": 2.3554, "router_z_loss": 0.0587, "step": 3140 }, { "balancing_entropy": 1.0656, "balancing_loss": 1.1193, "epoch": 16.07168, "grad_norm": 0.353515625, "learning_rate": 0.003, "loss": 2.3467, "router_z_loss": 0.0355, "step": 3150 }, { "balancing_entropy": 1.0487, "balancing_loss": 1.1401, "epoch": 16.12288, "grad_norm": 0.474609375, "learning_rate": 0.003, "loss": 2.3467, "router_z_loss": 0.0391, "step": 3160 }, { "balancing_entropy": 1.0587, "balancing_loss": 1.1202, "epoch": 16.17408, "grad_norm": 0.251953125, "learning_rate": 0.003, "loss": 2.3492, "router_z_loss": 0.0381, "step": 3170 }, { "balancing_entropy": 1.031, "balancing_loss": 1.1273, "epoch": 16.22528, "grad_norm": 0.76953125, "learning_rate": 0.003, "loss": 2.3497, "router_z_loss": 0.0332, "step": 3180 }, { "balancing_entropy": 1.0183, "balancing_loss": 1.1255, "epoch": 16.27648, "grad_norm": 0.337890625, "learning_rate": 0.003, "loss": 2.3481, "router_z_loss": 0.0449, "step": 3190 }, { "balancing_entropy": 1.0169, "balancing_loss": 1.1111, "epoch": 16.32768, "grad_norm": 0.5703125, "learning_rate": 0.003, "loss": 2.3593, "router_z_loss": 0.0457, "step": 3200 }, { "balancing_entropy": 1.0312, "balancing_loss": 1.1087, "epoch": 16.37888, "grad_norm": 0.287109375, "learning_rate": 0.003, "loss": 2.3548, "router_z_loss": 0.0534, "step": 3210 }, { "balancing_entropy": 1.0515, "balancing_loss": 1.1123, "epoch": 16.43008, "grad_norm": 0.318359375, "learning_rate": 0.003, "loss": 2.3556, "router_z_loss": 0.0416, "step": 3220 }, { "balancing_entropy": 1.0469, "balancing_loss": 1.1226, "epoch": 16.48128, "grad_norm": 0.2890625, "learning_rate": 0.003, "loss": 2.3427, "router_z_loss": 0.0486, "step": 3230 }, { "balancing_entropy": 1.0252, "balancing_loss": 1.1283, "epoch": 16.53248, "grad_norm": 0.6953125, "learning_rate": 0.003, "loss": 2.3534, "router_z_loss": 0.0483, "step": 3240 }, { "balancing_entropy": 1.0217, "balancing_loss": 1.114, "epoch": 16.58368, "grad_norm": 0.421875, "learning_rate": 0.003, "loss": 2.356, "router_z_loss": 0.0623, "step": 3250 }, { "balancing_entropy": 1.0573, "balancing_loss": 1.1287, "epoch": 16.63488, "grad_norm": 0.26171875, "learning_rate": 0.003, "loss": 2.3487, "router_z_loss": 0.0699, "step": 3260 }, { "balancing_entropy": 1.0375, "balancing_loss": 1.134, "epoch": 16.68608, "grad_norm": 0.318359375, "learning_rate": 0.003, "loss": 2.3549, "router_z_loss": 0.042, "step": 3270 }, { "balancing_entropy": 1.04, "balancing_loss": 1.1358, "epoch": 16.73728, "grad_norm": 0.8203125, "learning_rate": 0.003, "loss": 2.3604, "router_z_loss": 0.0331, "step": 3280 }, { "balancing_entropy": 0.9718, "balancing_loss": 1.117, "epoch": 16.78848, "grad_norm": 0.83203125, "learning_rate": 0.003, "loss": 2.3529, "router_z_loss": 0.0523, "step": 3290 }, { "balancing_entropy": 1.0086, "balancing_loss": 1.1137, "epoch": 16.83968, "grad_norm": 0.451171875, "learning_rate": 0.003, "loss": 2.352, "router_z_loss": 0.0803, "step": 3300 }, { "balancing_entropy": 1.0514, "balancing_loss": 1.14, "epoch": 16.89088, "grad_norm": 0.283203125, "learning_rate": 0.003, "loss": 2.3564, "router_z_loss": 0.0418, "step": 3310 }, { "balancing_entropy": 1.0892, "balancing_loss": 1.1227, "epoch": 16.94208, "grad_norm": 0.259765625, "learning_rate": 0.003, "loss": 2.3526, "router_z_loss": 0.0308, "step": 3320 }, { "balancing_entropy": 1.0845, "balancing_loss": 1.1338, "epoch": 16.99328, "grad_norm": 0.30078125, "learning_rate": 0.003, "loss": 2.353, "router_z_loss": 0.0393, "step": 3330 }, { "balancing_entropy": 1.0336, "balancing_loss": 1.1332, "epoch": 17.04096, "grad_norm": 0.330078125, "learning_rate": 0.003, "loss": 2.3431, "router_z_loss": 0.0401, "step": 3340 }, { "balancing_entropy": 1.0514, "balancing_loss": 1.1366, "epoch": 17.09216, "grad_norm": 0.28515625, "learning_rate": 0.003, "loss": 2.339, "router_z_loss": 0.0411, "step": 3350 }, { "balancing_entropy": 0.9933, "balancing_loss": 1.1317, "epoch": 17.14336, "grad_norm": 0.55859375, "learning_rate": 0.003, "loss": 2.331, "router_z_loss": 0.0535, "step": 3360 }, { "balancing_entropy": 1.0034, "balancing_loss": 1.1198, "epoch": 17.19456, "grad_norm": 0.326171875, "learning_rate": 0.003, "loss": 2.3471, "router_z_loss": 0.0803, "step": 3370 }, { "balancing_entropy": 1.056, "balancing_loss": 1.1265, "epoch": 17.24576, "grad_norm": 0.47265625, "learning_rate": 0.003, "loss": 2.341, "router_z_loss": 0.0498, "step": 3380 }, { "balancing_entropy": 1.0427, "balancing_loss": 1.1375, "epoch": 17.29696, "grad_norm": 0.4765625, "learning_rate": 0.003, "loss": 2.3335, "router_z_loss": 0.0433, "step": 3390 }, { "balancing_entropy": 1.0325, "balancing_loss": 1.1195, "epoch": 17.34816, "grad_norm": 0.53125, "learning_rate": 0.003, "loss": 2.344, "router_z_loss": 0.0626, "step": 3400 }, { "balancing_entropy": 1.0441, "balancing_loss": 1.1184, "epoch": 17.39936, "grad_norm": 0.33984375, "learning_rate": 0.003, "loss": 2.3477, "router_z_loss": 0.042, "step": 3410 }, { "balancing_entropy": 1.033, "balancing_loss": 1.1332, "epoch": 17.45056, "grad_norm": 0.3203125, "learning_rate": 0.003, "loss": 2.3299, "router_z_loss": 0.0311, "step": 3420 }, { "balancing_entropy": 1.0314, "balancing_loss": 1.1342, "epoch": 17.50176, "grad_norm": 0.63671875, "learning_rate": 0.003, "loss": 2.338, "router_z_loss": 0.0438, "step": 3430 }, { "balancing_entropy": 1.0458, "balancing_loss": 1.1274, "epoch": 17.55296, "grad_norm": 0.431640625, "learning_rate": 0.003, "loss": 2.3454, "router_z_loss": 0.0437, "step": 3440 }, { "balancing_entropy": 1.046, "balancing_loss": 1.1204, "epoch": 17.60416, "grad_norm": 0.5390625, "learning_rate": 0.003, "loss": 2.3413, "router_z_loss": 0.0402, "step": 3450 }, { "balancing_entropy": 1.0101, "balancing_loss": 1.117, "epoch": 17.65536, "grad_norm": 0.4453125, "learning_rate": 0.003, "loss": 2.339, "router_z_loss": 0.0383, "step": 3460 }, { "balancing_entropy": 1.0508, "balancing_loss": 1.1372, "epoch": 17.70656, "grad_norm": 0.36328125, "learning_rate": 0.003, "loss": 2.3426, "router_z_loss": 0.0731, "step": 3470 }, { "balancing_entropy": 1.0491, "balancing_loss": 1.1222, "epoch": 17.75776, "grad_norm": 0.56640625, "learning_rate": 0.003, "loss": 2.3409, "router_z_loss": 0.0513, "step": 3480 }, { "balancing_entropy": 1.0475, "balancing_loss": 1.1388, "epoch": 17.80896, "grad_norm": 0.31640625, "learning_rate": 0.003, "loss": 2.3349, "router_z_loss": 0.0452, "step": 3490 }, { "balancing_entropy": 1.0364, "balancing_loss": 1.1411, "epoch": 17.86016, "grad_norm": 0.65625, "learning_rate": 0.003, "loss": 2.3313, "router_z_loss": 0.0513, "step": 3500 }, { "balancing_entropy": 1.017, "balancing_loss": 1.1236, "epoch": 17.91136, "grad_norm": 0.51953125, "learning_rate": 0.003, "loss": 2.3363, "router_z_loss": 0.05, "step": 3510 }, { "balancing_entropy": 1.0213, "balancing_loss": 1.1387, "epoch": 17.96256, "grad_norm": 0.474609375, "learning_rate": 0.003, "loss": 2.3405, "router_z_loss": 0.0683, "step": 3520 }, { "balancing_entropy": 0.9772, "balancing_loss": 1.13, "epoch": 18.01024, "grad_norm": 0.58984375, "learning_rate": 0.003, "loss": 2.3404, "router_z_loss": 0.0417, "step": 3530 }, { "balancing_entropy": 1.0304, "balancing_loss": 1.1341, "epoch": 18.06144, "grad_norm": 0.56640625, "learning_rate": 0.003, "loss": 2.3337, "router_z_loss": 0.0499, "step": 3540 }, { "balancing_entropy": 1.0296, "balancing_loss": 1.1121, "epoch": 18.11264, "grad_norm": 0.3671875, "learning_rate": 0.003, "loss": 2.3267, "router_z_loss": 0.0403, "step": 3550 }, { "balancing_entropy": 1.066, "balancing_loss": 1.1384, "epoch": 18.16384, "grad_norm": 0.396484375, "learning_rate": 0.003, "loss": 2.3238, "router_z_loss": 0.04, "step": 3560 }, { "balancing_entropy": 1.0454, "balancing_loss": 1.1299, "epoch": 18.21504, "grad_norm": 0.330078125, "learning_rate": 0.003, "loss": 2.3202, "router_z_loss": 0.0293, "step": 3570 }, { "balancing_entropy": 1.0453, "balancing_loss": 1.1245, "epoch": 18.26624, "grad_norm": 0.54296875, "learning_rate": 0.003, "loss": 2.3229, "router_z_loss": 0.037, "step": 3580 }, { "balancing_entropy": 0.9897, "balancing_loss": 1.1545, "epoch": 18.31744, "grad_norm": 0.427734375, "learning_rate": 0.003, "loss": 2.3246, "router_z_loss": 0.0563, "step": 3590 }, { "balancing_entropy": 1.0073, "balancing_loss": 1.1369, "epoch": 18.36864, "grad_norm": 0.66796875, "learning_rate": 0.003, "loss": 2.3236, "router_z_loss": 0.0663, "step": 3600 }, { "balancing_entropy": 1.0421, "balancing_loss": 1.1096, "epoch": 18.41984, "grad_norm": 0.400390625, "learning_rate": 0.003, "loss": 2.3281, "router_z_loss": 0.0518, "step": 3610 }, { "balancing_entropy": 1.0917, "balancing_loss": 1.1235, "epoch": 18.47104, "grad_norm": 0.330078125, "learning_rate": 0.003, "loss": 2.3293, "router_z_loss": 0.0377, "step": 3620 }, { "balancing_entropy": 1.0374, "balancing_loss": 1.1221, "epoch": 18.52224, "grad_norm": 0.48046875, "learning_rate": 0.003, "loss": 2.3308, "router_z_loss": 0.0354, "step": 3630 }, { "balancing_entropy": 1.0252, "balancing_loss": 1.1258, "epoch": 18.57344, "grad_norm": 0.455078125, "learning_rate": 0.003, "loss": 2.327, "router_z_loss": 0.0604, "step": 3640 }, { "balancing_entropy": 1.0403, "balancing_loss": 1.1386, "epoch": 18.62464, "grad_norm": 0.466796875, "learning_rate": 0.003, "loss": 2.3345, "router_z_loss": 0.0517, "step": 3650 }, { "balancing_entropy": 1.0527, "balancing_loss": 1.1294, "epoch": 18.67584, "grad_norm": 0.4375, "learning_rate": 0.003, "loss": 2.3365, "router_z_loss": 0.035, "step": 3660 }, { "balancing_entropy": 1.0151, "balancing_loss": 1.1301, "epoch": 18.72704, "grad_norm": 0.53125, "learning_rate": 0.003, "loss": 2.3304, "router_z_loss": 0.0367, "step": 3670 }, { "balancing_entropy": 1.0685, "balancing_loss": 1.1199, "epoch": 18.77824, "grad_norm": 0.28515625, "learning_rate": 0.003, "loss": 2.3308, "router_z_loss": 0.0512, "step": 3680 }, { "balancing_entropy": 1.0582, "balancing_loss": 1.1277, "epoch": 18.829439999999998, "grad_norm": 0.302734375, "learning_rate": 0.003, "loss": 2.3248, "router_z_loss": 0.0356, "step": 3690 }, { "balancing_entropy": 1.0744, "balancing_loss": 1.1132, "epoch": 18.88064, "grad_norm": 0.2392578125, "learning_rate": 0.003, "loss": 2.3329, "router_z_loss": 0.0338, "step": 3700 }, { "balancing_entropy": 1.0843, "balancing_loss": 1.1303, "epoch": 18.93184, "grad_norm": 0.35546875, "learning_rate": 0.003, "loss": 2.33, "router_z_loss": 0.0418, "step": 3710 }, { "balancing_entropy": 1.0871, "balancing_loss": 1.1295, "epoch": 18.98304, "grad_norm": 0.353515625, "learning_rate": 0.003, "loss": 2.3322, "router_z_loss": 0.0367, "step": 3720 }, { "balancing_entropy": 1.0513, "balancing_loss": 1.123, "epoch": 19.03072, "grad_norm": 0.267578125, "learning_rate": 0.003, "loss": 2.3312, "router_z_loss": 0.0394, "step": 3730 }, { "balancing_entropy": 1.0894, "balancing_loss": 1.1285, "epoch": 19.08192, "grad_norm": 0.283203125, "learning_rate": 0.003, "loss": 2.3185, "router_z_loss": 0.0432, "step": 3740 }, { "balancing_entropy": 1.0925, "balancing_loss": 1.1308, "epoch": 19.13312, "grad_norm": 0.33203125, "learning_rate": 0.003, "loss": 2.3206, "router_z_loss": 0.0477, "step": 3750 }, { "balancing_entropy": 1.0879, "balancing_loss": 1.1238, "epoch": 19.18432, "grad_norm": 0.3125, "learning_rate": 0.003, "loss": 2.3233, "router_z_loss": 0.0395, "step": 3760 }, { "balancing_entropy": 1.0722, "balancing_loss": 1.1328, "epoch": 19.23552, "grad_norm": 0.31640625, "learning_rate": 0.003, "loss": 2.324, "router_z_loss": 0.0377, "step": 3770 }, { "balancing_entropy": 1.0895, "balancing_loss": 1.1288, "epoch": 19.28672, "grad_norm": 0.283203125, "learning_rate": 0.003, "loss": 2.3119, "router_z_loss": 0.0484, "step": 3780 }, { "balancing_entropy": 1.0912, "balancing_loss": 1.1208, "epoch": 19.33792, "grad_norm": 0.28515625, "learning_rate": 0.003, "loss": 2.3251, "router_z_loss": 0.0429, "step": 3790 }, { "balancing_entropy": 1.0661, "balancing_loss": 1.1277, "epoch": 19.38912, "grad_norm": 0.37109375, "learning_rate": 0.003, "loss": 2.3286, "router_z_loss": 0.0364, "step": 3800 }, { "balancing_entropy": 1.0604, "balancing_loss": 1.128, "epoch": 19.44032, "grad_norm": 0.4609375, "learning_rate": 0.003, "loss": 2.3202, "router_z_loss": 0.0522, "step": 3810 }, { "balancing_entropy": 1.0644, "balancing_loss": 1.1246, "epoch": 19.49152, "grad_norm": 0.30078125, "learning_rate": 0.003, "loss": 2.3231, "router_z_loss": 0.0577, "step": 3820 }, { "balancing_entropy": 1.0396, "balancing_loss": 1.1341, "epoch": 19.54272, "grad_norm": 0.478515625, "learning_rate": 0.003, "loss": 2.3307, "router_z_loss": 0.0406, "step": 3830 }, { "balancing_entropy": 1.0122, "balancing_loss": 1.1193, "epoch": 19.59392, "grad_norm": 0.458984375, "learning_rate": 0.003, "loss": 2.3299, "router_z_loss": 0.0519, "step": 3840 }, { "balancing_entropy": 1.0458, "balancing_loss": 1.1171, "epoch": 19.64512, "grad_norm": 0.271484375, "learning_rate": 0.003, "loss": 2.3236, "router_z_loss": 0.0475, "step": 3850 }, { "balancing_entropy": 0.9796, "balancing_loss": 1.1462, "epoch": 19.69632, "grad_norm": 0.6015625, "learning_rate": 0.003, "loss": 2.3271, "router_z_loss": 0.0477, "step": 3860 }, { "balancing_entropy": 1.0068, "balancing_loss": 1.0965, "epoch": 19.74752, "grad_norm": 0.365234375, "learning_rate": 0.003, "loss": 2.3292, "router_z_loss": 0.0887, "step": 3870 }, { "balancing_entropy": 1.0699, "balancing_loss": 1.1434, "epoch": 19.79872, "grad_norm": 0.46875, "learning_rate": 0.003, "loss": 2.3255, "router_z_loss": 0.068, "step": 3880 }, { "balancing_entropy": 1.0937, "balancing_loss": 1.1337, "epoch": 19.84992, "grad_norm": 0.2421875, "learning_rate": 0.003, "loss": 2.3212, "router_z_loss": 0.0444, "step": 3890 }, { "balancing_entropy": 1.0607, "balancing_loss": 1.1281, "epoch": 19.90112, "grad_norm": 0.56640625, "learning_rate": 0.003, "loss": 2.3333, "router_z_loss": 0.032, "step": 3900 }, { "balancing_entropy": 1.0434, "balancing_loss": 1.1199, "epoch": 19.95232, "grad_norm": 0.2890625, "learning_rate": 0.003, "loss": 2.3279, "router_z_loss": 0.0464, "step": 3910 }, { "balancing_entropy": 1.0229, "balancing_loss": 1.132, "epoch": 20.0, "grad_norm": 0.78125, "learning_rate": 0.003, "loss": 2.3329, "router_z_loss": 0.0448, "step": 3920 }, { "balancing_entropy": 1.0142, "balancing_loss": 1.1257, "epoch": 20.0512, "grad_norm": 0.72265625, "learning_rate": 0.003, "loss": 2.3077, "router_z_loss": 0.049, "step": 3930 }, { "balancing_entropy": 1.0025, "balancing_loss": 1.1225, "epoch": 20.1024, "grad_norm": 0.6015625, "learning_rate": 0.003, "loss": 2.3138, "router_z_loss": 0.0816, "step": 3940 }, { "balancing_entropy": 1.0195, "balancing_loss": 1.1433, "epoch": 20.1536, "grad_norm": 0.6640625, "learning_rate": 0.003, "loss": 2.313, "router_z_loss": 0.087, "step": 3950 }, { "balancing_entropy": 1.0725, "balancing_loss": 1.1381, "epoch": 20.2048, "grad_norm": 0.271484375, "learning_rate": 0.003, "loss": 2.3157, "router_z_loss": 0.0779, "step": 3960 }, { "balancing_entropy": 1.0654, "balancing_loss": 1.1203, "epoch": 20.256, "grad_norm": 0.33984375, "learning_rate": 0.003, "loss": 2.3124, "router_z_loss": 0.0429, "step": 3970 }, { "balancing_entropy": 1.0739, "balancing_loss": 1.1384, "epoch": 20.3072, "grad_norm": 0.361328125, "learning_rate": 0.003, "loss": 2.3125, "router_z_loss": 0.05, "step": 3980 }, { "balancing_entropy": 1.0768, "balancing_loss": 1.134, "epoch": 20.3584, "grad_norm": 0.50390625, "learning_rate": 0.003, "loss": 2.313, "router_z_loss": 0.0368, "step": 3990 }, { "balancing_entropy": 1.0431, "balancing_loss": 1.1251, "epoch": 20.4096, "grad_norm": 0.61328125, "learning_rate": 0.003, "loss": 2.3163, "router_z_loss": 0.0372, "step": 4000 }, { "balancing_entropy": 1.0229, "balancing_loss": 1.1299, "epoch": 20.4608, "grad_norm": 0.56640625, "learning_rate": 0.003, "loss": 2.3179, "router_z_loss": 0.0571, "step": 4010 }, { "balancing_entropy": 1.0859, "balancing_loss": 1.1238, "epoch": 20.512, "grad_norm": 0.26953125, "learning_rate": 0.003, "loss": 2.3196, "router_z_loss": 0.0571, "step": 4020 }, { "balancing_entropy": 1.0828, "balancing_loss": 1.1359, "epoch": 20.5632, "grad_norm": 0.29296875, "learning_rate": 0.003, "loss": 2.3168, "router_z_loss": 0.0353, "step": 4030 }, { "balancing_entropy": 1.0532, "balancing_loss": 1.133, "epoch": 20.6144, "grad_norm": 0.416015625, "learning_rate": 0.003, "loss": 2.3206, "router_z_loss": 0.0357, "step": 4040 }, { "balancing_entropy": 1.0563, "balancing_loss": 1.1198, "epoch": 20.6656, "grad_norm": 0.294921875, "learning_rate": 0.003, "loss": 2.3145, "router_z_loss": 0.055, "step": 4050 }, { "balancing_entropy": 1.0531, "balancing_loss": 1.1521, "epoch": 20.7168, "grad_norm": 0.48828125, "learning_rate": 0.003, "loss": 2.3216, "router_z_loss": 0.06, "step": 4060 }, { "balancing_entropy": 1.0252, "balancing_loss": 1.1323, "epoch": 20.768, "grad_norm": 0.314453125, "learning_rate": 0.003, "loss": 2.3264, "router_z_loss": 0.0396, "step": 4070 }, { "balancing_entropy": 1.0652, "balancing_loss": 1.129, "epoch": 20.8192, "grad_norm": 0.298828125, "learning_rate": 0.003, "loss": 2.3155, "router_z_loss": 0.05, "step": 4080 }, { "balancing_entropy": 1.0933, "balancing_loss": 1.134, "epoch": 20.8704, "grad_norm": 0.2578125, "learning_rate": 0.003, "loss": 2.3148, "router_z_loss": 0.036, "step": 4090 }, { "balancing_entropy": 1.0958, "balancing_loss": 1.128, "epoch": 20.9216, "grad_norm": 0.35546875, "learning_rate": 0.003, "loss": 2.3119, "router_z_loss": 0.0301, "step": 4100 }, { "balancing_entropy": 1.0887, "balancing_loss": 1.1354, "epoch": 20.9728, "grad_norm": 0.2197265625, "learning_rate": 0.003, "loss": 2.3083, "router_z_loss": 0.0324, "step": 4110 }, { "balancing_entropy": 1.0297, "balancing_loss": 1.1405, "epoch": 21.02048, "grad_norm": 0.65625, "learning_rate": 0.003, "loss": 2.3102, "router_z_loss": 0.0326, "step": 4120 }, { "balancing_entropy": 1.0745, "balancing_loss": 1.139, "epoch": 21.07168, "grad_norm": 0.4921875, "learning_rate": 0.003, "loss": 2.3082, "router_z_loss": 0.0506, "step": 4130 }, { "balancing_entropy": 1.0805, "balancing_loss": 1.1195, "epoch": 21.12288, "grad_norm": 0.30859375, "learning_rate": 0.003, "loss": 2.2994, "router_z_loss": 0.0352, "step": 4140 }, { "balancing_entropy": 1.0906, "balancing_loss": 1.1368, "epoch": 21.17408, "grad_norm": 0.30078125, "learning_rate": 0.003, "loss": 2.298, "router_z_loss": 0.0352, "step": 4150 }, { "balancing_entropy": 1.0787, "balancing_loss": 1.1367, "epoch": 21.22528, "grad_norm": 0.234375, "learning_rate": 0.003, "loss": 2.2971, "router_z_loss": 0.0368, "step": 4160 }, { "balancing_entropy": 1.0896, "balancing_loss": 1.1229, "epoch": 21.27648, "grad_norm": 0.34375, "learning_rate": 0.003, "loss": 2.2993, "router_z_loss": 0.0319, "step": 4170 }, { "balancing_entropy": 1.0083, "balancing_loss": 1.1473, "epoch": 21.32768, "grad_norm": 0.578125, "learning_rate": 0.003, "loss": 2.3058, "router_z_loss": 0.0505, "step": 4180 }, { "balancing_entropy": 1.0559, "balancing_loss": 1.1424, "epoch": 21.37888, "grad_norm": 0.56640625, "learning_rate": 0.003, "loss": 2.3025, "router_z_loss": 0.0774, "step": 4190 }, { "balancing_entropy": 1.0491, "balancing_loss": 1.1169, "epoch": 21.43008, "grad_norm": 0.328125, "learning_rate": 0.003, "loss": 2.3018, "router_z_loss": 0.043, "step": 4200 }, { "balancing_entropy": 1.0295, "balancing_loss": 1.1264, "epoch": 21.48128, "grad_norm": 0.38671875, "learning_rate": 0.003, "loss": 2.3103, "router_z_loss": 0.0752, "step": 4210 }, { "balancing_entropy": 1.0557, "balancing_loss": 1.119, "epoch": 21.53248, "grad_norm": 0.5625, "learning_rate": 0.003, "loss": 2.3019, "router_z_loss": 0.0842, "step": 4220 }, { "balancing_entropy": 1.0386, "balancing_loss": 1.1247, "epoch": 21.58368, "grad_norm": 0.35546875, "learning_rate": 0.003, "loss": 2.3054, "router_z_loss": 0.0546, "step": 4230 }, { "balancing_entropy": 1.0632, "balancing_loss": 1.1399, "epoch": 21.63488, "grad_norm": 0.400390625, "learning_rate": 0.003, "loss": 2.307, "router_z_loss": 0.0554, "step": 4240 }, { "balancing_entropy": 1.0652, "balancing_loss": 1.1398, "epoch": 21.68608, "grad_norm": 0.37890625, "learning_rate": 0.003, "loss": 2.2999, "router_z_loss": 0.0542, "step": 4250 }, { "balancing_entropy": 1.051, "balancing_loss": 1.1272, "epoch": 21.73728, "grad_norm": 0.310546875, "learning_rate": 0.003, "loss": 2.3111, "router_z_loss": 0.0523, "step": 4260 }, { "balancing_entropy": 1.0284, "balancing_loss": 1.1418, "epoch": 21.78848, "grad_norm": 0.6953125, "learning_rate": 0.003, "loss": 2.3119, "router_z_loss": 0.0507, "step": 4270 }, { "balancing_entropy": 1.0015, "balancing_loss": 1.11, "epoch": 21.83968, "grad_norm": 0.54296875, "learning_rate": 0.003, "loss": 2.3048, "router_z_loss": 0.0512, "step": 4280 }, { "balancing_entropy": 1.0566, "balancing_loss": 1.1091, "epoch": 21.89088, "grad_norm": 0.3359375, "learning_rate": 0.003, "loss": 2.3144, "router_z_loss": 0.0598, "step": 4290 }, { "balancing_entropy": 1.0463, "balancing_loss": 1.1171, "epoch": 21.94208, "grad_norm": 0.546875, "learning_rate": 0.003, "loss": 2.3107, "router_z_loss": 0.0398, "step": 4300 }, { "balancing_entropy": 1.0103, "balancing_loss": 1.1259, "epoch": 21.99328, "grad_norm": 0.73046875, "learning_rate": 0.003, "loss": 2.3131, "router_z_loss": 0.0561, "step": 4310 }, { "balancing_entropy": 1.035, "balancing_loss": 1.1451, "epoch": 22.04096, "grad_norm": 0.283203125, "learning_rate": 0.003, "loss": 2.2944, "router_z_loss": 0.0544, "step": 4320 }, { "balancing_entropy": 1.0442, "balancing_loss": 1.1572, "epoch": 22.09216, "grad_norm": 0.53515625, "learning_rate": 0.003, "loss": 2.2986, "router_z_loss": 0.0582, "step": 4330 }, { "balancing_entropy": 1.0668, "balancing_loss": 1.1234, "epoch": 22.14336, "grad_norm": 0.3671875, "learning_rate": 0.003, "loss": 2.2902, "router_z_loss": 0.0543, "step": 4340 }, { "balancing_entropy": 1.0114, "balancing_loss": 1.1257, "epoch": 22.19456, "grad_norm": 0.578125, "learning_rate": 0.003, "loss": 2.2964, "router_z_loss": 0.053, "step": 4350 }, { "balancing_entropy": 1.0688, "balancing_loss": 1.1459, "epoch": 22.24576, "grad_norm": 0.318359375, "learning_rate": 0.003, "loss": 2.2852, "router_z_loss": 0.0609, "step": 4360 }, { "balancing_entropy": 1.0939, "balancing_loss": 1.1498, "epoch": 22.29696, "grad_norm": 0.279296875, "learning_rate": 0.003, "loss": 2.2868, "router_z_loss": 0.0383, "step": 4370 }, { "balancing_entropy": 1.0894, "balancing_loss": 1.1373, "epoch": 22.34816, "grad_norm": 0.3828125, "learning_rate": 0.003, "loss": 2.2948, "router_z_loss": 0.0366, "step": 4380 }, { "balancing_entropy": 1.0741, "balancing_loss": 1.13, "epoch": 22.39936, "grad_norm": 0.55078125, "learning_rate": 0.003, "loss": 2.2896, "router_z_loss": 0.0337, "step": 4390 }, { "balancing_entropy": 1.0656, "balancing_loss": 1.1352, "epoch": 22.45056, "grad_norm": 0.55859375, "learning_rate": 0.003, "loss": 2.2973, "router_z_loss": 0.0445, "step": 4400 }, { "balancing_entropy": 1.021, "balancing_loss": 1.1298, "epoch": 22.50176, "grad_norm": 0.5, "learning_rate": 0.003, "loss": 2.3002, "router_z_loss": 0.0504, "step": 4410 }, { "balancing_entropy": 1.0723, "balancing_loss": 1.145, "epoch": 22.55296, "grad_norm": 0.373046875, "learning_rate": 0.003, "loss": 2.2945, "router_z_loss": 0.0491, "step": 4420 }, { "balancing_entropy": 1.0332, "balancing_loss": 1.1362, "epoch": 22.60416, "grad_norm": 0.3828125, "learning_rate": 0.003, "loss": 2.2972, "router_z_loss": 0.0441, "step": 4430 }, { "balancing_entropy": 0.9803, "balancing_loss": 1.1438, "epoch": 22.65536, "grad_norm": 0.71484375, "learning_rate": 0.003, "loss": 2.3051, "router_z_loss": 0.0522, "step": 4440 }, { "balancing_entropy": 1.0601, "balancing_loss": 1.1232, "epoch": 22.70656, "grad_norm": 0.46484375, "learning_rate": 0.003, "loss": 2.2975, "router_z_loss": 0.0611, "step": 4450 }, { "balancing_entropy": 1.007, "balancing_loss": 1.1101, "epoch": 22.75776, "grad_norm": 0.67578125, "learning_rate": 0.003, "loss": 2.2998, "router_z_loss": 0.0452, "step": 4460 }, { "balancing_entropy": 1.0561, "balancing_loss": 1.1192, "epoch": 22.80896, "grad_norm": 0.365234375, "learning_rate": 0.003, "loss": 2.2935, "router_z_loss": 0.0554, "step": 4470 }, { "balancing_entropy": 1.0627, "balancing_loss": 1.1333, "epoch": 22.86016, "grad_norm": 0.64453125, "learning_rate": 0.003, "loss": 2.2923, "router_z_loss": 0.0465, "step": 4480 }, { "balancing_entropy": 1.06, "balancing_loss": 1.1433, "epoch": 22.91136, "grad_norm": 0.36328125, "learning_rate": 0.003, "loss": 2.2996, "router_z_loss": 0.0432, "step": 4490 }, { "balancing_entropy": 1.0649, "balancing_loss": 1.1329, "epoch": 22.96256, "grad_norm": 0.58203125, "learning_rate": 0.003, "loss": 2.297, "router_z_loss": 0.0527, "step": 4500 }, { "balancing_entropy": 1.0084, "balancing_loss": 1.163, "epoch": 23.01024, "grad_norm": 0.494140625, "learning_rate": 0.003, "loss": 2.2983, "router_z_loss": 0.0448, "step": 4510 }, { "balancing_entropy": 1.0353, "balancing_loss": 1.1122, "epoch": 23.06144, "grad_norm": 0.265625, "learning_rate": 0.003, "loss": 2.2864, "router_z_loss": 0.0556, "step": 4520 }, { "balancing_entropy": 1.0281, "balancing_loss": 1.1533, "epoch": 23.11264, "grad_norm": 0.546875, "learning_rate": 0.003, "loss": 2.2755, "router_z_loss": 0.0569, "step": 4530 }, { "balancing_entropy": 1.0706, "balancing_loss": 1.1579, "epoch": 23.16384, "grad_norm": 0.35546875, "learning_rate": 0.003, "loss": 2.288, "router_z_loss": 0.0515, "step": 4540 }, { "balancing_entropy": 1.0586, "balancing_loss": 1.1544, "epoch": 23.21504, "grad_norm": 0.53515625, "learning_rate": 0.003, "loss": 2.2825, "router_z_loss": 0.0532, "step": 4550 }, { "balancing_entropy": 1.0204, "balancing_loss": 1.1167, "epoch": 23.26624, "grad_norm": 0.625, "learning_rate": 0.003, "loss": 2.2936, "router_z_loss": 0.0474, "step": 4560 }, { "balancing_entropy": 1.0752, "balancing_loss": 1.1596, "epoch": 23.31744, "grad_norm": 0.59765625, "learning_rate": 0.003, "loss": 2.2838, "router_z_loss": 0.063, "step": 4570 }, { "balancing_entropy": 0.9842, "balancing_loss": 1.1321, "epoch": 23.36864, "grad_norm": 0.421875, "learning_rate": 0.003, "loss": 2.2884, "router_z_loss": 0.0563, "step": 4580 }, { "balancing_entropy": 1.0403, "balancing_loss": 1.1547, "epoch": 23.41984, "grad_norm": 0.43359375, "learning_rate": 0.003, "loss": 2.2874, "router_z_loss": 0.082, "step": 4590 }, { "balancing_entropy": 1.0761, "balancing_loss": 1.14, "epoch": 23.47104, "grad_norm": 0.302734375, "learning_rate": 0.003, "loss": 2.2872, "router_z_loss": 0.0696, "step": 4600 }, { "balancing_entropy": 1.0439, "balancing_loss": 1.1381, "epoch": 23.52224, "grad_norm": 0.52734375, "learning_rate": 0.003, "loss": 2.2864, "router_z_loss": 0.0576, "step": 4610 }, { "balancing_entropy": 1.0911, "balancing_loss": 1.1326, "epoch": 23.57344, "grad_norm": 0.287109375, "learning_rate": 0.003, "loss": 2.2905, "router_z_loss": 0.0555, "step": 4620 }, { "balancing_entropy": 1.0703, "balancing_loss": 1.1211, "epoch": 23.62464, "grad_norm": 0.46875, "learning_rate": 0.003, "loss": 2.2932, "router_z_loss": 0.0454, "step": 4630 }, { "balancing_entropy": 1.0509, "balancing_loss": 1.1415, "epoch": 23.67584, "grad_norm": 0.6796875, "learning_rate": 0.003, "loss": 2.2851, "router_z_loss": 0.0415, "step": 4640 }, { "balancing_entropy": 1.0814, "balancing_loss": 1.139, "epoch": 23.72704, "grad_norm": 0.416015625, "learning_rate": 0.003, "loss": 2.2815, "router_z_loss": 0.0463, "step": 4650 }, { "balancing_entropy": 1.0366, "balancing_loss": 1.1473, "epoch": 23.77824, "grad_norm": 0.2890625, "learning_rate": 0.003, "loss": 2.2927, "router_z_loss": 0.0513, "step": 4660 }, { "balancing_entropy": 1.0449, "balancing_loss": 1.1243, "epoch": 23.829439999999998, "grad_norm": 0.51953125, "learning_rate": 0.003, "loss": 2.2838, "router_z_loss": 0.0461, "step": 4670 }, { "balancing_entropy": 1.0811, "balancing_loss": 1.1359, "epoch": 23.88064, "grad_norm": 0.330078125, "learning_rate": 0.003, "loss": 2.2877, "router_z_loss": 0.0451, "step": 4680 }, { "balancing_entropy": 1.0638, "balancing_loss": 1.1632, "epoch": 23.93184, "grad_norm": 0.498046875, "learning_rate": 0.003, "loss": 2.2878, "router_z_loss": 0.0387, "step": 4690 }, { "balancing_entropy": 1.0699, "balancing_loss": 1.1294, "epoch": 23.98304, "grad_norm": 0.56640625, "learning_rate": 0.003, "loss": 2.2858, "router_z_loss": 0.0398, "step": 4700 }, { "balancing_entropy": 1.0435, "balancing_loss": 1.1169, "epoch": 24.03072, "grad_norm": 0.4375, "learning_rate": 0.003, "loss": 2.289, "router_z_loss": 0.0401, "step": 4710 }, { "balancing_entropy": 1.0646, "balancing_loss": 1.1232, "epoch": 24.08192, "grad_norm": 0.25390625, "learning_rate": 0.003, "loss": 2.2828, "router_z_loss": 0.0396, "step": 4720 }, { "balancing_entropy": 1.0821, "balancing_loss": 1.1243, "epoch": 24.13312, "grad_norm": 0.578125, "learning_rate": 0.003, "loss": 2.2779, "router_z_loss": 0.0406, "step": 4730 }, { "balancing_entropy": 1.0832, "balancing_loss": 1.1521, "epoch": 24.18432, "grad_norm": 0.439453125, "learning_rate": 0.003, "loss": 2.2733, "router_z_loss": 0.0439, "step": 4740 }, { "balancing_entropy": 1.0704, "balancing_loss": 1.1228, "epoch": 24.23552, "grad_norm": 0.3125, "learning_rate": 0.003, "loss": 2.2775, "router_z_loss": 0.0462, "step": 4750 }, { "balancing_entropy": 1.0795, "balancing_loss": 1.1359, "epoch": 24.28672, "grad_norm": 0.314453125, "learning_rate": 0.003, "loss": 2.2688, "router_z_loss": 0.043, "step": 4760 }, { "balancing_entropy": 1.0511, "balancing_loss": 1.1325, "epoch": 24.33792, "grad_norm": 0.2421875, "learning_rate": 0.003, "loss": 2.28, "router_z_loss": 0.0428, "step": 4770 }, { "balancing_entropy": 1.037, "balancing_loss": 1.1263, "epoch": 24.38912, "grad_norm": 0.83984375, "learning_rate": 0.003, "loss": 2.2732, "router_z_loss": 0.0447, "step": 4780 }, { "balancing_entropy": 1.0001, "balancing_loss": 1.1322, "epoch": 24.44032, "grad_norm": 0.79296875, "learning_rate": 0.003, "loss": 2.2847, "router_z_loss": 0.0459, "step": 4790 }, { "balancing_entropy": 1.039, "balancing_loss": 1.1448, "epoch": 24.49152, "grad_norm": 0.39453125, "learning_rate": 0.003, "loss": 2.2863, "router_z_loss": 0.0461, "step": 4800 }, { "balancing_entropy": 1.0218, "balancing_loss": 1.1421, "epoch": 24.54272, "grad_norm": 0.515625, "learning_rate": 0.003, "loss": 2.2808, "router_z_loss": 0.0468, "step": 4810 }, { "balancing_entropy": 1.0368, "balancing_loss": 1.145, "epoch": 24.59392, "grad_norm": 0.404296875, "learning_rate": 0.003, "loss": 2.2825, "router_z_loss": 0.0523, "step": 4820 }, { "balancing_entropy": 1.0493, "balancing_loss": 1.1353, "epoch": 24.64512, "grad_norm": 0.298828125, "learning_rate": 0.003, "loss": 2.2823, "router_z_loss": 0.0485, "step": 4830 }, { "balancing_entropy": 1.0598, "balancing_loss": 1.1165, "epoch": 24.69632, "grad_norm": 0.40234375, "learning_rate": 0.003, "loss": 2.2776, "router_z_loss": 0.0428, "step": 4840 }, { "balancing_entropy": 1.0402, "balancing_loss": 1.1347, "epoch": 24.74752, "grad_norm": 0.26171875, "learning_rate": 0.003, "loss": 2.2834, "router_z_loss": 0.0458, "step": 4850 }, { "balancing_entropy": 1.0102, "balancing_loss": 1.1622, "epoch": 24.79872, "grad_norm": 0.625, "learning_rate": 0.003, "loss": 2.2829, "router_z_loss": 0.0509, "step": 4860 }, { "balancing_entropy": 0.9894, "balancing_loss": 1.1695, "epoch": 24.84992, "grad_norm": 0.86328125, "learning_rate": 0.003, "loss": 2.2829, "router_z_loss": 0.0572, "step": 4870 }, { "balancing_entropy": 1.044, "balancing_loss": 1.1283, "epoch": 24.90112, "grad_norm": 0.55078125, "learning_rate": 0.003, "loss": 2.2855, "router_z_loss": 0.0592, "step": 4880 }, { "balancing_entropy": 1.084, "balancing_loss": 1.1366, "epoch": 24.95232, "grad_norm": 0.28125, "learning_rate": 0.003, "loss": 2.279, "router_z_loss": 0.0519, "step": 4890 }, { "balancing_entropy": 1.0463, "balancing_loss": 1.1289, "epoch": 25.0, "grad_norm": 0.310546875, "learning_rate": 0.003, "loss": 2.281, "router_z_loss": 0.0457, "step": 4900 }, { "balancing_entropy": 1.0756, "balancing_loss": 1.1409, "epoch": 25.0512, "grad_norm": 0.2890625, "learning_rate": 0.003, "loss": 2.2624, "router_z_loss": 0.0432, "step": 4910 }, { "balancing_entropy": 1.0128, "balancing_loss": 1.1419, "epoch": 25.1024, "grad_norm": 0.435546875, "learning_rate": 0.003, "loss": 2.2761, "router_z_loss": 0.043, "step": 4920 }, { "balancing_entropy": 1.0785, "balancing_loss": 1.1306, "epoch": 25.1536, "grad_norm": 0.326171875, "learning_rate": 0.003, "loss": 2.2716, "router_z_loss": 0.0464, "step": 4930 }, { "balancing_entropy": 1.0723, "balancing_loss": 1.1443, "epoch": 25.2048, "grad_norm": 0.3359375, "learning_rate": 0.003, "loss": 2.2666, "router_z_loss": 0.0451, "step": 4940 }, { "balancing_entropy": 1.0652, "balancing_loss": 1.1235, "epoch": 25.256, "grad_norm": 0.625, "learning_rate": 0.003, "loss": 2.27, "router_z_loss": 0.0429, "step": 4950 }, { "balancing_entropy": 1.0634, "balancing_loss": 1.1462, "epoch": 25.3072, "grad_norm": 0.314453125, "learning_rate": 0.003, "loss": 2.2702, "router_z_loss": 0.0448, "step": 4960 }, { "balancing_entropy": 1.0723, "balancing_loss": 1.1268, "epoch": 25.3584, "grad_norm": 0.314453125, "learning_rate": 0.003, "loss": 2.2745, "router_z_loss": 0.0429, "step": 4970 }, { "balancing_entropy": 1.0726, "balancing_loss": 1.1487, "epoch": 25.4096, "grad_norm": 0.56640625, "learning_rate": 0.003, "loss": 2.2655, "router_z_loss": 0.04, "step": 4980 }, { "balancing_entropy": 1.0657, "balancing_loss": 1.1231, "epoch": 25.4608, "grad_norm": 0.65625, "learning_rate": 0.003, "loss": 2.2679, "router_z_loss": 0.0376, "step": 4990 }, { "balancing_entropy": 1.0308, "balancing_loss": 1.1208, "epoch": 25.512, "grad_norm": 0.38671875, "learning_rate": 0.003, "loss": 2.2698, "router_z_loss": 0.039, "step": 5000 } ], "logging_steps": 10, "max_steps": 19500, "num_input_tokens_seen": 0, "num_train_epochs": 100, "save_steps": 5000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.17699824084992e+17, "train_batch_size": 8, "trial_name": null, "trial_params": null }