{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.04724719469781482, "eval_steps": 500, "global_step": 900, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0005249688299757202, "grad_norm": 4051.18359375, "learning_rate": 9e-07, "loss": 7.93, "step": 10 }, { "epoch": 0.0010499376599514404, "grad_norm": 111.26915740966797, "learning_rate": 3.899999999999999e-06, "loss": 7.7273, "step": 20 }, { "epoch": 0.0015749064899271605, "grad_norm": 176.40713500976562, "learning_rate": 6.899999999999999e-06, "loss": 7.5271, "step": 30 }, { "epoch": 0.002099875319902881, "grad_norm": 668.3442993164062, "learning_rate": 9.9e-06, "loss": 7.6155, "step": 40 }, { "epoch": 0.002624844149878601, "grad_norm": 171.85369873046875, "learning_rate": 1.2899999999999998e-05, "loss": 7.4873, "step": 50 }, { "epoch": 0.003149812979854321, "grad_norm": 477.1031494140625, "learning_rate": 1.5899999999999997e-05, "loss": 7.4295, "step": 60 }, { "epoch": 0.0036747818098300414, "grad_norm": 256.7841491699219, "learning_rate": 1.89e-05, "loss": 7.3037, "step": 70 }, { "epoch": 0.004199750639805762, "grad_norm": 240.86167907714844, "learning_rate": 2.1899999999999997e-05, "loss": 7.3488, "step": 80 }, { "epoch": 0.0047247194697814816, "grad_norm": 151.8752899169922, "learning_rate": 2.49e-05, "loss": 7.1664, "step": 90 }, { "epoch": 0.005249688299757202, "grad_norm": 92.41702270507812, "learning_rate": 2.7899999999999997e-05, "loss": 7.2001, "step": 100 }, { "epoch": 0.005774657129732922, "grad_norm": 125.6628189086914, "learning_rate": 3.09e-05, "loss": 7.1956, "step": 110 }, { "epoch": 0.006299625959708642, "grad_norm": 105.1700210571289, "learning_rate": 3.39e-05, "loss": 7.2136, "step": 120 }, { "epoch": 0.006824594789684363, "grad_norm": 95.49678039550781, "learning_rate": 3.6899999999999996e-05, "loss": 7.2046, "step": 130 }, { "epoch": 0.007349563619660083, "grad_norm": 70.33267974853516, "learning_rate": 3.99e-05, "loss": 7.0895, "step": 140 }, { "epoch": 0.007874532449635803, "grad_norm": 42.994972229003906, "learning_rate": 4.289999999999999e-05, "loss": 7.1157, "step": 150 }, { "epoch": 0.008399501279611523, "grad_norm": 87.23907470703125, "learning_rate": 4.59e-05, "loss": 7.1537, "step": 160 }, { "epoch": 0.008924470109587244, "grad_norm": 53.14045333862305, "learning_rate": 4.8899999999999996e-05, "loss": 7.0126, "step": 170 }, { "epoch": 0.009449438939562963, "grad_norm": 44.222225189208984, "learning_rate": 5.1899999999999994e-05, "loss": 7.1067, "step": 180 }, { "epoch": 0.009974407769538684, "grad_norm": 65.67877197265625, "learning_rate": 5.489999999999999e-05, "loss": 7.0359, "step": 190 }, { "epoch": 0.010499376599514405, "grad_norm": 34.80784225463867, "learning_rate": 5.79e-05, "loss": 7.0124, "step": 200 }, { "epoch": 0.011024345429490124, "grad_norm": 80.05706024169922, "learning_rate": 6.0899999999999996e-05, "loss": 6.9882, "step": 210 }, { "epoch": 0.011549314259465844, "grad_norm": 18.072044372558594, "learning_rate": 6.39e-05, "loss": 7.082, "step": 220 }, { "epoch": 0.012074283089441565, "grad_norm": 27.460533142089844, "learning_rate": 6.69e-05, "loss": 7.0056, "step": 230 }, { "epoch": 0.012599251919417284, "grad_norm": 20.942256927490234, "learning_rate": 6.989999999999999e-05, "loss": 7.0385, "step": 240 }, { "epoch": 0.013124220749393005, "grad_norm": 21.205760955810547, "learning_rate": 7.29e-05, "loss": 6.9065, "step": 250 }, { "epoch": 0.013649189579368726, "grad_norm": 30.357505798339844, "learning_rate": 7.589999999999999e-05, "loss": 6.9887, "step": 260 }, { "epoch": 0.014174158409344445, "grad_norm": 21.6142520904541, "learning_rate": 7.89e-05, "loss": 7.0671, "step": 270 }, { "epoch": 0.014699127239320165, "grad_norm": 34.31865310668945, "learning_rate": 8.19e-05, "loss": 6.9352, "step": 280 }, { "epoch": 0.015224096069295886, "grad_norm": 31.643892288208008, "learning_rate": 8.489999999999999e-05, "loss": 7.0615, "step": 290 }, { "epoch": 0.015749064899271605, "grad_norm": 21.246601104736328, "learning_rate": 8.789999999999998e-05, "loss": 6.8747, "step": 300 }, { "epoch": 0.016274033729247326, "grad_norm": 17.99869155883789, "learning_rate": 9.089999999999999e-05, "loss": 6.9325, "step": 310 }, { "epoch": 0.016799002559223047, "grad_norm": 10.438518524169922, "learning_rate": 9.389999999999999e-05, "loss": 6.975, "step": 320 }, { "epoch": 0.017323971389198767, "grad_norm": 38.324283599853516, "learning_rate": 9.69e-05, "loss": 6.8833, "step": 330 }, { "epoch": 0.017848940219174488, "grad_norm": 25.789045333862305, "learning_rate": 9.99e-05, "loss": 6.869, "step": 340 }, { "epoch": 0.018373909049150206, "grad_norm": 26.649545669555664, "learning_rate": 0.0001029, "loss": 6.8773, "step": 350 }, { "epoch": 0.018898877879125926, "grad_norm": 24.452266693115234, "learning_rate": 0.00010589999999999999, "loss": 6.7558, "step": 360 }, { "epoch": 0.019423846709101647, "grad_norm": 14.234713554382324, "learning_rate": 0.00010889999999999999, "loss": 6.9624, "step": 370 }, { "epoch": 0.019948815539077368, "grad_norm": 16.222957611083984, "learning_rate": 0.0001119, "loss": 6.9116, "step": 380 }, { "epoch": 0.02047378436905309, "grad_norm": 14.955327033996582, "learning_rate": 0.00011489999999999999, "loss": 6.8227, "step": 390 }, { "epoch": 0.02099875319902881, "grad_norm": 13.272610664367676, "learning_rate": 0.00011789999999999999, "loss": 6.8292, "step": 400 }, { "epoch": 0.021523722029004527, "grad_norm": 14.966605186462402, "learning_rate": 0.0001209, "loss": 6.8364, "step": 410 }, { "epoch": 0.022048690858980247, "grad_norm": 11.822840690612793, "learning_rate": 0.00012389999999999998, "loss": 6.668, "step": 420 }, { "epoch": 0.022573659688955968, "grad_norm": 12.50557804107666, "learning_rate": 0.0001269, "loss": 6.6604, "step": 430 }, { "epoch": 0.02309862851893169, "grad_norm": 13.769299507141113, "learning_rate": 0.00012989999999999999, "loss": 6.6969, "step": 440 }, { "epoch": 0.02362359734890741, "grad_norm": 9.62465763092041, "learning_rate": 0.00013289999999999998, "loss": 6.7391, "step": 450 }, { "epoch": 0.02414856617888313, "grad_norm": 8.241267204284668, "learning_rate": 0.0001359, "loss": 6.7064, "step": 460 }, { "epoch": 0.024673535008858848, "grad_norm": 14.394071578979492, "learning_rate": 0.0001389, "loss": 6.7164, "step": 470 }, { "epoch": 0.02519850383883457, "grad_norm": 8.198172569274902, "learning_rate": 0.00014189999999999998, "loss": 6.7228, "step": 480 }, { "epoch": 0.02572347266881029, "grad_norm": 17.51156997680664, "learning_rate": 0.00014489999999999997, "loss": 6.6933, "step": 490 }, { "epoch": 0.02624844149878601, "grad_norm": 14.444514274597168, "learning_rate": 0.0001479, "loss": 6.5789, "step": 500 }, { "epoch": 0.02677341032876173, "grad_norm": 8.710993766784668, "learning_rate": 0.00015089999999999998, "loss": 6.6053, "step": 510 }, { "epoch": 0.02729837915873745, "grad_norm": 11.155731201171875, "learning_rate": 0.0001539, "loss": 6.6003, "step": 520 }, { "epoch": 0.02782334798871317, "grad_norm": 9.0637845993042, "learning_rate": 0.0001569, "loss": 6.5253, "step": 530 }, { "epoch": 0.02834831681868889, "grad_norm": 7.813695907592773, "learning_rate": 0.00015989999999999998, "loss": 6.5777, "step": 540 }, { "epoch": 0.02887328564866461, "grad_norm": 9.640409469604492, "learning_rate": 0.0001629, "loss": 6.5582, "step": 550 }, { "epoch": 0.02939825447864033, "grad_norm": 10.287951469421387, "learning_rate": 0.0001659, "loss": 6.5429, "step": 560 }, { "epoch": 0.02992322330861605, "grad_norm": 8.388657569885254, "learning_rate": 0.00016889999999999996, "loss": 6.4797, "step": 570 }, { "epoch": 0.030448192138591772, "grad_norm": 6.651219844818115, "learning_rate": 0.00017189999999999998, "loss": 6.472, "step": 580 }, { "epoch": 0.03097316096856749, "grad_norm": 6.32115364074707, "learning_rate": 0.00017489999999999997, "loss": 6.4754, "step": 590 }, { "epoch": 0.03149812979854321, "grad_norm": 10.339417457580566, "learning_rate": 0.0001779, "loss": 6.4067, "step": 600 }, { "epoch": 0.03202309862851893, "grad_norm": 7.705801963806152, "learning_rate": 0.00018089999999999998, "loss": 6.4035, "step": 610 }, { "epoch": 0.03254806745849465, "grad_norm": 6.596720218658447, "learning_rate": 0.00018389999999999997, "loss": 6.3301, "step": 620 }, { "epoch": 0.03307303628847037, "grad_norm": 10.351055145263672, "learning_rate": 0.0001869, "loss": 6.3362, "step": 630 }, { "epoch": 0.03359800511844609, "grad_norm": 8.058084487915039, "learning_rate": 0.00018989999999999998, "loss": 6.4833, "step": 640 }, { "epoch": 0.034122973948421814, "grad_norm": 8.515560150146484, "learning_rate": 0.0001929, "loss": 6.2454, "step": 650 }, { "epoch": 0.034647942778397535, "grad_norm": 7.069362640380859, "learning_rate": 0.0001959, "loss": 6.2539, "step": 660 }, { "epoch": 0.035172911608373256, "grad_norm": 6.835115909576416, "learning_rate": 0.00019889999999999998, "loss": 6.2121, "step": 670 }, { "epoch": 0.035697880438348976, "grad_norm": 9.131962776184082, "learning_rate": 0.0002019, "loss": 6.1163, "step": 680 }, { "epoch": 0.03622284926832469, "grad_norm": 6.500721454620361, "learning_rate": 0.0002049, "loss": 6.2233, "step": 690 }, { "epoch": 0.03674781809830041, "grad_norm": 6.955876350402832, "learning_rate": 0.00020789999999999996, "loss": 6.2746, "step": 700 }, { "epoch": 0.03727278692827613, "grad_norm": 12.63397216796875, "learning_rate": 0.00021089999999999998, "loss": 6.2639, "step": 710 }, { "epoch": 0.03779775575825185, "grad_norm": 6.766085624694824, "learning_rate": 0.00021389999999999997, "loss": 6.2185, "step": 720 }, { "epoch": 0.03832272458822757, "grad_norm": 7.125621795654297, "learning_rate": 0.0002169, "loss": 6.2077, "step": 730 }, { "epoch": 0.038847693418203294, "grad_norm": 6.098615646362305, "learning_rate": 0.00021989999999999998, "loss": 6.1988, "step": 740 }, { "epoch": 0.039372662248179015, "grad_norm": 6.724160671234131, "learning_rate": 0.00022289999999999997, "loss": 6.1645, "step": 750 }, { "epoch": 0.039897631078154736, "grad_norm": 6.864727973937988, "learning_rate": 0.0002259, "loss": 5.9853, "step": 760 }, { "epoch": 0.040422599908130456, "grad_norm": 7.888518810272217, "learning_rate": 0.00022889999999999998, "loss": 6.0459, "step": 770 }, { "epoch": 0.04094756873810618, "grad_norm": 5.348147392272949, "learning_rate": 0.0002319, "loss": 6.0306, "step": 780 }, { "epoch": 0.0414725375680819, "grad_norm": 7.666118621826172, "learning_rate": 0.0002349, "loss": 6.0464, "step": 790 }, { "epoch": 0.04199750639805762, "grad_norm": 12.02874755859375, "learning_rate": 0.00023789999999999998, "loss": 5.9991, "step": 800 }, { "epoch": 0.04252247522803333, "grad_norm": 6.495911598205566, "learning_rate": 0.0002409, "loss": 5.9451, "step": 810 }, { "epoch": 0.04304744405800905, "grad_norm": 9.461275100708008, "learning_rate": 0.00024389999999999997, "loss": 5.9558, "step": 820 }, { "epoch": 0.043572412887984774, "grad_norm": 6.616198539733887, "learning_rate": 0.0002469, "loss": 5.9853, "step": 830 }, { "epoch": 0.044097381717960495, "grad_norm": 6.1858086585998535, "learning_rate": 0.00024989999999999995, "loss": 5.9692, "step": 840 }, { "epoch": 0.044622350547936215, "grad_norm": 5.398629188537598, "learning_rate": 0.00025289999999999997, "loss": 5.9193, "step": 850 }, { "epoch": 0.045147319377911936, "grad_norm": 7.980245113372803, "learning_rate": 0.0002559, "loss": 5.8701, "step": 860 }, { "epoch": 0.04567228820788766, "grad_norm": 6.517972946166992, "learning_rate": 0.00025889999999999995, "loss": 5.905, "step": 870 }, { "epoch": 0.04619725703786338, "grad_norm": 6.580096244812012, "learning_rate": 0.00026189999999999997, "loss": 5.7834, "step": 880 }, { "epoch": 0.0467222258678391, "grad_norm": 6.371602535247803, "learning_rate": 0.0002649, "loss": 5.8452, "step": 890 }, { "epoch": 0.04724719469781482, "grad_norm": 6.168027400970459, "learning_rate": 0.0002679, "loss": 5.6781, "step": 900 } ], "logging_steps": 10, "max_steps": 10000000, "num_input_tokens_seen": 0, "num_train_epochs": 525, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.3575928233984e+16, "train_batch_size": 8, "trial_name": null, "trial_params": null }