{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 313, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "alignment_loss": 0.956536, "epoch": 0.032, "grad_norm": 8938.3779296875, "learning_rate": 9e-06, "loss": 537.496, "mean_token_accuracy": 0.6349152714014054, "num_tokens": 684434.0, "step": 10, "teacher_ce_loss": 67.311574 }, { "alignment_loss": 0.953701, "epoch": 0.064, "grad_norm": 2418.03369140625, "learning_rate": 9.702970297029704e-06, "loss": 148.2146, "mean_token_accuracy": 0.7730402827262879, "num_tokens": 1350616.0, "step": 20, "teacher_ce_loss": 19.467055 }, { "alignment_loss": 0.953897, "epoch": 0.096, "grad_norm": 2525.4296875, "learning_rate": 9.372937293729373e-06, "loss": 106.736, "mean_token_accuracy": 0.7940315298736096, "num_tokens": 2048862.0, "step": 30, "teacher_ce_loss": 13.013605 }, { "alignment_loss": 0.947818, "epoch": 0.128, "grad_norm": 2252.9521484375, "learning_rate": 9.042904290429043e-06, "loss": 79.3102, "mean_token_accuracy": 0.8635720252990723, "num_tokens": 2752423.0, "step": 40, "teacher_ce_loss": 9.476292 }, { "alignment_loss": 0.93975, "epoch": 0.16, "grad_norm": 941.5345458984375, "learning_rate": 8.712871287128714e-06, "loss": 57.8999, "mean_token_accuracy": 0.8709644131362438, "num_tokens": 3415991.0, "step": 50, "teacher_ce_loss": 7.637903 }, { "alignment_loss": 0.93242, "epoch": 0.192, "grad_norm": 494.6402587890625, "learning_rate": 8.382838283828383e-06, "loss": 49.9108, "mean_token_accuracy": 0.8711144886910915, "num_tokens": 4092597.0, "step": 60, "teacher_ce_loss": 5.167176 }, { "alignment_loss": 0.927774, "epoch": 0.224, "grad_norm": 448.8665466308594, "learning_rate": 8.052805280528053e-06, "loss": 48.3418, "mean_token_accuracy": 0.8714926809072494, "num_tokens": 4782962.0, "step": 70, "teacher_ce_loss": 6.822194 }, { "alignment_loss": 0.922368, "epoch": 0.256, "grad_norm": 512.7625122070312, "learning_rate": 7.722772277227724e-06, "loss": 50.2869, "mean_token_accuracy": 0.8667933315038681, "num_tokens": 5463890.0, "step": 80, "teacher_ce_loss": 6.749592 }, { "alignment_loss": 0.914546, "epoch": 0.288, "grad_norm": 405.1988220214844, "learning_rate": 7.392739273927393e-06, "loss": 49.6484, "mean_token_accuracy": 0.8680442161858082, "num_tokens": 6146518.0, "step": 90, "teacher_ce_loss": 7.311445 }, { "alignment_loss": 0.910286, "epoch": 0.32, "grad_norm": 389.6947937011719, "learning_rate": 7.062706270627063e-06, "loss": 50.4636, "mean_token_accuracy": 0.8658453419804573, "num_tokens": 6826396.0, "step": 100, "teacher_ce_loss": 5.171713 }, { "alignment_loss": 0.902513, "epoch": 0.352, "grad_norm": 429.2699890136719, "learning_rate": 6.732673267326733e-06, "loss": 47.7155, "mean_token_accuracy": 0.8693347111344337, "num_tokens": 7517684.0, "step": 110, "teacher_ce_loss": 5.650189 }, { "alignment_loss": 0.896312, "epoch": 0.384, "grad_norm": 430.8398742675781, "learning_rate": 6.402640264026403e-06, "loss": 47.995, "mean_token_accuracy": 0.8666416265070438, "num_tokens": 8188946.0, "step": 120, "teacher_ce_loss": 7.503155 }, { "alignment_loss": 0.893979, "epoch": 0.416, "grad_norm": 791.207275390625, "learning_rate": 6.072607260726073e-06, "loss": 46.9929, "mean_token_accuracy": 0.873030910640955, "num_tokens": 8874685.0, "step": 130, "teacher_ce_loss": 5.863695 }, { "alignment_loss": 0.892291, "epoch": 0.448, "grad_norm": 438.9299011230469, "learning_rate": 5.7425742574257425e-06, "loss": 46.5332, "mean_token_accuracy": 0.8730357453227043, "num_tokens": 9566920.0, "step": 140, "teacher_ce_loss": 4.956036 }, { "alignment_loss": 0.887302, "epoch": 0.48, "grad_norm": 455.186767578125, "learning_rate": 5.412541254125413e-06, "loss": 47.4667, "mean_token_accuracy": 0.8698927395045757, "num_tokens": 10249181.0, "step": 150, "teacher_ce_loss": 5.094092 }, { "alignment_loss": 0.887032, "epoch": 0.512, "grad_norm": 398.2301330566406, "learning_rate": 5.082508250825083e-06, "loss": 44.8594, "mean_token_accuracy": 0.8733536802232266, "num_tokens": 10942070.0, "step": 160, "teacher_ce_loss": 6.080262 }, { "alignment_loss": 0.885581, "epoch": 0.544, "grad_norm": 391.7760314941406, "learning_rate": 4.7524752475247525e-06, "loss": 46.027, "mean_token_accuracy": 0.8712647803127765, "num_tokens": 11634781.0, "step": 170, "teacher_ce_loss": 5.655279 }, { "alignment_loss": 0.883271, "epoch": 0.576, "grad_norm": 411.50592041015625, "learning_rate": 4.422442244224423e-06, "loss": 45.4771, "mean_token_accuracy": 0.8760336212813854, "num_tokens": 12331934.0, "step": 180, "teacher_ce_loss": 5.976733 }, { "alignment_loss": 0.879363, "epoch": 0.608, "grad_norm": 406.4468078613281, "learning_rate": 4.092409240924093e-06, "loss": 43.7762, "mean_token_accuracy": 0.8771503999829292, "num_tokens": 13004167.0, "step": 190, "teacher_ce_loss": 6.10556 }, { "alignment_loss": 0.873679, "epoch": 0.64, "grad_norm": 422.99945068359375, "learning_rate": 3.7623762376237625e-06, "loss": 44.5788, "mean_token_accuracy": 0.8752013951539993, "num_tokens": 13689914.0, "step": 200, "teacher_ce_loss": 5.429278 }, { "alignment_loss": 0.863939, "epoch": 0.672, "grad_norm": 415.8448486328125, "learning_rate": 3.4323432343234324e-06, "loss": 42.7953, "mean_token_accuracy": 0.8772109493613243, "num_tokens": 14378852.0, "step": 210, "teacher_ce_loss": 4.237569 }, { "alignment_loss": 0.862601, "epoch": 0.704, "grad_norm": 368.5125732421875, "learning_rate": 3.1023102310231023e-06, "loss": 42.6845, "mean_token_accuracy": 0.8811097137629986, "num_tokens": 15067474.0, "step": 220, "teacher_ce_loss": 5.223768 }, { "alignment_loss": 0.856529, "epoch": 0.736, "grad_norm": 400.0111083984375, "learning_rate": 2.7722772277227726e-06, "loss": 43.299, "mean_token_accuracy": 0.8764385782182217, "num_tokens": 15767042.0, "step": 230, "teacher_ce_loss": 5.99914 }, { "alignment_loss": 0.849113, "epoch": 0.768, "grad_norm": 412.9610900878906, "learning_rate": 2.4422442244224424e-06, "loss": 44.0378, "mean_token_accuracy": 0.8751519277691842, "num_tokens": 16463926.0, "step": 240, "teacher_ce_loss": 5.501055 }, { "alignment_loss": 0.850236, "epoch": 0.8, "grad_norm": 390.5102233886719, "learning_rate": 2.1122112211221123e-06, "loss": 44.4366, "mean_token_accuracy": 0.8718901112675667, "num_tokens": 17171085.0, "step": 250, "teacher_ce_loss": 6.008397 }, { "alignment_loss": 0.848085, "epoch": 0.832, "grad_norm": 373.6785583496094, "learning_rate": 1.7821782178217822e-06, "loss": 43.3382, "mean_token_accuracy": 0.8724160015583038, "num_tokens": 17873884.0, "step": 260, "teacher_ce_loss": 6.177311 }, { "alignment_loss": 0.842402, "epoch": 0.864, "grad_norm": 401.6341247558594, "learning_rate": 1.4521452145214523e-06, "loss": 42.9951, "mean_token_accuracy": 0.8800486765801907, "num_tokens": 18561026.0, "step": 270, "teacher_ce_loss": 5.229172 }, { "alignment_loss": 0.842598, "epoch": 0.896, "grad_norm": 348.2569885253906, "learning_rate": 1.1221122112211221e-06, "loss": 43.8781, "mean_token_accuracy": 0.8713223539292813, "num_tokens": 19268650.0, "step": 280, "teacher_ce_loss": 5.308041 }, { "alignment_loss": 0.840163, "epoch": 0.928, "grad_norm": 397.3896179199219, "learning_rate": 7.920792079207921e-07, "loss": 43.2348, "mean_token_accuracy": 0.8775620862841607, "num_tokens": 19979134.0, "step": 290, "teacher_ce_loss": 4.710304 }, { "alignment_loss": 0.842505, "epoch": 0.96, "grad_norm": 434.8416442871094, "learning_rate": 4.6204620462046204e-07, "loss": 42.5038, "mean_token_accuracy": 0.880195677280426, "num_tokens": 20671599.0, "step": 300, "teacher_ce_loss": 5.022283 }, { "alignment_loss": 0.84056, "epoch": 0.992, "grad_norm": 391.82354736328125, "learning_rate": 1.3201320132013202e-07, "loss": 42.0722, "mean_token_accuracy": 0.8764784179627896, "num_tokens": 21386663.0, "step": 310, "teacher_ce_loss": 5.886476 } ], "logging_steps": 10, "max_steps": 313, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.002134616338858e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }