{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 3796, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.026343519494204427, "grad_norm": 1.127703309059143, "learning_rate": 0.003, "loss": 6.6244049072265625, "step": 100 }, { "epoch": 0.05268703898840885, "grad_norm": 0.4761447608470917, "learning_rate": 0.003, "loss": 5.238236694335938, "step": 200 }, { "epoch": 0.07903055848261328, "grad_norm": 0.6752868294715881, "learning_rate": 0.003, "loss": 4.431298522949219, "step": 300 }, { "epoch": 0.1053740779768177, "grad_norm": 0.3623008131980896, "learning_rate": 0.003, "loss": 4.0496432495117185, "step": 400 }, { "epoch": 0.13171759747102213, "grad_norm": 0.43058475852012634, "learning_rate": 0.003, "loss": 3.8711343383789063, "step": 500 }, { "epoch": 0.13171759747102213, "eval_loss": 3.812506675720215, "eval_runtime": 11.5112, "eval_samples_per_second": 168.967, "eval_steps_per_second": 21.197, "step": 500 }, { "epoch": 0.15806111696522657, "grad_norm": 0.32820621132850647, "learning_rate": 0.003, "loss": 3.7587127685546875, "step": 600 }, { "epoch": 0.18440463645943098, "grad_norm": 0.47970837354660034, "learning_rate": 0.003, "loss": 3.6577584838867185, "step": 700 }, { "epoch": 0.2107481559536354, "grad_norm": 0.396938294172287, "learning_rate": 0.003, "loss": 3.5827557373046877, "step": 800 }, { "epoch": 0.23709167544783982, "grad_norm": 0.279178649187088, "learning_rate": 0.003, "loss": 3.5340786743164063, "step": 900 }, { "epoch": 0.26343519494204426, "grad_norm": 0.33553844690322876, "learning_rate": 0.003, "loss": 3.4949127197265626, "step": 1000 }, { "epoch": 0.26343519494204426, "eval_loss": 3.4784910678863525, "eval_runtime": 11.3326, "eval_samples_per_second": 171.629, "eval_steps_per_second": 21.531, "step": 1000 }, { "epoch": 0.2897787144362487, "grad_norm": 0.2446678876876831, "learning_rate": 0.003, "loss": 3.4653549194335938, "step": 1100 }, { "epoch": 0.31612223393045313, "grad_norm": 0.2247409224510193, "learning_rate": 0.003, "loss": 3.438248596191406, "step": 1200 }, { "epoch": 0.3424657534246575, "grad_norm": 0.2350401133298874, "learning_rate": 0.003, "loss": 3.413848876953125, "step": 1300 }, { "epoch": 0.36880927291886195, "grad_norm": 0.20326821506023407, "learning_rate": 0.003, "loss": 3.3952545166015624, "step": 1400 }, { "epoch": 0.3951527924130664, "grad_norm": 0.2626149356365204, "learning_rate": 0.003, "loss": 3.380882568359375, "step": 1500 }, { "epoch": 0.3951527924130664, "eval_loss": 3.3679862022399902, "eval_runtime": 11.3426, "eval_samples_per_second": 171.478, "eval_steps_per_second": 21.512, "step": 1500 }, { "epoch": 0.4214963119072708, "grad_norm": 0.20528662204742432, "learning_rate": 0.003, "loss": 3.3632281494140623, "step": 1600 }, { "epoch": 0.44783983140147526, "grad_norm": 0.19370083510875702, "learning_rate": 0.003, "loss": 3.3539483642578123, "step": 1700 }, { "epoch": 0.47418335089567965, "grad_norm": 0.2023897022008896, "learning_rate": 0.003, "loss": 3.341988220214844, "step": 1800 }, { "epoch": 0.5005268703898841, "grad_norm": 0.2200741320848465, "learning_rate": 0.003, "loss": 3.3259597778320313, "step": 1900 }, { "epoch": 0.5268703898840885, "grad_norm": 0.18966667354106903, "learning_rate": 0.003, "loss": 3.3156689453125, "step": 2000 }, { "epoch": 0.5268703898840885, "eval_loss": 3.3106234073638916, "eval_runtime": 10.6762, "eval_samples_per_second": 182.182, "eval_steps_per_second": 22.855, "step": 2000 }, { "epoch": 0.553213909378293, "grad_norm": 0.19186101853847504, "learning_rate": 0.003, "loss": 3.30958251953125, "step": 2100 }, { "epoch": 0.5795574288724974, "grad_norm": 0.22750510275363922, "learning_rate": 0.003, "loss": 3.3005621337890627, "step": 2200 }, { "epoch": 0.6059009483667018, "grad_norm": 0.18028104305267334, "learning_rate": 0.003, "loss": 3.291654052734375, "step": 2300 }, { "epoch": 0.6322444678609063, "grad_norm": 0.2097722589969635, "learning_rate": 0.003, "loss": 3.283000793457031, "step": 2400 }, { "epoch": 0.6585879873551106, "grad_norm": 0.16670863330364227, "learning_rate": 0.003, "loss": 3.2741189575195313, "step": 2500 }, { "epoch": 0.6585879873551106, "eval_loss": 3.2709083557128906, "eval_runtime": 11.5428, "eval_samples_per_second": 168.503, "eval_steps_per_second": 21.139, "step": 2500 }, { "epoch": 0.684931506849315, "grad_norm": 0.17148427665233612, "learning_rate": 0.003, "loss": 3.2707879638671873, "step": 2600 }, { "epoch": 0.7112750263435195, "grad_norm": 0.18402378261089325, "learning_rate": 0.003, "loss": 3.266829528808594, "step": 2700 }, { "epoch": 0.7376185458377239, "grad_norm": 0.1653515249490738, "learning_rate": 0.003, "loss": 3.257852783203125, "step": 2800 }, { "epoch": 0.7639620653319283, "grad_norm": 0.16761045157909393, "learning_rate": 0.003, "loss": 3.2541189575195313, "step": 2900 }, { "epoch": 0.7903055848261328, "grad_norm": 0.14971940219402313, "learning_rate": 0.003, "loss": 3.248277282714844, "step": 3000 }, { "epoch": 0.7903055848261328, "eval_loss": 3.2431423664093018, "eval_runtime": 11.465, "eval_samples_per_second": 169.647, "eval_steps_per_second": 21.282, "step": 3000 }, { "epoch": 0.8166491043203372, "grad_norm": 0.17114068567752838, "learning_rate": 0.0029508779938349373, "loss": 3.242442321777344, "step": 3100 }, { "epoch": 0.8429926238145417, "grad_norm": 0.152776300907135, "learning_rate": 0.002675231600866892, "loss": 3.2337353515625, "step": 3200 }, { "epoch": 0.8693361433087461, "grad_norm": 0.1631833165884018, "learning_rate": 0.002201098977270783, "loss": 3.221148681640625, "step": 3300 }, { "epoch": 0.8956796628029505, "grad_norm": 0.13488836586475372, "learning_rate": 0.0016085569327630683, "loss": 3.199487609863281, "step": 3400 }, { "epoch": 0.9220231822971549, "grad_norm": 0.12214531749486923, "learning_rate": 0.0009976805817435207, "loss": 3.1805181884765625, "step": 3500 }, { "epoch": 0.9220231822971549, "eval_loss": 3.167757987976074, "eval_runtime": 11.4945, "eval_samples_per_second": 169.211, "eval_steps_per_second": 21.228, "step": 3500 }, { "epoch": 0.9483667017913593, "grad_norm": 0.12541885673999786, "learning_rate": 0.00047164154094220246, "loss": 3.1607696533203127, "step": 3600 }, { "epoch": 0.9747102212855637, "grad_norm": 0.10409854352474213, "learning_rate": 0.00011928315518990008, "loss": 3.1512615966796873, "step": 3700 }, { "epoch": 1.0, "eval_loss": 3.136976957321167, "eval_runtime": 10.5793, "eval_samples_per_second": 183.849, "eval_steps_per_second": 23.064, "step": 3796 } ], "logging_steps": 100, "max_steps": 3796, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.0656885321498624e+16, "train_batch_size": 256, "trial_name": null, "trial_params": null }