| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 1.0, |
| "eval_steps": 500, |
| "global_step": 3796, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.026343519494204427, |
| "grad_norm": 1.127703309059143, |
| "learning_rate": 0.003, |
| "loss": 6.6244049072265625, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.05268703898840885, |
| "grad_norm": 0.4761447608470917, |
| "learning_rate": 0.003, |
| "loss": 5.238236694335938, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.07903055848261328, |
| "grad_norm": 0.6752868294715881, |
| "learning_rate": 0.003, |
| "loss": 4.431298522949219, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.1053740779768177, |
| "grad_norm": 0.3623008131980896, |
| "learning_rate": 0.003, |
| "loss": 4.0496432495117185, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.13171759747102213, |
| "grad_norm": 0.43058475852012634, |
| "learning_rate": 0.003, |
| "loss": 3.8711343383789063, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.13171759747102213, |
| "eval_loss": 3.812506675720215, |
| "eval_runtime": 11.5112, |
| "eval_samples_per_second": 168.967, |
| "eval_steps_per_second": 21.197, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.15806111696522657, |
| "grad_norm": 0.32820621132850647, |
| "learning_rate": 0.003, |
| "loss": 3.7587127685546875, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.18440463645943098, |
| "grad_norm": 0.47970837354660034, |
| "learning_rate": 0.003, |
| "loss": 3.6577584838867185, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.2107481559536354, |
| "grad_norm": 0.396938294172287, |
| "learning_rate": 0.003, |
| "loss": 3.5827557373046877, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.23709167544783982, |
| "grad_norm": 0.279178649187088, |
| "learning_rate": 0.003, |
| "loss": 3.5340786743164063, |
| "step": 900 |
| }, |
| { |
| "epoch": 0.26343519494204426, |
| "grad_norm": 0.33553844690322876, |
| "learning_rate": 0.003, |
| "loss": 3.4949127197265626, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.26343519494204426, |
| "eval_loss": 3.4784910678863525, |
| "eval_runtime": 11.3326, |
| "eval_samples_per_second": 171.629, |
| "eval_steps_per_second": 21.531, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.2897787144362487, |
| "grad_norm": 0.2446678876876831, |
| "learning_rate": 0.003, |
| "loss": 3.4653549194335938, |
| "step": 1100 |
| }, |
| { |
| "epoch": 0.31612223393045313, |
| "grad_norm": 0.2247409224510193, |
| "learning_rate": 0.003, |
| "loss": 3.438248596191406, |
| "step": 1200 |
| }, |
| { |
| "epoch": 0.3424657534246575, |
| "grad_norm": 0.2350401133298874, |
| "learning_rate": 0.003, |
| "loss": 3.413848876953125, |
| "step": 1300 |
| }, |
| { |
| "epoch": 0.36880927291886195, |
| "grad_norm": 0.20326821506023407, |
| "learning_rate": 0.003, |
| "loss": 3.3952545166015624, |
| "step": 1400 |
| }, |
| { |
| "epoch": 0.3951527924130664, |
| "grad_norm": 0.2626149356365204, |
| "learning_rate": 0.003, |
| "loss": 3.380882568359375, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.3951527924130664, |
| "eval_loss": 3.3679862022399902, |
| "eval_runtime": 11.3426, |
| "eval_samples_per_second": 171.478, |
| "eval_steps_per_second": 21.512, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.4214963119072708, |
| "grad_norm": 0.20528662204742432, |
| "learning_rate": 0.003, |
| "loss": 3.3632281494140623, |
| "step": 1600 |
| }, |
| { |
| "epoch": 0.44783983140147526, |
| "grad_norm": 0.19370083510875702, |
| "learning_rate": 0.003, |
| "loss": 3.3539483642578123, |
| "step": 1700 |
| }, |
| { |
| "epoch": 0.47418335089567965, |
| "grad_norm": 0.2023897022008896, |
| "learning_rate": 0.003, |
| "loss": 3.341988220214844, |
| "step": 1800 |
| }, |
| { |
| "epoch": 0.5005268703898841, |
| "grad_norm": 0.2200741320848465, |
| "learning_rate": 0.003, |
| "loss": 3.3259597778320313, |
| "step": 1900 |
| }, |
| { |
| "epoch": 0.5268703898840885, |
| "grad_norm": 0.18966667354106903, |
| "learning_rate": 0.003, |
| "loss": 3.3156689453125, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.5268703898840885, |
| "eval_loss": 3.3106234073638916, |
| "eval_runtime": 10.6762, |
| "eval_samples_per_second": 182.182, |
| "eval_steps_per_second": 22.855, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.553213909378293, |
| "grad_norm": 0.19186101853847504, |
| "learning_rate": 0.003, |
| "loss": 3.30958251953125, |
| "step": 2100 |
| }, |
| { |
| "epoch": 0.5795574288724974, |
| "grad_norm": 0.22750510275363922, |
| "learning_rate": 0.003, |
| "loss": 3.3005621337890627, |
| "step": 2200 |
| }, |
| { |
| "epoch": 0.6059009483667018, |
| "grad_norm": 0.18028104305267334, |
| "learning_rate": 0.003, |
| "loss": 3.291654052734375, |
| "step": 2300 |
| }, |
| { |
| "epoch": 0.6322444678609063, |
| "grad_norm": 0.2097722589969635, |
| "learning_rate": 0.003, |
| "loss": 3.283000793457031, |
| "step": 2400 |
| }, |
| { |
| "epoch": 0.6585879873551106, |
| "grad_norm": 0.16670863330364227, |
| "learning_rate": 0.003, |
| "loss": 3.2741189575195313, |
| "step": 2500 |
| }, |
| { |
| "epoch": 0.6585879873551106, |
| "eval_loss": 3.2709083557128906, |
| "eval_runtime": 11.5428, |
| "eval_samples_per_second": 168.503, |
| "eval_steps_per_second": 21.139, |
| "step": 2500 |
| }, |
| { |
| "epoch": 0.684931506849315, |
| "grad_norm": 0.17148427665233612, |
| "learning_rate": 0.003, |
| "loss": 3.2707879638671873, |
| "step": 2600 |
| }, |
| { |
| "epoch": 0.7112750263435195, |
| "grad_norm": 0.18402378261089325, |
| "learning_rate": 0.003, |
| "loss": 3.266829528808594, |
| "step": 2700 |
| }, |
| { |
| "epoch": 0.7376185458377239, |
| "grad_norm": 0.1653515249490738, |
| "learning_rate": 0.003, |
| "loss": 3.257852783203125, |
| "step": 2800 |
| }, |
| { |
| "epoch": 0.7639620653319283, |
| "grad_norm": 0.16761045157909393, |
| "learning_rate": 0.003, |
| "loss": 3.2541189575195313, |
| "step": 2900 |
| }, |
| { |
| "epoch": 0.7903055848261328, |
| "grad_norm": 0.14971940219402313, |
| "learning_rate": 0.003, |
| "loss": 3.248277282714844, |
| "step": 3000 |
| }, |
| { |
| "epoch": 0.7903055848261328, |
| "eval_loss": 3.2431423664093018, |
| "eval_runtime": 11.465, |
| "eval_samples_per_second": 169.647, |
| "eval_steps_per_second": 21.282, |
| "step": 3000 |
| }, |
| { |
| "epoch": 0.8166491043203372, |
| "grad_norm": 0.17114068567752838, |
| "learning_rate": 0.0029508779938349373, |
| "loss": 3.242442321777344, |
| "step": 3100 |
| }, |
| { |
| "epoch": 0.8429926238145417, |
| "grad_norm": 0.152776300907135, |
| "learning_rate": 0.002675231600866892, |
| "loss": 3.2337353515625, |
| "step": 3200 |
| }, |
| { |
| "epoch": 0.8693361433087461, |
| "grad_norm": 0.1631833165884018, |
| "learning_rate": 0.002201098977270783, |
| "loss": 3.221148681640625, |
| "step": 3300 |
| }, |
| { |
| "epoch": 0.8956796628029505, |
| "grad_norm": 0.13488836586475372, |
| "learning_rate": 0.0016085569327630683, |
| "loss": 3.199487609863281, |
| "step": 3400 |
| }, |
| { |
| "epoch": 0.9220231822971549, |
| "grad_norm": 0.12214531749486923, |
| "learning_rate": 0.0009976805817435207, |
| "loss": 3.1805181884765625, |
| "step": 3500 |
| }, |
| { |
| "epoch": 0.9220231822971549, |
| "eval_loss": 3.167757987976074, |
| "eval_runtime": 11.4945, |
| "eval_samples_per_second": 169.211, |
| "eval_steps_per_second": 21.228, |
| "step": 3500 |
| }, |
| { |
| "epoch": 0.9483667017913593, |
| "grad_norm": 0.12541885673999786, |
| "learning_rate": 0.00047164154094220246, |
| "loss": 3.1607696533203127, |
| "step": 3600 |
| }, |
| { |
| "epoch": 0.9747102212855637, |
| "grad_norm": 0.10409854352474213, |
| "learning_rate": 0.00011928315518990008, |
| "loss": 3.1512615966796873, |
| "step": 3700 |
| }, |
| { |
| "epoch": 1.0, |
| "eval_loss": 3.136976957321167, |
| "eval_runtime": 10.5793, |
| "eval_samples_per_second": 183.849, |
| "eval_steps_per_second": 23.064, |
| "step": 3796 |
| } |
| ], |
| "logging_steps": 100, |
| "max_steps": 3796, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 1, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.0656885321498624e+16, |
| "train_batch_size": 256, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|