{ "best_global_step": 2958, "best_metric": 1.3441592454910278, "best_model_checkpoint": "/content/drive/MyDrive/mn_cpt_v3_ckpts_round1/checkpoint-2958", "epoch": 1.0, "eval_steps": 500, "global_step": 2958, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.03380662609871535, "grad_norm": 20.814611434936523, "learning_rate": 1.98e-05, "loss": 2.7703976440429687, "step": 100 }, { "epoch": 0.0676132521974307, "grad_norm": 8.971936225891113, "learning_rate": 1.9940845600356408e-05, "loss": 1.5906294250488282, "step": 200 }, { "epoch": 0.10141987829614604, "grad_norm": 8.869734764099121, "learning_rate": 1.9761702758358067e-05, "loss": 1.5138514709472657, "step": 300 }, { "epoch": 0.1352265043948614, "grad_norm": 7.827669143676758, "learning_rate": 1.9464727839372697e-05, "loss": 1.4664981079101562, "step": 400 }, { "epoch": 0.16903313049357674, "grad_norm": 14.620606422424316, "learning_rate": 1.9053505583930026e-05, "loss": 1.4547904968261718, "step": 500 }, { "epoch": 0.16903313049357674, "eval_loss": 1.4145898818969727, "eval_runtime": 103.2879, "eval_samples_per_second": 3.873, "eval_steps_per_second": 0.484, "step": 500 }, { "epoch": 0.2028397565922921, "grad_norm": 4.778053283691406, "learning_rate": 1.8532999795339947e-05, "loss": 1.4374798583984374, "step": 600 }, { "epoch": 0.23664638269100743, "grad_norm": 6.689450740814209, "learning_rate": 1.7909493422353473e-05, "loss": 1.437916259765625, "step": 700 }, { "epoch": 0.2704530087897228, "grad_norm": 5.550195693969727, "learning_rate": 1.7190512718613252e-05, "loss": 1.417725830078125, "step": 800 }, { "epoch": 0.30425963488843816, "grad_norm": 5.314340591430664, "learning_rate": 1.638473639435381e-05, "loss": 1.4123281860351562, "step": 900 }, { "epoch": 0.3380662609871535, "grad_norm": 4.626297473907471, "learning_rate": 1.5501890856967875e-05, "loss": 1.414586944580078, "step": 1000 }, { "epoch": 0.3380662609871535, "eval_loss": 1.380101203918457, "eval_runtime": 65.1956, "eval_samples_per_second": 6.135, "eval_steps_per_second": 0.767, "step": 1000 }, { "epoch": 0.37187288708586885, "grad_norm": 11.251319885253906, "learning_rate": 1.4552632804974546e-05, "loss": 1.4127529907226561, "step": 1100 }, { "epoch": 0.4056795131845842, "grad_norm": 5.304548263549805, "learning_rate": 1.354842059258024e-05, "loss": 1.4026646423339844, "step": 1200 }, { "epoch": 0.43948613928329955, "grad_norm": 5.564629077911377, "learning_rate": 1.2501375917571837e-05, "loss": 1.4003787231445313, "step": 1300 }, { "epoch": 0.47329276538201487, "grad_norm": 7.565065383911133, "learning_rate": 1.1424137502087119e-05, "loss": 1.3923248291015624, "step": 1400 }, { "epoch": 0.5070993914807302, "grad_norm": 4.881017208099365, "learning_rate": 1.0329708532460358e-05, "loss": 1.392799835205078, "step": 1500 }, { "epoch": 0.5070993914807302, "eval_loss": 1.3630108833312988, "eval_runtime": 64.591, "eval_samples_per_second": 6.193, "eval_steps_per_second": 0.774, "step": 1500 }, { "epoch": 0.5409060175794456, "grad_norm": 6.385213375091553, "learning_rate": 9.231299699674285e-06, "loss": 1.3879092407226563, "step": 1600 }, { "epoch": 0.5747126436781609, "grad_norm": 4.620737075805664, "learning_rate": 8.142169735053952e-06, "loss": 1.4032789611816405, "step": 1700 }, { "epoch": 0.6085192697768763, "grad_norm": 6.220205783843994, "learning_rate": 7.075465366072709e-06, "loss": 1.3808775329589844, "step": 1800 }, { "epoch": 0.6423258958755916, "grad_norm": 8.211082458496094, "learning_rate": 6.044062624140205e-06, "loss": 1.3779316711425782, "step": 1900 }, { "epoch": 0.676132521974307, "grad_norm": 5.718968868255615, "learning_rate": 5.060411419922684e-06, "loss": 1.387956085205078, "step": 2000 }, { "epoch": 0.676132521974307, "eval_loss": 1.3504174947738647, "eval_runtime": 39.7065, "eval_samples_per_second": 10.074, "eval_steps_per_second": 1.259, "step": 2000 }, { "epoch": 0.7099391480730223, "grad_norm": 3.7877399921417236, "learning_rate": 4.136385262304085e-06, "loss": 1.3782768249511719, "step": 2100 }, { "epoch": 0.7437457741717377, "grad_norm": 10.204033851623535, "learning_rate": 3.2831379350081883e-06, "loss": 1.3788711547851562, "step": 2200 }, { "epoch": 0.777552400270453, "grad_norm": 3.7870566844940186, "learning_rate": 2.5109688609172235e-06, "loss": 1.375047607421875, "step": 2300 }, { "epoch": 0.8113590263691683, "grad_norm": 4.114550590515137, "learning_rate": 1.8291987792544041e-06, "loss": 1.376358184814453, "step": 2400 }, { "epoch": 0.8451656524678837, "grad_norm": 3.9523532390594482, "learning_rate": 1.2460572363129009e-06, "loss": 1.3739906311035157, "step": 2500 }, { "epoch": 0.8451656524678837, "eval_loss": 1.3448355197906494, "eval_runtime": 26.8663, "eval_samples_per_second": 14.889, "eval_steps_per_second": 1.861, "step": 2500 }, { "epoch": 0.8789722785665991, "grad_norm": 7.049986362457275, "learning_rate": 7.685832478139521e-07, "loss": 1.3785447692871093, "step": 2600 }, { "epoch": 0.9127789046653144, "grad_norm": 8.738005638122559, "learning_rate": 4.025403319843302e-07, "loss": 1.3778578186035155, "step": 2700 }, { "epoch": 0.9465855307640297, "grad_norm": 8.873653411865234, "learning_rate": 1.5234693897625552e-07, "loss": 1.3746939086914063, "step": 2800 }, { "epoch": 0.9803921568627451, "grad_norm": 4.53987979888916, "learning_rate": 2.102311640604593e-08, "loss": 1.375147705078125, "step": 2900 }, { "epoch": 1.0, "eval_loss": 1.3441592454910278, "eval_runtime": 26.9127, "eval_samples_per_second": 14.863, "eval_steps_per_second": 1.858, "step": 2958 } ], "logging_steps": 100, "max_steps": 2958, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.3047023099032727e+18, "train_batch_size": 45, "trial_name": null, "trial_params": null }