{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.9844961240310077, "eval_steps": 20, "global_step": 256, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.03875968992248062, "grad_norm": 6.5625, "learning_rate": 2.8641664412814824e-05, "loss": 2.365, "step": 5 }, { "epoch": 0.07751937984496124, "grad_norm": 4.875, "learning_rate": 6.444374492883336e-05, "loss": 2.2188, "step": 10 }, { "epoch": 0.11627906976744186, "grad_norm": 4.03125, "learning_rate": 7.875529867216568e-05, "loss": 2.1965, "step": 15 }, { "epoch": 0.15503875968992248, "grad_norm": 3.40625, "learning_rate": 7.869861806238865e-05, "loss": 2.125, "step": 20 }, { "epoch": 0.1937984496124031, "grad_norm": 3.046875, "learning_rate": 7.859051033349804e-05, "loss": 2.0542, "step": 25 }, { "epoch": 0.23255813953488372, "grad_norm": 3.0625, "learning_rate": 7.843116413585616e-05, "loss": 2.0675, "step": 30 }, { "epoch": 0.2713178294573643, "grad_norm": 2.75, "learning_rate": 7.822085753207902e-05, "loss": 2.0164, "step": 35 }, { "epoch": 0.31007751937984496, "grad_norm": 2.765625, "learning_rate": 7.795995751181111e-05, "loss": 1.9894, "step": 40 }, { "epoch": 0.3488372093023256, "grad_norm": 2.578125, "learning_rate": 7.764891935132029e-05, "loss": 1.9728, "step": 45 }, { "epoch": 0.3875968992248062, "grad_norm": 2.6875, "learning_rate": 7.728828581903074e-05, "loss": 1.9631, "step": 50 }, { "epoch": 0.4263565891472868, "grad_norm": 2.609375, "learning_rate": 7.687868622838021e-05, "loss": 1.9469, "step": 55 }, { "epoch": 0.46511627906976744, "grad_norm": 2.421875, "learning_rate": 7.642083533965407e-05, "loss": 1.9201, "step": 60 }, { "epoch": 0.5038759689922481, "grad_norm": 2.40625, "learning_rate": 7.591553211271311e-05, "loss": 1.9082, "step": 65 }, { "epoch": 0.5426356589147286, "grad_norm": 2.53125, "learning_rate": 7.536365831279087e-05, "loss": 1.8827, "step": 70 }, { "epoch": 0.5813953488372093, "grad_norm": 2.390625, "learning_rate": 7.476617697179401e-05, "loss": 1.9141, "step": 75 }, { "epoch": 0.6201550387596899, "grad_norm": 2.40625, "learning_rate": 7.412413070779045e-05, "loss": 1.8946, "step": 80 }, { "epoch": 0.6589147286821705, "grad_norm": 2.359375, "learning_rate": 7.343863990561798e-05, "loss": 1.8896, "step": 85 }, { "epoch": 0.6976744186046512, "grad_norm": 2.21875, "learning_rate": 7.271090076178798e-05, "loss": 1.8623, "step": 90 }, { "epoch": 0.7364341085271318, "grad_norm": 2.265625, "learning_rate": 7.194218319709636e-05, "loss": 1.8596, "step": 95 }, { "epoch": 0.7751937984496124, "grad_norm": 2.28125, "learning_rate": 7.113382864058384e-05, "loss": 1.8199, "step": 100 }, { "epoch": 0.7751937984496124, "eval_loss": 1.8531988859176636, "eval_runtime": 6.7302, "eval_samples_per_second": 39.226, "eval_steps_per_second": 39.226, "step": 100 }, { "epoch": 0.813953488372093, "grad_norm": 2.265625, "learning_rate": 7.02872476887127e-05, "loss": 1.8224, "step": 105 }, { "epoch": 0.8527131782945736, "grad_norm": 2.265625, "learning_rate": 6.940391764384508e-05, "loss": 1.8168, "step": 110 }, { "epoch": 0.8914728682170543, "grad_norm": 2.1875, "learning_rate": 6.848537993631783e-05, "loss": 1.8176, "step": 115 }, { "epoch": 0.9302325581395349, "grad_norm": 2.203125, "learning_rate": 6.753323743461277e-05, "loss": 1.7909, "step": 120 }, { "epoch": 0.9302325581395349, "eval_loss": 1.818508505821228, "eval_runtime": 6.5621, "eval_samples_per_second": 40.231, "eval_steps_per_second": 40.231, "step": 120 }, { "epoch": 0.9689922480620154, "grad_norm": 2.203125, "learning_rate": 6.654915164831587e-05, "loss": 1.7923, "step": 125 }, { "epoch": 0.9922480620155039, "eval_loss": 1.8079824447631836, "eval_runtime": 6.6044, "eval_samples_per_second": 39.973, "eval_steps_per_second": 39.973, "step": 128 }, { "epoch": 1.0077519379844961, "grad_norm": 2.75, "learning_rate": 6.553483982874658e-05, "loss": 1.6814, "step": 130 }, { "epoch": 1.0465116279069768, "grad_norm": 2.6875, "learning_rate": 6.44920719723166e-05, "loss": 1.4301, "step": 135 }, { "epoch": 1.0852713178294573, "grad_norm": 2.296875, "learning_rate": 6.342266773184709e-05, "loss": 1.3977, "step": 140 }, { "epoch": 1.0852713178294573, "eval_loss": 1.8325544595718384, "eval_runtime": 6.6999, "eval_samples_per_second": 39.404, "eval_steps_per_second": 39.404, "step": 140 }, { "epoch": 1.124031007751938, "grad_norm": 2.328125, "learning_rate": 6.23284932412347e-05, "loss": 1.3706, "step": 145 }, { "epoch": 1.1627906976744187, "grad_norm": 2.265625, "learning_rate": 6.121145785900679e-05, "loss": 1.3717, "step": 150 }, { "epoch": 1.2015503875968991, "grad_norm": 2.296875, "learning_rate": 6.007351083644889e-05, "loss": 1.386, "step": 155 }, { "epoch": 1.2403100775193798, "grad_norm": 2.203125, "learning_rate": 5.89166379161184e-05, "loss": 1.3732, "step": 160 }, { "epoch": 1.2403100775193798, "eval_loss": 1.804962396621704, "eval_runtime": 6.6306, "eval_samples_per_second": 39.815, "eval_steps_per_second": 39.815, "step": 160 }, { "epoch": 1.2790697674418605, "grad_norm": 2.171875, "learning_rate": 5.774285786668016e-05, "loss": 1.3714, "step": 165 }, { "epoch": 1.3178294573643412, "grad_norm": 2.15625, "learning_rate": 5.655421896011079e-05, "loss": 1.3909, "step": 170 }, { "epoch": 1.3565891472868217, "grad_norm": 2.171875, "learning_rate": 5.535279539741907e-05, "loss": 1.3855, "step": 175 }, { "epoch": 1.3953488372093024, "grad_norm": 2.15625, "learning_rate": 5.414068368911964e-05, "loss": 1.364, "step": 180 }, { "epoch": 1.3953488372093024, "eval_loss": 1.7959312200546265, "eval_runtime": 10.3349, "eval_samples_per_second": 25.544, "eval_steps_per_second": 25.544, "step": 180 }, { "epoch": 1.4341085271317828, "grad_norm": 2.140625, "learning_rate": 5.291999899677604e-05, "loss": 1.3704, "step": 185 }, { "epoch": 1.4728682170542635, "grad_norm": 2.078125, "learning_rate": 5.169287144199738e-05, "loss": 1.3877, "step": 190 }, { "epoch": 1.5116279069767442, "grad_norm": 2.140625, "learning_rate": 5.0461442389329213e-05, "loss": 1.3725, "step": 195 }, { "epoch": 1.550387596899225, "grad_norm": 2.21875, "learning_rate": 4.9227860709525484e-05, "loss": 1.3505, "step": 200 }, { "epoch": 1.550387596899225, "eval_loss": 1.7789695262908936, "eval_runtime": 6.8387, "eval_samples_per_second": 38.604, "eval_steps_per_second": 38.604, "step": 200 }, { "epoch": 1.5891472868217056, "grad_norm": 2.21875, "learning_rate": 4.799427902972175e-05, "loss": 1.3643, "step": 205 }, { "epoch": 1.627906976744186, "grad_norm": 2.140625, "learning_rate": 4.676284997705359e-05, "loss": 1.3627, "step": 210 }, { "epoch": 1.6666666666666665, "grad_norm": 2.09375, "learning_rate": 4.553572242227492e-05, "loss": 1.355, "step": 215 }, { "epoch": 1.7054263565891472, "grad_norm": 2.046875, "learning_rate": 4.431503772993132e-05, "loss": 1.368, "step": 220 }, { "epoch": 1.7054263565891472, "eval_loss": 1.7671611309051514, "eval_runtime": 6.5866, "eval_samples_per_second": 40.082, "eval_steps_per_second": 40.082, "step": 220 }, { "epoch": 1.744186046511628, "grad_norm": 2.171875, "learning_rate": 4.310292602163189e-05, "loss": 1.3474, "step": 225 }, { "epoch": 1.7829457364341086, "grad_norm": 2.03125, "learning_rate": 4.190150245894017e-05, "loss": 1.3473, "step": 230 }, { "epoch": 1.8217054263565893, "grad_norm": 2.03125, "learning_rate": 4.07128635523708e-05, "loss": 1.3479, "step": 235 }, { "epoch": 1.8604651162790697, "grad_norm": 2.0625, "learning_rate": 3.953908350293255e-05, "loss": 1.3268, "step": 240 }, { "epoch": 1.8604651162790697, "eval_loss": 1.7548513412475586, "eval_runtime": 6.6079, "eval_samples_per_second": 39.952, "eval_steps_per_second": 39.952, "step": 240 }, { "epoch": 1.8992248062015504, "grad_norm": 2.09375, "learning_rate": 3.8382210582602076e-05, "loss": 1.3408, "step": 245 }, { "epoch": 1.937984496124031, "grad_norm": 2.0625, "learning_rate": 3.724426356004418e-05, "loss": 1.3578, "step": 250 }, { "epoch": 1.9767441860465116, "grad_norm": 2.015625, "learning_rate": 3.612722817781627e-05, "loss": 1.3552, "step": 255 }, { "epoch": 1.9844961240310077, "eval_loss": 1.7418702840805054, "eval_runtime": 6.6959, "eval_samples_per_second": 39.427, "eval_steps_per_second": 39.427, "step": 256 } ], "logging_steps": 5, "max_steps": 387, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 20, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 6.685242865562419e+16, "train_batch_size": 100, "trial_name": null, "trial_params": null }