| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 1.9844961240310077, |
| "eval_steps": 20, |
| "global_step": 256, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.03875968992248062, |
| "grad_norm": 6.5625, |
| "learning_rate": 2.8641664412814824e-05, |
| "loss": 2.365, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.07751937984496124, |
| "grad_norm": 4.875, |
| "learning_rate": 6.444374492883336e-05, |
| "loss": 2.2188, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.11627906976744186, |
| "grad_norm": 4.03125, |
| "learning_rate": 7.875529867216568e-05, |
| "loss": 2.1965, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.15503875968992248, |
| "grad_norm": 3.40625, |
| "learning_rate": 7.869861806238865e-05, |
| "loss": 2.125, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.1937984496124031, |
| "grad_norm": 3.046875, |
| "learning_rate": 7.859051033349804e-05, |
| "loss": 2.0542, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.23255813953488372, |
| "grad_norm": 3.0625, |
| "learning_rate": 7.843116413585616e-05, |
| "loss": 2.0675, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.2713178294573643, |
| "grad_norm": 2.75, |
| "learning_rate": 7.822085753207902e-05, |
| "loss": 2.0164, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.31007751937984496, |
| "grad_norm": 2.765625, |
| "learning_rate": 7.795995751181111e-05, |
| "loss": 1.9894, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.3488372093023256, |
| "grad_norm": 2.578125, |
| "learning_rate": 7.764891935132029e-05, |
| "loss": 1.9728, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.3875968992248062, |
| "grad_norm": 2.6875, |
| "learning_rate": 7.728828581903074e-05, |
| "loss": 1.9631, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.4263565891472868, |
| "grad_norm": 2.609375, |
| "learning_rate": 7.687868622838021e-05, |
| "loss": 1.9469, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.46511627906976744, |
| "grad_norm": 2.421875, |
| "learning_rate": 7.642083533965407e-05, |
| "loss": 1.9201, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.5038759689922481, |
| "grad_norm": 2.40625, |
| "learning_rate": 7.591553211271311e-05, |
| "loss": 1.9082, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.5426356589147286, |
| "grad_norm": 2.53125, |
| "learning_rate": 7.536365831279087e-05, |
| "loss": 1.8827, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.5813953488372093, |
| "grad_norm": 2.390625, |
| "learning_rate": 7.476617697179401e-05, |
| "loss": 1.9141, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.6201550387596899, |
| "grad_norm": 2.40625, |
| "learning_rate": 7.412413070779045e-05, |
| "loss": 1.8946, |
| "step": 80 |
| }, |
| { |
| "epoch": 0.6589147286821705, |
| "grad_norm": 2.359375, |
| "learning_rate": 7.343863990561798e-05, |
| "loss": 1.8896, |
| "step": 85 |
| }, |
| { |
| "epoch": 0.6976744186046512, |
| "grad_norm": 2.21875, |
| "learning_rate": 7.271090076178798e-05, |
| "loss": 1.8623, |
| "step": 90 |
| }, |
| { |
| "epoch": 0.7364341085271318, |
| "grad_norm": 2.265625, |
| "learning_rate": 7.194218319709636e-05, |
| "loss": 1.8596, |
| "step": 95 |
| }, |
| { |
| "epoch": 0.7751937984496124, |
| "grad_norm": 2.28125, |
| "learning_rate": 7.113382864058384e-05, |
| "loss": 1.8199, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.7751937984496124, |
| "eval_loss": 1.8531988859176636, |
| "eval_runtime": 6.7302, |
| "eval_samples_per_second": 39.226, |
| "eval_steps_per_second": 39.226, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.813953488372093, |
| "grad_norm": 2.265625, |
| "learning_rate": 7.02872476887127e-05, |
| "loss": 1.8224, |
| "step": 105 |
| }, |
| { |
| "epoch": 0.8527131782945736, |
| "grad_norm": 2.265625, |
| "learning_rate": 6.940391764384508e-05, |
| "loss": 1.8168, |
| "step": 110 |
| }, |
| { |
| "epoch": 0.8914728682170543, |
| "grad_norm": 2.1875, |
| "learning_rate": 6.848537993631783e-05, |
| "loss": 1.8176, |
| "step": 115 |
| }, |
| { |
| "epoch": 0.9302325581395349, |
| "grad_norm": 2.203125, |
| "learning_rate": 6.753323743461277e-05, |
| "loss": 1.7909, |
| "step": 120 |
| }, |
| { |
| "epoch": 0.9302325581395349, |
| "eval_loss": 1.818508505821228, |
| "eval_runtime": 6.5621, |
| "eval_samples_per_second": 40.231, |
| "eval_steps_per_second": 40.231, |
| "step": 120 |
| }, |
| { |
| "epoch": 0.9689922480620154, |
| "grad_norm": 2.203125, |
| "learning_rate": 6.654915164831587e-05, |
| "loss": 1.7923, |
| "step": 125 |
| }, |
| { |
| "epoch": 0.9922480620155039, |
| "eval_loss": 1.8079824447631836, |
| "eval_runtime": 6.6044, |
| "eval_samples_per_second": 39.973, |
| "eval_steps_per_second": 39.973, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.0077519379844961, |
| "grad_norm": 2.75, |
| "learning_rate": 6.553483982874658e-05, |
| "loss": 1.6814, |
| "step": 130 |
| }, |
| { |
| "epoch": 1.0465116279069768, |
| "grad_norm": 2.6875, |
| "learning_rate": 6.44920719723166e-05, |
| "loss": 1.4301, |
| "step": 135 |
| }, |
| { |
| "epoch": 1.0852713178294573, |
| "grad_norm": 2.296875, |
| "learning_rate": 6.342266773184709e-05, |
| "loss": 1.3977, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.0852713178294573, |
| "eval_loss": 1.8325544595718384, |
| "eval_runtime": 6.6999, |
| "eval_samples_per_second": 39.404, |
| "eval_steps_per_second": 39.404, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.124031007751938, |
| "grad_norm": 2.328125, |
| "learning_rate": 6.23284932412347e-05, |
| "loss": 1.3706, |
| "step": 145 |
| }, |
| { |
| "epoch": 1.1627906976744187, |
| "grad_norm": 2.265625, |
| "learning_rate": 6.121145785900679e-05, |
| "loss": 1.3717, |
| "step": 150 |
| }, |
| { |
| "epoch": 1.2015503875968991, |
| "grad_norm": 2.296875, |
| "learning_rate": 6.007351083644889e-05, |
| "loss": 1.386, |
| "step": 155 |
| }, |
| { |
| "epoch": 1.2403100775193798, |
| "grad_norm": 2.203125, |
| "learning_rate": 5.89166379161184e-05, |
| "loss": 1.3732, |
| "step": 160 |
| }, |
| { |
| "epoch": 1.2403100775193798, |
| "eval_loss": 1.804962396621704, |
| "eval_runtime": 6.6306, |
| "eval_samples_per_second": 39.815, |
| "eval_steps_per_second": 39.815, |
| "step": 160 |
| }, |
| { |
| "epoch": 1.2790697674418605, |
| "grad_norm": 2.171875, |
| "learning_rate": 5.774285786668016e-05, |
| "loss": 1.3714, |
| "step": 165 |
| }, |
| { |
| "epoch": 1.3178294573643412, |
| "grad_norm": 2.15625, |
| "learning_rate": 5.655421896011079e-05, |
| "loss": 1.3909, |
| "step": 170 |
| }, |
| { |
| "epoch": 1.3565891472868217, |
| "grad_norm": 2.171875, |
| "learning_rate": 5.535279539741907e-05, |
| "loss": 1.3855, |
| "step": 175 |
| }, |
| { |
| "epoch": 1.3953488372093024, |
| "grad_norm": 2.15625, |
| "learning_rate": 5.414068368911964e-05, |
| "loss": 1.364, |
| "step": 180 |
| }, |
| { |
| "epoch": 1.3953488372093024, |
| "eval_loss": 1.7959312200546265, |
| "eval_runtime": 10.3349, |
| "eval_samples_per_second": 25.544, |
| "eval_steps_per_second": 25.544, |
| "step": 180 |
| }, |
| { |
| "epoch": 1.4341085271317828, |
| "grad_norm": 2.140625, |
| "learning_rate": 5.291999899677604e-05, |
| "loss": 1.3704, |
| "step": 185 |
| }, |
| { |
| "epoch": 1.4728682170542635, |
| "grad_norm": 2.078125, |
| "learning_rate": 5.169287144199738e-05, |
| "loss": 1.3877, |
| "step": 190 |
| }, |
| { |
| "epoch": 1.5116279069767442, |
| "grad_norm": 2.140625, |
| "learning_rate": 5.0461442389329213e-05, |
| "loss": 1.3725, |
| "step": 195 |
| }, |
| { |
| "epoch": 1.550387596899225, |
| "grad_norm": 2.21875, |
| "learning_rate": 4.9227860709525484e-05, |
| "loss": 1.3505, |
| "step": 200 |
| }, |
| { |
| "epoch": 1.550387596899225, |
| "eval_loss": 1.7789695262908936, |
| "eval_runtime": 6.8387, |
| "eval_samples_per_second": 38.604, |
| "eval_steps_per_second": 38.604, |
| "step": 200 |
| }, |
| { |
| "epoch": 1.5891472868217056, |
| "grad_norm": 2.21875, |
| "learning_rate": 4.799427902972175e-05, |
| "loss": 1.3643, |
| "step": 205 |
| }, |
| { |
| "epoch": 1.627906976744186, |
| "grad_norm": 2.140625, |
| "learning_rate": 4.676284997705359e-05, |
| "loss": 1.3627, |
| "step": 210 |
| }, |
| { |
| "epoch": 1.6666666666666665, |
| "grad_norm": 2.09375, |
| "learning_rate": 4.553572242227492e-05, |
| "loss": 1.355, |
| "step": 215 |
| }, |
| { |
| "epoch": 1.7054263565891472, |
| "grad_norm": 2.046875, |
| "learning_rate": 4.431503772993132e-05, |
| "loss": 1.368, |
| "step": 220 |
| }, |
| { |
| "epoch": 1.7054263565891472, |
| "eval_loss": 1.7671611309051514, |
| "eval_runtime": 6.5866, |
| "eval_samples_per_second": 40.082, |
| "eval_steps_per_second": 40.082, |
| "step": 220 |
| }, |
| { |
| "epoch": 1.744186046511628, |
| "grad_norm": 2.171875, |
| "learning_rate": 4.310292602163189e-05, |
| "loss": 1.3474, |
| "step": 225 |
| }, |
| { |
| "epoch": 1.7829457364341086, |
| "grad_norm": 2.03125, |
| "learning_rate": 4.190150245894017e-05, |
| "loss": 1.3473, |
| "step": 230 |
| }, |
| { |
| "epoch": 1.8217054263565893, |
| "grad_norm": 2.03125, |
| "learning_rate": 4.07128635523708e-05, |
| "loss": 1.3479, |
| "step": 235 |
| }, |
| { |
| "epoch": 1.8604651162790697, |
| "grad_norm": 2.0625, |
| "learning_rate": 3.953908350293255e-05, |
| "loss": 1.3268, |
| "step": 240 |
| }, |
| { |
| "epoch": 1.8604651162790697, |
| "eval_loss": 1.7548513412475586, |
| "eval_runtime": 6.6079, |
| "eval_samples_per_second": 39.952, |
| "eval_steps_per_second": 39.952, |
| "step": 240 |
| }, |
| { |
| "epoch": 1.8992248062015504, |
| "grad_norm": 2.09375, |
| "learning_rate": 3.8382210582602076e-05, |
| "loss": 1.3408, |
| "step": 245 |
| }, |
| { |
| "epoch": 1.937984496124031, |
| "grad_norm": 2.0625, |
| "learning_rate": 3.724426356004418e-05, |
| "loss": 1.3578, |
| "step": 250 |
| }, |
| { |
| "epoch": 1.9767441860465116, |
| "grad_norm": 2.015625, |
| "learning_rate": 3.612722817781627e-05, |
| "loss": 1.3552, |
| "step": 255 |
| }, |
| { |
| "epoch": 1.9844961240310077, |
| "eval_loss": 1.7418702840805054, |
| "eval_runtime": 6.6959, |
| "eval_samples_per_second": 39.427, |
| "eval_steps_per_second": 39.427, |
| "step": 256 |
| } |
| ], |
| "logging_steps": 5, |
| "max_steps": 387, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 3, |
| "save_steps": 20, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 6.685242865562419e+16, |
| "train_batch_size": 100, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|