| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 3.3955925826390754, |
| "eval_steps": 100, |
| "global_step": 200, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.08599838753023381, |
| "grad_norm": 20.39691162109375, |
| "learning_rate": 4e-08, |
| "loss": 1.1993448257446289, |
| "num_input_tokens_seen": 95768, |
| "step": 5, |
| "train_runtime": 130.2777, |
| "train_tokens_per_second": 735.107 |
| }, |
| { |
| "epoch": 0.17199677506046762, |
| "grad_norm": 20.53337860107422, |
| "learning_rate": 9e-08, |
| "loss": 1.23364200592041, |
| "num_input_tokens_seen": 192088, |
| "step": 10, |
| "train_runtime": 256.1595, |
| "train_tokens_per_second": 749.876 |
| }, |
| { |
| "epoch": 0.25799516259070143, |
| "grad_norm": 17.26736068725586, |
| "learning_rate": 1.4e-07, |
| "loss": 1.2103577613830567, |
| "num_input_tokens_seen": 285904, |
| "step": 15, |
| "train_runtime": 381.9483, |
| "train_tokens_per_second": 748.541 |
| }, |
| { |
| "epoch": 0.34399355012093524, |
| "grad_norm": 13.094156265258789, |
| "learning_rate": 1.8999999999999998e-07, |
| "loss": 1.1606547355651855, |
| "num_input_tokens_seen": 380136, |
| "step": 20, |
| "train_runtime": 507.8013, |
| "train_tokens_per_second": 748.592 |
| }, |
| { |
| "epoch": 0.42999193765116905, |
| "grad_norm": 8.614981651306152, |
| "learning_rate": 2.4e-07, |
| "loss": 1.1257909774780273, |
| "num_input_tokens_seen": 473768, |
| "step": 25, |
| "train_runtime": 634.7096, |
| "train_tokens_per_second": 746.433 |
| }, |
| { |
| "epoch": 0.5159903251814029, |
| "grad_norm": 6.893142223358154, |
| "learning_rate": 2.9e-07, |
| "loss": 1.0529449462890625, |
| "num_input_tokens_seen": 570960, |
| "step": 30, |
| "train_runtime": 760.0374, |
| "train_tokens_per_second": 751.226 |
| }, |
| { |
| "epoch": 0.6019887127116367, |
| "grad_norm": 6.435474395751953, |
| "learning_rate": 3.4000000000000003e-07, |
| "loss": 0.9501470565795899, |
| "num_input_tokens_seen": 666904, |
| "step": 35, |
| "train_runtime": 885.8858, |
| "train_tokens_per_second": 752.81 |
| }, |
| { |
| "epoch": 0.6879871002418705, |
| "grad_norm": 6.33709192276001, |
| "learning_rate": 3.8999999999999997e-07, |
| "loss": 0.9997085571289063, |
| "num_input_tokens_seen": 759040, |
| "step": 40, |
| "train_runtime": 1011.9639, |
| "train_tokens_per_second": 750.066 |
| }, |
| { |
| "epoch": 0.7739854877721043, |
| "grad_norm": 6.392234802246094, |
| "learning_rate": 4.3999999999999997e-07, |
| "loss": 0.941748046875, |
| "num_input_tokens_seen": 854112, |
| "step": 45, |
| "train_runtime": 1137.7802, |
| "train_tokens_per_second": 750.683 |
| }, |
| { |
| "epoch": 0.8599838753023381, |
| "grad_norm": 6.084305763244629, |
| "learning_rate": 4.9e-07, |
| "loss": 0.8405242919921875, |
| "num_input_tokens_seen": 950760, |
| "step": 50, |
| "train_runtime": 1263.8056, |
| "train_tokens_per_second": 752.299 |
| }, |
| { |
| "epoch": 0.9459822628325719, |
| "grad_norm": 5.806552886962891, |
| "learning_rate": 5.4e-07, |
| "loss": 0.8304224014282227, |
| "num_input_tokens_seen": 1044848, |
| "step": 55, |
| "train_runtime": 1389.4662, |
| "train_tokens_per_second": 751.978 |
| }, |
| { |
| "epoch": 1.0171996775060468, |
| "grad_norm": 5.317915439605713, |
| "learning_rate": 5.9e-07, |
| "loss": 0.7544718265533448, |
| "num_input_tokens_seen": 1125192, |
| "step": 60, |
| "train_runtime": 1494.191, |
| "train_tokens_per_second": 753.044 |
| }, |
| { |
| "epoch": 1.1031980650362805, |
| "grad_norm": 5.279268741607666, |
| "learning_rate": 6.4e-07, |
| "loss": 0.7000977993011475, |
| "num_input_tokens_seen": 1220824, |
| "step": 65, |
| "train_runtime": 1619.8853, |
| "train_tokens_per_second": 753.648 |
| }, |
| { |
| "epoch": 1.1891964525665144, |
| "grad_norm": 5.333123683929443, |
| "learning_rate": 6.9e-07, |
| "loss": 0.6922206878662109, |
| "num_input_tokens_seen": 1314816, |
| "step": 70, |
| "train_runtime": 1745.5942, |
| "train_tokens_per_second": 753.22 |
| }, |
| { |
| "epoch": 1.275194840096748, |
| "grad_norm": 5.560202598571777, |
| "learning_rate": 7.4e-07, |
| "loss": 0.6772861003875732, |
| "num_input_tokens_seen": 1410040, |
| "step": 75, |
| "train_runtime": 1871.2742, |
| "train_tokens_per_second": 753.519 |
| }, |
| { |
| "epoch": 1.361193227626982, |
| "grad_norm": 5.5269389152526855, |
| "learning_rate": 7.9e-07, |
| "loss": 0.6707859992980957, |
| "num_input_tokens_seen": 1506248, |
| "step": 80, |
| "train_runtime": 1997.6031, |
| "train_tokens_per_second": 754.028 |
| }, |
| { |
| "epoch": 1.4471916151572157, |
| "grad_norm": 5.004036903381348, |
| "learning_rate": 8.399999999999999e-07, |
| "loss": 0.6331174850463868, |
| "num_input_tokens_seen": 1599296, |
| "step": 85, |
| "train_runtime": 2123.3979, |
| "train_tokens_per_second": 753.178 |
| }, |
| { |
| "epoch": 1.5331900026874496, |
| "grad_norm": 5.266488552093506, |
| "learning_rate": 8.9e-07, |
| "loss": 0.6387096405029297, |
| "num_input_tokens_seen": 1693400, |
| "step": 90, |
| "train_runtime": 2248.9337, |
| "train_tokens_per_second": 752.979 |
| }, |
| { |
| "epoch": 1.6191883902176833, |
| "grad_norm": 4.819321155548096, |
| "learning_rate": 9.399999999999999e-07, |
| "loss": 0.5934211730957031, |
| "num_input_tokens_seen": 1787000, |
| "step": 95, |
| "train_runtime": 2374.4655, |
| "train_tokens_per_second": 752.59 |
| }, |
| { |
| "epoch": 1.7051867777479173, |
| "grad_norm": 4.935013771057129, |
| "learning_rate": 9.9e-07, |
| "loss": 0.6045561790466308, |
| "num_input_tokens_seen": 1882104, |
| "step": 100, |
| "train_runtime": 2500.4896, |
| "train_tokens_per_second": 752.694 |
| }, |
| { |
| "epoch": 1.7051867777479173, |
| "eval_loss": 0.5743909478187561, |
| "eval_runtime": 10.9213, |
| "eval_samples_per_second": 71.786, |
| "eval_steps_per_second": 17.947, |
| "num_input_tokens_seen": 1882104, |
| "step": 100 |
| }, |
| { |
| "epoch": 1.7911851652781512, |
| "grad_norm": 4.882491588592529, |
| "learning_rate": 9.9983558411534e-07, |
| "loss": 0.5929690361022949, |
| "num_input_tokens_seen": 1975008, |
| "step": 105, |
| "train_runtime": 2637.3808, |
| "train_tokens_per_second": 748.852 |
| }, |
| { |
| "epoch": 1.877183552808385, |
| "grad_norm": 4.714536190032959, |
| "learning_rate": 9.991678299006205e-07, |
| "loss": 0.5646411418914795, |
| "num_input_tokens_seen": 2071992, |
| "step": 110, |
| "train_runtime": 2763.47, |
| "train_tokens_per_second": 749.779 |
| }, |
| { |
| "epoch": 1.9631819403386186, |
| "grad_norm": 5.484632968902588, |
| "learning_rate": 9.979871469976195e-07, |
| "loss": 0.5584239006042481, |
| "num_input_tokens_seen": 2169008, |
| "step": 115, |
| "train_runtime": 2889.0567, |
| "train_tokens_per_second": 750.767 |
| }, |
| { |
| "epoch": 2.0343993550120936, |
| "grad_norm": 4.425460338592529, |
| "learning_rate": 9.962947486378324e-07, |
| "loss": 0.5410833358764648, |
| "num_input_tokens_seen": 2247720, |
| "step": 120, |
| "train_runtime": 2993.1338, |
| "train_tokens_per_second": 750.959 |
| }, |
| { |
| "epoch": 2.1203977425423273, |
| "grad_norm": 4.904783725738525, |
| "learning_rate": 9.940923738749777e-07, |
| "loss": 0.42338247299194337, |
| "num_input_tokens_seen": 2345128, |
| "step": 125, |
| "train_runtime": 3118.6594, |
| "train_tokens_per_second": 751.967 |
| }, |
| { |
| "epoch": 2.206396130072561, |
| "grad_norm": 5.408900260925293, |
| "learning_rate": 9.91382285798002e-07, |
| "loss": 0.4106863021850586, |
| "num_input_tokens_seen": 2439936, |
| "step": 130, |
| "train_runtime": 3244.2671, |
| "train_tokens_per_second": 752.076 |
| }, |
| { |
| "epoch": 2.292394517602795, |
| "grad_norm": 5.198470115661621, |
| "learning_rate": 9.88167269205602e-07, |
| "loss": 0.4100049495697021, |
| "num_input_tokens_seen": 2534144, |
| "step": 135, |
| "train_runtime": 3369.5649, |
| "train_tokens_per_second": 752.069 |
| }, |
| { |
| "epoch": 2.378392905133029, |
| "grad_norm": 5.204331398010254, |
| "learning_rate": 9.844506277446576e-07, |
| "loss": 0.4073524475097656, |
| "num_input_tokens_seen": 2629448, |
| "step": 140, |
| "train_runtime": 3495.376, |
| "train_tokens_per_second": 752.265 |
| }, |
| { |
| "epoch": 2.4643912926632625, |
| "grad_norm": 5.216585159301758, |
| "learning_rate": 9.802361805155097e-07, |
| "loss": 0.39515421390533445, |
| "num_input_tokens_seen": 2727304, |
| "step": 145, |
| "train_runtime": 3621.1152, |
| "train_tokens_per_second": 753.167 |
| }, |
| { |
| "epoch": 2.550389680193496, |
| "grad_norm": 5.4826226234436035, |
| "learning_rate": 9.755282581475767e-07, |
| "loss": 0.4133957862854004, |
| "num_input_tokens_seen": 2821616, |
| "step": 150, |
| "train_runtime": 3747.4831, |
| "train_tokens_per_second": 752.936 |
| }, |
| { |
| "epoch": 2.63638806772373, |
| "grad_norm": 5.135773181915283, |
| "learning_rate": 9.703316983493412e-07, |
| "loss": 0.4020789623260498, |
| "num_input_tokens_seen": 2916400, |
| "step": 155, |
| "train_runtime": 3873.6018, |
| "train_tokens_per_second": 752.891 |
| }, |
| { |
| "epoch": 2.722386455253964, |
| "grad_norm": 5.220492839813232, |
| "learning_rate": 9.646518409372759e-07, |
| "loss": 0.38811378479003905, |
| "num_input_tokens_seen": 3011424, |
| "step": 160, |
| "train_runtime": 3999.9318, |
| "train_tokens_per_second": 752.869 |
| }, |
| { |
| "epoch": 2.8083848427841978, |
| "grad_norm": 5.276327133178711, |
| "learning_rate": 9.584945223488226e-07, |
| "loss": 0.40136079788208007, |
| "num_input_tokens_seen": 3105176, |
| "step": 165, |
| "train_runtime": 4126.3897, |
| "train_tokens_per_second": 752.516 |
| }, |
| { |
| "epoch": 2.8943832303144315, |
| "grad_norm": 5.527720928192139, |
| "learning_rate": 9.518660696450567e-07, |
| "loss": 0.3835641860961914, |
| "num_input_tokens_seen": 3199872, |
| "step": 170, |
| "train_runtime": 4252.3976, |
| "train_tokens_per_second": 752.487 |
| }, |
| { |
| "epoch": 2.9803816178446656, |
| "grad_norm": 5.367305755615234, |
| "learning_rate": 9.447732940092059e-07, |
| "loss": 0.37801907062530515, |
| "num_input_tokens_seen": 3293376, |
| "step": 175, |
| "train_runtime": 4378.5735, |
| "train_tokens_per_second": 752.157 |
| }, |
| { |
| "epoch": 3.05159903251814, |
| "grad_norm": 4.809284210205078, |
| "learning_rate": 9.372234837476977e-07, |
| "loss": 0.31443004608154296, |
| "num_input_tokens_seen": 3372136, |
| "step": 180, |
| "train_runtime": 4483.0506, |
| "train_tokens_per_second": 752.197 |
| }, |
| { |
| "epoch": 3.1375974200483743, |
| "grad_norm": 6.2316436767578125, |
| "learning_rate": 9.29224396800933e-07, |
| "loss": 0.22384190559387207, |
| "num_input_tokens_seen": 3466240, |
| "step": 185, |
| "train_runtime": 4609.5773, |
| "train_tokens_per_second": 751.965 |
| }, |
| { |
| "epoch": 3.223595807578608, |
| "grad_norm": 7.395747661590576, |
| "learning_rate": 9.207842527714765e-07, |
| "loss": 0.23196635246276856, |
| "num_input_tokens_seen": 3562616, |
| "step": 190, |
| "train_runtime": 4735.6611, |
| "train_tokens_per_second": 752.295 |
| }, |
| { |
| "epoch": 3.3095941951088417, |
| "grad_norm": 5.527756214141846, |
| "learning_rate": 9.119117244778607e-07, |
| "loss": 0.22302393913269042, |
| "num_input_tokens_seen": 3658328, |
| "step": 195, |
| "train_runtime": 4861.5497, |
| "train_tokens_per_second": 752.502 |
| }, |
| { |
| "epoch": 3.3955925826390754, |
| "grad_norm": 5.768650054931641, |
| "learning_rate": 9.02615929042678e-07, |
| "loss": 0.23009986877441407, |
| "num_input_tokens_seen": 3754416, |
| "step": 200, |
| "train_runtime": 4987.5371, |
| "train_tokens_per_second": 752.76 |
| }, |
| { |
| "epoch": 3.3955925826390754, |
| "eval_loss": 0.6245584487915039, |
| "eval_runtime": 10.9548, |
| "eval_samples_per_second": 71.567, |
| "eval_steps_per_second": 17.892, |
| "num_input_tokens_seen": 3754416, |
| "step": 200 |
| } |
| ], |
| "logging_steps": 5, |
| "max_steps": 590, |
| "num_input_tokens_seen": 3754416, |
| "num_train_epochs": 10, |
| "save_steps": 200, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.875151003100119e+17, |
| "train_batch_size": 1, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|