{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.3955925826390754, "eval_steps": 100, "global_step": 200, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.08599838753023381, "grad_norm": 20.39691162109375, "learning_rate": 4e-08, "loss": 1.1993448257446289, "num_input_tokens_seen": 95768, "step": 5, "train_runtime": 130.2777, "train_tokens_per_second": 735.107 }, { "epoch": 0.17199677506046762, "grad_norm": 20.53337860107422, "learning_rate": 9e-08, "loss": 1.23364200592041, "num_input_tokens_seen": 192088, "step": 10, "train_runtime": 256.1595, "train_tokens_per_second": 749.876 }, { "epoch": 0.25799516259070143, "grad_norm": 17.26736068725586, "learning_rate": 1.4e-07, "loss": 1.2103577613830567, "num_input_tokens_seen": 285904, "step": 15, "train_runtime": 381.9483, "train_tokens_per_second": 748.541 }, { "epoch": 0.34399355012093524, "grad_norm": 13.094156265258789, "learning_rate": 1.8999999999999998e-07, "loss": 1.1606547355651855, "num_input_tokens_seen": 380136, "step": 20, "train_runtime": 507.8013, "train_tokens_per_second": 748.592 }, { "epoch": 0.42999193765116905, "grad_norm": 8.614981651306152, "learning_rate": 2.4e-07, "loss": 1.1257909774780273, "num_input_tokens_seen": 473768, "step": 25, "train_runtime": 634.7096, "train_tokens_per_second": 746.433 }, { "epoch": 0.5159903251814029, "grad_norm": 6.893142223358154, "learning_rate": 2.9e-07, "loss": 1.0529449462890625, "num_input_tokens_seen": 570960, "step": 30, "train_runtime": 760.0374, "train_tokens_per_second": 751.226 }, { "epoch": 0.6019887127116367, "grad_norm": 6.435474395751953, "learning_rate": 3.4000000000000003e-07, "loss": 0.9501470565795899, "num_input_tokens_seen": 666904, "step": 35, "train_runtime": 885.8858, "train_tokens_per_second": 752.81 }, { "epoch": 0.6879871002418705, "grad_norm": 6.33709192276001, "learning_rate": 3.8999999999999997e-07, "loss": 0.9997085571289063, "num_input_tokens_seen": 759040, "step": 40, "train_runtime": 1011.9639, "train_tokens_per_second": 750.066 }, { "epoch": 0.7739854877721043, "grad_norm": 6.392234802246094, "learning_rate": 4.3999999999999997e-07, "loss": 0.941748046875, "num_input_tokens_seen": 854112, "step": 45, "train_runtime": 1137.7802, "train_tokens_per_second": 750.683 }, { "epoch": 0.8599838753023381, "grad_norm": 6.084305763244629, "learning_rate": 4.9e-07, "loss": 0.8405242919921875, "num_input_tokens_seen": 950760, "step": 50, "train_runtime": 1263.8056, "train_tokens_per_second": 752.299 }, { "epoch": 0.9459822628325719, "grad_norm": 5.806552886962891, "learning_rate": 5.4e-07, "loss": 0.8304224014282227, "num_input_tokens_seen": 1044848, "step": 55, "train_runtime": 1389.4662, "train_tokens_per_second": 751.978 }, { "epoch": 1.0171996775060468, "grad_norm": 5.317915439605713, "learning_rate": 5.9e-07, "loss": 0.7544718265533448, "num_input_tokens_seen": 1125192, "step": 60, "train_runtime": 1494.191, "train_tokens_per_second": 753.044 }, { "epoch": 1.1031980650362805, "grad_norm": 5.279268741607666, "learning_rate": 6.4e-07, "loss": 0.7000977993011475, "num_input_tokens_seen": 1220824, "step": 65, "train_runtime": 1619.8853, "train_tokens_per_second": 753.648 }, { "epoch": 1.1891964525665144, "grad_norm": 5.333123683929443, "learning_rate": 6.9e-07, "loss": 0.6922206878662109, "num_input_tokens_seen": 1314816, "step": 70, "train_runtime": 1745.5942, "train_tokens_per_second": 753.22 }, { "epoch": 1.275194840096748, "grad_norm": 5.560202598571777, "learning_rate": 7.4e-07, "loss": 0.6772861003875732, "num_input_tokens_seen": 1410040, "step": 75, "train_runtime": 1871.2742, "train_tokens_per_second": 753.519 }, { "epoch": 1.361193227626982, "grad_norm": 5.5269389152526855, "learning_rate": 7.9e-07, "loss": 0.6707859992980957, "num_input_tokens_seen": 1506248, "step": 80, "train_runtime": 1997.6031, "train_tokens_per_second": 754.028 }, { "epoch": 1.4471916151572157, "grad_norm": 5.004036903381348, "learning_rate": 8.399999999999999e-07, "loss": 0.6331174850463868, "num_input_tokens_seen": 1599296, "step": 85, "train_runtime": 2123.3979, "train_tokens_per_second": 753.178 }, { "epoch": 1.5331900026874496, "grad_norm": 5.266488552093506, "learning_rate": 8.9e-07, "loss": 0.6387096405029297, "num_input_tokens_seen": 1693400, "step": 90, "train_runtime": 2248.9337, "train_tokens_per_second": 752.979 }, { "epoch": 1.6191883902176833, "grad_norm": 4.819321155548096, "learning_rate": 9.399999999999999e-07, "loss": 0.5934211730957031, "num_input_tokens_seen": 1787000, "step": 95, "train_runtime": 2374.4655, "train_tokens_per_second": 752.59 }, { "epoch": 1.7051867777479173, "grad_norm": 4.935013771057129, "learning_rate": 9.9e-07, "loss": 0.6045561790466308, "num_input_tokens_seen": 1882104, "step": 100, "train_runtime": 2500.4896, "train_tokens_per_second": 752.694 }, { "epoch": 1.7051867777479173, "eval_loss": 0.5743909478187561, "eval_runtime": 10.9213, "eval_samples_per_second": 71.786, "eval_steps_per_second": 17.947, "num_input_tokens_seen": 1882104, "step": 100 }, { "epoch": 1.7911851652781512, "grad_norm": 4.882491588592529, "learning_rate": 9.9983558411534e-07, "loss": 0.5929690361022949, "num_input_tokens_seen": 1975008, "step": 105, "train_runtime": 2637.3808, "train_tokens_per_second": 748.852 }, { "epoch": 1.877183552808385, "grad_norm": 4.714536190032959, "learning_rate": 9.991678299006205e-07, "loss": 0.5646411418914795, "num_input_tokens_seen": 2071992, "step": 110, "train_runtime": 2763.47, "train_tokens_per_second": 749.779 }, { "epoch": 1.9631819403386186, "grad_norm": 5.484632968902588, "learning_rate": 9.979871469976195e-07, "loss": 0.5584239006042481, "num_input_tokens_seen": 2169008, "step": 115, "train_runtime": 2889.0567, "train_tokens_per_second": 750.767 }, { "epoch": 2.0343993550120936, "grad_norm": 4.425460338592529, "learning_rate": 9.962947486378324e-07, "loss": 0.5410833358764648, "num_input_tokens_seen": 2247720, "step": 120, "train_runtime": 2993.1338, "train_tokens_per_second": 750.959 }, { "epoch": 2.1203977425423273, "grad_norm": 4.904783725738525, "learning_rate": 9.940923738749777e-07, "loss": 0.42338247299194337, "num_input_tokens_seen": 2345128, "step": 125, "train_runtime": 3118.6594, "train_tokens_per_second": 751.967 }, { "epoch": 2.206396130072561, "grad_norm": 5.408900260925293, "learning_rate": 9.91382285798002e-07, "loss": 0.4106863021850586, "num_input_tokens_seen": 2439936, "step": 130, "train_runtime": 3244.2671, "train_tokens_per_second": 752.076 }, { "epoch": 2.292394517602795, "grad_norm": 5.198470115661621, "learning_rate": 9.88167269205602e-07, "loss": 0.4100049495697021, "num_input_tokens_seen": 2534144, "step": 135, "train_runtime": 3369.5649, "train_tokens_per_second": 752.069 }, { "epoch": 2.378392905133029, "grad_norm": 5.204331398010254, "learning_rate": 9.844506277446576e-07, "loss": 0.4073524475097656, "num_input_tokens_seen": 2629448, "step": 140, "train_runtime": 3495.376, "train_tokens_per_second": 752.265 }, { "epoch": 2.4643912926632625, "grad_norm": 5.216585159301758, "learning_rate": 9.802361805155097e-07, "loss": 0.39515421390533445, "num_input_tokens_seen": 2727304, "step": 145, "train_runtime": 3621.1152, "train_tokens_per_second": 753.167 }, { "epoch": 2.550389680193496, "grad_norm": 5.4826226234436035, "learning_rate": 9.755282581475767e-07, "loss": 0.4133957862854004, "num_input_tokens_seen": 2821616, "step": 150, "train_runtime": 3747.4831, "train_tokens_per_second": 752.936 }, { "epoch": 2.63638806772373, "grad_norm": 5.135773181915283, "learning_rate": 9.703316983493412e-07, "loss": 0.4020789623260498, "num_input_tokens_seen": 2916400, "step": 155, "train_runtime": 3873.6018, "train_tokens_per_second": 752.891 }, { "epoch": 2.722386455253964, "grad_norm": 5.220492839813232, "learning_rate": 9.646518409372759e-07, "loss": 0.38811378479003905, "num_input_tokens_seen": 3011424, "step": 160, "train_runtime": 3999.9318, "train_tokens_per_second": 752.869 }, { "epoch": 2.8083848427841978, "grad_norm": 5.276327133178711, "learning_rate": 9.584945223488226e-07, "loss": 0.40136079788208007, "num_input_tokens_seen": 3105176, "step": 165, "train_runtime": 4126.3897, "train_tokens_per_second": 752.516 }, { "epoch": 2.8943832303144315, "grad_norm": 5.527720928192139, "learning_rate": 9.518660696450567e-07, "loss": 0.3835641860961914, "num_input_tokens_seen": 3199872, "step": 170, "train_runtime": 4252.3976, "train_tokens_per_second": 752.487 }, { "epoch": 2.9803816178446656, "grad_norm": 5.367305755615234, "learning_rate": 9.447732940092059e-07, "loss": 0.37801907062530515, "num_input_tokens_seen": 3293376, "step": 175, "train_runtime": 4378.5735, "train_tokens_per_second": 752.157 }, { "epoch": 3.05159903251814, "grad_norm": 4.809284210205078, "learning_rate": 9.372234837476977e-07, "loss": 0.31443004608154296, "num_input_tokens_seen": 3372136, "step": 180, "train_runtime": 4483.0506, "train_tokens_per_second": 752.197 }, { "epoch": 3.1375974200483743, "grad_norm": 6.2316436767578125, "learning_rate": 9.29224396800933e-07, "loss": 0.22384190559387207, "num_input_tokens_seen": 3466240, "step": 185, "train_runtime": 4609.5773, "train_tokens_per_second": 751.965 }, { "epoch": 3.223595807578608, "grad_norm": 7.395747661590576, "learning_rate": 9.207842527714765e-07, "loss": 0.23196635246276856, "num_input_tokens_seen": 3562616, "step": 190, "train_runtime": 4735.6611, "train_tokens_per_second": 752.295 }, { "epoch": 3.3095941951088417, "grad_norm": 5.527756214141846, "learning_rate": 9.119117244778607e-07, "loss": 0.22302393913269042, "num_input_tokens_seen": 3658328, "step": 195, "train_runtime": 4861.5497, "train_tokens_per_second": 752.502 }, { "epoch": 3.3955925826390754, "grad_norm": 5.768650054931641, "learning_rate": 9.02615929042678e-07, "loss": 0.23009986877441407, "num_input_tokens_seen": 3754416, "step": 200, "train_runtime": 4987.5371, "train_tokens_per_second": 752.76 }, { "epoch": 3.3955925826390754, "eval_loss": 0.6245584487915039, "eval_runtime": 10.9548, "eval_samples_per_second": 71.567, "eval_steps_per_second": 17.892, "num_input_tokens_seen": 3754416, "step": 200 } ], "logging_steps": 5, "max_steps": 590, "num_input_tokens_seen": 3754416, "num_train_epochs": 10, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.875151003100119e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }