{ "best_global_step": 250, "best_metric": 0.9828886389732361, "best_model_checkpoint": "/data/output/checkpoint-250", "epoch": 0.8539709649871904, "eval_steps": 50, "global_step": 250, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.1713112026453019, "epoch": 0.034158838599487616, "grad_norm": 3.3329014778137207, "learning_rate": 0.00012, "loss": 1.2999439239501953, "mean_token_accuracy": 0.6959523037075996, "num_tokens": 643010.0, "step": 10 }, { "entropy": 1.1543982975184917, "epoch": 0.06831767719897523, "grad_norm": 2.581118106842041, "learning_rate": 0.00019989785286500295, "loss": 1.1518776893615723, "mean_token_accuracy": 0.7155417971313, "num_tokens": 1251488.0, "step": 20 }, { "entropy": 0.9459363672882318, "epoch": 0.10247651579846286, "grad_norm": 2.3779942989349365, "learning_rate": 0.00019875109281794825, "loss": 0.9381013870239258, "mean_token_accuracy": 0.7682368114590645, "num_tokens": 1696074.0, "step": 30 }, { "entropy": 0.9385578982532025, "epoch": 0.13663535439795046, "grad_norm": 2.0882723331451416, "learning_rate": 0.00019634456691705702, "loss": 0.9547281265258789, "mean_token_accuracy": 0.7626850850880146, "num_tokens": 2006643.0, "step": 40 }, { "entropy": 0.9006230250000954, "epoch": 0.1707941929974381, "grad_norm": 2.151762008666992, "learning_rate": 0.00019270897516847403, "loss": 0.9329019546508789, "mean_token_accuracy": 0.7718432284891605, "num_tokens": 2177826.0, "step": 50 }, { "epoch": 0.1707941929974381, "eval_entropy": 1.0149640817940235, "eval_loss": 1.071570634841919, "eval_mean_token_accuracy": 0.742358745932579, "eval_num_tokens": 2177826.0, "eval_runtime": 95.085, "eval_samples_per_second": 1.052, "eval_steps_per_second": 1.052, "step": 50 }, { "entropy": 1.2094877127557992, "epoch": 0.2049530315969257, "grad_norm": 2.767357587814331, "learning_rate": 0.0001878906967484966, "loss": 1.209201717376709, "mean_token_accuracy": 0.7017950341105461, "num_tokens": 644405.0, "step": 60 }, { "entropy": 1.1481261406093837, "epoch": 0.23911187019641333, "grad_norm": 2.805593252182007, "learning_rate": 0.00018195119834528534, "loss": 1.1588325500488281, "mean_token_accuracy": 0.7221003979444504, "num_tokens": 1268539.0, "step": 70 }, { "entropy": 0.9842961743474007, "epoch": 0.27327070879590093, "grad_norm": 2.233400344848633, "learning_rate": 0.000174966250029467, "loss": 1.0100913047790527, "mean_token_accuracy": 0.7561626233160496, "num_tokens": 1729123.0, "step": 80 }, { "entropy": 0.9889072403311729, "epoch": 0.3074295473953886, "grad_norm": 1.992038369178772, "learning_rate": 0.0001670249586567531, "loss": 1.0143807411193848, "mean_token_accuracy": 0.7507779069244862, "num_tokens": 2034736.0, "step": 90 }, { "entropy": 0.8992462156340479, "epoch": 0.3415883859948762, "grad_norm": 2.0321593284606934, "learning_rate": 0.00015822863113343935, "loss": 0.9014181137084961, "mean_token_accuracy": 0.7751547530293464, "num_tokens": 2199862.0, "step": 100 }, { "epoch": 0.3415883859948762, "eval_entropy": 0.9943241326510907, "eval_loss": 1.043296456336975, "eval_mean_token_accuracy": 0.7519984298944473, "eval_num_tokens": 2199862.0, "eval_runtime": 95.5899, "eval_samples_per_second": 1.046, "eval_steps_per_second": 1.046, "step": 100 }, { "entropy": 1.1760564662516118, "epoch": 0.37574722459436377, "grad_norm": 3.0291037559509277, "learning_rate": 0.000148689482046087, "loss": 1.2000227928161622, "mean_token_accuracy": 0.711453115195036, "num_tokens": 643606.0, "step": 110 }, { "entropy": 1.1263522632420062, "epoch": 0.4099060631938514, "grad_norm": 2.554089307785034, "learning_rate": 0.00013852920214212964, "loss": 1.1538644790649415, "mean_token_accuracy": 0.7203516490757466, "num_tokens": 1250932.0, "step": 120 }, { "entropy": 0.9661639135330915, "epoch": 0.444064901793339, "grad_norm": 2.2706644535064697, "learning_rate": 0.0001278774059232723, "loss": 0.9473760604858399, "mean_token_accuracy": 0.7646104976534843, "num_tokens": 1690510.0, "step": 130 }, { "entropy": 0.9644285907968879, "epoch": 0.47822374039282667, "grad_norm": 1.8326361179351807, "learning_rate": 0.00011686997815570473, "loss": 0.9465847969055176, "mean_token_accuracy": 0.760813869535923, "num_tokens": 1991606.0, "step": 140 }, { "entropy": 0.847778935264796, "epoch": 0.5123825789923142, "grad_norm": 2.5428972244262695, "learning_rate": 0.00010564734039066699, "loss": 0.8805885314941406, "mean_token_accuracy": 0.784095474332571, "num_tokens": 2153462.0, "step": 150 }, { "epoch": 0.5123825789923142, "eval_entropy": 1.0146987434476613, "eval_loss": 1.0139193534851074, "eval_mean_token_accuracy": 0.7562771487236023, "eval_num_tokens": 2153462.0, "eval_runtime": 95.2112, "eval_samples_per_second": 1.05, "eval_steps_per_second": 1.05, "step": 150 }, { "entropy": 1.2566933140158654, "epoch": 0.5465414175918019, "grad_norm": 2.956472873687744, "learning_rate": 9.435265960933302e-05, "loss": 1.2643850326538086, "mean_token_accuracy": 0.700284918397665, "num_tokens": 644011.0, "step": 160 }, { "entropy": 1.1445974234491587, "epoch": 0.5807002561912895, "grad_norm": 2.522840738296509, "learning_rate": 8.313002184429529e-05, "loss": 1.1480578422546386, "mean_token_accuracy": 0.7231714740395546, "num_tokens": 1272288.0, "step": 170 }, { "entropy": 0.9980672411620617, "epoch": 0.6148590947907772, "grad_norm": 2.023250102996826, "learning_rate": 7.21225940767277e-05, "loss": 1.0411287307739259, "mean_token_accuracy": 0.74666218906641, "num_tokens": 1728820.0, "step": 180 }, { "entropy": 0.9762071590870619, "epoch": 0.6490179333902647, "grad_norm": 1.7645409107208252, "learning_rate": 6.147079785787038e-05, "loss": 0.9519403457641602, "mean_token_accuracy": 0.7596977911889553, "num_tokens": 2027911.0, "step": 190 }, { "entropy": 0.829610382579267, "epoch": 0.6831767719897524, "grad_norm": 1.8310364484786987, "learning_rate": 5.131051795391302e-05, "loss": 0.8207592964172363, "mean_token_accuracy": 0.7889963142573834, "num_tokens": 2200169.0, "step": 200 }, { "epoch": 0.6831767719897524, "eval_entropy": 1.0059119730442763, "eval_loss": 1.002184271812439, "eval_mean_token_accuracy": 0.7572826623916626, "eval_num_tokens": 2200169.0, "eval_runtime": 95.2716, "eval_samples_per_second": 1.05, "eval_steps_per_second": 1.05, "step": 200 }, { "entropy": 1.1494356069713831, "epoch": 0.71733561058924, "grad_norm": 3.3939480781555176, "learning_rate": 4.1771368866560665e-05, "loss": 1.169883918762207, "mean_token_accuracy": 0.7144785463809967, "num_tokens": 2843646.0, "step": 210 }, { "entropy": 1.1186032563447952, "epoch": 0.7514944491887275, "grad_norm": 2.491504192352295, "learning_rate": 3.2975041343246936e-05, "loss": 1.109489631652832, "mean_token_accuracy": 0.7285458266735076, "num_tokens": 3464241.0, "step": 220 }, { "entropy": 0.9699326818808913, "epoch": 0.7856532877882152, "grad_norm": 1.8113044500350952, "learning_rate": 2.5033749970533015e-05, "loss": 0.9755414009094239, "mean_token_accuracy": 0.7635111711919308, "num_tokens": 3914675.0, "step": 230 }, { "entropy": 0.9966869790107011, "epoch": 0.8198121263877028, "grad_norm": 1.7850583791732788, "learning_rate": 1.8048801654714688e-05, "loss": 1.020698356628418, "mean_token_accuracy": 0.7484274171292782, "num_tokens": 4212723.0, "step": 240 }, { "entropy": 0.8349324990995228, "epoch": 0.8539709649871904, "grad_norm": 1.9040881395339966, "learning_rate": 1.2109303251503434e-05, "loss": 0.8317201614379883, "mean_token_accuracy": 0.7891084231436253, "num_tokens": 4374805.0, "step": 250 }, { "epoch": 0.8539709649871904, "eval_entropy": 0.968962878882885, "eval_loss": 0.9828886389732361, "eval_mean_token_accuracy": 0.7627548807859421, "eval_num_tokens": 4374805.0, "eval_runtime": 95.2882, "eval_samples_per_second": 1.049, "eval_steps_per_second": 1.049, "step": 250 } ], "logging_steps": 10, "max_steps": 293, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4.714933266799657e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }