{ "best_global_step": 100, "best_metric": 1.043296456336975, "best_model_checkpoint": "/data/output/checkpoint-100", "epoch": 0.3415883859948762, "eval_steps": 50, "global_step": 100, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.1713112026453019, "epoch": 0.034158838599487616, "grad_norm": 3.3329014778137207, "learning_rate": 0.00012, "loss": 1.2999439239501953, "mean_token_accuracy": 0.6959523037075996, "num_tokens": 643010.0, "step": 10 }, { "entropy": 1.1543982975184917, "epoch": 0.06831767719897523, "grad_norm": 2.581118106842041, "learning_rate": 0.00019989785286500295, "loss": 1.1518776893615723, "mean_token_accuracy": 0.7155417971313, "num_tokens": 1251488.0, "step": 20 }, { "entropy": 0.9459363672882318, "epoch": 0.10247651579846286, "grad_norm": 2.3779942989349365, "learning_rate": 0.00019875109281794825, "loss": 0.9381013870239258, "mean_token_accuracy": 0.7682368114590645, "num_tokens": 1696074.0, "step": 30 }, { "entropy": 0.9385578982532025, "epoch": 0.13663535439795046, "grad_norm": 2.0882723331451416, "learning_rate": 0.00019634456691705702, "loss": 0.9547281265258789, "mean_token_accuracy": 0.7626850850880146, "num_tokens": 2006643.0, "step": 40 }, { "entropy": 0.9006230250000954, "epoch": 0.1707941929974381, "grad_norm": 2.151762008666992, "learning_rate": 0.00019270897516847403, "loss": 0.9329019546508789, "mean_token_accuracy": 0.7718432284891605, "num_tokens": 2177826.0, "step": 50 }, { "epoch": 0.1707941929974381, "eval_entropy": 1.0149640817940235, "eval_loss": 1.071570634841919, "eval_mean_token_accuracy": 0.742358745932579, "eval_num_tokens": 2177826.0, "eval_runtime": 95.085, "eval_samples_per_second": 1.052, "eval_steps_per_second": 1.052, "step": 50 }, { "entropy": 1.2094877127557992, "epoch": 0.2049530315969257, "grad_norm": 2.767357587814331, "learning_rate": 0.0001878906967484966, "loss": 1.209201717376709, "mean_token_accuracy": 0.7017950341105461, "num_tokens": 644405.0, "step": 60 }, { "entropy": 1.1481261406093837, "epoch": 0.23911187019641333, "grad_norm": 2.805593252182007, "learning_rate": 0.00018195119834528534, "loss": 1.1588325500488281, "mean_token_accuracy": 0.7221003979444504, "num_tokens": 1268539.0, "step": 70 }, { "entropy": 0.9842961743474007, "epoch": 0.27327070879590093, "grad_norm": 2.233400344848633, "learning_rate": 0.000174966250029467, "loss": 1.0100913047790527, "mean_token_accuracy": 0.7561626233160496, "num_tokens": 1729123.0, "step": 80 }, { "entropy": 0.9889072403311729, "epoch": 0.3074295473953886, "grad_norm": 1.992038369178772, "learning_rate": 0.0001670249586567531, "loss": 1.0143807411193848, "mean_token_accuracy": 0.7507779069244862, "num_tokens": 2034736.0, "step": 90 }, { "entropy": 0.8992462156340479, "epoch": 0.3415883859948762, "grad_norm": 2.0321593284606934, "learning_rate": 0.00015822863113343935, "loss": 0.9014181137084961, "mean_token_accuracy": 0.7751547530293464, "num_tokens": 2199862.0, "step": 100 }, { "epoch": 0.3415883859948762, "eval_entropy": 0.9943241326510907, "eval_loss": 1.043296456336975, "eval_mean_token_accuracy": 0.7519984298944473, "eval_num_tokens": 2199862.0, "eval_runtime": 95.5899, "eval_samples_per_second": 1.046, "eval_steps_per_second": 1.046, "step": 100 } ], "logging_steps": 10, "max_steps": 293, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.892543874094203e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }