{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.12, "eval_steps": 1000, "global_step": 6000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.002, "grad_norm": 1.158125638961792, "learning_rate": 7.920000000000001e-05, "loss": 8.2536, "step": 100 }, { "epoch": 0.004, "grad_norm": 0.6474116444587708, "learning_rate": 0.00015920000000000002, "loss": 6.577, "step": 200 }, { "epoch": 0.006, "grad_norm": 0.8440109491348267, "learning_rate": 0.00023920000000000001, "loss": 6.1636, "step": 300 }, { "epoch": 0.008, "grad_norm": 0.712805986404419, "learning_rate": 0.0003192, "loss": 5.8686, "step": 400 }, { "epoch": 0.01, "grad_norm": 0.6756730675697327, "learning_rate": 0.0003992, "loss": 5.5639, "step": 500 }, { "epoch": 0.012, "grad_norm": 0.8336403965950012, "learning_rate": 0.00047920000000000005, "loss": 5.3098, "step": 600 }, { "epoch": 0.014, "grad_norm": 0.6417033672332764, "learning_rate": 0.0005592, "loss": 5.0845, "step": 700 }, { "epoch": 0.016, "grad_norm": 0.5867908596992493, "learning_rate": 0.0006392, "loss": 4.8767, "step": 800 }, { "epoch": 0.018, "grad_norm": 0.5321984887123108, "learning_rate": 0.0007191999999999999, "loss": 4.7211, "step": 900 }, { "epoch": 0.02, "grad_norm": 0.5662059187889099, "learning_rate": 0.0007992, "loss": 4.6059, "step": 1000 }, { "epoch": 0.02, "eval_accuracy": 0.2709784735812133, "eval_loss": 4.504483222961426, "eval_runtime": 11.2003, "eval_samples_per_second": 89.283, "eval_steps_per_second": 0.714, "step": 1000 }, { "epoch": 0.022, "grad_norm": 0.45525625348091125, "learning_rate": 0.0008792, "loss": 4.4901, "step": 1100 }, { "epoch": 0.024, "grad_norm": 0.4701859652996063, "learning_rate": 0.0009592000000000001, "loss": 4.4344, "step": 1200 }, { "epoch": 0.026, "grad_norm": 0.40884163975715637, "learning_rate": 0.0010391999999999999, "loss": 4.3707, "step": 1300 }, { "epoch": 0.028, "grad_norm": 0.3846769332885742, "learning_rate": 0.0011192, "loss": 4.336, "step": 1400 }, { "epoch": 0.03, "grad_norm": 0.3585458993911743, "learning_rate": 0.0011992, "loss": 4.2832, "step": 1500 }, { "epoch": 0.032, "grad_norm": 0.4558027982711792, "learning_rate": 0.0012791999999999999, "loss": 4.2599, "step": 1600 }, { "epoch": 0.034, "grad_norm": 0.33011195063591003, "learning_rate": 0.0013592, "loss": 4.2287, "step": 1700 }, { "epoch": 0.036, "grad_norm": 0.32163774967193604, "learning_rate": 0.0014392, "loss": 4.1932, "step": 1800 }, { "epoch": 0.038, "grad_norm": 0.30342814326286316, "learning_rate": 0.0015192, "loss": 4.1447, "step": 1900 }, { "epoch": 0.04, "grad_norm": 0.32037997245788574, "learning_rate": 0.0015992, "loss": 4.149, "step": 2000 }, { "epoch": 0.04, "eval_accuracy": 0.30734833659491195, "eval_loss": 4.087185859680176, "eval_runtime": 11.8275, "eval_samples_per_second": 84.549, "eval_steps_per_second": 0.676, "step": 2000 }, { "epoch": 0.042, "grad_norm": 0.3013302683830261, "learning_rate": 0.0016792, "loss": 4.1191, "step": 2100 }, { "epoch": 0.044, "grad_norm": 0.25836440920829773, "learning_rate": 0.0017592, "loss": 4.075, "step": 2200 }, { "epoch": 0.046, "grad_norm": 0.2489597499370575, "learning_rate": 0.0018392, "loss": 4.0824, "step": 2300 }, { "epoch": 0.048, "grad_norm": 0.24732087552547455, "learning_rate": 0.0019192, "loss": 4.0533, "step": 2400 }, { "epoch": 0.05, "grad_norm": 0.2429002970457077, "learning_rate": 0.0019992, "loss": 4.0472, "step": 2500 }, { "epoch": 0.052, "grad_norm": 0.21534161269664764, "learning_rate": 0.001999978563623903, "loss": 4.0063, "step": 2600 }, { "epoch": 0.054, "grad_norm": 0.2244805246591568, "learning_rate": 0.0019999133871331223, "loss": 4.0074, "step": 2700 }, { "epoch": 0.056, "grad_norm": 0.1999787837266922, "learning_rate": 0.0019998044711915177, "loss": 3.9708, "step": 2800 }, { "epoch": 0.058, "grad_norm": 0.19969643652439117, "learning_rate": 0.0019996518205634257, "loss": 3.9525, "step": 2900 }, { "epoch": 0.06, "grad_norm": 0.21098633110523224, "learning_rate": 0.0019994554419262797, "loss": 3.9491, "step": 3000 }, { "epoch": 0.06, "eval_accuracy": 0.324146771037182, "eval_loss": 3.9009768962860107, "eval_runtime": 18.6503, "eval_samples_per_second": 53.618, "eval_steps_per_second": 0.429, "step": 3000 }, { "epoch": 0.062, "grad_norm": 0.1954544633626938, "learning_rate": 0.001999215343870317, "loss": 3.942, "step": 3100 }, { "epoch": 0.064, "grad_norm": 0.19358158111572266, "learning_rate": 0.0019989315368982054, "loss": 3.9159, "step": 3200 }, { "epoch": 0.066, "grad_norm": 0.18568383157253265, "learning_rate": 0.0019986040334245797, "loss": 3.8959, "step": 3300 }, { "epoch": 0.068, "grad_norm": 0.1798350065946579, "learning_rate": 0.001998232847775504, "loss": 3.9035, "step": 3400 }, { "epoch": 0.07, "grad_norm": 0.18326053023338318, "learning_rate": 0.0019978179961878404, "loss": 3.8771, "step": 3500 }, { "epoch": 0.072, "grad_norm": 0.1763591170310974, "learning_rate": 0.001997359496808541, "loss": 3.8714, "step": 3600 }, { "epoch": 0.074, "grad_norm": 0.16502562165260315, "learning_rate": 0.001996857369693855, "loss": 3.8516, "step": 3700 }, { "epoch": 0.076, "grad_norm": 0.18450422585010529, "learning_rate": 0.0019963116368084486, "loss": 3.8573, "step": 3800 }, { "epoch": 0.078, "grad_norm": 0.1750190556049347, "learning_rate": 0.001995722322024446, "loss": 3.8403, "step": 3900 }, { "epoch": 0.08, "grad_norm": 0.1842149794101715, "learning_rate": 0.001995089451120385, "loss": 3.8158, "step": 4000 }, { "epoch": 0.08, "eval_accuracy": 0.3340352250489237, "eval_loss": 3.7926738262176514, "eval_runtime": 12.3279, "eval_samples_per_second": 81.117, "eval_steps_per_second": 0.649, "step": 4000 }, { "epoch": 0.082, "grad_norm": 0.1560104936361313, "learning_rate": 0.0019944130517800893, "loss": 3.8258, "step": 4100 }, { "epoch": 0.084, "grad_norm": 0.15086719393730164, "learning_rate": 0.001993693153591457, "loss": 3.8246, "step": 4200 }, { "epoch": 0.086, "grad_norm": 0.1565793752670288, "learning_rate": 0.0019929297880451674, "loss": 3.8036, "step": 4300 }, { "epoch": 0.088, "grad_norm": 0.16023847460746765, "learning_rate": 0.0019921229885333023, "loss": 3.7936, "step": 4400 }, { "epoch": 0.09, "grad_norm": 0.16122952103614807, "learning_rate": 0.001991272790347886, "loss": 3.8071, "step": 4500 }, { "epoch": 0.092, "grad_norm": 0.1704457700252533, "learning_rate": 0.0019903792306793415, "loss": 3.7761, "step": 4600 }, { "epoch": 0.094, "grad_norm": 0.14904244244098663, "learning_rate": 0.001989442348614863, "loss": 3.7839, "step": 4700 }, { "epoch": 0.096, "grad_norm": 0.15502023696899414, "learning_rate": 0.0019884621851367075, "loss": 3.7759, "step": 4800 }, { "epoch": 0.098, "grad_norm": 0.14749225974082947, "learning_rate": 0.001987438783120401, "loss": 3.7718, "step": 4900 }, { "epoch": 0.1, "grad_norm": 0.15654946863651276, "learning_rate": 0.001986372187332862, "loss": 3.7804, "step": 5000 }, { "epoch": 0.1, "eval_accuracy": 0.3406477495107632, "eval_loss": 3.7244012355804443, "eval_runtime": 12.2821, "eval_samples_per_second": 81.419, "eval_steps_per_second": 0.651, "step": 5000 }, { "epoch": 0.102, "grad_norm": 0.15231221914291382, "learning_rate": 0.0019852624444304467, "loss": 3.7449, "step": 5100 }, { "epoch": 0.104, "grad_norm": 0.15843184292316437, "learning_rate": 0.0019841096029569044, "loss": 3.7559, "step": 5200 }, { "epoch": 0.106, "grad_norm": 0.14371678233146667, "learning_rate": 0.0019829137133412556, "loss": 3.7536, "step": 5300 }, { "epoch": 0.108, "grad_norm": 0.1501024067401886, "learning_rate": 0.001981674827895587, "loss": 3.7346, "step": 5400 }, { "epoch": 0.11, "grad_norm": 0.1276807337999344, "learning_rate": 0.00198039300081276, "loss": 3.7387, "step": 5500 }, { "epoch": 0.112, "grad_norm": 0.13706138730049133, "learning_rate": 0.0019790682881640448, "loss": 3.738, "step": 5600 }, { "epoch": 0.114, "grad_norm": 0.14035683870315552, "learning_rate": 0.001977700747896664, "loss": 3.7224, "step": 5700 }, { "epoch": 0.116, "grad_norm": 0.1608739197254181, "learning_rate": 0.001976290439831259, "loss": 3.7252, "step": 5800 }, { "epoch": 0.118, "grad_norm": 0.130873903632164, "learning_rate": 0.0019748374256592736, "loss": 3.7179, "step": 5900 }, { "epoch": 0.12, "grad_norm": 0.13922768831253052, "learning_rate": 0.0019733417689402543, "loss": 3.712, "step": 6000 }, { "epoch": 0.12, "eval_accuracy": 0.3451976516634051, "eval_loss": 3.6720173358917236, "eval_runtime": 12.3084, "eval_samples_per_second": 81.245, "eval_steps_per_second": 0.65, "step": 6000 } ], "logging_steps": 100, "max_steps": 50000, "num_input_tokens_seen": 0, "num_train_epochs": 9223372036854775807, "save_steps": 2000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 128, "trial_name": null, "trial_params": null }