{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 100, "global_step": 1944, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0010290712631849757, "grad_norm": Infinity, "learning_rate": 0.0, "loss": 14.6258, "step": 1 }, { "epoch": 0.10290712631849755, "grad_norm": 88.1055908203125, "learning_rate": 2.544987146529563e-07, "loss": 10.8465, "step": 100 }, { "epoch": 0.10290712631849755, "eval_loss": 5.158095359802246, "eval_runtime": 112.1444, "eval_samples_per_second": 50.257, "eval_steps_per_second": 12.564, "step": 100 }, { "epoch": 0.2058142526369951, "grad_norm": 94.28155517578125, "learning_rate": 5.115681233933161e-07, "loss": 4.6022, "step": 200 }, { "epoch": 0.2058142526369951, "eval_loss": 4.419423580169678, "eval_runtime": 112.0575, "eval_samples_per_second": 50.296, "eval_steps_per_second": 12.574, "step": 200 }, { "epoch": 0.3087213789554927, "grad_norm": 97.87965393066406, "learning_rate": 7.686375321336761e-07, "loss": 4.1479, "step": 300 }, { "epoch": 0.3087213789554927, "eval_loss": 4.014382839202881, "eval_runtime": 111.7852, "eval_samples_per_second": 50.418, "eval_steps_per_second": 12.605, "step": 300 }, { "epoch": 0.4116285052739902, "grad_norm": 95.3952865600586, "learning_rate": 9.998979614695782e-07, "loss": 3.7252, "step": 400 }, { "epoch": 0.4116285052739902, "eval_loss": 3.551706075668335, "eval_runtime": 108.3373, "eval_samples_per_second": 52.023, "eval_steps_per_second": 13.006, "step": 400 }, { "epoch": 0.5145356315924878, "grad_norm": 95.16962432861328, "learning_rate": 9.877036510787077e-07, "loss": 3.2177, "step": 500 }, { "epoch": 0.5145356315924878, "eval_loss": 3.0623891353607178, "eval_runtime": 108.2531, "eval_samples_per_second": 52.063, "eval_steps_per_second": 13.016, "step": 500 }, { "epoch": 0.6174427579109854, "grad_norm": 94.3937759399414, "learning_rate": 9.556704559847638e-07, "loss": 2.7197, "step": 600 }, { "epoch": 0.6174427579109854, "eval_loss": 2.5705835819244385, "eval_runtime": 108.2066, "eval_samples_per_second": 52.086, "eval_steps_per_second": 13.021, "step": 600 }, { "epoch": 0.7203498842294829, "grad_norm": 93.52433013916016, "learning_rate": 9.051014274622946e-07, "loss": 2.2819, "step": 700 }, { "epoch": 0.7203498842294829, "eval_loss": 2.1427197456359863, "eval_runtime": 108.5307, "eval_samples_per_second": 51.93, "eval_steps_per_second": 12.982, "step": 700 }, { "epoch": 0.8232570105479804, "grad_norm": 89.10120391845703, "learning_rate": 8.380536202907438e-07, "loss": 1.8746, "step": 800 }, { "epoch": 0.8232570105479804, "eval_loss": 1.7777544260025024, "eval_runtime": 108.8216, "eval_samples_per_second": 51.791, "eval_steps_per_second": 12.948, "step": 800 }, { "epoch": 0.926164136866478, "grad_norm": 85.86779022216797, "learning_rate": 7.572544155613299e-07, "loss": 1.5386, "step": 900 }, { "epoch": 0.926164136866478, "eval_loss": 1.478671908378601, "eval_runtime": 107.9148, "eval_samples_per_second": 52.226, "eval_steps_per_second": 13.057, "step": 900 }, { "epoch": 1.0288139953691793, "grad_norm": 75.19822692871094, "learning_rate": 6.65990575846327e-07, "loss": 1.2553, "step": 1000 }, { "epoch": 1.0288139953691793, "eval_loss": 1.2369881868362427, "eval_runtime": 108.6334, "eval_samples_per_second": 51.881, "eval_steps_per_second": 12.97, "step": 1000 }, { "epoch": 1.1317211216876768, "grad_norm": 67.07587432861328, "learning_rate": 5.67974545761766e-07, "loss": 1.0161, "step": 1100 }, { "epoch": 1.1317211216876768, "eval_loss": 1.0523114204406738, "eval_runtime": 108.4002, "eval_samples_per_second": 51.993, "eval_steps_per_second": 12.998, "step": 1100 }, { "epoch": 1.2346282480061745, "grad_norm": 58.74506759643555, "learning_rate": 4.671934365699874e-07, "loss": 0.8586, "step": 1200 }, { "epoch": 1.2346282480061745, "eval_loss": 0.9369459748268127, "eval_runtime": 109.3483, "eval_samples_per_second": 51.542, "eval_steps_per_second": 12.885, "step": 1200 }, { "epoch": 1.337535374324672, "grad_norm": 52.68925857543945, "learning_rate": 3.677468378497882e-07, "loss": 0.7547, "step": 1300 }, { "epoch": 1.337535374324672, "eval_loss": 0.8299320340156555, "eval_runtime": 108.4143, "eval_samples_per_second": 51.986, "eval_steps_per_second": 12.996, "step": 1300 }, { "epoch": 1.4404425006431696, "grad_norm": 43.96974563598633, "learning_rate": 2.736800537561799e-07, "loss": 0.6964, "step": 1400 }, { "epoch": 1.4404425006431696, "eval_loss": 0.7713428139686584, "eval_runtime": 108.6974, "eval_samples_per_second": 51.85, "eval_steps_per_second": 12.963, "step": 1400 }, { "epoch": 1.543349626961667, "grad_norm": 41.54279708862305, "learning_rate": 1.888195475110272e-07, "loss": 0.641, "step": 1500 }, { "epoch": 1.543349626961667, "eval_loss": 0.7353219389915466, "eval_runtime": 108.5089, "eval_samples_per_second": 51.94, "eval_steps_per_second": 12.985, "step": 1500 }, { "epoch": 1.6462567532801646, "grad_norm": 42.50430679321289, "learning_rate": 1.1661728793908349e-07, "loss": 0.5969, "step": 1600 }, { "epoch": 1.6462567532801646, "eval_loss": 0.7152444124221802, "eval_runtime": 108.3835, "eval_samples_per_second": 52.001, "eval_steps_per_second": 13.0, "step": 1600 }, { "epoch": 1.7491638795986622, "grad_norm": 37.6126708984375, "learning_rate": 6.001032974514946e-08, "loss": 0.5822, "step": 1700 }, { "epoch": 1.7491638795986622, "eval_loss": 0.6989532709121704, "eval_runtime": 109.1511, "eval_samples_per_second": 51.635, "eval_steps_per_second": 12.909, "step": 1700 }, { "epoch": 1.8520710059171597, "grad_norm": 40.5544548034668, "learning_rate": 2.130133954760538e-08, "loss": 0.5755, "step": 1800 }, { "epoch": 1.8520710059171597, "eval_loss": 0.6931490898132324, "eval_runtime": 108.3612, "eval_samples_per_second": 52.011, "eval_steps_per_second": 13.003, "step": 1800 }, { "epoch": 1.9549781322356572, "grad_norm": 41.48668670654297, "learning_rate": 2.0649276488408084e-09, "loss": 0.5698, "step": 1900 }, { "epoch": 1.9549781322356572, "eval_loss": 0.6919553279876709, "eval_runtime": 109.2179, "eval_samples_per_second": 51.603, "eval_steps_per_second": 12.901, "step": 1900 } ], "logging_steps": 100, "max_steps": 1944, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 900, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 8.415299181635174e+16, "train_batch_size": 4, "trial_name": null, "trial_params": null }