{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 333.3333333333333, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.3333333333333333, "grad_norm": 0.0, "learning_rate": 0.001, "loss": 12.006645202636719, "step": 1 }, { "epoch": 3.3333333333333335, "grad_norm": 0.0, "learning_rate": 0.0009955, "loss": 12.006645202636719, "step": 10 }, { "epoch": 6.666666666666667, "grad_norm": 0.0, "learning_rate": 0.0009905, "loss": 12.006645202636719, "step": 20 }, { "epoch": 10.0, "grad_norm": 0.0, "learning_rate": 0.0009855, "loss": 12.006645202636719, "step": 30 }, { "epoch": 13.333333333333334, "grad_norm": 0.0, "learning_rate": 0.0009805, "loss": 12.006645202636719, "step": 40 }, { "epoch": 16.666666666666668, "grad_norm": 0.0, "learning_rate": 0.0009755, "loss": 12.006645202636719, "step": 50 }, { "epoch": 20.0, "grad_norm": 0.0, "learning_rate": 0.0009705, "loss": 12.006645202636719, "step": 60 }, { "epoch": 23.333333333333332, "grad_norm": 0.0, "learning_rate": 0.0009655, "loss": 12.006645202636719, "step": 70 }, { "epoch": 26.666666666666668, "grad_norm": 0.0, "learning_rate": 0.0009605000000000001, "loss": 12.006645202636719, "step": 80 }, { "epoch": 30.0, "grad_norm": 0.0, "learning_rate": 0.0009555000000000001, "loss": 12.006645202636719, "step": 90 }, { "epoch": 33.333333333333336, "grad_norm": 0.0, "learning_rate": 0.0009505000000000001, "loss": 12.006645202636719, "step": 100 }, { "epoch": 36.666666666666664, "grad_norm": 0.0, "learning_rate": 0.0009455, "loss": 12.006645202636719, "step": 110 }, { "epoch": 40.0, "grad_norm": 0.0, "learning_rate": 0.0009405, "loss": 12.006645202636719, "step": 120 }, { "epoch": 43.333333333333336, "grad_norm": 0.0, "learning_rate": 0.0009355, "loss": 12.006645202636719, "step": 130 }, { "epoch": 46.666666666666664, "grad_norm": 0.0, "learning_rate": 0.0009305, "loss": 12.006645202636719, "step": 140 }, { "epoch": 50.0, "grad_norm": 0.0, "learning_rate": 0.0009255, "loss": 12.006645202636719, "step": 150 }, { "epoch": 53.333333333333336, "grad_norm": 0.0, "learning_rate": 0.0009205, "loss": 12.006645202636719, "step": 160 }, { "epoch": 56.666666666666664, "grad_norm": 0.0, "learning_rate": 0.0009155, "loss": 12.006645202636719, "step": 170 }, { "epoch": 60.0, "grad_norm": 0.0, "learning_rate": 0.0009105, "loss": 12.006645202636719, "step": 180 }, { "epoch": 63.333333333333336, "grad_norm": 0.0, "learning_rate": 0.0009055, "loss": 12.006645202636719, "step": 190 }, { "epoch": 66.66666666666667, "grad_norm": 0.0, "learning_rate": 0.0009004999999999999, "loss": 12.006645202636719, "step": 200 }, { "epoch": 70.0, "grad_norm": 0.0, "learning_rate": 0.0008955, "loss": 12.006645202636719, "step": 210 }, { "epoch": 73.33333333333333, "grad_norm": 0.0, "learning_rate": 0.0008905, "loss": 12.006645202636719, "step": 220 }, { "epoch": 76.66666666666667, "grad_norm": 0.0, "learning_rate": 0.0008855, "loss": 12.006645202636719, "step": 230 }, { "epoch": 80.0, "grad_norm": 0.0, "learning_rate": 0.0008805, "loss": 12.006645202636719, "step": 240 }, { "epoch": 83.33333333333333, "grad_norm": 0.0, "learning_rate": 0.0008755, "loss": 12.006645202636719, "step": 250 }, { "epoch": 86.66666666666667, "grad_norm": 0.0, "learning_rate": 0.0008705000000000001, "loss": 12.006645202636719, "step": 260 }, { "epoch": 90.0, "grad_norm": 0.0, "learning_rate": 0.0008655000000000001, "loss": 12.006645202636719, "step": 270 }, { "epoch": 93.33333333333333, "grad_norm": 0.0, "learning_rate": 0.0008605, "loss": 12.006645202636719, "step": 280 }, { "epoch": 96.66666666666667, "grad_norm": 0.0, "learning_rate": 0.0008555, "loss": 12.006645202636719, "step": 290 }, { "epoch": 100.0, "grad_norm": 0.0, "learning_rate": 0.0008505, "loss": 12.006645202636719, "step": 300 }, { "epoch": 103.33333333333333, "grad_norm": 0.0, "learning_rate": 0.0008455, "loss": 12.006645202636719, "step": 310 }, { "epoch": 106.66666666666667, "grad_norm": 0.0, "learning_rate": 0.0008405, "loss": 12.006645202636719, "step": 320 }, { "epoch": 110.0, "grad_norm": 0.0, "learning_rate": 0.0008355000000000001, "loss": 12.006645202636719, "step": 330 }, { "epoch": 113.33333333333333, "grad_norm": 0.0, "learning_rate": 0.0008305000000000001, "loss": 12.006645202636719, "step": 340 }, { "epoch": 116.66666666666667, "grad_norm": 0.0, "learning_rate": 0.0008255000000000001, "loss": 12.006645202636719, "step": 350 }, { "epoch": 120.0, "grad_norm": 0.0, "learning_rate": 0.0008205, "loss": 12.006645202636719, "step": 360 }, { "epoch": 123.33333333333333, "grad_norm": 0.0, "learning_rate": 0.0008155, "loss": 12.006645202636719, "step": 370 }, { "epoch": 126.66666666666667, "grad_norm": 0.0, "learning_rate": 0.0008105, "loss": 12.006645202636719, "step": 380 }, { "epoch": 130.0, "grad_norm": 0.0, "learning_rate": 0.0008055, "loss": 12.006645202636719, "step": 390 }, { "epoch": 133.33333333333334, "grad_norm": 0.0, "learning_rate": 0.0008005, "loss": 12.006645202636719, "step": 400 }, { "epoch": 136.66666666666666, "grad_norm": 0.0, "learning_rate": 0.0007955, "loss": 12.006645202636719, "step": 410 }, { "epoch": 140.0, "grad_norm": 0.0, "learning_rate": 0.0007905, "loss": 12.006645202636719, "step": 420 }, { "epoch": 143.33333333333334, "grad_norm": 0.0, "learning_rate": 0.0007855, "loss": 12.006645202636719, "step": 430 }, { "epoch": 146.66666666666666, "grad_norm": 0.0, "learning_rate": 0.0007804999999999999, "loss": 12.006645202636719, "step": 440 }, { "epoch": 150.0, "grad_norm": 0.0, "learning_rate": 0.0007754999999999999, "loss": 12.006645202636719, "step": 450 }, { "epoch": 153.33333333333334, "grad_norm": 0.0, "learning_rate": 0.0007705, "loss": 12.006645202636719, "step": 460 }, { "epoch": 156.66666666666666, "grad_norm": 0.0, "learning_rate": 0.0007655, "loss": 12.006645202636719, "step": 470 }, { "epoch": 160.0, "grad_norm": 0.0, "learning_rate": 0.0007605, "loss": 12.006645202636719, "step": 480 }, { "epoch": 163.33333333333334, "grad_norm": 0.0, "learning_rate": 0.0007555, "loss": 12.006645202636719, "step": 490 }, { "epoch": 166.66666666666666, "grad_norm": 0.0, "learning_rate": 0.0007505, "loss": 12.006645202636719, "step": 500 }, { "epoch": 170.0, "grad_norm": 0.0, "learning_rate": 0.0007455000000000001, "loss": 12.006645202636719, "step": 510 }, { "epoch": 173.33333333333334, "grad_norm": 0.0, "learning_rate": 0.0007405000000000001, "loss": 12.006645202636719, "step": 520 }, { "epoch": 176.66666666666666, "grad_norm": 0.0, "learning_rate": 0.0007355, "loss": 12.006645202636719, "step": 530 }, { "epoch": 180.0, "grad_norm": 0.0, "learning_rate": 0.0007305, "loss": 12.006645202636719, "step": 540 }, { "epoch": 183.33333333333334, "grad_norm": 0.0, "learning_rate": 0.0007255, "loss": 12.006645202636719, "step": 550 }, { "epoch": 186.66666666666666, "grad_norm": 0.0, "learning_rate": 0.0007205, "loss": 12.006645202636719, "step": 560 }, { "epoch": 190.0, "grad_norm": 0.0, "learning_rate": 0.0007155, "loss": 12.006645202636719, "step": 570 }, { "epoch": 193.33333333333334, "grad_norm": 0.0, "learning_rate": 0.0007105000000000001, "loss": 12.006645202636719, "step": 580 }, { "epoch": 196.66666666666666, "grad_norm": 0.0, "learning_rate": 0.0007055000000000001, "loss": 12.006645202636719, "step": 590 }, { "epoch": 200.0, "grad_norm": 0.0, "learning_rate": 0.0007005000000000001, "loss": 12.006645202636719, "step": 600 }, { "epoch": 203.33333333333334, "grad_norm": 0.0, "learning_rate": 0.0006955, "loss": 12.006645202636719, "step": 610 }, { "epoch": 206.66666666666666, "grad_norm": 0.0, "learning_rate": 0.0006905, "loss": 12.006645202636719, "step": 620 }, { "epoch": 210.0, "grad_norm": 0.0, "learning_rate": 0.0006855, "loss": 12.006645202636719, "step": 630 }, { "epoch": 213.33333333333334, "grad_norm": 0.0, "learning_rate": 0.0006805, "loss": 12.006645202636719, "step": 640 }, { "epoch": 216.66666666666666, "grad_norm": 0.0, "learning_rate": 0.0006755, "loss": 12.006645202636719, "step": 650 }, { "epoch": 220.0, "grad_norm": 0.0, "learning_rate": 0.0006705, "loss": 12.006645202636719, "step": 660 }, { "epoch": 223.33333333333334, "grad_norm": 0.0, "learning_rate": 0.0006655, "loss": 12.006645202636719, "step": 670 }, { "epoch": 226.66666666666666, "grad_norm": 0.0, "learning_rate": 0.0006605, "loss": 12.006645202636719, "step": 680 }, { "epoch": 230.0, "grad_norm": 0.0, "learning_rate": 0.0006554999999999999, "loss": 12.006645202636719, "step": 690 }, { "epoch": 233.33333333333334, "grad_norm": 0.0, "learning_rate": 0.0006504999999999999, "loss": 12.006645202636719, "step": 700 }, { "epoch": 236.66666666666666, "grad_norm": 0.0, "learning_rate": 0.0006455, "loss": 12.006645202636719, "step": 710 }, { "epoch": 240.0, "grad_norm": 0.0, "learning_rate": 0.0006405, "loss": 12.006645202636719, "step": 720 }, { "epoch": 243.33333333333334, "grad_norm": 0.0, "learning_rate": 0.0006355, "loss": 12.006645202636719, "step": 730 }, { "epoch": 246.66666666666666, "grad_norm": 0.0, "learning_rate": 0.0006305, "loss": 12.006645202636719, "step": 740 }, { "epoch": 250.0, "grad_norm": 0.0, "learning_rate": 0.0006255, "loss": 12.006645202636719, "step": 750 }, { "epoch": 253.33333333333334, "grad_norm": 0.0, "learning_rate": 0.0006205000000000001, "loss": 12.006645202636719, "step": 760 }, { "epoch": 256.6666666666667, "grad_norm": 0.0, "learning_rate": 0.0006155, "loss": 12.006645202636719, "step": 770 }, { "epoch": 260.0, "grad_norm": 0.0, "learning_rate": 0.0006105, "loss": 12.006645202636719, "step": 780 }, { "epoch": 263.3333333333333, "grad_norm": 0.0, "learning_rate": 0.0006055, "loss": 12.006645202636719, "step": 790 }, { "epoch": 266.6666666666667, "grad_norm": 0.0, "learning_rate": 0.0006005, "loss": 12.006645202636719, "step": 800 }, { "epoch": 270.0, "grad_norm": 0.0, "learning_rate": 0.0005955, "loss": 12.006645202636719, "step": 810 }, { "epoch": 273.3333333333333, "grad_norm": 0.0, "learning_rate": 0.0005905, "loss": 12.006645202636719, "step": 820 }, { "epoch": 276.6666666666667, "grad_norm": 0.0, "learning_rate": 0.0005855000000000001, "loss": 12.006645202636719, "step": 830 }, { "epoch": 280.0, "grad_norm": 0.0, "learning_rate": 0.0005805000000000001, "loss": 12.006645202636719, "step": 840 }, { "epoch": 283.3333333333333, "grad_norm": 0.0, "learning_rate": 0.0005755000000000001, "loss": 12.006645202636719, "step": 850 }, { "epoch": 286.6666666666667, "grad_norm": 0.0, "learning_rate": 0.0005705, "loss": 12.006645202636719, "step": 860 }, { "epoch": 290.0, "grad_norm": 0.0, "learning_rate": 0.0005655, "loss": 12.006645202636719, "step": 870 }, { "epoch": 293.3333333333333, "grad_norm": 0.0, "learning_rate": 0.0005605, "loss": 12.006645202636719, "step": 880 }, { "epoch": 296.6666666666667, "grad_norm": 0.0, "learning_rate": 0.0005555, "loss": 12.006645202636719, "step": 890 }, { "epoch": 300.0, "grad_norm": 0.0, "learning_rate": 0.0005505, "loss": 12.006645202636719, "step": 900 }, { "epoch": 303.3333333333333, "grad_norm": 0.0, "learning_rate": 0.0005455, "loss": 12.006645202636719, "step": 910 }, { "epoch": 306.6666666666667, "grad_norm": 0.0, "learning_rate": 0.0005405, "loss": 12.006645202636719, "step": 920 }, { "epoch": 310.0, "grad_norm": 0.0, "learning_rate": 0.0005355, "loss": 12.006645202636719, "step": 930 }, { "epoch": 313.3333333333333, "grad_norm": 0.0, "learning_rate": 0.0005304999999999999, "loss": 12.006645202636719, "step": 940 }, { "epoch": 316.6666666666667, "grad_norm": 0.0, "learning_rate": 0.0005254999999999999, "loss": 12.006645202636719, "step": 950 }, { "epoch": 320.0, "grad_norm": 0.0, "learning_rate": 0.0005205, "loss": 12.006645202636719, "step": 960 }, { "epoch": 323.3333333333333, "grad_norm": 0.0, "learning_rate": 0.0005155, "loss": 12.006645202636719, "step": 970 }, { "epoch": 326.6666666666667, "grad_norm": 0.0, "learning_rate": 0.0005105, "loss": 12.006645202636719, "step": 980 }, { "epoch": 330.0, "grad_norm": 0.0, "learning_rate": 0.0005055, "loss": 12.006645202636719, "step": 990 }, { "epoch": 333.3333333333333, "grad_norm": 0.0, "learning_rate": 0.0005005, "loss": 12.006645202636719, "step": 1000 } ], "logging_steps": 10, "max_steps": 2000, "num_input_tokens_seen": 0, "num_train_epochs": 667, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 583272445562880.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }