{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 250, "global_step": 3000, "is_hyper_param_search": false, "is_local_process_zero": false, "is_world_process_zero": true, "log_history": [ { "epoch": 0.016666666666666666, "grad_norm": 769.3955078125, "learning_rate": 0.00013066666666666668, "loss": 2207.061875, "step": 50 }, { "epoch": 0.03333333333333333, "grad_norm": 416.4177551269531, "learning_rate": 0.000264, "loss": 2157.63046875, "step": 100 }, { "epoch": 0.05, "grad_norm": 580.2691650390625, "learning_rate": 0.00039733333333333336, "loss": 2088.078125, "step": 150 }, { "epoch": 0.06666666666666667, "grad_norm": 518.3369140625, "learning_rate": 0.000399708326752494, "loss": 2027.68953125, "step": 200 }, { "epoch": 0.08333333333333333, "grad_norm": 343.1493225097656, "learning_rate": 0.0003988102673898103, "loss": 1981.4253125, "step": 250 }, { "epoch": 0.08333333333333333, "eval_accuracy": 0.1509169110459433, "eval_loss": 65.10028076171875, "eval_runtime": 22.9136, "eval_samples_per_second": 5.455, "eval_steps_per_second": 0.175, "step": 250 }, { "epoch": 0.1, "grad_norm": 301.3949890136719, "learning_rate": 0.00039730842777928766, "loss": 1950.15375, "step": 300 }, { "epoch": 0.11666666666666667, "grad_norm": 479.62359619140625, "learning_rate": 0.0003952073689584629, "loss": 1922.4278125, "step": 350 }, { "epoch": 0.13333333333333333, "grad_norm": 360.29132080078125, "learning_rate": 0.00039251347177392016, "loss": 1901.3628125, "step": 400 }, { "epoch": 0.15, "grad_norm": 334.61279296875, "learning_rate": 0.00038923491750286954, "loss": 1883.4759375, "step": 450 }, { "epoch": 0.16666666666666666, "grad_norm": 390.5067443847656, "learning_rate": 0.00038538166300687717, "loss": 1868.25234375, "step": 500 }, { "epoch": 0.16666666666666666, "eval_accuracy": 0.1607761485826002, "eval_loss": 61.64983367919922, "eval_runtime": 7.4283, "eval_samples_per_second": 16.827, "eval_steps_per_second": 0.538, "step": 500 }, { "epoch": 0.18333333333333332, "grad_norm": 330.5375061035156, "learning_rate": 0.0003809654104932039, "loss": 1856.43828125, "step": 550 }, { "epoch": 0.2, "grad_norm": 462.14501953125, "learning_rate": 0.00037599957197558643, "loss": 1845.416875, "step": 600 }, { "epoch": 0.21666666666666667, "grad_norm": 348.27215576171875, "learning_rate": 0.0003704992285423923, "loss": 1836.4821875, "step": 650 }, { "epoch": 0.23333333333333334, "grad_norm": 348.34326171875, "learning_rate": 0.0003644810845558505, "loss": 1828.6059375, "step": 700 }, { "epoch": 0.25, "grad_norm": 478.7774353027344, "learning_rate": 0.00035796341692145183, "loss": 1821.568125, "step": 750 }, { "epoch": 0.25, "eval_accuracy": 0.1680097751710655, "eval_loss": 60.21141815185547, "eval_runtime": 7.4388, "eval_samples_per_second": 16.804, "eval_steps_per_second": 0.538, "step": 750 }, { "epoch": 0.26666666666666666, "grad_norm": 353.61517333984375, "learning_rate": 0.0003509660195815883, "loss": 1817.4553125, "step": 800 }, { "epoch": 0.2833333333333333, "grad_norm": 335.4817810058594, "learning_rate": 0.0003435101434020002, "loss": 1810.23265625, "step": 850 }, { "epoch": 0.3, "grad_norm": 580.8027954101562, "learning_rate": 0.0003356184316335953, "loss": 1802.5071875, "step": 900 }, { "epoch": 0.31666666666666665, "grad_norm": 463.22943115234375, "learning_rate": 0.00032731485114564034, "loss": 1796.794375, "step": 950 }, { "epoch": 0.3333333333333333, "grad_norm": 435.9424133300781, "learning_rate": 0.0003186246196391665, "loss": 1792.77296875, "step": 1000 }, { "epoch": 0.3333333333333333, "eval_accuracy": 0.1721837732160313, "eval_loss": 59.25102233886719, "eval_runtime": 7.0046, "eval_samples_per_second": 17.845, "eval_steps_per_second": 0.571, "step": 1000 }, { "epoch": 0.35, "grad_norm": 428.2043151855469, "learning_rate": 0.00030957412906164035, "loss": 1789.57328125, "step": 1050 }, { "epoch": 0.36666666666666664, "grad_norm": 514.5044555664062, "learning_rate": 0.0003001908654554865, "loss": 1784.348125, "step": 1100 }, { "epoch": 0.38333333333333336, "grad_norm": 431.8824462890625, "learning_rate": 0.00029050332548388074, "loss": 1780.343125, "step": 1150 }, { "epoch": 0.4, "grad_norm": 544.1112670898438, "learning_rate": 0.00028054092988732, "loss": 1776.639375, "step": 1200 }, { "epoch": 0.4166666666666667, "grad_norm": 489.1014099121094, "learning_rate": 0.0002703339341338006, "loss": 1775.20375, "step": 1250 }, { "epoch": 0.4166666666666667, "eval_accuracy": 0.17473020527859237, "eval_loss": 58.67676544189453, "eval_runtime": 7.7117, "eval_samples_per_second": 16.209, "eval_steps_per_second": 0.519, "step": 1250 }, { "epoch": 0.43333333333333335, "grad_norm": 434.31243896484375, "learning_rate": 0.00025991333653395637, "loss": 1772.2684375, "step": 1300 }, { "epoch": 0.45, "grad_norm": 329.494873046875, "learning_rate": 0.00024931078410020814, "loss": 1769.61375, "step": 1350 }, { "epoch": 0.4666666666666667, "grad_norm": 606.4137573242188, "learning_rate": 0.00023855847643582703, "loss": 1765.89265625, "step": 1400 }, { "epoch": 0.48333333333333334, "grad_norm": 486.37298583984375, "learning_rate": 0.00022768906794579753, "loss": 1762.6784375, "step": 1450 }, { "epoch": 0.5, "grad_norm": 426.2013854980469, "learning_rate": 0.00021673556866646317, "loss": 1761.15328125, "step": 1500 }, { "epoch": 0.5, "eval_accuracy": 0.1763401759530792, "eval_loss": 58.22502517700195, "eval_runtime": 7.3798, "eval_samples_per_second": 16.938, "eval_steps_per_second": 0.542, "step": 1500 }, { "epoch": 0.5166666666666667, "grad_norm": 389.8416748046875, "learning_rate": 0.00020573124401513043, "loss": 1758.96953125, "step": 1550 }, { "epoch": 0.5333333333333333, "grad_norm": 650.4288330078125, "learning_rate": 0.00019470951376409043, "loss": 1757.52515625, "step": 1600 }, { "epoch": 0.55, "grad_norm": 847.1361694335938, "learning_rate": 0.0001837038505458685, "loss": 1753.61921875, "step": 1650 }, { "epoch": 0.5666666666666667, "grad_norm": 488.51898193359375, "learning_rate": 0.00017274767819793914, "loss": 1753.27640625, "step": 1700 }, { "epoch": 0.5833333333333334, "grad_norm": 306.435791015625, "learning_rate": 0.00016187427025563068, "loss": 1751.60140625, "step": 1750 }, { "epoch": 0.5833333333333334, "eval_accuracy": 0.17743304007820138, "eval_loss": 57.92564392089844, "eval_runtime": 7.3883, "eval_samples_per_second": 16.919, "eval_steps_per_second": 0.541, "step": 1750 }, { "epoch": 0.6, "grad_norm": 362.682373046875, "learning_rate": 0.0001511166489014914, "loss": 1750.76390625, "step": 1800 }, { "epoch": 0.6166666666666667, "grad_norm": 428.01727294921875, "learning_rate": 0.00014050748467800728, "loss": 1748.945625, "step": 1850 }, { "epoch": 0.6333333333333333, "grad_norm": 572.7185668945312, "learning_rate": 0.0001300789972682373, "loss": 1747.49421875, "step": 1900 }, { "epoch": 0.65, "grad_norm": 404.1789855957031, "learning_rate": 0.00011986285764569589, "loss": 1747.0315625, "step": 1950 }, { "epoch": 0.6666666666666666, "grad_norm": 516.892578125, "learning_rate": 0.00010989009189064648, "loss": 1745.6384375, "step": 2000 }, { "epoch": 0.6666666666666666, "eval_accuracy": 0.17842521994134897, "eval_loss": 57.703956604003906, "eval_runtime": 8.2449, "eval_samples_per_second": 15.161, "eval_steps_per_second": 0.485, "step": 2000 }, { "epoch": 0.6833333333333333, "grad_norm": 480.41583251953125, "learning_rate": 0.00010019098696491591, "loss": 1744.609375, "step": 2050 }, { "epoch": 0.7, "grad_norm": 489.03533935546875, "learning_rate": 9.079499873138675e-05, "loss": 1743.00265625, "step": 2100 }, { "epoch": 0.7166666666666667, "grad_norm": 281.31231689453125, "learning_rate": 8.173066249750974e-05, "loss": 1741.88375, "step": 2150 }, { "epoch": 0.7333333333333333, "grad_norm": 367.38116455078125, "learning_rate": 7.302550635451295e-05, "loss": 1741.17609375, "step": 2200 }, { "epoch": 0.75, "grad_norm": 373.6410827636719, "learning_rate": 6.470596757549348e-05, "loss": 1740.87671875, "step": 2250 }, { "epoch": 0.75, "eval_accuracy": 0.17889638318670575, "eval_loss": 57.56399917602539, "eval_runtime": 8.5942, "eval_samples_per_second": 14.545, "eval_steps_per_second": 0.465, "step": 2250 }, { "epoch": 0.7666666666666667, "grad_norm": 378.64324951171875, "learning_rate": 5.6797312326288e-05, "loss": 1741.790625, "step": 2300 }, { "epoch": 0.7833333333333333, "grad_norm": 399.52471923828125, "learning_rate": 4.932355893295748e-05, "loss": 1739.6509375, "step": 2350 }, { "epoch": 0.8, "grad_norm": 448.8892822265625, "learning_rate": 4.230740493892038e-05, "loss": 1739.64484375, "step": 2400 }, { "epoch": 0.8166666666666667, "grad_norm": 246.4326171875, "learning_rate": 3.57701581732592e-05, "loss": 1738.5784375, "step": 2450 }, { "epoch": 0.8333333333333334, "grad_norm": 420.97027587890625, "learning_rate": 2.973167203954399e-05, "loss": 1738.51265625, "step": 2500 }, { "epoch": 0.8333333333333334, "eval_accuracy": 0.17922873900293254, "eval_loss": 57.48527526855469, "eval_runtime": 6.8955, "eval_samples_per_second": 18.128, "eval_steps_per_second": 0.58, "step": 2500 }, { "epoch": 0.85, "grad_norm": 455.0086975097656, "learning_rate": 2.4210285221698124e-05, "loss": 1739.21203125, "step": 2550 }, { "epoch": 0.8666666666666667, "grad_norm": 460.4869079589844, "learning_rate": 1.922276599001802e-05, "loss": 1737.5628125, "step": 2600 }, { "epoch": 0.8833333333333333, "grad_norm": 488.4925231933594, "learning_rate": 1.4784261276487333e-05, "loss": 1737.22265625, "step": 2650 }, { "epoch": 0.9, "grad_norm": 602.5552978515625, "learning_rate": 1.0908250674042331e-05, "loss": 1736.81359375, "step": 2700 }, { "epoch": 0.9166666666666666, "grad_norm": 375.4463195800781, "learning_rate": 7.606505499491246e-06, "loss": 1736.9728125, "step": 2750 }, { "epoch": 0.9166666666666666, "eval_accuracy": 0.17933235581622678, "eval_loss": 57.458404541015625, "eval_runtime": 7.136, "eval_samples_per_second": 17.517, "eval_steps_per_second": 0.561, "step": 2750 }, { "epoch": 0.9333333333333333, "grad_norm": 411.4505920410156, "learning_rate": 4.88905304441194e-06, "loss": 1736.17953125, "step": 2800 }, { "epoch": 0.95, "grad_norm": 255.17337036132812, "learning_rate": 2.7641461225969665e-06, "loss": 1737.8128125, "step": 2850 }, { "epoch": 0.9666666666666667, "grad_norm": 709.8735961914062, "learning_rate": 1.2382380065293576e-06, "loss": 1737.474375, "step": 2900 }, { "epoch": 0.9833333333333333, "grad_norm": 485.8822326660156, "learning_rate": 3.159628290061445e-07, "loss": 1737.075, "step": 2950 }, { "epoch": 1.0, "grad_norm": 478.07696533203125, "learning_rate": 1.2150942938493615e-10, "loss": 1737.3753125, "step": 3000 }, { "epoch": 1.0, "eval_accuracy": 0.17936754643206257, "eval_loss": 57.4544677734375, "eval_runtime": 7.3114, "eval_samples_per_second": 17.097, "eval_steps_per_second": 0.547, "step": 3000 } ], "logging_steps": 50, "max_steps": 3000, "num_input_tokens_seen": 0, "num_train_epochs": 9223372036854775807, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }