| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 1.0, |
| "eval_steps": 250, |
| "global_step": 3000, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": false, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.016666666666666666, |
| "grad_norm": 769.3955078125, |
| "learning_rate": 0.00013066666666666668, |
| "loss": 2207.061875, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.03333333333333333, |
| "grad_norm": 416.4177551269531, |
| "learning_rate": 0.000264, |
| "loss": 2157.63046875, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.05, |
| "grad_norm": 580.2691650390625, |
| "learning_rate": 0.00039733333333333336, |
| "loss": 2088.078125, |
| "step": 150 |
| }, |
| { |
| "epoch": 0.06666666666666667, |
| "grad_norm": 518.3369140625, |
| "learning_rate": 0.000399708326752494, |
| "loss": 2027.68953125, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.08333333333333333, |
| "grad_norm": 343.1493225097656, |
| "learning_rate": 0.0003988102673898103, |
| "loss": 1981.4253125, |
| "step": 250 |
| }, |
| { |
| "epoch": 0.08333333333333333, |
| "eval_accuracy": 0.1509169110459433, |
| "eval_loss": 65.10028076171875, |
| "eval_runtime": 22.9136, |
| "eval_samples_per_second": 5.455, |
| "eval_steps_per_second": 0.175, |
| "step": 250 |
| }, |
| { |
| "epoch": 0.1, |
| "grad_norm": 301.3949890136719, |
| "learning_rate": 0.00039730842777928766, |
| "loss": 1950.15375, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.11666666666666667, |
| "grad_norm": 479.62359619140625, |
| "learning_rate": 0.0003952073689584629, |
| "loss": 1922.4278125, |
| "step": 350 |
| }, |
| { |
| "epoch": 0.13333333333333333, |
| "grad_norm": 360.29132080078125, |
| "learning_rate": 0.00039251347177392016, |
| "loss": 1901.3628125, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.15, |
| "grad_norm": 334.61279296875, |
| "learning_rate": 0.00038923491750286954, |
| "loss": 1883.4759375, |
| "step": 450 |
| }, |
| { |
| "epoch": 0.16666666666666666, |
| "grad_norm": 390.5067443847656, |
| "learning_rate": 0.00038538166300687717, |
| "loss": 1868.25234375, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.16666666666666666, |
| "eval_accuracy": 0.1607761485826002, |
| "eval_loss": 61.64983367919922, |
| "eval_runtime": 7.4283, |
| "eval_samples_per_second": 16.827, |
| "eval_steps_per_second": 0.538, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.18333333333333332, |
| "grad_norm": 330.5375061035156, |
| "learning_rate": 0.0003809654104932039, |
| "loss": 1856.43828125, |
| "step": 550 |
| }, |
| { |
| "epoch": 0.2, |
| "grad_norm": 462.14501953125, |
| "learning_rate": 0.00037599957197558643, |
| "loss": 1845.416875, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.21666666666666667, |
| "grad_norm": 348.27215576171875, |
| "learning_rate": 0.0003704992285423923, |
| "loss": 1836.4821875, |
| "step": 650 |
| }, |
| { |
| "epoch": 0.23333333333333334, |
| "grad_norm": 348.34326171875, |
| "learning_rate": 0.0003644810845558505, |
| "loss": 1828.6059375, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.25, |
| "grad_norm": 478.7774353027344, |
| "learning_rate": 0.00035796341692145183, |
| "loss": 1821.568125, |
| "step": 750 |
| }, |
| { |
| "epoch": 0.25, |
| "eval_accuracy": 0.1680097751710655, |
| "eval_loss": 60.21141815185547, |
| "eval_runtime": 7.4388, |
| "eval_samples_per_second": 16.804, |
| "eval_steps_per_second": 0.538, |
| "step": 750 |
| }, |
| { |
| "epoch": 0.26666666666666666, |
| "grad_norm": 353.61517333984375, |
| "learning_rate": 0.0003509660195815883, |
| "loss": 1817.4553125, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.2833333333333333, |
| "grad_norm": 335.4817810058594, |
| "learning_rate": 0.0003435101434020002, |
| "loss": 1810.23265625, |
| "step": 850 |
| }, |
| { |
| "epoch": 0.3, |
| "grad_norm": 580.8027954101562, |
| "learning_rate": 0.0003356184316335953, |
| "loss": 1802.5071875, |
| "step": 900 |
| }, |
| { |
| "epoch": 0.31666666666666665, |
| "grad_norm": 463.22943115234375, |
| "learning_rate": 0.00032731485114564034, |
| "loss": 1796.794375, |
| "step": 950 |
| }, |
| { |
| "epoch": 0.3333333333333333, |
| "grad_norm": 435.9424133300781, |
| "learning_rate": 0.0003186246196391665, |
| "loss": 1792.77296875, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.3333333333333333, |
| "eval_accuracy": 0.1721837732160313, |
| "eval_loss": 59.25102233886719, |
| "eval_runtime": 7.0046, |
| "eval_samples_per_second": 17.845, |
| "eval_steps_per_second": 0.571, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.35, |
| "grad_norm": 428.2043151855469, |
| "learning_rate": 0.00030957412906164035, |
| "loss": 1789.57328125, |
| "step": 1050 |
| }, |
| { |
| "epoch": 0.36666666666666664, |
| "grad_norm": 514.5044555664062, |
| "learning_rate": 0.0003001908654554865, |
| "loss": 1784.348125, |
| "step": 1100 |
| }, |
| { |
| "epoch": 0.38333333333333336, |
| "grad_norm": 431.8824462890625, |
| "learning_rate": 0.00029050332548388074, |
| "loss": 1780.343125, |
| "step": 1150 |
| }, |
| { |
| "epoch": 0.4, |
| "grad_norm": 544.1112670898438, |
| "learning_rate": 0.00028054092988732, |
| "loss": 1776.639375, |
| "step": 1200 |
| }, |
| { |
| "epoch": 0.4166666666666667, |
| "grad_norm": 489.1014099121094, |
| "learning_rate": 0.0002703339341338006, |
| "loss": 1775.20375, |
| "step": 1250 |
| }, |
| { |
| "epoch": 0.4166666666666667, |
| "eval_accuracy": 0.17473020527859237, |
| "eval_loss": 58.67676544189453, |
| "eval_runtime": 7.7117, |
| "eval_samples_per_second": 16.209, |
| "eval_steps_per_second": 0.519, |
| "step": 1250 |
| }, |
| { |
| "epoch": 0.43333333333333335, |
| "grad_norm": 434.31243896484375, |
| "learning_rate": 0.00025991333653395637, |
| "loss": 1772.2684375, |
| "step": 1300 |
| }, |
| { |
| "epoch": 0.45, |
| "grad_norm": 329.494873046875, |
| "learning_rate": 0.00024931078410020814, |
| "loss": 1769.61375, |
| "step": 1350 |
| }, |
| { |
| "epoch": 0.4666666666666667, |
| "grad_norm": 606.4137573242188, |
| "learning_rate": 0.00023855847643582703, |
| "loss": 1765.89265625, |
| "step": 1400 |
| }, |
| { |
| "epoch": 0.48333333333333334, |
| "grad_norm": 486.37298583984375, |
| "learning_rate": 0.00022768906794579753, |
| "loss": 1762.6784375, |
| "step": 1450 |
| }, |
| { |
| "epoch": 0.5, |
| "grad_norm": 426.2013854980469, |
| "learning_rate": 0.00021673556866646317, |
| "loss": 1761.15328125, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.5, |
| "eval_accuracy": 0.1763401759530792, |
| "eval_loss": 58.22502517700195, |
| "eval_runtime": 7.3798, |
| "eval_samples_per_second": 16.938, |
| "eval_steps_per_second": 0.542, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.5166666666666667, |
| "grad_norm": 389.8416748046875, |
| "learning_rate": 0.00020573124401513043, |
| "loss": 1758.96953125, |
| "step": 1550 |
| }, |
| { |
| "epoch": 0.5333333333333333, |
| "grad_norm": 650.4288330078125, |
| "learning_rate": 0.00019470951376409043, |
| "loss": 1757.52515625, |
| "step": 1600 |
| }, |
| { |
| "epoch": 0.55, |
| "grad_norm": 847.1361694335938, |
| "learning_rate": 0.0001837038505458685, |
| "loss": 1753.61921875, |
| "step": 1650 |
| }, |
| { |
| "epoch": 0.5666666666666667, |
| "grad_norm": 488.51898193359375, |
| "learning_rate": 0.00017274767819793914, |
| "loss": 1753.27640625, |
| "step": 1700 |
| }, |
| { |
| "epoch": 0.5833333333333334, |
| "grad_norm": 306.435791015625, |
| "learning_rate": 0.00016187427025563068, |
| "loss": 1751.60140625, |
| "step": 1750 |
| }, |
| { |
| "epoch": 0.5833333333333334, |
| "eval_accuracy": 0.17743304007820138, |
| "eval_loss": 57.92564392089844, |
| "eval_runtime": 7.3883, |
| "eval_samples_per_second": 16.919, |
| "eval_steps_per_second": 0.541, |
| "step": 1750 |
| }, |
| { |
| "epoch": 0.6, |
| "grad_norm": 362.682373046875, |
| "learning_rate": 0.0001511166489014914, |
| "loss": 1750.76390625, |
| "step": 1800 |
| }, |
| { |
| "epoch": 0.6166666666666667, |
| "grad_norm": 428.01727294921875, |
| "learning_rate": 0.00014050748467800728, |
| "loss": 1748.945625, |
| "step": 1850 |
| }, |
| { |
| "epoch": 0.6333333333333333, |
| "grad_norm": 572.7185668945312, |
| "learning_rate": 0.0001300789972682373, |
| "loss": 1747.49421875, |
| "step": 1900 |
| }, |
| { |
| "epoch": 0.65, |
| "grad_norm": 404.1789855957031, |
| "learning_rate": 0.00011986285764569589, |
| "loss": 1747.0315625, |
| "step": 1950 |
| }, |
| { |
| "epoch": 0.6666666666666666, |
| "grad_norm": 516.892578125, |
| "learning_rate": 0.00010989009189064648, |
| "loss": 1745.6384375, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.6666666666666666, |
| "eval_accuracy": 0.17842521994134897, |
| "eval_loss": 57.703956604003906, |
| "eval_runtime": 8.2449, |
| "eval_samples_per_second": 15.161, |
| "eval_steps_per_second": 0.485, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.6833333333333333, |
| "grad_norm": 480.41583251953125, |
| "learning_rate": 0.00010019098696491591, |
| "loss": 1744.609375, |
| "step": 2050 |
| }, |
| { |
| "epoch": 0.7, |
| "grad_norm": 489.03533935546875, |
| "learning_rate": 9.079499873138675e-05, |
| "loss": 1743.00265625, |
| "step": 2100 |
| }, |
| { |
| "epoch": 0.7166666666666667, |
| "grad_norm": 281.31231689453125, |
| "learning_rate": 8.173066249750974e-05, |
| "loss": 1741.88375, |
| "step": 2150 |
| }, |
| { |
| "epoch": 0.7333333333333333, |
| "grad_norm": 367.38116455078125, |
| "learning_rate": 7.302550635451295e-05, |
| "loss": 1741.17609375, |
| "step": 2200 |
| }, |
| { |
| "epoch": 0.75, |
| "grad_norm": 373.6410827636719, |
| "learning_rate": 6.470596757549348e-05, |
| "loss": 1740.87671875, |
| "step": 2250 |
| }, |
| { |
| "epoch": 0.75, |
| "eval_accuracy": 0.17889638318670575, |
| "eval_loss": 57.56399917602539, |
| "eval_runtime": 8.5942, |
| "eval_samples_per_second": 14.545, |
| "eval_steps_per_second": 0.465, |
| "step": 2250 |
| }, |
| { |
| "epoch": 0.7666666666666667, |
| "grad_norm": 378.64324951171875, |
| "learning_rate": 5.6797312326288e-05, |
| "loss": 1741.790625, |
| "step": 2300 |
| }, |
| { |
| "epoch": 0.7833333333333333, |
| "grad_norm": 399.52471923828125, |
| "learning_rate": 4.932355893295748e-05, |
| "loss": 1739.6509375, |
| "step": 2350 |
| }, |
| { |
| "epoch": 0.8, |
| "grad_norm": 448.8892822265625, |
| "learning_rate": 4.230740493892038e-05, |
| "loss": 1739.64484375, |
| "step": 2400 |
| }, |
| { |
| "epoch": 0.8166666666666667, |
| "grad_norm": 246.4326171875, |
| "learning_rate": 3.57701581732592e-05, |
| "loss": 1738.5784375, |
| "step": 2450 |
| }, |
| { |
| "epoch": 0.8333333333333334, |
| "grad_norm": 420.97027587890625, |
| "learning_rate": 2.973167203954399e-05, |
| "loss": 1738.51265625, |
| "step": 2500 |
| }, |
| { |
| "epoch": 0.8333333333333334, |
| "eval_accuracy": 0.17922873900293254, |
| "eval_loss": 57.48527526855469, |
| "eval_runtime": 6.8955, |
| "eval_samples_per_second": 18.128, |
| "eval_steps_per_second": 0.58, |
| "step": 2500 |
| }, |
| { |
| "epoch": 0.85, |
| "grad_norm": 455.0086975097656, |
| "learning_rate": 2.4210285221698124e-05, |
| "loss": 1739.21203125, |
| "step": 2550 |
| }, |
| { |
| "epoch": 0.8666666666666667, |
| "grad_norm": 460.4869079589844, |
| "learning_rate": 1.922276599001802e-05, |
| "loss": 1737.5628125, |
| "step": 2600 |
| }, |
| { |
| "epoch": 0.8833333333333333, |
| "grad_norm": 488.4925231933594, |
| "learning_rate": 1.4784261276487333e-05, |
| "loss": 1737.22265625, |
| "step": 2650 |
| }, |
| { |
| "epoch": 0.9, |
| "grad_norm": 602.5552978515625, |
| "learning_rate": 1.0908250674042331e-05, |
| "loss": 1736.81359375, |
| "step": 2700 |
| }, |
| { |
| "epoch": 0.9166666666666666, |
| "grad_norm": 375.4463195800781, |
| "learning_rate": 7.606505499491246e-06, |
| "loss": 1736.9728125, |
| "step": 2750 |
| }, |
| { |
| "epoch": 0.9166666666666666, |
| "eval_accuracy": 0.17933235581622678, |
| "eval_loss": 57.458404541015625, |
| "eval_runtime": 7.136, |
| "eval_samples_per_second": 17.517, |
| "eval_steps_per_second": 0.561, |
| "step": 2750 |
| }, |
| { |
| "epoch": 0.9333333333333333, |
| "grad_norm": 411.4505920410156, |
| "learning_rate": 4.88905304441194e-06, |
| "loss": 1736.17953125, |
| "step": 2800 |
| }, |
| { |
| "epoch": 0.95, |
| "grad_norm": 255.17337036132812, |
| "learning_rate": 2.7641461225969665e-06, |
| "loss": 1737.8128125, |
| "step": 2850 |
| }, |
| { |
| "epoch": 0.9666666666666667, |
| "grad_norm": 709.8735961914062, |
| "learning_rate": 1.2382380065293576e-06, |
| "loss": 1737.474375, |
| "step": 2900 |
| }, |
| { |
| "epoch": 0.9833333333333333, |
| "grad_norm": 485.8822326660156, |
| "learning_rate": 3.159628290061445e-07, |
| "loss": 1737.075, |
| "step": 2950 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 478.07696533203125, |
| "learning_rate": 1.2150942938493615e-10, |
| "loss": 1737.3753125, |
| "step": 3000 |
| }, |
| { |
| "epoch": 1.0, |
| "eval_accuracy": 0.17936754643206257, |
| "eval_loss": 57.4544677734375, |
| "eval_runtime": 7.3114, |
| "eval_samples_per_second": 17.097, |
| "eval_steps_per_second": 0.547, |
| "step": 3000 |
| } |
| ], |
| "logging_steps": 50, |
| "max_steps": 3000, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 9223372036854775807, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 0.0, |
| "train_batch_size": 4, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|