CodeIsAbstract's picture
Training in progress, step 3000, checkpoint
0a4b086 verified
Raw
History Blame Contribute Delete
14.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 250,
"global_step": 3000,
"is_hyper_param_search": false,
"is_local_process_zero": false,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.016666666666666666,
"grad_norm": 769.3955078125,
"learning_rate": 0.00013066666666666668,
"loss": 2207.061875,
"step": 50
},
{
"epoch": 0.03333333333333333,
"grad_norm": 416.4177551269531,
"learning_rate": 0.000264,
"loss": 2157.63046875,
"step": 100
},
{
"epoch": 0.05,
"grad_norm": 580.2691650390625,
"learning_rate": 0.00039733333333333336,
"loss": 2088.078125,
"step": 150
},
{
"epoch": 0.06666666666666667,
"grad_norm": 518.3369140625,
"learning_rate": 0.000399708326752494,
"loss": 2027.68953125,
"step": 200
},
{
"epoch": 0.08333333333333333,
"grad_norm": 343.1493225097656,
"learning_rate": 0.0003988102673898103,
"loss": 1981.4253125,
"step": 250
},
{
"epoch": 0.08333333333333333,
"eval_accuracy": 0.1509169110459433,
"eval_loss": 65.10028076171875,
"eval_runtime": 22.9136,
"eval_samples_per_second": 5.455,
"eval_steps_per_second": 0.175,
"step": 250
},
{
"epoch": 0.1,
"grad_norm": 301.3949890136719,
"learning_rate": 0.00039730842777928766,
"loss": 1950.15375,
"step": 300
},
{
"epoch": 0.11666666666666667,
"grad_norm": 479.62359619140625,
"learning_rate": 0.0003952073689584629,
"loss": 1922.4278125,
"step": 350
},
{
"epoch": 0.13333333333333333,
"grad_norm": 360.29132080078125,
"learning_rate": 0.00039251347177392016,
"loss": 1901.3628125,
"step": 400
},
{
"epoch": 0.15,
"grad_norm": 334.61279296875,
"learning_rate": 0.00038923491750286954,
"loss": 1883.4759375,
"step": 450
},
{
"epoch": 0.16666666666666666,
"grad_norm": 390.5067443847656,
"learning_rate": 0.00038538166300687717,
"loss": 1868.25234375,
"step": 500
},
{
"epoch": 0.16666666666666666,
"eval_accuracy": 0.1607761485826002,
"eval_loss": 61.64983367919922,
"eval_runtime": 7.4283,
"eval_samples_per_second": 16.827,
"eval_steps_per_second": 0.538,
"step": 500
},
{
"epoch": 0.18333333333333332,
"grad_norm": 330.5375061035156,
"learning_rate": 0.0003809654104932039,
"loss": 1856.43828125,
"step": 550
},
{
"epoch": 0.2,
"grad_norm": 462.14501953125,
"learning_rate": 0.00037599957197558643,
"loss": 1845.416875,
"step": 600
},
{
"epoch": 0.21666666666666667,
"grad_norm": 348.27215576171875,
"learning_rate": 0.0003704992285423923,
"loss": 1836.4821875,
"step": 650
},
{
"epoch": 0.23333333333333334,
"grad_norm": 348.34326171875,
"learning_rate": 0.0003644810845558505,
"loss": 1828.6059375,
"step": 700
},
{
"epoch": 0.25,
"grad_norm": 478.7774353027344,
"learning_rate": 0.00035796341692145183,
"loss": 1821.568125,
"step": 750
},
{
"epoch": 0.25,
"eval_accuracy": 0.1680097751710655,
"eval_loss": 60.21141815185547,
"eval_runtime": 7.4388,
"eval_samples_per_second": 16.804,
"eval_steps_per_second": 0.538,
"step": 750
},
{
"epoch": 0.26666666666666666,
"grad_norm": 353.61517333984375,
"learning_rate": 0.0003509660195815883,
"loss": 1817.4553125,
"step": 800
},
{
"epoch": 0.2833333333333333,
"grad_norm": 335.4817810058594,
"learning_rate": 0.0003435101434020002,
"loss": 1810.23265625,
"step": 850
},
{
"epoch": 0.3,
"grad_norm": 580.8027954101562,
"learning_rate": 0.0003356184316335953,
"loss": 1802.5071875,
"step": 900
},
{
"epoch": 0.31666666666666665,
"grad_norm": 463.22943115234375,
"learning_rate": 0.00032731485114564034,
"loss": 1796.794375,
"step": 950
},
{
"epoch": 0.3333333333333333,
"grad_norm": 435.9424133300781,
"learning_rate": 0.0003186246196391665,
"loss": 1792.77296875,
"step": 1000
},
{
"epoch": 0.3333333333333333,
"eval_accuracy": 0.1721837732160313,
"eval_loss": 59.25102233886719,
"eval_runtime": 7.0046,
"eval_samples_per_second": 17.845,
"eval_steps_per_second": 0.571,
"step": 1000
},
{
"epoch": 0.35,
"grad_norm": 428.2043151855469,
"learning_rate": 0.00030957412906164035,
"loss": 1789.57328125,
"step": 1050
},
{
"epoch": 0.36666666666666664,
"grad_norm": 514.5044555664062,
"learning_rate": 0.0003001908654554865,
"loss": 1784.348125,
"step": 1100
},
{
"epoch": 0.38333333333333336,
"grad_norm": 431.8824462890625,
"learning_rate": 0.00029050332548388074,
"loss": 1780.343125,
"step": 1150
},
{
"epoch": 0.4,
"grad_norm": 544.1112670898438,
"learning_rate": 0.00028054092988732,
"loss": 1776.639375,
"step": 1200
},
{
"epoch": 0.4166666666666667,
"grad_norm": 489.1014099121094,
"learning_rate": 0.0002703339341338006,
"loss": 1775.20375,
"step": 1250
},
{
"epoch": 0.4166666666666667,
"eval_accuracy": 0.17473020527859237,
"eval_loss": 58.67676544189453,
"eval_runtime": 7.7117,
"eval_samples_per_second": 16.209,
"eval_steps_per_second": 0.519,
"step": 1250
},
{
"epoch": 0.43333333333333335,
"grad_norm": 434.31243896484375,
"learning_rate": 0.00025991333653395637,
"loss": 1772.2684375,
"step": 1300
},
{
"epoch": 0.45,
"grad_norm": 329.494873046875,
"learning_rate": 0.00024931078410020814,
"loss": 1769.61375,
"step": 1350
},
{
"epoch": 0.4666666666666667,
"grad_norm": 606.4137573242188,
"learning_rate": 0.00023855847643582703,
"loss": 1765.89265625,
"step": 1400
},
{
"epoch": 0.48333333333333334,
"grad_norm": 486.37298583984375,
"learning_rate": 0.00022768906794579753,
"loss": 1762.6784375,
"step": 1450
},
{
"epoch": 0.5,
"grad_norm": 426.2013854980469,
"learning_rate": 0.00021673556866646317,
"loss": 1761.15328125,
"step": 1500
},
{
"epoch": 0.5,
"eval_accuracy": 0.1763401759530792,
"eval_loss": 58.22502517700195,
"eval_runtime": 7.3798,
"eval_samples_per_second": 16.938,
"eval_steps_per_second": 0.542,
"step": 1500
},
{
"epoch": 0.5166666666666667,
"grad_norm": 389.8416748046875,
"learning_rate": 0.00020573124401513043,
"loss": 1758.96953125,
"step": 1550
},
{
"epoch": 0.5333333333333333,
"grad_norm": 650.4288330078125,
"learning_rate": 0.00019470951376409043,
"loss": 1757.52515625,
"step": 1600
},
{
"epoch": 0.55,
"grad_norm": 847.1361694335938,
"learning_rate": 0.0001837038505458685,
"loss": 1753.61921875,
"step": 1650
},
{
"epoch": 0.5666666666666667,
"grad_norm": 488.51898193359375,
"learning_rate": 0.00017274767819793914,
"loss": 1753.27640625,
"step": 1700
},
{
"epoch": 0.5833333333333334,
"grad_norm": 306.435791015625,
"learning_rate": 0.00016187427025563068,
"loss": 1751.60140625,
"step": 1750
},
{
"epoch": 0.5833333333333334,
"eval_accuracy": 0.17743304007820138,
"eval_loss": 57.92564392089844,
"eval_runtime": 7.3883,
"eval_samples_per_second": 16.919,
"eval_steps_per_second": 0.541,
"step": 1750
},
{
"epoch": 0.6,
"grad_norm": 362.682373046875,
"learning_rate": 0.0001511166489014914,
"loss": 1750.76390625,
"step": 1800
},
{
"epoch": 0.6166666666666667,
"grad_norm": 428.01727294921875,
"learning_rate": 0.00014050748467800728,
"loss": 1748.945625,
"step": 1850
},
{
"epoch": 0.6333333333333333,
"grad_norm": 572.7185668945312,
"learning_rate": 0.0001300789972682373,
"loss": 1747.49421875,
"step": 1900
},
{
"epoch": 0.65,
"grad_norm": 404.1789855957031,
"learning_rate": 0.00011986285764569589,
"loss": 1747.0315625,
"step": 1950
},
{
"epoch": 0.6666666666666666,
"grad_norm": 516.892578125,
"learning_rate": 0.00010989009189064648,
"loss": 1745.6384375,
"step": 2000
},
{
"epoch": 0.6666666666666666,
"eval_accuracy": 0.17842521994134897,
"eval_loss": 57.703956604003906,
"eval_runtime": 8.2449,
"eval_samples_per_second": 15.161,
"eval_steps_per_second": 0.485,
"step": 2000
},
{
"epoch": 0.6833333333333333,
"grad_norm": 480.41583251953125,
"learning_rate": 0.00010019098696491591,
"loss": 1744.609375,
"step": 2050
},
{
"epoch": 0.7,
"grad_norm": 489.03533935546875,
"learning_rate": 9.079499873138675e-05,
"loss": 1743.00265625,
"step": 2100
},
{
"epoch": 0.7166666666666667,
"grad_norm": 281.31231689453125,
"learning_rate": 8.173066249750974e-05,
"loss": 1741.88375,
"step": 2150
},
{
"epoch": 0.7333333333333333,
"grad_norm": 367.38116455078125,
"learning_rate": 7.302550635451295e-05,
"loss": 1741.17609375,
"step": 2200
},
{
"epoch": 0.75,
"grad_norm": 373.6410827636719,
"learning_rate": 6.470596757549348e-05,
"loss": 1740.87671875,
"step": 2250
},
{
"epoch": 0.75,
"eval_accuracy": 0.17889638318670575,
"eval_loss": 57.56399917602539,
"eval_runtime": 8.5942,
"eval_samples_per_second": 14.545,
"eval_steps_per_second": 0.465,
"step": 2250
},
{
"epoch": 0.7666666666666667,
"grad_norm": 378.64324951171875,
"learning_rate": 5.6797312326288e-05,
"loss": 1741.790625,
"step": 2300
},
{
"epoch": 0.7833333333333333,
"grad_norm": 399.52471923828125,
"learning_rate": 4.932355893295748e-05,
"loss": 1739.6509375,
"step": 2350
},
{
"epoch": 0.8,
"grad_norm": 448.8892822265625,
"learning_rate": 4.230740493892038e-05,
"loss": 1739.64484375,
"step": 2400
},
{
"epoch": 0.8166666666666667,
"grad_norm": 246.4326171875,
"learning_rate": 3.57701581732592e-05,
"loss": 1738.5784375,
"step": 2450
},
{
"epoch": 0.8333333333333334,
"grad_norm": 420.97027587890625,
"learning_rate": 2.973167203954399e-05,
"loss": 1738.51265625,
"step": 2500
},
{
"epoch": 0.8333333333333334,
"eval_accuracy": 0.17922873900293254,
"eval_loss": 57.48527526855469,
"eval_runtime": 6.8955,
"eval_samples_per_second": 18.128,
"eval_steps_per_second": 0.58,
"step": 2500
},
{
"epoch": 0.85,
"grad_norm": 455.0086975097656,
"learning_rate": 2.4210285221698124e-05,
"loss": 1739.21203125,
"step": 2550
},
{
"epoch": 0.8666666666666667,
"grad_norm": 460.4869079589844,
"learning_rate": 1.922276599001802e-05,
"loss": 1737.5628125,
"step": 2600
},
{
"epoch": 0.8833333333333333,
"grad_norm": 488.4925231933594,
"learning_rate": 1.4784261276487333e-05,
"loss": 1737.22265625,
"step": 2650
},
{
"epoch": 0.9,
"grad_norm": 602.5552978515625,
"learning_rate": 1.0908250674042331e-05,
"loss": 1736.81359375,
"step": 2700
},
{
"epoch": 0.9166666666666666,
"grad_norm": 375.4463195800781,
"learning_rate": 7.606505499491246e-06,
"loss": 1736.9728125,
"step": 2750
},
{
"epoch": 0.9166666666666666,
"eval_accuracy": 0.17933235581622678,
"eval_loss": 57.458404541015625,
"eval_runtime": 7.136,
"eval_samples_per_second": 17.517,
"eval_steps_per_second": 0.561,
"step": 2750
},
{
"epoch": 0.9333333333333333,
"grad_norm": 411.4505920410156,
"learning_rate": 4.88905304441194e-06,
"loss": 1736.17953125,
"step": 2800
},
{
"epoch": 0.95,
"grad_norm": 255.17337036132812,
"learning_rate": 2.7641461225969665e-06,
"loss": 1737.8128125,
"step": 2850
},
{
"epoch": 0.9666666666666667,
"grad_norm": 709.8735961914062,
"learning_rate": 1.2382380065293576e-06,
"loss": 1737.474375,
"step": 2900
},
{
"epoch": 0.9833333333333333,
"grad_norm": 485.8822326660156,
"learning_rate": 3.159628290061445e-07,
"loss": 1737.075,
"step": 2950
},
{
"epoch": 1.0,
"grad_norm": 478.07696533203125,
"learning_rate": 1.2150942938493615e-10,
"loss": 1737.3753125,
"step": 3000
},
{
"epoch": 1.0,
"eval_accuracy": 0.17936754643206257,
"eval_loss": 57.4544677734375,
"eval_runtime": 7.3114,
"eval_samples_per_second": 17.097,
"eval_steps_per_second": 0.547,
"step": 3000
}
],
"logging_steps": 50,
"max_steps": 3000,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}