precisionalgorithms's picture
LoRA adapter (r32) for applying to your own Qwen3.5-9B base
2b94010 verified
Raw
History Blame Contribute Delete
35.9 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 100,
"global_step": 375,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0,
"eval_loss": 0.7259935140609741,
"eval_ppl": 2.06678,
"eval_runtime": 262.2012,
"eval_samples_per_second": 0.191,
"eval_steps_per_second": 0.191,
"memory/device_reserved (GiB)": 16.61,
"memory/max_active (GiB)": 13.63,
"memory/max_allocated (GiB)": 13.63,
"step": 0
},
{
"epoch": 0.013333333333333334,
"grad_norm": 0.9595199227333069,
"learning_rate": 3.6363636363636364e-05,
"loss": 0.7722715854644775,
"memory/device_reserved (GiB)": 21.73,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 2.16468,
"step": 5,
"tokens/total": 655360,
"tokens/trainable": 25212
},
{
"epoch": 0.02666666666666667,
"grad_norm": 0.899686336517334,
"learning_rate": 8.181818181818183e-05,
"loss": 0.6230775833129882,
"memory/device_reserved (GiB)": 21.73,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.86466,
"step": 10,
"tokens/total": 1310720,
"tokens/train_per_sec_per_gpu": 45.14,
"tokens/trainable": 50168
},
{
"epoch": 0.04,
"grad_norm": 0.5400508046150208,
"learning_rate": 9.998324072477266e-05,
"loss": 0.32673048973083496,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.38643,
"step": 15,
"tokens/total": 1966080,
"tokens/train_per_sec_per_gpu": 43.36,
"tokens/trainable": 74436
},
{
"epoch": 0.05333333333333334,
"grad_norm": 0.6370494365692139,
"learning_rate": 9.98808636150624e-05,
"loss": 0.15945987701416015,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.17288,
"step": 20,
"tokens/total": 2621440,
"tokens/train_per_sec_per_gpu": 40.94,
"tokens/trainable": 97372
},
{
"epoch": 0.06666666666666667,
"grad_norm": 0.3147568702697754,
"learning_rate": 9.968561049466214e-05,
"loss": 0.06350756883621216,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.06557,
"step": 25,
"tokens/total": 3276800,
"tokens/train_per_sec_per_gpu": 44.98,
"tokens/trainable": 122367
},
{
"epoch": 0.08,
"grad_norm": 0.38141945004463196,
"learning_rate": 9.939784491643734e-05,
"loss": 0.03221326172351837,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.03274,
"step": 30,
"tokens/total": 3932160,
"tokens/train_per_sec_per_gpu": 47.33,
"tokens/trainable": 148467
},
{
"epoch": 0.09333333333333334,
"grad_norm": 0.19483867287635803,
"learning_rate": 9.901810268744868e-05,
"loss": 0.015181700885295867,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.0153,
"step": 35,
"tokens/total": 4587520,
"tokens/train_per_sec_per_gpu": 43.02,
"tokens/trainable": 172408
},
{
"epoch": 0.10666666666666667,
"grad_norm": 0.2517841160297394,
"learning_rate": 9.85470908713026e-05,
"loss": 0.011043991893529892,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.18,
"memory/max_allocated (GiB)": 21.18,
"ppl": 1.01111,
"step": 40,
"tokens/total": 5242880,
"tokens/train_per_sec_per_gpu": 42.69,
"tokens/trainable": 196124
},
{
"epoch": 0.12,
"grad_norm": 0.18462270498275757,
"learning_rate": 9.798568647162938e-05,
"loss": 0.008527934551239014,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00856,
"step": 45,
"tokens/total": 5898240,
"tokens/train_per_sec_per_gpu": 45.45,
"tokens/trainable": 221449
},
{
"epoch": 0.13333333333333333,
"grad_norm": 0.15647922456264496,
"learning_rate": 9.73349347991403e-05,
"loss": 0.007092365622520446,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.18,
"memory/max_allocated (GiB)": 21.18,
"ppl": 1.00712,
"step": 50,
"tokens/total": 6553600,
"tokens/train_per_sec_per_gpu": 44.31,
"tokens/trainable": 246009
},
{
"epoch": 0.14666666666666667,
"grad_norm": 0.14506474137306213,
"learning_rate": 9.659604752530435e-05,
"loss": 0.007451323419809341,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.18,
"memory/max_allocated (GiB)": 21.18,
"ppl": 1.00748,
"step": 55,
"tokens/total": 7208960,
"tokens/train_per_sec_per_gpu": 46.6,
"tokens/trainable": 271720
},
{
"epoch": 0.16,
"grad_norm": 0.1790270060300827,
"learning_rate": 9.577040042626833e-05,
"loss": 0.006205667927861214,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00622,
"step": 60,
"tokens/total": 7864320,
"tokens/train_per_sec_per_gpu": 44.67,
"tokens/trainable": 296607
},
{
"epoch": 0.17333333333333334,
"grad_norm": 0.0761479064822197,
"learning_rate": 9.485953082122116e-05,
"loss": 0.006498461961746216,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00652,
"step": 65,
"tokens/total": 8519680,
"tokens/train_per_sec_per_gpu": 41.69,
"tokens/trainable": 319761
},
{
"epoch": 0.18666666666666668,
"grad_norm": 0.04886709898710251,
"learning_rate": 9.38651347099721e-05,
"loss": 0.006663598120212555,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00669,
"step": 70,
"tokens/total": 9175040,
"tokens/train_per_sec_per_gpu": 45.88,
"tokens/trainable": 345060
},
{
"epoch": 0.2,
"grad_norm": 0.1578911989927292,
"learning_rate": 9.278906361507238e-05,
"loss": 0.006440120935440064,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00646,
"step": 75,
"tokens/total": 9830400,
"tokens/train_per_sec_per_gpu": 44.89,
"tokens/trainable": 370067
},
{
"epoch": 0.21333333333333335,
"grad_norm": 0.042364154011011124,
"learning_rate": 9.163332113436032e-05,
"loss": 0.005803017318248749,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00582,
"step": 80,
"tokens/total": 10485760,
"tokens/train_per_sec_per_gpu": 40.53,
"tokens/trainable": 392560
},
{
"epoch": 0.22666666666666666,
"grad_norm": 0.045341458171606064,
"learning_rate": 9.040005921034882e-05,
"loss": 0.005494951084256172,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00551,
"step": 85,
"tokens/total": 11141120,
"tokens/train_per_sec_per_gpu": 46.42,
"tokens/trainable": 418173
},
{
"epoch": 0.24,
"grad_norm": 0.05745840072631836,
"learning_rate": 8.90915741234015e-05,
"loss": 0.005376889556646347,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.18,
"memory/max_allocated (GiB)": 21.18,
"ppl": 1.00539,
"step": 90,
"tokens/total": 11796480,
"tokens/train_per_sec_per_gpu": 47.3,
"tokens/trainable": 444638
},
{
"epoch": 0.25333333333333335,
"grad_norm": 0.04302145168185234,
"learning_rate": 8.771030221615786e-05,
"loss": 0.005212824791669846,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.18,
"memory/max_allocated (GiB)": 21.18,
"ppl": 1.00523,
"step": 95,
"tokens/total": 12451840,
"tokens/train_per_sec_per_gpu": 45.65,
"tokens/trainable": 470004
},
{
"epoch": 0.26666666666666666,
"grad_norm": 0.0410093255341053,
"learning_rate": 8.625881535716883e-05,
"loss": 0.00543316900730133,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.18,
"memory/max_allocated (GiB)": 21.18,
"ppl": 1.00545,
"step": 100,
"tokens/total": 13107200,
"tokens/train_per_sec_per_gpu": 48.85,
"tokens/trainable": 497224
},
{
"epoch": 0.26666666666666666,
"eval_loss": 0.005125863943248987,
"eval_ppl": 1.00514,
"eval_runtime": 195.2155,
"eval_samples_per_second": 0.256,
"eval_steps_per_second": 0.256,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 13.81,
"memory/max_allocated (GiB)": 13.81,
"step": 100
},
{
"epoch": 0.28,
"grad_norm": 0.030487440526485443,
"learning_rate": 8.473981615218863e-05,
"loss": 0.005957278609275818,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00598,
"step": 105,
"tokens/total": 13762560,
"tokens/train_per_sec_per_gpu": 29.14,
"tokens/trainable": 519281
},
{
"epoch": 0.29333333333333333,
"grad_norm": 0.04392572119832039,
"learning_rate": 8.315613291203976e-05,
"loss": 0.0056614305824041365,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00568,
"step": 110,
"tokens/total": 14417920,
"tokens/train_per_sec_per_gpu": 44.34,
"tokens/trainable": 543938
},
{
"epoch": 0.30666666666666664,
"grad_norm": 0.045901015400886536,
"learning_rate": 8.151071438642069e-05,
"loss": 0.005855409428477287,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00587,
"step": 115,
"tokens/total": 15073280,
"tokens/train_per_sec_per_gpu": 44.54,
"tokens/trainable": 568651
},
{
"epoch": 0.32,
"grad_norm": 0.0359453484416008,
"learning_rate": 7.980662427346127e-05,
"loss": 0.0049194592982530596,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00493,
"step": 120,
"tokens/total": 15728640,
"tokens/train_per_sec_per_gpu": 44.13,
"tokens/trainable": 593085
},
{
"epoch": 0.3333333333333333,
"grad_norm": 0.041456568986177444,
"learning_rate": 7.804703551524948e-05,
"loss": 0.005270272865891457,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00528,
"step": 125,
"tokens/total": 16384000,
"tokens/train_per_sec_per_gpu": 46.24,
"tokens/trainable": 618820
},
{
"epoch": 0.3466666666666667,
"grad_norm": 0.05520692467689514,
"learning_rate": 7.62352243899504e-05,
"loss": 0.00528857558965683,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.0053,
"step": 130,
"tokens/total": 17039360,
"tokens/train_per_sec_per_gpu": 45.0,
"tokens/trainable": 643808
},
{
"epoch": 0.36,
"grad_norm": 0.046541471034288406,
"learning_rate": 7.4374564411518e-05,
"loss": 0.004922469332814217,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00493,
"step": 135,
"tokens/total": 17694720,
"tokens/train_per_sec_per_gpu": 44.91,
"tokens/trainable": 668780
},
{
"epoch": 0.37333333333333335,
"grad_norm": 0.03092949464917183,
"learning_rate": 7.246852004835807e-05,
"loss": 0.005173306912183762,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00519,
"step": 140,
"tokens/total": 18350080,
"tokens/train_per_sec_per_gpu": 41.7,
"tokens/trainable": 691919
},
{
"epoch": 0.38666666666666666,
"grad_norm": 0.03591609001159668,
"learning_rate": 7.052064027263786e-05,
"loss": 0.005110039561986923,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00512,
"step": 145,
"tokens/total": 19005440,
"tokens/train_per_sec_per_gpu": 41.76,
"tokens/trainable": 715013
},
{
"epoch": 0.4,
"grad_norm": 0.025712192058563232,
"learning_rate": 6.853455195225338e-05,
"loss": 0.004509006440639496,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.18,
"memory/max_allocated (GiB)": 21.18,
"ppl": 1.00452,
"step": 150,
"tokens/total": 19660800,
"tokens/train_per_sec_per_gpu": 43.45,
"tokens/trainable": 739169
},
{
"epoch": 0.41333333333333333,
"grad_norm": 0.03468570113182068,
"learning_rate": 6.651395309775837e-05,
"loss": 0.0048051241785287855,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00482,
"step": 155,
"tokens/total": 20316160,
"tokens/train_per_sec_per_gpu": 43.28,
"tokens/trainable": 763273
},
{
"epoch": 0.4266666666666667,
"grad_norm": 0.0264927726238966,
"learning_rate": 6.446260597682839e-05,
"loss": 0.005041670426726342,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00505,
"step": 160,
"tokens/total": 20971520,
"tokens/train_per_sec_per_gpu": 42.96,
"tokens/trainable": 787181
},
{
"epoch": 0.44,
"grad_norm": 0.05475484952330589,
"learning_rate": 6.23843301090813e-05,
"loss": 0.004970982298254966,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00498,
"step": 165,
"tokens/total": 21626880,
"tokens/train_per_sec_per_gpu": 42.26,
"tokens/trainable": 810805
},
{
"epoch": 0.4533333333333333,
"grad_norm": 0.02439168654382229,
"learning_rate": 6.028299515429683e-05,
"loss": 0.0044364482164382935,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00445,
"step": 170,
"tokens/total": 22282240,
"tokens/train_per_sec_per_gpu": 40.05,
"tokens/trainable": 832951
},
{
"epoch": 0.4666666666666667,
"grad_norm": 0.02172553911805153,
"learning_rate": 5.816251370727748e-05,
"loss": 0.004864436015486718,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00488,
"step": 175,
"tokens/total": 22937600,
"tokens/train_per_sec_per_gpu": 44.58,
"tokens/trainable": 857760
},
{
"epoch": 0.48,
"grad_norm": 0.033849216997623444,
"learning_rate": 5.602683401276615e-05,
"loss": 0.004620900005102157,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00463,
"step": 180,
"tokens/total": 23592960,
"tokens/train_per_sec_per_gpu": 43.16,
"tokens/trainable": 881673
},
{
"epoch": 0.49333333333333335,
"grad_norm": 0.029739772900938988,
"learning_rate": 5.3879932613985316e-05,
"loss": 0.004911043122410775,
"memory/device_reserved (GiB)": 21.81,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00492,
"step": 185,
"tokens/total": 24248320,
"tokens/train_per_sec_per_gpu": 41.23,
"tokens/trainable": 904567
},
{
"epoch": 0.5066666666666667,
"grad_norm": 0.03290490806102753,
"learning_rate": 5.172580694848541e-05,
"loss": 0.004716288298368454,
"memory/device_reserved (GiB)": 21.81,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00473,
"step": 190,
"tokens/total": 24903680,
"tokens/train_per_sec_per_gpu": 44.56,
"tokens/trainable": 929202
},
{
"epoch": 0.52,
"grad_norm": 0.03205181285738945,
"learning_rate": 4.956846790508906e-05,
"loss": 0.004729276150465011,
"memory/device_reserved (GiB)": 21.83,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00474,
"step": 195,
"tokens/total": 25559040,
"tokens/train_per_sec_per_gpu": 41.48,
"tokens/trainable": 952306
},
{
"epoch": 0.5333333333333333,
"grad_norm": 0.03829289972782135,
"learning_rate": 4.741193235578952e-05,
"loss": 0.005359260737895966,
"memory/device_reserved (GiB)": 21.83,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00537,
"step": 200,
"tokens/total": 26214400,
"tokens/train_per_sec_per_gpu": 44.5,
"tokens/trainable": 977028
},
{
"epoch": 0.5333333333333333,
"eval_loss": 0.005626738537102938,
"eval_ppl": 1.00564,
"eval_runtime": 196.0068,
"eval_samples_per_second": 0.255,
"eval_steps_per_second": 0.255,
"memory/device_reserved (GiB)": 21.83,
"memory/max_active (GiB)": 13.81,
"memory/max_allocated (GiB)": 13.81,
"step": 200
},
{
"epoch": 0.5466666666666666,
"grad_norm": 0.028605518862605095,
"learning_rate": 4.5260215676508896e-05,
"loss": 0.0047349721193313595,
"memory/device_reserved (GiB)": 21.73,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00475,
"step": 205,
"tokens/total": 26869760,
"tokens/train_per_sec_per_gpu": 30.53,
"tokens/trainable": 1000141
},
{
"epoch": 0.56,
"grad_norm": 0.02617730386555195,
"learning_rate": 4.31173242706416e-05,
"loss": 0.0048753272742033,
"memory/device_reserved (GiB)": 21.73,
"memory/max_active (GiB)": 21.2,
"memory/max_allocated (GiB)": 21.2,
"ppl": 1.00489,
"step": 210,
"tokens/total": 27525120,
"tokens/train_per_sec_per_gpu": 42.9,
"tokens/trainable": 1023989
},
{
"epoch": 0.5733333333333334,
"grad_norm": 0.02969762124121189,
"learning_rate": 4.0987248109304714e-05,
"loss": 0.005086826533079148,
"memory/device_reserved (GiB)": 21.73,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.0051,
"step": 215,
"tokens/total": 28180480,
"tokens/train_per_sec_per_gpu": 44.72,
"tokens/trainable": 1049006
},
{
"epoch": 0.5866666666666667,
"grad_norm": 0.02718881517648697,
"learning_rate": 3.887395330218429e-05,
"loss": 0.004556325450539589,
"memory/device_reserved (GiB)": 21.73,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00457,
"step": 220,
"tokens/total": 28835840,
"tokens/train_per_sec_per_gpu": 40.82,
"tokens/trainable": 1071704
},
{
"epoch": 0.6,
"grad_norm": 0.03086484782397747,
"learning_rate": 3.678137471281056e-05,
"loss": 0.004742009192705154,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00475,
"step": 225,
"tokens/total": 29491200,
"tokens/train_per_sec_per_gpu": 42.15,
"tokens/trainable": 1095051
},
{
"epoch": 0.6133333333333333,
"grad_norm": 0.030093587934970856,
"learning_rate": 3.471340863201237e-05,
"loss": 0.004773300513625145,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00478,
"step": 230,
"tokens/total": 30146560,
"tokens/train_per_sec_per_gpu": 45.27,
"tokens/trainable": 1120272
},
{
"epoch": 0.6266666666666667,
"grad_norm": 0.03221883624792099,
"learning_rate": 3.2673905523191997e-05,
"loss": 0.004905195906758308,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00492,
"step": 235,
"tokens/total": 30801920,
"tokens/train_per_sec_per_gpu": 43.47,
"tokens/trainable": 1144548
},
{
"epoch": 0.64,
"grad_norm": 0.029244637116789818,
"learning_rate": 3.066666285292906e-05,
"loss": 0.004887398332357407,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.0049,
"step": 240,
"tokens/total": 31457280,
"tokens/train_per_sec_per_gpu": 41.76,
"tokens/trainable": 1167714
},
{
"epoch": 0.6533333333333333,
"grad_norm": 0.12850478291511536,
"learning_rate": 2.8695418020261756e-05,
"loss": 0.004754188284277916,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00477,
"step": 245,
"tokens/total": 32112640,
"tokens/train_per_sec_per_gpu": 40.12,
"tokens/trainable": 1189877
},
{
"epoch": 0.6666666666666666,
"grad_norm": 0.03636099770665169,
"learning_rate": 2.6763841397811573e-05,
"loss": 0.004981106519699097,
"memory/device_reserved (GiB)": 21.79,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00499,
"step": 250,
"tokens/total": 32768000,
"tokens/train_per_sec_per_gpu": 42.87,
"tokens/trainable": 1213805
},
{
"epoch": 0.68,
"grad_norm": 0.022054197266697884,
"learning_rate": 2.4875529497708356e-05,
"loss": 0.004619970917701721,
"memory/device_reserved (GiB)": 21.79,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00463,
"step": 255,
"tokens/total": 33423360,
"tokens/train_per_sec_per_gpu": 43.1,
"tokens/trainable": 1237666
},
{
"epoch": 0.6933333333333334,
"grad_norm": 0.027714325115084648,
"learning_rate": 2.3033998275040046e-05,
"loss": 0.0047100942581892015,
"memory/device_reserved (GiB)": 21.79,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00472,
"step": 260,
"tokens/total": 34078720,
"tokens/train_per_sec_per_gpu": 41.01,
"tokens/trainable": 1260466
},
{
"epoch": 0.7066666666666667,
"grad_norm": 0.031128723174333572,
"learning_rate": 2.1242676581296526e-05,
"loss": 0.005079636722803116,
"memory/device_reserved (GiB)": 21.79,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00509,
"step": 265,
"tokens/total": 34734080,
"tokens/train_per_sec_per_gpu": 41.68,
"tokens/trainable": 1283874
},
{
"epoch": 0.72,
"grad_norm": 0.027158157899975777,
"learning_rate": 1.9504899779996355e-05,
"loss": 0.0045673176646232605,
"memory/device_reserved (GiB)": 21.79,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00458,
"step": 270,
"tokens/total": 35389440,
"tokens/train_per_sec_per_gpu": 44.81,
"tokens/trainable": 1308610
},
{
"epoch": 0.7333333333333333,
"grad_norm": 0.15057113766670227,
"learning_rate": 1.7823903536384263e-05,
"loss": 0.004708150401711464,
"memory/device_reserved (GiB)": 21.79,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00472,
"step": 275,
"tokens/total": 36044800,
"tokens/train_per_sec_per_gpu": 42.58,
"tokens/trainable": 1332168
},
{
"epoch": 0.7466666666666667,
"grad_norm": 0.033471379429101944,
"learning_rate": 1.6202817792762282e-05,
"loss": 0.004595084860920906,
"memory/device_reserved (GiB)": 21.79,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00461,
"step": 280,
"tokens/total": 36700160,
"tokens/train_per_sec_per_gpu": 43.96,
"tokens/trainable": 1356631
},
{
"epoch": 0.76,
"grad_norm": 0.023440664634108543,
"learning_rate": 1.4644660940672627e-05,
"loss": 0.004753060266375541,
"memory/device_reserved (GiB)": 21.79,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00476,
"step": 285,
"tokens/total": 37355520,
"tokens/train_per_sec_per_gpu": 42.77,
"tokens/trainable": 1380446
},
{
"epoch": 0.7733333333333333,
"grad_norm": 0.027441756799817085,
"learning_rate": 1.3152334200783167e-05,
"loss": 0.005016597732901573,
"memory/device_reserved (GiB)": 21.79,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00503,
"step": 290,
"tokens/total": 38010880,
"tokens/train_per_sec_per_gpu": 40.86,
"tokens/trainable": 1403091
},
{
"epoch": 0.7866666666666666,
"grad_norm": 0.026855869218707085,
"learning_rate": 1.172861622094003e-05,
"loss": 0.004580753669142723,
"memory/device_reserved (GiB)": 21.79,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00459,
"step": 295,
"tokens/total": 38666240,
"tokens/train_per_sec_per_gpu": 41.25,
"tokens/trainable": 1426055
},
{
"epoch": 0.8,
"grad_norm": 0.023977380245923996,
"learning_rate": 1.0376157902445488e-05,
"loss": 0.004501186683773995,
"memory/device_reserved (GiB)": 21.79,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00451,
"step": 300,
"tokens/total": 39321600,
"tokens/train_per_sec_per_gpu": 43.12,
"tokens/trainable": 1450273
},
{
"epoch": 0.8,
"eval_loss": 0.004734031390398741,
"eval_ppl": 1.00475,
"eval_runtime": 194.0886,
"eval_samples_per_second": 0.258,
"eval_steps_per_second": 0.258,
"memory/device_reserved (GiB)": 21.79,
"memory/max_active (GiB)": 13.81,
"memory/max_allocated (GiB)": 13.81,
"step": 300
},
{
"epoch": 0.8133333333333334,
"grad_norm": 0.030878398567438126,
"learning_rate": 9.09747746419436e-06,
"loss": 0.0043730147182941435,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.2,
"memory/max_allocated (GiB)": 21.2,
"ppl": 1.00438,
"step": 305,
"tokens/total": 39976960,
"tokens/train_per_sec_per_gpu": 29.97,
"tokens/trainable": 1472876
},
{
"epoch": 0.8266666666666667,
"grad_norm": 0.042352087795734406,
"learning_rate": 7.894955753859413e-06,
"loss": 0.004312443360686302,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00432,
"step": 310,
"tokens/total": 40632320,
"tokens/train_per_sec_per_gpu": 42.03,
"tokens/trainable": 1496335
},
{
"epoch": 0.84,
"grad_norm": 0.06731227040290833,
"learning_rate": 6.770831814855883e-06,
"loss": 0.004706869274377823,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00472,
"step": 315,
"tokens/total": 41287680,
"tokens/train_per_sec_per_gpu": 42.45,
"tokens/trainable": 1519779
},
{
"epoch": 0.8533333333333334,
"grad_norm": 0.03264646604657173,
"learning_rate": 5.727198717339511e-06,
"loss": 0.004393095150589943,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.18,
"memory/max_allocated (GiB)": 21.18,
"ppl": 1.0044,
"step": 320,
"tokens/total": 41943040,
"tokens/train_per_sec_per_gpu": 39.05,
"tokens/trainable": 1541449
},
{
"epoch": 0.8666666666666667,
"grad_norm": 0.02452196180820465,
"learning_rate": 4.765999661000442e-06,
"loss": 0.004691409692168236,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.0047,
"step": 325,
"tokens/total": 42598400,
"tokens/train_per_sec_per_gpu": 41.78,
"tokens/trainable": 1564624
},
{
"epoch": 0.88,
"grad_norm": 0.02666294388473034,
"learning_rate": 3.8890243569094874e-06,
"loss": 0.004636475816369057,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.18,
"memory/max_allocated (GiB)": 21.18,
"ppl": 1.00465,
"step": 330,
"tokens/total": 43253760,
"tokens/train_per_sec_per_gpu": 43.77,
"tokens/trainable": 1588899
},
{
"epoch": 0.8933333333333333,
"grad_norm": 0.026685087010264397,
"learning_rate": 3.097905695153408e-06,
"loss": 0.004494461417198181,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.0045,
"step": 335,
"tokens/total": 43909120,
"tokens/train_per_sec_per_gpu": 41.39,
"tokens/trainable": 1611899
},
{
"epoch": 0.9066666666666666,
"grad_norm": 0.02968110330402851,
"learning_rate": 2.3941167044642944e-06,
"loss": 0.004899434372782707,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.18,
"memory/max_allocated (GiB)": 21.18,
"ppl": 1.00491,
"step": 340,
"tokens/total": 44564480,
"tokens/train_per_sec_per_gpu": 44.52,
"tokens/trainable": 1636597
},
{
"epoch": 0.92,
"grad_norm": 0.027353789657354355,
"learning_rate": 1.7789678095037454e-06,
"loss": 0.004315333440899849,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00432,
"step": 345,
"tokens/total": 45219840,
"tokens/train_per_sec_per_gpu": 43.0,
"tokens/trainable": 1660437
},
{
"epoch": 0.9333333333333333,
"grad_norm": 0.03258969634771347,
"learning_rate": 1.2536043909088191e-06,
"loss": 0.00461953803896904,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.18,
"memory/max_allocated (GiB)": 21.18,
"ppl": 1.00463,
"step": 350,
"tokens/total": 45875200,
"tokens/train_per_sec_per_gpu": 42.58,
"tokens/trainable": 1683976
},
{
"epoch": 0.9466666666666667,
"grad_norm": 0.02668372169137001,
"learning_rate": 8.190046526428242e-07,
"loss": 0.004539983719587326,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00455,
"step": 355,
"tokens/total": 46530560,
"tokens/train_per_sec_per_gpu": 46.4,
"tokens/trainable": 1709805
},
{
"epoch": 0.96,
"grad_norm": 0.01941784657537937,
"learning_rate": 4.7597780062184073e-07,
"loss": 0.004410231858491898,
"memory/device_reserved (GiB)": 21.77,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00442,
"step": 360,
"tokens/total": 47185920,
"tokens/train_per_sec_per_gpu": 43.28,
"tokens/trainable": 1733745
},
{
"epoch": 0.9733333333333334,
"grad_norm": 0.03431093320250511,
"learning_rate": 2.251625360083387e-07,
"loss": 0.0044364739209413525,
"memory/device_reserved (GiB)": 21.79,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00445,
"step": 365,
"tokens/total": 47841280,
"tokens/train_per_sec_per_gpu": 43.06,
"tokens/trainable": 1757536
},
{
"epoch": 0.9866666666666667,
"grad_norm": 0.021709132939577103,
"learning_rate": 6.702586597719385e-08,
"loss": 0.00460573323071003,
"memory/device_reserved (GiB)": 21.79,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00462,
"step": 370,
"tokens/total": 48496640,
"tokens/train_per_sec_per_gpu": 39.38,
"tokens/trainable": 1779397
},
{
"epoch": 1.0,
"grad_norm": 0.02140376716852188,
"learning_rate": 1.862234168542587e-09,
"loss": 0.004865445569157601,
"memory/device_reserved (GiB)": 21.79,
"memory/max_active (GiB)": 21.19,
"memory/max_allocated (GiB)": 21.19,
"ppl": 1.00488,
"step": 375,
"tokens/total": 49152000,
"tokens/train_per_sec_per_gpu": 45.08,
"tokens/trainable": 1804456
},
{
"epoch": 1.0,
"eval_loss": 0.004683868959546089,
"eval_ppl": 1.00469,
"eval_runtime": 195.4932,
"eval_samples_per_second": 0.256,
"eval_steps_per_second": 0.256,
"memory/device_reserved (GiB)": 21.79,
"memory/max_active (GiB)": 13.81,
"memory/max_allocated (GiB)": 13.81,
"step": 375
}
],
"logging_steps": 5,
"max_steps": 375,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.499850318381056e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}