GLM-4.7-Flash-sql-create-context / trainer_state.json
msingh-psl's picture Poojanbuselvan's picture
Add LoRA adapter, model card, and eval artifacts (#1)
54af938
Raw History Blame Contribute Delete
21 kB
{
"best_global_step": 675,
"best_metric": 0.5975516438484192,
"best_model_checkpoint": "/home/svadouser1/pooja/llm_autotuning/checkpoints/exp_20260827_221617/checkpoint-675",
"epoch": 3.0,
"eval_steps": 9999,
"global_step": 675,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.461071628332138,
"epoch": 0.044444444444444446,
"grad_norm": 1.6171875,
"learning_rate": 5.294117647058824e-05,
"loss": 2.388203811645508,
"mean_token_accuracy": 0.6123090386390686,
"num_tokens": 19486.0,
"step": 10
},
{
"entropy": 0.9562640145421029,
"epoch": 0.08888888888888889,
"grad_norm": 0.6875,
"learning_rate": 0.00011176470588235294,
"loss": 1.1077078819274901,
"mean_token_accuracy": 0.8430786401033401,
"num_tokens": 38826.0,
"step": 20
},
{
"entropy": 0.77465368360281,
"epoch": 0.13333333333333333,
"grad_norm": 0.455078125,
"learning_rate": 0.00017058823529411766,
"loss": 0.8623821258544921,
"mean_token_accuracy": 0.864073084294796,
"num_tokens": 58244.0,
"step": 30
},
{
"entropy": 0.7483784720301628,
"epoch": 0.17777777777777778,
"grad_norm": 0.423828125,
"learning_rate": 0.00019996997576394573,
"loss": 0.7713714599609375,
"mean_token_accuracy": 0.8697837173938752,
"num_tokens": 77711.0,
"step": 40
},
{
"entropy": 0.7391687169671058,
"epoch": 0.2222222222222222,
"grad_norm": 0.376953125,
"learning_rate": 0.00019972989003925543,
"loss": 0.7115508556365967,
"mean_token_accuracy": 0.8751530349254608,
"num_tokens": 97104.0,
"step": 50
},
{
"entropy": 0.7042164742946625,
"epoch": 0.26666666666666666,
"grad_norm": 0.330078125,
"learning_rate": 0.00019925029517454195,
"loss": 0.6672511577606202,
"mean_token_accuracy": 0.8725973218679428,
"num_tokens": 116498.0,
"step": 60
},
{
"entropy": 0.6745826601982117,
"epoch": 0.3111111111111111,
"grad_norm": 0.361328125,
"learning_rate": 0.00019853234295442638,
"loss": 0.6365277290344238,
"mean_token_accuracy": 0.872233435511589,
"num_tokens": 136089.0,
"step": 70
},
{
"entropy": 0.6878040120005607,
"epoch": 0.35555555555555557,
"grad_norm": 0.37109375,
"learning_rate": 0.00019757775759738272,
"loss": 0.6395976066589355,
"mean_token_accuracy": 0.8741081401705741,
"num_tokens": 155486.0,
"step": 80
},
{
"entropy": 0.6898319900035859,
"epoch": 0.4,
"grad_norm": 0.330078125,
"learning_rate": 0.00019638883161489224,
"loss": 0.6368544578552247,
"mean_token_accuracy": 0.8765213042497635,
"num_tokens": 175116.0,
"step": 90
},
{
"entropy": 0.656438185274601,
"epoch": 0.4444444444444444,
"grad_norm": 0.33203125,
"learning_rate": 0.0001949684203057978,
"loss": 0.6183670043945313,
"mean_token_accuracy": 0.8779006212949753,
"num_tokens": 194495.0,
"step": 100
},
{
"entropy": 0.6711793914437294,
"epoch": 0.4888888888888889,
"grad_norm": 0.388671875,
"learning_rate": 0.00019331993489907977,
"loss": 0.633416748046875,
"mean_token_accuracy": 0.8727847129106522,
"num_tokens": 214311.0,
"step": 110
},
{
"entropy": 0.6290019288659096,
"epoch": 0.5333333333333333,
"grad_norm": 0.33203125,
"learning_rate": 0.00019144733436152284,
"loss": 0.5889303684234619,
"mean_token_accuracy": 0.8814716726541519,
"num_tokens": 233676.0,
"step": 120
},
{
"entropy": 0.6458568304777146,
"epoch": 0.5777777777777777,
"grad_norm": 0.318359375,
"learning_rate": 0.00018935511588994715,
"loss": 0.6043062686920166,
"mean_token_accuracy": 0.8794952735304833,
"num_tokens": 253188.0,
"step": 130
},
{
"entropy": 0.6591948792338371,
"epoch": 0.6222222222222222,
"grad_norm": 0.32421875,
"learning_rate": 0.000187048304110838,
"loss": 0.6233312129974365,
"mean_token_accuracy": 0.873698017001152,
"num_tokens": 273185.0,
"step": 140
},
{
"entropy": 0.6109217047691345,
"epoch": 0.6666666666666666,
"grad_norm": 0.291015625,
"learning_rate": 0.00018453243901331195,
"loss": 0.5925732135772706,
"mean_token_accuracy": 0.884858050942421,
"num_tokens": 292431.0,
"step": 150
},
{
"entropy": 0.6377103522419929,
"epoch": 0.7111111111111111,
"grad_norm": 0.3671875,
"learning_rate": 0.00018181356264439905,
"loss": 0.5884737968444824,
"mean_token_accuracy": 0.8802034169435501,
"num_tokens": 311687.0,
"step": 160
},
{
"entropy": 0.6447647094726563,
"epoch": 0.7555555555555555,
"grad_norm": 0.3046875,
"learning_rate": 0.0001788982045985939,
"loss": 0.5939778327941895,
"mean_token_accuracy": 0.8817022785544395,
"num_tokens": 330813.0,
"step": 170
},
{
"entropy": 0.6029744669795036,
"epoch": 0.8,
"grad_norm": 0.3125,
"learning_rate": 0.00017579336633652317,
"loss": 0.5752908706665039,
"mean_token_accuracy": 0.8855120778083801,
"num_tokens": 350308.0,
"step": 180
},
{
"entropy": 0.6441277623176574,
"epoch": 0.8444444444444444,
"grad_norm": 0.259765625,
"learning_rate": 0.00017250650437038964,
"loss": 0.5958236217498779,
"mean_token_accuracy": 0.8808144956827164,
"num_tokens": 370083.0,
"step": 190
},
{
"entropy": 0.5766214028000831,
"epoch": 0.8888888888888888,
"grad_norm": 0.2734375,
"learning_rate": 0.0001690455123565743,
"loss": 0.5667627811431885,
"mean_token_accuracy": 0.8866458177566529,
"num_tokens": 389516.0,
"step": 200
},
{
"entropy": 0.6425503984093666,
"epoch": 0.9333333333333333,
"grad_norm": 0.3046875,
"learning_rate": 0.00016541870213840243,
"loss": 0.6137699127197266,
"mean_token_accuracy": 0.8819929376244545,
"num_tokens": 408940.0,
"step": 210
},
{
"entropy": 0.6159977808594703,
"epoch": 0.9777777777777777,
"grad_norm": 0.265625,
"learning_rate": 0.0001616347837846011,
"loss": 0.5788507461547852,
"mean_token_accuracy": 0.8852896198630333,
"num_tokens": 428166.0,
"step": 220
},
{
"entropy": 0.6020576372742653,
"epoch": 1.0222222222222221,
"grad_norm": 0.2353515625,
"learning_rate": 0.000157702844671387,
"loss": 0.5500371932983399,
"mean_token_accuracy": 0.8901642486453056,
"num_tokens": 447438.0,
"step": 230
},
{
"entropy": 0.5630205765366554,
"epoch": 1.0666666666666667,
"grad_norm": 0.275390625,
"learning_rate": 0.00015363232765842089,
"loss": 0.5382141590118408,
"mean_token_accuracy": 0.8885036528110504,
"num_tokens": 467009.0,
"step": 240
},
{
"entropy": 0.5631943918764591,
"epoch": 1.1111111111111112,
"grad_norm": 0.306640625,
"learning_rate": 0.00014943300841104094,
"loss": 0.5194426536560058,
"mean_token_accuracy": 0.8929360061883926,
"num_tokens": 486591.0,
"step": 250
},
{
"entropy": 0.5655099518597126,
"epoch": 1.1555555555555554,
"grad_norm": 0.259765625,
"learning_rate": 0.0001451149719232366,
"loss": 0.5290531158447266,
"mean_token_accuracy": 0.8912677451968193,
"num_tokens": 506180.0,
"step": 260
},
{
"entropy": 0.5660845704376698,
"epoch": 1.2,
"grad_norm": 0.326171875,
"learning_rate": 0.00014068858829774608,
"loss": 0.5366004943847656,
"mean_token_accuracy": 0.8909024119377136,
"num_tokens": 525696.0,
"step": 270
},
{
"entropy": 0.5818345256149768,
"epoch": 1.2444444444444445,
"grad_norm": 0.26171875,
"learning_rate": 0.0001361644878414428,
"loss": 0.5424720764160156,
"mean_token_accuracy": 0.8896975666284561,
"num_tokens": 545392.0,
"step": 280
},
{
"entropy": 0.5546154774725437,
"epoch": 1.2888888888888888,
"grad_norm": 0.3359375,
"learning_rate": 0.00013155353553582057,
"loss": 0.5176132202148438,
"mean_token_accuracy": 0.8928953528404235,
"num_tokens": 565036.0,
"step": 290
},
{
"entropy": 0.5676225990056991,
"epoch": 1.3333333333333333,
"grad_norm": 0.275390625,
"learning_rate": 0.0001268668049438902,
"loss": 0.5130613803863525,
"mean_token_accuracy": 0.8928169339895249,
"num_tokens": 584507.0,
"step": 300
},
{
"entropy": 0.5529272347688675,
"epoch": 1.3777777777777778,
"grad_norm": 0.326171875,
"learning_rate": 0.0001221155516161506,
"loss": 0.5317890644073486,
"mean_token_accuracy": 0.8913554430007935,
"num_tokens": 604008.0,
"step": 310
},
{
"entropy": 0.5658974438905716,
"epoch": 1.4222222222222223,
"grad_norm": 0.26953125,
"learning_rate": 0.0001173111860595032,
"loss": 0.5273444652557373,
"mean_token_accuracy": 0.8927861481904984,
"num_tokens": 623480.0,
"step": 320
},
{
"entropy": 0.5697685681283474,
"epoch": 1.4666666666666668,
"grad_norm": 0.322265625,
"learning_rate": 0.00011246524633402573,
"loss": 0.5287697792053223,
"mean_token_accuracy": 0.8912984907627106,
"num_tokens": 642979.0,
"step": 330
},
{
"entropy": 0.5488456651568413,
"epoch": 1.511111111111111,
"grad_norm": 0.326171875,
"learning_rate": 0.00010758937034341787,
"loss": 0.513739824295044,
"mean_token_accuracy": 0.8952319726347924,
"num_tokens": 662396.0,
"step": 340
},
{
"entropy": 0.55315260887146,
"epoch": 1.5555555555555556,
"grad_norm": 0.26953125,
"learning_rate": 0.00010269526788566408,
"loss": 0.5225533485412598,
"mean_token_accuracy": 0.8937178790569306,
"num_tokens": 681644.0,
"step": 350
},
{
"entropy": 0.5738558314740658,
"epoch": 1.6,
"grad_norm": 0.29296875,
"learning_rate": 9.779469253103684e-05,
"loss": 0.5239317417144775,
"mean_token_accuracy": 0.8908430561423302,
"num_tokens": 701030.0,
"step": 360
},
{
"entropy": 0.5420261971652508,
"epoch": 1.6444444444444444,
"grad_norm": 0.259765625,
"learning_rate": 9.289941339497719e-05,
"loss": 0.5274893283843994,
"mean_token_accuracy": 0.8941561266779899,
"num_tokens": 720294.0,
"step": 370
},
{
"entropy": 0.577882957458496,
"epoch": 1.6888888888888889,
"grad_norm": 0.33203125,
"learning_rate": 8.802118687364284e-05,
"loss": 0.5202207088470459,
"mean_token_accuracy": 0.8931182771921158,
"num_tokens": 739607.0,
"step": 380
},
{
"entropy": 0.5461296208202839,
"epoch": 1.7333333333333334,
"grad_norm": 0.30859375,
"learning_rate": 8.317172841000173e-05,
"loss": 0.5105932235717774,
"mean_token_accuracy": 0.8917569547891617,
"num_tokens": 759370.0,
"step": 390
},
{
"entropy": 0.5631573006510735,
"epoch": 1.7777777777777777,
"grad_norm": 0.298828125,
"learning_rate": 7.836268435827875e-05,
"loss": 0.5263056755065918,
"mean_token_accuracy": 0.8906426534056664,
"num_tokens": 778969.0,
"step": 400
},
{
"entropy": 0.5476421102881431,
"epoch": 1.8222222222222222,
"grad_norm": 0.255859375,
"learning_rate": 7.360560401432401e-05,
"loss": 0.5025547504425049,
"mean_token_accuracy": 0.8946620702743531,
"num_tokens": 798105.0,
"step": 410
},
{
"entropy": 0.5343898519873619,
"epoch": 1.8666666666666667,
"grad_norm": 0.27734375,
"learning_rate": 6.891191187907455e-05,
"loss": 0.49821176528930666,
"mean_token_accuracy": 0.8958980679512024,
"num_tokens": 817238.0,
"step": 420
},
{
"entropy": 0.5404686734080315,
"epoch": 1.911111111111111,
"grad_norm": 0.296875,
"learning_rate": 6.429288022172068e-05,
"loss": 0.5022043704986572,
"mean_token_accuracy": 0.8958747044205666,
"num_tokens": 836646.0,
"step": 430
},
{
"entropy": 0.5426375091075897,
"epoch": 1.9555555555555557,
"grad_norm": 0.279296875,
"learning_rate": 5.9759602008468996e-05,
"loss": 0.5035938262939453,
"mean_token_accuracy": 0.8944751426577568,
"num_tokens": 856282.0,
"step": 440
},
{
"entropy": 0.5425564736127854,
"epoch": 2.0,
"grad_norm": 0.263671875,
"learning_rate": 5.532296426191539e-05,
"loss": 0.5004886627197266,
"mean_token_accuracy": 0.8947419315576554,
"num_tokens": 875656.0,
"step": 450
},
{
"entropy": 0.526330380141735,
"epoch": 2.0444444444444443,
"grad_norm": 0.279296875,
"learning_rate": 5.0993621915007785e-05,
"loss": 0.44887552261352537,
"mean_token_accuracy": 0.9024429768323898,
"num_tokens": 894973.0,
"step": 460
},
{
"entropy": 0.4774711772799492,
"epoch": 2.088888888888889,
"grad_norm": 0.365234375,
"learning_rate": 4.678197222239035e-05,
"loss": 0.44640169143676756,
"mean_token_accuracy": 0.9045588001608849,
"num_tokens": 914579.0,
"step": 470
},
{
"entropy": 0.4789727419614792,
"epoch": 2.1333333333333333,
"grad_norm": 0.3828125,
"learning_rate": 4.269812979058235e-05,
"loss": 0.44276885986328124,
"mean_token_accuracy": 0.9066318318247795,
"num_tokens": 933807.0,
"step": 480
},
{
"entropy": 0.47537712305784224,
"epoch": 2.1777777777777776,
"grad_norm": 0.359375,
"learning_rate": 3.875190228695862e-05,
"loss": 0.4367781639099121,
"mean_token_accuracy": 0.9070042923092843,
"num_tokens": 953241.0,
"step": 490
},
{
"entropy": 0.4877164676785469,
"epoch": 2.2222222222222223,
"grad_norm": 0.328125,
"learning_rate": 3.4952766885868346e-05,
"loss": 0.4422135353088379,
"mean_token_accuracy": 0.905805604159832,
"num_tokens": 972758.0,
"step": 500
},
{
"entropy": 0.4915403999388218,
"epoch": 2.2666666666666666,
"grad_norm": 0.376953125,
"learning_rate": 3.130984750845885e-05,
"loss": 0.4357293128967285,
"mean_token_accuracy": 0.9067289993166924,
"num_tokens": 992534.0,
"step": 510
},
{
"entropy": 0.4957615494728088,
"epoch": 2.311111111111111,
"grad_norm": 0.33984375,
"learning_rate": 2.7831892910864434e-05,
"loss": 0.44167218208312986,
"mean_token_accuracy": 0.9066730305552483,
"num_tokens": 1012003.0,
"step": 520
},
{
"entropy": 0.48269262462854384,
"epoch": 2.3555555555555556,
"grad_norm": 0.375,
"learning_rate": 2.4527255673383565e-05,
"loss": 0.437894344329834,
"mean_token_accuracy": 0.904815036058426,
"num_tokens": 1031505.0,
"step": 530
},
{
"entropy": 0.47741171419620515,
"epoch": 2.4,
"grad_norm": 0.4140625,
"learning_rate": 2.140387214110322e-05,
"loss": 0.4400351047515869,
"mean_token_accuracy": 0.9068154886364936,
"num_tokens": 1050914.0,
"step": 540
},
{
"entropy": 0.4727069653570652,
"epoch": 2.4444444444444446,
"grad_norm": 0.35546875,
"learning_rate": 1.846924336414474e-05,
"loss": 0.43111190795898435,
"mean_token_accuracy": 0.9075597256422043,
"num_tokens": 1070218.0,
"step": 550
},
{
"entropy": 0.4883471392095089,
"epoch": 2.488888888888889,
"grad_norm": 0.314453125,
"learning_rate": 1.5730417083304573e-05,
"loss": 0.4493571758270264,
"mean_token_accuracy": 0.9073263511061669,
"num_tokens": 1089667.0,
"step": 560
},
{
"entropy": 0.4878625735640526,
"epoch": 2.533333333333333,
"grad_norm": 0.375,
"learning_rate": 1.3193970804352952e-05,
"loss": 0.44793548583984377,
"mean_token_accuracy": 0.9050837978720665,
"num_tokens": 1109201.0,
"step": 570
},
{
"entropy": 0.48537297546863556,
"epoch": 2.5777777777777775,
"grad_norm": 0.337890625,
"learning_rate": 1.08659960016387e-05,
"loss": 0.4368610382080078,
"mean_token_accuracy": 0.9097044110298157,
"num_tokens": 1128649.0,
"step": 580
},
{
"entropy": 0.4859867602586746,
"epoch": 2.6222222222222222,
"grad_norm": 0.328125,
"learning_rate": 8.75208348893667e-06,
"loss": 0.4249687194824219,
"mean_token_accuracy": 0.9087634190917016,
"num_tokens": 1148353.0,
"step": 590
},
{
"entropy": 0.4833585321903229,
"epoch": 2.6666666666666665,
"grad_norm": 0.3828125,
"learning_rate": 6.857309992670624e-06,
"loss": 0.4455591678619385,
"mean_token_accuracy": 0.9075253725051879,
"num_tokens": 1167638.0,
"step": 600
},
{
"entropy": 0.4794360339641571,
"epoch": 2.7111111111111112,
"grad_norm": 0.3203125,
"learning_rate": 5.186225959757207e-06,
"loss": 0.43627562522888186,
"mean_token_accuracy": 0.907138803601265,
"num_tokens": 1186894.0,
"step": 610
},
{
"entropy": 0.4800324112176895,
"epoch": 2.7555555555555555,
"grad_norm": 0.365234375,
"learning_rate": 3.7428446293514386e-06,
"loss": 0.42800016403198243,
"mean_token_accuracy": 0.9089159920811654,
"num_tokens": 1206224.0,
"step": 620
},
{
"entropy": 0.48999542444944383,
"epoch": 2.8,
"grad_norm": 0.31640625,
"learning_rate": 2.5306323947385746e-06,
"loss": 0.44663453102111816,
"mean_token_accuracy": 0.9060632780194282,
"num_tokens": 1225569.0,
"step": 630
},
{
"entropy": 0.4874999448657036,
"epoch": 2.8444444444444446,
"grad_norm": 0.326171875,
"learning_rate": 1.5525004785192143e-06,
"loss": 0.44841961860656737,
"mean_token_accuracy": 0.9045136958360672,
"num_tokens": 1244959.0,
"step": 640
},
{
"entropy": 0.49936808943748473,
"epoch": 2.888888888888889,
"grad_norm": 0.4296875,
"learning_rate": 8.107979410802769e-07,
"loss": 0.4453989028930664,
"mean_token_accuracy": 0.9050952970981598,
"num_tokens": 1264904.0,
"step": 650
},
{
"entropy": 0.49325661584734914,
"epoch": 2.9333333333333336,
"grad_norm": 0.373046875,
"learning_rate": 3.0730603914255193e-07,
"loss": 0.44756379127502444,
"mean_token_accuracy": 0.9043820068240166,
"num_tokens": 1284311.0,
"step": 660
},
{
"entropy": 0.5068465434014797,
"epoch": 2.977777777777778,
"grad_norm": 0.373046875,
"learning_rate": 4.323394793315228e-08,
"loss": 0.4593667030334473,
"mean_token_accuracy": 0.9011617928743363,
"num_tokens": 1303914.0,
"step": 670
},
{
"epoch": 3.0,
"eval_entropy": 0.5207519015669823,
"eval_loss": 0.5975516438484192,
"eval_mean_token_accuracy": 0.8822531878948212,
"eval_num_tokens": 1313484.0,
"eval_runtime": 57.0793,
"eval_samples_per_second": 7.008,
"eval_steps_per_second": 1.752,
"step": 675
},
{
"epoch": 3.0,
"step": 675,
"total_flos": 2.3441226939026637e+17,
"train_loss": 0.5646523337894016,
"train_runtime": 6392.6844,
"train_samples_per_second": 1.689,
"train_steps_per_second": 0.106
}
],
"logging_steps": 10,
"max_steps": 675,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 9999,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.3441226939026637e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}