{ "best_global_step": 675, "best_metric": 0.5975516438484192, "best_model_checkpoint": "/home/svadouser1/pooja/llm_autotuning/checkpoints/exp_20260827_221617/checkpoint-675", "epoch": 3.0, "eval_steps": 9999, "global_step": 675, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.461071628332138, "epoch": 0.044444444444444446, "grad_norm": 1.6171875, "learning_rate": 5.294117647058824e-05, "loss": 2.388203811645508, "mean_token_accuracy": 0.6123090386390686, "num_tokens": 19486.0, "step": 10 }, { "entropy": 0.9562640145421029, "epoch": 0.08888888888888889, "grad_norm": 0.6875, "learning_rate": 0.00011176470588235294, "loss": 1.1077078819274901, "mean_token_accuracy": 0.8430786401033401, "num_tokens": 38826.0, "step": 20 }, { "entropy": 0.77465368360281, "epoch": 0.13333333333333333, "grad_norm": 0.455078125, "learning_rate": 0.00017058823529411766, "loss": 0.8623821258544921, "mean_token_accuracy": 0.864073084294796, "num_tokens": 58244.0, "step": 30 }, { "entropy": 0.7483784720301628, "epoch": 0.17777777777777778, "grad_norm": 0.423828125, "learning_rate": 0.00019996997576394573, "loss": 0.7713714599609375, "mean_token_accuracy": 0.8697837173938752, "num_tokens": 77711.0, "step": 40 }, { "entropy": 0.7391687169671058, "epoch": 0.2222222222222222, "grad_norm": 0.376953125, "learning_rate": 0.00019972989003925543, "loss": 0.7115508556365967, "mean_token_accuracy": 0.8751530349254608, "num_tokens": 97104.0, "step": 50 }, { "entropy": 0.7042164742946625, "epoch": 0.26666666666666666, "grad_norm": 0.330078125, "learning_rate": 0.00019925029517454195, "loss": 0.6672511577606202, "mean_token_accuracy": 0.8725973218679428, "num_tokens": 116498.0, "step": 60 }, { "entropy": 0.6745826601982117, "epoch": 0.3111111111111111, "grad_norm": 0.361328125, "learning_rate": 0.00019853234295442638, "loss": 0.6365277290344238, "mean_token_accuracy": 0.872233435511589, "num_tokens": 136089.0, "step": 70 }, { "entropy": 0.6878040120005607, "epoch": 0.35555555555555557, "grad_norm": 0.37109375, "learning_rate": 0.00019757775759738272, "loss": 0.6395976066589355, "mean_token_accuracy": 0.8741081401705741, "num_tokens": 155486.0, "step": 80 }, { "entropy": 0.6898319900035859, "epoch": 0.4, "grad_norm": 0.330078125, "learning_rate": 0.00019638883161489224, "loss": 0.6368544578552247, "mean_token_accuracy": 0.8765213042497635, "num_tokens": 175116.0, "step": 90 }, { "entropy": 0.656438185274601, "epoch": 0.4444444444444444, "grad_norm": 0.33203125, "learning_rate": 0.0001949684203057978, "loss": 0.6183670043945313, "mean_token_accuracy": 0.8779006212949753, "num_tokens": 194495.0, "step": 100 }, { "entropy": 0.6711793914437294, "epoch": 0.4888888888888889, "grad_norm": 0.388671875, "learning_rate": 0.00019331993489907977, "loss": 0.633416748046875, "mean_token_accuracy": 0.8727847129106522, "num_tokens": 214311.0, "step": 110 }, { "entropy": 0.6290019288659096, "epoch": 0.5333333333333333, "grad_norm": 0.33203125, "learning_rate": 0.00019144733436152284, "loss": 0.5889303684234619, "mean_token_accuracy": 0.8814716726541519, "num_tokens": 233676.0, "step": 120 }, { "entropy": 0.6458568304777146, "epoch": 0.5777777777777777, "grad_norm": 0.318359375, "learning_rate": 0.00018935511588994715, "loss": 0.6043062686920166, "mean_token_accuracy": 0.8794952735304833, "num_tokens": 253188.0, "step": 130 }, { "entropy": 0.6591948792338371, "epoch": 0.6222222222222222, "grad_norm": 0.32421875, "learning_rate": 0.000187048304110838, "loss": 0.6233312129974365, "mean_token_accuracy": 0.873698017001152, "num_tokens": 273185.0, "step": 140 }, { "entropy": 0.6109217047691345, "epoch": 0.6666666666666666, "grad_norm": 0.291015625, "learning_rate": 0.00018453243901331195, "loss": 0.5925732135772706, "mean_token_accuracy": 0.884858050942421, "num_tokens": 292431.0, "step": 150 }, { "entropy": 0.6377103522419929, "epoch": 0.7111111111111111, "grad_norm": 0.3671875, "learning_rate": 0.00018181356264439905, "loss": 0.5884737968444824, "mean_token_accuracy": 0.8802034169435501, "num_tokens": 311687.0, "step": 160 }, { "entropy": 0.6447647094726563, "epoch": 0.7555555555555555, "grad_norm": 0.3046875, "learning_rate": 0.0001788982045985939, "loss": 0.5939778327941895, "mean_token_accuracy": 0.8817022785544395, "num_tokens": 330813.0, "step": 170 }, { "entropy": 0.6029744669795036, "epoch": 0.8, "grad_norm": 0.3125, "learning_rate": 0.00017579336633652317, "loss": 0.5752908706665039, "mean_token_accuracy": 0.8855120778083801, "num_tokens": 350308.0, "step": 180 }, { "entropy": 0.6441277623176574, "epoch": 0.8444444444444444, "grad_norm": 0.259765625, "learning_rate": 0.00017250650437038964, "loss": 0.5958236217498779, "mean_token_accuracy": 0.8808144956827164, "num_tokens": 370083.0, "step": 190 }, { "entropy": 0.5766214028000831, "epoch": 0.8888888888888888, "grad_norm": 0.2734375, "learning_rate": 0.0001690455123565743, "loss": 0.5667627811431885, "mean_token_accuracy": 0.8866458177566529, "num_tokens": 389516.0, "step": 200 }, { "entropy": 0.6425503984093666, "epoch": 0.9333333333333333, "grad_norm": 0.3046875, "learning_rate": 0.00016541870213840243, "loss": 0.6137699127197266, "mean_token_accuracy": 0.8819929376244545, "num_tokens": 408940.0, "step": 210 }, { "entropy": 0.6159977808594703, "epoch": 0.9777777777777777, "grad_norm": 0.265625, "learning_rate": 0.0001616347837846011, "loss": 0.5788507461547852, "mean_token_accuracy": 0.8852896198630333, "num_tokens": 428166.0, "step": 220 }, { "entropy": 0.6020576372742653, "epoch": 1.0222222222222221, "grad_norm": 0.2353515625, "learning_rate": 0.000157702844671387, "loss": 0.5500371932983399, "mean_token_accuracy": 0.8901642486453056, "num_tokens": 447438.0, "step": 230 }, { "entropy": 0.5630205765366554, "epoch": 1.0666666666666667, "grad_norm": 0.275390625, "learning_rate": 0.00015363232765842089, "loss": 0.5382141590118408, "mean_token_accuracy": 0.8885036528110504, "num_tokens": 467009.0, "step": 240 }, { "entropy": 0.5631943918764591, "epoch": 1.1111111111111112, "grad_norm": 0.306640625, "learning_rate": 0.00014943300841104094, "loss": 0.5194426536560058, "mean_token_accuracy": 0.8929360061883926, "num_tokens": 486591.0, "step": 250 }, { "entropy": 0.5655099518597126, "epoch": 1.1555555555555554, "grad_norm": 0.259765625, "learning_rate": 0.0001451149719232366, "loss": 0.5290531158447266, "mean_token_accuracy": 0.8912677451968193, "num_tokens": 506180.0, "step": 260 }, { "entropy": 0.5660845704376698, "epoch": 1.2, "grad_norm": 0.326171875, "learning_rate": 0.00014068858829774608, "loss": 0.5366004943847656, "mean_token_accuracy": 0.8909024119377136, "num_tokens": 525696.0, "step": 270 }, { "entropy": 0.5818345256149768, "epoch": 1.2444444444444445, "grad_norm": 0.26171875, "learning_rate": 0.0001361644878414428, "loss": 0.5424720764160156, "mean_token_accuracy": 0.8896975666284561, "num_tokens": 545392.0, "step": 280 }, { "entropy": 0.5546154774725437, "epoch": 1.2888888888888888, "grad_norm": 0.3359375, "learning_rate": 0.00013155353553582057, "loss": 0.5176132202148438, "mean_token_accuracy": 0.8928953528404235, "num_tokens": 565036.0, "step": 290 }, { "entropy": 0.5676225990056991, "epoch": 1.3333333333333333, "grad_norm": 0.275390625, "learning_rate": 0.0001268668049438902, "loss": 0.5130613803863525, "mean_token_accuracy": 0.8928169339895249, "num_tokens": 584507.0, "step": 300 }, { "entropy": 0.5529272347688675, "epoch": 1.3777777777777778, "grad_norm": 0.326171875, "learning_rate": 0.0001221155516161506, "loss": 0.5317890644073486, "mean_token_accuracy": 0.8913554430007935, "num_tokens": 604008.0, "step": 310 }, { "entropy": 0.5658974438905716, "epoch": 1.4222222222222223, "grad_norm": 0.26953125, "learning_rate": 0.0001173111860595032, "loss": 0.5273444652557373, "mean_token_accuracy": 0.8927861481904984, "num_tokens": 623480.0, "step": 320 }, { "entropy": 0.5697685681283474, "epoch": 1.4666666666666668, "grad_norm": 0.322265625, "learning_rate": 0.00011246524633402573, "loss": 0.5287697792053223, "mean_token_accuracy": 0.8912984907627106, "num_tokens": 642979.0, "step": 330 }, { "entropy": 0.5488456651568413, "epoch": 1.511111111111111, "grad_norm": 0.326171875, "learning_rate": 0.00010758937034341787, "loss": 0.513739824295044, "mean_token_accuracy": 0.8952319726347924, "num_tokens": 662396.0, "step": 340 }, { "entropy": 0.55315260887146, "epoch": 1.5555555555555556, "grad_norm": 0.26953125, "learning_rate": 0.00010269526788566408, "loss": 0.5225533485412598, "mean_token_accuracy": 0.8937178790569306, "num_tokens": 681644.0, "step": 350 }, { "entropy": 0.5738558314740658, "epoch": 1.6, "grad_norm": 0.29296875, "learning_rate": 9.779469253103684e-05, "loss": 0.5239317417144775, "mean_token_accuracy": 0.8908430561423302, "num_tokens": 701030.0, "step": 360 }, { "entropy": 0.5420261971652508, "epoch": 1.6444444444444444, "grad_norm": 0.259765625, "learning_rate": 9.289941339497719e-05, "loss": 0.5274893283843994, "mean_token_accuracy": 0.8941561266779899, "num_tokens": 720294.0, "step": 370 }, { "entropy": 0.577882957458496, "epoch": 1.6888888888888889, "grad_norm": 0.33203125, "learning_rate": 8.802118687364284e-05, "loss": 0.5202207088470459, "mean_token_accuracy": 0.8931182771921158, "num_tokens": 739607.0, "step": 380 }, { "entropy": 0.5461296208202839, "epoch": 1.7333333333333334, "grad_norm": 0.30859375, "learning_rate": 8.317172841000173e-05, "loss": 0.5105932235717774, "mean_token_accuracy": 0.8917569547891617, "num_tokens": 759370.0, "step": 390 }, { "entropy": 0.5631573006510735, "epoch": 1.7777777777777777, "grad_norm": 0.298828125, "learning_rate": 7.836268435827875e-05, "loss": 0.5263056755065918, "mean_token_accuracy": 0.8906426534056664, "num_tokens": 778969.0, "step": 400 }, { "entropy": 0.5476421102881431, "epoch": 1.8222222222222222, "grad_norm": 0.255859375, "learning_rate": 7.360560401432401e-05, "loss": 0.5025547504425049, "mean_token_accuracy": 0.8946620702743531, "num_tokens": 798105.0, "step": 410 }, { "entropy": 0.5343898519873619, "epoch": 1.8666666666666667, "grad_norm": 0.27734375, "learning_rate": 6.891191187907455e-05, "loss": 0.49821176528930666, "mean_token_accuracy": 0.8958980679512024, "num_tokens": 817238.0, "step": 420 }, { "entropy": 0.5404686734080315, "epoch": 1.911111111111111, "grad_norm": 0.296875, "learning_rate": 6.429288022172068e-05, "loss": 0.5022043704986572, "mean_token_accuracy": 0.8958747044205666, "num_tokens": 836646.0, "step": 430 }, { "entropy": 0.5426375091075897, "epoch": 1.9555555555555557, "grad_norm": 0.279296875, "learning_rate": 5.9759602008468996e-05, "loss": 0.5035938262939453, "mean_token_accuracy": 0.8944751426577568, "num_tokens": 856282.0, "step": 440 }, { "entropy": 0.5425564736127854, "epoch": 2.0, "grad_norm": 0.263671875, "learning_rate": 5.532296426191539e-05, "loss": 0.5004886627197266, "mean_token_accuracy": 0.8947419315576554, "num_tokens": 875656.0, "step": 450 }, { "entropy": 0.526330380141735, "epoch": 2.0444444444444443, "grad_norm": 0.279296875, "learning_rate": 5.0993621915007785e-05, "loss": 0.44887552261352537, "mean_token_accuracy": 0.9024429768323898, "num_tokens": 894973.0, "step": 460 }, { "entropy": 0.4774711772799492, "epoch": 2.088888888888889, "grad_norm": 0.365234375, "learning_rate": 4.678197222239035e-05, "loss": 0.44640169143676756, "mean_token_accuracy": 0.9045588001608849, "num_tokens": 914579.0, "step": 470 }, { "entropy": 0.4789727419614792, "epoch": 2.1333333333333333, "grad_norm": 0.3828125, "learning_rate": 4.269812979058235e-05, "loss": 0.44276885986328124, "mean_token_accuracy": 0.9066318318247795, "num_tokens": 933807.0, "step": 480 }, { "entropy": 0.47537712305784224, "epoch": 2.1777777777777776, "grad_norm": 0.359375, "learning_rate": 3.875190228695862e-05, "loss": 0.4367781639099121, "mean_token_accuracy": 0.9070042923092843, "num_tokens": 953241.0, "step": 490 }, { "entropy": 0.4877164676785469, "epoch": 2.2222222222222223, "grad_norm": 0.328125, "learning_rate": 3.4952766885868346e-05, "loss": 0.4422135353088379, "mean_token_accuracy": 0.905805604159832, "num_tokens": 972758.0, "step": 500 }, { "entropy": 0.4915403999388218, "epoch": 2.2666666666666666, "grad_norm": 0.376953125, "learning_rate": 3.130984750845885e-05, "loss": 0.4357293128967285, "mean_token_accuracy": 0.9067289993166924, "num_tokens": 992534.0, "step": 510 }, { "entropy": 0.4957615494728088, "epoch": 2.311111111111111, "grad_norm": 0.33984375, "learning_rate": 2.7831892910864434e-05, "loss": 0.44167218208312986, "mean_token_accuracy": 0.9066730305552483, "num_tokens": 1012003.0, "step": 520 }, { "entropy": 0.48269262462854384, "epoch": 2.3555555555555556, "grad_norm": 0.375, "learning_rate": 2.4527255673383565e-05, "loss": 0.437894344329834, "mean_token_accuracy": 0.904815036058426, "num_tokens": 1031505.0, "step": 530 }, { "entropy": 0.47741171419620515, "epoch": 2.4, "grad_norm": 0.4140625, "learning_rate": 2.140387214110322e-05, "loss": 0.4400351047515869, "mean_token_accuracy": 0.9068154886364936, "num_tokens": 1050914.0, "step": 540 }, { "entropy": 0.4727069653570652, "epoch": 2.4444444444444446, "grad_norm": 0.35546875, "learning_rate": 1.846924336414474e-05, "loss": 0.43111190795898435, "mean_token_accuracy": 0.9075597256422043, "num_tokens": 1070218.0, "step": 550 }, { "entropy": 0.4883471392095089, "epoch": 2.488888888888889, "grad_norm": 0.314453125, "learning_rate": 1.5730417083304573e-05, "loss": 0.4493571758270264, "mean_token_accuracy": 0.9073263511061669, "num_tokens": 1089667.0, "step": 560 }, { "entropy": 0.4878625735640526, "epoch": 2.533333333333333, "grad_norm": 0.375, "learning_rate": 1.3193970804352952e-05, "loss": 0.44793548583984377, "mean_token_accuracy": 0.9050837978720665, "num_tokens": 1109201.0, "step": 570 }, { "entropy": 0.48537297546863556, "epoch": 2.5777777777777775, "grad_norm": 0.337890625, "learning_rate": 1.08659960016387e-05, "loss": 0.4368610382080078, "mean_token_accuracy": 0.9097044110298157, "num_tokens": 1128649.0, "step": 580 }, { "entropy": 0.4859867602586746, "epoch": 2.6222222222222222, "grad_norm": 0.328125, "learning_rate": 8.75208348893667e-06, "loss": 0.4249687194824219, "mean_token_accuracy": 0.9087634190917016, "num_tokens": 1148353.0, "step": 590 }, { "entropy": 0.4833585321903229, "epoch": 2.6666666666666665, "grad_norm": 0.3828125, "learning_rate": 6.857309992670624e-06, "loss": 0.4455591678619385, "mean_token_accuracy": 0.9075253725051879, "num_tokens": 1167638.0, "step": 600 }, { "entropy": 0.4794360339641571, "epoch": 2.7111111111111112, "grad_norm": 0.3203125, "learning_rate": 5.186225959757207e-06, "loss": 0.43627562522888186, "mean_token_accuracy": 0.907138803601265, "num_tokens": 1186894.0, "step": 610 }, { "entropy": 0.4800324112176895, "epoch": 2.7555555555555555, "grad_norm": 0.365234375, "learning_rate": 3.7428446293514386e-06, "loss": 0.42800016403198243, "mean_token_accuracy": 0.9089159920811654, "num_tokens": 1206224.0, "step": 620 }, { "entropy": 0.48999542444944383, "epoch": 2.8, "grad_norm": 0.31640625, "learning_rate": 2.5306323947385746e-06, "loss": 0.44663453102111816, "mean_token_accuracy": 0.9060632780194282, "num_tokens": 1225569.0, "step": 630 }, { "entropy": 0.4874999448657036, "epoch": 2.8444444444444446, "grad_norm": 0.326171875, "learning_rate": 1.5525004785192143e-06, "loss": 0.44841961860656737, "mean_token_accuracy": 0.9045136958360672, "num_tokens": 1244959.0, "step": 640 }, { "entropy": 0.49936808943748473, "epoch": 2.888888888888889, "grad_norm": 0.4296875, "learning_rate": 8.107979410802769e-07, "loss": 0.4453989028930664, "mean_token_accuracy": 0.9050952970981598, "num_tokens": 1264904.0, "step": 650 }, { "entropy": 0.49325661584734914, "epoch": 2.9333333333333336, "grad_norm": 0.373046875, "learning_rate": 3.0730603914255193e-07, "loss": 0.44756379127502444, "mean_token_accuracy": 0.9043820068240166, "num_tokens": 1284311.0, "step": 660 }, { "entropy": 0.5068465434014797, "epoch": 2.977777777777778, "grad_norm": 0.373046875, "learning_rate": 4.323394793315228e-08, "loss": 0.4593667030334473, "mean_token_accuracy": 0.9011617928743363, "num_tokens": 1303914.0, "step": 670 }, { "epoch": 3.0, "eval_entropy": 0.5207519015669823, "eval_loss": 0.5975516438484192, "eval_mean_token_accuracy": 0.8822531878948212, "eval_num_tokens": 1313484.0, "eval_runtime": 57.0793, "eval_samples_per_second": 7.008, "eval_steps_per_second": 1.752, "step": 675 }, { "epoch": 3.0, "step": 675, "total_flos": 2.3441226939026637e+17, "train_loss": 0.5646523337894016, "train_runtime": 6392.6844, "train_samples_per_second": 1.689, "train_steps_per_second": 0.106 } ], "logging_steps": 10, "max_steps": 675, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 9999, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.3441226939026637e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }