===================================================== CODE AUTOPSY - COMPLETE TRAINING LOG (3 EPOCHS) ===================================================== Total Steps: 246 Best Model Checkpoint: C:\Users\Devansh Tyagi\Desktop\Projects\Code-Autopsy\checkpoints\checkpoint-246 Best Metric (eval_loss): 0.244215190410614 STEP-BY-STEP LOG HISTORY: ---------------------------------------------------------------------- {"entropy": 1.2720158830285073, "epoch": 0.06144393241167435, "grad_norm": 0.2734375, "learning_rate": 6.153846153846155e-05, "loss": 2.1623348236083983, "mean_token_accuracy": 0.6029356420040131, "num_tokens": 7832.0, "step": 5} {"entropy": 1.2995335638523102, "epoch": 0.1228878648233487, "grad_norm": 0.435546875, "learning_rate": 0.00013846153846153847, "loss": 2.1435720443725588, "mean_token_accuracy": 0.6072336934506893, "num_tokens": 15169.0, "step": 10} {"entropy": 1.3567075744271277, "epoch": 0.18433179723502305, "grad_norm": 0.5703125, "learning_rate": 0.00019999091026277928, "loss": 1.8734064102172852, "mean_token_accuracy": 0.6238010875880718, "num_tokens": 22884.0, "step": 15} {"entropy": 1.5021331459283829, "epoch": 0.2457757296466974, "grad_norm": 0.59765625, "learning_rate": 0.0001996729429353878, "loss": 1.6023683547973633, "mean_token_accuracy": 0.6496468104422093, "num_tokens": 30047.0, "step": 20} {"epoch": 0.2457757296466974, "eval_entropy": 1.4432531578900063, "eval_loss": 1.3970026969909668, "eval_mean_token_accuracy": 0.6886225922466958, "eval_num_tokens": 30047.0, "eval_runtime": 98.8045, "eval_samples_per_second": 0.739, "eval_steps_per_second": 0.739, "step": 20} {"entropy": 1.3366006165742874, "epoch": 0.30721966205837176, "grad_norm": 0.6171875, "learning_rate": 0.00019890213986358148, "loss": 1.2767066955566406, "mean_token_accuracy": 0.7060731440782547, "num_tokens": 37561.0, "step": 25} {"entropy": 0.8943048655986786, "epoch": 0.3686635944700461, "grad_norm": 0.69921875, "learning_rate": 0.00019768200297248193, "loss": 0.9884555816650391, "mean_token_accuracy": 0.772250434756279, "num_tokens": 45476.0, "step": 30} {"entropy": 0.6866158157587051, "epoch": 0.43010752688172044, "grad_norm": 0.734375, "learning_rate": 0.00019601807560796713, "loss": 0.7711129665374756, "mean_token_accuracy": 0.8339575499296188, "num_tokens": 53130.0, "step": 35} {"entropy": 0.6559636496007443, "epoch": 0.4915514592933948, "grad_norm": 0.86328125, "learning_rate": 0.00019391791735205182, "loss": 0.6632838726043702, "mean_token_accuracy": 0.8613109961152077, "num_tokens": 60631.0, "step": 40} {"epoch": 0.4915514592933948, "eval_entropy": 0.5521646117510861, "eval_loss": 0.630871057510376, "eval_mean_token_accuracy": 0.8730851166868863, "eval_num_tokens": 60631.0, "eval_runtime": 97.1898, "eval_samples_per_second": 0.751, "eval_steps_per_second": 0.751, "step": 40} {"entropy": 0.5553950414061546, "epoch": 0.5529953917050692, "grad_norm": 0.68359375, "learning_rate": 0.00019139106967807062, "loss": 0.6109470844268798, "mean_token_accuracy": 0.8708647087216377, "num_tokens": 68147.0, "step": 45} {"entropy": 0.5107979021966458, "epoch": 0.6144393241167435, "grad_norm": 0.498046875, "learning_rate": 0.0001884490126017005, "loss": 0.5680758953094482, "mean_token_accuracy": 0.8782492533326149, "num_tokens": 75622.0, "step": 50} {"entropy": 0.5033965408802032, "epoch": 0.6758832565284179, "grad_norm": 0.50390625, "learning_rate": 0.00018510511252476587, "loss": 0.5488744735717773, "mean_token_accuracy": 0.8770601689815521, "num_tokens": 83564.0, "step": 55} {"entropy": 0.4694289192557335, "epoch": 0.7373271889400922, "grad_norm": 0.4375, "learning_rate": 0.00018137456150878303, "loss": 0.4926635265350342, "mean_token_accuracy": 0.8881596863269806, "num_tokens": 91409.0, "step": 60} {"epoch": 0.7373271889400922, "eval_entropy": 0.4363853490515931, "eval_loss": 0.46880096197128296, "eval_mean_token_accuracy": 0.8960385273580682, "eval_num_tokens": 91409.0, "eval_runtime": 95.7743, "eval_samples_per_second": 0.762, "eval_steps_per_second": 0.762, "step": 60} {"entropy": 0.43721060529351236, "epoch": 0.7987711213517665, "grad_norm": 0.60546875, "learning_rate": 0.00017727430825413792, "loss": 0.4627737522125244, "mean_token_accuracy": 0.9004349738359452, "num_tokens": 98711.0, "step": 65} {"entropy": 0.4222001314163208, "epoch": 0.8602150537634409, "grad_norm": 0.66015625, "learning_rate": 0.00017282298109847345, "loss": 0.47431230545043945, "mean_token_accuracy": 0.8917310431599617, "num_tokens": 105785.0, "step": 70} {"entropy": 0.4233152411878109, "epoch": 0.9216589861751152, "grad_norm": 0.443359375, "learning_rate": 0.00016804080338412108, "loss": 0.4605244159698486, "mean_token_accuracy": 0.902459979057312, "num_tokens": 112840.0, "step": 75} {"entropy": 0.4323478534817696, "epoch": 0.9831029185867896, "grad_norm": 0.4453125, "learning_rate": 0.00016294950157908132, "loss": 0.44331941604614256, "mean_token_accuracy": 0.897197200357914, "num_tokens": 120233.0, "step": 80} {"epoch": 0.9831029185867896, "eval_entropy": 0.4033231739312002, "eval_loss": 0.39226189255714417, "eval_mean_token_accuracy": 0.9040106412482588, "eval_num_tokens": 120233.0, "eval_runtime": 99.948, "eval_samples_per_second": 0.73, "eval_steps_per_second": 0.73, "step": 80} {"entropy": 0.4201068043708801, "epoch": 1.0368663594470047, "grad_norm": 0.5, "learning_rate": 0.00015757220656897896, "loss": 0.41355881690979, "mean_token_accuracy": 0.9027445759092059, "num_tokens": 126530.0, "step": 85} {"entropy": 0.3881114762276411, "epoch": 1.098310291858679, "grad_norm": 0.4609375, "learning_rate": 0.00015193334856844528, "loss": 0.3866158723831177, "mean_token_accuracy": 0.9028143763542176, "num_tokens": 134195.0, "step": 90} {"entropy": 0.37071702964603903, "epoch": 1.1597542242703534, "grad_norm": 0.58203125, "learning_rate": 0.00014605854612936728, "loss": 0.38562917709350586, "mean_token_accuracy": 0.9037379220128059, "num_tokens": 142095.0, "step": 95} {"entropy": 0.39508153647184374, "epoch": 1.2211981566820276, "grad_norm": 0.498046875, "learning_rate": 0.00013997448975026382, "loss": 0.37968151569366454, "mean_token_accuracy": 0.902898819744587, "num_tokens": 150281.0, "step": 100} {"epoch": 1.2211981566820276, "eval_entropy": 0.3728377917041517, "eval_loss": 0.32667699456214905, "eval_mean_token_accuracy": 0.9168023311928527, "eval_num_tokens": 150281.0, "eval_runtime": 100.3144, "eval_samples_per_second": 0.728, "eval_steps_per_second": 0.728, "step": 100} {"entropy": 0.3990515094250441, "epoch": 1.282642089093702, "grad_norm": 0.498046875, "learning_rate": 0.00013370882061557635, "loss": 0.35355989933013915, "mean_token_accuracy": 0.9085300818085671, "num_tokens": 158311.0, "step": 105} {"entropy": 0.34259250313043593, "epoch": 1.3440860215053765, "grad_norm": 0.515625, "learning_rate": 0.0001272900050157875, "loss": 0.3187845706939697, "mean_token_accuracy": 0.9141712740063668, "num_tokens": 165531.0, "step": 110} {"entropy": 0.3513215810060501, "epoch": 1.4055299539170507, "grad_norm": 0.447265625, "learning_rate": 0.00012074720501890484, "loss": 0.34308681488037107, "mean_token_accuracy": 0.9139169871807098, "num_tokens": 172730.0, "step": 115} {"entropy": 0.3432418659329414, "epoch": 1.466973886328725, "grad_norm": 0.4609375, "learning_rate": 0.00011411014598087644, "loss": 0.3543131113052368, "mean_token_accuracy": 0.9060193613171578, "num_tokens": 180674.0, "step": 120} {"epoch": 1.466973886328725, "eval_entropy": 0.3156628967964486, "eval_loss": 0.28925180435180664, "eval_mean_token_accuracy": 0.9195440672848323, "eval_num_tokens": 180674.0, "eval_runtime": 100.8258, "eval_samples_per_second": 0.724, "eval_steps_per_second": 0.724, "step": 120} {"entropy": 0.328844403848052, "epoch": 1.5284178187403994, "grad_norm": 0.6484375, "learning_rate": 0.0001074089814968676, "loss": 0.3134729862213135, "mean_token_accuracy": 0.9172038078308106, "num_tokens": 187909.0, "step": 125} {"entropy": 0.3347533904016018, "epoch": 1.5898617511520738, "grad_norm": 0.46484375, "learning_rate": 0.0001006741564069543, "loss": 0.32318768501281736, "mean_token_accuracy": 0.915935255587101, "num_tokens": 195418.0, "step": 130} {"entropy": 0.31085881143808364, "epoch": 1.651305683563748, "grad_norm": 0.6953125, "learning_rate": 9.393626847862763e-05, "loss": 0.28849263191223146, "mean_token_accuracy": 0.9287568554282188, "num_tokens": 202302.0, "step": 135} {"entropy": 0.36759571749716996, "epoch": 1.7127496159754223, "grad_norm": 0.5546875, "learning_rate": 8.722592939451625e-05, "loss": 0.3258425951004028, "mean_token_accuracy": 0.9135418727993965, "num_tokens": 210159.0, "step": 140} {"epoch": 1.7127496159754223, "eval_entropy": 0.2999503336948891, "eval_loss": 0.2642817199230194, "eval_mean_token_accuracy": 0.9280164380596109, "eval_num_tokens": 210159.0, "eval_runtime": 95.0047, "eval_samples_per_second": 0.768, "eval_steps_per_second": 0.768, "step": 140} {"entropy": 0.2923012483865023, "epoch": 1.7741935483870968, "grad_norm": 0.470703125, "learning_rate": 8.057362567688942e-05, "loss": 0.28111426830291747, "mean_token_accuracy": 0.9294544145464897, "num_tokens": 217668.0, "step": 145} {"entropy": 0.3098321039229631, "epoch": 1.8356374807987712, "grad_norm": 0.400390625, "learning_rate": 7.400958018079008e-05, "loss": 0.2959801197052002, "mean_token_accuracy": 0.9246162533760071, "num_tokens": 224914.0, "step": 150} {"entropy": 0.30831411490216853, "epoch": 1.8970814132104454, "grad_norm": 0.435546875, "learning_rate": 6.756361478506578e-05, "loss": 0.3086764097213745, "mean_token_accuracy": 0.9224985137581825, "num_tokens": 232318.0, "step": 155} {"entropy": 0.29551686625927687, "epoch": 1.9585253456221197, "grad_norm": 0.58203125, "learning_rate": 6.1265014905121e-05, "loss": 0.2773712635040283, "mean_token_accuracy": 0.9252645134925842, "num_tokens": 239672.0, "step": 160} {"epoch": 1.9585253456221197, "eval_entropy": 0.26235738804895586, "eval_loss": 0.25179651379585266, "eval_mean_token_accuracy": 0.9296977715949489, "eval_num_tokens": 239672.0, "eval_runtime": 95.912, "eval_samples_per_second": 0.761, "eval_steps_per_second": 0.761, "step": 160} {"entropy": 0.26158358571784834, "epoch": 2.0122887864823347, "grad_norm": 0.4140625, "learning_rate": 5.5142396442938795e-05, "loss": 0.24724166393280028, "mean_token_accuracy": 0.9323797225952148, "num_tokens": 246006.0, "step": 165} {"entropy": 0.2724688397720456, "epoch": 2.0737327188940093, "grad_norm": 0.61328125, "learning_rate": 4.9223575778847085e-05, "loss": 0.2526975393295288, "mean_token_accuracy": 0.9308534324169159, "num_tokens": 253437.0, "step": 170} {"entropy": 0.2712310256436467, "epoch": 2.1351766513056836, "grad_norm": 0.439453125, "learning_rate": 4.353544339568448e-05, "loss": 0.2677891254425049, "mean_token_accuracy": 0.9274151250720024, "num_tokens": 260911.0, "step": 175} {"entropy": 0.2781375008635223, "epoch": 2.196620583717358, "grad_norm": 0.55078125, "learning_rate": 3.8103841709519084e-05, "loss": 0.29916017055511473, "mean_token_accuracy": 0.9209732711315155, "num_tokens": 268425.0, "step": 180} {"epoch": 2.196620583717358, "eval_entropy": 0.2463044097570524, "eval_loss": 0.24747803807258606, "eval_mean_token_accuracy": 0.930726853135514, "eval_num_tokens": 268425.0, "eval_runtime": 95.1097, "eval_samples_per_second": 0.768, "eval_steps_per_second": 0.768, "step": 180} {"entropy": 0.2690023283474147, "epoch": 2.258064516129032, "grad_norm": 0.4765625, "learning_rate": 3.29534476619609e-05, "loss": 0.27658329010009763, "mean_token_accuracy": 0.9289590641856194, "num_tokens": 275782.0, "step": 185} {"entropy": 0.2697915196418762, "epoch": 2.3195084485407067, "grad_norm": 0.44921875, "learning_rate": 2.8107660607477328e-05, "loss": 0.28579936027526853, "mean_token_accuracy": 0.9249747917056084, "num_tokens": 283440.0, "step": 190} {"entropy": 0.28678075782954693, "epoch": 2.380952380952381, "grad_norm": 0.5078125, "learning_rate": 2.3588496005063287e-05, "loss": 0.300011134147644, "mean_token_accuracy": 0.9201881185173988, "num_tokens": 290391.0, "step": 195} {"entropy": 0.2683371202088892, "epoch": 2.442396313364055, "grad_norm": 0.49609375, "learning_rate": 1.9416485397247795e-05, "loss": 0.26392982006072996, "mean_token_accuracy": 0.9297228127717971, "num_tokens": 298116.0, "step": 200} {"epoch": 2.442396313364055, "eval_entropy": 0.24947702108997188, "eval_loss": 0.24490928649902344, "eval_mean_token_accuracy": 0.931492513989749, "eval_num_tokens": 298116.0, "eval_runtime": 96.5333, "eval_samples_per_second": 0.756, "eval_steps_per_second": 0.756, "step": 200} {"entropy": 0.27692094454541805, "epoch": 2.50384024577573, "grad_norm": 0.396484375, "learning_rate": 1.5610583130854128e-05, "loss": 0.2804937601089478, "mean_token_accuracy": 0.922454084455967, "num_tokens": 305768.0, "step": 205} {"entropy": 0.29743164833635094, "epoch": 2.565284178187404, "grad_norm": 0.396484375, "learning_rate": 1.2188080243301437e-05, "loss": 0.29574849605560305, "mean_token_accuracy": 0.9198502600193024, "num_tokens": 313660.0, "step": 210} {"entropy": 0.2640182925388217, "epoch": 2.6267281105990783, "grad_norm": 0.49609375, "learning_rate": 9.164525905680709e-06, "loss": 0.25743927955627444, "mean_token_accuracy": 0.9311310544610023, "num_tokens": 320841.0, "step": 215} {"entropy": 0.27618018090724944, "epoch": 2.688172043010753, "grad_norm": 0.51953125, "learning_rate": 6.553656779506468e-06, "loss": 0.2789269685745239, "mean_token_accuracy": 0.9260447949171067, "num_tokens": 328470.0, "step": 220} {"epoch": 2.688172043010753, "eval_entropy": 0.24862186620904975, "eval_loss": 0.24429786205291748, "eval_mean_token_accuracy": 0.9314827543415435, "eval_num_tokens": 328470.0, "eval_runtime": 93.481, "eval_samples_per_second": 0.781, "eval_steps_per_second": 0.781, "step": 220} {"entropy": 0.2760592779144645, "epoch": 2.749615975422427, "grad_norm": 0.40625, "learning_rate": 4.367334608091389e-06, "loss": 0.29435703754425047, "mean_token_accuracy": 0.9220241814851761, "num_tokens": 336107.0, "step": 225} {"entropy": 0.2630997773259878, "epoch": 2.8110599078341014, "grad_norm": 0.466796875, "learning_rate": 2.6154923260801934e-06, "loss": 0.2583890914916992, "mean_token_accuracy": 0.9310009226202964, "num_tokens": 343384.0, "step": 230} {"entropy": 0.28990690847858785, "epoch": 2.8725038402457757, "grad_norm": 0.390625, "learning_rate": 1.3060889319784885e-06, "loss": 0.2960776090621948, "mean_token_accuracy": 0.9223004102706909, "num_tokens": 351180.0, "step": 235} {"entropy": 0.2609599939547479, "epoch": 2.93394777265745, "grad_norm": 0.388671875, "learning_rate": 4.4507332870059594e-07, "loss": 0.25511951446533204, "mean_token_accuracy": 0.9273923814296723, "num_tokens": 359106.0, "step": 240} {"epoch": 2.93394777265745, "eval_entropy": 0.24859930197261784, "eval_loss": 0.24424654245376587, "eval_mean_token_accuracy": 0.9321725441984934, "eval_num_tokens": 359106.0, "eval_runtime": 96.2762, "eval_samples_per_second": 0.758, "eval_steps_per_second": 0.758, "step": 240} {"entropy": 0.2684542080387473, "epoch": 2.9953917050691246, "grad_norm": 0.390625, "learning_rate": 3.635729641654484e-08, "loss": 0.2732724666595459, "mean_token_accuracy": 0.9262633189558983, "num_tokens": 366418.0, "step": 245} {"epoch": 3.0, "eval_entropy": 0.24880487002330284, "eval_loss": 0.244215190410614, "eval_mean_token_accuracy": 0.9320176945973749, "eval_num_tokens": 366954.0, "eval_runtime": 94.6685, "eval_samples_per_second": 0.771, "eval_steps_per_second": 0.771, "step": 246}