Text Generation
PEFT
Safetensors
code
code-review
bug-fixing
qwen
qwen2.5-coder
qlora
trl
static-analysis
conversational
Eval Results (legacy)
Instructions to use devanshty/Code-Autopsy with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use devanshty/Code-Autopsy with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-Coder-7B-Instruct") model = PeftModel.from_pretrained(base_model, "devanshty/Code-Autopsy") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 246, | |
| "best_metric": 0.244215190410614, | |
| "best_model_checkpoint": "C:\\Users\\Devansh Tyagi\\Desktop\\Projects\\Code-Autopsy\\checkpoints\\checkpoint-246", | |
| "epoch": 3.0, | |
| "eval_steps": 20, | |
| "global_step": 246, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.2720158830285073, | |
| "epoch": 0.06144393241167435, | |
| "grad_norm": 0.2734375, | |
| "learning_rate": 6.153846153846155e-05, | |
| "loss": 2.1623348236083983, | |
| "mean_token_accuracy": 0.6029356420040131, | |
| "num_tokens": 7832.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 1.2995335638523102, | |
| "epoch": 0.1228878648233487, | |
| "grad_norm": 0.435546875, | |
| "learning_rate": 0.00013846153846153847, | |
| "loss": 2.1435720443725588, | |
| "mean_token_accuracy": 0.6072336934506893, | |
| "num_tokens": 15169.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.3567075744271277, | |
| "epoch": 0.18433179723502305, | |
| "grad_norm": 0.5703125, | |
| "learning_rate": 0.00019999091026277928, | |
| "loss": 1.8734064102172852, | |
| "mean_token_accuracy": 0.6238010875880718, | |
| "num_tokens": 22884.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 1.5021331459283829, | |
| "epoch": 0.2457757296466974, | |
| "grad_norm": 0.59765625, | |
| "learning_rate": 0.0001996729429353878, | |
| "loss": 1.6023683547973633, | |
| "mean_token_accuracy": 0.6496468104422093, | |
| "num_tokens": 30047.0, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.2457757296466974, | |
| "eval_entropy": 1.4432531578900063, | |
| "eval_loss": 1.3970026969909668, | |
| "eval_mean_token_accuracy": 0.6886225922466958, | |
| "eval_num_tokens": 30047.0, | |
| "eval_runtime": 98.8045, | |
| "eval_samples_per_second": 0.739, | |
| "eval_steps_per_second": 0.739, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.3366006165742874, | |
| "epoch": 0.30721966205837176, | |
| "grad_norm": 0.6171875, | |
| "learning_rate": 0.00019890213986358148, | |
| "loss": 1.2767066955566406, | |
| "mean_token_accuracy": 0.7060731440782547, | |
| "num_tokens": 37561.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 0.8943048655986786, | |
| "epoch": 0.3686635944700461, | |
| "grad_norm": 0.69921875, | |
| "learning_rate": 0.00019768200297248193, | |
| "loss": 0.9884555816650391, | |
| "mean_token_accuracy": 0.772250434756279, | |
| "num_tokens": 45476.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.6866158157587051, | |
| "epoch": 0.43010752688172044, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 0.00019601807560796713, | |
| "loss": 0.7711129665374756, | |
| "mean_token_accuracy": 0.8339575499296188, | |
| "num_tokens": 53130.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 0.6559636496007443, | |
| "epoch": 0.4915514592933948, | |
| "grad_norm": 0.86328125, | |
| "learning_rate": 0.00019391791735205182, | |
| "loss": 0.6632838726043702, | |
| "mean_token_accuracy": 0.8613109961152077, | |
| "num_tokens": 60631.0, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.4915514592933948, | |
| "eval_entropy": 0.5521646117510861, | |
| "eval_loss": 0.630871057510376, | |
| "eval_mean_token_accuracy": 0.8730851166868863, | |
| "eval_num_tokens": 60631.0, | |
| "eval_runtime": 97.1898, | |
| "eval_samples_per_second": 0.751, | |
| "eval_steps_per_second": 0.751, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.5553950414061546, | |
| "epoch": 0.5529953917050692, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 0.00019139106967807062, | |
| "loss": 0.6109470844268798, | |
| "mean_token_accuracy": 0.8708647087216377, | |
| "num_tokens": 68147.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 0.5107979021966458, | |
| "epoch": 0.6144393241167435, | |
| "grad_norm": 0.498046875, | |
| "learning_rate": 0.0001884490126017005, | |
| "loss": 0.5680758953094482, | |
| "mean_token_accuracy": 0.8782492533326149, | |
| "num_tokens": 75622.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.5033965408802032, | |
| "epoch": 0.6758832565284179, | |
| "grad_norm": 0.50390625, | |
| "learning_rate": 0.00018510511252476587, | |
| "loss": 0.5488744735717773, | |
| "mean_token_accuracy": 0.8770601689815521, | |
| "num_tokens": 83564.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 0.4694289192557335, | |
| "epoch": 0.7373271889400922, | |
| "grad_norm": 0.4375, | |
| "learning_rate": 0.00018137456150878303, | |
| "loss": 0.4926635265350342, | |
| "mean_token_accuracy": 0.8881596863269806, | |
| "num_tokens": 91409.0, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.7373271889400922, | |
| "eval_entropy": 0.4363853490515931, | |
| "eval_loss": 0.46880096197128296, | |
| "eval_mean_token_accuracy": 0.8960385273580682, | |
| "eval_num_tokens": 91409.0, | |
| "eval_runtime": 95.7743, | |
| "eval_samples_per_second": 0.762, | |
| "eval_steps_per_second": 0.762, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 0.43721060529351236, | |
| "epoch": 0.7987711213517665, | |
| "grad_norm": 0.60546875, | |
| "learning_rate": 0.00017727430825413792, | |
| "loss": 0.4627737522125244, | |
| "mean_token_accuracy": 0.9004349738359452, | |
| "num_tokens": 98711.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 0.4222001314163208, | |
| "epoch": 0.8602150537634409, | |
| "grad_norm": 0.66015625, | |
| "learning_rate": 0.00017282298109847345, | |
| "loss": 0.47431230545043945, | |
| "mean_token_accuracy": 0.8917310431599617, | |
| "num_tokens": 105785.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 0.4233152411878109, | |
| "epoch": 0.9216589861751152, | |
| "grad_norm": 0.443359375, | |
| "learning_rate": 0.00016804080338412108, | |
| "loss": 0.4605244159698486, | |
| "mean_token_accuracy": 0.902459979057312, | |
| "num_tokens": 112840.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 0.4323478534817696, | |
| "epoch": 0.9831029185867896, | |
| "grad_norm": 0.4453125, | |
| "learning_rate": 0.00016294950157908132, | |
| "loss": 0.44331941604614256, | |
| "mean_token_accuracy": 0.897197200357914, | |
| "num_tokens": 120233.0, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.9831029185867896, | |
| "eval_entropy": 0.4033231739312002, | |
| "eval_loss": 0.39226189255714417, | |
| "eval_mean_token_accuracy": 0.9040106412482588, | |
| "eval_num_tokens": 120233.0, | |
| "eval_runtime": 99.948, | |
| "eval_samples_per_second": 0.73, | |
| "eval_steps_per_second": 0.73, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 0.4201068043708801, | |
| "epoch": 1.0368663594470047, | |
| "grad_norm": 0.5, | |
| "learning_rate": 0.00015757220656897896, | |
| "loss": 0.41355881690979, | |
| "mean_token_accuracy": 0.9027445759092059, | |
| "num_tokens": 126530.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 0.3881114762276411, | |
| "epoch": 1.098310291858679, | |
| "grad_norm": 0.4609375, | |
| "learning_rate": 0.00015193334856844528, | |
| "loss": 0.3866158723831177, | |
| "mean_token_accuracy": 0.9028143763542176, | |
| "num_tokens": 134195.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 0.37071702964603903, | |
| "epoch": 1.1597542242703534, | |
| "grad_norm": 0.58203125, | |
| "learning_rate": 0.00014605854612936728, | |
| "loss": 0.38562917709350586, | |
| "mean_token_accuracy": 0.9037379220128059, | |
| "num_tokens": 142095.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 0.39508153647184374, | |
| "epoch": 1.2211981566820276, | |
| "grad_norm": 0.498046875, | |
| "learning_rate": 0.00013997448975026382, | |
| "loss": 0.37968151569366454, | |
| "mean_token_accuracy": 0.902898819744587, | |
| "num_tokens": 150281.0, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 1.2211981566820276, | |
| "eval_entropy": 0.3728377917041517, | |
| "eval_loss": 0.32667699456214905, | |
| "eval_mean_token_accuracy": 0.9168023311928527, | |
| "eval_num_tokens": 150281.0, | |
| "eval_runtime": 100.3144, | |
| "eval_samples_per_second": 0.728, | |
| "eval_steps_per_second": 0.728, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.3990515094250441, | |
| "epoch": 1.282642089093702, | |
| "grad_norm": 0.498046875, | |
| "learning_rate": 0.00013370882061557635, | |
| "loss": 0.35355989933013915, | |
| "mean_token_accuracy": 0.9085300818085671, | |
| "num_tokens": 158311.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 0.34259250313043593, | |
| "epoch": 1.3440860215053765, | |
| "grad_norm": 0.515625, | |
| "learning_rate": 0.0001272900050157875, | |
| "loss": 0.3187845706939697, | |
| "mean_token_accuracy": 0.9141712740063668, | |
| "num_tokens": 165531.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 0.3513215810060501, | |
| "epoch": 1.4055299539170507, | |
| "grad_norm": 0.447265625, | |
| "learning_rate": 0.00012074720501890484, | |
| "loss": 0.34308681488037107, | |
| "mean_token_accuracy": 0.9139169871807098, | |
| "num_tokens": 172730.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 0.3432418659329414, | |
| "epoch": 1.466973886328725, | |
| "grad_norm": 0.4609375, | |
| "learning_rate": 0.00011411014598087644, | |
| "loss": 0.3543131113052368, | |
| "mean_token_accuracy": 0.9060193613171578, | |
| "num_tokens": 180674.0, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 1.466973886328725, | |
| "eval_entropy": 0.3156628967964486, | |
| "eval_loss": 0.28925180435180664, | |
| "eval_mean_token_accuracy": 0.9195440672848323, | |
| "eval_num_tokens": 180674.0, | |
| "eval_runtime": 100.8258, | |
| "eval_samples_per_second": 0.724, | |
| "eval_steps_per_second": 0.724, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 0.328844403848052, | |
| "epoch": 1.5284178187403994, | |
| "grad_norm": 0.6484375, | |
| "learning_rate": 0.0001074089814968676, | |
| "loss": 0.3134729862213135, | |
| "mean_token_accuracy": 0.9172038078308106, | |
| "num_tokens": 187909.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 0.3347533904016018, | |
| "epoch": 1.5898617511520738, | |
| "grad_norm": 0.46484375, | |
| "learning_rate": 0.0001006741564069543, | |
| "loss": 0.32318768501281736, | |
| "mean_token_accuracy": 0.915935255587101, | |
| "num_tokens": 195418.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 0.31085881143808364, | |
| "epoch": 1.651305683563748, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 9.393626847862763e-05, | |
| "loss": 0.28849263191223146, | |
| "mean_token_accuracy": 0.9287568554282188, | |
| "num_tokens": 202302.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 0.36759571749716996, | |
| "epoch": 1.7127496159754223, | |
| "grad_norm": 0.5546875, | |
| "learning_rate": 8.722592939451625e-05, | |
| "loss": 0.3258425951004028, | |
| "mean_token_accuracy": 0.9135418727993965, | |
| "num_tokens": 210159.0, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 1.7127496159754223, | |
| "eval_entropy": 0.2999503336948891, | |
| "eval_loss": 0.2642817199230194, | |
| "eval_mean_token_accuracy": 0.9280164380596109, | |
| "eval_num_tokens": 210159.0, | |
| "eval_runtime": 95.0047, | |
| "eval_samples_per_second": 0.768, | |
| "eval_steps_per_second": 0.768, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 0.2923012483865023, | |
| "epoch": 1.7741935483870968, | |
| "grad_norm": 0.470703125, | |
| "learning_rate": 8.057362567688942e-05, | |
| "loss": 0.28111426830291747, | |
| "mean_token_accuracy": 0.9294544145464897, | |
| "num_tokens": 217668.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 0.3098321039229631, | |
| "epoch": 1.8356374807987712, | |
| "grad_norm": 0.400390625, | |
| "learning_rate": 7.400958018079008e-05, | |
| "loss": 0.2959801197052002, | |
| "mean_token_accuracy": 0.9246162533760071, | |
| "num_tokens": 224914.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.30831411490216853, | |
| "epoch": 1.8970814132104454, | |
| "grad_norm": 0.435546875, | |
| "learning_rate": 6.756361478506578e-05, | |
| "loss": 0.3086764097213745, | |
| "mean_token_accuracy": 0.9224985137581825, | |
| "num_tokens": 232318.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 0.29551686625927687, | |
| "epoch": 1.9585253456221197, | |
| "grad_norm": 0.58203125, | |
| "learning_rate": 6.1265014905121e-05, | |
| "loss": 0.2773712635040283, | |
| "mean_token_accuracy": 0.9252645134925842, | |
| "num_tokens": 239672.0, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 1.9585253456221197, | |
| "eval_entropy": 0.26235738804895586, | |
| "eval_loss": 0.25179651379585266, | |
| "eval_mean_token_accuracy": 0.9296977715949489, | |
| "eval_num_tokens": 239672.0, | |
| "eval_runtime": 95.912, | |
| "eval_samples_per_second": 0.761, | |
| "eval_steps_per_second": 0.761, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 0.26158358571784834, | |
| "epoch": 2.0122887864823347, | |
| "grad_norm": 0.4140625, | |
| "learning_rate": 5.5142396442938795e-05, | |
| "loss": 0.24724166393280028, | |
| "mean_token_accuracy": 0.9323797225952148, | |
| "num_tokens": 246006.0, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 0.2724688397720456, | |
| "epoch": 2.0737327188940093, | |
| "grad_norm": 0.61328125, | |
| "learning_rate": 4.9223575778847085e-05, | |
| "loss": 0.2526975393295288, | |
| "mean_token_accuracy": 0.9308534324169159, | |
| "num_tokens": 253437.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.2712310256436467, | |
| "epoch": 2.1351766513056836, | |
| "grad_norm": 0.439453125, | |
| "learning_rate": 4.353544339568448e-05, | |
| "loss": 0.2677891254425049, | |
| "mean_token_accuracy": 0.9274151250720024, | |
| "num_tokens": 260911.0, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 0.2781375008635223, | |
| "epoch": 2.196620583717358, | |
| "grad_norm": 0.55078125, | |
| "learning_rate": 3.8103841709519084e-05, | |
| "loss": 0.29916017055511473, | |
| "mean_token_accuracy": 0.9209732711315155, | |
| "num_tokens": 268425.0, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 2.196620583717358, | |
| "eval_entropy": 0.2463044097570524, | |
| "eval_loss": 0.24747803807258606, | |
| "eval_mean_token_accuracy": 0.930726853135514, | |
| "eval_num_tokens": 268425.0, | |
| "eval_runtime": 95.1097, | |
| "eval_samples_per_second": 0.768, | |
| "eval_steps_per_second": 0.768, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 0.2690023283474147, | |
| "epoch": 2.258064516129032, | |
| "grad_norm": 0.4765625, | |
| "learning_rate": 3.29534476619609e-05, | |
| "loss": 0.27658329010009763, | |
| "mean_token_accuracy": 0.9289590641856194, | |
| "num_tokens": 275782.0, | |
| "step": 185 | |
| }, | |
| { | |
| "entropy": 0.2697915196418762, | |
| "epoch": 2.3195084485407067, | |
| "grad_norm": 0.44921875, | |
| "learning_rate": 2.8107660607477328e-05, | |
| "loss": 0.28579936027526853, | |
| "mean_token_accuracy": 0.9249747917056084, | |
| "num_tokens": 283440.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 0.28678075782954693, | |
| "epoch": 2.380952380952381, | |
| "grad_norm": 0.5078125, | |
| "learning_rate": 2.3588496005063287e-05, | |
| "loss": 0.300011134147644, | |
| "mean_token_accuracy": 0.9201881185173988, | |
| "num_tokens": 290391.0, | |
| "step": 195 | |
| }, | |
| { | |
| "entropy": 0.2683371202088892, | |
| "epoch": 2.442396313364055, | |
| "grad_norm": 0.49609375, | |
| "learning_rate": 1.9416485397247795e-05, | |
| "loss": 0.26392982006072996, | |
| "mean_token_accuracy": 0.9297228127717971, | |
| "num_tokens": 298116.0, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 2.442396313364055, | |
| "eval_entropy": 0.24947702108997188, | |
| "eval_loss": 0.24490928649902344, | |
| "eval_mean_token_accuracy": 0.931492513989749, | |
| "eval_num_tokens": 298116.0, | |
| "eval_runtime": 96.5333, | |
| "eval_samples_per_second": 0.756, | |
| "eval_steps_per_second": 0.756, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.27692094454541805, | |
| "epoch": 2.50384024577573, | |
| "grad_norm": 0.396484375, | |
| "learning_rate": 1.5610583130854128e-05, | |
| "loss": 0.2804937601089478, | |
| "mean_token_accuracy": 0.922454084455967, | |
| "num_tokens": 305768.0, | |
| "step": 205 | |
| }, | |
| { | |
| "entropy": 0.29743164833635094, | |
| "epoch": 2.565284178187404, | |
| "grad_norm": 0.396484375, | |
| "learning_rate": 1.2188080243301437e-05, | |
| "loss": 0.29574849605560305, | |
| "mean_token_accuracy": 0.9198502600193024, | |
| "num_tokens": 313660.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 0.2640182925388217, | |
| "epoch": 2.6267281105990783, | |
| "grad_norm": 0.49609375, | |
| "learning_rate": 9.164525905680709e-06, | |
| "loss": 0.25743927955627444, | |
| "mean_token_accuracy": 0.9311310544610023, | |
| "num_tokens": 320841.0, | |
| "step": 215 | |
| }, | |
| { | |
| "entropy": 0.27618018090724944, | |
| "epoch": 2.688172043010753, | |
| "grad_norm": 0.51953125, | |
| "learning_rate": 6.553656779506468e-06, | |
| "loss": 0.2789269685745239, | |
| "mean_token_accuracy": 0.9260447949171067, | |
| "num_tokens": 328470.0, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 2.688172043010753, | |
| "eval_entropy": 0.24862186620904975, | |
| "eval_loss": 0.24429786205291748, | |
| "eval_mean_token_accuracy": 0.9314827543415435, | |
| "eval_num_tokens": 328470.0, | |
| "eval_runtime": 93.481, | |
| "eval_samples_per_second": 0.781, | |
| "eval_steps_per_second": 0.781, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 0.2760592779144645, | |
| "epoch": 2.749615975422427, | |
| "grad_norm": 0.40625, | |
| "learning_rate": 4.367334608091389e-06, | |
| "loss": 0.29435703754425047, | |
| "mean_token_accuracy": 0.9220241814851761, | |
| "num_tokens": 336107.0, | |
| "step": 225 | |
| }, | |
| { | |
| "entropy": 0.2630997773259878, | |
| "epoch": 2.8110599078341014, | |
| "grad_norm": 0.466796875, | |
| "learning_rate": 2.6154923260801934e-06, | |
| "loss": 0.2583890914916992, | |
| "mean_token_accuracy": 0.9310009226202964, | |
| "num_tokens": 343384.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 0.28990690847858785, | |
| "epoch": 2.8725038402457757, | |
| "grad_norm": 0.390625, | |
| "learning_rate": 1.3060889319784885e-06, | |
| "loss": 0.2960776090621948, | |
| "mean_token_accuracy": 0.9223004102706909, | |
| "num_tokens": 351180.0, | |
| "step": 235 | |
| }, | |
| { | |
| "entropy": 0.2609599939547479, | |
| "epoch": 2.93394777265745, | |
| "grad_norm": 0.388671875, | |
| "learning_rate": 4.4507332870059594e-07, | |
| "loss": 0.25511951446533204, | |
| "mean_token_accuracy": 0.9273923814296723, | |
| "num_tokens": 359106.0, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 2.93394777265745, | |
| "eval_entropy": 0.24859930197261784, | |
| "eval_loss": 0.24424654245376587, | |
| "eval_mean_token_accuracy": 0.9321725441984934, | |
| "eval_num_tokens": 359106.0, | |
| "eval_runtime": 96.2762, | |
| "eval_samples_per_second": 0.758, | |
| "eval_steps_per_second": 0.758, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 0.2684542080387473, | |
| "epoch": 2.9953917050691246, | |
| "grad_norm": 0.390625, | |
| "learning_rate": 3.635729641654484e-08, | |
| "loss": 0.2732724666595459, | |
| "mean_token_accuracy": 0.9262633189558983, | |
| "num_tokens": 366418.0, | |
| "step": 245 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_entropy": 0.24880487002330284, | |
| "eval_loss": 0.244215190410614, | |
| "eval_mean_token_accuracy": 0.9320176945973749, | |
| "eval_num_tokens": 366954.0, | |
| "eval_runtime": 94.6685, | |
| "eval_samples_per_second": 0.771, | |
| "eval_steps_per_second": 0.771, | |
| "step": 246 | |
| } | |
| ], | |
| "logging_steps": 5, | |
| "max_steps": 246, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 20, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.5578662344763392e+16, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } |