Text Generation
PEFT
Safetensors
English
lora
qlora
sft
trl
text-to-sql
sql
conversational
Eval Results (legacy)
Instructions to use SASVAAI/GLM-4.7-Flash-sql-create-context with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use SASVAAI/GLM-4.7-Flash-sql-create-context with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("zai-org/GLM-4.7-Flash") model = PeftModel.from_pretrained(base_model, "SASVAAI/GLM-4.7-Flash-sql-create-context") - Notebooks
- Google Colab
- Kaggle
Download trainer_state.json from SASVAAI/GLM-4.7-Flash-sql-create-context: direct link, hf CLI and curl.
- Browser
- Download file 21 kB
-
https://huggingface.co/SASVAAI/GLM-4.7-Flash-sql-create-context/resolve/main/trainer_state.json
- Command line
-
hf download hf://SASVAAI/GLM-4.7-Flash-sql-create-context/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/SASVAAI/GLM-4.7-Flash-sql-create-context/resolve/main/trainer_state.json
21 kB
| { | |
| "best_global_step": 675, | |
| "best_metric": 0.5975516438484192, | |
| "best_model_checkpoint": "/home/svadouser1/pooja/llm_autotuning/checkpoints/exp_20260827_221617/checkpoint-675", | |
| "epoch": 3.0, | |
| "eval_steps": 9999, | |
| "global_step": 675, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.461071628332138, | |
| "epoch": 0.044444444444444446, | |
| "grad_norm": 1.6171875, | |
| "learning_rate": 5.294117647058824e-05, | |
| "loss": 2.388203811645508, | |
| "mean_token_accuracy": 0.6123090386390686, | |
| "num_tokens": 19486.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 0.9562640145421029, | |
| "epoch": 0.08888888888888889, | |
| "grad_norm": 0.6875, | |
| "learning_rate": 0.00011176470588235294, | |
| "loss": 1.1077078819274901, | |
| "mean_token_accuracy": 0.8430786401033401, | |
| "num_tokens": 38826.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 0.77465368360281, | |
| "epoch": 0.13333333333333333, | |
| "grad_norm": 0.455078125, | |
| "learning_rate": 0.00017058823529411766, | |
| "loss": 0.8623821258544921, | |
| "mean_token_accuracy": 0.864073084294796, | |
| "num_tokens": 58244.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.7483784720301628, | |
| "epoch": 0.17777777777777778, | |
| "grad_norm": 0.423828125, | |
| "learning_rate": 0.00019996997576394573, | |
| "loss": 0.7713714599609375, | |
| "mean_token_accuracy": 0.8697837173938752, | |
| "num_tokens": 77711.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.7391687169671058, | |
| "epoch": 0.2222222222222222, | |
| "grad_norm": 0.376953125, | |
| "learning_rate": 0.00019972989003925543, | |
| "loss": 0.7115508556365967, | |
| "mean_token_accuracy": 0.8751530349254608, | |
| "num_tokens": 97104.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.7042164742946625, | |
| "epoch": 0.26666666666666666, | |
| "grad_norm": 0.330078125, | |
| "learning_rate": 0.00019925029517454195, | |
| "loss": 0.6672511577606202, | |
| "mean_token_accuracy": 0.8725973218679428, | |
| "num_tokens": 116498.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 0.6745826601982117, | |
| "epoch": 0.3111111111111111, | |
| "grad_norm": 0.361328125, | |
| "learning_rate": 0.00019853234295442638, | |
| "loss": 0.6365277290344238, | |
| "mean_token_accuracy": 0.872233435511589, | |
| "num_tokens": 136089.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 0.6878040120005607, | |
| "epoch": 0.35555555555555557, | |
| "grad_norm": 0.37109375, | |
| "learning_rate": 0.00019757775759738272, | |
| "loss": 0.6395976066589355, | |
| "mean_token_accuracy": 0.8741081401705741, | |
| "num_tokens": 155486.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 0.6898319900035859, | |
| "epoch": 0.4, | |
| "grad_norm": 0.330078125, | |
| "learning_rate": 0.00019638883161489224, | |
| "loss": 0.6368544578552247, | |
| "mean_token_accuracy": 0.8765213042497635, | |
| "num_tokens": 175116.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 0.656438185274601, | |
| "epoch": 0.4444444444444444, | |
| "grad_norm": 0.33203125, | |
| "learning_rate": 0.0001949684203057978, | |
| "loss": 0.6183670043945313, | |
| "mean_token_accuracy": 0.8779006212949753, | |
| "num_tokens": 194495.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.6711793914437294, | |
| "epoch": 0.4888888888888889, | |
| "grad_norm": 0.388671875, | |
| "learning_rate": 0.00019331993489907977, | |
| "loss": 0.633416748046875, | |
| "mean_token_accuracy": 0.8727847129106522, | |
| "num_tokens": 214311.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 0.6290019288659096, | |
| "epoch": 0.5333333333333333, | |
| "grad_norm": 0.33203125, | |
| "learning_rate": 0.00019144733436152284, | |
| "loss": 0.5889303684234619, | |
| "mean_token_accuracy": 0.8814716726541519, | |
| "num_tokens": 233676.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 0.6458568304777146, | |
| "epoch": 0.5777777777777777, | |
| "grad_norm": 0.318359375, | |
| "learning_rate": 0.00018935511588994715, | |
| "loss": 0.6043062686920166, | |
| "mean_token_accuracy": 0.8794952735304833, | |
| "num_tokens": 253188.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 0.6591948792338371, | |
| "epoch": 0.6222222222222222, | |
| "grad_norm": 0.32421875, | |
| "learning_rate": 0.000187048304110838, | |
| "loss": 0.6233312129974365, | |
| "mean_token_accuracy": 0.873698017001152, | |
| "num_tokens": 273185.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 0.6109217047691345, | |
| "epoch": 0.6666666666666666, | |
| "grad_norm": 0.291015625, | |
| "learning_rate": 0.00018453243901331195, | |
| "loss": 0.5925732135772706, | |
| "mean_token_accuracy": 0.884858050942421, | |
| "num_tokens": 292431.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.6377103522419929, | |
| "epoch": 0.7111111111111111, | |
| "grad_norm": 0.3671875, | |
| "learning_rate": 0.00018181356264439905, | |
| "loss": 0.5884737968444824, | |
| "mean_token_accuracy": 0.8802034169435501, | |
| "num_tokens": 311687.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 0.6447647094726563, | |
| "epoch": 0.7555555555555555, | |
| "grad_norm": 0.3046875, | |
| "learning_rate": 0.0001788982045985939, | |
| "loss": 0.5939778327941895, | |
| "mean_token_accuracy": 0.8817022785544395, | |
| "num_tokens": 330813.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.6029744669795036, | |
| "epoch": 0.8, | |
| "grad_norm": 0.3125, | |
| "learning_rate": 0.00017579336633652317, | |
| "loss": 0.5752908706665039, | |
| "mean_token_accuracy": 0.8855120778083801, | |
| "num_tokens": 350308.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 0.6441277623176574, | |
| "epoch": 0.8444444444444444, | |
| "grad_norm": 0.259765625, | |
| "learning_rate": 0.00017250650437038964, | |
| "loss": 0.5958236217498779, | |
| "mean_token_accuracy": 0.8808144956827164, | |
| "num_tokens": 370083.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 0.5766214028000831, | |
| "epoch": 0.8888888888888888, | |
| "grad_norm": 0.2734375, | |
| "learning_rate": 0.0001690455123565743, | |
| "loss": 0.5667627811431885, | |
| "mean_token_accuracy": 0.8866458177566529, | |
| "num_tokens": 389516.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.6425503984093666, | |
| "epoch": 0.9333333333333333, | |
| "grad_norm": 0.3046875, | |
| "learning_rate": 0.00016541870213840243, | |
| "loss": 0.6137699127197266, | |
| "mean_token_accuracy": 0.8819929376244545, | |
| "num_tokens": 408940.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 0.6159977808594703, | |
| "epoch": 0.9777777777777777, | |
| "grad_norm": 0.265625, | |
| "learning_rate": 0.0001616347837846011, | |
| "loss": 0.5788507461547852, | |
| "mean_token_accuracy": 0.8852896198630333, | |
| "num_tokens": 428166.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 0.6020576372742653, | |
| "epoch": 1.0222222222222221, | |
| "grad_norm": 0.2353515625, | |
| "learning_rate": 0.000157702844671387, | |
| "loss": 0.5500371932983399, | |
| "mean_token_accuracy": 0.8901642486453056, | |
| "num_tokens": 447438.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 0.5630205765366554, | |
| "epoch": 1.0666666666666667, | |
| "grad_norm": 0.275390625, | |
| "learning_rate": 0.00015363232765842089, | |
| "loss": 0.5382141590118408, | |
| "mean_token_accuracy": 0.8885036528110504, | |
| "num_tokens": 467009.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 0.5631943918764591, | |
| "epoch": 1.1111111111111112, | |
| "grad_norm": 0.306640625, | |
| "learning_rate": 0.00014943300841104094, | |
| "loss": 0.5194426536560058, | |
| "mean_token_accuracy": 0.8929360061883926, | |
| "num_tokens": 486591.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 0.5655099518597126, | |
| "epoch": 1.1555555555555554, | |
| "grad_norm": 0.259765625, | |
| "learning_rate": 0.0001451149719232366, | |
| "loss": 0.5290531158447266, | |
| "mean_token_accuracy": 0.8912677451968193, | |
| "num_tokens": 506180.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 0.5660845704376698, | |
| "epoch": 1.2, | |
| "grad_norm": 0.326171875, | |
| "learning_rate": 0.00014068858829774608, | |
| "loss": 0.5366004943847656, | |
| "mean_token_accuracy": 0.8909024119377136, | |
| "num_tokens": 525696.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 0.5818345256149768, | |
| "epoch": 1.2444444444444445, | |
| "grad_norm": 0.26171875, | |
| "learning_rate": 0.0001361644878414428, | |
| "loss": 0.5424720764160156, | |
| "mean_token_accuracy": 0.8896975666284561, | |
| "num_tokens": 545392.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 0.5546154774725437, | |
| "epoch": 1.2888888888888888, | |
| "grad_norm": 0.3359375, | |
| "learning_rate": 0.00013155353553582057, | |
| "loss": 0.5176132202148438, | |
| "mean_token_accuracy": 0.8928953528404235, | |
| "num_tokens": 565036.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 0.5676225990056991, | |
| "epoch": 1.3333333333333333, | |
| "grad_norm": 0.275390625, | |
| "learning_rate": 0.0001268668049438902, | |
| "loss": 0.5130613803863525, | |
| "mean_token_accuracy": 0.8928169339895249, | |
| "num_tokens": 584507.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 0.5529272347688675, | |
| "epoch": 1.3777777777777778, | |
| "grad_norm": 0.326171875, | |
| "learning_rate": 0.0001221155516161506, | |
| "loss": 0.5317890644073486, | |
| "mean_token_accuracy": 0.8913554430007935, | |
| "num_tokens": 604008.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 0.5658974438905716, | |
| "epoch": 1.4222222222222223, | |
| "grad_norm": 0.26953125, | |
| "learning_rate": 0.0001173111860595032, | |
| "loss": 0.5273444652557373, | |
| "mean_token_accuracy": 0.8927861481904984, | |
| "num_tokens": 623480.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 0.5697685681283474, | |
| "epoch": 1.4666666666666668, | |
| "grad_norm": 0.322265625, | |
| "learning_rate": 0.00011246524633402573, | |
| "loss": 0.5287697792053223, | |
| "mean_token_accuracy": 0.8912984907627106, | |
| "num_tokens": 642979.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 0.5488456651568413, | |
| "epoch": 1.511111111111111, | |
| "grad_norm": 0.326171875, | |
| "learning_rate": 0.00010758937034341787, | |
| "loss": 0.513739824295044, | |
| "mean_token_accuracy": 0.8952319726347924, | |
| "num_tokens": 662396.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 0.55315260887146, | |
| "epoch": 1.5555555555555556, | |
| "grad_norm": 0.26953125, | |
| "learning_rate": 0.00010269526788566408, | |
| "loss": 0.5225533485412598, | |
| "mean_token_accuracy": 0.8937178790569306, | |
| "num_tokens": 681644.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 0.5738558314740658, | |
| "epoch": 1.6, | |
| "grad_norm": 0.29296875, | |
| "learning_rate": 9.779469253103684e-05, | |
| "loss": 0.5239317417144775, | |
| "mean_token_accuracy": 0.8908430561423302, | |
| "num_tokens": 701030.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 0.5420261971652508, | |
| "epoch": 1.6444444444444444, | |
| "grad_norm": 0.259765625, | |
| "learning_rate": 9.289941339497719e-05, | |
| "loss": 0.5274893283843994, | |
| "mean_token_accuracy": 0.8941561266779899, | |
| "num_tokens": 720294.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 0.577882957458496, | |
| "epoch": 1.6888888888888889, | |
| "grad_norm": 0.33203125, | |
| "learning_rate": 8.802118687364284e-05, | |
| "loss": 0.5202207088470459, | |
| "mean_token_accuracy": 0.8931182771921158, | |
| "num_tokens": 739607.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 0.5461296208202839, | |
| "epoch": 1.7333333333333334, | |
| "grad_norm": 0.30859375, | |
| "learning_rate": 8.317172841000173e-05, | |
| "loss": 0.5105932235717774, | |
| "mean_token_accuracy": 0.8917569547891617, | |
| "num_tokens": 759370.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 0.5631573006510735, | |
| "epoch": 1.7777777777777777, | |
| "grad_norm": 0.298828125, | |
| "learning_rate": 7.836268435827875e-05, | |
| "loss": 0.5263056755065918, | |
| "mean_token_accuracy": 0.8906426534056664, | |
| "num_tokens": 778969.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 0.5476421102881431, | |
| "epoch": 1.8222222222222222, | |
| "grad_norm": 0.255859375, | |
| "learning_rate": 7.360560401432401e-05, | |
| "loss": 0.5025547504425049, | |
| "mean_token_accuracy": 0.8946620702743531, | |
| "num_tokens": 798105.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 0.5343898519873619, | |
| "epoch": 1.8666666666666667, | |
| "grad_norm": 0.27734375, | |
| "learning_rate": 6.891191187907455e-05, | |
| "loss": 0.49821176528930666, | |
| "mean_token_accuracy": 0.8958980679512024, | |
| "num_tokens": 817238.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 0.5404686734080315, | |
| "epoch": 1.911111111111111, | |
| "grad_norm": 0.296875, | |
| "learning_rate": 6.429288022172068e-05, | |
| "loss": 0.5022043704986572, | |
| "mean_token_accuracy": 0.8958747044205666, | |
| "num_tokens": 836646.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 0.5426375091075897, | |
| "epoch": 1.9555555555555557, | |
| "grad_norm": 0.279296875, | |
| "learning_rate": 5.9759602008468996e-05, | |
| "loss": 0.5035938262939453, | |
| "mean_token_accuracy": 0.8944751426577568, | |
| "num_tokens": 856282.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 0.5425564736127854, | |
| "epoch": 2.0, | |
| "grad_norm": 0.263671875, | |
| "learning_rate": 5.532296426191539e-05, | |
| "loss": 0.5004886627197266, | |
| "mean_token_accuracy": 0.8947419315576554, | |
| "num_tokens": 875656.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 0.526330380141735, | |
| "epoch": 2.0444444444444443, | |
| "grad_norm": 0.279296875, | |
| "learning_rate": 5.0993621915007785e-05, | |
| "loss": 0.44887552261352537, | |
| "mean_token_accuracy": 0.9024429768323898, | |
| "num_tokens": 894973.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 0.4774711772799492, | |
| "epoch": 2.088888888888889, | |
| "grad_norm": 0.365234375, | |
| "learning_rate": 4.678197222239035e-05, | |
| "loss": 0.44640169143676756, | |
| "mean_token_accuracy": 0.9045588001608849, | |
| "num_tokens": 914579.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 0.4789727419614792, | |
| "epoch": 2.1333333333333333, | |
| "grad_norm": 0.3828125, | |
| "learning_rate": 4.269812979058235e-05, | |
| "loss": 0.44276885986328124, | |
| "mean_token_accuracy": 0.9066318318247795, | |
| "num_tokens": 933807.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 0.47537712305784224, | |
| "epoch": 2.1777777777777776, | |
| "grad_norm": 0.359375, | |
| "learning_rate": 3.875190228695862e-05, | |
| "loss": 0.4367781639099121, | |
| "mean_token_accuracy": 0.9070042923092843, | |
| "num_tokens": 953241.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 0.4877164676785469, | |
| "epoch": 2.2222222222222223, | |
| "grad_norm": 0.328125, | |
| "learning_rate": 3.4952766885868346e-05, | |
| "loss": 0.4422135353088379, | |
| "mean_token_accuracy": 0.905805604159832, | |
| "num_tokens": 972758.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 0.4915403999388218, | |
| "epoch": 2.2666666666666666, | |
| "grad_norm": 0.376953125, | |
| "learning_rate": 3.130984750845885e-05, | |
| "loss": 0.4357293128967285, | |
| "mean_token_accuracy": 0.9067289993166924, | |
| "num_tokens": 992534.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 0.4957615494728088, | |
| "epoch": 2.311111111111111, | |
| "grad_norm": 0.33984375, | |
| "learning_rate": 2.7831892910864434e-05, | |
| "loss": 0.44167218208312986, | |
| "mean_token_accuracy": 0.9066730305552483, | |
| "num_tokens": 1012003.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 0.48269262462854384, | |
| "epoch": 2.3555555555555556, | |
| "grad_norm": 0.375, | |
| "learning_rate": 2.4527255673383565e-05, | |
| "loss": 0.437894344329834, | |
| "mean_token_accuracy": 0.904815036058426, | |
| "num_tokens": 1031505.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 0.47741171419620515, | |
| "epoch": 2.4, | |
| "grad_norm": 0.4140625, | |
| "learning_rate": 2.140387214110322e-05, | |
| "loss": 0.4400351047515869, | |
| "mean_token_accuracy": 0.9068154886364936, | |
| "num_tokens": 1050914.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 0.4727069653570652, | |
| "epoch": 2.4444444444444446, | |
| "grad_norm": 0.35546875, | |
| "learning_rate": 1.846924336414474e-05, | |
| "loss": 0.43111190795898435, | |
| "mean_token_accuracy": 0.9075597256422043, | |
| "num_tokens": 1070218.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 0.4883471392095089, | |
| "epoch": 2.488888888888889, | |
| "grad_norm": 0.314453125, | |
| "learning_rate": 1.5730417083304573e-05, | |
| "loss": 0.4493571758270264, | |
| "mean_token_accuracy": 0.9073263511061669, | |
| "num_tokens": 1089667.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 0.4878625735640526, | |
| "epoch": 2.533333333333333, | |
| "grad_norm": 0.375, | |
| "learning_rate": 1.3193970804352952e-05, | |
| "loss": 0.44793548583984377, | |
| "mean_token_accuracy": 0.9050837978720665, | |
| "num_tokens": 1109201.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 0.48537297546863556, | |
| "epoch": 2.5777777777777775, | |
| "grad_norm": 0.337890625, | |
| "learning_rate": 1.08659960016387e-05, | |
| "loss": 0.4368610382080078, | |
| "mean_token_accuracy": 0.9097044110298157, | |
| "num_tokens": 1128649.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 0.4859867602586746, | |
| "epoch": 2.6222222222222222, | |
| "grad_norm": 0.328125, | |
| "learning_rate": 8.75208348893667e-06, | |
| "loss": 0.4249687194824219, | |
| "mean_token_accuracy": 0.9087634190917016, | |
| "num_tokens": 1148353.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 0.4833585321903229, | |
| "epoch": 2.6666666666666665, | |
| "grad_norm": 0.3828125, | |
| "learning_rate": 6.857309992670624e-06, | |
| "loss": 0.4455591678619385, | |
| "mean_token_accuracy": 0.9075253725051879, | |
| "num_tokens": 1167638.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 0.4794360339641571, | |
| "epoch": 2.7111111111111112, | |
| "grad_norm": 0.3203125, | |
| "learning_rate": 5.186225959757207e-06, | |
| "loss": 0.43627562522888186, | |
| "mean_token_accuracy": 0.907138803601265, | |
| "num_tokens": 1186894.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 0.4800324112176895, | |
| "epoch": 2.7555555555555555, | |
| "grad_norm": 0.365234375, | |
| "learning_rate": 3.7428446293514386e-06, | |
| "loss": 0.42800016403198243, | |
| "mean_token_accuracy": 0.9089159920811654, | |
| "num_tokens": 1206224.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 0.48999542444944383, | |
| "epoch": 2.8, | |
| "grad_norm": 0.31640625, | |
| "learning_rate": 2.5306323947385746e-06, | |
| "loss": 0.44663453102111816, | |
| "mean_token_accuracy": 0.9060632780194282, | |
| "num_tokens": 1225569.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 0.4874999448657036, | |
| "epoch": 2.8444444444444446, | |
| "grad_norm": 0.326171875, | |
| "learning_rate": 1.5525004785192143e-06, | |
| "loss": 0.44841961860656737, | |
| "mean_token_accuracy": 0.9045136958360672, | |
| "num_tokens": 1244959.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 0.49936808943748473, | |
| "epoch": 2.888888888888889, | |
| "grad_norm": 0.4296875, | |
| "learning_rate": 8.107979410802769e-07, | |
| "loss": 0.4453989028930664, | |
| "mean_token_accuracy": 0.9050952970981598, | |
| "num_tokens": 1264904.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 0.49325661584734914, | |
| "epoch": 2.9333333333333336, | |
| "grad_norm": 0.373046875, | |
| "learning_rate": 3.0730603914255193e-07, | |
| "loss": 0.44756379127502444, | |
| "mean_token_accuracy": 0.9043820068240166, | |
| "num_tokens": 1284311.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 0.5068465434014797, | |
| "epoch": 2.977777777777778, | |
| "grad_norm": 0.373046875, | |
| "learning_rate": 4.323394793315228e-08, | |
| "loss": 0.4593667030334473, | |
| "mean_token_accuracy": 0.9011617928743363, | |
| "num_tokens": 1303914.0, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_entropy": 0.5207519015669823, | |
| "eval_loss": 0.5975516438484192, | |
| "eval_mean_token_accuracy": 0.8822531878948212, | |
| "eval_num_tokens": 1313484.0, | |
| "eval_runtime": 57.0793, | |
| "eval_samples_per_second": 7.008, | |
| "eval_steps_per_second": 1.752, | |
| "step": 675 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "step": 675, | |
| "total_flos": 2.3441226939026637e+17, | |
| "train_loss": 0.5646523337894016, | |
| "train_runtime": 6392.6844, | |
| "train_samples_per_second": 1.689, | |
| "train_steps_per_second": 0.106 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 675, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 9999, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.3441226939026637e+17, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |