Instructions to use pamohlyakov-work/test-lora with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use pamohlyakov-work/test-lora with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("pamohlyakov-work/GigaChat3.1-10B-A1.8B-bf16") model = PeftModel.from_pretrained(base_model, "pamohlyakov-work/test-lora") - Transformers
How to use pamohlyakov-work/test-lora with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="pamohlyakov-work/test-lora") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("pamohlyakov-work/test-lora", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use pamohlyakov-work/test-lora with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "pamohlyakov-work/test-lora" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "pamohlyakov-work/test-lora", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/pamohlyakov-work/test-lora
- SGLang
How to use pamohlyakov-work/test-lora with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "pamohlyakov-work/test-lora" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "pamohlyakov-work/test-lora", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "pamohlyakov-work/test-lora" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "pamohlyakov-work/test-lora", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use pamohlyakov-work/test-lora with Docker Model Runner:
docker model run hf.co/pamohlyakov-work/test-lora
| { | |
| "best_global_step": 110, | |
| "best_metric": 0.0009438548004254699, | |
| "best_model_checkpoint": "./lora_adapter/checkpoint-110", | |
| "epoch": 3.8177777777777777, | |
| "eval_steps": 10, | |
| "global_step": 110, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0, | |
| "eval_loss": 5.712841987609863, | |
| "eval_runtime": 5.5217, | |
| "eval_samples_per_second": 9.055, | |
| "eval_steps_per_second": 9.055, | |
| "step": 0 | |
| }, | |
| { | |
| "epoch": 0, | |
| "eval_perplexity": 302.7302023645728, | |
| "step": 0 | |
| }, | |
| { | |
| "epoch": 0.035555555555555556, | |
| "grad_norm": 0.3103635609149933, | |
| "learning_rate": 0.0, | |
| "loss": 5.682491779327393, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.07111111111111111, | |
| "grad_norm": 0.4182112216949463, | |
| "learning_rate": 8.333333333333334e-06, | |
| "loss": 6.0904059410095215, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.10666666666666667, | |
| "grad_norm": 0.403287798166275, | |
| "learning_rate": 1.6666666666666667e-05, | |
| "loss": 5.459848403930664, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.14222222222222222, | |
| "grad_norm": 0.4156350791454315, | |
| "learning_rate": 2.5e-05, | |
| "loss": 5.875328063964844, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.17777777777777778, | |
| "grad_norm": 0.35492172837257385, | |
| "learning_rate": 3.3333333333333335e-05, | |
| "loss": 5.3188605308532715, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.21333333333333335, | |
| "grad_norm": 0.3586452007293701, | |
| "learning_rate": 4.166666666666667e-05, | |
| "loss": 5.076211929321289, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.24888888888888888, | |
| "grad_norm": 0.40670934319496155, | |
| "learning_rate": 5e-05, | |
| "loss": 4.494481563568115, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.28444444444444444, | |
| "grad_norm": 0.4478435218334198, | |
| "learning_rate": 5.833333333333334e-05, | |
| "loss": 4.102505207061768, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 0.4579038619995117, | |
| "learning_rate": 6.666666666666667e-05, | |
| "loss": 3.379936695098877, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.35555555555555557, | |
| "grad_norm": 0.38791775703430176, | |
| "learning_rate": 7.500000000000001e-05, | |
| "loss": 2.952427387237549, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.35555555555555557, | |
| "eval_loss": 2.718632221221924, | |
| "eval_runtime": 5.4982, | |
| "eval_samples_per_second": 9.094, | |
| "eval_steps_per_second": 9.094, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.35555555555555557, | |
| "eval_perplexity": 15.15957311568705, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.39111111111111113, | |
| "grad_norm": 0.7142107486724854, | |
| "learning_rate": 8.333333333333334e-05, | |
| "loss": 2.6527280807495117, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.4266666666666667, | |
| "grad_norm": 0.46958744525909424, | |
| "learning_rate": 9.166666666666667e-05, | |
| "loss": 2.0736618041992188, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.4622222222222222, | |
| "grad_norm": 0.46414491534233093, | |
| "learning_rate": 0.0001, | |
| "loss": 1.5400762557983398, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.49777777777777776, | |
| "grad_norm": 0.3608834445476532, | |
| "learning_rate": 9.999490215047167e-05, | |
| "loss": 1.2599258422851562, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.5333333333333333, | |
| "grad_norm": 0.3089125156402588, | |
| "learning_rate": 9.997960964140947e-05, | |
| "loss": 1.0378409624099731, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.5688888888888889, | |
| "grad_norm": 0.23846635222434998, | |
| "learning_rate": 9.995412559116979e-05, | |
| "loss": 0.683804452419281, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.6044444444444445, | |
| "grad_norm": 0.25005361437797546, | |
| "learning_rate": 9.991845519630678e-05, | |
| "loss": 0.6251506805419922, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 0.17282210290431976, | |
| "learning_rate": 9.987260573051269e-05, | |
| "loss": 0.40306615829467773, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.6755555555555556, | |
| "grad_norm": 0.14316385984420776, | |
| "learning_rate": 9.981658654313457e-05, | |
| "loss": 0.36748170852661133, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.7111111111111111, | |
| "grad_norm": 0.09027505666017532, | |
| "learning_rate": 9.975040905726798e-05, | |
| "loss": 0.3596840500831604, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.7111111111111111, | |
| "eval_loss": 0.34836798906326294, | |
| "eval_runtime": 5.5169, | |
| "eval_samples_per_second": 9.063, | |
| "eval_steps_per_second": 9.063, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.7111111111111111, | |
| "eval_perplexity": 1.4167535036209495, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.7466666666666667, | |
| "grad_norm": 0.07985851913690567, | |
| "learning_rate": 9.967408676742751e-05, | |
| "loss": 0.36926567554473877, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.7822222222222223, | |
| "grad_norm": 0.06538072973489761, | |
| "learning_rate": 9.958763523679514e-05, | |
| "loss": 0.3178553879261017, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.8177777777777778, | |
| "grad_norm": 0.05077500641345978, | |
| "learning_rate": 9.949107209404665e-05, | |
| "loss": 0.19684894382953644, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.8533333333333334, | |
| "grad_norm": 0.10189707577228546, | |
| "learning_rate": 9.938441702975689e-05, | |
| "loss": 0.2359190434217453, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.8888888888888888, | |
| "grad_norm": 0.06018666550517082, | |
| "learning_rate": 9.926769179238466e-05, | |
| "loss": 0.24584323167800903, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.9244444444444444, | |
| "grad_norm": 0.05413977429270744, | |
| "learning_rate": 9.914092018383778e-05, | |
| "loss": 0.17237712442874908, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 0.042994916439056396, | |
| "learning_rate": 9.900412805461967e-05, | |
| "loss": 0.15629145503044128, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.9955555555555555, | |
| "grad_norm": 0.0588720478117466, | |
| "learning_rate": 9.885734329855798e-05, | |
| "loss": 0.1863369643688202, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 0.15661829710006714, | |
| "learning_rate": 9.870059584711668e-05, | |
| "loss": 0.2297505885362625, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 1.0355555555555556, | |
| "grad_norm": 0.03409217298030853, | |
| "learning_rate": 9.853391766329263e-05, | |
| "loss": 0.06839371472597122, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 1.0355555555555556, | |
| "eval_loss": 0.0960446149110794, | |
| "eval_runtime": 5.4537, | |
| "eval_samples_per_second": 9.168, | |
| "eval_steps_per_second": 9.168, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 1.0355555555555556, | |
| "eval_perplexity": 1.1008081753572803, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 1.0711111111111111, | |
| "grad_norm": 0.03011409193277359, | |
| "learning_rate": 9.835734273509786e-05, | |
| "loss": 0.07586748898029327, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 1.1066666666666667, | |
| "grad_norm": 0.03701885789632797, | |
| "learning_rate": 9.817090706862895e-05, | |
| "loss": 0.0892762839794159, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 1.1422222222222222, | |
| "grad_norm": 0.03201104328036308, | |
| "learning_rate": 9.797464868072488e-05, | |
| "loss": 0.08438154309988022, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 1.1777777777777778, | |
| "grad_norm": 0.03157950937747955, | |
| "learning_rate": 9.776860759121484e-05, | |
| "loss": 0.04694896563887596, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 1.2133333333333334, | |
| "grad_norm": 0.032276663929224014, | |
| "learning_rate": 9.755282581475769e-05, | |
| "loss": 0.07806245237588882, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 1.248888888888889, | |
| "grad_norm": 0.030301420018076897, | |
| "learning_rate": 9.73273473522745e-05, | |
| "loss": 0.0493946447968483, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 1.2844444444444445, | |
| "grad_norm": 0.027570156380534172, | |
| "learning_rate": 9.709221818197624e-05, | |
| "loss": 0.06280327588319778, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 0.025066696107387543, | |
| "learning_rate": 9.68474862499881e-05, | |
| "loss": 0.05094042792916298, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 1.3555555555555556, | |
| "grad_norm": 0.02456921711564064, | |
| "learning_rate": 9.659320146057262e-05, | |
| "loss": 0.03677443787455559, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 1.3911111111111112, | |
| "grad_norm": 0.02479228563606739, | |
| "learning_rate": 9.632941566595357e-05, | |
| "loss": 0.03535553067922592, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 1.3911111111111112, | |
| "eval_loss": 0.022668220102787018, | |
| "eval_runtime": 5.6373, | |
| "eval_samples_per_second": 8.87, | |
| "eval_steps_per_second": 8.87, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 1.3911111111111112, | |
| "eval_perplexity": 1.022927096593193, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 1.4266666666666667, | |
| "grad_norm": 0.016291167587041855, | |
| "learning_rate": 9.60561826557425e-05, | |
| "loss": 0.019891822710633278, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 1.462222222222222, | |
| "grad_norm": 0.01630846969783306, | |
| "learning_rate": 9.577355814597031e-05, | |
| "loss": 0.023395322263240814, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 1.4977777777777779, | |
| "grad_norm": 0.014682851731777191, | |
| "learning_rate": 9.548159976772592e-05, | |
| "loss": 0.01620781607925892, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 1.5333333333333332, | |
| "grad_norm": 0.004914387129247189, | |
| "learning_rate": 9.518036705540458e-05, | |
| "loss": 0.006628153380006552, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 1.568888888888889, | |
| "grad_norm": 0.005044769961386919, | |
| "learning_rate": 9.486992143456792e-05, | |
| "loss": 0.0069605098105967045, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 1.6044444444444443, | |
| "grad_norm": 0.010346329770982265, | |
| "learning_rate": 9.45503262094184e-05, | |
| "loss": 0.009333918802440166, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 1.6400000000000001, | |
| "grad_norm": 0.005329441279172897, | |
| "learning_rate": 9.422164654989072e-05, | |
| "loss": 0.006601989734917879, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 1.6755555555555555, | |
| "grad_norm": 0.008117754012346268, | |
| "learning_rate": 9.388394947836279e-05, | |
| "loss": 0.006798232439905405, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 1.7111111111111112, | |
| "grad_norm": 0.008304511196911335, | |
| "learning_rate": 9.353730385598887e-05, | |
| "loss": 0.006939806509763002, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 1.7466666666666666, | |
| "grad_norm": 0.005011966452002525, | |
| "learning_rate": 9.318178036865785e-05, | |
| "loss": 0.005817799363285303, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 1.7466666666666666, | |
| "eval_loss": 0.005097925662994385, | |
| "eval_runtime": 5.4641, | |
| "eval_samples_per_second": 9.151, | |
| "eval_steps_per_second": 9.151, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 1.7466666666666666, | |
| "eval_perplexity": 1.0051109421957325, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 1.7822222222222224, | |
| "grad_norm": 0.00494053028523922, | |
| "learning_rate": 9.281745151257946e-05, | |
| "loss": 0.005493980832397938, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 1.8177777777777777, | |
| "grad_norm": 0.003944819793105125, | |
| "learning_rate": 9.244439157950114e-05, | |
| "loss": 0.004002867732197046, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 1.8533333333333335, | |
| "grad_norm": 0.002889649011194706, | |
| "learning_rate": 9.206267664155907e-05, | |
| "loss": 0.00337179284542799, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 1.8888888888888888, | |
| "grad_norm": 0.0023699572775512934, | |
| "learning_rate": 9.167238453576589e-05, | |
| "loss": 0.003095966763794422, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 1.9244444444444444, | |
| "grad_norm": 0.009545288980007172, | |
| "learning_rate": 9.12735948481387e-05, | |
| "loss": 0.005139315500855446, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 0.0045837461948394775, | |
| "learning_rate": 9.086638889747035e-05, | |
| "loss": 0.0036253915168344975, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 1.9955555555555555, | |
| "grad_norm": 0.008223620243370533, | |
| "learning_rate": 9.045084971874738e-05, | |
| "loss": 0.004782550968229771, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 0.005293046589940786, | |
| "learning_rate": 9.002706204621803e-05, | |
| "loss": 0.003609852399677038, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 2.0355555555555553, | |
| "grad_norm": 0.0016866261139512062, | |
| "learning_rate": 8.959511229611376e-05, | |
| "loss": 0.0023398897610604763, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 2.071111111111111, | |
| "grad_norm": 0.0024739305954426527, | |
| "learning_rate": 8.915508854902778e-05, | |
| "loss": 0.0026166446041315794, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 2.071111111111111, | |
| "eval_loss": 0.0024453848600387573, | |
| "eval_runtime": 5.4775, | |
| "eval_samples_per_second": 9.128, | |
| "eval_steps_per_second": 9.128, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 2.071111111111111, | |
| "eval_perplexity": 1.002448377252282, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 2.1066666666666665, | |
| "grad_norm": 0.0023085270076990128, | |
| "learning_rate": 8.870708053195413e-05, | |
| "loss": 0.002390390494838357, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 2.1422222222222222, | |
| "grad_norm": 0.0026797724422067404, | |
| "learning_rate": 8.825117959999116e-05, | |
| "loss": 0.002457966562360525, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 2.1777777777777776, | |
| "grad_norm": 0.0013235695660114288, | |
| "learning_rate": 8.778747871771292e-05, | |
| "loss": 0.0019208687590435147, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 2.2133333333333334, | |
| "grad_norm": 0.0019502972718328238, | |
| "learning_rate": 8.731607244021236e-05, | |
| "loss": 0.0020442644599825144, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 2.2488888888888887, | |
| "grad_norm": 0.0014056526124477386, | |
| "learning_rate": 8.683705689382024e-05, | |
| "loss": 0.0020194968674331903, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 2.2844444444444445, | |
| "grad_norm": 0.0016124699031934142, | |
| "learning_rate": 8.635052975650369e-05, | |
| "loss": 0.001853243331424892, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 2.32, | |
| "grad_norm": 0.0014297482557594776, | |
| "learning_rate": 8.585659023794818e-05, | |
| "loss": 0.002052597003057599, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 2.3555555555555556, | |
| "grad_norm": 0.0011592477094382048, | |
| "learning_rate": 8.535533905932738e-05, | |
| "loss": 0.0016631247708573937, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 2.391111111111111, | |
| "grad_norm": 0.0014637873973697424, | |
| "learning_rate": 8.484687843276469e-05, | |
| "loss": 0.0018859267001971602, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 2.4266666666666667, | |
| "grad_norm": 0.0009684404940344393, | |
| "learning_rate": 8.433131204049067e-05, | |
| "loss": 0.001511464361101389, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 2.4266666666666667, | |
| "eval_loss": 0.0016330081271007657, | |
| "eval_runtime": 5.4569, | |
| "eval_samples_per_second": 9.163, | |
| "eval_steps_per_second": 9.163, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 2.4266666666666667, | |
| "eval_perplexity": 1.0016343422109635, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 2.462222222222222, | |
| "grad_norm": 0.0010153243783861399, | |
| "learning_rate": 8.380874501370097e-05, | |
| "loss": 0.0015972007531672716, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 2.497777777777778, | |
| "grad_norm": 0.0009011203073896468, | |
| "learning_rate": 8.327928391111841e-05, | |
| "loss": 0.0013946370454505086, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 2.533333333333333, | |
| "grad_norm": 0.0009017665288411081, | |
| "learning_rate": 8.274303669726426e-05, | |
| "loss": 0.0014331797137856483, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 2.568888888888889, | |
| "grad_norm": 0.0009415379608981311, | |
| "learning_rate": 8.220011272044277e-05, | |
| "loss": 0.001520266872830689, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 2.6044444444444443, | |
| "grad_norm": 0.0009506358182989061, | |
| "learning_rate": 8.165062269044353e-05, | |
| "loss": 0.001505439169704914, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 2.64, | |
| "grad_norm": 0.0007934041786938906, | |
| "learning_rate": 8.109467865596612e-05, | |
| "loss": 0.0013778579887002707, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 2.6755555555555555, | |
| "grad_norm": 0.0008148634806275368, | |
| "learning_rate": 8.053239398177191e-05, | |
| "loss": 0.001370853278785944, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 2.7111111111111112, | |
| "grad_norm": 0.0006598148611374199, | |
| "learning_rate": 7.996388332556735e-05, | |
| "loss": 0.0011620635632425547, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 2.7466666666666666, | |
| "grad_norm": 0.0008030621684156358, | |
| "learning_rate": 7.938926261462366e-05, | |
| "loss": 0.0012577238958328962, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 2.7822222222222224, | |
| "grad_norm": 0.0008109168848022819, | |
| "learning_rate": 7.880864902213765e-05, | |
| "loss": 0.0013199358945712447, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 2.7822222222222224, | |
| "eval_loss": 0.0013468421529978514, | |
| "eval_runtime": 5.4617, | |
| "eval_samples_per_second": 9.155, | |
| "eval_steps_per_second": 9.155, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 2.7822222222222224, | |
| "eval_perplexity": 1.0013477495522192, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 2.8177777777777777, | |
| "grad_norm": 0.0007556782802566886, | |
| "learning_rate": 7.822216094333847e-05, | |
| "loss": 0.001324485638178885, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 2.8533333333333335, | |
| "grad_norm": 0.0008008314180187881, | |
| "learning_rate": 7.762991797134514e-05, | |
| "loss": 0.0012606465024873614, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 2.888888888888889, | |
| "grad_norm": 0.0007433093851432204, | |
| "learning_rate": 7.703204087277988e-05, | |
| "loss": 0.0012966024223715067, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 2.924444444444444, | |
| "grad_norm": 0.0007187623996287584, | |
| "learning_rate": 7.64286515631421e-05, | |
| "loss": 0.001278804033063352, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 2.96, | |
| "grad_norm": 0.0007242705905809999, | |
| "learning_rate": 7.58198730819481e-05, | |
| "loss": 0.0012370930053293705, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 2.9955555555555557, | |
| "grad_norm": 0.0005744029767811298, | |
| "learning_rate": 7.52058295676416e-05, | |
| "loss": 0.0010438471799716353, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "grad_norm": 0.0008678279700689018, | |
| "learning_rate": 7.45866462322802e-05, | |
| "loss": 0.0009476285194978118, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 3.0355555555555553, | |
| "grad_norm": 0.0006672442541457713, | |
| "learning_rate": 7.396244933600285e-05, | |
| "loss": 0.0011832310119643807, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 3.071111111111111, | |
| "grad_norm": 0.0007027190877124667, | |
| "learning_rate": 7.333336616128369e-05, | |
| "loss": 0.0011928146705031395, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 3.1066666666666665, | |
| "grad_norm": 0.0005659974412992597, | |
| "learning_rate": 7.269952498697734e-05, | |
| "loss": 0.0010046998504549265, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 3.1066666666666665, | |
| "eval_loss": 0.001156785525381565, | |
| "eval_runtime": 5.4591, | |
| "eval_samples_per_second": 9.159, | |
| "eval_steps_per_second": 9.159, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 3.1066666666666665, | |
| "eval_perplexity": 1.0011574548598248, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 3.1422222222222222, | |
| "grad_norm": 0.0007686283788643777, | |
| "learning_rate": 7.206105506216106e-05, | |
| "loss": 0.0012316190404817462, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 3.1777777777777776, | |
| "grad_norm": 0.0007238875259645283, | |
| "learning_rate": 7.141808657977907e-05, | |
| "loss": 0.0012630725977942348, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 3.2133333333333334, | |
| "grad_norm": 0.0005691683618351817, | |
| "learning_rate": 7.077075065009433e-05, | |
| "loss": 0.0010533572640269995, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 3.2488888888888887, | |
| "grad_norm": 0.0005341364885680377, | |
| "learning_rate": 7.01191792739534e-05, | |
| "loss": 0.0009238627390004694, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 3.2844444444444445, | |
| "grad_norm": 0.0006295841885730624, | |
| "learning_rate": 6.946350531586959e-05, | |
| "loss": 0.0011080841068178415, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 3.32, | |
| "grad_norm": 0.000528680335264653, | |
| "learning_rate": 6.880386247692999e-05, | |
| "loss": 0.001002258388325572, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 3.3555555555555556, | |
| "grad_norm": 0.0005391994491219521, | |
| "learning_rate": 6.814038526753205e-05, | |
| "loss": 0.0009756924118846655, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 3.391111111111111, | |
| "grad_norm": 0.0004892258439213037, | |
| "learning_rate": 6.747320897995493e-05, | |
| "loss": 0.0009195349994115531, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 3.4266666666666667, | |
| "grad_norm": 0.0006504295743070543, | |
| "learning_rate": 6.680246966077151e-05, | |
| "loss": 0.0010819350136443973, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 3.462222222222222, | |
| "grad_norm": 0.0005436805658973753, | |
| "learning_rate": 6.61283040831067e-05, | |
| "loss": 0.0010187672451138496, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 3.462222222222222, | |
| "eval_loss": 0.00102730724029243, | |
| "eval_runtime": 5.4639, | |
| "eval_samples_per_second": 9.151, | |
| "eval_steps_per_second": 9.151, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 3.462222222222222, | |
| "eval_perplexity": 1.0010278351011184, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 3.497777777777778, | |
| "grad_norm": 0.0005463913548737764, | |
| "learning_rate": 6.545084971874738e-05, | |
| "loss": 0.0010149093577638268, | |
| "step": 101 | |
| }, | |
| { | |
| "epoch": 3.533333333333333, | |
| "grad_norm": 0.0005039684474468231, | |
| "learning_rate": 6.477024471011001e-05, | |
| "loss": 0.0009072019602172077, | |
| "step": 102 | |
| }, | |
| { | |
| "epoch": 3.568888888888889, | |
| "grad_norm": 0.0005210865056142211, | |
| "learning_rate": 6.408662784207149e-05, | |
| "loss": 0.0009972177213057876, | |
| "step": 103 | |
| }, | |
| { | |
| "epoch": 3.6044444444444443, | |
| "grad_norm": 0.0006203350494615734, | |
| "learning_rate": 6.340013851366896e-05, | |
| "loss": 0.0010793538531288505, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 3.64, | |
| "grad_norm": 0.0004328833019826561, | |
| "learning_rate": 6.271091670967436e-05, | |
| "loss": 0.0008299812907353044, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 3.6755555555555555, | |
| "grad_norm": 0.0004699431301560253, | |
| "learning_rate": 6.201910297204962e-05, | |
| "loss": 0.0008918773382902145, | |
| "step": 106 | |
| }, | |
| { | |
| "epoch": 3.7111111111111112, | |
| "grad_norm": 0.0005212542018853128, | |
| "learning_rate": 6.132483837128823e-05, | |
| "loss": 0.0008914040517993271, | |
| "step": 107 | |
| }, | |
| { | |
| "epoch": 3.7466666666666666, | |
| "grad_norm": 0.000499907648190856, | |
| "learning_rate": 6.062826447764883e-05, | |
| "loss": 0.0009607981191948056, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 3.7822222222222224, | |
| "grad_norm": 0.00046874224790371954, | |
| "learning_rate": 5.992952333228728e-05, | |
| "loss": 0.000899041595403105, | |
| "step": 109 | |
| }, | |
| { | |
| "epoch": 3.8177777777777777, | |
| "grad_norm": 0.00046614641905762255, | |
| "learning_rate": 5.9228757418292266e-05, | |
| "loss": 0.0009188801050186157, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 3.8177777777777777, | |
| "eval_loss": 0.0009438548004254699, | |
| "eval_runtime": 5.47, | |
| "eval_samples_per_second": 9.141, | |
| "eval_steps_per_second": 9.141, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 3.8177777777777777, | |
| "eval_perplexity": 1.0009443003715415, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 3.8177777777777777, | |
| "step": 110, | |
| "total_flos": 1.1595012073517875e+17, | |
| "train_loss": 0.5676066864086103, | |
| "train_runtime": 733.6059, | |
| "train_samples_per_second": 4.907, | |
| "train_steps_per_second": 0.316 | |
| }, | |
| { | |
| "epoch": 3.8177777777777777, | |
| "eval_loss": 0.0009438548004254699, | |
| "eval_runtime": 5.4371, | |
| "eval_samples_per_second": 9.196, | |
| "eval_steps_per_second": 9.196, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 3.8177777777777777, | |
| "eval_perplexity": 1.0009443003715415, | |
| "step": 110 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 232, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 8, | |
| "save_steps": 10, | |
| "stateful_callbacks": { | |
| "EarlyStoppingCallback": { | |
| "args": { | |
| "early_stopping_patience": 5, | |
| "early_stopping_threshold": 0.001 | |
| }, | |
| "attributes": { | |
| "early_stopping_patience_counter": 5 | |
| } | |
| }, | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.1595012073517875e+17, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |