Text Generation
Transformers
TensorBoard
Safetensors
qwen3
llama-factory
full
Generated from Trainer
conversational
text-generation-inference
Instructions to use lldois/v15_user_logic_json_lr15e6 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use lldois/v15_user_logic_json_lr15e6 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="lldois/v15_user_logic_json_lr15e6") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("lldois/v15_user_logic_json_lr15e6") model = AutoModelForCausalLM.from_pretrained("lldois/v15_user_logic_json_lr15e6", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use lldois/v15_user_logic_json_lr15e6 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "lldois/v15_user_logic_json_lr15e6" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "lldois/v15_user_logic_json_lr15e6", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/lldois/v15_user_logic_json_lr15e6
- SGLang
How to use lldois/v15_user_logic_json_lr15e6 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "lldois/v15_user_logic_json_lr15e6" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "lldois/v15_user_logic_json_lr15e6", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "lldois/v15_user_logic_json_lr15e6" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "lldois/v15_user_logic_json_lr15e6", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use lldois/v15_user_logic_json_lr15e6 with Docker Model Runner:
docker model run hf.co/lldois/v15_user_logic_json_lr15e6
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.0, | |
| "eval_steps": 500, | |
| "global_step": 867, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.005768676088837612, | |
| "grad_norm": 45.75, | |
| "learning_rate": 2.222222222222222e-06, | |
| "loss": 2.812992477416992, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.011537352177675224, | |
| "grad_norm": 19.625, | |
| "learning_rate": 4.9999999999999996e-06, | |
| "loss": 2.6157678604125976, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.017306028266512834, | |
| "grad_norm": 10.0, | |
| "learning_rate": 7.777777777777777e-06, | |
| "loss": 2.550214958190918, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.02307470435535045, | |
| "grad_norm": 6.5625, | |
| "learning_rate": 1.0555555555555555e-05, | |
| "loss": 2.2421979904174805, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.02884338044418806, | |
| "grad_norm": 12.125, | |
| "learning_rate": 1.3333333333333333e-05, | |
| "loss": 2.3474178314208984, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.03461205653302567, | |
| "grad_norm": 3.703125, | |
| "learning_rate": 1.4999790187959524e-05, | |
| "loss": 2.0521663665771483, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.040380732621863286, | |
| "grad_norm": 3.09375, | |
| "learning_rate": 1.4997429937316679e-05, | |
| "loss": 1.9066032409667968, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.0461494087107009, | |
| "grad_norm": 3.34375, | |
| "learning_rate": 1.4992447999059861e-05, | |
| "loss": 1.8443662643432617, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.05191808479953851, | |
| "grad_norm": 4.125, | |
| "learning_rate": 1.498484611526414e-05, | |
| "loss": 1.8280458450317383, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.05768676088837612, | |
| "grad_norm": 3.234375, | |
| "learning_rate": 1.4974626944142366e-05, | |
| "loss": 1.743063735961914, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.06345543697721373, | |
| "grad_norm": 4.4375, | |
| "learning_rate": 1.4961794059115642e-05, | |
| "loss": 1.6797224044799806, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 0.06922411306605133, | |
| "grad_norm": 3.078125, | |
| "learning_rate": 1.494635194756378e-05, | |
| "loss": 1.687392807006836, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.07499278915488895, | |
| "grad_norm": 2.59375, | |
| "learning_rate": 1.4928306009256156e-05, | |
| "loss": 1.6969615936279296, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 0.08076146524372657, | |
| "grad_norm": 2.453125, | |
| "learning_rate": 1.4907662554463534e-05, | |
| "loss": 1.7176189422607422, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.08653014133256418, | |
| "grad_norm": 4.5625, | |
| "learning_rate": 1.4884428801751502e-05, | |
| "loss": 1.5526809692382812, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.0922988174214018, | |
| "grad_norm": 3.796875, | |
| "learning_rate": 1.4858612875456295e-05, | |
| "loss": 1.623830795288086, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.0980674935102394, | |
| "grad_norm": 2.984375, | |
| "learning_rate": 1.4830223802843894e-05, | |
| "loss": 1.6493770599365234, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 0.10383616959907702, | |
| "grad_norm": 3.46875, | |
| "learning_rate": 1.4799271510953386e-05, | |
| "loss": 1.6132541656494142, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.10960484568791462, | |
| "grad_norm": 5.0625, | |
| "learning_rate": 1.4765766823125695e-05, | |
| "loss": 1.7179641723632812, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 0.11537352177675224, | |
| "grad_norm": 2.46875, | |
| "learning_rate": 1.4729721455218899e-05, | |
| "loss": 1.5699467658996582, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.12114219786558984, | |
| "grad_norm": 4.03125, | |
| "learning_rate": 1.4691148011511447e-05, | |
| "loss": 1.5707356452941894, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 0.12691087395442746, | |
| "grad_norm": 2.671875, | |
| "learning_rate": 1.465005998029472e-05, | |
| "loss": 1.581485652923584, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.13267955004326507, | |
| "grad_norm": 4.0, | |
| "learning_rate": 1.4606471729156468e-05, | |
| "loss": 1.4936203956604004, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 0.13844822613210267, | |
| "grad_norm": 2.640625, | |
| "learning_rate": 1.4560398499956776e-05, | |
| "loss": 1.5083925247192382, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.1442169022209403, | |
| "grad_norm": 2.3125, | |
| "learning_rate": 1.4511856403498324e-05, | |
| "loss": 1.4727232933044434, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 0.1499855783097779, | |
| "grad_norm": 3.65625, | |
| "learning_rate": 1.4460862413892792e-05, | |
| "loss": 1.5390252113342284, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.1557542543986155, | |
| "grad_norm": 2.671875, | |
| "learning_rate": 1.4407434362625376e-05, | |
| "loss": 1.5905132293701172, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 0.16152293048745314, | |
| "grad_norm": 3.375, | |
| "learning_rate": 1.4351590932319506e-05, | |
| "loss": 1.5457244873046876, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.16729160657629075, | |
| "grad_norm": 3.4375, | |
| "learning_rate": 1.4293351650203956e-05, | |
| "loss": 1.5160816192626954, | |
| "step": 145 | |
| }, | |
| { | |
| "epoch": 0.17306028266512835, | |
| "grad_norm": 2.5625, | |
| "learning_rate": 1.4232736881284576e-05, | |
| "loss": 1.5460505485534668, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.17882895875396596, | |
| "grad_norm": 2.734375, | |
| "learning_rate": 1.416976782122311e-05, | |
| "loss": 1.4950276374816895, | |
| "step": 155 | |
| }, | |
| { | |
| "epoch": 0.1845976348428036, | |
| "grad_norm": 4.25, | |
| "learning_rate": 1.4104466488925536e-05, | |
| "loss": 1.4827272415161132, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.1903663109316412, | |
| "grad_norm": 2.859375, | |
| "learning_rate": 1.4036855718842518e-05, | |
| "loss": 1.585806179046631, | |
| "step": 165 | |
| }, | |
| { | |
| "epoch": 0.1961349870204788, | |
| "grad_norm": 3.734375, | |
| "learning_rate": 1.396695915298472e-05, | |
| "loss": 1.4454821586608886, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.2019036631093164, | |
| "grad_norm": 2.5, | |
| "learning_rate": 1.3894801232655692e-05, | |
| "loss": 1.5184972763061524, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 0.20767233919815403, | |
| "grad_norm": 2.5625, | |
| "learning_rate": 1.3820407189905295e-05, | |
| "loss": 1.4702855110168458, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.21344101528699164, | |
| "grad_norm": 4.25, | |
| "learning_rate": 1.3743803038706587e-05, | |
| "loss": 1.4560264587402343, | |
| "step": 185 | |
| }, | |
| { | |
| "epoch": 0.21920969137582924, | |
| "grad_norm": 4.71875, | |
| "learning_rate": 1.3665015565859325e-05, | |
| "loss": 1.4439519882202148, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.22497836746466685, | |
| "grad_norm": 3.640625, | |
| "learning_rate": 1.3584072321623183e-05, | |
| "loss": 1.3752272605895997, | |
| "step": 195 | |
| }, | |
| { | |
| "epoch": 0.23074704355350448, | |
| "grad_norm": 4.8125, | |
| "learning_rate": 1.3501001610084048e-05, | |
| "loss": 1.5652609825134278, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.23651571964234208, | |
| "grad_norm": 2.859375, | |
| "learning_rate": 1.3415832479256685e-05, | |
| "loss": 1.4904936790466308, | |
| "step": 205 | |
| }, | |
| { | |
| "epoch": 0.24228439573117969, | |
| "grad_norm": 3.859375, | |
| "learning_rate": 1.3328594710927282e-05, | |
| "loss": 1.4062389373779296, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.24805307182001732, | |
| "grad_norm": 3.09375, | |
| "learning_rate": 1.3239318810239423e-05, | |
| "loss": 1.5080370903015137, | |
| "step": 215 | |
| }, | |
| { | |
| "epoch": 0.2538217479088549, | |
| "grad_norm": 4.0625, | |
| "learning_rate": 1.3148035995027083e-05, | |
| "loss": 1.403939914703369, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.25959042399769255, | |
| "grad_norm": 2.453125, | |
| "learning_rate": 1.3054778184898452e-05, | |
| "loss": 1.460791778564453, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 0.26535910008653013, | |
| "grad_norm": 3.234375, | |
| "learning_rate": 1.2959577990074333e-05, | |
| "loss": 1.4795469284057616, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.27112777617536776, | |
| "grad_norm": 3.8125, | |
| "learning_rate": 1.2862468699985066e-05, | |
| "loss": 1.4639040946960449, | |
| "step": 235 | |
| }, | |
| { | |
| "epoch": 0.27689645226420534, | |
| "grad_norm": 2.890625, | |
| "learning_rate": 1.2763484271629938e-05, | |
| "loss": 1.4583266258239747, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.28266512835304297, | |
| "grad_norm": 3.125, | |
| "learning_rate": 1.2662659317703154e-05, | |
| "loss": 1.4482952117919923, | |
| "step": 245 | |
| }, | |
| { | |
| "epoch": 0.2884338044418806, | |
| "grad_norm": 3.15625, | |
| "learning_rate": 1.256002909449056e-05, | |
| "loss": 1.4816177368164063, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.2942024805307182, | |
| "grad_norm": 3.09375, | |
| "learning_rate": 1.2455629489541248e-05, | |
| "loss": 1.6563011169433595, | |
| "step": 255 | |
| }, | |
| { | |
| "epoch": 0.2999711566195558, | |
| "grad_norm": 3.5, | |
| "learning_rate": 1.2349497009118497e-05, | |
| "loss": 1.45164794921875, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.30573983270839344, | |
| "grad_norm": 2.3125, | |
| "learning_rate": 1.2241668765434324e-05, | |
| "loss": 1.5071072578430176, | |
| "step": 265 | |
| }, | |
| { | |
| "epoch": 0.311508508797231, | |
| "grad_norm": 3.0, | |
| "learning_rate": 1.2132182463672135e-05, | |
| "loss": 1.4920737266540527, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.31727718488606865, | |
| "grad_norm": 2.703125, | |
| "learning_rate": 1.2021076388802062e-05, | |
| "loss": 1.4359200477600098, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 0.3230458609749063, | |
| "grad_norm": 3.96875, | |
| "learning_rate": 1.1908389392193549e-05, | |
| "loss": 1.4329303741455077, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.32881453706374386, | |
| "grad_norm": 3.453125, | |
| "learning_rate": 1.1794160878029856e-05, | |
| "loss": 1.3877481460571288, | |
| "step": 285 | |
| }, | |
| { | |
| "epoch": 0.3345832131525815, | |
| "grad_norm": 2.40625, | |
| "learning_rate": 1.1678430789529292e-05, | |
| "loss": 1.4761417388916016, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.34035188924141907, | |
| "grad_norm": 3.46875, | |
| "learning_rate": 1.1561239594977943e-05, | |
| "loss": 1.5856515884399414, | |
| "step": 295 | |
| }, | |
| { | |
| "epoch": 0.3461205653302567, | |
| "grad_norm": 3.015625, | |
| "learning_rate": 1.1442628273578785e-05, | |
| "loss": 1.3921869277954102, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.35188924141909433, | |
| "grad_norm": 2.6875, | |
| "learning_rate": 1.1322638301122164e-05, | |
| "loss": 1.3925346374511718, | |
| "step": 305 | |
| }, | |
| { | |
| "epoch": 0.3576579175079319, | |
| "grad_norm": 2.96875, | |
| "learning_rate": 1.1201311635482602e-05, | |
| "loss": 1.3757241249084473, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.36342659359676954, | |
| "grad_norm": 3.203125, | |
| "learning_rate": 1.1078690701947063e-05, | |
| "loss": 1.4508034706115722, | |
| "step": 315 | |
| }, | |
| { | |
| "epoch": 0.3691952696856072, | |
| "grad_norm": 2.546875, | |
| "learning_rate": 1.0954818378379743e-05, | |
| "loss": 1.4826339721679687, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.37496394577444475, | |
| "grad_norm": 3.0, | |
| "learning_rate": 1.0829737980228618e-05, | |
| "loss": 1.41096773147583, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 0.3807326218632824, | |
| "grad_norm": 2.78125, | |
| "learning_rate": 1.0703493245378976e-05, | |
| "loss": 1.502821445465088, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.38650129795212, | |
| "grad_norm": 2.8125, | |
| "learning_rate": 1.0576128318859246e-05, | |
| "loss": 1.3927604675292968, | |
| "step": 335 | |
| }, | |
| { | |
| "epoch": 0.3922699740409576, | |
| "grad_norm": 3.625, | |
| "learning_rate": 1.0447687737404428e-05, | |
| "loss": 1.3787881851196289, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.3980386501297952, | |
| "grad_norm": 3.1875, | |
| "learning_rate": 1.0318216413882576e-05, | |
| "loss": 1.3673920631408691, | |
| "step": 345 | |
| }, | |
| { | |
| "epoch": 0.4038073262186328, | |
| "grad_norm": 4.25, | |
| "learning_rate": 1.018775962158975e-05, | |
| "loss": 1.3431027412414551, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.40957600230747043, | |
| "grad_norm": 2.1875, | |
| "learning_rate": 1.0056362978418937e-05, | |
| "loss": 1.483182430267334, | |
| "step": 355 | |
| }, | |
| { | |
| "epoch": 0.41534467839630806, | |
| "grad_norm": 4.25, | |
| "learning_rate": 9.924072430908451e-06, | |
| "loss": 1.4253923416137695, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.42111335448514564, | |
| "grad_norm": 2.65625, | |
| "learning_rate": 9.79093423817545e-06, | |
| "loss": 1.436702823638916, | |
| "step": 365 | |
| }, | |
| { | |
| "epoch": 0.4268820305739833, | |
| "grad_norm": 2.640625, | |
| "learning_rate": 9.656994955740129e-06, | |
| "loss": 1.4487831115722656, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.4326507066628209, | |
| "grad_norm": 2.4375, | |
| "learning_rate": 9.522301419246267e-06, | |
| "loss": 1.3315213203430176, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 0.4384193827516585, | |
| "grad_norm": 2.546875, | |
| "learning_rate": 9.386900728083816e-06, | |
| "loss": 1.464303684234619, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.4441880588404961, | |
| "grad_norm": 4.03125, | |
| "learning_rate": 9.250840228919291e-06, | |
| "loss": 1.3498079299926757, | |
| "step": 385 | |
| }, | |
| { | |
| "epoch": 0.4499567349293337, | |
| "grad_norm": 2.25, | |
| "learning_rate": 9.114167499139666e-06, | |
| "loss": 1.444554042816162, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.4557254110181713, | |
| "grad_norm": 4.21875, | |
| "learning_rate": 8.976930330215592e-06, | |
| "loss": 1.311547088623047, | |
| "step": 395 | |
| }, | |
| { | |
| "epoch": 0.46149408710700895, | |
| "grad_norm": 2.84375, | |
| "learning_rate": 8.839176710989775e-06, | |
| "loss": 1.423337173461914, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.46726276319584653, | |
| "grad_norm": 2.828125, | |
| "learning_rate": 8.700954810896315e-06, | |
| "loss": 1.4692988395690918, | |
| "step": 405 | |
| }, | |
| { | |
| "epoch": 0.47303143928468416, | |
| "grad_norm": 4.28125, | |
| "learning_rate": 8.562312963116918e-06, | |
| "loss": 1.416618251800537, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.4788001153735218, | |
| "grad_norm": 2.828125, | |
| "learning_rate": 8.423299647679823e-06, | |
| "loss": 1.3839403152465821, | |
| "step": 415 | |
| }, | |
| { | |
| "epoch": 0.48456879146235937, | |
| "grad_norm": 3.609375, | |
| "learning_rate": 8.283963474507402e-06, | |
| "loss": 1.4335898399353026, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.490337467551197, | |
| "grad_norm": 2.53125, | |
| "learning_rate": 8.144353166418336e-06, | |
| "loss": 1.3607335090637207, | |
| "step": 425 | |
| }, | |
| { | |
| "epoch": 0.49610614364003464, | |
| "grad_norm": 2.90625, | |
| "learning_rate": 8.004517542090298e-06, | |
| "loss": 1.3808890342712403, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.5018748197288723, | |
| "grad_norm": 4.25, | |
| "learning_rate": 7.864505498989136e-06, | |
| "loss": 1.339999294281006, | |
| "step": 435 | |
| }, | |
| { | |
| "epoch": 0.5076434958177098, | |
| "grad_norm": 2.484375, | |
| "learning_rate": 7.724365996270489e-06, | |
| "loss": 1.4851154327392577, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.5134121719065474, | |
| "grad_norm": 2.921875, | |
| "learning_rate": 7.584148037659845e-06, | |
| "loss": 1.4813553810119628, | |
| "step": 445 | |
| }, | |
| { | |
| "epoch": 0.5191808479953851, | |
| "grad_norm": 2.90625, | |
| "learning_rate": 7.443900654317003e-06, | |
| "loss": 1.5473807334899903, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.5249495240842227, | |
| "grad_norm": 3.046875, | |
| "learning_rate": 7.303672887690953e-06, | |
| "loss": 1.4310360908508302, | |
| "step": 455 | |
| }, | |
| { | |
| "epoch": 0.5307182001730603, | |
| "grad_norm": 3.6875, | |
| "learning_rate": 7.163513772371141e-06, | |
| "loss": 1.4008095741271973, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.536486876261898, | |
| "grad_norm": 2.265625, | |
| "learning_rate": 7.02347231894115e-06, | |
| "loss": 1.476534080505371, | |
| "step": 465 | |
| }, | |
| { | |
| "epoch": 0.5422555523507355, | |
| "grad_norm": 2.671875, | |
| "learning_rate": 6.883597496840774e-06, | |
| "loss": 1.4958248138427734, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.5480242284395731, | |
| "grad_norm": 2.640625, | |
| "learning_rate": 6.7439382172424665e-06, | |
| "loss": 1.4489681243896484, | |
| "step": 475 | |
| }, | |
| { | |
| "epoch": 0.5537929045284107, | |
| "grad_norm": 2.625, | |
| "learning_rate": 6.604543315948169e-06, | |
| "loss": 1.3916007995605468, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.5595615806172484, | |
| "grad_norm": 2.796875, | |
| "learning_rate": 6.465461536312499e-06, | |
| "loss": 1.40925931930542, | |
| "step": 485 | |
| }, | |
| { | |
| "epoch": 0.5653302567060859, | |
| "grad_norm": 4.15625, | |
| "learning_rate": 6.326741512198267e-06, | |
| "loss": 1.4209882736206054, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.5710989327949235, | |
| "grad_norm": 2.859375, | |
| "learning_rate": 6.188431750970279e-06, | |
| "loss": 1.4472535133361817, | |
| "step": 495 | |
| }, | |
| { | |
| "epoch": 0.5768676088837612, | |
| "grad_norm": 2.71875, | |
| "learning_rate": 6.050580616533352e-06, | |
| "loss": 1.4107693672180175, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.5826362849725988, | |
| "grad_norm": 2.640625, | |
| "learning_rate": 5.913236312420529e-06, | |
| "loss": 1.3599486351013184, | |
| "step": 505 | |
| }, | |
| { | |
| "epoch": 0.5884049610614364, | |
| "grad_norm": 2.9375, | |
| "learning_rate": 5.7764468649373555e-06, | |
| "loss": 1.4726941108703613, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.594173637150274, | |
| "grad_norm": 3.90625, | |
| "learning_rate": 5.640260106368114e-06, | |
| "loss": 1.3863279342651367, | |
| "step": 515 | |
| }, | |
| { | |
| "epoch": 0.5999423132391116, | |
| "grad_norm": 2.375, | |
| "learning_rate": 5.5047236582499375e-06, | |
| "loss": 1.4163952827453614, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.6057109893279492, | |
| "grad_norm": 2.296875, | |
| "learning_rate": 5.36988491472058e-06, | |
| "loss": 1.37623929977417, | |
| "step": 525 | |
| }, | |
| { | |
| "epoch": 0.6114796654167869, | |
| "grad_norm": 2.671875, | |
| "learning_rate": 5.235791025945735e-06, | |
| "loss": 1.5111130714416503, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.6172483415056245, | |
| "grad_norm": 4.0625, | |
| "learning_rate": 5.10248888163164e-06, | |
| "loss": 1.3977880477905273, | |
| "step": 535 | |
| }, | |
| { | |
| "epoch": 0.623017017594462, | |
| "grad_norm": 2.96875, | |
| "learning_rate": 4.970025094628776e-06, | |
| "loss": 1.4750987052917481, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.6287856936832997, | |
| "grad_norm": 3.515625, | |
| "learning_rate": 4.8384459846323695e-06, | |
| "loss": 1.3118095397949219, | |
| "step": 545 | |
| }, | |
| { | |
| "epoch": 0.6345543697721373, | |
| "grad_norm": 2.578125, | |
| "learning_rate": 4.707797561985411e-06, | |
| "loss": 1.3975916862487794, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.6403230458609749, | |
| "grad_norm": 3.0625, | |
| "learning_rate": 4.5781255115898316e-06, | |
| "loss": 1.3796093940734864, | |
| "step": 555 | |
| }, | |
| { | |
| "epoch": 0.6460917219498126, | |
| "grad_norm": 2.75, | |
| "learning_rate": 4.4494751769315e-06, | |
| "loss": 1.4118720054626466, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.6518603980386501, | |
| "grad_norm": 3.328125, | |
| "learning_rate": 4.321891544224585e-06, | |
| "loss": 1.4323857307434082, | |
| "step": 565 | |
| }, | |
| { | |
| "epoch": 0.6576290741274877, | |
| "grad_norm": 3.234375, | |
| "learning_rate": 4.195419226680871e-06, | |
| "loss": 1.3628763198852538, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.6633977502163253, | |
| "grad_norm": 3.21875, | |
| "learning_rate": 4.0701024489094845e-06, | |
| "loss": 1.4056241989135743, | |
| "step": 575 | |
| }, | |
| { | |
| "epoch": 0.669166426305163, | |
| "grad_norm": 3.578125, | |
| "learning_rate": 3.94598503145251e-06, | |
| "loss": 1.436029052734375, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.6749351023940006, | |
| "grad_norm": 4.21875, | |
| "learning_rate": 3.823110375461909e-06, | |
| "loss": 1.4853976249694825, | |
| "step": 585 | |
| }, | |
| { | |
| "epoch": 0.6807037784828381, | |
| "grad_norm": 4.15625, | |
| "learning_rate": 3.7015214475230806e-06, | |
| "loss": 1.4030592918395997, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.6864724545716758, | |
| "grad_norm": 3.09375, | |
| "learning_rate": 3.5812607646303843e-06, | |
| "loss": 1.3297285079956054, | |
| "step": 595 | |
| }, | |
| { | |
| "epoch": 0.6922411306605134, | |
| "grad_norm": 3.4375, | |
| "learning_rate": 3.462370379319884e-06, | |
| "loss": 1.3419939994812011, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.698009806749351, | |
| "grad_norm": 4.875, | |
| "learning_rate": 3.3448918649644763e-06, | |
| "loss": 1.3997164726257325, | |
| "step": 605 | |
| }, | |
| { | |
| "epoch": 0.7037784828381887, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 3.2288663012366104e-06, | |
| "loss": 1.417185115814209, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.7095471589270262, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 3.114334259743604e-06, | |
| "loss": 1.4784677505493165, | |
| "step": 615 | |
| }, | |
| { | |
| "epoch": 0.7153158350158638, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 3.0013357898406473e-06, | |
| "loss": 1.5040478706359863, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.7210845111047015, | |
| "grad_norm": 2.859375, | |
| "learning_rate": 2.889910404626421e-06, | |
| "loss": 1.4505383491516113, | |
| "step": 625 | |
| }, | |
| { | |
| "epoch": 0.7268531871935391, | |
| "grad_norm": 4.46875, | |
| "learning_rate": 2.7800970671262205e-06, | |
| "loss": 1.398913860321045, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 0.7326218632823767, | |
| "grad_norm": 1.9765625, | |
| "learning_rate": 2.6719341766674354e-06, | |
| "loss": 1.4610247611999512, | |
| "step": 635 | |
| }, | |
| { | |
| "epoch": 0.7383905393712143, | |
| "grad_norm": 3.46875, | |
| "learning_rate": 2.5654595554521557e-06, | |
| "loss": 1.4679314613342285, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.7441592154600519, | |
| "grad_norm": 2.828125, | |
| "learning_rate": 2.4607104353315556e-06, | |
| "loss": 1.4416119575500488, | |
| "step": 645 | |
| }, | |
| { | |
| "epoch": 0.7499278915488895, | |
| "grad_norm": 2.484375, | |
| "learning_rate": 2.3577234447867435e-06, | |
| "loss": 1.4032243728637694, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.7556965676377272, | |
| "grad_norm": 2.90625, | |
| "learning_rate": 2.2565345961205697e-06, | |
| "loss": 1.4307050704956055, | |
| "step": 655 | |
| }, | |
| { | |
| "epoch": 0.7614652437265648, | |
| "grad_norm": 2.40625, | |
| "learning_rate": 2.157179272864915e-06, | |
| "loss": 1.3724449157714844, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.7672339198154023, | |
| "grad_norm": 2.25, | |
| "learning_rate": 2.0596922174078447e-06, | |
| "loss": 1.4334271430969239, | |
| "step": 665 | |
| }, | |
| { | |
| "epoch": 0.77300259590424, | |
| "grad_norm": 3.828125, | |
| "learning_rate": 1.9641075188449458e-06, | |
| "loss": 1.3669556617736816, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 0.7787712719930776, | |
| "grad_norm": 2.90625, | |
| "learning_rate": 1.8704586010591252e-06, | |
| "loss": 1.4459367752075196, | |
| "step": 675 | |
| }, | |
| { | |
| "epoch": 0.7845399480819152, | |
| "grad_norm": 2.796875, | |
| "learning_rate": 1.7787782110330011e-06, | |
| "loss": 1.4034392356872558, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.7903086241707528, | |
| "grad_norm": 2.203125, | |
| "learning_rate": 1.6890984073979934e-06, | |
| "loss": 1.3815957069396974, | |
| "step": 685 | |
| }, | |
| { | |
| "epoch": 0.7960773002595904, | |
| "grad_norm": 2.3125, | |
| "learning_rate": 1.601450549224127e-06, | |
| "loss": 1.3128249168395996, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 0.801845976348428, | |
| "grad_norm": 2.890625, | |
| "learning_rate": 1.5158652850544483e-06, | |
| "loss": 1.3994318962097168, | |
| "step": 695 | |
| }, | |
| { | |
| "epoch": 0.8076146524372656, | |
| "grad_norm": 2.28125, | |
| "learning_rate": 1.432372542187895e-06, | |
| "loss": 1.4310274124145508, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.8133833285261033, | |
| "grad_norm": 2.625, | |
| "learning_rate": 1.35100151621438e-06, | |
| "loss": 1.3345772743225097, | |
| "step": 705 | |
| }, | |
| { | |
| "epoch": 0.8191520046149409, | |
| "grad_norm": 2.25, | |
| "learning_rate": 1.2717806608057217e-06, | |
| "loss": 1.4705657958984375, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.8249206807037784, | |
| "grad_norm": 1.921875, | |
| "learning_rate": 1.1947376777660244e-06, | |
| "loss": 1.4911749839782715, | |
| "step": 715 | |
| }, | |
| { | |
| "epoch": 0.8306893567926161, | |
| "grad_norm": 3.6875, | |
| "learning_rate": 1.1198995073449542e-06, | |
| "loss": 1.3002596855163575, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.8364580328814537, | |
| "grad_norm": 2.421875, | |
| "learning_rate": 1.0472923188173266e-06, | |
| "loss": 1.381908130645752, | |
| "step": 725 | |
| }, | |
| { | |
| "epoch": 0.8422267089702913, | |
| "grad_norm": 2.546875, | |
| "learning_rate": 9.769415013322849e-07, | |
| "loss": 1.4264190673828125, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 0.847995385059129, | |
| "grad_norm": 2.515625, | |
| "learning_rate": 9.088716550352605e-07, | |
| "loss": 1.3962379455566407, | |
| "step": 735 | |
| }, | |
| { | |
| "epoch": 0.8537640611479665, | |
| "grad_norm": 2.6875, | |
| "learning_rate": 8.431065824658443e-07, | |
| "loss": 1.4328977584838867, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.8595327372368041, | |
| "grad_norm": 2.84375, | |
| "learning_rate": 7.796692802345615e-07, | |
| "loss": 1.4179375648498536, | |
| "step": 745 | |
| }, | |
| { | |
| "epoch": 0.8653014133256418, | |
| "grad_norm": 3.0, | |
| "learning_rate": 7.185819309814492e-07, | |
| "loss": 1.3624920845031738, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.8710700894144794, | |
| "grad_norm": 3.0625, | |
| "learning_rate": 6.598658956192829e-07, | |
| "loss": 1.3818011283874512, | |
| "step": 755 | |
| }, | |
| { | |
| "epoch": 0.876838765503317, | |
| "grad_norm": 2.796875, | |
| "learning_rate": 6.035417058641207e-07, | |
| "loss": 1.334589385986328, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.8826074415921547, | |
| "grad_norm": 3.5, | |
| "learning_rate": 5.496290570558157e-07, | |
| "loss": 1.4661783218383788, | |
| "step": 765 | |
| }, | |
| { | |
| "epoch": 0.8883761176809922, | |
| "grad_norm": 2.453125, | |
| "learning_rate": 4.981468012709877e-07, | |
| "loss": 1.320871353149414, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 0.8941447937698298, | |
| "grad_norm": 3.109375, | |
| "learning_rate": 4.4911294073085724e-07, | |
| "loss": 1.4195501327514648, | |
| "step": 775 | |
| }, | |
| { | |
| "epoch": 0.8999134698586674, | |
| "grad_norm": 2.9375, | |
| "learning_rate": 4.025446215062681e-07, | |
| "loss": 1.388649845123291, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.9056821459475051, | |
| "grad_norm": 2.359375, | |
| "learning_rate": 3.584581275220772e-07, | |
| "loss": 1.4097150802612304, | |
| "step": 785 | |
| }, | |
| { | |
| "epoch": 0.9114508220363426, | |
| "grad_norm": 3.828125, | |
| "learning_rate": 3.1686887486302164e-07, | |
| "loss": 1.3754265785217286, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 0.9172194981251802, | |
| "grad_norm": 2.453125, | |
| "learning_rate": 2.777914063830492e-07, | |
| "loss": 1.381131935119629, | |
| "step": 795 | |
| }, | |
| { | |
| "epoch": 0.9229881742140179, | |
| "grad_norm": 2.453125, | |
| "learning_rate": 2.4123938662000186e-07, | |
| "loss": 1.471685028076172, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.9287568503028555, | |
| "grad_norm": 2.65625, | |
| "learning_rate": 2.0722559701742582e-07, | |
| "loss": 1.4830981254577638, | |
| "step": 805 | |
| }, | |
| { | |
| "epoch": 0.9345255263916931, | |
| "grad_norm": 2.59375, | |
| "learning_rate": 1.7576193145517782e-07, | |
| "loss": 1.4231231689453125, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 0.9402942024805307, | |
| "grad_norm": 2.65625, | |
| "learning_rate": 1.4685939209039324e-07, | |
| "loss": 1.3563322067260741, | |
| "step": 815 | |
| }, | |
| { | |
| "epoch": 0.9460628785693683, | |
| "grad_norm": 3.09375, | |
| "learning_rate": 1.205280855102775e-07, | |
| "loss": 1.4409172058105468, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 0.9518315546582059, | |
| "grad_norm": 3.109375, | |
| "learning_rate": 9.677721919804816e-08, | |
| "loss": 1.4546229362487793, | |
| "step": 825 | |
| }, | |
| { | |
| "epoch": 0.9576002307470436, | |
| "grad_norm": 2.8125, | |
| "learning_rate": 7.561509831327779e-08, | |
| "loss": 1.4547360420227051, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 0.9633689068358812, | |
| "grad_norm": 2.625, | |
| "learning_rate": 5.704912278776952e-08, | |
| "loss": 1.3702272415161132, | |
| "step": 835 | |
| }, | |
| { | |
| "epoch": 0.9691375829247187, | |
| "grad_norm": 4.4375, | |
| "learning_rate": 4.108578473795033e-08, | |
| "loss": 1.2763612747192383, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 0.9749062590135564, | |
| "grad_norm": 3.890625, | |
| "learning_rate": 2.773066619472936e-08, | |
| "loss": 1.4001253128051758, | |
| "step": 845 | |
| }, | |
| { | |
| "epoch": 0.980674935102394, | |
| "grad_norm": 2.28125, | |
| "learning_rate": 1.6988437151579385e-08, | |
| "loss": 1.4111320495605468, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.9864436111912316, | |
| "grad_norm": 4.90625, | |
| "learning_rate": 8.862853931542181e-09, | |
| "loss": 1.367732334136963, | |
| "step": 855 | |
| }, | |
| { | |
| "epoch": 0.9922122872800693, | |
| "grad_norm": 4.4375, | |
| "learning_rate": 3.3567578737250802e-09, | |
| "loss": 1.3816195487976075, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 0.9979809633689068, | |
| "grad_norm": 2.46875, | |
| "learning_rate": 4.720743397457205e-10, | |
| "loss": 1.3967268943786622, | |
| "step": 865 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "step": 867, | |
| "total_flos": 4.2033452439454925e+17, | |
| "train_loss": 1.4887716360433154, | |
| "train_runtime": 7587.3157, | |
| "train_samples_per_second": 0.457, | |
| "train_steps_per_second": 0.114 | |
| } | |
| ], | |
| "logging_steps": 5, | |
| "max_steps": 867, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": false, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4.2033452439454925e+17, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |