Instructions to use hartular/xml-parser-rtt-lora-partial-step1500 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use hartular/xml-parser-rtt-lora-partial-step1500 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("unsloth/Qwen3-8B-unsloth-bnb-4bit") model = PeftModel.from_pretrained(base_model, "hartular/xml-parser-rtt-lora-partial-step1500") - Transformers
How to use hartular/xml-parser-rtt-lora-partial-step1500 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="hartular/xml-parser-rtt-lora-partial-step1500") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("hartular/xml-parser-rtt-lora-partial-step1500", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use hartular/xml-parser-rtt-lora-partial-step1500 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "hartular/xml-parser-rtt-lora-partial-step1500" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "hartular/xml-parser-rtt-lora-partial-step1500", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/hartular/xml-parser-rtt-lora-partial-step1500
- SGLang
How to use hartular/xml-parser-rtt-lora-partial-step1500 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "hartular/xml-parser-rtt-lora-partial-step1500" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "hartular/xml-parser-rtt-lora-partial-step1500", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "hartular/xml-parser-rtt-lora-partial-step1500" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "hartular/xml-parser-rtt-lora-partial-step1500", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Unsloth Studio
How to use hartular/xml-parser-rtt-lora-partial-step1500 with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for hartular/xml-parser-rtt-lora-partial-step1500 to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for hartular/xml-parser-rtt-lora-partial-step1500 to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for hartular/xml-parser-rtt-lora-partial-step1500 to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="hartular/xml-parser-rtt-lora-partial-step1500", max_seq_length=2048, ) - Docker Model Runner
How to use hartular/xml-parser-rtt-lora-partial-step1500 with Docker Model Runner:
docker model run hf.co/hartular/xml-parser-rtt-lora-partial-step1500
Invalid JSON:Unexpected token 'N', ..."ad_norm": NaN,
"... is not valid JSON
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.24, | |
| "eval_steps": 250, | |
| "global_step": 1500, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0016, | |
| "grad_norm": NaN, | |
| "learning_rate": 9.574468085106383e-06, | |
| "loss": 0.6083179950714112, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.0032, | |
| "grad_norm": 0.2735198438167572, | |
| "learning_rate": 1.9148936170212766e-05, | |
| "loss": 0.6088993072509765, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.0048, | |
| "grad_norm": 0.15276113152503967, | |
| "learning_rate": 2.9787234042553192e-05, | |
| "loss": 0.5225989818572998, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.0064, | |
| "grad_norm": 0.17109858989715576, | |
| "learning_rate": 4.0425531914893614e-05, | |
| "loss": 0.4329381942749023, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.008, | |
| "grad_norm": 0.17585736513137817, | |
| "learning_rate": 5.1063829787234044e-05, | |
| "loss": 0.35364015102386476, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.0096, | |
| "grad_norm": 0.16095905005931854, | |
| "learning_rate": 6.170212765957447e-05, | |
| "loss": 0.26982028484344484, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.0112, | |
| "grad_norm": 0.11053046584129333, | |
| "learning_rate": 7.23404255319149e-05, | |
| "loss": 0.20504410266876222, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.0128, | |
| "grad_norm": 0.12669840455055237, | |
| "learning_rate": 8.297872340425533e-05, | |
| "loss": 0.19483240842819213, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.0144, | |
| "grad_norm": 0.11641468852758408, | |
| "learning_rate": 9.361702127659576e-05, | |
| "loss": 0.17770581245422362, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.016, | |
| "grad_norm": 0.14681392908096313, | |
| "learning_rate": 0.00010425531914893618, | |
| "loss": 0.15753360986709594, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.0176, | |
| "grad_norm": 0.09883147478103638, | |
| "learning_rate": 0.00011489361702127661, | |
| "loss": 0.16169432401657105, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.0192, | |
| "grad_norm": 0.1138603463768959, | |
| "learning_rate": 0.00012553191489361702, | |
| "loss": 0.16089822053909303, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.0208, | |
| "grad_norm": 0.13063949346542358, | |
| "learning_rate": 0.00013617021276595746, | |
| "loss": 0.1603950023651123, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.0224, | |
| "grad_norm": 0.06824357807636261, | |
| "learning_rate": 0.00014680851063829788, | |
| "loss": 0.14956578016281127, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.024, | |
| "grad_norm": 0.12136659771203995, | |
| "learning_rate": 0.00015744680851063832, | |
| "loss": 0.1617922306060791, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.0256, | |
| "grad_norm": 0.10032546520233154, | |
| "learning_rate": 0.00016808510638297873, | |
| "loss": 0.1547396659851074, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.0272, | |
| "grad_norm": 0.07678422331809998, | |
| "learning_rate": 0.00017872340425531915, | |
| "loss": 0.14475579261779786, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.0288, | |
| "grad_norm": 0.10933304578065872, | |
| "learning_rate": 0.00018936170212765957, | |
| "loss": 0.1330868124961853, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.0304, | |
| "grad_norm": 0.12041473388671875, | |
| "learning_rate": 0.0002, | |
| "loss": 0.14836544990539552, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.032, | |
| "grad_norm": 0.0896446481347084, | |
| "learning_rate": 0.00019967007588254704, | |
| "loss": 0.14405652284622192, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.0336, | |
| "grad_norm": 0.0876811295747757, | |
| "learning_rate": 0.00019934015176509403, | |
| "loss": 0.14646297693252563, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.0352, | |
| "grad_norm": 0.09327778220176697, | |
| "learning_rate": 0.00019901022764764106, | |
| "loss": 0.14419257640838623, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.0368, | |
| "grad_norm": 0.08388442546129227, | |
| "learning_rate": 0.00019868030353018806, | |
| "loss": 0.15150091648101807, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.0384, | |
| "grad_norm": 0.09979762881994247, | |
| "learning_rate": 0.00019835037941273509, | |
| "loss": 0.14006744623184203, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 0.0845855325460434, | |
| "learning_rate": 0.0001980204552952821, | |
| "loss": 0.15045372247695923, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.0416, | |
| "grad_norm": 0.09481288492679596, | |
| "learning_rate": 0.0001976905311778291, | |
| "loss": 0.15042688846588134, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.0432, | |
| "grad_norm": 0.10349375009536743, | |
| "learning_rate": 0.0001973606070603761, | |
| "loss": 0.13992291688919067, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.0448, | |
| "grad_norm": 0.07897678017616272, | |
| "learning_rate": 0.00019703068294292314, | |
| "loss": 0.13927781581878662, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.0464, | |
| "grad_norm": 0.08341789990663528, | |
| "learning_rate": 0.00019670075882547014, | |
| "loss": 0.14076149463653564, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.048, | |
| "grad_norm": 0.10565593093633652, | |
| "learning_rate": 0.00019637083470801716, | |
| "loss": 0.14325612783432007, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.0496, | |
| "grad_norm": 0.07861499488353729, | |
| "learning_rate": 0.0001960409105905642, | |
| "loss": 0.1343199133872986, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.0512, | |
| "grad_norm": 0.09252545982599258, | |
| "learning_rate": 0.0001957109864731112, | |
| "loss": 0.12891001701354982, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.0528, | |
| "grad_norm": 0.08716761320829391, | |
| "learning_rate": 0.0001953810623556582, | |
| "loss": 0.1449826717376709, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.0544, | |
| "grad_norm": 0.07750111818313599, | |
| "learning_rate": 0.0001950511382382052, | |
| "loss": 0.1274427056312561, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.056, | |
| "grad_norm": 0.07396410405635834, | |
| "learning_rate": 0.00019472121412075224, | |
| "loss": 0.12241615056991577, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.0576, | |
| "grad_norm": 0.07157568633556366, | |
| "learning_rate": 0.00019439129000329926, | |
| "loss": 0.14313431978225707, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.0592, | |
| "grad_norm": 0.08780192583799362, | |
| "learning_rate": 0.00019406136588584626, | |
| "loss": 0.13534088134765626, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.0608, | |
| "grad_norm": 0.09394513815641403, | |
| "learning_rate": 0.0001937314417683933, | |
| "loss": 0.1249586820602417, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.0624, | |
| "grad_norm": 0.0853569507598877, | |
| "learning_rate": 0.0001934015176509403, | |
| "loss": 0.13353261947631836, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.064, | |
| "grad_norm": 0.08356380462646484, | |
| "learning_rate": 0.00019307159353348731, | |
| "loss": 0.12304072380065918, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.0656, | |
| "grad_norm": 0.08608467876911163, | |
| "learning_rate": 0.00019274166941603434, | |
| "loss": 0.13379846811294555, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.0672, | |
| "grad_norm": 0.07890665531158447, | |
| "learning_rate": 0.0001924117452985813, | |
| "loss": 0.11951367855072022, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.0688, | |
| "grad_norm": 0.08108149468898773, | |
| "learning_rate": 0.00019208182118112834, | |
| "loss": 0.12902278900146485, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.0704, | |
| "grad_norm": 0.09603618830442429, | |
| "learning_rate": 0.00019175189706367536, | |
| "loss": 0.12690144777297974, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.072, | |
| "grad_norm": 0.09471320360898972, | |
| "learning_rate": 0.00019142197294622236, | |
| "loss": 0.13802603483200074, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.0736, | |
| "grad_norm": 0.08374392986297607, | |
| "learning_rate": 0.0001910920488287694, | |
| "loss": 0.12328752279281616, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.0752, | |
| "grad_norm": 0.08944465219974518, | |
| "learning_rate": 0.00019076212471131642, | |
| "loss": 0.12756569385528566, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.0768, | |
| "grad_norm": 0.0898577868938446, | |
| "learning_rate": 0.00019043220059386341, | |
| "loss": 0.13218681812286376, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.0784, | |
| "grad_norm": 0.07767961174249649, | |
| "learning_rate": 0.00019010227647641044, | |
| "loss": 0.135015869140625, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 0.0865555852651596, | |
| "learning_rate": 0.00018977235235895744, | |
| "loss": 0.128175950050354, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.0816, | |
| "grad_norm": 0.07919178158044815, | |
| "learning_rate": 0.00018944242824150447, | |
| "loss": 0.12430660724639893, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.0832, | |
| "grad_norm": 0.08649525046348572, | |
| "learning_rate": 0.0001891125041240515, | |
| "loss": 0.12590073347091674, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.0848, | |
| "grad_norm": 0.08704695850610733, | |
| "learning_rate": 0.0001887825800065985, | |
| "loss": 0.12156925201416016, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.0864, | |
| "grad_norm": 0.06752946227788925, | |
| "learning_rate": 0.00018845265588914552, | |
| "loss": 0.12604955434799195, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.088, | |
| "grad_norm": 0.09034618735313416, | |
| "learning_rate": 0.00018812273177169252, | |
| "loss": 0.13052459955215454, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.0896, | |
| "grad_norm": 0.0869947075843811, | |
| "learning_rate": 0.00018779280765423954, | |
| "loss": 0.12303999662399293, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.0912, | |
| "grad_norm": 0.0702558308839798, | |
| "learning_rate": 0.00018746288353678654, | |
| "loss": 0.12230894565582276, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.0928, | |
| "grad_norm": 0.08718933910131454, | |
| "learning_rate": 0.00018713295941933354, | |
| "loss": 0.1285646677017212, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.0944, | |
| "grad_norm": 0.07396125048398972, | |
| "learning_rate": 0.00018680303530188057, | |
| "loss": 0.1259121775627136, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.096, | |
| "grad_norm": 0.10813502222299576, | |
| "learning_rate": 0.0001864731111844276, | |
| "loss": 0.12581136226654052, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.0976, | |
| "grad_norm": 0.07332257181406021, | |
| "learning_rate": 0.0001861431870669746, | |
| "loss": 0.120159912109375, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.0992, | |
| "grad_norm": 0.08529425412416458, | |
| "learning_rate": 0.00018581326294952162, | |
| "loss": 0.1297559142112732, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.1008, | |
| "grad_norm": 0.09605136513710022, | |
| "learning_rate": 0.00018548333883206864, | |
| "loss": 0.12067115306854248, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 0.1024, | |
| "grad_norm": 0.08586304634809494, | |
| "learning_rate": 0.00018515341471461564, | |
| "loss": 0.12730380296707153, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.104, | |
| "grad_norm": 0.06986010074615479, | |
| "learning_rate": 0.00018482349059716267, | |
| "loss": 0.12864140272140503, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.1056, | |
| "grad_norm": 0.08565957844257355, | |
| "learning_rate": 0.00018449356647970967, | |
| "loss": 0.13535914421081544, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.1072, | |
| "grad_norm": 0.07841351628303528, | |
| "learning_rate": 0.0001841636423622567, | |
| "loss": 0.12447234392166137, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 0.1088, | |
| "grad_norm": 0.07424665987491608, | |
| "learning_rate": 0.00018383371824480372, | |
| "loss": 0.12037907838821411, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.1104, | |
| "grad_norm": 0.0957612544298172, | |
| "learning_rate": 0.00018350379412735072, | |
| "loss": 0.11919810771942138, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 0.112, | |
| "grad_norm": 0.07862170785665512, | |
| "learning_rate": 0.00018317387000989775, | |
| "loss": 0.12414863109588622, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.1136, | |
| "grad_norm": 0.12410055845975876, | |
| "learning_rate": 0.00018284394589244474, | |
| "loss": 0.12083030939102173, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.1152, | |
| "grad_norm": 0.07692275941371918, | |
| "learning_rate": 0.00018251402177499174, | |
| "loss": 0.11559462547302246, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.1168, | |
| "grad_norm": 0.07810766994953156, | |
| "learning_rate": 0.00018218409765753877, | |
| "loss": 0.12092136144638062, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 0.1184, | |
| "grad_norm": 0.08475863188505173, | |
| "learning_rate": 0.00018185417354008577, | |
| "loss": 0.12225215435028076, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 0.09497244656085968, | |
| "learning_rate": 0.0001815242494226328, | |
| "loss": 0.12478446960449219, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.1216, | |
| "grad_norm": 0.07779653370380402, | |
| "learning_rate": 0.00018119432530517982, | |
| "loss": 0.11081166267395019, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.1232, | |
| "grad_norm": 0.08435814827680588, | |
| "learning_rate": 0.00018086440118772682, | |
| "loss": 0.10844987630844116, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 0.1248, | |
| "grad_norm": 0.07567104697227478, | |
| "learning_rate": 0.00018053447707027385, | |
| "loss": 0.11887184381484986, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.1264, | |
| "grad_norm": 0.07750700414180756, | |
| "learning_rate": 0.00018020455295282087, | |
| "loss": 0.11811846494674683, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 0.128, | |
| "grad_norm": 0.09390198439359665, | |
| "learning_rate": 0.00017987462883536787, | |
| "loss": 0.11379201412200927, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.1296, | |
| "grad_norm": 0.08400580286979675, | |
| "learning_rate": 0.0001795447047179149, | |
| "loss": 0.11909257173538208, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 0.1312, | |
| "grad_norm": 0.09543855488300323, | |
| "learning_rate": 0.0001792147806004619, | |
| "loss": 0.10916774272918701, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 0.1328, | |
| "grad_norm": 0.07908441871404648, | |
| "learning_rate": 0.00017888485648300892, | |
| "loss": 0.107346510887146, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 0.1344, | |
| "grad_norm": 0.1085224449634552, | |
| "learning_rate": 0.00017855493236555595, | |
| "loss": 0.12227011919021606, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 0.136, | |
| "grad_norm": 0.07472517341375351, | |
| "learning_rate": 0.00017822500824810295, | |
| "loss": 0.11575174331665039, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.1376, | |
| "grad_norm": 0.07198534905910492, | |
| "learning_rate": 0.00017789508413064997, | |
| "loss": 0.12281327247619629, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 0.1392, | |
| "grad_norm": 0.09142109006643295, | |
| "learning_rate": 0.00017756516001319697, | |
| "loss": 0.11497378349304199, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 0.1408, | |
| "grad_norm": 0.09548252075910568, | |
| "learning_rate": 0.00017723523589574397, | |
| "loss": 0.11615512371063233, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 0.1424, | |
| "grad_norm": 0.06250233203172684, | |
| "learning_rate": 0.000176905311778291, | |
| "loss": 0.11593252420425415, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 0.144, | |
| "grad_norm": 0.08740886300802231, | |
| "learning_rate": 0.000176575387660838, | |
| "loss": 0.11546707153320312, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.1456, | |
| "grad_norm": 0.11061470210552216, | |
| "learning_rate": 0.00017624546354338502, | |
| "loss": 0.12130849361419678, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 0.1472, | |
| "grad_norm": 0.07824647426605225, | |
| "learning_rate": 0.00017591553942593205, | |
| "loss": 0.1188379168510437, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 0.1488, | |
| "grad_norm": 0.08214984834194183, | |
| "learning_rate": 0.00017558561530847905, | |
| "loss": 0.11806504726409912, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 0.1504, | |
| "grad_norm": 0.09313149005174637, | |
| "learning_rate": 0.00017525569119102607, | |
| "loss": 0.11112408638000489, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 0.152, | |
| "grad_norm": 0.08523363620042801, | |
| "learning_rate": 0.0001749257670735731, | |
| "loss": 0.1136185884475708, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.1536, | |
| "grad_norm": 0.06718438863754272, | |
| "learning_rate": 0.0001745958429561201, | |
| "loss": 0.1142117738723755, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 0.1552, | |
| "grad_norm": 0.08877789974212646, | |
| "learning_rate": 0.00017426591883866713, | |
| "loss": 0.11236680746078491, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 0.1568, | |
| "grad_norm": 0.07814772427082062, | |
| "learning_rate": 0.00017393599472121412, | |
| "loss": 0.10925638675689697, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 0.1584, | |
| "grad_norm": 0.08659686148166656, | |
| "learning_rate": 0.00017360607060376115, | |
| "loss": 0.11623308658599854, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 0.08823436498641968, | |
| "learning_rate": 0.00017327614648630818, | |
| "loss": 0.11374906301498414, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.1616, | |
| "grad_norm": 0.12844692170619965, | |
| "learning_rate": 0.00017294622236885518, | |
| "loss": 0.10570265054702759, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 0.1632, | |
| "grad_norm": 0.09296935796737671, | |
| "learning_rate": 0.00017261629825140217, | |
| "loss": 0.10974518060684205, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 0.1648, | |
| "grad_norm": 0.09684396535158157, | |
| "learning_rate": 0.0001722863741339492, | |
| "loss": 0.11235146522521973, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 0.1664, | |
| "grad_norm": 0.0794069766998291, | |
| "learning_rate": 0.0001719564500164962, | |
| "loss": 0.11345041990280151, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 0.168, | |
| "grad_norm": 0.0808623656630516, | |
| "learning_rate": 0.00017162652589904323, | |
| "loss": 0.11226475238800049, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.1696, | |
| "grad_norm": 0.09042982757091522, | |
| "learning_rate": 0.00017129660178159022, | |
| "loss": 0.11745167970657348, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 0.1712, | |
| "grad_norm": 0.0925358310341835, | |
| "learning_rate": 0.00017096667766413725, | |
| "loss": 0.11483606100082397, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 0.1728, | |
| "grad_norm": 0.08630611002445221, | |
| "learning_rate": 0.00017063675354668428, | |
| "loss": 0.11297872066497802, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 0.1744, | |
| "grad_norm": 0.07782171666622162, | |
| "learning_rate": 0.00017030682942923128, | |
| "loss": 0.12509260177612305, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 0.176, | |
| "grad_norm": 0.09083843231201172, | |
| "learning_rate": 0.0001699769053117783, | |
| "loss": 0.1190922737121582, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.1776, | |
| "grad_norm": 0.09185738116502762, | |
| "learning_rate": 0.00016964698119432533, | |
| "loss": 0.11026453971862793, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 0.1792, | |
| "grad_norm": 0.10063742846250534, | |
| "learning_rate": 0.00016931705707687233, | |
| "loss": 0.11582765579223633, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 0.1808, | |
| "grad_norm": 0.09147176891565323, | |
| "learning_rate": 0.00016898713295941935, | |
| "loss": 0.11444920301437378, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 0.1824, | |
| "grad_norm": 0.10646630078554153, | |
| "learning_rate": 0.00016865720884196635, | |
| "loss": 0.10560888051986694, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 0.184, | |
| "grad_norm": 0.12107925117015839, | |
| "learning_rate": 0.00016832728472451338, | |
| "loss": 0.11672050952911377, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.1856, | |
| "grad_norm": 0.10743635892868042, | |
| "learning_rate": 0.0001679973606070604, | |
| "loss": 0.11454172134399414, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 0.1872, | |
| "grad_norm": 0.0912097841501236, | |
| "learning_rate": 0.00016766743648960738, | |
| "loss": 0.10987292528152466, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 0.1888, | |
| "grad_norm": 0.08923039585351944, | |
| "learning_rate": 0.0001673375123721544, | |
| "loss": 0.11110665798187255, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 0.1904, | |
| "grad_norm": 0.11190492659807205, | |
| "learning_rate": 0.00016700758825470143, | |
| "loss": 0.12069671154022217, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 0.192, | |
| "grad_norm": 0.09391149133443832, | |
| "learning_rate": 0.00016667766413724843, | |
| "loss": 0.10857542753219604, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.1936, | |
| "grad_norm": 0.09822124242782593, | |
| "learning_rate": 0.00016634774001979545, | |
| "loss": 0.11493276357650757, | |
| "step": 1210 | |
| }, | |
| { | |
| "epoch": 0.1952, | |
| "grad_norm": 0.08219283819198608, | |
| "learning_rate": 0.00016601781590234245, | |
| "loss": 0.10868325233459472, | |
| "step": 1220 | |
| }, | |
| { | |
| "epoch": 0.1968, | |
| "grad_norm": 0.1040310487151146, | |
| "learning_rate": 0.00016568789178488948, | |
| "loss": 0.10602080821990967, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 0.1984, | |
| "grad_norm": 0.0804198682308197, | |
| "learning_rate": 0.0001653579676674365, | |
| "loss": 0.10579434633255005, | |
| "step": 1240 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 0.08008287101984024, | |
| "learning_rate": 0.0001650280435499835, | |
| "loss": 0.10420469045639039, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.2016, | |
| "grad_norm": 0.08706449717283249, | |
| "learning_rate": 0.00016469811943253053, | |
| "loss": 0.10426139831542969, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 0.2032, | |
| "grad_norm": 0.10690020024776459, | |
| "learning_rate": 0.00016436819531507756, | |
| "loss": 0.10465244054794312, | |
| "step": 1270 | |
| }, | |
| { | |
| "epoch": 0.2048, | |
| "grad_norm": 0.10291136056184769, | |
| "learning_rate": 0.00016403827119762456, | |
| "loss": 0.09800633192062377, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 0.2064, | |
| "grad_norm": 0.09384270757436752, | |
| "learning_rate": 0.00016370834708017158, | |
| "loss": 0.10762728452682495, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 0.208, | |
| "grad_norm": 0.09748148173093796, | |
| "learning_rate": 0.00016337842296271858, | |
| "loss": 0.10190448760986329, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.2096, | |
| "grad_norm": 0.08641976118087769, | |
| "learning_rate": 0.0001630484988452656, | |
| "loss": 0.10793905258178711, | |
| "step": 1310 | |
| }, | |
| { | |
| "epoch": 0.2112, | |
| "grad_norm": 0.08845674246549606, | |
| "learning_rate": 0.0001627185747278126, | |
| "loss": 0.1030082106590271, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 0.2128, | |
| "grad_norm": 0.08985752612352371, | |
| "learning_rate": 0.0001623886506103596, | |
| "loss": 0.10357458591461181, | |
| "step": 1330 | |
| }, | |
| { | |
| "epoch": 0.2144, | |
| "grad_norm": 0.11634411662817001, | |
| "learning_rate": 0.00016205872649290663, | |
| "loss": 0.10648585557937622, | |
| "step": 1340 | |
| }, | |
| { | |
| "epoch": 0.216, | |
| "grad_norm": 0.10860881209373474, | |
| "learning_rate": 0.00016172880237545366, | |
| "loss": 0.10430452823638917, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.2176, | |
| "grad_norm": 0.10317538678646088, | |
| "learning_rate": 0.00016139887825800066, | |
| "loss": 0.10179120302200317, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 0.2192, | |
| "grad_norm": 0.10053454339504242, | |
| "learning_rate": 0.00016106895414054768, | |
| "loss": 0.10597822666168213, | |
| "step": 1370 | |
| }, | |
| { | |
| "epoch": 0.2208, | |
| "grad_norm": 0.08927279710769653, | |
| "learning_rate": 0.00016073903002309468, | |
| "loss": 0.09684351682662964, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 0.2224, | |
| "grad_norm": 0.1257501095533371, | |
| "learning_rate": 0.0001604091059056417, | |
| "loss": 0.11261625289916992, | |
| "step": 1390 | |
| }, | |
| { | |
| "epoch": 0.224, | |
| "grad_norm": 0.1243852972984314, | |
| "learning_rate": 0.00016007918178818873, | |
| "loss": 0.10365232229232788, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.2256, | |
| "grad_norm": 0.10740727186203003, | |
| "learning_rate": 0.00015974925767073573, | |
| "loss": 0.10951308012008668, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 0.2272, | |
| "grad_norm": 0.09918347746133804, | |
| "learning_rate": 0.00015941933355328276, | |
| "loss": 0.0985394537448883, | |
| "step": 1420 | |
| }, | |
| { | |
| "epoch": 0.2288, | |
| "grad_norm": 0.08673065900802612, | |
| "learning_rate": 0.00015908940943582978, | |
| "loss": 0.09536778330802917, | |
| "step": 1430 | |
| }, | |
| { | |
| "epoch": 0.2304, | |
| "grad_norm": 0.08423957228660583, | |
| "learning_rate": 0.00015875948531837678, | |
| "loss": 0.10208734273910522, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 0.232, | |
| "grad_norm": 0.08404131233692169, | |
| "learning_rate": 0.0001584295612009238, | |
| "loss": 0.11047152280807496, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.2336, | |
| "grad_norm": 0.09844925999641418, | |
| "learning_rate": 0.0001580996370834708, | |
| "loss": 0.10863144397735595, | |
| "step": 1460 | |
| }, | |
| { | |
| "epoch": 0.2352, | |
| "grad_norm": 0.0969533696770668, | |
| "learning_rate": 0.0001577697129660178, | |
| "loss": 0.10357078313827514, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 0.2368, | |
| "grad_norm": 0.09240443259477615, | |
| "learning_rate": 0.00015743978884856483, | |
| "loss": 0.1025089144706726, | |
| "step": 1480 | |
| }, | |
| { | |
| "epoch": 0.2384, | |
| "grad_norm": 0.08052058517932892, | |
| "learning_rate": 0.00015710986473111183, | |
| "loss": 0.10557924509048462, | |
| "step": 1490 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 0.08213961869478226, | |
| "learning_rate": 0.00015677994061365886, | |
| "loss": 0.10791049003601075, | |
| "step": 1500 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 6250, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 250, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 5.807714853021389e+17, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |