Instructions to use Dilaksan/NLAQA with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Dilaksan/NLAQA with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("unsloth/deepseek-r1-0528-qwen3-8b-unsloth-bnb-4bit") model = PeftModel.from_pretrained(base_model, "Dilaksan/NLAQA") - Transformers
How to use Dilaksan/NLAQA with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Dilaksan/NLAQA") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Dilaksan/NLAQA", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Dilaksan/NLAQA with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Dilaksan/NLAQA" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Dilaksan/NLAQA", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/Dilaksan/NLAQA
- SGLang
How to use Dilaksan/NLAQA with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Dilaksan/NLAQA" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Dilaksan/NLAQA", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Dilaksan/NLAQA" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Dilaksan/NLAQA", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Unsloth Studio
How to use Dilaksan/NLAQA with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for Dilaksan/NLAQA to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for Dilaksan/NLAQA to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for Dilaksan/NLAQA to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="Dilaksan/NLAQA", max_seq_length=2048, ) - Docker Model Runner
How to use Dilaksan/NLAQA with Docker Model Runner:
docker model run hf.co/Dilaksan/NLAQA
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 20.0, | |
| "eval_steps": 500, | |
| "global_step": 2260, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.08888888888888889, | |
| "grad_norm": 0.8280278444290161, | |
| "learning_rate": 1.8e-05, | |
| "loss": 0.8199, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.17777777777777778, | |
| "grad_norm": 0.33694130182266235, | |
| "learning_rate": 3.8e-05, | |
| "loss": 0.7234, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.26666666666666666, | |
| "grad_norm": 0.5253115296363831, | |
| "learning_rate": 5.8e-05, | |
| "loss": 0.6757, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.35555555555555557, | |
| "grad_norm": 0.4070330262184143, | |
| "learning_rate": 7.800000000000001e-05, | |
| "loss": 0.5784, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.4444444444444444, | |
| "grad_norm": 0.468620240688324, | |
| "learning_rate": 9.8e-05, | |
| "loss": 0.5344, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.5333333333333333, | |
| "grad_norm": 0.29918837547302246, | |
| "learning_rate": 9.999590801246853e-05, | |
| "loss": 0.4592, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.6222222222222222, | |
| "grad_norm": 0.46750399470329285, | |
| "learning_rate": 9.998176373027159e-05, | |
| "loss": 0.4602, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.7111111111111111, | |
| "grad_norm": 0.5740944147109985, | |
| "learning_rate": 9.995751949253889e-05, | |
| "loss": 0.4043, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 0.5454725027084351, | |
| "learning_rate": 9.99231801983717e-05, | |
| "loss": 0.3956, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.8888888888888888, | |
| "grad_norm": 0.6640157103538513, | |
| "learning_rate": 9.987875278680778e-05, | |
| "loss": 0.4194, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.9777777777777777, | |
| "grad_norm": 0.5255690813064575, | |
| "learning_rate": 9.982424623541908e-05, | |
| "loss": 0.3796, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_loss": 0.3822258412837982, | |
| "eval_runtime": 24.245, | |
| "eval_samples_per_second": 4.125, | |
| "eval_steps_per_second": 0.536, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 1.0622222222222222, | |
| "grad_norm": 0.46724095940589905, | |
| "learning_rate": 9.975967155849773e-05, | |
| "loss": 0.3253, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 1.1511111111111112, | |
| "grad_norm": 0.40628087520599365, | |
| "learning_rate": 9.968504180483023e-05, | |
| "loss": 0.3997, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 0.641273558139801, | |
| "learning_rate": 9.960037205506079e-05, | |
| "loss": 0.3381, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 1.3288888888888888, | |
| "grad_norm": 0.5509289503097534, | |
| "learning_rate": 9.950567941864377e-05, | |
| "loss": 0.3444, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 1.4177777777777778, | |
| "grad_norm": 0.49098026752471924, | |
| "learning_rate": 9.94009830303865e-05, | |
| "loss": 0.3568, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 1.5066666666666668, | |
| "grad_norm": 0.6113401055335999, | |
| "learning_rate": 9.928630404658255e-05, | |
| "loss": 0.3037, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 1.5955555555555554, | |
| "grad_norm": 0.41983288526535034, | |
| "learning_rate": 9.916166564073662e-05, | |
| "loss": 0.3177, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 1.6844444444444444, | |
| "grad_norm": 0.5567779541015625, | |
| "learning_rate": 9.90270929988818e-05, | |
| "loss": 0.3761, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 1.7733333333333334, | |
| "grad_norm": 0.4871814250946045, | |
| "learning_rate": 9.888261331449029e-05, | |
| "loss": 0.3177, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 1.8622222222222222, | |
| "grad_norm": 0.8324890732765198, | |
| "learning_rate": 9.872825578297811e-05, | |
| "loss": 0.3103, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 1.951111111111111, | |
| "grad_norm": 0.5431402325630188, | |
| "learning_rate": 9.85640515958057e-05, | |
| "loss": 0.3238, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_loss": 0.3141745328903198, | |
| "eval_runtime": 22.8047, | |
| "eval_samples_per_second": 4.385, | |
| "eval_steps_per_second": 0.57, | |
| "step": 226 | |
| }, | |
| { | |
| "epoch": 2.0355555555555553, | |
| "grad_norm": 0.46945399045944214, | |
| "learning_rate": 9.839003393417486e-05, | |
| "loss": 0.3596, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 2.1244444444444444, | |
| "grad_norm": 0.5933423042297363, | |
| "learning_rate": 9.820623796232378e-05, | |
| "loss": 0.2621, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 2.2133333333333334, | |
| "grad_norm": 0.5787666440010071, | |
| "learning_rate": 9.80127008204213e-05, | |
| "loss": 0.2739, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 2.3022222222222224, | |
| "grad_norm": 0.6163641810417175, | |
| "learning_rate": 9.780946161706188e-05, | |
| "loss": 0.2683, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 2.391111111111111, | |
| "grad_norm": 0.6638880968093872, | |
| "learning_rate": 9.759656142136279e-05, | |
| "loss": 0.2813, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 2.48, | |
| "grad_norm": 0.550884485244751, | |
| "learning_rate": 9.737404325466521e-05, | |
| "loss": 0.3166, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 2.568888888888889, | |
| "grad_norm": 0.9437989592552185, | |
| "learning_rate": 9.714195208184076e-05, | |
| "loss": 0.286, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 2.6577777777777776, | |
| "grad_norm": 0.6860134601593018, | |
| "learning_rate": 9.690033480220535e-05, | |
| "loss": 0.2935, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 2.7466666666666666, | |
| "grad_norm": 0.7631677389144897, | |
| "learning_rate": 9.664924024004203e-05, | |
| "loss": 0.2836, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 2.8355555555555556, | |
| "grad_norm": 1.093269944190979, | |
| "learning_rate": 9.638871913473501e-05, | |
| "loss": 0.2875, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 2.924444444444444, | |
| "grad_norm": 0.7322181463241577, | |
| "learning_rate": 9.611882413051659e-05, | |
| "loss": 0.2811, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_loss": 0.29859602451324463, | |
| "eval_runtime": 22.7936, | |
| "eval_samples_per_second": 4.387, | |
| "eval_steps_per_second": 0.57, | |
| "step": 339 | |
| }, | |
| { | |
| "epoch": 3.008888888888889, | |
| "grad_norm": 0.6508819460868835, | |
| "learning_rate": 9.583960976582913e-05, | |
| "loss": 0.2612, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 3.097777777777778, | |
| "grad_norm": 0.813624382019043, | |
| "learning_rate": 9.555113246230442e-05, | |
| "loss": 0.2477, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 3.1866666666666665, | |
| "grad_norm": 0.7740529775619507, | |
| "learning_rate": 9.525345051336232e-05, | |
| "loss": 0.2508, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 3.2755555555555556, | |
| "grad_norm": 0.6230549812316895, | |
| "learning_rate": 9.494662407243129e-05, | |
| "loss": 0.2201, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 3.3644444444444446, | |
| "grad_norm": 0.605621874332428, | |
| "learning_rate": 9.463071514079299e-05, | |
| "loss": 0.2579, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 3.453333333333333, | |
| "grad_norm": 0.6390963196754456, | |
| "learning_rate": 9.430578755505345e-05, | |
| "loss": 0.2468, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 3.542222222222222, | |
| "grad_norm": 0.6382352709770203, | |
| "learning_rate": 9.39719069742436e-05, | |
| "loss": 0.254, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 3.631111111111111, | |
| "grad_norm": 1.0674622058868408, | |
| "learning_rate": 9.36291408665512e-05, | |
| "loss": 0.2817, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 3.7199999999999998, | |
| "grad_norm": 0.6276893615722656, | |
| "learning_rate": 9.327755849568745e-05, | |
| "loss": 0.2549, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 3.8088888888888888, | |
| "grad_norm": 0.8051192164421082, | |
| "learning_rate": 9.291723090689058e-05, | |
| "loss": 0.2707, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 3.897777777777778, | |
| "grad_norm": 1.0645169019699097, | |
| "learning_rate": 9.25482309125696e-05, | |
| "loss": 0.2107, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 3.986666666666667, | |
| "grad_norm": 0.9240409135818481, | |
| "learning_rate": 9.217063307759098e-05, | |
| "loss": 0.2654, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "eval_loss": 0.29310476779937744, | |
| "eval_runtime": 22.794, | |
| "eval_samples_per_second": 4.387, | |
| "eval_steps_per_second": 0.57, | |
| "step": 452 | |
| }, | |
| { | |
| "epoch": 4.071111111111111, | |
| "grad_norm": 0.6939980983734131, | |
| "learning_rate": 9.178451370421092e-05, | |
| "loss": 0.2052, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 4.16, | |
| "grad_norm": 0.731479823589325, | |
| "learning_rate": 9.138995081665691e-05, | |
| "loss": 0.2145, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 4.248888888888889, | |
| "grad_norm": 0.8955116868019104, | |
| "learning_rate": 9.098702414536107e-05, | |
| "loss": 0.2046, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 4.337777777777778, | |
| "grad_norm": 1.1034150123596191, | |
| "learning_rate": 9.057581511084879e-05, | |
| "loss": 0.1743, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 4.426666666666667, | |
| "grad_norm": 0.9072665572166443, | |
| "learning_rate": 9.015640680728595e-05, | |
| "loss": 0.2571, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 4.515555555555555, | |
| "grad_norm": 1.0989047288894653, | |
| "learning_rate": 8.972888398568772e-05, | |
| "loss": 0.2083, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 4.604444444444445, | |
| "grad_norm": 1.1180020570755005, | |
| "learning_rate": 8.929333303679276e-05, | |
| "loss": 0.2248, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 4.693333333333333, | |
| "grad_norm": 0.9198616743087769, | |
| "learning_rate": 8.884984197360605e-05, | |
| "loss": 0.2404, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 4.782222222222222, | |
| "grad_norm": 0.8098738789558411, | |
| "learning_rate": 8.839850041361368e-05, | |
| "loss": 0.2395, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 4.871111111111111, | |
| "grad_norm": 0.9560163617134094, | |
| "learning_rate": 8.793939956067379e-05, | |
| "loss": 0.2291, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 4.96, | |
| "grad_norm": 0.9346197247505188, | |
| "learning_rate": 8.747263218658661e-05, | |
| "loss": 0.2112, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "eval_loss": 0.2931341826915741, | |
| "eval_runtime": 22.801, | |
| "eval_samples_per_second": 4.386, | |
| "eval_steps_per_second": 0.57, | |
| "step": 565 | |
| }, | |
| { | |
| "epoch": 5.044444444444444, | |
| "grad_norm": 0.727533221244812, | |
| "learning_rate": 8.699829261234791e-05, | |
| "loss": 0.2315, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 5.133333333333334, | |
| "grad_norm": 0.8154391050338745, | |
| "learning_rate": 8.651647668908917e-05, | |
| "loss": 0.23, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 5.222222222222222, | |
| "grad_norm": 1.1250296831130981, | |
| "learning_rate": 8.60272817787088e-05, | |
| "loss": 0.1952, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 5.311111111111111, | |
| "grad_norm": 1.1119612455368042, | |
| "learning_rate": 8.553080673419784e-05, | |
| "loss": 0.1742, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 5.4, | |
| "grad_norm": 1.0984034538269043, | |
| "learning_rate": 8.502715187966455e-05, | |
| "loss": 0.2081, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 5.488888888888889, | |
| "grad_norm": 0.9959269165992737, | |
| "learning_rate": 8.451641899006155e-05, | |
| "loss": 0.1958, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 5.5777777777777775, | |
| "grad_norm": 0.8436211347579956, | |
| "learning_rate": 8.399871127061991e-05, | |
| "loss": 0.1772, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 5.666666666666667, | |
| "grad_norm": 1.0537818670272827, | |
| "learning_rate": 8.347413333599419e-05, | |
| "loss": 0.1792, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 5.7555555555555555, | |
| "grad_norm": 1.2140848636627197, | |
| "learning_rate": 8.294279118912267e-05, | |
| "loss": 0.2104, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 5.844444444444444, | |
| "grad_norm": 1.4907416105270386, | |
| "learning_rate": 8.240479219980697e-05, | |
| "loss": 0.2044, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 5.933333333333334, | |
| "grad_norm": 0.8753892183303833, | |
| "learning_rate": 8.186024508301564e-05, | |
| "loss": 0.1779, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 6.0, | |
| "eval_loss": 0.30221858620643616, | |
| "eval_runtime": 22.8113, | |
| "eval_samples_per_second": 4.384, | |
| "eval_steps_per_second": 0.57, | |
| "step": 678 | |
| }, | |
| { | |
| "epoch": 6.017777777777778, | |
| "grad_norm": 1.161600112915039, | |
| "learning_rate": 8.130925987691569e-05, | |
| "loss": 0.2089, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 6.1066666666666665, | |
| "grad_norm": 1.0779800415039062, | |
| "learning_rate": 8.0751947920637e-05, | |
| "loss": 0.1549, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 6.195555555555556, | |
| "grad_norm": 1.244500756263733, | |
| "learning_rate": 8.018842183177363e-05, | |
| "loss": 0.1777, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 6.2844444444444445, | |
| "grad_norm": 1.0372693538665771, | |
| "learning_rate": 7.961879548362687e-05, | |
| "loss": 0.1681, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 6.373333333333333, | |
| "grad_norm": 1.275514841079712, | |
| "learning_rate": 7.904318398219456e-05, | |
| "loss": 0.1783, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 6.4622222222222225, | |
| "grad_norm": 1.0903297662734985, | |
| "learning_rate": 7.84617036429113e-05, | |
| "loss": 0.1777, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 6.551111111111111, | |
| "grad_norm": 1.1274893283843994, | |
| "learning_rate": 7.787447196714427e-05, | |
| "loss": 0.1372, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 6.64, | |
| "grad_norm": 1.0295445919036865, | |
| "learning_rate": 7.728160761844938e-05, | |
| "loss": 0.1765, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 6.728888888888889, | |
| "grad_norm": 0.7822284698486328, | |
| "learning_rate": 7.668323039859255e-05, | |
| "loss": 0.1741, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 6.817777777777778, | |
| "grad_norm": 1.2998981475830078, | |
| "learning_rate": 7.607946122334115e-05, | |
| "loss": 0.1763, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 6.906666666666666, | |
| "grad_norm": 0.9125447273254395, | |
| "learning_rate": 7.54704220980301e-05, | |
| "loss": 0.1672, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 6.995555555555556, | |
| "grad_norm": 1.3892459869384766, | |
| "learning_rate": 7.485623609290792e-05, | |
| "loss": 0.201, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 7.0, | |
| "eval_loss": 0.31423336267471313, | |
| "eval_runtime": 22.8119, | |
| "eval_samples_per_second": 4.384, | |
| "eval_steps_per_second": 0.57, | |
| "step": 791 | |
| }, | |
| { | |
| "epoch": 7.08, | |
| "grad_norm": 1.2177425622940063, | |
| "learning_rate": 7.423702731826764e-05, | |
| "loss": 0.161, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 7.168888888888889, | |
| "grad_norm": 1.2349414825439453, | |
| "learning_rate": 7.361292089936748e-05, | |
| "loss": 0.1288, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 7.257777777777778, | |
| "grad_norm": 1.3617855310440063, | |
| "learning_rate": 7.298404295114633e-05, | |
| "loss": 0.1498, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 7.346666666666667, | |
| "grad_norm": 1.0532838106155396, | |
| "learning_rate": 7.235052055273947e-05, | |
| "loss": 0.145, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 7.435555555555555, | |
| "grad_norm": 2.5282888412475586, | |
| "learning_rate": 7.171248172179933e-05, | |
| "loss": 0.1572, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 7.524444444444445, | |
| "grad_norm": 1.316571831703186, | |
| "learning_rate": 7.107005538862646e-05, | |
| "loss": 0.1743, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 7.613333333333333, | |
| "grad_norm": 1.0913692712783813, | |
| "learning_rate": 7.042337137011641e-05, | |
| "loss": 0.1319, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 7.702222222222222, | |
| "grad_norm": 1.2439199686050415, | |
| "learning_rate": 6.977256034352712e-05, | |
| "loss": 0.1523, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 7.791111111111111, | |
| "grad_norm": 1.400645136833191, | |
| "learning_rate": 6.911775382007274e-05, | |
| "loss": 0.1647, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 7.88, | |
| "grad_norm": 1.1752562522888184, | |
| "learning_rate": 6.845908411834859e-05, | |
| "loss": 0.147, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 7.968888888888889, | |
| "grad_norm": 1.1503429412841797, | |
| "learning_rate": 6.779668433759336e-05, | |
| "loss": 0.1609, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 8.0, | |
| "eval_loss": 0.33602261543273926, | |
| "eval_runtime": 22.8016, | |
| "eval_samples_per_second": 4.386, | |
| "eval_steps_per_second": 0.57, | |
| "step": 904 | |
| }, | |
| { | |
| "epoch": 8.053333333333333, | |
| "grad_norm": 1.0708063840866089, | |
| "learning_rate": 6.713068833079333e-05, | |
| "loss": 0.146, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 8.142222222222221, | |
| "grad_norm": 0.9203677177429199, | |
| "learning_rate": 6.646123067763417e-05, | |
| "loss": 0.13, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 8.231111111111112, | |
| "grad_norm": 1.0815396308898926, | |
| "learning_rate": 6.578844665730629e-05, | |
| "loss": 0.1515, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 8.32, | |
| "grad_norm": 1.0179847478866577, | |
| "learning_rate": 6.511247222116839e-05, | |
| "loss": 0.1034, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 8.408888888888889, | |
| "grad_norm": 1.5660508871078491, | |
| "learning_rate": 6.443344396527548e-05, | |
| "loss": 0.1566, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 8.497777777777777, | |
| "grad_norm": 1.3174259662628174, | |
| "learning_rate": 6.375149910277656e-05, | |
| "loss": 0.1555, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 8.586666666666666, | |
| "grad_norm": 1.3149052858352661, | |
| "learning_rate": 6.306677543618742e-05, | |
| "loss": 0.1545, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 8.675555555555556, | |
| "grad_norm": 1.0674543380737305, | |
| "learning_rate": 6.237941132954475e-05, | |
| "loss": 0.1173, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 8.764444444444445, | |
| "grad_norm": 2.6074378490448, | |
| "learning_rate": 6.168954568044626e-05, | |
| "loss": 0.1439, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 8.853333333333333, | |
| "grad_norm": 1.1385785341262817, | |
| "learning_rate": 6.099731789198344e-05, | |
| "loss": 0.1057, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 8.942222222222222, | |
| "grad_norm": 1.4166982173919678, | |
| "learning_rate": 6.030286784457191e-05, | |
| "loss": 0.1318, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 9.0, | |
| "eval_loss": 0.3568514883518219, | |
| "eval_runtime": 22.8151, | |
| "eval_samples_per_second": 4.383, | |
| "eval_steps_per_second": 0.57, | |
| "step": 1017 | |
| }, | |
| { | |
| "epoch": 9.026666666666667, | |
| "grad_norm": 1.4854719638824463, | |
| "learning_rate": 5.960633586768543e-05, | |
| "loss": 0.1511, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 9.115555555555556, | |
| "grad_norm": 1.2033461332321167, | |
| "learning_rate": 5.890786271149904e-05, | |
| "loss": 0.0962, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 9.204444444444444, | |
| "grad_norm": 1.3722549676895142, | |
| "learning_rate": 5.8207589518447405e-05, | |
| "loss": 0.1056, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 9.293333333333333, | |
| "grad_norm": 1.156151294708252, | |
| "learning_rate": 5.750565779470368e-05, | |
| "loss": 0.1185, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 9.382222222222222, | |
| "grad_norm": 1.1652061939239502, | |
| "learning_rate": 5.680220938158495e-05, | |
| "loss": 0.1073, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 9.471111111111112, | |
| "grad_norm": 1.1125752925872803, | |
| "learning_rate": 5.609738642689001e-05, | |
| "loss": 0.1081, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 9.56, | |
| "grad_norm": 1.2892574071884155, | |
| "learning_rate": 5.539133135617517e-05, | |
| "loss": 0.1231, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 9.648888888888889, | |
| "grad_norm": 1.379626989364624, | |
| "learning_rate": 5.4684186843973826e-05, | |
| "loss": 0.1066, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 9.737777777777778, | |
| "grad_norm": 1.0732649564743042, | |
| "learning_rate": 5.397609578496593e-05, | |
| "loss": 0.1111, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 9.826666666666666, | |
| "grad_norm": 1.5738511085510254, | |
| "learning_rate": 5.326720126510275e-05, | |
| "loss": 0.1213, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 9.915555555555555, | |
| "grad_norm": 1.2037897109985352, | |
| "learning_rate": 5.2557646532693226e-05, | |
| "loss": 0.1145, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 10.0, | |
| "grad_norm": 1.7668266296386719, | |
| "learning_rate": 5.184757496945726e-05, | |
| "loss": 0.142, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 10.0, | |
| "eval_loss": 0.38781511783599854, | |
| "eval_runtime": 22.819, | |
| "eval_samples_per_second": 4.382, | |
| "eval_steps_per_second": 0.57, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 10.088888888888889, | |
| "grad_norm": 1.293931245803833, | |
| "learning_rate": 5.1137130061552174e-05, | |
| "loss": 0.0851, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 10.177777777777777, | |
| "grad_norm": 1.5352977514266968, | |
| "learning_rate": 5.042645537057819e-05, | |
| "loss": 0.1186, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 10.266666666666667, | |
| "grad_norm": 1.765360951423645, | |
| "learning_rate": 4.971569450456836e-05, | |
| "loss": 0.1055, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 10.355555555555556, | |
| "grad_norm": 1.5278376340866089, | |
| "learning_rate": 4.9004991088969384e-05, | |
| "loss": 0.0788, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 10.444444444444445, | |
| "grad_norm": 1.144656777381897, | |
| "learning_rate": 4.829448873761885e-05, | |
| "loss": 0.0976, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 10.533333333333333, | |
| "grad_norm": 0.9775051474571228, | |
| "learning_rate": 4.758433102372466e-05, | |
| "loss": 0.0866, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 10.622222222222222, | |
| "grad_norm": 1.5830668210983276, | |
| "learning_rate": 4.687466145085286e-05, | |
| "loss": 0.1037, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 10.71111111111111, | |
| "grad_norm": 1.668695092201233, | |
| "learning_rate": 4.616562342392955e-05, | |
| "loss": 0.1323, | |
| "step": 1210 | |
| }, | |
| { | |
| "epoch": 10.8, | |
| "grad_norm": 1.8038705587387085, | |
| "learning_rate": 4.545736022026247e-05, | |
| "loss": 0.1157, | |
| "step": 1220 | |
| }, | |
| { | |
| "epoch": 10.88888888888889, | |
| "grad_norm": 1.432991862297058, | |
| "learning_rate": 4.4750014960588666e-05, | |
| "loss": 0.1234, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 10.977777777777778, | |
| "grad_norm": 1.264278531074524, | |
| "learning_rate": 4.404373058015371e-05, | |
| "loss": 0.1105, | |
| "step": 1240 | |
| }, | |
| { | |
| "epoch": 11.0, | |
| "eval_loss": 0.4054388403892517, | |
| "eval_runtime": 22.808, | |
| "eval_samples_per_second": 4.384, | |
| "eval_steps_per_second": 0.57, | |
| "step": 1243 | |
| }, | |
| { | |
| "epoch": 11.062222222222223, | |
| "grad_norm": 1.5953978300094604, | |
| "learning_rate": 4.333864979982825e-05, | |
| "loss": 0.1119, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 11.151111111111112, | |
| "grad_norm": 1.5366672277450562, | |
| "learning_rate": 4.2634915097268115e-05, | |
| "loss": 0.0805, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 11.24, | |
| "grad_norm": 1.175093173980713, | |
| "learning_rate": 4.193266867812346e-05, | |
| "loss": 0.1111, | |
| "step": 1270 | |
| }, | |
| { | |
| "epoch": 11.328888888888889, | |
| "grad_norm": 1.193050503730774, | |
| "learning_rate": 4.123205244730275e-05, | |
| "loss": 0.0814, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 11.417777777777777, | |
| "grad_norm": 1.9646860361099243, | |
| "learning_rate": 4.0533207980297724e-05, | |
| "loss": 0.0884, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 11.506666666666666, | |
| "grad_norm": 1.2864062786102295, | |
| "learning_rate": 3.9836276494574865e-05, | |
| "loss": 0.0811, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 11.595555555555556, | |
| "grad_norm": 1.9868394136428833, | |
| "learning_rate": 3.914139882103911e-05, | |
| "loss": 0.1031, | |
| "step": 1310 | |
| }, | |
| { | |
| "epoch": 11.684444444444445, | |
| "grad_norm": 1.0178577899932861, | |
| "learning_rate": 3.844871537557583e-05, | |
| "loss": 0.0779, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 11.773333333333333, | |
| "grad_norm": 1.2357277870178223, | |
| "learning_rate": 3.7758366130676504e-05, | |
| "loss": 0.0997, | |
| "step": 1330 | |
| }, | |
| { | |
| "epoch": 11.862222222222222, | |
| "grad_norm": 1.4548487663269043, | |
| "learning_rate": 3.7139162859371955e-05, | |
| "loss": 0.0916, | |
| "step": 1340 | |
| }, | |
| { | |
| "epoch": 11.95111111111111, | |
| "grad_norm": 1.3962253332138062, | |
| "learning_rate": 3.645363250772425e-05, | |
| "loss": 0.1056, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 12.0, | |
| "eval_loss": 0.4192918539047241, | |
| "eval_runtime": 22.8206, | |
| "eval_samples_per_second": 4.382, | |
| "eval_steps_per_second": 0.57, | |
| "step": 1356 | |
| }, | |
| { | |
| "epoch": 12.035555555555556, | |
| "grad_norm": 1.0945167541503906, | |
| "learning_rate": 3.5770839508645385e-05, | |
| "loss": 0.0946, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 12.124444444444444, | |
| "grad_norm": 1.3720024824142456, | |
| "learning_rate": 3.509092183603659e-05, | |
| "loss": 0.0843, | |
| "step": 1370 | |
| }, | |
| { | |
| "epoch": 12.213333333333333, | |
| "grad_norm": 3.5357658863067627, | |
| "learning_rate": 3.4414016882773757e-05, | |
| "loss": 0.0951, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 12.302222222222222, | |
| "grad_norm": 1.6700564622879028, | |
| "learning_rate": 3.37402614329441e-05, | |
| "loss": 0.0929, | |
| "step": 1390 | |
| }, | |
| { | |
| "epoch": 12.391111111111112, | |
| "grad_norm": 1.6576741933822632, | |
| "learning_rate": 3.306979163420582e-05, | |
| "loss": 0.0678, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 12.48, | |
| "grad_norm": 1.3355114459991455, | |
| "learning_rate": 3.2402742970276426e-05, | |
| "loss": 0.0785, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 12.568888888888889, | |
| "grad_norm": 1.2856038808822632, | |
| "learning_rate": 3.1739250233554996e-05, | |
| "loss": 0.0729, | |
| "step": 1420 | |
| }, | |
| { | |
| "epoch": 12.657777777777778, | |
| "grad_norm": 1.1800755262374878, | |
| "learning_rate": 3.107944749788449e-05, | |
| "loss": 0.0761, | |
| "step": 1430 | |
| }, | |
| { | |
| "epoch": 12.746666666666666, | |
| "grad_norm": 0.9438807964324951, | |
| "learning_rate": 3.0423468091458918e-05, | |
| "loss": 0.0962, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 12.835555555555555, | |
| "grad_norm": 1.2357594966888428, | |
| "learning_rate": 2.9771444569881413e-05, | |
| "loss": 0.0778, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 12.924444444444445, | |
| "grad_norm": 1.2670978307724, | |
| "learning_rate": 2.9123508689378352e-05, | |
| "loss": 0.0712, | |
| "step": 1460 | |
| }, | |
| { | |
| "epoch": 13.0, | |
| "eval_loss": 0.452305406332016, | |
| "eval_runtime": 22.8071, | |
| "eval_samples_per_second": 4.385, | |
| "eval_steps_per_second": 0.57, | |
| "step": 1469 | |
| }, | |
| { | |
| "epoch": 13.008888888888889, | |
| "grad_norm": 1.1917250156402588, | |
| "learning_rate": 2.847979138017496e-05, | |
| "loss": 0.078, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 13.097777777777777, | |
| "grad_norm": 1.3447437286376953, | |
| "learning_rate": 2.784042272003794e-05, | |
| "loss": 0.0705, | |
| "step": 1480 | |
| }, | |
| { | |
| "epoch": 13.186666666666667, | |
| "grad_norm": 1.989099144935608, | |
| "learning_rate": 2.720553190799019e-05, | |
| "loss": 0.066, | |
| "step": 1490 | |
| }, | |
| { | |
| "epoch": 13.275555555555556, | |
| "grad_norm": 1.0475879907608032, | |
| "learning_rate": 2.6575247238203328e-05, | |
| "loss": 0.0636, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 13.364444444444445, | |
| "grad_norm": 1.481781005859375, | |
| "learning_rate": 2.5949696074072786e-05, | |
| "loss": 0.0831, | |
| "step": 1510 | |
| }, | |
| { | |
| "epoch": 13.453333333333333, | |
| "grad_norm": 0.9895071387290955, | |
| "learning_rate": 2.532900482248124e-05, | |
| "loss": 0.0745, | |
| "step": 1520 | |
| }, | |
| { | |
| "epoch": 13.542222222222222, | |
| "grad_norm": 1.4489779472351074, | |
| "learning_rate": 2.471329890825514e-05, | |
| "loss": 0.0757, | |
| "step": 1530 | |
| }, | |
| { | |
| "epoch": 13.63111111111111, | |
| "grad_norm": 1.0097142457962036, | |
| "learning_rate": 2.410270274881981e-05, | |
| "loss": 0.0698, | |
| "step": 1540 | |
| }, | |
| { | |
| "epoch": 13.72, | |
| "grad_norm": 1.7415978908538818, | |
| "learning_rate": 2.3497339729058083e-05, | |
| "loss": 0.0889, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 13.80888888888889, | |
| "grad_norm": 1.0850639343261719, | |
| "learning_rate": 2.2897332176377528e-05, | |
| "loss": 0.0725, | |
| "step": 1560 | |
| }, | |
| { | |
| "epoch": 13.897777777777778, | |
| "grad_norm": 1.0806571245193481, | |
| "learning_rate": 2.2302801335991413e-05, | |
| "loss": 0.0894, | |
| "step": 1570 | |
| }, | |
| { | |
| "epoch": 13.986666666666666, | |
| "grad_norm": 1.1130938529968262, | |
| "learning_rate": 2.1713867346418354e-05, | |
| "loss": 0.062, | |
| "step": 1580 | |
| }, | |
| { | |
| "epoch": 14.0, | |
| "eval_loss": 0.4800405502319336, | |
| "eval_runtime": 22.8054, | |
| "eval_samples_per_second": 4.385, | |
| "eval_steps_per_second": 0.57, | |
| "step": 1582 | |
| }, | |
| { | |
| "epoch": 14.071111111111112, | |
| "grad_norm": 0.8069847226142883, | |
| "learning_rate": 2.1130649215205584e-05, | |
| "loss": 0.0638, | |
| "step": 1590 | |
| }, | |
| { | |
| "epoch": 14.16, | |
| "grad_norm": 1.0252199172973633, | |
| "learning_rate": 2.0553264794880756e-05, | |
| "loss": 0.0546, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 14.248888888888889, | |
| "grad_norm": 0.7054935693740845, | |
| "learning_rate": 1.9981830759137186e-05, | |
| "loss": 0.0547, | |
| "step": 1610 | |
| }, | |
| { | |
| "epoch": 14.337777777777777, | |
| "grad_norm": 1.59795343875885, | |
| "learning_rate": 1.9416462579257273e-05, | |
| "loss": 0.0669, | |
| "step": 1620 | |
| }, | |
| { | |
| "epoch": 14.426666666666666, | |
| "grad_norm": 0.9351125955581665, | |
| "learning_rate": 1.885727450077879e-05, | |
| "loss": 0.0755, | |
| "step": 1630 | |
| }, | |
| { | |
| "epoch": 14.515555555555556, | |
| "grad_norm": 1.1384128332138062, | |
| "learning_rate": 1.8304379520409087e-05, | |
| "loss": 0.07, | |
| "step": 1640 | |
| }, | |
| { | |
| "epoch": 14.604444444444445, | |
| "grad_norm": 0.9477954506874084, | |
| "learning_rate": 1.7757889363191483e-05, | |
| "loss": 0.0503, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 14.693333333333333, | |
| "grad_norm": 1.6113272905349731, | |
| "learning_rate": 1.7217914459928646e-05, | |
| "loss": 0.0797, | |
| "step": 1660 | |
| }, | |
| { | |
| "epoch": 14.782222222222222, | |
| "grad_norm": 2.085812568664551, | |
| "learning_rate": 1.668456392486762e-05, | |
| "loss": 0.065, | |
| "step": 1670 | |
| }, | |
| { | |
| "epoch": 14.87111111111111, | |
| "grad_norm": 1.1539088487625122, | |
| "learning_rate": 1.615794553365066e-05, | |
| "loss": 0.0776, | |
| "step": 1680 | |
| }, | |
| { | |
| "epoch": 14.96, | |
| "grad_norm": 1.685166597366333, | |
| "learning_rate": 1.5638165701536868e-05, | |
| "loss": 0.0742, | |
| "step": 1690 | |
| }, | |
| { | |
| "epoch": 15.0, | |
| "eval_loss": 0.5068357586860657, | |
| "eval_runtime": 22.7972, | |
| "eval_samples_per_second": 4.386, | |
| "eval_steps_per_second": 0.57, | |
| "step": 1695 | |
| }, | |
| { | |
| "epoch": 15.044444444444444, | |
| "grad_norm": 1.00210440158844, | |
| "learning_rate": 1.5125329461898408e-05, | |
| "loss": 0.0496, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 15.133333333333333, | |
| "grad_norm": 0.8724846839904785, | |
| "learning_rate": 1.4619540444996227e-05, | |
| "loss": 0.0577, | |
| "step": 1710 | |
| }, | |
| { | |
| "epoch": 15.222222222222221, | |
| "grad_norm": 1.568989872932434, | |
| "learning_rate": 1.4120900857039126e-05, | |
| "loss": 0.0679, | |
| "step": 1720 | |
| }, | |
| { | |
| "epoch": 15.311111111111112, | |
| "grad_norm": 1.4423738718032837, | |
| "learning_rate": 1.3629511459530758e-05, | |
| "loss": 0.056, | |
| "step": 1730 | |
| }, | |
| { | |
| "epoch": 15.4, | |
| "grad_norm": 1.4789477586746216, | |
| "learning_rate": 1.3145471548908345e-05, | |
| "loss": 0.0661, | |
| "step": 1740 | |
| }, | |
| { | |
| "epoch": 15.488888888888889, | |
| "grad_norm": 1.2932227849960327, | |
| "learning_rate": 1.266887893647764e-05, | |
| "loss": 0.0736, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 15.577777777777778, | |
| "grad_norm": 1.0465151071548462, | |
| "learning_rate": 1.2199829928647949e-05, | |
| "loss": 0.0582, | |
| "step": 1760 | |
| }, | |
| { | |
| "epoch": 15.666666666666666, | |
| "grad_norm": 1.129989504814148, | |
| "learning_rate": 1.1738419307471138e-05, | |
| "loss": 0.0612, | |
| "step": 1770 | |
| }, | |
| { | |
| "epoch": 15.755555555555556, | |
| "grad_norm": 1.283918023109436, | |
| "learning_rate": 1.1284740311488812e-05, | |
| "loss": 0.0592, | |
| "step": 1780 | |
| }, | |
| { | |
| "epoch": 15.844444444444445, | |
| "grad_norm": 0.6702640652656555, | |
| "learning_rate": 1.083888461689137e-05, | |
| "loss": 0.0609, | |
| "step": 1790 | |
| }, | |
| { | |
| "epoch": 15.933333333333334, | |
| "grad_norm": 1.0527065992355347, | |
| "learning_rate": 1.0400942318992668e-05, | |
| "loss": 0.0624, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 16.0, | |
| "eval_loss": 0.5388746857643127, | |
| "eval_runtime": 22.7988, | |
| "eval_samples_per_second": 4.386, | |
| "eval_steps_per_second": 0.57, | |
| "step": 1808 | |
| }, | |
| { | |
| "epoch": 16.017777777777777, | |
| "grad_norm": 0.8927621841430664, | |
| "learning_rate": 9.971001914024247e-06, | |
| "loss": 0.0542, | |
| "step": 1810 | |
| }, | |
| { | |
| "epoch": 16.106666666666666, | |
| "grad_norm": 1.9986155033111572, | |
| "learning_rate": 9.549150281252633e-06, | |
| "loss": 0.0738, | |
| "step": 1820 | |
| }, | |
| { | |
| "epoch": 16.195555555555554, | |
| "grad_norm": 0.7365565299987793, | |
| "learning_rate": 9.135472665423433e-06, | |
| "loss": 0.0536, | |
| "step": 1830 | |
| }, | |
| { | |
| "epoch": 16.284444444444443, | |
| "grad_norm": 1.414197564125061, | |
| "learning_rate": 8.730052659535675e-06, | |
| "loss": 0.0561, | |
| "step": 1840 | |
| }, | |
| { | |
| "epoch": 16.373333333333335, | |
| "grad_norm": 1.1275652647018433, | |
| "learning_rate": 8.332972187949889e-06, | |
| "loss": 0.053, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 16.462222222222223, | |
| "grad_norm": 1.1671727895736694, | |
| "learning_rate": 7.94431148983349e-06, | |
| "loss": 0.0655, | |
| "step": 1860 | |
| }, | |
| { | |
| "epoch": 16.551111111111112, | |
| "grad_norm": 0.7808873653411865, | |
| "learning_rate": 7.564149102946572e-06, | |
| "loss": 0.052, | |
| "step": 1870 | |
| }, | |
| { | |
| "epoch": 16.64, | |
| "grad_norm": 1.3717401027679443, | |
| "learning_rate": 7.192561847771589e-06, | |
| "loss": 0.0626, | |
| "step": 1880 | |
| }, | |
| { | |
| "epoch": 16.72888888888889, | |
| "grad_norm": 1.3122680187225342, | |
| "learning_rate": 6.829624811990038e-06, | |
| "loss": 0.0523, | |
| "step": 1890 | |
| }, | |
| { | |
| "epoch": 16.817777777777778, | |
| "grad_norm": 0.9357064366340637, | |
| "learning_rate": 6.475411335309245e-06, | |
| "loss": 0.0512, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 16.906666666666666, | |
| "grad_norm": 1.1543922424316406, | |
| "learning_rate": 6.129992994642425e-06, | |
| "loss": 0.0547, | |
| "step": 1910 | |
| }, | |
| { | |
| "epoch": 16.995555555555555, | |
| "grad_norm": 1.072333574295044, | |
| "learning_rate": 5.793439589644917e-06, | |
| "loss": 0.0615, | |
| "step": 1920 | |
| }, | |
| { | |
| "epoch": 17.0, | |
| "eval_loss": 0.5451540350914001, | |
| "eval_runtime": 22.8109, | |
| "eval_samples_per_second": 4.384, | |
| "eval_steps_per_second": 0.57, | |
| "step": 1921 | |
| }, | |
| { | |
| "epoch": 17.08, | |
| "grad_norm": 1.281044602394104, | |
| "learning_rate": 5.4658191286095895e-06, | |
| "loss": 0.0539, | |
| "step": 1930 | |
| }, | |
| { | |
| "epoch": 17.16888888888889, | |
| "grad_norm": 0.7179533839225769, | |
| "learning_rate": 5.1471978147241974e-06, | |
| "loss": 0.0563, | |
| "step": 1940 | |
| }, | |
| { | |
| "epoch": 17.25777777777778, | |
| "grad_norm": 0.7629289031028748, | |
| "learning_rate": 4.837640032693558e-06, | |
| "loss": 0.0577, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 17.346666666666668, | |
| "grad_norm": 1.0043361186981201, | |
| "learning_rate": 4.537208335729088e-06, | |
| "loss": 0.0553, | |
| "step": 1960 | |
| }, | |
| { | |
| "epoch": 17.435555555555556, | |
| "grad_norm": 1.1511973142623901, | |
| "learning_rate": 4.245963432908556e-06, | |
| "loss": 0.0529, | |
| "step": 1970 | |
| }, | |
| { | |
| "epoch": 17.524444444444445, | |
| "grad_norm": 1.298182487487793, | |
| "learning_rate": 3.963964176908391e-06, | |
| "loss": 0.0477, | |
| "step": 1980 | |
| }, | |
| { | |
| "epoch": 17.613333333333333, | |
| "grad_norm": 1.01607084274292, | |
| "learning_rate": 3.691267552111183e-06, | |
| "loss": 0.0569, | |
| "step": 1990 | |
| }, | |
| { | |
| "epoch": 17.702222222222222, | |
| "grad_norm": 1.1849422454833984, | |
| "learning_rate": 3.4279286630906572e-06, | |
| "loss": 0.0476, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 17.79111111111111, | |
| "grad_norm": 1.1263349056243896, | |
| "learning_rate": 3.1740007234766002e-06, | |
| "loss": 0.0534, | |
| "step": 2010 | |
| }, | |
| { | |
| "epoch": 17.88, | |
| "grad_norm": 1.0211373567581177, | |
| "learning_rate": 2.9295350452017535e-06, | |
| "loss": 0.0503, | |
| "step": 2020 | |
| }, | |
| { | |
| "epoch": 17.968888888888888, | |
| "grad_norm": 0.8752411603927612, | |
| "learning_rate": 2.6945810281331085e-06, | |
| "loss": 0.0546, | |
| "step": 2030 | |
| }, | |
| { | |
| "epoch": 18.0, | |
| "eval_loss": 0.5564368963241577, | |
| "eval_runtime": 22.789, | |
| "eval_samples_per_second": 4.388, | |
| "eval_steps_per_second": 0.57, | |
| "step": 2034 | |
| }, | |
| { | |
| "epoch": 18.053333333333335, | |
| "grad_norm": 1.052837610244751, | |
| "learning_rate": 2.4691861500895474e-06, | |
| "loss": 0.0525, | |
| "step": 2040 | |
| }, | |
| { | |
| "epoch": 18.142222222222223, | |
| "grad_norm": 0.5916168689727783, | |
| "learning_rate": 2.2533959572478392e-06, | |
| "loss": 0.0452, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 18.23111111111111, | |
| "grad_norm": 0.8715868592262268, | |
| "learning_rate": 2.0472540549390074e-06, | |
| "loss": 0.0504, | |
| "step": 2060 | |
| }, | |
| { | |
| "epoch": 18.32, | |
| "grad_norm": 1.3320412635803223, | |
| "learning_rate": 1.85080209883689e-06, | |
| "loss": 0.051, | |
| "step": 2070 | |
| }, | |
| { | |
| "epoch": 18.40888888888889, | |
| "grad_norm": 1.0562243461608887, | |
| "learning_rate": 1.6640797865406288e-06, | |
| "loss": 0.0564, | |
| "step": 2080 | |
| }, | |
| { | |
| "epoch": 18.497777777777777, | |
| "grad_norm": 0.8278095126152039, | |
| "learning_rate": 1.4871248495529011e-06, | |
| "loss": 0.0502, | |
| "step": 2090 | |
| }, | |
| { | |
| "epoch": 18.586666666666666, | |
| "grad_norm": 1.0500751733779907, | |
| "learning_rate": 1.3199730456553926e-06, | |
| "loss": 0.0532, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 18.675555555555555, | |
| "grad_norm": 1.490010380744934, | |
| "learning_rate": 1.1626581516831048e-06, | |
| "loss": 0.0647, | |
| "step": 2110 | |
| }, | |
| { | |
| "epoch": 18.764444444444443, | |
| "grad_norm": 1.9580787420272827, | |
| "learning_rate": 1.0152119566990025e-06, | |
| "loss": 0.0583, | |
| "step": 2120 | |
| }, | |
| { | |
| "epoch": 18.85333333333333, | |
| "grad_norm": 1.0863550901412964, | |
| "learning_rate": 8.776642555702985e-07, | |
| "loss": 0.0534, | |
| "step": 2130 | |
| }, | |
| { | |
| "epoch": 18.942222222222224, | |
| "grad_norm": 1.1364506483078003, | |
| "learning_rate": 7.50042842947718e-07, | |
| "loss": 0.0495, | |
| "step": 2140 | |
| }, | |
| { | |
| "epoch": 19.0, | |
| "eval_loss": 0.5644907355308533, | |
| "eval_runtime": 22.8007, | |
| "eval_samples_per_second": 4.386, | |
| "eval_steps_per_second": 0.57, | |
| "step": 2147 | |
| }, | |
| { | |
| "epoch": 19.026666666666667, | |
| "grad_norm": 0.4925549328327179, | |
| "learning_rate": 6.323735076489535e-07, | |
| "loss": 0.0476, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 19.115555555555556, | |
| "grad_norm": 1.1283750534057617, | |
| "learning_rate": 5.246800274474439e-07, | |
| "loss": 0.0498, | |
| "step": 2160 | |
| }, | |
| { | |
| "epoch": 19.204444444444444, | |
| "grad_norm": 1.1284992694854736, | |
| "learning_rate": 4.269841642675576e-07, | |
| "loss": 0.0521, | |
| "step": 2170 | |
| }, | |
| { | |
| "epoch": 19.293333333333333, | |
| "grad_norm": 1.0008766651153564, | |
| "learning_rate": 3.393056597870703e-07, | |
| "loss": 0.0505, | |
| "step": 2180 | |
| }, | |
| { | |
| "epoch": 19.38222222222222, | |
| "grad_norm": 0.728695809841156, | |
| "learning_rate": 2.616622314479067e-07, | |
| "loss": 0.0441, | |
| "step": 2190 | |
| }, | |
| { | |
| "epoch": 19.47111111111111, | |
| "grad_norm": 0.9185757637023926, | |
| "learning_rate": 1.9406956887595418e-07, | |
| "loss": 0.0491, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 19.56, | |
| "grad_norm": 0.7735620141029358, | |
| "learning_rate": 1.3654133071059893e-07, | |
| "loss": 0.0597, | |
| "step": 2210 | |
| }, | |
| { | |
| "epoch": 19.648888888888887, | |
| "grad_norm": 0.6428269743919373, | |
| "learning_rate": 8.90891418446782e-08, | |
| "loss": 0.0681, | |
| "step": 2220 | |
| }, | |
| { | |
| "epoch": 19.73777777777778, | |
| "grad_norm": 1.19765305519104, | |
| "learning_rate": 5.1722591075425986e-08, | |
| "loss": 0.0487, | |
| "step": 2230 | |
| }, | |
| { | |
| "epoch": 19.826666666666668, | |
| "grad_norm": 1.2431554794311523, | |
| "learning_rate": 2.4449229166823016e-08, | |
| "loss": 0.0523, | |
| "step": 2240 | |
| }, | |
| { | |
| "epoch": 19.915555555555557, | |
| "grad_norm": 0.572210967540741, | |
| "learning_rate": 7.2745673238006076e-09, | |
| "loss": 0.0537, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 20.0, | |
| "grad_norm": 1.5146510601043701, | |
| "learning_rate": 2.020760785648168e-10, | |
| "loss": 0.0445, | |
| "step": 2260 | |
| }, | |
| { | |
| "epoch": 20.0, | |
| "eval_loss": 0.5654152035713196, | |
| "eval_runtime": 22.8163, | |
| "eval_samples_per_second": 4.383, | |
| "eval_steps_per_second": 0.57, | |
| "step": 2260 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 2260, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 20, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.67518433968128e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |