Text Generation
Transformers
Safetensors
qwen2
Generated from Trainer
open-r1
trl
sft
conversational
text-generation-inference
Instructions to use Sunnylululu/Qwen2.5-0.5B-Open-R1-Distill with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Sunnylululu/Qwen2.5-0.5B-Open-R1-Distill with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Sunnylululu/Qwen2.5-0.5B-Open-R1-Distill") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("Sunnylululu/Qwen2.5-0.5B-Open-R1-Distill") model = AutoModelForCausalLM.from_pretrained("Sunnylululu/Qwen2.5-0.5B-Open-R1-Distill", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Sunnylululu/Qwen2.5-0.5B-Open-R1-Distill with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Sunnylululu/Qwen2.5-0.5B-Open-R1-Distill" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Sunnylululu/Qwen2.5-0.5B-Open-R1-Distill", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/Sunnylululu/Qwen2.5-0.5B-Open-R1-Distill
- SGLang
How to use Sunnylululu/Qwen2.5-0.5B-Open-R1-Distill with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Sunnylululu/Qwen2.5-0.5B-Open-R1-Distill" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Sunnylululu/Qwen2.5-0.5B-Open-R1-Distill", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Sunnylululu/Qwen2.5-0.5B-Open-R1-Distill" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Sunnylululu/Qwen2.5-0.5B-Open-R1-Distill", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use Sunnylululu/Qwen2.5-0.5B-Open-R1-Distill with Docker Model Runner:
docker model run hf.co/Sunnylululu/Qwen2.5-0.5B-Open-R1-Distill
| { | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 20.0, | |
| "eval_steps": 500, | |
| "global_step": 940, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.10638297872340426, | |
| "grad_norm": 7.71875, | |
| "learning_rate": 5.319148936170213e-06, | |
| "loss": 1.874, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.2127659574468085, | |
| "grad_norm": 3.96875, | |
| "learning_rate": 1.0638297872340426e-05, | |
| "loss": 1.8146, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.3191489361702128, | |
| "grad_norm": 3.09375, | |
| "learning_rate": 1.595744680851064e-05, | |
| "loss": 1.6658, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.425531914893617, | |
| "grad_norm": 2.5625, | |
| "learning_rate": 2.1276595744680852e-05, | |
| "loss": 1.5605, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.5319148936170213, | |
| "grad_norm": 2.296875, | |
| "learning_rate": 2.6595744680851064e-05, | |
| "loss": 1.4474, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.6382978723404256, | |
| "grad_norm": 1.953125, | |
| "learning_rate": 3.191489361702128e-05, | |
| "loss": 1.367, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.7446808510638298, | |
| "grad_norm": 2.09375, | |
| "learning_rate": 3.723404255319149e-05, | |
| "loss": 1.3428, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.851063829787234, | |
| "grad_norm": 2.0625, | |
| "learning_rate": 4.2553191489361704e-05, | |
| "loss": 1.2922, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.9574468085106383, | |
| "grad_norm": 2.4375, | |
| "learning_rate": 4.787234042553192e-05, | |
| "loss": 1.2636, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 1.0638297872340425, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 4.9998746893945805e-05, | |
| "loss": 1.2129, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 1.1702127659574468, | |
| "grad_norm": 1.984375, | |
| "learning_rate": 4.99910895290836e-05, | |
| "loss": 1.1482, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 1.2765957446808511, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 4.997647333573498e-05, | |
| "loss": 1.1343, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 1.3829787234042552, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 4.995490283620569e-05, | |
| "loss": 1.1265, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 1.4893617021276595, | |
| "grad_norm": 1.9453125, | |
| "learning_rate": 4.992638470449016e-05, | |
| "loss": 1.1193, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 1.5957446808510638, | |
| "grad_norm": 1.9921875, | |
| "learning_rate": 4.98909277642066e-05, | |
| "loss": 1.1042, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 1.702127659574468, | |
| "grad_norm": 2.171875, | |
| "learning_rate": 4.984854298586695e-05, | |
| "loss": 1.0683, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 1.8085106382978724, | |
| "grad_norm": 1.8984375, | |
| "learning_rate": 4.979924348348256e-05, | |
| "loss": 1.0495, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 1.9148936170212765, | |
| "grad_norm": 1.8125, | |
| "learning_rate": 4.9743044510506596e-05, | |
| "loss": 1.0677, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 2.021276595744681, | |
| "grad_norm": 2.109375, | |
| "learning_rate": 4.967996345511468e-05, | |
| "loss": 1.058, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 2.127659574468085, | |
| "grad_norm": 2.484375, | |
| "learning_rate": 4.9610019834824824e-05, | |
| "loss": 0.9445, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 2.2340425531914896, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 4.953323529045868e-05, | |
| "loss": 0.9534, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 2.3404255319148937, | |
| "grad_norm": 1.9375, | |
| "learning_rate": 4.9449633579445785e-05, | |
| "loss": 0.9609, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 2.4468085106382977, | |
| "grad_norm": 1.9765625, | |
| "learning_rate": 4.935924056847292e-05, | |
| "loss": 0.9451, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 2.5531914893617023, | |
| "grad_norm": 1.9375, | |
| "learning_rate": 4.926208422548085e-05, | |
| "loss": 0.9381, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 2.6595744680851063, | |
| "grad_norm": 2.03125, | |
| "learning_rate": 4.915819461101094e-05, | |
| "loss": 0.9412, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 2.7659574468085104, | |
| "grad_norm": 2.0625, | |
| "learning_rate": 4.904760386890431e-05, | |
| "loss": 0.9306, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 2.872340425531915, | |
| "grad_norm": 2.046875, | |
| "learning_rate": 4.893034621635644e-05, | |
| "loss": 0.9287, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 2.978723404255319, | |
| "grad_norm": 2.0625, | |
| "learning_rate": 4.8806457933330185e-05, | |
| "loss": 0.9184, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 3.0851063829787235, | |
| "grad_norm": 2.1875, | |
| "learning_rate": 4.8675977351330635e-05, | |
| "loss": 0.83, | |
| "step": 145 | |
| }, | |
| { | |
| "epoch": 3.1914893617021276, | |
| "grad_norm": 2.015625, | |
| "learning_rate": 4.853894484154523e-05, | |
| "loss": 0.8281, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 3.297872340425532, | |
| "grad_norm": 2.234375, | |
| "learning_rate": 4.839540280235274e-05, | |
| "loss": 0.8054, | |
| "step": 155 | |
| }, | |
| { | |
| "epoch": 3.404255319148936, | |
| "grad_norm": 2.03125, | |
| "learning_rate": 4.8245395646205024e-05, | |
| "loss": 0.8155, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 3.5106382978723403, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 4.808896978588571e-05, | |
| "loss": 0.799, | |
| "step": 165 | |
| }, | |
| { | |
| "epoch": 3.617021276595745, | |
| "grad_norm": 2.171875, | |
| "learning_rate": 4.792617362014982e-05, | |
| "loss": 0.8008, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 3.723404255319149, | |
| "grad_norm": 2.125, | |
| "learning_rate": 4.7757057518749085e-05, | |
| "loss": 0.7805, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 3.829787234042553, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 4.758167380684733e-05, | |
| "loss": 0.8217, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 3.9361702127659575, | |
| "grad_norm": 2.53125, | |
| "learning_rate": 4.7400076748830835e-05, | |
| "loss": 0.8064, | |
| "step": 185 | |
| }, | |
| { | |
| "epoch": 4.042553191489362, | |
| "grad_norm": 2.296875, | |
| "learning_rate": 4.721232253151879e-05, | |
| "loss": 0.7495, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 4.148936170212766, | |
| "grad_norm": 2.0625, | |
| "learning_rate": 4.701846924677881e-05, | |
| "loss": 0.7, | |
| "step": 195 | |
| }, | |
| { | |
| "epoch": 4.25531914893617, | |
| "grad_norm": 2.109375, | |
| "learning_rate": 4.681857687355316e-05, | |
| "loss": 0.6738, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 4.361702127659575, | |
| "grad_norm": 2.015625, | |
| "learning_rate": 4.661270725930099e-05, | |
| "loss": 0.6929, | |
| "step": 205 | |
| }, | |
| { | |
| "epoch": 4.468085106382979, | |
| "grad_norm": 2.125, | |
| "learning_rate": 4.6400924100862526e-05, | |
| "loss": 0.6916, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 4.574468085106383, | |
| "grad_norm": 2.59375, | |
| "learning_rate": 4.6183292924751005e-05, | |
| "loss": 0.6948, | |
| "step": 215 | |
| }, | |
| { | |
| "epoch": 4.680851063829787, | |
| "grad_norm": 2.53125, | |
| "learning_rate": 4.595988106687854e-05, | |
| "loss": 0.6938, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 4.787234042553192, | |
| "grad_norm": 2.203125, | |
| "learning_rate": 4.573075765172214e-05, | |
| "loss": 0.6836, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 4.8936170212765955, | |
| "grad_norm": 2.515625, | |
| "learning_rate": 4.549599357093629e-05, | |
| "loss": 0.6804, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "grad_norm": 2.25, | |
| "learning_rate": 4.5255661461418854e-05, | |
| "loss": 0.6922, | |
| "step": 235 | |
| }, | |
| { | |
| "epoch": 5.1063829787234045, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 4.500983568283694e-05, | |
| "loss": 0.5917, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 5.212765957446808, | |
| "grad_norm": 2.1875, | |
| "learning_rate": 4.4758592294619696e-05, | |
| "loss": 0.582, | |
| "step": 245 | |
| }, | |
| { | |
| "epoch": 5.319148936170213, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 4.450200903242526e-05, | |
| "loss": 0.5846, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 5.425531914893617, | |
| "grad_norm": 2.171875, | |
| "learning_rate": 4.4240165284089065e-05, | |
| "loss": 0.5845, | |
| "step": 255 | |
| }, | |
| { | |
| "epoch": 5.531914893617021, | |
| "grad_norm": 2.21875, | |
| "learning_rate": 4.397314206506092e-05, | |
| "loss": 0.5968, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 5.638297872340425, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 4.3701021993338534e-05, | |
| "loss": 0.5739, | |
| "step": 265 | |
| }, | |
| { | |
| "epoch": 5.74468085106383, | |
| "grad_norm": 2.171875, | |
| "learning_rate": 4.342388926390517e-05, | |
| "loss": 0.5974, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 5.851063829787234, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 4.314182962267946e-05, | |
| "loss": 0.5955, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 5.957446808510638, | |
| "grad_norm": 2.0625, | |
| "learning_rate": 4.285493033998519e-05, | |
| "loss": 0.5848, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 6.0638297872340425, | |
| "grad_norm": 2.375, | |
| "learning_rate": 4.256328018354964e-05, | |
| "loss": 0.5369, | |
| "step": 285 | |
| }, | |
| { | |
| "epoch": 6.170212765957447, | |
| "grad_norm": 2.21875, | |
| "learning_rate": 4.226696939103846e-05, | |
| "loss": 0.4998, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 6.276595744680851, | |
| "grad_norm": 2.21875, | |
| "learning_rate": 4.196608964213574e-05, | |
| "loss": 0.4911, | |
| "step": 295 | |
| }, | |
| { | |
| "epoch": 6.382978723404255, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 4.16607340301781e-05, | |
| "loss": 0.4974, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 6.48936170212766, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 4.1350997033351126e-05, | |
| "loss": 0.4991, | |
| "step": 305 | |
| }, | |
| { | |
| "epoch": 6.595744680851064, | |
| "grad_norm": 2.125, | |
| "learning_rate": 4.103697448545753e-05, | |
| "loss": 0.499, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 6.702127659574468, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 4.071876354626581e-05, | |
| "loss": 0.4991, | |
| "step": 315 | |
| }, | |
| { | |
| "epoch": 6.808510638297872, | |
| "grad_norm": 2.09375, | |
| "learning_rate": 4.0396462671448616e-05, | |
| "loss": 0.5022, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 6.914893617021277, | |
| "grad_norm": 2.03125, | |
| "learning_rate": 4.007017158212022e-05, | |
| "loss": 0.5008, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 7.0212765957446805, | |
| "grad_norm": 2.625, | |
| "learning_rate": 3.9739991233982394e-05, | |
| "loss": 0.4899, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 7.127659574468085, | |
| "grad_norm": 2.203125, | |
| "learning_rate": 3.9406023786088356e-05, | |
| "loss": 0.4098, | |
| "step": 335 | |
| }, | |
| { | |
| "epoch": 7.23404255319149, | |
| "grad_norm": 2.234375, | |
| "learning_rate": 3.906837256923439e-05, | |
| "loss": 0.4213, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 7.340425531914893, | |
| "grad_norm": 2.046875, | |
| "learning_rate": 3.872714205398886e-05, | |
| "loss": 0.4184, | |
| "step": 345 | |
| }, | |
| { | |
| "epoch": 7.446808510638298, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 3.838243781836864e-05, | |
| "loss": 0.4223, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 7.553191489361702, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 3.803436651517288e-05, | |
| "loss": 0.4052, | |
| "step": 355 | |
| }, | |
| { | |
| "epoch": 7.659574468085106, | |
| "grad_norm": 2.25, | |
| "learning_rate": 3.7683035838984224e-05, | |
| "loss": 0.4189, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 7.76595744680851, | |
| "grad_norm": 2.3125, | |
| "learning_rate": 3.732855449284769e-05, | |
| "loss": 0.4152, | |
| "step": 365 | |
| }, | |
| { | |
| "epoch": 7.872340425531915, | |
| "grad_norm": 2.21875, | |
| "learning_rate": 3.697103215463754e-05, | |
| "loss": 0.4349, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 7.9787234042553195, | |
| "grad_norm": 2.171875, | |
| "learning_rate": 3.661057944312252e-05, | |
| "loss": 0.4235, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 8.085106382978724, | |
| "grad_norm": 2.75, | |
| "learning_rate": 3.624730788374003e-05, | |
| "loss": 0.3635, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 8.191489361702128, | |
| "grad_norm": 2.125, | |
| "learning_rate": 3.5881329874089664e-05, | |
| "loss": 0.355, | |
| "step": 385 | |
| }, | |
| { | |
| "epoch": 8.297872340425531, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 3.551275864915703e-05, | |
| "loss": 0.3456, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 8.404255319148936, | |
| "grad_norm": 2.171875, | |
| "learning_rate": 3.5141708246278385e-05, | |
| "loss": 0.3448, | |
| "step": 395 | |
| }, | |
| { | |
| "epoch": 8.51063829787234, | |
| "grad_norm": 2.125, | |
| "learning_rate": 3.476829346985704e-05, | |
| "loss": 0.3448, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 8.617021276595745, | |
| "grad_norm": 2.125, | |
| "learning_rate": 3.4392629855842475e-05, | |
| "loss": 0.3551, | |
| "step": 405 | |
| }, | |
| { | |
| "epoch": 8.72340425531915, | |
| "grad_norm": 2.234375, | |
| "learning_rate": 3.401483363598305e-05, | |
| "loss": 0.3574, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 8.829787234042554, | |
| "grad_norm": 2.0625, | |
| "learning_rate": 3.363502170186346e-05, | |
| "loss": 0.3502, | |
| "step": 415 | |
| }, | |
| { | |
| "epoch": 8.936170212765958, | |
| "grad_norm": 2.1875, | |
| "learning_rate": 3.325331156873807e-05, | |
| "loss": 0.3579, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 9.042553191489361, | |
| "grad_norm": 2.046875, | |
| "learning_rate": 3.2869821339171195e-05, | |
| "loss": 0.3326, | |
| "step": 425 | |
| }, | |
| { | |
| "epoch": 9.148936170212766, | |
| "grad_norm": 2.28125, | |
| "learning_rate": 3.248466966649579e-05, | |
| "loss": 0.2921, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 9.25531914893617, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 3.2097975718101544e-05, | |
| "loss": 0.2834, | |
| "step": 435 | |
| }, | |
| { | |
| "epoch": 9.361702127659575, | |
| "grad_norm": 2.375, | |
| "learning_rate": 3.170985913856418e-05, | |
| "loss": 0.2942, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 9.46808510638298, | |
| "grad_norm": 2.09375, | |
| "learning_rate": 3.1320440012626864e-05, | |
| "loss": 0.294, | |
| "step": 445 | |
| }, | |
| { | |
| "epoch": 9.574468085106384, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 3.0929838828045566e-05, | |
| "loss": 0.2844, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 9.680851063829786, | |
| "grad_norm": 2.125, | |
| "learning_rate": 3.053817643830969e-05, | |
| "loss": 0.295, | |
| "step": 455 | |
| }, | |
| { | |
| "epoch": 9.787234042553191, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 3.0145574025249544e-05, | |
| "loss": 0.2875, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 9.893617021276595, | |
| "grad_norm": 2.25, | |
| "learning_rate": 2.975215306154222e-05, | |
| "loss": 0.3021, | |
| "step": 465 | |
| }, | |
| { | |
| "epoch": 10.0, | |
| "grad_norm": 2.375, | |
| "learning_rate": 2.9358035273127483e-05, | |
| "loss": 0.296, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 10.106382978723405, | |
| "grad_norm": 2.40625, | |
| "learning_rate": 2.896334260154532e-05, | |
| "loss": 0.2404, | |
| "step": 475 | |
| }, | |
| { | |
| "epoch": 10.212765957446809, | |
| "grad_norm": 2.0, | |
| "learning_rate": 2.856819716620674e-05, | |
| "loss": 0.2408, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 10.319148936170214, | |
| "grad_norm": 2.1875, | |
| "learning_rate": 2.81727212266096e-05, | |
| "loss": 0.2386, | |
| "step": 485 | |
| }, | |
| { | |
| "epoch": 10.425531914893616, | |
| "grad_norm": 2.1875, | |
| "learning_rate": 2.7777037144510993e-05, | |
| "loss": 0.2381, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 10.53191489361702, | |
| "grad_norm": 1.90625, | |
| "learning_rate": 2.7381267346068112e-05, | |
| "loss": 0.2355, | |
| "step": 495 | |
| }, | |
| { | |
| "epoch": 10.638297872340425, | |
| "grad_norm": 2.125, | |
| "learning_rate": 2.6985534283959123e-05, | |
| "loss": 0.2509, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 10.74468085106383, | |
| "grad_norm": 2.1875, | |
| "learning_rate": 2.6589960399495834e-05, | |
| "loss": 0.2449, | |
| "step": 505 | |
| }, | |
| { | |
| "epoch": 10.851063829787234, | |
| "grad_norm": 2.125, | |
| "learning_rate": 2.6194668084739833e-05, | |
| "loss": 0.2462, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 10.957446808510639, | |
| "grad_norm": 2.015625, | |
| "learning_rate": 2.579977964463403e-05, | |
| "loss": 0.2482, | |
| "step": 515 | |
| }, | |
| { | |
| "epoch": 11.063829787234043, | |
| "grad_norm": 1.96875, | |
| "learning_rate": 2.5405417259160968e-05, | |
| "loss": 0.2267, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 11.170212765957446, | |
| "grad_norm": 2.046875, | |
| "learning_rate": 2.5011702945539882e-05, | |
| "loss": 0.1964, | |
| "step": 525 | |
| }, | |
| { | |
| "epoch": 11.27659574468085, | |
| "grad_norm": 1.9765625, | |
| "learning_rate": 2.4618758520474116e-05, | |
| "loss": 0.1997, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 11.382978723404255, | |
| "grad_norm": 2.125, | |
| "learning_rate": 2.422670556246059e-05, | |
| "loss": 0.2016, | |
| "step": 535 | |
| }, | |
| { | |
| "epoch": 11.48936170212766, | |
| "grad_norm": 2.21875, | |
| "learning_rate": 2.38356653741729e-05, | |
| "loss": 0.2074, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 11.595744680851064, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 2.3445758944929875e-05, | |
| "loss": 0.197, | |
| "step": 545 | |
| }, | |
| { | |
| "epoch": 11.702127659574469, | |
| "grad_norm": 1.8671875, | |
| "learning_rate": 2.3057106913260972e-05, | |
| "loss": 0.2065, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 11.808510638297872, | |
| "grad_norm": 2.046875, | |
| "learning_rate": 2.266982952958029e-05, | |
| "loss": 0.2105, | |
| "step": 555 | |
| }, | |
| { | |
| "epoch": 11.914893617021276, | |
| "grad_norm": 1.9609375, | |
| "learning_rate": 2.2284046618980613e-05, | |
| "loss": 0.2061, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 12.02127659574468, | |
| "grad_norm": 1.84375, | |
| "learning_rate": 2.1899877544159092e-05, | |
| "loss": 0.2009, | |
| "step": 565 | |
| }, | |
| { | |
| "epoch": 12.127659574468085, | |
| "grad_norm": 2.0625, | |
| "learning_rate": 2.1517441168485936e-05, | |
| "loss": 0.1751, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 12.23404255319149, | |
| "grad_norm": 1.84375, | |
| "learning_rate": 2.1136855819227686e-05, | |
| "loss": 0.1741, | |
| "step": 575 | |
| }, | |
| { | |
| "epoch": 12.340425531914894, | |
| "grad_norm": 1.984375, | |
| "learning_rate": 2.075823925093627e-05, | |
| "loss": 0.1727, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 12.446808510638299, | |
| "grad_norm": 1.734375, | |
| "learning_rate": 2.038170860901531e-05, | |
| "loss": 0.1685, | |
| "step": 585 | |
| }, | |
| { | |
| "epoch": 12.553191489361701, | |
| "grad_norm": 1.8671875, | |
| "learning_rate": 2.00073803934749e-05, | |
| "loss": 0.1707, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 12.659574468085106, | |
| "grad_norm": 1.828125, | |
| "learning_rate": 1.9635370422886033e-05, | |
| "loss": 0.1762, | |
| "step": 595 | |
| }, | |
| { | |
| "epoch": 12.76595744680851, | |
| "grad_norm": 1.796875, | |
| "learning_rate": 1.9265793798545934e-05, | |
| "loss": 0.1737, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 12.872340425531915, | |
| "grad_norm": 1.828125, | |
| "learning_rate": 1.8898764868865243e-05, | |
| "loss": 0.1753, | |
| "step": 605 | |
| }, | |
| { | |
| "epoch": 12.97872340425532, | |
| "grad_norm": 1.9296875, | |
| "learning_rate": 1.8534397193988202e-05, | |
| "loss": 0.1747, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 13.085106382978724, | |
| "grad_norm": 1.8203125, | |
| "learning_rate": 1.8172803510656728e-05, | |
| "loss": 0.1539, | |
| "step": 615 | |
| }, | |
| { | |
| "epoch": 13.191489361702128, | |
| "grad_norm": 1.75, | |
| "learning_rate": 1.781409569732922e-05, | |
| "loss": 0.1467, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 13.297872340425531, | |
| "grad_norm": 1.7421875, | |
| "learning_rate": 1.745838473956492e-05, | |
| "loss": 0.1477, | |
| "step": 625 | |
| }, | |
| { | |
| "epoch": 13.404255319148936, | |
| "grad_norm": 1.7265625, | |
| "learning_rate": 1.71057806956846e-05, | |
| "loss": 0.1545, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 13.51063829787234, | |
| "grad_norm": 2.015625, | |
| "learning_rate": 1.6756392662718072e-05, | |
| "loss": 0.1461, | |
| "step": 635 | |
| }, | |
| { | |
| "epoch": 13.617021276595745, | |
| "grad_norm": 1.78125, | |
| "learning_rate": 1.6410328742649175e-05, | |
| "loss": 0.1538, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 13.72340425531915, | |
| "grad_norm": 1.7265625, | |
| "learning_rate": 1.606769600896859e-05, | |
| "loss": 0.1521, | |
| "step": 645 | |
| }, | |
| { | |
| "epoch": 13.829787234042554, | |
| "grad_norm": 1.71875, | |
| "learning_rate": 1.5728600473544896e-05, | |
| "loss": 0.1513, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 13.936170212765958, | |
| "grad_norm": 1.796875, | |
| "learning_rate": 1.539314705382412e-05, | |
| "loss": 0.1511, | |
| "step": 655 | |
| }, | |
| { | |
| "epoch": 14.042553191489361, | |
| "grad_norm": 1.4296875, | |
| "learning_rate": 1.506143954036784e-05, | |
| "loss": 0.1421, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 14.148936170212766, | |
| "grad_norm": 1.6875, | |
| "learning_rate": 1.4733580564740035e-05, | |
| "loss": 0.1355, | |
| "step": 665 | |
| }, | |
| { | |
| "epoch": 14.25531914893617, | |
| "grad_norm": 1.71875, | |
| "learning_rate": 1.4409671567752462e-05, | |
| "loss": 0.1358, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 14.361702127659575, | |
| "grad_norm": 1.5625, | |
| "learning_rate": 1.4089812768078495e-05, | |
| "loss": 0.1325, | |
| "step": 675 | |
| }, | |
| { | |
| "epoch": 14.46808510638298, | |
| "grad_norm": 1.6015625, | |
| "learning_rate": 1.3774103131245064e-05, | |
| "loss": 0.1325, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 14.574468085106384, | |
| "grad_norm": 1.7421875, | |
| "learning_rate": 1.3462640339012389e-05, | |
| "loss": 0.1331, | |
| "step": 685 | |
| }, | |
| { | |
| "epoch": 14.680851063829786, | |
| "grad_norm": 1.640625, | |
| "learning_rate": 1.3155520759150825e-05, | |
| "loss": 0.1336, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 14.787234042553191, | |
| "grad_norm": 1.5546875, | |
| "learning_rate": 1.2852839415624358e-05, | |
| "loss": 0.1379, | |
| "step": 695 | |
| }, | |
| { | |
| "epoch": 14.893617021276595, | |
| "grad_norm": 1.515625, | |
| "learning_rate": 1.2554689959189781e-05, | |
| "loss": 0.1349, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 15.0, | |
| "grad_norm": 1.6875, | |
| "learning_rate": 1.2261164638420832e-05, | |
| "loss": 0.1374, | |
| "step": 705 | |
| }, | |
| { | |
| "epoch": 15.106382978723405, | |
| "grad_norm": 1.453125, | |
| "learning_rate": 1.1972354271166089e-05, | |
| "loss": 0.1248, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 15.212765957446809, | |
| "grad_norm": 1.5546875, | |
| "learning_rate": 1.168834821644964e-05, | |
| "loss": 0.1268, | |
| "step": 715 | |
| }, | |
| { | |
| "epoch": 15.319148936170214, | |
| "grad_norm": 1.53125, | |
| "learning_rate": 1.1409234346823028e-05, | |
| "loss": 0.1227, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 15.425531914893616, | |
| "grad_norm": 1.515625, | |
| "learning_rate": 1.1135099021177155e-05, | |
| "loss": 0.1247, | |
| "step": 725 | |
| }, | |
| { | |
| "epoch": 15.53191489361702, | |
| "grad_norm": 1.453125, | |
| "learning_rate": 1.0866027058022515e-05, | |
| "loss": 0.1207, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 15.638297872340425, | |
| "grad_norm": 1.53125, | |
| "learning_rate": 1.0602101709246026e-05, | |
| "loss": 0.1237, | |
| "step": 735 | |
| }, | |
| { | |
| "epoch": 15.74468085106383, | |
| "grad_norm": 1.46875, | |
| "learning_rate": 1.0343404634352569e-05, | |
| "loss": 0.1238, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 15.851063829787234, | |
| "grad_norm": 1.546875, | |
| "learning_rate": 1.0090015875199252e-05, | |
| "loss": 0.1251, | |
| "step": 745 | |
| }, | |
| { | |
| "epoch": 15.957446808510639, | |
| "grad_norm": 1.5078125, | |
| "learning_rate": 9.842013831230129e-06, | |
| "loss": 0.122, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 16.06382978723404, | |
| "grad_norm": 1.328125, | |
| "learning_rate": 9.59947523521913e-06, | |
| "loss": 0.1187, | |
| "step": 755 | |
| }, | |
| { | |
| "epoch": 16.170212765957448, | |
| "grad_norm": 1.46875, | |
| "learning_rate": 9.362475129528648e-06, | |
| "loss": 0.1125, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 16.27659574468085, | |
| "grad_norm": 1.4765625, | |
| "learning_rate": 9.131086842891132e-06, | |
| "loss": 0.1155, | |
| "step": 765 | |
| }, | |
| { | |
| "epoch": 16.382978723404257, | |
| "grad_norm": 1.5, | |
| "learning_rate": 8.905381967720925e-06, | |
| "loss": 0.1161, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 16.48936170212766, | |
| "grad_norm": 1.4453125, | |
| "learning_rate": 8.685430337963278e-06, | |
| "loss": 0.1181, | |
| "step": 775 | |
| }, | |
| { | |
| "epoch": 16.595744680851062, | |
| "grad_norm": 1.4375, | |
| "learning_rate": 8.471300007487473e-06, | |
| "loss": 0.1173, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 16.70212765957447, | |
| "grad_norm": 1.4375, | |
| "learning_rate": 8.263057229030688e-06, | |
| "loss": 0.1181, | |
| "step": 785 | |
| }, | |
| { | |
| "epoch": 16.80851063829787, | |
| "grad_norm": 1.4921875, | |
| "learning_rate": 8.060766433699175e-06, | |
| "loss": 0.1168, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 16.914893617021278, | |
| "grad_norm": 1.3984375, | |
| "learning_rate": 7.864490211032975e-06, | |
| "loss": 0.1174, | |
| "step": 795 | |
| }, | |
| { | |
| "epoch": 17.02127659574468, | |
| "grad_norm": 1.328125, | |
| "learning_rate": 7.67428928964054e-06, | |
| "loss": 0.1153, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 17.127659574468087, | |
| "grad_norm": 1.3984375, | |
| "learning_rate": 7.490222518409038e-06, | |
| "loss": 0.111, | |
| "step": 805 | |
| }, | |
| { | |
| "epoch": 17.23404255319149, | |
| "grad_norm": 1.4375, | |
| "learning_rate": 7.312346848296281e-06, | |
| "loss": 0.1105, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 17.340425531914892, | |
| "grad_norm": 1.5703125, | |
| "learning_rate": 7.140717314709908e-06, | |
| "loss": 0.1113, | |
| "step": 815 | |
| }, | |
| { | |
| "epoch": 17.4468085106383, | |
| "grad_norm": 1.4140625, | |
| "learning_rate": 6.975387020479173e-06, | |
| "loss": 0.1119, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 17.5531914893617, | |
| "grad_norm": 1.3984375, | |
| "learning_rate": 6.816407119424789e-06, | |
| "loss": 0.1115, | |
| "step": 825 | |
| }, | |
| { | |
| "epoch": 17.659574468085108, | |
| "grad_norm": 1.3984375, | |
| "learning_rate": 6.663826800531703e-06, | |
| "loss": 0.1115, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 17.76595744680851, | |
| "grad_norm": 1.3359375, | |
| "learning_rate": 6.517693272729839e-06, | |
| "loss": 0.1126, | |
| "step": 835 | |
| }, | |
| { | |
| "epoch": 17.872340425531917, | |
| "grad_norm": 1.3828125, | |
| "learning_rate": 6.3780517502874835e-06, | |
| "loss": 0.1157, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 17.97872340425532, | |
| "grad_norm": 1.5, | |
| "learning_rate": 6.24494543882183e-06, | |
| "loss": 0.1128, | |
| "step": 845 | |
| }, | |
| { | |
| "epoch": 18.085106382978722, | |
| "grad_norm": 1.3203125, | |
| "learning_rate": 6.118415521930966e-06, | |
| "loss": 0.11, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 18.19148936170213, | |
| "grad_norm": 1.28125, | |
| "learning_rate": 5.998501148451544e-06, | |
| "loss": 0.1065, | |
| "step": 855 | |
| }, | |
| { | |
| "epoch": 18.29787234042553, | |
| "grad_norm": 1.3125, | |
| "learning_rate": 5.885239420345969e-06, | |
| "loss": 0.106, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 18.404255319148938, | |
| "grad_norm": 1.3359375, | |
| "learning_rate": 5.778665381222906e-06, | |
| "loss": 0.1106, | |
| "step": 865 | |
| }, | |
| { | |
| "epoch": 18.51063829787234, | |
| "grad_norm": 1.40625, | |
| "learning_rate": 5.678812005494661e-06, | |
| "loss": 0.1109, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 18.617021276595743, | |
| "grad_norm": 1.40625, | |
| "learning_rate": 5.585710188174777e-06, | |
| "loss": 0.1093, | |
| "step": 875 | |
| }, | |
| { | |
| "epoch": 18.72340425531915, | |
| "grad_norm": 1.3203125, | |
| "learning_rate": 5.499388735318982e-06, | |
| "loss": 0.1081, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 18.829787234042552, | |
| "grad_norm": 1.46875, | |
| "learning_rate": 5.419874355112507e-06, | |
| "loss": 0.1123, | |
| "step": 885 | |
| }, | |
| { | |
| "epoch": 18.93617021276596, | |
| "grad_norm": 1.6796875, | |
| "learning_rate": 5.34719164960646e-06, | |
| "loss": 0.1107, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 19.04255319148936, | |
| "grad_norm": 1.359375, | |
| "learning_rate": 5.281363107105859e-06, | |
| "loss": 0.1104, | |
| "step": 895 | |
| }, | |
| { | |
| "epoch": 19.148936170212767, | |
| "grad_norm": 1.3515625, | |
| "learning_rate": 5.222409095211667e-06, | |
| "loss": 0.1087, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 19.25531914893617, | |
| "grad_norm": 1.359375, | |
| "learning_rate": 5.170347854518983e-06, | |
| "loss": 0.1057, | |
| "step": 905 | |
| }, | |
| { | |
| "epoch": 19.361702127659573, | |
| "grad_norm": 1.3359375, | |
| "learning_rate": 5.1251954929733194e-06, | |
| "loss": 0.1097, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 19.46808510638298, | |
| "grad_norm": 1.28125, | |
| "learning_rate": 5.086965980886762e-06, | |
| "loss": 0.1084, | |
| "step": 915 | |
| }, | |
| { | |
| "epoch": 19.574468085106382, | |
| "grad_norm": 1.3046875, | |
| "learning_rate": 5.0556711466154845e-06, | |
| "loss": 0.1062, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 19.680851063829788, | |
| "grad_norm": 1.4453125, | |
| "learning_rate": 5.0313206729000174e-06, | |
| "loss": 0.1055, | |
| "step": 925 | |
| }, | |
| { | |
| "epoch": 19.78723404255319, | |
| "grad_norm": 1.4140625, | |
| "learning_rate": 5.013922093869376e-06, | |
| "loss": 0.107, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 19.893617021276597, | |
| "grad_norm": 1.4296875, | |
| "learning_rate": 5.003480792709965e-06, | |
| "loss": 0.1074, | |
| "step": 935 | |
| }, | |
| { | |
| "epoch": 20.0, | |
| "grad_norm": 1.46875, | |
| "learning_rate": 5e-06, | |
| "loss": 0.1086, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 20.0, | |
| "step": 940, | |
| "total_flos": 1.3211147408769024e+17, | |
| "train_loss": 0.4334589367217206, | |
| "train_runtime": 1817.3607, | |
| "train_samples_per_second": 8.265, | |
| "train_steps_per_second": 0.517 | |
| } | |
| ], | |
| "logging_steps": 5, | |
| "max_steps": 940, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 20, | |
| "save_steps": 100, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.3211147408769024e+17, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |