Instructions to use FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("unsloth/Qwen2.5-7B-Instruct") model = PeftModel.from_pretrained(base_model, "FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth") - Transformers
How to use FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth
- SGLang
How to use FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Unsloth Studio
How to use FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth", max_seq_length=2048, ) - Docker Model Runner
How to use FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth with Docker Model Runner:
docker model run hf.co/FormlessAI/Qwen2.5-7B-Instruct-Code-Unsloth
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.0, | |
| "eval_steps": 59, | |
| "global_step": 586, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.003418803418803419, | |
| "grad_norm": 0.7900828123092651, | |
| "learning_rate": 0.0, | |
| "loss": 1.4756, | |
| "num_input_tokens_seen": 16096, | |
| "step": 1, | |
| "train_runtime": 4.4851, | |
| "train_tokens_per_second": 3588.771 | |
| }, | |
| { | |
| "epoch": 0.006837606837606838, | |
| "grad_norm": 0.8550273180007935, | |
| "learning_rate": 4e-05, | |
| "loss": 1.4762, | |
| "num_input_tokens_seen": 31264, | |
| "step": 2, | |
| "train_runtime": 6.6431, | |
| "train_tokens_per_second": 4706.205 | |
| }, | |
| { | |
| "epoch": 0.010256410256410256, | |
| "grad_norm": 0.7560146450996399, | |
| "learning_rate": 8e-05, | |
| "loss": 1.3375, | |
| "num_input_tokens_seen": 45584, | |
| "step": 3, | |
| "train_runtime": 8.7724, | |
| "train_tokens_per_second": 5196.291 | |
| }, | |
| { | |
| "epoch": 0.013675213675213675, | |
| "grad_norm": 0.6870028376579285, | |
| "learning_rate": 0.00012, | |
| "loss": 1.0514, | |
| "num_input_tokens_seen": 75072, | |
| "step": 4, | |
| "train_runtime": 13.0746, | |
| "train_tokens_per_second": 5741.815 | |
| }, | |
| { | |
| "epoch": 0.017094017094017096, | |
| "grad_norm": 1.0243306159973145, | |
| "learning_rate": 0.00016, | |
| "loss": 1.1457, | |
| "num_input_tokens_seen": 93296, | |
| "step": 5, | |
| "train_runtime": 15.6571, | |
| "train_tokens_per_second": 5958.706 | |
| }, | |
| { | |
| "epoch": 0.020512820512820513, | |
| "grad_norm": 0.9480018019676208, | |
| "learning_rate": 0.0002, | |
| "loss": 0.8195, | |
| "num_input_tokens_seen": 108880, | |
| "step": 6, | |
| "train_runtime": 17.9212, | |
| "train_tokens_per_second": 6075.488 | |
| }, | |
| { | |
| "epoch": 0.023931623931623933, | |
| "grad_norm": 0.6540018320083618, | |
| "learning_rate": 0.00019965576592082616, | |
| "loss": 0.6109, | |
| "num_input_tokens_seen": 124688, | |
| "step": 7, | |
| "train_runtime": 20.1568, | |
| "train_tokens_per_second": 6185.907 | |
| }, | |
| { | |
| "epoch": 0.02735042735042735, | |
| "grad_norm": 0.28220847249031067, | |
| "learning_rate": 0.00019931153184165235, | |
| "loss": 0.5465, | |
| "num_input_tokens_seen": 141552, | |
| "step": 8, | |
| "train_runtime": 22.5656, | |
| "train_tokens_per_second": 6272.909 | |
| }, | |
| { | |
| "epoch": 0.03076923076923077, | |
| "grad_norm": 0.18244771659374237, | |
| "learning_rate": 0.0001989672977624785, | |
| "loss": 0.4196, | |
| "num_input_tokens_seen": 156656, | |
| "step": 9, | |
| "train_runtime": 24.7703, | |
| "train_tokens_per_second": 6324.342 | |
| }, | |
| { | |
| "epoch": 0.03418803418803419, | |
| "grad_norm": 0.19386130571365356, | |
| "learning_rate": 0.00019862306368330465, | |
| "loss": 0.4848, | |
| "num_input_tokens_seen": 175424, | |
| "step": 10, | |
| "train_runtime": 27.4449, | |
| "train_tokens_per_second": 6391.856 | |
| }, | |
| { | |
| "epoch": 0.037606837606837605, | |
| "grad_norm": 0.21845291554927826, | |
| "learning_rate": 0.0001982788296041308, | |
| "loss": 0.4163, | |
| "num_input_tokens_seen": 191904, | |
| "step": 11, | |
| "train_runtime": 29.8233, | |
| "train_tokens_per_second": 6434.711 | |
| }, | |
| { | |
| "epoch": 0.041025641025641026, | |
| "grad_norm": 0.2227926403284073, | |
| "learning_rate": 0.000197934595524957, | |
| "loss": 0.5241, | |
| "num_input_tokens_seen": 204480, | |
| "step": 12, | |
| "train_runtime": 31.6741, | |
| "train_tokens_per_second": 6455.753 | |
| }, | |
| { | |
| "epoch": 0.044444444444444446, | |
| "grad_norm": 0.14958512783050537, | |
| "learning_rate": 0.00019759036144578314, | |
| "loss": 0.3789, | |
| "num_input_tokens_seen": 222928, | |
| "step": 13, | |
| "train_runtime": 34.2727, | |
| "train_tokens_per_second": 6504.542 | |
| }, | |
| { | |
| "epoch": 0.04786324786324787, | |
| "grad_norm": 0.12511517107486725, | |
| "learning_rate": 0.0001972461273666093, | |
| "loss": 0.4255, | |
| "num_input_tokens_seen": 243248, | |
| "step": 14, | |
| "train_runtime": 37.1309, | |
| "train_tokens_per_second": 6551.089 | |
| }, | |
| { | |
| "epoch": 0.05128205128205128, | |
| "grad_norm": 0.12351791560649872, | |
| "learning_rate": 0.00019690189328743548, | |
| "loss": 0.4773, | |
| "num_input_tokens_seen": 259984, | |
| "step": 15, | |
| "train_runtime": 39.5774, | |
| "train_tokens_per_second": 6569.005 | |
| }, | |
| { | |
| "epoch": 0.0547008547008547, | |
| "grad_norm": 0.15381421148777008, | |
| "learning_rate": 0.00019655765920826164, | |
| "loss": 0.572, | |
| "num_input_tokens_seen": 273488, | |
| "step": 16, | |
| "train_runtime": 41.5599, | |
| "train_tokens_per_second": 6580.574 | |
| }, | |
| { | |
| "epoch": 0.05811965811965812, | |
| "grad_norm": 0.12012167274951935, | |
| "learning_rate": 0.0001962134251290878, | |
| "loss": 0.4824, | |
| "num_input_tokens_seen": 289072, | |
| "step": 17, | |
| "train_runtime": 43.7917, | |
| "train_tokens_per_second": 6601.074 | |
| }, | |
| { | |
| "epoch": 0.06153846153846154, | |
| "grad_norm": 0.12363950163125992, | |
| "learning_rate": 0.00019586919104991394, | |
| "loss": 0.4198, | |
| "num_input_tokens_seen": 303408, | |
| "step": 18, | |
| "train_runtime": 45.8994, | |
| "train_tokens_per_second": 6610.276 | |
| }, | |
| { | |
| "epoch": 0.06495726495726496, | |
| "grad_norm": 0.13709434866905212, | |
| "learning_rate": 0.00019552495697074013, | |
| "loss": 0.5045, | |
| "num_input_tokens_seen": 321088, | |
| "step": 19, | |
| "train_runtime": 48.4273, | |
| "train_tokens_per_second": 6630.309 | |
| }, | |
| { | |
| "epoch": 0.06837606837606838, | |
| "grad_norm": 0.11719892919063568, | |
| "learning_rate": 0.00019518072289156628, | |
| "loss": 0.444, | |
| "num_input_tokens_seen": 339024, | |
| "step": 20, | |
| "train_runtime": 51.0105, | |
| "train_tokens_per_second": 6646.155 | |
| }, | |
| { | |
| "epoch": 0.07179487179487179, | |
| "grad_norm": 0.1195915937423706, | |
| "learning_rate": 0.00019483648881239243, | |
| "loss": 0.4404, | |
| "num_input_tokens_seen": 355648, | |
| "step": 21, | |
| "train_runtime": 53.4008, | |
| "train_tokens_per_second": 6659.98 | |
| }, | |
| { | |
| "epoch": 0.07521367521367521, | |
| "grad_norm": 0.12735435366630554, | |
| "learning_rate": 0.0001944922547332186, | |
| "loss": 0.4253, | |
| "num_input_tokens_seen": 377104, | |
| "step": 22, | |
| "train_runtime": 58.0087, | |
| "train_tokens_per_second": 6500.816 | |
| }, | |
| { | |
| "epoch": 0.07863247863247863, | |
| "grad_norm": 0.13012833893299103, | |
| "learning_rate": 0.00019414802065404477, | |
| "loss": 0.4549, | |
| "num_input_tokens_seen": 388496, | |
| "step": 23, | |
| "train_runtime": 59.7134, | |
| "train_tokens_per_second": 6506.008 | |
| }, | |
| { | |
| "epoch": 0.08205128205128205, | |
| "grad_norm": 0.1187860295176506, | |
| "learning_rate": 0.00019380378657487093, | |
| "loss": 0.4447, | |
| "num_input_tokens_seen": 405136, | |
| "step": 24, | |
| "train_runtime": 62.1253, | |
| "train_tokens_per_second": 6521.268 | |
| }, | |
| { | |
| "epoch": 0.08547008547008547, | |
| "grad_norm": 0.12317577004432678, | |
| "learning_rate": 0.0001934595524956971, | |
| "loss": 0.4326, | |
| "num_input_tokens_seen": 421088, | |
| "step": 25, | |
| "train_runtime": 64.4069, | |
| "train_tokens_per_second": 6537.935 | |
| }, | |
| { | |
| "epoch": 0.08888888888888889, | |
| "grad_norm": 0.12564784288406372, | |
| "learning_rate": 0.00019311531841652323, | |
| "loss": 0.4521, | |
| "num_input_tokens_seen": 435328, | |
| "step": 26, | |
| "train_runtime": 66.5043, | |
| "train_tokens_per_second": 6545.86 | |
| }, | |
| { | |
| "epoch": 0.09230769230769231, | |
| "grad_norm": 0.10685139149427414, | |
| "learning_rate": 0.00019277108433734942, | |
| "loss": 0.4642, | |
| "num_input_tokens_seen": 451968, | |
| "step": 27, | |
| "train_runtime": 68.9138, | |
| "train_tokens_per_second": 6558.455 | |
| }, | |
| { | |
| "epoch": 0.09572649572649573, | |
| "grad_norm": 0.11094007641077042, | |
| "learning_rate": 0.00019242685025817557, | |
| "loss": 0.4877, | |
| "num_input_tokens_seen": 464928, | |
| "step": 28, | |
| "train_runtime": 70.8316, | |
| "train_tokens_per_second": 6563.853 | |
| }, | |
| { | |
| "epoch": 0.09914529914529914, | |
| "grad_norm": 0.1094178631901741, | |
| "learning_rate": 0.00019208261617900175, | |
| "loss": 0.5, | |
| "num_input_tokens_seen": 479280, | |
| "step": 29, | |
| "train_runtime": 72.9759, | |
| "train_tokens_per_second": 6567.645 | |
| }, | |
| { | |
| "epoch": 0.10256410256410256, | |
| "grad_norm": 0.09002909064292908, | |
| "learning_rate": 0.00019173838209982788, | |
| "loss": 0.3389, | |
| "num_input_tokens_seen": 496320, | |
| "step": 30, | |
| "train_runtime": 75.4421, | |
| "train_tokens_per_second": 6578.822 | |
| }, | |
| { | |
| "epoch": 0.10598290598290598, | |
| "grad_norm": 0.10585018992424011, | |
| "learning_rate": 0.00019139414802065406, | |
| "loss": 0.4548, | |
| "num_input_tokens_seen": 511296, | |
| "step": 31, | |
| "train_runtime": 78.2326, | |
| "train_tokens_per_second": 6535.59 | |
| }, | |
| { | |
| "epoch": 0.1094017094017094, | |
| "grad_norm": 0.09583117812871933, | |
| "learning_rate": 0.00019104991394148021, | |
| "loss": 0.4003, | |
| "num_input_tokens_seen": 529008, | |
| "step": 32, | |
| "train_runtime": 80.7656, | |
| "train_tokens_per_second": 6549.918 | |
| }, | |
| { | |
| "epoch": 0.11282051282051282, | |
| "grad_norm": 0.1044701486825943, | |
| "learning_rate": 0.0001907056798623064, | |
| "loss": 0.4673, | |
| "num_input_tokens_seen": 544384, | |
| "step": 33, | |
| "train_runtime": 83.0622, | |
| "train_tokens_per_second": 6553.935 | |
| }, | |
| { | |
| "epoch": 0.11623931623931624, | |
| "grad_norm": 0.10936785489320755, | |
| "learning_rate": 0.00019036144578313252, | |
| "loss": 0.4197, | |
| "num_input_tokens_seen": 562096, | |
| "step": 34, | |
| "train_runtime": 85.6158, | |
| "train_tokens_per_second": 6565.333 | |
| }, | |
| { | |
| "epoch": 0.11965811965811966, | |
| "grad_norm": 0.08397576957941055, | |
| "learning_rate": 0.0001900172117039587, | |
| "loss": 0.3889, | |
| "num_input_tokens_seen": 580704, | |
| "step": 35, | |
| "train_runtime": 88.3072, | |
| "train_tokens_per_second": 6575.955 | |
| }, | |
| { | |
| "epoch": 0.12307692307692308, | |
| "grad_norm": 0.10643361508846283, | |
| "learning_rate": 0.00018967297762478486, | |
| "loss": 0.474, | |
| "num_input_tokens_seen": 596128, | |
| "step": 36, | |
| "train_runtime": 90.568, | |
| "train_tokens_per_second": 6582.102 | |
| }, | |
| { | |
| "epoch": 0.1264957264957265, | |
| "grad_norm": 0.11568325012922287, | |
| "learning_rate": 0.00018932874354561104, | |
| "loss": 0.4805, | |
| "num_input_tokens_seen": 609488, | |
| "step": 37, | |
| "train_runtime": 92.5585, | |
| "train_tokens_per_second": 6584.897 | |
| }, | |
| { | |
| "epoch": 0.12991452991452992, | |
| "grad_norm": 0.1005433201789856, | |
| "learning_rate": 0.00018898450946643717, | |
| "loss": 0.3679, | |
| "num_input_tokens_seen": 624592, | |
| "step": 38, | |
| "train_runtime": 94.7955, | |
| "train_tokens_per_second": 6588.837 | |
| }, | |
| { | |
| "epoch": 0.13333333333333333, | |
| "grad_norm": 0.0977381095290184, | |
| "learning_rate": 0.00018864027538726335, | |
| "loss": 0.4141, | |
| "num_input_tokens_seen": 639840, | |
| "step": 39, | |
| "train_runtime": 97.0423, | |
| "train_tokens_per_second": 6593.411 | |
| }, | |
| { | |
| "epoch": 0.13675213675213677, | |
| "grad_norm": 0.11257043480873108, | |
| "learning_rate": 0.0001882960413080895, | |
| "loss": 0.5211, | |
| "num_input_tokens_seen": 652048, | |
| "step": 40, | |
| "train_runtime": 98.9078, | |
| "train_tokens_per_second": 6592.481 | |
| }, | |
| { | |
| "epoch": 0.14017094017094017, | |
| "grad_norm": 0.10306330025196075, | |
| "learning_rate": 0.00018795180722891569, | |
| "loss": 0.3752, | |
| "num_input_tokens_seen": 670112, | |
| "step": 41, | |
| "train_runtime": 101.5158, | |
| "train_tokens_per_second": 6601.063 | |
| }, | |
| { | |
| "epoch": 0.14358974358974358, | |
| "grad_norm": 0.07424470037221909, | |
| "learning_rate": 0.00018760757314974184, | |
| "loss": 0.2781, | |
| "num_input_tokens_seen": 705168, | |
| "step": 42, | |
| "train_runtime": 106.5454, | |
| "train_tokens_per_second": 6618.476 | |
| }, | |
| { | |
| "epoch": 0.147008547008547, | |
| "grad_norm": 0.09572459757328033, | |
| "learning_rate": 0.000187263339070568, | |
| "loss": 0.5014, | |
| "num_input_tokens_seen": 720320, | |
| "step": 43, | |
| "train_runtime": 108.8037, | |
| "train_tokens_per_second": 6620.362 | |
| }, | |
| { | |
| "epoch": 0.15042735042735042, | |
| "grad_norm": 0.09543762356042862, | |
| "learning_rate": 0.00018691910499139415, | |
| "loss": 0.4411, | |
| "num_input_tokens_seen": 736032, | |
| "step": 44, | |
| "train_runtime": 111.1227, | |
| "train_tokens_per_second": 6623.596 | |
| }, | |
| { | |
| "epoch": 0.15384615384615385, | |
| "grad_norm": 0.09599870443344116, | |
| "learning_rate": 0.00018657487091222033, | |
| "loss": 0.3435, | |
| "num_input_tokens_seen": 750576, | |
| "step": 45, | |
| "train_runtime": 113.3125, | |
| "train_tokens_per_second": 6623.948 | |
| }, | |
| { | |
| "epoch": 0.15726495726495726, | |
| "grad_norm": 0.0982552245259285, | |
| "learning_rate": 0.00018623063683304649, | |
| "loss": 0.5206, | |
| "num_input_tokens_seen": 768944, | |
| "step": 46, | |
| "train_runtime": 115.975, | |
| "train_tokens_per_second": 6630.256 | |
| }, | |
| { | |
| "epoch": 0.1606837606837607, | |
| "grad_norm": 0.10187075287103653, | |
| "learning_rate": 0.00018588640275387264, | |
| "loss": 0.4408, | |
| "num_input_tokens_seen": 784144, | |
| "step": 47, | |
| "train_runtime": 118.2082, | |
| "train_tokens_per_second": 6633.584 | |
| }, | |
| { | |
| "epoch": 0.1641025641025641, | |
| "grad_norm": 0.0859491378068924, | |
| "learning_rate": 0.0001855421686746988, | |
| "loss": 0.4154, | |
| "num_input_tokens_seen": 804272, | |
| "step": 48, | |
| "train_runtime": 121.1095, | |
| "train_tokens_per_second": 6640.864 | |
| }, | |
| { | |
| "epoch": 0.1675213675213675, | |
| "grad_norm": 0.08325184136629105, | |
| "learning_rate": 0.00018519793459552498, | |
| "loss": 0.4557, | |
| "num_input_tokens_seen": 818224, | |
| "step": 49, | |
| "train_runtime": 123.1709, | |
| "train_tokens_per_second": 6642.997 | |
| }, | |
| { | |
| "epoch": 0.17094017094017094, | |
| "grad_norm": 0.09160371869802475, | |
| "learning_rate": 0.00018485370051635113, | |
| "loss": 0.3976, | |
| "num_input_tokens_seen": 837600, | |
| "step": 50, | |
| "train_runtime": 125.9707, | |
| "train_tokens_per_second": 6649.167 | |
| }, | |
| { | |
| "epoch": 0.17435897435897435, | |
| "grad_norm": 0.08669862151145935, | |
| "learning_rate": 0.00018450946643717729, | |
| "loss": 0.4597, | |
| "num_input_tokens_seen": 855360, | |
| "step": 51, | |
| "train_runtime": 128.5702, | |
| "train_tokens_per_second": 6652.866 | |
| }, | |
| { | |
| "epoch": 0.17777777777777778, | |
| "grad_norm": 0.10008913278579712, | |
| "learning_rate": 0.00018416523235800344, | |
| "loss": 0.4608, | |
| "num_input_tokens_seen": 869472, | |
| "step": 52, | |
| "train_runtime": 130.6754, | |
| "train_tokens_per_second": 6653.679 | |
| }, | |
| { | |
| "epoch": 0.1811965811965812, | |
| "grad_norm": 0.08692440390586853, | |
| "learning_rate": 0.00018382099827882962, | |
| "loss": 0.4229, | |
| "num_input_tokens_seen": 887936, | |
| "step": 53, | |
| "train_runtime": 133.3545, | |
| "train_tokens_per_second": 6658.462 | |
| }, | |
| { | |
| "epoch": 0.18461538461538463, | |
| "grad_norm": 0.12537947297096252, | |
| "learning_rate": 0.00018347676419965578, | |
| "loss": 0.5767, | |
| "num_input_tokens_seen": 902240, | |
| "step": 54, | |
| "train_runtime": 135.5092, | |
| "train_tokens_per_second": 6658.146 | |
| }, | |
| { | |
| "epoch": 0.18803418803418803, | |
| "grad_norm": 0.08537557721138, | |
| "learning_rate": 0.00018313253012048193, | |
| "loss": 0.4519, | |
| "num_input_tokens_seen": 920688, | |
| "step": 55, | |
| "train_runtime": 138.1817, | |
| "train_tokens_per_second": 6662.881 | |
| }, | |
| { | |
| "epoch": 0.19145299145299147, | |
| "grad_norm": 0.09388847649097443, | |
| "learning_rate": 0.00018278829604130808, | |
| "loss": 0.4083, | |
| "num_input_tokens_seen": 937024, | |
| "step": 56, | |
| "train_runtime": 140.574, | |
| "train_tokens_per_second": 6665.697 | |
| }, | |
| { | |
| "epoch": 0.19487179487179487, | |
| "grad_norm": 0.12476610392332077, | |
| "learning_rate": 0.00018244406196213427, | |
| "loss": 0.457, | |
| "num_input_tokens_seen": 949568, | |
| "step": 57, | |
| "train_runtime": 142.4521, | |
| "train_tokens_per_second": 6665.875 | |
| }, | |
| { | |
| "epoch": 0.19829059829059828, | |
| "grad_norm": 0.11227541416883469, | |
| "learning_rate": 0.00018209982788296042, | |
| "loss": 0.4666, | |
| "num_input_tokens_seen": 964000, | |
| "step": 58, | |
| "train_runtime": 144.5997, | |
| "train_tokens_per_second": 6666.681 | |
| }, | |
| { | |
| "epoch": 0.20170940170940171, | |
| "grad_norm": 0.10149527341127396, | |
| "learning_rate": 0.0001817555938037866, | |
| "loss": 0.473, | |
| "num_input_tokens_seen": 976560, | |
| "step": 59, | |
| "train_runtime": 146.4793, | |
| "train_tokens_per_second": 6666.883 | |
| }, | |
| { | |
| "epoch": 0.20170940170940171, | |
| "eval_loss": 0.4301406145095825, | |
| "eval_runtime": 11.8663, | |
| "eval_samples_per_second": 84.104, | |
| "eval_steps_per_second": 5.309, | |
| "num_input_tokens_seen": 976560, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 0.20512820512820512, | |
| "grad_norm": 0.0855872854590416, | |
| "learning_rate": 0.00018141135972461273, | |
| "loss": 0.4248, | |
| "num_input_tokens_seen": 992944, | |
| "step": 60, | |
| "train_runtime": 160.7566, | |
| "train_tokens_per_second": 6176.693 | |
| }, | |
| { | |
| "epoch": 0.20854700854700856, | |
| "grad_norm": 0.11866864562034607, | |
| "learning_rate": 0.0001810671256454389, | |
| "loss": 0.537, | |
| "num_input_tokens_seen": 1005920, | |
| "step": 61, | |
| "train_runtime": 163.2145, | |
| "train_tokens_per_second": 6163.179 | |
| }, | |
| { | |
| "epoch": 0.21196581196581196, | |
| "grad_norm": 0.0955129861831665, | |
| "learning_rate": 0.00018072289156626507, | |
| "loss": 0.3983, | |
| "num_input_tokens_seen": 1022704, | |
| "step": 62, | |
| "train_runtime": 165.6518, | |
| "train_tokens_per_second": 6173.817 | |
| }, | |
| { | |
| "epoch": 0.2153846153846154, | |
| "grad_norm": 0.11176180094480515, | |
| "learning_rate": 0.00018037865748709125, | |
| "loss": 0.4392, | |
| "num_input_tokens_seen": 1038928, | |
| "step": 63, | |
| "train_runtime": 168.0352, | |
| "train_tokens_per_second": 6182.8 | |
| }, | |
| { | |
| "epoch": 0.2188034188034188, | |
| "grad_norm": 0.08749086409807205, | |
| "learning_rate": 0.00018003442340791737, | |
| "loss": 0.412, | |
| "num_input_tokens_seen": 1057504, | |
| "step": 64, | |
| "train_runtime": 170.7322, | |
| "train_tokens_per_second": 6193.934 | |
| }, | |
| { | |
| "epoch": 0.2222222222222222, | |
| "grad_norm": 0.10065372288227081, | |
| "learning_rate": 0.00017969018932874356, | |
| "loss": 0.4496, | |
| "num_input_tokens_seen": 1071952, | |
| "step": 65, | |
| "train_runtime": 172.8869, | |
| "train_tokens_per_second": 6200.307 | |
| }, | |
| { | |
| "epoch": 0.22564102564102564, | |
| "grad_norm": 0.09161035716533661, | |
| "learning_rate": 0.0001793459552495697, | |
| "loss": 0.4995, | |
| "num_input_tokens_seen": 1091408, | |
| "step": 66, | |
| "train_runtime": 175.7012, | |
| "train_tokens_per_second": 6211.727 | |
| }, | |
| { | |
| "epoch": 0.22905982905982905, | |
| "grad_norm": 0.08862069249153137, | |
| "learning_rate": 0.0001790017211703959, | |
| "loss": 0.4157, | |
| "num_input_tokens_seen": 1107040, | |
| "step": 67, | |
| "train_runtime": 178.0171, | |
| "train_tokens_per_second": 6218.728 | |
| }, | |
| { | |
| "epoch": 0.23247863247863249, | |
| "grad_norm": 0.09428606927394867, | |
| "learning_rate": 0.00017865748709122202, | |
| "loss": 0.4845, | |
| "num_input_tokens_seen": 1121712, | |
| "step": 68, | |
| "train_runtime": 180.2346, | |
| "train_tokens_per_second": 6223.624 | |
| }, | |
| { | |
| "epoch": 0.2358974358974359, | |
| "grad_norm": 0.1100679412484169, | |
| "learning_rate": 0.0001783132530120482, | |
| "loss": 0.4706, | |
| "num_input_tokens_seen": 1135664, | |
| "step": 69, | |
| "train_runtime": 182.3342, | |
| "train_tokens_per_second": 6228.477 | |
| }, | |
| { | |
| "epoch": 0.23931623931623933, | |
| "grad_norm": 0.10081252455711365, | |
| "learning_rate": 0.00017796901893287436, | |
| "loss": 0.4073, | |
| "num_input_tokens_seen": 1154224, | |
| "step": 70, | |
| "train_runtime": 185.0219, | |
| "train_tokens_per_second": 6238.31 | |
| }, | |
| { | |
| "epoch": 0.24273504273504273, | |
| "grad_norm": 0.08933307230472565, | |
| "learning_rate": 0.00017762478485370054, | |
| "loss": 0.4457, | |
| "num_input_tokens_seen": 1171424, | |
| "step": 71, | |
| "train_runtime": 187.5554, | |
| "train_tokens_per_second": 6245.75 | |
| }, | |
| { | |
| "epoch": 0.24615384615384617, | |
| "grad_norm": 0.0866895243525505, | |
| "learning_rate": 0.00017728055077452666, | |
| "loss": 0.3439, | |
| "num_input_tokens_seen": 1189504, | |
| "step": 72, | |
| "train_runtime": 190.1853, | |
| "train_tokens_per_second": 6254.449 | |
| }, | |
| { | |
| "epoch": 0.24957264957264957, | |
| "grad_norm": 0.09268927574157715, | |
| "learning_rate": 0.00017693631669535285, | |
| "loss": 0.4454, | |
| "num_input_tokens_seen": 1207600, | |
| "step": 73, | |
| "train_runtime": 192.8217, | |
| "train_tokens_per_second": 6262.782 | |
| }, | |
| { | |
| "epoch": 0.252991452991453, | |
| "grad_norm": 0.08207046240568161, | |
| "learning_rate": 0.000176592082616179, | |
| "loss": 0.4721, | |
| "num_input_tokens_seen": 1227552, | |
| "step": 74, | |
| "train_runtime": 195.7293, | |
| "train_tokens_per_second": 6271.682 | |
| }, | |
| { | |
| "epoch": 0.2564102564102564, | |
| "grad_norm": 0.08926599472761154, | |
| "learning_rate": 0.00017624784853700518, | |
| "loss": 0.5064, | |
| "num_input_tokens_seen": 1245984, | |
| "step": 75, | |
| "train_runtime": 198.439, | |
| "train_tokens_per_second": 6278.928 | |
| }, | |
| { | |
| "epoch": 0.25982905982905985, | |
| "grad_norm": 0.10555540025234222, | |
| "learning_rate": 0.00017590361445783134, | |
| "loss": 0.4264, | |
| "num_input_tokens_seen": 1259536, | |
| "step": 76, | |
| "train_runtime": 200.4904, | |
| "train_tokens_per_second": 6282.277 | |
| }, | |
| { | |
| "epoch": 0.26324786324786326, | |
| "grad_norm": 0.09617225080728531, | |
| "learning_rate": 0.0001755593803786575, | |
| "loss": 0.4686, | |
| "num_input_tokens_seen": 1278768, | |
| "step": 77, | |
| "train_runtime": 203.2722, | |
| "train_tokens_per_second": 6290.914 | |
| }, | |
| { | |
| "epoch": 0.26666666666666666, | |
| "grad_norm": 0.12434384226799011, | |
| "learning_rate": 0.00017521514629948364, | |
| "loss": 0.5939, | |
| "num_input_tokens_seen": 1292928, | |
| "step": 78, | |
| "train_runtime": 205.3845, | |
| "train_tokens_per_second": 6295.159 | |
| }, | |
| { | |
| "epoch": 0.27008547008547007, | |
| "grad_norm": 0.1012965589761734, | |
| "learning_rate": 0.00017487091222030983, | |
| "loss": 0.403, | |
| "num_input_tokens_seen": 1310160, | |
| "step": 79, | |
| "train_runtime": 207.8738, | |
| "train_tokens_per_second": 6302.671 | |
| }, | |
| { | |
| "epoch": 0.27350427350427353, | |
| "grad_norm": 0.08980307728052139, | |
| "learning_rate": 0.00017452667814113598, | |
| "loss": 0.3688, | |
| "num_input_tokens_seen": 1328608, | |
| "step": 80, | |
| "train_runtime": 210.5562, | |
| "train_tokens_per_second": 6309.993 | |
| }, | |
| { | |
| "epoch": 0.27692307692307694, | |
| "grad_norm": 0.09891822189092636, | |
| "learning_rate": 0.00017418244406196214, | |
| "loss": 0.4751, | |
| "num_input_tokens_seen": 1346016, | |
| "step": 81, | |
| "train_runtime": 213.0979, | |
| "train_tokens_per_second": 6316.422 | |
| }, | |
| { | |
| "epoch": 0.28034188034188035, | |
| "grad_norm": 0.10093598067760468, | |
| "learning_rate": 0.0001738382099827883, | |
| "loss": 0.5395, | |
| "num_input_tokens_seen": 1359184, | |
| "step": 82, | |
| "train_runtime": 215.139, | |
| "train_tokens_per_second": 6317.702 | |
| }, | |
| { | |
| "epoch": 0.28376068376068375, | |
| "grad_norm": 0.09215115010738373, | |
| "learning_rate": 0.00017349397590361447, | |
| "loss": 0.4067, | |
| "num_input_tokens_seen": 1374384, | |
| "step": 83, | |
| "train_runtime": 217.3721, | |
| "train_tokens_per_second": 6322.726 | |
| }, | |
| { | |
| "epoch": 0.28717948717948716, | |
| "grad_norm": 0.09286817163228989, | |
| "learning_rate": 0.00017314974182444063, | |
| "loss": 0.4327, | |
| "num_input_tokens_seen": 1395312, | |
| "step": 84, | |
| "train_runtime": 220.3981, | |
| "train_tokens_per_second": 6330.871 | |
| }, | |
| { | |
| "epoch": 0.2905982905982906, | |
| "grad_norm": 0.10269108414649963, | |
| "learning_rate": 0.00017280550774526678, | |
| "loss": 0.4137, | |
| "num_input_tokens_seen": 1410480, | |
| "step": 85, | |
| "train_runtime": 222.6432, | |
| "train_tokens_per_second": 6335.159 | |
| }, | |
| { | |
| "epoch": 0.294017094017094, | |
| "grad_norm": 0.11593605577945709, | |
| "learning_rate": 0.00017246127366609296, | |
| "loss": 0.488, | |
| "num_input_tokens_seen": 1423008, | |
| "step": 86, | |
| "train_runtime": 224.5645, | |
| "train_tokens_per_second": 6336.746 | |
| }, | |
| { | |
| "epoch": 0.29743589743589743, | |
| "grad_norm": 0.09121434390544891, | |
| "learning_rate": 0.00017211703958691912, | |
| "loss": 0.4372, | |
| "num_input_tokens_seen": 1443008, | |
| "step": 87, | |
| "train_runtime": 227.4516, | |
| "train_tokens_per_second": 6344.241 | |
| }, | |
| { | |
| "epoch": 0.30085470085470084, | |
| "grad_norm": 0.11658863723278046, | |
| "learning_rate": 0.00017177280550774527, | |
| "loss": 0.4129, | |
| "num_input_tokens_seen": 1457936, | |
| "step": 88, | |
| "train_runtime": 229.6543, | |
| "train_tokens_per_second": 6348.393 | |
| }, | |
| { | |
| "epoch": 0.30427350427350425, | |
| "grad_norm": 0.1077234074473381, | |
| "learning_rate": 0.00017142857142857143, | |
| "loss": 0.4311, | |
| "num_input_tokens_seen": 1471536, | |
| "step": 89, | |
| "train_runtime": 231.6871, | |
| "train_tokens_per_second": 6351.395 | |
| }, | |
| { | |
| "epoch": 0.3076923076923077, | |
| "grad_norm": 0.10258413106203079, | |
| "learning_rate": 0.0001710843373493976, | |
| "loss": 0.4856, | |
| "num_input_tokens_seen": 1486080, | |
| "step": 90, | |
| "train_runtime": 233.8589, | |
| "train_tokens_per_second": 6354.6 | |
| }, | |
| { | |
| "epoch": 0.3111111111111111, | |
| "grad_norm": 0.09048861265182495, | |
| "learning_rate": 0.00017074010327022376, | |
| "loss": 0.4573, | |
| "num_input_tokens_seen": 1501360, | |
| "step": 91, | |
| "train_runtime": 236.6697, | |
| "train_tokens_per_second": 6343.694 | |
| }, | |
| { | |
| "epoch": 0.3145299145299145, | |
| "grad_norm": 0.09616488963365555, | |
| "learning_rate": 0.00017039586919104992, | |
| "loss": 0.3533, | |
| "num_input_tokens_seen": 1521744, | |
| "step": 92, | |
| "train_runtime": 239.5612, | |
| "train_tokens_per_second": 6352.215 | |
| }, | |
| { | |
| "epoch": 0.31794871794871793, | |
| "grad_norm": 0.10119186341762543, | |
| "learning_rate": 0.00017005163511187607, | |
| "loss": 0.4687, | |
| "num_input_tokens_seen": 1538640, | |
| "step": 93, | |
| "train_runtime": 242.0203, | |
| "train_tokens_per_second": 6357.484 | |
| }, | |
| { | |
| "epoch": 0.3213675213675214, | |
| "grad_norm": 0.103726826608181, | |
| "learning_rate": 0.00016970740103270225, | |
| "loss": 0.43, | |
| "num_input_tokens_seen": 1553200, | |
| "step": 94, | |
| "train_runtime": 244.1818, | |
| "train_tokens_per_second": 6360.835 | |
| }, | |
| { | |
| "epoch": 0.3247863247863248, | |
| "grad_norm": 0.09369926899671555, | |
| "learning_rate": 0.0001693631669535284, | |
| "loss": 0.4155, | |
| "num_input_tokens_seen": 1571952, | |
| "step": 95, | |
| "train_runtime": 246.9205, | |
| "train_tokens_per_second": 6366.227 | |
| }, | |
| { | |
| "epoch": 0.3282051282051282, | |
| "grad_norm": 0.09061973541975021, | |
| "learning_rate": 0.0001690189328743546, | |
| "loss": 0.4044, | |
| "num_input_tokens_seen": 1584416, | |
| "step": 96, | |
| "train_runtime": 248.812, | |
| "train_tokens_per_second": 6367.924 | |
| }, | |
| { | |
| "epoch": 0.3316239316239316, | |
| "grad_norm": 0.08632508665323257, | |
| "learning_rate": 0.00016867469879518074, | |
| "loss": 0.405, | |
| "num_input_tokens_seen": 1604672, | |
| "step": 97, | |
| "train_runtime": 251.7603, | |
| "train_tokens_per_second": 6373.808 | |
| }, | |
| { | |
| "epoch": 0.335042735042735, | |
| "grad_norm": 0.08924511075019836, | |
| "learning_rate": 0.0001683304647160069, | |
| "loss": 0.4357, | |
| "num_input_tokens_seen": 1622608, | |
| "step": 98, | |
| "train_runtime": 254.3946, | |
| "train_tokens_per_second": 6378.311 | |
| }, | |
| { | |
| "epoch": 0.3384615384615385, | |
| "grad_norm": 0.10018568485975266, | |
| "learning_rate": 0.00016798623063683305, | |
| "loss": 0.4007, | |
| "num_input_tokens_seen": 1636752, | |
| "step": 99, | |
| "train_runtime": 256.4999, | |
| "train_tokens_per_second": 6381.101 | |
| }, | |
| { | |
| "epoch": 0.3418803418803419, | |
| "grad_norm": 0.08820787072181702, | |
| "learning_rate": 0.00016764199655765923, | |
| "loss": 0.3778, | |
| "num_input_tokens_seen": 1649408, | |
| "step": 100, | |
| "train_runtime": 258.3868, | |
| "train_tokens_per_second": 6383.484 | |
| }, | |
| { | |
| "epoch": 0.3452991452991453, | |
| "grad_norm": 0.10735058784484863, | |
| "learning_rate": 0.0001672977624784854, | |
| "loss": 0.5828, | |
| "num_input_tokens_seen": 1665776, | |
| "step": 101, | |
| "train_runtime": 260.7883, | |
| "train_tokens_per_second": 6387.466 | |
| }, | |
| { | |
| "epoch": 0.3487179487179487, | |
| "grad_norm": 0.09399764984846115, | |
| "learning_rate": 0.00016695352839931154, | |
| "loss": 0.4238, | |
| "num_input_tokens_seen": 1688816, | |
| "step": 102, | |
| "train_runtime": 264.0814, | |
| "train_tokens_per_second": 6395.059 | |
| }, | |
| { | |
| "epoch": 0.35213675213675216, | |
| "grad_norm": 0.0975056141614914, | |
| "learning_rate": 0.0001666092943201377, | |
| "loss": 0.4374, | |
| "num_input_tokens_seen": 1703456, | |
| "step": 103, | |
| "train_runtime": 266.2978, | |
| "train_tokens_per_second": 6396.807 | |
| }, | |
| { | |
| "epoch": 0.35555555555555557, | |
| "grad_norm": 0.09030232578516006, | |
| "learning_rate": 0.00016626506024096388, | |
| "loss": 0.448, | |
| "num_input_tokens_seen": 1724528, | |
| "step": 104, | |
| "train_runtime": 269.3165, | |
| "train_tokens_per_second": 6403.35 | |
| }, | |
| { | |
| "epoch": 0.358974358974359, | |
| "grad_norm": 0.10417474806308746, | |
| "learning_rate": 0.00016592082616179003, | |
| "loss": 0.4109, | |
| "num_input_tokens_seen": 1740768, | |
| "step": 105, | |
| "train_runtime": 271.6966, | |
| "train_tokens_per_second": 6407.029 | |
| }, | |
| { | |
| "epoch": 0.3623931623931624, | |
| "grad_norm": 0.10844124108552933, | |
| "learning_rate": 0.00016557659208261619, | |
| "loss": 0.4165, | |
| "num_input_tokens_seen": 1753632, | |
| "step": 106, | |
| "train_runtime": 273.6236, | |
| "train_tokens_per_second": 6408.921 | |
| }, | |
| { | |
| "epoch": 0.3658119658119658, | |
| "grad_norm": 0.08827276527881622, | |
| "learning_rate": 0.00016523235800344234, | |
| "loss": 0.4233, | |
| "num_input_tokens_seen": 1768480, | |
| "step": 107, | |
| "train_runtime": 275.8419, | |
| "train_tokens_per_second": 6411.209 | |
| }, | |
| { | |
| "epoch": 0.36923076923076925, | |
| "grad_norm": 0.10917767882347107, | |
| "learning_rate": 0.00016488812392426852, | |
| "loss": 0.4624, | |
| "num_input_tokens_seen": 1782800, | |
| "step": 108, | |
| "train_runtime": 277.9694, | |
| "train_tokens_per_second": 6413.656 | |
| }, | |
| { | |
| "epoch": 0.37264957264957266, | |
| "grad_norm": 0.10163897275924683, | |
| "learning_rate": 0.00016454388984509468, | |
| "loss": 0.4553, | |
| "num_input_tokens_seen": 1799008, | |
| "step": 109, | |
| "train_runtime": 280.3434, | |
| "train_tokens_per_second": 6417.158 | |
| }, | |
| { | |
| "epoch": 0.37606837606837606, | |
| "grad_norm": 0.10832331329584122, | |
| "learning_rate": 0.00016419965576592083, | |
| "loss": 0.359, | |
| "num_input_tokens_seen": 1811792, | |
| "step": 110, | |
| "train_runtime": 282.2797, | |
| "train_tokens_per_second": 6418.429 | |
| }, | |
| { | |
| "epoch": 0.37948717948717947, | |
| "grad_norm": 0.08609069138765335, | |
| "learning_rate": 0.00016385542168674699, | |
| "loss": 0.4809, | |
| "num_input_tokens_seen": 1828512, | |
| "step": 111, | |
| "train_runtime": 284.7476, | |
| "train_tokens_per_second": 6421.518 | |
| }, | |
| { | |
| "epoch": 0.38290598290598293, | |
| "grad_norm": 0.11904721707105637, | |
| "learning_rate": 0.00016351118760757317, | |
| "loss": 0.4375, | |
| "num_input_tokens_seen": 1849616, | |
| "step": 112, | |
| "train_runtime": 287.8004, | |
| "train_tokens_per_second": 6426.732 | |
| }, | |
| { | |
| "epoch": 0.38632478632478634, | |
| "grad_norm": 0.09531164169311523, | |
| "learning_rate": 0.00016316695352839932, | |
| "loss": 0.4484, | |
| "num_input_tokens_seen": 1866480, | |
| "step": 113, | |
| "train_runtime": 290.2693, | |
| "train_tokens_per_second": 6430.167 | |
| }, | |
| { | |
| "epoch": 0.38974358974358975, | |
| "grad_norm": 0.13019715249538422, | |
| "learning_rate": 0.0001628227194492255, | |
| "loss": 0.4285, | |
| "num_input_tokens_seen": 1881008, | |
| "step": 114, | |
| "train_runtime": 292.3998, | |
| "train_tokens_per_second": 6433.0 | |
| }, | |
| { | |
| "epoch": 0.39316239316239315, | |
| "grad_norm": 0.1122983917593956, | |
| "learning_rate": 0.00016247848537005163, | |
| "loss": 0.5555, | |
| "num_input_tokens_seen": 1893264, | |
| "step": 115, | |
| "train_runtime": 294.2603, | |
| "train_tokens_per_second": 6433.977 | |
| }, | |
| { | |
| "epoch": 0.39658119658119656, | |
| "grad_norm": 0.0886179730296135, | |
| "learning_rate": 0.0001621342512908778, | |
| "loss": 0.4052, | |
| "num_input_tokens_seen": 1911168, | |
| "step": 116, | |
| "train_runtime": 296.8399, | |
| "train_tokens_per_second": 6438.379 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 0.11588186770677567, | |
| "learning_rate": 0.00016179001721170397, | |
| "loss": 0.4881, | |
| "num_input_tokens_seen": 1922320, | |
| "step": 117, | |
| "train_runtime": 298.5272, | |
| "train_tokens_per_second": 6439.346 | |
| }, | |
| { | |
| "epoch": 0.40341880341880343, | |
| "grad_norm": 0.09329588711261749, | |
| "learning_rate": 0.00016144578313253015, | |
| "loss": 0.392, | |
| "num_input_tokens_seen": 1935888, | |
| "step": 118, | |
| "train_runtime": 300.5442, | |
| "train_tokens_per_second": 6441.276 | |
| }, | |
| { | |
| "epoch": 0.40341880341880343, | |
| "eval_loss": 0.4257439076900482, | |
| "eval_runtime": 11.8891, | |
| "eval_samples_per_second": 83.943, | |
| "eval_steps_per_second": 5.299, | |
| "num_input_tokens_seen": 1935888, | |
| "step": 118 | |
| }, | |
| { | |
| "epoch": 0.40683760683760684, | |
| "grad_norm": 0.09967512637376785, | |
| "learning_rate": 0.00016110154905335628, | |
| "loss": 0.4716, | |
| "num_input_tokens_seen": 1949360, | |
| "step": 119, | |
| "train_runtime": 314.4663, | |
| "train_tokens_per_second": 6198.947 | |
| }, | |
| { | |
| "epoch": 0.41025641025641024, | |
| "grad_norm": 0.08704519271850586, | |
| "learning_rate": 0.00016075731497418246, | |
| "loss": 0.3573, | |
| "num_input_tokens_seen": 1965152, | |
| "step": 120, | |
| "train_runtime": 316.7907, | |
| "train_tokens_per_second": 6203.314 | |
| }, | |
| { | |
| "epoch": 0.41367521367521365, | |
| "grad_norm": 0.09572669863700867, | |
| "learning_rate": 0.0001604130808950086, | |
| "loss": 0.3742, | |
| "num_input_tokens_seen": 1981632, | |
| "step": 121, | |
| "train_runtime": 319.7181, | |
| "train_tokens_per_second": 6198.06 | |
| }, | |
| { | |
| "epoch": 0.4170940170940171, | |
| "grad_norm": 0.09697537869215012, | |
| "learning_rate": 0.0001600688468158348, | |
| "loss": 0.4811, | |
| "num_input_tokens_seen": 1999488, | |
| "step": 122, | |
| "train_runtime": 322.3203, | |
| "train_tokens_per_second": 6203.42 | |
| }, | |
| { | |
| "epoch": 0.4205128205128205, | |
| "grad_norm": 0.10042616724967957, | |
| "learning_rate": 0.00015972461273666092, | |
| "loss": 0.4146, | |
| "num_input_tokens_seen": 2015360, | |
| "step": 123, | |
| "train_runtime": 324.66, | |
| "train_tokens_per_second": 6207.601 | |
| }, | |
| { | |
| "epoch": 0.4239316239316239, | |
| "grad_norm": 0.09732874482870102, | |
| "learning_rate": 0.0001593803786574871, | |
| "loss": 0.3647, | |
| "num_input_tokens_seen": 2029840, | |
| "step": 124, | |
| "train_runtime": 326.8173, | |
| "train_tokens_per_second": 6210.931 | |
| }, | |
| { | |
| "epoch": 0.42735042735042733, | |
| "grad_norm": 0.0899026021361351, | |
| "learning_rate": 0.00015903614457831326, | |
| "loss": 0.3614, | |
| "num_input_tokens_seen": 2043888, | |
| "step": 125, | |
| "train_runtime": 328.9033, | |
| "train_tokens_per_second": 6214.251 | |
| }, | |
| { | |
| "epoch": 0.4307692307692308, | |
| "grad_norm": 0.1127215027809143, | |
| "learning_rate": 0.00015869191049913944, | |
| "loss": 0.521, | |
| "num_input_tokens_seen": 2056784, | |
| "step": 126, | |
| "train_runtime": 330.847, | |
| "train_tokens_per_second": 6216.723 | |
| }, | |
| { | |
| "epoch": 0.4341880341880342, | |
| "grad_norm": 0.10900437831878662, | |
| "learning_rate": 0.00015834767641996557, | |
| "loss": 0.5004, | |
| "num_input_tokens_seen": 2073152, | |
| "step": 127, | |
| "train_runtime": 333.236, | |
| "train_tokens_per_second": 6221.272 | |
| }, | |
| { | |
| "epoch": 0.4376068376068376, | |
| "grad_norm": 0.10284293442964554, | |
| "learning_rate": 0.00015800344234079175, | |
| "loss": 0.4758, | |
| "num_input_tokens_seen": 2086832, | |
| "step": 128, | |
| "train_runtime": 335.3261, | |
| "train_tokens_per_second": 6223.291 | |
| }, | |
| { | |
| "epoch": 0.441025641025641, | |
| "grad_norm": 0.08526846766471863, | |
| "learning_rate": 0.0001576592082616179, | |
| "loss": 0.3601, | |
| "num_input_tokens_seen": 2102704, | |
| "step": 129, | |
| "train_runtime": 337.6773, | |
| "train_tokens_per_second": 6226.962 | |
| }, | |
| { | |
| "epoch": 0.4444444444444444, | |
| "grad_norm": 0.0935521200299263, | |
| "learning_rate": 0.00015731497418244408, | |
| "loss": 0.4191, | |
| "num_input_tokens_seen": 2120672, | |
| "step": 130, | |
| "train_runtime": 340.2901, | |
| "train_tokens_per_second": 6231.953 | |
| }, | |
| { | |
| "epoch": 0.4478632478632479, | |
| "grad_norm": 0.09808618575334549, | |
| "learning_rate": 0.00015697074010327024, | |
| "loss": 0.432, | |
| "num_input_tokens_seen": 2134528, | |
| "step": 131, | |
| "train_runtime": 342.374, | |
| "train_tokens_per_second": 6234.492 | |
| }, | |
| { | |
| "epoch": 0.4512820512820513, | |
| "grad_norm": 0.08662474900484085, | |
| "learning_rate": 0.0001566265060240964, | |
| "loss": 0.4311, | |
| "num_input_tokens_seen": 2150768, | |
| "step": 132, | |
| "train_runtime": 344.7887, | |
| "train_tokens_per_second": 6237.931 | |
| }, | |
| { | |
| "epoch": 0.4547008547008547, | |
| "grad_norm": 0.09085840731859207, | |
| "learning_rate": 0.00015628227194492255, | |
| "loss": 0.4223, | |
| "num_input_tokens_seen": 2171536, | |
| "step": 133, | |
| "train_runtime": 347.7754, | |
| "train_tokens_per_second": 6244.076 | |
| }, | |
| { | |
| "epoch": 0.4581196581196581, | |
| "grad_norm": 0.1134534478187561, | |
| "learning_rate": 0.00015593803786574873, | |
| "loss": 0.4995, | |
| "num_input_tokens_seen": 2187392, | |
| "step": 134, | |
| "train_runtime": 350.1232, | |
| "train_tokens_per_second": 6247.493 | |
| }, | |
| { | |
| "epoch": 0.46153846153846156, | |
| "grad_norm": 0.0914321318268776, | |
| "learning_rate": 0.00015559380378657488, | |
| "loss": 0.3414, | |
| "num_input_tokens_seen": 2208736, | |
| "step": 135, | |
| "train_runtime": 353.1913, | |
| "train_tokens_per_second": 6253.653 | |
| }, | |
| { | |
| "epoch": 0.46495726495726497, | |
| "grad_norm": 0.09697174280881882, | |
| "learning_rate": 0.00015524956970740104, | |
| "loss": 0.4192, | |
| "num_input_tokens_seen": 2221520, | |
| "step": 136, | |
| "train_runtime": 355.1021, | |
| "train_tokens_per_second": 6256.004 | |
| }, | |
| { | |
| "epoch": 0.4683760683760684, | |
| "grad_norm": 0.09903775900602341, | |
| "learning_rate": 0.0001549053356282272, | |
| "loss": 0.4107, | |
| "num_input_tokens_seen": 2234736, | |
| "step": 137, | |
| "train_runtime": 357.0576, | |
| "train_tokens_per_second": 6258.755 | |
| }, | |
| { | |
| "epoch": 0.4717948717948718, | |
| "grad_norm": 0.10500401258468628, | |
| "learning_rate": 0.00015456110154905337, | |
| "loss": 0.4507, | |
| "num_input_tokens_seen": 2246432, | |
| "step": 138, | |
| "train_runtime": 358.8165, | |
| "train_tokens_per_second": 6260.671 | |
| }, | |
| { | |
| "epoch": 0.4752136752136752, | |
| "grad_norm": 0.10770396888256073, | |
| "learning_rate": 0.00015421686746987953, | |
| "loss": 0.4844, | |
| "num_input_tokens_seen": 2264496, | |
| "step": 139, | |
| "train_runtime": 361.4046, | |
| "train_tokens_per_second": 6265.82 | |
| }, | |
| { | |
| "epoch": 0.47863247863247865, | |
| "grad_norm": 0.09635472297668457, | |
| "learning_rate": 0.00015387263339070568, | |
| "loss": 0.3587, | |
| "num_input_tokens_seen": 2279664, | |
| "step": 140, | |
| "train_runtime": 363.662, | |
| "train_tokens_per_second": 6268.634 | |
| }, | |
| { | |
| "epoch": 0.48205128205128206, | |
| "grad_norm": 0.10260126739740372, | |
| "learning_rate": 0.00015352839931153184, | |
| "loss": 0.4402, | |
| "num_input_tokens_seen": 2294976, | |
| "step": 141, | |
| "train_runtime": 365.9416, | |
| "train_tokens_per_second": 6271.427 | |
| }, | |
| { | |
| "epoch": 0.48547008547008547, | |
| "grad_norm": 0.11078032851219177, | |
| "learning_rate": 0.00015318416523235802, | |
| "loss": 0.4819, | |
| "num_input_tokens_seen": 2310256, | |
| "step": 142, | |
| "train_runtime": 368.2151, | |
| "train_tokens_per_second": 6274.202 | |
| }, | |
| { | |
| "epoch": 0.4888888888888889, | |
| "grad_norm": 0.08946855366230011, | |
| "learning_rate": 0.00015283993115318417, | |
| "loss": 0.3455, | |
| "num_input_tokens_seen": 2332160, | |
| "step": 143, | |
| "train_runtime": 371.3782, | |
| "train_tokens_per_second": 6279.745 | |
| }, | |
| { | |
| "epoch": 0.49230769230769234, | |
| "grad_norm": 0.089847132563591, | |
| "learning_rate": 0.00015249569707401033, | |
| "loss": 0.3624, | |
| "num_input_tokens_seen": 2346720, | |
| "step": 144, | |
| "train_runtime": 373.5395, | |
| "train_tokens_per_second": 6282.389 | |
| }, | |
| { | |
| "epoch": 0.49572649572649574, | |
| "grad_norm": 0.10344398766756058, | |
| "learning_rate": 0.00015215146299483648, | |
| "loss": 0.4373, | |
| "num_input_tokens_seen": 2360992, | |
| "step": 145, | |
| "train_runtime": 375.6328, | |
| "train_tokens_per_second": 6285.372 | |
| }, | |
| { | |
| "epoch": 0.49914529914529915, | |
| "grad_norm": 0.10121628642082214, | |
| "learning_rate": 0.00015180722891566266, | |
| "loss": 0.4471, | |
| "num_input_tokens_seen": 2375680, | |
| "step": 146, | |
| "train_runtime": 377.7982, | |
| "train_tokens_per_second": 6288.226 | |
| }, | |
| { | |
| "epoch": 0.5025641025641026, | |
| "grad_norm": 0.08698102086782455, | |
| "learning_rate": 0.00015146299483648882, | |
| "loss": 0.3908, | |
| "num_input_tokens_seen": 2397024, | |
| "step": 147, | |
| "train_runtime": 380.8567, | |
| "train_tokens_per_second": 6293.768 | |
| }, | |
| { | |
| "epoch": 0.505982905982906, | |
| "grad_norm": 0.08766576647758484, | |
| "learning_rate": 0.000151118760757315, | |
| "loss": 0.3881, | |
| "num_input_tokens_seen": 2414128, | |
| "step": 148, | |
| "train_runtime": 383.3371, | |
| "train_tokens_per_second": 6297.663 | |
| }, | |
| { | |
| "epoch": 0.5094017094017094, | |
| "grad_norm": 0.10594574362039566, | |
| "learning_rate": 0.00015077452667814113, | |
| "loss": 0.3554, | |
| "num_input_tokens_seen": 2430736, | |
| "step": 149, | |
| "train_runtime": 385.7797, | |
| "train_tokens_per_second": 6300.84 | |
| }, | |
| { | |
| "epoch": 0.5128205128205128, | |
| "grad_norm": 0.10977370291948318, | |
| "learning_rate": 0.0001504302925989673, | |
| "loss": 0.4906, | |
| "num_input_tokens_seen": 2449856, | |
| "step": 150, | |
| "train_runtime": 388.5377, | |
| "train_tokens_per_second": 6305.324 | |
| }, | |
| { | |
| "epoch": 0.5162393162393163, | |
| "grad_norm": 0.09074017405509949, | |
| "learning_rate": 0.00015008605851979346, | |
| "loss": 0.4157, | |
| "num_input_tokens_seen": 2467024, | |
| "step": 151, | |
| "train_runtime": 391.5399, | |
| "train_tokens_per_second": 6300.824 | |
| }, | |
| { | |
| "epoch": 0.5196581196581197, | |
| "grad_norm": 0.08705534040927887, | |
| "learning_rate": 0.00014974182444061964, | |
| "loss": 0.3707, | |
| "num_input_tokens_seen": 2485488, | |
| "step": 152, | |
| "train_runtime": 394.1859, | |
| "train_tokens_per_second": 6305.37 | |
| }, | |
| { | |
| "epoch": 0.5230769230769231, | |
| "grad_norm": 0.09123992174863815, | |
| "learning_rate": 0.00014939759036144577, | |
| "loss": 0.4008, | |
| "num_input_tokens_seen": 2501296, | |
| "step": 153, | |
| "train_runtime": 396.5327, | |
| "train_tokens_per_second": 6307.918 | |
| }, | |
| { | |
| "epoch": 0.5264957264957265, | |
| "grad_norm": 0.07104610651731491, | |
| "learning_rate": 0.00014905335628227195, | |
| "loss": 0.3379, | |
| "num_input_tokens_seen": 2529040, | |
| "step": 154, | |
| "train_runtime": 400.4284, | |
| "train_tokens_per_second": 6315.835 | |
| }, | |
| { | |
| "epoch": 0.5299145299145299, | |
| "grad_norm": 0.11433000862598419, | |
| "learning_rate": 0.0001487091222030981, | |
| "loss": 0.5056, | |
| "num_input_tokens_seen": 2544496, | |
| "step": 155, | |
| "train_runtime": 402.6965, | |
| "train_tokens_per_second": 6318.645 | |
| }, | |
| { | |
| "epoch": 0.5333333333333333, | |
| "grad_norm": 0.12911392748355865, | |
| "learning_rate": 0.0001483648881239243, | |
| "loss": 0.4726, | |
| "num_input_tokens_seen": 2558704, | |
| "step": 156, | |
| "train_runtime": 404.78, | |
| "train_tokens_per_second": 6321.221 | |
| }, | |
| { | |
| "epoch": 0.5367521367521367, | |
| "grad_norm": 0.11388979107141495, | |
| "learning_rate": 0.00014802065404475042, | |
| "loss": 0.44, | |
| "num_input_tokens_seen": 2571648, | |
| "step": 157, | |
| "train_runtime": 406.7058, | |
| "train_tokens_per_second": 6323.115 | |
| }, | |
| { | |
| "epoch": 0.5401709401709401, | |
| "grad_norm": 0.1020691767334938, | |
| "learning_rate": 0.0001476764199655766, | |
| "loss": 0.5144, | |
| "num_input_tokens_seen": 2585280, | |
| "step": 158, | |
| "train_runtime": 408.7686, | |
| "train_tokens_per_second": 6324.556 | |
| }, | |
| { | |
| "epoch": 0.5435897435897435, | |
| "grad_norm": 0.11266439408063889, | |
| "learning_rate": 0.00014733218588640275, | |
| "loss": 0.4898, | |
| "num_input_tokens_seen": 2602560, | |
| "step": 159, | |
| "train_runtime": 411.2897, | |
| "train_tokens_per_second": 6327.802 | |
| }, | |
| { | |
| "epoch": 0.5470085470085471, | |
| "grad_norm": 0.09511423856019974, | |
| "learning_rate": 0.00014698795180722893, | |
| "loss": 0.4601, | |
| "num_input_tokens_seen": 2617520, | |
| "step": 160, | |
| "train_runtime": 413.5019, | |
| "train_tokens_per_second": 6330.127 | |
| }, | |
| { | |
| "epoch": 0.5504273504273505, | |
| "grad_norm": 0.08593633025884628, | |
| "learning_rate": 0.0001466437177280551, | |
| "loss": 0.3578, | |
| "num_input_tokens_seen": 2638032, | |
| "step": 161, | |
| "train_runtime": 416.4729, | |
| "train_tokens_per_second": 6334.222 | |
| }, | |
| { | |
| "epoch": 0.5538461538461539, | |
| "grad_norm": 0.10547275096178055, | |
| "learning_rate": 0.00014629948364888124, | |
| "loss": 0.4053, | |
| "num_input_tokens_seen": 2652912, | |
| "step": 162, | |
| "train_runtime": 418.6689, | |
| "train_tokens_per_second": 6336.54 | |
| }, | |
| { | |
| "epoch": 0.5572649572649573, | |
| "grad_norm": 0.11780176311731339, | |
| "learning_rate": 0.0001459552495697074, | |
| "loss": 0.4034, | |
| "num_input_tokens_seen": 2664944, | |
| "step": 163, | |
| "train_runtime": 420.4837, | |
| "train_tokens_per_second": 6337.806 | |
| }, | |
| { | |
| "epoch": 0.5606837606837607, | |
| "grad_norm": 0.098305843770504, | |
| "learning_rate": 0.00014561101549053358, | |
| "loss": 0.4804, | |
| "num_input_tokens_seen": 2680720, | |
| "step": 164, | |
| "train_runtime": 422.8103, | |
| "train_tokens_per_second": 6340.243 | |
| }, | |
| { | |
| "epoch": 0.5641025641025641, | |
| "grad_norm": 0.08514019846916199, | |
| "learning_rate": 0.00014526678141135973, | |
| "loss": 0.4623, | |
| "num_input_tokens_seen": 2693696, | |
| "step": 165, | |
| "train_runtime": 424.733, | |
| "train_tokens_per_second": 6342.093 | |
| }, | |
| { | |
| "epoch": 0.5675213675213675, | |
| "grad_norm": 0.10156818479299545, | |
| "learning_rate": 0.0001449225473321859, | |
| "loss": 0.4374, | |
| "num_input_tokens_seen": 2706672, | |
| "step": 166, | |
| "train_runtime": 426.6739, | |
| "train_tokens_per_second": 6343.655 | |
| }, | |
| { | |
| "epoch": 0.5709401709401709, | |
| "grad_norm": 0.09817566722631454, | |
| "learning_rate": 0.00014457831325301204, | |
| "loss": 0.3713, | |
| "num_input_tokens_seen": 2717856, | |
| "step": 167, | |
| "train_runtime": 428.3605, | |
| "train_tokens_per_second": 6344.787 | |
| }, | |
| { | |
| "epoch": 0.5743589743589743, | |
| "grad_norm": 0.08898711949586868, | |
| "learning_rate": 0.00014423407917383822, | |
| "loss": 0.3958, | |
| "num_input_tokens_seen": 2738048, | |
| "step": 168, | |
| "train_runtime": 431.2652, | |
| "train_tokens_per_second": 6348.873 | |
| }, | |
| { | |
| "epoch": 0.5777777777777777, | |
| "grad_norm": 0.10815781354904175, | |
| "learning_rate": 0.00014388984509466438, | |
| "loss": 0.4212, | |
| "num_input_tokens_seen": 2751264, | |
| "step": 169, | |
| "train_runtime": 433.2567, | |
| "train_tokens_per_second": 6350.193 | |
| }, | |
| { | |
| "epoch": 0.5811965811965812, | |
| "grad_norm": 0.0858953520655632, | |
| "learning_rate": 0.00014354561101549053, | |
| "loss": 0.4252, | |
| "num_input_tokens_seen": 2768352, | |
| "step": 170, | |
| "train_runtime": 435.7397, | |
| "train_tokens_per_second": 6353.224 | |
| }, | |
| { | |
| "epoch": 0.5846153846153846, | |
| "grad_norm": 0.1065724790096283, | |
| "learning_rate": 0.0001432013769363167, | |
| "loss": 0.4376, | |
| "num_input_tokens_seen": 2783696, | |
| "step": 171, | |
| "train_runtime": 438.0174, | |
| "train_tokens_per_second": 6355.217 | |
| }, | |
| { | |
| "epoch": 0.588034188034188, | |
| "grad_norm": 0.0936359241604805, | |
| "learning_rate": 0.00014285714285714287, | |
| "loss": 0.4641, | |
| "num_input_tokens_seen": 2797712, | |
| "step": 172, | |
| "train_runtime": 440.1373, | |
| "train_tokens_per_second": 6356.452 | |
| }, | |
| { | |
| "epoch": 0.5914529914529915, | |
| "grad_norm": 0.10138653963804245, | |
| "learning_rate": 0.00014251290877796902, | |
| "loss": 0.4442, | |
| "num_input_tokens_seen": 2812432, | |
| "step": 173, | |
| "train_runtime": 442.3579, | |
| "train_tokens_per_second": 6357.821 | |
| }, | |
| { | |
| "epoch": 0.5948717948717949, | |
| "grad_norm": 0.10231815278530121, | |
| "learning_rate": 0.00014216867469879518, | |
| "loss": 0.4113, | |
| "num_input_tokens_seen": 2824544, | |
| "step": 174, | |
| "train_runtime": 444.2041, | |
| "train_tokens_per_second": 6358.663 | |
| }, | |
| { | |
| "epoch": 0.5982905982905983, | |
| "grad_norm": 0.10455156117677689, | |
| "learning_rate": 0.00014182444061962136, | |
| "loss": 0.5237, | |
| "num_input_tokens_seen": 2841296, | |
| "step": 175, | |
| "train_runtime": 446.6226, | |
| "train_tokens_per_second": 6361.738 | |
| }, | |
| { | |
| "epoch": 0.6017094017094017, | |
| "grad_norm": 0.09039057046175003, | |
| "learning_rate": 0.0001414802065404475, | |
| "loss": 0.4316, | |
| "num_input_tokens_seen": 2854304, | |
| "step": 176, | |
| "train_runtime": 448.5655, | |
| "train_tokens_per_second": 6363.182 | |
| }, | |
| { | |
| "epoch": 0.6051282051282051, | |
| "grad_norm": 0.09800916165113449, | |
| "learning_rate": 0.00014113597246127367, | |
| "loss": 0.4883, | |
| "num_input_tokens_seen": 2871312, | |
| "step": 177, | |
| "train_runtime": 451.0616, | |
| "train_tokens_per_second": 6365.676 | |
| }, | |
| { | |
| "epoch": 0.6051282051282051, | |
| "eval_loss": 0.4250277280807495, | |
| "eval_runtime": 11.8943, | |
| "eval_samples_per_second": 83.906, | |
| "eval_steps_per_second": 5.297, | |
| "num_input_tokens_seen": 2871312, | |
| "step": 177 | |
| }, | |
| { | |
| "epoch": 0.6085470085470085, | |
| "grad_norm": 0.1056000217795372, | |
| "learning_rate": 0.00014079173838209982, | |
| "loss": 0.3984, | |
| "num_input_tokens_seen": 2882896, | |
| "step": 178, | |
| "train_runtime": 464.7282, | |
| "train_tokens_per_second": 6203.403 | |
| }, | |
| { | |
| "epoch": 0.611965811965812, | |
| "grad_norm": 0.10022575408220291, | |
| "learning_rate": 0.000140447504302926, | |
| "loss": 0.3613, | |
| "num_input_tokens_seen": 2897328, | |
| "step": 179, | |
| "train_runtime": 466.8908, | |
| "train_tokens_per_second": 6205.58 | |
| }, | |
| { | |
| "epoch": 0.6153846153846154, | |
| "grad_norm": 0.10060451924800873, | |
| "learning_rate": 0.00014010327022375216, | |
| "loss": 0.505, | |
| "num_input_tokens_seen": 2910544, | |
| "step": 180, | |
| "train_runtime": 468.834, | |
| "train_tokens_per_second": 6208.049 | |
| }, | |
| { | |
| "epoch": 0.6188034188034188, | |
| "grad_norm": 0.10652410238981247, | |
| "learning_rate": 0.00013975903614457834, | |
| "loss": 0.456, | |
| "num_input_tokens_seen": 2921712, | |
| "step": 181, | |
| "train_runtime": 471.0911, | |
| "train_tokens_per_second": 6202.01 | |
| }, | |
| { | |
| "epoch": 0.6222222222222222, | |
| "grad_norm": 0.1084052249789238, | |
| "learning_rate": 0.00013941480206540447, | |
| "loss": 0.3833, | |
| "num_input_tokens_seen": 2932832, | |
| "step": 182, | |
| "train_runtime": 472.7877, | |
| "train_tokens_per_second": 6203.274 | |
| }, | |
| { | |
| "epoch": 0.6256410256410256, | |
| "grad_norm": 0.09704000502824783, | |
| "learning_rate": 0.00013907056798623065, | |
| "loss": 0.4889, | |
| "num_input_tokens_seen": 2947600, | |
| "step": 183, | |
| "train_runtime": 474.9298, | |
| "train_tokens_per_second": 6206.391 | |
| }, | |
| { | |
| "epoch": 0.629059829059829, | |
| "grad_norm": 0.09996459633111954, | |
| "learning_rate": 0.0001387263339070568, | |
| "loss": 0.3787, | |
| "num_input_tokens_seen": 2963088, | |
| "step": 184, | |
| "train_runtime": 477.2542, | |
| "train_tokens_per_second": 6208.616 | |
| }, | |
| { | |
| "epoch": 0.6324786324786325, | |
| "grad_norm": 0.09264053404331207, | |
| "learning_rate": 0.00013838209982788298, | |
| "loss": 0.3498, | |
| "num_input_tokens_seen": 2975088, | |
| "step": 185, | |
| "train_runtime": 479.0775, | |
| "train_tokens_per_second": 6210.035 | |
| }, | |
| { | |
| "epoch": 0.6358974358974359, | |
| "grad_norm": 0.09588699042797089, | |
| "learning_rate": 0.00013803786574870914, | |
| "loss": 0.485, | |
| "num_input_tokens_seen": 2988944, | |
| "step": 186, | |
| "train_runtime": 481.1581, | |
| "train_tokens_per_second": 6211.978 | |
| }, | |
| { | |
| "epoch": 0.6393162393162393, | |
| "grad_norm": 0.09032841771841049, | |
| "learning_rate": 0.0001376936316695353, | |
| "loss": 0.4083, | |
| "num_input_tokens_seen": 3006016, | |
| "step": 187, | |
| "train_runtime": 483.6506, | |
| "train_tokens_per_second": 6215.264 | |
| }, | |
| { | |
| "epoch": 0.6427350427350428, | |
| "grad_norm": 0.11055252701044083, | |
| "learning_rate": 0.00013734939759036145, | |
| "loss": 0.4339, | |
| "num_input_tokens_seen": 3018096, | |
| "step": 188, | |
| "train_runtime": 485.4309, | |
| "train_tokens_per_second": 6217.355 | |
| }, | |
| { | |
| "epoch": 0.6461538461538462, | |
| "grad_norm": 0.12127861380577087, | |
| "learning_rate": 0.00013700516351118763, | |
| "loss": 0.4601, | |
| "num_input_tokens_seen": 3031280, | |
| "step": 189, | |
| "train_runtime": 487.4282, | |
| "train_tokens_per_second": 6218.926 | |
| }, | |
| { | |
| "epoch": 0.6495726495726496, | |
| "grad_norm": 0.10579859465360641, | |
| "learning_rate": 0.00013666092943201378, | |
| "loss": 0.4519, | |
| "num_input_tokens_seen": 3046560, | |
| "step": 190, | |
| "train_runtime": 489.6819, | |
| "train_tokens_per_second": 6221.508 | |
| }, | |
| { | |
| "epoch": 0.652991452991453, | |
| "grad_norm": 0.1086781919002533, | |
| "learning_rate": 0.00013631669535283994, | |
| "loss": 0.4843, | |
| "num_input_tokens_seen": 3061024, | |
| "step": 191, | |
| "train_runtime": 491.8462, | |
| "train_tokens_per_second": 6223.539 | |
| }, | |
| { | |
| "epoch": 0.6564102564102564, | |
| "grad_norm": 0.09214667230844498, | |
| "learning_rate": 0.0001359724612736661, | |
| "loss": 0.43, | |
| "num_input_tokens_seen": 3076848, | |
| "step": 192, | |
| "train_runtime": 494.2062, | |
| "train_tokens_per_second": 6225.839 | |
| }, | |
| { | |
| "epoch": 0.6598290598290598, | |
| "grad_norm": 0.11928390711545944, | |
| "learning_rate": 0.00013562822719449227, | |
| "loss": 0.5062, | |
| "num_input_tokens_seen": 3092208, | |
| "step": 193, | |
| "train_runtime": 496.4458, | |
| "train_tokens_per_second": 6228.692 | |
| }, | |
| { | |
| "epoch": 0.6632478632478632, | |
| "grad_norm": 0.09398146718740463, | |
| "learning_rate": 0.00013528399311531843, | |
| "loss": 0.372, | |
| "num_input_tokens_seen": 3103168, | |
| "step": 194, | |
| "train_runtime": 498.1054, | |
| "train_tokens_per_second": 6229.943 | |
| }, | |
| { | |
| "epoch": 0.6666666666666666, | |
| "grad_norm": 0.08932854235172272, | |
| "learning_rate": 0.00013493975903614458, | |
| "loss": 0.4515, | |
| "num_input_tokens_seen": 3120512, | |
| "step": 195, | |
| "train_runtime": 500.6536, | |
| "train_tokens_per_second": 6232.877 | |
| }, | |
| { | |
| "epoch": 0.67008547008547, | |
| "grad_norm": 0.09448716044425964, | |
| "learning_rate": 0.00013459552495697074, | |
| "loss": 0.4346, | |
| "num_input_tokens_seen": 3136544, | |
| "step": 196, | |
| "train_runtime": 503.0211, | |
| "train_tokens_per_second": 6235.412 | |
| }, | |
| { | |
| "epoch": 0.6735042735042736, | |
| "grad_norm": 0.09740068763494492, | |
| "learning_rate": 0.00013425129087779692, | |
| "loss": 0.3846, | |
| "num_input_tokens_seen": 3152720, | |
| "step": 197, | |
| "train_runtime": 505.3917, | |
| "train_tokens_per_second": 6238.172 | |
| }, | |
| { | |
| "epoch": 0.676923076923077, | |
| "grad_norm": 0.10378974676132202, | |
| "learning_rate": 0.00013390705679862307, | |
| "loss": 0.4808, | |
| "num_input_tokens_seen": 3167392, | |
| "step": 198, | |
| "train_runtime": 507.5697, | |
| "train_tokens_per_second": 6240.31 | |
| }, | |
| { | |
| "epoch": 0.6803418803418804, | |
| "grad_norm": 0.08869824558496475, | |
| "learning_rate": 0.00013356282271944923, | |
| "loss": 0.387, | |
| "num_input_tokens_seen": 3186496, | |
| "step": 199, | |
| "train_runtime": 510.3483, | |
| "train_tokens_per_second": 6243.767 | |
| }, | |
| { | |
| "epoch": 0.6837606837606838, | |
| "grad_norm": 0.09974192827939987, | |
| "learning_rate": 0.00013321858864027538, | |
| "loss": 0.4512, | |
| "num_input_tokens_seen": 3205344, | |
| "step": 200, | |
| "train_runtime": 513.0801, | |
| "train_tokens_per_second": 6247.259 | |
| }, | |
| { | |
| "epoch": 0.6871794871794872, | |
| "grad_norm": 0.08839447796344757, | |
| "learning_rate": 0.00013287435456110156, | |
| "loss": 0.4027, | |
| "num_input_tokens_seen": 3222720, | |
| "step": 201, | |
| "train_runtime": 515.6265, | |
| "train_tokens_per_second": 6250.106 | |
| }, | |
| { | |
| "epoch": 0.6905982905982906, | |
| "grad_norm": 0.07892576605081558, | |
| "learning_rate": 0.00013253012048192772, | |
| "loss": 0.3836, | |
| "num_input_tokens_seen": 3247392, | |
| "step": 202, | |
| "train_runtime": 519.1427, | |
| "train_tokens_per_second": 6255.297 | |
| }, | |
| { | |
| "epoch": 0.694017094017094, | |
| "grad_norm": 0.09967231005430222, | |
| "learning_rate": 0.0001321858864027539, | |
| "loss": 0.6602, | |
| "num_input_tokens_seen": 3263344, | |
| "step": 203, | |
| "train_runtime": 521.4876, | |
| "train_tokens_per_second": 6257.76 | |
| }, | |
| { | |
| "epoch": 0.6974358974358974, | |
| "grad_norm": 0.09928127378225327, | |
| "learning_rate": 0.00013184165232358003, | |
| "loss": 0.3557, | |
| "num_input_tokens_seen": 3275472, | |
| "step": 204, | |
| "train_runtime": 523.3642, | |
| "train_tokens_per_second": 6258.494 | |
| }, | |
| { | |
| "epoch": 0.7008547008547008, | |
| "grad_norm": 0.10789816826581955, | |
| "learning_rate": 0.0001314974182444062, | |
| "loss": 0.3937, | |
| "num_input_tokens_seen": 3293904, | |
| "step": 205, | |
| "train_runtime": 526.0362, | |
| "train_tokens_per_second": 6261.744 | |
| }, | |
| { | |
| "epoch": 0.7042735042735043, | |
| "grad_norm": 0.10802796483039856, | |
| "learning_rate": 0.00013115318416523236, | |
| "loss": 0.4472, | |
| "num_input_tokens_seen": 3309584, | |
| "step": 206, | |
| "train_runtime": 528.3293, | |
| "train_tokens_per_second": 6264.245 | |
| }, | |
| { | |
| "epoch": 0.7076923076923077, | |
| "grad_norm": 0.09764997661113739, | |
| "learning_rate": 0.00013080895008605854, | |
| "loss": 0.457, | |
| "num_input_tokens_seen": 3323776, | |
| "step": 207, | |
| "train_runtime": 530.4461, | |
| "train_tokens_per_second": 6266.002 | |
| }, | |
| { | |
| "epoch": 0.7111111111111111, | |
| "grad_norm": 0.10141371190547943, | |
| "learning_rate": 0.00013046471600688467, | |
| "loss": 0.4036, | |
| "num_input_tokens_seen": 3339600, | |
| "step": 208, | |
| "train_runtime": 532.7571, | |
| "train_tokens_per_second": 6268.523 | |
| }, | |
| { | |
| "epoch": 0.7145299145299145, | |
| "grad_norm": 0.11183507740497589, | |
| "learning_rate": 0.00013012048192771085, | |
| "loss": 0.4412, | |
| "num_input_tokens_seen": 3353280, | |
| "step": 209, | |
| "train_runtime": 534.8217, | |
| "train_tokens_per_second": 6269.902 | |
| }, | |
| { | |
| "epoch": 0.717948717948718, | |
| "grad_norm": 0.1051330491900444, | |
| "learning_rate": 0.000129776247848537, | |
| "loss": 0.4337, | |
| "num_input_tokens_seen": 3369296, | |
| "step": 210, | |
| "train_runtime": 537.1671, | |
| "train_tokens_per_second": 6272.342 | |
| }, | |
| { | |
| "epoch": 0.7213675213675214, | |
| "grad_norm": 0.10551027208566666, | |
| "learning_rate": 0.0001294320137693632, | |
| "loss": 0.4042, | |
| "num_input_tokens_seen": 3384000, | |
| "step": 211, | |
| "train_runtime": 539.924, | |
| "train_tokens_per_second": 6267.548 | |
| }, | |
| { | |
| "epoch": 0.7247863247863248, | |
| "grad_norm": 0.10018742829561234, | |
| "learning_rate": 0.00012908777969018932, | |
| "loss": 0.4694, | |
| "num_input_tokens_seen": 3399088, | |
| "step": 212, | |
| "train_runtime": 542.1589, | |
| "train_tokens_per_second": 6269.542 | |
| }, | |
| { | |
| "epoch": 0.7282051282051282, | |
| "grad_norm": 0.12323636561632156, | |
| "learning_rate": 0.0001287435456110155, | |
| "loss": 0.4411, | |
| "num_input_tokens_seen": 3411392, | |
| "step": 213, | |
| "train_runtime": 544.0078, | |
| "train_tokens_per_second": 6270.851 | |
| }, | |
| { | |
| "epoch": 0.7316239316239316, | |
| "grad_norm": 0.11548493057489395, | |
| "learning_rate": 0.00012839931153184165, | |
| "loss": 0.5167, | |
| "num_input_tokens_seen": 3428416, | |
| "step": 214, | |
| "train_runtime": 546.4748, | |
| "train_tokens_per_second": 6273.695 | |
| }, | |
| { | |
| "epoch": 0.7350427350427351, | |
| "grad_norm": 0.0862911120057106, | |
| "learning_rate": 0.00012805507745266783, | |
| "loss": 0.3712, | |
| "num_input_tokens_seen": 3459568, | |
| "step": 215, | |
| "train_runtime": 553.9819, | |
| "train_tokens_per_second": 6244.912 | |
| }, | |
| { | |
| "epoch": 0.7384615384615385, | |
| "grad_norm": 0.1001635193824768, | |
| "learning_rate": 0.00012771084337349396, | |
| "loss": 0.394, | |
| "num_input_tokens_seen": 3474128, | |
| "step": 216, | |
| "train_runtime": 556.1513, | |
| "train_tokens_per_second": 6246.732 | |
| }, | |
| { | |
| "epoch": 0.7418803418803419, | |
| "grad_norm": 0.10096625983715057, | |
| "learning_rate": 0.00012736660929432014, | |
| "loss": 0.4354, | |
| "num_input_tokens_seen": 3488032, | |
| "step": 217, | |
| "train_runtime": 558.2102, | |
| "train_tokens_per_second": 6248.6 | |
| }, | |
| { | |
| "epoch": 0.7452991452991453, | |
| "grad_norm": 0.10238556563854218, | |
| "learning_rate": 0.0001270223752151463, | |
| "loss": 0.4276, | |
| "num_input_tokens_seen": 3504688, | |
| "step": 218, | |
| "train_runtime": 560.6522, | |
| "train_tokens_per_second": 6251.091 | |
| }, | |
| { | |
| "epoch": 0.7487179487179487, | |
| "grad_norm": 0.09864645451307297, | |
| "learning_rate": 0.00012667814113597248, | |
| "loss": 0.4098, | |
| "num_input_tokens_seen": 3521088, | |
| "step": 219, | |
| "train_runtime": 563.1091, | |
| "train_tokens_per_second": 6252.941 | |
| }, | |
| { | |
| "epoch": 0.7521367521367521, | |
| "grad_norm": 0.10077870637178421, | |
| "learning_rate": 0.00012633390705679863, | |
| "loss": 0.4802, | |
| "num_input_tokens_seen": 3537040, | |
| "step": 220, | |
| "train_runtime": 565.4347, | |
| "train_tokens_per_second": 6255.435 | |
| }, | |
| { | |
| "epoch": 0.7555555555555555, | |
| "grad_norm": 0.10053377598524094, | |
| "learning_rate": 0.0001259896729776248, | |
| "loss": 0.4794, | |
| "num_input_tokens_seen": 3551456, | |
| "step": 221, | |
| "train_runtime": 567.5603, | |
| "train_tokens_per_second": 6257.407 | |
| }, | |
| { | |
| "epoch": 0.7589743589743589, | |
| "grad_norm": 0.10047437995672226, | |
| "learning_rate": 0.00012564543889845094, | |
| "loss": 0.4938, | |
| "num_input_tokens_seen": 3567616, | |
| "step": 222, | |
| "train_runtime": 569.9285, | |
| "train_tokens_per_second": 6259.761 | |
| }, | |
| { | |
| "epoch": 0.7623931623931623, | |
| "grad_norm": 0.07970099151134491, | |
| "learning_rate": 0.00012530120481927712, | |
| "loss": 0.3474, | |
| "num_input_tokens_seen": 3588144, | |
| "step": 223, | |
| "train_runtime": 572.8933, | |
| "train_tokens_per_second": 6263.198 | |
| }, | |
| { | |
| "epoch": 0.7658119658119659, | |
| "grad_norm": 0.10995665192604065, | |
| "learning_rate": 0.00012495697074010328, | |
| "loss": 0.3795, | |
| "num_input_tokens_seen": 3600144, | |
| "step": 224, | |
| "train_runtime": 574.6969, | |
| "train_tokens_per_second": 6264.422 | |
| }, | |
| { | |
| "epoch": 0.7692307692307693, | |
| "grad_norm": 0.12067970633506775, | |
| "learning_rate": 0.00012461273666092943, | |
| "loss": 0.4804, | |
| "num_input_tokens_seen": 3621280, | |
| "step": 225, | |
| "train_runtime": 577.7205, | |
| "train_tokens_per_second": 6268.222 | |
| }, | |
| { | |
| "epoch": 0.7726495726495727, | |
| "grad_norm": 0.11939004063606262, | |
| "learning_rate": 0.0001242685025817556, | |
| "loss": 0.4533, | |
| "num_input_tokens_seen": 3634160, | |
| "step": 226, | |
| "train_runtime": 579.6747, | |
| "train_tokens_per_second": 6269.31 | |
| }, | |
| { | |
| "epoch": 0.7760683760683761, | |
| "grad_norm": 0.10946697741746902, | |
| "learning_rate": 0.00012392426850258177, | |
| "loss": 0.4324, | |
| "num_input_tokens_seen": 3645536, | |
| "step": 227, | |
| "train_runtime": 581.3907, | |
| "train_tokens_per_second": 6270.372 | |
| }, | |
| { | |
| "epoch": 0.7794871794871795, | |
| "grad_norm": 0.09853693842887878, | |
| "learning_rate": 0.00012358003442340792, | |
| "loss": 0.4728, | |
| "num_input_tokens_seen": 3660048, | |
| "step": 228, | |
| "train_runtime": 583.5443, | |
| "train_tokens_per_second": 6272.1 | |
| }, | |
| { | |
| "epoch": 0.7829059829059829, | |
| "grad_norm": 0.1062566265463829, | |
| "learning_rate": 0.00012323580034423408, | |
| "loss": 0.5393, | |
| "num_input_tokens_seen": 3672816, | |
| "step": 229, | |
| "train_runtime": 585.4621, | |
| "train_tokens_per_second": 6273.363 | |
| }, | |
| { | |
| "epoch": 0.7863247863247863, | |
| "grad_norm": 0.09363020956516266, | |
| "learning_rate": 0.00012289156626506023, | |
| "loss": 0.4152, | |
| "num_input_tokens_seen": 3696128, | |
| "step": 230, | |
| "train_runtime": 588.8137, | |
| "train_tokens_per_second": 6277.245 | |
| }, | |
| { | |
| "epoch": 0.7897435897435897, | |
| "grad_norm": 0.09704622626304626, | |
| "learning_rate": 0.00012254733218588641, | |
| "loss": 0.5139, | |
| "num_input_tokens_seen": 3710160, | |
| "step": 231, | |
| "train_runtime": 590.8993, | |
| "train_tokens_per_second": 6278.836 | |
| }, | |
| { | |
| "epoch": 0.7931623931623931, | |
| "grad_norm": 0.09564655274152756, | |
| "learning_rate": 0.00012220309810671257, | |
| "loss": 0.4335, | |
| "num_input_tokens_seen": 3723536, | |
| "step": 232, | |
| "train_runtime": 592.9271, | |
| "train_tokens_per_second": 6279.922 | |
| }, | |
| { | |
| "epoch": 0.7965811965811965, | |
| "grad_norm": 0.08687002956867218, | |
| "learning_rate": 0.00012185886402753872, | |
| "loss": 0.3445, | |
| "num_input_tokens_seen": 3738592, | |
| "step": 233, | |
| "train_runtime": 595.173, | |
| "train_tokens_per_second": 6281.522 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 0.09096026420593262, | |
| "learning_rate": 0.00012151462994836489, | |
| "loss": 0.5372, | |
| "num_input_tokens_seen": 3755936, | |
| "step": 234, | |
| "train_runtime": 597.7017, | |
| "train_tokens_per_second": 6283.964 | |
| }, | |
| { | |
| "epoch": 0.8034188034188035, | |
| "grad_norm": 0.09353629499673843, | |
| "learning_rate": 0.00012117039586919106, | |
| "loss": 0.3614, | |
| "num_input_tokens_seen": 3770768, | |
| "step": 235, | |
| "train_runtime": 599.8797, | |
| "train_tokens_per_second": 6285.873 | |
| }, | |
| { | |
| "epoch": 0.8068376068376069, | |
| "grad_norm": 0.0944899320602417, | |
| "learning_rate": 0.00012082616179001723, | |
| "loss": 0.3849, | |
| "num_input_tokens_seen": 3795312, | |
| "step": 236, | |
| "train_runtime": 603.3944, | |
| "train_tokens_per_second": 6289.935 | |
| }, | |
| { | |
| "epoch": 0.8068376068376069, | |
| "eval_loss": 0.42357537150382996, | |
| "eval_runtime": 11.8678, | |
| "eval_samples_per_second": 84.093, | |
| "eval_steps_per_second": 5.308, | |
| "num_input_tokens_seen": 3795312, | |
| "step": 236 | |
| }, | |
| { | |
| "epoch": 0.8102564102564103, | |
| "grad_norm": 0.10128959268331528, | |
| "learning_rate": 0.0001204819277108434, | |
| "loss": 0.4026, | |
| "num_input_tokens_seen": 3806656, | |
| "step": 237, | |
| "train_runtime": 616.9818, | |
| "train_tokens_per_second": 6169.803 | |
| }, | |
| { | |
| "epoch": 0.8136752136752137, | |
| "grad_norm": 0.09387616068124771, | |
| "learning_rate": 0.00012013769363166954, | |
| "loss": 0.4182, | |
| "num_input_tokens_seen": 3822144, | |
| "step": 238, | |
| "train_runtime": 619.269, | |
| "train_tokens_per_second": 6172.026 | |
| }, | |
| { | |
| "epoch": 0.8170940170940171, | |
| "grad_norm": 0.09902401268482208, | |
| "learning_rate": 0.0001197934595524957, | |
| "loss": 0.4232, | |
| "num_input_tokens_seen": 3842016, | |
| "step": 239, | |
| "train_runtime": 622.1266, | |
| "train_tokens_per_second": 6175.617 | |
| }, | |
| { | |
| "epoch": 0.8205128205128205, | |
| "grad_norm": 0.09925245493650436, | |
| "learning_rate": 0.00011944922547332187, | |
| "loss": 0.4478, | |
| "num_input_tokens_seen": 3854752, | |
| "step": 240, | |
| "train_runtime": 624.0402, | |
| "train_tokens_per_second": 6177.089 | |
| }, | |
| { | |
| "epoch": 0.8239316239316239, | |
| "grad_norm": 0.11560021340847015, | |
| "learning_rate": 0.00011910499139414804, | |
| "loss": 0.4808, | |
| "num_input_tokens_seen": 3866496, | |
| "step": 241, | |
| "train_runtime": 626.2473, | |
| "train_tokens_per_second": 6174.072 | |
| }, | |
| { | |
| "epoch": 0.8273504273504273, | |
| "grad_norm": 0.08798137307167053, | |
| "learning_rate": 0.00011876075731497418, | |
| "loss": 0.4486, | |
| "num_input_tokens_seen": 3885600, | |
| "step": 242, | |
| "train_runtime": 629.0654, | |
| "train_tokens_per_second": 6176.782 | |
| }, | |
| { | |
| "epoch": 0.8307692307692308, | |
| "grad_norm": 0.09302930533885956, | |
| "learning_rate": 0.00011841652323580035, | |
| "loss": 0.436, | |
| "num_input_tokens_seen": 3905008, | |
| "step": 243, | |
| "train_runtime": 631.8771, | |
| "train_tokens_per_second": 6180.012 | |
| }, | |
| { | |
| "epoch": 0.8341880341880342, | |
| "grad_norm": 0.1044159084558487, | |
| "learning_rate": 0.00011807228915662652, | |
| "loss": 0.4986, | |
| "num_input_tokens_seen": 3917472, | |
| "step": 244, | |
| "train_runtime": 633.7768, | |
| "train_tokens_per_second": 6181.154 | |
| }, | |
| { | |
| "epoch": 0.8376068376068376, | |
| "grad_norm": 0.10373450815677643, | |
| "learning_rate": 0.00011772805507745268, | |
| "loss": 0.5037, | |
| "num_input_tokens_seen": 3933664, | |
| "step": 245, | |
| "train_runtime": 636.199, | |
| "train_tokens_per_second": 6183.072 | |
| }, | |
| { | |
| "epoch": 0.841025641025641, | |
| "grad_norm": 0.08972188085317612, | |
| "learning_rate": 0.00011738382099827883, | |
| "loss": 0.4908, | |
| "num_input_tokens_seen": 3952288, | |
| "step": 246, | |
| "train_runtime": 638.8866, | |
| "train_tokens_per_second": 6186.212 | |
| }, | |
| { | |
| "epoch": 0.8444444444444444, | |
| "grad_norm": 0.0838053897023201, | |
| "learning_rate": 0.000117039586919105, | |
| "loss": 0.3793, | |
| "num_input_tokens_seen": 3970672, | |
| "step": 247, | |
| "train_runtime": 641.5476, | |
| "train_tokens_per_second": 6189.209 | |
| }, | |
| { | |
| "epoch": 0.8478632478632478, | |
| "grad_norm": 0.06703872978687286, | |
| "learning_rate": 0.00011669535283993116, | |
| "loss": 0.3059, | |
| "num_input_tokens_seen": 3999184, | |
| "step": 248, | |
| "train_runtime": 645.5767, | |
| "train_tokens_per_second": 6194.747 | |
| }, | |
| { | |
| "epoch": 0.8512820512820513, | |
| "grad_norm": 0.08314735442399979, | |
| "learning_rate": 0.00011635111876075733, | |
| "loss": 0.4058, | |
| "num_input_tokens_seen": 4013280, | |
| "step": 249, | |
| "train_runtime": 647.6748, | |
| "train_tokens_per_second": 6196.443 | |
| }, | |
| { | |
| "epoch": 0.8547008547008547, | |
| "grad_norm": 0.08154241740703583, | |
| "learning_rate": 0.00011600688468158347, | |
| "loss": 0.3805, | |
| "num_input_tokens_seen": 4031920, | |
| "step": 250, | |
| "train_runtime": 650.4038, | |
| "train_tokens_per_second": 6199.102 | |
| }, | |
| { | |
| "epoch": 0.8581196581196581, | |
| "grad_norm": 0.09133270382881165, | |
| "learning_rate": 0.00011566265060240964, | |
| "loss": 0.3681, | |
| "num_input_tokens_seen": 4053744, | |
| "step": 251, | |
| "train_runtime": 653.5797, | |
| "train_tokens_per_second": 6202.371 | |
| }, | |
| { | |
| "epoch": 0.8615384615384616, | |
| "grad_norm": 0.10926900058984756, | |
| "learning_rate": 0.0001153184165232358, | |
| "loss": 0.4441, | |
| "num_input_tokens_seen": 4065536, | |
| "step": 252, | |
| "train_runtime": 655.3821, | |
| "train_tokens_per_second": 6203.307 | |
| }, | |
| { | |
| "epoch": 0.864957264957265, | |
| "grad_norm": 0.08510483056306839, | |
| "learning_rate": 0.00011497418244406197, | |
| "loss": 0.4944, | |
| "num_input_tokens_seen": 4083376, | |
| "step": 253, | |
| "train_runtime": 657.9531, | |
| "train_tokens_per_second": 6206.181 | |
| }, | |
| { | |
| "epoch": 0.8683760683760684, | |
| "grad_norm": 0.09709641337394714, | |
| "learning_rate": 0.00011462994836488814, | |
| "loss": 0.481, | |
| "num_input_tokens_seen": 4098848, | |
| "step": 254, | |
| "train_runtime": 660.2372, | |
| "train_tokens_per_second": 6208.145 | |
| }, | |
| { | |
| "epoch": 0.8717948717948718, | |
| "grad_norm": 0.08926745504140854, | |
| "learning_rate": 0.00011428571428571428, | |
| "loss": 0.4043, | |
| "num_input_tokens_seen": 4113904, | |
| "step": 255, | |
| "train_runtime": 662.4724, | |
| "train_tokens_per_second": 6209.925 | |
| }, | |
| { | |
| "epoch": 0.8752136752136752, | |
| "grad_norm": 0.09374278038740158, | |
| "learning_rate": 0.00011394148020654045, | |
| "loss": 0.4502, | |
| "num_input_tokens_seen": 4131168, | |
| "step": 256, | |
| "train_runtime": 664.9653, | |
| "train_tokens_per_second": 6212.607 | |
| }, | |
| { | |
| "epoch": 0.8786324786324786, | |
| "grad_norm": 0.09459812939167023, | |
| "learning_rate": 0.00011359724612736662, | |
| "loss": 0.4439, | |
| "num_input_tokens_seen": 4149904, | |
| "step": 257, | |
| "train_runtime": 667.6682, | |
| "train_tokens_per_second": 6215.519 | |
| }, | |
| { | |
| "epoch": 0.882051282051282, | |
| "grad_norm": 0.1052205041050911, | |
| "learning_rate": 0.00011325301204819279, | |
| "loss": 0.4385, | |
| "num_input_tokens_seen": 4166832, | |
| "step": 258, | |
| "train_runtime": 670.0958, | |
| "train_tokens_per_second": 6218.263 | |
| }, | |
| { | |
| "epoch": 0.8854700854700854, | |
| "grad_norm": 0.09694038331508636, | |
| "learning_rate": 0.00011290877796901893, | |
| "loss": 0.375, | |
| "num_input_tokens_seen": 4184976, | |
| "step": 259, | |
| "train_runtime": 672.74, | |
| "train_tokens_per_second": 6220.793 | |
| }, | |
| { | |
| "epoch": 0.8888888888888888, | |
| "grad_norm": 0.11208639293909073, | |
| "learning_rate": 0.0001125645438898451, | |
| "loss": 0.4517, | |
| "num_input_tokens_seen": 4199888, | |
| "step": 260, | |
| "train_runtime": 674.9288, | |
| "train_tokens_per_second": 6222.713 | |
| }, | |
| { | |
| "epoch": 0.8923076923076924, | |
| "grad_norm": 0.09207024425268173, | |
| "learning_rate": 0.00011222030981067126, | |
| "loss": 0.4132, | |
| "num_input_tokens_seen": 4215664, | |
| "step": 261, | |
| "train_runtime": 677.2813, | |
| "train_tokens_per_second": 6224.392 | |
| }, | |
| { | |
| "epoch": 0.8957264957264958, | |
| "grad_norm": 0.0904022753238678, | |
| "learning_rate": 0.00011187607573149743, | |
| "loss": 0.3322, | |
| "num_input_tokens_seen": 4230080, | |
| "step": 262, | |
| "train_runtime": 679.4101, | |
| "train_tokens_per_second": 6226.107 | |
| }, | |
| { | |
| "epoch": 0.8991452991452992, | |
| "grad_norm": 0.12087982147932053, | |
| "learning_rate": 0.00011153184165232357, | |
| "loss": 0.4281, | |
| "num_input_tokens_seen": 4241440, | |
| "step": 263, | |
| "train_runtime": 681.1509, | |
| "train_tokens_per_second": 6226.873 | |
| }, | |
| { | |
| "epoch": 0.9025641025641026, | |
| "grad_norm": 0.12484072893857956, | |
| "learning_rate": 0.00011118760757314974, | |
| "loss": 0.5186, | |
| "num_input_tokens_seen": 4252976, | |
| "step": 264, | |
| "train_runtime": 682.9063, | |
| "train_tokens_per_second": 6227.759 | |
| }, | |
| { | |
| "epoch": 0.905982905982906, | |
| "grad_norm": 0.08252517133951187, | |
| "learning_rate": 0.00011084337349397591, | |
| "loss": 0.4049, | |
| "num_input_tokens_seen": 4269312, | |
| "step": 265, | |
| "train_runtime": 685.2856, | |
| "train_tokens_per_second": 6229.975 | |
| }, | |
| { | |
| "epoch": 0.9094017094017094, | |
| "grad_norm": 0.11546450853347778, | |
| "learning_rate": 0.00011049913941480208, | |
| "loss": 0.4628, | |
| "num_input_tokens_seen": 4284544, | |
| "step": 266, | |
| "train_runtime": 687.5331, | |
| "train_tokens_per_second": 6231.764 | |
| }, | |
| { | |
| "epoch": 0.9128205128205128, | |
| "grad_norm": 0.11925678700208664, | |
| "learning_rate": 0.00011015490533562822, | |
| "loss": 0.4275, | |
| "num_input_tokens_seen": 4296208, | |
| "step": 267, | |
| "train_runtime": 689.3281, | |
| "train_tokens_per_second": 6232.457 | |
| }, | |
| { | |
| "epoch": 0.9162393162393162, | |
| "grad_norm": 0.09587883204221725, | |
| "learning_rate": 0.00010981067125645439, | |
| "loss": 0.4098, | |
| "num_input_tokens_seen": 4313872, | |
| "step": 268, | |
| "train_runtime": 691.9285, | |
| "train_tokens_per_second": 6234.563 | |
| }, | |
| { | |
| "epoch": 0.9196581196581196, | |
| "grad_norm": 0.08406773209571838, | |
| "learning_rate": 0.00010946643717728055, | |
| "loss": 0.3972, | |
| "num_input_tokens_seen": 4335664, | |
| "step": 269, | |
| "train_runtime": 695.0743, | |
| "train_tokens_per_second": 6237.699 | |
| }, | |
| { | |
| "epoch": 0.9230769230769231, | |
| "grad_norm": 0.1020239070057869, | |
| "learning_rate": 0.00010912220309810672, | |
| "loss": 0.3777, | |
| "num_input_tokens_seen": 4353360, | |
| "step": 270, | |
| "train_runtime": 697.6355, | |
| "train_tokens_per_second": 6240.165 | |
| }, | |
| { | |
| "epoch": 0.9264957264957265, | |
| "grad_norm": 0.11209993064403534, | |
| "learning_rate": 0.00010877796901893289, | |
| "loss": 0.4114, | |
| "num_input_tokens_seen": 4374544, | |
| "step": 271, | |
| "train_runtime": 701.2128, | |
| "train_tokens_per_second": 6238.54 | |
| }, | |
| { | |
| "epoch": 0.9299145299145299, | |
| "grad_norm": 0.11567652225494385, | |
| "learning_rate": 0.00010843373493975903, | |
| "loss": 0.4051, | |
| "num_input_tokens_seen": 4391456, | |
| "step": 272, | |
| "train_runtime": 703.6794, | |
| "train_tokens_per_second": 6240.706 | |
| }, | |
| { | |
| "epoch": 0.9333333333333333, | |
| "grad_norm": 0.11092627048492432, | |
| "learning_rate": 0.0001080895008605852, | |
| "loss": 0.4194, | |
| "num_input_tokens_seen": 4404608, | |
| "step": 273, | |
| "train_runtime": 705.6779, | |
| "train_tokens_per_second": 6241.669 | |
| }, | |
| { | |
| "epoch": 0.9367521367521368, | |
| "grad_norm": 0.10917766392230988, | |
| "learning_rate": 0.00010774526678141137, | |
| "loss": 0.4475, | |
| "num_input_tokens_seen": 4416592, | |
| "step": 274, | |
| "train_runtime": 707.4805, | |
| "train_tokens_per_second": 6242.705 | |
| }, | |
| { | |
| "epoch": 0.9401709401709402, | |
| "grad_norm": 0.09348605573177338, | |
| "learning_rate": 0.00010740103270223754, | |
| "loss": 0.4913, | |
| "num_input_tokens_seen": 4433728, | |
| "step": 275, | |
| "train_runtime": 709.9546, | |
| "train_tokens_per_second": 6245.086 | |
| }, | |
| { | |
| "epoch": 0.9435897435897436, | |
| "grad_norm": 0.10354448109865189, | |
| "learning_rate": 0.00010705679862306368, | |
| "loss": 0.4018, | |
| "num_input_tokens_seen": 4448224, | |
| "step": 276, | |
| "train_runtime": 712.1021, | |
| "train_tokens_per_second": 6246.61 | |
| }, | |
| { | |
| "epoch": 0.947008547008547, | |
| "grad_norm": 0.09892738610506058, | |
| "learning_rate": 0.00010671256454388984, | |
| "loss": 0.4477, | |
| "num_input_tokens_seen": 4467024, | |
| "step": 277, | |
| "train_runtime": 714.8588, | |
| "train_tokens_per_second": 6248.82 | |
| }, | |
| { | |
| "epoch": 0.9504273504273504, | |
| "grad_norm": 0.11075231432914734, | |
| "learning_rate": 0.00010636833046471601, | |
| "loss": 0.3678, | |
| "num_input_tokens_seen": 4481232, | |
| "step": 278, | |
| "train_runtime": 716.9881, | |
| "train_tokens_per_second": 6250.078 | |
| }, | |
| { | |
| "epoch": 0.9538461538461539, | |
| "grad_norm": 0.10120780020952225, | |
| "learning_rate": 0.00010602409638554218, | |
| "loss": 0.4281, | |
| "num_input_tokens_seen": 4500528, | |
| "step": 279, | |
| "train_runtime": 719.7698, | |
| "train_tokens_per_second": 6252.733 | |
| }, | |
| { | |
| "epoch": 0.9572649572649573, | |
| "grad_norm": 0.09937260299921036, | |
| "learning_rate": 0.00010567986230636832, | |
| "loss": 0.3882, | |
| "num_input_tokens_seen": 4525136, | |
| "step": 280, | |
| "train_runtime": 723.3072, | |
| "train_tokens_per_second": 6256.175 | |
| }, | |
| { | |
| "epoch": 0.9606837606837607, | |
| "grad_norm": 0.08478062599897385, | |
| "learning_rate": 0.00010533562822719449, | |
| "loss": 0.3849, | |
| "num_input_tokens_seen": 4541200, | |
| "step": 281, | |
| "train_runtime": 725.6747, | |
| "train_tokens_per_second": 6257.9 | |
| }, | |
| { | |
| "epoch": 0.9641025641025641, | |
| "grad_norm": 0.09681829810142517, | |
| "learning_rate": 0.00010499139414802066, | |
| "loss": 0.3051, | |
| "num_input_tokens_seen": 4578816, | |
| "step": 282, | |
| "train_runtime": 731.2044, | |
| "train_tokens_per_second": 6262.019 | |
| }, | |
| { | |
| "epoch": 0.9675213675213675, | |
| "grad_norm": 0.09028521925210953, | |
| "learning_rate": 0.00010464716006884682, | |
| "loss": 0.4796, | |
| "num_input_tokens_seen": 4596608, | |
| "step": 283, | |
| "train_runtime": 733.7729, | |
| "train_tokens_per_second": 6264.347 | |
| }, | |
| { | |
| "epoch": 0.9709401709401709, | |
| "grad_norm": 0.09063593298196793, | |
| "learning_rate": 0.00010430292598967298, | |
| "loss": 0.347, | |
| "num_input_tokens_seen": 4607632, | |
| "step": 284, | |
| "train_runtime": 735.4673, | |
| "train_tokens_per_second": 6264.904 | |
| }, | |
| { | |
| "epoch": 0.9743589743589743, | |
| "grad_norm": 0.09063643962144852, | |
| "learning_rate": 0.00010395869191049913, | |
| "loss": 0.2912, | |
| "num_input_tokens_seen": 4631200, | |
| "step": 285, | |
| "train_runtime": 738.8336, | |
| "train_tokens_per_second": 6268.258 | |
| }, | |
| { | |
| "epoch": 0.9777777777777777, | |
| "grad_norm": 0.11136946082115173, | |
| "learning_rate": 0.0001036144578313253, | |
| "loss": 0.4875, | |
| "num_input_tokens_seen": 4645856, | |
| "step": 286, | |
| "train_runtime": 741.0112, | |
| "train_tokens_per_second": 6269.616 | |
| }, | |
| { | |
| "epoch": 0.9811965811965812, | |
| "grad_norm": 0.09543482214212418, | |
| "learning_rate": 0.00010327022375215147, | |
| "loss": 0.4009, | |
| "num_input_tokens_seen": 4662528, | |
| "step": 287, | |
| "train_runtime": 743.4774, | |
| "train_tokens_per_second": 6271.244 | |
| }, | |
| { | |
| "epoch": 0.9846153846153847, | |
| "grad_norm": 0.11340586096048355, | |
| "learning_rate": 0.00010292598967297764, | |
| "loss": 0.4523, | |
| "num_input_tokens_seen": 4677744, | |
| "step": 288, | |
| "train_runtime": 745.7291, | |
| "train_tokens_per_second": 6272.712 | |
| }, | |
| { | |
| "epoch": 0.9880341880341881, | |
| "grad_norm": 0.09249569475650787, | |
| "learning_rate": 0.00010258175559380379, | |
| "loss": 0.3638, | |
| "num_input_tokens_seen": 4694512, | |
| "step": 289, | |
| "train_runtime": 748.2102, | |
| "train_tokens_per_second": 6274.323 | |
| }, | |
| { | |
| "epoch": 0.9914529914529915, | |
| "grad_norm": 0.11417587846517563, | |
| "learning_rate": 0.00010223752151462995, | |
| "loss": 0.513, | |
| "num_input_tokens_seen": 4710224, | |
| "step": 290, | |
| "train_runtime": 750.5071, | |
| "train_tokens_per_second": 6276.055 | |
| }, | |
| { | |
| "epoch": 0.9948717948717949, | |
| "grad_norm": 0.09056784212589264, | |
| "learning_rate": 0.00010189328743545611, | |
| "loss": 0.4324, | |
| "num_input_tokens_seen": 4727296, | |
| "step": 291, | |
| "train_runtime": 752.9922, | |
| "train_tokens_per_second": 6278.014 | |
| }, | |
| { | |
| "epoch": 0.9982905982905983, | |
| "grad_norm": 0.09821169078350067, | |
| "learning_rate": 0.00010154905335628228, | |
| "loss": 0.3605, | |
| "num_input_tokens_seen": 4741520, | |
| "step": 292, | |
| "train_runtime": 755.0666, | |
| "train_tokens_per_second": 6279.605 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 0.13449996709823608, | |
| "learning_rate": 0.00010120481927710844, | |
| "loss": 0.3949, | |
| "num_input_tokens_seen": 4751278, | |
| "step": 293, | |
| "train_runtime": 756.491, | |
| "train_tokens_per_second": 6280.68 | |
| }, | |
| { | |
| "epoch": 1.0034188034188034, | |
| "grad_norm": 0.09440767765045166, | |
| "learning_rate": 0.0001008605851979346, | |
| "loss": 0.3857, | |
| "num_input_tokens_seen": 4764718, | |
| "step": 294, | |
| "train_runtime": 758.5245, | |
| "train_tokens_per_second": 6281.561 | |
| }, | |
| { | |
| "epoch": 1.0068376068376068, | |
| "grad_norm": 0.08331061899662018, | |
| "learning_rate": 0.00010051635111876076, | |
| "loss": 0.3654, | |
| "num_input_tokens_seen": 4782670, | |
| "step": 295, | |
| "train_runtime": 761.0921, | |
| "train_tokens_per_second": 6283.957 | |
| }, | |
| { | |
| "epoch": 1.0068376068376068, | |
| "eval_loss": 0.421943724155426, | |
| "eval_runtime": 11.8792, | |
| "eval_samples_per_second": 84.013, | |
| "eval_steps_per_second": 5.303, | |
| "num_input_tokens_seen": 4782670, | |
| "step": 295 | |
| }, | |
| { | |
| "epoch": 1.0102564102564102, | |
| "grad_norm": 0.09061148762702942, | |
| "learning_rate": 0.00010017211703958693, | |
| "loss": 0.3673, | |
| "num_input_tokens_seen": 4795310, | |
| "step": 296, | |
| "train_runtime": 774.907, | |
| "train_tokens_per_second": 6188.239 | |
| }, | |
| { | |
| "epoch": 1.0136752136752136, | |
| "grad_norm": 0.09946513175964355, | |
| "learning_rate": 9.982788296041308e-05, | |
| "loss": 0.3978, | |
| "num_input_tokens_seen": 4810798, | |
| "step": 297, | |
| "train_runtime": 777.235, | |
| "train_tokens_per_second": 6189.631 | |
| }, | |
| { | |
| "epoch": 1.017094017094017, | |
| "grad_norm": 0.10077892988920212, | |
| "learning_rate": 9.948364888123925e-05, | |
| "loss": 0.3721, | |
| "num_input_tokens_seen": 4821918, | |
| "step": 298, | |
| "train_runtime": 778.9429, | |
| "train_tokens_per_second": 6190.336 | |
| }, | |
| { | |
| "epoch": 1.0205128205128204, | |
| "grad_norm": 0.09540440887212753, | |
| "learning_rate": 9.91394148020654e-05, | |
| "loss": 0.4804, | |
| "num_input_tokens_seen": 4839806, | |
| "step": 299, | |
| "train_runtime": 781.5496, | |
| "train_tokens_per_second": 6192.577 | |
| }, | |
| { | |
| "epoch": 1.0239316239316238, | |
| "grad_norm": 0.09200432151556015, | |
| "learning_rate": 9.879518072289157e-05, | |
| "loss": 0.4185, | |
| "num_input_tokens_seen": 4855374, | |
| "step": 300, | |
| "train_runtime": 783.8509, | |
| "train_tokens_per_second": 6194.257 | |
| }, | |
| { | |
| "epoch": 1.0273504273504273, | |
| "grad_norm": 0.09225641936063766, | |
| "learning_rate": 9.845094664371774e-05, | |
| "loss": 0.3448, | |
| "num_input_tokens_seen": 4875646, | |
| "step": 301, | |
| "train_runtime": 787.3218, | |
| "train_tokens_per_second": 6192.698 | |
| }, | |
| { | |
| "epoch": 1.0307692307692307, | |
| "grad_norm": 0.09093517065048218, | |
| "learning_rate": 9.81067125645439e-05, | |
| "loss": 0.3735, | |
| "num_input_tokens_seen": 4889006, | |
| "step": 302, | |
| "train_runtime": 789.3263, | |
| "train_tokens_per_second": 6193.897 | |
| }, | |
| { | |
| "epoch": 1.0341880341880343, | |
| "grad_norm": 0.1052882969379425, | |
| "learning_rate": 9.776247848537006e-05, | |
| "loss": 0.4364, | |
| "num_input_tokens_seen": 4902686, | |
| "step": 303, | |
| "train_runtime": 791.403, | |
| "train_tokens_per_second": 6194.93 | |
| }, | |
| { | |
| "epoch": 1.0376068376068377, | |
| "grad_norm": 0.09175313264131546, | |
| "learning_rate": 9.741824440619622e-05, | |
| "loss": 0.4034, | |
| "num_input_tokens_seen": 4922078, | |
| "step": 304, | |
| "train_runtime": 794.1808, | |
| "train_tokens_per_second": 6197.679 | |
| }, | |
| { | |
| "epoch": 1.041025641025641, | |
| "grad_norm": 0.09906546771526337, | |
| "learning_rate": 9.707401032702239e-05, | |
| "loss": 0.448, | |
| "num_input_tokens_seen": 4943358, | |
| "step": 305, | |
| "train_runtime": 797.2477, | |
| "train_tokens_per_second": 6200.53 | |
| }, | |
| { | |
| "epoch": 1.0444444444444445, | |
| "grad_norm": 0.10816071182489395, | |
| "learning_rate": 9.672977624784855e-05, | |
| "loss": 0.3971, | |
| "num_input_tokens_seen": 4956078, | |
| "step": 306, | |
| "train_runtime": 799.1676, | |
| "train_tokens_per_second": 6201.55 | |
| }, | |
| { | |
| "epoch": 1.047863247863248, | |
| "grad_norm": 0.09161638468503952, | |
| "learning_rate": 9.638554216867471e-05, | |
| "loss": 0.3514, | |
| "num_input_tokens_seen": 4981710, | |
| "step": 307, | |
| "train_runtime": 802.8012, | |
| "train_tokens_per_second": 6205.409 | |
| }, | |
| { | |
| "epoch": 1.0512820512820513, | |
| "grad_norm": 0.09889056533575058, | |
| "learning_rate": 9.604130808950088e-05, | |
| "loss": 0.3105, | |
| "num_input_tokens_seen": 5001214, | |
| "step": 308, | |
| "train_runtime": 805.5994, | |
| "train_tokens_per_second": 6208.066 | |
| }, | |
| { | |
| "epoch": 1.0547008547008547, | |
| "grad_norm": 0.1137273982167244, | |
| "learning_rate": 9.569707401032703e-05, | |
| "loss": 0.3571, | |
| "num_input_tokens_seen": 5017694, | |
| "step": 309, | |
| "train_runtime": 808.0045, | |
| "train_tokens_per_second": 6209.982 | |
| }, | |
| { | |
| "epoch": 1.0581196581196581, | |
| "grad_norm": 0.09778351336717606, | |
| "learning_rate": 9.53528399311532e-05, | |
| "loss": 0.3879, | |
| "num_input_tokens_seen": 5035758, | |
| "step": 310, | |
| "train_runtime": 810.6114, | |
| "train_tokens_per_second": 6212.296 | |
| }, | |
| { | |
| "epoch": 1.0615384615384615, | |
| "grad_norm": 0.1118144690990448, | |
| "learning_rate": 9.500860585197935e-05, | |
| "loss": 0.3965, | |
| "num_input_tokens_seen": 5052750, | |
| "step": 311, | |
| "train_runtime": 813.0944, | |
| "train_tokens_per_second": 6214.223 | |
| }, | |
| { | |
| "epoch": 1.064957264957265, | |
| "grad_norm": 0.11538024991750717, | |
| "learning_rate": 9.466437177280552e-05, | |
| "loss": 0.4422, | |
| "num_input_tokens_seen": 5067630, | |
| "step": 312, | |
| "train_runtime": 815.286, | |
| "train_tokens_per_second": 6215.77 | |
| }, | |
| { | |
| "epoch": 1.0683760683760684, | |
| "grad_norm": 0.10927511751651764, | |
| "learning_rate": 9.432013769363168e-05, | |
| "loss": 0.4174, | |
| "num_input_tokens_seen": 5083150, | |
| "step": 313, | |
| "train_runtime": 817.5852, | |
| "train_tokens_per_second": 6217.272 | |
| }, | |
| { | |
| "epoch": 1.0717948717948718, | |
| "grad_norm": 0.10767415165901184, | |
| "learning_rate": 9.397590361445784e-05, | |
| "loss": 0.3619, | |
| "num_input_tokens_seen": 5104078, | |
| "step": 314, | |
| "train_runtime": 820.6095, | |
| "train_tokens_per_second": 6219.862 | |
| }, | |
| { | |
| "epoch": 1.0752136752136752, | |
| "grad_norm": 0.10561515390872955, | |
| "learning_rate": 9.3631669535284e-05, | |
| "loss": 0.4125, | |
| "num_input_tokens_seen": 5118014, | |
| "step": 315, | |
| "train_runtime": 822.6736, | |
| "train_tokens_per_second": 6221.197 | |
| }, | |
| { | |
| "epoch": 1.0786324786324786, | |
| "grad_norm": 0.10327659547328949, | |
| "learning_rate": 9.328743545611017e-05, | |
| "loss": 0.4252, | |
| "num_input_tokens_seen": 5137150, | |
| "step": 316, | |
| "train_runtime": 825.4032, | |
| "train_tokens_per_second": 6223.807 | |
| }, | |
| { | |
| "epoch": 1.082051282051282, | |
| "grad_norm": 0.1158551275730133, | |
| "learning_rate": 9.294320137693632e-05, | |
| "loss": 0.3862, | |
| "num_input_tokens_seen": 5152190, | |
| "step": 317, | |
| "train_runtime": 827.6678, | |
| "train_tokens_per_second": 6224.949 | |
| }, | |
| { | |
| "epoch": 1.0854700854700854, | |
| "grad_norm": 0.11891324818134308, | |
| "learning_rate": 9.259896729776249e-05, | |
| "loss": 0.4514, | |
| "num_input_tokens_seen": 5165790, | |
| "step": 318, | |
| "train_runtime": 829.6973, | |
| "train_tokens_per_second": 6226.114 | |
| }, | |
| { | |
| "epoch": 1.0888888888888888, | |
| "grad_norm": 0.09706568717956543, | |
| "learning_rate": 9.225473321858864e-05, | |
| "loss": 0.4038, | |
| "num_input_tokens_seen": 5187630, | |
| "step": 319, | |
| "train_runtime": 832.8397, | |
| "train_tokens_per_second": 6228.846 | |
| }, | |
| { | |
| "epoch": 1.0923076923076924, | |
| "grad_norm": 0.1240311861038208, | |
| "learning_rate": 9.191049913941481e-05, | |
| "loss": 0.4434, | |
| "num_input_tokens_seen": 5201454, | |
| "step": 320, | |
| "train_runtime": 834.8979, | |
| "train_tokens_per_second": 6230.048 | |
| }, | |
| { | |
| "epoch": 1.0957264957264958, | |
| "grad_norm": 0.10608533769845963, | |
| "learning_rate": 9.156626506024096e-05, | |
| "loss": 0.3612, | |
| "num_input_tokens_seen": 5217502, | |
| "step": 321, | |
| "train_runtime": 837.243, | |
| "train_tokens_per_second": 6231.766 | |
| }, | |
| { | |
| "epoch": 1.0991452991452992, | |
| "grad_norm": 0.11198005080223083, | |
| "learning_rate": 9.122203098106713e-05, | |
| "loss": 0.3461, | |
| "num_input_tokens_seen": 5233502, | |
| "step": 322, | |
| "train_runtime": 839.607, | |
| "train_tokens_per_second": 6233.276 | |
| }, | |
| { | |
| "epoch": 1.1025641025641026, | |
| "grad_norm": 0.11071202903985977, | |
| "learning_rate": 9.08777969018933e-05, | |
| "loss": 0.3657, | |
| "num_input_tokens_seen": 5247166, | |
| "step": 323, | |
| "train_runtime": 841.6904, | |
| "train_tokens_per_second": 6234.081 | |
| }, | |
| { | |
| "epoch": 1.105982905982906, | |
| "grad_norm": 0.128941148519516, | |
| "learning_rate": 9.053356282271946e-05, | |
| "loss": 0.3202, | |
| "num_input_tokens_seen": 5264302, | |
| "step": 324, | |
| "train_runtime": 844.1905, | |
| "train_tokens_per_second": 6235.917 | |
| }, | |
| { | |
| "epoch": 1.1094017094017095, | |
| "grad_norm": 0.10935687273740768, | |
| "learning_rate": 9.018932874354562e-05, | |
| "loss": 0.3335, | |
| "num_input_tokens_seen": 5285150, | |
| "step": 325, | |
| "train_runtime": 847.1788, | |
| "train_tokens_per_second": 6238.53 | |
| }, | |
| { | |
| "epoch": 1.1128205128205129, | |
| "grad_norm": 0.11587445437908173, | |
| "learning_rate": 8.984509466437178e-05, | |
| "loss": 0.3548, | |
| "num_input_tokens_seen": 5303454, | |
| "step": 326, | |
| "train_runtime": 849.8521, | |
| "train_tokens_per_second": 6240.443 | |
| }, | |
| { | |
| "epoch": 1.1162393162393163, | |
| "grad_norm": 0.14800626039505005, | |
| "learning_rate": 8.950086058519795e-05, | |
| "loss": 0.4223, | |
| "num_input_tokens_seen": 5313854, | |
| "step": 327, | |
| "train_runtime": 851.4701, | |
| "train_tokens_per_second": 6240.8 | |
| }, | |
| { | |
| "epoch": 1.1196581196581197, | |
| "grad_norm": 0.12176591157913208, | |
| "learning_rate": 8.91566265060241e-05, | |
| "loss": 0.3805, | |
| "num_input_tokens_seen": 5327342, | |
| "step": 328, | |
| "train_runtime": 853.4843, | |
| "train_tokens_per_second": 6241.875 | |
| }, | |
| { | |
| "epoch": 1.123076923076923, | |
| "grad_norm": 0.1277189403772354, | |
| "learning_rate": 8.881239242685027e-05, | |
| "loss": 0.4071, | |
| "num_input_tokens_seen": 5343678, | |
| "step": 329, | |
| "train_runtime": 855.8801, | |
| "train_tokens_per_second": 6243.489 | |
| }, | |
| { | |
| "epoch": 1.1264957264957265, | |
| "grad_norm": 0.10131321847438812, | |
| "learning_rate": 8.846815834767642e-05, | |
| "loss": 0.2666, | |
| "num_input_tokens_seen": 5364910, | |
| "step": 330, | |
| "train_runtime": 858.9596, | |
| "train_tokens_per_second": 6245.823 | |
| }, | |
| { | |
| "epoch": 1.12991452991453, | |
| "grad_norm": 0.12116528302431107, | |
| "learning_rate": 8.812392426850259e-05, | |
| "loss": 0.4034, | |
| "num_input_tokens_seen": 5379150, | |
| "step": 331, | |
| "train_runtime": 861.6047, | |
| "train_tokens_per_second": 6243.176 | |
| }, | |
| { | |
| "epoch": 1.1333333333333333, | |
| "grad_norm": 0.13882531225681305, | |
| "learning_rate": 8.777969018932875e-05, | |
| "loss": 0.3558, | |
| "num_input_tokens_seen": 5392910, | |
| "step": 332, | |
| "train_runtime": 863.675, | |
| "train_tokens_per_second": 6244.142 | |
| }, | |
| { | |
| "epoch": 1.1367521367521367, | |
| "grad_norm": 0.10566709190607071, | |
| "learning_rate": 8.743545611015491e-05, | |
| "loss": 0.3374, | |
| "num_input_tokens_seen": 5410798, | |
| "step": 333, | |
| "train_runtime": 866.263, | |
| "train_tokens_per_second": 6246.137 | |
| }, | |
| { | |
| "epoch": 1.1401709401709401, | |
| "grad_norm": 0.1450272500514984, | |
| "learning_rate": 8.709122203098107e-05, | |
| "loss": 0.3957, | |
| "num_input_tokens_seen": 5425198, | |
| "step": 334, | |
| "train_runtime": 868.4297, | |
| "train_tokens_per_second": 6247.136 | |
| }, | |
| { | |
| "epoch": 1.1435897435897435, | |
| "grad_norm": 0.13562506437301636, | |
| "learning_rate": 8.674698795180724e-05, | |
| "loss": 0.4037, | |
| "num_input_tokens_seen": 5439374, | |
| "step": 335, | |
| "train_runtime": 870.5364, | |
| "train_tokens_per_second": 6248.301 | |
| }, | |
| { | |
| "epoch": 1.147008547008547, | |
| "grad_norm": 0.12343757599592209, | |
| "learning_rate": 8.640275387263339e-05, | |
| "loss": 0.4106, | |
| "num_input_tokens_seen": 5456574, | |
| "step": 336, | |
| "train_runtime": 873.0308, | |
| "train_tokens_per_second": 6250.151 | |
| }, | |
| { | |
| "epoch": 1.1504273504273503, | |
| "grad_norm": 0.12856614589691162, | |
| "learning_rate": 8.605851979345956e-05, | |
| "loss": 0.4445, | |
| "num_input_tokens_seen": 5475102, | |
| "step": 337, | |
| "train_runtime": 875.7122, | |
| "train_tokens_per_second": 6252.17 | |
| }, | |
| { | |
| "epoch": 1.1538461538461537, | |
| "grad_norm": 0.13173913955688477, | |
| "learning_rate": 8.571428571428571e-05, | |
| "loss": 0.412, | |
| "num_input_tokens_seen": 5488254, | |
| "step": 338, | |
| "train_runtime": 877.6958, | |
| "train_tokens_per_second": 6253.025 | |
| }, | |
| { | |
| "epoch": 1.1572649572649572, | |
| "grad_norm": 0.13166651129722595, | |
| "learning_rate": 8.537005163511188e-05, | |
| "loss": 0.3414, | |
| "num_input_tokens_seen": 5503694, | |
| "step": 339, | |
| "train_runtime": 879.9753, | |
| "train_tokens_per_second": 6254.373 | |
| }, | |
| { | |
| "epoch": 1.1606837606837608, | |
| "grad_norm": 0.14514580368995667, | |
| "learning_rate": 8.502581755593804e-05, | |
| "loss": 0.4121, | |
| "num_input_tokens_seen": 5518158, | |
| "step": 340, | |
| "train_runtime": 882.0821, | |
| "train_tokens_per_second": 6255.833 | |
| }, | |
| { | |
| "epoch": 1.1641025641025642, | |
| "grad_norm": 0.13414417207241058, | |
| "learning_rate": 8.46815834767642e-05, | |
| "loss": 0.3738, | |
| "num_input_tokens_seen": 5531150, | |
| "step": 341, | |
| "train_runtime": 884.0358, | |
| "train_tokens_per_second": 6256.704 | |
| }, | |
| { | |
| "epoch": 1.1675213675213676, | |
| "grad_norm": 0.13111338019371033, | |
| "learning_rate": 8.433734939759037e-05, | |
| "loss": 0.4629, | |
| "num_input_tokens_seen": 5547870, | |
| "step": 342, | |
| "train_runtime": 886.4774, | |
| "train_tokens_per_second": 6258.332 | |
| }, | |
| { | |
| "epoch": 1.170940170940171, | |
| "grad_norm": 0.13821318745613098, | |
| "learning_rate": 8.399311531841653e-05, | |
| "loss": 0.3793, | |
| "num_input_tokens_seen": 5560814, | |
| "step": 343, | |
| "train_runtime": 888.4364, | |
| "train_tokens_per_second": 6259.102 | |
| }, | |
| { | |
| "epoch": 1.1743589743589744, | |
| "grad_norm": 0.133073627948761, | |
| "learning_rate": 8.36488812392427e-05, | |
| "loss": 0.3765, | |
| "num_input_tokens_seen": 5573470, | |
| "step": 344, | |
| "train_runtime": 890.3654, | |
| "train_tokens_per_second": 6259.756 | |
| }, | |
| { | |
| "epoch": 1.1777777777777778, | |
| "grad_norm": 0.14837369322776794, | |
| "learning_rate": 8.330464716006885e-05, | |
| "loss": 0.4345, | |
| "num_input_tokens_seen": 5589358, | |
| "step": 345, | |
| "train_runtime": 892.7259, | |
| "train_tokens_per_second": 6261.001 | |
| }, | |
| { | |
| "epoch": 1.1811965811965812, | |
| "grad_norm": 0.11554093658924103, | |
| "learning_rate": 8.296041308089502e-05, | |
| "loss": 0.3454, | |
| "num_input_tokens_seen": 5608286, | |
| "step": 346, | |
| "train_runtime": 895.4735, | |
| "train_tokens_per_second": 6262.928 | |
| }, | |
| { | |
| "epoch": 1.1846153846153846, | |
| "grad_norm": 0.13670602440834045, | |
| "learning_rate": 8.261617900172117e-05, | |
| "loss": 0.3641, | |
| "num_input_tokens_seen": 5624222, | |
| "step": 347, | |
| "train_runtime": 897.8188, | |
| "train_tokens_per_second": 6264.317 | |
| }, | |
| { | |
| "epoch": 1.188034188034188, | |
| "grad_norm": 0.11645640432834625, | |
| "learning_rate": 8.227194492254734e-05, | |
| "loss": 0.3086, | |
| "num_input_tokens_seen": 5644302, | |
| "step": 348, | |
| "train_runtime": 900.68, | |
| "train_tokens_per_second": 6266.711 | |
| }, | |
| { | |
| "epoch": 1.1914529914529914, | |
| "grad_norm": 0.13790756464004517, | |
| "learning_rate": 8.192771084337349e-05, | |
| "loss": 0.3614, | |
| "num_input_tokens_seen": 5660814, | |
| "step": 349, | |
| "train_runtime": 903.1107, | |
| "train_tokens_per_second": 6268.129 | |
| }, | |
| { | |
| "epoch": 1.1948717948717948, | |
| "grad_norm": 0.12048908323049545, | |
| "learning_rate": 8.158347676419966e-05, | |
| "loss": 0.3175, | |
| "num_input_tokens_seen": 5678238, | |
| "step": 350, | |
| "train_runtime": 905.6459, | |
| "train_tokens_per_second": 6269.822 | |
| }, | |
| { | |
| "epoch": 1.1982905982905983, | |
| "grad_norm": 0.1469748467206955, | |
| "learning_rate": 8.123924268502582e-05, | |
| "loss": 0.402, | |
| "num_input_tokens_seen": 5690766, | |
| "step": 351, | |
| "train_runtime": 907.5181, | |
| "train_tokens_per_second": 6270.692 | |
| }, | |
| { | |
| "epoch": 1.2017094017094017, | |
| "grad_norm": 0.15761221945285797, | |
| "learning_rate": 8.089500860585198e-05, | |
| "loss": 0.4114, | |
| "num_input_tokens_seen": 5704126, | |
| "step": 352, | |
| "train_runtime": 909.528, | |
| "train_tokens_per_second": 6271.523 | |
| }, | |
| { | |
| "epoch": 1.205128205128205, | |
| "grad_norm": 0.12943622469902039, | |
| "learning_rate": 8.055077452667814e-05, | |
| "loss": 0.3823, | |
| "num_input_tokens_seen": 5721070, | |
| "step": 353, | |
| "train_runtime": 912.0326, | |
| "train_tokens_per_second": 6272.879 | |
| }, | |
| { | |
| "epoch": 1.2085470085470085, | |
| "grad_norm": 0.14878448843955994, | |
| "learning_rate": 8.02065404475043e-05, | |
| "loss": 0.4004, | |
| "num_input_tokens_seen": 5738638, | |
| "step": 354, | |
| "train_runtime": 914.5921, | |
| "train_tokens_per_second": 6274.532 | |
| }, | |
| { | |
| "epoch": 1.2085470085470085, | |
| "eval_loss": 0.4262903034687042, | |
| "eval_runtime": 11.8731, | |
| "eval_samples_per_second": 84.056, | |
| "eval_steps_per_second": 5.306, | |
| "num_input_tokens_seen": 5738638, | |
| "step": 354 | |
| }, | |
| { | |
| "epoch": 1.2119658119658119, | |
| "grad_norm": 0.15027886629104614, | |
| "learning_rate": 7.986230636833046e-05, | |
| "loss": 0.352, | |
| "num_input_tokens_seen": 5755054, | |
| "step": 355, | |
| "train_runtime": 928.8681, | |
| "train_tokens_per_second": 6195.771 | |
| }, | |
| { | |
| "epoch": 1.2153846153846155, | |
| "grad_norm": 0.13495990633964539, | |
| "learning_rate": 7.951807228915663e-05, | |
| "loss": 0.3563, | |
| "num_input_tokens_seen": 5767742, | |
| "step": 356, | |
| "train_runtime": 930.7674, | |
| "train_tokens_per_second": 6196.76 | |
| }, | |
| { | |
| "epoch": 1.218803418803419, | |
| "grad_norm": 0.1535864919424057, | |
| "learning_rate": 7.917383820998278e-05, | |
| "loss": 0.3608, | |
| "num_input_tokens_seen": 5787614, | |
| "step": 357, | |
| "train_runtime": 933.6119, | |
| "train_tokens_per_second": 6199.164 | |
| }, | |
| { | |
| "epoch": 1.2222222222222223, | |
| "grad_norm": 0.13963304460048676, | |
| "learning_rate": 7.882960413080895e-05, | |
| "loss": 0.4206, | |
| "num_input_tokens_seen": 5802558, | |
| "step": 358, | |
| "train_runtime": 935.8349, | |
| "train_tokens_per_second": 6200.407 | |
| }, | |
| { | |
| "epoch": 1.2256410256410257, | |
| "grad_norm": 0.163704514503479, | |
| "learning_rate": 7.848537005163512e-05, | |
| "loss": 0.391, | |
| "num_input_tokens_seen": 5816382, | |
| "step": 359, | |
| "train_runtime": 937.9276, | |
| "train_tokens_per_second": 6201.312 | |
| }, | |
| { | |
| "epoch": 1.2290598290598291, | |
| "grad_norm": 0.14221028983592987, | |
| "learning_rate": 7.814113597246127e-05, | |
| "loss": 0.3529, | |
| "num_input_tokens_seen": 5833550, | |
| "step": 360, | |
| "train_runtime": 940.4404, | |
| "train_tokens_per_second": 6202.998 | |
| }, | |
| { | |
| "epoch": 1.2324786324786325, | |
| "grad_norm": 0.14981484413146973, | |
| "learning_rate": 7.779690189328744e-05, | |
| "loss": 0.4097, | |
| "num_input_tokens_seen": 5847742, | |
| "step": 361, | |
| "train_runtime": 943.0512, | |
| "train_tokens_per_second": 6200.874 | |
| }, | |
| { | |
| "epoch": 1.235897435897436, | |
| "grad_norm": 0.15353192389011383, | |
| "learning_rate": 7.74526678141136e-05, | |
| "loss": 0.4207, | |
| "num_input_tokens_seen": 5861422, | |
| "step": 362, | |
| "train_runtime": 945.0925, | |
| "train_tokens_per_second": 6201.956 | |
| }, | |
| { | |
| "epoch": 1.2393162393162394, | |
| "grad_norm": 0.1498330533504486, | |
| "learning_rate": 7.710843373493976e-05, | |
| "loss": 0.4371, | |
| "num_input_tokens_seen": 5879550, | |
| "step": 363, | |
| "train_runtime": 947.7032, | |
| "train_tokens_per_second": 6203.999 | |
| }, | |
| { | |
| "epoch": 1.2427350427350428, | |
| "grad_norm": 0.16379210352897644, | |
| "learning_rate": 7.676419965576592e-05, | |
| "loss": 0.4001, | |
| "num_input_tokens_seen": 5890414, | |
| "step": 364, | |
| "train_runtime": 949.3619, | |
| "train_tokens_per_second": 6204.603 | |
| }, | |
| { | |
| "epoch": 1.2461538461538462, | |
| "grad_norm": 0.14771924912929535, | |
| "learning_rate": 7.641996557659209e-05, | |
| "loss": 0.4091, | |
| "num_input_tokens_seen": 5903870, | |
| "step": 365, | |
| "train_runtime": 951.3898, | |
| "train_tokens_per_second": 6205.522 | |
| }, | |
| { | |
| "epoch": 1.2495726495726496, | |
| "grad_norm": 0.1314336210489273, | |
| "learning_rate": 7.607573149741824e-05, | |
| "loss": 0.3686, | |
| "num_input_tokens_seen": 5922702, | |
| "step": 366, | |
| "train_runtime": 954.0994, | |
| "train_tokens_per_second": 6207.636 | |
| }, | |
| { | |
| "epoch": 1.252991452991453, | |
| "grad_norm": 0.14639326930046082, | |
| "learning_rate": 7.573149741824441e-05, | |
| "loss": 0.391, | |
| "num_input_tokens_seen": 5943566, | |
| "step": 367, | |
| "train_runtime": 957.0573, | |
| "train_tokens_per_second": 6210.251 | |
| }, | |
| { | |
| "epoch": 1.2564102564102564, | |
| "grad_norm": 0.14717791974544525, | |
| "learning_rate": 7.538726333907056e-05, | |
| "loss": 0.4646, | |
| "num_input_tokens_seen": 5960878, | |
| "step": 368, | |
| "train_runtime": 959.6021, | |
| "train_tokens_per_second": 6211.823 | |
| }, | |
| { | |
| "epoch": 1.2598290598290598, | |
| "grad_norm": 0.14937731623649597, | |
| "learning_rate": 7.504302925989673e-05, | |
| "loss": 0.448, | |
| "num_input_tokens_seen": 5976654, | |
| "step": 369, | |
| "train_runtime": 961.9381, | |
| "train_tokens_per_second": 6213.138 | |
| }, | |
| { | |
| "epoch": 1.2632478632478632, | |
| "grad_norm": 0.15321378409862518, | |
| "learning_rate": 7.469879518072289e-05, | |
| "loss": 0.4242, | |
| "num_input_tokens_seen": 5989406, | |
| "step": 370, | |
| "train_runtime": 963.873, | |
| "train_tokens_per_second": 6213.896 | |
| }, | |
| { | |
| "epoch": 1.2666666666666666, | |
| "grad_norm": 0.13933706283569336, | |
| "learning_rate": 7.435456110154905e-05, | |
| "loss": 0.4543, | |
| "num_input_tokens_seen": 6007710, | |
| "step": 371, | |
| "train_runtime": 966.5773, | |
| "train_tokens_per_second": 6215.447 | |
| }, | |
| { | |
| "epoch": 1.27008547008547, | |
| "grad_norm": 0.1422203630208969, | |
| "learning_rate": 7.401032702237521e-05, | |
| "loss": 0.3656, | |
| "num_input_tokens_seen": 6021982, | |
| "step": 372, | |
| "train_runtime": 968.6875, | |
| "train_tokens_per_second": 6216.641 | |
| }, | |
| { | |
| "epoch": 1.2735042735042734, | |
| "grad_norm": 0.15311431884765625, | |
| "learning_rate": 7.366609294320138e-05, | |
| "loss": 0.5369, | |
| "num_input_tokens_seen": 6036606, | |
| "step": 373, | |
| "train_runtime": 970.8599, | |
| "train_tokens_per_second": 6217.793 | |
| }, | |
| { | |
| "epoch": 1.2769230769230768, | |
| "grad_norm": 0.15368784964084625, | |
| "learning_rate": 7.332185886402754e-05, | |
| "loss": 0.4691, | |
| "num_input_tokens_seen": 6050686, | |
| "step": 374, | |
| "train_runtime": 972.9604, | |
| "train_tokens_per_second": 6218.841 | |
| }, | |
| { | |
| "epoch": 1.2803418803418802, | |
| "grad_norm": 0.128590390086174, | |
| "learning_rate": 7.29776247848537e-05, | |
| "loss": 0.3645, | |
| "num_input_tokens_seen": 6071006, | |
| "step": 375, | |
| "train_runtime": 975.8603, | |
| "train_tokens_per_second": 6221.183 | |
| }, | |
| { | |
| "epoch": 1.2837606837606836, | |
| "grad_norm": 0.16918911039829254, | |
| "learning_rate": 7.263339070567987e-05, | |
| "loss": 0.4516, | |
| "num_input_tokens_seen": 6083838, | |
| "step": 376, | |
| "train_runtime": 977.7866, | |
| "train_tokens_per_second": 6222.051 | |
| }, | |
| { | |
| "epoch": 1.287179487179487, | |
| "grad_norm": 0.1317807137966156, | |
| "learning_rate": 7.228915662650602e-05, | |
| "loss": 0.3979, | |
| "num_input_tokens_seen": 6103870, | |
| "step": 377, | |
| "train_runtime": 980.6218, | |
| "train_tokens_per_second": 6224.489 | |
| }, | |
| { | |
| "epoch": 1.2905982905982907, | |
| "grad_norm": 0.15844884514808655, | |
| "learning_rate": 7.194492254733219e-05, | |
| "loss": 0.4077, | |
| "num_input_tokens_seen": 6119342, | |
| "step": 378, | |
| "train_runtime": 982.9217, | |
| "train_tokens_per_second": 6225.666 | |
| }, | |
| { | |
| "epoch": 1.294017094017094, | |
| "grad_norm": 0.13094189763069153, | |
| "learning_rate": 7.160068846815836e-05, | |
| "loss": 0.3317, | |
| "num_input_tokens_seen": 6135582, | |
| "step": 379, | |
| "train_runtime": 985.318, | |
| "train_tokens_per_second": 6227.007 | |
| }, | |
| { | |
| "epoch": 1.2974358974358975, | |
| "grad_norm": 0.1428907960653305, | |
| "learning_rate": 7.125645438898451e-05, | |
| "loss": 0.3667, | |
| "num_input_tokens_seen": 6153166, | |
| "step": 380, | |
| "train_runtime": 987.8695, | |
| "train_tokens_per_second": 6228.724 | |
| }, | |
| { | |
| "epoch": 1.300854700854701, | |
| "grad_norm": 0.1479697972536087, | |
| "learning_rate": 7.091222030981068e-05, | |
| "loss": 0.4703, | |
| "num_input_tokens_seen": 6167790, | |
| "step": 381, | |
| "train_runtime": 990.0311, | |
| "train_tokens_per_second": 6229.895 | |
| }, | |
| { | |
| "epoch": 1.3042735042735043, | |
| "grad_norm": 0.1379973441362381, | |
| "learning_rate": 7.056798623063683e-05, | |
| "loss": 0.305, | |
| "num_input_tokens_seen": 6188846, | |
| "step": 382, | |
| "train_runtime": 993.0644, | |
| "train_tokens_per_second": 6232.069 | |
| }, | |
| { | |
| "epoch": 1.3076923076923077, | |
| "grad_norm": 0.15161173045635223, | |
| "learning_rate": 7.0223752151463e-05, | |
| "loss": 0.3361, | |
| "num_input_tokens_seen": 6202542, | |
| "step": 383, | |
| "train_runtime": 995.1105, | |
| "train_tokens_per_second": 6233.018 | |
| }, | |
| { | |
| "epoch": 1.3111111111111111, | |
| "grad_norm": 0.14290477335453033, | |
| "learning_rate": 6.987951807228917e-05, | |
| "loss": 0.3268, | |
| "num_input_tokens_seen": 6220366, | |
| "step": 384, | |
| "train_runtime": 997.717, | |
| "train_tokens_per_second": 6234.599 | |
| }, | |
| { | |
| "epoch": 1.3145299145299145, | |
| "grad_norm": 0.1553800255060196, | |
| "learning_rate": 6.953528399311532e-05, | |
| "loss": 0.4104, | |
| "num_input_tokens_seen": 6237422, | |
| "step": 385, | |
| "train_runtime": 1000.1787, | |
| "train_tokens_per_second": 6236.307 | |
| }, | |
| { | |
| "epoch": 1.317948717948718, | |
| "grad_norm": 0.15926386415958405, | |
| "learning_rate": 6.919104991394149e-05, | |
| "loss": 0.3809, | |
| "num_input_tokens_seen": 6249070, | |
| "step": 386, | |
| "train_runtime": 1001.9601, | |
| "train_tokens_per_second": 6236.845 | |
| }, | |
| { | |
| "epoch": 1.3213675213675213, | |
| "grad_norm": 0.15950970351696014, | |
| "learning_rate": 6.884681583476765e-05, | |
| "loss": 0.3429, | |
| "num_input_tokens_seen": 6265198, | |
| "step": 387, | |
| "train_runtime": 1004.333, | |
| "train_tokens_per_second": 6238.168 | |
| }, | |
| { | |
| "epoch": 1.3247863247863247, | |
| "grad_norm": 0.15029311180114746, | |
| "learning_rate": 6.850258175559381e-05, | |
| "loss": 0.3975, | |
| "num_input_tokens_seen": 6281966, | |
| "step": 388, | |
| "train_runtime": 1006.7802, | |
| "train_tokens_per_second": 6239.66 | |
| }, | |
| { | |
| "epoch": 1.3282051282051281, | |
| "grad_norm": 0.16369454562664032, | |
| "learning_rate": 6.815834767641997e-05, | |
| "loss": 0.3495, | |
| "num_input_tokens_seen": 6298718, | |
| "step": 389, | |
| "train_runtime": 1009.2265, | |
| "train_tokens_per_second": 6241.134 | |
| }, | |
| { | |
| "epoch": 1.3316239316239316, | |
| "grad_norm": 0.1701713353395462, | |
| "learning_rate": 6.781411359724614e-05, | |
| "loss": 0.4102, | |
| "num_input_tokens_seen": 6312510, | |
| "step": 390, | |
| "train_runtime": 1011.2977, | |
| "train_tokens_per_second": 6241.99 | |
| }, | |
| { | |
| "epoch": 1.335042735042735, | |
| "grad_norm": 0.15310458838939667, | |
| "learning_rate": 6.746987951807229e-05, | |
| "loss": 0.3758, | |
| "num_input_tokens_seen": 6329998, | |
| "step": 391, | |
| "train_runtime": 1014.3612, | |
| "train_tokens_per_second": 6240.379 | |
| }, | |
| { | |
| "epoch": 1.3384615384615386, | |
| "grad_norm": 0.1793118566274643, | |
| "learning_rate": 6.712564543889846e-05, | |
| "loss": 0.4579, | |
| "num_input_tokens_seen": 6344158, | |
| "step": 392, | |
| "train_runtime": 1016.4559, | |
| "train_tokens_per_second": 6241.449 | |
| }, | |
| { | |
| "epoch": 1.341880341880342, | |
| "grad_norm": 0.1364370435476303, | |
| "learning_rate": 6.678141135972461e-05, | |
| "loss": 0.3032, | |
| "num_input_tokens_seen": 6362286, | |
| "step": 393, | |
| "train_runtime": 1019.0898, | |
| "train_tokens_per_second": 6243.106 | |
| }, | |
| { | |
| "epoch": 1.3452991452991454, | |
| "grad_norm": 0.19111692905426025, | |
| "learning_rate": 6.643717728055078e-05, | |
| "loss": 0.3836, | |
| "num_input_tokens_seen": 6374334, | |
| "step": 394, | |
| "train_runtime": 1020.8971, | |
| "train_tokens_per_second": 6243.856 | |
| }, | |
| { | |
| "epoch": 1.3487179487179488, | |
| "grad_norm": 0.13976141810417175, | |
| "learning_rate": 6.609294320137695e-05, | |
| "loss": 0.3489, | |
| "num_input_tokens_seen": 6392286, | |
| "step": 395, | |
| "train_runtime": 1023.5184, | |
| "train_tokens_per_second": 6245.404 | |
| }, | |
| { | |
| "epoch": 1.3521367521367522, | |
| "grad_norm": 0.1717049479484558, | |
| "learning_rate": 6.57487091222031e-05, | |
| "loss": 0.4546, | |
| "num_input_tokens_seen": 6407102, | |
| "step": 396, | |
| "train_runtime": 1025.7201, | |
| "train_tokens_per_second": 6246.443 | |
| }, | |
| { | |
| "epoch": 1.3555555555555556, | |
| "grad_norm": 0.15389494597911835, | |
| "learning_rate": 6.540447504302927e-05, | |
| "loss": 0.3984, | |
| "num_input_tokens_seen": 6424190, | |
| "step": 397, | |
| "train_runtime": 1028.1999, | |
| "train_tokens_per_second": 6247.997 | |
| }, | |
| { | |
| "epoch": 1.358974358974359, | |
| "grad_norm": 0.15128876268863678, | |
| "learning_rate": 6.506024096385543e-05, | |
| "loss": 0.4107, | |
| "num_input_tokens_seen": 6438926, | |
| "step": 398, | |
| "train_runtime": 1030.39, | |
| "train_tokens_per_second": 6249.018 | |
| }, | |
| { | |
| "epoch": 1.3623931623931624, | |
| "grad_norm": 0.1720062643289566, | |
| "learning_rate": 6.47160068846816e-05, | |
| "loss": 0.4398, | |
| "num_input_tokens_seen": 6454206, | |
| "step": 399, | |
| "train_runtime": 1032.6825, | |
| "train_tokens_per_second": 6249.942 | |
| }, | |
| { | |
| "epoch": 1.3658119658119658, | |
| "grad_norm": 0.16892306506633759, | |
| "learning_rate": 6.437177280550775e-05, | |
| "loss": 0.4768, | |
| "num_input_tokens_seen": 6470446, | |
| "step": 400, | |
| "train_runtime": 1035.0677, | |
| "train_tokens_per_second": 6251.23 | |
| }, | |
| { | |
| "epoch": 1.3692307692307693, | |
| "grad_norm": 0.16459856927394867, | |
| "learning_rate": 6.402753872633392e-05, | |
| "loss": 0.394, | |
| "num_input_tokens_seen": 6485566, | |
| "step": 401, | |
| "train_runtime": 1037.3161, | |
| "train_tokens_per_second": 6252.256 | |
| }, | |
| { | |
| "epoch": 1.3726495726495727, | |
| "grad_norm": 0.146686390042305, | |
| "learning_rate": 6.368330464716007e-05, | |
| "loss": 0.4074, | |
| "num_input_tokens_seen": 6500878, | |
| "step": 402, | |
| "train_runtime": 1039.5797, | |
| "train_tokens_per_second": 6253.371 | |
| }, | |
| { | |
| "epoch": 1.376068376068376, | |
| "grad_norm": 0.13347510993480682, | |
| "learning_rate": 6.333907056798624e-05, | |
| "loss": 0.3718, | |
| "num_input_tokens_seen": 6527726, | |
| "step": 403, | |
| "train_runtime": 1043.3774, | |
| "train_tokens_per_second": 6256.342 | |
| }, | |
| { | |
| "epoch": 1.3794871794871795, | |
| "grad_norm": 0.15149444341659546, | |
| "learning_rate": 6.29948364888124e-05, | |
| "loss": 0.4889, | |
| "num_input_tokens_seen": 6549054, | |
| "step": 404, | |
| "train_runtime": 1046.4485, | |
| "train_tokens_per_second": 6258.363 | |
| }, | |
| { | |
| "epoch": 1.3829059829059829, | |
| "grad_norm": 0.15119557082653046, | |
| "learning_rate": 6.265060240963856e-05, | |
| "loss": 0.3562, | |
| "num_input_tokens_seen": 6565374, | |
| "step": 405, | |
| "train_runtime": 1048.8497, | |
| "train_tokens_per_second": 6259.595 | |
| }, | |
| { | |
| "epoch": 1.3863247863247863, | |
| "grad_norm": 0.1899130493402481, | |
| "learning_rate": 6.230636833046472e-05, | |
| "loss": 0.4359, | |
| "num_input_tokens_seen": 6577854, | |
| "step": 406, | |
| "train_runtime": 1050.7387, | |
| "train_tokens_per_second": 6260.219 | |
| }, | |
| { | |
| "epoch": 1.3897435897435897, | |
| "grad_norm": 0.15261997282505035, | |
| "learning_rate": 6.196213425129088e-05, | |
| "loss": 0.3755, | |
| "num_input_tokens_seen": 6595182, | |
| "step": 407, | |
| "train_runtime": 1053.2481, | |
| "train_tokens_per_second": 6261.755 | |
| }, | |
| { | |
| "epoch": 1.393162393162393, | |
| "grad_norm": 0.1569528728723526, | |
| "learning_rate": 6.161790017211704e-05, | |
| "loss": 0.4357, | |
| "num_input_tokens_seen": 6609166, | |
| "step": 408, | |
| "train_runtime": 1055.3193, | |
| "train_tokens_per_second": 6262.717 | |
| }, | |
| { | |
| "epoch": 1.3965811965811965, | |
| "grad_norm": 0.15785826742649078, | |
| "learning_rate": 6.127366609294321e-05, | |
| "loss": 0.3605, | |
| "num_input_tokens_seen": 6622254, | |
| "step": 409, | |
| "train_runtime": 1057.2748, | |
| "train_tokens_per_second": 6263.513 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 0.1593894064426422, | |
| "learning_rate": 6.092943201376936e-05, | |
| "loss": 0.461, | |
| "num_input_tokens_seen": 6637758, | |
| "step": 410, | |
| "train_runtime": 1059.5389, | |
| "train_tokens_per_second": 6264.761 | |
| }, | |
| { | |
| "epoch": 1.4034188034188033, | |
| "grad_norm": 0.1655980795621872, | |
| "learning_rate": 6.058519793459553e-05, | |
| "loss": 0.3856, | |
| "num_input_tokens_seen": 6653086, | |
| "step": 411, | |
| "train_runtime": 1061.8036, | |
| "train_tokens_per_second": 6265.835 | |
| }, | |
| { | |
| "epoch": 1.4068376068376067, | |
| "grad_norm": 0.16413439810276031, | |
| "learning_rate": 6.02409638554217e-05, | |
| "loss": 0.3601, | |
| "num_input_tokens_seen": 6671230, | |
| "step": 412, | |
| "train_runtime": 1064.4168, | |
| "train_tokens_per_second": 6267.498 | |
| }, | |
| { | |
| "epoch": 1.4102564102564101, | |
| "grad_norm": 0.17654147744178772, | |
| "learning_rate": 5.989672977624785e-05, | |
| "loss": 0.4383, | |
| "num_input_tokens_seen": 6685294, | |
| "step": 413, | |
| "train_runtime": 1066.4829, | |
| "train_tokens_per_second": 6268.543 | |
| }, | |
| { | |
| "epoch": 1.4102564102564101, | |
| "eval_loss": 0.42687925696372986, | |
| "eval_runtime": 11.8448, | |
| "eval_samples_per_second": 84.257, | |
| "eval_steps_per_second": 5.319, | |
| "num_input_tokens_seen": 6685294, | |
| "step": 413 | |
| }, | |
| { | |
| "epoch": 1.4136752136752135, | |
| "grad_norm": 0.14143113791942596, | |
| "learning_rate": 5.955249569707402e-05, | |
| "loss": 0.3417, | |
| "num_input_tokens_seen": 6706110, | |
| "step": 414, | |
| "train_runtime": 1081.3024, | |
| "train_tokens_per_second": 6201.882 | |
| }, | |
| { | |
| "epoch": 1.4170940170940172, | |
| "grad_norm": 0.17738325893878937, | |
| "learning_rate": 5.9208261617900174e-05, | |
| "loss": 0.4049, | |
| "num_input_tokens_seen": 6719390, | |
| "step": 415, | |
| "train_runtime": 1083.3114, | |
| "train_tokens_per_second": 6202.64 | |
| }, | |
| { | |
| "epoch": 1.4205128205128206, | |
| "grad_norm": 0.15967565774917603, | |
| "learning_rate": 5.886402753872634e-05, | |
| "loss": 0.322, | |
| "num_input_tokens_seen": 6732926, | |
| "step": 416, | |
| "train_runtime": 1085.3328, | |
| "train_tokens_per_second": 6203.559 | |
| }, | |
| { | |
| "epoch": 1.423931623931624, | |
| "grad_norm": 0.17965038120746613, | |
| "learning_rate": 5.85197934595525e-05, | |
| "loss": 0.4321, | |
| "num_input_tokens_seen": 6748014, | |
| "step": 417, | |
| "train_runtime": 1087.5395, | |
| "train_tokens_per_second": 6204.845 | |
| }, | |
| { | |
| "epoch": 1.4273504273504274, | |
| "grad_norm": 0.17158453166484833, | |
| "learning_rate": 5.8175559380378665e-05, | |
| "loss": 0.3844, | |
| "num_input_tokens_seen": 6762782, | |
| "step": 418, | |
| "train_runtime": 1089.7402, | |
| "train_tokens_per_second": 6205.866 | |
| }, | |
| { | |
| "epoch": 1.4307692307692308, | |
| "grad_norm": 0.17010599374771118, | |
| "learning_rate": 5.783132530120482e-05, | |
| "loss": 0.3944, | |
| "num_input_tokens_seen": 6775838, | |
| "step": 419, | |
| "train_runtime": 1091.687, | |
| "train_tokens_per_second": 6206.759 | |
| }, | |
| { | |
| "epoch": 1.4341880341880342, | |
| "grad_norm": 0.14824308454990387, | |
| "learning_rate": 5.748709122203099e-05, | |
| "loss": 0.3437, | |
| "num_input_tokens_seen": 6794014, | |
| "step": 420, | |
| "train_runtime": 1094.3074, | |
| "train_tokens_per_second": 6208.506 | |
| }, | |
| { | |
| "epoch": 1.4376068376068376, | |
| "grad_norm": 0.1721956878900528, | |
| "learning_rate": 5.714285714285714e-05, | |
| "loss": 0.3813, | |
| "num_input_tokens_seen": 6809502, | |
| "step": 421, | |
| "train_runtime": 1097.1486, | |
| "train_tokens_per_second": 6206.545 | |
| }, | |
| { | |
| "epoch": 1.441025641025641, | |
| "grad_norm": 0.17868974804878235, | |
| "learning_rate": 5.679862306368331e-05, | |
| "loss": 0.439, | |
| "num_input_tokens_seen": 6823038, | |
| "step": 422, | |
| "train_runtime": 1099.1662, | |
| "train_tokens_per_second": 6207.467 | |
| }, | |
| { | |
| "epoch": 1.4444444444444444, | |
| "grad_norm": 0.15935160219669342, | |
| "learning_rate": 5.6454388984509464e-05, | |
| "loss": 0.387, | |
| "num_input_tokens_seen": 6841582, | |
| "step": 423, | |
| "train_runtime": 1101.8557, | |
| "train_tokens_per_second": 6209.145 | |
| }, | |
| { | |
| "epoch": 1.4478632478632478, | |
| "grad_norm": 0.1758459508419037, | |
| "learning_rate": 5.611015490533563e-05, | |
| "loss": 0.5356, | |
| "num_input_tokens_seen": 6855310, | |
| "step": 424, | |
| "train_runtime": 1103.8914, | |
| "train_tokens_per_second": 6210.131 | |
| }, | |
| { | |
| "epoch": 1.4512820512820512, | |
| "grad_norm": 0.16828133165836334, | |
| "learning_rate": 5.576592082616179e-05, | |
| "loss": 0.3835, | |
| "num_input_tokens_seen": 6875486, | |
| "step": 425, | |
| "train_runtime": 1106.7831, | |
| "train_tokens_per_second": 6212.135 | |
| }, | |
| { | |
| "epoch": 1.4547008547008546, | |
| "grad_norm": 0.16434825956821442, | |
| "learning_rate": 5.5421686746987955e-05, | |
| "loss": 0.3765, | |
| "num_input_tokens_seen": 6889502, | |
| "step": 426, | |
| "train_runtime": 1108.8374, | |
| "train_tokens_per_second": 6213.266 | |
| }, | |
| { | |
| "epoch": 1.458119658119658, | |
| "grad_norm": 0.16002990305423737, | |
| "learning_rate": 5.507745266781411e-05, | |
| "loss": 0.4121, | |
| "num_input_tokens_seen": 6908046, | |
| "step": 427, | |
| "train_runtime": 1111.5373, | |
| "train_tokens_per_second": 6214.858 | |
| }, | |
| { | |
| "epoch": 1.4615384615384617, | |
| "grad_norm": 0.17183275520801544, | |
| "learning_rate": 5.473321858864028e-05, | |
| "loss": 0.439, | |
| "num_input_tokens_seen": 6924190, | |
| "step": 428, | |
| "train_runtime": 1113.8957, | |
| "train_tokens_per_second": 6216.192 | |
| }, | |
| { | |
| "epoch": 1.464957264957265, | |
| "grad_norm": 0.18027374148368835, | |
| "learning_rate": 5.4388984509466445e-05, | |
| "loss": 0.4895, | |
| "num_input_tokens_seen": 6939070, | |
| "step": 429, | |
| "train_runtime": 1116.1017, | |
| "train_tokens_per_second": 6217.238 | |
| }, | |
| { | |
| "epoch": 1.4683760683760685, | |
| "grad_norm": 0.15044456720352173, | |
| "learning_rate": 5.40447504302926e-05, | |
| "loss": 0.4429, | |
| "num_input_tokens_seen": 6956478, | |
| "step": 430, | |
| "train_runtime": 1118.6746, | |
| "train_tokens_per_second": 6218.5 | |
| }, | |
| { | |
| "epoch": 1.471794871794872, | |
| "grad_norm": 0.15003447234630585, | |
| "learning_rate": 5.370051635111877e-05, | |
| "loss": 0.5628, | |
| "num_input_tokens_seen": 6973246, | |
| "step": 431, | |
| "train_runtime": 1121.1665, | |
| "train_tokens_per_second": 6219.635 | |
| }, | |
| { | |
| "epoch": 1.4752136752136753, | |
| "grad_norm": 0.1591937392950058, | |
| "learning_rate": 5.335628227194492e-05, | |
| "loss": 0.3721, | |
| "num_input_tokens_seen": 6986990, | |
| "step": 432, | |
| "train_runtime": 1123.2293, | |
| "train_tokens_per_second": 6220.448 | |
| }, | |
| { | |
| "epoch": 1.4786324786324787, | |
| "grad_norm": 0.18640592694282532, | |
| "learning_rate": 5.301204819277109e-05, | |
| "loss": 0.3516, | |
| "num_input_tokens_seen": 7001950, | |
| "step": 433, | |
| "train_runtime": 1125.4499, | |
| "train_tokens_per_second": 6221.468 | |
| }, | |
| { | |
| "epoch": 1.4820512820512821, | |
| "grad_norm": 0.17443552613258362, | |
| "learning_rate": 5.2667814113597244e-05, | |
| "loss": 0.4784, | |
| "num_input_tokens_seen": 7016318, | |
| "step": 434, | |
| "train_runtime": 1127.6255, | |
| "train_tokens_per_second": 6222.206 | |
| }, | |
| { | |
| "epoch": 1.4854700854700855, | |
| "grad_norm": 0.1685023009777069, | |
| "learning_rate": 5.232358003442341e-05, | |
| "loss": 0.4227, | |
| "num_input_tokens_seen": 7029358, | |
| "step": 435, | |
| "train_runtime": 1129.5922, | |
| "train_tokens_per_second": 6222.916 | |
| }, | |
| { | |
| "epoch": 1.488888888888889, | |
| "grad_norm": 0.17190369963645935, | |
| "learning_rate": 5.197934595524957e-05, | |
| "loss": 0.3718, | |
| "num_input_tokens_seen": 7046350, | |
| "step": 436, | |
| "train_runtime": 1132.1043, | |
| "train_tokens_per_second": 6224.117 | |
| }, | |
| { | |
| "epoch": 1.4923076923076923, | |
| "grad_norm": 0.16871225833892822, | |
| "learning_rate": 5.1635111876075735e-05, | |
| "loss": 0.4095, | |
| "num_input_tokens_seen": 7060286, | |
| "step": 437, | |
| "train_runtime": 1134.2429, | |
| "train_tokens_per_second": 6224.669 | |
| }, | |
| { | |
| "epoch": 1.4957264957264957, | |
| "grad_norm": 0.15742996335029602, | |
| "learning_rate": 5.1290877796901896e-05, | |
| "loss": 0.3377, | |
| "num_input_tokens_seen": 7077550, | |
| "step": 438, | |
| "train_runtime": 1136.7468, | |
| "train_tokens_per_second": 6226.145 | |
| }, | |
| { | |
| "epoch": 1.4991452991452991, | |
| "grad_norm": 0.1806265264749527, | |
| "learning_rate": 5.094664371772806e-05, | |
| "loss": 0.4356, | |
| "num_input_tokens_seen": 7096110, | |
| "step": 439, | |
| "train_runtime": 1139.4331, | |
| "train_tokens_per_second": 6227.755 | |
| }, | |
| { | |
| "epoch": 1.5025641025641026, | |
| "grad_norm": 0.1986326277256012, | |
| "learning_rate": 5.060240963855422e-05, | |
| "loss": 0.421, | |
| "num_input_tokens_seen": 7110462, | |
| "step": 440, | |
| "train_runtime": 1141.5636, | |
| "train_tokens_per_second": 6228.704 | |
| }, | |
| { | |
| "epoch": 1.505982905982906, | |
| "grad_norm": 0.18825186789035797, | |
| "learning_rate": 5.025817555938038e-05, | |
| "loss": 0.3866, | |
| "num_input_tokens_seen": 7123438, | |
| "step": 441, | |
| "train_runtime": 1143.5279, | |
| "train_tokens_per_second": 6229.352 | |
| }, | |
| { | |
| "epoch": 1.5094017094017094, | |
| "grad_norm": 0.15836316347122192, | |
| "learning_rate": 4.991394148020654e-05, | |
| "loss": 0.3759, | |
| "num_input_tokens_seen": 7139678, | |
| "step": 442, | |
| "train_runtime": 1145.9334, | |
| "train_tokens_per_second": 6230.448 | |
| }, | |
| { | |
| "epoch": 1.5128205128205128, | |
| "grad_norm": 0.1643362194299698, | |
| "learning_rate": 4.95697074010327e-05, | |
| "loss": 0.3715, | |
| "num_input_tokens_seen": 7152798, | |
| "step": 443, | |
| "train_runtime": 1147.927, | |
| "train_tokens_per_second": 6231.056 | |
| }, | |
| { | |
| "epoch": 1.5162393162393162, | |
| "grad_norm": 0.18112708628177643, | |
| "learning_rate": 4.922547332185887e-05, | |
| "loss": 0.5004, | |
| "num_input_tokens_seen": 7166718, | |
| "step": 444, | |
| "train_runtime": 1149.9906, | |
| "train_tokens_per_second": 6231.98 | |
| }, | |
| { | |
| "epoch": 1.5196581196581196, | |
| "grad_norm": 0.17923805117607117, | |
| "learning_rate": 4.888123924268503e-05, | |
| "loss": 0.3967, | |
| "num_input_tokens_seen": 7180718, | |
| "step": 445, | |
| "train_runtime": 1152.0495, | |
| "train_tokens_per_second": 6232.994 | |
| }, | |
| { | |
| "epoch": 1.523076923076923, | |
| "grad_norm": 0.15098166465759277, | |
| "learning_rate": 4.853700516351119e-05, | |
| "loss": 0.379, | |
| "num_input_tokens_seen": 7198382, | |
| "step": 446, | |
| "train_runtime": 1154.5661, | |
| "train_tokens_per_second": 6234.708 | |
| }, | |
| { | |
| "epoch": 1.5264957264957264, | |
| "grad_norm": 0.17328427731990814, | |
| "learning_rate": 4.8192771084337354e-05, | |
| "loss": 0.3807, | |
| "num_input_tokens_seen": 7213006, | |
| "step": 447, | |
| "train_runtime": 1156.7041, | |
| "train_tokens_per_second": 6235.827 | |
| }, | |
| { | |
| "epoch": 1.5299145299145298, | |
| "grad_norm": 0.13623268902301788, | |
| "learning_rate": 4.7848537005163515e-05, | |
| "loss": 0.3011, | |
| "num_input_tokens_seen": 7243582, | |
| "step": 448, | |
| "train_runtime": 1161.0841, | |
| "train_tokens_per_second": 6238.637 | |
| }, | |
| { | |
| "epoch": 1.5333333333333332, | |
| "grad_norm": 0.23146113753318787, | |
| "learning_rate": 4.7504302925989676e-05, | |
| "loss": 0.4946, | |
| "num_input_tokens_seen": 7257710, | |
| "step": 449, | |
| "train_runtime": 1163.1872, | |
| "train_tokens_per_second": 6239.503 | |
| }, | |
| { | |
| "epoch": 1.5367521367521366, | |
| "grad_norm": 0.1464138627052307, | |
| "learning_rate": 4.716006884681584e-05, | |
| "loss": 0.3956, | |
| "num_input_tokens_seen": 7275646, | |
| "step": 450, | |
| "train_runtime": 1165.763, | |
| "train_tokens_per_second": 6241.102 | |
| }, | |
| { | |
| "epoch": 1.54017094017094, | |
| "grad_norm": 0.13081535696983337, | |
| "learning_rate": 4.6815834767642e-05, | |
| "loss": 0.351, | |
| "num_input_tokens_seen": 7295710, | |
| "step": 451, | |
| "train_runtime": 1169.156, | |
| "train_tokens_per_second": 6240.151 | |
| }, | |
| { | |
| "epoch": 1.5435897435897434, | |
| "grad_norm": 0.16835983097553253, | |
| "learning_rate": 4.647160068846816e-05, | |
| "loss": 0.4823, | |
| "num_input_tokens_seen": 7314574, | |
| "step": 452, | |
| "train_runtime": 1171.8934, | |
| "train_tokens_per_second": 6241.672 | |
| }, | |
| { | |
| "epoch": 1.547008547008547, | |
| "grad_norm": 0.12163835763931274, | |
| "learning_rate": 4.612736660929432e-05, | |
| "loss": 0.2982, | |
| "num_input_tokens_seen": 7343022, | |
| "step": 453, | |
| "train_runtime": 1175.8796, | |
| "train_tokens_per_second": 6244.706 | |
| }, | |
| { | |
| "epoch": 1.5504273504273505, | |
| "grad_norm": 0.14073219895362854, | |
| "learning_rate": 4.578313253012048e-05, | |
| "loss": 0.2964, | |
| "num_input_tokens_seen": 7363630, | |
| "step": 454, | |
| "train_runtime": 1178.8416, | |
| "train_tokens_per_second": 6246.497 | |
| }, | |
| { | |
| "epoch": 1.5538461538461539, | |
| "grad_norm": 0.1757187843322754, | |
| "learning_rate": 4.543889845094665e-05, | |
| "loss": 0.4486, | |
| "num_input_tokens_seen": 7378830, | |
| "step": 455, | |
| "train_runtime": 1181.0635, | |
| "train_tokens_per_second": 6247.615 | |
| }, | |
| { | |
| "epoch": 1.5572649572649573, | |
| "grad_norm": 0.16719017922878265, | |
| "learning_rate": 4.509466437177281e-05, | |
| "loss": 0.342, | |
| "num_input_tokens_seen": 7396958, | |
| "step": 456, | |
| "train_runtime": 1183.6752, | |
| "train_tokens_per_second": 6249.145 | |
| }, | |
| { | |
| "epoch": 1.5606837606837607, | |
| "grad_norm": 0.15160873532295227, | |
| "learning_rate": 4.475043029259897e-05, | |
| "loss": 0.3305, | |
| "num_input_tokens_seen": 7419918, | |
| "step": 457, | |
| "train_runtime": 1186.9428, | |
| "train_tokens_per_second": 6251.285 | |
| }, | |
| { | |
| "epoch": 1.564102564102564, | |
| "grad_norm": 0.16827233135700226, | |
| "learning_rate": 4.4406196213425134e-05, | |
| "loss": 0.3478, | |
| "num_input_tokens_seen": 7438590, | |
| "step": 458, | |
| "train_runtime": 1189.6616, | |
| "train_tokens_per_second": 6252.694 | |
| }, | |
| { | |
| "epoch": 1.5675213675213675, | |
| "grad_norm": 0.15692555904388428, | |
| "learning_rate": 4.4061962134251295e-05, | |
| "loss": 0.3317, | |
| "num_input_tokens_seen": 7457614, | |
| "step": 459, | |
| "train_runtime": 1192.4245, | |
| "train_tokens_per_second": 6254.16 | |
| }, | |
| { | |
| "epoch": 1.570940170940171, | |
| "grad_norm": 0.16111750900745392, | |
| "learning_rate": 4.371772805507746e-05, | |
| "loss": 0.3559, | |
| "num_input_tokens_seen": 7478254, | |
| "step": 460, | |
| "train_runtime": 1195.4195, | |
| "train_tokens_per_second": 6255.757 | |
| }, | |
| { | |
| "epoch": 1.5743589743589743, | |
| "grad_norm": 0.1745642125606537, | |
| "learning_rate": 4.337349397590362e-05, | |
| "loss": 0.3515, | |
| "num_input_tokens_seen": 7491422, | |
| "step": 461, | |
| "train_runtime": 1197.3704, | |
| "train_tokens_per_second": 6256.562 | |
| }, | |
| { | |
| "epoch": 1.5777777777777777, | |
| "grad_norm": 0.1923861801624298, | |
| "learning_rate": 4.302925989672978e-05, | |
| "loss": 0.4927, | |
| "num_input_tokens_seen": 7508174, | |
| "step": 462, | |
| "train_runtime": 1199.809, | |
| "train_tokens_per_second": 6257.808 | |
| }, | |
| { | |
| "epoch": 1.5811965811965814, | |
| "grad_norm": 0.19131140410900116, | |
| "learning_rate": 4.268502581755594e-05, | |
| "loss": 0.4331, | |
| "num_input_tokens_seen": 7520590, | |
| "step": 463, | |
| "train_runtime": 1201.6752, | |
| "train_tokens_per_second": 6258.422 | |
| }, | |
| { | |
| "epoch": 1.5846153846153848, | |
| "grad_norm": 0.16123589873313904, | |
| "learning_rate": 4.23407917383821e-05, | |
| "loss": 0.3504, | |
| "num_input_tokens_seen": 7534430, | |
| "step": 464, | |
| "train_runtime": 1203.7756, | |
| "train_tokens_per_second": 6258.999 | |
| }, | |
| { | |
| "epoch": 1.5880341880341882, | |
| "grad_norm": 0.1816190630197525, | |
| "learning_rate": 4.199655765920826e-05, | |
| "loss": 0.349, | |
| "num_input_tokens_seen": 7550974, | |
| "step": 465, | |
| "train_runtime": 1206.2032, | |
| "train_tokens_per_second": 6260.117 | |
| }, | |
| { | |
| "epoch": 1.5914529914529916, | |
| "grad_norm": 0.1618788093328476, | |
| "learning_rate": 4.1652323580034424e-05, | |
| "loss": 0.3963, | |
| "num_input_tokens_seen": 7568494, | |
| "step": 466, | |
| "train_runtime": 1208.719, | |
| "train_tokens_per_second": 6261.583 | |
| }, | |
| { | |
| "epoch": 1.594871794871795, | |
| "grad_norm": 0.1682547926902771, | |
| "learning_rate": 4.1308089500860585e-05, | |
| "loss": 0.4128, | |
| "num_input_tokens_seen": 7584510, | |
| "step": 467, | |
| "train_runtime": 1211.076, | |
| "train_tokens_per_second": 6262.621 | |
| }, | |
| { | |
| "epoch": 1.5982905982905984, | |
| "grad_norm": 0.17071352899074554, | |
| "learning_rate": 4.0963855421686746e-05, | |
| "loss": 0.4007, | |
| "num_input_tokens_seen": 7601806, | |
| "step": 468, | |
| "train_runtime": 1213.648, | |
| "train_tokens_per_second": 6263.6 | |
| }, | |
| { | |
| "epoch": 1.6017094017094018, | |
| "grad_norm": 0.19961658120155334, | |
| "learning_rate": 4.061962134251291e-05, | |
| "loss": 0.3831, | |
| "num_input_tokens_seen": 7615134, | |
| "step": 469, | |
| "train_runtime": 1215.6143, | |
| "train_tokens_per_second": 6264.433 | |
| }, | |
| { | |
| "epoch": 1.6051282051282052, | |
| "grad_norm": 0.15891629457473755, | |
| "learning_rate": 4.027538726333907e-05, | |
| "loss": 0.3579, | |
| "num_input_tokens_seen": 7632446, | |
| "step": 470, | |
| "train_runtime": 1218.1415, | |
| "train_tokens_per_second": 6265.648 | |
| }, | |
| { | |
| "epoch": 1.6085470085470086, | |
| "grad_norm": 0.18139025568962097, | |
| "learning_rate": 3.993115318416523e-05, | |
| "loss": 0.4023, | |
| "num_input_tokens_seen": 7647038, | |
| "step": 471, | |
| "train_runtime": 1220.3009, | |
| "train_tokens_per_second": 6266.519 | |
| }, | |
| { | |
| "epoch": 1.611965811965812, | |
| "grad_norm": 0.1726229041814804, | |
| "learning_rate": 3.958691910499139e-05, | |
| "loss": 0.3495, | |
| "num_input_tokens_seen": 7664846, | |
| "step": 472, | |
| "train_runtime": 1222.889, | |
| "train_tokens_per_second": 6267.818 | |
| }, | |
| { | |
| "epoch": 1.611965811965812, | |
| "eval_loss": 0.4264853894710541, | |
| "eval_runtime": 11.8946, | |
| "eval_samples_per_second": 83.904, | |
| "eval_steps_per_second": 5.297, | |
| "num_input_tokens_seen": 7664846, | |
| "step": 472 | |
| }, | |
| { | |
| "epoch": 1.6153846153846154, | |
| "grad_norm": 0.2046596258878708, | |
| "learning_rate": 3.924268502581756e-05, | |
| "loss": 0.4611, | |
| "num_input_tokens_seen": 7678558, | |
| "step": 473, | |
| "train_runtime": 1236.8201, | |
| "train_tokens_per_second": 6208.306 | |
| }, | |
| { | |
| "epoch": 1.6188034188034188, | |
| "grad_norm": 0.18339784443378448, | |
| "learning_rate": 3.889845094664372e-05, | |
| "loss": 0.4687, | |
| "num_input_tokens_seen": 7692542, | |
| "step": 474, | |
| "train_runtime": 1238.9304, | |
| "train_tokens_per_second": 6209.019 | |
| }, | |
| { | |
| "epoch": 1.6222222222222222, | |
| "grad_norm": 0.15463566780090332, | |
| "learning_rate": 3.855421686746988e-05, | |
| "loss": 0.3533, | |
| "num_input_tokens_seen": 7706094, | |
| "step": 475, | |
| "train_runtime": 1240.9949, | |
| "train_tokens_per_second": 6209.61 | |
| }, | |
| { | |
| "epoch": 1.6256410256410256, | |
| "grad_norm": 0.18534722924232483, | |
| "learning_rate": 3.820998278829604e-05, | |
| "loss": 0.429, | |
| "num_input_tokens_seen": 7723006, | |
| "step": 476, | |
| "train_runtime": 1243.4537, | |
| "train_tokens_per_second": 6210.932 | |
| }, | |
| { | |
| "epoch": 1.629059829059829, | |
| "grad_norm": 0.16153299808502197, | |
| "learning_rate": 3.7865748709122204e-05, | |
| "loss": 0.368, | |
| "num_input_tokens_seen": 7739230, | |
| "step": 477, | |
| "train_runtime": 1245.8498, | |
| "train_tokens_per_second": 6212.009 | |
| }, | |
| { | |
| "epoch": 1.6324786324786325, | |
| "grad_norm": 0.18664556741714478, | |
| "learning_rate": 3.7521514629948365e-05, | |
| "loss": 0.3884, | |
| "num_input_tokens_seen": 7753966, | |
| "step": 478, | |
| "train_runtime": 1248.0407, | |
| "train_tokens_per_second": 6212.911 | |
| }, | |
| { | |
| "epoch": 1.6358974358974359, | |
| "grad_norm": 0.14830684661865234, | |
| "learning_rate": 3.717728055077453e-05, | |
| "loss": 0.3094, | |
| "num_input_tokens_seen": 7771758, | |
| "step": 479, | |
| "train_runtime": 1250.6256, | |
| "train_tokens_per_second": 6214.296 | |
| }, | |
| { | |
| "epoch": 1.6393162393162393, | |
| "grad_norm": 0.1431615799665451, | |
| "learning_rate": 3.683304647160069e-05, | |
| "loss": 0.3434, | |
| "num_input_tokens_seen": 7788030, | |
| "step": 480, | |
| "train_runtime": 1253.0226, | |
| "train_tokens_per_second": 6215.395 | |
| }, | |
| { | |
| "epoch": 1.6427350427350427, | |
| "grad_norm": 0.17345507442951202, | |
| "learning_rate": 3.648881239242685e-05, | |
| "loss": 0.4109, | |
| "num_input_tokens_seen": 7805374, | |
| "step": 481, | |
| "train_runtime": 1256.1793, | |
| "train_tokens_per_second": 6213.583 | |
| }, | |
| { | |
| "epoch": 1.646153846153846, | |
| "grad_norm": 0.18331271409988403, | |
| "learning_rate": 3.614457831325301e-05, | |
| "loss": 0.483, | |
| "num_input_tokens_seen": 7821278, | |
| "step": 482, | |
| "train_runtime": 1258.5131, | |
| "train_tokens_per_second": 6214.697 | |
| }, | |
| { | |
| "epoch": 1.6495726495726495, | |
| "grad_norm": 0.14575603604316711, | |
| "learning_rate": 3.580034423407918e-05, | |
| "loss": 0.3499, | |
| "num_input_tokens_seen": 7838750, | |
| "step": 483, | |
| "train_runtime": 1261.0972, | |
| "train_tokens_per_second": 6215.817 | |
| }, | |
| { | |
| "epoch": 1.652991452991453, | |
| "grad_norm": 0.16931626200675964, | |
| "learning_rate": 3.545611015490534e-05, | |
| "loss": 0.364, | |
| "num_input_tokens_seen": 7855742, | |
| "step": 484, | |
| "train_runtime": 1263.5759, | |
| "train_tokens_per_second": 6217.072 | |
| }, | |
| { | |
| "epoch": 1.6564102564102563, | |
| "grad_norm": 0.17259550094604492, | |
| "learning_rate": 3.51118760757315e-05, | |
| "loss": 0.4564, | |
| "num_input_tokens_seen": 7874494, | |
| "step": 485, | |
| "train_runtime": 1266.3175, | |
| "train_tokens_per_second": 6218.42 | |
| }, | |
| { | |
| "epoch": 1.6598290598290597, | |
| "grad_norm": 0.17083777487277985, | |
| "learning_rate": 3.476764199655766e-05, | |
| "loss": 0.3809, | |
| "num_input_tokens_seen": 7890430, | |
| "step": 486, | |
| "train_runtime": 1268.6327, | |
| "train_tokens_per_second": 6219.633 | |
| }, | |
| { | |
| "epoch": 1.6632478632478631, | |
| "grad_norm": 0.1671985685825348, | |
| "learning_rate": 3.442340791738382e-05, | |
| "loss": 0.3755, | |
| "num_input_tokens_seen": 7906142, | |
| "step": 487, | |
| "train_runtime": 1270.96, | |
| "train_tokens_per_second": 6220.606 | |
| }, | |
| { | |
| "epoch": 1.6666666666666665, | |
| "grad_norm": 0.18116803467273712, | |
| "learning_rate": 3.4079173838209984e-05, | |
| "loss": 0.3913, | |
| "num_input_tokens_seen": 7922366, | |
| "step": 488, | |
| "train_runtime": 1273.3633, | |
| "train_tokens_per_second": 6221.607 | |
| }, | |
| { | |
| "epoch": 1.67008547008547, | |
| "grad_norm": 0.18932628631591797, | |
| "learning_rate": 3.3734939759036146e-05, | |
| "loss": 0.4293, | |
| "num_input_tokens_seen": 7934942, | |
| "step": 489, | |
| "train_runtime": 1275.2793, | |
| "train_tokens_per_second": 6222.121 | |
| }, | |
| { | |
| "epoch": 1.6735042735042736, | |
| "grad_norm": 0.17077142000198364, | |
| "learning_rate": 3.339070567986231e-05, | |
| "loss": 0.3818, | |
| "num_input_tokens_seen": 7951486, | |
| "step": 490, | |
| "train_runtime": 1277.6946, | |
| "train_tokens_per_second": 6223.307 | |
| }, | |
| { | |
| "epoch": 1.676923076923077, | |
| "grad_norm": 0.1565760374069214, | |
| "learning_rate": 3.3046471600688475e-05, | |
| "loss": 0.4047, | |
| "num_input_tokens_seen": 7970478, | |
| "step": 491, | |
| "train_runtime": 1280.4332, | |
| "train_tokens_per_second": 6224.829 | |
| }, | |
| { | |
| "epoch": 1.6803418803418804, | |
| "grad_norm": 0.17805105447769165, | |
| "learning_rate": 3.2702237521514636e-05, | |
| "loss": 0.3757, | |
| "num_input_tokens_seen": 7984814, | |
| "step": 492, | |
| "train_runtime": 1282.5395, | |
| "train_tokens_per_second": 6225.784 | |
| }, | |
| { | |
| "epoch": 1.6837606837606838, | |
| "grad_norm": 0.19390779733657837, | |
| "learning_rate": 3.23580034423408e-05, | |
| "loss": 0.3895, | |
| "num_input_tokens_seen": 7998286, | |
| "step": 493, | |
| "train_runtime": 1284.5377, | |
| "train_tokens_per_second": 6226.587 | |
| }, | |
| { | |
| "epoch": 1.6871794871794872, | |
| "grad_norm": 0.16203835606575012, | |
| "learning_rate": 3.201376936316696e-05, | |
| "loss": 0.3933, | |
| "num_input_tokens_seen": 8022334, | |
| "step": 494, | |
| "train_runtime": 1287.9546, | |
| "train_tokens_per_second": 6228.74 | |
| }, | |
| { | |
| "epoch": 1.6905982905982906, | |
| "grad_norm": 0.164924755692482, | |
| "learning_rate": 3.166953528399312e-05, | |
| "loss": 0.367, | |
| "num_input_tokens_seen": 8043294, | |
| "step": 495, | |
| "train_runtime": 1290.9515, | |
| "train_tokens_per_second": 6230.516 | |
| }, | |
| { | |
| "epoch": 1.694017094017094, | |
| "grad_norm": 0.187575563788414, | |
| "learning_rate": 3.132530120481928e-05, | |
| "loss": 0.4334, | |
| "num_input_tokens_seen": 8057310, | |
| "step": 496, | |
| "train_runtime": 1293.0552, | |
| "train_tokens_per_second": 6231.219 | |
| }, | |
| { | |
| "epoch": 1.6974358974358974, | |
| "grad_norm": 0.1323373168706894, | |
| "learning_rate": 3.098106712564544e-05, | |
| "loss": 0.3116, | |
| "num_input_tokens_seen": 8083774, | |
| "step": 497, | |
| "train_runtime": 1296.8416, | |
| "train_tokens_per_second": 6233.432 | |
| }, | |
| { | |
| "epoch": 1.7008547008547008, | |
| "grad_norm": 0.20211701095104218, | |
| "learning_rate": 3.0636833046471604e-05, | |
| "loss": 0.4324, | |
| "num_input_tokens_seen": 8097038, | |
| "step": 498, | |
| "train_runtime": 1298.8399, | |
| "train_tokens_per_second": 6234.054 | |
| }, | |
| { | |
| "epoch": 1.7042735042735044, | |
| "grad_norm": 0.17863459885120392, | |
| "learning_rate": 3.0292598967297765e-05, | |
| "loss": 0.2992, | |
| "num_input_tokens_seen": 8114750, | |
| "step": 499, | |
| "train_runtime": 1301.44, | |
| "train_tokens_per_second": 6235.208 | |
| }, | |
| { | |
| "epoch": 1.7076923076923078, | |
| "grad_norm": 0.19749584794044495, | |
| "learning_rate": 2.9948364888123926e-05, | |
| "loss": 0.4242, | |
| "num_input_tokens_seen": 8126750, | |
| "step": 500, | |
| "train_runtime": 1303.2477, | |
| "train_tokens_per_second": 6235.768 | |
| }, | |
| { | |
| "epoch": 1.7111111111111112, | |
| "grad_norm": 0.171902135014534, | |
| "learning_rate": 2.9604130808950087e-05, | |
| "loss": 0.3748, | |
| "num_input_tokens_seen": 8144766, | |
| "step": 501, | |
| "train_runtime": 1305.8965, | |
| "train_tokens_per_second": 6236.915 | |
| }, | |
| { | |
| "epoch": 1.7145299145299147, | |
| "grad_norm": 0.15472909808158875, | |
| "learning_rate": 2.925989672977625e-05, | |
| "loss": 0.3657, | |
| "num_input_tokens_seen": 8164254, | |
| "step": 502, | |
| "train_runtime": 1308.7049, | |
| "train_tokens_per_second": 6238.423 | |
| }, | |
| { | |
| "epoch": 1.717948717948718, | |
| "grad_norm": 0.1825917810201645, | |
| "learning_rate": 2.891566265060241e-05, | |
| "loss": 0.3551, | |
| "num_input_tokens_seen": 8178510, | |
| "step": 503, | |
| "train_runtime": 1310.798, | |
| "train_tokens_per_second": 6239.337 | |
| }, | |
| { | |
| "epoch": 1.7213675213675215, | |
| "grad_norm": 0.1650628000497818, | |
| "learning_rate": 2.857142857142857e-05, | |
| "loss": 0.3871, | |
| "num_input_tokens_seen": 8196702, | |
| "step": 504, | |
| "train_runtime": 1313.4498, | |
| "train_tokens_per_second": 6240.59 | |
| }, | |
| { | |
| "epoch": 1.7247863247863249, | |
| "grad_norm": 0.17389492690563202, | |
| "learning_rate": 2.8227194492254732e-05, | |
| "loss": 0.3691, | |
| "num_input_tokens_seen": 8216254, | |
| "step": 505, | |
| "train_runtime": 1316.2774, | |
| "train_tokens_per_second": 6242.038 | |
| }, | |
| { | |
| "epoch": 1.7282051282051283, | |
| "grad_norm": 0.17346595227718353, | |
| "learning_rate": 2.7882960413080893e-05, | |
| "loss": 0.4057, | |
| "num_input_tokens_seen": 8233758, | |
| "step": 506, | |
| "train_runtime": 1318.8695, | |
| "train_tokens_per_second": 6243.042 | |
| }, | |
| { | |
| "epoch": 1.7316239316239317, | |
| "grad_norm": 0.15873438119888306, | |
| "learning_rate": 2.7538726333907055e-05, | |
| "loss": 0.332, | |
| "num_input_tokens_seen": 8247550, | |
| "step": 507, | |
| "train_runtime": 1320.9274, | |
| "train_tokens_per_second": 6243.757 | |
| }, | |
| { | |
| "epoch": 1.735042735042735, | |
| "grad_norm": 0.17913693189620972, | |
| "learning_rate": 2.7194492254733223e-05, | |
| "loss": 0.3435, | |
| "num_input_tokens_seen": 8263054, | |
| "step": 508, | |
| "train_runtime": 1323.2116, | |
| "train_tokens_per_second": 6244.696 | |
| }, | |
| { | |
| "epoch": 1.7384615384615385, | |
| "grad_norm": 0.15651476383209229, | |
| "learning_rate": 2.6850258175559384e-05, | |
| "loss": 0.3343, | |
| "num_input_tokens_seen": 8278046, | |
| "step": 509, | |
| "train_runtime": 1325.4232, | |
| "train_tokens_per_second": 6245.587 | |
| }, | |
| { | |
| "epoch": 1.741880341880342, | |
| "grad_norm": 0.17296011745929718, | |
| "learning_rate": 2.6506024096385545e-05, | |
| "loss": 0.4069, | |
| "num_input_tokens_seen": 8295214, | |
| "step": 510, | |
| "train_runtime": 1327.9451, | |
| "train_tokens_per_second": 6246.654 | |
| }, | |
| { | |
| "epoch": 1.7452991452991453, | |
| "grad_norm": 0.18028153479099274, | |
| "learning_rate": 2.6161790017211706e-05, | |
| "loss": 0.3585, | |
| "num_input_tokens_seen": 8312942, | |
| "step": 511, | |
| "train_runtime": 1331.0641, | |
| "train_tokens_per_second": 6245.336 | |
| }, | |
| { | |
| "epoch": 1.7487179487179487, | |
| "grad_norm": 0.18217986822128296, | |
| "learning_rate": 2.5817555938037867e-05, | |
| "loss": 0.3445, | |
| "num_input_tokens_seen": 8329982, | |
| "step": 512, | |
| "train_runtime": 1333.576, | |
| "train_tokens_per_second": 6246.35 | |
| }, | |
| { | |
| "epoch": 1.7521367521367521, | |
| "grad_norm": 0.17503562569618225, | |
| "learning_rate": 2.547332185886403e-05, | |
| "loss": 0.3677, | |
| "num_input_tokens_seen": 8341998, | |
| "step": 513, | |
| "train_runtime": 1335.4087, | |
| "train_tokens_per_second": 6246.775 | |
| }, | |
| { | |
| "epoch": 1.7555555555555555, | |
| "grad_norm": 0.12160934507846832, | |
| "learning_rate": 2.512908777969019e-05, | |
| "loss": 0.282, | |
| "num_input_tokens_seen": 8371790, | |
| "step": 514, | |
| "train_runtime": 1339.6445, | |
| "train_tokens_per_second": 6249.262 | |
| }, | |
| { | |
| "epoch": 1.758974358974359, | |
| "grad_norm": 0.1700914204120636, | |
| "learning_rate": 2.478485370051635e-05, | |
| "loss": 0.4006, | |
| "num_input_tokens_seen": 8390766, | |
| "step": 515, | |
| "train_runtime": 1342.3857, | |
| "train_tokens_per_second": 6250.637 | |
| }, | |
| { | |
| "epoch": 1.7623931623931623, | |
| "grad_norm": 0.18512286245822906, | |
| "learning_rate": 2.4440619621342516e-05, | |
| "loss": 0.4371, | |
| "num_input_tokens_seen": 8401710, | |
| "step": 516, | |
| "train_runtime": 1344.1099, | |
| "train_tokens_per_second": 6250.761 | |
| }, | |
| { | |
| "epoch": 1.7658119658119658, | |
| "grad_norm": 0.1791275441646576, | |
| "learning_rate": 2.4096385542168677e-05, | |
| "loss": 0.3738, | |
| "num_input_tokens_seen": 8418446, | |
| "step": 517, | |
| "train_runtime": 1346.5498, | |
| "train_tokens_per_second": 6251.864 | |
| }, | |
| { | |
| "epoch": 1.7692307692307692, | |
| "grad_norm": 0.18900056183338165, | |
| "learning_rate": 2.3752151462994838e-05, | |
| "loss": 0.4529, | |
| "num_input_tokens_seen": 8430590, | |
| "step": 518, | |
| "train_runtime": 1348.3721, | |
| "train_tokens_per_second": 6252.421 | |
| }, | |
| { | |
| "epoch": 1.7726495726495726, | |
| "grad_norm": 0.1776425540447235, | |
| "learning_rate": 2.3407917383821e-05, | |
| "loss": 0.3513, | |
| "num_input_tokens_seen": 8450318, | |
| "step": 519, | |
| "train_runtime": 1351.2218, | |
| "train_tokens_per_second": 6253.835 | |
| }, | |
| { | |
| "epoch": 1.776068376068376, | |
| "grad_norm": 0.18933919072151184, | |
| "learning_rate": 2.306368330464716e-05, | |
| "loss": 0.3775, | |
| "num_input_tokens_seen": 8464190, | |
| "step": 520, | |
| "train_runtime": 1353.2852, | |
| "train_tokens_per_second": 6254.55 | |
| }, | |
| { | |
| "epoch": 1.7794871794871794, | |
| "grad_norm": 0.1620868742465973, | |
| "learning_rate": 2.2719449225473325e-05, | |
| "loss": 0.4034, | |
| "num_input_tokens_seen": 8483038, | |
| "step": 521, | |
| "train_runtime": 1356.0363, | |
| "train_tokens_per_second": 6255.76 | |
| }, | |
| { | |
| "epoch": 1.7829059829059828, | |
| "grad_norm": 0.16931356489658356, | |
| "learning_rate": 2.2375215146299486e-05, | |
| "loss": 0.3733, | |
| "num_input_tokens_seen": 8499278, | |
| "step": 522, | |
| "train_runtime": 1358.4322, | |
| "train_tokens_per_second": 6256.682 | |
| }, | |
| { | |
| "epoch": 1.7863247863247862, | |
| "grad_norm": 0.1474018692970276, | |
| "learning_rate": 2.2030981067125648e-05, | |
| "loss": 0.3131, | |
| "num_input_tokens_seen": 8518766, | |
| "step": 523, | |
| "train_runtime": 1361.2451, | |
| "train_tokens_per_second": 6258.069 | |
| }, | |
| { | |
| "epoch": 1.7897435897435896, | |
| "grad_norm": 0.16736820340156555, | |
| "learning_rate": 2.168674698795181e-05, | |
| "loss": 0.3634, | |
| "num_input_tokens_seen": 8534430, | |
| "step": 524, | |
| "train_runtime": 1363.5049, | |
| "train_tokens_per_second": 6259.186 | |
| }, | |
| { | |
| "epoch": 1.793162393162393, | |
| "grad_norm": 0.17213431000709534, | |
| "learning_rate": 2.134251290877797e-05, | |
| "loss": 0.3632, | |
| "num_input_tokens_seen": 8546862, | |
| "step": 525, | |
| "train_runtime": 1365.3454, | |
| "train_tokens_per_second": 6259.853 | |
| }, | |
| { | |
| "epoch": 1.7965811965811964, | |
| "grad_norm": 0.19592760503292084, | |
| "learning_rate": 2.099827882960413e-05, | |
| "loss": 0.381, | |
| "num_input_tokens_seen": 8561358, | |
| "step": 526, | |
| "train_runtime": 1367.5092, | |
| "train_tokens_per_second": 6260.549 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 0.1715427190065384, | |
| "learning_rate": 2.0654044750430293e-05, | |
| "loss": 0.4199, | |
| "num_input_tokens_seen": 8581310, | |
| "step": 527, | |
| "train_runtime": 1370.3773, | |
| "train_tokens_per_second": 6262.005 | |
| }, | |
| { | |
| "epoch": 1.8034188034188035, | |
| "grad_norm": 0.194061741232872, | |
| "learning_rate": 2.0309810671256454e-05, | |
| "loss": 0.3965, | |
| "num_input_tokens_seen": 8592766, | |
| "step": 528, | |
| "train_runtime": 1372.1254, | |
| "train_tokens_per_second": 6262.376 | |
| }, | |
| { | |
| "epoch": 1.8068376068376069, | |
| "grad_norm": 0.1930086761713028, | |
| "learning_rate": 1.9965576592082615e-05, | |
| "loss": 0.3976, | |
| "num_input_tokens_seen": 8607166, | |
| "step": 529, | |
| "train_runtime": 1374.2507, | |
| "train_tokens_per_second": 6263.17 | |
| }, | |
| { | |
| "epoch": 1.8102564102564103, | |
| "grad_norm": 0.16003040969371796, | |
| "learning_rate": 1.962134251290878e-05, | |
| "loss": 0.3367, | |
| "num_input_tokens_seen": 8622478, | |
| "step": 530, | |
| "train_runtime": 1376.5089, | |
| "train_tokens_per_second": 6264.019 | |
| }, | |
| { | |
| "epoch": 1.8136752136752137, | |
| "grad_norm": 0.19035999476909637, | |
| "learning_rate": 1.927710843373494e-05, | |
| "loss": 0.5509, | |
| "num_input_tokens_seen": 8637918, | |
| "step": 531, | |
| "train_runtime": 1378.7679, | |
| "train_tokens_per_second": 6264.954 | |
| }, | |
| { | |
| "epoch": 1.8136752136752137, | |
| "eval_loss": 0.4248267114162445, | |
| "eval_runtime": 11.8853, | |
| "eval_samples_per_second": 83.969, | |
| "eval_steps_per_second": 5.301, | |
| "num_input_tokens_seen": 8637918, | |
| "step": 531 | |
| }, | |
| { | |
| "epoch": 1.817094017094017, | |
| "grad_norm": 0.17047119140625, | |
| "learning_rate": 1.8932874354561102e-05, | |
| "loss": 0.3973, | |
| "num_input_tokens_seen": 8656606, | |
| "step": 532, | |
| "train_runtime": 1393.3816, | |
| "train_tokens_per_second": 6212.66 | |
| }, | |
| { | |
| "epoch": 1.8205128205128205, | |
| "grad_norm": 0.1665705293416977, | |
| "learning_rate": 1.8588640275387263e-05, | |
| "loss": 0.4401, | |
| "num_input_tokens_seen": 8675454, | |
| "step": 533, | |
| "train_runtime": 1396.1479, | |
| "train_tokens_per_second": 6213.85 | |
| }, | |
| { | |
| "epoch": 1.823931623931624, | |
| "grad_norm": 0.18982985615730286, | |
| "learning_rate": 1.8244406196213425e-05, | |
| "loss": 0.4021, | |
| "num_input_tokens_seen": 8690142, | |
| "step": 534, | |
| "train_runtime": 1398.3083, | |
| "train_tokens_per_second": 6214.754 | |
| }, | |
| { | |
| "epoch": 1.8273504273504273, | |
| "grad_norm": 0.16096247732639313, | |
| "learning_rate": 1.790017211703959e-05, | |
| "loss": 0.4033, | |
| "num_input_tokens_seen": 8706558, | |
| "step": 535, | |
| "train_runtime": 1400.6804, | |
| "train_tokens_per_second": 6215.949 | |
| }, | |
| { | |
| "epoch": 1.830769230769231, | |
| "grad_norm": 0.1925681084394455, | |
| "learning_rate": 1.755593803786575e-05, | |
| "loss": 0.4394, | |
| "num_input_tokens_seen": 8722270, | |
| "step": 536, | |
| "train_runtime": 1402.9974, | |
| "train_tokens_per_second": 6216.882 | |
| }, | |
| { | |
| "epoch": 1.8341880341880343, | |
| "grad_norm": 0.18180759251117706, | |
| "learning_rate": 1.721170395869191e-05, | |
| "loss": 0.4643, | |
| "num_input_tokens_seen": 8737982, | |
| "step": 537, | |
| "train_runtime": 1405.3075, | |
| "train_tokens_per_second": 6217.844 | |
| }, | |
| { | |
| "epoch": 1.8376068376068377, | |
| "grad_norm": 0.1800447255373001, | |
| "learning_rate": 1.6867469879518073e-05, | |
| "loss": 0.6214, | |
| "num_input_tokens_seen": 8753838, | |
| "step": 538, | |
| "train_runtime": 1407.6382, | |
| "train_tokens_per_second": 6218.812 | |
| }, | |
| { | |
| "epoch": 1.8410256410256411, | |
| "grad_norm": 0.18196427822113037, | |
| "learning_rate": 1.6523235800344237e-05, | |
| "loss": 0.3515, | |
| "num_input_tokens_seen": 8767294, | |
| "step": 539, | |
| "train_runtime": 1409.6646, | |
| "train_tokens_per_second": 6219.418 | |
| }, | |
| { | |
| "epoch": 1.8444444444444446, | |
| "grad_norm": 0.1552770733833313, | |
| "learning_rate": 1.61790017211704e-05, | |
| "loss": 0.3492, | |
| "num_input_tokens_seen": 8790974, | |
| "step": 540, | |
| "train_runtime": 1413.0808, | |
| "train_tokens_per_second": 6221.14 | |
| }, | |
| { | |
| "epoch": 1.847863247863248, | |
| "grad_norm": 0.17243799567222595, | |
| "learning_rate": 1.583476764199656e-05, | |
| "loss": 0.4604, | |
| "num_input_tokens_seen": 8802782, | |
| "step": 541, | |
| "train_runtime": 1415.3829, | |
| "train_tokens_per_second": 6219.364 | |
| }, | |
| { | |
| "epoch": 1.8512820512820514, | |
| "grad_norm": 0.1819770187139511, | |
| "learning_rate": 1.549053356282272e-05, | |
| "loss": 0.4274, | |
| "num_input_tokens_seen": 8818334, | |
| "step": 542, | |
| "train_runtime": 1417.6847, | |
| "train_tokens_per_second": 6220.237 | |
| }, | |
| { | |
| "epoch": 1.8547008547008548, | |
| "grad_norm": 0.17073139548301697, | |
| "learning_rate": 1.5146299483648882e-05, | |
| "loss": 0.4203, | |
| "num_input_tokens_seen": 8837166, | |
| "step": 543, | |
| "train_runtime": 1420.4111, | |
| "train_tokens_per_second": 6221.555 | |
| }, | |
| { | |
| "epoch": 1.8581196581196582, | |
| "grad_norm": 0.1646145135164261, | |
| "learning_rate": 1.4802065404475044e-05, | |
| "loss": 0.3531, | |
| "num_input_tokens_seen": 8854318, | |
| "step": 544, | |
| "train_runtime": 1422.8958, | |
| "train_tokens_per_second": 6222.745 | |
| }, | |
| { | |
| "epoch": 1.8615384615384616, | |
| "grad_norm": 0.21891261637210846, | |
| "learning_rate": 1.4457831325301205e-05, | |
| "loss": 0.4048, | |
| "num_input_tokens_seen": 8867102, | |
| "step": 545, | |
| "train_runtime": 1424.813, | |
| "train_tokens_per_second": 6223.345 | |
| }, | |
| { | |
| "epoch": 1.864957264957265, | |
| "grad_norm": 0.2045115977525711, | |
| "learning_rate": 1.4113597246127366e-05, | |
| "loss": 0.5021, | |
| "num_input_tokens_seen": 8880990, | |
| "step": 546, | |
| "train_runtime": 1426.8816, | |
| "train_tokens_per_second": 6224.055 | |
| }, | |
| { | |
| "epoch": 1.8683760683760684, | |
| "grad_norm": 0.18179452419281006, | |
| "learning_rate": 1.3769363166953527e-05, | |
| "loss": 0.4367, | |
| "num_input_tokens_seen": 8895422, | |
| "step": 547, | |
| "train_runtime": 1429.0398, | |
| "train_tokens_per_second": 6224.754 | |
| }, | |
| { | |
| "epoch": 1.8717948717948718, | |
| "grad_norm": 0.1890801042318344, | |
| "learning_rate": 1.3425129087779692e-05, | |
| "loss": 0.3696, | |
| "num_input_tokens_seen": 8908718, | |
| "step": 548, | |
| "train_runtime": 1431.0057, | |
| "train_tokens_per_second": 6225.495 | |
| }, | |
| { | |
| "epoch": 1.8752136752136752, | |
| "grad_norm": 0.1882188469171524, | |
| "learning_rate": 1.3080895008605853e-05, | |
| "loss": 0.4208, | |
| "num_input_tokens_seen": 8923086, | |
| "step": 549, | |
| "train_runtime": 1433.137, | |
| "train_tokens_per_second": 6226.262 | |
| }, | |
| { | |
| "epoch": 1.8786324786324786, | |
| "grad_norm": 0.168639674782753, | |
| "learning_rate": 1.2736660929432014e-05, | |
| "loss": 0.3938, | |
| "num_input_tokens_seen": 8941022, | |
| "step": 550, | |
| "train_runtime": 1435.7111, | |
| "train_tokens_per_second": 6227.591 | |
| }, | |
| { | |
| "epoch": 1.882051282051282, | |
| "grad_norm": 0.21191436052322388, | |
| "learning_rate": 1.2392426850258176e-05, | |
| "loss": 0.3797, | |
| "num_input_tokens_seen": 8951518, | |
| "step": 551, | |
| "train_runtime": 1437.3232, | |
| "train_tokens_per_second": 6227.909 | |
| }, | |
| { | |
| "epoch": 1.8854700854700854, | |
| "grad_norm": 0.17271479964256287, | |
| "learning_rate": 1.2048192771084338e-05, | |
| "loss": 0.3924, | |
| "num_input_tokens_seen": 8967406, | |
| "step": 552, | |
| "train_runtime": 1439.697, | |
| "train_tokens_per_second": 6228.676 | |
| }, | |
| { | |
| "epoch": 1.8888888888888888, | |
| "grad_norm": 0.17815494537353516, | |
| "learning_rate": 1.17039586919105e-05, | |
| "loss": 0.3984, | |
| "num_input_tokens_seen": 8980910, | |
| "step": 553, | |
| "train_runtime": 1441.6466, | |
| "train_tokens_per_second": 6229.619 | |
| }, | |
| { | |
| "epoch": 1.8923076923076922, | |
| "grad_norm": 0.18840882182121277, | |
| "learning_rate": 1.1359724612736663e-05, | |
| "loss": 0.4698, | |
| "num_input_tokens_seen": 8996702, | |
| "step": 554, | |
| "train_runtime": 1444.0033, | |
| "train_tokens_per_second": 6230.389 | |
| }, | |
| { | |
| "epoch": 1.8957264957264957, | |
| "grad_norm": 0.17246229946613312, | |
| "learning_rate": 1.1015490533562824e-05, | |
| "loss": 0.3294, | |
| "num_input_tokens_seen": 9014414, | |
| "step": 555, | |
| "train_runtime": 1446.5743, | |
| "train_tokens_per_second": 6231.56 | |
| }, | |
| { | |
| "epoch": 1.899145299145299, | |
| "grad_norm": 0.20323026180267334, | |
| "learning_rate": 1.0671256454388985e-05, | |
| "loss": 0.4267, | |
| "num_input_tokens_seen": 9031550, | |
| "step": 556, | |
| "train_runtime": 1449.0794, | |
| "train_tokens_per_second": 6232.612 | |
| }, | |
| { | |
| "epoch": 1.9025641025641025, | |
| "grad_norm": 0.17592619359493256, | |
| "learning_rate": 1.0327022375215146e-05, | |
| "loss": 0.3815, | |
| "num_input_tokens_seen": 9048238, | |
| "step": 557, | |
| "train_runtime": 1451.4988, | |
| "train_tokens_per_second": 6233.721 | |
| }, | |
| { | |
| "epoch": 1.9059829059829059, | |
| "grad_norm": 0.16363990306854248, | |
| "learning_rate": 9.982788296041308e-06, | |
| "loss": 0.3811, | |
| "num_input_tokens_seen": 9066494, | |
| "step": 558, | |
| "train_runtime": 1454.1349, | |
| "train_tokens_per_second": 6234.975 | |
| }, | |
| { | |
| "epoch": 1.9094017094017093, | |
| "grad_norm": 0.1940564066171646, | |
| "learning_rate": 9.63855421686747e-06, | |
| "loss": 0.3237, | |
| "num_input_tokens_seen": 9079822, | |
| "step": 559, | |
| "train_runtime": 1456.1609, | |
| "train_tokens_per_second": 6235.453 | |
| }, | |
| { | |
| "epoch": 1.9128205128205127, | |
| "grad_norm": 0.2036203294992447, | |
| "learning_rate": 9.294320137693632e-06, | |
| "loss": 0.4353, | |
| "num_input_tokens_seen": 9091598, | |
| "step": 560, | |
| "train_runtime": 1457.9853, | |
| "train_tokens_per_second": 6235.727 | |
| }, | |
| { | |
| "epoch": 1.916239316239316, | |
| "grad_norm": 0.18901148438453674, | |
| "learning_rate": 8.950086058519795e-06, | |
| "loss": 0.4001, | |
| "num_input_tokens_seen": 9104990, | |
| "step": 561, | |
| "train_runtime": 1460.0107, | |
| "train_tokens_per_second": 6236.249 | |
| }, | |
| { | |
| "epoch": 1.9196581196581195, | |
| "grad_norm": 0.18928927183151245, | |
| "learning_rate": 8.605851979345956e-06, | |
| "loss": 0.3813, | |
| "num_input_tokens_seen": 9119310, | |
| "step": 562, | |
| "train_runtime": 1462.1634, | |
| "train_tokens_per_second": 6236.861 | |
| }, | |
| { | |
| "epoch": 1.9230769230769231, | |
| "grad_norm": 0.1698116660118103, | |
| "learning_rate": 8.261617900172119e-06, | |
| "loss": 0.3993, | |
| "num_input_tokens_seen": 9134702, | |
| "step": 563, | |
| "train_runtime": 1464.4317, | |
| "train_tokens_per_second": 6237.711 | |
| }, | |
| { | |
| "epoch": 1.9264957264957265, | |
| "grad_norm": 0.1814728081226349, | |
| "learning_rate": 7.91738382099828e-06, | |
| "loss": 0.4208, | |
| "num_input_tokens_seen": 9147822, | |
| "step": 564, | |
| "train_runtime": 1466.388, | |
| "train_tokens_per_second": 6238.336 | |
| }, | |
| { | |
| "epoch": 1.92991452991453, | |
| "grad_norm": 0.18567024171352386, | |
| "learning_rate": 7.573149741824441e-06, | |
| "loss": 0.4371, | |
| "num_input_tokens_seen": 9164110, | |
| "step": 565, | |
| "train_runtime": 1468.7747, | |
| "train_tokens_per_second": 6239.289 | |
| }, | |
| { | |
| "epoch": 1.9333333333333333, | |
| "grad_norm": 0.2137572318315506, | |
| "learning_rate": 7.228915662650602e-06, | |
| "loss": 0.3899, | |
| "num_input_tokens_seen": 9174894, | |
| "step": 566, | |
| "train_runtime": 1470.4523, | |
| "train_tokens_per_second": 6239.505 | |
| }, | |
| { | |
| "epoch": 1.9367521367521368, | |
| "grad_norm": 0.15320739150047302, | |
| "learning_rate": 6.884681583476764e-06, | |
| "loss": 0.3531, | |
| "num_input_tokens_seen": 9191886, | |
| "step": 567, | |
| "train_runtime": 1472.9549, | |
| "train_tokens_per_second": 6240.44 | |
| }, | |
| { | |
| "epoch": 1.9401709401709402, | |
| "grad_norm": 0.21417830884456635, | |
| "learning_rate": 6.5404475043029266e-06, | |
| "loss": 0.4213, | |
| "num_input_tokens_seen": 9203742, | |
| "step": 568, | |
| "train_runtime": 1474.745, | |
| "train_tokens_per_second": 6240.904 | |
| }, | |
| { | |
| "epoch": 1.9435897435897436, | |
| "grad_norm": 0.1843339502811432, | |
| "learning_rate": 6.196213425129088e-06, | |
| "loss": 0.374, | |
| "num_input_tokens_seen": 9216110, | |
| "step": 569, | |
| "train_runtime": 1476.6219, | |
| "train_tokens_per_second": 6241.347 | |
| }, | |
| { | |
| "epoch": 1.947008547008547, | |
| "grad_norm": 0.16858874261379242, | |
| "learning_rate": 5.85197934595525e-06, | |
| "loss": 0.3967, | |
| "num_input_tokens_seen": 9232750, | |
| "step": 570, | |
| "train_runtime": 1479.0428, | |
| "train_tokens_per_second": 6242.382 | |
| }, | |
| { | |
| "epoch": 1.9504273504273504, | |
| "grad_norm": 0.21565116941928864, | |
| "learning_rate": 5.507745266781412e-06, | |
| "loss": 0.4639, | |
| "num_input_tokens_seen": 9244110, | |
| "step": 571, | |
| "train_runtime": 1481.2963, | |
| "train_tokens_per_second": 6240.554 | |
| }, | |
| { | |
| "epoch": 1.953846153846154, | |
| "grad_norm": 0.17212358117103577, | |
| "learning_rate": 5.163511187607573e-06, | |
| "loss": 0.4541, | |
| "num_input_tokens_seen": 9260670, | |
| "step": 572, | |
| "train_runtime": 1483.7253, | |
| "train_tokens_per_second": 6241.499 | |
| }, | |
| { | |
| "epoch": 1.9572649572649574, | |
| "grad_norm": 0.16098545491695404, | |
| "learning_rate": 4.819277108433735e-06, | |
| "loss": 0.3808, | |
| "num_input_tokens_seen": 9277182, | |
| "step": 573, | |
| "train_runtime": 1486.1266, | |
| "train_tokens_per_second": 6242.525 | |
| }, | |
| { | |
| "epoch": 1.9606837606837608, | |
| "grad_norm": 0.1885039359331131, | |
| "learning_rate": 4.475043029259897e-06, | |
| "loss": 0.4711, | |
| "num_input_tokens_seen": 9291486, | |
| "step": 574, | |
| "train_runtime": 1488.2625, | |
| "train_tokens_per_second": 6243.177 | |
| }, | |
| { | |
| "epoch": 1.9641025641025642, | |
| "grad_norm": 0.17435158789157867, | |
| "learning_rate": 4.130808950086059e-06, | |
| "loss": 0.3834, | |
| "num_input_tokens_seen": 9307182, | |
| "step": 575, | |
| "train_runtime": 1490.6012, | |
| "train_tokens_per_second": 6243.911 | |
| }, | |
| { | |
| "epoch": 1.9675213675213676, | |
| "grad_norm": 0.17134054005146027, | |
| "learning_rate": 3.7865748709122206e-06, | |
| "loss": 0.3521, | |
| "num_input_tokens_seen": 9324318, | |
| "step": 576, | |
| "train_runtime": 1493.1064, | |
| "train_tokens_per_second": 6244.912 | |
| }, | |
| { | |
| "epoch": 1.970940170940171, | |
| "grad_norm": 0.18249361217021942, | |
| "learning_rate": 3.442340791738382e-06, | |
| "loss": 0.3362, | |
| "num_input_tokens_seen": 9338622, | |
| "step": 577, | |
| "train_runtime": 1495.2539, | |
| "train_tokens_per_second": 6245.509 | |
| }, | |
| { | |
| "epoch": 1.9743589743589745, | |
| "grad_norm": 0.17978602647781372, | |
| "learning_rate": 3.098106712564544e-06, | |
| "loss": 0.4274, | |
| "num_input_tokens_seen": 9353918, | |
| "step": 578, | |
| "train_runtime": 1497.5034, | |
| "train_tokens_per_second": 6246.342 | |
| }, | |
| { | |
| "epoch": 1.9777777777777779, | |
| "grad_norm": 0.14672812819480896, | |
| "learning_rate": 2.753872633390706e-06, | |
| "loss": 0.314, | |
| "num_input_tokens_seen": 9390878, | |
| "step": 579, | |
| "train_runtime": 1502.7758, | |
| "train_tokens_per_second": 6249.021 | |
| }, | |
| { | |
| "epoch": 1.9811965811965813, | |
| "grad_norm": 0.19798055291175842, | |
| "learning_rate": 2.4096385542168676e-06, | |
| "loss": 0.4314, | |
| "num_input_tokens_seen": 9404654, | |
| "step": 580, | |
| "train_runtime": 1504.8242, | |
| "train_tokens_per_second": 6249.67 | |
| }, | |
| { | |
| "epoch": 1.9846153846153847, | |
| "grad_norm": 0.1839577704668045, | |
| "learning_rate": 2.0654044750430297e-06, | |
| "loss": 0.346, | |
| "num_input_tokens_seen": 9421838, | |
| "step": 581, | |
| "train_runtime": 1507.3329, | |
| "train_tokens_per_second": 6250.668 | |
| }, | |
| { | |
| "epoch": 1.988034188034188, | |
| "grad_norm": 0.1459440439939499, | |
| "learning_rate": 1.721170395869191e-06, | |
| "loss": 0.302, | |
| "num_input_tokens_seen": 9450766, | |
| "step": 582, | |
| "train_runtime": 1511.4289, | |
| "train_tokens_per_second": 6252.868 | |
| }, | |
| { | |
| "epoch": 1.9914529914529915, | |
| "grad_norm": 0.1679002195596695, | |
| "learning_rate": 1.376936316695353e-06, | |
| "loss": 0.3794, | |
| "num_input_tokens_seen": 9467966, | |
| "step": 583, | |
| "train_runtime": 1513.9495, | |
| "train_tokens_per_second": 6253.819 | |
| }, | |
| { | |
| "epoch": 1.994871794871795, | |
| "grad_norm": 0.18191100656986237, | |
| "learning_rate": 1.0327022375215148e-06, | |
| "loss": 0.4131, | |
| "num_input_tokens_seen": 9482622, | |
| "step": 584, | |
| "train_runtime": 1516.0908, | |
| "train_tokens_per_second": 6254.653 | |
| }, | |
| { | |
| "epoch": 1.9982905982905983, | |
| "grad_norm": 0.17011763155460358, | |
| "learning_rate": 6.884681583476765e-07, | |
| "loss": 0.3366, | |
| "num_input_tokens_seen": 9497966, | |
| "step": 585, | |
| "train_runtime": 1518.3683, | |
| "train_tokens_per_second": 6255.377 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 0.23105928301811218, | |
| "learning_rate": 3.4423407917383825e-07, | |
| "loss": 0.3455, | |
| "num_input_tokens_seen": 9505226, | |
| "step": 586, | |
| "train_runtime": 1519.4393, | |
| "train_tokens_per_second": 6255.746 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 586, | |
| "num_input_tokens_seen": 9505226, | |
| "num_train_epochs": 2, | |
| "save_steps": 30, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4.055493629648671e+17, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |