Text Generation
Transformers
Safetensors
qwen2
Generated from Trainer
trl
sft
unsloth
conversational
text-generation-inference
Instructions to use FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth") model = AutoModelForCausalLM.from_pretrained("FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth
- SGLang
How to use FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Unsloth Studio
How to use FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth", max_seq_length=2048, ) - Docker Model Runner
How to use FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth with Docker Model Runner:
docker model run hf.co/FormlessAI/Qwen2.5-3B-Instruct-Reasoning-Unsloth
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.0, | |
| "eval_steps": 78, | |
| "global_step": 778, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0012857602057216328, | |
| "grad_norm": 59.91437911987305, | |
| "learning_rate": 0.0, | |
| "loss": 2.8221, | |
| "num_input_tokens_seen": 135296, | |
| "step": 1, | |
| "train_runtime": 22.8878, | |
| "train_tokens_per_second": 5911.283 | |
| }, | |
| { | |
| "epoch": 0.0025715204114432656, | |
| "grad_norm": 54.928260803222656, | |
| "learning_rate": 4.000000000000001e-06, | |
| "loss": 2.8194, | |
| "num_input_tokens_seen": 295488, | |
| "step": 2, | |
| "train_runtime": 38.3163, | |
| "train_tokens_per_second": 7711.806 | |
| }, | |
| { | |
| "epoch": 0.003857280617164899, | |
| "grad_norm": 46.19917297363281, | |
| "learning_rate": 8.000000000000001e-06, | |
| "loss": 2.5824, | |
| "num_input_tokens_seen": 390880, | |
| "step": 3, | |
| "train_runtime": 46.3319, | |
| "train_tokens_per_second": 8436.522 | |
| }, | |
| { | |
| "epoch": 0.005143040822886531, | |
| "grad_norm": 29.48894691467285, | |
| "learning_rate": 1.2e-05, | |
| "loss": 2.1127, | |
| "num_input_tokens_seen": 527584, | |
| "step": 4, | |
| "train_runtime": 58.9913, | |
| "train_tokens_per_second": 8943.425 | |
| }, | |
| { | |
| "epoch": 0.006428801028608165, | |
| "grad_norm": 12.14394474029541, | |
| "learning_rate": 1.6000000000000003e-05, | |
| "loss": 1.7084, | |
| "num_input_tokens_seen": 644736, | |
| "step": 5, | |
| "train_runtime": 69.2931, | |
| "train_tokens_per_second": 9304.479 | |
| }, | |
| { | |
| "epoch": 0.007714561234329798, | |
| "grad_norm": 9.809494018554688, | |
| "learning_rate": 2e-05, | |
| "loss": 1.681, | |
| "num_input_tokens_seen": 777056, | |
| "step": 6, | |
| "train_runtime": 81.2029, | |
| "train_tokens_per_second": 9569.309 | |
| }, | |
| { | |
| "epoch": 0.00900032144005143, | |
| "grad_norm": 8.21720027923584, | |
| "learning_rate": 1.997412677878396e-05, | |
| "loss": 1.6744, | |
| "num_input_tokens_seen": 910560, | |
| "step": 7, | |
| "train_runtime": 93.321, | |
| "train_tokens_per_second": 9757.29 | |
| }, | |
| { | |
| "epoch": 0.010286081645773062, | |
| "grad_norm": 7.667925834655762, | |
| "learning_rate": 1.994825355756792e-05, | |
| "loss": 1.4179, | |
| "num_input_tokens_seen": 1062912, | |
| "step": 8, | |
| "train_runtime": 107.311, | |
| "train_tokens_per_second": 9904.967 | |
| }, | |
| { | |
| "epoch": 0.011571841851494697, | |
| "grad_norm": 6.243086814880371, | |
| "learning_rate": 1.9922380336351877e-05, | |
| "loss": 1.3252, | |
| "num_input_tokens_seen": 1152448, | |
| "step": 9, | |
| "train_runtime": 114.8712, | |
| "train_tokens_per_second": 10032.519 | |
| }, | |
| { | |
| "epoch": 0.01285760205721633, | |
| "grad_norm": 4.096212863922119, | |
| "learning_rate": 1.9896507115135837e-05, | |
| "loss": 1.2179, | |
| "num_input_tokens_seen": 1251424, | |
| "step": 10, | |
| "train_runtime": 123.394, | |
| "train_tokens_per_second": 10141.69 | |
| }, | |
| { | |
| "epoch": 0.014143362262937963, | |
| "grad_norm": 3.7918293476104736, | |
| "learning_rate": 1.9870633893919795e-05, | |
| "loss": 1.3145, | |
| "num_input_tokens_seen": 1401632, | |
| "step": 11, | |
| "train_runtime": 137.3677, | |
| "train_tokens_per_second": 10203.506 | |
| }, | |
| { | |
| "epoch": 0.015429122468659595, | |
| "grad_norm": 2.6636881828308105, | |
| "learning_rate": 1.9844760672703752e-05, | |
| "loss": 1.1167, | |
| "num_input_tokens_seen": 1485088, | |
| "step": 12, | |
| "train_runtime": 144.3866, | |
| "train_tokens_per_second": 10285.495 | |
| }, | |
| { | |
| "epoch": 0.01671488267438123, | |
| "grad_norm": 3.1536850929260254, | |
| "learning_rate": 1.9818887451487713e-05, | |
| "loss": 1.2975, | |
| "num_input_tokens_seen": 1599424, | |
| "step": 13, | |
| "train_runtime": 154.4368, | |
| "train_tokens_per_second": 10356.492 | |
| }, | |
| { | |
| "epoch": 0.01800064288010286, | |
| "grad_norm": 2.806964874267578, | |
| "learning_rate": 1.979301423027167e-05, | |
| "loss": 1.2166, | |
| "num_input_tokens_seen": 1688192, | |
| "step": 14, | |
| "train_runtime": 161.9986, | |
| "train_tokens_per_second": 10421.031 | |
| }, | |
| { | |
| "epoch": 0.019286403085824494, | |
| "grad_norm": 2.8832125663757324, | |
| "learning_rate": 1.9767141009055627e-05, | |
| "loss": 1.3103, | |
| "num_input_tokens_seen": 1779040, | |
| "step": 15, | |
| "train_runtime": 169.8234, | |
| "train_tokens_per_second": 10475.825 | |
| }, | |
| { | |
| "epoch": 0.020572163291546125, | |
| "grad_norm": 2.3326032161712646, | |
| "learning_rate": 1.9741267787839588e-05, | |
| "loss": 1.1936, | |
| "num_input_tokens_seen": 1898976, | |
| "step": 16, | |
| "train_runtime": 180.4047, | |
| "train_tokens_per_second": 10526.202 | |
| }, | |
| { | |
| "epoch": 0.02185792349726776, | |
| "grad_norm": 2.495771646499634, | |
| "learning_rate": 1.971539456662355e-05, | |
| "loss": 1.238, | |
| "num_input_tokens_seen": 2002496, | |
| "step": 17, | |
| "train_runtime": 189.3388, | |
| "train_tokens_per_second": 10576.258 | |
| }, | |
| { | |
| "epoch": 0.023143683702989394, | |
| "grad_norm": 2.3127689361572266, | |
| "learning_rate": 1.9689521345407506e-05, | |
| "loss": 1.2386, | |
| "num_input_tokens_seen": 2148032, | |
| "step": 18, | |
| "train_runtime": 202.5493, | |
| "train_tokens_per_second": 10604.983 | |
| }, | |
| { | |
| "epoch": 0.024429443908711025, | |
| "grad_norm": 2.1507444381713867, | |
| "learning_rate": 1.9663648124191463e-05, | |
| "loss": 1.1955, | |
| "num_input_tokens_seen": 2273632, | |
| "step": 19, | |
| "train_runtime": 214.0022, | |
| "train_tokens_per_second": 10624.337 | |
| }, | |
| { | |
| "epoch": 0.02571520411443266, | |
| "grad_norm": 2.7235100269317627, | |
| "learning_rate": 1.963777490297542e-05, | |
| "loss": 1.2066, | |
| "num_input_tokens_seen": 2383520, | |
| "step": 20, | |
| "train_runtime": 223.8834, | |
| "train_tokens_per_second": 10646.255 | |
| }, | |
| { | |
| "epoch": 0.02700096432015429, | |
| "grad_norm": 2.299577236175537, | |
| "learning_rate": 1.961190168175938e-05, | |
| "loss": 1.1685, | |
| "num_input_tokens_seen": 2483456, | |
| "step": 21, | |
| "train_runtime": 232.4787, | |
| "train_tokens_per_second": 10682.509 | |
| }, | |
| { | |
| "epoch": 0.028286724525875925, | |
| "grad_norm": 2.1814215183258057, | |
| "learning_rate": 1.9586028460543338e-05, | |
| "loss": 1.1816, | |
| "num_input_tokens_seen": 2628480, | |
| "step": 22, | |
| "train_runtime": 245.7507, | |
| "train_tokens_per_second": 10695.718 | |
| }, | |
| { | |
| "epoch": 0.029572484731597556, | |
| "grad_norm": 1.9551724195480347, | |
| "learning_rate": 1.95601552393273e-05, | |
| "loss": 1.1728, | |
| "num_input_tokens_seen": 2741984, | |
| "step": 23, | |
| "train_runtime": 255.7533, | |
| "train_tokens_per_second": 10721.207 | |
| }, | |
| { | |
| "epoch": 0.03085824493731919, | |
| "grad_norm": 1.9535983800888062, | |
| "learning_rate": 1.9534282018111256e-05, | |
| "loss": 1.2263, | |
| "num_input_tokens_seen": 2827744, | |
| "step": 24, | |
| "train_runtime": 263.0783, | |
| "train_tokens_per_second": 10748.679 | |
| }, | |
| { | |
| "epoch": 0.032144005143040826, | |
| "grad_norm": 2.2656548023223877, | |
| "learning_rate": 1.9508408796895217e-05, | |
| "loss": 1.1648, | |
| "num_input_tokens_seen": 2926304, | |
| "step": 25, | |
| "train_runtime": 271.5983, | |
| "train_tokens_per_second": 10774.384 | |
| }, | |
| { | |
| "epoch": 0.03342976534876246, | |
| "grad_norm": 2.323800563812256, | |
| "learning_rate": 1.9482535575679174e-05, | |
| "loss": 1.1831, | |
| "num_input_tokens_seen": 3039168, | |
| "step": 26, | |
| "train_runtime": 281.843, | |
| "train_tokens_per_second": 10783.195 | |
| }, | |
| { | |
| "epoch": 0.03471552555448409, | |
| "grad_norm": 1.9560903310775757, | |
| "learning_rate": 1.945666235446313e-05, | |
| "loss": 1.2156, | |
| "num_input_tokens_seen": 3162080, | |
| "step": 27, | |
| "train_runtime": 293.1326, | |
| "train_tokens_per_second": 10787.199 | |
| }, | |
| { | |
| "epoch": 0.03600128576020572, | |
| "grad_norm": 1.7636638879776, | |
| "learning_rate": 1.943078913324709e-05, | |
| "loss": 1.1564, | |
| "num_input_tokens_seen": 3277408, | |
| "step": 28, | |
| "train_runtime": 303.3144, | |
| "train_tokens_per_second": 10805.316 | |
| }, | |
| { | |
| "epoch": 0.03728704596592736, | |
| "grad_norm": 1.9402304887771606, | |
| "learning_rate": 1.940491591203105e-05, | |
| "loss": 1.2378, | |
| "num_input_tokens_seen": 3393408, | |
| "step": 29, | |
| "train_runtime": 313.5538, | |
| "train_tokens_per_second": 10822.41 | |
| }, | |
| { | |
| "epoch": 0.03857280617164899, | |
| "grad_norm": 2.0136935710906982, | |
| "learning_rate": 1.937904269081501e-05, | |
| "loss": 1.2205, | |
| "num_input_tokens_seen": 3493664, | |
| "step": 30, | |
| "train_runtime": 322.3163, | |
| "train_tokens_per_second": 10839.242 | |
| }, | |
| { | |
| "epoch": 0.03985856637737062, | |
| "grad_norm": 2.0718331336975098, | |
| "learning_rate": 1.9353169469598967e-05, | |
| "loss": 1.2168, | |
| "num_input_tokens_seen": 3632128, | |
| "step": 31, | |
| "train_runtime": 351.6221, | |
| "train_tokens_per_second": 10329.636 | |
| }, | |
| { | |
| "epoch": 0.04114432658309225, | |
| "grad_norm": 1.8790080547332764, | |
| "learning_rate": 1.9327296248382924e-05, | |
| "loss": 1.1357, | |
| "num_input_tokens_seen": 3740256, | |
| "step": 32, | |
| "train_runtime": 360.9507, | |
| "train_tokens_per_second": 10362.236 | |
| }, | |
| { | |
| "epoch": 0.04243008678881389, | |
| "grad_norm": 1.775802731513977, | |
| "learning_rate": 1.9301423027166882e-05, | |
| "loss": 1.1974, | |
| "num_input_tokens_seen": 3836320, | |
| "step": 33, | |
| "train_runtime": 369.242, | |
| "train_tokens_per_second": 10389.716 | |
| }, | |
| { | |
| "epoch": 0.04371584699453552, | |
| "grad_norm": 1.7465744018554688, | |
| "learning_rate": 1.9275549805950842e-05, | |
| "loss": 1.1552, | |
| "num_input_tokens_seen": 3973216, | |
| "step": 34, | |
| "train_runtime": 381.9458, | |
| "train_tokens_per_second": 10402.566 | |
| }, | |
| { | |
| "epoch": 0.04500160720025715, | |
| "grad_norm": 1.946832299232483, | |
| "learning_rate": 1.9249676584734803e-05, | |
| "loss": 1.0835, | |
| "num_input_tokens_seen": 4098496, | |
| "step": 35, | |
| "train_runtime": 393.2749, | |
| "train_tokens_per_second": 10421.453 | |
| }, | |
| { | |
| "epoch": 0.04628736740597879, | |
| "grad_norm": 1.8845430612564087, | |
| "learning_rate": 1.922380336351876e-05, | |
| "loss": 1.2099, | |
| "num_input_tokens_seen": 4211328, | |
| "step": 36, | |
| "train_runtime": 403.0748, | |
| "train_tokens_per_second": 10448.006 | |
| }, | |
| { | |
| "epoch": 0.04757312761170042, | |
| "grad_norm": 1.9792522192001343, | |
| "learning_rate": 1.9197930142302718e-05, | |
| "loss": 1.1743, | |
| "num_input_tokens_seen": 4354368, | |
| "step": 37, | |
| "train_runtime": 416.1989, | |
| "train_tokens_per_second": 10462.229 | |
| }, | |
| { | |
| "epoch": 0.04885888781742205, | |
| "grad_norm": 1.7486963272094727, | |
| "learning_rate": 1.9172056921086678e-05, | |
| "loss": 1.1916, | |
| "num_input_tokens_seen": 4459872, | |
| "step": 38, | |
| "train_runtime": 425.2452, | |
| "train_tokens_per_second": 10487.765 | |
| }, | |
| { | |
| "epoch": 0.05014464802314368, | |
| "grad_norm": 1.8029528856277466, | |
| "learning_rate": 1.9146183699870636e-05, | |
| "loss": 1.2058, | |
| "num_input_tokens_seen": 4586752, | |
| "step": 39, | |
| "train_runtime": 436.5305, | |
| "train_tokens_per_second": 10507.289 | |
| }, | |
| { | |
| "epoch": 0.05143040822886532, | |
| "grad_norm": 1.6773114204406738, | |
| "learning_rate": 1.9120310478654593e-05, | |
| "loss": 1.171, | |
| "num_input_tokens_seen": 4679744, | |
| "step": 40, | |
| "train_runtime": 444.5403, | |
| "train_tokens_per_second": 10527.152 | |
| }, | |
| { | |
| "epoch": 0.05271616843458695, | |
| "grad_norm": 2.0230824947357178, | |
| "learning_rate": 1.909443725743855e-05, | |
| "loss": 1.1621, | |
| "num_input_tokens_seen": 4834496, | |
| "step": 41, | |
| "train_runtime": 459.2262, | |
| "train_tokens_per_second": 10527.482 | |
| }, | |
| { | |
| "epoch": 0.05400192864030858, | |
| "grad_norm": 1.7988804578781128, | |
| "learning_rate": 1.906856403622251e-05, | |
| "loss": 1.1448, | |
| "num_input_tokens_seen": 4924224, | |
| "step": 42, | |
| "train_runtime": 466.8323, | |
| "train_tokens_per_second": 10548.165 | |
| }, | |
| { | |
| "epoch": 0.05528768884603021, | |
| "grad_norm": 1.8624871969223022, | |
| "learning_rate": 1.904269081500647e-05, | |
| "loss": 1.0607, | |
| "num_input_tokens_seen": 5027584, | |
| "step": 43, | |
| "train_runtime": 475.733, | |
| "train_tokens_per_second": 10568.078 | |
| }, | |
| { | |
| "epoch": 0.05657344905175185, | |
| "grad_norm": 1.902448296546936, | |
| "learning_rate": 1.901681759379043e-05, | |
| "loss": 1.2209, | |
| "num_input_tokens_seen": 5147008, | |
| "step": 44, | |
| "train_runtime": 486.1981, | |
| "train_tokens_per_second": 10586.237 | |
| }, | |
| { | |
| "epoch": 0.05785920925747348, | |
| "grad_norm": 1.875640869140625, | |
| "learning_rate": 1.8990944372574386e-05, | |
| "loss": 1.1073, | |
| "num_input_tokens_seen": 5265504, | |
| "step": 45, | |
| "train_runtime": 497.0036, | |
| "train_tokens_per_second": 10594.498 | |
| }, | |
| { | |
| "epoch": 0.05914496946319511, | |
| "grad_norm": 1.8521565198898315, | |
| "learning_rate": 1.8965071151358347e-05, | |
| "loss": 1.1615, | |
| "num_input_tokens_seen": 5367456, | |
| "step": 46, | |
| "train_runtime": 505.7756, | |
| "train_tokens_per_second": 10612.328 | |
| }, | |
| { | |
| "epoch": 0.060430729668916744, | |
| "grad_norm": 1.8101763725280762, | |
| "learning_rate": 1.8939197930142304e-05, | |
| "loss": 1.0999, | |
| "num_input_tokens_seen": 5491136, | |
| "step": 47, | |
| "train_runtime": 516.6042, | |
| "train_tokens_per_second": 10629.291 | |
| }, | |
| { | |
| "epoch": 0.06171648987463838, | |
| "grad_norm": 1.81596040725708, | |
| "learning_rate": 1.8913324708926265e-05, | |
| "loss": 1.0616, | |
| "num_input_tokens_seen": 5608224, | |
| "step": 48, | |
| "train_runtime": 527.1638, | |
| "train_tokens_per_second": 10638.484 | |
| }, | |
| { | |
| "epoch": 0.06300225008036, | |
| "grad_norm": 1.988157868385315, | |
| "learning_rate": 1.8887451487710222e-05, | |
| "loss": 1.2014, | |
| "num_input_tokens_seen": 5729248, | |
| "step": 49, | |
| "train_runtime": 538.0492, | |
| "train_tokens_per_second": 10648.187 | |
| }, | |
| { | |
| "epoch": 0.06428801028608165, | |
| "grad_norm": 1.8147128820419312, | |
| "learning_rate": 1.886157826649418e-05, | |
| "loss": 1.0791, | |
| "num_input_tokens_seen": 5888672, | |
| "step": 50, | |
| "train_runtime": 552.8286, | |
| "train_tokens_per_second": 10651.895 | |
| }, | |
| { | |
| "epoch": 0.06557377049180328, | |
| "grad_norm": 1.8205593824386597, | |
| "learning_rate": 1.883570504527814e-05, | |
| "loss": 1.1579, | |
| "num_input_tokens_seen": 6022656, | |
| "step": 51, | |
| "train_runtime": 565.0367, | |
| "train_tokens_per_second": 10658.875 | |
| }, | |
| { | |
| "epoch": 0.06685953069752491, | |
| "grad_norm": 1.8702155351638794, | |
| "learning_rate": 1.8809831824062097e-05, | |
| "loss": 1.1736, | |
| "num_input_tokens_seen": 6122848, | |
| "step": 52, | |
| "train_runtime": 573.6417, | |
| "train_tokens_per_second": 10673.646 | |
| }, | |
| { | |
| "epoch": 0.06814529090324654, | |
| "grad_norm": 2.053255796432495, | |
| "learning_rate": 1.8783958602846054e-05, | |
| "loss": 1.1884, | |
| "num_input_tokens_seen": 6219968, | |
| "step": 53, | |
| "train_runtime": 581.9801, | |
| "train_tokens_per_second": 10687.596 | |
| }, | |
| { | |
| "epoch": 0.06943105110896818, | |
| "grad_norm": 1.8326001167297363, | |
| "learning_rate": 1.8758085381630015e-05, | |
| "loss": 1.1875, | |
| "num_input_tokens_seen": 6330400, | |
| "step": 54, | |
| "train_runtime": 591.5047, | |
| "train_tokens_per_second": 10702.198 | |
| }, | |
| { | |
| "epoch": 0.0707168113146898, | |
| "grad_norm": 1.9650863409042358, | |
| "learning_rate": 1.8732212160413976e-05, | |
| "loss": 1.1747, | |
| "num_input_tokens_seen": 6500608, | |
| "step": 55, | |
| "train_runtime": 607.6429, | |
| "train_tokens_per_second": 10698.072 | |
| }, | |
| { | |
| "epoch": 0.07200257152041144, | |
| "grad_norm": 1.8934389352798462, | |
| "learning_rate": 1.8706338939197933e-05, | |
| "loss": 1.1195, | |
| "num_input_tokens_seen": 6600288, | |
| "step": 56, | |
| "train_runtime": 616.1735, | |
| "train_tokens_per_second": 10711.735 | |
| }, | |
| { | |
| "epoch": 0.07328833172613308, | |
| "grad_norm": 1.8143988847732544, | |
| "learning_rate": 1.868046571798189e-05, | |
| "loss": 1.1152, | |
| "num_input_tokens_seen": 6713184, | |
| "step": 57, | |
| "train_runtime": 625.8716, | |
| "train_tokens_per_second": 10726.135 | |
| }, | |
| { | |
| "epoch": 0.07457409193185471, | |
| "grad_norm": 1.8745934963226318, | |
| "learning_rate": 1.8654592496765847e-05, | |
| "loss": 1.1131, | |
| "num_input_tokens_seen": 6854400, | |
| "step": 58, | |
| "train_runtime": 638.8924, | |
| "train_tokens_per_second": 10728.567 | |
| }, | |
| { | |
| "epoch": 0.07585985213757634, | |
| "grad_norm": 1.8524185419082642, | |
| "learning_rate": 1.8628719275549808e-05, | |
| "loss": 1.0552, | |
| "num_input_tokens_seen": 6951744, | |
| "step": 59, | |
| "train_runtime": 647.376, | |
| "train_tokens_per_second": 10738.341 | |
| }, | |
| { | |
| "epoch": 0.07714561234329798, | |
| "grad_norm": 1.8481533527374268, | |
| "learning_rate": 1.8602846054333765e-05, | |
| "loss": 1.1928, | |
| "num_input_tokens_seen": 7081184, | |
| "step": 60, | |
| "train_runtime": 659.3929, | |
| "train_tokens_per_second": 10738.945 | |
| }, | |
| { | |
| "epoch": 0.0784313725490196, | |
| "grad_norm": 1.8214608430862427, | |
| "learning_rate": 1.8576972833117726e-05, | |
| "loss": 1.1535, | |
| "num_input_tokens_seen": 7226528, | |
| "step": 61, | |
| "train_runtime": 688.7221, | |
| "train_tokens_per_second": 10492.661 | |
| }, | |
| { | |
| "epoch": 0.07971713275474124, | |
| "grad_norm": 1.8268235921859741, | |
| "learning_rate": 1.8551099611901683e-05, | |
| "loss": 1.0817, | |
| "num_input_tokens_seen": 7317344, | |
| "step": 62, | |
| "train_runtime": 696.3751, | |
| "train_tokens_per_second": 10507.762 | |
| }, | |
| { | |
| "epoch": 0.08100289296046287, | |
| "grad_norm": 1.8014057874679565, | |
| "learning_rate": 1.8525226390685644e-05, | |
| "loss": 1.1799, | |
| "num_input_tokens_seen": 7473824, | |
| "step": 63, | |
| "train_runtime": 711.0738, | |
| "train_tokens_per_second": 10510.616 | |
| }, | |
| { | |
| "epoch": 0.0822886531661845, | |
| "grad_norm": 1.826602816581726, | |
| "learning_rate": 1.84993531694696e-05, | |
| "loss": 1.1546, | |
| "num_input_tokens_seen": 7575392, | |
| "step": 64, | |
| "train_runtime": 719.8185, | |
| "train_tokens_per_second": 10524.031 | |
| }, | |
| { | |
| "epoch": 0.08357441337190614, | |
| "grad_norm": 1.7211124897003174, | |
| "learning_rate": 1.847347994825356e-05, | |
| "loss": 1.1899, | |
| "num_input_tokens_seen": 7723680, | |
| "step": 65, | |
| "train_runtime": 733.4703, | |
| "train_tokens_per_second": 10530.324 | |
| }, | |
| { | |
| "epoch": 0.08486017357762778, | |
| "grad_norm": 1.7656164169311523, | |
| "learning_rate": 1.8447606727037516e-05, | |
| "loss": 1.2178, | |
| "num_input_tokens_seen": 7850144, | |
| "step": 66, | |
| "train_runtime": 745.1189, | |
| "train_tokens_per_second": 10535.425 | |
| }, | |
| { | |
| "epoch": 0.08614593378334941, | |
| "grad_norm": 1.8083853721618652, | |
| "learning_rate": 1.8421733505821476e-05, | |
| "loss": 1.1542, | |
| "num_input_tokens_seen": 7950752, | |
| "step": 67, | |
| "train_runtime": 753.8917, | |
| "train_tokens_per_second": 10546.278 | |
| }, | |
| { | |
| "epoch": 0.08743169398907104, | |
| "grad_norm": 1.7961894273757935, | |
| "learning_rate": 1.8395860284605437e-05, | |
| "loss": 1.044, | |
| "num_input_tokens_seen": 8080160, | |
| "step": 68, | |
| "train_runtime": 765.8094, | |
| "train_tokens_per_second": 10551.138 | |
| }, | |
| { | |
| "epoch": 0.08871745419479267, | |
| "grad_norm": 1.994905710220337, | |
| "learning_rate": 1.8369987063389394e-05, | |
| "loss": 1.1235, | |
| "num_input_tokens_seen": 8218784, | |
| "step": 69, | |
| "train_runtime": 778.4148, | |
| "train_tokens_per_second": 10558.36 | |
| }, | |
| { | |
| "epoch": 0.0900032144005143, | |
| "grad_norm": 1.9451382160186768, | |
| "learning_rate": 1.834411384217335e-05, | |
| "loss": 1.1517, | |
| "num_input_tokens_seen": 8333600, | |
| "step": 70, | |
| "train_runtime": 788.6364, | |
| "train_tokens_per_second": 10567.1 | |
| }, | |
| { | |
| "epoch": 0.09128897460623593, | |
| "grad_norm": 1.8312456607818604, | |
| "learning_rate": 1.8318240620957312e-05, | |
| "loss": 1.0547, | |
| "num_input_tokens_seen": 8460128, | |
| "step": 71, | |
| "train_runtime": 799.7803, | |
| "train_tokens_per_second": 10578.065 | |
| }, | |
| { | |
| "epoch": 0.09257473481195758, | |
| "grad_norm": 1.9686640501022339, | |
| "learning_rate": 1.829236739974127e-05, | |
| "loss": 1.2261, | |
| "num_input_tokens_seen": 8536256, | |
| "step": 72, | |
| "train_runtime": 806.2621, | |
| "train_tokens_per_second": 10587.446 | |
| }, | |
| { | |
| "epoch": 0.09386049501767921, | |
| "grad_norm": 1.8814424276351929, | |
| "learning_rate": 1.8266494178525227e-05, | |
| "loss": 1.0726, | |
| "num_input_tokens_seen": 8641280, | |
| "step": 73, | |
| "train_runtime": 815.3389, | |
| "train_tokens_per_second": 10598.39 | |
| }, | |
| { | |
| "epoch": 0.09514625522340084, | |
| "grad_norm": 1.9460242986679077, | |
| "learning_rate": 1.8240620957309187e-05, | |
| "loss": 1.1726, | |
| "num_input_tokens_seen": 8743456, | |
| "step": 74, | |
| "train_runtime": 824.1743, | |
| "train_tokens_per_second": 10608.746 | |
| }, | |
| { | |
| "epoch": 0.09643201542912247, | |
| "grad_norm": 2.0222864151000977, | |
| "learning_rate": 1.8214747736093145e-05, | |
| "loss": 1.1902, | |
| "num_input_tokens_seen": 8850720, | |
| "step": 75, | |
| "train_runtime": 833.6218, | |
| "train_tokens_per_second": 10617.189 | |
| }, | |
| { | |
| "epoch": 0.0977177756348441, | |
| "grad_norm": 1.943700909614563, | |
| "learning_rate": 1.8188874514877105e-05, | |
| "loss": 1.1683, | |
| "num_input_tokens_seen": 8990112, | |
| "step": 76, | |
| "train_runtime": 846.3567, | |
| "train_tokens_per_second": 10622.131 | |
| }, | |
| { | |
| "epoch": 0.09900353584056573, | |
| "grad_norm": 2.1447455883026123, | |
| "learning_rate": 1.8163001293661063e-05, | |
| "loss": 1.1458, | |
| "num_input_tokens_seen": 9074080, | |
| "step": 77, | |
| "train_runtime": 853.5667, | |
| "train_tokens_per_second": 10630.78 | |
| }, | |
| { | |
| "epoch": 0.10028929604628736, | |
| "grad_norm": 2.0305962562561035, | |
| "learning_rate": 1.813712807244502e-05, | |
| "loss": 1.0369, | |
| "num_input_tokens_seen": 9180160, | |
| "step": 78, | |
| "train_runtime": 862.9817, | |
| "train_tokens_per_second": 10637.723 | |
| }, | |
| { | |
| "epoch": 0.10028929604628736, | |
| "eval_loss": 1.1576727628707886, | |
| "eval_runtime": 23.0724, | |
| "eval_samples_per_second": 43.082, | |
| "eval_steps_per_second": 1.387, | |
| "num_input_tokens_seen": 9180160, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 0.101575056252009, | |
| "grad_norm": 1.998412847518921, | |
| "learning_rate": 1.8111254851228977e-05, | |
| "loss": 1.145, | |
| "num_input_tokens_seen": 9270560, | |
| "step": 79, | |
| "train_runtime": 893.8501, | |
| "train_tokens_per_second": 10371.492 | |
| }, | |
| { | |
| "epoch": 0.10286081645773064, | |
| "grad_norm": 1.8889389038085938, | |
| "learning_rate": 1.8085381630012938e-05, | |
| "loss": 1.1677, | |
| "num_input_tokens_seen": 9389504, | |
| "step": 80, | |
| "train_runtime": 904.2477, | |
| "train_tokens_per_second": 10383.774 | |
| }, | |
| { | |
| "epoch": 0.10414657666345227, | |
| "grad_norm": 1.8141217231750488, | |
| "learning_rate": 1.80595084087969e-05, | |
| "loss": 1.0648, | |
| "num_input_tokens_seen": 9498464, | |
| "step": 81, | |
| "train_runtime": 913.7098, | |
| "train_tokens_per_second": 10395.494 | |
| }, | |
| { | |
| "epoch": 0.1054323368691739, | |
| "grad_norm": 1.8328213691711426, | |
| "learning_rate": 1.8033635187580856e-05, | |
| "loss": 1.1208, | |
| "num_input_tokens_seen": 9619936, | |
| "step": 82, | |
| "train_runtime": 924.4896, | |
| "train_tokens_per_second": 10405.672 | |
| }, | |
| { | |
| "epoch": 0.10671809707489553, | |
| "grad_norm": 1.795311689376831, | |
| "learning_rate": 1.8007761966364813e-05, | |
| "loss": 1.0181, | |
| "num_input_tokens_seen": 9726976, | |
| "step": 83, | |
| "train_runtime": 933.8495, | |
| "train_tokens_per_second": 10416.0 | |
| }, | |
| { | |
| "epoch": 0.10800385728061716, | |
| "grad_norm": 1.8454675674438477, | |
| "learning_rate": 1.7981888745148774e-05, | |
| "loss": 1.0702, | |
| "num_input_tokens_seen": 9828896, | |
| "step": 84, | |
| "train_runtime": 942.6626, | |
| "train_tokens_per_second": 10426.738 | |
| }, | |
| { | |
| "epoch": 0.1092896174863388, | |
| "grad_norm": 1.9122002124786377, | |
| "learning_rate": 1.795601552393273e-05, | |
| "loss": 1.184, | |
| "num_input_tokens_seen": 10007680, | |
| "step": 85, | |
| "train_runtime": 960.0623, | |
| "train_tokens_per_second": 10423.99 | |
| }, | |
| { | |
| "epoch": 0.11057537769206043, | |
| "grad_norm": 1.873637318611145, | |
| "learning_rate": 1.7930142302716688e-05, | |
| "loss": 1.1323, | |
| "num_input_tokens_seen": 10161088, | |
| "step": 86, | |
| "train_runtime": 974.6068, | |
| "train_tokens_per_second": 10425.833 | |
| }, | |
| { | |
| "epoch": 0.11186113789778207, | |
| "grad_norm": 1.7707033157348633, | |
| "learning_rate": 1.790426908150065e-05, | |
| "loss": 1.0968, | |
| "num_input_tokens_seen": 10247072, | |
| "step": 87, | |
| "train_runtime": 981.9572, | |
| "train_tokens_per_second": 10435.355 | |
| }, | |
| { | |
| "epoch": 0.1131468981035037, | |
| "grad_norm": 1.7864853143692017, | |
| "learning_rate": 1.7878395860284606e-05, | |
| "loss": 1.0646, | |
| "num_input_tokens_seen": 10438112, | |
| "step": 88, | |
| "train_runtime": 1000.9105, | |
| "train_tokens_per_second": 10428.617 | |
| }, | |
| { | |
| "epoch": 0.11443265830922533, | |
| "grad_norm": 1.8133771419525146, | |
| "learning_rate": 1.7852522639068567e-05, | |
| "loss": 1.0905, | |
| "num_input_tokens_seen": 10559456, | |
| "step": 89, | |
| "train_runtime": 1012.136, | |
| "train_tokens_per_second": 10432.843 | |
| }, | |
| { | |
| "epoch": 0.11571841851494696, | |
| "grad_norm": 1.854591965675354, | |
| "learning_rate": 1.7826649417852524e-05, | |
| "loss": 1.1079, | |
| "num_input_tokens_seen": 10675840, | |
| "step": 90, | |
| "train_runtime": 1022.5885, | |
| "train_tokens_per_second": 10440.015 | |
| }, | |
| { | |
| "epoch": 0.1170041787206686, | |
| "grad_norm": 1.7617478370666504, | |
| "learning_rate": 1.780077619663648e-05, | |
| "loss": 1.0203, | |
| "num_input_tokens_seen": 10791936, | |
| "step": 91, | |
| "train_runtime": 1048.7392, | |
| "train_tokens_per_second": 10290.39 | |
| }, | |
| { | |
| "epoch": 0.11828993892639023, | |
| "grad_norm": 1.9446653127670288, | |
| "learning_rate": 1.7774902975420442e-05, | |
| "loss": 1.097, | |
| "num_input_tokens_seen": 10917536, | |
| "step": 92, | |
| "train_runtime": 1059.9578, | |
| "train_tokens_per_second": 10299.972 | |
| }, | |
| { | |
| "epoch": 0.11957569913211186, | |
| "grad_norm": 1.8482822179794312, | |
| "learning_rate": 1.7749029754204403e-05, | |
| "loss": 1.1365, | |
| "num_input_tokens_seen": 11021824, | |
| "step": 93, | |
| "train_runtime": 1069.2663, | |
| "train_tokens_per_second": 10307.838 | |
| }, | |
| { | |
| "epoch": 0.12086145933783349, | |
| "grad_norm": 1.8727803230285645, | |
| "learning_rate": 1.772315653298836e-05, | |
| "loss": 1.1018, | |
| "num_input_tokens_seen": 11159872, | |
| "step": 94, | |
| "train_runtime": 1081.6899, | |
| "train_tokens_per_second": 10317.071 | |
| }, | |
| { | |
| "epoch": 0.12214721954355513, | |
| "grad_norm": 1.779184341430664, | |
| "learning_rate": 1.7697283311772317e-05, | |
| "loss": 1.0668, | |
| "num_input_tokens_seen": 11258336, | |
| "step": 95, | |
| "train_runtime": 1090.2473, | |
| "train_tokens_per_second": 10326.406 | |
| }, | |
| { | |
| "epoch": 0.12343297974927676, | |
| "grad_norm": 1.8586459159851074, | |
| "learning_rate": 1.7671410090556274e-05, | |
| "loss": 1.1594, | |
| "num_input_tokens_seen": 11381312, | |
| "step": 96, | |
| "train_runtime": 1101.6291, | |
| "train_tokens_per_second": 10331.347 | |
| }, | |
| { | |
| "epoch": 0.1247187399549984, | |
| "grad_norm": 1.8665542602539062, | |
| "learning_rate": 1.7645536869340235e-05, | |
| "loss": 1.108, | |
| "num_input_tokens_seen": 11554048, | |
| "step": 97, | |
| "train_runtime": 1118.3041, | |
| "train_tokens_per_second": 10331.759 | |
| }, | |
| { | |
| "epoch": 0.12600450016072, | |
| "grad_norm": 1.8169111013412476, | |
| "learning_rate": 1.7619663648124192e-05, | |
| "loss": 1.1525, | |
| "num_input_tokens_seen": 11717152, | |
| "step": 98, | |
| "train_runtime": 1134.1337, | |
| "train_tokens_per_second": 10331.367 | |
| }, | |
| { | |
| "epoch": 0.12729026036644167, | |
| "grad_norm": 1.9255194664001465, | |
| "learning_rate": 1.759379042690815e-05, | |
| "loss": 1.0878, | |
| "num_input_tokens_seen": 11854432, | |
| "step": 99, | |
| "train_runtime": 1146.8016, | |
| "train_tokens_per_second": 10336.951 | |
| }, | |
| { | |
| "epoch": 0.1285760205721633, | |
| "grad_norm": 1.9415030479431152, | |
| "learning_rate": 1.756791720569211e-05, | |
| "loss": 1.1299, | |
| "num_input_tokens_seen": 11979232, | |
| "step": 100, | |
| "train_runtime": 1158.3947, | |
| "train_tokens_per_second": 10341.235 | |
| }, | |
| { | |
| "epoch": 0.12986178077788493, | |
| "grad_norm": 1.9196245670318604, | |
| "learning_rate": 1.754204398447607e-05, | |
| "loss": 1.124, | |
| "num_input_tokens_seen": 12144416, | |
| "step": 101, | |
| "train_runtime": 1173.9193, | |
| "train_tokens_per_second": 10345.188 | |
| }, | |
| { | |
| "epoch": 0.13114754098360656, | |
| "grad_norm": 1.8218384981155396, | |
| "learning_rate": 1.7516170763260028e-05, | |
| "loss": 1.0596, | |
| "num_input_tokens_seen": 12261408, | |
| "step": 102, | |
| "train_runtime": 1184.2447, | |
| "train_tokens_per_second": 10353.779 | |
| }, | |
| { | |
| "epoch": 0.1324333011893282, | |
| "grad_norm": 1.86562979221344, | |
| "learning_rate": 1.7490297542043985e-05, | |
| "loss": 1.0873, | |
| "num_input_tokens_seen": 12384448, | |
| "step": 103, | |
| "train_runtime": 1194.8569, | |
| "train_tokens_per_second": 10364.796 | |
| }, | |
| { | |
| "epoch": 0.13371906139504983, | |
| "grad_norm": 1.9434869289398193, | |
| "learning_rate": 1.7464424320827943e-05, | |
| "loss": 1.1354, | |
| "num_input_tokens_seen": 12476352, | |
| "step": 104, | |
| "train_runtime": 1202.6401, | |
| "train_tokens_per_second": 10374.136 | |
| }, | |
| { | |
| "epoch": 0.13500482160077146, | |
| "grad_norm": 1.9082143306732178, | |
| "learning_rate": 1.7438551099611903e-05, | |
| "loss": 1.0588, | |
| "num_input_tokens_seen": 12562464, | |
| "step": 105, | |
| "train_runtime": 1209.8616, | |
| "train_tokens_per_second": 10383.39 | |
| }, | |
| { | |
| "epoch": 0.1362905818064931, | |
| "grad_norm": 1.7863415479660034, | |
| "learning_rate": 1.7412677878395864e-05, | |
| "loss": 1.1061, | |
| "num_input_tokens_seen": 12654304, | |
| "step": 106, | |
| "train_runtime": 1217.5491, | |
| "train_tokens_per_second": 10393.26 | |
| }, | |
| { | |
| "epoch": 0.13757634201221472, | |
| "grad_norm": 1.872205138206482, | |
| "learning_rate": 1.738680465717982e-05, | |
| "loss": 0.9919, | |
| "num_input_tokens_seen": 12782144, | |
| "step": 107, | |
| "train_runtime": 1229.0168, | |
| "train_tokens_per_second": 10400.3 | |
| }, | |
| { | |
| "epoch": 0.13886210221793635, | |
| "grad_norm": 2.2330684661865234, | |
| "learning_rate": 1.736093143596378e-05, | |
| "loss": 1.1528, | |
| "num_input_tokens_seen": 12899840, | |
| "step": 108, | |
| "train_runtime": 1239.2467, | |
| "train_tokens_per_second": 10409.421 | |
| }, | |
| { | |
| "epoch": 0.14014786242365798, | |
| "grad_norm": 2.096357822418213, | |
| "learning_rate": 1.733505821474774e-05, | |
| "loss": 1.0917, | |
| "num_input_tokens_seen": 13043392, | |
| "step": 109, | |
| "train_runtime": 1252.1584, | |
| "train_tokens_per_second": 10416.727 | |
| }, | |
| { | |
| "epoch": 0.1414336226293796, | |
| "grad_norm": 1.9565867185592651, | |
| "learning_rate": 1.7309184993531696e-05, | |
| "loss": 1.0547, | |
| "num_input_tokens_seen": 13188448, | |
| "step": 110, | |
| "train_runtime": 1265.437, | |
| "train_tokens_per_second": 10422.05 | |
| }, | |
| { | |
| "epoch": 0.14271938283510124, | |
| "grad_norm": 1.9779455661773682, | |
| "learning_rate": 1.7283311772315654e-05, | |
| "loss": 1.0885, | |
| "num_input_tokens_seen": 13275616, | |
| "step": 111, | |
| "train_runtime": 1272.8268, | |
| "train_tokens_per_second": 10430.026 | |
| }, | |
| { | |
| "epoch": 0.14400514304082287, | |
| "grad_norm": 1.8848296403884888, | |
| "learning_rate": 1.725743855109961e-05, | |
| "loss": 1.0563, | |
| "num_input_tokens_seen": 13401984, | |
| "step": 112, | |
| "train_runtime": 1284.164, | |
| "train_tokens_per_second": 10436.35 | |
| }, | |
| { | |
| "epoch": 0.1452909032465445, | |
| "grad_norm": 1.8709964752197266, | |
| "learning_rate": 1.723156532988357e-05, | |
| "loss": 1.1049, | |
| "num_input_tokens_seen": 13516096, | |
| "step": 113, | |
| "train_runtime": 1294.3698, | |
| "train_tokens_per_second": 10442.221 | |
| }, | |
| { | |
| "epoch": 0.14657666345226616, | |
| "grad_norm": 1.7715637683868408, | |
| "learning_rate": 1.7205692108667532e-05, | |
| "loss": 1.0666, | |
| "num_input_tokens_seen": 13608128, | |
| "step": 114, | |
| "train_runtime": 1302.3125, | |
| "train_tokens_per_second": 10449.203 | |
| }, | |
| { | |
| "epoch": 0.1478624236579878, | |
| "grad_norm": 1.7707303762435913, | |
| "learning_rate": 1.717981888745149e-05, | |
| "loss": 1.035, | |
| "num_input_tokens_seen": 13708288, | |
| "step": 115, | |
| "train_runtime": 1310.8819, | |
| "train_tokens_per_second": 10457.302 | |
| }, | |
| { | |
| "epoch": 0.14914818386370943, | |
| "grad_norm": 2.0213918685913086, | |
| "learning_rate": 1.7153945666235447e-05, | |
| "loss": 1.1718, | |
| "num_input_tokens_seen": 13832640, | |
| "step": 116, | |
| "train_runtime": 1321.8066, | |
| "train_tokens_per_second": 10464.95 | |
| }, | |
| { | |
| "epoch": 0.15043394406943106, | |
| "grad_norm": 1.9812514781951904, | |
| "learning_rate": 1.7128072445019407e-05, | |
| "loss": 1.0449, | |
| "num_input_tokens_seen": 13942400, | |
| "step": 117, | |
| "train_runtime": 1331.2362, | |
| "train_tokens_per_second": 10473.273 | |
| }, | |
| { | |
| "epoch": 0.1517197042751527, | |
| "grad_norm": 1.8844302892684937, | |
| "learning_rate": 1.7102199223803365e-05, | |
| "loss": 1.045, | |
| "num_input_tokens_seen": 14069888, | |
| "step": 118, | |
| "train_runtime": 1342.8933, | |
| "train_tokens_per_second": 10477.294 | |
| }, | |
| { | |
| "epoch": 0.15300546448087432, | |
| "grad_norm": 1.816438913345337, | |
| "learning_rate": 1.7076326002587325e-05, | |
| "loss": 1.1185, | |
| "num_input_tokens_seen": 14175328, | |
| "step": 119, | |
| "train_runtime": 1352.3432, | |
| "train_tokens_per_second": 10482.049 | |
| }, | |
| { | |
| "epoch": 0.15429122468659595, | |
| "grad_norm": 1.8164008855819702, | |
| "learning_rate": 1.7050452781371283e-05, | |
| "loss": 1.1141, | |
| "num_input_tokens_seen": 14316736, | |
| "step": 120, | |
| "train_runtime": 1365.1583, | |
| "train_tokens_per_second": 10487.235 | |
| }, | |
| { | |
| "epoch": 0.15557698489231758, | |
| "grad_norm": 1.9856698513031006, | |
| "learning_rate": 1.702457956015524e-05, | |
| "loss": 1.0548, | |
| "num_input_tokens_seen": 14398720, | |
| "step": 121, | |
| "train_runtime": 1388.1489, | |
| "train_tokens_per_second": 10372.605 | |
| }, | |
| { | |
| "epoch": 0.1568627450980392, | |
| "grad_norm": 1.7079716920852661, | |
| "learning_rate": 1.69987063389392e-05, | |
| "loss": 1.1154, | |
| "num_input_tokens_seen": 14510944, | |
| "step": 122, | |
| "train_runtime": 1398.0002, | |
| "train_tokens_per_second": 10379.787 | |
| }, | |
| { | |
| "epoch": 0.15814850530376084, | |
| "grad_norm": 2.0213663578033447, | |
| "learning_rate": 1.6972833117723158e-05, | |
| "loss": 1.1813, | |
| "num_input_tokens_seen": 14627488, | |
| "step": 123, | |
| "train_runtime": 1408.2243, | |
| "train_tokens_per_second": 10387.186 | |
| }, | |
| { | |
| "epoch": 0.15943426550948248, | |
| "grad_norm": 1.5762097835540771, | |
| "learning_rate": 1.6946959896507115e-05, | |
| "loss": 0.8798, | |
| "num_input_tokens_seen": 14765056, | |
| "step": 124, | |
| "train_runtime": 1420.9688, | |
| "train_tokens_per_second": 10390.838 | |
| }, | |
| { | |
| "epoch": 0.1607200257152041, | |
| "grad_norm": 1.9591020345687866, | |
| "learning_rate": 1.6921086675291072e-05, | |
| "loss": 1.0846, | |
| "num_input_tokens_seen": 14870688, | |
| "step": 125, | |
| "train_runtime": 1430.1584, | |
| "train_tokens_per_second": 10397.931 | |
| }, | |
| { | |
| "epoch": 0.16200578592092574, | |
| "grad_norm": 1.9856301546096802, | |
| "learning_rate": 1.6895213454075033e-05, | |
| "loss": 1.1124, | |
| "num_input_tokens_seen": 15003424, | |
| "step": 126, | |
| "train_runtime": 1442.2654, | |
| "train_tokens_per_second": 10402.679 | |
| }, | |
| { | |
| "epoch": 0.16329154612664737, | |
| "grad_norm": 1.8877084255218506, | |
| "learning_rate": 1.6869340232858994e-05, | |
| "loss": 1.102, | |
| "num_input_tokens_seen": 15167424, | |
| "step": 127, | |
| "train_runtime": 1457.8734, | |
| "train_tokens_per_second": 10403.801 | |
| }, | |
| { | |
| "epoch": 0.164577306332369, | |
| "grad_norm": 1.8509068489074707, | |
| "learning_rate": 1.684346701164295e-05, | |
| "loss": 1.0739, | |
| "num_input_tokens_seen": 15348224, | |
| "step": 128, | |
| "train_runtime": 1475.0417, | |
| "train_tokens_per_second": 10405.282 | |
| }, | |
| { | |
| "epoch": 0.16586306653809066, | |
| "grad_norm": 1.9316065311431885, | |
| "learning_rate": 1.6817593790426908e-05, | |
| "loss": 1.1319, | |
| "num_input_tokens_seen": 15459680, | |
| "step": 129, | |
| "train_runtime": 1484.5083, | |
| "train_tokens_per_second": 10414.007 | |
| }, | |
| { | |
| "epoch": 0.1671488267438123, | |
| "grad_norm": 1.8838239908218384, | |
| "learning_rate": 1.679172056921087e-05, | |
| "loss": 1.1425, | |
| "num_input_tokens_seen": 15599488, | |
| "step": 130, | |
| "train_runtime": 1497.2084, | |
| "train_tokens_per_second": 10419.049 | |
| }, | |
| { | |
| "epoch": 0.16843458694953392, | |
| "grad_norm": 1.910106897354126, | |
| "learning_rate": 1.6765847347994826e-05, | |
| "loss": 1.1367, | |
| "num_input_tokens_seen": 15693728, | |
| "step": 131, | |
| "train_runtime": 1505.1617, | |
| "train_tokens_per_second": 10426.606 | |
| }, | |
| { | |
| "epoch": 0.16972034715525555, | |
| "grad_norm": 1.8794375658035278, | |
| "learning_rate": 1.6739974126778787e-05, | |
| "loss": 1.0579, | |
| "num_input_tokens_seen": 15827776, | |
| "step": 132, | |
| "train_runtime": 1517.1331, | |
| "train_tokens_per_second": 10432.688 | |
| }, | |
| { | |
| "epoch": 0.17100610736097718, | |
| "grad_norm": 1.9578567743301392, | |
| "learning_rate": 1.6714100905562744e-05, | |
| "loss": 0.9833, | |
| "num_input_tokens_seen": 15915456, | |
| "step": 133, | |
| "train_runtime": 1524.5049, | |
| "train_tokens_per_second": 10439.754 | |
| }, | |
| { | |
| "epoch": 0.17229186756669881, | |
| "grad_norm": 1.8861867189407349, | |
| "learning_rate": 1.66882276843467e-05, | |
| "loss": 1.0137, | |
| "num_input_tokens_seen": 16006112, | |
| "step": 134, | |
| "train_runtime": 1532.0904, | |
| "train_tokens_per_second": 10447.237 | |
| }, | |
| { | |
| "epoch": 0.17357762777242045, | |
| "grad_norm": 1.8860288858413696, | |
| "learning_rate": 1.6662354463130662e-05, | |
| "loss": 1.1243, | |
| "num_input_tokens_seen": 16105472, | |
| "step": 135, | |
| "train_runtime": 1540.4944, | |
| "train_tokens_per_second": 10454.742 | |
| }, | |
| { | |
| "epoch": 0.17486338797814208, | |
| "grad_norm": 1.7597628831863403, | |
| "learning_rate": 1.663648124191462e-05, | |
| "loss": 1.065, | |
| "num_input_tokens_seen": 16227296, | |
| "step": 136, | |
| "train_runtime": 1551.1796, | |
| "train_tokens_per_second": 10461.262 | |
| }, | |
| { | |
| "epoch": 0.1761491481838637, | |
| "grad_norm": 1.8316805362701416, | |
| "learning_rate": 1.6610608020698577e-05, | |
| "loss": 1.0799, | |
| "num_input_tokens_seen": 16327072, | |
| "step": 137, | |
| "train_runtime": 1559.8785, | |
| "train_tokens_per_second": 10466.887 | |
| }, | |
| { | |
| "epoch": 0.17743490838958534, | |
| "grad_norm": 1.965746283531189, | |
| "learning_rate": 1.6584734799482537e-05, | |
| "loss": 1.1353, | |
| "num_input_tokens_seen": 16424576, | |
| "step": 138, | |
| "train_runtime": 1568.1636, | |
| "train_tokens_per_second": 10473.764 | |
| }, | |
| { | |
| "epoch": 0.17872066859530697, | |
| "grad_norm": 1.7702914476394653, | |
| "learning_rate": 1.6558861578266498e-05, | |
| "loss": 1.1117, | |
| "num_input_tokens_seen": 16573120, | |
| "step": 139, | |
| "train_runtime": 1581.7542, | |
| "train_tokens_per_second": 10477.684 | |
| }, | |
| { | |
| "epoch": 0.1800064288010286, | |
| "grad_norm": 1.8150639533996582, | |
| "learning_rate": 1.6532988357050455e-05, | |
| "loss": 1.129, | |
| "num_input_tokens_seen": 16669440, | |
| "step": 140, | |
| "train_runtime": 1589.8087, | |
| "train_tokens_per_second": 10485.186 | |
| }, | |
| { | |
| "epoch": 0.18129218900675023, | |
| "grad_norm": 1.8353360891342163, | |
| "learning_rate": 1.6507115135834412e-05, | |
| "loss": 1.1148, | |
| "num_input_tokens_seen": 16771040, | |
| "step": 141, | |
| "train_runtime": 1598.5428, | |
| "train_tokens_per_second": 10491.455 | |
| }, | |
| { | |
| "epoch": 0.18257794921247186, | |
| "grad_norm": 2.064567804336548, | |
| "learning_rate": 1.648124191461837e-05, | |
| "loss": 1.0626, | |
| "num_input_tokens_seen": 16902048, | |
| "step": 142, | |
| "train_runtime": 1609.9524, | |
| "train_tokens_per_second": 10498.477 | |
| }, | |
| { | |
| "epoch": 0.1838637094181935, | |
| "grad_norm": 1.8049488067626953, | |
| "learning_rate": 1.645536869340233e-05, | |
| "loss": 1.1076, | |
| "num_input_tokens_seen": 17043808, | |
| "step": 143, | |
| "train_runtime": 1622.5917, | |
| "train_tokens_per_second": 10504.064 | |
| }, | |
| { | |
| "epoch": 0.18514946962391515, | |
| "grad_norm": 1.751596212387085, | |
| "learning_rate": 1.6429495472186288e-05, | |
| "loss": 1.0649, | |
| "num_input_tokens_seen": 17140096, | |
| "step": 144, | |
| "train_runtime": 1630.7355, | |
| "train_tokens_per_second": 10510.653 | |
| }, | |
| { | |
| "epoch": 0.18643522982963678, | |
| "grad_norm": 1.855686068534851, | |
| "learning_rate": 1.6403622250970248e-05, | |
| "loss": 1.1758, | |
| "num_input_tokens_seen": 17238624, | |
| "step": 145, | |
| "train_runtime": 1639.2446, | |
| "train_tokens_per_second": 10516.2 | |
| }, | |
| { | |
| "epoch": 0.18772099003535841, | |
| "grad_norm": 1.9099684953689575, | |
| "learning_rate": 1.6377749029754206e-05, | |
| "loss": 1.0719, | |
| "num_input_tokens_seen": 17360128, | |
| "step": 146, | |
| "train_runtime": 1650.2244, | |
| "train_tokens_per_second": 10519.859 | |
| }, | |
| { | |
| "epoch": 0.18900675024108005, | |
| "grad_norm": 1.8072643280029297, | |
| "learning_rate": 1.6351875808538166e-05, | |
| "loss": 1.1247, | |
| "num_input_tokens_seen": 17494240, | |
| "step": 147, | |
| "train_runtime": 1662.4473, | |
| "train_tokens_per_second": 10523.185 | |
| }, | |
| { | |
| "epoch": 0.19029251044680168, | |
| "grad_norm": 1.864859938621521, | |
| "learning_rate": 1.6326002587322123e-05, | |
| "loss": 1.0562, | |
| "num_input_tokens_seen": 17584160, | |
| "step": 148, | |
| "train_runtime": 1670.1325, | |
| "train_tokens_per_second": 10528.602 | |
| }, | |
| { | |
| "epoch": 0.1915782706525233, | |
| "grad_norm": 1.8772127628326416, | |
| "learning_rate": 1.630012936610608e-05, | |
| "loss": 1.0535, | |
| "num_input_tokens_seen": 17670144, | |
| "step": 149, | |
| "train_runtime": 1677.3621, | |
| "train_tokens_per_second": 10534.484 | |
| }, | |
| { | |
| "epoch": 0.19286403085824494, | |
| "grad_norm": 1.7363184690475464, | |
| "learning_rate": 1.6274256144890038e-05, | |
| "loss": 1.0541, | |
| "num_input_tokens_seen": 17771456, | |
| "step": 150, | |
| "train_runtime": 1686.1324, | |
| "train_tokens_per_second": 10539.775 | |
| }, | |
| { | |
| "epoch": 0.19414979106396657, | |
| "grad_norm": 1.9292726516723633, | |
| "learning_rate": 1.6248382923674e-05, | |
| "loss": 1.186, | |
| "num_input_tokens_seen": 17875200, | |
| "step": 151, | |
| "train_runtime": 1711.1828, | |
| "train_tokens_per_second": 10446.108 | |
| }, | |
| { | |
| "epoch": 0.1954355512696882, | |
| "grad_norm": 1.8201920986175537, | |
| "learning_rate": 1.622250970245796e-05, | |
| "loss": 1.0198, | |
| "num_input_tokens_seen": 17978048, | |
| "step": 152, | |
| "train_runtime": 1719.8774, | |
| "train_tokens_per_second": 10453.098 | |
| }, | |
| { | |
| "epoch": 0.19672131147540983, | |
| "grad_norm": 1.9103111028671265, | |
| "learning_rate": 1.6196636481241917e-05, | |
| "loss": 1.0822, | |
| "num_input_tokens_seen": 18092224, | |
| "step": 153, | |
| "train_runtime": 1730.076, | |
| "train_tokens_per_second": 10457.473 | |
| }, | |
| { | |
| "epoch": 0.19800707168113146, | |
| "grad_norm": 1.990533709526062, | |
| "learning_rate": 1.6170763260025874e-05, | |
| "loss": 1.1262, | |
| "num_input_tokens_seen": 18180064, | |
| "step": 154, | |
| "train_runtime": 1737.4747, | |
| "train_tokens_per_second": 10463.499 | |
| }, | |
| { | |
| "epoch": 0.1992928318868531, | |
| "grad_norm": 1.7888742685317993, | |
| "learning_rate": 1.6144890038809835e-05, | |
| "loss": 1.1955, | |
| "num_input_tokens_seen": 18265056, | |
| "step": 155, | |
| "train_runtime": 1744.6485, | |
| "train_tokens_per_second": 10469.19 | |
| }, | |
| { | |
| "epoch": 0.20057859209257473, | |
| "grad_norm": 1.7337497472763062, | |
| "learning_rate": 1.6119016817593792e-05, | |
| "loss": 1.0541, | |
| "num_input_tokens_seen": 18367328, | |
| "step": 156, | |
| "train_runtime": 1753.372, | |
| "train_tokens_per_second": 10475.431 | |
| }, | |
| { | |
| "epoch": 0.20057859209257473, | |
| "eval_loss": 1.1330561637878418, | |
| "eval_runtime": 22.3584, | |
| "eval_samples_per_second": 44.458, | |
| "eval_steps_per_second": 1.431, | |
| "num_input_tokens_seen": 18367328, | |
| "step": 156 | |
| }, | |
| { | |
| "epoch": 0.20186435229829636, | |
| "grad_norm": 1.760105848312378, | |
| "learning_rate": 1.609314359637775e-05, | |
| "loss": 1.092, | |
| "num_input_tokens_seen": 18469024, | |
| "step": 157, | |
| "train_runtime": 1784.5882, | |
| "train_tokens_per_second": 10349.179 | |
| }, | |
| { | |
| "epoch": 0.203150112504018, | |
| "grad_norm": 2.001173496246338, | |
| "learning_rate": 1.606727037516171e-05, | |
| "loss": 1.15, | |
| "num_input_tokens_seen": 18603648, | |
| "step": 158, | |
| "train_runtime": 1796.907, | |
| "train_tokens_per_second": 10353.15 | |
| }, | |
| { | |
| "epoch": 0.20443587270973965, | |
| "grad_norm": 1.806795358657837, | |
| "learning_rate": 1.6041397153945667e-05, | |
| "loss": 1.024, | |
| "num_input_tokens_seen": 18693536, | |
| "step": 159, | |
| "train_runtime": 1804.6539, | |
| "train_tokens_per_second": 10358.516 | |
| }, | |
| { | |
| "epoch": 0.20572163291546128, | |
| "grad_norm": 1.9059035778045654, | |
| "learning_rate": 1.6015523932729628e-05, | |
| "loss": 1.1534, | |
| "num_input_tokens_seen": 18854592, | |
| "step": 160, | |
| "train_runtime": 1819.9574, | |
| "train_tokens_per_second": 10359.908 | |
| }, | |
| { | |
| "epoch": 0.2070073931211829, | |
| "grad_norm": 1.902287483215332, | |
| "learning_rate": 1.5989650711513585e-05, | |
| "loss": 0.9808, | |
| "num_input_tokens_seen": 18972384, | |
| "step": 161, | |
| "train_runtime": 1830.4631, | |
| "train_tokens_per_second": 10364.8 | |
| }, | |
| { | |
| "epoch": 0.20829315332690454, | |
| "grad_norm": 1.9465879201889038, | |
| "learning_rate": 1.5963777490297542e-05, | |
| "loss": 1.1595, | |
| "num_input_tokens_seen": 19119424, | |
| "step": 162, | |
| "train_runtime": 1844.4228, | |
| "train_tokens_per_second": 10366.075 | |
| }, | |
| { | |
| "epoch": 0.20957891353262617, | |
| "grad_norm": 1.8765859603881836, | |
| "learning_rate": 1.59379042690815e-05, | |
| "loss": 1.1413, | |
| "num_input_tokens_seen": 19229984, | |
| "step": 163, | |
| "train_runtime": 1854.1827, | |
| "train_tokens_per_second": 10371.138 | |
| }, | |
| { | |
| "epoch": 0.2108646737383478, | |
| "grad_norm": 1.9399867057800293, | |
| "learning_rate": 1.591203104786546e-05, | |
| "loss": 1.0859, | |
| "num_input_tokens_seen": 19334016, | |
| "step": 164, | |
| "train_runtime": 1863.2733, | |
| "train_tokens_per_second": 10376.372 | |
| }, | |
| { | |
| "epoch": 0.21215043394406943, | |
| "grad_norm": 1.999969244003296, | |
| "learning_rate": 1.588615782664942e-05, | |
| "loss": 1.1394, | |
| "num_input_tokens_seen": 19501312, | |
| "step": 165, | |
| "train_runtime": 1879.0538, | |
| "train_tokens_per_second": 10378.261 | |
| }, | |
| { | |
| "epoch": 0.21343619414979106, | |
| "grad_norm": 1.8910810947418213, | |
| "learning_rate": 1.5860284605433378e-05, | |
| "loss": 0.9774, | |
| "num_input_tokens_seen": 19602976, | |
| "step": 166, | |
| "train_runtime": 1887.7727, | |
| "train_tokens_per_second": 10384.182 | |
| }, | |
| { | |
| "epoch": 0.2147219543555127, | |
| "grad_norm": 1.824230432510376, | |
| "learning_rate": 1.5834411384217335e-05, | |
| "loss": 1.0689, | |
| "num_input_tokens_seen": 19727904, | |
| "step": 167, | |
| "train_runtime": 1898.9411, | |
| "train_tokens_per_second": 10388.897 | |
| }, | |
| { | |
| "epoch": 0.21600771456123433, | |
| "grad_norm": 1.9098621606826782, | |
| "learning_rate": 1.5808538163001296e-05, | |
| "loss": 1.069, | |
| "num_input_tokens_seen": 19844096, | |
| "step": 168, | |
| "train_runtime": 1909.7001, | |
| "train_tokens_per_second": 10391.211 | |
| }, | |
| { | |
| "epoch": 0.21729347476695596, | |
| "grad_norm": 1.773947834968567, | |
| "learning_rate": 1.5782664941785253e-05, | |
| "loss": 1.0426, | |
| "num_input_tokens_seen": 19969248, | |
| "step": 169, | |
| "train_runtime": 1920.8606, | |
| "train_tokens_per_second": 10395.99 | |
| }, | |
| { | |
| "epoch": 0.2185792349726776, | |
| "grad_norm": 1.7338457107543945, | |
| "learning_rate": 1.575679172056921e-05, | |
| "loss": 1.0428, | |
| "num_input_tokens_seen": 20165376, | |
| "step": 170, | |
| "train_runtime": 1940.1892, | |
| "train_tokens_per_second": 10393.51 | |
| }, | |
| { | |
| "epoch": 0.21986499517839922, | |
| "grad_norm": 1.7944598197937012, | |
| "learning_rate": 1.573091849935317e-05, | |
| "loss": 1.1008, | |
| "num_input_tokens_seen": 20282464, | |
| "step": 171, | |
| "train_runtime": 1950.6375, | |
| "train_tokens_per_second": 10397.864 | |
| }, | |
| { | |
| "epoch": 0.22115075538412085, | |
| "grad_norm": 1.7881031036376953, | |
| "learning_rate": 1.570504527813713e-05, | |
| "loss": 1.0998, | |
| "num_input_tokens_seen": 20414304, | |
| "step": 172, | |
| "train_runtime": 1962.9682, | |
| "train_tokens_per_second": 10399.712 | |
| }, | |
| { | |
| "epoch": 0.22243651558984248, | |
| "grad_norm": 1.8311177492141724, | |
| "learning_rate": 1.567917205692109e-05, | |
| "loss": 1.1359, | |
| "num_input_tokens_seen": 20524000, | |
| "step": 173, | |
| "train_runtime": 1972.6273, | |
| "train_tokens_per_second": 10404.398 | |
| }, | |
| { | |
| "epoch": 0.22372227579556414, | |
| "grad_norm": 1.774649739265442, | |
| "learning_rate": 1.5653298835705046e-05, | |
| "loss": 1.1199, | |
| "num_input_tokens_seen": 20615872, | |
| "step": 174, | |
| "train_runtime": 1980.5452, | |
| "train_tokens_per_second": 10409.191 | |
| }, | |
| { | |
| "epoch": 0.22500803600128577, | |
| "grad_norm": 1.8202511072158813, | |
| "learning_rate": 1.5627425614489004e-05, | |
| "loss": 1.1552, | |
| "num_input_tokens_seen": 20737184, | |
| "step": 175, | |
| "train_runtime": 1991.4125, | |
| "train_tokens_per_second": 10413.304 | |
| }, | |
| { | |
| "epoch": 0.2262937962070074, | |
| "grad_norm": 1.8184281587600708, | |
| "learning_rate": 1.5601552393272964e-05, | |
| "loss": 1.0945, | |
| "num_input_tokens_seen": 20871712, | |
| "step": 176, | |
| "train_runtime": 2003.8054, | |
| "train_tokens_per_second": 10416.038 | |
| }, | |
| { | |
| "epoch": 0.22757955641272903, | |
| "grad_norm": 2.0196473598480225, | |
| "learning_rate": 1.5575679172056925e-05, | |
| "loss": 1.0248, | |
| "num_input_tokens_seen": 21029760, | |
| "step": 177, | |
| "train_runtime": 2018.6807, | |
| "train_tokens_per_second": 10417.576 | |
| }, | |
| { | |
| "epoch": 0.22886531661845066, | |
| "grad_norm": 1.8468624353408813, | |
| "learning_rate": 1.5549805950840882e-05, | |
| "loss": 1.1439, | |
| "num_input_tokens_seen": 21118112, | |
| "step": 178, | |
| "train_runtime": 2026.2014, | |
| "train_tokens_per_second": 10422.514 | |
| }, | |
| { | |
| "epoch": 0.2301510768241723, | |
| "grad_norm": 2.0327556133270264, | |
| "learning_rate": 1.552393272962484e-05, | |
| "loss": 1.0553, | |
| "num_input_tokens_seen": 21217408, | |
| "step": 179, | |
| "train_runtime": 2034.8324, | |
| "train_tokens_per_second": 10427.104 | |
| }, | |
| { | |
| "epoch": 0.23143683702989393, | |
| "grad_norm": 1.9502851963043213, | |
| "learning_rate": 1.5498059508408797e-05, | |
| "loss": 1.0866, | |
| "num_input_tokens_seen": 21328928, | |
| "step": 180, | |
| "train_runtime": 2044.8024, | |
| "train_tokens_per_second": 10430.802 | |
| }, | |
| { | |
| "epoch": 0.23272259723561556, | |
| "grad_norm": 1.8489340543746948, | |
| "learning_rate": 1.5472186287192757e-05, | |
| "loss": 1.1345, | |
| "num_input_tokens_seen": 21433248, | |
| "step": 181, | |
| "train_runtime": 2072.5697, | |
| "train_tokens_per_second": 10341.388 | |
| }, | |
| { | |
| "epoch": 0.2340083574413372, | |
| "grad_norm": 2.063244104385376, | |
| "learning_rate": 1.5446313065976715e-05, | |
| "loss": 1.0425, | |
| "num_input_tokens_seen": 21543552, | |
| "step": 182, | |
| "train_runtime": 2082.003, | |
| "train_tokens_per_second": 10347.513 | |
| }, | |
| { | |
| "epoch": 0.23529411764705882, | |
| "grad_norm": 1.8250895738601685, | |
| "learning_rate": 1.5420439844760672e-05, | |
| "loss": 1.1022, | |
| "num_input_tokens_seen": 21631584, | |
| "step": 183, | |
| "train_runtime": 2089.5086, | |
| "train_tokens_per_second": 10352.474 | |
| }, | |
| { | |
| "epoch": 0.23657987785278045, | |
| "grad_norm": 1.8058557510375977, | |
| "learning_rate": 1.5394566623544633e-05, | |
| "loss": 1.1283, | |
| "num_input_tokens_seen": 21732768, | |
| "step": 184, | |
| "train_runtime": 2098.3876, | |
| "train_tokens_per_second": 10356.889 | |
| }, | |
| { | |
| "epoch": 0.23786563805850208, | |
| "grad_norm": 1.8823782205581665, | |
| "learning_rate": 1.5368693402328593e-05, | |
| "loss": 1.0454, | |
| "num_input_tokens_seen": 21847392, | |
| "step": 185, | |
| "train_runtime": 2108.5281, | |
| "train_tokens_per_second": 10361.442 | |
| }, | |
| { | |
| "epoch": 0.2391513982642237, | |
| "grad_norm": 1.9651679992675781, | |
| "learning_rate": 1.534282018111255e-05, | |
| "loss": 1.1543, | |
| "num_input_tokens_seen": 21969408, | |
| "step": 186, | |
| "train_runtime": 2119.7121, | |
| "train_tokens_per_second": 10364.336 | |
| }, | |
| { | |
| "epoch": 0.24043715846994534, | |
| "grad_norm": 1.9040675163269043, | |
| "learning_rate": 1.5316946959896508e-05, | |
| "loss": 1.1195, | |
| "num_input_tokens_seen": 22082176, | |
| "step": 187, | |
| "train_runtime": 2129.7977, | |
| "train_tokens_per_second": 10368.204 | |
| }, | |
| { | |
| "epoch": 0.24172291867566698, | |
| "grad_norm": 1.8690330982208252, | |
| "learning_rate": 1.5291073738680465e-05, | |
| "loss": 1.1459, | |
| "num_input_tokens_seen": 22172480, | |
| "step": 188, | |
| "train_runtime": 2137.5122, | |
| "train_tokens_per_second": 10373.031 | |
| }, | |
| { | |
| "epoch": 0.24300867888138863, | |
| "grad_norm": 1.873816967010498, | |
| "learning_rate": 1.5265200517464426e-05, | |
| "loss": 1.1256, | |
| "num_input_tokens_seen": 22305728, | |
| "step": 189, | |
| "train_runtime": 2149.436, | |
| "train_tokens_per_second": 10377.479 | |
| }, | |
| { | |
| "epoch": 0.24429443908711027, | |
| "grad_norm": 1.936040997505188, | |
| "learning_rate": 1.5239327296248385e-05, | |
| "loss": 1.0522, | |
| "num_input_tokens_seen": 22460672, | |
| "step": 190, | |
| "train_runtime": 2163.9753, | |
| "train_tokens_per_second": 10379.357 | |
| }, | |
| { | |
| "epoch": 0.2455801992928319, | |
| "grad_norm": 1.8445260524749756, | |
| "learning_rate": 1.5213454075032344e-05, | |
| "loss": 1.1412, | |
| "num_input_tokens_seen": 22556352, | |
| "step": 191, | |
| "train_runtime": 2172.3429, | |
| "train_tokens_per_second": 10383.421 | |
| }, | |
| { | |
| "epoch": 0.24686595949855353, | |
| "grad_norm": 1.9163671731948853, | |
| "learning_rate": 1.5187580853816301e-05, | |
| "loss": 1.1672, | |
| "num_input_tokens_seen": 22662624, | |
| "step": 192, | |
| "train_runtime": 2181.6935, | |
| "train_tokens_per_second": 10387.63 | |
| }, | |
| { | |
| "epoch": 0.24815171970427516, | |
| "grad_norm": 2.0177226066589355, | |
| "learning_rate": 1.516170763260026e-05, | |
| "loss": 1.1193, | |
| "num_input_tokens_seen": 22789664, | |
| "step": 193, | |
| "train_runtime": 2193.5134, | |
| "train_tokens_per_second": 10389.571 | |
| }, | |
| { | |
| "epoch": 0.2494374799099968, | |
| "grad_norm": 1.8356866836547852, | |
| "learning_rate": 1.5135834411384219e-05, | |
| "loss": 1.1705, | |
| "num_input_tokens_seen": 22878816, | |
| "step": 194, | |
| "train_runtime": 2201.1512, | |
| "train_tokens_per_second": 10394.023 | |
| }, | |
| { | |
| "epoch": 0.2507232401157184, | |
| "grad_norm": 1.9464590549468994, | |
| "learning_rate": 1.5109961190168176e-05, | |
| "loss": 1.2413, | |
| "num_input_tokens_seen": 23036256, | |
| "step": 195, | |
| "train_runtime": 2216.0262, | |
| "train_tokens_per_second": 10395.299 | |
| }, | |
| { | |
| "epoch": 0.25200900032144, | |
| "grad_norm": 1.9846364259719849, | |
| "learning_rate": 1.5084087968952135e-05, | |
| "loss": 1.1349, | |
| "num_input_tokens_seen": 23113184, | |
| "step": 196, | |
| "train_runtime": 2222.6223, | |
| "train_tokens_per_second": 10399.061 | |
| }, | |
| { | |
| "epoch": 0.2532947605271617, | |
| "grad_norm": 1.921323537826538, | |
| "learning_rate": 1.5058214747736096e-05, | |
| "loss": 1.0196, | |
| "num_input_tokens_seen": 23227616, | |
| "step": 197, | |
| "train_runtime": 2232.9722, | |
| "train_tokens_per_second": 10402.107 | |
| }, | |
| { | |
| "epoch": 0.25458052073288334, | |
| "grad_norm": 1.7825725078582764, | |
| "learning_rate": 1.5032341526520053e-05, | |
| "loss": 1.0327, | |
| "num_input_tokens_seen": 23394208, | |
| "step": 198, | |
| "train_runtime": 2249.1819, | |
| "train_tokens_per_second": 10401.208 | |
| }, | |
| { | |
| "epoch": 0.255866280938605, | |
| "grad_norm": 2.1068551540374756, | |
| "learning_rate": 1.5006468305304012e-05, | |
| "loss": 1.0875, | |
| "num_input_tokens_seen": 23528416, | |
| "step": 199, | |
| "train_runtime": 2261.1565, | |
| "train_tokens_per_second": 10405.479 | |
| }, | |
| { | |
| "epoch": 0.2571520411443266, | |
| "grad_norm": 1.8937175273895264, | |
| "learning_rate": 1.498059508408797e-05, | |
| "loss": 1.0898, | |
| "num_input_tokens_seen": 23670240, | |
| "step": 200, | |
| "train_runtime": 2274.3795, | |
| "train_tokens_per_second": 10407.34 | |
| }, | |
| { | |
| "epoch": 0.25843780135004824, | |
| "grad_norm": 1.8117809295654297, | |
| "learning_rate": 1.4954721862871928e-05, | |
| "loss": 0.98, | |
| "num_input_tokens_seen": 23795712, | |
| "step": 201, | |
| "train_runtime": 2285.6253, | |
| "train_tokens_per_second": 10411.029 | |
| }, | |
| { | |
| "epoch": 0.25972356155576987, | |
| "grad_norm": 1.9877797365188599, | |
| "learning_rate": 1.4928848641655887e-05, | |
| "loss": 1.1332, | |
| "num_input_tokens_seen": 23913248, | |
| "step": 202, | |
| "train_runtime": 2295.9518, | |
| "train_tokens_per_second": 10415.396 | |
| }, | |
| { | |
| "epoch": 0.2610093217614915, | |
| "grad_norm": 1.832665205001831, | |
| "learning_rate": 1.4902975420439846e-05, | |
| "loss": 1.0939, | |
| "num_input_tokens_seen": 24017152, | |
| "step": 203, | |
| "train_runtime": 2305.1109, | |
| "train_tokens_per_second": 10419.088 | |
| }, | |
| { | |
| "epoch": 0.26229508196721313, | |
| "grad_norm": 1.8349584341049194, | |
| "learning_rate": 1.4877102199223805e-05, | |
| "loss": 1.1451, | |
| "num_input_tokens_seen": 24132384, | |
| "step": 204, | |
| "train_runtime": 2315.2627, | |
| "train_tokens_per_second": 10423.173 | |
| }, | |
| { | |
| "epoch": 0.26358084217293476, | |
| "grad_norm": 1.8495604991912842, | |
| "learning_rate": 1.4851228978007764e-05, | |
| "loss": 1.0344, | |
| "num_input_tokens_seen": 24217024, | |
| "step": 205, | |
| "train_runtime": 2322.5078, | |
| "train_tokens_per_second": 10427.101 | |
| }, | |
| { | |
| "epoch": 0.2648666023786564, | |
| "grad_norm": 1.7923839092254639, | |
| "learning_rate": 1.4825355756791721e-05, | |
| "loss": 1.0408, | |
| "num_input_tokens_seen": 24329984, | |
| "step": 206, | |
| "train_runtime": 2332.827, | |
| "train_tokens_per_second": 10429.399 | |
| }, | |
| { | |
| "epoch": 0.266152362584378, | |
| "grad_norm": 1.8214589357376099, | |
| "learning_rate": 1.479948253557568e-05, | |
| "loss": 1.091, | |
| "num_input_tokens_seen": 24451776, | |
| "step": 207, | |
| "train_runtime": 2343.5108, | |
| "train_tokens_per_second": 10433.823 | |
| }, | |
| { | |
| "epoch": 0.26743812279009965, | |
| "grad_norm": 1.9028258323669434, | |
| "learning_rate": 1.4773609314359637e-05, | |
| "loss": 1.1523, | |
| "num_input_tokens_seen": 24630016, | |
| "step": 208, | |
| "train_runtime": 2360.69, | |
| "train_tokens_per_second": 10433.397 | |
| }, | |
| { | |
| "epoch": 0.2687238829958213, | |
| "grad_norm": 1.80238676071167, | |
| "learning_rate": 1.4747736093143598e-05, | |
| "loss": 1.0408, | |
| "num_input_tokens_seen": 24752800, | |
| "step": 209, | |
| "train_runtime": 2371.5796, | |
| "train_tokens_per_second": 10437.263 | |
| }, | |
| { | |
| "epoch": 0.2700096432015429, | |
| "grad_norm": 1.8515748977661133, | |
| "learning_rate": 1.4721862871927557e-05, | |
| "loss": 1.0605, | |
| "num_input_tokens_seen": 24844864, | |
| "step": 210, | |
| "train_runtime": 2379.4213, | |
| "train_tokens_per_second": 10441.557 | |
| }, | |
| { | |
| "epoch": 0.27129540340726455, | |
| "grad_norm": 1.831057071685791, | |
| "learning_rate": 1.4695989650711514e-05, | |
| "loss": 1.074, | |
| "num_input_tokens_seen": 25002304, | |
| "step": 211, | |
| "train_runtime": 2412.4948, | |
| "train_tokens_per_second": 10363.672 | |
| }, | |
| { | |
| "epoch": 0.2725811636129862, | |
| "grad_norm": 2.014904260635376, | |
| "learning_rate": 1.4670116429495473e-05, | |
| "loss": 1.1354, | |
| "num_input_tokens_seen": 25133536, | |
| "step": 212, | |
| "train_runtime": 2424.3186, | |
| "train_tokens_per_second": 10367.258 | |
| }, | |
| { | |
| "epoch": 0.2738669238187078, | |
| "grad_norm": 1.9899771213531494, | |
| "learning_rate": 1.4644243208279432e-05, | |
| "loss": 1.0888, | |
| "num_input_tokens_seen": 25302464, | |
| "step": 213, | |
| "train_runtime": 2440.569, | |
| "train_tokens_per_second": 10367.445 | |
| }, | |
| { | |
| "epoch": 0.27515268402442944, | |
| "grad_norm": 1.9485491514205933, | |
| "learning_rate": 1.461836998706339e-05, | |
| "loss": 1.0257, | |
| "num_input_tokens_seen": 25400640, | |
| "step": 214, | |
| "train_runtime": 2449.2043, | |
| "train_tokens_per_second": 10370.976 | |
| }, | |
| { | |
| "epoch": 0.27643844423015107, | |
| "grad_norm": 1.7471483945846558, | |
| "learning_rate": 1.4592496765847349e-05, | |
| "loss": 0.9967, | |
| "num_input_tokens_seen": 25491296, | |
| "step": 215, | |
| "train_runtime": 2456.9876, | |
| "train_tokens_per_second": 10375.02 | |
| }, | |
| { | |
| "epoch": 0.2777242044358727, | |
| "grad_norm": 1.8240132331848145, | |
| "learning_rate": 1.456662354463131e-05, | |
| "loss": 1.0384, | |
| "num_input_tokens_seen": 25584320, | |
| "step": 216, | |
| "train_runtime": 2464.9704, | |
| "train_tokens_per_second": 10379.159 | |
| }, | |
| { | |
| "epoch": 0.27900996464159433, | |
| "grad_norm": 1.8008581399917603, | |
| "learning_rate": 1.4540750323415266e-05, | |
| "loss": 1.0473, | |
| "num_input_tokens_seen": 25675328, | |
| "step": 217, | |
| "train_runtime": 2472.784, | |
| "train_tokens_per_second": 10383.166 | |
| }, | |
| { | |
| "epoch": 0.28029572484731596, | |
| "grad_norm": 1.8560556173324585, | |
| "learning_rate": 1.4514877102199225e-05, | |
| "loss": 1.0333, | |
| "num_input_tokens_seen": 25761216, | |
| "step": 218, | |
| "train_runtime": 2480.13, | |
| "train_tokens_per_second": 10387.043 | |
| }, | |
| { | |
| "epoch": 0.2815814850530376, | |
| "grad_norm": 1.9014114141464233, | |
| "learning_rate": 1.4489003880983183e-05, | |
| "loss": 1.1028, | |
| "num_input_tokens_seen": 25890592, | |
| "step": 219, | |
| "train_runtime": 2491.8423, | |
| "train_tokens_per_second": 10390.141 | |
| }, | |
| { | |
| "epoch": 0.2828672452587592, | |
| "grad_norm": 1.8335984945297241, | |
| "learning_rate": 1.4463130659767142e-05, | |
| "loss": 1.045, | |
| "num_input_tokens_seen": 25970880, | |
| "step": 220, | |
| "train_runtime": 2498.6975, | |
| "train_tokens_per_second": 10393.767 | |
| }, | |
| { | |
| "epoch": 0.28415300546448086, | |
| "grad_norm": 1.9171757698059082, | |
| "learning_rate": 1.44372574385511e-05, | |
| "loss": 1.074, | |
| "num_input_tokens_seen": 26051808, | |
| "step": 221, | |
| "train_runtime": 2505.5849, | |
| "train_tokens_per_second": 10397.496 | |
| }, | |
| { | |
| "epoch": 0.2854387656702025, | |
| "grad_norm": 1.849561333656311, | |
| "learning_rate": 1.4411384217335061e-05, | |
| "loss": 1.0662, | |
| "num_input_tokens_seen": 26163232, | |
| "step": 222, | |
| "train_runtime": 2515.3859, | |
| "train_tokens_per_second": 10401.28 | |
| }, | |
| { | |
| "epoch": 0.2867245258759241, | |
| "grad_norm": 1.886615514755249, | |
| "learning_rate": 1.4385510996119019e-05, | |
| "loss": 1.1053, | |
| "num_input_tokens_seen": 26257664, | |
| "step": 223, | |
| "train_runtime": 2523.536, | |
| "train_tokens_per_second": 10405.108 | |
| }, | |
| { | |
| "epoch": 0.28801028608164575, | |
| "grad_norm": 1.7920629978179932, | |
| "learning_rate": 1.4359637774902977e-05, | |
| "loss": 1.0041, | |
| "num_input_tokens_seen": 26368288, | |
| "step": 224, | |
| "train_runtime": 2533.3464, | |
| "train_tokens_per_second": 10408.481 | |
| }, | |
| { | |
| "epoch": 0.2892960462873674, | |
| "grad_norm": 1.9786632061004639, | |
| "learning_rate": 1.4333764553686935e-05, | |
| "loss": 1.1993, | |
| "num_input_tokens_seen": 26482400, | |
| "step": 225, | |
| "train_runtime": 2543.3441, | |
| "train_tokens_per_second": 10412.433 | |
| }, | |
| { | |
| "epoch": 0.290581806493089, | |
| "grad_norm": 1.9302722215652466, | |
| "learning_rate": 1.4307891332470894e-05, | |
| "loss": 1.0486, | |
| "num_input_tokens_seen": 26580512, | |
| "step": 226, | |
| "train_runtime": 2551.839, | |
| "train_tokens_per_second": 10416.218 | |
| }, | |
| { | |
| "epoch": 0.2918675666988107, | |
| "grad_norm": 1.7275605201721191, | |
| "learning_rate": 1.4282018111254851e-05, | |
| "loss": 0.9721, | |
| "num_input_tokens_seen": 26699392, | |
| "step": 227, | |
| "train_runtime": 2562.4385, | |
| "train_tokens_per_second": 10419.525 | |
| }, | |
| { | |
| "epoch": 0.29315332690453233, | |
| "grad_norm": 1.8996021747589111, | |
| "learning_rate": 1.425614489003881e-05, | |
| "loss": 1.0883, | |
| "num_input_tokens_seen": 26856992, | |
| "step": 228, | |
| "train_runtime": 2577.1118, | |
| "train_tokens_per_second": 10421.353 | |
| }, | |
| { | |
| "epoch": 0.29443908711025396, | |
| "grad_norm": 1.8853155374526978, | |
| "learning_rate": 1.423027166882277e-05, | |
| "loss": 1.0271, | |
| "num_input_tokens_seen": 26964960, | |
| "step": 229, | |
| "train_runtime": 2586.5183, | |
| "train_tokens_per_second": 10425.196 | |
| }, | |
| { | |
| "epoch": 0.2957248473159756, | |
| "grad_norm": 1.9568660259246826, | |
| "learning_rate": 1.4204398447606728e-05, | |
| "loss": 1.0765, | |
| "num_input_tokens_seen": 27099008, | |
| "step": 230, | |
| "train_runtime": 2599.0806, | |
| "train_tokens_per_second": 10426.382 | |
| }, | |
| { | |
| "epoch": 0.2970106075216972, | |
| "grad_norm": 1.8366093635559082, | |
| "learning_rate": 1.4178525226390687e-05, | |
| "loss": 1.0547, | |
| "num_input_tokens_seen": 27213760, | |
| "step": 231, | |
| "train_runtime": 2609.5848, | |
| "train_tokens_per_second": 10428.387 | |
| }, | |
| { | |
| "epoch": 0.29829636772741885, | |
| "grad_norm": 1.8327536582946777, | |
| "learning_rate": 1.4152652005174646e-05, | |
| "loss": 1.0903, | |
| "num_input_tokens_seen": 27297344, | |
| "step": 232, | |
| "train_runtime": 2616.7236, | |
| "train_tokens_per_second": 10431.879 | |
| }, | |
| { | |
| "epoch": 0.2995821279331405, | |
| "grad_norm": 1.8904881477355957, | |
| "learning_rate": 1.4126778783958603e-05, | |
| "loss": 1.0861, | |
| "num_input_tokens_seen": 27426688, | |
| "step": 233, | |
| "train_runtime": 2628.7609, | |
| "train_tokens_per_second": 10433.314 | |
| }, | |
| { | |
| "epoch": 0.3008678881388621, | |
| "grad_norm": 1.99700927734375, | |
| "learning_rate": 1.4100905562742562e-05, | |
| "loss": 1.0771, | |
| "num_input_tokens_seen": 27563648, | |
| "step": 234, | |
| "train_runtime": 2641.4168, | |
| "train_tokens_per_second": 10435.176 | |
| }, | |
| { | |
| "epoch": 0.3008678881388621, | |
| "eval_loss": 1.1202009916305542, | |
| "eval_runtime": 22.3846, | |
| "eval_samples_per_second": 44.406, | |
| "eval_steps_per_second": 1.43, | |
| "num_input_tokens_seen": 27563648, | |
| "step": 234 | |
| }, | |
| { | |
| "epoch": 0.30215364834458375, | |
| "grad_norm": 1.886243462562561, | |
| "learning_rate": 1.4075032341526523e-05, | |
| "loss": 1.0186, | |
| "num_input_tokens_seen": 27753376, | |
| "step": 235, | |
| "train_runtime": 2682.2789, | |
| "train_tokens_per_second": 10346.939 | |
| }, | |
| { | |
| "epoch": 0.3034394085503054, | |
| "grad_norm": 1.8130700588226318, | |
| "learning_rate": 1.404915912031048e-05, | |
| "loss": 1.0335, | |
| "num_input_tokens_seen": 27868672, | |
| "step": 236, | |
| "train_runtime": 2692.3246, | |
| "train_tokens_per_second": 10351.156 | |
| }, | |
| { | |
| "epoch": 0.304725168756027, | |
| "grad_norm": 1.870937466621399, | |
| "learning_rate": 1.4023285899094439e-05, | |
| "loss": 1.036, | |
| "num_input_tokens_seen": 27970848, | |
| "step": 237, | |
| "train_runtime": 2701.1905, | |
| "train_tokens_per_second": 10355.008 | |
| }, | |
| { | |
| "epoch": 0.30601092896174864, | |
| "grad_norm": 1.9421213865280151, | |
| "learning_rate": 1.3997412677878396e-05, | |
| "loss": 1.0861, | |
| "num_input_tokens_seen": 28103104, | |
| "step": 238, | |
| "train_runtime": 2713.4976, | |
| "train_tokens_per_second": 10356.783 | |
| }, | |
| { | |
| "epoch": 0.30729668916747027, | |
| "grad_norm": 2.0607948303222656, | |
| "learning_rate": 1.3971539456662355e-05, | |
| "loss": 1.1563, | |
| "num_input_tokens_seen": 28200704, | |
| "step": 239, | |
| "train_runtime": 2721.862, | |
| "train_tokens_per_second": 10360.813 | |
| }, | |
| { | |
| "epoch": 0.3085824493731919, | |
| "grad_norm": 1.9641258716583252, | |
| "learning_rate": 1.3945666235446314e-05, | |
| "loss": 1.0857, | |
| "num_input_tokens_seen": 28301088, | |
| "step": 240, | |
| "train_runtime": 2730.5823, | |
| "train_tokens_per_second": 10364.488 | |
| }, | |
| { | |
| "epoch": 0.30986820957891353, | |
| "grad_norm": 1.7765169143676758, | |
| "learning_rate": 1.3919793014230271e-05, | |
| "loss": 1.17, | |
| "num_input_tokens_seen": 28407104, | |
| "step": 241, | |
| "train_runtime": 2757.845, | |
| "train_tokens_per_second": 10300.472 | |
| }, | |
| { | |
| "epoch": 0.31115396978463516, | |
| "grad_norm": 1.8327834606170654, | |
| "learning_rate": 1.3893919793014232e-05, | |
| "loss": 1.1576, | |
| "num_input_tokens_seen": 28551616, | |
| "step": 242, | |
| "train_runtime": 2770.8246, | |
| "train_tokens_per_second": 10304.375 | |
| }, | |
| { | |
| "epoch": 0.3124397299903568, | |
| "grad_norm": 1.8959366083145142, | |
| "learning_rate": 1.3868046571798191e-05, | |
| "loss": 1.1029, | |
| "num_input_tokens_seen": 28676992, | |
| "step": 243, | |
| "train_runtime": 2781.7813, | |
| "train_tokens_per_second": 10308.859 | |
| }, | |
| { | |
| "epoch": 0.3137254901960784, | |
| "grad_norm": 1.906044840812683, | |
| "learning_rate": 1.3842173350582148e-05, | |
| "loss": 1.0936, | |
| "num_input_tokens_seen": 28808192, | |
| "step": 244, | |
| "train_runtime": 2793.4191, | |
| "train_tokens_per_second": 10312.879 | |
| }, | |
| { | |
| "epoch": 0.31501125040180006, | |
| "grad_norm": 1.6482162475585938, | |
| "learning_rate": 1.3816300129366107e-05, | |
| "loss": 1.0089, | |
| "num_input_tokens_seen": 28911680, | |
| "step": 245, | |
| "train_runtime": 2802.3761, | |
| "train_tokens_per_second": 10316.845 | |
| }, | |
| { | |
| "epoch": 0.3162970106075217, | |
| "grad_norm": 2.033006191253662, | |
| "learning_rate": 1.3790426908150065e-05, | |
| "loss": 1.1089, | |
| "num_input_tokens_seen": 29016864, | |
| "step": 246, | |
| "train_runtime": 2811.4614, | |
| "train_tokens_per_second": 10320.919 | |
| }, | |
| { | |
| "epoch": 0.3175827708132433, | |
| "grad_norm": 1.7948728799819946, | |
| "learning_rate": 1.3764553686934023e-05, | |
| "loss": 1.0618, | |
| "num_input_tokens_seen": 29131168, | |
| "step": 247, | |
| "train_runtime": 2821.6622, | |
| "train_tokens_per_second": 10324.116 | |
| }, | |
| { | |
| "epoch": 0.31886853101896495, | |
| "grad_norm": 1.90618097782135, | |
| "learning_rate": 1.3738680465717984e-05, | |
| "loss": 1.0781, | |
| "num_input_tokens_seen": 29220064, | |
| "step": 248, | |
| "train_runtime": 2829.145, | |
| "train_tokens_per_second": 10328.231 | |
| }, | |
| { | |
| "epoch": 0.3201542912246866, | |
| "grad_norm": 1.9356735944747925, | |
| "learning_rate": 1.3712807244501941e-05, | |
| "loss": 1.081, | |
| "num_input_tokens_seen": 29327360, | |
| "step": 249, | |
| "train_runtime": 2838.3079, | |
| "train_tokens_per_second": 10332.691 | |
| }, | |
| { | |
| "epoch": 0.3214400514304082, | |
| "grad_norm": 1.9027749300003052, | |
| "learning_rate": 1.36869340232859e-05, | |
| "loss": 1.0783, | |
| "num_input_tokens_seen": 29460416, | |
| "step": 250, | |
| "train_runtime": 2850.5438, | |
| "train_tokens_per_second": 10335.016 | |
| }, | |
| { | |
| "epoch": 0.32272581163612984, | |
| "grad_norm": 1.9512473344802856, | |
| "learning_rate": 1.366106080206986e-05, | |
| "loss": 1.1187, | |
| "num_input_tokens_seen": 29560960, | |
| "step": 251, | |
| "train_runtime": 2859.2337, | |
| "train_tokens_per_second": 10338.77 | |
| }, | |
| { | |
| "epoch": 0.3240115718418515, | |
| "grad_norm": 1.8211243152618408, | |
| "learning_rate": 1.3635187580853817e-05, | |
| "loss": 1.0958, | |
| "num_input_tokens_seen": 29663328, | |
| "step": 252, | |
| "train_runtime": 2868.0908, | |
| "train_tokens_per_second": 10342.535 | |
| }, | |
| { | |
| "epoch": 0.3252973320475731, | |
| "grad_norm": 1.9262733459472656, | |
| "learning_rate": 1.3609314359637776e-05, | |
| "loss": 1.0872, | |
| "num_input_tokens_seen": 29746208, | |
| "step": 253, | |
| "train_runtime": 2875.16, | |
| "train_tokens_per_second": 10345.931 | |
| }, | |
| { | |
| "epoch": 0.32658309225329474, | |
| "grad_norm": 1.8188444375991821, | |
| "learning_rate": 1.3583441138421733e-05, | |
| "loss": 1.0855, | |
| "num_input_tokens_seen": 29894432, | |
| "step": 254, | |
| "train_runtime": 2888.8665, | |
| "train_tokens_per_second": 10348.153 | |
| }, | |
| { | |
| "epoch": 0.32786885245901637, | |
| "grad_norm": 1.9136427640914917, | |
| "learning_rate": 1.3557567917205693e-05, | |
| "loss": 1.1348, | |
| "num_input_tokens_seen": 29994112, | |
| "step": 255, | |
| "train_runtime": 2897.5218, | |
| "train_tokens_per_second": 10351.643 | |
| }, | |
| { | |
| "epoch": 0.329154612664738, | |
| "grad_norm": 1.8818548917770386, | |
| "learning_rate": 1.3531694695989652e-05, | |
| "loss": 1.0323, | |
| "num_input_tokens_seen": 30130016, | |
| "step": 256, | |
| "train_runtime": 2910.0743, | |
| "train_tokens_per_second": 10353.693 | |
| }, | |
| { | |
| "epoch": 0.3304403728704597, | |
| "grad_norm": 1.8252167701721191, | |
| "learning_rate": 1.350582147477361e-05, | |
| "loss": 1.1093, | |
| "num_input_tokens_seen": 30265760, | |
| "step": 257, | |
| "train_runtime": 2922.5727, | |
| "train_tokens_per_second": 10355.862 | |
| }, | |
| { | |
| "epoch": 0.3317261330761813, | |
| "grad_norm": 1.7374950647354126, | |
| "learning_rate": 1.3479948253557569e-05, | |
| "loss": 1.0167, | |
| "num_input_tokens_seen": 30376608, | |
| "step": 258, | |
| "train_runtime": 2932.2957, | |
| "train_tokens_per_second": 10359.326 | |
| }, | |
| { | |
| "epoch": 0.33301189328190295, | |
| "grad_norm": 1.8809834718704224, | |
| "learning_rate": 1.3454075032341528e-05, | |
| "loss": 1.0811, | |
| "num_input_tokens_seen": 30516832, | |
| "step": 259, | |
| "train_runtime": 2945.3073, | |
| "train_tokens_per_second": 10361.171 | |
| }, | |
| { | |
| "epoch": 0.3342976534876246, | |
| "grad_norm": 1.8606772422790527, | |
| "learning_rate": 1.3428201811125485e-05, | |
| "loss": 1.1816, | |
| "num_input_tokens_seen": 30630464, | |
| "step": 260, | |
| "train_runtime": 2955.2838, | |
| "train_tokens_per_second": 10364.644 | |
| }, | |
| { | |
| "epoch": 0.3355834136933462, | |
| "grad_norm": 1.841683030128479, | |
| "learning_rate": 1.3402328589909446e-05, | |
| "loss": 1.0374, | |
| "num_input_tokens_seen": 30773344, | |
| "step": 261, | |
| "train_runtime": 2968.6865, | |
| "train_tokens_per_second": 10365.98 | |
| }, | |
| { | |
| "epoch": 0.33686917389906784, | |
| "grad_norm": 1.9608851671218872, | |
| "learning_rate": 1.3376455368693405e-05, | |
| "loss": 1.075, | |
| "num_input_tokens_seen": 30899296, | |
| "step": 262, | |
| "train_runtime": 2980.4948, | |
| "train_tokens_per_second": 10367.17 | |
| }, | |
| { | |
| "epoch": 0.3381549341047895, | |
| "grad_norm": 1.9880949258804321, | |
| "learning_rate": 1.3350582147477362e-05, | |
| "loss": 1.0203, | |
| "num_input_tokens_seen": 31000256, | |
| "step": 263, | |
| "train_runtime": 2989.2311, | |
| "train_tokens_per_second": 10370.645 | |
| }, | |
| { | |
| "epoch": 0.3394406943105111, | |
| "grad_norm": 1.9502097368240356, | |
| "learning_rate": 1.332470892626132e-05, | |
| "loss": 1.1464, | |
| "num_input_tokens_seen": 31104768, | |
| "step": 264, | |
| "train_runtime": 2998.2398, | |
| "train_tokens_per_second": 10374.343 | |
| }, | |
| { | |
| "epoch": 0.34072645451623274, | |
| "grad_norm": 1.934061050415039, | |
| "learning_rate": 1.3298835705045278e-05, | |
| "loss": 1.0263, | |
| "num_input_tokens_seen": 31232832, | |
| "step": 265, | |
| "train_runtime": 3009.8265, | |
| "train_tokens_per_second": 10376.954 | |
| }, | |
| { | |
| "epoch": 0.34201221472195437, | |
| "grad_norm": 1.8722063302993774, | |
| "learning_rate": 1.3272962483829237e-05, | |
| "loss": 1.0799, | |
| "num_input_tokens_seen": 31351872, | |
| "step": 266, | |
| "train_runtime": 3020.55, | |
| "train_tokens_per_second": 10379.524 | |
| }, | |
| { | |
| "epoch": 0.343297974927676, | |
| "grad_norm": 1.941330909729004, | |
| "learning_rate": 1.3247089262613198e-05, | |
| "loss": 0.9481, | |
| "num_input_tokens_seen": 31458432, | |
| "step": 267, | |
| "train_runtime": 3029.8631, | |
| "train_tokens_per_second": 10382.79 | |
| }, | |
| { | |
| "epoch": 0.34458373513339763, | |
| "grad_norm": 2.109315872192383, | |
| "learning_rate": 1.3221216041397157e-05, | |
| "loss": 1.1085, | |
| "num_input_tokens_seen": 31566048, | |
| "step": 268, | |
| "train_runtime": 3039.2325, | |
| "train_tokens_per_second": 10386.191 | |
| }, | |
| { | |
| "epoch": 0.34586949533911926, | |
| "grad_norm": 1.9429577589035034, | |
| "learning_rate": 1.3195342820181114e-05, | |
| "loss": 1.1085, | |
| "num_input_tokens_seen": 31679008, | |
| "step": 269, | |
| "train_runtime": 3049.0419, | |
| "train_tokens_per_second": 10389.824 | |
| }, | |
| { | |
| "epoch": 0.3471552555448409, | |
| "grad_norm": 1.8708595037460327, | |
| "learning_rate": 1.3169469598965073e-05, | |
| "loss": 1.0415, | |
| "num_input_tokens_seen": 31805376, | |
| "step": 270, | |
| "train_runtime": 3060.3402, | |
| "train_tokens_per_second": 10392.758 | |
| }, | |
| { | |
| "epoch": 0.3484410157505625, | |
| "grad_norm": 1.890461802482605, | |
| "learning_rate": 1.314359637774903e-05, | |
| "loss": 1.0917, | |
| "num_input_tokens_seen": 31887200, | |
| "step": 271, | |
| "train_runtime": 3085.3071, | |
| "train_tokens_per_second": 10335.179 | |
| }, | |
| { | |
| "epoch": 0.34972677595628415, | |
| "grad_norm": 1.8630510568618774, | |
| "learning_rate": 1.3117723156532989e-05, | |
| "loss": 1.0943, | |
| "num_input_tokens_seen": 32037536, | |
| "step": 272, | |
| "train_runtime": 3098.8904, | |
| "train_tokens_per_second": 10338.39 | |
| }, | |
| { | |
| "epoch": 0.3510125361620058, | |
| "grad_norm": 1.9622751474380493, | |
| "learning_rate": 1.3091849935316946e-05, | |
| "loss": 1.0348, | |
| "num_input_tokens_seen": 32152288, | |
| "step": 273, | |
| "train_runtime": 3108.918, | |
| "train_tokens_per_second": 10341.954 | |
| }, | |
| { | |
| "epoch": 0.3522982963677274, | |
| "grad_norm": 1.8532695770263672, | |
| "learning_rate": 1.3065976714100907e-05, | |
| "loss": 0.9972, | |
| "num_input_tokens_seen": 32254592, | |
| "step": 274, | |
| "train_runtime": 3117.7914, | |
| "train_tokens_per_second": 10345.333 | |
| }, | |
| { | |
| "epoch": 0.35358405657344905, | |
| "grad_norm": 1.8529016971588135, | |
| "learning_rate": 1.3040103492884866e-05, | |
| "loss": 1.1095, | |
| "num_input_tokens_seen": 32377696, | |
| "step": 275, | |
| "train_runtime": 3128.8339, | |
| "train_tokens_per_second": 10348.167 | |
| }, | |
| { | |
| "epoch": 0.3548698167791707, | |
| "grad_norm": 1.9654872417449951, | |
| "learning_rate": 1.3014230271668823e-05, | |
| "loss": 1.1777, | |
| "num_input_tokens_seen": 32464224, | |
| "step": 276, | |
| "train_runtime": 3136.2376, | |
| "train_tokens_per_second": 10351.328 | |
| }, | |
| { | |
| "epoch": 0.3561555769848923, | |
| "grad_norm": 1.9332945346832275, | |
| "learning_rate": 1.2988357050452782e-05, | |
| "loss": 1.0694, | |
| "num_input_tokens_seen": 32543360, | |
| "step": 277, | |
| "train_runtime": 3142.9151, | |
| "train_tokens_per_second": 10354.515 | |
| }, | |
| { | |
| "epoch": 0.35744133719061394, | |
| "grad_norm": 2.014310121536255, | |
| "learning_rate": 1.2962483829236741e-05, | |
| "loss": 1.1293, | |
| "num_input_tokens_seen": 32652000, | |
| "step": 278, | |
| "train_runtime": 3152.361, | |
| "train_tokens_per_second": 10357.951 | |
| }, | |
| { | |
| "epoch": 0.35872709739633557, | |
| "grad_norm": 1.9047924280166626, | |
| "learning_rate": 1.2936610608020698e-05, | |
| "loss": 1.0027, | |
| "num_input_tokens_seen": 32764256, | |
| "step": 279, | |
| "train_runtime": 3162.2615, | |
| "train_tokens_per_second": 10361.021 | |
| }, | |
| { | |
| "epoch": 0.3600128576020572, | |
| "grad_norm": 1.825059413909912, | |
| "learning_rate": 1.2910737386804659e-05, | |
| "loss": 1.1741, | |
| "num_input_tokens_seen": 32843744, | |
| "step": 280, | |
| "train_runtime": 3168.977, | |
| "train_tokens_per_second": 10364.147 | |
| }, | |
| { | |
| "epoch": 0.36129861780777883, | |
| "grad_norm": 1.831803321838379, | |
| "learning_rate": 1.2884864165588618e-05, | |
| "loss": 1.022, | |
| "num_input_tokens_seen": 32964992, | |
| "step": 281, | |
| "train_runtime": 3179.9785, | |
| "train_tokens_per_second": 10366.42 | |
| }, | |
| { | |
| "epoch": 0.36258437801350046, | |
| "grad_norm": 1.70236074924469, | |
| "learning_rate": 1.2858990944372575e-05, | |
| "loss": 1.0487, | |
| "num_input_tokens_seen": 33080992, | |
| "step": 282, | |
| "train_runtime": 3190.2018, | |
| "train_tokens_per_second": 10369.561 | |
| }, | |
| { | |
| "epoch": 0.3638701382192221, | |
| "grad_norm": 1.796125888824463, | |
| "learning_rate": 1.2833117723156534e-05, | |
| "loss": 1.0899, | |
| "num_input_tokens_seen": 33226368, | |
| "step": 283, | |
| "train_runtime": 3203.4864, | |
| "train_tokens_per_second": 10371.94 | |
| }, | |
| { | |
| "epoch": 0.3651558984249437, | |
| "grad_norm": 1.8778120279312134, | |
| "learning_rate": 1.2807244501940492e-05, | |
| "loss": 1.0362, | |
| "num_input_tokens_seen": 33339552, | |
| "step": 284, | |
| "train_runtime": 3213.4705, | |
| "train_tokens_per_second": 10374.937 | |
| }, | |
| { | |
| "epoch": 0.36644165863066536, | |
| "grad_norm": 1.868843913078308, | |
| "learning_rate": 1.278137128072445e-05, | |
| "loss": 1.0095, | |
| "num_input_tokens_seen": 33425280, | |
| "step": 285, | |
| "train_runtime": 3220.8266, | |
| "train_tokens_per_second": 10377.858 | |
| }, | |
| { | |
| "epoch": 0.367727418836387, | |
| "grad_norm": 1.8552757501602173, | |
| "learning_rate": 1.275549805950841e-05, | |
| "loss": 0.9967, | |
| "num_input_tokens_seen": 33519872, | |
| "step": 286, | |
| "train_runtime": 3228.9988, | |
| "train_tokens_per_second": 10380.887 | |
| }, | |
| { | |
| "epoch": 0.3690131790421087, | |
| "grad_norm": 1.8477954864501953, | |
| "learning_rate": 1.272962483829237e-05, | |
| "loss": 1.1182, | |
| "num_input_tokens_seen": 33670336, | |
| "step": 287, | |
| "train_runtime": 3243.1369, | |
| "train_tokens_per_second": 10382.027 | |
| }, | |
| { | |
| "epoch": 0.3702989392478303, | |
| "grad_norm": 1.7322572469711304, | |
| "learning_rate": 1.2703751617076327e-05, | |
| "loss": 1.0259, | |
| "num_input_tokens_seen": 33777152, | |
| "step": 288, | |
| "train_runtime": 3252.4159, | |
| "train_tokens_per_second": 10385.25 | |
| }, | |
| { | |
| "epoch": 0.37158469945355194, | |
| "grad_norm": 1.8179206848144531, | |
| "learning_rate": 1.2677878395860286e-05, | |
| "loss": 1.095, | |
| "num_input_tokens_seen": 33933760, | |
| "step": 289, | |
| "train_runtime": 3267.0848, | |
| "train_tokens_per_second": 10386.556 | |
| }, | |
| { | |
| "epoch": 0.37287045965927357, | |
| "grad_norm": 1.927725076675415, | |
| "learning_rate": 1.2652005174644244e-05, | |
| "loss": 1.0971, | |
| "num_input_tokens_seen": 34016064, | |
| "step": 290, | |
| "train_runtime": 3274.2027, | |
| "train_tokens_per_second": 10389.114 | |
| }, | |
| { | |
| "epoch": 0.3741562198649952, | |
| "grad_norm": 1.8900138139724731, | |
| "learning_rate": 1.2626131953428203e-05, | |
| "loss": 1.0385, | |
| "num_input_tokens_seen": 34105728, | |
| "step": 291, | |
| "train_runtime": 3281.9209, | |
| "train_tokens_per_second": 10392.002 | |
| }, | |
| { | |
| "epoch": 0.37544198007071683, | |
| "grad_norm": 1.8767197132110596, | |
| "learning_rate": 1.260025873221216e-05, | |
| "loss": 1.2325, | |
| "num_input_tokens_seen": 34257888, | |
| "step": 292, | |
| "train_runtime": 3296.0865, | |
| "train_tokens_per_second": 10393.504 | |
| }, | |
| { | |
| "epoch": 0.37672774027643846, | |
| "grad_norm": 1.6599918603897095, | |
| "learning_rate": 1.257438551099612e-05, | |
| "loss": 1.0944, | |
| "num_input_tokens_seen": 34370272, | |
| "step": 293, | |
| "train_runtime": 3305.9389, | |
| "train_tokens_per_second": 10396.524 | |
| }, | |
| { | |
| "epoch": 0.3780135004821601, | |
| "grad_norm": 1.9018691778182983, | |
| "learning_rate": 1.254851228978008e-05, | |
| "loss": 1.1485, | |
| "num_input_tokens_seen": 34497536, | |
| "step": 294, | |
| "train_runtime": 3317.4286, | |
| "train_tokens_per_second": 10398.878 | |
| }, | |
| { | |
| "epoch": 0.3792992606878817, | |
| "grad_norm": 1.9373286962509155, | |
| "learning_rate": 1.2522639068564037e-05, | |
| "loss": 1.1207, | |
| "num_input_tokens_seen": 34655552, | |
| "step": 295, | |
| "train_runtime": 3332.4647, | |
| "train_tokens_per_second": 10399.376 | |
| }, | |
| { | |
| "epoch": 0.38058502089360335, | |
| "grad_norm": 1.9912974834442139, | |
| "learning_rate": 1.2496765847347996e-05, | |
| "loss": 1.0018, | |
| "num_input_tokens_seen": 34850176, | |
| "step": 296, | |
| "train_runtime": 3351.492, | |
| "train_tokens_per_second": 10398.406 | |
| }, | |
| { | |
| "epoch": 0.381870781099325, | |
| "grad_norm": 2.001157760620117, | |
| "learning_rate": 1.2470892626131955e-05, | |
| "loss": 1.0122, | |
| "num_input_tokens_seen": 34929440, | |
| "step": 297, | |
| "train_runtime": 3358.2119, | |
| "train_tokens_per_second": 10401.202 | |
| }, | |
| { | |
| "epoch": 0.3831565413050466, | |
| "grad_norm": 1.9736489057540894, | |
| "learning_rate": 1.2445019404915912e-05, | |
| "loss": 1.0287, | |
| "num_input_tokens_seen": 35043488, | |
| "step": 298, | |
| "train_runtime": 3368.304, | |
| "train_tokens_per_second": 10403.897 | |
| }, | |
| { | |
| "epoch": 0.38444230151076825, | |
| "grad_norm": 2.0292022228240967, | |
| "learning_rate": 1.2419146183699871e-05, | |
| "loss": 1.1769, | |
| "num_input_tokens_seen": 35170560, | |
| "step": 299, | |
| "train_runtime": 3379.6518, | |
| "train_tokens_per_second": 10406.563 | |
| }, | |
| { | |
| "epoch": 0.3857280617164899, | |
| "grad_norm": 1.7314234972000122, | |
| "learning_rate": 1.2393272962483832e-05, | |
| "loss": 0.97, | |
| "num_input_tokens_seen": 35281056, | |
| "step": 300, | |
| "train_runtime": 3389.3149, | |
| "train_tokens_per_second": 10409.495 | |
| }, | |
| { | |
| "epoch": 0.3870138219222115, | |
| "grad_norm": 2.0191800594329834, | |
| "learning_rate": 1.2367399741267789e-05, | |
| "loss": 1.1325, | |
| "num_input_tokens_seen": 35388672, | |
| "step": 301, | |
| "train_runtime": 3417.1135, | |
| "train_tokens_per_second": 10356.306 | |
| }, | |
| { | |
| "epoch": 0.38829958212793314, | |
| "grad_norm": 1.8068965673446655, | |
| "learning_rate": 1.2341526520051748e-05, | |
| "loss": 1.1311, | |
| "num_input_tokens_seen": 35523712, | |
| "step": 302, | |
| "train_runtime": 3429.3021, | |
| "train_tokens_per_second": 10358.875 | |
| }, | |
| { | |
| "epoch": 0.38958534233365477, | |
| "grad_norm": 1.8851860761642456, | |
| "learning_rate": 1.2315653298835705e-05, | |
| "loss": 1.1328, | |
| "num_input_tokens_seen": 35691712, | |
| "step": 303, | |
| "train_runtime": 3445.5901, | |
| "train_tokens_per_second": 10358.665 | |
| }, | |
| { | |
| "epoch": 0.3908711025393764, | |
| "grad_norm": 2.3786840438842773, | |
| "learning_rate": 1.2289780077619664e-05, | |
| "loss": 1.1061, | |
| "num_input_tokens_seen": 35780768, | |
| "step": 304, | |
| "train_runtime": 3453.2825, | |
| "train_tokens_per_second": 10361.379 | |
| }, | |
| { | |
| "epoch": 0.39215686274509803, | |
| "grad_norm": 1.793230414390564, | |
| "learning_rate": 1.2263906856403623e-05, | |
| "loss": 1.1275, | |
| "num_input_tokens_seen": 35888608, | |
| "step": 305, | |
| "train_runtime": 3462.6599, | |
| "train_tokens_per_second": 10364.462 | |
| }, | |
| { | |
| "epoch": 0.39344262295081966, | |
| "grad_norm": 1.8552781343460083, | |
| "learning_rate": 1.2238033635187584e-05, | |
| "loss": 1.1033, | |
| "num_input_tokens_seen": 36048640, | |
| "step": 306, | |
| "train_runtime": 3477.6998, | |
| "train_tokens_per_second": 10365.656 | |
| }, | |
| { | |
| "epoch": 0.3947283831565413, | |
| "grad_norm": 1.8553136587142944, | |
| "learning_rate": 1.2212160413971541e-05, | |
| "loss": 1.0171, | |
| "num_input_tokens_seen": 36150336, | |
| "step": 307, | |
| "train_runtime": 3486.8518, | |
| "train_tokens_per_second": 10367.615 | |
| }, | |
| { | |
| "epoch": 0.3960141433622629, | |
| "grad_norm": 1.8456462621688843, | |
| "learning_rate": 1.21862871927555e-05, | |
| "loss": 1.0815, | |
| "num_input_tokens_seen": 36262560, | |
| "step": 308, | |
| "train_runtime": 3496.9741, | |
| "train_tokens_per_second": 10369.696 | |
| }, | |
| { | |
| "epoch": 0.39729990356798456, | |
| "grad_norm": 2.0002105236053467, | |
| "learning_rate": 1.2160413971539457e-05, | |
| "loss": 1.0209, | |
| "num_input_tokens_seen": 36364320, | |
| "step": 309, | |
| "train_runtime": 3506.0556, | |
| "train_tokens_per_second": 10371.86 | |
| }, | |
| { | |
| "epoch": 0.3985856637737062, | |
| "grad_norm": 1.8822708129882812, | |
| "learning_rate": 1.2134540750323416e-05, | |
| "loss": 1.1019, | |
| "num_input_tokens_seen": 36472480, | |
| "step": 310, | |
| "train_runtime": 3515.5179, | |
| "train_tokens_per_second": 10374.71 | |
| }, | |
| { | |
| "epoch": 0.3998714239794278, | |
| "grad_norm": 1.954473614692688, | |
| "learning_rate": 1.2108667529107373e-05, | |
| "loss": 1.2242, | |
| "num_input_tokens_seen": 36585792, | |
| "step": 311, | |
| "train_runtime": 3525.5023, | |
| "train_tokens_per_second": 10377.469 | |
| }, | |
| { | |
| "epoch": 0.40115718418514945, | |
| "grad_norm": 1.8884960412979126, | |
| "learning_rate": 1.2082794307891334e-05, | |
| "loss": 1.1584, | |
| "num_input_tokens_seen": 36700448, | |
| "step": 312, | |
| "train_runtime": 3536.0058, | |
| "train_tokens_per_second": 10379.069 | |
| }, | |
| { | |
| "epoch": 0.40115718418514945, | |
| "eval_loss": 1.112414836883545, | |
| "eval_runtime": 22.4354, | |
| "eval_samples_per_second": 44.305, | |
| "eval_steps_per_second": 1.426, | |
| "num_input_tokens_seen": 36700448, | |
| "step": 312 | |
| }, | |
| { | |
| "epoch": 0.4024429443908711, | |
| "grad_norm": 1.7745190858840942, | |
| "learning_rate": 1.2056921086675293e-05, | |
| "loss": 1.0609, | |
| "num_input_tokens_seen": 36819552, | |
| "step": 313, | |
| "train_runtime": 3569.0494, | |
| "train_tokens_per_second": 10316.347 | |
| }, | |
| { | |
| "epoch": 0.4037287045965927, | |
| "grad_norm": 1.9588580131530762, | |
| "learning_rate": 1.2031047865459252e-05, | |
| "loss": 1.0342, | |
| "num_input_tokens_seen": 36901792, | |
| "step": 314, | |
| "train_runtime": 3576.0188, | |
| "train_tokens_per_second": 10319.239 | |
| }, | |
| { | |
| "epoch": 0.40501446480231434, | |
| "grad_norm": 1.886616826057434, | |
| "learning_rate": 1.200517464424321e-05, | |
| "loss": 1.0539, | |
| "num_input_tokens_seen": 37002112, | |
| "step": 315, | |
| "train_runtime": 3584.6465, | |
| "train_tokens_per_second": 10322.388 | |
| }, | |
| { | |
| "epoch": 0.406300225008036, | |
| "grad_norm": 1.9062621593475342, | |
| "learning_rate": 1.1979301423027168e-05, | |
| "loss": 1.0985, | |
| "num_input_tokens_seen": 37111936, | |
| "step": 316, | |
| "train_runtime": 3594.3563, | |
| "train_tokens_per_second": 10325.058 | |
| }, | |
| { | |
| "epoch": 0.4075859852137576, | |
| "grad_norm": 2.068682909011841, | |
| "learning_rate": 1.1953428201811125e-05, | |
| "loss": 1.097, | |
| "num_input_tokens_seen": 37218208, | |
| "step": 317, | |
| "train_runtime": 3603.7296, | |
| "train_tokens_per_second": 10327.692 | |
| }, | |
| { | |
| "epoch": 0.4088717454194793, | |
| "grad_norm": 1.958736538887024, | |
| "learning_rate": 1.1927554980595084e-05, | |
| "loss": 0.9942, | |
| "num_input_tokens_seen": 37345632, | |
| "step": 318, | |
| "train_runtime": 3615.4338, | |
| "train_tokens_per_second": 10329.502 | |
| }, | |
| { | |
| "epoch": 0.4101575056252009, | |
| "grad_norm": 1.8023805618286133, | |
| "learning_rate": 1.1901681759379045e-05, | |
| "loss": 0.9653, | |
| "num_input_tokens_seen": 37443360, | |
| "step": 319, | |
| "train_runtime": 3623.7748, | |
| "train_tokens_per_second": 10332.695 | |
| }, | |
| { | |
| "epoch": 0.41144326583092256, | |
| "grad_norm": 1.9169106483459473, | |
| "learning_rate": 1.1875808538163002e-05, | |
| "loss": 1.0838, | |
| "num_input_tokens_seen": 37545600, | |
| "step": 320, | |
| "train_runtime": 3632.642, | |
| "train_tokens_per_second": 10335.618 | |
| }, | |
| { | |
| "epoch": 0.4127290260366442, | |
| "grad_norm": 1.8038839101791382, | |
| "learning_rate": 1.1849935316946961e-05, | |
| "loss": 1.1069, | |
| "num_input_tokens_seen": 37666080, | |
| "step": 321, | |
| "train_runtime": 3643.3493, | |
| "train_tokens_per_second": 10338.311 | |
| }, | |
| { | |
| "epoch": 0.4140147862423658, | |
| "grad_norm": 1.7721644639968872, | |
| "learning_rate": 1.1824062095730919e-05, | |
| "loss": 1.0839, | |
| "num_input_tokens_seen": 37822144, | |
| "step": 322, | |
| "train_runtime": 3657.9869, | |
| "train_tokens_per_second": 10339.606 | |
| }, | |
| { | |
| "epoch": 0.41530054644808745, | |
| "grad_norm": 1.9049701690673828, | |
| "learning_rate": 1.1798188874514877e-05, | |
| "loss": 1.0799, | |
| "num_input_tokens_seen": 37966560, | |
| "step": 323, | |
| "train_runtime": 3671.372, | |
| "train_tokens_per_second": 10341.246 | |
| }, | |
| { | |
| "epoch": 0.4165863066538091, | |
| "grad_norm": 1.980131983757019, | |
| "learning_rate": 1.1772315653298836e-05, | |
| "loss": 1.0307, | |
| "num_input_tokens_seen": 38062112, | |
| "step": 324, | |
| "train_runtime": 3679.5815, | |
| "train_tokens_per_second": 10344.141 | |
| }, | |
| { | |
| "epoch": 0.4178720668595307, | |
| "grad_norm": 1.9756392240524292, | |
| "learning_rate": 1.1746442432082797e-05, | |
| "loss": 1.1018, | |
| "num_input_tokens_seen": 38150848, | |
| "step": 325, | |
| "train_runtime": 3687.0852, | |
| "train_tokens_per_second": 10347.157 | |
| }, | |
| { | |
| "epoch": 0.41915782706525234, | |
| "grad_norm": 1.896883249282837, | |
| "learning_rate": 1.1720569210866754e-05, | |
| "loss": 1.1311, | |
| "num_input_tokens_seen": 38241536, | |
| "step": 326, | |
| "train_runtime": 3694.6877, | |
| "train_tokens_per_second": 10350.411 | |
| }, | |
| { | |
| "epoch": 0.420443587270974, | |
| "grad_norm": 1.739008903503418, | |
| "learning_rate": 1.1694695989650713e-05, | |
| "loss": 1.0084, | |
| "num_input_tokens_seen": 38318656, | |
| "step": 327, | |
| "train_runtime": 3701.2278, | |
| "train_tokens_per_second": 10352.958 | |
| }, | |
| { | |
| "epoch": 0.4217293474766956, | |
| "grad_norm": 1.8083174228668213, | |
| "learning_rate": 1.166882276843467e-05, | |
| "loss": 1.123, | |
| "num_input_tokens_seen": 38417472, | |
| "step": 328, | |
| "train_runtime": 3709.7971, | |
| "train_tokens_per_second": 10355.68 | |
| }, | |
| { | |
| "epoch": 0.42301510768241724, | |
| "grad_norm": 1.8054888248443604, | |
| "learning_rate": 1.164294954721863e-05, | |
| "loss": 0.9772, | |
| "num_input_tokens_seen": 38536576, | |
| "step": 329, | |
| "train_runtime": 3720.5243, | |
| "train_tokens_per_second": 10357.835 | |
| }, | |
| { | |
| "epoch": 0.42430086788813887, | |
| "grad_norm": 1.8551595211029053, | |
| "learning_rate": 1.1617076326002587e-05, | |
| "loss": 1.0588, | |
| "num_input_tokens_seen": 38623488, | |
| "step": 330, | |
| "train_runtime": 3727.8728, | |
| "train_tokens_per_second": 10360.731 | |
| }, | |
| { | |
| "epoch": 0.4255866280938605, | |
| "grad_norm": 1.9173765182495117, | |
| "learning_rate": 1.1591203104786546e-05, | |
| "loss": 1.0059, | |
| "num_input_tokens_seen": 38708384, | |
| "step": 331, | |
| "train_runtime": 3752.9725, | |
| "train_tokens_per_second": 10314.06 | |
| }, | |
| { | |
| "epoch": 0.42687238829958213, | |
| "grad_norm": 1.9079426527023315, | |
| "learning_rate": 1.1565329883570506e-05, | |
| "loss": 1.1054, | |
| "num_input_tokens_seen": 38843744, | |
| "step": 332, | |
| "train_runtime": 3765.4725, | |
| "train_tokens_per_second": 10315.769 | |
| }, | |
| { | |
| "epoch": 0.42815814850530376, | |
| "grad_norm": 1.8765593767166138, | |
| "learning_rate": 1.1539456662354465e-05, | |
| "loss": 1.0543, | |
| "num_input_tokens_seen": 38952768, | |
| "step": 333, | |
| "train_runtime": 3774.9835, | |
| "train_tokens_per_second": 10318.659 | |
| }, | |
| { | |
| "epoch": 0.4294439087110254, | |
| "grad_norm": 1.9778969287872314, | |
| "learning_rate": 1.1513583441138423e-05, | |
| "loss": 1.0328, | |
| "num_input_tokens_seen": 39051136, | |
| "step": 334, | |
| "train_runtime": 3783.4403, | |
| "train_tokens_per_second": 10321.594 | |
| }, | |
| { | |
| "epoch": 0.430729668916747, | |
| "grad_norm": 1.9157649278640747, | |
| "learning_rate": 1.1487710219922382e-05, | |
| "loss": 1.0765, | |
| "num_input_tokens_seen": 39151392, | |
| "step": 335, | |
| "train_runtime": 3792.1825, | |
| "train_tokens_per_second": 10324.237 | |
| }, | |
| { | |
| "epoch": 0.43201542912246865, | |
| "grad_norm": 1.9655895233154297, | |
| "learning_rate": 1.1461836998706339e-05, | |
| "loss": 1.0175, | |
| "num_input_tokens_seen": 39247360, | |
| "step": 336, | |
| "train_runtime": 3800.3977, | |
| "train_tokens_per_second": 10327.172 | |
| }, | |
| { | |
| "epoch": 0.4333011893281903, | |
| "grad_norm": 1.8738690614700317, | |
| "learning_rate": 1.1435963777490298e-05, | |
| "loss": 1.103, | |
| "num_input_tokens_seen": 39336896, | |
| "step": 337, | |
| "train_runtime": 3808.0625, | |
| "train_tokens_per_second": 10329.898 | |
| }, | |
| { | |
| "epoch": 0.4345869495339119, | |
| "grad_norm": 1.6234264373779297, | |
| "learning_rate": 1.1410090556274259e-05, | |
| "loss": 0.8555, | |
| "num_input_tokens_seen": 39482304, | |
| "step": 338, | |
| "train_runtime": 3821.6722, | |
| "train_tokens_per_second": 10331.159 | |
| }, | |
| { | |
| "epoch": 0.43587270973963355, | |
| "grad_norm": 1.8462566137313843, | |
| "learning_rate": 1.1384217335058216e-05, | |
| "loss": 1.1103, | |
| "num_input_tokens_seen": 39575136, | |
| "step": 339, | |
| "train_runtime": 3829.6789, | |
| "train_tokens_per_second": 10333.8 | |
| }, | |
| { | |
| "epoch": 0.4371584699453552, | |
| "grad_norm": 1.850907325744629, | |
| "learning_rate": 1.1358344113842175e-05, | |
| "loss": 1.0596, | |
| "num_input_tokens_seen": 39689024, | |
| "step": 340, | |
| "train_runtime": 3839.7717, | |
| "train_tokens_per_second": 10336.298 | |
| }, | |
| { | |
| "epoch": 0.4384442301510768, | |
| "grad_norm": 1.863982915878296, | |
| "learning_rate": 1.1332470892626132e-05, | |
| "loss": 1.0263, | |
| "num_input_tokens_seen": 39816832, | |
| "step": 341, | |
| "train_runtime": 3851.71, | |
| "train_tokens_per_second": 10337.443 | |
| }, | |
| { | |
| "epoch": 0.43972999035679844, | |
| "grad_norm": 1.933987021446228, | |
| "learning_rate": 1.1306597671410091e-05, | |
| "loss": 1.0908, | |
| "num_input_tokens_seen": 39960768, | |
| "step": 342, | |
| "train_runtime": 3865.0922, | |
| "train_tokens_per_second": 10338.891 | |
| }, | |
| { | |
| "epoch": 0.44101575056252007, | |
| "grad_norm": 1.8219382762908936, | |
| "learning_rate": 1.128072445019405e-05, | |
| "loss": 1.1551, | |
| "num_input_tokens_seen": 40086912, | |
| "step": 343, | |
| "train_runtime": 3876.2397, | |
| "train_tokens_per_second": 10341.701 | |
| }, | |
| { | |
| "epoch": 0.4423015107682417, | |
| "grad_norm": 1.9455715417861938, | |
| "learning_rate": 1.1254851228978007e-05, | |
| "loss": 1.1734, | |
| "num_input_tokens_seen": 40207200, | |
| "step": 344, | |
| "train_runtime": 3887.3565, | |
| "train_tokens_per_second": 10343.07 | |
| }, | |
| { | |
| "epoch": 0.44358727097396333, | |
| "grad_norm": 1.81923246383667, | |
| "learning_rate": 1.1228978007761968e-05, | |
| "loss": 1.0239, | |
| "num_input_tokens_seen": 40346560, | |
| "step": 345, | |
| "train_runtime": 3900.1116, | |
| "train_tokens_per_second": 10344.976 | |
| }, | |
| { | |
| "epoch": 0.44487303117968496, | |
| "grad_norm": 1.9423332214355469, | |
| "learning_rate": 1.1203104786545927e-05, | |
| "loss": 0.9855, | |
| "num_input_tokens_seen": 40449888, | |
| "step": 346, | |
| "train_runtime": 3909.0681, | |
| "train_tokens_per_second": 10347.706 | |
| }, | |
| { | |
| "epoch": 0.4461587913854066, | |
| "grad_norm": 1.9526299238204956, | |
| "learning_rate": 1.1177231565329884e-05, | |
| "loss": 1.0271, | |
| "num_input_tokens_seen": 40586752, | |
| "step": 347, | |
| "train_runtime": 3921.8977, | |
| "train_tokens_per_second": 10348.753 | |
| }, | |
| { | |
| "epoch": 0.4474445515911283, | |
| "grad_norm": 1.8065625429153442, | |
| "learning_rate": 1.1151358344113843e-05, | |
| "loss": 1.1239, | |
| "num_input_tokens_seen": 40696608, | |
| "step": 348, | |
| "train_runtime": 3931.7547, | |
| "train_tokens_per_second": 10350.749 | |
| }, | |
| { | |
| "epoch": 0.4487303117968499, | |
| "grad_norm": 1.6349153518676758, | |
| "learning_rate": 1.11254851228978e-05, | |
| "loss": 0.9781, | |
| "num_input_tokens_seen": 40814656, | |
| "step": 349, | |
| "train_runtime": 3942.1447, | |
| "train_tokens_per_second": 10353.414 | |
| }, | |
| { | |
| "epoch": 0.45001607200257154, | |
| "grad_norm": 1.7468831539154053, | |
| "learning_rate": 1.109961190168176e-05, | |
| "loss": 1.0172, | |
| "num_input_tokens_seen": 40974816, | |
| "step": 350, | |
| "train_runtime": 3957.5232, | |
| "train_tokens_per_second": 10353.651 | |
| }, | |
| { | |
| "epoch": 0.4513018322082932, | |
| "grad_norm": 1.9717236757278442, | |
| "learning_rate": 1.107373868046572e-05, | |
| "loss": 1.1383, | |
| "num_input_tokens_seen": 41075776, | |
| "step": 351, | |
| "train_runtime": 3966.3179, | |
| "train_tokens_per_second": 10356.148 | |
| }, | |
| { | |
| "epoch": 0.4525875924140148, | |
| "grad_norm": 1.715475082397461, | |
| "learning_rate": 1.1047865459249679e-05, | |
| "loss": 1.0579, | |
| "num_input_tokens_seen": 41192352, | |
| "step": 352, | |
| "train_runtime": 3976.6366, | |
| "train_tokens_per_second": 10358.591 | |
| }, | |
| { | |
| "epoch": 0.45387335261973644, | |
| "grad_norm": 1.936943769454956, | |
| "learning_rate": 1.1021992238033636e-05, | |
| "loss": 1.1545, | |
| "num_input_tokens_seen": 41296928, | |
| "step": 353, | |
| "train_runtime": 3985.9231, | |
| "train_tokens_per_second": 10360.694 | |
| }, | |
| { | |
| "epoch": 0.45515911282545807, | |
| "grad_norm": 1.7825515270233154, | |
| "learning_rate": 1.0996119016817595e-05, | |
| "loss": 1.0933, | |
| "num_input_tokens_seen": 41390336, | |
| "step": 354, | |
| "train_runtime": 3993.8858, | |
| "train_tokens_per_second": 10363.425 | |
| }, | |
| { | |
| "epoch": 0.4564448730311797, | |
| "grad_norm": 1.7963905334472656, | |
| "learning_rate": 1.0970245795601552e-05, | |
| "loss": 1.0372, | |
| "num_input_tokens_seen": 41491968, | |
| "step": 355, | |
| "train_runtime": 4002.6542, | |
| "train_tokens_per_second": 10366.114 | |
| }, | |
| { | |
| "epoch": 0.45773063323690133, | |
| "grad_norm": 1.836431860923767, | |
| "learning_rate": 1.0944372574385511e-05, | |
| "loss": 1.0373, | |
| "num_input_tokens_seen": 41613888, | |
| "step": 356, | |
| "train_runtime": 4013.7789, | |
| "train_tokens_per_second": 10367.758 | |
| }, | |
| { | |
| "epoch": 0.45901639344262296, | |
| "grad_norm": 1.9172090291976929, | |
| "learning_rate": 1.0918499353169469e-05, | |
| "loss": 1.0329, | |
| "num_input_tokens_seen": 41745664, | |
| "step": 357, | |
| "train_runtime": 4025.8189, | |
| "train_tokens_per_second": 10369.484 | |
| }, | |
| { | |
| "epoch": 0.4603021536483446, | |
| "grad_norm": 1.8832635879516602, | |
| "learning_rate": 1.089262613195343e-05, | |
| "loss": 1.0411, | |
| "num_input_tokens_seen": 41879264, | |
| "step": 358, | |
| "train_runtime": 4038.136, | |
| "train_tokens_per_second": 10370.939 | |
| }, | |
| { | |
| "epoch": 0.4615879138540662, | |
| "grad_norm": 1.8881222009658813, | |
| "learning_rate": 1.0866752910737388e-05, | |
| "loss": 1.1016, | |
| "num_input_tokens_seen": 42019424, | |
| "step": 359, | |
| "train_runtime": 4050.808, | |
| "train_tokens_per_second": 10373.097 | |
| }, | |
| { | |
| "epoch": 0.46287367405978785, | |
| "grad_norm": 1.8251198530197144, | |
| "learning_rate": 1.0840879689521346e-05, | |
| "loss": 1.0582, | |
| "num_input_tokens_seen": 42184096, | |
| "step": 360, | |
| "train_runtime": 4066.1572, | |
| "train_tokens_per_second": 10374.438 | |
| }, | |
| { | |
| "epoch": 0.4641594342655095, | |
| "grad_norm": 1.8713456392288208, | |
| "learning_rate": 1.0815006468305305e-05, | |
| "loss": 1.111, | |
| "num_input_tokens_seen": 42279968, | |
| "step": 361, | |
| "train_runtime": 4091.1662, | |
| "train_tokens_per_second": 10334.454 | |
| }, | |
| { | |
| "epoch": 0.4654451944712311, | |
| "grad_norm": 1.8834689855575562, | |
| "learning_rate": 1.0789133247089263e-05, | |
| "loss": 1.1313, | |
| "num_input_tokens_seen": 42376320, | |
| "step": 362, | |
| "train_runtime": 4099.4271, | |
| "train_tokens_per_second": 10337.132 | |
| }, | |
| { | |
| "epoch": 0.46673095467695275, | |
| "grad_norm": 1.9569921493530273, | |
| "learning_rate": 1.076326002587322e-05, | |
| "loss": 0.9795, | |
| "num_input_tokens_seen": 42480736, | |
| "step": 363, | |
| "train_runtime": 4108.5761, | |
| "train_tokens_per_second": 10339.528 | |
| }, | |
| { | |
| "epoch": 0.4680167148826744, | |
| "grad_norm": 1.9009162187576294, | |
| "learning_rate": 1.0737386804657181e-05, | |
| "loss": 1.028, | |
| "num_input_tokens_seen": 42588928, | |
| "step": 364, | |
| "train_runtime": 4117.995, | |
| "train_tokens_per_second": 10342.151 | |
| }, | |
| { | |
| "epoch": 0.469302475088396, | |
| "grad_norm": 1.9303570985794067, | |
| "learning_rate": 1.071151358344114e-05, | |
| "loss": 1.0805, | |
| "num_input_tokens_seen": 42702336, | |
| "step": 365, | |
| "train_runtime": 4127.9119, | |
| "train_tokens_per_second": 10344.779 | |
| }, | |
| { | |
| "epoch": 0.47058823529411764, | |
| "grad_norm": 1.8810940980911255, | |
| "learning_rate": 1.0685640362225098e-05, | |
| "loss": 1.0237, | |
| "num_input_tokens_seen": 42778176, | |
| "step": 366, | |
| "train_runtime": 4134.3506, | |
| "train_tokens_per_second": 10347.012 | |
| }, | |
| { | |
| "epoch": 0.47187399549983927, | |
| "grad_norm": 1.7211192846298218, | |
| "learning_rate": 1.0659767141009057e-05, | |
| "loss": 0.9568, | |
| "num_input_tokens_seen": 42865536, | |
| "step": 367, | |
| "train_runtime": 4141.8091, | |
| "train_tokens_per_second": 10349.472 | |
| }, | |
| { | |
| "epoch": 0.4731597557055609, | |
| "grad_norm": 1.7768193483352661, | |
| "learning_rate": 1.0633893919793014e-05, | |
| "loss": 1.0588, | |
| "num_input_tokens_seen": 42971392, | |
| "step": 368, | |
| "train_runtime": 4151.0681, | |
| "train_tokens_per_second": 10351.888 | |
| }, | |
| { | |
| "epoch": 0.47444551591128253, | |
| "grad_norm": 1.8423272371292114, | |
| "learning_rate": 1.0608020698576973e-05, | |
| "loss": 1.0675, | |
| "num_input_tokens_seen": 43112160, | |
| "step": 369, | |
| "train_runtime": 4164.273, | |
| "train_tokens_per_second": 10352.866 | |
| }, | |
| { | |
| "epoch": 0.47573127611700416, | |
| "grad_norm": 1.7994762659072876, | |
| "learning_rate": 1.0582147477360933e-05, | |
| "loss": 1.0544, | |
| "num_input_tokens_seen": 43221728, | |
| "step": 370, | |
| "train_runtime": 4173.8176, | |
| "train_tokens_per_second": 10355.443 | |
| }, | |
| { | |
| "epoch": 0.4770170363227258, | |
| "grad_norm": 1.8866075277328491, | |
| "learning_rate": 1.0556274256144892e-05, | |
| "loss": 1.1007, | |
| "num_input_tokens_seen": 43330080, | |
| "step": 371, | |
| "train_runtime": 4183.4643, | |
| "train_tokens_per_second": 10357.464 | |
| }, | |
| { | |
| "epoch": 0.4783027965284474, | |
| "grad_norm": 1.8547290563583374, | |
| "learning_rate": 1.053040103492885e-05, | |
| "loss": 0.9975, | |
| "num_input_tokens_seen": 43423392, | |
| "step": 372, | |
| "train_runtime": 4191.3728, | |
| "train_tokens_per_second": 10360.184 | |
| }, | |
| { | |
| "epoch": 0.47958855673416906, | |
| "grad_norm": 2.1289970874786377, | |
| "learning_rate": 1.0504527813712809e-05, | |
| "loss": 1.0475, | |
| "num_input_tokens_seen": 43536064, | |
| "step": 373, | |
| "train_runtime": 4201.1006, | |
| "train_tokens_per_second": 10363.014 | |
| }, | |
| { | |
| "epoch": 0.4808743169398907, | |
| "grad_norm": 1.9905496835708618, | |
| "learning_rate": 1.0478654592496766e-05, | |
| "loss": 0.9375, | |
| "num_input_tokens_seen": 43635072, | |
| "step": 374, | |
| "train_runtime": 4209.5792, | |
| "train_tokens_per_second": 10365.661 | |
| }, | |
| { | |
| "epoch": 0.4821600771456123, | |
| "grad_norm": 1.791810393333435, | |
| "learning_rate": 1.0452781371280725e-05, | |
| "loss": 1.0144, | |
| "num_input_tokens_seen": 43724256, | |
| "step": 375, | |
| "train_runtime": 4217.1636, | |
| "train_tokens_per_second": 10368.167 | |
| }, | |
| { | |
| "epoch": 0.48344583735133395, | |
| "grad_norm": 1.828808307647705, | |
| "learning_rate": 1.0426908150064682e-05, | |
| "loss": 1.1086, | |
| "num_input_tokens_seen": 43903168, | |
| "step": 376, | |
| "train_runtime": 4234.1848, | |
| "train_tokens_per_second": 10368.742 | |
| }, | |
| { | |
| "epoch": 0.4847315975570556, | |
| "grad_norm": 2.0768697261810303, | |
| "learning_rate": 1.0401034928848643e-05, | |
| "loss": 1.1689, | |
| "num_input_tokens_seen": 44021952, | |
| "step": 377, | |
| "train_runtime": 4244.5157, | |
| "train_tokens_per_second": 10371.49 | |
| }, | |
| { | |
| "epoch": 0.48601735776277727, | |
| "grad_norm": 1.960158109664917, | |
| "learning_rate": 1.0375161707632602e-05, | |
| "loss": 1.061, | |
| "num_input_tokens_seen": 44108640, | |
| "step": 378, | |
| "train_runtime": 4251.8678, | |
| "train_tokens_per_second": 10373.944 | |
| }, | |
| { | |
| "epoch": 0.4873031179684989, | |
| "grad_norm": 1.9121805429458618, | |
| "learning_rate": 1.034928848641656e-05, | |
| "loss": 1.0433, | |
| "num_input_tokens_seen": 44203648, | |
| "step": 379, | |
| "train_runtime": 4260.0015, | |
| "train_tokens_per_second": 10376.44 | |
| }, | |
| { | |
| "epoch": 0.48858887817422053, | |
| "grad_norm": 1.8849984407424927, | |
| "learning_rate": 1.0323415265200518e-05, | |
| "loss": 1.1013, | |
| "num_input_tokens_seen": 44291008, | |
| "step": 380, | |
| "train_runtime": 4267.4727, | |
| "train_tokens_per_second": 10378.744 | |
| }, | |
| { | |
| "epoch": 0.48987463837994216, | |
| "grad_norm": 1.863187313079834, | |
| "learning_rate": 1.0297542043984477e-05, | |
| "loss": 1.028, | |
| "num_input_tokens_seen": 44377920, | |
| "step": 381, | |
| "train_runtime": 4274.8697, | |
| "train_tokens_per_second": 10381.116 | |
| }, | |
| { | |
| "epoch": 0.4911603985856638, | |
| "grad_norm": 1.8333090543746948, | |
| "learning_rate": 1.0271668822768434e-05, | |
| "loss": 1.075, | |
| "num_input_tokens_seen": 44581920, | |
| "step": 382, | |
| "train_runtime": 4294.9622, | |
| "train_tokens_per_second": 10380.049 | |
| }, | |
| { | |
| "epoch": 0.4924461587913854, | |
| "grad_norm": 1.873062252998352, | |
| "learning_rate": 1.0245795601552395e-05, | |
| "loss": 1.1039, | |
| "num_input_tokens_seen": 44754688, | |
| "step": 383, | |
| "train_runtime": 4311.2726, | |
| "train_tokens_per_second": 10380.853 | |
| }, | |
| { | |
| "epoch": 0.49373191899710706, | |
| "grad_norm": 1.9315266609191895, | |
| "learning_rate": 1.0219922380336354e-05, | |
| "loss": 1.145, | |
| "num_input_tokens_seen": 44880224, | |
| "step": 384, | |
| "train_runtime": 4323.0272, | |
| "train_tokens_per_second": 10381.666 | |
| }, | |
| { | |
| "epoch": 0.4950176792028287, | |
| "grad_norm": 1.731623888015747, | |
| "learning_rate": 1.0194049159120311e-05, | |
| "loss": 1.0024, | |
| "num_input_tokens_seen": 45029664, | |
| "step": 385, | |
| "train_runtime": 4336.9208, | |
| "train_tokens_per_second": 10382.865 | |
| }, | |
| { | |
| "epoch": 0.4963034394085503, | |
| "grad_norm": 1.618575096130371, | |
| "learning_rate": 1.016817593790427e-05, | |
| "loss": 0.9817, | |
| "num_input_tokens_seen": 45129600, | |
| "step": 386, | |
| "train_runtime": 4345.5214, | |
| "train_tokens_per_second": 10385.313 | |
| }, | |
| { | |
| "epoch": 0.49758919961427195, | |
| "grad_norm": 1.8326330184936523, | |
| "learning_rate": 1.0142302716688227e-05, | |
| "loss": 1.0646, | |
| "num_input_tokens_seen": 45219104, | |
| "step": 387, | |
| "train_runtime": 4353.1201, | |
| "train_tokens_per_second": 10387.746 | |
| }, | |
| { | |
| "epoch": 0.4988749598199936, | |
| "grad_norm": 1.9410369396209717, | |
| "learning_rate": 1.0116429495472186e-05, | |
| "loss": 1.1241, | |
| "num_input_tokens_seen": 45380032, | |
| "step": 388, | |
| "train_runtime": 4368.2134, | |
| "train_tokens_per_second": 10388.694 | |
| }, | |
| { | |
| "epoch": 0.5001607200257152, | |
| "grad_norm": 2.0092506408691406, | |
| "learning_rate": 1.0090556274256145e-05, | |
| "loss": 1.0946, | |
| "num_input_tokens_seen": 45512480, | |
| "step": 389, | |
| "train_runtime": 4380.1221, | |
| "train_tokens_per_second": 10390.687 | |
| }, | |
| { | |
| "epoch": 0.5014464802314368, | |
| "grad_norm": 2.0018155574798584, | |
| "learning_rate": 1.0064683053040106e-05, | |
| "loss": 1.0753, | |
| "num_input_tokens_seen": 45640032, | |
| "step": 390, | |
| "train_runtime": 4391.8578, | |
| "train_tokens_per_second": 10391.965 | |
| }, | |
| { | |
| "epoch": 0.5014464802314368, | |
| "eval_loss": 1.1071221828460693, | |
| "eval_runtime": 22.1149, | |
| "eval_samples_per_second": 44.947, | |
| "eval_steps_per_second": 1.447, | |
| "num_input_tokens_seen": 45640032, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.5027322404371585, | |
| "grad_norm": 1.8650777339935303, | |
| "learning_rate": 1.0038809831824063e-05, | |
| "loss": 1.036, | |
| "num_input_tokens_seen": 45720768, | |
| "step": 391, | |
| "train_runtime": 4437.5417, | |
| "train_tokens_per_second": 10303.175 | |
| }, | |
| { | |
| "epoch": 0.50401800064288, | |
| "grad_norm": 1.9369052648544312, | |
| "learning_rate": 1.0012936610608022e-05, | |
| "loss": 1.1169, | |
| "num_input_tokens_seen": 45842240, | |
| "step": 392, | |
| "train_runtime": 4448.5568, | |
| "train_tokens_per_second": 10304.969 | |
| }, | |
| { | |
| "epoch": 0.5053037608486017, | |
| "grad_norm": 1.8346235752105713, | |
| "learning_rate": 9.98706338939198e-06, | |
| "loss": 1.0749, | |
| "num_input_tokens_seen": 45918976, | |
| "step": 393, | |
| "train_runtime": 4454.9464, | |
| "train_tokens_per_second": 10307.414 | |
| }, | |
| { | |
| "epoch": 0.5065895210543234, | |
| "grad_norm": 2.0440127849578857, | |
| "learning_rate": 9.961190168175938e-06, | |
| "loss": 1.0516, | |
| "num_input_tokens_seen": 45999104, | |
| "step": 394, | |
| "train_runtime": 4461.6884, | |
| "train_tokens_per_second": 10309.798 | |
| }, | |
| { | |
| "epoch": 0.507875281260045, | |
| "grad_norm": 3.248145341873169, | |
| "learning_rate": 9.935316946959897e-06, | |
| "loss": 1.1728, | |
| "num_input_tokens_seen": 46154144, | |
| "step": 395, | |
| "train_runtime": 4476.3079, | |
| "train_tokens_per_second": 10310.762 | |
| }, | |
| { | |
| "epoch": 0.5091610414657667, | |
| "grad_norm": 1.918129801750183, | |
| "learning_rate": 9.909443725743856e-06, | |
| "loss": 1.0521, | |
| "num_input_tokens_seen": 46325344, | |
| "step": 396, | |
| "train_runtime": 4492.8544, | |
| "train_tokens_per_second": 10310.894 | |
| }, | |
| { | |
| "epoch": 0.5104468016714883, | |
| "grad_norm": 1.8980101346969604, | |
| "learning_rate": 9.883570504527814e-06, | |
| "loss": 1.0749, | |
| "num_input_tokens_seen": 46411072, | |
| "step": 397, | |
| "train_runtime": 4500.1395, | |
| "train_tokens_per_second": 10313.252 | |
| }, | |
| { | |
| "epoch": 0.51173256187721, | |
| "grad_norm": 1.7899583578109741, | |
| "learning_rate": 9.857697283311774e-06, | |
| "loss": 1.0462, | |
| "num_input_tokens_seen": 46509216, | |
| "step": 398, | |
| "train_runtime": 4508.575, | |
| "train_tokens_per_second": 10315.724 | |
| }, | |
| { | |
| "epoch": 0.5130183220829315, | |
| "grad_norm": 1.8656114339828491, | |
| "learning_rate": 9.831824062095732e-06, | |
| "loss": 1.0682, | |
| "num_input_tokens_seen": 46644160, | |
| "step": 399, | |
| "train_runtime": 4520.8245, | |
| "train_tokens_per_second": 10317.622 | |
| }, | |
| { | |
| "epoch": 0.5143040822886532, | |
| "grad_norm": 1.847536325454712, | |
| "learning_rate": 9.80595084087969e-06, | |
| "loss": 1.0864, | |
| "num_input_tokens_seen": 46783808, | |
| "step": 400, | |
| "train_runtime": 4533.3771, | |
| "train_tokens_per_second": 10319.858 | |
| }, | |
| { | |
| "epoch": 0.5155898424943748, | |
| "grad_norm": 1.8390229940414429, | |
| "learning_rate": 9.78007761966365e-06, | |
| "loss": 0.9831, | |
| "num_input_tokens_seen": 46926240, | |
| "step": 401, | |
| "train_runtime": 4546.39, | |
| "train_tokens_per_second": 10321.649 | |
| }, | |
| { | |
| "epoch": 0.5168756027000965, | |
| "grad_norm": 1.8536787033081055, | |
| "learning_rate": 9.754204398447608e-06, | |
| "loss": 1.0727, | |
| "num_input_tokens_seen": 47071040, | |
| "step": 402, | |
| "train_runtime": 4559.4688, | |
| "train_tokens_per_second": 10323.799 | |
| }, | |
| { | |
| "epoch": 0.518161362905818, | |
| "grad_norm": 1.8034573793411255, | |
| "learning_rate": 9.728331177231566e-06, | |
| "loss": 1.1378, | |
| "num_input_tokens_seen": 47179744, | |
| "step": 403, | |
| "train_runtime": 4569.0897, | |
| "train_tokens_per_second": 10325.852 | |
| }, | |
| { | |
| "epoch": 0.5194471231115397, | |
| "grad_norm": 1.8764989376068115, | |
| "learning_rate": 9.702457956015525e-06, | |
| "loss": 1.0454, | |
| "num_input_tokens_seen": 47293760, | |
| "step": 404, | |
| "train_runtime": 4579.0502, | |
| "train_tokens_per_second": 10328.29 | |
| }, | |
| { | |
| "epoch": 0.5207328833172613, | |
| "grad_norm": 1.9220011234283447, | |
| "learning_rate": 9.676584734799484e-06, | |
| "loss": 1.1761, | |
| "num_input_tokens_seen": 47392832, | |
| "step": 405, | |
| "train_runtime": 4587.61, | |
| "train_tokens_per_second": 10330.615 | |
| }, | |
| { | |
| "epoch": 0.522018643522983, | |
| "grad_norm": 1.879625916481018, | |
| "learning_rate": 9.650711513583441e-06, | |
| "loss": 1.0923, | |
| "num_input_tokens_seen": 47487712, | |
| "step": 406, | |
| "train_runtime": 4595.7576, | |
| "train_tokens_per_second": 10332.945 | |
| }, | |
| { | |
| "epoch": 0.5233044037287046, | |
| "grad_norm": 1.839417815208435, | |
| "learning_rate": 9.624838292367402e-06, | |
| "loss": 1.1236, | |
| "num_input_tokens_seen": 47620096, | |
| "step": 407, | |
| "train_runtime": 4607.8581, | |
| "train_tokens_per_second": 10334.541 | |
| }, | |
| { | |
| "epoch": 0.5245901639344263, | |
| "grad_norm": 1.8451459407806396, | |
| "learning_rate": 9.598965071151359e-06, | |
| "loss": 1.0462, | |
| "num_input_tokens_seen": 47700000, | |
| "step": 408, | |
| "train_runtime": 4614.6366, | |
| "train_tokens_per_second": 10336.675 | |
| }, | |
| { | |
| "epoch": 0.5258759241401478, | |
| "grad_norm": 1.9718786478042603, | |
| "learning_rate": 9.573091849935318e-06, | |
| "loss": 0.9997, | |
| "num_input_tokens_seen": 47834944, | |
| "step": 409, | |
| "train_runtime": 4626.8909, | |
| "train_tokens_per_second": 10338.464 | |
| }, | |
| { | |
| "epoch": 0.5271616843458695, | |
| "grad_norm": 1.9811155796051025, | |
| "learning_rate": 9.547218628719275e-06, | |
| "loss": 1.0761, | |
| "num_input_tokens_seen": 47968160, | |
| "step": 410, | |
| "train_runtime": 4639.1336, | |
| "train_tokens_per_second": 10339.896 | |
| }, | |
| { | |
| "epoch": 0.5284474445515911, | |
| "grad_norm": 1.8997541666030884, | |
| "learning_rate": 9.521345407503236e-06, | |
| "loss": 1.027, | |
| "num_input_tokens_seen": 48059648, | |
| "step": 411, | |
| "train_runtime": 4646.969, | |
| "train_tokens_per_second": 10342.149 | |
| }, | |
| { | |
| "epoch": 0.5297332047573128, | |
| "grad_norm": 1.8173083066940308, | |
| "learning_rate": 9.495472186287193e-06, | |
| "loss": 1.1339, | |
| "num_input_tokens_seen": 48181504, | |
| "step": 412, | |
| "train_runtime": 4658.0106, | |
| "train_tokens_per_second": 10343.794 | |
| }, | |
| { | |
| "epoch": 0.5310189649630344, | |
| "grad_norm": 1.7731293439865112, | |
| "learning_rate": 9.469598965071152e-06, | |
| "loss": 0.9738, | |
| "num_input_tokens_seen": 48280416, | |
| "step": 413, | |
| "train_runtime": 4666.5826, | |
| "train_tokens_per_second": 10345.99 | |
| }, | |
| { | |
| "epoch": 0.532304725168756, | |
| "grad_norm": 1.9140669107437134, | |
| "learning_rate": 9.443725743855111e-06, | |
| "loss": 1.0163, | |
| "num_input_tokens_seen": 48409600, | |
| "step": 414, | |
| "train_runtime": 4678.3897, | |
| "train_tokens_per_second": 10347.492 | |
| }, | |
| { | |
| "epoch": 0.5335904853744776, | |
| "grad_norm": 1.872811198234558, | |
| "learning_rate": 9.41785252263907e-06, | |
| "loss": 0.9948, | |
| "num_input_tokens_seen": 48530944, | |
| "step": 415, | |
| "train_runtime": 4689.1516, | |
| "train_tokens_per_second": 10349.622 | |
| }, | |
| { | |
| "epoch": 0.5348762455801993, | |
| "grad_norm": 1.7188026905059814, | |
| "learning_rate": 9.391979301423027e-06, | |
| "loss": 1.0364, | |
| "num_input_tokens_seen": 48621344, | |
| "step": 416, | |
| "train_runtime": 4696.9538, | |
| "train_tokens_per_second": 10351.676 | |
| }, | |
| { | |
| "epoch": 0.5361620057859209, | |
| "grad_norm": 1.9433099031448364, | |
| "learning_rate": 9.366106080206988e-06, | |
| "loss": 1.0985, | |
| "num_input_tokens_seen": 48730336, | |
| "step": 417, | |
| "train_runtime": 4706.5206, | |
| "train_tokens_per_second": 10353.792 | |
| }, | |
| { | |
| "epoch": 0.5374477659916426, | |
| "grad_norm": 1.8120436668395996, | |
| "learning_rate": 9.340232858990945e-06, | |
| "loss": 1.0375, | |
| "num_input_tokens_seen": 48876416, | |
| "step": 418, | |
| "train_runtime": 4720.1751, | |
| "train_tokens_per_second": 10354.789 | |
| }, | |
| { | |
| "epoch": 0.5387335261973641, | |
| "grad_norm": 1.8917372226715088, | |
| "learning_rate": 9.314359637774904e-06, | |
| "loss": 1.0179, | |
| "num_input_tokens_seen": 48968384, | |
| "step": 419, | |
| "train_runtime": 4728.029, | |
| "train_tokens_per_second": 10357.04 | |
| }, | |
| { | |
| "epoch": 0.5400192864030858, | |
| "grad_norm": 1.9676231145858765, | |
| "learning_rate": 9.288486416558863e-06, | |
| "loss": 1.0241, | |
| "num_input_tokens_seen": 49076928, | |
| "step": 420, | |
| "train_runtime": 4737.4729, | |
| "train_tokens_per_second": 10359.305 | |
| }, | |
| { | |
| "epoch": 0.5413050466088074, | |
| "grad_norm": 1.799108862876892, | |
| "learning_rate": 9.262613195342822e-06, | |
| "loss": 1.1027, | |
| "num_input_tokens_seen": 49202080, | |
| "step": 421, | |
| "train_runtime": 4765.3676, | |
| "train_tokens_per_second": 10324.928 | |
| }, | |
| { | |
| "epoch": 0.5425908068145291, | |
| "grad_norm": 1.6937819719314575, | |
| "learning_rate": 9.23673997412678e-06, | |
| "loss": 1.0448, | |
| "num_input_tokens_seen": 49279744, | |
| "step": 422, | |
| "train_runtime": 4772.0012, | |
| "train_tokens_per_second": 10326.851 | |
| }, | |
| { | |
| "epoch": 0.5438765670202508, | |
| "grad_norm": 1.8214465379714966, | |
| "learning_rate": 9.210866752910738e-06, | |
| "loss": 1.0483, | |
| "num_input_tokens_seen": 49426304, | |
| "step": 423, | |
| "train_runtime": 4785.0768, | |
| "train_tokens_per_second": 10329.26 | |
| }, | |
| { | |
| "epoch": 0.5451623272259724, | |
| "grad_norm": 2.017838954925537, | |
| "learning_rate": 9.184993531694697e-06, | |
| "loss": 1.0529, | |
| "num_input_tokens_seen": 49552544, | |
| "step": 424, | |
| "train_runtime": 4796.8995, | |
| "train_tokens_per_second": 10330.119 | |
| }, | |
| { | |
| "epoch": 0.546448087431694, | |
| "grad_norm": 1.8154163360595703, | |
| "learning_rate": 9.159120310478656e-06, | |
| "loss": 1.0638, | |
| "num_input_tokens_seen": 49681152, | |
| "step": 425, | |
| "train_runtime": 4808.5011, | |
| "train_tokens_per_second": 10331.941 | |
| }, | |
| { | |
| "epoch": 0.5477338476374156, | |
| "grad_norm": 2.039503574371338, | |
| "learning_rate": 9.133247089262613e-06, | |
| "loss": 1.1204, | |
| "num_input_tokens_seen": 49810272, | |
| "step": 426, | |
| "train_runtime": 4820.4338, | |
| "train_tokens_per_second": 10333.151 | |
| }, | |
| { | |
| "epoch": 0.5490196078431373, | |
| "grad_norm": 1.8751721382141113, | |
| "learning_rate": 9.107373868046572e-06, | |
| "loss": 1.0905, | |
| "num_input_tokens_seen": 49931552, | |
| "step": 427, | |
| "train_runtime": 4831.6448, | |
| "train_tokens_per_second": 10334.276 | |
| }, | |
| { | |
| "epoch": 0.5503053680488589, | |
| "grad_norm": 1.9049893617630005, | |
| "learning_rate": 9.081500646830531e-06, | |
| "loss": 1.0296, | |
| "num_input_tokens_seen": 50054880, | |
| "step": 428, | |
| "train_runtime": 4842.7281, | |
| "train_tokens_per_second": 10336.091 | |
| }, | |
| { | |
| "epoch": 0.5515911282545806, | |
| "grad_norm": 1.743492603302002, | |
| "learning_rate": 9.055627425614489e-06, | |
| "loss": 1.0613, | |
| "num_input_tokens_seen": 50135776, | |
| "step": 429, | |
| "train_runtime": 4849.6827, | |
| "train_tokens_per_second": 10337.95 | |
| }, | |
| { | |
| "epoch": 0.5528768884603021, | |
| "grad_norm": 1.752612590789795, | |
| "learning_rate": 9.02975420439845e-06, | |
| "loss": 1.0087, | |
| "num_input_tokens_seen": 50233920, | |
| "step": 430, | |
| "train_runtime": 4858.229, | |
| "train_tokens_per_second": 10339.965 | |
| }, | |
| { | |
| "epoch": 0.5541626486660238, | |
| "grad_norm": 1.793007493019104, | |
| "learning_rate": 9.003880983182406e-06, | |
| "loss": 1.0386, | |
| "num_input_tokens_seen": 50364480, | |
| "step": 431, | |
| "train_runtime": 4870.2509, | |
| "train_tokens_per_second": 10341.249 | |
| }, | |
| { | |
| "epoch": 0.5554484088717454, | |
| "grad_norm": 1.8837916851043701, | |
| "learning_rate": 8.978007761966365e-06, | |
| "loss": 1.0343, | |
| "num_input_tokens_seen": 50477568, | |
| "step": 432, | |
| "train_runtime": 4880.2122, | |
| "train_tokens_per_second": 10343.314 | |
| }, | |
| { | |
| "epoch": 0.5567341690774671, | |
| "grad_norm": 1.8399786949157715, | |
| "learning_rate": 8.952134540750324e-06, | |
| "loss": 1.0474, | |
| "num_input_tokens_seen": 50587904, | |
| "step": 433, | |
| "train_runtime": 4889.8391, | |
| "train_tokens_per_second": 10345.515 | |
| }, | |
| { | |
| "epoch": 0.5580199292831887, | |
| "grad_norm": 1.9835869073867798, | |
| "learning_rate": 8.926261319534283e-06, | |
| "loss": 1.0986, | |
| "num_input_tokens_seen": 50748288, | |
| "step": 434, | |
| "train_runtime": 4904.8056, | |
| "train_tokens_per_second": 10346.646 | |
| }, | |
| { | |
| "epoch": 0.5593056894889104, | |
| "grad_norm": 2.022273540496826, | |
| "learning_rate": 8.90038809831824e-06, | |
| "loss": 1.078, | |
| "num_input_tokens_seen": 50829376, | |
| "step": 435, | |
| "train_runtime": 4911.6238, | |
| "train_tokens_per_second": 10348.793 | |
| }, | |
| { | |
| "epoch": 0.5605914496946319, | |
| "grad_norm": 1.9517446756362915, | |
| "learning_rate": 8.874514877102201e-06, | |
| "loss": 1.0425, | |
| "num_input_tokens_seen": 50990240, | |
| "step": 436, | |
| "train_runtime": 4927.2726, | |
| "train_tokens_per_second": 10348.573 | |
| }, | |
| { | |
| "epoch": 0.5618772099003536, | |
| "grad_norm": 1.8184734582901, | |
| "learning_rate": 8.848641655886159e-06, | |
| "loss": 1.201, | |
| "num_input_tokens_seen": 51092736, | |
| "step": 437, | |
| "train_runtime": 4936.1299, | |
| "train_tokens_per_second": 10350.768 | |
| }, | |
| { | |
| "epoch": 0.5631629701060752, | |
| "grad_norm": 1.876457929611206, | |
| "learning_rate": 8.822768434670118e-06, | |
| "loss": 1.0678, | |
| "num_input_tokens_seen": 51179680, | |
| "step": 438, | |
| "train_runtime": 4943.6088, | |
| "train_tokens_per_second": 10352.696 | |
| }, | |
| { | |
| "epoch": 0.5644487303117969, | |
| "grad_norm": 1.8654677867889404, | |
| "learning_rate": 8.796895213454075e-06, | |
| "loss": 1.0735, | |
| "num_input_tokens_seen": 51292160, | |
| "step": 439, | |
| "train_runtime": 4953.7338, | |
| "train_tokens_per_second": 10354.242 | |
| }, | |
| { | |
| "epoch": 0.5657344905175185, | |
| "grad_norm": 1.7864034175872803, | |
| "learning_rate": 8.771021992238035e-06, | |
| "loss": 1.0005, | |
| "num_input_tokens_seen": 51402400, | |
| "step": 440, | |
| "train_runtime": 4963.8198, | |
| "train_tokens_per_second": 10355.412 | |
| }, | |
| { | |
| "epoch": 0.5670202507232401, | |
| "grad_norm": 1.8480334281921387, | |
| "learning_rate": 8.745148771021993e-06, | |
| "loss": 1.146, | |
| "num_input_tokens_seen": 51503840, | |
| "step": 441, | |
| "train_runtime": 4972.6909, | |
| "train_tokens_per_second": 10357.338 | |
| }, | |
| { | |
| "epoch": 0.5683060109289617, | |
| "grad_norm": 1.8786932229995728, | |
| "learning_rate": 8.719275549805952e-06, | |
| "loss": 1.032, | |
| "num_input_tokens_seen": 51625920, | |
| "step": 442, | |
| "train_runtime": 4983.5486, | |
| "train_tokens_per_second": 10359.269 | |
| }, | |
| { | |
| "epoch": 0.5695917711346834, | |
| "grad_norm": 1.8805335760116577, | |
| "learning_rate": 8.69340232858991e-06, | |
| "loss": 1.0604, | |
| "num_input_tokens_seen": 51766848, | |
| "step": 443, | |
| "train_runtime": 4996.6032, | |
| "train_tokens_per_second": 10360.408 | |
| }, | |
| { | |
| "epoch": 0.570877531340405, | |
| "grad_norm": 2.044856548309326, | |
| "learning_rate": 8.66752910737387e-06, | |
| "loss": 1.0327, | |
| "num_input_tokens_seen": 51885568, | |
| "step": 444, | |
| "train_runtime": 5007.1763, | |
| "train_tokens_per_second": 10362.241 | |
| }, | |
| { | |
| "epoch": 0.5721632915461267, | |
| "grad_norm": 1.7294365167617798, | |
| "learning_rate": 8.641655886157827e-06, | |
| "loss": 1.0273, | |
| "num_input_tokens_seen": 51987968, | |
| "step": 445, | |
| "train_runtime": 5016.2418, | |
| "train_tokens_per_second": 10363.928 | |
| }, | |
| { | |
| "epoch": 0.5734490517518482, | |
| "grad_norm": 1.9049499034881592, | |
| "learning_rate": 8.615782664941786e-06, | |
| "loss": 1.0087, | |
| "num_input_tokens_seen": 52075232, | |
| "step": 446, | |
| "train_runtime": 5023.7352, | |
| "train_tokens_per_second": 10365.839 | |
| }, | |
| { | |
| "epoch": 0.5747348119575699, | |
| "grad_norm": 1.995016098022461, | |
| "learning_rate": 8.589909443725745e-06, | |
| "loss": 1.082, | |
| "num_input_tokens_seen": 52181120, | |
| "step": 447, | |
| "train_runtime": 5033.0217, | |
| "train_tokens_per_second": 10367.752 | |
| }, | |
| { | |
| "epoch": 0.5760205721632915, | |
| "grad_norm": 1.8061517477035522, | |
| "learning_rate": 8.564036222509704e-06, | |
| "loss": 1.0338, | |
| "num_input_tokens_seen": 52312864, | |
| "step": 448, | |
| "train_runtime": 5045.4751, | |
| "train_tokens_per_second": 10368.273 | |
| }, | |
| { | |
| "epoch": 0.5773063323690132, | |
| "grad_norm": 1.906706690788269, | |
| "learning_rate": 8.538163001293663e-06, | |
| "loss": 1.0313, | |
| "num_input_tokens_seen": 52492128, | |
| "step": 449, | |
| "train_runtime": 5062.8483, | |
| "train_tokens_per_second": 10368.102 | |
| }, | |
| { | |
| "epoch": 0.5785920925747348, | |
| "grad_norm": 1.9607821702957153, | |
| "learning_rate": 8.51228978007762e-06, | |
| "loss": 1.0598, | |
| "num_input_tokens_seen": 52580800, | |
| "step": 450, | |
| "train_runtime": 5070.3956, | |
| "train_tokens_per_second": 10370.157 | |
| }, | |
| { | |
| "epoch": 0.5798778527804564, | |
| "grad_norm": 1.8769546747207642, | |
| "learning_rate": 8.486416558861579e-06, | |
| "loss": 1.0721, | |
| "num_input_tokens_seen": 52715552, | |
| "step": 451, | |
| "train_runtime": 5099.7454, | |
| "train_tokens_per_second": 10336.899 | |
| }, | |
| { | |
| "epoch": 0.581163612986178, | |
| "grad_norm": 1.8132247924804688, | |
| "learning_rate": 8.460543337645536e-06, | |
| "loss": 1.0979, | |
| "num_input_tokens_seen": 52884896, | |
| "step": 452, | |
| "train_runtime": 5115.8206, | |
| "train_tokens_per_second": 10337.52 | |
| }, | |
| { | |
| "epoch": 0.5824493731918997, | |
| "grad_norm": 1.8635915517807007, | |
| "learning_rate": 8.434670116429497e-06, | |
| "loss": 1.0368, | |
| "num_input_tokens_seen": 53008224, | |
| "step": 453, | |
| "train_runtime": 5126.8881, | |
| "train_tokens_per_second": 10339.259 | |
| }, | |
| { | |
| "epoch": 0.5837351333976214, | |
| "grad_norm": 1.903838038444519, | |
| "learning_rate": 8.408796895213454e-06, | |
| "loss": 0.9926, | |
| "num_input_tokens_seen": 53141920, | |
| "step": 454, | |
| "train_runtime": 5138.9508, | |
| "train_tokens_per_second": 10341.006 | |
| }, | |
| { | |
| "epoch": 0.585020893603343, | |
| "grad_norm": 1.836340069770813, | |
| "learning_rate": 8.382923673997413e-06, | |
| "loss": 1.0946, | |
| "num_input_tokens_seen": 53272960, | |
| "step": 455, | |
| "train_runtime": 5150.7368, | |
| "train_tokens_per_second": 10342.784 | |
| }, | |
| { | |
| "epoch": 0.5863066538090647, | |
| "grad_norm": 1.8196651935577393, | |
| "learning_rate": 8.357050452781372e-06, | |
| "loss": 1.0399, | |
| "num_input_tokens_seen": 53416992, | |
| "step": 456, | |
| "train_runtime": 5163.847, | |
| "train_tokens_per_second": 10344.418 | |
| }, | |
| { | |
| "epoch": 0.5875924140147862, | |
| "grad_norm": 1.8723372220993042, | |
| "learning_rate": 8.331177231565331e-06, | |
| "loss": 1.1476, | |
| "num_input_tokens_seen": 53533632, | |
| "step": 457, | |
| "train_runtime": 5174.1711, | |
| "train_tokens_per_second": 10346.32 | |
| }, | |
| { | |
| "epoch": 0.5888781742205079, | |
| "grad_norm": 1.8454405069351196, | |
| "learning_rate": 8.305304010349288e-06, | |
| "loss": 1.031, | |
| "num_input_tokens_seen": 53631552, | |
| "step": 458, | |
| "train_runtime": 5182.534, | |
| "train_tokens_per_second": 10348.519 | |
| }, | |
| { | |
| "epoch": 0.5901639344262295, | |
| "grad_norm": 1.9296767711639404, | |
| "learning_rate": 8.279430789133249e-06, | |
| "loss": 1.036, | |
| "num_input_tokens_seen": 53754528, | |
| "step": 459, | |
| "train_runtime": 5193.4642, | |
| "train_tokens_per_second": 10350.419 | |
| }, | |
| { | |
| "epoch": 0.5914496946319512, | |
| "grad_norm": 1.8463411331176758, | |
| "learning_rate": 8.253557567917206e-06, | |
| "loss": 0.9773, | |
| "num_input_tokens_seen": 53828992, | |
| "step": 460, | |
| "train_runtime": 5199.7389, | |
| "train_tokens_per_second": 10352.249 | |
| }, | |
| { | |
| "epoch": 0.5927354548376728, | |
| "grad_norm": 1.9723373651504517, | |
| "learning_rate": 8.227684346701165e-06, | |
| "loss": 1.1172, | |
| "num_input_tokens_seen": 54010208, | |
| "step": 461, | |
| "train_runtime": 5217.2951, | |
| "train_tokens_per_second": 10352.147 | |
| }, | |
| { | |
| "epoch": 0.5940212150433944, | |
| "grad_norm": 1.9189200401306152, | |
| "learning_rate": 8.201811125485124e-06, | |
| "loss": 1.0317, | |
| "num_input_tokens_seen": 54134656, | |
| "step": 462, | |
| "train_runtime": 5228.207, | |
| "train_tokens_per_second": 10354.344 | |
| }, | |
| { | |
| "epoch": 0.595306975249116, | |
| "grad_norm": 1.6208829879760742, | |
| "learning_rate": 8.175937904269083e-06, | |
| "loss": 0.9256, | |
| "num_input_tokens_seen": 54268224, | |
| "step": 463, | |
| "train_runtime": 5240.6612, | |
| "train_tokens_per_second": 10355.225 | |
| }, | |
| { | |
| "epoch": 0.5965927354548377, | |
| "grad_norm": 1.9756633043289185, | |
| "learning_rate": 8.15006468305304e-06, | |
| "loss": 1.0466, | |
| "num_input_tokens_seen": 54384544, | |
| "step": 464, | |
| "train_runtime": 5251.3101, | |
| "train_tokens_per_second": 10356.376 | |
| }, | |
| { | |
| "epoch": 0.5978784956605593, | |
| "grad_norm": 1.8915356397628784, | |
| "learning_rate": 8.124191461837e-06, | |
| "loss": 1.0826, | |
| "num_input_tokens_seen": 54546208, | |
| "step": 465, | |
| "train_runtime": 5266.7741, | |
| "train_tokens_per_second": 10356.664 | |
| }, | |
| { | |
| "epoch": 0.599164255866281, | |
| "grad_norm": 1.9341920614242554, | |
| "learning_rate": 8.098318240620958e-06, | |
| "loss": 1.0257, | |
| "num_input_tokens_seen": 54644864, | |
| "step": 466, | |
| "train_runtime": 5275.3751, | |
| "train_tokens_per_second": 10358.479 | |
| }, | |
| { | |
| "epoch": 0.6004500160720025, | |
| "grad_norm": 1.772900104522705, | |
| "learning_rate": 8.072445019404917e-06, | |
| "loss": 1.0155, | |
| "num_input_tokens_seen": 54775808, | |
| "step": 467, | |
| "train_runtime": 5287.3482, | |
| "train_tokens_per_second": 10359.788 | |
| }, | |
| { | |
| "epoch": 0.6017357762777242, | |
| "grad_norm": 1.8051958084106445, | |
| "learning_rate": 8.046571798188875e-06, | |
| "loss": 1.0296, | |
| "num_input_tokens_seen": 54865024, | |
| "step": 468, | |
| "train_runtime": 5294.9344, | |
| "train_tokens_per_second": 10361.795 | |
| }, | |
| { | |
| "epoch": 0.6017357762777242, | |
| "eval_loss": 1.104156732559204, | |
| "eval_runtime": 22.4988, | |
| "eval_samples_per_second": 44.18, | |
| "eval_steps_per_second": 1.422, | |
| "num_input_tokens_seen": 54865024, | |
| "step": 468 | |
| }, | |
| { | |
| "epoch": 0.6030215364834458, | |
| "grad_norm": 1.9409384727478027, | |
| "learning_rate": 8.020698576972833e-06, | |
| "loss": 1.0859, | |
| "num_input_tokens_seen": 55004192, | |
| "step": 469, | |
| "train_runtime": 5330.358, | |
| "train_tokens_per_second": 10319.043 | |
| }, | |
| { | |
| "epoch": 0.6043072966891675, | |
| "grad_norm": 1.7463427782058716, | |
| "learning_rate": 7.994825355756792e-06, | |
| "loss": 1.0851, | |
| "num_input_tokens_seen": 55115104, | |
| "step": 470, | |
| "train_runtime": 5340.0483, | |
| "train_tokens_per_second": 10321.087 | |
| }, | |
| { | |
| "epoch": 0.6055930568948891, | |
| "grad_norm": 1.958573579788208, | |
| "learning_rate": 7.96895213454075e-06, | |
| "loss": 1.0175, | |
| "num_input_tokens_seen": 55232576, | |
| "step": 471, | |
| "train_runtime": 5350.618, | |
| "train_tokens_per_second": 10322.654 | |
| }, | |
| { | |
| "epoch": 0.6068788171006108, | |
| "grad_norm": 1.8370342254638672, | |
| "learning_rate": 7.94307891332471e-06, | |
| "loss": 1.0919, | |
| "num_input_tokens_seen": 55327584, | |
| "step": 472, | |
| "train_runtime": 5358.7331, | |
| "train_tokens_per_second": 10324.751 | |
| }, | |
| { | |
| "epoch": 0.6081645773063323, | |
| "grad_norm": 1.8849748373031616, | |
| "learning_rate": 7.917205692108668e-06, | |
| "loss": 1.061, | |
| "num_input_tokens_seen": 55460224, | |
| "step": 473, | |
| "train_runtime": 5371.0369, | |
| "train_tokens_per_second": 10325.795 | |
| }, | |
| { | |
| "epoch": 0.609450337512054, | |
| "grad_norm": 1.8478233814239502, | |
| "learning_rate": 7.891332470892627e-06, | |
| "loss": 1.0702, | |
| "num_input_tokens_seen": 55603200, | |
| "step": 474, | |
| "train_runtime": 5384.0612, | |
| "train_tokens_per_second": 10327.371 | |
| }, | |
| { | |
| "epoch": 0.6107360977177756, | |
| "grad_norm": 1.7144081592559814, | |
| "learning_rate": 7.865459249676586e-06, | |
| "loss": 1.0623, | |
| "num_input_tokens_seen": 55715008, | |
| "step": 475, | |
| "train_runtime": 5393.8386, | |
| "train_tokens_per_second": 10329.38 | |
| }, | |
| { | |
| "epoch": 0.6120218579234973, | |
| "grad_norm": 1.895750641822815, | |
| "learning_rate": 7.839586028460545e-06, | |
| "loss": 1.0541, | |
| "num_input_tokens_seen": 55814400, | |
| "step": 476, | |
| "train_runtime": 5402.4312, | |
| "train_tokens_per_second": 10331.349 | |
| }, | |
| { | |
| "epoch": 0.6133076181292189, | |
| "grad_norm": 1.997480034828186, | |
| "learning_rate": 7.813712807244502e-06, | |
| "loss": 1.1358, | |
| "num_input_tokens_seen": 55905248, | |
| "step": 477, | |
| "train_runtime": 5410.2074, | |
| "train_tokens_per_second": 10333.291 | |
| }, | |
| { | |
| "epoch": 0.6145933783349405, | |
| "grad_norm": 1.9574437141418457, | |
| "learning_rate": 7.787839586028462e-06, | |
| "loss": 1.0872, | |
| "num_input_tokens_seen": 55996224, | |
| "step": 478, | |
| "train_runtime": 5418.1887, | |
| "train_tokens_per_second": 10334.86 | |
| }, | |
| { | |
| "epoch": 0.6158791385406621, | |
| "grad_norm": 1.738667607307434, | |
| "learning_rate": 7.76196636481242e-06, | |
| "loss": 1.0266, | |
| "num_input_tokens_seen": 56089024, | |
| "step": 479, | |
| "train_runtime": 5426.2457, | |
| "train_tokens_per_second": 10336.617 | |
| }, | |
| { | |
| "epoch": 0.6171648987463838, | |
| "grad_norm": 1.8634562492370605, | |
| "learning_rate": 7.736093143596379e-06, | |
| "loss": 1.1175, | |
| "num_input_tokens_seen": 56203232, | |
| "step": 480, | |
| "train_runtime": 5436.2029, | |
| "train_tokens_per_second": 10338.693 | |
| }, | |
| { | |
| "epoch": 0.6184506589521054, | |
| "grad_norm": 1.8316950798034668, | |
| "learning_rate": 7.710219922380336e-06, | |
| "loss": 0.9945, | |
| "num_input_tokens_seen": 56293504, | |
| "step": 481, | |
| "train_runtime": 5460.5999, | |
| "train_tokens_per_second": 10309.033 | |
| }, | |
| { | |
| "epoch": 0.6197364191578271, | |
| "grad_norm": 1.9369782209396362, | |
| "learning_rate": 7.684346701164297e-06, | |
| "loss": 1.082, | |
| "num_input_tokens_seen": 56402752, | |
| "step": 482, | |
| "train_runtime": 5470.187, | |
| "train_tokens_per_second": 10310.937 | |
| }, | |
| { | |
| "epoch": 0.6210221793635486, | |
| "grad_norm": 1.7741248607635498, | |
| "learning_rate": 7.658473479948254e-06, | |
| "loss": 1.0357, | |
| "num_input_tokens_seen": 56505376, | |
| "step": 483, | |
| "train_runtime": 5479.036, | |
| "train_tokens_per_second": 10313.014 | |
| }, | |
| { | |
| "epoch": 0.6223079395692703, | |
| "grad_norm": 1.9275310039520264, | |
| "learning_rate": 7.632600258732213e-06, | |
| "loss": 1.0627, | |
| "num_input_tokens_seen": 56607264, | |
| "step": 484, | |
| "train_runtime": 5487.9536, | |
| "train_tokens_per_second": 10314.822 | |
| }, | |
| { | |
| "epoch": 0.623593699774992, | |
| "grad_norm": 1.8197015523910522, | |
| "learning_rate": 7.606727037516172e-06, | |
| "loss": 0.966, | |
| "num_input_tokens_seen": 56736576, | |
| "step": 485, | |
| "train_runtime": 5500.0845, | |
| "train_tokens_per_second": 10315.583 | |
| }, | |
| { | |
| "epoch": 0.6248794599807136, | |
| "grad_norm": 1.7420237064361572, | |
| "learning_rate": 7.58085381630013e-06, | |
| "loss": 1.0898, | |
| "num_input_tokens_seen": 56832608, | |
| "step": 486, | |
| "train_runtime": 5508.3187, | |
| "train_tokens_per_second": 10317.596 | |
| }, | |
| { | |
| "epoch": 0.6261652201864353, | |
| "grad_norm": 1.7904372215270996, | |
| "learning_rate": 7.554980595084088e-06, | |
| "loss": 0.9849, | |
| "num_input_tokens_seen": 56918528, | |
| "step": 487, | |
| "train_runtime": 5515.7042, | |
| "train_tokens_per_second": 10319.358 | |
| }, | |
| { | |
| "epoch": 0.6274509803921569, | |
| "grad_norm": 1.901534914970398, | |
| "learning_rate": 7.529107373868048e-06, | |
| "loss": 1.0978, | |
| "num_input_tokens_seen": 57060512, | |
| "step": 488, | |
| "train_runtime": 5528.8699, | |
| "train_tokens_per_second": 10320.466 | |
| }, | |
| { | |
| "epoch": 0.6287367405978785, | |
| "grad_norm": 1.8489160537719727, | |
| "learning_rate": 7.503234152652006e-06, | |
| "loss": 1.0536, | |
| "num_input_tokens_seen": 57153408, | |
| "step": 489, | |
| "train_runtime": 5536.9185, | |
| "train_tokens_per_second": 10322.241 | |
| }, | |
| { | |
| "epoch": 0.6300225008036001, | |
| "grad_norm": 1.8837651014328003, | |
| "learning_rate": 7.477360931435964e-06, | |
| "loss": 1.0979, | |
| "num_input_tokens_seen": 57244704, | |
| "step": 490, | |
| "train_runtime": 5544.8307, | |
| "train_tokens_per_second": 10323.977 | |
| }, | |
| { | |
| "epoch": 0.6313082610093218, | |
| "grad_norm": 1.9377018213272095, | |
| "learning_rate": 7.451487710219923e-06, | |
| "loss": 0.9867, | |
| "num_input_tokens_seen": 57382048, | |
| "step": 491, | |
| "train_runtime": 5557.3194, | |
| "train_tokens_per_second": 10325.49 | |
| }, | |
| { | |
| "epoch": 0.6325940212150434, | |
| "grad_norm": 1.971827507019043, | |
| "learning_rate": 7.425614489003882e-06, | |
| "loss": 1.1096, | |
| "num_input_tokens_seen": 57526912, | |
| "step": 492, | |
| "train_runtime": 5570.7926, | |
| "train_tokens_per_second": 10326.522 | |
| }, | |
| { | |
| "epoch": 0.6338797814207651, | |
| "grad_norm": 1.8177952766418457, | |
| "learning_rate": 7.39974126778784e-06, | |
| "loss": 1.0804, | |
| "num_input_tokens_seen": 57651648, | |
| "step": 493, | |
| "train_runtime": 5582.2541, | |
| "train_tokens_per_second": 10327.665 | |
| }, | |
| { | |
| "epoch": 0.6351655416264866, | |
| "grad_norm": 1.9560736417770386, | |
| "learning_rate": 7.373868046571799e-06, | |
| "loss": 1.0818, | |
| "num_input_tokens_seen": 57742848, | |
| "step": 494, | |
| "train_runtime": 5590.0563, | |
| "train_tokens_per_second": 10329.565 | |
| }, | |
| { | |
| "epoch": 0.6364513018322083, | |
| "grad_norm": 2.095134735107422, | |
| "learning_rate": 7.347994825355757e-06, | |
| "loss": 1.051, | |
| "num_input_tokens_seen": 57848384, | |
| "step": 495, | |
| "train_runtime": 5599.5099, | |
| "train_tokens_per_second": 10330.973 | |
| }, | |
| { | |
| "epoch": 0.6377370620379299, | |
| "grad_norm": 2.0076119899749756, | |
| "learning_rate": 7.322121604139716e-06, | |
| "loss": 1.1306, | |
| "num_input_tokens_seen": 57996032, | |
| "step": 496, | |
| "train_runtime": 5613.6125, | |
| "train_tokens_per_second": 10331.321 | |
| }, | |
| { | |
| "epoch": 0.6390228222436516, | |
| "grad_norm": 1.7557566165924072, | |
| "learning_rate": 7.296248382923674e-06, | |
| "loss": 0.9975, | |
| "num_input_tokens_seen": 58088800, | |
| "step": 497, | |
| "train_runtime": 5621.5772, | |
| "train_tokens_per_second": 10333.185 | |
| }, | |
| { | |
| "epoch": 0.6403085824493732, | |
| "grad_norm": 1.983188271522522, | |
| "learning_rate": 7.270375161707633e-06, | |
| "loss": 0.9731, | |
| "num_input_tokens_seen": 58211040, | |
| "step": 498, | |
| "train_runtime": 5632.8912, | |
| "train_tokens_per_second": 10334.132 | |
| }, | |
| { | |
| "epoch": 0.6415943426550949, | |
| "grad_norm": 1.955208659172058, | |
| "learning_rate": 7.244501940491591e-06, | |
| "loss": 1.0637, | |
| "num_input_tokens_seen": 58334432, | |
| "step": 499, | |
| "train_runtime": 5644.1895, | |
| "train_tokens_per_second": 10335.307 | |
| }, | |
| { | |
| "epoch": 0.6428801028608164, | |
| "grad_norm": 1.839125156402588, | |
| "learning_rate": 7.21862871927555e-06, | |
| "loss": 1.0653, | |
| "num_input_tokens_seen": 58444576, | |
| "step": 500, | |
| "train_runtime": 5653.6395, | |
| "train_tokens_per_second": 10337.514 | |
| }, | |
| { | |
| "epoch": 0.6441658630665381, | |
| "grad_norm": 1.8079696893692017, | |
| "learning_rate": 7.192755498059509e-06, | |
| "loss": 1.0928, | |
| "num_input_tokens_seen": 58603360, | |
| "step": 501, | |
| "train_runtime": 5668.8043, | |
| "train_tokens_per_second": 10337.87 | |
| }, | |
| { | |
| "epoch": 0.6454516232722597, | |
| "grad_norm": 1.7496858835220337, | |
| "learning_rate": 7.166882276843467e-06, | |
| "loss": 0.9713, | |
| "num_input_tokens_seen": 58771264, | |
| "step": 502, | |
| "train_runtime": 5684.7051, | |
| "train_tokens_per_second": 10338.49 | |
| }, | |
| { | |
| "epoch": 0.6467373834779814, | |
| "grad_norm": 2.015773057937622, | |
| "learning_rate": 7.1410090556274255e-06, | |
| "loss": 1.0992, | |
| "num_input_tokens_seen": 58931392, | |
| "step": 503, | |
| "train_runtime": 5699.5505, | |
| "train_tokens_per_second": 10339.656 | |
| }, | |
| { | |
| "epoch": 0.648023143683703, | |
| "grad_norm": 1.7812045812606812, | |
| "learning_rate": 7.115135834411385e-06, | |
| "loss": 1.0177, | |
| "num_input_tokens_seen": 59031904, | |
| "step": 504, | |
| "train_runtime": 5708.5567, | |
| "train_tokens_per_second": 10340.951 | |
| }, | |
| { | |
| "epoch": 0.6493089038894246, | |
| "grad_norm": 2.226012945175171, | |
| "learning_rate": 7.089262613195343e-06, | |
| "loss": 1.0775, | |
| "num_input_tokens_seen": 59170880, | |
| "step": 505, | |
| "train_runtime": 5721.3851, | |
| "train_tokens_per_second": 10342.055 | |
| }, | |
| { | |
| "epoch": 0.6505946640951462, | |
| "grad_norm": 1.7196251153945923, | |
| "learning_rate": 7.0633893919793015e-06, | |
| "loss": 1.0867, | |
| "num_input_tokens_seen": 59305920, | |
| "step": 506, | |
| "train_runtime": 5733.791, | |
| "train_tokens_per_second": 10343.23 | |
| }, | |
| { | |
| "epoch": 0.6518804243008679, | |
| "grad_norm": 2.0985634326934814, | |
| "learning_rate": 7.037516170763261e-06, | |
| "loss": 1.0544, | |
| "num_input_tokens_seen": 59429280, | |
| "step": 507, | |
| "train_runtime": 5744.9517, | |
| "train_tokens_per_second": 10344.609 | |
| }, | |
| { | |
| "epoch": 0.6531661845065895, | |
| "grad_norm": 1.983805775642395, | |
| "learning_rate": 7.0116429495472195e-06, | |
| "loss": 0.9989, | |
| "num_input_tokens_seen": 59511424, | |
| "step": 508, | |
| "train_runtime": 5751.8269, | |
| "train_tokens_per_second": 10346.525 | |
| }, | |
| { | |
| "epoch": 0.6544519447123112, | |
| "grad_norm": 1.8357391357421875, | |
| "learning_rate": 6.985769728331178e-06, | |
| "loss": 1.0282, | |
| "num_input_tokens_seen": 59629280, | |
| "step": 509, | |
| "train_runtime": 5762.4785, | |
| "train_tokens_per_second": 10347.853 | |
| }, | |
| { | |
| "epoch": 0.6557377049180327, | |
| "grad_norm": 1.8154447078704834, | |
| "learning_rate": 6.959896507115136e-06, | |
| "loss": 1.0676, | |
| "num_input_tokens_seen": 59728704, | |
| "step": 510, | |
| "train_runtime": 5771.0809, | |
| "train_tokens_per_second": 10349.656 | |
| }, | |
| { | |
| "epoch": 0.6570234651237544, | |
| "grad_norm": 1.966147541999817, | |
| "learning_rate": 6.9340232858990955e-06, | |
| "loss": 1.1222, | |
| "num_input_tokens_seen": 59858304, | |
| "step": 511, | |
| "train_runtime": 5799.4165, | |
| "train_tokens_per_second": 10321.436 | |
| }, | |
| { | |
| "epoch": 0.658309225329476, | |
| "grad_norm": 1.942854404449463, | |
| "learning_rate": 6.908150064683054e-06, | |
| "loss": 1.1369, | |
| "num_input_tokens_seen": 59962496, | |
| "step": 512, | |
| "train_runtime": 5808.3201, | |
| "train_tokens_per_second": 10323.552 | |
| }, | |
| { | |
| "epoch": 0.6595949855351977, | |
| "grad_norm": 2.0717549324035645, | |
| "learning_rate": 6.882276843467012e-06, | |
| "loss": 1.0623, | |
| "num_input_tokens_seen": 60104320, | |
| "step": 513, | |
| "train_runtime": 5821.4241, | |
| "train_tokens_per_second": 10324.676 | |
| }, | |
| { | |
| "epoch": 0.6608807457409194, | |
| "grad_norm": 2.0552477836608887, | |
| "learning_rate": 6.856403622250971e-06, | |
| "loss": 1.079, | |
| "num_input_tokens_seen": 60239488, | |
| "step": 514, | |
| "train_runtime": 5833.6761, | |
| "train_tokens_per_second": 10326.163 | |
| }, | |
| { | |
| "epoch": 0.662166505946641, | |
| "grad_norm": 1.8785006999969482, | |
| "learning_rate": 6.83053040103493e-06, | |
| "loss": 1.0287, | |
| "num_input_tokens_seen": 60372960, | |
| "step": 515, | |
| "train_runtime": 5846.0146, | |
| "train_tokens_per_second": 10327.2 | |
| }, | |
| { | |
| "epoch": 0.6634522661523626, | |
| "grad_norm": 2.1240034103393555, | |
| "learning_rate": 6.804657179818888e-06, | |
| "loss": 1.093, | |
| "num_input_tokens_seen": 60524480, | |
| "step": 516, | |
| "train_runtime": 5860.475, | |
| "train_tokens_per_second": 10327.572 | |
| }, | |
| { | |
| "epoch": 0.6647380263580842, | |
| "grad_norm": 1.815077304840088, | |
| "learning_rate": 6.778783958602847e-06, | |
| "loss": 1.0346, | |
| "num_input_tokens_seen": 60655744, | |
| "step": 517, | |
| "train_runtime": 5872.4212, | |
| "train_tokens_per_second": 10328.916 | |
| }, | |
| { | |
| "epoch": 0.6660237865638059, | |
| "grad_norm": 1.8126624822616577, | |
| "learning_rate": 6.752910737386805e-06, | |
| "loss": 1.0734, | |
| "num_input_tokens_seen": 60770176, | |
| "step": 518, | |
| "train_runtime": 5882.5093, | |
| "train_tokens_per_second": 10330.655 | |
| }, | |
| { | |
| "epoch": 0.6673095467695275, | |
| "grad_norm": 1.7896870374679565, | |
| "learning_rate": 6.727037516170764e-06, | |
| "loss": 1.0592, | |
| "num_input_tokens_seen": 60889088, | |
| "step": 519, | |
| "train_runtime": 5892.9745, | |
| "train_tokens_per_second": 10332.488 | |
| }, | |
| { | |
| "epoch": 0.6685953069752492, | |
| "grad_norm": 1.8001877069473267, | |
| "learning_rate": 6.701164294954723e-06, | |
| "loss": 0.9968, | |
| "num_input_tokens_seen": 61065792, | |
| "step": 520, | |
| "train_runtime": 5909.8573, | |
| "train_tokens_per_second": 10332.871 | |
| }, | |
| { | |
| "epoch": 0.6698810671809707, | |
| "grad_norm": 1.8801597356796265, | |
| "learning_rate": 6.675291073738681e-06, | |
| "loss": 1.0645, | |
| "num_input_tokens_seen": 61235808, | |
| "step": 521, | |
| "train_runtime": 5926.3712, | |
| "train_tokens_per_second": 10332.766 | |
| }, | |
| { | |
| "epoch": 0.6711668273866924, | |
| "grad_norm": 1.8804895877838135, | |
| "learning_rate": 6.649417852522639e-06, | |
| "loss": 1.0528, | |
| "num_input_tokens_seen": 61393632, | |
| "step": 522, | |
| "train_runtime": 5940.9242, | |
| "train_tokens_per_second": 10334.02 | |
| }, | |
| { | |
| "epoch": 0.672452587592414, | |
| "grad_norm": 1.9801836013793945, | |
| "learning_rate": 6.623544631306599e-06, | |
| "loss": 1.1185, | |
| "num_input_tokens_seen": 61529632, | |
| "step": 523, | |
| "train_runtime": 5953.2464, | |
| "train_tokens_per_second": 10335.475 | |
| }, | |
| { | |
| "epoch": 0.6737383477981357, | |
| "grad_norm": 1.8925362825393677, | |
| "learning_rate": 6.597671410090557e-06, | |
| "loss": 1.1512, | |
| "num_input_tokens_seen": 61631840, | |
| "step": 524, | |
| "train_runtime": 5962.0027, | |
| "train_tokens_per_second": 10337.439 | |
| }, | |
| { | |
| "epoch": 0.6750241080038573, | |
| "grad_norm": 1.7096664905548096, | |
| "learning_rate": 6.571798188874515e-06, | |
| "loss": 1.0007, | |
| "num_input_tokens_seen": 61719392, | |
| "step": 525, | |
| "train_runtime": 5969.4912, | |
| "train_tokens_per_second": 10339.138 | |
| }, | |
| { | |
| "epoch": 0.676309868209579, | |
| "grad_norm": 1.7562854290008545, | |
| "learning_rate": 6.545924967658473e-06, | |
| "loss": 0.9808, | |
| "num_input_tokens_seen": 61904448, | |
| "step": 526, | |
| "train_runtime": 5987.4689, | |
| "train_tokens_per_second": 10339.001 | |
| }, | |
| { | |
| "epoch": 0.6775956284153005, | |
| "grad_norm": 1.9827765226364136, | |
| "learning_rate": 6.520051746442433e-06, | |
| "loss": 1.0306, | |
| "num_input_tokens_seen": 62045888, | |
| "step": 527, | |
| "train_runtime": 6000.3698, | |
| "train_tokens_per_second": 10340.344 | |
| }, | |
| { | |
| "epoch": 0.6788813886210222, | |
| "grad_norm": 1.9799909591674805, | |
| "learning_rate": 6.494178525226391e-06, | |
| "loss": 0.9475, | |
| "num_input_tokens_seen": 62144736, | |
| "step": 528, | |
| "train_runtime": 6008.9407, | |
| "train_tokens_per_second": 10342.045 | |
| }, | |
| { | |
| "epoch": 0.6801671488267438, | |
| "grad_norm": 1.928503155708313, | |
| "learning_rate": 6.468305304010349e-06, | |
| "loss": 0.973, | |
| "num_input_tokens_seen": 62266400, | |
| "step": 529, | |
| "train_runtime": 6019.7454, | |
| "train_tokens_per_second": 10343.693 | |
| }, | |
| { | |
| "epoch": 0.6814529090324655, | |
| "grad_norm": 1.9949895143508911, | |
| "learning_rate": 6.442432082794309e-06, | |
| "loss": 1.1023, | |
| "num_input_tokens_seen": 62377888, | |
| "step": 530, | |
| "train_runtime": 6029.3488, | |
| "train_tokens_per_second": 10345.709 | |
| }, | |
| { | |
| "epoch": 0.682738669238187, | |
| "grad_norm": 1.8765671253204346, | |
| "learning_rate": 6.416558861578267e-06, | |
| "loss": 1.0263, | |
| "num_input_tokens_seen": 62462016, | |
| "step": 531, | |
| "train_runtime": 6036.392, | |
| "train_tokens_per_second": 10347.574 | |
| }, | |
| { | |
| "epoch": 0.6840244294439087, | |
| "grad_norm": 1.9741531610488892, | |
| "learning_rate": 6.390685640362225e-06, | |
| "loss": 1.2246, | |
| "num_input_tokens_seen": 62610176, | |
| "step": 532, | |
| "train_runtime": 6050.1111, | |
| "train_tokens_per_second": 10348.599 | |
| }, | |
| { | |
| "epoch": 0.6853101896496303, | |
| "grad_norm": 1.8716306686401367, | |
| "learning_rate": 6.364812419146185e-06, | |
| "loss": 1.0364, | |
| "num_input_tokens_seen": 62709280, | |
| "step": 533, | |
| "train_runtime": 6058.5723, | |
| "train_tokens_per_second": 10350.505 | |
| }, | |
| { | |
| "epoch": 0.686595949855352, | |
| "grad_norm": 1.8738210201263428, | |
| "learning_rate": 6.338939197930143e-06, | |
| "loss": 1.0923, | |
| "num_input_tokens_seen": 62874912, | |
| "step": 534, | |
| "train_runtime": 6074.0138, | |
| "train_tokens_per_second": 10351.46 | |
| }, | |
| { | |
| "epoch": 0.6878817100610736, | |
| "grad_norm": 1.8222072124481201, | |
| "learning_rate": 6.313065976714101e-06, | |
| "loss": 1.0699, | |
| "num_input_tokens_seen": 62994208, | |
| "step": 535, | |
| "train_runtime": 6084.6192, | |
| "train_tokens_per_second": 10353.024 | |
| }, | |
| { | |
| "epoch": 0.6891674702667953, | |
| "grad_norm": 1.8478925228118896, | |
| "learning_rate": 6.28719275549806e-06, | |
| "loss": 1.1806, | |
| "num_input_tokens_seen": 63145056, | |
| "step": 536, | |
| "train_runtime": 6098.4851, | |
| "train_tokens_per_second": 10354.22 | |
| }, | |
| { | |
| "epoch": 0.6904532304725168, | |
| "grad_norm": 2.016186475753784, | |
| "learning_rate": 6.261319534282018e-06, | |
| "loss": 1.0304, | |
| "num_input_tokens_seen": 63269120, | |
| "step": 537, | |
| "train_runtime": 6110.0516, | |
| "train_tokens_per_second": 10354.924 | |
| }, | |
| { | |
| "epoch": 0.6917389906782385, | |
| "grad_norm": 1.8224762678146362, | |
| "learning_rate": 6.235446313065977e-06, | |
| "loss": 1.0067, | |
| "num_input_tokens_seen": 63415744, | |
| "step": 538, | |
| "train_runtime": 6123.7782, | |
| "train_tokens_per_second": 10355.657 | |
| }, | |
| { | |
| "epoch": 0.6930247508839601, | |
| "grad_norm": 1.7332342863082886, | |
| "learning_rate": 6.2095730918499354e-06, | |
| "loss": 1.0274, | |
| "num_input_tokens_seen": 63508160, | |
| "step": 539, | |
| "train_runtime": 6131.7391, | |
| "train_tokens_per_second": 10357.283 | |
| }, | |
| { | |
| "epoch": 0.6943105110896818, | |
| "grad_norm": 1.7827410697937012, | |
| "learning_rate": 6.183699870633894e-06, | |
| "loss": 1.0193, | |
| "num_input_tokens_seen": 63661440, | |
| "step": 540, | |
| "train_runtime": 6146.5269, | |
| "train_tokens_per_second": 10357.303 | |
| }, | |
| { | |
| "epoch": 0.6955962712954034, | |
| "grad_norm": 2.020627498626709, | |
| "learning_rate": 6.1578266494178525e-06, | |
| "loss": 1.0964, | |
| "num_input_tokens_seen": 63780032, | |
| "step": 541, | |
| "train_runtime": 6173.4887, | |
| "train_tokens_per_second": 10331.279 | |
| }, | |
| { | |
| "epoch": 0.696882031501125, | |
| "grad_norm": 1.7501956224441528, | |
| "learning_rate": 6.1319534282018115e-06, | |
| "loss": 1.0793, | |
| "num_input_tokens_seen": 63918880, | |
| "step": 542, | |
| "train_runtime": 6185.9809, | |
| "train_tokens_per_second": 10332.861 | |
| }, | |
| { | |
| "epoch": 0.6981677917068466, | |
| "grad_norm": 1.8000164031982422, | |
| "learning_rate": 6.1060802069857704e-06, | |
| "loss": 0.9915, | |
| "num_input_tokens_seen": 64021696, | |
| "step": 543, | |
| "train_runtime": 6194.7919, | |
| "train_tokens_per_second": 10334.761 | |
| }, | |
| { | |
| "epoch": 0.6994535519125683, | |
| "grad_norm": 1.771580696105957, | |
| "learning_rate": 6.0802069857697286e-06, | |
| "loss": 1.0623, | |
| "num_input_tokens_seen": 64140384, | |
| "step": 544, | |
| "train_runtime": 6205.2559, | |
| "train_tokens_per_second": 10336.461 | |
| }, | |
| { | |
| "epoch": 0.70073931211829, | |
| "grad_norm": 1.9515384435653687, | |
| "learning_rate": 6.054333764553687e-06, | |
| "loss": 1.1481, | |
| "num_input_tokens_seen": 64242624, | |
| "step": 545, | |
| "train_runtime": 6214.1214, | |
| "train_tokens_per_second": 10338.167 | |
| }, | |
| { | |
| "epoch": 0.7020250723240116, | |
| "grad_norm": 1.8691986799240112, | |
| "learning_rate": 6.0284605433376465e-06, | |
| "loss": 1.0209, | |
| "num_input_tokens_seen": 64314496, | |
| "step": 546, | |
| "train_runtime": 6220.1913, | |
| "train_tokens_per_second": 10339.633 | |
| }, | |
| { | |
| "epoch": 0.7020250723240116, | |
| "eval_loss": 1.102497935295105, | |
| "eval_runtime": 22.3274, | |
| "eval_samples_per_second": 44.519, | |
| "eval_steps_per_second": 1.433, | |
| "num_input_tokens_seen": 64314496, | |
| "step": 546 | |
| }, | |
| { | |
| "epoch": 0.7033108325297333, | |
| "grad_norm": 1.691506266593933, | |
| "learning_rate": 6.002587322121605e-06, | |
| "loss": 0.9789, | |
| "num_input_tokens_seen": 64429248, | |
| "step": 547, | |
| "train_runtime": 6252.5897, | |
| "train_tokens_per_second": 10304.41 | |
| }, | |
| { | |
| "epoch": 0.7045965927354548, | |
| "grad_norm": 1.7860418558120728, | |
| "learning_rate": 5.976714100905563e-06, | |
| "loss": 1.0317, | |
| "num_input_tokens_seen": 64559776, | |
| "step": 548, | |
| "train_runtime": 6264.281, | |
| "train_tokens_per_second": 10306.015 | |
| }, | |
| { | |
| "epoch": 0.7058823529411765, | |
| "grad_norm": 2.1169979572296143, | |
| "learning_rate": 5.9508408796895225e-06, | |
| "loss": 1.0426, | |
| "num_input_tokens_seen": 64683264, | |
| "step": 549, | |
| "train_runtime": 6275.2924, | |
| "train_tokens_per_second": 10307.61 | |
| }, | |
| { | |
| "epoch": 0.7071681131468981, | |
| "grad_norm": 1.937103271484375, | |
| "learning_rate": 5.924967658473481e-06, | |
| "loss": 1.0845, | |
| "num_input_tokens_seen": 64821728, | |
| "step": 550, | |
| "train_runtime": 6288.0189, | |
| "train_tokens_per_second": 10308.768 | |
| }, | |
| { | |
| "epoch": 0.7084538733526198, | |
| "grad_norm": 1.8114924430847168, | |
| "learning_rate": 5.899094437257439e-06, | |
| "loss": 1.0205, | |
| "num_input_tokens_seen": 64920384, | |
| "step": 551, | |
| "train_runtime": 6296.4281, | |
| "train_tokens_per_second": 10310.669 | |
| }, | |
| { | |
| "epoch": 0.7097396335583414, | |
| "grad_norm": 1.9015802145004272, | |
| "learning_rate": 5.8732212160413986e-06, | |
| "loss": 1.0589, | |
| "num_input_tokens_seen": 65041088, | |
| "step": 552, | |
| "train_runtime": 6307.1492, | |
| "train_tokens_per_second": 10312.28 | |
| }, | |
| { | |
| "epoch": 0.711025393764063, | |
| "grad_norm": 1.871267318725586, | |
| "learning_rate": 5.847347994825357e-06, | |
| "loss": 1.0599, | |
| "num_input_tokens_seen": 65166368, | |
| "step": 553, | |
| "train_runtime": 6318.2983, | |
| "train_tokens_per_second": 10313.911 | |
| }, | |
| { | |
| "epoch": 0.7123111539697846, | |
| "grad_norm": 1.7762296199798584, | |
| "learning_rate": 5.821474773609315e-06, | |
| "loss": 1.1277, | |
| "num_input_tokens_seen": 65256192, | |
| "step": 554, | |
| "train_runtime": 6326.0044, | |
| "train_tokens_per_second": 10315.546 | |
| }, | |
| { | |
| "epoch": 0.7135969141755063, | |
| "grad_norm": 2.015854835510254, | |
| "learning_rate": 5.795601552393273e-06, | |
| "loss": 1.048, | |
| "num_input_tokens_seen": 65379488, | |
| "step": 555, | |
| "train_runtime": 6337.3792, | |
| "train_tokens_per_second": 10316.487 | |
| }, | |
| { | |
| "epoch": 0.7148826743812279, | |
| "grad_norm": 1.9349653720855713, | |
| "learning_rate": 5.769728331177233e-06, | |
| "loss": 1.0893, | |
| "num_input_tokens_seen": 65530368, | |
| "step": 556, | |
| "train_runtime": 6351.5436, | |
| "train_tokens_per_second": 10317.235 | |
| }, | |
| { | |
| "epoch": 0.7161684345869496, | |
| "grad_norm": 1.8240134716033936, | |
| "learning_rate": 5.743855109961191e-06, | |
| "loss": 1.0671, | |
| "num_input_tokens_seen": 65613952, | |
| "step": 557, | |
| "train_runtime": 6358.6261, | |
| "train_tokens_per_second": 10318.888 | |
| }, | |
| { | |
| "epoch": 0.7174541947926711, | |
| "grad_norm": 1.8752096891403198, | |
| "learning_rate": 5.717981888745149e-06, | |
| "loss": 1.0451, | |
| "num_input_tokens_seen": 65725792, | |
| "step": 558, | |
| "train_runtime": 6368.3372, | |
| "train_tokens_per_second": 10320.715 | |
| }, | |
| { | |
| "epoch": 0.7187399549983928, | |
| "grad_norm": 1.9915884733200073, | |
| "learning_rate": 5.692108667529108e-06, | |
| "loss": 1.0574, | |
| "num_input_tokens_seen": 65807680, | |
| "step": 559, | |
| "train_runtime": 6375.3518, | |
| "train_tokens_per_second": 10322.204 | |
| }, | |
| { | |
| "epoch": 0.7200257152041144, | |
| "grad_norm": 1.7847318649291992, | |
| "learning_rate": 5.666235446313066e-06, | |
| "loss": 1.061, | |
| "num_input_tokens_seen": 65905312, | |
| "step": 560, | |
| "train_runtime": 6383.8117, | |
| "train_tokens_per_second": 10323.818 | |
| }, | |
| { | |
| "epoch": 0.7213114754098361, | |
| "grad_norm": 1.7851864099502563, | |
| "learning_rate": 5.640362225097025e-06, | |
| "loss": 0.9781, | |
| "num_input_tokens_seen": 66025056, | |
| "step": 561, | |
| "train_runtime": 6394.6288, | |
| "train_tokens_per_second": 10325.08 | |
| }, | |
| { | |
| "epoch": 0.7225972356155577, | |
| "grad_norm": 2.038956642150879, | |
| "learning_rate": 5.614489003880984e-06, | |
| "loss": 1.1079, | |
| "num_input_tokens_seen": 66161536, | |
| "step": 562, | |
| "train_runtime": 6406.936, | |
| "train_tokens_per_second": 10326.549 | |
| }, | |
| { | |
| "epoch": 0.7238829958212794, | |
| "grad_norm": 1.8547343015670776, | |
| "learning_rate": 5.588615782664942e-06, | |
| "loss": 0.9582, | |
| "num_input_tokens_seen": 66301920, | |
| "step": 563, | |
| "train_runtime": 6419.8653, | |
| "train_tokens_per_second": 10327.619 | |
| }, | |
| { | |
| "epoch": 0.7251687560270009, | |
| "grad_norm": 1.8734216690063477, | |
| "learning_rate": 5.5627425614489e-06, | |
| "loss": 1.1257, | |
| "num_input_tokens_seen": 66416448, | |
| "step": 564, | |
| "train_runtime": 6430.0471, | |
| "train_tokens_per_second": 10329.076 | |
| }, | |
| { | |
| "epoch": 0.7264545162327226, | |
| "grad_norm": 1.9347343444824219, | |
| "learning_rate": 5.53686934023286e-06, | |
| "loss": 1.0665, | |
| "num_input_tokens_seen": 66504544, | |
| "step": 565, | |
| "train_runtime": 6437.5545, | |
| "train_tokens_per_second": 10330.715 | |
| }, | |
| { | |
| "epoch": 0.7277402764384442, | |
| "grad_norm": 1.8810735940933228, | |
| "learning_rate": 5.510996119016818e-06, | |
| "loss": 1.0375, | |
| "num_input_tokens_seen": 66656448, | |
| "step": 566, | |
| "train_runtime": 6451.7561, | |
| "train_tokens_per_second": 10331.52 | |
| }, | |
| { | |
| "epoch": 0.7290260366441659, | |
| "grad_norm": 1.837829351425171, | |
| "learning_rate": 5.485122897800776e-06, | |
| "loss": 1.0713, | |
| "num_input_tokens_seen": 66759904, | |
| "step": 567, | |
| "train_runtime": 6460.6494, | |
| "train_tokens_per_second": 10333.312 | |
| }, | |
| { | |
| "epoch": 0.7303117968498875, | |
| "grad_norm": 1.9980813264846802, | |
| "learning_rate": 5.459249676584734e-06, | |
| "loss": 0.9986, | |
| "num_input_tokens_seen": 66894848, | |
| "step": 568, | |
| "train_runtime": 6473.0889, | |
| "train_tokens_per_second": 10334.301 | |
| }, | |
| { | |
| "epoch": 0.7315975570556091, | |
| "grad_norm": 1.976579189300537, | |
| "learning_rate": 5.433376455368694e-06, | |
| "loss": 1.1012, | |
| "num_input_tokens_seen": 66996128, | |
| "step": 569, | |
| "train_runtime": 6481.9025, | |
| "train_tokens_per_second": 10335.874 | |
| }, | |
| { | |
| "epoch": 0.7328833172613307, | |
| "grad_norm": 1.903847336769104, | |
| "learning_rate": 5.407503234152652e-06, | |
| "loss": 1.0675, | |
| "num_input_tokens_seen": 67141920, | |
| "step": 570, | |
| "train_runtime": 6495.5236, | |
| "train_tokens_per_second": 10336.645 | |
| }, | |
| { | |
| "epoch": 0.7341690774670524, | |
| "grad_norm": 1.9221888780593872, | |
| "learning_rate": 5.38163001293661e-06, | |
| "loss": 1.0781, | |
| "num_input_tokens_seen": 67290336, | |
| "step": 571, | |
| "train_runtime": 6525.8926, | |
| "train_tokens_per_second": 10311.285 | |
| }, | |
| { | |
| "epoch": 0.735454837672774, | |
| "grad_norm": 1.808961033821106, | |
| "learning_rate": 5.35575679172057e-06, | |
| "loss": 1.1462, | |
| "num_input_tokens_seen": 67395424, | |
| "step": 572, | |
| "train_runtime": 6534.8507, | |
| "train_tokens_per_second": 10313.231 | |
| }, | |
| { | |
| "epoch": 0.7367405978784957, | |
| "grad_norm": 1.8847907781600952, | |
| "learning_rate": 5.329883570504528e-06, | |
| "loss": 1.0736, | |
| "num_input_tokens_seen": 67521888, | |
| "step": 573, | |
| "train_runtime": 6545.9199, | |
| "train_tokens_per_second": 10315.111 | |
| }, | |
| { | |
| "epoch": 0.7380263580842173, | |
| "grad_norm": 1.8549025058746338, | |
| "learning_rate": 5.304010349288486e-06, | |
| "loss": 1.0503, | |
| "num_input_tokens_seen": 67665568, | |
| "step": 574, | |
| "train_runtime": 6559.1726, | |
| "train_tokens_per_second": 10316.174 | |
| }, | |
| { | |
| "epoch": 0.7393121182899389, | |
| "grad_norm": 1.9307861328125, | |
| "learning_rate": 5.278137128072446e-06, | |
| "loss": 1.1438, | |
| "num_input_tokens_seen": 67774688, | |
| "step": 575, | |
| "train_runtime": 6568.6043, | |
| "train_tokens_per_second": 10317.974 | |
| }, | |
| { | |
| "epoch": 0.7405978784956606, | |
| "grad_norm": 1.9152367115020752, | |
| "learning_rate": 5.252263906856404e-06, | |
| "loss": 1.0097, | |
| "num_input_tokens_seen": 67861824, | |
| "step": 576, | |
| "train_runtime": 6575.9557, | |
| "train_tokens_per_second": 10319.69 | |
| }, | |
| { | |
| "epoch": 0.7418836387013822, | |
| "grad_norm": 1.8602268695831299, | |
| "learning_rate": 5.2263906856403625e-06, | |
| "loss": 1.0663, | |
| "num_input_tokens_seen": 67982592, | |
| "step": 577, | |
| "train_runtime": 6586.8236, | |
| "train_tokens_per_second": 10320.998 | |
| }, | |
| { | |
| "epoch": 0.7431693989071039, | |
| "grad_norm": 1.928527593612671, | |
| "learning_rate": 5.200517464424321e-06, | |
| "loss": 1.1119, | |
| "num_input_tokens_seen": 68088704, | |
| "step": 578, | |
| "train_runtime": 6595.9873, | |
| "train_tokens_per_second": 10322.746 | |
| }, | |
| { | |
| "epoch": 0.7444551591128254, | |
| "grad_norm": 2.0047895908355713, | |
| "learning_rate": 5.17464424320828e-06, | |
| "loss": 1.0698, | |
| "num_input_tokens_seen": 68230048, | |
| "step": 579, | |
| "train_runtime": 6608.8637, | |
| "train_tokens_per_second": 10324.021 | |
| }, | |
| { | |
| "epoch": 0.7457409193185471, | |
| "grad_norm": 1.8268404006958008, | |
| "learning_rate": 5.1487710219922385e-06, | |
| "loss": 1.0993, | |
| "num_input_tokens_seen": 68349472, | |
| "step": 580, | |
| "train_runtime": 6619.3705, | |
| "train_tokens_per_second": 10325.676 | |
| }, | |
| { | |
| "epoch": 0.7470266795242687, | |
| "grad_norm": 2.0684757232666016, | |
| "learning_rate": 5.1228978007761975e-06, | |
| "loss": 1.0588, | |
| "num_input_tokens_seen": 68470720, | |
| "step": 581, | |
| "train_runtime": 6630.3909, | |
| "train_tokens_per_second": 10326.8 | |
| }, | |
| { | |
| "epoch": 0.7483124397299904, | |
| "grad_norm": 1.9927403926849365, | |
| "learning_rate": 5.0970245795601556e-06, | |
| "loss": 1.0661, | |
| "num_input_tokens_seen": 68583616, | |
| "step": 582, | |
| "train_runtime": 6640.5867, | |
| "train_tokens_per_second": 10327.945 | |
| }, | |
| { | |
| "epoch": 0.749598199935712, | |
| "grad_norm": 1.9514095783233643, | |
| "learning_rate": 5.071151358344114e-06, | |
| "loss": 1.0833, | |
| "num_input_tokens_seen": 68700480, | |
| "step": 583, | |
| "train_runtime": 6650.9406, | |
| "train_tokens_per_second": 10329.438 | |
| }, | |
| { | |
| "epoch": 0.7508839601414337, | |
| "grad_norm": 2.018437623977661, | |
| "learning_rate": 5.045278137128073e-06, | |
| "loss": 1.0668, | |
| "num_input_tokens_seen": 68822336, | |
| "step": 584, | |
| "train_runtime": 6661.8349, | |
| "train_tokens_per_second": 10330.838 | |
| }, | |
| { | |
| "epoch": 0.7521697203471552, | |
| "grad_norm": 1.8875172138214111, | |
| "learning_rate": 5.019404915912032e-06, | |
| "loss": 1.0462, | |
| "num_input_tokens_seen": 68951936, | |
| "step": 585, | |
| "train_runtime": 6673.1759, | |
| "train_tokens_per_second": 10332.702 | |
| }, | |
| { | |
| "epoch": 0.7534554805528769, | |
| "grad_norm": 1.818596363067627, | |
| "learning_rate": 4.99353169469599e-06, | |
| "loss": 1.04, | |
| "num_input_tokens_seen": 69135360, | |
| "step": 586, | |
| "train_runtime": 6690.4234, | |
| "train_tokens_per_second": 10333.48 | |
| }, | |
| { | |
| "epoch": 0.7547412407585985, | |
| "grad_norm": 1.750368595123291, | |
| "learning_rate": 4.967658473479949e-06, | |
| "loss": 1.0268, | |
| "num_input_tokens_seen": 69267744, | |
| "step": 587, | |
| "train_runtime": 6702.7098, | |
| "train_tokens_per_second": 10334.29 | |
| }, | |
| { | |
| "epoch": 0.7560270009643202, | |
| "grad_norm": 1.8207074403762817, | |
| "learning_rate": 4.941785252263907e-06, | |
| "loss": 1.0989, | |
| "num_input_tokens_seen": 69370016, | |
| "step": 588, | |
| "train_runtime": 6711.6974, | |
| "train_tokens_per_second": 10335.689 | |
| }, | |
| { | |
| "epoch": 0.7573127611700418, | |
| "grad_norm": 1.9229310750961304, | |
| "learning_rate": 4.915912031047866e-06, | |
| "loss": 1.1032, | |
| "num_input_tokens_seen": 69495744, | |
| "step": 589, | |
| "train_runtime": 6722.8508, | |
| "train_tokens_per_second": 10337.243 | |
| }, | |
| { | |
| "epoch": 0.7585985213757634, | |
| "grad_norm": 1.8761484622955322, | |
| "learning_rate": 4.890038809831825e-06, | |
| "loss": 1.0723, | |
| "num_input_tokens_seen": 69637824, | |
| "step": 590, | |
| "train_runtime": 6735.7596, | |
| "train_tokens_per_second": 10338.526 | |
| }, | |
| { | |
| "epoch": 0.759884281581485, | |
| "grad_norm": 1.9209434986114502, | |
| "learning_rate": 4.864165588615783e-06, | |
| "loss": 1.0539, | |
| "num_input_tokens_seen": 69746688, | |
| "step": 591, | |
| "train_runtime": 6745.3898, | |
| "train_tokens_per_second": 10339.905 | |
| }, | |
| { | |
| "epoch": 0.7611700417872067, | |
| "grad_norm": 1.8482396602630615, | |
| "learning_rate": 4.838292367399742e-06, | |
| "loss": 1.1362, | |
| "num_input_tokens_seen": 69896288, | |
| "step": 592, | |
| "train_runtime": 6759.169, | |
| "train_tokens_per_second": 10340.959 | |
| }, | |
| { | |
| "epoch": 0.7624558019929283, | |
| "grad_norm": 1.7221297025680542, | |
| "learning_rate": 4.812419146183701e-06, | |
| "loss": 1.0768, | |
| "num_input_tokens_seen": 69981248, | |
| "step": 593, | |
| "train_runtime": 6766.3944, | |
| "train_tokens_per_second": 10342.473 | |
| }, | |
| { | |
| "epoch": 0.76374156219865, | |
| "grad_norm": 1.803056240081787, | |
| "learning_rate": 4.786545924967659e-06, | |
| "loss": 1.0445, | |
| "num_input_tokens_seen": 70077920, | |
| "step": 594, | |
| "train_runtime": 6774.6332, | |
| "train_tokens_per_second": 10344.165 | |
| }, | |
| { | |
| "epoch": 0.7650273224043715, | |
| "grad_norm": 2.036080837249756, | |
| "learning_rate": 4.760672703751618e-06, | |
| "loss": 1.0569, | |
| "num_input_tokens_seen": 70207136, | |
| "step": 595, | |
| "train_runtime": 6786.3397, | |
| "train_tokens_per_second": 10345.361 | |
| }, | |
| { | |
| "epoch": 0.7663130826100932, | |
| "grad_norm": 1.8578526973724365, | |
| "learning_rate": 4.734799482535576e-06, | |
| "loss": 1.0575, | |
| "num_input_tokens_seen": 70295488, | |
| "step": 596, | |
| "train_runtime": 6793.831, | |
| "train_tokens_per_second": 10346.959 | |
| }, | |
| { | |
| "epoch": 0.7675988428158148, | |
| "grad_norm": 1.8725582361221313, | |
| "learning_rate": 4.708926261319535e-06, | |
| "loss": 1.0409, | |
| "num_input_tokens_seen": 70387808, | |
| "step": 597, | |
| "train_runtime": 6801.6342, | |
| "train_tokens_per_second": 10348.661 | |
| }, | |
| { | |
| "epoch": 0.7688846030215365, | |
| "grad_norm": 1.8751484155654907, | |
| "learning_rate": 4.683053040103494e-06, | |
| "loss": 1.0569, | |
| "num_input_tokens_seen": 70502912, | |
| "step": 598, | |
| "train_runtime": 6811.7789, | |
| "train_tokens_per_second": 10350.147 | |
| }, | |
| { | |
| "epoch": 0.7701703632272581, | |
| "grad_norm": 1.832022786140442, | |
| "learning_rate": 4.657179818887452e-06, | |
| "loss": 1.0852, | |
| "num_input_tokens_seen": 70629696, | |
| "step": 599, | |
| "train_runtime": 6822.8214, | |
| "train_tokens_per_second": 10351.978 | |
| }, | |
| { | |
| "epoch": 0.7714561234329798, | |
| "grad_norm": 1.9740808010101318, | |
| "learning_rate": 4.631306597671411e-06, | |
| "loss": 1.0614, | |
| "num_input_tokens_seen": 70732640, | |
| "step": 600, | |
| "train_runtime": 6831.678, | |
| "train_tokens_per_second": 10353.626 | |
| }, | |
| { | |
| "epoch": 0.7727418836387013, | |
| "grad_norm": 1.9888503551483154, | |
| "learning_rate": 4.605433376455369e-06, | |
| "loss": 1.1406, | |
| "num_input_tokens_seen": 70851840, | |
| "step": 601, | |
| "train_runtime": 6859.0779, | |
| "train_tokens_per_second": 10329.645 | |
| }, | |
| { | |
| "epoch": 0.774027643844423, | |
| "grad_norm": 2.011823892593384, | |
| "learning_rate": 4.579560155239328e-06, | |
| "loss": 1.0582, | |
| "num_input_tokens_seen": 70977120, | |
| "step": 602, | |
| "train_runtime": 6870.6102, | |
| "train_tokens_per_second": 10330.541 | |
| }, | |
| { | |
| "epoch": 0.7753134040501446, | |
| "grad_norm": 1.8113346099853516, | |
| "learning_rate": 4.553686934023286e-06, | |
| "loss": 1.0753, | |
| "num_input_tokens_seen": 71089760, | |
| "step": 603, | |
| "train_runtime": 6880.2562, | |
| "train_tokens_per_second": 10332.429 | |
| }, | |
| { | |
| "epoch": 0.7765991642558663, | |
| "grad_norm": 1.8886075019836426, | |
| "learning_rate": 4.527813712807244e-06, | |
| "loss": 1.067, | |
| "num_input_tokens_seen": 71200000, | |
| "step": 604, | |
| "train_runtime": 6889.8418, | |
| "train_tokens_per_second": 10334.054 | |
| }, | |
| { | |
| "epoch": 0.777884924461588, | |
| "grad_norm": 1.803390622138977, | |
| "learning_rate": 4.501940491591203e-06, | |
| "loss": 1.0229, | |
| "num_input_tokens_seen": 71313984, | |
| "step": 605, | |
| "train_runtime": 6899.7826, | |
| "train_tokens_per_second": 10335.686 | |
| }, | |
| { | |
| "epoch": 0.7791706846673095, | |
| "grad_norm": 1.9048407077789307, | |
| "learning_rate": 4.476067270375162e-06, | |
| "loss": 1.1005, | |
| "num_input_tokens_seen": 71454176, | |
| "step": 606, | |
| "train_runtime": 6912.9278, | |
| "train_tokens_per_second": 10336.312 | |
| }, | |
| { | |
| "epoch": 0.7804564448730312, | |
| "grad_norm": 1.7786400318145752, | |
| "learning_rate": 4.45019404915912e-06, | |
| "loss": 1.0786, | |
| "num_input_tokens_seen": 71608032, | |
| "step": 607, | |
| "train_runtime": 6927.2874, | |
| "train_tokens_per_second": 10337.096 | |
| }, | |
| { | |
| "epoch": 0.7817422050787528, | |
| "grad_norm": 1.9795823097229004, | |
| "learning_rate": 4.424320827943079e-06, | |
| "loss": 1.1182, | |
| "num_input_tokens_seen": 71703232, | |
| "step": 608, | |
| "train_runtime": 6935.3945, | |
| "train_tokens_per_second": 10338.739 | |
| }, | |
| { | |
| "epoch": 0.7830279652844745, | |
| "grad_norm": 2.045689821243286, | |
| "learning_rate": 4.398447606727037e-06, | |
| "loss": 1.0731, | |
| "num_input_tokens_seen": 71800608, | |
| "step": 609, | |
| "train_runtime": 6943.76, | |
| "train_tokens_per_second": 10340.307 | |
| }, | |
| { | |
| "epoch": 0.7843137254901961, | |
| "grad_norm": 1.9164133071899414, | |
| "learning_rate": 4.372574385510996e-06, | |
| "loss": 1.0076, | |
| "num_input_tokens_seen": 71902688, | |
| "step": 610, | |
| "train_runtime": 6952.5948, | |
| "train_tokens_per_second": 10341.849 | |
| }, | |
| { | |
| "epoch": 0.7855994856959178, | |
| "grad_norm": 1.7875125408172607, | |
| "learning_rate": 4.346701164294955e-06, | |
| "loss": 1.0059, | |
| "num_input_tokens_seen": 71999488, | |
| "step": 611, | |
| "train_runtime": 6960.8799, | |
| "train_tokens_per_second": 10343.446 | |
| }, | |
| { | |
| "epoch": 0.7868852459016393, | |
| "grad_norm": 1.7959182262420654, | |
| "learning_rate": 4.3208279430789134e-06, | |
| "loss": 1.001, | |
| "num_input_tokens_seen": 72127648, | |
| "step": 612, | |
| "train_runtime": 6972.1724, | |
| "train_tokens_per_second": 10345.075 | |
| }, | |
| { | |
| "epoch": 0.788171006107361, | |
| "grad_norm": 1.9085074663162231, | |
| "learning_rate": 4.294954721862872e-06, | |
| "loss": 1.0613, | |
| "num_input_tokens_seen": 72236512, | |
| "step": 613, | |
| "train_runtime": 6981.6576, | |
| "train_tokens_per_second": 10346.613 | |
| }, | |
| { | |
| "epoch": 0.7894567663130826, | |
| "grad_norm": 1.923269271850586, | |
| "learning_rate": 4.269081500646831e-06, | |
| "loss": 1.0021, | |
| "num_input_tokens_seen": 72331104, | |
| "step": 614, | |
| "train_runtime": 6989.7253, | |
| "train_tokens_per_second": 10348.204 | |
| }, | |
| { | |
| "epoch": 0.7907425265188043, | |
| "grad_norm": 1.7725319862365723, | |
| "learning_rate": 4.2432082794307895e-06, | |
| "loss": 1.0252, | |
| "num_input_tokens_seen": 72470080, | |
| "step": 615, | |
| "train_runtime": 7002.3646, | |
| "train_tokens_per_second": 10349.373 | |
| }, | |
| { | |
| "epoch": 0.7920282867245259, | |
| "grad_norm": 1.854164958000183, | |
| "learning_rate": 4.2173350582147484e-06, | |
| "loss": 0.9617, | |
| "num_input_tokens_seen": 72587776, | |
| "step": 616, | |
| "train_runtime": 7012.7177, | |
| "train_tokens_per_second": 10350.877 | |
| }, | |
| { | |
| "epoch": 0.7933140469302475, | |
| "grad_norm": 1.8561328649520874, | |
| "learning_rate": 4.1914618369987065e-06, | |
| "loss": 1.0435, | |
| "num_input_tokens_seen": 72709504, | |
| "step": 617, | |
| "train_runtime": 7023.2797, | |
| "train_tokens_per_second": 10352.642 | |
| }, | |
| { | |
| "epoch": 0.7945998071359691, | |
| "grad_norm": 1.8203593492507935, | |
| "learning_rate": 4.1655886157826655e-06, | |
| "loss": 1.0132, | |
| "num_input_tokens_seen": 72799776, | |
| "step": 618, | |
| "train_runtime": 7030.8864, | |
| "train_tokens_per_second": 10354.281 | |
| }, | |
| { | |
| "epoch": 0.7958855673416908, | |
| "grad_norm": 1.8547409772872925, | |
| "learning_rate": 4.1397153945666245e-06, | |
| "loss": 0.9842, | |
| "num_input_tokens_seen": 72879840, | |
| "step": 619, | |
| "train_runtime": 7037.5273, | |
| "train_tokens_per_second": 10355.887 | |
| }, | |
| { | |
| "epoch": 0.7971713275474124, | |
| "grad_norm": 1.9788426160812378, | |
| "learning_rate": 4.113842173350583e-06, | |
| "loss": 1.0385, | |
| "num_input_tokens_seen": 72971616, | |
| "step": 620, | |
| "train_runtime": 7045.2634, | |
| "train_tokens_per_second": 10357.543 | |
| }, | |
| { | |
| "epoch": 0.7984570877531341, | |
| "grad_norm": 1.8518086671829224, | |
| "learning_rate": 4.0879689521345415e-06, | |
| "loss": 1.0729, | |
| "num_input_tokens_seen": 73071392, | |
| "step": 621, | |
| "train_runtime": 7053.7889, | |
| "train_tokens_per_second": 10359.169 | |
| }, | |
| { | |
| "epoch": 0.7997428479588556, | |
| "grad_norm": 1.7593944072723389, | |
| "learning_rate": 4.0620957309185e-06, | |
| "loss": 0.9755, | |
| "num_input_tokens_seen": 73155936, | |
| "step": 622, | |
| "train_runtime": 7060.9396, | |
| "train_tokens_per_second": 10360.652 | |
| }, | |
| { | |
| "epoch": 0.8010286081645773, | |
| "grad_norm": 1.8963724374771118, | |
| "learning_rate": 4.036222509702459e-06, | |
| "loss": 1.0652, | |
| "num_input_tokens_seen": 73269600, | |
| "step": 623, | |
| "train_runtime": 7071.1619, | |
| "train_tokens_per_second": 10361.748 | |
| }, | |
| { | |
| "epoch": 0.8023143683702989, | |
| "grad_norm": 1.8380028009414673, | |
| "learning_rate": 4.010349288486417e-06, | |
| "loss": 1.0608, | |
| "num_input_tokens_seen": 73394752, | |
| "step": 624, | |
| "train_runtime": 7082.1878, | |
| "train_tokens_per_second": 10363.288 | |
| }, | |
| { | |
| "epoch": 0.8023143683702989, | |
| "eval_loss": 1.1012874841690063, | |
| "eval_runtime": 22.0115, | |
| "eval_samples_per_second": 45.158, | |
| "eval_steps_per_second": 1.454, | |
| "num_input_tokens_seen": 73394752, | |
| "step": 624 | |
| }, | |
| { | |
| "epoch": 0.8036001285760206, | |
| "grad_norm": 1.9703397750854492, | |
| "learning_rate": 3.984476067270375e-06, | |
| "loss": 1.0863, | |
| "num_input_tokens_seen": 73490912, | |
| "step": 625, | |
| "train_runtime": 7112.3423, | |
| "train_tokens_per_second": 10332.87 | |
| }, | |
| { | |
| "epoch": 0.8048858887817422, | |
| "grad_norm": 1.7578519582748413, | |
| "learning_rate": 3.958602846054334e-06, | |
| "loss": 0.9404, | |
| "num_input_tokens_seen": 73610944, | |
| "step": 626, | |
| "train_runtime": 7122.7514, | |
| "train_tokens_per_second": 10334.622 | |
| }, | |
| { | |
| "epoch": 0.8061716489874639, | |
| "grad_norm": 1.903511881828308, | |
| "learning_rate": 3.932729624838293e-06, | |
| "loss": 1.0024, | |
| "num_input_tokens_seen": 73704576, | |
| "step": 627, | |
| "train_runtime": 7130.9357, | |
| "train_tokens_per_second": 10335.891 | |
| }, | |
| { | |
| "epoch": 0.8074574091931854, | |
| "grad_norm": 1.7375211715698242, | |
| "learning_rate": 3.906856403622251e-06, | |
| "loss": 1.026, | |
| "num_input_tokens_seen": 73846848, | |
| "step": 628, | |
| "train_runtime": 7143.4942, | |
| "train_tokens_per_second": 10337.637 | |
| }, | |
| { | |
| "epoch": 0.8087431693989071, | |
| "grad_norm": 1.864484429359436, | |
| "learning_rate": 3.88098318240621e-06, | |
| "loss": 1.065, | |
| "num_input_tokens_seen": 73957984, | |
| "step": 629, | |
| "train_runtime": 7153.3216, | |
| "train_tokens_per_second": 10338.971 | |
| }, | |
| { | |
| "epoch": 0.8100289296046287, | |
| "grad_norm": 1.851105809211731, | |
| "learning_rate": 3.855109961190168e-06, | |
| "loss": 1.0817, | |
| "num_input_tokens_seen": 74102016, | |
| "step": 630, | |
| "train_runtime": 7166.4684, | |
| "train_tokens_per_second": 10340.102 | |
| }, | |
| { | |
| "epoch": 0.8113146898103504, | |
| "grad_norm": 2.0116357803344727, | |
| "learning_rate": 3.829236739974127e-06, | |
| "loss": 1.1515, | |
| "num_input_tokens_seen": 74214208, | |
| "step": 631, | |
| "train_runtime": 7192.7679, | |
| "train_tokens_per_second": 10317.893 | |
| }, | |
| { | |
| "epoch": 0.812600450016072, | |
| "grad_norm": 1.927558422088623, | |
| "learning_rate": 3.803363518758086e-06, | |
| "loss": 1.0052, | |
| "num_input_tokens_seen": 74299168, | |
| "step": 632, | |
| "train_runtime": 7199.9125, | |
| "train_tokens_per_second": 10319.454 | |
| }, | |
| { | |
| "epoch": 0.8138862102217936, | |
| "grad_norm": 1.961654543876648, | |
| "learning_rate": 3.777490297542044e-06, | |
| "loss": 1.0519, | |
| "num_input_tokens_seen": 74418176, | |
| "step": 633, | |
| "train_runtime": 7210.5863, | |
| "train_tokens_per_second": 10320.683 | |
| }, | |
| { | |
| "epoch": 0.8151719704275152, | |
| "grad_norm": 1.8367573022842407, | |
| "learning_rate": 3.751617076326003e-06, | |
| "loss": 1.011, | |
| "num_input_tokens_seen": 74533024, | |
| "step": 634, | |
| "train_runtime": 7220.8171, | |
| "train_tokens_per_second": 10321.965 | |
| }, | |
| { | |
| "epoch": 0.8164577306332369, | |
| "grad_norm": 1.8445461988449097, | |
| "learning_rate": 3.7257438551099615e-06, | |
| "loss": 0.9722, | |
| "num_input_tokens_seen": 74639200, | |
| "step": 635, | |
| "train_runtime": 7230.1938, | |
| "train_tokens_per_second": 10323.264 | |
| }, | |
| { | |
| "epoch": 0.8177434908389586, | |
| "grad_norm": 1.9773858785629272, | |
| "learning_rate": 3.69987063389392e-06, | |
| "loss": 0.9934, | |
| "num_input_tokens_seen": 74718656, | |
| "step": 636, | |
| "train_runtime": 7236.8882, | |
| "train_tokens_per_second": 10324.694 | |
| }, | |
| { | |
| "epoch": 0.8190292510446802, | |
| "grad_norm": 1.880348801612854, | |
| "learning_rate": 3.6739974126778786e-06, | |
| "loss": 1.0368, | |
| "num_input_tokens_seen": 74883680, | |
| "step": 637, | |
| "train_runtime": 7252.295, | |
| "train_tokens_per_second": 10325.515 | |
| }, | |
| { | |
| "epoch": 0.8203150112504018, | |
| "grad_norm": 1.939626932144165, | |
| "learning_rate": 3.648124191461837e-06, | |
| "loss": 1.135, | |
| "num_input_tokens_seen": 75006080, | |
| "step": 638, | |
| "train_runtime": 7263.2834, | |
| "train_tokens_per_second": 10326.746 | |
| }, | |
| { | |
| "epoch": 0.8216007714561234, | |
| "grad_norm": 1.7646300792694092, | |
| "learning_rate": 3.6222509702457957e-06, | |
| "loss": 1.0535, | |
| "num_input_tokens_seen": 75128000, | |
| "step": 639, | |
| "train_runtime": 7274.1683, | |
| "train_tokens_per_second": 10328.054 | |
| }, | |
| { | |
| "epoch": 0.8228865316618451, | |
| "grad_norm": 2.0148706436157227, | |
| "learning_rate": 3.5963777490297546e-06, | |
| "loss": 1.0519, | |
| "num_input_tokens_seen": 75233216, | |
| "step": 640, | |
| "train_runtime": 7283.2614, | |
| "train_tokens_per_second": 10329.605 | |
| }, | |
| { | |
| "epoch": 0.8241722918675667, | |
| "grad_norm": 1.9275726079940796, | |
| "learning_rate": 3.5705045278137127e-06, | |
| "loss": 1.0881, | |
| "num_input_tokens_seen": 75367840, | |
| "step": 641, | |
| "train_runtime": 7295.2124, | |
| "train_tokens_per_second": 10331.137 | |
| }, | |
| { | |
| "epoch": 0.8254580520732884, | |
| "grad_norm": 2.142881393432617, | |
| "learning_rate": 3.5446313065976717e-06, | |
| "loss": 1.2726, | |
| "num_input_tokens_seen": 75526528, | |
| "step": 642, | |
| "train_runtime": 7309.8561, | |
| "train_tokens_per_second": 10332.15 | |
| }, | |
| { | |
| "epoch": 0.82674381227901, | |
| "grad_norm": 1.8535045385360718, | |
| "learning_rate": 3.5187580853816307e-06, | |
| "loss": 1.0476, | |
| "num_input_tokens_seen": 75662336, | |
| "step": 643, | |
| "train_runtime": 7322.2115, | |
| "train_tokens_per_second": 10333.263 | |
| }, | |
| { | |
| "epoch": 0.8280295724847316, | |
| "grad_norm": 1.9154276847839355, | |
| "learning_rate": 3.492884864165589e-06, | |
| "loss": 1.131, | |
| "num_input_tokens_seen": 75779040, | |
| "step": 644, | |
| "train_runtime": 7332.6834, | |
| "train_tokens_per_second": 10334.421 | |
| }, | |
| { | |
| "epoch": 0.8293153326904532, | |
| "grad_norm": 1.8441919088363647, | |
| "learning_rate": 3.4670116429495478e-06, | |
| "loss": 1.049, | |
| "num_input_tokens_seen": 75923360, | |
| "step": 645, | |
| "train_runtime": 7346.1516, | |
| "train_tokens_per_second": 10335.12 | |
| }, | |
| { | |
| "epoch": 0.8306010928961749, | |
| "grad_norm": 2.044139862060547, | |
| "learning_rate": 3.441138421733506e-06, | |
| "loss": 1.0502, | |
| "num_input_tokens_seen": 76033984, | |
| "step": 646, | |
| "train_runtime": 7355.8474, | |
| "train_tokens_per_second": 10336.536 | |
| }, | |
| { | |
| "epoch": 0.8318868531018965, | |
| "grad_norm": 1.9089950323104858, | |
| "learning_rate": 3.415265200517465e-06, | |
| "loss": 1.1316, | |
| "num_input_tokens_seen": 76122944, | |
| "step": 647, | |
| "train_runtime": 7363.3482, | |
| "train_tokens_per_second": 10338.088 | |
| }, | |
| { | |
| "epoch": 0.8331726133076182, | |
| "grad_norm": 1.77204430103302, | |
| "learning_rate": 3.3893919793014234e-06, | |
| "loss": 1.0729, | |
| "num_input_tokens_seen": 76216608, | |
| "step": 648, | |
| "train_runtime": 7371.305, | |
| "train_tokens_per_second": 10339.636 | |
| }, | |
| { | |
| "epoch": 0.8344583735133397, | |
| "grad_norm": 1.8178905248641968, | |
| "learning_rate": 3.363518758085382e-06, | |
| "loss": 1.0451, | |
| "num_input_tokens_seen": 76310720, | |
| "step": 649, | |
| "train_runtime": 7379.274, | |
| "train_tokens_per_second": 10341.223 | |
| }, | |
| { | |
| "epoch": 0.8357441337190614, | |
| "grad_norm": 1.819828748703003, | |
| "learning_rate": 3.3376455368693404e-06, | |
| "loss": 1.0011, | |
| "num_input_tokens_seen": 76423424, | |
| "step": 650, | |
| "train_runtime": 7389.1813, | |
| "train_tokens_per_second": 10342.611 | |
| }, | |
| { | |
| "epoch": 0.837029893924783, | |
| "grad_norm": 1.8803701400756836, | |
| "learning_rate": 3.3117723156532994e-06, | |
| "loss": 1.0684, | |
| "num_input_tokens_seen": 76528768, | |
| "step": 651, | |
| "train_runtime": 7398.2156, | |
| "train_tokens_per_second": 10344.22 | |
| }, | |
| { | |
| "epoch": 0.8383156541305047, | |
| "grad_norm": 1.7649791240692139, | |
| "learning_rate": 3.2858990944372575e-06, | |
| "loss": 1.0853, | |
| "num_input_tokens_seen": 76637184, | |
| "step": 652, | |
| "train_runtime": 7407.6495, | |
| "train_tokens_per_second": 10345.682 | |
| }, | |
| { | |
| "epoch": 0.8396014143362263, | |
| "grad_norm": 1.8651745319366455, | |
| "learning_rate": 3.2600258732212165e-06, | |
| "loss": 1.016, | |
| "num_input_tokens_seen": 76752288, | |
| "step": 653, | |
| "train_runtime": 7418.1044, | |
| "train_tokens_per_second": 10346.617 | |
| }, | |
| { | |
| "epoch": 0.840887174541948, | |
| "grad_norm": 2.0024538040161133, | |
| "learning_rate": 3.2341526520051746e-06, | |
| "loss": 0.9789, | |
| "num_input_tokens_seen": 76872672, | |
| "step": 654, | |
| "train_runtime": 7428.7756, | |
| "train_tokens_per_second": 10347.96 | |
| }, | |
| { | |
| "epoch": 0.8421729347476695, | |
| "grad_norm": 1.891562581062317, | |
| "learning_rate": 3.2082794307891336e-06, | |
| "loss": 0.9911, | |
| "num_input_tokens_seen": 76990624, | |
| "step": 655, | |
| "train_runtime": 7439.4116, | |
| "train_tokens_per_second": 10349.021 | |
| }, | |
| { | |
| "epoch": 0.8434586949533912, | |
| "grad_norm": 1.8575772047042847, | |
| "learning_rate": 3.1824062095730925e-06, | |
| "loss": 1.0312, | |
| "num_input_tokens_seen": 77120544, | |
| "step": 656, | |
| "train_runtime": 7451.122, | |
| "train_tokens_per_second": 10350.192 | |
| }, | |
| { | |
| "epoch": 0.8447444551591128, | |
| "grad_norm": 1.7141671180725098, | |
| "learning_rate": 3.1565329883570506e-06, | |
| "loss": 0.9903, | |
| "num_input_tokens_seen": 77225280, | |
| "step": 657, | |
| "train_runtime": 7460.2728, | |
| "train_tokens_per_second": 10351.536 | |
| }, | |
| { | |
| "epoch": 0.8460302153648345, | |
| "grad_norm": 2.0042834281921387, | |
| "learning_rate": 3.130659767141009e-06, | |
| "loss": 1.0529, | |
| "num_input_tokens_seen": 77332128, | |
| "step": 658, | |
| "train_runtime": 7469.5149, | |
| "train_tokens_per_second": 10353.032 | |
| }, | |
| { | |
| "epoch": 0.847315975570556, | |
| "grad_norm": 1.9022477865219116, | |
| "learning_rate": 3.1047865459249677e-06, | |
| "loss": 1.0931, | |
| "num_input_tokens_seen": 77443168, | |
| "step": 659, | |
| "train_runtime": 7479.2157, | |
| "train_tokens_per_second": 10354.45 | |
| }, | |
| { | |
| "epoch": 0.8486017357762777, | |
| "grad_norm": 1.873485803604126, | |
| "learning_rate": 3.0789133247089263e-06, | |
| "loss": 1.026, | |
| "num_input_tokens_seen": 77537376, | |
| "step": 660, | |
| "train_runtime": 7487.2839, | |
| "train_tokens_per_second": 10355.875 | |
| }, | |
| { | |
| "epoch": 0.8498874959819993, | |
| "grad_norm": 1.8651823997497559, | |
| "learning_rate": 3.0530401034928852e-06, | |
| "loss": 1.0775, | |
| "num_input_tokens_seen": 77650464, | |
| "step": 661, | |
| "train_runtime": 7514.0471, | |
| "train_tokens_per_second": 10334.04 | |
| }, | |
| { | |
| "epoch": 0.851173256187721, | |
| "grad_norm": 1.8203614950180054, | |
| "learning_rate": 3.0271668822768433e-06, | |
| "loss": 1.0082, | |
| "num_input_tokens_seen": 77754656, | |
| "step": 662, | |
| "train_runtime": 7523.1298, | |
| "train_tokens_per_second": 10335.413 | |
| }, | |
| { | |
| "epoch": 0.8524590163934426, | |
| "grad_norm": 1.87871515750885, | |
| "learning_rate": 3.0012936610608023e-06, | |
| "loss": 1.0285, | |
| "num_input_tokens_seen": 77863392, | |
| "step": 663, | |
| "train_runtime": 7532.441, | |
| "train_tokens_per_second": 10337.073 | |
| }, | |
| { | |
| "epoch": 0.8537447765991643, | |
| "grad_norm": 1.8229897022247314, | |
| "learning_rate": 2.9754204398447613e-06, | |
| "loss": 1.0719, | |
| "num_input_tokens_seen": 77968736, | |
| "step": 664, | |
| "train_runtime": 7541.5876, | |
| "train_tokens_per_second": 10338.504 | |
| }, | |
| { | |
| "epoch": 0.8550305368048859, | |
| "grad_norm": 1.788649320602417, | |
| "learning_rate": 2.9495472186287194e-06, | |
| "loss": 1.0702, | |
| "num_input_tokens_seen": 78116000, | |
| "step": 665, | |
| "train_runtime": 7555.0918, | |
| "train_tokens_per_second": 10339.517 | |
| }, | |
| { | |
| "epoch": 0.8563162970106075, | |
| "grad_norm": 1.9688736200332642, | |
| "learning_rate": 2.9236739974126783e-06, | |
| "loss": 1.0683, | |
| "num_input_tokens_seen": 78252000, | |
| "step": 666, | |
| "train_runtime": 7567.7838, | |
| "train_tokens_per_second": 10340.147 | |
| }, | |
| { | |
| "epoch": 0.8576020572163292, | |
| "grad_norm": 1.8758140802383423, | |
| "learning_rate": 2.8978007761966365e-06, | |
| "loss": 1.0176, | |
| "num_input_tokens_seen": 78400896, | |
| "step": 667, | |
| "train_runtime": 7581.1157, | |
| "train_tokens_per_second": 10341.604 | |
| }, | |
| { | |
| "epoch": 0.8588878174220508, | |
| "grad_norm": 1.8528767824172974, | |
| "learning_rate": 2.8719275549805954e-06, | |
| "loss": 1.0088, | |
| "num_input_tokens_seen": 78535872, | |
| "step": 668, | |
| "train_runtime": 7593.4775, | |
| "train_tokens_per_second": 10342.544 | |
| }, | |
| { | |
| "epoch": 0.8601735776277725, | |
| "grad_norm": 1.8127259016036987, | |
| "learning_rate": 2.846054333764554e-06, | |
| "loss": 1.1, | |
| "num_input_tokens_seen": 78643040, | |
| "step": 669, | |
| "train_runtime": 7602.9127, | |
| "train_tokens_per_second": 10343.804 | |
| }, | |
| { | |
| "epoch": 0.861459337833494, | |
| "grad_norm": 1.833497405052185, | |
| "learning_rate": 2.8201811125485125e-06, | |
| "loss": 1.0125, | |
| "num_input_tokens_seen": 78758208, | |
| "step": 670, | |
| "train_runtime": 7612.996, | |
| "train_tokens_per_second": 10345.232 | |
| }, | |
| { | |
| "epoch": 0.8627450980392157, | |
| "grad_norm": 1.9422428607940674, | |
| "learning_rate": 2.794307891332471e-06, | |
| "loss": 1.034, | |
| "num_input_tokens_seen": 78856224, | |
| "step": 671, | |
| "train_runtime": 7621.3865, | |
| "train_tokens_per_second": 10346.703 | |
| }, | |
| { | |
| "epoch": 0.8640308582449373, | |
| "grad_norm": 1.9948776960372925, | |
| "learning_rate": 2.76843467011643e-06, | |
| "loss": 1.0527, | |
| "num_input_tokens_seen": 78963072, | |
| "step": 672, | |
| "train_runtime": 7630.5085, | |
| "train_tokens_per_second": 10348.337 | |
| }, | |
| { | |
| "epoch": 0.865316618450659, | |
| "grad_norm": 1.8143967390060425, | |
| "learning_rate": 2.742561448900388e-06, | |
| "loss": 1.0609, | |
| "num_input_tokens_seen": 79109120, | |
| "step": 673, | |
| "train_runtime": 7643.9846, | |
| "train_tokens_per_second": 10349.199 | |
| }, | |
| { | |
| "epoch": 0.8666023786563806, | |
| "grad_norm": 1.855102777481079, | |
| "learning_rate": 2.716688227684347e-06, | |
| "loss": 1.0352, | |
| "num_input_tokens_seen": 79207456, | |
| "step": 674, | |
| "train_runtime": 7652.3254, | |
| "train_tokens_per_second": 10350.769 | |
| }, | |
| { | |
| "epoch": 0.8678881388621023, | |
| "grad_norm": 2.0813863277435303, | |
| "learning_rate": 2.690815006468305e-06, | |
| "loss": 1.1286, | |
| "num_input_tokens_seen": 79317120, | |
| "step": 675, | |
| "train_runtime": 7661.9866, | |
| "train_tokens_per_second": 10352.031 | |
| }, | |
| { | |
| "epoch": 0.8691738990678238, | |
| "grad_norm": 1.8220653533935547, | |
| "learning_rate": 2.664941785252264e-06, | |
| "loss": 1.1715, | |
| "num_input_tokens_seen": 79483744, | |
| "step": 676, | |
| "train_runtime": 7677.6815, | |
| "train_tokens_per_second": 10352.571 | |
| }, | |
| { | |
| "epoch": 0.8704596592735455, | |
| "grad_norm": 1.8896037340164185, | |
| "learning_rate": 2.639068564036223e-06, | |
| "loss": 1.0194, | |
| "num_input_tokens_seen": 79569024, | |
| "step": 677, | |
| "train_runtime": 7684.8538, | |
| "train_tokens_per_second": 10354.006 | |
| }, | |
| { | |
| "epoch": 0.8717454194792671, | |
| "grad_norm": 1.8855335712432861, | |
| "learning_rate": 2.6131953428201812e-06, | |
| "loss": 1.0903, | |
| "num_input_tokens_seen": 79665344, | |
| "step": 678, | |
| "train_runtime": 7693.2234, | |
| "train_tokens_per_second": 10355.262 | |
| }, | |
| { | |
| "epoch": 0.8730311796849888, | |
| "grad_norm": 1.8641669750213623, | |
| "learning_rate": 2.58732212160414e-06, | |
| "loss": 1.0381, | |
| "num_input_tokens_seen": 79761120, | |
| "step": 679, | |
| "train_runtime": 7701.3015, | |
| "train_tokens_per_second": 10356.836 | |
| }, | |
| { | |
| "epoch": 0.8743169398907104, | |
| "grad_norm": 1.8233321905136108, | |
| "learning_rate": 2.5614489003880987e-06, | |
| "loss": 0.983, | |
| "num_input_tokens_seen": 79924640, | |
| "step": 680, | |
| "train_runtime": 7716.5881, | |
| "train_tokens_per_second": 10357.51 | |
| }, | |
| { | |
| "epoch": 0.875602700096432, | |
| "grad_norm": 1.8468879461288452, | |
| "learning_rate": 2.535575679172057e-06, | |
| "loss": 1.039, | |
| "num_input_tokens_seen": 80021344, | |
| "step": 681, | |
| "train_runtime": 7724.808, | |
| "train_tokens_per_second": 10359.007 | |
| }, | |
| { | |
| "epoch": 0.8768884603021536, | |
| "grad_norm": 1.7861686944961548, | |
| "learning_rate": 2.509702457956016e-06, | |
| "loss": 1.0949, | |
| "num_input_tokens_seen": 80140384, | |
| "step": 682, | |
| "train_runtime": 7735.3252, | |
| "train_tokens_per_second": 10360.312 | |
| }, | |
| { | |
| "epoch": 0.8781742205078753, | |
| "grad_norm": 1.9106656312942505, | |
| "learning_rate": 2.4838292367399743e-06, | |
| "loss": 1.0139, | |
| "num_input_tokens_seen": 80283136, | |
| "step": 683, | |
| "train_runtime": 7748.4471, | |
| "train_tokens_per_second": 10361.19 | |
| }, | |
| { | |
| "epoch": 0.8794599807135969, | |
| "grad_norm": 1.7842717170715332, | |
| "learning_rate": 2.457956015523933e-06, | |
| "loss": 1.0803, | |
| "num_input_tokens_seen": 80407520, | |
| "step": 684, | |
| "train_runtime": 7759.5573, | |
| "train_tokens_per_second": 10362.385 | |
| }, | |
| { | |
| "epoch": 0.8807457409193186, | |
| "grad_norm": 1.6155146360397339, | |
| "learning_rate": 2.4320827943078914e-06, | |
| "loss": 1.0904, | |
| "num_input_tokens_seen": 80521312, | |
| "step": 685, | |
| "train_runtime": 7769.6839, | |
| "train_tokens_per_second": 10363.525 | |
| }, | |
| { | |
| "epoch": 0.8820315011250401, | |
| "grad_norm": 1.9151482582092285, | |
| "learning_rate": 2.4062095730918504e-06, | |
| "loss": 0.9985, | |
| "num_input_tokens_seen": 80650112, | |
| "step": 686, | |
| "train_runtime": 7781.5312, | |
| "train_tokens_per_second": 10364.299 | |
| }, | |
| { | |
| "epoch": 0.8833172613307618, | |
| "grad_norm": 1.882094144821167, | |
| "learning_rate": 2.380336351875809e-06, | |
| "loss": 1.0523, | |
| "num_input_tokens_seen": 80751584, | |
| "step": 687, | |
| "train_runtime": 7790.3656, | |
| "train_tokens_per_second": 10365.571 | |
| }, | |
| { | |
| "epoch": 0.8846030215364834, | |
| "grad_norm": 1.9243850708007812, | |
| "learning_rate": 2.3544631306597675e-06, | |
| "loss": 1.0447, | |
| "num_input_tokens_seen": 80893472, | |
| "step": 688, | |
| "train_runtime": 7803.0693, | |
| "train_tokens_per_second": 10366.879 | |
| }, | |
| { | |
| "epoch": 0.8858887817422051, | |
| "grad_norm": 1.9028187990188599, | |
| "learning_rate": 2.328589909443726e-06, | |
| "loss": 1.124, | |
| "num_input_tokens_seen": 81008832, | |
| "step": 689, | |
| "train_runtime": 7813.0316, | |
| "train_tokens_per_second": 10368.425 | |
| }, | |
| { | |
| "epoch": 0.8871745419479267, | |
| "grad_norm": 1.9224538803100586, | |
| "learning_rate": 2.3027166882276845e-06, | |
| "loss": 1.0497, | |
| "num_input_tokens_seen": 81122272, | |
| "step": 690, | |
| "train_runtime": 7823.0001, | |
| "train_tokens_per_second": 10369.714 | |
| }, | |
| { | |
| "epoch": 0.8884603021536484, | |
| "grad_norm": 1.7827943563461304, | |
| "learning_rate": 2.276843467011643e-06, | |
| "loss": 0.9838, | |
| "num_input_tokens_seen": 81199616, | |
| "step": 691, | |
| "train_runtime": 7846.4547, | |
| "train_tokens_per_second": 10348.574 | |
| }, | |
| { | |
| "epoch": 0.8897460623593699, | |
| "grad_norm": 1.9258924722671509, | |
| "learning_rate": 2.2509702457956016e-06, | |
| "loss": 1.0869, | |
| "num_input_tokens_seen": 81317440, | |
| "step": 692, | |
| "train_runtime": 7856.7474, | |
| "train_tokens_per_second": 10350.013 | |
| }, | |
| { | |
| "epoch": 0.8910318225650916, | |
| "grad_norm": 1.7988842725753784, | |
| "learning_rate": 2.22509702457956e-06, | |
| "loss": 1.0551, | |
| "num_input_tokens_seen": 81392096, | |
| "step": 693, | |
| "train_runtime": 7863.0317, | |
| "train_tokens_per_second": 10351.236 | |
| }, | |
| { | |
| "epoch": 0.8923175827708132, | |
| "grad_norm": 1.9783662557601929, | |
| "learning_rate": 2.1992238033635187e-06, | |
| "loss": 1.0206, | |
| "num_input_tokens_seen": 81586720, | |
| "step": 694, | |
| "train_runtime": 7881.7563, | |
| "train_tokens_per_second": 10351.338 | |
| }, | |
| { | |
| "epoch": 0.8936033429765349, | |
| "grad_norm": 1.8867701292037964, | |
| "learning_rate": 2.1733505821474777e-06, | |
| "loss": 1.021, | |
| "num_input_tokens_seen": 81666304, | |
| "step": 695, | |
| "train_runtime": 7888.4054, | |
| "train_tokens_per_second": 10352.701 | |
| }, | |
| { | |
| "epoch": 0.8948891031822566, | |
| "grad_norm": 1.9221513271331787, | |
| "learning_rate": 2.147477360931436e-06, | |
| "loss": 1.0316, | |
| "num_input_tokens_seen": 81798240, | |
| "step": 696, | |
| "train_runtime": 7900.2219, | |
| "train_tokens_per_second": 10353.917 | |
| }, | |
| { | |
| "epoch": 0.8961748633879781, | |
| "grad_norm": 1.837570309638977, | |
| "learning_rate": 2.1216041397153947e-06, | |
| "loss": 1.0778, | |
| "num_input_tokens_seen": 81969408, | |
| "step": 697, | |
| "train_runtime": 7916.1174, | |
| "train_tokens_per_second": 10354.749 | |
| }, | |
| { | |
| "epoch": 0.8974606235936998, | |
| "grad_norm": 1.9242483377456665, | |
| "learning_rate": 2.0957309184993533e-06, | |
| "loss": 1.0736, | |
| "num_input_tokens_seen": 82059968, | |
| "step": 698, | |
| "train_runtime": 7923.8396, | |
| "train_tokens_per_second": 10356.086 | |
| }, | |
| { | |
| "epoch": 0.8987463837994214, | |
| "grad_norm": 1.8562523126602173, | |
| "learning_rate": 2.0698576972833122e-06, | |
| "loss": 1.0715, | |
| "num_input_tokens_seen": 82150944, | |
| "step": 699, | |
| "train_runtime": 7931.5687, | |
| "train_tokens_per_second": 10357.465 | |
| }, | |
| { | |
| "epoch": 0.9000321440051431, | |
| "grad_norm": 1.8766613006591797, | |
| "learning_rate": 2.0439844760672708e-06, | |
| "loss": 1.0177, | |
| "num_input_tokens_seen": 82278976, | |
| "step": 700, | |
| "train_runtime": 7942.9729, | |
| "train_tokens_per_second": 10358.713 | |
| }, | |
| { | |
| "epoch": 0.9013179042108647, | |
| "grad_norm": 1.8400506973266602, | |
| "learning_rate": 2.0181112548512293e-06, | |
| "loss": 0.9974, | |
| "num_input_tokens_seen": 82380256, | |
| "step": 701, | |
| "train_runtime": 7951.654, | |
| "train_tokens_per_second": 10360.141 | |
| }, | |
| { | |
| "epoch": 0.9026036644165863, | |
| "grad_norm": 1.869764804840088, | |
| "learning_rate": 1.9922380336351874e-06, | |
| "loss": 1.1055, | |
| "num_input_tokens_seen": 82467136, | |
| "step": 702, | |
| "train_runtime": 7959.0198, | |
| "train_tokens_per_second": 10361.469 | |
| }, | |
| { | |
| "epoch": 0.9026036644165863, | |
| "eval_loss": 1.1008806228637695, | |
| "eval_runtime": 21.9435, | |
| "eval_samples_per_second": 45.298, | |
| "eval_steps_per_second": 1.458, | |
| "num_input_tokens_seen": 82467136, | |
| "step": 702 | |
| }, | |
| { | |
| "epoch": 0.9038894246223079, | |
| "grad_norm": 1.8863102197647095, | |
| "learning_rate": 1.9663648124191464e-06, | |
| "loss": 1.0474, | |
| "num_input_tokens_seen": 82549824, | |
| "step": 703, | |
| "train_runtime": 7987.8517, | |
| "train_tokens_per_second": 10334.421 | |
| }, | |
| { | |
| "epoch": 0.9051751848280296, | |
| "grad_norm": 1.9096331596374512, | |
| "learning_rate": 1.940491591203105e-06, | |
| "loss": 0.9695, | |
| "num_input_tokens_seen": 82644544, | |
| "step": 704, | |
| "train_runtime": 7995.9308, | |
| "train_tokens_per_second": 10335.825 | |
| }, | |
| { | |
| "epoch": 0.9064609450337512, | |
| "grad_norm": 1.917685627937317, | |
| "learning_rate": 1.9146183699870635e-06, | |
| "loss": 1.0134, | |
| "num_input_tokens_seen": 82744352, | |
| "step": 705, | |
| "train_runtime": 8004.4871, | |
| "train_tokens_per_second": 10337.246 | |
| }, | |
| { | |
| "epoch": 0.9077467052394729, | |
| "grad_norm": 1.8343957662582397, | |
| "learning_rate": 1.888745148771022e-06, | |
| "loss": 1.0128, | |
| "num_input_tokens_seen": 82828832, | |
| "step": 706, | |
| "train_runtime": 8011.5724, | |
| "train_tokens_per_second": 10338.649 | |
| }, | |
| { | |
| "epoch": 0.9090324654451944, | |
| "grad_norm": 1.8960968255996704, | |
| "learning_rate": 1.8628719275549808e-06, | |
| "loss": 1.0537, | |
| "num_input_tokens_seen": 82904896, | |
| "step": 707, | |
| "train_runtime": 8017.8668, | |
| "train_tokens_per_second": 10340.019 | |
| }, | |
| { | |
| "epoch": 0.9103182256509161, | |
| "grad_norm": 1.9157270193099976, | |
| "learning_rate": 1.8369987063389393e-06, | |
| "loss": 1.0718, | |
| "num_input_tokens_seen": 83015168, | |
| "step": 708, | |
| "train_runtime": 8027.3151, | |
| "train_tokens_per_second": 10341.586 | |
| }, | |
| { | |
| "epoch": 0.9116039858566377, | |
| "grad_norm": 1.9855552911758423, | |
| "learning_rate": 1.8111254851228978e-06, | |
| "loss": 1.0452, | |
| "num_input_tokens_seen": 83164288, | |
| "step": 709, | |
| "train_runtime": 8041.0658, | |
| "train_tokens_per_second": 10342.446 | |
| }, | |
| { | |
| "epoch": 0.9128897460623594, | |
| "grad_norm": 1.8479399681091309, | |
| "learning_rate": 1.7852522639068564e-06, | |
| "loss": 1.0732, | |
| "num_input_tokens_seen": 83269312, | |
| "step": 710, | |
| "train_runtime": 8050.0869, | |
| "train_tokens_per_second": 10343.902 | |
| }, | |
| { | |
| "epoch": 0.914175506268081, | |
| "grad_norm": 1.8165806531906128, | |
| "learning_rate": 1.7593790426908153e-06, | |
| "loss": 1.0951, | |
| "num_input_tokens_seen": 83382816, | |
| "step": 711, | |
| "train_runtime": 8060.1786, | |
| "train_tokens_per_second": 10345.033 | |
| }, | |
| { | |
| "epoch": 0.9154612664738027, | |
| "grad_norm": 1.933991551399231, | |
| "learning_rate": 1.7335058214747739e-06, | |
| "loss": 1.0493, | |
| "num_input_tokens_seen": 83479968, | |
| "step": 712, | |
| "train_runtime": 8068.5568, | |
| "train_tokens_per_second": 10346.332 | |
| }, | |
| { | |
| "epoch": 0.9167470266795242, | |
| "grad_norm": 1.9237388372421265, | |
| "learning_rate": 1.7076326002587324e-06, | |
| "loss": 1.129, | |
| "num_input_tokens_seen": 83614112, | |
| "step": 713, | |
| "train_runtime": 8080.647, | |
| "train_tokens_per_second": 10347.453 | |
| }, | |
| { | |
| "epoch": 0.9180327868852459, | |
| "grad_norm": 1.7912081480026245, | |
| "learning_rate": 1.681759379042691e-06, | |
| "loss": 0.9808, | |
| "num_input_tokens_seen": 83697376, | |
| "step": 714, | |
| "train_runtime": 8087.6795, | |
| "train_tokens_per_second": 10348.75 | |
| }, | |
| { | |
| "epoch": 0.9193185470909675, | |
| "grad_norm": 1.951076865196228, | |
| "learning_rate": 1.6558861578266497e-06, | |
| "loss": 1.0593, | |
| "num_input_tokens_seen": 83815040, | |
| "step": 715, | |
| "train_runtime": 8098.1807, | |
| "train_tokens_per_second": 10349.86 | |
| }, | |
| { | |
| "epoch": 0.9206043072966892, | |
| "grad_norm": 1.97995924949646, | |
| "learning_rate": 1.6300129366106082e-06, | |
| "loss": 1.1155, | |
| "num_input_tokens_seen": 83897792, | |
| "step": 716, | |
| "train_runtime": 8105.0892, | |
| "train_tokens_per_second": 10351.248 | |
| }, | |
| { | |
| "epoch": 0.9218900675024108, | |
| "grad_norm": 1.942265510559082, | |
| "learning_rate": 1.6041397153945668e-06, | |
| "loss": 1.0594, | |
| "num_input_tokens_seen": 83994528, | |
| "step": 717, | |
| "train_runtime": 8113.4146, | |
| "train_tokens_per_second": 10352.55 | |
| }, | |
| { | |
| "epoch": 0.9231758277081324, | |
| "grad_norm": 1.8772202730178833, | |
| "learning_rate": 1.5782664941785253e-06, | |
| "loss": 1.0071, | |
| "num_input_tokens_seen": 84138560, | |
| "step": 718, | |
| "train_runtime": 8126.2707, | |
| "train_tokens_per_second": 10353.896 | |
| }, | |
| { | |
| "epoch": 0.924461587913854, | |
| "grad_norm": 1.8658959865570068, | |
| "learning_rate": 1.5523932729624839e-06, | |
| "loss": 1.042, | |
| "num_input_tokens_seen": 84260672, | |
| "step": 719, | |
| "train_runtime": 8137.107, | |
| "train_tokens_per_second": 10355.114 | |
| }, | |
| { | |
| "epoch": 0.9257473481195757, | |
| "grad_norm": 2.0019772052764893, | |
| "learning_rate": 1.5265200517464426e-06, | |
| "loss": 1.1432, | |
| "num_input_tokens_seen": 84396768, | |
| "step": 720, | |
| "train_runtime": 8149.6434, | |
| "train_tokens_per_second": 10355.885 | |
| }, | |
| { | |
| "epoch": 0.9270331083252973, | |
| "grad_norm": 1.8118327856063843, | |
| "learning_rate": 1.5006468305304011e-06, | |
| "loss": 1.0152, | |
| "num_input_tokens_seen": 84505152, | |
| "step": 721, | |
| "train_runtime": 8175.6795, | |
| "train_tokens_per_second": 10336.163 | |
| }, | |
| { | |
| "epoch": 0.928318868531019, | |
| "grad_norm": 1.8588857650756836, | |
| "learning_rate": 1.4747736093143597e-06, | |
| "loss": 1.0345, | |
| "num_input_tokens_seen": 84622880, | |
| "step": 722, | |
| "train_runtime": 8185.9126, | |
| "train_tokens_per_second": 10337.623 | |
| }, | |
| { | |
| "epoch": 0.9296046287367405, | |
| "grad_norm": 1.9721977710723877, | |
| "learning_rate": 1.4489003880983182e-06, | |
| "loss": 0.9971, | |
| "num_input_tokens_seen": 84703392, | |
| "step": 723, | |
| "train_runtime": 8192.5908, | |
| "train_tokens_per_second": 10339.024 | |
| }, | |
| { | |
| "epoch": 0.9308903889424622, | |
| "grad_norm": 1.8980185985565186, | |
| "learning_rate": 1.423027166882277e-06, | |
| "loss": 1.1035, | |
| "num_input_tokens_seen": 84808768, | |
| "step": 724, | |
| "train_runtime": 8201.5607, | |
| "train_tokens_per_second": 10340.565 | |
| }, | |
| { | |
| "epoch": 0.9321761491481839, | |
| "grad_norm": 1.9349688291549683, | |
| "learning_rate": 1.3971539456662355e-06, | |
| "loss": 1.0111, | |
| "num_input_tokens_seen": 84913856, | |
| "step": 725, | |
| "train_runtime": 8210.5039, | |
| "train_tokens_per_second": 10342.1 | |
| }, | |
| { | |
| "epoch": 0.9334619093539055, | |
| "grad_norm": 1.8501139879226685, | |
| "learning_rate": 1.371280724450194e-06, | |
| "loss": 1.0002, | |
| "num_input_tokens_seen": 85059104, | |
| "step": 726, | |
| "train_runtime": 8223.8201, | |
| "train_tokens_per_second": 10343.016 | |
| }, | |
| { | |
| "epoch": 0.9347476695596272, | |
| "grad_norm": 1.839609146118164, | |
| "learning_rate": 1.3454075032341526e-06, | |
| "loss": 1.0067, | |
| "num_input_tokens_seen": 85222624, | |
| "step": 727, | |
| "train_runtime": 8239.0013, | |
| "train_tokens_per_second": 10343.805 | |
| }, | |
| { | |
| "epoch": 0.9360334297653488, | |
| "grad_norm": 1.8927664756774902, | |
| "learning_rate": 1.3195342820181116e-06, | |
| "loss": 1.0748, | |
| "num_input_tokens_seen": 85403168, | |
| "step": 728, | |
| "train_runtime": 8256.2939, | |
| "train_tokens_per_second": 10344.008 | |
| }, | |
| { | |
| "epoch": 0.9373191899710704, | |
| "grad_norm": 1.9910334348678589, | |
| "learning_rate": 1.29366106080207e-06, | |
| "loss": 1.065, | |
| "num_input_tokens_seen": 85504928, | |
| "step": 729, | |
| "train_runtime": 8265.046, | |
| "train_tokens_per_second": 10345.366 | |
| }, | |
| { | |
| "epoch": 0.938604950176792, | |
| "grad_norm": 2.0429680347442627, | |
| "learning_rate": 1.2677878395860284e-06, | |
| "loss": 1.0859, | |
| "num_input_tokens_seen": 85584480, | |
| "step": 730, | |
| "train_runtime": 8271.7915, | |
| "train_tokens_per_second": 10346.547 | |
| }, | |
| { | |
| "epoch": 0.9398907103825137, | |
| "grad_norm": 1.899824619293213, | |
| "learning_rate": 1.2419146183699872e-06, | |
| "loss": 1.0421, | |
| "num_input_tokens_seen": 85722336, | |
| "step": 731, | |
| "train_runtime": 8284.1914, | |
| "train_tokens_per_second": 10347.701 | |
| }, | |
| { | |
| "epoch": 0.9411764705882353, | |
| "grad_norm": 1.7903647422790527, | |
| "learning_rate": 1.2160413971539457e-06, | |
| "loss": 0.9449, | |
| "num_input_tokens_seen": 85865184, | |
| "step": 732, | |
| "train_runtime": 8297.6936, | |
| "train_tokens_per_second": 10348.078 | |
| }, | |
| { | |
| "epoch": 0.942462230793957, | |
| "grad_norm": 1.8359401226043701, | |
| "learning_rate": 1.1901681759379045e-06, | |
| "loss": 1.0292, | |
| "num_input_tokens_seen": 85976832, | |
| "step": 733, | |
| "train_runtime": 8307.6144, | |
| "train_tokens_per_second": 10349.16 | |
| }, | |
| { | |
| "epoch": 0.9437479909996785, | |
| "grad_norm": 1.7849318981170654, | |
| "learning_rate": 1.164294954721863e-06, | |
| "loss": 0.9646, | |
| "num_input_tokens_seen": 86061920, | |
| "step": 734, | |
| "train_runtime": 8314.8905, | |
| "train_tokens_per_second": 10350.337 | |
| }, | |
| { | |
| "epoch": 0.9450337512054002, | |
| "grad_norm": 1.92512845993042, | |
| "learning_rate": 1.1384217335058215e-06, | |
| "loss": 0.9865, | |
| "num_input_tokens_seen": 86189248, | |
| "step": 735, | |
| "train_runtime": 8326.2348, | |
| "train_tokens_per_second": 10351.527 | |
| }, | |
| { | |
| "epoch": 0.9463195114111218, | |
| "grad_norm": 1.8651082515716553, | |
| "learning_rate": 1.11254851228978e-06, | |
| "loss": 1.0223, | |
| "num_input_tokens_seen": 86316320, | |
| "step": 736, | |
| "train_runtime": 8337.4327, | |
| "train_tokens_per_second": 10352.866 | |
| }, | |
| { | |
| "epoch": 0.9476052716168435, | |
| "grad_norm": 2.024437189102173, | |
| "learning_rate": 1.0866752910737388e-06, | |
| "loss": 1.1516, | |
| "num_input_tokens_seen": 86437952, | |
| "step": 737, | |
| "train_runtime": 8348.1965, | |
| "train_tokens_per_second": 10354.087 | |
| }, | |
| { | |
| "epoch": 0.9488910318225651, | |
| "grad_norm": 1.9123945236206055, | |
| "learning_rate": 1.0608020698576974e-06, | |
| "loss": 1.049, | |
| "num_input_tokens_seen": 86553120, | |
| "step": 738, | |
| "train_runtime": 8358.151, | |
| "train_tokens_per_second": 10355.534 | |
| }, | |
| { | |
| "epoch": 0.9501767920282868, | |
| "grad_norm": 1.8395739793777466, | |
| "learning_rate": 1.0349288486416561e-06, | |
| "loss": 1.095, | |
| "num_input_tokens_seen": 86637792, | |
| "step": 739, | |
| "train_runtime": 8365.3725, | |
| "train_tokens_per_second": 10356.717 | |
| }, | |
| { | |
| "epoch": 0.9514625522340083, | |
| "grad_norm": 1.8441441059112549, | |
| "learning_rate": 1.0090556274256147e-06, | |
| "loss": 1.0399, | |
| "num_input_tokens_seen": 86779232, | |
| "step": 740, | |
| "train_runtime": 8378.4531, | |
| "train_tokens_per_second": 10357.429 | |
| }, | |
| { | |
| "epoch": 0.95274831243973, | |
| "grad_norm": 1.9400453567504883, | |
| "learning_rate": 9.831824062095732e-07, | |
| "loss": 1.0772, | |
| "num_input_tokens_seen": 86871712, | |
| "step": 741, | |
| "train_runtime": 8386.2953, | |
| "train_tokens_per_second": 10358.771 | |
| }, | |
| { | |
| "epoch": 0.9540340726454516, | |
| "grad_norm": 1.7376289367675781, | |
| "learning_rate": 9.573091849935317e-07, | |
| "loss": 0.9707, | |
| "num_input_tokens_seen": 87009664, | |
| "step": 742, | |
| "train_runtime": 8398.846, | |
| "train_tokens_per_second": 10359.717 | |
| }, | |
| { | |
| "epoch": 0.9553198328511733, | |
| "grad_norm": 1.8850547075271606, | |
| "learning_rate": 9.314359637774904e-07, | |
| "loss": 1.0961, | |
| "num_input_tokens_seen": 87136544, | |
| "step": 743, | |
| "train_runtime": 8410.4197, | |
| "train_tokens_per_second": 10360.546 | |
| }, | |
| { | |
| "epoch": 0.9566055930568949, | |
| "grad_norm": 1.964850664138794, | |
| "learning_rate": 9.055627425614489e-07, | |
| "loss": 1.0545, | |
| "num_input_tokens_seen": 87257664, | |
| "step": 744, | |
| "train_runtime": 8421.013, | |
| "train_tokens_per_second": 10361.896 | |
| }, | |
| { | |
| "epoch": 0.9578913532626165, | |
| "grad_norm": 1.853871464729309, | |
| "learning_rate": 8.796895213454077e-07, | |
| "loss": 0.9811, | |
| "num_input_tokens_seen": 87335232, | |
| "step": 745, | |
| "train_runtime": 8427.4933, | |
| "train_tokens_per_second": 10363.133 | |
| }, | |
| { | |
| "epoch": 0.9591771134683381, | |
| "grad_norm": 1.8630493879318237, | |
| "learning_rate": 8.538163001293662e-07, | |
| "loss": 1.0717, | |
| "num_input_tokens_seen": 87423904, | |
| "step": 746, | |
| "train_runtime": 8434.9496, | |
| "train_tokens_per_second": 10364.484 | |
| }, | |
| { | |
| "epoch": 0.9604628736740598, | |
| "grad_norm": 1.965602159500122, | |
| "learning_rate": 8.279430789133249e-07, | |
| "loss": 1.0034, | |
| "num_input_tokens_seen": 87578368, | |
| "step": 747, | |
| "train_runtime": 8449.1667, | |
| "train_tokens_per_second": 10365.326 | |
| }, | |
| { | |
| "epoch": 0.9617486338797814, | |
| "grad_norm": 2.018232822418213, | |
| "learning_rate": 8.020698576972834e-07, | |
| "loss": 1.1624, | |
| "num_input_tokens_seen": 87677056, | |
| "step": 748, | |
| "train_runtime": 8457.5855, | |
| "train_tokens_per_second": 10366.677 | |
| }, | |
| { | |
| "epoch": 0.9630343940855031, | |
| "grad_norm": 1.9769020080566406, | |
| "learning_rate": 7.761966364812419e-07, | |
| "loss": 1.0854, | |
| "num_input_tokens_seen": 87789760, | |
| "step": 749, | |
| "train_runtime": 8467.576, | |
| "train_tokens_per_second": 10367.756 | |
| }, | |
| { | |
| "epoch": 0.9643201542912246, | |
| "grad_norm": 1.8354781866073608, | |
| "learning_rate": 7.503234152652006e-07, | |
| "loss": 1.0912, | |
| "num_input_tokens_seen": 87898272, | |
| "step": 750, | |
| "train_runtime": 8476.9893, | |
| "train_tokens_per_second": 10369.044 | |
| }, | |
| { | |
| "epoch": 0.9656059144969463, | |
| "grad_norm": 1.9885339736938477, | |
| "learning_rate": 7.244501940491591e-07, | |
| "loss": 1.1578, | |
| "num_input_tokens_seen": 88005184, | |
| "step": 751, | |
| "train_runtime": 8502.9158, | |
| "train_tokens_per_second": 10350.001 | |
| }, | |
| { | |
| "epoch": 0.9668916747026679, | |
| "grad_norm": 1.799993872642517, | |
| "learning_rate": 6.985769728331178e-07, | |
| "loss": 1.0968, | |
| "num_input_tokens_seen": 88145856, | |
| "step": 752, | |
| "train_runtime": 8515.7908, | |
| "train_tokens_per_second": 10350.871 | |
| }, | |
| { | |
| "epoch": 0.9681774349083896, | |
| "grad_norm": 1.7286502122879028, | |
| "learning_rate": 6.727037516170763e-07, | |
| "loss": 1.0199, | |
| "num_input_tokens_seen": 88253472, | |
| "step": 753, | |
| "train_runtime": 8525.1284, | |
| "train_tokens_per_second": 10352.157 | |
| }, | |
| { | |
| "epoch": 0.9694631951141112, | |
| "grad_norm": 1.8545376062393188, | |
| "learning_rate": 6.46830530401035e-07, | |
| "loss": 1.0294, | |
| "num_input_tokens_seen": 88410112, | |
| "step": 754, | |
| "train_runtime": 8540.0868, | |
| "train_tokens_per_second": 10352.367 | |
| }, | |
| { | |
| "epoch": 0.9707489553198329, | |
| "grad_norm": 1.7983657121658325, | |
| "learning_rate": 6.209573091849936e-07, | |
| "loss": 1.0312, | |
| "num_input_tokens_seen": 88517184, | |
| "step": 755, | |
| "train_runtime": 8549.4704, | |
| "train_tokens_per_second": 10353.528 | |
| }, | |
| { | |
| "epoch": 0.9720347155255545, | |
| "grad_norm": 1.9300833940505981, | |
| "learning_rate": 5.950840879689522e-07, | |
| "loss": 0.9773, | |
| "num_input_tokens_seen": 88644960, | |
| "step": 756, | |
| "train_runtime": 8561.4036, | |
| "train_tokens_per_second": 10354.022 | |
| }, | |
| { | |
| "epoch": 0.9733204757312761, | |
| "grad_norm": 1.8282893896102905, | |
| "learning_rate": 5.692108667529108e-07, | |
| "loss": 0.9824, | |
| "num_input_tokens_seen": 88763680, | |
| "step": 757, | |
| "train_runtime": 8572.4426, | |
| "train_tokens_per_second": 10354.538 | |
| }, | |
| { | |
| "epoch": 0.9746062359369978, | |
| "grad_norm": 2.0415329933166504, | |
| "learning_rate": 5.433376455368694e-07, | |
| "loss": 1.0697, | |
| "num_input_tokens_seen": 88915392, | |
| "step": 758, | |
| "train_runtime": 8586.3403, | |
| "train_tokens_per_second": 10355.447 | |
| }, | |
| { | |
| "epoch": 0.9758919961427194, | |
| "grad_norm": 1.8638561964035034, | |
| "learning_rate": 5.174644243208281e-07, | |
| "loss": 1.1258, | |
| "num_input_tokens_seen": 89018304, | |
| "step": 759, | |
| "train_runtime": 8595.2138, | |
| "train_tokens_per_second": 10356.729 | |
| }, | |
| { | |
| "epoch": 0.9771777563484411, | |
| "grad_norm": 1.989698886871338, | |
| "learning_rate": 4.915912031047866e-07, | |
| "loss": 1.0544, | |
| "num_input_tokens_seen": 89134688, | |
| "step": 760, | |
| "train_runtime": 8605.465, | |
| "train_tokens_per_second": 10357.916 | |
| }, | |
| { | |
| "epoch": 0.9784635165541626, | |
| "grad_norm": 1.9920203685760498, | |
| "learning_rate": 4.657179818887452e-07, | |
| "loss": 0.9777, | |
| "num_input_tokens_seen": 89292992, | |
| "step": 761, | |
| "train_runtime": 8620.2862, | |
| "train_tokens_per_second": 10358.472 | |
| }, | |
| { | |
| "epoch": 0.9797492767598843, | |
| "grad_norm": 1.792285680770874, | |
| "learning_rate": 4.3984476067270383e-07, | |
| "loss": 1.011, | |
| "num_input_tokens_seen": 89397312, | |
| "step": 762, | |
| "train_runtime": 8629.3843, | |
| "train_tokens_per_second": 10359.64 | |
| }, | |
| { | |
| "epoch": 0.9810350369656059, | |
| "grad_norm": 1.7668837308883667, | |
| "learning_rate": 4.139715394566624e-07, | |
| "loss": 1.0001, | |
| "num_input_tokens_seen": 89473952, | |
| "step": 763, | |
| "train_runtime": 8635.848, | |
| "train_tokens_per_second": 10360.76 | |
| }, | |
| { | |
| "epoch": 0.9823207971713276, | |
| "grad_norm": 2.0289688110351562, | |
| "learning_rate": 3.8809831824062096e-07, | |
| "loss": 1.0785, | |
| "num_input_tokens_seen": 89572416, | |
| "step": 764, | |
| "train_runtime": 8644.254, | |
| "train_tokens_per_second": 10362.076 | |
| }, | |
| { | |
| "epoch": 0.9836065573770492, | |
| "grad_norm": 1.9272173643112183, | |
| "learning_rate": 3.6222509702457956e-07, | |
| "loss": 1.0206, | |
| "num_input_tokens_seen": 89671456, | |
| "step": 765, | |
| "train_runtime": 8652.7996, | |
| "train_tokens_per_second": 10363.288 | |
| }, | |
| { | |
| "epoch": 0.9848923175827708, | |
| "grad_norm": 2.0589964389801025, | |
| "learning_rate": 3.3635187580853815e-07, | |
| "loss": 1.029, | |
| "num_input_tokens_seen": 89745216, | |
| "step": 766, | |
| "train_runtime": 8659.0809, | |
| "train_tokens_per_second": 10364.289 | |
| }, | |
| { | |
| "epoch": 0.9861780777884924, | |
| "grad_norm": 1.846987247467041, | |
| "learning_rate": 3.104786545924968e-07, | |
| "loss": 1.0234, | |
| "num_input_tokens_seen": 89840896, | |
| "step": 767, | |
| "train_runtime": 8667.3147, | |
| "train_tokens_per_second": 10365.482 | |
| }, | |
| { | |
| "epoch": 0.9874638379942141, | |
| "grad_norm": 1.9260659217834473, | |
| "learning_rate": 2.846054333764554e-07, | |
| "loss": 1.2661, | |
| "num_input_tokens_seen": 89958592, | |
| "step": 768, | |
| "train_runtime": 8677.7751, | |
| "train_tokens_per_second": 10366.55 | |
| }, | |
| { | |
| "epoch": 0.9887495981999357, | |
| "grad_norm": 1.8034597635269165, | |
| "learning_rate": 2.5873221216041403e-07, | |
| "loss": 1.016, | |
| "num_input_tokens_seen": 90066944, | |
| "step": 769, | |
| "train_runtime": 8687.2356, | |
| "train_tokens_per_second": 10367.734 | |
| }, | |
| { | |
| "epoch": 0.9900353584056574, | |
| "grad_norm": 1.848668098449707, | |
| "learning_rate": 2.328589909443726e-07, | |
| "loss": 1.1509, | |
| "num_input_tokens_seen": 90199456, | |
| "step": 770, | |
| "train_runtime": 8699.3479, | |
| "train_tokens_per_second": 10368.531 | |
| }, | |
| { | |
| "epoch": 0.991321118611379, | |
| "grad_norm": 1.843025803565979, | |
| "learning_rate": 2.069857697283312e-07, | |
| "loss": 1.4619, | |
| "num_input_tokens_seen": 90314368, | |
| "step": 771, | |
| "train_runtime": 8709.3929, | |
| "train_tokens_per_second": 10369.766 | |
| }, | |
| { | |
| "epoch": 0.9926068788171006, | |
| "grad_norm": 1.9316155910491943, | |
| "learning_rate": 1.8111254851228978e-07, | |
| "loss": 1.1308, | |
| "num_input_tokens_seen": 90455488, | |
| "step": 772, | |
| "train_runtime": 8722.3601, | |
| "train_tokens_per_second": 10370.529 | |
| }, | |
| { | |
| "epoch": 0.9938926390228222, | |
| "grad_norm": 1.8842840194702148, | |
| "learning_rate": 1.552393272962484e-07, | |
| "loss": 1.181, | |
| "num_input_tokens_seen": 90566848, | |
| "step": 773, | |
| "train_runtime": 8732.2133, | |
| "train_tokens_per_second": 10371.58 | |
| }, | |
| { | |
| "epoch": 0.9951783992285439, | |
| "grad_norm": 1.918171763420105, | |
| "learning_rate": 1.2936610608020701e-07, | |
| "loss": 1.0189, | |
| "num_input_tokens_seen": 90670336, | |
| "step": 774, | |
| "train_runtime": 8741.1414, | |
| "train_tokens_per_second": 10372.826 | |
| }, | |
| { | |
| "epoch": 0.9964641594342655, | |
| "grad_norm": 2.0272796154022217, | |
| "learning_rate": 1.034928848641656e-07, | |
| "loss": 1.0934, | |
| "num_input_tokens_seen": 90764096, | |
| "step": 775, | |
| "train_runtime": 8749.2474, | |
| "train_tokens_per_second": 10373.932 | |
| }, | |
| { | |
| "epoch": 0.9977499196399872, | |
| "grad_norm": 1.906491994857788, | |
| "learning_rate": 7.76196636481242e-08, | |
| "loss": 1.0435, | |
| "num_input_tokens_seen": 90880416, | |
| "step": 776, | |
| "train_runtime": 8759.5236, | |
| "train_tokens_per_second": 10375.041 | |
| }, | |
| { | |
| "epoch": 0.9990356798457087, | |
| "grad_norm": 1.8904526233673096, | |
| "learning_rate": 5.17464424320828e-08, | |
| "loss": 1.0791, | |
| "num_input_tokens_seen": 91001792, | |
| "step": 777, | |
| "train_runtime": 8770.7656, | |
| "train_tokens_per_second": 10375.581 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 2.2318460941314697, | |
| "learning_rate": 2.58732212160414e-08, | |
| "loss": 0.9926, | |
| "num_input_tokens_seen": 91103430, | |
| "step": 778, | |
| "train_runtime": 8781.8231, | |
| "train_tokens_per_second": 10374.091 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 778, | |
| "num_input_tokens_seen": 91103430, | |
| "num_train_epochs": 1, | |
| "save_steps": 30, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.5167484420599808e+18, | |
| "train_batch_size": 32, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |