Instructions to use FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("unsloth/Qwen2.5-7B-Instruct") model = PeftModel.from_pretrained(base_model, "FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth") - Transformers
How to use FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth
- SGLang
How to use FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Unsloth Studio
How to use FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth", max_seq_length=2048, ) - Docker Model Runner
How to use FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth with Docker Model Runner:
docker model run hf.co/FormlessAI/Qwen2.5-7B-Instruct-Reasoning-Unsloth
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.0, | |
| "eval_steps": 156, | |
| "global_step": 1556, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0006428801028608164, | |
| "grad_norm": 1.4815346002578735, | |
| "learning_rate": 0.0, | |
| "loss": 3.0354, | |
| "num_input_tokens_seen": 58240, | |
| "step": 1, | |
| "train_runtime": 14.0904, | |
| "train_tokens_per_second": 4133.31 | |
| }, | |
| { | |
| "epoch": 0.0012857602057216328, | |
| "grad_norm": 1.3779746294021606, | |
| "learning_rate": 4e-05, | |
| "loss": 2.9584, | |
| "num_input_tokens_seen": 102384, | |
| "step": 2, | |
| "train_runtime": 20.0807, | |
| "train_tokens_per_second": 5098.638 | |
| }, | |
| { | |
| "epoch": 0.0019286403085824494, | |
| "grad_norm": 1.3874965906143188, | |
| "learning_rate": 8e-05, | |
| "loss": 3.1628, | |
| "num_input_tokens_seen": 164480, | |
| "step": 3, | |
| "train_runtime": 29.0202, | |
| "train_tokens_per_second": 5667.774 | |
| }, | |
| { | |
| "epoch": 0.0025715204114432656, | |
| "grad_norm": 1.467178225517273, | |
| "learning_rate": 0.00012, | |
| "loss": 2.8477, | |
| "num_input_tokens_seen": 227360, | |
| "step": 4, | |
| "train_runtime": 37.6089, | |
| "train_tokens_per_second": 6045.37 | |
| }, | |
| { | |
| "epoch": 0.0032144005143040825, | |
| "grad_norm": 1.5457735061645508, | |
| "learning_rate": 0.00016, | |
| "loss": 2.7233, | |
| "num_input_tokens_seen": 264512, | |
| "step": 5, | |
| "train_runtime": 42.7595, | |
| "train_tokens_per_second": 6186.034 | |
| }, | |
| { | |
| "epoch": 0.003857280617164899, | |
| "grad_norm": 1.178829312324524, | |
| "learning_rate": 0.0002, | |
| "loss": 2.1801, | |
| "num_input_tokens_seen": 309424, | |
| "step": 6, | |
| "train_runtime": 48.9842, | |
| "train_tokens_per_second": 6316.809 | |
| }, | |
| { | |
| "epoch": 0.004500160720025715, | |
| "grad_norm": 0.8789910078048706, | |
| "learning_rate": 0.00019987105093488073, | |
| "loss": 1.8974, | |
| "num_input_tokens_seen": 402160, | |
| "step": 7, | |
| "train_runtime": 61.7856, | |
| "train_tokens_per_second": 6508.96 | |
| }, | |
| { | |
| "epoch": 0.005143040822886531, | |
| "grad_norm": 0.673732578754425, | |
| "learning_rate": 0.00019974210186976145, | |
| "loss": 1.7119, | |
| "num_input_tokens_seen": 438624, | |
| "step": 8, | |
| "train_runtime": 66.8435, | |
| "train_tokens_per_second": 6561.957 | |
| }, | |
| { | |
| "epoch": 0.0057859209257473485, | |
| "grad_norm": 0.521441638469696, | |
| "learning_rate": 0.00019961315280464216, | |
| "loss": 1.4815, | |
| "num_input_tokens_seen": 486400, | |
| "step": 9, | |
| "train_runtime": 73.4648, | |
| "train_tokens_per_second": 6620.858 | |
| }, | |
| { | |
| "epoch": 0.006428801028608165, | |
| "grad_norm": 0.6127826571464539, | |
| "learning_rate": 0.0001994842037395229, | |
| "loss": 1.5544, | |
| "num_input_tokens_seen": 542512, | |
| "step": 10, | |
| "train_runtime": 81.1977, | |
| "train_tokens_per_second": 6681.374 | |
| }, | |
| { | |
| "epoch": 0.007071681131468981, | |
| "grad_norm": 0.640856146812439, | |
| "learning_rate": 0.0001993552546744036, | |
| "loss": 1.4353, | |
| "num_input_tokens_seen": 588752, | |
| "step": 11, | |
| "train_runtime": 87.6246, | |
| "train_tokens_per_second": 6719.029 | |
| }, | |
| { | |
| "epoch": 0.007714561234329798, | |
| "grad_norm": 0.48673883080482483, | |
| "learning_rate": 0.00019922630560928435, | |
| "loss": 1.3777, | |
| "num_input_tokens_seen": 652208, | |
| "step": 12, | |
| "train_runtime": 96.4514, | |
| "train_tokens_per_second": 6762.039 | |
| }, | |
| { | |
| "epoch": 0.008357441337190614, | |
| "grad_norm": 0.7254194021224976, | |
| "learning_rate": 0.00019909735654416506, | |
| "loss": 1.534, | |
| "num_input_tokens_seen": 713088, | |
| "step": 13, | |
| "train_runtime": 104.9169, | |
| "train_tokens_per_second": 6796.692 | |
| }, | |
| { | |
| "epoch": 0.00900032144005143, | |
| "grad_norm": 0.43824103474617004, | |
| "learning_rate": 0.00019896840747904578, | |
| "loss": 1.3674, | |
| "num_input_tokens_seen": 755024, | |
| "step": 14, | |
| "train_runtime": 110.719, | |
| "train_tokens_per_second": 6819.28 | |
| }, | |
| { | |
| "epoch": 0.009643201542912247, | |
| "grad_norm": 0.3844089210033417, | |
| "learning_rate": 0.0001988394584139265, | |
| "loss": 1.3111, | |
| "num_input_tokens_seen": 804912, | |
| "step": 15, | |
| "train_runtime": 117.6264, | |
| "train_tokens_per_second": 6842.954 | |
| }, | |
| { | |
| "epoch": 0.010286081645773062, | |
| "grad_norm": 0.35496699810028076, | |
| "learning_rate": 0.00019871050934880725, | |
| "loss": 1.2114, | |
| "num_input_tokens_seen": 873424, | |
| "step": 16, | |
| "train_runtime": 127.1638, | |
| "train_tokens_per_second": 6868.496 | |
| }, | |
| { | |
| "epoch": 0.01092896174863388, | |
| "grad_norm": 0.43963053822517395, | |
| "learning_rate": 0.00019858156028368796, | |
| "loss": 1.1994, | |
| "num_input_tokens_seen": 907520, | |
| "step": 17, | |
| "train_runtime": 131.9627, | |
| "train_tokens_per_second": 6877.095 | |
| }, | |
| { | |
| "epoch": 0.011571841851494697, | |
| "grad_norm": 0.33540457487106323, | |
| "learning_rate": 0.00019845261121856868, | |
| "loss": 1.254, | |
| "num_input_tokens_seen": 952896, | |
| "step": 18, | |
| "train_runtime": 138.2745, | |
| "train_tokens_per_second": 6891.337 | |
| }, | |
| { | |
| "epoch": 0.012214721954355513, | |
| "grad_norm": 0.2950117588043213, | |
| "learning_rate": 0.0001983236621534494, | |
| "loss": 1.1624, | |
| "num_input_tokens_seen": 1005344, | |
| "step": 19, | |
| "train_runtime": 145.6011, | |
| "train_tokens_per_second": 6904.781 | |
| }, | |
| { | |
| "epoch": 0.01285760205721633, | |
| "grad_norm": 0.2870226502418518, | |
| "learning_rate": 0.00019819471308833012, | |
| "loss": 1.1386, | |
| "num_input_tokens_seen": 1040544, | |
| "step": 20, | |
| "train_runtime": 150.5659, | |
| "train_tokens_per_second": 6910.886 | |
| }, | |
| { | |
| "epoch": 0.013500482160077145, | |
| "grad_norm": 0.27605196833610535, | |
| "learning_rate": 0.00019806576402321084, | |
| "loss": 1.2057, | |
| "num_input_tokens_seen": 1080432, | |
| "step": 21, | |
| "train_runtime": 156.1378, | |
| "train_tokens_per_second": 6919.735 | |
| }, | |
| { | |
| "epoch": 0.014143362262937963, | |
| "grad_norm": 0.29624828696250916, | |
| "learning_rate": 0.00019793681495809155, | |
| "loss": 1.2303, | |
| "num_input_tokens_seen": 1148496, | |
| "step": 22, | |
| "train_runtime": 165.7289, | |
| "train_tokens_per_second": 6929.969 | |
| }, | |
| { | |
| "epoch": 0.014786242365798778, | |
| "grad_norm": 0.2731878459453583, | |
| "learning_rate": 0.0001978078658929723, | |
| "loss": 1.0739, | |
| "num_input_tokens_seen": 1189760, | |
| "step": 23, | |
| "train_runtime": 171.4728, | |
| "train_tokens_per_second": 6938.478 | |
| }, | |
| { | |
| "epoch": 0.015429122468659595, | |
| "grad_norm": 0.33944907784461975, | |
| "learning_rate": 0.000197678916827853, | |
| "loss": 1.0303, | |
| "num_input_tokens_seen": 1226432, | |
| "step": 24, | |
| "train_runtime": 176.634, | |
| "train_tokens_per_second": 6943.352 | |
| }, | |
| { | |
| "epoch": 0.016072002571520413, | |
| "grad_norm": 0.2622462511062622, | |
| "learning_rate": 0.00019754996776273374, | |
| "loss": 1.3015, | |
| "num_input_tokens_seen": 1266848, | |
| "step": 25, | |
| "train_runtime": 182.3158, | |
| "train_tokens_per_second": 6948.647 | |
| }, | |
| { | |
| "epoch": 0.01671488267438123, | |
| "grad_norm": 0.24616512656211853, | |
| "learning_rate": 0.00019742101869761445, | |
| "loss": 1.1244, | |
| "num_input_tokens_seen": 1323584, | |
| "step": 26, | |
| "train_runtime": 190.2408, | |
| "train_tokens_per_second": 6957.415 | |
| }, | |
| { | |
| "epoch": 0.017357762777242044, | |
| "grad_norm": 0.23589050769805908, | |
| "learning_rate": 0.00019729206963249517, | |
| "loss": 1.1235, | |
| "num_input_tokens_seen": 1361104, | |
| "step": 27, | |
| "train_runtime": 195.5135, | |
| "train_tokens_per_second": 6961.687 | |
| }, | |
| { | |
| "epoch": 0.01800064288010286, | |
| "grad_norm": 0.23991915583610535, | |
| "learning_rate": 0.0001971631205673759, | |
| "loss": 1.1462, | |
| "num_input_tokens_seen": 1398528, | |
| "step": 28, | |
| "train_runtime": 200.794, | |
| "train_tokens_per_second": 6964.989 | |
| }, | |
| { | |
| "epoch": 0.01864352298296368, | |
| "grad_norm": 0.2634638547897339, | |
| "learning_rate": 0.00019703417150225663, | |
| "loss": 1.2721, | |
| "num_input_tokens_seen": 1435776, | |
| "step": 29, | |
| "train_runtime": 206.0467, | |
| "train_tokens_per_second": 6968.207 | |
| }, | |
| { | |
| "epoch": 0.019286403085824494, | |
| "grad_norm": 0.19377130270004272, | |
| "learning_rate": 0.00019690522243713733, | |
| "loss": 1.1832, | |
| "num_input_tokens_seen": 1478496, | |
| "step": 30, | |
| "train_runtime": 212.0993, | |
| "train_tokens_per_second": 6970.772 | |
| }, | |
| { | |
| "epoch": 0.01992928318868531, | |
| "grad_norm": 0.18850353360176086, | |
| "learning_rate": 0.00019677627337201807, | |
| "loss": 1.0619, | |
| "num_input_tokens_seen": 1532256, | |
| "step": 31, | |
| "train_runtime": 220.2613, | |
| "train_tokens_per_second": 6956.537 | |
| }, | |
| { | |
| "epoch": 0.020572163291546125, | |
| "grad_norm": 0.17500188946723938, | |
| "learning_rate": 0.0001966473243068988, | |
| "loss": 1.1776, | |
| "num_input_tokens_seen": 1579456, | |
| "step": 32, | |
| "train_runtime": 226.8725, | |
| "train_tokens_per_second": 6961.867 | |
| }, | |
| { | |
| "epoch": 0.021215043394406944, | |
| "grad_norm": 0.21095849573612213, | |
| "learning_rate": 0.0001965183752417795, | |
| "loss": 1.1431, | |
| "num_input_tokens_seen": 1624896, | |
| "step": 33, | |
| "train_runtime": 233.2234, | |
| "train_tokens_per_second": 6967.124 | |
| }, | |
| { | |
| "epoch": 0.02185792349726776, | |
| "grad_norm": 0.18223783373832703, | |
| "learning_rate": 0.00019638942617666023, | |
| "loss": 1.1791, | |
| "num_input_tokens_seen": 1669808, | |
| "step": 34, | |
| "train_runtime": 239.4782, | |
| "train_tokens_per_second": 6972.692 | |
| }, | |
| { | |
| "epoch": 0.022500803600128575, | |
| "grad_norm": 0.21014757454395294, | |
| "learning_rate": 0.00019626047711154094, | |
| "loss": 1.1142, | |
| "num_input_tokens_seen": 1738240, | |
| "step": 35, | |
| "train_runtime": 249.0199, | |
| "train_tokens_per_second": 6980.327 | |
| }, | |
| { | |
| "epoch": 0.023143683702989394, | |
| "grad_norm": 0.19807523488998413, | |
| "learning_rate": 0.0001961315280464217, | |
| "loss": 1.2255, | |
| "num_input_tokens_seen": 1788656, | |
| "step": 36, | |
| "train_runtime": 256.0945, | |
| "train_tokens_per_second": 6984.36 | |
| }, | |
| { | |
| "epoch": 0.02378656380585021, | |
| "grad_norm": 0.2257339507341385, | |
| "learning_rate": 0.00019600257898130238, | |
| "loss": 1.1833, | |
| "num_input_tokens_seen": 1830592, | |
| "step": 37, | |
| "train_runtime": 262.0096, | |
| "train_tokens_per_second": 6986.737 | |
| }, | |
| { | |
| "epoch": 0.024429443908711025, | |
| "grad_norm": 0.16706082224845886, | |
| "learning_rate": 0.00019587362991618313, | |
| "loss": 1.0836, | |
| "num_input_tokens_seen": 1889488, | |
| "step": 38, | |
| "train_runtime": 270.2441, | |
| "train_tokens_per_second": 6991.783 | |
| }, | |
| { | |
| "epoch": 0.02507232401157184, | |
| "grad_norm": 0.17788530886173248, | |
| "learning_rate": 0.00019574468085106384, | |
| "loss": 1.1416, | |
| "num_input_tokens_seen": 1926928, | |
| "step": 39, | |
| "train_runtime": 275.5398, | |
| "train_tokens_per_second": 6993.283 | |
| }, | |
| { | |
| "epoch": 0.02571520411443266, | |
| "grad_norm": 0.20560547709465027, | |
| "learning_rate": 0.00019561573178594456, | |
| "loss": 1.1354, | |
| "num_input_tokens_seen": 1975616, | |
| "step": 40, | |
| "train_runtime": 282.4472, | |
| "train_tokens_per_second": 6994.638 | |
| }, | |
| { | |
| "epoch": 0.026358084217293475, | |
| "grad_norm": 0.18634942173957825, | |
| "learning_rate": 0.00019548678272082528, | |
| "loss": 1.1416, | |
| "num_input_tokens_seen": 2020672, | |
| "step": 41, | |
| "train_runtime": 288.8056, | |
| "train_tokens_per_second": 6996.65 | |
| }, | |
| { | |
| "epoch": 0.02700096432015429, | |
| "grad_norm": 0.2036864012479782, | |
| "learning_rate": 0.00019535783365570602, | |
| "loss": 1.0778, | |
| "num_input_tokens_seen": 2059120, | |
| "step": 42, | |
| "train_runtime": 294.2046, | |
| "train_tokens_per_second": 6998.94 | |
| }, | |
| { | |
| "epoch": 0.027643844423015106, | |
| "grad_norm": 0.15779554843902588, | |
| "learning_rate": 0.00019522888459058672, | |
| "loss": 1.0298, | |
| "num_input_tokens_seen": 2113040, | |
| "step": 43, | |
| "train_runtime": 301.7907, | |
| "train_tokens_per_second": 7001.675 | |
| }, | |
| { | |
| "epoch": 0.028286724525875925, | |
| "grad_norm": 0.1940307766199112, | |
| "learning_rate": 0.00019509993552546746, | |
| "loss": 1.2145, | |
| "num_input_tokens_seen": 2168464, | |
| "step": 44, | |
| "train_runtime": 309.5156, | |
| "train_tokens_per_second": 7005.992 | |
| }, | |
| { | |
| "epoch": 0.02892960462873674, | |
| "grad_norm": 0.1537512242794037, | |
| "learning_rate": 0.00019497098646034818, | |
| "loss": 1.0519, | |
| "num_input_tokens_seen": 2221904, | |
| "step": 45, | |
| "train_runtime": 317.0459, | |
| "train_tokens_per_second": 7008.147 | |
| }, | |
| { | |
| "epoch": 0.029572484731597556, | |
| "grad_norm": 0.16348929703235626, | |
| "learning_rate": 0.0001948420373952289, | |
| "loss": 1.1651, | |
| "num_input_tokens_seen": 2261088, | |
| "step": 46, | |
| "train_runtime": 322.608, | |
| "train_tokens_per_second": 7008.778 | |
| }, | |
| { | |
| "epoch": 0.030215364834458372, | |
| "grad_norm": 0.1592399775981903, | |
| "learning_rate": 0.00019471308833010962, | |
| "loss": 1.0866, | |
| "num_input_tokens_seen": 2301040, | |
| "step": 47, | |
| "train_runtime": 328.2327, | |
| "train_tokens_per_second": 7010.392 | |
| }, | |
| { | |
| "epoch": 0.03085824493731919, | |
| "grad_norm": 0.15753492712974548, | |
| "learning_rate": 0.00019458413926499033, | |
| "loss": 1.2199, | |
| "num_input_tokens_seen": 2340080, | |
| "step": 48, | |
| "train_runtime": 333.7329, | |
| "train_tokens_per_second": 7011.835 | |
| }, | |
| { | |
| "epoch": 0.03150112504018, | |
| "grad_norm": 0.16081875562667847, | |
| "learning_rate": 0.00019445519019987105, | |
| "loss": 1.0763, | |
| "num_input_tokens_seen": 2385008, | |
| "step": 49, | |
| "train_runtime": 340.0525, | |
| "train_tokens_per_second": 7013.647 | |
| }, | |
| { | |
| "epoch": 0.032144005143040826, | |
| "grad_norm": 0.18117882311344147, | |
| "learning_rate": 0.00019432624113475177, | |
| "loss": 1.1252, | |
| "num_input_tokens_seen": 2424432, | |
| "step": 50, | |
| "train_runtime": 345.6231, | |
| "train_tokens_per_second": 7014.671 | |
| }, | |
| { | |
| "epoch": 0.03278688524590164, | |
| "grad_norm": 0.196014404296875, | |
| "learning_rate": 0.00019419729206963251, | |
| "loss": 1.1195, | |
| "num_input_tokens_seen": 2483664, | |
| "step": 51, | |
| "train_runtime": 353.9289, | |
| "train_tokens_per_second": 7017.409 | |
| }, | |
| { | |
| "epoch": 0.03342976534876246, | |
| "grad_norm": 0.17965562641620636, | |
| "learning_rate": 0.00019406834300451323, | |
| "loss": 1.1258, | |
| "num_input_tokens_seen": 2518352, | |
| "step": 52, | |
| "train_runtime": 358.8626, | |
| "train_tokens_per_second": 7017.594 | |
| }, | |
| { | |
| "epoch": 0.03407264545162327, | |
| "grad_norm": 0.1602979451417923, | |
| "learning_rate": 0.00019393939393939395, | |
| "loss": 1.0905, | |
| "num_input_tokens_seen": 2576704, | |
| "step": 53, | |
| "train_runtime": 367.0539, | |
| "train_tokens_per_second": 7019.961 | |
| }, | |
| { | |
| "epoch": 0.03471552555448409, | |
| "grad_norm": 0.17046068608760834, | |
| "learning_rate": 0.00019381044487427467, | |
| "loss": 1.1841, | |
| "num_input_tokens_seen": 2616624, | |
| "step": 54, | |
| "train_runtime": 372.6815, | |
| "train_tokens_per_second": 7021.074 | |
| }, | |
| { | |
| "epoch": 0.0353584056573449, | |
| "grad_norm": 0.15942060947418213, | |
| "learning_rate": 0.0001936814958091554, | |
| "loss": 1.0914, | |
| "num_input_tokens_seen": 2671344, | |
| "step": 55, | |
| "train_runtime": 380.3215, | |
| "train_tokens_per_second": 7023.911 | |
| }, | |
| { | |
| "epoch": 0.03600128576020572, | |
| "grad_norm": 0.17654664814472198, | |
| "learning_rate": 0.0001935525467440361, | |
| "loss": 1.0943, | |
| "num_input_tokens_seen": 2715520, | |
| "step": 56, | |
| "train_runtime": 386.5062, | |
| "train_tokens_per_second": 7025.813 | |
| }, | |
| { | |
| "epoch": 0.03664416586306654, | |
| "grad_norm": 0.23010510206222534, | |
| "learning_rate": 0.00019342359767891685, | |
| "loss": 1.1784, | |
| "num_input_tokens_seen": 2762960, | |
| "step": 57, | |
| "train_runtime": 393.1797, | |
| "train_tokens_per_second": 7027.219 | |
| }, | |
| { | |
| "epoch": 0.03728704596592736, | |
| "grad_norm": 0.17523719370365143, | |
| "learning_rate": 0.00019329464861379757, | |
| "loss": 1.1282, | |
| "num_input_tokens_seen": 2816064, | |
| "step": 58, | |
| "train_runtime": 400.6116, | |
| "train_tokens_per_second": 7029.413 | |
| }, | |
| { | |
| "epoch": 0.03792992606878817, | |
| "grad_norm": 0.21163171529769897, | |
| "learning_rate": 0.0001931656995486783, | |
| "loss": 1.0851, | |
| "num_input_tokens_seen": 2855264, | |
| "step": 59, | |
| "train_runtime": 406.1575, | |
| "train_tokens_per_second": 7029.942 | |
| }, | |
| { | |
| "epoch": 0.03857280617164899, | |
| "grad_norm": 0.25337469577789307, | |
| "learning_rate": 0.000193036750483559, | |
| "loss": 1.2117, | |
| "num_input_tokens_seen": 2904656, | |
| "step": 60, | |
| "train_runtime": 413.1009, | |
| "train_tokens_per_second": 7031.348 | |
| }, | |
| { | |
| "epoch": 0.0392156862745098, | |
| "grad_norm": 0.19712360203266144, | |
| "learning_rate": 0.00019290780141843972, | |
| "loss": 1.2204, | |
| "num_input_tokens_seen": 2971088, | |
| "step": 61, | |
| "train_runtime": 422.9897, | |
| "train_tokens_per_second": 7024.019 | |
| }, | |
| { | |
| "epoch": 0.03985856637737062, | |
| "grad_norm": 0.19821137189865112, | |
| "learning_rate": 0.00019277885235332044, | |
| "loss": 1.0626, | |
| "num_input_tokens_seen": 3013552, | |
| "step": 62, | |
| "train_runtime": 428.9561, | |
| "train_tokens_per_second": 7025.315 | |
| }, | |
| { | |
| "epoch": 0.040501446480231434, | |
| "grad_norm": 0.17856234312057495, | |
| "learning_rate": 0.00019264990328820116, | |
| "loss": 1.0619, | |
| "num_input_tokens_seen": 3059952, | |
| "step": 63, | |
| "train_runtime": 435.4318, | |
| "train_tokens_per_second": 7027.397 | |
| }, | |
| { | |
| "epoch": 0.04114432658309225, | |
| "grad_norm": 0.18660882115364075, | |
| "learning_rate": 0.0001925209542230819, | |
| "loss": 1.0679, | |
| "num_input_tokens_seen": 3107920, | |
| "step": 64, | |
| "train_runtime": 442.1457, | |
| "train_tokens_per_second": 7029.175 | |
| }, | |
| { | |
| "epoch": 0.04178720668595307, | |
| "grad_norm": 0.1943148672580719, | |
| "learning_rate": 0.0001923920051579626, | |
| "loss": 1.1859, | |
| "num_input_tokens_seen": 3155936, | |
| "step": 65, | |
| "train_runtime": 448.9004, | |
| "train_tokens_per_second": 7030.371 | |
| }, | |
| { | |
| "epoch": 0.04243008678881389, | |
| "grad_norm": 0.18507765233516693, | |
| "learning_rate": 0.00019226305609284334, | |
| "loss": 1.0599, | |
| "num_input_tokens_seen": 3190864, | |
| "step": 66, | |
| "train_runtime": 453.8531, | |
| "train_tokens_per_second": 7030.609 | |
| }, | |
| { | |
| "epoch": 0.043072966891674704, | |
| "grad_norm": 0.17876607179641724, | |
| "learning_rate": 0.00019213410702772406, | |
| "loss": 1.1394, | |
| "num_input_tokens_seen": 3233616, | |
| "step": 67, | |
| "train_runtime": 459.8348, | |
| "train_tokens_per_second": 7032.126 | |
| }, | |
| { | |
| "epoch": 0.04371584699453552, | |
| "grad_norm": 0.19422762095928192, | |
| "learning_rate": 0.00019200515796260478, | |
| "loss": 1.0683, | |
| "num_input_tokens_seen": 3303616, | |
| "step": 68, | |
| "train_runtime": 469.6416, | |
| "train_tokens_per_second": 7034.334 | |
| }, | |
| { | |
| "epoch": 0.044358727097396335, | |
| "grad_norm": 0.2042950987815857, | |
| "learning_rate": 0.0001918762088974855, | |
| "loss": 1.1002, | |
| "num_input_tokens_seen": 3353936, | |
| "step": 69, | |
| "train_runtime": 476.682, | |
| "train_tokens_per_second": 7036.003 | |
| }, | |
| { | |
| "epoch": 0.04500160720025715, | |
| "grad_norm": 0.18014422059059143, | |
| "learning_rate": 0.00019174725983236624, | |
| "loss": 0.9397, | |
| "num_input_tokens_seen": 3398368, | |
| "step": 70, | |
| "train_runtime": 482.9344, | |
| "train_tokens_per_second": 7036.915 | |
| }, | |
| { | |
| "epoch": 0.045644487303117966, | |
| "grad_norm": 0.16590985655784607, | |
| "learning_rate": 0.00019161831076724693, | |
| "loss": 1.0775, | |
| "num_input_tokens_seen": 3444640, | |
| "step": 71, | |
| "train_runtime": 489.4489, | |
| "train_tokens_per_second": 7037.793 | |
| }, | |
| { | |
| "epoch": 0.04628736740597879, | |
| "grad_norm": 0.19661296904087067, | |
| "learning_rate": 0.00019148936170212768, | |
| "loss": 1.1763, | |
| "num_input_tokens_seen": 3486768, | |
| "step": 72, | |
| "train_runtime": 495.3941, | |
| "train_tokens_per_second": 7038.372 | |
| }, | |
| { | |
| "epoch": 0.046930247508839604, | |
| "grad_norm": 0.18453364074230194, | |
| "learning_rate": 0.0001913604126370084, | |
| "loss": 1.0713, | |
| "num_input_tokens_seen": 3540944, | |
| "step": 73, | |
| "train_runtime": 502.9706, | |
| "train_tokens_per_second": 7040.062 | |
| }, | |
| { | |
| "epoch": 0.04757312761170042, | |
| "grad_norm": 0.1981048732995987, | |
| "learning_rate": 0.0001912314635718891, | |
| "loss": 1.1318, | |
| "num_input_tokens_seen": 3600416, | |
| "step": 74, | |
| "train_runtime": 511.3315, | |
| "train_tokens_per_second": 7041.255 | |
| }, | |
| { | |
| "epoch": 0.048216007714561235, | |
| "grad_norm": 0.19020932912826538, | |
| "learning_rate": 0.00019110251450676983, | |
| "loss": 1.1775, | |
| "num_input_tokens_seen": 3643216, | |
| "step": 75, | |
| "train_runtime": 517.3293, | |
| "train_tokens_per_second": 7042.354 | |
| }, | |
| { | |
| "epoch": 0.04885888781742205, | |
| "grad_norm": 0.19130156934261322, | |
| "learning_rate": 0.00019097356544165055, | |
| "loss": 1.0635, | |
| "num_input_tokens_seen": 3690592, | |
| "step": 76, | |
| "train_runtime": 523.9724, | |
| "train_tokens_per_second": 7043.485 | |
| }, | |
| { | |
| "epoch": 0.049501767920282866, | |
| "grad_norm": 0.191071018576622, | |
| "learning_rate": 0.0001908446163765313, | |
| "loss": 1.2032, | |
| "num_input_tokens_seen": 3743680, | |
| "step": 77, | |
| "train_runtime": 531.4274, | |
| "train_tokens_per_second": 7044.575 | |
| }, | |
| { | |
| "epoch": 0.05014464802314368, | |
| "grad_norm": 0.19254839420318604, | |
| "learning_rate": 0.00019071566731141199, | |
| "loss": 1.0561, | |
| "num_input_tokens_seen": 3788096, | |
| "step": 78, | |
| "train_runtime": 537.6994, | |
| "train_tokens_per_second": 7045.007 | |
| }, | |
| { | |
| "epoch": 0.0507875281260045, | |
| "grad_norm": 0.21967262029647827, | |
| "learning_rate": 0.00019058671824629273, | |
| "loss": 1.0789, | |
| "num_input_tokens_seen": 3824128, | |
| "step": 79, | |
| "train_runtime": 542.7932, | |
| "train_tokens_per_second": 7045.276 | |
| }, | |
| { | |
| "epoch": 0.05143040822886532, | |
| "grad_norm": 0.1794055998325348, | |
| "learning_rate": 0.00019045776918117345, | |
| "loss": 1.1144, | |
| "num_input_tokens_seen": 3869600, | |
| "step": 80, | |
| "train_runtime": 549.2268, | |
| "train_tokens_per_second": 7045.541 | |
| }, | |
| { | |
| "epoch": 0.052073288331726135, | |
| "grad_norm": 0.22182276844978333, | |
| "learning_rate": 0.00019032882011605417, | |
| "loss": 1.0452, | |
| "num_input_tokens_seen": 3930416, | |
| "step": 81, | |
| "train_runtime": 557.7179, | |
| "train_tokens_per_second": 7047.319 | |
| }, | |
| { | |
| "epoch": 0.05271616843458695, | |
| "grad_norm": 0.1964883953332901, | |
| "learning_rate": 0.00019019987105093489, | |
| "loss": 1.1264, | |
| "num_input_tokens_seen": 3994528, | |
| "step": 82, | |
| "train_runtime": 566.7719, | |
| "train_tokens_per_second": 7047.859 | |
| }, | |
| { | |
| "epoch": 0.053359048537447766, | |
| "grad_norm": 0.18389713764190674, | |
| "learning_rate": 0.00019007092198581563, | |
| "loss": 1.1044, | |
| "num_input_tokens_seen": 4025760, | |
| "step": 83, | |
| "train_runtime": 571.2105, | |
| "train_tokens_per_second": 7047.769 | |
| }, | |
| { | |
| "epoch": 0.05400192864030858, | |
| "grad_norm": 0.21487605571746826, | |
| "learning_rate": 0.00018994197292069632, | |
| "loss": 1.0369, | |
| "num_input_tokens_seen": 4073840, | |
| "step": 84, | |
| "train_runtime": 577.9687, | |
| "train_tokens_per_second": 7048.548 | |
| }, | |
| { | |
| "epoch": 0.0546448087431694, | |
| "grad_norm": 0.21032066643238068, | |
| "learning_rate": 0.00018981302385557707, | |
| "loss": 1.0615, | |
| "num_input_tokens_seen": 4108976, | |
| "step": 85, | |
| "train_runtime": 582.9533, | |
| "train_tokens_per_second": 7048.551 | |
| }, | |
| { | |
| "epoch": 0.05528768884603021, | |
| "grad_norm": 0.19567039608955383, | |
| "learning_rate": 0.00018968407479045778, | |
| "loss": 0.9216, | |
| "num_input_tokens_seen": 4164832, | |
| "step": 86, | |
| "train_runtime": 590.7405, | |
| "train_tokens_per_second": 7050.188 | |
| }, | |
| { | |
| "epoch": 0.055930568948891035, | |
| "grad_norm": 0.2140112817287445, | |
| "learning_rate": 0.00018955512572533848, | |
| "loss": 1.1268, | |
| "num_input_tokens_seen": 4223920, | |
| "step": 87, | |
| "train_runtime": 599.009, | |
| "train_tokens_per_second": 7051.513 | |
| }, | |
| { | |
| "epoch": 0.05657344905175185, | |
| "grad_norm": 0.2232234627008438, | |
| "learning_rate": 0.00018942617666021922, | |
| "loss": 1.1666, | |
| "num_input_tokens_seen": 4257440, | |
| "step": 88, | |
| "train_runtime": 603.7538, | |
| "train_tokens_per_second": 7051.616 | |
| }, | |
| { | |
| "epoch": 0.057216329154612666, | |
| "grad_norm": 0.20844654738903046, | |
| "learning_rate": 0.00018929722759509994, | |
| "loss": 0.9959, | |
| "num_input_tokens_seen": 4291488, | |
| "step": 89, | |
| "train_runtime": 608.6239, | |
| "train_tokens_per_second": 7051.133 | |
| }, | |
| { | |
| "epoch": 0.05785920925747348, | |
| "grad_norm": 0.21762102842330933, | |
| "learning_rate": 0.00018916827852998066, | |
| "loss": 1.0791, | |
| "num_input_tokens_seen": 4350704, | |
| "step": 90, | |
| "train_runtime": 616.9377, | |
| "train_tokens_per_second": 7052.097 | |
| }, | |
| { | |
| "epoch": 0.0585020893603343, | |
| "grad_norm": 0.2169635146856308, | |
| "learning_rate": 0.00018903932946486138, | |
| "loss": 1.169, | |
| "num_input_tokens_seen": 4390512, | |
| "step": 91, | |
| "train_runtime": 623.0766, | |
| "train_tokens_per_second": 7046.505 | |
| }, | |
| { | |
| "epoch": 0.05914496946319511, | |
| "grad_norm": 0.19721537828445435, | |
| "learning_rate": 0.00018891038039974212, | |
| "loss": 1.0508, | |
| "num_input_tokens_seen": 4441920, | |
| "step": 92, | |
| "train_runtime": 630.2606, | |
| "train_tokens_per_second": 7047.751 | |
| }, | |
| { | |
| "epoch": 0.05978784956605593, | |
| "grad_norm": 0.23010528087615967, | |
| "learning_rate": 0.00018878143133462284, | |
| "loss": 0.9817, | |
| "num_input_tokens_seen": 4486672, | |
| "step": 93, | |
| "train_runtime": 636.5612, | |
| "train_tokens_per_second": 7048.297 | |
| }, | |
| { | |
| "epoch": 0.060430729668916744, | |
| "grad_norm": 0.19669458270072937, | |
| "learning_rate": 0.00018865248226950356, | |
| "loss": 1.0702, | |
| "num_input_tokens_seen": 4538384, | |
| "step": 94, | |
| "train_runtime": 643.8004, | |
| "train_tokens_per_second": 7049.365 | |
| }, | |
| { | |
| "epoch": 0.061073609771777566, | |
| "grad_norm": 0.33032017946243286, | |
| "learning_rate": 0.00018852353320438427, | |
| "loss": 1.0299, | |
| "num_input_tokens_seen": 4589312, | |
| "step": 95, | |
| "train_runtime": 651.0321, | |
| "train_tokens_per_second": 7049.287 | |
| }, | |
| { | |
| "epoch": 0.06171648987463838, | |
| "grad_norm": 0.18110264837741852, | |
| "learning_rate": 0.00018839458413926502, | |
| "loss": 0.9553, | |
| "num_input_tokens_seen": 4626080, | |
| "step": 96, | |
| "train_runtime": 656.2234, | |
| "train_tokens_per_second": 7049.55 | |
| }, | |
| { | |
| "epoch": 0.0623593699774992, | |
| "grad_norm": 0.2149723619222641, | |
| "learning_rate": 0.0001882656350741457, | |
| "loss": 1.1532, | |
| "num_input_tokens_seen": 4668624, | |
| "step": 97, | |
| "train_runtime": 662.2157, | |
| "train_tokens_per_second": 7050.005 | |
| }, | |
| { | |
| "epoch": 0.06300225008036, | |
| "grad_norm": 0.21420878171920776, | |
| "learning_rate": 0.00018813668600902646, | |
| "loss": 1.1092, | |
| "num_input_tokens_seen": 4724240, | |
| "step": 98, | |
| "train_runtime": 670.094, | |
| "train_tokens_per_second": 7050.115 | |
| }, | |
| { | |
| "epoch": 0.06364513018322084, | |
| "grad_norm": 0.21070437133312225, | |
| "learning_rate": 0.00018800773694390717, | |
| "loss": 0.9589, | |
| "num_input_tokens_seen": 4795776, | |
| "step": 99, | |
| "train_runtime": 680.0991, | |
| "train_tokens_per_second": 7051.584 | |
| }, | |
| { | |
| "epoch": 0.06428801028608165, | |
| "grad_norm": 0.19431836903095245, | |
| "learning_rate": 0.0001878787878787879, | |
| "loss": 1.0636, | |
| "num_input_tokens_seen": 4851008, | |
| "step": 100, | |
| "train_runtime": 687.8429, | |
| "train_tokens_per_second": 7052.494 | |
| }, | |
| { | |
| "epoch": 0.06493089038894247, | |
| "grad_norm": 0.20360679924488068, | |
| "learning_rate": 0.0001877498388136686, | |
| "loss": 1.1182, | |
| "num_input_tokens_seen": 4891088, | |
| "step": 101, | |
| "train_runtime": 693.4719, | |
| "train_tokens_per_second": 7053.044 | |
| }, | |
| { | |
| "epoch": 0.06557377049180328, | |
| "grad_norm": 0.21350686252117157, | |
| "learning_rate": 0.00018762088974854933, | |
| "loss": 1.0525, | |
| "num_input_tokens_seen": 4952416, | |
| "step": 102, | |
| "train_runtime": 702.1041, | |
| "train_tokens_per_second": 7053.678 | |
| }, | |
| { | |
| "epoch": 0.0662166505946641, | |
| "grad_norm": 0.2190914750099182, | |
| "learning_rate": 0.00018749194068343005, | |
| "loss": 1.0602, | |
| "num_input_tokens_seen": 5000400, | |
| "step": 103, | |
| "train_runtime": 708.8252, | |
| "train_tokens_per_second": 7054.489 | |
| }, | |
| { | |
| "epoch": 0.06685953069752491, | |
| "grad_norm": 0.21608233451843262, | |
| "learning_rate": 0.00018736299161831077, | |
| "loss": 1.1176, | |
| "num_input_tokens_seen": 5048592, | |
| "step": 104, | |
| "train_runtime": 715.5961, | |
| "train_tokens_per_second": 7055.086 | |
| }, | |
| { | |
| "epoch": 0.06750241080038573, | |
| "grad_norm": 0.21670708060264587, | |
| "learning_rate": 0.0001872340425531915, | |
| "loss": 1.1591, | |
| "num_input_tokens_seen": 5081664, | |
| "step": 105, | |
| "train_runtime": 720.3252, | |
| "train_tokens_per_second": 7054.68 | |
| }, | |
| { | |
| "epoch": 0.06814529090324654, | |
| "grad_norm": 0.20723669230937958, | |
| "learning_rate": 0.0001871050934880722, | |
| "loss": 1.0741, | |
| "num_input_tokens_seen": 5133264, | |
| "step": 106, | |
| "train_runtime": 727.5521, | |
| "train_tokens_per_second": 7055.528 | |
| }, | |
| { | |
| "epoch": 0.06878817100610736, | |
| "grad_norm": 0.22334900498390198, | |
| "learning_rate": 0.00018697614442295295, | |
| "loss": 1.2012, | |
| "num_input_tokens_seen": 5180464, | |
| "step": 107, | |
| "train_runtime": 734.1803, | |
| "train_tokens_per_second": 7056.12 | |
| }, | |
| { | |
| "epoch": 0.06943105110896818, | |
| "grad_norm": 0.19817394018173218, | |
| "learning_rate": 0.00018684719535783366, | |
| "loss": 1.0348, | |
| "num_input_tokens_seen": 5227712, | |
| "step": 108, | |
| "train_runtime": 740.8405, | |
| "train_tokens_per_second": 7056.461 | |
| }, | |
| { | |
| "epoch": 0.07007393121182899, | |
| "grad_norm": 0.22613032162189484, | |
| "learning_rate": 0.00018671824629271438, | |
| "loss": 1.0507, | |
| "num_input_tokens_seen": 5297424, | |
| "step": 109, | |
| "train_runtime": 750.5378, | |
| "train_tokens_per_second": 7058.171 | |
| }, | |
| { | |
| "epoch": 0.0707168113146898, | |
| "grad_norm": 0.19790789484977722, | |
| "learning_rate": 0.0001865892972275951, | |
| "loss": 1.1512, | |
| "num_input_tokens_seen": 5353920, | |
| "step": 110, | |
| "train_runtime": 758.4763, | |
| "train_tokens_per_second": 7058.783 | |
| }, | |
| { | |
| "epoch": 0.07135969141755062, | |
| "grad_norm": 0.19805489480495453, | |
| "learning_rate": 0.00018646034816247585, | |
| "loss": 1.0392, | |
| "num_input_tokens_seen": 5387872, | |
| "step": 111, | |
| "train_runtime": 763.2666, | |
| "train_tokens_per_second": 7058.965 | |
| }, | |
| { | |
| "epoch": 0.07200257152041144, | |
| "grad_norm": 0.21664251387119293, | |
| "learning_rate": 0.00018633139909735656, | |
| "loss": 1.0399, | |
| "num_input_tokens_seen": 5431632, | |
| "step": 112, | |
| "train_runtime": 769.3579, | |
| "train_tokens_per_second": 7059.954 | |
| }, | |
| { | |
| "epoch": 0.07264545162327225, | |
| "grad_norm": 0.21840597689151764, | |
| "learning_rate": 0.00018620245003223728, | |
| "loss": 1.0969, | |
| "num_input_tokens_seen": 5478704, | |
| "step": 113, | |
| "train_runtime": 775.8252, | |
| "train_tokens_per_second": 7061.776 | |
| }, | |
| { | |
| "epoch": 0.07328833172613308, | |
| "grad_norm": 0.1976010650396347, | |
| "learning_rate": 0.000186073500967118, | |
| "loss": 0.9954, | |
| "num_input_tokens_seen": 5528176, | |
| "step": 114, | |
| "train_runtime": 782.6383, | |
| "train_tokens_per_second": 7063.513 | |
| }, | |
| { | |
| "epoch": 0.0739312118289939, | |
| "grad_norm": 0.19003896415233612, | |
| "learning_rate": 0.00018594455190199872, | |
| "loss": 1.0055, | |
| "num_input_tokens_seen": 5593040, | |
| "step": 115, | |
| "train_runtime": 791.6683, | |
| "train_tokens_per_second": 7064.878 | |
| }, | |
| { | |
| "epoch": 0.07457409193185471, | |
| "grad_norm": 0.1933498978614807, | |
| "learning_rate": 0.00018581560283687944, | |
| "loss": 1.0906, | |
| "num_input_tokens_seen": 5633680, | |
| "step": 116, | |
| "train_runtime": 797.3292, | |
| "train_tokens_per_second": 7065.689 | |
| }, | |
| { | |
| "epoch": 0.07521697203471553, | |
| "grad_norm": 0.2050444781780243, | |
| "learning_rate": 0.00018568665377176016, | |
| "loss": 0.9672, | |
| "num_input_tokens_seen": 5683744, | |
| "step": 117, | |
| "train_runtime": 804.286, | |
| "train_tokens_per_second": 7066.819 | |
| }, | |
| { | |
| "epoch": 0.07585985213757634, | |
| "grad_norm": 0.20085984468460083, | |
| "learning_rate": 0.0001855577047066409, | |
| "loss": 1.0086, | |
| "num_input_tokens_seen": 5718912, | |
| "step": 118, | |
| "train_runtime": 809.2226, | |
| "train_tokens_per_second": 7067.168 | |
| }, | |
| { | |
| "epoch": 0.07650273224043716, | |
| "grad_norm": 0.2239076942205429, | |
| "learning_rate": 0.0001854287556415216, | |
| "loss": 1.0371, | |
| "num_input_tokens_seen": 5787328, | |
| "step": 119, | |
| "train_runtime": 818.7746, | |
| "train_tokens_per_second": 7068.28 | |
| }, | |
| { | |
| "epoch": 0.07714561234329798, | |
| "grad_norm": 0.2009563148021698, | |
| "learning_rate": 0.00018529980657640234, | |
| "loss": 1.1895, | |
| "num_input_tokens_seen": 5823296, | |
| "step": 120, | |
| "train_runtime": 823.7933, | |
| "train_tokens_per_second": 7068.88 | |
| }, | |
| { | |
| "epoch": 0.07778849244615879, | |
| "grad_norm": 0.24800238013267517, | |
| "learning_rate": 0.00018517085751128305, | |
| "loss": 1.0178, | |
| "num_input_tokens_seen": 5891968, | |
| "step": 121, | |
| "train_runtime": 833.7905, | |
| "train_tokens_per_second": 7066.485 | |
| }, | |
| { | |
| "epoch": 0.0784313725490196, | |
| "grad_norm": 0.20752151310443878, | |
| "learning_rate": 0.00018504190844616377, | |
| "loss": 1.1151, | |
| "num_input_tokens_seen": 5945280, | |
| "step": 122, | |
| "train_runtime": 841.1288, | |
| "train_tokens_per_second": 7068.216 | |
| }, | |
| { | |
| "epoch": 0.07907425265188042, | |
| "grad_norm": 0.22319258749485016, | |
| "learning_rate": 0.0001849129593810445, | |
| "loss": 0.9032, | |
| "num_input_tokens_seen": 5991152, | |
| "step": 123, | |
| "train_runtime": 847.4512, | |
| "train_tokens_per_second": 7069.613 | |
| }, | |
| { | |
| "epoch": 0.07971713275474124, | |
| "grad_norm": 0.23252902925014496, | |
| "learning_rate": 0.00018478401031592524, | |
| "loss": 1.1092, | |
| "num_input_tokens_seen": 6027488, | |
| "step": 124, | |
| "train_runtime": 852.5296, | |
| "train_tokens_per_second": 7070.122 | |
| }, | |
| { | |
| "epoch": 0.08036001285760205, | |
| "grad_norm": 0.2191491425037384, | |
| "learning_rate": 0.00018465506125080593, | |
| "loss": 1.1129, | |
| "num_input_tokens_seen": 6064384, | |
| "step": 125, | |
| "train_runtime": 857.6884, | |
| "train_tokens_per_second": 7070.614 | |
| }, | |
| { | |
| "epoch": 0.08100289296046287, | |
| "grad_norm": 0.2259877622127533, | |
| "learning_rate": 0.00018452611218568667, | |
| "loss": 1.1156, | |
| "num_input_tokens_seen": 6157600, | |
| "step": 126, | |
| "train_runtime": 870.549, | |
| "train_tokens_per_second": 7073.238 | |
| }, | |
| { | |
| "epoch": 0.08164577306332368, | |
| "grad_norm": 0.22781765460968018, | |
| "learning_rate": 0.0001843971631205674, | |
| "loss": 1.1326, | |
| "num_input_tokens_seen": 6197904, | |
| "step": 127, | |
| "train_runtime": 876.1256, | |
| "train_tokens_per_second": 7074.218 | |
| }, | |
| { | |
| "epoch": 0.0822886531661845, | |
| "grad_norm": 0.1966547816991806, | |
| "learning_rate": 0.0001842682140554481, | |
| "loss": 1.0326, | |
| "num_input_tokens_seen": 6242368, | |
| "step": 128, | |
| "train_runtime": 882.251, | |
| "train_tokens_per_second": 7075.501 | |
| }, | |
| { | |
| "epoch": 0.08293153326904533, | |
| "grad_norm": 0.22219525277614594, | |
| "learning_rate": 0.00018413926499032883, | |
| "loss": 1.0803, | |
| "num_input_tokens_seen": 6306416, | |
| "step": 129, | |
| "train_runtime": 891.1022, | |
| "train_tokens_per_second": 7077.096 | |
| }, | |
| { | |
| "epoch": 0.08357441337190614, | |
| "grad_norm": 0.1935926377773285, | |
| "learning_rate": 0.00018401031592520954, | |
| "loss": 1.1262, | |
| "num_input_tokens_seen": 6356528, | |
| "step": 130, | |
| "train_runtime": 897.9981, | |
| "train_tokens_per_second": 7078.554 | |
| }, | |
| { | |
| "epoch": 0.08421729347476696, | |
| "grad_norm": 0.2209094762802124, | |
| "learning_rate": 0.00018388136686009026, | |
| "loss": 1.163, | |
| "num_input_tokens_seen": 6422768, | |
| "step": 131, | |
| "train_runtime": 907.1079, | |
| "train_tokens_per_second": 7080.49 | |
| }, | |
| { | |
| "epoch": 0.08486017357762778, | |
| "grad_norm": 0.223740816116333, | |
| "learning_rate": 0.00018375241779497098, | |
| "loss": 1.1249, | |
| "num_input_tokens_seen": 6464640, | |
| "step": 132, | |
| "train_runtime": 912.8481, | |
| "train_tokens_per_second": 7081.835 | |
| }, | |
| { | |
| "epoch": 0.08550305368048859, | |
| "grad_norm": 0.2206628918647766, | |
| "learning_rate": 0.00018362346872985173, | |
| "loss": 1.0312, | |
| "num_input_tokens_seen": 6500848, | |
| "step": 133, | |
| "train_runtime": 917.9064, | |
| "train_tokens_per_second": 7082.256 | |
| }, | |
| { | |
| "epoch": 0.08614593378334941, | |
| "grad_norm": 0.23904292285442352, | |
| "learning_rate": 0.00018349451966473244, | |
| "loss": 1.1285, | |
| "num_input_tokens_seen": 6553072, | |
| "step": 134, | |
| "train_runtime": 925.0205, | |
| "train_tokens_per_second": 7084.245 | |
| }, | |
| { | |
| "epoch": 0.08678881388621022, | |
| "grad_norm": 0.21213850378990173, | |
| "learning_rate": 0.00018336557059961316, | |
| "loss": 0.9785, | |
| "num_input_tokens_seen": 6593648, | |
| "step": 135, | |
| "train_runtime": 930.6399, | |
| "train_tokens_per_second": 7085.069 | |
| }, | |
| { | |
| "epoch": 0.08743169398907104, | |
| "grad_norm": 0.25068166851997375, | |
| "learning_rate": 0.00018323662153449388, | |
| "loss": 0.9906, | |
| "num_input_tokens_seen": 6655792, | |
| "step": 136, | |
| "train_runtime": 939.2004, | |
| "train_tokens_per_second": 7086.658 | |
| }, | |
| { | |
| "epoch": 0.08807457409193185, | |
| "grad_norm": 0.2144203633069992, | |
| "learning_rate": 0.00018310767246937463, | |
| "loss": 1.1189, | |
| "num_input_tokens_seen": 6701456, | |
| "step": 137, | |
| "train_runtime": 945.4803, | |
| "train_tokens_per_second": 7087.885 | |
| }, | |
| { | |
| "epoch": 0.08871745419479267, | |
| "grad_norm": 0.219550222158432, | |
| "learning_rate": 0.00018297872340425532, | |
| "loss": 0.969, | |
| "num_input_tokens_seen": 6757216, | |
| "step": 138, | |
| "train_runtime": 953.1781, | |
| "train_tokens_per_second": 7089.143 | |
| }, | |
| { | |
| "epoch": 0.08936033429765348, | |
| "grad_norm": 0.2444351464509964, | |
| "learning_rate": 0.00018284977433913606, | |
| "loss": 1.1312, | |
| "num_input_tokens_seen": 6801888, | |
| "step": 139, | |
| "train_runtime": 959.3814, | |
| "train_tokens_per_second": 7089.869 | |
| }, | |
| { | |
| "epoch": 0.0900032144005143, | |
| "grad_norm": 0.1964501291513443, | |
| "learning_rate": 0.00018272082527401678, | |
| "loss": 1.0268, | |
| "num_input_tokens_seen": 6866432, | |
| "step": 140, | |
| "train_runtime": 968.3634, | |
| "train_tokens_per_second": 7090.759 | |
| }, | |
| { | |
| "epoch": 0.09064609450337512, | |
| "grad_norm": 0.2163739949464798, | |
| "learning_rate": 0.00018259187620889747, | |
| "loss": 0.9358, | |
| "num_input_tokens_seen": 6911232, | |
| "step": 141, | |
| "train_runtime": 974.5993, | |
| "train_tokens_per_second": 7091.357 | |
| }, | |
| { | |
| "epoch": 0.09128897460623593, | |
| "grad_norm": 0.25095582008361816, | |
| "learning_rate": 0.00018246292714377822, | |
| "loss": 1.0278, | |
| "num_input_tokens_seen": 6968496, | |
| "step": 142, | |
| "train_runtime": 982.5023, | |
| "train_tokens_per_second": 7092.6 | |
| }, | |
| { | |
| "epoch": 0.09193185470909675, | |
| "grad_norm": 0.2552036941051483, | |
| "learning_rate": 0.00018233397807865893, | |
| "loss": 1.2132, | |
| "num_input_tokens_seen": 7001616, | |
| "step": 143, | |
| "train_runtime": 987.1499, | |
| "train_tokens_per_second": 7092.759 | |
| }, | |
| { | |
| "epoch": 0.09257473481195758, | |
| "grad_norm": 0.2304268479347229, | |
| "learning_rate": 0.00018220502901353965, | |
| "loss": 1.087, | |
| "num_input_tokens_seen": 7039440, | |
| "step": 144, | |
| "train_runtime": 992.4368, | |
| "train_tokens_per_second": 7093.086 | |
| }, | |
| { | |
| "epoch": 0.09321761491481839, | |
| "grad_norm": 0.24973514676094055, | |
| "learning_rate": 0.00018207607994842037, | |
| "loss": 1.0373, | |
| "num_input_tokens_seen": 7090448, | |
| "step": 145, | |
| "train_runtime": 999.5329, | |
| "train_tokens_per_second": 7093.761 | |
| }, | |
| { | |
| "epoch": 0.09386049501767921, | |
| "grad_norm": 0.24035415053367615, | |
| "learning_rate": 0.00018194713088330112, | |
| "loss": 0.9661, | |
| "num_input_tokens_seen": 7132352, | |
| "step": 146, | |
| "train_runtime": 1005.376, | |
| "train_tokens_per_second": 7094.213 | |
| }, | |
| { | |
| "epoch": 0.09450337512054002, | |
| "grad_norm": 0.2570725977420807, | |
| "learning_rate": 0.00018181818181818183, | |
| "loss": 1.0897, | |
| "num_input_tokens_seen": 7178112, | |
| "step": 147, | |
| "train_runtime": 1011.7434, | |
| "train_tokens_per_second": 7094.795 | |
| }, | |
| { | |
| "epoch": 0.09514625522340084, | |
| "grad_norm": 0.2333613485097885, | |
| "learning_rate": 0.00018168923275306255, | |
| "loss": 1.1247, | |
| "num_input_tokens_seen": 7213856, | |
| "step": 148, | |
| "train_runtime": 1016.7771, | |
| "train_tokens_per_second": 7094.825 | |
| }, | |
| { | |
| "epoch": 0.09578913532626165, | |
| "grad_norm": 0.2136976569890976, | |
| "learning_rate": 0.00018156028368794327, | |
| "loss": 1.0022, | |
| "num_input_tokens_seen": 7257296, | |
| "step": 149, | |
| "train_runtime": 1022.8844, | |
| "train_tokens_per_second": 7094.933 | |
| }, | |
| { | |
| "epoch": 0.09643201542912247, | |
| "grad_norm": 0.23702369630336761, | |
| "learning_rate": 0.000181431334622824, | |
| "loss": 1.2264, | |
| "num_input_tokens_seen": 7302064, | |
| "step": 150, | |
| "train_runtime": 1029.1706, | |
| "train_tokens_per_second": 7095.096 | |
| }, | |
| { | |
| "epoch": 0.09707489553198329, | |
| "grad_norm": 0.2674248218536377, | |
| "learning_rate": 0.0001813023855577047, | |
| "loss": 1.0873, | |
| "num_input_tokens_seen": 7351824, | |
| "step": 151, | |
| "train_runtime": 1036.6946, | |
| "train_tokens_per_second": 7091.601 | |
| }, | |
| { | |
| "epoch": 0.0977177756348441, | |
| "grad_norm": 0.21677564084529877, | |
| "learning_rate": 0.00018117343649258545, | |
| "loss": 1.087, | |
| "num_input_tokens_seen": 7413824, | |
| "step": 152, | |
| "train_runtime": 1045.3339, | |
| "train_tokens_per_second": 7092.302 | |
| }, | |
| { | |
| "epoch": 0.09836065573770492, | |
| "grad_norm": 0.2248373031616211, | |
| "learning_rate": 0.00018104448742746617, | |
| "loss": 1.0474, | |
| "num_input_tokens_seen": 7454160, | |
| "step": 153, | |
| "train_runtime": 1050.9856, | |
| "train_tokens_per_second": 7092.542 | |
| }, | |
| { | |
| "epoch": 0.09900353584056573, | |
| "grad_norm": 0.22680656611919403, | |
| "learning_rate": 0.0001809155383623469, | |
| "loss": 1.087, | |
| "num_input_tokens_seen": 7493616, | |
| "step": 154, | |
| "train_runtime": 1056.5707, | |
| "train_tokens_per_second": 7092.394 | |
| }, | |
| { | |
| "epoch": 0.09964641594342655, | |
| "grad_norm": 0.19268976151943207, | |
| "learning_rate": 0.0001807865892972276, | |
| "loss": 0.8812, | |
| "num_input_tokens_seen": 7538000, | |
| "step": 155, | |
| "train_runtime": 1062.8564, | |
| "train_tokens_per_second": 7092.21 | |
| }, | |
| { | |
| "epoch": 0.10028929604628736, | |
| "grad_norm": 0.22635945677757263, | |
| "learning_rate": 0.00018065764023210832, | |
| "loss": 1.0733, | |
| "num_input_tokens_seen": 7581424, | |
| "step": 156, | |
| "train_runtime": 1068.9436, | |
| "train_tokens_per_second": 7092.445 | |
| }, | |
| { | |
| "epoch": 0.10028929604628736, | |
| "eval_loss": 1.0724854469299316, | |
| "eval_runtime": 39.9606, | |
| "eval_samples_per_second": 24.875, | |
| "eval_steps_per_second": 1.577, | |
| "num_input_tokens_seen": 7581424, | |
| "step": 156 | |
| }, | |
| { | |
| "epoch": 0.10093217614914818, | |
| "grad_norm": 0.1949465125799179, | |
| "learning_rate": 0.00018052869116698904, | |
| "loss": 1.0841, | |
| "num_input_tokens_seen": 7627072, | |
| "step": 157, | |
| "train_runtime": 1115.3292, | |
| "train_tokens_per_second": 6838.404 | |
| }, | |
| { | |
| "epoch": 0.101575056252009, | |
| "grad_norm": 0.22935912013053894, | |
| "learning_rate": 0.00018039974210186976, | |
| "loss": 1.0461, | |
| "num_input_tokens_seen": 7661936, | |
| "step": 158, | |
| "train_runtime": 1120.2715, | |
| "train_tokens_per_second": 6839.357 | |
| }, | |
| { | |
| "epoch": 0.10221793635486982, | |
| "grad_norm": 0.1948421150445938, | |
| "learning_rate": 0.0001802707930367505, | |
| "loss": 1.1345, | |
| "num_input_tokens_seen": 7713968, | |
| "step": 159, | |
| "train_runtime": 1127.5172, | |
| "train_tokens_per_second": 6841.552 | |
| }, | |
| { | |
| "epoch": 0.10286081645773064, | |
| "grad_norm": 0.212183877825737, | |
| "learning_rate": 0.0001801418439716312, | |
| "loss": 1.0388, | |
| "num_input_tokens_seen": 7752976, | |
| "step": 160, | |
| "train_runtime": 1132.9323, | |
| "train_tokens_per_second": 6843.283 | |
| }, | |
| { | |
| "epoch": 0.10350369656059145, | |
| "grad_norm": 0.21781344711780548, | |
| "learning_rate": 0.00018001289490651194, | |
| "loss": 1.0323, | |
| "num_input_tokens_seen": 7791104, | |
| "step": 161, | |
| "train_runtime": 1138.279, | |
| "train_tokens_per_second": 6844.635 | |
| }, | |
| { | |
| "epoch": 0.10414657666345227, | |
| "grad_norm": 0.24289098381996155, | |
| "learning_rate": 0.00017988394584139266, | |
| "loss": 0.9597, | |
| "num_input_tokens_seen": 7843168, | |
| "step": 162, | |
| "train_runtime": 1145.4597, | |
| "train_tokens_per_second": 6847.179 | |
| }, | |
| { | |
| "epoch": 0.10478945676631309, | |
| "grad_norm": 0.22889725863933563, | |
| "learning_rate": 0.00017975499677627338, | |
| "loss": 1.0462, | |
| "num_input_tokens_seen": 7888016, | |
| "step": 163, | |
| "train_runtime": 1151.7079, | |
| "train_tokens_per_second": 6848.973 | |
| }, | |
| { | |
| "epoch": 0.1054323368691739, | |
| "grad_norm": 0.2221020758152008, | |
| "learning_rate": 0.0001796260477111541, | |
| "loss": 1.0538, | |
| "num_input_tokens_seen": 7942304, | |
| "step": 164, | |
| "train_runtime": 1159.2432, | |
| "train_tokens_per_second": 6851.284 | |
| }, | |
| { | |
| "epoch": 0.10607521697203472, | |
| "grad_norm": 0.19479186832904816, | |
| "learning_rate": 0.00017949709864603484, | |
| "loss": 0.9074, | |
| "num_input_tokens_seen": 7980496, | |
| "step": 165, | |
| "train_runtime": 1164.6073, | |
| "train_tokens_per_second": 6852.521 | |
| }, | |
| { | |
| "epoch": 0.10671809707489553, | |
| "grad_norm": 0.2103356570005417, | |
| "learning_rate": 0.00017936814958091553, | |
| "loss": 0.9725, | |
| "num_input_tokens_seen": 8031264, | |
| "step": 166, | |
| "train_runtime": 1171.6399, | |
| "train_tokens_per_second": 6854.721 | |
| }, | |
| { | |
| "epoch": 0.10736097717775635, | |
| "grad_norm": 0.2254662811756134, | |
| "learning_rate": 0.00017923920051579628, | |
| "loss": 1.018, | |
| "num_input_tokens_seen": 8074720, | |
| "step": 167, | |
| "train_runtime": 1177.7123, | |
| "train_tokens_per_second": 6856.276 | |
| }, | |
| { | |
| "epoch": 0.10800385728061716, | |
| "grad_norm": 0.23099878430366516, | |
| "learning_rate": 0.000179110251450677, | |
| "loss": 0.9887, | |
| "num_input_tokens_seen": 8117776, | |
| "step": 168, | |
| "train_runtime": 1183.679, | |
| "train_tokens_per_second": 6858.089 | |
| }, | |
| { | |
| "epoch": 0.10864673738347798, | |
| "grad_norm": 0.22438518702983856, | |
| "learning_rate": 0.00017898130238555771, | |
| "loss": 1.0775, | |
| "num_input_tokens_seen": 8183888, | |
| "step": 169, | |
| "train_runtime": 1192.8273, | |
| "train_tokens_per_second": 6860.916 | |
| }, | |
| { | |
| "epoch": 0.1092896174863388, | |
| "grad_norm": 0.2522250711917877, | |
| "learning_rate": 0.00017885235332043843, | |
| "loss": 1.1234, | |
| "num_input_tokens_seen": 8243600, | |
| "step": 170, | |
| "train_runtime": 1201.0972, | |
| "train_tokens_per_second": 6863.391 | |
| }, | |
| { | |
| "epoch": 0.10993249758919961, | |
| "grad_norm": 0.23084506392478943, | |
| "learning_rate": 0.00017872340425531915, | |
| "loss": 1.1419, | |
| "num_input_tokens_seen": 8315104, | |
| "step": 171, | |
| "train_runtime": 1211.0141, | |
| "train_tokens_per_second": 6866.232 | |
| }, | |
| { | |
| "epoch": 0.11057537769206043, | |
| "grad_norm": 0.21146203577518463, | |
| "learning_rate": 0.0001785944551901999, | |
| "loss": 0.9589, | |
| "num_input_tokens_seen": 8361632, | |
| "step": 172, | |
| "train_runtime": 1217.4549, | |
| "train_tokens_per_second": 6868.125 | |
| }, | |
| { | |
| "epoch": 0.11121825779492124, | |
| "grad_norm": 0.2073734998703003, | |
| "learning_rate": 0.0001784655061250806, | |
| "loss": 1.0018, | |
| "num_input_tokens_seen": 8398272, | |
| "step": 173, | |
| "train_runtime": 1222.5503, | |
| "train_tokens_per_second": 6869.47 | |
| }, | |
| { | |
| "epoch": 0.11186113789778207, | |
| "grad_norm": 0.23064003884792328, | |
| "learning_rate": 0.00017833655705996133, | |
| "loss": 1.0175, | |
| "num_input_tokens_seen": 8436592, | |
| "step": 174, | |
| "train_runtime": 1227.8678, | |
| "train_tokens_per_second": 6870.928 | |
| }, | |
| { | |
| "epoch": 0.11250401800064289, | |
| "grad_norm": 0.2068207710981369, | |
| "learning_rate": 0.00017820760799484205, | |
| "loss": 0.9224, | |
| "num_input_tokens_seen": 8486672, | |
| "step": 175, | |
| "train_runtime": 1234.8255, | |
| "train_tokens_per_second": 6872.77 | |
| }, | |
| { | |
| "epoch": 0.1131468981035037, | |
| "grad_norm": 0.21776925027370453, | |
| "learning_rate": 0.00017807865892972277, | |
| "loss": 1.0478, | |
| "num_input_tokens_seen": 8573280, | |
| "step": 176, | |
| "train_runtime": 1246.8789, | |
| "train_tokens_per_second": 6875.792 | |
| }, | |
| { | |
| "epoch": 0.11378977820636452, | |
| "grad_norm": 0.2205696552991867, | |
| "learning_rate": 0.00017794970986460349, | |
| "loss": 0.993, | |
| "num_input_tokens_seen": 8631824, | |
| "step": 177, | |
| "train_runtime": 1255.0271, | |
| "train_tokens_per_second": 6877.799 | |
| }, | |
| { | |
| "epoch": 0.11443265830922533, | |
| "grad_norm": 0.22359175980091095, | |
| "learning_rate": 0.00017782076079948423, | |
| "loss": 1.0263, | |
| "num_input_tokens_seen": 8669328, | |
| "step": 178, | |
| "train_runtime": 1260.2564, | |
| "train_tokens_per_second": 6879.019 | |
| }, | |
| { | |
| "epoch": 0.11507553841208615, | |
| "grad_norm": 0.21172000467777252, | |
| "learning_rate": 0.00017769181173436492, | |
| "loss": 0.916, | |
| "num_input_tokens_seen": 8708768, | |
| "step": 179, | |
| "train_runtime": 1265.7239, | |
| "train_tokens_per_second": 6880.464 | |
| }, | |
| { | |
| "epoch": 0.11571841851494696, | |
| "grad_norm": 0.2595050036907196, | |
| "learning_rate": 0.00017756286266924567, | |
| "loss": 1.174, | |
| "num_input_tokens_seen": 8761984, | |
| "step": 180, | |
| "train_runtime": 1273.0455, | |
| "train_tokens_per_second": 6882.695 | |
| }, | |
| { | |
| "epoch": 0.11636129861780778, | |
| "grad_norm": 0.21484827995300293, | |
| "learning_rate": 0.00017743391360412639, | |
| "loss": 1.0035, | |
| "num_input_tokens_seen": 8804384, | |
| "step": 181, | |
| "train_runtime": 1279.4701, | |
| "train_tokens_per_second": 6881.274 | |
| }, | |
| { | |
| "epoch": 0.1170041787206686, | |
| "grad_norm": 0.21428106725215912, | |
| "learning_rate": 0.00017730496453900708, | |
| "loss": 0.8851, | |
| "num_input_tokens_seen": 8861280, | |
| "step": 182, | |
| "train_runtime": 1287.2763, | |
| "train_tokens_per_second": 6883.743 | |
| }, | |
| { | |
| "epoch": 0.11764705882352941, | |
| "grad_norm": 0.20558470487594604, | |
| "learning_rate": 0.00017717601547388782, | |
| "loss": 1.0338, | |
| "num_input_tokens_seen": 8918064, | |
| "step": 183, | |
| "train_runtime": 1295.0934, | |
| "train_tokens_per_second": 6886.039 | |
| }, | |
| { | |
| "epoch": 0.11828993892639023, | |
| "grad_norm": 0.21777905523777008, | |
| "learning_rate": 0.00017704706640876854, | |
| "loss": 0.9756, | |
| "num_input_tokens_seen": 8960192, | |
| "step": 184, | |
| "train_runtime": 1300.9164, | |
| "train_tokens_per_second": 6887.6 | |
| }, | |
| { | |
| "epoch": 0.11893281902925104, | |
| "grad_norm": 0.21575364470481873, | |
| "learning_rate": 0.00017691811734364926, | |
| "loss": 1.0877, | |
| "num_input_tokens_seen": 8998128, | |
| "step": 185, | |
| "train_runtime": 1306.1898, | |
| "train_tokens_per_second": 6888.837 | |
| }, | |
| { | |
| "epoch": 0.11957569913211186, | |
| "grad_norm": 0.2269899994134903, | |
| "learning_rate": 0.00017678916827852998, | |
| "loss": 1.0258, | |
| "num_input_tokens_seen": 9055952, | |
| "step": 186, | |
| "train_runtime": 1314.1654, | |
| "train_tokens_per_second": 6891.029 | |
| }, | |
| { | |
| "epoch": 0.12021857923497267, | |
| "grad_norm": 0.24424798786640167, | |
| "learning_rate": 0.00017666021921341072, | |
| "loss": 1.0449, | |
| "num_input_tokens_seen": 9116272, | |
| "step": 187, | |
| "train_runtime": 1322.4634, | |
| "train_tokens_per_second": 6893.402 | |
| }, | |
| { | |
| "epoch": 0.12086145933783349, | |
| "grad_norm": 0.22270651161670685, | |
| "learning_rate": 0.00017653127014829144, | |
| "loss": 1.0173, | |
| "num_input_tokens_seen": 9164416, | |
| "step": 188, | |
| "train_runtime": 1329.1451, | |
| "train_tokens_per_second": 6894.97 | |
| }, | |
| { | |
| "epoch": 0.12150433944069432, | |
| "grad_norm": 0.2047732174396515, | |
| "learning_rate": 0.00017640232108317216, | |
| "loss": 0.9592, | |
| "num_input_tokens_seen": 9195696, | |
| "step": 189, | |
| "train_runtime": 1333.5875, | |
| "train_tokens_per_second": 6895.457 | |
| }, | |
| { | |
| "epoch": 0.12214721954355513, | |
| "grad_norm": 0.24051836133003235, | |
| "learning_rate": 0.00017627337201805288, | |
| "loss": 1.0174, | |
| "num_input_tokens_seen": 9251120, | |
| "step": 190, | |
| "train_runtime": 1341.2546, | |
| "train_tokens_per_second": 6897.363 | |
| }, | |
| { | |
| "epoch": 0.12279009964641595, | |
| "grad_norm": 0.23167778551578522, | |
| "learning_rate": 0.0001761444229529336, | |
| "loss": 1.145, | |
| "num_input_tokens_seen": 9311872, | |
| "step": 191, | |
| "train_runtime": 1349.7292, | |
| "train_tokens_per_second": 6899.067 | |
| }, | |
| { | |
| "epoch": 0.12343297974927676, | |
| "grad_norm": 0.22334854304790497, | |
| "learning_rate": 0.0001760154738878143, | |
| "loss": 1.0342, | |
| "num_input_tokens_seen": 9344960, | |
| "step": 192, | |
| "train_runtime": 1354.3406, | |
| "train_tokens_per_second": 6900.007 | |
| }, | |
| { | |
| "epoch": 0.12407585985213758, | |
| "grad_norm": 0.21167592704296112, | |
| "learning_rate": 0.00017588652482269506, | |
| "loss": 1.0305, | |
| "num_input_tokens_seen": 9406096, | |
| "step": 193, | |
| "train_runtime": 1362.8133, | |
| "train_tokens_per_second": 6901.969 | |
| }, | |
| { | |
| "epoch": 0.1247187399549984, | |
| "grad_norm": 0.2151985913515091, | |
| "learning_rate": 0.00017575757575757578, | |
| "loss": 1.0412, | |
| "num_input_tokens_seen": 9475040, | |
| "step": 194, | |
| "train_runtime": 1372.3769, | |
| "train_tokens_per_second": 6904.109 | |
| }, | |
| { | |
| "epoch": 0.1253616200578592, | |
| "grad_norm": 0.22665420174598694, | |
| "learning_rate": 0.00017562862669245647, | |
| "loss": 1.1126, | |
| "num_input_tokens_seen": 9530432, | |
| "step": 195, | |
| "train_runtime": 1380.1019, | |
| "train_tokens_per_second": 6905.6 | |
| }, | |
| { | |
| "epoch": 0.12600450016072, | |
| "grad_norm": 0.2426138073205948, | |
| "learning_rate": 0.0001754996776273372, | |
| "loss": 1.0301, | |
| "num_input_tokens_seen": 9595536, | |
| "step": 196, | |
| "train_runtime": 1389.1031, | |
| "train_tokens_per_second": 6907.721 | |
| }, | |
| { | |
| "epoch": 0.12664738026358086, | |
| "grad_norm": 0.28386926651000977, | |
| "learning_rate": 0.00017537072856221793, | |
| "loss": 0.9756, | |
| "num_input_tokens_seen": 9633680, | |
| "step": 197, | |
| "train_runtime": 1394.4152, | |
| "train_tokens_per_second": 6908.76 | |
| }, | |
| { | |
| "epoch": 0.12729026036644167, | |
| "grad_norm": 0.21381893754005432, | |
| "learning_rate": 0.00017524177949709865, | |
| "loss": 1.0494, | |
| "num_input_tokens_seen": 9704480, | |
| "step": 198, | |
| "train_runtime": 1404.1835, | |
| "train_tokens_per_second": 6911.119 | |
| }, | |
| { | |
| "epoch": 0.1279331404693025, | |
| "grad_norm": 0.23659008741378784, | |
| "learning_rate": 0.00017511283043197937, | |
| "loss": 1.0873, | |
| "num_input_tokens_seen": 9762144, | |
| "step": 199, | |
| "train_runtime": 1412.2135, | |
| "train_tokens_per_second": 6912.654 | |
| }, | |
| { | |
| "epoch": 0.1285760205721633, | |
| "grad_norm": 0.25226446986198425, | |
| "learning_rate": 0.0001749838813668601, | |
| "loss": 1.0107, | |
| "num_input_tokens_seen": 9803008, | |
| "step": 200, | |
| "train_runtime": 1417.8691, | |
| "train_tokens_per_second": 6913.902 | |
| }, | |
| { | |
| "epoch": 0.12921890067502412, | |
| "grad_norm": 0.2516157925128937, | |
| "learning_rate": 0.0001748549323017408, | |
| "loss": 1.0264, | |
| "num_input_tokens_seen": 9844768, | |
| "step": 201, | |
| "train_runtime": 1423.6304, | |
| "train_tokens_per_second": 6915.255 | |
| }, | |
| { | |
| "epoch": 0.12986178077788493, | |
| "grad_norm": 0.24535000324249268, | |
| "learning_rate": 0.00017472598323662155, | |
| "loss": 1.0769, | |
| "num_input_tokens_seen": 9926304, | |
| "step": 202, | |
| "train_runtime": 1434.9118, | |
| "train_tokens_per_second": 6917.71 | |
| }, | |
| { | |
| "epoch": 0.13050466088074575, | |
| "grad_norm": 0.22521895170211792, | |
| "learning_rate": 0.00017459703417150227, | |
| "loss": 0.9298, | |
| "num_input_tokens_seen": 9964880, | |
| "step": 203, | |
| "train_runtime": 1440.226, | |
| "train_tokens_per_second": 6918.97 | |
| }, | |
| { | |
| "epoch": 0.13114754098360656, | |
| "grad_norm": 0.22114278376102448, | |
| "learning_rate": 0.00017446808510638298, | |
| "loss": 1.0312, | |
| "num_input_tokens_seen": 10016000, | |
| "step": 204, | |
| "train_runtime": 1447.364, | |
| "train_tokens_per_second": 6920.166 | |
| }, | |
| { | |
| "epoch": 0.13179042108646738, | |
| "grad_norm": 0.25172755122184753, | |
| "learning_rate": 0.0001743391360412637, | |
| "loss": 0.9959, | |
| "num_input_tokens_seen": 10066848, | |
| "step": 205, | |
| "train_runtime": 1454.362, | |
| "train_tokens_per_second": 6921.831 | |
| }, | |
| { | |
| "epoch": 0.1324333011893282, | |
| "grad_norm": 0.21752239763736725, | |
| "learning_rate": 0.00017421018697614445, | |
| "loss": 1.0253, | |
| "num_input_tokens_seen": 10121968, | |
| "step": 206, | |
| "train_runtime": 1461.9531, | |
| "train_tokens_per_second": 6923.593 | |
| }, | |
| { | |
| "epoch": 0.133076181292189, | |
| "grad_norm": 0.2266158163547516, | |
| "learning_rate": 0.00017408123791102517, | |
| "loss": 1.0936, | |
| "num_input_tokens_seen": 10168336, | |
| "step": 207, | |
| "train_runtime": 1468.3641, | |
| "train_tokens_per_second": 6924.942 | |
| }, | |
| { | |
| "epoch": 0.13371906139504983, | |
| "grad_norm": 0.25873246788978577, | |
| "learning_rate": 0.00017395228884590588, | |
| "loss": 1.038, | |
| "num_input_tokens_seen": 10203984, | |
| "step": 208, | |
| "train_runtime": 1473.3039, | |
| "train_tokens_per_second": 6925.919 | |
| }, | |
| { | |
| "epoch": 0.13436194149791064, | |
| "grad_norm": 0.21677619218826294, | |
| "learning_rate": 0.0001738233397807866, | |
| "loss": 1.0556, | |
| "num_input_tokens_seen": 10246608, | |
| "step": 209, | |
| "train_runtime": 1479.2216, | |
| "train_tokens_per_second": 6927.027 | |
| }, | |
| { | |
| "epoch": 0.13500482160077146, | |
| "grad_norm": 0.22836393117904663, | |
| "learning_rate": 0.00017369439071566732, | |
| "loss": 0.9201, | |
| "num_input_tokens_seen": 10277088, | |
| "step": 210, | |
| "train_runtime": 1483.493, | |
| "train_tokens_per_second": 6927.628 | |
| }, | |
| { | |
| "epoch": 0.13564770170363227, | |
| "grad_norm": 0.24446630477905273, | |
| "learning_rate": 0.00017356544165054804, | |
| "loss": 0.9526, | |
| "num_input_tokens_seen": 10320416, | |
| "step": 211, | |
| "train_runtime": 1489.9864, | |
| "train_tokens_per_second": 6926.517 | |
| }, | |
| { | |
| "epoch": 0.1362905818064931, | |
| "grad_norm": 0.2546757757663727, | |
| "learning_rate": 0.00017343649258542876, | |
| "loss": 1.109, | |
| "num_input_tokens_seen": 10357904, | |
| "step": 212, | |
| "train_runtime": 1495.1661, | |
| "train_tokens_per_second": 6927.594 | |
| }, | |
| { | |
| "epoch": 0.1369334619093539, | |
| "grad_norm": 0.20647278428077698, | |
| "learning_rate": 0.0001733075435203095, | |
| "loss": 1.0048, | |
| "num_input_tokens_seen": 10414032, | |
| "step": 213, | |
| "train_runtime": 1502.9339, | |
| "train_tokens_per_second": 6929.135 | |
| }, | |
| { | |
| "epoch": 0.13757634201221472, | |
| "grad_norm": 0.21804779767990112, | |
| "learning_rate": 0.0001731785944551902, | |
| "loss": 0.8408, | |
| "num_input_tokens_seen": 10461408, | |
| "step": 214, | |
| "train_runtime": 1509.429, | |
| "train_tokens_per_second": 6930.706 | |
| }, | |
| { | |
| "epoch": 0.13821922211507554, | |
| "grad_norm": 0.20865757763385773, | |
| "learning_rate": 0.00017304964539007094, | |
| "loss": 1.0862, | |
| "num_input_tokens_seen": 10504464, | |
| "step": 215, | |
| "train_runtime": 1515.3812, | |
| "train_tokens_per_second": 6931.895 | |
| }, | |
| { | |
| "epoch": 0.13886210221793635, | |
| "grad_norm": 0.3014566898345947, | |
| "learning_rate": 0.00017292069632495166, | |
| "loss": 1.0654, | |
| "num_input_tokens_seen": 10569680, | |
| "step": 216, | |
| "train_runtime": 1524.3124, | |
| "train_tokens_per_second": 6934.064 | |
| }, | |
| { | |
| "epoch": 0.13950498232079717, | |
| "grad_norm": 0.2809727191925049, | |
| "learning_rate": 0.00017279174725983237, | |
| "loss": 1.0455, | |
| "num_input_tokens_seen": 10619856, | |
| "step": 217, | |
| "train_runtime": 1531.2676, | |
| "train_tokens_per_second": 6935.336 | |
| }, | |
| { | |
| "epoch": 0.14014786242365798, | |
| "grad_norm": 0.22862663865089417, | |
| "learning_rate": 0.0001726627981947131, | |
| "loss": 0.9765, | |
| "num_input_tokens_seen": 10677552, | |
| "step": 218, | |
| "train_runtime": 1539.2513, | |
| "train_tokens_per_second": 6936.848 | |
| }, | |
| { | |
| "epoch": 0.1407907425265188, | |
| "grad_norm": 0.21180987358093262, | |
| "learning_rate": 0.00017253384912959384, | |
| "loss": 0.9582, | |
| "num_input_tokens_seen": 10729824, | |
| "step": 219, | |
| "train_runtime": 1546.5127, | |
| "train_tokens_per_second": 6938.077 | |
| }, | |
| { | |
| "epoch": 0.1414336226293796, | |
| "grad_norm": 0.2360568344593048, | |
| "learning_rate": 0.00017240490006447453, | |
| "loss": 1.0123, | |
| "num_input_tokens_seen": 10786064, | |
| "step": 220, | |
| "train_runtime": 1554.3812, | |
| "train_tokens_per_second": 6939.137 | |
| }, | |
| { | |
| "epoch": 0.14207650273224043, | |
| "grad_norm": 0.2420787811279297, | |
| "learning_rate": 0.00017227595099935527, | |
| "loss": 1.0137, | |
| "num_input_tokens_seen": 10816624, | |
| "step": 221, | |
| "train_runtime": 1558.7253, | |
| "train_tokens_per_second": 6939.404 | |
| }, | |
| { | |
| "epoch": 0.14271938283510124, | |
| "grad_norm": 0.21091967821121216, | |
| "learning_rate": 0.000172147001934236, | |
| "loss": 1.0136, | |
| "num_input_tokens_seen": 10863712, | |
| "step": 222, | |
| "train_runtime": 1565.3264, | |
| "train_tokens_per_second": 6940.222 | |
| }, | |
| { | |
| "epoch": 0.14336226293796206, | |
| "grad_norm": 0.2029949128627777, | |
| "learning_rate": 0.0001720180528691167, | |
| "loss": 0.9917, | |
| "num_input_tokens_seen": 10921872, | |
| "step": 223, | |
| "train_runtime": 1573.4217, | |
| "train_tokens_per_second": 6941.478 | |
| }, | |
| { | |
| "epoch": 0.14400514304082287, | |
| "grad_norm": 0.23956239223480225, | |
| "learning_rate": 0.00017188910380399743, | |
| "loss": 0.9445, | |
| "num_input_tokens_seen": 10966448, | |
| "step": 224, | |
| "train_runtime": 1579.6133, | |
| "train_tokens_per_second": 6942.489 | |
| }, | |
| { | |
| "epoch": 0.1446480231436837, | |
| "grad_norm": 0.21189863979816437, | |
| "learning_rate": 0.00017176015473887815, | |
| "loss": 1.0501, | |
| "num_input_tokens_seen": 11014368, | |
| "step": 225, | |
| "train_runtime": 1586.2995, | |
| "train_tokens_per_second": 6943.435 | |
| }, | |
| { | |
| "epoch": 0.1452909032465445, | |
| "grad_norm": 0.22365020215511322, | |
| "learning_rate": 0.00017163120567375886, | |
| "loss": 1.0064, | |
| "num_input_tokens_seen": 11062784, | |
| "step": 226, | |
| "train_runtime": 1593.0071, | |
| "train_tokens_per_second": 6944.592 | |
| }, | |
| { | |
| "epoch": 0.14593378334940535, | |
| "grad_norm": 0.22429963946342468, | |
| "learning_rate": 0.00017150225660863958, | |
| "loss": 1.0248, | |
| "num_input_tokens_seen": 11103616, | |
| "step": 227, | |
| "train_runtime": 1598.7121, | |
| "train_tokens_per_second": 6945.351 | |
| }, | |
| { | |
| "epoch": 0.14657666345226616, | |
| "grad_norm": 0.20400308072566986, | |
| "learning_rate": 0.00017137330754352033, | |
| "loss": 0.963, | |
| "num_input_tokens_seen": 11138032, | |
| "step": 228, | |
| "train_runtime": 1603.5508, | |
| "train_tokens_per_second": 6945.855 | |
| }, | |
| { | |
| "epoch": 0.14721954355512698, | |
| "grad_norm": 0.22514568269252777, | |
| "learning_rate": 0.00017124435847840105, | |
| "loss": 0.9966, | |
| "num_input_tokens_seen": 11178224, | |
| "step": 229, | |
| "train_runtime": 1609.1071, | |
| "train_tokens_per_second": 6946.849 | |
| }, | |
| { | |
| "epoch": 0.1478624236579878, | |
| "grad_norm": 0.21329401433467865, | |
| "learning_rate": 0.00017111540941328176, | |
| "loss": 0.9087, | |
| "num_input_tokens_seen": 11219712, | |
| "step": 230, | |
| "train_runtime": 1614.89, | |
| "train_tokens_per_second": 6947.663 | |
| }, | |
| { | |
| "epoch": 0.1485053037608486, | |
| "grad_norm": 0.23918579518795013, | |
| "learning_rate": 0.00017098646034816248, | |
| "loss": 0.9757, | |
| "num_input_tokens_seen": 11269872, | |
| "step": 231, | |
| "train_runtime": 1621.7982, | |
| "train_tokens_per_second": 6948.998 | |
| }, | |
| { | |
| "epoch": 0.14914818386370943, | |
| "grad_norm": 0.2166871875524521, | |
| "learning_rate": 0.00017085751128304323, | |
| "loss": 1.1711, | |
| "num_input_tokens_seen": 11319904, | |
| "step": 232, | |
| "train_runtime": 1628.7208, | |
| "train_tokens_per_second": 6950.181 | |
| }, | |
| { | |
| "epoch": 0.14979106396657024, | |
| "grad_norm": 0.25991290807724, | |
| "learning_rate": 0.00017072856221792392, | |
| "loss": 0.9433, | |
| "num_input_tokens_seen": 11354720, | |
| "step": 233, | |
| "train_runtime": 1633.5841, | |
| "train_tokens_per_second": 6950.802 | |
| }, | |
| { | |
| "epoch": 0.15043394406943106, | |
| "grad_norm": 0.23324406147003174, | |
| "learning_rate": 0.00017059961315280466, | |
| "loss": 1.0064, | |
| "num_input_tokens_seen": 11405392, | |
| "step": 234, | |
| "train_runtime": 1640.5727, | |
| "train_tokens_per_second": 6952.079 | |
| }, | |
| { | |
| "epoch": 0.15107682417229187, | |
| "grad_norm": 0.2757960557937622, | |
| "learning_rate": 0.00017047066408768538, | |
| "loss": 1.0475, | |
| "num_input_tokens_seen": 11468880, | |
| "step": 235, | |
| "train_runtime": 1649.396, | |
| "train_tokens_per_second": 6953.382 | |
| }, | |
| { | |
| "epoch": 0.1517197042751527, | |
| "grad_norm": 0.19429758191108704, | |
| "learning_rate": 0.00017034171502256607, | |
| "loss": 0.8813, | |
| "num_input_tokens_seen": 11504256, | |
| "step": 236, | |
| "train_runtime": 1654.3414, | |
| "train_tokens_per_second": 6953.979 | |
| }, | |
| { | |
| "epoch": 0.1523625843780135, | |
| "grad_norm": 0.21211576461791992, | |
| "learning_rate": 0.00017021276595744682, | |
| "loss": 1.0322, | |
| "num_input_tokens_seen": 11561280, | |
| "step": 237, | |
| "train_runtime": 1662.2186, | |
| "train_tokens_per_second": 6955.33 | |
| }, | |
| { | |
| "epoch": 0.15300546448087432, | |
| "grad_norm": 0.22346429526805878, | |
| "learning_rate": 0.00017008381689232754, | |
| "loss": 1.0374, | |
| "num_input_tokens_seen": 11595856, | |
| "step": 238, | |
| "train_runtime": 1667.077, | |
| "train_tokens_per_second": 6955.801 | |
| }, | |
| { | |
| "epoch": 0.15364834458373514, | |
| "grad_norm": 0.2228838950395584, | |
| "learning_rate": 0.00016995486782720825, | |
| "loss": 1.0827, | |
| "num_input_tokens_seen": 11657568, | |
| "step": 239, | |
| "train_runtime": 1675.586, | |
| "train_tokens_per_second": 6957.308 | |
| }, | |
| { | |
| "epoch": 0.15429122468659595, | |
| "grad_norm": 0.2152034342288971, | |
| "learning_rate": 0.00016982591876208897, | |
| "loss": 0.9675, | |
| "num_input_tokens_seen": 11706000, | |
| "step": 240, | |
| "train_runtime": 1682.2153, | |
| "train_tokens_per_second": 6958.681 | |
| }, | |
| { | |
| "epoch": 0.15493410478945677, | |
| "grad_norm": 0.2260894626379013, | |
| "learning_rate": 0.00016969696969696972, | |
| "loss": 1.0304, | |
| "num_input_tokens_seen": 11741536, | |
| "step": 241, | |
| "train_runtime": 1687.6844, | |
| "train_tokens_per_second": 6957.187 | |
| }, | |
| { | |
| "epoch": 0.15557698489231758, | |
| "grad_norm": 0.23029419779777527, | |
| "learning_rate": 0.0001695680206318504, | |
| "loss": 0.9199, | |
| "num_input_tokens_seen": 11781760, | |
| "step": 242, | |
| "train_runtime": 1693.2406, | |
| "train_tokens_per_second": 6958.113 | |
| }, | |
| { | |
| "epoch": 0.1562198649951784, | |
| "grad_norm": 0.22995297610759735, | |
| "learning_rate": 0.00016943907156673115, | |
| "loss": 1.0472, | |
| "num_input_tokens_seen": 11817488, | |
| "step": 243, | |
| "train_runtime": 1698.2011, | |
| "train_tokens_per_second": 6958.827 | |
| }, | |
| { | |
| "epoch": 0.1568627450980392, | |
| "grad_norm": 0.22286485135555267, | |
| "learning_rate": 0.00016931012250161187, | |
| "loss": 1.0351, | |
| "num_input_tokens_seen": 11871216, | |
| "step": 244, | |
| "train_runtime": 1705.5842, | |
| "train_tokens_per_second": 6960.205 | |
| }, | |
| { | |
| "epoch": 0.15750562520090003, | |
| "grad_norm": 0.22770291566848755, | |
| "learning_rate": 0.0001691811734364926, | |
| "loss": 1.0394, | |
| "num_input_tokens_seen": 11923056, | |
| "step": 245, | |
| "train_runtime": 1712.7388, | |
| "train_tokens_per_second": 6961.398 | |
| }, | |
| { | |
| "epoch": 0.15814850530376084, | |
| "grad_norm": 0.22315266728401184, | |
| "learning_rate": 0.0001690522243713733, | |
| "loss": 1.1564, | |
| "num_input_tokens_seen": 11965232, | |
| "step": 246, | |
| "train_runtime": 1718.5507, | |
| "train_tokens_per_second": 6962.397 | |
| }, | |
| { | |
| "epoch": 0.15879138540662166, | |
| "grad_norm": 0.15868711471557617, | |
| "learning_rate": 0.00016892327530625405, | |
| "loss": 0.6357, | |
| "num_input_tokens_seen": 12029632, | |
| "step": 247, | |
| "train_runtime": 1727.516, | |
| "train_tokens_per_second": 6963.543 | |
| }, | |
| { | |
| "epoch": 0.15943426550948248, | |
| "grad_norm": 0.25372278690338135, | |
| "learning_rate": 0.00016879432624113477, | |
| "loss": 1.0601, | |
| "num_input_tokens_seen": 12072080, | |
| "step": 248, | |
| "train_runtime": 1733.3318, | |
| "train_tokens_per_second": 6964.668 | |
| }, | |
| { | |
| "epoch": 0.1600771456123433, | |
| "grad_norm": 0.22227583825588226, | |
| "learning_rate": 0.00016866537717601546, | |
| "loss": 1.0248, | |
| "num_input_tokens_seen": 12108464, | |
| "step": 249, | |
| "train_runtime": 1738.3796, | |
| "train_tokens_per_second": 6965.374 | |
| }, | |
| { | |
| "epoch": 0.1607200257152041, | |
| "grad_norm": 0.2230069488286972, | |
| "learning_rate": 0.0001685364281108962, | |
| "loss": 0.9572, | |
| "num_input_tokens_seen": 12160512, | |
| "step": 250, | |
| "train_runtime": 1745.61, | |
| "train_tokens_per_second": 6966.339 | |
| }, | |
| { | |
| "epoch": 0.16136290581806492, | |
| "grad_norm": 0.23262253403663635, | |
| "learning_rate": 0.00016840747904577693, | |
| "loss": 1.1385, | |
| "num_input_tokens_seen": 12203120, | |
| "step": 251, | |
| "train_runtime": 1751.4966, | |
| "train_tokens_per_second": 6967.253 | |
| }, | |
| { | |
| "epoch": 0.16200578592092574, | |
| "grad_norm": 0.23355282843112946, | |
| "learning_rate": 0.00016827852998065764, | |
| "loss": 0.9223, | |
| "num_input_tokens_seen": 12264608, | |
| "step": 252, | |
| "train_runtime": 1760.0334, | |
| "train_tokens_per_second": 6968.395 | |
| }, | |
| { | |
| "epoch": 0.16264866602378655, | |
| "grad_norm": 0.2217501848936081, | |
| "learning_rate": 0.00016814958091553836, | |
| "loss": 1.0235, | |
| "num_input_tokens_seen": 12327648, | |
| "step": 253, | |
| "train_runtime": 1768.8714, | |
| "train_tokens_per_second": 6969.217 | |
| }, | |
| { | |
| "epoch": 0.16329154612664737, | |
| "grad_norm": 0.222650945186615, | |
| "learning_rate": 0.0001680206318504191, | |
| "loss": 0.9988, | |
| "num_input_tokens_seen": 12388624, | |
| "step": 254, | |
| "train_runtime": 1777.4265, | |
| "train_tokens_per_second": 6969.978 | |
| }, | |
| { | |
| "epoch": 0.16393442622950818, | |
| "grad_norm": 0.22060762345790863, | |
| "learning_rate": 0.0001678916827852998, | |
| "loss": 1.0221, | |
| "num_input_tokens_seen": 12465440, | |
| "step": 255, | |
| "train_runtime": 1788.246, | |
| "train_tokens_per_second": 6970.763 | |
| }, | |
| { | |
| "epoch": 0.164577306332369, | |
| "grad_norm": 0.21604016423225403, | |
| "learning_rate": 0.00016776273372018054, | |
| "loss": 0.9783, | |
| "num_input_tokens_seen": 12517344, | |
| "step": 256, | |
| "train_runtime": 1795.5256, | |
| "train_tokens_per_second": 6971.409 | |
| }, | |
| { | |
| "epoch": 0.16522018643522984, | |
| "grad_norm": 0.2075498253107071, | |
| "learning_rate": 0.00016763378465506126, | |
| "loss": 1.0503, | |
| "num_input_tokens_seen": 12565440, | |
| "step": 257, | |
| "train_runtime": 1802.277, | |
| "train_tokens_per_second": 6971.981 | |
| }, | |
| { | |
| "epoch": 0.16586306653809066, | |
| "grad_norm": 0.2417847365140915, | |
| "learning_rate": 0.00016750483558994198, | |
| "loss": 1.0369, | |
| "num_input_tokens_seen": 12611408, | |
| "step": 258, | |
| "train_runtime": 1808.6976, | |
| "train_tokens_per_second": 6972.646 | |
| }, | |
| { | |
| "epoch": 0.16650594664095147, | |
| "grad_norm": 0.2209647297859192, | |
| "learning_rate": 0.0001673758865248227, | |
| "loss": 1.0149, | |
| "num_input_tokens_seen": 12650032, | |
| "step": 259, | |
| "train_runtime": 1814.1769, | |
| "train_tokens_per_second": 6972.877 | |
| }, | |
| { | |
| "epoch": 0.1671488267438123, | |
| "grad_norm": 0.2291407436132431, | |
| "learning_rate": 0.00016724693745970344, | |
| "loss": 1.1034, | |
| "num_input_tokens_seen": 12712656, | |
| "step": 260, | |
| "train_runtime": 1823.0164, | |
| "train_tokens_per_second": 6973.418 | |
| }, | |
| { | |
| "epoch": 0.1677917068466731, | |
| "grad_norm": 0.21010412275791168, | |
| "learning_rate": 0.00016711798839458413, | |
| "loss": 1.0496, | |
| "num_input_tokens_seen": 12750384, | |
| "step": 261, | |
| "train_runtime": 1828.4006, | |
| "train_tokens_per_second": 6973.518 | |
| }, | |
| { | |
| "epoch": 0.16843458694953392, | |
| "grad_norm": 0.2299986481666565, | |
| "learning_rate": 0.00016698903932946488, | |
| "loss": 1.053, | |
| "num_input_tokens_seen": 12788976, | |
| "step": 262, | |
| "train_runtime": 1833.8738, | |
| "train_tokens_per_second": 6973.749 | |
| }, | |
| { | |
| "epoch": 0.16907746705239474, | |
| "grad_norm": 0.21923059225082397, | |
| "learning_rate": 0.0001668600902643456, | |
| "loss": 1.0072, | |
| "num_input_tokens_seen": 12836720, | |
| "step": 263, | |
| "train_runtime": 1840.6434, | |
| "train_tokens_per_second": 6974.039 | |
| }, | |
| { | |
| "epoch": 0.16972034715525555, | |
| "grad_norm": 0.2251053899526596, | |
| "learning_rate": 0.00016673114119922632, | |
| "loss": 0.9474, | |
| "num_input_tokens_seen": 12893312, | |
| "step": 264, | |
| "train_runtime": 1848.5649, | |
| "train_tokens_per_second": 6974.768 | |
| }, | |
| { | |
| "epoch": 0.17036322725811637, | |
| "grad_norm": 0.2260395586490631, | |
| "learning_rate": 0.00016660219213410703, | |
| "loss": 0.9149, | |
| "num_input_tokens_seen": 12926224, | |
| "step": 265, | |
| "train_runtime": 1853.2179, | |
| "train_tokens_per_second": 6975.016 | |
| }, | |
| { | |
| "epoch": 0.17100610736097718, | |
| "grad_norm": 0.21920432150363922, | |
| "learning_rate": 0.00016647324306898775, | |
| "loss": 0.9037, | |
| "num_input_tokens_seen": 12966480, | |
| "step": 266, | |
| "train_runtime": 1858.9134, | |
| "train_tokens_per_second": 6975.301 | |
| }, | |
| { | |
| "epoch": 0.171648987463838, | |
| "grad_norm": 0.20153847336769104, | |
| "learning_rate": 0.0001663442940038685, | |
| "loss": 0.9807, | |
| "num_input_tokens_seen": 13004816, | |
| "step": 267, | |
| "train_runtime": 1864.2918, | |
| "train_tokens_per_second": 6975.741 | |
| }, | |
| { | |
| "epoch": 0.17229186756669881, | |
| "grad_norm": 0.2206585705280304, | |
| "learning_rate": 0.0001662153449387492, | |
| "loss": 0.8857, | |
| "num_input_tokens_seen": 13045632, | |
| "step": 268, | |
| "train_runtime": 1869.9874, | |
| "train_tokens_per_second": 6976.321 | |
| }, | |
| { | |
| "epoch": 0.17293474766955963, | |
| "grad_norm": 0.21724189817905426, | |
| "learning_rate": 0.00016608639587362993, | |
| "loss": 1.0563, | |
| "num_input_tokens_seen": 13085504, | |
| "step": 269, | |
| "train_runtime": 1875.625, | |
| "train_tokens_per_second": 6976.61 | |
| }, | |
| { | |
| "epoch": 0.17357762777242045, | |
| "grad_norm": 0.22223103046417236, | |
| "learning_rate": 0.00016595744680851065, | |
| "loss": 1.0327, | |
| "num_input_tokens_seen": 13128048, | |
| "step": 270, | |
| "train_runtime": 1881.5955, | |
| "train_tokens_per_second": 6977.083 | |
| }, | |
| { | |
| "epoch": 0.17422050787528126, | |
| "grad_norm": 0.2211606651544571, | |
| "learning_rate": 0.00016582849774339137, | |
| "loss": 0.9248, | |
| "num_input_tokens_seen": 13179008, | |
| "step": 271, | |
| "train_runtime": 1889.3405, | |
| "train_tokens_per_second": 6975.454 | |
| }, | |
| { | |
| "epoch": 0.17486338797814208, | |
| "grad_norm": 0.223886638879776, | |
| "learning_rate": 0.0001656995486782721, | |
| "loss": 1.0344, | |
| "num_input_tokens_seen": 13219472, | |
| "step": 272, | |
| "train_runtime": 1895.0504, | |
| "train_tokens_per_second": 6975.789 | |
| }, | |
| { | |
| "epoch": 0.1755062680810029, | |
| "grad_norm": 0.22049862146377563, | |
| "learning_rate": 0.00016557059961315283, | |
| "loss": 1.0321, | |
| "num_input_tokens_seen": 13266560, | |
| "step": 273, | |
| "train_runtime": 1901.6853, | |
| "train_tokens_per_second": 6976.212 | |
| }, | |
| { | |
| "epoch": 0.1761491481838637, | |
| "grad_norm": 0.21115176379680634, | |
| "learning_rate": 0.00016544165054803352, | |
| "loss": 0.9625, | |
| "num_input_tokens_seen": 13303536, | |
| "step": 274, | |
| "train_runtime": 1906.9531, | |
| "train_tokens_per_second": 6976.331 | |
| }, | |
| { | |
| "epoch": 0.17679202828672452, | |
| "grad_norm": 0.2265198975801468, | |
| "learning_rate": 0.00016531270148291427, | |
| "loss": 1.063, | |
| "num_input_tokens_seen": 13344512, | |
| "step": 275, | |
| "train_runtime": 1912.7241, | |
| "train_tokens_per_second": 6976.705 | |
| }, | |
| { | |
| "epoch": 0.17743490838958534, | |
| "grad_norm": 0.22062142193317413, | |
| "learning_rate": 0.000165183752417795, | |
| "loss": 1.0361, | |
| "num_input_tokens_seen": 13390368, | |
| "step": 276, | |
| "train_runtime": 1919.1466, | |
| "train_tokens_per_second": 6977.251 | |
| }, | |
| { | |
| "epoch": 0.17807778849244615, | |
| "grad_norm": 0.21890532970428467, | |
| "learning_rate": 0.00016505480335267568, | |
| "loss": 1.0226, | |
| "num_input_tokens_seen": 13439984, | |
| "step": 277, | |
| "train_runtime": 1926.079, | |
| "train_tokens_per_second": 6977.899 | |
| }, | |
| { | |
| "epoch": 0.17872066859530697, | |
| "grad_norm": 0.19763115048408508, | |
| "learning_rate": 0.00016492585428755642, | |
| "loss": 1.0388, | |
| "num_input_tokens_seen": 13506464, | |
| "step": 278, | |
| "train_runtime": 1935.4136, | |
| "train_tokens_per_second": 6978.593 | |
| }, | |
| { | |
| "epoch": 0.17936354869816779, | |
| "grad_norm": 0.2263236939907074, | |
| "learning_rate": 0.00016479690522243714, | |
| "loss": 1.0409, | |
| "num_input_tokens_seen": 13548112, | |
| "step": 279, | |
| "train_runtime": 1941.2548, | |
| "train_tokens_per_second": 6979.049 | |
| }, | |
| { | |
| "epoch": 0.1800064288010286, | |
| "grad_norm": 0.20944298803806305, | |
| "learning_rate": 0.00016466795615731786, | |
| "loss": 1.0429, | |
| "num_input_tokens_seen": 13593520, | |
| "step": 280, | |
| "train_runtime": 1947.5837, | |
| "train_tokens_per_second": 6979.685 | |
| }, | |
| { | |
| "epoch": 0.18064930890388942, | |
| "grad_norm": 0.20669174194335938, | |
| "learning_rate": 0.00016453900709219858, | |
| "loss": 1.0351, | |
| "num_input_tokens_seen": 13633696, | |
| "step": 281, | |
| "train_runtime": 1953.2138, | |
| "train_tokens_per_second": 6980.135 | |
| }, | |
| { | |
| "epoch": 0.18129218900675023, | |
| "grad_norm": 0.22448189556598663, | |
| "learning_rate": 0.00016441005802707932, | |
| "loss": 1.0267, | |
| "num_input_tokens_seen": 13680928, | |
| "step": 282, | |
| "train_runtime": 1959.8731, | |
| "train_tokens_per_second": 6980.517 | |
| }, | |
| { | |
| "epoch": 0.18193506910961105, | |
| "grad_norm": 0.23241977393627167, | |
| "learning_rate": 0.00016428110896196004, | |
| "loss": 0.9453, | |
| "num_input_tokens_seen": 13730304, | |
| "step": 283, | |
| "train_runtime": 1966.8014, | |
| "train_tokens_per_second": 6981.032 | |
| }, | |
| { | |
| "epoch": 0.18257794921247186, | |
| "grad_norm": 0.23002482950687408, | |
| "learning_rate": 0.00016415215989684076, | |
| "loss": 0.9982, | |
| "num_input_tokens_seen": 13783552, | |
| "step": 284, | |
| "train_runtime": 1974.272, | |
| "train_tokens_per_second": 6981.587 | |
| }, | |
| { | |
| "epoch": 0.18322082931533268, | |
| "grad_norm": 0.22926917672157288, | |
| "learning_rate": 0.00016402321083172148, | |
| "loss": 1.1197, | |
| "num_input_tokens_seen": 13836400, | |
| "step": 285, | |
| "train_runtime": 1981.6555, | |
| "train_tokens_per_second": 6982.243 | |
| }, | |
| { | |
| "epoch": 0.1838637094181935, | |
| "grad_norm": 0.20413215458393097, | |
| "learning_rate": 0.0001638942617666022, | |
| "loss": 0.955, | |
| "num_input_tokens_seen": 13893248, | |
| "step": 286, | |
| "train_runtime": 1989.6672, | |
| "train_tokens_per_second": 6982.699 | |
| }, | |
| { | |
| "epoch": 0.18450658952105434, | |
| "grad_norm": 0.2088879644870758, | |
| "learning_rate": 0.00016376531270148291, | |
| "loss": 0.8842, | |
| "num_input_tokens_seen": 13938304, | |
| "step": 287, | |
| "train_runtime": 1995.9845, | |
| "train_tokens_per_second": 6983.173 | |
| }, | |
| { | |
| "epoch": 0.18514946962391515, | |
| "grad_norm": 0.21762271225452423, | |
| "learning_rate": 0.00016363636363636366, | |
| "loss": 1.0652, | |
| "num_input_tokens_seen": 13976848, | |
| "step": 288, | |
| "train_runtime": 2001.3961, | |
| "train_tokens_per_second": 6983.549 | |
| }, | |
| { | |
| "epoch": 0.18579234972677597, | |
| "grad_norm": 0.2539909780025482, | |
| "learning_rate": 0.00016350741457124438, | |
| "loss": 1.0878, | |
| "num_input_tokens_seen": 14025536, | |
| "step": 289, | |
| "train_runtime": 2008.2605, | |
| "train_tokens_per_second": 6983.923 | |
| }, | |
| { | |
| "epoch": 0.18643522982963678, | |
| "grad_norm": 0.21907879412174225, | |
| "learning_rate": 0.00016337846550612507, | |
| "loss": 1.0875, | |
| "num_input_tokens_seen": 14060912, | |
| "step": 290, | |
| "train_runtime": 2013.3476, | |
| "train_tokens_per_second": 6983.847 | |
| }, | |
| { | |
| "epoch": 0.1870781099324976, | |
| "grad_norm": 0.2488570660352707, | |
| "learning_rate": 0.0001632495164410058, | |
| "loss": 1.009, | |
| "num_input_tokens_seen": 14118128, | |
| "step": 291, | |
| "train_runtime": 2021.445, | |
| "train_tokens_per_second": 6984.176 | |
| }, | |
| { | |
| "epoch": 0.18772099003535841, | |
| "grad_norm": 0.2508719265460968, | |
| "learning_rate": 0.00016312056737588653, | |
| "loss": 0.9741, | |
| "num_input_tokens_seen": 14149312, | |
| "step": 292, | |
| "train_runtime": 2025.9095, | |
| "train_tokens_per_second": 6984.178 | |
| }, | |
| { | |
| "epoch": 0.18836387013821923, | |
| "grad_norm": 0.2172834575176239, | |
| "learning_rate": 0.00016299161831076725, | |
| "loss": 1.0391, | |
| "num_input_tokens_seen": 14218928, | |
| "step": 293, | |
| "train_runtime": 2035.6049, | |
| "train_tokens_per_second": 6985.112 | |
| }, | |
| { | |
| "epoch": 0.18900675024108005, | |
| "grad_norm": 0.213466614484787, | |
| "learning_rate": 0.00016286266924564797, | |
| "loss": 1.0612, | |
| "num_input_tokens_seen": 14255008, | |
| "step": 294, | |
| "train_runtime": 2040.7249, | |
| "train_tokens_per_second": 6985.267 | |
| }, | |
| { | |
| "epoch": 0.18964963034394086, | |
| "grad_norm": 0.21678265929222107, | |
| "learning_rate": 0.0001627337201805287, | |
| "loss": 0.9694, | |
| "num_input_tokens_seen": 14288208, | |
| "step": 295, | |
| "train_runtime": 2045.4091, | |
| "train_tokens_per_second": 6985.501 | |
| }, | |
| { | |
| "epoch": 0.19029251044680168, | |
| "grad_norm": 0.21735024452209473, | |
| "learning_rate": 0.0001626047711154094, | |
| "loss": 0.9697, | |
| "num_input_tokens_seen": 14336704, | |
| "step": 296, | |
| "train_runtime": 2052.1745, | |
| "train_tokens_per_second": 6986.104 | |
| }, | |
| { | |
| "epoch": 0.1909353905496625, | |
| "grad_norm": 0.2252785861492157, | |
| "learning_rate": 0.00016247582205029015, | |
| "loss": 0.9943, | |
| "num_input_tokens_seen": 14376112, | |
| "step": 297, | |
| "train_runtime": 2057.6427, | |
| "train_tokens_per_second": 6986.69 | |
| }, | |
| { | |
| "epoch": 0.1915782706525233, | |
| "grad_norm": 0.22839459776878357, | |
| "learning_rate": 0.00016234687298517087, | |
| "loss": 0.9697, | |
| "num_input_tokens_seen": 14417840, | |
| "step": 298, | |
| "train_runtime": 2063.4637, | |
| "train_tokens_per_second": 6987.203 | |
| }, | |
| { | |
| "epoch": 0.19222115075538412, | |
| "grad_norm": 0.2202254831790924, | |
| "learning_rate": 0.00016221792392005159, | |
| "loss": 0.9729, | |
| "num_input_tokens_seen": 14470960, | |
| "step": 299, | |
| "train_runtime": 2070.8486, | |
| "train_tokens_per_second": 6987.937 | |
| }, | |
| { | |
| "epoch": 0.19286403085824494, | |
| "grad_norm": 0.21936999261379242, | |
| "learning_rate": 0.0001620889748549323, | |
| "loss": 0.9936, | |
| "num_input_tokens_seen": 14510896, | |
| "step": 300, | |
| "train_runtime": 2076.5004, | |
| "train_tokens_per_second": 6988.15 | |
| }, | |
| { | |
| "epoch": 0.19350691096110575, | |
| "grad_norm": 0.21325935423374176, | |
| "learning_rate": 0.00016196002578981305, | |
| "loss": 1.1782, | |
| "num_input_tokens_seen": 14559328, | |
| "step": 301, | |
| "train_runtime": 2083.8514, | |
| "train_tokens_per_second": 6986.74 | |
| }, | |
| { | |
| "epoch": 0.19414979106396657, | |
| "grad_norm": 0.2144458293914795, | |
| "learning_rate": 0.00016183107672469374, | |
| "loss": 1.0087, | |
| "num_input_tokens_seen": 14601008, | |
| "step": 302, | |
| "train_runtime": 2089.7659, | |
| "train_tokens_per_second": 6986.911 | |
| }, | |
| { | |
| "epoch": 0.19479267116682739, | |
| "grad_norm": 0.22481171786785126, | |
| "learning_rate": 0.00016170212765957446, | |
| "loss": 0.8639, | |
| "num_input_tokens_seen": 14647408, | |
| "step": 303, | |
| "train_runtime": 2096.2153, | |
| "train_tokens_per_second": 6987.549 | |
| }, | |
| { | |
| "epoch": 0.1954355512696882, | |
| "grad_norm": 0.212294340133667, | |
| "learning_rate": 0.0001615731785944552, | |
| "loss": 0.984, | |
| "num_input_tokens_seen": 14691920, | |
| "step": 304, | |
| "train_runtime": 2102.516, | |
| "train_tokens_per_second": 6987.78 | |
| }, | |
| { | |
| "epoch": 0.19607843137254902, | |
| "grad_norm": 0.237873375415802, | |
| "learning_rate": 0.00016144422952933592, | |
| "loss": 0.9527, | |
| "num_input_tokens_seen": 14739696, | |
| "step": 305, | |
| "train_runtime": 2109.2496, | |
| "train_tokens_per_second": 6988.123 | |
| }, | |
| { | |
| "epoch": 0.19672131147540983, | |
| "grad_norm": 0.2184976041316986, | |
| "learning_rate": 0.00016131528046421664, | |
| "loss": 1.0345, | |
| "num_input_tokens_seen": 14780704, | |
| "step": 306, | |
| "train_runtime": 2115.0693, | |
| "train_tokens_per_second": 6988.284 | |
| }, | |
| { | |
| "epoch": 0.19736419157827065, | |
| "grad_norm": 0.22368647158145905, | |
| "learning_rate": 0.00016118633139909736, | |
| "loss": 1.0269, | |
| "num_input_tokens_seen": 14815456, | |
| "step": 307, | |
| "train_runtime": 2120.0285, | |
| "train_tokens_per_second": 6988.329 | |
| }, | |
| { | |
| "epoch": 0.19800707168113146, | |
| "grad_norm": 0.22638754546642303, | |
| "learning_rate": 0.0001610573823339781, | |
| "loss": 1.0508, | |
| "num_input_tokens_seen": 14859568, | |
| "step": 308, | |
| "train_runtime": 2126.1887, | |
| "train_tokens_per_second": 6988.828 | |
| }, | |
| { | |
| "epoch": 0.19864995178399228, | |
| "grad_norm": 0.22508348524570465, | |
| "learning_rate": 0.0001609284332688588, | |
| "loss": 1.1461, | |
| "num_input_tokens_seen": 14893728, | |
| "step": 309, | |
| "train_runtime": 2131.0369, | |
| "train_tokens_per_second": 6988.958 | |
| }, | |
| { | |
| "epoch": 0.1992928318868531, | |
| "grad_norm": 0.21122296154499054, | |
| "learning_rate": 0.00016079948420373954, | |
| "loss": 1.0852, | |
| "num_input_tokens_seen": 14937536, | |
| "step": 310, | |
| "train_runtime": 2137.149, | |
| "train_tokens_per_second": 6989.469 | |
| }, | |
| { | |
| "epoch": 0.1999357119897139, | |
| "grad_norm": 0.2315026819705963, | |
| "learning_rate": 0.00016067053513862026, | |
| "loss": 1.0333, | |
| "num_input_tokens_seen": 14984160, | |
| "step": 311, | |
| "train_runtime": 2143.6598, | |
| "train_tokens_per_second": 6989.99 | |
| }, | |
| { | |
| "epoch": 0.20057859209257473, | |
| "grad_norm": 0.23183020949363708, | |
| "learning_rate": 0.00016054158607350098, | |
| "loss": 0.933, | |
| "num_input_tokens_seen": 15023328, | |
| "step": 312, | |
| "train_runtime": 2149.2207, | |
| "train_tokens_per_second": 6990.128 | |
| }, | |
| { | |
| "epoch": 0.20057859209257473, | |
| "eval_loss": 1.0449717044830322, | |
| "eval_runtime": 39.9901, | |
| "eval_samples_per_second": 24.856, | |
| "eval_steps_per_second": 1.575, | |
| "num_input_tokens_seen": 15023328, | |
| "step": 312 | |
| }, | |
| { | |
| "epoch": 0.20122147219543554, | |
| "grad_norm": 0.2052253782749176, | |
| "learning_rate": 0.0001604126370083817, | |
| "loss": 1.088, | |
| "num_input_tokens_seen": 15064848, | |
| "step": 313, | |
| "train_runtime": 2195.0514, | |
| "train_tokens_per_second": 6863.096 | |
| }, | |
| { | |
| "epoch": 0.20186435229829636, | |
| "grad_norm": 0.2076413780450821, | |
| "learning_rate": 0.00016028368794326244, | |
| "loss": 0.9505, | |
| "num_input_tokens_seen": 15107216, | |
| "step": 314, | |
| "train_runtime": 2201.0734, | |
| "train_tokens_per_second": 6863.567 | |
| }, | |
| { | |
| "epoch": 0.20250723240115717, | |
| "grad_norm": 0.22141262888908386, | |
| "learning_rate": 0.00016015473887814313, | |
| "loss": 1.0592, | |
| "num_input_tokens_seen": 15167120, | |
| "step": 315, | |
| "train_runtime": 2209.4569, | |
| "train_tokens_per_second": 6864.637 | |
| }, | |
| { | |
| "epoch": 0.203150112504018, | |
| "grad_norm": 0.23321790993213654, | |
| "learning_rate": 0.00016002578981302387, | |
| "loss": 1.1055, | |
| "num_input_tokens_seen": 15213584, | |
| "step": 316, | |
| "train_runtime": 2216.0238, | |
| "train_tokens_per_second": 6865.262 | |
| }, | |
| { | |
| "epoch": 0.2037929926068788, | |
| "grad_norm": 0.199346125125885, | |
| "learning_rate": 0.0001598968407479046, | |
| "loss": 0.9193, | |
| "num_input_tokens_seen": 15251280, | |
| "step": 317, | |
| "train_runtime": 2221.3256, | |
| "train_tokens_per_second": 6865.846 | |
| }, | |
| { | |
| "epoch": 0.20443587270973965, | |
| "grad_norm": 0.20624004304409027, | |
| "learning_rate": 0.0001597678916827853, | |
| "loss": 0.9764, | |
| "num_input_tokens_seen": 15291984, | |
| "step": 318, | |
| "train_runtime": 2227.0722, | |
| "train_tokens_per_second": 6866.407 | |
| }, | |
| { | |
| "epoch": 0.20507875281260046, | |
| "grad_norm": 0.21078018844127655, | |
| "learning_rate": 0.00015963894261766603, | |
| "loss": 1.0383, | |
| "num_input_tokens_seen": 15368032, | |
| "step": 319, | |
| "train_runtime": 2237.8039, | |
| "train_tokens_per_second": 6867.461 | |
| }, | |
| { | |
| "epoch": 0.20572163291546128, | |
| "grad_norm": 0.224661186337471, | |
| "learning_rate": 0.00015950999355254675, | |
| "loss": 1.1089, | |
| "num_input_tokens_seen": 15415200, | |
| "step": 320, | |
| "train_runtime": 2244.409, | |
| "train_tokens_per_second": 6868.267 | |
| }, | |
| { | |
| "epoch": 0.2063645130183221, | |
| "grad_norm": 0.22397011518478394, | |
| "learning_rate": 0.00015938104448742747, | |
| "loss": 0.8939, | |
| "num_input_tokens_seen": 15466512, | |
| "step": 321, | |
| "train_runtime": 2251.6208, | |
| "train_tokens_per_second": 6869.057 | |
| }, | |
| { | |
| "epoch": 0.2070073931211829, | |
| "grad_norm": 0.2197643667459488, | |
| "learning_rate": 0.00015925209542230818, | |
| "loss": 0.9243, | |
| "num_input_tokens_seen": 15508848, | |
| "step": 322, | |
| "train_runtime": 2257.5953, | |
| "train_tokens_per_second": 6869.632 | |
| }, | |
| { | |
| "epoch": 0.20765027322404372, | |
| "grad_norm": 0.2126566618680954, | |
| "learning_rate": 0.00015912314635718893, | |
| "loss": 1.0816, | |
| "num_input_tokens_seen": 15569040, | |
| "step": 323, | |
| "train_runtime": 2266.0805, | |
| "train_tokens_per_second": 6870.471 | |
| }, | |
| { | |
| "epoch": 0.20829315332690454, | |
| "grad_norm": 0.22825764119625092, | |
| "learning_rate": 0.00015899419729206965, | |
| "loss": 1.0619, | |
| "num_input_tokens_seen": 15624560, | |
| "step": 324, | |
| "train_runtime": 2273.8965, | |
| "train_tokens_per_second": 6871.271 | |
| }, | |
| { | |
| "epoch": 0.20893603342976536, | |
| "grad_norm": 0.23155193030834198, | |
| "learning_rate": 0.00015886524822695037, | |
| "loss": 1.1336, | |
| "num_input_tokens_seen": 15676384, | |
| "step": 325, | |
| "train_runtime": 2281.1802, | |
| "train_tokens_per_second": 6872.05 | |
| }, | |
| { | |
| "epoch": 0.20957891353262617, | |
| "grad_norm": 0.2167881578207016, | |
| "learning_rate": 0.00015873629916183108, | |
| "loss": 0.9745, | |
| "num_input_tokens_seen": 15715376, | |
| "step": 326, | |
| "train_runtime": 2286.7205, | |
| "train_tokens_per_second": 6872.452 | |
| }, | |
| { | |
| "epoch": 0.210221793635487, | |
| "grad_norm": 0.22079265117645264, | |
| "learning_rate": 0.00015860735009671183, | |
| "loss": 1.0279, | |
| "num_input_tokens_seen": 15755296, | |
| "step": 327, | |
| "train_runtime": 2292.4006, | |
| "train_tokens_per_second": 6872.837 | |
| }, | |
| { | |
| "epoch": 0.2108646737383478, | |
| "grad_norm": 0.20521511137485504, | |
| "learning_rate": 0.00015847840103159252, | |
| "loss": 0.9797, | |
| "num_input_tokens_seen": 15796304, | |
| "step": 328, | |
| "train_runtime": 2298.1842, | |
| "train_tokens_per_second": 6873.385 | |
| }, | |
| { | |
| "epoch": 0.21150755384120862, | |
| "grad_norm": 0.20652268826961517, | |
| "learning_rate": 0.00015834945196647326, | |
| "loss": 1.0131, | |
| "num_input_tokens_seen": 15861888, | |
| "step": 329, | |
| "train_runtime": 2307.3506, | |
| "train_tokens_per_second": 6874.503 | |
| }, | |
| { | |
| "epoch": 0.21215043394406943, | |
| "grad_norm": 0.2393670231103897, | |
| "learning_rate": 0.00015822050290135398, | |
| "loss": 1.0919, | |
| "num_input_tokens_seen": 15918912, | |
| "step": 330, | |
| "train_runtime": 2315.3599, | |
| "train_tokens_per_second": 6875.351 | |
| }, | |
| { | |
| "epoch": 0.21279331404693025, | |
| "grad_norm": 0.22710706293582916, | |
| "learning_rate": 0.00015809155383623467, | |
| "loss": 0.8762, | |
| "num_input_tokens_seen": 15964208, | |
| "step": 331, | |
| "train_runtime": 2322.1834, | |
| "train_tokens_per_second": 6874.654 | |
| }, | |
| { | |
| "epoch": 0.21343619414979106, | |
| "grad_norm": 0.2203913927078247, | |
| "learning_rate": 0.00015796260477111542, | |
| "loss": 0.9199, | |
| "num_input_tokens_seen": 16005184, | |
| "step": 332, | |
| "train_runtime": 2327.9642, | |
| "train_tokens_per_second": 6875.185 | |
| }, | |
| { | |
| "epoch": 0.21407907425265188, | |
| "grad_norm": 0.21308915317058563, | |
| "learning_rate": 0.00015783365570599614, | |
| "loss": 1.072, | |
| "num_input_tokens_seen": 16059904, | |
| "step": 333, | |
| "train_runtime": 2335.62, | |
| "train_tokens_per_second": 6876.077 | |
| }, | |
| { | |
| "epoch": 0.2147219543555127, | |
| "grad_norm": 0.20549263060092926, | |
| "learning_rate": 0.00015770470664087686, | |
| "loss": 0.8769, | |
| "num_input_tokens_seen": 16107120, | |
| "step": 334, | |
| "train_runtime": 2342.2351, | |
| "train_tokens_per_second": 6876.816 | |
| }, | |
| { | |
| "epoch": 0.2153648344583735, | |
| "grad_norm": 0.2424677014350891, | |
| "learning_rate": 0.00015757575757575757, | |
| "loss": 0.9632, | |
| "num_input_tokens_seen": 16167296, | |
| "step": 335, | |
| "train_runtime": 2350.7127, | |
| "train_tokens_per_second": 6877.615 | |
| }, | |
| { | |
| "epoch": 0.21600771456123433, | |
| "grad_norm": 0.2267872840166092, | |
| "learning_rate": 0.00015744680851063832, | |
| "loss": 1.0203, | |
| "num_input_tokens_seen": 16204688, | |
| "step": 336, | |
| "train_runtime": 2355.9807, | |
| "train_tokens_per_second": 6878.107 | |
| }, | |
| { | |
| "epoch": 0.21665059466409514, | |
| "grad_norm": 0.22265243530273438, | |
| "learning_rate": 0.000157317859445519, | |
| "loss": 0.944, | |
| "num_input_tokens_seen": 16260720, | |
| "step": 337, | |
| "train_runtime": 2363.8103, | |
| "train_tokens_per_second": 6879.029 | |
| }, | |
| { | |
| "epoch": 0.21729347476695596, | |
| "grad_norm": 0.21381650865077972, | |
| "learning_rate": 0.00015718891038039975, | |
| "loss": 0.9924, | |
| "num_input_tokens_seen": 16311056, | |
| "step": 338, | |
| "train_runtime": 2370.8636, | |
| "train_tokens_per_second": 6879.795 | |
| }, | |
| { | |
| "epoch": 0.21793635486981677, | |
| "grad_norm": 0.22315365076065063, | |
| "learning_rate": 0.00015705996131528047, | |
| "loss": 0.9271, | |
| "num_input_tokens_seen": 16373312, | |
| "step": 339, | |
| "train_runtime": 2379.5316, | |
| "train_tokens_per_second": 6880.897 | |
| }, | |
| { | |
| "epoch": 0.2185792349726776, | |
| "grad_norm": 0.20747241377830505, | |
| "learning_rate": 0.0001569310122501612, | |
| "loss": 0.9806, | |
| "num_input_tokens_seen": 16460896, | |
| "step": 340, | |
| "train_runtime": 2391.8054, | |
| "train_tokens_per_second": 6882.205 | |
| }, | |
| { | |
| "epoch": 0.2192221150755384, | |
| "grad_norm": 0.22228913009166718, | |
| "learning_rate": 0.0001568020631850419, | |
| "loss": 0.9529, | |
| "num_input_tokens_seen": 16500624, | |
| "step": 341, | |
| "train_runtime": 2397.4202, | |
| "train_tokens_per_second": 6882.658 | |
| }, | |
| { | |
| "epoch": 0.21986499517839922, | |
| "grad_norm": 0.22346661984920502, | |
| "learning_rate": 0.00015667311411992265, | |
| "loss": 1.0819, | |
| "num_input_tokens_seen": 16562912, | |
| "step": 342, | |
| "train_runtime": 2406.137, | |
| "train_tokens_per_second": 6883.611 | |
| }, | |
| { | |
| "epoch": 0.22050787528126004, | |
| "grad_norm": 0.21236997842788696, | |
| "learning_rate": 0.00015654416505480337, | |
| "loss": 1.0681, | |
| "num_input_tokens_seen": 16641856, | |
| "step": 343, | |
| "train_runtime": 2417.3084, | |
| "train_tokens_per_second": 6884.457 | |
| }, | |
| { | |
| "epoch": 0.22115075538412085, | |
| "grad_norm": 0.22987902164459229, | |
| "learning_rate": 0.00015641521598968406, | |
| "loss": 0.9596, | |
| "num_input_tokens_seen": 16680544, | |
| "step": 344, | |
| "train_runtime": 2422.7728, | |
| "train_tokens_per_second": 6884.898 | |
| }, | |
| { | |
| "epoch": 0.22179363548698167, | |
| "grad_norm": 0.2243010699748993, | |
| "learning_rate": 0.0001562862669245648, | |
| "loss": 1.0497, | |
| "num_input_tokens_seen": 16731376, | |
| "step": 345, | |
| "train_runtime": 2429.8931, | |
| "train_tokens_per_second": 6885.643 | |
| }, | |
| { | |
| "epoch": 0.22243651558984248, | |
| "grad_norm": 0.20788230001926422, | |
| "learning_rate": 0.00015615731785944553, | |
| "loss": 1.0496, | |
| "num_input_tokens_seen": 16777760, | |
| "step": 346, | |
| "train_runtime": 2436.3871, | |
| "train_tokens_per_second": 6886.328 | |
| }, | |
| { | |
| "epoch": 0.2230793956927033, | |
| "grad_norm": 0.20559217035770416, | |
| "learning_rate": 0.00015602836879432625, | |
| "loss": 1.0781, | |
| "num_input_tokens_seen": 16820112, | |
| "step": 347, | |
| "train_runtime": 2442.3361, | |
| "train_tokens_per_second": 6886.895 | |
| }, | |
| { | |
| "epoch": 0.22372227579556414, | |
| "grad_norm": 0.22564542293548584, | |
| "learning_rate": 0.00015589941972920696, | |
| "loss": 0.9787, | |
| "num_input_tokens_seen": 16862384, | |
| "step": 348, | |
| "train_runtime": 2448.2489, | |
| "train_tokens_per_second": 6887.529 | |
| }, | |
| { | |
| "epoch": 0.22436515589842496, | |
| "grad_norm": 0.20842592418193817, | |
| "learning_rate": 0.0001557704706640877, | |
| "loss": 0.9991, | |
| "num_input_tokens_seen": 16904848, | |
| "step": 349, | |
| "train_runtime": 2454.2617, | |
| "train_tokens_per_second": 6887.957 | |
| }, | |
| { | |
| "epoch": 0.22500803600128577, | |
| "grad_norm": 0.2145644873380661, | |
| "learning_rate": 0.0001556415215989684, | |
| "loss": 1.1338, | |
| "num_input_tokens_seen": 16962400, | |
| "step": 350, | |
| "train_runtime": 2462.3222, | |
| "train_tokens_per_second": 6888.782 | |
| }, | |
| { | |
| "epoch": 0.2256509161041466, | |
| "grad_norm": 0.22125239670276642, | |
| "learning_rate": 0.00015551257253384914, | |
| "loss": 0.9465, | |
| "num_input_tokens_seen": 17031360, | |
| "step": 351, | |
| "train_runtime": 2471.9125, | |
| "train_tokens_per_second": 6889.953 | |
| }, | |
| { | |
| "epoch": 0.2262937962070074, | |
| "grad_norm": 0.22434987127780914, | |
| "learning_rate": 0.00015538362346872986, | |
| "loss": 1.0576, | |
| "num_input_tokens_seen": 17070768, | |
| "step": 352, | |
| "train_runtime": 2477.4513, | |
| "train_tokens_per_second": 6890.456 | |
| }, | |
| { | |
| "epoch": 0.22693667630986822, | |
| "grad_norm": 0.2168796807527542, | |
| "learning_rate": 0.00015525467440361058, | |
| "loss": 0.9702, | |
| "num_input_tokens_seen": 17133312, | |
| "step": 353, | |
| "train_runtime": 2486.2278, | |
| "train_tokens_per_second": 6891.288 | |
| }, | |
| { | |
| "epoch": 0.22757955641272903, | |
| "grad_norm": 0.2135160118341446, | |
| "learning_rate": 0.0001551257253384913, | |
| "loss": 0.9385, | |
| "num_input_tokens_seen": 17209040, | |
| "step": 354, | |
| "train_runtime": 2496.8564, | |
| "train_tokens_per_second": 6892.283 | |
| }, | |
| { | |
| "epoch": 0.22822243651558985, | |
| "grad_norm": 0.20850864052772522, | |
| "learning_rate": 0.00015499677627337204, | |
| "loss": 1.0142, | |
| "num_input_tokens_seen": 17249168, | |
| "step": 355, | |
| "train_runtime": 2502.4956, | |
| "train_tokens_per_second": 6892.786 | |
| }, | |
| { | |
| "epoch": 0.22886531661845066, | |
| "grad_norm": 0.22662048041820526, | |
| "learning_rate": 0.00015486782720825274, | |
| "loss": 1.101, | |
| "num_input_tokens_seen": 17286880, | |
| "step": 356, | |
| "train_runtime": 2507.7503, | |
| "train_tokens_per_second": 6893.382 | |
| }, | |
| { | |
| "epoch": 0.22950819672131148, | |
| "grad_norm": 0.25150901079177856, | |
| "learning_rate": 0.00015473887814313345, | |
| "loss": 1.0504, | |
| "num_input_tokens_seen": 17336416, | |
| "step": 357, | |
| "train_runtime": 2514.6955, | |
| "train_tokens_per_second": 6894.042 | |
| }, | |
| { | |
| "epoch": 0.2301510768241723, | |
| "grad_norm": 0.22188004851341248, | |
| "learning_rate": 0.0001546099290780142, | |
| "loss": 0.9251, | |
| "num_input_tokens_seen": 17372624, | |
| "step": 358, | |
| "train_runtime": 2519.8241, | |
| "train_tokens_per_second": 6894.38 | |
| }, | |
| { | |
| "epoch": 0.2307939569270331, | |
| "grad_norm": 0.2283482849597931, | |
| "learning_rate": 0.00015448098001289492, | |
| "loss": 0.9696, | |
| "num_input_tokens_seen": 17405232, | |
| "step": 359, | |
| "train_runtime": 2524.4397, | |
| "train_tokens_per_second": 6894.691 | |
| }, | |
| { | |
| "epoch": 0.23143683702989393, | |
| "grad_norm": 0.23135900497436523, | |
| "learning_rate": 0.00015435203094777563, | |
| "loss": 1.0346, | |
| "num_input_tokens_seen": 17464912, | |
| "step": 360, | |
| "train_runtime": 2532.7593, | |
| "train_tokens_per_second": 6895.607 | |
| }, | |
| { | |
| "epoch": 0.23207971713275474, | |
| "grad_norm": 0.20459306240081787, | |
| "learning_rate": 0.00015422308188265635, | |
| "loss": 0.9895, | |
| "num_input_tokens_seen": 17504080, | |
| "step": 361, | |
| "train_runtime": 2538.8167, | |
| "train_tokens_per_second": 6894.582 | |
| }, | |
| { | |
| "epoch": 0.23272259723561556, | |
| "grad_norm": 0.23917587101459503, | |
| "learning_rate": 0.00015409413281753707, | |
| "loss": 1.1129, | |
| "num_input_tokens_seen": 17550544, | |
| "step": 362, | |
| "train_runtime": 2545.3315, | |
| "train_tokens_per_second": 6895.19 | |
| }, | |
| { | |
| "epoch": 0.23336547733847637, | |
| "grad_norm": 0.21495625376701355, | |
| "learning_rate": 0.0001539651837524178, | |
| "loss": 0.9594, | |
| "num_input_tokens_seen": 17597312, | |
| "step": 363, | |
| "train_runtime": 2551.871, | |
| "train_tokens_per_second": 6895.847 | |
| }, | |
| { | |
| "epoch": 0.2340083574413372, | |
| "grad_norm": 0.21964554488658905, | |
| "learning_rate": 0.00015383623468729853, | |
| "loss": 0.9654, | |
| "num_input_tokens_seen": 17638976, | |
| "step": 364, | |
| "train_runtime": 2557.6614, | |
| "train_tokens_per_second": 6896.525 | |
| }, | |
| { | |
| "epoch": 0.234651237544198, | |
| "grad_norm": 0.20798838138580322, | |
| "learning_rate": 0.00015370728562217925, | |
| "loss": 1.0088, | |
| "num_input_tokens_seen": 17681408, | |
| "step": 365, | |
| "train_runtime": 2563.5782, | |
| "train_tokens_per_second": 6897.16 | |
| }, | |
| { | |
| "epoch": 0.23529411764705882, | |
| "grad_norm": 0.2274344116449356, | |
| "learning_rate": 0.00015357833655705997, | |
| "loss": 1.0474, | |
| "num_input_tokens_seen": 17721088, | |
| "step": 366, | |
| "train_runtime": 2569.1892, | |
| "train_tokens_per_second": 6897.541 | |
| }, | |
| { | |
| "epoch": 0.23593699774991964, | |
| "grad_norm": 0.21265920996665955, | |
| "learning_rate": 0.0001534493874919407, | |
| "loss": 1.0855, | |
| "num_input_tokens_seen": 17774192, | |
| "step": 367, | |
| "train_runtime": 2576.6447, | |
| "train_tokens_per_second": 6898.193 | |
| }, | |
| { | |
| "epoch": 0.23657987785278045, | |
| "grad_norm": 0.20594769716262817, | |
| "learning_rate": 0.00015332043842682143, | |
| "loss": 1.0002, | |
| "num_input_tokens_seen": 17806736, | |
| "step": 368, | |
| "train_runtime": 2581.2698, | |
| "train_tokens_per_second": 6898.44 | |
| }, | |
| { | |
| "epoch": 0.23722275795564127, | |
| "grad_norm": 0.23406660556793213, | |
| "learning_rate": 0.00015319148936170213, | |
| "loss": 0.9609, | |
| "num_input_tokens_seen": 17851600, | |
| "step": 369, | |
| "train_runtime": 2587.5545, | |
| "train_tokens_per_second": 6899.024 | |
| }, | |
| { | |
| "epoch": 0.23786563805850208, | |
| "grad_norm": 0.2062958925962448, | |
| "learning_rate": 0.00015306254029658287, | |
| "loss": 0.9404, | |
| "num_input_tokens_seen": 17900896, | |
| "step": 370, | |
| "train_runtime": 2594.5321, | |
| "train_tokens_per_second": 6899.47 | |
| }, | |
| { | |
| "epoch": 0.2385085181613629, | |
| "grad_norm": 0.21552585065364838, | |
| "learning_rate": 0.0001529335912314636, | |
| "loss": 1.0565, | |
| "num_input_tokens_seen": 17944608, | |
| "step": 371, | |
| "train_runtime": 2600.689, | |
| "train_tokens_per_second": 6899.944 | |
| }, | |
| { | |
| "epoch": 0.2391513982642237, | |
| "grad_norm": 0.2339625358581543, | |
| "learning_rate": 0.00015280464216634428, | |
| "loss": 1.0835, | |
| "num_input_tokens_seen": 17997248, | |
| "step": 372, | |
| "train_runtime": 2608.1398, | |
| "train_tokens_per_second": 6900.415 | |
| }, | |
| { | |
| "epoch": 0.23979427836708453, | |
| "grad_norm": 0.20932239294052124, | |
| "learning_rate": 0.00015267569310122502, | |
| "loss": 0.8882, | |
| "num_input_tokens_seen": 18038784, | |
| "step": 373, | |
| "train_runtime": 2614.0203, | |
| "train_tokens_per_second": 6900.782 | |
| }, | |
| { | |
| "epoch": 0.24043715846994534, | |
| "grad_norm": 0.21244873106479645, | |
| "learning_rate": 0.00015254674403610574, | |
| "loss": 1.1622, | |
| "num_input_tokens_seen": 18100272, | |
| "step": 374, | |
| "train_runtime": 2622.6304, | |
| "train_tokens_per_second": 6901.572 | |
| }, | |
| { | |
| "epoch": 0.24108003857280616, | |
| "grad_norm": 0.2197032868862152, | |
| "learning_rate": 0.00015241779497098646, | |
| "loss": 1.0074, | |
| "num_input_tokens_seen": 18139376, | |
| "step": 375, | |
| "train_runtime": 2628.1043, | |
| "train_tokens_per_second": 6902.076 | |
| }, | |
| { | |
| "epoch": 0.24172291867566698, | |
| "grad_norm": 0.2254268378019333, | |
| "learning_rate": 0.00015228884590586718, | |
| "loss": 1.1203, | |
| "num_input_tokens_seen": 18183152, | |
| "step": 376, | |
| "train_runtime": 2634.2959, | |
| "train_tokens_per_second": 6902.471 | |
| }, | |
| { | |
| "epoch": 0.2423657987785278, | |
| "grad_norm": 0.22068928182125092, | |
| "learning_rate": 0.00015215989684074792, | |
| "loss": 1.0726, | |
| "num_input_tokens_seen": 18246832, | |
| "step": 377, | |
| "train_runtime": 2643.2335, | |
| "train_tokens_per_second": 6903.224 | |
| }, | |
| { | |
| "epoch": 0.24300867888138863, | |
| "grad_norm": 0.2326030731201172, | |
| "learning_rate": 0.00015203094777562864, | |
| "loss": 1.037, | |
| "num_input_tokens_seen": 18294272, | |
| "step": 378, | |
| "train_runtime": 2649.8373, | |
| "train_tokens_per_second": 6903.923 | |
| }, | |
| { | |
| "epoch": 0.24365155898424945, | |
| "grad_norm": 0.20725147426128387, | |
| "learning_rate": 0.00015190199871050936, | |
| "loss": 1.0334, | |
| "num_input_tokens_seen": 18358048, | |
| "step": 379, | |
| "train_runtime": 2658.7607, | |
| "train_tokens_per_second": 6904.739 | |
| }, | |
| { | |
| "epoch": 0.24429443908711027, | |
| "grad_norm": 0.22106829285621643, | |
| "learning_rate": 0.00015177304964539008, | |
| "loss": 0.919, | |
| "num_input_tokens_seen": 18415040, | |
| "step": 380, | |
| "train_runtime": 2666.8029, | |
| "train_tokens_per_second": 6905.287 | |
| }, | |
| { | |
| "epoch": 0.24493731918997108, | |
| "grad_norm": 0.21206669509410858, | |
| "learning_rate": 0.0001516441005802708, | |
| "loss": 1.0846, | |
| "num_input_tokens_seen": 18457616, | |
| "step": 381, | |
| "train_runtime": 2672.8188, | |
| "train_tokens_per_second": 6905.674 | |
| }, | |
| { | |
| "epoch": 0.2455801992928319, | |
| "grad_norm": 0.2023545801639557, | |
| "learning_rate": 0.00015151515151515152, | |
| "loss": 1.0256, | |
| "num_input_tokens_seen": 18501568, | |
| "step": 382, | |
| "train_runtime": 2678.9798, | |
| "train_tokens_per_second": 6906.199 | |
| }, | |
| { | |
| "epoch": 0.2462230793956927, | |
| "grad_norm": 0.22866152226924896, | |
| "learning_rate": 0.00015138620245003226, | |
| "loss": 1.0998, | |
| "num_input_tokens_seen": 18549424, | |
| "step": 383, | |
| "train_runtime": 2685.7401, | |
| "train_tokens_per_second": 6906.634 | |
| }, | |
| { | |
| "epoch": 0.24686595949855353, | |
| "grad_norm": 0.20636679232120514, | |
| "learning_rate": 0.00015125725338491298, | |
| "loss": 1.0465, | |
| "num_input_tokens_seen": 18586848, | |
| "step": 384, | |
| "train_runtime": 2691.0114, | |
| "train_tokens_per_second": 6907.012 | |
| }, | |
| { | |
| "epoch": 0.24750883960141434, | |
| "grad_norm": 0.23085221648216248, | |
| "learning_rate": 0.00015112830431979367, | |
| "loss": 1.0254, | |
| "num_input_tokens_seen": 18626480, | |
| "step": 385, | |
| "train_runtime": 2696.519, | |
| "train_tokens_per_second": 6907.602 | |
| }, | |
| { | |
| "epoch": 0.24815171970427516, | |
| "grad_norm": 0.22030708193778992, | |
| "learning_rate": 0.00015099935525467441, | |
| "loss": 1.0352, | |
| "num_input_tokens_seen": 18689568, | |
| "step": 386, | |
| "train_runtime": 2705.3041, | |
| "train_tokens_per_second": 6908.491 | |
| }, | |
| { | |
| "epoch": 0.24879459980713597, | |
| "grad_norm": 0.22935743629932404, | |
| "learning_rate": 0.00015087040618955513, | |
| "loss": 1.146, | |
| "num_input_tokens_seen": 18726704, | |
| "step": 387, | |
| "train_runtime": 2710.5029, | |
| "train_tokens_per_second": 6908.941 | |
| }, | |
| { | |
| "epoch": 0.2494374799099968, | |
| "grad_norm": 0.20517560839653015, | |
| "learning_rate": 0.00015074145712443585, | |
| "loss": 1.022, | |
| "num_input_tokens_seen": 18766496, | |
| "step": 388, | |
| "train_runtime": 2716.0753, | |
| "train_tokens_per_second": 6909.417 | |
| }, | |
| { | |
| "epoch": 0.2500803600128576, | |
| "grad_norm": 0.22025009989738464, | |
| "learning_rate": 0.00015061250805931657, | |
| "loss": 0.9693, | |
| "num_input_tokens_seen": 18816080, | |
| "step": 389, | |
| "train_runtime": 2722.9496, | |
| "train_tokens_per_second": 6910.183 | |
| }, | |
| { | |
| "epoch": 0.2507232401157184, | |
| "grad_norm": 0.21232417225837708, | |
| "learning_rate": 0.00015048355899419731, | |
| "loss": 1.2909, | |
| "num_input_tokens_seen": 18882448, | |
| "step": 390, | |
| "train_runtime": 2732.2319, | |
| "train_tokens_per_second": 6910.998 | |
| }, | |
| { | |
| "epoch": 0.25136612021857924, | |
| "grad_norm": 0.23262064158916473, | |
| "learning_rate": 0.000150354609929078, | |
| "loss": 1.0109, | |
| "num_input_tokens_seen": 18914880, | |
| "step": 391, | |
| "train_runtime": 2737.3571, | |
| "train_tokens_per_second": 6909.906 | |
| }, | |
| { | |
| "epoch": 0.25200900032144, | |
| "grad_norm": 0.22956109046936035, | |
| "learning_rate": 0.00015022566086395875, | |
| "loss": 1.0905, | |
| "num_input_tokens_seen": 18956000, | |
| "step": 392, | |
| "train_runtime": 2743.0989, | |
| "train_tokens_per_second": 6910.433 | |
| }, | |
| { | |
| "epoch": 0.25265188042430087, | |
| "grad_norm": 0.22758060693740845, | |
| "learning_rate": 0.00015009671179883947, | |
| "loss": 0.8537, | |
| "num_input_tokens_seen": 18994240, | |
| "step": 393, | |
| "train_runtime": 2748.4514, | |
| "train_tokens_per_second": 6910.888 | |
| }, | |
| { | |
| "epoch": 0.2532947605271617, | |
| "grad_norm": 0.23041218519210815, | |
| "learning_rate": 0.0001499677627337202, | |
| "loss": 1.0148, | |
| "num_input_tokens_seen": 19043488, | |
| "step": 394, | |
| "train_runtime": 2755.3445, | |
| "train_tokens_per_second": 6911.473 | |
| }, | |
| { | |
| "epoch": 0.2539376406300225, | |
| "grad_norm": 0.22266460955142975, | |
| "learning_rate": 0.0001498388136686009, | |
| "loss": 0.9664, | |
| "num_input_tokens_seen": 19104592, | |
| "step": 395, | |
| "train_runtime": 2763.8353, | |
| "train_tokens_per_second": 6912.348 | |
| }, | |
| { | |
| "epoch": 0.25458052073288334, | |
| "grad_norm": 0.21018558740615845, | |
| "learning_rate": 0.00014970986460348165, | |
| "loss": 0.96, | |
| "num_input_tokens_seen": 19162144, | |
| "step": 396, | |
| "train_runtime": 2771.8439, | |
| "train_tokens_per_second": 6913.14 | |
| }, | |
| { | |
| "epoch": 0.25522340083574413, | |
| "grad_norm": 0.2324586659669876, | |
| "learning_rate": 0.00014958091553836234, | |
| "loss": 0.9965, | |
| "num_input_tokens_seen": 19213072, | |
| "step": 397, | |
| "train_runtime": 2778.8865, | |
| "train_tokens_per_second": 6913.946 | |
| }, | |
| { | |
| "epoch": 0.255866280938605, | |
| "grad_norm": 0.22461821138858795, | |
| "learning_rate": 0.00014945196647324306, | |
| "loss": 1.0135, | |
| "num_input_tokens_seen": 19264752, | |
| "step": 398, | |
| "train_runtime": 2786.0111, | |
| "train_tokens_per_second": 6914.815 | |
| }, | |
| { | |
| "epoch": 0.25650916104146576, | |
| "grad_norm": 0.21653743088245392, | |
| "learning_rate": 0.0001493230174081238, | |
| "loss": 0.9953, | |
| "num_input_tokens_seen": 19314720, | |
| "step": 399, | |
| "train_runtime": 2792.9395, | |
| "train_tokens_per_second": 6915.552 | |
| }, | |
| { | |
| "epoch": 0.2571520411443266, | |
| "grad_norm": 0.1964331865310669, | |
| "learning_rate": 0.00014919406834300452, | |
| "loss": 1.0134, | |
| "num_input_tokens_seen": 19372448, | |
| "step": 400, | |
| "train_runtime": 2800.9649, | |
| "train_tokens_per_second": 6916.348 | |
| }, | |
| { | |
| "epoch": 0.2577949212471874, | |
| "grad_norm": 0.22261105477809906, | |
| "learning_rate": 0.00014906511927788524, | |
| "loss": 0.8945, | |
| "num_input_tokens_seen": 19419152, | |
| "step": 401, | |
| "train_runtime": 2807.4236, | |
| "train_tokens_per_second": 6917.072 | |
| }, | |
| { | |
| "epoch": 0.25843780135004824, | |
| "grad_norm": 0.21433231234550476, | |
| "learning_rate": 0.00014893617021276596, | |
| "loss": 0.9175, | |
| "num_input_tokens_seen": 19473936, | |
| "step": 402, | |
| "train_runtime": 2814.9768, | |
| "train_tokens_per_second": 6917.974 | |
| }, | |
| { | |
| "epoch": 0.259080681452909, | |
| "grad_norm": 0.20293863117694855, | |
| "learning_rate": 0.0001488072211476467, | |
| "loss": 1.085, | |
| "num_input_tokens_seen": 19520528, | |
| "step": 403, | |
| "train_runtime": 2821.3854, | |
| "train_tokens_per_second": 6918.774 | |
| }, | |
| { | |
| "epoch": 0.25972356155576987, | |
| "grad_norm": 0.2340640276670456, | |
| "learning_rate": 0.0001486782720825274, | |
| "loss": 0.9965, | |
| "num_input_tokens_seen": 19573120, | |
| "step": 404, | |
| "train_runtime": 2828.5815, | |
| "train_tokens_per_second": 6919.765 | |
| }, | |
| { | |
| "epoch": 0.26036644165863065, | |
| "grad_norm": 0.22344012558460236, | |
| "learning_rate": 0.00014854932301740814, | |
| "loss": 0.9849, | |
| "num_input_tokens_seen": 19623328, | |
| "step": 405, | |
| "train_runtime": 2835.5013, | |
| "train_tokens_per_second": 6920.585 | |
| }, | |
| { | |
| "epoch": 0.2610093217614915, | |
| "grad_norm": 0.1989823281764984, | |
| "learning_rate": 0.00014842037395228886, | |
| "loss": 1.0261, | |
| "num_input_tokens_seen": 19663536, | |
| "step": 406, | |
| "train_runtime": 2841.0622, | |
| "train_tokens_per_second": 6921.192 | |
| }, | |
| { | |
| "epoch": 0.2616522018643523, | |
| "grad_norm": 0.25294196605682373, | |
| "learning_rate": 0.00014829142488716958, | |
| "loss": 1.0592, | |
| "num_input_tokens_seen": 19716272, | |
| "step": 407, | |
| "train_runtime": 2848.3461, | |
| "train_tokens_per_second": 6922.007 | |
| }, | |
| { | |
| "epoch": 0.26229508196721313, | |
| "grad_norm": 0.19655641913414001, | |
| "learning_rate": 0.0001481624758220503, | |
| "loss": 1.0594, | |
| "num_input_tokens_seen": 19757136, | |
| "step": 408, | |
| "train_runtime": 2854.032, | |
| "train_tokens_per_second": 6922.535 | |
| }, | |
| { | |
| "epoch": 0.2629379620700739, | |
| "grad_norm": 0.2105259895324707, | |
| "learning_rate": 0.00014803352675693104, | |
| "loss": 0.9865, | |
| "num_input_tokens_seen": 19798336, | |
| "step": 409, | |
| "train_runtime": 2859.7906, | |
| "train_tokens_per_second": 6923.002 | |
| }, | |
| { | |
| "epoch": 0.26358084217293476, | |
| "grad_norm": 0.23902744054794312, | |
| "learning_rate": 0.00014790457769181173, | |
| "loss": 0.9191, | |
| "num_input_tokens_seen": 19835600, | |
| "step": 410, | |
| "train_runtime": 2864.9574, | |
| "train_tokens_per_second": 6923.523 | |
| }, | |
| { | |
| "epoch": 0.26422372227579555, | |
| "grad_norm": 0.20994171500205994, | |
| "learning_rate": 0.00014777562862669245, | |
| "loss": 1.0072, | |
| "num_input_tokens_seen": 19888144, | |
| "step": 411, | |
| "train_runtime": 2872.2647, | |
| "train_tokens_per_second": 6924.203 | |
| }, | |
| { | |
| "epoch": 0.2648666023786564, | |
| "grad_norm": 0.2297692447900772, | |
| "learning_rate": 0.0001476466795615732, | |
| "loss": 0.892, | |
| "num_input_tokens_seen": 19919472, | |
| "step": 412, | |
| "train_runtime": 2876.6558, | |
| "train_tokens_per_second": 6924.524 | |
| }, | |
| { | |
| "epoch": 0.2655094824815172, | |
| "grad_norm": 0.23039385676383972, | |
| "learning_rate": 0.00014751773049645389, | |
| "loss": 0.9413, | |
| "num_input_tokens_seen": 19970784, | |
| "step": 413, | |
| "train_runtime": 2883.6897, | |
| "train_tokens_per_second": 6925.427 | |
| }, | |
| { | |
| "epoch": 0.266152362584378, | |
| "grad_norm": 0.22210006415843964, | |
| "learning_rate": 0.00014738878143133463, | |
| "loss": 1.0716, | |
| "num_input_tokens_seen": 20016944, | |
| "step": 414, | |
| "train_runtime": 2890.0507, | |
| "train_tokens_per_second": 6926.157 | |
| }, | |
| { | |
| "epoch": 0.2667952426872388, | |
| "grad_norm": 0.21822607517242432, | |
| "learning_rate": 0.00014725983236621535, | |
| "loss": 1.063, | |
| "num_input_tokens_seen": 20073952, | |
| "step": 415, | |
| "train_runtime": 2897.8885, | |
| "train_tokens_per_second": 6927.096 | |
| }, | |
| { | |
| "epoch": 0.26743812279009965, | |
| "grad_norm": 0.226910799741745, | |
| "learning_rate": 0.00014713088330109607, | |
| "loss": 1.0704, | |
| "num_input_tokens_seen": 20148912, | |
| "step": 416, | |
| "train_runtime": 2908.257, | |
| "train_tokens_per_second": 6928.174 | |
| }, | |
| { | |
| "epoch": 0.26808100289296044, | |
| "grad_norm": 0.20137490332126617, | |
| "learning_rate": 0.00014700193423597678, | |
| "loss": 0.9697, | |
| "num_input_tokens_seen": 20206416, | |
| "step": 417, | |
| "train_runtime": 2916.1441, | |
| "train_tokens_per_second": 6929.155 | |
| }, | |
| { | |
| "epoch": 0.2687238829958213, | |
| "grad_norm": 0.21282772719860077, | |
| "learning_rate": 0.00014687298517085753, | |
| "loss": 0.9607, | |
| "num_input_tokens_seen": 20248576, | |
| "step": 418, | |
| "train_runtime": 2921.9462, | |
| "train_tokens_per_second": 6929.825 | |
| }, | |
| { | |
| "epoch": 0.26936676309868207, | |
| "grad_norm": 0.21868926286697388, | |
| "learning_rate": 0.00014674403610573825, | |
| "loss": 0.9257, | |
| "num_input_tokens_seen": 20293872, | |
| "step": 419, | |
| "train_runtime": 2928.1578, | |
| "train_tokens_per_second": 6930.594 | |
| }, | |
| { | |
| "epoch": 0.2700096432015429, | |
| "grad_norm": 0.19923853874206543, | |
| "learning_rate": 0.00014661508704061897, | |
| "loss": 1.0378, | |
| "num_input_tokens_seen": 20332000, | |
| "step": 420, | |
| "train_runtime": 2933.4328, | |
| "train_tokens_per_second": 6931.129 | |
| }, | |
| { | |
| "epoch": 0.2706525233044037, | |
| "grad_norm": 0.2215918004512787, | |
| "learning_rate": 0.00014648613797549968, | |
| "loss": 1.0737, | |
| "num_input_tokens_seen": 20383904, | |
| "step": 421, | |
| "train_runtime": 2941.1143, | |
| "train_tokens_per_second": 6930.674 | |
| }, | |
| { | |
| "epoch": 0.27129540340726455, | |
| "grad_norm": 0.21484601497650146, | |
| "learning_rate": 0.0001463571889103804, | |
| "loss": 0.9174, | |
| "num_input_tokens_seen": 20462464, | |
| "step": 422, | |
| "train_runtime": 2951.9415, | |
| "train_tokens_per_second": 6931.866 | |
| }, | |
| { | |
| "epoch": 0.2719382835101254, | |
| "grad_norm": 0.24356883764266968, | |
| "learning_rate": 0.00014622823984526112, | |
| "loss": 1.0667, | |
| "num_input_tokens_seen": 20516160, | |
| "step": 423, | |
| "train_runtime": 2959.3036, | |
| "train_tokens_per_second": 6932.766 | |
| }, | |
| { | |
| "epoch": 0.2725811636129862, | |
| "grad_norm": 0.22561974823474884, | |
| "learning_rate": 0.00014609929078014187, | |
| "loss": 1.0216, | |
| "num_input_tokens_seen": 20555504, | |
| "step": 424, | |
| "train_runtime": 2964.7521, | |
| "train_tokens_per_second": 6933.296 | |
| }, | |
| { | |
| "epoch": 0.273224043715847, | |
| "grad_norm": 0.22649145126342773, | |
| "learning_rate": 0.00014597034171502258, | |
| "loss": 0.99, | |
| "num_input_tokens_seen": 20635824, | |
| "step": 425, | |
| "train_runtime": 2975.8312, | |
| "train_tokens_per_second": 6934.474 | |
| }, | |
| { | |
| "epoch": 0.2738669238187078, | |
| "grad_norm": 0.2253292202949524, | |
| "learning_rate": 0.00014584139264990328, | |
| "loss": 1.0371, | |
| "num_input_tokens_seen": 20675360, | |
| "step": 426, | |
| "train_runtime": 2981.2815, | |
| "train_tokens_per_second": 6935.058 | |
| }, | |
| { | |
| "epoch": 0.27450980392156865, | |
| "grad_norm": 0.21163207292556763, | |
| "learning_rate": 0.00014571244358478402, | |
| "loss": 0.9201, | |
| "num_input_tokens_seen": 20721296, | |
| "step": 427, | |
| "train_runtime": 2987.6584, | |
| "train_tokens_per_second": 6935.631 | |
| }, | |
| { | |
| "epoch": 0.27515268402442944, | |
| "grad_norm": 0.21027563512325287, | |
| "learning_rate": 0.00014558349451966474, | |
| "loss": 0.9869, | |
| "num_input_tokens_seen": 20756176, | |
| "step": 428, | |
| "train_runtime": 2992.5875, | |
| "train_tokens_per_second": 6935.863 | |
| }, | |
| { | |
| "epoch": 0.2757955641272903, | |
| "grad_norm": 0.2262483835220337, | |
| "learning_rate": 0.00014545454545454546, | |
| "loss": 0.9857, | |
| "num_input_tokens_seen": 20795920, | |
| "step": 429, | |
| "train_runtime": 2998.1707, | |
| "train_tokens_per_second": 6936.203 | |
| }, | |
| { | |
| "epoch": 0.27643844423015107, | |
| "grad_norm": 0.20631232857704163, | |
| "learning_rate": 0.00014532559638942617, | |
| "loss": 0.8497, | |
| "num_input_tokens_seen": 20833296, | |
| "step": 430, | |
| "train_runtime": 3003.4181, | |
| "train_tokens_per_second": 6936.529 | |
| }, | |
| { | |
| "epoch": 0.2770813243330119, | |
| "grad_norm": 0.20906981825828552, | |
| "learning_rate": 0.00014519664732430692, | |
| "loss": 0.9911, | |
| "num_input_tokens_seen": 20881552, | |
| "step": 431, | |
| "train_runtime": 3010.1323, | |
| "train_tokens_per_second": 6937.088 | |
| }, | |
| { | |
| "epoch": 0.2777242044358727, | |
| "grad_norm": 0.1900017410516739, | |
| "learning_rate": 0.0001450676982591876, | |
| "loss": 0.9406, | |
| "num_input_tokens_seen": 20920416, | |
| "step": 432, | |
| "train_runtime": 3015.588, | |
| "train_tokens_per_second": 6937.425 | |
| }, | |
| { | |
| "epoch": 0.27836708453873354, | |
| "grad_norm": 0.23332680761814117, | |
| "learning_rate": 0.00014493874919406836, | |
| "loss": 0.9818, | |
| "num_input_tokens_seen": 20958432, | |
| "step": 433, | |
| "train_runtime": 3020.9117, | |
| "train_tokens_per_second": 6937.784 | |
| }, | |
| { | |
| "epoch": 0.27900996464159433, | |
| "grad_norm": 0.20991705358028412, | |
| "learning_rate": 0.00014480980012894907, | |
| "loss": 0.9668, | |
| "num_input_tokens_seen": 21000656, | |
| "step": 434, | |
| "train_runtime": 3026.8788, | |
| "train_tokens_per_second": 6938.057 | |
| }, | |
| { | |
| "epoch": 0.2796528447444552, | |
| "grad_norm": 0.23032096028327942, | |
| "learning_rate": 0.0001446808510638298, | |
| "loss": 0.9968, | |
| "num_input_tokens_seen": 21036128, | |
| "step": 435, | |
| "train_runtime": 3031.9131, | |
| "train_tokens_per_second": 6938.236 | |
| }, | |
| { | |
| "epoch": 0.28029572484731596, | |
| "grad_norm": 0.20887252688407898, | |
| "learning_rate": 0.0001445519019987105, | |
| "loss": 0.928, | |
| "num_input_tokens_seen": 21075744, | |
| "step": 436, | |
| "train_runtime": 3037.5307, | |
| "train_tokens_per_second": 6938.446 | |
| }, | |
| { | |
| "epoch": 0.2809386049501768, | |
| "grad_norm": 0.22414767742156982, | |
| "learning_rate": 0.00014442295293359126, | |
| "loss": 0.9507, | |
| "num_input_tokens_seen": 21130784, | |
| "step": 437, | |
| "train_runtime": 3045.287, | |
| "train_tokens_per_second": 6938.848 | |
| }, | |
| { | |
| "epoch": 0.2815814850530376, | |
| "grad_norm": 0.22513002157211304, | |
| "learning_rate": 0.00014429400386847197, | |
| "loss": 1.0848, | |
| "num_input_tokens_seen": 21180912, | |
| "step": 438, | |
| "train_runtime": 3052.2626, | |
| "train_tokens_per_second": 6939.413 | |
| }, | |
| { | |
| "epoch": 0.28222436515589844, | |
| "grad_norm": 0.21031957864761353, | |
| "learning_rate": 0.00014416505480335266, | |
| "loss": 0.9672, | |
| "num_input_tokens_seen": 21221936, | |
| "step": 439, | |
| "train_runtime": 3058.0003, | |
| "train_tokens_per_second": 6939.808 | |
| }, | |
| { | |
| "epoch": 0.2828672452587592, | |
| "grad_norm": 0.2110009789466858, | |
| "learning_rate": 0.0001440361057382334, | |
| "loss": 0.9508, | |
| "num_input_tokens_seen": 21256336, | |
| "step": 440, | |
| "train_runtime": 3062.9106, | |
| "train_tokens_per_second": 6939.914 | |
| }, | |
| { | |
| "epoch": 0.28351012536162007, | |
| "grad_norm": 0.2163558304309845, | |
| "learning_rate": 0.00014390715667311413, | |
| "loss": 0.9935, | |
| "num_input_tokens_seen": 21293856, | |
| "step": 441, | |
| "train_runtime": 3068.2246, | |
| "train_tokens_per_second": 6940.123 | |
| }, | |
| { | |
| "epoch": 0.28415300546448086, | |
| "grad_norm": 0.2277555614709854, | |
| "learning_rate": 0.00014377820760799485, | |
| "loss": 0.9512, | |
| "num_input_tokens_seen": 21326368, | |
| "step": 442, | |
| "train_runtime": 3072.8392, | |
| "train_tokens_per_second": 6940.281 | |
| }, | |
| { | |
| "epoch": 0.2847958855673417, | |
| "grad_norm": 0.228995680809021, | |
| "learning_rate": 0.00014364925854287556, | |
| "loss": 0.9446, | |
| "num_input_tokens_seen": 21373968, | |
| "step": 443, | |
| "train_runtime": 3079.4766, | |
| "train_tokens_per_second": 6940.78 | |
| }, | |
| { | |
| "epoch": 0.2854387656702025, | |
| "grad_norm": 0.21971489489078522, | |
| "learning_rate": 0.0001435203094777563, | |
| "loss": 1.0327, | |
| "num_input_tokens_seen": 21422752, | |
| "step": 444, | |
| "train_runtime": 3086.3349, | |
| "train_tokens_per_second": 6941.162 | |
| }, | |
| { | |
| "epoch": 0.28608164577306333, | |
| "grad_norm": 0.22412551939487457, | |
| "learning_rate": 0.000143391360412637, | |
| "loss": 1.0243, | |
| "num_input_tokens_seen": 21460832, | |
| "step": 445, | |
| "train_runtime": 3091.6768, | |
| "train_tokens_per_second": 6941.486 | |
| }, | |
| { | |
| "epoch": 0.2867245258759241, | |
| "grad_norm": 0.23160946369171143, | |
| "learning_rate": 0.00014326241134751775, | |
| "loss": 1.0057, | |
| "num_input_tokens_seen": 21503984, | |
| "step": 446, | |
| "train_runtime": 3097.7463, | |
| "train_tokens_per_second": 6941.816 | |
| }, | |
| { | |
| "epoch": 0.28736740597878496, | |
| "grad_norm": 0.2109261304140091, | |
| "learning_rate": 0.00014313346228239846, | |
| "loss": 0.9851, | |
| "num_input_tokens_seen": 21548880, | |
| "step": 447, | |
| "train_runtime": 3104.093, | |
| "train_tokens_per_second": 6942.086 | |
| }, | |
| { | |
| "epoch": 0.28801028608164575, | |
| "grad_norm": 0.22187648713588715, | |
| "learning_rate": 0.00014300451321727918, | |
| "loss": 0.8728, | |
| "num_input_tokens_seen": 21596320, | |
| "step": 448, | |
| "train_runtime": 3110.7629, | |
| "train_tokens_per_second": 6942.451 | |
| }, | |
| { | |
| "epoch": 0.2886531661845066, | |
| "grad_norm": 0.23777811229228973, | |
| "learning_rate": 0.0001428755641521599, | |
| "loss": 1.1549, | |
| "num_input_tokens_seen": 21641584, | |
| "step": 449, | |
| "train_runtime": 3117.1594, | |
| "train_tokens_per_second": 6942.726 | |
| }, | |
| { | |
| "epoch": 0.2892960462873674, | |
| "grad_norm": 0.22787660360336304, | |
| "learning_rate": 0.00014274661508704065, | |
| "loss": 1.0658, | |
| "num_input_tokens_seen": 21699088, | |
| "step": 450, | |
| "train_runtime": 3125.1717, | |
| "train_tokens_per_second": 6943.327 | |
| }, | |
| { | |
| "epoch": 0.2899389263902282, | |
| "grad_norm": 0.23120397329330444, | |
| "learning_rate": 0.00014261766602192134, | |
| "loss": 1.0974, | |
| "num_input_tokens_seen": 21743200, | |
| "step": 451, | |
| "train_runtime": 3131.8371, | |
| "train_tokens_per_second": 6942.634 | |
| }, | |
| { | |
| "epoch": 0.290581806493089, | |
| "grad_norm": 0.20242908596992493, | |
| "learning_rate": 0.00014248871695680205, | |
| "loss": 0.853, | |
| "num_input_tokens_seen": 21782304, | |
| "step": 452, | |
| "train_runtime": 3137.3582, | |
| "train_tokens_per_second": 6942.881 | |
| }, | |
| { | |
| "epoch": 0.29122468659594986, | |
| "grad_norm": 0.20652198791503906, | |
| "learning_rate": 0.0001423597678916828, | |
| "loss": 0.9178, | |
| "num_input_tokens_seen": 21833456, | |
| "step": 453, | |
| "train_runtime": 3144.5316, | |
| "train_tokens_per_second": 6943.309 | |
| }, | |
| { | |
| "epoch": 0.2918675666988107, | |
| "grad_norm": 0.21495656669139862, | |
| "learning_rate": 0.00014223081882656352, | |
| "loss": 0.8723, | |
| "num_input_tokens_seen": 21880688, | |
| "step": 454, | |
| "train_runtime": 3151.1193, | |
| "train_tokens_per_second": 6943.783 | |
| }, | |
| { | |
| "epoch": 0.2925104468016715, | |
| "grad_norm": 0.20841602981090546, | |
| "learning_rate": 0.00014210186976144424, | |
| "loss": 0.9809, | |
| "num_input_tokens_seen": 21929696, | |
| "step": 455, | |
| "train_runtime": 3158.045, | |
| "train_tokens_per_second": 6944.073 | |
| }, | |
| { | |
| "epoch": 0.29315332690453233, | |
| "grad_norm": 0.2267104536294937, | |
| "learning_rate": 0.00014197292069632495, | |
| "loss": 1.0488, | |
| "num_input_tokens_seen": 22003776, | |
| "step": 456, | |
| "train_runtime": 3168.4062, | |
| "train_tokens_per_second": 6944.746 | |
| }, | |
| { | |
| "epoch": 0.2937962070073931, | |
| "grad_norm": 0.22157594561576843, | |
| "learning_rate": 0.00014184397163120567, | |
| "loss": 0.9029, | |
| "num_input_tokens_seen": 22049024, | |
| "step": 457, | |
| "train_runtime": 3174.7818, | |
| "train_tokens_per_second": 6945.052 | |
| }, | |
| { | |
| "epoch": 0.29443908711025396, | |
| "grad_norm": 0.21928298473358154, | |
| "learning_rate": 0.0001417150225660864, | |
| "loss": 0.9906, | |
| "num_input_tokens_seen": 22092448, | |
| "step": 458, | |
| "train_runtime": 3180.8825, | |
| "train_tokens_per_second": 6945.383 | |
| }, | |
| { | |
| "epoch": 0.29508196721311475, | |
| "grad_norm": 0.23455502092838287, | |
| "learning_rate": 0.00014158607350096714, | |
| "loss": 0.9531, | |
| "num_input_tokens_seen": 22130688, | |
| "step": 459, | |
| "train_runtime": 3186.288, | |
| "train_tokens_per_second": 6945.602 | |
| }, | |
| { | |
| "epoch": 0.2957248473159756, | |
| "grad_norm": 0.24930107593536377, | |
| "learning_rate": 0.00014145712443584785, | |
| "loss": 1.0249, | |
| "num_input_tokens_seen": 22206608, | |
| "step": 460, | |
| "train_runtime": 3196.925, | |
| "train_tokens_per_second": 6946.24 | |
| }, | |
| { | |
| "epoch": 0.2963677274188364, | |
| "grad_norm": 0.2500987648963928, | |
| "learning_rate": 0.00014132817537072857, | |
| "loss": 0.9792, | |
| "num_input_tokens_seen": 22240000, | |
| "step": 461, | |
| "train_runtime": 3201.6743, | |
| "train_tokens_per_second": 6946.366 | |
| }, | |
| { | |
| "epoch": 0.2970106075216972, | |
| "grad_norm": 0.2103571742773056, | |
| "learning_rate": 0.0001411992263056093, | |
| "loss": 0.9678, | |
| "num_input_tokens_seen": 22294912, | |
| "step": 462, | |
| "train_runtime": 3209.4273, | |
| "train_tokens_per_second": 6946.695 | |
| }, | |
| { | |
| "epoch": 0.297653487624558, | |
| "grad_norm": 0.21802906692028046, | |
| "learning_rate": 0.00014107027724049004, | |
| "loss": 1.0285, | |
| "num_input_tokens_seen": 22332432, | |
| "step": 463, | |
| "train_runtime": 3214.7693, | |
| "train_tokens_per_second": 6946.823 | |
| }, | |
| { | |
| "epoch": 0.29829636772741885, | |
| "grad_norm": 0.2042447030544281, | |
| "learning_rate": 0.00014094132817537073, | |
| "loss": 0.9883, | |
| "num_input_tokens_seen": 22366544, | |
| "step": 464, | |
| "train_runtime": 3219.6424, | |
| "train_tokens_per_second": 6946.903 | |
| }, | |
| { | |
| "epoch": 0.29893924783027964, | |
| "grad_norm": 0.2040151059627533, | |
| "learning_rate": 0.00014081237911025144, | |
| "loss": 0.9602, | |
| "num_input_tokens_seen": 22401552, | |
| "step": 465, | |
| "train_runtime": 3224.6289, | |
| "train_tokens_per_second": 6947.017 | |
| }, | |
| { | |
| "epoch": 0.2995821279331405, | |
| "grad_norm": 0.2195388823747635, | |
| "learning_rate": 0.0001406834300451322, | |
| "loss": 1.0522, | |
| "num_input_tokens_seen": 22472880, | |
| "step": 466, | |
| "train_runtime": 3234.6144, | |
| "train_tokens_per_second": 6947.623 | |
| }, | |
| { | |
| "epoch": 0.3002250080360013, | |
| "grad_norm": 0.2215881049633026, | |
| "learning_rate": 0.00014055448098001288, | |
| "loss": 0.9738, | |
| "num_input_tokens_seen": 22532464, | |
| "step": 467, | |
| "train_runtime": 3243.0088, | |
| "train_tokens_per_second": 6948.012 | |
| }, | |
| { | |
| "epoch": 0.3008678881388621, | |
| "grad_norm": 0.2088415026664734, | |
| "learning_rate": 0.00014042553191489363, | |
| "loss": 1.0041, | |
| "num_input_tokens_seen": 22579504, | |
| "step": 468, | |
| "train_runtime": 3249.5829, | |
| "train_tokens_per_second": 6948.431 | |
| }, | |
| { | |
| "epoch": 0.3008678881388621, | |
| "eval_loss": 1.0304499864578247, | |
| "eval_runtime": 40.087, | |
| "eval_samples_per_second": 24.796, | |
| "eval_steps_per_second": 1.572, | |
| "num_input_tokens_seen": 22579504, | |
| "step": 468 | |
| }, | |
| { | |
| "epoch": 0.3015107682417229, | |
| "grad_norm": 0.22007477283477783, | |
| "learning_rate": 0.00014029658284977434, | |
| "loss": 0.8784, | |
| "num_input_tokens_seen": 22638304, | |
| "step": 469, | |
| "train_runtime": 3297.9748, | |
| "train_tokens_per_second": 6864.305 | |
| }, | |
| { | |
| "epoch": 0.30215364834458375, | |
| "grad_norm": 0.21239815652370453, | |
| "learning_rate": 0.00014016763378465506, | |
| "loss": 1.0087, | |
| "num_input_tokens_seen": 22720144, | |
| "step": 470, | |
| "train_runtime": 3309.4305, | |
| "train_tokens_per_second": 6865.273 | |
| }, | |
| { | |
| "epoch": 0.30279652844744454, | |
| "grad_norm": 0.21392999589443207, | |
| "learning_rate": 0.00014003868471953578, | |
| "loss": 0.9459, | |
| "num_input_tokens_seen": 22758576, | |
| "step": 471, | |
| "train_runtime": 3314.8836, | |
| "train_tokens_per_second": 6865.573 | |
| }, | |
| { | |
| "epoch": 0.3034394085503054, | |
| "grad_norm": 0.24180610477924347, | |
| "learning_rate": 0.00013990973565441653, | |
| "loss": 0.9437, | |
| "num_input_tokens_seen": 22814256, | |
| "step": 472, | |
| "train_runtime": 3322.696, | |
| "train_tokens_per_second": 6866.188 | |
| }, | |
| { | |
| "epoch": 0.30408228865316617, | |
| "grad_norm": 0.22510194778442383, | |
| "learning_rate": 0.00013978078658929722, | |
| "loss": 0.9329, | |
| "num_input_tokens_seen": 22866640, | |
| "step": 473, | |
| "train_runtime": 3330.041, | |
| "train_tokens_per_second": 6866.774 | |
| }, | |
| { | |
| "epoch": 0.304725168756027, | |
| "grad_norm": 0.2063971608877182, | |
| "learning_rate": 0.00013965183752417796, | |
| "loss": 0.9578, | |
| "num_input_tokens_seen": 22902608, | |
| "step": 474, | |
| "train_runtime": 3335.1437, | |
| "train_tokens_per_second": 6867.053 | |
| }, | |
| { | |
| "epoch": 0.3053680488588878, | |
| "grad_norm": 0.22402247786521912, | |
| "learning_rate": 0.00013952288845905868, | |
| "loss": 1.0159, | |
| "num_input_tokens_seen": 22968496, | |
| "step": 475, | |
| "train_runtime": 3344.4383, | |
| "train_tokens_per_second": 6867.669 | |
| }, | |
| { | |
| "epoch": 0.30601092896174864, | |
| "grad_norm": 0.24827386438846588, | |
| "learning_rate": 0.0001393939393939394, | |
| "loss": 0.987, | |
| "num_input_tokens_seen": 22997648, | |
| "step": 476, | |
| "train_runtime": 3348.5796, | |
| "train_tokens_per_second": 6867.882 | |
| }, | |
| { | |
| "epoch": 0.30665380906460943, | |
| "grad_norm": 0.21244807541370392, | |
| "learning_rate": 0.00013926499032882012, | |
| "loss": 1.0285, | |
| "num_input_tokens_seen": 23042048, | |
| "step": 477, | |
| "train_runtime": 3354.8491, | |
| "train_tokens_per_second": 6868.281 | |
| }, | |
| { | |
| "epoch": 0.30729668916747027, | |
| "grad_norm": 0.23184971511363983, | |
| "learning_rate": 0.00013913604126370086, | |
| "loss": 1.1143, | |
| "num_input_tokens_seen": 23084368, | |
| "step": 478, | |
| "train_runtime": 3360.8138, | |
| "train_tokens_per_second": 6868.684 | |
| }, | |
| { | |
| "epoch": 0.30793956927033106, | |
| "grad_norm": 0.23399090766906738, | |
| "learning_rate": 0.00013900709219858158, | |
| "loss": 1.0699, | |
| "num_input_tokens_seen": 23129632, | |
| "step": 479, | |
| "train_runtime": 3367.1699, | |
| "train_tokens_per_second": 6869.161 | |
| }, | |
| { | |
| "epoch": 0.3085824493731919, | |
| "grad_norm": 0.2339830994606018, | |
| "learning_rate": 0.00013887814313346227, | |
| "loss": 0.9267, | |
| "num_input_tokens_seen": 23166080, | |
| "step": 480, | |
| "train_runtime": 3372.3301, | |
| "train_tokens_per_second": 6869.458 | |
| }, | |
| { | |
| "epoch": 0.3092253294760527, | |
| "grad_norm": 0.21304185688495636, | |
| "learning_rate": 0.00013874919406834302, | |
| "loss": 1.0969, | |
| "num_input_tokens_seen": 23205632, | |
| "step": 481, | |
| "train_runtime": 3378.4889, | |
| "train_tokens_per_second": 6868.642 | |
| }, | |
| { | |
| "epoch": 0.30986820957891353, | |
| "grad_norm": 0.21676377952098846, | |
| "learning_rate": 0.00013862024500322373, | |
| "loss": 1.054, | |
| "num_input_tokens_seen": 23263680, | |
| "step": 482, | |
| "train_runtime": 3386.5884, | |
| "train_tokens_per_second": 6869.356 | |
| }, | |
| { | |
| "epoch": 0.3105110896817743, | |
| "grad_norm": 0.20853395760059357, | |
| "learning_rate": 0.00013849129593810445, | |
| "loss": 0.9668, | |
| "num_input_tokens_seen": 23314128, | |
| "step": 483, | |
| "train_runtime": 3393.6327, | |
| "train_tokens_per_second": 6869.962 | |
| }, | |
| { | |
| "epoch": 0.31115396978463516, | |
| "grad_norm": 0.20457607507705688, | |
| "learning_rate": 0.00013836234687298517, | |
| "loss": 1.1696, | |
| "num_input_tokens_seen": 23372528, | |
| "step": 484, | |
| "train_runtime": 3401.8284, | |
| "train_tokens_per_second": 6870.578 | |
| }, | |
| { | |
| "epoch": 0.311796849887496, | |
| "grad_norm": 0.2261870801448822, | |
| "learning_rate": 0.00013823339780786592, | |
| "loss": 1.0568, | |
| "num_input_tokens_seen": 23415520, | |
| "step": 485, | |
| "train_runtime": 3407.7745, | |
| "train_tokens_per_second": 6871.206 | |
| }, | |
| { | |
| "epoch": 0.3124397299903568, | |
| "grad_norm": 0.2235896736383438, | |
| "learning_rate": 0.0001381044487427466, | |
| "loss": 0.9828, | |
| "num_input_tokens_seen": 23469776, | |
| "step": 486, | |
| "train_runtime": 3415.3123, | |
| "train_tokens_per_second": 6871.927 | |
| }, | |
| { | |
| "epoch": 0.31308261009321764, | |
| "grad_norm": 0.20803005993366241, | |
| "learning_rate": 0.00013797549967762735, | |
| "loss": 0.9982, | |
| "num_input_tokens_seen": 23524704, | |
| "step": 487, | |
| "train_runtime": 3422.985, | |
| "train_tokens_per_second": 6872.57 | |
| }, | |
| { | |
| "epoch": 0.3137254901960784, | |
| "grad_norm": 0.21710795164108276, | |
| "learning_rate": 0.00013784655061250807, | |
| "loss": 1.0199, | |
| "num_input_tokens_seen": 23574352, | |
| "step": 488, | |
| "train_runtime": 3429.8894, | |
| "train_tokens_per_second": 6873.211 | |
| }, | |
| { | |
| "epoch": 0.31436837029893927, | |
| "grad_norm": 0.20312581956386566, | |
| "learning_rate": 0.0001377176015473888, | |
| "loss": 0.8987, | |
| "num_input_tokens_seen": 23627760, | |
| "step": 489, | |
| "train_runtime": 3437.2668, | |
| "train_tokens_per_second": 6873.997 | |
| }, | |
| { | |
| "epoch": 0.31501125040180006, | |
| "grad_norm": 0.20755556225776672, | |
| "learning_rate": 0.0001375886524822695, | |
| "loss": 0.9631, | |
| "num_input_tokens_seen": 23663664, | |
| "step": 490, | |
| "train_runtime": 3442.3155, | |
| "train_tokens_per_second": 6874.345 | |
| }, | |
| { | |
| "epoch": 0.3156541305046609, | |
| "grad_norm": 0.23552921414375305, | |
| "learning_rate": 0.00013745970341715025, | |
| "loss": 1.0089, | |
| "num_input_tokens_seen": 23715280, | |
| "step": 491, | |
| "train_runtime": 3449.4922, | |
| "train_tokens_per_second": 6875.006 | |
| }, | |
| { | |
| "epoch": 0.3162970106075217, | |
| "grad_norm": 0.22361139953136444, | |
| "learning_rate": 0.00013733075435203094, | |
| "loss": 1.0316, | |
| "num_input_tokens_seen": 23755296, | |
| "step": 492, | |
| "train_runtime": 3455.0373, | |
| "train_tokens_per_second": 6875.554 | |
| }, | |
| { | |
| "epoch": 0.31693989071038253, | |
| "grad_norm": 0.22092361748218536, | |
| "learning_rate": 0.00013720180528691166, | |
| "loss": 0.9885, | |
| "num_input_tokens_seen": 23809776, | |
| "step": 493, | |
| "train_runtime": 3462.606, | |
| "train_tokens_per_second": 6876.259 | |
| }, | |
| { | |
| "epoch": 0.3175827708132433, | |
| "grad_norm": 0.2110934853553772, | |
| "learning_rate": 0.0001370728562217924, | |
| "loss": 0.9728, | |
| "num_input_tokens_seen": 23846256, | |
| "step": 494, | |
| "train_runtime": 3467.7687, | |
| "train_tokens_per_second": 6876.542 | |
| }, | |
| { | |
| "epoch": 0.31822565091610416, | |
| "grad_norm": 0.22661617398262024, | |
| "learning_rate": 0.00013694390715667312, | |
| "loss": 0.9672, | |
| "num_input_tokens_seen": 23881296, | |
| "step": 495, | |
| "train_runtime": 3472.6479, | |
| "train_tokens_per_second": 6876.97 | |
| }, | |
| { | |
| "epoch": 0.31886853101896495, | |
| "grad_norm": 0.21662630140781403, | |
| "learning_rate": 0.00013681495809155384, | |
| "loss": 1.0207, | |
| "num_input_tokens_seen": 23922768, | |
| "step": 496, | |
| "train_runtime": 3478.4065, | |
| "train_tokens_per_second": 6877.508 | |
| }, | |
| { | |
| "epoch": 0.3195114111218258, | |
| "grad_norm": 0.21633575856685638, | |
| "learning_rate": 0.00013668600902643456, | |
| "loss": 0.9655, | |
| "num_input_tokens_seen": 23968688, | |
| "step": 497, | |
| "train_runtime": 3484.7432, | |
| "train_tokens_per_second": 6878.179 | |
| }, | |
| { | |
| "epoch": 0.3201542912246866, | |
| "grad_norm": 0.22479382157325745, | |
| "learning_rate": 0.0001365570599613153, | |
| "loss": 1.0251, | |
| "num_input_tokens_seen": 24019088, | |
| "step": 498, | |
| "train_runtime": 3491.7117, | |
| "train_tokens_per_second": 6878.886 | |
| }, | |
| { | |
| "epoch": 0.3207971713275474, | |
| "grad_norm": 0.23307350277900696, | |
| "learning_rate": 0.000136428110896196, | |
| "loss": 1.005, | |
| "num_input_tokens_seen": 24097408, | |
| "step": 499, | |
| "train_runtime": 3502.5666, | |
| "train_tokens_per_second": 6879.929 | |
| }, | |
| { | |
| "epoch": 0.3214400514304082, | |
| "grad_norm": 0.23394767940044403, | |
| "learning_rate": 0.00013629916183107674, | |
| "loss": 0.9901, | |
| "num_input_tokens_seen": 24135088, | |
| "step": 500, | |
| "train_runtime": 3507.8283, | |
| "train_tokens_per_second": 6880.35 | |
| }, | |
| { | |
| "epoch": 0.32208293153326906, | |
| "grad_norm": 0.21206118166446686, | |
| "learning_rate": 0.00013617021276595746, | |
| "loss": 1.0684, | |
| "num_input_tokens_seen": 24179280, | |
| "step": 501, | |
| "train_runtime": 3513.9813, | |
| "train_tokens_per_second": 6880.879 | |
| }, | |
| { | |
| "epoch": 0.32272581163612984, | |
| "grad_norm": 0.21079224348068237, | |
| "learning_rate": 0.00013604126370083818, | |
| "loss": 0.9874, | |
| "num_input_tokens_seen": 24220336, | |
| "step": 502, | |
| "train_runtime": 3519.7213, | |
| "train_tokens_per_second": 6881.322 | |
| }, | |
| { | |
| "epoch": 0.3233686917389907, | |
| "grad_norm": 0.20273390412330627, | |
| "learning_rate": 0.0001359123146357189, | |
| "loss": 1.0484, | |
| "num_input_tokens_seen": 24262736, | |
| "step": 503, | |
| "train_runtime": 3525.6356, | |
| "train_tokens_per_second": 6881.805 | |
| }, | |
| { | |
| "epoch": 0.3240115718418515, | |
| "grad_norm": 0.20427271723747253, | |
| "learning_rate": 0.00013578336557059964, | |
| "loss": 0.9679, | |
| "num_input_tokens_seen": 24308064, | |
| "step": 504, | |
| "train_runtime": 3531.8857, | |
| "train_tokens_per_second": 6882.461 | |
| }, | |
| { | |
| "epoch": 0.3246544519447123, | |
| "grad_norm": 0.2109527736902237, | |
| "learning_rate": 0.00013565441650548033, | |
| "loss": 0.9445, | |
| "num_input_tokens_seen": 24345008, | |
| "step": 505, | |
| "train_runtime": 3537.0403, | |
| "train_tokens_per_second": 6882.875 | |
| }, | |
| { | |
| "epoch": 0.3252973320475731, | |
| "grad_norm": 0.2220373898744583, | |
| "learning_rate": 0.00013552546744036105, | |
| "loss": 1.0339, | |
| "num_input_tokens_seen": 24382368, | |
| "step": 506, | |
| "train_runtime": 3542.2658, | |
| "train_tokens_per_second": 6883.269 | |
| }, | |
| { | |
| "epoch": 0.32594021215043395, | |
| "grad_norm": 0.21177394688129425, | |
| "learning_rate": 0.0001353965183752418, | |
| "loss": 1.0558, | |
| "num_input_tokens_seen": 24424272, | |
| "step": 507, | |
| "train_runtime": 3548.0552, | |
| "train_tokens_per_second": 6883.848 | |
| }, | |
| { | |
| "epoch": 0.32658309225329474, | |
| "grad_norm": 0.2130356878042221, | |
| "learning_rate": 0.0001352675693101225, | |
| "loss": 0.9415, | |
| "num_input_tokens_seen": 24497040, | |
| "step": 508, | |
| "train_runtime": 3558.1332, | |
| "train_tokens_per_second": 6884.801 | |
| }, | |
| { | |
| "epoch": 0.3272259723561556, | |
| "grad_norm": 0.21283923089504242, | |
| "learning_rate": 0.00013513862024500323, | |
| "loss": 1.0213, | |
| "num_input_tokens_seen": 24538912, | |
| "step": 509, | |
| "train_runtime": 3563.9332, | |
| "train_tokens_per_second": 6885.346 | |
| }, | |
| { | |
| "epoch": 0.32786885245901637, | |
| "grad_norm": 0.23125970363616943, | |
| "learning_rate": 0.00013500967117988395, | |
| "loss": 1.0807, | |
| "num_input_tokens_seen": 24586896, | |
| "step": 510, | |
| "train_runtime": 3570.5716, | |
| "train_tokens_per_second": 6885.983 | |
| }, | |
| { | |
| "epoch": 0.3285117325618772, | |
| "grad_norm": 0.20956462621688843, | |
| "learning_rate": 0.00013488072211476467, | |
| "loss": 0.9554, | |
| "num_input_tokens_seen": 24636288, | |
| "step": 511, | |
| "train_runtime": 3577.9296, | |
| "train_tokens_per_second": 6885.627 | |
| }, | |
| { | |
| "epoch": 0.329154612664738, | |
| "grad_norm": 0.20466941595077515, | |
| "learning_rate": 0.00013475177304964539, | |
| "loss": 0.9407, | |
| "num_input_tokens_seen": 24700208, | |
| "step": 512, | |
| "train_runtime": 3586.7348, | |
| "train_tokens_per_second": 6886.544 | |
| }, | |
| { | |
| "epoch": 0.32979749276759884, | |
| "grad_norm": 0.21156948804855347, | |
| "learning_rate": 0.00013462282398452613, | |
| "loss": 1.0416, | |
| "num_input_tokens_seen": 24767520, | |
| "step": 513, | |
| "train_runtime": 3596.058, | |
| "train_tokens_per_second": 6887.408 | |
| }, | |
| { | |
| "epoch": 0.3304403728704597, | |
| "grad_norm": 0.21754856407642365, | |
| "learning_rate": 0.00013449387491940685, | |
| "loss": 0.9787, | |
| "num_input_tokens_seen": 24809824, | |
| "step": 514, | |
| "train_runtime": 3601.8511, | |
| "train_tokens_per_second": 6888.076 | |
| }, | |
| { | |
| "epoch": 0.3310832529733205, | |
| "grad_norm": 0.20795920491218567, | |
| "learning_rate": 0.00013436492585428757, | |
| "loss": 0.8816, | |
| "num_input_tokens_seen": 24859872, | |
| "step": 515, | |
| "train_runtime": 3608.7952, | |
| "train_tokens_per_second": 6888.69 | |
| }, | |
| { | |
| "epoch": 0.3317261330761813, | |
| "grad_norm": 0.22304174304008484, | |
| "learning_rate": 0.00013423597678916829, | |
| "loss": 0.9804, | |
| "num_input_tokens_seen": 24893568, | |
| "step": 516, | |
| "train_runtime": 3613.4725, | |
| "train_tokens_per_second": 6889.099 | |
| }, | |
| { | |
| "epoch": 0.3323690131790421, | |
| "grad_norm": 0.22424030303955078, | |
| "learning_rate": 0.000134107027724049, | |
| "loss": 1.058, | |
| "num_input_tokens_seen": 24947216, | |
| "step": 517, | |
| "train_runtime": 3620.8973, | |
| "train_tokens_per_second": 6889.788 | |
| }, | |
| { | |
| "epoch": 0.33301189328190295, | |
| "grad_norm": 0.2329922467470169, | |
| "learning_rate": 0.00013397807865892972, | |
| "loss": 0.9558, | |
| "num_input_tokens_seen": 25002624, | |
| "step": 518, | |
| "train_runtime": 3628.6094, | |
| "train_tokens_per_second": 6890.415 | |
| }, | |
| { | |
| "epoch": 0.33365477338476374, | |
| "grad_norm": 0.2094709426164627, | |
| "learning_rate": 0.00013384912959381044, | |
| "loss": 1.1208, | |
| "num_input_tokens_seen": 25052704, | |
| "step": 519, | |
| "train_runtime": 3635.5352, | |
| "train_tokens_per_second": 6891.064 | |
| }, | |
| { | |
| "epoch": 0.3342976534876246, | |
| "grad_norm": 0.2430083155632019, | |
| "learning_rate": 0.00013372018052869119, | |
| "loss": 1.0242, | |
| "num_input_tokens_seen": 25096752, | |
| "step": 520, | |
| "train_runtime": 3641.648, | |
| "train_tokens_per_second": 6891.592 | |
| }, | |
| { | |
| "epoch": 0.33494053359048537, | |
| "grad_norm": 0.22180068492889404, | |
| "learning_rate": 0.00013359123146357188, | |
| "loss": 0.9733, | |
| "num_input_tokens_seen": 25143664, | |
| "step": 521, | |
| "train_runtime": 3648.0565, | |
| "train_tokens_per_second": 6892.345 | |
| }, | |
| { | |
| "epoch": 0.3355834136933462, | |
| "grad_norm": 0.2066153585910797, | |
| "learning_rate": 0.00013346228239845262, | |
| "loss": 0.9317, | |
| "num_input_tokens_seen": 25205920, | |
| "step": 522, | |
| "train_runtime": 3656.7402, | |
| "train_tokens_per_second": 6893.003 | |
| }, | |
| { | |
| "epoch": 0.336226293796207, | |
| "grad_norm": 0.24886547029018402, | |
| "learning_rate": 0.00013333333333333334, | |
| "loss": 1.0372, | |
| "num_input_tokens_seen": 25243200, | |
| "step": 523, | |
| "train_runtime": 3661.941, | |
| "train_tokens_per_second": 6893.393 | |
| }, | |
| { | |
| "epoch": 0.33686917389906784, | |
| "grad_norm": 0.21790605783462524, | |
| "learning_rate": 0.00013320438426821406, | |
| "loss": 0.9581, | |
| "num_input_tokens_seen": 25303376, | |
| "step": 524, | |
| "train_runtime": 3670.3457, | |
| "train_tokens_per_second": 6894.004 | |
| }, | |
| { | |
| "epoch": 0.33751205400192863, | |
| "grad_norm": 0.2200934737920761, | |
| "learning_rate": 0.00013307543520309478, | |
| "loss": 0.9435, | |
| "num_input_tokens_seen": 25353728, | |
| "step": 525, | |
| "train_runtime": 3677.2854, | |
| "train_tokens_per_second": 6894.686 | |
| }, | |
| { | |
| "epoch": 0.3381549341047895, | |
| "grad_norm": 0.20982544124126434, | |
| "learning_rate": 0.00013294648613797552, | |
| "loss": 0.9352, | |
| "num_input_tokens_seen": 25394720, | |
| "step": 526, | |
| "train_runtime": 3682.9962, | |
| "train_tokens_per_second": 6895.125 | |
| }, | |
| { | |
| "epoch": 0.33879781420765026, | |
| "grad_norm": 0.22811082005500793, | |
| "learning_rate": 0.0001328175370728562, | |
| "loss": 1.0701, | |
| "num_input_tokens_seen": 25434592, | |
| "step": 527, | |
| "train_runtime": 3688.5184, | |
| "train_tokens_per_second": 6895.612 | |
| }, | |
| { | |
| "epoch": 0.3394406943105111, | |
| "grad_norm": 0.2045535147190094, | |
| "learning_rate": 0.00013268858800773696, | |
| "loss": 1.0568, | |
| "num_input_tokens_seen": 25479168, | |
| "step": 528, | |
| "train_runtime": 3694.6898, | |
| "train_tokens_per_second": 6896.159 | |
| }, | |
| { | |
| "epoch": 0.3400835744133719, | |
| "grad_norm": 0.22363616526126862, | |
| "learning_rate": 0.00013255963894261768, | |
| "loss": 1.0645, | |
| "num_input_tokens_seen": 25542432, | |
| "step": 529, | |
| "train_runtime": 3703.4384, | |
| "train_tokens_per_second": 6896.951 | |
| }, | |
| { | |
| "epoch": 0.34072645451623274, | |
| "grad_norm": 0.21083000302314758, | |
| "learning_rate": 0.0001324306898774984, | |
| "loss": 0.8455, | |
| "num_input_tokens_seen": 25583328, | |
| "step": 530, | |
| "train_runtime": 3709.103, | |
| "train_tokens_per_second": 6897.443 | |
| }, | |
| { | |
| "epoch": 0.3413693346190935, | |
| "grad_norm": 0.2215147763490677, | |
| "learning_rate": 0.0001323017408123791, | |
| "loss": 1.0028, | |
| "num_input_tokens_seen": 25624320, | |
| "step": 531, | |
| "train_runtime": 3714.8407, | |
| "train_tokens_per_second": 6897.825 | |
| }, | |
| { | |
| "epoch": 0.34201221472195437, | |
| "grad_norm": 0.2467392385005951, | |
| "learning_rate": 0.00013217279174725983, | |
| "loss": 0.9723, | |
| "num_input_tokens_seen": 25682048, | |
| "step": 532, | |
| "train_runtime": 3722.9065, | |
| "train_tokens_per_second": 6898.386 | |
| }, | |
| { | |
| "epoch": 0.34265509482481515, | |
| "grad_norm": 0.24092997610569, | |
| "learning_rate": 0.00013204384268214058, | |
| "loss": 0.8117, | |
| "num_input_tokens_seen": 25724176, | |
| "step": 533, | |
| "train_runtime": 3728.829, | |
| "train_tokens_per_second": 6898.728 | |
| }, | |
| { | |
| "epoch": 0.343297974927676, | |
| "grad_norm": 0.22751258313655853, | |
| "learning_rate": 0.00013191489361702127, | |
| "loss": 0.9201, | |
| "num_input_tokens_seen": 25770528, | |
| "step": 534, | |
| "train_runtime": 3735.3326, | |
| "train_tokens_per_second": 6899.125 | |
| }, | |
| { | |
| "epoch": 0.3439408550305368, | |
| "grad_norm": 0.2548338770866394, | |
| "learning_rate": 0.000131785944551902, | |
| "loss": 1.087, | |
| "num_input_tokens_seen": 25820896, | |
| "step": 535, | |
| "train_runtime": 3742.4211, | |
| "train_tokens_per_second": 6899.516 | |
| }, | |
| { | |
| "epoch": 0.34458373513339763, | |
| "grad_norm": 0.2448054552078247, | |
| "learning_rate": 0.00013165699548678273, | |
| "loss": 0.9634, | |
| "num_input_tokens_seen": 25859488, | |
| "step": 536, | |
| "train_runtime": 3747.8476, | |
| "train_tokens_per_second": 6899.824 | |
| }, | |
| { | |
| "epoch": 0.3452266152362584, | |
| "grad_norm": 0.22934119403362274, | |
| "learning_rate": 0.00013152804642166345, | |
| "loss": 1.0141, | |
| "num_input_tokens_seen": 25909280, | |
| "step": 537, | |
| "train_runtime": 3754.7496, | |
| "train_tokens_per_second": 6900.402 | |
| }, | |
| { | |
| "epoch": 0.34586949533911926, | |
| "grad_norm": 0.24733909964561462, | |
| "learning_rate": 0.00013139909735654417, | |
| "loss": 1.0, | |
| "num_input_tokens_seen": 25953088, | |
| "step": 538, | |
| "train_runtime": 3760.8823, | |
| "train_tokens_per_second": 6900.798 | |
| }, | |
| { | |
| "epoch": 0.34651237544198005, | |
| "grad_norm": 0.23463451862335205, | |
| "learning_rate": 0.0001312701482914249, | |
| "loss": 0.9776, | |
| "num_input_tokens_seen": 26013008, | |
| "step": 539, | |
| "train_runtime": 3769.2386, | |
| "train_tokens_per_second": 6901.396 | |
| }, | |
| { | |
| "epoch": 0.3471552555448409, | |
| "grad_norm": 0.2205786406993866, | |
| "learning_rate": 0.0001311411992263056, | |
| "loss": 0.9417, | |
| "num_input_tokens_seen": 26060880, | |
| "step": 540, | |
| "train_runtime": 3775.9441, | |
| "train_tokens_per_second": 6901.818 | |
| }, | |
| { | |
| "epoch": 0.3477981356477017, | |
| "grad_norm": 0.24714644253253937, | |
| "learning_rate": 0.00013101225016118635, | |
| "loss": 1.079, | |
| "num_input_tokens_seen": 26099840, | |
| "step": 541, | |
| "train_runtime": 3781.9194, | |
| "train_tokens_per_second": 6901.215 | |
| }, | |
| { | |
| "epoch": 0.3484410157505625, | |
| "grad_norm": 0.21026214957237244, | |
| "learning_rate": 0.00013088330109606707, | |
| "loss": 0.9243, | |
| "num_input_tokens_seen": 26132576, | |
| "step": 542, | |
| "train_runtime": 3786.5674, | |
| "train_tokens_per_second": 6901.389 | |
| }, | |
| { | |
| "epoch": 0.3490838958534233, | |
| "grad_norm": 0.21683214604854584, | |
| "learning_rate": 0.00013075435203094778, | |
| "loss": 1.0338, | |
| "num_input_tokens_seen": 26188816, | |
| "step": 543, | |
| "train_runtime": 3794.4579, | |
| "train_tokens_per_second": 6901.86 | |
| }, | |
| { | |
| "epoch": 0.34972677595628415, | |
| "grad_norm": 0.23099243640899658, | |
| "learning_rate": 0.0001306254029658285, | |
| "loss": 0.9737, | |
| "num_input_tokens_seen": 26243056, | |
| "step": 544, | |
| "train_runtime": 3802.0591, | |
| "train_tokens_per_second": 6902.327 | |
| }, | |
| { | |
| "epoch": 0.350369656059145, | |
| "grad_norm": 0.22725285589694977, | |
| "learning_rate": 0.00013049645390070925, | |
| "loss": 0.959, | |
| "num_input_tokens_seen": 26294640, | |
| "step": 545, | |
| "train_runtime": 3809.2339, | |
| "train_tokens_per_second": 6902.868 | |
| }, | |
| { | |
| "epoch": 0.3510125361620058, | |
| "grad_norm": 0.2573927342891693, | |
| "learning_rate": 0.00013036750483558994, | |
| "loss": 0.9467, | |
| "num_input_tokens_seen": 26336240, | |
| "step": 546, | |
| "train_runtime": 3815.0662, | |
| "train_tokens_per_second": 6903.22 | |
| }, | |
| { | |
| "epoch": 0.3516554162648666, | |
| "grad_norm": 0.22747130692005157, | |
| "learning_rate": 0.00013023855577047066, | |
| "loss": 0.9114, | |
| "num_input_tokens_seen": 26387344, | |
| "step": 547, | |
| "train_runtime": 3822.2615, | |
| "train_tokens_per_second": 6903.595 | |
| }, | |
| { | |
| "epoch": 0.3522982963677274, | |
| "grad_norm": 0.22548294067382812, | |
| "learning_rate": 0.0001301096067053514, | |
| "loss": 0.9211, | |
| "num_input_tokens_seen": 26430704, | |
| "step": 548, | |
| "train_runtime": 3828.3276, | |
| "train_tokens_per_second": 6903.982 | |
| }, | |
| { | |
| "epoch": 0.35294117647058826, | |
| "grad_norm": 0.21985627710819244, | |
| "learning_rate": 0.00012998065764023212, | |
| "loss": 1.0221, | |
| "num_input_tokens_seen": 26490432, | |
| "step": 549, | |
| "train_runtime": 3836.6822, | |
| "train_tokens_per_second": 6904.516 | |
| }, | |
| { | |
| "epoch": 0.35358405657344905, | |
| "grad_norm": 0.21374687552452087, | |
| "learning_rate": 0.00012985170857511284, | |
| "loss": 1.0297, | |
| "num_input_tokens_seen": 26535888, | |
| "step": 550, | |
| "train_runtime": 3843.0736, | |
| "train_tokens_per_second": 6904.861 | |
| }, | |
| { | |
| "epoch": 0.3542269366763099, | |
| "grad_norm": 0.243165522813797, | |
| "learning_rate": 0.00012972275950999356, | |
| "loss": 1.1353, | |
| "num_input_tokens_seen": 26566720, | |
| "step": 551, | |
| "train_runtime": 3847.4679, | |
| "train_tokens_per_second": 6904.988 | |
| }, | |
| { | |
| "epoch": 0.3548698167791707, | |
| "grad_norm": 0.24455544352531433, | |
| "learning_rate": 0.00012959381044487427, | |
| "loss": 1.0217, | |
| "num_input_tokens_seen": 26606912, | |
| "step": 552, | |
| "train_runtime": 3853.1324, | |
| "train_tokens_per_second": 6905.268 | |
| }, | |
| { | |
| "epoch": 0.3555126968820315, | |
| "grad_norm": 0.22101067006587982, | |
| "learning_rate": 0.000129464861379755, | |
| "loss": 0.9031, | |
| "num_input_tokens_seen": 26642352, | |
| "step": 553, | |
| "train_runtime": 3858.1639, | |
| "train_tokens_per_second": 6905.448 | |
| }, | |
| { | |
| "epoch": 0.3561555769848923, | |
| "grad_norm": 0.20512044429779053, | |
| "learning_rate": 0.00012933591231463574, | |
| "loss": 1.0668, | |
| "num_input_tokens_seen": 26681264, | |
| "step": 554, | |
| "train_runtime": 3863.6705, | |
| "train_tokens_per_second": 6905.678 | |
| }, | |
| { | |
| "epoch": 0.35679845708775315, | |
| "grad_norm": 0.2276490330696106, | |
| "learning_rate": 0.00012920696324951646, | |
| "loss": 1.0823, | |
| "num_input_tokens_seen": 26730576, | |
| "step": 555, | |
| "train_runtime": 3870.5592, | |
| "train_tokens_per_second": 6906.128 | |
| }, | |
| { | |
| "epoch": 0.35744133719061394, | |
| "grad_norm": 0.23173771798610687, | |
| "learning_rate": 0.00012907801418439717, | |
| "loss": 1.0071, | |
| "num_input_tokens_seen": 26781632, | |
| "step": 556, | |
| "train_runtime": 3877.726, | |
| "train_tokens_per_second": 6906.53 | |
| }, | |
| { | |
| "epoch": 0.3580842172934748, | |
| "grad_norm": 0.21714136004447937, | |
| "learning_rate": 0.0001289490651192779, | |
| "loss": 0.9671, | |
| "num_input_tokens_seen": 26844144, | |
| "step": 557, | |
| "train_runtime": 3886.4338, | |
| "train_tokens_per_second": 6907.14 | |
| }, | |
| { | |
| "epoch": 0.35872709739633557, | |
| "grad_norm": 0.2281978577375412, | |
| "learning_rate": 0.00012882011605415864, | |
| "loss": 0.8735, | |
| "num_input_tokens_seen": 26882384, | |
| "step": 558, | |
| "train_runtime": 3891.8083, | |
| "train_tokens_per_second": 6907.428 | |
| }, | |
| { | |
| "epoch": 0.3593699774991964, | |
| "grad_norm": 0.2230071723461151, | |
| "learning_rate": 0.00012869116698903933, | |
| "loss": 1.1621, | |
| "num_input_tokens_seen": 26924112, | |
| "step": 559, | |
| "train_runtime": 3897.6836, | |
| "train_tokens_per_second": 6907.721 | |
| }, | |
| { | |
| "epoch": 0.3600128576020572, | |
| "grad_norm": 0.21923069655895233, | |
| "learning_rate": 0.00012856221792392005, | |
| "loss": 1.0041, | |
| "num_input_tokens_seen": 26954864, | |
| "step": 560, | |
| "train_runtime": 3902.0753, | |
| "train_tokens_per_second": 6907.828 | |
| }, | |
| { | |
| "epoch": 0.36065573770491804, | |
| "grad_norm": 0.21977007389068604, | |
| "learning_rate": 0.0001284332688588008, | |
| "loss": 0.9363, | |
| "num_input_tokens_seen": 27009328, | |
| "step": 561, | |
| "train_runtime": 3909.7824, | |
| "train_tokens_per_second": 6908.141 | |
| }, | |
| { | |
| "epoch": 0.36129861780777883, | |
| "grad_norm": 0.2261383831501007, | |
| "learning_rate": 0.00012830431979368148, | |
| "loss": 0.9468, | |
| "num_input_tokens_seen": 27050640, | |
| "step": 562, | |
| "train_runtime": 3915.6115, | |
| "train_tokens_per_second": 6908.408 | |
| }, | |
| { | |
| "epoch": 0.3619414979106397, | |
| "grad_norm": 0.22950001060962677, | |
| "learning_rate": 0.00012817537072856223, | |
| "loss": 0.9635, | |
| "num_input_tokens_seen": 27107952, | |
| "step": 563, | |
| "train_runtime": 3923.6042, | |
| "train_tokens_per_second": 6908.942 | |
| }, | |
| { | |
| "epoch": 0.36258437801350046, | |
| "grad_norm": 0.20494036376476288, | |
| "learning_rate": 0.00012804642166344295, | |
| "loss": 0.9518, | |
| "num_input_tokens_seen": 27149680, | |
| "step": 564, | |
| "train_runtime": 3929.5027, | |
| "train_tokens_per_second": 6909.19 | |
| }, | |
| { | |
| "epoch": 0.3632272581163613, | |
| "grad_norm": 0.2079777717590332, | |
| "learning_rate": 0.00012791747259832366, | |
| "loss": 0.9171, | |
| "num_input_tokens_seen": 27204672, | |
| "step": 565, | |
| "train_runtime": 3937.259, | |
| "train_tokens_per_second": 6909.546 | |
| }, | |
| { | |
| "epoch": 0.3638701382192221, | |
| "grad_norm": 0.22996214032173157, | |
| "learning_rate": 0.00012778852353320438, | |
| "loss": 1.1146, | |
| "num_input_tokens_seen": 27257552, | |
| "step": 566, | |
| "train_runtime": 3944.6632, | |
| "train_tokens_per_second": 6909.982 | |
| }, | |
| { | |
| "epoch": 0.36451301832208294, | |
| "grad_norm": 0.22713743150234222, | |
| "learning_rate": 0.00012765957446808513, | |
| "loss": 0.9419, | |
| "num_input_tokens_seen": 27297616, | |
| "step": 567, | |
| "train_runtime": 3950.3514, | |
| "train_tokens_per_second": 6910.174 | |
| }, | |
| { | |
| "epoch": 0.3651558984249437, | |
| "grad_norm": 0.22290444374084473, | |
| "learning_rate": 0.00012753062540296582, | |
| "loss": 0.9696, | |
| "num_input_tokens_seen": 27354432, | |
| "step": 568, | |
| "train_runtime": 3958.3118, | |
| "train_tokens_per_second": 6910.631 | |
| }, | |
| { | |
| "epoch": 0.36579877852780457, | |
| "grad_norm": 0.2305925339460373, | |
| "learning_rate": 0.00012740167633784656, | |
| "loss": 0.9383, | |
| "num_input_tokens_seen": 27388640, | |
| "step": 569, | |
| "train_runtime": 3963.1821, | |
| "train_tokens_per_second": 6910.77 | |
| }, | |
| { | |
| "epoch": 0.36644165863066536, | |
| "grad_norm": 0.2095453143119812, | |
| "learning_rate": 0.00012727272727272728, | |
| "loss": 0.9092, | |
| "num_input_tokens_seen": 27426656, | |
| "step": 570, | |
| "train_runtime": 3968.5432, | |
| "train_tokens_per_second": 6911.014 | |
| }, | |
| { | |
| "epoch": 0.3670845387335262, | |
| "grad_norm": 0.2165188491344452, | |
| "learning_rate": 0.000127143778207608, | |
| "loss": 0.86, | |
| "num_input_tokens_seen": 27469616, | |
| "step": 571, | |
| "train_runtime": 3975.127, | |
| "train_tokens_per_second": 6910.374 | |
| }, | |
| { | |
| "epoch": 0.367727418836387, | |
| "grad_norm": 0.21359601616859436, | |
| "learning_rate": 0.00012701482914248872, | |
| "loss": 0.9545, | |
| "num_input_tokens_seen": 27509728, | |
| "step": 572, | |
| "train_runtime": 3980.7541, | |
| "train_tokens_per_second": 6910.683 | |
| }, | |
| { | |
| "epoch": 0.36837029893924783, | |
| "grad_norm": 0.21762266755104065, | |
| "learning_rate": 0.00012688588007736944, | |
| "loss": 1.1062, | |
| "num_input_tokens_seen": 27559888, | |
| "step": 573, | |
| "train_runtime": 3987.8327, | |
| "train_tokens_per_second": 6910.994 | |
| }, | |
| { | |
| "epoch": 0.3690131790421087, | |
| "grad_norm": 0.22264431416988373, | |
| "learning_rate": 0.00012675693101225018, | |
| "loss": 0.939, | |
| "num_input_tokens_seen": 27619392, | |
| "step": 574, | |
| "train_runtime": 3996.2479, | |
| "train_tokens_per_second": 6911.331 | |
| }, | |
| { | |
| "epoch": 0.36965605914496946, | |
| "grad_norm": 0.21523094177246094, | |
| "learning_rate": 0.00012662798194713087, | |
| "loss": 1.0106, | |
| "num_input_tokens_seen": 27660256, | |
| "step": 575, | |
| "train_runtime": 4001.9951, | |
| "train_tokens_per_second": 6911.617 | |
| }, | |
| { | |
| "epoch": 0.3702989392478303, | |
| "grad_norm": 0.20433154702186584, | |
| "learning_rate": 0.00012649903288201162, | |
| "loss": 0.8952, | |
| "num_input_tokens_seen": 27711360, | |
| "step": 576, | |
| "train_runtime": 4009.176, | |
| "train_tokens_per_second": 6911.984 | |
| }, | |
| { | |
| "epoch": 0.3709418193506911, | |
| "grad_norm": 0.21504226326942444, | |
| "learning_rate": 0.00012637008381689234, | |
| "loss": 0.9748, | |
| "num_input_tokens_seen": 27785872, | |
| "step": 577, | |
| "train_runtime": 4019.6649, | |
| "train_tokens_per_second": 6912.485 | |
| }, | |
| { | |
| "epoch": 0.37158469945355194, | |
| "grad_norm": 0.22260011732578278, | |
| "learning_rate": 0.00012624113475177305, | |
| "loss": 1.0449, | |
| "num_input_tokens_seen": 27831328, | |
| "step": 578, | |
| "train_runtime": 4026.0195, | |
| "train_tokens_per_second": 6912.865 | |
| }, | |
| { | |
| "epoch": 0.3722275795564127, | |
| "grad_norm": 0.21825265884399414, | |
| "learning_rate": 0.00012611218568665377, | |
| "loss": 0.8929, | |
| "num_input_tokens_seen": 27858000, | |
| "step": 579, | |
| "train_runtime": 4029.8615, | |
| "train_tokens_per_second": 6912.893 | |
| }, | |
| { | |
| "epoch": 0.37287045965927357, | |
| "grad_norm": 0.21789203584194183, | |
| "learning_rate": 0.00012598323662153452, | |
| "loss": 1.1042, | |
| "num_input_tokens_seen": 27905360, | |
| "step": 580, | |
| "train_runtime": 4036.5269, | |
| "train_tokens_per_second": 6913.21 | |
| }, | |
| { | |
| "epoch": 0.37351333976213436, | |
| "grad_norm": 0.2369895726442337, | |
| "learning_rate": 0.0001258542875564152, | |
| "loss": 0.9221, | |
| "num_input_tokens_seen": 27939744, | |
| "step": 581, | |
| "train_runtime": 4041.3997, | |
| "train_tokens_per_second": 6913.383 | |
| }, | |
| { | |
| "epoch": 0.3741562198649952, | |
| "grad_norm": 0.21872176229953766, | |
| "learning_rate": 0.00012572533849129595, | |
| "loss": 1.0185, | |
| "num_input_tokens_seen": 27982016, | |
| "step": 582, | |
| "train_runtime": 4047.3382, | |
| "train_tokens_per_second": 6913.684 | |
| }, | |
| { | |
| "epoch": 0.374799099967856, | |
| "grad_norm": 0.22556743025779724, | |
| "learning_rate": 0.00012559638942617667, | |
| "loss": 1.0568, | |
| "num_input_tokens_seen": 28026144, | |
| "step": 583, | |
| "train_runtime": 4053.5359, | |
| "train_tokens_per_second": 6913.999 | |
| }, | |
| { | |
| "epoch": 0.37544198007071683, | |
| "grad_norm": 0.20244669914245605, | |
| "learning_rate": 0.0001254674403610574, | |
| "loss": 1.2114, | |
| "num_input_tokens_seen": 28096992, | |
| "step": 584, | |
| "train_runtime": 4063.4542, | |
| "train_tokens_per_second": 6914.558 | |
| }, | |
| { | |
| "epoch": 0.3760848601735776, | |
| "grad_norm": 0.17933306097984314, | |
| "learning_rate": 0.0001253384912959381, | |
| "loss": 0.9909, | |
| "num_input_tokens_seen": 28145312, | |
| "step": 585, | |
| "train_runtime": 4070.2961, | |
| "train_tokens_per_second": 6914.807 | |
| }, | |
| { | |
| "epoch": 0.37672774027643846, | |
| "grad_norm": 0.21245713531970978, | |
| "learning_rate": 0.00012520954223081883, | |
| "loss": 1.0352, | |
| "num_input_tokens_seen": 28188176, | |
| "step": 586, | |
| "train_runtime": 4076.3544, | |
| "train_tokens_per_second": 6915.045 | |
| }, | |
| { | |
| "epoch": 0.37737062037929925, | |
| "grad_norm": 0.21566520631313324, | |
| "learning_rate": 0.00012508059316569954, | |
| "loss": 0.9848, | |
| "num_input_tokens_seen": 28224368, | |
| "step": 587, | |
| "train_runtime": 4081.4827, | |
| "train_tokens_per_second": 6915.224 | |
| }, | |
| { | |
| "epoch": 0.3780135004821601, | |
| "grad_norm": 0.22781872749328613, | |
| "learning_rate": 0.00012495164410058026, | |
| "loss": 1.1376, | |
| "num_input_tokens_seen": 28286320, | |
| "step": 588, | |
| "train_runtime": 4090.184, | |
| "train_tokens_per_second": 6915.66 | |
| }, | |
| { | |
| "epoch": 0.3786563805850209, | |
| "grad_norm": 0.20224601030349731, | |
| "learning_rate": 0.000124822695035461, | |
| "loss": 1.0087, | |
| "num_input_tokens_seen": 28334400, | |
| "step": 589, | |
| "train_runtime": 4096.9721, | |
| "train_tokens_per_second": 6915.937 | |
| }, | |
| { | |
| "epoch": 0.3792992606878817, | |
| "grad_norm": 0.21622709929943085, | |
| "learning_rate": 0.00012469374597034173, | |
| "loss": 1.0467, | |
| "num_input_tokens_seen": 28411456, | |
| "step": 590, | |
| "train_runtime": 4107.7924, | |
| "train_tokens_per_second": 6916.478 | |
| }, | |
| { | |
| "epoch": 0.3799421407907425, | |
| "grad_norm": 0.2303570955991745, | |
| "learning_rate": 0.00012456479690522244, | |
| "loss": 0.894, | |
| "num_input_tokens_seen": 28487168, | |
| "step": 591, | |
| "train_runtime": 4118.4367, | |
| "train_tokens_per_second": 6916.986 | |
| }, | |
| { | |
| "epoch": 0.38058502089360335, | |
| "grad_norm": 0.23342084884643555, | |
| "learning_rate": 0.00012443584784010316, | |
| "loss": 0.9435, | |
| "num_input_tokens_seen": 28544832, | |
| "step": 592, | |
| "train_runtime": 4126.5979, | |
| "train_tokens_per_second": 6917.28 | |
| }, | |
| { | |
| "epoch": 0.38122790099646414, | |
| "grad_norm": 0.22476206719875336, | |
| "learning_rate": 0.0001243068987749839, | |
| "loss": 0.9244, | |
| "num_input_tokens_seen": 28571696, | |
| "step": 593, | |
| "train_runtime": 4130.4665, | |
| "train_tokens_per_second": 6917.305 | |
| }, | |
| { | |
| "epoch": 0.381870781099325, | |
| "grad_norm": 0.23770561814308167, | |
| "learning_rate": 0.0001241779497098646, | |
| "loss": 0.952, | |
| "num_input_tokens_seen": 28610848, | |
| "step": 594, | |
| "train_runtime": 4136.0008, | |
| "train_tokens_per_second": 6917.515 | |
| }, | |
| { | |
| "epoch": 0.3825136612021858, | |
| "grad_norm": 0.2344546765089035, | |
| "learning_rate": 0.00012404900064474534, | |
| "loss": 0.9873, | |
| "num_input_tokens_seen": 28661696, | |
| "step": 595, | |
| "train_runtime": 4143.1852, | |
| "train_tokens_per_second": 6917.793 | |
| }, | |
| { | |
| "epoch": 0.3831565413050466, | |
| "grad_norm": 0.2203758805990219, | |
| "learning_rate": 0.00012392005157962606, | |
| "loss": 0.9037, | |
| "num_input_tokens_seen": 28702016, | |
| "step": 596, | |
| "train_runtime": 4148.8302, | |
| "train_tokens_per_second": 6918.098 | |
| }, | |
| { | |
| "epoch": 0.3837994214079074, | |
| "grad_norm": 0.23991960287094116, | |
| "learning_rate": 0.00012379110251450678, | |
| "loss": 1.0986, | |
| "num_input_tokens_seen": 28750608, | |
| "step": 597, | |
| "train_runtime": 4155.6771, | |
| "train_tokens_per_second": 6918.393 | |
| }, | |
| { | |
| "epoch": 0.38444230151076825, | |
| "grad_norm": 0.2651250958442688, | |
| "learning_rate": 0.0001236621534493875, | |
| "loss": 1.0733, | |
| "num_input_tokens_seen": 28802192, | |
| "step": 598, | |
| "train_runtime": 4162.9186, | |
| "train_tokens_per_second": 6918.75 | |
| }, | |
| { | |
| "epoch": 0.38508518161362904, | |
| "grad_norm": 0.19469523429870605, | |
| "learning_rate": 0.00012353320438426824, | |
| "loss": 0.8291, | |
| "num_input_tokens_seen": 28836496, | |
| "step": 599, | |
| "train_runtime": 4167.7908, | |
| "train_tokens_per_second": 6918.892 | |
| }, | |
| { | |
| "epoch": 0.3857280617164899, | |
| "grad_norm": 0.21888983249664307, | |
| "learning_rate": 0.00012340425531914893, | |
| "loss": 0.9539, | |
| "num_input_tokens_seen": 28889152, | |
| "step": 600, | |
| "train_runtime": 4175.156, | |
| "train_tokens_per_second": 6919.299 | |
| }, | |
| { | |
| "epoch": 0.38637094181935067, | |
| "grad_norm": 0.21506822109222412, | |
| "learning_rate": 0.00012327530625402965, | |
| "loss": 1.0613, | |
| "num_input_tokens_seen": 28954208, | |
| "step": 601, | |
| "train_runtime": 4184.9056, | |
| "train_tokens_per_second": 6918.724 | |
| }, | |
| { | |
| "epoch": 0.3870138219222115, | |
| "grad_norm": 0.20702601969242096, | |
| "learning_rate": 0.0001231463571889104, | |
| "loss": 1.0223, | |
| "num_input_tokens_seen": 28990576, | |
| "step": 602, | |
| "train_runtime": 4190.0373, | |
| "train_tokens_per_second": 6918.93 | |
| }, | |
| { | |
| "epoch": 0.3876567020250723, | |
| "grad_norm": 0.21783804893493652, | |
| "learning_rate": 0.0001230174081237911, | |
| "loss": 1.1475, | |
| "num_input_tokens_seen": 29044912, | |
| "step": 603, | |
| "train_runtime": 4197.6381, | |
| "train_tokens_per_second": 6919.346 | |
| }, | |
| { | |
| "epoch": 0.38829958212793314, | |
| "grad_norm": 0.2323097288608551, | |
| "learning_rate": 0.00012288845905867183, | |
| "loss": 0.9286, | |
| "num_input_tokens_seen": 29102384, | |
| "step": 604, | |
| "train_runtime": 4205.7063, | |
| "train_tokens_per_second": 6919.738 | |
| }, | |
| { | |
| "epoch": 0.388942462230794, | |
| "grad_norm": 0.23841801285743713, | |
| "learning_rate": 0.00012275950999355255, | |
| "loss": 1.0584, | |
| "num_input_tokens_seen": 29164656, | |
| "step": 605, | |
| "train_runtime": 4214.5376, | |
| "train_tokens_per_second": 6920.013 | |
| }, | |
| { | |
| "epoch": 0.38958534233365477, | |
| "grad_norm": 0.20748752355575562, | |
| "learning_rate": 0.00012263056092843327, | |
| "loss": 1.0395, | |
| "num_input_tokens_seen": 29225600, | |
| "step": 606, | |
| "train_runtime": 4223.1606, | |
| "train_tokens_per_second": 6920.315 | |
| }, | |
| { | |
| "epoch": 0.3902282224365156, | |
| "grad_norm": 0.2151229828596115, | |
| "learning_rate": 0.000122501611863314, | |
| "loss": 1.0344, | |
| "num_input_tokens_seen": 29262288, | |
| "step": 607, | |
| "train_runtime": 4228.3802, | |
| "train_tokens_per_second": 6920.449 | |
| }, | |
| { | |
| "epoch": 0.3908711025393764, | |
| "grad_norm": 0.21405351161956787, | |
| "learning_rate": 0.00012237266279819473, | |
| "loss": 0.9952, | |
| "num_input_tokens_seen": 29308352, | |
| "step": 608, | |
| "train_runtime": 4234.8569, | |
| "train_tokens_per_second": 6920.742 | |
| }, | |
| { | |
| "epoch": 0.39151398264223725, | |
| "grad_norm": 0.23500262200832367, | |
| "learning_rate": 0.00012224371373307545, | |
| "loss": 1.0545, | |
| "num_input_tokens_seen": 29358352, | |
| "step": 609, | |
| "train_runtime": 4241.8241, | |
| "train_tokens_per_second": 6921.162 | |
| }, | |
| { | |
| "epoch": 0.39215686274509803, | |
| "grad_norm": 0.2577454745769501, | |
| "learning_rate": 0.00012211476466795617, | |
| "loss": 1.0378, | |
| "num_input_tokens_seen": 29394896, | |
| "step": 610, | |
| "train_runtime": 4246.9734, | |
| "train_tokens_per_second": 6921.375 | |
| }, | |
| { | |
| "epoch": 0.3927997428479589, | |
| "grad_norm": 0.2507747411727905, | |
| "learning_rate": 0.00012198581560283689, | |
| "loss": 0.9745, | |
| "num_input_tokens_seen": 29475024, | |
| "step": 611, | |
| "train_runtime": 4258.173, | |
| "train_tokens_per_second": 6921.988 | |
| }, | |
| { | |
| "epoch": 0.39344262295081966, | |
| "grad_norm": 0.20818312466144562, | |
| "learning_rate": 0.00012185686653771762, | |
| "loss": 1.0457, | |
| "num_input_tokens_seen": 29524560, | |
| "step": 612, | |
| "train_runtime": 4265.1329, | |
| "train_tokens_per_second": 6922.307 | |
| }, | |
| { | |
| "epoch": 0.3940855030536805, | |
| "grad_norm": 0.20738723874092102, | |
| "learning_rate": 0.00012172791747259832, | |
| "loss": 0.9007, | |
| "num_input_tokens_seen": 29557488, | |
| "step": 613, | |
| "train_runtime": 4269.8032, | |
| "train_tokens_per_second": 6922.447 | |
| }, | |
| { | |
| "epoch": 0.3947283831565413, | |
| "grad_norm": 0.23783709108829498, | |
| "learning_rate": 0.00012159896840747904, | |
| "loss": 0.9693, | |
| "num_input_tokens_seen": 29606720, | |
| "step": 614, | |
| "train_runtime": 4276.6802, | |
| "train_tokens_per_second": 6922.828 | |
| }, | |
| { | |
| "epoch": 0.39537126325940214, | |
| "grad_norm": 0.2414642572402954, | |
| "learning_rate": 0.00012147001934235977, | |
| "loss": 0.9164, | |
| "num_input_tokens_seen": 29659248, | |
| "step": 615, | |
| "train_runtime": 4284.0389, | |
| "train_tokens_per_second": 6923.198 | |
| }, | |
| { | |
| "epoch": 0.3960141433622629, | |
| "grad_norm": 0.2816667854785919, | |
| "learning_rate": 0.00012134107027724049, | |
| "loss": 1.08, | |
| "num_input_tokens_seen": 29692640, | |
| "step": 616, | |
| "train_runtime": 4288.753, | |
| "train_tokens_per_second": 6923.374 | |
| }, | |
| { | |
| "epoch": 0.39665702346512377, | |
| "grad_norm": 0.22061841189861298, | |
| "learning_rate": 0.00012121212121212122, | |
| "loss": 0.942, | |
| "num_input_tokens_seen": 29749232, | |
| "step": 617, | |
| "train_runtime": 4296.6122, | |
| "train_tokens_per_second": 6923.881 | |
| }, | |
| { | |
| "epoch": 0.39729990356798456, | |
| "grad_norm": 0.22501406073570251, | |
| "learning_rate": 0.00012108317214700193, | |
| "loss": 0.9142, | |
| "num_input_tokens_seen": 29782464, | |
| "step": 618, | |
| "train_runtime": 4301.2713, | |
| "train_tokens_per_second": 6924.107 | |
| }, | |
| { | |
| "epoch": 0.3979427836708454, | |
| "grad_norm": 0.22138579189777374, | |
| "learning_rate": 0.00012095422308188267, | |
| "loss": 1.0032, | |
| "num_input_tokens_seen": 29827024, | |
| "step": 619, | |
| "train_runtime": 4307.5291, | |
| "train_tokens_per_second": 6924.393 | |
| }, | |
| { | |
| "epoch": 0.3985856637737062, | |
| "grad_norm": 0.23382511734962463, | |
| "learning_rate": 0.00012082527401676338, | |
| "loss": 0.9978, | |
| "num_input_tokens_seen": 29871056, | |
| "step": 620, | |
| "train_runtime": 4313.6531, | |
| "train_tokens_per_second": 6924.77 | |
| }, | |
| { | |
| "epoch": 0.39922854387656703, | |
| "grad_norm": 0.2238994836807251, | |
| "learning_rate": 0.00012069632495164411, | |
| "loss": 1.2913, | |
| "num_input_tokens_seen": 29931440, | |
| "step": 621, | |
| "train_runtime": 4321.992, | |
| "train_tokens_per_second": 6925.381 | |
| }, | |
| { | |
| "epoch": 0.3998714239794278, | |
| "grad_norm": 0.21180926263332367, | |
| "learning_rate": 0.00012056737588652483, | |
| "loss": 0.955, | |
| "num_input_tokens_seen": 29969744, | |
| "step": 622, | |
| "train_runtime": 4327.3136, | |
| "train_tokens_per_second": 6925.716 | |
| }, | |
| { | |
| "epoch": 0.40051430408228866, | |
| "grad_norm": 0.23319873213768005, | |
| "learning_rate": 0.00012043842682140556, | |
| "loss": 1.0568, | |
| "num_input_tokens_seen": 30001616, | |
| "step": 623, | |
| "train_runtime": 4331.7652, | |
| "train_tokens_per_second": 6925.956 | |
| }, | |
| { | |
| "epoch": 0.40115718418514945, | |
| "grad_norm": 0.22872281074523926, | |
| "learning_rate": 0.00012030947775628628, | |
| "loss": 1.0755, | |
| "num_input_tokens_seen": 30061664, | |
| "step": 624, | |
| "train_runtime": 4340.096, | |
| "train_tokens_per_second": 6926.498 | |
| }, | |
| { | |
| "epoch": 0.40115718418514945, | |
| "eval_loss": 1.0195001363754272, | |
| "eval_runtime": 39.6587, | |
| "eval_samples_per_second": 25.064, | |
| "eval_steps_per_second": 1.589, | |
| "num_input_tokens_seen": 30061664, | |
| "step": 624 | |
| }, | |
| { | |
| "epoch": 0.4018000642880103, | |
| "grad_norm": 0.21049852669239044, | |
| "learning_rate": 0.00012018052869116701, | |
| "loss": 0.9652, | |
| "num_input_tokens_seen": 30099536, | |
| "step": 625, | |
| "train_runtime": 4385.0645, | |
| "train_tokens_per_second": 6864.103 | |
| }, | |
| { | |
| "epoch": 0.4024429443908711, | |
| "grad_norm": 0.21458666026592255, | |
| "learning_rate": 0.00012005157962604771, | |
| "loss": 0.9631, | |
| "num_input_tokens_seen": 30156400, | |
| "step": 626, | |
| "train_runtime": 4392.9933, | |
| "train_tokens_per_second": 6864.659 | |
| }, | |
| { | |
| "epoch": 0.4030858244937319, | |
| "grad_norm": 0.21649177372455597, | |
| "learning_rate": 0.00011992263056092843, | |
| "loss": 0.9611, | |
| "num_input_tokens_seen": 30199968, | |
| "step": 627, | |
| "train_runtime": 4399.0421, | |
| "train_tokens_per_second": 6865.124 | |
| }, | |
| { | |
| "epoch": 0.4037287045965927, | |
| "grad_norm": 0.2240186184644699, | |
| "learning_rate": 0.00011979368149580916, | |
| "loss": 0.931, | |
| "num_input_tokens_seen": 30233536, | |
| "step": 628, | |
| "train_runtime": 4403.7362, | |
| "train_tokens_per_second": 6865.428 | |
| }, | |
| { | |
| "epoch": 0.40437158469945356, | |
| "grad_norm": 0.1959734410047531, | |
| "learning_rate": 0.00011966473243068988, | |
| "loss": 0.9257, | |
| "num_input_tokens_seen": 30280816, | |
| "step": 629, | |
| "train_runtime": 4410.2782, | |
| "train_tokens_per_second": 6865.965 | |
| }, | |
| { | |
| "epoch": 0.40501446480231434, | |
| "grad_norm": 0.22301970422267914, | |
| "learning_rate": 0.00011953578336557061, | |
| "loss": 1.0331, | |
| "num_input_tokens_seen": 30319856, | |
| "step": 630, | |
| "train_runtime": 4415.7542, | |
| "train_tokens_per_second": 6866.292 | |
| }, | |
| { | |
| "epoch": 0.4056573449051752, | |
| "grad_norm": 0.21817179024219513, | |
| "learning_rate": 0.00011940683430045132, | |
| "loss": 0.9312, | |
| "num_input_tokens_seen": 30366832, | |
| "step": 631, | |
| "train_runtime": 4422.9045, | |
| "train_tokens_per_second": 6865.812 | |
| }, | |
| { | |
| "epoch": 0.406300225008036, | |
| "grad_norm": 0.21276038885116577, | |
| "learning_rate": 0.00011927788523533205, | |
| "loss": 1.0818, | |
| "num_input_tokens_seen": 30411472, | |
| "step": 632, | |
| "train_runtime": 4429.0946, | |
| "train_tokens_per_second": 6866.295 | |
| }, | |
| { | |
| "epoch": 0.4069431051108968, | |
| "grad_norm": 0.20637577772140503, | |
| "learning_rate": 0.00011914893617021277, | |
| "loss": 1.0118, | |
| "num_input_tokens_seen": 30450272, | |
| "step": 633, | |
| "train_runtime": 4434.5087, | |
| "train_tokens_per_second": 6866.662 | |
| }, | |
| { | |
| "epoch": 0.4075859852137576, | |
| "grad_norm": 0.21434983611106873, | |
| "learning_rate": 0.0001190199871050935, | |
| "loss": 0.9965, | |
| "num_input_tokens_seen": 30497536, | |
| "step": 634, | |
| "train_runtime": 4441.0991, | |
| "train_tokens_per_second": 6867.115 | |
| }, | |
| { | |
| "epoch": 0.40822886531661845, | |
| "grad_norm": 0.21265575289726257, | |
| "learning_rate": 0.00011889103803997422, | |
| "loss": 0.9129, | |
| "num_input_tokens_seen": 30555504, | |
| "step": 635, | |
| "train_runtime": 4449.2162, | |
| "train_tokens_per_second": 6867.615 | |
| }, | |
| { | |
| "epoch": 0.4088717454194793, | |
| "grad_norm": 0.22651416063308716, | |
| "learning_rate": 0.00011876208897485495, | |
| "loss": 0.9242, | |
| "num_input_tokens_seen": 30595360, | |
| "step": 636, | |
| "train_runtime": 4454.752, | |
| "train_tokens_per_second": 6868.028 | |
| }, | |
| { | |
| "epoch": 0.4095146255223401, | |
| "grad_norm": 0.20967771112918854, | |
| "learning_rate": 0.00011863313990973565, | |
| "loss": 0.9452, | |
| "num_input_tokens_seen": 30627360, | |
| "step": 637, | |
| "train_runtime": 4459.2199, | |
| "train_tokens_per_second": 6868.322 | |
| }, | |
| { | |
| "epoch": 0.4101575056252009, | |
| "grad_norm": 0.19460758566856384, | |
| "learning_rate": 0.0001185041908446164, | |
| "loss": 0.7967, | |
| "num_input_tokens_seen": 30675744, | |
| "step": 638, | |
| "train_runtime": 4465.9439, | |
| "train_tokens_per_second": 6868.815 | |
| }, | |
| { | |
| "epoch": 0.4108003857280617, | |
| "grad_norm": 0.21010765433311462, | |
| "learning_rate": 0.0001183752417794971, | |
| "loss": 0.9081, | |
| "num_input_tokens_seen": 30708240, | |
| "step": 639, | |
| "train_runtime": 4470.5297, | |
| "train_tokens_per_second": 6869.038 | |
| }, | |
| { | |
| "epoch": 0.41144326583092256, | |
| "grad_norm": 0.23160742223262787, | |
| "learning_rate": 0.00011824629271437782, | |
| "loss": 1.072, | |
| "num_input_tokens_seen": 30756592, | |
| "step": 640, | |
| "train_runtime": 4477.2619, | |
| "train_tokens_per_second": 6869.509 | |
| }, | |
| { | |
| "epoch": 0.41208614593378334, | |
| "grad_norm": 0.22536088526248932, | |
| "learning_rate": 0.00011811734364925855, | |
| "loss": 1.0498, | |
| "num_input_tokens_seen": 30808704, | |
| "step": 641, | |
| "train_runtime": 4484.5345, | |
| "train_tokens_per_second": 6869.989 | |
| }, | |
| { | |
| "epoch": 0.4127290260366442, | |
| "grad_norm": 0.21694333851337433, | |
| "learning_rate": 0.00011798839458413926, | |
| "loss": 0.9911, | |
| "num_input_tokens_seen": 30850400, | |
| "step": 642, | |
| "train_runtime": 4490.3558, | |
| "train_tokens_per_second": 6870.369 | |
| }, | |
| { | |
| "epoch": 0.413371906139505, | |
| "grad_norm": 0.22314226627349854, | |
| "learning_rate": 0.00011785944551901999, | |
| "loss": 1.0367, | |
| "num_input_tokens_seen": 30909184, | |
| "step": 643, | |
| "train_runtime": 4498.5039, | |
| "train_tokens_per_second": 6870.992 | |
| }, | |
| { | |
| "epoch": 0.4140147862423658, | |
| "grad_norm": 0.21192863583564758, | |
| "learning_rate": 0.00011773049645390071, | |
| "loss": 0.9676, | |
| "num_input_tokens_seen": 30964544, | |
| "step": 644, | |
| "train_runtime": 4506.3238, | |
| "train_tokens_per_second": 6871.354 | |
| }, | |
| { | |
| "epoch": 0.4146576663452266, | |
| "grad_norm": 0.21439877152442932, | |
| "learning_rate": 0.00011760154738878144, | |
| "loss": 0.9365, | |
| "num_input_tokens_seen": 31015952, | |
| "step": 645, | |
| "train_runtime": 4513.4906, | |
| "train_tokens_per_second": 6871.833 | |
| }, | |
| { | |
| "epoch": 0.41530054644808745, | |
| "grad_norm": 0.22022485733032227, | |
| "learning_rate": 0.00011747259832366216, | |
| "loss": 1.0268, | |
| "num_input_tokens_seen": 31076064, | |
| "step": 646, | |
| "train_runtime": 4522.0091, | |
| "train_tokens_per_second": 6872.181 | |
| }, | |
| { | |
| "epoch": 0.41594342655094824, | |
| "grad_norm": 0.22051121294498444, | |
| "learning_rate": 0.00011734364925854289, | |
| "loss": 0.9622, | |
| "num_input_tokens_seen": 31123008, | |
| "step": 647, | |
| "train_runtime": 4528.5517, | |
| "train_tokens_per_second": 6872.618 | |
| }, | |
| { | |
| "epoch": 0.4165863066538091, | |
| "grad_norm": 0.22413188219070435, | |
| "learning_rate": 0.00011721470019342359, | |
| "loss": 0.9393, | |
| "num_input_tokens_seen": 31158768, | |
| "step": 648, | |
| "train_runtime": 4533.6072, | |
| "train_tokens_per_second": 6872.842 | |
| }, | |
| { | |
| "epoch": 0.41722918675666987, | |
| "grad_norm": 0.21698571741580963, | |
| "learning_rate": 0.00011708575112830434, | |
| "loss": 0.9853, | |
| "num_input_tokens_seen": 31196608, | |
| "step": 649, | |
| "train_runtime": 4538.8981, | |
| "train_tokens_per_second": 6873.168 | |
| }, | |
| { | |
| "epoch": 0.4178720668595307, | |
| "grad_norm": 0.22137726843357086, | |
| "learning_rate": 0.00011695680206318504, | |
| "loss": 1.027, | |
| "num_input_tokens_seen": 31238256, | |
| "step": 650, | |
| "train_runtime": 4544.6888, | |
| "train_tokens_per_second": 6873.574 | |
| }, | |
| { | |
| "epoch": 0.4185149469623915, | |
| "grad_norm": 0.2062436044216156, | |
| "learning_rate": 0.00011682785299806577, | |
| "loss": 1.0151, | |
| "num_input_tokens_seen": 31283008, | |
| "step": 651, | |
| "train_runtime": 4550.8603, | |
| "train_tokens_per_second": 6874.087 | |
| }, | |
| { | |
| "epoch": 0.41915782706525234, | |
| "grad_norm": 0.21680644154548645, | |
| "learning_rate": 0.00011669890393294649, | |
| "loss": 1.0544, | |
| "num_input_tokens_seen": 31321264, | |
| "step": 652, | |
| "train_runtime": 4556.2232, | |
| "train_tokens_per_second": 6874.392 | |
| }, | |
| { | |
| "epoch": 0.41980070716811313, | |
| "grad_norm": 0.20638515055179596, | |
| "learning_rate": 0.00011656995486782722, | |
| "loss": 0.9003, | |
| "num_input_tokens_seen": 31356928, | |
| "step": 653, | |
| "train_runtime": 4561.2955, | |
| "train_tokens_per_second": 6874.566 | |
| }, | |
| { | |
| "epoch": 0.420443587270974, | |
| "grad_norm": 0.20695024728775024, | |
| "learning_rate": 0.00011644100580270794, | |
| "loss": 0.9458, | |
| "num_input_tokens_seen": 31394000, | |
| "step": 654, | |
| "train_runtime": 4566.543, | |
| "train_tokens_per_second": 6874.785 | |
| }, | |
| { | |
| "epoch": 0.42108646737383476, | |
| "grad_norm": 0.20706257224082947, | |
| "learning_rate": 0.00011631205673758865, | |
| "loss": 1.0082, | |
| "num_input_tokens_seen": 31430544, | |
| "step": 655, | |
| "train_runtime": 4571.683, | |
| "train_tokens_per_second": 6875.049 | |
| }, | |
| { | |
| "epoch": 0.4217293474766956, | |
| "grad_norm": 0.23636630177497864, | |
| "learning_rate": 0.00011618310767246938, | |
| "loss": 1.0523, | |
| "num_input_tokens_seen": 31476864, | |
| "step": 656, | |
| "train_runtime": 4578.185, | |
| "train_tokens_per_second": 6875.402 | |
| }, | |
| { | |
| "epoch": 0.4223722275795564, | |
| "grad_norm": 0.2097059190273285, | |
| "learning_rate": 0.0001160541586073501, | |
| "loss": 0.8199, | |
| "num_input_tokens_seen": 31526576, | |
| "step": 657, | |
| "train_runtime": 4585.1503, | |
| "train_tokens_per_second": 6875.8 | |
| }, | |
| { | |
| "epoch": 0.42301510768241724, | |
| "grad_norm": 0.22159291803836823, | |
| "learning_rate": 0.00011592520954223083, | |
| "loss": 0.9934, | |
| "num_input_tokens_seen": 31566736, | |
| "step": 658, | |
| "train_runtime": 4590.7784, | |
| "train_tokens_per_second": 6876.118 | |
| }, | |
| { | |
| "epoch": 0.423657987785278, | |
| "grad_norm": 0.2194710522890091, | |
| "learning_rate": 0.00011579626047711155, | |
| "loss": 0.9837, | |
| "num_input_tokens_seen": 31604992, | |
| "step": 659, | |
| "train_runtime": 4596.148, | |
| "train_tokens_per_second": 6876.409 | |
| }, | |
| { | |
| "epoch": 0.42430086788813887, | |
| "grad_norm": 0.2124231904745102, | |
| "learning_rate": 0.00011566731141199228, | |
| "loss": 0.9482, | |
| "num_input_tokens_seen": 31641088, | |
| "step": 660, | |
| "train_runtime": 4601.1459, | |
| "train_tokens_per_second": 6876.784 | |
| }, | |
| { | |
| "epoch": 0.42494374799099965, | |
| "grad_norm": 0.2047438621520996, | |
| "learning_rate": 0.00011553836234687298, | |
| "loss": 0.8637, | |
| "num_input_tokens_seen": 31685744, | |
| "step": 661, | |
| "train_runtime": 4607.9012, | |
| "train_tokens_per_second": 6876.394 | |
| }, | |
| { | |
| "epoch": 0.4255866280938605, | |
| "grad_norm": 0.23964186012744904, | |
| "learning_rate": 0.00011540941328175371, | |
| "loss": 1.0124, | |
| "num_input_tokens_seen": 31718608, | |
| "step": 662, | |
| "train_runtime": 4612.5423, | |
| "train_tokens_per_second": 6876.6 | |
| }, | |
| { | |
| "epoch": 0.4262295081967213, | |
| "grad_norm": 0.22414755821228027, | |
| "learning_rate": 0.00011528046421663443, | |
| "loss": 1.0236, | |
| "num_input_tokens_seen": 31773472, | |
| "step": 663, | |
| "train_runtime": 4620.2165, | |
| "train_tokens_per_second": 6877.053 | |
| }, | |
| { | |
| "epoch": 0.42687238829958213, | |
| "grad_norm": 0.20792655646800995, | |
| "learning_rate": 0.00011515151515151516, | |
| "loss": 1.0071, | |
| "num_input_tokens_seen": 31831120, | |
| "step": 664, | |
| "train_runtime": 4628.3237, | |
| "train_tokens_per_second": 6877.462 | |
| }, | |
| { | |
| "epoch": 0.42751526840244297, | |
| "grad_norm": 0.22675418853759766, | |
| "learning_rate": 0.00011502256608639588, | |
| "loss": 0.9932, | |
| "num_input_tokens_seen": 31870400, | |
| "step": 665, | |
| "train_runtime": 4633.8504, | |
| "train_tokens_per_second": 6877.736 | |
| }, | |
| { | |
| "epoch": 0.42815814850530376, | |
| "grad_norm": 0.20541276037693024, | |
| "learning_rate": 0.00011489361702127661, | |
| "loss": 0.9302, | |
| "num_input_tokens_seen": 31921072, | |
| "step": 666, | |
| "train_runtime": 4640.9182, | |
| "train_tokens_per_second": 6878.18 | |
| }, | |
| { | |
| "epoch": 0.4288010286081646, | |
| "grad_norm": 0.20797085762023926, | |
| "learning_rate": 0.00011476466795615732, | |
| "loss": 0.9894, | |
| "num_input_tokens_seen": 31959600, | |
| "step": 667, | |
| "train_runtime": 4646.3473, | |
| "train_tokens_per_second": 6878.435 | |
| }, | |
| { | |
| "epoch": 0.4294439087110254, | |
| "grad_norm": 0.22054386138916016, | |
| "learning_rate": 0.00011463571889103804, | |
| "loss": 0.8813, | |
| "num_input_tokens_seen": 32003888, | |
| "step": 668, | |
| "train_runtime": 4652.5271, | |
| "train_tokens_per_second": 6878.818 | |
| }, | |
| { | |
| "epoch": 0.43008678881388623, | |
| "grad_norm": 0.2270301729440689, | |
| "learning_rate": 0.00011450676982591877, | |
| "loss": 1.0675, | |
| "num_input_tokens_seen": 32054864, | |
| "step": 669, | |
| "train_runtime": 4659.6237, | |
| "train_tokens_per_second": 6879.282 | |
| }, | |
| { | |
| "epoch": 0.430729668916747, | |
| "grad_norm": 0.2037355899810791, | |
| "learning_rate": 0.00011437782076079949, | |
| "loss": 0.9287, | |
| "num_input_tokens_seen": 32096768, | |
| "step": 670, | |
| "train_runtime": 4665.4868, | |
| "train_tokens_per_second": 6879.618 | |
| }, | |
| { | |
| "epoch": 0.43137254901960786, | |
| "grad_norm": 0.2622132897377014, | |
| "learning_rate": 0.00011424887169568022, | |
| "loss": 0.9492, | |
| "num_input_tokens_seen": 32134112, | |
| "step": 671, | |
| "train_runtime": 4670.6869, | |
| "train_tokens_per_second": 6879.954 | |
| }, | |
| { | |
| "epoch": 0.43201542912246865, | |
| "grad_norm": 0.1913800835609436, | |
| "learning_rate": 0.00011411992263056092, | |
| "loss": 0.9271, | |
| "num_input_tokens_seen": 32173216, | |
| "step": 672, | |
| "train_runtime": 4676.1106, | |
| "train_tokens_per_second": 6880.337 | |
| }, | |
| { | |
| "epoch": 0.4326583092253295, | |
| "grad_norm": 0.2154611498117447, | |
| "learning_rate": 0.00011399097356544165, | |
| "loss": 0.9622, | |
| "num_input_tokens_seen": 32215968, | |
| "step": 673, | |
| "train_runtime": 4682.0757, | |
| "train_tokens_per_second": 6880.702 | |
| }, | |
| { | |
| "epoch": 0.4333011893281903, | |
| "grad_norm": 0.22015735507011414, | |
| "learning_rate": 0.00011386202450032237, | |
| "loss": 1.0512, | |
| "num_input_tokens_seen": 32255728, | |
| "step": 674, | |
| "train_runtime": 4687.6013, | |
| "train_tokens_per_second": 6881.073 | |
| }, | |
| { | |
| "epoch": 0.4339440694310511, | |
| "grad_norm": 0.16371029615402222, | |
| "learning_rate": 0.0001137330754352031, | |
| "loss": 0.6272, | |
| "num_input_tokens_seen": 32320576, | |
| "step": 675, | |
| "train_runtime": 4696.653, | |
| "train_tokens_per_second": 6881.619 | |
| }, | |
| { | |
| "epoch": 0.4345869495339119, | |
| "grad_norm": 0.22172540426254272, | |
| "learning_rate": 0.00011360412637008382, | |
| "loss": 0.9891, | |
| "num_input_tokens_seen": 32362384, | |
| "step": 676, | |
| "train_runtime": 4702.4813, | |
| "train_tokens_per_second": 6881.98 | |
| }, | |
| { | |
| "epoch": 0.43522982963677276, | |
| "grad_norm": 0.22036395967006683, | |
| "learning_rate": 0.00011347517730496455, | |
| "loss": 1.0239, | |
| "num_input_tokens_seen": 32400048, | |
| "step": 677, | |
| "train_runtime": 4707.7622, | |
| "train_tokens_per_second": 6882.261 | |
| }, | |
| { | |
| "epoch": 0.43587270973963355, | |
| "grad_norm": 0.22396039962768555, | |
| "learning_rate": 0.00011334622823984526, | |
| "loss": 1.0223, | |
| "num_input_tokens_seen": 32446432, | |
| "step": 678, | |
| "train_runtime": 4714.1851, | |
| "train_tokens_per_second": 6882.723 | |
| }, | |
| { | |
| "epoch": 0.4365155898424944, | |
| "grad_norm": 0.23210053145885468, | |
| "learning_rate": 0.000113217279174726, | |
| "loss": 0.9947, | |
| "num_input_tokens_seen": 32499440, | |
| "step": 679, | |
| "train_runtime": 4721.5273, | |
| "train_tokens_per_second": 6883.247 | |
| }, | |
| { | |
| "epoch": 0.4371584699453552, | |
| "grad_norm": 0.22264118492603302, | |
| "learning_rate": 0.00011308833010960671, | |
| "loss": 0.9648, | |
| "num_input_tokens_seen": 32542192, | |
| "step": 680, | |
| "train_runtime": 4727.528, | |
| "train_tokens_per_second": 6883.554 | |
| }, | |
| { | |
| "epoch": 0.437801350048216, | |
| "grad_norm": 0.23207049071788788, | |
| "learning_rate": 0.00011295938104448743, | |
| "loss": 1.039, | |
| "num_input_tokens_seen": 32576320, | |
| "step": 681, | |
| "train_runtime": 4732.3421, | |
| "train_tokens_per_second": 6883.763 | |
| }, | |
| { | |
| "epoch": 0.4384442301510768, | |
| "grad_norm": 0.20451678335666656, | |
| "learning_rate": 0.00011283043197936816, | |
| "loss": 0.86, | |
| "num_input_tokens_seen": 32639232, | |
| "step": 682, | |
| "train_runtime": 4741.1386, | |
| "train_tokens_per_second": 6884.26 | |
| }, | |
| { | |
| "epoch": 0.43908711025393765, | |
| "grad_norm": 0.21010853350162506, | |
| "learning_rate": 0.00011270148291424886, | |
| "loss": 0.949, | |
| "num_input_tokens_seen": 32688096, | |
| "step": 683, | |
| "train_runtime": 4747.9314, | |
| "train_tokens_per_second": 6884.703 | |
| }, | |
| { | |
| "epoch": 0.43972999035679844, | |
| "grad_norm": 0.229692742228508, | |
| "learning_rate": 0.00011257253384912961, | |
| "loss": 1.0432, | |
| "num_input_tokens_seen": 32752512, | |
| "step": 684, | |
| "train_runtime": 4756.8786, | |
| "train_tokens_per_second": 6885.295 | |
| }, | |
| { | |
| "epoch": 0.4403728704596593, | |
| "grad_norm": 0.21229156851768494, | |
| "learning_rate": 0.00011244358478401031, | |
| "loss": 0.9829, | |
| "num_input_tokens_seen": 32799184, | |
| "step": 685, | |
| "train_runtime": 4763.3748, | |
| "train_tokens_per_second": 6885.703 | |
| }, | |
| { | |
| "epoch": 0.44101575056252007, | |
| "grad_norm": 0.2042849361896515, | |
| "learning_rate": 0.00011231463571889104, | |
| "loss": 1.1422, | |
| "num_input_tokens_seen": 32851248, | |
| "step": 686, | |
| "train_runtime": 4770.5849, | |
| "train_tokens_per_second": 6886.21 | |
| }, | |
| { | |
| "epoch": 0.4416586306653809, | |
| "grad_norm": 0.22981370985507965, | |
| "learning_rate": 0.00011218568665377176, | |
| "loss": 1.1633, | |
| "num_input_tokens_seen": 32918608, | |
| "step": 687, | |
| "train_runtime": 4779.9642, | |
| "train_tokens_per_second": 6886.79 | |
| }, | |
| { | |
| "epoch": 0.4423015107682417, | |
| "grad_norm": 0.2342732697725296, | |
| "learning_rate": 0.0001120567375886525, | |
| "loss": 0.9755, | |
| "num_input_tokens_seen": 32955376, | |
| "step": 688, | |
| "train_runtime": 4785.1234, | |
| "train_tokens_per_second": 6887.048 | |
| }, | |
| { | |
| "epoch": 0.44294439087110254, | |
| "grad_norm": 0.2190224826335907, | |
| "learning_rate": 0.00011192778852353321, | |
| "loss": 0.9443, | |
| "num_input_tokens_seen": 33001280, | |
| "step": 689, | |
| "train_runtime": 4791.5486, | |
| "train_tokens_per_second": 6887.393 | |
| }, | |
| { | |
| "epoch": 0.44358727097396333, | |
| "grad_norm": 0.20389577746391296, | |
| "learning_rate": 0.00011179883945841394, | |
| "loss": 0.9415, | |
| "num_input_tokens_seen": 33060048, | |
| "step": 690, | |
| "train_runtime": 4799.7228, | |
| "train_tokens_per_second": 6887.908 | |
| }, | |
| { | |
| "epoch": 0.4442301510768242, | |
| "grad_norm": 0.2384883016347885, | |
| "learning_rate": 0.00011166989039329465, | |
| "loss": 0.9189, | |
| "num_input_tokens_seen": 33100688, | |
| "step": 691, | |
| "train_runtime": 4805.9254, | |
| "train_tokens_per_second": 6887.474 | |
| }, | |
| { | |
| "epoch": 0.44487303117968496, | |
| "grad_norm": 0.2082808017730713, | |
| "learning_rate": 0.00011154094132817538, | |
| "loss": 0.8782, | |
| "num_input_tokens_seen": 33152336, | |
| "step": 692, | |
| "train_runtime": 4813.1569, | |
| "train_tokens_per_second": 6887.857 | |
| }, | |
| { | |
| "epoch": 0.4455159112825458, | |
| "grad_norm": 0.2516237497329712, | |
| "learning_rate": 0.0001114119922630561, | |
| "loss": 0.9324, | |
| "num_input_tokens_seen": 33189920, | |
| "step": 693, | |
| "train_runtime": 4818.4834, | |
| "train_tokens_per_second": 6888.043 | |
| }, | |
| { | |
| "epoch": 0.4461587913854066, | |
| "grad_norm": 0.23709340393543243, | |
| "learning_rate": 0.0001112830431979368, | |
| "loss": 0.9557, | |
| "num_input_tokens_seen": 33260768, | |
| "step": 694, | |
| "train_runtime": 4828.4263, | |
| "train_tokens_per_second": 6888.532 | |
| }, | |
| { | |
| "epoch": 0.44680167148826744, | |
| "grad_norm": 0.20567552745342255, | |
| "learning_rate": 0.00011115409413281755, | |
| "loss": 0.9644, | |
| "num_input_tokens_seen": 33324816, | |
| "step": 695, | |
| "train_runtime": 4837.3309, | |
| "train_tokens_per_second": 6889.092 | |
| }, | |
| { | |
| "epoch": 0.4474445515911283, | |
| "grad_norm": 0.23268231749534607, | |
| "learning_rate": 0.00011102514506769825, | |
| "loss": 1.1173, | |
| "num_input_tokens_seen": 33360608, | |
| "step": 696, | |
| "train_runtime": 4842.3614, | |
| "train_tokens_per_second": 6889.326 | |
| }, | |
| { | |
| "epoch": 0.44808743169398907, | |
| "grad_norm": 0.21495988965034485, | |
| "learning_rate": 0.00011089619600257898, | |
| "loss": 0.8198, | |
| "num_input_tokens_seen": 33417952, | |
| "step": 697, | |
| "train_runtime": 4850.2634, | |
| "train_tokens_per_second": 6889.925 | |
| }, | |
| { | |
| "epoch": 0.4487303117968499, | |
| "grad_norm": 0.21632738411426544, | |
| "learning_rate": 0.0001107672469374597, | |
| "loss": 0.9627, | |
| "num_input_tokens_seen": 33459424, | |
| "step": 698, | |
| "train_runtime": 4856.0055, | |
| "train_tokens_per_second": 6890.318 | |
| }, | |
| { | |
| "epoch": 0.4493731918997107, | |
| "grad_norm": 0.21286652982234955, | |
| "learning_rate": 0.00011063829787234043, | |
| "loss": 0.9581, | |
| "num_input_tokens_seen": 33514128, | |
| "step": 699, | |
| "train_runtime": 4863.6708, | |
| "train_tokens_per_second": 6890.706 | |
| }, | |
| { | |
| "epoch": 0.45001607200257154, | |
| "grad_norm": 0.20469930768013, | |
| "learning_rate": 0.00011050934880722115, | |
| "loss": 0.8758, | |
| "num_input_tokens_seen": 33571600, | |
| "step": 700, | |
| "train_runtime": 4871.7374, | |
| "train_tokens_per_second": 6891.094 | |
| }, | |
| { | |
| "epoch": 0.45065895210543233, | |
| "grad_norm": 0.22726038098335266, | |
| "learning_rate": 0.00011038039974210188, | |
| "loss": 1.0946, | |
| "num_input_tokens_seen": 33617424, | |
| "step": 701, | |
| "train_runtime": 4878.1349, | |
| "train_tokens_per_second": 6891.45 | |
| }, | |
| { | |
| "epoch": 0.4513018322082932, | |
| "grad_norm": 0.22706422209739685, | |
| "learning_rate": 0.00011025145067698259, | |
| "loss": 0.9967, | |
| "num_input_tokens_seen": 33659984, | |
| "step": 702, | |
| "train_runtime": 4884.0638, | |
| "train_tokens_per_second": 6891.799 | |
| }, | |
| { | |
| "epoch": 0.45194471231115396, | |
| "grad_norm": 0.2139998823404312, | |
| "learning_rate": 0.00011012250161186332, | |
| "loss": 0.9974, | |
| "num_input_tokens_seen": 33711920, | |
| "step": 703, | |
| "train_runtime": 4891.2803, | |
| "train_tokens_per_second": 6892.249 | |
| }, | |
| { | |
| "epoch": 0.4525875924140148, | |
| "grad_norm": 0.1970311999320984, | |
| "learning_rate": 0.00010999355254674404, | |
| "loss": 0.9625, | |
| "num_input_tokens_seen": 33759344, | |
| "step": 704, | |
| "train_runtime": 4897.9042, | |
| "train_tokens_per_second": 6892.61 | |
| }, | |
| { | |
| "epoch": 0.4532304725168756, | |
| "grad_norm": 0.22025848925113678, | |
| "learning_rate": 0.00010986460348162477, | |
| "loss": 1.1195, | |
| "num_input_tokens_seen": 33799712, | |
| "step": 705, | |
| "train_runtime": 4903.5939, | |
| "train_tokens_per_second": 6892.845 | |
| }, | |
| { | |
| "epoch": 0.45387335261973644, | |
| "grad_norm": 0.2358890026807785, | |
| "learning_rate": 0.00010973565441650549, | |
| "loss": 0.9897, | |
| "num_input_tokens_seen": 33846080, | |
| "step": 706, | |
| "train_runtime": 4910.1395, | |
| "train_tokens_per_second": 6893.099 | |
| }, | |
| { | |
| "epoch": 0.4545162327225972, | |
| "grad_norm": 0.2292589545249939, | |
| "learning_rate": 0.00010960670535138622, | |
| "loss": 1.0153, | |
| "num_input_tokens_seen": 33887872, | |
| "step": 707, | |
| "train_runtime": 4915.9598, | |
| "train_tokens_per_second": 6893.44 | |
| }, | |
| { | |
| "epoch": 0.45515911282545807, | |
| "grad_norm": 0.2088674008846283, | |
| "learning_rate": 0.00010947775628626692, | |
| "loss": 0.9935, | |
| "num_input_tokens_seen": 33929488, | |
| "step": 708, | |
| "train_runtime": 4921.7787, | |
| "train_tokens_per_second": 6893.745 | |
| }, | |
| { | |
| "epoch": 0.45580199292831886, | |
| "grad_norm": 0.2125674933195114, | |
| "learning_rate": 0.00010934880722114764, | |
| "loss": 0.918, | |
| "num_input_tokens_seen": 33965600, | |
| "step": 709, | |
| "train_runtime": 4926.8406, | |
| "train_tokens_per_second": 6893.992 | |
| }, | |
| { | |
| "epoch": 0.4564448730311797, | |
| "grad_norm": 0.21705789864063263, | |
| "learning_rate": 0.00010921985815602837, | |
| "loss": 0.9987, | |
| "num_input_tokens_seen": 34018016, | |
| "step": 710, | |
| "train_runtime": 4934.1229, | |
| "train_tokens_per_second": 6894.44 | |
| }, | |
| { | |
| "epoch": 0.4570877531340405, | |
| "grad_norm": 0.22935166954994202, | |
| "learning_rate": 0.00010909090909090909, | |
| "loss": 0.9295, | |
| "num_input_tokens_seen": 34076464, | |
| "step": 711, | |
| "train_runtime": 4942.3293, | |
| "train_tokens_per_second": 6894.819 | |
| }, | |
| { | |
| "epoch": 0.45773063323690133, | |
| "grad_norm": 0.21767853200435638, | |
| "learning_rate": 0.00010896196002578982, | |
| "loss": 0.967, | |
| "num_input_tokens_seen": 34118112, | |
| "step": 712, | |
| "train_runtime": 4948.1513, | |
| "train_tokens_per_second": 6895.123 | |
| }, | |
| { | |
| "epoch": 0.4583735133397621, | |
| "grad_norm": 0.23016303777694702, | |
| "learning_rate": 0.00010883301096067053, | |
| "loss": 0.9883, | |
| "num_input_tokens_seen": 34161248, | |
| "step": 713, | |
| "train_runtime": 4954.2205, | |
| "train_tokens_per_second": 6895.383 | |
| }, | |
| { | |
| "epoch": 0.45901639344262296, | |
| "grad_norm": 0.20562049746513367, | |
| "learning_rate": 0.00010870406189555127, | |
| "loss": 0.9099, | |
| "num_input_tokens_seen": 34220720, | |
| "step": 714, | |
| "train_runtime": 4962.5412, | |
| "train_tokens_per_second": 6895.806 | |
| }, | |
| { | |
| "epoch": 0.45965927354548375, | |
| "grad_norm": 0.22300930321216583, | |
| "learning_rate": 0.00010857511283043198, | |
| "loss": 0.9613, | |
| "num_input_tokens_seen": 34274288, | |
| "step": 715, | |
| "train_runtime": 4970.0724, | |
| "train_tokens_per_second": 6896.135 | |
| }, | |
| { | |
| "epoch": 0.4603021536483446, | |
| "grad_norm": 0.21331855654716492, | |
| "learning_rate": 0.00010844616376531271, | |
| "loss": 0.9472, | |
| "num_input_tokens_seen": 34320880, | |
| "step": 716, | |
| "train_runtime": 4976.636, | |
| "train_tokens_per_second": 6896.402 | |
| }, | |
| { | |
| "epoch": 0.4609450337512054, | |
| "grad_norm": 0.21685561537742615, | |
| "learning_rate": 0.00010831721470019343, | |
| "loss": 1.0051, | |
| "num_input_tokens_seen": 34376192, | |
| "step": 717, | |
| "train_runtime": 4984.3693, | |
| "train_tokens_per_second": 6896.799 | |
| }, | |
| { | |
| "epoch": 0.4615879138540662, | |
| "grad_norm": 0.23412403464317322, | |
| "learning_rate": 0.00010818826563507416, | |
| "loss": 1.0075, | |
| "num_input_tokens_seen": 34430176, | |
| "step": 718, | |
| "train_runtime": 4991.9671, | |
| "train_tokens_per_second": 6897.116 | |
| }, | |
| { | |
| "epoch": 0.462230793956927, | |
| "grad_norm": 0.22776493430137634, | |
| "learning_rate": 0.00010805931656995488, | |
| "loss": 1.0074, | |
| "num_input_tokens_seen": 34486272, | |
| "step": 719, | |
| "train_runtime": 4999.8436, | |
| "train_tokens_per_second": 6897.47 | |
| }, | |
| { | |
| "epoch": 0.46287367405978785, | |
| "grad_norm": 0.21548962593078613, | |
| "learning_rate": 0.00010793036750483561, | |
| "loss": 0.9424, | |
| "num_input_tokens_seen": 34556976, | |
| "step": 720, | |
| "train_runtime": 5009.7319, | |
| "train_tokens_per_second": 6897.969 | |
| }, | |
| { | |
| "epoch": 0.46351655416264864, | |
| "grad_norm": 0.2266944944858551, | |
| "learning_rate": 0.00010780141843971631, | |
| "loss": 1.0024, | |
| "num_input_tokens_seen": 34598672, | |
| "step": 721, | |
| "train_runtime": 5016.1173, | |
| "train_tokens_per_second": 6897.501 | |
| }, | |
| { | |
| "epoch": 0.4641594342655095, | |
| "grad_norm": 0.23636233806610107, | |
| "learning_rate": 0.00010767246937459703, | |
| "loss": 1.0415, | |
| "num_input_tokens_seen": 34637408, | |
| "step": 722, | |
| "train_runtime": 5021.57, | |
| "train_tokens_per_second": 6897.725 | |
| }, | |
| { | |
| "epoch": 0.4648023143683703, | |
| "grad_norm": 0.21734626591205597, | |
| "learning_rate": 0.00010754352030947776, | |
| "loss": 0.9927, | |
| "num_input_tokens_seen": 34677456, | |
| "step": 723, | |
| "train_runtime": 5027.186, | |
| "train_tokens_per_second": 6897.985 | |
| }, | |
| { | |
| "epoch": 0.4654451944712311, | |
| "grad_norm": 0.19954009354114532, | |
| "learning_rate": 0.00010741457124435847, | |
| "loss": 1.0602, | |
| "num_input_tokens_seen": 34722688, | |
| "step": 724, | |
| "train_runtime": 5033.5411, | |
| "train_tokens_per_second": 6898.262 | |
| }, | |
| { | |
| "epoch": 0.46608807457409196, | |
| "grad_norm": 0.2060932070016861, | |
| "learning_rate": 0.00010728562217923921, | |
| "loss": 0.8783, | |
| "num_input_tokens_seen": 34774800, | |
| "step": 725, | |
| "train_runtime": 5040.8584, | |
| "train_tokens_per_second": 6898.587 | |
| }, | |
| { | |
| "epoch": 0.46673095467695275, | |
| "grad_norm": 0.2004295140504837, | |
| "learning_rate": 0.00010715667311411992, | |
| "loss": 0.8934, | |
| "num_input_tokens_seen": 34810768, | |
| "step": 726, | |
| "train_runtime": 5045.9606, | |
| "train_tokens_per_second": 6898.74 | |
| }, | |
| { | |
| "epoch": 0.4673738347798136, | |
| "grad_norm": 0.20946674048900604, | |
| "learning_rate": 0.00010702772404900065, | |
| "loss": 0.827, | |
| "num_input_tokens_seen": 34863024, | |
| "step": 727, | |
| "train_runtime": 5053.2176, | |
| "train_tokens_per_second": 6899.173 | |
| }, | |
| { | |
| "epoch": 0.4680167148826744, | |
| "grad_norm": 0.20330943167209625, | |
| "learning_rate": 0.00010689877498388137, | |
| "loss": 1.0435, | |
| "num_input_tokens_seen": 34902256, | |
| "step": 728, | |
| "train_runtime": 5058.7326, | |
| "train_tokens_per_second": 6899.407 | |
| }, | |
| { | |
| "epoch": 0.4686595949855352, | |
| "grad_norm": 0.21033909916877747, | |
| "learning_rate": 0.0001067698259187621, | |
| "loss": 0.9367, | |
| "num_input_tokens_seen": 34961184, | |
| "step": 729, | |
| "train_runtime": 5067.0185, | |
| "train_tokens_per_second": 6899.755 | |
| }, | |
| { | |
| "epoch": 0.469302475088396, | |
| "grad_norm": 0.21685197949409485, | |
| "learning_rate": 0.00010664087685364282, | |
| "loss": 1.0288, | |
| "num_input_tokens_seen": 35004000, | |
| "step": 730, | |
| "train_runtime": 5073.0146, | |
| "train_tokens_per_second": 6900.039 | |
| }, | |
| { | |
| "epoch": 0.46994535519125685, | |
| "grad_norm": 0.20428651571273804, | |
| "learning_rate": 0.00010651192778852355, | |
| "loss": 0.9739, | |
| "num_input_tokens_seen": 35044128, | |
| "step": 731, | |
| "train_runtime": 5078.6457, | |
| "train_tokens_per_second": 6900.29 | |
| }, | |
| { | |
| "epoch": 0.47058823529411764, | |
| "grad_norm": 0.20795543491840363, | |
| "learning_rate": 0.00010638297872340425, | |
| "loss": 0.9113, | |
| "num_input_tokens_seen": 35076784, | |
| "step": 732, | |
| "train_runtime": 5083.3209, | |
| "train_tokens_per_second": 6900.368 | |
| }, | |
| { | |
| "epoch": 0.4712311153969785, | |
| "grad_norm": 0.2232762724161148, | |
| "learning_rate": 0.00010625402965828499, | |
| "loss": 0.8051, | |
| "num_input_tokens_seen": 35115712, | |
| "step": 733, | |
| "train_runtime": 5088.7741, | |
| "train_tokens_per_second": 6900.623 | |
| }, | |
| { | |
| "epoch": 0.47187399549983927, | |
| "grad_norm": 0.2067340910434723, | |
| "learning_rate": 0.0001061250805931657, | |
| "loss": 0.9404, | |
| "num_input_tokens_seen": 35148368, | |
| "step": 734, | |
| "train_runtime": 5093.3669, | |
| "train_tokens_per_second": 6900.812 | |
| }, | |
| { | |
| "epoch": 0.4725168756027001, | |
| "grad_norm": 0.21283183991909027, | |
| "learning_rate": 0.00010599613152804642, | |
| "loss": 0.9125, | |
| "num_input_tokens_seen": 35185088, | |
| "step": 735, | |
| "train_runtime": 5098.5136, | |
| "train_tokens_per_second": 6901.048 | |
| }, | |
| { | |
| "epoch": 0.4731597557055609, | |
| "grad_norm": 0.22728654742240906, | |
| "learning_rate": 0.00010586718246292715, | |
| "loss": 1.0397, | |
| "num_input_tokens_seen": 35232928, | |
| "step": 736, | |
| "train_runtime": 5105.159, | |
| "train_tokens_per_second": 6901.436 | |
| }, | |
| { | |
| "epoch": 0.47380263580842175, | |
| "grad_norm": 0.22465203702449799, | |
| "learning_rate": 0.00010573823339780786, | |
| "loss": 0.9188, | |
| "num_input_tokens_seen": 35280848, | |
| "step": 737, | |
| "train_runtime": 5111.7911, | |
| "train_tokens_per_second": 6901.856 | |
| }, | |
| { | |
| "epoch": 0.47444551591128253, | |
| "grad_norm": 0.21893534064292908, | |
| "learning_rate": 0.00010560928433268859, | |
| "loss": 1.0128, | |
| "num_input_tokens_seen": 35339920, | |
| "step": 738, | |
| "train_runtime": 5120.1115, | |
| "train_tokens_per_second": 6902.178 | |
| }, | |
| { | |
| "epoch": 0.4750883960141434, | |
| "grad_norm": 0.22276096045970917, | |
| "learning_rate": 0.00010548033526756931, | |
| "loss": 0.9431, | |
| "num_input_tokens_seen": 35388384, | |
| "step": 739, | |
| "train_runtime": 5126.8792, | |
| "train_tokens_per_second": 6902.52 | |
| }, | |
| { | |
| "epoch": 0.47573127611700416, | |
| "grad_norm": 0.21816401183605194, | |
| "learning_rate": 0.00010535138620245004, | |
| "loss": 1.0065, | |
| "num_input_tokens_seen": 35431600, | |
| "step": 740, | |
| "train_runtime": 5132.9116, | |
| "train_tokens_per_second": 6902.827 | |
| }, | |
| { | |
| "epoch": 0.476374156219865, | |
| "grad_norm": 0.2419298142194748, | |
| "learning_rate": 0.00010522243713733076, | |
| "loss": 1.009, | |
| "num_input_tokens_seen": 35486368, | |
| "step": 741, | |
| "train_runtime": 5140.5982, | |
| "train_tokens_per_second": 6903.159 | |
| }, | |
| { | |
| "epoch": 0.4770170363227258, | |
| "grad_norm": 0.2303159534931183, | |
| "learning_rate": 0.00010509348807221149, | |
| "loss": 1.0134, | |
| "num_input_tokens_seen": 35520352, | |
| "step": 742, | |
| "train_runtime": 5145.3929, | |
| "train_tokens_per_second": 6903.331 | |
| }, | |
| { | |
| "epoch": 0.47765991642558664, | |
| "grad_norm": 0.21811984479427338, | |
| "learning_rate": 0.0001049645390070922, | |
| "loss": 0.8346, | |
| "num_input_tokens_seen": 35557856, | |
| "step": 743, | |
| "train_runtime": 5150.6741, | |
| "train_tokens_per_second": 6903.534 | |
| }, | |
| { | |
| "epoch": 0.4783027965284474, | |
| "grad_norm": 0.22950100898742676, | |
| "learning_rate": 0.00010483558994197294, | |
| "loss": 0.9851, | |
| "num_input_tokens_seen": 35603856, | |
| "step": 744, | |
| "train_runtime": 5157.1004, | |
| "train_tokens_per_second": 6903.852 | |
| }, | |
| { | |
| "epoch": 0.47894567663130827, | |
| "grad_norm": 0.22559398412704468, | |
| "learning_rate": 0.00010470664087685364, | |
| "loss": 0.9259, | |
| "num_input_tokens_seen": 35647760, | |
| "step": 745, | |
| "train_runtime": 5163.2802, | |
| "train_tokens_per_second": 6904.092 | |
| }, | |
| { | |
| "epoch": 0.47958855673416906, | |
| "grad_norm": 0.2145167589187622, | |
| "learning_rate": 0.00010457769181173438, | |
| "loss": 0.9911, | |
| "num_input_tokens_seen": 35698448, | |
| "step": 746, | |
| "train_runtime": 5170.3491, | |
| "train_tokens_per_second": 6904.456 | |
| }, | |
| { | |
| "epoch": 0.4802314368370299, | |
| "grad_norm": 0.20136818289756775, | |
| "learning_rate": 0.0001044487427466151, | |
| "loss": 0.8966, | |
| "num_input_tokens_seen": 35744928, | |
| "step": 747, | |
| "train_runtime": 5176.8823, | |
| "train_tokens_per_second": 6904.721 | |
| }, | |
| { | |
| "epoch": 0.4808743169398907, | |
| "grad_norm": 0.2237679660320282, | |
| "learning_rate": 0.0001043197936814958, | |
| "loss": 0.8031, | |
| "num_input_tokens_seen": 35782080, | |
| "step": 748, | |
| "train_runtime": 5182.113, | |
| "train_tokens_per_second": 6904.921 | |
| }, | |
| { | |
| "epoch": 0.48151719704275153, | |
| "grad_norm": 0.22918713092803955, | |
| "learning_rate": 0.00010419084461637654, | |
| "loss": 0.898, | |
| "num_input_tokens_seen": 35823216, | |
| "step": 749, | |
| "train_runtime": 5187.9503, | |
| "train_tokens_per_second": 6905.081 | |
| }, | |
| { | |
| "epoch": 0.4821600771456123, | |
| "grad_norm": 0.21593888103961945, | |
| "learning_rate": 0.00010406189555125725, | |
| "loss": 0.9395, | |
| "num_input_tokens_seen": 35862640, | |
| "step": 750, | |
| "train_runtime": 5193.54, | |
| "train_tokens_per_second": 6905.24 | |
| }, | |
| { | |
| "epoch": 0.48280295724847316, | |
| "grad_norm": 0.24713970720767975, | |
| "learning_rate": 0.00010393294648613798, | |
| "loss": 0.9388, | |
| "num_input_tokens_seen": 35913136, | |
| "step": 751, | |
| "train_runtime": 5201.1565, | |
| "train_tokens_per_second": 6904.837 | |
| }, | |
| { | |
| "epoch": 0.48344583735133395, | |
| "grad_norm": 0.21903486549854279, | |
| "learning_rate": 0.0001038039974210187, | |
| "loss": 1.0879, | |
| "num_input_tokens_seen": 35988592, | |
| "step": 752, | |
| "train_runtime": 5211.7508, | |
| "train_tokens_per_second": 6905.279 | |
| }, | |
| { | |
| "epoch": 0.4840887174541948, | |
| "grad_norm": 0.21665923297405243, | |
| "learning_rate": 0.00010367504835589943, | |
| "loss": 1.2186, | |
| "num_input_tokens_seen": 36034608, | |
| "step": 753, | |
| "train_runtime": 5218.1905, | |
| "train_tokens_per_second": 6905.575 | |
| }, | |
| { | |
| "epoch": 0.4847315975570556, | |
| "grad_norm": 0.23793700337409973, | |
| "learning_rate": 0.00010354609929078013, | |
| "loss": 0.9369, | |
| "num_input_tokens_seen": 36084560, | |
| "step": 754, | |
| "train_runtime": 5225.0719, | |
| "train_tokens_per_second": 6906.041 | |
| }, | |
| { | |
| "epoch": 0.4853744776599164, | |
| "grad_norm": 0.22704121470451355, | |
| "learning_rate": 0.00010341715022566088, | |
| "loss": 1.0209, | |
| "num_input_tokens_seen": 36123968, | |
| "step": 755, | |
| "train_runtime": 5230.5664, | |
| "train_tokens_per_second": 6906.32 | |
| }, | |
| { | |
| "epoch": 0.48601735776277727, | |
| "grad_norm": 0.21854600310325623, | |
| "learning_rate": 0.00010328820116054158, | |
| "loss": 0.9209, | |
| "num_input_tokens_seen": 36160400, | |
| "step": 756, | |
| "train_runtime": 5235.7065, | |
| "train_tokens_per_second": 6906.499 | |
| }, | |
| { | |
| "epoch": 0.48666023786563806, | |
| "grad_norm": 0.21820661425590515, | |
| "learning_rate": 0.00010315925209542232, | |
| "loss": 0.8536, | |
| "num_input_tokens_seen": 36201760, | |
| "step": 757, | |
| "train_runtime": 5241.4811, | |
| "train_tokens_per_second": 6906.781 | |
| }, | |
| { | |
| "epoch": 0.4873031179684989, | |
| "grad_norm": 0.2267056107521057, | |
| "learning_rate": 0.00010303030303030303, | |
| "loss": 1.039, | |
| "num_input_tokens_seen": 36241792, | |
| "step": 758, | |
| "train_runtime": 5247.1175, | |
| "train_tokens_per_second": 6906.991 | |
| }, | |
| { | |
| "epoch": 0.4879459980713597, | |
| "grad_norm": 0.21134983003139496, | |
| "learning_rate": 0.00010290135396518377, | |
| "loss": 0.9895, | |
| "num_input_tokens_seen": 36283280, | |
| "step": 759, | |
| "train_runtime": 5252.9079, | |
| "train_tokens_per_second": 6907.275 | |
| }, | |
| { | |
| "epoch": 0.48858887817422053, | |
| "grad_norm": 0.2200525552034378, | |
| "learning_rate": 0.00010277240490006448, | |
| "loss": 1.0206, | |
| "num_input_tokens_seen": 36322064, | |
| "step": 760, | |
| "train_runtime": 5258.4012, | |
| "train_tokens_per_second": 6907.435 | |
| }, | |
| { | |
| "epoch": 0.4892317582770813, | |
| "grad_norm": 0.2264779657125473, | |
| "learning_rate": 0.00010264345583494522, | |
| "loss": 0.9971, | |
| "num_input_tokens_seen": 36358512, | |
| "step": 761, | |
| "train_runtime": 5263.5554, | |
| "train_tokens_per_second": 6907.596 | |
| }, | |
| { | |
| "epoch": 0.48987463837994216, | |
| "grad_norm": 0.20705893635749817, | |
| "learning_rate": 0.00010251450676982592, | |
| "loss": 0.8841, | |
| "num_input_tokens_seen": 36395296, | |
| "step": 762, | |
| "train_runtime": 5268.7278, | |
| "train_tokens_per_second": 6907.796 | |
| }, | |
| { | |
| "epoch": 0.49051751848280295, | |
| "grad_norm": 0.21519790589809418, | |
| "learning_rate": 0.00010238555770470664, | |
| "loss": 0.8807, | |
| "num_input_tokens_seen": 36449152, | |
| "step": 763, | |
| "train_runtime": 5276.297, | |
| "train_tokens_per_second": 6908.093 | |
| }, | |
| { | |
| "epoch": 0.4911603985856638, | |
| "grad_norm": 0.19477756321430206, | |
| "learning_rate": 0.00010225660863958737, | |
| "loss": 1.0622, | |
| "num_input_tokens_seen": 36529264, | |
| "step": 764, | |
| "train_runtime": 5287.6156, | |
| "train_tokens_per_second": 6908.457 | |
| }, | |
| { | |
| "epoch": 0.4918032786885246, | |
| "grad_norm": 0.22233176231384277, | |
| "learning_rate": 0.00010212765957446809, | |
| "loss": 1.0275, | |
| "num_input_tokens_seen": 36579232, | |
| "step": 765, | |
| "train_runtime": 5294.6526, | |
| "train_tokens_per_second": 6908.712 | |
| }, | |
| { | |
| "epoch": 0.4924461587913854, | |
| "grad_norm": 0.20059292018413544, | |
| "learning_rate": 0.00010199871050934882, | |
| "loss": 0.9885, | |
| "num_input_tokens_seen": 36654368, | |
| "step": 766, | |
| "train_runtime": 5305.214, | |
| "train_tokens_per_second": 6909.121 | |
| }, | |
| { | |
| "epoch": 0.4930890388942462, | |
| "grad_norm": 0.2213578075170517, | |
| "learning_rate": 0.00010186976144422952, | |
| "loss": 1.066, | |
| "num_input_tokens_seen": 36694352, | |
| "step": 767, | |
| "train_runtime": 5310.8501, | |
| "train_tokens_per_second": 6909.318 | |
| }, | |
| { | |
| "epoch": 0.49373191899710706, | |
| "grad_norm": 0.21473011374473572, | |
| "learning_rate": 0.00010174081237911026, | |
| "loss": 1.0383, | |
| "num_input_tokens_seen": 36753792, | |
| "step": 768, | |
| "train_runtime": 5319.2558, | |
| "train_tokens_per_second": 6909.574 | |
| }, | |
| { | |
| "epoch": 0.49437479909996784, | |
| "grad_norm": 0.22463928163051605, | |
| "learning_rate": 0.00010161186331399097, | |
| "loss": 0.9858, | |
| "num_input_tokens_seen": 36822496, | |
| "step": 769, | |
| "train_runtime": 5328.9486, | |
| "train_tokens_per_second": 6909.899 | |
| }, | |
| { | |
| "epoch": 0.4950176792028287, | |
| "grad_norm": 0.2096138745546341, | |
| "learning_rate": 0.0001014829142488717, | |
| "loss": 0.856, | |
| "num_input_tokens_seen": 36871792, | |
| "step": 770, | |
| "train_runtime": 5335.831, | |
| "train_tokens_per_second": 6910.225 | |
| }, | |
| { | |
| "epoch": 0.4956605593056895, | |
| "grad_norm": 0.2219269871711731, | |
| "learning_rate": 0.00010135396518375242, | |
| "loss": 0.8585, | |
| "num_input_tokens_seen": 36914608, | |
| "step": 771, | |
| "train_runtime": 5341.8262, | |
| "train_tokens_per_second": 6910.485 | |
| }, | |
| { | |
| "epoch": 0.4963034394085503, | |
| "grad_norm": 0.19027844071388245, | |
| "learning_rate": 0.00010122501611863316, | |
| "loss": 0.9252, | |
| "num_input_tokens_seen": 36966544, | |
| "step": 772, | |
| "train_runtime": 5349.0613, | |
| "train_tokens_per_second": 6910.847 | |
| }, | |
| { | |
| "epoch": 0.4969463195114111, | |
| "grad_norm": 0.23160985112190247, | |
| "learning_rate": 0.00010109606705351386, | |
| "loss": 1.0037, | |
| "num_input_tokens_seen": 37004928, | |
| "step": 773, | |
| "train_runtime": 5354.4843, | |
| "train_tokens_per_second": 6911.016 | |
| }, | |
| { | |
| "epoch": 0.49758919961427195, | |
| "grad_norm": 0.2228197604417801, | |
| "learning_rate": 0.0001009671179883946, | |
| "loss": 0.9763, | |
| "num_input_tokens_seen": 37045872, | |
| "step": 774, | |
| "train_runtime": 5360.271, | |
| "train_tokens_per_second": 6911.194 | |
| }, | |
| { | |
| "epoch": 0.49823207971713274, | |
| "grad_norm": 0.2354273945093155, | |
| "learning_rate": 0.00010083816892327531, | |
| "loss": 1.0797, | |
| "num_input_tokens_seen": 37115744, | |
| "step": 775, | |
| "train_runtime": 5370.0681, | |
| "train_tokens_per_second": 6911.596 | |
| }, | |
| { | |
| "epoch": 0.4988749598199936, | |
| "grad_norm": 0.22572071850299835, | |
| "learning_rate": 0.00010070921985815603, | |
| "loss": 0.9801, | |
| "num_input_tokens_seen": 37167536, | |
| "step": 776, | |
| "train_runtime": 5377.3506, | |
| "train_tokens_per_second": 6911.868 | |
| }, | |
| { | |
| "epoch": 0.49951783992285437, | |
| "grad_norm": 0.22266492247581482, | |
| "learning_rate": 0.00010058027079303676, | |
| "loss": 1.0543, | |
| "num_input_tokens_seen": 37222160, | |
| "step": 777, | |
| "train_runtime": 5385.0841, | |
| "train_tokens_per_second": 6912.085 | |
| }, | |
| { | |
| "epoch": 0.5001607200257152, | |
| "grad_norm": 0.21932601928710938, | |
| "learning_rate": 0.00010045132172791746, | |
| "loss": 0.9456, | |
| "num_input_tokens_seen": 37267312, | |
| "step": 778, | |
| "train_runtime": 5391.4001, | |
| "train_tokens_per_second": 6912.363 | |
| }, | |
| { | |
| "epoch": 0.500803600128576, | |
| "grad_norm": 0.22067613899707794, | |
| "learning_rate": 0.00010032237266279821, | |
| "loss": 0.979, | |
| "num_input_tokens_seen": 37312176, | |
| "step": 779, | |
| "train_runtime": 5397.7267, | |
| "train_tokens_per_second": 6912.572 | |
| }, | |
| { | |
| "epoch": 0.5014464802314368, | |
| "grad_norm": 0.22810345888137817, | |
| "learning_rate": 0.00010019342359767891, | |
| "loss": 1.0039, | |
| "num_input_tokens_seen": 37372080, | |
| "step": 780, | |
| "train_runtime": 5406.202, | |
| "train_tokens_per_second": 6912.816 | |
| }, | |
| { | |
| "epoch": 0.5014464802314368, | |
| "eval_loss": 1.0119534730911255, | |
| "eval_runtime": 40.1144, | |
| "eval_samples_per_second": 24.779, | |
| "eval_steps_per_second": 1.571, | |
| "num_input_tokens_seen": 37372080, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.5020893603342976, | |
| "grad_norm": 0.2170599102973938, | |
| "learning_rate": 0.00010006447453255965, | |
| "loss": 0.9351, | |
| "num_input_tokens_seen": 37405264, | |
| "step": 781, | |
| "train_runtime": 5451.6653, | |
| "train_tokens_per_second": 6861.255 | |
| }, | |
| { | |
| "epoch": 0.5027322404371585, | |
| "grad_norm": 0.21231862902641296, | |
| "learning_rate": 9.993552546744036e-05, | |
| "loss": 0.9615, | |
| "num_input_tokens_seen": 37447872, | |
| "step": 782, | |
| "train_runtime": 5457.6793, | |
| "train_tokens_per_second": 6861.501 | |
| }, | |
| { | |
| "epoch": 0.5033751205400193, | |
| "grad_norm": 0.2113790363073349, | |
| "learning_rate": 9.980657640232108e-05, | |
| "loss": 1.0439, | |
| "num_input_tokens_seen": 37488944, | |
| "step": 783, | |
| "train_runtime": 5463.5208, | |
| "train_tokens_per_second": 6861.682 | |
| }, | |
| { | |
| "epoch": 0.50401800064288, | |
| "grad_norm": 0.2181268185377121, | |
| "learning_rate": 9.96776273372018e-05, | |
| "loss": 1.0294, | |
| "num_input_tokens_seen": 37556592, | |
| "step": 784, | |
| "train_runtime": 5473.0127, | |
| "train_tokens_per_second": 6862.142 | |
| }, | |
| { | |
| "epoch": 0.5046608807457409, | |
| "grad_norm": 0.2144027054309845, | |
| "learning_rate": 9.954867827208253e-05, | |
| "loss": 0.9804, | |
| "num_input_tokens_seen": 37592480, | |
| "step": 785, | |
| "train_runtime": 5478.0658, | |
| "train_tokens_per_second": 6862.364 | |
| }, | |
| { | |
| "epoch": 0.5053037608486017, | |
| "grad_norm": 0.2277204841375351, | |
| "learning_rate": 9.941972920696325e-05, | |
| "loss": 1.0026, | |
| "num_input_tokens_seen": 37631008, | |
| "step": 786, | |
| "train_runtime": 5483.4784, | |
| "train_tokens_per_second": 6862.616 | |
| }, | |
| { | |
| "epoch": 0.5059466409514626, | |
| "grad_norm": 0.2240583598613739, | |
| "learning_rate": 9.929078014184398e-05, | |
| "loss": 0.9938, | |
| "num_input_tokens_seen": 37670928, | |
| "step": 787, | |
| "train_runtime": 5489.1164, | |
| "train_tokens_per_second": 6862.84 | |
| }, | |
| { | |
| "epoch": 0.5065895210543234, | |
| "grad_norm": 0.2214142084121704, | |
| "learning_rate": 9.91618310767247e-05, | |
| "loss": 0.9126, | |
| "num_input_tokens_seen": 37706112, | |
| "step": 788, | |
| "train_runtime": 5494.179, | |
| "train_tokens_per_second": 6862.92 | |
| }, | |
| { | |
| "epoch": 0.5072324011571842, | |
| "grad_norm": 0.27018073201179504, | |
| "learning_rate": 9.903288201160542e-05, | |
| "loss": 1.1332, | |
| "num_input_tokens_seen": 37774016, | |
| "step": 789, | |
| "train_runtime": 5503.7935, | |
| "train_tokens_per_second": 6863.269 | |
| }, | |
| { | |
| "epoch": 0.507875281260045, | |
| "grad_norm": 0.2212986946105957, | |
| "learning_rate": 9.890393294648615e-05, | |
| "loss": 1.0088, | |
| "num_input_tokens_seen": 37829152, | |
| "step": 790, | |
| "train_runtime": 5511.5653, | |
| "train_tokens_per_second": 6863.595 | |
| }, | |
| { | |
| "epoch": 0.5085181613629058, | |
| "grad_norm": 0.2240961641073227, | |
| "learning_rate": 9.877498388136687e-05, | |
| "loss": 1.0432, | |
| "num_input_tokens_seen": 37897120, | |
| "step": 791, | |
| "train_runtime": 5521.1096, | |
| "train_tokens_per_second": 6864.04 | |
| }, | |
| { | |
| "epoch": 0.5091610414657667, | |
| "grad_norm": 0.22257636487483978, | |
| "learning_rate": 9.864603481624759e-05, | |
| "loss": 0.8842, | |
| "num_input_tokens_seen": 37958560, | |
| "step": 792, | |
| "train_runtime": 5529.7519, | |
| "train_tokens_per_second": 6864.424 | |
| }, | |
| { | |
| "epoch": 0.5098039215686274, | |
| "grad_norm": 0.22161521017551422, | |
| "learning_rate": 9.851708575112832e-05, | |
| "loss": 0.9624, | |
| "num_input_tokens_seen": 37996224, | |
| "step": 793, | |
| "train_runtime": 5535.1111, | |
| "train_tokens_per_second": 6864.582 | |
| }, | |
| { | |
| "epoch": 0.5104468016714883, | |
| "grad_norm": 0.22766484320163727, | |
| "learning_rate": 9.838813668600904e-05, | |
| "loss": 1.0029, | |
| "num_input_tokens_seen": 38037360, | |
| "step": 794, | |
| "train_runtime": 5540.9151, | |
| "train_tokens_per_second": 6864.816 | |
| }, | |
| { | |
| "epoch": 0.5110896817743491, | |
| "grad_norm": 0.20991362631320953, | |
| "learning_rate": 9.825918762088975e-05, | |
| "loss": 0.985, | |
| "num_input_tokens_seen": 38071184, | |
| "step": 795, | |
| "train_runtime": 5545.7174, | |
| "train_tokens_per_second": 6864.97 | |
| }, | |
| { | |
| "epoch": 0.51173256187721, | |
| "grad_norm": 0.20548021793365479, | |
| "learning_rate": 9.813023855577047e-05, | |
| "loss": 0.9304, | |
| "num_input_tokens_seen": 38114448, | |
| "step": 796, | |
| "train_runtime": 5551.8401, | |
| "train_tokens_per_second": 6865.192 | |
| }, | |
| { | |
| "epoch": 0.5123754419800707, | |
| "grad_norm": 0.21104614436626434, | |
| "learning_rate": 9.800128949065119e-05, | |
| "loss": 0.9289, | |
| "num_input_tokens_seen": 38169520, | |
| "step": 797, | |
| "train_runtime": 5559.6111, | |
| "train_tokens_per_second": 6865.502 | |
| }, | |
| { | |
| "epoch": 0.5130183220829315, | |
| "grad_norm": 0.261750191450119, | |
| "learning_rate": 9.787234042553192e-05, | |
| "loss": 1.0508, | |
| "num_input_tokens_seen": 38217456, | |
| "step": 798, | |
| "train_runtime": 5566.3756, | |
| "train_tokens_per_second": 6865.77 | |
| }, | |
| { | |
| "epoch": 0.5136612021857924, | |
| "grad_norm": 0.21956448256969452, | |
| "learning_rate": 9.774339136041264e-05, | |
| "loss": 1.0698, | |
| "num_input_tokens_seen": 38264448, | |
| "step": 799, | |
| "train_runtime": 5572.9589, | |
| "train_tokens_per_second": 6866.092 | |
| }, | |
| { | |
| "epoch": 0.5143040822886532, | |
| "grad_norm": 0.21060562133789062, | |
| "learning_rate": 9.761444229529336e-05, | |
| "loss": 0.9054, | |
| "num_input_tokens_seen": 38323808, | |
| "step": 800, | |
| "train_runtime": 5581.3308, | |
| "train_tokens_per_second": 6866.428 | |
| }, | |
| { | |
| "epoch": 0.5149469623915139, | |
| "grad_norm": 0.21071135997772217, | |
| "learning_rate": 9.748549323017409e-05, | |
| "loss": 0.8784, | |
| "num_input_tokens_seen": 38387104, | |
| "step": 801, | |
| "train_runtime": 5590.2262, | |
| "train_tokens_per_second": 6866.825 | |
| }, | |
| { | |
| "epoch": 0.5155898424943748, | |
| "grad_norm": 0.21163177490234375, | |
| "learning_rate": 9.735654416505481e-05, | |
| "loss": 0.9145, | |
| "num_input_tokens_seen": 38431408, | |
| "step": 802, | |
| "train_runtime": 5596.5181, | |
| "train_tokens_per_second": 6867.021 | |
| }, | |
| { | |
| "epoch": 0.5162327225972356, | |
| "grad_norm": 0.22283923625946045, | |
| "learning_rate": 9.722759509993553e-05, | |
| "loss": 0.958, | |
| "num_input_tokens_seen": 38494624, | |
| "step": 803, | |
| "train_runtime": 5605.4124, | |
| "train_tokens_per_second": 6867.403 | |
| }, | |
| { | |
| "epoch": 0.5168756027000965, | |
| "grad_norm": 0.22431445121765137, | |
| "learning_rate": 9.709864603481626e-05, | |
| "loss": 1.0125, | |
| "num_input_tokens_seen": 38539232, | |
| "step": 804, | |
| "train_runtime": 5611.6718, | |
| "train_tokens_per_second": 6867.692 | |
| }, | |
| { | |
| "epoch": 0.5175184828029572, | |
| "grad_norm": 0.23587460815906525, | |
| "learning_rate": 9.696969696969698e-05, | |
| "loss": 1.0458, | |
| "num_input_tokens_seen": 38576064, | |
| "step": 805, | |
| "train_runtime": 5616.914, | |
| "train_tokens_per_second": 6867.84 | |
| }, | |
| { | |
| "epoch": 0.518161362905818, | |
| "grad_norm": 0.207449272274971, | |
| "learning_rate": 9.68407479045777e-05, | |
| "loss": 1.0524, | |
| "num_input_tokens_seen": 38632640, | |
| "step": 806, | |
| "train_runtime": 5624.8634, | |
| "train_tokens_per_second": 6868.192 | |
| }, | |
| { | |
| "epoch": 0.5188042430086789, | |
| "grad_norm": 0.21176041662693024, | |
| "learning_rate": 9.671179883945843e-05, | |
| "loss": 0.9592, | |
| "num_input_tokens_seen": 38682864, | |
| "step": 807, | |
| "train_runtime": 5631.9549, | |
| "train_tokens_per_second": 6868.461 | |
| }, | |
| { | |
| "epoch": 0.5194471231115397, | |
| "grad_norm": 0.21222098171710968, | |
| "learning_rate": 9.658284977433914e-05, | |
| "loss": 0.9656, | |
| "num_input_tokens_seen": 38726928, | |
| "step": 808, | |
| "train_runtime": 5638.1731, | |
| "train_tokens_per_second": 6868.701 | |
| }, | |
| { | |
| "epoch": 0.5200900032144005, | |
| "grad_norm": 0.2217748910188675, | |
| "learning_rate": 9.645390070921986e-05, | |
| "loss": 1.1452, | |
| "num_input_tokens_seen": 38768208, | |
| "step": 809, | |
| "train_runtime": 5643.9671, | |
| "train_tokens_per_second": 6868.964 | |
| }, | |
| { | |
| "epoch": 0.5207328833172613, | |
| "grad_norm": 0.2218509018421173, | |
| "learning_rate": 9.632495164410058e-05, | |
| "loss": 1.0318, | |
| "num_input_tokens_seen": 38814848, | |
| "step": 810, | |
| "train_runtime": 5650.5568, | |
| "train_tokens_per_second": 6869.208 | |
| }, | |
| { | |
| "epoch": 0.5213757634201222, | |
| "grad_norm": 0.21409547328948975, | |
| "learning_rate": 9.61960025789813e-05, | |
| "loss": 1.0752, | |
| "num_input_tokens_seen": 38852192, | |
| "step": 811, | |
| "train_runtime": 5656.3876, | |
| "train_tokens_per_second": 6868.729 | |
| }, | |
| { | |
| "epoch": 0.522018643522983, | |
| "grad_norm": 0.2177419811487198, | |
| "learning_rate": 9.606705351386203e-05, | |
| "loss": 0.9027, | |
| "num_input_tokens_seen": 38899840, | |
| "step": 812, | |
| "train_runtime": 5663.0105, | |
| "train_tokens_per_second": 6869.11 | |
| }, | |
| { | |
| "epoch": 0.5226615236258437, | |
| "grad_norm": 0.20673255622386932, | |
| "learning_rate": 9.593810444874275e-05, | |
| "loss": 0.9976, | |
| "num_input_tokens_seen": 38941680, | |
| "step": 813, | |
| "train_runtime": 5668.9566, | |
| "train_tokens_per_second": 6869.285 | |
| }, | |
| { | |
| "epoch": 0.5233044037287046, | |
| "grad_norm": 0.22064630687236786, | |
| "learning_rate": 9.580915538362347e-05, | |
| "loss": 1.053, | |
| "num_input_tokens_seen": 38995920, | |
| "step": 814, | |
| "train_runtime": 5676.6459, | |
| "train_tokens_per_second": 6869.535 | |
| }, | |
| { | |
| "epoch": 0.5239472838315654, | |
| "grad_norm": 0.19912369549274445, | |
| "learning_rate": 9.56802063185042e-05, | |
| "loss": 0.9567, | |
| "num_input_tokens_seen": 39033728, | |
| "step": 815, | |
| "train_runtime": 5681.9727, | |
| "train_tokens_per_second": 6869.749 | |
| }, | |
| { | |
| "epoch": 0.5245901639344263, | |
| "grad_norm": 0.2328333854675293, | |
| "learning_rate": 9.555125725338492e-05, | |
| "loss": 0.9518, | |
| "num_input_tokens_seen": 39066896, | |
| "step": 816, | |
| "train_runtime": 5686.6796, | |
| "train_tokens_per_second": 6869.896 | |
| }, | |
| { | |
| "epoch": 0.5252330440372871, | |
| "grad_norm": 0.2665647268295288, | |
| "learning_rate": 9.542230818826565e-05, | |
| "loss": 0.9155, | |
| "num_input_tokens_seen": 39112144, | |
| "step": 817, | |
| "train_runtime": 5693.0716, | |
| "train_tokens_per_second": 6870.13 | |
| }, | |
| { | |
| "epoch": 0.5258759241401478, | |
| "grad_norm": 0.21602346003055573, | |
| "learning_rate": 9.529335912314637e-05, | |
| "loss": 0.9097, | |
| "num_input_tokens_seen": 39169712, | |
| "step": 818, | |
| "train_runtime": 5701.2268, | |
| "train_tokens_per_second": 6870.401 | |
| }, | |
| { | |
| "epoch": 0.5265188042430087, | |
| "grad_norm": 0.21335062384605408, | |
| "learning_rate": 9.516441005802708e-05, | |
| "loss": 0.9175, | |
| "num_input_tokens_seen": 39226352, | |
| "step": 819, | |
| "train_runtime": 5709.206, | |
| "train_tokens_per_second": 6870.719 | |
| }, | |
| { | |
| "epoch": 0.5271616843458695, | |
| "grad_norm": 0.21426311135292053, | |
| "learning_rate": 9.503546099290782e-05, | |
| "loss": 1.0489, | |
| "num_input_tokens_seen": 39276496, | |
| "step": 820, | |
| "train_runtime": 5716.279, | |
| "train_tokens_per_second": 6870.99 | |
| }, | |
| { | |
| "epoch": 0.5278045644487304, | |
| "grad_norm": 0.22840139269828796, | |
| "learning_rate": 9.490651192778853e-05, | |
| "loss": 0.9286, | |
| "num_input_tokens_seen": 39316784, | |
| "step": 821, | |
| "train_runtime": 5721.9319, | |
| "train_tokens_per_second": 6871.243 | |
| }, | |
| { | |
| "epoch": 0.5284474445515911, | |
| "grad_norm": 0.22848589718341827, | |
| "learning_rate": 9.477756286266924e-05, | |
| "loss": 0.9535, | |
| "num_input_tokens_seen": 39354496, | |
| "step": 822, | |
| "train_runtime": 5727.2483, | |
| "train_tokens_per_second": 6871.449 | |
| }, | |
| { | |
| "epoch": 0.5290903246544519, | |
| "grad_norm": 0.21826131641864777, | |
| "learning_rate": 9.464861379754997e-05, | |
| "loss": 1.0541, | |
| "num_input_tokens_seen": 39409184, | |
| "step": 823, | |
| "train_runtime": 5734.924, | |
| "train_tokens_per_second": 6871.788 | |
| }, | |
| { | |
| "epoch": 0.5297332047573128, | |
| "grad_norm": 0.21087752282619476, | |
| "learning_rate": 9.451966473243069e-05, | |
| "loss": 1.0101, | |
| "num_input_tokens_seen": 39446544, | |
| "step": 824, | |
| "train_runtime": 5740.2346, | |
| "train_tokens_per_second": 6871.939 | |
| }, | |
| { | |
| "epoch": 0.5303760848601736, | |
| "grad_norm": 0.2084406465291977, | |
| "learning_rate": 9.439071566731142e-05, | |
| "loss": 0.8512, | |
| "num_input_tokens_seen": 39491200, | |
| "step": 825, | |
| "train_runtime": 5746.5125, | |
| "train_tokens_per_second": 6872.203 | |
| }, | |
| { | |
| "epoch": 0.5310189649630344, | |
| "grad_norm": 0.21428586542606354, | |
| "learning_rate": 9.426176660219214e-05, | |
| "loss": 0.9252, | |
| "num_input_tokens_seen": 39526512, | |
| "step": 826, | |
| "train_runtime": 5751.5278, | |
| "train_tokens_per_second": 6872.35 | |
| }, | |
| { | |
| "epoch": 0.5316618450658952, | |
| "grad_norm": 0.21495121717453003, | |
| "learning_rate": 9.413281753707286e-05, | |
| "loss": 0.9177, | |
| "num_input_tokens_seen": 39582784, | |
| "step": 827, | |
| "train_runtime": 5759.4735, | |
| "train_tokens_per_second": 6872.639 | |
| }, | |
| { | |
| "epoch": 0.532304725168756, | |
| "grad_norm": 0.23897185921669006, | |
| "learning_rate": 9.400386847195359e-05, | |
| "loss": 0.9302, | |
| "num_input_tokens_seen": 39632240, | |
| "step": 828, | |
| "train_runtime": 5766.4408, | |
| "train_tokens_per_second": 6872.912 | |
| }, | |
| { | |
| "epoch": 0.5329476052716169, | |
| "grad_norm": 0.21306166052818298, | |
| "learning_rate": 9.38749194068343e-05, | |
| "loss": 0.9407, | |
| "num_input_tokens_seen": 39679152, | |
| "step": 829, | |
| "train_runtime": 5773.0632, | |
| "train_tokens_per_second": 6873.154 | |
| }, | |
| { | |
| "epoch": 0.5335904853744776, | |
| "grad_norm": 0.24286721646785736, | |
| "learning_rate": 9.374597034171502e-05, | |
| "loss": 0.87, | |
| "num_input_tokens_seen": 39729280, | |
| "step": 830, | |
| "train_runtime": 5780.0687, | |
| "train_tokens_per_second": 6873.496 | |
| }, | |
| { | |
| "epoch": 0.5342333654773385, | |
| "grad_norm": 0.21733801066875458, | |
| "learning_rate": 9.361702127659576e-05, | |
| "loss": 1.0095, | |
| "num_input_tokens_seen": 39769760, | |
| "step": 831, | |
| "train_runtime": 5785.7904, | |
| "train_tokens_per_second": 6873.695 | |
| }, | |
| { | |
| "epoch": 0.5348762455801993, | |
| "grad_norm": 0.19941464066505432, | |
| "learning_rate": 9.348807221147647e-05, | |
| "loss": 0.8936, | |
| "num_input_tokens_seen": 39811328, | |
| "step": 832, | |
| "train_runtime": 5791.6483, | |
| "train_tokens_per_second": 6873.92 | |
| }, | |
| { | |
| "epoch": 0.5355191256830601, | |
| "grad_norm": 0.22359183430671692, | |
| "learning_rate": 9.335912314635719e-05, | |
| "loss": 1.0963, | |
| "num_input_tokens_seen": 39847168, | |
| "step": 833, | |
| "train_runtime": 5796.7331, | |
| "train_tokens_per_second": 6874.073 | |
| }, | |
| { | |
| "epoch": 0.5361620057859209, | |
| "grad_norm": 0.23717975616455078, | |
| "learning_rate": 9.323017408123792e-05, | |
| "loss": 0.9002, | |
| "num_input_tokens_seen": 39909168, | |
| "step": 834, | |
| "train_runtime": 5805.3823, | |
| "train_tokens_per_second": 6874.512 | |
| }, | |
| { | |
| "epoch": 0.5368048858887817, | |
| "grad_norm": 0.21464844048023224, | |
| "learning_rate": 9.310122501611864e-05, | |
| "loss": 0.9609, | |
| "num_input_tokens_seen": 39953264, | |
| "step": 835, | |
| "train_runtime": 5811.6133, | |
| "train_tokens_per_second": 6874.729 | |
| }, | |
| { | |
| "epoch": 0.5374477659916426, | |
| "grad_norm": 0.20704124867916107, | |
| "learning_rate": 9.297227595099936e-05, | |
| "loss": 0.9292, | |
| "num_input_tokens_seen": 40025024, | |
| "step": 836, | |
| "train_runtime": 5821.7066, | |
| "train_tokens_per_second": 6875.136 | |
| }, | |
| { | |
| "epoch": 0.5380906460945034, | |
| "grad_norm": 0.2311316728591919, | |
| "learning_rate": 9.284332688588008e-05, | |
| "loss": 1.0163, | |
| "num_input_tokens_seen": 40068128, | |
| "step": 837, | |
| "train_runtime": 5827.7726, | |
| "train_tokens_per_second": 6875.376 | |
| }, | |
| { | |
| "epoch": 0.5387335261973641, | |
| "grad_norm": 0.20525947213172913, | |
| "learning_rate": 9.27143778207608e-05, | |
| "loss": 0.8296, | |
| "num_input_tokens_seen": 40106032, | |
| "step": 838, | |
| "train_runtime": 5833.108, | |
| "train_tokens_per_second": 6875.585 | |
| }, | |
| { | |
| "epoch": 0.539376406300225, | |
| "grad_norm": 0.22608095407485962, | |
| "learning_rate": 9.258542875564153e-05, | |
| "loss": 0.9444, | |
| "num_input_tokens_seen": 40150368, | |
| "step": 839, | |
| "train_runtime": 5839.3826, | |
| "train_tokens_per_second": 6875.79 | |
| }, | |
| { | |
| "epoch": 0.5400192864030858, | |
| "grad_norm": 0.21035784482955933, | |
| "learning_rate": 9.245647969052225e-05, | |
| "loss": 0.9388, | |
| "num_input_tokens_seen": 40202592, | |
| "step": 840, | |
| "train_runtime": 5846.7137, | |
| "train_tokens_per_second": 6876.101 | |
| }, | |
| { | |
| "epoch": 0.5406621665059467, | |
| "grad_norm": 0.2148246020078659, | |
| "learning_rate": 9.232753062540296e-05, | |
| "loss": 0.9992, | |
| "num_input_tokens_seen": 40260592, | |
| "step": 841, | |
| "train_runtime": 5855.3499, | |
| "train_tokens_per_second": 6875.864 | |
| }, | |
| { | |
| "epoch": 0.5413050466088074, | |
| "grad_norm": 0.20591579377651215, | |
| "learning_rate": 9.21985815602837e-05, | |
| "loss": 1.0278, | |
| "num_input_tokens_seen": 40296272, | |
| "step": 842, | |
| "train_runtime": 5860.3641, | |
| "train_tokens_per_second": 6876.07 | |
| }, | |
| { | |
| "epoch": 0.5419479267116682, | |
| "grad_norm": 0.19806860387325287, | |
| "learning_rate": 9.206963249516441e-05, | |
| "loss": 0.941, | |
| "num_input_tokens_seen": 40331984, | |
| "step": 843, | |
| "train_runtime": 5865.4433, | |
| "train_tokens_per_second": 6876.204 | |
| }, | |
| { | |
| "epoch": 0.5425908068145291, | |
| "grad_norm": 0.2135857492685318, | |
| "learning_rate": 9.194068343004513e-05, | |
| "loss": 0.9578, | |
| "num_input_tokens_seen": 40367648, | |
| "step": 844, | |
| "train_runtime": 5870.5212, | |
| "train_tokens_per_second": 6876.331 | |
| }, | |
| { | |
| "epoch": 0.5432336869173899, | |
| "grad_norm": 0.20810310542583466, | |
| "learning_rate": 9.181173436492586e-05, | |
| "loss": 0.9486, | |
| "num_input_tokens_seen": 40428800, | |
| "step": 845, | |
| "train_runtime": 5879.0687, | |
| "train_tokens_per_second": 6876.735 | |
| }, | |
| { | |
| "epoch": 0.5438765670202508, | |
| "grad_norm": 0.2066211998462677, | |
| "learning_rate": 9.168278529980658e-05, | |
| "loss": 0.9881, | |
| "num_input_tokens_seen": 40481600, | |
| "step": 846, | |
| "train_runtime": 5886.4452, | |
| "train_tokens_per_second": 6877.088 | |
| }, | |
| { | |
| "epoch": 0.5445194471231115, | |
| "grad_norm": 0.22638893127441406, | |
| "learning_rate": 9.155383623468731e-05, | |
| "loss": 1.0343, | |
| "num_input_tokens_seen": 40518064, | |
| "step": 847, | |
| "train_runtime": 5891.6303, | |
| "train_tokens_per_second": 6877.224 | |
| }, | |
| { | |
| "epoch": 0.5451623272259724, | |
| "grad_norm": 0.2309054434299469, | |
| "learning_rate": 9.142488716956803e-05, | |
| "loss": 0.8937, | |
| "num_input_tokens_seen": 40580432, | |
| "step": 848, | |
| "train_runtime": 5900.405, | |
| "train_tokens_per_second": 6877.567 | |
| }, | |
| { | |
| "epoch": 0.5458052073288332, | |
| "grad_norm": 0.21096345782279968, | |
| "learning_rate": 9.129593810444874e-05, | |
| "loss": 0.9058, | |
| "num_input_tokens_seen": 40636384, | |
| "step": 849, | |
| "train_runtime": 5908.2116, | |
| "train_tokens_per_second": 6877.95 | |
| }, | |
| { | |
| "epoch": 0.546448087431694, | |
| "grad_norm": 0.23349037766456604, | |
| "learning_rate": 9.116698903932947e-05, | |
| "loss": 1.0517, | |
| "num_input_tokens_seen": 40700768, | |
| "step": 850, | |
| "train_runtime": 5917.2501, | |
| "train_tokens_per_second": 6878.325 | |
| }, | |
| { | |
| "epoch": 0.5470909675345548, | |
| "grad_norm": 0.24514555931091309, | |
| "learning_rate": 9.103803997421019e-05, | |
| "loss": 0.9398, | |
| "num_input_tokens_seen": 40762272, | |
| "step": 851, | |
| "train_runtime": 5925.9076, | |
| "train_tokens_per_second": 6878.655 | |
| }, | |
| { | |
| "epoch": 0.5477338476374156, | |
| "grad_norm": 0.2217293083667755, | |
| "learning_rate": 9.090909090909092e-05, | |
| "loss": 1.0893, | |
| "num_input_tokens_seen": 40803104, | |
| "step": 852, | |
| "train_runtime": 5931.6651, | |
| "train_tokens_per_second": 6878.862 | |
| }, | |
| { | |
| "epoch": 0.5483767277402765, | |
| "grad_norm": 0.21611201763153076, | |
| "learning_rate": 9.078014184397164e-05, | |
| "loss": 0.9538, | |
| "num_input_tokens_seen": 40844208, | |
| "step": 853, | |
| "train_runtime": 5937.4707, | |
| "train_tokens_per_second": 6879.058 | |
| }, | |
| { | |
| "epoch": 0.5490196078431373, | |
| "grad_norm": 0.21386729180812836, | |
| "learning_rate": 9.065119277885235e-05, | |
| "loss": 1.022, | |
| "num_input_tokens_seen": 40903888, | |
| "step": 854, | |
| "train_runtime": 5945.8847, | |
| "train_tokens_per_second": 6879.361 | |
| }, | |
| { | |
| "epoch": 0.549662487945998, | |
| "grad_norm": 0.22319400310516357, | |
| "learning_rate": 9.052224371373309e-05, | |
| "loss": 0.9228, | |
| "num_input_tokens_seen": 40961344, | |
| "step": 855, | |
| "train_runtime": 5953.914, | |
| "train_tokens_per_second": 6879.734 | |
| }, | |
| { | |
| "epoch": 0.5503053680488589, | |
| "grad_norm": 0.22674967348575592, | |
| "learning_rate": 9.03932946486138e-05, | |
| "loss": 0.9645, | |
| "num_input_tokens_seen": 41008160, | |
| "step": 856, | |
| "train_runtime": 5960.523, | |
| "train_tokens_per_second": 6879.96 | |
| }, | |
| { | |
| "epoch": 0.5509482481517197, | |
| "grad_norm": 0.23880483210086823, | |
| "learning_rate": 9.026434558349452e-05, | |
| "loss": 0.8906, | |
| "num_input_tokens_seen": 41042464, | |
| "step": 857, | |
| "train_runtime": 5965.3763, | |
| "train_tokens_per_second": 6880.113 | |
| }, | |
| { | |
| "epoch": 0.5515911282545806, | |
| "grad_norm": 0.21060539782047272, | |
| "learning_rate": 9.013539651837525e-05, | |
| "loss": 1.0402, | |
| "num_input_tokens_seen": 41082064, | |
| "step": 858, | |
| "train_runtime": 5970.9961, | |
| "train_tokens_per_second": 6880.27 | |
| }, | |
| { | |
| "epoch": 0.5522340083574413, | |
| "grad_norm": 0.2186761349439621, | |
| "learning_rate": 9.000644745325597e-05, | |
| "loss": 0.95, | |
| "num_input_tokens_seen": 41123552, | |
| "step": 859, | |
| "train_runtime": 5976.8549, | |
| "train_tokens_per_second": 6880.467 | |
| }, | |
| { | |
| "epoch": 0.5528768884603021, | |
| "grad_norm": 0.2016412615776062, | |
| "learning_rate": 8.987749838813669e-05, | |
| "loss": 0.9186, | |
| "num_input_tokens_seen": 41168240, | |
| "step": 860, | |
| "train_runtime": 5983.0983, | |
| "train_tokens_per_second": 6880.756 | |
| }, | |
| { | |
| "epoch": 0.553519768563163, | |
| "grad_norm": 0.21804280579090118, | |
| "learning_rate": 8.974854932301742e-05, | |
| "loss": 0.9289, | |
| "num_input_tokens_seen": 41234384, | |
| "step": 861, | |
| "train_runtime": 5992.3826, | |
| "train_tokens_per_second": 6881.133 | |
| }, | |
| { | |
| "epoch": 0.5541626486660238, | |
| "grad_norm": 0.21665385365486145, | |
| "learning_rate": 8.961960025789814e-05, | |
| "loss": 0.9558, | |
| "num_input_tokens_seen": 41272016, | |
| "step": 862, | |
| "train_runtime": 5997.6849, | |
| "train_tokens_per_second": 6881.324 | |
| }, | |
| { | |
| "epoch": 0.5548055287688846, | |
| "grad_norm": 0.2189703732728958, | |
| "learning_rate": 8.949065119277886e-05, | |
| "loss": 0.9443, | |
| "num_input_tokens_seen": 41320896, | |
| "step": 863, | |
| "train_runtime": 6004.5713, | |
| "train_tokens_per_second": 6881.573 | |
| }, | |
| { | |
| "epoch": 0.5554484088717454, | |
| "grad_norm": 0.2256087064743042, | |
| "learning_rate": 8.936170212765958e-05, | |
| "loss": 0.9379, | |
| "num_input_tokens_seen": 41367872, | |
| "step": 864, | |
| "train_runtime": 6011.1948, | |
| "train_tokens_per_second": 6881.805 | |
| }, | |
| { | |
| "epoch": 0.5560912889746062, | |
| "grad_norm": 0.22272774577140808, | |
| "learning_rate": 8.92327530625403e-05, | |
| "loss": 0.9655, | |
| "num_input_tokens_seen": 41413008, | |
| "step": 865, | |
| "train_runtime": 6017.569, | |
| "train_tokens_per_second": 6882.016 | |
| }, | |
| { | |
| "epoch": 0.5567341690774671, | |
| "grad_norm": 0.2210770696401596, | |
| "learning_rate": 8.910380399742103e-05, | |
| "loss": 0.9604, | |
| "num_input_tokens_seen": 41457152, | |
| "step": 866, | |
| "train_runtime": 6023.8013, | |
| "train_tokens_per_second": 6882.224 | |
| }, | |
| { | |
| "epoch": 0.5573770491803278, | |
| "grad_norm": 0.21450798213481903, | |
| "learning_rate": 8.897485493230174e-05, | |
| "loss": 1.0894, | |
| "num_input_tokens_seen": 41521120, | |
| "step": 867, | |
| "train_runtime": 6032.7832, | |
| "train_tokens_per_second": 6882.581 | |
| }, | |
| { | |
| "epoch": 0.5580199292831887, | |
| "grad_norm": 0.23895588517189026, | |
| "learning_rate": 8.884590586718246e-05, | |
| "loss": 0.8939, | |
| "num_input_tokens_seen": 41581344, | |
| "step": 868, | |
| "train_runtime": 6041.1988, | |
| "train_tokens_per_second": 6882.962 | |
| }, | |
| { | |
| "epoch": 0.5586628093860495, | |
| "grad_norm": 0.23894917964935303, | |
| "learning_rate": 8.871695680206319e-05, | |
| "loss": 0.9768, | |
| "num_input_tokens_seen": 41618224, | |
| "step": 869, | |
| "train_runtime": 6046.4132, | |
| "train_tokens_per_second": 6883.126 | |
| }, | |
| { | |
| "epoch": 0.5593056894889104, | |
| "grad_norm": 0.23007355630397797, | |
| "learning_rate": 8.858800773694391e-05, | |
| "loss": 0.9947, | |
| "num_input_tokens_seen": 41655376, | |
| "step": 870, | |
| "train_runtime": 6051.6787, | |
| "train_tokens_per_second": 6883.276 | |
| }, | |
| { | |
| "epoch": 0.5599485695917711, | |
| "grad_norm": 0.22590278089046478, | |
| "learning_rate": 8.845905867182463e-05, | |
| "loss": 0.8208, | |
| "num_input_tokens_seen": 41687184, | |
| "step": 871, | |
| "train_runtime": 6056.7009, | |
| "train_tokens_per_second": 6882.82 | |
| }, | |
| { | |
| "epoch": 0.5605914496946319, | |
| "grad_norm": 0.2513355016708374, | |
| "learning_rate": 8.833010960670536e-05, | |
| "loss": 1.1157, | |
| "num_input_tokens_seen": 41779632, | |
| "step": 872, | |
| "train_runtime": 6069.7172, | |
| "train_tokens_per_second": 6883.291 | |
| }, | |
| { | |
| "epoch": 0.5612343297974928, | |
| "grad_norm": 0.21992050111293793, | |
| "learning_rate": 8.820116054158608e-05, | |
| "loss": 1.0661, | |
| "num_input_tokens_seen": 41819712, | |
| "step": 873, | |
| "train_runtime": 6075.3753, | |
| "train_tokens_per_second": 6883.478 | |
| }, | |
| { | |
| "epoch": 0.5618772099003536, | |
| "grad_norm": 0.20959214866161346, | |
| "learning_rate": 8.80722114764668e-05, | |
| "loss": 1.1405, | |
| "num_input_tokens_seen": 41864224, | |
| "step": 874, | |
| "train_runtime": 6081.6646, | |
| "train_tokens_per_second": 6883.679 | |
| }, | |
| { | |
| "epoch": 0.5625200900032143, | |
| "grad_norm": 0.21922095119953156, | |
| "learning_rate": 8.794326241134753e-05, | |
| "loss": 0.9449, | |
| "num_input_tokens_seen": 41895120, | |
| "step": 875, | |
| "train_runtime": 6086.082, | |
| "train_tokens_per_second": 6883.759 | |
| }, | |
| { | |
| "epoch": 0.5631629701060752, | |
| "grad_norm": 0.2277074009180069, | |
| "learning_rate": 8.781431334622823e-05, | |
| "loss": 0.9949, | |
| "num_input_tokens_seen": 41938720, | |
| "step": 876, | |
| "train_runtime": 6092.2718, | |
| "train_tokens_per_second": 6883.921 | |
| }, | |
| { | |
| "epoch": 0.563805850208936, | |
| "grad_norm": 0.23298637568950653, | |
| "learning_rate": 8.768536428110897e-05, | |
| "loss": 1.0172, | |
| "num_input_tokens_seen": 41987904, | |
| "step": 877, | |
| "train_runtime": 6099.2057, | |
| "train_tokens_per_second": 6884.159 | |
| }, | |
| { | |
| "epoch": 0.5644487303117969, | |
| "grad_norm": 0.21925728023052216, | |
| "learning_rate": 8.755641521598968e-05, | |
| "loss": 0.9435, | |
| "num_input_tokens_seen": 42027456, | |
| "step": 878, | |
| "train_runtime": 6104.797, | |
| "train_tokens_per_second": 6884.333 | |
| }, | |
| { | |
| "epoch": 0.5650916104146577, | |
| "grad_norm": 0.2143392413854599, | |
| "learning_rate": 8.74274661508704e-05, | |
| "loss": 0.992, | |
| "num_input_tokens_seen": 42088400, | |
| "step": 879, | |
| "train_runtime": 6113.3262, | |
| "train_tokens_per_second": 6884.697 | |
| }, | |
| { | |
| "epoch": 0.5657344905175185, | |
| "grad_norm": 0.2037908136844635, | |
| "learning_rate": 8.729851708575113e-05, | |
| "loss": 0.8212, | |
| "num_input_tokens_seen": 42121408, | |
| "step": 880, | |
| "train_runtime": 6118.001, | |
| "train_tokens_per_second": 6884.832 | |
| }, | |
| { | |
| "epoch": 0.5663773706203793, | |
| "grad_norm": 0.21776051819324493, | |
| "learning_rate": 8.716956802063185e-05, | |
| "loss": 1.0319, | |
| "num_input_tokens_seen": 42167056, | |
| "step": 881, | |
| "train_runtime": 6124.4423, | |
| "train_tokens_per_second": 6885.044 | |
| }, | |
| { | |
| "epoch": 0.5670202507232401, | |
| "grad_norm": 0.1910998821258545, | |
| "learning_rate": 8.704061895551258e-05, | |
| "loss": 1.0724, | |
| "num_input_tokens_seen": 42207408, | |
| "step": 882, | |
| "train_runtime": 6130.0885, | |
| "train_tokens_per_second": 6885.285 | |
| }, | |
| { | |
| "epoch": 0.567663130826101, | |
| "grad_norm": 0.21779921650886536, | |
| "learning_rate": 8.69116698903933e-05, | |
| "loss": 0.9752, | |
| "num_input_tokens_seen": 42249360, | |
| "step": 883, | |
| "train_runtime": 6136.0045, | |
| "train_tokens_per_second": 6885.484 | |
| }, | |
| { | |
| "epoch": 0.5683060109289617, | |
| "grad_norm": 0.2009030431509018, | |
| "learning_rate": 8.678272082527402e-05, | |
| "loss": 0.9272, | |
| "num_input_tokens_seen": 42307536, | |
| "step": 884, | |
| "train_runtime": 6144.1609, | |
| "train_tokens_per_second": 6885.812 | |
| }, | |
| { | |
| "epoch": 0.5689488910318226, | |
| "grad_norm": 0.20714476704597473, | |
| "learning_rate": 8.665377176015475e-05, | |
| "loss": 0.9203, | |
| "num_input_tokens_seen": 42365472, | |
| "step": 885, | |
| "train_runtime": 6152.2851, | |
| "train_tokens_per_second": 6886.136 | |
| }, | |
| { | |
| "epoch": 0.5695917711346834, | |
| "grad_norm": 0.22802214324474335, | |
| "learning_rate": 8.652482269503547e-05, | |
| "loss": 1.0257, | |
| "num_input_tokens_seen": 42429312, | |
| "step": 886, | |
| "train_runtime": 6161.2401, | |
| "train_tokens_per_second": 6886.489 | |
| }, | |
| { | |
| "epoch": 0.5702346512375442, | |
| "grad_norm": 0.24137407541275024, | |
| "learning_rate": 8.639587362991619e-05, | |
| "loss": 1.0293, | |
| "num_input_tokens_seen": 42468416, | |
| "step": 887, | |
| "train_runtime": 6166.8111, | |
| "train_tokens_per_second": 6886.609 | |
| }, | |
| { | |
| "epoch": 0.570877531340405, | |
| "grad_norm": 0.23040415346622467, | |
| "learning_rate": 8.626692456479692e-05, | |
| "loss": 0.8444, | |
| "num_input_tokens_seen": 42520688, | |
| "step": 888, | |
| "train_runtime": 6174.1119, | |
| "train_tokens_per_second": 6886.932 | |
| }, | |
| { | |
| "epoch": 0.5715204114432658, | |
| "grad_norm": 0.19980192184448242, | |
| "learning_rate": 8.613797549967764e-05, | |
| "loss": 0.8182, | |
| "num_input_tokens_seen": 42572048, | |
| "step": 889, | |
| "train_runtime": 6181.3308, | |
| "train_tokens_per_second": 6887.198 | |
| }, | |
| { | |
| "epoch": 0.5721632915461267, | |
| "grad_norm": 0.22542989253997803, | |
| "learning_rate": 8.600902643455835e-05, | |
| "loss": 1.0732, | |
| "num_input_tokens_seen": 42609424, | |
| "step": 890, | |
| "train_runtime": 6186.6135, | |
| "train_tokens_per_second": 6887.358 | |
| }, | |
| { | |
| "epoch": 0.5728061716489875, | |
| "grad_norm": 0.23115967214107513, | |
| "learning_rate": 8.588007736943907e-05, | |
| "loss": 0.9204, | |
| "num_input_tokens_seen": 42643936, | |
| "step": 891, | |
| "train_runtime": 6191.4711, | |
| "train_tokens_per_second": 6887.529 | |
| }, | |
| { | |
| "epoch": 0.5734490517518482, | |
| "grad_norm": 0.23263217508792877, | |
| "learning_rate": 8.575112830431979e-05, | |
| "loss": 0.9213, | |
| "num_input_tokens_seen": 42688720, | |
| "step": 892, | |
| "train_runtime": 6197.6985, | |
| "train_tokens_per_second": 6887.834 | |
| }, | |
| { | |
| "epoch": 0.5740919318547091, | |
| "grad_norm": 0.22807829082012177, | |
| "learning_rate": 8.562217923920052e-05, | |
| "loss": 1.0849, | |
| "num_input_tokens_seen": 42732496, | |
| "step": 893, | |
| "train_runtime": 6203.7686, | |
| "train_tokens_per_second": 6888.151 | |
| }, | |
| { | |
| "epoch": 0.5747348119575699, | |
| "grad_norm": 0.21378318965435028, | |
| "learning_rate": 8.549323017408124e-05, | |
| "loss": 0.8884, | |
| "num_input_tokens_seen": 42779216, | |
| "step": 894, | |
| "train_runtime": 6210.2206, | |
| "train_tokens_per_second": 6888.518 | |
| }, | |
| { | |
| "epoch": 0.5753776920604308, | |
| "grad_norm": 0.20278410613536835, | |
| "learning_rate": 8.536428110896196e-05, | |
| "loss": 0.9375, | |
| "num_input_tokens_seen": 42819792, | |
| "step": 895, | |
| "train_runtime": 6215.8757, | |
| "train_tokens_per_second": 6888.779 | |
| }, | |
| { | |
| "epoch": 0.5760205721632915, | |
| "grad_norm": 0.20692852139472961, | |
| "learning_rate": 8.523533204384269e-05, | |
| "loss": 0.9632, | |
| "num_input_tokens_seen": 42878464, | |
| "step": 896, | |
| "train_runtime": 6224.1169, | |
| "train_tokens_per_second": 6889.084 | |
| }, | |
| { | |
| "epoch": 0.5766634522661523, | |
| "grad_norm": 0.2214338183403015, | |
| "learning_rate": 8.510638297872341e-05, | |
| "loss": 1.0123, | |
| "num_input_tokens_seen": 42932576, | |
| "step": 897, | |
| "train_runtime": 6231.7369, | |
| "train_tokens_per_second": 6889.344 | |
| }, | |
| { | |
| "epoch": 0.5773063323690132, | |
| "grad_norm": 0.2511458992958069, | |
| "learning_rate": 8.497743391360413e-05, | |
| "loss": 0.8736, | |
| "num_input_tokens_seen": 43004368, | |
| "step": 898, | |
| "train_runtime": 6241.8144, | |
| "train_tokens_per_second": 6889.722 | |
| }, | |
| { | |
| "epoch": 0.577949212471874, | |
| "grad_norm": 0.21616335213184357, | |
| "learning_rate": 8.484848484848486e-05, | |
| "loss": 0.8995, | |
| "num_input_tokens_seen": 43039600, | |
| "step": 899, | |
| "train_runtime": 6246.7721, | |
| "train_tokens_per_second": 6889.894 | |
| }, | |
| { | |
| "epoch": 0.5785920925747348, | |
| "grad_norm": 0.22274382412433624, | |
| "learning_rate": 8.471953578336558e-05, | |
| "loss": 1.0423, | |
| "num_input_tokens_seen": 43085184, | |
| "step": 900, | |
| "train_runtime": 6253.1468, | |
| "train_tokens_per_second": 6890.16 | |
| }, | |
| { | |
| "epoch": 0.5792349726775956, | |
| "grad_norm": 0.22178566455841064, | |
| "learning_rate": 8.45905867182463e-05, | |
| "loss": 0.9354, | |
| "num_input_tokens_seen": 43164352, | |
| "step": 901, | |
| "train_runtime": 6264.699, | |
| "train_tokens_per_second": 6890.092 | |
| }, | |
| { | |
| "epoch": 0.5798778527804564, | |
| "grad_norm": 0.22248417139053345, | |
| "learning_rate": 8.446163765312703e-05, | |
| "loss": 1.0238, | |
| "num_input_tokens_seen": 43196160, | |
| "step": 902, | |
| "train_runtime": 6269.2226, | |
| "train_tokens_per_second": 6890.194 | |
| }, | |
| { | |
| "epoch": 0.5805207328833173, | |
| "grad_norm": 0.20994658768177032, | |
| "learning_rate": 8.433268858800773e-05, | |
| "loss": 1.0422, | |
| "num_input_tokens_seen": 43258992, | |
| "step": 903, | |
| "train_runtime": 6278.1231, | |
| "train_tokens_per_second": 6890.434 | |
| }, | |
| { | |
| "epoch": 0.581163612986178, | |
| "grad_norm": 0.23427492380142212, | |
| "learning_rate": 8.420373952288846e-05, | |
| "loss": 0.9556, | |
| "num_input_tokens_seen": 43328208, | |
| "step": 904, | |
| "train_runtime": 6287.8019, | |
| "train_tokens_per_second": 6890.835 | |
| }, | |
| { | |
| "epoch": 0.5818064930890389, | |
| "grad_norm": 0.24690331518650055, | |
| "learning_rate": 8.407479045776918e-05, | |
| "loss": 0.9847, | |
| "num_input_tokens_seen": 43381440, | |
| "step": 905, | |
| "train_runtime": 6295.28, | |
| "train_tokens_per_second": 6891.106 | |
| }, | |
| { | |
| "epoch": 0.5824493731918997, | |
| "grad_norm": 0.1973118931055069, | |
| "learning_rate": 8.39458413926499e-05, | |
| "loss": 0.8898, | |
| "num_input_tokens_seen": 43428560, | |
| "step": 906, | |
| "train_runtime": 6301.8974, | |
| "train_tokens_per_second": 6891.347 | |
| }, | |
| { | |
| "epoch": 0.5830922532947606, | |
| "grad_norm": 0.2366381287574768, | |
| "learning_rate": 8.381689232753063e-05, | |
| "loss": 0.9489, | |
| "num_input_tokens_seen": 43467968, | |
| "step": 907, | |
| "train_runtime": 6307.4496, | |
| "train_tokens_per_second": 6891.528 | |
| }, | |
| { | |
| "epoch": 0.5837351333976214, | |
| "grad_norm": 0.23190288245677948, | |
| "learning_rate": 8.368794326241135e-05, | |
| "loss": 0.8342, | |
| "num_input_tokens_seen": 43531200, | |
| "step": 908, | |
| "train_runtime": 6316.3141, | |
| "train_tokens_per_second": 6891.868 | |
| }, | |
| { | |
| "epoch": 0.5843780135004821, | |
| "grad_norm": 0.23574669659137726, | |
| "learning_rate": 8.355899419729207e-05, | |
| "loss": 1.1343, | |
| "num_input_tokens_seen": 43599280, | |
| "step": 909, | |
| "train_runtime": 6325.8663, | |
| "train_tokens_per_second": 6892.223 | |
| }, | |
| { | |
| "epoch": 0.585020893603343, | |
| "grad_norm": 0.21268287301063538, | |
| "learning_rate": 8.34300451321728e-05, | |
| "loss": 0.8419, | |
| "num_input_tokens_seen": 43637872, | |
| "step": 910, | |
| "train_runtime": 6331.2741, | |
| "train_tokens_per_second": 6892.431 | |
| }, | |
| { | |
| "epoch": 0.5856637737062038, | |
| "grad_norm": 0.2215997725725174, | |
| "learning_rate": 8.330109606705352e-05, | |
| "loss": 1.0209, | |
| "num_input_tokens_seen": 43689440, | |
| "step": 911, | |
| "train_runtime": 6338.5247, | |
| "train_tokens_per_second": 6892.683 | |
| }, | |
| { | |
| "epoch": 0.5863066538090647, | |
| "grad_norm": 0.21488438546657562, | |
| "learning_rate": 8.317214700193425e-05, | |
| "loss": 0.86, | |
| "num_input_tokens_seen": 43746672, | |
| "step": 912, | |
| "train_runtime": 6346.582, | |
| "train_tokens_per_second": 6892.95 | |
| }, | |
| { | |
| "epoch": 0.5869495339119254, | |
| "grad_norm": 0.23541532456874847, | |
| "learning_rate": 8.304319793681497e-05, | |
| "loss": 0.9567, | |
| "num_input_tokens_seen": 43817744, | |
| "step": 913, | |
| "train_runtime": 6356.4817, | |
| "train_tokens_per_second": 6893.396 | |
| }, | |
| { | |
| "epoch": 0.5875924140147862, | |
| "grad_norm": 0.22803905606269836, | |
| "learning_rate": 8.291424887169568e-05, | |
| "loss": 1.1268, | |
| "num_input_tokens_seen": 43851520, | |
| "step": 914, | |
| "train_runtime": 6361.3016, | |
| "train_tokens_per_second": 6893.482 | |
| }, | |
| { | |
| "epoch": 0.5882352941176471, | |
| "grad_norm": 0.21955518424510956, | |
| "learning_rate": 8.278529980657642e-05, | |
| "loss": 0.9847, | |
| "num_input_tokens_seen": 43895232, | |
| "step": 915, | |
| "train_runtime": 6367.4054, | |
| "train_tokens_per_second": 6893.739 | |
| }, | |
| { | |
| "epoch": 0.5888781742205079, | |
| "grad_norm": 0.20941504836082458, | |
| "learning_rate": 8.265635074145713e-05, | |
| "loss": 0.9002, | |
| "num_input_tokens_seen": 43933248, | |
| "step": 916, | |
| "train_runtime": 6372.7546, | |
| "train_tokens_per_second": 6893.918 | |
| }, | |
| { | |
| "epoch": 0.5895210543233687, | |
| "grad_norm": 0.2331460863351822, | |
| "learning_rate": 8.252740167633784e-05, | |
| "loss": 0.9279, | |
| "num_input_tokens_seen": 43976928, | |
| "step": 917, | |
| "train_runtime": 6378.8552, | |
| "train_tokens_per_second": 6894.173 | |
| }, | |
| { | |
| "epoch": 0.5901639344262295, | |
| "grad_norm": 0.21849630773067474, | |
| "learning_rate": 8.239845261121857e-05, | |
| "loss": 0.9592, | |
| "num_input_tokens_seen": 44037440, | |
| "step": 918, | |
| "train_runtime": 6387.3069, | |
| "train_tokens_per_second": 6894.524 | |
| }, | |
| { | |
| "epoch": 0.5908068145290903, | |
| "grad_norm": 0.20870837569236755, | |
| "learning_rate": 8.226950354609929e-05, | |
| "loss": 0.934, | |
| "num_input_tokens_seen": 44071488, | |
| "step": 919, | |
| "train_runtime": 6392.1384, | |
| "train_tokens_per_second": 6894.639 | |
| }, | |
| { | |
| "epoch": 0.5914496946319512, | |
| "grad_norm": 0.2119072824716568, | |
| "learning_rate": 8.214055448098002e-05, | |
| "loss": 0.8326, | |
| "num_input_tokens_seen": 44101040, | |
| "step": 920, | |
| "train_runtime": 6396.3504, | |
| "train_tokens_per_second": 6894.719 | |
| }, | |
| { | |
| "epoch": 0.5920925747348119, | |
| "grad_norm": 0.23690038919448853, | |
| "learning_rate": 8.201160541586074e-05, | |
| "loss": 1.0202, | |
| "num_input_tokens_seen": 44157248, | |
| "step": 921, | |
| "train_runtime": 6404.3079, | |
| "train_tokens_per_second": 6894.929 | |
| }, | |
| { | |
| "epoch": 0.5927354548376728, | |
| "grad_norm": 0.22710008919239044, | |
| "learning_rate": 8.188265635074146e-05, | |
| "loss": 1.0342, | |
| "num_input_tokens_seen": 44224064, | |
| "step": 922, | |
| "train_runtime": 6413.7279, | |
| "train_tokens_per_second": 6895.22 | |
| }, | |
| { | |
| "epoch": 0.5933783349405336, | |
| "grad_norm": 0.2313239574432373, | |
| "learning_rate": 8.175370728562219e-05, | |
| "loss": 0.8901, | |
| "num_input_tokens_seen": 44274672, | |
| "step": 923, | |
| "train_runtime": 6420.8058, | |
| "train_tokens_per_second": 6895.501 | |
| }, | |
| { | |
| "epoch": 0.5940212150433944, | |
| "grad_norm": 0.22043012082576752, | |
| "learning_rate": 8.16247582205029e-05, | |
| "loss": 1.0042, | |
| "num_input_tokens_seen": 44318736, | |
| "step": 924, | |
| "train_runtime": 6427.0153, | |
| "train_tokens_per_second": 6895.695 | |
| }, | |
| { | |
| "epoch": 0.5946640951462552, | |
| "grad_norm": 0.2008189857006073, | |
| "learning_rate": 8.149580915538362e-05, | |
| "loss": 0.9335, | |
| "num_input_tokens_seen": 44358256, | |
| "step": 925, | |
| "train_runtime": 6432.5716, | |
| "train_tokens_per_second": 6895.882 | |
| }, | |
| { | |
| "epoch": 0.595306975249116, | |
| "grad_norm": 0.1697245091199875, | |
| "learning_rate": 8.136686009026436e-05, | |
| "loss": 0.7817, | |
| "num_input_tokens_seen": 44434544, | |
| "step": 926, | |
| "train_runtime": 6443.2477, | |
| "train_tokens_per_second": 6896.296 | |
| }, | |
| { | |
| "epoch": 0.5959498553519769, | |
| "grad_norm": 0.21377557516098022, | |
| "learning_rate": 8.123791102514507e-05, | |
| "loss": 0.8774, | |
| "num_input_tokens_seen": 44492352, | |
| "step": 927, | |
| "train_runtime": 6451.3472, | |
| "train_tokens_per_second": 6896.599 | |
| }, | |
| { | |
| "epoch": 0.5965927354548377, | |
| "grad_norm": 0.21762780845165253, | |
| "learning_rate": 8.110896196002579e-05, | |
| "loss": 1.0206, | |
| "num_input_tokens_seen": 44523424, | |
| "step": 928, | |
| "train_runtime": 6455.7713, | |
| "train_tokens_per_second": 6896.685 | |
| }, | |
| { | |
| "epoch": 0.5972356155576984, | |
| "grad_norm": 0.22104495763778687, | |
| "learning_rate": 8.098001289490652e-05, | |
| "loss": 1.0388, | |
| "num_input_tokens_seen": 44569904, | |
| "step": 929, | |
| "train_runtime": 6462.3358, | |
| "train_tokens_per_second": 6896.872 | |
| }, | |
| { | |
| "epoch": 0.5978784956605593, | |
| "grad_norm": 0.23265767097473145, | |
| "learning_rate": 8.085106382978723e-05, | |
| "loss": 0.9364, | |
| "num_input_tokens_seen": 44644992, | |
| "step": 930, | |
| "train_runtime": 6472.904, | |
| "train_tokens_per_second": 6897.212 | |
| }, | |
| { | |
| "epoch": 0.5985213757634201, | |
| "grad_norm": 0.23737984895706177, | |
| "learning_rate": 8.072211476466796e-05, | |
| "loss": 0.9437, | |
| "num_input_tokens_seen": 44683088, | |
| "step": 931, | |
| "train_runtime": 6478.8445, | |
| "train_tokens_per_second": 6896.768 | |
| }, | |
| { | |
| "epoch": 0.599164255866281, | |
| "grad_norm": 0.23196366429328918, | |
| "learning_rate": 8.059316569954868e-05, | |
| "loss": 0.9364, | |
| "num_input_tokens_seen": 44731184, | |
| "step": 932, | |
| "train_runtime": 6485.6032, | |
| "train_tokens_per_second": 6896.997 | |
| }, | |
| { | |
| "epoch": 0.5998071359691417, | |
| "grad_norm": 0.20719966292381287, | |
| "learning_rate": 8.04642166344294e-05, | |
| "loss": 0.9187, | |
| "num_input_tokens_seen": 44782240, | |
| "step": 933, | |
| "train_runtime": 6492.7686, | |
| "train_tokens_per_second": 6897.249 | |
| }, | |
| { | |
| "epoch": 0.6004500160720025, | |
| "grad_norm": 0.2094103842973709, | |
| "learning_rate": 8.033526756931013e-05, | |
| "loss": 0.945, | |
| "num_input_tokens_seen": 44833904, | |
| "step": 934, | |
| "train_runtime": 6500.0655, | |
| "train_tokens_per_second": 6897.454 | |
| }, | |
| { | |
| "epoch": 0.6010928961748634, | |
| "grad_norm": 0.23072101175785065, | |
| "learning_rate": 8.020631850419085e-05, | |
| "loss": 0.9558, | |
| "num_input_tokens_seen": 44872496, | |
| "step": 935, | |
| "train_runtime": 6505.5009, | |
| "train_tokens_per_second": 6897.623 | |
| }, | |
| { | |
| "epoch": 0.6017357762777242, | |
| "grad_norm": 0.23481076955795288, | |
| "learning_rate": 8.007736943907156e-05, | |
| "loss": 0.9275, | |
| "num_input_tokens_seen": 44909856, | |
| "step": 936, | |
| "train_runtime": 6510.7323, | |
| "train_tokens_per_second": 6897.819 | |
| }, | |
| { | |
| "epoch": 0.6017357762777242, | |
| "eval_loss": 1.0076556205749512, | |
| "eval_runtime": 40.0319, | |
| "eval_samples_per_second": 24.83, | |
| "eval_steps_per_second": 1.574, | |
| "num_input_tokens_seen": 44909856, | |
| "step": 936 | |
| }, | |
| { | |
| "epoch": 0.6023786563805851, | |
| "grad_norm": 0.2573668360710144, | |
| "learning_rate": 7.99484203739523e-05, | |
| "loss": 0.941, | |
| "num_input_tokens_seen": 44964080, | |
| "step": 937, | |
| "train_runtime": 6558.4171, | |
| "train_tokens_per_second": 6855.935 | |
| }, | |
| { | |
| "epoch": 0.6030215364834458, | |
| "grad_norm": 0.2350708395242691, | |
| "learning_rate": 7.981947130883301e-05, | |
| "loss": 1.0511, | |
| "num_input_tokens_seen": 45013536, | |
| "step": 938, | |
| "train_runtime": 6565.4248, | |
| "train_tokens_per_second": 6856.15 | |
| }, | |
| { | |
| "epoch": 0.6036644165863067, | |
| "grad_norm": 0.22017408907413483, | |
| "learning_rate": 7.969052224371373e-05, | |
| "loss": 1.0908, | |
| "num_input_tokens_seen": 45062928, | |
| "step": 939, | |
| "train_runtime": 6572.3543, | |
| "train_tokens_per_second": 6856.436 | |
| }, | |
| { | |
| "epoch": 0.6043072966891675, | |
| "grad_norm": 0.19787846505641937, | |
| "learning_rate": 7.956157317859446e-05, | |
| "loss": 0.8993, | |
| "num_input_tokens_seen": 45108224, | |
| "step": 940, | |
| "train_runtime": 6578.7161, | |
| "train_tokens_per_second": 6856.691 | |
| }, | |
| { | |
| "epoch": 0.6049501767920283, | |
| "grad_norm": 0.21461884677410126, | |
| "learning_rate": 7.943262411347518e-05, | |
| "loss": 0.833, | |
| "num_input_tokens_seen": 45151552, | |
| "step": 941, | |
| "train_runtime": 6584.7583, | |
| "train_tokens_per_second": 6856.979 | |
| }, | |
| { | |
| "epoch": 0.6055930568948891, | |
| "grad_norm": 0.2068055421113968, | |
| "learning_rate": 7.930367504835591e-05, | |
| "loss": 1.0113, | |
| "num_input_tokens_seen": 45207248, | |
| "step": 942, | |
| "train_runtime": 6592.6019, | |
| "train_tokens_per_second": 6857.27 | |
| }, | |
| { | |
| "epoch": 0.6062359369977499, | |
| "grad_norm": 0.22537890076637268, | |
| "learning_rate": 7.917472598323663e-05, | |
| "loss": 1.0316, | |
| "num_input_tokens_seen": 45246032, | |
| "step": 943, | |
| "train_runtime": 6598.0453, | |
| "train_tokens_per_second": 6857.49 | |
| }, | |
| { | |
| "epoch": 0.6068788171006108, | |
| "grad_norm": 0.2297266274690628, | |
| "learning_rate": 7.904577691811734e-05, | |
| "loss": 0.9796, | |
| "num_input_tokens_seen": 45285568, | |
| "step": 944, | |
| "train_runtime": 6603.5907, | |
| "train_tokens_per_second": 6857.719 | |
| }, | |
| { | |
| "epoch": 0.6075216972034716, | |
| "grad_norm": 0.2185073047876358, | |
| "learning_rate": 7.891682785299807e-05, | |
| "loss": 1.025, | |
| "num_input_tokens_seen": 45349424, | |
| "step": 945, | |
| "train_runtime": 6612.5255, | |
| "train_tokens_per_second": 6858.11 | |
| }, | |
| { | |
| "epoch": 0.6081645773063323, | |
| "grad_norm": 0.20334357023239136, | |
| "learning_rate": 7.878787878787879e-05, | |
| "loss": 0.9352, | |
| "num_input_tokens_seen": 45382528, | |
| "step": 946, | |
| "train_runtime": 6617.202, | |
| "train_tokens_per_second": 6858.265 | |
| }, | |
| { | |
| "epoch": 0.6088074574091932, | |
| "grad_norm": 0.22521203756332397, | |
| "learning_rate": 7.86589297227595e-05, | |
| "loss": 0.9307, | |
| "num_input_tokens_seen": 45434592, | |
| "step": 947, | |
| "train_runtime": 6624.4965, | |
| "train_tokens_per_second": 6858.573 | |
| }, | |
| { | |
| "epoch": 0.609450337512054, | |
| "grad_norm": 0.21149739623069763, | |
| "learning_rate": 7.852998065764024e-05, | |
| "loss": 1.0105, | |
| "num_input_tokens_seen": 45490192, | |
| "step": 948, | |
| "train_runtime": 6632.1883, | |
| "train_tokens_per_second": 6859.002 | |
| }, | |
| { | |
| "epoch": 0.6100932176149149, | |
| "grad_norm": 0.21434244513511658, | |
| "learning_rate": 7.840103159252095e-05, | |
| "loss": 0.9318, | |
| "num_input_tokens_seen": 45542496, | |
| "step": 949, | |
| "train_runtime": 6639.4349, | |
| "train_tokens_per_second": 6859.393 | |
| }, | |
| { | |
| "epoch": 0.6107360977177756, | |
| "grad_norm": 0.19788849353790283, | |
| "learning_rate": 7.827208252740169e-05, | |
| "loss": 0.9998, | |
| "num_input_tokens_seen": 45587712, | |
| "step": 950, | |
| "train_runtime": 6645.7335, | |
| "train_tokens_per_second": 6859.696 | |
| }, | |
| { | |
| "epoch": 0.6113789778206364, | |
| "grad_norm": 0.24048268795013428, | |
| "learning_rate": 7.81431334622824e-05, | |
| "loss": 0.9126, | |
| "num_input_tokens_seen": 45626816, | |
| "step": 951, | |
| "train_runtime": 6651.1735, | |
| "train_tokens_per_second": 6859.965 | |
| }, | |
| { | |
| "epoch": 0.6120218579234973, | |
| "grad_norm": 0.2160108983516693, | |
| "learning_rate": 7.801418439716312e-05, | |
| "loss": 1.0111, | |
| "num_input_tokens_seen": 45672320, | |
| "step": 952, | |
| "train_runtime": 6657.4991, | |
| "train_tokens_per_second": 6860.282 | |
| }, | |
| { | |
| "epoch": 0.6126647380263581, | |
| "grad_norm": 0.2314816117286682, | |
| "learning_rate": 7.788523533204385e-05, | |
| "loss": 1.0468, | |
| "num_input_tokens_seen": 45720000, | |
| "step": 953, | |
| "train_runtime": 6664.057, | |
| "train_tokens_per_second": 6860.686 | |
| }, | |
| { | |
| "epoch": 0.6133076181292189, | |
| "grad_norm": 0.22002699971199036, | |
| "learning_rate": 7.775628626692457e-05, | |
| "loss": 1.0283, | |
| "num_input_tokens_seen": 45752288, | |
| "step": 954, | |
| "train_runtime": 6668.585, | |
| "train_tokens_per_second": 6860.869 | |
| }, | |
| { | |
| "epoch": 0.6139504982320797, | |
| "grad_norm": 0.2057672142982483, | |
| "learning_rate": 7.762733720180529e-05, | |
| "loss": 0.9906, | |
| "num_input_tokens_seen": 45787136, | |
| "step": 955, | |
| "train_runtime": 6673.4818, | |
| "train_tokens_per_second": 6861.056 | |
| }, | |
| { | |
| "epoch": 0.6145933783349405, | |
| "grad_norm": 0.22810469567775726, | |
| "learning_rate": 7.749838813668602e-05, | |
| "loss": 1.0197, | |
| "num_input_tokens_seen": 45832416, | |
| "step": 956, | |
| "train_runtime": 6679.7842, | |
| "train_tokens_per_second": 6861.362 | |
| }, | |
| { | |
| "epoch": 0.6152362584378014, | |
| "grad_norm": 0.2123366743326187, | |
| "learning_rate": 7.736943907156673e-05, | |
| "loss": 0.9164, | |
| "num_input_tokens_seen": 45872960, | |
| "step": 957, | |
| "train_runtime": 6685.4446, | |
| "train_tokens_per_second": 6861.617 | |
| }, | |
| { | |
| "epoch": 0.6158791385406621, | |
| "grad_norm": 0.19447851181030273, | |
| "learning_rate": 7.724049000644746e-05, | |
| "loss": 0.9516, | |
| "num_input_tokens_seen": 45910544, | |
| "step": 958, | |
| "train_runtime": 6690.7329, | |
| "train_tokens_per_second": 6861.811 | |
| }, | |
| { | |
| "epoch": 0.616522018643523, | |
| "grad_norm": 0.22850489616394043, | |
| "learning_rate": 7.711154094132818e-05, | |
| "loss": 1.0786, | |
| "num_input_tokens_seen": 45960944, | |
| "step": 959, | |
| "train_runtime": 6697.7183, | |
| "train_tokens_per_second": 6862.179 | |
| }, | |
| { | |
| "epoch": 0.6171648987463838, | |
| "grad_norm": 0.21646857261657715, | |
| "learning_rate": 7.69825918762089e-05, | |
| "loss": 0.9976, | |
| "num_input_tokens_seen": 46010656, | |
| "step": 960, | |
| "train_runtime": 6704.5387, | |
| "train_tokens_per_second": 6862.613 | |
| }, | |
| { | |
| "epoch": 0.6178077788492446, | |
| "grad_norm": 0.2174510955810547, | |
| "learning_rate": 7.685364281108963e-05, | |
| "loss": 0.9598, | |
| "num_input_tokens_seen": 46054448, | |
| "step": 961, | |
| "train_runtime": 6711.1106, | |
| "train_tokens_per_second": 6862.418 | |
| }, | |
| { | |
| "epoch": 0.6184506589521054, | |
| "grad_norm": 0.20922686159610748, | |
| "learning_rate": 7.672469374597034e-05, | |
| "loss": 0.8961, | |
| "num_input_tokens_seen": 46090672, | |
| "step": 962, | |
| "train_runtime": 6716.1748, | |
| "train_tokens_per_second": 6862.637 | |
| }, | |
| { | |
| "epoch": 0.6190935390549662, | |
| "grad_norm": 0.22034646570682526, | |
| "learning_rate": 7.659574468085106e-05, | |
| "loss": 1.0259, | |
| "num_input_tokens_seen": 46126704, | |
| "step": 963, | |
| "train_runtime": 6721.2076, | |
| "train_tokens_per_second": 6862.86 | |
| }, | |
| { | |
| "epoch": 0.6197364191578271, | |
| "grad_norm": 0.22129416465759277, | |
| "learning_rate": 7.64667956157318e-05, | |
| "loss": 0.9486, | |
| "num_input_tokens_seen": 46176464, | |
| "step": 964, | |
| "train_runtime": 6728.1278, | |
| "train_tokens_per_second": 6863.197 | |
| }, | |
| { | |
| "epoch": 0.6203792992606879, | |
| "grad_norm": 0.21850019693374634, | |
| "learning_rate": 7.633784655061251e-05, | |
| "loss": 0.965, | |
| "num_input_tokens_seen": 46221184, | |
| "step": 965, | |
| "train_runtime": 6734.3203, | |
| "train_tokens_per_second": 6863.526 | |
| }, | |
| { | |
| "epoch": 0.6210221793635486, | |
| "grad_norm": 0.2046729326248169, | |
| "learning_rate": 7.620889748549323e-05, | |
| "loss": 0.9319, | |
| "num_input_tokens_seen": 46265680, | |
| "step": 966, | |
| "train_runtime": 6740.5364, | |
| "train_tokens_per_second": 6863.798 | |
| }, | |
| { | |
| "epoch": 0.6216650594664095, | |
| "grad_norm": 0.21326079964637756, | |
| "learning_rate": 7.607994842037396e-05, | |
| "loss": 0.9574, | |
| "num_input_tokens_seen": 46301680, | |
| "step": 967, | |
| "train_runtime": 6745.584, | |
| "train_tokens_per_second": 6863.999 | |
| }, | |
| { | |
| "epoch": 0.6223079395692703, | |
| "grad_norm": 0.213593527674675, | |
| "learning_rate": 7.595099935525468e-05, | |
| "loss": 0.9439, | |
| "num_input_tokens_seen": 46350304, | |
| "step": 968, | |
| "train_runtime": 6752.2772, | |
| "train_tokens_per_second": 6864.396 | |
| }, | |
| { | |
| "epoch": 0.6229508196721312, | |
| "grad_norm": 0.21795116364955902, | |
| "learning_rate": 7.58220502901354e-05, | |
| "loss": 0.86, | |
| "num_input_tokens_seen": 46390528, | |
| "step": 969, | |
| "train_runtime": 6757.8381, | |
| "train_tokens_per_second": 6864.7 | |
| }, | |
| { | |
| "epoch": 0.623593699774992, | |
| "grad_norm": 0.20645615458488464, | |
| "learning_rate": 7.569310122501613e-05, | |
| "loss": 0.8959, | |
| "num_input_tokens_seen": 46450176, | |
| "step": 970, | |
| "train_runtime": 6766.119, | |
| "train_tokens_per_second": 6865.114 | |
| }, | |
| { | |
| "epoch": 0.6242365798778527, | |
| "grad_norm": 0.21638134121894836, | |
| "learning_rate": 7.556415215989683e-05, | |
| "loss": 1.0205, | |
| "num_input_tokens_seen": 46488288, | |
| "step": 971, | |
| "train_runtime": 6771.3952, | |
| "train_tokens_per_second": 6865.393 | |
| }, | |
| { | |
| "epoch": 0.6248794599807136, | |
| "grad_norm": 0.21955394744873047, | |
| "learning_rate": 7.543520309477757e-05, | |
| "loss": 0.9762, | |
| "num_input_tokens_seen": 46531296, | |
| "step": 972, | |
| "train_runtime": 6777.3266, | |
| "train_tokens_per_second": 6865.73 | |
| }, | |
| { | |
| "epoch": 0.6255223400835744, | |
| "grad_norm": 0.23245960474014282, | |
| "learning_rate": 7.530625402965828e-05, | |
| "loss": 0.917, | |
| "num_input_tokens_seen": 46565248, | |
| "step": 973, | |
| "train_runtime": 6782.116, | |
| "train_tokens_per_second": 6865.888 | |
| }, | |
| { | |
| "epoch": 0.6261652201864353, | |
| "grad_norm": 0.20442916452884674, | |
| "learning_rate": 7.5177304964539e-05, | |
| "loss": 0.8955, | |
| "num_input_tokens_seen": 46611184, | |
| "step": 974, | |
| "train_runtime": 6788.4548, | |
| "train_tokens_per_second": 6866.244 | |
| }, | |
| { | |
| "epoch": 0.626808100289296, | |
| "grad_norm": 0.22477011382579803, | |
| "learning_rate": 7.504835589941973e-05, | |
| "loss": 0.9841, | |
| "num_input_tokens_seen": 46654144, | |
| "step": 975, | |
| "train_runtime": 6794.4059, | |
| "train_tokens_per_second": 6866.552 | |
| }, | |
| { | |
| "epoch": 0.6274509803921569, | |
| "grad_norm": 0.219425231218338, | |
| "learning_rate": 7.491940683430045e-05, | |
| "loss": 1.0111, | |
| "num_input_tokens_seen": 46716160, | |
| "step": 976, | |
| "train_runtime": 6802.9733, | |
| "train_tokens_per_second": 6867.021 | |
| }, | |
| { | |
| "epoch": 0.6280938604950177, | |
| "grad_norm": 0.2272089719772339, | |
| "learning_rate": 7.479045776918117e-05, | |
| "loss": 0.9653, | |
| "num_input_tokens_seen": 46761376, | |
| "step": 977, | |
| "train_runtime": 6809.176, | |
| "train_tokens_per_second": 6867.406 | |
| }, | |
| { | |
| "epoch": 0.6287367405978785, | |
| "grad_norm": 0.2164466679096222, | |
| "learning_rate": 7.46615087040619e-05, | |
| "loss": 0.9439, | |
| "num_input_tokens_seen": 46797264, | |
| "step": 978, | |
| "train_runtime": 6814.1155, | |
| "train_tokens_per_second": 6867.695 | |
| }, | |
| { | |
| "epoch": 0.6293796207007393, | |
| "grad_norm": 0.21363511681556702, | |
| "learning_rate": 7.453255963894262e-05, | |
| "loss": 0.9783, | |
| "num_input_tokens_seen": 46834144, | |
| "step": 979, | |
| "train_runtime": 6819.2729, | |
| "train_tokens_per_second": 6867.909 | |
| }, | |
| { | |
| "epoch": 0.6300225008036001, | |
| "grad_norm": 0.2254478931427002, | |
| "learning_rate": 7.440361057382335e-05, | |
| "loss": 1.0318, | |
| "num_input_tokens_seen": 46880720, | |
| "step": 980, | |
| "train_runtime": 6825.6472, | |
| "train_tokens_per_second": 6868.319 | |
| }, | |
| { | |
| "epoch": 0.630665380906461, | |
| "grad_norm": 0.22620360553264618, | |
| "learning_rate": 7.427466150870407e-05, | |
| "loss": 0.9323, | |
| "num_input_tokens_seen": 46917472, | |
| "step": 981, | |
| "train_runtime": 6830.7439, | |
| "train_tokens_per_second": 6868.574 | |
| }, | |
| { | |
| "epoch": 0.6313082610093218, | |
| "grad_norm": 0.21192996203899384, | |
| "learning_rate": 7.414571244358479e-05, | |
| "loss": 0.8626, | |
| "num_input_tokens_seen": 46978192, | |
| "step": 982, | |
| "train_runtime": 6839.1256, | |
| "train_tokens_per_second": 6869.035 | |
| }, | |
| { | |
| "epoch": 0.6319511411121825, | |
| "grad_norm": 0.22016724944114685, | |
| "learning_rate": 7.401676337846552e-05, | |
| "loss": 0.9411, | |
| "num_input_tokens_seen": 47047760, | |
| "step": 983, | |
| "train_runtime": 6848.6862, | |
| "train_tokens_per_second": 6869.604 | |
| }, | |
| { | |
| "epoch": 0.6325940212150434, | |
| "grad_norm": 0.24845948815345764, | |
| "learning_rate": 7.388781431334622e-05, | |
| "loss": 1.0784, | |
| "num_input_tokens_seen": 47098816, | |
| "step": 984, | |
| "train_runtime": 6855.6941, | |
| "train_tokens_per_second": 6870.029 | |
| }, | |
| { | |
| "epoch": 0.6332369013179042, | |
| "grad_norm": 0.2411433309316635, | |
| "learning_rate": 7.375886524822694e-05, | |
| "loss": 0.9888, | |
| "num_input_tokens_seen": 47154208, | |
| "step": 985, | |
| "train_runtime": 6863.351, | |
| "train_tokens_per_second": 6870.435 | |
| }, | |
| { | |
| "epoch": 0.6338797814207651, | |
| "grad_norm": 0.22008250653743744, | |
| "learning_rate": 7.362991618310767e-05, | |
| "loss": 0.9903, | |
| "num_input_tokens_seen": 47198608, | |
| "step": 986, | |
| "train_runtime": 6869.4842, | |
| "train_tokens_per_second": 6870.764 | |
| }, | |
| { | |
| "epoch": 0.6345226615236258, | |
| "grad_norm": 0.23359744250774384, | |
| "learning_rate": 7.350096711798839e-05, | |
| "loss": 1.0394, | |
| "num_input_tokens_seen": 47235120, | |
| "step": 987, | |
| "train_runtime": 6874.5459, | |
| "train_tokens_per_second": 6871.017 | |
| }, | |
| { | |
| "epoch": 0.6351655416264866, | |
| "grad_norm": 0.21749937534332275, | |
| "learning_rate": 7.337201805286912e-05, | |
| "loss": 0.9307, | |
| "num_input_tokens_seen": 47277952, | |
| "step": 988, | |
| "train_runtime": 6880.4288, | |
| "train_tokens_per_second": 6871.367 | |
| }, | |
| { | |
| "epoch": 0.6358084217293475, | |
| "grad_norm": 0.23919233679771423, | |
| "learning_rate": 7.324306898774984e-05, | |
| "loss": 0.9935, | |
| "num_input_tokens_seen": 47332336, | |
| "step": 989, | |
| "train_runtime": 6887.9261, | |
| "train_tokens_per_second": 6871.783 | |
| }, | |
| { | |
| "epoch": 0.6364513018322083, | |
| "grad_norm": 0.22570660710334778, | |
| "learning_rate": 7.311411992263056e-05, | |
| "loss": 0.9237, | |
| "num_input_tokens_seen": 47368256, | |
| "step": 990, | |
| "train_runtime": 6893.0199, | |
| "train_tokens_per_second": 6871.916 | |
| }, | |
| { | |
| "epoch": 0.6370941819350691, | |
| "grad_norm": 0.23035700619220734, | |
| "learning_rate": 7.298517085751129e-05, | |
| "loss": 1.0694, | |
| "num_input_tokens_seen": 47402480, | |
| "step": 991, | |
| "train_runtime": 6898.3258, | |
| "train_tokens_per_second": 6871.592 | |
| }, | |
| { | |
| "epoch": 0.6377370620379299, | |
| "grad_norm": 0.24699033796787262, | |
| "learning_rate": 7.285622179239201e-05, | |
| "loss": 0.997, | |
| "num_input_tokens_seen": 47478224, | |
| "step": 992, | |
| "train_runtime": 6908.8665, | |
| "train_tokens_per_second": 6872.071 | |
| }, | |
| { | |
| "epoch": 0.6383799421407907, | |
| "grad_norm": 0.20100495219230652, | |
| "learning_rate": 7.272727272727273e-05, | |
| "loss": 0.8458, | |
| "num_input_tokens_seen": 47516640, | |
| "step": 993, | |
| "train_runtime": 6914.2512, | |
| "train_tokens_per_second": 6872.276 | |
| }, | |
| { | |
| "epoch": 0.6390228222436516, | |
| "grad_norm": 0.20696420967578888, | |
| "learning_rate": 7.259832366215346e-05, | |
| "loss": 0.9597, | |
| "num_input_tokens_seen": 47558624, | |
| "step": 994, | |
| "train_runtime": 6920.1393, | |
| "train_tokens_per_second": 6872.495 | |
| }, | |
| { | |
| "epoch": 0.6396657023465123, | |
| "grad_norm": 0.23742607235908508, | |
| "learning_rate": 7.246937459703418e-05, | |
| "loss": 0.9151, | |
| "num_input_tokens_seen": 47629440, | |
| "step": 995, | |
| "train_runtime": 6930.0426, | |
| "train_tokens_per_second": 6872.893 | |
| }, | |
| { | |
| "epoch": 0.6403085824493732, | |
| "grad_norm": 0.21890178322792053, | |
| "learning_rate": 7.23404255319149e-05, | |
| "loss": 0.8402, | |
| "num_input_tokens_seen": 47668032, | |
| "step": 996, | |
| "train_runtime": 6935.4916, | |
| "train_tokens_per_second": 6873.057 | |
| }, | |
| { | |
| "epoch": 0.640951462552234, | |
| "grad_norm": 0.21457263827323914, | |
| "learning_rate": 7.221147646679563e-05, | |
| "loss": 0.9283, | |
| "num_input_tokens_seen": 47727584, | |
| "step": 997, | |
| "train_runtime": 6943.8296, | |
| "train_tokens_per_second": 6873.381 | |
| }, | |
| { | |
| "epoch": 0.6415943426550949, | |
| "grad_norm": 0.24617235362529755, | |
| "learning_rate": 7.208252740167633e-05, | |
| "loss": 1.0306, | |
| "num_input_tokens_seen": 47766352, | |
| "step": 998, | |
| "train_runtime": 6949.2829, | |
| "train_tokens_per_second": 6873.566 | |
| }, | |
| { | |
| "epoch": 0.6422372227579557, | |
| "grad_norm": 0.21127833425998688, | |
| "learning_rate": 7.195357833655706e-05, | |
| "loss": 0.9085, | |
| "num_input_tokens_seen": 47815232, | |
| "step": 999, | |
| "train_runtime": 6956.0924, | |
| "train_tokens_per_second": 6873.864 | |
| }, | |
| { | |
| "epoch": 0.6428801028608164, | |
| "grad_norm": 0.22037668526172638, | |
| "learning_rate": 7.182462927143778e-05, | |
| "loss": 1.0263, | |
| "num_input_tokens_seen": 47858784, | |
| "step": 1000, | |
| "train_runtime": 6962.152, | |
| "train_tokens_per_second": 6874.137 | |
| }, | |
| { | |
| "epoch": 0.6435229829636773, | |
| "grad_norm": 0.2265874296426773, | |
| "learning_rate": 7.16956802063185e-05, | |
| "loss": 1.0295, | |
| "num_input_tokens_seen": 47933472, | |
| "step": 1001, | |
| "train_runtime": 6972.5362, | |
| "train_tokens_per_second": 6874.611 | |
| }, | |
| { | |
| "epoch": 0.6441658630665381, | |
| "grad_norm": 0.22066611051559448, | |
| "learning_rate": 7.156673114119923e-05, | |
| "loss": 0.9419, | |
| "num_input_tokens_seen": 47997584, | |
| "step": 1002, | |
| "train_runtime": 6981.3745, | |
| "train_tokens_per_second": 6875.091 | |
| }, | |
| { | |
| "epoch": 0.644808743169399, | |
| "grad_norm": 0.2365170419216156, | |
| "learning_rate": 7.143778207607995e-05, | |
| "loss": 0.8646, | |
| "num_input_tokens_seen": 48063616, | |
| "step": 1003, | |
| "train_runtime": 6990.5257, | |
| "train_tokens_per_second": 6875.537 | |
| }, | |
| { | |
| "epoch": 0.6454516232722597, | |
| "grad_norm": 0.19993442296981812, | |
| "learning_rate": 7.130883301096067e-05, | |
| "loss": 0.8968, | |
| "num_input_tokens_seen": 48127984, | |
| "step": 1004, | |
| "train_runtime": 6999.4566, | |
| "train_tokens_per_second": 6875.96 | |
| }, | |
| { | |
| "epoch": 0.6460945033751205, | |
| "grad_norm": 0.21699395775794983, | |
| "learning_rate": 7.11798839458414e-05, | |
| "loss": 0.9993, | |
| "num_input_tokens_seen": 48180272, | |
| "step": 1005, | |
| "train_runtime": 7006.6964, | |
| "train_tokens_per_second": 6876.318 | |
| }, | |
| { | |
| "epoch": 0.6467373834779814, | |
| "grad_norm": 0.2222331166267395, | |
| "learning_rate": 7.105093488072212e-05, | |
| "loss": 0.9866, | |
| "num_input_tokens_seen": 48244928, | |
| "step": 1006, | |
| "train_runtime": 7015.6856, | |
| "train_tokens_per_second": 6876.723 | |
| }, | |
| { | |
| "epoch": 0.6473802635808422, | |
| "grad_norm": 0.20489053428173065, | |
| "learning_rate": 7.092198581560284e-05, | |
| "loss": 0.8411, | |
| "num_input_tokens_seen": 48295296, | |
| "step": 1007, | |
| "train_runtime": 7022.675, | |
| "train_tokens_per_second": 6877.051 | |
| }, | |
| { | |
| "epoch": 0.648023143683703, | |
| "grad_norm": 0.2395627647638321, | |
| "learning_rate": 7.079303675048357e-05, | |
| "loss": 1.0088, | |
| "num_input_tokens_seen": 48326816, | |
| "step": 1008, | |
| "train_runtime": 7027.137, | |
| "train_tokens_per_second": 6877.17 | |
| }, | |
| { | |
| "epoch": 0.6486660237865638, | |
| "grad_norm": 0.22366495430469513, | |
| "learning_rate": 7.066408768536429e-05, | |
| "loss": 1.0026, | |
| "num_input_tokens_seen": 48363488, | |
| "step": 1009, | |
| "train_runtime": 7032.2438, | |
| "train_tokens_per_second": 6877.391 | |
| }, | |
| { | |
| "epoch": 0.6493089038894246, | |
| "grad_norm": 0.23582132160663605, | |
| "learning_rate": 7.053513862024502e-05, | |
| "loss": 0.9802, | |
| "num_input_tokens_seen": 48429872, | |
| "step": 1010, | |
| "train_runtime": 7041.4949, | |
| "train_tokens_per_second": 6877.783 | |
| }, | |
| { | |
| "epoch": 0.6499517839922855, | |
| "grad_norm": 0.23157043755054474, | |
| "learning_rate": 7.040618955512572e-05, | |
| "loss": 1.0195, | |
| "num_input_tokens_seen": 48491216, | |
| "step": 1011, | |
| "train_runtime": 7050.0327, | |
| "train_tokens_per_second": 6878.155 | |
| }, | |
| { | |
| "epoch": 0.6505946640951462, | |
| "grad_norm": 0.22757606208324432, | |
| "learning_rate": 7.027724049000644e-05, | |
| "loss": 0.9446, | |
| "num_input_tokens_seen": 48536352, | |
| "step": 1012, | |
| "train_runtime": 7056.2998, | |
| "train_tokens_per_second": 6878.442 | |
| }, | |
| { | |
| "epoch": 0.6512375441980071, | |
| "grad_norm": 0.22248154878616333, | |
| "learning_rate": 7.014829142488717e-05, | |
| "loss": 0.9717, | |
| "num_input_tokens_seen": 48578576, | |
| "step": 1013, | |
| "train_runtime": 7062.133, | |
| "train_tokens_per_second": 6878.74 | |
| }, | |
| { | |
| "epoch": 0.6518804243008679, | |
| "grad_norm": 0.23368652164936066, | |
| "learning_rate": 7.001934235976789e-05, | |
| "loss": 0.9362, | |
| "num_input_tokens_seen": 48636000, | |
| "step": 1014, | |
| "train_runtime": 7070.1159, | |
| "train_tokens_per_second": 6879.095 | |
| }, | |
| { | |
| "epoch": 0.6525233044037287, | |
| "grad_norm": 0.21449260413646698, | |
| "learning_rate": 6.989039329464861e-05, | |
| "loss": 0.901, | |
| "num_input_tokens_seen": 48669152, | |
| "step": 1015, | |
| "train_runtime": 7074.7527, | |
| "train_tokens_per_second": 6879.273 | |
| }, | |
| { | |
| "epoch": 0.6531661845065895, | |
| "grad_norm": 0.2274601012468338, | |
| "learning_rate": 6.976144422952934e-05, | |
| "loss": 0.9272, | |
| "num_input_tokens_seen": 48704112, | |
| "step": 1016, | |
| "train_runtime": 7079.616, | |
| "train_tokens_per_second": 6879.485 | |
| }, | |
| { | |
| "epoch": 0.6538090646094503, | |
| "grad_norm": 0.2232244312763214, | |
| "learning_rate": 6.963249516441006e-05, | |
| "loss": 1.0063, | |
| "num_input_tokens_seen": 48765600, | |
| "step": 1017, | |
| "train_runtime": 7088.0798, | |
| "train_tokens_per_second": 6879.945 | |
| }, | |
| { | |
| "epoch": 0.6544519447123112, | |
| "grad_norm": 0.2260793298482895, | |
| "learning_rate": 6.950354609929079e-05, | |
| "loss": 0.8803, | |
| "num_input_tokens_seen": 48806128, | |
| "step": 1018, | |
| "train_runtime": 7093.6664, | |
| "train_tokens_per_second": 6880.24 | |
| }, | |
| { | |
| "epoch": 0.655094824815172, | |
| "grad_norm": 0.23438192903995514, | |
| "learning_rate": 6.937459703417151e-05, | |
| "loss": 1.0313, | |
| "num_input_tokens_seen": 48849328, | |
| "step": 1019, | |
| "train_runtime": 7099.6643, | |
| "train_tokens_per_second": 6880.512 | |
| }, | |
| { | |
| "epoch": 0.6557377049180327, | |
| "grad_norm": 0.23910987377166748, | |
| "learning_rate": 6.924564796905223e-05, | |
| "loss": 0.9334, | |
| "num_input_tokens_seen": 48891040, | |
| "step": 1020, | |
| "train_runtime": 7105.4233, | |
| "train_tokens_per_second": 6880.806 | |
| }, | |
| { | |
| "epoch": 0.6563805850208936, | |
| "grad_norm": 0.2428818792104721, | |
| "learning_rate": 6.911669890393296e-05, | |
| "loss": 1.0331, | |
| "num_input_tokens_seen": 48953104, | |
| "step": 1021, | |
| "train_runtime": 7114.4728, | |
| "train_tokens_per_second": 6880.777 | |
| }, | |
| { | |
| "epoch": 0.6570234651237544, | |
| "grad_norm": 0.24574337899684906, | |
| "learning_rate": 6.898774983881368e-05, | |
| "loss": 1.0121, | |
| "num_input_tokens_seen": 48992464, | |
| "step": 1022, | |
| "train_runtime": 7119.9009, | |
| "train_tokens_per_second": 6881.06 | |
| }, | |
| { | |
| "epoch": 0.6576663452266153, | |
| "grad_norm": 0.24428240954875946, | |
| "learning_rate": 6.88588007736944e-05, | |
| "loss": 1.0972, | |
| "num_input_tokens_seen": 49039008, | |
| "step": 1023, | |
| "train_runtime": 7126.2761, | |
| "train_tokens_per_second": 6881.435 | |
| }, | |
| { | |
| "epoch": 0.658309225329476, | |
| "grad_norm": 0.2183476835489273, | |
| "learning_rate": 6.872985170857513e-05, | |
| "loss": 0.9851, | |
| "num_input_tokens_seen": 49085344, | |
| "step": 1024, | |
| "train_runtime": 7132.642, | |
| "train_tokens_per_second": 6881.79 | |
| }, | |
| { | |
| "epoch": 0.6589521054323368, | |
| "grad_norm": 0.24681338667869568, | |
| "learning_rate": 6.860090264345583e-05, | |
| "loss": 0.9841, | |
| "num_input_tokens_seen": 49150688, | |
| "step": 1025, | |
| "train_runtime": 7141.7025, | |
| "train_tokens_per_second": 6882.209 | |
| }, | |
| { | |
| "epoch": 0.6595949855351977, | |
| "grad_norm": 0.21444672346115112, | |
| "learning_rate": 6.847195357833656e-05, | |
| "loss": 0.9491, | |
| "num_input_tokens_seen": 49191440, | |
| "step": 1026, | |
| "train_runtime": 7147.3276, | |
| "train_tokens_per_second": 6882.494 | |
| }, | |
| { | |
| "epoch": 0.6602378656380585, | |
| "grad_norm": 0.21985282003879547, | |
| "learning_rate": 6.834300451321728e-05, | |
| "loss": 0.9602, | |
| "num_input_tokens_seen": 49248928, | |
| "step": 1027, | |
| "train_runtime": 7155.1844, | |
| "train_tokens_per_second": 6882.971 | |
| }, | |
| { | |
| "epoch": 0.6608807457409194, | |
| "grad_norm": 0.24706678092479706, | |
| "learning_rate": 6.8214055448098e-05, | |
| "loss": 1.0032, | |
| "num_input_tokens_seen": 49306448, | |
| "step": 1028, | |
| "train_runtime": 7163.1356, | |
| "train_tokens_per_second": 6883.361 | |
| }, | |
| { | |
| "epoch": 0.6615236258437801, | |
| "grad_norm": 0.22101391851902008, | |
| "learning_rate": 6.808510638297873e-05, | |
| "loss": 1.0164, | |
| "num_input_tokens_seen": 49353728, | |
| "step": 1029, | |
| "train_runtime": 7169.5972, | |
| "train_tokens_per_second": 6883.752 | |
| }, | |
| { | |
| "epoch": 0.662166505946641, | |
| "grad_norm": 0.21555444598197937, | |
| "learning_rate": 6.795615731785945e-05, | |
| "loss": 0.8685, | |
| "num_input_tokens_seen": 49414256, | |
| "step": 1030, | |
| "train_runtime": 7177.9909, | |
| "train_tokens_per_second": 6884.135 | |
| }, | |
| { | |
| "epoch": 0.6628093860495018, | |
| "grad_norm": 0.23320741951465607, | |
| "learning_rate": 6.782720825274017e-05, | |
| "loss": 1.0389, | |
| "num_input_tokens_seen": 49487152, | |
| "step": 1031, | |
| "train_runtime": 7188.0883, | |
| "train_tokens_per_second": 6884.605 | |
| }, | |
| { | |
| "epoch": 0.6634522661523626, | |
| "grad_norm": 0.23155942559242249, | |
| "learning_rate": 6.76982591876209e-05, | |
| "loss": 0.9408, | |
| "num_input_tokens_seen": 49526848, | |
| "step": 1032, | |
| "train_runtime": 7193.6458, | |
| "train_tokens_per_second": 6884.805 | |
| }, | |
| { | |
| "epoch": 0.6640951462552234, | |
| "grad_norm": 0.2161242812871933, | |
| "learning_rate": 6.756931012250162e-05, | |
| "loss": 0.9456, | |
| "num_input_tokens_seen": 49585168, | |
| "step": 1033, | |
| "train_runtime": 7201.6963, | |
| "train_tokens_per_second": 6885.207 | |
| }, | |
| { | |
| "epoch": 0.6647380263580842, | |
| "grad_norm": 0.20924127101898193, | |
| "learning_rate": 6.744036105738233e-05, | |
| "loss": 0.9401, | |
| "num_input_tokens_seen": 49632320, | |
| "step": 1034, | |
| "train_runtime": 7208.1656, | |
| "train_tokens_per_second": 6885.569 | |
| }, | |
| { | |
| "epoch": 0.665380906460945, | |
| "grad_norm": 0.21134765446186066, | |
| "learning_rate": 6.731141199226307e-05, | |
| "loss": 1.0104, | |
| "num_input_tokens_seen": 49682064, | |
| "step": 1035, | |
| "train_runtime": 7215.068, | |
| "train_tokens_per_second": 6885.876 | |
| }, | |
| { | |
| "epoch": 0.6660237865638059, | |
| "grad_norm": 0.21447201073169708, | |
| "learning_rate": 6.718246292714378e-05, | |
| "loss": 0.9398, | |
| "num_input_tokens_seen": 49729392, | |
| "step": 1036, | |
| "train_runtime": 7221.566, | |
| "train_tokens_per_second": 6886.234 | |
| }, | |
| { | |
| "epoch": 0.6666666666666666, | |
| "grad_norm": 0.22306424379348755, | |
| "learning_rate": 6.70535138620245e-05, | |
| "loss": 0.9365, | |
| "num_input_tokens_seen": 49793296, | |
| "step": 1037, | |
| "train_runtime": 7230.3142, | |
| "train_tokens_per_second": 6886.74 | |
| }, | |
| { | |
| "epoch": 0.6673095467695275, | |
| "grad_norm": 0.2094729244709015, | |
| "learning_rate": 6.692456479690522e-05, | |
| "loss": 0.992, | |
| "num_input_tokens_seen": 49836256, | |
| "step": 1038, | |
| "train_runtime": 7236.29, | |
| "train_tokens_per_second": 6886.99 | |
| }, | |
| { | |
| "epoch": 0.6679524268723883, | |
| "grad_norm": 0.21107782423496246, | |
| "learning_rate": 6.679561573178594e-05, | |
| "loss": 0.9429, | |
| "num_input_tokens_seen": 49899120, | |
| "step": 1039, | |
| "train_runtime": 7244.9437, | |
| "train_tokens_per_second": 6887.441 | |
| }, | |
| { | |
| "epoch": 0.6685953069752492, | |
| "grad_norm": 0.2193991243839264, | |
| "learning_rate": 6.666666666666667e-05, | |
| "loss": 0.875, | |
| "num_input_tokens_seen": 49970224, | |
| "step": 1040, | |
| "train_runtime": 7254.7327, | |
| "train_tokens_per_second": 6887.948 | |
| }, | |
| { | |
| "epoch": 0.6692381870781099, | |
| "grad_norm": 0.20523865520954132, | |
| "learning_rate": 6.653771760154739e-05, | |
| "loss": 0.9484, | |
| "num_input_tokens_seen": 50030208, | |
| "step": 1041, | |
| "train_runtime": 7263.034, | |
| "train_tokens_per_second": 6888.335 | |
| }, | |
| { | |
| "epoch": 0.6698810671809707, | |
| "grad_norm": 0.242182657122612, | |
| "learning_rate": 6.64087685364281e-05, | |
| "loss": 0.9938, | |
| "num_input_tokens_seen": 50109888, | |
| "step": 1042, | |
| "train_runtime": 7274.1431, | |
| "train_tokens_per_second": 6888.769 | |
| }, | |
| { | |
| "epoch": 0.6705239472838316, | |
| "grad_norm": 0.21813493967056274, | |
| "learning_rate": 6.627981947130884e-05, | |
| "loss": 1.0141, | |
| "num_input_tokens_seen": 50173184, | |
| "step": 1043, | |
| "train_runtime": 7282.8986, | |
| "train_tokens_per_second": 6889.178 | |
| }, | |
| { | |
| "epoch": 0.6711668273866924, | |
| "grad_norm": 0.2105100452899933, | |
| "learning_rate": 6.615087040618956e-05, | |
| "loss": 0.8706, | |
| "num_input_tokens_seen": 50229232, | |
| "step": 1044, | |
| "train_runtime": 7290.7196, | |
| "train_tokens_per_second": 6889.475 | |
| }, | |
| { | |
| "epoch": 0.6718097074895532, | |
| "grad_norm": 0.21437270939350128, | |
| "learning_rate": 6.602192134107029e-05, | |
| "loss": 1.0573, | |
| "num_input_tokens_seen": 50277392, | |
| "step": 1045, | |
| "train_runtime": 7297.3971, | |
| "train_tokens_per_second": 6889.771 | |
| }, | |
| { | |
| "epoch": 0.672452587592414, | |
| "grad_norm": 0.24188022315502167, | |
| "learning_rate": 6.5892972275951e-05, | |
| "loss": 0.984, | |
| "num_input_tokens_seen": 50334688, | |
| "step": 1046, | |
| "train_runtime": 7305.3843, | |
| "train_tokens_per_second": 6890.081 | |
| }, | |
| { | |
| "epoch": 0.6730954676952748, | |
| "grad_norm": 0.2214278280735016, | |
| "learning_rate": 6.576402321083172e-05, | |
| "loss": 0.9764, | |
| "num_input_tokens_seen": 50380240, | |
| "step": 1047, | |
| "train_runtime": 7311.6909, | |
| "train_tokens_per_second": 6890.368 | |
| }, | |
| { | |
| "epoch": 0.6737383477981357, | |
| "grad_norm": 0.20579014718532562, | |
| "learning_rate": 6.563507414571246e-05, | |
| "loss": 1.1293, | |
| "num_input_tokens_seen": 50424352, | |
| "step": 1048, | |
| "train_runtime": 7317.8961, | |
| "train_tokens_per_second": 6890.553 | |
| }, | |
| { | |
| "epoch": 0.6743812279009964, | |
| "grad_norm": 0.21741363406181335, | |
| "learning_rate": 6.550612508059317e-05, | |
| "loss": 0.9443, | |
| "num_input_tokens_seen": 50467216, | |
| "step": 1049, | |
| "train_runtime": 7323.8851, | |
| "train_tokens_per_second": 6890.771 | |
| }, | |
| { | |
| "epoch": 0.6750241080038573, | |
| "grad_norm": 0.2026466727256775, | |
| "learning_rate": 6.537717601547389e-05, | |
| "loss": 0.854, | |
| "num_input_tokens_seen": 50501040, | |
| "step": 1050, | |
| "train_runtime": 7328.7043, | |
| "train_tokens_per_second": 6890.855 | |
| }, | |
| { | |
| "epoch": 0.6756669881067181, | |
| "grad_norm": 0.18450354039669037, | |
| "learning_rate": 6.524822695035462e-05, | |
| "loss": 0.8429, | |
| "num_input_tokens_seen": 50542768, | |
| "step": 1051, | |
| "train_runtime": 7335.0852, | |
| "train_tokens_per_second": 6890.55 | |
| }, | |
| { | |
| "epoch": 0.676309868209579, | |
| "grad_norm": 0.2224583476781845, | |
| "learning_rate": 6.511927788523533e-05, | |
| "loss": 0.9466, | |
| "num_input_tokens_seen": 50632528, | |
| "step": 1052, | |
| "train_runtime": 7347.6703, | |
| "train_tokens_per_second": 6890.963 | |
| }, | |
| { | |
| "epoch": 0.6769527483124397, | |
| "grad_norm": 0.20810087025165558, | |
| "learning_rate": 6.499032882011606e-05, | |
| "loss": 0.875, | |
| "num_input_tokens_seen": 50685568, | |
| "step": 1053, | |
| "train_runtime": 7355.0956, | |
| "train_tokens_per_second": 6891.218 | |
| }, | |
| { | |
| "epoch": 0.6775956284153005, | |
| "grad_norm": 0.2427845001220703, | |
| "learning_rate": 6.486137975499678e-05, | |
| "loss": 1.0109, | |
| "num_input_tokens_seen": 50744800, | |
| "step": 1054, | |
| "train_runtime": 7363.4158, | |
| "train_tokens_per_second": 6891.476 | |
| }, | |
| { | |
| "epoch": 0.6782385085181614, | |
| "grad_norm": 0.2223530411720276, | |
| "learning_rate": 6.47324306898775e-05, | |
| "loss": 0.7355, | |
| "num_input_tokens_seen": 50788688, | |
| "step": 1055, | |
| "train_runtime": 7369.5565, | |
| "train_tokens_per_second": 6891.689 | |
| }, | |
| { | |
| "epoch": 0.6788813886210222, | |
| "grad_norm": 0.2333330661058426, | |
| "learning_rate": 6.460348162475823e-05, | |
| "loss": 0.9833, | |
| "num_input_tokens_seen": 50832736, | |
| "step": 1056, | |
| "train_runtime": 7375.7831, | |
| "train_tokens_per_second": 6891.843 | |
| }, | |
| { | |
| "epoch": 0.6795242687238829, | |
| "grad_norm": 0.21342216432094574, | |
| "learning_rate": 6.447453255963895e-05, | |
| "loss": 0.8388, | |
| "num_input_tokens_seen": 50879456, | |
| "step": 1057, | |
| "train_runtime": 7382.3467, | |
| "train_tokens_per_second": 6892.044 | |
| }, | |
| { | |
| "epoch": 0.6801671488267438, | |
| "grad_norm": 0.2341690957546234, | |
| "learning_rate": 6.434558349451966e-05, | |
| "loss": 0.9347, | |
| "num_input_tokens_seen": 50934720, | |
| "step": 1058, | |
| "train_runtime": 7390.0582, | |
| "train_tokens_per_second": 6892.33 | |
| }, | |
| { | |
| "epoch": 0.6808100289296046, | |
| "grad_norm": 0.2247081845998764, | |
| "learning_rate": 6.42166344294004e-05, | |
| "loss": 0.8637, | |
| "num_input_tokens_seen": 50990400, | |
| "step": 1059, | |
| "train_runtime": 7397.8508, | |
| "train_tokens_per_second": 6892.596 | |
| }, | |
| { | |
| "epoch": 0.6814529090324655, | |
| "grad_norm": 0.23331518471240997, | |
| "learning_rate": 6.408768536428111e-05, | |
| "loss": 1.1459, | |
| "num_input_tokens_seen": 51031360, | |
| "step": 1060, | |
| "train_runtime": 7403.6192, | |
| "train_tokens_per_second": 6892.759 | |
| }, | |
| { | |
| "epoch": 0.6820957891353263, | |
| "grad_norm": 0.2078360766172409, | |
| "learning_rate": 6.395873629916183e-05, | |
| "loss": 0.8934, | |
| "num_input_tokens_seen": 51068048, | |
| "step": 1061, | |
| "train_runtime": 7408.8002, | |
| "train_tokens_per_second": 6892.89 | |
| }, | |
| { | |
| "epoch": 0.682738669238187, | |
| "grad_norm": 0.24373888969421387, | |
| "learning_rate": 6.382978723404256e-05, | |
| "loss": 0.9581, | |
| "num_input_tokens_seen": 51104944, | |
| "step": 1062, | |
| "train_runtime": 7414.0038, | |
| "train_tokens_per_second": 6893.029 | |
| }, | |
| { | |
| "epoch": 0.6833815493410479, | |
| "grad_norm": 0.2216201275587082, | |
| "learning_rate": 6.370083816892328e-05, | |
| "loss": 1.0246, | |
| "num_input_tokens_seen": 51153904, | |
| "step": 1063, | |
| "train_runtime": 7420.8674, | |
| "train_tokens_per_second": 6893.251 | |
| }, | |
| { | |
| "epoch": 0.6840244294439087, | |
| "grad_norm": 0.25028952956199646, | |
| "learning_rate": 6.3571889103804e-05, | |
| "loss": 1.2053, | |
| "num_input_tokens_seen": 51212272, | |
| "step": 1064, | |
| "train_runtime": 7429.1124, | |
| "train_tokens_per_second": 6893.458 | |
| }, | |
| { | |
| "epoch": 0.6846673095467696, | |
| "grad_norm": 0.1991652399301529, | |
| "learning_rate": 6.344294003868472e-05, | |
| "loss": 0.8922, | |
| "num_input_tokens_seen": 51249952, | |
| "step": 1065, | |
| "train_runtime": 7434.4247, | |
| "train_tokens_per_second": 6893.6 | |
| }, | |
| { | |
| "epoch": 0.6853101896496303, | |
| "grad_norm": 0.22701826691627502, | |
| "learning_rate": 6.331399097356544e-05, | |
| "loss": 0.9936, | |
| "num_input_tokens_seen": 51302224, | |
| "step": 1066, | |
| "train_runtime": 7441.7003, | |
| "train_tokens_per_second": 6893.885 | |
| }, | |
| { | |
| "epoch": 0.6859530697524912, | |
| "grad_norm": 0.21672441065311432, | |
| "learning_rate": 6.318504190844617e-05, | |
| "loss": 1.0611, | |
| "num_input_tokens_seen": 51367808, | |
| "step": 1067, | |
| "train_runtime": 7450.9283, | |
| "train_tokens_per_second": 6894.149 | |
| }, | |
| { | |
| "epoch": 0.686595949855352, | |
| "grad_norm": 0.22594638168811798, | |
| "learning_rate": 6.305609284332689e-05, | |
| "loss": 0.93, | |
| "num_input_tokens_seen": 51436192, | |
| "step": 1068, | |
| "train_runtime": 7460.4525, | |
| "train_tokens_per_second": 6894.514 | |
| }, | |
| { | |
| "epoch": 0.6872388299582128, | |
| "grad_norm": 0.22045005857944489, | |
| "learning_rate": 6.29271437782076e-05, | |
| "loss": 0.9998, | |
| "num_input_tokens_seen": 51487824, | |
| "step": 1069, | |
| "train_runtime": 7467.708, | |
| "train_tokens_per_second": 6894.729 | |
| }, | |
| { | |
| "epoch": 0.6878817100610736, | |
| "grad_norm": 0.2007933109998703, | |
| "learning_rate": 6.279819471308834e-05, | |
| "loss": 0.959, | |
| "num_input_tokens_seen": 51533248, | |
| "step": 1070, | |
| "train_runtime": 7474.0741, | |
| "train_tokens_per_second": 6894.934 | |
| }, | |
| { | |
| "epoch": 0.6885245901639344, | |
| "grad_norm": 0.2333477884531021, | |
| "learning_rate": 6.266924564796905e-05, | |
| "loss": 1.0436, | |
| "num_input_tokens_seen": 51590096, | |
| "step": 1071, | |
| "train_runtime": 7482.0555, | |
| "train_tokens_per_second": 6895.177 | |
| }, | |
| { | |
| "epoch": 0.6891674702667953, | |
| "grad_norm": 0.2452705204486847, | |
| "learning_rate": 6.254029658284977e-05, | |
| "loss": 1.1345, | |
| "num_input_tokens_seen": 51660640, | |
| "step": 1072, | |
| "train_runtime": 7491.8973, | |
| "train_tokens_per_second": 6895.535 | |
| }, | |
| { | |
| "epoch": 0.6898103503696561, | |
| "grad_norm": 0.2273714393377304, | |
| "learning_rate": 6.24113475177305e-05, | |
| "loss": 0.9046, | |
| "num_input_tokens_seen": 51722848, | |
| "step": 1073, | |
| "train_runtime": 7500.6012, | |
| "train_tokens_per_second": 6895.827 | |
| }, | |
| { | |
| "epoch": 0.6904532304725168, | |
| "grad_norm": 0.22089748084545135, | |
| "learning_rate": 6.228239845261122e-05, | |
| "loss": 0.9745, | |
| "num_input_tokens_seen": 51760048, | |
| "step": 1074, | |
| "train_runtime": 7505.8386, | |
| "train_tokens_per_second": 6895.971 | |
| }, | |
| { | |
| "epoch": 0.6910961105753777, | |
| "grad_norm": 0.20138859748840332, | |
| "learning_rate": 6.215344938749195e-05, | |
| "loss": 0.8623, | |
| "num_input_tokens_seen": 51805552, | |
| "step": 1075, | |
| "train_runtime": 7512.2247, | |
| "train_tokens_per_second": 6896.166 | |
| }, | |
| { | |
| "epoch": 0.6917389906782385, | |
| "grad_norm": 0.20670074224472046, | |
| "learning_rate": 6.202450032237267e-05, | |
| "loss": 0.9809, | |
| "num_input_tokens_seen": 51870080, | |
| "step": 1076, | |
| "train_runtime": 7521.3065, | |
| "train_tokens_per_second": 6896.419 | |
| }, | |
| { | |
| "epoch": 0.6923818707810994, | |
| "grad_norm": 0.22219733893871307, | |
| "learning_rate": 6.189555125725339e-05, | |
| "loss": 0.9614, | |
| "num_input_tokens_seen": 51916400, | |
| "step": 1077, | |
| "train_runtime": 7527.8271, | |
| "train_tokens_per_second": 6896.598 | |
| }, | |
| { | |
| "epoch": 0.6930247508839601, | |
| "grad_norm": 0.2168516218662262, | |
| "learning_rate": 6.176660219213412e-05, | |
| "loss": 0.9194, | |
| "num_input_tokens_seen": 51950992, | |
| "step": 1078, | |
| "train_runtime": 7532.7731, | |
| "train_tokens_per_second": 6896.662 | |
| }, | |
| { | |
| "epoch": 0.6936676309868209, | |
| "grad_norm": 0.2015160173177719, | |
| "learning_rate": 6.163765312701483e-05, | |
| "loss": 0.891, | |
| "num_input_tokens_seen": 51983408, | |
| "step": 1079, | |
| "train_runtime": 7537.4038, | |
| "train_tokens_per_second": 6896.726 | |
| }, | |
| { | |
| "epoch": 0.6943105110896818, | |
| "grad_norm": 0.21054089069366455, | |
| "learning_rate": 6.150870406189554e-05, | |
| "loss": 0.9726, | |
| "num_input_tokens_seen": 52063120, | |
| "step": 1080, | |
| "train_runtime": 7548.7363, | |
| "train_tokens_per_second": 6896.932 | |
| }, | |
| { | |
| "epoch": 0.6949533911925426, | |
| "grad_norm": 0.2329845428466797, | |
| "learning_rate": 6.137975499677628e-05, | |
| "loss": 1.0234, | |
| "num_input_tokens_seen": 52108432, | |
| "step": 1081, | |
| "train_runtime": 7555.6633, | |
| "train_tokens_per_second": 6896.606 | |
| }, | |
| { | |
| "epoch": 0.6955962712954034, | |
| "grad_norm": 0.24675798416137695, | |
| "learning_rate": 6.1250805931657e-05, | |
| "loss": 1.0005, | |
| "num_input_tokens_seen": 52164368, | |
| "step": 1082, | |
| "train_runtime": 7563.4869, | |
| "train_tokens_per_second": 6896.868 | |
| }, | |
| { | |
| "epoch": 0.6962391513982642, | |
| "grad_norm": 0.21558962762355804, | |
| "learning_rate": 6.112185686653773e-05, | |
| "loss": 0.961, | |
| "num_input_tokens_seen": 52213952, | |
| "step": 1083, | |
| "train_runtime": 7570.4103, | |
| "train_tokens_per_second": 6897.11 | |
| }, | |
| { | |
| "epoch": 0.696882031501125, | |
| "grad_norm": 0.21725592017173767, | |
| "learning_rate": 6.0992907801418444e-05, | |
| "loss": 0.9962, | |
| "num_input_tokens_seen": 52275392, | |
| "step": 1084, | |
| "train_runtime": 7578.9986, | |
| "train_tokens_per_second": 6897.401 | |
| }, | |
| { | |
| "epoch": 0.6975249116039859, | |
| "grad_norm": 0.20202240347862244, | |
| "learning_rate": 6.086395873629916e-05, | |
| "loss": 0.8846, | |
| "num_input_tokens_seen": 52326960, | |
| "step": 1085, | |
| "train_runtime": 7586.2257, | |
| "train_tokens_per_second": 6897.628 | |
| }, | |
| { | |
| "epoch": 0.6981677917068466, | |
| "grad_norm": 0.24250298738479614, | |
| "learning_rate": 6.0735009671179887e-05, | |
| "loss": 0.9109, | |
| "num_input_tokens_seen": 52357504, | |
| "step": 1086, | |
| "train_runtime": 7590.5452, | |
| "train_tokens_per_second": 6897.726 | |
| }, | |
| { | |
| "epoch": 0.6988106718097075, | |
| "grad_norm": 0.21728849411010742, | |
| "learning_rate": 6.060606060606061e-05, | |
| "loss": 0.9872, | |
| "num_input_tokens_seen": 52401488, | |
| "step": 1087, | |
| "train_runtime": 7596.6765, | |
| "train_tokens_per_second": 6897.949 | |
| }, | |
| { | |
| "epoch": 0.6994535519125683, | |
| "grad_norm": 0.20992811024188995, | |
| "learning_rate": 6.0477111540941336e-05, | |
| "loss": 0.9504, | |
| "num_input_tokens_seen": 52467152, | |
| "step": 1088, | |
| "train_runtime": 7605.7442, | |
| "train_tokens_per_second": 6898.359 | |
| }, | |
| { | |
| "epoch": 0.7000964320154291, | |
| "grad_norm": 0.20924942195415497, | |
| "learning_rate": 6.0348162475822054e-05, | |
| "loss": 1.0382, | |
| "num_input_tokens_seen": 52521776, | |
| "step": 1089, | |
| "train_runtime": 7613.3461, | |
| "train_tokens_per_second": 6898.645 | |
| }, | |
| { | |
| "epoch": 0.70073931211829, | |
| "grad_norm": 0.23880977928638458, | |
| "learning_rate": 6.021921341070278e-05, | |
| "loss": 1.0625, | |
| "num_input_tokens_seen": 52560640, | |
| "step": 1090, | |
| "train_runtime": 7618.7656, | |
| "train_tokens_per_second": 6898.839 | |
| }, | |
| { | |
| "epoch": 0.7013821922211507, | |
| "grad_norm": 0.22585086524486542, | |
| "learning_rate": 6.0090264345583504e-05, | |
| "loss": 0.9023, | |
| "num_input_tokens_seen": 52595664, | |
| "step": 1091, | |
| "train_runtime": 7623.6886, | |
| "train_tokens_per_second": 6898.979 | |
| }, | |
| { | |
| "epoch": 0.7020250723240116, | |
| "grad_norm": 0.2203749567270279, | |
| "learning_rate": 5.9961315280464216e-05, | |
| "loss": 0.9401, | |
| "num_input_tokens_seen": 52628416, | |
| "step": 1092, | |
| "train_runtime": 7628.3522, | |
| "train_tokens_per_second": 6899.054 | |
| }, | |
| { | |
| "epoch": 0.7020250723240116, | |
| "eval_loss": 1.002116084098816, | |
| "eval_runtime": 39.9717, | |
| "eval_samples_per_second": 24.868, | |
| "eval_steps_per_second": 1.576, | |
| "num_input_tokens_seen": 52628416, | |
| "step": 1092 | |
| }, | |
| { | |
| "epoch": 0.7026679524268724, | |
| "grad_norm": 0.20180866122245789, | |
| "learning_rate": 5.983236621534494e-05, | |
| "loss": 0.8595, | |
| "num_input_tokens_seen": 52685664, | |
| "step": 1093, | |
| "train_runtime": 7676.3331, | |
| "train_tokens_per_second": 6863.39 | |
| }, | |
| { | |
| "epoch": 0.7033108325297333, | |
| "grad_norm": 0.21487735211849213, | |
| "learning_rate": 5.970341715022566e-05, | |
| "loss": 0.9204, | |
| "num_input_tokens_seen": 52728496, | |
| "step": 1094, | |
| "train_runtime": 7682.3441, | |
| "train_tokens_per_second": 6863.595 | |
| }, | |
| { | |
| "epoch": 0.703953712632594, | |
| "grad_norm": 0.21911489963531494, | |
| "learning_rate": 5.9574468085106384e-05, | |
| "loss": 0.8805, | |
| "num_input_tokens_seen": 52793232, | |
| "step": 1095, | |
| "train_runtime": 7691.3798, | |
| "train_tokens_per_second": 6863.948 | |
| }, | |
| { | |
| "epoch": 0.7045965927354548, | |
| "grad_norm": 0.21352975070476532, | |
| "learning_rate": 5.944551901998711e-05, | |
| "loss": 0.9869, | |
| "num_input_tokens_seen": 52845856, | |
| "step": 1096, | |
| "train_runtime": 7698.7181, | |
| "train_tokens_per_second": 6864.241 | |
| }, | |
| { | |
| "epoch": 0.7052394728383157, | |
| "grad_norm": 0.22658900916576385, | |
| "learning_rate": 5.9316569954867827e-05, | |
| "loss": 0.8745, | |
| "num_input_tokens_seen": 52907328, | |
| "step": 1097, | |
| "train_runtime": 7707.3226, | |
| "train_tokens_per_second": 6864.553 | |
| }, | |
| { | |
| "epoch": 0.7058823529411765, | |
| "grad_norm": 0.21794851124286652, | |
| "learning_rate": 5.918762088974855e-05, | |
| "loss": 0.9739, | |
| "num_input_tokens_seen": 52945344, | |
| "step": 1098, | |
| "train_runtime": 7712.6946, | |
| "train_tokens_per_second": 6864.701 | |
| }, | |
| { | |
| "epoch": 0.7065252330440372, | |
| "grad_norm": 0.22467251121997833, | |
| "learning_rate": 5.9058671824629276e-05, | |
| "loss": 0.9488, | |
| "num_input_tokens_seen": 52998032, | |
| "step": 1099, | |
| "train_runtime": 7720.1682, | |
| "train_tokens_per_second": 6864.881 | |
| }, | |
| { | |
| "epoch": 0.7071681131468981, | |
| "grad_norm": 0.23567631840705872, | |
| "learning_rate": 5.8929722759509994e-05, | |
| "loss": 1.0229, | |
| "num_input_tokens_seen": 53048416, | |
| "step": 1100, | |
| "train_runtime": 7727.1563, | |
| "train_tokens_per_second": 6865.193 | |
| }, | |
| { | |
| "epoch": 0.7078109932497589, | |
| "grad_norm": 0.22417950630187988, | |
| "learning_rate": 5.880077369439072e-05, | |
| "loss": 0.8845, | |
| "num_input_tokens_seen": 53087632, | |
| "step": 1101, | |
| "train_runtime": 7732.6797, | |
| "train_tokens_per_second": 6865.36 | |
| }, | |
| { | |
| "epoch": 0.7084538733526198, | |
| "grad_norm": 0.23154444992542267, | |
| "learning_rate": 5.8671824629271444e-05, | |
| "loss": 0.9673, | |
| "num_input_tokens_seen": 53131856, | |
| "step": 1102, | |
| "train_runtime": 7738.8958, | |
| "train_tokens_per_second": 6865.56 | |
| }, | |
| { | |
| "epoch": 0.7090967534554805, | |
| "grad_norm": 0.22846034169197083, | |
| "learning_rate": 5.854287556415217e-05, | |
| "loss": 0.9304, | |
| "num_input_tokens_seen": 53194192, | |
| "step": 1103, | |
| "train_runtime": 7747.5318, | |
| "train_tokens_per_second": 6865.953 | |
| }, | |
| { | |
| "epoch": 0.7097396335583414, | |
| "grad_norm": 0.22535398602485657, | |
| "learning_rate": 5.841392649903289e-05, | |
| "loss": 0.9926, | |
| "num_input_tokens_seen": 53237296, | |
| "step": 1104, | |
| "train_runtime": 7753.5662, | |
| "train_tokens_per_second": 6866.169 | |
| }, | |
| { | |
| "epoch": 0.7103825136612022, | |
| "grad_norm": 0.21644599735736847, | |
| "learning_rate": 5.828497743391361e-05, | |
| "loss": 0.8929, | |
| "num_input_tokens_seen": 53293872, | |
| "step": 1105, | |
| "train_runtime": 7761.4556, | |
| "train_tokens_per_second": 6866.479 | |
| }, | |
| { | |
| "epoch": 0.711025393764063, | |
| "grad_norm": 0.2133343517780304, | |
| "learning_rate": 5.8156028368794324e-05, | |
| "loss": 1.0127, | |
| "num_input_tokens_seen": 53336256, | |
| "step": 1106, | |
| "train_runtime": 7767.4386, | |
| "train_tokens_per_second": 6866.647 | |
| }, | |
| { | |
| "epoch": 0.7116682738669238, | |
| "grad_norm": 0.21515777707099915, | |
| "learning_rate": 5.802707930367505e-05, | |
| "loss": 1.0408, | |
| "num_input_tokens_seen": 53374128, | |
| "step": 1107, | |
| "train_runtime": 7772.794, | |
| "train_tokens_per_second": 6866.788 | |
| }, | |
| { | |
| "epoch": 0.7123111539697846, | |
| "grad_norm": 0.223897784948349, | |
| "learning_rate": 5.789813023855577e-05, | |
| "loss": 1.0293, | |
| "num_input_tokens_seen": 53418320, | |
| "step": 1108, | |
| "train_runtime": 7779.0117, | |
| "train_tokens_per_second": 6866.98 | |
| }, | |
| { | |
| "epoch": 0.7129540340726455, | |
| "grad_norm": 0.23518460988998413, | |
| "learning_rate": 5.776918117343649e-05, | |
| "loss": 0.9154, | |
| "num_input_tokens_seen": 53474272, | |
| "step": 1109, | |
| "train_runtime": 7786.7968, | |
| "train_tokens_per_second": 6867.3 | |
| }, | |
| { | |
| "epoch": 0.7135969141755063, | |
| "grad_norm": 0.24510706961154938, | |
| "learning_rate": 5.7640232108317216e-05, | |
| "loss": 0.9749, | |
| "num_input_tokens_seen": 53510944, | |
| "step": 1110, | |
| "train_runtime": 7791.917, | |
| "train_tokens_per_second": 6867.494 | |
| }, | |
| { | |
| "epoch": 0.714239794278367, | |
| "grad_norm": 0.22904647886753082, | |
| "learning_rate": 5.751128304319794e-05, | |
| "loss": 0.9732, | |
| "num_input_tokens_seen": 53566928, | |
| "step": 1111, | |
| "train_runtime": 7800.2156, | |
| "train_tokens_per_second": 6867.365 | |
| }, | |
| { | |
| "epoch": 0.7148826743812279, | |
| "grad_norm": 0.24273896217346191, | |
| "learning_rate": 5.738233397807866e-05, | |
| "loss": 0.9793, | |
| "num_input_tokens_seen": 53626144, | |
| "step": 1112, | |
| "train_runtime": 7808.4556, | |
| "train_tokens_per_second": 6867.702 | |
| }, | |
| { | |
| "epoch": 0.7155255544840887, | |
| "grad_norm": 0.23252332210540771, | |
| "learning_rate": 5.7253384912959384e-05, | |
| "loss": 0.9698, | |
| "num_input_tokens_seen": 53662896, | |
| "step": 1113, | |
| "train_runtime": 7813.5812, | |
| "train_tokens_per_second": 6867.9 | |
| }, | |
| { | |
| "epoch": 0.7161684345869496, | |
| "grad_norm": 0.21385739743709564, | |
| "learning_rate": 5.712443584784011e-05, | |
| "loss": 0.9627, | |
| "num_input_tokens_seen": 53702752, | |
| "step": 1114, | |
| "train_runtime": 7819.1534, | |
| "train_tokens_per_second": 6868.103 | |
| }, | |
| { | |
| "epoch": 0.7168113146898103, | |
| "grad_norm": 0.22277802228927612, | |
| "learning_rate": 5.699548678272083e-05, | |
| "loss": 0.9046, | |
| "num_input_tokens_seen": 53753744, | |
| "step": 1115, | |
| "train_runtime": 7826.2367, | |
| "train_tokens_per_second": 6868.403 | |
| }, | |
| { | |
| "epoch": 0.7174541947926711, | |
| "grad_norm": 0.24389879405498505, | |
| "learning_rate": 5.686653771760155e-05, | |
| "loss": 0.9821, | |
| "num_input_tokens_seen": 53797728, | |
| "step": 1116, | |
| "train_runtime": 7832.3144, | |
| "train_tokens_per_second": 6868.689 | |
| }, | |
| { | |
| "epoch": 0.718097074895532, | |
| "grad_norm": 0.22600604593753815, | |
| "learning_rate": 5.673758865248228e-05, | |
| "loss": 0.9745, | |
| "num_input_tokens_seen": 53832608, | |
| "step": 1117, | |
| "train_runtime": 7837.1799, | |
| "train_tokens_per_second": 6868.875 | |
| }, | |
| { | |
| "epoch": 0.7187399549983928, | |
| "grad_norm": 0.22461646795272827, | |
| "learning_rate": 5.6608639587363e-05, | |
| "loss": 0.966, | |
| "num_input_tokens_seen": 53870880, | |
| "step": 1118, | |
| "train_runtime": 7842.5366, | |
| "train_tokens_per_second": 6869.063 | |
| }, | |
| { | |
| "epoch": 0.7193828351012537, | |
| "grad_norm": 0.2225736677646637, | |
| "learning_rate": 5.647969052224371e-05, | |
| "loss": 0.9372, | |
| "num_input_tokens_seen": 53912432, | |
| "step": 1119, | |
| "train_runtime": 7848.3282, | |
| "train_tokens_per_second": 6869.289 | |
| }, | |
| { | |
| "epoch": 0.7200257152041144, | |
| "grad_norm": 0.20642247796058655, | |
| "learning_rate": 5.635074145712443e-05, | |
| "loss": 0.9846, | |
| "num_input_tokens_seen": 53955376, | |
| "step": 1120, | |
| "train_runtime": 7854.2753, | |
| "train_tokens_per_second": 6869.555 | |
| }, | |
| { | |
| "epoch": 0.7206685953069752, | |
| "grad_norm": 0.20037145912647247, | |
| "learning_rate": 5.6221792392005156e-05, | |
| "loss": 0.9248, | |
| "num_input_tokens_seen": 54010848, | |
| "step": 1121, | |
| "train_runtime": 7861.9353, | |
| "train_tokens_per_second": 6869.918 | |
| }, | |
| { | |
| "epoch": 0.7213114754098361, | |
| "grad_norm": 0.21794676780700684, | |
| "learning_rate": 5.609284332688588e-05, | |
| "loss": 0.8596, | |
| "num_input_tokens_seen": 54044656, | |
| "step": 1122, | |
| "train_runtime": 7866.6604, | |
| "train_tokens_per_second": 6870.089 | |
| }, | |
| { | |
| "epoch": 0.7219543555126969, | |
| "grad_norm": 0.23393063247203827, | |
| "learning_rate": 5.5963894261766606e-05, | |
| "loss": 1.0028, | |
| "num_input_tokens_seen": 54100128, | |
| "step": 1123, | |
| "train_runtime": 7874.2817, | |
| "train_tokens_per_second": 6870.484 | |
| }, | |
| { | |
| "epoch": 0.7225972356155577, | |
| "grad_norm": 0.22931329905986786, | |
| "learning_rate": 5.5834945196647324e-05, | |
| "loss": 1.0313, | |
| "num_input_tokens_seen": 54153344, | |
| "step": 1124, | |
| "train_runtime": 7881.6167, | |
| "train_tokens_per_second": 6870.842 | |
| }, | |
| { | |
| "epoch": 0.7232401157184185, | |
| "grad_norm": 0.22053447365760803, | |
| "learning_rate": 5.570599613152805e-05, | |
| "loss": 0.861, | |
| "num_input_tokens_seen": 54222704, | |
| "step": 1125, | |
| "train_runtime": 7891.1353, | |
| "train_tokens_per_second": 6871.344 | |
| }, | |
| { | |
| "epoch": 0.7238829958212794, | |
| "grad_norm": 0.22127224504947662, | |
| "learning_rate": 5.5577047066408774e-05, | |
| "loss": 0.8733, | |
| "num_input_tokens_seen": 54263936, | |
| "step": 1126, | |
| "train_runtime": 7896.8263, | |
| "train_tokens_per_second": 6871.613 | |
| }, | |
| { | |
| "epoch": 0.7245258759241402, | |
| "grad_norm": 0.20868195593357086, | |
| "learning_rate": 5.544809800128949e-05, | |
| "loss": 1.0278, | |
| "num_input_tokens_seen": 54308544, | |
| "step": 1127, | |
| "train_runtime": 7903.0171, | |
| "train_tokens_per_second": 6871.875 | |
| }, | |
| { | |
| "epoch": 0.7251687560270009, | |
| "grad_norm": 0.2393093705177307, | |
| "learning_rate": 5.531914893617022e-05, | |
| "loss": 1.0157, | |
| "num_input_tokens_seen": 54355248, | |
| "step": 1128, | |
| "train_runtime": 7909.4817, | |
| "train_tokens_per_second": 6872.163 | |
| }, | |
| { | |
| "epoch": 0.7258116361298618, | |
| "grad_norm": 0.24080771207809448, | |
| "learning_rate": 5.519019987105094e-05, | |
| "loss": 0.948, | |
| "num_input_tokens_seen": 54398944, | |
| "step": 1129, | |
| "train_runtime": 7915.4679, | |
| "train_tokens_per_second": 6872.486 | |
| }, | |
| { | |
| "epoch": 0.7264545162327226, | |
| "grad_norm": 0.22321158647537231, | |
| "learning_rate": 5.506125080593166e-05, | |
| "loss": 0.9862, | |
| "num_input_tokens_seen": 54439088, | |
| "step": 1130, | |
| "train_runtime": 7921.003, | |
| "train_tokens_per_second": 6872.752 | |
| }, | |
| { | |
| "epoch": 0.7270973963355835, | |
| "grad_norm": 0.2523844838142395, | |
| "learning_rate": 5.4932301740812385e-05, | |
| "loss": 0.9001, | |
| "num_input_tokens_seen": 54505696, | |
| "step": 1131, | |
| "train_runtime": 7930.1312, | |
| "train_tokens_per_second": 6873.24 | |
| }, | |
| { | |
| "epoch": 0.7277402764384442, | |
| "grad_norm": 0.22878628969192505, | |
| "learning_rate": 5.480335267569311e-05, | |
| "loss": 0.9857, | |
| "num_input_tokens_seen": 54556000, | |
| "step": 1132, | |
| "train_runtime": 7937.1096, | |
| "train_tokens_per_second": 6873.535 | |
| }, | |
| { | |
| "epoch": 0.728383156541305, | |
| "grad_norm": 0.2232838124036789, | |
| "learning_rate": 5.467440361057382e-05, | |
| "loss": 0.943, | |
| "num_input_tokens_seen": 54593344, | |
| "step": 1133, | |
| "train_runtime": 7942.2821, | |
| "train_tokens_per_second": 6873.76 | |
| }, | |
| { | |
| "epoch": 0.7290260366441659, | |
| "grad_norm": 0.23237422108650208, | |
| "learning_rate": 5.4545454545454546e-05, | |
| "loss": 1.0123, | |
| "num_input_tokens_seen": 54646032, | |
| "step": 1134, | |
| "train_runtime": 7949.4332, | |
| "train_tokens_per_second": 6874.205 | |
| }, | |
| { | |
| "epoch": 0.7296689167470267, | |
| "grad_norm": 0.21997365355491638, | |
| "learning_rate": 5.4416505480335264e-05, | |
| "loss": 0.8986, | |
| "num_input_tokens_seen": 54695088, | |
| "step": 1135, | |
| "train_runtime": 7956.23, | |
| "train_tokens_per_second": 6874.498 | |
| }, | |
| { | |
| "epoch": 0.7303117968498875, | |
| "grad_norm": 0.23271259665489197, | |
| "learning_rate": 5.428755641521599e-05, | |
| "loss": 0.8801, | |
| "num_input_tokens_seen": 54752464, | |
| "step": 1136, | |
| "train_runtime": 7964.1444, | |
| "train_tokens_per_second": 6874.871 | |
| }, | |
| { | |
| "epoch": 0.7309546769527483, | |
| "grad_norm": 0.24548843502998352, | |
| "learning_rate": 5.4158607350096714e-05, | |
| "loss": 0.9257, | |
| "num_input_tokens_seen": 54792336, | |
| "step": 1137, | |
| "train_runtime": 7969.6902, | |
| "train_tokens_per_second": 6875.09 | |
| }, | |
| { | |
| "epoch": 0.7315975570556091, | |
| "grad_norm": 0.2421896904706955, | |
| "learning_rate": 5.402965828497744e-05, | |
| "loss": 1.0737, | |
| "num_input_tokens_seen": 54834752, | |
| "step": 1138, | |
| "train_runtime": 7975.5384, | |
| "train_tokens_per_second": 6875.367 | |
| }, | |
| { | |
| "epoch": 0.73224043715847, | |
| "grad_norm": 0.23351521790027618, | |
| "learning_rate": 5.390070921985816e-05, | |
| "loss": 0.9608, | |
| "num_input_tokens_seen": 54886640, | |
| "step": 1139, | |
| "train_runtime": 7982.717, | |
| "train_tokens_per_second": 6875.684 | |
| }, | |
| { | |
| "epoch": 0.7328833172613307, | |
| "grad_norm": 0.23344506323337555, | |
| "learning_rate": 5.377176015473888e-05, | |
| "loss": 0.9816, | |
| "num_input_tokens_seen": 54954016, | |
| "step": 1140, | |
| "train_runtime": 7991.9968, | |
| "train_tokens_per_second": 6876.131 | |
| }, | |
| { | |
| "epoch": 0.7335261973641916, | |
| "grad_norm": 0.23483243584632874, | |
| "learning_rate": 5.364281108961961e-05, | |
| "loss": 1.0239, | |
| "num_input_tokens_seen": 55011264, | |
| "step": 1141, | |
| "train_runtime": 8000.4982, | |
| "train_tokens_per_second": 6875.98 | |
| }, | |
| { | |
| "epoch": 0.7341690774670524, | |
| "grad_norm": 0.2115328162908554, | |
| "learning_rate": 5.3513862024500325e-05, | |
| "loss": 0.9455, | |
| "num_input_tokens_seen": 55064576, | |
| "step": 1142, | |
| "train_runtime": 8007.8404, | |
| "train_tokens_per_second": 6876.333 | |
| }, | |
| { | |
| "epoch": 0.7348119575699132, | |
| "grad_norm": 0.23102976381778717, | |
| "learning_rate": 5.338491295938105e-05, | |
| "loss": 1.0438, | |
| "num_input_tokens_seen": 55113792, | |
| "step": 1143, | |
| "train_runtime": 8014.6035, | |
| "train_tokens_per_second": 6876.671 | |
| }, | |
| { | |
| "epoch": 0.735454837672774, | |
| "grad_norm": 0.2138880044221878, | |
| "learning_rate": 5.3255963894261775e-05, | |
| "loss": 1.0519, | |
| "num_input_tokens_seen": 55160768, | |
| "step": 1144, | |
| "train_runtime": 8021.058, | |
| "train_tokens_per_second": 6876.994 | |
| }, | |
| { | |
| "epoch": 0.7360977177756348, | |
| "grad_norm": 0.22077840566635132, | |
| "learning_rate": 5.312701482914249e-05, | |
| "loss": 0.999, | |
| "num_input_tokens_seen": 55207872, | |
| "step": 1145, | |
| "train_runtime": 8027.5436, | |
| "train_tokens_per_second": 6877.306 | |
| }, | |
| { | |
| "epoch": 0.7367405978784957, | |
| "grad_norm": 0.22485333681106567, | |
| "learning_rate": 5.299806576402321e-05, | |
| "loss": 0.9196, | |
| "num_input_tokens_seen": 55258304, | |
| "step": 1146, | |
| "train_runtime": 8034.4365, | |
| "train_tokens_per_second": 6877.683 | |
| }, | |
| { | |
| "epoch": 0.7373834779813565, | |
| "grad_norm": 0.22138972580432892, | |
| "learning_rate": 5.286911669890393e-05, | |
| "loss": 0.9889, | |
| "num_input_tokens_seen": 55313520, | |
| "step": 1147, | |
| "train_runtime": 8042.0983, | |
| "train_tokens_per_second": 6877.996 | |
| }, | |
| { | |
| "epoch": 0.7380263580842173, | |
| "grad_norm": 0.23767682909965515, | |
| "learning_rate": 5.2740167633784654e-05, | |
| "loss": 0.9317, | |
| "num_input_tokens_seen": 55366688, | |
| "step": 1148, | |
| "train_runtime": 8049.4084, | |
| "train_tokens_per_second": 6878.355 | |
| }, | |
| { | |
| "epoch": 0.7386692381870781, | |
| "grad_norm": 0.21733619272708893, | |
| "learning_rate": 5.261121856866538e-05, | |
| "loss": 1.0789, | |
| "num_input_tokens_seen": 55407632, | |
| "step": 1149, | |
| "train_runtime": 8055.0656, | |
| "train_tokens_per_second": 6878.607 | |
| }, | |
| { | |
| "epoch": 0.7393121182899389, | |
| "grad_norm": 0.23163765668869019, | |
| "learning_rate": 5.24822695035461e-05, | |
| "loss": 1.0057, | |
| "num_input_tokens_seen": 55460928, | |
| "step": 1150, | |
| "train_runtime": 8062.3716, | |
| "train_tokens_per_second": 6878.984 | |
| }, | |
| { | |
| "epoch": 0.7399549983927998, | |
| "grad_norm": 0.21014994382858276, | |
| "learning_rate": 5.235332043842682e-05, | |
| "loss": 0.9287, | |
| "num_input_tokens_seen": 55505344, | |
| "step": 1151, | |
| "train_runtime": 8068.5377, | |
| "train_tokens_per_second": 6879.232 | |
| }, | |
| { | |
| "epoch": 0.7405978784956606, | |
| "grad_norm": 0.225826233625412, | |
| "learning_rate": 5.222437137330755e-05, | |
| "loss": 0.9094, | |
| "num_input_tokens_seen": 55542640, | |
| "step": 1152, | |
| "train_runtime": 8073.7681, | |
| "train_tokens_per_second": 6879.395 | |
| }, | |
| { | |
| "epoch": 0.7412407585985213, | |
| "grad_norm": 0.20695921778678894, | |
| "learning_rate": 5.209542230818827e-05, | |
| "loss": 0.9438, | |
| "num_input_tokens_seen": 55584288, | |
| "step": 1153, | |
| "train_runtime": 8079.5894, | |
| "train_tokens_per_second": 6879.593 | |
| }, | |
| { | |
| "epoch": 0.7418836387013822, | |
| "grad_norm": 0.23178590834140778, | |
| "learning_rate": 5.196647324306899e-05, | |
| "loss": 0.9829, | |
| "num_input_tokens_seen": 55639888, | |
| "step": 1154, | |
| "train_runtime": 8087.3713, | |
| "train_tokens_per_second": 6879.848 | |
| }, | |
| { | |
| "epoch": 0.742526518804243, | |
| "grad_norm": 0.22732076048851013, | |
| "learning_rate": 5.1837524177949715e-05, | |
| "loss": 1.0151, | |
| "num_input_tokens_seen": 55680480, | |
| "step": 1155, | |
| "train_runtime": 8093.0698, | |
| "train_tokens_per_second": 6880.02 | |
| }, | |
| { | |
| "epoch": 0.7431693989071039, | |
| "grad_norm": 0.2244046926498413, | |
| "learning_rate": 5.170857511283044e-05, | |
| "loss": 1.0104, | |
| "num_input_tokens_seen": 55723328, | |
| "step": 1156, | |
| "train_runtime": 8099.1214, | |
| "train_tokens_per_second": 6880.17 | |
| }, | |
| { | |
| "epoch": 0.7438122790099646, | |
| "grad_norm": 0.23200780153274536, | |
| "learning_rate": 5.157962604771116e-05, | |
| "loss": 1.0062, | |
| "num_input_tokens_seen": 55768816, | |
| "step": 1157, | |
| "train_runtime": 8105.5226, | |
| "train_tokens_per_second": 6880.348 | |
| }, | |
| { | |
| "epoch": 0.7444551591128254, | |
| "grad_norm": 0.21963828802108765, | |
| "learning_rate": 5.145067698259188e-05, | |
| "loss": 0.9265, | |
| "num_input_tokens_seen": 55835024, | |
| "step": 1158, | |
| "train_runtime": 8114.7836, | |
| "train_tokens_per_second": 6880.655 | |
| }, | |
| { | |
| "epoch": 0.7450980392156863, | |
| "grad_norm": 0.20844990015029907, | |
| "learning_rate": 5.132172791747261e-05, | |
| "loss": 0.9126, | |
| "num_input_tokens_seen": 55879152, | |
| "step": 1159, | |
| "train_runtime": 8120.9672, | |
| "train_tokens_per_second": 6880.849 | |
| }, | |
| { | |
| "epoch": 0.7457409193185471, | |
| "grad_norm": 0.2319706231355667, | |
| "learning_rate": 5.119277885235332e-05, | |
| "loss": 1.1053, | |
| "num_input_tokens_seen": 55932224, | |
| "step": 1160, | |
| "train_runtime": 8128.4026, | |
| "train_tokens_per_second": 6881.084 | |
| }, | |
| { | |
| "epoch": 0.7463837994214079, | |
| "grad_norm": 0.2260400801897049, | |
| "learning_rate": 5.1063829787234044e-05, | |
| "loss": 0.9339, | |
| "num_input_tokens_seen": 55985392, | |
| "step": 1161, | |
| "train_runtime": 8135.8349, | |
| "train_tokens_per_second": 6881.333 | |
| }, | |
| { | |
| "epoch": 0.7470266795242687, | |
| "grad_norm": 0.2468838393688202, | |
| "learning_rate": 5.093488072211476e-05, | |
| "loss": 0.9742, | |
| "num_input_tokens_seen": 56028096, | |
| "step": 1162, | |
| "train_runtime": 8141.77, | |
| "train_tokens_per_second": 6881.562 | |
| }, | |
| { | |
| "epoch": 0.7476695596271296, | |
| "grad_norm": 0.23743107914924622, | |
| "learning_rate": 5.080593165699549e-05, | |
| "loss": 0.9592, | |
| "num_input_tokens_seen": 56083904, | |
| "step": 1163, | |
| "train_runtime": 8149.5139, | |
| "train_tokens_per_second": 6881.871 | |
| }, | |
| { | |
| "epoch": 0.7483124397299904, | |
| "grad_norm": 0.230645552277565, | |
| "learning_rate": 5.067698259187621e-05, | |
| "loss": 0.9732, | |
| "num_input_tokens_seen": 56116832, | |
| "step": 1164, | |
| "train_runtime": 8154.1629, | |
| "train_tokens_per_second": 6881.986 | |
| }, | |
| { | |
| "epoch": 0.7489553198328511, | |
| "grad_norm": 0.21561990678310394, | |
| "learning_rate": 5.054803352675693e-05, | |
| "loss": 0.9405, | |
| "num_input_tokens_seen": 56161920, | |
| "step": 1165, | |
| "train_runtime": 8160.4444, | |
| "train_tokens_per_second": 6882.213 | |
| }, | |
| { | |
| "epoch": 0.749598199935712, | |
| "grad_norm": 0.2270730882883072, | |
| "learning_rate": 5.0419084461637655e-05, | |
| "loss": 1.0281, | |
| "num_input_tokens_seen": 56211712, | |
| "step": 1166, | |
| "train_runtime": 8167.4132, | |
| "train_tokens_per_second": 6882.438 | |
| }, | |
| { | |
| "epoch": 0.7502410800385728, | |
| "grad_norm": 0.23744960129261017, | |
| "learning_rate": 5.029013539651838e-05, | |
| "loss": 0.9077, | |
| "num_input_tokens_seen": 56250912, | |
| "step": 1167, | |
| "train_runtime": 8172.9494, | |
| "train_tokens_per_second": 6882.572 | |
| }, | |
| { | |
| "epoch": 0.7508839601414337, | |
| "grad_norm": 0.24074719846248627, | |
| "learning_rate": 5.0161186331399105e-05, | |
| "loss": 1.0299, | |
| "num_input_tokens_seen": 56320176, | |
| "step": 1168, | |
| "train_runtime": 8182.589, | |
| "train_tokens_per_second": 6882.929 | |
| }, | |
| { | |
| "epoch": 0.7515268402442944, | |
| "grad_norm": 0.2285345196723938, | |
| "learning_rate": 5.003223726627982e-05, | |
| "loss": 1.0016, | |
| "num_input_tokens_seen": 56372112, | |
| "step": 1169, | |
| "train_runtime": 8189.9035, | |
| "train_tokens_per_second": 6883.123 | |
| }, | |
| { | |
| "epoch": 0.7521697203471552, | |
| "grad_norm": 0.24572432041168213, | |
| "learning_rate": 4.990328820116054e-05, | |
| "loss": 0.883, | |
| "num_input_tokens_seen": 56428272, | |
| "step": 1170, | |
| "train_runtime": 8197.7663, | |
| "train_tokens_per_second": 6883.372 | |
| }, | |
| { | |
| "epoch": 0.7528126004500161, | |
| "grad_norm": 0.22612586617469788, | |
| "learning_rate": 4.9774339136041266e-05, | |
| "loss": 0.8977, | |
| "num_input_tokens_seen": 56501376, | |
| "step": 1171, | |
| "train_runtime": 8208.6044, | |
| "train_tokens_per_second": 6883.189 | |
| }, | |
| { | |
| "epoch": 0.7534554805528769, | |
| "grad_norm": 0.23137860000133514, | |
| "learning_rate": 4.964539007092199e-05, | |
| "loss": 1.0062, | |
| "num_input_tokens_seen": 56557344, | |
| "step": 1172, | |
| "train_runtime": 8216.4609, | |
| "train_tokens_per_second": 6883.419 | |
| }, | |
| { | |
| "epoch": 0.7540983606557377, | |
| "grad_norm": 0.21029794216156006, | |
| "learning_rate": 4.951644100580271e-05, | |
| "loss": 0.925, | |
| "num_input_tokens_seen": 56603296, | |
| "step": 1173, | |
| "train_runtime": 8222.8421, | |
| "train_tokens_per_second": 6883.666 | |
| }, | |
| { | |
| "epoch": 0.7547412407585985, | |
| "grad_norm": 0.2205536663532257, | |
| "learning_rate": 4.9387491940683434e-05, | |
| "loss": 0.9305, | |
| "num_input_tokens_seen": 56658960, | |
| "step": 1174, | |
| "train_runtime": 8230.6725, | |
| "train_tokens_per_second": 6883.88 | |
| }, | |
| { | |
| "epoch": 0.7553841208614593, | |
| "grad_norm": 0.22032520174980164, | |
| "learning_rate": 4.925854287556416e-05, | |
| "loss": 0.9456, | |
| "num_input_tokens_seen": 56695088, | |
| "step": 1175, | |
| "train_runtime": 8235.7777, | |
| "train_tokens_per_second": 6883.999 | |
| }, | |
| { | |
| "epoch": 0.7560270009643202, | |
| "grad_norm": 0.22646676003932953, | |
| "learning_rate": 4.912959381044488e-05, | |
| "loss": 1.0539, | |
| "num_input_tokens_seen": 56740304, | |
| "step": 1176, | |
| "train_runtime": 8242.1556, | |
| "train_tokens_per_second": 6884.158 | |
| }, | |
| { | |
| "epoch": 0.7566698810671809, | |
| "grad_norm": 0.24559547007083893, | |
| "learning_rate": 4.9000644745325595e-05, | |
| "loss": 0.988, | |
| "num_input_tokens_seen": 56798672, | |
| "step": 1177, | |
| "train_runtime": 8250.314, | |
| "train_tokens_per_second": 6884.425 | |
| }, | |
| { | |
| "epoch": 0.7573127611700418, | |
| "grad_norm": 0.21654796600341797, | |
| "learning_rate": 4.887169568020632e-05, | |
| "loss": 0.9943, | |
| "num_input_tokens_seen": 56843280, | |
| "step": 1178, | |
| "train_runtime": 8256.5134, | |
| "train_tokens_per_second": 6884.659 | |
| }, | |
| { | |
| "epoch": 0.7579556412729026, | |
| "grad_norm": 0.2150622457265854, | |
| "learning_rate": 4.8742746615087045e-05, | |
| "loss": 0.9943, | |
| "num_input_tokens_seen": 56898112, | |
| "step": 1179, | |
| "train_runtime": 8264.2324, | |
| "train_tokens_per_second": 6884.864 | |
| }, | |
| { | |
| "epoch": 0.7585985213757634, | |
| "grad_norm": 0.22791166603565216, | |
| "learning_rate": 4.861379754996776e-05, | |
| "loss": 0.9494, | |
| "num_input_tokens_seen": 56950448, | |
| "step": 1180, | |
| "train_runtime": 8271.587, | |
| "train_tokens_per_second": 6885.069 | |
| }, | |
| { | |
| "epoch": 0.7592414014786243, | |
| "grad_norm": 0.21735823154449463, | |
| "learning_rate": 4.848484848484849e-05, | |
| "loss": 0.9485, | |
| "num_input_tokens_seen": 56979856, | |
| "step": 1181, | |
| "train_runtime": 8275.7774, | |
| "train_tokens_per_second": 6885.136 | |
| }, | |
| { | |
| "epoch": 0.759884281581485, | |
| "grad_norm": 0.22657233476638794, | |
| "learning_rate": 4.835589941972921e-05, | |
| "loss": 0.9565, | |
| "num_input_tokens_seen": 57036800, | |
| "step": 1182, | |
| "train_runtime": 8283.7895, | |
| "train_tokens_per_second": 6885.351 | |
| }, | |
| { | |
| "epoch": 0.7605271616843459, | |
| "grad_norm": 0.21392716467380524, | |
| "learning_rate": 4.822695035460993e-05, | |
| "loss": 1.0406, | |
| "num_input_tokens_seen": 57084048, | |
| "step": 1183, | |
| "train_runtime": 8290.4276, | |
| "train_tokens_per_second": 6885.537 | |
| }, | |
| { | |
| "epoch": 0.7611700417872067, | |
| "grad_norm": 0.2238176167011261, | |
| "learning_rate": 4.809800128949065e-05, | |
| "loss": 1.0245, | |
| "num_input_tokens_seen": 57143824, | |
| "step": 1184, | |
| "train_runtime": 8298.876, | |
| "train_tokens_per_second": 6885.731 | |
| }, | |
| { | |
| "epoch": 0.7618129218900676, | |
| "grad_norm": 0.21898095309734344, | |
| "learning_rate": 4.7969052224371374e-05, | |
| "loss": 1.0304, | |
| "num_input_tokens_seen": 57183152, | |
| "step": 1185, | |
| "train_runtime": 8304.3882, | |
| "train_tokens_per_second": 6885.896 | |
| }, | |
| { | |
| "epoch": 0.7624558019929283, | |
| "grad_norm": 0.2068723440170288, | |
| "learning_rate": 4.78401031592521e-05, | |
| "loss": 0.9284, | |
| "num_input_tokens_seen": 57222176, | |
| "step": 1186, | |
| "train_runtime": 8309.9032, | |
| "train_tokens_per_second": 6886.022 | |
| }, | |
| { | |
| "epoch": 0.7630986820957891, | |
| "grad_norm": 0.22520464658737183, | |
| "learning_rate": 4.7711154094132824e-05, | |
| "loss": 0.9208, | |
| "num_input_tokens_seen": 57264864, | |
| "step": 1187, | |
| "train_runtime": 8315.896, | |
| "train_tokens_per_second": 6886.193 | |
| }, | |
| { | |
| "epoch": 0.76374156219865, | |
| "grad_norm": 0.22291500866413116, | |
| "learning_rate": 4.758220502901354e-05, | |
| "loss": 0.9927, | |
| "num_input_tokens_seen": 57305552, | |
| "step": 1188, | |
| "train_runtime": 8321.6354, | |
| "train_tokens_per_second": 6886.333 | |
| }, | |
| { | |
| "epoch": 0.7643844423015108, | |
| "grad_norm": 0.23212119936943054, | |
| "learning_rate": 4.745325596389427e-05, | |
| "loss": 0.9143, | |
| "num_input_tokens_seen": 57345392, | |
| "step": 1189, | |
| "train_runtime": 8327.2897, | |
| "train_tokens_per_second": 6886.441 | |
| }, | |
| { | |
| "epoch": 0.7650273224043715, | |
| "grad_norm": 0.24220021069049835, | |
| "learning_rate": 4.7324306898774985e-05, | |
| "loss": 0.9725, | |
| "num_input_tokens_seen": 57401472, | |
| "step": 1190, | |
| "train_runtime": 8335.2033, | |
| "train_tokens_per_second": 6886.631 | |
| }, | |
| { | |
| "epoch": 0.7656702025072324, | |
| "grad_norm": 0.22186042368412018, | |
| "learning_rate": 4.719535783365571e-05, | |
| "loss": 0.9678, | |
| "num_input_tokens_seen": 57442512, | |
| "step": 1191, | |
| "train_runtime": 8340.9492, | |
| "train_tokens_per_second": 6886.808 | |
| }, | |
| { | |
| "epoch": 0.7663130826100932, | |
| "grad_norm": 0.23403644561767578, | |
| "learning_rate": 4.706640876853643e-05, | |
| "loss": 0.9648, | |
| "num_input_tokens_seen": 57483120, | |
| "step": 1192, | |
| "train_runtime": 8346.684, | |
| "train_tokens_per_second": 6886.941 | |
| }, | |
| { | |
| "epoch": 0.7669559627129541, | |
| "grad_norm": 0.22645071148872375, | |
| "learning_rate": 4.693745970341715e-05, | |
| "loss": 0.9198, | |
| "num_input_tokens_seen": 57525104, | |
| "step": 1193, | |
| "train_runtime": 8352.5785, | |
| "train_tokens_per_second": 6887.107 | |
| }, | |
| { | |
| "epoch": 0.7675988428158148, | |
| "grad_norm": 0.2159106433391571, | |
| "learning_rate": 4.680851063829788e-05, | |
| "loss": 0.9795, | |
| "num_input_tokens_seen": 57565168, | |
| "step": 1194, | |
| "train_runtime": 8358.1865, | |
| "train_tokens_per_second": 6887.28 | |
| }, | |
| { | |
| "epoch": 0.7682417229186757, | |
| "grad_norm": 0.22750870883464813, | |
| "learning_rate": 4.6679561573178596e-05, | |
| "loss": 0.8687, | |
| "num_input_tokens_seen": 57614672, | |
| "step": 1195, | |
| "train_runtime": 8365.1418, | |
| "train_tokens_per_second": 6887.471 | |
| }, | |
| { | |
| "epoch": 0.7688846030215365, | |
| "grad_norm": 0.21381807327270508, | |
| "learning_rate": 4.655061250805932e-05, | |
| "loss": 1.0295, | |
| "num_input_tokens_seen": 57658208, | |
| "step": 1196, | |
| "train_runtime": 8371.2702, | |
| "train_tokens_per_second": 6887.63 | |
| }, | |
| { | |
| "epoch": 0.7695274831243973, | |
| "grad_norm": 0.2144988477230072, | |
| "learning_rate": 4.642166344294004e-05, | |
| "loss": 0.9495, | |
| "num_input_tokens_seen": 57712400, | |
| "step": 1197, | |
| "train_runtime": 8378.8176, | |
| "train_tokens_per_second": 6887.893 | |
| }, | |
| { | |
| "epoch": 0.7701703632272581, | |
| "grad_norm": 0.23491157591342926, | |
| "learning_rate": 4.6292714377820764e-05, | |
| "loss": 1.0421, | |
| "num_input_tokens_seen": 57762512, | |
| "step": 1198, | |
| "train_runtime": 8385.8252, | |
| "train_tokens_per_second": 6888.113 | |
| }, | |
| { | |
| "epoch": 0.7708132433301189, | |
| "grad_norm": 0.2191002517938614, | |
| "learning_rate": 4.616376531270148e-05, | |
| "loss": 0.9837, | |
| "num_input_tokens_seen": 57801200, | |
| "step": 1199, | |
| "train_runtime": 8391.2734, | |
| "train_tokens_per_second": 6888.251 | |
| }, | |
| { | |
| "epoch": 0.7714561234329798, | |
| "grad_norm": 0.24052459001541138, | |
| "learning_rate": 4.603481624758221e-05, | |
| "loss": 0.9505, | |
| "num_input_tokens_seen": 57848416, | |
| "step": 1200, | |
| "train_runtime": 8397.9153, | |
| "train_tokens_per_second": 6888.426 | |
| }, | |
| { | |
| "epoch": 0.7720990035358406, | |
| "grad_norm": 0.21337009966373444, | |
| "learning_rate": 4.590586718246293e-05, | |
| "loss": 1.0245, | |
| "num_input_tokens_seen": 57912256, | |
| "step": 1201, | |
| "train_runtime": 8407.4519, | |
| "train_tokens_per_second": 6888.205 | |
| }, | |
| { | |
| "epoch": 0.7727418836387013, | |
| "grad_norm": 0.2229907065629959, | |
| "learning_rate": 4.5776918117343656e-05, | |
| "loss": 1.0446, | |
| "num_input_tokens_seen": 57950320, | |
| "step": 1202, | |
| "train_runtime": 8412.8371, | |
| "train_tokens_per_second": 6888.321 | |
| }, | |
| { | |
| "epoch": 0.7733847637415622, | |
| "grad_norm": 0.21816016733646393, | |
| "learning_rate": 4.564796905222437e-05, | |
| "loss": 0.9966, | |
| "num_input_tokens_seen": 58008464, | |
| "step": 1203, | |
| "train_runtime": 8421.0592, | |
| "train_tokens_per_second": 6888.5 | |
| }, | |
| { | |
| "epoch": 0.774027643844423, | |
| "grad_norm": 0.2395995855331421, | |
| "learning_rate": 4.551901998710509e-05, | |
| "loss": 0.9236, | |
| "num_input_tokens_seen": 58046464, | |
| "step": 1204, | |
| "train_runtime": 8426.4054, | |
| "train_tokens_per_second": 6888.639 | |
| }, | |
| { | |
| "epoch": 0.7746705239472839, | |
| "grad_norm": 0.22368338704109192, | |
| "learning_rate": 4.539007092198582e-05, | |
| "loss": 0.9081, | |
| "num_input_tokens_seen": 58099648, | |
| "step": 1205, | |
| "train_runtime": 8433.8425, | |
| "train_tokens_per_second": 6888.87 | |
| }, | |
| { | |
| "epoch": 0.7753134040501446, | |
| "grad_norm": 0.2314455807209015, | |
| "learning_rate": 4.526112185686654e-05, | |
| "loss": 1.0343, | |
| "num_input_tokens_seen": 58145440, | |
| "step": 1206, | |
| "train_runtime": 8440.2523, | |
| "train_tokens_per_second": 6889.064 | |
| }, | |
| { | |
| "epoch": 0.7759562841530054, | |
| "grad_norm": 0.22723662853240967, | |
| "learning_rate": 4.513217279174726e-05, | |
| "loss": 0.9582, | |
| "num_input_tokens_seen": 58191472, | |
| "step": 1207, | |
| "train_runtime": 8446.7219, | |
| "train_tokens_per_second": 6889.237 | |
| }, | |
| { | |
| "epoch": 0.7765991642558663, | |
| "grad_norm": 0.21512675285339355, | |
| "learning_rate": 4.5003223726627986e-05, | |
| "loss": 0.9875, | |
| "num_input_tokens_seen": 58242688, | |
| "step": 1208, | |
| "train_runtime": 8453.9052, | |
| "train_tokens_per_second": 6889.442 | |
| }, | |
| { | |
| "epoch": 0.7772420443587271, | |
| "grad_norm": 0.21539998054504395, | |
| "learning_rate": 4.487427466150871e-05, | |
| "loss": 0.9029, | |
| "num_input_tokens_seen": 58292320, | |
| "step": 1209, | |
| "train_runtime": 8460.89, | |
| "train_tokens_per_second": 6889.62 | |
| }, | |
| { | |
| "epoch": 0.777884924461588, | |
| "grad_norm": 0.2292962372303009, | |
| "learning_rate": 4.474532559638943e-05, | |
| "loss": 0.9405, | |
| "num_input_tokens_seen": 58335520, | |
| "step": 1210, | |
| "train_runtime": 8466.9635, | |
| "train_tokens_per_second": 6889.781 | |
| }, | |
| { | |
| "epoch": 0.7785278045644487, | |
| "grad_norm": 0.22950732707977295, | |
| "learning_rate": 4.461637653127015e-05, | |
| "loss": 0.9055, | |
| "num_input_tokens_seen": 58409648, | |
| "step": 1211, | |
| "train_runtime": 8477.3793, | |
| "train_tokens_per_second": 6890.06 | |
| }, | |
| { | |
| "epoch": 0.7791706846673095, | |
| "grad_norm": 0.2094380408525467, | |
| "learning_rate": 4.448742746615087e-05, | |
| "loss": 1.0754, | |
| "num_input_tokens_seen": 58446592, | |
| "step": 1212, | |
| "train_runtime": 8482.5952, | |
| "train_tokens_per_second": 6890.178 | |
| }, | |
| { | |
| "epoch": 0.7798135647701704, | |
| "grad_norm": 0.21322154998779297, | |
| "learning_rate": 4.4358478401031597e-05, | |
| "loss": 0.9984, | |
| "num_input_tokens_seen": 58523840, | |
| "step": 1213, | |
| "train_runtime": 8493.4865, | |
| "train_tokens_per_second": 6890.438 | |
| }, | |
| { | |
| "epoch": 0.7804564448730312, | |
| "grad_norm": 0.2207326591014862, | |
| "learning_rate": 4.4229529335912315e-05, | |
| "loss": 0.9486, | |
| "num_input_tokens_seen": 58565120, | |
| "step": 1214, | |
| "train_runtime": 8499.3099, | |
| "train_tokens_per_second": 6890.574 | |
| }, | |
| { | |
| "epoch": 0.781099324975892, | |
| "grad_norm": 0.22177189588546753, | |
| "learning_rate": 4.410058027079304e-05, | |
| "loss": 1.0167, | |
| "num_input_tokens_seen": 58601776, | |
| "step": 1215, | |
| "train_runtime": 8504.5197, | |
| "train_tokens_per_second": 6890.663 | |
| }, | |
| { | |
| "epoch": 0.7817422050787528, | |
| "grad_norm": 0.23585543036460876, | |
| "learning_rate": 4.3971631205673764e-05, | |
| "loss": 1.004, | |
| "num_input_tokens_seen": 58648016, | |
| "step": 1216, | |
| "train_runtime": 8511.012, | |
| "train_tokens_per_second": 6890.839 | |
| }, | |
| { | |
| "epoch": 0.7823850851816136, | |
| "grad_norm": 0.22136184573173523, | |
| "learning_rate": 4.384268214055448e-05, | |
| "loss": 0.982, | |
| "num_input_tokens_seen": 58688384, | |
| "step": 1217, | |
| "train_runtime": 8516.686, | |
| "train_tokens_per_second": 6890.988 | |
| }, | |
| { | |
| "epoch": 0.7830279652844745, | |
| "grad_norm": 0.25705647468566895, | |
| "learning_rate": 4.37137330754352e-05, | |
| "loss": 0.9643, | |
| "num_input_tokens_seen": 58736880, | |
| "step": 1218, | |
| "train_runtime": 8523.4446, | |
| "train_tokens_per_second": 6891.214 | |
| }, | |
| { | |
| "epoch": 0.7836708453873352, | |
| "grad_norm": 0.21513555943965912, | |
| "learning_rate": 4.3584784010315926e-05, | |
| "loss": 0.9442, | |
| "num_input_tokens_seen": 58786448, | |
| "step": 1219, | |
| "train_runtime": 8530.4163, | |
| "train_tokens_per_second": 6891.393 | |
| }, | |
| { | |
| "epoch": 0.7843137254901961, | |
| "grad_norm": 0.21693727374076843, | |
| "learning_rate": 4.345583494519665e-05, | |
| "loss": 0.9013, | |
| "num_input_tokens_seen": 58826464, | |
| "step": 1220, | |
| "train_runtime": 8536.0745, | |
| "train_tokens_per_second": 6891.512 | |
| }, | |
| { | |
| "epoch": 0.7849566055930569, | |
| "grad_norm": 0.22054851055145264, | |
| "learning_rate": 4.3326885880077375e-05, | |
| "loss": 0.8901, | |
| "num_input_tokens_seen": 58875904, | |
| "step": 1221, | |
| "train_runtime": 8543.0507, | |
| "train_tokens_per_second": 6891.672 | |
| }, | |
| { | |
| "epoch": 0.7855994856959178, | |
| "grad_norm": 0.2086583971977234, | |
| "learning_rate": 4.3197936814958094e-05, | |
| "loss": 0.939, | |
| "num_input_tokens_seen": 58917904, | |
| "step": 1222, | |
| "train_runtime": 8548.9468, | |
| "train_tokens_per_second": 6891.832 | |
| }, | |
| { | |
| "epoch": 0.7862423657987785, | |
| "grad_norm": 0.22025592625141144, | |
| "learning_rate": 4.306898774983882e-05, | |
| "loss": 0.9353, | |
| "num_input_tokens_seen": 58968256, | |
| "step": 1223, | |
| "train_runtime": 8556.0367, | |
| "train_tokens_per_second": 6892.006 | |
| }, | |
| { | |
| "epoch": 0.7868852459016393, | |
| "grad_norm": 0.22146140038967133, | |
| "learning_rate": 4.2940038684719537e-05, | |
| "loss": 0.8715, | |
| "num_input_tokens_seen": 59012672, | |
| "step": 1224, | |
| "train_runtime": 8562.2887, | |
| "train_tokens_per_second": 6892.161 | |
| }, | |
| { | |
| "epoch": 0.7875281260045002, | |
| "grad_norm": 0.21178406476974487, | |
| "learning_rate": 4.281108961960026e-05, | |
| "loss": 0.9546, | |
| "num_input_tokens_seen": 59060096, | |
| "step": 1225, | |
| "train_runtime": 8568.9631, | |
| "train_tokens_per_second": 6892.327 | |
| }, | |
| { | |
| "epoch": 0.788171006107361, | |
| "grad_norm": 0.236673966050148, | |
| "learning_rate": 4.268214055448098e-05, | |
| "loss": 0.976, | |
| "num_input_tokens_seen": 59099840, | |
| "step": 1226, | |
| "train_runtime": 8574.612, | |
| "train_tokens_per_second": 6892.421 | |
| }, | |
| { | |
| "epoch": 0.7888138862102217, | |
| "grad_norm": 0.23856617510318756, | |
| "learning_rate": 4.2553191489361704e-05, | |
| "loss": 0.8789, | |
| "num_input_tokens_seen": 59146000, | |
| "step": 1227, | |
| "train_runtime": 8581.1157, | |
| "train_tokens_per_second": 6892.577 | |
| }, | |
| { | |
| "epoch": 0.7894567663130826, | |
| "grad_norm": 0.22620564699172974, | |
| "learning_rate": 4.242424242424243e-05, | |
| "loss": 0.9081, | |
| "num_input_tokens_seen": 59180640, | |
| "step": 1228, | |
| "train_runtime": 8586.0547, | |
| "train_tokens_per_second": 6892.647 | |
| }, | |
| { | |
| "epoch": 0.7900996464159434, | |
| "grad_norm": 0.2247392237186432, | |
| "learning_rate": 4.229529335912315e-05, | |
| "loss": 0.9257, | |
| "num_input_tokens_seen": 59242176, | |
| "step": 1229, | |
| "train_runtime": 8594.7528, | |
| "train_tokens_per_second": 6892.831 | |
| }, | |
| { | |
| "epoch": 0.7907425265188043, | |
| "grad_norm": 0.2251686453819275, | |
| "learning_rate": 4.2166344294003866e-05, | |
| "loss": 0.9371, | |
| "num_input_tokens_seen": 59288336, | |
| "step": 1230, | |
| "train_runtime": 8601.2625, | |
| "train_tokens_per_second": 6892.981 | |
| }, | |
| { | |
| "epoch": 0.791385406621665, | |
| "grad_norm": 0.21998196840286255, | |
| "learning_rate": 4.203739522888459e-05, | |
| "loss": 0.8956, | |
| "num_input_tokens_seen": 59337408, | |
| "step": 1231, | |
| "train_runtime": 8608.7066, | |
| "train_tokens_per_second": 6892.72 | |
| }, | |
| { | |
| "epoch": 0.7920282867245259, | |
| "grad_norm": 0.21279209852218628, | |
| "learning_rate": 4.1908446163765315e-05, | |
| "loss": 0.862, | |
| "num_input_tokens_seen": 59381904, | |
| "step": 1232, | |
| "train_runtime": 8614.9445, | |
| "train_tokens_per_second": 6892.895 | |
| }, | |
| { | |
| "epoch": 0.7926711668273867, | |
| "grad_norm": 0.2197798490524292, | |
| "learning_rate": 4.1779497098646034e-05, | |
| "loss": 0.9011, | |
| "num_input_tokens_seen": 59422240, | |
| "step": 1233, | |
| "train_runtime": 8620.6309, | |
| "train_tokens_per_second": 6893.027 | |
| }, | |
| { | |
| "epoch": 0.7933140469302475, | |
| "grad_norm": 0.21757225692272186, | |
| "learning_rate": 4.165054803352676e-05, | |
| "loss": 0.97, | |
| "num_input_tokens_seen": 59478848, | |
| "step": 1234, | |
| "train_runtime": 8628.5712, | |
| "train_tokens_per_second": 6893.244 | |
| }, | |
| { | |
| "epoch": 0.7939569270331083, | |
| "grad_norm": 0.21754653751850128, | |
| "learning_rate": 4.152159896840748e-05, | |
| "loss": 0.863, | |
| "num_input_tokens_seen": 59522960, | |
| "step": 1235, | |
| "train_runtime": 8634.7754, | |
| "train_tokens_per_second": 6893.4 | |
| }, | |
| { | |
| "epoch": 0.7945998071359691, | |
| "grad_norm": 0.2172289490699768, | |
| "learning_rate": 4.139264990328821e-05, | |
| "loss": 0.9865, | |
| "num_input_tokens_seen": 59562832, | |
| "step": 1236, | |
| "train_runtime": 8640.4108, | |
| "train_tokens_per_second": 6893.518 | |
| }, | |
| { | |
| "epoch": 0.79524268723883, | |
| "grad_norm": 0.21205008029937744, | |
| "learning_rate": 4.126370083816892e-05, | |
| "loss": 0.8675, | |
| "num_input_tokens_seen": 59600784, | |
| "step": 1237, | |
| "train_runtime": 8645.7572, | |
| "train_tokens_per_second": 6893.645 | |
| }, | |
| { | |
| "epoch": 0.7958855673416908, | |
| "grad_norm": 0.22735366225242615, | |
| "learning_rate": 4.1134751773049644e-05, | |
| "loss": 0.9441, | |
| "num_input_tokens_seen": 59636464, | |
| "step": 1238, | |
| "train_runtime": 8650.8144, | |
| "train_tokens_per_second": 6893.74 | |
| }, | |
| { | |
| "epoch": 0.7965284474445516, | |
| "grad_norm": 0.23327912390232086, | |
| "learning_rate": 4.100580270793037e-05, | |
| "loss": 0.9658, | |
| "num_input_tokens_seen": 59675792, | |
| "step": 1239, | |
| "train_runtime": 8656.3391, | |
| "train_tokens_per_second": 6893.883 | |
| }, | |
| { | |
| "epoch": 0.7971713275474124, | |
| "grad_norm": 0.22936224937438965, | |
| "learning_rate": 4.0876853642811094e-05, | |
| "loss": 0.9035, | |
| "num_input_tokens_seen": 59713312, | |
| "step": 1240, | |
| "train_runtime": 8661.6216, | |
| "train_tokens_per_second": 6894.011 | |
| }, | |
| { | |
| "epoch": 0.7978142076502732, | |
| "grad_norm": 0.3092407286167145, | |
| "learning_rate": 4.074790457769181e-05, | |
| "loss": 0.9441, | |
| "num_input_tokens_seen": 59750992, | |
| "step": 1241, | |
| "train_runtime": 8666.9545, | |
| "train_tokens_per_second": 6894.116 | |
| }, | |
| { | |
| "epoch": 0.7984570877531341, | |
| "grad_norm": 0.2089376598596573, | |
| "learning_rate": 4.061895551257254e-05, | |
| "loss": 0.9926, | |
| "num_input_tokens_seen": 59800864, | |
| "step": 1242, | |
| "train_runtime": 8673.9447, | |
| "train_tokens_per_second": 6894.31 | |
| }, | |
| { | |
| "epoch": 0.7990999678559949, | |
| "grad_norm": 0.22079479694366455, | |
| "learning_rate": 4.049000644745326e-05, | |
| "loss": 0.8473, | |
| "num_input_tokens_seen": 59834160, | |
| "step": 1243, | |
| "train_runtime": 8678.6795, | |
| "train_tokens_per_second": 6894.385 | |
| }, | |
| { | |
| "epoch": 0.7997428479588556, | |
| "grad_norm": 0.21040008962154388, | |
| "learning_rate": 4.036105738233398e-05, | |
| "loss": 0.915, | |
| "num_input_tokens_seen": 59872256, | |
| "step": 1244, | |
| "train_runtime": 8684.0907, | |
| "train_tokens_per_second": 6894.476 | |
| }, | |
| { | |
| "epoch": 0.8003857280617165, | |
| "grad_norm": 0.2410404533147812, | |
| "learning_rate": 4.02321083172147e-05, | |
| "loss": 1.0353, | |
| "num_input_tokens_seen": 59923728, | |
| "step": 1245, | |
| "train_runtime": 8691.3682, | |
| "train_tokens_per_second": 6894.625 | |
| }, | |
| { | |
| "epoch": 0.8010286081645773, | |
| "grad_norm": 0.23142696917057037, | |
| "learning_rate": 4.010315925209542e-05, | |
| "loss": 0.8739, | |
| "num_input_tokens_seen": 59959872, | |
| "step": 1246, | |
| "train_runtime": 8696.5196, | |
| "train_tokens_per_second": 6894.698 | |
| }, | |
| { | |
| "epoch": 0.8016714882674382, | |
| "grad_norm": 0.2280237376689911, | |
| "learning_rate": 3.997421018697615e-05, | |
| "loss": 1.0204, | |
| "num_input_tokens_seen": 60011952, | |
| "step": 1247, | |
| "train_runtime": 8703.7998, | |
| "train_tokens_per_second": 6894.914 | |
| }, | |
| { | |
| "epoch": 0.8023143683702989, | |
| "grad_norm": 0.21406146883964539, | |
| "learning_rate": 3.9845261121856866e-05, | |
| "loss": 0.9072, | |
| "num_input_tokens_seen": 60061136, | |
| "step": 1248, | |
| "train_runtime": 8710.6904, | |
| "train_tokens_per_second": 6895.106 | |
| }, | |
| { | |
| "epoch": 0.8023143683702989, | |
| "eval_loss": 0.9978415369987488, | |
| "eval_runtime": 40.0681, | |
| "eval_samples_per_second": 24.808, | |
| "eval_steps_per_second": 1.572, | |
| "num_input_tokens_seen": 60061136, | |
| "step": 1248 | |
| }, | |
| { | |
| "epoch": 0.8029572484731597, | |
| "grad_norm": 0.24779734015464783, | |
| "learning_rate": 3.971631205673759e-05, | |
| "loss": 0.9878, | |
| "num_input_tokens_seen": 60104144, | |
| "step": 1249, | |
| "train_runtime": 8756.8321, | |
| "train_tokens_per_second": 6863.686 | |
| }, | |
| { | |
| "epoch": 0.8036001285760206, | |
| "grad_norm": 0.2491709291934967, | |
| "learning_rate": 3.9587362991618316e-05, | |
| "loss": 0.9887, | |
| "num_input_tokens_seen": 60145840, | |
| "step": 1250, | |
| "train_runtime": 8762.7546, | |
| "train_tokens_per_second": 6863.805 | |
| }, | |
| { | |
| "epoch": 0.8042430086788814, | |
| "grad_norm": 0.2274121791124344, | |
| "learning_rate": 3.9458413926499034e-05, | |
| "loss": 0.8389, | |
| "num_input_tokens_seen": 60193536, | |
| "step": 1251, | |
| "train_runtime": 8769.4626, | |
| "train_tokens_per_second": 6863.994 | |
| }, | |
| { | |
| "epoch": 0.8048858887817422, | |
| "grad_norm": 0.21966342628002167, | |
| "learning_rate": 3.932946486137975e-05, | |
| "loss": 0.8693, | |
| "num_input_tokens_seen": 60243184, | |
| "step": 1252, | |
| "train_runtime": 8776.4333, | |
| "train_tokens_per_second": 6864.199 | |
| }, | |
| { | |
| "epoch": 0.805528768884603, | |
| "grad_norm": 0.23420031368732452, | |
| "learning_rate": 3.920051579626048e-05, | |
| "loss": 0.9123, | |
| "num_input_tokens_seen": 60272752, | |
| "step": 1253, | |
| "train_runtime": 8780.6698, | |
| "train_tokens_per_second": 6864.254 | |
| }, | |
| { | |
| "epoch": 0.8061716489874639, | |
| "grad_norm": 0.22144600749015808, | |
| "learning_rate": 3.90715667311412e-05, | |
| "loss": 0.9243, | |
| "num_input_tokens_seen": 60316464, | |
| "step": 1254, | |
| "train_runtime": 8786.8427, | |
| "train_tokens_per_second": 6864.407 | |
| }, | |
| { | |
| "epoch": 0.8068145290903247, | |
| "grad_norm": 0.22973129153251648, | |
| "learning_rate": 3.894261766602193e-05, | |
| "loss": 0.8757, | |
| "num_input_tokens_seen": 60370112, | |
| "step": 1255, | |
| "train_runtime": 8794.3484, | |
| "train_tokens_per_second": 6864.649 | |
| }, | |
| { | |
| "epoch": 0.8074574091931854, | |
| "grad_norm": 0.21880486607551575, | |
| "learning_rate": 3.8813668600902645e-05, | |
| "loss": 0.9781, | |
| "num_input_tokens_seen": 60426192, | |
| "step": 1256, | |
| "train_runtime": 8802.1636, | |
| "train_tokens_per_second": 6864.925 | |
| }, | |
| { | |
| "epoch": 0.8081002892960463, | |
| "grad_norm": 0.23579160869121552, | |
| "learning_rate": 3.868471953578336e-05, | |
| "loss": 0.9731, | |
| "num_input_tokens_seen": 60469616, | |
| "step": 1257, | |
| "train_runtime": 8808.3158, | |
| "train_tokens_per_second": 6865.06 | |
| }, | |
| { | |
| "epoch": 0.8087431693989071, | |
| "grad_norm": 0.23246201872825623, | |
| "learning_rate": 3.855577047066409e-05, | |
| "loss": 0.9306, | |
| "num_input_tokens_seen": 60512592, | |
| "step": 1258, | |
| "train_runtime": 8814.3148, | |
| "train_tokens_per_second": 6865.263 | |
| }, | |
| { | |
| "epoch": 0.809386049501768, | |
| "grad_norm": 0.2275032103061676, | |
| "learning_rate": 3.842682140554481e-05, | |
| "loss": 0.9319, | |
| "num_input_tokens_seen": 60574896, | |
| "step": 1259, | |
| "train_runtime": 8823.0076, | |
| "train_tokens_per_second": 6865.561 | |
| }, | |
| { | |
| "epoch": 0.8100289296046287, | |
| "grad_norm": 0.22882547974586487, | |
| "learning_rate": 3.829787234042553e-05, | |
| "loss": 1.0166, | |
| "num_input_tokens_seen": 60622112, | |
| "step": 1260, | |
| "train_runtime": 8829.6587, | |
| "train_tokens_per_second": 6865.737 | |
| }, | |
| { | |
| "epoch": 0.8106718097074895, | |
| "grad_norm": 0.24896188080310822, | |
| "learning_rate": 3.8168923275306256e-05, | |
| "loss": 1.0336, | |
| "num_input_tokens_seen": 60673776, | |
| "step": 1261, | |
| "train_runtime": 8837.388, | |
| "train_tokens_per_second": 6865.578 | |
| }, | |
| { | |
| "epoch": 0.8113146898103504, | |
| "grad_norm": 0.24217981100082397, | |
| "learning_rate": 3.803997421018698e-05, | |
| "loss": 1.0291, | |
| "num_input_tokens_seen": 60719712, | |
| "step": 1262, | |
| "train_runtime": 8843.8394, | |
| "train_tokens_per_second": 6865.764 | |
| }, | |
| { | |
| "epoch": 0.8119575699132112, | |
| "grad_norm": 0.24342891573905945, | |
| "learning_rate": 3.79110251450677e-05, | |
| "loss": 0.8978, | |
| "num_input_tokens_seen": 60759008, | |
| "step": 1263, | |
| "train_runtime": 8849.3883, | |
| "train_tokens_per_second": 6865.899 | |
| }, | |
| { | |
| "epoch": 0.812600450016072, | |
| "grad_norm": 0.21937716007232666, | |
| "learning_rate": 3.778207607994842e-05, | |
| "loss": 0.9114, | |
| "num_input_tokens_seen": 60793760, | |
| "step": 1264, | |
| "train_runtime": 8854.3231, | |
| "train_tokens_per_second": 6865.997 | |
| }, | |
| { | |
| "epoch": 0.8132433301189328, | |
| "grad_norm": 0.22124840319156647, | |
| "learning_rate": 3.765312701482914e-05, | |
| "loss": 0.8901, | |
| "num_input_tokens_seen": 60842800, | |
| "step": 1265, | |
| "train_runtime": 8861.218, | |
| "train_tokens_per_second": 6866.189 | |
| }, | |
| { | |
| "epoch": 0.8138862102217936, | |
| "grad_norm": 0.24157920479774475, | |
| "learning_rate": 3.752417794970987e-05, | |
| "loss": 1.0071, | |
| "num_input_tokens_seen": 60885248, | |
| "step": 1266, | |
| "train_runtime": 8867.1823, | |
| "train_tokens_per_second": 6866.358 | |
| }, | |
| { | |
| "epoch": 0.8145290903246545, | |
| "grad_norm": 0.21528279781341553, | |
| "learning_rate": 3.7395228884590585e-05, | |
| "loss": 0.925, | |
| "num_input_tokens_seen": 60937568, | |
| "step": 1267, | |
| "train_runtime": 8874.5446, | |
| "train_tokens_per_second": 6866.557 | |
| }, | |
| { | |
| "epoch": 0.8151719704275152, | |
| "grad_norm": 0.28632667660713196, | |
| "learning_rate": 3.726627981947131e-05, | |
| "loss": 0.9065, | |
| "num_input_tokens_seen": 60974000, | |
| "step": 1268, | |
| "train_runtime": 8879.6749, | |
| "train_tokens_per_second": 6866.693 | |
| }, | |
| { | |
| "epoch": 0.8158148505303761, | |
| "grad_norm": 0.21082501113414764, | |
| "learning_rate": 3.7137330754352035e-05, | |
| "loss": 0.8591, | |
| "num_input_tokens_seen": 61010336, | |
| "step": 1269, | |
| "train_runtime": 8884.8106, | |
| "train_tokens_per_second": 6866.813 | |
| }, | |
| { | |
| "epoch": 0.8164577306332369, | |
| "grad_norm": 0.2408752143383026, | |
| "learning_rate": 3.700838168923276e-05, | |
| "loss": 0.9138, | |
| "num_input_tokens_seen": 61060768, | |
| "step": 1270, | |
| "train_runtime": 8891.9102, | |
| "train_tokens_per_second": 6867.002 | |
| }, | |
| { | |
| "epoch": 0.8171006107360977, | |
| "grad_norm": 0.2305835634469986, | |
| "learning_rate": 3.687943262411347e-05, | |
| "loss": 0.8796, | |
| "num_input_tokens_seen": 61095104, | |
| "step": 1271, | |
| "train_runtime": 8896.7968, | |
| "train_tokens_per_second": 6867.09 | |
| }, | |
| { | |
| "epoch": 0.8177434908389586, | |
| "grad_norm": 0.2463512271642685, | |
| "learning_rate": 3.6750483558994196e-05, | |
| "loss": 0.9345, | |
| "num_input_tokens_seen": 61136608, | |
| "step": 1272, | |
| "train_runtime": 8902.6282, | |
| "train_tokens_per_second": 6867.254 | |
| }, | |
| { | |
| "epoch": 0.8183863709418193, | |
| "grad_norm": 0.22142194211483002, | |
| "learning_rate": 3.662153449387492e-05, | |
| "loss": 0.9516, | |
| "num_input_tokens_seen": 61183712, | |
| "step": 1273, | |
| "train_runtime": 8909.2587, | |
| "train_tokens_per_second": 6867.43 | |
| }, | |
| { | |
| "epoch": 0.8190292510446802, | |
| "grad_norm": 0.22028407454490662, | |
| "learning_rate": 3.6492585428755646e-05, | |
| "loss": 0.9311, | |
| "num_input_tokens_seen": 61260576, | |
| "step": 1274, | |
| "train_runtime": 8920.0131, | |
| "train_tokens_per_second": 6867.768 | |
| }, | |
| { | |
| "epoch": 0.819672131147541, | |
| "grad_norm": 0.21425789594650269, | |
| "learning_rate": 3.6363636363636364e-05, | |
| "loss": 1.0058, | |
| "num_input_tokens_seen": 61301920, | |
| "step": 1275, | |
| "train_runtime": 8925.9034, | |
| "train_tokens_per_second": 6867.867 | |
| }, | |
| { | |
| "epoch": 0.8203150112504018, | |
| "grad_norm": 0.24809955060482025, | |
| "learning_rate": 3.623468729851709e-05, | |
| "loss": 1.0607, | |
| "num_input_tokens_seen": 61362656, | |
| "step": 1276, | |
| "train_runtime": 8934.4359, | |
| "train_tokens_per_second": 6868.106 | |
| }, | |
| { | |
| "epoch": 0.8209578913532626, | |
| "grad_norm": 0.20570631325244904, | |
| "learning_rate": 3.6105738233397814e-05, | |
| "loss": 0.903, | |
| "num_input_tokens_seen": 61408960, | |
| "step": 1277, | |
| "train_runtime": 8940.9874, | |
| "train_tokens_per_second": 6868.253 | |
| }, | |
| { | |
| "epoch": 0.8216007714561234, | |
| "grad_norm": 0.234993577003479, | |
| "learning_rate": 3.597678916827853e-05, | |
| "loss": 1.0065, | |
| "num_input_tokens_seen": 61457568, | |
| "step": 1278, | |
| "train_runtime": 8947.87, | |
| "train_tokens_per_second": 6868.402 | |
| }, | |
| { | |
| "epoch": 0.8222436515589843, | |
| "grad_norm": 0.21434393525123596, | |
| "learning_rate": 3.584784010315925e-05, | |
| "loss": 0.9359, | |
| "num_input_tokens_seen": 61494944, | |
| "step": 1279, | |
| "train_runtime": 8953.174, | |
| "train_tokens_per_second": 6868.508 | |
| }, | |
| { | |
| "epoch": 0.8228865316618451, | |
| "grad_norm": 0.23359251022338867, | |
| "learning_rate": 3.5718891038039975e-05, | |
| "loss": 0.9728, | |
| "num_input_tokens_seen": 61549936, | |
| "step": 1280, | |
| "train_runtime": 8960.8875, | |
| "train_tokens_per_second": 6868.732 | |
| }, | |
| { | |
| "epoch": 0.8235294117647058, | |
| "grad_norm": 0.23295457661151886, | |
| "learning_rate": 3.55899419729207e-05, | |
| "loss": 0.9831, | |
| "num_input_tokens_seen": 61597104, | |
| "step": 1281, | |
| "train_runtime": 8967.5677, | |
| "train_tokens_per_second": 6868.875 | |
| }, | |
| { | |
| "epoch": 0.8241722918675667, | |
| "grad_norm": 0.23427145183086395, | |
| "learning_rate": 3.546099290780142e-05, | |
| "loss": 0.9904, | |
| "num_input_tokens_seen": 61649024, | |
| "step": 1282, | |
| "train_runtime": 8974.8213, | |
| "train_tokens_per_second": 6869.109 | |
| }, | |
| { | |
| "epoch": 0.8248151719704275, | |
| "grad_norm": 0.25249189138412476, | |
| "learning_rate": 3.533204384268214e-05, | |
| "loss": 1.3934, | |
| "num_input_tokens_seen": 61705136, | |
| "step": 1283, | |
| "train_runtime": 8982.6911, | |
| "train_tokens_per_second": 6869.337 | |
| }, | |
| { | |
| "epoch": 0.8254580520732884, | |
| "grad_norm": 0.22632817924022675, | |
| "learning_rate": 3.520309477756286e-05, | |
| "loss": 0.9095, | |
| "num_input_tokens_seen": 61776336, | |
| "step": 1284, | |
| "train_runtime": 8992.6871, | |
| "train_tokens_per_second": 6869.619 | |
| }, | |
| { | |
| "epoch": 0.8261009321761491, | |
| "grad_norm": 0.22133934497833252, | |
| "learning_rate": 3.5074145712443586e-05, | |
| "loss": 0.9181, | |
| "num_input_tokens_seen": 61814624, | |
| "step": 1285, | |
| "train_runtime": 8998.1163, | |
| "train_tokens_per_second": 6869.729 | |
| }, | |
| { | |
| "epoch": 0.82674381227901, | |
| "grad_norm": 0.21737878024578094, | |
| "learning_rate": 3.4945196647324304e-05, | |
| "loss": 0.992, | |
| "num_input_tokens_seen": 61885232, | |
| "step": 1286, | |
| "train_runtime": 9007.9965, | |
| "train_tokens_per_second": 6870.033 | |
| }, | |
| { | |
| "epoch": 0.8273866923818708, | |
| "grad_norm": 0.24849003553390503, | |
| "learning_rate": 3.481624758220503e-05, | |
| "loss": 1.1027, | |
| "num_input_tokens_seen": 61920896, | |
| "step": 1287, | |
| "train_runtime": 9013.0615, | |
| "train_tokens_per_second": 6870.129 | |
| }, | |
| { | |
| "epoch": 0.8280295724847316, | |
| "grad_norm": 0.21847772598266602, | |
| "learning_rate": 3.4687298517085754e-05, | |
| "loss": 0.9722, | |
| "num_input_tokens_seen": 61973696, | |
| "step": 1288, | |
| "train_runtime": 9020.5141, | |
| "train_tokens_per_second": 6870.306 | |
| }, | |
| { | |
| "epoch": 0.8286724525875924, | |
| "grad_norm": 0.22305962443351746, | |
| "learning_rate": 3.455834945196648e-05, | |
| "loss": 1.0413, | |
| "num_input_tokens_seen": 62009824, | |
| "step": 1289, | |
| "train_runtime": 9025.6725, | |
| "train_tokens_per_second": 6870.383 | |
| }, | |
| { | |
| "epoch": 0.8293153326904532, | |
| "grad_norm": 0.21231709420681, | |
| "learning_rate": 3.44294003868472e-05, | |
| "loss": 0.8639, | |
| "num_input_tokens_seen": 62091072, | |
| "step": 1290, | |
| "train_runtime": 9037.0685, | |
| "train_tokens_per_second": 6870.709 | |
| }, | |
| { | |
| "epoch": 0.829958212793314, | |
| "grad_norm": 0.21660618484020233, | |
| "learning_rate": 3.4300451321727915e-05, | |
| "loss": 0.914, | |
| "num_input_tokens_seen": 62127408, | |
| "step": 1291, | |
| "train_runtime": 9042.7565, | |
| "train_tokens_per_second": 6870.406 | |
| }, | |
| { | |
| "epoch": 0.8306010928961749, | |
| "grad_norm": 0.2337297797203064, | |
| "learning_rate": 3.417150225660864e-05, | |
| "loss": 0.9785, | |
| "num_input_tokens_seen": 62184736, | |
| "step": 1292, | |
| "train_runtime": 9050.7518, | |
| "train_tokens_per_second": 6870.671 | |
| }, | |
| { | |
| "epoch": 0.8312439729990356, | |
| "grad_norm": 0.23421838879585266, | |
| "learning_rate": 3.4042553191489365e-05, | |
| "loss": 1.07, | |
| "num_input_tokens_seen": 62217472, | |
| "step": 1293, | |
| "train_runtime": 9055.4066, | |
| "train_tokens_per_second": 6870.754 | |
| }, | |
| { | |
| "epoch": 0.8318868531018965, | |
| "grad_norm": 0.23266111314296722, | |
| "learning_rate": 3.391360412637008e-05, | |
| "loss": 0.9908, | |
| "num_input_tokens_seen": 62260736, | |
| "step": 1294, | |
| "train_runtime": 9061.4565, | |
| "train_tokens_per_second": 6870.941 | |
| }, | |
| { | |
| "epoch": 0.8325297332047573, | |
| "grad_norm": 0.2197062373161316, | |
| "learning_rate": 3.378465506125081e-05, | |
| "loss": 0.9503, | |
| "num_input_tokens_seen": 62299360, | |
| "step": 1295, | |
| "train_runtime": 9066.9208, | |
| "train_tokens_per_second": 6871.06 | |
| }, | |
| { | |
| "epoch": 0.8331726133076182, | |
| "grad_norm": 0.21622958779335022, | |
| "learning_rate": 3.365570599613153e-05, | |
| "loss": 0.9882, | |
| "num_input_tokens_seen": 62338960, | |
| "step": 1296, | |
| "train_runtime": 9072.4918, | |
| "train_tokens_per_second": 6871.206 | |
| }, | |
| { | |
| "epoch": 0.8338154934104789, | |
| "grad_norm": 0.21843262016773224, | |
| "learning_rate": 3.352675693101225e-05, | |
| "loss": 0.9831, | |
| "num_input_tokens_seen": 62378832, | |
| "step": 1297, | |
| "train_runtime": 9078.1235, | |
| "train_tokens_per_second": 6871.335 | |
| }, | |
| { | |
| "epoch": 0.8344583735133397, | |
| "grad_norm": 0.22889907658100128, | |
| "learning_rate": 3.339780786589297e-05, | |
| "loss": 0.8782, | |
| "num_input_tokens_seen": 62420640, | |
| "step": 1298, | |
| "train_runtime": 9083.9834, | |
| "train_tokens_per_second": 6871.505 | |
| }, | |
| { | |
| "epoch": 0.8351012536162006, | |
| "grad_norm": 0.23234236240386963, | |
| "learning_rate": 3.3268858800773694e-05, | |
| "loss": 0.8964, | |
| "num_input_tokens_seen": 62468304, | |
| "step": 1299, | |
| "train_runtime": 9090.7185, | |
| "train_tokens_per_second": 6871.658 | |
| }, | |
| { | |
| "epoch": 0.8357441337190614, | |
| "grad_norm": 0.210599884390831, | |
| "learning_rate": 3.313990973565442e-05, | |
| "loss": 0.9152, | |
| "num_input_tokens_seen": 62512080, | |
| "step": 1300, | |
| "train_runtime": 9096.8766, | |
| "train_tokens_per_second": 6871.818 | |
| }, | |
| { | |
| "epoch": 0.8363870138219223, | |
| "grad_norm": 0.2227179855108261, | |
| "learning_rate": 3.3010960670535144e-05, | |
| "loss": 0.9977, | |
| "num_input_tokens_seen": 62551312, | |
| "step": 1301, | |
| "train_runtime": 9102.3838, | |
| "train_tokens_per_second": 6871.97 | |
| }, | |
| { | |
| "epoch": 0.837029893924783, | |
| "grad_norm": 0.2382332682609558, | |
| "learning_rate": 3.288201160541586e-05, | |
| "loss": 0.937, | |
| "num_input_tokens_seen": 62600304, | |
| "step": 1302, | |
| "train_runtime": 9109.25, | |
| "train_tokens_per_second": 6872.169 | |
| }, | |
| { | |
| "epoch": 0.8376727740276438, | |
| "grad_norm": 0.20747257769107819, | |
| "learning_rate": 3.275306254029659e-05, | |
| "loss": 1.0066, | |
| "num_input_tokens_seen": 62653216, | |
| "step": 1303, | |
| "train_runtime": 9116.6433, | |
| "train_tokens_per_second": 6872.4 | |
| }, | |
| { | |
| "epoch": 0.8383156541305047, | |
| "grad_norm": 0.20847642421722412, | |
| "learning_rate": 3.262411347517731e-05, | |
| "loss": 0.9644, | |
| "num_input_tokens_seen": 62696416, | |
| "step": 1304, | |
| "train_runtime": 9122.7469, | |
| "train_tokens_per_second": 6872.537 | |
| }, | |
| { | |
| "epoch": 0.8389585342333655, | |
| "grad_norm": 0.22569946944713593, | |
| "learning_rate": 3.249516441005803e-05, | |
| "loss": 0.9966, | |
| "num_input_tokens_seen": 62734384, | |
| "step": 1305, | |
| "train_runtime": 9128.136, | |
| "train_tokens_per_second": 6872.639 | |
| }, | |
| { | |
| "epoch": 0.8396014143362263, | |
| "grad_norm": 0.21350441873073578, | |
| "learning_rate": 3.236621534493875e-05, | |
| "loss": 0.8312, | |
| "num_input_tokens_seen": 62784304, | |
| "step": 1306, | |
| "train_runtime": 9135.2632, | |
| "train_tokens_per_second": 6872.742 | |
| }, | |
| { | |
| "epoch": 0.8402442944390871, | |
| "grad_norm": 0.2505035698413849, | |
| "learning_rate": 3.223726627981947e-05, | |
| "loss": 0.7903, | |
| "num_input_tokens_seen": 62827200, | |
| "step": 1307, | |
| "train_runtime": 9141.2689, | |
| "train_tokens_per_second": 6872.919 | |
| }, | |
| { | |
| "epoch": 0.840887174541948, | |
| "grad_norm": 0.22541561722755432, | |
| "learning_rate": 3.21083172147002e-05, | |
| "loss": 0.958, | |
| "num_input_tokens_seen": 62877392, | |
| "step": 1308, | |
| "train_runtime": 9148.37, | |
| "train_tokens_per_second": 6873.07 | |
| }, | |
| { | |
| "epoch": 0.8415300546448088, | |
| "grad_norm": 0.2288602888584137, | |
| "learning_rate": 3.1979368149580916e-05, | |
| "loss": 0.939, | |
| "num_input_tokens_seen": 62934912, | |
| "step": 1309, | |
| "train_runtime": 9156.462, | |
| "train_tokens_per_second": 6873.278 | |
| }, | |
| { | |
| "epoch": 0.8421729347476695, | |
| "grad_norm": 0.21767346560955048, | |
| "learning_rate": 3.185041908446164e-05, | |
| "loss": 0.8732, | |
| "num_input_tokens_seen": 62972032, | |
| "step": 1310, | |
| "train_runtime": 9161.7436, | |
| "train_tokens_per_second": 6873.368 | |
| }, | |
| { | |
| "epoch": 0.8428158148505304, | |
| "grad_norm": 0.23855219781398773, | |
| "learning_rate": 3.172147001934236e-05, | |
| "loss": 0.9919, | |
| "num_input_tokens_seen": 63013904, | |
| "step": 1311, | |
| "train_runtime": 9167.6385, | |
| "train_tokens_per_second": 6873.515 | |
| }, | |
| { | |
| "epoch": 0.8434586949533912, | |
| "grad_norm": 0.22057105600833893, | |
| "learning_rate": 3.1592520954223084e-05, | |
| "loss": 0.8627, | |
| "num_input_tokens_seen": 63077488, | |
| "step": 1312, | |
| "train_runtime": 9176.5594, | |
| "train_tokens_per_second": 6873.762 | |
| }, | |
| { | |
| "epoch": 0.844101575056252, | |
| "grad_norm": 0.2043379843235016, | |
| "learning_rate": 3.14635718891038e-05, | |
| "loss": 0.8982, | |
| "num_input_tokens_seen": 63126688, | |
| "step": 1313, | |
| "train_runtime": 9183.4801, | |
| "train_tokens_per_second": 6873.94 | |
| }, | |
| { | |
| "epoch": 0.8447444551591128, | |
| "grad_norm": 0.20252691209316254, | |
| "learning_rate": 3.133462282398453e-05, | |
| "loss": 0.8743, | |
| "num_input_tokens_seen": 63165360, | |
| "step": 1314, | |
| "train_runtime": 9188.9999, | |
| "train_tokens_per_second": 6874.019 | |
| }, | |
| { | |
| "epoch": 0.8453873352619736, | |
| "grad_norm": 0.24319347739219666, | |
| "learning_rate": 3.120567375886525e-05, | |
| "loss": 1.0114, | |
| "num_input_tokens_seen": 63205120, | |
| "step": 1315, | |
| "train_runtime": 9194.6333, | |
| "train_tokens_per_second": 6874.132 | |
| }, | |
| { | |
| "epoch": 0.8460302153648345, | |
| "grad_norm": 0.24205361306667328, | |
| "learning_rate": 3.107672469374598e-05, | |
| "loss": 0.9002, | |
| "num_input_tokens_seen": 63253072, | |
| "step": 1316, | |
| "train_runtime": 9201.357, | |
| "train_tokens_per_second": 6874.32 | |
| }, | |
| { | |
| "epoch": 0.8466730954676953, | |
| "grad_norm": 0.22536036372184753, | |
| "learning_rate": 3.0947775628626695e-05, | |
| "loss": 0.9127, | |
| "num_input_tokens_seen": 63294464, | |
| "step": 1317, | |
| "train_runtime": 9207.1647, | |
| "train_tokens_per_second": 6874.479 | |
| }, | |
| { | |
| "epoch": 0.847315975570556, | |
| "grad_norm": 0.2225712686777115, | |
| "learning_rate": 3.081882656350741e-05, | |
| "loss": 1.092, | |
| "num_input_tokens_seen": 63341584, | |
| "step": 1318, | |
| "train_runtime": 9213.7477, | |
| "train_tokens_per_second": 6874.682 | |
| }, | |
| { | |
| "epoch": 0.8479588556734169, | |
| "grad_norm": 0.2246129810810089, | |
| "learning_rate": 3.068987749838814e-05, | |
| "loss": 0.9754, | |
| "num_input_tokens_seen": 63383728, | |
| "step": 1319, | |
| "train_runtime": 9219.7143, | |
| "train_tokens_per_second": 6874.804 | |
| }, | |
| { | |
| "epoch": 0.8486017357762777, | |
| "grad_norm": 0.22739674150943756, | |
| "learning_rate": 3.056092843326886e-05, | |
| "loss": 0.8704, | |
| "num_input_tokens_seen": 63431200, | |
| "step": 1320, | |
| "train_runtime": 9226.3672, | |
| "train_tokens_per_second": 6874.992 | |
| }, | |
| { | |
| "epoch": 0.8492446158791386, | |
| "grad_norm": 0.23638106882572174, | |
| "learning_rate": 3.043197936814958e-05, | |
| "loss": 0.9812, | |
| "num_input_tokens_seen": 63468624, | |
| "step": 1321, | |
| "train_runtime": 9232.2044, | |
| "train_tokens_per_second": 6874.699 | |
| }, | |
| { | |
| "epoch": 0.8498874959819993, | |
| "grad_norm": 0.2244069129228592, | |
| "learning_rate": 3.0303030303030306e-05, | |
| "loss": 0.9947, | |
| "num_input_tokens_seen": 63519392, | |
| "step": 1322, | |
| "train_runtime": 9239.3341, | |
| "train_tokens_per_second": 6874.889 | |
| }, | |
| { | |
| "epoch": 0.8505303760848602, | |
| "grad_norm": 0.21489335596561432, | |
| "learning_rate": 3.0174081237911027e-05, | |
| "loss": 0.8827, | |
| "num_input_tokens_seen": 63558224, | |
| "step": 1323, | |
| "train_runtime": 9244.8389, | |
| "train_tokens_per_second": 6874.995 | |
| }, | |
| { | |
| "epoch": 0.851173256187721, | |
| "grad_norm": 0.2280271053314209, | |
| "learning_rate": 3.0045132172791752e-05, | |
| "loss": 0.9427, | |
| "num_input_tokens_seen": 63611792, | |
| "step": 1324, | |
| "train_runtime": 9252.3795, | |
| "train_tokens_per_second": 6875.182 | |
| }, | |
| { | |
| "epoch": 0.8518161362905818, | |
| "grad_norm": 0.2121179848909378, | |
| "learning_rate": 2.991618310767247e-05, | |
| "loss": 0.9785, | |
| "num_input_tokens_seen": 63668368, | |
| "step": 1325, | |
| "train_runtime": 9260.2535, | |
| "train_tokens_per_second": 6875.445 | |
| }, | |
| { | |
| "epoch": 0.8524590163934426, | |
| "grad_norm": 0.2208545058965683, | |
| "learning_rate": 2.9787234042553192e-05, | |
| "loss": 0.8791, | |
| "num_input_tokens_seen": 63708352, | |
| "step": 1326, | |
| "train_runtime": 9265.9015, | |
| "train_tokens_per_second": 6875.57 | |
| }, | |
| { | |
| "epoch": 0.8531018964963034, | |
| "grad_norm": 0.2271835207939148, | |
| "learning_rate": 2.9658284977433913e-05, | |
| "loss": 0.9281, | |
| "num_input_tokens_seen": 63749152, | |
| "step": 1327, | |
| "train_runtime": 9271.6298, | |
| "train_tokens_per_second": 6875.722 | |
| }, | |
| { | |
| "epoch": 0.8537447765991643, | |
| "grad_norm": 0.2530703842639923, | |
| "learning_rate": 2.9529335912314638e-05, | |
| "loss": 1.0096, | |
| "num_input_tokens_seen": 63798240, | |
| "step": 1328, | |
| "train_runtime": 9278.5301, | |
| "train_tokens_per_second": 6875.899 | |
| }, | |
| { | |
| "epoch": 0.8543876567020251, | |
| "grad_norm": 0.2180684357881546, | |
| "learning_rate": 2.940038684719536e-05, | |
| "loss": 0.8982, | |
| "num_input_tokens_seen": 63854480, | |
| "step": 1329, | |
| "train_runtime": 9286.4279, | |
| "train_tokens_per_second": 6876.108 | |
| }, | |
| { | |
| "epoch": 0.8550305368048859, | |
| "grad_norm": 0.2329641580581665, | |
| "learning_rate": 2.9271437782076085e-05, | |
| "loss": 1.056, | |
| "num_input_tokens_seen": 63919616, | |
| "step": 1330, | |
| "train_runtime": 9295.4858, | |
| "train_tokens_per_second": 6876.415 | |
| }, | |
| { | |
| "epoch": 0.8556734169077467, | |
| "grad_norm": 0.24323369562625885, | |
| "learning_rate": 2.9142488716956806e-05, | |
| "loss": 0.9347, | |
| "num_input_tokens_seen": 63953392, | |
| "step": 1331, | |
| "train_runtime": 9300.3106, | |
| "train_tokens_per_second": 6876.479 | |
| }, | |
| { | |
| "epoch": 0.8563162970106075, | |
| "grad_norm": 0.23381201922893524, | |
| "learning_rate": 2.9013539651837524e-05, | |
| "loss": 1.0158, | |
| "num_input_tokens_seen": 64022416, | |
| "step": 1332, | |
| "train_runtime": 9309.9939, | |
| "train_tokens_per_second": 6876.741 | |
| }, | |
| { | |
| "epoch": 0.8569591771134684, | |
| "grad_norm": 0.20569060742855072, | |
| "learning_rate": 2.8884590586718246e-05, | |
| "loss": 0.9542, | |
| "num_input_tokens_seen": 64084016, | |
| "step": 1333, | |
| "train_runtime": 9318.5868, | |
| "train_tokens_per_second": 6877.01 | |
| }, | |
| { | |
| "epoch": 0.8576020572163292, | |
| "grad_norm": 0.2487626075744629, | |
| "learning_rate": 2.875564152159897e-05, | |
| "loss": 0.8908, | |
| "num_input_tokens_seen": 64142288, | |
| "step": 1334, | |
| "train_runtime": 9326.7236, | |
| "train_tokens_per_second": 6877.258 | |
| }, | |
| { | |
| "epoch": 0.8582449373191899, | |
| "grad_norm": 0.21883252263069153, | |
| "learning_rate": 2.8626692456479692e-05, | |
| "loss": 1.0138, | |
| "num_input_tokens_seen": 64191808, | |
| "step": 1335, | |
| "train_runtime": 9333.6551, | |
| "train_tokens_per_second": 6877.457 | |
| }, | |
| { | |
| "epoch": 0.8588878174220508, | |
| "grad_norm": 0.22027264535427094, | |
| "learning_rate": 2.8497743391360414e-05, | |
| "loss": 0.7875, | |
| "num_input_tokens_seen": 64250336, | |
| "step": 1336, | |
| "train_runtime": 9341.8962, | |
| "train_tokens_per_second": 6877.655 | |
| }, | |
| { | |
| "epoch": 0.8595306975249116, | |
| "grad_norm": 0.21138998866081238, | |
| "learning_rate": 2.836879432624114e-05, | |
| "loss": 0.9741, | |
| "num_input_tokens_seen": 64310224, | |
| "step": 1337, | |
| "train_runtime": 9350.3003, | |
| "train_tokens_per_second": 6877.878 | |
| }, | |
| { | |
| "epoch": 0.8601735776277725, | |
| "grad_norm": 0.22284504771232605, | |
| "learning_rate": 2.8239845261121857e-05, | |
| "loss": 1.0089, | |
| "num_input_tokens_seen": 64343168, | |
| "step": 1338, | |
| "train_runtime": 9354.9833, | |
| "train_tokens_per_second": 6877.956 | |
| }, | |
| { | |
| "epoch": 0.8608164577306332, | |
| "grad_norm": 0.21529455482959747, | |
| "learning_rate": 2.8110896196002578e-05, | |
| "loss": 0.966, | |
| "num_input_tokens_seen": 64389136, | |
| "step": 1339, | |
| "train_runtime": 9361.4442, | |
| "train_tokens_per_second": 6878.12 | |
| }, | |
| { | |
| "epoch": 0.861459337833494, | |
| "grad_norm": 0.2132706642150879, | |
| "learning_rate": 2.7981947130883303e-05, | |
| "loss": 0.8745, | |
| "num_input_tokens_seen": 64432304, | |
| "step": 1340, | |
| "train_runtime": 9367.5306, | |
| "train_tokens_per_second": 6878.259 | |
| }, | |
| { | |
| "epoch": 0.8621022179363549, | |
| "grad_norm": 0.23623524606227875, | |
| "learning_rate": 2.7852998065764025e-05, | |
| "loss": 0.9538, | |
| "num_input_tokens_seen": 64474288, | |
| "step": 1341, | |
| "train_runtime": 9373.4733, | |
| "train_tokens_per_second": 6878.378 | |
| }, | |
| { | |
| "epoch": 0.8627450980392157, | |
| "grad_norm": 0.22249281406402588, | |
| "learning_rate": 2.7724049000644746e-05, | |
| "loss": 0.8987, | |
| "num_input_tokens_seen": 64514576, | |
| "step": 1342, | |
| "train_runtime": 9379.1133, | |
| "train_tokens_per_second": 6878.537 | |
| }, | |
| { | |
| "epoch": 0.8633879781420765, | |
| "grad_norm": 0.23305073380470276, | |
| "learning_rate": 2.759509993552547e-05, | |
| "loss": 0.8426, | |
| "num_input_tokens_seen": 64556816, | |
| "step": 1343, | |
| "train_runtime": 9385.0941, | |
| "train_tokens_per_second": 6878.654 | |
| }, | |
| { | |
| "epoch": 0.8640308582449373, | |
| "grad_norm": 0.2223258912563324, | |
| "learning_rate": 2.7466150870406193e-05, | |
| "loss": 1.0508, | |
| "num_input_tokens_seen": 64602640, | |
| "step": 1344, | |
| "train_runtime": 9391.5157, | |
| "train_tokens_per_second": 6878.83 | |
| }, | |
| { | |
| "epoch": 0.8646737383477981, | |
| "grad_norm": 0.2066197246313095, | |
| "learning_rate": 2.733720180528691e-05, | |
| "loss": 0.914, | |
| "num_input_tokens_seen": 64662432, | |
| "step": 1345, | |
| "train_runtime": 9399.9503, | |
| "train_tokens_per_second": 6879.019 | |
| }, | |
| { | |
| "epoch": 0.865316618450659, | |
| "grad_norm": 0.23025156557559967, | |
| "learning_rate": 2.7208252740167632e-05, | |
| "loss": 1.0049, | |
| "num_input_tokens_seen": 64716896, | |
| "step": 1346, | |
| "train_runtime": 9407.5761, | |
| "train_tokens_per_second": 6879.232 | |
| }, | |
| { | |
| "epoch": 0.8659594985535197, | |
| "grad_norm": 0.20561859011650085, | |
| "learning_rate": 2.7079303675048357e-05, | |
| "loss": 0.8103, | |
| "num_input_tokens_seen": 64759664, | |
| "step": 1347, | |
| "train_runtime": 9413.5949, | |
| "train_tokens_per_second": 6879.377 | |
| }, | |
| { | |
| "epoch": 0.8666023786563806, | |
| "grad_norm": 0.24761579930782318, | |
| "learning_rate": 2.695035460992908e-05, | |
| "loss": 1.0608, | |
| "num_input_tokens_seen": 64801808, | |
| "step": 1348, | |
| "train_runtime": 9419.5286, | |
| "train_tokens_per_second": 6879.517 | |
| }, | |
| { | |
| "epoch": 0.8672452587592414, | |
| "grad_norm": 0.23833587765693665, | |
| "learning_rate": 2.6821405544809803e-05, | |
| "loss": 1.0325, | |
| "num_input_tokens_seen": 64856656, | |
| "step": 1349, | |
| "train_runtime": 9427.206, | |
| "train_tokens_per_second": 6879.733 | |
| }, | |
| { | |
| "epoch": 0.8678881388621023, | |
| "grad_norm": 0.24994045495986938, | |
| "learning_rate": 2.6692456479690525e-05, | |
| "loss": 1.0294, | |
| "num_input_tokens_seen": 64891456, | |
| "step": 1350, | |
| "train_runtime": 9432.1515, | |
| "train_tokens_per_second": 6879.815 | |
| }, | |
| { | |
| "epoch": 0.868531018964963, | |
| "grad_norm": 0.2241462916135788, | |
| "learning_rate": 2.6563507414571247e-05, | |
| "loss": 1.2096, | |
| "num_input_tokens_seen": 64944320, | |
| "step": 1351, | |
| "train_runtime": 9440.0687, | |
| "train_tokens_per_second": 6879.645 | |
| }, | |
| { | |
| "epoch": 0.8691738990678238, | |
| "grad_norm": 0.21827709674835205, | |
| "learning_rate": 2.6434558349451965e-05, | |
| "loss": 0.9132, | |
| "num_input_tokens_seen": 65016704, | |
| "step": 1352, | |
| "train_runtime": 9450.2725, | |
| "train_tokens_per_second": 6879.876 | |
| }, | |
| { | |
| "epoch": 0.8698167791706847, | |
| "grad_norm": 0.2271472066640854, | |
| "learning_rate": 2.630560928433269e-05, | |
| "loss": 0.9197, | |
| "num_input_tokens_seen": 65057376, | |
| "step": 1353, | |
| "train_runtime": 9455.9918, | |
| "train_tokens_per_second": 6880.016 | |
| }, | |
| { | |
| "epoch": 0.8704596592735455, | |
| "grad_norm": 0.22219029068946838, | |
| "learning_rate": 2.617666021921341e-05, | |
| "loss": 0.9124, | |
| "num_input_tokens_seen": 65093680, | |
| "step": 1354, | |
| "train_runtime": 9461.1493, | |
| "train_tokens_per_second": 6880.103 | |
| }, | |
| { | |
| "epoch": 0.8711025393764062, | |
| "grad_norm": 0.24440434575080872, | |
| "learning_rate": 2.6047711154094136e-05, | |
| "loss": 1.0075, | |
| "num_input_tokens_seen": 65138896, | |
| "step": 1355, | |
| "train_runtime": 9467.5476, | |
| "train_tokens_per_second": 6880.229 | |
| }, | |
| { | |
| "epoch": 0.8717454194792671, | |
| "grad_norm": 0.21005411446094513, | |
| "learning_rate": 2.5918762088974857e-05, | |
| "loss": 0.9593, | |
| "num_input_tokens_seen": 65177488, | |
| "step": 1356, | |
| "train_runtime": 9472.9808, | |
| "train_tokens_per_second": 6880.357 | |
| }, | |
| { | |
| "epoch": 0.8723882995821279, | |
| "grad_norm": 0.2265816330909729, | |
| "learning_rate": 2.578981302385558e-05, | |
| "loss": 0.8899, | |
| "num_input_tokens_seen": 65212144, | |
| "step": 1357, | |
| "train_runtime": 9477.8714, | |
| "train_tokens_per_second": 6880.463 | |
| }, | |
| { | |
| "epoch": 0.8730311796849888, | |
| "grad_norm": 0.22339262068271637, | |
| "learning_rate": 2.5660863958736304e-05, | |
| "loss": 0.9877, | |
| "num_input_tokens_seen": 65256048, | |
| "step": 1358, | |
| "train_runtime": 9484.0266, | |
| "train_tokens_per_second": 6880.627 | |
| }, | |
| { | |
| "epoch": 0.8736740597878495, | |
| "grad_norm": 0.2420601099729538, | |
| "learning_rate": 2.5531914893617022e-05, | |
| "loss": 0.9584, | |
| "num_input_tokens_seen": 65311952, | |
| "step": 1359, | |
| "train_runtime": 9491.8732, | |
| "train_tokens_per_second": 6880.829 | |
| }, | |
| { | |
| "epoch": 0.8743169398907104, | |
| "grad_norm": 0.20226748287677765, | |
| "learning_rate": 2.5402965828497744e-05, | |
| "loss": 0.8146, | |
| "num_input_tokens_seen": 65372576, | |
| "step": 1360, | |
| "train_runtime": 9500.4272, | |
| "train_tokens_per_second": 6881.014 | |
| }, | |
| { | |
| "epoch": 0.8749598199935712, | |
| "grad_norm": 0.21576273441314697, | |
| "learning_rate": 2.5274016763378465e-05, | |
| "loss": 0.8867, | |
| "num_input_tokens_seen": 65412800, | |
| "step": 1361, | |
| "train_runtime": 9506.0663, | |
| "train_tokens_per_second": 6881.164 | |
| }, | |
| { | |
| "epoch": 0.875602700096432, | |
| "grad_norm": 0.22144931554794312, | |
| "learning_rate": 2.514506769825919e-05, | |
| "loss": 0.9981, | |
| "num_input_tokens_seen": 65458672, | |
| "step": 1362, | |
| "train_runtime": 9512.5325, | |
| "train_tokens_per_second": 6881.309 | |
| }, | |
| { | |
| "epoch": 0.8762455801992929, | |
| "grad_norm": 0.2183014303445816, | |
| "learning_rate": 2.501611863313991e-05, | |
| "loss": 0.9481, | |
| "num_input_tokens_seen": 65510736, | |
| "step": 1363, | |
| "train_runtime": 9519.8042, | |
| "train_tokens_per_second": 6881.521 | |
| }, | |
| { | |
| "epoch": 0.8768884603021536, | |
| "grad_norm": 0.22006624937057495, | |
| "learning_rate": 2.4887169568020633e-05, | |
| "loss": 1.0402, | |
| "num_input_tokens_seen": 65559648, | |
| "step": 1364, | |
| "train_runtime": 9526.6833, | |
| "train_tokens_per_second": 6881.687 | |
| }, | |
| { | |
| "epoch": 0.8775313404050145, | |
| "grad_norm": 0.2272113561630249, | |
| "learning_rate": 2.4758220502901354e-05, | |
| "loss": 0.9189, | |
| "num_input_tokens_seen": 65606816, | |
| "step": 1365, | |
| "train_runtime": 9533.3266, | |
| "train_tokens_per_second": 6881.839 | |
| }, | |
| { | |
| "epoch": 0.8781742205078753, | |
| "grad_norm": 0.24562184512615204, | |
| "learning_rate": 2.462927143778208e-05, | |
| "loss": 0.9158, | |
| "num_input_tokens_seen": 65670256, | |
| "step": 1366, | |
| "train_runtime": 9542.221, | |
| "train_tokens_per_second": 6882.072 | |
| }, | |
| { | |
| "epoch": 0.8788171006107361, | |
| "grad_norm": 0.23116691410541534, | |
| "learning_rate": 2.4500322372662797e-05, | |
| "loss": 0.899, | |
| "num_input_tokens_seen": 65724288, | |
| "step": 1367, | |
| "train_runtime": 9549.829, | |
| "train_tokens_per_second": 6882.248 | |
| }, | |
| { | |
| "epoch": 0.8794599807135969, | |
| "grad_norm": 0.2198581099510193, | |
| "learning_rate": 2.4371373307543522e-05, | |
| "loss": 1.0382, | |
| "num_input_tokens_seen": 65770288, | |
| "step": 1368, | |
| "train_runtime": 9556.201, | |
| "train_tokens_per_second": 6882.472 | |
| }, | |
| { | |
| "epoch": 0.8801028608164577, | |
| "grad_norm": 0.19544394314289093, | |
| "learning_rate": 2.4242424242424244e-05, | |
| "loss": 0.8376, | |
| "num_input_tokens_seen": 65807296, | |
| "step": 1369, | |
| "train_runtime": 9561.4451, | |
| "train_tokens_per_second": 6882.568 | |
| }, | |
| { | |
| "epoch": 0.8807457409193186, | |
| "grad_norm": 0.17657072842121124, | |
| "learning_rate": 2.4113475177304965e-05, | |
| "loss": 1.138, | |
| "num_input_tokens_seen": 65864880, | |
| "step": 1370, | |
| "train_runtime": 9569.4964, | |
| "train_tokens_per_second": 6882.795 | |
| }, | |
| { | |
| "epoch": 0.8813886210221794, | |
| "grad_norm": 0.23098967969417572, | |
| "learning_rate": 2.3984526112185687e-05, | |
| "loss": 0.9083, | |
| "num_input_tokens_seen": 65929424, | |
| "step": 1371, | |
| "train_runtime": 9578.5577, | |
| "train_tokens_per_second": 6883.022 | |
| }, | |
| { | |
| "epoch": 0.8820315011250401, | |
| "grad_norm": 0.2079899162054062, | |
| "learning_rate": 2.3855577047066412e-05, | |
| "loss": 0.893, | |
| "num_input_tokens_seen": 65964688, | |
| "step": 1372, | |
| "train_runtime": 9583.6065, | |
| "train_tokens_per_second": 6883.076 | |
| }, | |
| { | |
| "epoch": 0.882674381227901, | |
| "grad_norm": 0.22222909331321716, | |
| "learning_rate": 2.3726627981947133e-05, | |
| "loss": 0.9877, | |
| "num_input_tokens_seen": 66011776, | |
| "step": 1373, | |
| "train_runtime": 9590.2359, | |
| "train_tokens_per_second": 6883.228 | |
| }, | |
| { | |
| "epoch": 0.8833172613307618, | |
| "grad_norm": 0.24297206103801727, | |
| "learning_rate": 2.3597678916827855e-05, | |
| "loss": 0.9199, | |
| "num_input_tokens_seen": 66052704, | |
| "step": 1374, | |
| "train_runtime": 9596.0189, | |
| "train_tokens_per_second": 6883.344 | |
| }, | |
| { | |
| "epoch": 0.8839601414336227, | |
| "grad_norm": 0.23367612063884735, | |
| "learning_rate": 2.3468729851708576e-05, | |
| "loss": 0.9687, | |
| "num_input_tokens_seen": 66112288, | |
| "step": 1375, | |
| "train_runtime": 9604.3258, | |
| "train_tokens_per_second": 6883.595 | |
| }, | |
| { | |
| "epoch": 0.8846030215364834, | |
| "grad_norm": 0.2388744354248047, | |
| "learning_rate": 2.3339780786589298e-05, | |
| "loss": 0.9275, | |
| "num_input_tokens_seen": 66164032, | |
| "step": 1376, | |
| "train_runtime": 9611.5218, | |
| "train_tokens_per_second": 6883.825 | |
| }, | |
| { | |
| "epoch": 0.8852459016393442, | |
| "grad_norm": 0.23560196161270142, | |
| "learning_rate": 2.321083172147002e-05, | |
| "loss": 1.0068, | |
| "num_input_tokens_seen": 66213504, | |
| "step": 1377, | |
| "train_runtime": 9618.4361, | |
| "train_tokens_per_second": 6884.02 | |
| }, | |
| { | |
| "epoch": 0.8858887817422051, | |
| "grad_norm": 0.23844046890735626, | |
| "learning_rate": 2.308188265635074e-05, | |
| "loss": 1.0219, | |
| "num_input_tokens_seen": 66253168, | |
| "step": 1378, | |
| "train_runtime": 9624.0025, | |
| "train_tokens_per_second": 6884.159 | |
| }, | |
| { | |
| "epoch": 0.8865316618450659, | |
| "grad_norm": 0.23521339893341064, | |
| "learning_rate": 2.2952933591231466e-05, | |
| "loss": 0.9633, | |
| "num_input_tokens_seen": 66290672, | |
| "step": 1379, | |
| "train_runtime": 9629.2576, | |
| "train_tokens_per_second": 6884.297 | |
| }, | |
| { | |
| "epoch": 0.8871745419479267, | |
| "grad_norm": 0.21503745019435883, | |
| "learning_rate": 2.2823984526112184e-05, | |
| "loss": 0.9616, | |
| "num_input_tokens_seen": 66347552, | |
| "step": 1380, | |
| "train_runtime": 9637.1794, | |
| "train_tokens_per_second": 6884.541 | |
| }, | |
| { | |
| "epoch": 0.8878174220507875, | |
| "grad_norm": 0.20514243841171265, | |
| "learning_rate": 2.269503546099291e-05, | |
| "loss": 0.8724, | |
| "num_input_tokens_seen": 66382528, | |
| "step": 1381, | |
| "train_runtime": 9642.5803, | |
| "train_tokens_per_second": 6884.312 | |
| }, | |
| { | |
| "epoch": 0.8884603021536484, | |
| "grad_norm": 0.22188791632652283, | |
| "learning_rate": 2.256608639587363e-05, | |
| "loss": 0.8934, | |
| "num_input_tokens_seen": 66415904, | |
| "step": 1382, | |
| "train_runtime": 9647.2729, | |
| "train_tokens_per_second": 6884.423 | |
| }, | |
| { | |
| "epoch": 0.8891031822565092, | |
| "grad_norm": 0.2151537835597992, | |
| "learning_rate": 2.2437137330754355e-05, | |
| "loss": 0.9754, | |
| "num_input_tokens_seen": 66460144, | |
| "step": 1383, | |
| "train_runtime": 9653.4033, | |
| "train_tokens_per_second": 6884.633 | |
| }, | |
| { | |
| "epoch": 0.8897460623593699, | |
| "grad_norm": 0.22987443208694458, | |
| "learning_rate": 2.2308188265635073e-05, | |
| "loss": 0.9966, | |
| "num_input_tokens_seen": 66514928, | |
| "step": 1384, | |
| "train_runtime": 9661.0146, | |
| "train_tokens_per_second": 6884.88 | |
| }, | |
| { | |
| "epoch": 0.8903889424622308, | |
| "grad_norm": 0.2253212034702301, | |
| "learning_rate": 2.2179239200515798e-05, | |
| "loss": 0.9591, | |
| "num_input_tokens_seen": 66549040, | |
| "step": 1385, | |
| "train_runtime": 9665.8434, | |
| "train_tokens_per_second": 6884.97 | |
| }, | |
| { | |
| "epoch": 0.8910318225650916, | |
| "grad_norm": 0.21320044994354248, | |
| "learning_rate": 2.205029013539652e-05, | |
| "loss": 0.9533, | |
| "num_input_tokens_seen": 66583696, | |
| "step": 1386, | |
| "train_runtime": 9670.7834, | |
| "train_tokens_per_second": 6885.036 | |
| }, | |
| { | |
| "epoch": 0.8916747026679525, | |
| "grad_norm": 0.23471881449222565, | |
| "learning_rate": 2.192134107027724e-05, | |
| "loss": 0.9836, | |
| "num_input_tokens_seen": 66653536, | |
| "step": 1387, | |
| "train_runtime": 9680.6401, | |
| "train_tokens_per_second": 6885.241 | |
| }, | |
| { | |
| "epoch": 0.8923175827708132, | |
| "grad_norm": 0.2249496728181839, | |
| "learning_rate": 2.1792392005157963e-05, | |
| "loss": 0.87, | |
| "num_input_tokens_seen": 66723344, | |
| "step": 1388, | |
| "train_runtime": 9690.4412, | |
| "train_tokens_per_second": 6885.48 | |
| }, | |
| { | |
| "epoch": 0.892960462873674, | |
| "grad_norm": 0.2176201492547989, | |
| "learning_rate": 2.1663442940038688e-05, | |
| "loss": 0.8927, | |
| "num_input_tokens_seen": 66757584, | |
| "step": 1389, | |
| "train_runtime": 9695.3021, | |
| "train_tokens_per_second": 6885.56 | |
| }, | |
| { | |
| "epoch": 0.8936033429765349, | |
| "grad_norm": 0.23144999146461487, | |
| "learning_rate": 2.153449387491941e-05, | |
| "loss": 0.9819, | |
| "num_input_tokens_seen": 66797680, | |
| "step": 1390, | |
| "train_runtime": 9701.0265, | |
| "train_tokens_per_second": 6885.63 | |
| }, | |
| { | |
| "epoch": 0.8942462230793957, | |
| "grad_norm": 0.22405368089675903, | |
| "learning_rate": 2.140554480980013e-05, | |
| "loss": 0.9472, | |
| "num_input_tokens_seen": 66856720, | |
| "step": 1391, | |
| "train_runtime": 9709.2408, | |
| "train_tokens_per_second": 6885.885 | |
| }, | |
| { | |
| "epoch": 0.8948891031822566, | |
| "grad_norm": 0.2517498731613159, | |
| "learning_rate": 2.1276595744680852e-05, | |
| "loss": 0.94, | |
| "num_input_tokens_seen": 66897904, | |
| "step": 1392, | |
| "train_runtime": 9715.0173, | |
| "train_tokens_per_second": 6886.03 | |
| }, | |
| { | |
| "epoch": 0.8955319832851173, | |
| "grad_norm": 0.22383905947208405, | |
| "learning_rate": 2.1147646679561574e-05, | |
| "loss": 0.9274, | |
| "num_input_tokens_seen": 66959696, | |
| "step": 1393, | |
| "train_runtime": 9723.6455, | |
| "train_tokens_per_second": 6886.275 | |
| }, | |
| { | |
| "epoch": 0.8961748633879781, | |
| "grad_norm": 0.21671845018863678, | |
| "learning_rate": 2.1018697614442295e-05, | |
| "loss": 1.0021, | |
| "num_input_tokens_seen": 67030720, | |
| "step": 1394, | |
| "train_runtime": 9733.6024, | |
| "train_tokens_per_second": 6886.527 | |
| }, | |
| { | |
| "epoch": 0.896817743490839, | |
| "grad_norm": 0.22518201172351837, | |
| "learning_rate": 2.0889748549323017e-05, | |
| "loss": 1.0131, | |
| "num_input_tokens_seen": 67063200, | |
| "step": 1395, | |
| "train_runtime": 9738.2374, | |
| "train_tokens_per_second": 6886.585 | |
| }, | |
| { | |
| "epoch": 0.8974606235936998, | |
| "grad_norm": 0.22435115277767181, | |
| "learning_rate": 2.076079948420374e-05, | |
| "loss": 0.9225, | |
| "num_input_tokens_seen": 67100304, | |
| "step": 1396, | |
| "train_runtime": 9743.4768, | |
| "train_tokens_per_second": 6886.69 | |
| }, | |
| { | |
| "epoch": 0.8981035036965606, | |
| "grad_norm": 0.21497158706188202, | |
| "learning_rate": 2.063185041908446e-05, | |
| "loss": 0.9231, | |
| "num_input_tokens_seen": 67137808, | |
| "step": 1397, | |
| "train_runtime": 9748.7727, | |
| "train_tokens_per_second": 6886.796 | |
| }, | |
| { | |
| "epoch": 0.8987463837994214, | |
| "grad_norm": 0.23121468722820282, | |
| "learning_rate": 2.0502901353965185e-05, | |
| "loss": 1.0326, | |
| "num_input_tokens_seen": 67179600, | |
| "step": 1398, | |
| "train_runtime": 9754.6238, | |
| "train_tokens_per_second": 6886.949 | |
| }, | |
| { | |
| "epoch": 0.8993892639022822, | |
| "grad_norm": 0.22834500670433044, | |
| "learning_rate": 2.0373952288845906e-05, | |
| "loss": 0.925, | |
| "num_input_tokens_seen": 67238208, | |
| "step": 1399, | |
| "train_runtime": 9762.8304, | |
| "train_tokens_per_second": 6887.163 | |
| }, | |
| { | |
| "epoch": 0.9000321440051431, | |
| "grad_norm": 0.21778346598148346, | |
| "learning_rate": 2.024500322372663e-05, | |
| "loss": 0.9272, | |
| "num_input_tokens_seen": 67284880, | |
| "step": 1400, | |
| "train_runtime": 9769.3547, | |
| "train_tokens_per_second": 6887.341 | |
| }, | |
| { | |
| "epoch": 0.9006750241080038, | |
| "grad_norm": 0.22009389102458954, | |
| "learning_rate": 2.011605415860735e-05, | |
| "loss": 0.925, | |
| "num_input_tokens_seen": 67327776, | |
| "step": 1401, | |
| "train_runtime": 9775.3488, | |
| "train_tokens_per_second": 6887.506 | |
| }, | |
| { | |
| "epoch": 0.9013179042108647, | |
| "grad_norm": 0.22195357084274292, | |
| "learning_rate": 1.9987105093488074e-05, | |
| "loss": 0.856, | |
| "num_input_tokens_seen": 67371792, | |
| "step": 1402, | |
| "train_runtime": 9781.5289, | |
| "train_tokens_per_second": 6887.655 | |
| }, | |
| { | |
| "epoch": 0.9019607843137255, | |
| "grad_norm": 0.22993923723697662, | |
| "learning_rate": 1.9858156028368796e-05, | |
| "loss": 0.9366, | |
| "num_input_tokens_seen": 67412240, | |
| "step": 1403, | |
| "train_runtime": 9787.2214, | |
| "train_tokens_per_second": 6887.781 | |
| }, | |
| { | |
| "epoch": 0.9026036644165863, | |
| "grad_norm": 0.22455386817455292, | |
| "learning_rate": 1.9729206963249517e-05, | |
| "loss": 1.0493, | |
| "num_input_tokens_seen": 67454384, | |
| "step": 1404, | |
| "train_runtime": 9793.153, | |
| "train_tokens_per_second": 6887.913 | |
| }, | |
| { | |
| "epoch": 0.9026036644165863, | |
| "eval_loss": 0.9950572848320007, | |
| "eval_runtime": 40.0596, | |
| "eval_samples_per_second": 24.813, | |
| "eval_steps_per_second": 1.573, | |
| "num_input_tokens_seen": 67454384, | |
| "step": 1404 | |
| }, | |
| { | |
| "epoch": 0.9032465445194471, | |
| "grad_norm": 0.22418317198753357, | |
| "learning_rate": 1.960025789813024e-05, | |
| "loss": 0.9479, | |
| "num_input_tokens_seen": 67489760, | |
| "step": 1405, | |
| "train_runtime": 9838.2156, | |
| "train_tokens_per_second": 6859.959 | |
| }, | |
| { | |
| "epoch": 0.9038894246223079, | |
| "grad_norm": 0.2270124852657318, | |
| "learning_rate": 1.9471308833010964e-05, | |
| "loss": 0.9602, | |
| "num_input_tokens_seen": 67524768, | |
| "step": 1406, | |
| "train_runtime": 9843.1519, | |
| "train_tokens_per_second": 6860.076 | |
| }, | |
| { | |
| "epoch": 0.9045323047251688, | |
| "grad_norm": 0.22935500741004944, | |
| "learning_rate": 1.934235976789168e-05, | |
| "loss": 0.8195, | |
| "num_input_tokens_seen": 67566512, | |
| "step": 1407, | |
| "train_runtime": 9849.0337, | |
| "train_tokens_per_second": 6860.217 | |
| }, | |
| { | |
| "epoch": 0.9051751848280296, | |
| "grad_norm": 0.21343062818050385, | |
| "learning_rate": 1.9213410702772407e-05, | |
| "loss": 0.9033, | |
| "num_input_tokens_seen": 67605264, | |
| "step": 1408, | |
| "train_runtime": 9854.4877, | |
| "train_tokens_per_second": 6860.353 | |
| }, | |
| { | |
| "epoch": 0.9058180649308903, | |
| "grad_norm": 0.21292684972286224, | |
| "learning_rate": 1.9084461637653128e-05, | |
| "loss": 0.852, | |
| "num_input_tokens_seen": 67641856, | |
| "step": 1409, | |
| "train_runtime": 9859.7137, | |
| "train_tokens_per_second": 6860.428 | |
| }, | |
| { | |
| "epoch": 0.9064609450337512, | |
| "grad_norm": 0.23036617040634155, | |
| "learning_rate": 1.895551257253385e-05, | |
| "loss": 0.964, | |
| "num_input_tokens_seen": 67693248, | |
| "step": 1410, | |
| "train_runtime": 9866.908, | |
| "train_tokens_per_second": 6860.634 | |
| }, | |
| { | |
| "epoch": 0.907103825136612, | |
| "grad_norm": 0.21956272423267365, | |
| "learning_rate": 1.882656350741457e-05, | |
| "loss": 0.9122, | |
| "num_input_tokens_seen": 67732784, | |
| "step": 1411, | |
| "train_runtime": 9873.0284, | |
| "train_tokens_per_second": 6860.386 | |
| }, | |
| { | |
| "epoch": 0.9077467052394729, | |
| "grad_norm": 0.23881959915161133, | |
| "learning_rate": 1.8697614442295293e-05, | |
| "loss": 0.9352, | |
| "num_input_tokens_seen": 67764784, | |
| "step": 1412, | |
| "train_runtime": 9877.5822, | |
| "train_tokens_per_second": 6860.463 | |
| }, | |
| { | |
| "epoch": 0.9083895853423336, | |
| "grad_norm": 0.2238263487815857, | |
| "learning_rate": 1.8568665377176018e-05, | |
| "loss": 0.9374, | |
| "num_input_tokens_seen": 67802224, | |
| "step": 1413, | |
| "train_runtime": 9882.8779, | |
| "train_tokens_per_second": 6860.575 | |
| }, | |
| { | |
| "epoch": 0.9090324654451944, | |
| "grad_norm": 0.21705101430416107, | |
| "learning_rate": 1.8439716312056736e-05, | |
| "loss": 0.9895, | |
| "num_input_tokens_seen": 67836496, | |
| "step": 1414, | |
| "train_runtime": 9887.76, | |
| "train_tokens_per_second": 6860.654 | |
| }, | |
| { | |
| "epoch": 0.9096753455480553, | |
| "grad_norm": 0.22904640436172485, | |
| "learning_rate": 1.831076724693746e-05, | |
| "loss": 0.9624, | |
| "num_input_tokens_seen": 67885632, | |
| "step": 1415, | |
| "train_runtime": 9894.6359, | |
| "train_tokens_per_second": 6860.852 | |
| }, | |
| { | |
| "epoch": 0.9103182256509161, | |
| "grad_norm": 0.24583081901073456, | |
| "learning_rate": 1.8181818181818182e-05, | |
| "loss": 0.9797, | |
| "num_input_tokens_seen": 67927120, | |
| "step": 1416, | |
| "train_runtime": 9900.4602, | |
| "train_tokens_per_second": 6861.006 | |
| }, | |
| { | |
| "epoch": 0.9109611057537769, | |
| "grad_norm": 0.2447551190853119, | |
| "learning_rate": 1.8052869116698907e-05, | |
| "loss": 0.942, | |
| "num_input_tokens_seen": 67979584, | |
| "step": 1417, | |
| "train_runtime": 9907.8027, | |
| "train_tokens_per_second": 6861.217 | |
| }, | |
| { | |
| "epoch": 0.9116039858566377, | |
| "grad_norm": 0.2340712547302246, | |
| "learning_rate": 1.7923920051579625e-05, | |
| "loss": 0.9678, | |
| "num_input_tokens_seen": 68036032, | |
| "step": 1418, | |
| "train_runtime": 9915.6772, | |
| "train_tokens_per_second": 6861.461 | |
| }, | |
| { | |
| "epoch": 0.9122468659594986, | |
| "grad_norm": 0.22300267219543457, | |
| "learning_rate": 1.779497098646035e-05, | |
| "loss": 0.9238, | |
| "num_input_tokens_seen": 68083520, | |
| "step": 1419, | |
| "train_runtime": 9922.2805, | |
| "train_tokens_per_second": 6861.681 | |
| }, | |
| { | |
| "epoch": 0.9128897460623594, | |
| "grad_norm": 0.24390143156051636, | |
| "learning_rate": 1.766602192134107e-05, | |
| "loss": 1.028, | |
| "num_input_tokens_seen": 68124336, | |
| "step": 1420, | |
| "train_runtime": 9927.9689, | |
| "train_tokens_per_second": 6861.86 | |
| }, | |
| { | |
| "epoch": 0.9135326261652202, | |
| "grad_norm": 0.21573801338672638, | |
| "learning_rate": 1.7537072856221793e-05, | |
| "loss": 0.9566, | |
| "num_input_tokens_seen": 68187888, | |
| "step": 1421, | |
| "train_runtime": 9936.769, | |
| "train_tokens_per_second": 6862.179 | |
| }, | |
| { | |
| "epoch": 0.914175506268081, | |
| "grad_norm": 0.2340092808008194, | |
| "learning_rate": 1.7408123791102515e-05, | |
| "loss": 1.0308, | |
| "num_input_tokens_seen": 68220832, | |
| "step": 1422, | |
| "train_runtime": 9941.4125, | |
| "train_tokens_per_second": 6862.288 | |
| }, | |
| { | |
| "epoch": 0.9148183863709418, | |
| "grad_norm": 0.22807711362838745, | |
| "learning_rate": 1.727917472598324e-05, | |
| "loss": 0.9513, | |
| "num_input_tokens_seen": 68255328, | |
| "step": 1423, | |
| "train_runtime": 9946.2544, | |
| "train_tokens_per_second": 6862.415 | |
| }, | |
| { | |
| "epoch": 0.9154612664738027, | |
| "grad_norm": 0.2519054114818573, | |
| "learning_rate": 1.7150225660863958e-05, | |
| "loss": 0.9472, | |
| "num_input_tokens_seen": 68301776, | |
| "step": 1424, | |
| "train_runtime": 9952.7263, | |
| "train_tokens_per_second": 6862.62 | |
| }, | |
| { | |
| "epoch": 0.9161041465766635, | |
| "grad_norm": 0.22526559233665466, | |
| "learning_rate": 1.7021276595744682e-05, | |
| "loss": 1.0598, | |
| "num_input_tokens_seen": 68357584, | |
| "step": 1425, | |
| "train_runtime": 9960.4084, | |
| "train_tokens_per_second": 6862.93 | |
| }, | |
| { | |
| "epoch": 0.9167470266795242, | |
| "grad_norm": 0.24125026166439056, | |
| "learning_rate": 1.6892327530625404e-05, | |
| "loss": 0.9811, | |
| "num_input_tokens_seen": 68409632, | |
| "step": 1426, | |
| "train_runtime": 9967.6863, | |
| "train_tokens_per_second": 6863.141 | |
| }, | |
| { | |
| "epoch": 0.9173899067823851, | |
| "grad_norm": 0.22700725495815277, | |
| "learning_rate": 1.6763378465506125e-05, | |
| "loss": 0.9205, | |
| "num_input_tokens_seen": 68451088, | |
| "step": 1427, | |
| "train_runtime": 9973.4835, | |
| "train_tokens_per_second": 6863.308 | |
| }, | |
| { | |
| "epoch": 0.9180327868852459, | |
| "grad_norm": 0.21550695598125458, | |
| "learning_rate": 1.6634429400386847e-05, | |
| "loss": 0.8762, | |
| "num_input_tokens_seen": 68486848, | |
| "step": 1428, | |
| "train_runtime": 9978.5488, | |
| "train_tokens_per_second": 6863.408 | |
| }, | |
| { | |
| "epoch": 0.9186756669881068, | |
| "grad_norm": 0.2375817447900772, | |
| "learning_rate": 1.6505480335267572e-05, | |
| "loss": 0.9705, | |
| "num_input_tokens_seen": 68525520, | |
| "step": 1429, | |
| "train_runtime": 9983.9807, | |
| "train_tokens_per_second": 6863.547 | |
| }, | |
| { | |
| "epoch": 0.9193185470909675, | |
| "grad_norm": 0.22618383169174194, | |
| "learning_rate": 1.6376531270148293e-05, | |
| "loss": 0.9702, | |
| "num_input_tokens_seen": 68580896, | |
| "step": 1430, | |
| "train_runtime": 9991.6454, | |
| "train_tokens_per_second": 6863.824 | |
| }, | |
| { | |
| "epoch": 0.9199614271938283, | |
| "grad_norm": 0.2312181442975998, | |
| "learning_rate": 1.6247582205029015e-05, | |
| "loss": 1.0483, | |
| "num_input_tokens_seen": 68618928, | |
| "step": 1431, | |
| "train_runtime": 9996.9384, | |
| "train_tokens_per_second": 6863.994 | |
| }, | |
| { | |
| "epoch": 0.9206043072966892, | |
| "grad_norm": 0.21677947044372559, | |
| "learning_rate": 1.6118633139909736e-05, | |
| "loss": 1.0033, | |
| "num_input_tokens_seen": 68659440, | |
| "step": 1432, | |
| "train_runtime": 10002.5622, | |
| "train_tokens_per_second": 6864.185 | |
| }, | |
| { | |
| "epoch": 0.92124718739955, | |
| "grad_norm": 0.24624547362327576, | |
| "learning_rate": 1.5989684074790458e-05, | |
| "loss": 0.9439, | |
| "num_input_tokens_seen": 68698576, | |
| "step": 1433, | |
| "train_runtime": 10008.0086, | |
| "train_tokens_per_second": 6864.36 | |
| }, | |
| { | |
| "epoch": 0.9218900675024108, | |
| "grad_norm": 0.22636933624744415, | |
| "learning_rate": 1.586073500967118e-05, | |
| "loss": 0.974, | |
| "num_input_tokens_seen": 68743168, | |
| "step": 1434, | |
| "train_runtime": 10014.2353, | |
| "train_tokens_per_second": 6864.545 | |
| }, | |
| { | |
| "epoch": 0.9225329476052716, | |
| "grad_norm": 0.20989619195461273, | |
| "learning_rate": 1.57317859445519e-05, | |
| "loss": 0.849, | |
| "num_input_tokens_seen": 68799680, | |
| "step": 1435, | |
| "train_runtime": 10022.0254, | |
| "train_tokens_per_second": 6864.848 | |
| }, | |
| { | |
| "epoch": 0.9231758277081324, | |
| "grad_norm": 0.2507398724555969, | |
| "learning_rate": 1.5602836879432626e-05, | |
| "loss": 0.9745, | |
| "num_input_tokens_seen": 68857664, | |
| "step": 1436, | |
| "train_runtime": 10030.1234, | |
| "train_tokens_per_second": 6865.086 | |
| }, | |
| { | |
| "epoch": 0.9238187078109933, | |
| "grad_norm": 0.23638993501663208, | |
| "learning_rate": 1.5473887814313347e-05, | |
| "loss": 0.9524, | |
| "num_input_tokens_seen": 68910064, | |
| "step": 1437, | |
| "train_runtime": 10037.4646, | |
| "train_tokens_per_second": 6865.286 | |
| }, | |
| { | |
| "epoch": 0.924461587913854, | |
| "grad_norm": 0.2204284518957138, | |
| "learning_rate": 1.534493874919407e-05, | |
| "loss": 0.9532, | |
| "num_input_tokens_seen": 68958096, | |
| "step": 1438, | |
| "train_runtime": 10044.1591, | |
| "train_tokens_per_second": 6865.492 | |
| }, | |
| { | |
| "epoch": 0.9251044680167149, | |
| "grad_norm": 0.23989911377429962, | |
| "learning_rate": 1.521598968407479e-05, | |
| "loss": 1.0243, | |
| "num_input_tokens_seen": 69016288, | |
| "step": 1439, | |
| "train_runtime": 10052.3433, | |
| "train_tokens_per_second": 6865.692 | |
| }, | |
| { | |
| "epoch": 0.9257473481195757, | |
| "grad_norm": 0.22689130902290344, | |
| "learning_rate": 1.5087040618955514e-05, | |
| "loss": 1.0335, | |
| "num_input_tokens_seen": 69060416, | |
| "step": 1440, | |
| "train_runtime": 10058.4885, | |
| "train_tokens_per_second": 6865.884 | |
| }, | |
| { | |
| "epoch": 0.9263902282224366, | |
| "grad_norm": 0.20910261571407318, | |
| "learning_rate": 1.4958091553836235e-05, | |
| "loss": 0.8844, | |
| "num_input_tokens_seen": 69107248, | |
| "step": 1441, | |
| "train_runtime": 10065.6688, | |
| "train_tokens_per_second": 6865.639 | |
| }, | |
| { | |
| "epoch": 0.9270331083252973, | |
| "grad_norm": 0.22202737629413605, | |
| "learning_rate": 1.4829142488716957e-05, | |
| "loss": 0.9544, | |
| "num_input_tokens_seen": 69150096, | |
| "step": 1442, | |
| "train_runtime": 10071.7232, | |
| "train_tokens_per_second": 6865.766 | |
| }, | |
| { | |
| "epoch": 0.9276759884281581, | |
| "grad_norm": 0.22584928572177887, | |
| "learning_rate": 1.470019342359768e-05, | |
| "loss": 0.8774, | |
| "num_input_tokens_seen": 69198752, | |
| "step": 1443, | |
| "train_runtime": 10078.513, | |
| "train_tokens_per_second": 6865.968 | |
| }, | |
| { | |
| "epoch": 0.928318868531019, | |
| "grad_norm": 0.23412150144577026, | |
| "learning_rate": 1.4571244358478403e-05, | |
| "loss": 1.0116, | |
| "num_input_tokens_seen": 69244912, | |
| "step": 1444, | |
| "train_runtime": 10084.9759, | |
| "train_tokens_per_second": 6866.146 | |
| }, | |
| { | |
| "epoch": 0.9289617486338798, | |
| "grad_norm": 0.22440744936466217, | |
| "learning_rate": 1.4442295293359123e-05, | |
| "loss": 0.9491, | |
| "num_input_tokens_seen": 69280640, | |
| "step": 1445, | |
| "train_runtime": 10089.9793, | |
| "train_tokens_per_second": 6866.282 | |
| }, | |
| { | |
| "epoch": 0.9296046287367405, | |
| "grad_norm": 0.23212245106697083, | |
| "learning_rate": 1.4313346228239846e-05, | |
| "loss": 0.8358, | |
| "num_input_tokens_seen": 69321088, | |
| "step": 1446, | |
| "train_runtime": 10095.6451, | |
| "train_tokens_per_second": 6866.435 | |
| }, | |
| { | |
| "epoch": 0.9302475088396014, | |
| "grad_norm": 0.2366316169500351, | |
| "learning_rate": 1.418439716312057e-05, | |
| "loss": 0.9141, | |
| "num_input_tokens_seen": 69359888, | |
| "step": 1447, | |
| "train_runtime": 10101.1143, | |
| "train_tokens_per_second": 6866.558 | |
| }, | |
| { | |
| "epoch": 0.9308903889424622, | |
| "grad_norm": 0.23429423570632935, | |
| "learning_rate": 1.4055448098001289e-05, | |
| "loss": 1.0872, | |
| "num_input_tokens_seen": 69410992, | |
| "step": 1448, | |
| "train_runtime": 10108.2195, | |
| "train_tokens_per_second": 6866.787 | |
| }, | |
| { | |
| "epoch": 0.9315332690453231, | |
| "grad_norm": 0.23109328746795654, | |
| "learning_rate": 1.3926499032882012e-05, | |
| "loss": 0.9236, | |
| "num_input_tokens_seen": 69456560, | |
| "step": 1449, | |
| "train_runtime": 10114.5869, | |
| "train_tokens_per_second": 6866.97 | |
| }, | |
| { | |
| "epoch": 0.9321761491481839, | |
| "grad_norm": 0.22933979332447052, | |
| "learning_rate": 1.3797549967762736e-05, | |
| "loss": 0.9109, | |
| "num_input_tokens_seen": 69498112, | |
| "step": 1450, | |
| "train_runtime": 10120.4153, | |
| "train_tokens_per_second": 6867.121 | |
| }, | |
| { | |
| "epoch": 0.9328190292510447, | |
| "grad_norm": 0.22896629571914673, | |
| "learning_rate": 1.3668600902643455e-05, | |
| "loss": 0.9436, | |
| "num_input_tokens_seen": 69552464, | |
| "step": 1451, | |
| "train_runtime": 10128.0301, | |
| "train_tokens_per_second": 6867.324 | |
| }, | |
| { | |
| "epoch": 0.9334619093539055, | |
| "grad_norm": 0.2261325716972351, | |
| "learning_rate": 1.3539651837524179e-05, | |
| "loss": 0.859, | |
| "num_input_tokens_seen": 69604752, | |
| "step": 1452, | |
| "train_runtime": 10135.2972, | |
| "train_tokens_per_second": 6867.559 | |
| }, | |
| { | |
| "epoch": 0.9341047894567663, | |
| "grad_norm": 0.23998339474201202, | |
| "learning_rate": 1.3410702772404902e-05, | |
| "loss": 0.9361, | |
| "num_input_tokens_seen": 69666048, | |
| "step": 1453, | |
| "train_runtime": 10143.7979, | |
| "train_tokens_per_second": 6867.847 | |
| }, | |
| { | |
| "epoch": 0.9347476695596272, | |
| "grad_norm": 0.2145000845193863, | |
| "learning_rate": 1.3281753707285623e-05, | |
| "loss": 0.8499, | |
| "num_input_tokens_seen": 69726352, | |
| "step": 1454, | |
| "train_runtime": 10152.1929, | |
| "train_tokens_per_second": 6868.107 | |
| }, | |
| { | |
| "epoch": 0.9353905496624879, | |
| "grad_norm": 0.2282804548740387, | |
| "learning_rate": 1.3152804642166345e-05, | |
| "loss": 0.9619, | |
| "num_input_tokens_seen": 69777712, | |
| "step": 1455, | |
| "train_runtime": 10159.3382, | |
| "train_tokens_per_second": 6868.332 | |
| }, | |
| { | |
| "epoch": 0.9360334297653488, | |
| "grad_norm": 0.21795395016670227, | |
| "learning_rate": 1.3023855577047068e-05, | |
| "loss": 0.9902, | |
| "num_input_tokens_seen": 69859472, | |
| "step": 1456, | |
| "train_runtime": 10170.8258, | |
| "train_tokens_per_second": 6868.614 | |
| }, | |
| { | |
| "epoch": 0.9366763098682096, | |
| "grad_norm": 0.2481180876493454, | |
| "learning_rate": 1.289490651192779e-05, | |
| "loss": 1.0054, | |
| "num_input_tokens_seen": 69904928, | |
| "step": 1457, | |
| "train_runtime": 10177.1651, | |
| "train_tokens_per_second": 6868.802 | |
| }, | |
| { | |
| "epoch": 0.9373191899710704, | |
| "grad_norm": 0.23332452774047852, | |
| "learning_rate": 1.2765957446808511e-05, | |
| "loss": 0.9111, | |
| "num_input_tokens_seen": 69946176, | |
| "step": 1458, | |
| "train_runtime": 10182.9769, | |
| "train_tokens_per_second": 6868.932 | |
| }, | |
| { | |
| "epoch": 0.9379620700739312, | |
| "grad_norm": 0.23579373955726624, | |
| "learning_rate": 1.2637008381689233e-05, | |
| "loss": 1.0746, | |
| "num_input_tokens_seen": 69985952, | |
| "step": 1459, | |
| "train_runtime": 10188.603, | |
| "train_tokens_per_second": 6869.043 | |
| }, | |
| { | |
| "epoch": 0.938604950176792, | |
| "grad_norm": 0.25695693492889404, | |
| "learning_rate": 1.2508059316569956e-05, | |
| "loss": 0.888, | |
| "num_input_tokens_seen": 70016992, | |
| "step": 1460, | |
| "train_runtime": 10193.0063, | |
| "train_tokens_per_second": 6869.121 | |
| }, | |
| { | |
| "epoch": 0.9392478302796529, | |
| "grad_norm": 0.21970728039741516, | |
| "learning_rate": 1.2379110251450677e-05, | |
| "loss": 1.016, | |
| "num_input_tokens_seen": 70063872, | |
| "step": 1461, | |
| "train_runtime": 10199.6083, | |
| "train_tokens_per_second": 6869.271 | |
| }, | |
| { | |
| "epoch": 0.9398907103825137, | |
| "grad_norm": 0.21850202977657318, | |
| "learning_rate": 1.2250161186331399e-05, | |
| "loss": 0.8753, | |
| "num_input_tokens_seen": 70116928, | |
| "step": 1462, | |
| "train_runtime": 10207.0556, | |
| "train_tokens_per_second": 6869.457 | |
| }, | |
| { | |
| "epoch": 0.9405335904853744, | |
| "grad_norm": 0.2183936983346939, | |
| "learning_rate": 1.2121212121212122e-05, | |
| "loss": 0.8533, | |
| "num_input_tokens_seen": 70168576, | |
| "step": 1463, | |
| "train_runtime": 10214.2898, | |
| "train_tokens_per_second": 6869.648 | |
| }, | |
| { | |
| "epoch": 0.9411764705882353, | |
| "grad_norm": 0.22495919466018677, | |
| "learning_rate": 1.1992263056092843e-05, | |
| "loss": 0.8346, | |
| "num_input_tokens_seen": 70227952, | |
| "step": 1464, | |
| "train_runtime": 10222.7241, | |
| "train_tokens_per_second": 6869.788 | |
| }, | |
| { | |
| "epoch": 0.9418193506910961, | |
| "grad_norm": 0.22515498101711273, | |
| "learning_rate": 1.1863313990973567e-05, | |
| "loss": 1.0316, | |
| "num_input_tokens_seen": 70300208, | |
| "step": 1465, | |
| "train_runtime": 10232.815, | |
| "train_tokens_per_second": 6870.075 | |
| }, | |
| { | |
| "epoch": 0.942462230793957, | |
| "grad_norm": 0.20822781324386597, | |
| "learning_rate": 1.1734364925854288e-05, | |
| "loss": 0.8258, | |
| "num_input_tokens_seen": 70337472, | |
| "step": 1466, | |
| "train_runtime": 10238.1087, | |
| "train_tokens_per_second": 6870.163 | |
| }, | |
| { | |
| "epoch": 0.9431051108968177, | |
| "grad_norm": 0.23032674193382263, | |
| "learning_rate": 1.160541586073501e-05, | |
| "loss": 0.9532, | |
| "num_input_tokens_seen": 70369504, | |
| "step": 1467, | |
| "train_runtime": 10242.6604, | |
| "train_tokens_per_second": 6870.237 | |
| }, | |
| { | |
| "epoch": 0.9437479909996785, | |
| "grad_norm": 0.20609726011753082, | |
| "learning_rate": 1.1476466795615733e-05, | |
| "loss": 0.7868, | |
| "num_input_tokens_seen": 70413344, | |
| "step": 1468, | |
| "train_runtime": 10248.8547, | |
| "train_tokens_per_second": 6870.362 | |
| }, | |
| { | |
| "epoch": 0.9443908711025394, | |
| "grad_norm": 0.23372110724449158, | |
| "learning_rate": 1.1347517730496454e-05, | |
| "loss": 0.8516, | |
| "num_input_tokens_seen": 70469104, | |
| "step": 1469, | |
| "train_runtime": 10256.6888, | |
| "train_tokens_per_second": 6870.551 | |
| }, | |
| { | |
| "epoch": 0.9450337512054002, | |
| "grad_norm": 0.22682523727416992, | |
| "learning_rate": 1.1218568665377178e-05, | |
| "loss": 0.9136, | |
| "num_input_tokens_seen": 70511488, | |
| "step": 1470, | |
| "train_runtime": 10262.6499, | |
| "train_tokens_per_second": 6870.69 | |
| }, | |
| { | |
| "epoch": 0.945676631308261, | |
| "grad_norm": 0.2447620928287506, | |
| "learning_rate": 1.1089619600257899e-05, | |
| "loss": 0.8358, | |
| "num_input_tokens_seen": 70573376, | |
| "step": 1471, | |
| "train_runtime": 10271.8891, | |
| "train_tokens_per_second": 6870.535 | |
| }, | |
| { | |
| "epoch": 0.9463195114111218, | |
| "grad_norm": 0.2190268188714981, | |
| "learning_rate": 1.096067053513862e-05, | |
| "loss": 0.9806, | |
| "num_input_tokens_seen": 70626032, | |
| "step": 1472, | |
| "train_runtime": 10279.2403, | |
| "train_tokens_per_second": 6870.744 | |
| }, | |
| { | |
| "epoch": 0.9469623915139826, | |
| "grad_norm": 0.22610507905483246, | |
| "learning_rate": 1.0831721470019344e-05, | |
| "loss": 1.0947, | |
| "num_input_tokens_seen": 70670400, | |
| "step": 1473, | |
| "train_runtime": 10285.4855, | |
| "train_tokens_per_second": 6870.886 | |
| }, | |
| { | |
| "epoch": 0.9476052716168435, | |
| "grad_norm": 0.24609413743019104, | |
| "learning_rate": 1.0702772404900065e-05, | |
| "loss": 0.9695, | |
| "num_input_tokens_seen": 70721200, | |
| "step": 1474, | |
| "train_runtime": 10292.5271, | |
| "train_tokens_per_second": 6871.121 | |
| }, | |
| { | |
| "epoch": 0.9482481517197042, | |
| "grad_norm": 0.2186412215232849, | |
| "learning_rate": 1.0573823339780787e-05, | |
| "loss": 0.8916, | |
| "num_input_tokens_seen": 70773392, | |
| "step": 1475, | |
| "train_runtime": 10299.743, | |
| "train_tokens_per_second": 6871.375 | |
| }, | |
| { | |
| "epoch": 0.9488910318225651, | |
| "grad_norm": 0.22198593616485596, | |
| "learning_rate": 1.0444874274661508e-05, | |
| "loss": 0.9986, | |
| "num_input_tokens_seen": 70817312, | |
| "step": 1476, | |
| "train_runtime": 10305.8674, | |
| "train_tokens_per_second": 6871.553 | |
| }, | |
| { | |
| "epoch": 0.9495339119254259, | |
| "grad_norm": 0.22311225533485413, | |
| "learning_rate": 1.031592520954223e-05, | |
| "loss": 0.9174, | |
| "num_input_tokens_seen": 70855552, | |
| "step": 1477, | |
| "train_runtime": 10311.2514, | |
| "train_tokens_per_second": 6871.673 | |
| }, | |
| { | |
| "epoch": 0.9501767920282868, | |
| "grad_norm": 0.22305837273597717, | |
| "learning_rate": 1.0186976144422953e-05, | |
| "loss": 1.0409, | |
| "num_input_tokens_seen": 70897120, | |
| "step": 1478, | |
| "train_runtime": 10317.0953, | |
| "train_tokens_per_second": 6871.81 | |
| }, | |
| { | |
| "epoch": 0.9508196721311475, | |
| "grad_norm": 0.21804772317409515, | |
| "learning_rate": 1.0058027079303675e-05, | |
| "loss": 0.9187, | |
| "num_input_tokens_seen": 70947872, | |
| "step": 1479, | |
| "train_runtime": 10324.2218, | |
| "train_tokens_per_second": 6871.983 | |
| }, | |
| { | |
| "epoch": 0.9514625522340083, | |
| "grad_norm": 0.24226270616054535, | |
| "learning_rate": 9.929078014184398e-06, | |
| "loss": 0.9696, | |
| "num_input_tokens_seen": 71005248, | |
| "step": 1480, | |
| "train_runtime": 10332.2825, | |
| "train_tokens_per_second": 6872.174 | |
| }, | |
| { | |
| "epoch": 0.9521054323368692, | |
| "grad_norm": 0.21511489152908325, | |
| "learning_rate": 9.80012894906512e-06, | |
| "loss": 0.9717, | |
| "num_input_tokens_seen": 71047280, | |
| "step": 1481, | |
| "train_runtime": 10338.2265, | |
| "train_tokens_per_second": 6872.289 | |
| }, | |
| { | |
| "epoch": 0.95274831243973, | |
| "grad_norm": 0.23640964925289154, | |
| "learning_rate": 9.67117988394584e-06, | |
| "loss": 0.9809, | |
| "num_input_tokens_seen": 71087584, | |
| "step": 1482, | |
| "train_runtime": 10343.9144, | |
| "train_tokens_per_second": 6872.406 | |
| }, | |
| { | |
| "epoch": 0.9533911925425909, | |
| "grad_norm": 0.21565860509872437, | |
| "learning_rate": 9.542230818826564e-06, | |
| "loss": 0.8432, | |
| "num_input_tokens_seen": 71154064, | |
| "step": 1483, | |
| "train_runtime": 10353.2251, | |
| "train_tokens_per_second": 6872.647 | |
| }, | |
| { | |
| "epoch": 0.9540340726454516, | |
| "grad_norm": 0.21562111377716064, | |
| "learning_rate": 9.413281753707286e-06, | |
| "loss": 0.894, | |
| "num_input_tokens_seen": 71194080, | |
| "step": 1484, | |
| "train_runtime": 10358.8752, | |
| "train_tokens_per_second": 6872.762 | |
| }, | |
| { | |
| "epoch": 0.9546769527483124, | |
| "grad_norm": 0.22925646603107452, | |
| "learning_rate": 9.284332688588009e-06, | |
| "loss": 1.0213, | |
| "num_input_tokens_seen": 71237424, | |
| "step": 1485, | |
| "train_runtime": 10364.9791, | |
| "train_tokens_per_second": 6872.896 | |
| }, | |
| { | |
| "epoch": 0.9553198328511733, | |
| "grad_norm": 0.2211703509092331, | |
| "learning_rate": 9.15538362346873e-06, | |
| "loss": 0.9599, | |
| "num_input_tokens_seen": 71294800, | |
| "step": 1486, | |
| "train_runtime": 10373.0981, | |
| "train_tokens_per_second": 6873.048 | |
| }, | |
| { | |
| "epoch": 0.9559627129540341, | |
| "grad_norm": 0.2549663782119751, | |
| "learning_rate": 9.026434558349453e-06, | |
| "loss": 0.9073, | |
| "num_input_tokens_seen": 71360176, | |
| "step": 1487, | |
| "train_runtime": 10382.2284, | |
| "train_tokens_per_second": 6873.301 | |
| }, | |
| { | |
| "epoch": 0.9566055930568949, | |
| "grad_norm": 0.22406437993049622, | |
| "learning_rate": 8.897485493230175e-06, | |
| "loss": 0.9863, | |
| "num_input_tokens_seen": 71400816, | |
| "step": 1488, | |
| "train_runtime": 10387.957, | |
| "train_tokens_per_second": 6873.422 | |
| }, | |
| { | |
| "epoch": 0.9572484731597557, | |
| "grad_norm": 0.2288341373205185, | |
| "learning_rate": 8.768536428110897e-06, | |
| "loss": 0.9861, | |
| "num_input_tokens_seen": 71438720, | |
| "step": 1489, | |
| "train_runtime": 10393.2868, | |
| "train_tokens_per_second": 6873.545 | |
| }, | |
| { | |
| "epoch": 0.9578913532626165, | |
| "grad_norm": 0.20654594898223877, | |
| "learning_rate": 8.63958736299162e-06, | |
| "loss": 0.7846, | |
| "num_input_tokens_seen": 71475296, | |
| "step": 1490, | |
| "train_runtime": 10398.4555, | |
| "train_tokens_per_second": 6873.645 | |
| }, | |
| { | |
| "epoch": 0.9585342333654774, | |
| "grad_norm": 0.2258782833814621, | |
| "learning_rate": 8.510638297872341e-06, | |
| "loss": 1.0008, | |
| "num_input_tokens_seen": 71518512, | |
| "step": 1491, | |
| "train_runtime": 10404.5551, | |
| "train_tokens_per_second": 6873.769 | |
| }, | |
| { | |
| "epoch": 0.9591771134683381, | |
| "grad_norm": 0.217194065451622, | |
| "learning_rate": 8.381689232753063e-06, | |
| "loss": 0.9591, | |
| "num_input_tokens_seen": 71558352, | |
| "step": 1492, | |
| "train_runtime": 10410.1906, | |
| "train_tokens_per_second": 6873.875 | |
| }, | |
| { | |
| "epoch": 0.959819993571199, | |
| "grad_norm": 0.21820807456970215, | |
| "learning_rate": 8.252740167633786e-06, | |
| "loss": 0.9159, | |
| "num_input_tokens_seen": 71616752, | |
| "step": 1493, | |
| "train_runtime": 10418.4046, | |
| "train_tokens_per_second": 6874.061 | |
| }, | |
| { | |
| "epoch": 0.9604628736740598, | |
| "grad_norm": 0.22350728511810303, | |
| "learning_rate": 8.123791102514507e-06, | |
| "loss": 0.8806, | |
| "num_input_tokens_seen": 71675872, | |
| "step": 1494, | |
| "train_runtime": 10426.7534, | |
| "train_tokens_per_second": 6874.227 | |
| }, | |
| { | |
| "epoch": 0.9611057537769206, | |
| "grad_norm": 0.23393666744232178, | |
| "learning_rate": 7.994842037395229e-06, | |
| "loss": 1.0436, | |
| "num_input_tokens_seen": 71720592, | |
| "step": 1495, | |
| "train_runtime": 10433.0466, | |
| "train_tokens_per_second": 6874.367 | |
| }, | |
| { | |
| "epoch": 0.9617486338797814, | |
| "grad_norm": 0.2220027595758438, | |
| "learning_rate": 7.86589297227595e-06, | |
| "loss": 1.0807, | |
| "num_input_tokens_seen": 71764048, | |
| "step": 1496, | |
| "train_runtime": 10439.1482, | |
| "train_tokens_per_second": 6874.512 | |
| }, | |
| { | |
| "epoch": 0.9623915139826422, | |
| "grad_norm": 0.227558434009552, | |
| "learning_rate": 7.736943907156674e-06, | |
| "loss": 0.9828, | |
| "num_input_tokens_seen": 71808592, | |
| "step": 1497, | |
| "train_runtime": 10445.3874, | |
| "train_tokens_per_second": 6874.67 | |
| }, | |
| { | |
| "epoch": 0.9630343940855031, | |
| "grad_norm": 0.2309248149394989, | |
| "learning_rate": 7.607994842037395e-06, | |
| "loss": 0.9937, | |
| "num_input_tokens_seen": 71858480, | |
| "step": 1498, | |
| "train_runtime": 10452.4313, | |
| "train_tokens_per_second": 6874.81 | |
| }, | |
| { | |
| "epoch": 0.9636772741883639, | |
| "grad_norm": 0.24256859719753265, | |
| "learning_rate": 7.4790457769181176e-06, | |
| "loss": 1.0748, | |
| "num_input_tokens_seen": 71904512, | |
| "step": 1499, | |
| "train_runtime": 10458.8953, | |
| "train_tokens_per_second": 6874.962 | |
| }, | |
| { | |
| "epoch": 0.9643201542912246, | |
| "grad_norm": 0.21975061297416687, | |
| "learning_rate": 7.35009671179884e-06, | |
| "loss": 0.9066, | |
| "num_input_tokens_seen": 71952672, | |
| "step": 1500, | |
| "train_runtime": 10465.6379, | |
| "train_tokens_per_second": 6875.135 | |
| }, | |
| { | |
| "epoch": 0.9649630343940855, | |
| "grad_norm": 0.23950344324111938, | |
| "learning_rate": 7.2211476466795614e-06, | |
| "loss": 1.0634, | |
| "num_input_tokens_seen": 71994464, | |
| "step": 1501, | |
| "train_runtime": 10472.0515, | |
| "train_tokens_per_second": 6874.915 | |
| }, | |
| { | |
| "epoch": 0.9656059144969463, | |
| "grad_norm": 0.2366107702255249, | |
| "learning_rate": 7.092198581560285e-06, | |
| "loss": 1.0483, | |
| "num_input_tokens_seen": 72044336, | |
| "step": 1502, | |
| "train_runtime": 10479.0377, | |
| "train_tokens_per_second": 6875.091 | |
| }, | |
| { | |
| "epoch": 0.9662487945998072, | |
| "grad_norm": 0.20939429104328156, | |
| "learning_rate": 6.963249516441006e-06, | |
| "loss": 0.9134, | |
| "num_input_tokens_seen": 72096384, | |
| "step": 1503, | |
| "train_runtime": 10486.3482, | |
| "train_tokens_per_second": 6875.261 | |
| }, | |
| { | |
| "epoch": 0.9668916747026679, | |
| "grad_norm": 0.24359357357025146, | |
| "learning_rate": 6.834300451321728e-06, | |
| "loss": 1.0708, | |
| "num_input_tokens_seen": 72152000, | |
| "step": 1504, | |
| "train_runtime": 10494.2042, | |
| "train_tokens_per_second": 6875.414 | |
| }, | |
| { | |
| "epoch": 0.9675345548055287, | |
| "grad_norm": 0.22651512920856476, | |
| "learning_rate": 6.705351386202451e-06, | |
| "loss": 0.9473, | |
| "num_input_tokens_seen": 72203584, | |
| "step": 1505, | |
| "train_runtime": 10501.4323, | |
| "train_tokens_per_second": 6875.594 | |
| }, | |
| { | |
| "epoch": 0.9681774349083896, | |
| "grad_norm": 0.2099381536245346, | |
| "learning_rate": 6.576402321083172e-06, | |
| "loss": 0.8985, | |
| "num_input_tokens_seen": 72250368, | |
| "step": 1506, | |
| "train_runtime": 10508.0099, | |
| "train_tokens_per_second": 6875.742 | |
| }, | |
| { | |
| "epoch": 0.9688203150112504, | |
| "grad_norm": 0.21460288763046265, | |
| "learning_rate": 6.447453255963895e-06, | |
| "loss": 0.8075, | |
| "num_input_tokens_seen": 72301424, | |
| "step": 1507, | |
| "train_runtime": 10515.1925, | |
| "train_tokens_per_second": 6875.901 | |
| }, | |
| { | |
| "epoch": 0.9694631951141112, | |
| "grad_norm": 0.22760364413261414, | |
| "learning_rate": 6.318504190844616e-06, | |
| "loss": 1.0461, | |
| "num_input_tokens_seen": 72363488, | |
| "step": 1508, | |
| "train_runtime": 10523.9695, | |
| "train_tokens_per_second": 6876.064 | |
| }, | |
| { | |
| "epoch": 0.970106075216972, | |
| "grad_norm": 0.24012909829616547, | |
| "learning_rate": 6.189555125725339e-06, | |
| "loss": 0.9455, | |
| "num_input_tokens_seen": 72414944, | |
| "step": 1509, | |
| "train_runtime": 10531.2007, | |
| "train_tokens_per_second": 6876.229 | |
| }, | |
| { | |
| "epoch": 0.9707489553198329, | |
| "grad_norm": 0.21027275919914246, | |
| "learning_rate": 6.060606060606061e-06, | |
| "loss": 0.9407, | |
| "num_input_tokens_seen": 72449424, | |
| "step": 1510, | |
| "train_runtime": 10536.112, | |
| "train_tokens_per_second": 6876.296 | |
| }, | |
| { | |
| "epoch": 0.9713918354226937, | |
| "grad_norm": 0.22606825828552246, | |
| "learning_rate": 5.931656995486783e-06, | |
| "loss": 0.8168, | |
| "num_input_tokens_seen": 72508240, | |
| "step": 1511, | |
| "train_runtime": 10544.438, | |
| "train_tokens_per_second": 6876.444 | |
| }, | |
| { | |
| "epoch": 0.9720347155255545, | |
| "grad_norm": 0.2204393595457077, | |
| "learning_rate": 5.802707930367505e-06, | |
| "loss": 0.9256, | |
| "num_input_tokens_seen": 72548032, | |
| "step": 1512, | |
| "train_runtime": 10550.0785, | |
| "train_tokens_per_second": 6876.54 | |
| }, | |
| { | |
| "epoch": 0.9726775956284153, | |
| "grad_norm": 0.23502115905284882, | |
| "learning_rate": 5.673758865248227e-06, | |
| "loss": 0.9147, | |
| "num_input_tokens_seen": 72584416, | |
| "step": 1513, | |
| "train_runtime": 10555.2719, | |
| "train_tokens_per_second": 6876.603 | |
| }, | |
| { | |
| "epoch": 0.9733204757312761, | |
| "grad_norm": 0.21649810671806335, | |
| "learning_rate": 5.5448098001289496e-06, | |
| "loss": 0.849, | |
| "num_input_tokens_seen": 72646048, | |
| "step": 1514, | |
| "train_runtime": 10563.968, | |
| "train_tokens_per_second": 6876.777 | |
| }, | |
| { | |
| "epoch": 0.973963355834137, | |
| "grad_norm": 0.22711792588233948, | |
| "learning_rate": 5.415860735009672e-06, | |
| "loss": 0.9796, | |
| "num_input_tokens_seen": 72690720, | |
| "step": 1515, | |
| "train_runtime": 10570.2401, | |
| "train_tokens_per_second": 6876.922 | |
| }, | |
| { | |
| "epoch": 0.9746062359369978, | |
| "grad_norm": 0.2364644706249237, | |
| "learning_rate": 5.2869116698903934e-06, | |
| "loss": 0.9632, | |
| "num_input_tokens_seen": 72759216, | |
| "step": 1516, | |
| "train_runtime": 10579.834, | |
| "train_tokens_per_second": 6877.16 | |
| }, | |
| { | |
| "epoch": 0.9752491160398585, | |
| "grad_norm": 0.22103801369667053, | |
| "learning_rate": 5.157962604771115e-06, | |
| "loss": 1.0121, | |
| "num_input_tokens_seen": 72798032, | |
| "step": 1517, | |
| "train_runtime": 10585.3058, | |
| "train_tokens_per_second": 6877.272 | |
| }, | |
| { | |
| "epoch": 0.9758919961427194, | |
| "grad_norm": 0.22890672087669373, | |
| "learning_rate": 5.029013539651837e-06, | |
| "loss": 1.0232, | |
| "num_input_tokens_seen": 72837680, | |
| "step": 1518, | |
| "train_runtime": 10590.9089, | |
| "train_tokens_per_second": 6877.378 | |
| }, | |
| { | |
| "epoch": 0.9765348762455802, | |
| "grad_norm": 0.22934086620807648, | |
| "learning_rate": 4.90006447453256e-06, | |
| "loss": 0.9378, | |
| "num_input_tokens_seen": 72874688, | |
| "step": 1519, | |
| "train_runtime": 10596.0774, | |
| "train_tokens_per_second": 6877.516 | |
| }, | |
| { | |
| "epoch": 0.9771777563484411, | |
| "grad_norm": 0.23011226952075958, | |
| "learning_rate": 4.771115409413282e-06, | |
| "loss": 0.9678, | |
| "num_input_tokens_seen": 72936256, | |
| "step": 1520, | |
| "train_runtime": 10604.6406, | |
| "train_tokens_per_second": 6877.768 | |
| }, | |
| { | |
| "epoch": 0.9778206364513018, | |
| "grad_norm": 0.24541643261909485, | |
| "learning_rate": 4.642166344294004e-06, | |
| "loss": 0.8654, | |
| "num_input_tokens_seen": 73006592, | |
| "step": 1521, | |
| "train_runtime": 10614.4594, | |
| "train_tokens_per_second": 6878.032 | |
| }, | |
| { | |
| "epoch": 0.9784635165541626, | |
| "grad_norm": 0.22993628680706024, | |
| "learning_rate": 4.513217279174727e-06, | |
| "loss": 0.8861, | |
| "num_input_tokens_seen": 73054544, | |
| "step": 1522, | |
| "train_runtime": 10621.2121, | |
| "train_tokens_per_second": 6878.174 | |
| }, | |
| { | |
| "epoch": 0.9791063966570235, | |
| "grad_norm": 0.22999486327171326, | |
| "learning_rate": 4.384268214055448e-06, | |
| "loss": 0.9199, | |
| "num_input_tokens_seen": 73105040, | |
| "step": 1523, | |
| "train_runtime": 10628.2805, | |
| "train_tokens_per_second": 6878.351 | |
| }, | |
| { | |
| "epoch": 0.9797492767598843, | |
| "grad_norm": 0.21587304770946503, | |
| "learning_rate": 4.255319148936171e-06, | |
| "loss": 0.9214, | |
| "num_input_tokens_seen": 73143792, | |
| "step": 1524, | |
| "train_runtime": 10633.7179, | |
| "train_tokens_per_second": 6878.478 | |
| }, | |
| { | |
| "epoch": 0.9803921568627451, | |
| "grad_norm": 0.2139047533273697, | |
| "learning_rate": 4.126370083816893e-06, | |
| "loss": 0.934, | |
| "num_input_tokens_seen": 73182944, | |
| "step": 1525, | |
| "train_runtime": 10639.2884, | |
| "train_tokens_per_second": 6878.556 | |
| }, | |
| { | |
| "epoch": 0.9810350369656059, | |
| "grad_norm": 0.22586394846439362, | |
| "learning_rate": 3.9974210186976145e-06, | |
| "loss": 0.8524, | |
| "num_input_tokens_seen": 73212320, | |
| "step": 1526, | |
| "train_runtime": 10643.4687, | |
| "train_tokens_per_second": 6878.615 | |
| }, | |
| { | |
| "epoch": 0.9816779170684667, | |
| "grad_norm": 0.2351096123456955, | |
| "learning_rate": 3.868471953578337e-06, | |
| "loss": 1.0184, | |
| "num_input_tokens_seen": 73250352, | |
| "step": 1527, | |
| "train_runtime": 10648.8122, | |
| "train_tokens_per_second": 6878.735 | |
| }, | |
| { | |
| "epoch": 0.9823207971713276, | |
| "grad_norm": 0.23118098080158234, | |
| "learning_rate": 3.7395228884590588e-06, | |
| "loss": 0.9452, | |
| "num_input_tokens_seen": 73296496, | |
| "step": 1528, | |
| "train_runtime": 10655.2604, | |
| "train_tokens_per_second": 6878.902 | |
| }, | |
| { | |
| "epoch": 0.9829636772741883, | |
| "grad_norm": 0.22116637229919434, | |
| "learning_rate": 3.6105738233397807e-06, | |
| "loss": 0.8709, | |
| "num_input_tokens_seen": 73337840, | |
| "step": 1529, | |
| "train_runtime": 10661.0594, | |
| "train_tokens_per_second": 6879.039 | |
| }, | |
| { | |
| "epoch": 0.9836065573770492, | |
| "grad_norm": 0.21791870892047882, | |
| "learning_rate": 3.481624758220503e-06, | |
| "loss": 0.9545, | |
| "num_input_tokens_seen": 73379968, | |
| "step": 1530, | |
| "train_runtime": 10667.0265, | |
| "train_tokens_per_second": 6879.14 | |
| }, | |
| { | |
| "epoch": 0.98424943747991, | |
| "grad_norm": 0.24784664809703827, | |
| "learning_rate": 3.3526756931012254e-06, | |
| "loss": 0.8842, | |
| "num_input_tokens_seen": 73410880, | |
| "step": 1531, | |
| "train_runtime": 10671.9405, | |
| "train_tokens_per_second": 6878.869 | |
| }, | |
| { | |
| "epoch": 0.9848923175827708, | |
| "grad_norm": 0.24023281037807465, | |
| "learning_rate": 3.2237266279819474e-06, | |
| "loss": 0.969, | |
| "num_input_tokens_seen": 73447616, | |
| "step": 1532, | |
| "train_runtime": 10677.1333, | |
| "train_tokens_per_second": 6878.964 | |
| }, | |
| { | |
| "epoch": 0.9855351976856316, | |
| "grad_norm": 0.22703370451927185, | |
| "learning_rate": 3.0947775628626693e-06, | |
| "loss": 0.8778, | |
| "num_input_tokens_seen": 73491600, | |
| "step": 1533, | |
| "train_runtime": 10683.2916, | |
| "train_tokens_per_second": 6879.116 | |
| }, | |
| { | |
| "epoch": 0.9861780777884924, | |
| "grad_norm": 0.2379906177520752, | |
| "learning_rate": 2.9658284977433917e-06, | |
| "loss": 0.9919, | |
| "num_input_tokens_seen": 73531328, | |
| "step": 1534, | |
| "train_runtime": 10688.8868, | |
| "train_tokens_per_second": 6879.232 | |
| }, | |
| { | |
| "epoch": 0.9868209578913533, | |
| "grad_norm": 0.2339247614145279, | |
| "learning_rate": 2.8368794326241136e-06, | |
| "loss": 1.0197, | |
| "num_input_tokens_seen": 73580624, | |
| "step": 1535, | |
| "train_runtime": 10695.8355, | |
| "train_tokens_per_second": 6879.371 | |
| }, | |
| { | |
| "epoch": 0.9874638379942141, | |
| "grad_norm": 0.2211606651544571, | |
| "learning_rate": 2.707930367504836e-06, | |
| "loss": 1.2567, | |
| "num_input_tokens_seen": 73629520, | |
| "step": 1536, | |
| "train_runtime": 10702.7009, | |
| "train_tokens_per_second": 6879.527 | |
| }, | |
| { | |
| "epoch": 0.9881067180970748, | |
| "grad_norm": 0.23319384455680847, | |
| "learning_rate": 2.5789813023855575e-06, | |
| "loss": 0.9055, | |
| "num_input_tokens_seen": 73671728, | |
| "step": 1537, | |
| "train_runtime": 10708.6418, | |
| "train_tokens_per_second": 6879.652 | |
| }, | |
| { | |
| "epoch": 0.9887495981999357, | |
| "grad_norm": 0.23008319735527039, | |
| "learning_rate": 2.45003223726628e-06, | |
| "loss": 0.9364, | |
| "num_input_tokens_seen": 73723088, | |
| "step": 1538, | |
| "train_runtime": 10715.8183, | |
| "train_tokens_per_second": 6879.837 | |
| }, | |
| { | |
| "epoch": 0.9893924783027965, | |
| "grad_norm": 0.22150327265262604, | |
| "learning_rate": 2.321083172147002e-06, | |
| "loss": 1.0242, | |
| "num_input_tokens_seen": 73777696, | |
| "step": 1539, | |
| "train_runtime": 10723.5459, | |
| "train_tokens_per_second": 6879.972 | |
| }, | |
| { | |
| "epoch": 0.9900353584056574, | |
| "grad_norm": 0.21783533692359924, | |
| "learning_rate": 2.192134107027724e-06, | |
| "loss": 1.0637, | |
| "num_input_tokens_seen": 73831504, | |
| "step": 1540, | |
| "train_runtime": 10731.0934, | |
| "train_tokens_per_second": 6880.147 | |
| }, | |
| { | |
| "epoch": 0.9906782385085182, | |
| "grad_norm": 0.22133003175258636, | |
| "learning_rate": 2.0631850419084465e-06, | |
| "loss": 1.0165, | |
| "num_input_tokens_seen": 73875968, | |
| "step": 1541, | |
| "train_runtime": 10737.3327, | |
| "train_tokens_per_second": 6880.291 | |
| }, | |
| { | |
| "epoch": 0.991321118611379, | |
| "grad_norm": 0.25689297914505005, | |
| "learning_rate": 1.9342359767891684e-06, | |
| "loss": 1.6965, | |
| "num_input_tokens_seen": 73934464, | |
| "step": 1542, | |
| "train_runtime": 10745.5214, | |
| "train_tokens_per_second": 6880.491 | |
| }, | |
| { | |
| "epoch": 0.9919639987142398, | |
| "grad_norm": 0.23742981255054474, | |
| "learning_rate": 1.8052869116698904e-06, | |
| "loss": 0.9891, | |
| "num_input_tokens_seen": 73993488, | |
| "step": 1543, | |
| "train_runtime": 10753.8618, | |
| "train_tokens_per_second": 6880.643 | |
| }, | |
| { | |
| "epoch": 0.9926068788171006, | |
| "grad_norm": 0.25090768933296204, | |
| "learning_rate": 1.6763378465506127e-06, | |
| "loss": 1.0532, | |
| "num_input_tokens_seen": 74044432, | |
| "step": 1544, | |
| "train_runtime": 10761.0324, | |
| "train_tokens_per_second": 6880.793 | |
| }, | |
| { | |
| "epoch": 0.9932497589199615, | |
| "grad_norm": 0.23686262965202332, | |
| "learning_rate": 1.5473887814313347e-06, | |
| "loss": 1.0108, | |
| "num_input_tokens_seen": 74094208, | |
| "step": 1545, | |
| "train_runtime": 10768.0263, | |
| "train_tokens_per_second": 6880.946 | |
| }, | |
| { | |
| "epoch": 0.9938926390228222, | |
| "grad_norm": 0.22799675166606903, | |
| "learning_rate": 1.4184397163120568e-06, | |
| "loss": 1.1222, | |
| "num_input_tokens_seen": 74133760, | |
| "step": 1546, | |
| "train_runtime": 10773.6342, | |
| "train_tokens_per_second": 6881.036 | |
| }, | |
| { | |
| "epoch": 0.994535519125683, | |
| "grad_norm": 0.22108574211597443, | |
| "learning_rate": 1.2894906511927787e-06, | |
| "loss": 0.8359, | |
| "num_input_tokens_seen": 74183040, | |
| "step": 1547, | |
| "train_runtime": 10780.5602, | |
| "train_tokens_per_second": 6881.186 | |
| }, | |
| { | |
| "epoch": 0.9951783992285439, | |
| "grad_norm": 0.24408769607543945, | |
| "learning_rate": 1.160541586073501e-06, | |
| "loss": 0.9974, | |
| "num_input_tokens_seen": 74223408, | |
| "step": 1548, | |
| "train_runtime": 10786.2555, | |
| "train_tokens_per_second": 6881.295 | |
| }, | |
| { | |
| "epoch": 0.9958212793314047, | |
| "grad_norm": 0.25479939579963684, | |
| "learning_rate": 1.0315925209542232e-06, | |
| "loss": 0.9484, | |
| "num_input_tokens_seen": 74261936, | |
| "step": 1549, | |
| "train_runtime": 10791.6911, | |
| "train_tokens_per_second": 6881.399 | |
| }, | |
| { | |
| "epoch": 0.9964641594342655, | |
| "grad_norm": 0.25188323855400085, | |
| "learning_rate": 9.026434558349452e-07, | |
| "loss": 0.9854, | |
| "num_input_tokens_seen": 74305648, | |
| "step": 1550, | |
| "train_runtime": 10797.8713, | |
| "train_tokens_per_second": 6881.509 | |
| }, | |
| { | |
| "epoch": 0.9971070395371263, | |
| "grad_norm": 0.23725450038909912, | |
| "learning_rate": 7.736943907156673e-07, | |
| "loss": 0.9761, | |
| "num_input_tokens_seen": 74354912, | |
| "step": 1551, | |
| "train_runtime": 10804.7577, | |
| "train_tokens_per_second": 6881.682 | |
| }, | |
| { | |
| "epoch": 0.9977499196399872, | |
| "grad_norm": 0.2294706404209137, | |
| "learning_rate": 6.447453255963894e-07, | |
| "loss": 0.903, | |
| "num_input_tokens_seen": 74397344, | |
| "step": 1552, | |
| "train_runtime": 10810.7407, | |
| "train_tokens_per_second": 6881.799 | |
| }, | |
| { | |
| "epoch": 0.998392799742848, | |
| "grad_norm": 0.2335725575685501, | |
| "learning_rate": 5.157962604771116e-07, | |
| "loss": 1.0615, | |
| "num_input_tokens_seen": 74451520, | |
| "step": 1553, | |
| "train_runtime": 10818.4341, | |
| "train_tokens_per_second": 6881.913 | |
| }, | |
| { | |
| "epoch": 0.9990356798457087, | |
| "grad_norm": 0.22153763473033905, | |
| "learning_rate": 3.8684719535783366e-07, | |
| "loss": 0.9205, | |
| "num_input_tokens_seen": 74490944, | |
| "step": 1554, | |
| "train_runtime": 10824.0166, | |
| "train_tokens_per_second": 6882.006 | |
| }, | |
| { | |
| "epoch": 0.9996785599485696, | |
| "grad_norm": 0.22652824223041534, | |
| "learning_rate": 2.578981302385558e-07, | |
| "loss": 0.8884, | |
| "num_input_tokens_seen": 74553376, | |
| "step": 1555, | |
| "train_runtime": 10832.8456, | |
| "train_tokens_per_second": 6882.16 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 0.353055864572525, | |
| "learning_rate": 1.289490651192779e-07, | |
| "loss": 0.9193, | |
| "num_input_tokens_seen": 74567527, | |
| "step": 1556, | |
| "train_runtime": 10834.9152, | |
| "train_tokens_per_second": 6882.151 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 1556, | |
| "num_input_tokens_seen": 74567527, | |
| "num_train_epochs": 1, | |
| "save_steps": 30, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 3.1814933251156285e+18, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |