Instructions to use FormlessAI/Qwen3-32B-Code-Unsloth with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use FormlessAI/Qwen3-32B-Code-Unsloth with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("unsloth/Qwen3-32B") model = PeftModel.from_pretrained(base_model, "FormlessAI/Qwen3-32B-Code-Unsloth") - Transformers
How to use FormlessAI/Qwen3-32B-Code-Unsloth with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="FormlessAI/Qwen3-32B-Code-Unsloth") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("FormlessAI/Qwen3-32B-Code-Unsloth", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use FormlessAI/Qwen3-32B-Code-Unsloth with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "FormlessAI/Qwen3-32B-Code-Unsloth" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen3-32B-Code-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/FormlessAI/Qwen3-32B-Code-Unsloth
- SGLang
How to use FormlessAI/Qwen3-32B-Code-Unsloth with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "FormlessAI/Qwen3-32B-Code-Unsloth" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen3-32B-Code-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "FormlessAI/Qwen3-32B-Code-Unsloth" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen3-32B-Code-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Unsloth Studio
How to use FormlessAI/Qwen3-32B-Code-Unsloth with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for FormlessAI/Qwen3-32B-Code-Unsloth to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for FormlessAI/Qwen3-32B-Code-Unsloth to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for FormlessAI/Qwen3-32B-Code-Unsloth to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="FormlessAI/Qwen3-32B-Code-Unsloth", max_seq_length=2048, ) - Docker Model Runner
How to use FormlessAI/Qwen3-32B-Code-Unsloth with Docker Model Runner:
docker model run hf.co/FormlessAI/Qwen3-32B-Code-Unsloth
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.0, | |
| "eval_steps": 117, | |
| "global_step": 1170, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0017094017094017094, | |
| "grad_norm": 0.4250143766403198, | |
| "learning_rate": 0.0, | |
| "loss": 1.518, | |
| "num_input_tokens_seen": 6088, | |
| "step": 1, | |
| "train_runtime": 6.2191, | |
| "train_tokens_per_second": 978.921 | |
| }, | |
| { | |
| "epoch": 0.003418803418803419, | |
| "grad_norm": 0.42283380031585693, | |
| "learning_rate": 4e-05, | |
| "loss": 1.4678, | |
| "num_input_tokens_seen": 11808, | |
| "step": 2, | |
| "train_runtime": 9.8285, | |
| "train_tokens_per_second": 1201.403 | |
| }, | |
| { | |
| "epoch": 0.005128205128205128, | |
| "grad_norm": 0.40052852034568787, | |
| "learning_rate": 8e-05, | |
| "loss": 1.3678, | |
| "num_input_tokens_seen": 18304, | |
| "step": 3, | |
| "train_runtime": 13.9109, | |
| "train_tokens_per_second": 1315.798 | |
| }, | |
| { | |
| "epoch": 0.006837606837606838, | |
| "grad_norm": 0.6133590340614319, | |
| "learning_rate": 0.00012, | |
| "loss": 1.5195, | |
| "num_input_tokens_seen": 23752, | |
| "step": 4, | |
| "train_runtime": 17.5271, | |
| "train_tokens_per_second": 1355.159 | |
| }, | |
| { | |
| "epoch": 0.008547008547008548, | |
| "grad_norm": 0.5969431400299072, | |
| "learning_rate": 0.00016, | |
| "loss": 0.9666, | |
| "num_input_tokens_seen": 30536, | |
| "step": 5, | |
| "train_runtime": 21.9024, | |
| "train_tokens_per_second": 1394.188 | |
| }, | |
| { | |
| "epoch": 0.010256410256410256, | |
| "grad_norm": 0.780890703201294, | |
| "learning_rate": 0.0002, | |
| "loss": 0.816, | |
| "num_input_tokens_seen": 35152, | |
| "step": 6, | |
| "train_runtime": 25.0032, | |
| "train_tokens_per_second": 1405.901 | |
| }, | |
| { | |
| "epoch": 0.011965811965811967, | |
| "grad_norm": 0.2505766451358795, | |
| "learning_rate": 0.00019982832618025754, | |
| "loss": 0.4829, | |
| "num_input_tokens_seen": 45688, | |
| "step": 7, | |
| "train_runtime": 33.1628, | |
| "train_tokens_per_second": 1377.688 | |
| }, | |
| { | |
| "epoch": 0.013675213675213675, | |
| "grad_norm": 0.22040167450904846, | |
| "learning_rate": 0.00019965665236051504, | |
| "loss": 0.3633, | |
| "num_input_tokens_seen": 55504, | |
| "step": 8, | |
| "train_runtime": 39.2433, | |
| "train_tokens_per_second": 1414.355 | |
| }, | |
| { | |
| "epoch": 0.015384615384615385, | |
| "grad_norm": 0.18094895780086517, | |
| "learning_rate": 0.00019948497854077254, | |
| "loss": 0.4153, | |
| "num_input_tokens_seen": 62664, | |
| "step": 9, | |
| "train_runtime": 43.8042, | |
| "train_tokens_per_second": 1430.547 | |
| }, | |
| { | |
| "epoch": 0.017094017094017096, | |
| "grad_norm": 0.19979114830493927, | |
| "learning_rate": 0.00019931330472103005, | |
| "loss": 0.4687, | |
| "num_input_tokens_seen": 69264, | |
| "step": 10, | |
| "train_runtime": 48.0067, | |
| "train_tokens_per_second": 1442.8 | |
| }, | |
| { | |
| "epoch": 0.018803418803418803, | |
| "grad_norm": 0.13777591288089752, | |
| "learning_rate": 0.00019914163090128758, | |
| "loss": 0.3691, | |
| "num_input_tokens_seen": 76296, | |
| "step": 11, | |
| "train_runtime": 52.4921, | |
| "train_tokens_per_second": 1453.476 | |
| }, | |
| { | |
| "epoch": 0.020512820512820513, | |
| "grad_norm": 0.18852345645427704, | |
| "learning_rate": 0.00019896995708154508, | |
| "loss": 0.4321, | |
| "num_input_tokens_seen": 81088, | |
| "step": 12, | |
| "train_runtime": 55.6144, | |
| "train_tokens_per_second": 1458.039 | |
| }, | |
| { | |
| "epoch": 0.022222222222222223, | |
| "grad_norm": 0.161995068192482, | |
| "learning_rate": 0.00019879828326180258, | |
| "loss": 0.3859, | |
| "num_input_tokens_seen": 86336, | |
| "step": 13, | |
| "train_runtime": 59.0226, | |
| "train_tokens_per_second": 1462.761 | |
| }, | |
| { | |
| "epoch": 0.023931623931623933, | |
| "grad_norm": 0.17920617759227753, | |
| "learning_rate": 0.00019862660944206008, | |
| "loss": 0.4851, | |
| "num_input_tokens_seen": 92520, | |
| "step": 14, | |
| "train_runtime": 63.0338, | |
| "train_tokens_per_second": 1467.785 | |
| }, | |
| { | |
| "epoch": 0.02564102564102564, | |
| "grad_norm": 0.18425999581813812, | |
| "learning_rate": 0.0001984549356223176, | |
| "loss": 0.4319, | |
| "num_input_tokens_seen": 99352, | |
| "step": 15, | |
| "train_runtime": 67.3828, | |
| "train_tokens_per_second": 1474.441 | |
| }, | |
| { | |
| "epoch": 0.02735042735042735, | |
| "grad_norm": 0.1532442718744278, | |
| "learning_rate": 0.00019828326180257511, | |
| "loss": 0.5035, | |
| "num_input_tokens_seen": 105464, | |
| "step": 16, | |
| "train_runtime": 71.3114, | |
| "train_tokens_per_second": 1478.922 | |
| }, | |
| { | |
| "epoch": 0.02905982905982906, | |
| "grad_norm": 0.1138884648680687, | |
| "learning_rate": 0.00019811158798283262, | |
| "loss": 0.3167, | |
| "num_input_tokens_seen": 113576, | |
| "step": 17, | |
| "train_runtime": 76.3581, | |
| "train_tokens_per_second": 1487.412 | |
| }, | |
| { | |
| "epoch": 0.03076923076923077, | |
| "grad_norm": 0.1539948731660843, | |
| "learning_rate": 0.00019793991416309015, | |
| "loss": 0.4765, | |
| "num_input_tokens_seen": 118448, | |
| "step": 18, | |
| "train_runtime": 79.6038, | |
| "train_tokens_per_second": 1487.97 | |
| }, | |
| { | |
| "epoch": 0.03247863247863248, | |
| "grad_norm": 0.11567585170269012, | |
| "learning_rate": 0.00019776824034334765, | |
| "loss": 0.423, | |
| "num_input_tokens_seen": 126120, | |
| "step": 19, | |
| "train_runtime": 84.4957, | |
| "train_tokens_per_second": 1492.621 | |
| }, | |
| { | |
| "epoch": 0.03418803418803419, | |
| "grad_norm": 0.1400221586227417, | |
| "learning_rate": 0.00019759656652360515, | |
| "loss": 0.4563, | |
| "num_input_tokens_seen": 132752, | |
| "step": 20, | |
| "train_runtime": 88.698, | |
| "train_tokens_per_second": 1496.674 | |
| }, | |
| { | |
| "epoch": 0.035897435897435895, | |
| "grad_norm": 0.13252879679203033, | |
| "learning_rate": 0.00019742489270386265, | |
| "loss": 0.3811, | |
| "num_input_tokens_seen": 139568, | |
| "step": 21, | |
| "train_runtime": 92.9809, | |
| "train_tokens_per_second": 1501.039 | |
| }, | |
| { | |
| "epoch": 0.037606837606837605, | |
| "grad_norm": 0.11468011885881424, | |
| "learning_rate": 0.00019725321888412018, | |
| "loss": 0.3752, | |
| "num_input_tokens_seen": 144896, | |
| "step": 22, | |
| "train_runtime": 96.4953, | |
| "train_tokens_per_second": 1501.586 | |
| }, | |
| { | |
| "epoch": 0.039316239316239315, | |
| "grad_norm": 0.1273491531610489, | |
| "learning_rate": 0.00019708154506437769, | |
| "loss": 0.5735, | |
| "num_input_tokens_seen": 149888, | |
| "step": 23, | |
| "train_runtime": 99.8529, | |
| "train_tokens_per_second": 1501.089 | |
| }, | |
| { | |
| "epoch": 0.041025641025641026, | |
| "grad_norm": 0.115237295627594, | |
| "learning_rate": 0.00019690987124463521, | |
| "loss": 0.3692, | |
| "num_input_tokens_seen": 155416, | |
| "step": 24, | |
| "train_runtime": 103.4634, | |
| "train_tokens_per_second": 1502.135 | |
| }, | |
| { | |
| "epoch": 0.042735042735042736, | |
| "grad_norm": 0.11244790256023407, | |
| "learning_rate": 0.00019673819742489272, | |
| "loss": 0.362, | |
| "num_input_tokens_seen": 162096, | |
| "step": 25, | |
| "train_runtime": 107.7741, | |
| "train_tokens_per_second": 1504.035 | |
| }, | |
| { | |
| "epoch": 0.044444444444444446, | |
| "grad_norm": 0.1112871989607811, | |
| "learning_rate": 0.00019656652360515022, | |
| "loss": 0.3231, | |
| "num_input_tokens_seen": 169184, | |
| "step": 26, | |
| "train_runtime": 112.2991, | |
| "train_tokens_per_second": 1506.549 | |
| }, | |
| { | |
| "epoch": 0.046153846153846156, | |
| "grad_norm": 0.10700014233589172, | |
| "learning_rate": 0.00019639484978540775, | |
| "loss": 0.4011, | |
| "num_input_tokens_seen": 176064, | |
| "step": 27, | |
| "train_runtime": 116.6504, | |
| "train_tokens_per_second": 1509.33 | |
| }, | |
| { | |
| "epoch": 0.04786324786324787, | |
| "grad_norm": 0.09945544600486755, | |
| "learning_rate": 0.00019622317596566525, | |
| "loss": 0.4002, | |
| "num_input_tokens_seen": 183784, | |
| "step": 28, | |
| "train_runtime": 121.5197, | |
| "train_tokens_per_second": 1512.38 | |
| }, | |
| { | |
| "epoch": 0.04957264957264957, | |
| "grad_norm": 0.11044273525476456, | |
| "learning_rate": 0.00019605150214592275, | |
| "loss": 0.5269, | |
| "num_input_tokens_seen": 190200, | |
| "step": 29, | |
| "train_runtime": 125.6386, | |
| "train_tokens_per_second": 1513.866 | |
| }, | |
| { | |
| "epoch": 0.05128205128205128, | |
| "grad_norm": 0.09791948646306992, | |
| "learning_rate": 0.00019587982832618026, | |
| "loss": 0.4054, | |
| "num_input_tokens_seen": 197152, | |
| "step": 30, | |
| "train_runtime": 129.9816, | |
| "train_tokens_per_second": 1516.769 | |
| }, | |
| { | |
| "epoch": 0.05299145299145299, | |
| "grad_norm": 0.09980098158121109, | |
| "learning_rate": 0.00019570815450643779, | |
| "loss": 0.5087, | |
| "num_input_tokens_seen": 202824, | |
| "step": 31, | |
| "train_runtime": 137.1025, | |
| "train_tokens_per_second": 1479.361 | |
| }, | |
| { | |
| "epoch": 0.0547008547008547, | |
| "grad_norm": 0.12963376939296722, | |
| "learning_rate": 0.0001955364806866953, | |
| "loss": 0.5493, | |
| "num_input_tokens_seen": 207640, | |
| "step": 32, | |
| "train_runtime": 140.4253, | |
| "train_tokens_per_second": 1478.651 | |
| }, | |
| { | |
| "epoch": 0.05641025641025641, | |
| "grad_norm": 0.0860801488161087, | |
| "learning_rate": 0.0001953648068669528, | |
| "loss": 0.3875, | |
| "num_input_tokens_seen": 214648, | |
| "step": 33, | |
| "train_runtime": 144.9087, | |
| "train_tokens_per_second": 1481.264 | |
| }, | |
| { | |
| "epoch": 0.05811965811965812, | |
| "grad_norm": 0.11512323468923569, | |
| "learning_rate": 0.00019519313304721032, | |
| "loss": 0.5298, | |
| "num_input_tokens_seen": 220632, | |
| "step": 34, | |
| "train_runtime": 148.7677, | |
| "train_tokens_per_second": 1483.064 | |
| }, | |
| { | |
| "epoch": 0.05982905982905983, | |
| "grad_norm": 0.09134849905967712, | |
| "learning_rate": 0.00019502145922746782, | |
| "loss": 0.3995, | |
| "num_input_tokens_seen": 225952, | |
| "step": 35, | |
| "train_runtime": 152.2771, | |
| "train_tokens_per_second": 1483.821 | |
| }, | |
| { | |
| "epoch": 0.06153846153846154, | |
| "grad_norm": 0.08371111750602722, | |
| "learning_rate": 0.00019484978540772535, | |
| "loss": 0.3972, | |
| "num_input_tokens_seen": 231512, | |
| "step": 36, | |
| "train_runtime": 155.8719, | |
| "train_tokens_per_second": 1485.271 | |
| }, | |
| { | |
| "epoch": 0.06324786324786325, | |
| "grad_norm": 0.10832574218511581, | |
| "learning_rate": 0.00019467811158798283, | |
| "loss": 0.6165, | |
| "num_input_tokens_seen": 237608, | |
| "step": 37, | |
| "train_runtime": 159.803, | |
| "train_tokens_per_second": 1486.88 | |
| }, | |
| { | |
| "epoch": 0.06495726495726496, | |
| "grad_norm": 0.08655951172113419, | |
| "learning_rate": 0.00019450643776824036, | |
| "loss": 0.3368, | |
| "num_input_tokens_seen": 245056, | |
| "step": 38, | |
| "train_runtime": 164.5499, | |
| "train_tokens_per_second": 1489.25 | |
| }, | |
| { | |
| "epoch": 0.06666666666666667, | |
| "grad_norm": 0.1013326346874237, | |
| "learning_rate": 0.00019433476394849786, | |
| "loss": 0.4206, | |
| "num_input_tokens_seen": 250840, | |
| "step": 39, | |
| "train_runtime": 168.3364, | |
| "train_tokens_per_second": 1490.111 | |
| }, | |
| { | |
| "epoch": 0.06837606837606838, | |
| "grad_norm": 0.09398815035820007, | |
| "learning_rate": 0.0001941630901287554, | |
| "loss": 0.4084, | |
| "num_input_tokens_seen": 258976, | |
| "step": 40, | |
| "train_runtime": 173.4242, | |
| "train_tokens_per_second": 1493.309 | |
| }, | |
| { | |
| "epoch": 0.07008547008547009, | |
| "grad_norm": 0.09392287582159042, | |
| "learning_rate": 0.00019399141630901286, | |
| "loss": 0.4611, | |
| "num_input_tokens_seen": 266368, | |
| "step": 41, | |
| "train_runtime": 178.0545, | |
| "train_tokens_per_second": 1495.992 | |
| }, | |
| { | |
| "epoch": 0.07179487179487179, | |
| "grad_norm": 0.09110905230045319, | |
| "learning_rate": 0.0001938197424892704, | |
| "loss": 0.3737, | |
| "num_input_tokens_seen": 272608, | |
| "step": 42, | |
| "train_runtime": 182.0937, | |
| "train_tokens_per_second": 1497.075 | |
| }, | |
| { | |
| "epoch": 0.0735042735042735, | |
| "grad_norm": 0.12417464703321457, | |
| "learning_rate": 0.00019364806866952792, | |
| "loss": 0.3449, | |
| "num_input_tokens_seen": 281928, | |
| "step": 43, | |
| "train_runtime": 187.7546, | |
| "train_tokens_per_second": 1501.577 | |
| }, | |
| { | |
| "epoch": 0.07521367521367521, | |
| "grad_norm": 0.08885443955659866, | |
| "learning_rate": 0.00019347639484978542, | |
| "loss": 0.3705, | |
| "num_input_tokens_seen": 287584, | |
| "step": 44, | |
| "train_runtime": 191.4739, | |
| "train_tokens_per_second": 1501.949 | |
| }, | |
| { | |
| "epoch": 0.07692307692307693, | |
| "grad_norm": 0.101967953145504, | |
| "learning_rate": 0.00019330472103004293, | |
| "loss": 0.3949, | |
| "num_input_tokens_seen": 291480, | |
| "step": 45, | |
| "train_runtime": 194.2615, | |
| "train_tokens_per_second": 1500.452 | |
| }, | |
| { | |
| "epoch": 0.07863247863247863, | |
| "grad_norm": 0.09961338341236115, | |
| "learning_rate": 0.00019313304721030043, | |
| "loss": 0.4503, | |
| "num_input_tokens_seen": 297024, | |
| "step": 46, | |
| "train_runtime": 197.902, | |
| "train_tokens_per_second": 1500.864 | |
| }, | |
| { | |
| "epoch": 0.08034188034188035, | |
| "grad_norm": 0.0889606773853302, | |
| "learning_rate": 0.00019296137339055796, | |
| "loss": 0.4031, | |
| "num_input_tokens_seen": 303648, | |
| "step": 47, | |
| "train_runtime": 202.0341, | |
| "train_tokens_per_second": 1502.954 | |
| }, | |
| { | |
| "epoch": 0.08205128205128205, | |
| "grad_norm": 0.09531895071268082, | |
| "learning_rate": 0.00019278969957081546, | |
| "loss": 0.4417, | |
| "num_input_tokens_seen": 309056, | |
| "step": 48, | |
| "train_runtime": 205.5638, | |
| "train_tokens_per_second": 1503.456 | |
| }, | |
| { | |
| "epoch": 0.08376068376068375, | |
| "grad_norm": 0.08631931990385056, | |
| "learning_rate": 0.00019261802575107296, | |
| "loss": 0.4553, | |
| "num_input_tokens_seen": 316400, | |
| "step": 49, | |
| "train_runtime": 210.172, | |
| "train_tokens_per_second": 1505.434 | |
| }, | |
| { | |
| "epoch": 0.08547008547008547, | |
| "grad_norm": 0.08847703784704208, | |
| "learning_rate": 0.00019244635193133047, | |
| "loss": 0.3219, | |
| "num_input_tokens_seen": 323200, | |
| "step": 50, | |
| "train_runtime": 214.5176, | |
| "train_tokens_per_second": 1506.636 | |
| }, | |
| { | |
| "epoch": 0.08717948717948718, | |
| "grad_norm": 0.11054311692714691, | |
| "learning_rate": 0.000192274678111588, | |
| "loss": 0.4683, | |
| "num_input_tokens_seen": 328312, | |
| "step": 51, | |
| "train_runtime": 217.9764, | |
| "train_tokens_per_second": 1506.181 | |
| }, | |
| { | |
| "epoch": 0.08888888888888889, | |
| "grad_norm": 0.09251222759485245, | |
| "learning_rate": 0.00019210300429184553, | |
| "loss": 0.4102, | |
| "num_input_tokens_seen": 333800, | |
| "step": 52, | |
| "train_runtime": 221.5458, | |
| "train_tokens_per_second": 1506.686 | |
| }, | |
| { | |
| "epoch": 0.0905982905982906, | |
| "grad_norm": 0.0774988904595375, | |
| "learning_rate": 0.000191931330472103, | |
| "loss": 0.3548, | |
| "num_input_tokens_seen": 342048, | |
| "step": 53, | |
| "train_runtime": 226.7275, | |
| "train_tokens_per_second": 1508.631 | |
| }, | |
| { | |
| "epoch": 0.09230769230769231, | |
| "grad_norm": 0.12202516943216324, | |
| "learning_rate": 0.00019175965665236053, | |
| "loss": 0.5613, | |
| "num_input_tokens_seen": 347624, | |
| "step": 54, | |
| "train_runtime": 230.3617, | |
| "train_tokens_per_second": 1509.035 | |
| }, | |
| { | |
| "epoch": 0.09401709401709402, | |
| "grad_norm": 0.10605426132678986, | |
| "learning_rate": 0.00019158798283261803, | |
| "loss": 0.4176, | |
| "num_input_tokens_seen": 352416, | |
| "step": 55, | |
| "train_runtime": 233.4925, | |
| "train_tokens_per_second": 1509.325 | |
| }, | |
| { | |
| "epoch": 0.09572649572649573, | |
| "grad_norm": 0.11558322608470917, | |
| "learning_rate": 0.00019141630901287556, | |
| "loss": 0.4917, | |
| "num_input_tokens_seen": 357896, | |
| "step": 56, | |
| "train_runtime": 237.0248, | |
| "train_tokens_per_second": 1509.952 | |
| }, | |
| { | |
| "epoch": 0.09743589743589744, | |
| "grad_norm": 0.09910829365253448, | |
| "learning_rate": 0.00019124463519313304, | |
| "loss": 0.4792, | |
| "num_input_tokens_seen": 364720, | |
| "step": 57, | |
| "train_runtime": 241.3172, | |
| "train_tokens_per_second": 1511.371 | |
| }, | |
| { | |
| "epoch": 0.09914529914529914, | |
| "grad_norm": 0.1221349686384201, | |
| "learning_rate": 0.00019107296137339057, | |
| "loss": 0.4691, | |
| "num_input_tokens_seen": 369984, | |
| "step": 58, | |
| "train_runtime": 244.7282, | |
| "train_tokens_per_second": 1511.816 | |
| }, | |
| { | |
| "epoch": 0.10085470085470086, | |
| "grad_norm": 0.08596599102020264, | |
| "learning_rate": 0.00019090128755364807, | |
| "loss": 0.3253, | |
| "num_input_tokens_seen": 376832, | |
| "step": 59, | |
| "train_runtime": 249.045, | |
| "train_tokens_per_second": 1513.108 | |
| }, | |
| { | |
| "epoch": 0.10256410256410256, | |
| "grad_norm": 0.10098423808813095, | |
| "learning_rate": 0.0001907296137339056, | |
| "loss": 0.3785, | |
| "num_input_tokens_seen": 383320, | |
| "step": 60, | |
| "train_runtime": 253.2014, | |
| "train_tokens_per_second": 1513.894 | |
| }, | |
| { | |
| "epoch": 0.10427350427350428, | |
| "grad_norm": 0.10320388525724411, | |
| "learning_rate": 0.0001905579399141631, | |
| "loss": 0.4157, | |
| "num_input_tokens_seen": 388816, | |
| "step": 61, | |
| "train_runtime": 258.8284, | |
| "train_tokens_per_second": 1502.215 | |
| }, | |
| { | |
| "epoch": 0.10598290598290598, | |
| "grad_norm": 0.1285121887922287, | |
| "learning_rate": 0.0001903862660944206, | |
| "loss": 0.4692, | |
| "num_input_tokens_seen": 394272, | |
| "step": 62, | |
| "train_runtime": 262.3864, | |
| "train_tokens_per_second": 1502.639 | |
| }, | |
| { | |
| "epoch": 0.1076923076923077, | |
| "grad_norm": 0.09725423902273178, | |
| "learning_rate": 0.00019021459227467813, | |
| "loss": 0.3565, | |
| "num_input_tokens_seen": 401608, | |
| "step": 63, | |
| "train_runtime": 267.0812, | |
| "train_tokens_per_second": 1503.692 | |
| }, | |
| { | |
| "epoch": 0.1094017094017094, | |
| "grad_norm": 0.09742418676614761, | |
| "learning_rate": 0.00019004291845493563, | |
| "loss": 0.4284, | |
| "num_input_tokens_seen": 406744, | |
| "step": 64, | |
| "train_runtime": 270.5234, | |
| "train_tokens_per_second": 1503.545 | |
| }, | |
| { | |
| "epoch": 0.1111111111111111, | |
| "grad_norm": 0.10458344221115112, | |
| "learning_rate": 0.00018987124463519314, | |
| "loss": 0.4902, | |
| "num_input_tokens_seen": 412400, | |
| "step": 65, | |
| "train_runtime": 274.2503, | |
| "train_tokens_per_second": 1503.736 | |
| }, | |
| { | |
| "epoch": 0.11282051282051282, | |
| "grad_norm": 0.10790280252695084, | |
| "learning_rate": 0.00018969957081545064, | |
| "loss": 0.3972, | |
| "num_input_tokens_seen": 418328, | |
| "step": 66, | |
| "train_runtime": 278.0127, | |
| "train_tokens_per_second": 1504.708 | |
| }, | |
| { | |
| "epoch": 0.11452991452991453, | |
| "grad_norm": 0.11004123091697693, | |
| "learning_rate": 0.00018952789699570817, | |
| "loss": 0.5001, | |
| "num_input_tokens_seen": 423608, | |
| "step": 67, | |
| "train_runtime": 281.5247, | |
| "train_tokens_per_second": 1504.692 | |
| }, | |
| { | |
| "epoch": 0.11623931623931624, | |
| "grad_norm": 0.09410227090120316, | |
| "learning_rate": 0.00018935622317596567, | |
| "loss": 0.3218, | |
| "num_input_tokens_seen": 430864, | |
| "step": 68, | |
| "train_runtime": 286.005, | |
| "train_tokens_per_second": 1506.491 | |
| }, | |
| { | |
| "epoch": 0.11794871794871795, | |
| "grad_norm": 0.08077986538410187, | |
| "learning_rate": 0.00018918454935622317, | |
| "loss": 0.4251, | |
| "num_input_tokens_seen": 438136, | |
| "step": 69, | |
| "train_runtime": 290.6532, | |
| "train_tokens_per_second": 1507.418 | |
| }, | |
| { | |
| "epoch": 0.11965811965811966, | |
| "grad_norm": 0.09709861129522324, | |
| "learning_rate": 0.0001890128755364807, | |
| "loss": 0.305, | |
| "num_input_tokens_seen": 444304, | |
| "step": 70, | |
| "train_runtime": 294.7262, | |
| "train_tokens_per_second": 1507.514 | |
| }, | |
| { | |
| "epoch": 0.12136752136752137, | |
| "grad_norm": 0.07995827496051788, | |
| "learning_rate": 0.0001888412017167382, | |
| "loss": 0.3157, | |
| "num_input_tokens_seen": 449944, | |
| "step": 71, | |
| "train_runtime": 298.499, | |
| "train_tokens_per_second": 1507.355 | |
| }, | |
| { | |
| "epoch": 0.12307692307692308, | |
| "grad_norm": 0.11763301491737366, | |
| "learning_rate": 0.00018866952789699574, | |
| "loss": 0.614, | |
| "num_input_tokens_seen": 456280, | |
| "step": 72, | |
| "train_runtime": 302.4916, | |
| "train_tokens_per_second": 1508.406 | |
| }, | |
| { | |
| "epoch": 0.12478632478632479, | |
| "grad_norm": 0.13120430707931519, | |
| "learning_rate": 0.0001884978540772532, | |
| "loss": 0.429, | |
| "num_input_tokens_seen": 461752, | |
| "step": 73, | |
| "train_runtime": 306.0652, | |
| "train_tokens_per_second": 1508.672 | |
| }, | |
| { | |
| "epoch": 0.1264957264957265, | |
| "grad_norm": 0.11087733507156372, | |
| "learning_rate": 0.00018832618025751074, | |
| "loss": 0.4589, | |
| "num_input_tokens_seen": 467256, | |
| "step": 74, | |
| "train_runtime": 309.6589, | |
| "train_tokens_per_second": 1508.938 | |
| }, | |
| { | |
| "epoch": 0.1282051282051282, | |
| "grad_norm": 0.08506280928850174, | |
| "learning_rate": 0.00018815450643776824, | |
| "loss": 0.3565, | |
| "num_input_tokens_seen": 472728, | |
| "step": 75, | |
| "train_runtime": 313.2853, | |
| "train_tokens_per_second": 1508.938 | |
| }, | |
| { | |
| "epoch": 0.12991452991452992, | |
| "grad_norm": 0.09503644704818726, | |
| "learning_rate": 0.00018798283261802577, | |
| "loss": 0.3387, | |
| "num_input_tokens_seen": 478992, | |
| "step": 76, | |
| "train_runtime": 317.1949, | |
| "train_tokens_per_second": 1510.087 | |
| }, | |
| { | |
| "epoch": 0.13162393162393163, | |
| "grad_norm": 0.08575405180454254, | |
| "learning_rate": 0.00018781115879828325, | |
| "loss": 0.3635, | |
| "num_input_tokens_seen": 485832, | |
| "step": 77, | |
| "train_runtime": 321.5107, | |
| "train_tokens_per_second": 1511.091 | |
| }, | |
| { | |
| "epoch": 0.13333333333333333, | |
| "grad_norm": 0.10871604830026627, | |
| "learning_rate": 0.00018763948497854078, | |
| "loss": 0.4296, | |
| "num_input_tokens_seen": 490928, | |
| "step": 78, | |
| "train_runtime": 324.876, | |
| "train_tokens_per_second": 1511.124 | |
| }, | |
| { | |
| "epoch": 0.13504273504273503, | |
| "grad_norm": 0.1150660291314125, | |
| "learning_rate": 0.0001874678111587983, | |
| "loss": 0.4239, | |
| "num_input_tokens_seen": 495328, | |
| "step": 79, | |
| "train_runtime": 327.8846, | |
| "train_tokens_per_second": 1510.678 | |
| }, | |
| { | |
| "epoch": 0.13675213675213677, | |
| "grad_norm": 0.09480957686901093, | |
| "learning_rate": 0.0001872961373390558, | |
| "loss": 0.5293, | |
| "num_input_tokens_seen": 500544, | |
| "step": 80, | |
| "train_runtime": 331.3228, | |
| "train_tokens_per_second": 1510.744 | |
| }, | |
| { | |
| "epoch": 0.13846153846153847, | |
| "grad_norm": 0.10827576369047165, | |
| "learning_rate": 0.0001871244635193133, | |
| "loss": 0.3564, | |
| "num_input_tokens_seen": 508392, | |
| "step": 81, | |
| "train_runtime": 336.1583, | |
| "train_tokens_per_second": 1512.359 | |
| }, | |
| { | |
| "epoch": 0.14017094017094017, | |
| "grad_norm": 0.11873910576105118, | |
| "learning_rate": 0.0001869527896995708, | |
| "loss": 0.3257, | |
| "num_input_tokens_seen": 513256, | |
| "step": 82, | |
| "train_runtime": 339.3559, | |
| "train_tokens_per_second": 1512.442 | |
| }, | |
| { | |
| "epoch": 0.14188034188034188, | |
| "grad_norm": 0.0916254073381424, | |
| "learning_rate": 0.00018678111587982834, | |
| "loss": 0.4016, | |
| "num_input_tokens_seen": 521168, | |
| "step": 83, | |
| "train_runtime": 344.2306, | |
| "train_tokens_per_second": 1514.008 | |
| }, | |
| { | |
| "epoch": 0.14358974358974358, | |
| "grad_norm": 0.08179375529289246, | |
| "learning_rate": 0.00018660944206008584, | |
| "loss": 0.1876, | |
| "num_input_tokens_seen": 535992, | |
| "step": 84, | |
| "train_runtime": 356.5513, | |
| "train_tokens_per_second": 1503.268 | |
| }, | |
| { | |
| "epoch": 0.1452991452991453, | |
| "grad_norm": 0.10662805289030075, | |
| "learning_rate": 0.00018643776824034335, | |
| "loss": 0.4497, | |
| "num_input_tokens_seen": 540728, | |
| "step": 85, | |
| "train_runtime": 359.8356, | |
| "train_tokens_per_second": 1502.708 | |
| }, | |
| { | |
| "epoch": 0.147008547008547, | |
| "grad_norm": 0.09463411569595337, | |
| "learning_rate": 0.00018626609442060085, | |
| "loss": 0.5027, | |
| "num_input_tokens_seen": 547776, | |
| "step": 86, | |
| "train_runtime": 364.3736, | |
| "train_tokens_per_second": 1503.336 | |
| }, | |
| { | |
| "epoch": 0.14871794871794872, | |
| "grad_norm": 0.12029843032360077, | |
| "learning_rate": 0.00018609442060085838, | |
| "loss": 0.4105, | |
| "num_input_tokens_seen": 552712, | |
| "step": 87, | |
| "train_runtime": 367.7054, | |
| "train_tokens_per_second": 1503.138 | |
| }, | |
| { | |
| "epoch": 0.15042735042735042, | |
| "grad_norm": 0.08062440901994705, | |
| "learning_rate": 0.0001859227467811159, | |
| "loss": 0.418, | |
| "num_input_tokens_seen": 559664, | |
| "step": 88, | |
| "train_runtime": 372.2417, | |
| "train_tokens_per_second": 1503.496 | |
| }, | |
| { | |
| "epoch": 0.15213675213675212, | |
| "grad_norm": 0.10988523811101913, | |
| "learning_rate": 0.00018575107296137338, | |
| "loss": 0.4045, | |
| "num_input_tokens_seen": 564984, | |
| "step": 89, | |
| "train_runtime": 375.6853, | |
| "train_tokens_per_second": 1503.876 | |
| }, | |
| { | |
| "epoch": 0.15384615384615385, | |
| "grad_norm": 0.08529689162969589, | |
| "learning_rate": 0.0001855793991416309, | |
| "loss": 0.2621, | |
| "num_input_tokens_seen": 570904, | |
| "step": 90, | |
| "train_runtime": 379.4257, | |
| "train_tokens_per_second": 1504.653 | |
| }, | |
| { | |
| "epoch": 0.15555555555555556, | |
| "grad_norm": 0.0883374810218811, | |
| "learning_rate": 0.00018540772532188842, | |
| "loss": 0.4192, | |
| "num_input_tokens_seen": 578592, | |
| "step": 91, | |
| "train_runtime": 386.3897, | |
| "train_tokens_per_second": 1497.431 | |
| }, | |
| { | |
| "epoch": 0.15726495726495726, | |
| "grad_norm": 0.09064248204231262, | |
| "learning_rate": 0.00018523605150214595, | |
| "loss": 0.587, | |
| "num_input_tokens_seen": 585320, | |
| "step": 92, | |
| "train_runtime": 390.6938, | |
| "train_tokens_per_second": 1498.155 | |
| }, | |
| { | |
| "epoch": 0.15897435897435896, | |
| "grad_norm": 0.0960068479180336, | |
| "learning_rate": 0.00018506437768240342, | |
| "loss": 0.4497, | |
| "num_input_tokens_seen": 591128, | |
| "step": 93, | |
| "train_runtime": 394.5866, | |
| "train_tokens_per_second": 1498.095 | |
| }, | |
| { | |
| "epoch": 0.1606837606837607, | |
| "grad_norm": 0.08961305022239685, | |
| "learning_rate": 0.00018489270386266095, | |
| "loss": 0.3829, | |
| "num_input_tokens_seen": 597296, | |
| "step": 94, | |
| "train_runtime": 398.5175, | |
| "train_tokens_per_second": 1498.795 | |
| }, | |
| { | |
| "epoch": 0.1623931623931624, | |
| "grad_norm": 0.07730946689844131, | |
| "learning_rate": 0.00018472103004291848, | |
| "loss": 0.3776, | |
| "num_input_tokens_seen": 604664, | |
| "step": 95, | |
| "train_runtime": 403.2132, | |
| "train_tokens_per_second": 1499.613 | |
| }, | |
| { | |
| "epoch": 0.1641025641025641, | |
| "grad_norm": 0.07900130748748779, | |
| "learning_rate": 0.00018454935622317598, | |
| "loss": 0.4371, | |
| "num_input_tokens_seen": 612288, | |
| "step": 96, | |
| "train_runtime": 407.9353, | |
| "train_tokens_per_second": 1500.944 | |
| }, | |
| { | |
| "epoch": 0.1658119658119658, | |
| "grad_norm": 0.08631894737482071, | |
| "learning_rate": 0.00018437768240343348, | |
| "loss": 0.4397, | |
| "num_input_tokens_seen": 619168, | |
| "step": 97, | |
| "train_runtime": 412.3324, | |
| "train_tokens_per_second": 1501.623 | |
| }, | |
| { | |
| "epoch": 0.1675213675213675, | |
| "grad_norm": 0.10031551122665405, | |
| "learning_rate": 0.000184206008583691, | |
| "loss": 0.4387, | |
| "num_input_tokens_seen": 624400, | |
| "step": 98, | |
| "train_runtime": 415.8434, | |
| "train_tokens_per_second": 1501.527 | |
| }, | |
| { | |
| "epoch": 0.16923076923076924, | |
| "grad_norm": 0.07904055714607239, | |
| "learning_rate": 0.00018403433476394852, | |
| "loss": 0.3353, | |
| "num_input_tokens_seen": 632536, | |
| "step": 99, | |
| "train_runtime": 420.8949, | |
| "train_tokens_per_second": 1502.836 | |
| }, | |
| { | |
| "epoch": 0.17094017094017094, | |
| "grad_norm": 0.11156652867794037, | |
| "learning_rate": 0.00018386266094420602, | |
| "loss": 0.4099, | |
| "num_input_tokens_seen": 638680, | |
| "step": 100, | |
| "train_runtime": 424.9889, | |
| "train_tokens_per_second": 1502.816 | |
| }, | |
| { | |
| "epoch": 0.17264957264957265, | |
| "grad_norm": 0.08511320501565933, | |
| "learning_rate": 0.00018369098712446352, | |
| "loss": 0.4528, | |
| "num_input_tokens_seen": 644608, | |
| "step": 101, | |
| "train_runtime": 428.8153, | |
| "train_tokens_per_second": 1503.23 | |
| }, | |
| { | |
| "epoch": 0.17435897435897435, | |
| "grad_norm": 0.0914352536201477, | |
| "learning_rate": 0.00018351931330472102, | |
| "loss": 0.4464, | |
| "num_input_tokens_seen": 653032, | |
| "step": 102, | |
| "train_runtime": 434.0457, | |
| "train_tokens_per_second": 1504.524 | |
| }, | |
| { | |
| "epoch": 0.17606837606837608, | |
| "grad_norm": 0.0785689502954483, | |
| "learning_rate": 0.00018334763948497855, | |
| "loss": 0.353, | |
| "num_input_tokens_seen": 659008, | |
| "step": 103, | |
| "train_runtime": 437.8871, | |
| "train_tokens_per_second": 1504.973 | |
| }, | |
| { | |
| "epoch": 0.17777777777777778, | |
| "grad_norm": 0.0988244116306305, | |
| "learning_rate": 0.00018317596566523608, | |
| "loss": 0.552, | |
| "num_input_tokens_seen": 664320, | |
| "step": 104, | |
| "train_runtime": 441.435, | |
| "train_tokens_per_second": 1504.91 | |
| }, | |
| { | |
| "epoch": 0.1794871794871795, | |
| "grad_norm": 0.0942261815071106, | |
| "learning_rate": 0.00018300429184549356, | |
| "loss": 0.4421, | |
| "num_input_tokens_seen": 670136, | |
| "step": 105, | |
| "train_runtime": 445.279, | |
| "train_tokens_per_second": 1504.98 | |
| }, | |
| { | |
| "epoch": 0.1811965811965812, | |
| "grad_norm": 0.08600349724292755, | |
| "learning_rate": 0.0001828326180257511, | |
| "loss": 0.3713, | |
| "num_input_tokens_seen": 677616, | |
| "step": 106, | |
| "train_runtime": 450.0186, | |
| "train_tokens_per_second": 1505.751 | |
| }, | |
| { | |
| "epoch": 0.1829059829059829, | |
| "grad_norm": 0.104121632874012, | |
| "learning_rate": 0.0001826609442060086, | |
| "loss": 0.5, | |
| "num_input_tokens_seen": 682872, | |
| "step": 107, | |
| "train_runtime": 453.5698, | |
| "train_tokens_per_second": 1505.55 | |
| }, | |
| { | |
| "epoch": 0.18461538461538463, | |
| "grad_norm": 0.09976616501808167, | |
| "learning_rate": 0.00018248927038626612, | |
| "loss": 0.5722, | |
| "num_input_tokens_seen": 688880, | |
| "step": 108, | |
| "train_runtime": 457.5283, | |
| "train_tokens_per_second": 1505.656 | |
| }, | |
| { | |
| "epoch": 0.18632478632478633, | |
| "grad_norm": 0.09686106443405151, | |
| "learning_rate": 0.00018231759656652362, | |
| "loss": 0.3717, | |
| "num_input_tokens_seen": 694384, | |
| "step": 109, | |
| "train_runtime": 461.1352, | |
| "train_tokens_per_second": 1505.814 | |
| }, | |
| { | |
| "epoch": 0.18803418803418803, | |
| "grad_norm": 0.08702944964170456, | |
| "learning_rate": 0.00018214592274678112, | |
| "loss": 0.4682, | |
| "num_input_tokens_seen": 702888, | |
| "step": 110, | |
| "train_runtime": 466.3341, | |
| "train_tokens_per_second": 1507.263 | |
| }, | |
| { | |
| "epoch": 0.18974358974358974, | |
| "grad_norm": 0.0813233032822609, | |
| "learning_rate": 0.00018197424892703863, | |
| "loss": 0.3174, | |
| "num_input_tokens_seen": 708344, | |
| "step": 111, | |
| "train_runtime": 469.8961, | |
| "train_tokens_per_second": 1507.448 | |
| }, | |
| { | |
| "epoch": 0.19145299145299147, | |
| "grad_norm": 0.07839726656675339, | |
| "learning_rate": 0.00018180257510729616, | |
| "loss": 0.4506, | |
| "num_input_tokens_seen": 716048, | |
| "step": 112, | |
| "train_runtime": 474.733, | |
| "train_tokens_per_second": 1508.317 | |
| }, | |
| { | |
| "epoch": 0.19316239316239317, | |
| "grad_norm": 0.10011430829763412, | |
| "learning_rate": 0.00018163090128755366, | |
| "loss": 0.4048, | |
| "num_input_tokens_seen": 720496, | |
| "step": 113, | |
| "train_runtime": 477.7631, | |
| "train_tokens_per_second": 1508.061 | |
| }, | |
| { | |
| "epoch": 0.19487179487179487, | |
| "grad_norm": 0.11349597573280334, | |
| "learning_rate": 0.00018145922746781116, | |
| "loss": 0.4511, | |
| "num_input_tokens_seen": 726112, | |
| "step": 114, | |
| "train_runtime": 481.4317, | |
| "train_tokens_per_second": 1508.235 | |
| }, | |
| { | |
| "epoch": 0.19658119658119658, | |
| "grad_norm": 0.099846251308918, | |
| "learning_rate": 0.0001812875536480687, | |
| "loss": 0.4463, | |
| "num_input_tokens_seen": 732528, | |
| "step": 115, | |
| "train_runtime": 485.6263, | |
| "train_tokens_per_second": 1508.419 | |
| }, | |
| { | |
| "epoch": 0.19829059829059828, | |
| "grad_norm": 0.08845727145671844, | |
| "learning_rate": 0.0001811158798283262, | |
| "loss": 0.4187, | |
| "num_input_tokens_seen": 738224, | |
| "step": 116, | |
| "train_runtime": 489.3463, | |
| "train_tokens_per_second": 1508.592 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 0.08002110570669174, | |
| "learning_rate": 0.0001809442060085837, | |
| "loss": 0.3403, | |
| "num_input_tokens_seen": 744104, | |
| "step": 117, | |
| "train_runtime": 493.2012, | |
| "train_tokens_per_second": 1508.723 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "eval_loss": 0.40587517619132996, | |
| "eval_runtime": 40.1503, | |
| "eval_samples_per_second": 24.857, | |
| "eval_steps_per_second": 3.113, | |
| "num_input_tokens_seen": 744104, | |
| "step": 117 | |
| }, | |
| { | |
| "epoch": 0.20170940170940171, | |
| "grad_norm": 0.09665407240390778, | |
| "learning_rate": 0.0001807725321888412, | |
| "loss": 0.5484, | |
| "num_input_tokens_seen": 748408, | |
| "step": 118, | |
| "train_runtime": 536.2984, | |
| "train_tokens_per_second": 1395.507 | |
| }, | |
| { | |
| "epoch": 0.20341880341880342, | |
| "grad_norm": 0.073427215218544, | |
| "learning_rate": 0.00018060085836909873, | |
| "loss": 0.4037, | |
| "num_input_tokens_seen": 754976, | |
| "step": 119, | |
| "train_runtime": 540.4931, | |
| "train_tokens_per_second": 1396.828 | |
| }, | |
| { | |
| "epoch": 0.20512820512820512, | |
| "grad_norm": 0.07861398160457611, | |
| "learning_rate": 0.00018042918454935623, | |
| "loss": 0.4175, | |
| "num_input_tokens_seen": 761608, | |
| "step": 120, | |
| "train_runtime": 544.7639, | |
| "train_tokens_per_second": 1398.051 | |
| }, | |
| { | |
| "epoch": 0.20683760683760682, | |
| "grad_norm": 0.08523395657539368, | |
| "learning_rate": 0.00018025751072961373, | |
| "loss": 0.4514, | |
| "num_input_tokens_seen": 766696, | |
| "step": 121, | |
| "train_runtime": 550.2584, | |
| "train_tokens_per_second": 1393.338 | |
| }, | |
| { | |
| "epoch": 0.20854700854700856, | |
| "grad_norm": 0.10175268352031708, | |
| "learning_rate": 0.00018008583690987126, | |
| "loss": 0.5498, | |
| "num_input_tokens_seen": 771816, | |
| "step": 122, | |
| "train_runtime": 553.5915, | |
| "train_tokens_per_second": 1394.198 | |
| }, | |
| { | |
| "epoch": 0.21025641025641026, | |
| "grad_norm": 0.07897434383630753, | |
| "learning_rate": 0.00017991416309012876, | |
| "loss": 0.3669, | |
| "num_input_tokens_seen": 779816, | |
| "step": 123, | |
| "train_runtime": 558.5531, | |
| "train_tokens_per_second": 1396.136 | |
| }, | |
| { | |
| "epoch": 0.21196581196581196, | |
| "grad_norm": 0.10032803565263748, | |
| "learning_rate": 0.0001797424892703863, | |
| "loss": 0.3945, | |
| "num_input_tokens_seen": 784600, | |
| "step": 124, | |
| "train_runtime": 561.7266, | |
| "train_tokens_per_second": 1396.765 | |
| }, | |
| { | |
| "epoch": 0.21367521367521367, | |
| "grad_norm": 0.10458017885684967, | |
| "learning_rate": 0.0001795708154506438, | |
| "loss": 0.4762, | |
| "num_input_tokens_seen": 790456, | |
| "step": 125, | |
| "train_runtime": 565.5377, | |
| "train_tokens_per_second": 1397.707 | |
| }, | |
| { | |
| "epoch": 0.2153846153846154, | |
| "grad_norm": 0.09089679270982742, | |
| "learning_rate": 0.0001793991416309013, | |
| "loss": 0.3702, | |
| "num_input_tokens_seen": 796736, | |
| "step": 126, | |
| "train_runtime": 569.5205, | |
| "train_tokens_per_second": 1398.959 | |
| }, | |
| { | |
| "epoch": 0.2170940170940171, | |
| "grad_norm": 0.06831668317317963, | |
| "learning_rate": 0.0001792274678111588, | |
| "loss": 0.3713, | |
| "num_input_tokens_seen": 804176, | |
| "step": 127, | |
| "train_runtime": 574.2202, | |
| "train_tokens_per_second": 1400.466 | |
| }, | |
| { | |
| "epoch": 0.2188034188034188, | |
| "grad_norm": 0.083027184009552, | |
| "learning_rate": 0.00017905579399141633, | |
| "loss": 0.4235, | |
| "num_input_tokens_seen": 809584, | |
| "step": 128, | |
| "train_runtime": 577.782, | |
| "train_tokens_per_second": 1401.193 | |
| }, | |
| { | |
| "epoch": 0.2205128205128205, | |
| "grad_norm": 0.11360776424407959, | |
| "learning_rate": 0.00017888412017167383, | |
| "loss": 0.4361, | |
| "num_input_tokens_seen": 814840, | |
| "step": 129, | |
| "train_runtime": 581.233, | |
| "train_tokens_per_second": 1401.916 | |
| }, | |
| { | |
| "epoch": 0.2222222222222222, | |
| "grad_norm": 0.08979545533657074, | |
| "learning_rate": 0.00017871244635193133, | |
| "loss": 0.4393, | |
| "num_input_tokens_seen": 821288, | |
| "step": 130, | |
| "train_runtime": 585.3382, | |
| "train_tokens_per_second": 1403.1 | |
| }, | |
| { | |
| "epoch": 0.22393162393162394, | |
| "grad_norm": 0.08497156947851181, | |
| "learning_rate": 0.00017854077253218886, | |
| "loss": 0.5048, | |
| "num_input_tokens_seen": 827120, | |
| "step": 131, | |
| "train_runtime": 589.1115, | |
| "train_tokens_per_second": 1404.013 | |
| }, | |
| { | |
| "epoch": 0.22564102564102564, | |
| "grad_norm": 0.0827530175447464, | |
| "learning_rate": 0.00017836909871244637, | |
| "loss": 0.4593, | |
| "num_input_tokens_seen": 834872, | |
| "step": 132, | |
| "train_runtime": 594.0487, | |
| "train_tokens_per_second": 1405.393 | |
| }, | |
| { | |
| "epoch": 0.22735042735042735, | |
| "grad_norm": 0.08185572922229767, | |
| "learning_rate": 0.00017819742489270387, | |
| "loss": 0.4384, | |
| "num_input_tokens_seen": 842384, | |
| "step": 133, | |
| "train_runtime": 598.7695, | |
| "train_tokens_per_second": 1406.859 | |
| }, | |
| { | |
| "epoch": 0.22905982905982905, | |
| "grad_norm": 0.07782582938671112, | |
| "learning_rate": 0.00017802575107296137, | |
| "loss": 0.3566, | |
| "num_input_tokens_seen": 848280, | |
| "step": 134, | |
| "train_runtime": 602.5201, | |
| "train_tokens_per_second": 1407.887 | |
| }, | |
| { | |
| "epoch": 0.23076923076923078, | |
| "grad_norm": 0.08689026534557343, | |
| "learning_rate": 0.0001778540772532189, | |
| "loss": 0.4375, | |
| "num_input_tokens_seen": 853712, | |
| "step": 135, | |
| "train_runtime": 606.0639, | |
| "train_tokens_per_second": 1408.617 | |
| }, | |
| { | |
| "epoch": 0.23247863247863249, | |
| "grad_norm": 0.08213752508163452, | |
| "learning_rate": 0.0001776824034334764, | |
| "loss": 0.4607, | |
| "num_input_tokens_seen": 860096, | |
| "step": 136, | |
| "train_runtime": 610.1344, | |
| "train_tokens_per_second": 1409.683 | |
| }, | |
| { | |
| "epoch": 0.2341880341880342, | |
| "grad_norm": 0.10310304164886475, | |
| "learning_rate": 0.0001775107296137339, | |
| "loss": 0.5032, | |
| "num_input_tokens_seen": 865432, | |
| "step": 137, | |
| "train_runtime": 613.6063, | |
| "train_tokens_per_second": 1410.403 | |
| }, | |
| { | |
| "epoch": 0.2358974358974359, | |
| "grad_norm": 0.09156456589698792, | |
| "learning_rate": 0.0001773390557939914, | |
| "loss": 0.3892, | |
| "num_input_tokens_seen": 871368, | |
| "step": 138, | |
| "train_runtime": 617.5677, | |
| "train_tokens_per_second": 1410.968 | |
| }, | |
| { | |
| "epoch": 0.2376068376068376, | |
| "grad_norm": 0.091376394033432, | |
| "learning_rate": 0.00017716738197424894, | |
| "loss": 0.3485, | |
| "num_input_tokens_seen": 878000, | |
| "step": 139, | |
| "train_runtime": 621.9067, | |
| "train_tokens_per_second": 1411.787 | |
| }, | |
| { | |
| "epoch": 0.23931623931623933, | |
| "grad_norm": 0.08833985775709152, | |
| "learning_rate": 0.00017699570815450647, | |
| "loss": 0.4308, | |
| "num_input_tokens_seen": 884944, | |
| "step": 140, | |
| "train_runtime": 626.1591, | |
| "train_tokens_per_second": 1413.289 | |
| }, | |
| { | |
| "epoch": 0.24102564102564103, | |
| "grad_norm": 0.077347531914711, | |
| "learning_rate": 0.00017682403433476397, | |
| "loss": 0.4437, | |
| "num_input_tokens_seen": 892048, | |
| "step": 141, | |
| "train_runtime": 630.5956, | |
| "train_tokens_per_second": 1414.612 | |
| }, | |
| { | |
| "epoch": 0.24273504273504273, | |
| "grad_norm": 0.08778735250234604, | |
| "learning_rate": 0.00017665236051502147, | |
| "loss": 0.4004, | |
| "num_input_tokens_seen": 899272, | |
| "step": 142, | |
| "train_runtime": 635.1106, | |
| "train_tokens_per_second": 1415.93 | |
| }, | |
| { | |
| "epoch": 0.24444444444444444, | |
| "grad_norm": 0.07579584419727325, | |
| "learning_rate": 0.00017648068669527897, | |
| "loss": 0.3275, | |
| "num_input_tokens_seen": 905736, | |
| "step": 143, | |
| "train_runtime": 639.1325, | |
| "train_tokens_per_second": 1417.133 | |
| }, | |
| { | |
| "epoch": 0.24615384615384617, | |
| "grad_norm": 0.09621628373861313, | |
| "learning_rate": 0.0001763090128755365, | |
| "loss": 0.3186, | |
| "num_input_tokens_seen": 911992, | |
| "step": 144, | |
| "train_runtime": 643.0987, | |
| "train_tokens_per_second": 1418.121 | |
| }, | |
| { | |
| "epoch": 0.24786324786324787, | |
| "grad_norm": 0.08134900778532028, | |
| "learning_rate": 0.000176137339055794, | |
| "loss": 0.4076, | |
| "num_input_tokens_seen": 919056, | |
| "step": 145, | |
| "train_runtime": 647.5843, | |
| "train_tokens_per_second": 1419.207 | |
| }, | |
| { | |
| "epoch": 0.24957264957264957, | |
| "grad_norm": 0.08956107497215271, | |
| "learning_rate": 0.0001759656652360515, | |
| "loss": 0.442, | |
| "num_input_tokens_seen": 926560, | |
| "step": 146, | |
| "train_runtime": 652.2666, | |
| "train_tokens_per_second": 1420.523 | |
| }, | |
| { | |
| "epoch": 0.2512820512820513, | |
| "grad_norm": 0.09825581312179565, | |
| "learning_rate": 0.000175793991416309, | |
| "loss": 0.4903, | |
| "num_input_tokens_seen": 932616, | |
| "step": 147, | |
| "train_runtime": 656.1634, | |
| "train_tokens_per_second": 1421.317 | |
| }, | |
| { | |
| "epoch": 0.252991452991453, | |
| "grad_norm": 0.0692400187253952, | |
| "learning_rate": 0.00017562231759656654, | |
| "loss": 0.4363, | |
| "num_input_tokens_seen": 943096, | |
| "step": 148, | |
| "train_runtime": 662.5318, | |
| "train_tokens_per_second": 1423.473 | |
| }, | |
| { | |
| "epoch": 0.2547008547008547, | |
| "grad_norm": 0.08518907427787781, | |
| "learning_rate": 0.00017545064377682404, | |
| "loss": 0.507, | |
| "num_input_tokens_seen": 949704, | |
| "step": 149, | |
| "train_runtime": 666.7, | |
| "train_tokens_per_second": 1424.485 | |
| }, | |
| { | |
| "epoch": 0.2564102564102564, | |
| "grad_norm": 0.07248781621456146, | |
| "learning_rate": 0.00017527896995708154, | |
| "loss": 0.4597, | |
| "num_input_tokens_seen": 958480, | |
| "step": 150, | |
| "train_runtime": 672.0909, | |
| "train_tokens_per_second": 1426.117 | |
| }, | |
| { | |
| "epoch": 0.25811965811965815, | |
| "grad_norm": 0.08344928175210953, | |
| "learning_rate": 0.00017510729613733907, | |
| "loss": 0.4066, | |
| "num_input_tokens_seen": 962848, | |
| "step": 151, | |
| "train_runtime": 677.1767, | |
| "train_tokens_per_second": 1421.856 | |
| }, | |
| { | |
| "epoch": 0.25982905982905985, | |
| "grad_norm": 0.08732214570045471, | |
| "learning_rate": 0.00017493562231759658, | |
| "loss": 0.4012, | |
| "num_input_tokens_seen": 969200, | |
| "step": 152, | |
| "train_runtime": 681.1815, | |
| "train_tokens_per_second": 1422.822 | |
| }, | |
| { | |
| "epoch": 0.26153846153846155, | |
| "grad_norm": 0.0862775668501854, | |
| "learning_rate": 0.00017476394849785408, | |
| "loss": 0.4044, | |
| "num_input_tokens_seen": 977976, | |
| "step": 153, | |
| "train_runtime": 686.6033, | |
| "train_tokens_per_second": 1424.368 | |
| }, | |
| { | |
| "epoch": 0.26324786324786326, | |
| "grad_norm": 0.09334586560726166, | |
| "learning_rate": 0.00017459227467811158, | |
| "loss": 0.4974, | |
| "num_input_tokens_seen": 982864, | |
| "step": 154, | |
| "train_runtime": 689.9455, | |
| "train_tokens_per_second": 1424.553 | |
| }, | |
| { | |
| "epoch": 0.26495726495726496, | |
| "grad_norm": 0.09835942089557648, | |
| "learning_rate": 0.0001744206008583691, | |
| "loss": 0.4172, | |
| "num_input_tokens_seen": 987816, | |
| "step": 155, | |
| "train_runtime": 693.2463, | |
| "train_tokens_per_second": 1424.913 | |
| }, | |
| { | |
| "epoch": 0.26666666666666666, | |
| "grad_norm": 0.09492865204811096, | |
| "learning_rate": 0.0001742489270386266, | |
| "loss": 0.6536, | |
| "num_input_tokens_seen": 995184, | |
| "step": 156, | |
| "train_runtime": 697.9501, | |
| "train_tokens_per_second": 1425.867 | |
| }, | |
| { | |
| "epoch": 0.26837606837606837, | |
| "grad_norm": 0.11019627749919891, | |
| "learning_rate": 0.00017407725321888414, | |
| "loss": 0.3825, | |
| "num_input_tokens_seen": 1001744, | |
| "step": 157, | |
| "train_runtime": 702.1512, | |
| "train_tokens_per_second": 1426.678 | |
| }, | |
| { | |
| "epoch": 0.27008547008547007, | |
| "grad_norm": 0.07688013464212418, | |
| "learning_rate": 0.00017390557939914164, | |
| "loss": 0.3832, | |
| "num_input_tokens_seen": 1009000, | |
| "step": 158, | |
| "train_runtime": 706.7516, | |
| "train_tokens_per_second": 1427.659 | |
| }, | |
| { | |
| "epoch": 0.2717948717948718, | |
| "grad_norm": 0.07811388373374939, | |
| "learning_rate": 0.00017373390557939915, | |
| "loss": 0.3388, | |
| "num_input_tokens_seen": 1016968, | |
| "step": 159, | |
| "train_runtime": 711.6447, | |
| "train_tokens_per_second": 1429.039 | |
| }, | |
| { | |
| "epoch": 0.27350427350427353, | |
| "grad_norm": 0.08074574917554855, | |
| "learning_rate": 0.00017356223175965668, | |
| "loss": 0.3884, | |
| "num_input_tokens_seen": 1023360, | |
| "step": 160, | |
| "train_runtime": 715.701, | |
| "train_tokens_per_second": 1429.871 | |
| }, | |
| { | |
| "epoch": 0.27521367521367524, | |
| "grad_norm": 0.08296569436788559, | |
| "learning_rate": 0.00017339055793991418, | |
| "loss": 0.4869, | |
| "num_input_tokens_seen": 1030056, | |
| "step": 161, | |
| "train_runtime": 719.8879, | |
| "train_tokens_per_second": 1430.856 | |
| }, | |
| { | |
| "epoch": 0.27692307692307694, | |
| "grad_norm": 0.08286713808774948, | |
| "learning_rate": 0.00017321888412017168, | |
| "loss": 0.4112, | |
| "num_input_tokens_seen": 1035944, | |
| "step": 162, | |
| "train_runtime": 723.7165, | |
| "train_tokens_per_second": 1431.422 | |
| }, | |
| { | |
| "epoch": 0.27863247863247864, | |
| "grad_norm": 0.08952026814222336, | |
| "learning_rate": 0.00017304721030042918, | |
| "loss": 0.5178, | |
| "num_input_tokens_seen": 1041072, | |
| "step": 163, | |
| "train_runtime": 727.2547, | |
| "train_tokens_per_second": 1431.509 | |
| }, | |
| { | |
| "epoch": 0.28034188034188035, | |
| "grad_norm": 0.08672165125608444, | |
| "learning_rate": 0.0001728755364806867, | |
| "loss": 0.5141, | |
| "num_input_tokens_seen": 1046504, | |
| "step": 164, | |
| "train_runtime": 730.8063, | |
| "train_tokens_per_second": 1431.985 | |
| }, | |
| { | |
| "epoch": 0.28205128205128205, | |
| "grad_norm": 0.07433119416236877, | |
| "learning_rate": 0.00017270386266094421, | |
| "loss": 0.3705, | |
| "num_input_tokens_seen": 1053320, | |
| "step": 165, | |
| "train_runtime": 735.1927, | |
| "train_tokens_per_second": 1432.713 | |
| }, | |
| { | |
| "epoch": 0.28376068376068375, | |
| "grad_norm": 0.09836415946483612, | |
| "learning_rate": 0.00017253218884120172, | |
| "loss": 0.4012, | |
| "num_input_tokens_seen": 1058256, | |
| "step": 166, | |
| "train_runtime": 738.4481, | |
| "train_tokens_per_second": 1433.081 | |
| }, | |
| { | |
| "epoch": 0.28547008547008546, | |
| "grad_norm": 0.07832959294319153, | |
| "learning_rate": 0.00017236051502145925, | |
| "loss": 0.4682, | |
| "num_input_tokens_seen": 1066112, | |
| "step": 167, | |
| "train_runtime": 743.4085, | |
| "train_tokens_per_second": 1434.086 | |
| }, | |
| { | |
| "epoch": 0.28717948717948716, | |
| "grad_norm": 0.08503518998622894, | |
| "learning_rate": 0.00017218884120171675, | |
| "loss": 0.3681, | |
| "num_input_tokens_seen": 1072952, | |
| "step": 168, | |
| "train_runtime": 747.782, | |
| "train_tokens_per_second": 1434.846 | |
| }, | |
| { | |
| "epoch": 0.28888888888888886, | |
| "grad_norm": 0.09327785670757294, | |
| "learning_rate": 0.00017201716738197428, | |
| "loss": 0.4025, | |
| "num_input_tokens_seen": 1077256, | |
| "step": 169, | |
| "train_runtime": 750.8076, | |
| "train_tokens_per_second": 1434.796 | |
| }, | |
| { | |
| "epoch": 0.2905982905982906, | |
| "grad_norm": 0.09186345338821411, | |
| "learning_rate": 0.00017184549356223175, | |
| "loss": 0.3879, | |
| "num_input_tokens_seen": 1084024, | |
| "step": 170, | |
| "train_runtime": 755.0495, | |
| "train_tokens_per_second": 1435.699 | |
| }, | |
| { | |
| "epoch": 0.2923076923076923, | |
| "grad_norm": 0.10323686897754669, | |
| "learning_rate": 0.00017167381974248928, | |
| "loss": 0.4933, | |
| "num_input_tokens_seen": 1088616, | |
| "step": 171, | |
| "train_runtime": 758.2012, | |
| "train_tokens_per_second": 1435.788 | |
| }, | |
| { | |
| "epoch": 0.294017094017094, | |
| "grad_norm": 0.09350578486919403, | |
| "learning_rate": 0.00017150214592274679, | |
| "loss": 0.4143, | |
| "num_input_tokens_seen": 1093688, | |
| "step": 172, | |
| "train_runtime": 761.4934, | |
| "train_tokens_per_second": 1436.241 | |
| }, | |
| { | |
| "epoch": 0.29572649572649573, | |
| "grad_norm": 0.08342265337705612, | |
| "learning_rate": 0.00017133047210300431, | |
| "loss": 0.5081, | |
| "num_input_tokens_seen": 1102040, | |
| "step": 173, | |
| "train_runtime": 766.6178, | |
| "train_tokens_per_second": 1437.535 | |
| }, | |
| { | |
| "epoch": 0.29743589743589743, | |
| "grad_norm": 0.08377649635076523, | |
| "learning_rate": 0.0001711587982832618, | |
| "loss": 0.3301, | |
| "num_input_tokens_seen": 1108952, | |
| "step": 174, | |
| "train_runtime": 771.0497, | |
| "train_tokens_per_second": 1438.237 | |
| }, | |
| { | |
| "epoch": 0.29914529914529914, | |
| "grad_norm": 0.0985167846083641, | |
| "learning_rate": 0.00017098712446351932, | |
| "loss": 0.4349, | |
| "num_input_tokens_seen": 1114632, | |
| "step": 175, | |
| "train_runtime": 774.8477, | |
| "train_tokens_per_second": 1438.518 | |
| }, | |
| { | |
| "epoch": 0.30085470085470084, | |
| "grad_norm": 0.08420700579881668, | |
| "learning_rate": 0.00017081545064377685, | |
| "loss": 0.3511, | |
| "num_input_tokens_seen": 1120864, | |
| "step": 176, | |
| "train_runtime": 778.8626, | |
| "train_tokens_per_second": 1439.104 | |
| }, | |
| { | |
| "epoch": 0.30256410256410254, | |
| "grad_norm": 0.09592931717634201, | |
| "learning_rate": 0.00017064377682403435, | |
| "loss": 0.41, | |
| "num_input_tokens_seen": 1125952, | |
| "step": 177, | |
| "train_runtime": 782.2927, | |
| "train_tokens_per_second": 1439.298 | |
| }, | |
| { | |
| "epoch": 0.30427350427350425, | |
| "grad_norm": 0.1051315888762474, | |
| "learning_rate": 0.00017047210300429185, | |
| "loss": 0.4207, | |
| "num_input_tokens_seen": 1131248, | |
| "step": 178, | |
| "train_runtime": 785.7848, | |
| "train_tokens_per_second": 1439.641 | |
| }, | |
| { | |
| "epoch": 0.305982905982906, | |
| "grad_norm": 0.08925200253725052, | |
| "learning_rate": 0.00017030042918454936, | |
| "loss": 0.4633, | |
| "num_input_tokens_seen": 1136936, | |
| "step": 179, | |
| "train_runtime": 789.5893, | |
| "train_tokens_per_second": 1439.908 | |
| }, | |
| { | |
| "epoch": 0.3076923076923077, | |
| "grad_norm": 0.0915122926235199, | |
| "learning_rate": 0.00017012875536480689, | |
| "loss": 0.4684, | |
| "num_input_tokens_seen": 1142672, | |
| "step": 180, | |
| "train_runtime": 793.454, | |
| "train_tokens_per_second": 1440.124 | |
| }, | |
| { | |
| "epoch": 0.3094017094017094, | |
| "grad_norm": 0.08007518202066422, | |
| "learning_rate": 0.0001699570815450644, | |
| "loss": 0.3796, | |
| "num_input_tokens_seen": 1148560, | |
| "step": 181, | |
| "train_runtime": 799.6238, | |
| "train_tokens_per_second": 1436.375 | |
| }, | |
| { | |
| "epoch": 0.3111111111111111, | |
| "grad_norm": 0.07503318041563034, | |
| "learning_rate": 0.0001697854077253219, | |
| "loss": 0.4707, | |
| "num_input_tokens_seen": 1154464, | |
| "step": 182, | |
| "train_runtime": 803.5538, | |
| "train_tokens_per_second": 1436.698 | |
| }, | |
| { | |
| "epoch": 0.3128205128205128, | |
| "grad_norm": 0.08250313997268677, | |
| "learning_rate": 0.0001696137339055794, | |
| "loss": 0.353, | |
| "num_input_tokens_seen": 1160784, | |
| "step": 183, | |
| "train_runtime": 807.6568, | |
| "train_tokens_per_second": 1437.224 | |
| }, | |
| { | |
| "epoch": 0.3145299145299145, | |
| "grad_norm": 0.08271831274032593, | |
| "learning_rate": 0.00016944206008583692, | |
| "loss": 0.3339, | |
| "num_input_tokens_seen": 1168784, | |
| "step": 184, | |
| "train_runtime": 812.761, | |
| "train_tokens_per_second": 1438.042 | |
| }, | |
| { | |
| "epoch": 0.3162393162393162, | |
| "grad_norm": 0.0855436846613884, | |
| "learning_rate": 0.00016927038626609445, | |
| "loss": 0.4262, | |
| "num_input_tokens_seen": 1174328, | |
| "step": 185, | |
| "train_runtime": 816.4748, | |
| "train_tokens_per_second": 1438.291 | |
| }, | |
| { | |
| "epoch": 0.31794871794871793, | |
| "grad_norm": 0.0945754274725914, | |
| "learning_rate": 0.00016909871244635193, | |
| "loss": 0.4788, | |
| "num_input_tokens_seen": 1181472, | |
| "step": 186, | |
| "train_runtime": 820.9842, | |
| "train_tokens_per_second": 1439.092 | |
| }, | |
| { | |
| "epoch": 0.31965811965811963, | |
| "grad_norm": 0.08868105709552765, | |
| "learning_rate": 0.00016892703862660946, | |
| "loss": 0.3443, | |
| "num_input_tokens_seen": 1186512, | |
| "step": 187, | |
| "train_runtime": 824.2996, | |
| "train_tokens_per_second": 1439.418 | |
| }, | |
| { | |
| "epoch": 0.3213675213675214, | |
| "grad_norm": 0.08292389661073685, | |
| "learning_rate": 0.00016875536480686696, | |
| "loss": 0.4366, | |
| "num_input_tokens_seen": 1193368, | |
| "step": 188, | |
| "train_runtime": 828.6712, | |
| "train_tokens_per_second": 1440.098 | |
| }, | |
| { | |
| "epoch": 0.3230769230769231, | |
| "grad_norm": 0.08975725620985031, | |
| "learning_rate": 0.0001685836909871245, | |
| "loss": 0.4329, | |
| "num_input_tokens_seen": 1199040, | |
| "step": 189, | |
| "train_runtime": 832.4326, | |
| "train_tokens_per_second": 1440.405 | |
| }, | |
| { | |
| "epoch": 0.3247863247863248, | |
| "grad_norm": 0.0817112997174263, | |
| "learning_rate": 0.00016841201716738196, | |
| "loss": 0.3662, | |
| "num_input_tokens_seen": 1206688, | |
| "step": 190, | |
| "train_runtime": 837.2183, | |
| "train_tokens_per_second": 1441.306 | |
| }, | |
| { | |
| "epoch": 0.3264957264957265, | |
| "grad_norm": 0.07979970425367355, | |
| "learning_rate": 0.0001682403433476395, | |
| "loss": 0.398, | |
| "num_input_tokens_seen": 1212200, | |
| "step": 191, | |
| "train_runtime": 840.9362, | |
| "train_tokens_per_second": 1441.489 | |
| }, | |
| { | |
| "epoch": 0.3282051282051282, | |
| "grad_norm": 0.07939396798610687, | |
| "learning_rate": 0.000168068669527897, | |
| "loss": 0.3686, | |
| "num_input_tokens_seen": 1216776, | |
| "step": 192, | |
| "train_runtime": 843.9694, | |
| "train_tokens_per_second": 1441.73 | |
| }, | |
| { | |
| "epoch": 0.3299145299145299, | |
| "grad_norm": 0.07741633802652359, | |
| "learning_rate": 0.00016789699570815452, | |
| "loss": 0.425, | |
| "num_input_tokens_seen": 1226144, | |
| "step": 193, | |
| "train_runtime": 849.6943, | |
| "train_tokens_per_second": 1443.041 | |
| }, | |
| { | |
| "epoch": 0.3316239316239316, | |
| "grad_norm": 0.09136336296796799, | |
| "learning_rate": 0.00016772532188841203, | |
| "loss": 0.3931, | |
| "num_input_tokens_seen": 1231528, | |
| "step": 194, | |
| "train_runtime": 853.2848, | |
| "train_tokens_per_second": 1443.279 | |
| }, | |
| { | |
| "epoch": 0.3333333333333333, | |
| "grad_norm": 0.08121038973331451, | |
| "learning_rate": 0.00016755364806866953, | |
| "loss": 0.463, | |
| "num_input_tokens_seen": 1238208, | |
| "step": 195, | |
| "train_runtime": 857.5308, | |
| "train_tokens_per_second": 1443.923 | |
| }, | |
| { | |
| "epoch": 0.335042735042735, | |
| "grad_norm": 0.07446426898241043, | |
| "learning_rate": 0.00016738197424892706, | |
| "loss": 0.3814, | |
| "num_input_tokens_seen": 1246368, | |
| "step": 196, | |
| "train_runtime": 862.7002, | |
| "train_tokens_per_second": 1444.729 | |
| }, | |
| { | |
| "epoch": 0.3367521367521368, | |
| "grad_norm": 0.08591346442699432, | |
| "learning_rate": 0.00016721030042918456, | |
| "loss": 0.4053, | |
| "num_input_tokens_seen": 1253176, | |
| "step": 197, | |
| "train_runtime": 867.0626, | |
| "train_tokens_per_second": 1445.312 | |
| }, | |
| { | |
| "epoch": 0.3384615384615385, | |
| "grad_norm": 0.0990113615989685, | |
| "learning_rate": 0.00016703862660944206, | |
| "loss": 0.3617, | |
| "num_input_tokens_seen": 1257328, | |
| "step": 198, | |
| "train_runtime": 869.9717, | |
| "train_tokens_per_second": 1445.252 | |
| }, | |
| { | |
| "epoch": 0.3401709401709402, | |
| "grad_norm": 0.08174863457679749, | |
| "learning_rate": 0.00016686695278969957, | |
| "loss": 0.2952, | |
| "num_input_tokens_seen": 1262752, | |
| "step": 199, | |
| "train_runtime": 873.6148, | |
| "train_tokens_per_second": 1445.433 | |
| }, | |
| { | |
| "epoch": 0.3418803418803419, | |
| "grad_norm": 0.0933527871966362, | |
| "learning_rate": 0.0001666952789699571, | |
| "loss": 0.4163, | |
| "num_input_tokens_seen": 1268184, | |
| "step": 200, | |
| "train_runtime": 877.2752, | |
| "train_tokens_per_second": 1445.594 | |
| }, | |
| { | |
| "epoch": 0.3435897435897436, | |
| "grad_norm": 0.1140134260058403, | |
| "learning_rate": 0.0001665236051502146, | |
| "loss": 0.4031, | |
| "num_input_tokens_seen": 1272472, | |
| "step": 201, | |
| "train_runtime": 880.2048, | |
| "train_tokens_per_second": 1445.654 | |
| }, | |
| { | |
| "epoch": 0.3452991452991453, | |
| "grad_norm": 0.08693648129701614, | |
| "learning_rate": 0.0001663519313304721, | |
| "loss": 0.6282, | |
| "num_input_tokens_seen": 1281824, | |
| "step": 202, | |
| "train_runtime": 886.0089, | |
| "train_tokens_per_second": 1446.739 | |
| }, | |
| { | |
| "epoch": 0.347008547008547, | |
| "grad_norm": 0.07994189858436584, | |
| "learning_rate": 0.00016618025751072963, | |
| "loss": 0.4113, | |
| "num_input_tokens_seen": 1289504, | |
| "step": 203, | |
| "train_runtime": 890.7326, | |
| "train_tokens_per_second": 1447.689 | |
| }, | |
| { | |
| "epoch": 0.3487179487179487, | |
| "grad_norm": 0.09394797682762146, | |
| "learning_rate": 0.00016600858369098713, | |
| "loss": 0.4092, | |
| "num_input_tokens_seen": 1297680, | |
| "step": 204, | |
| "train_runtime": 895.8276, | |
| "train_tokens_per_second": 1448.582 | |
| }, | |
| { | |
| "epoch": 0.3504273504273504, | |
| "grad_norm": 0.1045864149928093, | |
| "learning_rate": 0.00016583690987124466, | |
| "loss": 0.4665, | |
| "num_input_tokens_seen": 1303120, | |
| "step": 205, | |
| "train_runtime": 899.4257, | |
| "train_tokens_per_second": 1448.836 | |
| }, | |
| { | |
| "epoch": 0.35213675213675216, | |
| "grad_norm": 0.09909515082836151, | |
| "learning_rate": 0.00016566523605150214, | |
| "loss": 0.3833, | |
| "num_input_tokens_seen": 1308704, | |
| "step": 206, | |
| "train_runtime": 903.0277, | |
| "train_tokens_per_second": 1449.24 | |
| }, | |
| { | |
| "epoch": 0.35384615384615387, | |
| "grad_norm": 0.09417211264371872, | |
| "learning_rate": 0.00016549356223175967, | |
| "loss": 0.4637, | |
| "num_input_tokens_seen": 1318024, | |
| "step": 207, | |
| "train_runtime": 908.7522, | |
| "train_tokens_per_second": 1450.367 | |
| }, | |
| { | |
| "epoch": 0.35555555555555557, | |
| "grad_norm": 0.08689752966165543, | |
| "learning_rate": 0.00016532188841201717, | |
| "loss": 0.3688, | |
| "num_input_tokens_seen": 1323376, | |
| "step": 208, | |
| "train_runtime": 912.3212, | |
| "train_tokens_per_second": 1450.559 | |
| }, | |
| { | |
| "epoch": 0.3572649572649573, | |
| "grad_norm": 0.10346587747335434, | |
| "learning_rate": 0.0001651502145922747, | |
| "loss": 0.417, | |
| "num_input_tokens_seen": 1329344, | |
| "step": 209, | |
| "train_runtime": 916.1738, | |
| "train_tokens_per_second": 1450.974 | |
| }, | |
| { | |
| "epoch": 0.358974358974359, | |
| "grad_norm": 0.08489441126585007, | |
| "learning_rate": 0.00016497854077253217, | |
| "loss": 0.3553, | |
| "num_input_tokens_seen": 1335584, | |
| "step": 210, | |
| "train_runtime": 920.2847, | |
| "train_tokens_per_second": 1451.273 | |
| }, | |
| { | |
| "epoch": 0.3606837606837607, | |
| "grad_norm": 0.10042458772659302, | |
| "learning_rate": 0.0001648068669527897, | |
| "loss": 0.4154, | |
| "num_input_tokens_seen": 1340328, | |
| "step": 211, | |
| "train_runtime": 925.545, | |
| "train_tokens_per_second": 1448.15 | |
| }, | |
| { | |
| "epoch": 0.3623931623931624, | |
| "grad_norm": 0.10793930292129517, | |
| "learning_rate": 0.00016463519313304723, | |
| "loss": 0.3644, | |
| "num_input_tokens_seen": 1345400, | |
| "step": 212, | |
| "train_runtime": 928.914, | |
| "train_tokens_per_second": 1448.358 | |
| }, | |
| { | |
| "epoch": 0.3641025641025641, | |
| "grad_norm": 0.08157683908939362, | |
| "learning_rate": 0.00016446351931330473, | |
| "loss": 0.3851, | |
| "num_input_tokens_seen": 1352168, | |
| "step": 213, | |
| "train_runtime": 933.2462, | |
| "train_tokens_per_second": 1448.887 | |
| }, | |
| { | |
| "epoch": 0.3658119658119658, | |
| "grad_norm": 0.08290579169988632, | |
| "learning_rate": 0.00016429184549356224, | |
| "loss": 0.4271, | |
| "num_input_tokens_seen": 1357488, | |
| "step": 214, | |
| "train_runtime": 936.7821, | |
| "train_tokens_per_second": 1449.097 | |
| }, | |
| { | |
| "epoch": 0.36752136752136755, | |
| "grad_norm": 0.09265032410621643, | |
| "learning_rate": 0.00016412017167381974, | |
| "loss": 0.3743, | |
| "num_input_tokens_seen": 1363552, | |
| "step": 215, | |
| "train_runtime": 940.8128, | |
| "train_tokens_per_second": 1449.334 | |
| }, | |
| { | |
| "epoch": 0.36923076923076925, | |
| "grad_norm": 0.11796024441719055, | |
| "learning_rate": 0.00016394849785407727, | |
| "loss": 0.5261, | |
| "num_input_tokens_seen": 1368296, | |
| "step": 216, | |
| "train_runtime": 943.9494, | |
| "train_tokens_per_second": 1449.544 | |
| }, | |
| { | |
| "epoch": 0.37094017094017095, | |
| "grad_norm": 0.08797245472669601, | |
| "learning_rate": 0.00016377682403433477, | |
| "loss": 0.4256, | |
| "num_input_tokens_seen": 1374640, | |
| "step": 217, | |
| "train_runtime": 947.9289, | |
| "train_tokens_per_second": 1450.151 | |
| }, | |
| { | |
| "epoch": 0.37264957264957266, | |
| "grad_norm": 0.09329722076654434, | |
| "learning_rate": 0.00016360515021459227, | |
| "loss": 0.4461, | |
| "num_input_tokens_seen": 1379760, | |
| "step": 218, | |
| "train_runtime": 951.2715, | |
| "train_tokens_per_second": 1450.438 | |
| }, | |
| { | |
| "epoch": 0.37435897435897436, | |
| "grad_norm": 0.09663166105747223, | |
| "learning_rate": 0.00016343347639484978, | |
| "loss": 0.3487, | |
| "num_input_tokens_seen": 1384368, | |
| "step": 219, | |
| "train_runtime": 954.3992, | |
| "train_tokens_per_second": 1450.513 | |
| }, | |
| { | |
| "epoch": 0.37606837606837606, | |
| "grad_norm": 0.07949472963809967, | |
| "learning_rate": 0.0001632618025751073, | |
| "loss": 0.3311, | |
| "num_input_tokens_seen": 1389488, | |
| "step": 220, | |
| "train_runtime": 957.768, | |
| "train_tokens_per_second": 1450.756 | |
| }, | |
| { | |
| "epoch": 0.37777777777777777, | |
| "grad_norm": 0.07584179192781448, | |
| "learning_rate": 0.00016309012875536483, | |
| "loss": 0.524, | |
| "num_input_tokens_seen": 1396320, | |
| "step": 221, | |
| "train_runtime": 962.0694, | |
| "train_tokens_per_second": 1451.371 | |
| }, | |
| { | |
| "epoch": 0.37948717948717947, | |
| "grad_norm": 0.08242885023355484, | |
| "learning_rate": 0.0001629184549356223, | |
| "loss": 0.4083, | |
| "num_input_tokens_seen": 1403024, | |
| "step": 222, | |
| "train_runtime": 966.312, | |
| "train_tokens_per_second": 1451.937 | |
| }, | |
| { | |
| "epoch": 0.3811965811965812, | |
| "grad_norm": 0.08721666783094406, | |
| "learning_rate": 0.00016274678111587984, | |
| "loss": 0.4642, | |
| "num_input_tokens_seen": 1413336, | |
| "step": 223, | |
| "train_runtime": 972.5941, | |
| "train_tokens_per_second": 1453.161 | |
| }, | |
| { | |
| "epoch": 0.38290598290598293, | |
| "grad_norm": 0.08998598903417587, | |
| "learning_rate": 0.00016257510729613734, | |
| "loss": 0.3536, | |
| "num_input_tokens_seen": 1418664, | |
| "step": 224, | |
| "train_runtime": 976.0647, | |
| "train_tokens_per_second": 1453.453 | |
| }, | |
| { | |
| "epoch": 0.38461538461538464, | |
| "grad_norm": 0.09844992309808731, | |
| "learning_rate": 0.00016240343347639487, | |
| "loss": 0.4508, | |
| "num_input_tokens_seen": 1424488, | |
| "step": 225, | |
| "train_runtime": 979.8777, | |
| "train_tokens_per_second": 1453.741 | |
| }, | |
| { | |
| "epoch": 0.38632478632478634, | |
| "grad_norm": 0.0743747279047966, | |
| "learning_rate": 0.00016223175965665235, | |
| "loss": 0.4139, | |
| "num_input_tokens_seen": 1430656, | |
| "step": 226, | |
| "train_runtime": 983.8135, | |
| "train_tokens_per_second": 1454.194 | |
| }, | |
| { | |
| "epoch": 0.38803418803418804, | |
| "grad_norm": 0.09330051392316818, | |
| "learning_rate": 0.00016206008583690988, | |
| "loss": 0.3968, | |
| "num_input_tokens_seen": 1436704, | |
| "step": 227, | |
| "train_runtime": 987.722, | |
| "train_tokens_per_second": 1454.563 | |
| }, | |
| { | |
| "epoch": 0.38974358974358975, | |
| "grad_norm": 0.08090078085660934, | |
| "learning_rate": 0.00016188841201716738, | |
| "loss": 0.4065, | |
| "num_input_tokens_seen": 1442192, | |
| "step": 228, | |
| "train_runtime": 991.2265, | |
| "train_tokens_per_second": 1454.957 | |
| }, | |
| { | |
| "epoch": 0.39145299145299145, | |
| "grad_norm": 0.09302696585655212, | |
| "learning_rate": 0.0001617167381974249, | |
| "loss": 0.5249, | |
| "num_input_tokens_seen": 1446968, | |
| "step": 229, | |
| "train_runtime": 994.4101, | |
| "train_tokens_per_second": 1455.102 | |
| }, | |
| { | |
| "epoch": 0.39316239316239315, | |
| "grad_norm": 0.09254134446382523, | |
| "learning_rate": 0.0001615450643776824, | |
| "loss": 0.492, | |
| "num_input_tokens_seen": 1451760, | |
| "step": 230, | |
| "train_runtime": 997.6396, | |
| "train_tokens_per_second": 1455.195 | |
| }, | |
| { | |
| "epoch": 0.39487179487179486, | |
| "grad_norm": 0.07806482911109924, | |
| "learning_rate": 0.0001613733905579399, | |
| "loss": 0.3763, | |
| "num_input_tokens_seen": 1458224, | |
| "step": 231, | |
| "train_runtime": 1001.7272, | |
| "train_tokens_per_second": 1455.71 | |
| }, | |
| { | |
| "epoch": 0.39658119658119656, | |
| "grad_norm": 0.09533582627773285, | |
| "learning_rate": 0.00016120171673819744, | |
| "loss": 0.3539, | |
| "num_input_tokens_seen": 1466568, | |
| "step": 232, | |
| "train_runtime": 1006.8859, | |
| "train_tokens_per_second": 1456.538 | |
| }, | |
| { | |
| "epoch": 0.39829059829059826, | |
| "grad_norm": 0.08084721863269806, | |
| "learning_rate": 0.00016103004291845494, | |
| "loss": 0.3963, | |
| "num_input_tokens_seen": 1471888, | |
| "step": 233, | |
| "train_runtime": 1010.3453, | |
| "train_tokens_per_second": 1456.817 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 0.11491655558347702, | |
| "learning_rate": 0.00016085836909871245, | |
| "loss": 0.5211, | |
| "num_input_tokens_seen": 1475936, | |
| "step": 234, | |
| "train_runtime": 1013.2193, | |
| "train_tokens_per_second": 1456.68 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "eval_loss": 0.40096667408943176, | |
| "eval_runtime": 39.8121, | |
| "eval_samples_per_second": 25.068, | |
| "eval_steps_per_second": 3.14, | |
| "num_input_tokens_seen": 1475936, | |
| "step": 234 | |
| }, | |
| { | |
| "epoch": 0.4017094017094017, | |
| "grad_norm": 0.09031600505113602, | |
| "learning_rate": 0.00016068669527896995, | |
| "loss": 0.3919, | |
| "num_input_tokens_seen": 1480152, | |
| "step": 235, | |
| "train_runtime": 1055.9664, | |
| "train_tokens_per_second": 1401.704 | |
| }, | |
| { | |
| "epoch": 0.40341880341880343, | |
| "grad_norm": 0.07933737337589264, | |
| "learning_rate": 0.00016051502145922748, | |
| "loss": 0.3459, | |
| "num_input_tokens_seen": 1487376, | |
| "step": 236, | |
| "train_runtime": 1060.4849, | |
| "train_tokens_per_second": 1402.543 | |
| }, | |
| { | |
| "epoch": 0.40512820512820513, | |
| "grad_norm": 0.10257117450237274, | |
| "learning_rate": 0.00016034334763948498, | |
| "loss": 0.4875, | |
| "num_input_tokens_seen": 1491480, | |
| "step": 237, | |
| "train_runtime": 1063.2453, | |
| "train_tokens_per_second": 1402.762 | |
| }, | |
| { | |
| "epoch": 0.40683760683760684, | |
| "grad_norm": 0.07746583223342896, | |
| "learning_rate": 0.00016017167381974248, | |
| "loss": 0.4194, | |
| "num_input_tokens_seen": 1498224, | |
| "step": 238, | |
| "train_runtime": 1067.6608, | |
| "train_tokens_per_second": 1403.277 | |
| }, | |
| { | |
| "epoch": 0.40854700854700854, | |
| "grad_norm": 0.08215701580047607, | |
| "learning_rate": 0.00016, | |
| "loss": 0.3321, | |
| "num_input_tokens_seen": 1505016, | |
| "step": 239, | |
| "train_runtime": 1071.959, | |
| "train_tokens_per_second": 1403.986 | |
| }, | |
| { | |
| "epoch": 0.41025641025641024, | |
| "grad_norm": 0.08626586198806763, | |
| "learning_rate": 0.00015982832618025752, | |
| "loss": 0.352, | |
| "num_input_tokens_seen": 1510872, | |
| "step": 240, | |
| "train_runtime": 1075.7766, | |
| "train_tokens_per_second": 1404.448 | |
| }, | |
| { | |
| "epoch": 0.41196581196581195, | |
| "grad_norm": 0.07768667489290237, | |
| "learning_rate": 0.00015965665236051504, | |
| "loss": 0.3635, | |
| "num_input_tokens_seen": 1518680, | |
| "step": 241, | |
| "train_runtime": 1083.0754, | |
| "train_tokens_per_second": 1402.192 | |
| }, | |
| { | |
| "epoch": 0.41367521367521365, | |
| "grad_norm": 0.09436383098363876, | |
| "learning_rate": 0.00015948497854077255, | |
| "loss": 0.3873, | |
| "num_input_tokens_seen": 1523408, | |
| "step": 242, | |
| "train_runtime": 1086.2718, | |
| "train_tokens_per_second": 1402.419 | |
| }, | |
| { | |
| "epoch": 0.4153846153846154, | |
| "grad_norm": 0.10022980719804764, | |
| "learning_rate": 0.00015931330472103005, | |
| "loss": 0.4982, | |
| "num_input_tokens_seen": 1527088, | |
| "step": 243, | |
| "train_runtime": 1088.8585, | |
| "train_tokens_per_second": 1402.467 | |
| }, | |
| { | |
| "epoch": 0.4170940170940171, | |
| "grad_norm": 0.07399852573871613, | |
| "learning_rate": 0.00015914163090128755, | |
| "loss": 0.428, | |
| "num_input_tokens_seen": 1537712, | |
| "step": 244, | |
| "train_runtime": 1095.1717, | |
| "train_tokens_per_second": 1404.083 | |
| }, | |
| { | |
| "epoch": 0.4188034188034188, | |
| "grad_norm": 0.09640722721815109, | |
| "learning_rate": 0.00015896995708154508, | |
| "loss": 0.4273, | |
| "num_input_tokens_seen": 1544256, | |
| "step": 245, | |
| "train_runtime": 1099.4433, | |
| "train_tokens_per_second": 1404.58 | |
| }, | |
| { | |
| "epoch": 0.4205128205128205, | |
| "grad_norm": 0.08752251416444778, | |
| "learning_rate": 0.00015879828326180258, | |
| "loss": 0.3741, | |
| "num_input_tokens_seen": 1549216, | |
| "step": 246, | |
| "train_runtime": 1102.808, | |
| "train_tokens_per_second": 1404.792 | |
| }, | |
| { | |
| "epoch": 0.4222222222222222, | |
| "grad_norm": 0.09055118262767792, | |
| "learning_rate": 0.00015862660944206009, | |
| "loss": 0.3215, | |
| "num_input_tokens_seen": 1553936, | |
| "step": 247, | |
| "train_runtime": 1106.0798, | |
| "train_tokens_per_second": 1404.904 | |
| }, | |
| { | |
| "epoch": 0.4239316239316239, | |
| "grad_norm": 0.09065423905849457, | |
| "learning_rate": 0.00015845493562231762, | |
| "loss": 0.3577, | |
| "num_input_tokens_seen": 1559952, | |
| "step": 248, | |
| "train_runtime": 1110.0108, | |
| "train_tokens_per_second": 1405.349 | |
| }, | |
| { | |
| "epoch": 0.4256410256410256, | |
| "grad_norm": 0.07726360857486725, | |
| "learning_rate": 0.00015828326180257512, | |
| "loss": 0.3056, | |
| "num_input_tokens_seen": 1565544, | |
| "step": 249, | |
| "train_runtime": 1113.7626, | |
| "train_tokens_per_second": 1405.635 | |
| }, | |
| { | |
| "epoch": 0.42735042735042733, | |
| "grad_norm": 0.11181222647428513, | |
| "learning_rate": 0.00015811158798283262, | |
| "loss": 0.4, | |
| "num_input_tokens_seen": 1570120, | |
| "step": 250, | |
| "train_runtime": 1116.8239, | |
| "train_tokens_per_second": 1405.88 | |
| }, | |
| { | |
| "epoch": 0.42905982905982903, | |
| "grad_norm": 0.09931083768606186, | |
| "learning_rate": 0.00015793991416309012, | |
| "loss": 0.4628, | |
| "num_input_tokens_seen": 1576664, | |
| "step": 251, | |
| "train_runtime": 1120.9296, | |
| "train_tokens_per_second": 1406.568 | |
| }, | |
| { | |
| "epoch": 0.4307692307692308, | |
| "grad_norm": 0.1047554761171341, | |
| "learning_rate": 0.00015776824034334765, | |
| "loss": 0.5433, | |
| "num_input_tokens_seen": 1580232, | |
| "step": 252, | |
| "train_runtime": 1123.4358, | |
| "train_tokens_per_second": 1406.606 | |
| }, | |
| { | |
| "epoch": 0.4324786324786325, | |
| "grad_norm": 0.09181802719831467, | |
| "learning_rate": 0.00015759656652360515, | |
| "loss": 0.5485, | |
| "num_input_tokens_seen": 1587000, | |
| "step": 253, | |
| "train_runtime": 1127.7713, | |
| "train_tokens_per_second": 1407.2 | |
| }, | |
| { | |
| "epoch": 0.4341880341880342, | |
| "grad_norm": 0.08955714106559753, | |
| "learning_rate": 0.00015742489270386266, | |
| "loss": 0.3696, | |
| "num_input_tokens_seen": 1592184, | |
| "step": 254, | |
| "train_runtime": 1131.1496, | |
| "train_tokens_per_second": 1407.58 | |
| }, | |
| { | |
| "epoch": 0.4358974358974359, | |
| "grad_norm": 0.08395666629076004, | |
| "learning_rate": 0.00015725321888412016, | |
| "loss": 0.3811, | |
| "num_input_tokens_seen": 1597400, | |
| "step": 255, | |
| "train_runtime": 1134.6396, | |
| "train_tokens_per_second": 1407.848 | |
| }, | |
| { | |
| "epoch": 0.4376068376068376, | |
| "grad_norm": 0.08952012658119202, | |
| "learning_rate": 0.0001570815450643777, | |
| "loss": 0.5207, | |
| "num_input_tokens_seen": 1603560, | |
| "step": 256, | |
| "train_runtime": 1138.5956, | |
| "train_tokens_per_second": 1408.367 | |
| }, | |
| { | |
| "epoch": 0.4393162393162393, | |
| "grad_norm": 0.07518703490495682, | |
| "learning_rate": 0.00015690987124463522, | |
| "loss": 0.341, | |
| "num_input_tokens_seen": 1609952, | |
| "step": 257, | |
| "train_runtime": 1142.6858, | |
| "train_tokens_per_second": 1408.919 | |
| }, | |
| { | |
| "epoch": 0.441025641025641, | |
| "grad_norm": 0.08981534093618393, | |
| "learning_rate": 0.00015673819742489272, | |
| "loss": 0.3535, | |
| "num_input_tokens_seen": 1614952, | |
| "step": 258, | |
| "train_runtime": 1146.1364, | |
| "train_tokens_per_second": 1409.04 | |
| }, | |
| { | |
| "epoch": 0.4427350427350427, | |
| "grad_norm": 0.09569933265447617, | |
| "learning_rate": 0.00015656652360515022, | |
| "loss": 0.4656, | |
| "num_input_tokens_seen": 1621848, | |
| "step": 259, | |
| "train_runtime": 1150.5402, | |
| "train_tokens_per_second": 1409.64 | |
| }, | |
| { | |
| "epoch": 0.4444444444444444, | |
| "grad_norm": 0.0871426984667778, | |
| "learning_rate": 0.00015639484978540773, | |
| "loss": 0.3592, | |
| "num_input_tokens_seen": 1629144, | |
| "step": 260, | |
| "train_runtime": 1155.1465, | |
| "train_tokens_per_second": 1410.335 | |
| }, | |
| { | |
| "epoch": 0.4461538461538462, | |
| "grad_norm": 0.07977623492479324, | |
| "learning_rate": 0.00015622317596566525, | |
| "loss": 0.4316, | |
| "num_input_tokens_seen": 1635464, | |
| "step": 261, | |
| "train_runtime": 1159.1609, | |
| "train_tokens_per_second": 1410.903 | |
| }, | |
| { | |
| "epoch": 0.4478632478632479, | |
| "grad_norm": 0.10125043988227844, | |
| "learning_rate": 0.00015605150214592276, | |
| "loss": 0.3631, | |
| "num_input_tokens_seen": 1640440, | |
| "step": 262, | |
| "train_runtime": 1162.4822, | |
| "train_tokens_per_second": 1411.153 | |
| }, | |
| { | |
| "epoch": 0.4495726495726496, | |
| "grad_norm": 0.0801963284611702, | |
| "learning_rate": 0.00015587982832618026, | |
| "loss": 0.3788, | |
| "num_input_tokens_seen": 1647488, | |
| "step": 263, | |
| "train_runtime": 1167.0278, | |
| "train_tokens_per_second": 1411.696 | |
| }, | |
| { | |
| "epoch": 0.4512820512820513, | |
| "grad_norm": 0.07716058194637299, | |
| "learning_rate": 0.0001557081545064378, | |
| "loss": 0.4523, | |
| "num_input_tokens_seen": 1653720, | |
| "step": 264, | |
| "train_runtime": 1170.999, | |
| "train_tokens_per_second": 1412.23 | |
| }, | |
| { | |
| "epoch": 0.452991452991453, | |
| "grad_norm": 0.07113456726074219, | |
| "learning_rate": 0.0001555364806866953, | |
| "loss": 0.4483, | |
| "num_input_tokens_seen": 1662984, | |
| "step": 265, | |
| "train_runtime": 1176.6605, | |
| "train_tokens_per_second": 1413.308 | |
| }, | |
| { | |
| "epoch": 0.4547008547008547, | |
| "grad_norm": 0.08501028269529343, | |
| "learning_rate": 0.0001553648068669528, | |
| "loss": 0.3744, | |
| "num_input_tokens_seen": 1669240, | |
| "step": 266, | |
| "train_runtime": 1180.5615, | |
| "train_tokens_per_second": 1413.937 | |
| }, | |
| { | |
| "epoch": 0.4564102564102564, | |
| "grad_norm": 0.12146402895450592, | |
| "learning_rate": 0.0001551931330472103, | |
| "loss": 0.5228, | |
| "num_input_tokens_seen": 1674392, | |
| "step": 267, | |
| "train_runtime": 1183.9915, | |
| "train_tokens_per_second": 1414.193 | |
| }, | |
| { | |
| "epoch": 0.4581196581196581, | |
| "grad_norm": 0.08500533550977707, | |
| "learning_rate": 0.00015502145922746783, | |
| "loss": 0.4029, | |
| "num_input_tokens_seen": 1680704, | |
| "step": 268, | |
| "train_runtime": 1188.0637, | |
| "train_tokens_per_second": 1414.658 | |
| }, | |
| { | |
| "epoch": 0.4598290598290598, | |
| "grad_norm": 0.08828039467334747, | |
| "learning_rate": 0.00015484978540772533, | |
| "loss": 0.3817, | |
| "num_input_tokens_seen": 1688032, | |
| "step": 269, | |
| "train_runtime": 1192.6736, | |
| "train_tokens_per_second": 1415.334 | |
| }, | |
| { | |
| "epoch": 0.46153846153846156, | |
| "grad_norm": 0.09044201672077179, | |
| "learning_rate": 0.00015467811158798283, | |
| "loss": 0.2898, | |
| "num_input_tokens_seen": 1695632, | |
| "step": 270, | |
| "train_runtime": 1197.4796, | |
| "train_tokens_per_second": 1416.001 | |
| }, | |
| { | |
| "epoch": 0.46324786324786327, | |
| "grad_norm": 0.08178558945655823, | |
| "learning_rate": 0.00015450643776824033, | |
| "loss": 0.3721, | |
| "num_input_tokens_seen": 1701256, | |
| "step": 271, | |
| "train_runtime": 1203.6359, | |
| "train_tokens_per_second": 1413.431 | |
| }, | |
| { | |
| "epoch": 0.46495726495726497, | |
| "grad_norm": 0.08540398627519608, | |
| "learning_rate": 0.00015433476394849786, | |
| "loss": 0.4181, | |
| "num_input_tokens_seen": 1706352, | |
| "step": 272, | |
| "train_runtime": 1206.9569, | |
| "train_tokens_per_second": 1413.764 | |
| }, | |
| { | |
| "epoch": 0.4666666666666667, | |
| "grad_norm": 0.08019081503152847, | |
| "learning_rate": 0.0001541630901287554, | |
| "loss": 0.3428, | |
| "num_input_tokens_seen": 1711728, | |
| "step": 273, | |
| "train_runtime": 1210.514, | |
| "train_tokens_per_second": 1414.051 | |
| }, | |
| { | |
| "epoch": 0.4683760683760684, | |
| "grad_norm": 0.09295406192541122, | |
| "learning_rate": 0.0001539914163090129, | |
| "loss": 0.4543, | |
| "num_input_tokens_seen": 1716512, | |
| "step": 274, | |
| "train_runtime": 1213.6938, | |
| "train_tokens_per_second": 1414.287 | |
| }, | |
| { | |
| "epoch": 0.4700854700854701, | |
| "grad_norm": 0.07860468327999115, | |
| "learning_rate": 0.0001538197424892704, | |
| "loss": 0.4592, | |
| "num_input_tokens_seen": 1722200, | |
| "step": 275, | |
| "train_runtime": 1217.3819, | |
| "train_tokens_per_second": 1414.675 | |
| }, | |
| { | |
| "epoch": 0.4717948717948718, | |
| "grad_norm": 0.08995640277862549, | |
| "learning_rate": 0.0001536480686695279, | |
| "loss": 0.3845, | |
| "num_input_tokens_seen": 1726088, | |
| "step": 276, | |
| "train_runtime": 1220.143, | |
| "train_tokens_per_second": 1414.66 | |
| }, | |
| { | |
| "epoch": 0.4735042735042735, | |
| "grad_norm": 0.08785276114940643, | |
| "learning_rate": 0.00015347639484978543, | |
| "loss": 0.4225, | |
| "num_input_tokens_seen": 1733392, | |
| "step": 277, | |
| "train_runtime": 1224.7221, | |
| "train_tokens_per_second": 1415.335 | |
| }, | |
| { | |
| "epoch": 0.4752136752136752, | |
| "grad_norm": 0.0918450802564621, | |
| "learning_rate": 0.00015330472103004293, | |
| "loss": 0.4922, | |
| "num_input_tokens_seen": 1739624, | |
| "step": 278, | |
| "train_runtime": 1228.6485, | |
| "train_tokens_per_second": 1415.884 | |
| }, | |
| { | |
| "epoch": 0.47692307692307695, | |
| "grad_norm": 0.07409488409757614, | |
| "learning_rate": 0.00015313304721030043, | |
| "loss": 0.3089, | |
| "num_input_tokens_seen": 1745512, | |
| "step": 279, | |
| "train_runtime": 1232.4839, | |
| "train_tokens_per_second": 1416.255 | |
| }, | |
| { | |
| "epoch": 0.47863247863247865, | |
| "grad_norm": 0.08338349312543869, | |
| "learning_rate": 0.00015296137339055794, | |
| "loss": 0.3837, | |
| "num_input_tokens_seen": 1751352, | |
| "step": 280, | |
| "train_runtime": 1236.2127, | |
| "train_tokens_per_second": 1416.708 | |
| }, | |
| { | |
| "epoch": 0.48034188034188036, | |
| "grad_norm": 0.08887634426355362, | |
| "learning_rate": 0.00015278969957081546, | |
| "loss": 0.4143, | |
| "num_input_tokens_seen": 1757360, | |
| "step": 281, | |
| "train_runtime": 1240.1646, | |
| "train_tokens_per_second": 1417.038 | |
| }, | |
| { | |
| "epoch": 0.48205128205128206, | |
| "grad_norm": 0.08524525165557861, | |
| "learning_rate": 0.00015261802575107297, | |
| "loss": 0.4217, | |
| "num_input_tokens_seen": 1762880, | |
| "step": 282, | |
| "train_runtime": 1243.7701, | |
| "train_tokens_per_second": 1417.368 | |
| }, | |
| { | |
| "epoch": 0.48376068376068376, | |
| "grad_norm": 0.08796384930610657, | |
| "learning_rate": 0.00015244635193133047, | |
| "loss": 0.5087, | |
| "num_input_tokens_seen": 1768064, | |
| "step": 283, | |
| "train_runtime": 1247.2163, | |
| "train_tokens_per_second": 1417.608 | |
| }, | |
| { | |
| "epoch": 0.48547008547008547, | |
| "grad_norm": 0.08289546519517899, | |
| "learning_rate": 0.000152274678111588, | |
| "loss": 0.3867, | |
| "num_input_tokens_seen": 1774344, | |
| "step": 284, | |
| "train_runtime": 1251.4095, | |
| "train_tokens_per_second": 1417.876 | |
| }, | |
| { | |
| "epoch": 0.48717948717948717, | |
| "grad_norm": 0.09948357194662094, | |
| "learning_rate": 0.0001521030042918455, | |
| "loss": 0.4324, | |
| "num_input_tokens_seen": 1779720, | |
| "step": 285, | |
| "train_runtime": 1255.0103, | |
| "train_tokens_per_second": 1418.092 | |
| }, | |
| { | |
| "epoch": 0.4888888888888889, | |
| "grad_norm": 0.08023009449243546, | |
| "learning_rate": 0.000151931330472103, | |
| "loss": 0.2635, | |
| "num_input_tokens_seen": 1789384, | |
| "step": 286, | |
| "train_runtime": 1260.9634, | |
| "train_tokens_per_second": 1419.061 | |
| }, | |
| { | |
| "epoch": 0.4905982905982906, | |
| "grad_norm": 0.08087978512048721, | |
| "learning_rate": 0.0001517596566523605, | |
| "loss": 0.3492, | |
| "num_input_tokens_seen": 1794880, | |
| "step": 287, | |
| "train_runtime": 1264.6081, | |
| "train_tokens_per_second": 1419.317 | |
| }, | |
| { | |
| "epoch": 0.49230769230769234, | |
| "grad_norm": 0.07231873273849487, | |
| "learning_rate": 0.00015158798283261804, | |
| "loss": 0.3468, | |
| "num_input_tokens_seen": 1800104, | |
| "step": 288, | |
| "train_runtime": 1268.0921, | |
| "train_tokens_per_second": 1419.537 | |
| }, | |
| { | |
| "epoch": 0.49401709401709404, | |
| "grad_norm": 0.07424788177013397, | |
| "learning_rate": 0.00015141630901287554, | |
| "loss": 0.3704, | |
| "num_input_tokens_seen": 1805928, | |
| "step": 289, | |
| "train_runtime": 1271.8437, | |
| "train_tokens_per_second": 1419.929 | |
| }, | |
| { | |
| "epoch": 0.49572649572649574, | |
| "grad_norm": 0.09837713837623596, | |
| "learning_rate": 0.00015124463519313307, | |
| "loss": 0.45, | |
| "num_input_tokens_seen": 1810824, | |
| "step": 290, | |
| "train_runtime": 1275.0248, | |
| "train_tokens_per_second": 1420.227 | |
| }, | |
| { | |
| "epoch": 0.49743589743589745, | |
| "grad_norm": 0.08725966513156891, | |
| "learning_rate": 0.00015107296137339057, | |
| "loss": 0.4393, | |
| "num_input_tokens_seen": 1815928, | |
| "step": 291, | |
| "train_runtime": 1278.4107, | |
| "train_tokens_per_second": 1420.457 | |
| }, | |
| { | |
| "epoch": 0.49914529914529915, | |
| "grad_norm": 0.08219818770885468, | |
| "learning_rate": 0.00015090128755364807, | |
| "loss": 0.4083, | |
| "num_input_tokens_seen": 1822272, | |
| "step": 292, | |
| "train_runtime": 1282.5809, | |
| "train_tokens_per_second": 1420.785 | |
| }, | |
| { | |
| "epoch": 0.5008547008547009, | |
| "grad_norm": 0.08088050782680511, | |
| "learning_rate": 0.0001507296137339056, | |
| "loss": 0.3627, | |
| "num_input_tokens_seen": 1828008, | |
| "step": 293, | |
| "train_runtime": 1286.3907, | |
| "train_tokens_per_second": 1421.036 | |
| }, | |
| { | |
| "epoch": 0.5025641025641026, | |
| "grad_norm": 0.07896595448255539, | |
| "learning_rate": 0.0001505579399141631, | |
| "loss": 0.3942, | |
| "num_input_tokens_seen": 1836360, | |
| "step": 294, | |
| "train_runtime": 1291.5001, | |
| "train_tokens_per_second": 1421.881 | |
| }, | |
| { | |
| "epoch": 0.5042735042735043, | |
| "grad_norm": 0.09844955801963806, | |
| "learning_rate": 0.0001503862660944206, | |
| "loss": 0.4604, | |
| "num_input_tokens_seen": 1843848, | |
| "step": 295, | |
| "train_runtime": 1296.2401, | |
| "train_tokens_per_second": 1422.459 | |
| }, | |
| { | |
| "epoch": 0.505982905982906, | |
| "grad_norm": 0.07079170644283295, | |
| "learning_rate": 0.0001502145922746781, | |
| "loss": 0.2805, | |
| "num_input_tokens_seen": 1851360, | |
| "step": 296, | |
| "train_runtime": 1300.9484, | |
| "train_tokens_per_second": 1423.085 | |
| }, | |
| { | |
| "epoch": 0.5076923076923077, | |
| "grad_norm": 0.09218448400497437, | |
| "learning_rate": 0.00015004291845493564, | |
| "loss": 0.3511, | |
| "num_input_tokens_seen": 1855936, | |
| "step": 297, | |
| "train_runtime": 1304.0647, | |
| "train_tokens_per_second": 1423.193 | |
| }, | |
| { | |
| "epoch": 0.5094017094017094, | |
| "grad_norm": 0.09190265834331512, | |
| "learning_rate": 0.00014987124463519314, | |
| "loss": 0.3471, | |
| "num_input_tokens_seen": 1863072, | |
| "step": 298, | |
| "train_runtime": 1308.6096, | |
| "train_tokens_per_second": 1423.703 | |
| }, | |
| { | |
| "epoch": 0.5111111111111111, | |
| "grad_norm": 0.09502872824668884, | |
| "learning_rate": 0.00014969957081545064, | |
| "loss": 0.4892, | |
| "num_input_tokens_seen": 1869608, | |
| "step": 299, | |
| "train_runtime": 1312.7245, | |
| "train_tokens_per_second": 1424.22 | |
| }, | |
| { | |
| "epoch": 0.5128205128205128, | |
| "grad_norm": 0.10176997631788254, | |
| "learning_rate": 0.00014952789699570817, | |
| "loss": 0.4568, | |
| "num_input_tokens_seen": 1875904, | |
| "step": 300, | |
| "train_runtime": 1316.7069, | |
| "train_tokens_per_second": 1424.694 | |
| }, | |
| { | |
| "epoch": 0.5145299145299145, | |
| "grad_norm": 0.10159771889448166, | |
| "learning_rate": 0.00014935622317596567, | |
| "loss": 0.3938, | |
| "num_input_tokens_seen": 1880448, | |
| "step": 301, | |
| "train_runtime": 1321.8403, | |
| "train_tokens_per_second": 1422.599 | |
| }, | |
| { | |
| "epoch": 0.5162393162393163, | |
| "grad_norm": 0.07759668678045273, | |
| "learning_rate": 0.0001491845493562232, | |
| "loss": 0.4137, | |
| "num_input_tokens_seen": 1888856, | |
| "step": 302, | |
| "train_runtime": 1327.1569, | |
| "train_tokens_per_second": 1423.235 | |
| }, | |
| { | |
| "epoch": 0.517948717948718, | |
| "grad_norm": 0.06867683678865433, | |
| "learning_rate": 0.00014901287553648068, | |
| "loss": 0.3298, | |
| "num_input_tokens_seen": 1895272, | |
| "step": 303, | |
| "train_runtime": 1331.3216, | |
| "train_tokens_per_second": 1423.602 | |
| }, | |
| { | |
| "epoch": 0.5196581196581197, | |
| "grad_norm": 0.09469713270664215, | |
| "learning_rate": 0.0001488412017167382, | |
| "loss": 0.3788, | |
| "num_input_tokens_seen": 1901800, | |
| "step": 304, | |
| "train_runtime": 1335.4905, | |
| "train_tokens_per_second": 1424.046 | |
| }, | |
| { | |
| "epoch": 0.5213675213675214, | |
| "grad_norm": 0.07816332578659058, | |
| "learning_rate": 0.0001486695278969957, | |
| "loss": 0.428, | |
| "num_input_tokens_seen": 1908632, | |
| "step": 305, | |
| "train_runtime": 1339.8213, | |
| "train_tokens_per_second": 1424.542 | |
| }, | |
| { | |
| "epoch": 0.5230769230769231, | |
| "grad_norm": 0.08694681525230408, | |
| "learning_rate": 0.00014849785407725324, | |
| "loss": 0.3145, | |
| "num_input_tokens_seen": 1913720, | |
| "step": 306, | |
| "train_runtime": 1343.2127, | |
| "train_tokens_per_second": 1424.733 | |
| }, | |
| { | |
| "epoch": 0.5247863247863248, | |
| "grad_norm": 0.053747374564409256, | |
| "learning_rate": 0.00014832618025751072, | |
| "loss": 0.3026, | |
| "num_input_tokens_seen": 1927400, | |
| "step": 307, | |
| "train_runtime": 1351.386, | |
| "train_tokens_per_second": 1426.239 | |
| }, | |
| { | |
| "epoch": 0.5264957264957265, | |
| "grad_norm": 0.09011126309633255, | |
| "learning_rate": 0.00014815450643776825, | |
| "loss": 0.3607, | |
| "num_input_tokens_seen": 1933544, | |
| "step": 308, | |
| "train_runtime": 1355.3093, | |
| "train_tokens_per_second": 1426.644 | |
| }, | |
| { | |
| "epoch": 0.5282051282051282, | |
| "grad_norm": 0.08776524662971497, | |
| "learning_rate": 0.00014798283261802578, | |
| "loss": 0.4278, | |
| "num_input_tokens_seen": 1938896, | |
| "step": 309, | |
| "train_runtime": 1358.8461, | |
| "train_tokens_per_second": 1426.869 | |
| }, | |
| { | |
| "epoch": 0.5299145299145299, | |
| "grad_norm": 0.10794860124588013, | |
| "learning_rate": 0.00014781115879828328, | |
| "loss": 0.5204, | |
| "num_input_tokens_seen": 1945288, | |
| "step": 310, | |
| "train_runtime": 1363.0326, | |
| "train_tokens_per_second": 1427.176 | |
| }, | |
| { | |
| "epoch": 0.5316239316239316, | |
| "grad_norm": 0.08652819693088531, | |
| "learning_rate": 0.00014763948497854078, | |
| "loss": 0.3907, | |
| "num_input_tokens_seen": 1951448, | |
| "step": 311, | |
| "train_runtime": 1366.9784, | |
| "train_tokens_per_second": 1427.563 | |
| }, | |
| { | |
| "epoch": 0.5333333333333333, | |
| "grad_norm": 0.10126706957817078, | |
| "learning_rate": 0.00014746781115879828, | |
| "loss": 0.4945, | |
| "num_input_tokens_seen": 1956456, | |
| "step": 312, | |
| "train_runtime": 1370.372, | |
| "train_tokens_per_second": 1427.682 | |
| }, | |
| { | |
| "epoch": 0.535042735042735, | |
| "grad_norm": 0.10532712191343307, | |
| "learning_rate": 0.0001472961373390558, | |
| "loss": 0.4276, | |
| "num_input_tokens_seen": 1961216, | |
| "step": 313, | |
| "train_runtime": 1373.4969, | |
| "train_tokens_per_second": 1427.9 | |
| }, | |
| { | |
| "epoch": 0.5367521367521367, | |
| "grad_norm": 0.09144797176122665, | |
| "learning_rate": 0.00014712446351931331, | |
| "loss": 0.4097, | |
| "num_input_tokens_seen": 1967176, | |
| "step": 314, | |
| "train_runtime": 1377.3529, | |
| "train_tokens_per_second": 1428.229 | |
| }, | |
| { | |
| "epoch": 0.5384615384615384, | |
| "grad_norm": 0.07700413465499878, | |
| "learning_rate": 0.00014695278969957082, | |
| "loss": 0.5064, | |
| "num_input_tokens_seen": 1973824, | |
| "step": 315, | |
| "train_runtime": 1381.6847, | |
| "train_tokens_per_second": 1428.563 | |
| }, | |
| { | |
| "epoch": 0.5401709401709401, | |
| "grad_norm": 0.10635288059711456, | |
| "learning_rate": 0.00014678111587982832, | |
| "loss": 0.464, | |
| "num_input_tokens_seen": 1978280, | |
| "step": 316, | |
| "train_runtime": 1384.7125, | |
| "train_tokens_per_second": 1428.658 | |
| }, | |
| { | |
| "epoch": 0.5418803418803418, | |
| "grad_norm": 0.1100783571600914, | |
| "learning_rate": 0.00014660944206008585, | |
| "loss": 0.4738, | |
| "num_input_tokens_seen": 1984584, | |
| "step": 317, | |
| "train_runtime": 1388.7531, | |
| "train_tokens_per_second": 1429.04 | |
| }, | |
| { | |
| "epoch": 0.5435897435897435, | |
| "grad_norm": 0.09916520863771439, | |
| "learning_rate": 0.00014643776824034338, | |
| "loss": 0.4941, | |
| "num_input_tokens_seen": 1990456, | |
| "step": 318, | |
| "train_runtime": 1392.6048, | |
| "train_tokens_per_second": 1429.304 | |
| }, | |
| { | |
| "epoch": 0.5452991452991452, | |
| "grad_norm": 0.11754505336284637, | |
| "learning_rate": 0.00014626609442060085, | |
| "loss": 0.4537, | |
| "num_input_tokens_seen": 1996424, | |
| "step": 319, | |
| "train_runtime": 1396.5367, | |
| "train_tokens_per_second": 1429.554 | |
| }, | |
| { | |
| "epoch": 0.5470085470085471, | |
| "grad_norm": 0.09356576949357986, | |
| "learning_rate": 0.00014609442060085838, | |
| "loss": 0.3945, | |
| "num_input_tokens_seen": 2002712, | |
| "step": 320, | |
| "train_runtime": 1400.5323, | |
| "train_tokens_per_second": 1429.965 | |
| }, | |
| { | |
| "epoch": 0.5487179487179488, | |
| "grad_norm": 0.08926735818386078, | |
| "learning_rate": 0.00014592274678111588, | |
| "loss": 0.34, | |
| "num_input_tokens_seen": 2010392, | |
| "step": 321, | |
| "train_runtime": 1405.3404, | |
| "train_tokens_per_second": 1430.537 | |
| }, | |
| { | |
| "epoch": 0.5504273504273505, | |
| "grad_norm": 0.0716586783528328, | |
| "learning_rate": 0.00014575107296137341, | |
| "loss": 0.3498, | |
| "num_input_tokens_seen": 2018112, | |
| "step": 322, | |
| "train_runtime": 1410.1769, | |
| "train_tokens_per_second": 1431.106 | |
| }, | |
| { | |
| "epoch": 0.5521367521367522, | |
| "grad_norm": 0.08030697703361511, | |
| "learning_rate": 0.0001455793991416309, | |
| "loss": 0.4488, | |
| "num_input_tokens_seen": 2024360, | |
| "step": 323, | |
| "train_runtime": 1414.2132, | |
| "train_tokens_per_second": 1431.439 | |
| }, | |
| { | |
| "epoch": 0.5538461538461539, | |
| "grad_norm": 0.08266004920005798, | |
| "learning_rate": 0.00014540772532188842, | |
| "loss": 0.3271, | |
| "num_input_tokens_seen": 2029784, | |
| "step": 324, | |
| "train_runtime": 1417.8782, | |
| "train_tokens_per_second": 1431.564 | |
| }, | |
| { | |
| "epoch": 0.5555555555555556, | |
| "grad_norm": 0.0910225510597229, | |
| "learning_rate": 0.00014523605150214592, | |
| "loss": 0.3246, | |
| "num_input_tokens_seen": 2035024, | |
| "step": 325, | |
| "train_runtime": 1421.4156, | |
| "train_tokens_per_second": 1431.688 | |
| }, | |
| { | |
| "epoch": 0.5572649572649573, | |
| "grad_norm": 0.10865269601345062, | |
| "learning_rate": 0.00014506437768240345, | |
| "loss": 0.4211, | |
| "num_input_tokens_seen": 2039312, | |
| "step": 326, | |
| "train_runtime": 1424.3146, | |
| "train_tokens_per_second": 1431.785 | |
| }, | |
| { | |
| "epoch": 0.558974358974359, | |
| "grad_norm": 0.0958554595708847, | |
| "learning_rate": 0.00014489270386266095, | |
| "loss": 0.4778, | |
| "num_input_tokens_seen": 2046432, | |
| "step": 327, | |
| "train_runtime": 1428.8104, | |
| "train_tokens_per_second": 1432.263 | |
| }, | |
| { | |
| "epoch": 0.5606837606837607, | |
| "grad_norm": 0.09468738734722137, | |
| "learning_rate": 0.00014472103004291846, | |
| "loss": 0.4299, | |
| "num_input_tokens_seen": 2051776, | |
| "step": 328, | |
| "train_runtime": 1432.395, | |
| "train_tokens_per_second": 1432.409 | |
| }, | |
| { | |
| "epoch": 0.5623931623931624, | |
| "grad_norm": 0.06919053196907043, | |
| "learning_rate": 0.00014454935622317599, | |
| "loss": 0.3952, | |
| "num_input_tokens_seen": 2057712, | |
| "step": 329, | |
| "train_runtime": 1436.3095, | |
| "train_tokens_per_second": 1432.638 | |
| }, | |
| { | |
| "epoch": 0.5641025641025641, | |
| "grad_norm": 0.08503609895706177, | |
| "learning_rate": 0.0001443776824034335, | |
| "loss": 0.49, | |
| "num_input_tokens_seen": 2061968, | |
| "step": 330, | |
| "train_runtime": 1439.2203, | |
| "train_tokens_per_second": 1432.698 | |
| }, | |
| { | |
| "epoch": 0.5658119658119658, | |
| "grad_norm": 0.08844102919101715, | |
| "learning_rate": 0.000144206008583691, | |
| "loss": 0.4348, | |
| "num_input_tokens_seen": 2067504, | |
| "step": 331, | |
| "train_runtime": 1444.8321, | |
| "train_tokens_per_second": 1430.965 | |
| }, | |
| { | |
| "epoch": 0.5675213675213675, | |
| "grad_norm": 0.08457052707672119, | |
| "learning_rate": 0.0001440343347639485, | |
| "loss": 0.4158, | |
| "num_input_tokens_seen": 2072688, | |
| "step": 332, | |
| "train_runtime": 1448.2405, | |
| "train_tokens_per_second": 1431.177 | |
| }, | |
| { | |
| "epoch": 0.5692307692307692, | |
| "grad_norm": 0.08367235213518143, | |
| "learning_rate": 0.00014386266094420602, | |
| "loss": 0.331, | |
| "num_input_tokens_seen": 2077200, | |
| "step": 333, | |
| "train_runtime": 1451.3343, | |
| "train_tokens_per_second": 1431.235 | |
| }, | |
| { | |
| "epoch": 0.5709401709401709, | |
| "grad_norm": 0.09541928768157959, | |
| "learning_rate": 0.00014369098712446352, | |
| "loss": 0.3559, | |
| "num_input_tokens_seen": 2081992, | |
| "step": 334, | |
| "train_runtime": 1454.5461, | |
| "train_tokens_per_second": 1431.369 | |
| }, | |
| { | |
| "epoch": 0.5726495726495726, | |
| "grad_norm": 0.08940909057855606, | |
| "learning_rate": 0.00014351931330472103, | |
| "loss": 0.3756, | |
| "num_input_tokens_seen": 2087928, | |
| "step": 335, | |
| "train_runtime": 1458.4391, | |
| "train_tokens_per_second": 1431.618 | |
| }, | |
| { | |
| "epoch": 0.5743589743589743, | |
| "grad_norm": 0.07144365459680557, | |
| "learning_rate": 0.00014334763948497856, | |
| "loss": 0.3767, | |
| "num_input_tokens_seen": 2096776, | |
| "step": 336, | |
| "train_runtime": 1463.9741, | |
| "train_tokens_per_second": 1432.249 | |
| }, | |
| { | |
| "epoch": 0.576068376068376, | |
| "grad_norm": 0.1072118952870369, | |
| "learning_rate": 0.00014317596566523606, | |
| "loss": 0.4711, | |
| "num_input_tokens_seen": 2100736, | |
| "step": 337, | |
| "train_runtime": 1466.8178, | |
| "train_tokens_per_second": 1432.172 | |
| }, | |
| { | |
| "epoch": 0.5777777777777777, | |
| "grad_norm": 0.09300663322210312, | |
| "learning_rate": 0.0001430042918454936, | |
| "loss": 0.3452, | |
| "num_input_tokens_seen": 2107160, | |
| "step": 338, | |
| "train_runtime": 1471.0439, | |
| "train_tokens_per_second": 1432.425 | |
| }, | |
| { | |
| "epoch": 0.5794871794871795, | |
| "grad_norm": 0.07325253635644913, | |
| "learning_rate": 0.00014283261802575106, | |
| "loss": 0.4553, | |
| "num_input_tokens_seen": 2113784, | |
| "step": 339, | |
| "train_runtime": 1475.4308, | |
| "train_tokens_per_second": 1432.655 | |
| }, | |
| { | |
| "epoch": 0.5811965811965812, | |
| "grad_norm": 0.07705891877412796, | |
| "learning_rate": 0.0001426609442060086, | |
| "loss": 0.3485, | |
| "num_input_tokens_seen": 2120384, | |
| "step": 340, | |
| "train_runtime": 1479.6085, | |
| "train_tokens_per_second": 1433.071 | |
| }, | |
| { | |
| "epoch": 0.582905982905983, | |
| "grad_norm": 0.08625199645757675, | |
| "learning_rate": 0.0001424892703862661, | |
| "loss": 0.4506, | |
| "num_input_tokens_seen": 2126768, | |
| "step": 341, | |
| "train_runtime": 1483.7964, | |
| "train_tokens_per_second": 1433.329 | |
| }, | |
| { | |
| "epoch": 0.5846153846153846, | |
| "grad_norm": 0.0800558477640152, | |
| "learning_rate": 0.00014231759656652362, | |
| "loss": 0.3653, | |
| "num_input_tokens_seen": 2132224, | |
| "step": 342, | |
| "train_runtime": 1487.3113, | |
| "train_tokens_per_second": 1433.61 | |
| }, | |
| { | |
| "epoch": 0.5863247863247864, | |
| "grad_norm": 0.08397111296653748, | |
| "learning_rate": 0.0001421459227467811, | |
| "loss": 0.4463, | |
| "num_input_tokens_seen": 2137720, | |
| "step": 343, | |
| "train_runtime": 1490.9075, | |
| "train_tokens_per_second": 1433.838 | |
| }, | |
| { | |
| "epoch": 0.588034188034188, | |
| "grad_norm": 0.07987198978662491, | |
| "learning_rate": 0.00014197424892703863, | |
| "loss": 0.4335, | |
| "num_input_tokens_seen": 2143688, | |
| "step": 344, | |
| "train_runtime": 1494.8312, | |
| "train_tokens_per_second": 1434.067 | |
| }, | |
| { | |
| "epoch": 0.5897435897435898, | |
| "grad_norm": 0.08058437705039978, | |
| "learning_rate": 0.00014180257510729616, | |
| "loss": 0.4047, | |
| "num_input_tokens_seen": 2149424, | |
| "step": 345, | |
| "train_runtime": 1498.5271, | |
| "train_tokens_per_second": 1434.358 | |
| }, | |
| { | |
| "epoch": 0.5914529914529915, | |
| "grad_norm": 0.08178169280290604, | |
| "learning_rate": 0.00014163090128755366, | |
| "loss": 0.4263, | |
| "num_input_tokens_seen": 2154792, | |
| "step": 346, | |
| "train_runtime": 1502.107, | |
| "train_tokens_per_second": 1434.513 | |
| }, | |
| { | |
| "epoch": 0.5931623931623932, | |
| "grad_norm": 0.09406203776597977, | |
| "learning_rate": 0.00014145922746781116, | |
| "loss": 0.3642, | |
| "num_input_tokens_seen": 2159888, | |
| "step": 347, | |
| "train_runtime": 1505.4719, | |
| "train_tokens_per_second": 1434.692 | |
| }, | |
| { | |
| "epoch": 0.5948717948717949, | |
| "grad_norm": 0.08521080017089844, | |
| "learning_rate": 0.00014128755364806867, | |
| "loss": 0.4245, | |
| "num_input_tokens_seen": 2164880, | |
| "step": 348, | |
| "train_runtime": 1508.7988, | |
| "train_tokens_per_second": 1434.837 | |
| }, | |
| { | |
| "epoch": 0.5965811965811966, | |
| "grad_norm": 0.09558600187301636, | |
| "learning_rate": 0.0001411158798283262, | |
| "loss": 0.5506, | |
| "num_input_tokens_seen": 2169712, | |
| "step": 349, | |
| "train_runtime": 1512.0048, | |
| "train_tokens_per_second": 1434.99 | |
| }, | |
| { | |
| "epoch": 0.5982905982905983, | |
| "grad_norm": 0.09704317897558212, | |
| "learning_rate": 0.0001409442060085837, | |
| "loss": 0.4522, | |
| "num_input_tokens_seen": 2176688, | |
| "step": 350, | |
| "train_runtime": 1516.4757, | |
| "train_tokens_per_second": 1435.36 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 0.07796601951122284, | |
| "learning_rate": 0.0001407725321888412, | |
| "loss": 0.3903, | |
| "num_input_tokens_seen": 2182704, | |
| "step": 351, | |
| "train_runtime": 1520.4129, | |
| "train_tokens_per_second": 1435.599 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "eval_loss": 0.39889562129974365, | |
| "eval_runtime": 40.1503, | |
| "eval_samples_per_second": 24.857, | |
| "eval_steps_per_second": 3.113, | |
| "num_input_tokens_seen": 2182704, | |
| "step": 351 | |
| }, | |
| { | |
| "epoch": 0.6017094017094017, | |
| "grad_norm": 0.09079721570014954, | |
| "learning_rate": 0.0001406008583690987, | |
| "loss": 0.4283, | |
| "num_input_tokens_seen": 2188192, | |
| "step": 352, | |
| "train_runtime": 1564.2922, | |
| "train_tokens_per_second": 1398.838 | |
| }, | |
| { | |
| "epoch": 0.6034188034188034, | |
| "grad_norm": 0.0738375186920166, | |
| "learning_rate": 0.00014042918454935623, | |
| "loss": 0.4441, | |
| "num_input_tokens_seen": 2196224, | |
| "step": 353, | |
| "train_runtime": 1569.3087, | |
| "train_tokens_per_second": 1399.485 | |
| }, | |
| { | |
| "epoch": 0.6051282051282051, | |
| "grad_norm": 0.09894047677516937, | |
| "learning_rate": 0.00014025751072961376, | |
| "loss": 0.5074, | |
| "num_input_tokens_seen": 2200912, | |
| "step": 354, | |
| "train_runtime": 1572.4562, | |
| "train_tokens_per_second": 1399.665 | |
| }, | |
| { | |
| "epoch": 0.6068376068376068, | |
| "grad_norm": 0.07697256654500961, | |
| "learning_rate": 0.00014008583690987124, | |
| "loss": 0.3198, | |
| "num_input_tokens_seen": 2206576, | |
| "step": 355, | |
| "train_runtime": 1576.2927, | |
| "train_tokens_per_second": 1399.852 | |
| }, | |
| { | |
| "epoch": 0.6085470085470085, | |
| "grad_norm": 0.10991324484348297, | |
| "learning_rate": 0.00013991416309012877, | |
| "loss": 0.444, | |
| "num_input_tokens_seen": 2210776, | |
| "step": 356, | |
| "train_runtime": 1579.1755, | |
| "train_tokens_per_second": 1399.956 | |
| }, | |
| { | |
| "epoch": 0.6102564102564103, | |
| "grad_norm": 0.09266971796751022, | |
| "learning_rate": 0.00013974248927038627, | |
| "loss": 0.3746, | |
| "num_input_tokens_seen": 2215184, | |
| "step": 357, | |
| "train_runtime": 1582.2121, | |
| "train_tokens_per_second": 1400.055 | |
| }, | |
| { | |
| "epoch": 0.611965811965812, | |
| "grad_norm": 0.07689535617828369, | |
| "learning_rate": 0.0001395708154506438, | |
| "loss": 0.3114, | |
| "num_input_tokens_seen": 2221480, | |
| "step": 358, | |
| "train_runtime": 1586.3483, | |
| "train_tokens_per_second": 1400.373 | |
| }, | |
| { | |
| "epoch": 0.6136752136752137, | |
| "grad_norm": 0.09256884455680847, | |
| "learning_rate": 0.00013939914163090127, | |
| "loss": 0.5355, | |
| "num_input_tokens_seen": 2227224, | |
| "step": 359, | |
| "train_runtime": 1590.0739, | |
| "train_tokens_per_second": 1400.705 | |
| }, | |
| { | |
| "epoch": 0.6153846153846154, | |
| "grad_norm": 0.10408233106136322, | |
| "learning_rate": 0.0001392274678111588, | |
| "loss": 0.4115, | |
| "num_input_tokens_seen": 2232224, | |
| "step": 360, | |
| "train_runtime": 1593.3627, | |
| "train_tokens_per_second": 1400.952 | |
| }, | |
| { | |
| "epoch": 0.6170940170940171, | |
| "grad_norm": 0.0907105803489685, | |
| "learning_rate": 0.0001390557939914163, | |
| "loss": 0.3445, | |
| "num_input_tokens_seen": 2236584, | |
| "step": 361, | |
| "train_runtime": 1598.5561, | |
| "train_tokens_per_second": 1399.128 | |
| }, | |
| { | |
| "epoch": 0.6188034188034188, | |
| "grad_norm": 0.0865362212061882, | |
| "learning_rate": 0.00013888412017167383, | |
| "loss": 0.4831, | |
| "num_input_tokens_seen": 2241096, | |
| "step": 362, | |
| "train_runtime": 1601.6168, | |
| "train_tokens_per_second": 1399.271 | |
| }, | |
| { | |
| "epoch": 0.6205128205128205, | |
| "grad_norm": 0.09336186200380325, | |
| "learning_rate": 0.00013871244635193134, | |
| "loss": 0.3674, | |
| "num_input_tokens_seen": 2245488, | |
| "step": 363, | |
| "train_runtime": 1604.583, | |
| "train_tokens_per_second": 1399.422 | |
| }, | |
| { | |
| "epoch": 0.6222222222222222, | |
| "grad_norm": 0.09631265699863434, | |
| "learning_rate": 0.00013854077253218884, | |
| "loss": 0.3435, | |
| "num_input_tokens_seen": 2250184, | |
| "step": 364, | |
| "train_runtime": 1607.6918, | |
| "train_tokens_per_second": 1399.636 | |
| }, | |
| { | |
| "epoch": 0.6239316239316239, | |
| "grad_norm": 0.10324070602655411, | |
| "learning_rate": 0.00013836909871244637, | |
| "loss": 0.4786, | |
| "num_input_tokens_seen": 2255360, | |
| "step": 365, | |
| "train_runtime": 1611.2468, | |
| "train_tokens_per_second": 1399.761 | |
| }, | |
| { | |
| "epoch": 0.6256410256410256, | |
| "grad_norm": 0.08939824253320694, | |
| "learning_rate": 0.00013819742489270387, | |
| "loss": 0.4553, | |
| "num_input_tokens_seen": 2261184, | |
| "step": 366, | |
| "train_runtime": 1615.0109, | |
| "train_tokens_per_second": 1400.105 | |
| }, | |
| { | |
| "epoch": 0.6273504273504273, | |
| "grad_norm": 0.09298057854175568, | |
| "learning_rate": 0.00013802575107296137, | |
| "loss": 0.3719, | |
| "num_input_tokens_seen": 2267688, | |
| "step": 367, | |
| "train_runtime": 1619.2073, | |
| "train_tokens_per_second": 1400.493 | |
| }, | |
| { | |
| "epoch": 0.629059829059829, | |
| "grad_norm": 0.09285794943571091, | |
| "learning_rate": 0.00013785407725321888, | |
| "loss": 0.3364, | |
| "num_input_tokens_seen": 2272200, | |
| "step": 368, | |
| "train_runtime": 1622.2382, | |
| "train_tokens_per_second": 1400.657 | |
| }, | |
| { | |
| "epoch": 0.6307692307692307, | |
| "grad_norm": 0.08546578139066696, | |
| "learning_rate": 0.0001376824034334764, | |
| "loss": 0.3205, | |
| "num_input_tokens_seen": 2276488, | |
| "step": 369, | |
| "train_runtime": 1625.2365, | |
| "train_tokens_per_second": 1400.712 | |
| }, | |
| { | |
| "epoch": 0.6324786324786325, | |
| "grad_norm": 0.08365242183208466, | |
| "learning_rate": 0.0001375107296137339, | |
| "loss": 0.3349, | |
| "num_input_tokens_seen": 2281184, | |
| "step": 370, | |
| "train_runtime": 1628.4726, | |
| "train_tokens_per_second": 1400.812 | |
| }, | |
| { | |
| "epoch": 0.6341880341880342, | |
| "grad_norm": 0.07910430431365967, | |
| "learning_rate": 0.0001373390557939914, | |
| "loss": 0.3611, | |
| "num_input_tokens_seen": 2286696, | |
| "step": 371, | |
| "train_runtime": 1632.1432, | |
| "train_tokens_per_second": 1401.039 | |
| }, | |
| { | |
| "epoch": 0.6358974358974359, | |
| "grad_norm": 0.0918528288602829, | |
| "learning_rate": 0.00013716738197424894, | |
| "loss": 0.5565, | |
| "num_input_tokens_seen": 2291648, | |
| "step": 372, | |
| "train_runtime": 1635.5649, | |
| "train_tokens_per_second": 1401.136 | |
| }, | |
| { | |
| "epoch": 0.6376068376068376, | |
| "grad_norm": 0.07989461719989777, | |
| "learning_rate": 0.00013699570815450644, | |
| "loss": 0.4643, | |
| "num_input_tokens_seen": 2298904, | |
| "step": 373, | |
| "train_runtime": 1640.2116, | |
| "train_tokens_per_second": 1401.59 | |
| }, | |
| { | |
| "epoch": 0.6393162393162393, | |
| "grad_norm": 0.09709218889474869, | |
| "learning_rate": 0.00013682403433476397, | |
| "loss": 0.2924, | |
| "num_input_tokens_seen": 2304656, | |
| "step": 374, | |
| "train_runtime": 1644.0348, | |
| "train_tokens_per_second": 1401.829 | |
| }, | |
| { | |
| "epoch": 0.6410256410256411, | |
| "grad_norm": 0.08683669567108154, | |
| "learning_rate": 0.00013665236051502147, | |
| "loss": 0.399, | |
| "num_input_tokens_seen": 2309560, | |
| "step": 375, | |
| "train_runtime": 1647.3687, | |
| "train_tokens_per_second": 1401.969 | |
| }, | |
| { | |
| "epoch": 0.6427350427350428, | |
| "grad_norm": 0.09597049653530121, | |
| "learning_rate": 0.00013648068669527898, | |
| "loss": 0.4146, | |
| "num_input_tokens_seen": 2314304, | |
| "step": 376, | |
| "train_runtime": 1650.5219, | |
| "train_tokens_per_second": 1402.165 | |
| }, | |
| { | |
| "epoch": 0.6444444444444445, | |
| "grad_norm": 0.10446120798587799, | |
| "learning_rate": 0.00013630901287553648, | |
| "loss": 0.4616, | |
| "num_input_tokens_seen": 2319912, | |
| "step": 377, | |
| "train_runtime": 1654.2418, | |
| "train_tokens_per_second": 1402.402 | |
| }, | |
| { | |
| "epoch": 0.6461538461538462, | |
| "grad_norm": 0.10042799264192581, | |
| "learning_rate": 0.000136137339055794, | |
| "loss": 0.4273, | |
| "num_input_tokens_seen": 2324896, | |
| "step": 378, | |
| "train_runtime": 1657.6904, | |
| "train_tokens_per_second": 1402.491 | |
| }, | |
| { | |
| "epoch": 0.6478632478632479, | |
| "grad_norm": 0.09080878645181656, | |
| "learning_rate": 0.0001359656652360515, | |
| "loss": 0.371, | |
| "num_input_tokens_seen": 2329696, | |
| "step": 379, | |
| "train_runtime": 1660.9598, | |
| "train_tokens_per_second": 1402.62 | |
| }, | |
| { | |
| "epoch": 0.6495726495726496, | |
| "grad_norm": 0.09960087388753891, | |
| "learning_rate": 0.000135793991416309, | |
| "loss": 0.478, | |
| "num_input_tokens_seen": 2335952, | |
| "step": 380, | |
| "train_runtime": 1665.0537, | |
| "train_tokens_per_second": 1402.929 | |
| }, | |
| { | |
| "epoch": 0.6512820512820513, | |
| "grad_norm": 0.09628906100988388, | |
| "learning_rate": 0.00013562231759656654, | |
| "loss": 0.5056, | |
| "num_input_tokens_seen": 2341424, | |
| "step": 381, | |
| "train_runtime": 1668.6974, | |
| "train_tokens_per_second": 1403.145 | |
| }, | |
| { | |
| "epoch": 0.652991452991453, | |
| "grad_norm": 0.09442561119794846, | |
| "learning_rate": 0.00013545064377682404, | |
| "loss": 0.4214, | |
| "num_input_tokens_seen": 2346280, | |
| "step": 382, | |
| "train_runtime": 1671.9888, | |
| "train_tokens_per_second": 1403.287 | |
| }, | |
| { | |
| "epoch": 0.6547008547008547, | |
| "grad_norm": 0.08291413635015488, | |
| "learning_rate": 0.00013527896995708155, | |
| "loss": 0.3663, | |
| "num_input_tokens_seen": 2351856, | |
| "step": 383, | |
| "train_runtime": 1675.6596, | |
| "train_tokens_per_second": 1403.54 | |
| }, | |
| { | |
| "epoch": 0.6564102564102564, | |
| "grad_norm": 0.08272901922464371, | |
| "learning_rate": 0.00013510729613733905, | |
| "loss": 0.4371, | |
| "num_input_tokens_seen": 2358488, | |
| "step": 384, | |
| "train_runtime": 1679.9498, | |
| "train_tokens_per_second": 1403.904 | |
| }, | |
| { | |
| "epoch": 0.6581196581196581, | |
| "grad_norm": 0.09740111231803894, | |
| "learning_rate": 0.00013493562231759658, | |
| "loss": 0.4235, | |
| "num_input_tokens_seen": 2363344, | |
| "step": 385, | |
| "train_runtime": 1683.3637, | |
| "train_tokens_per_second": 1403.941 | |
| }, | |
| { | |
| "epoch": 0.6598290598290598, | |
| "grad_norm": 0.10885223746299744, | |
| "learning_rate": 0.00013476394849785408, | |
| "loss": 0.5086, | |
| "num_input_tokens_seen": 2369912, | |
| "step": 386, | |
| "train_runtime": 1687.682, | |
| "train_tokens_per_second": 1404.241 | |
| }, | |
| { | |
| "epoch": 0.6615384615384615, | |
| "grad_norm": 0.08678839355707169, | |
| "learning_rate": 0.00013459227467811158, | |
| "loss": 0.2697, | |
| "num_input_tokens_seen": 2374184, | |
| "step": 387, | |
| "train_runtime": 1690.6282, | |
| "train_tokens_per_second": 1404.321 | |
| }, | |
| { | |
| "epoch": 0.6632478632478632, | |
| "grad_norm": 0.08202622830867767, | |
| "learning_rate": 0.00013442060085836909, | |
| "loss": 0.4109, | |
| "num_input_tokens_seen": 2379040, | |
| "step": 388, | |
| "train_runtime": 1693.9423, | |
| "train_tokens_per_second": 1404.44 | |
| }, | |
| { | |
| "epoch": 0.6649572649572649, | |
| "grad_norm": 0.08018656075000763, | |
| "learning_rate": 0.00013424892703862662, | |
| "loss": 0.4139, | |
| "num_input_tokens_seen": 2387224, | |
| "step": 389, | |
| "train_runtime": 1699.0756, | |
| "train_tokens_per_second": 1405.013 | |
| }, | |
| { | |
| "epoch": 0.6666666666666666, | |
| "grad_norm": 0.08134426176548004, | |
| "learning_rate": 0.00013407725321888414, | |
| "loss": 0.4374, | |
| "num_input_tokens_seen": 2392080, | |
| "step": 390, | |
| "train_runtime": 1702.3937, | |
| "train_tokens_per_second": 1405.127 | |
| }, | |
| { | |
| "epoch": 0.6683760683760683, | |
| "grad_norm": 0.07251180708408356, | |
| "learning_rate": 0.00013390557939914165, | |
| "loss": 0.3994, | |
| "num_input_tokens_seen": 2398128, | |
| "step": 391, | |
| "train_runtime": 1708.3925, | |
| "train_tokens_per_second": 1403.734 | |
| }, | |
| { | |
| "epoch": 0.67008547008547, | |
| "grad_norm": 0.08818169683218002, | |
| "learning_rate": 0.00013373390557939915, | |
| "loss": 0.4005, | |
| "num_input_tokens_seen": 2404440, | |
| "step": 392, | |
| "train_runtime": 1712.4305, | |
| "train_tokens_per_second": 1404.11 | |
| }, | |
| { | |
| "epoch": 0.6717948717948717, | |
| "grad_norm": 0.0823337659239769, | |
| "learning_rate": 0.00013356223175965665, | |
| "loss": 0.3136, | |
| "num_input_tokens_seen": 2412128, | |
| "step": 393, | |
| "train_runtime": 1717.3418, | |
| "train_tokens_per_second": 1404.571 | |
| }, | |
| { | |
| "epoch": 0.6735042735042736, | |
| "grad_norm": 0.09980267286300659, | |
| "learning_rate": 0.00013339055793991418, | |
| "loss": 0.4452, | |
| "num_input_tokens_seen": 2416536, | |
| "step": 394, | |
| "train_runtime": 1720.4905, | |
| "train_tokens_per_second": 1404.562 | |
| }, | |
| { | |
| "epoch": 0.6752136752136753, | |
| "grad_norm": 0.08660242706537247, | |
| "learning_rate": 0.00013321888412017168, | |
| "loss": 0.4983, | |
| "num_input_tokens_seen": 2421080, | |
| "step": 395, | |
| "train_runtime": 1723.5853, | |
| "train_tokens_per_second": 1404.677 | |
| }, | |
| { | |
| "epoch": 0.676923076923077, | |
| "grad_norm": 0.10475271195173264, | |
| "learning_rate": 0.00013304721030042919, | |
| "loss": 0.4383, | |
| "num_input_tokens_seen": 2427376, | |
| "step": 396, | |
| "train_runtime": 1727.6892, | |
| "train_tokens_per_second": 1404.984 | |
| }, | |
| { | |
| "epoch": 0.6786324786324787, | |
| "grad_norm": 0.08192956447601318, | |
| "learning_rate": 0.0001328755364806867, | |
| "loss": 0.3392, | |
| "num_input_tokens_seen": 2435120, | |
| "step": 397, | |
| "train_runtime": 1732.6657, | |
| "train_tokens_per_second": 1405.418 | |
| }, | |
| { | |
| "epoch": 0.6803418803418804, | |
| "grad_norm": 0.07553105801343918, | |
| "learning_rate": 0.00013270386266094422, | |
| "loss": 0.383, | |
| "num_input_tokens_seen": 2442576, | |
| "step": 398, | |
| "train_runtime": 1737.418, | |
| "train_tokens_per_second": 1405.866 | |
| }, | |
| { | |
| "epoch": 0.6820512820512821, | |
| "grad_norm": 0.1032620221376419, | |
| "learning_rate": 0.00013253218884120172, | |
| "loss": 0.4186, | |
| "num_input_tokens_seen": 2448784, | |
| "step": 399, | |
| "train_runtime": 1741.4935, | |
| "train_tokens_per_second": 1406.14 | |
| }, | |
| { | |
| "epoch": 0.6837606837606838, | |
| "grad_norm": 0.10456489771604538, | |
| "learning_rate": 0.00013236051502145922, | |
| "loss": 0.4697, | |
| "num_input_tokens_seen": 2455504, | |
| "step": 400, | |
| "train_runtime": 1745.7367, | |
| "train_tokens_per_second": 1406.572 | |
| }, | |
| { | |
| "epoch": 0.6854700854700855, | |
| "grad_norm": 0.09265512973070145, | |
| "learning_rate": 0.00013218884120171675, | |
| "loss": 0.4487, | |
| "num_input_tokens_seen": 2461560, | |
| "step": 401, | |
| "train_runtime": 1749.5632, | |
| "train_tokens_per_second": 1406.957 | |
| }, | |
| { | |
| "epoch": 0.6871794871794872, | |
| "grad_norm": 0.07256102561950684, | |
| "learning_rate": 0.00013201716738197425, | |
| "loss": 0.3153, | |
| "num_input_tokens_seen": 2468800, | |
| "step": 402, | |
| "train_runtime": 1754.2231, | |
| "train_tokens_per_second": 1407.347 | |
| }, | |
| { | |
| "epoch": 0.6888888888888889, | |
| "grad_norm": 0.07364867627620697, | |
| "learning_rate": 0.00013184549356223176, | |
| "loss": 0.3433, | |
| "num_input_tokens_seen": 2477720, | |
| "step": 403, | |
| "train_runtime": 1759.7128, | |
| "train_tokens_per_second": 1408.025 | |
| }, | |
| { | |
| "epoch": 0.6905982905982906, | |
| "grad_norm": 0.08628483861684799, | |
| "learning_rate": 0.00013167381974248926, | |
| "loss": 0.3985, | |
| "num_input_tokens_seen": 2486192, | |
| "step": 404, | |
| "train_runtime": 1765.0347, | |
| "train_tokens_per_second": 1408.58 | |
| }, | |
| { | |
| "epoch": 0.6923076923076923, | |
| "grad_norm": 0.08556502312421799, | |
| "learning_rate": 0.0001315021459227468, | |
| "loss": 0.3041, | |
| "num_input_tokens_seen": 2492480, | |
| "step": 405, | |
| "train_runtime": 1769.0985, | |
| "train_tokens_per_second": 1408.898 | |
| }, | |
| { | |
| "epoch": 0.694017094017094, | |
| "grad_norm": 0.10038785636425018, | |
| "learning_rate": 0.0001313304721030043, | |
| "loss": 0.9755, | |
| "num_input_tokens_seen": 2498112, | |
| "step": 406, | |
| "train_runtime": 1772.8297, | |
| "train_tokens_per_second": 1409.11 | |
| }, | |
| { | |
| "epoch": 0.6957264957264957, | |
| "grad_norm": 0.09080588072538376, | |
| "learning_rate": 0.00013115879828326182, | |
| "loss": 0.3674, | |
| "num_input_tokens_seen": 2502984, | |
| "step": 407, | |
| "train_runtime": 1776.2479, | |
| "train_tokens_per_second": 1409.141 | |
| }, | |
| { | |
| "epoch": 0.6974358974358974, | |
| "grad_norm": 0.08220319449901581, | |
| "learning_rate": 0.00013098712446351932, | |
| "loss": 0.3126, | |
| "num_input_tokens_seen": 2507112, | |
| "step": 408, | |
| "train_runtime": 1779.1809, | |
| "train_tokens_per_second": 1409.138 | |
| }, | |
| { | |
| "epoch": 0.6991452991452991, | |
| "grad_norm": 0.11195231974124908, | |
| "learning_rate": 0.00013081545064377683, | |
| "loss": 0.3934, | |
| "num_input_tokens_seen": 2515928, | |
| "step": 409, | |
| "train_runtime": 1784.7765, | |
| "train_tokens_per_second": 1409.66 | |
| }, | |
| { | |
| "epoch": 0.7008547008547008, | |
| "grad_norm": 0.09571472555398941, | |
| "learning_rate": 0.00013064377682403435, | |
| "loss": 0.3706, | |
| "num_input_tokens_seen": 2521944, | |
| "step": 410, | |
| "train_runtime": 1788.7202, | |
| "train_tokens_per_second": 1409.915 | |
| }, | |
| { | |
| "epoch": 0.7025641025641025, | |
| "grad_norm": 0.09179401397705078, | |
| "learning_rate": 0.00013047210300429186, | |
| "loss": 0.2979, | |
| "num_input_tokens_seen": 2526848, | |
| "step": 411, | |
| "train_runtime": 1792.0136, | |
| "train_tokens_per_second": 1410.061 | |
| }, | |
| { | |
| "epoch": 0.7042735042735043, | |
| "grad_norm": 0.09440741688013077, | |
| "learning_rate": 0.00013030042918454936, | |
| "loss": 0.5097, | |
| "num_input_tokens_seen": 2533784, | |
| "step": 412, | |
| "train_runtime": 1796.3941, | |
| "train_tokens_per_second": 1410.483 | |
| }, | |
| { | |
| "epoch": 0.705982905982906, | |
| "grad_norm": 0.11012144386768341, | |
| "learning_rate": 0.00013012875536480686, | |
| "loss": 0.385, | |
| "num_input_tokens_seen": 2538112, | |
| "step": 413, | |
| "train_runtime": 1799.4714, | |
| "train_tokens_per_second": 1410.476 | |
| }, | |
| { | |
| "epoch": 0.7076923076923077, | |
| "grad_norm": 0.08006038516759872, | |
| "learning_rate": 0.0001299570815450644, | |
| "loss": 0.4715, | |
| "num_input_tokens_seen": 2544952, | |
| "step": 414, | |
| "train_runtime": 1803.9087, | |
| "train_tokens_per_second": 1410.799 | |
| }, | |
| { | |
| "epoch": 0.7094017094017094, | |
| "grad_norm": 0.0850716233253479, | |
| "learning_rate": 0.0001297854077253219, | |
| "loss": 0.3632, | |
| "num_input_tokens_seen": 2550800, | |
| "step": 415, | |
| "train_runtime": 1807.7422, | |
| "train_tokens_per_second": 1411.042 | |
| }, | |
| { | |
| "epoch": 0.7111111111111111, | |
| "grad_norm": 0.08932614326477051, | |
| "learning_rate": 0.0001296137339055794, | |
| "loss": 0.4279, | |
| "num_input_tokens_seen": 2557144, | |
| "step": 416, | |
| "train_runtime": 1811.9042, | |
| "train_tokens_per_second": 1411.302 | |
| }, | |
| { | |
| "epoch": 0.7128205128205128, | |
| "grad_norm": 0.08836366981267929, | |
| "learning_rate": 0.00012944206008583693, | |
| "loss": 0.404, | |
| "num_input_tokens_seen": 2562936, | |
| "step": 417, | |
| "train_runtime": 1815.6127, | |
| "train_tokens_per_second": 1411.609 | |
| }, | |
| { | |
| "epoch": 0.7145299145299145, | |
| "grad_norm": 0.08833774924278259, | |
| "learning_rate": 0.00012927038626609443, | |
| "loss": 0.4296, | |
| "num_input_tokens_seen": 2567728, | |
| "step": 418, | |
| "train_runtime": 1818.8812, | |
| "train_tokens_per_second": 1411.707 | |
| }, | |
| { | |
| "epoch": 0.7162393162393162, | |
| "grad_norm": 0.0948844775557518, | |
| "learning_rate": 0.00012909871244635193, | |
| "loss": 0.398, | |
| "num_input_tokens_seen": 2573784, | |
| "step": 419, | |
| "train_runtime": 1822.8202, | |
| "train_tokens_per_second": 1411.979 | |
| }, | |
| { | |
| "epoch": 0.717948717948718, | |
| "grad_norm": 0.08557496964931488, | |
| "learning_rate": 0.00012892703862660943, | |
| "loss": 0.4048, | |
| "num_input_tokens_seen": 2580104, | |
| "step": 420, | |
| "train_runtime": 1826.9724, | |
| "train_tokens_per_second": 1412.229 | |
| }, | |
| { | |
| "epoch": 0.7196581196581197, | |
| "grad_norm": 0.10961645841598511, | |
| "learning_rate": 0.00012875536480686696, | |
| "loss": 0.3888, | |
| "num_input_tokens_seen": 2586304, | |
| "step": 421, | |
| "train_runtime": 1833.0299, | |
| "train_tokens_per_second": 1410.945 | |
| }, | |
| { | |
| "epoch": 0.7213675213675214, | |
| "grad_norm": 0.09428433328866959, | |
| "learning_rate": 0.00012858369098712446, | |
| "loss": 0.3787, | |
| "num_input_tokens_seen": 2591328, | |
| "step": 422, | |
| "train_runtime": 1836.3708, | |
| "train_tokens_per_second": 1411.114 | |
| }, | |
| { | |
| "epoch": 0.7230769230769231, | |
| "grad_norm": 0.07983230799436569, | |
| "learning_rate": 0.000128412017167382, | |
| "loss": 0.4333, | |
| "num_input_tokens_seen": 2597392, | |
| "step": 423, | |
| "train_runtime": 1840.3075, | |
| "train_tokens_per_second": 1411.39 | |
| }, | |
| { | |
| "epoch": 0.7247863247863248, | |
| "grad_norm": 0.09758428484201431, | |
| "learning_rate": 0.0001282403433476395, | |
| "loss": 0.4846, | |
| "num_input_tokens_seen": 2603632, | |
| "step": 424, | |
| "train_runtime": 1844.4191, | |
| "train_tokens_per_second": 1411.627 | |
| }, | |
| { | |
| "epoch": 0.7264957264957265, | |
| "grad_norm": 0.11297962069511414, | |
| "learning_rate": 0.000128068669527897, | |
| "loss": 0.4252, | |
| "num_input_tokens_seen": 2609304, | |
| "step": 425, | |
| "train_runtime": 1848.0395, | |
| "train_tokens_per_second": 1411.931 | |
| }, | |
| { | |
| "epoch": 0.7282051282051282, | |
| "grad_norm": 0.10584045201539993, | |
| "learning_rate": 0.00012789699570815453, | |
| "loss": 0.3543, | |
| "num_input_tokens_seen": 2613512, | |
| "step": 426, | |
| "train_runtime": 1850.9158, | |
| "train_tokens_per_second": 1412.01 | |
| }, | |
| { | |
| "epoch": 0.7299145299145299, | |
| "grad_norm": 0.10154668241739273, | |
| "learning_rate": 0.00012772532188841203, | |
| "loss": 0.546, | |
| "num_input_tokens_seen": 2618824, | |
| "step": 427, | |
| "train_runtime": 1854.4991, | |
| "train_tokens_per_second": 1412.146 | |
| }, | |
| { | |
| "epoch": 0.7316239316239316, | |
| "grad_norm": 0.10194077342748642, | |
| "learning_rate": 0.00012755364806866953, | |
| "loss": 0.4355, | |
| "num_input_tokens_seen": 2626440, | |
| "step": 428, | |
| "train_runtime": 1859.1535, | |
| "train_tokens_per_second": 1412.707 | |
| }, | |
| { | |
| "epoch": 0.7333333333333333, | |
| "grad_norm": 0.059250883758068085, | |
| "learning_rate": 0.00012738197424892704, | |
| "loss": 0.3542, | |
| "num_input_tokens_seen": 2640696, | |
| "step": 429, | |
| "train_runtime": 1867.9636, | |
| "train_tokens_per_second": 1413.676 | |
| }, | |
| { | |
| "epoch": 0.7350427350427351, | |
| "grad_norm": 0.09271879494190216, | |
| "learning_rate": 0.00012721030042918456, | |
| "loss": 0.3714, | |
| "num_input_tokens_seen": 2645552, | |
| "step": 430, | |
| "train_runtime": 1871.1549, | |
| "train_tokens_per_second": 1413.861 | |
| }, | |
| { | |
| "epoch": 0.7367521367521368, | |
| "grad_norm": 0.10251565277576447, | |
| "learning_rate": 0.00012703862660944207, | |
| "loss": 0.402, | |
| "num_input_tokens_seen": 2650008, | |
| "step": 431, | |
| "train_runtime": 1874.2478, | |
| "train_tokens_per_second": 1413.905 | |
| }, | |
| { | |
| "epoch": 0.7384615384615385, | |
| "grad_norm": 0.08104413002729416, | |
| "learning_rate": 0.00012686695278969957, | |
| "loss": 0.3586, | |
| "num_input_tokens_seen": 2657184, | |
| "step": 432, | |
| "train_runtime": 1878.7478, | |
| "train_tokens_per_second": 1414.338 | |
| }, | |
| { | |
| "epoch": 0.7401709401709402, | |
| "grad_norm": 0.08250881731510162, | |
| "learning_rate": 0.0001266952789699571, | |
| "loss": 0.4122, | |
| "num_input_tokens_seen": 2662408, | |
| "step": 433, | |
| "train_runtime": 1882.2806, | |
| "train_tokens_per_second": 1414.459 | |
| }, | |
| { | |
| "epoch": 0.7418803418803419, | |
| "grad_norm": 0.08179739117622375, | |
| "learning_rate": 0.0001265236051502146, | |
| "loss": 0.3988, | |
| "num_input_tokens_seen": 2668632, | |
| "step": 434, | |
| "train_runtime": 1886.2827, | |
| "train_tokens_per_second": 1414.757 | |
| }, | |
| { | |
| "epoch": 0.7435897435897436, | |
| "grad_norm": 0.09739404171705246, | |
| "learning_rate": 0.00012635193133047213, | |
| "loss": 0.4507, | |
| "num_input_tokens_seen": 2675376, | |
| "step": 435, | |
| "train_runtime": 1890.5915, | |
| "train_tokens_per_second": 1415.1 | |
| }, | |
| { | |
| "epoch": 0.7452991452991453, | |
| "grad_norm": 0.08292689919471741, | |
| "learning_rate": 0.0001261802575107296, | |
| "loss": 0.344, | |
| "num_input_tokens_seen": 2681072, | |
| "step": 436, | |
| "train_runtime": 1894.2808, | |
| "train_tokens_per_second": 1415.351 | |
| }, | |
| { | |
| "epoch": 0.747008547008547, | |
| "grad_norm": 0.10009622573852539, | |
| "learning_rate": 0.00012600858369098714, | |
| "loss": 0.4121, | |
| "num_input_tokens_seen": 2687664, | |
| "step": 437, | |
| "train_runtime": 1898.7144, | |
| "train_tokens_per_second": 1415.518 | |
| }, | |
| { | |
| "epoch": 0.7487179487179487, | |
| "grad_norm": 0.08162456750869751, | |
| "learning_rate": 0.00012583690987124464, | |
| "loss": 0.38, | |
| "num_input_tokens_seen": 2692888, | |
| "step": 438, | |
| "train_runtime": 1902.2857, | |
| "train_tokens_per_second": 1415.607 | |
| }, | |
| { | |
| "epoch": 0.7504273504273504, | |
| "grad_norm": 0.10055331140756607, | |
| "learning_rate": 0.00012566523605150217, | |
| "loss": 0.5579, | |
| "num_input_tokens_seen": 2698192, | |
| "step": 439, | |
| "train_runtime": 1905.8783, | |
| "train_tokens_per_second": 1415.721 | |
| }, | |
| { | |
| "epoch": 0.7521367521367521, | |
| "grad_norm": 0.08599859476089478, | |
| "learning_rate": 0.00012549356223175964, | |
| "loss": 0.4105, | |
| "num_input_tokens_seen": 2706400, | |
| "step": 440, | |
| "train_runtime": 1911.01, | |
| "train_tokens_per_second": 1416.214 | |
| }, | |
| { | |
| "epoch": 0.7538461538461538, | |
| "grad_norm": 0.10321099311113358, | |
| "learning_rate": 0.00012532188841201717, | |
| "loss": 0.5507, | |
| "num_input_tokens_seen": 2711248, | |
| "step": 441, | |
| "train_runtime": 1914.2832, | |
| "train_tokens_per_second": 1416.325 | |
| }, | |
| { | |
| "epoch": 0.7555555555555555, | |
| "grad_norm": 0.08138895779848099, | |
| "learning_rate": 0.0001251502145922747, | |
| "loss": 0.3421, | |
| "num_input_tokens_seen": 2717984, | |
| "step": 442, | |
| "train_runtime": 1918.6058, | |
| "train_tokens_per_second": 1416.645 | |
| }, | |
| { | |
| "epoch": 0.7572649572649572, | |
| "grad_norm": 0.09042924642562866, | |
| "learning_rate": 0.0001249785407725322, | |
| "loss": 0.4009, | |
| "num_input_tokens_seen": 2724304, | |
| "step": 443, | |
| "train_runtime": 1922.6265, | |
| "train_tokens_per_second": 1416.97 | |
| }, | |
| { | |
| "epoch": 0.7589743589743589, | |
| "grad_norm": 0.08353422582149506, | |
| "learning_rate": 0.0001248068669527897, | |
| "loss": 0.5339, | |
| "num_input_tokens_seen": 2730536, | |
| "step": 444, | |
| "train_runtime": 1926.6415, | |
| "train_tokens_per_second": 1417.252 | |
| }, | |
| { | |
| "epoch": 0.7606837606837606, | |
| "grad_norm": 0.08057735860347748, | |
| "learning_rate": 0.0001246351931330472, | |
| "loss": 0.2139, | |
| "num_input_tokens_seen": 2739592, | |
| "step": 445, | |
| "train_runtime": 1932.3746, | |
| "train_tokens_per_second": 1417.733 | |
| }, | |
| { | |
| "epoch": 0.7623931623931623, | |
| "grad_norm": 0.08368086814880371, | |
| "learning_rate": 0.00012446351931330474, | |
| "loss": 0.4547, | |
| "num_input_tokens_seen": 2746472, | |
| "step": 446, | |
| "train_runtime": 1936.8148, | |
| "train_tokens_per_second": 1418.035 | |
| }, | |
| { | |
| "epoch": 0.764102564102564, | |
| "grad_norm": 0.09206908941268921, | |
| "learning_rate": 0.00012429184549356224, | |
| "loss": 0.364, | |
| "num_input_tokens_seen": 2752544, | |
| "step": 447, | |
| "train_runtime": 1940.8003, | |
| "train_tokens_per_second": 1418.252 | |
| }, | |
| { | |
| "epoch": 0.7658119658119659, | |
| "grad_norm": 0.09689074009656906, | |
| "learning_rate": 0.00012412017167381974, | |
| "loss": 0.3698, | |
| "num_input_tokens_seen": 2756232, | |
| "step": 448, | |
| "train_runtime": 1943.3995, | |
| "train_tokens_per_second": 1418.253 | |
| }, | |
| { | |
| "epoch": 0.7675213675213676, | |
| "grad_norm": 0.11510168761014938, | |
| "learning_rate": 0.00012394849785407725, | |
| "loss": 0.4782, | |
| "num_input_tokens_seen": 2763704, | |
| "step": 449, | |
| "train_runtime": 1948.0738, | |
| "train_tokens_per_second": 1418.685 | |
| }, | |
| { | |
| "epoch": 0.7692307692307693, | |
| "grad_norm": 0.10438208281993866, | |
| "learning_rate": 0.00012377682403433477, | |
| "loss": 0.4068, | |
| "num_input_tokens_seen": 2771048, | |
| "step": 450, | |
| "train_runtime": 1952.7876, | |
| "train_tokens_per_second": 1419.022 | |
| }, | |
| { | |
| "epoch": 0.770940170940171, | |
| "grad_norm": 0.09076783806085587, | |
| "learning_rate": 0.0001236051502145923, | |
| "loss": 0.4336, | |
| "num_input_tokens_seen": 2776848, | |
| "step": 451, | |
| "train_runtime": 1958.6056, | |
| "train_tokens_per_second": 1417.768 | |
| }, | |
| { | |
| "epoch": 0.7726495726495727, | |
| "grad_norm": 0.09839843213558197, | |
| "learning_rate": 0.00012343347639484978, | |
| "loss": 0.4169, | |
| "num_input_tokens_seen": 2781392, | |
| "step": 452, | |
| "train_runtime": 1961.7188, | |
| "train_tokens_per_second": 1417.834 | |
| }, | |
| { | |
| "epoch": 0.7743589743589744, | |
| "grad_norm": 0.11131442338228226, | |
| "learning_rate": 0.0001232618025751073, | |
| "loss": 0.3881, | |
| "num_input_tokens_seen": 2785736, | |
| "step": 453, | |
| "train_runtime": 1964.6246, | |
| "train_tokens_per_second": 1417.948 | |
| }, | |
| { | |
| "epoch": 0.7760683760683761, | |
| "grad_norm": 0.09070441126823425, | |
| "learning_rate": 0.0001230901287553648, | |
| "loss": 0.399, | |
| "num_input_tokens_seen": 2790968, | |
| "step": 454, | |
| "train_runtime": 1968.1511, | |
| "train_tokens_per_second": 1418.066 | |
| }, | |
| { | |
| "epoch": 0.7777777777777778, | |
| "grad_norm": 0.09357093274593353, | |
| "learning_rate": 0.00012291845493562234, | |
| "loss": 0.4989, | |
| "num_input_tokens_seen": 2795968, | |
| "step": 455, | |
| "train_runtime": 1971.5124, | |
| "train_tokens_per_second": 1418.184 | |
| }, | |
| { | |
| "epoch": 0.7794871794871795, | |
| "grad_norm": 0.08152603358030319, | |
| "learning_rate": 0.00012274678111587982, | |
| "loss": 0.397, | |
| "num_input_tokens_seen": 2801968, | |
| "step": 456, | |
| "train_runtime": 1975.4058, | |
| "train_tokens_per_second": 1418.427 | |
| }, | |
| { | |
| "epoch": 0.7811965811965812, | |
| "grad_norm": 0.08832139521837234, | |
| "learning_rate": 0.00012257510729613735, | |
| "loss": 0.4593, | |
| "num_input_tokens_seen": 2806896, | |
| "step": 457, | |
| "train_runtime": 1978.6286, | |
| "train_tokens_per_second": 1418.607 | |
| }, | |
| { | |
| "epoch": 0.7829059829059829, | |
| "grad_norm": 0.09871666878461838, | |
| "learning_rate": 0.00012240343347639485, | |
| "loss": 0.5688, | |
| "num_input_tokens_seen": 2811904, | |
| "step": 458, | |
| "train_runtime": 1981.985, | |
| "train_tokens_per_second": 1418.731 | |
| }, | |
| { | |
| "epoch": 0.7846153846153846, | |
| "grad_norm": 0.08846089243888855, | |
| "learning_rate": 0.00012223175965665238, | |
| "loss": 0.3872, | |
| "num_input_tokens_seen": 2817760, | |
| "step": 459, | |
| "train_runtime": 1985.7982, | |
| "train_tokens_per_second": 1418.956 | |
| }, | |
| { | |
| "epoch": 0.7863247863247863, | |
| "grad_norm": 0.07381941378116608, | |
| "learning_rate": 0.0001220600858369099, | |
| "loss": 0.397, | |
| "num_input_tokens_seen": 2828936, | |
| "step": 460, | |
| "train_runtime": 1992.6291, | |
| "train_tokens_per_second": 1419.7 | |
| }, | |
| { | |
| "epoch": 0.788034188034188, | |
| "grad_norm": 0.0786755383014679, | |
| "learning_rate": 0.00012188841201716738, | |
| "loss": 0.3676, | |
| "num_input_tokens_seen": 2834352, | |
| "step": 461, | |
| "train_runtime": 1996.1137, | |
| "train_tokens_per_second": 1419.935 | |
| }, | |
| { | |
| "epoch": 0.7897435897435897, | |
| "grad_norm": 0.09888231754302979, | |
| "learning_rate": 0.00012171673819742491, | |
| "loss": 0.6124, | |
| "num_input_tokens_seen": 2839672, | |
| "step": 462, | |
| "train_runtime": 1999.6256, | |
| "train_tokens_per_second": 1420.102 | |
| }, | |
| { | |
| "epoch": 0.7914529914529914, | |
| "grad_norm": 0.07366322726011276, | |
| "learning_rate": 0.0001215450643776824, | |
| "loss": 0.3307, | |
| "num_input_tokens_seen": 2845376, | |
| "step": 463, | |
| "train_runtime": 2003.3598, | |
| "train_tokens_per_second": 1420.302 | |
| }, | |
| { | |
| "epoch": 0.7931623931623931, | |
| "grad_norm": 0.10405825823545456, | |
| "learning_rate": 0.00012137339055793993, | |
| "loss": 0.5077, | |
| "num_input_tokens_seen": 2850056, | |
| "step": 464, | |
| "train_runtime": 2006.5829, | |
| "train_tokens_per_second": 1420.353 | |
| }, | |
| { | |
| "epoch": 0.7948717948717948, | |
| "grad_norm": 0.0754900574684143, | |
| "learning_rate": 0.00012120171673819742, | |
| "loss": 0.2874, | |
| "num_input_tokens_seen": 2856648, | |
| "step": 465, | |
| "train_runtime": 2010.8653, | |
| "train_tokens_per_second": 1420.606 | |
| }, | |
| { | |
| "epoch": 0.7965811965811965, | |
| "grad_norm": 0.08353781700134277, | |
| "learning_rate": 0.00012103004291845495, | |
| "loss": 0.3667, | |
| "num_input_tokens_seen": 2862632, | |
| "step": 466, | |
| "train_runtime": 2014.8034, | |
| "train_tokens_per_second": 1420.8 | |
| }, | |
| { | |
| "epoch": 0.7982905982905983, | |
| "grad_norm": 0.07881499826908112, | |
| "learning_rate": 0.00012085836909871244, | |
| "loss": 0.6024, | |
| "num_input_tokens_seen": 2870288, | |
| "step": 467, | |
| "train_runtime": 2019.6398, | |
| "train_tokens_per_second": 1421.188 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 0.08371937274932861, | |
| "learning_rate": 0.00012068669527896997, | |
| "loss": 0.3757, | |
| "num_input_tokens_seen": 2876552, | |
| "step": 468, | |
| "train_runtime": 2023.5632, | |
| "train_tokens_per_second": 1421.528 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "eval_loss": 0.3975943326950073, | |
| "eval_runtime": 40.2348, | |
| "eval_samples_per_second": 24.804, | |
| "eval_steps_per_second": 3.107, | |
| "num_input_tokens_seen": 2876552, | |
| "step": 468 | |
| }, | |
| { | |
| "epoch": 0.8017094017094017, | |
| "grad_norm": 0.09587102383375168, | |
| "learning_rate": 0.00012051502145922748, | |
| "loss": 0.4033, | |
| "num_input_tokens_seen": 2880952, | |
| "step": 469, | |
| "train_runtime": 2066.7148, | |
| "train_tokens_per_second": 1393.977 | |
| }, | |
| { | |
| "epoch": 0.8034188034188035, | |
| "grad_norm": 0.07546790689229965, | |
| "learning_rate": 0.00012034334763948498, | |
| "loss": 0.295, | |
| "num_input_tokens_seen": 2888184, | |
| "step": 470, | |
| "train_runtime": 2071.1851, | |
| "train_tokens_per_second": 1394.46 | |
| }, | |
| { | |
| "epoch": 0.8051282051282052, | |
| "grad_norm": 0.10362780094146729, | |
| "learning_rate": 0.0001201716738197425, | |
| "loss": 0.3668, | |
| "num_input_tokens_seen": 2899416, | |
| "step": 471, | |
| "train_runtime": 2078.0557, | |
| "train_tokens_per_second": 1395.254 | |
| }, | |
| { | |
| "epoch": 0.8068376068376069, | |
| "grad_norm": 0.07979272305965424, | |
| "learning_rate": 0.00012, | |
| "loss": 0.3491, | |
| "num_input_tokens_seen": 2904592, | |
| "step": 472, | |
| "train_runtime": 2081.4118, | |
| "train_tokens_per_second": 1395.491 | |
| }, | |
| { | |
| "epoch": 0.8085470085470086, | |
| "grad_norm": 0.08196493983268738, | |
| "learning_rate": 0.00011982832618025752, | |
| "loss": 0.3491, | |
| "num_input_tokens_seen": 2909616, | |
| "step": 473, | |
| "train_runtime": 2084.8475, | |
| "train_tokens_per_second": 1395.601 | |
| }, | |
| { | |
| "epoch": 0.8102564102564103, | |
| "grad_norm": 0.10573233664035797, | |
| "learning_rate": 0.00011965665236051502, | |
| "loss": 0.4396, | |
| "num_input_tokens_seen": 2913824, | |
| "step": 474, | |
| "train_runtime": 2087.7209, | |
| "train_tokens_per_second": 1395.696 | |
| }, | |
| { | |
| "epoch": 0.811965811965812, | |
| "grad_norm": 0.11220520734786987, | |
| "learning_rate": 0.00011948497854077254, | |
| "loss": 0.4309, | |
| "num_input_tokens_seen": 2920208, | |
| "step": 475, | |
| "train_runtime": 2091.7609, | |
| "train_tokens_per_second": 1396.052 | |
| }, | |
| { | |
| "epoch": 0.8136752136752137, | |
| "grad_norm": 0.07423815131187439, | |
| "learning_rate": 0.00011931330472103004, | |
| "loss": 0.338, | |
| "num_input_tokens_seen": 2926144, | |
| "step": 476, | |
| "train_runtime": 2095.6855, | |
| "train_tokens_per_second": 1396.271 | |
| }, | |
| { | |
| "epoch": 0.8153846153846154, | |
| "grad_norm": 0.07826936990022659, | |
| "learning_rate": 0.00011914163090128756, | |
| "loss": 0.3758, | |
| "num_input_tokens_seen": 2933112, | |
| "step": 477, | |
| "train_runtime": 2100.1257, | |
| "train_tokens_per_second": 1396.636 | |
| }, | |
| { | |
| "epoch": 0.8170940170940171, | |
| "grad_norm": 0.10059487074613571, | |
| "learning_rate": 0.00011896995708154509, | |
| "loss": 0.4095, | |
| "num_input_tokens_seen": 2940512, | |
| "step": 478, | |
| "train_runtime": 2104.7295, | |
| "train_tokens_per_second": 1397.097 | |
| }, | |
| { | |
| "epoch": 0.8188034188034188, | |
| "grad_norm": 0.10775360465049744, | |
| "learning_rate": 0.00011879828326180257, | |
| "loss": 0.4641, | |
| "num_input_tokens_seen": 2946016, | |
| "step": 479, | |
| "train_runtime": 2108.2514, | |
| "train_tokens_per_second": 1397.374 | |
| }, | |
| { | |
| "epoch": 0.8205128205128205, | |
| "grad_norm": 0.08371871709823608, | |
| "learning_rate": 0.0001186266094420601, | |
| "loss": 0.4006, | |
| "num_input_tokens_seen": 2950256, | |
| "step": 480, | |
| "train_runtime": 2111.2163, | |
| "train_tokens_per_second": 1397.42 | |
| }, | |
| { | |
| "epoch": 0.8222222222222222, | |
| "grad_norm": 0.09858489036560059, | |
| "learning_rate": 0.00011845493562231759, | |
| "loss": 0.4827, | |
| "num_input_tokens_seen": 2954528, | |
| "step": 481, | |
| "train_runtime": 2116.2112, | |
| "train_tokens_per_second": 1396.14 | |
| }, | |
| { | |
| "epoch": 0.8239316239316239, | |
| "grad_norm": 0.10172171145677567, | |
| "learning_rate": 0.00011828326180257512, | |
| "loss": 0.4265, | |
| "num_input_tokens_seen": 2959568, | |
| "step": 482, | |
| "train_runtime": 2119.6177, | |
| "train_tokens_per_second": 1396.274 | |
| }, | |
| { | |
| "epoch": 0.8256410256410256, | |
| "grad_norm": 0.07476787269115448, | |
| "learning_rate": 0.00011811158798283261, | |
| "loss": 0.426, | |
| "num_input_tokens_seen": 2969808, | |
| "step": 483, | |
| "train_runtime": 2125.8709, | |
| "train_tokens_per_second": 1396.984 | |
| }, | |
| { | |
| "epoch": 0.8273504273504273, | |
| "grad_norm": 0.1218891367316246, | |
| "learning_rate": 0.00011793991416309014, | |
| "loss": 0.4376, | |
| "num_input_tokens_seen": 2975584, | |
| "step": 484, | |
| "train_runtime": 2129.7262, | |
| "train_tokens_per_second": 1397.167 | |
| }, | |
| { | |
| "epoch": 0.8290598290598291, | |
| "grad_norm": 0.09157467633485794, | |
| "learning_rate": 0.00011776824034334764, | |
| "loss": 0.4647, | |
| "num_input_tokens_seen": 2983568, | |
| "step": 485, | |
| "train_runtime": 2134.8436, | |
| "train_tokens_per_second": 1397.558 | |
| }, | |
| { | |
| "epoch": 0.8307692307692308, | |
| "grad_norm": 0.08052816987037659, | |
| "learning_rate": 0.00011759656652360516, | |
| "loss": 0.34, | |
| "num_input_tokens_seen": 2990136, | |
| "step": 486, | |
| "train_runtime": 2139.0965, | |
| "train_tokens_per_second": 1397.85 | |
| }, | |
| { | |
| "epoch": 0.8324786324786325, | |
| "grad_norm": 0.09681648761034012, | |
| "learning_rate": 0.00011742489270386267, | |
| "loss": 0.5222, | |
| "num_input_tokens_seen": 2995648, | |
| "step": 487, | |
| "train_runtime": 2142.6907, | |
| "train_tokens_per_second": 1398.078 | |
| }, | |
| { | |
| "epoch": 0.8341880341880342, | |
| "grad_norm": 0.09712634235620499, | |
| "learning_rate": 0.00011725321888412018, | |
| "loss": 0.4272, | |
| "num_input_tokens_seen": 2999936, | |
| "step": 488, | |
| "train_runtime": 2145.6273, | |
| "train_tokens_per_second": 1398.163 | |
| }, | |
| { | |
| "epoch": 0.8358974358974359, | |
| "grad_norm": 0.08245320618152618, | |
| "learning_rate": 0.00011708154506437769, | |
| "loss": 0.4377, | |
| "num_input_tokens_seen": 3006392, | |
| "step": 489, | |
| "train_runtime": 2149.8266, | |
| "train_tokens_per_second": 1398.435 | |
| }, | |
| { | |
| "epoch": 0.8376068376068376, | |
| "grad_norm": 0.09992548078298569, | |
| "learning_rate": 0.0001169098712446352, | |
| "loss": 0.4934, | |
| "num_input_tokens_seen": 3012312, | |
| "step": 490, | |
| "train_runtime": 2153.6393, | |
| "train_tokens_per_second": 1398.708 | |
| }, | |
| { | |
| "epoch": 0.8393162393162393, | |
| "grad_norm": 0.08246449381113052, | |
| "learning_rate": 0.00011673819742489271, | |
| "loss": 0.4387, | |
| "num_input_tokens_seen": 3019104, | |
| "step": 491, | |
| "train_runtime": 2158.108, | |
| "train_tokens_per_second": 1398.959 | |
| }, | |
| { | |
| "epoch": 0.841025641025641, | |
| "grad_norm": 0.08337292075157166, | |
| "learning_rate": 0.00011656652360515021, | |
| "loss": 0.4912, | |
| "num_input_tokens_seen": 3025664, | |
| "step": 492, | |
| "train_runtime": 2162.3996, | |
| "train_tokens_per_second": 1399.216 | |
| }, | |
| { | |
| "epoch": 0.8427350427350427, | |
| "grad_norm": 0.06182870268821716, | |
| "learning_rate": 0.00011639484978540773, | |
| "loss": 0.3326, | |
| "num_input_tokens_seen": 3033776, | |
| "step": 493, | |
| "train_runtime": 2167.5232, | |
| "train_tokens_per_second": 1399.651 | |
| }, | |
| { | |
| "epoch": 0.8444444444444444, | |
| "grad_norm": 0.09150062501430511, | |
| "learning_rate": 0.00011622317596566523, | |
| "loss": 0.4187, | |
| "num_input_tokens_seen": 3038744, | |
| "step": 494, | |
| "train_runtime": 2170.893, | |
| "train_tokens_per_second": 1399.767 | |
| }, | |
| { | |
| "epoch": 0.8461538461538461, | |
| "grad_norm": 0.06586892902851105, | |
| "learning_rate": 0.00011605150214592275, | |
| "loss": 0.271, | |
| "num_input_tokens_seen": 3046920, | |
| "step": 495, | |
| "train_runtime": 2176.1904, | |
| "train_tokens_per_second": 1400.116 | |
| }, | |
| { | |
| "epoch": 0.8478632478632478, | |
| "grad_norm": 0.0771869495511055, | |
| "learning_rate": 0.00011587982832618028, | |
| "loss": 0.3341, | |
| "num_input_tokens_seen": 3057816, | |
| "step": 496, | |
| "train_runtime": 2182.8707, | |
| "train_tokens_per_second": 1400.823 | |
| }, | |
| { | |
| "epoch": 0.8495726495726496, | |
| "grad_norm": 0.07207699120044708, | |
| "learning_rate": 0.00011570815450643777, | |
| "loss": 0.3464, | |
| "num_input_tokens_seen": 3064472, | |
| "step": 497, | |
| "train_runtime": 2187.2355, | |
| "train_tokens_per_second": 1401.071 | |
| }, | |
| { | |
| "epoch": 0.8512820512820513, | |
| "grad_norm": 0.087531179189682, | |
| "learning_rate": 0.0001155364806866953, | |
| "loss": 0.4572, | |
| "num_input_tokens_seen": 3069264, | |
| "step": 498, | |
| "train_runtime": 2190.4257, | |
| "train_tokens_per_second": 1401.218 | |
| }, | |
| { | |
| "epoch": 0.852991452991453, | |
| "grad_norm": 0.07901884615421295, | |
| "learning_rate": 0.00011536480686695278, | |
| "loss": 0.3738, | |
| "num_input_tokens_seen": 3075112, | |
| "step": 499, | |
| "train_runtime": 2194.3188, | |
| "train_tokens_per_second": 1401.397 | |
| }, | |
| { | |
| "epoch": 0.8547008547008547, | |
| "grad_norm": 0.0702543780207634, | |
| "learning_rate": 0.00011519313304721031, | |
| "loss": 0.3385, | |
| "num_input_tokens_seen": 3081824, | |
| "step": 500, | |
| "train_runtime": 2198.62, | |
| "train_tokens_per_second": 1401.708 | |
| }, | |
| { | |
| "epoch": 0.8564102564102564, | |
| "grad_norm": 0.06980577856302261, | |
| "learning_rate": 0.00011502145922746782, | |
| "loss": 0.3095, | |
| "num_input_tokens_seen": 3090464, | |
| "step": 501, | |
| "train_runtime": 2203.9777, | |
| "train_tokens_per_second": 1402.221 | |
| }, | |
| { | |
| "epoch": 0.8581196581196581, | |
| "grad_norm": 0.08610618114471436, | |
| "learning_rate": 0.00011484978540772533, | |
| "loss": 0.3978, | |
| "num_input_tokens_seen": 3096072, | |
| "step": 502, | |
| "train_runtime": 2207.7148, | |
| "train_tokens_per_second": 1402.388 | |
| }, | |
| { | |
| "epoch": 0.8598290598290599, | |
| "grad_norm": 0.09656289964914322, | |
| "learning_rate": 0.00011467811158798283, | |
| "loss": 0.4409, | |
| "num_input_tokens_seen": 3100552, | |
| "step": 503, | |
| "train_runtime": 2210.8981, | |
| "train_tokens_per_second": 1402.395 | |
| }, | |
| { | |
| "epoch": 0.8615384615384616, | |
| "grad_norm": 0.09101828932762146, | |
| "learning_rate": 0.00011450643776824035, | |
| "loss": 0.3892, | |
| "num_input_tokens_seen": 3105368, | |
| "step": 504, | |
| "train_runtime": 2214.1665, | |
| "train_tokens_per_second": 1402.5 | |
| }, | |
| { | |
| "epoch": 0.8632478632478633, | |
| "grad_norm": 0.08322126418352127, | |
| "learning_rate": 0.00011433476394849787, | |
| "loss": 0.4806, | |
| "num_input_tokens_seen": 3112744, | |
| "step": 505, | |
| "train_runtime": 2218.8487, | |
| "train_tokens_per_second": 1402.864 | |
| }, | |
| { | |
| "epoch": 0.864957264957265, | |
| "grad_norm": 0.07923685014247894, | |
| "learning_rate": 0.00011416309012875537, | |
| "loss": 0.4667, | |
| "num_input_tokens_seen": 3119008, | |
| "step": 506, | |
| "train_runtime": 2222.9295, | |
| "train_tokens_per_second": 1403.107 | |
| }, | |
| { | |
| "epoch": 0.8666666666666667, | |
| "grad_norm": 0.08297446370124817, | |
| "learning_rate": 0.00011399141630901288, | |
| "loss": 0.4381, | |
| "num_input_tokens_seen": 3126120, | |
| "step": 507, | |
| "train_runtime": 2227.4066, | |
| "train_tokens_per_second": 1403.48 | |
| }, | |
| { | |
| "epoch": 0.8683760683760684, | |
| "grad_norm": 0.09984984993934631, | |
| "learning_rate": 0.00011381974248927039, | |
| "loss": 0.5017, | |
| "num_input_tokens_seen": 3131432, | |
| "step": 508, | |
| "train_runtime": 2230.9301, | |
| "train_tokens_per_second": 1403.644 | |
| }, | |
| { | |
| "epoch": 0.8700854700854701, | |
| "grad_norm": 0.07992815226316452, | |
| "learning_rate": 0.0001136480686695279, | |
| "loss": 0.3426, | |
| "num_input_tokens_seen": 3137440, | |
| "step": 509, | |
| "train_runtime": 2234.8499, | |
| "train_tokens_per_second": 1403.871 | |
| }, | |
| { | |
| "epoch": 0.8717948717948718, | |
| "grad_norm": 0.09450999647378922, | |
| "learning_rate": 0.0001134763948497854, | |
| "loss": 0.417, | |
| "num_input_tokens_seen": 3142752, | |
| "step": 510, | |
| "train_runtime": 2238.3582, | |
| "train_tokens_per_second": 1404.043 | |
| }, | |
| { | |
| "epoch": 0.8735042735042735, | |
| "grad_norm": 0.09634573012590408, | |
| "learning_rate": 0.00011330472103004292, | |
| "loss": 0.4263, | |
| "num_input_tokens_seen": 3147904, | |
| "step": 511, | |
| "train_runtime": 2244.2827, | |
| "train_tokens_per_second": 1402.633 | |
| }, | |
| { | |
| "epoch": 0.8752136752136752, | |
| "grad_norm": 0.08692895621061325, | |
| "learning_rate": 0.00011313304721030042, | |
| "loss": 0.4547, | |
| "num_input_tokens_seen": 3155136, | |
| "step": 512, | |
| "train_runtime": 2248.902, | |
| "train_tokens_per_second": 1402.967 | |
| }, | |
| { | |
| "epoch": 0.8769230769230769, | |
| "grad_norm": 0.09777207672595978, | |
| "learning_rate": 0.00011296137339055794, | |
| "loss": 0.391, | |
| "num_input_tokens_seen": 3161728, | |
| "step": 513, | |
| "train_runtime": 2253.1795, | |
| "train_tokens_per_second": 1403.23 | |
| }, | |
| { | |
| "epoch": 0.8786324786324786, | |
| "grad_norm": 0.06957412511110306, | |
| "learning_rate": 0.00011278969957081547, | |
| "loss": 0.4446, | |
| "num_input_tokens_seen": 3168800, | |
| "step": 514, | |
| "train_runtime": 2257.7407, | |
| "train_tokens_per_second": 1403.527 | |
| }, | |
| { | |
| "epoch": 0.8803418803418803, | |
| "grad_norm": 0.09542404860258102, | |
| "learning_rate": 0.00011261802575107297, | |
| "loss": 0.4259, | |
| "num_input_tokens_seen": 3175224, | |
| "step": 515, | |
| "train_runtime": 2261.9216, | |
| "train_tokens_per_second": 1403.773 | |
| }, | |
| { | |
| "epoch": 0.882051282051282, | |
| "grad_norm": 0.08433569967746735, | |
| "learning_rate": 0.00011244635193133049, | |
| "loss": 0.3827, | |
| "num_input_tokens_seen": 3181096, | |
| "step": 516, | |
| "train_runtime": 2265.8164, | |
| "train_tokens_per_second": 1403.951 | |
| }, | |
| { | |
| "epoch": 0.8837606837606837, | |
| "grad_norm": 0.06952463835477829, | |
| "learning_rate": 0.00011227467811158799, | |
| "loss": 0.282, | |
| "num_input_tokens_seen": 3186880, | |
| "step": 517, | |
| "train_runtime": 2269.6547, | |
| "train_tokens_per_second": 1404.125 | |
| }, | |
| { | |
| "epoch": 0.8854700854700854, | |
| "grad_norm": 0.12418562173843384, | |
| "learning_rate": 0.0001121030042918455, | |
| "loss": 0.3922, | |
| "num_input_tokens_seen": 3194480, | |
| "step": 518, | |
| "train_runtime": 2274.5284, | |
| "train_tokens_per_second": 1404.458 | |
| }, | |
| { | |
| "epoch": 0.8871794871794871, | |
| "grad_norm": 0.10115774720907211, | |
| "learning_rate": 0.00011193133047210301, | |
| "loss": 0.4714, | |
| "num_input_tokens_seen": 3200424, | |
| "step": 519, | |
| "train_runtime": 2278.4811, | |
| "train_tokens_per_second": 1404.631 | |
| }, | |
| { | |
| "epoch": 0.8888888888888888, | |
| "grad_norm": 0.09031491726636887, | |
| "learning_rate": 0.00011175965665236052, | |
| "loss": 0.4023, | |
| "num_input_tokens_seen": 3205768, | |
| "step": 520, | |
| "train_runtime": 2282.1166, | |
| "train_tokens_per_second": 1404.735 | |
| }, | |
| { | |
| "epoch": 0.8905982905982905, | |
| "grad_norm": 0.08610999584197998, | |
| "learning_rate": 0.00011158798283261803, | |
| "loss": 0.3608, | |
| "num_input_tokens_seen": 3212416, | |
| "step": 521, | |
| "train_runtime": 2286.4575, | |
| "train_tokens_per_second": 1404.975 | |
| }, | |
| { | |
| "epoch": 0.8923076923076924, | |
| "grad_norm": 0.0851425752043724, | |
| "learning_rate": 0.00011141630901287554, | |
| "loss": 0.4337, | |
| "num_input_tokens_seen": 3217720, | |
| "step": 522, | |
| "train_runtime": 2290.031, | |
| "train_tokens_per_second": 1405.099 | |
| }, | |
| { | |
| "epoch": 0.8940170940170941, | |
| "grad_norm": 0.07973898947238922, | |
| "learning_rate": 0.00011124463519313306, | |
| "loss": 0.3752, | |
| "num_input_tokens_seen": 3222528, | |
| "step": 523, | |
| "train_runtime": 2293.2223, | |
| "train_tokens_per_second": 1405.24 | |
| }, | |
| { | |
| "epoch": 0.8957264957264958, | |
| "grad_norm": 0.0735258162021637, | |
| "learning_rate": 0.00011107296137339056, | |
| "loss": 0.2528, | |
| "num_input_tokens_seen": 3228424, | |
| "step": 524, | |
| "train_runtime": 2297.1669, | |
| "train_tokens_per_second": 1405.394 | |
| }, | |
| { | |
| "epoch": 0.8974358974358975, | |
| "grad_norm": 0.08155602961778641, | |
| "learning_rate": 0.00011090128755364808, | |
| "loss": 0.3476, | |
| "num_input_tokens_seen": 3233072, | |
| "step": 525, | |
| "train_runtime": 2300.3205, | |
| "train_tokens_per_second": 1405.488 | |
| }, | |
| { | |
| "epoch": 0.8991452991452992, | |
| "grad_norm": 0.12425163388252258, | |
| "learning_rate": 0.00011072961373390558, | |
| "loss": 0.4724, | |
| "num_input_tokens_seen": 3237264, | |
| "step": 526, | |
| "train_runtime": 2303.2241, | |
| "train_tokens_per_second": 1405.536 | |
| }, | |
| { | |
| "epoch": 0.9008547008547009, | |
| "grad_norm": 0.10108618438243866, | |
| "learning_rate": 0.0001105579399141631, | |
| "loss": 0.4843, | |
| "num_input_tokens_seen": 3241480, | |
| "step": 527, | |
| "train_runtime": 2306.1928, | |
| "train_tokens_per_second": 1405.555 | |
| }, | |
| { | |
| "epoch": 0.9025641025641026, | |
| "grad_norm": 0.10584156215190887, | |
| "learning_rate": 0.0001103862660944206, | |
| "loss": 0.4872, | |
| "num_input_tokens_seen": 3246152, | |
| "step": 528, | |
| "train_runtime": 2309.4182, | |
| "train_tokens_per_second": 1405.615 | |
| }, | |
| { | |
| "epoch": 0.9042735042735043, | |
| "grad_norm": 0.07442856580018997, | |
| "learning_rate": 0.00011021459227467811, | |
| "loss": 0.3933, | |
| "num_input_tokens_seen": 3253160, | |
| "step": 529, | |
| "train_runtime": 2313.9463, | |
| "train_tokens_per_second": 1405.893 | |
| }, | |
| { | |
| "epoch": 0.905982905982906, | |
| "grad_norm": 0.08017449080944061, | |
| "learning_rate": 0.00011004291845493561, | |
| "loss": 0.3851, | |
| "num_input_tokens_seen": 3260120, | |
| "step": 530, | |
| "train_runtime": 2318.4343, | |
| "train_tokens_per_second": 1406.173 | |
| }, | |
| { | |
| "epoch": 0.9076923076923077, | |
| "grad_norm": 0.08193705230951309, | |
| "learning_rate": 0.00010987124463519314, | |
| "loss": 0.4319, | |
| "num_input_tokens_seen": 3265248, | |
| "step": 531, | |
| "train_runtime": 2321.9214, | |
| "train_tokens_per_second": 1406.27 | |
| }, | |
| { | |
| "epoch": 0.9094017094017094, | |
| "grad_norm": 0.10451549291610718, | |
| "learning_rate": 0.00010969957081545066, | |
| "loss": 0.468, | |
| "num_input_tokens_seen": 3271504, | |
| "step": 532, | |
| "train_runtime": 2325.9367, | |
| "train_tokens_per_second": 1406.532 | |
| }, | |
| { | |
| "epoch": 0.9111111111111111, | |
| "grad_norm": 0.08480311930179596, | |
| "learning_rate": 0.00010952789699570816, | |
| "loss": 0.3204, | |
| "num_input_tokens_seen": 3277336, | |
| "step": 533, | |
| "train_runtime": 2329.8184, | |
| "train_tokens_per_second": 1406.692 | |
| }, | |
| { | |
| "epoch": 0.9128205128205128, | |
| "grad_norm": 0.11771999299526215, | |
| "learning_rate": 0.00010935622317596568, | |
| "loss": 0.4402, | |
| "num_input_tokens_seen": 3281200, | |
| "step": 534, | |
| "train_runtime": 2332.5771, | |
| "train_tokens_per_second": 1406.684 | |
| }, | |
| { | |
| "epoch": 0.9145299145299145, | |
| "grad_norm": 0.09482161700725555, | |
| "learning_rate": 0.00010918454935622318, | |
| "loss": 0.4203, | |
| "num_input_tokens_seen": 3288080, | |
| "step": 535, | |
| "train_runtime": 2336.9908, | |
| "train_tokens_per_second": 1406.972 | |
| }, | |
| { | |
| "epoch": 0.9162393162393162, | |
| "grad_norm": 0.08046115934848785, | |
| "learning_rate": 0.0001090128755364807, | |
| "loss": 0.3672, | |
| "num_input_tokens_seen": 3295160, | |
| "step": 536, | |
| "train_runtime": 2341.5133, | |
| "train_tokens_per_second": 1407.278 | |
| }, | |
| { | |
| "epoch": 0.9179487179487179, | |
| "grad_norm": 0.0700264498591423, | |
| "learning_rate": 0.0001088412017167382, | |
| "loss": 0.4366, | |
| "num_input_tokens_seen": 3304208, | |
| "step": 537, | |
| "train_runtime": 2347.0429, | |
| "train_tokens_per_second": 1407.817 | |
| }, | |
| { | |
| "epoch": 0.9196581196581196, | |
| "grad_norm": 0.0773264542222023, | |
| "learning_rate": 0.00010866952789699572, | |
| "loss": 0.3111, | |
| "num_input_tokens_seen": 3311160, | |
| "step": 538, | |
| "train_runtime": 2351.412, | |
| "train_tokens_per_second": 1408.158 | |
| }, | |
| { | |
| "epoch": 0.9213675213675213, | |
| "grad_norm": 0.09096362441778183, | |
| "learning_rate": 0.00010849785407725322, | |
| "loss": 0.3933, | |
| "num_input_tokens_seen": 3315912, | |
| "step": 539, | |
| "train_runtime": 2354.6076, | |
| "train_tokens_per_second": 1408.265 | |
| }, | |
| { | |
| "epoch": 0.9230769230769231, | |
| "grad_norm": 0.07224144041538239, | |
| "learning_rate": 0.00010832618025751073, | |
| "loss": 0.3323, | |
| "num_input_tokens_seen": 3324072, | |
| "step": 540, | |
| "train_runtime": 2359.683, | |
| "train_tokens_per_second": 1408.694 | |
| }, | |
| { | |
| "epoch": 0.9247863247863248, | |
| "grad_norm": 0.0825057327747345, | |
| "learning_rate": 0.00010815450643776825, | |
| "loss": 0.3806, | |
| "num_input_tokens_seen": 3328808, | |
| "step": 541, | |
| "train_runtime": 2364.9808, | |
| "train_tokens_per_second": 1407.541 | |
| }, | |
| { | |
| "epoch": 0.9264957264957265, | |
| "grad_norm": 0.09786176681518555, | |
| "learning_rate": 0.00010798283261802575, | |
| "loss": 0.3953, | |
| "num_input_tokens_seen": 3339576, | |
| "step": 542, | |
| "train_runtime": 2371.5338, | |
| "train_tokens_per_second": 1408.192 | |
| }, | |
| { | |
| "epoch": 0.9282051282051282, | |
| "grad_norm": 0.08032157272100449, | |
| "learning_rate": 0.00010781115879828327, | |
| "loss": 0.3554, | |
| "num_input_tokens_seen": 3346712, | |
| "step": 543, | |
| "train_runtime": 2376.1571, | |
| "train_tokens_per_second": 1408.456 | |
| }, | |
| { | |
| "epoch": 0.9299145299145299, | |
| "grad_norm": 0.07897566258907318, | |
| "learning_rate": 0.00010763948497854077, | |
| "loss": 0.4126, | |
| "num_input_tokens_seen": 3352832, | |
| "step": 544, | |
| "train_runtime": 2380.1411, | |
| "train_tokens_per_second": 1408.669 | |
| }, | |
| { | |
| "epoch": 0.9316239316239316, | |
| "grad_norm": 0.09934298694133759, | |
| "learning_rate": 0.0001074678111587983, | |
| "loss": 0.402, | |
| "num_input_tokens_seen": 3357992, | |
| "step": 545, | |
| "train_runtime": 2383.715, | |
| "train_tokens_per_second": 1408.722 | |
| }, | |
| { | |
| "epoch": 0.9333333333333333, | |
| "grad_norm": 0.11830101907253265, | |
| "learning_rate": 0.00010729613733905579, | |
| "loss": 0.3796, | |
| "num_input_tokens_seen": 3363672, | |
| "step": 546, | |
| "train_runtime": 2387.4938, | |
| "train_tokens_per_second": 1408.871 | |
| }, | |
| { | |
| "epoch": 0.935042735042735, | |
| "grad_norm": 0.09613929688930511, | |
| "learning_rate": 0.00010712446351931332, | |
| "loss": 0.4991, | |
| "num_input_tokens_seen": 3368520, | |
| "step": 547, | |
| "train_runtime": 2390.7547, | |
| "train_tokens_per_second": 1408.978 | |
| }, | |
| { | |
| "epoch": 0.9367521367521368, | |
| "grad_norm": 0.08919502049684525, | |
| "learning_rate": 0.0001069527896995708, | |
| "loss": 0.3698, | |
| "num_input_tokens_seen": 3373184, | |
| "step": 548, | |
| "train_runtime": 2393.9857, | |
| "train_tokens_per_second": 1409.024 | |
| }, | |
| { | |
| "epoch": 0.9384615384615385, | |
| "grad_norm": 0.09076035767793655, | |
| "learning_rate": 0.00010678111587982834, | |
| "loss": 0.541, | |
| "num_input_tokens_seen": 3378288, | |
| "step": 549, | |
| "train_runtime": 2397.3665, | |
| "train_tokens_per_second": 1409.166 | |
| }, | |
| { | |
| "epoch": 0.9401709401709402, | |
| "grad_norm": 0.07492446899414062, | |
| "learning_rate": 0.00010660944206008585, | |
| "loss": 0.4197, | |
| "num_input_tokens_seen": 3385600, | |
| "step": 550, | |
| "train_runtime": 2402.0343, | |
| "train_tokens_per_second": 1409.472 | |
| }, | |
| { | |
| "epoch": 0.9418803418803419, | |
| "grad_norm": 0.09239984303712845, | |
| "learning_rate": 0.00010643776824034335, | |
| "loss": 0.4034, | |
| "num_input_tokens_seen": 3390528, | |
| "step": 551, | |
| "train_runtime": 2405.2548, | |
| "train_tokens_per_second": 1409.634 | |
| }, | |
| { | |
| "epoch": 0.9435897435897436, | |
| "grad_norm": 0.0913330614566803, | |
| "learning_rate": 0.00010626609442060087, | |
| "loss": 0.3552, | |
| "num_input_tokens_seen": 3396984, | |
| "step": 552, | |
| "train_runtime": 2409.3976, | |
| "train_tokens_per_second": 1409.889 | |
| }, | |
| { | |
| "epoch": 0.9452991452991453, | |
| "grad_norm": 0.07622038573026657, | |
| "learning_rate": 0.00010609442060085837, | |
| "loss": 0.4532, | |
| "num_input_tokens_seen": 3404064, | |
| "step": 553, | |
| "train_runtime": 2413.8636, | |
| "train_tokens_per_second": 1410.214 | |
| }, | |
| { | |
| "epoch": 0.947008547008547, | |
| "grad_norm": 0.08276895433664322, | |
| "learning_rate": 0.00010592274678111589, | |
| "loss": 0.4015, | |
| "num_input_tokens_seen": 3411192, | |
| "step": 554, | |
| "train_runtime": 2418.3946, | |
| "train_tokens_per_second": 1410.519 | |
| }, | |
| { | |
| "epoch": 0.9487179487179487, | |
| "grad_norm": 0.11180777847766876, | |
| "learning_rate": 0.00010575107296137339, | |
| "loss": 0.3798, | |
| "num_input_tokens_seen": 3416296, | |
| "step": 555, | |
| "train_runtime": 2421.8251, | |
| "train_tokens_per_second": 1410.629 | |
| }, | |
| { | |
| "epoch": 0.9504273504273504, | |
| "grad_norm": 0.08645719289779663, | |
| "learning_rate": 0.0001055793991416309, | |
| "loss": 0.3381, | |
| "num_input_tokens_seen": 3422928, | |
| "step": 556, | |
| "train_runtime": 2426.0854, | |
| "train_tokens_per_second": 1410.885 | |
| }, | |
| { | |
| "epoch": 0.9521367521367521, | |
| "grad_norm": 0.0832013487815857, | |
| "learning_rate": 0.00010540772532188841, | |
| "loss": 0.4564, | |
| "num_input_tokens_seen": 3429968, | |
| "step": 557, | |
| "train_runtime": 2430.5605, | |
| "train_tokens_per_second": 1411.184 | |
| }, | |
| { | |
| "epoch": 0.9538461538461539, | |
| "grad_norm": 0.0959947481751442, | |
| "learning_rate": 0.00010523605150214593, | |
| "loss": 0.3677, | |
| "num_input_tokens_seen": 3436672, | |
| "step": 558, | |
| "train_runtime": 2434.8462, | |
| "train_tokens_per_second": 1411.453 | |
| }, | |
| { | |
| "epoch": 0.9555555555555556, | |
| "grad_norm": 0.11064450442790985, | |
| "learning_rate": 0.00010506437768240344, | |
| "loss": 0.4121, | |
| "num_input_tokens_seen": 3445016, | |
| "step": 559, | |
| "train_runtime": 2439.9861, | |
| "train_tokens_per_second": 1411.9 | |
| }, | |
| { | |
| "epoch": 0.9572649572649573, | |
| "grad_norm": 0.0816698893904686, | |
| "learning_rate": 0.00010489270386266094, | |
| "loss": 0.3565, | |
| "num_input_tokens_seen": 3452888, | |
| "step": 560, | |
| "train_runtime": 2444.9883, | |
| "train_tokens_per_second": 1412.231 | |
| }, | |
| { | |
| "epoch": 0.958974358974359, | |
| "grad_norm": 0.07744520902633667, | |
| "learning_rate": 0.00010472103004291847, | |
| "loss": 0.3107, | |
| "num_input_tokens_seen": 3458640, | |
| "step": 561, | |
| "train_runtime": 2448.7297, | |
| "train_tokens_per_second": 1412.422 | |
| }, | |
| { | |
| "epoch": 0.9606837606837607, | |
| "grad_norm": 0.08622029423713684, | |
| "learning_rate": 0.00010454935622317596, | |
| "loss": 0.4368, | |
| "num_input_tokens_seen": 3465472, | |
| "step": 562, | |
| "train_runtime": 2453.114, | |
| "train_tokens_per_second": 1412.683 | |
| }, | |
| { | |
| "epoch": 0.9623931623931624, | |
| "grad_norm": 0.13964629173278809, | |
| "learning_rate": 0.00010437768240343349, | |
| "loss": 0.3164, | |
| "num_input_tokens_seen": 3469568, | |
| "step": 563, | |
| "train_runtime": 2456.0226, | |
| "train_tokens_per_second": 1412.678 | |
| }, | |
| { | |
| "epoch": 0.9641025641025641, | |
| "grad_norm": 0.07157761603593826, | |
| "learning_rate": 0.00010420600858369098, | |
| "loss": 0.2602, | |
| "num_input_tokens_seen": 3488040, | |
| "step": 564, | |
| "train_runtime": 2474.1915, | |
| "train_tokens_per_second": 1409.77 | |
| }, | |
| { | |
| "epoch": 0.9658119658119658, | |
| "grad_norm": 0.08262784779071808, | |
| "learning_rate": 0.00010403433476394851, | |
| "loss": 0.5607, | |
| "num_input_tokens_seen": 3493808, | |
| "step": 565, | |
| "train_runtime": 2478.017, | |
| "train_tokens_per_second": 1409.921 | |
| }, | |
| { | |
| "epoch": 0.9675213675213675, | |
| "grad_norm": 0.07769016921520233, | |
| "learning_rate": 0.000103862660944206, | |
| "loss": 0.3689, | |
| "num_input_tokens_seen": 3501520, | |
| "step": 566, | |
| "train_runtime": 2482.9061, | |
| "train_tokens_per_second": 1410.251 | |
| }, | |
| { | |
| "epoch": 0.9692307692307692, | |
| "grad_norm": 0.08556525409221649, | |
| "learning_rate": 0.00010369098712446353, | |
| "loss": 0.3556, | |
| "num_input_tokens_seen": 3505560, | |
| "step": 567, | |
| "train_runtime": 2485.7706, | |
| "train_tokens_per_second": 1410.251 | |
| }, | |
| { | |
| "epoch": 0.9709401709401709, | |
| "grad_norm": 0.07327679544687271, | |
| "learning_rate": 0.00010351931330472104, | |
| "loss": 0.3068, | |
| "num_input_tokens_seen": 3510384, | |
| "step": 568, | |
| "train_runtime": 2489.0695, | |
| "train_tokens_per_second": 1410.32 | |
| }, | |
| { | |
| "epoch": 0.9726495726495726, | |
| "grad_norm": 0.0801009014248848, | |
| "learning_rate": 0.00010334763948497855, | |
| "loss": 0.3229, | |
| "num_input_tokens_seen": 3517104, | |
| "step": 569, | |
| "train_runtime": 2493.3461, | |
| "train_tokens_per_second": 1410.596 | |
| }, | |
| { | |
| "epoch": 0.9743589743589743, | |
| "grad_norm": 0.06246993690729141, | |
| "learning_rate": 0.00010317596566523606, | |
| "loss": 0.2222, | |
| "num_input_tokens_seen": 3526656, | |
| "step": 570, | |
| "train_runtime": 2499.1803, | |
| "train_tokens_per_second": 1411.125 | |
| }, | |
| { | |
| "epoch": 0.976068376068376, | |
| "grad_norm": 0.1202109083533287, | |
| "learning_rate": 0.00010300429184549356, | |
| "loss": 0.5679, | |
| "num_input_tokens_seen": 3531512, | |
| "step": 571, | |
| "train_runtime": 2504.4144, | |
| "train_tokens_per_second": 1410.115 | |
| }, | |
| { | |
| "epoch": 0.9777777777777777, | |
| "grad_norm": 0.08485902100801468, | |
| "learning_rate": 0.00010283261802575108, | |
| "loss": 0.3944, | |
| "num_input_tokens_seen": 3538680, | |
| "step": 572, | |
| "train_runtime": 2508.9249, | |
| "train_tokens_per_second": 1410.437 | |
| }, | |
| { | |
| "epoch": 0.9794871794871794, | |
| "grad_norm": 0.07959533482789993, | |
| "learning_rate": 0.00010266094420600858, | |
| "loss": 0.4062, | |
| "num_input_tokens_seen": 3546464, | |
| "step": 573, | |
| "train_runtime": 2513.8989, | |
| "train_tokens_per_second": 1410.742 | |
| }, | |
| { | |
| "epoch": 0.9811965811965812, | |
| "grad_norm": 0.09233636409044266, | |
| "learning_rate": 0.0001024892703862661, | |
| "loss": 0.3835, | |
| "num_input_tokens_seen": 3552456, | |
| "step": 574, | |
| "train_runtime": 2517.8592, | |
| "train_tokens_per_second": 1410.903 | |
| }, | |
| { | |
| "epoch": 0.9829059829059829, | |
| "grad_norm": 0.09226620197296143, | |
| "learning_rate": 0.0001023175965665236, | |
| "loss": 0.406, | |
| "num_input_tokens_seen": 3558408, | |
| "step": 575, | |
| "train_runtime": 2521.7196, | |
| "train_tokens_per_second": 1411.104 | |
| }, | |
| { | |
| "epoch": 0.9846153846153847, | |
| "grad_norm": 0.09293176978826523, | |
| "learning_rate": 0.00010214592274678112, | |
| "loss": 0.4517, | |
| "num_input_tokens_seen": 3562888, | |
| "step": 576, | |
| "train_runtime": 2524.8827, | |
| "train_tokens_per_second": 1411.11 | |
| }, | |
| { | |
| "epoch": 0.9863247863247864, | |
| "grad_norm": 0.09278377890586853, | |
| "learning_rate": 0.00010197424892703865, | |
| "loss": 0.3824, | |
| "num_input_tokens_seen": 3569056, | |
| "step": 577, | |
| "train_runtime": 2528.8642, | |
| "train_tokens_per_second": 1411.328 | |
| }, | |
| { | |
| "epoch": 0.9880341880341881, | |
| "grad_norm": 0.08279518783092499, | |
| "learning_rate": 0.00010180257510729614, | |
| "loss": 0.3324, | |
| "num_input_tokens_seen": 3575144, | |
| "step": 578, | |
| "train_runtime": 2532.8766, | |
| "train_tokens_per_second": 1411.496 | |
| }, | |
| { | |
| "epoch": 0.9897435897435898, | |
| "grad_norm": 0.10000254958868027, | |
| "learning_rate": 0.00010163090128755366, | |
| "loss": 0.5108, | |
| "num_input_tokens_seen": 3581656, | |
| "step": 579, | |
| "train_runtime": 2537.0696, | |
| "train_tokens_per_second": 1411.729 | |
| }, | |
| { | |
| "epoch": 0.9914529914529915, | |
| "grad_norm": 0.08659250289201736, | |
| "learning_rate": 0.00010145922746781115, | |
| "loss": 0.4577, | |
| "num_input_tokens_seen": 3587680, | |
| "step": 580, | |
| "train_runtime": 2541.0662, | |
| "train_tokens_per_second": 1411.88 | |
| }, | |
| { | |
| "epoch": 0.9931623931623932, | |
| "grad_norm": 0.07771515846252441, | |
| "learning_rate": 0.00010128755364806868, | |
| "loss": 0.4422, | |
| "num_input_tokens_seen": 3593504, | |
| "step": 581, | |
| "train_runtime": 2544.9092, | |
| "train_tokens_per_second": 1412.036 | |
| }, | |
| { | |
| "epoch": 0.9948717948717949, | |
| "grad_norm": 0.07676418870687485, | |
| "learning_rate": 0.00010111587982832617, | |
| "loss": 0.3758, | |
| "num_input_tokens_seen": 3600384, | |
| "step": 582, | |
| "train_runtime": 2549.2938, | |
| "train_tokens_per_second": 1412.306 | |
| }, | |
| { | |
| "epoch": 0.9965811965811966, | |
| "grad_norm": 0.08909256011247635, | |
| "learning_rate": 0.0001009442060085837, | |
| "loss": 0.3669, | |
| "num_input_tokens_seen": 3605464, | |
| "step": 583, | |
| "train_runtime": 2552.6971, | |
| "train_tokens_per_second": 1412.414 | |
| }, | |
| { | |
| "epoch": 0.9982905982905983, | |
| "grad_norm": 0.08806303888559341, | |
| "learning_rate": 0.00010077253218884119, | |
| "loss": 0.3305, | |
| "num_input_tokens_seen": 3611536, | |
| "step": 584, | |
| "train_runtime": 2556.5698, | |
| "train_tokens_per_second": 1412.649 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 0.08583690226078033, | |
| "learning_rate": 0.00010060085836909872, | |
| "loss": 0.3828, | |
| "num_input_tokens_seen": 3618422, | |
| "step": 585, | |
| "train_runtime": 2560.9505, | |
| "train_tokens_per_second": 1412.921 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_loss": 0.39605432748794556, | |
| "eval_runtime": 40.3316, | |
| "eval_samples_per_second": 24.745, | |
| "eval_steps_per_second": 3.099, | |
| "num_input_tokens_seen": 3618422, | |
| "step": 585 | |
| }, | |
| { | |
| "epoch": 1.0017094017094017, | |
| "grad_norm": 0.08948741853237152, | |
| "learning_rate": 0.00010042918454935624, | |
| "loss": 0.3274, | |
| "num_input_tokens_seen": 3622718, | |
| "step": 586, | |
| "train_runtime": 2604.2915, | |
| "train_tokens_per_second": 1391.057 | |
| }, | |
| { | |
| "epoch": 1.0034188034188034, | |
| "grad_norm": 0.08865802735090256, | |
| "learning_rate": 0.00010025751072961374, | |
| "loss": 0.3752, | |
| "num_input_tokens_seen": 3628366, | |
| "step": 587, | |
| "train_runtime": 2608.0141, | |
| "train_tokens_per_second": 1391.237 | |
| }, | |
| { | |
| "epoch": 1.005128205128205, | |
| "grad_norm": 0.08882749825716019, | |
| "learning_rate": 0.00010008583690987125, | |
| "loss": 0.3247, | |
| "num_input_tokens_seen": 3634422, | |
| "step": 588, | |
| "train_runtime": 2611.9678, | |
| "train_tokens_per_second": 1391.45 | |
| }, | |
| { | |
| "epoch": 1.0068376068376068, | |
| "grad_norm": 0.07764381170272827, | |
| "learning_rate": 9.991416309012877e-05, | |
| "loss": 0.3212, | |
| "num_input_tokens_seen": 3642062, | |
| "step": 589, | |
| "train_runtime": 2616.7435, | |
| "train_tokens_per_second": 1391.83 | |
| }, | |
| { | |
| "epoch": 1.0085470085470085, | |
| "grad_norm": 0.07668716460466385, | |
| "learning_rate": 9.974248927038627e-05, | |
| "loss": 0.2789, | |
| "num_input_tokens_seen": 3647678, | |
| "step": 590, | |
| "train_runtime": 2620.4702, | |
| "train_tokens_per_second": 1391.994 | |
| }, | |
| { | |
| "epoch": 1.0102564102564102, | |
| "grad_norm": 0.08743472397327423, | |
| "learning_rate": 9.957081545064379e-05, | |
| "loss": 0.4002, | |
| "num_input_tokens_seen": 3652086, | |
| "step": 591, | |
| "train_runtime": 2623.6804, | |
| "train_tokens_per_second": 1391.971 | |
| }, | |
| { | |
| "epoch": 1.011965811965812, | |
| "grad_norm": 0.0788293108344078, | |
| "learning_rate": 9.939914163090129e-05, | |
| "loss": 0.3955, | |
| "num_input_tokens_seen": 3658766, | |
| "step": 592, | |
| "train_runtime": 2627.9769, | |
| "train_tokens_per_second": 1392.237 | |
| }, | |
| { | |
| "epoch": 1.0136752136752136, | |
| "grad_norm": 0.08279833942651749, | |
| "learning_rate": 9.92274678111588e-05, | |
| "loss": 0.3241, | |
| "num_input_tokens_seen": 3663790, | |
| "step": 593, | |
| "train_runtime": 2631.3729, | |
| "train_tokens_per_second": 1392.349 | |
| }, | |
| { | |
| "epoch": 1.0153846153846153, | |
| "grad_norm": 0.09472624957561493, | |
| "learning_rate": 9.905579399141631e-05, | |
| "loss": 0.319, | |
| "num_input_tokens_seen": 3667814, | |
| "step": 594, | |
| "train_runtime": 2634.1893, | |
| "train_tokens_per_second": 1392.388 | |
| }, | |
| { | |
| "epoch": 1.017094017094017, | |
| "grad_norm": 0.0776962861418724, | |
| "learning_rate": 9.888412017167382e-05, | |
| "loss": 0.3256, | |
| "num_input_tokens_seen": 3673086, | |
| "step": 595, | |
| "train_runtime": 2637.6636, | |
| "train_tokens_per_second": 1392.553 | |
| }, | |
| { | |
| "epoch": 1.0188034188034187, | |
| "grad_norm": 0.08131415396928787, | |
| "learning_rate": 9.871244635193133e-05, | |
| "loss": 0.4514, | |
| "num_input_tokens_seen": 3679750, | |
| "step": 596, | |
| "train_runtime": 2642.0566, | |
| "train_tokens_per_second": 1392.76 | |
| }, | |
| { | |
| "epoch": 1.0205128205128204, | |
| "grad_norm": 0.08639644086360931, | |
| "learning_rate": 9.854077253218884e-05, | |
| "loss": 0.4259, | |
| "num_input_tokens_seen": 3686286, | |
| "step": 597, | |
| "train_runtime": 2646.3002, | |
| "train_tokens_per_second": 1392.996 | |
| }, | |
| { | |
| "epoch": 1.0222222222222221, | |
| "grad_norm": 0.07753600180149078, | |
| "learning_rate": 9.836909871244636e-05, | |
| "loss": 0.345, | |
| "num_input_tokens_seen": 3692046, | |
| "step": 598, | |
| "train_runtime": 2650.0207, | |
| "train_tokens_per_second": 1393.214 | |
| }, | |
| { | |
| "epoch": 1.0239316239316238, | |
| "grad_norm": 0.1012101024389267, | |
| "learning_rate": 9.819742489270387e-05, | |
| "loss": 0.43, | |
| "num_input_tokens_seen": 3698230, | |
| "step": 599, | |
| "train_runtime": 2654.0616, | |
| "train_tokens_per_second": 1393.423 | |
| }, | |
| { | |
| "epoch": 1.0256410256410255, | |
| "grad_norm": 0.08087831735610962, | |
| "learning_rate": 9.802575107296138e-05, | |
| "loss": 0.2885, | |
| "num_input_tokens_seen": 3705894, | |
| "step": 600, | |
| "train_runtime": 2658.9893, | |
| "train_tokens_per_second": 1393.723 | |
| }, | |
| { | |
| "epoch": 1.0273504273504273, | |
| "grad_norm": 0.09200716018676758, | |
| "learning_rate": 9.785407725321889e-05, | |
| "loss": 0.3635, | |
| "num_input_tokens_seen": 3712206, | |
| "step": 601, | |
| "train_runtime": 2665.0844, | |
| "train_tokens_per_second": 1392.904 | |
| }, | |
| { | |
| "epoch": 1.029059829059829, | |
| "grad_norm": 0.08871855586767197, | |
| "learning_rate": 9.76824034334764e-05, | |
| "loss": 0.3291, | |
| "num_input_tokens_seen": 3718302, | |
| "step": 602, | |
| "train_runtime": 2669.0702, | |
| "train_tokens_per_second": 1393.108 | |
| }, | |
| { | |
| "epoch": 1.0307692307692307, | |
| "grad_norm": 0.08718711137771606, | |
| "learning_rate": 9.751072961373391e-05, | |
| "loss": 0.343, | |
| "num_input_tokens_seen": 3722894, | |
| "step": 603, | |
| "train_runtime": 2672.2548, | |
| "train_tokens_per_second": 1393.166 | |
| }, | |
| { | |
| "epoch": 1.0324786324786326, | |
| "grad_norm": 0.1148778423666954, | |
| "learning_rate": 9.733905579399141e-05, | |
| "loss": 0.46, | |
| "num_input_tokens_seen": 3728318, | |
| "step": 604, | |
| "train_runtime": 2675.8538, | |
| "train_tokens_per_second": 1393.319 | |
| }, | |
| { | |
| "epoch": 1.0341880341880343, | |
| "grad_norm": 0.09517476707696915, | |
| "learning_rate": 9.716738197424893e-05, | |
| "loss": 0.3318, | |
| "num_input_tokens_seen": 3733382, | |
| "step": 605, | |
| "train_runtime": 2679.2474, | |
| "train_tokens_per_second": 1393.444 | |
| }, | |
| { | |
| "epoch": 1.035897435897436, | |
| "grad_norm": 0.08098772168159485, | |
| "learning_rate": 9.699570815450643e-05, | |
| "loss": 0.4015, | |
| "num_input_tokens_seen": 3740134, | |
| "step": 606, | |
| "train_runtime": 2683.621, | |
| "train_tokens_per_second": 1393.689 | |
| }, | |
| { | |
| "epoch": 1.0376068376068377, | |
| "grad_norm": 0.08234472572803497, | |
| "learning_rate": 9.682403433476396e-05, | |
| "loss": 0.3397, | |
| "num_input_tokens_seen": 3748294, | |
| "step": 607, | |
| "train_runtime": 2688.737, | |
| "train_tokens_per_second": 1394.072 | |
| }, | |
| { | |
| "epoch": 1.0393162393162394, | |
| "grad_norm": 0.09244134277105331, | |
| "learning_rate": 9.665236051502146e-05, | |
| "loss": 0.4135, | |
| "num_input_tokens_seen": 3757438, | |
| "step": 608, | |
| "train_runtime": 2694.5363, | |
| "train_tokens_per_second": 1394.466 | |
| }, | |
| { | |
| "epoch": 1.041025641025641, | |
| "grad_norm": 0.10387304425239563, | |
| "learning_rate": 9.648068669527898e-05, | |
| "loss": 0.3957, | |
| "num_input_tokens_seen": 3764318, | |
| "step": 609, | |
| "train_runtime": 2699.0049, | |
| "train_tokens_per_second": 1394.706 | |
| }, | |
| { | |
| "epoch": 1.0427350427350428, | |
| "grad_norm": 0.10354664921760559, | |
| "learning_rate": 9.630901287553648e-05, | |
| "loss": 0.3482, | |
| "num_input_tokens_seen": 3768958, | |
| "step": 610, | |
| "train_runtime": 2702.2905, | |
| "train_tokens_per_second": 1394.727 | |
| }, | |
| { | |
| "epoch": 1.0444444444444445, | |
| "grad_norm": 0.09723416715860367, | |
| "learning_rate": 9.6137339055794e-05, | |
| "loss": 0.3646, | |
| "num_input_tokens_seen": 3774318, | |
| "step": 611, | |
| "train_runtime": 2705.8739, | |
| "train_tokens_per_second": 1394.861 | |
| }, | |
| { | |
| "epoch": 1.0461538461538462, | |
| "grad_norm": 0.12522576749324799, | |
| "learning_rate": 9.59656652360515e-05, | |
| "loss": 0.4124, | |
| "num_input_tokens_seen": 3778782, | |
| "step": 612, | |
| "train_runtime": 2708.8626, | |
| "train_tokens_per_second": 1394.97 | |
| }, | |
| { | |
| "epoch": 1.047863247863248, | |
| "grad_norm": 0.07524297386407852, | |
| "learning_rate": 9.579399141630902e-05, | |
| "loss": 0.2649, | |
| "num_input_tokens_seen": 3791542, | |
| "step": 613, | |
| "train_runtime": 2716.6371, | |
| "train_tokens_per_second": 1395.675 | |
| }, | |
| { | |
| "epoch": 1.0495726495726496, | |
| "grad_norm": 0.09840003401041031, | |
| "learning_rate": 9.562231759656652e-05, | |
| "loss": 0.2911, | |
| "num_input_tokens_seen": 3798062, | |
| "step": 614, | |
| "train_runtime": 2720.7491, | |
| "train_tokens_per_second": 1395.962 | |
| }, | |
| { | |
| "epoch": 1.0512820512820513, | |
| "grad_norm": 0.08430645614862442, | |
| "learning_rate": 9.545064377682403e-05, | |
| "loss": 0.2807, | |
| "num_input_tokens_seen": 3805886, | |
| "step": 615, | |
| "train_runtime": 2725.6421, | |
| "train_tokens_per_second": 1396.326 | |
| }, | |
| { | |
| "epoch": 1.052991452991453, | |
| "grad_norm": 0.09602045267820358, | |
| "learning_rate": 9.527896995708155e-05, | |
| "loss": 0.3352, | |
| "num_input_tokens_seen": 3812678, | |
| "step": 616, | |
| "train_runtime": 2729.9694, | |
| "train_tokens_per_second": 1396.601 | |
| }, | |
| { | |
| "epoch": 1.0547008547008547, | |
| "grad_norm": 0.11685816943645477, | |
| "learning_rate": 9.510729613733907e-05, | |
| "loss": 0.3145, | |
| "num_input_tokens_seen": 3817918, | |
| "step": 617, | |
| "train_runtime": 2733.4384, | |
| "train_tokens_per_second": 1396.746 | |
| }, | |
| { | |
| "epoch": 1.0564102564102564, | |
| "grad_norm": 0.10211452841758728, | |
| "learning_rate": 9.493562231759657e-05, | |
| "loss": 0.4132, | |
| "num_input_tokens_seen": 3823910, | |
| "step": 618, | |
| "train_runtime": 2737.3388, | |
| "train_tokens_per_second": 1396.944 | |
| }, | |
| { | |
| "epoch": 1.0581196581196581, | |
| "grad_norm": 0.08317096531391144, | |
| "learning_rate": 9.476394849785408e-05, | |
| "loss": 0.3044, | |
| "num_input_tokens_seen": 3831590, | |
| "step": 619, | |
| "train_runtime": 2742.2732, | |
| "train_tokens_per_second": 1397.231 | |
| }, | |
| { | |
| "epoch": 1.0598290598290598, | |
| "grad_norm": 0.10162318497896194, | |
| "learning_rate": 9.459227467811159e-05, | |
| "loss": 0.3509, | |
| "num_input_tokens_seen": 3838574, | |
| "step": 620, | |
| "train_runtime": 2746.7086, | |
| "train_tokens_per_second": 1397.518 | |
| }, | |
| { | |
| "epoch": 1.0615384615384615, | |
| "grad_norm": 0.11026163399219513, | |
| "learning_rate": 9.44206008583691e-05, | |
| "loss": 0.3539, | |
| "num_input_tokens_seen": 3845406, | |
| "step": 621, | |
| "train_runtime": 2750.9862, | |
| "train_tokens_per_second": 1397.828 | |
| }, | |
| { | |
| "epoch": 1.0632478632478632, | |
| "grad_norm": 0.10371764004230499, | |
| "learning_rate": 9.42489270386266e-05, | |
| "loss": 0.3829, | |
| "num_input_tokens_seen": 3851846, | |
| "step": 622, | |
| "train_runtime": 2755.1883, | |
| "train_tokens_per_second": 1398.034 | |
| }, | |
| { | |
| "epoch": 1.064957264957265, | |
| "grad_norm": 0.12548448145389557, | |
| "learning_rate": 9.407725321888412e-05, | |
| "loss": 0.4213, | |
| "num_input_tokens_seen": 3857550, | |
| "step": 623, | |
| "train_runtime": 2758.8716, | |
| "train_tokens_per_second": 1398.235 | |
| }, | |
| { | |
| "epoch": 1.0666666666666667, | |
| "grad_norm": 0.10498113930225372, | |
| "learning_rate": 9.390557939914162e-05, | |
| "loss": 0.4485, | |
| "num_input_tokens_seen": 3863470, | |
| "step": 624, | |
| "train_runtime": 2762.81, | |
| "train_tokens_per_second": 1398.384 | |
| }, | |
| { | |
| "epoch": 1.0683760683760684, | |
| "grad_norm": 0.1048503890633583, | |
| "learning_rate": 9.373390557939915e-05, | |
| "loss": 0.3127, | |
| "num_input_tokens_seen": 3869654, | |
| "step": 625, | |
| "train_runtime": 2766.7958, | |
| "train_tokens_per_second": 1398.605 | |
| }, | |
| { | |
| "epoch": 1.07008547008547, | |
| "grad_norm": 0.09524165093898773, | |
| "learning_rate": 9.356223175965666e-05, | |
| "loss": 0.3127, | |
| "num_input_tokens_seen": 3878486, | |
| "step": 626, | |
| "train_runtime": 2772.2649, | |
| "train_tokens_per_second": 1399.032 | |
| }, | |
| { | |
| "epoch": 1.0717948717948718, | |
| "grad_norm": 0.10186054557561874, | |
| "learning_rate": 9.339055793991417e-05, | |
| "loss": 0.3342, | |
| "num_input_tokens_seen": 3883590, | |
| "step": 627, | |
| "train_runtime": 2775.6835, | |
| "train_tokens_per_second": 1399.147 | |
| }, | |
| { | |
| "epoch": 1.0735042735042735, | |
| "grad_norm": 0.09904703497886658, | |
| "learning_rate": 9.321888412017167e-05, | |
| "loss": 0.3603, | |
| "num_input_tokens_seen": 3890358, | |
| "step": 628, | |
| "train_runtime": 2780.0801, | |
| "train_tokens_per_second": 1399.369 | |
| }, | |
| { | |
| "epoch": 1.0752136752136752, | |
| "grad_norm": 0.11625757068395615, | |
| "learning_rate": 9.304721030042919e-05, | |
| "loss": 0.4212, | |
| "num_input_tokens_seen": 3895574, | |
| "step": 629, | |
| "train_runtime": 2783.6001, | |
| "train_tokens_per_second": 1399.473 | |
| }, | |
| { | |
| "epoch": 1.0769230769230769, | |
| "grad_norm": 0.09834125638008118, | |
| "learning_rate": 9.287553648068669e-05, | |
| "loss": 0.3934, | |
| "num_input_tokens_seen": 3903326, | |
| "step": 630, | |
| "train_runtime": 2788.4609, | |
| "train_tokens_per_second": 1399.814 | |
| }, | |
| { | |
| "epoch": 1.0786324786324786, | |
| "grad_norm": 0.11049104481935501, | |
| "learning_rate": 9.270386266094421e-05, | |
| "loss": 0.3621, | |
| "num_input_tokens_seen": 3909342, | |
| "step": 631, | |
| "train_runtime": 2794.4207, | |
| "train_tokens_per_second": 1398.981 | |
| }, | |
| { | |
| "epoch": 1.0803418803418803, | |
| "grad_norm": 0.1120554581284523, | |
| "learning_rate": 9.253218884120171e-05, | |
| "loss": 0.3118, | |
| "num_input_tokens_seen": 3914966, | |
| "step": 632, | |
| "train_runtime": 2798.1277, | |
| "train_tokens_per_second": 1399.138 | |
| }, | |
| { | |
| "epoch": 1.082051282051282, | |
| "grad_norm": 0.11459173262119293, | |
| "learning_rate": 9.236051502145924e-05, | |
| "loss": 0.3686, | |
| "num_input_tokens_seen": 3921462, | |
| "step": 633, | |
| "train_runtime": 2802.3884, | |
| "train_tokens_per_second": 1399.328 | |
| }, | |
| { | |
| "epoch": 1.0837606837606837, | |
| "grad_norm": 0.11084756255149841, | |
| "learning_rate": 9.218884120171674e-05, | |
| "loss": 0.3529, | |
| "num_input_tokens_seen": 3927558, | |
| "step": 634, | |
| "train_runtime": 2806.299, | |
| "train_tokens_per_second": 1399.551 | |
| }, | |
| { | |
| "epoch": 1.0854700854700854, | |
| "grad_norm": 0.12373020499944687, | |
| "learning_rate": 9.201716738197426e-05, | |
| "loss": 0.4522, | |
| "num_input_tokens_seen": 3932094, | |
| "step": 635, | |
| "train_runtime": 2809.3759, | |
| "train_tokens_per_second": 1399.633 | |
| }, | |
| { | |
| "epoch": 1.087179487179487, | |
| "grad_norm": 0.08477049320936203, | |
| "learning_rate": 9.184549356223176e-05, | |
| "loss": 0.3035, | |
| "num_input_tokens_seen": 3941230, | |
| "step": 636, | |
| "train_runtime": 2815.0844, | |
| "train_tokens_per_second": 1400.04 | |
| }, | |
| { | |
| "epoch": 1.0888888888888888, | |
| "grad_norm": 0.1090676486492157, | |
| "learning_rate": 9.167381974248928e-05, | |
| "loss": 0.4409, | |
| "num_input_tokens_seen": 3947470, | |
| "step": 637, | |
| "train_runtime": 2819.144, | |
| "train_tokens_per_second": 1400.237 | |
| }, | |
| { | |
| "epoch": 1.0905982905982905, | |
| "grad_norm": 0.12120052427053452, | |
| "learning_rate": 9.150214592274678e-05, | |
| "loss": 0.4599, | |
| "num_input_tokens_seen": 3953878, | |
| "step": 638, | |
| "train_runtime": 2823.1637, | |
| "train_tokens_per_second": 1400.513 | |
| }, | |
| { | |
| "epoch": 1.0923076923076924, | |
| "grad_norm": 0.11783261597156525, | |
| "learning_rate": 9.13304721030043e-05, | |
| "loss": 0.3354, | |
| "num_input_tokens_seen": 3958406, | |
| "step": 639, | |
| "train_runtime": 2826.2247, | |
| "train_tokens_per_second": 1400.598 | |
| }, | |
| { | |
| "epoch": 1.0940170940170941, | |
| "grad_norm": 0.09893219918012619, | |
| "learning_rate": 9.115879828326181e-05, | |
| "loss": 0.2526, | |
| "num_input_tokens_seen": 3964966, | |
| "step": 640, | |
| "train_runtime": 2830.4214, | |
| "train_tokens_per_second": 1400.839 | |
| }, | |
| { | |
| "epoch": 1.0957264957264958, | |
| "grad_norm": 0.12095890194177628, | |
| "learning_rate": 9.098712446351931e-05, | |
| "loss": 0.3913, | |
| "num_input_tokens_seen": 3971974, | |
| "step": 641, | |
| "train_runtime": 2834.9317, | |
| "train_tokens_per_second": 1401.083 | |
| }, | |
| { | |
| "epoch": 1.0974358974358975, | |
| "grad_norm": 0.10970400273799896, | |
| "learning_rate": 9.081545064377683e-05, | |
| "loss": 0.2948, | |
| "num_input_tokens_seen": 3977078, | |
| "step": 642, | |
| "train_runtime": 2838.3405, | |
| "train_tokens_per_second": 1401.198 | |
| }, | |
| { | |
| "epoch": 1.0991452991452992, | |
| "grad_norm": 0.11889484524726868, | |
| "learning_rate": 9.064377682403434e-05, | |
| "loss": 0.335, | |
| "num_input_tokens_seen": 3984550, | |
| "step": 643, | |
| "train_runtime": 2842.9124, | |
| "train_tokens_per_second": 1401.573 | |
| }, | |
| { | |
| "epoch": 1.100854700854701, | |
| "grad_norm": 0.09870035946369171, | |
| "learning_rate": 9.047210300429185e-05, | |
| "loss": 0.2858, | |
| "num_input_tokens_seen": 3991398, | |
| "step": 644, | |
| "train_runtime": 2847.409, | |
| "train_tokens_per_second": 1401.765 | |
| }, | |
| { | |
| "epoch": 1.1025641025641026, | |
| "grad_norm": 0.13711033761501312, | |
| "learning_rate": 9.030042918454936e-05, | |
| "loss": 0.3647, | |
| "num_input_tokens_seen": 3995926, | |
| "step": 645, | |
| "train_runtime": 2850.5247, | |
| "train_tokens_per_second": 1401.821 | |
| }, | |
| { | |
| "epoch": 1.1042735042735043, | |
| "grad_norm": 0.10438720136880875, | |
| "learning_rate": 9.012875536480687e-05, | |
| "loss": 0.2409, | |
| "num_input_tokens_seen": 4003198, | |
| "step": 646, | |
| "train_runtime": 2855.1319, | |
| "train_tokens_per_second": 1402.106 | |
| }, | |
| { | |
| "epoch": 1.105982905982906, | |
| "grad_norm": 0.15836024284362793, | |
| "learning_rate": 8.995708154506438e-05, | |
| "loss": 0.3368, | |
| "num_input_tokens_seen": 4008270, | |
| "step": 647, | |
| "train_runtime": 2858.5235, | |
| "train_tokens_per_second": 1402.217 | |
| }, | |
| { | |
| "epoch": 1.1076923076923078, | |
| "grad_norm": 0.10418689996004105, | |
| "learning_rate": 8.97854077253219e-05, | |
| "loss": 0.3241, | |
| "num_input_tokens_seen": 4014838, | |
| "step": 648, | |
| "train_runtime": 2862.7868, | |
| "train_tokens_per_second": 1402.423 | |
| }, | |
| { | |
| "epoch": 1.1094017094017095, | |
| "grad_norm": 0.1044258251786232, | |
| "learning_rate": 8.96137339055794e-05, | |
| "loss": 0.2804, | |
| "num_input_tokens_seen": 4022990, | |
| "step": 649, | |
| "train_runtime": 2867.905, | |
| "train_tokens_per_second": 1402.763 | |
| }, | |
| { | |
| "epoch": 1.1111111111111112, | |
| "grad_norm": 0.10561820864677429, | |
| "learning_rate": 8.944206008583692e-05, | |
| "loss": 0.2887, | |
| "num_input_tokens_seen": 4030286, | |
| "step": 650, | |
| "train_runtime": 2872.5702, | |
| "train_tokens_per_second": 1403.024 | |
| }, | |
| { | |
| "epoch": 1.1128205128205129, | |
| "grad_norm": 0.11144879460334778, | |
| "learning_rate": 8.927038626609443e-05, | |
| "loss": 0.3114, | |
| "num_input_tokens_seen": 4036790, | |
| "step": 651, | |
| "train_runtime": 2876.8141, | |
| "train_tokens_per_second": 1403.215 | |
| }, | |
| { | |
| "epoch": 1.1145299145299146, | |
| "grad_norm": 0.14294514060020447, | |
| "learning_rate": 8.909871244635193e-05, | |
| "loss": 0.3772, | |
| "num_input_tokens_seen": 4040950, | |
| "step": 652, | |
| "train_runtime": 2879.6357, | |
| "train_tokens_per_second": 1403.285 | |
| }, | |
| { | |
| "epoch": 1.1162393162393163, | |
| "grad_norm": 0.1573735773563385, | |
| "learning_rate": 8.892703862660945e-05, | |
| "loss": 0.3632, | |
| "num_input_tokens_seen": 4045150, | |
| "step": 653, | |
| "train_runtime": 2882.5288, | |
| "train_tokens_per_second": 1403.334 | |
| }, | |
| { | |
| "epoch": 1.117948717948718, | |
| "grad_norm": 0.12260954082012177, | |
| "learning_rate": 8.875536480686695e-05, | |
| "loss": 0.3622, | |
| "num_input_tokens_seen": 4051350, | |
| "step": 654, | |
| "train_runtime": 2886.5663, | |
| "train_tokens_per_second": 1403.519 | |
| }, | |
| { | |
| "epoch": 1.1196581196581197, | |
| "grad_norm": 0.12595947086811066, | |
| "learning_rate": 8.858369098712447e-05, | |
| "loss": 0.3106, | |
| "num_input_tokens_seen": 4055846, | |
| "step": 655, | |
| "train_runtime": 2889.7758, | |
| "train_tokens_per_second": 1403.516 | |
| }, | |
| { | |
| "epoch": 1.1213675213675214, | |
| "grad_norm": 0.10922437906265259, | |
| "learning_rate": 8.841201716738198e-05, | |
| "loss": 0.3463, | |
| "num_input_tokens_seen": 4064006, | |
| "step": 656, | |
| "train_runtime": 2894.9551, | |
| "train_tokens_per_second": 1403.824 | |
| }, | |
| { | |
| "epoch": 1.123076923076923, | |
| "grad_norm": 0.13162162899971008, | |
| "learning_rate": 8.824034334763949e-05, | |
| "loss": 0.3693, | |
| "num_input_tokens_seen": 4069158, | |
| "step": 657, | |
| "train_runtime": 2898.4174, | |
| "train_tokens_per_second": 1403.924 | |
| }, | |
| { | |
| "epoch": 1.1247863247863248, | |
| "grad_norm": 0.09306973218917847, | |
| "learning_rate": 8.8068669527897e-05, | |
| "loss": 0.2135, | |
| "num_input_tokens_seen": 4075910, | |
| "step": 658, | |
| "train_runtime": 2902.7564, | |
| "train_tokens_per_second": 1404.152 | |
| }, | |
| { | |
| "epoch": 1.1264957264957265, | |
| "grad_norm": 0.11251482367515564, | |
| "learning_rate": 8.78969957081545e-05, | |
| "loss": 0.2678, | |
| "num_input_tokens_seen": 4083350, | |
| "step": 659, | |
| "train_runtime": 2907.453, | |
| "train_tokens_per_second": 1404.442 | |
| }, | |
| { | |
| "epoch": 1.1282051282051282, | |
| "grad_norm": 0.11792943626642227, | |
| "learning_rate": 8.772532188841202e-05, | |
| "loss": 0.3796, | |
| "num_input_tokens_seen": 4088502, | |
| "step": 660, | |
| "train_runtime": 2910.9225, | |
| "train_tokens_per_second": 1404.538 | |
| }, | |
| { | |
| "epoch": 1.12991452991453, | |
| "grad_norm": 0.13532239198684692, | |
| "learning_rate": 8.755364806866954e-05, | |
| "loss": 0.3234, | |
| "num_input_tokens_seen": 4094158, | |
| "step": 661, | |
| "train_runtime": 2916.6295, | |
| "train_tokens_per_second": 1403.729 | |
| }, | |
| { | |
| "epoch": 1.1316239316239316, | |
| "grad_norm": 0.1649348884820938, | |
| "learning_rate": 8.738197424892704e-05, | |
| "loss": 0.2733, | |
| "num_input_tokens_seen": 4100614, | |
| "step": 662, | |
| "train_runtime": 2920.8065, | |
| "train_tokens_per_second": 1403.932 | |
| }, | |
| { | |
| "epoch": 1.1333333333333333, | |
| "grad_norm": 0.12547938525676727, | |
| "learning_rate": 8.721030042918455e-05, | |
| "loss": 0.3671, | |
| "num_input_tokens_seen": 4104630, | |
| "step": 663, | |
| "train_runtime": 2923.6894, | |
| "train_tokens_per_second": 1403.921 | |
| }, | |
| { | |
| "epoch": 1.135042735042735, | |
| "grad_norm": 0.1248277947306633, | |
| "learning_rate": 8.703862660944207e-05, | |
| "loss": 0.3165, | |
| "num_input_tokens_seen": 4111406, | |
| "step": 664, | |
| "train_runtime": 2928.0537, | |
| "train_tokens_per_second": 1404.143 | |
| }, | |
| { | |
| "epoch": 1.1367521367521367, | |
| "grad_norm": 0.10170157998800278, | |
| "learning_rate": 8.686695278969957e-05, | |
| "loss": 0.2983, | |
| "num_input_tokens_seen": 4119070, | |
| "step": 665, | |
| "train_runtime": 2932.9305, | |
| "train_tokens_per_second": 1404.421 | |
| }, | |
| { | |
| "epoch": 1.1384615384615384, | |
| "grad_norm": 0.12390810996294022, | |
| "learning_rate": 8.669527896995709e-05, | |
| "loss": 0.3526, | |
| "num_input_tokens_seen": 4124734, | |
| "step": 666, | |
| "train_runtime": 2936.6426, | |
| "train_tokens_per_second": 1404.575 | |
| }, | |
| { | |
| "epoch": 1.1401709401709401, | |
| "grad_norm": 0.1411864310503006, | |
| "learning_rate": 8.652360515021459e-05, | |
| "loss": 0.3677, | |
| "num_input_tokens_seen": 4129230, | |
| "step": 667, | |
| "train_runtime": 2939.7387, | |
| "train_tokens_per_second": 1404.625 | |
| }, | |
| { | |
| "epoch": 1.1418803418803418, | |
| "grad_norm": 0.15506789088249207, | |
| "learning_rate": 8.635193133047211e-05, | |
| "loss": 0.4179, | |
| "num_input_tokens_seen": 4134566, | |
| "step": 668, | |
| "train_runtime": 2943.2748, | |
| "train_tokens_per_second": 1404.75 | |
| }, | |
| { | |
| "epoch": 1.1435897435897435, | |
| "grad_norm": 0.12583504617214203, | |
| "learning_rate": 8.618025751072962e-05, | |
| "loss": 0.335, | |
| "num_input_tokens_seen": 4139998, | |
| "step": 669, | |
| "train_runtime": 2946.9935, | |
| "train_tokens_per_second": 1404.821 | |
| }, | |
| { | |
| "epoch": 1.1452991452991452, | |
| "grad_norm": 0.1164029911160469, | |
| "learning_rate": 8.600858369098714e-05, | |
| "loss": 0.3436, | |
| "num_input_tokens_seen": 4145854, | |
| "step": 670, | |
| "train_runtime": 2950.7518, | |
| "train_tokens_per_second": 1405.016 | |
| }, | |
| { | |
| "epoch": 1.147008547008547, | |
| "grad_norm": 0.11394175887107849, | |
| "learning_rate": 8.583690987124464e-05, | |
| "loss": 0.3931, | |
| "num_input_tokens_seen": 4154062, | |
| "step": 671, | |
| "train_runtime": 2955.921, | |
| "train_tokens_per_second": 1405.336 | |
| }, | |
| { | |
| "epoch": 1.1487179487179486, | |
| "grad_norm": 0.1256456822156906, | |
| "learning_rate": 8.566523605150216e-05, | |
| "loss": 0.3797, | |
| "num_input_tokens_seen": 4159086, | |
| "step": 672, | |
| "train_runtime": 2959.2691, | |
| "train_tokens_per_second": 1405.444 | |
| }, | |
| { | |
| "epoch": 1.1504273504273503, | |
| "grad_norm": 0.11079292744398117, | |
| "learning_rate": 8.549356223175966e-05, | |
| "loss": 0.3967, | |
| "num_input_tokens_seen": 4167806, | |
| "step": 673, | |
| "train_runtime": 2964.6253, | |
| "train_tokens_per_second": 1405.846 | |
| }, | |
| { | |
| "epoch": 1.152136752136752, | |
| "grad_norm": 0.11943069845438004, | |
| "learning_rate": 8.532188841201718e-05, | |
| "loss": 0.4008, | |
| "num_input_tokens_seen": 4173558, | |
| "step": 674, | |
| "train_runtime": 2968.3878, | |
| "train_tokens_per_second": 1406.002 | |
| }, | |
| { | |
| "epoch": 1.1538461538461537, | |
| "grad_norm": 0.1307218074798584, | |
| "learning_rate": 8.515021459227468e-05, | |
| "loss": 0.3377, | |
| "num_input_tokens_seen": 4178718, | |
| "step": 675, | |
| "train_runtime": 2971.9038, | |
| "train_tokens_per_second": 1406.074 | |
| }, | |
| { | |
| "epoch": 1.1555555555555554, | |
| "grad_norm": 0.11272697895765305, | |
| "learning_rate": 8.49785407725322e-05, | |
| "loss": 0.3091, | |
| "num_input_tokens_seen": 4185366, | |
| "step": 676, | |
| "train_runtime": 2976.1919, | |
| "train_tokens_per_second": 1406.282 | |
| }, | |
| { | |
| "epoch": 1.1572649572649572, | |
| "grad_norm": 0.12259600311517715, | |
| "learning_rate": 8.48068669527897e-05, | |
| "loss": 0.2661, | |
| "num_input_tokens_seen": 4190998, | |
| "step": 677, | |
| "train_runtime": 2979.8773, | |
| "train_tokens_per_second": 1406.433 | |
| }, | |
| { | |
| "epoch": 1.1589743589743589, | |
| "grad_norm": 0.1330793797969818, | |
| "learning_rate": 8.463519313304723e-05, | |
| "loss": 0.3186, | |
| "num_input_tokens_seen": 4196758, | |
| "step": 678, | |
| "train_runtime": 2983.6254, | |
| "train_tokens_per_second": 1406.597 | |
| }, | |
| { | |
| "epoch": 1.1606837606837608, | |
| "grad_norm": 0.13795171678066254, | |
| "learning_rate": 8.446351931330473e-05, | |
| "loss": 0.4127, | |
| "num_input_tokens_seen": 4202318, | |
| "step": 679, | |
| "train_runtime": 2987.2952, | |
| "train_tokens_per_second": 1406.73 | |
| }, | |
| { | |
| "epoch": 1.1623931623931625, | |
| "grad_norm": 0.1282401978969574, | |
| "learning_rate": 8.429184549356224e-05, | |
| "loss": 0.3593, | |
| "num_input_tokens_seen": 4207182, | |
| "step": 680, | |
| "train_runtime": 2990.5405, | |
| "train_tokens_per_second": 1406.83 | |
| }, | |
| { | |
| "epoch": 1.1641025641025642, | |
| "grad_norm": 0.12769852578639984, | |
| "learning_rate": 8.412017167381975e-05, | |
| "loss": 0.3226, | |
| "num_input_tokens_seen": 4212214, | |
| "step": 681, | |
| "train_runtime": 2993.9992, | |
| "train_tokens_per_second": 1406.885 | |
| }, | |
| { | |
| "epoch": 1.165811965811966, | |
| "grad_norm": 0.11880778521299362, | |
| "learning_rate": 8.394849785407726e-05, | |
| "loss": 0.3876, | |
| "num_input_tokens_seen": 4218710, | |
| "step": 682, | |
| "train_runtime": 2998.2223, | |
| "train_tokens_per_second": 1407.07 | |
| }, | |
| { | |
| "epoch": 1.1675213675213676, | |
| "grad_norm": 0.12354989349842072, | |
| "learning_rate": 8.377682403433476e-05, | |
| "loss": 0.4613, | |
| "num_input_tokens_seen": 4224726, | |
| "step": 683, | |
| "train_runtime": 3002.1266, | |
| "train_tokens_per_second": 1407.244 | |
| }, | |
| { | |
| "epoch": 1.1692307692307693, | |
| "grad_norm": 0.1455572098493576, | |
| "learning_rate": 8.360515021459228e-05, | |
| "loss": 0.4111, | |
| "num_input_tokens_seen": 4230606, | |
| "step": 684, | |
| "train_runtime": 3005.9145, | |
| "train_tokens_per_second": 1407.427 | |
| }, | |
| { | |
| "epoch": 1.170940170940171, | |
| "grad_norm": 0.1312953233718872, | |
| "learning_rate": 8.343347639484978e-05, | |
| "loss": 0.2817, | |
| "num_input_tokens_seen": 4234918, | |
| "step": 685, | |
| "train_runtime": 3008.9265, | |
| "train_tokens_per_second": 1407.451 | |
| }, | |
| { | |
| "epoch": 1.1726495726495727, | |
| "grad_norm": 0.11988040059804916, | |
| "learning_rate": 8.32618025751073e-05, | |
| "loss": 0.3142, | |
| "num_input_tokens_seen": 4239622, | |
| "step": 686, | |
| "train_runtime": 3012.0648, | |
| "train_tokens_per_second": 1407.547 | |
| }, | |
| { | |
| "epoch": 1.1743589743589744, | |
| "grad_norm": 0.12248189002275467, | |
| "learning_rate": 8.309012875536481e-05, | |
| "loss": 0.3699, | |
| "num_input_tokens_seen": 4246046, | |
| "step": 687, | |
| "train_runtime": 3016.2638, | |
| "train_tokens_per_second": 1407.717 | |
| }, | |
| { | |
| "epoch": 1.176068376068376, | |
| "grad_norm": 0.13097332417964935, | |
| "learning_rate": 8.291845493562233e-05, | |
| "loss": 0.4192, | |
| "num_input_tokens_seen": 4252182, | |
| "step": 688, | |
| "train_runtime": 3020.2889, | |
| "train_tokens_per_second": 1407.873 | |
| }, | |
| { | |
| "epoch": 1.1777777777777778, | |
| "grad_norm": 0.1253839135169983, | |
| "learning_rate": 8.274678111587983e-05, | |
| "loss": 0.33, | |
| "num_input_tokens_seen": 4258126, | |
| "step": 689, | |
| "train_runtime": 3024.21, | |
| "train_tokens_per_second": 1408.013 | |
| }, | |
| { | |
| "epoch": 1.1794871794871795, | |
| "grad_norm": 0.11824435740709305, | |
| "learning_rate": 8.257510729613735e-05, | |
| "loss": 0.3657, | |
| "num_input_tokens_seen": 4263766, | |
| "step": 690, | |
| "train_runtime": 3027.9432, | |
| "train_tokens_per_second": 1408.139 | |
| }, | |
| { | |
| "epoch": 1.1811965811965812, | |
| "grad_norm": 0.10008279979228973, | |
| "learning_rate": 8.240343347639485e-05, | |
| "loss": 0.2639, | |
| "num_input_tokens_seen": 4271606, | |
| "step": 691, | |
| "train_runtime": 3035.004, | |
| "train_tokens_per_second": 1407.447 | |
| }, | |
| { | |
| "epoch": 1.182905982905983, | |
| "grad_norm": 0.13148897886276245, | |
| "learning_rate": 8.223175965665237e-05, | |
| "loss": 0.3419, | |
| "num_input_tokens_seen": 4277814, | |
| "step": 692, | |
| "train_runtime": 3039.0799, | |
| "train_tokens_per_second": 1407.602 | |
| }, | |
| { | |
| "epoch": 1.1846153846153846, | |
| "grad_norm": 0.12744757533073425, | |
| "learning_rate": 8.206008583690987e-05, | |
| "loss": 0.3128, | |
| "num_input_tokens_seen": 4284254, | |
| "step": 693, | |
| "train_runtime": 3043.1921, | |
| "train_tokens_per_second": 1407.816 | |
| }, | |
| { | |
| "epoch": 1.1863247863247863, | |
| "grad_norm": 0.10180284082889557, | |
| "learning_rate": 8.188841201716739e-05, | |
| "loss": 0.2579, | |
| "num_input_tokens_seen": 4292718, | |
| "step": 694, | |
| "train_runtime": 3048.4277, | |
| "train_tokens_per_second": 1408.174 | |
| }, | |
| { | |
| "epoch": 1.188034188034188, | |
| "grad_norm": 0.11092183738946915, | |
| "learning_rate": 8.171673819742489e-05, | |
| "loss": 0.2859, | |
| "num_input_tokens_seen": 4299326, | |
| "step": 695, | |
| "train_runtime": 3052.7332, | |
| "train_tokens_per_second": 1408.353 | |
| }, | |
| { | |
| "epoch": 1.1897435897435897, | |
| "grad_norm": 0.11507410556077957, | |
| "learning_rate": 8.154506437768242e-05, | |
| "loss": 0.2612, | |
| "num_input_tokens_seen": 4305558, | |
| "step": 696, | |
| "train_runtime": 3056.7517, | |
| "train_tokens_per_second": 1408.54 | |
| }, | |
| { | |
| "epoch": 1.1914529914529914, | |
| "grad_norm": 0.12987719476222992, | |
| "learning_rate": 8.137339055793992e-05, | |
| "loss": 0.348, | |
| "num_input_tokens_seen": 4312030, | |
| "step": 697, | |
| "train_runtime": 3060.9536, | |
| "train_tokens_per_second": 1408.721 | |
| }, | |
| { | |
| "epoch": 1.1931623931623931, | |
| "grad_norm": 0.13223910331726074, | |
| "learning_rate": 8.120171673819744e-05, | |
| "loss": 0.2785, | |
| "num_input_tokens_seen": 4316510, | |
| "step": 698, | |
| "train_runtime": 3064.0436, | |
| "train_tokens_per_second": 1408.763 | |
| }, | |
| { | |
| "epoch": 1.1948717948717948, | |
| "grad_norm": 0.11111994832754135, | |
| "learning_rate": 8.103004291845494e-05, | |
| "loss": 0.2969, | |
| "num_input_tokens_seen": 4324606, | |
| "step": 699, | |
| "train_runtime": 3069.1412, | |
| "train_tokens_per_second": 1409.061 | |
| }, | |
| { | |
| "epoch": 1.1965811965811965, | |
| "grad_norm": 0.1413484662771225, | |
| "learning_rate": 8.085836909871245e-05, | |
| "loss": 0.3364, | |
| "num_input_tokens_seen": 4329830, | |
| "step": 700, | |
| "train_runtime": 3072.6351, | |
| "train_tokens_per_second": 1409.159 | |
| }, | |
| { | |
| "epoch": 1.1982905982905983, | |
| "grad_norm": 0.1474023163318634, | |
| "learning_rate": 8.068669527896996e-05, | |
| "loss": 0.3746, | |
| "num_input_tokens_seen": 4334662, | |
| "step": 701, | |
| "train_runtime": 3075.8988, | |
| "train_tokens_per_second": 1409.234 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 0.13913953304290771, | |
| "learning_rate": 8.051502145922747e-05, | |
| "loss": 0.3741, | |
| "num_input_tokens_seen": 4340158, | |
| "step": 702, | |
| "train_runtime": 3079.5939, | |
| "train_tokens_per_second": 1409.328 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "eval_loss": 0.4070233404636383, | |
| "eval_runtime": 40.246, | |
| "eval_samples_per_second": 24.798, | |
| "eval_steps_per_second": 3.106, | |
| "num_input_tokens_seen": 4340158, | |
| "step": 702 | |
| }, | |
| { | |
| "epoch": 1.2017094017094017, | |
| "grad_norm": 0.15744465589523315, | |
| "learning_rate": 8.034334763948497e-05, | |
| "loss": 0.3205, | |
| "num_input_tokens_seen": 4344510, | |
| "step": 703, | |
| "train_runtime": 3122.7838, | |
| "train_tokens_per_second": 1391.23 | |
| }, | |
| { | |
| "epoch": 1.2034188034188034, | |
| "grad_norm": 0.10824355483055115, | |
| "learning_rate": 8.017167381974249e-05, | |
| "loss": 0.3016, | |
| "num_input_tokens_seen": 4351566, | |
| "step": 704, | |
| "train_runtime": 3127.2592, | |
| "train_tokens_per_second": 1391.495 | |
| }, | |
| { | |
| "epoch": 1.205128205128205, | |
| "grad_norm": 0.14710809290409088, | |
| "learning_rate": 8e-05, | |
| "loss": 0.4078, | |
| "num_input_tokens_seen": 4357350, | |
| "step": 705, | |
| "train_runtime": 3131.0621, | |
| "train_tokens_per_second": 1391.652 | |
| }, | |
| { | |
| "epoch": 1.2068376068376068, | |
| "grad_norm": 0.1302827000617981, | |
| "learning_rate": 7.982832618025752e-05, | |
| "loss": 0.3591, | |
| "num_input_tokens_seen": 4363374, | |
| "step": 706, | |
| "train_runtime": 3135.006, | |
| "train_tokens_per_second": 1391.823 | |
| }, | |
| { | |
| "epoch": 1.2085470085470085, | |
| "grad_norm": 0.12259086221456528, | |
| "learning_rate": 7.965665236051502e-05, | |
| "loss": 0.3385, | |
| "num_input_tokens_seen": 4369726, | |
| "step": 707, | |
| "train_runtime": 3139.1212, | |
| "train_tokens_per_second": 1392.022 | |
| }, | |
| { | |
| "epoch": 1.2102564102564102, | |
| "grad_norm": 0.14181672036647797, | |
| "learning_rate": 7.948497854077254e-05, | |
| "loss": 0.3, | |
| "num_input_tokens_seen": 4375566, | |
| "step": 708, | |
| "train_runtime": 3142.8713, | |
| "train_tokens_per_second": 1392.219 | |
| }, | |
| { | |
| "epoch": 1.2119658119658119, | |
| "grad_norm": 0.1263398677110672, | |
| "learning_rate": 7.931330472103004e-05, | |
| "loss": 0.326, | |
| "num_input_tokens_seen": 4382422, | |
| "step": 709, | |
| "train_runtime": 3147.2669, | |
| "train_tokens_per_second": 1392.453 | |
| }, | |
| { | |
| "epoch": 1.2136752136752136, | |
| "grad_norm": 0.13287968933582306, | |
| "learning_rate": 7.914163090128756e-05, | |
| "loss": 0.3703, | |
| "num_input_tokens_seen": 4387598, | |
| "step": 710, | |
| "train_runtime": 3150.6679, | |
| "train_tokens_per_second": 1392.593 | |
| }, | |
| { | |
| "epoch": 1.2153846153846155, | |
| "grad_norm": 0.1080661490559578, | |
| "learning_rate": 7.896995708154506e-05, | |
| "loss": 0.2662, | |
| "num_input_tokens_seen": 4393070, | |
| "step": 711, | |
| "train_runtime": 3154.3344, | |
| "train_tokens_per_second": 1392.709 | |
| }, | |
| { | |
| "epoch": 1.2170940170940172, | |
| "grad_norm": 0.15643350780010223, | |
| "learning_rate": 7.879828326180258e-05, | |
| "loss": 0.3682, | |
| "num_input_tokens_seen": 4400974, | |
| "step": 712, | |
| "train_runtime": 3159.2844, | |
| "train_tokens_per_second": 1393.029 | |
| }, | |
| { | |
| "epoch": 1.218803418803419, | |
| "grad_norm": 0.13371539115905762, | |
| "learning_rate": 7.862660944206008e-05, | |
| "loss": 0.2962, | |
| "num_input_tokens_seen": 4407534, | |
| "step": 713, | |
| "train_runtime": 3163.505, | |
| "train_tokens_per_second": 1393.244 | |
| }, | |
| { | |
| "epoch": 1.2205128205128206, | |
| "grad_norm": 0.12932796776294708, | |
| "learning_rate": 7.845493562231761e-05, | |
| "loss": 0.4288, | |
| "num_input_tokens_seen": 4414006, | |
| "step": 714, | |
| "train_runtime": 3167.7424, | |
| "train_tokens_per_second": 1393.423 | |
| }, | |
| { | |
| "epoch": 1.2222222222222223, | |
| "grad_norm": 0.13061010837554932, | |
| "learning_rate": 7.828326180257511e-05, | |
| "loss": 0.3212, | |
| "num_input_tokens_seen": 4419822, | |
| "step": 715, | |
| "train_runtime": 3171.4916, | |
| "train_tokens_per_second": 1393.61 | |
| }, | |
| { | |
| "epoch": 1.223931623931624, | |
| "grad_norm": 0.15035027265548706, | |
| "learning_rate": 7.811158798283263e-05, | |
| "loss": 0.3392, | |
| "num_input_tokens_seen": 4424894, | |
| "step": 716, | |
| "train_runtime": 3174.9326, | |
| "train_tokens_per_second": 1393.697 | |
| }, | |
| { | |
| "epoch": 1.2256410256410257, | |
| "grad_norm": 0.13823997974395752, | |
| "learning_rate": 7.793991416309013e-05, | |
| "loss": 0.3443, | |
| "num_input_tokens_seen": 4429934, | |
| "step": 717, | |
| "train_runtime": 3178.3439, | |
| "train_tokens_per_second": 1393.787 | |
| }, | |
| { | |
| "epoch": 1.2273504273504274, | |
| "grad_norm": 0.12821649014949799, | |
| "learning_rate": 7.776824034334765e-05, | |
| "loss": 0.3079, | |
| "num_input_tokens_seen": 4437350, | |
| "step": 718, | |
| "train_runtime": 3182.9631, | |
| "train_tokens_per_second": 1394.094 | |
| }, | |
| { | |
| "epoch": 1.2290598290598291, | |
| "grad_norm": 0.15762051939964294, | |
| "learning_rate": 7.759656652360515e-05, | |
| "loss": 0.3233, | |
| "num_input_tokens_seen": 4443350, | |
| "step": 719, | |
| "train_runtime": 3186.8324, | |
| "train_tokens_per_second": 1394.284 | |
| }, | |
| { | |
| "epoch": 1.2307692307692308, | |
| "grad_norm": 0.12094758450984955, | |
| "learning_rate": 7.742489270386266e-05, | |
| "loss": 0.3412, | |
| "num_input_tokens_seen": 4450358, | |
| "step": 720, | |
| "train_runtime": 3191.2311, | |
| "train_tokens_per_second": 1394.558 | |
| }, | |
| { | |
| "epoch": 1.2324786324786325, | |
| "grad_norm": 0.14245277643203735, | |
| "learning_rate": 7.725321888412017e-05, | |
| "loss": 0.3852, | |
| "num_input_tokens_seen": 4455006, | |
| "step": 721, | |
| "train_runtime": 3196.5176, | |
| "train_tokens_per_second": 1393.706 | |
| }, | |
| { | |
| "epoch": 1.2341880341880342, | |
| "grad_norm": 0.12726493179798126, | |
| "learning_rate": 7.70815450643777e-05, | |
| "loss": 0.3124, | |
| "num_input_tokens_seen": 4460062, | |
| "step": 722, | |
| "train_runtime": 3199.9064, | |
| "train_tokens_per_second": 1393.81 | |
| }, | |
| { | |
| "epoch": 1.235897435897436, | |
| "grad_norm": 0.1353270411491394, | |
| "learning_rate": 7.69098712446352e-05, | |
| "loss": 0.4404, | |
| "num_input_tokens_seen": 4465926, | |
| "step": 723, | |
| "train_runtime": 3203.6787, | |
| "train_tokens_per_second": 1393.999 | |
| }, | |
| { | |
| "epoch": 1.2376068376068377, | |
| "grad_norm": 0.12000975012779236, | |
| "learning_rate": 7.673819742489271e-05, | |
| "loss": 0.415, | |
| "num_input_tokens_seen": 4473902, | |
| "step": 724, | |
| "train_runtime": 3208.6199, | |
| "train_tokens_per_second": 1394.338 | |
| }, | |
| { | |
| "epoch": 1.2393162393162394, | |
| "grad_norm": 0.14204196631908417, | |
| "learning_rate": 7.656652360515022e-05, | |
| "loss": 0.3714, | |
| "num_input_tokens_seen": 4479870, | |
| "step": 725, | |
| "train_runtime": 3212.4525, | |
| "train_tokens_per_second": 1394.533 | |
| }, | |
| { | |
| "epoch": 1.241025641025641, | |
| "grad_norm": 0.15379798412322998, | |
| "learning_rate": 7.639484978540773e-05, | |
| "loss": 0.3517, | |
| "num_input_tokens_seen": 4484942, | |
| "step": 726, | |
| "train_runtime": 3215.8195, | |
| "train_tokens_per_second": 1394.65 | |
| }, | |
| { | |
| "epoch": 1.2427350427350428, | |
| "grad_norm": 0.14596928656101227, | |
| "learning_rate": 7.622317596566523e-05, | |
| "loss": 0.3631, | |
| "num_input_tokens_seen": 4489038, | |
| "step": 727, | |
| "train_runtime": 3218.5973, | |
| "train_tokens_per_second": 1394.719 | |
| }, | |
| { | |
| "epoch": 1.2444444444444445, | |
| "grad_norm": 0.13844047486782074, | |
| "learning_rate": 7.605150214592275e-05, | |
| "loss": 0.3868, | |
| "num_input_tokens_seen": 4494750, | |
| "step": 728, | |
| "train_runtime": 3222.3484, | |
| "train_tokens_per_second": 1394.868 | |
| }, | |
| { | |
| "epoch": 1.2461538461538462, | |
| "grad_norm": 0.13620500266551971, | |
| "learning_rate": 7.587982832618025e-05, | |
| "loss": 0.3273, | |
| "num_input_tokens_seen": 4499982, | |
| "step": 729, | |
| "train_runtime": 3225.86, | |
| "train_tokens_per_second": 1394.971 | |
| }, | |
| { | |
| "epoch": 1.2478632478632479, | |
| "grad_norm": 0.11844179034233093, | |
| "learning_rate": 7.570815450643777e-05, | |
| "loss": 0.3236, | |
| "num_input_tokens_seen": 4508150, | |
| "step": 730, | |
| "train_runtime": 3230.9631, | |
| "train_tokens_per_second": 1395.296 | |
| }, | |
| { | |
| "epoch": 1.2495726495726496, | |
| "grad_norm": 0.12672026455402374, | |
| "learning_rate": 7.553648068669528e-05, | |
| "loss": 0.3344, | |
| "num_input_tokens_seen": 4514606, | |
| "step": 731, | |
| "train_runtime": 3235.0964, | |
| "train_tokens_per_second": 1395.509 | |
| }, | |
| { | |
| "epoch": 1.2512820512820513, | |
| "grad_norm": 0.13571657240390778, | |
| "learning_rate": 7.53648068669528e-05, | |
| "loss": 0.4214, | |
| "num_input_tokens_seen": 4523526, | |
| "step": 732, | |
| "train_runtime": 3240.687, | |
| "train_tokens_per_second": 1395.854 | |
| }, | |
| { | |
| "epoch": 1.252991452991453, | |
| "grad_norm": 0.14158177375793457, | |
| "learning_rate": 7.51931330472103e-05, | |
| "loss": 0.257, | |
| "num_input_tokens_seen": 4528758, | |
| "step": 733, | |
| "train_runtime": 3244.1781, | |
| "train_tokens_per_second": 1395.965 | |
| }, | |
| { | |
| "epoch": 1.2547008547008547, | |
| "grad_norm": 0.12700851261615753, | |
| "learning_rate": 7.502145922746782e-05, | |
| "loss": 0.4369, | |
| "num_input_tokens_seen": 4535382, | |
| "step": 734, | |
| "train_runtime": 3248.4052, | |
| "train_tokens_per_second": 1396.187 | |
| }, | |
| { | |
| "epoch": 1.2564102564102564, | |
| "grad_norm": 0.1430508941411972, | |
| "learning_rate": 7.484978540772532e-05, | |
| "loss": 0.3833, | |
| "num_input_tokens_seen": 4541614, | |
| "step": 735, | |
| "train_runtime": 3252.4598, | |
| "train_tokens_per_second": 1396.363 | |
| }, | |
| { | |
| "epoch": 1.258119658119658, | |
| "grad_norm": 0.12764482200145721, | |
| "learning_rate": 7.467811158798284e-05, | |
| "loss": 0.4148, | |
| "num_input_tokens_seen": 4548046, | |
| "step": 736, | |
| "train_runtime": 3256.6496, | |
| "train_tokens_per_second": 1396.541 | |
| }, | |
| { | |
| "epoch": 1.2598290598290598, | |
| "grad_norm": 0.13472262024879456, | |
| "learning_rate": 7.450643776824034e-05, | |
| "loss": 0.3777, | |
| "num_input_tokens_seen": 4553950, | |
| "step": 737, | |
| "train_runtime": 3260.4005, | |
| "train_tokens_per_second": 1396.746 | |
| }, | |
| { | |
| "epoch": 1.2615384615384615, | |
| "grad_norm": 0.1314297914505005, | |
| "learning_rate": 7.433476394849786e-05, | |
| "loss": 0.4397, | |
| "num_input_tokens_seen": 4558846, | |
| "step": 738, | |
| "train_runtime": 3263.7018, | |
| "train_tokens_per_second": 1396.833 | |
| }, | |
| { | |
| "epoch": 1.2632478632478632, | |
| "grad_norm": 0.14270712435245514, | |
| "learning_rate": 7.416309012875536e-05, | |
| "loss": 0.3093, | |
| "num_input_tokens_seen": 4563726, | |
| "step": 739, | |
| "train_runtime": 3266.9431, | |
| "train_tokens_per_second": 1396.941 | |
| }, | |
| { | |
| "epoch": 1.264957264957265, | |
| "grad_norm": 0.1482027918100357, | |
| "learning_rate": 7.399141630901289e-05, | |
| "loss": 0.4741, | |
| "num_input_tokens_seen": 4571278, | |
| "step": 740, | |
| "train_runtime": 3271.6203, | |
| "train_tokens_per_second": 1397.252 | |
| }, | |
| { | |
| "epoch": 1.2666666666666666, | |
| "grad_norm": 0.12276957184076309, | |
| "learning_rate": 7.381974248927039e-05, | |
| "loss": 0.3511, | |
| "num_input_tokens_seen": 4577710, | |
| "step": 741, | |
| "train_runtime": 3275.6213, | |
| "train_tokens_per_second": 1397.509 | |
| }, | |
| { | |
| "epoch": 1.2683760683760683, | |
| "grad_norm": 0.13464733958244324, | |
| "learning_rate": 7.36480686695279e-05, | |
| "loss": 0.3685, | |
| "num_input_tokens_seen": 4583294, | |
| "step": 742, | |
| "train_runtime": 3279.1819, | |
| "train_tokens_per_second": 1397.694 | |
| }, | |
| { | |
| "epoch": 1.27008547008547, | |
| "grad_norm": 0.12158236652612686, | |
| "learning_rate": 7.347639484978541e-05, | |
| "loss": 0.2883, | |
| "num_input_tokens_seen": 4588590, | |
| "step": 743, | |
| "train_runtime": 3282.5387, | |
| "train_tokens_per_second": 1397.878 | |
| }, | |
| { | |
| "epoch": 1.2717948717948717, | |
| "grad_norm": 0.13294081389904022, | |
| "learning_rate": 7.330472103004292e-05, | |
| "loss": 0.437, | |
| "num_input_tokens_seen": 4595566, | |
| "step": 744, | |
| "train_runtime": 3286.9142, | |
| "train_tokens_per_second": 1398.14 | |
| }, | |
| { | |
| "epoch": 1.2735042735042734, | |
| "grad_norm": 0.1501665860414505, | |
| "learning_rate": 7.313304721030043e-05, | |
| "loss": 0.5661, | |
| "num_input_tokens_seen": 4599918, | |
| "step": 745, | |
| "train_runtime": 3289.8586, | |
| "train_tokens_per_second": 1398.211 | |
| }, | |
| { | |
| "epoch": 1.2752136752136751, | |
| "grad_norm": 0.14475314319133759, | |
| "learning_rate": 7.296137339055794e-05, | |
| "loss": 0.4791, | |
| "num_input_tokens_seen": 4605942, | |
| "step": 746, | |
| "train_runtime": 3293.6594, | |
| "train_tokens_per_second": 1398.427 | |
| }, | |
| { | |
| "epoch": 1.2769230769230768, | |
| "grad_norm": 0.12351132929325104, | |
| "learning_rate": 7.278969957081544e-05, | |
| "loss": 0.3623, | |
| "num_input_tokens_seen": 4611150, | |
| "step": 747, | |
| "train_runtime": 3297.0543, | |
| "train_tokens_per_second": 1398.567 | |
| }, | |
| { | |
| "epoch": 1.2786324786324785, | |
| "grad_norm": 0.13310228288173676, | |
| "learning_rate": 7.261802575107296e-05, | |
| "loss": 0.3743, | |
| "num_input_tokens_seen": 4616758, | |
| "step": 748, | |
| "train_runtime": 3300.7146, | |
| "train_tokens_per_second": 1398.715 | |
| }, | |
| { | |
| "epoch": 1.2803418803418802, | |
| "grad_norm": 0.09973648190498352, | |
| "learning_rate": 7.244635193133048e-05, | |
| "loss": 0.2891, | |
| "num_input_tokens_seen": 4626662, | |
| "step": 749, | |
| "train_runtime": 3306.7934, | |
| "train_tokens_per_second": 1399.139 | |
| }, | |
| { | |
| "epoch": 1.282051282051282, | |
| "grad_norm": 0.14369341731071472, | |
| "learning_rate": 7.227467811158799e-05, | |
| "loss": 0.3285, | |
| "num_input_tokens_seen": 4631822, | |
| "step": 750, | |
| "train_runtime": 3310.203, | |
| "train_tokens_per_second": 1399.256 | |
| }, | |
| { | |
| "epoch": 1.2837606837606836, | |
| "grad_norm": 0.1476762741804123, | |
| "learning_rate": 7.21030042918455e-05, | |
| "loss": 0.4658, | |
| "num_input_tokens_seen": 4636590, | |
| "step": 751, | |
| "train_runtime": 3315.5788, | |
| "train_tokens_per_second": 1398.426 | |
| }, | |
| { | |
| "epoch": 1.2854700854700853, | |
| "grad_norm": 0.11374587565660477, | |
| "learning_rate": 7.193133047210301e-05, | |
| "loss": 0.3681, | |
| "num_input_tokens_seen": 4644318, | |
| "step": 752, | |
| "train_runtime": 3320.3931, | |
| "train_tokens_per_second": 1398.725 | |
| }, | |
| { | |
| "epoch": 1.287179487179487, | |
| "grad_norm": 0.11597425490617752, | |
| "learning_rate": 7.175965665236051e-05, | |
| "loss": 0.357, | |
| "num_input_tokens_seen": 4650038, | |
| "step": 753, | |
| "train_runtime": 3324.1736, | |
| "train_tokens_per_second": 1398.855 | |
| }, | |
| { | |
| "epoch": 1.2888888888888888, | |
| "grad_norm": 0.13681602478027344, | |
| "learning_rate": 7.158798283261803e-05, | |
| "loss": 0.3438, | |
| "num_input_tokens_seen": 4657070, | |
| "step": 754, | |
| "train_runtime": 3328.6588, | |
| "train_tokens_per_second": 1399.083 | |
| }, | |
| { | |
| "epoch": 1.2905982905982907, | |
| "grad_norm": 0.13616129755973816, | |
| "learning_rate": 7.141630901287553e-05, | |
| "loss": 0.3903, | |
| "num_input_tokens_seen": 4662454, | |
| "step": 755, | |
| "train_runtime": 3332.1591, | |
| "train_tokens_per_second": 1399.229 | |
| }, | |
| { | |
| "epoch": 1.2923076923076924, | |
| "grad_norm": 0.11485311388969421, | |
| "learning_rate": 7.124463519313305e-05, | |
| "loss": 0.2805, | |
| "num_input_tokens_seen": 4668550, | |
| "step": 756, | |
| "train_runtime": 3336.0659, | |
| "train_tokens_per_second": 1399.418 | |
| }, | |
| { | |
| "epoch": 1.294017094017094, | |
| "grad_norm": 0.10654192417860031, | |
| "learning_rate": 7.107296137339055e-05, | |
| "loss": 0.3048, | |
| "num_input_tokens_seen": 4674622, | |
| "step": 757, | |
| "train_runtime": 3339.9603, | |
| "train_tokens_per_second": 1399.604 | |
| }, | |
| { | |
| "epoch": 1.2957264957264958, | |
| "grad_norm": 0.11485373228788376, | |
| "learning_rate": 7.090128755364808e-05, | |
| "loss": 0.3378, | |
| "num_input_tokens_seen": 4681182, | |
| "step": 758, | |
| "train_runtime": 3344.152, | |
| "train_tokens_per_second": 1399.811 | |
| }, | |
| { | |
| "epoch": 1.2974358974358975, | |
| "grad_norm": 0.12688450515270233, | |
| "learning_rate": 7.072961373390558e-05, | |
| "loss": 0.3171, | |
| "num_input_tokens_seen": 4688046, | |
| "step": 759, | |
| "train_runtime": 3348.539, | |
| "train_tokens_per_second": 1400.027 | |
| }, | |
| { | |
| "epoch": 1.2991452991452992, | |
| "grad_norm": 0.14865227043628693, | |
| "learning_rate": 7.05579399141631e-05, | |
| "loss": 0.4053, | |
| "num_input_tokens_seen": 4693070, | |
| "step": 760, | |
| "train_runtime": 3351.8787, | |
| "train_tokens_per_second": 1400.131 | |
| }, | |
| { | |
| "epoch": 1.300854700854701, | |
| "grad_norm": 0.11336711049079895, | |
| "learning_rate": 7.03862660944206e-05, | |
| "loss": 0.4168, | |
| "num_input_tokens_seen": 4700366, | |
| "step": 761, | |
| "train_runtime": 3356.4783, | |
| "train_tokens_per_second": 1400.386 | |
| }, | |
| { | |
| "epoch": 1.3025641025641026, | |
| "grad_norm": 0.12746818363666534, | |
| "learning_rate": 7.021459227467812e-05, | |
| "loss": 0.3034, | |
| "num_input_tokens_seen": 4705990, | |
| "step": 762, | |
| "train_runtime": 3360.1127, | |
| "train_tokens_per_second": 1400.545 | |
| }, | |
| { | |
| "epoch": 1.3042735042735043, | |
| "grad_norm": 0.12251978367567062, | |
| "learning_rate": 7.004291845493562e-05, | |
| "loss": 0.2748, | |
| "num_input_tokens_seen": 4714262, | |
| "step": 763, | |
| "train_runtime": 3365.1365, | |
| "train_tokens_per_second": 1400.913 | |
| }, | |
| { | |
| "epoch": 1.305982905982906, | |
| "grad_norm": 0.13442695140838623, | |
| "learning_rate": 6.987124463519313e-05, | |
| "loss": 0.295, | |
| "num_input_tokens_seen": 4719134, | |
| "step": 764, | |
| "train_runtime": 3368.3798, | |
| "train_tokens_per_second": 1401.01 | |
| }, | |
| { | |
| "epoch": 1.3076923076923077, | |
| "grad_norm": 0.12905444204807281, | |
| "learning_rate": 6.969957081545064e-05, | |
| "loss": 0.3244, | |
| "num_input_tokens_seen": 4725510, | |
| "step": 765, | |
| "train_runtime": 3372.4643, | |
| "train_tokens_per_second": 1401.204 | |
| }, | |
| { | |
| "epoch": 1.3094017094017094, | |
| "grad_norm": 0.11190018802881241, | |
| "learning_rate": 6.952789699570815e-05, | |
| "loss": 0.3076, | |
| "num_input_tokens_seen": 4733854, | |
| "step": 766, | |
| "train_runtime": 3377.5045, | |
| "train_tokens_per_second": 1401.583 | |
| }, | |
| { | |
| "epoch": 1.3111111111111111, | |
| "grad_norm": 0.17238380014896393, | |
| "learning_rate": 6.935622317596567e-05, | |
| "loss": 0.2737, | |
| "num_input_tokens_seen": 4739286, | |
| "step": 767, | |
| "train_runtime": 3381.0372, | |
| "train_tokens_per_second": 1401.725 | |
| }, | |
| { | |
| "epoch": 1.3128205128205128, | |
| "grad_norm": 0.17607900500297546, | |
| "learning_rate": 6.918454935622318e-05, | |
| "loss": 0.3432, | |
| "num_input_tokens_seen": 4745774, | |
| "step": 768, | |
| "train_runtime": 3385.2278, | |
| "train_tokens_per_second": 1401.907 | |
| }, | |
| { | |
| "epoch": 1.3145299145299145, | |
| "grad_norm": 0.1317862719297409, | |
| "learning_rate": 6.901287553648069e-05, | |
| "loss": 0.3515, | |
| "num_input_tokens_seen": 4752102, | |
| "step": 769, | |
| "train_runtime": 3389.3012, | |
| "train_tokens_per_second": 1402.089 | |
| }, | |
| { | |
| "epoch": 1.3162393162393162, | |
| "grad_norm": 0.14107532799243927, | |
| "learning_rate": 6.88412017167382e-05, | |
| "loss": 0.3412, | |
| "num_input_tokens_seen": 4756838, | |
| "step": 770, | |
| "train_runtime": 3392.4585, | |
| "train_tokens_per_second": 1402.18 | |
| }, | |
| { | |
| "epoch": 1.317948717948718, | |
| "grad_norm": 0.13236303627490997, | |
| "learning_rate": 6.86695278969957e-05, | |
| "loss": 0.3439, | |
| "num_input_tokens_seen": 4762030, | |
| "step": 771, | |
| "train_runtime": 3395.9367, | |
| "train_tokens_per_second": 1402.273 | |
| }, | |
| { | |
| "epoch": 1.3196581196581196, | |
| "grad_norm": 0.1498628854751587, | |
| "learning_rate": 6.849785407725322e-05, | |
| "loss": 0.3687, | |
| "num_input_tokens_seen": 4768278, | |
| "step": 772, | |
| "train_runtime": 3400.0481, | |
| "train_tokens_per_second": 1402.415 | |
| }, | |
| { | |
| "epoch": 1.3213675213675213, | |
| "grad_norm": 0.14370892941951752, | |
| "learning_rate": 6.832618025751074e-05, | |
| "loss": 0.2666, | |
| "num_input_tokens_seen": 4774286, | |
| "step": 773, | |
| "train_runtime": 3403.935, | |
| "train_tokens_per_second": 1402.578 | |
| }, | |
| { | |
| "epoch": 1.323076923076923, | |
| "grad_norm": 0.10908810794353485, | |
| "learning_rate": 6.815450643776824e-05, | |
| "loss": 0.3024, | |
| "num_input_tokens_seen": 4782158, | |
| "step": 774, | |
| "train_runtime": 3408.873, | |
| "train_tokens_per_second": 1402.856 | |
| }, | |
| { | |
| "epoch": 1.3247863247863247, | |
| "grad_norm": 0.14470210671424866, | |
| "learning_rate": 6.798283261802576e-05, | |
| "loss": 0.4275, | |
| "num_input_tokens_seen": 4787766, | |
| "step": 775, | |
| "train_runtime": 3412.4916, | |
| "train_tokens_per_second": 1403.012 | |
| }, | |
| { | |
| "epoch": 1.3264957264957264, | |
| "grad_norm": 0.13045263290405273, | |
| "learning_rate": 6.781115879828327e-05, | |
| "loss": 0.2805, | |
| "num_input_tokens_seen": 4793574, | |
| "step": 776, | |
| "train_runtime": 3416.2588, | |
| "train_tokens_per_second": 1403.165 | |
| }, | |
| { | |
| "epoch": 1.3282051282051281, | |
| "grad_norm": 0.13219225406646729, | |
| "learning_rate": 6.763948497854077e-05, | |
| "loss": 0.3582, | |
| "num_input_tokens_seen": 4799806, | |
| "step": 777, | |
| "train_runtime": 3420.2931, | |
| "train_tokens_per_second": 1403.332 | |
| }, | |
| { | |
| "epoch": 1.3299145299145299, | |
| "grad_norm": 0.1638411432504654, | |
| "learning_rate": 6.746781115879829e-05, | |
| "loss": 0.4126, | |
| "num_input_tokens_seen": 4804742, | |
| "step": 778, | |
| "train_runtime": 3423.6145, | |
| "train_tokens_per_second": 1403.412 | |
| }, | |
| { | |
| "epoch": 1.3316239316239316, | |
| "grad_norm": 0.14201755821704865, | |
| "learning_rate": 6.729613733905579e-05, | |
| "loss": 0.3419, | |
| "num_input_tokens_seen": 4810782, | |
| "step": 779, | |
| "train_runtime": 3427.5338, | |
| "train_tokens_per_second": 1403.57 | |
| }, | |
| { | |
| "epoch": 1.3333333333333333, | |
| "grad_norm": 0.15089352428913116, | |
| "learning_rate": 6.712446351931331e-05, | |
| "loss": 0.2885, | |
| "num_input_tokens_seen": 4817070, | |
| "step": 780, | |
| "train_runtime": 3431.5635, | |
| "train_tokens_per_second": 1403.754 | |
| }, | |
| { | |
| "epoch": 1.335042735042735, | |
| "grad_norm": 0.13004031777381897, | |
| "learning_rate": 6.695278969957082e-05, | |
| "loss": 0.3854, | |
| "num_input_tokens_seen": 4823494, | |
| "step": 781, | |
| "train_runtime": 3437.7554, | |
| "train_tokens_per_second": 1403.094 | |
| }, | |
| { | |
| "epoch": 1.3367521367521369, | |
| "grad_norm": 0.15346503257751465, | |
| "learning_rate": 6.678111587982833e-05, | |
| "loss": 0.4984, | |
| "num_input_tokens_seen": 4830086, | |
| "step": 782, | |
| "train_runtime": 3442.0415, | |
| "train_tokens_per_second": 1403.262 | |
| }, | |
| { | |
| "epoch": 1.3384615384615386, | |
| "grad_norm": 0.14129255712032318, | |
| "learning_rate": 6.660944206008584e-05, | |
| "loss": 0.2954, | |
| "num_input_tokens_seen": 4834182, | |
| "step": 783, | |
| "train_runtime": 3444.8732, | |
| "train_tokens_per_second": 1403.298 | |
| }, | |
| { | |
| "epoch": 1.3401709401709403, | |
| "grad_norm": 0.11984660476446152, | |
| "learning_rate": 6.643776824034334e-05, | |
| "loss": 0.3082, | |
| "num_input_tokens_seen": 4840982, | |
| "step": 784, | |
| "train_runtime": 3449.1751, | |
| "train_tokens_per_second": 1403.519 | |
| }, | |
| { | |
| "epoch": 1.341880341880342, | |
| "grad_norm": 0.09363918751478195, | |
| "learning_rate": 6.626609442060086e-05, | |
| "loss": 0.2449, | |
| "num_input_tokens_seen": 4848502, | |
| "step": 785, | |
| "train_runtime": 3453.9244, | |
| "train_tokens_per_second": 1403.766 | |
| }, | |
| { | |
| "epoch": 1.3435897435897437, | |
| "grad_norm": 0.1427582949399948, | |
| "learning_rate": 6.609442060085838e-05, | |
| "loss": 0.3177, | |
| "num_input_tokens_seen": 4852918, | |
| "step": 786, | |
| "train_runtime": 3456.9516, | |
| "train_tokens_per_second": 1403.814 | |
| }, | |
| { | |
| "epoch": 1.3452991452991454, | |
| "grad_norm": 0.17200025916099548, | |
| "learning_rate": 6.592274678111588e-05, | |
| "loss": 0.3403, | |
| "num_input_tokens_seen": 4857702, | |
| "step": 787, | |
| "train_runtime": 3460.13, | |
| "train_tokens_per_second": 1403.907 | |
| }, | |
| { | |
| "epoch": 1.347008547008547, | |
| "grad_norm": 0.11825034767389297, | |
| "learning_rate": 6.57510729613734e-05, | |
| "loss": 0.3184, | |
| "num_input_tokens_seen": 4865798, | |
| "step": 788, | |
| "train_runtime": 3465.1861, | |
| "train_tokens_per_second": 1404.195 | |
| }, | |
| { | |
| "epoch": 1.3487179487179488, | |
| "grad_norm": 0.12618689239025116, | |
| "learning_rate": 6.557939914163091e-05, | |
| "loss": 0.3325, | |
| "num_input_tokens_seen": 4872190, | |
| "step": 789, | |
| "train_runtime": 3469.3589, | |
| "train_tokens_per_second": 1404.349 | |
| }, | |
| { | |
| "epoch": 1.3504273504273505, | |
| "grad_norm": 0.152120903134346, | |
| "learning_rate": 6.540772532188841e-05, | |
| "loss": 0.4916, | |
| "num_input_tokens_seen": 4879126, | |
| "step": 790, | |
| "train_runtime": 3473.7659, | |
| "train_tokens_per_second": 1404.564 | |
| }, | |
| { | |
| "epoch": 1.3521367521367522, | |
| "grad_norm": 0.18881268799304962, | |
| "learning_rate": 6.523605150214593e-05, | |
| "loss": 0.3321, | |
| "num_input_tokens_seen": 4885526, | |
| "step": 791, | |
| "train_runtime": 3477.8095, | |
| "train_tokens_per_second": 1404.771 | |
| }, | |
| { | |
| "epoch": 1.353846153846154, | |
| "grad_norm": 0.11601816117763519, | |
| "learning_rate": 6.506437768240343e-05, | |
| "loss": 0.3422, | |
| "num_input_tokens_seen": 4892726, | |
| "step": 792, | |
| "train_runtime": 3482.3464, | |
| "train_tokens_per_second": 1405.008 | |
| }, | |
| { | |
| "epoch": 1.3555555555555556, | |
| "grad_norm": 0.14055293798446655, | |
| "learning_rate": 6.489270386266095e-05, | |
| "loss": 0.3659, | |
| "num_input_tokens_seen": 4898358, | |
| "step": 793, | |
| "train_runtime": 3485.9704, | |
| "train_tokens_per_second": 1405.163 | |
| }, | |
| { | |
| "epoch": 1.3572649572649573, | |
| "grad_norm": 0.13708831369876862, | |
| "learning_rate": 6.472103004291846e-05, | |
| "loss": 0.3883, | |
| "num_input_tokens_seen": 4903222, | |
| "step": 794, | |
| "train_runtime": 3489.2494, | |
| "train_tokens_per_second": 1405.237 | |
| }, | |
| { | |
| "epoch": 1.358974358974359, | |
| "grad_norm": 0.1181880459189415, | |
| "learning_rate": 6.454935622317597e-05, | |
| "loss": 0.3499, | |
| "num_input_tokens_seen": 4909550, | |
| "step": 795, | |
| "train_runtime": 3493.3108, | |
| "train_tokens_per_second": 1405.415 | |
| }, | |
| { | |
| "epoch": 1.3606837606837607, | |
| "grad_norm": 0.1416664868593216, | |
| "learning_rate": 6.437768240343348e-05, | |
| "loss": 0.3251, | |
| "num_input_tokens_seen": 4914894, | |
| "step": 796, | |
| "train_runtime": 3496.8801, | |
| "train_tokens_per_second": 1405.508 | |
| }, | |
| { | |
| "epoch": 1.3623931623931624, | |
| "grad_norm": 0.14663483202457428, | |
| "learning_rate": 6.4206008583691e-05, | |
| "loss": 0.4227, | |
| "num_input_tokens_seen": 4921046, | |
| "step": 797, | |
| "train_runtime": 3500.8366, | |
| "train_tokens_per_second": 1405.677 | |
| }, | |
| { | |
| "epoch": 1.3641025641025641, | |
| "grad_norm": 0.1496182233095169, | |
| "learning_rate": 6.40343347639485e-05, | |
| "loss": 0.4552, | |
| "num_input_tokens_seen": 4927342, | |
| "step": 798, | |
| "train_runtime": 3504.826, | |
| "train_tokens_per_second": 1405.874 | |
| }, | |
| { | |
| "epoch": 1.3658119658119658, | |
| "grad_norm": 0.15900661051273346, | |
| "learning_rate": 6.386266094420602e-05, | |
| "loss": 0.3935, | |
| "num_input_tokens_seen": 4933422, | |
| "step": 799, | |
| "train_runtime": 3508.8577, | |
| "train_tokens_per_second": 1405.991 | |
| }, | |
| { | |
| "epoch": 1.3675213675213675, | |
| "grad_norm": 0.16213171184062958, | |
| "learning_rate": 6.369098712446352e-05, | |
| "loss": 0.3777, | |
| "num_input_tokens_seen": 4937910, | |
| "step": 800, | |
| "train_runtime": 3511.8753, | |
| "train_tokens_per_second": 1406.061 | |
| }, | |
| { | |
| "epoch": 1.3692307692307693, | |
| "grad_norm": 0.1332091987133026, | |
| "learning_rate": 6.351931330472103e-05, | |
| "loss": 0.3411, | |
| "num_input_tokens_seen": 4945310, | |
| "step": 801, | |
| "train_runtime": 3516.581, | |
| "train_tokens_per_second": 1406.284 | |
| }, | |
| { | |
| "epoch": 1.370940170940171, | |
| "grad_norm": 0.12687839567661285, | |
| "learning_rate": 6.334763948497855e-05, | |
| "loss": 0.3497, | |
| "num_input_tokens_seen": 4952318, | |
| "step": 802, | |
| "train_runtime": 3521.058, | |
| "train_tokens_per_second": 1406.486 | |
| }, | |
| { | |
| "epoch": 1.3726495726495727, | |
| "grad_norm": 0.13601604104042053, | |
| "learning_rate": 6.317596566523607e-05, | |
| "loss": 0.3821, | |
| "num_input_tokens_seen": 4957638, | |
| "step": 803, | |
| "train_runtime": 3524.6153, | |
| "train_tokens_per_second": 1406.576 | |
| }, | |
| { | |
| "epoch": 1.3743589743589744, | |
| "grad_norm": 0.12945939600467682, | |
| "learning_rate": 6.300429184549357e-05, | |
| "loss": 0.3478, | |
| "num_input_tokens_seen": 4964622, | |
| "step": 804, | |
| "train_runtime": 3529.0468, | |
| "train_tokens_per_second": 1406.788 | |
| }, | |
| { | |
| "epoch": 1.376068376068376, | |
| "grad_norm": 0.13379725813865662, | |
| "learning_rate": 6.283261802575108e-05, | |
| "loss": 0.3145, | |
| "num_input_tokens_seen": 4975366, | |
| "step": 805, | |
| "train_runtime": 3535.554, | |
| "train_tokens_per_second": 1407.238 | |
| }, | |
| { | |
| "epoch": 1.3777777777777778, | |
| "grad_norm": 0.12784002721309662, | |
| "learning_rate": 6.266094420600859e-05, | |
| "loss": 0.3537, | |
| "num_input_tokens_seen": 4984470, | |
| "step": 806, | |
| "train_runtime": 3541.2817, | |
| "train_tokens_per_second": 1407.533 | |
| }, | |
| { | |
| "epoch": 1.3794871794871795, | |
| "grad_norm": 0.1543240249156952, | |
| "learning_rate": 6.24892703862661e-05, | |
| "loss": 0.5405, | |
| "num_input_tokens_seen": 4990494, | |
| "step": 807, | |
| "train_runtime": 3545.1709, | |
| "train_tokens_per_second": 1407.688 | |
| }, | |
| { | |
| "epoch": 1.3811965811965812, | |
| "grad_norm": 0.14580953121185303, | |
| "learning_rate": 6.23175965665236e-05, | |
| "loss": 0.3638, | |
| "num_input_tokens_seen": 4996022, | |
| "step": 808, | |
| "train_runtime": 3548.7602, | |
| "train_tokens_per_second": 1407.822 | |
| }, | |
| { | |
| "epoch": 1.3829059829059829, | |
| "grad_norm": 0.13987824320793152, | |
| "learning_rate": 6.214592274678112e-05, | |
| "loss": 0.2967, | |
| "num_input_tokens_seen": 5003358, | |
| "step": 809, | |
| "train_runtime": 3553.3322, | |
| "train_tokens_per_second": 1408.075 | |
| }, | |
| { | |
| "epoch": 1.3846153846153846, | |
| "grad_norm": 0.15021635591983795, | |
| "learning_rate": 6.197424892703862e-05, | |
| "loss": 0.3521, | |
| "num_input_tokens_seen": 5009470, | |
| "step": 810, | |
| "train_runtime": 3557.3125, | |
| "train_tokens_per_second": 1408.218 | |
| }, | |
| { | |
| "epoch": 1.3863247863247863, | |
| "grad_norm": 0.17432373762130737, | |
| "learning_rate": 6.180257510729615e-05, | |
| "loss": 0.4223, | |
| "num_input_tokens_seen": 5013910, | |
| "step": 811, | |
| "train_runtime": 3562.3066, | |
| "train_tokens_per_second": 1407.49 | |
| }, | |
| { | |
| "epoch": 1.388034188034188, | |
| "grad_norm": 0.12946096062660217, | |
| "learning_rate": 6.163090128755365e-05, | |
| "loss": 0.3144, | |
| "num_input_tokens_seen": 5020934, | |
| "step": 812, | |
| "train_runtime": 3566.7167, | |
| "train_tokens_per_second": 1407.719 | |
| }, | |
| { | |
| "epoch": 1.3897435897435897, | |
| "grad_norm": 0.14947237074375153, | |
| "learning_rate": 6.145922746781117e-05, | |
| "loss": 0.3538, | |
| "num_input_tokens_seen": 5026366, | |
| "step": 813, | |
| "train_runtime": 3570.2494, | |
| "train_tokens_per_second": 1407.847 | |
| }, | |
| { | |
| "epoch": 1.3914529914529914, | |
| "grad_norm": 0.16150113940238953, | |
| "learning_rate": 6.128755364806867e-05, | |
| "loss": 0.4022, | |
| "num_input_tokens_seen": 5032670, | |
| "step": 814, | |
| "train_runtime": 3574.3152, | |
| "train_tokens_per_second": 1408.01 | |
| }, | |
| { | |
| "epoch": 1.393162393162393, | |
| "grad_norm": 0.13235805928707123, | |
| "learning_rate": 6.111587982832619e-05, | |
| "loss": 0.4002, | |
| "num_input_tokens_seen": 5038006, | |
| "step": 815, | |
| "train_runtime": 3577.9246, | |
| "train_tokens_per_second": 1408.081 | |
| }, | |
| { | |
| "epoch": 1.3948717948717948, | |
| "grad_norm": 0.13235850632190704, | |
| "learning_rate": 6.094420600858369e-05, | |
| "loss": 0.3106, | |
| "num_input_tokens_seen": 5042966, | |
| "step": 816, | |
| "train_runtime": 3581.2275, | |
| "train_tokens_per_second": 1408.167 | |
| }, | |
| { | |
| "epoch": 1.3965811965811965, | |
| "grad_norm": 0.12829095125198364, | |
| "learning_rate": 6.07725321888412e-05, | |
| "loss": 0.3089, | |
| "num_input_tokens_seen": 5048478, | |
| "step": 817, | |
| "train_runtime": 3584.7901, | |
| "train_tokens_per_second": 1408.305 | |
| }, | |
| { | |
| "epoch": 1.3982905982905982, | |
| "grad_norm": 0.128507599234581, | |
| "learning_rate": 6.060085836909871e-05, | |
| "loss": 0.3642, | |
| "num_input_tokens_seen": 5054262, | |
| "step": 818, | |
| "train_runtime": 3588.5263, | |
| "train_tokens_per_second": 1408.451 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 0.1573978215456009, | |
| "learning_rate": 6.042918454935622e-05, | |
| "loss": 0.4736, | |
| "num_input_tokens_seen": 5059318, | |
| "step": 819, | |
| "train_runtime": 3591.913, | |
| "train_tokens_per_second": 1408.53 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "eval_loss": 0.40713953971862793, | |
| "eval_runtime": 39.9732, | |
| "eval_samples_per_second": 24.967, | |
| "eval_steps_per_second": 3.127, | |
| "num_input_tokens_seen": 5059318, | |
| "step": 819 | |
| }, | |
| { | |
| "epoch": 1.4017094017094016, | |
| "grad_norm": 0.14844471216201782, | |
| "learning_rate": 6.025751072961374e-05, | |
| "loss": 0.357, | |
| "num_input_tokens_seen": 5065662, | |
| "step": 820, | |
| "train_runtime": 3635.9646, | |
| "train_tokens_per_second": 1393.21 | |
| }, | |
| { | |
| "epoch": 1.4034188034188033, | |
| "grad_norm": 0.1275315284729004, | |
| "learning_rate": 6.008583690987125e-05, | |
| "loss": 0.3142, | |
| "num_input_tokens_seen": 5072030, | |
| "step": 821, | |
| "train_runtime": 3639.9817, | |
| "train_tokens_per_second": 1393.422 | |
| }, | |
| { | |
| "epoch": 1.405128205128205, | |
| "grad_norm": 0.1327238231897354, | |
| "learning_rate": 5.991416309012876e-05, | |
| "loss": 0.3219, | |
| "num_input_tokens_seen": 5077102, | |
| "step": 822, | |
| "train_runtime": 3643.3247, | |
| "train_tokens_per_second": 1393.535 | |
| }, | |
| { | |
| "epoch": 1.4068376068376067, | |
| "grad_norm": 0.1424541175365448, | |
| "learning_rate": 5.974248927038627e-05, | |
| "loss": 0.3149, | |
| "num_input_tokens_seen": 5084094, | |
| "step": 823, | |
| "train_runtime": 3647.8224, | |
| "train_tokens_per_second": 1393.734 | |
| }, | |
| { | |
| "epoch": 1.4085470085470084, | |
| "grad_norm": 0.1389557421207428, | |
| "learning_rate": 5.957081545064378e-05, | |
| "loss": 0.388, | |
| "num_input_tokens_seen": 5089366, | |
| "step": 824, | |
| "train_runtime": 3651.3158, | |
| "train_tokens_per_second": 1393.844 | |
| }, | |
| { | |
| "epoch": 1.4102564102564101, | |
| "grad_norm": 0.16298536956310272, | |
| "learning_rate": 5.939914163090129e-05, | |
| "loss": 0.4075, | |
| "num_input_tokens_seen": 5094734, | |
| "step": 825, | |
| "train_runtime": 3654.7291, | |
| "train_tokens_per_second": 1394.011 | |
| }, | |
| { | |
| "epoch": 1.4119658119658118, | |
| "grad_norm": 0.12247509509325027, | |
| "learning_rate": 5.9227467811158796e-05, | |
| "loss": 0.3127, | |
| "num_input_tokens_seen": 5102198, | |
| "step": 826, | |
| "train_runtime": 3659.4415, | |
| "train_tokens_per_second": 1394.256 | |
| }, | |
| { | |
| "epoch": 1.4136752136752135, | |
| "grad_norm": 0.15482676029205322, | |
| "learning_rate": 5.9055793991416305e-05, | |
| "loss": 0.3002, | |
| "num_input_tokens_seen": 5111134, | |
| "step": 827, | |
| "train_runtime": 3665.0056, | |
| "train_tokens_per_second": 1394.577 | |
| }, | |
| { | |
| "epoch": 1.4153846153846155, | |
| "grad_norm": 0.14611922204494476, | |
| "learning_rate": 5.888412017167382e-05, | |
| "loss": 0.352, | |
| "num_input_tokens_seen": 5115230, | |
| "step": 828, | |
| "train_runtime": 3667.7611, | |
| "train_tokens_per_second": 1394.646 | |
| }, | |
| { | |
| "epoch": 1.4170940170940172, | |
| "grad_norm": 0.17032893002033234, | |
| "learning_rate": 5.871244635193134e-05, | |
| "loss": 0.3732, | |
| "num_input_tokens_seen": 5120990, | |
| "step": 829, | |
| "train_runtime": 3671.46, | |
| "train_tokens_per_second": 1394.81 | |
| }, | |
| { | |
| "epoch": 1.4188034188034189, | |
| "grad_norm": 0.13741740584373474, | |
| "learning_rate": 5.8540772532188846e-05, | |
| "loss": 0.2781, | |
| "num_input_tokens_seen": 5126070, | |
| "step": 830, | |
| "train_runtime": 3674.8572, | |
| "train_tokens_per_second": 1394.903 | |
| }, | |
| { | |
| "epoch": 1.4205128205128206, | |
| "grad_norm": 0.1337319314479828, | |
| "learning_rate": 5.8369098712446355e-05, | |
| "loss": 0.2903, | |
| "num_input_tokens_seen": 5131270, | |
| "step": 831, | |
| "train_runtime": 3678.3235, | |
| "train_tokens_per_second": 1395.002 | |
| }, | |
| { | |
| "epoch": 1.4222222222222223, | |
| "grad_norm": 0.14914950728416443, | |
| "learning_rate": 5.8197424892703864e-05, | |
| "loss": 0.3417, | |
| "num_input_tokens_seen": 5136918, | |
| "step": 832, | |
| "train_runtime": 3682.0496, | |
| "train_tokens_per_second": 1395.125 | |
| }, | |
| { | |
| "epoch": 1.423931623931624, | |
| "grad_norm": 0.162494957447052, | |
| "learning_rate": 5.8025751072961374e-05, | |
| "loss": 0.423, | |
| "num_input_tokens_seen": 5142158, | |
| "step": 833, | |
| "train_runtime": 3685.5503, | |
| "train_tokens_per_second": 1395.221 | |
| }, | |
| { | |
| "epoch": 1.4256410256410257, | |
| "grad_norm": 0.14546248316764832, | |
| "learning_rate": 5.785407725321888e-05, | |
| "loss": 0.3648, | |
| "num_input_tokens_seen": 5148094, | |
| "step": 834, | |
| "train_runtime": 3689.3363, | |
| "train_tokens_per_second": 1395.398 | |
| }, | |
| { | |
| "epoch": 1.4273504273504274, | |
| "grad_norm": 0.15214349329471588, | |
| "learning_rate": 5.768240343347639e-05, | |
| "loss": 0.3288, | |
| "num_input_tokens_seen": 5152742, | |
| "step": 835, | |
| "train_runtime": 3692.4044, | |
| "train_tokens_per_second": 1395.498 | |
| }, | |
| { | |
| "epoch": 1.429059829059829, | |
| "grad_norm": 0.13268783688545227, | |
| "learning_rate": 5.751072961373391e-05, | |
| "loss": 0.3101, | |
| "num_input_tokens_seen": 5158358, | |
| "step": 836, | |
| "train_runtime": 3696.043, | |
| "train_tokens_per_second": 1395.643 | |
| }, | |
| { | |
| "epoch": 1.4307692307692308, | |
| "grad_norm": 0.1861671358346939, | |
| "learning_rate": 5.733905579399142e-05, | |
| "loss": 0.4137, | |
| "num_input_tokens_seen": 5163294, | |
| "step": 837, | |
| "train_runtime": 3699.3676, | |
| "train_tokens_per_second": 1395.723 | |
| }, | |
| { | |
| "epoch": 1.4324786324786325, | |
| "grad_norm": 0.13023094832897186, | |
| "learning_rate": 5.716738197424893e-05, | |
| "loss": 0.3631, | |
| "num_input_tokens_seen": 5168686, | |
| "step": 838, | |
| "train_runtime": 3702.9614, | |
| "train_tokens_per_second": 1395.825 | |
| }, | |
| { | |
| "epoch": 1.4341880341880342, | |
| "grad_norm": 0.11844179034233093, | |
| "learning_rate": 5.699570815450644e-05, | |
| "loss": 0.2492, | |
| "num_input_tokens_seen": 5177182, | |
| "step": 839, | |
| "train_runtime": 3708.2961, | |
| "train_tokens_per_second": 1396.108 | |
| }, | |
| { | |
| "epoch": 1.435897435897436, | |
| "grad_norm": 0.15760420262813568, | |
| "learning_rate": 5.682403433476395e-05, | |
| "loss": 0.3296, | |
| "num_input_tokens_seen": 5181222, | |
| "step": 840, | |
| "train_runtime": 3711.0998, | |
| "train_tokens_per_second": 1396.142 | |
| }, | |
| { | |
| "epoch": 1.4376068376068376, | |
| "grad_norm": 0.1670273393392563, | |
| "learning_rate": 5.665236051502146e-05, | |
| "loss": 0.3472, | |
| "num_input_tokens_seen": 5188286, | |
| "step": 841, | |
| "train_runtime": 3717.6952, | |
| "train_tokens_per_second": 1395.565 | |
| }, | |
| { | |
| "epoch": 1.4393162393162393, | |
| "grad_norm": 0.16332553327083588, | |
| "learning_rate": 5.648068669527897e-05, | |
| "loss": 0.3388, | |
| "num_input_tokens_seen": 5192998, | |
| "step": 842, | |
| "train_runtime": 3720.9156, | |
| "train_tokens_per_second": 1395.624 | |
| }, | |
| { | |
| "epoch": 1.441025641025641, | |
| "grad_norm": 0.15031462907791138, | |
| "learning_rate": 5.6309012875536485e-05, | |
| "loss": 0.4377, | |
| "num_input_tokens_seen": 5198462, | |
| "step": 843, | |
| "train_runtime": 3724.5247, | |
| "train_tokens_per_second": 1395.738 | |
| }, | |
| { | |
| "epoch": 1.4427350427350427, | |
| "grad_norm": 0.13682641088962555, | |
| "learning_rate": 5.6137339055793995e-05, | |
| "loss": 0.2486, | |
| "num_input_tokens_seen": 5202982, | |
| "step": 844, | |
| "train_runtime": 3727.5494, | |
| "train_tokens_per_second": 1395.818 | |
| }, | |
| { | |
| "epoch": 1.4444444444444444, | |
| "grad_norm": 0.1407112032175064, | |
| "learning_rate": 5.5965665236051504e-05, | |
| "loss": 0.3894, | |
| "num_input_tokens_seen": 5211254, | |
| "step": 845, | |
| "train_runtime": 3732.8344, | |
| "train_tokens_per_second": 1396.058 | |
| }, | |
| { | |
| "epoch": 1.4461538461538461, | |
| "grad_norm": 0.16395379602909088, | |
| "learning_rate": 5.579399141630901e-05, | |
| "loss": 0.5773, | |
| "num_input_tokens_seen": 5216782, | |
| "step": 846, | |
| "train_runtime": 3736.5208, | |
| "train_tokens_per_second": 1396.16 | |
| }, | |
| { | |
| "epoch": 1.4478632478632478, | |
| "grad_norm": 0.13352353870868683, | |
| "learning_rate": 5.562231759656653e-05, | |
| "loss": 0.3843, | |
| "num_input_tokens_seen": 5222070, | |
| "step": 847, | |
| "train_runtime": 3740.0075, | |
| "train_tokens_per_second": 1396.273 | |
| }, | |
| { | |
| "epoch": 1.4495726495726495, | |
| "grad_norm": 0.1692342758178711, | |
| "learning_rate": 5.545064377682404e-05, | |
| "loss": 0.4467, | |
| "num_input_tokens_seen": 5227246, | |
| "step": 848, | |
| "train_runtime": 3743.4389, | |
| "train_tokens_per_second": 1396.375 | |
| }, | |
| { | |
| "epoch": 1.4512820512820512, | |
| "grad_norm": 0.15134482085704803, | |
| "learning_rate": 5.527896995708155e-05, | |
| "loss": 0.241, | |
| "num_input_tokens_seen": 5235518, | |
| "step": 849, | |
| "train_runtime": 3748.4958, | |
| "train_tokens_per_second": 1396.698 | |
| }, | |
| { | |
| "epoch": 1.452991452991453, | |
| "grad_norm": 0.14503733813762665, | |
| "learning_rate": 5.5107296137339056e-05, | |
| "loss": 0.3709, | |
| "num_input_tokens_seen": 5240966, | |
| "step": 850, | |
| "train_runtime": 3752.1211, | |
| "train_tokens_per_second": 1396.801 | |
| }, | |
| { | |
| "epoch": 1.4547008547008546, | |
| "grad_norm": 0.1375107765197754, | |
| "learning_rate": 5.493562231759657e-05, | |
| "loss": 0.2942, | |
| "num_input_tokens_seen": 5245934, | |
| "step": 851, | |
| "train_runtime": 3755.3802, | |
| "train_tokens_per_second": 1396.912 | |
| }, | |
| { | |
| "epoch": 1.4564102564102563, | |
| "grad_norm": 0.122276172041893, | |
| "learning_rate": 5.476394849785408e-05, | |
| "loss": 0.3244, | |
| "num_input_tokens_seen": 5253238, | |
| "step": 852, | |
| "train_runtime": 3759.9878, | |
| "train_tokens_per_second": 1397.142 | |
| }, | |
| { | |
| "epoch": 1.458119658119658, | |
| "grad_norm": 0.15556900203227997, | |
| "learning_rate": 5.459227467811159e-05, | |
| "loss": 0.3869, | |
| "num_input_tokens_seen": 5259758, | |
| "step": 853, | |
| "train_runtime": 3764.1834, | |
| "train_tokens_per_second": 1397.317 | |
| }, | |
| { | |
| "epoch": 1.4598290598290597, | |
| "grad_norm": 0.14983288943767548, | |
| "learning_rate": 5.44206008583691e-05, | |
| "loss": 0.385, | |
| "num_input_tokens_seen": 5265518, | |
| "step": 854, | |
| "train_runtime": 3767.8711, | |
| "train_tokens_per_second": 1397.478 | |
| }, | |
| { | |
| "epoch": 1.4615384615384617, | |
| "grad_norm": 0.1455240398645401, | |
| "learning_rate": 5.424892703862661e-05, | |
| "loss": 0.4104, | |
| "num_input_tokens_seen": 5272654, | |
| "step": 855, | |
| "train_runtime": 3772.3838, | |
| "train_tokens_per_second": 1397.698 | |
| }, | |
| { | |
| "epoch": 1.4632478632478634, | |
| "grad_norm": 0.19445322453975677, | |
| "learning_rate": 5.4077253218884125e-05, | |
| "loss": 0.4355, | |
| "num_input_tokens_seen": 5279846, | |
| "step": 856, | |
| "train_runtime": 3776.8801, | |
| "train_tokens_per_second": 1397.938 | |
| }, | |
| { | |
| "epoch": 1.464957264957265, | |
| "grad_norm": 0.15882650017738342, | |
| "learning_rate": 5.3905579399141634e-05, | |
| "loss": 0.4704, | |
| "num_input_tokens_seen": 5284854, | |
| "step": 857, | |
| "train_runtime": 3780.1753, | |
| "train_tokens_per_second": 1398.045 | |
| }, | |
| { | |
| "epoch": 1.4666666666666668, | |
| "grad_norm": 0.14064083993434906, | |
| "learning_rate": 5.373390557939915e-05, | |
| "loss": 0.4001, | |
| "num_input_tokens_seen": 5290262, | |
| "step": 858, | |
| "train_runtime": 3783.6813, | |
| "train_tokens_per_second": 1398.179 | |
| }, | |
| { | |
| "epoch": 1.4683760683760685, | |
| "grad_norm": 0.13175015151500702, | |
| "learning_rate": 5.356223175965666e-05, | |
| "loss": 0.4009, | |
| "num_input_tokens_seen": 5299142, | |
| "step": 859, | |
| "train_runtime": 3789.1831, | |
| "train_tokens_per_second": 1398.492 | |
| }, | |
| { | |
| "epoch": 1.4700854700854702, | |
| "grad_norm": 0.12459183484315872, | |
| "learning_rate": 5.339055793991417e-05, | |
| "loss": 0.5154, | |
| "num_input_tokens_seen": 5305334, | |
| "step": 860, | |
| "train_runtime": 3793.1945, | |
| "train_tokens_per_second": 1398.645 | |
| }, | |
| { | |
| "epoch": 1.471794871794872, | |
| "grad_norm": 0.13496418297290802, | |
| "learning_rate": 5.321888412017168e-05, | |
| "loss": 0.5302, | |
| "num_input_tokens_seen": 5312582, | |
| "step": 861, | |
| "train_runtime": 3797.8243, | |
| "train_tokens_per_second": 1398.849 | |
| }, | |
| { | |
| "epoch": 1.4735042735042736, | |
| "grad_norm": 0.12612996995449066, | |
| "learning_rate": 5.3047210300429186e-05, | |
| "loss": 0.3437, | |
| "num_input_tokens_seen": 5318646, | |
| "step": 862, | |
| "train_runtime": 3801.9229, | |
| "train_tokens_per_second": 1398.936 | |
| }, | |
| { | |
| "epoch": 1.4752136752136753, | |
| "grad_norm": 0.15236078202724457, | |
| "learning_rate": 5.2875536480686695e-05, | |
| "loss": 0.3329, | |
| "num_input_tokens_seen": 5323214, | |
| "step": 863, | |
| "train_runtime": 3804.9799, | |
| "train_tokens_per_second": 1399.012 | |
| }, | |
| { | |
| "epoch": 1.476923076923077, | |
| "grad_norm": 0.14306163787841797, | |
| "learning_rate": 5.2703862660944205e-05, | |
| "loss": 0.3123, | |
| "num_input_tokens_seen": 5328902, | |
| "step": 864, | |
| "train_runtime": 3808.7041, | |
| "train_tokens_per_second": 1399.138 | |
| }, | |
| { | |
| "epoch": 1.4786324786324787, | |
| "grad_norm": 0.1255759447813034, | |
| "learning_rate": 5.253218884120172e-05, | |
| "loss": 0.2965, | |
| "num_input_tokens_seen": 5334094, | |
| "step": 865, | |
| "train_runtime": 3812.1793, | |
| "train_tokens_per_second": 1399.224 | |
| }, | |
| { | |
| "epoch": 1.4803418803418804, | |
| "grad_norm": 0.15679959952831268, | |
| "learning_rate": 5.2360515021459236e-05, | |
| "loss": 0.5092, | |
| "num_input_tokens_seen": 5339710, | |
| "step": 866, | |
| "train_runtime": 3815.8784, | |
| "train_tokens_per_second": 1399.34 | |
| }, | |
| { | |
| "epoch": 1.4820512820512821, | |
| "grad_norm": 0.14153476059436798, | |
| "learning_rate": 5.2188841201716746e-05, | |
| "loss": 0.3473, | |
| "num_input_tokens_seen": 5346190, | |
| "step": 867, | |
| "train_runtime": 3819.9095, | |
| "train_tokens_per_second": 1399.559 | |
| }, | |
| { | |
| "epoch": 1.4837606837606838, | |
| "grad_norm": 0.13382677733898163, | |
| "learning_rate": 5.2017167381974255e-05, | |
| "loss": 0.3588, | |
| "num_input_tokens_seen": 5352462, | |
| "step": 868, | |
| "train_runtime": 3824.0287, | |
| "train_tokens_per_second": 1399.692 | |
| }, | |
| { | |
| "epoch": 1.4854700854700855, | |
| "grad_norm": 0.16382722556591034, | |
| "learning_rate": 5.1845493562231764e-05, | |
| "loss": 0.3964, | |
| "num_input_tokens_seen": 5356254, | |
| "step": 869, | |
| "train_runtime": 3826.6221, | |
| "train_tokens_per_second": 1399.734 | |
| }, | |
| { | |
| "epoch": 1.4871794871794872, | |
| "grad_norm": 0.14120569825172424, | |
| "learning_rate": 5.167381974248927e-05, | |
| "loss": 0.3463, | |
| "num_input_tokens_seen": 5363590, | |
| "step": 870, | |
| "train_runtime": 3831.2189, | |
| "train_tokens_per_second": 1399.97 | |
| }, | |
| { | |
| "epoch": 1.488888888888889, | |
| "grad_norm": 0.16003507375717163, | |
| "learning_rate": 5.150214592274678e-05, | |
| "loss": 0.3489, | |
| "num_input_tokens_seen": 5368462, | |
| "step": 871, | |
| "train_runtime": 3836.5884, | |
| "train_tokens_per_second": 1399.28 | |
| }, | |
| { | |
| "epoch": 1.4905982905982906, | |
| "grad_norm": 0.1279754787683487, | |
| "learning_rate": 5.133047210300429e-05, | |
| "loss": 0.341, | |
| "num_input_tokens_seen": 5373550, | |
| "step": 872, | |
| "train_runtime": 3840.064, | |
| "train_tokens_per_second": 1399.339 | |
| }, | |
| { | |
| "epoch": 1.4923076923076923, | |
| "grad_norm": 0.16718865931034088, | |
| "learning_rate": 5.11587982832618e-05, | |
| "loss": 0.3997, | |
| "num_input_tokens_seen": 5379134, | |
| "step": 873, | |
| "train_runtime": 3843.6488, | |
| "train_tokens_per_second": 1399.486 | |
| }, | |
| { | |
| "epoch": 1.494017094017094, | |
| "grad_norm": 0.12986551225185394, | |
| "learning_rate": 5.098712446351932e-05, | |
| "loss": 0.3132, | |
| "num_input_tokens_seen": 5388758, | |
| "step": 874, | |
| "train_runtime": 3849.7111, | |
| "train_tokens_per_second": 1399.782 | |
| }, | |
| { | |
| "epoch": 1.4957264957264957, | |
| "grad_norm": 0.1360234171152115, | |
| "learning_rate": 5.081545064377683e-05, | |
| "loss": 0.2856, | |
| "num_input_tokens_seen": 5393182, | |
| "step": 875, | |
| "train_runtime": 3852.7029, | |
| "train_tokens_per_second": 1399.844 | |
| }, | |
| { | |
| "epoch": 1.4974358974358974, | |
| "grad_norm": 0.17069897055625916, | |
| "learning_rate": 5.064377682403434e-05, | |
| "loss": 0.4769, | |
| "num_input_tokens_seen": 5398094, | |
| "step": 876, | |
| "train_runtime": 3856.0373, | |
| "train_tokens_per_second": 1399.907 | |
| }, | |
| { | |
| "epoch": 1.4991452991452991, | |
| "grad_norm": 0.15237049758434296, | |
| "learning_rate": 5.047210300429185e-05, | |
| "loss": 0.3108, | |
| "num_input_tokens_seen": 5406302, | |
| "step": 877, | |
| "train_runtime": 3861.1411, | |
| "train_tokens_per_second": 1400.182 | |
| }, | |
| { | |
| "epoch": 1.5008547008547009, | |
| "grad_norm": 0.18374916911125183, | |
| "learning_rate": 5.030042918454936e-05, | |
| "loss": 0.3626, | |
| "num_input_tokens_seen": 5410838, | |
| "step": 878, | |
| "train_runtime": 3864.2838, | |
| "train_tokens_per_second": 1400.218 | |
| }, | |
| { | |
| "epoch": 1.5025641025641026, | |
| "grad_norm": 0.15585371851921082, | |
| "learning_rate": 5.012875536480687e-05, | |
| "loss": 0.3773, | |
| "num_input_tokens_seen": 5417318, | |
| "step": 879, | |
| "train_runtime": 3868.4233, | |
| "train_tokens_per_second": 1400.394 | |
| }, | |
| { | |
| "epoch": 1.5042735042735043, | |
| "grad_norm": 0.18755033612251282, | |
| "learning_rate": 4.9957081545064385e-05, | |
| "loss": 0.4022, | |
| "num_input_tokens_seen": 5421910, | |
| "step": 880, | |
| "train_runtime": 3871.5671, | |
| "train_tokens_per_second": 1400.443 | |
| }, | |
| { | |
| "epoch": 1.505982905982906, | |
| "grad_norm": 0.1306111067533493, | |
| "learning_rate": 4.9785407725321894e-05, | |
| "loss": 0.2989, | |
| "num_input_tokens_seen": 5427630, | |
| "step": 881, | |
| "train_runtime": 3875.3642, | |
| "train_tokens_per_second": 1400.547 | |
| }, | |
| { | |
| "epoch": 1.5076923076923077, | |
| "grad_norm": 0.14471091330051422, | |
| "learning_rate": 4.96137339055794e-05, | |
| "loss": 0.3487, | |
| "num_input_tokens_seen": 5434654, | |
| "step": 882, | |
| "train_runtime": 3879.7092, | |
| "train_tokens_per_second": 1400.789 | |
| }, | |
| { | |
| "epoch": 1.5094017094017094, | |
| "grad_norm": 0.1394500881433487, | |
| "learning_rate": 4.944206008583691e-05, | |
| "loss": 0.3425, | |
| "num_input_tokens_seen": 5441006, | |
| "step": 883, | |
| "train_runtime": 3883.8235, | |
| "train_tokens_per_second": 1400.941 | |
| }, | |
| { | |
| "epoch": 1.511111111111111, | |
| "grad_norm": 0.1315561830997467, | |
| "learning_rate": 4.927038626609442e-05, | |
| "loss": 0.2697, | |
| "num_input_tokens_seen": 5445926, | |
| "step": 884, | |
| "train_runtime": 3887.1139, | |
| "train_tokens_per_second": 1401.02 | |
| }, | |
| { | |
| "epoch": 1.5128205128205128, | |
| "grad_norm": 0.14249852299690247, | |
| "learning_rate": 4.909871244635194e-05, | |
| "loss": 0.3622, | |
| "num_input_tokens_seen": 5452246, | |
| "step": 885, | |
| "train_runtime": 3891.1997, | |
| "train_tokens_per_second": 1401.174 | |
| }, | |
| { | |
| "epoch": 1.5145299145299145, | |
| "grad_norm": 0.16895607113838196, | |
| "learning_rate": 4.8927038626609446e-05, | |
| "loss": 0.4891, | |
| "num_input_tokens_seen": 5456854, | |
| "step": 886, | |
| "train_runtime": 3894.3609, | |
| "train_tokens_per_second": 1401.219 | |
| }, | |
| { | |
| "epoch": 1.5162393162393162, | |
| "grad_norm": 0.1550210863351822, | |
| "learning_rate": 4.8755364806866956e-05, | |
| "loss": 0.4051, | |
| "num_input_tokens_seen": 5463430, | |
| "step": 887, | |
| "train_runtime": 3898.5586, | |
| "train_tokens_per_second": 1401.397 | |
| }, | |
| { | |
| "epoch": 1.5179487179487179, | |
| "grad_norm": 0.1588016301393509, | |
| "learning_rate": 4.8583690987124465e-05, | |
| "loss": 0.3086, | |
| "num_input_tokens_seen": 5468830, | |
| "step": 888, | |
| "train_runtime": 3902.1609, | |
| "train_tokens_per_second": 1401.488 | |
| }, | |
| { | |
| "epoch": 1.5196581196581196, | |
| "grad_norm": 0.1528807431459427, | |
| "learning_rate": 4.841201716738198e-05, | |
| "loss": 0.384, | |
| "num_input_tokens_seen": 5474166, | |
| "step": 889, | |
| "train_runtime": 3905.7353, | |
| "train_tokens_per_second": 1401.571 | |
| }, | |
| { | |
| "epoch": 1.5213675213675213, | |
| "grad_norm": 0.1336115598678589, | |
| "learning_rate": 4.824034334763949e-05, | |
| "loss": 0.337, | |
| "num_input_tokens_seen": 5480990, | |
| "step": 890, | |
| "train_runtime": 3910.1338, | |
| "train_tokens_per_second": 1401.74 | |
| }, | |
| { | |
| "epoch": 1.523076923076923, | |
| "grad_norm": 0.14113153517246246, | |
| "learning_rate": 4.8068669527897e-05, | |
| "loss": 0.3582, | |
| "num_input_tokens_seen": 5487366, | |
| "step": 891, | |
| "train_runtime": 3914.2226, | |
| "train_tokens_per_second": 1401.904 | |
| }, | |
| { | |
| "epoch": 1.5247863247863247, | |
| "grad_norm": 0.14740779995918274, | |
| "learning_rate": 4.789699570815451e-05, | |
| "loss": 0.3241, | |
| "num_input_tokens_seen": 5491782, | |
| "step": 892, | |
| "train_runtime": 3917.2888, | |
| "train_tokens_per_second": 1401.934 | |
| }, | |
| { | |
| "epoch": 1.5264957264957264, | |
| "grad_norm": 0.1684054136276245, | |
| "learning_rate": 4.772532188841202e-05, | |
| "loss": 0.3419, | |
| "num_input_tokens_seen": 5498598, | |
| "step": 893, | |
| "train_runtime": 3921.6413, | |
| "train_tokens_per_second": 1402.116 | |
| }, | |
| { | |
| "epoch": 1.528205128205128, | |
| "grad_norm": 0.1600559949874878, | |
| "learning_rate": 4.755364806866953e-05, | |
| "loss": 0.3971, | |
| "num_input_tokens_seen": 5504558, | |
| "step": 894, | |
| "train_runtime": 3925.5164, | |
| "train_tokens_per_second": 1402.251 | |
| }, | |
| { | |
| "epoch": 1.5299145299145298, | |
| "grad_norm": 0.16193747520446777, | |
| "learning_rate": 4.738197424892704e-05, | |
| "loss": 0.1982, | |
| "num_input_tokens_seen": 5518366, | |
| "step": 895, | |
| "train_runtime": 3933.7663, | |
| "train_tokens_per_second": 1402.82 | |
| }, | |
| { | |
| "epoch": 1.5316239316239315, | |
| "grad_norm": 0.1655426323413849, | |
| "learning_rate": 4.721030042918455e-05, | |
| "loss": 0.4295, | |
| "num_input_tokens_seen": 5523782, | |
| "step": 896, | |
| "train_runtime": 3937.3438, | |
| "train_tokens_per_second": 1402.921 | |
| }, | |
| { | |
| "epoch": 1.5333333333333332, | |
| "grad_norm": 0.18400371074676514, | |
| "learning_rate": 4.703862660944206e-05, | |
| "loss": 0.4301, | |
| "num_input_tokens_seen": 5529142, | |
| "step": 897, | |
| "train_runtime": 3940.9012, | |
| "train_tokens_per_second": 1403.015 | |
| }, | |
| { | |
| "epoch": 1.535042735042735, | |
| "grad_norm": 0.1289558857679367, | |
| "learning_rate": 4.6866952789699576e-05, | |
| "loss": 0.2999, | |
| "num_input_tokens_seen": 5536438, | |
| "step": 898, | |
| "train_runtime": 3945.5414, | |
| "train_tokens_per_second": 1403.214 | |
| }, | |
| { | |
| "epoch": 1.5367521367521366, | |
| "grad_norm": 0.13847073912620544, | |
| "learning_rate": 4.6695278969957086e-05, | |
| "loss": 0.4114, | |
| "num_input_tokens_seen": 5544542, | |
| "step": 899, | |
| "train_runtime": 3950.6248, | |
| "train_tokens_per_second": 1403.46 | |
| }, | |
| { | |
| "epoch": 1.5384615384615383, | |
| "grad_norm": 0.130548357963562, | |
| "learning_rate": 4.6523605150214595e-05, | |
| "loss": 0.3208, | |
| "num_input_tokens_seen": 5551966, | |
| "step": 900, | |
| "train_runtime": 3955.355, | |
| "train_tokens_per_second": 1403.658 | |
| }, | |
| { | |
| "epoch": 1.54017094017094, | |
| "grad_norm": 0.12483415752649307, | |
| "learning_rate": 4.6351931330472104e-05, | |
| "loss": 0.3094, | |
| "num_input_tokens_seen": 5559310, | |
| "step": 901, | |
| "train_runtime": 3962.2691, | |
| "train_tokens_per_second": 1403.062 | |
| }, | |
| { | |
| "epoch": 1.5418803418803417, | |
| "grad_norm": 0.1626817137002945, | |
| "learning_rate": 4.618025751072962e-05, | |
| "loss": 0.5097, | |
| "num_input_tokens_seen": 5566126, | |
| "step": 902, | |
| "train_runtime": 3966.5485, | |
| "train_tokens_per_second": 1403.267 | |
| }, | |
| { | |
| "epoch": 1.5435897435897434, | |
| "grad_norm": 0.12783609330654144, | |
| "learning_rate": 4.600858369098713e-05, | |
| "loss": 0.376, | |
| "num_input_tokens_seen": 5573526, | |
| "step": 903, | |
| "train_runtime": 3971.1289, | |
| "train_tokens_per_second": 1403.512 | |
| }, | |
| { | |
| "epoch": 1.5452991452991451, | |
| "grad_norm": 0.12774644792079926, | |
| "learning_rate": 4.583690987124464e-05, | |
| "loss": 0.3011, | |
| "num_input_tokens_seen": 5579950, | |
| "step": 904, | |
| "train_runtime": 3975.2459, | |
| "train_tokens_per_second": 1403.674 | |
| }, | |
| { | |
| "epoch": 1.547008547008547, | |
| "grad_norm": 0.13785552978515625, | |
| "learning_rate": 4.566523605150215e-05, | |
| "loss": 0.2532, | |
| "num_input_tokens_seen": 5592222, | |
| "step": 905, | |
| "train_runtime": 3982.6088, | |
| "train_tokens_per_second": 1404.161 | |
| }, | |
| { | |
| "epoch": 1.5487179487179488, | |
| "grad_norm": 0.10258350521326065, | |
| "learning_rate": 4.5493562231759656e-05, | |
| "loss": 0.2478, | |
| "num_input_tokens_seen": 5601822, | |
| "step": 906, | |
| "train_runtime": 3988.4826, | |
| "train_tokens_per_second": 1404.5 | |
| }, | |
| { | |
| "epoch": 1.5504273504273505, | |
| "grad_norm": 0.14077666401863098, | |
| "learning_rate": 4.532188841201717e-05, | |
| "loss": 0.2856, | |
| "num_input_tokens_seen": 5606942, | |
| "step": 907, | |
| "train_runtime": 3991.8287, | |
| "train_tokens_per_second": 1404.605 | |
| }, | |
| { | |
| "epoch": 1.5521367521367522, | |
| "grad_norm": 0.15848904848098755, | |
| "learning_rate": 4.515021459227468e-05, | |
| "loss": 0.4184, | |
| "num_input_tokens_seen": 5611870, | |
| "step": 908, | |
| "train_runtime": 3995.0262, | |
| "train_tokens_per_second": 1404.714 | |
| }, | |
| { | |
| "epoch": 1.5538461538461539, | |
| "grad_norm": 0.14436501264572144, | |
| "learning_rate": 4.497854077253219e-05, | |
| "loss": 0.3977, | |
| "num_input_tokens_seen": 5618398, | |
| "step": 909, | |
| "train_runtime": 3999.2042, | |
| "train_tokens_per_second": 1404.879 | |
| }, | |
| { | |
| "epoch": 1.5555555555555556, | |
| "grad_norm": 0.13145920634269714, | |
| "learning_rate": 4.48068669527897e-05, | |
| "loss": 0.3204, | |
| "num_input_tokens_seen": 5627286, | |
| "step": 910, | |
| "train_runtime": 4004.6715, | |
| "train_tokens_per_second": 1405.18 | |
| }, | |
| { | |
| "epoch": 1.5572649572649573, | |
| "grad_norm": 0.15464188158512115, | |
| "learning_rate": 4.4635193133047216e-05, | |
| "loss": 0.2961, | |
| "num_input_tokens_seen": 5631254, | |
| "step": 911, | |
| "train_runtime": 4007.4026, | |
| "train_tokens_per_second": 1405.213 | |
| }, | |
| { | |
| "epoch": 1.558974358974359, | |
| "grad_norm": 0.15370634198188782, | |
| "learning_rate": 4.4463519313304725e-05, | |
| "loss": 0.3432, | |
| "num_input_tokens_seen": 5638078, | |
| "step": 912, | |
| "train_runtime": 4011.673, | |
| "train_tokens_per_second": 1405.418 | |
| }, | |
| { | |
| "epoch": 1.5606837606837607, | |
| "grad_norm": 0.11987742781639099, | |
| "learning_rate": 4.4291845493562234e-05, | |
| "loss": 0.2736, | |
| "num_input_tokens_seen": 5647550, | |
| "step": 913, | |
| "train_runtime": 4017.4402, | |
| "train_tokens_per_second": 1405.758 | |
| }, | |
| { | |
| "epoch": 1.5623931623931624, | |
| "grad_norm": 0.1432374119758606, | |
| "learning_rate": 4.412017167381974e-05, | |
| "loss": 0.3456, | |
| "num_input_tokens_seen": 5654566, | |
| "step": 914, | |
| "train_runtime": 4021.8492, | |
| "train_tokens_per_second": 1405.962 | |
| }, | |
| { | |
| "epoch": 1.564102564102564, | |
| "grad_norm": 0.14146411418914795, | |
| "learning_rate": 4.394849785407725e-05, | |
| "loss": 0.2831, | |
| "num_input_tokens_seen": 5661366, | |
| "step": 915, | |
| "train_runtime": 4026.1282, | |
| "train_tokens_per_second": 1406.156 | |
| }, | |
| { | |
| "epoch": 1.5658119658119658, | |
| "grad_norm": 0.1362568885087967, | |
| "learning_rate": 4.377682403433477e-05, | |
| "loss": 0.3261, | |
| "num_input_tokens_seen": 5667022, | |
| "step": 916, | |
| "train_runtime": 4029.7803, | |
| "train_tokens_per_second": 1406.286 | |
| }, | |
| { | |
| "epoch": 1.5675213675213675, | |
| "grad_norm": 0.13071489334106445, | |
| "learning_rate": 4.360515021459228e-05, | |
| "loss": 0.264, | |
| "num_input_tokens_seen": 5674158, | |
| "step": 917, | |
| "train_runtime": 4034.3501, | |
| "train_tokens_per_second": 1406.461 | |
| }, | |
| { | |
| "epoch": 1.5692307692307692, | |
| "grad_norm": 0.1308346837759018, | |
| "learning_rate": 4.3433476394849786e-05, | |
| "loss": 0.2655, | |
| "num_input_tokens_seen": 5681038, | |
| "step": 918, | |
| "train_runtime": 4038.6578, | |
| "train_tokens_per_second": 1406.665 | |
| }, | |
| { | |
| "epoch": 1.570940170940171, | |
| "grad_norm": 0.14354775846004486, | |
| "learning_rate": 4.3261802575107296e-05, | |
| "loss": 0.3548, | |
| "num_input_tokens_seen": 5689142, | |
| "step": 919, | |
| "train_runtime": 4043.681, | |
| "train_tokens_per_second": 1406.922 | |
| }, | |
| { | |
| "epoch": 1.5726495726495726, | |
| "grad_norm": 0.14994634687900543, | |
| "learning_rate": 4.309012875536481e-05, | |
| "loss": 0.3652, | |
| "num_input_tokens_seen": 5694430, | |
| "step": 920, | |
| "train_runtime": 4047.0891, | |
| "train_tokens_per_second": 1407.043 | |
| }, | |
| { | |
| "epoch": 1.5743589743589743, | |
| "grad_norm": 0.14056207239627838, | |
| "learning_rate": 4.291845493562232e-05, | |
| "loss": 0.2809, | |
| "num_input_tokens_seen": 5699694, | |
| "step": 921, | |
| "train_runtime": 4050.4592, | |
| "train_tokens_per_second": 1407.172 | |
| }, | |
| { | |
| "epoch": 1.576068376068376, | |
| "grad_norm": 0.1594097912311554, | |
| "learning_rate": 4.274678111587983e-05, | |
| "loss": 0.4683, | |
| "num_input_tokens_seen": 5706182, | |
| "step": 922, | |
| "train_runtime": 4054.6337, | |
| "train_tokens_per_second": 1407.324 | |
| }, | |
| { | |
| "epoch": 1.5777777777777777, | |
| "grad_norm": 0.16299133002758026, | |
| "learning_rate": 4.257510729613734e-05, | |
| "loss": 0.4031, | |
| "num_input_tokens_seen": 5711566, | |
| "step": 923, | |
| "train_runtime": 4058.0973, | |
| "train_tokens_per_second": 1407.449 | |
| }, | |
| { | |
| "epoch": 1.5794871794871796, | |
| "grad_norm": 0.18204393982887268, | |
| "learning_rate": 4.240343347639485e-05, | |
| "loss": 0.4191, | |
| "num_input_tokens_seen": 5717422, | |
| "step": 924, | |
| "train_runtime": 4061.8526, | |
| "train_tokens_per_second": 1407.59 | |
| }, | |
| { | |
| "epoch": 1.5811965811965814, | |
| "grad_norm": 0.16016630828380585, | |
| "learning_rate": 4.2231759656652364e-05, | |
| "loss": 0.3527, | |
| "num_input_tokens_seen": 5721734, | |
| "step": 925, | |
| "train_runtime": 4064.8253, | |
| "train_tokens_per_second": 1407.621 | |
| }, | |
| { | |
| "epoch": 1.582905982905983, | |
| "grad_norm": 0.15261352062225342, | |
| "learning_rate": 4.206008583690987e-05, | |
| "loss": 0.2939, | |
| "num_input_tokens_seen": 5726726, | |
| "step": 926, | |
| "train_runtime": 4068.1454, | |
| "train_tokens_per_second": 1407.699 | |
| }, | |
| { | |
| "epoch": 1.5846153846153848, | |
| "grad_norm": 0.14059829711914062, | |
| "learning_rate": 4.188841201716738e-05, | |
| "loss": 0.345, | |
| "num_input_tokens_seen": 5732878, | |
| "step": 927, | |
| "train_runtime": 4072.1298, | |
| "train_tokens_per_second": 1407.833 | |
| }, | |
| { | |
| "epoch": 1.5863247863247865, | |
| "grad_norm": 0.15168927609920502, | |
| "learning_rate": 4.171673819742489e-05, | |
| "loss": 0.2833, | |
| "num_input_tokens_seen": 5738606, | |
| "step": 928, | |
| "train_runtime": 4075.9083, | |
| "train_tokens_per_second": 1407.933 | |
| }, | |
| { | |
| "epoch": 1.5880341880341882, | |
| "grad_norm": 0.14608868956565857, | |
| "learning_rate": 4.154506437768241e-05, | |
| "loss": 0.3264, | |
| "num_input_tokens_seen": 5744222, | |
| "step": 929, | |
| "train_runtime": 4079.5662, | |
| "train_tokens_per_second": 1408.047 | |
| }, | |
| { | |
| "epoch": 1.5897435897435899, | |
| "grad_norm": 0.13235428929328918, | |
| "learning_rate": 4.1373390557939917e-05, | |
| "loss": 0.3547, | |
| "num_input_tokens_seen": 5751422, | |
| "step": 930, | |
| "train_runtime": 4084.0105, | |
| "train_tokens_per_second": 1408.278 | |
| }, | |
| { | |
| "epoch": 1.5914529914529916, | |
| "grad_norm": 0.15778063237667084, | |
| "learning_rate": 4.1201716738197426e-05, | |
| "loss": 0.3659, | |
| "num_input_tokens_seen": 5757270, | |
| "step": 931, | |
| "train_runtime": 4089.841, | |
| "train_tokens_per_second": 1407.7 | |
| }, | |
| { | |
| "epoch": 1.5931623931623933, | |
| "grad_norm": 0.14234130084514618, | |
| "learning_rate": 4.1030042918454935e-05, | |
| "loss": 0.3474, | |
| "num_input_tokens_seen": 5763062, | |
| "step": 932, | |
| "train_runtime": 4093.5857, | |
| "train_tokens_per_second": 1407.827 | |
| }, | |
| { | |
| "epoch": 1.594871794871795, | |
| "grad_norm": 0.15950438380241394, | |
| "learning_rate": 4.0858369098712444e-05, | |
| "loss": 0.3991, | |
| "num_input_tokens_seen": 5769542, | |
| "step": 933, | |
| "train_runtime": 4097.7094, | |
| "train_tokens_per_second": 1407.992 | |
| }, | |
| { | |
| "epoch": 1.5965811965811967, | |
| "grad_norm": 0.15297670662403107, | |
| "learning_rate": 4.068669527896996e-05, | |
| "loss": 0.4014, | |
| "num_input_tokens_seen": 5777038, | |
| "step": 934, | |
| "train_runtime": 4102.3551, | |
| "train_tokens_per_second": 1408.225 | |
| }, | |
| { | |
| "epoch": 1.5982905982905984, | |
| "grad_norm": 0.14198969304561615, | |
| "learning_rate": 4.051502145922747e-05, | |
| "loss": 0.324, | |
| "num_input_tokens_seen": 5783518, | |
| "step": 935, | |
| "train_runtime": 4106.4425, | |
| "train_tokens_per_second": 1408.401 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 0.18063846230506897, | |
| "learning_rate": 4.034334763948498e-05, | |
| "loss": 0.2441, | |
| "num_input_tokens_seen": 5789382, | |
| "step": 936, | |
| "train_runtime": 4110.1508, | |
| "train_tokens_per_second": 1408.557 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "eval_loss": 0.4057992100715637, | |
| "eval_runtime": 39.8829, | |
| "eval_samples_per_second": 25.023, | |
| "eval_steps_per_second": 3.134, | |
| "num_input_tokens_seen": 5789382, | |
| "step": 936 | |
| }, | |
| { | |
| "epoch": 1.6017094017094018, | |
| "grad_norm": 0.17349766194820404, | |
| "learning_rate": 4.017167381974249e-05, | |
| "loss": 0.4031, | |
| "num_input_tokens_seen": 5793958, | |
| "step": 937, | |
| "train_runtime": 4153.1322, | |
| "train_tokens_per_second": 1395.082 | |
| }, | |
| { | |
| "epoch": 1.6034188034188035, | |
| "grad_norm": 0.14728385210037231, | |
| "learning_rate": 4e-05, | |
| "loss": 0.3286, | |
| "num_input_tokens_seen": 5801366, | |
| "step": 938, | |
| "train_runtime": 4157.8001, | |
| "train_tokens_per_second": 1395.297 | |
| }, | |
| { | |
| "epoch": 1.6051282051282052, | |
| "grad_norm": 0.15259931981563568, | |
| "learning_rate": 3.982832618025751e-05, | |
| "loss": 0.3429, | |
| "num_input_tokens_seen": 5807702, | |
| "step": 939, | |
| "train_runtime": 4161.8686, | |
| "train_tokens_per_second": 1395.455 | |
| }, | |
| { | |
| "epoch": 1.606837606837607, | |
| "grad_norm": 0.15199637413024902, | |
| "learning_rate": 3.965665236051502e-05, | |
| "loss": 0.3543, | |
| "num_input_tokens_seen": 5814662, | |
| "step": 940, | |
| "train_runtime": 4166.1977, | |
| "train_tokens_per_second": 1395.676 | |
| }, | |
| { | |
| "epoch": 1.6085470085470086, | |
| "grad_norm": 0.16361570358276367, | |
| "learning_rate": 3.948497854077253e-05, | |
| "loss": 0.367, | |
| "num_input_tokens_seen": 5819478, | |
| "step": 941, | |
| "train_runtime": 4169.3434, | |
| "train_tokens_per_second": 1395.778 | |
| }, | |
| { | |
| "epoch": 1.6102564102564103, | |
| "grad_norm": 0.1512775421142578, | |
| "learning_rate": 3.931330472103004e-05, | |
| "loss": 0.338, | |
| "num_input_tokens_seen": 5826830, | |
| "step": 942, | |
| "train_runtime": 4173.9012, | |
| "train_tokens_per_second": 1396.015 | |
| }, | |
| { | |
| "epoch": 1.611965811965812, | |
| "grad_norm": 0.1339310258626938, | |
| "learning_rate": 3.9141630901287556e-05, | |
| "loss": 0.3077, | |
| "num_input_tokens_seen": 5833174, | |
| "step": 943, | |
| "train_runtime": 4178.0154, | |
| "train_tokens_per_second": 1396.159 | |
| }, | |
| { | |
| "epoch": 1.6136752136752137, | |
| "grad_norm": 0.17570827901363373, | |
| "learning_rate": 3.8969957081545065e-05, | |
| "loss": 0.3698, | |
| "num_input_tokens_seen": 5837766, | |
| "step": 944, | |
| "train_runtime": 4181.1294, | |
| "train_tokens_per_second": 1396.217 | |
| }, | |
| { | |
| "epoch": 1.6153846153846154, | |
| "grad_norm": 0.1571483314037323, | |
| "learning_rate": 3.8798283261802574e-05, | |
| "loss": 0.4129, | |
| "num_input_tokens_seen": 5843358, | |
| "step": 945, | |
| "train_runtime": 4184.7637, | |
| "train_tokens_per_second": 1396.341 | |
| }, | |
| { | |
| "epoch": 1.6170940170940171, | |
| "grad_norm": 0.1724429428577423, | |
| "learning_rate": 3.862660944206008e-05, | |
| "loss": 0.4613, | |
| "num_input_tokens_seen": 5849022, | |
| "step": 946, | |
| "train_runtime": 4188.4421, | |
| "train_tokens_per_second": 1396.467 | |
| }, | |
| { | |
| "epoch": 1.6188034188034188, | |
| "grad_norm": 0.1553131341934204, | |
| "learning_rate": 3.84549356223176e-05, | |
| "loss": 0.3879, | |
| "num_input_tokens_seen": 5854078, | |
| "step": 947, | |
| "train_runtime": 4191.7577, | |
| "train_tokens_per_second": 1396.569 | |
| }, | |
| { | |
| "epoch": 1.6205128205128205, | |
| "grad_norm": 0.12425386160612106, | |
| "learning_rate": 3.828326180257511e-05, | |
| "loss": 0.2773, | |
| "num_input_tokens_seen": 5861006, | |
| "step": 948, | |
| "train_runtime": 4196.1024, | |
| "train_tokens_per_second": 1396.774 | |
| }, | |
| { | |
| "epoch": 1.6222222222222222, | |
| "grad_norm": 0.14096501469612122, | |
| "learning_rate": 3.811158798283262e-05, | |
| "loss": 0.34, | |
| "num_input_tokens_seen": 5865774, | |
| "step": 949, | |
| "train_runtime": 4199.3625, | |
| "train_tokens_per_second": 1396.825 | |
| }, | |
| { | |
| "epoch": 1.623931623931624, | |
| "grad_norm": 0.1395706981420517, | |
| "learning_rate": 3.7939914163090127e-05, | |
| "loss": 0.3407, | |
| "num_input_tokens_seen": 5871974, | |
| "step": 950, | |
| "train_runtime": 4203.3207, | |
| "train_tokens_per_second": 1396.985 | |
| }, | |
| { | |
| "epoch": 1.6256410256410256, | |
| "grad_norm": 0.17341846227645874, | |
| "learning_rate": 3.776824034334764e-05, | |
| "loss": 0.4103, | |
| "num_input_tokens_seen": 5877782, | |
| "step": 951, | |
| "train_runtime": 4207.092, | |
| "train_tokens_per_second": 1397.113 | |
| }, | |
| { | |
| "epoch": 1.6273504273504273, | |
| "grad_norm": 0.13125059008598328, | |
| "learning_rate": 3.759656652360515e-05, | |
| "loss": 0.2613, | |
| "num_input_tokens_seen": 5884166, | |
| "step": 952, | |
| "train_runtime": 4211.2144, | |
| "train_tokens_per_second": 1397.261 | |
| }, | |
| { | |
| "epoch": 1.629059829059829, | |
| "grad_norm": 0.15653657913208008, | |
| "learning_rate": 3.742489270386266e-05, | |
| "loss": 0.348, | |
| "num_input_tokens_seen": 5890622, | |
| "step": 953, | |
| "train_runtime": 4215.4326, | |
| "train_tokens_per_second": 1397.394 | |
| }, | |
| { | |
| "epoch": 1.6307692307692307, | |
| "grad_norm": 0.16723714768886566, | |
| "learning_rate": 3.725321888412017e-05, | |
| "loss": 0.4219, | |
| "num_input_tokens_seen": 5895502, | |
| "step": 954, | |
| "train_runtime": 4218.7165, | |
| "train_tokens_per_second": 1397.463 | |
| }, | |
| { | |
| "epoch": 1.6324786324786325, | |
| "grad_norm": 0.146444633603096, | |
| "learning_rate": 3.708154506437768e-05, | |
| "loss": 0.2672, | |
| "num_input_tokens_seen": 5901414, | |
| "step": 955, | |
| "train_runtime": 4222.6691, | |
| "train_tokens_per_second": 1397.555 | |
| }, | |
| { | |
| "epoch": 1.6341880341880342, | |
| "grad_norm": 0.11249315738677979, | |
| "learning_rate": 3.6909871244635195e-05, | |
| "loss": 0.2149, | |
| "num_input_tokens_seen": 5909254, | |
| "step": 956, | |
| "train_runtime": 4227.5922, | |
| "train_tokens_per_second": 1397.782 | |
| }, | |
| { | |
| "epoch": 1.6358974358974359, | |
| "grad_norm": 0.14980441331863403, | |
| "learning_rate": 3.6738197424892704e-05, | |
| "loss": 0.3522, | |
| "num_input_tokens_seen": 5914310, | |
| "step": 957, | |
| "train_runtime": 4231.0393, | |
| "train_tokens_per_second": 1397.839 | |
| }, | |
| { | |
| "epoch": 1.6376068376068376, | |
| "grad_norm": 0.13074517250061035, | |
| "learning_rate": 3.656652360515021e-05, | |
| "loss": 0.2345, | |
| "num_input_tokens_seen": 5921494, | |
| "step": 958, | |
| "train_runtime": 4235.5622, | |
| "train_tokens_per_second": 1398.042 | |
| }, | |
| { | |
| "epoch": 1.6393162393162393, | |
| "grad_norm": 0.14216265082359314, | |
| "learning_rate": 3.639484978540772e-05, | |
| "loss": 0.3773, | |
| "num_input_tokens_seen": 5927062, | |
| "step": 959, | |
| "train_runtime": 4239.1985, | |
| "train_tokens_per_second": 1398.156 | |
| }, | |
| { | |
| "epoch": 1.641025641025641, | |
| "grad_norm": 0.16056610643863678, | |
| "learning_rate": 3.622317596566524e-05, | |
| "loss": 0.3857, | |
| "num_input_tokens_seen": 5934134, | |
| "step": 960, | |
| "train_runtime": 4243.7395, | |
| "train_tokens_per_second": 1398.327 | |
| }, | |
| { | |
| "epoch": 1.6427350427350427, | |
| "grad_norm": 0.1462031453847885, | |
| "learning_rate": 3.605150214592275e-05, | |
| "loss": 0.3269, | |
| "num_input_tokens_seen": 5939398, | |
| "step": 961, | |
| "train_runtime": 4249.3319, | |
| "train_tokens_per_second": 1397.725 | |
| }, | |
| { | |
| "epoch": 1.6444444444444444, | |
| "grad_norm": 0.1907830536365509, | |
| "learning_rate": 3.587982832618026e-05, | |
| "loss": 0.5159, | |
| "num_input_tokens_seen": 5944502, | |
| "step": 962, | |
| "train_runtime": 4252.8018, | |
| "train_tokens_per_second": 1397.785 | |
| }, | |
| { | |
| "epoch": 1.646153846153846, | |
| "grad_norm": 0.16608525812625885, | |
| "learning_rate": 3.5708154506437766e-05, | |
| "loss": 0.3244, | |
| "num_input_tokens_seen": 5950342, | |
| "step": 963, | |
| "train_runtime": 4256.5589, | |
| "train_tokens_per_second": 1397.923 | |
| }, | |
| { | |
| "epoch": 1.6478632478632478, | |
| "grad_norm": 0.14312684535980225, | |
| "learning_rate": 3.5536480686695275e-05, | |
| "loss": 0.3154, | |
| "num_input_tokens_seen": 5955310, | |
| "step": 964, | |
| "train_runtime": 4259.9178, | |
| "train_tokens_per_second": 1397.987 | |
| }, | |
| { | |
| "epoch": 1.6495726495726495, | |
| "grad_norm": 0.12518402934074402, | |
| "learning_rate": 3.536480686695279e-05, | |
| "loss": 0.3291, | |
| "num_input_tokens_seen": 5965774, | |
| "step": 965, | |
| "train_runtime": 4266.2276, | |
| "train_tokens_per_second": 1398.372 | |
| }, | |
| { | |
| "epoch": 1.6512820512820512, | |
| "grad_norm": 0.13345399498939514, | |
| "learning_rate": 3.51931330472103e-05, | |
| "loss": 0.3288, | |
| "num_input_tokens_seen": 5973430, | |
| "step": 966, | |
| "train_runtime": 4271.1227, | |
| "train_tokens_per_second": 1398.562 | |
| }, | |
| { | |
| "epoch": 1.652991452991453, | |
| "grad_norm": 0.14265747368335724, | |
| "learning_rate": 3.502145922746781e-05, | |
| "loss": 0.3364, | |
| "num_input_tokens_seen": 5978654, | |
| "step": 967, | |
| "train_runtime": 4274.6629, | |
| "train_tokens_per_second": 1398.626 | |
| }, | |
| { | |
| "epoch": 1.6547008547008546, | |
| "grad_norm": 0.16501638293266296, | |
| "learning_rate": 3.484978540772532e-05, | |
| "loss": 0.3486, | |
| "num_input_tokens_seen": 5983806, | |
| "step": 968, | |
| "train_runtime": 4278.033, | |
| "train_tokens_per_second": 1398.728 | |
| }, | |
| { | |
| "epoch": 1.6564102564102563, | |
| "grad_norm": 0.1431581974029541, | |
| "learning_rate": 3.4678111587982834e-05, | |
| "loss": 0.3881, | |
| "num_input_tokens_seen": 5993574, | |
| "step": 969, | |
| "train_runtime": 4284.1459, | |
| "train_tokens_per_second": 1399.013 | |
| }, | |
| { | |
| "epoch": 1.658119658119658, | |
| "grad_norm": 0.14108191430568695, | |
| "learning_rate": 3.450643776824034e-05, | |
| "loss": 0.3189, | |
| "num_input_tokens_seen": 6000262, | |
| "step": 970, | |
| "train_runtime": 4288.3925, | |
| "train_tokens_per_second": 1399.187 | |
| }, | |
| { | |
| "epoch": 1.6598290598290597, | |
| "grad_norm": 0.16081646084785461, | |
| "learning_rate": 3.433476394849785e-05, | |
| "loss": 0.3586, | |
| "num_input_tokens_seen": 6005062, | |
| "step": 971, | |
| "train_runtime": 4291.5438, | |
| "train_tokens_per_second": 1399.278 | |
| }, | |
| { | |
| "epoch": 1.6615384615384614, | |
| "grad_norm": 0.16049602627754211, | |
| "learning_rate": 3.416309012875537e-05, | |
| "loss": 0.3027, | |
| "num_input_tokens_seen": 6009998, | |
| "step": 972, | |
| "train_runtime": 4294.9154, | |
| "train_tokens_per_second": 1399.329 | |
| }, | |
| { | |
| "epoch": 1.6632478632478631, | |
| "grad_norm": 0.14511296153068542, | |
| "learning_rate": 3.399141630901288e-05, | |
| "loss": 0.358, | |
| "num_input_tokens_seen": 6017742, | |
| "step": 973, | |
| "train_runtime": 4299.8283, | |
| "train_tokens_per_second": 1399.531 | |
| }, | |
| { | |
| "epoch": 1.6649572649572648, | |
| "grad_norm": 0.1554926484823227, | |
| "learning_rate": 3.381974248927039e-05, | |
| "loss": 0.3312, | |
| "num_input_tokens_seen": 6024430, | |
| "step": 974, | |
| "train_runtime": 4304.1438, | |
| "train_tokens_per_second": 1399.681 | |
| }, | |
| { | |
| "epoch": 1.6666666666666665, | |
| "grad_norm": 0.163766011595726, | |
| "learning_rate": 3.3648068669527896e-05, | |
| "loss": 0.38, | |
| "num_input_tokens_seen": 6030750, | |
| "step": 975, | |
| "train_runtime": 4308.2834, | |
| "train_tokens_per_second": 1399.803 | |
| }, | |
| { | |
| "epoch": 1.6683760683760682, | |
| "grad_norm": 0.18036513030529022, | |
| "learning_rate": 3.347639484978541e-05, | |
| "loss": 0.4304, | |
| "num_input_tokens_seen": 6035278, | |
| "step": 976, | |
| "train_runtime": 4311.3418, | |
| "train_tokens_per_second": 1399.861 | |
| }, | |
| { | |
| "epoch": 1.67008547008547, | |
| "grad_norm": 0.16275691986083984, | |
| "learning_rate": 3.330472103004292e-05, | |
| "loss": 0.3478, | |
| "num_input_tokens_seen": 6041366, | |
| "step": 977, | |
| "train_runtime": 4315.3401, | |
| "train_tokens_per_second": 1399.974 | |
| }, | |
| { | |
| "epoch": 1.6717948717948716, | |
| "grad_norm": 0.13549788296222687, | |
| "learning_rate": 3.313304721030043e-05, | |
| "loss": 0.3254, | |
| "num_input_tokens_seen": 6047142, | |
| "step": 978, | |
| "train_runtime": 4319.1359, | |
| "train_tokens_per_second": 1400.081 | |
| }, | |
| { | |
| "epoch": 1.6735042735042736, | |
| "grad_norm": 0.15927636623382568, | |
| "learning_rate": 3.296137339055794e-05, | |
| "loss": 0.3495, | |
| "num_input_tokens_seen": 6053086, | |
| "step": 979, | |
| "train_runtime": 4322.9032, | |
| "train_tokens_per_second": 1400.236 | |
| }, | |
| { | |
| "epoch": 1.6752136752136753, | |
| "grad_norm": 0.14179955422878265, | |
| "learning_rate": 3.2789699570815455e-05, | |
| "loss": 0.3902, | |
| "num_input_tokens_seen": 6060382, | |
| "step": 980, | |
| "train_runtime": 4327.5542, | |
| "train_tokens_per_second": 1400.417 | |
| }, | |
| { | |
| "epoch": 1.676923076923077, | |
| "grad_norm": 0.13718022406101227, | |
| "learning_rate": 3.2618025751072964e-05, | |
| "loss": 0.325, | |
| "num_input_tokens_seen": 6067214, | |
| "step": 981, | |
| "train_runtime": 4331.8978, | |
| "train_tokens_per_second": 1400.59 | |
| }, | |
| { | |
| "epoch": 1.6786324786324787, | |
| "grad_norm": 0.14240792393684387, | |
| "learning_rate": 3.2446351931330473e-05, | |
| "loss": 0.3153, | |
| "num_input_tokens_seen": 6072542, | |
| "step": 982, | |
| "train_runtime": 4335.4612, | |
| "train_tokens_per_second": 1400.668 | |
| }, | |
| { | |
| "epoch": 1.6803418803418804, | |
| "grad_norm": 0.17063497006893158, | |
| "learning_rate": 3.227467811158798e-05, | |
| "loss": 0.3474, | |
| "num_input_tokens_seen": 6077822, | |
| "step": 983, | |
| "train_runtime": 4339.0337, | |
| "train_tokens_per_second": 1400.732 | |
| }, | |
| { | |
| "epoch": 1.682051282051282, | |
| "grad_norm": 0.1793319284915924, | |
| "learning_rate": 3.21030042918455e-05, | |
| "loss": 0.3506, | |
| "num_input_tokens_seen": 6082414, | |
| "step": 984, | |
| "train_runtime": 4342.1991, | |
| "train_tokens_per_second": 1400.768 | |
| }, | |
| { | |
| "epoch": 1.6837606837606838, | |
| "grad_norm": 0.15594610571861267, | |
| "learning_rate": 3.193133047210301e-05, | |
| "loss": 0.3521, | |
| "num_input_tokens_seen": 6088374, | |
| "step": 985, | |
| "train_runtime": 4346.1065, | |
| "train_tokens_per_second": 1400.88 | |
| }, | |
| { | |
| "epoch": 1.6854700854700855, | |
| "grad_norm": 0.1668577343225479, | |
| "learning_rate": 3.175965665236052e-05, | |
| "loss": 0.3075, | |
| "num_input_tokens_seen": 6099598, | |
| "step": 986, | |
| "train_runtime": 4353.0219, | |
| "train_tokens_per_second": 1401.233 | |
| }, | |
| { | |
| "epoch": 1.6871794871794872, | |
| "grad_norm": 0.15573537349700928, | |
| "learning_rate": 3.158798283261803e-05, | |
| "loss": 0.3101, | |
| "num_input_tokens_seen": 6106238, | |
| "step": 987, | |
| "train_runtime": 4357.3365, | |
| "train_tokens_per_second": 1401.369 | |
| }, | |
| { | |
| "epoch": 1.6888888888888889, | |
| "grad_norm": 0.1659414917230606, | |
| "learning_rate": 3.141630901287554e-05, | |
| "loss": 0.3679, | |
| "num_input_tokens_seen": 6112990, | |
| "step": 988, | |
| "train_runtime": 4361.6346, | |
| "train_tokens_per_second": 1401.536 | |
| }, | |
| { | |
| "epoch": 1.6905982905982906, | |
| "grad_norm": 0.13771456480026245, | |
| "learning_rate": 3.124463519313305e-05, | |
| "loss": 0.2698, | |
| "num_input_tokens_seen": 6121190, | |
| "step": 989, | |
| "train_runtime": 4366.785, | |
| "train_tokens_per_second": 1401.761 | |
| }, | |
| { | |
| "epoch": 1.6923076923076923, | |
| "grad_norm": 0.17398853600025177, | |
| "learning_rate": 3.107296137339056e-05, | |
| "loss": 0.3585, | |
| "num_input_tokens_seen": 6126838, | |
| "step": 990, | |
| "train_runtime": 4370.4426, | |
| "train_tokens_per_second": 1401.88 | |
| }, | |
| { | |
| "epoch": 1.694017094017094, | |
| "grad_norm": 0.16992250084877014, | |
| "learning_rate": 3.0901287553648076e-05, | |
| "loss": 0.3688, | |
| "num_input_tokens_seen": 6132214, | |
| "step": 991, | |
| "train_runtime": 4376.044, | |
| "train_tokens_per_second": 1401.315 | |
| }, | |
| { | |
| "epoch": 1.6957264957264957, | |
| "grad_norm": 0.14736062288284302, | |
| "learning_rate": 3.0729613733905585e-05, | |
| "loss": 0.4102, | |
| "num_input_tokens_seen": 6139086, | |
| "step": 992, | |
| "train_runtime": 4380.4121, | |
| "train_tokens_per_second": 1401.486 | |
| }, | |
| { | |
| "epoch": 1.6974358974358974, | |
| "grad_norm": 0.09231652319431305, | |
| "learning_rate": 3.0557939914163094e-05, | |
| "loss": 0.1844, | |
| "num_input_tokens_seen": 6149238, | |
| "step": 993, | |
| "train_runtime": 4386.5474, | |
| "train_tokens_per_second": 1401.84 | |
| }, | |
| { | |
| "epoch": 1.699145299145299, | |
| "grad_norm": 0.17811483144760132, | |
| "learning_rate": 3.03862660944206e-05, | |
| "loss": 0.4097, | |
| "num_input_tokens_seen": 6154366, | |
| "step": 994, | |
| "train_runtime": 4389.9507, | |
| "train_tokens_per_second": 1401.921 | |
| }, | |
| { | |
| "epoch": 1.7008547008547008, | |
| "grad_norm": 0.15624217689037323, | |
| "learning_rate": 3.021459227467811e-05, | |
| "loss": 0.3516, | |
| "num_input_tokens_seen": 6159286, | |
| "step": 995, | |
| "train_runtime": 4393.3511, | |
| "train_tokens_per_second": 1401.956 | |
| }, | |
| { | |
| "epoch": 1.7025641025641025, | |
| "grad_norm": 0.1756419837474823, | |
| "learning_rate": 3.0042918454935625e-05, | |
| "loss": 0.3392, | |
| "num_input_tokens_seen": 6164166, | |
| "step": 996, | |
| "train_runtime": 4396.6508, | |
| "train_tokens_per_second": 1402.014 | |
| }, | |
| { | |
| "epoch": 1.7042735042735044, | |
| "grad_norm": 0.11751808226108551, | |
| "learning_rate": 2.9871244635193134e-05, | |
| "loss": 0.2156, | |
| "num_input_tokens_seen": 6172630, | |
| "step": 997, | |
| "train_runtime": 4401.9216, | |
| "train_tokens_per_second": 1402.258 | |
| }, | |
| { | |
| "epoch": 1.7059829059829061, | |
| "grad_norm": 0.1824459284543991, | |
| "learning_rate": 2.9699570815450643e-05, | |
| "loss": 0.3685, | |
| "num_input_tokens_seen": 6177326, | |
| "step": 998, | |
| "train_runtime": 4405.0787, | |
| "train_tokens_per_second": 1402.319 | |
| }, | |
| { | |
| "epoch": 1.7076923076923078, | |
| "grad_norm": 0.15616580843925476, | |
| "learning_rate": 2.9527896995708153e-05, | |
| "loss": 0.3737, | |
| "num_input_tokens_seen": 6182622, | |
| "step": 999, | |
| "train_runtime": 4408.5719, | |
| "train_tokens_per_second": 1402.409 | |
| }, | |
| { | |
| "epoch": 1.7094017094017095, | |
| "grad_norm": 0.1718655824661255, | |
| "learning_rate": 2.935622317596567e-05, | |
| "loss": 0.4426, | |
| "num_input_tokens_seen": 6189630, | |
| "step": 1000, | |
| "train_runtime": 4412.9794, | |
| "train_tokens_per_second": 1402.597 | |
| }, | |
| { | |
| "epoch": 1.7111111111111112, | |
| "grad_norm": 0.14478078484535217, | |
| "learning_rate": 2.9184549356223178e-05, | |
| "loss": 0.2377, | |
| "num_input_tokens_seen": 6196462, | |
| "step": 1001, | |
| "train_runtime": 4417.29, | |
| "train_tokens_per_second": 1402.775 | |
| }, | |
| { | |
| "epoch": 1.712820512820513, | |
| "grad_norm": 0.14062879979610443, | |
| "learning_rate": 2.9012875536480687e-05, | |
| "loss": 0.2676, | |
| "num_input_tokens_seen": 6204102, | |
| "step": 1002, | |
| "train_runtime": 4422.1082, | |
| "train_tokens_per_second": 1402.974 | |
| }, | |
| { | |
| "epoch": 1.7145299145299147, | |
| "grad_norm": 0.13248053193092346, | |
| "learning_rate": 2.8841201716738196e-05, | |
| "loss": 0.3631, | |
| "num_input_tokens_seen": 6210486, | |
| "step": 1003, | |
| "train_runtime": 4426.2686, | |
| "train_tokens_per_second": 1403.097 | |
| }, | |
| { | |
| "epoch": 1.7162393162393164, | |
| "grad_norm": 0.1455918848514557, | |
| "learning_rate": 2.866952789699571e-05, | |
| "loss": 0.3268, | |
| "num_input_tokens_seen": 6216734, | |
| "step": 1004, | |
| "train_runtime": 4430.3644, | |
| "train_tokens_per_second": 1403.211 | |
| }, | |
| { | |
| "epoch": 1.717948717948718, | |
| "grad_norm": 0.16086509823799133, | |
| "learning_rate": 2.849785407725322e-05, | |
| "loss": 0.2984, | |
| "num_input_tokens_seen": 6221590, | |
| "step": 1005, | |
| "train_runtime": 4433.6172, | |
| "train_tokens_per_second": 1403.276 | |
| }, | |
| { | |
| "epoch": 1.7196581196581198, | |
| "grad_norm": 0.24680602550506592, | |
| "learning_rate": 2.832618025751073e-05, | |
| "loss": 0.3334, | |
| "num_input_tokens_seen": 6229086, | |
| "step": 1006, | |
| "train_runtime": 4438.3525, | |
| "train_tokens_per_second": 1403.468 | |
| }, | |
| { | |
| "epoch": 1.7213675213675215, | |
| "grad_norm": 0.15239591896533966, | |
| "learning_rate": 2.8154506437768243e-05, | |
| "loss": 0.3622, | |
| "num_input_tokens_seen": 6235030, | |
| "step": 1007, | |
| "train_runtime": 4442.1313, | |
| "train_tokens_per_second": 1403.612 | |
| }, | |
| { | |
| "epoch": 1.7230769230769232, | |
| "grad_norm": 0.18432646989822388, | |
| "learning_rate": 2.7982832618025752e-05, | |
| "loss": 0.4047, | |
| "num_input_tokens_seen": 6240934, | |
| "step": 1008, | |
| "train_runtime": 4446.0001, | |
| "train_tokens_per_second": 1403.719 | |
| }, | |
| { | |
| "epoch": 1.7247863247863249, | |
| "grad_norm": 0.15836463868618011, | |
| "learning_rate": 2.7811158798283264e-05, | |
| "loss": 0.3048, | |
| "num_input_tokens_seen": 6249862, | |
| "step": 1009, | |
| "train_runtime": 4451.485, | |
| "train_tokens_per_second": 1403.995 | |
| }, | |
| { | |
| "epoch": 1.7264957264957266, | |
| "grad_norm": 0.15719516575336456, | |
| "learning_rate": 2.7639484978540774e-05, | |
| "loss": 0.3226, | |
| "num_input_tokens_seen": 6257486, | |
| "step": 1010, | |
| "train_runtime": 4456.2732, | |
| "train_tokens_per_second": 1404.197 | |
| }, | |
| { | |
| "epoch": 1.7282051282051283, | |
| "grad_norm": 0.15233346819877625, | |
| "learning_rate": 2.7467811158798286e-05, | |
| "loss": 0.3904, | |
| "num_input_tokens_seen": 6263398, | |
| "step": 1011, | |
| "train_runtime": 4460.0746, | |
| "train_tokens_per_second": 1404.326 | |
| }, | |
| { | |
| "epoch": 1.72991452991453, | |
| "grad_norm": 0.16483135521411896, | |
| "learning_rate": 2.7296137339055795e-05, | |
| "loss": 0.3194, | |
| "num_input_tokens_seen": 6267510, | |
| "step": 1012, | |
| "train_runtime": 4462.9455, | |
| "train_tokens_per_second": 1404.344 | |
| }, | |
| { | |
| "epoch": 1.7316239316239317, | |
| "grad_norm": 0.12890520691871643, | |
| "learning_rate": 2.7124463519313304e-05, | |
| "loss": 0.278, | |
| "num_input_tokens_seen": 6274342, | |
| "step": 1013, | |
| "train_runtime": 4467.431, | |
| "train_tokens_per_second": 1404.463 | |
| }, | |
| { | |
| "epoch": 1.7333333333333334, | |
| "grad_norm": 0.14849728345870972, | |
| "learning_rate": 2.6952789699570817e-05, | |
| "loss": 0.3502, | |
| "num_input_tokens_seen": 6279782, | |
| "step": 1014, | |
| "train_runtime": 4471.0355, | |
| "train_tokens_per_second": 1404.548 | |
| }, | |
| { | |
| "epoch": 1.735042735042735, | |
| "grad_norm": 0.15156908333301544, | |
| "learning_rate": 2.678111587982833e-05, | |
| "loss": 0.2686, | |
| "num_input_tokens_seen": 6286150, | |
| "step": 1015, | |
| "train_runtime": 4475.1422, | |
| "train_tokens_per_second": 1404.682 | |
| }, | |
| { | |
| "epoch": 1.7367521367521368, | |
| "grad_norm": 0.167219877243042, | |
| "learning_rate": 2.660944206008584e-05, | |
| "loss": 0.3783, | |
| "num_input_tokens_seen": 6291254, | |
| "step": 1016, | |
| "train_runtime": 4478.5112, | |
| "train_tokens_per_second": 1404.765 | |
| }, | |
| { | |
| "epoch": 1.7384615384615385, | |
| "grad_norm": 0.11013533920049667, | |
| "learning_rate": 2.6437768240343348e-05, | |
| "loss": 0.2325, | |
| "num_input_tokens_seen": 6297734, | |
| "step": 1017, | |
| "train_runtime": 4482.7092, | |
| "train_tokens_per_second": 1404.895 | |
| }, | |
| { | |
| "epoch": 1.7401709401709402, | |
| "grad_norm": 0.14911878108978271, | |
| "learning_rate": 2.626609442060086e-05, | |
| "loss": 0.3542, | |
| "num_input_tokens_seen": 6304838, | |
| "step": 1018, | |
| "train_runtime": 4487.1017, | |
| "train_tokens_per_second": 1405.103 | |
| }, | |
| { | |
| "epoch": 1.741880341880342, | |
| "grad_norm": 0.15777182579040527, | |
| "learning_rate": 2.6094420600858373e-05, | |
| "loss": 0.399, | |
| "num_input_tokens_seen": 6310614, | |
| "step": 1019, | |
| "train_runtime": 4490.9301, | |
| "train_tokens_per_second": 1405.191 | |
| }, | |
| { | |
| "epoch": 1.7435897435897436, | |
| "grad_norm": 0.13833945989608765, | |
| "learning_rate": 2.5922746781115882e-05, | |
| "loss": 0.337, | |
| "num_input_tokens_seen": 6318622, | |
| "step": 1020, | |
| "train_runtime": 4495.9494, | |
| "train_tokens_per_second": 1405.403 | |
| }, | |
| { | |
| "epoch": 1.7452991452991453, | |
| "grad_norm": 0.1786230504512787, | |
| "learning_rate": 2.575107296137339e-05, | |
| "loss": 0.331, | |
| "num_input_tokens_seen": 6324174, | |
| "step": 1021, | |
| "train_runtime": 4501.5449, | |
| "train_tokens_per_second": 1404.89 | |
| }, | |
| { | |
| "epoch": 1.747008547008547, | |
| "grad_norm": 0.12603215873241425, | |
| "learning_rate": 2.55793991416309e-05, | |
| "loss": 0.2773, | |
| "num_input_tokens_seen": 6332590, | |
| "step": 1022, | |
| "train_runtime": 4506.7954, | |
| "train_tokens_per_second": 1405.12 | |
| }, | |
| { | |
| "epoch": 1.7487179487179487, | |
| "grad_norm": 0.18076284229755402, | |
| "learning_rate": 2.5407725321888416e-05, | |
| "loss": 0.3666, | |
| "num_input_tokens_seen": 6337286, | |
| "step": 1023, | |
| "train_runtime": 4509.9478, | |
| "train_tokens_per_second": 1405.179 | |
| }, | |
| { | |
| "epoch": 1.7504273504273504, | |
| "grad_norm": 0.15938463807106018, | |
| "learning_rate": 2.5236051502145925e-05, | |
| "loss": 0.3929, | |
| "num_input_tokens_seen": 6342718, | |
| "step": 1024, | |
| "train_runtime": 4513.6662, | |
| "train_tokens_per_second": 1405.225 | |
| }, | |
| { | |
| "epoch": 1.7521367521367521, | |
| "grad_norm": 0.14623907208442688, | |
| "learning_rate": 2.5064377682403434e-05, | |
| "loss": 0.2741, | |
| "num_input_tokens_seen": 6347494, | |
| "step": 1025, | |
| "train_runtime": 4516.821, | |
| "train_tokens_per_second": 1405.301 | |
| }, | |
| { | |
| "epoch": 1.7538461538461538, | |
| "grad_norm": 0.13452006876468658, | |
| "learning_rate": 2.4892703862660947e-05, | |
| "loss": 0.3146, | |
| "num_input_tokens_seen": 6353366, | |
| "step": 1026, | |
| "train_runtime": 4520.7165, | |
| "train_tokens_per_second": 1405.389 | |
| }, | |
| { | |
| "epoch": 1.7555555555555555, | |
| "grad_norm": 0.09792611002922058, | |
| "learning_rate": 2.4721030042918456e-05, | |
| "loss": 0.24, | |
| "num_input_tokens_seen": 6368022, | |
| "step": 1027, | |
| "train_runtime": 4529.5761, | |
| "train_tokens_per_second": 1405.876 | |
| }, | |
| { | |
| "epoch": 1.7572649572649572, | |
| "grad_norm": 0.1469515562057495, | |
| "learning_rate": 2.454935622317597e-05, | |
| "loss": 0.2991, | |
| "num_input_tokens_seen": 6373742, | |
| "step": 1028, | |
| "train_runtime": 4533.4245, | |
| "train_tokens_per_second": 1405.944 | |
| }, | |
| { | |
| "epoch": 1.758974358974359, | |
| "grad_norm": 0.14302274584770203, | |
| "learning_rate": 2.4377682403433478e-05, | |
| "loss": 0.4099, | |
| "num_input_tokens_seen": 6380934, | |
| "step": 1029, | |
| "train_runtime": 4538.0583, | |
| "train_tokens_per_second": 1406.093 | |
| }, | |
| { | |
| "epoch": 1.7606837606837606, | |
| "grad_norm": 0.1585194617509842, | |
| "learning_rate": 2.420600858369099e-05, | |
| "loss": 0.3884, | |
| "num_input_tokens_seen": 6384662, | |
| "step": 1030, | |
| "train_runtime": 4540.8411, | |
| "train_tokens_per_second": 1406.053 | |
| }, | |
| { | |
| "epoch": 1.7623931623931623, | |
| "grad_norm": 0.16706667840480804, | |
| "learning_rate": 2.40343347639485e-05, | |
| "loss": 0.3835, | |
| "num_input_tokens_seen": 6389966, | |
| "step": 1031, | |
| "train_runtime": 4544.4381, | |
| "train_tokens_per_second": 1406.107 | |
| }, | |
| { | |
| "epoch": 1.764102564102564, | |
| "grad_norm": 0.15659315884113312, | |
| "learning_rate": 2.386266094420601e-05, | |
| "loss": 0.3452, | |
| "num_input_tokens_seen": 6395846, | |
| "step": 1032, | |
| "train_runtime": 4548.2609, | |
| "train_tokens_per_second": 1406.218 | |
| }, | |
| { | |
| "epoch": 1.7658119658119658, | |
| "grad_norm": 0.15282271802425385, | |
| "learning_rate": 2.369098712446352e-05, | |
| "loss": 0.3265, | |
| "num_input_tokens_seen": 6402358, | |
| "step": 1033, | |
| "train_runtime": 4552.448, | |
| "train_tokens_per_second": 1406.355 | |
| }, | |
| { | |
| "epoch": 1.7675213675213675, | |
| "grad_norm": 0.15687775611877441, | |
| "learning_rate": 2.351931330472103e-05, | |
| "loss": 0.3049, | |
| "num_input_tokens_seen": 6407302, | |
| "step": 1034, | |
| "train_runtime": 4555.7062, | |
| "train_tokens_per_second": 1406.434 | |
| }, | |
| { | |
| "epoch": 1.7692307692307692, | |
| "grad_norm": 0.17506225407123566, | |
| "learning_rate": 2.3347639484978543e-05, | |
| "loss": 0.477, | |
| "num_input_tokens_seen": 6411742, | |
| "step": 1035, | |
| "train_runtime": 4558.7076, | |
| "train_tokens_per_second": 1406.482 | |
| }, | |
| { | |
| "epoch": 1.7709401709401709, | |
| "grad_norm": 0.16328084468841553, | |
| "learning_rate": 2.3175965665236052e-05, | |
| "loss": 0.3114, | |
| "num_input_tokens_seen": 6419462, | |
| "step": 1036, | |
| "train_runtime": 4563.6036, | |
| "train_tokens_per_second": 1406.665 | |
| }, | |
| { | |
| "epoch": 1.7726495726495726, | |
| "grad_norm": 0.20261751115322113, | |
| "learning_rate": 2.3004291845493564e-05, | |
| "loss": 0.2963, | |
| "num_input_tokens_seen": 6426198, | |
| "step": 1037, | |
| "train_runtime": 4567.8768, | |
| "train_tokens_per_second": 1406.824 | |
| }, | |
| { | |
| "epoch": 1.7743589743589743, | |
| "grad_norm": 0.15363574028015137, | |
| "learning_rate": 2.2832618025751074e-05, | |
| "loss": 0.3716, | |
| "num_input_tokens_seen": 6432110, | |
| "step": 1038, | |
| "train_runtime": 4571.7893, | |
| "train_tokens_per_second": 1406.913 | |
| }, | |
| { | |
| "epoch": 1.776068376068376, | |
| "grad_norm": 0.16166916489601135, | |
| "learning_rate": 2.2660944206008586e-05, | |
| "loss": 0.3069, | |
| "num_input_tokens_seen": 6436894, | |
| "step": 1039, | |
| "train_runtime": 4575.0332, | |
| "train_tokens_per_second": 1406.961 | |
| }, | |
| { | |
| "epoch": 1.7777777777777777, | |
| "grad_norm": 0.13780422508716583, | |
| "learning_rate": 2.2489270386266095e-05, | |
| "loss": 0.32, | |
| "num_input_tokens_seen": 6442478, | |
| "step": 1040, | |
| "train_runtime": 4578.7364, | |
| "train_tokens_per_second": 1407.043 | |
| }, | |
| { | |
| "epoch": 1.7794871794871794, | |
| "grad_norm": 0.13809658586978912, | |
| "learning_rate": 2.2317596566523608e-05, | |
| "loss": 0.3943, | |
| "num_input_tokens_seen": 6452022, | |
| "step": 1041, | |
| "train_runtime": 4584.5201, | |
| "train_tokens_per_second": 1407.349 | |
| }, | |
| { | |
| "epoch": 1.781196581196581, | |
| "grad_norm": 0.1384420543909073, | |
| "learning_rate": 2.2145922746781117e-05, | |
| "loss": 0.3566, | |
| "num_input_tokens_seen": 6457366, | |
| "step": 1042, | |
| "train_runtime": 4588.1267, | |
| "train_tokens_per_second": 1407.408 | |
| }, | |
| { | |
| "epoch": 1.7829059829059828, | |
| "grad_norm": 0.14281603693962097, | |
| "learning_rate": 2.1974248927038626e-05, | |
| "loss": 0.29, | |
| "num_input_tokens_seen": 6463758, | |
| "step": 1043, | |
| "train_runtime": 4592.2407, | |
| "train_tokens_per_second": 1407.539 | |
| }, | |
| { | |
| "epoch": 1.7846153846153845, | |
| "grad_norm": 0.1341668963432312, | |
| "learning_rate": 2.180257510729614e-05, | |
| "loss": 0.3113, | |
| "num_input_tokens_seen": 6470814, | |
| "step": 1044, | |
| "train_runtime": 4596.7241, | |
| "train_tokens_per_second": 1407.701 | |
| }, | |
| { | |
| "epoch": 1.7863247863247862, | |
| "grad_norm": 0.12165071070194244, | |
| "learning_rate": 2.1630901287553648e-05, | |
| "loss": 0.2428, | |
| "num_input_tokens_seen": 6478470, | |
| "step": 1045, | |
| "train_runtime": 4601.6129, | |
| "train_tokens_per_second": 1407.869 | |
| }, | |
| { | |
| "epoch": 1.788034188034188, | |
| "grad_norm": 0.12957434356212616, | |
| "learning_rate": 2.145922746781116e-05, | |
| "loss": 0.3294, | |
| "num_input_tokens_seen": 6485742, | |
| "step": 1046, | |
| "train_runtime": 4606.2305, | |
| "train_tokens_per_second": 1408.037 | |
| }, | |
| { | |
| "epoch": 1.7897435897435896, | |
| "grad_norm": 0.15326030552387238, | |
| "learning_rate": 2.128755364806867e-05, | |
| "loss": 0.2989, | |
| "num_input_tokens_seen": 6490534, | |
| "step": 1047, | |
| "train_runtime": 4609.394, | |
| "train_tokens_per_second": 1408.11 | |
| }, | |
| { | |
| "epoch": 1.7914529914529913, | |
| "grad_norm": 0.1443042904138565, | |
| "learning_rate": 2.1115879828326182e-05, | |
| "loss": 0.321, | |
| "num_input_tokens_seen": 6496446, | |
| "step": 1048, | |
| "train_runtime": 4613.259, | |
| "train_tokens_per_second": 1408.212 | |
| }, | |
| { | |
| "epoch": 1.793162393162393, | |
| "grad_norm": 0.14335471391677856, | |
| "learning_rate": 2.094420600858369e-05, | |
| "loss": 0.3075, | |
| "num_input_tokens_seen": 6500918, | |
| "step": 1049, | |
| "train_runtime": 4616.2414, | |
| "train_tokens_per_second": 1408.271 | |
| }, | |
| { | |
| "epoch": 1.7948717948717947, | |
| "grad_norm": 0.14600598812103271, | |
| "learning_rate": 2.0772532188841204e-05, | |
| "loss": 0.2909, | |
| "num_input_tokens_seen": 6507990, | |
| "step": 1050, | |
| "train_runtime": 4620.7168, | |
| "train_tokens_per_second": 1408.437 | |
| }, | |
| { | |
| "epoch": 1.7965811965811964, | |
| "grad_norm": 0.18093526363372803, | |
| "learning_rate": 2.0600858369098713e-05, | |
| "loss": 0.3847, | |
| "num_input_tokens_seen": 6512422, | |
| "step": 1051, | |
| "train_runtime": 4625.7264, | |
| "train_tokens_per_second": 1407.87 | |
| }, | |
| { | |
| "epoch": 1.7982905982905983, | |
| "grad_norm": 0.16364380717277527, | |
| "learning_rate": 2.0429184549356222e-05, | |
| "loss": 0.4275, | |
| "num_input_tokens_seen": 6518614, | |
| "step": 1052, | |
| "train_runtime": 4629.7613, | |
| "train_tokens_per_second": 1407.981 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 0.1316070705652237, | |
| "learning_rate": 2.0257510729613735e-05, | |
| "loss": 0.3271, | |
| "num_input_tokens_seen": 6526590, | |
| "step": 1053, | |
| "train_runtime": 4634.7196, | |
| "train_tokens_per_second": 1408.195 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "eval_loss": 0.404507040977478, | |
| "eval_runtime": 40.0997, | |
| "eval_samples_per_second": 24.888, | |
| "eval_steps_per_second": 3.117, | |
| "num_input_tokens_seen": 6526590, | |
| "step": 1053 | |
| }, | |
| { | |
| "epoch": 1.8017094017094017, | |
| "grad_norm": 0.15155088901519775, | |
| "learning_rate": 2.0085836909871244e-05, | |
| "loss": 0.332, | |
| "num_input_tokens_seen": 6531142, | |
| "step": 1054, | |
| "train_runtime": 4677.9352, | |
| "train_tokens_per_second": 1396.159 | |
| }, | |
| { | |
| "epoch": 1.8034188034188035, | |
| "grad_norm": 0.16894248127937317, | |
| "learning_rate": 1.9914163090128756e-05, | |
| "loss": 0.3468, | |
| "num_input_tokens_seen": 6535878, | |
| "step": 1055, | |
| "train_runtime": 4681.1277, | |
| "train_tokens_per_second": 1396.219 | |
| }, | |
| { | |
| "epoch": 1.8051282051282052, | |
| "grad_norm": 0.16134795546531677, | |
| "learning_rate": 1.9742489270386265e-05, | |
| "loss": 0.4106, | |
| "num_input_tokens_seen": 6540734, | |
| "step": 1056, | |
| "train_runtime": 4684.3719, | |
| "train_tokens_per_second": 1396.288 | |
| }, | |
| { | |
| "epoch": 1.8068376068376069, | |
| "grad_norm": 0.15336063504219055, | |
| "learning_rate": 1.9570815450643778e-05, | |
| "loss": 0.3094, | |
| "num_input_tokens_seen": 6546686, | |
| "step": 1057, | |
| "train_runtime": 4688.2462, | |
| "train_tokens_per_second": 1396.404 | |
| }, | |
| { | |
| "epoch": 1.8085470085470086, | |
| "grad_norm": 0.14268825948238373, | |
| "learning_rate": 1.9399141630901287e-05, | |
| "loss": 0.273, | |
| "num_input_tokens_seen": 6551342, | |
| "step": 1058, | |
| "train_runtime": 4691.4225, | |
| "train_tokens_per_second": 1396.451 | |
| }, | |
| { | |
| "epoch": 1.8102564102564103, | |
| "grad_norm": 0.14494940638542175, | |
| "learning_rate": 1.92274678111588e-05, | |
| "loss": 0.3132, | |
| "num_input_tokens_seen": 6557974, | |
| "step": 1059, | |
| "train_runtime": 4695.6758, | |
| "train_tokens_per_second": 1396.599 | |
| }, | |
| { | |
| "epoch": 1.811965811965812, | |
| "grad_norm": 0.18244661390781403, | |
| "learning_rate": 1.905579399141631e-05, | |
| "loss": 0.5737, | |
| "num_input_tokens_seen": 6562998, | |
| "step": 1060, | |
| "train_runtime": 4698.9602, | |
| "train_tokens_per_second": 1396.692 | |
| }, | |
| { | |
| "epoch": 1.8136752136752137, | |
| "grad_norm": 0.1533288210630417, | |
| "learning_rate": 1.888412017167382e-05, | |
| "loss": 0.441, | |
| "num_input_tokens_seen": 6569270, | |
| "step": 1061, | |
| "train_runtime": 4702.9527, | |
| "train_tokens_per_second": 1396.839 | |
| }, | |
| { | |
| "epoch": 1.8153846153846154, | |
| "grad_norm": 0.17031623423099518, | |
| "learning_rate": 1.871244635193133e-05, | |
| "loss": 0.3263, | |
| "num_input_tokens_seen": 6576398, | |
| "step": 1062, | |
| "train_runtime": 4707.3688, | |
| "train_tokens_per_second": 1397.043 | |
| }, | |
| { | |
| "epoch": 1.817094017094017, | |
| "grad_norm": 0.15098752081394196, | |
| "learning_rate": 1.854077253218884e-05, | |
| "loss": 0.3944, | |
| "num_input_tokens_seen": 6583126, | |
| "step": 1063, | |
| "train_runtime": 4711.6687, | |
| "train_tokens_per_second": 1397.196 | |
| }, | |
| { | |
| "epoch": 1.8188034188034188, | |
| "grad_norm": 0.14613556861877441, | |
| "learning_rate": 1.8369098712446352e-05, | |
| "loss": 0.3597, | |
| "num_input_tokens_seen": 6588926, | |
| "step": 1064, | |
| "train_runtime": 4715.3802, | |
| "train_tokens_per_second": 1397.327 | |
| }, | |
| { | |
| "epoch": 1.8205128205128205, | |
| "grad_norm": 0.14206819236278534, | |
| "learning_rate": 1.819742489270386e-05, | |
| "loss": 0.4242, | |
| "num_input_tokens_seen": 6596990, | |
| "step": 1065, | |
| "train_runtime": 4720.4135, | |
| "train_tokens_per_second": 1397.545 | |
| }, | |
| { | |
| "epoch": 1.8222222222222222, | |
| "grad_norm": 0.140799418091774, | |
| "learning_rate": 1.8025751072961374e-05, | |
| "loss": 0.3399, | |
| "num_input_tokens_seen": 6602190, | |
| "step": 1066, | |
| "train_runtime": 4723.9657, | |
| "train_tokens_per_second": 1397.595 | |
| }, | |
| { | |
| "epoch": 1.823931623931624, | |
| "grad_norm": 0.19462433457374573, | |
| "learning_rate": 1.7854077253218883e-05, | |
| "loss": 0.3512, | |
| "num_input_tokens_seen": 6607014, | |
| "step": 1067, | |
| "train_runtime": 4727.1472, | |
| "train_tokens_per_second": 1397.675 | |
| }, | |
| { | |
| "epoch": 1.8256410256410256, | |
| "grad_norm": 0.13291078805923462, | |
| "learning_rate": 1.7682403433476395e-05, | |
| "loss": 0.3843, | |
| "num_input_tokens_seen": 6613678, | |
| "step": 1068, | |
| "train_runtime": 4731.4386, | |
| "train_tokens_per_second": 1397.815 | |
| }, | |
| { | |
| "epoch": 1.8273504273504273, | |
| "grad_norm": 0.15383653342723846, | |
| "learning_rate": 1.7510729613733905e-05, | |
| "loss": 0.3471, | |
| "num_input_tokens_seen": 6618774, | |
| "step": 1069, | |
| "train_runtime": 4734.8385, | |
| "train_tokens_per_second": 1397.888 | |
| }, | |
| { | |
| "epoch": 1.8290598290598292, | |
| "grad_norm": 0.1934920996427536, | |
| "learning_rate": 1.7339055793991417e-05, | |
| "loss": 0.4046, | |
| "num_input_tokens_seen": 6623158, | |
| "step": 1070, | |
| "train_runtime": 4737.8828, | |
| "train_tokens_per_second": 1397.915 | |
| }, | |
| { | |
| "epoch": 1.830769230769231, | |
| "grad_norm": 0.14363759756088257, | |
| "learning_rate": 1.7167381974248926e-05, | |
| "loss": 0.3881, | |
| "num_input_tokens_seen": 6629886, | |
| "step": 1071, | |
| "train_runtime": 4742.2138, | |
| "train_tokens_per_second": 1398.057 | |
| }, | |
| { | |
| "epoch": 1.8324786324786326, | |
| "grad_norm": 0.16139546036720276, | |
| "learning_rate": 1.699570815450644e-05, | |
| "loss": 0.4487, | |
| "num_input_tokens_seen": 6636854, | |
| "step": 1072, | |
| "train_runtime": 4746.7336, | |
| "train_tokens_per_second": 1398.194 | |
| }, | |
| { | |
| "epoch": 1.8341880341880343, | |
| "grad_norm": 0.1400468498468399, | |
| "learning_rate": 1.6824034334763948e-05, | |
| "loss": 0.3305, | |
| "num_input_tokens_seen": 6642486, | |
| "step": 1073, | |
| "train_runtime": 4750.5141, | |
| "train_tokens_per_second": 1398.267 | |
| }, | |
| { | |
| "epoch": 1.835897435897436, | |
| "grad_norm": 0.13978594541549683, | |
| "learning_rate": 1.665236051502146e-05, | |
| "loss": 0.6809, | |
| "num_input_tokens_seen": 6649566, | |
| "step": 1074, | |
| "train_runtime": 4755.0422, | |
| "train_tokens_per_second": 1398.424 | |
| }, | |
| { | |
| "epoch": 1.8376068376068377, | |
| "grad_norm": 0.1702847182750702, | |
| "learning_rate": 1.648068669527897e-05, | |
| "loss": 0.4449, | |
| "num_input_tokens_seen": 6655126, | |
| "step": 1075, | |
| "train_runtime": 4758.7098, | |
| "train_tokens_per_second": 1398.515 | |
| }, | |
| { | |
| "epoch": 1.8393162393162394, | |
| "grad_norm": 0.17050866782665253, | |
| "learning_rate": 1.6309012875536482e-05, | |
| "loss": 0.3379, | |
| "num_input_tokens_seen": 6659030, | |
| "step": 1076, | |
| "train_runtime": 4761.477, | |
| "train_tokens_per_second": 1398.522 | |
| }, | |
| { | |
| "epoch": 1.8410256410256411, | |
| "grad_norm": 0.13685175776481628, | |
| "learning_rate": 1.613733905579399e-05, | |
| "loss": 0.278, | |
| "num_input_tokens_seen": 6665878, | |
| "step": 1077, | |
| "train_runtime": 4765.8908, | |
| "train_tokens_per_second": 1398.664 | |
| }, | |
| { | |
| "epoch": 1.8427350427350428, | |
| "grad_norm": 0.15728789567947388, | |
| "learning_rate": 1.5965665236051504e-05, | |
| "loss": 0.4222, | |
| "num_input_tokens_seen": 6673366, | |
| "step": 1078, | |
| "train_runtime": 4770.5968, | |
| "train_tokens_per_second": 1398.853 | |
| }, | |
| { | |
| "epoch": 1.8444444444444446, | |
| "grad_norm": 0.1324002593755722, | |
| "learning_rate": 1.5793991416309016e-05, | |
| "loss": 0.2461, | |
| "num_input_tokens_seen": 6683390, | |
| "step": 1079, | |
| "train_runtime": 4776.8061, | |
| "train_tokens_per_second": 1399.134 | |
| }, | |
| { | |
| "epoch": 1.8461538461538463, | |
| "grad_norm": 0.16516079008579254, | |
| "learning_rate": 1.5622317596566525e-05, | |
| "loss": 0.4134, | |
| "num_input_tokens_seen": 6688182, | |
| "step": 1080, | |
| "train_runtime": 4780.0471, | |
| "train_tokens_per_second": 1399.187 | |
| }, | |
| { | |
| "epoch": 1.847863247863248, | |
| "grad_norm": 0.15185537934303284, | |
| "learning_rate": 1.5450643776824038e-05, | |
| "loss": 0.4063, | |
| "num_input_tokens_seen": 6693006, | |
| "step": 1081, | |
| "train_runtime": 4785.5138, | |
| "train_tokens_per_second": 1398.597 | |
| }, | |
| { | |
| "epoch": 1.8495726495726497, | |
| "grad_norm": 0.15653982758522034, | |
| "learning_rate": 1.5278969957081547e-05, | |
| "loss": 0.3766, | |
| "num_input_tokens_seen": 6698870, | |
| "step": 1082, | |
| "train_runtime": 4789.2559, | |
| "train_tokens_per_second": 1398.729 | |
| }, | |
| { | |
| "epoch": 1.8512820512820514, | |
| "grad_norm": 0.1651298999786377, | |
| "learning_rate": 1.5107296137339055e-05, | |
| "loss": 0.3813, | |
| "num_input_tokens_seen": 6704446, | |
| "step": 1083, | |
| "train_runtime": 4792.9155, | |
| "train_tokens_per_second": 1398.824 | |
| }, | |
| { | |
| "epoch": 1.852991452991453, | |
| "grad_norm": 0.13992318511009216, | |
| "learning_rate": 1.4935622317596567e-05, | |
| "loss": 0.3536, | |
| "num_input_tokens_seen": 6712214, | |
| "step": 1084, | |
| "train_runtime": 4797.8044, | |
| "train_tokens_per_second": 1399.018 | |
| }, | |
| { | |
| "epoch": 1.8547008547008548, | |
| "grad_norm": 0.18008194863796234, | |
| "learning_rate": 1.4763948497854076e-05, | |
| "loss": 0.4277, | |
| "num_input_tokens_seen": 6718494, | |
| "step": 1085, | |
| "train_runtime": 4801.9402, | |
| "train_tokens_per_second": 1399.121 | |
| }, | |
| { | |
| "epoch": 1.8564102564102565, | |
| "grad_norm": 0.14547497034072876, | |
| "learning_rate": 1.4592274678111589e-05, | |
| "loss": 0.3601, | |
| "num_input_tokens_seen": 6725166, | |
| "step": 1086, | |
| "train_runtime": 4806.2732, | |
| "train_tokens_per_second": 1399.248 | |
| }, | |
| { | |
| "epoch": 1.8581196581196582, | |
| "grad_norm": 0.16261422634124756, | |
| "learning_rate": 1.4420600858369098e-05, | |
| "loss": 0.2693, | |
| "num_input_tokens_seen": 6730998, | |
| "step": 1087, | |
| "train_runtime": 4810.0482, | |
| "train_tokens_per_second": 1399.362 | |
| }, | |
| { | |
| "epoch": 1.8598290598290599, | |
| "grad_norm": 0.18159757554531097, | |
| "learning_rate": 1.424892703862661e-05, | |
| "loss": 0.3637, | |
| "num_input_tokens_seen": 6736422, | |
| "step": 1088, | |
| "train_runtime": 4813.51, | |
| "train_tokens_per_second": 1399.482 | |
| }, | |
| { | |
| "epoch": 1.8615384615384616, | |
| "grad_norm": 0.17222821712493896, | |
| "learning_rate": 1.4077253218884121e-05, | |
| "loss": 0.3602, | |
| "num_input_tokens_seen": 6740854, | |
| "step": 1089, | |
| "train_runtime": 4816.5377, | |
| "train_tokens_per_second": 1399.523 | |
| }, | |
| { | |
| "epoch": 1.8632478632478633, | |
| "grad_norm": 0.2024536430835724, | |
| "learning_rate": 1.3905579399141632e-05, | |
| "loss": 0.4612, | |
| "num_input_tokens_seen": 6746086, | |
| "step": 1090, | |
| "train_runtime": 4820.0103, | |
| "train_tokens_per_second": 1399.6 | |
| }, | |
| { | |
| "epoch": 1.864957264957265, | |
| "grad_norm": 0.17339684069156647, | |
| "learning_rate": 1.3733905579399143e-05, | |
| "loss": 0.3912, | |
| "num_input_tokens_seen": 6751998, | |
| "step": 1091, | |
| "train_runtime": 4823.8611, | |
| "train_tokens_per_second": 1399.708 | |
| }, | |
| { | |
| "epoch": 1.8666666666666667, | |
| "grad_norm": 0.15908282995224, | |
| "learning_rate": 1.3562231759656652e-05, | |
| "loss": 0.4084, | |
| "num_input_tokens_seen": 6757014, | |
| "step": 1092, | |
| "train_runtime": 4827.2695, | |
| "train_tokens_per_second": 1399.759 | |
| }, | |
| { | |
| "epoch": 1.8683760683760684, | |
| "grad_norm": 0.15388384461402893, | |
| "learning_rate": 1.3390557939914165e-05, | |
| "loss": 0.3886, | |
| "num_input_tokens_seen": 6763046, | |
| "step": 1093, | |
| "train_runtime": 4831.1646, | |
| "train_tokens_per_second": 1399.879 | |
| }, | |
| { | |
| "epoch": 1.87008547008547, | |
| "grad_norm": 0.159906804561615, | |
| "learning_rate": 1.3218884120171674e-05, | |
| "loss": 0.3046, | |
| "num_input_tokens_seen": 6767926, | |
| "step": 1094, | |
| "train_runtime": 4834.4979, | |
| "train_tokens_per_second": 1399.923 | |
| }, | |
| { | |
| "epoch": 1.8717948717948718, | |
| "grad_norm": 0.14533422887325287, | |
| "learning_rate": 1.3047210300429186e-05, | |
| "loss": 0.3364, | |
| "num_input_tokens_seen": 6773470, | |
| "step": 1095, | |
| "train_runtime": 4838.153, | |
| "train_tokens_per_second": 1400.012 | |
| }, | |
| { | |
| "epoch": 1.8735042735042735, | |
| "grad_norm": 0.1425410658121109, | |
| "learning_rate": 1.2875536480686696e-05, | |
| "loss": 0.34, | |
| "num_input_tokens_seen": 6780046, | |
| "step": 1096, | |
| "train_runtime": 4842.3489, | |
| "train_tokens_per_second": 1400.156 | |
| }, | |
| { | |
| "epoch": 1.8752136752136752, | |
| "grad_norm": 0.17550382018089294, | |
| "learning_rate": 1.2703862660944208e-05, | |
| "loss": 0.3715, | |
| "num_input_tokens_seen": 6784934, | |
| "step": 1097, | |
| "train_runtime": 4845.5655, | |
| "train_tokens_per_second": 1400.236 | |
| }, | |
| { | |
| "epoch": 1.876923076923077, | |
| "grad_norm": 0.14778852462768555, | |
| "learning_rate": 1.2532188841201717e-05, | |
| "loss": 0.3221, | |
| "num_input_tokens_seen": 6792326, | |
| "step": 1098, | |
| "train_runtime": 4850.2742, | |
| "train_tokens_per_second": 1400.4 | |
| }, | |
| { | |
| "epoch": 1.8786324786324786, | |
| "grad_norm": 0.16497938334941864, | |
| "learning_rate": 1.2360515021459228e-05, | |
| "loss": 0.4165, | |
| "num_input_tokens_seen": 6798566, | |
| "step": 1099, | |
| "train_runtime": 4854.305, | |
| "train_tokens_per_second": 1400.523 | |
| }, | |
| { | |
| "epoch": 1.8803418803418803, | |
| "grad_norm": 0.197905495762825, | |
| "learning_rate": 1.2188841201716739e-05, | |
| "loss": 0.3145, | |
| "num_input_tokens_seen": 6802638, | |
| "step": 1100, | |
| "train_runtime": 4857.1375, | |
| "train_tokens_per_second": 1400.545 | |
| }, | |
| { | |
| "epoch": 1.882051282051282, | |
| "grad_norm": 0.17154602706432343, | |
| "learning_rate": 1.201716738197425e-05, | |
| "loss": 0.3308, | |
| "num_input_tokens_seen": 6807246, | |
| "step": 1101, | |
| "train_runtime": 4860.2531, | |
| "train_tokens_per_second": 1400.595 | |
| }, | |
| { | |
| "epoch": 1.8837606837606837, | |
| "grad_norm": 0.16185066103935242, | |
| "learning_rate": 1.184549356223176e-05, | |
| "loss": 0.4201, | |
| "num_input_tokens_seen": 6813470, | |
| "step": 1102, | |
| "train_runtime": 4864.2681, | |
| "train_tokens_per_second": 1400.718 | |
| }, | |
| { | |
| "epoch": 1.8854700854700854, | |
| "grad_norm": 0.14669010043144226, | |
| "learning_rate": 1.1673819742489271e-05, | |
| "loss": 0.277, | |
| "num_input_tokens_seen": 6819462, | |
| "step": 1103, | |
| "train_runtime": 4868.1501, | |
| "train_tokens_per_second": 1400.832 | |
| }, | |
| { | |
| "epoch": 1.8871794871794871, | |
| "grad_norm": 0.14133639633655548, | |
| "learning_rate": 1.1502145922746782e-05, | |
| "loss": 0.2909, | |
| "num_input_tokens_seen": 6825846, | |
| "step": 1104, | |
| "train_runtime": 4872.1267, | |
| "train_tokens_per_second": 1400.999 | |
| }, | |
| { | |
| "epoch": 1.8888888888888888, | |
| "grad_norm": 0.15974490344524384, | |
| "learning_rate": 1.1330472103004293e-05, | |
| "loss": 0.409, | |
| "num_input_tokens_seen": 6830438, | |
| "step": 1105, | |
| "train_runtime": 4875.179, | |
| "train_tokens_per_second": 1401.064 | |
| }, | |
| { | |
| "epoch": 1.8905982905982905, | |
| "grad_norm": 0.14427092671394348, | |
| "learning_rate": 1.1158798283261804e-05, | |
| "loss": 0.3139, | |
| "num_input_tokens_seen": 6837246, | |
| "step": 1106, | |
| "train_runtime": 4879.5448, | |
| "train_tokens_per_second": 1401.206 | |
| }, | |
| { | |
| "epoch": 1.8923076923076922, | |
| "grad_norm": 0.1914999932050705, | |
| "learning_rate": 1.0987124463519313e-05, | |
| "loss": 0.5047, | |
| "num_input_tokens_seen": 6842374, | |
| "step": 1107, | |
| "train_runtime": 4882.9114, | |
| "train_tokens_per_second": 1401.29 | |
| }, | |
| { | |
| "epoch": 1.894017094017094, | |
| "grad_norm": 0.1484641432762146, | |
| "learning_rate": 1.0815450643776824e-05, | |
| "loss": 0.3216, | |
| "num_input_tokens_seen": 6850582, | |
| "step": 1108, | |
| "train_runtime": 4888.0245, | |
| "train_tokens_per_second": 1401.503 | |
| }, | |
| { | |
| "epoch": 1.8957264957264957, | |
| "grad_norm": 0.14059650897979736, | |
| "learning_rate": 1.0643776824034335e-05, | |
| "loss": 0.2703, | |
| "num_input_tokens_seen": 6856102, | |
| "step": 1109, | |
| "train_runtime": 4891.5942, | |
| "train_tokens_per_second": 1401.609 | |
| }, | |
| { | |
| "epoch": 1.8974358974358974, | |
| "grad_norm": 0.20912344753742218, | |
| "learning_rate": 1.0472103004291846e-05, | |
| "loss": 0.3141, | |
| "num_input_tokens_seen": 6862710, | |
| "step": 1110, | |
| "train_runtime": 4895.7904, | |
| "train_tokens_per_second": 1401.757 | |
| }, | |
| { | |
| "epoch": 1.899145299145299, | |
| "grad_norm": 0.1622704267501831, | |
| "learning_rate": 1.0300429184549356e-05, | |
| "loss": 0.3853, | |
| "num_input_tokens_seen": 6869022, | |
| "step": 1111, | |
| "train_runtime": 4901.9521, | |
| "train_tokens_per_second": 1401.283 | |
| }, | |
| { | |
| "epoch": 1.9008547008547008, | |
| "grad_norm": 0.1645922064781189, | |
| "learning_rate": 1.0128755364806867e-05, | |
| "loss": 0.3398, | |
| "num_input_tokens_seen": 6874726, | |
| "step": 1112, | |
| "train_runtime": 4905.6953, | |
| "train_tokens_per_second": 1401.376 | |
| }, | |
| { | |
| "epoch": 1.9025641025641025, | |
| "grad_norm": 0.1458289623260498, | |
| "learning_rate": 9.957081545064378e-06, | |
| "loss": 0.317, | |
| "num_input_tokens_seen": 6881630, | |
| "step": 1113, | |
| "train_runtime": 4910.1371, | |
| "train_tokens_per_second": 1401.515 | |
| }, | |
| { | |
| "epoch": 1.9042735042735042, | |
| "grad_norm": 0.12950517237186432, | |
| "learning_rate": 9.785407725321889e-06, | |
| "loss": 0.3292, | |
| "num_input_tokens_seen": 6889566, | |
| "step": 1114, | |
| "train_runtime": 4915.0767, | |
| "train_tokens_per_second": 1401.721 | |
| }, | |
| { | |
| "epoch": 1.9059829059829059, | |
| "grad_norm": 0.17092257738113403, | |
| "learning_rate": 9.6137339055794e-06, | |
| "loss": 0.3772, | |
| "num_input_tokens_seen": 6897254, | |
| "step": 1115, | |
| "train_runtime": 4919.8978, | |
| "train_tokens_per_second": 1401.91 | |
| }, | |
| { | |
| "epoch": 1.9076923076923076, | |
| "grad_norm": 0.15210705995559692, | |
| "learning_rate": 9.44206008583691e-06, | |
| "loss": 0.2851, | |
| "num_input_tokens_seen": 6903030, | |
| "step": 1116, | |
| "train_runtime": 4923.6154, | |
| "train_tokens_per_second": 1402.025 | |
| }, | |
| { | |
| "epoch": 1.9094017094017093, | |
| "grad_norm": 0.17195074260234833, | |
| "learning_rate": 9.27038626609442e-06, | |
| "loss": 0.3031, | |
| "num_input_tokens_seen": 6908182, | |
| "step": 1117, | |
| "train_runtime": 4926.9947, | |
| "train_tokens_per_second": 1402.109 | |
| }, | |
| { | |
| "epoch": 1.911111111111111, | |
| "grad_norm": 0.1584848016500473, | |
| "learning_rate": 9.09871244635193e-06, | |
| "loss": 0.3616, | |
| "num_input_tokens_seen": 6913494, | |
| "step": 1118, | |
| "train_runtime": 4930.5631, | |
| "train_tokens_per_second": 1402.171 | |
| }, | |
| { | |
| "epoch": 1.9128205128205127, | |
| "grad_norm": 0.1975264549255371, | |
| "learning_rate": 8.927038626609441e-06, | |
| "loss": 0.4163, | |
| "num_input_tokens_seen": 6918062, | |
| "step": 1119, | |
| "train_runtime": 4933.5796, | |
| "train_tokens_per_second": 1402.24 | |
| }, | |
| { | |
| "epoch": 1.9145299145299144, | |
| "grad_norm": 0.16457124054431915, | |
| "learning_rate": 8.755364806866952e-06, | |
| "loss": 0.3484, | |
| "num_input_tokens_seen": 6924510, | |
| "step": 1120, | |
| "train_runtime": 4937.7657, | |
| "train_tokens_per_second": 1402.357 | |
| }, | |
| { | |
| "epoch": 1.916239316239316, | |
| "grad_norm": 0.17964407801628113, | |
| "learning_rate": 8.583690987124463e-06, | |
| "loss": 0.3722, | |
| "num_input_tokens_seen": 6929198, | |
| "step": 1121, | |
| "train_runtime": 4940.9815, | |
| "train_tokens_per_second": 1402.393 | |
| }, | |
| { | |
| "epoch": 1.9179487179487178, | |
| "grad_norm": 0.1665036529302597, | |
| "learning_rate": 8.412017167381974e-06, | |
| "loss": 0.3422, | |
| "num_input_tokens_seen": 6934638, | |
| "step": 1122, | |
| "train_runtime": 4944.5768, | |
| "train_tokens_per_second": 1402.474 | |
| }, | |
| { | |
| "epoch": 1.9196581196581195, | |
| "grad_norm": 0.15092073380947113, | |
| "learning_rate": 8.240343347639485e-06, | |
| "loss": 0.3241, | |
| "num_input_tokens_seen": 6939854, | |
| "step": 1123, | |
| "train_runtime": 4948.0723, | |
| "train_tokens_per_second": 1402.537 | |
| }, | |
| { | |
| "epoch": 1.9213675213675212, | |
| "grad_norm": 0.14096640050411224, | |
| "learning_rate": 8.068669527896996e-06, | |
| "loss": 0.3273, | |
| "num_input_tokens_seen": 6946214, | |
| "step": 1124, | |
| "train_runtime": 4952.1614, | |
| "train_tokens_per_second": 1402.663 | |
| }, | |
| { | |
| "epoch": 1.9230769230769231, | |
| "grad_norm": 0.1625843495130539, | |
| "learning_rate": 7.896995708154508e-06, | |
| "loss": 0.3869, | |
| "num_input_tokens_seen": 6951950, | |
| "step": 1125, | |
| "train_runtime": 4955.9684, | |
| "train_tokens_per_second": 1402.743 | |
| }, | |
| { | |
| "epoch": 1.9247863247863248, | |
| "grad_norm": 0.17909951508045197, | |
| "learning_rate": 7.725321888412019e-06, | |
| "loss": 0.3497, | |
| "num_input_tokens_seen": 6957638, | |
| "step": 1126, | |
| "train_runtime": 4959.737, | |
| "train_tokens_per_second": 1402.824 | |
| }, | |
| { | |
| "epoch": 1.9264957264957265, | |
| "grad_norm": 0.17353759706020355, | |
| "learning_rate": 7.553648068669527e-06, | |
| "loss": 0.3897, | |
| "num_input_tokens_seen": 6962374, | |
| "step": 1127, | |
| "train_runtime": 4962.8962, | |
| "train_tokens_per_second": 1402.885 | |
| }, | |
| { | |
| "epoch": 1.9282051282051282, | |
| "grad_norm": 0.15928848087787628, | |
| "learning_rate": 7.381974248927038e-06, | |
| "loss": 0.3673, | |
| "num_input_tokens_seen": 6969438, | |
| "step": 1128, | |
| "train_runtime": 4967.3831, | |
| "train_tokens_per_second": 1403.04 | |
| }, | |
| { | |
| "epoch": 1.92991452991453, | |
| "grad_norm": 0.1764049082994461, | |
| "learning_rate": 7.210300429184549e-06, | |
| "loss": 0.4195, | |
| "num_input_tokens_seen": 6974686, | |
| "step": 1129, | |
| "train_runtime": 4970.8962, | |
| "train_tokens_per_second": 1403.104 | |
| }, | |
| { | |
| "epoch": 1.9316239316239316, | |
| "grad_norm": 0.16329072415828705, | |
| "learning_rate": 7.038626609442061e-06, | |
| "loss": 0.4364, | |
| "num_input_tokens_seen": 6978790, | |
| "step": 1130, | |
| "train_runtime": 4973.7668, | |
| "train_tokens_per_second": 1403.12 | |
| }, | |
| { | |
| "epoch": 1.9333333333333333, | |
| "grad_norm": 0.1772487908601761, | |
| "learning_rate": 6.8669527896995715e-06, | |
| "loss": 0.2383, | |
| "num_input_tokens_seen": 6983270, | |
| "step": 1131, | |
| "train_runtime": 4976.8686, | |
| "train_tokens_per_second": 1403.145 | |
| }, | |
| { | |
| "epoch": 1.935042735042735, | |
| "grad_norm": 0.14440268278121948, | |
| "learning_rate": 6.695278969957082e-06, | |
| "loss": 0.3158, | |
| "num_input_tokens_seen": 6990422, | |
| "step": 1132, | |
| "train_runtime": 4981.4235, | |
| "train_tokens_per_second": 1403.298 | |
| }, | |
| { | |
| "epoch": 1.9367521367521368, | |
| "grad_norm": 0.12382279336452484, | |
| "learning_rate": 6.523605150214593e-06, | |
| "loss": 0.2929, | |
| "num_input_tokens_seen": 6996510, | |
| "step": 1133, | |
| "train_runtime": 4985.3586, | |
| "train_tokens_per_second": 1403.412 | |
| }, | |
| { | |
| "epoch": 1.9384615384615385, | |
| "grad_norm": 0.1855405867099762, | |
| "learning_rate": 6.351931330472104e-06, | |
| "loss": 0.3417, | |
| "num_input_tokens_seen": 7001694, | |
| "step": 1134, | |
| "train_runtime": 4988.8358, | |
| "train_tokens_per_second": 1403.473 | |
| }, | |
| { | |
| "epoch": 1.9401709401709402, | |
| "grad_norm": 0.17923769354820251, | |
| "learning_rate": 6.180257510729614e-06, | |
| "loss": 0.4127, | |
| "num_input_tokens_seen": 7006406, | |
| "step": 1135, | |
| "train_runtime": 4992.0156, | |
| "train_tokens_per_second": 1403.522 | |
| }, | |
| { | |
| "epoch": 1.9418803418803419, | |
| "grad_norm": 0.16682113707065582, | |
| "learning_rate": 6.008583690987125e-06, | |
| "loss": 0.3125, | |
| "num_input_tokens_seen": 7011622, | |
| "step": 1136, | |
| "train_runtime": 4995.5472, | |
| "train_tokens_per_second": 1403.574 | |
| }, | |
| { | |
| "epoch": 1.9435897435897436, | |
| "grad_norm": 0.15530408918857574, | |
| "learning_rate": 5.836909871244636e-06, | |
| "loss": 0.3365, | |
| "num_input_tokens_seen": 7016462, | |
| "step": 1137, | |
| "train_runtime": 4998.7709, | |
| "train_tokens_per_second": 1403.637 | |
| }, | |
| { | |
| "epoch": 1.9452991452991453, | |
| "grad_norm": 0.13905546069145203, | |
| "learning_rate": 5.6652360515021465e-06, | |
| "loss": 0.3441, | |
| "num_input_tokens_seen": 7024086, | |
| "step": 1138, | |
| "train_runtime": 5003.5809, | |
| "train_tokens_per_second": 1403.812 | |
| }, | |
| { | |
| "epoch": 1.947008547008547, | |
| "grad_norm": 0.16939112544059753, | |
| "learning_rate": 5.4935622317596565e-06, | |
| "loss": 0.3539, | |
| "num_input_tokens_seen": 7028750, | |
| "step": 1139, | |
| "train_runtime": 5006.7812, | |
| "train_tokens_per_second": 1403.846 | |
| }, | |
| { | |
| "epoch": 1.9487179487179487, | |
| "grad_norm": 0.15002712607383728, | |
| "learning_rate": 5.321888412017167e-06, | |
| "loss": 0.3174, | |
| "num_input_tokens_seen": 7033710, | |
| "step": 1140, | |
| "train_runtime": 5010.1585, | |
| "train_tokens_per_second": 1403.89 | |
| }, | |
| { | |
| "epoch": 1.9504273504273504, | |
| "grad_norm": 0.18167702853679657, | |
| "learning_rate": 5.150214592274678e-06, | |
| "loss": 0.4735, | |
| "num_input_tokens_seen": 7038134, | |
| "step": 1141, | |
| "train_runtime": 5015.1806, | |
| "train_tokens_per_second": 1403.366 | |
| }, | |
| { | |
| "epoch": 1.952136752136752, | |
| "grad_norm": 0.19326065480709076, | |
| "learning_rate": 4.978540772532189e-06, | |
| "loss": 0.4024, | |
| "num_input_tokens_seen": 7045182, | |
| "step": 1142, | |
| "train_runtime": 5019.6695, | |
| "train_tokens_per_second": 1403.515 | |
| }, | |
| { | |
| "epoch": 1.953846153846154, | |
| "grad_norm": 0.15256325900554657, | |
| "learning_rate": 4.8068669527897e-06, | |
| "loss": 0.4067, | |
| "num_input_tokens_seen": 7051910, | |
| "step": 1143, | |
| "train_runtime": 5024.001, | |
| "train_tokens_per_second": 1403.644 | |
| }, | |
| { | |
| "epoch": 1.9555555555555557, | |
| "grad_norm": 0.14433787763118744, | |
| "learning_rate": 4.63519313304721e-06, | |
| "loss": 0.3536, | |
| "num_input_tokens_seen": 7057862, | |
| "step": 1144, | |
| "train_runtime": 5027.9685, | |
| "train_tokens_per_second": 1403.72 | |
| }, | |
| { | |
| "epoch": 1.9572649572649574, | |
| "grad_norm": 0.13618534803390503, | |
| "learning_rate": 4.463519313304721e-06, | |
| "loss": 0.3097, | |
| "num_input_tokens_seen": 7065950, | |
| "step": 1145, | |
| "train_runtime": 5033.0872, | |
| "train_tokens_per_second": 1403.9 | |
| }, | |
| { | |
| "epoch": 1.9589743589743591, | |
| "grad_norm": 0.18025486171245575, | |
| "learning_rate": 4.2918454935622316e-06, | |
| "loss": 0.5036, | |
| "num_input_tokens_seen": 7070798, | |
| "step": 1146, | |
| "train_runtime": 5036.3826, | |
| "train_tokens_per_second": 1403.944 | |
| }, | |
| { | |
| "epoch": 1.9606837606837608, | |
| "grad_norm": 0.14855344593524933, | |
| "learning_rate": 4.120171673819742e-06, | |
| "loss": 0.358, | |
| "num_input_tokens_seen": 7076262, | |
| "step": 1147, | |
| "train_runtime": 5039.9834, | |
| "train_tokens_per_second": 1404.025 | |
| }, | |
| { | |
| "epoch": 1.9623931623931625, | |
| "grad_norm": 0.14267109334468842, | |
| "learning_rate": 3.948497854077254e-06, | |
| "loss": 0.314, | |
| "num_input_tokens_seen": 7082518, | |
| "step": 1148, | |
| "train_runtime": 5044.05, | |
| "train_tokens_per_second": 1404.133 | |
| }, | |
| { | |
| "epoch": 1.9641025641025642, | |
| "grad_norm": 0.14983952045440674, | |
| "learning_rate": 3.7768240343347637e-06, | |
| "loss": 0.3844, | |
| "num_input_tokens_seen": 7088558, | |
| "step": 1149, | |
| "train_runtime": 5047.9368, | |
| "train_tokens_per_second": 1404.249 | |
| }, | |
| { | |
| "epoch": 1.965811965811966, | |
| "grad_norm": 0.1477644294500351, | |
| "learning_rate": 3.6051502145922745e-06, | |
| "loss": 0.2836, | |
| "num_input_tokens_seen": 7095926, | |
| "step": 1150, | |
| "train_runtime": 5052.6961, | |
| "train_tokens_per_second": 1404.384 | |
| }, | |
| { | |
| "epoch": 1.9675213675213676, | |
| "grad_norm": 0.17511659860610962, | |
| "learning_rate": 3.4334763948497858e-06, | |
| "loss": 0.3682, | |
| "num_input_tokens_seen": 7100846, | |
| "step": 1151, | |
| "train_runtime": 5056.0814, | |
| "train_tokens_per_second": 1404.417 | |
| }, | |
| { | |
| "epoch": 1.9692307692307693, | |
| "grad_norm": 0.15633749961853027, | |
| "learning_rate": 3.2618025751072966e-06, | |
| "loss": 0.2592, | |
| "num_input_tokens_seen": 7105150, | |
| "step": 1152, | |
| "train_runtime": 5059.0018, | |
| "train_tokens_per_second": 1404.457 | |
| }, | |
| { | |
| "epoch": 1.970940170940171, | |
| "grad_norm": 0.15015672147274017, | |
| "learning_rate": 3.090128755364807e-06, | |
| "loss": 0.3362, | |
| "num_input_tokens_seen": 7112038, | |
| "step": 1153, | |
| "train_runtime": 5063.4562, | |
| "train_tokens_per_second": 1404.582 | |
| }, | |
| { | |
| "epoch": 1.9726495726495727, | |
| "grad_norm": 0.14071433246135712, | |
| "learning_rate": 2.918454935622318e-06, | |
| "loss": 0.2969, | |
| "num_input_tokens_seen": 7118214, | |
| "step": 1154, | |
| "train_runtime": 5067.4234, | |
| "train_tokens_per_second": 1404.701 | |
| }, | |
| { | |
| "epoch": 1.9743589743589745, | |
| "grad_norm": 0.16674835979938507, | |
| "learning_rate": 2.7467811158798283e-06, | |
| "loss": 0.4497, | |
| "num_input_tokens_seen": 7124414, | |
| "step": 1155, | |
| "train_runtime": 5071.4815, | |
| "train_tokens_per_second": 1404.799 | |
| }, | |
| { | |
| "epoch": 1.9760683760683762, | |
| "grad_norm": 0.16165152192115784, | |
| "learning_rate": 2.575107296137339e-06, | |
| "loss": 0.3373, | |
| "num_input_tokens_seen": 7128862, | |
| "step": 1156, | |
| "train_runtime": 5074.4614, | |
| "train_tokens_per_second": 1404.851 | |
| }, | |
| { | |
| "epoch": 1.9777777777777779, | |
| "grad_norm": 0.17277656495571136, | |
| "learning_rate": 2.40343347639485e-06, | |
| "loss": 0.2393, | |
| "num_input_tokens_seen": 7146230, | |
| "step": 1157, | |
| "train_runtime": 5084.9281, | |
| "train_tokens_per_second": 1405.375 | |
| }, | |
| { | |
| "epoch": 1.9794871794871796, | |
| "grad_norm": 0.17875243723392487, | |
| "learning_rate": 2.2317596566523604e-06, | |
| "loss": 0.4351, | |
| "num_input_tokens_seen": 7152230, | |
| "step": 1158, | |
| "train_runtime": 5088.821, | |
| "train_tokens_per_second": 1405.479 | |
| }, | |
| { | |
| "epoch": 1.9811965811965813, | |
| "grad_norm": 0.15034790337085724, | |
| "learning_rate": 2.060085836909871e-06, | |
| "loss": 0.337, | |
| "num_input_tokens_seen": 7157270, | |
| "step": 1159, | |
| "train_runtime": 5092.1754, | |
| "train_tokens_per_second": 1405.543 | |
| }, | |
| { | |
| "epoch": 1.982905982905983, | |
| "grad_norm": 0.15507899224758148, | |
| "learning_rate": 1.8884120171673818e-06, | |
| "loss": 0.3092, | |
| "num_input_tokens_seen": 7162982, | |
| "step": 1160, | |
| "train_runtime": 5095.8972, | |
| "train_tokens_per_second": 1405.637 | |
| }, | |
| { | |
| "epoch": 1.9846153846153847, | |
| "grad_norm": 0.14410509169101715, | |
| "learning_rate": 1.7167381974248929e-06, | |
| "loss": 0.3034, | |
| "num_input_tokens_seen": 7169934, | |
| "step": 1161, | |
| "train_runtime": 5100.2993, | |
| "train_tokens_per_second": 1405.787 | |
| }, | |
| { | |
| "epoch": 1.9863247863247864, | |
| "grad_norm": 0.1652487963438034, | |
| "learning_rate": 1.5450643776824035e-06, | |
| "loss": 0.3926, | |
| "num_input_tokens_seen": 7175958, | |
| "step": 1162, | |
| "train_runtime": 5104.1999, | |
| "train_tokens_per_second": 1405.893 | |
| }, | |
| { | |
| "epoch": 1.988034188034188, | |
| "grad_norm": 0.12866978347301483, | |
| "learning_rate": 1.3733905579399141e-06, | |
| "loss": 0.216, | |
| "num_input_tokens_seen": 7192558, | |
| "step": 1163, | |
| "train_runtime": 5113.9801, | |
| "train_tokens_per_second": 1406.45 | |
| }, | |
| { | |
| "epoch": 1.9897435897435898, | |
| "grad_norm": 0.1544247269630432, | |
| "learning_rate": 1.201716738197425e-06, | |
| "loss": 0.3591, | |
| "num_input_tokens_seen": 7198806, | |
| "step": 1164, | |
| "train_runtime": 5117.9515, | |
| "train_tokens_per_second": 1406.58 | |
| }, | |
| { | |
| "epoch": 1.9914529914529915, | |
| "grad_norm": 0.14498887956142426, | |
| "learning_rate": 1.0300429184549356e-06, | |
| "loss": 0.3196, | |
| "num_input_tokens_seen": 7205486, | |
| "step": 1165, | |
| "train_runtime": 5122.3014, | |
| "train_tokens_per_second": 1406.689 | |
| }, | |
| { | |
| "epoch": 1.9931623931623932, | |
| "grad_norm": 0.1625777930021286, | |
| "learning_rate": 8.583690987124464e-07, | |
| "loss": 0.3314, | |
| "num_input_tokens_seen": 7210694, | |
| "step": 1166, | |
| "train_runtime": 5125.7917, | |
| "train_tokens_per_second": 1406.747 | |
| }, | |
| { | |
| "epoch": 1.994871794871795, | |
| "grad_norm": 0.16056707501411438, | |
| "learning_rate": 6.866952789699571e-07, | |
| "loss": 0.4212, | |
| "num_input_tokens_seen": 7216110, | |
| "step": 1167, | |
| "train_runtime": 5129.3371, | |
| "train_tokens_per_second": 1406.831 | |
| }, | |
| { | |
| "epoch": 1.9965811965811966, | |
| "grad_norm": 0.17116740345954895, | |
| "learning_rate": 5.150214592274678e-07, | |
| "loss": 0.3152, | |
| "num_input_tokens_seen": 7222086, | |
| "step": 1168, | |
| "train_runtime": 5133.2419, | |
| "train_tokens_per_second": 1406.925 | |
| }, | |
| { | |
| "epoch": 1.9982905982905983, | |
| "grad_norm": 0.13754986226558685, | |
| "learning_rate": 3.4334763948497853e-07, | |
| "loss": 0.3062, | |
| "num_input_tokens_seen": 7228470, | |
| "step": 1169, | |
| "train_runtime": 5137.3693, | |
| "train_tokens_per_second": 1407.037 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 0.1478198617696762, | |
| "learning_rate": 1.7167381974248927e-07, | |
| "loss": 0.3072, | |
| "num_input_tokens_seen": 7234780, | |
| "step": 1170, | |
| "train_runtime": 5141.5156, | |
| "train_tokens_per_second": 1407.13 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_loss": 0.40483909845352173, | |
| "eval_runtime": 40.6231, | |
| "eval_samples_per_second": 24.567, | |
| "eval_steps_per_second": 3.077, | |
| "num_input_tokens_seen": 7234780, | |
| "step": 1170 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 1170, | |
| "num_input_tokens_seen": 7234780, | |
| "num_train_epochs": 2, | |
| "save_steps": 30, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.400044806730752e+18, | |
| "train_batch_size": 8, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |