Text Generation
Transformers
Safetensors
qwen2
Generated from Trainer
trl
unsloth
sft
conversational
text-generation-inference
Instructions to use FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth") model = AutoModelForCausalLM.from_pretrained("FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth
- SGLang
How to use FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Unsloth Studio
How to use FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth", max_seq_length=2048, ) - Docker Model Runner
How to use FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth with Docker Model Runner:
docker model run hf.co/FormlessAI/Qwen2.5-3B-Instruct-Math-Unsloth
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.0, | |
| "eval_steps": 25, | |
| "global_step": 248, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.00808080808080808, | |
| "grad_norm": 34.29597854614258, | |
| "learning_rate": 0.0, | |
| "loss": 0.9949, | |
| "num_input_tokens_seen": 24048, | |
| "step": 1, | |
| "train_runtime": 17.3014, | |
| "train_tokens_per_second": 1389.947 | |
| }, | |
| { | |
| "epoch": 0.01616161616161616, | |
| "grad_norm": 35.52030944824219, | |
| "learning_rate": 4.000000000000001e-06, | |
| "loss": 1.0553, | |
| "num_input_tokens_seen": 48096, | |
| "step": 2, | |
| "train_runtime": 19.429, | |
| "train_tokens_per_second": 2475.474 | |
| }, | |
| { | |
| "epoch": 0.024242424242424242, | |
| "grad_norm": 25.08833122253418, | |
| "learning_rate": 8.000000000000001e-06, | |
| "loss": 0.8931, | |
| "num_input_tokens_seen": 68416, | |
| "step": 3, | |
| "train_runtime": 21.2655, | |
| "train_tokens_per_second": 3217.224 | |
| }, | |
| { | |
| "epoch": 0.03232323232323232, | |
| "grad_norm": 15.185912132263184, | |
| "learning_rate": 1.2e-05, | |
| "loss": 0.6129, | |
| "num_input_tokens_seen": 90432, | |
| "step": 4, | |
| "train_runtime": 23.2211, | |
| "train_tokens_per_second": 3894.39 | |
| }, | |
| { | |
| "epoch": 0.04040404040404041, | |
| "grad_norm": 15.486276626586914, | |
| "learning_rate": 1.6000000000000003e-05, | |
| "loss": 0.5151, | |
| "num_input_tokens_seen": 110544, | |
| "step": 5, | |
| "train_runtime": 25.0374, | |
| "train_tokens_per_second": 4415.159 | |
| }, | |
| { | |
| "epoch": 0.048484848484848485, | |
| "grad_norm": 6.518914699554443, | |
| "learning_rate": 2e-05, | |
| "loss": 0.3906, | |
| "num_input_tokens_seen": 135584, | |
| "step": 6, | |
| "train_runtime": 27.2726, | |
| "train_tokens_per_second": 4971.445 | |
| }, | |
| { | |
| "epoch": 0.05656565656565657, | |
| "grad_norm": 3.689831256866455, | |
| "learning_rate": 1.991769547325103e-05, | |
| "loss": 0.3707, | |
| "num_input_tokens_seen": 159200, | |
| "step": 7, | |
| "train_runtime": 29.3859, | |
| "train_tokens_per_second": 5417.559 | |
| }, | |
| { | |
| "epoch": 0.06464646464646465, | |
| "grad_norm": 2.442633867263794, | |
| "learning_rate": 1.983539094650206e-05, | |
| "loss": 0.361, | |
| "num_input_tokens_seen": 182224, | |
| "step": 8, | |
| "train_runtime": 31.4524, | |
| "train_tokens_per_second": 5793.636 | |
| }, | |
| { | |
| "epoch": 0.07272727272727272, | |
| "grad_norm": 2.300377368927002, | |
| "learning_rate": 1.9753086419753087e-05, | |
| "loss": 0.3582, | |
| "num_input_tokens_seen": 205472, | |
| "step": 9, | |
| "train_runtime": 33.5262, | |
| "train_tokens_per_second": 6128.691 | |
| }, | |
| { | |
| "epoch": 0.08080808080808081, | |
| "grad_norm": 1.9368574619293213, | |
| "learning_rate": 1.9670781893004115e-05, | |
| "loss": 0.3134, | |
| "num_input_tokens_seen": 230400, | |
| "step": 10, | |
| "train_runtime": 36.915, | |
| "train_tokens_per_second": 6241.36 | |
| }, | |
| { | |
| "epoch": 0.08888888888888889, | |
| "grad_norm": 2.0495376586914062, | |
| "learning_rate": 1.9588477366255147e-05, | |
| "loss": 0.3375, | |
| "num_input_tokens_seen": 252736, | |
| "step": 11, | |
| "train_runtime": 38.9446, | |
| "train_tokens_per_second": 6489.625 | |
| }, | |
| { | |
| "epoch": 0.09696969696969697, | |
| "grad_norm": 2.28267502784729, | |
| "learning_rate": 1.9506172839506175e-05, | |
| "loss": 0.3242, | |
| "num_input_tokens_seen": 273584, | |
| "step": 12, | |
| "train_runtime": 40.8507, | |
| "train_tokens_per_second": 6697.174 | |
| }, | |
| { | |
| "epoch": 0.10505050505050505, | |
| "grad_norm": 2.2189362049102783, | |
| "learning_rate": 1.9423868312757203e-05, | |
| "loss": 0.3666, | |
| "num_input_tokens_seen": 299968, | |
| "step": 13, | |
| "train_runtime": 43.2004, | |
| "train_tokens_per_second": 6943.636 | |
| }, | |
| { | |
| "epoch": 0.11313131313131314, | |
| "grad_norm": 2.0740907192230225, | |
| "learning_rate": 1.934156378600823e-05, | |
| "loss": 0.3772, | |
| "num_input_tokens_seen": 322480, | |
| "step": 14, | |
| "train_runtime": 45.2552, | |
| "train_tokens_per_second": 7125.818 | |
| }, | |
| { | |
| "epoch": 0.12121212121212122, | |
| "grad_norm": 2.38155460357666, | |
| "learning_rate": 1.925925925925926e-05, | |
| "loss": 0.362, | |
| "num_input_tokens_seen": 344864, | |
| "step": 15, | |
| "train_runtime": 47.2767, | |
| "train_tokens_per_second": 7294.584 | |
| }, | |
| { | |
| "epoch": 0.1292929292929293, | |
| "grad_norm": 1.8321378231048584, | |
| "learning_rate": 1.9176954732510288e-05, | |
| "loss": 0.3286, | |
| "num_input_tokens_seen": 369296, | |
| "step": 16, | |
| "train_runtime": 49.4673, | |
| "train_tokens_per_second": 7465.459 | |
| }, | |
| { | |
| "epoch": 0.13737373737373737, | |
| "grad_norm": 2.0253713130950928, | |
| "learning_rate": 1.9094650205761317e-05, | |
| "loss": 0.3555, | |
| "num_input_tokens_seen": 390944, | |
| "step": 17, | |
| "train_runtime": 51.4481, | |
| "train_tokens_per_second": 7598.811 | |
| }, | |
| { | |
| "epoch": 0.14545454545454545, | |
| "grad_norm": 1.9212645292282104, | |
| "learning_rate": 1.901234567901235e-05, | |
| "loss": 0.3191, | |
| "num_input_tokens_seen": 414144, | |
| "step": 18, | |
| "train_runtime": 53.5341, | |
| "train_tokens_per_second": 7736.071 | |
| }, | |
| { | |
| "epoch": 0.15353535353535352, | |
| "grad_norm": 1.9833357334136963, | |
| "learning_rate": 1.8930041152263377e-05, | |
| "loss": 0.3033, | |
| "num_input_tokens_seen": 435840, | |
| "step": 19, | |
| "train_runtime": 55.4996, | |
| "train_tokens_per_second": 7853.023 | |
| }, | |
| { | |
| "epoch": 0.16161616161616163, | |
| "grad_norm": 1.8135859966278076, | |
| "learning_rate": 1.8847736625514405e-05, | |
| "loss": 0.3375, | |
| "num_input_tokens_seen": 459808, | |
| "step": 20, | |
| "train_runtime": 57.6671, | |
| "train_tokens_per_second": 7973.49 | |
| }, | |
| { | |
| "epoch": 0.1696969696969697, | |
| "grad_norm": 1.9057047367095947, | |
| "learning_rate": 1.8765432098765433e-05, | |
| "loss": 0.3338, | |
| "num_input_tokens_seen": 479504, | |
| "step": 21, | |
| "train_runtime": 59.4876, | |
| "train_tokens_per_second": 8060.567 | |
| }, | |
| { | |
| "epoch": 0.17777777777777778, | |
| "grad_norm": 1.8097015619277954, | |
| "learning_rate": 1.868312757201646e-05, | |
| "loss": 0.3333, | |
| "num_input_tokens_seen": 505712, | |
| "step": 22, | |
| "train_runtime": 61.8524, | |
| "train_tokens_per_second": 8176.108 | |
| }, | |
| { | |
| "epoch": 0.18585858585858586, | |
| "grad_norm": 2.087014675140381, | |
| "learning_rate": 1.860082304526749e-05, | |
| "loss": 0.3309, | |
| "num_input_tokens_seen": 525456, | |
| "step": 23, | |
| "train_runtime": 63.693, | |
| "train_tokens_per_second": 8249.829 | |
| }, | |
| { | |
| "epoch": 0.19393939393939394, | |
| "grad_norm": 2.135472536087036, | |
| "learning_rate": 1.851851851851852e-05, | |
| "loss": 0.3742, | |
| "num_input_tokens_seen": 548928, | |
| "step": 24, | |
| "train_runtime": 65.8153, | |
| "train_tokens_per_second": 8340.436 | |
| }, | |
| { | |
| "epoch": 0.20202020202020202, | |
| "grad_norm": 2.068189859390259, | |
| "learning_rate": 1.843621399176955e-05, | |
| "loss": 0.3191, | |
| "num_input_tokens_seen": 568608, | |
| "step": 25, | |
| "train_runtime": 67.6509, | |
| "train_tokens_per_second": 8405.03 | |
| }, | |
| { | |
| "epoch": 0.20202020202020202, | |
| "eval_loss": 0.30983325839042664, | |
| "eval_runtime": 10.55, | |
| "eval_samples_per_second": 83.318, | |
| "eval_steps_per_second": 5.213, | |
| "num_input_tokens_seen": 568608, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.2101010101010101, | |
| "grad_norm": 2.005445718765259, | |
| "learning_rate": 1.835390946502058e-05, | |
| "loss": 0.3055, | |
| "num_input_tokens_seen": 592240, | |
| "step": 26, | |
| "train_runtime": 81.0864, | |
| "train_tokens_per_second": 7303.813 | |
| }, | |
| { | |
| "epoch": 0.21818181818181817, | |
| "grad_norm": 1.9169626235961914, | |
| "learning_rate": 1.8271604938271607e-05, | |
| "loss": 0.2896, | |
| "num_input_tokens_seen": 613168, | |
| "step": 27, | |
| "train_runtime": 83.0241, | |
| "train_tokens_per_second": 7385.42 | |
| }, | |
| { | |
| "epoch": 0.22626262626262628, | |
| "grad_norm": 1.8428266048431396, | |
| "learning_rate": 1.8189300411522635e-05, | |
| "loss": 0.3012, | |
| "num_input_tokens_seen": 637552, | |
| "step": 28, | |
| "train_runtime": 85.2155, | |
| "train_tokens_per_second": 7481.643 | |
| }, | |
| { | |
| "epoch": 0.23434343434343435, | |
| "grad_norm": 1.9976342916488647, | |
| "learning_rate": 1.8106995884773663e-05, | |
| "loss": 0.3314, | |
| "num_input_tokens_seen": 661184, | |
| "step": 29, | |
| "train_runtime": 87.3748, | |
| "train_tokens_per_second": 7567.217 | |
| }, | |
| { | |
| "epoch": 0.24242424242424243, | |
| "grad_norm": 1.928344964981079, | |
| "learning_rate": 1.802469135802469e-05, | |
| "loss": 0.3567, | |
| "num_input_tokens_seen": 683072, | |
| "step": 30, | |
| "train_runtime": 89.3764, | |
| "train_tokens_per_second": 7642.645 | |
| }, | |
| { | |
| "epoch": 0.2505050505050505, | |
| "grad_norm": 1.8772201538085938, | |
| "learning_rate": 1.7942386831275723e-05, | |
| "loss": 0.3105, | |
| "num_input_tokens_seen": 703776, | |
| "step": 31, | |
| "train_runtime": 107.296, | |
| "train_tokens_per_second": 6559.199 | |
| }, | |
| { | |
| "epoch": 0.2585858585858586, | |
| "grad_norm": 1.742013692855835, | |
| "learning_rate": 1.786008230452675e-05, | |
| "loss": 0.3078, | |
| "num_input_tokens_seen": 729584, | |
| "step": 32, | |
| "train_runtime": 109.5875, | |
| "train_tokens_per_second": 6657.545 | |
| }, | |
| { | |
| "epoch": 0.26666666666666666, | |
| "grad_norm": 2.0742855072021484, | |
| "learning_rate": 1.7777777777777777e-05, | |
| "loss": 0.3568, | |
| "num_input_tokens_seen": 752672, | |
| "step": 33, | |
| "train_runtime": 111.6837, | |
| "train_tokens_per_second": 6739.321 | |
| }, | |
| { | |
| "epoch": 0.27474747474747474, | |
| "grad_norm": 2.038970947265625, | |
| "learning_rate": 1.769547325102881e-05, | |
| "loss": 0.3193, | |
| "num_input_tokens_seen": 776672, | |
| "step": 34, | |
| "train_runtime": 113.8655, | |
| "train_tokens_per_second": 6820.962 | |
| }, | |
| { | |
| "epoch": 0.2828282828282828, | |
| "grad_norm": 1.8307162523269653, | |
| "learning_rate": 1.7613168724279837e-05, | |
| "loss": 0.3426, | |
| "num_input_tokens_seen": 801296, | |
| "step": 35, | |
| "train_runtime": 116.0796, | |
| "train_tokens_per_second": 6902.987 | |
| }, | |
| { | |
| "epoch": 0.2909090909090909, | |
| "grad_norm": 2.0113823413848877, | |
| "learning_rate": 1.7530864197530865e-05, | |
| "loss": 0.3058, | |
| "num_input_tokens_seen": 822368, | |
| "step": 36, | |
| "train_runtime": 117.9981, | |
| "train_tokens_per_second": 6969.331 | |
| }, | |
| { | |
| "epoch": 0.298989898989899, | |
| "grad_norm": 1.922239899635315, | |
| "learning_rate": 1.7448559670781893e-05, | |
| "loss": 0.2951, | |
| "num_input_tokens_seen": 848928, | |
| "step": 37, | |
| "train_runtime": 120.382, | |
| "train_tokens_per_second": 7051.954 | |
| }, | |
| { | |
| "epoch": 0.30707070707070705, | |
| "grad_norm": 1.8546710014343262, | |
| "learning_rate": 1.7366255144032925e-05, | |
| "loss": 0.2751, | |
| "num_input_tokens_seen": 870672, | |
| "step": 38, | |
| "train_runtime": 122.3477, | |
| "train_tokens_per_second": 7116.372 | |
| }, | |
| { | |
| "epoch": 0.3151515151515151, | |
| "grad_norm": 2.022054433822632, | |
| "learning_rate": 1.728395061728395e-05, | |
| "loss": 0.3516, | |
| "num_input_tokens_seen": 892064, | |
| "step": 39, | |
| "train_runtime": 124.3075, | |
| "train_tokens_per_second": 7176.271 | |
| }, | |
| { | |
| "epoch": 0.32323232323232326, | |
| "grad_norm": 1.8261455297470093, | |
| "learning_rate": 1.720164609053498e-05, | |
| "loss": 0.3178, | |
| "num_input_tokens_seen": 915680, | |
| "step": 40, | |
| "train_runtime": 126.4529, | |
| "train_tokens_per_second": 7241.273 | |
| }, | |
| { | |
| "epoch": 0.33131313131313134, | |
| "grad_norm": 2.0345096588134766, | |
| "learning_rate": 1.711934156378601e-05, | |
| "loss": 0.3142, | |
| "num_input_tokens_seen": 935216, | |
| "step": 41, | |
| "train_runtime": 128.2566, | |
| "train_tokens_per_second": 7291.759 | |
| }, | |
| { | |
| "epoch": 0.3393939393939394, | |
| "grad_norm": 1.9947233200073242, | |
| "learning_rate": 1.7037037037037038e-05, | |
| "loss": 0.3049, | |
| "num_input_tokens_seen": 956864, | |
| "step": 42, | |
| "train_runtime": 130.2476, | |
| "train_tokens_per_second": 7346.5 | |
| }, | |
| { | |
| "epoch": 0.3474747474747475, | |
| "grad_norm": 2.135382652282715, | |
| "learning_rate": 1.6954732510288067e-05, | |
| "loss": 0.3233, | |
| "num_input_tokens_seen": 981440, | |
| "step": 43, | |
| "train_runtime": 132.4658, | |
| "train_tokens_per_second": 7409.008 | |
| }, | |
| { | |
| "epoch": 0.35555555555555557, | |
| "grad_norm": 2.0088696479797363, | |
| "learning_rate": 1.68724279835391e-05, | |
| "loss": 0.297, | |
| "num_input_tokens_seen": 1001232, | |
| "step": 44, | |
| "train_runtime": 134.324, | |
| "train_tokens_per_second": 7453.858 | |
| }, | |
| { | |
| "epoch": 0.36363636363636365, | |
| "grad_norm": 1.9240626096725464, | |
| "learning_rate": 1.6790123456790123e-05, | |
| "loss": 0.2836, | |
| "num_input_tokens_seen": 1027680, | |
| "step": 45, | |
| "train_runtime": 136.7055, | |
| "train_tokens_per_second": 7517.473 | |
| }, | |
| { | |
| "epoch": 0.3717171717171717, | |
| "grad_norm": 1.9892817735671997, | |
| "learning_rate": 1.670781893004115e-05, | |
| "loss": 0.3567, | |
| "num_input_tokens_seen": 1049968, | |
| "step": 46, | |
| "train_runtime": 138.7457, | |
| "train_tokens_per_second": 7567.57 | |
| }, | |
| { | |
| "epoch": 0.3797979797979798, | |
| "grad_norm": 2.067185401916504, | |
| "learning_rate": 1.6625514403292183e-05, | |
| "loss": 0.3299, | |
| "num_input_tokens_seen": 1071840, | |
| "step": 47, | |
| "train_runtime": 140.7519, | |
| "train_tokens_per_second": 7615.101 | |
| }, | |
| { | |
| "epoch": 0.3878787878787879, | |
| "grad_norm": 1.953230619430542, | |
| "learning_rate": 1.654320987654321e-05, | |
| "loss": 0.2794, | |
| "num_input_tokens_seen": 1092864, | |
| "step": 48, | |
| "train_runtime": 142.7001, | |
| "train_tokens_per_second": 7658.469 | |
| }, | |
| { | |
| "epoch": 0.39595959595959596, | |
| "grad_norm": 1.9437150955200195, | |
| "learning_rate": 1.646090534979424e-05, | |
| "loss": 0.3269, | |
| "num_input_tokens_seen": 1117040, | |
| "step": 49, | |
| "train_runtime": 144.8716, | |
| "train_tokens_per_second": 7710.55 | |
| }, | |
| { | |
| "epoch": 0.40404040404040403, | |
| "grad_norm": 1.921739101409912, | |
| "learning_rate": 1.6378600823045268e-05, | |
| "loss": 0.3297, | |
| "num_input_tokens_seen": 1140240, | |
| "step": 50, | |
| "train_runtime": 146.9806, | |
| "train_tokens_per_second": 7757.759 | |
| }, | |
| { | |
| "epoch": 0.40404040404040403, | |
| "eval_loss": 0.30039629340171814, | |
| "eval_runtime": 7.062, | |
| "eval_samples_per_second": 124.469, | |
| "eval_steps_per_second": 7.788, | |
| "num_input_tokens_seen": 1140240, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.4121212121212121, | |
| "grad_norm": 2.030803918838501, | |
| "learning_rate": 1.6296296296296297e-05, | |
| "loss": 0.317, | |
| "num_input_tokens_seen": 1161104, | |
| "step": 51, | |
| "train_runtime": 155.9849, | |
| "train_tokens_per_second": 7443.696 | |
| }, | |
| { | |
| "epoch": 0.4202020202020202, | |
| "grad_norm": 1.6810036897659302, | |
| "learning_rate": 1.6213991769547325e-05, | |
| "loss": 0.3059, | |
| "num_input_tokens_seen": 1189328, | |
| "step": 52, | |
| "train_runtime": 158.5167, | |
| "train_tokens_per_second": 7502.855 | |
| }, | |
| { | |
| "epoch": 0.42828282828282827, | |
| "grad_norm": 1.7849842309951782, | |
| "learning_rate": 1.6131687242798357e-05, | |
| "loss": 0.2731, | |
| "num_input_tokens_seen": 1211120, | |
| "step": 53, | |
| "train_runtime": 160.4993, | |
| "train_tokens_per_second": 7545.95 | |
| }, | |
| { | |
| "epoch": 0.43636363636363634, | |
| "grad_norm": 1.7593951225280762, | |
| "learning_rate": 1.6049382716049385e-05, | |
| "loss": 0.2982, | |
| "num_input_tokens_seen": 1234080, | |
| "step": 54, | |
| "train_runtime": 162.5873, | |
| "train_tokens_per_second": 7590.26 | |
| }, | |
| { | |
| "epoch": 0.4444444444444444, | |
| "grad_norm": 1.9831680059432983, | |
| "learning_rate": 1.5967078189300413e-05, | |
| "loss": 0.3024, | |
| "num_input_tokens_seen": 1256880, | |
| "step": 55, | |
| "train_runtime": 164.6649, | |
| "train_tokens_per_second": 7632.957 | |
| }, | |
| { | |
| "epoch": 0.45252525252525255, | |
| "grad_norm": 1.9270755052566528, | |
| "learning_rate": 1.588477366255144e-05, | |
| "loss": 0.3484, | |
| "num_input_tokens_seen": 1281376, | |
| "step": 56, | |
| "train_runtime": 166.8926, | |
| "train_tokens_per_second": 7677.849 | |
| }, | |
| { | |
| "epoch": 0.46060606060606063, | |
| "grad_norm": 1.7645379304885864, | |
| "learning_rate": 1.580246913580247e-05, | |
| "loss": 0.2909, | |
| "num_input_tokens_seen": 1309216, | |
| "step": 57, | |
| "train_runtime": 169.4269, | |
| "train_tokens_per_second": 7727.323 | |
| }, | |
| { | |
| "epoch": 0.4686868686868687, | |
| "grad_norm": 2.019009590148926, | |
| "learning_rate": 1.5720164609053498e-05, | |
| "loss": 0.37, | |
| "num_input_tokens_seen": 1331120, | |
| "step": 58, | |
| "train_runtime": 171.4602, | |
| "train_tokens_per_second": 7763.433 | |
| }, | |
| { | |
| "epoch": 0.4767676767676768, | |
| "grad_norm": 1.8868393898010254, | |
| "learning_rate": 1.5637860082304527e-05, | |
| "loss": 0.2952, | |
| "num_input_tokens_seen": 1354976, | |
| "step": 59, | |
| "train_runtime": 173.6145, | |
| "train_tokens_per_second": 7804.51 | |
| }, | |
| { | |
| "epoch": 0.48484848484848486, | |
| "grad_norm": 2.1054604053497314, | |
| "learning_rate": 1.555555555555556e-05, | |
| "loss": 0.3012, | |
| "num_input_tokens_seen": 1376976, | |
| "step": 60, | |
| "train_runtime": 175.6397, | |
| "train_tokens_per_second": 7839.778 | |
| }, | |
| { | |
| "epoch": 0.49292929292929294, | |
| "grad_norm": 1.8059983253479004, | |
| "learning_rate": 1.5473251028806587e-05, | |
| "loss": 0.3007, | |
| "num_input_tokens_seen": 1397952, | |
| "step": 61, | |
| "train_runtime": 193.5698, | |
| "train_tokens_per_second": 7221.952 | |
| }, | |
| { | |
| "epoch": 0.501010101010101, | |
| "grad_norm": 1.8705294132232666, | |
| "learning_rate": 1.5390946502057615e-05, | |
| "loss": 0.2984, | |
| "num_input_tokens_seen": 1417712, | |
| "step": 62, | |
| "train_runtime": 195.3895, | |
| "train_tokens_per_second": 7255.825 | |
| }, | |
| { | |
| "epoch": 0.509090909090909, | |
| "grad_norm": 1.9110565185546875, | |
| "learning_rate": 1.5308641975308643e-05, | |
| "loss": 0.2868, | |
| "num_input_tokens_seen": 1438544, | |
| "step": 63, | |
| "train_runtime": 197.311, | |
| "train_tokens_per_second": 7290.746 | |
| }, | |
| { | |
| "epoch": 0.5171717171717172, | |
| "grad_norm": 1.8605395555496216, | |
| "learning_rate": 1.5226337448559672e-05, | |
| "loss": 0.2894, | |
| "num_input_tokens_seen": 1461776, | |
| "step": 64, | |
| "train_runtime": 199.4092, | |
| "train_tokens_per_second": 7330.533 | |
| }, | |
| { | |
| "epoch": 0.5252525252525253, | |
| "grad_norm": 1.9197546243667603, | |
| "learning_rate": 1.51440329218107e-05, | |
| "loss": 0.3344, | |
| "num_input_tokens_seen": 1483600, | |
| "step": 65, | |
| "train_runtime": 201.3793, | |
| "train_tokens_per_second": 7367.193 | |
| }, | |
| { | |
| "epoch": 0.5333333333333333, | |
| "grad_norm": 1.8143887519836426, | |
| "learning_rate": 1.506172839506173e-05, | |
| "loss": 0.3272, | |
| "num_input_tokens_seen": 1507280, | |
| "step": 66, | |
| "train_runtime": 203.5195, | |
| "train_tokens_per_second": 7406.072 | |
| }, | |
| { | |
| "epoch": 0.5414141414141415, | |
| "grad_norm": 1.9554014205932617, | |
| "learning_rate": 1.4979423868312758e-05, | |
| "loss": 0.3072, | |
| "num_input_tokens_seen": 1530176, | |
| "step": 67, | |
| "train_runtime": 205.5865, | |
| "train_tokens_per_second": 7442.978 | |
| }, | |
| { | |
| "epoch": 0.5494949494949495, | |
| "grad_norm": 1.8135331869125366, | |
| "learning_rate": 1.4897119341563788e-05, | |
| "loss": 0.2907, | |
| "num_input_tokens_seen": 1553520, | |
| "step": 68, | |
| "train_runtime": 207.7058, | |
| "train_tokens_per_second": 7479.424 | |
| }, | |
| { | |
| "epoch": 0.5575757575757576, | |
| "grad_norm": 1.7284748554229736, | |
| "learning_rate": 1.4814814814814815e-05, | |
| "loss": 0.3004, | |
| "num_input_tokens_seen": 1577728, | |
| "step": 69, | |
| "train_runtime": 209.9215, | |
| "train_tokens_per_second": 7515.801 | |
| }, | |
| { | |
| "epoch": 0.5656565656565656, | |
| "grad_norm": 1.9973853826522827, | |
| "learning_rate": 1.4732510288065845e-05, | |
| "loss": 0.2774, | |
| "num_input_tokens_seen": 1598448, | |
| "step": 70, | |
| "train_runtime": 211.8265, | |
| "train_tokens_per_second": 7546.025 | |
| }, | |
| { | |
| "epoch": 0.5737373737373738, | |
| "grad_norm": 1.867518663406372, | |
| "learning_rate": 1.4650205761316873e-05, | |
| "loss": 0.2953, | |
| "num_input_tokens_seen": 1619616, | |
| "step": 71, | |
| "train_runtime": 213.7737, | |
| "train_tokens_per_second": 7576.311 | |
| }, | |
| { | |
| "epoch": 0.5818181818181818, | |
| "grad_norm": 1.87697172164917, | |
| "learning_rate": 1.4567901234567903e-05, | |
| "loss": 0.3165, | |
| "num_input_tokens_seen": 1647504, | |
| "step": 72, | |
| "train_runtime": 216.2825, | |
| "train_tokens_per_second": 7617.373 | |
| }, | |
| { | |
| "epoch": 0.5898989898989899, | |
| "grad_norm": 2.0404067039489746, | |
| "learning_rate": 1.4485596707818932e-05, | |
| "loss": 0.325, | |
| "num_input_tokens_seen": 1669600, | |
| "step": 73, | |
| "train_runtime": 218.3171, | |
| "train_tokens_per_second": 7647.592 | |
| }, | |
| { | |
| "epoch": 0.597979797979798, | |
| "grad_norm": 1.9081746339797974, | |
| "learning_rate": 1.4403292181069962e-05, | |
| "loss": 0.3295, | |
| "num_input_tokens_seen": 1692464, | |
| "step": 74, | |
| "train_runtime": 220.4059, | |
| "train_tokens_per_second": 7678.851 | |
| }, | |
| { | |
| "epoch": 0.6060606060606061, | |
| "grad_norm": 1.9184836149215698, | |
| "learning_rate": 1.4320987654320988e-05, | |
| "loss": 0.3046, | |
| "num_input_tokens_seen": 1714544, | |
| "step": 75, | |
| "train_runtime": 222.438, | |
| "train_tokens_per_second": 7707.964 | |
| }, | |
| { | |
| "epoch": 0.6060606060606061, | |
| "eval_loss": 0.2966873049736023, | |
| "eval_runtime": 7.0993, | |
| "eval_samples_per_second": 123.814, | |
| "eval_steps_per_second": 7.747, | |
| "num_input_tokens_seen": 1714544, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.6141414141414141, | |
| "grad_norm": 1.9091130495071411, | |
| "learning_rate": 1.4238683127572017e-05, | |
| "loss": 0.3117, | |
| "num_input_tokens_seen": 1734992, | |
| "step": 76, | |
| "train_runtime": 231.4507, | |
| "train_tokens_per_second": 7496.164 | |
| }, | |
| { | |
| "epoch": 0.6222222222222222, | |
| "grad_norm": 1.8281859159469604, | |
| "learning_rate": 1.4156378600823047e-05, | |
| "loss": 0.3165, | |
| "num_input_tokens_seen": 1758528, | |
| "step": 77, | |
| "train_runtime": 233.6112, | |
| "train_tokens_per_second": 7527.584 | |
| }, | |
| { | |
| "epoch": 0.6303030303030303, | |
| "grad_norm": 2.0086405277252197, | |
| "learning_rate": 1.4074074074074075e-05, | |
| "loss": 0.3239, | |
| "num_input_tokens_seen": 1782768, | |
| "step": 78, | |
| "train_runtime": 235.7867, | |
| "train_tokens_per_second": 7560.935 | |
| }, | |
| { | |
| "epoch": 0.6383838383838384, | |
| "grad_norm": 1.9040608406066895, | |
| "learning_rate": 1.3991769547325105e-05, | |
| "loss": 0.3269, | |
| "num_input_tokens_seen": 1806000, | |
| "step": 79, | |
| "train_runtime": 237.8964, | |
| "train_tokens_per_second": 7591.539 | |
| }, | |
| { | |
| "epoch": 0.6464646464646465, | |
| "grad_norm": 1.8077948093414307, | |
| "learning_rate": 1.3909465020576133e-05, | |
| "loss": 0.3069, | |
| "num_input_tokens_seen": 1833264, | |
| "step": 80, | |
| "train_runtime": 240.3427, | |
| "train_tokens_per_second": 7627.708 | |
| }, | |
| { | |
| "epoch": 0.6545454545454545, | |
| "grad_norm": 2.132566452026367, | |
| "learning_rate": 1.3827160493827162e-05, | |
| "loss": 0.3564, | |
| "num_input_tokens_seen": 1855920, | |
| "step": 81, | |
| "train_runtime": 242.4326, | |
| "train_tokens_per_second": 7655.407 | |
| }, | |
| { | |
| "epoch": 0.6626262626262627, | |
| "grad_norm": 1.9666991233825684, | |
| "learning_rate": 1.374485596707819e-05, | |
| "loss": 0.3299, | |
| "num_input_tokens_seen": 1877664, | |
| "step": 82, | |
| "train_runtime": 244.4539, | |
| "train_tokens_per_second": 7681.055 | |
| }, | |
| { | |
| "epoch": 0.6707070707070707, | |
| "grad_norm": 1.7784312963485718, | |
| "learning_rate": 1.366255144032922e-05, | |
| "loss": 0.2704, | |
| "num_input_tokens_seen": 1901152, | |
| "step": 83, | |
| "train_runtime": 246.5816, | |
| "train_tokens_per_second": 7710.033 | |
| }, | |
| { | |
| "epoch": 0.6787878787878788, | |
| "grad_norm": 1.9089895486831665, | |
| "learning_rate": 1.3580246913580248e-05, | |
| "loss": 0.3071, | |
| "num_input_tokens_seen": 1927440, | |
| "step": 84, | |
| "train_runtime": 248.9261, | |
| "train_tokens_per_second": 7743.02 | |
| }, | |
| { | |
| "epoch": 0.6868686868686869, | |
| "grad_norm": 2.1388967037200928, | |
| "learning_rate": 1.3497942386831278e-05, | |
| "loss": 0.3121, | |
| "num_input_tokens_seen": 1951408, | |
| "step": 85, | |
| "train_runtime": 251.0849, | |
| "train_tokens_per_second": 7771.906 | |
| }, | |
| { | |
| "epoch": 0.694949494949495, | |
| "grad_norm": 1.9663597345352173, | |
| "learning_rate": 1.3415637860082307e-05, | |
| "loss": 0.3255, | |
| "num_input_tokens_seen": 1973200, | |
| "step": 86, | |
| "train_runtime": 253.071, | |
| "train_tokens_per_second": 7797.022 | |
| }, | |
| { | |
| "epoch": 0.703030303030303, | |
| "grad_norm": 1.8622767925262451, | |
| "learning_rate": 1.3333333333333333e-05, | |
| "loss": 0.3316, | |
| "num_input_tokens_seen": 1994528, | |
| "step": 87, | |
| "train_runtime": 255.0392, | |
| "train_tokens_per_second": 7820.476 | |
| }, | |
| { | |
| "epoch": 0.7111111111111111, | |
| "grad_norm": 2.091785430908203, | |
| "learning_rate": 1.3251028806584363e-05, | |
| "loss": 0.29, | |
| "num_input_tokens_seen": 2019248, | |
| "step": 88, | |
| "train_runtime": 257.2586, | |
| "train_tokens_per_second": 7849.097 | |
| }, | |
| { | |
| "epoch": 0.7191919191919192, | |
| "grad_norm": 1.9802072048187256, | |
| "learning_rate": 1.3168724279835392e-05, | |
| "loss": 0.3108, | |
| "num_input_tokens_seen": 2040592, | |
| "step": 89, | |
| "train_runtime": 259.2297, | |
| "train_tokens_per_second": 7871.751 | |
| }, | |
| { | |
| "epoch": 0.7272727272727273, | |
| "grad_norm": 1.8566641807556152, | |
| "learning_rate": 1.3086419753086422e-05, | |
| "loss": 0.2818, | |
| "num_input_tokens_seen": 2062032, | |
| "step": 90, | |
| "train_runtime": 261.2082, | |
| "train_tokens_per_second": 7894.21 | |
| }, | |
| { | |
| "epoch": 0.7353535353535353, | |
| "grad_norm": 2.006922960281372, | |
| "learning_rate": 1.300411522633745e-05, | |
| "loss": 0.2786, | |
| "num_input_tokens_seen": 2082368, | |
| "step": 91, | |
| "train_runtime": 279.7434, | |
| "train_tokens_per_second": 7443.85 | |
| }, | |
| { | |
| "epoch": 0.7434343434343434, | |
| "grad_norm": 1.9318790435791016, | |
| "learning_rate": 1.2921810699588477e-05, | |
| "loss": 0.2882, | |
| "num_input_tokens_seen": 2104976, | |
| "step": 92, | |
| "train_runtime": 281.7953, | |
| "train_tokens_per_second": 7469.876 | |
| }, | |
| { | |
| "epoch": 0.7515151515151515, | |
| "grad_norm": 2.0379955768585205, | |
| "learning_rate": 1.2839506172839507e-05, | |
| "loss": 0.3164, | |
| "num_input_tokens_seen": 2125664, | |
| "step": 93, | |
| "train_runtime": 283.6716, | |
| "train_tokens_per_second": 7493.396 | |
| }, | |
| { | |
| "epoch": 0.7595959595959596, | |
| "grad_norm": 1.7655056715011597, | |
| "learning_rate": 1.2757201646090535e-05, | |
| "loss": 0.2632, | |
| "num_input_tokens_seen": 2151216, | |
| "step": 94, | |
| "train_runtime": 285.9821, | |
| "train_tokens_per_second": 7522.204 | |
| }, | |
| { | |
| "epoch": 0.7676767676767676, | |
| "grad_norm": 2.0078585147857666, | |
| "learning_rate": 1.2674897119341565e-05, | |
| "loss": 0.3138, | |
| "num_input_tokens_seen": 2174480, | |
| "step": 95, | |
| "train_runtime": 288.0796, | |
| "train_tokens_per_second": 7548.192 | |
| }, | |
| { | |
| "epoch": 0.7757575757575758, | |
| "grad_norm": 1.8399180173873901, | |
| "learning_rate": 1.2592592592592593e-05, | |
| "loss": 0.2765, | |
| "num_input_tokens_seen": 2198048, | |
| "step": 96, | |
| "train_runtime": 290.2011, | |
| "train_tokens_per_second": 7574.225 | |
| }, | |
| { | |
| "epoch": 0.7838383838383839, | |
| "grad_norm": 2.049941301345825, | |
| "learning_rate": 1.2510288065843623e-05, | |
| "loss": 0.3136, | |
| "num_input_tokens_seen": 2218944, | |
| "step": 97, | |
| "train_runtime": 292.1183, | |
| "train_tokens_per_second": 7596.047 | |
| }, | |
| { | |
| "epoch": 0.7919191919191919, | |
| "grad_norm": 1.8334540128707886, | |
| "learning_rate": 1.242798353909465e-05, | |
| "loss": 0.3265, | |
| "num_input_tokens_seen": 2244752, | |
| "step": 98, | |
| "train_runtime": 294.4345, | |
| "train_tokens_per_second": 7623.944 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 2.317540168762207, | |
| "learning_rate": 1.234567901234568e-05, | |
| "loss": 0.3505, | |
| "num_input_tokens_seen": 2267728, | |
| "step": 99, | |
| "train_runtime": 296.5099, | |
| "train_tokens_per_second": 7648.068 | |
| }, | |
| { | |
| "epoch": 0.8080808080808081, | |
| "grad_norm": 1.9731619358062744, | |
| "learning_rate": 1.2263374485596708e-05, | |
| "loss": 0.2984, | |
| "num_input_tokens_seen": 2289328, | |
| "step": 100, | |
| "train_runtime": 298.4904, | |
| "train_tokens_per_second": 7669.686 | |
| }, | |
| { | |
| "epoch": 0.8080808080808081, | |
| "eval_loss": 0.29423120617866516, | |
| "eval_runtime": 7.029, | |
| "eval_samples_per_second": 125.053, | |
| "eval_steps_per_second": 7.825, | |
| "num_input_tokens_seen": 2289328, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.8161616161616162, | |
| "grad_norm": 2.0644495487213135, | |
| "learning_rate": 1.2181069958847738e-05, | |
| "loss": 0.326, | |
| "num_input_tokens_seen": 2313216, | |
| "step": 101, | |
| "train_runtime": 307.6926, | |
| "train_tokens_per_second": 7517.945 | |
| }, | |
| { | |
| "epoch": 0.8242424242424242, | |
| "grad_norm": 1.9370036125183105, | |
| "learning_rate": 1.2098765432098767e-05, | |
| "loss": 0.2865, | |
| "num_input_tokens_seen": 2333152, | |
| "step": 102, | |
| "train_runtime": 309.5355, | |
| "train_tokens_per_second": 7537.591 | |
| }, | |
| { | |
| "epoch": 0.8323232323232324, | |
| "grad_norm": 1.9265321493148804, | |
| "learning_rate": 1.2016460905349797e-05, | |
| "loss": 0.3275, | |
| "num_input_tokens_seen": 2355744, | |
| "step": 103, | |
| "train_runtime": 311.5913, | |
| "train_tokens_per_second": 7560.365 | |
| }, | |
| { | |
| "epoch": 0.8404040404040404, | |
| "grad_norm": 1.9668643474578857, | |
| "learning_rate": 1.1934156378600823e-05, | |
| "loss": 0.3592, | |
| "num_input_tokens_seen": 2376560, | |
| "step": 104, | |
| "train_runtime": 313.4969, | |
| "train_tokens_per_second": 7580.81 | |
| }, | |
| { | |
| "epoch": 0.8484848484848485, | |
| "grad_norm": 1.9941215515136719, | |
| "learning_rate": 1.1851851851851852e-05, | |
| "loss": 0.2986, | |
| "num_input_tokens_seen": 2400896, | |
| "step": 105, | |
| "train_runtime": 315.6988, | |
| "train_tokens_per_second": 7605.02 | |
| }, | |
| { | |
| "epoch": 0.8565656565656565, | |
| "grad_norm": 2.070256233215332, | |
| "learning_rate": 1.1769547325102882e-05, | |
| "loss": 0.3146, | |
| "num_input_tokens_seen": 2423632, | |
| "step": 106, | |
| "train_runtime": 317.7728, | |
| "train_tokens_per_second": 7626.933 | |
| }, | |
| { | |
| "epoch": 0.8646464646464647, | |
| "grad_norm": 1.929892659187317, | |
| "learning_rate": 1.168724279835391e-05, | |
| "loss": 0.33, | |
| "num_input_tokens_seen": 2448432, | |
| "step": 107, | |
| "train_runtime": 320.0049, | |
| "train_tokens_per_second": 7651.233 | |
| }, | |
| { | |
| "epoch": 0.8727272727272727, | |
| "grad_norm": 1.7959911823272705, | |
| "learning_rate": 1.160493827160494e-05, | |
| "loss": 0.3109, | |
| "num_input_tokens_seen": 2470768, | |
| "step": 108, | |
| "train_runtime": 322.0228, | |
| "train_tokens_per_second": 7672.65 | |
| }, | |
| { | |
| "epoch": 0.8808080808080808, | |
| "grad_norm": 1.8385419845581055, | |
| "learning_rate": 1.1522633744855968e-05, | |
| "loss": 0.2902, | |
| "num_input_tokens_seen": 2494944, | |
| "step": 109, | |
| "train_runtime": 324.2378, | |
| "train_tokens_per_second": 7694.798 | |
| }, | |
| { | |
| "epoch": 0.8888888888888888, | |
| "grad_norm": 1.9622164964675903, | |
| "learning_rate": 1.1440329218106997e-05, | |
| "loss": 0.3503, | |
| "num_input_tokens_seen": 2515760, | |
| "step": 110, | |
| "train_runtime": 326.16, | |
| "train_tokens_per_second": 7713.268 | |
| }, | |
| { | |
| "epoch": 0.896969696969697, | |
| "grad_norm": 1.9579459428787231, | |
| "learning_rate": 1.1358024691358025e-05, | |
| "loss": 0.2731, | |
| "num_input_tokens_seen": 2537792, | |
| "step": 111, | |
| "train_runtime": 328.183, | |
| "train_tokens_per_second": 7732.857 | |
| }, | |
| { | |
| "epoch": 0.9050505050505051, | |
| "grad_norm": 1.8197929859161377, | |
| "learning_rate": 1.1275720164609055e-05, | |
| "loss": 0.2742, | |
| "num_input_tokens_seen": 2562032, | |
| "step": 112, | |
| "train_runtime": 330.3793, | |
| "train_tokens_per_second": 7754.819 | |
| }, | |
| { | |
| "epoch": 0.9131313131313131, | |
| "grad_norm": 2.2101240158081055, | |
| "learning_rate": 1.1193415637860083e-05, | |
| "loss": 0.3154, | |
| "num_input_tokens_seen": 2583760, | |
| "step": 113, | |
| "train_runtime": 332.3672, | |
| "train_tokens_per_second": 7773.81 | |
| }, | |
| { | |
| "epoch": 0.9212121212121213, | |
| "grad_norm": 1.961485743522644, | |
| "learning_rate": 1.1111111111111113e-05, | |
| "loss": 0.2789, | |
| "num_input_tokens_seen": 2607776, | |
| "step": 114, | |
| "train_runtime": 334.5191, | |
| "train_tokens_per_second": 7795.596 | |
| }, | |
| { | |
| "epoch": 0.9292929292929293, | |
| "grad_norm": 2.0995683670043945, | |
| "learning_rate": 1.1028806584362142e-05, | |
| "loss": 0.3263, | |
| "num_input_tokens_seen": 2630208, | |
| "step": 115, | |
| "train_runtime": 336.587, | |
| "train_tokens_per_second": 7814.349 | |
| }, | |
| { | |
| "epoch": 0.9373737373737374, | |
| "grad_norm": 2.0641095638275146, | |
| "learning_rate": 1.0946502057613168e-05, | |
| "loss": 0.2851, | |
| "num_input_tokens_seen": 2650208, | |
| "step": 116, | |
| "train_runtime": 338.4264, | |
| "train_tokens_per_second": 7830.972 | |
| }, | |
| { | |
| "epoch": 0.9454545454545454, | |
| "grad_norm": 2.0057430267333984, | |
| "learning_rate": 1.0864197530864198e-05, | |
| "loss": 0.3165, | |
| "num_input_tokens_seen": 2672592, | |
| "step": 117, | |
| "train_runtime": 340.4808, | |
| "train_tokens_per_second": 7849.464 | |
| }, | |
| { | |
| "epoch": 0.9535353535353536, | |
| "grad_norm": 1.996042251586914, | |
| "learning_rate": 1.0781893004115227e-05, | |
| "loss": 0.2761, | |
| "num_input_tokens_seen": 2698064, | |
| "step": 118, | |
| "train_runtime": 342.8571, | |
| "train_tokens_per_second": 7869.354 | |
| }, | |
| { | |
| "epoch": 0.9616161616161616, | |
| "grad_norm": 1.9719218015670776, | |
| "learning_rate": 1.0699588477366257e-05, | |
| "loss": 0.3056, | |
| "num_input_tokens_seen": 2719680, | |
| "step": 119, | |
| "train_runtime": 344.8444, | |
| "train_tokens_per_second": 7886.688 | |
| }, | |
| { | |
| "epoch": 0.9696969696969697, | |
| "grad_norm": 1.7962714433670044, | |
| "learning_rate": 1.0617283950617285e-05, | |
| "loss": 0.2745, | |
| "num_input_tokens_seen": 2742400, | |
| "step": 120, | |
| "train_runtime": 346.9298, | |
| "train_tokens_per_second": 7904.768 | |
| }, | |
| { | |
| "epoch": 0.9777777777777777, | |
| "grad_norm": 1.91484797000885, | |
| "learning_rate": 1.0534979423868315e-05, | |
| "loss": 0.2906, | |
| "num_input_tokens_seen": 2766112, | |
| "step": 121, | |
| "train_runtime": 365.0207, | |
| "train_tokens_per_second": 7577.96 | |
| }, | |
| { | |
| "epoch": 0.9858585858585859, | |
| "grad_norm": 1.9865151643753052, | |
| "learning_rate": 1.0452674897119342e-05, | |
| "loss": 0.291, | |
| "num_input_tokens_seen": 2787952, | |
| "step": 122, | |
| "train_runtime": 366.9952, | |
| "train_tokens_per_second": 7596.699 | |
| }, | |
| { | |
| "epoch": 0.9939393939393939, | |
| "grad_norm": 2.03933048248291, | |
| "learning_rate": 1.037037037037037e-05, | |
| "loss": 0.3486, | |
| "num_input_tokens_seen": 2811632, | |
| "step": 123, | |
| "train_runtime": 369.1409, | |
| "train_tokens_per_second": 7616.69 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 2.3509812355041504, | |
| "learning_rate": 1.02880658436214e-05, | |
| "loss": 0.2723, | |
| "num_input_tokens_seen": 2825206, | |
| "step": 124, | |
| "train_runtime": 372.5555, | |
| "train_tokens_per_second": 7583.315 | |
| }, | |
| { | |
| "epoch": 1.0080808080808081, | |
| "grad_norm": 2.5542423725128174, | |
| "learning_rate": 1.0205761316872428e-05, | |
| "loss": 0.271, | |
| "num_input_tokens_seen": 2847206, | |
| "step": 125, | |
| "train_runtime": 374.5469, | |
| "train_tokens_per_second": 7601.734 | |
| }, | |
| { | |
| "epoch": 1.0080808080808081, | |
| "eval_loss": 0.2926430106163025, | |
| "eval_runtime": 7.026, | |
| "eval_samples_per_second": 125.107, | |
| "eval_steps_per_second": 7.828, | |
| "num_input_tokens_seen": 2847206, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 1.0161616161616163, | |
| "grad_norm": 2.485454797744751, | |
| "learning_rate": 1.0123456790123458e-05, | |
| "loss": 0.2351, | |
| "num_input_tokens_seen": 2867190, | |
| "step": 126, | |
| "train_runtime": 383.4417, | |
| "train_tokens_per_second": 7477.513 | |
| }, | |
| { | |
| "epoch": 1.0242424242424242, | |
| "grad_norm": 1.870703101158142, | |
| "learning_rate": 1.0041152263374487e-05, | |
| "loss": 0.2432, | |
| "num_input_tokens_seen": 2888710, | |
| "step": 127, | |
| "train_runtime": 385.4176, | |
| "train_tokens_per_second": 7495.014 | |
| }, | |
| { | |
| "epoch": 1.0323232323232323, | |
| "grad_norm": 1.9022161960601807, | |
| "learning_rate": 9.958847736625515e-06, | |
| "loss": 0.2415, | |
| "num_input_tokens_seen": 2913990, | |
| "step": 128, | |
| "train_runtime": 387.7088, | |
| "train_tokens_per_second": 7515.925 | |
| }, | |
| { | |
| "epoch": 1.0404040404040404, | |
| "grad_norm": 2.121541738510132, | |
| "learning_rate": 9.876543209876543e-06, | |
| "loss": 0.2421, | |
| "num_input_tokens_seen": 2938246, | |
| "step": 129, | |
| "train_runtime": 389.9127, | |
| "train_tokens_per_second": 7535.65 | |
| }, | |
| { | |
| "epoch": 1.0484848484848486, | |
| "grad_norm": 1.8283259868621826, | |
| "learning_rate": 9.794238683127573e-06, | |
| "loss": 0.2525, | |
| "num_input_tokens_seen": 2962326, | |
| "step": 130, | |
| "train_runtime": 392.1155, | |
| "train_tokens_per_second": 7554.729 | |
| }, | |
| { | |
| "epoch": 1.0565656565656565, | |
| "grad_norm": 2.0393452644348145, | |
| "learning_rate": 9.711934156378602e-06, | |
| "loss": 0.2636, | |
| "num_input_tokens_seen": 2983126, | |
| "step": 131, | |
| "train_runtime": 394.0236, | |
| "train_tokens_per_second": 7570.933 | |
| }, | |
| { | |
| "epoch": 1.0646464646464646, | |
| "grad_norm": 2.0195391178131104, | |
| "learning_rate": 9.62962962962963e-06, | |
| "loss": 0.2488, | |
| "num_input_tokens_seen": 3005606, | |
| "step": 132, | |
| "train_runtime": 396.0787, | |
| "train_tokens_per_second": 7588.405 | |
| }, | |
| { | |
| "epoch": 1.0727272727272728, | |
| "grad_norm": 2.2477834224700928, | |
| "learning_rate": 9.547325102880658e-06, | |
| "loss": 0.2564, | |
| "num_input_tokens_seen": 3027926, | |
| "step": 133, | |
| "train_runtime": 398.1422, | |
| "train_tokens_per_second": 7605.138 | |
| }, | |
| { | |
| "epoch": 1.0808080808080809, | |
| "grad_norm": 2.251457691192627, | |
| "learning_rate": 9.465020576131688e-06, | |
| "loss": 0.2514, | |
| "num_input_tokens_seen": 3052294, | |
| "step": 134, | |
| "train_runtime": 400.3525, | |
| "train_tokens_per_second": 7624.016 | |
| }, | |
| { | |
| "epoch": 1.0888888888888888, | |
| "grad_norm": 2.3457224369049072, | |
| "learning_rate": 9.382716049382717e-06, | |
| "loss": 0.2447, | |
| "num_input_tokens_seen": 3073014, | |
| "step": 135, | |
| "train_runtime": 402.2692, | |
| "train_tokens_per_second": 7639.198 | |
| }, | |
| { | |
| "epoch": 1.096969696969697, | |
| "grad_norm": 2.5215225219726562, | |
| "learning_rate": 9.300411522633745e-06, | |
| "loss": 0.2123, | |
| "num_input_tokens_seen": 3095126, | |
| "step": 136, | |
| "train_runtime": 404.2858, | |
| "train_tokens_per_second": 7655.786 | |
| }, | |
| { | |
| "epoch": 1.105050505050505, | |
| "grad_norm": 2.9330391883850098, | |
| "learning_rate": 9.218106995884775e-06, | |
| "loss": 0.2813, | |
| "num_input_tokens_seen": 3116438, | |
| "step": 137, | |
| "train_runtime": 406.2489, | |
| "train_tokens_per_second": 7671.252 | |
| }, | |
| { | |
| "epoch": 1.1131313131313132, | |
| "grad_norm": 2.4419281482696533, | |
| "learning_rate": 9.135802469135803e-06, | |
| "loss": 0.2355, | |
| "num_input_tokens_seen": 3139174, | |
| "step": 138, | |
| "train_runtime": 408.3028, | |
| "train_tokens_per_second": 7688.348 | |
| }, | |
| { | |
| "epoch": 1.121212121212121, | |
| "grad_norm": 2.1203596591949463, | |
| "learning_rate": 9.053497942386832e-06, | |
| "loss": 0.2362, | |
| "num_input_tokens_seen": 3165206, | |
| "step": 139, | |
| "train_runtime": 410.6277, | |
| "train_tokens_per_second": 7708.214 | |
| }, | |
| { | |
| "epoch": 1.1292929292929292, | |
| "grad_norm": 2.388300657272339, | |
| "learning_rate": 8.971193415637862e-06, | |
| "loss": 0.2683, | |
| "num_input_tokens_seen": 3189942, | |
| "step": 140, | |
| "train_runtime": 412.8585, | |
| "train_tokens_per_second": 7726.478 | |
| }, | |
| { | |
| "epoch": 1.1373737373737374, | |
| "grad_norm": 2.1845967769622803, | |
| "learning_rate": 8.888888888888888e-06, | |
| "loss": 0.2414, | |
| "num_input_tokens_seen": 3213878, | |
| "step": 141, | |
| "train_runtime": 415.0261, | |
| "train_tokens_per_second": 7743.798 | |
| }, | |
| { | |
| "epoch": 1.1454545454545455, | |
| "grad_norm": 1.9687696695327759, | |
| "learning_rate": 8.806584362139918e-06, | |
| "loss": 0.2828, | |
| "num_input_tokens_seen": 3236806, | |
| "step": 142, | |
| "train_runtime": 417.1211, | |
| "train_tokens_per_second": 7759.872 | |
| }, | |
| { | |
| "epoch": 1.1535353535353536, | |
| "grad_norm": 2.1155526638031006, | |
| "learning_rate": 8.724279835390947e-06, | |
| "loss": 0.2821, | |
| "num_input_tokens_seen": 3258822, | |
| "step": 143, | |
| "train_runtime": 419.1343, | |
| "train_tokens_per_second": 7775.127 | |
| }, | |
| { | |
| "epoch": 1.1616161616161615, | |
| "grad_norm": 2.031667947769165, | |
| "learning_rate": 8.641975308641975e-06, | |
| "loss": 0.2472, | |
| "num_input_tokens_seen": 3280694, | |
| "step": 144, | |
| "train_runtime": 421.1299, | |
| "train_tokens_per_second": 7790.219 | |
| }, | |
| { | |
| "epoch": 1.1696969696969697, | |
| "grad_norm": 2.065946340560913, | |
| "learning_rate": 8.559670781893005e-06, | |
| "loss": 0.24, | |
| "num_input_tokens_seen": 3305894, | |
| "step": 145, | |
| "train_runtime": 423.386, | |
| "train_tokens_per_second": 7808.226 | |
| }, | |
| { | |
| "epoch": 1.1777777777777778, | |
| "grad_norm": 2.0876126289367676, | |
| "learning_rate": 8.477366255144033e-06, | |
| "loss": 0.2466, | |
| "num_input_tokens_seen": 3327526, | |
| "step": 146, | |
| "train_runtime": 425.3809, | |
| "train_tokens_per_second": 7822.462 | |
| }, | |
| { | |
| "epoch": 1.185858585858586, | |
| "grad_norm": 1.9692819118499756, | |
| "learning_rate": 8.395061728395062e-06, | |
| "loss": 0.2462, | |
| "num_input_tokens_seen": 3349414, | |
| "step": 147, | |
| "train_runtime": 427.3897, | |
| "train_tokens_per_second": 7836.909 | |
| }, | |
| { | |
| "epoch": 1.1939393939393939, | |
| "grad_norm": 2.186434030532837, | |
| "learning_rate": 8.312757201646092e-06, | |
| "loss": 0.3039, | |
| "num_input_tokens_seen": 3373782, | |
| "step": 148, | |
| "train_runtime": 429.5935, | |
| "train_tokens_per_second": 7853.429 | |
| }, | |
| { | |
| "epoch": 1.202020202020202, | |
| "grad_norm": 2.0272040367126465, | |
| "learning_rate": 8.23045267489712e-06, | |
| "loss": 0.2476, | |
| "num_input_tokens_seen": 3397254, | |
| "step": 149, | |
| "train_runtime": 431.7412, | |
| "train_tokens_per_second": 7868.729 | |
| }, | |
| { | |
| "epoch": 1.2101010101010101, | |
| "grad_norm": 1.9289153814315796, | |
| "learning_rate": 8.148148148148148e-06, | |
| "loss": 0.2371, | |
| "num_input_tokens_seen": 3420102, | |
| "step": 150, | |
| "train_runtime": 433.8468, | |
| "train_tokens_per_second": 7883.202 | |
| }, | |
| { | |
| "epoch": 1.2101010101010101, | |
| "eval_loss": 0.2959754765033722, | |
| "eval_runtime": 7.0833, | |
| "eval_samples_per_second": 124.095, | |
| "eval_steps_per_second": 7.765, | |
| "num_input_tokens_seen": 3420102, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 1.2181818181818183, | |
| "grad_norm": 2.1007144451141357, | |
| "learning_rate": 8.065843621399178e-06, | |
| "loss": 0.265, | |
| "num_input_tokens_seen": 3440438, | |
| "step": 151, | |
| "train_runtime": 461.0146, | |
| "train_tokens_per_second": 7462.752 | |
| }, | |
| { | |
| "epoch": 1.2262626262626264, | |
| "grad_norm": 2.0250070095062256, | |
| "learning_rate": 7.983539094650207e-06, | |
| "loss": 0.2486, | |
| "num_input_tokens_seen": 3466054, | |
| "step": 152, | |
| "train_runtime": 463.3174, | |
| "train_tokens_per_second": 7480.949 | |
| }, | |
| { | |
| "epoch": 1.2343434343434343, | |
| "grad_norm": 1.7474883794784546, | |
| "learning_rate": 7.901234567901235e-06, | |
| "loss": 0.2172, | |
| "num_input_tokens_seen": 3492278, | |
| "step": 153, | |
| "train_runtime": 465.6949, | |
| "train_tokens_per_second": 7499.068 | |
| }, | |
| { | |
| "epoch": 1.2424242424242424, | |
| "grad_norm": 1.8963685035705566, | |
| "learning_rate": 7.818930041152263e-06, | |
| "loss": 0.2187, | |
| "num_input_tokens_seen": 3512582, | |
| "step": 154, | |
| "train_runtime": 467.5775, | |
| "train_tokens_per_second": 7512.299 | |
| }, | |
| { | |
| "epoch": 1.2505050505050506, | |
| "grad_norm": 1.9363595247268677, | |
| "learning_rate": 7.736625514403293e-06, | |
| "loss": 0.2594, | |
| "num_input_tokens_seen": 3535750, | |
| "step": 155, | |
| "train_runtime": 469.6918, | |
| "train_tokens_per_second": 7527.809 | |
| }, | |
| { | |
| "epoch": 1.2585858585858585, | |
| "grad_norm": 2.0793097019195557, | |
| "learning_rate": 7.654320987654322e-06, | |
| "loss": 0.2463, | |
| "num_input_tokens_seen": 3559894, | |
| "step": 156, | |
| "train_runtime": 471.8957, | |
| "train_tokens_per_second": 7543.816 | |
| }, | |
| { | |
| "epoch": 1.2666666666666666, | |
| "grad_norm": 2.071737289428711, | |
| "learning_rate": 7.57201646090535e-06, | |
| "loss": 0.2553, | |
| "num_input_tokens_seen": 3580390, | |
| "step": 157, | |
| "train_runtime": 473.7908, | |
| "train_tokens_per_second": 7556.901 | |
| }, | |
| { | |
| "epoch": 1.2747474747474747, | |
| "grad_norm": 1.9994101524353027, | |
| "learning_rate": 7.489711934156379e-06, | |
| "loss": 0.2189, | |
| "num_input_tokens_seen": 3601750, | |
| "step": 158, | |
| "train_runtime": 475.7442, | |
| "train_tokens_per_second": 7570.77 | |
| }, | |
| { | |
| "epoch": 1.2828282828282829, | |
| "grad_norm": 2.021566867828369, | |
| "learning_rate": 7.4074074074074075e-06, | |
| "loss": 0.2453, | |
| "num_input_tokens_seen": 3629030, | |
| "step": 159, | |
| "train_runtime": 478.1887, | |
| "train_tokens_per_second": 7589.117 | |
| }, | |
| { | |
| "epoch": 1.290909090909091, | |
| "grad_norm": 2.1607470512390137, | |
| "learning_rate": 7.325102880658437e-06, | |
| "loss": 0.2541, | |
| "num_input_tokens_seen": 3654358, | |
| "step": 160, | |
| "train_runtime": 480.4853, | |
| "train_tokens_per_second": 7605.556 | |
| }, | |
| { | |
| "epoch": 1.298989898989899, | |
| "grad_norm": 2.1245932579040527, | |
| "learning_rate": 7.242798353909466e-06, | |
| "loss": 0.2361, | |
| "num_input_tokens_seen": 3680758, | |
| "step": 161, | |
| "train_runtime": 482.8693, | |
| "train_tokens_per_second": 7622.68 | |
| }, | |
| { | |
| "epoch": 1.307070707070707, | |
| "grad_norm": 2.2660951614379883, | |
| "learning_rate": 7.160493827160494e-06, | |
| "loss": 0.2438, | |
| "num_input_tokens_seen": 3704022, | |
| "step": 162, | |
| "train_runtime": 485.004, | |
| "train_tokens_per_second": 7637.096 | |
| }, | |
| { | |
| "epoch": 1.3151515151515152, | |
| "grad_norm": 2.2035646438598633, | |
| "learning_rate": 7.078189300411523e-06, | |
| "loss": 0.2482, | |
| "num_input_tokens_seen": 3727814, | |
| "step": 163, | |
| "train_runtime": 487.1455, | |
| "train_tokens_per_second": 7652.362 | |
| }, | |
| { | |
| "epoch": 1.3232323232323233, | |
| "grad_norm": 2.1511008739471436, | |
| "learning_rate": 6.9958847736625525e-06, | |
| "loss": 0.2547, | |
| "num_input_tokens_seen": 3749606, | |
| "step": 164, | |
| "train_runtime": 489.1325, | |
| "train_tokens_per_second": 7665.828 | |
| }, | |
| { | |
| "epoch": 1.3313131313131312, | |
| "grad_norm": 2.249523878097534, | |
| "learning_rate": 6.913580246913581e-06, | |
| "loss": 0.2968, | |
| "num_input_tokens_seen": 3774710, | |
| "step": 165, | |
| "train_runtime": 491.419, | |
| "train_tokens_per_second": 7681.245 | |
| }, | |
| { | |
| "epoch": 1.3393939393939394, | |
| "grad_norm": 2.0948562622070312, | |
| "learning_rate": 6.83127572016461e-06, | |
| "loss": 0.2359, | |
| "num_input_tokens_seen": 3793814, | |
| "step": 166, | |
| "train_runtime": 493.2079, | |
| "train_tokens_per_second": 7692.119 | |
| }, | |
| { | |
| "epoch": 1.3474747474747475, | |
| "grad_norm": 2.107844591140747, | |
| "learning_rate": 6.748971193415639e-06, | |
| "loss": 0.2737, | |
| "num_input_tokens_seen": 3818662, | |
| "step": 167, | |
| "train_runtime": 495.4635, | |
| "train_tokens_per_second": 7707.251 | |
| }, | |
| { | |
| "epoch": 1.3555555555555556, | |
| "grad_norm": 2.3334641456604004, | |
| "learning_rate": 6.666666666666667e-06, | |
| "loss": 0.2596, | |
| "num_input_tokens_seen": 3841606, | |
| "step": 168, | |
| "train_runtime": 497.5542, | |
| "train_tokens_per_second": 7720.98 | |
| }, | |
| { | |
| "epoch": 1.3636363636363638, | |
| "grad_norm": 2.0350282192230225, | |
| "learning_rate": 6.584362139917696e-06, | |
| "loss": 0.2443, | |
| "num_input_tokens_seen": 3863830, | |
| "step": 169, | |
| "train_runtime": 499.6021, | |
| "train_tokens_per_second": 7733.815 | |
| }, | |
| { | |
| "epoch": 1.3717171717171717, | |
| "grad_norm": 2.1754233837127686, | |
| "learning_rate": 6.502057613168725e-06, | |
| "loss": 0.2618, | |
| "num_input_tokens_seen": 3886230, | |
| "step": 170, | |
| "train_runtime": 501.6397, | |
| "train_tokens_per_second": 7747.055 | |
| }, | |
| { | |
| "epoch": 1.3797979797979798, | |
| "grad_norm": 2.145559072494507, | |
| "learning_rate": 6.419753086419753e-06, | |
| "loss": 0.2353, | |
| "num_input_tokens_seen": 3908982, | |
| "step": 171, | |
| "train_runtime": 503.6986, | |
| "train_tokens_per_second": 7760.557 | |
| }, | |
| { | |
| "epoch": 1.387878787878788, | |
| "grad_norm": 2.020923376083374, | |
| "learning_rate": 6.3374485596707825e-06, | |
| "loss": 0.2178, | |
| "num_input_tokens_seen": 3936150, | |
| "step": 172, | |
| "train_runtime": 506.1611, | |
| "train_tokens_per_second": 7776.477 | |
| }, | |
| { | |
| "epoch": 1.3959595959595958, | |
| "grad_norm": 2.0729899406433105, | |
| "learning_rate": 6.255144032921812e-06, | |
| "loss": 0.2592, | |
| "num_input_tokens_seen": 3959430, | |
| "step": 173, | |
| "train_runtime": 508.2944, | |
| "train_tokens_per_second": 7789.639 | |
| }, | |
| { | |
| "epoch": 1.404040404040404, | |
| "grad_norm": 2.098947525024414, | |
| "learning_rate": 6.17283950617284e-06, | |
| "loss": 0.2497, | |
| "num_input_tokens_seen": 3981126, | |
| "step": 174, | |
| "train_runtime": 510.3129, | |
| "train_tokens_per_second": 7801.344 | |
| }, | |
| { | |
| "epoch": 1.412121212121212, | |
| "grad_norm": 2.200272560119629, | |
| "learning_rate": 6.090534979423869e-06, | |
| "loss": 0.2587, | |
| "num_input_tokens_seen": 4006118, | |
| "step": 175, | |
| "train_runtime": 512.5647, | |
| "train_tokens_per_second": 7815.829 | |
| }, | |
| { | |
| "epoch": 1.412121212121212, | |
| "eval_loss": 0.29883837699890137, | |
| "eval_runtime": 7.1029, | |
| "eval_samples_per_second": 123.753, | |
| "eval_steps_per_second": 7.743, | |
| "num_input_tokens_seen": 4006118, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 1.4202020202020202, | |
| "grad_norm": 2.150625228881836, | |
| "learning_rate": 6.008230452674898e-06, | |
| "loss": 0.2508, | |
| "num_input_tokens_seen": 4034054, | |
| "step": 176, | |
| "train_runtime": 522.2099, | |
| "train_tokens_per_second": 7724.967 | |
| }, | |
| { | |
| "epoch": 1.4282828282828284, | |
| "grad_norm": 2.0687313079833984, | |
| "learning_rate": 5.925925925925926e-06, | |
| "loss": 0.2393, | |
| "num_input_tokens_seen": 4058646, | |
| "step": 177, | |
| "train_runtime": 524.4627, | |
| "train_tokens_per_second": 7738.674 | |
| }, | |
| { | |
| "epoch": 1.4363636363636363, | |
| "grad_norm": 2.018831253051758, | |
| "learning_rate": 5.843621399176955e-06, | |
| "loss": 0.2712, | |
| "num_input_tokens_seen": 4083414, | |
| "step": 178, | |
| "train_runtime": 526.7043, | |
| "train_tokens_per_second": 7752.764 | |
| }, | |
| { | |
| "epoch": 1.4444444444444444, | |
| "grad_norm": 2.097909450531006, | |
| "learning_rate": 5.761316872427984e-06, | |
| "loss": 0.2601, | |
| "num_input_tokens_seen": 4107190, | |
| "step": 179, | |
| "train_runtime": 528.9031, | |
| "train_tokens_per_second": 7765.487 | |
| }, | |
| { | |
| "epoch": 1.4525252525252526, | |
| "grad_norm": 2.1564548015594482, | |
| "learning_rate": 5.6790123456790125e-06, | |
| "loss": 0.3076, | |
| "num_input_tokens_seen": 4129958, | |
| "step": 180, | |
| "train_runtime": 531.0094, | |
| "train_tokens_per_second": 7777.561 | |
| }, | |
| { | |
| "epoch": 1.4606060606060607, | |
| "grad_norm": 2.1547343730926514, | |
| "learning_rate": 5.596707818930042e-06, | |
| "loss": 0.2285, | |
| "num_input_tokens_seen": 4153302, | |
| "step": 181, | |
| "train_runtime": 551.2055, | |
| "train_tokens_per_second": 7534.943 | |
| }, | |
| { | |
| "epoch": 1.4686868686868686, | |
| "grad_norm": 2.0703673362731934, | |
| "learning_rate": 5.514403292181071e-06, | |
| "loss": 0.237, | |
| "num_input_tokens_seen": 4175222, | |
| "step": 182, | |
| "train_runtime": 553.2018, | |
| "train_tokens_per_second": 7547.375 | |
| }, | |
| { | |
| "epoch": 1.4767676767676767, | |
| "grad_norm": 1.8771171569824219, | |
| "learning_rate": 5.432098765432099e-06, | |
| "loss": 0.2437, | |
| "num_input_tokens_seen": 4196966, | |
| "step": 183, | |
| "train_runtime": 555.2016, | |
| "train_tokens_per_second": 7559.355 | |
| }, | |
| { | |
| "epoch": 1.4848484848484849, | |
| "grad_norm": 2.054640293121338, | |
| "learning_rate": 5.349794238683128e-06, | |
| "loss": 0.259, | |
| "num_input_tokens_seen": 4222630, | |
| "step": 184, | |
| "train_runtime": 557.5348, | |
| "train_tokens_per_second": 7573.752 | |
| }, | |
| { | |
| "epoch": 1.492929292929293, | |
| "grad_norm": 2.0560507774353027, | |
| "learning_rate": 5.2674897119341575e-06, | |
| "loss": 0.2397, | |
| "num_input_tokens_seen": 4243798, | |
| "step": 185, | |
| "train_runtime": 559.4718, | |
| "train_tokens_per_second": 7585.365 | |
| }, | |
| { | |
| "epoch": 1.5010101010101011, | |
| "grad_norm": 2.1618330478668213, | |
| "learning_rate": 5.185185185185185e-06, | |
| "loss": 0.254, | |
| "num_input_tokens_seen": 4265174, | |
| "step": 186, | |
| "train_runtime": 561.4461, | |
| "train_tokens_per_second": 7596.765 | |
| }, | |
| { | |
| "epoch": 1.509090909090909, | |
| "grad_norm": 1.9395222663879395, | |
| "learning_rate": 5.102880658436214e-06, | |
| "loss": 0.2269, | |
| "num_input_tokens_seen": 4286374, | |
| "step": 187, | |
| "train_runtime": 563.42, | |
| "train_tokens_per_second": 7607.777 | |
| }, | |
| { | |
| "epoch": 1.5171717171717172, | |
| "grad_norm": 1.9343959093093872, | |
| "learning_rate": 5.020576131687243e-06, | |
| "loss": 0.2284, | |
| "num_input_tokens_seen": 4314534, | |
| "step": 188, | |
| "train_runtime": 565.9536, | |
| "train_tokens_per_second": 7623.477 | |
| }, | |
| { | |
| "epoch": 1.5252525252525253, | |
| "grad_norm": 2.2199180126190186, | |
| "learning_rate": 4.938271604938272e-06, | |
| "loss": 0.2729, | |
| "num_input_tokens_seen": 4334726, | |
| "step": 189, | |
| "train_runtime": 567.8322, | |
| "train_tokens_per_second": 7633.815 | |
| }, | |
| { | |
| "epoch": 1.5333333333333332, | |
| "grad_norm": 2.422062397003174, | |
| "learning_rate": 4.855967078189301e-06, | |
| "loss": 0.2577, | |
| "num_input_tokens_seen": 4357238, | |
| "step": 190, | |
| "train_runtime": 569.9123, | |
| "train_tokens_per_second": 7645.453 | |
| }, | |
| { | |
| "epoch": 1.5414141414141413, | |
| "grad_norm": 2.182530641555786, | |
| "learning_rate": 4.773662551440329e-06, | |
| "loss": 0.2506, | |
| "num_input_tokens_seen": 4380310, | |
| "step": 191, | |
| "train_runtime": 572.0127, | |
| "train_tokens_per_second": 7657.714 | |
| }, | |
| { | |
| "epoch": 1.5494949494949495, | |
| "grad_norm": 1.9306634664535522, | |
| "learning_rate": 4.691358024691358e-06, | |
| "loss": 0.2492, | |
| "num_input_tokens_seen": 4402598, | |
| "step": 192, | |
| "train_runtime": 574.0447, | |
| "train_tokens_per_second": 7669.434 | |
| }, | |
| { | |
| "epoch": 1.5575757575757576, | |
| "grad_norm": 2.064788818359375, | |
| "learning_rate": 4.6090534979423875e-06, | |
| "loss": 0.2417, | |
| "num_input_tokens_seen": 4426854, | |
| "step": 193, | |
| "train_runtime": 576.2391, | |
| "train_tokens_per_second": 7682.321 | |
| }, | |
| { | |
| "epoch": 1.5656565656565657, | |
| "grad_norm": 2.1123790740966797, | |
| "learning_rate": 4.526748971193416e-06, | |
| "loss": 0.2702, | |
| "num_input_tokens_seen": 4452422, | |
| "step": 194, | |
| "train_runtime": 578.5618, | |
| "train_tokens_per_second": 7695.673 | |
| }, | |
| { | |
| "epoch": 1.5737373737373739, | |
| "grad_norm": 2.039179563522339, | |
| "learning_rate": 4.444444444444444e-06, | |
| "loss": 0.2523, | |
| "num_input_tokens_seen": 4479574, | |
| "step": 195, | |
| "train_runtime": 581.0195, | |
| "train_tokens_per_second": 7709.852 | |
| }, | |
| { | |
| "epoch": 1.5818181818181818, | |
| "grad_norm": 2.136936664581299, | |
| "learning_rate": 4.362139917695473e-06, | |
| "loss": 0.2797, | |
| "num_input_tokens_seen": 4499862, | |
| "step": 196, | |
| "train_runtime": 582.8938, | |
| "train_tokens_per_second": 7719.867 | |
| }, | |
| { | |
| "epoch": 1.58989898989899, | |
| "grad_norm": 2.0336132049560547, | |
| "learning_rate": 4.2798353909465025e-06, | |
| "loss": 0.2496, | |
| "num_input_tokens_seen": 4522614, | |
| "step": 197, | |
| "train_runtime": 584.992, | |
| "train_tokens_per_second": 7731.07 | |
| }, | |
| { | |
| "epoch": 1.5979797979797978, | |
| "grad_norm": 1.997153639793396, | |
| "learning_rate": 4.197530864197531e-06, | |
| "loss": 0.2318, | |
| "num_input_tokens_seen": 4544022, | |
| "step": 198, | |
| "train_runtime": 586.9586, | |
| "train_tokens_per_second": 7741.64 | |
| }, | |
| { | |
| "epoch": 1.606060606060606, | |
| "grad_norm": 1.994828224182129, | |
| "learning_rate": 4.11522633744856e-06, | |
| "loss": 0.2436, | |
| "num_input_tokens_seen": 4566198, | |
| "step": 199, | |
| "train_runtime": 588.9959, | |
| "train_tokens_per_second": 7752.512 | |
| }, | |
| { | |
| "epoch": 1.614141414141414, | |
| "grad_norm": 2.174928665161133, | |
| "learning_rate": 4.032921810699589e-06, | |
| "loss": 0.2769, | |
| "num_input_tokens_seen": 4588070, | |
| "step": 200, | |
| "train_runtime": 590.9965, | |
| "train_tokens_per_second": 7763.277 | |
| }, | |
| { | |
| "epoch": 1.614141414141414, | |
| "eval_loss": 0.2970900535583496, | |
| "eval_runtime": 7.1151, | |
| "eval_samples_per_second": 123.539, | |
| "eval_steps_per_second": 7.73, | |
| "num_input_tokens_seen": 4588070, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 1.6222222222222222, | |
| "grad_norm": 2.186704158782959, | |
| "learning_rate": 3.9506172839506175e-06, | |
| "loss": 0.2691, | |
| "num_input_tokens_seen": 4612646, | |
| "step": 201, | |
| "train_runtime": 600.3639, | |
| "train_tokens_per_second": 7683.084 | |
| }, | |
| { | |
| "epoch": 1.6303030303030304, | |
| "grad_norm": 2.1499741077423096, | |
| "learning_rate": 3.868312757201647e-06, | |
| "loss": 0.2562, | |
| "num_input_tokens_seen": 4633446, | |
| "step": 202, | |
| "train_runtime": 602.3025, | |
| "train_tokens_per_second": 7692.889 | |
| }, | |
| { | |
| "epoch": 1.6383838383838385, | |
| "grad_norm": 2.155334711074829, | |
| "learning_rate": 3.786008230452675e-06, | |
| "loss": 0.2389, | |
| "num_input_tokens_seen": 4656278, | |
| "step": 203, | |
| "train_runtime": 604.4073, | |
| "train_tokens_per_second": 7703.875 | |
| }, | |
| { | |
| "epoch": 1.6464646464646466, | |
| "grad_norm": 2.1553854942321777, | |
| "learning_rate": 3.7037037037037037e-06, | |
| "loss": 0.2447, | |
| "num_input_tokens_seen": 4678006, | |
| "step": 204, | |
| "train_runtime": 606.4147, | |
| "train_tokens_per_second": 7714.203 | |
| }, | |
| { | |
| "epoch": 1.6545454545454545, | |
| "grad_norm": 2.211529493331909, | |
| "learning_rate": 3.621399176954733e-06, | |
| "loss": 0.2673, | |
| "num_input_tokens_seen": 4701206, | |
| "step": 205, | |
| "train_runtime": 608.5378, | |
| "train_tokens_per_second": 7725.414 | |
| }, | |
| { | |
| "epoch": 1.6626262626262627, | |
| "grad_norm": 1.99440336227417, | |
| "learning_rate": 3.5390946502057617e-06, | |
| "loss": 0.2631, | |
| "num_input_tokens_seen": 4724646, | |
| "step": 206, | |
| "train_runtime": 610.695, | |
| "train_tokens_per_second": 7736.507 | |
| }, | |
| { | |
| "epoch": 1.6707070707070706, | |
| "grad_norm": 2.078808307647705, | |
| "learning_rate": 3.4567901234567904e-06, | |
| "loss": 0.2474, | |
| "num_input_tokens_seen": 4748998, | |
| "step": 207, | |
| "train_runtime": 612.9302, | |
| "train_tokens_per_second": 7748.025 | |
| }, | |
| { | |
| "epoch": 1.6787878787878787, | |
| "grad_norm": 2.2216312885284424, | |
| "learning_rate": 3.3744855967078196e-06, | |
| "loss": 0.2523, | |
| "num_input_tokens_seen": 4768294, | |
| "step": 208, | |
| "train_runtime": 614.7311, | |
| "train_tokens_per_second": 7756.715 | |
| }, | |
| { | |
| "epoch": 1.6868686868686869, | |
| "grad_norm": 2.1256401538848877, | |
| "learning_rate": 3.292181069958848e-06, | |
| "loss": 0.2799, | |
| "num_input_tokens_seen": 4792550, | |
| "step": 209, | |
| "train_runtime": 616.9493, | |
| "train_tokens_per_second": 7768.143 | |
| }, | |
| { | |
| "epoch": 1.694949494949495, | |
| "grad_norm": 2.0942769050598145, | |
| "learning_rate": 3.2098765432098767e-06, | |
| "loss": 0.259, | |
| "num_input_tokens_seen": 4816006, | |
| "step": 210, | |
| "train_runtime": 619.088, | |
| "train_tokens_per_second": 7779.194 | |
| }, | |
| { | |
| "epoch": 1.7030303030303031, | |
| "grad_norm": 1.9659632444381714, | |
| "learning_rate": 3.127572016460906e-06, | |
| "loss": 0.271, | |
| "num_input_tokens_seen": 4839222, | |
| "step": 211, | |
| "train_runtime": 639.404, | |
| "train_tokens_per_second": 7568.332 | |
| }, | |
| { | |
| "epoch": 1.7111111111111112, | |
| "grad_norm": 1.9326211214065552, | |
| "learning_rate": 3.0452674897119346e-06, | |
| "loss": 0.2437, | |
| "num_input_tokens_seen": 4862822, | |
| "step": 212, | |
| "train_runtime": 641.5123, | |
| "train_tokens_per_second": 7580.247 | |
| }, | |
| { | |
| "epoch": 1.7191919191919192, | |
| "grad_norm": 2.3900415897369385, | |
| "learning_rate": 2.962962962962963e-06, | |
| "loss": 0.3026, | |
| "num_input_tokens_seen": 4884582, | |
| "step": 213, | |
| "train_runtime": 643.5091, | |
| "train_tokens_per_second": 7590.541 | |
| }, | |
| { | |
| "epoch": 1.7272727272727273, | |
| "grad_norm": 2.0574638843536377, | |
| "learning_rate": 2.880658436213992e-06, | |
| "loss": 0.2525, | |
| "num_input_tokens_seen": 4909174, | |
| "step": 214, | |
| "train_runtime": 645.7213, | |
| "train_tokens_per_second": 7602.62 | |
| }, | |
| { | |
| "epoch": 1.7353535353535352, | |
| "grad_norm": 2.039299726486206, | |
| "learning_rate": 2.798353909465021e-06, | |
| "loss": 0.2637, | |
| "num_input_tokens_seen": 4933798, | |
| "step": 215, | |
| "train_runtime": 647.9549, | |
| "train_tokens_per_second": 7614.416 | |
| }, | |
| { | |
| "epoch": 1.7434343434343433, | |
| "grad_norm": 2.1611974239349365, | |
| "learning_rate": 2.7160493827160496e-06, | |
| "loss": 0.2601, | |
| "num_input_tokens_seen": 4952742, | |
| "step": 216, | |
| "train_runtime": 649.7285, | |
| "train_tokens_per_second": 7622.787 | |
| }, | |
| { | |
| "epoch": 1.7515151515151515, | |
| "grad_norm": 1.8820812702178955, | |
| "learning_rate": 2.6337448559670788e-06, | |
| "loss": 0.2407, | |
| "num_input_tokens_seen": 4976246, | |
| "step": 217, | |
| "train_runtime": 651.852, | |
| "train_tokens_per_second": 7634.012 | |
| }, | |
| { | |
| "epoch": 1.7595959595959596, | |
| "grad_norm": 2.016808271408081, | |
| "learning_rate": 2.551440329218107e-06, | |
| "loss": 0.2237, | |
| "num_input_tokens_seen": 4995798, | |
| "step": 218, | |
| "train_runtime": 653.6727, | |
| "train_tokens_per_second": 7642.66 | |
| }, | |
| { | |
| "epoch": 1.7676767676767677, | |
| "grad_norm": 2.027350902557373, | |
| "learning_rate": 2.469135802469136e-06, | |
| "loss": 0.2408, | |
| "num_input_tokens_seen": 5018838, | |
| "step": 219, | |
| "train_runtime": 655.7795, | |
| "train_tokens_per_second": 7653.241 | |
| }, | |
| { | |
| "epoch": 1.7757575757575759, | |
| "grad_norm": 2.164444923400879, | |
| "learning_rate": 2.3868312757201646e-06, | |
| "loss": 0.2154, | |
| "num_input_tokens_seen": 5041782, | |
| "step": 220, | |
| "train_runtime": 657.8444, | |
| "train_tokens_per_second": 7664.094 | |
| }, | |
| { | |
| "epoch": 1.783838383838384, | |
| "grad_norm": 2.082343339920044, | |
| "learning_rate": 2.3045267489711937e-06, | |
| "loss": 0.2569, | |
| "num_input_tokens_seen": 5063478, | |
| "step": 221, | |
| "train_runtime": 659.8611, | |
| "train_tokens_per_second": 7673.552 | |
| }, | |
| { | |
| "epoch": 1.791919191919192, | |
| "grad_norm": 2.043057680130005, | |
| "learning_rate": 2.222222222222222e-06, | |
| "loss": 0.2536, | |
| "num_input_tokens_seen": 5085526, | |
| "step": 222, | |
| "train_runtime": 661.8702, | |
| "train_tokens_per_second": 7683.57 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 1.9899940490722656, | |
| "learning_rate": 2.1399176954732512e-06, | |
| "loss": 0.2755, | |
| "num_input_tokens_seen": 5109430, | |
| "step": 223, | |
| "train_runtime": 664.0648, | |
| "train_tokens_per_second": 7694.173 | |
| }, | |
| { | |
| "epoch": 1.808080808080808, | |
| "grad_norm": 2.1286203861236572, | |
| "learning_rate": 2.05761316872428e-06, | |
| "loss": 0.2391, | |
| "num_input_tokens_seen": 5132182, | |
| "step": 224, | |
| "train_runtime": 666.1433, | |
| "train_tokens_per_second": 7704.321 | |
| }, | |
| { | |
| "epoch": 1.816161616161616, | |
| "grad_norm": 1.9586842060089111, | |
| "learning_rate": 1.9753086419753087e-06, | |
| "loss": 0.2511, | |
| "num_input_tokens_seen": 5153622, | |
| "step": 225, | |
| "train_runtime": 668.1036, | |
| "train_tokens_per_second": 7713.807 | |
| }, | |
| { | |
| "epoch": 1.816161616161616, | |
| "eval_loss": 0.29719212651252747, | |
| "eval_runtime": 7.0733, | |
| "eval_samples_per_second": 124.27, | |
| "eval_steps_per_second": 7.776, | |
| "num_input_tokens_seen": 5153622, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 1.8242424242424242, | |
| "grad_norm": 2.056194543838501, | |
| "learning_rate": 1.8930041152263375e-06, | |
| "loss": 0.239, | |
| "num_input_tokens_seen": 5178470, | |
| "step": 226, | |
| "train_runtime": 677.4315, | |
| "train_tokens_per_second": 7644.27 | |
| }, | |
| { | |
| "epoch": 1.8323232323232324, | |
| "grad_norm": 2.03861403465271, | |
| "learning_rate": 1.8106995884773665e-06, | |
| "loss": 0.2453, | |
| "num_input_tokens_seen": 5199062, | |
| "step": 227, | |
| "train_runtime": 679.3306, | |
| "train_tokens_per_second": 7653.214 | |
| }, | |
| { | |
| "epoch": 1.8404040404040405, | |
| "grad_norm": 2.454902410507202, | |
| "learning_rate": 1.7283950617283952e-06, | |
| "loss": 0.2815, | |
| "num_input_tokens_seen": 5218134, | |
| "step": 228, | |
| "train_runtime": 681.1112, | |
| "train_tokens_per_second": 7661.207 | |
| }, | |
| { | |
| "epoch": 1.8484848484848486, | |
| "grad_norm": 2.0664114952087402, | |
| "learning_rate": 1.646090534979424e-06, | |
| "loss": 0.2481, | |
| "num_input_tokens_seen": 5242054, | |
| "step": 229, | |
| "train_runtime": 683.2902, | |
| "train_tokens_per_second": 7671.783 | |
| }, | |
| { | |
| "epoch": 1.8565656565656565, | |
| "grad_norm": 2.1586387157440186, | |
| "learning_rate": 1.563786008230453e-06, | |
| "loss": 0.2255, | |
| "num_input_tokens_seen": 5264518, | |
| "step": 230, | |
| "train_runtime": 685.3446, | |
| "train_tokens_per_second": 7681.564 | |
| }, | |
| { | |
| "epoch": 1.8646464646464647, | |
| "grad_norm": 2.2115135192871094, | |
| "learning_rate": 1.4814814814814815e-06, | |
| "loss": 0.2941, | |
| "num_input_tokens_seen": 5284374, | |
| "step": 231, | |
| "train_runtime": 687.1947, | |
| "train_tokens_per_second": 7689.777 | |
| }, | |
| { | |
| "epoch": 1.8727272727272726, | |
| "grad_norm": 1.9213886260986328, | |
| "learning_rate": 1.3991769547325104e-06, | |
| "loss": 0.2309, | |
| "num_input_tokens_seen": 5303622, | |
| "step": 232, | |
| "train_runtime": 688.9977, | |
| "train_tokens_per_second": 7697.591 | |
| }, | |
| { | |
| "epoch": 1.8808080808080807, | |
| "grad_norm": 1.919615387916565, | |
| "learning_rate": 1.3168724279835394e-06, | |
| "loss": 0.2332, | |
| "num_input_tokens_seen": 5329718, | |
| "step": 233, | |
| "train_runtime": 691.3575, | |
| "train_tokens_per_second": 7709.062 | |
| }, | |
| { | |
| "epoch": 1.8888888888888888, | |
| "grad_norm": 1.9546780586242676, | |
| "learning_rate": 1.234567901234568e-06, | |
| "loss": 0.2468, | |
| "num_input_tokens_seen": 5349718, | |
| "step": 234, | |
| "train_runtime": 693.227, | |
| "train_tokens_per_second": 7717.123 | |
| }, | |
| { | |
| "epoch": 1.896969696969697, | |
| "grad_norm": 2.1279263496398926, | |
| "learning_rate": 1.1522633744855969e-06, | |
| "loss": 0.2711, | |
| "num_input_tokens_seen": 5369638, | |
| "step": 235, | |
| "train_runtime": 695.0864, | |
| "train_tokens_per_second": 7725.137 | |
| }, | |
| { | |
| "epoch": 1.905050505050505, | |
| "grad_norm": 2.0568149089813232, | |
| "learning_rate": 1.0699588477366256e-06, | |
| "loss": 0.262, | |
| "num_input_tokens_seen": 5392726, | |
| "step": 236, | |
| "train_runtime": 697.1851, | |
| "train_tokens_per_second": 7734.999 | |
| }, | |
| { | |
| "epoch": 1.9131313131313132, | |
| "grad_norm": 2.307243824005127, | |
| "learning_rate": 9.876543209876544e-07, | |
| "loss": 0.2773, | |
| "num_input_tokens_seen": 5412470, | |
| "step": 237, | |
| "train_runtime": 699.0602, | |
| "train_tokens_per_second": 7742.495 | |
| }, | |
| { | |
| "epoch": 1.9212121212121214, | |
| "grad_norm": 2.0928726196289062, | |
| "learning_rate": 9.053497942386832e-07, | |
| "loss": 0.2715, | |
| "num_input_tokens_seen": 5437894, | |
| "step": 238, | |
| "train_runtime": 701.3562, | |
| "train_tokens_per_second": 7753.398 | |
| }, | |
| { | |
| "epoch": 1.9292929292929293, | |
| "grad_norm": 2.1170663833618164, | |
| "learning_rate": 8.23045267489712e-07, | |
| "loss": 0.2814, | |
| "num_input_tokens_seen": 5461686, | |
| "step": 239, | |
| "train_runtime": 703.5235, | |
| "train_tokens_per_second": 7763.331 | |
| }, | |
| { | |
| "epoch": 1.9373737373737374, | |
| "grad_norm": 1.9261893033981323, | |
| "learning_rate": 7.407407407407407e-07, | |
| "loss": 0.2426, | |
| "num_input_tokens_seen": 5486054, | |
| "step": 240, | |
| "train_runtime": 705.7339, | |
| "train_tokens_per_second": 7773.545 | |
| }, | |
| { | |
| "epoch": 1.9454545454545453, | |
| "grad_norm": 2.053776741027832, | |
| "learning_rate": 6.584362139917697e-07, | |
| "loss": 0.2712, | |
| "num_input_tokens_seen": 5509142, | |
| "step": 241, | |
| "train_runtime": 726.1192, | |
| "train_tokens_per_second": 7587.104 | |
| }, | |
| { | |
| "epoch": 1.9535353535353535, | |
| "grad_norm": 1.9918407201766968, | |
| "learning_rate": 5.761316872427984e-07, | |
| "loss": 0.2019, | |
| "num_input_tokens_seen": 5528598, | |
| "step": 242, | |
| "train_runtime": 727.9519, | |
| "train_tokens_per_second": 7594.73 | |
| }, | |
| { | |
| "epoch": 1.9616161616161616, | |
| "grad_norm": 1.8533083200454712, | |
| "learning_rate": 4.938271604938272e-07, | |
| "loss": 0.2358, | |
| "num_input_tokens_seen": 5551926, | |
| "step": 243, | |
| "train_runtime": 730.0608, | |
| "train_tokens_per_second": 7604.744 | |
| }, | |
| { | |
| "epoch": 1.9696969696969697, | |
| "grad_norm": 1.9955955743789673, | |
| "learning_rate": 4.11522633744856e-07, | |
| "loss": 0.2237, | |
| "num_input_tokens_seen": 5574326, | |
| "step": 244, | |
| "train_runtime": 732.1133, | |
| "train_tokens_per_second": 7614.021 | |
| }, | |
| { | |
| "epoch": 1.9777777777777779, | |
| "grad_norm": 2.0239830017089844, | |
| "learning_rate": 3.2921810699588484e-07, | |
| "loss": 0.2742, | |
| "num_input_tokens_seen": 5598310, | |
| "step": 245, | |
| "train_runtime": 734.2562, | |
| "train_tokens_per_second": 7624.464 | |
| }, | |
| { | |
| "epoch": 1.985858585858586, | |
| "grad_norm": 2.1352379322052, | |
| "learning_rate": 2.469135802469136e-07, | |
| "loss": 0.2701, | |
| "num_input_tokens_seen": 5620534, | |
| "step": 246, | |
| "train_runtime": 736.283, | |
| "train_tokens_per_second": 7633.66 | |
| }, | |
| { | |
| "epoch": 1.993939393939394, | |
| "grad_norm": 2.292893171310425, | |
| "learning_rate": 1.6460905349794242e-07, | |
| "loss": 0.2626, | |
| "num_input_tokens_seen": 5640982, | |
| "step": 247, | |
| "train_runtime": 738.169, | |
| "train_tokens_per_second": 7641.857 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 2.7160730361938477, | |
| "learning_rate": 8.230452674897121e-08, | |
| "loss": 0.2577, | |
| "num_input_tokens_seen": 5653442, | |
| "step": 248, | |
| "train_runtime": 739.3962, | |
| "train_tokens_per_second": 7646.025 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 248, | |
| "num_input_tokens_seen": 5653442, | |
| "num_train_epochs": 2, | |
| "save_steps": 30, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 9.412213509169152e+16, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |