Instructions to use FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("unsloth/Qwen2.5-7B-Instruct") model = PeftModel.from_pretrained(base_model, "FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth") - Transformers
How to use FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth
- SGLang
How to use FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Unsloth Studio
How to use FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth", max_seq_length=2048, ) - Docker Model Runner
How to use FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth with Docker Model Runner:
docker model run hf.co/FormlessAI/Qwen2.5-7B-Instruct-Math-Unsloth
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.0, | |
| "eval_steps": 25, | |
| "global_step": 248, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.00808080808080808, | |
| "grad_norm": 0.9913852214813232, | |
| "learning_rate": 0.0, | |
| "loss": 1.3233, | |
| "num_input_tokens_seen": 24048, | |
| "step": 1, | |
| "train_runtime": 5.5427, | |
| "train_tokens_per_second": 4338.668 | |
| }, | |
| { | |
| "epoch": 0.01616161616161616, | |
| "grad_norm": 1.0378535985946655, | |
| "learning_rate": 4e-05, | |
| "loss": 1.3425, | |
| "num_input_tokens_seen": 48096, | |
| "step": 2, | |
| "train_runtime": 8.8764, | |
| "train_tokens_per_second": 5418.441 | |
| }, | |
| { | |
| "epoch": 0.024242424242424242, | |
| "grad_norm": 1.0206665992736816, | |
| "learning_rate": 8e-05, | |
| "loss": 1.3516, | |
| "num_input_tokens_seen": 68416, | |
| "step": 3, | |
| "train_runtime": 11.7535, | |
| "train_tokens_per_second": 5820.919 | |
| }, | |
| { | |
| "epoch": 0.03232323232323232, | |
| "grad_norm": 1.2065541744232178, | |
| "learning_rate": 0.00012, | |
| "loss": 1.3039, | |
| "num_input_tokens_seen": 90432, | |
| "step": 4, | |
| "train_runtime": 14.8511, | |
| "train_tokens_per_second": 6089.231 | |
| }, | |
| { | |
| "epoch": 0.04040404040404041, | |
| "grad_norm": 1.3231337070465088, | |
| "learning_rate": 0.00016, | |
| "loss": 1.0488, | |
| "num_input_tokens_seen": 110544, | |
| "step": 5, | |
| "train_runtime": 17.7213, | |
| "train_tokens_per_second": 6237.921 | |
| }, | |
| { | |
| "epoch": 0.048484848484848485, | |
| "grad_norm": 0.7355687022209167, | |
| "learning_rate": 0.0002, | |
| "loss": 0.649, | |
| "num_input_tokens_seen": 135584, | |
| "step": 6, | |
| "train_runtime": 21.4984, | |
| "train_tokens_per_second": 6306.704 | |
| }, | |
| { | |
| "epoch": 0.05656565656565657, | |
| "grad_norm": 0.7402859926223755, | |
| "learning_rate": 0.0001991769547325103, | |
| "loss": 0.4857, | |
| "num_input_tokens_seen": 159200, | |
| "step": 7, | |
| "train_runtime": 24.8086, | |
| "train_tokens_per_second": 6417.137 | |
| }, | |
| { | |
| "epoch": 0.06464646464646465, | |
| "grad_norm": 0.5103421807289124, | |
| "learning_rate": 0.0001983539094650206, | |
| "loss": 0.371, | |
| "num_input_tokens_seen": 182224, | |
| "step": 8, | |
| "train_runtime": 28.0753, | |
| "train_tokens_per_second": 6490.548 | |
| }, | |
| { | |
| "epoch": 0.07272727272727272, | |
| "grad_norm": 0.3125229477882385, | |
| "learning_rate": 0.00019753086419753085, | |
| "loss": 0.3324, | |
| "num_input_tokens_seen": 205472, | |
| "step": 9, | |
| "train_runtime": 31.3551, | |
| "train_tokens_per_second": 6553.073 | |
| }, | |
| { | |
| "epoch": 0.08080808080808081, | |
| "grad_norm": 0.33310967683792114, | |
| "learning_rate": 0.00019670781893004114, | |
| "loss": 0.2862, | |
| "num_input_tokens_seen": 230400, | |
| "step": 10, | |
| "train_runtime": 34.8863, | |
| "train_tokens_per_second": 6604.316 | |
| }, | |
| { | |
| "epoch": 0.08888888888888889, | |
| "grad_norm": 0.33717748522758484, | |
| "learning_rate": 0.00019588477366255146, | |
| "loss": 0.2973, | |
| "num_input_tokens_seen": 252736, | |
| "step": 11, | |
| "train_runtime": 38.0785, | |
| "train_tokens_per_second": 6637.239 | |
| }, | |
| { | |
| "epoch": 0.09696969696969697, | |
| "grad_norm": 0.383858859539032, | |
| "learning_rate": 0.00019506172839506175, | |
| "loss": 0.2761, | |
| "num_input_tokens_seen": 273584, | |
| "step": 12, | |
| "train_runtime": 41.108, | |
| "train_tokens_per_second": 6655.248 | |
| }, | |
| { | |
| "epoch": 0.10505050505050505, | |
| "grad_norm": 0.33506128191947937, | |
| "learning_rate": 0.00019423868312757204, | |
| "loss": 0.3092, | |
| "num_input_tokens_seen": 299968, | |
| "step": 13, | |
| "train_runtime": 44.8301, | |
| "train_tokens_per_second": 6691.217 | |
| }, | |
| { | |
| "epoch": 0.11313131313131314, | |
| "grad_norm": 0.25691795349121094, | |
| "learning_rate": 0.00019341563786008233, | |
| "loss": 0.2943, | |
| "num_input_tokens_seen": 322480, | |
| "step": 14, | |
| "train_runtime": 48.0773, | |
| "train_tokens_per_second": 6707.535 | |
| }, | |
| { | |
| "epoch": 0.12121212121212122, | |
| "grad_norm": 0.23056800663471222, | |
| "learning_rate": 0.0001925925925925926, | |
| "loss": 0.2575, | |
| "num_input_tokens_seen": 344864, | |
| "step": 15, | |
| "train_runtime": 51.2647, | |
| "train_tokens_per_second": 6727.124 | |
| }, | |
| { | |
| "epoch": 0.1292929292929293, | |
| "grad_norm": 0.2146308422088623, | |
| "learning_rate": 0.00019176954732510288, | |
| "loss": 0.2441, | |
| "num_input_tokens_seen": 369296, | |
| "step": 16, | |
| "train_runtime": 54.7643, | |
| "train_tokens_per_second": 6743.376 | |
| }, | |
| { | |
| "epoch": 0.13737373737373737, | |
| "grad_norm": 0.18066899478435516, | |
| "learning_rate": 0.00019094650205761317, | |
| "loss": 0.2686, | |
| "num_input_tokens_seen": 390944, | |
| "step": 17, | |
| "train_runtime": 57.902, | |
| "train_tokens_per_second": 6751.823 | |
| }, | |
| { | |
| "epoch": 0.14545454545454545, | |
| "grad_norm": 0.18266606330871582, | |
| "learning_rate": 0.00019012345679012346, | |
| "loss": 0.2484, | |
| "num_input_tokens_seen": 414144, | |
| "step": 18, | |
| "train_runtime": 61.2046, | |
| "train_tokens_per_second": 6766.553 | |
| }, | |
| { | |
| "epoch": 0.15353535353535352, | |
| "grad_norm": 0.18596097826957703, | |
| "learning_rate": 0.00018930041152263375, | |
| "loss": 0.2215, | |
| "num_input_tokens_seen": 435840, | |
| "step": 19, | |
| "train_runtime": 64.3043, | |
| "train_tokens_per_second": 6777.778 | |
| }, | |
| { | |
| "epoch": 0.16161616161616163, | |
| "grad_norm": 0.19186538457870483, | |
| "learning_rate": 0.00018847736625514404, | |
| "loss": 0.2181, | |
| "num_input_tokens_seen": 459808, | |
| "step": 20, | |
| "train_runtime": 67.7619, | |
| "train_tokens_per_second": 6785.644 | |
| }, | |
| { | |
| "epoch": 0.1696969696969697, | |
| "grad_norm": 0.1703331023454666, | |
| "learning_rate": 0.00018765432098765433, | |
| "loss": 0.2441, | |
| "num_input_tokens_seen": 479504, | |
| "step": 21, | |
| "train_runtime": 70.6513, | |
| "train_tokens_per_second": 6786.914 | |
| }, | |
| { | |
| "epoch": 0.17777777777777778, | |
| "grad_norm": 0.17710761725902557, | |
| "learning_rate": 0.00018683127572016462, | |
| "loss": 0.2475, | |
| "num_input_tokens_seen": 505712, | |
| "step": 22, | |
| "train_runtime": 74.4032, | |
| "train_tokens_per_second": 6796.911 | |
| }, | |
| { | |
| "epoch": 0.18585858585858586, | |
| "grad_norm": 0.18230487406253815, | |
| "learning_rate": 0.0001860082304526749, | |
| "loss": 0.2586, | |
| "num_input_tokens_seen": 525456, | |
| "step": 23, | |
| "train_runtime": 77.2642, | |
| "train_tokens_per_second": 6800.768 | |
| }, | |
| { | |
| "epoch": 0.19393939393939394, | |
| "grad_norm": 0.16953755915164948, | |
| "learning_rate": 0.0001851851851851852, | |
| "loss": 0.2548, | |
| "num_input_tokens_seen": 548928, | |
| "step": 24, | |
| "train_runtime": 80.6542, | |
| "train_tokens_per_second": 6805.941 | |
| }, | |
| { | |
| "epoch": 0.20202020202020202, | |
| "grad_norm": 0.1729792058467865, | |
| "learning_rate": 0.0001843621399176955, | |
| "loss": 0.221, | |
| "num_input_tokens_seen": 568608, | |
| "step": 25, | |
| "train_runtime": 83.58, | |
| "train_tokens_per_second": 6803.16 | |
| }, | |
| { | |
| "epoch": 0.20202020202020202, | |
| "eval_loss": 0.2138330042362213, | |
| "eval_runtime": 15.9812, | |
| "eval_samples_per_second": 55.002, | |
| "eval_steps_per_second": 3.442, | |
| "num_input_tokens_seen": 568608, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.2101010101010101, | |
| "grad_norm": 0.1425217092037201, | |
| "learning_rate": 0.00018353909465020578, | |
| "loss": 0.2036, | |
| "num_input_tokens_seen": 592240, | |
| "step": 26, | |
| "train_runtime": 103.0213, | |
| "train_tokens_per_second": 5748.712 | |
| }, | |
| { | |
| "epoch": 0.21818181818181817, | |
| "grad_norm": 0.1629820615053177, | |
| "learning_rate": 0.00018271604938271605, | |
| "loss": 0.1973, | |
| "num_input_tokens_seen": 613168, | |
| "step": 27, | |
| "train_runtime": 106.1403, | |
| "train_tokens_per_second": 5776.96 | |
| }, | |
| { | |
| "epoch": 0.22626262626262628, | |
| "grad_norm": 0.13308098912239075, | |
| "learning_rate": 0.00018189300411522634, | |
| "loss": 0.2178, | |
| "num_input_tokens_seen": 637552, | |
| "step": 28, | |
| "train_runtime": 109.6485, | |
| "train_tokens_per_second": 5814.508 | |
| }, | |
| { | |
| "epoch": 0.23434343434343435, | |
| "grad_norm": 0.13057714700698853, | |
| "learning_rate": 0.00018106995884773663, | |
| "loss": 0.2244, | |
| "num_input_tokens_seen": 661184, | |
| "step": 29, | |
| "train_runtime": 113.0702, | |
| "train_tokens_per_second": 5847.551 | |
| }, | |
| { | |
| "epoch": 0.24242424242424243, | |
| "grad_norm": 0.15625949203968048, | |
| "learning_rate": 0.00018024691358024692, | |
| "loss": 0.2448, | |
| "num_input_tokens_seen": 683072, | |
| "step": 30, | |
| "train_runtime": 116.2536, | |
| "train_tokens_per_second": 5875.704 | |
| }, | |
| { | |
| "epoch": 0.2505050505050505, | |
| "grad_norm": 0.1479414701461792, | |
| "learning_rate": 0.0001794238683127572, | |
| "loss": 0.2132, | |
| "num_input_tokens_seen": 703776, | |
| "step": 31, | |
| "train_runtime": 119.8681, | |
| "train_tokens_per_second": 5871.251 | |
| }, | |
| { | |
| "epoch": 0.2585858585858586, | |
| "grad_norm": 0.12871505320072174, | |
| "learning_rate": 0.0001786008230452675, | |
| "loss": 0.2193, | |
| "num_input_tokens_seen": 729584, | |
| "step": 32, | |
| "train_runtime": 123.5834, | |
| "train_tokens_per_second": 5903.574 | |
| }, | |
| { | |
| "epoch": 0.26666666666666666, | |
| "grad_norm": 0.13625787198543549, | |
| "learning_rate": 0.00017777777777777779, | |
| "loss": 0.2572, | |
| "num_input_tokens_seen": 752672, | |
| "step": 33, | |
| "train_runtime": 126.9484, | |
| "train_tokens_per_second": 5928.961 | |
| }, | |
| { | |
| "epoch": 0.27474747474747474, | |
| "grad_norm": 0.13514648377895355, | |
| "learning_rate": 0.00017695473251028808, | |
| "loss": 0.1983, | |
| "num_input_tokens_seen": 776672, | |
| "step": 34, | |
| "train_runtime": 130.4118, | |
| "train_tokens_per_second": 5955.537 | |
| }, | |
| { | |
| "epoch": 0.2828282828282828, | |
| "grad_norm": 0.13971051573753357, | |
| "learning_rate": 0.00017613168724279837, | |
| "loss": 0.2283, | |
| "num_input_tokens_seen": 801296, | |
| "step": 35, | |
| "train_runtime": 133.967, | |
| "train_tokens_per_second": 5981.294 | |
| }, | |
| { | |
| "epoch": 0.2909090909090909, | |
| "grad_norm": 0.1429297775030136, | |
| "learning_rate": 0.00017530864197530866, | |
| "loss": 0.199, | |
| "num_input_tokens_seen": 822368, | |
| "step": 36, | |
| "train_runtime": 137.0476, | |
| "train_tokens_per_second": 6000.599 | |
| }, | |
| { | |
| "epoch": 0.298989898989899, | |
| "grad_norm": 0.13625267148017883, | |
| "learning_rate": 0.00017448559670781895, | |
| "loss": 0.1851, | |
| "num_input_tokens_seen": 848928, | |
| "step": 37, | |
| "train_runtime": 140.8511, | |
| "train_tokens_per_second": 6027.132 | |
| }, | |
| { | |
| "epoch": 0.30707070707070705, | |
| "grad_norm": 0.13639648258686066, | |
| "learning_rate": 0.00017366255144032924, | |
| "loss": 0.1784, | |
| "num_input_tokens_seen": 870672, | |
| "step": 38, | |
| "train_runtime": 143.9915, | |
| "train_tokens_per_second": 6046.692 | |
| }, | |
| { | |
| "epoch": 0.3151515151515151, | |
| "grad_norm": 0.15709735453128815, | |
| "learning_rate": 0.0001728395061728395, | |
| "loss": 0.2379, | |
| "num_input_tokens_seen": 892064, | |
| "step": 39, | |
| "train_runtime": 147.1192, | |
| "train_tokens_per_second": 6063.547 | |
| }, | |
| { | |
| "epoch": 0.32323232323232326, | |
| "grad_norm": 0.13749410212039948, | |
| "learning_rate": 0.0001720164609053498, | |
| "loss": 0.2086, | |
| "num_input_tokens_seen": 915680, | |
| "step": 40, | |
| "train_runtime": 150.5405, | |
| "train_tokens_per_second": 6082.617 | |
| }, | |
| { | |
| "epoch": 0.33131313131313134, | |
| "grad_norm": 0.15497097373008728, | |
| "learning_rate": 0.00017119341563786008, | |
| "loss": 0.2155, | |
| "num_input_tokens_seen": 935216, | |
| "step": 41, | |
| "train_runtime": 153.3826, | |
| "train_tokens_per_second": 6097.277 | |
| }, | |
| { | |
| "epoch": 0.3393939393939394, | |
| "grad_norm": 0.14246957004070282, | |
| "learning_rate": 0.00017037037037037037, | |
| "loss": 0.1926, | |
| "num_input_tokens_seen": 956864, | |
| "step": 42, | |
| "train_runtime": 156.5384, | |
| "train_tokens_per_second": 6112.648 | |
| }, | |
| { | |
| "epoch": 0.3474747474747475, | |
| "grad_norm": 0.1377769261598587, | |
| "learning_rate": 0.00016954732510288066, | |
| "loss": 0.2117, | |
| "num_input_tokens_seen": 981440, | |
| "step": 43, | |
| "train_runtime": 160.0454, | |
| "train_tokens_per_second": 6132.259 | |
| }, | |
| { | |
| "epoch": 0.35555555555555557, | |
| "grad_norm": 0.1453401744365692, | |
| "learning_rate": 0.00016872427983539098, | |
| "loss": 0.1787, | |
| "num_input_tokens_seen": 1001232, | |
| "step": 44, | |
| "train_runtime": 162.9716, | |
| "train_tokens_per_second": 6143.599 | |
| }, | |
| { | |
| "epoch": 0.36363636363636365, | |
| "grad_norm": 0.13512200117111206, | |
| "learning_rate": 0.00016790123456790124, | |
| "loss": 0.1778, | |
| "num_input_tokens_seen": 1027680, | |
| "step": 45, | |
| "train_runtime": 166.7953, | |
| "train_tokens_per_second": 6161.325 | |
| }, | |
| { | |
| "epoch": 0.3717171717171717, | |
| "grad_norm": 0.14032725989818573, | |
| "learning_rate": 0.00016707818930041153, | |
| "loss": 0.2622, | |
| "num_input_tokens_seen": 1049968, | |
| "step": 46, | |
| "train_runtime": 170.0243, | |
| "train_tokens_per_second": 6175.401 | |
| }, | |
| { | |
| "epoch": 0.3797979797979798, | |
| "grad_norm": 0.13695235550403595, | |
| "learning_rate": 0.00016625514403292182, | |
| "loss": 0.2172, | |
| "num_input_tokens_seen": 1071840, | |
| "step": 47, | |
| "train_runtime": 173.2045, | |
| "train_tokens_per_second": 6188.291 | |
| }, | |
| { | |
| "epoch": 0.3878787878787879, | |
| "grad_norm": 0.14571040868759155, | |
| "learning_rate": 0.0001654320987654321, | |
| "loss": 0.1682, | |
| "num_input_tokens_seen": 1092864, | |
| "step": 48, | |
| "train_runtime": 176.2872, | |
| "train_tokens_per_second": 6199.339 | |
| }, | |
| { | |
| "epoch": 0.39595959595959596, | |
| "grad_norm": 0.13497225940227509, | |
| "learning_rate": 0.0001646090534979424, | |
| "loss": 0.2167, | |
| "num_input_tokens_seen": 1117040, | |
| "step": 49, | |
| "train_runtime": 179.7447, | |
| "train_tokens_per_second": 6214.592 | |
| }, | |
| { | |
| "epoch": 0.40404040404040403, | |
| "grad_norm": 0.13479158282279968, | |
| "learning_rate": 0.0001637860082304527, | |
| "loss": 0.2188, | |
| "num_input_tokens_seen": 1140240, | |
| "step": 50, | |
| "train_runtime": 183.112, | |
| "train_tokens_per_second": 6227.007 | |
| }, | |
| { | |
| "epoch": 0.40404040404040403, | |
| "eval_loss": 0.19270148873329163, | |
| "eval_runtime": 15.9678, | |
| "eval_samples_per_second": 55.048, | |
| "eval_steps_per_second": 3.444, | |
| "num_input_tokens_seen": 1140240, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.4121212121212121, | |
| "grad_norm": 0.14810238778591156, | |
| "learning_rate": 0.00016296296296296295, | |
| "loss": 0.1908, | |
| "num_input_tokens_seen": 1161104, | |
| "step": 51, | |
| "train_runtime": 202.1269, | |
| "train_tokens_per_second": 5744.431 | |
| }, | |
| { | |
| "epoch": 0.4202020202020202, | |
| "grad_norm": 0.12631717324256897, | |
| "learning_rate": 0.00016213991769547324, | |
| "loss": 0.2194, | |
| "num_input_tokens_seen": 1189328, | |
| "step": 52, | |
| "train_runtime": 206.1876, | |
| "train_tokens_per_second": 5768.183 | |
| }, | |
| { | |
| "epoch": 0.42828282828282827, | |
| "grad_norm": 0.12934885919094086, | |
| "learning_rate": 0.00016131687242798353, | |
| "loss": 0.1682, | |
| "num_input_tokens_seen": 1211120, | |
| "step": 53, | |
| "train_runtime": 209.3667, | |
| "train_tokens_per_second": 5784.684 | |
| }, | |
| { | |
| "epoch": 0.43636363636363634, | |
| "grad_norm": 0.1369091421365738, | |
| "learning_rate": 0.00016049382716049385, | |
| "loss": 0.1882, | |
| "num_input_tokens_seen": 1234080, | |
| "step": 54, | |
| "train_runtime": 212.7157, | |
| "train_tokens_per_second": 5801.546 | |
| }, | |
| { | |
| "epoch": 0.4444444444444444, | |
| "grad_norm": 0.14891834557056427, | |
| "learning_rate": 0.00015967078189300414, | |
| "loss": 0.1898, | |
| "num_input_tokens_seen": 1256880, | |
| "step": 55, | |
| "train_runtime": 216.0146, | |
| "train_tokens_per_second": 5818.495 | |
| }, | |
| { | |
| "epoch": 0.45252525252525255, | |
| "grad_norm": 0.15192829072475433, | |
| "learning_rate": 0.00015884773662551443, | |
| "loss": 0.2452, | |
| "num_input_tokens_seen": 1281376, | |
| "step": 56, | |
| "train_runtime": 219.5282, | |
| "train_tokens_per_second": 5836.954 | |
| }, | |
| { | |
| "epoch": 0.46060606060606063, | |
| "grad_norm": 0.13381753861904144, | |
| "learning_rate": 0.0001580246913580247, | |
| "loss": 0.1983, | |
| "num_input_tokens_seen": 1309216, | |
| "step": 57, | |
| "train_runtime": 223.5427, | |
| "train_tokens_per_second": 5856.67 | |
| }, | |
| { | |
| "epoch": 0.4686868686868687, | |
| "grad_norm": 0.14824049174785614, | |
| "learning_rate": 0.00015720164609053498, | |
| "loss": 0.2358, | |
| "num_input_tokens_seen": 1331120, | |
| "step": 58, | |
| "train_runtime": 226.7435, | |
| "train_tokens_per_second": 5870.599 | |
| }, | |
| { | |
| "epoch": 0.4767676767676768, | |
| "grad_norm": 0.15301313996315002, | |
| "learning_rate": 0.00015637860082304527, | |
| "loss": 0.1871, | |
| "num_input_tokens_seen": 1354976, | |
| "step": 59, | |
| "train_runtime": 230.1754, | |
| "train_tokens_per_second": 5886.711 | |
| }, | |
| { | |
| "epoch": 0.48484848484848486, | |
| "grad_norm": 0.1360855996608734, | |
| "learning_rate": 0.00015555555555555556, | |
| "loss": 0.2078, | |
| "num_input_tokens_seen": 1376976, | |
| "step": 60, | |
| "train_runtime": 233.3715, | |
| "train_tokens_per_second": 5900.36 | |
| }, | |
| { | |
| "epoch": 0.49292929292929294, | |
| "grad_norm": 0.1479628086090088, | |
| "learning_rate": 0.00015473251028806585, | |
| "loss": 0.2039, | |
| "num_input_tokens_seen": 1397952, | |
| "step": 61, | |
| "train_runtime": 236.9762, | |
| "train_tokens_per_second": 5899.125 | |
| }, | |
| { | |
| "epoch": 0.501010101010101, | |
| "grad_norm": 0.13906534016132355, | |
| "learning_rate": 0.00015390946502057614, | |
| "loss": 0.1926, | |
| "num_input_tokens_seen": 1417712, | |
| "step": 62, | |
| "train_runtime": 239.842, | |
| "train_tokens_per_second": 5911.024 | |
| }, | |
| { | |
| "epoch": 0.509090909090909, | |
| "grad_norm": 0.1498580425977707, | |
| "learning_rate": 0.0001530864197530864, | |
| "loss": 0.1674, | |
| "num_input_tokens_seen": 1438544, | |
| "step": 63, | |
| "train_runtime": 242.9024, | |
| "train_tokens_per_second": 5922.312 | |
| }, | |
| { | |
| "epoch": 0.5171717171717172, | |
| "grad_norm": 0.13896457850933075, | |
| "learning_rate": 0.00015226337448559672, | |
| "loss": 0.1779, | |
| "num_input_tokens_seen": 1461776, | |
| "step": 64, | |
| "train_runtime": 246.286, | |
| "train_tokens_per_second": 5935.278 | |
| }, | |
| { | |
| "epoch": 0.5252525252525253, | |
| "grad_norm": 0.15526247024536133, | |
| "learning_rate": 0.000151440329218107, | |
| "loss": 0.2209, | |
| "num_input_tokens_seen": 1483600, | |
| "step": 65, | |
| "train_runtime": 249.4086, | |
| "train_tokens_per_second": 5948.472 | |
| }, | |
| { | |
| "epoch": 0.5333333333333333, | |
| "grad_norm": 0.15172874927520752, | |
| "learning_rate": 0.0001506172839506173, | |
| "loss": 0.1939, | |
| "num_input_tokens_seen": 1507280, | |
| "step": 66, | |
| "train_runtime": 252.8239, | |
| "train_tokens_per_second": 5961.777 | |
| }, | |
| { | |
| "epoch": 0.5414141414141415, | |
| "grad_norm": 0.15608155727386475, | |
| "learning_rate": 0.0001497942386831276, | |
| "loss": 0.2115, | |
| "num_input_tokens_seen": 1530176, | |
| "step": 67, | |
| "train_runtime": 256.1302, | |
| "train_tokens_per_second": 5974.211 | |
| }, | |
| { | |
| "epoch": 0.5494949494949495, | |
| "grad_norm": 0.13221146166324615, | |
| "learning_rate": 0.00014897119341563788, | |
| "loss": 0.1864, | |
| "num_input_tokens_seen": 1553520, | |
| "step": 68, | |
| "train_runtime": 259.5354, | |
| "train_tokens_per_second": 5985.772 | |
| }, | |
| { | |
| "epoch": 0.5575757575757576, | |
| "grad_norm": 0.13630913197994232, | |
| "learning_rate": 0.00014814814814814815, | |
| "loss": 0.1888, | |
| "num_input_tokens_seen": 1577728, | |
| "step": 69, | |
| "train_runtime": 263.0794, | |
| "train_tokens_per_second": 5997.155 | |
| }, | |
| { | |
| "epoch": 0.5656565656565656, | |
| "grad_norm": 0.1588101089000702, | |
| "learning_rate": 0.00014732510288065844, | |
| "loss": 0.1622, | |
| "num_input_tokens_seen": 1598448, | |
| "step": 70, | |
| "train_runtime": 266.1041, | |
| "train_tokens_per_second": 6006.852 | |
| }, | |
| { | |
| "epoch": 0.5737373737373738, | |
| "grad_norm": 0.1479269117116928, | |
| "learning_rate": 0.00014650205761316873, | |
| "loss": 0.1665, | |
| "num_input_tokens_seen": 1619616, | |
| "step": 71, | |
| "train_runtime": 269.2171, | |
| "train_tokens_per_second": 6016.021 | |
| }, | |
| { | |
| "epoch": 0.5818181818181818, | |
| "grad_norm": 0.1633758842945099, | |
| "learning_rate": 0.00014567901234567902, | |
| "loss": 0.2066, | |
| "num_input_tokens_seen": 1647504, | |
| "step": 72, | |
| "train_runtime": 273.2086, | |
| "train_tokens_per_second": 6030.206 | |
| }, | |
| { | |
| "epoch": 0.5898989898989899, | |
| "grad_norm": 0.1569192260503769, | |
| "learning_rate": 0.0001448559670781893, | |
| "loss": 0.2209, | |
| "num_input_tokens_seen": 1669600, | |
| "step": 73, | |
| "train_runtime": 276.4483, | |
| "train_tokens_per_second": 6039.465 | |
| }, | |
| { | |
| "epoch": 0.597979797979798, | |
| "grad_norm": 0.15907315909862518, | |
| "learning_rate": 0.0001440329218106996, | |
| "loss": 0.203, | |
| "num_input_tokens_seen": 1692464, | |
| "step": 74, | |
| "train_runtime": 279.7549, | |
| "train_tokens_per_second": 6049.811 | |
| }, | |
| { | |
| "epoch": 0.6060606060606061, | |
| "grad_norm": 0.15339483320713043, | |
| "learning_rate": 0.00014320987654320989, | |
| "loss": 0.1902, | |
| "num_input_tokens_seen": 1714544, | |
| "step": 75, | |
| "train_runtime": 282.9625, | |
| "train_tokens_per_second": 6059.263 | |
| }, | |
| { | |
| "epoch": 0.6060606060606061, | |
| "eval_loss": 0.18341881036758423, | |
| "eval_runtime": 15.9903, | |
| "eval_samples_per_second": 54.971, | |
| "eval_steps_per_second": 3.44, | |
| "num_input_tokens_seen": 1714544, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.6141414141414141, | |
| "grad_norm": 0.1519935429096222, | |
| "learning_rate": 0.00014238683127572018, | |
| "loss": 0.1774, | |
| "num_input_tokens_seen": 1734992, | |
| "step": 76, | |
| "train_runtime": 301.9584, | |
| "train_tokens_per_second": 5745.799 | |
| }, | |
| { | |
| "epoch": 0.6222222222222222, | |
| "grad_norm": 0.1523190289735794, | |
| "learning_rate": 0.00014156378600823047, | |
| "loss": 0.188, | |
| "num_input_tokens_seen": 1758528, | |
| "step": 77, | |
| "train_runtime": 305.3612, | |
| "train_tokens_per_second": 5758.846 | |
| }, | |
| { | |
| "epoch": 0.6303030303030303, | |
| "grad_norm": 0.16023258864879608, | |
| "learning_rate": 0.00014074074074074076, | |
| "loss": 0.2015, | |
| "num_input_tokens_seen": 1782768, | |
| "step": 78, | |
| "train_runtime": 308.8338, | |
| "train_tokens_per_second": 5772.58 | |
| }, | |
| { | |
| "epoch": 0.6383838383838384, | |
| "grad_norm": 0.15232358872890472, | |
| "learning_rate": 0.00013991769547325105, | |
| "loss": 0.1844, | |
| "num_input_tokens_seen": 1806000, | |
| "step": 79, | |
| "train_runtime": 312.204, | |
| "train_tokens_per_second": 5784.679 | |
| }, | |
| { | |
| "epoch": 0.6464646464646465, | |
| "grad_norm": 0.15448316931724548, | |
| "learning_rate": 0.00013909465020576134, | |
| "loss": 0.1729, | |
| "num_input_tokens_seen": 1833264, | |
| "step": 80, | |
| "train_runtime": 316.1144, | |
| "train_tokens_per_second": 5799.368 | |
| }, | |
| { | |
| "epoch": 0.6545454545454545, | |
| "grad_norm": 0.16937431693077087, | |
| "learning_rate": 0.0001382716049382716, | |
| "loss": 0.2037, | |
| "num_input_tokens_seen": 1855920, | |
| "step": 81, | |
| "train_runtime": 319.4445, | |
| "train_tokens_per_second": 5809.835 | |
| }, | |
| { | |
| "epoch": 0.6626262626262627, | |
| "grad_norm": 0.1692294478416443, | |
| "learning_rate": 0.0001374485596707819, | |
| "loss": 0.2102, | |
| "num_input_tokens_seen": 1877664, | |
| "step": 82, | |
| "train_runtime": 322.623, | |
| "train_tokens_per_second": 5819.994 | |
| }, | |
| { | |
| "epoch": 0.6707070707070707, | |
| "grad_norm": 0.15476073324680328, | |
| "learning_rate": 0.00013662551440329218, | |
| "loss": 0.1601, | |
| "num_input_tokens_seen": 1901152, | |
| "step": 83, | |
| "train_runtime": 326.007, | |
| "train_tokens_per_second": 5831.63 | |
| }, | |
| { | |
| "epoch": 0.6787878787878788, | |
| "grad_norm": 0.1650950163602829, | |
| "learning_rate": 0.00013580246913580247, | |
| "loss": 0.2074, | |
| "num_input_tokens_seen": 1927440, | |
| "step": 84, | |
| "train_runtime": 329.7391, | |
| "train_tokens_per_second": 5845.348 | |
| }, | |
| { | |
| "epoch": 0.6868686868686869, | |
| "grad_norm": 0.17345544695854187, | |
| "learning_rate": 0.00013497942386831276, | |
| "loss": 0.1916, | |
| "num_input_tokens_seen": 1951408, | |
| "step": 85, | |
| "train_runtime": 333.1884, | |
| "train_tokens_per_second": 5856.771 | |
| }, | |
| { | |
| "epoch": 0.694949494949495, | |
| "grad_norm": 0.16704945266246796, | |
| "learning_rate": 0.00013415637860082305, | |
| "loss": 0.2071, | |
| "num_input_tokens_seen": 1973200, | |
| "step": 86, | |
| "train_runtime": 336.3437, | |
| "train_tokens_per_second": 5866.619 | |
| }, | |
| { | |
| "epoch": 0.703030303030303, | |
| "grad_norm": 0.14658761024475098, | |
| "learning_rate": 0.00013333333333333334, | |
| "loss": 0.228, | |
| "num_input_tokens_seen": 1994528, | |
| "step": 87, | |
| "train_runtime": 339.4404, | |
| "train_tokens_per_second": 5875.93 | |
| }, | |
| { | |
| "epoch": 0.7111111111111111, | |
| "grad_norm": 0.17460143566131592, | |
| "learning_rate": 0.00013251028806584363, | |
| "loss": 0.1777, | |
| "num_input_tokens_seen": 2019248, | |
| "step": 88, | |
| "train_runtime": 343.0056, | |
| "train_tokens_per_second": 5886.924 | |
| }, | |
| { | |
| "epoch": 0.7191919191919192, | |
| "grad_norm": 0.1555347740650177, | |
| "learning_rate": 0.00013168724279835392, | |
| "loss": 0.1718, | |
| "num_input_tokens_seen": 2040592, | |
| "step": 89, | |
| "train_runtime": 346.1188, | |
| "train_tokens_per_second": 5895.641 | |
| }, | |
| { | |
| "epoch": 0.7272727272727273, | |
| "grad_norm": 0.14311373233795166, | |
| "learning_rate": 0.0001308641975308642, | |
| "loss": 0.1703, | |
| "num_input_tokens_seen": 2062032, | |
| "step": 90, | |
| "train_runtime": 349.2336, | |
| "train_tokens_per_second": 5904.449 | |
| }, | |
| { | |
| "epoch": 0.7353535353535353, | |
| "grad_norm": 0.15284591913223267, | |
| "learning_rate": 0.0001300411522633745, | |
| "loss": 0.1685, | |
| "num_input_tokens_seen": 2082368, | |
| "step": 91, | |
| "train_runtime": 352.7694, | |
| "train_tokens_per_second": 5902.915 | |
| }, | |
| { | |
| "epoch": 0.7434343434343434, | |
| "grad_norm": 0.155190110206604, | |
| "learning_rate": 0.00012921810699588476, | |
| "loss": 0.1604, | |
| "num_input_tokens_seen": 2104976, | |
| "step": 92, | |
| "train_runtime": 356.0443, | |
| "train_tokens_per_second": 5912.118 | |
| }, | |
| { | |
| "epoch": 0.7515151515151515, | |
| "grad_norm": 0.15990827977657318, | |
| "learning_rate": 0.00012839506172839505, | |
| "loss": 0.1926, | |
| "num_input_tokens_seen": 2125664, | |
| "step": 93, | |
| "train_runtime": 359.04, | |
| "train_tokens_per_second": 5920.41 | |
| }, | |
| { | |
| "epoch": 0.7595959595959596, | |
| "grad_norm": 0.14356884360313416, | |
| "learning_rate": 0.00012757201646090534, | |
| "loss": 0.157, | |
| "num_input_tokens_seen": 2151216, | |
| "step": 94, | |
| "train_runtime": 362.7537, | |
| "train_tokens_per_second": 5930.238 | |
| }, | |
| { | |
| "epoch": 0.7676767676767676, | |
| "grad_norm": 0.16834881901741028, | |
| "learning_rate": 0.00012674897119341563, | |
| "loss": 0.1684, | |
| "num_input_tokens_seen": 2174480, | |
| "step": 95, | |
| "train_runtime": 366.0908, | |
| "train_tokens_per_second": 5939.729 | |
| }, | |
| { | |
| "epoch": 0.7757575757575758, | |
| "grad_norm": 0.15969020128250122, | |
| "learning_rate": 0.00012592592592592592, | |
| "loss": 0.1817, | |
| "num_input_tokens_seen": 2198048, | |
| "step": 96, | |
| "train_runtime": 369.4885, | |
| "train_tokens_per_second": 5948.894 | |
| }, | |
| { | |
| "epoch": 0.7838383838383839, | |
| "grad_norm": 0.17647744715213776, | |
| "learning_rate": 0.00012510288065843624, | |
| "loss": 0.1925, | |
| "num_input_tokens_seen": 2218944, | |
| "step": 97, | |
| "train_runtime": 372.5447, | |
| "train_tokens_per_second": 5956.182 | |
| }, | |
| { | |
| "epoch": 0.7919191919191919, | |
| "grad_norm": 0.15452450513839722, | |
| "learning_rate": 0.0001242798353909465, | |
| "loss": 0.2199, | |
| "num_input_tokens_seen": 2244752, | |
| "step": 98, | |
| "train_runtime": 376.2965, | |
| "train_tokens_per_second": 5965.381 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 0.16536033153533936, | |
| "learning_rate": 0.0001234567901234568, | |
| "loss": 0.202, | |
| "num_input_tokens_seen": 2267728, | |
| "step": 99, | |
| "train_runtime": 379.6467, | |
| "train_tokens_per_second": 5973.259 | |
| }, | |
| { | |
| "epoch": 0.8080808080808081, | |
| "grad_norm": 0.15133647620677948, | |
| "learning_rate": 0.00012263374485596708, | |
| "loss": 0.177, | |
| "num_input_tokens_seen": 2289328, | |
| "step": 100, | |
| "train_runtime": 382.7931, | |
| "train_tokens_per_second": 5980.589 | |
| }, | |
| { | |
| "epoch": 0.8080808080808081, | |
| "eval_loss": 0.17801880836486816, | |
| "eval_runtime": 15.9675, | |
| "eval_samples_per_second": 55.049, | |
| "eval_steps_per_second": 3.444, | |
| "num_input_tokens_seen": 2289328, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.8161616161616162, | |
| "grad_norm": 0.1537664383649826, | |
| "learning_rate": 0.00012181069958847737, | |
| "loss": 0.2092, | |
| "num_input_tokens_seen": 2313216, | |
| "step": 101, | |
| "train_runtime": 402.2143, | |
| "train_tokens_per_second": 5751.203 | |
| }, | |
| { | |
| "epoch": 0.8242424242424242, | |
| "grad_norm": 0.15654610097408295, | |
| "learning_rate": 0.00012098765432098766, | |
| "loss": 0.1664, | |
| "num_input_tokens_seen": 2333152, | |
| "step": 102, | |
| "train_runtime": 405.1177, | |
| "train_tokens_per_second": 5759.195 | |
| }, | |
| { | |
| "epoch": 0.8323232323232324, | |
| "grad_norm": 0.15154822170734406, | |
| "learning_rate": 0.00012016460905349795, | |
| "loss": 0.2069, | |
| "num_input_tokens_seen": 2355744, | |
| "step": 103, | |
| "train_runtime": 408.4074, | |
| "train_tokens_per_second": 5768.123 | |
| }, | |
| { | |
| "epoch": 0.8404040404040404, | |
| "grad_norm": 0.16599127650260925, | |
| "learning_rate": 0.00011934156378600823, | |
| "loss": 0.2347, | |
| "num_input_tokens_seen": 2376560, | |
| "step": 104, | |
| "train_runtime": 411.4246, | |
| "train_tokens_per_second": 5776.418 | |
| }, | |
| { | |
| "epoch": 0.8484848484848485, | |
| "grad_norm": 0.1642574518918991, | |
| "learning_rate": 0.00011851851851851852, | |
| "loss": 0.185, | |
| "num_input_tokens_seen": 2400896, | |
| "step": 105, | |
| "train_runtime": 414.9439, | |
| "train_tokens_per_second": 5786.074 | |
| }, | |
| { | |
| "epoch": 0.8565656565656565, | |
| "grad_norm": 0.15395912528038025, | |
| "learning_rate": 0.00011769547325102881, | |
| "loss": 0.179, | |
| "num_input_tokens_seen": 2423632, | |
| "step": 106, | |
| "train_runtime": 418.2763, | |
| "train_tokens_per_second": 5794.332 | |
| }, | |
| { | |
| "epoch": 0.8646464646464647, | |
| "grad_norm": 0.16491572558879852, | |
| "learning_rate": 0.0001168724279835391, | |
| "loss": 0.2168, | |
| "num_input_tokens_seen": 2448432, | |
| "step": 107, | |
| "train_runtime": 421.8552, | |
| "train_tokens_per_second": 5803.963 | |
| }, | |
| { | |
| "epoch": 0.8727272727272727, | |
| "grad_norm": 0.16017423570156097, | |
| "learning_rate": 0.00011604938271604939, | |
| "loss": 0.1826, | |
| "num_input_tokens_seen": 2470768, | |
| "step": 108, | |
| "train_runtime": 425.0496, | |
| "train_tokens_per_second": 5812.893 | |
| }, | |
| { | |
| "epoch": 0.8808080808080808, | |
| "grad_norm": 0.14728578925132751, | |
| "learning_rate": 0.00011522633744855968, | |
| "loss": 0.1907, | |
| "num_input_tokens_seen": 2494944, | |
| "step": 109, | |
| "train_runtime": 428.5398, | |
| "train_tokens_per_second": 5821.965 | |
| }, | |
| { | |
| "epoch": 0.8888888888888888, | |
| "grad_norm": 0.17022450268268585, | |
| "learning_rate": 0.00011440329218106996, | |
| "loss": 0.2021, | |
| "num_input_tokens_seen": 2515760, | |
| "step": 110, | |
| "train_runtime": 431.6001, | |
| "train_tokens_per_second": 5828.914 | |
| }, | |
| { | |
| "epoch": 0.896969696969697, | |
| "grad_norm": 0.16193877160549164, | |
| "learning_rate": 0.00011358024691358025, | |
| "loss": 0.1559, | |
| "num_input_tokens_seen": 2537792, | |
| "step": 111, | |
| "train_runtime": 434.8205, | |
| "train_tokens_per_second": 5836.414 | |
| }, | |
| { | |
| "epoch": 0.9050505050505051, | |
| "grad_norm": 0.14079837501049042, | |
| "learning_rate": 0.00011275720164609054, | |
| "loss": 0.1667, | |
| "num_input_tokens_seen": 2562032, | |
| "step": 112, | |
| "train_runtime": 438.3575, | |
| "train_tokens_per_second": 5844.618 | |
| }, | |
| { | |
| "epoch": 0.9131313131313131, | |
| "grad_norm": 0.1725139021873474, | |
| "learning_rate": 0.00011193415637860083, | |
| "loss": 0.1913, | |
| "num_input_tokens_seen": 2583760, | |
| "step": 113, | |
| "train_runtime": 441.5306, | |
| "train_tokens_per_second": 5851.826 | |
| }, | |
| { | |
| "epoch": 0.9212121212121213, | |
| "grad_norm": 0.1663820445537567, | |
| "learning_rate": 0.00011111111111111112, | |
| "loss": 0.1441, | |
| "num_input_tokens_seen": 2607776, | |
| "step": 114, | |
| "train_runtime": 445.0017, | |
| "train_tokens_per_second": 5860.149 | |
| }, | |
| { | |
| "epoch": 0.9292929292929293, | |
| "grad_norm": 0.16796670854091644, | |
| "learning_rate": 0.0001102880658436214, | |
| "loss": 0.2076, | |
| "num_input_tokens_seen": 2630208, | |
| "step": 115, | |
| "train_runtime": 448.275, | |
| "train_tokens_per_second": 5867.398 | |
| }, | |
| { | |
| "epoch": 0.9373737373737374, | |
| "grad_norm": 0.16379429399967194, | |
| "learning_rate": 0.00010946502057613168, | |
| "loss": 0.1832, | |
| "num_input_tokens_seen": 2650208, | |
| "step": 116, | |
| "train_runtime": 451.1977, | |
| "train_tokens_per_second": 5873.718 | |
| }, | |
| { | |
| "epoch": 0.9454545454545454, | |
| "grad_norm": 0.1663283109664917, | |
| "learning_rate": 0.00010864197530864197, | |
| "loss": 0.2013, | |
| "num_input_tokens_seen": 2672592, | |
| "step": 117, | |
| "train_runtime": 454.4485, | |
| "train_tokens_per_second": 5880.957 | |
| }, | |
| { | |
| "epoch": 0.9535353535353536, | |
| "grad_norm": 0.16695767641067505, | |
| "learning_rate": 0.00010781893004115226, | |
| "loss": 0.1462, | |
| "num_input_tokens_seen": 2698064, | |
| "step": 118, | |
| "train_runtime": 458.1001, | |
| "train_tokens_per_second": 5889.682 | |
| }, | |
| { | |
| "epoch": 0.9616161616161616, | |
| "grad_norm": 0.1588376760482788, | |
| "learning_rate": 0.00010699588477366255, | |
| "loss": 0.1837, | |
| "num_input_tokens_seen": 2719680, | |
| "step": 119, | |
| "train_runtime": 461.2512, | |
| "train_tokens_per_second": 5896.31 | |
| }, | |
| { | |
| "epoch": 0.9696969696969697, | |
| "grad_norm": 0.1472574770450592, | |
| "learning_rate": 0.00010617283950617284, | |
| "loss": 0.1742, | |
| "num_input_tokens_seen": 2742400, | |
| "step": 120, | |
| "train_runtime": 464.5791, | |
| "train_tokens_per_second": 5902.978 | |
| }, | |
| { | |
| "epoch": 0.9777777777777777, | |
| "grad_norm": 0.17550979554653168, | |
| "learning_rate": 0.00010534979423868315, | |
| "loss": 0.1364, | |
| "num_input_tokens_seen": 2766112, | |
| "step": 121, | |
| "train_runtime": 468.5285, | |
| "train_tokens_per_second": 5903.829 | |
| }, | |
| { | |
| "epoch": 0.9858585858585859, | |
| "grad_norm": 0.15758642554283142, | |
| "learning_rate": 0.00010452674897119341, | |
| "loss": 0.1775, | |
| "num_input_tokens_seen": 2787952, | |
| "step": 122, | |
| "train_runtime": 471.7104, | |
| "train_tokens_per_second": 5910.304 | |
| }, | |
| { | |
| "epoch": 0.9939393939393939, | |
| "grad_norm": 0.16019918024539948, | |
| "learning_rate": 0.0001037037037037037, | |
| "loss": 0.2096, | |
| "num_input_tokens_seen": 2811632, | |
| "step": 123, | |
| "train_runtime": 475.1248, | |
| "train_tokens_per_second": 5917.671 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 0.2007690817117691, | |
| "learning_rate": 0.00010288065843621399, | |
| "loss": 0.1646, | |
| "num_input_tokens_seen": 2825206, | |
| "step": 124, | |
| "train_runtime": 477.1077, | |
| "train_tokens_per_second": 5921.527 | |
| }, | |
| { | |
| "epoch": 1.0080808080808081, | |
| "grad_norm": 0.14078141748905182, | |
| "learning_rate": 0.00010205761316872428, | |
| "loss": 0.1363, | |
| "num_input_tokens_seen": 2847206, | |
| "step": 125, | |
| "train_runtime": 480.3107, | |
| "train_tokens_per_second": 5927.842 | |
| }, | |
| { | |
| "epoch": 1.0080808080808081, | |
| "eval_loss": 0.1743689626455307, | |
| "eval_runtime": 15.9727, | |
| "eval_samples_per_second": 55.031, | |
| "eval_steps_per_second": 3.443, | |
| "num_input_tokens_seen": 2847206, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 1.0161616161616163, | |
| "grad_norm": 0.14959807693958282, | |
| "learning_rate": 0.00010123456790123458, | |
| "loss": 0.1373, | |
| "num_input_tokens_seen": 2867190, | |
| "step": 126, | |
| "train_runtime": 499.2365, | |
| "train_tokens_per_second": 5743.15 | |
| }, | |
| { | |
| "epoch": 1.0242424242424242, | |
| "grad_norm": 0.14410553872585297, | |
| "learning_rate": 0.00010041152263374487, | |
| "loss": 0.1391, | |
| "num_input_tokens_seen": 2888710, | |
| "step": 127, | |
| "train_runtime": 502.361, | |
| "train_tokens_per_second": 5750.268 | |
| }, | |
| { | |
| "epoch": 1.0323232323232323, | |
| "grad_norm": 0.14210668206214905, | |
| "learning_rate": 9.958847736625515e-05, | |
| "loss": 0.1514, | |
| "num_input_tokens_seen": 2913990, | |
| "step": 128, | |
| "train_runtime": 506.0209, | |
| "train_tokens_per_second": 5758.636 | |
| }, | |
| { | |
| "epoch": 1.0404040404040404, | |
| "grad_norm": 0.14086109399795532, | |
| "learning_rate": 9.876543209876543e-05, | |
| "loss": 0.1384, | |
| "num_input_tokens_seen": 2938246, | |
| "step": 129, | |
| "train_runtime": 509.5108, | |
| "train_tokens_per_second": 5766.799 | |
| }, | |
| { | |
| "epoch": 1.0484848484848486, | |
| "grad_norm": 0.1444181203842163, | |
| "learning_rate": 9.794238683127573e-05, | |
| "loss": 0.1694, | |
| "num_input_tokens_seen": 2962326, | |
| "step": 130, | |
| "train_runtime": 513.0283, | |
| "train_tokens_per_second": 5774.196 | |
| }, | |
| { | |
| "epoch": 1.0565656565656565, | |
| "grad_norm": 0.15412774682044983, | |
| "learning_rate": 9.711934156378602e-05, | |
| "loss": 0.1657, | |
| "num_input_tokens_seen": 2983126, | |
| "step": 131, | |
| "train_runtime": 516.07, | |
| "train_tokens_per_second": 5780.468 | |
| }, | |
| { | |
| "epoch": 1.0646464646464646, | |
| "grad_norm": 0.1612967848777771, | |
| "learning_rate": 9.62962962962963e-05, | |
| "loss": 0.1738, | |
| "num_input_tokens_seen": 3005606, | |
| "step": 132, | |
| "train_runtime": 519.3068, | |
| "train_tokens_per_second": 5787.727 | |
| }, | |
| { | |
| "epoch": 1.0727272727272728, | |
| "grad_norm": 0.1550590842962265, | |
| "learning_rate": 9.547325102880659e-05, | |
| "loss": 0.1634, | |
| "num_input_tokens_seen": 3027926, | |
| "step": 133, | |
| "train_runtime": 522.5599, | |
| "train_tokens_per_second": 5794.41 | |
| }, | |
| { | |
| "epoch": 1.0808080808080809, | |
| "grad_norm": 0.1607086956501007, | |
| "learning_rate": 9.465020576131688e-05, | |
| "loss": 0.1507, | |
| "num_input_tokens_seen": 3052294, | |
| "step": 134, | |
| "train_runtime": 526.0714, | |
| "train_tokens_per_second": 5802.053 | |
| }, | |
| { | |
| "epoch": 1.0888888888888888, | |
| "grad_norm": 0.14786848425865173, | |
| "learning_rate": 9.382716049382717e-05, | |
| "loss": 0.1371, | |
| "num_input_tokens_seen": 3073014, | |
| "step": 135, | |
| "train_runtime": 529.0875, | |
| "train_tokens_per_second": 5808.139 | |
| }, | |
| { | |
| "epoch": 1.096969696969697, | |
| "grad_norm": 0.14476324617862701, | |
| "learning_rate": 9.300411522633746e-05, | |
| "loss": 0.1223, | |
| "num_input_tokens_seen": 3095126, | |
| "step": 136, | |
| "train_runtime": 532.2833, | |
| "train_tokens_per_second": 5814.809 | |
| }, | |
| { | |
| "epoch": 1.105050505050505, | |
| "grad_norm": 0.17048926651477814, | |
| "learning_rate": 9.218106995884775e-05, | |
| "loss": 0.1542, | |
| "num_input_tokens_seen": 3116438, | |
| "step": 137, | |
| "train_runtime": 535.3914, | |
| "train_tokens_per_second": 5820.859 | |
| }, | |
| { | |
| "epoch": 1.1131313131313132, | |
| "grad_norm": 0.14804477989673615, | |
| "learning_rate": 9.135802469135802e-05, | |
| "loss": 0.129, | |
| "num_input_tokens_seen": 3139174, | |
| "step": 138, | |
| "train_runtime": 538.6924, | |
| "train_tokens_per_second": 5827.396 | |
| }, | |
| { | |
| "epoch": 1.121212121212121, | |
| "grad_norm": 0.14984357357025146, | |
| "learning_rate": 9.053497942386831e-05, | |
| "loss": 0.139, | |
| "num_input_tokens_seen": 3165206, | |
| "step": 139, | |
| "train_runtime": 542.4266, | |
| "train_tokens_per_second": 5835.27 | |
| }, | |
| { | |
| "epoch": 1.1292929292929292, | |
| "grad_norm": 0.1541273444890976, | |
| "learning_rate": 8.97119341563786e-05, | |
| "loss": 0.139, | |
| "num_input_tokens_seen": 3189942, | |
| "step": 140, | |
| "train_runtime": 545.9937, | |
| "train_tokens_per_second": 5842.452 | |
| }, | |
| { | |
| "epoch": 1.1373737373737374, | |
| "grad_norm": 0.1608126163482666, | |
| "learning_rate": 8.888888888888889e-05, | |
| "loss": 0.1145, | |
| "num_input_tokens_seen": 3213878, | |
| "step": 141, | |
| "train_runtime": 549.4275, | |
| "train_tokens_per_second": 5849.503 | |
| }, | |
| { | |
| "epoch": 1.1454545454545455, | |
| "grad_norm": 0.15520773828029633, | |
| "learning_rate": 8.806584362139918e-05, | |
| "loss": 0.185, | |
| "num_input_tokens_seen": 3236806, | |
| "step": 142, | |
| "train_runtime": 552.7146, | |
| "train_tokens_per_second": 5856.197 | |
| }, | |
| { | |
| "epoch": 1.1535353535353536, | |
| "grad_norm": 0.17958641052246094, | |
| "learning_rate": 8.724279835390947e-05, | |
| "loss": 0.1744, | |
| "num_input_tokens_seen": 3258822, | |
| "step": 143, | |
| "train_runtime": 555.9036, | |
| "train_tokens_per_second": 5862.207 | |
| }, | |
| { | |
| "epoch": 1.1616161616161615, | |
| "grad_norm": 0.15695422887802124, | |
| "learning_rate": 8.641975308641975e-05, | |
| "loss": 0.1292, | |
| "num_input_tokens_seen": 3280694, | |
| "step": 144, | |
| "train_runtime": 559.0968, | |
| "train_tokens_per_second": 5867.846 | |
| }, | |
| { | |
| "epoch": 1.1696969696969697, | |
| "grad_norm": 0.15811026096343994, | |
| "learning_rate": 8.559670781893004e-05, | |
| "loss": 0.1366, | |
| "num_input_tokens_seen": 3305894, | |
| "step": 145, | |
| "train_runtime": 562.6785, | |
| "train_tokens_per_second": 5875.281 | |
| }, | |
| { | |
| "epoch": 1.1777777777777778, | |
| "grad_norm": 0.18241523206233978, | |
| "learning_rate": 8.477366255144033e-05, | |
| "loss": 0.1277, | |
| "num_input_tokens_seen": 3327526, | |
| "step": 146, | |
| "train_runtime": 565.8579, | |
| "train_tokens_per_second": 5880.498 | |
| }, | |
| { | |
| "epoch": 1.185858585858586, | |
| "grad_norm": 0.18478727340698242, | |
| "learning_rate": 8.395061728395062e-05, | |
| "loss": 0.1556, | |
| "num_input_tokens_seen": 3349414, | |
| "step": 147, | |
| "train_runtime": 569.0152, | |
| "train_tokens_per_second": 5886.335 | |
| }, | |
| { | |
| "epoch": 1.1939393939393939, | |
| "grad_norm": 0.18235282599925995, | |
| "learning_rate": 8.312757201646091e-05, | |
| "loss": 0.185, | |
| "num_input_tokens_seen": 3373782, | |
| "step": 148, | |
| "train_runtime": 572.5108, | |
| "train_tokens_per_second": 5892.958 | |
| }, | |
| { | |
| "epoch": 1.202020202020202, | |
| "grad_norm": 0.16526545584201813, | |
| "learning_rate": 8.23045267489712e-05, | |
| "loss": 0.1417, | |
| "num_input_tokens_seen": 3397254, | |
| "step": 149, | |
| "train_runtime": 575.9284, | |
| "train_tokens_per_second": 5898.744 | |
| }, | |
| { | |
| "epoch": 1.2101010101010101, | |
| "grad_norm": 0.1843811720609665, | |
| "learning_rate": 8.148148148148148e-05, | |
| "loss": 0.1289, | |
| "num_input_tokens_seen": 3420102, | |
| "step": 150, | |
| "train_runtime": 579.2683, | |
| "train_tokens_per_second": 5904.176 | |
| }, | |
| { | |
| "epoch": 1.2101010101010101, | |
| "eval_loss": 0.17398151755332947, | |
| "eval_runtime": 15.974, | |
| "eval_samples_per_second": 55.027, | |
| "eval_steps_per_second": 3.443, | |
| "num_input_tokens_seen": 3420102, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 1.2181818181818183, | |
| "grad_norm": 0.20147649943828583, | |
| "learning_rate": 8.065843621399177e-05, | |
| "loss": 0.1823, | |
| "num_input_tokens_seen": 3440438, | |
| "step": 151, | |
| "train_runtime": 598.6689, | |
| "train_tokens_per_second": 5746.813 | |
| }, | |
| { | |
| "epoch": 1.2262626262626264, | |
| "grad_norm": 0.16948151588439941, | |
| "learning_rate": 7.983539094650207e-05, | |
| "loss": 0.1352, | |
| "num_input_tokens_seen": 3466054, | |
| "step": 152, | |
| "train_runtime": 602.3354, | |
| "train_tokens_per_second": 5754.358 | |
| }, | |
| { | |
| "epoch": 1.2343434343434343, | |
| "grad_norm": 0.13926386833190918, | |
| "learning_rate": 7.901234567901235e-05, | |
| "loss": 0.1396, | |
| "num_input_tokens_seen": 3492278, | |
| "step": 153, | |
| "train_runtime": 606.1274, | |
| "train_tokens_per_second": 5761.624 | |
| }, | |
| { | |
| "epoch": 1.2424242424242424, | |
| "grad_norm": 0.1492907702922821, | |
| "learning_rate": 7.818930041152264e-05, | |
| "loss": 0.1222, | |
| "num_input_tokens_seen": 3512582, | |
| "step": 154, | |
| "train_runtime": 609.1167, | |
| "train_tokens_per_second": 5766.681 | |
| }, | |
| { | |
| "epoch": 1.2505050505050506, | |
| "grad_norm": 0.17096783220767975, | |
| "learning_rate": 7.736625514403293e-05, | |
| "loss": 0.1434, | |
| "num_input_tokens_seen": 3535750, | |
| "step": 155, | |
| "train_runtime": 612.4626, | |
| "train_tokens_per_second": 5773.005 | |
| }, | |
| { | |
| "epoch": 1.2585858585858585, | |
| "grad_norm": 0.1619611382484436, | |
| "learning_rate": 7.65432098765432e-05, | |
| "loss": 0.142, | |
| "num_input_tokens_seen": 3559894, | |
| "step": 156, | |
| "train_runtime": 615.9667, | |
| "train_tokens_per_second": 5779.361 | |
| }, | |
| { | |
| "epoch": 1.2666666666666666, | |
| "grad_norm": 0.18333695828914642, | |
| "learning_rate": 7.57201646090535e-05, | |
| "loss": 0.1433, | |
| "num_input_tokens_seen": 3580390, | |
| "step": 157, | |
| "train_runtime": 618.9828, | |
| "train_tokens_per_second": 5784.312 | |
| }, | |
| { | |
| "epoch": 1.2747474747474747, | |
| "grad_norm": 0.1673658788204193, | |
| "learning_rate": 7.48971193415638e-05, | |
| "loss": 0.1168, | |
| "num_input_tokens_seen": 3601750, | |
| "step": 158, | |
| "train_runtime": 622.0976, | |
| "train_tokens_per_second": 5789.686 | |
| }, | |
| { | |
| "epoch": 1.2828282828282829, | |
| "grad_norm": 0.16368548572063446, | |
| "learning_rate": 7.407407407407407e-05, | |
| "loss": 0.1345, | |
| "num_input_tokens_seen": 3629030, | |
| "step": 159, | |
| "train_runtime": 625.9653, | |
| "train_tokens_per_second": 5797.494 | |
| }, | |
| { | |
| "epoch": 1.290909090909091, | |
| "grad_norm": 0.18099236488342285, | |
| "learning_rate": 7.325102880658436e-05, | |
| "loss": 0.1503, | |
| "num_input_tokens_seen": 3654358, | |
| "step": 160, | |
| "train_runtime": 629.6159, | |
| "train_tokens_per_second": 5804.107 | |
| }, | |
| { | |
| "epoch": 1.298989898989899, | |
| "grad_norm": 0.17030303180217743, | |
| "learning_rate": 7.242798353909465e-05, | |
| "loss": 0.1414, | |
| "num_input_tokens_seen": 3680758, | |
| "step": 161, | |
| "train_runtime": 633.4286, | |
| "train_tokens_per_second": 5810.849 | |
| }, | |
| { | |
| "epoch": 1.307070707070707, | |
| "grad_norm": 0.1868920922279358, | |
| "learning_rate": 7.160493827160494e-05, | |
| "loss": 0.1348, | |
| "num_input_tokens_seen": 3704022, | |
| "step": 162, | |
| "train_runtime": 636.8172, | |
| "train_tokens_per_second": 5816.461 | |
| }, | |
| { | |
| "epoch": 1.3151515151515152, | |
| "grad_norm": 0.18310731649398804, | |
| "learning_rate": 7.078189300411523e-05, | |
| "loss": 0.1241, | |
| "num_input_tokens_seen": 3727814, | |
| "step": 163, | |
| "train_runtime": 640.2506, | |
| "train_tokens_per_second": 5822.429 | |
| }, | |
| { | |
| "epoch": 1.3232323232323233, | |
| "grad_norm": 0.188144713640213, | |
| "learning_rate": 6.995884773662552e-05, | |
| "loss": 0.1568, | |
| "num_input_tokens_seen": 3749606, | |
| "step": 164, | |
| "train_runtime": 643.4135, | |
| "train_tokens_per_second": 5827.677 | |
| }, | |
| { | |
| "epoch": 1.3313131313131312, | |
| "grad_norm": 0.19525550305843353, | |
| "learning_rate": 6.91358024691358e-05, | |
| "loss": 0.1781, | |
| "num_input_tokens_seen": 3774710, | |
| "step": 165, | |
| "train_runtime": 647.0635, | |
| "train_tokens_per_second": 5833.601 | |
| }, | |
| { | |
| "epoch": 1.3393939393939394, | |
| "grad_norm": 0.18591126799583435, | |
| "learning_rate": 6.831275720164609e-05, | |
| "loss": 0.1231, | |
| "num_input_tokens_seen": 3793814, | |
| "step": 166, | |
| "train_runtime": 649.8581, | |
| "train_tokens_per_second": 5837.911 | |
| }, | |
| { | |
| "epoch": 1.3474747474747475, | |
| "grad_norm": 0.19412674009799957, | |
| "learning_rate": 6.748971193415638e-05, | |
| "loss": 0.1545, | |
| "num_input_tokens_seen": 3818662, | |
| "step": 167, | |
| "train_runtime": 653.4715, | |
| "train_tokens_per_second": 5843.655 | |
| }, | |
| { | |
| "epoch": 1.3555555555555556, | |
| "grad_norm": 0.16812458634376526, | |
| "learning_rate": 6.666666666666667e-05, | |
| "loss": 0.1414, | |
| "num_input_tokens_seen": 3841606, | |
| "step": 168, | |
| "train_runtime": 656.7714, | |
| "train_tokens_per_second": 5849.228 | |
| }, | |
| { | |
| "epoch": 1.3636363636363638, | |
| "grad_norm": 0.18051378428936005, | |
| "learning_rate": 6.584362139917696e-05, | |
| "loss": 0.144, | |
| "num_input_tokens_seen": 3863830, | |
| "step": 169, | |
| "train_runtime": 660.006, | |
| "train_tokens_per_second": 5854.234 | |
| }, | |
| { | |
| "epoch": 1.3717171717171717, | |
| "grad_norm": 0.19069063663482666, | |
| "learning_rate": 6.502057613168725e-05, | |
| "loss": 0.1649, | |
| "num_input_tokens_seen": 3886230, | |
| "step": 170, | |
| "train_runtime": 663.2462, | |
| "train_tokens_per_second": 5859.408 | |
| }, | |
| { | |
| "epoch": 1.3797979797979798, | |
| "grad_norm": 0.18689148128032684, | |
| "learning_rate": 6.419753086419753e-05, | |
| "loss": 0.1425, | |
| "num_input_tokens_seen": 3908982, | |
| "step": 171, | |
| "train_runtime": 666.5218, | |
| "train_tokens_per_second": 5864.747 | |
| }, | |
| { | |
| "epoch": 1.387878787878788, | |
| "grad_norm": 0.14730970561504364, | |
| "learning_rate": 6.337448559670782e-05, | |
| "loss": 0.1336, | |
| "num_input_tokens_seen": 3936150, | |
| "step": 172, | |
| "train_runtime": 670.4336, | |
| "train_tokens_per_second": 5871.052 | |
| }, | |
| { | |
| "epoch": 1.3959595959595958, | |
| "grad_norm": 0.177509605884552, | |
| "learning_rate": 6.255144032921812e-05, | |
| "loss": 0.1545, | |
| "num_input_tokens_seen": 3959430, | |
| "step": 173, | |
| "train_runtime": 673.8214, | |
| "train_tokens_per_second": 5876.083 | |
| }, | |
| { | |
| "epoch": 1.404040404040404, | |
| "grad_norm": 0.17181722819805145, | |
| "learning_rate": 6.17283950617284e-05, | |
| "loss": 0.1462, | |
| "num_input_tokens_seen": 3981126, | |
| "step": 174, | |
| "train_runtime": 677.031, | |
| "train_tokens_per_second": 5880.271 | |
| }, | |
| { | |
| "epoch": 1.412121212121212, | |
| "grad_norm": 0.1883271485567093, | |
| "learning_rate": 6.0905349794238687e-05, | |
| "loss": 0.1511, | |
| "num_input_tokens_seen": 4006118, | |
| "step": 175, | |
| "train_runtime": 680.6168, | |
| "train_tokens_per_second": 5886.011 | |
| }, | |
| { | |
| "epoch": 1.412121212121212, | |
| "eval_loss": 0.1727769374847412, | |
| "eval_runtime": 15.9835, | |
| "eval_samples_per_second": 54.994, | |
| "eval_steps_per_second": 3.441, | |
| "num_input_tokens_seen": 4006118, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 1.4202020202020202, | |
| "grad_norm": 0.17214921116828918, | |
| "learning_rate": 6.0082304526748977e-05, | |
| "loss": 0.1669, | |
| "num_input_tokens_seen": 4034054, | |
| "step": 176, | |
| "train_runtime": 700.6314, | |
| "train_tokens_per_second": 5757.74 | |
| }, | |
| { | |
| "epoch": 1.4282828282828284, | |
| "grad_norm": 0.17713947594165802, | |
| "learning_rate": 5.925925925925926e-05, | |
| "loss": 0.1356, | |
| "num_input_tokens_seen": 4058646, | |
| "step": 177, | |
| "train_runtime": 704.1834, | |
| "train_tokens_per_second": 5763.62 | |
| }, | |
| { | |
| "epoch": 1.4363636363636363, | |
| "grad_norm": 0.18645597994327545, | |
| "learning_rate": 5.843621399176955e-05, | |
| "loss": 0.1573, | |
| "num_input_tokens_seen": 4083414, | |
| "step": 178, | |
| "train_runtime": 707.7598, | |
| "train_tokens_per_second": 5769.491 | |
| }, | |
| { | |
| "epoch": 1.4444444444444444, | |
| "grad_norm": 0.1776132434606552, | |
| "learning_rate": 5.761316872427984e-05, | |
| "loss": 0.1338, | |
| "num_input_tokens_seen": 4107190, | |
| "step": 179, | |
| "train_runtime": 711.2238, | |
| "train_tokens_per_second": 5774.821 | |
| }, | |
| { | |
| "epoch": 1.4525252525252526, | |
| "grad_norm": 0.1832626312971115, | |
| "learning_rate": 5.679012345679012e-05, | |
| "loss": 0.2298, | |
| "num_input_tokens_seen": 4129958, | |
| "step": 180, | |
| "train_runtime": 714.5258, | |
| "train_tokens_per_second": 5779.999 | |
| }, | |
| { | |
| "epoch": 1.4606060606060607, | |
| "grad_norm": 0.17791666090488434, | |
| "learning_rate": 5.596707818930041e-05, | |
| "loss": 0.1267, | |
| "num_input_tokens_seen": 4153302, | |
| "step": 181, | |
| "train_runtime": 718.4279, | |
| "train_tokens_per_second": 5781.098 | |
| }, | |
| { | |
| "epoch": 1.4686868686868686, | |
| "grad_norm": 0.18174052238464355, | |
| "learning_rate": 5.51440329218107e-05, | |
| "loss": 0.1311, | |
| "num_input_tokens_seen": 4175222, | |
| "step": 182, | |
| "train_runtime": 721.5861, | |
| "train_tokens_per_second": 5786.173 | |
| }, | |
| { | |
| "epoch": 1.4767676767676767, | |
| "grad_norm": 0.17272153496742249, | |
| "learning_rate": 5.4320987654320986e-05, | |
| "loss": 0.1454, | |
| "num_input_tokens_seen": 4196966, | |
| "step": 183, | |
| "train_runtime": 724.781, | |
| "train_tokens_per_second": 5790.668 | |
| }, | |
| { | |
| "epoch": 1.4848484848484849, | |
| "grad_norm": 0.18341264128684998, | |
| "learning_rate": 5.3497942386831277e-05, | |
| "loss": 0.1295, | |
| "num_input_tokens_seen": 4222630, | |
| "step": 184, | |
| "train_runtime": 728.4765, | |
| "train_tokens_per_second": 5796.522 | |
| }, | |
| { | |
| "epoch": 1.492929292929293, | |
| "grad_norm": 0.18532636761665344, | |
| "learning_rate": 5.267489711934157e-05, | |
| "loss": 0.1311, | |
| "num_input_tokens_seen": 4243798, | |
| "step": 185, | |
| "train_runtime": 731.5451, | |
| "train_tokens_per_second": 5801.143 | |
| }, | |
| { | |
| "epoch": 1.5010101010101011, | |
| "grad_norm": 0.19856366515159607, | |
| "learning_rate": 5.185185185185185e-05, | |
| "loss": 0.1532, | |
| "num_input_tokens_seen": 4265174, | |
| "step": 186, | |
| "train_runtime": 734.668, | |
| "train_tokens_per_second": 5805.581 | |
| }, | |
| { | |
| "epoch": 1.509090909090909, | |
| "grad_norm": 0.1887090802192688, | |
| "learning_rate": 5.102880658436214e-05, | |
| "loss": 0.108, | |
| "num_input_tokens_seen": 4286374, | |
| "step": 187, | |
| "train_runtime": 737.8004, | |
| "train_tokens_per_second": 5809.666 | |
| }, | |
| { | |
| "epoch": 1.5171717171717172, | |
| "grad_norm": 0.16914108395576477, | |
| "learning_rate": 5.020576131687244e-05, | |
| "loss": 0.1231, | |
| "num_input_tokens_seen": 4314534, | |
| "step": 188, | |
| "train_runtime": 741.8365, | |
| "train_tokens_per_second": 5816.017 | |
| }, | |
| { | |
| "epoch": 1.5252525252525253, | |
| "grad_norm": 0.207884281873703, | |
| "learning_rate": 4.938271604938271e-05, | |
| "loss": 0.1846, | |
| "num_input_tokens_seen": 4334726, | |
| "step": 189, | |
| "train_runtime": 744.774, | |
| "train_tokens_per_second": 5820.189 | |
| }, | |
| { | |
| "epoch": 1.5333333333333332, | |
| "grad_norm": 0.21083691716194153, | |
| "learning_rate": 4.855967078189301e-05, | |
| "loss": 0.1274, | |
| "num_input_tokens_seen": 4357238, | |
| "step": 190, | |
| "train_runtime": 748.0199, | |
| "train_tokens_per_second": 5825.029 | |
| }, | |
| { | |
| "epoch": 1.5414141414141413, | |
| "grad_norm": 0.18116632103919983, | |
| "learning_rate": 4.773662551440329e-05, | |
| "loss": 0.1457, | |
| "num_input_tokens_seen": 4380310, | |
| "step": 191, | |
| "train_runtime": 751.3376, | |
| "train_tokens_per_second": 5830.015 | |
| }, | |
| { | |
| "epoch": 1.5494949494949495, | |
| "grad_norm": 0.1774257868528366, | |
| "learning_rate": 4.691358024691358e-05, | |
| "loss": 0.1638, | |
| "num_input_tokens_seen": 4402598, | |
| "step": 192, | |
| "train_runtime": 754.5705, | |
| "train_tokens_per_second": 5834.575 | |
| }, | |
| { | |
| "epoch": 1.5575757575757576, | |
| "grad_norm": 0.17490142583847046, | |
| "learning_rate": 4.609053497942387e-05, | |
| "loss": 0.1287, | |
| "num_input_tokens_seen": 4426854, | |
| "step": 193, | |
| "train_runtime": 758.0657, | |
| "train_tokens_per_second": 5839.671 | |
| }, | |
| { | |
| "epoch": 1.5656565656565657, | |
| "grad_norm": 0.17895734310150146, | |
| "learning_rate": 4.5267489711934157e-05, | |
| "loss": 0.1565, | |
| "num_input_tokens_seen": 4452422, | |
| "step": 194, | |
| "train_runtime": 761.7593, | |
| "train_tokens_per_second": 5844.92 | |
| }, | |
| { | |
| "epoch": 1.5737373737373739, | |
| "grad_norm": 0.19911067187786102, | |
| "learning_rate": 4.4444444444444447e-05, | |
| "loss": 0.161, | |
| "num_input_tokens_seen": 4479574, | |
| "step": 195, | |
| "train_runtime": 765.648, | |
| "train_tokens_per_second": 5850.697 | |
| }, | |
| { | |
| "epoch": 1.5818181818181818, | |
| "grad_norm": 0.20772644877433777, | |
| "learning_rate": 4.3621399176954737e-05, | |
| "loss": 0.1791, | |
| "num_input_tokens_seen": 4499862, | |
| "step": 196, | |
| "train_runtime": 768.5633, | |
| "train_tokens_per_second": 5854.901 | |
| }, | |
| { | |
| "epoch": 1.58989898989899, | |
| "grad_norm": 0.20278632640838623, | |
| "learning_rate": 4.279835390946502e-05, | |
| "loss": 0.1221, | |
| "num_input_tokens_seen": 4522614, | |
| "step": 197, | |
| "train_runtime": 771.8795, | |
| "train_tokens_per_second": 5859.223 | |
| }, | |
| { | |
| "epoch": 1.5979797979797978, | |
| "grad_norm": 0.19286850094795227, | |
| "learning_rate": 4.197530864197531e-05, | |
| "loss": 0.1297, | |
| "num_input_tokens_seen": 4544022, | |
| "step": 198, | |
| "train_runtime": 775.0258, | |
| "train_tokens_per_second": 5863.059 | |
| }, | |
| { | |
| "epoch": 1.606060606060606, | |
| "grad_norm": 0.1876365840435028, | |
| "learning_rate": 4.11522633744856e-05, | |
| "loss": 0.1301, | |
| "num_input_tokens_seen": 4566198, | |
| "step": 199, | |
| "train_runtime": 778.2557, | |
| "train_tokens_per_second": 5867.221 | |
| }, | |
| { | |
| "epoch": 1.614141414141414, | |
| "grad_norm": 0.1976366490125656, | |
| "learning_rate": 4.032921810699588e-05, | |
| "loss": 0.1522, | |
| "num_input_tokens_seen": 4588070, | |
| "step": 200, | |
| "train_runtime": 781.4257, | |
| "train_tokens_per_second": 5871.409 | |
| }, | |
| { | |
| "epoch": 1.614141414141414, | |
| "eval_loss": 0.17329195141792297, | |
| "eval_runtime": 15.9586, | |
| "eval_samples_per_second": 55.08, | |
| "eval_steps_per_second": 3.446, | |
| "num_input_tokens_seen": 4588070, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 1.6222222222222222, | |
| "grad_norm": 0.2171986699104309, | |
| "learning_rate": 3.950617283950617e-05, | |
| "loss": 0.1527, | |
| "num_input_tokens_seen": 4612646, | |
| "step": 201, | |
| "train_runtime": 800.9346, | |
| "train_tokens_per_second": 5759.079 | |
| }, | |
| { | |
| "epoch": 1.6303030303030304, | |
| "grad_norm": 0.18816785514354706, | |
| "learning_rate": 3.868312757201646e-05, | |
| "loss": 0.1419, | |
| "num_input_tokens_seen": 4633446, | |
| "step": 202, | |
| "train_runtime": 804.007, | |
| "train_tokens_per_second": 5762.942 | |
| }, | |
| { | |
| "epoch": 1.6383838383838385, | |
| "grad_norm": 0.1965034157037735, | |
| "learning_rate": 3.786008230452675e-05, | |
| "loss": 0.1294, | |
| "num_input_tokens_seen": 4656278, | |
| "step": 203, | |
| "train_runtime": 807.3253, | |
| "train_tokens_per_second": 5767.536 | |
| }, | |
| { | |
| "epoch": 1.6464646464646466, | |
| "grad_norm": 0.20697784423828125, | |
| "learning_rate": 3.7037037037037037e-05, | |
| "loss": 0.1277, | |
| "num_input_tokens_seen": 4678006, | |
| "step": 204, | |
| "train_runtime": 810.4618, | |
| "train_tokens_per_second": 5772.025 | |
| }, | |
| { | |
| "epoch": 1.6545454545454545, | |
| "grad_norm": 0.1958000510931015, | |
| "learning_rate": 3.6213991769547327e-05, | |
| "loss": 0.1268, | |
| "num_input_tokens_seen": 4701206, | |
| "step": 205, | |
| "train_runtime": 813.8387, | |
| "train_tokens_per_second": 5776.582 | |
| }, | |
| { | |
| "epoch": 1.6626262626262627, | |
| "grad_norm": 0.1861943006515503, | |
| "learning_rate": 3.539094650205762e-05, | |
| "loss": 0.1549, | |
| "num_input_tokens_seen": 4724646, | |
| "step": 206, | |
| "train_runtime": 817.2582, | |
| "train_tokens_per_second": 5781.093 | |
| }, | |
| { | |
| "epoch": 1.6707070707070706, | |
| "grad_norm": 0.1965884119272232, | |
| "learning_rate": 3.45679012345679e-05, | |
| "loss": 0.1221, | |
| "num_input_tokens_seen": 4748998, | |
| "step": 207, | |
| "train_runtime": 820.7842, | |
| "train_tokens_per_second": 5785.927 | |
| }, | |
| { | |
| "epoch": 1.6787878787878787, | |
| "grad_norm": 0.23105938732624054, | |
| "learning_rate": 3.374485596707819e-05, | |
| "loss": 0.1353, | |
| "num_input_tokens_seen": 4768294, | |
| "step": 208, | |
| "train_runtime": 823.5916, | |
| "train_tokens_per_second": 5789.634 | |
| }, | |
| { | |
| "epoch": 1.6868686868686869, | |
| "grad_norm": 0.17601825296878815, | |
| "learning_rate": 3.292181069958848e-05, | |
| "loss": 0.1743, | |
| "num_input_tokens_seen": 4792550, | |
| "step": 209, | |
| "train_runtime": 827.116, | |
| "train_tokens_per_second": 5794.29 | |
| }, | |
| { | |
| "epoch": 1.694949494949495, | |
| "grad_norm": 0.192215234041214, | |
| "learning_rate": 3.209876543209876e-05, | |
| "loss": 0.1441, | |
| "num_input_tokens_seen": 4816006, | |
| "step": 210, | |
| "train_runtime": 830.4803, | |
| "train_tokens_per_second": 5799.061 | |
| }, | |
| { | |
| "epoch": 1.7030303030303031, | |
| "grad_norm": 0.1799449473619461, | |
| "learning_rate": 3.127572016460906e-05, | |
| "loss": 0.1755, | |
| "num_input_tokens_seen": 4839222, | |
| "step": 211, | |
| "train_runtime": 834.3314, | |
| "train_tokens_per_second": 5800.12 | |
| }, | |
| { | |
| "epoch": 1.7111111111111112, | |
| "grad_norm": 0.18329425156116486, | |
| "learning_rate": 3.0452674897119343e-05, | |
| "loss": 0.1469, | |
| "num_input_tokens_seen": 4862822, | |
| "step": 212, | |
| "train_runtime": 837.7144, | |
| "train_tokens_per_second": 5804.869 | |
| }, | |
| { | |
| "epoch": 1.7191919191919192, | |
| "grad_norm": 0.2032759040594101, | |
| "learning_rate": 2.962962962962963e-05, | |
| "loss": 0.1809, | |
| "num_input_tokens_seen": 4884582, | |
| "step": 213, | |
| "train_runtime": 840.9065, | |
| "train_tokens_per_second": 5808.71 | |
| }, | |
| { | |
| "epoch": 1.7272727272727273, | |
| "grad_norm": 0.20157882571220398, | |
| "learning_rate": 2.880658436213992e-05, | |
| "loss": 0.1466, | |
| "num_input_tokens_seen": 4909174, | |
| "step": 214, | |
| "train_runtime": 844.4537, | |
| "train_tokens_per_second": 5813.432 | |
| }, | |
| { | |
| "epoch": 1.7353535353535352, | |
| "grad_norm": 0.1857813447713852, | |
| "learning_rate": 2.7983539094650207e-05, | |
| "loss": 0.1549, | |
| "num_input_tokens_seen": 4933798, | |
| "step": 215, | |
| "train_runtime": 848.0304, | |
| "train_tokens_per_second": 5817.949 | |
| }, | |
| { | |
| "epoch": 1.7434343434343433, | |
| "grad_norm": 0.21499592065811157, | |
| "learning_rate": 2.7160493827160493e-05, | |
| "loss": 0.1383, | |
| "num_input_tokens_seen": 4952742, | |
| "step": 216, | |
| "train_runtime": 850.8052, | |
| "train_tokens_per_second": 5821.241 | |
| }, | |
| { | |
| "epoch": 1.7515151515151515, | |
| "grad_norm": 0.17735537886619568, | |
| "learning_rate": 2.6337448559670787e-05, | |
| "loss": 0.1496, | |
| "num_input_tokens_seen": 4976246, | |
| "step": 217, | |
| "train_runtime": 854.1841, | |
| "train_tokens_per_second": 5825.73 | |
| }, | |
| { | |
| "epoch": 1.7595959595959596, | |
| "grad_norm": 0.18576224148273468, | |
| "learning_rate": 2.551440329218107e-05, | |
| "loss": 0.1409, | |
| "num_input_tokens_seen": 4995798, | |
| "step": 218, | |
| "train_runtime": 857.0834, | |
| "train_tokens_per_second": 5828.836 | |
| }, | |
| { | |
| "epoch": 1.7676767676767677, | |
| "grad_norm": 0.18721511960029602, | |
| "learning_rate": 2.4691358024691357e-05, | |
| "loss": 0.1294, | |
| "num_input_tokens_seen": 5018838, | |
| "step": 219, | |
| "train_runtime": 860.4125, | |
| "train_tokens_per_second": 5833.06 | |
| }, | |
| { | |
| "epoch": 1.7757575757575759, | |
| "grad_norm": 0.18898357450962067, | |
| "learning_rate": 2.3868312757201647e-05, | |
| "loss": 0.1011, | |
| "num_input_tokens_seen": 5041782, | |
| "step": 220, | |
| "train_runtime": 863.7343, | |
| "train_tokens_per_second": 5837.191 | |
| }, | |
| { | |
| "epoch": 1.783838383838384, | |
| "grad_norm": 0.1976945698261261, | |
| "learning_rate": 2.3045267489711937e-05, | |
| "loss": 0.1584, | |
| "num_input_tokens_seen": 5063478, | |
| "step": 221, | |
| "train_runtime": 866.9236, | |
| "train_tokens_per_second": 5840.743 | |
| }, | |
| { | |
| "epoch": 1.791919191919192, | |
| "grad_norm": 0.19949166476726532, | |
| "learning_rate": 2.2222222222222223e-05, | |
| "loss": 0.1523, | |
| "num_input_tokens_seen": 5085526, | |
| "step": 222, | |
| "train_runtime": 870.1255, | |
| "train_tokens_per_second": 5844.589 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 0.181776225566864, | |
| "learning_rate": 2.139917695473251e-05, | |
| "loss": 0.1641, | |
| "num_input_tokens_seen": 5109430, | |
| "step": 223, | |
| "train_runtime": 873.6231, | |
| "train_tokens_per_second": 5848.552 | |
| }, | |
| { | |
| "epoch": 1.808080808080808, | |
| "grad_norm": 0.21610131859779358, | |
| "learning_rate": 2.05761316872428e-05, | |
| "loss": 0.116, | |
| "num_input_tokens_seen": 5132182, | |
| "step": 224, | |
| "train_runtime": 876.9236, | |
| "train_tokens_per_second": 5852.485 | |
| }, | |
| { | |
| "epoch": 1.816161616161616, | |
| "grad_norm": 0.19361373782157898, | |
| "learning_rate": 1.9753086419753087e-05, | |
| "loss": 0.1369, | |
| "num_input_tokens_seen": 5153622, | |
| "step": 225, | |
| "train_runtime": 880.0664, | |
| "train_tokens_per_second": 5855.947 | |
| }, | |
| { | |
| "epoch": 1.816161616161616, | |
| "eval_loss": 0.1724003553390503, | |
| "eval_runtime": 15.9947, | |
| "eval_samples_per_second": 54.956, | |
| "eval_steps_per_second": 3.439, | |
| "num_input_tokens_seen": 5153622, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 1.8242424242424242, | |
| "grad_norm": 0.19882901012897491, | |
| "learning_rate": 1.8930041152263377e-05, | |
| "loss": 0.1499, | |
| "num_input_tokens_seen": 5178470, | |
| "step": 226, | |
| "train_runtime": 899.6327, | |
| "train_tokens_per_second": 5756.205 | |
| }, | |
| { | |
| "epoch": 1.8323232323232324, | |
| "grad_norm": 0.19828850030899048, | |
| "learning_rate": 1.8106995884773663e-05, | |
| "loss": 0.1295, | |
| "num_input_tokens_seen": 5199062, | |
| "step": 227, | |
| "train_runtime": 902.6363, | |
| "train_tokens_per_second": 5759.864 | |
| }, | |
| { | |
| "epoch": 1.8404040404040405, | |
| "grad_norm": 0.2071538269519806, | |
| "learning_rate": 1.728395061728395e-05, | |
| "loss": 0.1739, | |
| "num_input_tokens_seen": 5218134, | |
| "step": 228, | |
| "train_runtime": 905.4534, | |
| "train_tokens_per_second": 5763.006 | |
| }, | |
| { | |
| "epoch": 1.8484848484848486, | |
| "grad_norm": 0.20533259212970734, | |
| "learning_rate": 1.646090534979424e-05, | |
| "loss": 0.1343, | |
| "num_input_tokens_seen": 5242054, | |
| "step": 229, | |
| "train_runtime": 908.9457, | |
| "train_tokens_per_second": 5767.181 | |
| }, | |
| { | |
| "epoch": 1.8565656565656565, | |
| "grad_norm": 0.19329999387264252, | |
| "learning_rate": 1.563786008230453e-05, | |
| "loss": 0.1266, | |
| "num_input_tokens_seen": 5264518, | |
| "step": 230, | |
| "train_runtime": 912.2004, | |
| "train_tokens_per_second": 5771.23 | |
| }, | |
| { | |
| "epoch": 1.8646464646464647, | |
| "grad_norm": 0.20547281205654144, | |
| "learning_rate": 1.4814814814814815e-05, | |
| "loss": 0.1622, | |
| "num_input_tokens_seen": 5284374, | |
| "step": 231, | |
| "train_runtime": 915.1219, | |
| "train_tokens_per_second": 5774.503 | |
| }, | |
| { | |
| "epoch": 1.8727272727272726, | |
| "grad_norm": 0.20196233689785004, | |
| "learning_rate": 1.3991769547325103e-05, | |
| "loss": 0.1211, | |
| "num_input_tokens_seen": 5303622, | |
| "step": 232, | |
| "train_runtime": 917.9986, | |
| "train_tokens_per_second": 5777.375 | |
| }, | |
| { | |
| "epoch": 1.8808080808080807, | |
| "grad_norm": 0.17019926011562347, | |
| "learning_rate": 1.3168724279835393e-05, | |
| "loss": 0.1297, | |
| "num_input_tokens_seen": 5329718, | |
| "step": 233, | |
| "train_runtime": 921.75, | |
| "train_tokens_per_second": 5782.173 | |
| }, | |
| { | |
| "epoch": 1.8888888888888888, | |
| "grad_norm": 0.1855989396572113, | |
| "learning_rate": 1.2345679012345678e-05, | |
| "loss": 0.1502, | |
| "num_input_tokens_seen": 5349718, | |
| "step": 234, | |
| "train_runtime": 924.7021, | |
| "train_tokens_per_second": 5785.342 | |
| }, | |
| { | |
| "epoch": 1.896969696969697, | |
| "grad_norm": 0.21048571169376373, | |
| "learning_rate": 1.1522633744855968e-05, | |
| "loss": 0.1483, | |
| "num_input_tokens_seen": 5369638, | |
| "step": 235, | |
| "train_runtime": 927.6143, | |
| "train_tokens_per_second": 5788.654 | |
| }, | |
| { | |
| "epoch": 1.905050505050505, | |
| "grad_norm": 0.20776841044425964, | |
| "learning_rate": 1.0699588477366255e-05, | |
| "loss": 0.1553, | |
| "num_input_tokens_seen": 5392726, | |
| "step": 236, | |
| "train_runtime": 930.986, | |
| "train_tokens_per_second": 5792.489 | |
| }, | |
| { | |
| "epoch": 1.9131313131313132, | |
| "grad_norm": 0.22271353006362915, | |
| "learning_rate": 9.876543209876543e-06, | |
| "loss": 0.1699, | |
| "num_input_tokens_seen": 5412470, | |
| "step": 237, | |
| "train_runtime": 933.9223, | |
| "train_tokens_per_second": 5795.418 | |
| }, | |
| { | |
| "epoch": 1.9212121212121214, | |
| "grad_norm": 0.20936141908168793, | |
| "learning_rate": 9.053497942386832e-06, | |
| "loss": 0.1471, | |
| "num_input_tokens_seen": 5437894, | |
| "step": 238, | |
| "train_runtime": 937.5658, | |
| "train_tokens_per_second": 5800.013 | |
| }, | |
| { | |
| "epoch": 1.9292929292929293, | |
| "grad_norm": 0.18848469853401184, | |
| "learning_rate": 8.23045267489712e-06, | |
| "loss": 0.1898, | |
| "num_input_tokens_seen": 5461686, | |
| "step": 239, | |
| "train_runtime": 940.9924, | |
| "train_tokens_per_second": 5804.177 | |
| }, | |
| { | |
| "epoch": 1.9373737373737374, | |
| "grad_norm": 0.17875902354717255, | |
| "learning_rate": 7.4074074074074075e-06, | |
| "loss": 0.147, | |
| "num_input_tokens_seen": 5486054, | |
| "step": 240, | |
| "train_runtime": 944.4956, | |
| "train_tokens_per_second": 5808.448 | |
| }, | |
| { | |
| "epoch": 1.9454545454545453, | |
| "grad_norm": 0.21896323561668396, | |
| "learning_rate": 6.584362139917697e-06, | |
| "loss": 0.1621, | |
| "num_input_tokens_seen": 5509142, | |
| "step": 241, | |
| "train_runtime": 948.3591, | |
| "train_tokens_per_second": 5809.131 | |
| }, | |
| { | |
| "epoch": 1.9535353535353535, | |
| "grad_norm": 0.19773228466510773, | |
| "learning_rate": 5.761316872427984e-06, | |
| "loss": 0.1263, | |
| "num_input_tokens_seen": 5528598, | |
| "step": 242, | |
| "train_runtime": 951.2561, | |
| "train_tokens_per_second": 5811.892 | |
| }, | |
| { | |
| "epoch": 1.9616161616161616, | |
| "grad_norm": 0.1763569563627243, | |
| "learning_rate": 4.938271604938272e-06, | |
| "loss": 0.1158, | |
| "num_input_tokens_seen": 5551926, | |
| "step": 243, | |
| "train_runtime": 954.6378, | |
| "train_tokens_per_second": 5815.741 | |
| }, | |
| { | |
| "epoch": 1.9696969696969697, | |
| "grad_norm": 0.17359760403633118, | |
| "learning_rate": 4.11522633744856e-06, | |
| "loss": 0.1097, | |
| "num_input_tokens_seen": 5574326, | |
| "step": 244, | |
| "train_runtime": 957.9246, | |
| "train_tokens_per_second": 5819.17 | |
| }, | |
| { | |
| "epoch": 1.9777777777777779, | |
| "grad_norm": 0.2085653394460678, | |
| "learning_rate": 3.2921810699588483e-06, | |
| "loss": 0.194, | |
| "num_input_tokens_seen": 5598310, | |
| "step": 245, | |
| "train_runtime": 961.3777, | |
| "train_tokens_per_second": 5823.216 | |
| }, | |
| { | |
| "epoch": 1.985858585858586, | |
| "grad_norm": 0.183889701962471, | |
| "learning_rate": 2.469135802469136e-06, | |
| "loss": 0.1558, | |
| "num_input_tokens_seen": 5620534, | |
| "step": 246, | |
| "train_runtime": 964.6204, | |
| "train_tokens_per_second": 5826.68 | |
| }, | |
| { | |
| "epoch": 1.993939393939394, | |
| "grad_norm": 0.20709186792373657, | |
| "learning_rate": 1.6460905349794242e-06, | |
| "loss": 0.1613, | |
| "num_input_tokens_seen": 5640982, | |
| "step": 247, | |
| "train_runtime": 967.6377, | |
| "train_tokens_per_second": 5829.643 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 0.2510419189929962, | |
| "learning_rate": 8.230452674897121e-07, | |
| "loss": 0.1576, | |
| "num_input_tokens_seen": 5653442, | |
| "step": 248, | |
| "train_runtime": 969.499, | |
| "train_tokens_per_second": 5831.303 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 248, | |
| "num_input_tokens_seen": 5653442, | |
| "num_train_epochs": 2, | |
| "save_steps": 30, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.4120939382807142e+17, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |