Instructions to use Taywon/B2plus_v4_qwq_e2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Taywon/B2plus_v4_qwq_e2 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/QwQ-32B") model = PeftModel.from_pretrained(base_model, "Taywon/B2plus_v4_qwq_e2") - Transformers
How to use Taywon/B2plus_v4_qwq_e2 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Taywon/B2plus_v4_qwq_e2") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Taywon/B2plus_v4_qwq_e2", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Taywon/B2plus_v4_qwq_e2 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Taywon/B2plus_v4_qwq_e2" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/B2plus_v4_qwq_e2", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/Taywon/B2plus_v4_qwq_e2
- SGLang
How to use Taywon/B2plus_v4_qwq_e2 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Taywon/B2plus_v4_qwq_e2" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/B2plus_v4_qwq_e2", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Taywon/B2plus_v4_qwq_e2" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/B2plus_v4_qwq_e2", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use Taywon/B2plus_v4_qwq_e2 with Docker Model Runner:
docker model run hf.co/Taywon/B2plus_v4_qwq_e2
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.0, | |
| "eval_steps": 500, | |
| "global_step": 206, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.3152819871902466, | |
| "epoch": 0.009708737864077669, | |
| "grad_norm": 1.013494849205017, | |
| "learning_rate": 0.0, | |
| "loss": 2.06831431388855, | |
| "mean_token_accuracy": 0.5338841378688812, | |
| "num_tokens": 97105.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 1.3242674767971039, | |
| "epoch": 0.019417475728155338, | |
| "grad_norm": 1.0874853134155273, | |
| "learning_rate": 3.125e-06, | |
| "loss": 2.139530658721924, | |
| "mean_token_accuracy": 0.5263050831854343, | |
| "num_tokens": 192679.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 1.355704814195633, | |
| "epoch": 0.02912621359223301, | |
| "grad_norm": 0.998701274394989, | |
| "learning_rate": 6.25e-06, | |
| "loss": 2.0967135429382324, | |
| "mean_token_accuracy": 0.525411419570446, | |
| "num_tokens": 290599.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 1.4417763948440552, | |
| "epoch": 0.038834951456310676, | |
| "grad_norm": 0.8833345770835876, | |
| "learning_rate": 9.375000000000001e-06, | |
| "loss": 2.1067581176757812, | |
| "mean_token_accuracy": 0.5188259109854698, | |
| "num_tokens": 388130.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 1.4466145783662796, | |
| "epoch": 0.04854368932038835, | |
| "grad_norm": 0.7175306081771851, | |
| "learning_rate": 1.25e-05, | |
| "loss": 1.998451590538025, | |
| "mean_token_accuracy": 0.5344960391521454, | |
| "num_tokens": 485983.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 1.521438479423523, | |
| "epoch": 0.05825242718446602, | |
| "grad_norm": 0.5840274691581726, | |
| "learning_rate": 1.5625e-05, | |
| "loss": 1.966963768005371, | |
| "mean_token_accuracy": 0.5378070250153542, | |
| "num_tokens": 583257.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 1.590747281908989, | |
| "epoch": 0.06796116504854369, | |
| "grad_norm": 0.5097014904022217, | |
| "learning_rate": 1.8750000000000002e-05, | |
| "loss": 1.9825010299682617, | |
| "mean_token_accuracy": 0.5324273854494095, | |
| "num_tokens": 678553.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 1.6503181159496307, | |
| "epoch": 0.07766990291262135, | |
| "grad_norm": 0.374606192111969, | |
| "learning_rate": 2.1875e-05, | |
| "loss": 1.8895000219345093, | |
| "mean_token_accuracy": 0.5438744276762009, | |
| "num_tokens": 774991.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 1.7381516695022583, | |
| "epoch": 0.08737864077669903, | |
| "grad_norm": 0.3151414096355438, | |
| "learning_rate": 2.5e-05, | |
| "loss": 1.8734210729599, | |
| "mean_token_accuracy": 0.5423448756337166, | |
| "num_tokens": 871685.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 1.72954061627388, | |
| "epoch": 0.0970873786407767, | |
| "grad_norm": 0.26697251200675964, | |
| "learning_rate": 2.8125000000000003e-05, | |
| "loss": 1.7822761535644531, | |
| "mean_token_accuracy": 0.5574369356036186, | |
| "num_tokens": 968934.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.8142512142658234, | |
| "epoch": 0.10679611650485436, | |
| "grad_norm": 0.26576197147369385, | |
| "learning_rate": 3.125e-05, | |
| "loss": 1.7738474607467651, | |
| "mean_token_accuracy": 0.5553920194506645, | |
| "num_tokens": 1066190.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 1.8880750685930252, | |
| "epoch": 0.11650485436893204, | |
| "grad_norm": 0.2821778357028961, | |
| "learning_rate": 3.4375e-05, | |
| "loss": 1.7811144590377808, | |
| "mean_token_accuracy": 0.554568275809288, | |
| "num_tokens": 1163717.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 1.8850630968809128, | |
| "epoch": 0.1262135922330097, | |
| "grad_norm": 0.2994160056114197, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "loss": 1.731427550315857, | |
| "mean_token_accuracy": 0.5632588267326355, | |
| "num_tokens": 1261260.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 1.9034151881933212, | |
| "epoch": 0.13592233009708737, | |
| "grad_norm": 0.3169096112251282, | |
| "learning_rate": 4.0625000000000005e-05, | |
| "loss": 1.7296199798583984, | |
| "mean_token_accuracy": 0.5644616037607193, | |
| "num_tokens": 1358315.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 1.861739456653595, | |
| "epoch": 0.14563106796116504, | |
| "grad_norm": 0.3155674636363983, | |
| "learning_rate": 4.375e-05, | |
| "loss": 1.673210859298706, | |
| "mean_token_accuracy": 0.576985627412796, | |
| "num_tokens": 1455424.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 1.838089257478714, | |
| "epoch": 0.1553398058252427, | |
| "grad_norm": 0.30909860134124756, | |
| "learning_rate": 4.6875e-05, | |
| "loss": 1.6549508571624756, | |
| "mean_token_accuracy": 0.5776421800255775, | |
| "num_tokens": 1552741.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 1.8052831888198853, | |
| "epoch": 0.1650485436893204, | |
| "grad_norm": 0.2848927080631256, | |
| "learning_rate": 5e-05, | |
| "loss": 1.6311283111572266, | |
| "mean_token_accuracy": 0.5776514038443565, | |
| "num_tokens": 1650044.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 1.7298080027103424, | |
| "epoch": 0.17475728155339806, | |
| "grad_norm": 0.24145011603832245, | |
| "learning_rate": 4.999856295503635e-05, | |
| "loss": 1.6070364713668823, | |
| "mean_token_accuracy": 0.5808622017502785, | |
| "num_tokens": 1747782.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 1.64244344830513, | |
| "epoch": 0.18446601941747573, | |
| "grad_norm": 0.20389729738235474, | |
| "learning_rate": 4.999425198535325e-05, | |
| "loss": 1.5785616636276245, | |
| "mean_token_accuracy": 0.5904434770345688, | |
| "num_tokens": 1845724.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 1.5861433744430542, | |
| "epoch": 0.1941747572815534, | |
| "grad_norm": 0.1882556676864624, | |
| "learning_rate": 4.998706758655528e-05, | |
| "loss": 1.561955213546753, | |
| "mean_token_accuracy": 0.5861038938164711, | |
| "num_tokens": 1943411.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.4805333763360977, | |
| "epoch": 0.20388349514563106, | |
| "grad_norm": 0.19283851981163025, | |
| "learning_rate": 4.997701058458676e-05, | |
| "loss": 1.510377287864685, | |
| "mean_token_accuracy": 0.5976782292127609, | |
| "num_tokens": 2041045.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 1.4247176200151443, | |
| "epoch": 0.21359223300970873, | |
| "grad_norm": 0.2663690149784088, | |
| "learning_rate": 4.996408213563684e-05, | |
| "loss": 1.5150444507598877, | |
| "mean_token_accuracy": 0.5990786626935005, | |
| "num_tokens": 2138535.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 1.4107022881507874, | |
| "epoch": 0.22330097087378642, | |
| "grad_norm": 0.24283358454704285, | |
| "learning_rate": 4.994828372600649e-05, | |
| "loss": 1.4896345138549805, | |
| "mean_token_accuracy": 0.6046600863337517, | |
| "num_tokens": 2235538.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 1.3890789598226547, | |
| "epoch": 0.23300970873786409, | |
| "grad_norm": 0.2506687343120575, | |
| "learning_rate": 4.9929617171937724e-05, | |
| "loss": 1.4759382009506226, | |
| "mean_token_accuracy": 0.6044173762202263, | |
| "num_tokens": 2332954.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 1.4158536195755005, | |
| "epoch": 0.24271844660194175, | |
| "grad_norm": 0.2098265439271927, | |
| "learning_rate": 4.9908084619404735e-05, | |
| "loss": 1.4671399593353271, | |
| "mean_token_accuracy": 0.6056077107787132, | |
| "num_tokens": 2431031.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 1.4332131743431091, | |
| "epoch": 0.2524271844660194, | |
| "grad_norm": 0.17440126836299896, | |
| "learning_rate": 4.988368854386722e-05, | |
| "loss": 1.4597738981246948, | |
| "mean_token_accuracy": 0.6085917800664902, | |
| "num_tokens": 2527933.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 1.4164835065603256, | |
| "epoch": 0.2621359223300971, | |
| "grad_norm": 0.1584484875202179, | |
| "learning_rate": 4.985643174998578e-05, | |
| "loss": 1.4157624244689941, | |
| "mean_token_accuracy": 0.6172334477305412, | |
| "num_tokens": 2625130.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 1.448016420006752, | |
| "epoch": 0.27184466019417475, | |
| "grad_norm": 0.15808650851249695, | |
| "learning_rate": 4.982631737129948e-05, | |
| "loss": 1.4137294292449951, | |
| "mean_token_accuracy": 0.6172233298420906, | |
| "num_tokens": 2722735.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 1.4877165704965591, | |
| "epoch": 0.2815533980582524, | |
| "grad_norm": 0.15937305986881256, | |
| "learning_rate": 4.9793348869865616e-05, | |
| "loss": 1.4389235973358154, | |
| "mean_token_accuracy": 0.6117468476295471, | |
| "num_tokens": 2820721.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 1.4804623126983643, | |
| "epoch": 0.2912621359223301, | |
| "grad_norm": 0.15408481657505035, | |
| "learning_rate": 4.9757530035861716e-05, | |
| "loss": 1.4307830333709717, | |
| "mean_token_accuracy": 0.6147695183753967, | |
| "num_tokens": 2918531.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 1.431130662560463, | |
| "epoch": 0.30097087378640774, | |
| "grad_norm": 0.15174533426761627, | |
| "learning_rate": 4.971886498714977e-05, | |
| "loss": 1.3788732290267944, | |
| "mean_token_accuracy": 0.6244773417711258, | |
| "num_tokens": 3014027.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 1.432707354426384, | |
| "epoch": 0.3106796116504854, | |
| "grad_norm": 0.14417818188667297, | |
| "learning_rate": 4.967735816880286e-05, | |
| "loss": 1.3854697942733765, | |
| "mean_token_accuracy": 0.6244093701243401, | |
| "num_tokens": 3111172.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 1.408346712589264, | |
| "epoch": 0.32038834951456313, | |
| "grad_norm": 0.13806791603565216, | |
| "learning_rate": 4.963301435259413e-05, | |
| "loss": 1.37909734249115, | |
| "mean_token_accuracy": 0.6215110719203949, | |
| "num_tokens": 3208860.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 1.3968226611614227, | |
| "epoch": 0.3300970873786408, | |
| "grad_norm": 0.14189019799232483, | |
| "learning_rate": 4.95858386364482e-05, | |
| "loss": 1.3762025833129883, | |
| "mean_token_accuracy": 0.6241011992096901, | |
| "num_tokens": 3305964.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 1.3652866929769516, | |
| "epoch": 0.33980582524271846, | |
| "grad_norm": 0.13668735325336456, | |
| "learning_rate": 4.9535836443855096e-05, | |
| "loss": 1.3661797046661377, | |
| "mean_token_accuracy": 0.6231197491288185, | |
| "num_tokens": 3403337.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 1.3354476243257523, | |
| "epoch": 0.34951456310679613, | |
| "grad_norm": 0.13242210447788239, | |
| "learning_rate": 4.948301352324673e-05, | |
| "loss": 1.3337945938110352, | |
| "mean_token_accuracy": 0.6336007639765739, | |
| "num_tokens": 3500500.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 1.3027702569961548, | |
| "epoch": 0.3592233009708738, | |
| "grad_norm": 0.12860701978206635, | |
| "learning_rate": 4.942737594733609e-05, | |
| "loss": 1.3151164054870605, | |
| "mean_token_accuracy": 0.6383665949106216, | |
| "num_tokens": 3597306.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 1.3396568596363068, | |
| "epoch": 0.36893203883495146, | |
| "grad_norm": 0.1314004808664322, | |
| "learning_rate": 4.9368930112419e-05, | |
| "loss": 1.3459738492965698, | |
| "mean_token_accuracy": 0.6287253126502037, | |
| "num_tokens": 3694352.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 1.331050619482994, | |
| "epoch": 0.3786407766990291, | |
| "grad_norm": 0.12769116461277008, | |
| "learning_rate": 4.930768273763889e-05, | |
| "loss": 1.3475216627120972, | |
| "mean_token_accuracy": 0.6293819546699524, | |
| "num_tokens": 3792464.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 1.328546553850174, | |
| "epoch": 0.3883495145631068, | |
| "grad_norm": 0.1277284175157547, | |
| "learning_rate": 4.92436408642143e-05, | |
| "loss": 1.3299285173416138, | |
| "mean_token_accuracy": 0.6318994611501694, | |
| "num_tokens": 3889619.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 1.320247620344162, | |
| "epoch": 0.39805825242718446, | |
| "grad_norm": 0.12813310325145721, | |
| "learning_rate": 4.917681185462934e-05, | |
| "loss": 1.3119574785232544, | |
| "mean_token_accuracy": 0.6348763853311539, | |
| "num_tokens": 3986630.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 1.3185490667819977, | |
| "epoch": 0.4077669902912621, | |
| "grad_norm": 0.1228400245308876, | |
| "learning_rate": 4.910720339178735e-05, | |
| "loss": 1.310436725616455, | |
| "mean_token_accuracy": 0.6377311646938324, | |
| "num_tokens": 4083691.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 1.3097300678491592, | |
| "epoch": 0.4174757281553398, | |
| "grad_norm": 0.12255794554948807, | |
| "learning_rate": 4.90348234781276e-05, | |
| "loss": 1.2923684120178223, | |
| "mean_token_accuracy": 0.6398537456989288, | |
| "num_tokens": 4181870.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 1.3270199447870255, | |
| "epoch": 0.42718446601941745, | |
| "grad_norm": 0.13049428164958954, | |
| "learning_rate": 4.895968043470532e-05, | |
| "loss": 1.3082845211029053, | |
| "mean_token_accuracy": 0.6348344013094902, | |
| "num_tokens": 4277672.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 1.2746291309595108, | |
| "epoch": 0.4368932038834951, | |
| "grad_norm": 0.11880674958229065, | |
| "learning_rate": 4.8881782900235094e-05, | |
| "loss": 1.2675082683563232, | |
| "mean_token_accuracy": 0.6442193761467934, | |
| "num_tokens": 4375365.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 1.2948976457118988, | |
| "epoch": 0.44660194174757284, | |
| "grad_norm": 0.12034562975168228, | |
| "learning_rate": 4.880113983009768e-05, | |
| "loss": 1.2931270599365234, | |
| "mean_token_accuracy": 0.638730451464653, | |
| "num_tokens": 4472689.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 1.3306090533733368, | |
| "epoch": 0.4563106796116505, | |
| "grad_norm": 0.12678076326847076, | |
| "learning_rate": 4.87177604953105e-05, | |
| "loss": 1.3286418914794922, | |
| "mean_token_accuracy": 0.630160316824913, | |
| "num_tokens": 4569961.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 1.2873755544424057, | |
| "epoch": 0.46601941747572817, | |
| "grad_norm": 0.12189076095819473, | |
| "learning_rate": 4.86316544814618e-05, | |
| "loss": 1.2889766693115234, | |
| "mean_token_accuracy": 0.6420179456472397, | |
| "num_tokens": 4667359.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 1.2845768928527832, | |
| "epoch": 0.47572815533980584, | |
| "grad_norm": 0.12239941954612732, | |
| "learning_rate": 4.854283168760868e-05, | |
| "loss": 1.2809079885482788, | |
| "mean_token_accuracy": 0.6406335309147835, | |
| "num_tokens": 4765400.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 1.271145537495613, | |
| "epoch": 0.4854368932038835, | |
| "grad_norm": 0.11950168758630753, | |
| "learning_rate": 4.8451302325139004e-05, | |
| "loss": 1.2703527212142944, | |
| "mean_token_accuracy": 0.6420813724398613, | |
| "num_tokens": 4863204.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 1.2670437693595886, | |
| "epoch": 0.49514563106796117, | |
| "grad_norm": 0.12081712484359741, | |
| "learning_rate": 4.835707691659753e-05, | |
| "loss": 1.2614223957061768, | |
| "mean_token_accuracy": 0.6454492062330246, | |
| "num_tokens": 4960926.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 1.2643397003412247, | |
| "epoch": 0.5048543689320388, | |
| "grad_norm": 0.12239903211593628, | |
| "learning_rate": 4.8260166294476164e-05, | |
| "loss": 1.2616130113601685, | |
| "mean_token_accuracy": 0.645437128841877, | |
| "num_tokens": 5058013.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 1.2825093269348145, | |
| "epoch": 0.5145631067961165, | |
| "grad_norm": 0.1260427087545395, | |
| "learning_rate": 4.8160581599968625e-05, | |
| "loss": 1.277658224105835, | |
| "mean_token_accuracy": 0.6420258656144142, | |
| "num_tokens": 5153970.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 1.2708389461040497, | |
| "epoch": 0.5242718446601942, | |
| "grad_norm": 0.12050087749958038, | |
| "learning_rate": 4.8058334281689595e-05, | |
| "loss": 1.2695984840393066, | |
| "mean_token_accuracy": 0.642313040792942, | |
| "num_tokens": 5251276.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 1.2563078105449677, | |
| "epoch": 0.5339805825242718, | |
| "grad_norm": 0.11743330955505371, | |
| "learning_rate": 4.7953436094358595e-05, | |
| "loss": 1.2539889812469482, | |
| "mean_token_accuracy": 0.6447448581457138, | |
| "num_tokens": 5348605.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 1.2068996280431747, | |
| "epoch": 0.5436893203883495, | |
| "grad_norm": 0.12018584460020065, | |
| "learning_rate": 4.784589909744855e-05, | |
| "loss": 1.216509222984314, | |
| "mean_token_accuracy": 0.6554165631532669, | |
| "num_tokens": 5446513.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 1.2394993752241135, | |
| "epoch": 0.5533980582524272, | |
| "grad_norm": 0.12352150678634644, | |
| "learning_rate": 4.7735735653799463e-05, | |
| "loss": 1.2473233938217163, | |
| "mean_token_accuracy": 0.6503345593810081, | |
| "num_tokens": 5543963.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 1.246939942240715, | |
| "epoch": 0.5631067961165048, | |
| "grad_norm": 0.12477197498083115, | |
| "learning_rate": 4.762295842819707e-05, | |
| "loss": 1.250666618347168, | |
| "mean_token_accuracy": 0.6479302644729614, | |
| "num_tokens": 5641181.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 1.2309289276599884, | |
| "epoch": 0.5728155339805825, | |
| "grad_norm": 0.12381109595298767, | |
| "learning_rate": 4.75075803859169e-05, | |
| "loss": 1.2395830154418945, | |
| "mean_token_accuracy": 0.6485741809010506, | |
| "num_tokens": 5738020.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 1.2478574961423874, | |
| "epoch": 0.5825242718446602, | |
| "grad_norm": 0.11805979907512665, | |
| "learning_rate": 4.7389614791233726e-05, | |
| "loss": 1.2468922138214111, | |
| "mean_token_accuracy": 0.6481822803616524, | |
| "num_tokens": 5835528.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 1.2492798864841461, | |
| "epoch": 0.5922330097087378, | |
| "grad_norm": 0.12080500274896622, | |
| "learning_rate": 4.726907520589664e-05, | |
| "loss": 1.237337589263916, | |
| "mean_token_accuracy": 0.6492728218436241, | |
| "num_tokens": 5933622.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 1.2176159173250198, | |
| "epoch": 0.6019417475728155, | |
| "grad_norm": 0.11797010898590088, | |
| "learning_rate": 4.714597548756996e-05, | |
| "loss": 1.2085245847702026, | |
| "mean_token_accuracy": 0.6568486616015434, | |
| "num_tokens": 6030609.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 1.2172307223081589, | |
| "epoch": 0.6116504854368932, | |
| "grad_norm": 0.12290960550308228, | |
| "learning_rate": 4.702032978824011e-05, | |
| "loss": 1.209407091140747, | |
| "mean_token_accuracy": 0.6554706916213036, | |
| "num_tokens": 6127908.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 1.2215903252363205, | |
| "epoch": 0.6213592233009708, | |
| "grad_norm": 0.12479083985090256, | |
| "learning_rate": 4.6892152552588655e-05, | |
| "loss": 1.2204253673553467, | |
| "mean_token_accuracy": 0.6541763246059418, | |
| "num_tokens": 6225260.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 1.235756516456604, | |
| "epoch": 0.6310679611650486, | |
| "grad_norm": 0.12294752150774002, | |
| "learning_rate": 4.6761458516331655e-05, | |
| "loss": 1.2323334217071533, | |
| "mean_token_accuracy": 0.6487969532608986, | |
| "num_tokens": 6322811.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 1.2219218015670776, | |
| "epoch": 0.6407766990291263, | |
| "grad_norm": 0.12319876253604889, | |
| "learning_rate": 4.662826270452565e-05, | |
| "loss": 1.2222312688827515, | |
| "mean_token_accuracy": 0.6520592123270035, | |
| "num_tokens": 6419134.0, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 1.2260529547929764, | |
| "epoch": 0.6504854368932039, | |
| "grad_norm": 0.12657777965068817, | |
| "learning_rate": 4.649258042984026e-05, | |
| "loss": 1.2416422367095947, | |
| "mean_token_accuracy": 0.6495706215500832, | |
| "num_tokens": 6516137.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 1.1933054029941559, | |
| "epoch": 0.6601941747572816, | |
| "grad_norm": 0.12323662638664246, | |
| "learning_rate": 4.6354427290797875e-05, | |
| "loss": 1.2011079788208008, | |
| "mean_token_accuracy": 0.6561424136161804, | |
| "num_tokens": 6613796.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 1.221726194024086, | |
| "epoch": 0.6699029126213593, | |
| "grad_norm": 0.12489137798547745, | |
| "learning_rate": 4.621381916998029e-05, | |
| "loss": 1.2248003482818604, | |
| "mean_token_accuracy": 0.6516422927379608, | |
| "num_tokens": 6711660.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 1.206027626991272, | |
| "epoch": 0.6796116504854369, | |
| "grad_norm": 0.12634317576885223, | |
| "learning_rate": 4.607077223220285e-05, | |
| "loss": 1.2010035514831543, | |
| "mean_token_accuracy": 0.6585103869438171, | |
| "num_tokens": 6808587.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 1.2234635204076767, | |
| "epoch": 0.6893203883495146, | |
| "grad_norm": 0.12501473724842072, | |
| "learning_rate": 4.592530292265609e-05, | |
| "loss": 1.214389681816101, | |
| "mean_token_accuracy": 0.652966596186161, | |
| "num_tokens": 6906120.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 1.20992873609066, | |
| "epoch": 0.6990291262135923, | |
| "grad_norm": 0.12392093241214752, | |
| "learning_rate": 4.5777427965015096e-05, | |
| "loss": 1.2072722911834717, | |
| "mean_token_accuracy": 0.6577531844377518, | |
| "num_tokens": 7004058.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 1.1975662112236023, | |
| "epoch": 0.7087378640776699, | |
| "grad_norm": 0.12035489082336426, | |
| "learning_rate": 4.562716435951692e-05, | |
| "loss": 1.1932990550994873, | |
| "mean_token_accuracy": 0.6592987105250359, | |
| "num_tokens": 7101920.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 1.210291549563408, | |
| "epoch": 0.7184466019417476, | |
| "grad_norm": 0.12668585777282715, | |
| "learning_rate": 4.5474529381006146e-05, | |
| "loss": 1.1978528499603271, | |
| "mean_token_accuracy": 0.6573837548494339, | |
| "num_tokens": 7198756.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 1.2065477669239044, | |
| "epoch": 0.7281553398058253, | |
| "grad_norm": 0.1260020136833191, | |
| "learning_rate": 4.531954057694897e-05, | |
| "loss": 1.211967945098877, | |
| "mean_token_accuracy": 0.6572022661566734, | |
| "num_tokens": 7296339.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 1.2129930704832077, | |
| "epoch": 0.7378640776699029, | |
| "grad_norm": 0.12252921611070633, | |
| "learning_rate": 4.516221576541581e-05, | |
| "loss": 1.2114158868789673, | |
| "mean_token_accuracy": 0.6573594808578491, | |
| "num_tokens": 7393950.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 1.1850701719522476, | |
| "epoch": 0.7475728155339806, | |
| "grad_norm": 0.1253945231437683, | |
| "learning_rate": 4.5002573033032904e-05, | |
| "loss": 1.1827876567840576, | |
| "mean_token_accuracy": 0.6604309305548668, | |
| "num_tokens": 7489205.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 1.2005933076143265, | |
| "epoch": 0.7572815533980582, | |
| "grad_norm": 0.126405268907547, | |
| "learning_rate": 4.484063073290301e-05, | |
| "loss": 1.1962429285049438, | |
| "mean_token_accuracy": 0.6605332940816879, | |
| "num_tokens": 7584161.0, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 1.167565494775772, | |
| "epoch": 0.7669902912621359, | |
| "grad_norm": 0.12077456712722778, | |
| "learning_rate": 4.467640748249548e-05, | |
| "loss": 1.173671841621399, | |
| "mean_token_accuracy": 0.666810154914856, | |
| "num_tokens": 7681353.0, | |
| "step": 79 | |
| }, | |
| { | |
| "entropy": 1.1648044735193253, | |
| "epoch": 0.7766990291262136, | |
| "grad_norm": 0.1220446452498436, | |
| "learning_rate": 4.4509922161505926e-05, | |
| "loss": 1.1669106483459473, | |
| "mean_token_accuracy": 0.6648600175976753, | |
| "num_tokens": 7778582.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 1.1993677020072937, | |
| "epoch": 0.7864077669902912, | |
| "grad_norm": 0.12758223712444305, | |
| "learning_rate": 4.4341193909685686e-05, | |
| "loss": 1.2060935497283936, | |
| "mean_token_accuracy": 0.656955823302269, | |
| "num_tokens": 7874950.0, | |
| "step": 81 | |
| }, | |
| { | |
| "entropy": 1.1694086194038391, | |
| "epoch": 0.7961165048543689, | |
| "grad_norm": 0.12749262154102325, | |
| "learning_rate": 4.417024212464152e-05, | |
| "loss": 1.1744275093078613, | |
| "mean_token_accuracy": 0.6638457253575325, | |
| "num_tokens": 7971956.0, | |
| "step": 82 | |
| }, | |
| { | |
| "entropy": 1.1816840171813965, | |
| "epoch": 0.8058252427184466, | |
| "grad_norm": 0.12547384202480316, | |
| "learning_rate": 4.399708645960559e-05, | |
| "loss": 1.1782863140106201, | |
| "mean_token_accuracy": 0.6614864841103554, | |
| "num_tokens": 8068461.0, | |
| "step": 83 | |
| }, | |
| { | |
| "entropy": 1.1679448634386063, | |
| "epoch": 0.8155339805825242, | |
| "grad_norm": 0.12635710835456848, | |
| "learning_rate": 4.382174682117598e-05, | |
| "loss": 1.1667355298995972, | |
| "mean_token_accuracy": 0.6685158833861351, | |
| "num_tokens": 8166250.0, | |
| "step": 84 | |
| }, | |
| { | |
| "entropy": 1.1952285468578339, | |
| "epoch": 0.8252427184466019, | |
| "grad_norm": 0.12347149848937988, | |
| "learning_rate": 4.364424336702825e-05, | |
| "loss": 1.1968965530395508, | |
| "mean_token_accuracy": 0.6564839482307434, | |
| "num_tokens": 8263412.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 1.162320762872696, | |
| "epoch": 0.8349514563106796, | |
| "grad_norm": 0.1282951831817627, | |
| "learning_rate": 4.346459650359798e-05, | |
| "loss": 1.165436029434204, | |
| "mean_token_accuracy": 0.6640432700514793, | |
| "num_tokens": 8361054.0, | |
| "step": 86 | |
| }, | |
| { | |
| "entropy": 1.1757322996854782, | |
| "epoch": 0.8446601941747572, | |
| "grad_norm": 0.12616223096847534, | |
| "learning_rate": 4.328282688373479e-05, | |
| "loss": 1.1854305267333984, | |
| "mean_token_accuracy": 0.6585058197379112, | |
| "num_tokens": 8458058.0, | |
| "step": 87 | |
| }, | |
| { | |
| "entropy": 1.2041359692811966, | |
| "epoch": 0.8543689320388349, | |
| "grad_norm": 0.12326717376708984, | |
| "learning_rate": 4.3098955404328045e-05, | |
| "loss": 1.2033782005310059, | |
| "mean_token_accuracy": 0.6559617221355438, | |
| "num_tokens": 8552707.0, | |
| "step": 88 | |
| }, | |
| { | |
| "entropy": 1.1909528076648712, | |
| "epoch": 0.8640776699029126, | |
| "grad_norm": 0.12603110074996948, | |
| "learning_rate": 4.29130032039044e-05, | |
| "loss": 1.1859486103057861, | |
| "mean_token_accuracy": 0.6600593701004982, | |
| "num_tokens": 8648715.0, | |
| "step": 89 | |
| }, | |
| { | |
| "entropy": 1.1856964826583862, | |
| "epoch": 0.8737864077669902, | |
| "grad_norm": 0.1260392963886261, | |
| "learning_rate": 4.272499166019771e-05, | |
| "loss": 1.1915158033370972, | |
| "mean_token_accuracy": 0.6585908159613609, | |
| "num_tokens": 8744790.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 1.1794664412736893, | |
| "epoch": 0.883495145631068, | |
| "grad_norm": 0.12392019480466843, | |
| "learning_rate": 4.253494238769134e-05, | |
| "loss": 1.183051586151123, | |
| "mean_token_accuracy": 0.6626226082444191, | |
| "num_tokens": 8841963.0, | |
| "step": 91 | |
| }, | |
| { | |
| "entropy": 1.170656368136406, | |
| "epoch": 0.8932038834951457, | |
| "grad_norm": 0.12465117126703262, | |
| "learning_rate": 4.234287723513326e-05, | |
| "loss": 1.1673667430877686, | |
| "mean_token_accuracy": 0.6653531640768051, | |
| "num_tokens": 8938823.0, | |
| "step": 92 | |
| }, | |
| { | |
| "entropy": 1.1882077753543854, | |
| "epoch": 0.9029126213592233, | |
| "grad_norm": 0.12566819787025452, | |
| "learning_rate": 4.2148818283024304e-05, | |
| "loss": 1.1874932050704956, | |
| "mean_token_accuracy": 0.6594797223806381, | |
| "num_tokens": 9036976.0, | |
| "step": 93 | |
| }, | |
| { | |
| "entropy": 1.1583750993013382, | |
| "epoch": 0.912621359223301, | |
| "grad_norm": 0.12392456829547882, | |
| "learning_rate": 4.195278784107964e-05, | |
| "loss": 1.1598093509674072, | |
| "mean_token_accuracy": 0.6643186137080193, | |
| "num_tokens": 9134903.0, | |
| "step": 94 | |
| }, | |
| { | |
| "entropy": 1.18809275329113, | |
| "epoch": 0.9223300970873787, | |
| "grad_norm": 0.12459253519773483, | |
| "learning_rate": 4.175480844566404e-05, | |
| "loss": 1.1854370832443237, | |
| "mean_token_accuracy": 0.6601575016975403, | |
| "num_tokens": 9231494.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 1.175073578953743, | |
| "epoch": 0.9320388349514563, | |
| "grad_norm": 0.12408064305782318, | |
| "learning_rate": 4.1554902857200924e-05, | |
| "loss": 1.1680026054382324, | |
| "mean_token_accuracy": 0.6664741188287735, | |
| "num_tokens": 9328418.0, | |
| "step": 96 | |
| }, | |
| { | |
| "entropy": 1.1660194247961044, | |
| "epoch": 0.941747572815534, | |
| "grad_norm": 0.1269122213125229, | |
| "learning_rate": 4.135309405755583e-05, | |
| "loss": 1.1648091077804565, | |
| "mean_token_accuracy": 0.6640554815530777, | |
| "num_tokens": 9426256.0, | |
| "step": 97 | |
| }, | |
| { | |
| "entropy": 1.1806619465351105, | |
| "epoch": 0.9514563106796117, | |
| "grad_norm": 0.12446007132530212, | |
| "learning_rate": 4.11494052473943e-05, | |
| "loss": 1.1816036701202393, | |
| "mean_token_accuracy": 0.6603836715221405, | |
| "num_tokens": 9523841.0, | |
| "step": 98 | |
| }, | |
| { | |
| "entropy": 1.143372431397438, | |
| "epoch": 0.9611650485436893, | |
| "grad_norm": 0.12895351648330688, | |
| "learning_rate": 4.094385984351462e-05, | |
| "loss": 1.1549444198608398, | |
| "mean_token_accuracy": 0.6684554740786552, | |
| "num_tokens": 9621225.0, | |
| "step": 99 | |
| }, | |
| { | |
| "entropy": 1.157622754573822, | |
| "epoch": 0.970873786407767, | |
| "grad_norm": 0.12986451387405396, | |
| "learning_rate": 4.073648147615579e-05, | |
| "loss": 1.1613187789916992, | |
| "mean_token_accuracy": 0.6658940613269806, | |
| "num_tokens": 9718805.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 1.1661712676286697, | |
| "epoch": 0.9805825242718447, | |
| "grad_norm": 0.12773863971233368, | |
| "learning_rate": 4.052729398628089e-05, | |
| "loss": 1.1692513227462769, | |
| "mean_token_accuracy": 0.6620098426938057, | |
| "num_tokens": 9816814.0, | |
| "step": 101 | |
| }, | |
| { | |
| "entropy": 1.1614899933338165, | |
| "epoch": 0.9902912621359223, | |
| "grad_norm": 0.12632128596305847, | |
| "learning_rate": 4.031632142283622e-05, | |
| "loss": 1.155547857284546, | |
| "mean_token_accuracy": 0.6674634590744972, | |
| "num_tokens": 9914411.0, | |
| "step": 102 | |
| }, | |
| { | |
| "entropy": 1.145766094326973, | |
| "epoch": 1.0, | |
| "grad_norm": 0.12433107942342758, | |
| "learning_rate": 4.0103588039986556e-05, | |
| "loss": 1.14786958694458, | |
| "mean_token_accuracy": 0.6690786927938461, | |
| "num_tokens": 10010251.0, | |
| "step": 103 | |
| }, | |
| { | |
| "entropy": 1.1341409236192703, | |
| "epoch": 1.0097087378640777, | |
| "grad_norm": 0.12799648940563202, | |
| "learning_rate": 3.988911829432682e-05, | |
| "loss": 1.1098670959472656, | |
| "mean_token_accuracy": 0.6751041486859322, | |
| "num_tokens": 10106628.0, | |
| "step": 104 | |
| }, | |
| { | |
| "entropy": 1.1491402089595795, | |
| "epoch": 1.0194174757281553, | |
| "grad_norm": 0.12858925759792328, | |
| "learning_rate": 3.967293684207042e-05, | |
| "loss": 1.1254563331604004, | |
| "mean_token_accuracy": 0.6731077134609222, | |
| "num_tokens": 10203919.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 1.1238928586244583, | |
| "epoch": 1.029126213592233, | |
| "grad_norm": 0.12643985450267792, | |
| "learning_rate": 3.945506853621476e-05, | |
| "loss": 1.1088980436325073, | |
| "mean_token_accuracy": 0.6773268133401871, | |
| "num_tokens": 10301090.0, | |
| "step": 106 | |
| }, | |
| { | |
| "entropy": 1.1413813680410385, | |
| "epoch": 1.0388349514563107, | |
| "grad_norm": 0.12904314696788788, | |
| "learning_rate": 3.923553842368396e-05, | |
| "loss": 1.1306235790252686, | |
| "mean_token_accuracy": 0.6715306341648102, | |
| "num_tokens": 10398407.0, | |
| "step": 107 | |
| }, | |
| { | |
| "entropy": 1.1197253912687302, | |
| "epoch": 1.0485436893203883, | |
| "grad_norm": 0.1303851157426834, | |
| "learning_rate": 3.901437174244943e-05, | |
| "loss": 1.1225614547729492, | |
| "mean_token_accuracy": 0.6706969887018204, | |
| "num_tokens": 10496286.0, | |
| "step": 108 | |
| }, | |
| { | |
| "entropy": 1.122231513261795, | |
| "epoch": 1.058252427184466, | |
| "grad_norm": 0.1349845975637436, | |
| "learning_rate": 3.879159391862839e-05, | |
| "loss": 1.1277834177017212, | |
| "mean_token_accuracy": 0.6702014356851578, | |
| "num_tokens": 10593041.0, | |
| "step": 109 | |
| }, | |
| { | |
| "entropy": 1.115450069308281, | |
| "epoch": 1.0679611650485437, | |
| "grad_norm": 0.13234294950962067, | |
| "learning_rate": 3.856723056356084e-05, | |
| "loss": 1.1329256296157837, | |
| "mean_token_accuracy": 0.6710078343749046, | |
| "num_tokens": 10690608.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 1.102941244840622, | |
| "epoch": 1.0776699029126213, | |
| "grad_norm": 0.13028526306152344, | |
| "learning_rate": 3.834130747086512e-05, | |
| "loss": 1.1175909042358398, | |
| "mean_token_accuracy": 0.677011676132679, | |
| "num_tokens": 10788441.0, | |
| "step": 111 | |
| }, | |
| { | |
| "entropy": 1.1198238283395767, | |
| "epoch": 1.087378640776699, | |
| "grad_norm": 0.1328689604997635, | |
| "learning_rate": 3.811385061347263e-05, | |
| "loss": 1.1254500150680542, | |
| "mean_token_accuracy": 0.6724693179130554, | |
| "num_tokens": 10886095.0, | |
| "step": 112 | |
| }, | |
| { | |
| "entropy": 1.1324098259210587, | |
| "epoch": 1.0970873786407767, | |
| "grad_norm": 0.12953810393810272, | |
| "learning_rate": 3.788488614064188e-05, | |
| "loss": 1.1315046548843384, | |
| "mean_token_accuracy": 0.6697050705552101, | |
| "num_tokens": 10983700.0, | |
| "step": 113 | |
| }, | |
| { | |
| "entropy": 1.1275495439767838, | |
| "epoch": 1.1067961165048543, | |
| "grad_norm": 0.1354612112045288, | |
| "learning_rate": 3.7654440374952286e-05, | |
| "loss": 1.1271648406982422, | |
| "mean_token_accuracy": 0.672305554151535, | |
| "num_tokens": 11081141.0, | |
| "step": 114 | |
| }, | |
| { | |
| "entropy": 1.1429592818021774, | |
| "epoch": 1.116504854368932, | |
| "grad_norm": 0.1337576061487198, | |
| "learning_rate": 3.742253980927799e-05, | |
| "loss": 1.1285946369171143, | |
| "mean_token_accuracy": 0.6733437776565552, | |
| "num_tokens": 11178553.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 1.1202867925167084, | |
| "epoch": 1.1262135922330097, | |
| "grad_norm": 0.13228580355644226, | |
| "learning_rate": 3.7189211103742206e-05, | |
| "loss": 1.1025102138519287, | |
| "mean_token_accuracy": 0.6800560057163239, | |
| "num_tokens": 11275288.0, | |
| "step": 116 | |
| }, | |
| { | |
| "entropy": 1.0949921309947968, | |
| "epoch": 1.1359223300970873, | |
| "grad_norm": 0.1253608763217926, | |
| "learning_rate": 3.695448108265221e-05, | |
| "loss": 1.085485816001892, | |
| "mean_token_accuracy": 0.6812227368354797, | |
| "num_tokens": 11372523.0, | |
| "step": 117 | |
| }, | |
| { | |
| "entropy": 1.1151315122842789, | |
| "epoch": 1.145631067961165, | |
| "grad_norm": 0.12856075167655945, | |
| "learning_rate": 3.671837673141559e-05, | |
| "loss": 1.1069122552871704, | |
| "mean_token_accuracy": 0.6765121668577194, | |
| "num_tokens": 11470482.0, | |
| "step": 118 | |
| }, | |
| { | |
| "entropy": 1.0998107194900513, | |
| "epoch": 1.1553398058252426, | |
| "grad_norm": 0.12800323963165283, | |
| "learning_rate": 3.648092519343783e-05, | |
| "loss": 1.1018128395080566, | |
| "mean_token_accuracy": 0.676878921687603, | |
| "num_tokens": 11568438.0, | |
| "step": 119 | |
| }, | |
| { | |
| "entropy": 1.1217384338378906, | |
| "epoch": 1.1650485436893203, | |
| "grad_norm": 0.13246221840381622, | |
| "learning_rate": 3.6242153767001895e-05, | |
| "loss": 1.1250511407852173, | |
| "mean_token_accuracy": 0.6719321832060814, | |
| "num_tokens": 11665644.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 1.1170085221529007, | |
| "epoch": 1.174757281553398, | |
| "grad_norm": 0.13148824870586395, | |
| "learning_rate": 3.600208990212984e-05, | |
| "loss": 1.1268041133880615, | |
| "mean_token_accuracy": 0.6731199100613594, | |
| "num_tokens": 11762261.0, | |
| "step": 121 | |
| }, | |
| { | |
| "entropy": 1.1139017194509506, | |
| "epoch": 1.1844660194174756, | |
| "grad_norm": 0.1360619217157364, | |
| "learning_rate": 3.5760761197427095e-05, | |
| "loss": 1.1233904361724854, | |
| "mean_token_accuracy": 0.6718152910470963, | |
| "num_tokens": 11860108.0, | |
| "step": 122 | |
| }, | |
| { | |
| "entropy": 1.0983168631792068, | |
| "epoch": 1.1941747572815533, | |
| "grad_norm": 0.1338312178850174, | |
| "learning_rate": 3.551819539690965e-05, | |
| "loss": 1.1016520261764526, | |
| "mean_token_accuracy": 0.6767120957374573, | |
| "num_tokens": 11957749.0, | |
| "step": 123 | |
| }, | |
| { | |
| "entropy": 1.1032237857580185, | |
| "epoch": 1.203883495145631, | |
| "grad_norm": 0.1313079446554184, | |
| "learning_rate": 3.527442038681446e-05, | |
| "loss": 1.100191593170166, | |
| "mean_token_accuracy": 0.678658239543438, | |
| "num_tokens": 12055121.0, | |
| "step": 124 | |
| }, | |
| { | |
| "entropy": 1.1136897951364517, | |
| "epoch": 1.2135922330097086, | |
| "grad_norm": 0.13034434616565704, | |
| "learning_rate": 3.5029464192393555e-05, | |
| "loss": 1.1128168106079102, | |
| "mean_token_accuracy": 0.67413529753685, | |
| "num_tokens": 12151377.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 1.1389924734830856, | |
| "epoch": 1.2233009708737863, | |
| "grad_norm": 0.1353037804365158, | |
| "learning_rate": 3.478335497469219e-05, | |
| "loss": 1.1380655765533447, | |
| "mean_token_accuracy": 0.6695696339011192, | |
| "num_tokens": 12248560.0, | |
| "step": 126 | |
| }, | |
| { | |
| "entropy": 1.107931211590767, | |
| "epoch": 1.233009708737864, | |
| "grad_norm": 0.13514992594718933, | |
| "learning_rate": 3.45361210273113e-05, | |
| "loss": 1.1055539846420288, | |
| "mean_token_accuracy": 0.6756316646933556, | |
| "num_tokens": 12345865.0, | |
| "step": 127 | |
| }, | |
| { | |
| "entropy": 1.1335723251104355, | |
| "epoch": 1.2427184466019416, | |
| "grad_norm": 0.13835780322551727, | |
| "learning_rate": 3.42877907731548e-05, | |
| "loss": 1.1302151679992676, | |
| "mean_token_accuracy": 0.669251911342144, | |
| "num_tokens": 12443200.0, | |
| "step": 128 | |
| }, | |
| { | |
| "entropy": 1.1074748188257217, | |
| "epoch": 1.2524271844660193, | |
| "grad_norm": 0.13170616328716278, | |
| "learning_rate": 3.403839276116199e-05, | |
| "loss": 1.1079301834106445, | |
| "mean_token_accuracy": 0.6757740005850792, | |
| "num_tokens": 12540890.0, | |
| "step": 129 | |
| }, | |
| { | |
| "entropy": 1.095900535583496, | |
| "epoch": 1.262135922330097, | |
| "grad_norm": 0.13312096893787384, | |
| "learning_rate": 3.378795566302541e-05, | |
| "loss": 1.0944111347198486, | |
| "mean_token_accuracy": 0.6820532456040382, | |
| "num_tokens": 12637489.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 1.139050379395485, | |
| "epoch": 1.2718446601941746, | |
| "grad_norm": 0.13441915810108185, | |
| "learning_rate": 3.3536508269894724e-05, | |
| "loss": 1.143053412437439, | |
| "mean_token_accuracy": 0.6661617383360863, | |
| "num_tokens": 12735387.0, | |
| "step": 131 | |
| }, | |
| { | |
| "entropy": 1.1290362179279327, | |
| "epoch": 1.2815533980582523, | |
| "grad_norm": 0.13508093357086182, | |
| "learning_rate": 3.3284079489066725e-05, | |
| "loss": 1.1235984563827515, | |
| "mean_token_accuracy": 0.6717719659209251, | |
| "num_tokens": 12832975.0, | |
| "step": 132 | |
| }, | |
| { | |
| "entropy": 1.0883319675922394, | |
| "epoch": 1.29126213592233, | |
| "grad_norm": 0.12796825170516968, | |
| "learning_rate": 3.303069834066206e-05, | |
| "loss": 1.0845664739608765, | |
| "mean_token_accuracy": 0.6816640943288803, | |
| "num_tokens": 12930517.0, | |
| "step": 133 | |
| }, | |
| { | |
| "entropy": 1.1136111319065094, | |
| "epoch": 1.3009708737864076, | |
| "grad_norm": 0.13345250487327576, | |
| "learning_rate": 3.2776393954289e-05, | |
| "loss": 1.1119763851165771, | |
| "mean_token_accuracy": 0.6760792285203934, | |
| "num_tokens": 13027442.0, | |
| "step": 134 | |
| }, | |
| { | |
| "entropy": 1.1128307431936264, | |
| "epoch": 1.3106796116504853, | |
| "grad_norm": 0.13406725227832794, | |
| "learning_rate": 3.252119556569454e-05, | |
| "loss": 1.1177759170532227, | |
| "mean_token_accuracy": 0.6735335886478424, | |
| "num_tokens": 13124793.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 1.0935580134391785, | |
| "epoch": 1.3203883495145632, | |
| "grad_norm": 0.13077104091644287, | |
| "learning_rate": 3.226513251340341e-05, | |
| "loss": 1.0963619947433472, | |
| "mean_token_accuracy": 0.6799755468964577, | |
| "num_tokens": 13222075.0, | |
| "step": 136 | |
| }, | |
| { | |
| "entropy": 1.106724590063095, | |
| "epoch": 1.3300970873786409, | |
| "grad_norm": 0.13231448829174042, | |
| "learning_rate": 3.200823423534519e-05, | |
| "loss": 1.1073098182678223, | |
| "mean_token_accuracy": 0.6749509125947952, | |
| "num_tokens": 13319423.0, | |
| "step": 137 | |
| }, | |
| { | |
| "entropy": 1.1182805299758911, | |
| "epoch": 1.3398058252427185, | |
| "grad_norm": 0.13593561947345734, | |
| "learning_rate": 3.175053026547002e-05, | |
| "loss": 1.1097687482833862, | |
| "mean_token_accuracy": 0.6745005398988724, | |
| "num_tokens": 13416786.0, | |
| "step": 138 | |
| }, | |
| { | |
| "entropy": 1.102017655968666, | |
| "epoch": 1.3495145631067962, | |
| "grad_norm": 0.12999407947063446, | |
| "learning_rate": 3.149205023035324e-05, | |
| "loss": 1.094827651977539, | |
| "mean_token_accuracy": 0.6781732141971588, | |
| "num_tokens": 13513688.0, | |
| "step": 139 | |
| }, | |
| { | |
| "entropy": 1.1274291574954987, | |
| "epoch": 1.3592233009708738, | |
| "grad_norm": 0.1388029307126999, | |
| "learning_rate": 3.123282384578947e-05, | |
| "loss": 1.1278557777404785, | |
| "mean_token_accuracy": 0.6717119812965393, | |
| "num_tokens": 13607205.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 1.0886951833963394, | |
| "epoch": 1.3689320388349515, | |
| "grad_norm": 0.1308942288160324, | |
| "learning_rate": 3.097288091337635e-05, | |
| "loss": 1.0786107778549194, | |
| "mean_token_accuracy": 0.6831399872899055, | |
| "num_tokens": 13705043.0, | |
| "step": 141 | |
| }, | |
| { | |
| "entropy": 1.1056243032217026, | |
| "epoch": 1.3786407766990292, | |
| "grad_norm": 0.13267813622951508, | |
| "learning_rate": 3.0712251317088424e-05, | |
| "loss": 1.1058636903762817, | |
| "mean_token_accuracy": 0.676319070160389, | |
| "num_tokens": 13800688.0, | |
| "step": 142 | |
| }, | |
| { | |
| "entropy": 1.064341314136982, | |
| "epoch": 1.3883495145631068, | |
| "grad_norm": 0.13194353878498077, | |
| "learning_rate": 3.0450965019841592e-05, | |
| "loss": 1.0774102210998535, | |
| "mean_token_accuracy": 0.6842505931854248, | |
| "num_tokens": 13898532.0, | |
| "step": 143 | |
| }, | |
| { | |
| "entropy": 1.0963745787739754, | |
| "epoch": 1.3980582524271845, | |
| "grad_norm": 0.13382062315940857, | |
| "learning_rate": 3.018905206004846e-05, | |
| "loss": 1.1064839363098145, | |
| "mean_token_accuracy": 0.6754385456442833, | |
| "num_tokens": 13996316.0, | |
| "step": 144 | |
| }, | |
| { | |
| "entropy": 1.0882743149995804, | |
| "epoch": 1.4077669902912622, | |
| "grad_norm": 0.13834838569164276, | |
| "learning_rate": 2.9926542548165e-05, | |
| "loss": 1.095473051071167, | |
| "mean_token_accuracy": 0.6777098774909973, | |
| "num_tokens": 14093597.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 1.112631008028984, | |
| "epoch": 1.4174757281553398, | |
| "grad_norm": 0.13094595074653625, | |
| "learning_rate": 2.9663466663228978e-05, | |
| "loss": 1.1103705167770386, | |
| "mean_token_accuracy": 0.6743965744972229, | |
| "num_tokens": 14190530.0, | |
| "step": 146 | |
| }, | |
| { | |
| "entropy": 1.1073136031627655, | |
| "epoch": 1.4271844660194175, | |
| "grad_norm": 0.13101445138454437, | |
| "learning_rate": 2.939985464939043e-05, | |
| "loss": 1.0990314483642578, | |
| "mean_token_accuracy": 0.677456445991993, | |
| "num_tokens": 14287147.0, | |
| "step": 147 | |
| }, | |
| { | |
| "entropy": 1.0993877053260803, | |
| "epoch": 1.4368932038834952, | |
| "grad_norm": 0.13668039441108704, | |
| "learning_rate": 2.91357368124347e-05, | |
| "loss": 1.0901072025299072, | |
| "mean_token_accuracy": 0.6798613220453262, | |
| "num_tokens": 14384467.0, | |
| "step": 148 | |
| }, | |
| { | |
| "entropy": 1.1148638427257538, | |
| "epoch": 1.4466019417475728, | |
| "grad_norm": 0.13427703082561493, | |
| "learning_rate": 2.887114351629839e-05, | |
| "loss": 1.1118576526641846, | |
| "mean_token_accuracy": 0.6752256974577904, | |
| "num_tokens": 14481672.0, | |
| "step": 149 | |
| }, | |
| { | |
| "entropy": 1.1126298606395721, | |
| "epoch": 1.4563106796116505, | |
| "grad_norm": 0.13493342697620392, | |
| "learning_rate": 2.8606105179578585e-05, | |
| "loss": 1.103308916091919, | |
| "mean_token_accuracy": 0.6754327192902565, | |
| "num_tokens": 14579140.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 1.1269358694553375, | |
| "epoch": 1.4660194174757282, | |
| "grad_norm": 0.1375623494386673, | |
| "learning_rate": 2.834065227203584e-05, | |
| "loss": 1.1257972717285156, | |
| "mean_token_accuracy": 0.6717520728707314, | |
| "num_tokens": 14675405.0, | |
| "step": 151 | |
| }, | |
| { | |
| "entropy": 1.091068834066391, | |
| "epoch": 1.4757281553398058, | |
| "grad_norm": 0.13285107910633087, | |
| "learning_rate": 2.8074815311091263e-05, | |
| "loss": 1.0854649543762207, | |
| "mean_token_accuracy": 0.6809473261237144, | |
| "num_tokens": 14771912.0, | |
| "step": 152 | |
| }, | |
| { | |
| "entropy": 1.088371217250824, | |
| "epoch": 1.4854368932038835, | |
| "grad_norm": 0.12998193502426147, | |
| "learning_rate": 2.780862485831814e-05, | |
| "loss": 1.088443636894226, | |
| "mean_token_accuracy": 0.6804046705365181, | |
| "num_tokens": 14869059.0, | |
| "step": 153 | |
| }, | |
| { | |
| "entropy": 1.0733504742383957, | |
| "epoch": 1.4951456310679612, | |
| "grad_norm": 0.13263165950775146, | |
| "learning_rate": 2.754211151592841e-05, | |
| "loss": 1.0766732692718506, | |
| "mean_token_accuracy": 0.6827335134148598, | |
| "num_tokens": 14966471.0, | |
| "step": 154 | |
| }, | |
| { | |
| "entropy": 1.0793418139219284, | |
| "epoch": 1.5048543689320388, | |
| "grad_norm": 0.13578683137893677, | |
| "learning_rate": 2.7275305923254606e-05, | |
| "loss": 1.0825673341751099, | |
| "mean_token_accuracy": 0.6809343695640564, | |
| "num_tokens": 15064288.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 1.0963272899389267, | |
| "epoch": 1.5145631067961165, | |
| "grad_norm": 0.13607671856880188, | |
| "learning_rate": 2.7008238753227383e-05, | |
| "loss": 1.098541021347046, | |
| "mean_token_accuracy": 0.6789273098111153, | |
| "num_tokens": 15161784.0, | |
| "step": 156 | |
| }, | |
| { | |
| "entropy": 1.0859090983867645, | |
| "epoch": 1.5242718446601942, | |
| "grad_norm": 0.13354609906673431, | |
| "learning_rate": 2.674094070884926e-05, | |
| "loss": 1.082608699798584, | |
| "mean_token_accuracy": 0.6817299351096153, | |
| "num_tokens": 15258172.0, | |
| "step": 157 | |
| }, | |
| { | |
| "entropy": 1.0621516406536102, | |
| "epoch": 1.5339805825242718, | |
| "grad_norm": 0.13234467804431915, | |
| "learning_rate": 2.6473442519664933e-05, | |
| "loss": 1.067661166191101, | |
| "mean_token_accuracy": 0.6867925897240639, | |
| "num_tokens": 15356321.0, | |
| "step": 158 | |
| }, | |
| { | |
| "entropy": 1.072020262479782, | |
| "epoch": 1.5436893203883495, | |
| "grad_norm": 0.13347479701042175, | |
| "learning_rate": 2.6205774938228432e-05, | |
| "loss": 1.0770134925842285, | |
| "mean_token_accuracy": 0.6840454787015915, | |
| "num_tokens": 15454280.0, | |
| "step": 159 | |
| }, | |
| { | |
| "entropy": 1.1073368191719055, | |
| "epoch": 1.5533980582524272, | |
| "grad_norm": 0.13910114765167236, | |
| "learning_rate": 2.5937968736567746e-05, | |
| "loss": 1.1051959991455078, | |
| "mean_token_accuracy": 0.6768160760402679, | |
| "num_tokens": 15548567.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 1.096828117966652, | |
| "epoch": 1.5631067961165048, | |
| "grad_norm": 0.13016392290592194, | |
| "learning_rate": 2.5670054702647146e-05, | |
| "loss": 1.096802830696106, | |
| "mean_token_accuracy": 0.6764859855175018, | |
| "num_tokens": 15646127.0, | |
| "step": 161 | |
| }, | |
| { | |
| "entropy": 1.080091506242752, | |
| "epoch": 1.5728155339805825, | |
| "grad_norm": 0.13738420605659485, | |
| "learning_rate": 2.540206363682768e-05, | |
| "loss": 1.0735712051391602, | |
| "mean_token_accuracy": 0.6868385076522827, | |
| "num_tokens": 15743035.0, | |
| "step": 162 | |
| }, | |
| { | |
| "entropy": 1.0919175893068314, | |
| "epoch": 1.5825242718446602, | |
| "grad_norm": 0.13039371371269226, | |
| "learning_rate": 2.513402634832627e-05, | |
| "loss": 1.0824579000473022, | |
| "mean_token_accuracy": 0.6828672811388969, | |
| "num_tokens": 15840620.0, | |
| "step": 163 | |
| }, | |
| { | |
| "entropy": 1.1115864664316177, | |
| "epoch": 1.5922330097087378, | |
| "grad_norm": 0.1381915658712387, | |
| "learning_rate": 2.486597365167374e-05, | |
| "loss": 1.1111185550689697, | |
| "mean_token_accuracy": 0.6739100441336632, | |
| "num_tokens": 15934881.0, | |
| "step": 164 | |
| }, | |
| { | |
| "entropy": 1.112838163971901, | |
| "epoch": 1.6019417475728155, | |
| "grad_norm": 0.1360097974538803, | |
| "learning_rate": 2.4597936363172327e-05, | |
| "loss": 1.115320086479187, | |
| "mean_token_accuracy": 0.6730142682790756, | |
| "num_tokens": 16031255.0, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 1.1212502270936966, | |
| "epoch": 1.6116504854368932, | |
| "grad_norm": 0.13571614027023315, | |
| "learning_rate": 2.4329945297352856e-05, | |
| "loss": 1.1150697469711304, | |
| "mean_token_accuracy": 0.6693666502833366, | |
| "num_tokens": 16128504.0, | |
| "step": 166 | |
| }, | |
| { | |
| "entropy": 1.1456474959850311, | |
| "epoch": 1.6213592233009708, | |
| "grad_norm": 0.13418100774288177, | |
| "learning_rate": 2.4062031263432267e-05, | |
| "loss": 1.1406886577606201, | |
| "mean_token_accuracy": 0.6659777089953423, | |
| "num_tokens": 16225326.0, | |
| "step": 167 | |
| }, | |
| { | |
| "entropy": 1.1106930375099182, | |
| "epoch": 1.6310679611650487, | |
| "grad_norm": 0.13814160227775574, | |
| "learning_rate": 2.379422506177157e-05, | |
| "loss": 1.1088345050811768, | |
| "mean_token_accuracy": 0.6740678325295448, | |
| "num_tokens": 16322821.0, | |
| "step": 168 | |
| }, | |
| { | |
| "entropy": 1.0945058912038803, | |
| "epoch": 1.6407766990291264, | |
| "grad_norm": 0.13345304131507874, | |
| "learning_rate": 2.352655748033508e-05, | |
| "loss": 1.0935648679733276, | |
| "mean_token_accuracy": 0.6785749718546867, | |
| "num_tokens": 16420465.0, | |
| "step": 169 | |
| }, | |
| { | |
| "entropy": 1.1017240583896637, | |
| "epoch": 1.650485436893204, | |
| "grad_norm": 0.13569359481334686, | |
| "learning_rate": 2.3259059291150744e-05, | |
| "loss": 1.1082301139831543, | |
| "mean_token_accuracy": 0.6771815866231918, | |
| "num_tokens": 16517503.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 1.0889143496751785, | |
| "epoch": 1.6601941747572817, | |
| "grad_norm": 0.13005991280078888, | |
| "learning_rate": 2.2991761246772623e-05, | |
| "loss": 1.0856151580810547, | |
| "mean_token_accuracy": 0.6784548461437225, | |
| "num_tokens": 16614912.0, | |
| "step": 171 | |
| }, | |
| { | |
| "entropy": 1.0579037442803383, | |
| "epoch": 1.6699029126213594, | |
| "grad_norm": 0.1313212513923645, | |
| "learning_rate": 2.2724694076745396e-05, | |
| "loss": 1.0559953451156616, | |
| "mean_token_accuracy": 0.6898924559354782, | |
| "num_tokens": 16712592.0, | |
| "step": 172 | |
| }, | |
| { | |
| "entropy": 1.1083923876285553, | |
| "epoch": 1.679611650485437, | |
| "grad_norm": 0.13689088821411133, | |
| "learning_rate": 2.245788848407159e-05, | |
| "loss": 1.1079823970794678, | |
| "mean_token_accuracy": 0.6759866625070572, | |
| "num_tokens": 16810516.0, | |
| "step": 173 | |
| }, | |
| { | |
| "entropy": 1.0712365210056305, | |
| "epoch": 1.6893203883495147, | |
| "grad_norm": 0.13318578898906708, | |
| "learning_rate": 2.2191375141681867e-05, | |
| "loss": 1.0704731941223145, | |
| "mean_token_accuracy": 0.6857739463448524, | |
| "num_tokens": 16907482.0, | |
| "step": 174 | |
| }, | |
| { | |
| "entropy": 1.0663366466760635, | |
| "epoch": 1.6990291262135924, | |
| "grad_norm": 0.13724525272846222, | |
| "learning_rate": 2.1925184688908733e-05, | |
| "loss": 1.0599327087402344, | |
| "mean_token_accuracy": 0.6870192289352417, | |
| "num_tokens": 17004782.0, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 1.0753221213817596, | |
| "epoch": 1.70873786407767, | |
| "grad_norm": 0.13162659108638763, | |
| "learning_rate": 2.165934772796417e-05, | |
| "loss": 1.0721540451049805, | |
| "mean_token_accuracy": 0.6858146041631699, | |
| "num_tokens": 17102923.0, | |
| "step": 176 | |
| }, | |
| { | |
| "entropy": 1.0932756066322327, | |
| "epoch": 1.7184466019417477, | |
| "grad_norm": 0.13949009776115417, | |
| "learning_rate": 2.139389482042142e-05, | |
| "loss": 1.0997275114059448, | |
| "mean_token_accuracy": 0.6768719181418419, | |
| "num_tokens": 17199802.0, | |
| "step": 177 | |
| }, | |
| { | |
| "entropy": 1.0782397091388702, | |
| "epoch": 1.7281553398058254, | |
| "grad_norm": 0.13670584559440613, | |
| "learning_rate": 2.1128856483701624e-05, | |
| "loss": 1.0765775442123413, | |
| "mean_token_accuracy": 0.6813456863164902, | |
| "num_tokens": 17297366.0, | |
| "step": 178 | |
| }, | |
| { | |
| "entropy": 1.1082730144262314, | |
| "epoch": 1.737864077669903, | |
| "grad_norm": 0.13865377008914948, | |
| "learning_rate": 2.0864263187565307e-05, | |
| "loss": 1.1068543195724487, | |
| "mean_token_accuracy": 0.6740632429718971, | |
| "num_tokens": 17394536.0, | |
| "step": 179 | |
| }, | |
| { | |
| "entropy": 1.0805223286151886, | |
| "epoch": 1.7475728155339807, | |
| "grad_norm": 0.13269315659999847, | |
| "learning_rate": 2.0600145350609586e-05, | |
| "loss": 1.083526611328125, | |
| "mean_token_accuracy": 0.6796915903687477, | |
| "num_tokens": 17492516.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 1.0782201439142227, | |
| "epoch": 1.7572815533980584, | |
| "grad_norm": 0.1363665759563446, | |
| "learning_rate": 2.033653333677103e-05, | |
| "loss": 1.0777041912078857, | |
| "mean_token_accuracy": 0.681628406047821, | |
| "num_tokens": 17589926.0, | |
| "step": 181 | |
| }, | |
| { | |
| "entropy": 1.0712686330080032, | |
| "epoch": 1.766990291262136, | |
| "grad_norm": 0.13791945576667786, | |
| "learning_rate": 2.0073457451835e-05, | |
| "loss": 1.0800034999847412, | |
| "mean_token_accuracy": 0.6833217963576317, | |
| "num_tokens": 17686993.0, | |
| "step": 182 | |
| }, | |
| { | |
| "entropy": 1.1033148169517517, | |
| "epoch": 1.7766990291262137, | |
| "grad_norm": 0.1398749202489853, | |
| "learning_rate": 1.9810947939951546e-05, | |
| "loss": 1.09896719455719, | |
| "mean_token_accuracy": 0.6757858321070671, | |
| "num_tokens": 17784319.0, | |
| "step": 183 | |
| }, | |
| { | |
| "entropy": 1.0812745094299316, | |
| "epoch": 1.7864077669902914, | |
| "grad_norm": 0.13486915826797485, | |
| "learning_rate": 1.9549034980158403e-05, | |
| "loss": 1.0731672048568726, | |
| "mean_token_accuracy": 0.6828427761793137, | |
| "num_tokens": 17880977.0, | |
| "step": 184 | |
| }, | |
| { | |
| "entropy": 1.066931888461113, | |
| "epoch": 1.796116504854369, | |
| "grad_norm": 0.13600149750709534, | |
| "learning_rate": 1.928774868291158e-05, | |
| "loss": 1.0673391819000244, | |
| "mean_token_accuracy": 0.686062753200531, | |
| "num_tokens": 17978329.0, | |
| "step": 185 | |
| }, | |
| { | |
| "entropy": 1.071746215224266, | |
| "epoch": 1.8058252427184467, | |
| "grad_norm": 0.13377977907657623, | |
| "learning_rate": 1.9027119086623645e-05, | |
| "loss": 1.078979730606079, | |
| "mean_token_accuracy": 0.6813490614295006, | |
| "num_tokens": 18075785.0, | |
| "step": 186 | |
| }, | |
| { | |
| "entropy": 1.0819374173879623, | |
| "epoch": 1.8155339805825244, | |
| "grad_norm": 0.13810507953166962, | |
| "learning_rate": 1.8767176154210537e-05, | |
| "loss": 1.0912374258041382, | |
| "mean_token_accuracy": 0.6771052777767181, | |
| "num_tokens": 18172695.0, | |
| "step": 187 | |
| }, | |
| { | |
| "entropy": 1.0893210768699646, | |
| "epoch": 1.825242718446602, | |
| "grad_norm": 0.13837401568889618, | |
| "learning_rate": 1.850794976964677e-05, | |
| "loss": 1.0948269367218018, | |
| "mean_token_accuracy": 0.6772284880280495, | |
| "num_tokens": 18269124.0, | |
| "step": 188 | |
| }, | |
| { | |
| "entropy": 1.0922745019197464, | |
| "epoch": 1.8349514563106797, | |
| "grad_norm": 0.1368655264377594, | |
| "learning_rate": 1.8249469734529994e-05, | |
| "loss": 1.094635248184204, | |
| "mean_token_accuracy": 0.6792716234922409, | |
| "num_tokens": 18367249.0, | |
| "step": 189 | |
| }, | |
| { | |
| "entropy": 1.0973671078681946, | |
| "epoch": 1.8446601941747574, | |
| "grad_norm": 0.13867440819740295, | |
| "learning_rate": 1.7991765764654813e-05, | |
| "loss": 1.0981615781784058, | |
| "mean_token_accuracy": 0.6770187169313431, | |
| "num_tokens": 18463910.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 1.0979862809181213, | |
| "epoch": 1.854368932038835, | |
| "grad_norm": 0.13719773292541504, | |
| "learning_rate": 1.7734867486596594e-05, | |
| "loss": 1.0996887683868408, | |
| "mean_token_accuracy": 0.6748794317245483, | |
| "num_tokens": 18561195.0, | |
| "step": 191 | |
| }, | |
| { | |
| "entropy": 1.0835170894861221, | |
| "epoch": 1.8640776699029127, | |
| "grad_norm": 0.13240128755569458, | |
| "learning_rate": 1.7478804434305465e-05, | |
| "loss": 1.0772799253463745, | |
| "mean_token_accuracy": 0.681126669049263, | |
| "num_tokens": 18658873.0, | |
| "step": 192 | |
| }, | |
| { | |
| "entropy": 1.0795052200555801, | |
| "epoch": 1.8737864077669903, | |
| "grad_norm": 0.13433118164539337, | |
| "learning_rate": 1.7223606045711006e-05, | |
| "loss": 1.075081706047058, | |
| "mean_token_accuracy": 0.6832121908664703, | |
| "num_tokens": 18755726.0, | |
| "step": 193 | |
| }, | |
| { | |
| "entropy": 1.093080535531044, | |
| "epoch": 1.883495145631068, | |
| "grad_norm": 0.13910488784313202, | |
| "learning_rate": 1.6969301659337944e-05, | |
| "loss": 1.0920544862747192, | |
| "mean_token_accuracy": 0.6785269528627396, | |
| "num_tokens": 18852964.0, | |
| "step": 194 | |
| }, | |
| { | |
| "entropy": 1.0945715457201004, | |
| "epoch": 1.8932038834951457, | |
| "grad_norm": 0.13376078009605408, | |
| "learning_rate": 1.6715920510933274e-05, | |
| "loss": 1.08772873878479, | |
| "mean_token_accuracy": 0.6802259981632233, | |
| "num_tokens": 18950306.0, | |
| "step": 195 | |
| }, | |
| { | |
| "entropy": 1.0904459059238434, | |
| "epoch": 1.9029126213592233, | |
| "grad_norm": 0.13289691507816315, | |
| "learning_rate": 1.646349173010528e-05, | |
| "loss": 1.079534888267517, | |
| "mean_token_accuracy": 0.6807990521192551, | |
| "num_tokens": 19047745.0, | |
| "step": 196 | |
| }, | |
| { | |
| "entropy": 1.084108181297779, | |
| "epoch": 1.912621359223301, | |
| "grad_norm": 0.13117721676826477, | |
| "learning_rate": 1.6212044336974596e-05, | |
| "loss": 1.0817947387695312, | |
| "mean_token_accuracy": 0.6821762919425964, | |
| "num_tokens": 19144506.0, | |
| "step": 197 | |
| }, | |
| { | |
| "entropy": 1.1004932224750519, | |
| "epoch": 1.9223300970873787, | |
| "grad_norm": 0.13507765531539917, | |
| "learning_rate": 1.596160723883802e-05, | |
| "loss": 1.0958290100097656, | |
| "mean_token_accuracy": 0.6797609329223633, | |
| "num_tokens": 19242731.0, | |
| "step": 198 | |
| }, | |
| { | |
| "entropy": 1.0579907447099686, | |
| "epoch": 1.9320388349514563, | |
| "grad_norm": 0.13918183743953705, | |
| "learning_rate": 1.57122092268452e-05, | |
| "loss": 1.0589427947998047, | |
| "mean_token_accuracy": 0.6888704299926758, | |
| "num_tokens": 19339951.0, | |
| "step": 199 | |
| }, | |
| { | |
| "entropy": 1.069817140698433, | |
| "epoch": 1.941747572815534, | |
| "grad_norm": 0.13269823789596558, | |
| "learning_rate": 1.5463878972688705e-05, | |
| "loss": 1.067978858947754, | |
| "mean_token_accuracy": 0.6849696636199951, | |
| "num_tokens": 19437708.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 1.072118565440178, | |
| "epoch": 1.9514563106796117, | |
| "grad_norm": 0.1348169893026352, | |
| "learning_rate": 1.5216645025307814e-05, | |
| "loss": 1.0756759643554688, | |
| "mean_token_accuracy": 0.6812460944056511, | |
| "num_tokens": 19534829.0, | |
| "step": 201 | |
| }, | |
| { | |
| "entropy": 1.0803940147161484, | |
| "epoch": 1.9611650485436893, | |
| "grad_norm": 0.1353556215763092, | |
| "learning_rate": 1.4970535807606453e-05, | |
| "loss": 1.0730772018432617, | |
| "mean_token_accuracy": 0.6812914535403252, | |
| "num_tokens": 19632310.0, | |
| "step": 202 | |
| }, | |
| { | |
| "entropy": 1.1029697358608246, | |
| "epoch": 1.970873786407767, | |
| "grad_norm": 0.13503853976726532, | |
| "learning_rate": 1.4725579613185547e-05, | |
| "loss": 1.1056077480316162, | |
| "mean_token_accuracy": 0.6741223260760307, | |
| "num_tokens": 19730041.0, | |
| "step": 203 | |
| }, | |
| { | |
| "entropy": 1.0752769261598587, | |
| "epoch": 1.9805825242718447, | |
| "grad_norm": 0.13670338690280914, | |
| "learning_rate": 1.4481804603090357e-05, | |
| "loss": 1.0759882926940918, | |
| "mean_token_accuracy": 0.6815044358372688, | |
| "num_tokens": 19827501.0, | |
| "step": 204 | |
| }, | |
| { | |
| "entropy": 1.0689293816685677, | |
| "epoch": 1.9902912621359223, | |
| "grad_norm": 0.13970424234867096, | |
| "learning_rate": 1.4239238802572908e-05, | |
| "loss": 1.076995849609375, | |
| "mean_token_accuracy": 0.6857749298214912, | |
| "num_tokens": 19923357.0, | |
| "step": 205 | |
| }, | |
| { | |
| "entropy": 1.0659722238779068, | |
| "epoch": 2.0, | |
| "grad_norm": 0.1367228478193283, | |
| "learning_rate": 1.3997910097870165e-05, | |
| "loss": 1.067176103591919, | |
| "mean_token_accuracy": 0.6823889762163162, | |
| "num_tokens": 20020502.0, | |
| "step": 206 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 309, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.3022063767763026e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |