Instructions to use Taywon/B2plus_v4_qwen72_e2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Taywon/B2plus_v4_qwen72_e2 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-72B-Instruct") model = PeftModel.from_pretrained(base_model, "Taywon/B2plus_v4_qwen72_e2") - Transformers
How to use Taywon/B2plus_v4_qwen72_e2 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Taywon/B2plus_v4_qwen72_e2") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Taywon/B2plus_v4_qwen72_e2", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Taywon/B2plus_v4_qwen72_e2 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Taywon/B2plus_v4_qwen72_e2" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/B2plus_v4_qwen72_e2", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/Taywon/B2plus_v4_qwen72_e2
- SGLang
How to use Taywon/B2plus_v4_qwen72_e2 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Taywon/B2plus_v4_qwen72_e2" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/B2plus_v4_qwen72_e2", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Taywon/B2plus_v4_qwen72_e2" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/B2plus_v4_qwen72_e2", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use Taywon/B2plus_v4_qwen72_e2 with Docker Model Runner:
docker model run hf.co/Taywon/B2plus_v4_qwen72_e2
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.0, | |
| "eval_steps": 500, | |
| "global_step": 206, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.4083243012428284, | |
| "epoch": 0.009708737864077669, | |
| "grad_norm": 0.94761723279953, | |
| "learning_rate": 0.0, | |
| "loss": 1.9706486463546753, | |
| "mean_token_accuracy": 0.5420544818043709, | |
| "num_tokens": 97105.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 1.421248883008957, | |
| "epoch": 0.019417475728155338, | |
| "grad_norm": 1.021393060684204, | |
| "learning_rate": 3.125e-06, | |
| "loss": 2.03873872756958, | |
| "mean_token_accuracy": 0.5355476140975952, | |
| "num_tokens": 192679.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 1.4670909941196442, | |
| "epoch": 0.02912621359223301, | |
| "grad_norm": 0.8904154896736145, | |
| "learning_rate": 6.25e-06, | |
| "loss": 1.994919776916504, | |
| "mean_token_accuracy": 0.5325814262032509, | |
| "num_tokens": 290599.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 1.5951472371816635, | |
| "epoch": 0.038834951456310676, | |
| "grad_norm": 0.6973261833190918, | |
| "learning_rate": 9.375000000000001e-06, | |
| "loss": 1.9966566562652588, | |
| "mean_token_accuracy": 0.5266260281205177, | |
| "num_tokens": 388130.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 1.6103769689798355, | |
| "epoch": 0.04854368932038835, | |
| "grad_norm": 0.5392856597900391, | |
| "learning_rate": 1.25e-05, | |
| "loss": 1.8900949954986572, | |
| "mean_token_accuracy": 0.5452185645699501, | |
| "num_tokens": 485983.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 1.7284279018640518, | |
| "epoch": 0.05825242718446602, | |
| "grad_norm": 0.4281271696090698, | |
| "learning_rate": 1.5625e-05, | |
| "loss": 1.8690071105957031, | |
| "mean_token_accuracy": 0.5448430627584457, | |
| "num_tokens": 583257.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 1.79091015458107, | |
| "epoch": 0.06796116504854369, | |
| "grad_norm": 0.4108770191669464, | |
| "learning_rate": 1.8750000000000002e-05, | |
| "loss": 1.8907827138900757, | |
| "mean_token_accuracy": 0.5405718386173248, | |
| "num_tokens": 678553.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 1.8500836789608002, | |
| "epoch": 0.07766990291262135, | |
| "grad_norm": 0.35201919078826904, | |
| "learning_rate": 2.1875e-05, | |
| "loss": 1.8045190572738647, | |
| "mean_token_accuracy": 0.5530312657356262, | |
| "num_tokens": 774991.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 1.9261595904827118, | |
| "epoch": 0.08737864077669903, | |
| "grad_norm": 0.36849886178970337, | |
| "learning_rate": 2.5e-05, | |
| "loss": 1.7962449789047241, | |
| "mean_token_accuracy": 0.5506185740232468, | |
| "num_tokens": 871685.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 1.875639259815216, | |
| "epoch": 0.0970873786407767, | |
| "grad_norm": 0.36218366026878357, | |
| "learning_rate": 2.8125000000000003e-05, | |
| "loss": 1.703657627105713, | |
| "mean_token_accuracy": 0.5688499510288239, | |
| "num_tokens": 968934.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.8956582099199295, | |
| "epoch": 0.10679611650485436, | |
| "grad_norm": 0.38436606526374817, | |
| "learning_rate": 3.125e-05, | |
| "loss": 1.6929868459701538, | |
| "mean_token_accuracy": 0.5671246349811554, | |
| "num_tokens": 1066190.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 1.9003087729215622, | |
| "epoch": 0.11650485436893204, | |
| "grad_norm": 0.38454198837280273, | |
| "learning_rate": 3.4375e-05, | |
| "loss": 1.6784961223602295, | |
| "mean_token_accuracy": 0.5702497884631157, | |
| "num_tokens": 1163717.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 1.7804109752178192, | |
| "epoch": 0.1262135922330097, | |
| "grad_norm": 0.34963515400886536, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "loss": 1.609951376914978, | |
| "mean_token_accuracy": 0.5796908214688301, | |
| "num_tokens": 1261260.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 1.6776917278766632, | |
| "epoch": 0.13592233009708737, | |
| "grad_norm": 0.2801634669303894, | |
| "learning_rate": 4.0625000000000005e-05, | |
| "loss": 1.5957839488983154, | |
| "mean_token_accuracy": 0.5835207626223564, | |
| "num_tokens": 1358315.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 1.5199688822031021, | |
| "epoch": 0.14563106796116504, | |
| "grad_norm": 0.27892422676086426, | |
| "learning_rate": 4.375e-05, | |
| "loss": 1.5371708869934082, | |
| "mean_token_accuracy": 0.5937215387821198, | |
| "num_tokens": 1455424.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 1.42391437292099, | |
| "epoch": 0.1553398058252427, | |
| "grad_norm": 0.36465972661972046, | |
| "learning_rate": 4.6875e-05, | |
| "loss": 1.5261038541793823, | |
| "mean_token_accuracy": 0.5960521325469017, | |
| "num_tokens": 1552741.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 1.4002629518508911, | |
| "epoch": 0.1650485436893204, | |
| "grad_norm": 0.33470022678375244, | |
| "learning_rate": 5e-05, | |
| "loss": 1.506011962890625, | |
| "mean_token_accuracy": 0.5978913903236389, | |
| "num_tokens": 1650044.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 1.4228239804506302, | |
| "epoch": 0.17475728155339806, | |
| "grad_norm": 0.24347813427448273, | |
| "learning_rate": 4.999856295503635e-05, | |
| "loss": 1.4823517799377441, | |
| "mean_token_accuracy": 0.599531851708889, | |
| "num_tokens": 1747782.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 1.448434516787529, | |
| "epoch": 0.18446601941747573, | |
| "grad_norm": 0.20727963745594025, | |
| "learning_rate": 4.999425198535325e-05, | |
| "loss": 1.463187575340271, | |
| "mean_token_accuracy": 0.6064818128943443, | |
| "num_tokens": 1845724.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 1.4923068583011627, | |
| "epoch": 0.1941747572815534, | |
| "grad_norm": 0.2315221130847931, | |
| "learning_rate": 4.998706758655528e-05, | |
| "loss": 1.4465688467025757, | |
| "mean_token_accuracy": 0.6043036803603172, | |
| "num_tokens": 1943411.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.472718134522438, | |
| "epoch": 0.20388349514563106, | |
| "grad_norm": 0.24738778173923492, | |
| "learning_rate": 4.997701058458676e-05, | |
| "loss": 1.4063471555709839, | |
| "mean_token_accuracy": 0.6147852465510368, | |
| "num_tokens": 2041045.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 1.4919932037591934, | |
| "epoch": 0.21359223300970873, | |
| "grad_norm": 0.21912068128585815, | |
| "learning_rate": 4.996408213563684e-05, | |
| "loss": 1.4053853750228882, | |
| "mean_token_accuracy": 0.6167104989290237, | |
| "num_tokens": 2138535.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 1.4844385087490082, | |
| "epoch": 0.22330097087378642, | |
| "grad_norm": 0.22786955535411835, | |
| "learning_rate": 4.994828372600649e-05, | |
| "loss": 1.3828628063201904, | |
| "mean_token_accuracy": 0.6216765120625496, | |
| "num_tokens": 2235538.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 1.4436479061841965, | |
| "epoch": 0.23300970873786409, | |
| "grad_norm": 0.19272480905056, | |
| "learning_rate": 4.9929617171937724e-05, | |
| "loss": 1.3706296682357788, | |
| "mean_token_accuracy": 0.6209864541888237, | |
| "num_tokens": 2332954.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 1.4084927588701248, | |
| "epoch": 0.24271844660194175, | |
| "grad_norm": 0.17803719639778137, | |
| "learning_rate": 4.9908084619404735e-05, | |
| "loss": 1.3561553955078125, | |
| "mean_token_accuracy": 0.6240377500653267, | |
| "num_tokens": 2431031.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 1.3695293813943863, | |
| "epoch": 0.2524271844660194, | |
| "grad_norm": 0.1710546761751175, | |
| "learning_rate": 4.988368854386722e-05, | |
| "loss": 1.3544114828109741, | |
| "mean_token_accuracy": 0.6251663640141487, | |
| "num_tokens": 2527933.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 1.2857100814580917, | |
| "epoch": 0.2621359223300971, | |
| "grad_norm": 0.18847821652889252, | |
| "learning_rate": 4.985643174998578e-05, | |
| "loss": 1.3139867782592773, | |
| "mean_token_accuracy": 0.6356627941131592, | |
| "num_tokens": 2625130.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 1.280667930841446, | |
| "epoch": 0.27184466019417475, | |
| "grad_norm": 0.19685013592243195, | |
| "learning_rate": 4.982631737129948e-05, | |
| "loss": 1.3132545948028564, | |
| "mean_token_accuracy": 0.6352921947836876, | |
| "num_tokens": 2722735.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 1.3028772920370102, | |
| "epoch": 0.2815533980582524, | |
| "grad_norm": 0.19354666769504547, | |
| "learning_rate": 4.9793348869865616e-05, | |
| "loss": 1.3400448560714722, | |
| "mean_token_accuracy": 0.6271930709481239, | |
| "num_tokens": 2820721.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 1.3173751831054688, | |
| "epoch": 0.2912621359223301, | |
| "grad_norm": 0.16872914135456085, | |
| "learning_rate": 4.9757530035861716e-05, | |
| "loss": 1.3304100036621094, | |
| "mean_token_accuracy": 0.6323504224419594, | |
| "num_tokens": 2918531.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 1.284382238984108, | |
| "epoch": 0.30097087378640774, | |
| "grad_norm": 0.17004726827144623, | |
| "learning_rate": 4.971886498714977e-05, | |
| "loss": 1.2796059846878052, | |
| "mean_token_accuracy": 0.6409082934260368, | |
| "num_tokens": 3014027.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 1.3059177845716476, | |
| "epoch": 0.3106796116504854, | |
| "grad_norm": 0.17118602991104126, | |
| "learning_rate": 4.967735816880286e-05, | |
| "loss": 1.2877871990203857, | |
| "mean_token_accuracy": 0.6396790593862534, | |
| "num_tokens": 3111172.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 1.3147014528512955, | |
| "epoch": 0.32038834951456313, | |
| "grad_norm": 0.16340142488479614, | |
| "learning_rate": 4.963301435259413e-05, | |
| "loss": 1.2802796363830566, | |
| "mean_token_accuracy": 0.6386668905615807, | |
| "num_tokens": 3208860.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 1.3065699636936188, | |
| "epoch": 0.3300970873786408, | |
| "grad_norm": 0.1647864431142807, | |
| "learning_rate": 4.95858386364482e-05, | |
| "loss": 1.2798354625701904, | |
| "mean_token_accuracy": 0.6393692642450333, | |
| "num_tokens": 3305964.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 1.2940323948860168, | |
| "epoch": 0.33980582524271846, | |
| "grad_norm": 0.15510039031505585, | |
| "learning_rate": 4.9535836443855096e-05, | |
| "loss": 1.2712514400482178, | |
| "mean_token_accuracy": 0.6405108198523521, | |
| "num_tokens": 3403337.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 1.2636306136846542, | |
| "epoch": 0.34951456310679613, | |
| "grad_norm": 0.16528593003749847, | |
| "learning_rate": 4.948301352324673e-05, | |
| "loss": 1.2383002042770386, | |
| "mean_token_accuracy": 0.6498897895216942, | |
| "num_tokens": 3500500.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 1.2304436564445496, | |
| "epoch": 0.3592233009708738, | |
| "grad_norm": 0.15354204177856445, | |
| "learning_rate": 4.942737594733609e-05, | |
| "loss": 1.2233033180236816, | |
| "mean_token_accuracy": 0.6514501944184303, | |
| "num_tokens": 3597306.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 1.2565466612577438, | |
| "epoch": 0.36893203883495146, | |
| "grad_norm": 0.15500810742378235, | |
| "learning_rate": 4.9368930112419e-05, | |
| "loss": 1.2482693195343018, | |
| "mean_token_accuracy": 0.645413227379322, | |
| "num_tokens": 3694352.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 1.2443159818649292, | |
| "epoch": 0.3786407766990291, | |
| "grad_norm": 0.15541698038578033, | |
| "learning_rate": 4.930768273763889e-05, | |
| "loss": 1.2520265579223633, | |
| "mean_token_accuracy": 0.6438535004854202, | |
| "num_tokens": 3792464.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 1.2296875715255737, | |
| "epoch": 0.3883495145631068, | |
| "grad_norm": 0.15958574414253235, | |
| "learning_rate": 4.92436408642143e-05, | |
| "loss": 1.2351443767547607, | |
| "mean_token_accuracy": 0.6492253467440605, | |
| "num_tokens": 3889619.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 1.2195448875427246, | |
| "epoch": 0.39805825242718446, | |
| "grad_norm": 0.1615312397480011, | |
| "learning_rate": 4.917681185462934e-05, | |
| "loss": 1.2214652299880981, | |
| "mean_token_accuracy": 0.6524631232023239, | |
| "num_tokens": 3986630.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 1.2140728384256363, | |
| "epoch": 0.4077669902912621, | |
| "grad_norm": 0.15110917389392853, | |
| "learning_rate": 4.910720339178735e-05, | |
| "loss": 1.2222949266433716, | |
| "mean_token_accuracy": 0.6521077156066895, | |
| "num_tokens": 4083691.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 1.2051743566989899, | |
| "epoch": 0.4174757281553398, | |
| "grad_norm": 0.1491296887397766, | |
| "learning_rate": 4.90348234781276e-05, | |
| "loss": 1.2039450407028198, | |
| "mean_token_accuracy": 0.654543362557888, | |
| "num_tokens": 4181870.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 1.2167726755142212, | |
| "epoch": 0.42718446601941745, | |
| "grad_norm": 0.1601928472518921, | |
| "learning_rate": 4.895968043470532e-05, | |
| "loss": 1.2167367935180664, | |
| "mean_token_accuracy": 0.65306556224823, | |
| "num_tokens": 4277672.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 1.1795921474695206, | |
| "epoch": 0.4368932038834951, | |
| "grad_norm": 0.14628776907920837, | |
| "learning_rate": 4.8881782900235094e-05, | |
| "loss": 1.1818878650665283, | |
| "mean_token_accuracy": 0.6603984162211418, | |
| "num_tokens": 4375365.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 1.2080871313810349, | |
| "epoch": 0.44660194174757284, | |
| "grad_norm": 0.15034087002277374, | |
| "learning_rate": 4.880113983009768e-05, | |
| "loss": 1.2044813632965088, | |
| "mean_token_accuracy": 0.6534772142767906, | |
| "num_tokens": 4472689.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 1.2424661964178085, | |
| "epoch": 0.4563106796116505, | |
| "grad_norm": 0.14910851418972015, | |
| "learning_rate": 4.87177604953105e-05, | |
| "loss": 1.2322750091552734, | |
| "mean_token_accuracy": 0.6469002515077591, | |
| "num_tokens": 4569961.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 1.209616169333458, | |
| "epoch": 0.46601941747572817, | |
| "grad_norm": 0.14911304414272308, | |
| "learning_rate": 4.86316544814618e-05, | |
| "loss": 1.2000218629837036, | |
| "mean_token_accuracy": 0.6570775136351585, | |
| "num_tokens": 4667359.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 1.201382964849472, | |
| "epoch": 0.47572815533980584, | |
| "grad_norm": 0.17708911001682281, | |
| "learning_rate": 4.854283168760868e-05, | |
| "loss": 1.1916768550872803, | |
| "mean_token_accuracy": 0.6561535075306892, | |
| "num_tokens": 4765400.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 1.1911841928958893, | |
| "epoch": 0.4854368932038835, | |
| "grad_norm": 0.1523158699274063, | |
| "learning_rate": 4.8451302325139004e-05, | |
| "loss": 1.1832383871078491, | |
| "mean_token_accuracy": 0.6573370844125748, | |
| "num_tokens": 4863204.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 1.1881461590528488, | |
| "epoch": 0.49514563106796117, | |
| "grad_norm": 0.15072602033615112, | |
| "learning_rate": 4.835707691659753e-05, | |
| "loss": 1.1761033535003662, | |
| "mean_token_accuracy": 0.6590301543474197, | |
| "num_tokens": 4960926.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 1.1763849258422852, | |
| "epoch": 0.5048543689320388, | |
| "grad_norm": 0.15600641071796417, | |
| "learning_rate": 4.8260166294476164e-05, | |
| "loss": 1.1728320121765137, | |
| "mean_token_accuracy": 0.6621676161885262, | |
| "num_tokens": 5058013.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 1.1916624307632446, | |
| "epoch": 0.5145631067961165, | |
| "grad_norm": 0.15378843247890472, | |
| "learning_rate": 4.8160581599968625e-05, | |
| "loss": 1.184821367263794, | |
| "mean_token_accuracy": 0.6572789996862411, | |
| "num_tokens": 5153970.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 1.1805166453123093, | |
| "epoch": 0.5242718446601942, | |
| "grad_norm": 0.15211763978004456, | |
| "learning_rate": 4.8058334281689595e-05, | |
| "loss": 1.1789004802703857, | |
| "mean_token_accuracy": 0.658557578921318, | |
| "num_tokens": 5251276.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 1.1733617633581161, | |
| "epoch": 0.5339805825242718, | |
| "grad_norm": 0.15024270117282867, | |
| "learning_rate": 4.7953436094358595e-05, | |
| "loss": 1.1704764366149902, | |
| "mean_token_accuracy": 0.6585692763328552, | |
| "num_tokens": 5348605.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 1.1367567777633667, | |
| "epoch": 0.5436893203883495, | |
| "grad_norm": 0.14717121422290802, | |
| "learning_rate": 4.784589909744855e-05, | |
| "loss": 1.1350934505462646, | |
| "mean_token_accuracy": 0.6707980632781982, | |
| "num_tokens": 5446513.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 1.1633624881505966, | |
| "epoch": 0.5533980582524272, | |
| "grad_norm": 0.15170669555664062, | |
| "learning_rate": 4.7735735653799463e-05, | |
| "loss": 1.1654052734375, | |
| "mean_token_accuracy": 0.6653316840529442, | |
| "num_tokens": 5543963.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 1.1694072782993317, | |
| "epoch": 0.5631067961165048, | |
| "grad_norm": 0.14897707104682922, | |
| "learning_rate": 4.762295842819707e-05, | |
| "loss": 1.1644500494003296, | |
| "mean_token_accuracy": 0.6641355082392693, | |
| "num_tokens": 5641181.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 1.1587684005498886, | |
| "epoch": 0.5728155339805825, | |
| "grad_norm": 0.14866051077842712, | |
| "learning_rate": 4.75075803859169e-05, | |
| "loss": 1.1571202278137207, | |
| "mean_token_accuracy": 0.6645473390817642, | |
| "num_tokens": 5738020.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 1.1717360317707062, | |
| "epoch": 0.5825242718446602, | |
| "grad_norm": 0.15497078001499176, | |
| "learning_rate": 4.7389614791233726e-05, | |
| "loss": 1.1673715114593506, | |
| "mean_token_accuracy": 0.662636861205101, | |
| "num_tokens": 5835528.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 1.1693744212388992, | |
| "epoch": 0.5922330097087378, | |
| "grad_norm": 0.15867234766483307, | |
| "learning_rate": 4.726907520589664e-05, | |
| "loss": 1.1548094749450684, | |
| "mean_token_accuracy": 0.6624177768826485, | |
| "num_tokens": 5933622.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 1.1339199990034103, | |
| "epoch": 0.6019417475728155, | |
| "grad_norm": 0.15212447941303253, | |
| "learning_rate": 4.714597548756996e-05, | |
| "loss": 1.1325181722640991, | |
| "mean_token_accuracy": 0.6707736179232597, | |
| "num_tokens": 6030609.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 1.1296663135290146, | |
| "epoch": 0.6116504854368932, | |
| "grad_norm": 0.15575166046619415, | |
| "learning_rate": 4.702032978824011e-05, | |
| "loss": 1.1267575025558472, | |
| "mean_token_accuracy": 0.6701638028025627, | |
| "num_tokens": 6127908.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 1.1318050771951675, | |
| "epoch": 0.6213592233009708, | |
| "grad_norm": 0.15813998878002167, | |
| "learning_rate": 4.6892152552588655e-05, | |
| "loss": 1.1390020847320557, | |
| "mean_token_accuracy": 0.6672858372330666, | |
| "num_tokens": 6225260.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 1.1477476954460144, | |
| "epoch": 0.6310679611650486, | |
| "grad_norm": 0.15706756711006165, | |
| "learning_rate": 4.6761458516331655e-05, | |
| "loss": 1.153120994567871, | |
| "mean_token_accuracy": 0.663187600672245, | |
| "num_tokens": 6322811.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 1.133908674120903, | |
| "epoch": 0.6407766990291263, | |
| "grad_norm": 0.1579563319683075, | |
| "learning_rate": 4.662826270452565e-05, | |
| "loss": 1.1408581733703613, | |
| "mean_token_accuracy": 0.6672231107950211, | |
| "num_tokens": 6419134.0, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 1.150125876069069, | |
| "epoch": 0.6504854368932039, | |
| "grad_norm": 0.15973767638206482, | |
| "learning_rate": 4.649258042984026e-05, | |
| "loss": 1.1557530164718628, | |
| "mean_token_accuracy": 0.6634695678949356, | |
| "num_tokens": 6516137.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 1.124921292066574, | |
| "epoch": 0.6601941747572816, | |
| "grad_norm": 0.15293626487255096, | |
| "learning_rate": 4.6354427290797875e-05, | |
| "loss": 1.1272459030151367, | |
| "mean_token_accuracy": 0.6693216189742088, | |
| "num_tokens": 6613796.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 1.1551329046487808, | |
| "epoch": 0.6699029126213593, | |
| "grad_norm": 0.15234892070293427, | |
| "learning_rate": 4.621381916998029e-05, | |
| "loss": 1.1462955474853516, | |
| "mean_token_accuracy": 0.6653169468045235, | |
| "num_tokens": 6711660.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 1.1397110670804977, | |
| "epoch": 0.6796116504854369, | |
| "grad_norm": 0.15561261773109436, | |
| "learning_rate": 4.607077223220285e-05, | |
| "loss": 1.1248576641082764, | |
| "mean_token_accuracy": 0.6719892099499702, | |
| "num_tokens": 6808587.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 1.1522215157747269, | |
| "epoch": 0.6893203883495146, | |
| "grad_norm": 0.1659662127494812, | |
| "learning_rate": 4.592530292265609e-05, | |
| "loss": 1.1409823894500732, | |
| "mean_token_accuracy": 0.6674581989645958, | |
| "num_tokens": 6906120.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 1.1350633352994919, | |
| "epoch": 0.6990291262135923, | |
| "grad_norm": 0.15686708688735962, | |
| "learning_rate": 4.5777427965015096e-05, | |
| "loss": 1.128638744354248, | |
| "mean_token_accuracy": 0.6704377010464668, | |
| "num_tokens": 7004058.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 1.1182153522968292, | |
| "epoch": 0.7087378640776699, | |
| "grad_norm": 0.15111538767814636, | |
| "learning_rate": 4.562716435951692e-05, | |
| "loss": 1.1166245937347412, | |
| "mean_token_accuracy": 0.6737237125635147, | |
| "num_tokens": 7101920.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 1.1188742965459824, | |
| "epoch": 0.7184466019417476, | |
| "grad_norm": 0.15409265458583832, | |
| "learning_rate": 4.5474529381006146e-05, | |
| "loss": 1.118614673614502, | |
| "mean_token_accuracy": 0.6710415109992027, | |
| "num_tokens": 7198756.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 1.1149023473262787, | |
| "epoch": 0.7281553398058253, | |
| "grad_norm": 0.16151487827301025, | |
| "learning_rate": 4.531954057694897e-05, | |
| "loss": 1.1311017274856567, | |
| "mean_token_accuracy": 0.6720475554466248, | |
| "num_tokens": 7296339.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 1.1312980204820633, | |
| "epoch": 0.7378640776699029, | |
| "grad_norm": 0.1549658626317978, | |
| "learning_rate": 4.516221576541581e-05, | |
| "loss": 1.1340723037719727, | |
| "mean_token_accuracy": 0.6688062027096748, | |
| "num_tokens": 7393950.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 1.1147898435592651, | |
| "epoch": 0.7475728155339806, | |
| "grad_norm": 0.15624849498271942, | |
| "learning_rate": 4.5002573033032904e-05, | |
| "loss": 1.1091203689575195, | |
| "mean_token_accuracy": 0.674225278198719, | |
| "num_tokens": 7489205.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 1.137469932436943, | |
| "epoch": 0.7572815533980582, | |
| "grad_norm": 0.16516146063804626, | |
| "learning_rate": 4.484063073290301e-05, | |
| "loss": 1.1193323135375977, | |
| "mean_token_accuracy": 0.6739235296845436, | |
| "num_tokens": 7584161.0, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 1.1054588705301285, | |
| "epoch": 0.7669902912621359, | |
| "grad_norm": 0.15215378999710083, | |
| "learning_rate": 4.467640748249548e-05, | |
| "loss": 1.1007866859436035, | |
| "mean_token_accuracy": 0.6783005967736244, | |
| "num_tokens": 7681353.0, | |
| "step": 79 | |
| }, | |
| { | |
| "entropy": 1.0961224287748337, | |
| "epoch": 0.7766990291262136, | |
| "grad_norm": 0.15287643671035767, | |
| "learning_rate": 4.4509922161505926e-05, | |
| "loss": 1.0958147048950195, | |
| "mean_token_accuracy": 0.676163524389267, | |
| "num_tokens": 7778582.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 1.1254196166992188, | |
| "epoch": 0.7864077669902912, | |
| "grad_norm": 0.16113276779651642, | |
| "learning_rate": 4.4341193909685686e-05, | |
| "loss": 1.130951166152954, | |
| "mean_token_accuracy": 0.6697586253285408, | |
| "num_tokens": 7874950.0, | |
| "step": 81 | |
| }, | |
| { | |
| "entropy": 1.0993820428848267, | |
| "epoch": 0.7961165048543689, | |
| "grad_norm": 0.1620422899723053, | |
| "learning_rate": 4.417024212464152e-05, | |
| "loss": 1.1005873680114746, | |
| "mean_token_accuracy": 0.6766335293650627, | |
| "num_tokens": 7971956.0, | |
| "step": 82 | |
| }, | |
| { | |
| "entropy": 1.1041197627782822, | |
| "epoch": 0.8058252427184466, | |
| "grad_norm": 0.15546955168247223, | |
| "learning_rate": 4.399708645960559e-05, | |
| "loss": 1.10465407371521, | |
| "mean_token_accuracy": 0.674575038254261, | |
| "num_tokens": 8068461.0, | |
| "step": 83 | |
| }, | |
| { | |
| "entropy": 1.0924506783485413, | |
| "epoch": 0.8155339805825242, | |
| "grad_norm": 0.16429384052753448, | |
| "learning_rate": 4.382174682117598e-05, | |
| "loss": 1.093902587890625, | |
| "mean_token_accuracy": 0.6806196495890617, | |
| "num_tokens": 8166250.0, | |
| "step": 84 | |
| }, | |
| { | |
| "entropy": 1.1175890564918518, | |
| "epoch": 0.8252427184466019, | |
| "grad_norm": 0.1590225100517273, | |
| "learning_rate": 4.364424336702825e-05, | |
| "loss": 1.1183996200561523, | |
| "mean_token_accuracy": 0.6712751016020775, | |
| "num_tokens": 8263412.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 1.091995120048523, | |
| "epoch": 0.8349514563106796, | |
| "grad_norm": 0.16027086973190308, | |
| "learning_rate": 4.346459650359798e-05, | |
| "loss": 1.089324951171875, | |
| "mean_token_accuracy": 0.6779745444655418, | |
| "num_tokens": 8361054.0, | |
| "step": 86 | |
| }, | |
| { | |
| "entropy": 1.1091380715370178, | |
| "epoch": 0.8446601941747572, | |
| "grad_norm": 0.16367396712303162, | |
| "learning_rate": 4.328282688373479e-05, | |
| "loss": 1.1101912260055542, | |
| "mean_token_accuracy": 0.6726596802473068, | |
| "num_tokens": 8458058.0, | |
| "step": 87 | |
| }, | |
| { | |
| "entropy": 1.1332892328500748, | |
| "epoch": 0.8543689320388349, | |
| "grad_norm": 0.16062098741531372, | |
| "learning_rate": 4.3098955404328045e-05, | |
| "loss": 1.1345933675765991, | |
| "mean_token_accuracy": 0.669020764529705, | |
| "num_tokens": 8552707.0, | |
| "step": 88 | |
| }, | |
| { | |
| "entropy": 1.124135971069336, | |
| "epoch": 0.8640776699029126, | |
| "grad_norm": 0.15737071633338928, | |
| "learning_rate": 4.29130032039044e-05, | |
| "loss": 1.1120331287384033, | |
| "mean_token_accuracy": 0.6742131784558296, | |
| "num_tokens": 8648715.0, | |
| "step": 89 | |
| }, | |
| { | |
| "entropy": 1.11882945895195, | |
| "epoch": 0.8737864077669902, | |
| "grad_norm": 0.15959268808364868, | |
| "learning_rate": 4.272499166019771e-05, | |
| "loss": 1.117668628692627, | |
| "mean_token_accuracy": 0.6719657182693481, | |
| "num_tokens": 8744790.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 1.1137337386608124, | |
| "epoch": 0.883495145631068, | |
| "grad_norm": 0.1567354053258896, | |
| "learning_rate": 4.253494238769134e-05, | |
| "loss": 1.10910165309906, | |
| "mean_token_accuracy": 0.6751311644911766, | |
| "num_tokens": 8841963.0, | |
| "step": 91 | |
| }, | |
| { | |
| "entropy": 1.0963155031204224, | |
| "epoch": 0.8932038834951457, | |
| "grad_norm": 0.16550451517105103, | |
| "learning_rate": 4.234287723513326e-05, | |
| "loss": 1.0936603546142578, | |
| "mean_token_accuracy": 0.6774952635169029, | |
| "num_tokens": 8938823.0, | |
| "step": 92 | |
| }, | |
| { | |
| "entropy": 1.1137651056051254, | |
| "epoch": 0.9029126213592233, | |
| "grad_norm": 0.15746837854385376, | |
| "learning_rate": 4.2148818283024304e-05, | |
| "loss": 1.11457097530365, | |
| "mean_token_accuracy": 0.6719932034611702, | |
| "num_tokens": 9036976.0, | |
| "step": 93 | |
| }, | |
| { | |
| "entropy": 1.085622027516365, | |
| "epoch": 0.912621359223301, | |
| "grad_norm": 0.16476289927959442, | |
| "learning_rate": 4.195278784107964e-05, | |
| "loss": 1.086329460144043, | |
| "mean_token_accuracy": 0.677251435816288, | |
| "num_tokens": 9134903.0, | |
| "step": 94 | |
| }, | |
| { | |
| "entropy": 1.1134615540504456, | |
| "epoch": 0.9223300970873787, | |
| "grad_norm": 0.16442131996154785, | |
| "learning_rate": 4.175480844566404e-05, | |
| "loss": 1.1127569675445557, | |
| "mean_token_accuracy": 0.6718188151717186, | |
| "num_tokens": 9231494.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 1.1019631028175354, | |
| "epoch": 0.9320388349514563, | |
| "grad_norm": 0.15546253323554993, | |
| "learning_rate": 4.1554902857200924e-05, | |
| "loss": 1.0951738357543945, | |
| "mean_token_accuracy": 0.6784623265266418, | |
| "num_tokens": 9328418.0, | |
| "step": 96 | |
| }, | |
| { | |
| "entropy": 1.0921340584754944, | |
| "epoch": 0.941747572815534, | |
| "grad_norm": 0.16863901913166046, | |
| "learning_rate": 4.135309405755583e-05, | |
| "loss": 1.0979890823364258, | |
| "mean_token_accuracy": 0.6765805631875992, | |
| "num_tokens": 9426256.0, | |
| "step": 97 | |
| }, | |
| { | |
| "entropy": 1.104684755206108, | |
| "epoch": 0.9514563106796117, | |
| "grad_norm": 0.16420894861221313, | |
| "learning_rate": 4.11494052473943e-05, | |
| "loss": 1.106919765472412, | |
| "mean_token_accuracy": 0.6736476495862007, | |
| "num_tokens": 9523841.0, | |
| "step": 98 | |
| }, | |
| { | |
| "entropy": 1.0703193694353104, | |
| "epoch": 0.9611650485436893, | |
| "grad_norm": 0.1605386883020401, | |
| "learning_rate": 4.094385984351462e-05, | |
| "loss": 1.0785481929779053, | |
| "mean_token_accuracy": 0.6812796592712402, | |
| "num_tokens": 9621225.0, | |
| "step": 99 | |
| }, | |
| { | |
| "entropy": 1.090438723564148, | |
| "epoch": 0.970873786407767, | |
| "grad_norm": 0.15666428208351135, | |
| "learning_rate": 4.073648147615579e-05, | |
| "loss": 1.0910429954528809, | |
| "mean_token_accuracy": 0.6792959794402122, | |
| "num_tokens": 9718805.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 1.1004114151000977, | |
| "epoch": 0.9805825242718447, | |
| "grad_norm": 0.16704976558685303, | |
| "learning_rate": 4.052729398628089e-05, | |
| "loss": 1.0998764038085938, | |
| "mean_token_accuracy": 0.6745198145508766, | |
| "num_tokens": 9816814.0, | |
| "step": 101 | |
| }, | |
| { | |
| "entropy": 1.0953031778335571, | |
| "epoch": 0.9902912621359223, | |
| "grad_norm": 0.16081705689430237, | |
| "learning_rate": 4.031632142283622e-05, | |
| "loss": 1.0844577550888062, | |
| "mean_token_accuracy": 0.6796873956918716, | |
| "num_tokens": 9914411.0, | |
| "step": 102 | |
| }, | |
| { | |
| "entropy": 1.0845869928598404, | |
| "epoch": 1.0, | |
| "grad_norm": 0.16136308014392853, | |
| "learning_rate": 4.0103588039986556e-05, | |
| "loss": 1.0797569751739502, | |
| "mean_token_accuracy": 0.6803081929683685, | |
| "num_tokens": 10010251.0, | |
| "step": 103 | |
| }, | |
| { | |
| "entropy": 1.068443089723587, | |
| "epoch": 1.0097087378640777, | |
| "grad_norm": 0.1638786494731903, | |
| "learning_rate": 3.988911829432682e-05, | |
| "loss": 1.0353350639343262, | |
| "mean_token_accuracy": 0.6882663518190384, | |
| "num_tokens": 10106628.0, | |
| "step": 104 | |
| }, | |
| { | |
| "entropy": 1.0666862949728966, | |
| "epoch": 1.0194174757281553, | |
| "grad_norm": 0.16060160100460052, | |
| "learning_rate": 3.967293684207042e-05, | |
| "loss": 1.04751718044281, | |
| "mean_token_accuracy": 0.6869001239538193, | |
| "num_tokens": 10203919.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 1.029679775238037, | |
| "epoch": 1.029126213592233, | |
| "grad_norm": 0.16603456437587738, | |
| "learning_rate": 3.945506853621476e-05, | |
| "loss": 1.0321340560913086, | |
| "mean_token_accuracy": 0.6923350319266319, | |
| "num_tokens": 10301090.0, | |
| "step": 106 | |
| }, | |
| { | |
| "entropy": 1.0381744876503944, | |
| "epoch": 1.0388349514563107, | |
| "grad_norm": 0.1720408946275711, | |
| "learning_rate": 3.923553842368396e-05, | |
| "loss": 1.0508530139923096, | |
| "mean_token_accuracy": 0.6882685720920563, | |
| "num_tokens": 10398407.0, | |
| "step": 107 | |
| }, | |
| { | |
| "entropy": 1.0274595245718956, | |
| "epoch": 1.0485436893203883, | |
| "grad_norm": 0.1640644371509552, | |
| "learning_rate": 3.901437174244943e-05, | |
| "loss": 1.0384334325790405, | |
| "mean_token_accuracy": 0.6870113834738731, | |
| "num_tokens": 10496286.0, | |
| "step": 108 | |
| }, | |
| { | |
| "entropy": 1.051487922668457, | |
| "epoch": 1.058252427184466, | |
| "grad_norm": 0.17232562601566315, | |
| "learning_rate": 3.879159391862839e-05, | |
| "loss": 1.0552724599838257, | |
| "mean_token_accuracy": 0.6844486594200134, | |
| "num_tokens": 10593041.0, | |
| "step": 109 | |
| }, | |
| { | |
| "entropy": 1.0558612048625946, | |
| "epoch": 1.0679611650485437, | |
| "grad_norm": 0.16551247239112854, | |
| "learning_rate": 3.856723056356084e-05, | |
| "loss": 1.0514483451843262, | |
| "mean_token_accuracy": 0.6873890236020088, | |
| "num_tokens": 10690608.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 1.0500814393162727, | |
| "epoch": 1.0776699029126213, | |
| "grad_norm": 0.16079694032669067, | |
| "learning_rate": 3.834130747086512e-05, | |
| "loss": 1.0406620502471924, | |
| "mean_token_accuracy": 0.6894150301814079, | |
| "num_tokens": 10788441.0, | |
| "step": 111 | |
| }, | |
| { | |
| "entropy": 1.0713951885700226, | |
| "epoch": 1.087378640776699, | |
| "grad_norm": 0.16561074554920197, | |
| "learning_rate": 3.811385061347263e-05, | |
| "loss": 1.047391414642334, | |
| "mean_token_accuracy": 0.6867462620139122, | |
| "num_tokens": 10886095.0, | |
| "step": 112 | |
| }, | |
| { | |
| "entropy": 1.0726030766963959, | |
| "epoch": 1.0970873786407767, | |
| "grad_norm": 0.1706630438566208, | |
| "learning_rate": 3.788488614064188e-05, | |
| "loss": 1.0566606521606445, | |
| "mean_token_accuracy": 0.6830915883183479, | |
| "num_tokens": 10983700.0, | |
| "step": 113 | |
| }, | |
| { | |
| "entropy": 1.0523803383111954, | |
| "epoch": 1.1067961165048543, | |
| "grad_norm": 0.17153160274028778, | |
| "learning_rate": 3.7654440374952286e-05, | |
| "loss": 1.0483253002166748, | |
| "mean_token_accuracy": 0.6866283416748047, | |
| "num_tokens": 11081141.0, | |
| "step": 114 | |
| }, | |
| { | |
| "entropy": 1.0569421201944351, | |
| "epoch": 1.116504854368932, | |
| "grad_norm": 0.17598958313465118, | |
| "learning_rate": 3.742253980927799e-05, | |
| "loss": 1.050697684288025, | |
| "mean_token_accuracy": 0.6876719892024994, | |
| "num_tokens": 11178553.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 1.025670774281025, | |
| "epoch": 1.1262135922330097, | |
| "grad_norm": 0.1734474152326584, | |
| "learning_rate": 3.7189211103742206e-05, | |
| "loss": 1.0291353464126587, | |
| "mean_token_accuracy": 0.6928240656852722, | |
| "num_tokens": 11275288.0, | |
| "step": 116 | |
| }, | |
| { | |
| "entropy": 1.003603272140026, | |
| "epoch": 1.1359223300970873, | |
| "grad_norm": 0.16272073984146118, | |
| "learning_rate": 3.695448108265221e-05, | |
| "loss": 1.0103802680969238, | |
| "mean_token_accuracy": 0.6972288712859154, | |
| "num_tokens": 11372523.0, | |
| "step": 117 | |
| }, | |
| { | |
| "entropy": 1.02402725815773, | |
| "epoch": 1.145631067961165, | |
| "grad_norm": 0.16548147797584534, | |
| "learning_rate": 3.671837673141559e-05, | |
| "loss": 1.030734896659851, | |
| "mean_token_accuracy": 0.692120373249054, | |
| "num_tokens": 11470482.0, | |
| "step": 118 | |
| }, | |
| { | |
| "entropy": 1.0215473622083664, | |
| "epoch": 1.1553398058252426, | |
| "grad_norm": 0.16721011698246002, | |
| "learning_rate": 3.648092519343783e-05, | |
| "loss": 1.0301539897918701, | |
| "mean_token_accuracy": 0.6894958764314651, | |
| "num_tokens": 11568438.0, | |
| "step": 119 | |
| }, | |
| { | |
| "entropy": 1.056374877691269, | |
| "epoch": 1.1650485436893203, | |
| "grad_norm": 0.17408575117588043, | |
| "learning_rate": 3.6242153767001895e-05, | |
| "loss": 1.0481269359588623, | |
| "mean_token_accuracy": 0.6849339008331299, | |
| "num_tokens": 11665644.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 1.0519457012414932, | |
| "epoch": 1.174757281553398, | |
| "grad_norm": 0.1641719490289688, | |
| "learning_rate": 3.600208990212984e-05, | |
| "loss": 1.0483492612838745, | |
| "mean_token_accuracy": 0.6879769489169121, | |
| "num_tokens": 11762261.0, | |
| "step": 121 | |
| }, | |
| { | |
| "entropy": 1.049955114722252, | |
| "epoch": 1.1844660194174756, | |
| "grad_norm": 0.17227791249752045, | |
| "learning_rate": 3.5760761197427095e-05, | |
| "loss": 1.0500767230987549, | |
| "mean_token_accuracy": 0.6855774074792862, | |
| "num_tokens": 11860108.0, | |
| "step": 122 | |
| }, | |
| { | |
| "entropy": 1.0267768576741219, | |
| "epoch": 1.1941747572815533, | |
| "grad_norm": 0.16169141232967377, | |
| "learning_rate": 3.551819539690965e-05, | |
| "loss": 1.0238873958587646, | |
| "mean_token_accuracy": 0.6936259567737579, | |
| "num_tokens": 11957749.0, | |
| "step": 123 | |
| }, | |
| { | |
| "entropy": 1.0247065424919128, | |
| "epoch": 1.203883495145631, | |
| "grad_norm": 0.17105494439601898, | |
| "learning_rate": 3.527442038681446e-05, | |
| "loss": 1.0272483825683594, | |
| "mean_token_accuracy": 0.6926182508468628, | |
| "num_tokens": 12055121.0, | |
| "step": 124 | |
| }, | |
| { | |
| "entropy": 1.0369553938508034, | |
| "epoch": 1.2135922330097086, | |
| "grad_norm": 0.1695042997598648, | |
| "learning_rate": 3.5029464192393555e-05, | |
| "loss": 1.038701057434082, | |
| "mean_token_accuracy": 0.68787931650877, | |
| "num_tokens": 12151377.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 1.0596141815185547, | |
| "epoch": 1.2233009708737863, | |
| "grad_norm": 0.17646324634552002, | |
| "learning_rate": 3.478335497469219e-05, | |
| "loss": 1.0595526695251465, | |
| "mean_token_accuracy": 0.6831439137458801, | |
| "num_tokens": 12248560.0, | |
| "step": 126 | |
| }, | |
| { | |
| "entropy": 1.0373520329594612, | |
| "epoch": 1.233009708737864, | |
| "grad_norm": 0.19195199012756348, | |
| "learning_rate": 3.45361210273113e-05, | |
| "loss": 1.0353025197982788, | |
| "mean_token_accuracy": 0.6883834302425385, | |
| "num_tokens": 12345865.0, | |
| "step": 127 | |
| }, | |
| { | |
| "entropy": 1.066431000828743, | |
| "epoch": 1.2427184466019416, | |
| "grad_norm": 0.17165441811084747, | |
| "learning_rate": 3.42877907731548e-05, | |
| "loss": 1.0560047626495361, | |
| "mean_token_accuracy": 0.6849204152822495, | |
| "num_tokens": 12443200.0, | |
| "step": 128 | |
| }, | |
| { | |
| "entropy": 1.0401945114135742, | |
| "epoch": 1.2524271844660193, | |
| "grad_norm": 0.1729133278131485, | |
| "learning_rate": 3.403839276116199e-05, | |
| "loss": 1.0313591957092285, | |
| "mean_token_accuracy": 0.6888679265975952, | |
| "num_tokens": 12540890.0, | |
| "step": 129 | |
| }, | |
| { | |
| "entropy": 1.018211580812931, | |
| "epoch": 1.262135922330097, | |
| "grad_norm": 0.1711256206035614, | |
| "learning_rate": 3.378795566302541e-05, | |
| "loss": 1.0243428945541382, | |
| "mean_token_accuracy": 0.6950447037816048, | |
| "num_tokens": 12637489.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 1.0643156915903091, | |
| "epoch": 1.2718446601941746, | |
| "grad_norm": 0.2479192018508911, | |
| "learning_rate": 3.3536508269894724e-05, | |
| "loss": 1.0673259496688843, | |
| "mean_token_accuracy": 0.6813078597187996, | |
| "num_tokens": 12735387.0, | |
| "step": 131 | |
| }, | |
| { | |
| "entropy": 1.0525815039873123, | |
| "epoch": 1.2815533980582523, | |
| "grad_norm": 0.16756953299045563, | |
| "learning_rate": 3.3284079489066725e-05, | |
| "loss": 1.0502808094024658, | |
| "mean_token_accuracy": 0.6859902366995811, | |
| "num_tokens": 12832975.0, | |
| "step": 132 | |
| }, | |
| { | |
| "entropy": 1.0120011419057846, | |
| "epoch": 1.29126213592233, | |
| "grad_norm": 0.16773994266986847, | |
| "learning_rate": 3.303069834066206e-05, | |
| "loss": 1.0103399753570557, | |
| "mean_token_accuracy": 0.6967930570244789, | |
| "num_tokens": 12930517.0, | |
| "step": 133 | |
| }, | |
| { | |
| "entropy": 1.042226254940033, | |
| "epoch": 1.3009708737864076, | |
| "grad_norm": 0.17991676926612854, | |
| "learning_rate": 3.2776393954289e-05, | |
| "loss": 1.0408594608306885, | |
| "mean_token_accuracy": 0.6895272880792618, | |
| "num_tokens": 13027442.0, | |
| "step": 134 | |
| }, | |
| { | |
| "entropy": 1.0453506335616112, | |
| "epoch": 1.3106796116504853, | |
| "grad_norm": 0.16743086278438568, | |
| "learning_rate": 3.252119556569454e-05, | |
| "loss": 1.0410550832748413, | |
| "mean_token_accuracy": 0.6867326200008392, | |
| "num_tokens": 13124793.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 1.0293388664722443, | |
| "epoch": 1.3203883495145632, | |
| "grad_norm": 0.16317346692085266, | |
| "learning_rate": 3.226513251340341e-05, | |
| "loss": 1.02403724193573, | |
| "mean_token_accuracy": 0.6924958303570747, | |
| "num_tokens": 13222075.0, | |
| "step": 136 | |
| }, | |
| { | |
| "entropy": 1.0420408472418785, | |
| "epoch": 1.3300970873786409, | |
| "grad_norm": 0.1733805537223816, | |
| "learning_rate": 3.200823423534519e-05, | |
| "loss": 1.0338948965072632, | |
| "mean_token_accuracy": 0.689193956553936, | |
| "num_tokens": 13319423.0, | |
| "step": 137 | |
| }, | |
| { | |
| "entropy": 1.042591854929924, | |
| "epoch": 1.3398058252427185, | |
| "grad_norm": 0.17078301310539246, | |
| "learning_rate": 3.175053026547002e-05, | |
| "loss": 1.0373930931091309, | |
| "mean_token_accuracy": 0.6894862800836563, | |
| "num_tokens": 13416786.0, | |
| "step": 138 | |
| }, | |
| { | |
| "entropy": 1.0242534130811691, | |
| "epoch": 1.3495145631067962, | |
| "grad_norm": 0.17801660299301147, | |
| "learning_rate": 3.149205023035324e-05, | |
| "loss": 1.0228601694107056, | |
| "mean_token_accuracy": 0.6911262944340706, | |
| "num_tokens": 13513688.0, | |
| "step": 139 | |
| }, | |
| { | |
| "entropy": 1.0496903359889984, | |
| "epoch": 1.3592233009708738, | |
| "grad_norm": 0.17852218449115753, | |
| "learning_rate": 3.123282384578947e-05, | |
| "loss": 1.049614429473877, | |
| "mean_token_accuracy": 0.6867869421839714, | |
| "num_tokens": 13607205.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 1.0080739930272102, | |
| "epoch": 1.3689320388349515, | |
| "grad_norm": 0.16432735323905945, | |
| "learning_rate": 3.097288091337635e-05, | |
| "loss": 1.0080070495605469, | |
| "mean_token_accuracy": 0.6958046182990074, | |
| "num_tokens": 13705043.0, | |
| "step": 141 | |
| }, | |
| { | |
| "entropy": 1.0257286205887794, | |
| "epoch": 1.3786407766990292, | |
| "grad_norm": 0.17122159898281097, | |
| "learning_rate": 3.0712251317088424e-05, | |
| "loss": 1.0299582481384277, | |
| "mean_token_accuracy": 0.6896805837750435, | |
| "num_tokens": 13800688.0, | |
| "step": 142 | |
| }, | |
| { | |
| "entropy": 0.9992336556315422, | |
| "epoch": 1.3883495145631068, | |
| "grad_norm": 0.2238861322402954, | |
| "learning_rate": 3.0450965019841592e-05, | |
| "loss": 0.99715656042099, | |
| "mean_token_accuracy": 0.6997470483183861, | |
| "num_tokens": 13898532.0, | |
| "step": 143 | |
| }, | |
| { | |
| "entropy": 1.0371707454323769, | |
| "epoch": 1.3980582524271845, | |
| "grad_norm": 0.17037111520767212, | |
| "learning_rate": 3.018905206004846e-05, | |
| "loss": 1.035717487335205, | |
| "mean_token_accuracy": 0.6881653517484665, | |
| "num_tokens": 13996316.0, | |
| "step": 144 | |
| }, | |
| { | |
| "entropy": 1.0275786891579628, | |
| "epoch": 1.4077669902912622, | |
| "grad_norm": 0.18156027793884277, | |
| "learning_rate": 2.9926542548165e-05, | |
| "loss": 1.025190830230713, | |
| "mean_token_accuracy": 0.6906291842460632, | |
| "num_tokens": 14093597.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 1.0460922569036484, | |
| "epoch": 1.4174757281553398, | |
| "grad_norm": 0.1703980714082718, | |
| "learning_rate": 2.9663466663228978e-05, | |
| "loss": 1.0359042882919312, | |
| "mean_token_accuracy": 0.6888971403241158, | |
| "num_tokens": 14190530.0, | |
| "step": 146 | |
| }, | |
| { | |
| "entropy": 1.0335627645254135, | |
| "epoch": 1.4271844660194175, | |
| "grad_norm": 0.17414884269237518, | |
| "learning_rate": 2.939985464939043e-05, | |
| "loss": 1.0247759819030762, | |
| "mean_token_accuracy": 0.6912643909454346, | |
| "num_tokens": 14287147.0, | |
| "step": 147 | |
| }, | |
| { | |
| "entropy": 1.0209672376513481, | |
| "epoch": 1.4368932038834952, | |
| "grad_norm": 0.17711719870567322, | |
| "learning_rate": 2.91357368124347e-05, | |
| "loss": 1.0165073871612549, | |
| "mean_token_accuracy": 0.6936698257923126, | |
| "num_tokens": 14384467.0, | |
| "step": 148 | |
| }, | |
| { | |
| "entropy": 1.0329503864049911, | |
| "epoch": 1.4466019417475728, | |
| "grad_norm": 0.1697532832622528, | |
| "learning_rate": 2.887114351629839e-05, | |
| "loss": 1.0369350910186768, | |
| "mean_token_accuracy": 0.6886308863759041, | |
| "num_tokens": 14481672.0, | |
| "step": 149 | |
| }, | |
| { | |
| "entropy": 1.0292729139328003, | |
| "epoch": 1.4563106796116505, | |
| "grad_norm": 0.17358174920082092, | |
| "learning_rate": 2.8606105179578585e-05, | |
| "loss": 1.027604341506958, | |
| "mean_token_accuracy": 0.689355343580246, | |
| "num_tokens": 14579140.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 1.0498756989836693, | |
| "epoch": 1.4660194174757282, | |
| "grad_norm": 0.19735999405384064, | |
| "learning_rate": 2.834065227203584e-05, | |
| "loss": 1.0510324239730835, | |
| "mean_token_accuracy": 0.6850913092494011, | |
| "num_tokens": 14675405.0, | |
| "step": 151 | |
| }, | |
| { | |
| "entropy": 1.0204887762665749, | |
| "epoch": 1.4757281553398058, | |
| "grad_norm": 0.1725974678993225, | |
| "learning_rate": 2.8074815311091263e-05, | |
| "loss": 1.0187439918518066, | |
| "mean_token_accuracy": 0.6918519213795662, | |
| "num_tokens": 14771912.0, | |
| "step": 152 | |
| }, | |
| { | |
| "entropy": 1.0176549404859543, | |
| "epoch": 1.4854368932038835, | |
| "grad_norm": 0.1712421178817749, | |
| "learning_rate": 2.780862485831814e-05, | |
| "loss": 1.0172964334487915, | |
| "mean_token_accuracy": 0.6932723894715309, | |
| "num_tokens": 14869059.0, | |
| "step": 153 | |
| }, | |
| { | |
| "entropy": 1.0050822049379349, | |
| "epoch": 1.4951456310679612, | |
| "grad_norm": 0.17614896595478058, | |
| "learning_rate": 2.754211151592841e-05, | |
| "loss": 1.006335973739624, | |
| "mean_token_accuracy": 0.6953242495656013, | |
| "num_tokens": 14966471.0, | |
| "step": 154 | |
| }, | |
| { | |
| "entropy": 1.0111511871218681, | |
| "epoch": 1.5048543689320388, | |
| "grad_norm": 0.1675221472978592, | |
| "learning_rate": 2.7275305923254606e-05, | |
| "loss": 1.0154767036437988, | |
| "mean_token_accuracy": 0.6931192204356194, | |
| "num_tokens": 15064288.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 1.02684336155653, | |
| "epoch": 1.5145631067961165, | |
| "grad_norm": 0.17546917498111725, | |
| "learning_rate": 2.7008238753227383e-05, | |
| "loss": 1.023386001586914, | |
| "mean_token_accuracy": 0.691448763012886, | |
| "num_tokens": 15161784.0, | |
| "step": 156 | |
| }, | |
| { | |
| "entropy": 1.0204633623361588, | |
| "epoch": 1.5242718446601942, | |
| "grad_norm": 0.175806924700737, | |
| "learning_rate": 2.674094070884926e-05, | |
| "loss": 1.0095469951629639, | |
| "mean_token_accuracy": 0.6962961703538895, | |
| "num_tokens": 15258172.0, | |
| "step": 157 | |
| }, | |
| { | |
| "entropy": 0.9925187677145004, | |
| "epoch": 1.5339805825242718, | |
| "grad_norm": 0.16857516765594482, | |
| "learning_rate": 2.6473442519664933e-05, | |
| "loss": 0.995888888835907, | |
| "mean_token_accuracy": 0.7000978887081146, | |
| "num_tokens": 15356321.0, | |
| "step": 158 | |
| }, | |
| { | |
| "entropy": 1.0085221901535988, | |
| "epoch": 1.5436893203883495, | |
| "grad_norm": 0.17279484868049622, | |
| "learning_rate": 2.6205774938228432e-05, | |
| "loss": 1.0096505880355835, | |
| "mean_token_accuracy": 0.6963389366865158, | |
| "num_tokens": 15454280.0, | |
| "step": 159 | |
| }, | |
| { | |
| "entropy": 1.0388263463974, | |
| "epoch": 1.5533980582524272, | |
| "grad_norm": 0.19317008554935455, | |
| "learning_rate": 2.5937968736567746e-05, | |
| "loss": 1.0307786464691162, | |
| "mean_token_accuracy": 0.6896204799413681, | |
| "num_tokens": 15548567.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 1.0248635411262512, | |
| "epoch": 1.5631067961165048, | |
| "grad_norm": 0.285595178604126, | |
| "learning_rate": 2.5670054702647146e-05, | |
| "loss": 1.0265969038009644, | |
| "mean_token_accuracy": 0.6895977482199669, | |
| "num_tokens": 15646127.0, | |
| "step": 161 | |
| }, | |
| { | |
| "entropy": 1.0066411048173904, | |
| "epoch": 1.5728155339805825, | |
| "grad_norm": 0.1719922423362732, | |
| "learning_rate": 2.540206363682768e-05, | |
| "loss": 1.0009901523590088, | |
| "mean_token_accuracy": 0.6995166838169098, | |
| "num_tokens": 15743035.0, | |
| "step": 162 | |
| }, | |
| { | |
| "entropy": 1.0152993351221085, | |
| "epoch": 1.5825242718446602, | |
| "grad_norm": 0.17260152101516724, | |
| "learning_rate": 2.513402634832627e-05, | |
| "loss": 1.0113165378570557, | |
| "mean_token_accuracy": 0.6952773109078407, | |
| "num_tokens": 15840620.0, | |
| "step": 163 | |
| }, | |
| { | |
| "entropy": 1.033155396580696, | |
| "epoch": 1.5922330097087378, | |
| "grad_norm": 0.18080708384513855, | |
| "learning_rate": 2.486597365167374e-05, | |
| "loss": 1.0448689460754395, | |
| "mean_token_accuracy": 0.6873042583465576, | |
| "num_tokens": 15934881.0, | |
| "step": 164 | |
| }, | |
| { | |
| "entropy": 1.0372785106301308, | |
| "epoch": 1.6019417475728155, | |
| "grad_norm": 0.17866858839988708, | |
| "learning_rate": 2.4597936363172327e-05, | |
| "loss": 1.0408073663711548, | |
| "mean_token_accuracy": 0.6880093738436699, | |
| "num_tokens": 16031255.0, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 1.0505105406045914, | |
| "epoch": 1.6116504854368932, | |
| "grad_norm": 0.17675521969795227, | |
| "learning_rate": 2.4329945297352856e-05, | |
| "loss": 1.0455937385559082, | |
| "mean_token_accuracy": 0.6833712980151176, | |
| "num_tokens": 16128504.0, | |
| "step": 166 | |
| }, | |
| { | |
| "entropy": 1.07162706553936, | |
| "epoch": 1.6213592233009708, | |
| "grad_norm": 0.17488880455493927, | |
| "learning_rate": 2.4062031263432267e-05, | |
| "loss": 1.0692931413650513, | |
| "mean_token_accuracy": 0.6797295063734055, | |
| "num_tokens": 16225326.0, | |
| "step": 167 | |
| }, | |
| { | |
| "entropy": 1.04351444542408, | |
| "epoch": 1.6310679611650487, | |
| "grad_norm": 0.17990568280220032, | |
| "learning_rate": 2.379422506177157e-05, | |
| "loss": 1.040710210800171, | |
| "mean_token_accuracy": 0.6852644607424736, | |
| "num_tokens": 16322821.0, | |
| "step": 168 | |
| }, | |
| { | |
| "entropy": 1.0298245176672935, | |
| "epoch": 1.6407766990291264, | |
| "grad_norm": 0.17780478298664093, | |
| "learning_rate": 2.352655748033508e-05, | |
| "loss": 1.0249665975570679, | |
| "mean_token_accuracy": 0.6916689649224281, | |
| "num_tokens": 16420465.0, | |
| "step": 169 | |
| }, | |
| { | |
| "entropy": 1.0333473309874535, | |
| "epoch": 1.650485436893204, | |
| "grad_norm": 0.178379625082016, | |
| "learning_rate": 2.3259059291150744e-05, | |
| "loss": 1.0341100692749023, | |
| "mean_token_accuracy": 0.6892575472593307, | |
| "num_tokens": 16517503.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 1.0237839594483376, | |
| "epoch": 1.6601941747572817, | |
| "grad_norm": 0.17204873263835907, | |
| "learning_rate": 2.2991761246772623e-05, | |
| "loss": 1.0178446769714355, | |
| "mean_token_accuracy": 0.6930648684501648, | |
| "num_tokens": 16614912.0, | |
| "step": 171 | |
| }, | |
| { | |
| "entropy": 0.9896853193640709, | |
| "epoch": 1.6699029126213594, | |
| "grad_norm": 0.17218872904777527, | |
| "learning_rate": 2.2724694076745396e-05, | |
| "loss": 0.9850873947143555, | |
| "mean_token_accuracy": 0.7045940905809402, | |
| "num_tokens": 16712592.0, | |
| "step": 172 | |
| }, | |
| { | |
| "entropy": 1.0385229736566544, | |
| "epoch": 1.679611650485437, | |
| "grad_norm": 0.17635254561901093, | |
| "learning_rate": 2.245788848407159e-05, | |
| "loss": 1.0379856824874878, | |
| "mean_token_accuracy": 0.6906830444931984, | |
| "num_tokens": 16810516.0, | |
| "step": 173 | |
| }, | |
| { | |
| "entropy": 1.0037900060415268, | |
| "epoch": 1.6893203883495147, | |
| "grad_norm": 0.17268624901771545, | |
| "learning_rate": 2.2191375141681867e-05, | |
| "loss": 0.9993359446525574, | |
| "mean_token_accuracy": 0.6987345814704895, | |
| "num_tokens": 16907482.0, | |
| "step": 174 | |
| }, | |
| { | |
| "entropy": 0.9959080442786217, | |
| "epoch": 1.6990291262135924, | |
| "grad_norm": 0.18175552785396576, | |
| "learning_rate": 2.1925184688908733e-05, | |
| "loss": 0.9904047250747681, | |
| "mean_token_accuracy": 0.7010570541024208, | |
| "num_tokens": 17004782.0, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 0.9975259378552437, | |
| "epoch": 1.70873786407767, | |
| "grad_norm": 0.17460443079471588, | |
| "learning_rate": 2.165934772796417e-05, | |
| "loss": 0.999598503112793, | |
| "mean_token_accuracy": 0.6996893584728241, | |
| "num_tokens": 17102923.0, | |
| "step": 176 | |
| }, | |
| { | |
| "entropy": 1.0192040726542473, | |
| "epoch": 1.7184466019417477, | |
| "grad_norm": 0.19032660126686096, | |
| "learning_rate": 2.139389482042142e-05, | |
| "loss": 1.023505449295044, | |
| "mean_token_accuracy": 0.6922990456223488, | |
| "num_tokens": 17199802.0, | |
| "step": 177 | |
| }, | |
| { | |
| "entropy": 1.008660413324833, | |
| "epoch": 1.7281553398058254, | |
| "grad_norm": 0.18207867443561554, | |
| "learning_rate": 2.1128856483701624e-05, | |
| "loss": 1.008425235748291, | |
| "mean_token_accuracy": 0.6940756440162659, | |
| "num_tokens": 17297366.0, | |
| "step": 178 | |
| }, | |
| { | |
| "entropy": 1.0423468202352524, | |
| "epoch": 1.737864077669903, | |
| "grad_norm": 0.17587341368198395, | |
| "learning_rate": 2.0864263187565307e-05, | |
| "loss": 1.036442756652832, | |
| "mean_token_accuracy": 0.6883173510432243, | |
| "num_tokens": 17394536.0, | |
| "step": 179 | |
| }, | |
| { | |
| "entropy": 1.0092622190713882, | |
| "epoch": 1.7475728155339807, | |
| "grad_norm": 0.17515939474105835, | |
| "learning_rate": 2.0600145350609586e-05, | |
| "loss": 1.0126979351043701, | |
| "mean_token_accuracy": 0.6944826990365982, | |
| "num_tokens": 17492516.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 1.0159369558095932, | |
| "epoch": 1.7572815533980584, | |
| "grad_norm": 0.18199597299098969, | |
| "learning_rate": 2.033653333677103e-05, | |
| "loss": 1.011486530303955, | |
| "mean_token_accuracy": 0.6935876160860062, | |
| "num_tokens": 17589926.0, | |
| "step": 181 | |
| }, | |
| { | |
| "entropy": 1.0069985464215279, | |
| "epoch": 1.766990291262136, | |
| "grad_norm": 0.17988887429237366, | |
| "learning_rate": 2.0073457451835e-05, | |
| "loss": 1.0077378749847412, | |
| "mean_token_accuracy": 0.6979865580797195, | |
| "num_tokens": 17686993.0, | |
| "step": 182 | |
| }, | |
| { | |
| "entropy": 1.0414468497037888, | |
| "epoch": 1.7766990291262137, | |
| "grad_norm": 0.1765284687280655, | |
| "learning_rate": 1.9810947939951546e-05, | |
| "loss": 1.0297632217407227, | |
| "mean_token_accuracy": 0.6888556927442551, | |
| "num_tokens": 17784319.0, | |
| "step": 183 | |
| }, | |
| { | |
| "entropy": 1.0168253928422928, | |
| "epoch": 1.7864077669902914, | |
| "grad_norm": 0.18019120395183563, | |
| "learning_rate": 1.9549034980158403e-05, | |
| "loss": 1.0034856796264648, | |
| "mean_token_accuracy": 0.6975414827466011, | |
| "num_tokens": 17880977.0, | |
| "step": 184 | |
| }, | |
| { | |
| "entropy": 1.0029722303152084, | |
| "epoch": 1.796116504854369, | |
| "grad_norm": 0.19301190972328186, | |
| "learning_rate": 1.928774868291158e-05, | |
| "loss": 0.9989402294158936, | |
| "mean_token_accuracy": 0.699431985616684, | |
| "num_tokens": 17978329.0, | |
| "step": 185 | |
| }, | |
| { | |
| "entropy": 1.0058149993419647, | |
| "epoch": 1.8058252427184467, | |
| "grad_norm": 0.17930394411087036, | |
| "learning_rate": 1.9027119086623645e-05, | |
| "loss": 1.0110243558883667, | |
| "mean_token_accuracy": 0.6958926245570183, | |
| "num_tokens": 18075785.0, | |
| "step": 186 | |
| }, | |
| { | |
| "entropy": 1.0077807754278183, | |
| "epoch": 1.8155339805825244, | |
| "grad_norm": 0.17985112965106964, | |
| "learning_rate": 1.8767176154210537e-05, | |
| "loss": 1.0201196670532227, | |
| "mean_token_accuracy": 0.6894695311784744, | |
| "num_tokens": 18172695.0, | |
| "step": 187 | |
| }, | |
| { | |
| "entropy": 1.0128311812877655, | |
| "epoch": 1.825242718446602, | |
| "grad_norm": 0.18074993789196014, | |
| "learning_rate": 1.850794976964677e-05, | |
| "loss": 1.0270740985870361, | |
| "mean_token_accuracy": 0.6907941848039627, | |
| "num_tokens": 18269124.0, | |
| "step": 188 | |
| }, | |
| { | |
| "entropy": 1.01870559155941, | |
| "epoch": 1.8349514563106797, | |
| "grad_norm": 0.18928128480911255, | |
| "learning_rate": 1.8249469734529994e-05, | |
| "loss": 1.0252387523651123, | |
| "mean_token_accuracy": 0.6926762014627457, | |
| "num_tokens": 18367249.0, | |
| "step": 189 | |
| }, | |
| { | |
| "entropy": 1.0275882855057716, | |
| "epoch": 1.8446601941747574, | |
| "grad_norm": 0.17471325397491455, | |
| "learning_rate": 1.7991765764654813e-05, | |
| "loss": 1.0264182090759277, | |
| "mean_token_accuracy": 0.6901049017906189, | |
| "num_tokens": 18463910.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 1.034515455365181, | |
| "epoch": 1.854368932038835, | |
| "grad_norm": 0.17968705296516418, | |
| "learning_rate": 1.7734867486596594e-05, | |
| "loss": 1.0311692953109741, | |
| "mean_token_accuracy": 0.6873079612851143, | |
| "num_tokens": 18561195.0, | |
| "step": 191 | |
| }, | |
| { | |
| "entropy": 1.0225220322608948, | |
| "epoch": 1.8640776699029127, | |
| "grad_norm": 0.17145471274852753, | |
| "learning_rate": 1.7478804434305465e-05, | |
| "loss": 1.0082602500915527, | |
| "mean_token_accuracy": 0.6934807673096657, | |
| "num_tokens": 18658873.0, | |
| "step": 192 | |
| }, | |
| { | |
| "entropy": 1.0166627615690231, | |
| "epoch": 1.8737864077669903, | |
| "grad_norm": 0.17330369353294373, | |
| "learning_rate": 1.7223606045711006e-05, | |
| "loss": 1.0024232864379883, | |
| "mean_token_accuracy": 0.6985119730234146, | |
| "num_tokens": 18755726.0, | |
| "step": 193 | |
| }, | |
| { | |
| "entropy": 1.028284415602684, | |
| "epoch": 1.883495145631068, | |
| "grad_norm": 0.17851871252059937, | |
| "learning_rate": 1.6969301659337944e-05, | |
| "loss": 1.0232582092285156, | |
| "mean_token_accuracy": 0.6918485462665558, | |
| "num_tokens": 18852964.0, | |
| "step": 194 | |
| }, | |
| { | |
| "entropy": 1.0244980603456497, | |
| "epoch": 1.8932038834951457, | |
| "grad_norm": 0.17368443310260773, | |
| "learning_rate": 1.6715920510933274e-05, | |
| "loss": 1.020582675933838, | |
| "mean_token_accuracy": 0.6939240843057632, | |
| "num_tokens": 18950306.0, | |
| "step": 195 | |
| }, | |
| { | |
| "entropy": 1.0173082277178764, | |
| "epoch": 1.9029126213592233, | |
| "grad_norm": 0.17003676295280457, | |
| "learning_rate": 1.646349173010528e-05, | |
| "loss": 1.0092861652374268, | |
| "mean_token_accuracy": 0.6938014999032021, | |
| "num_tokens": 19047745.0, | |
| "step": 196 | |
| }, | |
| { | |
| "entropy": 1.0060075893998146, | |
| "epoch": 1.912621359223301, | |
| "grad_norm": 0.17336414754390717, | |
| "learning_rate": 1.6212044336974596e-05, | |
| "loss": 1.0132522583007812, | |
| "mean_token_accuracy": 0.6941477060317993, | |
| "num_tokens": 19144506.0, | |
| "step": 197 | |
| }, | |
| { | |
| "entropy": 1.0209631994366646, | |
| "epoch": 1.9223300970873787, | |
| "grad_norm": 0.17279008030891418, | |
| "learning_rate": 1.596160723883802e-05, | |
| "loss": 1.0216258764266968, | |
| "mean_token_accuracy": 0.6932391673326492, | |
| "num_tokens": 19242731.0, | |
| "step": 198 | |
| }, | |
| { | |
| "entropy": 0.9829826056957245, | |
| "epoch": 1.9320388349514563, | |
| "grad_norm": 0.17792966961860657, | |
| "learning_rate": 1.57122092268452e-05, | |
| "loss": 0.992206335067749, | |
| "mean_token_accuracy": 0.7004464343190193, | |
| "num_tokens": 19339951.0, | |
| "step": 199 | |
| }, | |
| { | |
| "entropy": 0.9956350028514862, | |
| "epoch": 1.941747572815534, | |
| "grad_norm": 0.17040826380252838, | |
| "learning_rate": 1.5463878972688705e-05, | |
| "loss": 1.0016891956329346, | |
| "mean_token_accuracy": 0.6970360353589058, | |
| "num_tokens": 19437708.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 1.0005292445421219, | |
| "epoch": 1.9514563106796117, | |
| "grad_norm": 0.21164390444755554, | |
| "learning_rate": 1.5216645025307814e-05, | |
| "loss": 1.0097347497940063, | |
| "mean_token_accuracy": 0.6938510239124298, | |
| "num_tokens": 19534829.0, | |
| "step": 201 | |
| }, | |
| { | |
| "entropy": 1.0144784301519394, | |
| "epoch": 1.9611650485436893, | |
| "grad_norm": 0.17291411757469177, | |
| "learning_rate": 1.4970535807606453e-05, | |
| "loss": 1.0064911842346191, | |
| "mean_token_accuracy": 0.6957991868257523, | |
| "num_tokens": 19632310.0, | |
| "step": 202 | |
| }, | |
| { | |
| "entropy": 1.0408466532826424, | |
| "epoch": 1.970873786407767, | |
| "grad_norm": 0.2224787026643753, | |
| "learning_rate": 1.4725579613185547e-05, | |
| "loss": 1.0339338779449463, | |
| "mean_token_accuracy": 0.6887135058641434, | |
| "num_tokens": 19730041.0, | |
| "step": 203 | |
| }, | |
| { | |
| "entropy": 1.0174331441521645, | |
| "epoch": 1.9805825242718447, | |
| "grad_norm": 0.1863594949245453, | |
| "learning_rate": 1.4481804603090357e-05, | |
| "loss": 1.0097577571868896, | |
| "mean_token_accuracy": 0.6938179507851601, | |
| "num_tokens": 19827501.0, | |
| "step": 204 | |
| }, | |
| { | |
| "entropy": 1.0116109624505043, | |
| "epoch": 1.9902912621359223, | |
| "grad_norm": 0.17445802688598633, | |
| "learning_rate": 1.4239238802572908e-05, | |
| "loss": 1.0059723854064941, | |
| "mean_token_accuracy": 0.6990595534443855, | |
| "num_tokens": 19923357.0, | |
| "step": 205 | |
| }, | |
| { | |
| "entropy": 1.0056637898087502, | |
| "epoch": 2.0, | |
| "grad_norm": 0.17976193130016327, | |
| "learning_rate": 1.3997910097870165e-05, | |
| "loss": 0.9994570016860962, | |
| "mean_token_accuracy": 0.6946380734443665, | |
| "num_tokens": 20020502.0, | |
| "step": 206 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 309, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.8950470679970447e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |