Instructions to use Jongbin-kr/exaone_7b_lora_rtlcoder_ratio1.0 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Jongbin-kr/exaone_7b_lora_rtlcoder_ratio1.0 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("LGAI-EXAONE/EXAONE-3.5-7.8B-Instruct") model = PeftModel.from_pretrained(base_model, "Jongbin-kr/exaone_7b_lora_rtlcoder_ratio1.0") - Transformers
How to use Jongbin-kr/exaone_7b_lora_rtlcoder_ratio1.0 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Jongbin-kr/exaone_7b_lora_rtlcoder_ratio1.0") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Jongbin-kr/exaone_7b_lora_rtlcoder_ratio1.0", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Jongbin-kr/exaone_7b_lora_rtlcoder_ratio1.0 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Jongbin-kr/exaone_7b_lora_rtlcoder_ratio1.0" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Jongbin-kr/exaone_7b_lora_rtlcoder_ratio1.0", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/Jongbin-kr/exaone_7b_lora_rtlcoder_ratio1.0
- SGLang
How to use Jongbin-kr/exaone_7b_lora_rtlcoder_ratio1.0 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Jongbin-kr/exaone_7b_lora_rtlcoder_ratio1.0" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Jongbin-kr/exaone_7b_lora_rtlcoder_ratio1.0", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Jongbin-kr/exaone_7b_lora_rtlcoder_ratio1.0" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Jongbin-kr/exaone_7b_lora_rtlcoder_ratio1.0", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use Jongbin-kr/exaone_7b_lora_rtlcoder_ratio1.0 with Docker Model Runner:
docker model run hf.co/Jongbin-kr/exaone_7b_lora_rtlcoder_ratio1.0
| { | |
| "best_global_step": 5270, | |
| "best_metric": 0.29535341262817383, | |
| "best_model_checkpoint": "/home/longtail/data/outputs/exaone_7b_lora_rtlcoder_ratio1.0/checkpoint-5270", | |
| "epoch": 3.9715470133785566, | |
| "eval_steps": 170, | |
| "global_step": 5270, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 0.500390625, | |
| "epoch": 0.007537214999057848, | |
| "grad_norm": 3.2508912086486816, | |
| "learning_rate": 9.000000000000001e-07, | |
| "loss": 1.4970951080322266, | |
| "mean_token_accuracy": 0.7383653238415718, | |
| "num_tokens": 124053.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 0.480322265625, | |
| "epoch": 0.015074429998115696, | |
| "grad_norm": 2.5751638412475586, | |
| "learning_rate": 1.9000000000000002e-06, | |
| "loss": 1.4152856826782227, | |
| "mean_token_accuracy": 0.7493167400360108, | |
| "num_tokens": 260327.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 0.513330078125, | |
| "epoch": 0.022611644997173545, | |
| "grad_norm": 2.6885225772857666, | |
| "learning_rate": 2.9e-06, | |
| "loss": 1.3749178886413573, | |
| "mean_token_accuracy": 0.7562702834606171, | |
| "num_tokens": 382406.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.55849609375, | |
| "epoch": 0.030148859996231393, | |
| "grad_norm": 2.3008334636688232, | |
| "learning_rate": 3.900000000000001e-06, | |
| "loss": 1.2062281608581542, | |
| "mean_token_accuracy": 0.763033090531826, | |
| "num_tokens": 505114.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.566552734375, | |
| "epoch": 0.03768607499528924, | |
| "grad_norm": 1.038688063621521, | |
| "learning_rate": 4.9000000000000005e-06, | |
| "loss": 0.8852876663208008, | |
| "mean_token_accuracy": 0.8057842180132866, | |
| "num_tokens": 640766.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.64345703125, | |
| "epoch": 0.04522328999434709, | |
| "grad_norm": 0.8166051506996155, | |
| "learning_rate": 5.9e-06, | |
| "loss": 0.6880127429962158, | |
| "mean_token_accuracy": 0.8336978167295456, | |
| "num_tokens": 759118.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 0.58603515625, | |
| "epoch": 0.052760504993404934, | |
| "grad_norm": 0.7374411225318909, | |
| "learning_rate": 6.9e-06, | |
| "loss": 0.5521659851074219, | |
| "mean_token_accuracy": 0.8549367278814316, | |
| "num_tokens": 885806.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 0.5080078125, | |
| "epoch": 0.060297719992462785, | |
| "grad_norm": 0.39635205268859863, | |
| "learning_rate": 7.9e-06, | |
| "loss": 0.49886331558227537, | |
| "mean_token_accuracy": 0.8612601146101951, | |
| "num_tokens": 1013663.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 0.452587890625, | |
| "epoch": 0.06783493499152063, | |
| "grad_norm": 0.40894708037376404, | |
| "learning_rate": 8.900000000000001e-06, | |
| "loss": 0.4750356197357178, | |
| "mean_token_accuracy": 0.8679621189832687, | |
| "num_tokens": 1140381.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 0.434814453125, | |
| "epoch": 0.07537214999057848, | |
| "grad_norm": 0.3433704376220703, | |
| "learning_rate": 9.9e-06, | |
| "loss": 0.4414645195007324, | |
| "mean_token_accuracy": 0.8758952230215072, | |
| "num_tokens": 1269277.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.425927734375, | |
| "epoch": 0.08290936498963633, | |
| "grad_norm": 0.3355954587459564, | |
| "learning_rate": 1.0900000000000002e-05, | |
| "loss": 0.4468825817108154, | |
| "mean_token_accuracy": 0.8759026020765305, | |
| "num_tokens": 1393833.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 0.4673828125, | |
| "epoch": 0.09044657998869418, | |
| "grad_norm": 0.3367510437965393, | |
| "learning_rate": 1.1900000000000001e-05, | |
| "loss": 0.47623600959777834, | |
| "mean_token_accuracy": 0.8684576749801636, | |
| "num_tokens": 1525283.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 0.43203125, | |
| "epoch": 0.09798379498775203, | |
| "grad_norm": 0.38895294070243835, | |
| "learning_rate": 1.2900000000000002e-05, | |
| "loss": 0.4312158107757568, | |
| "mean_token_accuracy": 0.8784290611743927, | |
| "num_tokens": 1652856.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 0.4258056640625, | |
| "epoch": 0.10552100998680987, | |
| "grad_norm": 0.3369289040565491, | |
| "learning_rate": 1.39e-05, | |
| "loss": 0.4163616180419922, | |
| "mean_token_accuracy": 0.88214410841465, | |
| "num_tokens": 1787576.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 0.419775390625, | |
| "epoch": 0.11305822498586772, | |
| "grad_norm": 0.34929800033569336, | |
| "learning_rate": 1.4900000000000001e-05, | |
| "loss": 0.42300877571105955, | |
| "mean_token_accuracy": 0.8821998775005341, | |
| "num_tokens": 1910866.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.422314453125, | |
| "epoch": 0.12059543998492557, | |
| "grad_norm": 0.34880968928337097, | |
| "learning_rate": 1.5900000000000004e-05, | |
| "loss": 0.4256776809692383, | |
| "mean_token_accuracy": 0.8781016901135444, | |
| "num_tokens": 2033937.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 0.390673828125, | |
| "epoch": 0.1281326549839834, | |
| "grad_norm": 0.30792421102523804, | |
| "learning_rate": 1.69e-05, | |
| "loss": 0.392413592338562, | |
| "mean_token_accuracy": 0.8856923297047615, | |
| "num_tokens": 2161669.0, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.1281326549839834, | |
| "eval_entropy": 0.40038180064006024, | |
| "eval_loss": 0.408536434173584, | |
| "eval_mean_token_accuracy": 0.8834756215114191, | |
| "eval_num_tokens": 2161669.0, | |
| "eval_runtime": 444.9651, | |
| "eval_samples_per_second": 5.962, | |
| "eval_steps_per_second": 1.492, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.3729248046875, | |
| "epoch": 0.13566986998304126, | |
| "grad_norm": 0.36590659618377686, | |
| "learning_rate": 1.79e-05, | |
| "loss": 0.3798275709152222, | |
| "mean_token_accuracy": 0.8910293310880661, | |
| "num_tokens": 2298812.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 0.398779296875, | |
| "epoch": 0.1432070849820991, | |
| "grad_norm": 0.37025851011276245, | |
| "learning_rate": 1.8900000000000002e-05, | |
| "loss": 0.4105966567993164, | |
| "mean_token_accuracy": 0.8843188390135766, | |
| "num_tokens": 2421990.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 0.3990234375, | |
| "epoch": 0.15074429998115696, | |
| "grad_norm": 0.38612475991249084, | |
| "learning_rate": 1.9900000000000003e-05, | |
| "loss": 0.40378603935241697, | |
| "mean_token_accuracy": 0.881200622022152, | |
| "num_tokens": 2546022.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.4103515625, | |
| "epoch": 0.1582815149802148, | |
| "grad_norm": 0.4074586033821106, | |
| "learning_rate": 1.9999903471186634e-05, | |
| "loss": 0.42444210052490233, | |
| "mean_token_accuracy": 0.8808081805706024, | |
| "num_tokens": 2673345.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 0.374658203125, | |
| "epoch": 0.16581872997927266, | |
| "grad_norm": 0.34897786378860474, | |
| "learning_rate": 1.999956979373049e-05, | |
| "loss": 0.3861543655395508, | |
| "mean_token_accuracy": 0.887491112947464, | |
| "num_tokens": 2799859.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 0.391455078125, | |
| "epoch": 0.1733559449783305, | |
| "grad_norm": 0.38405418395996094, | |
| "learning_rate": 1.9998997783868885e-05, | |
| "loss": 0.3967418193817139, | |
| "mean_token_accuracy": 0.8830995351076126, | |
| "num_tokens": 2929096.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 0.392724609375, | |
| "epoch": 0.18089315997738836, | |
| "grad_norm": 0.4110228717327118, | |
| "learning_rate": 1.999818745523526e-05, | |
| "loss": 0.39841184616088865, | |
| "mean_token_accuracy": 0.8842095598578453, | |
| "num_tokens": 3048433.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 0.3698974609375, | |
| "epoch": 0.1884303749764462, | |
| "grad_norm": 0.4672147035598755, | |
| "learning_rate": 1.9997138827143197e-05, | |
| "loss": 0.38254082202911377, | |
| "mean_token_accuracy": 0.8880651697516442, | |
| "num_tokens": 3159277.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 0.390576171875, | |
| "epoch": 0.19596758997550406, | |
| "grad_norm": 0.4443078339099884, | |
| "learning_rate": 1.9995851924585978e-05, | |
| "loss": 0.3986587762832642, | |
| "mean_token_accuracy": 0.8839748218655586, | |
| "num_tokens": 3291698.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 0.360400390625, | |
| "epoch": 0.2035048049745619, | |
| "grad_norm": 0.46329835057258606, | |
| "learning_rate": 1.9994326778235983e-05, | |
| "loss": 0.37484548091888426, | |
| "mean_token_accuracy": 0.8916234523057938, | |
| "num_tokens": 3415688.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 0.3857666015625, | |
| "epoch": 0.21104201997361974, | |
| "grad_norm": 0.41270825266838074, | |
| "learning_rate": 1.9992563424443955e-05, | |
| "loss": 0.4022381782531738, | |
| "mean_token_accuracy": 0.8860612288117409, | |
| "num_tokens": 3541844.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 0.3788330078125, | |
| "epoch": 0.2185792349726776, | |
| "grad_norm": 0.4354550540447235, | |
| "learning_rate": 1.9990561905238136e-05, | |
| "loss": 0.39404640197753904, | |
| "mean_token_accuracy": 0.8860739976167679, | |
| "num_tokens": 3668238.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 0.355810546875, | |
| "epoch": 0.22611644997173544, | |
| "grad_norm": 0.4367234706878662, | |
| "learning_rate": 1.998832226832327e-05, | |
| "loss": 0.35446126461029054, | |
| "mean_token_accuracy": 0.8932908058166504, | |
| "num_tokens": 3791388.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 0.3698974609375, | |
| "epoch": 0.2336536649707933, | |
| "grad_norm": 0.33177778124809265, | |
| "learning_rate": 1.9985844567079452e-05, | |
| "loss": 0.3798938512802124, | |
| "mean_token_accuracy": 0.890485617518425, | |
| "num_tokens": 3918847.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 0.343310546875, | |
| "epoch": 0.24119087996985114, | |
| "grad_norm": 0.4057367146015167, | |
| "learning_rate": 1.998312886056088e-05, | |
| "loss": 0.3518209934234619, | |
| "mean_token_accuracy": 0.8955762058496475, | |
| "num_tokens": 4046508.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 0.3807373046875, | |
| "epoch": 0.248728094968909, | |
| "grad_norm": 0.42162206768989563, | |
| "learning_rate": 1.9980175213494418e-05, | |
| "loss": 0.39223556518554686, | |
| "mean_token_accuracy": 0.8870018571615219, | |
| "num_tokens": 4169257.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 0.374658203125, | |
| "epoch": 0.2562653099679668, | |
| "grad_norm": 0.4284176826477051, | |
| "learning_rate": 1.9976983696278083e-05, | |
| "loss": 0.3777692556381226, | |
| "mean_token_accuracy": 0.8895119220018387, | |
| "num_tokens": 4299468.0, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.2562653099679668, | |
| "eval_entropy": 0.35730862904743976, | |
| "eval_loss": 0.3676407039165497, | |
| "eval_mean_token_accuracy": 0.8923638243093548, | |
| "eval_num_tokens": 4299468.0, | |
| "eval_runtime": 445.3697, | |
| "eval_samples_per_second": 5.957, | |
| "eval_steps_per_second": 1.491, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 0.3595703125, | |
| "epoch": 0.26380252496702467, | |
| "grad_norm": 0.4121377468109131, | |
| "learning_rate": 1.9973554384979343e-05, | |
| "loss": 0.373604416847229, | |
| "mean_token_accuracy": 0.892127700150013, | |
| "num_tokens": 4430546.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 0.3835205078125, | |
| "epoch": 0.2713397399660825, | |
| "grad_norm": 0.4015622138977051, | |
| "learning_rate": 1.9969887361333313e-05, | |
| "loss": 0.3918182373046875, | |
| "mean_token_accuracy": 0.8868573501706123, | |
| "num_tokens": 4554384.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 0.3498046875, | |
| "epoch": 0.27887695496514037, | |
| "grad_norm": 0.43255379796028137, | |
| "learning_rate": 1.996598271274081e-05, | |
| "loss": 0.35996294021606445, | |
| "mean_token_accuracy": 0.8938629716634751, | |
| "num_tokens": 4690486.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 0.3456298828125, | |
| "epoch": 0.2864141699641982, | |
| "grad_norm": 0.3963714838027954, | |
| "learning_rate": 1.9961840532266263e-05, | |
| "loss": 0.35376391410827634, | |
| "mean_token_accuracy": 0.8946138739585876, | |
| "num_tokens": 4814483.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 0.332177734375, | |
| "epoch": 0.29395138496325607, | |
| "grad_norm": 0.3841065764427185, | |
| "learning_rate": 1.9957460918635513e-05, | |
| "loss": 0.34462361335754393, | |
| "mean_token_accuracy": 0.897958156466484, | |
| "num_tokens": 4940434.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 0.361767578125, | |
| "epoch": 0.3014885999623139, | |
| "grad_norm": 0.4300925135612488, | |
| "learning_rate": 1.9952843976233428e-05, | |
| "loss": 0.36802771091461184, | |
| "mean_token_accuracy": 0.8923172727227211, | |
| "num_tokens": 5068544.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 0.3556640625, | |
| "epoch": 0.30902581496137177, | |
| "grad_norm": 0.42255330085754395, | |
| "learning_rate": 1.9947989815101444e-05, | |
| "loss": 0.36620967388153075, | |
| "mean_token_accuracy": 0.8925080612301827, | |
| "num_tokens": 5181729.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 0.3381591796875, | |
| "epoch": 0.3165630299604296, | |
| "grad_norm": 0.3419656753540039, | |
| "learning_rate": 1.9942898550934928e-05, | |
| "loss": 0.3503819465637207, | |
| "mean_token_accuracy": 0.8954922616481781, | |
| "num_tokens": 5306748.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 0.3394287109375, | |
| "epoch": 0.32410024495948747, | |
| "grad_norm": 0.3902963101863861, | |
| "learning_rate": 1.9937570305080422e-05, | |
| "loss": 0.3475761651992798, | |
| "mean_token_accuracy": 0.8975138142704964, | |
| "num_tokens": 5438366.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 0.3736083984375, | |
| "epoch": 0.3316374599585453, | |
| "grad_norm": 0.38104942440986633, | |
| "learning_rate": 1.9932005204532756e-05, | |
| "loss": 0.38853695392608645, | |
| "mean_token_accuracy": 0.889219282567501, | |
| "num_tokens": 5576392.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 0.3273193359375, | |
| "epoch": 0.3391746749576032, | |
| "grad_norm": 0.35075074434280396, | |
| "learning_rate": 1.9926203381932015e-05, | |
| "loss": 0.33571979999542234, | |
| "mean_token_accuracy": 0.8994953021407127, | |
| "num_tokens": 5701170.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 0.3619873046875, | |
| "epoch": 0.346711889956661, | |
| "grad_norm": 0.34510132670402527, | |
| "learning_rate": 1.9920164975560386e-05, | |
| "loss": 0.37769622802734376, | |
| "mean_token_accuracy": 0.8914814174175263, | |
| "num_tokens": 5834397.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 0.37041015625, | |
| "epoch": 0.3542491049557189, | |
| "grad_norm": 0.3143845796585083, | |
| "learning_rate": 1.9913890129338846e-05, | |
| "loss": 0.3819720268249512, | |
| "mean_token_accuracy": 0.891846376657486, | |
| "num_tokens": 5969370.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 0.348388671875, | |
| "epoch": 0.3617863199547767, | |
| "grad_norm": 0.4210856556892395, | |
| "learning_rate": 1.9907378992823755e-05, | |
| "loss": 0.36168179512023924, | |
| "mean_token_accuracy": 0.8931615963578224, | |
| "num_tokens": 6086183.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 0.33388671875, | |
| "epoch": 0.3693235349538346, | |
| "grad_norm": 0.3834077715873718, | |
| "learning_rate": 1.9900631721203264e-05, | |
| "loss": 0.3554360866546631, | |
| "mean_token_accuracy": 0.8969168856739997, | |
| "num_tokens": 6209383.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 0.3376953125, | |
| "epoch": 0.3768607499528924, | |
| "grad_norm": 0.3776184320449829, | |
| "learning_rate": 1.9893648475293646e-05, | |
| "loss": 0.35178580284118655, | |
| "mean_token_accuracy": 0.8986482962965965, | |
| "num_tokens": 6339234.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 0.359765625, | |
| "epoch": 0.3843979649519503, | |
| "grad_norm": 0.3891402781009674, | |
| "learning_rate": 1.988642942153544e-05, | |
| "loss": 0.3677093982696533, | |
| "mean_token_accuracy": 0.895267216861248, | |
| "num_tokens": 6467113.0, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.3843979649519503, | |
| "eval_entropy": 0.3330872317394578, | |
| "eval_loss": 0.3505273461341858, | |
| "eval_mean_token_accuracy": 0.8962113052067986, | |
| "eval_num_tokens": 6467113.0, | |
| "eval_runtime": 444.8495, | |
| "eval_samples_per_second": 5.964, | |
| "eval_steps_per_second": 1.493, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 0.3333984375, | |
| "epoch": 0.39193517995100813, | |
| "grad_norm": 0.43438854813575745, | |
| "learning_rate": 1.9878974731989487e-05, | |
| "loss": 0.3478308439254761, | |
| "mean_token_accuracy": 0.8962388306856155, | |
| "num_tokens": 6583985.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 0.35859375, | |
| "epoch": 0.3994723949500659, | |
| "grad_norm": 0.4000532031059265, | |
| "learning_rate": 1.9871284584332845e-05, | |
| "loss": 0.3833730697631836, | |
| "mean_token_accuracy": 0.8913498848676682, | |
| "num_tokens": 6708069.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 0.33818359375, | |
| "epoch": 0.4070096099491238, | |
| "grad_norm": 0.45075827836990356, | |
| "learning_rate": 1.986335916185454e-05, | |
| "loss": 0.3408809661865234, | |
| "mean_token_accuracy": 0.8979726910591126, | |
| "num_tokens": 6834235.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 0.356494140625, | |
| "epoch": 0.4145468249481816, | |
| "grad_norm": 0.3909159004688263, | |
| "learning_rate": 1.9855198653451194e-05, | |
| "loss": 0.36372694969177244, | |
| "mean_token_accuracy": 0.8921904131770134, | |
| "num_tokens": 6972729.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 0.340576171875, | |
| "epoch": 0.4220840399472395, | |
| "grad_norm": 0.34595179557800293, | |
| "learning_rate": 1.9846803253622535e-05, | |
| "loss": 0.35205156803131105, | |
| "mean_token_accuracy": 0.8962323024868966, | |
| "num_tokens": 7105522.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 0.3424072265625, | |
| "epoch": 0.4296212549462973, | |
| "grad_norm": 0.48934608697891235, | |
| "learning_rate": 1.983817316246676e-05, | |
| "loss": 0.35395040512084963, | |
| "mean_token_accuracy": 0.8971632197499275, | |
| "num_tokens": 7226248.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 0.31986083984375, | |
| "epoch": 0.4371584699453552, | |
| "grad_norm": 0.4124310612678528, | |
| "learning_rate": 1.9829308585675746e-05, | |
| "loss": 0.33618412017822263, | |
| "mean_token_accuracy": 0.8994600489735604, | |
| "num_tokens": 7348054.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 0.3430908203125, | |
| "epoch": 0.444695684944413, | |
| "grad_norm": 0.3382546901702881, | |
| "learning_rate": 1.9820209734530185e-05, | |
| "loss": 0.35527355670928956, | |
| "mean_token_accuracy": 0.8949465349316597, | |
| "num_tokens": 7467342.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 0.3464599609375, | |
| "epoch": 0.4522328999434709, | |
| "grad_norm": 0.4934978783130646, | |
| "learning_rate": 1.981087682589451e-05, | |
| "loss": 0.3549240827560425, | |
| "mean_token_accuracy": 0.8943406358361244, | |
| "num_tokens": 7592366.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 0.33681640625, | |
| "epoch": 0.45977011494252873, | |
| "grad_norm": 0.4190860986709595, | |
| "learning_rate": 1.9801310082211748e-05, | |
| "loss": 0.3477961540222168, | |
| "mean_token_accuracy": 0.8963608622550965, | |
| "num_tokens": 7718744.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 0.32294921875, | |
| "epoch": 0.4673073299415866, | |
| "grad_norm": 0.4096807539463043, | |
| "learning_rate": 1.9791509731498205e-05, | |
| "loss": 0.33289148807525637, | |
| "mean_token_accuracy": 0.8992252185940742, | |
| "num_tokens": 7835764.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 0.3320068359375, | |
| "epoch": 0.47484454494064443, | |
| "grad_norm": 0.45555874705314636, | |
| "learning_rate": 1.9781476007338058e-05, | |
| "loss": 0.34081387519836426, | |
| "mean_token_accuracy": 0.8964440226554871, | |
| "num_tokens": 7965749.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 0.3408935546875, | |
| "epoch": 0.4823817599397023, | |
| "grad_norm": 0.3963310718536377, | |
| "learning_rate": 1.977120914887775e-05, | |
| "loss": 0.3597146272659302, | |
| "mean_token_accuracy": 0.8958937346935272, | |
| "num_tokens": 8088365.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 0.37021484375, | |
| "epoch": 0.48991897493876013, | |
| "grad_norm": 0.365715891122818, | |
| "learning_rate": 1.9760709400820314e-05, | |
| "loss": 0.3843697547912598, | |
| "mean_token_accuracy": 0.8901895850896835, | |
| "num_tokens": 8229867.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 0.3655029296875, | |
| "epoch": 0.497456189937818, | |
| "grad_norm": 0.4006253778934479, | |
| "learning_rate": 1.9749977013419536e-05, | |
| "loss": 0.37570044994354246, | |
| "mean_token_accuracy": 0.8904815658926963, | |
| "num_tokens": 8357858.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 0.3462890625, | |
| "epoch": 0.5049934049368758, | |
| "grad_norm": 0.3711676299571991, | |
| "learning_rate": 1.9739012242474e-05, | |
| "loss": 0.3505732297897339, | |
| "mean_token_accuracy": 0.8968447670340538, | |
| "num_tokens": 8491784.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 0.3403564453125, | |
| "epoch": 0.5125306199359336, | |
| "grad_norm": 0.432271808385849, | |
| "learning_rate": 1.9727815349320964e-05, | |
| "loss": 0.35620846748352053, | |
| "mean_token_accuracy": 0.8953040033578873, | |
| "num_tokens": 8613675.0, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.5125306199359336, | |
| "eval_entropy": 0.3416262707078313, | |
| "eval_loss": 0.3412366807460785, | |
| "eval_mean_token_accuracy": 0.8980938759912928, | |
| "eval_num_tokens": 8613675.0, | |
| "eval_runtime": 445.2361, | |
| "eval_samples_per_second": 5.959, | |
| "eval_steps_per_second": 1.491, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 0.3375244140625, | |
| "epoch": 0.5200678349349915, | |
| "grad_norm": 0.39377152919769287, | |
| "learning_rate": 1.971638660083016e-05, | |
| "loss": 0.3446618318557739, | |
| "mean_token_accuracy": 0.8973624289035798, | |
| "num_tokens": 8734967.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 0.380859375, | |
| "epoch": 0.5276050499340493, | |
| "grad_norm": 0.3425155282020569, | |
| "learning_rate": 1.970472626939742e-05, | |
| "loss": 0.3928657293319702, | |
| "mean_token_accuracy": 0.8857068896293641, | |
| "num_tokens": 8866789.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 0.3181884765625, | |
| "epoch": 0.5351422649331072, | |
| "grad_norm": 0.39210009574890137, | |
| "learning_rate": 1.969283463293818e-05, | |
| "loss": 0.3279300928115845, | |
| "mean_token_accuracy": 0.901725186407566, | |
| "num_tokens": 8989637.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 0.3260986328125, | |
| "epoch": 0.542679479932165, | |
| "grad_norm": 0.36499711871147156, | |
| "learning_rate": 1.9680711974880868e-05, | |
| "loss": 0.3395835399627686, | |
| "mean_token_accuracy": 0.8985119208693504, | |
| "num_tokens": 9107079.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 0.3133056640625, | |
| "epoch": 0.5502166949312229, | |
| "grad_norm": 0.3930191099643707, | |
| "learning_rate": 1.9668358584160136e-05, | |
| "loss": 0.3265484094619751, | |
| "mean_token_accuracy": 0.9016185060143471, | |
| "num_tokens": 9227783.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 0.340673828125, | |
| "epoch": 0.5577539099302807, | |
| "grad_norm": 0.3877074122428894, | |
| "learning_rate": 1.965577475520999e-05, | |
| "loss": 0.34572837352752683, | |
| "mean_token_accuracy": 0.8980929121375084, | |
| "num_tokens": 9352288.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 0.3293212890625, | |
| "epoch": 0.5652911249293386, | |
| "grad_norm": 0.3847011625766754, | |
| "learning_rate": 1.964296078795675e-05, | |
| "loss": 0.33631391525268556, | |
| "mean_token_accuracy": 0.8981146275997162, | |
| "num_tokens": 9475875.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 0.3515380859375, | |
| "epoch": 0.5728283399283964, | |
| "grad_norm": 0.3962864577770233, | |
| "learning_rate": 1.9629916987811924e-05, | |
| "loss": 0.3633269309997559, | |
| "mean_token_accuracy": 0.8934466958045959, | |
| "num_tokens": 9601762.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 0.31484375, | |
| "epoch": 0.5803655549274543, | |
| "grad_norm": 0.3556186556816101, | |
| "learning_rate": 1.961664366566491e-05, | |
| "loss": 0.3226339101791382, | |
| "mean_token_accuracy": 0.9032136023044586, | |
| "num_tokens": 9729416.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 0.34990234375, | |
| "epoch": 0.5879027699265121, | |
| "grad_norm": 0.3913438618183136, | |
| "learning_rate": 1.9603141137875596e-05, | |
| "loss": 0.358534836769104, | |
| "mean_token_accuracy": 0.8945465311408043, | |
| "num_tokens": 9862899.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 0.343603515625, | |
| "epoch": 0.59543998492557, | |
| "grad_norm": 0.39869415760040283, | |
| "learning_rate": 1.9589409726266822e-05, | |
| "loss": 0.3582808494567871, | |
| "mean_token_accuracy": 0.8956417754292488, | |
| "num_tokens": 9990936.0, | |
| "step": 790 | |
| }, | |
| { | |
| "entropy": 0.3222900390625, | |
| "epoch": 0.6029771999246278, | |
| "grad_norm": 0.46191906929016113, | |
| "learning_rate": 1.9575449758116703e-05, | |
| "loss": 0.32662172317504884, | |
| "mean_token_accuracy": 0.9030146107077599, | |
| "num_tokens": 10124909.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 0.3161376953125, | |
| "epoch": 0.6105144149236857, | |
| "grad_norm": 0.35114115476608276, | |
| "learning_rate": 1.956126156615083e-05, | |
| "loss": 0.3295163631439209, | |
| "mean_token_accuracy": 0.8997720777988434, | |
| "num_tokens": 10252655.0, | |
| "step": 810 | |
| }, | |
| { | |
| "entropy": 0.335595703125, | |
| "epoch": 0.6180516299227435, | |
| "grad_norm": 0.435343861579895, | |
| "learning_rate": 1.9546845488534347e-05, | |
| "loss": 0.34328203201293944, | |
| "mean_token_accuracy": 0.8988629937171936, | |
| "num_tokens": 10378988.0, | |
| "step": 820 | |
| }, | |
| { | |
| "entropy": 0.329248046875, | |
| "epoch": 0.6255888449218014, | |
| "grad_norm": 0.3690928518772125, | |
| "learning_rate": 1.953220186886388e-05, | |
| "loss": 0.3510568380355835, | |
| "mean_token_accuracy": 0.897222849726677, | |
| "num_tokens": 10503801.0, | |
| "step": 830 | |
| }, | |
| { | |
| "entropy": 0.325, | |
| "epoch": 0.6331260599208592, | |
| "grad_norm": 0.33731427788734436, | |
| "learning_rate": 1.9517331056159353e-05, | |
| "loss": 0.3301519870758057, | |
| "mean_token_accuracy": 0.9016004085540772, | |
| "num_tokens": 10632605.0, | |
| "step": 840 | |
| }, | |
| { | |
| "entropy": 0.3230224609375, | |
| "epoch": 0.640663274919917, | |
| "grad_norm": 0.3374157249927521, | |
| "learning_rate": 1.9502233404855672e-05, | |
| "loss": 0.335455584526062, | |
| "mean_token_accuracy": 0.8995656460523606, | |
| "num_tokens": 10758290.0, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.640663274919917, | |
| "eval_entropy": 0.32338926016566266, | |
| "eval_loss": 0.33324772119522095, | |
| "eval_mean_token_accuracy": 0.8999460333262581, | |
| "eval_num_tokens": 10758290.0, | |
| "eval_runtime": 445.1709, | |
| "eval_samples_per_second": 5.96, | |
| "eval_steps_per_second": 1.492, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 0.3327880859375, | |
| "epoch": 0.6482004899189749, | |
| "grad_norm": 0.3995136320590973, | |
| "learning_rate": 1.948690927479427e-05, | |
| "loss": 0.34148826599121096, | |
| "mean_token_accuracy": 0.898120503127575, | |
| "num_tokens": 10884739.0, | |
| "step": 860 | |
| }, | |
| { | |
| "entropy": 0.3158203125, | |
| "epoch": 0.6557377049180327, | |
| "grad_norm": 0.49846041202545166, | |
| "learning_rate": 1.9471359031214535e-05, | |
| "loss": 0.3240156412124634, | |
| "mean_token_accuracy": 0.9004231512546539, | |
| "num_tokens": 11008100.0, | |
| "step": 870 | |
| }, | |
| { | |
| "entropy": 0.312646484375, | |
| "epoch": 0.6632749199170906, | |
| "grad_norm": 0.42257261276245117, | |
| "learning_rate": 1.945558304474512e-05, | |
| "loss": 0.3160678863525391, | |
| "mean_token_accuracy": 0.9045681983232499, | |
| "num_tokens": 11129110.0, | |
| "step": 880 | |
| }, | |
| { | |
| "entropy": 0.319189453125, | |
| "epoch": 0.6708121349161484, | |
| "grad_norm": 0.36973708868026733, | |
| "learning_rate": 1.943958169139507e-05, | |
| "loss": 0.3275951623916626, | |
| "mean_token_accuracy": 0.9003831461071968, | |
| "num_tokens": 11258786.0, | |
| "step": 890 | |
| }, | |
| { | |
| "entropy": 0.311572265625, | |
| "epoch": 0.6783493499152063, | |
| "grad_norm": 0.3653687834739685, | |
| "learning_rate": 1.9423355352544896e-05, | |
| "loss": 0.31893162727355956, | |
| "mean_token_accuracy": 0.9011349901556969, | |
| "num_tokens": 11370930.0, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 0.3440673828125, | |
| "epoch": 0.6858865649142641, | |
| "grad_norm": 0.39143797755241394, | |
| "learning_rate": 1.940690441493748e-05, | |
| "loss": 0.3578460693359375, | |
| "mean_token_accuracy": 0.8946596220135689, | |
| "num_tokens": 11504972.0, | |
| "step": 910 | |
| }, | |
| { | |
| "entropy": 0.3222412109375, | |
| "epoch": 0.693423779913322, | |
| "grad_norm": 0.33701032400131226, | |
| "learning_rate": 1.939022927066884e-05, | |
| "loss": 0.3248148441314697, | |
| "mean_token_accuracy": 0.9022357478737831, | |
| "num_tokens": 11646947.0, | |
| "step": 920 | |
| }, | |
| { | |
| "entropy": 0.345849609375, | |
| "epoch": 0.7009609949123798, | |
| "grad_norm": 0.43142688274383545, | |
| "learning_rate": 1.9373330317178797e-05, | |
| "loss": 0.3588585615158081, | |
| "mean_token_accuracy": 0.8931220710277558, | |
| "num_tokens": 11768199.0, | |
| "step": 930 | |
| }, | |
| { | |
| "entropy": 0.34091796875, | |
| "epoch": 0.7084982099114377, | |
| "grad_norm": 0.36513519287109375, | |
| "learning_rate": 1.93562079572415e-05, | |
| "loss": 0.34344265460968015, | |
| "mean_token_accuracy": 0.8979562237858772, | |
| "num_tokens": 11890508.0, | |
| "step": 940 | |
| }, | |
| { | |
| "entropy": 0.3333984375, | |
| "epoch": 0.7160354249104955, | |
| "grad_norm": 0.41007548570632935, | |
| "learning_rate": 1.9338862598955833e-05, | |
| "loss": 0.34928805828094484, | |
| "mean_token_accuracy": 0.8953282848000527, | |
| "num_tokens": 12021587.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 0.3439208984375, | |
| "epoch": 0.7235726399095535, | |
| "grad_norm": 0.44236838817596436, | |
| "learning_rate": 1.932129465573568e-05, | |
| "loss": 0.34870595932006837, | |
| "mean_token_accuracy": 0.8960365921258926, | |
| "num_tokens": 12143730.0, | |
| "step": 960 | |
| }, | |
| { | |
| "entropy": 0.3028564453125, | |
| "epoch": 0.7311098549086112, | |
| "grad_norm": 0.4242440164089203, | |
| "learning_rate": 1.9303504546300066e-05, | |
| "loss": 0.31922686100006104, | |
| "mean_token_accuracy": 0.9043222770094872, | |
| "num_tokens": 12271951.0, | |
| "step": 970 | |
| }, | |
| { | |
| "entropy": 0.31630859375, | |
| "epoch": 0.7386470699076692, | |
| "grad_norm": 0.4041174352169037, | |
| "learning_rate": 1.928549269466319e-05, | |
| "loss": 0.31934442520141604, | |
| "mean_token_accuracy": 0.9024053528904915, | |
| "num_tokens": 12391649.0, | |
| "step": 980 | |
| }, | |
| { | |
| "entropy": 0.300537109375, | |
| "epoch": 0.746184284906727, | |
| "grad_norm": 0.36280640959739685, | |
| "learning_rate": 1.9267259530124317e-05, | |
| "loss": 0.30955698490142824, | |
| "mean_token_accuracy": 0.9053523823618889, | |
| "num_tokens": 12515972.0, | |
| "step": 990 | |
| }, | |
| { | |
| "entropy": 0.3237060546875, | |
| "epoch": 0.7537214999057849, | |
| "grad_norm": 0.35504451394081116, | |
| "learning_rate": 1.9248805487257537e-05, | |
| "loss": 0.3321828842163086, | |
| "mean_token_accuracy": 0.8994348689913749, | |
| "num_tokens": 12638350.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "entropy": 0.3082275390625, | |
| "epoch": 0.7612587149048426, | |
| "grad_norm": 0.3824400305747986, | |
| "learning_rate": 1.9230131005901413e-05, | |
| "loss": 0.3234311580657959, | |
| "mean_token_accuracy": 0.9044092565774917, | |
| "num_tokens": 12772460.0, | |
| "step": 1010 | |
| }, | |
| { | |
| "entropy": 0.3014404296875, | |
| "epoch": 0.7687959299039006, | |
| "grad_norm": 0.32694560289382935, | |
| "learning_rate": 1.92112365311485e-05, | |
| "loss": 0.3027196884155273, | |
| "mean_token_accuracy": 0.9065699726343155, | |
| "num_tokens": 12915477.0, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 0.7687959299039006, | |
| "eval_entropy": 0.3172269154743976, | |
| "eval_loss": 0.32759496569633484, | |
| "eval_mean_token_accuracy": 0.900975513978895, | |
| "eval_num_tokens": 12915477.0, | |
| "eval_runtime": 445.4607, | |
| "eval_samples_per_second": 5.956, | |
| "eval_steps_per_second": 1.491, | |
| "step": 1020 | |
| }, | |
| { | |
| "entropy": 0.3295166015625, | |
| "epoch": 0.7763331449029583, | |
| "grad_norm": 0.39178362488746643, | |
| "learning_rate": 1.9192122513334742e-05, | |
| "loss": 0.338738226890564, | |
| "mean_token_accuracy": 0.8980937018990517, | |
| "num_tokens": 13044310.0, | |
| "step": 1030 | |
| }, | |
| { | |
| "entropy": 0.3359375, | |
| "epoch": 0.7838703599020163, | |
| "grad_norm": 0.45059332251548767, | |
| "learning_rate": 1.917278940802871e-05, | |
| "loss": 0.3519278049468994, | |
| "mean_token_accuracy": 0.8944015249609947, | |
| "num_tokens": 13167032.0, | |
| "step": 1040 | |
| }, | |
| { | |
| "entropy": 0.3169189453125, | |
| "epoch": 0.791407574901074, | |
| "grad_norm": 0.43569517135620117, | |
| "learning_rate": 1.9153237676020783e-05, | |
| "loss": 0.32522382736206057, | |
| "mean_token_accuracy": 0.9009502604603767, | |
| "num_tokens": 13289712.0, | |
| "step": 1050 | |
| }, | |
| { | |
| "entropy": 0.308447265625, | |
| "epoch": 0.7989447899001318, | |
| "grad_norm": 0.3533364236354828, | |
| "learning_rate": 1.9133467783312135e-05, | |
| "loss": 0.31727802753448486, | |
| "mean_token_accuracy": 0.9029386058449745, | |
| "num_tokens": 13408540.0, | |
| "step": 1060 | |
| }, | |
| { | |
| "entropy": 0.284033203125, | |
| "epoch": 0.8064820048991898, | |
| "grad_norm": 0.3339077830314636, | |
| "learning_rate": 1.9113480201103658e-05, | |
| "loss": 0.28868808746337893, | |
| "mean_token_accuracy": 0.9101893961429596, | |
| "num_tokens": 13531603.0, | |
| "step": 1070 | |
| }, | |
| { | |
| "entropy": 0.3197265625, | |
| "epoch": 0.8140192198982475, | |
| "grad_norm": 0.49363258481025696, | |
| "learning_rate": 1.9093275405784686e-05, | |
| "loss": 0.32742924690246583, | |
| "mean_token_accuracy": 0.9000251770019532, | |
| "num_tokens": 13644481.0, | |
| "step": 1080 | |
| }, | |
| { | |
| "entropy": 0.3171630859375, | |
| "epoch": 0.8215564348973055, | |
| "grad_norm": 0.34514543414115906, | |
| "learning_rate": 1.9072853878921698e-05, | |
| "loss": 0.3292176008224487, | |
| "mean_token_accuracy": 0.9016644075512886, | |
| "num_tokens": 13779842.0, | |
| "step": 1090 | |
| }, | |
| { | |
| "entropy": 0.3384521484375, | |
| "epoch": 0.8290936498963632, | |
| "grad_norm": 0.3689023554325104, | |
| "learning_rate": 1.9052216107246786e-05, | |
| "loss": 0.35496888160705564, | |
| "mean_token_accuracy": 0.896573556959629, | |
| "num_tokens": 13915594.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 0.31826171875, | |
| "epoch": 0.8366308648954212, | |
| "grad_norm": 0.429788738489151, | |
| "learning_rate": 1.903136258264609e-05, | |
| "loss": 0.3248345375061035, | |
| "mean_token_accuracy": 0.9002579048275947, | |
| "num_tokens": 14042862.0, | |
| "step": 1110 | |
| }, | |
| { | |
| "entropy": 0.32587890625, | |
| "epoch": 0.844168079894479, | |
| "grad_norm": 0.3493012487888336, | |
| "learning_rate": 1.901029380214806e-05, | |
| "loss": 0.33571810722351075, | |
| "mean_token_accuracy": 0.8995957180857659, | |
| "num_tokens": 14171903.0, | |
| "step": 1120 | |
| }, | |
| { | |
| "entropy": 0.3212890625, | |
| "epoch": 0.8517052948935369, | |
| "grad_norm": 0.3966390788555145, | |
| "learning_rate": 1.8989010267911613e-05, | |
| "loss": 0.32640881538391114, | |
| "mean_token_accuracy": 0.9010836943984032, | |
| "num_tokens": 14307045.0, | |
| "step": 1130 | |
| }, | |
| { | |
| "entropy": 0.3130126953125, | |
| "epoch": 0.8592425098925947, | |
| "grad_norm": 0.38989686965942383, | |
| "learning_rate": 1.8967512487214165e-05, | |
| "loss": 0.3198718070983887, | |
| "mean_token_accuracy": 0.9039800494909287, | |
| "num_tokens": 14446367.0, | |
| "step": 1140 | |
| }, | |
| { | |
| "entropy": 0.3095703125, | |
| "epoch": 0.8667797248916526, | |
| "grad_norm": 0.42321473360061646, | |
| "learning_rate": 1.894580097243954e-05, | |
| "loss": 0.30954005718231203, | |
| "mean_token_accuracy": 0.9031733021140098, | |
| "num_tokens": 14570222.0, | |
| "step": 1150 | |
| }, | |
| { | |
| "entropy": 0.309814453125, | |
| "epoch": 0.8743169398907104, | |
| "grad_norm": 0.3035660684108734, | |
| "learning_rate": 1.8923876241065747e-05, | |
| "loss": 0.3227293252944946, | |
| "mean_token_accuracy": 0.9051610559225083, | |
| "num_tokens": 14710023.0, | |
| "step": 1160 | |
| }, | |
| { | |
| "entropy": 0.297412109375, | |
| "epoch": 0.8818541548897683, | |
| "grad_norm": 0.3944414258003235, | |
| "learning_rate": 1.890173881565267e-05, | |
| "loss": 0.31080548763275145, | |
| "mean_token_accuracy": 0.9057466745376587, | |
| "num_tokens": 14840957.0, | |
| "step": 1170 | |
| }, | |
| { | |
| "entropy": 0.300244140625, | |
| "epoch": 0.889391369888826, | |
| "grad_norm": 0.42378875613212585, | |
| "learning_rate": 1.8879389223829592e-05, | |
| "loss": 0.30106220245361326, | |
| "mean_token_accuracy": 0.904910996556282, | |
| "num_tokens": 14960231.0, | |
| "step": 1180 | |
| }, | |
| { | |
| "entropy": 0.3187255859375, | |
| "epoch": 0.896928584887884, | |
| "grad_norm": 0.4092881381511688, | |
| "learning_rate": 1.8856827998282622e-05, | |
| "loss": 0.33903799057006834, | |
| "mean_token_accuracy": 0.9004707217216492, | |
| "num_tokens": 15082392.0, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 0.896928584887884, | |
| "eval_entropy": 0.3203551510730422, | |
| "eval_loss": 0.3233819901943207, | |
| "eval_mean_token_accuracy": 0.9019732332552772, | |
| "eval_num_tokens": 15082392.0, | |
| "eval_runtime": 445.1, | |
| "eval_samples_per_second": 5.96, | |
| "eval_steps_per_second": 1.492, | |
| "step": 1190 | |
| }, | |
| { | |
| "entropy": 0.292822265625, | |
| "epoch": 0.9044657998869418, | |
| "grad_norm": 0.36644798517227173, | |
| "learning_rate": 1.8834055676742018e-05, | |
| "loss": 0.29460992813110354, | |
| "mean_token_accuracy": 0.9084796339273453, | |
| "num_tokens": 15212983.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 0.3179931640625, | |
| "epoch": 0.9120030148859997, | |
| "grad_norm": 0.3994215130805969, | |
| "learning_rate": 1.8811072801969338e-05, | |
| "loss": 0.33203489780426027, | |
| "mean_token_accuracy": 0.8998118698596954, | |
| "num_tokens": 15348661.0, | |
| "step": 1210 | |
| }, | |
| { | |
| "entropy": 0.3119140625, | |
| "epoch": 0.9195402298850575, | |
| "grad_norm": 0.4053172469139099, | |
| "learning_rate": 1.878787992174454e-05, | |
| "loss": 0.32895455360412595, | |
| "mean_token_accuracy": 0.9015865311026573, | |
| "num_tokens": 15471160.0, | |
| "step": 1220 | |
| }, | |
| { | |
| "entropy": 0.3383544921875, | |
| "epoch": 0.9270774448841154, | |
| "grad_norm": 0.44813165068626404, | |
| "learning_rate": 1.876447758885289e-05, | |
| "loss": 0.33706986904144287, | |
| "mean_token_accuracy": 0.89834313839674, | |
| "num_tokens": 15603058.0, | |
| "step": 1230 | |
| }, | |
| { | |
| "entropy": 0.307568359375, | |
| "epoch": 0.9346146598831732, | |
| "grad_norm": 0.3789234757423401, | |
| "learning_rate": 1.8740866361071818e-05, | |
| "loss": 0.3279023408889771, | |
| "mean_token_accuracy": 0.9016483277082443, | |
| "num_tokens": 15734640.0, | |
| "step": 1240 | |
| }, | |
| { | |
| "entropy": 0.333056640625, | |
| "epoch": 0.9421518748822311, | |
| "grad_norm": 0.38480523228645325, | |
| "learning_rate": 1.8717046801157602e-05, | |
| "loss": 0.3306466817855835, | |
| "mean_token_accuracy": 0.8975656688213348, | |
| "num_tokens": 15853167.0, | |
| "step": 1250 | |
| }, | |
| { | |
| "entropy": 0.315673828125, | |
| "epoch": 0.9496890898812889, | |
| "grad_norm": 0.3715457618236542, | |
| "learning_rate": 1.869301947683197e-05, | |
| "loss": 0.3402095317840576, | |
| "mean_token_accuracy": 0.8996288001537323, | |
| "num_tokens": 15983692.0, | |
| "step": 1260 | |
| }, | |
| { | |
| "entropy": 0.3170654296875, | |
| "epoch": 0.9572263048803467, | |
| "grad_norm": 0.40626004338264465, | |
| "learning_rate": 1.866878496076856e-05, | |
| "loss": 0.32470359802246096, | |
| "mean_token_accuracy": 0.9029552206397057, | |
| "num_tokens": 16100297.0, | |
| "step": 1270 | |
| }, | |
| { | |
| "entropy": 0.301513671875, | |
| "epoch": 0.9647635198794046, | |
| "grad_norm": 0.40940678119659424, | |
| "learning_rate": 1.864434383057927e-05, | |
| "loss": 0.31711864471435547, | |
| "mean_token_accuracy": 0.9059911221265793, | |
| "num_tokens": 16228135.0, | |
| "step": 1280 | |
| }, | |
| { | |
| "entropy": 0.331494140625, | |
| "epoch": 0.9723007348784624, | |
| "grad_norm": 0.3918750286102295, | |
| "learning_rate": 1.8619696668800494e-05, | |
| "loss": 0.3397138833999634, | |
| "mean_token_accuracy": 0.8966664358973503, | |
| "num_tokens": 16358644.0, | |
| "step": 1290 | |
| }, | |
| { | |
| "entropy": 0.30888671875, | |
| "epoch": 0.9798379498775203, | |
| "grad_norm": 0.35955581068992615, | |
| "learning_rate": 1.8594844062879244e-05, | |
| "loss": 0.3226014614105225, | |
| "mean_token_accuracy": 0.9042733535170555, | |
| "num_tokens": 16485152.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 0.3216064453125, | |
| "epoch": 0.9873751648765781, | |
| "grad_norm": 0.3783910572528839, | |
| "learning_rate": 1.8569786605159133e-05, | |
| "loss": 0.3362764358520508, | |
| "mean_token_accuracy": 0.8991301536560059, | |
| "num_tokens": 16604827.0, | |
| "step": 1310 | |
| }, | |
| { | |
| "entropy": 0.317529296875, | |
| "epoch": 0.994912379875636, | |
| "grad_norm": 0.32068535685539246, | |
| "learning_rate": 1.8544524892866277e-05, | |
| "loss": 0.32965884208679197, | |
| "mean_token_accuracy": 0.9012513026595116, | |
| "num_tokens": 16740803.0, | |
| "step": 1320 | |
| }, | |
| { | |
| "entropy": 0.3245442708333333, | |
| "epoch": 1.0022611644997172, | |
| "grad_norm": 0.3632865250110626, | |
| "learning_rate": 1.8519059528095042e-05, | |
| "loss": 0.33621630668640134, | |
| "mean_token_accuracy": 0.9006370382431226, | |
| "num_tokens": 16856855.0, | |
| "step": 1330 | |
| }, | |
| { | |
| "entropy": 0.283056640625, | |
| "epoch": 1.0097983794987753, | |
| "grad_norm": 0.46613505482673645, | |
| "learning_rate": 1.84933911177937e-05, | |
| "loss": 0.28250281810760497, | |
| "mean_token_accuracy": 0.9116494670510292, | |
| "num_tokens": 16975649.0, | |
| "step": 1340 | |
| }, | |
| { | |
| "entropy": 0.278125, | |
| "epoch": 1.017335594497833, | |
| "grad_norm": 0.36128926277160645, | |
| "learning_rate": 1.8467520273749976e-05, | |
| "loss": 0.29456756114959715, | |
| "mean_token_accuracy": 0.9097805410623551, | |
| "num_tokens": 17101024.0, | |
| "step": 1350 | |
| }, | |
| { | |
| "entropy": 0.3016357421875, | |
| "epoch": 1.0248728094968909, | |
| "grad_norm": 0.4207335412502289, | |
| "learning_rate": 1.8441447612576438e-05, | |
| "loss": 0.3014190673828125, | |
| "mean_token_accuracy": 0.9071466863155365, | |
| "num_tokens": 17230628.0, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 1.0248728094968909, | |
| "eval_entropy": 0.2955366387424699, | |
| "eval_loss": 0.32009029388427734, | |
| "eval_mean_token_accuracy": 0.9035842050629926, | |
| "eval_num_tokens": 17230628.0, | |
| "eval_runtime": 444.9145, | |
| "eval_samples_per_second": 5.963, | |
| "eval_steps_per_second": 1.492, | |
| "step": 1360 | |
| }, | |
| { | |
| "entropy": 0.30123291015625, | |
| "epoch": 1.0324100244959487, | |
| "grad_norm": 0.40995725989341736, | |
| "learning_rate": 1.841517375569583e-05, | |
| "loss": 0.30909392833709715, | |
| "mean_token_accuracy": 0.9055786192417145, | |
| "num_tokens": 17352049.0, | |
| "step": 1370 | |
| }, | |
| { | |
| "entropy": 0.3074951171875, | |
| "epoch": 1.0399472394950067, | |
| "grad_norm": 0.36840590834617615, | |
| "learning_rate": 1.8388699329326237e-05, | |
| "loss": 0.31580018997192383, | |
| "mean_token_accuracy": 0.9033578932285309, | |
| "num_tokens": 17479720.0, | |
| "step": 1380 | |
| }, | |
| { | |
| "entropy": 0.2889404296875, | |
| "epoch": 1.0474844544940645, | |
| "grad_norm": 0.39798107743263245, | |
| "learning_rate": 1.8362024964466185e-05, | |
| "loss": 0.30143420696258544, | |
| "mean_token_accuracy": 0.9072484865784645, | |
| "num_tokens": 17602320.0, | |
| "step": 1390 | |
| }, | |
| { | |
| "entropy": 0.2903564453125, | |
| "epoch": 1.0550216694931223, | |
| "grad_norm": 0.36563146114349365, | |
| "learning_rate": 1.8335151296879576e-05, | |
| "loss": 0.2945702075958252, | |
| "mean_token_accuracy": 0.9097679927945137, | |
| "num_tokens": 17732035.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 0.2938720703125, | |
| "epoch": 1.06255888449218, | |
| "grad_norm": 0.3827485740184784, | |
| "learning_rate": 1.8308078967080547e-05, | |
| "loss": 0.3062156915664673, | |
| "mean_token_accuracy": 0.9074965313076973, | |
| "num_tokens": 17858692.0, | |
| "step": 1410 | |
| }, | |
| { | |
| "entropy": 0.293212890625, | |
| "epoch": 1.070096099491238, | |
| "grad_norm": 0.3732523024082184, | |
| "learning_rate": 1.8280808620318207e-05, | |
| "loss": 0.29337191581726074, | |
| "mean_token_accuracy": 0.908596222102642, | |
| "num_tokens": 17980887.0, | |
| "step": 1420 | |
| }, | |
| { | |
| "entropy": 0.3029052734375, | |
| "epoch": 1.0776333144902959, | |
| "grad_norm": 0.34282541275024414, | |
| "learning_rate": 1.8253340906561257e-05, | |
| "loss": 0.31957981586456297, | |
| "mean_token_accuracy": 0.9054985359311104, | |
| "num_tokens": 18118746.0, | |
| "step": 1430 | |
| }, | |
| { | |
| "entropy": 0.306103515625, | |
| "epoch": 1.0851705294893537, | |
| "grad_norm": 0.4450572729110718, | |
| "learning_rate": 1.8225676480482484e-05, | |
| "loss": 0.3173269033432007, | |
| "mean_token_accuracy": 0.905036324262619, | |
| "num_tokens": 18242535.0, | |
| "step": 1440 | |
| }, | |
| { | |
| "entropy": 0.3273193359375, | |
| "epoch": 1.0927077444884115, | |
| "grad_norm": 0.37454572319984436, | |
| "learning_rate": 1.819781600144318e-05, | |
| "loss": 0.339494514465332, | |
| "mean_token_accuracy": 0.8988345369696618, | |
| "num_tokens": 18369940.0, | |
| "step": 1450 | |
| }, | |
| { | |
| "entropy": 0.2994873046875, | |
| "epoch": 1.1002449594874695, | |
| "grad_norm": 0.39925429224967957, | |
| "learning_rate": 1.8169760133477404e-05, | |
| "loss": 0.3085808277130127, | |
| "mean_token_accuracy": 0.9062377795577049, | |
| "num_tokens": 18510860.0, | |
| "step": 1460 | |
| }, | |
| { | |
| "entropy": 0.3177734375, | |
| "epoch": 1.1077821744865273, | |
| "grad_norm": 0.3473636209964752, | |
| "learning_rate": 1.814150954527618e-05, | |
| "loss": 0.33002748489379885, | |
| "mean_token_accuracy": 0.9014916539192199, | |
| "num_tokens": 18637891.0, | |
| "step": 1470 | |
| }, | |
| { | |
| "entropy": 0.2923583984375, | |
| "epoch": 1.115319389485585, | |
| "grad_norm": 0.41963300108909607, | |
| "learning_rate": 1.8113064910171538e-05, | |
| "loss": 0.30164639949798583, | |
| "mean_token_accuracy": 0.9075041651725769, | |
| "num_tokens": 18762929.0, | |
| "step": 1480 | |
| }, | |
| { | |
| "entropy": 0.304736328125, | |
| "epoch": 1.1228566044846429, | |
| "grad_norm": 0.4134460985660553, | |
| "learning_rate": 1.8084426906120472e-05, | |
| "loss": 0.312406063079834, | |
| "mean_token_accuracy": 0.9049404874444008, | |
| "num_tokens": 18885165.0, | |
| "step": 1490 | |
| }, | |
| { | |
| "entropy": 0.2976318359375, | |
| "epoch": 1.1303938194837007, | |
| "grad_norm": 0.44191214442253113, | |
| "learning_rate": 1.8055596215688788e-05, | |
| "loss": 0.3146297693252563, | |
| "mean_token_accuracy": 0.9052109360694885, | |
| "num_tokens": 19003706.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "entropy": 0.27841796875, | |
| "epoch": 1.1379310344827587, | |
| "grad_norm": 0.43751654028892517, | |
| "learning_rate": 1.802657352603483e-05, | |
| "loss": 0.28258237838745115, | |
| "mean_token_accuracy": 0.9103972479701042, | |
| "num_tokens": 19129867.0, | |
| "step": 1510 | |
| }, | |
| { | |
| "entropy": 0.3037841796875, | |
| "epoch": 1.1454682494818165, | |
| "grad_norm": 0.4770371913909912, | |
| "learning_rate": 1.7997359528893098e-05, | |
| "loss": 0.31419939994812013, | |
| "mean_token_accuracy": 0.9043475434184074, | |
| "num_tokens": 19245782.0, | |
| "step": 1520 | |
| }, | |
| { | |
| "entropy": 0.3114501953125, | |
| "epoch": 1.1530054644808743, | |
| "grad_norm": 0.40218523144721985, | |
| "learning_rate": 1.7967954920557768e-05, | |
| "loss": 0.3275810956954956, | |
| "mean_token_accuracy": 0.9032333821058274, | |
| "num_tokens": 19375196.0, | |
| "step": 1530 | |
| }, | |
| { | |
| "epoch": 1.1530054644808743, | |
| "eval_entropy": 0.30540668533509036, | |
| "eval_loss": 0.31701526045799255, | |
| "eval_mean_token_accuracy": 0.9038175200841513, | |
| "eval_num_tokens": 19375196.0, | |
| "eval_runtime": 444.8306, | |
| "eval_samples_per_second": 5.964, | |
| "eval_steps_per_second": 1.493, | |
| "step": 1530 | |
| }, | |
| { | |
| "entropy": 0.300830078125, | |
| "epoch": 1.1605426794799323, | |
| "grad_norm": 0.3524416983127594, | |
| "learning_rate": 1.7938360401866096e-05, | |
| "loss": 0.30742716789245605, | |
| "mean_token_accuracy": 0.9047734826803208, | |
| "num_tokens": 19500857.0, | |
| "step": 1540 | |
| }, | |
| { | |
| "entropy": 0.316162109375, | |
| "epoch": 1.16807989447899, | |
| "grad_norm": 0.3703024983406067, | |
| "learning_rate": 1.7908576678181707e-05, | |
| "loss": 0.33172438144683836, | |
| "mean_token_accuracy": 0.9015444025397301, | |
| "num_tokens": 19626493.0, | |
| "step": 1550 | |
| }, | |
| { | |
| "entropy": 0.2737548828125, | |
| "epoch": 1.1756171094780479, | |
| "grad_norm": 0.3456210494041443, | |
| "learning_rate": 1.7878604459377795e-05, | |
| "loss": 0.2756441593170166, | |
| "mean_token_accuracy": 0.9136368721723557, | |
| "num_tokens": 19743689.0, | |
| "step": 1560 | |
| }, | |
| { | |
| "entropy": 0.302880859375, | |
| "epoch": 1.1831543244771057, | |
| "grad_norm": 0.4714341461658478, | |
| "learning_rate": 1.7848444459820188e-05, | |
| "loss": 0.3121260404586792, | |
| "mean_token_accuracy": 0.9028191328048706, | |
| "num_tokens": 19863458.0, | |
| "step": 1570 | |
| }, | |
| { | |
| "entropy": 0.28583984375, | |
| "epoch": 1.1906915394761635, | |
| "grad_norm": 0.4156145453453064, | |
| "learning_rate": 1.7818097398350342e-05, | |
| "loss": 0.2904102325439453, | |
| "mean_token_accuracy": 0.9098244786262513, | |
| "num_tokens": 19994262.0, | |
| "step": 1580 | |
| }, | |
| { | |
| "entropy": 0.29375, | |
| "epoch": 1.1982287544752215, | |
| "grad_norm": 0.3377763330936432, | |
| "learning_rate": 1.7787563998268184e-05, | |
| "loss": 0.30670197010040284, | |
| "mean_token_accuracy": 0.906707638502121, | |
| "num_tokens": 20124999.0, | |
| "step": 1590 | |
| }, | |
| { | |
| "entropy": 0.302392578125, | |
| "epoch": 1.2057659694742793, | |
| "grad_norm": 0.49329009652137756, | |
| "learning_rate": 1.775684498731489e-05, | |
| "loss": 0.3087696313858032, | |
| "mean_token_accuracy": 0.9053114622831344, | |
| "num_tokens": 20249258.0, | |
| "step": 1600 | |
| }, | |
| { | |
| "entropy": 0.297705078125, | |
| "epoch": 1.213303184473337, | |
| "grad_norm": 0.4330660402774811, | |
| "learning_rate": 1.7725941097655545e-05, | |
| "loss": 0.3062288761138916, | |
| "mean_token_accuracy": 0.9051512002944946, | |
| "num_tokens": 20364874.0, | |
| "step": 1610 | |
| }, | |
| { | |
| "entropy": 0.2842529296875, | |
| "epoch": 1.2208403994723949, | |
| "grad_norm": 0.4065454602241516, | |
| "learning_rate": 1.769485306586166e-05, | |
| "loss": 0.2898876428604126, | |
| "mean_token_accuracy": 0.9075682818889618, | |
| "num_tokens": 20480419.0, | |
| "step": 1620 | |
| }, | |
| { | |
| "entropy": 0.2935791015625, | |
| "epoch": 1.2283776144714529, | |
| "grad_norm": 0.35416698455810547, | |
| "learning_rate": 1.766358163289366e-05, | |
| "loss": 0.30039851665496825, | |
| "mean_token_accuracy": 0.9085959702730179, | |
| "num_tokens": 20614729.0, | |
| "step": 1630 | |
| }, | |
| { | |
| "entropy": 0.2864990234375, | |
| "epoch": 1.2359148294705107, | |
| "grad_norm": 0.3471983075141907, | |
| "learning_rate": 1.763212754408319e-05, | |
| "loss": 0.29657065868377686, | |
| "mean_token_accuracy": 0.9082139819860459, | |
| "num_tokens": 20738759.0, | |
| "step": 1640 | |
| }, | |
| { | |
| "entropy": 0.3024169921875, | |
| "epoch": 1.2434520444695685, | |
| "grad_norm": 0.3187088370323181, | |
| "learning_rate": 1.760049154911537e-05, | |
| "loss": 0.31194396018981935, | |
| "mean_token_accuracy": 0.9060672715306282, | |
| "num_tokens": 20867449.0, | |
| "step": 1650 | |
| }, | |
| { | |
| "entropy": 0.2745849609375, | |
| "epoch": 1.2509892594686263, | |
| "grad_norm": 0.3486154079437256, | |
| "learning_rate": 1.7568674402010916e-05, | |
| "loss": 0.2793387174606323, | |
| "mean_token_accuracy": 0.9114227816462517, | |
| "num_tokens": 20995147.0, | |
| "step": 1660 | |
| }, | |
| { | |
| "entropy": 0.2999755859375, | |
| "epoch": 1.258526474467684, | |
| "grad_norm": 0.42927002906799316, | |
| "learning_rate": 1.7536676861108167e-05, | |
| "loss": 0.3100817441940308, | |
| "mean_token_accuracy": 0.9050891101360321, | |
| "num_tokens": 21115888.0, | |
| "step": 1670 | |
| }, | |
| { | |
| "entropy": 0.2914794921875, | |
| "epoch": 1.266063689466742, | |
| "grad_norm": 0.389069527387619, | |
| "learning_rate": 1.7504499689045025e-05, | |
| "loss": 0.2946730852127075, | |
| "mean_token_accuracy": 0.9088802948594094, | |
| "num_tokens": 21248739.0, | |
| "step": 1680 | |
| }, | |
| { | |
| "entropy": 0.2900390625, | |
| "epoch": 1.2736009044657999, | |
| "grad_norm": 0.4550289809703827, | |
| "learning_rate": 1.7472143652740766e-05, | |
| "loss": 0.2940664768218994, | |
| "mean_token_accuracy": 0.9070353329181671, | |
| "num_tokens": 21372952.0, | |
| "step": 1690 | |
| }, | |
| { | |
| "entropy": 0.3079345703125, | |
| "epoch": 1.2811381194648577, | |
| "grad_norm": 0.3766443133354187, | |
| "learning_rate": 1.7439609523377765e-05, | |
| "loss": 0.31435160636901854, | |
| "mean_token_accuracy": 0.9039904981851578, | |
| "num_tokens": 21482465.0, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 1.2811381194648577, | |
| "eval_entropy": 0.2963881894766566, | |
| "eval_loss": 0.3144903779029846, | |
| "eval_mean_token_accuracy": 0.9044847843876804, | |
| "eval_num_tokens": 21482465.0, | |
| "eval_runtime": 444.3229, | |
| "eval_samples_per_second": 5.971, | |
| "eval_steps_per_second": 1.494, | |
| "step": 1700 | |
| }, | |
| { | |
| "entropy": 0.2976318359375, | |
| "epoch": 1.2886753344639157, | |
| "grad_norm": 0.3675684630870819, | |
| "learning_rate": 1.740689807638311e-05, | |
| "loss": 0.3084413051605225, | |
| "mean_token_accuracy": 0.9068222478032112, | |
| "num_tokens": 21606886.0, | |
| "step": 1710 | |
| }, | |
| { | |
| "entropy": 0.26845703125, | |
| "epoch": 1.2962125494629735, | |
| "grad_norm": 0.48080354928970337, | |
| "learning_rate": 1.7374010091410126e-05, | |
| "loss": 0.27617788314819336, | |
| "mean_token_accuracy": 0.9144353941082954, | |
| "num_tokens": 21728204.0, | |
| "step": 1720 | |
| }, | |
| { | |
| "entropy": 0.3060546875, | |
| "epoch": 1.3037497644620313, | |
| "grad_norm": 0.4360472559928894, | |
| "learning_rate": 1.7340946352319795e-05, | |
| "loss": 0.3208837270736694, | |
| "mean_token_accuracy": 0.9051508828997612, | |
| "num_tokens": 21847166.0, | |
| "step": 1730 | |
| }, | |
| { | |
| "entropy": 0.275732421875, | |
| "epoch": 1.311286979461089, | |
| "grad_norm": 0.42607492208480835, | |
| "learning_rate": 1.730770764716206e-05, | |
| "loss": 0.2842782735824585, | |
| "mean_token_accuracy": 0.912279462814331, | |
| "num_tokens": 21972827.0, | |
| "step": 1740 | |
| }, | |
| { | |
| "entropy": 0.298291015625, | |
| "epoch": 1.3188241944601469, | |
| "grad_norm": 0.3897174298763275, | |
| "learning_rate": 1.7274294768157065e-05, | |
| "loss": 0.30409531593322753, | |
| "mean_token_accuracy": 0.907126384973526, | |
| "num_tokens": 22098702.0, | |
| "step": 1750 | |
| }, | |
| { | |
| "entropy": 0.301708984375, | |
| "epoch": 1.3263614094592049, | |
| "grad_norm": 0.3547886312007904, | |
| "learning_rate": 1.7240708511676253e-05, | |
| "loss": 0.30962510108947755, | |
| "mean_token_accuracy": 0.9043201595544815, | |
| "num_tokens": 22224280.0, | |
| "step": 1760 | |
| }, | |
| { | |
| "entropy": 0.2868896484375, | |
| "epoch": 1.3338986244582627, | |
| "grad_norm": 0.41709667444229126, | |
| "learning_rate": 1.7206949678223388e-05, | |
| "loss": 0.29194619655609133, | |
| "mean_token_accuracy": 0.9089675724506379, | |
| "num_tokens": 22350124.0, | |
| "step": 1770 | |
| }, | |
| { | |
| "entropy": 0.31044921875, | |
| "epoch": 1.3414358394573205, | |
| "grad_norm": 0.41593441367149353, | |
| "learning_rate": 1.7173019072415488e-05, | |
| "loss": 0.3232313871383667, | |
| "mean_token_accuracy": 0.9014707505702972, | |
| "num_tokens": 22466149.0, | |
| "step": 1780 | |
| }, | |
| { | |
| "entropy": 0.302587890625, | |
| "epoch": 1.3489730544563785, | |
| "grad_norm": 0.3737364113330841, | |
| "learning_rate": 1.7138917502963627e-05, | |
| "loss": 0.3045801639556885, | |
| "mean_token_accuracy": 0.9061708480119706, | |
| "num_tokens": 22589692.0, | |
| "step": 1790 | |
| }, | |
| { | |
| "entropy": 0.288525390625, | |
| "epoch": 1.3565102694554363, | |
| "grad_norm": 0.36714568734169006, | |
| "learning_rate": 1.710464578265369e-05, | |
| "loss": 0.2963777780532837, | |
| "mean_token_accuracy": 0.9083131685853004, | |
| "num_tokens": 22722538.0, | |
| "step": 1800 | |
| }, | |
| { | |
| "entropy": 0.273828125, | |
| "epoch": 1.364047484454494, | |
| "grad_norm": 0.35630372166633606, | |
| "learning_rate": 1.7070204728326964e-05, | |
| "loss": 0.27682127952575686, | |
| "mean_token_accuracy": 0.9124655604362488, | |
| "num_tokens": 22857508.0, | |
| "step": 1810 | |
| }, | |
| { | |
| "entropy": 0.2949951171875, | |
| "epoch": 1.3715846994535519, | |
| "grad_norm": 0.353568434715271, | |
| "learning_rate": 1.7035595160860694e-05, | |
| "loss": 0.3098414897918701, | |
| "mean_token_accuracy": 0.9068989664316177, | |
| "num_tokens": 22982244.0, | |
| "step": 1820 | |
| }, | |
| { | |
| "entropy": 0.30048828125, | |
| "epoch": 1.3791219144526097, | |
| "grad_norm": 0.33436575531959534, | |
| "learning_rate": 1.7000817905148523e-05, | |
| "loss": 0.3092353820800781, | |
| "mean_token_accuracy": 0.9077757328748703, | |
| "num_tokens": 23115582.0, | |
| "step": 1830 | |
| }, | |
| { | |
| "entropy": 0.293017578125, | |
| "epoch": 1.3866591294516675, | |
| "grad_norm": 0.3831446170806885, | |
| "learning_rate": 1.6965873790080806e-05, | |
| "loss": 0.2991267442703247, | |
| "mean_token_accuracy": 0.9091545164585113, | |
| "num_tokens": 23244458.0, | |
| "step": 1840 | |
| }, | |
| { | |
| "entropy": 0.2932373046875, | |
| "epoch": 1.3941963444507255, | |
| "grad_norm": 0.4001041352748871, | |
| "learning_rate": 1.693076364852487e-05, | |
| "loss": 0.3073925018310547, | |
| "mean_token_accuracy": 0.9061064407229423, | |
| "num_tokens": 23370896.0, | |
| "step": 1850 | |
| }, | |
| { | |
| "entropy": 0.2966796875, | |
| "epoch": 1.4017335594497833, | |
| "grad_norm": 0.36026492714881897, | |
| "learning_rate": 1.6895488317305174e-05, | |
| "loss": 0.3013612747192383, | |
| "mean_token_accuracy": 0.9059083923697472, | |
| "num_tokens": 23490463.0, | |
| "step": 1860 | |
| }, | |
| { | |
| "entropy": 0.28447265625, | |
| "epoch": 1.409270774448841, | |
| "grad_norm": 0.4457832872867584, | |
| "learning_rate": 1.6860048637183336e-05, | |
| "loss": 0.2879622936248779, | |
| "mean_token_accuracy": 0.910649086534977, | |
| "num_tokens": 23619624.0, | |
| "step": 1870 | |
| }, | |
| { | |
| "epoch": 1.409270774448841, | |
| "eval_entropy": 0.2866534497364458, | |
| "eval_loss": 0.31162187457084656, | |
| "eval_mean_token_accuracy": 0.9055151030959854, | |
| "eval_num_tokens": 23619624.0, | |
| "eval_runtime": 444.4582, | |
| "eval_samples_per_second": 5.969, | |
| "eval_steps_per_second": 1.494, | |
| "step": 1870 | |
| }, | |
| { | |
| "entropy": 0.2755126953125, | |
| "epoch": 1.416807989447899, | |
| "grad_norm": 0.34847527742385864, | |
| "learning_rate": 1.6824445452838112e-05, | |
| "loss": 0.2797748327255249, | |
| "mean_token_accuracy": 0.9122792810201645, | |
| "num_tokens": 23751843.0, | |
| "step": 1880 | |
| }, | |
| { | |
| "entropy": 0.3048583984375, | |
| "epoch": 1.424345204446957, | |
| "grad_norm": 0.34166133403778076, | |
| "learning_rate": 1.6788679612845275e-05, | |
| "loss": 0.3143250226974487, | |
| "mean_token_accuracy": 0.9053974837064743, | |
| "num_tokens": 23890129.0, | |
| "step": 1890 | |
| }, | |
| { | |
| "entropy": 0.2959228515625, | |
| "epoch": 1.4318824194460147, | |
| "grad_norm": 0.4138602316379547, | |
| "learning_rate": 1.6752751969657364e-05, | |
| "loss": 0.3098402738571167, | |
| "mean_token_accuracy": 0.9060688123106957, | |
| "num_tokens": 24025639.0, | |
| "step": 1900 | |
| }, | |
| { | |
| "entropy": 0.2892822265625, | |
| "epoch": 1.4394196344450725, | |
| "grad_norm": 0.35475072264671326, | |
| "learning_rate": 1.6716663379583373e-05, | |
| "loss": 0.30137479305267334, | |
| "mean_token_accuracy": 0.9065017476677895, | |
| "num_tokens": 24142755.0, | |
| "step": 1910 | |
| }, | |
| { | |
| "entropy": 0.2736083984375, | |
| "epoch": 1.4469568494441303, | |
| "grad_norm": 0.38053274154663086, | |
| "learning_rate": 1.6680414702768358e-05, | |
| "loss": 0.2755943775177002, | |
| "mean_token_accuracy": 0.9128162145614624, | |
| "num_tokens": 24271034.0, | |
| "step": 1920 | |
| }, | |
| { | |
| "entropy": 0.2882568359375, | |
| "epoch": 1.4544940644431883, | |
| "grad_norm": 0.3685821294784546, | |
| "learning_rate": 1.6644006803172926e-05, | |
| "loss": 0.29870429039001467, | |
| "mean_token_accuracy": 0.9083519443869591, | |
| "num_tokens": 24401299.0, | |
| "step": 1930 | |
| }, | |
| { | |
| "entropy": 0.2899169921875, | |
| "epoch": 1.462031279442246, | |
| "grad_norm": 0.38053128123283386, | |
| "learning_rate": 1.660744054855263e-05, | |
| "loss": 0.2999034643173218, | |
| "mean_token_accuracy": 0.9092144444584846, | |
| "num_tokens": 24525590.0, | |
| "step": 1940 | |
| }, | |
| { | |
| "entropy": 0.3008544921875, | |
| "epoch": 1.4695684944413039, | |
| "grad_norm": 0.3747199773788452, | |
| "learning_rate": 1.657071681043731e-05, | |
| "loss": 0.3081289052963257, | |
| "mean_token_accuracy": 0.9040897369384766, | |
| "num_tokens": 24652105.0, | |
| "step": 1950 | |
| }, | |
| { | |
| "entropy": 0.28818359375, | |
| "epoch": 1.477105709440362, | |
| "grad_norm": 0.4361964762210846, | |
| "learning_rate": 1.6533836464110303e-05, | |
| "loss": 0.2913468599319458, | |
| "mean_token_accuracy": 0.9085044726729393, | |
| "num_tokens": 24781538.0, | |
| "step": 1960 | |
| }, | |
| { | |
| "entropy": 0.2942626953125, | |
| "epoch": 1.4846429244394197, | |
| "grad_norm": 0.4351835548877716, | |
| "learning_rate": 1.649680038858759e-05, | |
| "loss": 0.30144288539886477, | |
| "mean_token_accuracy": 0.9078996136784554, | |
| "num_tokens": 24900040.0, | |
| "step": 1970 | |
| }, | |
| { | |
| "entropy": 0.309912109375, | |
| "epoch": 1.4921801394384775, | |
| "grad_norm": 0.3614610433578491, | |
| "learning_rate": 1.645960946659685e-05, | |
| "loss": 0.32563717365264894, | |
| "mean_token_accuracy": 0.9042312502861023, | |
| "num_tokens": 25029356.0, | |
| "step": 1980 | |
| }, | |
| { | |
| "entropy": 0.288232421875, | |
| "epoch": 1.4997173544375353, | |
| "grad_norm": 0.46183428168296814, | |
| "learning_rate": 1.64222645845564e-05, | |
| "loss": 0.2938676118850708, | |
| "mean_token_accuracy": 0.9088562294840813, | |
| "num_tokens": 25150702.0, | |
| "step": 1990 | |
| }, | |
| { | |
| "entropy": 0.287841796875, | |
| "epoch": 1.507254569436593, | |
| "grad_norm": 0.35748639702796936, | |
| "learning_rate": 1.638476663255409e-05, | |
| "loss": 0.3016012907028198, | |
| "mean_token_accuracy": 0.90945535749197, | |
| "num_tokens": 25289821.0, | |
| "step": 2000 | |
| }, | |
| { | |
| "entropy": 0.29658203125, | |
| "epoch": 1.5147917844356509, | |
| "grad_norm": 0.392511785030365, | |
| "learning_rate": 1.6347116504326082e-05, | |
| "loss": 0.30182077884674074, | |
| "mean_token_accuracy": 0.9069562748074531, | |
| "num_tokens": 25427874.0, | |
| "step": 2010 | |
| }, | |
| { | |
| "entropy": 0.2969482421875, | |
| "epoch": 1.522328999434709, | |
| "grad_norm": 0.4357432425022125, | |
| "learning_rate": 1.630931509723554e-05, | |
| "loss": 0.30153517723083495, | |
| "mean_token_accuracy": 0.9072390154004097, | |
| "num_tokens": 25554351.0, | |
| "step": 2020 | |
| }, | |
| { | |
| "entropy": 0.2900390625, | |
| "epoch": 1.5298662144337667, | |
| "grad_norm": 0.36660265922546387, | |
| "learning_rate": 1.6271363312251253e-05, | |
| "loss": 0.30401484966278075, | |
| "mean_token_accuracy": 0.909621711075306, | |
| "num_tokens": 25687339.0, | |
| "step": 2030 | |
| }, | |
| { | |
| "entropy": 0.291259765625, | |
| "epoch": 1.5374034294328247, | |
| "grad_norm": 0.3444574177265167, | |
| "learning_rate": 1.6233262053926165e-05, | |
| "loss": 0.29833531379699707, | |
| "mean_token_accuracy": 0.9089738965034485, | |
| "num_tokens": 25819705.0, | |
| "step": 2040 | |
| }, | |
| { | |
| "epoch": 1.5374034294328247, | |
| "eval_entropy": 0.29168186417545183, | |
| "eval_loss": 0.3090449571609497, | |
| "eval_mean_token_accuracy": 0.9057694819856839, | |
| "eval_num_tokens": 25819705.0, | |
| "eval_runtime": 444.9473, | |
| "eval_samples_per_second": 5.963, | |
| "eval_steps_per_second": 1.492, | |
| "step": 2040 | |
| }, | |
| { | |
| "entropy": 0.286083984375, | |
| "epoch": 1.5449406444318825, | |
| "grad_norm": 0.3866405487060547, | |
| "learning_rate": 1.6195012230375783e-05, | |
| "loss": 0.29763362407684324, | |
| "mean_token_accuracy": 0.9090174749493599, | |
| "num_tokens": 25950997.0, | |
| "step": 2050 | |
| }, | |
| { | |
| "entropy": 0.279345703125, | |
| "epoch": 1.5524778594309403, | |
| "grad_norm": 0.39879608154296875, | |
| "learning_rate": 1.6156614753256583e-05, | |
| "loss": 0.2852219343185425, | |
| "mean_token_accuracy": 0.9102980241179466, | |
| "num_tokens": 26065033.0, | |
| "step": 2060 | |
| }, | |
| { | |
| "entropy": 0.2977294921875, | |
| "epoch": 1.560015074429998, | |
| "grad_norm": 0.4519115686416626, | |
| "learning_rate": 1.6118070537744242e-05, | |
| "loss": 0.3063497066497803, | |
| "mean_token_accuracy": 0.9054354265332222, | |
| "num_tokens": 26188501.0, | |
| "step": 2070 | |
| }, | |
| { | |
| "entropy": 0.305029296875, | |
| "epoch": 1.567552289429056, | |
| "grad_norm": 0.3860149383544922, | |
| "learning_rate": 1.6079380502511846e-05, | |
| "loss": 0.3170385122299194, | |
| "mean_token_accuracy": 0.906504712998867, | |
| "num_tokens": 26320550.0, | |
| "step": 2080 | |
| }, | |
| { | |
| "entropy": 0.2880859375, | |
| "epoch": 1.5750895044281137, | |
| "grad_norm": 0.4003013074398041, | |
| "learning_rate": 1.6040545569707977e-05, | |
| "loss": 0.29796886444091797, | |
| "mean_token_accuracy": 0.907678847014904, | |
| "num_tokens": 26439410.0, | |
| "step": 2090 | |
| }, | |
| { | |
| "entropy": 0.293212890625, | |
| "epoch": 1.5826267194271717, | |
| "grad_norm": 0.39812982082366943, | |
| "learning_rate": 1.600156666493475e-05, | |
| "loss": 0.3037936449050903, | |
| "mean_token_accuracy": 0.9078080400824546, | |
| "num_tokens": 26558486.0, | |
| "step": 2100 | |
| }, | |
| { | |
| "entropy": 0.2809814453125, | |
| "epoch": 1.5901639344262295, | |
| "grad_norm": 0.3826020658016205, | |
| "learning_rate": 1.5962444717225753e-05, | |
| "loss": 0.29529705047607424, | |
| "mean_token_accuracy": 0.9107925236225128, | |
| "num_tokens": 26690449.0, | |
| "step": 2110 | |
| }, | |
| { | |
| "entropy": 0.2869140625, | |
| "epoch": 1.5977011494252875, | |
| "grad_norm": 0.3772203326225281, | |
| "learning_rate": 1.5923180659023883e-05, | |
| "loss": 0.29066874980926516, | |
| "mean_token_accuracy": 0.9094026356935501, | |
| "num_tokens": 26824245.0, | |
| "step": 2120 | |
| }, | |
| { | |
| "entropy": 0.28427734375, | |
| "epoch": 1.6052383644243453, | |
| "grad_norm": 0.3734860122203827, | |
| "learning_rate": 1.588377542615915e-05, | |
| "loss": 0.2948519945144653, | |
| "mean_token_accuracy": 0.908295425772667, | |
| "num_tokens": 26951710.0, | |
| "step": 2130 | |
| }, | |
| { | |
| "entropy": 0.2827392578125, | |
| "epoch": 1.612775579423403, | |
| "grad_norm": 0.4289539158344269, | |
| "learning_rate": 1.5844229957826347e-05, | |
| "loss": 0.28623509407043457, | |
| "mean_token_accuracy": 0.9114281222224235, | |
| "num_tokens": 27081467.0, | |
| "step": 2140 | |
| }, | |
| { | |
| "entropy": 0.3018798828125, | |
| "epoch": 1.620312794422461, | |
| "grad_norm": 0.4174732565879822, | |
| "learning_rate": 1.5804545196562683e-05, | |
| "loss": 0.31496200561523435, | |
| "mean_token_accuracy": 0.9058399319648742, | |
| "num_tokens": 27213220.0, | |
| "step": 2150 | |
| }, | |
| { | |
| "entropy": 0.2672119140625, | |
| "epoch": 1.6278500094215187, | |
| "grad_norm": 0.3824097514152527, | |
| "learning_rate": 1.5764722088225317e-05, | |
| "loss": 0.2726640224456787, | |
| "mean_token_accuracy": 0.9144431263208389, | |
| "num_tokens": 27326671.0, | |
| "step": 2160 | |
| }, | |
| { | |
| "entropy": 0.3100341796875, | |
| "epoch": 1.6353872244205765, | |
| "grad_norm": 0.45335128903388977, | |
| "learning_rate": 1.572476158196879e-05, | |
| "loss": 0.3252666234970093, | |
| "mean_token_accuracy": 0.9008206337690353, | |
| "num_tokens": 27440284.0, | |
| "step": 2170 | |
| }, | |
| { | |
| "entropy": 0.28056640625, | |
| "epoch": 1.6429244394196343, | |
| "grad_norm": 0.3022969663143158, | |
| "learning_rate": 1.568466463022245e-05, | |
| "loss": 0.2954371452331543, | |
| "mean_token_accuracy": 0.9110561206936836, | |
| "num_tokens": 27559379.0, | |
| "step": 2180 | |
| }, | |
| { | |
| "entropy": 0.2784423828125, | |
| "epoch": 1.6504616544186923, | |
| "grad_norm": 0.3907804489135742, | |
| "learning_rate": 1.5644432188667695e-05, | |
| "loss": 0.2918686389923096, | |
| "mean_token_accuracy": 0.9108302012085915, | |
| "num_tokens": 27686989.0, | |
| "step": 2190 | |
| }, | |
| { | |
| "entropy": 0.2941162109375, | |
| "epoch": 1.65799886941775, | |
| "grad_norm": 0.35084792971611023, | |
| "learning_rate": 1.560406521621524e-05, | |
| "loss": 0.29794740676879883, | |
| "mean_token_accuracy": 0.9107154473662377, | |
| "num_tokens": 27820500.0, | |
| "step": 2200 | |
| }, | |
| { | |
| "entropy": 0.26474609375, | |
| "epoch": 1.6655360844168081, | |
| "grad_norm": 0.3820977807044983, | |
| "learning_rate": 1.5563564674982235e-05, | |
| "loss": 0.27836596965789795, | |
| "mean_token_accuracy": 0.9123305752873421, | |
| "num_tokens": 27932725.0, | |
| "step": 2210 | |
| }, | |
| { | |
| "epoch": 1.6655360844168081, | |
| "eval_entropy": 0.28888454207454817, | |
| "eval_loss": 0.30725526809692383, | |
| "eval_mean_token_accuracy": 0.9062411828213427, | |
| "eval_num_tokens": 27932725.0, | |
| "eval_runtime": 444.1042, | |
| "eval_samples_per_second": 5.974, | |
| "eval_steps_per_second": 1.495, | |
| "step": 2210 | |
| }, | |
| { | |
| "entropy": 0.301220703125, | |
| "epoch": 1.673073299415866, | |
| "grad_norm": 0.41093695163726807, | |
| "learning_rate": 1.5522931530269356e-05, | |
| "loss": 0.3100571155548096, | |
| "mean_token_accuracy": 0.9063948586583137, | |
| "num_tokens": 28068236.0, | |
| "step": 2220 | |
| }, | |
| { | |
| "entropy": 0.2692626953125, | |
| "epoch": 1.6806105144149237, | |
| "grad_norm": 0.33717814087867737, | |
| "learning_rate": 1.5482166750537777e-05, | |
| "loss": 0.2845989942550659, | |
| "mean_token_accuracy": 0.913370530307293, | |
| "num_tokens": 28194718.0, | |
| "step": 2230 | |
| }, | |
| { | |
| "entropy": 0.310009765625, | |
| "epoch": 1.6881477294139815, | |
| "grad_norm": 0.43015503883361816, | |
| "learning_rate": 1.54412713073861e-05, | |
| "loss": 0.31532199382781984, | |
| "mean_token_accuracy": 0.903562581539154, | |
| "num_tokens": 28317717.0, | |
| "step": 2240 | |
| }, | |
| { | |
| "entropy": 0.2740234375, | |
| "epoch": 1.6956849444130393, | |
| "grad_norm": 0.3851742148399353, | |
| "learning_rate": 1.5400246175527186e-05, | |
| "loss": 0.2825237035751343, | |
| "mean_token_accuracy": 0.9131973013281822, | |
| "num_tokens": 28450059.0, | |
| "step": 2250 | |
| }, | |
| { | |
| "entropy": 0.270556640625, | |
| "epoch": 1.703222159412097, | |
| "grad_norm": 0.3782564401626587, | |
| "learning_rate": 1.5359092332764938e-05, | |
| "loss": 0.28100948333740233, | |
| "mean_token_accuracy": 0.9127213463187218, | |
| "num_tokens": 28577388.0, | |
| "step": 2260 | |
| }, | |
| { | |
| "entropy": 0.2857666015625, | |
| "epoch": 1.710759374411155, | |
| "grad_norm": 0.41269612312316895, | |
| "learning_rate": 1.5317810759970996e-05, | |
| "loss": 0.29292376041412355, | |
| "mean_token_accuracy": 0.9088818147778511, | |
| "num_tokens": 28708268.0, | |
| "step": 2270 | |
| }, | |
| { | |
| "entropy": 0.2853271484375, | |
| "epoch": 1.718296589410213, | |
| "grad_norm": 0.3992975354194641, | |
| "learning_rate": 1.527640244106133e-05, | |
| "loss": 0.29620723724365233, | |
| "mean_token_accuracy": 0.9107150569558143, | |
| "num_tokens": 28844273.0, | |
| "step": 2280 | |
| }, | |
| { | |
| "entropy": 0.282958984375, | |
| "epoch": 1.725833804409271, | |
| "grad_norm": 0.4681526720523834, | |
| "learning_rate": 1.5234868362972832e-05, | |
| "loss": 0.292909574508667, | |
| "mean_token_accuracy": 0.9111030578613282, | |
| "num_tokens": 28968218.0, | |
| "step": 2290 | |
| }, | |
| { | |
| "entropy": 0.263427734375, | |
| "epoch": 1.7333710194083287, | |
| "grad_norm": 0.38428157567977905, | |
| "learning_rate": 1.5193209515639762e-05, | |
| "loss": 0.2674442768096924, | |
| "mean_token_accuracy": 0.914100530743599, | |
| "num_tokens": 29089112.0, | |
| "step": 2300 | |
| }, | |
| { | |
| "entropy": 0.2892822265625, | |
| "epoch": 1.7409082344073865, | |
| "grad_norm": 0.40929433703422546, | |
| "learning_rate": 1.5151426891970168e-05, | |
| "loss": 0.29194159507751466, | |
| "mean_token_accuracy": 0.9096132263541221, | |
| "num_tokens": 29218950.0, | |
| "step": 2310 | |
| }, | |
| { | |
| "entropy": 0.2778564453125, | |
| "epoch": 1.7484454494064443, | |
| "grad_norm": 0.3487510681152344, | |
| "learning_rate": 1.5109521487822208e-05, | |
| "loss": 0.294701361656189, | |
| "mean_token_accuracy": 0.9104762703180314, | |
| "num_tokens": 29354082.0, | |
| "step": 2320 | |
| }, | |
| { | |
| "entropy": 0.2981201171875, | |
| "epoch": 1.755982664405502, | |
| "grad_norm": 0.4178600311279297, | |
| "learning_rate": 1.5067494301980427e-05, | |
| "loss": 0.3012765169143677, | |
| "mean_token_accuracy": 0.9065235763788223, | |
| "num_tokens": 29488709.0, | |
| "step": 2330 | |
| }, | |
| { | |
| "entropy": 0.2984375, | |
| "epoch": 1.76351987940456, | |
| "grad_norm": 0.39268913865089417, | |
| "learning_rate": 1.5025346336131955e-05, | |
| "loss": 0.314531946182251, | |
| "mean_token_accuracy": 0.9063766539096832, | |
| "num_tokens": 29618043.0, | |
| "step": 2340 | |
| }, | |
| { | |
| "entropy": 0.2891845703125, | |
| "epoch": 1.771057094403618, | |
| "grad_norm": 0.5101540088653564, | |
| "learning_rate": 1.4983078594842608e-05, | |
| "loss": 0.29479122161865234, | |
| "mean_token_accuracy": 0.9087283477187157, | |
| "num_tokens": 29742122.0, | |
| "step": 2350 | |
| }, | |
| { | |
| "entropy": 0.2698974609375, | |
| "epoch": 1.7785943094026757, | |
| "grad_norm": 0.40157949924468994, | |
| "learning_rate": 1.494069208553298e-05, | |
| "loss": 0.277575945854187, | |
| "mean_token_accuracy": 0.9128099977970123, | |
| "num_tokens": 29872789.0, | |
| "step": 2360 | |
| }, | |
| { | |
| "entropy": 0.2943603515625, | |
| "epoch": 1.7861315244017335, | |
| "grad_norm": 0.35253477096557617, | |
| "learning_rate": 1.4898187818454401e-05, | |
| "loss": 0.2952854633331299, | |
| "mean_token_accuracy": 0.9069695189595223, | |
| "num_tokens": 29996632.0, | |
| "step": 2370 | |
| }, | |
| { | |
| "entropy": 0.283447265625, | |
| "epoch": 1.7936687394007915, | |
| "grad_norm": 0.394357830286026, | |
| "learning_rate": 1.4855566806664874e-05, | |
| "loss": 0.29858076572418213, | |
| "mean_token_accuracy": 0.9087747976183891, | |
| "num_tokens": 30115734.0, | |
| "step": 2380 | |
| }, | |
| { | |
| "epoch": 1.7936687394007915, | |
| "eval_entropy": 0.2916524496423193, | |
| "eval_loss": 0.30516064167022705, | |
| "eval_mean_token_accuracy": 0.9064356250217162, | |
| "eval_num_tokens": 30115734.0, | |
| "eval_runtime": 444.5117, | |
| "eval_samples_per_second": 5.968, | |
| "eval_steps_per_second": 1.494, | |
| "step": 2380 | |
| }, | |
| { | |
| "entropy": 0.28697509765625, | |
| "epoch": 1.8012059543998493, | |
| "grad_norm": 0.33769169449806213, | |
| "learning_rate": 1.481283006600493e-05, | |
| "loss": 0.29146175384521483, | |
| "mean_token_accuracy": 0.9108529061079025, | |
| "num_tokens": 30251060.0, | |
| "step": 2390 | |
| }, | |
| { | |
| "entropy": 0.2843994140625, | |
| "epoch": 1.8087431693989071, | |
| "grad_norm": 0.3985027074813843, | |
| "learning_rate": 1.4769978615073406e-05, | |
| "loss": 0.2936448574066162, | |
| "mean_token_accuracy": 0.9098766788840293, | |
| "num_tokens": 30373308.0, | |
| "step": 2400 | |
| }, | |
| { | |
| "entropy": 0.27158203125, | |
| "epoch": 1.816280384397965, | |
| "grad_norm": 0.4366515278816223, | |
| "learning_rate": 1.4727013475203182e-05, | |
| "loss": 0.27635395526885986, | |
| "mean_token_accuracy": 0.9137975901365281, | |
| "num_tokens": 30504411.0, | |
| "step": 2410 | |
| }, | |
| { | |
| "entropy": 0.26373291015625, | |
| "epoch": 1.8238175993970227, | |
| "grad_norm": 0.35052821040153503, | |
| "learning_rate": 1.4683935670436824e-05, | |
| "loss": 0.2652280330657959, | |
| "mean_token_accuracy": 0.9151029929518699, | |
| "num_tokens": 30630360.0, | |
| "step": 2420 | |
| }, | |
| { | |
| "entropy": 0.29560546875, | |
| "epoch": 1.8313548143960805, | |
| "grad_norm": 0.33174508810043335, | |
| "learning_rate": 1.464074622750219e-05, | |
| "loss": 0.3035954713821411, | |
| "mean_token_accuracy": 0.9070772379636765, | |
| "num_tokens": 30764034.0, | |
| "step": 2430 | |
| }, | |
| { | |
| "entropy": 0.2862060546875, | |
| "epoch": 1.8388920293951385, | |
| "grad_norm": 0.418497771024704, | |
| "learning_rate": 1.4597446175787944e-05, | |
| "loss": 0.29122745990753174, | |
| "mean_token_accuracy": 0.9084449097514152, | |
| "num_tokens": 30889656.0, | |
| "step": 2440 | |
| }, | |
| { | |
| "entropy": 0.27470703125, | |
| "epoch": 1.8464292443941963, | |
| "grad_norm": 0.30565425753593445, | |
| "learning_rate": 1.4554036547319033e-05, | |
| "loss": 0.277424955368042, | |
| "mean_token_accuracy": 0.9113439500331879, | |
| "num_tokens": 31019827.0, | |
| "step": 2450 | |
| }, | |
| { | |
| "entropy": 0.27275390625, | |
| "epoch": 1.8539664593932543, | |
| "grad_norm": 0.43941381573677063, | |
| "learning_rate": 1.4510518376732081e-05, | |
| "loss": 0.2832863092422485, | |
| "mean_token_accuracy": 0.9118362620472908, | |
| "num_tokens": 31154827.0, | |
| "step": 2460 | |
| }, | |
| { | |
| "entropy": 0.2802734375, | |
| "epoch": 1.8615036743923121, | |
| "grad_norm": 0.41547101736068726, | |
| "learning_rate": 1.4466892701250745e-05, | |
| "loss": 0.286260986328125, | |
| "mean_token_accuracy": 0.911260911822319, | |
| "num_tokens": 31287561.0, | |
| "step": 2470 | |
| }, | |
| { | |
| "entropy": 0.28837890625, | |
| "epoch": 1.86904088939137, | |
| "grad_norm": 0.34127259254455566, | |
| "learning_rate": 1.4423160560660972e-05, | |
| "loss": 0.30336732864379884, | |
| "mean_token_accuracy": 0.9074774295091629, | |
| "num_tokens": 31420717.0, | |
| "step": 2480 | |
| }, | |
| { | |
| "entropy": 0.2842529296875, | |
| "epoch": 1.8765781043904277, | |
| "grad_norm": 0.4352460503578186, | |
| "learning_rate": 1.4379322997286228e-05, | |
| "loss": 0.29042506217956543, | |
| "mean_token_accuracy": 0.9101185172796249, | |
| "num_tokens": 31543657.0, | |
| "step": 2490 | |
| }, | |
| { | |
| "entropy": 0.308984375, | |
| "epoch": 1.8841153193894855, | |
| "grad_norm": 0.37729454040527344, | |
| "learning_rate": 1.4335381055962657e-05, | |
| "loss": 0.32251315116882323, | |
| "mean_token_accuracy": 0.9027933478355408, | |
| "num_tokens": 31672685.0, | |
| "step": 2500 | |
| }, | |
| { | |
| "entropy": 0.2936279296875, | |
| "epoch": 1.8916525343885433, | |
| "grad_norm": 0.38765987753868103, | |
| "learning_rate": 1.4291335784014173e-05, | |
| "loss": 0.2984729766845703, | |
| "mean_token_accuracy": 0.9071457028388977, | |
| "num_tokens": 31794684.0, | |
| "step": 2510 | |
| }, | |
| { | |
| "entropy": 0.2948486328125, | |
| "epoch": 1.8991897493876013, | |
| "grad_norm": 0.39258772134780884, | |
| "learning_rate": 1.42471882312275e-05, | |
| "loss": 0.30484049320220946, | |
| "mean_token_accuracy": 0.9063387095928193, | |
| "num_tokens": 31915478.0, | |
| "step": 2520 | |
| }, | |
| { | |
| "entropy": 0.2870849609375, | |
| "epoch": 1.9067269643866591, | |
| "grad_norm": 0.3371396064758301, | |
| "learning_rate": 1.4202939449827149e-05, | |
| "loss": 0.30141425132751465, | |
| "mean_token_accuracy": 0.9095958784222603, | |
| "num_tokens": 32040746.0, | |
| "step": 2530 | |
| }, | |
| { | |
| "entropy": 0.2741943359375, | |
| "epoch": 1.9142641793857171, | |
| "grad_norm": 0.4031423032283783, | |
| "learning_rate": 1.4158590494450344e-05, | |
| "loss": 0.2807930946350098, | |
| "mean_token_accuracy": 0.9128145009279252, | |
| "num_tokens": 32169569.0, | |
| "step": 2540 | |
| }, | |
| { | |
| "entropy": 0.2891357421875, | |
| "epoch": 1.921801394384775, | |
| "grad_norm": 0.37120503187179565, | |
| "learning_rate": 1.4114142422121879e-05, | |
| "loss": 0.2933060646057129, | |
| "mean_token_accuracy": 0.908392770588398, | |
| "num_tokens": 32296584.0, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 1.921801394384775, | |
| "eval_entropy": 0.2865328501506024, | |
| "eval_loss": 0.3034323453903198, | |
| "eval_mean_token_accuracy": 0.9070448785661215, | |
| "eval_num_tokens": 32296584.0, | |
| "eval_runtime": 444.775, | |
| "eval_samples_per_second": 5.965, | |
| "eval_steps_per_second": 1.493, | |
| "step": 2550 | |
| }, | |
| { | |
| "entropy": 0.2989990234375, | |
| "epoch": 1.9293386093838327, | |
| "grad_norm": 0.40673521161079407, | |
| "learning_rate": 1.406959629222893e-05, | |
| "loss": 0.3103364944458008, | |
| "mean_token_accuracy": 0.9063321113586426, | |
| "num_tokens": 32428504.0, | |
| "step": 2560 | |
| }, | |
| { | |
| "entropy": 0.2962646484375, | |
| "epoch": 1.9368758243828905, | |
| "grad_norm": 0.3941977322101593, | |
| "learning_rate": 1.40249531664958e-05, | |
| "loss": 0.30964858531951905, | |
| "mean_token_accuracy": 0.9068703219294548, | |
| "num_tokens": 32556407.0, | |
| "step": 2570 | |
| }, | |
| { | |
| "entropy": 0.2732666015625, | |
| "epoch": 1.9444130393819483, | |
| "grad_norm": 0.4122161567211151, | |
| "learning_rate": 1.3980214108958626e-05, | |
| "loss": 0.27610068321228026, | |
| "mean_token_accuracy": 0.9125834852457047, | |
| "num_tokens": 32679188.0, | |
| "step": 2580 | |
| }, | |
| { | |
| "entropy": 0.252587890625, | |
| "epoch": 1.9519502543810061, | |
| "grad_norm": 0.31762272119522095, | |
| "learning_rate": 1.3935380185939992e-05, | |
| "loss": 0.26145143508911134, | |
| "mean_token_accuracy": 0.9161947175860405, | |
| "num_tokens": 32806126.0, | |
| "step": 2590 | |
| }, | |
| { | |
| "entropy": 0.28642578125, | |
| "epoch": 1.959487469380064, | |
| "grad_norm": 0.37945154309272766, | |
| "learning_rate": 1.3890452466023545e-05, | |
| "loss": 0.29998881816864015, | |
| "mean_token_accuracy": 0.908545869588852, | |
| "num_tokens": 32928860.0, | |
| "step": 2600 | |
| }, | |
| { | |
| "entropy": 0.2949462890625, | |
| "epoch": 1.967024684379122, | |
| "grad_norm": 0.39361295104026794, | |
| "learning_rate": 1.3845432020028511e-05, | |
| "loss": 0.30800106525421145, | |
| "mean_token_accuracy": 0.9073520034551621, | |
| "num_tokens": 33065049.0, | |
| "step": 2610 | |
| }, | |
| { | |
| "entropy": 0.3162109375, | |
| "epoch": 1.9745618993781797, | |
| "grad_norm": 0.411302387714386, | |
| "learning_rate": 1.380031992098417e-05, | |
| "loss": 0.33235788345336914, | |
| "mean_token_accuracy": 0.9015798211097718, | |
| "num_tokens": 33199078.0, | |
| "step": 2620 | |
| }, | |
| { | |
| "entropy": 0.2697021484375, | |
| "epoch": 1.9820991143772377, | |
| "grad_norm": 0.42348551750183105, | |
| "learning_rate": 1.3755117244104282e-05, | |
| "loss": 0.27779905796051024, | |
| "mean_token_accuracy": 0.9132746890187263, | |
| "num_tokens": 33326852.0, | |
| "step": 2630 | |
| }, | |
| { | |
| "entropy": 0.2989501953125, | |
| "epoch": 1.9896363293762955, | |
| "grad_norm": 0.3523179888725281, | |
| "learning_rate": 1.370982506676147e-05, | |
| "loss": 0.3090573787689209, | |
| "mean_token_accuracy": 0.907941748201847, | |
| "num_tokens": 33465412.0, | |
| "step": 2640 | |
| }, | |
| { | |
| "entropy": 0.289208984375, | |
| "epoch": 1.9971735443753533, | |
| "grad_norm": 0.3901941180229187, | |
| "learning_rate": 1.3664444468461537e-05, | |
| "loss": 0.30592546463012693, | |
| "mean_token_accuracy": 0.9097454324364662, | |
| "num_tokens": 33594937.0, | |
| "step": 2650 | |
| }, | |
| { | |
| "entropy": 0.2732121394230769, | |
| "epoch": 2.0045223289994345, | |
| "grad_norm": 0.42783066630363464, | |
| "learning_rate": 1.3618976530817727e-05, | |
| "loss": 0.27013728618621824, | |
| "mean_token_accuracy": 0.915503862576607, | |
| "num_tokens": 33713476.0, | |
| "step": 2660 | |
| }, | |
| { | |
| "entropy": 0.265283203125, | |
| "epoch": 2.0120595439984927, | |
| "grad_norm": 0.3797246217727661, | |
| "learning_rate": 1.3573422337524953e-05, | |
| "loss": 0.27342140674591064, | |
| "mean_token_accuracy": 0.9139280915260315, | |
| "num_tokens": 33841244.0, | |
| "step": 2670 | |
| }, | |
| { | |
| "entropy": 0.2574951171875, | |
| "epoch": 2.0195967589975505, | |
| "grad_norm": 0.4094177484512329, | |
| "learning_rate": 1.3527782974333978e-05, | |
| "loss": 0.26642181873321535, | |
| "mean_token_accuracy": 0.917819993197918, | |
| "num_tokens": 33965783.0, | |
| "step": 2680 | |
| }, | |
| { | |
| "entropy": 0.2673828125, | |
| "epoch": 2.0271339739966083, | |
| "grad_norm": 0.49123308062553406, | |
| "learning_rate": 1.3482059529025517e-05, | |
| "loss": 0.272041392326355, | |
| "mean_token_accuracy": 0.9136370241641998, | |
| "num_tokens": 34084425.0, | |
| "step": 2690 | |
| }, | |
| { | |
| "entropy": 0.2714599609375, | |
| "epoch": 2.034671188995666, | |
| "grad_norm": 0.38243553042411804, | |
| "learning_rate": 1.3436253091384321e-05, | |
| "loss": 0.28252534866333007, | |
| "mean_token_accuracy": 0.9118999525904655, | |
| "num_tokens": 34206356.0, | |
| "step": 2700 | |
| }, | |
| { | |
| "entropy": 0.2743896484375, | |
| "epoch": 2.042208403994724, | |
| "grad_norm": 0.4383077919483185, | |
| "learning_rate": 1.3390364753173206e-05, | |
| "loss": 0.2724027633666992, | |
| "mean_token_accuracy": 0.9126274734735489, | |
| "num_tokens": 34326720.0, | |
| "step": 2710 | |
| }, | |
| { | |
| "entropy": 0.264013671875, | |
| "epoch": 2.0497456189937817, | |
| "grad_norm": 0.42032304406166077, | |
| "learning_rate": 1.3344395608107032e-05, | |
| "loss": 0.27180933952331543, | |
| "mean_token_accuracy": 0.9154068097472191, | |
| "num_tokens": 34449082.0, | |
| "step": 2720 | |
| }, | |
| { | |
| "epoch": 2.0497456189937817, | |
| "eval_entropy": 0.2703239716679217, | |
| "eval_loss": 0.30382418632507324, | |
| "eval_mean_token_accuracy": 0.9076029673577791, | |
| "eval_num_tokens": 34449082.0, | |
| "eval_runtime": 444.9112, | |
| "eval_samples_per_second": 5.963, | |
| "eval_steps_per_second": 1.492, | |
| "step": 2720 | |
| }, | |
| { | |
| "entropy": 0.25732421875, | |
| "epoch": 2.0572828339928395, | |
| "grad_norm": 0.4523007571697235, | |
| "learning_rate": 1.3298346751826624e-05, | |
| "loss": 0.2659280300140381, | |
| "mean_token_accuracy": 0.9151400104165077, | |
| "num_tokens": 34574314.0, | |
| "step": 2730 | |
| }, | |
| { | |
| "entropy": 0.2736328125, | |
| "epoch": 2.0648200489918973, | |
| "grad_norm": 0.43264201283454895, | |
| "learning_rate": 1.3252219281872663e-05, | |
| "loss": 0.27533228397369386, | |
| "mean_token_accuracy": 0.9147139310836792, | |
| "num_tokens": 34694661.0, | |
| "step": 2740 | |
| }, | |
| { | |
| "entropy": 0.25009765625, | |
| "epoch": 2.0723572639909555, | |
| "grad_norm": 0.38429099321365356, | |
| "learning_rate": 1.3206014297659538e-05, | |
| "loss": 0.25780477523803713, | |
| "mean_token_accuracy": 0.9180345565080643, | |
| "num_tokens": 34821985.0, | |
| "step": 2750 | |
| }, | |
| { | |
| "entropy": 0.2557861328125, | |
| "epoch": 2.0798944789900133, | |
| "grad_norm": 0.40265947580337524, | |
| "learning_rate": 1.315973290044913e-05, | |
| "loss": 0.26505556106567385, | |
| "mean_token_accuracy": 0.9161929801106453, | |
| "num_tokens": 34946746.0, | |
| "step": 2760 | |
| }, | |
| { | |
| "entropy": 0.274853515625, | |
| "epoch": 2.087431693989071, | |
| "grad_norm": 0.3728543519973755, | |
| "learning_rate": 1.3113376193324564e-05, | |
| "loss": 0.2775618314743042, | |
| "mean_token_accuracy": 0.9146954879164696, | |
| "num_tokens": 35084683.0, | |
| "step": 2770 | |
| }, | |
| { | |
| "entropy": 0.26063232421875, | |
| "epoch": 2.094968908988129, | |
| "grad_norm": 0.4594137668609619, | |
| "learning_rate": 1.3066945281163923e-05, | |
| "loss": 0.2669402837753296, | |
| "mean_token_accuracy": 0.9168649092316628, | |
| "num_tokens": 35207447.0, | |
| "step": 2780 | |
| }, | |
| { | |
| "entropy": 0.267236328125, | |
| "epoch": 2.1025061239871867, | |
| "grad_norm": 0.4985879063606262, | |
| "learning_rate": 1.302044127061392e-05, | |
| "loss": 0.2751408815383911, | |
| "mean_token_accuracy": 0.912787701189518, | |
| "num_tokens": 35325558.0, | |
| "step": 2790 | |
| }, | |
| { | |
| "entropy": 0.26943359375, | |
| "epoch": 2.1100433389862445, | |
| "grad_norm": 0.45133885741233826, | |
| "learning_rate": 1.2973865270063501e-05, | |
| "loss": 0.27563629150390623, | |
| "mean_token_accuracy": 0.9126975074410438, | |
| "num_tokens": 35451140.0, | |
| "step": 2800 | |
| }, | |
| { | |
| "entropy": 0.2789306640625, | |
| "epoch": 2.1175805539853023, | |
| "grad_norm": 0.42350032925605774, | |
| "learning_rate": 1.2927218389617452e-05, | |
| "loss": 0.28734893798828126, | |
| "mean_token_accuracy": 0.911960031092167, | |
| "num_tokens": 35567497.0, | |
| "step": 2810 | |
| }, | |
| { | |
| "entropy": 0.255517578125, | |
| "epoch": 2.12511776898436, | |
| "grad_norm": 0.4202309548854828, | |
| "learning_rate": 1.2880501741069931e-05, | |
| "loss": 0.2654577255249023, | |
| "mean_token_accuracy": 0.9167904317378998, | |
| "num_tokens": 35695050.0, | |
| "step": 2820 | |
| }, | |
| { | |
| "entropy": 0.23223876953125, | |
| "epoch": 2.132654983983418, | |
| "grad_norm": 0.44368067383766174, | |
| "learning_rate": 1.2833716437877952e-05, | |
| "loss": 0.23806145191192626, | |
| "mean_token_accuracy": 0.9233140185475349, | |
| "num_tokens": 35822236.0, | |
| "step": 2830 | |
| }, | |
| { | |
| "entropy": 0.2786865234375, | |
| "epoch": 2.140192198982476, | |
| "grad_norm": 0.40076377987861633, | |
| "learning_rate": 1.278686359513488e-05, | |
| "loss": 0.2845803737640381, | |
| "mean_token_accuracy": 0.9122401431202889, | |
| "num_tokens": 35958799.0, | |
| "step": 2840 | |
| }, | |
| { | |
| "entropy": 0.2666748046875, | |
| "epoch": 2.147729413981534, | |
| "grad_norm": 0.4162449538707733, | |
| "learning_rate": 1.2739944329543818e-05, | |
| "loss": 0.274515962600708, | |
| "mean_token_accuracy": 0.9145516887307167, | |
| "num_tokens": 36083078.0, | |
| "step": 2850 | |
| }, | |
| { | |
| "entropy": 0.252099609375, | |
| "epoch": 2.1552666289805917, | |
| "grad_norm": 0.41252174973487854, | |
| "learning_rate": 1.2692959759391027e-05, | |
| "loss": 0.2631190299987793, | |
| "mean_token_accuracy": 0.9182503208518028, | |
| "num_tokens": 36203301.0, | |
| "step": 2860 | |
| }, | |
| { | |
| "entropy": 0.2442626953125, | |
| "epoch": 2.1628038439796495, | |
| "grad_norm": 0.47404617071151733, | |
| "learning_rate": 1.2645911004519246e-05, | |
| "loss": 0.250153923034668, | |
| "mean_token_accuracy": 0.9218041867017746, | |
| "num_tokens": 36337562.0, | |
| "step": 2870 | |
| }, | |
| { | |
| "entropy": 0.2638671875, | |
| "epoch": 2.1703410589787073, | |
| "grad_norm": 0.44618526101112366, | |
| "learning_rate": 1.2598799186301003e-05, | |
| "loss": 0.26806776523590087, | |
| "mean_token_accuracy": 0.9138118460774421, | |
| "num_tokens": 36451609.0, | |
| "step": 2880 | |
| }, | |
| { | |
| "entropy": 0.2649169921875, | |
| "epoch": 2.177878273977765, | |
| "grad_norm": 0.4570532441139221, | |
| "learning_rate": 1.2551625427611907e-05, | |
| "loss": 0.27152099609375, | |
| "mean_token_accuracy": 0.9154557690024376, | |
| "num_tokens": 36578083.0, | |
| "step": 2890 | |
| }, | |
| { | |
| "epoch": 2.177878273977765, | |
| "eval_entropy": 0.2681899472891566, | |
| "eval_loss": 0.3028174340724945, | |
| "eval_mean_token_accuracy": 0.9079541289303676, | |
| "eval_num_tokens": 36578083.0, | |
| "eval_runtime": 445.3242, | |
| "eval_samples_per_second": 5.957, | |
| "eval_steps_per_second": 1.491, | |
| "step": 2890 | |
| }, | |
| { | |
| "entropy": 0.2643310546875, | |
| "epoch": 2.185415488976823, | |
| "grad_norm": 0.4730449318885803, | |
| "learning_rate": 1.2504390852803863e-05, | |
| "loss": 0.2764227867126465, | |
| "mean_token_accuracy": 0.9145638346672058, | |
| "num_tokens": 36710742.0, | |
| "step": 2900 | |
| }, | |
| { | |
| "entropy": 0.2716796875, | |
| "epoch": 2.1929527039758807, | |
| "grad_norm": 0.4901706576347351, | |
| "learning_rate": 1.245709658767829e-05, | |
| "loss": 0.2783637523651123, | |
| "mean_token_accuracy": 0.913567054271698, | |
| "num_tokens": 36829782.0, | |
| "step": 2910 | |
| }, | |
| { | |
| "entropy": 0.273779296875, | |
| "epoch": 2.200489918974939, | |
| "grad_norm": 0.47092169523239136, | |
| "learning_rate": 1.2409743759459275e-05, | |
| "loss": 0.28058323860168455, | |
| "mean_token_accuracy": 0.9126289084553718, | |
| "num_tokens": 36957582.0, | |
| "step": 2920 | |
| }, | |
| { | |
| "entropy": 0.24866943359375, | |
| "epoch": 2.2080271339739967, | |
| "grad_norm": 0.43678930401802063, | |
| "learning_rate": 1.2362333496766718e-05, | |
| "loss": 0.249833345413208, | |
| "mean_token_accuracy": 0.9209662929177285, | |
| "num_tokens": 37090946.0, | |
| "step": 2930 | |
| }, | |
| { | |
| "entropy": 0.2679443359375, | |
| "epoch": 2.2155643489730545, | |
| "grad_norm": 0.44983765482902527, | |
| "learning_rate": 1.2314866929589434e-05, | |
| "loss": 0.281503963470459, | |
| "mean_token_accuracy": 0.9136047154664994, | |
| "num_tokens": 37226066.0, | |
| "step": 2940 | |
| }, | |
| { | |
| "entropy": 0.2578369140625, | |
| "epoch": 2.2231015639721123, | |
| "grad_norm": 0.4278606176376343, | |
| "learning_rate": 1.2267345189258197e-05, | |
| "loss": 0.26151697635650634, | |
| "mean_token_accuracy": 0.917884474992752, | |
| "num_tokens": 37348841.0, | |
| "step": 2950 | |
| }, | |
| { | |
| "entropy": 0.255615234375, | |
| "epoch": 2.23063877897117, | |
| "grad_norm": 0.38196465373039246, | |
| "learning_rate": 1.2219769408418809e-05, | |
| "loss": 0.26131410598754884, | |
| "mean_token_accuracy": 0.9185866966843605, | |
| "num_tokens": 37485128.0, | |
| "step": 2960 | |
| }, | |
| { | |
| "entropy": 0.282373046875, | |
| "epoch": 2.238175993970228, | |
| "grad_norm": 0.4476567208766937, | |
| "learning_rate": 1.217214072100508e-05, | |
| "loss": 0.2837507963180542, | |
| "mean_token_accuracy": 0.9103922292590141, | |
| "num_tokens": 37614342.0, | |
| "step": 2970 | |
| }, | |
| { | |
| "entropy": 0.279638671875, | |
| "epoch": 2.2457132089692857, | |
| "grad_norm": 0.45457765460014343, | |
| "learning_rate": 1.2124460262211808e-05, | |
| "loss": 0.29149446487426756, | |
| "mean_token_accuracy": 0.9109927758574485, | |
| "num_tokens": 37745788.0, | |
| "step": 2980 | |
| }, | |
| { | |
| "entropy": 0.27572021484375, | |
| "epoch": 2.2532504239683435, | |
| "grad_norm": 0.46303901076316833, | |
| "learning_rate": 1.2076729168467733e-05, | |
| "loss": 0.28504157066345215, | |
| "mean_token_accuracy": 0.9117044806480408, | |
| "num_tokens": 37874375.0, | |
| "step": 2990 | |
| }, | |
| { | |
| "entropy": 0.2697509765625, | |
| "epoch": 2.2607876389674013, | |
| "grad_norm": 0.5162591934204102, | |
| "learning_rate": 1.202894857740843e-05, | |
| "loss": 0.27514770030975344, | |
| "mean_token_accuracy": 0.9141019478440284, | |
| "num_tokens": 38003944.0, | |
| "step": 3000 | |
| }, | |
| { | |
| "entropy": 0.27939453125, | |
| "epoch": 2.2683248539664596, | |
| "grad_norm": 0.3618636727333069, | |
| "learning_rate": 1.1981119627849213e-05, | |
| "loss": 0.28610208034515383, | |
| "mean_token_accuracy": 0.9116652965545654, | |
| "num_tokens": 38140440.0, | |
| "step": 3010 | |
| }, | |
| { | |
| "entropy": 0.25126953125, | |
| "epoch": 2.2758620689655173, | |
| "grad_norm": 0.45818719267845154, | |
| "learning_rate": 1.1933243459757987e-05, | |
| "loss": 0.25659780502319335, | |
| "mean_token_accuracy": 0.9194882601499558, | |
| "num_tokens": 38266675.0, | |
| "step": 3020 | |
| }, | |
| { | |
| "entropy": 0.277490234375, | |
| "epoch": 2.283399283964575, | |
| "grad_norm": 0.4702519476413727, | |
| "learning_rate": 1.1885321214228065e-05, | |
| "loss": 0.285460376739502, | |
| "mean_token_accuracy": 0.91060761064291, | |
| "num_tokens": 38373564.0, | |
| "step": 3030 | |
| }, | |
| { | |
| "entropy": 0.2642333984375, | |
| "epoch": 2.290936498963633, | |
| "grad_norm": 0.415840744972229, | |
| "learning_rate": 1.1837354033451e-05, | |
| "loss": 0.26558847427368165, | |
| "mean_token_accuracy": 0.9156399607658386, | |
| "num_tokens": 38498699.0, | |
| "step": 3040 | |
| }, | |
| { | |
| "entropy": 0.27161865234375, | |
| "epoch": 2.2984737139626907, | |
| "grad_norm": 0.42131829261779785, | |
| "learning_rate": 1.178934306068933e-05, | |
| "loss": 0.27293484210968016, | |
| "mean_token_accuracy": 0.9125606477260589, | |
| "num_tokens": 38628016.0, | |
| "step": 3050 | |
| }, | |
| { | |
| "entropy": 0.2598876953125, | |
| "epoch": 2.3060109289617485, | |
| "grad_norm": 0.4538854658603668, | |
| "learning_rate": 1.1741289440249342e-05, | |
| "loss": 0.26241345405578614, | |
| "mean_token_accuracy": 0.9170191511511803, | |
| "num_tokens": 38754104.0, | |
| "step": 3060 | |
| }, | |
| { | |
| "epoch": 2.3060109289617485, | |
| "eval_entropy": 0.26989010730421686, | |
| "eval_loss": 0.3018670380115509, | |
| "eval_mean_token_accuracy": 0.9079400467046772, | |
| "eval_num_tokens": 38754104.0, | |
| "eval_runtime": 445.3089, | |
| "eval_samples_per_second": 5.958, | |
| "eval_steps_per_second": 1.491, | |
| "step": 3060 | |
| }, | |
| { | |
| "entropy": 0.2600341796875, | |
| "epoch": 2.3135481439608063, | |
| "grad_norm": 0.42576491832733154, | |
| "learning_rate": 1.1693194317453809e-05, | |
| "loss": 0.2762170314788818, | |
| "mean_token_accuracy": 0.9149327039718628, | |
| "num_tokens": 38887576.0, | |
| "step": 3070 | |
| }, | |
| { | |
| "entropy": 0.2461669921875, | |
| "epoch": 2.3210853589598646, | |
| "grad_norm": 0.36997467279434204, | |
| "learning_rate": 1.1645058838614676e-05, | |
| "loss": 0.2484156608581543, | |
| "mean_token_accuracy": 0.9216334640979766, | |
| "num_tokens": 39020182.0, | |
| "step": 3080 | |
| }, | |
| { | |
| "entropy": 0.26444091796875, | |
| "epoch": 2.3286225739589224, | |
| "grad_norm": 0.4386986792087555, | |
| "learning_rate": 1.1596884151005743e-05, | |
| "loss": 0.2760676383972168, | |
| "mean_token_accuracy": 0.9157780781388283, | |
| "num_tokens": 39141193.0, | |
| "step": 3090 | |
| }, | |
| { | |
| "entropy": 0.2866455078125, | |
| "epoch": 2.33615978895798, | |
| "grad_norm": 0.42354196310043335, | |
| "learning_rate": 1.1548671402835325e-05, | |
| "loss": 0.29737937450408936, | |
| "mean_token_accuracy": 0.9101170405745507, | |
| "num_tokens": 39269837.0, | |
| "step": 3100 | |
| }, | |
| { | |
| "entropy": 0.2653564453125, | |
| "epoch": 2.343697003957038, | |
| "grad_norm": 0.4202589690685272, | |
| "learning_rate": 1.1500421743218885e-05, | |
| "loss": 0.27224156856536863, | |
| "mean_token_accuracy": 0.9151485860347748, | |
| "num_tokens": 39397814.0, | |
| "step": 3110 | |
| }, | |
| { | |
| "entropy": 0.2645751953125, | |
| "epoch": 2.3512342189560957, | |
| "grad_norm": 0.4046901762485504, | |
| "learning_rate": 1.145213632215164e-05, | |
| "loss": 0.2657832384109497, | |
| "mean_token_accuracy": 0.9154883936047554, | |
| "num_tokens": 39524638.0, | |
| "step": 3120 | |
| }, | |
| { | |
| "entropy": 0.2693115234375, | |
| "epoch": 2.3587714339551535, | |
| "grad_norm": 0.44271120429039, | |
| "learning_rate": 1.1403816290481148e-05, | |
| "loss": 0.2753964185714722, | |
| "mean_token_accuracy": 0.9133884340524674, | |
| "num_tokens": 39661551.0, | |
| "step": 3130 | |
| }, | |
| { | |
| "entropy": 0.2556884765625, | |
| "epoch": 2.3663086489542113, | |
| "grad_norm": 0.4109664261341095, | |
| "learning_rate": 1.1355462799879903e-05, | |
| "loss": 0.25953586101531984, | |
| "mean_token_accuracy": 0.9173814952373505, | |
| "num_tokens": 39776450.0, | |
| "step": 3140 | |
| }, | |
| { | |
| "entropy": 0.2528076171875, | |
| "epoch": 2.373845863953269, | |
| "grad_norm": 0.4666280150413513, | |
| "learning_rate": 1.1307077002817853e-05, | |
| "loss": 0.26098630428314207, | |
| "mean_token_accuracy": 0.9175211057066918, | |
| "num_tokens": 39903858.0, | |
| "step": 3150 | |
| }, | |
| { | |
| "entropy": 0.2533935546875, | |
| "epoch": 2.381383078952327, | |
| "grad_norm": 0.43249785900115967, | |
| "learning_rate": 1.125866005253495e-05, | |
| "loss": 0.2545808792114258, | |
| "mean_token_accuracy": 0.9177893921732903, | |
| "num_tokens": 40039159.0, | |
| "step": 3160 | |
| }, | |
| { | |
| "entropy": 0.273388671875, | |
| "epoch": 2.3889202939513847, | |
| "grad_norm": 0.4109291136264801, | |
| "learning_rate": 1.1210213103013666e-05, | |
| "loss": 0.2860630750656128, | |
| "mean_token_accuracy": 0.9107137665152549, | |
| "num_tokens": 40163427.0, | |
| "step": 3170 | |
| }, | |
| { | |
| "entropy": 0.2639892578125, | |
| "epoch": 2.396457508950443, | |
| "grad_norm": 0.498600572347641, | |
| "learning_rate": 1.1161737308951473e-05, | |
| "loss": 0.27160656452178955, | |
| "mean_token_accuracy": 0.9145796820521355, | |
| "num_tokens": 40290261.0, | |
| "step": 3180 | |
| }, | |
| { | |
| "entropy": 0.27569580078125, | |
| "epoch": 2.4039947239495008, | |
| "grad_norm": 0.459117591381073, | |
| "learning_rate": 1.1113233825733342e-05, | |
| "loss": 0.27838788032531736, | |
| "mean_token_accuracy": 0.9126795575022697, | |
| "num_tokens": 40419601.0, | |
| "step": 3190 | |
| }, | |
| { | |
| "entropy": 0.2720947265625, | |
| "epoch": 2.4115319389485586, | |
| "grad_norm": 0.4818122982978821, | |
| "learning_rate": 1.1064703809404185e-05, | |
| "loss": 0.28298871517181395, | |
| "mean_token_accuracy": 0.9107334464788437, | |
| "num_tokens": 40534638.0, | |
| "step": 3200 | |
| }, | |
| { | |
| "entropy": 0.293701171875, | |
| "epoch": 2.4190691539476163, | |
| "grad_norm": 0.40891212224960327, | |
| "learning_rate": 1.1016148416641321e-05, | |
| "loss": 0.3044193983078003, | |
| "mean_token_accuracy": 0.9071599930524826, | |
| "num_tokens": 40663606.0, | |
| "step": 3210 | |
| }, | |
| { | |
| "entropy": 0.2436767578125, | |
| "epoch": 2.426606368946674, | |
| "grad_norm": 0.4774790406227112, | |
| "learning_rate": 1.096756880472689e-05, | |
| "loss": 0.24657707214355468, | |
| "mean_token_accuracy": 0.9199987560510635, | |
| "num_tokens": 40781780.0, | |
| "step": 3220 | |
| }, | |
| { | |
| "entropy": 0.27978515625, | |
| "epoch": 2.434143583945732, | |
| "grad_norm": 0.4053128957748413, | |
| "learning_rate": 1.0918966131520276e-05, | |
| "loss": 0.2862666606903076, | |
| "mean_token_accuracy": 0.9118180349469185, | |
| "num_tokens": 40916833.0, | |
| "step": 3230 | |
| }, | |
| { | |
| "epoch": 2.434143583945732, | |
| "eval_entropy": 0.2733654343938253, | |
| "eval_loss": 0.30075809359550476, | |
| "eval_mean_token_accuracy": 0.9080868976482426, | |
| "eval_num_tokens": 40916833.0, | |
| "eval_runtime": 445.2814, | |
| "eval_samples_per_second": 5.958, | |
| "eval_steps_per_second": 1.491, | |
| "step": 3230 | |
| }, | |
| { | |
| "entropy": 0.268994140625, | |
| "epoch": 2.4416807989447897, | |
| "grad_norm": 0.4496704936027527, | |
| "learning_rate": 1.0870341555430524e-05, | |
| "loss": 0.27509455680847167, | |
| "mean_token_accuracy": 0.9132101371884346, | |
| "num_tokens": 41037216.0, | |
| "step": 3240 | |
| }, | |
| { | |
| "entropy": 0.265087890625, | |
| "epoch": 2.449218013943848, | |
| "grad_norm": 0.45039892196655273, | |
| "learning_rate": 1.0821696235388704e-05, | |
| "loss": 0.2819454908370972, | |
| "mean_token_accuracy": 0.9132270663976669, | |
| "num_tokens": 41158606.0, | |
| "step": 3250 | |
| }, | |
| { | |
| "entropy": 0.2676513671875, | |
| "epoch": 2.4567552289429058, | |
| "grad_norm": 0.4146597385406494, | |
| "learning_rate": 1.0773031330820313e-05, | |
| "loss": 0.26915433406829836, | |
| "mean_token_accuracy": 0.915351215004921, | |
| "num_tokens": 41279915.0, | |
| "step": 3260 | |
| }, | |
| { | |
| "entropy": 0.282275390625, | |
| "epoch": 2.4642924439419636, | |
| "grad_norm": 0.3807780146598816, | |
| "learning_rate": 1.0724348001617626e-05, | |
| "loss": 0.29516355991363524, | |
| "mean_token_accuracy": 0.910530948638916, | |
| "num_tokens": 41417857.0, | |
| "step": 3270 | |
| }, | |
| { | |
| "entropy": 0.270166015625, | |
| "epoch": 2.4718296589410214, | |
| "grad_norm": 0.4073243737220764, | |
| "learning_rate": 1.0675647408112055e-05, | |
| "loss": 0.27692787647247313, | |
| "mean_token_accuracy": 0.9140403926372528, | |
| "num_tokens": 41543296.0, | |
| "step": 3280 | |
| }, | |
| { | |
| "entropy": 0.2533935546875, | |
| "epoch": 2.479366873940079, | |
| "grad_norm": 0.4855513572692871, | |
| "learning_rate": 1.0626930711046499e-05, | |
| "loss": 0.26345822811126707, | |
| "mean_token_accuracy": 0.9178490027785301, | |
| "num_tokens": 41665526.0, | |
| "step": 3290 | |
| }, | |
| { | |
| "entropy": 0.2848876953125, | |
| "epoch": 2.486904088939137, | |
| "grad_norm": 0.40497887134552, | |
| "learning_rate": 1.0578199071547666e-05, | |
| "loss": 0.2959612846374512, | |
| "mean_token_accuracy": 0.9122223347425461, | |
| "num_tokens": 41798895.0, | |
| "step": 3300 | |
| }, | |
| { | |
| "entropy": 0.2606201171875, | |
| "epoch": 2.4944413039381947, | |
| "grad_norm": 0.4320884644985199, | |
| "learning_rate": 1.0529453651098414e-05, | |
| "loss": 0.2592708826065063, | |
| "mean_token_accuracy": 0.9175490200519562, | |
| "num_tokens": 41924273.0, | |
| "step": 3310 | |
| }, | |
| { | |
| "entropy": 0.25693359375, | |
| "epoch": 2.5019785189372525, | |
| "grad_norm": 0.4300364851951599, | |
| "learning_rate": 1.0480695611510052e-05, | |
| "loss": 0.2722728967666626, | |
| "mean_token_accuracy": 0.9149225175380706, | |
| "num_tokens": 42050422.0, | |
| "step": 3320 | |
| }, | |
| { | |
| "entropy": 0.2692626953125, | |
| "epoch": 2.5095157339363103, | |
| "grad_norm": 0.381966233253479, | |
| "learning_rate": 1.0431926114894666e-05, | |
| "loss": 0.2769562482833862, | |
| "mean_token_accuracy": 0.9167289510369301, | |
| "num_tokens": 42182717.0, | |
| "step": 3330 | |
| }, | |
| { | |
| "entropy": 0.2641357421875, | |
| "epoch": 2.517052948935368, | |
| "grad_norm": 0.4619712233543396, | |
| "learning_rate": 1.0383146323637403e-05, | |
| "loss": 0.2671494007110596, | |
| "mean_token_accuracy": 0.9168986156582832, | |
| "num_tokens": 42309826.0, | |
| "step": 3340 | |
| }, | |
| { | |
| "entropy": 0.2777099609375, | |
| "epoch": 2.5245901639344264, | |
| "grad_norm": 0.45539072155952454, | |
| "learning_rate": 1.0334357400368777e-05, | |
| "loss": 0.2854647159576416, | |
| "mean_token_accuracy": 0.9126088574528695, | |
| "num_tokens": 42433368.0, | |
| "step": 3350 | |
| }, | |
| { | |
| "entropy": 0.26806640625, | |
| "epoch": 2.532127378933484, | |
| "grad_norm": 0.4394124448299408, | |
| "learning_rate": 1.0285560507936962e-05, | |
| "loss": 0.2735744953155518, | |
| "mean_token_accuracy": 0.9150983482599259, | |
| "num_tokens": 42554101.0, | |
| "step": 3360 | |
| }, | |
| { | |
| "entropy": 0.2348876953125, | |
| "epoch": 2.539664593932542, | |
| "grad_norm": 0.47088930010795593, | |
| "learning_rate": 1.023675680938007e-05, | |
| "loss": 0.24447669982910156, | |
| "mean_token_accuracy": 0.9219925120472908, | |
| "num_tokens": 42677888.0, | |
| "step": 3370 | |
| }, | |
| { | |
| "entropy": 0.2652587890625, | |
| "epoch": 2.5472018089315998, | |
| "grad_norm": 0.4078092873096466, | |
| "learning_rate": 1.0187947467898425e-05, | |
| "loss": 0.2711235284805298, | |
| "mean_token_accuracy": 0.916148230433464, | |
| "num_tokens": 42810838.0, | |
| "step": 3380 | |
| }, | |
| { | |
| "entropy": 0.27083740234375, | |
| "epoch": 2.5547390239306575, | |
| "grad_norm": 0.3476676344871521, | |
| "learning_rate": 1.0139133646826854e-05, | |
| "loss": 0.27367372512817384, | |
| "mean_token_accuracy": 0.914184220135212, | |
| "num_tokens": 42940004.0, | |
| "step": 3390 | |
| }, | |
| { | |
| "entropy": 0.2453125, | |
| "epoch": 2.5622762389297153, | |
| "grad_norm": 0.42558515071868896, | |
| "learning_rate": 1.0090316509606945e-05, | |
| "loss": 0.254138708114624, | |
| "mean_token_accuracy": 0.9195643991231919, | |
| "num_tokens": 43069099.0, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 2.5622762389297153, | |
| "eval_entropy": 0.2698195124246988, | |
| "eval_loss": 0.2993011474609375, | |
| "eval_mean_token_accuracy": 0.9087990870676845, | |
| "eval_num_tokens": 43069099.0, | |
| "eval_runtime": 443.9843, | |
| "eval_samples_per_second": 5.975, | |
| "eval_steps_per_second": 1.496, | |
| "step": 3400 | |
| }, | |
| { | |
| "entropy": 0.2767333984375, | |
| "epoch": 2.5698134539287736, | |
| "grad_norm": 0.45832180976867676, | |
| "learning_rate": 1.0041497219759333e-05, | |
| "loss": 0.29227685928344727, | |
| "mean_token_accuracy": 0.9110212385654449, | |
| "num_tokens": 43193208.0, | |
| "step": 3410 | |
| }, | |
| { | |
| "entropy": 0.2489013671875, | |
| "epoch": 2.5773506689278314, | |
| "grad_norm": 0.4983760416507721, | |
| "learning_rate": 9.99267694085595e-06, | |
| "loss": 0.2483989715576172, | |
| "mean_token_accuracy": 0.9187382385134697, | |
| "num_tokens": 43317014.0, | |
| "step": 3420 | |
| }, | |
| { | |
| "entropy": 0.26158447265625, | |
| "epoch": 2.584887883926889, | |
| "grad_norm": 0.45462238788604736, | |
| "learning_rate": 9.943856836492301e-06, | |
| "loss": 0.2670482397079468, | |
| "mean_token_accuracy": 0.9153082132339477, | |
| "num_tokens": 43449515.0, | |
| "step": 3430 | |
| }, | |
| { | |
| "entropy": 0.2579345703125, | |
| "epoch": 2.592425098925947, | |
| "grad_norm": 0.46467944979667664, | |
| "learning_rate": 9.895038070259746e-06, | |
| "loss": 0.2636100769042969, | |
| "mean_token_accuracy": 0.9178228959441185, | |
| "num_tokens": 43567089.0, | |
| "step": 3440 | |
| }, | |
| { | |
| "entropy": 0.27763671875, | |
| "epoch": 2.5999623139250048, | |
| "grad_norm": 0.41027960181236267, | |
| "learning_rate": 9.846221805717734e-06, | |
| "loss": 0.2852740526199341, | |
| "mean_token_accuracy": 0.9120066031813622, | |
| "num_tokens": 43703492.0, | |
| "step": 3450 | |
| }, | |
| { | |
| "entropy": 0.253173828125, | |
| "epoch": 2.6074995289240626, | |
| "grad_norm": 0.4736091196537018, | |
| "learning_rate": 9.797409206366095e-06, | |
| "loss": 0.26119682788848875, | |
| "mean_token_accuracy": 0.9169812351465225, | |
| "num_tokens": 43820194.0, | |
| "step": 3460 | |
| }, | |
| { | |
| "entropy": 0.275732421875, | |
| "epoch": 2.6150367439231204, | |
| "grad_norm": 0.40017107129096985, | |
| "learning_rate": 9.748601435617303e-06, | |
| "loss": 0.27841379642486574, | |
| "mean_token_accuracy": 0.9130286037921905, | |
| "num_tokens": 43947103.0, | |
| "step": 3470 | |
| }, | |
| { | |
| "entropy": 0.2679931640625, | |
| "epoch": 2.622573958922178, | |
| "grad_norm": 0.4032149910926819, | |
| "learning_rate": 9.699799656768745e-06, | |
| "loss": 0.28026058673858645, | |
| "mean_token_accuracy": 0.9144454896450043, | |
| "num_tokens": 44075924.0, | |
| "step": 3480 | |
| }, | |
| { | |
| "entropy": 0.2673828125, | |
| "epoch": 2.630111173921236, | |
| "grad_norm": 0.46909603476524353, | |
| "learning_rate": 9.651005032974994e-06, | |
| "loss": 0.28631269931793213, | |
| "mean_token_accuracy": 0.9125849813222885, | |
| "num_tokens": 44203855.0, | |
| "step": 3490 | |
| }, | |
| { | |
| "entropy": 0.2550537109375, | |
| "epoch": 2.6376483889202937, | |
| "grad_norm": 0.4014464020729065, | |
| "learning_rate": 9.602218727220088e-06, | |
| "loss": 0.2603114128112793, | |
| "mean_token_accuracy": 0.9170651033520698, | |
| "num_tokens": 44329352.0, | |
| "step": 3500 | |
| }, | |
| { | |
| "entropy": 0.2544677734375, | |
| "epoch": 2.6451856039193515, | |
| "grad_norm": 0.4324460029602051, | |
| "learning_rate": 9.553441902289807e-06, | |
| "loss": 0.25681219100952146, | |
| "mean_token_accuracy": 0.9173885345458984, | |
| "num_tokens": 44459299.0, | |
| "step": 3510 | |
| }, | |
| { | |
| "entropy": 0.2712646484375, | |
| "epoch": 2.6527228189184098, | |
| "grad_norm": 0.429166316986084, | |
| "learning_rate": 9.504675720743976e-06, | |
| "loss": 0.2794325590133667, | |
| "mean_token_accuracy": 0.9118164703249931, | |
| "num_tokens": 44589157.0, | |
| "step": 3520 | |
| }, | |
| { | |
| "entropy": 0.2759033203125, | |
| "epoch": 2.6602600339174676, | |
| "grad_norm": 0.4505804777145386, | |
| "learning_rate": 9.45592134488873e-06, | |
| "loss": 0.2813832759857178, | |
| "mean_token_accuracy": 0.9124478429555893, | |
| "num_tokens": 44720112.0, | |
| "step": 3530 | |
| }, | |
| { | |
| "entropy": 0.271630859375, | |
| "epoch": 2.6677972489165254, | |
| "grad_norm": 0.4533892571926117, | |
| "learning_rate": 9.407179936748827e-06, | |
| "loss": 0.28013317584991454, | |
| "mean_token_accuracy": 0.9141771763563156, | |
| "num_tokens": 44849682.0, | |
| "step": 3540 | |
| }, | |
| { | |
| "entropy": 0.2718505859375, | |
| "epoch": 2.675334463915583, | |
| "grad_norm": 0.4437422752380371, | |
| "learning_rate": 9.358452658039946e-06, | |
| "loss": 0.28716139793395995, | |
| "mean_token_accuracy": 0.9127397000789642, | |
| "num_tokens": 44977692.0, | |
| "step": 3550 | |
| }, | |
| { | |
| "entropy": 0.2603515625, | |
| "epoch": 2.682871678914641, | |
| "grad_norm": 0.41409823298454285, | |
| "learning_rate": 9.30974067014101e-06, | |
| "loss": 0.2669771432876587, | |
| "mean_token_accuracy": 0.9178864300251007, | |
| "num_tokens": 45110149.0, | |
| "step": 3560 | |
| }, | |
| { | |
| "entropy": 0.2744873046875, | |
| "epoch": 2.6904088939136988, | |
| "grad_norm": 0.4747328460216522, | |
| "learning_rate": 9.261045134066487e-06, | |
| "loss": 0.28503587245941164, | |
| "mean_token_accuracy": 0.9122420877218247, | |
| "num_tokens": 45241772.0, | |
| "step": 3570 | |
| }, | |
| { | |
| "epoch": 2.6904088939136988, | |
| "eval_entropy": 0.2725241787462349, | |
| "eval_loss": 0.29796838760375977, | |
| "eval_mean_token_accuracy": 0.9088380316115288, | |
| "eval_num_tokens": 45241772.0, | |
| "eval_runtime": 443.9422, | |
| "eval_samples_per_second": 5.976, | |
| "eval_steps_per_second": 1.496, | |
| "step": 3570 | |
| }, | |
| { | |
| "entropy": 0.268896484375, | |
| "epoch": 2.697946108912757, | |
| "grad_norm": 0.42475807666778564, | |
| "learning_rate": 9.212367210438735e-06, | |
| "loss": 0.2734686374664307, | |
| "mean_token_accuracy": 0.9146973386406898, | |
| "num_tokens": 45373873.0, | |
| "step": 3580 | |
| }, | |
| { | |
| "entropy": 0.24866943359375, | |
| "epoch": 2.705483323911815, | |
| "grad_norm": 0.4935104250907898, | |
| "learning_rate": 9.16370805946033e-06, | |
| "loss": 0.2566777944564819, | |
| "mean_token_accuracy": 0.918173971772194, | |
| "num_tokens": 45503108.0, | |
| "step": 3590 | |
| }, | |
| { | |
| "entropy": 0.26513671875, | |
| "epoch": 2.7130205389108726, | |
| "grad_norm": 0.32801884412765503, | |
| "learning_rate": 9.115068840886418e-06, | |
| "loss": 0.2722788333892822, | |
| "mean_token_accuracy": 0.9168035730719566, | |
| "num_tokens": 45640842.0, | |
| "step": 3600 | |
| }, | |
| { | |
| "entropy": 0.264794921875, | |
| "epoch": 2.7205577539099304, | |
| "grad_norm": 0.4599117636680603, | |
| "learning_rate": 9.066450713997062e-06, | |
| "loss": 0.276505184173584, | |
| "mean_token_accuracy": 0.9149751618504525, | |
| "num_tokens": 45769433.0, | |
| "step": 3610 | |
| }, | |
| { | |
| "entropy": 0.2660400390625, | |
| "epoch": 2.728094968908988, | |
| "grad_norm": 0.46812763810157776, | |
| "learning_rate": 9.017854837569629e-06, | |
| "loss": 0.27300546169281004, | |
| "mean_token_accuracy": 0.9130877435207367, | |
| "num_tokens": 45880560.0, | |
| "step": 3620 | |
| }, | |
| { | |
| "entropy": 0.2379638671875, | |
| "epoch": 2.735632183908046, | |
| "grad_norm": 0.5042068958282471, | |
| "learning_rate": 8.969282369851163e-06, | |
| "loss": 0.24074835777282716, | |
| "mean_token_accuracy": 0.921598632633686, | |
| "num_tokens": 45993797.0, | |
| "step": 3630 | |
| }, | |
| { | |
| "entropy": 0.2520263671875, | |
| "epoch": 2.7431693989071038, | |
| "grad_norm": 0.48145022988319397, | |
| "learning_rate": 8.920734468530773e-06, | |
| "loss": 0.2605001211166382, | |
| "mean_token_accuracy": 0.918573509156704, | |
| "num_tokens": 46112002.0, | |
| "step": 3640 | |
| }, | |
| { | |
| "entropy": 0.25791015625, | |
| "epoch": 2.7507066139061616, | |
| "grad_norm": 0.3994383215904236, | |
| "learning_rate": 8.872212290712047e-06, | |
| "loss": 0.2658211708068848, | |
| "mean_token_accuracy": 0.9159253165125847, | |
| "num_tokens": 46240729.0, | |
| "step": 3650 | |
| }, | |
| { | |
| "entropy": 0.271435546875, | |
| "epoch": 2.7582438289052194, | |
| "grad_norm": 0.39268237352371216, | |
| "learning_rate": 8.823716992885475e-06, | |
| "loss": 0.2839186191558838, | |
| "mean_token_accuracy": 0.9141981810331344, | |
| "num_tokens": 46368015.0, | |
| "step": 3660 | |
| }, | |
| { | |
| "entropy": 0.2667236328125, | |
| "epoch": 2.765781043904277, | |
| "grad_norm": 0.39958369731903076, | |
| "learning_rate": 8.77524973090088e-06, | |
| "loss": 0.27642645835876467, | |
| "mean_token_accuracy": 0.9151778295636177, | |
| "num_tokens": 46515273.0, | |
| "step": 3670 | |
| }, | |
| { | |
| "entropy": 0.29097900390625, | |
| "epoch": 2.773318258903335, | |
| "grad_norm": 0.42510679364204407, | |
| "learning_rate": 8.726811659939877e-06, | |
| "loss": 0.29592735767364503, | |
| "mean_token_accuracy": 0.9093442618846893, | |
| "num_tokens": 46639287.0, | |
| "step": 3680 | |
| }, | |
| { | |
| "entropy": 0.271142578125, | |
| "epoch": 2.780855473902393, | |
| "grad_norm": 0.41649726033210754, | |
| "learning_rate": 8.678403934488325e-06, | |
| "loss": 0.27806544303894043, | |
| "mean_token_accuracy": 0.914185406267643, | |
| "num_tokens": 46755940.0, | |
| "step": 3690 | |
| }, | |
| { | |
| "entropy": 0.2638916015625, | |
| "epoch": 2.788392688901451, | |
| "grad_norm": 0.42742252349853516, | |
| "learning_rate": 8.630027708308826e-06, | |
| "loss": 0.2767770290374756, | |
| "mean_token_accuracy": 0.9134870544075966, | |
| "num_tokens": 46889885.0, | |
| "step": 3700 | |
| }, | |
| { | |
| "entropy": 0.2822509765625, | |
| "epoch": 2.7959299039005088, | |
| "grad_norm": 0.3878902792930603, | |
| "learning_rate": 8.581684134413216e-06, | |
| "loss": 0.27821874618530273, | |
| "mean_token_accuracy": 0.9127815574407577, | |
| "num_tokens": 47019960.0, | |
| "step": 3710 | |
| }, | |
| { | |
| "entropy": 0.272314453125, | |
| "epoch": 2.8034671188995666, | |
| "grad_norm": 0.373980849981308, | |
| "learning_rate": 8.533374365035089e-06, | |
| "loss": 0.28022453784942625, | |
| "mean_token_accuracy": 0.9120476201176644, | |
| "num_tokens": 47153538.0, | |
| "step": 3720 | |
| }, | |
| { | |
| "entropy": 0.2423095703125, | |
| "epoch": 2.8110043338986244, | |
| "grad_norm": 0.3966856300830841, | |
| "learning_rate": 8.485099551602341e-06, | |
| "loss": 0.24279303550720216, | |
| "mean_token_accuracy": 0.9210615813732147, | |
| "num_tokens": 47278367.0, | |
| "step": 3730 | |
| }, | |
| { | |
| "entropy": 0.253173828125, | |
| "epoch": 2.818541548897682, | |
| "grad_norm": 0.424553781747818, | |
| "learning_rate": 8.436860844709708e-06, | |
| "loss": 0.2533012866973877, | |
| "mean_token_accuracy": 0.9188416093587876, | |
| "num_tokens": 47401970.0, | |
| "step": 3740 | |
| }, | |
| { | |
| "epoch": 2.818541548897682, | |
| "eval_entropy": 0.2633541980421687, | |
| "eval_loss": 0.2967968285083771, | |
| "eval_mean_token_accuracy": 0.9093607121023787, | |
| "eval_num_tokens": 47401970.0, | |
| "eval_runtime": 444.0882, | |
| "eval_samples_per_second": 5.974, | |
| "eval_steps_per_second": 1.495, | |
| "step": 3740 | |
| }, | |
| { | |
| "entropy": 0.2485107421875, | |
| "epoch": 2.8260787638967404, | |
| "grad_norm": 0.4144607186317444, | |
| "learning_rate": 8.388659394091362e-06, | |
| "loss": 0.256608772277832, | |
| "mean_token_accuracy": 0.9184371501207351, | |
| "num_tokens": 47536067.0, | |
| "step": 3750 | |
| }, | |
| { | |
| "entropy": 0.2462890625, | |
| "epoch": 2.833615978895798, | |
| "grad_norm": 0.4533601701259613, | |
| "learning_rate": 8.340496348593485e-06, | |
| "loss": 0.25168781280517577, | |
| "mean_token_accuracy": 0.919621941447258, | |
| "num_tokens": 47659072.0, | |
| "step": 3760 | |
| }, | |
| { | |
| "entropy": 0.242138671875, | |
| "epoch": 2.841153193894856, | |
| "grad_norm": 0.4203242063522339, | |
| "learning_rate": 8.292372856146919e-06, | |
| "loss": 0.2485339403152466, | |
| "mean_token_accuracy": 0.9196742460131645, | |
| "num_tokens": 47785829.0, | |
| "step": 3770 | |
| }, | |
| { | |
| "entropy": 0.2552490234375, | |
| "epoch": 2.848690408893914, | |
| "grad_norm": 0.3394729793071747, | |
| "learning_rate": 8.244290063739776e-06, | |
| "loss": 0.25977215766906736, | |
| "mean_token_accuracy": 0.9153026059269905, | |
| "num_tokens": 47913628.0, | |
| "step": 3780 | |
| }, | |
| { | |
| "entropy": 0.27724609375, | |
| "epoch": 2.8562276238929716, | |
| "grad_norm": 0.4583624303340912, | |
| "learning_rate": 8.196249117390112e-06, | |
| "loss": 0.2713502883911133, | |
| "mean_token_accuracy": 0.913399763405323, | |
| "num_tokens": 48040647.0, | |
| "step": 3790 | |
| }, | |
| { | |
| "entropy": 0.25810546875, | |
| "epoch": 2.8637648388920294, | |
| "grad_norm": 0.40007394552230835, | |
| "learning_rate": 8.148251162118625e-06, | |
| "loss": 0.26303553581237793, | |
| "mean_token_accuracy": 0.9153849989175796, | |
| "num_tokens": 48170847.0, | |
| "step": 3800 | |
| }, | |
| { | |
| "entropy": 0.2434814453125, | |
| "epoch": 2.871302053891087, | |
| "grad_norm": 0.3815859258174896, | |
| "learning_rate": 8.100297341921342e-06, | |
| "loss": 0.2506600856781006, | |
| "mean_token_accuracy": 0.9199610412120819, | |
| "num_tokens": 48290214.0, | |
| "step": 3810 | |
| }, | |
| { | |
| "entropy": 0.2513671875, | |
| "epoch": 2.878839268890145, | |
| "grad_norm": 0.38468119502067566, | |
| "learning_rate": 8.05238879974236e-06, | |
| "loss": 0.2547659635543823, | |
| "mean_token_accuracy": 0.9180278465151787, | |
| "num_tokens": 48414986.0, | |
| "step": 3820 | |
| }, | |
| { | |
| "entropy": 0.2574951171875, | |
| "epoch": 2.8863764838892028, | |
| "grad_norm": 0.48956918716430664, | |
| "learning_rate": 8.00452667744662e-06, | |
| "loss": 0.2638235092163086, | |
| "mean_token_accuracy": 0.9166240409016609, | |
| "num_tokens": 48531392.0, | |
| "step": 3830 | |
| }, | |
| { | |
| "entropy": 0.267822265625, | |
| "epoch": 2.8939136988882606, | |
| "grad_norm": 0.5001468658447266, | |
| "learning_rate": 7.956712115792666e-06, | |
| "loss": 0.2735679388046265, | |
| "mean_token_accuracy": 0.9156135901808738, | |
| "num_tokens": 48664784.0, | |
| "step": 3840 | |
| }, | |
| { | |
| "entropy": 0.2489990234375, | |
| "epoch": 2.901450913887319, | |
| "grad_norm": 0.46188080310821533, | |
| "learning_rate": 7.908946254405477e-06, | |
| "loss": 0.2521179676055908, | |
| "mean_token_accuracy": 0.9186730876564979, | |
| "num_tokens": 48786675.0, | |
| "step": 3850 | |
| }, | |
| { | |
| "entropy": 0.2811767578125, | |
| "epoch": 2.9089881288863766, | |
| "grad_norm": 0.3843408226966858, | |
| "learning_rate": 7.86123023174929e-06, | |
| "loss": 0.28948609828948973, | |
| "mean_token_accuracy": 0.911932322382927, | |
| "num_tokens": 48926071.0, | |
| "step": 3860 | |
| }, | |
| { | |
| "entropy": 0.270263671875, | |
| "epoch": 2.9165253438854344, | |
| "grad_norm": 0.3932430148124695, | |
| "learning_rate": 7.813565185100487e-06, | |
| "loss": 0.2777218818664551, | |
| "mean_token_accuracy": 0.9139480367302895, | |
| "num_tokens": 49059803.0, | |
| "step": 3870 | |
| }, | |
| { | |
| "entropy": 0.243212890625, | |
| "epoch": 2.924062558884492, | |
| "grad_norm": 0.48365503549575806, | |
| "learning_rate": 7.765952250520459e-06, | |
| "loss": 0.24481496810913086, | |
| "mean_token_accuracy": 0.9214571461081504, | |
| "num_tokens": 49188445.0, | |
| "step": 3880 | |
| }, | |
| { | |
| "entropy": 0.239501953125, | |
| "epoch": 2.93159977388355, | |
| "grad_norm": 0.37279045581817627, | |
| "learning_rate": 7.71839256282855e-06, | |
| "loss": 0.24772932529449462, | |
| "mean_token_accuracy": 0.9205403715372086, | |
| "num_tokens": 49317486.0, | |
| "step": 3890 | |
| }, | |
| { | |
| "entropy": 0.2743408203125, | |
| "epoch": 2.9391369888826078, | |
| "grad_norm": 0.4030146598815918, | |
| "learning_rate": 7.670887255575003e-06, | |
| "loss": 0.2839582204818726, | |
| "mean_token_accuracy": 0.9123036295175553, | |
| "num_tokens": 49455758.0, | |
| "step": 3900 | |
| }, | |
| { | |
| "entropy": 0.243994140625, | |
| "epoch": 2.9466742038816656, | |
| "grad_norm": 0.37864017486572266, | |
| "learning_rate": 7.623437461013941e-06, | |
| "loss": 0.24827678203582765, | |
| "mean_token_accuracy": 0.9205136641860008, | |
| "num_tokens": 49582414.0, | |
| "step": 3910 | |
| }, | |
| { | |
| "epoch": 2.9466742038816656, | |
| "eval_entropy": 0.26600003529743976, | |
| "eval_loss": 0.29588836431503296, | |
| "eval_mean_token_accuracy": 0.909692998032972, | |
| "eval_num_tokens": 49582414.0, | |
| "eval_runtime": 444.4984, | |
| "eval_samples_per_second": 5.969, | |
| "eval_steps_per_second": 1.494, | |
| "step": 3910 | |
| }, | |
| { | |
| "entropy": 0.23487548828125, | |
| "epoch": 2.954211418880724, | |
| "grad_norm": 0.4359188675880432, | |
| "learning_rate": 7.576044310076388e-06, | |
| "loss": 0.23804020881652832, | |
| "mean_token_accuracy": 0.9226861000061035, | |
| "num_tokens": 49706454.0, | |
| "step": 3920 | |
| }, | |
| { | |
| "entropy": 0.2821044921875, | |
| "epoch": 2.9617486338797816, | |
| "grad_norm": 0.4656037390232086, | |
| "learning_rate": 7.5287089323433035e-06, | |
| "loss": 0.2857757806777954, | |
| "mean_token_accuracy": 0.9117534056305885, | |
| "num_tokens": 49840228.0, | |
| "step": 3930 | |
| }, | |
| { | |
| "entropy": 0.27659912109375, | |
| "epoch": 2.9692858488788394, | |
| "grad_norm": 0.35202714800834656, | |
| "learning_rate": 7.481432456018671e-06, | |
| "loss": 0.2831352949142456, | |
| "mean_token_accuracy": 0.9127496406435966, | |
| "num_tokens": 49973240.0, | |
| "step": 3940 | |
| }, | |
| { | |
| "entropy": 0.2625244140625, | |
| "epoch": 2.976823063877897, | |
| "grad_norm": 0.4686535596847534, | |
| "learning_rate": 7.434216007902598e-06, | |
| "loss": 0.2630059242248535, | |
| "mean_token_accuracy": 0.9144649460911751, | |
| "num_tokens": 50094039.0, | |
| "step": 3950 | |
| }, | |
| { | |
| "entropy": 0.255615234375, | |
| "epoch": 2.984360278876955, | |
| "grad_norm": 0.4569144546985626, | |
| "learning_rate": 7.387060713364462e-06, | |
| "loss": 0.26566917896270753, | |
| "mean_token_accuracy": 0.9165397122502327, | |
| "num_tokens": 50208282.0, | |
| "step": 3960 | |
| }, | |
| { | |
| "entropy": 0.2490234375, | |
| "epoch": 2.991897493876013, | |
| "grad_norm": 0.4426827132701874, | |
| "learning_rate": 7.33996769631609e-06, | |
| "loss": 0.25277419090270997, | |
| "mean_token_accuracy": 0.9186919391155243, | |
| "num_tokens": 50328886.0, | |
| "step": 3970 | |
| }, | |
| { | |
| "entropy": 0.2667724609375, | |
| "epoch": 2.9994347088750706, | |
| "grad_norm": 0.48642250895500183, | |
| "learning_rate": 7.292938079184979e-06, | |
| "loss": 0.2723618745803833, | |
| "mean_token_accuracy": 0.9138344705104828, | |
| "num_tokens": 50454506.0, | |
| "step": 3980 | |
| }, | |
| { | |
| "entropy": 0.2523036858974359, | |
| "epoch": 3.006783493499152, | |
| "grad_norm": 0.48612406849861145, | |
| "learning_rate": 7.2459729828875256e-06, | |
| "loss": 0.25093731880187986, | |
| "mean_token_accuracy": 0.9203954384877131, | |
| "num_tokens": 50563331.0, | |
| "step": 3990 | |
| }, | |
| { | |
| "entropy": 0.2311279296875, | |
| "epoch": 3.01432070849821, | |
| "grad_norm": 0.3902427554130554, | |
| "learning_rate": 7.199073526802322e-06, | |
| "loss": 0.23201241493225097, | |
| "mean_token_accuracy": 0.9242525264620781, | |
| "num_tokens": 50688841.0, | |
| "step": 4000 | |
| }, | |
| { | |
| "entropy": 0.24853515625, | |
| "epoch": 3.021857923497268, | |
| "grad_norm": 0.3865509331226349, | |
| "learning_rate": 7.1522408287434774e-06, | |
| "loss": 0.2584357738494873, | |
| "mean_token_accuracy": 0.9196509182453155, | |
| "num_tokens": 50823608.0, | |
| "step": 4010 | |
| }, | |
| { | |
| "entropy": 0.23577880859375, | |
| "epoch": 3.0293951384963256, | |
| "grad_norm": 0.47226399183273315, | |
| "learning_rate": 7.105476004933973e-06, | |
| "loss": 0.23722119331359864, | |
| "mean_token_accuracy": 0.9245356351137162, | |
| "num_tokens": 50952093.0, | |
| "step": 4020 | |
| }, | |
| { | |
| "entropy": 0.24713134765625, | |
| "epoch": 3.0369323534953834, | |
| "grad_norm": 0.5489491820335388, | |
| "learning_rate": 7.058780169979051e-06, | |
| "loss": 0.25731186866760253, | |
| "mean_token_accuracy": 0.9205514118075371, | |
| "num_tokens": 51078395.0, | |
| "step": 4030 | |
| }, | |
| { | |
| "entropy": 0.2447509765625, | |
| "epoch": 3.044469568494441, | |
| "grad_norm": 0.442008912563324, | |
| "learning_rate": 7.012154436839664e-06, | |
| "loss": 0.250858998298645, | |
| "mean_token_accuracy": 0.9203956529498101, | |
| "num_tokens": 51206927.0, | |
| "step": 4040 | |
| }, | |
| { | |
| "entropy": 0.2478759765625, | |
| "epoch": 3.052006783493499, | |
| "grad_norm": 0.5229147672653198, | |
| "learning_rate": 6.965599916805927e-06, | |
| "loss": 0.2520869731903076, | |
| "mean_token_accuracy": 0.9199037939310074, | |
| "num_tokens": 51323632.0, | |
| "step": 4050 | |
| }, | |
| { | |
| "entropy": 0.2457275390625, | |
| "epoch": 3.059543998492557, | |
| "grad_norm": 0.4642680287361145, | |
| "learning_rate": 6.919117719470655e-06, | |
| "loss": 0.25035810470581055, | |
| "mean_token_accuracy": 0.9208179607987403, | |
| "num_tokens": 51450728.0, | |
| "step": 4060 | |
| }, | |
| { | |
| "entropy": 0.23104248046875, | |
| "epoch": 3.067081213491615, | |
| "grad_norm": 0.46121546626091003, | |
| "learning_rate": 6.872708952702893e-06, | |
| "loss": 0.2347405433654785, | |
| "mean_token_accuracy": 0.9219806760549545, | |
| "num_tokens": 51568454.0, | |
| "step": 4070 | |
| }, | |
| { | |
| "entropy": 0.2685791015625, | |
| "epoch": 3.074618428490673, | |
| "grad_norm": 0.5084824562072754, | |
| "learning_rate": 6.826374722621536e-06, | |
| "loss": 0.27871730327606203, | |
| "mean_token_accuracy": 0.914721603691578, | |
| "num_tokens": 51692485.0, | |
| "step": 4080 | |
| }, | |
| { | |
| "epoch": 3.074618428490673, | |
| "eval_entropy": 0.25480192253388556, | |
| "eval_loss": 0.29853206872940063, | |
| "eval_mean_token_accuracy": 0.9095420700957976, | |
| "eval_num_tokens": 51692485.0, | |
| "eval_runtime": 444.6635, | |
| "eval_samples_per_second": 5.966, | |
| "eval_steps_per_second": 1.493, | |
| "step": 4080 | |
| }, | |
| { | |
| "entropy": 0.257958984375, | |
| "epoch": 3.0821556434897306, | |
| "grad_norm": 0.4730566143989563, | |
| "learning_rate": 6.780116133568943e-06, | |
| "loss": 0.26084840297698975, | |
| "mean_token_accuracy": 0.9181940242648124, | |
| "num_tokens": 51819563.0, | |
| "step": 4090 | |
| }, | |
| { | |
| "entropy": 0.2264892578125, | |
| "epoch": 3.0896928584887884, | |
| "grad_norm": 0.4408583343029022, | |
| "learning_rate": 6.733934288084624e-06, | |
| "loss": 0.22071993350982666, | |
| "mean_token_accuracy": 0.928843292593956, | |
| "num_tokens": 51957836.0, | |
| "step": 4100 | |
| }, | |
| { | |
| "entropy": 0.240869140625, | |
| "epoch": 3.097230073487846, | |
| "grad_norm": 0.41696277260780334, | |
| "learning_rate": 6.687830286878968e-06, | |
| "loss": 0.24481325149536132, | |
| "mean_token_accuracy": 0.9215219706296921, | |
| "num_tokens": 52085471.0, | |
| "step": 4110 | |
| }, | |
| { | |
| "entropy": 0.249609375, | |
| "epoch": 3.104767288486904, | |
| "grad_norm": 0.45289766788482666, | |
| "learning_rate": 6.641805228806994e-06, | |
| "loss": 0.2558360815048218, | |
| "mean_token_accuracy": 0.9204878672957421, | |
| "num_tokens": 52210380.0, | |
| "step": 4120 | |
| }, | |
| { | |
| "entropy": 0.25283203125, | |
| "epoch": 3.1123045034859618, | |
| "grad_norm": 0.48902979493141174, | |
| "learning_rate": 6.5958602108421796e-06, | |
| "loss": 0.26007556915283203, | |
| "mean_token_accuracy": 0.9192629650235176, | |
| "num_tokens": 52344583.0, | |
| "step": 4130 | |
| }, | |
| { | |
| "entropy": 0.2415771484375, | |
| "epoch": 3.11984171848502, | |
| "grad_norm": 0.4995759129524231, | |
| "learning_rate": 6.549996328050296e-06, | |
| "loss": 0.24606029987335204, | |
| "mean_token_accuracy": 0.9220411941409111, | |
| "num_tokens": 52481392.0, | |
| "step": 4140 | |
| }, | |
| { | |
| "entropy": 0.2508056640625, | |
| "epoch": 3.127378933484078, | |
| "grad_norm": 0.5180537104606628, | |
| "learning_rate": 6.504214673563321e-06, | |
| "loss": 0.25423905849456785, | |
| "mean_token_accuracy": 0.9189393475651741, | |
| "num_tokens": 52598987.0, | |
| "step": 4150 | |
| }, | |
| { | |
| "entropy": 0.2357666015625, | |
| "epoch": 3.1349161484831356, | |
| "grad_norm": 0.505828320980072, | |
| "learning_rate": 6.458516338553387e-06, | |
| "loss": 0.24432835578918458, | |
| "mean_token_accuracy": 0.9223694607615471, | |
| "num_tokens": 52725067.0, | |
| "step": 4160 | |
| }, | |
| { | |
| "entropy": 0.246435546875, | |
| "epoch": 3.1424533634821934, | |
| "grad_norm": 0.565288245677948, | |
| "learning_rate": 6.41290241220676e-06, | |
| "loss": 0.2593379020690918, | |
| "mean_token_accuracy": 0.918650609254837, | |
| "num_tokens": 52845379.0, | |
| "step": 4170 | |
| }, | |
| { | |
| "entropy": 0.2607177734375, | |
| "epoch": 3.149990578481251, | |
| "grad_norm": 0.45378032326698303, | |
| "learning_rate": 6.367373981697889e-06, | |
| "loss": 0.26407182216644287, | |
| "mean_token_accuracy": 0.9182954132556915, | |
| "num_tokens": 52977261.0, | |
| "step": 4180 | |
| }, | |
| { | |
| "entropy": 0.2532958984375, | |
| "epoch": 3.157527793480309, | |
| "grad_norm": 0.42719534039497375, | |
| "learning_rate": 6.321932132163493e-06, | |
| "loss": 0.26045353412628175, | |
| "mean_token_accuracy": 0.9192585989832878, | |
| "num_tokens": 53110441.0, | |
| "step": 4190 | |
| }, | |
| { | |
| "entropy": 0.2584716796875, | |
| "epoch": 3.165065008479367, | |
| "grad_norm": 0.48866167664527893, | |
| "learning_rate": 6.276577946676696e-06, | |
| "loss": 0.27137844562530516, | |
| "mean_token_accuracy": 0.9169502511620522, | |
| "num_tokens": 53239158.0, | |
| "step": 4200 | |
| }, | |
| { | |
| "entropy": 0.23046875, | |
| "epoch": 3.1726022234784246, | |
| "grad_norm": 0.4197594225406647, | |
| "learning_rate": 6.231312506221219e-06, | |
| "loss": 0.23780272006988526, | |
| "mean_token_accuracy": 0.9241486981511116, | |
| "num_tokens": 53368874.0, | |
| "step": 4210 | |
| }, | |
| { | |
| "entropy": 0.2381103515625, | |
| "epoch": 3.1801394384774824, | |
| "grad_norm": 0.5063280463218689, | |
| "learning_rate": 6.1861368896656e-06, | |
| "loss": 0.23919708728790284, | |
| "mean_token_accuracy": 0.9226507186889649, | |
| "num_tokens": 53496718.0, | |
| "step": 4220 | |
| }, | |
| { | |
| "entropy": 0.251904296875, | |
| "epoch": 3.1876766534765406, | |
| "grad_norm": 0.5316512584686279, | |
| "learning_rate": 6.141052173737503e-06, | |
| "loss": 0.2563410758972168, | |
| "mean_token_accuracy": 0.9189333856105805, | |
| "num_tokens": 53623940.0, | |
| "step": 4230 | |
| }, | |
| { | |
| "entropy": 0.24686279296875, | |
| "epoch": 3.1952138684755984, | |
| "grad_norm": 0.4826897382736206, | |
| "learning_rate": 6.096059432998034e-06, | |
| "loss": 0.24861443042755127, | |
| "mean_token_accuracy": 0.9219458773732185, | |
| "num_tokens": 53764009.0, | |
| "step": 4240 | |
| }, | |
| { | |
| "entropy": 0.2468017578125, | |
| "epoch": 3.202751083474656, | |
| "grad_norm": 0.46765172481536865, | |
| "learning_rate": 6.0511597398161395e-06, | |
| "loss": 0.250647234916687, | |
| "mean_token_accuracy": 0.9204504400491714, | |
| "num_tokens": 53892566.0, | |
| "step": 4250 | |
| }, | |
| { | |
| "epoch": 3.202751083474656, | |
| "eval_entropy": 0.2578801534262048, | |
| "eval_loss": 0.2983558773994446, | |
| "eval_mean_token_accuracy": 0.9092684685286269, | |
| "eval_num_tokens": 53892566.0, | |
| "eval_runtime": 443.9354, | |
| "eval_samples_per_second": 5.976, | |
| "eval_steps_per_second": 1.496, | |
| "step": 4250 | |
| }, | |
| { | |
| "entropy": 0.2371826171875, | |
| "epoch": 3.210288298473714, | |
| "grad_norm": 0.5083767771720886, | |
| "learning_rate": 6.006354164343047e-06, | |
| "loss": 0.2339548110961914, | |
| "mean_token_accuracy": 0.9240068301558495, | |
| "num_tokens": 54017602.0, | |
| "step": 4260 | |
| }, | |
| { | |
| "entropy": 0.229931640625, | |
| "epoch": 3.217825513472772, | |
| "grad_norm": 0.5524066686630249, | |
| "learning_rate": 5.961643774486754e-06, | |
| "loss": 0.24028148651123046, | |
| "mean_token_accuracy": 0.9243996739387512, | |
| "num_tokens": 54151854.0, | |
| "step": 4270 | |
| }, | |
| { | |
| "entropy": 0.2494140625, | |
| "epoch": 3.2253627284718296, | |
| "grad_norm": 0.5873595476150513, | |
| "learning_rate": 5.917029635886585e-06, | |
| "loss": 0.2616408824920654, | |
| "mean_token_accuracy": 0.919035418331623, | |
| "num_tokens": 54262389.0, | |
| "step": 4280 | |
| }, | |
| { | |
| "entropy": 0.23074951171875, | |
| "epoch": 3.2328999434708874, | |
| "grad_norm": 0.46301954984664917, | |
| "learning_rate": 5.872512811887777e-06, | |
| "loss": 0.2374636173248291, | |
| "mean_token_accuracy": 0.9259173914790153, | |
| "num_tokens": 54394237.0, | |
| "step": 4290 | |
| }, | |
| { | |
| "entropy": 0.2382568359375, | |
| "epoch": 3.240437158469945, | |
| "grad_norm": 0.41154083609580994, | |
| "learning_rate": 5.828094363516158e-06, | |
| "loss": 0.24436559677124023, | |
| "mean_token_accuracy": 0.9219806671142579, | |
| "num_tokens": 54531773.0, | |
| "step": 4300 | |
| }, | |
| { | |
| "entropy": 0.245263671875, | |
| "epoch": 3.2479743734690034, | |
| "grad_norm": 0.4517538845539093, | |
| "learning_rate": 5.783775349452831e-06, | |
| "loss": 0.25096561908721926, | |
| "mean_token_accuracy": 0.9219090670347214, | |
| "num_tokens": 54661135.0, | |
| "step": 4310 | |
| }, | |
| { | |
| "entropy": 0.2532470703125, | |
| "epoch": 3.255511588468061, | |
| "grad_norm": 0.4663011133670807, | |
| "learning_rate": 5.739556826008972e-06, | |
| "loss": 0.2571004629135132, | |
| "mean_token_accuracy": 0.918338057398796, | |
| "num_tokens": 54781768.0, | |
| "step": 4320 | |
| }, | |
| { | |
| "entropy": 0.2399658203125, | |
| "epoch": 3.263048803467119, | |
| "grad_norm": 0.4521697163581848, | |
| "learning_rate": 5.695439847100615e-06, | |
| "loss": 0.24652526378631592, | |
| "mean_token_accuracy": 0.9215589553117752, | |
| "num_tokens": 54916397.0, | |
| "step": 4330 | |
| }, | |
| { | |
| "entropy": 0.2451416015625, | |
| "epoch": 3.270586018466177, | |
| "grad_norm": 0.4162958562374115, | |
| "learning_rate": 5.651425464223577e-06, | |
| "loss": 0.24436590671539307, | |
| "mean_token_accuracy": 0.920574314892292, | |
| "num_tokens": 55040997.0, | |
| "step": 4340 | |
| }, | |
| { | |
| "entropy": 0.2452392578125, | |
| "epoch": 3.2781232334652346, | |
| "grad_norm": 0.46381431818008423, | |
| "learning_rate": 5.6075147264283526e-06, | |
| "loss": 0.2571404457092285, | |
| "mean_token_accuracy": 0.9213781818747521, | |
| "num_tokens": 55175738.0, | |
| "step": 4350 | |
| }, | |
| { | |
| "entropy": 0.24869384765625, | |
| "epoch": 3.2856604484642924, | |
| "grad_norm": 0.36787933111190796, | |
| "learning_rate": 5.56370868029515e-06, | |
| "loss": 0.253587532043457, | |
| "mean_token_accuracy": 0.9196270078420639, | |
| "num_tokens": 55312758.0, | |
| "step": 4360 | |
| }, | |
| { | |
| "entropy": 0.22239990234375, | |
| "epoch": 3.29319766346335, | |
| "grad_norm": 0.43934619426727295, | |
| "learning_rate": 5.520008369908918e-06, | |
| "loss": 0.2182994842529297, | |
| "mean_token_accuracy": 0.9281560033559799, | |
| "num_tokens": 55444635.0, | |
| "step": 4370 | |
| }, | |
| { | |
| "entropy": 0.2463134765625, | |
| "epoch": 3.300734878462408, | |
| "grad_norm": 0.5719824433326721, | |
| "learning_rate": 5.476414836834481e-06, | |
| "loss": 0.25219566822052003, | |
| "mean_token_accuracy": 0.9201019376516342, | |
| "num_tokens": 55569153.0, | |
| "step": 4380 | |
| }, | |
| { | |
| "entropy": 0.2388427734375, | |
| "epoch": 3.308272093461466, | |
| "grad_norm": 0.6103549599647522, | |
| "learning_rate": 5.432929120091691e-06, | |
| "loss": 0.24608726501464845, | |
| "mean_token_accuracy": 0.9217844411730767, | |
| "num_tokens": 55689383.0, | |
| "step": 4390 | |
| }, | |
| { | |
| "entropy": 0.2604736328125, | |
| "epoch": 3.315809308460524, | |
| "grad_norm": 0.48919445276260376, | |
| "learning_rate": 5.38955225613069e-06, | |
| "loss": 0.2672025203704834, | |
| "mean_token_accuracy": 0.9159393101930619, | |
| "num_tokens": 55818032.0, | |
| "step": 4400 | |
| }, | |
| { | |
| "entropy": 0.24017333984375, | |
| "epoch": 3.323346523459582, | |
| "grad_norm": 0.6008545756340027, | |
| "learning_rate": 5.346285278807182e-06, | |
| "loss": 0.24650108814239502, | |
| "mean_token_accuracy": 0.9232565045356751, | |
| "num_tokens": 55951704.0, | |
| "step": 4410 | |
| }, | |
| { | |
| "entropy": 0.24951171875, | |
| "epoch": 3.3308837384586396, | |
| "grad_norm": 0.5296514630317688, | |
| "learning_rate": 5.303129219357811e-06, | |
| "loss": 0.25560004711151124, | |
| "mean_token_accuracy": 0.9190060347318649, | |
| "num_tokens": 56087124.0, | |
| "step": 4420 | |
| }, | |
| { | |
| "epoch": 3.3308837384586396, | |
| "eval_entropy": 0.25144572430346385, | |
| "eval_loss": 0.29815539717674255, | |
| "eval_mean_token_accuracy": 0.9097737183412874, | |
| "eval_num_tokens": 56087124.0, | |
| "eval_runtime": 444.342, | |
| "eval_samples_per_second": 5.971, | |
| "eval_steps_per_second": 1.494, | |
| "step": 4420 | |
| }, | |
| { | |
| "entropy": 0.24404296875, | |
| "epoch": 3.3384209534576974, | |
| "grad_norm": 0.5156750082969666, | |
| "learning_rate": 5.260085106375577e-06, | |
| "loss": 0.24577805995941163, | |
| "mean_token_accuracy": 0.9231465876102447, | |
| "num_tokens": 56216768.0, | |
| "step": 4430 | |
| }, | |
| { | |
| "entropy": 0.23583984375, | |
| "epoch": 3.345958168456755, | |
| "grad_norm": 0.48873215913772583, | |
| "learning_rate": 5.217153965785315e-06, | |
| "loss": 0.24040358066558837, | |
| "mean_token_accuracy": 0.9222135201096535, | |
| "num_tokens": 56331628.0, | |
| "step": 4440 | |
| }, | |
| { | |
| "entropy": 0.236279296875, | |
| "epoch": 3.353495383455813, | |
| "grad_norm": 0.6165609955787659, | |
| "learning_rate": 5.174336820819241e-06, | |
| "loss": 0.24129061698913573, | |
| "mean_token_accuracy": 0.922450278699398, | |
| "num_tokens": 56466449.0, | |
| "step": 4450 | |
| }, | |
| { | |
| "entropy": 0.25859375, | |
| "epoch": 3.361032598454871, | |
| "grad_norm": 0.42945030331611633, | |
| "learning_rate": 5.131634691992576e-06, | |
| "loss": 0.2604536771774292, | |
| "mean_token_accuracy": 0.9179983928799629, | |
| "num_tokens": 56590258.0, | |
| "step": 4460 | |
| }, | |
| { | |
| "entropy": 0.2478515625, | |
| "epoch": 3.3685698134539286, | |
| "grad_norm": 0.3764921724796295, | |
| "learning_rate": 5.089048597079218e-06, | |
| "loss": 0.25089526176452637, | |
| "mean_token_accuracy": 0.918754868209362, | |
| "num_tokens": 56712466.0, | |
| "step": 4470 | |
| }, | |
| { | |
| "entropy": 0.251513671875, | |
| "epoch": 3.376107028452987, | |
| "grad_norm": 0.5503227710723877, | |
| "learning_rate": 5.046579551087469e-06, | |
| "loss": 0.25963895320892333, | |
| "mean_token_accuracy": 0.9187079787254333, | |
| "num_tokens": 56838324.0, | |
| "step": 4480 | |
| }, | |
| { | |
| "entropy": 0.24443359375, | |
| "epoch": 3.3836442434520446, | |
| "grad_norm": 0.4642918109893799, | |
| "learning_rate": 5.0042285662358715e-06, | |
| "loss": 0.25160040855407717, | |
| "mean_token_accuracy": 0.9221544966101647, | |
| "num_tokens": 56971672.0, | |
| "step": 4490 | |
| }, | |
| { | |
| "entropy": 0.22529296875, | |
| "epoch": 3.3911814584511024, | |
| "grad_norm": 0.47102871537208557, | |
| "learning_rate": 4.961996651929053e-06, | |
| "loss": 0.23354432582855225, | |
| "mean_token_accuracy": 0.9269132241606712, | |
| "num_tokens": 57101256.0, | |
| "step": 4500 | |
| }, | |
| { | |
| "entropy": 0.2195068359375, | |
| "epoch": 3.39871867345016, | |
| "grad_norm": 0.4792303144931793, | |
| "learning_rate": 4.9198848147336935e-06, | |
| "loss": 0.22426846027374267, | |
| "mean_token_accuracy": 0.9267282068729401, | |
| "num_tokens": 57220336.0, | |
| "step": 4510 | |
| }, | |
| { | |
| "entropy": 0.23193359375, | |
| "epoch": 3.406255888449218, | |
| "grad_norm": 0.46890905499458313, | |
| "learning_rate": 4.877894058354518e-06, | |
| "loss": 0.23823246955871583, | |
| "mean_token_accuracy": 0.9238113984465599, | |
| "num_tokens": 57351375.0, | |
| "step": 4520 | |
| }, | |
| { | |
| "entropy": 0.259375, | |
| "epoch": 3.413793103448276, | |
| "grad_norm": 0.4295634925365448, | |
| "learning_rate": 4.836025383610382e-06, | |
| "loss": 0.26934764385223386, | |
| "mean_token_accuracy": 0.9180942147970199, | |
| "num_tokens": 57492948.0, | |
| "step": 4530 | |
| }, | |
| { | |
| "entropy": 0.23662109375, | |
| "epoch": 3.4213303184473336, | |
| "grad_norm": 0.4977467656135559, | |
| "learning_rate": 4.794279788410408e-06, | |
| "loss": 0.23803329467773438, | |
| "mean_token_accuracy": 0.9239297583699226, | |
| "num_tokens": 57617213.0, | |
| "step": 4540 | |
| }, | |
| { | |
| "entropy": 0.2344482421875, | |
| "epoch": 3.4288675334463914, | |
| "grad_norm": 0.5020400881767273, | |
| "learning_rate": 4.752658267730218e-06, | |
| "loss": 0.24145655632019042, | |
| "mean_token_accuracy": 0.9231008142232895, | |
| "num_tokens": 57755087.0, | |
| "step": 4550 | |
| }, | |
| { | |
| "entropy": 0.23726806640625, | |
| "epoch": 3.436404748445449, | |
| "grad_norm": 0.5047474503517151, | |
| "learning_rate": 4.711161813588198e-06, | |
| "loss": 0.24432265758514404, | |
| "mean_token_accuracy": 0.921500913798809, | |
| "num_tokens": 57881092.0, | |
| "step": 4560 | |
| }, | |
| { | |
| "entropy": 0.2539306640625, | |
| "epoch": 3.4439419634445074, | |
| "grad_norm": 0.5615915060043335, | |
| "learning_rate": 4.6697914150218726e-06, | |
| "loss": 0.26180734634399416, | |
| "mean_token_accuracy": 0.9188700020313263, | |
| "num_tokens": 58019422.0, | |
| "step": 4570 | |
| }, | |
| { | |
| "entropy": 0.2443115234375, | |
| "epoch": 3.451479178443565, | |
| "grad_norm": 0.41278159618377686, | |
| "learning_rate": 4.6285480580643214e-06, | |
| "loss": 0.24113664627075196, | |
| "mean_token_accuracy": 0.92239079028368, | |
| "num_tokens": 58144501.0, | |
| "step": 4580 | |
| }, | |
| { | |
| "entropy": 0.249853515625, | |
| "epoch": 3.459016393442623, | |
| "grad_norm": 0.48389744758605957, | |
| "learning_rate": 4.587432725720687e-06, | |
| "loss": 0.2561469554901123, | |
| "mean_token_accuracy": 0.9191392526030541, | |
| "num_tokens": 58274208.0, | |
| "step": 4590 | |
| }, | |
| { | |
| "epoch": 3.459016393442623, | |
| "eval_entropy": 0.2534054675734187, | |
| "eval_loss": 0.2973636984825134, | |
| "eval_mean_token_accuracy": 0.9099213545580944, | |
| "eval_num_tokens": 58274208.0, | |
| "eval_runtime": 444.1047, | |
| "eval_samples_per_second": 5.974, | |
| "eval_steps_per_second": 1.495, | |
| "step": 4590 | |
| }, | |
| { | |
| "entropy": 0.25052490234375, | |
| "epoch": 3.466553608441681, | |
| "grad_norm": 0.48276710510253906, | |
| "learning_rate": 4.5464463979447245e-06, | |
| "loss": 0.2551881313323975, | |
| "mean_token_accuracy": 0.9179890528321266, | |
| "num_tokens": 58399143.0, | |
| "step": 4600 | |
| }, | |
| { | |
| "entropy": 0.23720703125, | |
| "epoch": 3.4740908234407386, | |
| "grad_norm": 0.49638012051582336, | |
| "learning_rate": 4.505590051615478e-06, | |
| "loss": 0.24317293167114257, | |
| "mean_token_accuracy": 0.9220433473587036, | |
| "num_tokens": 58518939.0, | |
| "step": 4610 | |
| }, | |
| { | |
| "entropy": 0.23392333984375, | |
| "epoch": 3.4816280384397964, | |
| "grad_norm": 0.512684166431427, | |
| "learning_rate": 4.4648646605139605e-06, | |
| "loss": 0.23999152183532715, | |
| "mean_token_accuracy": 0.9236366301774979, | |
| "num_tokens": 58645386.0, | |
| "step": 4620 | |
| }, | |
| { | |
| "entropy": 0.2496337890625, | |
| "epoch": 3.489165253438854, | |
| "grad_norm": 0.476936399936676, | |
| "learning_rate": 4.424271195299981e-06, | |
| "loss": 0.25567328929901123, | |
| "mean_token_accuracy": 0.9208142340183259, | |
| "num_tokens": 58774633.0, | |
| "step": 4630 | |
| }, | |
| { | |
| "entropy": 0.2439453125, | |
| "epoch": 3.4967024684379124, | |
| "grad_norm": 0.4863242208957672, | |
| "learning_rate": 4.383810623488973e-06, | |
| "loss": 0.2511773109436035, | |
| "mean_token_accuracy": 0.9208297878503799, | |
| "num_tokens": 58890700.0, | |
| "step": 4640 | |
| }, | |
| { | |
| "entropy": 0.2301513671875, | |
| "epoch": 3.5042396834369702, | |
| "grad_norm": 0.4208335280418396, | |
| "learning_rate": 4.343483909428978e-06, | |
| "loss": 0.23434915542602539, | |
| "mean_token_accuracy": 0.926320880651474, | |
| "num_tokens": 59023930.0, | |
| "step": 4650 | |
| }, | |
| { | |
| "entropy": 0.2602294921875, | |
| "epoch": 3.511776898436028, | |
| "grad_norm": 0.5129518508911133, | |
| "learning_rate": 4.3032920142776125e-06, | |
| "loss": 0.2699117660522461, | |
| "mean_token_accuracy": 0.9175953105092048, | |
| "num_tokens": 59148853.0, | |
| "step": 4660 | |
| }, | |
| { | |
| "entropy": 0.232763671875, | |
| "epoch": 3.519314113435086, | |
| "grad_norm": 0.48988714814186096, | |
| "learning_rate": 4.2632358959791984e-06, | |
| "loss": 0.24585673809051514, | |
| "mean_token_accuracy": 0.9236719325184822, | |
| "num_tokens": 59270325.0, | |
| "step": 4670 | |
| }, | |
| { | |
| "entropy": 0.2343994140625, | |
| "epoch": 3.5268513284341436, | |
| "grad_norm": 0.5187233686447144, | |
| "learning_rate": 4.2233165092419045e-06, | |
| "loss": 0.23766450881958007, | |
| "mean_token_accuracy": 0.9215475022792816, | |
| "num_tokens": 59390235.0, | |
| "step": 4680 | |
| }, | |
| { | |
| "entropy": 0.2481201171875, | |
| "epoch": 3.5343885434332014, | |
| "grad_norm": 0.5581011772155762, | |
| "learning_rate": 4.183534805515017e-06, | |
| "loss": 0.2518896579742432, | |
| "mean_token_accuracy": 0.9208254173398018, | |
| "num_tokens": 59523333.0, | |
| "step": 4690 | |
| }, | |
| { | |
| "entropy": 0.2261474609375, | |
| "epoch": 3.541925758432259, | |
| "grad_norm": 0.4673849046230316, | |
| "learning_rate": 4.143891732966233e-06, | |
| "loss": 0.222815203666687, | |
| "mean_token_accuracy": 0.9255363285541535, | |
| "num_tokens": 59644999.0, | |
| "step": 4700 | |
| }, | |
| { | |
| "entropy": 0.238232421875, | |
| "epoch": 3.549462973431317, | |
| "grad_norm": 0.4689350724220276, | |
| "learning_rate": 4.1043882364590895e-06, | |
| "loss": 0.24630405902862548, | |
| "mean_token_accuracy": 0.9213015034794807, | |
| "num_tokens": 59768160.0, | |
| "step": 4710 | |
| }, | |
| { | |
| "entropy": 0.246630859375, | |
| "epoch": 3.557000188430375, | |
| "grad_norm": 0.5590668320655823, | |
| "learning_rate": 4.065025257530425e-06, | |
| "loss": 0.2526021718978882, | |
| "mean_token_accuracy": 0.9192856788635254, | |
| "num_tokens": 59893438.0, | |
| "step": 4720 | |
| }, | |
| { | |
| "entropy": 0.2509765625, | |
| "epoch": 3.5645374034294326, | |
| "grad_norm": 0.5854102373123169, | |
| "learning_rate": 4.025803734367951e-06, | |
| "loss": 0.2594055414199829, | |
| "mean_token_accuracy": 0.9179863676428794, | |
| "num_tokens": 60011320.0, | |
| "step": 4730 | |
| }, | |
| { | |
| "entropy": 0.2639892578125, | |
| "epoch": 3.572074618428491, | |
| "grad_norm": 0.4343920648097992, | |
| "learning_rate": 3.986724601787874e-06, | |
| "loss": 0.27078163623809814, | |
| "mean_token_accuracy": 0.9166007101535797, | |
| "num_tokens": 60132251.0, | |
| "step": 4740 | |
| }, | |
| { | |
| "entropy": 0.2543212890625, | |
| "epoch": 3.5796118334275486, | |
| "grad_norm": 0.5742672681808472, | |
| "learning_rate": 3.947788791212636e-06, | |
| "loss": 0.2545814037322998, | |
| "mean_token_accuracy": 0.9177268758416176, | |
| "num_tokens": 60250677.0, | |
| "step": 4750 | |
| }, | |
| { | |
| "entropy": 0.2412841796875, | |
| "epoch": 3.5871490484266064, | |
| "grad_norm": 0.47204774618148804, | |
| "learning_rate": 3.908997230648693e-06, | |
| "loss": 0.2479944944381714, | |
| "mean_token_accuracy": 0.9224215567111969, | |
| "num_tokens": 60384182.0, | |
| "step": 4760 | |
| }, | |
| { | |
| "epoch": 3.5871490484266064, | |
| "eval_entropy": 0.2532833972609187, | |
| "eval_loss": 0.2967984080314636, | |
| "eval_mean_token_accuracy": 0.9098558257143181, | |
| "eval_num_tokens": 60384182.0, | |
| "eval_runtime": 444.2337, | |
| "eval_samples_per_second": 5.972, | |
| "eval_steps_per_second": 1.495, | |
| "step": 4760 | |
| }, | |
| { | |
| "entropy": 0.2306640625, | |
| "epoch": 3.594686263425664, | |
| "grad_norm": 0.44733676314353943, | |
| "learning_rate": 3.870350844664421e-06, | |
| "loss": 0.23280799388885498, | |
| "mean_token_accuracy": 0.9231883391737938, | |
| "num_tokens": 60512836.0, | |
| "step": 4770 | |
| }, | |
| { | |
| "entropy": 0.22529296875, | |
| "epoch": 3.602223478424722, | |
| "grad_norm": 0.4727942645549774, | |
| "learning_rate": 3.831850554368062e-06, | |
| "loss": 0.2281050443649292, | |
| "mean_token_accuracy": 0.9263469472527504, | |
| "num_tokens": 60644876.0, | |
| "step": 4780 | |
| }, | |
| { | |
| "entropy": 0.2620361328125, | |
| "epoch": 3.60976069342378, | |
| "grad_norm": 0.5005683302879333, | |
| "learning_rate": 3.7934972773857637e-06, | |
| "loss": 0.2716717481613159, | |
| "mean_token_accuracy": 0.9157996863126755, | |
| "num_tokens": 60767111.0, | |
| "step": 4790 | |
| }, | |
| { | |
| "entropy": 0.239306640625, | |
| "epoch": 3.6172979084228376, | |
| "grad_norm": 0.5814849734306335, | |
| "learning_rate": 3.7552919278397335e-06, | |
| "loss": 0.24393236637115479, | |
| "mean_token_accuracy": 0.9211369171738625, | |
| "num_tokens": 60888646.0, | |
| "step": 4800 | |
| }, | |
| { | |
| "entropy": 0.23623046875, | |
| "epoch": 3.624835123421896, | |
| "grad_norm": 0.5132681727409363, | |
| "learning_rate": 3.7172354163264324e-06, | |
| "loss": 0.23972315788269044, | |
| "mean_token_accuracy": 0.9234942555427551, | |
| "num_tokens": 61006787.0, | |
| "step": 4810 | |
| }, | |
| { | |
| "entropy": 0.239892578125, | |
| "epoch": 3.6323723384209536, | |
| "grad_norm": 0.449523001909256, | |
| "learning_rate": 3.6793286498948777e-06, | |
| "loss": 0.250550365447998, | |
| "mean_token_accuracy": 0.9213675454258918, | |
| "num_tokens": 61136494.0, | |
| "step": 4820 | |
| }, | |
| { | |
| "entropy": 0.23447265625, | |
| "epoch": 3.6399095534200114, | |
| "grad_norm": 0.4843718707561493, | |
| "learning_rate": 3.641572532025014e-06, | |
| "loss": 0.2334545373916626, | |
| "mean_token_accuracy": 0.9240896537899971, | |
| "num_tokens": 61255513.0, | |
| "step": 4830 | |
| }, | |
| { | |
| "entropy": 0.2620361328125, | |
| "epoch": 3.6474467684190692, | |
| "grad_norm": 0.48772865533828735, | |
| "learning_rate": 3.603967962606201e-06, | |
| "loss": 0.26780409812927247, | |
| "mean_token_accuracy": 0.9164189457893371, | |
| "num_tokens": 61377835.0, | |
| "step": 4840 | |
| }, | |
| { | |
| "entropy": 0.232861328125, | |
| "epoch": 3.654983983418127, | |
| "grad_norm": 0.488202303647995, | |
| "learning_rate": 3.566515837915738e-06, | |
| "loss": 0.2365469217300415, | |
| "mean_token_accuracy": 0.9234168440103531, | |
| "num_tokens": 61510553.0, | |
| "step": 4850 | |
| }, | |
| { | |
| "entropy": 0.2384765625, | |
| "epoch": 3.662521198417185, | |
| "grad_norm": 0.48342105746269226, | |
| "learning_rate": 3.5292170505975286e-06, | |
| "loss": 0.24164836406707763, | |
| "mean_token_accuracy": 0.9242537707090378, | |
| "num_tokens": 61641190.0, | |
| "step": 4860 | |
| }, | |
| { | |
| "entropy": 0.245166015625, | |
| "epoch": 3.6700584134162426, | |
| "grad_norm": 0.4898669421672821, | |
| "learning_rate": 3.4920724896407877e-06, | |
| "loss": 0.2510417699813843, | |
| "mean_token_accuracy": 0.9203757330775261, | |
| "num_tokens": 61772842.0, | |
| "step": 4870 | |
| }, | |
| { | |
| "entropy": 0.23450927734375, | |
| "epoch": 3.6775956284153004, | |
| "grad_norm": 0.5533488988876343, | |
| "learning_rate": 3.455083040358861e-06, | |
| "loss": 0.23881711959838867, | |
| "mean_token_accuracy": 0.9239112094044686, | |
| "num_tokens": 61901653.0, | |
| "step": 4880 | |
| }, | |
| { | |
| "entropy": 0.2240234375, | |
| "epoch": 3.685132843414358, | |
| "grad_norm": 0.3996533155441284, | |
| "learning_rate": 3.4182495843681117e-06, | |
| "loss": 0.22698888778686524, | |
| "mean_token_accuracy": 0.927504974603653, | |
| "num_tokens": 62041188.0, | |
| "step": 4890 | |
| }, | |
| { | |
| "entropy": 0.24088134765625, | |
| "epoch": 3.692670058413416, | |
| "grad_norm": 0.49964672327041626, | |
| "learning_rate": 3.3815729995669322e-06, | |
| "loss": 0.24840447902679444, | |
| "mean_token_accuracy": 0.9213329881429673, | |
| "num_tokens": 62173168.0, | |
| "step": 4900 | |
| }, | |
| { | |
| "entropy": 0.22628173828125, | |
| "epoch": 3.7002072734124742, | |
| "grad_norm": 0.4857988953590393, | |
| "learning_rate": 3.345054160114789e-06, | |
| "loss": 0.22398624420166016, | |
| "mean_token_accuracy": 0.9263280004262924, | |
| "num_tokens": 62297740.0, | |
| "step": 4910 | |
| }, | |
| { | |
| "entropy": 0.246728515625, | |
| "epoch": 3.707744488411532, | |
| "grad_norm": 0.4899304509162903, | |
| "learning_rate": 3.308693936411421e-06, | |
| "loss": 0.25445635318756105, | |
| "mean_token_accuracy": 0.920192101597786, | |
| "num_tokens": 62418710.0, | |
| "step": 4920 | |
| }, | |
| { | |
| "entropy": 0.24462890625, | |
| "epoch": 3.71528170341059, | |
| "grad_norm": 0.4868662655353546, | |
| "learning_rate": 3.2724931950760576e-06, | |
| "loss": 0.24715008735656738, | |
| "mean_token_accuracy": 0.9194081127643585, | |
| "num_tokens": 62538535.0, | |
| "step": 4930 | |
| }, | |
| { | |
| "epoch": 3.71528170341059, | |
| "eval_entropy": 0.25196268472326805, | |
| "eval_loss": 0.2968800365924835, | |
| "eval_mean_token_accuracy": 0.9099598022469555, | |
| "eval_num_tokens": 62538535.0, | |
| "eval_runtime": 444.76, | |
| "eval_samples_per_second": 5.965, | |
| "eval_steps_per_second": 1.493, | |
| "step": 4930 | |
| }, | |
| { | |
| "entropy": 0.2277587890625, | |
| "epoch": 3.7228189184096476, | |
| "grad_norm": 0.5071448683738708, | |
| "learning_rate": 3.236452798926807e-06, | |
| "loss": 0.2292656660079956, | |
| "mean_token_accuracy": 0.9266470044851303, | |
| "num_tokens": 62663129.0, | |
| "step": 4940 | |
| }, | |
| { | |
| "entropy": 0.249853515625, | |
| "epoch": 3.7303561334087054, | |
| "grad_norm": 0.46776777505874634, | |
| "learning_rate": 3.2005736069600446e-06, | |
| "loss": 0.25865788459777833, | |
| "mean_token_accuracy": 0.9170892059803009, | |
| "num_tokens": 62779198.0, | |
| "step": 4950 | |
| }, | |
| { | |
| "entropy": 0.253662109375, | |
| "epoch": 3.737893348407763, | |
| "grad_norm": 0.5072009563446045, | |
| "learning_rate": 3.1648564743299793e-06, | |
| "loss": 0.2605839729309082, | |
| "mean_token_accuracy": 0.9192040726542473, | |
| "num_tokens": 62906493.0, | |
| "step": 4960 | |
| }, | |
| { | |
| "entropy": 0.249267578125, | |
| "epoch": 3.7454305634068215, | |
| "grad_norm": 0.5265138149261475, | |
| "learning_rate": 3.12930225232824e-06, | |
| "loss": 0.2564325571060181, | |
| "mean_token_accuracy": 0.9199110895395279, | |
| "num_tokens": 63034082.0, | |
| "step": 4970 | |
| }, | |
| { | |
| "entropy": 0.238427734375, | |
| "epoch": 3.7529677784058793, | |
| "grad_norm": 0.4928956627845764, | |
| "learning_rate": 3.093911788363617e-06, | |
| "loss": 0.2413705825805664, | |
| "mean_token_accuracy": 0.9228529289364815, | |
| "num_tokens": 63157973.0, | |
| "step": 4980 | |
| }, | |
| { | |
| "entropy": 0.2524169921875, | |
| "epoch": 3.760504993404937, | |
| "grad_norm": 0.5981191992759705, | |
| "learning_rate": 3.058685925941832e-06, | |
| "loss": 0.2596710443496704, | |
| "mean_token_accuracy": 0.9180012375116349, | |
| "num_tokens": 63280137.0, | |
| "step": 4990 | |
| }, | |
| { | |
| "entropy": 0.23251953125, | |
| "epoch": 3.768042208403995, | |
| "grad_norm": 0.482380211353302, | |
| "learning_rate": 3.023625504645459e-06, | |
| "loss": 0.24188435077667236, | |
| "mean_token_accuracy": 0.9233495354652405, | |
| "num_tokens": 63406930.0, | |
| "step": 5000 | |
| }, | |
| { | |
| "entropy": 0.23822021484375, | |
| "epoch": 3.7755794234030526, | |
| "grad_norm": 0.5340070128440857, | |
| "learning_rate": 2.9887313601139023e-06, | |
| "loss": 0.24011678695678712, | |
| "mean_token_accuracy": 0.9242303058505058, | |
| "num_tokens": 63533137.0, | |
| "step": 5010 | |
| }, | |
| { | |
| "entropy": 0.24560546875, | |
| "epoch": 3.7831166384021104, | |
| "grad_norm": 0.4129692316055298, | |
| "learning_rate": 2.954004324023485e-06, | |
| "loss": 0.25254933834075927, | |
| "mean_token_accuracy": 0.9207971751689911, | |
| "num_tokens": 63665433.0, | |
| "step": 5020 | |
| }, | |
| { | |
| "entropy": 0.2470947265625, | |
| "epoch": 3.7906538534011682, | |
| "grad_norm": 0.4447065591812134, | |
| "learning_rate": 2.919445224067614e-06, | |
| "loss": 0.2541998624801636, | |
| "mean_token_accuracy": 0.9211808830499649, | |
| "num_tokens": 63793265.0, | |
| "step": 5030 | |
| }, | |
| { | |
| "entropy": 0.242724609375, | |
| "epoch": 3.798191068400226, | |
| "grad_norm": 0.4375300109386444, | |
| "learning_rate": 2.885054883937073e-06, | |
| "loss": 0.24628190994262694, | |
| "mean_token_accuracy": 0.9202960833907128, | |
| "num_tokens": 63913932.0, | |
| "step": 5040 | |
| }, | |
| { | |
| "entropy": 0.2439208984375, | |
| "epoch": 3.805728283399284, | |
| "grad_norm": 0.5313498973846436, | |
| "learning_rate": 2.8508341233003656e-06, | |
| "loss": 0.2506706237792969, | |
| "mean_token_accuracy": 0.9210630789399147, | |
| "num_tokens": 64035256.0, | |
| "step": 5050 | |
| }, | |
| { | |
| "entropy": 0.2599853515625, | |
| "epoch": 3.8132654983983416, | |
| "grad_norm": 0.5273305773735046, | |
| "learning_rate": 2.816783757784206e-06, | |
| "loss": 0.2702688217163086, | |
| "mean_token_accuracy": 0.9156295627355575, | |
| "num_tokens": 64156686.0, | |
| "step": 5060 | |
| }, | |
| { | |
| "entropy": 0.25810546875, | |
| "epoch": 3.8208027133973994, | |
| "grad_norm": 0.5010347962379456, | |
| "learning_rate": 2.7829045989540594e-06, | |
| "loss": 0.2638701915740967, | |
| "mean_token_accuracy": 0.9181295543909073, | |
| "num_tokens": 64286554.0, | |
| "step": 5070 | |
| }, | |
| { | |
| "entropy": 0.2409423828125, | |
| "epoch": 3.8283399283964576, | |
| "grad_norm": 0.6270024180412292, | |
| "learning_rate": 2.7491974542948087e-06, | |
| "loss": 0.24303548336029052, | |
| "mean_token_accuracy": 0.9216175884008407, | |
| "num_tokens": 64406250.0, | |
| "step": 5080 | |
| }, | |
| { | |
| "entropy": 0.2555908203125, | |
| "epoch": 3.8358771433955154, | |
| "grad_norm": 0.50421142578125, | |
| "learning_rate": 2.715663127191498e-06, | |
| "loss": 0.2657378435134888, | |
| "mean_token_accuracy": 0.918186990916729, | |
| "num_tokens": 64546008.0, | |
| "step": 5090 | |
| }, | |
| { | |
| "entropy": 0.23912353515625, | |
| "epoch": 3.8434143583945732, | |
| "grad_norm": 0.5221638083457947, | |
| "learning_rate": 2.682302416910201e-06, | |
| "loss": 0.24288854598999024, | |
| "mean_token_accuracy": 0.9223589122295379, | |
| "num_tokens": 64673887.0, | |
| "step": 5100 | |
| }, | |
| { | |
| "epoch": 3.8434143583945732, | |
| "eval_entropy": 0.25410847491528615, | |
| "eval_loss": 0.29583480954170227, | |
| "eval_mean_token_accuracy": 0.9102463329053787, | |
| "eval_num_tokens": 64673887.0, | |
| "eval_runtime": 444.3668, | |
| "eval_samples_per_second": 5.97, | |
| "eval_steps_per_second": 1.494, | |
| "step": 5100 | |
| }, | |
| { | |
| "entropy": 0.2464111328125, | |
| "epoch": 3.850951573393631, | |
| "grad_norm": 0.4669792354106903, | |
| "learning_rate": 2.6491161185789525e-06, | |
| "loss": 0.251127290725708, | |
| "mean_token_accuracy": 0.9189326271414757, | |
| "num_tokens": 64792525.0, | |
| "step": 5110 | |
| }, | |
| { | |
| "entropy": 0.23583984375, | |
| "epoch": 3.858488788392689, | |
| "grad_norm": 0.5284295678138733, | |
| "learning_rate": 2.6161050231688145e-06, | |
| "loss": 0.23496873378753663, | |
| "mean_token_accuracy": 0.9242655590176583, | |
| "num_tokens": 64927953.0, | |
| "step": 5120 | |
| }, | |
| { | |
| "entropy": 0.2385986328125, | |
| "epoch": 3.8660260033917466, | |
| "grad_norm": 0.4746510982513428, | |
| "learning_rate": 2.583269917475015e-06, | |
| "loss": 0.24602668285369872, | |
| "mean_token_accuracy": 0.9217883810400963, | |
| "num_tokens": 65060416.0, | |
| "step": 5130 | |
| }, | |
| { | |
| "entropy": 0.2327392578125, | |
| "epoch": 3.873563218390805, | |
| "grad_norm": 0.5625964999198914, | |
| "learning_rate": 2.5506115840981905e-06, | |
| "loss": 0.23991544246673585, | |
| "mean_token_accuracy": 0.9225243136286736, | |
| "num_tokens": 65180637.0, | |
| "step": 5140 | |
| }, | |
| { | |
| "entropy": 0.25853271484375, | |
| "epoch": 3.8811004333898627, | |
| "grad_norm": 0.49249470233917236, | |
| "learning_rate": 2.5181308014257445e-06, | |
| "loss": 0.2658606290817261, | |
| "mean_token_accuracy": 0.9198394268751144, | |
| "num_tokens": 65306476.0, | |
| "step": 5150 | |
| }, | |
| { | |
| "entropy": 0.2334228515625, | |
| "epoch": 3.8886376483889205, | |
| "grad_norm": 0.5490977168083191, | |
| "learning_rate": 2.485828343613288e-06, | |
| "loss": 0.23961324691772462, | |
| "mean_token_accuracy": 0.9249249547719955, | |
| "num_tokens": 65429741.0, | |
| "step": 5160 | |
| }, | |
| { | |
| "entropy": 0.22962646484375, | |
| "epoch": 3.8961748633879782, | |
| "grad_norm": 0.4870103597640991, | |
| "learning_rate": 2.453704980566194e-06, | |
| "loss": 0.2331066608428955, | |
| "mean_token_accuracy": 0.9261724725365639, | |
| "num_tokens": 65557932.0, | |
| "step": 5170 | |
| }, | |
| { | |
| "entropy": 0.2351806640625, | |
| "epoch": 3.903712078387036, | |
| "grad_norm": 0.5044042468070984, | |
| "learning_rate": 2.421761477921232e-06, | |
| "loss": 0.24697554111480713, | |
| "mean_token_accuracy": 0.9232055351138115, | |
| "num_tokens": 65685595.0, | |
| "step": 5180 | |
| }, | |
| { | |
| "entropy": 0.2565673828125, | |
| "epoch": 3.911249293386094, | |
| "grad_norm": 0.5367307662963867, | |
| "learning_rate": 2.3899985970283446e-06, | |
| "loss": 0.262367844581604, | |
| "mean_token_accuracy": 0.916471290588379, | |
| "num_tokens": 65794307.0, | |
| "step": 5190 | |
| }, | |
| { | |
| "entropy": 0.24423828125, | |
| "epoch": 3.9187865083851516, | |
| "grad_norm": 0.4560658633708954, | |
| "learning_rate": 2.358417094932477e-06, | |
| "loss": 0.255014443397522, | |
| "mean_token_accuracy": 0.9187598779797554, | |
| "num_tokens": 65921865.0, | |
| "step": 5200 | |
| }, | |
| { | |
| "entropy": 0.24368896484375, | |
| "epoch": 3.9263237233842094, | |
| "grad_norm": 0.517406165599823, | |
| "learning_rate": 2.3270177243555483e-06, | |
| "loss": 0.25057861804962156, | |
| "mean_token_accuracy": 0.9210366785526276, | |
| "num_tokens": 66042392.0, | |
| "step": 5210 | |
| }, | |
| { | |
| "entropy": 0.259814453125, | |
| "epoch": 3.9338609383832672, | |
| "grad_norm": 0.4247106909751892, | |
| "learning_rate": 2.2958012336785075e-06, | |
| "loss": 0.2645686626434326, | |
| "mean_token_accuracy": 0.9183212980628014, | |
| "num_tokens": 66174262.0, | |
| "step": 5220 | |
| }, | |
| { | |
| "entropy": 0.24361572265625, | |
| "epoch": 3.941398153382325, | |
| "grad_norm": 0.4038093388080597, | |
| "learning_rate": 2.2647683669234964e-06, | |
| "loss": 0.24378161430358886, | |
| "mean_token_accuracy": 0.9212676301598549, | |
| "num_tokens": 66308633.0, | |
| "step": 5230 | |
| }, | |
| { | |
| "entropy": 0.239697265625, | |
| "epoch": 3.948935368381383, | |
| "grad_norm": 0.5646233558654785, | |
| "learning_rate": 2.2339198637361094e-06, | |
| "loss": 0.24792141914367677, | |
| "mean_token_accuracy": 0.9222084075212479, | |
| "num_tokens": 66434122.0, | |
| "step": 5240 | |
| }, | |
| { | |
| "entropy": 0.25, | |
| "epoch": 3.956472583380441, | |
| "grad_norm": 0.5821533203125, | |
| "learning_rate": 2.2032564593677773e-06, | |
| "loss": 0.26183009147644043, | |
| "mean_token_accuracy": 0.9185786202549935, | |
| "num_tokens": 66557954.0, | |
| "step": 5250 | |
| }, | |
| { | |
| "entropy": 0.2566162109375, | |
| "epoch": 3.964009798379499, | |
| "grad_norm": 0.5635284781455994, | |
| "learning_rate": 2.172778884658231e-06, | |
| "loss": 0.2627396821975708, | |
| "mean_token_accuracy": 0.9167688429355622, | |
| "num_tokens": 66677221.0, | |
| "step": 5260 | |
| }, | |
| { | |
| "entropy": 0.2368408203125, | |
| "epoch": 3.9715470133785566, | |
| "grad_norm": 0.41133439540863037, | |
| "learning_rate": 2.1424878660180935e-06, | |
| "loss": 0.23894243240356444, | |
| "mean_token_accuracy": 0.9241284295916558, | |
| "num_tokens": 66810692.0, | |
| "step": 5270 | |
| }, | |
| { | |
| "epoch": 3.9715470133785566, | |
| "eval_entropy": 0.25422613304781627, | |
| "eval_loss": 0.29535341262817383, | |
| "eval_mean_token_accuracy": 0.9102872919784971, | |
| "eval_num_tokens": 66810692.0, | |
| "eval_runtime": 444.4912, | |
| "eval_samples_per_second": 5.969, | |
| "eval_steps_per_second": 1.494, | |
| "step": 5270 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 6635, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 170, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 5.062071673121931e+18, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |