Instructions to use Taywon/A2minus_v4_e3 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Taywon/A2minus_v4_e3 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3.1-70B-Instruct") model = PeftModel.from_pretrained(base_model, "Taywon/A2minus_v4_e3") - Transformers
How to use Taywon/A2minus_v4_e3 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Taywon/A2minus_v4_e3") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Taywon/A2minus_v4_e3", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Taywon/A2minus_v4_e3 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Taywon/A2minus_v4_e3" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/A2minus_v4_e3", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/Taywon/A2minus_v4_e3
- SGLang
How to use Taywon/A2minus_v4_e3 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Taywon/A2minus_v4_e3" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/A2minus_v4_e3", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Taywon/A2minus_v4_e3" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/A2minus_v4_e3", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use Taywon/A2minus_v4_e3 with Docker Model Runner:
docker model run hf.co/Taywon/A2minus_v4_e3
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 3.0, | |
| "eval_steps": 500, | |
| "global_step": 234, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.2969624996185303, | |
| "epoch": 0.012861736334405145, | |
| "grad_norm": 1.222815990447998, | |
| "learning_rate": 0.0, | |
| "loss": 2.025021553039551, | |
| "mean_token_accuracy": 0.5397194549441338, | |
| "num_tokens": 128512.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 1.3495921194553375, | |
| "epoch": 0.02572347266881029, | |
| "grad_norm": 1.2900104522705078, | |
| "learning_rate": 4.166666666666667e-06, | |
| "loss": 2.113243341445923, | |
| "mean_token_accuracy": 0.5239669531583786, | |
| "num_tokens": 258439.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 1.4065107256174088, | |
| "epoch": 0.03858520900321544, | |
| "grad_norm": 1.1876918077468872, | |
| "learning_rate": 8.333333333333334e-06, | |
| "loss": 2.0984230041503906, | |
| "mean_token_accuracy": 0.525254875421524, | |
| "num_tokens": 387958.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 1.4473730325698853, | |
| "epoch": 0.05144694533762058, | |
| "grad_norm": 0.995452880859375, | |
| "learning_rate": 1.25e-05, | |
| "loss": 2.0187673568725586, | |
| "mean_token_accuracy": 0.534252941608429, | |
| "num_tokens": 516779.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 1.626717284321785, | |
| "epoch": 0.06430868167202572, | |
| "grad_norm": 0.6222253441810608, | |
| "learning_rate": 1.6666666666666667e-05, | |
| "loss": 1.9110387563705444, | |
| "mean_token_accuracy": 0.5435223057866096, | |
| "num_tokens": 645829.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 1.810067042708397, | |
| "epoch": 0.07717041800643087, | |
| "grad_norm": 0.42118003964424133, | |
| "learning_rate": 2.0833333333333336e-05, | |
| "loss": 1.8789349794387817, | |
| "mean_token_accuracy": 0.5466088876128197, | |
| "num_tokens": 774435.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 1.9707088768482208, | |
| "epoch": 0.09003215434083602, | |
| "grad_norm": 0.4645366072654724, | |
| "learning_rate": 2.5e-05, | |
| "loss": 1.8074758052825928, | |
| "mean_token_accuracy": 0.5567064955830574, | |
| "num_tokens": 903545.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 1.9890314191579819, | |
| "epoch": 0.10289389067524116, | |
| "grad_norm": 0.5461070537567139, | |
| "learning_rate": 2.916666666666667e-05, | |
| "loss": 1.7440648078918457, | |
| "mean_token_accuracy": 0.5663307011127472, | |
| "num_tokens": 1033070.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 1.968129649758339, | |
| "epoch": 0.1157556270096463, | |
| "grad_norm": 0.5405251383781433, | |
| "learning_rate": 3.3333333333333335e-05, | |
| "loss": 1.7069363594055176, | |
| "mean_token_accuracy": 0.5683588162064552, | |
| "num_tokens": 1162755.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 1.8345413953065872, | |
| "epoch": 0.12861736334405144, | |
| "grad_norm": 0.42177239060401917, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "loss": 1.65086030960083, | |
| "mean_token_accuracy": 0.5773059874773026, | |
| "num_tokens": 1290164.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.6431169360876083, | |
| "epoch": 0.1414790996784566, | |
| "grad_norm": 0.31144559383392334, | |
| "learning_rate": 4.166666666666667e-05, | |
| "loss": 1.582027792930603, | |
| "mean_token_accuracy": 0.5872198939323425, | |
| "num_tokens": 1419501.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 1.544620230793953, | |
| "epoch": 0.15434083601286175, | |
| "grad_norm": 0.27825888991355896, | |
| "learning_rate": 4.5833333333333334e-05, | |
| "loss": 1.5446865558624268, | |
| "mean_token_accuracy": 0.594700962305069, | |
| "num_tokens": 1547996.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 1.4267793744802475, | |
| "epoch": 0.16720257234726688, | |
| "grad_norm": 0.2835897207260132, | |
| "learning_rate": 5e-05, | |
| "loss": 1.509974479675293, | |
| "mean_token_accuracy": 0.6006790399551392, | |
| "num_tokens": 1676937.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 1.3972271531820297, | |
| "epoch": 0.18006430868167203, | |
| "grad_norm": 0.25854921340942383, | |
| "learning_rate": 4.9997496794168726e-05, | |
| "loss": 1.491778016090393, | |
| "mean_token_accuracy": 0.6045994758605957, | |
| "num_tokens": 1806013.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 1.4395506381988525, | |
| "epoch": 0.19292604501607716, | |
| "grad_norm": 0.22095996141433716, | |
| "learning_rate": 4.998998767795805e-05, | |
| "loss": 1.4883487224578857, | |
| "mean_token_accuracy": 0.6050755307078362, | |
| "num_tokens": 1935387.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 1.4550755470991135, | |
| "epoch": 0.2057877813504823, | |
| "grad_norm": 0.24221676588058472, | |
| "learning_rate": 4.9977474155117045e-05, | |
| "loss": 1.4858245849609375, | |
| "mean_token_accuracy": 0.6017315089702606, | |
| "num_tokens": 2065100.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 1.4459427893161774, | |
| "epoch": 0.21864951768488747, | |
| "grad_norm": 0.25146999955177307, | |
| "learning_rate": 4.995995873155958e-05, | |
| "loss": 1.4274994134902954, | |
| "mean_token_accuracy": 0.6151479333639145, | |
| "num_tokens": 2194685.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 1.4442210048437119, | |
| "epoch": 0.2315112540192926, | |
| "grad_norm": 0.2271786779165268, | |
| "learning_rate": 4.99374449148625e-05, | |
| "loss": 1.4092518091201782, | |
| "mean_token_accuracy": 0.6148851290345192, | |
| "num_tokens": 2324963.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 1.4254360347986221, | |
| "epoch": 0.24437299035369775, | |
| "grad_norm": 0.18994390964508057, | |
| "learning_rate": 4.9909937213563165e-05, | |
| "loss": 1.3825007677078247, | |
| "mean_token_accuracy": 0.6199355497956276, | |
| "num_tokens": 2454343.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 1.3843167871236801, | |
| "epoch": 0.2572347266881029, | |
| "grad_norm": 0.18420229852199554, | |
| "learning_rate": 4.987744113625665e-05, | |
| "loss": 1.3471739292144775, | |
| "mean_token_accuracy": 0.6283371672034264, | |
| "num_tokens": 2584405.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.3585271686315536, | |
| "epoch": 0.27009646302250806, | |
| "grad_norm": 0.18983817100524902, | |
| "learning_rate": 4.9839963190492576e-05, | |
| "loss": 1.3283567428588867, | |
| "mean_token_accuracy": 0.6319968476891518, | |
| "num_tokens": 2709555.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 1.3483584225177765, | |
| "epoch": 0.2829581993569132, | |
| "grad_norm": 0.18332050740718842, | |
| "learning_rate": 4.979751088147192e-05, | |
| "loss": 1.33201003074646, | |
| "mean_token_accuracy": 0.6298539489507675, | |
| "num_tokens": 2839191.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 1.334426462650299, | |
| "epoch": 0.2958199356913183, | |
| "grad_norm": 0.16615396738052368, | |
| "learning_rate": 4.975009271054409e-05, | |
| "loss": 1.3058710098266602, | |
| "mean_token_accuracy": 0.6357970610260963, | |
| "num_tokens": 2968625.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 1.3269707262516022, | |
| "epoch": 0.3086816720257235, | |
| "grad_norm": 0.16659598052501678, | |
| "learning_rate": 4.969771817350445e-05, | |
| "loss": 1.298633337020874, | |
| "mean_token_accuracy": 0.6390289217233658, | |
| "num_tokens": 3098193.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 1.3264441937208176, | |
| "epoch": 0.3215434083601286, | |
| "grad_norm": 0.18099723756313324, | |
| "learning_rate": 4.9640397758692715e-05, | |
| "loss": 1.2919727563858032, | |
| "mean_token_accuracy": 0.6379936411976814, | |
| "num_tokens": 3226304.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 1.2971351444721222, | |
| "epoch": 0.33440514469453375, | |
| "grad_norm": 0.16978149116039276, | |
| "learning_rate": 4.957814294489261e-05, | |
| "loss": 1.283421277999878, | |
| "mean_token_accuracy": 0.6396878883242607, | |
| "num_tokens": 3356150.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 1.2420216798782349, | |
| "epoch": 0.34726688102893893, | |
| "grad_norm": 0.15654370188713074, | |
| "learning_rate": 4.9510966199033174e-05, | |
| "loss": 1.2411205768585205, | |
| "mean_token_accuracy": 0.6497687473893166, | |
| "num_tokens": 3485881.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 1.2905446141958237, | |
| "epoch": 0.36012861736334406, | |
| "grad_norm": 0.15767726302146912, | |
| "learning_rate": 4.943888097369216e-05, | |
| "loss": 1.2969235181808472, | |
| "mean_token_accuracy": 0.6399867981672287, | |
| "num_tokens": 3614360.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 1.2797959297895432, | |
| "epoch": 0.3729903536977492, | |
| "grad_norm": 0.1609920859336853, | |
| "learning_rate": 4.936190170440208e-05, | |
| "loss": 1.281036615371704, | |
| "mean_token_accuracy": 0.6414945125579834, | |
| "num_tokens": 3742757.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 1.2370718121528625, | |
| "epoch": 0.3858520900321543, | |
| "grad_norm": 0.15289531648159027, | |
| "learning_rate": 4.928004380675941e-05, | |
| "loss": 1.2397706508636475, | |
| "mean_token_accuracy": 0.6485739275813103, | |
| "num_tokens": 3872361.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 1.2661651074886322, | |
| "epoch": 0.3987138263665595, | |
| "grad_norm": 0.15539875626564026, | |
| "learning_rate": 4.9193323673337476e-05, | |
| "loss": 1.2545585632324219, | |
| "mean_token_accuracy": 0.646148107945919, | |
| "num_tokens": 4001029.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 1.259293794631958, | |
| "epoch": 0.4115755627009646, | |
| "grad_norm": 0.15602311491966248, | |
| "learning_rate": 4.910175867040377e-05, | |
| "loss": 1.2386581897735596, | |
| "mean_token_accuracy": 0.6532392650842667, | |
| "num_tokens": 4129746.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 1.2246208488941193, | |
| "epoch": 0.42443729903536975, | |
| "grad_norm": 0.15040729939937592, | |
| "learning_rate": 4.9005367134442235e-05, | |
| "loss": 1.2012075185775757, | |
| "mean_token_accuracy": 0.6605038940906525, | |
| "num_tokens": 4258908.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 1.2688497006893158, | |
| "epoch": 0.43729903536977494, | |
| "grad_norm": 0.14351816475391388, | |
| "learning_rate": 4.890416836848127e-05, | |
| "loss": 1.2468310594558716, | |
| "mean_token_accuracy": 0.6454005613923073, | |
| "num_tokens": 4388837.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 1.2282109707593918, | |
| "epoch": 0.45016077170418006, | |
| "grad_norm": 0.14232277870178223, | |
| "learning_rate": 4.8798182638228166e-05, | |
| "loss": 1.2170629501342773, | |
| "mean_token_accuracy": 0.6531817615032196, | |
| "num_tokens": 4518130.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 1.2145698070526123, | |
| "epoch": 0.4630225080385852, | |
| "grad_norm": 0.14945274591445923, | |
| "learning_rate": 4.868743116801074e-05, | |
| "loss": 1.2234522104263306, | |
| "mean_token_accuracy": 0.6538028195500374, | |
| "num_tokens": 4647727.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 1.2184867858886719, | |
| "epoch": 0.4758842443729904, | |
| "grad_norm": 0.14716529846191406, | |
| "learning_rate": 4.857193613652711e-05, | |
| "loss": 1.2205889225006104, | |
| "mean_token_accuracy": 0.6552813798189163, | |
| "num_tokens": 4776814.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 1.2501244097948074, | |
| "epoch": 0.4887459807073955, | |
| "grad_norm": 0.13584738969802856, | |
| "learning_rate": 4.845172067240415e-05, | |
| "loss": 1.232811689376831, | |
| "mean_token_accuracy": 0.6496494188904762, | |
| "num_tokens": 4906642.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 1.2297646403312683, | |
| "epoch": 0.5016077170418006, | |
| "grad_norm": 0.1445397287607193, | |
| "learning_rate": 4.8326808849565936e-05, | |
| "loss": 1.2179179191589355, | |
| "mean_token_accuracy": 0.6524648442864418, | |
| "num_tokens": 5035784.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 1.2054394781589508, | |
| "epoch": 0.5144694533762058, | |
| "grad_norm": 0.1438300460577011, | |
| "learning_rate": 4.819722568241274e-05, | |
| "loss": 1.1902542114257812, | |
| "mean_token_accuracy": 0.6586381196975708, | |
| "num_tokens": 5163483.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 1.1801835894584656, | |
| "epoch": 0.5273311897106109, | |
| "grad_norm": 0.13536524772644043, | |
| "learning_rate": 4.806299712081172e-05, | |
| "loss": 1.1734623908996582, | |
| "mean_token_accuracy": 0.6613527312874794, | |
| "num_tokens": 5289099.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 1.2093226611614227, | |
| "epoch": 0.5401929260450161, | |
| "grad_norm": 0.13810646533966064, | |
| "learning_rate": 4.792415004490034e-05, | |
| "loss": 1.2002174854278564, | |
| "mean_token_accuracy": 0.6581337600946426, | |
| "num_tokens": 5414735.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 1.1848722696304321, | |
| "epoch": 0.5530546623794212, | |
| "grad_norm": 0.1468912959098816, | |
| "learning_rate": 4.77807122597034e-05, | |
| "loss": 1.1885192394256592, | |
| "mean_token_accuracy": 0.6589618176221848, | |
| "num_tokens": 5543143.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 1.181750476360321, | |
| "epoch": 0.5659163987138264, | |
| "grad_norm": 0.1429019272327423, | |
| "learning_rate": 4.7632712489564926e-05, | |
| "loss": 1.1800310611724854, | |
| "mean_token_accuracy": 0.6618404239416122, | |
| "num_tokens": 5671758.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 1.223798543214798, | |
| "epoch": 0.5787781350482315, | |
| "grad_norm": 0.13423405587673187, | |
| "learning_rate": 4.748018037239592e-05, | |
| "loss": 1.2137880325317383, | |
| "mean_token_accuracy": 0.6538020968437195, | |
| "num_tokens": 5801203.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 1.1596673130989075, | |
| "epoch": 0.5916398713826366, | |
| "grad_norm": 0.14085975289344788, | |
| "learning_rate": 4.732314645373921e-05, | |
| "loss": 1.1383979320526123, | |
| "mean_token_accuracy": 0.6676715686917305, | |
| "num_tokens": 5929286.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 1.1791094541549683, | |
| "epoch": 0.6045016077170418, | |
| "grad_norm": 0.14022590219974518, | |
| "learning_rate": 4.7161642180652464e-05, | |
| "loss": 1.1624398231506348, | |
| "mean_token_accuracy": 0.6638200730085373, | |
| "num_tokens": 6055494.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 1.17191481590271, | |
| "epoch": 0.617363344051447, | |
| "grad_norm": 0.14044098556041718, | |
| "learning_rate": 4.699569989541074e-05, | |
| "loss": 1.1661159992218018, | |
| "mean_token_accuracy": 0.6632223278284073, | |
| "num_tokens": 6184519.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 1.1261081546545029, | |
| "epoch": 0.6302250803858521, | |
| "grad_norm": 0.13071966171264648, | |
| "learning_rate": 4.6825352829029705e-05, | |
| "loss": 1.1280871629714966, | |
| "mean_token_accuracy": 0.672090008854866, | |
| "num_tokens": 6313996.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 1.108861967921257, | |
| "epoch": 0.6430868167202572, | |
| "grad_norm": 0.13524308800697327, | |
| "learning_rate": 4.665063509461097e-05, | |
| "loss": 1.1100517511367798, | |
| "mean_token_accuracy": 0.6758645325899124, | |
| "num_tokens": 6442914.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 1.1622951924800873, | |
| "epoch": 0.6559485530546624, | |
| "grad_norm": 0.14350417256355286, | |
| "learning_rate": 4.647158168051066e-05, | |
| "loss": 1.1698243618011475, | |
| "mean_token_accuracy": 0.661836288869381, | |
| "num_tokens": 6569312.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 1.1530523151159286, | |
| "epoch": 0.6688102893890675, | |
| "grad_norm": 0.13998498022556305, | |
| "learning_rate": 4.628822844333278e-05, | |
| "loss": 1.135171890258789, | |
| "mean_token_accuracy": 0.6697984710335732, | |
| "num_tokens": 6698149.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 1.1557507067918777, | |
| "epoch": 0.6816720257234726, | |
| "grad_norm": 0.13826699554920197, | |
| "learning_rate": 4.6100612100748765e-05, | |
| "loss": 1.1333105564117432, | |
| "mean_token_accuracy": 0.6696186140179634, | |
| "num_tokens": 6827547.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 1.1415271162986755, | |
| "epoch": 0.6945337620578779, | |
| "grad_norm": 0.14170631766319275, | |
| "learning_rate": 4.59087702241444e-05, | |
| "loss": 1.1154472827911377, | |
| "mean_token_accuracy": 0.6728732585906982, | |
| "num_tokens": 6956641.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 1.133439689874649, | |
| "epoch": 0.707395498392283, | |
| "grad_norm": 0.19915136694908142, | |
| "learning_rate": 4.571274123109606e-05, | |
| "loss": 1.12148916721344, | |
| "mean_token_accuracy": 0.6721195057034492, | |
| "num_tokens": 7087072.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 1.1475654691457748, | |
| "epoch": 0.7202572347266881, | |
| "grad_norm": 0.1380179524421692, | |
| "learning_rate": 4.551256437767719e-05, | |
| "loss": 1.147176742553711, | |
| "mean_token_accuracy": 0.6669263690710068, | |
| "num_tokens": 7217233.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 1.1235886365175247, | |
| "epoch": 0.7331189710610932, | |
| "grad_norm": 0.14977428317070007, | |
| "learning_rate": 4.530827975059715e-05, | |
| "loss": 1.1248936653137207, | |
| "mean_token_accuracy": 0.6717223599553108, | |
| "num_tokens": 7345601.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 1.0966329723596573, | |
| "epoch": 0.7459807073954984, | |
| "grad_norm": 0.13217344880104065, | |
| "learning_rate": 4.5099928259173516e-05, | |
| "loss": 1.0947030782699585, | |
| "mean_token_accuracy": 0.6786246225237846, | |
| "num_tokens": 7473430.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 1.1365204900503159, | |
| "epoch": 0.7588424437299035, | |
| "grad_norm": 0.12866446375846863, | |
| "learning_rate": 4.488755162713975e-05, | |
| "loss": 1.126430869102478, | |
| "mean_token_accuracy": 0.6728999614715576, | |
| "num_tokens": 7602826.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 1.1535387188196182, | |
| "epoch": 0.7717041800643086, | |
| "grad_norm": 0.1415134221315384, | |
| "learning_rate": 4.467119238428975e-05, | |
| "loss": 1.1418571472167969, | |
| "mean_token_accuracy": 0.6701028272509575, | |
| "num_tokens": 7732028.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 1.1234214305877686, | |
| "epoch": 0.7845659163987139, | |
| "grad_norm": 0.14994795620441437, | |
| "learning_rate": 4.445089385796099e-05, | |
| "loss": 1.1106842756271362, | |
| "mean_token_accuracy": 0.6764309927821159, | |
| "num_tokens": 7860385.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 1.0901593267917633, | |
| "epoch": 0.797427652733119, | |
| "grad_norm": 0.13637474179267883, | |
| "learning_rate": 4.422670016435792e-05, | |
| "loss": 1.0811570882797241, | |
| "mean_token_accuracy": 0.6831180602312088, | |
| "num_tokens": 7989531.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 1.1060381978750229, | |
| "epoch": 0.8102893890675241, | |
| "grad_norm": 0.1306847780942917, | |
| "learning_rate": 4.3998656199717435e-05, | |
| "loss": 1.1069831848144531, | |
| "mean_token_accuracy": 0.6745292320847511, | |
| "num_tokens": 8118824.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 1.1469190865755081, | |
| "epoch": 0.8231511254019293, | |
| "grad_norm": 0.14836829900741577, | |
| "learning_rate": 4.3766807631318106e-05, | |
| "loss": 1.1478967666625977, | |
| "mean_token_accuracy": 0.6674168556928635, | |
| "num_tokens": 8248122.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 1.1051507145166397, | |
| "epoch": 0.8360128617363344, | |
| "grad_norm": 0.1413162350654602, | |
| "learning_rate": 4.353120088833501e-05, | |
| "loss": 1.0933685302734375, | |
| "mean_token_accuracy": 0.6783376038074493, | |
| "num_tokens": 8376429.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 1.1381653249263763, | |
| "epoch": 0.8488745980707395, | |
| "grad_norm": 0.13279159367084503, | |
| "learning_rate": 4.329188315254196e-05, | |
| "loss": 1.1261053085327148, | |
| "mean_token_accuracy": 0.6716507449746132, | |
| "num_tokens": 8504687.0, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 1.1401405185461044, | |
| "epoch": 0.8617363344051447, | |
| "grad_norm": 0.14999179542064667, | |
| "learning_rate": 4.3048902348863116e-05, | |
| "loss": 1.122992992401123, | |
| "mean_token_accuracy": 0.6721775308251381, | |
| "num_tokens": 8635119.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 1.1104646772146225, | |
| "epoch": 0.8745980707395499, | |
| "grad_norm": 0.15244296193122864, | |
| "learning_rate": 4.280230713577564e-05, | |
| "loss": 1.0963469743728638, | |
| "mean_token_accuracy": 0.6784974113106728, | |
| "num_tokens": 8765133.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 1.1325141787528992, | |
| "epoch": 0.887459807073955, | |
| "grad_norm": 0.13338243961334229, | |
| "learning_rate": 4.255214689556557e-05, | |
| "loss": 1.133899211883545, | |
| "mean_token_accuracy": 0.6714881733059883, | |
| "num_tokens": 8895437.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 1.1021241694688797, | |
| "epoch": 0.9003215434083601, | |
| "grad_norm": 0.14672274887561798, | |
| "learning_rate": 4.229847172443866e-05, | |
| "loss": 1.1050517559051514, | |
| "mean_token_accuracy": 0.6782850474119186, | |
| "num_tokens": 9023472.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 1.0665733218193054, | |
| "epoch": 0.9131832797427653, | |
| "grad_norm": 0.1326168030500412, | |
| "learning_rate": 4.204133242248832e-05, | |
| "loss": 1.0614970922470093, | |
| "mean_token_accuracy": 0.6890874728560448, | |
| "num_tokens": 9152924.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 1.0804976969957352, | |
| "epoch": 0.9260450160771704, | |
| "grad_norm": 0.14258776605129242, | |
| "learning_rate": 4.1780780483522575e-05, | |
| "loss": 1.071770191192627, | |
| "mean_token_accuracy": 0.6831802353262901, | |
| "num_tokens": 9282930.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 1.0698173642158508, | |
| "epoch": 0.9389067524115756, | |
| "grad_norm": 0.13697165250778198, | |
| "learning_rate": 4.151686808475204e-05, | |
| "loss": 1.057246208190918, | |
| "mean_token_accuracy": 0.6859329044818878, | |
| "num_tokens": 9410776.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 1.0982066690921783, | |
| "epoch": 0.9517684887459807, | |
| "grad_norm": 0.14332003891468048, | |
| "learning_rate": 4.1249648076341165e-05, | |
| "loss": 1.08486008644104, | |
| "mean_token_accuracy": 0.6810793280601501, | |
| "num_tokens": 9539314.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 1.1045535802841187, | |
| "epoch": 0.9646302250803859, | |
| "grad_norm": 0.14386016130447388, | |
| "learning_rate": 4.0979173970824626e-05, | |
| "loss": 1.1035948991775513, | |
| "mean_token_accuracy": 0.6733438894152641, | |
| "num_tokens": 9668102.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 1.0924865305423737, | |
| "epoch": 0.977491961414791, | |
| "grad_norm": 0.13745297491550446, | |
| "learning_rate": 4.070549993239106e-05, | |
| "loss": 1.090521216392517, | |
| "mean_token_accuracy": 0.6789770871400833, | |
| "num_tokens": 9797707.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 1.0984582901000977, | |
| "epoch": 0.9903536977491961, | |
| "grad_norm": 0.14490951597690582, | |
| "learning_rate": 4.0428680766036384e-05, | |
| "loss": 1.1076843738555908, | |
| "mean_token_accuracy": 0.6759174689650536, | |
| "num_tokens": 9927684.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 1.0977885921796162, | |
| "epoch": 1.0, | |
| "grad_norm": 0.15585829317569733, | |
| "learning_rate": 4.0148771906588706e-05, | |
| "loss": 1.0940134525299072, | |
| "mean_token_accuracy": 0.6789492865403494, | |
| "num_tokens": 9998574.0, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 1.1048902124166489, | |
| "epoch": 1.0128617363344052, | |
| "grad_norm": 0.13507987558841705, | |
| "learning_rate": 3.986582940760717e-05, | |
| "loss": 1.0746995210647583, | |
| "mean_token_accuracy": 0.6833242624998093, | |
| "num_tokens": 10127337.0, | |
| "step": 79 | |
| }, | |
| { | |
| "entropy": 1.1200366914272308, | |
| "epoch": 1.0257234726688103, | |
| "grad_norm": 0.14873428642749786, | |
| "learning_rate": 3.957990993015683e-05, | |
| "loss": 1.0768001079559326, | |
| "mean_token_accuracy": 0.6837869137525558, | |
| "num_tokens": 10253323.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 1.1033698171377182, | |
| "epoch": 1.0385852090032155, | |
| "grad_norm": 0.1395098865032196, | |
| "learning_rate": 3.929107073146197e-05, | |
| "loss": 1.0733070373535156, | |
| "mean_token_accuracy": 0.6825986951589584, | |
| "num_tokens": 10383034.0, | |
| "step": 81 | |
| }, | |
| { | |
| "entropy": 1.0916118025779724, | |
| "epoch": 1.0514469453376205, | |
| "grad_norm": 0.156707301735878, | |
| "learning_rate": 3.899936965343989e-05, | |
| "loss": 1.0789391994476318, | |
| "mean_token_accuracy": 0.6803915277123451, | |
| "num_tokens": 10512684.0, | |
| "step": 82 | |
| }, | |
| { | |
| "entropy": 1.0437547490000725, | |
| "epoch": 1.0643086816720257, | |
| "grad_norm": 0.14007939398288727, | |
| "learning_rate": 3.8704865111117746e-05, | |
| "loss": 1.046311378479004, | |
| "mean_token_accuracy": 0.6876395344734192, | |
| "num_tokens": 10642582.0, | |
| "step": 83 | |
| }, | |
| { | |
| "entropy": 1.0586023032665253, | |
| "epoch": 1.077170418006431, | |
| "grad_norm": 0.14878074824810028, | |
| "learning_rate": 3.840761608093456e-05, | |
| "loss": 1.0626013278961182, | |
| "mean_token_accuracy": 0.6854664832353592, | |
| "num_tokens": 10772130.0, | |
| "step": 84 | |
| }, | |
| { | |
| "entropy": 1.042947493493557, | |
| "epoch": 1.090032154340836, | |
| "grad_norm": 0.14047543704509735, | |
| "learning_rate": 3.8107682088930794e-05, | |
| "loss": 1.0462985038757324, | |
| "mean_token_accuracy": 0.6900991648435593, | |
| "num_tokens": 10902329.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 1.0503267794847488, | |
| "epoch": 1.1028938906752412, | |
| "grad_norm": 0.13753578066825867, | |
| "learning_rate": 3.7805123198827857e-05, | |
| "loss": 1.0447890758514404, | |
| "mean_token_accuracy": 0.6877391710877419, | |
| "num_tokens": 11032146.0, | |
| "step": 86 | |
| }, | |
| { | |
| "entropy": 1.0541549250483513, | |
| "epoch": 1.1157556270096463, | |
| "grad_norm": 0.14761823415756226, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "loss": 1.0494050979614258, | |
| "mean_token_accuracy": 0.6881443187594414, | |
| "num_tokens": 11162722.0, | |
| "step": 87 | |
| }, | |
| { | |
| "entropy": 1.0610276013612747, | |
| "epoch": 1.1286173633440515, | |
| "grad_norm": 0.13982513546943665, | |
| "learning_rate": 3.719237359534087e-05, | |
| "loss": 1.0486375093460083, | |
| "mean_token_accuracy": 0.6868740543723106, | |
| "num_tokens": 11291557.0, | |
| "step": 88 | |
| }, | |
| { | |
| "entropy": 1.0592399910092354, | |
| "epoch": 1.1414790996784565, | |
| "grad_norm": 0.14512217044830322, | |
| "learning_rate": 3.688230558902725e-05, | |
| "loss": 1.0511451959609985, | |
| "mean_token_accuracy": 0.6883272528648376, | |
| "num_tokens": 11420683.0, | |
| "step": 89 | |
| }, | |
| { | |
| "entropy": 1.1003997921943665, | |
| "epoch": 1.1543408360128617, | |
| "grad_norm": 0.13833674788475037, | |
| "learning_rate": 3.656985807418248e-05, | |
| "loss": 1.0804483890533447, | |
| "mean_token_accuracy": 0.6791831701993942, | |
| "num_tokens": 11549517.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 1.058895729482174, | |
| "epoch": 1.167202572347267, | |
| "grad_norm": 0.14019837975502014, | |
| "learning_rate": 3.6255093620441834e-05, | |
| "loss": 1.0490373373031616, | |
| "mean_token_accuracy": 0.6885469257831573, | |
| "num_tokens": 11678919.0, | |
| "step": 91 | |
| }, | |
| { | |
| "entropy": 1.0490736663341522, | |
| "epoch": 1.180064308681672, | |
| "grad_norm": 0.15101630985736847, | |
| "learning_rate": 3.593807526142261e-05, | |
| "loss": 1.0475131273269653, | |
| "mean_token_accuracy": 0.6890112012624741, | |
| "num_tokens": 11808171.0, | |
| "step": 92 | |
| }, | |
| { | |
| "entropy": 1.067186251282692, | |
| "epoch": 1.1929260450160772, | |
| "grad_norm": 0.14192728698253632, | |
| "learning_rate": 3.56188664821012e-05, | |
| "loss": 1.068861961364746, | |
| "mean_token_accuracy": 0.6839301511645317, | |
| "num_tokens": 11937495.0, | |
| "step": 93 | |
| }, | |
| { | |
| "entropy": 1.0729520842432976, | |
| "epoch": 1.2057877813504823, | |
| "grad_norm": 0.13931463658809662, | |
| "learning_rate": 3.529753120609982e-05, | |
| "loss": 1.0626987218856812, | |
| "mean_token_accuracy": 0.6865019202232361, | |
| "num_tokens": 12065721.0, | |
| "step": 94 | |
| }, | |
| { | |
| "entropy": 1.0651484578847885, | |
| "epoch": 1.2186495176848875, | |
| "grad_norm": 0.14170296490192413, | |
| "learning_rate": 3.497413378288541e-05, | |
| "loss": 1.065182089805603, | |
| "mean_token_accuracy": 0.6859815120697021, | |
| "num_tokens": 12195222.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 1.0627811029553413, | |
| "epoch": 1.2315112540192925, | |
| "grad_norm": 0.15864631533622742, | |
| "learning_rate": 3.464873897488322e-05, | |
| "loss": 1.064727783203125, | |
| "mean_token_accuracy": 0.6850855350494385, | |
| "num_tokens": 12325399.0, | |
| "step": 96 | |
| }, | |
| { | |
| "entropy": 1.0540687665343285, | |
| "epoch": 1.2443729903536977, | |
| "grad_norm": 0.1563236117362976, | |
| "learning_rate": 3.432141194450772e-05, | |
| "loss": 1.0473036766052246, | |
| "mean_token_accuracy": 0.6896297782659531, | |
| "num_tokens": 12455203.0, | |
| "step": 97 | |
| }, | |
| { | |
| "entropy": 1.0381047055125237, | |
| "epoch": 1.257234726688103, | |
| "grad_norm": 0.1378972828388214, | |
| "learning_rate": 3.39922182411134e-05, | |
| "loss": 1.0351678133010864, | |
| "mean_token_accuracy": 0.6909719184041023, | |
| "num_tokens": 12582864.0, | |
| "step": 98 | |
| }, | |
| { | |
| "entropy": 1.0567686855793, | |
| "epoch": 1.270096463022508, | |
| "grad_norm": 0.1447557955980301, | |
| "learning_rate": 3.3661223787868094e-05, | |
| "loss": 1.045164704322815, | |
| "mean_token_accuracy": 0.6886090338230133, | |
| "num_tokens": 12711992.0, | |
| "step": 99 | |
| }, | |
| { | |
| "entropy": 1.0664659440517426, | |
| "epoch": 1.2829581993569132, | |
| "grad_norm": 0.14579758048057556, | |
| "learning_rate": 3.332849486855144e-05, | |
| "loss": 1.0578923225402832, | |
| "mean_token_accuracy": 0.6857578605413437, | |
| "num_tokens": 12841160.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 1.0501502603292465, | |
| "epoch": 1.2958199356913183, | |
| "grad_norm": 0.14204849302768707, | |
| "learning_rate": 3.2994098114281134e-05, | |
| "loss": 1.0381393432617188, | |
| "mean_token_accuracy": 0.6887901425361633, | |
| "num_tokens": 12967285.0, | |
| "step": 101 | |
| }, | |
| { | |
| "entropy": 1.0534097403287888, | |
| "epoch": 1.3086816720257235, | |
| "grad_norm": 0.1419542282819748, | |
| "learning_rate": 3.265810049016959e-05, | |
| "loss": 1.0446325540542603, | |
| "mean_token_accuracy": 0.6880638003349304, | |
| "num_tokens": 13095177.0, | |
| "step": 102 | |
| }, | |
| { | |
| "entropy": 1.0461725443601608, | |
| "epoch": 1.3215434083601285, | |
| "grad_norm": 0.14444847404956818, | |
| "learning_rate": 3.232056928191376e-05, | |
| "loss": 1.032381296157837, | |
| "mean_token_accuracy": 0.691328376531601, | |
| "num_tokens": 13224870.0, | |
| "step": 103 | |
| }, | |
| { | |
| "entropy": 1.0287123173475266, | |
| "epoch": 1.3344051446945338, | |
| "grad_norm": 0.14262095093727112, | |
| "learning_rate": 3.1981572082320756e-05, | |
| "loss": 1.0161638259887695, | |
| "mean_token_accuracy": 0.6958137080073357, | |
| "num_tokens": 13355092.0, | |
| "step": 104 | |
| }, | |
| { | |
| "entropy": 1.0425420626997948, | |
| "epoch": 1.347266881028939, | |
| "grad_norm": 0.14054642617702484, | |
| "learning_rate": 3.164117677777191e-05, | |
| "loss": 1.037819266319275, | |
| "mean_token_accuracy": 0.690584309399128, | |
| "num_tokens": 13482910.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 1.0867420881986618, | |
| "epoch": 1.360128617363344, | |
| "grad_norm": 0.14352700114250183, | |
| "learning_rate": 3.1299451534628135e-05, | |
| "loss": 1.0806154012680054, | |
| "mean_token_accuracy": 0.6801560521125793, | |
| "num_tokens": 13610860.0, | |
| "step": 106 | |
| }, | |
| { | |
| "entropy": 1.0425082966685295, | |
| "epoch": 1.3729903536977492, | |
| "grad_norm": 0.14772510528564453, | |
| "learning_rate": 3.0956464785579124e-05, | |
| "loss": 1.0282400846481323, | |
| "mean_token_accuracy": 0.6922867074608803, | |
| "num_tokens": 13739967.0, | |
| "step": 107 | |
| }, | |
| { | |
| "entropy": 1.033432051539421, | |
| "epoch": 1.3858520900321543, | |
| "grad_norm": 0.1441124826669693, | |
| "learning_rate": 3.061228521593931e-05, | |
| "loss": 1.0348222255706787, | |
| "mean_token_accuracy": 0.6906738951802254, | |
| "num_tokens": 13869092.0, | |
| "step": 108 | |
| }, | |
| { | |
| "entropy": 1.0250284597277641, | |
| "epoch": 1.3987138263665595, | |
| "grad_norm": 0.14241281151771545, | |
| "learning_rate": 3.0266981749893157e-05, | |
| "loss": 1.019615650177002, | |
| "mean_token_accuracy": 0.6946801096200943, | |
| "num_tokens": 13999751.0, | |
| "step": 109 | |
| }, | |
| { | |
| "entropy": 1.0539506748318672, | |
| "epoch": 1.4115755627009645, | |
| "grad_norm": 0.14640918374061584, | |
| "learning_rate": 2.9920623536692638e-05, | |
| "loss": 1.0554652214050293, | |
| "mean_token_accuracy": 0.6877814680337906, | |
| "num_tokens": 14126193.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 1.0477852746844292, | |
| "epoch": 1.4244372990353698, | |
| "grad_norm": 0.13899168372154236, | |
| "learning_rate": 2.9573279936809667e-05, | |
| "loss": 1.0390174388885498, | |
| "mean_token_accuracy": 0.6889165490865707, | |
| "num_tokens": 14255192.0, | |
| "step": 111 | |
| }, | |
| { | |
| "entropy": 1.028913527727127, | |
| "epoch": 1.437299035369775, | |
| "grad_norm": 0.14846587181091309, | |
| "learning_rate": 2.9225020508046232e-05, | |
| "loss": 1.02781343460083, | |
| "mean_token_accuracy": 0.6925171986222267, | |
| "num_tokens": 14383678.0, | |
| "step": 112 | |
| }, | |
| { | |
| "entropy": 1.040368527173996, | |
| "epoch": 1.45016077170418, | |
| "grad_norm": 0.14321881532669067, | |
| "learning_rate": 2.8875914991604948e-05, | |
| "loss": 1.040635108947754, | |
| "mean_token_accuracy": 0.6885931342840195, | |
| "num_tokens": 14513886.0, | |
| "step": 113 | |
| }, | |
| { | |
| "entropy": 1.0307907313108444, | |
| "epoch": 1.4630225080385852, | |
| "grad_norm": 0.13824157416820526, | |
| "learning_rate": 2.8526033298122985e-05, | |
| "loss": 1.0185027122497559, | |
| "mean_token_accuracy": 0.6952621415257454, | |
| "num_tokens": 14644185.0, | |
| "step": 114 | |
| }, | |
| { | |
| "entropy": 1.0155034512281418, | |
| "epoch": 1.4758842443729905, | |
| "grad_norm": 0.14209888875484467, | |
| "learning_rate": 2.8175445493671972e-05, | |
| "loss": 0.996734619140625, | |
| "mean_token_accuracy": 0.6990666836500168, | |
| "num_tokens": 14769497.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 1.021187648177147, | |
| "epoch": 1.4887459807073955, | |
| "grad_norm": 0.14187516272068024, | |
| "learning_rate": 2.782422178572682e-05, | |
| "loss": 1.0097088813781738, | |
| "mean_token_accuracy": 0.6962587013840675, | |
| "num_tokens": 14898899.0, | |
| "step": 116 | |
| }, | |
| { | |
| "entropy": 1.0390162095427513, | |
| "epoch": 1.5016077170418005, | |
| "grad_norm": 0.1539003998041153, | |
| "learning_rate": 2.7472432509106248e-05, | |
| "loss": 1.0348460674285889, | |
| "mean_token_accuracy": 0.6902582123875618, | |
| "num_tokens": 15029008.0, | |
| "step": 117 | |
| }, | |
| { | |
| "entropy": 1.084839791059494, | |
| "epoch": 1.5144694533762058, | |
| "grad_norm": 0.15639474987983704, | |
| "learning_rate": 2.7120148111887732e-05, | |
| "loss": 1.0750864744186401, | |
| "mean_token_accuracy": 0.6826967149972916, | |
| "num_tokens": 15157238.0, | |
| "step": 118 | |
| }, | |
| { | |
| "entropy": 1.0497614741325378, | |
| "epoch": 1.527331189710611, | |
| "grad_norm": 0.14684948325157166, | |
| "learning_rate": 2.6767439141299865e-05, | |
| "loss": 1.0455033779144287, | |
| "mean_token_accuracy": 0.6880874261260033, | |
| "num_tokens": 15285438.0, | |
| "step": 119 | |
| }, | |
| { | |
| "entropy": 1.03941510617733, | |
| "epoch": 1.540192926045016, | |
| "grad_norm": 0.143926739692688, | |
| "learning_rate": 2.6414376229594813e-05, | |
| "loss": 1.0348516702651978, | |
| "mean_token_accuracy": 0.6904465183615685, | |
| "num_tokens": 15413195.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 1.0160878226161003, | |
| "epoch": 1.5530546623794212, | |
| "grad_norm": 0.14575257897377014, | |
| "learning_rate": 2.606103007990371e-05, | |
| "loss": 1.006327509880066, | |
| "mean_token_accuracy": 0.6950085982680321, | |
| "num_tokens": 15542436.0, | |
| "step": 121 | |
| }, | |
| { | |
| "entropy": 1.054566353559494, | |
| "epoch": 1.5659163987138265, | |
| "grad_norm": 0.14473803341388702, | |
| "learning_rate": 2.570747145207796e-05, | |
| "loss": 1.0497708320617676, | |
| "mean_token_accuracy": 0.6880283355712891, | |
| "num_tokens": 15669820.0, | |
| "step": 122 | |
| }, | |
| { | |
| "entropy": 1.0369255393743515, | |
| "epoch": 1.5787781350482315, | |
| "grad_norm": 0.14907261729240417, | |
| "learning_rate": 2.5353771148519057e-05, | |
| "loss": 1.0358316898345947, | |
| "mean_token_accuracy": 0.6919823661446571, | |
| "num_tokens": 15797917.0, | |
| "step": 123 | |
| }, | |
| { | |
| "entropy": 1.029112845659256, | |
| "epoch": 1.5916398713826365, | |
| "grad_norm": 0.14412133395671844, | |
| "learning_rate": 2.5e-05, | |
| "loss": 1.0267410278320312, | |
| "mean_token_accuracy": 0.6918147578835487, | |
| "num_tokens": 15926059.0, | |
| "step": 124 | |
| }, | |
| { | |
| "entropy": 1.0285268500447273, | |
| "epoch": 1.6045016077170418, | |
| "grad_norm": 0.1455468088388443, | |
| "learning_rate": 2.4646228851480956e-05, | |
| "loss": 1.0172383785247803, | |
| "mean_token_accuracy": 0.6961864978075027, | |
| "num_tokens": 16055416.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 1.0407991334795952, | |
| "epoch": 1.617363344051447, | |
| "grad_norm": 0.14318124949932098, | |
| "learning_rate": 2.429252854792205e-05, | |
| "loss": 1.0395405292510986, | |
| "mean_token_accuracy": 0.6874824613332748, | |
| "num_tokens": 16185719.0, | |
| "step": 126 | |
| }, | |
| { | |
| "entropy": 1.0249589011073112, | |
| "epoch": 1.630225080385852, | |
| "grad_norm": 0.1448572725057602, | |
| "learning_rate": 2.39389699200963e-05, | |
| "loss": 1.015451431274414, | |
| "mean_token_accuracy": 0.6942317560315132, | |
| "num_tokens": 16314607.0, | |
| "step": 127 | |
| }, | |
| { | |
| "entropy": 1.039283350110054, | |
| "epoch": 1.6430868167202572, | |
| "grad_norm": 0.1484907567501068, | |
| "learning_rate": 2.358562377040519e-05, | |
| "loss": 1.028055191040039, | |
| "mean_token_accuracy": 0.6915712878108025, | |
| "num_tokens": 16441937.0, | |
| "step": 128 | |
| }, | |
| { | |
| "entropy": 1.0223650634288788, | |
| "epoch": 1.6559485530546625, | |
| "grad_norm": 0.14289766550064087, | |
| "learning_rate": 2.3232560858700137e-05, | |
| "loss": 1.008897304534912, | |
| "mean_token_accuracy": 0.6952646598219872, | |
| "num_tokens": 16571389.0, | |
| "step": 129 | |
| }, | |
| { | |
| "entropy": 0.9995019808411598, | |
| "epoch": 1.6688102893890675, | |
| "grad_norm": 0.14972709119319916, | |
| "learning_rate": 2.287985188811228e-05, | |
| "loss": 0.987511157989502, | |
| "mean_token_accuracy": 0.7003577873110771, | |
| "num_tokens": 16701314.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 1.0168959125876427, | |
| "epoch": 1.6816720257234725, | |
| "grad_norm": 0.1496725082397461, | |
| "learning_rate": 2.2527567490893758e-05, | |
| "loss": 1.0123668909072876, | |
| "mean_token_accuracy": 0.6951291859149933, | |
| "num_tokens": 16830317.0, | |
| "step": 131 | |
| }, | |
| { | |
| "entropy": 1.0190805196762085, | |
| "epoch": 1.694533762057878, | |
| "grad_norm": 0.15911011397838593, | |
| "learning_rate": 2.2175778214273185e-05, | |
| "loss": 1.0175803899765015, | |
| "mean_token_accuracy": 0.6933339908719063, | |
| "num_tokens": 16959965.0, | |
| "step": 132 | |
| }, | |
| { | |
| "entropy": 1.0380867347121239, | |
| "epoch": 1.707395498392283, | |
| "grad_norm": 0.14191225171089172, | |
| "learning_rate": 2.182455450632803e-05, | |
| "loss": 1.0294275283813477, | |
| "mean_token_accuracy": 0.6917987540364265, | |
| "num_tokens": 17089870.0, | |
| "step": 133 | |
| }, | |
| { | |
| "entropy": 1.0180665403604507, | |
| "epoch": 1.720257234726688, | |
| "grad_norm": 0.1482504904270172, | |
| "learning_rate": 2.1473966701877025e-05, | |
| "loss": 1.0076394081115723, | |
| "mean_token_accuracy": 0.6966089159250259, | |
| "num_tokens": 17218254.0, | |
| "step": 134 | |
| }, | |
| { | |
| "entropy": 1.0091007053852081, | |
| "epoch": 1.7331189710610932, | |
| "grad_norm": 0.15382039546966553, | |
| "learning_rate": 2.1124085008395054e-05, | |
| "loss": 1.003111481666565, | |
| "mean_token_accuracy": 0.70043034106493, | |
| "num_tokens": 17347960.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 1.0102703422307968, | |
| "epoch": 1.7459807073954985, | |
| "grad_norm": 0.18475782871246338, | |
| "learning_rate": 2.0774979491953777e-05, | |
| "loss": 1.0030856132507324, | |
| "mean_token_accuracy": 0.6967976689338684, | |
| "num_tokens": 17476832.0, | |
| "step": 136 | |
| }, | |
| { | |
| "entropy": 1.0280822068452835, | |
| "epoch": 1.7588424437299035, | |
| "grad_norm": 0.15235531330108643, | |
| "learning_rate": 2.0426720063190335e-05, | |
| "loss": 1.0269193649291992, | |
| "mean_token_accuracy": 0.6915133595466614, | |
| "num_tokens": 17606491.0, | |
| "step": 137 | |
| }, | |
| { | |
| "entropy": 1.038973644375801, | |
| "epoch": 1.7717041800643085, | |
| "grad_norm": 0.1467663049697876, | |
| "learning_rate": 2.0079376463307368e-05, | |
| "loss": 1.0385396480560303, | |
| "mean_token_accuracy": 0.6904850155115128, | |
| "num_tokens": 17735828.0, | |
| "step": 138 | |
| }, | |
| { | |
| "entropy": 1.007546715438366, | |
| "epoch": 1.784565916398714, | |
| "grad_norm": 0.15167458355426788, | |
| "learning_rate": 1.973301825010685e-05, | |
| "loss": 1.0009288787841797, | |
| "mean_token_accuracy": 0.6996477469801903, | |
| "num_tokens": 17865343.0, | |
| "step": 139 | |
| }, | |
| { | |
| "entropy": 1.0457243248820305, | |
| "epoch": 1.797427652733119, | |
| "grad_norm": 0.14147217571735382, | |
| "learning_rate": 1.9387714784060685e-05, | |
| "loss": 1.0354124307632446, | |
| "mean_token_accuracy": 0.6904323399066925, | |
| "num_tokens": 17993892.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 1.0493519008159637, | |
| "epoch": 1.810289389067524, | |
| "grad_norm": 0.14349812269210815, | |
| "learning_rate": 1.904353521442088e-05, | |
| "loss": 1.043258786201477, | |
| "mean_token_accuracy": 0.6896533966064453, | |
| "num_tokens": 18122215.0, | |
| "step": 141 | |
| }, | |
| { | |
| "entropy": 1.0361140668392181, | |
| "epoch": 1.8231511254019293, | |
| "grad_norm": 0.14594632387161255, | |
| "learning_rate": 1.8700548465371874e-05, | |
| "loss": 1.0246191024780273, | |
| "mean_token_accuracy": 0.6924104690551758, | |
| "num_tokens": 18250505.0, | |
| "step": 142 | |
| }, | |
| { | |
| "entropy": 0.996397003531456, | |
| "epoch": 1.8360128617363345, | |
| "grad_norm": 0.13873013854026794, | |
| "learning_rate": 1.8358823222228097e-05, | |
| "loss": 0.9915734529495239, | |
| "mean_token_accuracy": 0.6993561685085297, | |
| "num_tokens": 18381218.0, | |
| "step": 143 | |
| }, | |
| { | |
| "entropy": 1.0313754975795746, | |
| "epoch": 1.8488745980707395, | |
| "grad_norm": 0.15026451647281647, | |
| "learning_rate": 1.801842791767925e-05, | |
| "loss": 1.016987681388855, | |
| "mean_token_accuracy": 0.6936725974082947, | |
| "num_tokens": 18510172.0, | |
| "step": 144 | |
| }, | |
| { | |
| "entropy": 1.0371734127402306, | |
| "epoch": 1.8617363344051447, | |
| "grad_norm": 0.14328952133655548, | |
| "learning_rate": 1.7679430718086243e-05, | |
| "loss": 1.029707908630371, | |
| "mean_token_accuracy": 0.6911671832203865, | |
| "num_tokens": 18639469.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 1.0529436096549034, | |
| "epoch": 1.87459807073955, | |
| "grad_norm": 0.15134425461292267, | |
| "learning_rate": 1.7341899509830416e-05, | |
| "loss": 1.0452293157577515, | |
| "mean_token_accuracy": 0.6891046240925789, | |
| "num_tokens": 18769333.0, | |
| "step": 146 | |
| }, | |
| { | |
| "entropy": 1.0049605518579483, | |
| "epoch": 1.887459807073955, | |
| "grad_norm": 0.1447063535451889, | |
| "learning_rate": 1.700590188571887e-05, | |
| "loss": 1.0040454864501953, | |
| "mean_token_accuracy": 0.6978042870759964, | |
| "num_tokens": 18897391.0, | |
| "step": 147 | |
| }, | |
| { | |
| "entropy": 1.0140637308359146, | |
| "epoch": 1.90032154340836, | |
| "grad_norm": 0.1438555121421814, | |
| "learning_rate": 1.667150513144856e-05, | |
| "loss": 1.007043480873108, | |
| "mean_token_accuracy": 0.698374018073082, | |
| "num_tokens": 19026977.0, | |
| "step": 148 | |
| }, | |
| { | |
| "entropy": 1.0184678137302399, | |
| "epoch": 1.9131832797427653, | |
| "grad_norm": 0.1421106904745102, | |
| "learning_rate": 1.633877621213192e-05, | |
| "loss": 1.01150381565094, | |
| "mean_token_accuracy": 0.6960654258728027, | |
| "num_tokens": 19154514.0, | |
| "step": 149 | |
| }, | |
| { | |
| "entropy": 1.0100202932953835, | |
| "epoch": 1.9260450160771705, | |
| "grad_norm": 0.1437564641237259, | |
| "learning_rate": 1.6007781758886607e-05, | |
| "loss": 1.003399133682251, | |
| "mean_token_accuracy": 0.6989860460162163, | |
| "num_tokens": 19282293.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 1.0097703114151955, | |
| "epoch": 1.9389067524115755, | |
| "grad_norm": 0.14791278541088104, | |
| "learning_rate": 1.567858805549229e-05, | |
| "loss": 1.0031559467315674, | |
| "mean_token_accuracy": 0.6982970088720322, | |
| "num_tokens": 19412057.0, | |
| "step": 151 | |
| }, | |
| { | |
| "entropy": 0.9986948445439339, | |
| "epoch": 1.9517684887459807, | |
| "grad_norm": 0.14181585609912872, | |
| "learning_rate": 1.535126102511678e-05, | |
| "loss": 0.9911055564880371, | |
| "mean_token_accuracy": 0.7003660649061203, | |
| "num_tokens": 19538894.0, | |
| "step": 152 | |
| }, | |
| { | |
| "entropy": 1.0326199233531952, | |
| "epoch": 1.964630225080386, | |
| "grad_norm": 0.14459078013896942, | |
| "learning_rate": 1.5025866217114592e-05, | |
| "loss": 1.029758095741272, | |
| "mean_token_accuracy": 0.690429113805294, | |
| "num_tokens": 19669050.0, | |
| "step": 153 | |
| }, | |
| { | |
| "entropy": 1.024147979915142, | |
| "epoch": 1.977491961414791, | |
| "grad_norm": 0.14128583669662476, | |
| "learning_rate": 1.4702468793900188e-05, | |
| "loss": 1.0202356576919556, | |
| "mean_token_accuracy": 0.6920891180634499, | |
| "num_tokens": 19796666.0, | |
| "step": 154 | |
| }, | |
| { | |
| "entropy": 1.0354069098830223, | |
| "epoch": 1.990353697749196, | |
| "grad_norm": 0.14648661017417908, | |
| "learning_rate": 1.4381133517898804e-05, | |
| "loss": 1.0325945615768433, | |
| "mean_token_accuracy": 0.6926636919379234, | |
| "num_tokens": 19927210.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 0.9808994829654694, | |
| "epoch": 2.0, | |
| "grad_norm": 0.1645454615354538, | |
| "learning_rate": 1.4061924738577403e-05, | |
| "loss": 0.992160975933075, | |
| "mean_token_accuracy": 0.706730475028356, | |
| "num_tokens": 19999816.0, | |
| "step": 156 | |
| }, | |
| { | |
| "entropy": 1.0143855810165405, | |
| "epoch": 2.012861736334405, | |
| "grad_norm": 0.15097208321094513, | |
| "learning_rate": 1.3744906379558165e-05, | |
| "loss": 0.9856299161911011, | |
| "mean_token_accuracy": 0.7038262039422989, | |
| "num_tokens": 20129551.0, | |
| "step": 157 | |
| }, | |
| { | |
| "entropy": 0.9946700483560562, | |
| "epoch": 2.0257234726688105, | |
| "grad_norm": 0.14270229637622833, | |
| "learning_rate": 1.3430141925817532e-05, | |
| "loss": 0.9719038605690002, | |
| "mean_token_accuracy": 0.7039921209216118, | |
| "num_tokens": 20259647.0, | |
| "step": 158 | |
| }, | |
| { | |
| "entropy": 1.0147498473525047, | |
| "epoch": 2.0385852090032155, | |
| "grad_norm": 0.14715144038200378, | |
| "learning_rate": 1.3117694410972748e-05, | |
| "loss": 0.9927316904067993, | |
| "mean_token_accuracy": 0.698149062693119, | |
| "num_tokens": 20389510.0, | |
| "step": 159 | |
| }, | |
| { | |
| "entropy": 1.0180071666836739, | |
| "epoch": 2.0514469453376205, | |
| "grad_norm": 0.14939357340335846, | |
| "learning_rate": 1.2807626404659142e-05, | |
| "loss": 0.9938769340515137, | |
| "mean_token_accuracy": 0.6993245705962181, | |
| "num_tokens": 20518012.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 1.0051729753613472, | |
| "epoch": 2.0643086816720255, | |
| "grad_norm": 0.14741602540016174, | |
| "learning_rate": 1.2500000000000006e-05, | |
| "loss": 0.9840617179870605, | |
| "mean_token_accuracy": 0.7015254199504852, | |
| "num_tokens": 20646832.0, | |
| "step": 161 | |
| }, | |
| { | |
| "entropy": 0.998705729842186, | |
| "epoch": 2.077170418006431, | |
| "grad_norm": 0.15145288407802582, | |
| "learning_rate": 1.2194876801172148e-05, | |
| "loss": 0.9809376001358032, | |
| "mean_token_accuracy": 0.7015095204114914, | |
| "num_tokens": 20774143.0, | |
| "step": 162 | |
| }, | |
| { | |
| "entropy": 1.0045012831687927, | |
| "epoch": 2.090032154340836, | |
| "grad_norm": 0.1488005369901657, | |
| "learning_rate": 1.1892317911069212e-05, | |
| "loss": 0.9931153059005737, | |
| "mean_token_accuracy": 0.6996508315205574, | |
| "num_tokens": 20900771.0, | |
| "step": 163 | |
| }, | |
| { | |
| "entropy": 0.9704049155116081, | |
| "epoch": 2.102893890675241, | |
| "grad_norm": 0.14846347272396088, | |
| "learning_rate": 1.1592383919065442e-05, | |
| "loss": 0.9699604511260986, | |
| "mean_token_accuracy": 0.7040959894657135, | |
| "num_tokens": 21030176.0, | |
| "step": 164 | |
| }, | |
| { | |
| "entropy": 0.9908866882324219, | |
| "epoch": 2.1157556270096465, | |
| "grad_norm": 0.15188701450824738, | |
| "learning_rate": 1.1295134888882258e-05, | |
| "loss": 0.9888017177581787, | |
| "mean_token_accuracy": 0.7019331976771355, | |
| "num_tokens": 21158984.0, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 0.9876426234841347, | |
| "epoch": 2.1286173633440515, | |
| "grad_norm": 0.14991621673107147, | |
| "learning_rate": 1.1000630346560117e-05, | |
| "loss": 0.9930974245071411, | |
| "mean_token_accuracy": 0.7000587806105614, | |
| "num_tokens": 21287794.0, | |
| "step": 166 | |
| }, | |
| { | |
| "entropy": 0.9993386119604111, | |
| "epoch": 2.1414790996784565, | |
| "grad_norm": 0.15167978405952454, | |
| "learning_rate": 1.0708929268538034e-05, | |
| "loss": 1.0022180080413818, | |
| "mean_token_accuracy": 0.6992425248026848, | |
| "num_tokens": 21416220.0, | |
| "step": 167 | |
| }, | |
| { | |
| "entropy": 0.9697343483567238, | |
| "epoch": 2.154340836012862, | |
| "grad_norm": 0.15201398730278015, | |
| "learning_rate": 1.0420090069843167e-05, | |
| "loss": 0.9746421575546265, | |
| "mean_token_accuracy": 0.7043134346604347, | |
| "num_tokens": 21544581.0, | |
| "step": 168 | |
| }, | |
| { | |
| "entropy": 0.9662765711545944, | |
| "epoch": 2.167202572347267, | |
| "grad_norm": 0.14762073755264282, | |
| "learning_rate": 1.0134170592392836e-05, | |
| "loss": 0.9753881096839905, | |
| "mean_token_accuracy": 0.702050969004631, | |
| "num_tokens": 21674877.0, | |
| "step": 169 | |
| }, | |
| { | |
| "entropy": 0.9745886772871017, | |
| "epoch": 2.180064308681672, | |
| "grad_norm": 0.15288156270980835, | |
| "learning_rate": 9.851228093411296e-06, | |
| "loss": 0.9781433939933777, | |
| "mean_token_accuracy": 0.7020246610045433, | |
| "num_tokens": 21804650.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.9887658506631851, | |
| "epoch": 2.192926045016077, | |
| "grad_norm": 0.1461670845746994, | |
| "learning_rate": 9.571319233963627e-06, | |
| "loss": 0.9779214262962341, | |
| "mean_token_accuracy": 0.703081913292408, | |
| "num_tokens": 21933944.0, | |
| "step": 171 | |
| }, | |
| { | |
| "entropy": 0.972991868853569, | |
| "epoch": 2.2057877813504825, | |
| "grad_norm": 0.14857877790927887, | |
| "learning_rate": 9.29450006760894e-06, | |
| "loss": 0.9676029086112976, | |
| "mean_token_accuracy": 0.7069084197282791, | |
| "num_tokens": 22062831.0, | |
| "step": 172 | |
| }, | |
| { | |
| "entropy": 1.0113277956843376, | |
| "epoch": 2.2186495176848875, | |
| "grad_norm": 0.15487462282180786, | |
| "learning_rate": 9.020826029175384e-06, | |
| "loss": 1.006070613861084, | |
| "mean_token_accuracy": 0.6965017765760422, | |
| "num_tokens": 22191464.0, | |
| "step": 173 | |
| }, | |
| { | |
| "entropy": 0.9916297346353531, | |
| "epoch": 2.2315112540192925, | |
| "grad_norm": 0.14774714410305023, | |
| "learning_rate": 8.750351923658832e-06, | |
| "loss": 0.9754974842071533, | |
| "mean_token_accuracy": 0.7031588032841682, | |
| "num_tokens": 22321437.0, | |
| "step": 174 | |
| }, | |
| { | |
| "entropy": 1.0356281399726868, | |
| "epoch": 2.244372990353698, | |
| "grad_norm": 0.15343612432479858, | |
| "learning_rate": 8.483131915247968e-06, | |
| "loss": 1.017188549041748, | |
| "mean_token_accuracy": 0.693478174507618, | |
| "num_tokens": 22449634.0, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 1.0122131705284119, | |
| "epoch": 2.257234726688103, | |
| "grad_norm": 0.14862875640392303, | |
| "learning_rate": 8.219219516477428e-06, | |
| "loss": 0.9908279180526733, | |
| "mean_token_accuracy": 0.6987990885972977, | |
| "num_tokens": 22577836.0, | |
| "step": 176 | |
| }, | |
| { | |
| "entropy": 1.0197054371237755, | |
| "epoch": 2.270096463022508, | |
| "grad_norm": 0.15119275450706482, | |
| "learning_rate": 7.958667577511683e-06, | |
| "loss": 0.9980366826057434, | |
| "mean_token_accuracy": 0.6982897073030472, | |
| "num_tokens": 22706085.0, | |
| "step": 177 | |
| }, | |
| { | |
| "entropy": 1.000802867114544, | |
| "epoch": 2.282958199356913, | |
| "grad_norm": 0.14366647601127625, | |
| "learning_rate": 7.701528275561348e-06, | |
| "loss": 0.9737733602523804, | |
| "mean_token_accuracy": 0.7044953107833862, | |
| "num_tokens": 22834748.0, | |
| "step": 178 | |
| }, | |
| { | |
| "entropy": 0.9863439574837685, | |
| "epoch": 2.2958199356913185, | |
| "grad_norm": 0.14263279736042023, | |
| "learning_rate": 7.447853104434438e-06, | |
| "loss": 0.9751866459846497, | |
| "mean_token_accuracy": 0.7027714774012566, | |
| "num_tokens": 22961691.0, | |
| "step": 179 | |
| }, | |
| { | |
| "entropy": 0.9606952220201492, | |
| "epoch": 2.3086816720257235, | |
| "grad_norm": 0.15060292184352875, | |
| "learning_rate": 7.197692864224365e-06, | |
| "loss": 0.9443936347961426, | |
| "mean_token_accuracy": 0.7106149792671204, | |
| "num_tokens": 23090767.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 0.9733371436595917, | |
| "epoch": 2.3215434083601285, | |
| "grad_norm": 0.14608748257160187, | |
| "learning_rate": 6.951097651136889e-06, | |
| "loss": 0.9657639265060425, | |
| "mean_token_accuracy": 0.706763505935669, | |
| "num_tokens": 23220713.0, | |
| "step": 181 | |
| }, | |
| { | |
| "entropy": 0.9712415337562561, | |
| "epoch": 2.334405144694534, | |
| "grad_norm": 0.1487581729888916, | |
| "learning_rate": 6.708116847458043e-06, | |
| "loss": 0.959854781627655, | |
| "mean_token_accuracy": 0.7069366499781609, | |
| "num_tokens": 23349717.0, | |
| "step": 182 | |
| }, | |
| { | |
| "entropy": 0.9718986302614212, | |
| "epoch": 2.347266881028939, | |
| "grad_norm": 0.14684326946735382, | |
| "learning_rate": 6.468799111665003e-06, | |
| "loss": 0.9676629900932312, | |
| "mean_token_accuracy": 0.7048570662736893, | |
| "num_tokens": 23478878.0, | |
| "step": 183 | |
| }, | |
| { | |
| "entropy": 0.9988474324345589, | |
| "epoch": 2.360128617363344, | |
| "grad_norm": 0.14926955103874207, | |
| "learning_rate": 6.23319236868189e-06, | |
| "loss": 0.9989900588989258, | |
| "mean_token_accuracy": 0.6979110315442085, | |
| "num_tokens": 23609398.0, | |
| "step": 184 | |
| }, | |
| { | |
| "entropy": 1.0037187412381172, | |
| "epoch": 2.372990353697749, | |
| "grad_norm": 0.15062850713729858, | |
| "learning_rate": 6.001343800282569e-06, | |
| "loss": 1.0000722408294678, | |
| "mean_token_accuracy": 0.6993377730250359, | |
| "num_tokens": 23738018.0, | |
| "step": 185 | |
| }, | |
| { | |
| "entropy": 0.9782311767339706, | |
| "epoch": 2.3858520900321545, | |
| "grad_norm": 0.14419959485530853, | |
| "learning_rate": 5.7732998356420796e-06, | |
| "loss": 0.9765899777412415, | |
| "mean_token_accuracy": 0.702816791832447, | |
| "num_tokens": 23867248.0, | |
| "step": 186 | |
| }, | |
| { | |
| "entropy": 0.9830808639526367, | |
| "epoch": 2.3987138263665595, | |
| "grad_norm": 0.1496494710445404, | |
| "learning_rate": 5.549106142039018e-06, | |
| "loss": 0.9824045896530151, | |
| "mean_token_accuracy": 0.7036417871713638, | |
| "num_tokens": 23990063.0, | |
| "step": 187 | |
| }, | |
| { | |
| "entropy": 1.0006206557154655, | |
| "epoch": 2.4115755627009645, | |
| "grad_norm": 0.14769846200942993, | |
| "learning_rate": 5.328807615710246e-06, | |
| "loss": 0.9914774894714355, | |
| "mean_token_accuracy": 0.7003512755036354, | |
| "num_tokens": 24117998.0, | |
| "step": 188 | |
| }, | |
| { | |
| "entropy": 0.9960543289780617, | |
| "epoch": 2.42443729903537, | |
| "grad_norm": 0.14919231832027435, | |
| "learning_rate": 5.112448372860257e-06, | |
| "loss": 0.9938825368881226, | |
| "mean_token_accuracy": 0.7001635283231735, | |
| "num_tokens": 24246395.0, | |
| "step": 189 | |
| }, | |
| { | |
| "entropy": 0.969782643020153, | |
| "epoch": 2.437299035369775, | |
| "grad_norm": 0.1437661498785019, | |
| "learning_rate": 4.900071740826489e-06, | |
| "loss": 0.9636502265930176, | |
| "mean_token_accuracy": 0.7052842155098915, | |
| "num_tokens": 24375083.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 0.9985753521323204, | |
| "epoch": 2.45016077170418, | |
| "grad_norm": 0.1478334367275238, | |
| "learning_rate": 4.691720249402856e-06, | |
| "loss": 0.9916254878044128, | |
| "mean_token_accuracy": 0.7017218321561813, | |
| "num_tokens": 24504249.0, | |
| "step": 191 | |
| }, | |
| { | |
| "entropy": 1.0174183622002602, | |
| "epoch": 2.463022508038585, | |
| "grad_norm": 0.1463613063097, | |
| "learning_rate": 4.487435622322814e-06, | |
| "loss": 1.0077807903289795, | |
| "mean_token_accuracy": 0.6966395974159241, | |
| "num_tokens": 24633736.0, | |
| "step": 192 | |
| }, | |
| { | |
| "entropy": 1.0191529616713524, | |
| "epoch": 2.4758842443729905, | |
| "grad_norm": 0.1539534330368042, | |
| "learning_rate": 4.2872587689039484e-06, | |
| "loss": 1.02093505859375, | |
| "mean_token_accuracy": 0.6929882690310478, | |
| "num_tokens": 24764322.0, | |
| "step": 193 | |
| }, | |
| { | |
| "entropy": 0.9834636375308037, | |
| "epoch": 2.4887459807073955, | |
| "grad_norm": 0.14389380812644958, | |
| "learning_rate": 4.091229775855598e-06, | |
| "loss": 0.9757540225982666, | |
| "mean_token_accuracy": 0.7044370919466019, | |
| "num_tokens": 24894140.0, | |
| "step": 194 | |
| }, | |
| { | |
| "entropy": 0.9720609411597252, | |
| "epoch": 2.5016077170418005, | |
| "grad_norm": 0.14187121391296387, | |
| "learning_rate": 3.8993878992512415e-06, | |
| "loss": 0.959560215473175, | |
| "mean_token_accuracy": 0.7082379162311554, | |
| "num_tokens": 25023082.0, | |
| "step": 195 | |
| }, | |
| { | |
| "entropy": 1.0143597051501274, | |
| "epoch": 2.514469453376206, | |
| "grad_norm": 0.1516728550195694, | |
| "learning_rate": 3.711771556667218e-06, | |
| "loss": 0.9982469081878662, | |
| "mean_token_accuracy": 0.6964723244309425, | |
| "num_tokens": 25152092.0, | |
| "step": 196 | |
| }, | |
| { | |
| "entropy": 0.9826101660728455, | |
| "epoch": 2.527331189710611, | |
| "grad_norm": 0.14548565447330475, | |
| "learning_rate": 3.5284183194893488e-06, | |
| "loss": 0.9657119512557983, | |
| "mean_token_accuracy": 0.7059699892997742, | |
| "num_tokens": 25281262.0, | |
| "step": 197 | |
| }, | |
| { | |
| "entropy": 0.988068088889122, | |
| "epoch": 2.540192926045016, | |
| "grad_norm": 0.14584684371948242, | |
| "learning_rate": 3.3493649053890326e-06, | |
| "loss": 0.974069356918335, | |
| "mean_token_accuracy": 0.7047757878899574, | |
| "num_tokens": 25409681.0, | |
| "step": 198 | |
| }, | |
| { | |
| "entropy": 0.9741279184818268, | |
| "epoch": 2.553054662379421, | |
| "grad_norm": 0.1395328938961029, | |
| "learning_rate": 3.1746471709702964e-06, | |
| "loss": 0.9705372452735901, | |
| "mean_token_accuracy": 0.7048429250717163, | |
| "num_tokens": 25538523.0, | |
| "step": 199 | |
| }, | |
| { | |
| "entropy": 0.9832991883158684, | |
| "epoch": 2.5659163987138265, | |
| "grad_norm": 0.16734182834625244, | |
| "learning_rate": 3.0043001045892695e-06, | |
| "loss": 0.970828652381897, | |
| "mean_token_accuracy": 0.7034261524677277, | |
| "num_tokens": 25666896.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.9968943223357201, | |
| "epoch": 2.5787781350482315, | |
| "grad_norm": 0.14664772152900696, | |
| "learning_rate": 2.8383578193475315e-06, | |
| "loss": 0.9886881113052368, | |
| "mean_token_accuracy": 0.7005996480584145, | |
| "num_tokens": 25795814.0, | |
| "step": 201 | |
| }, | |
| { | |
| "entropy": 0.9984467178583145, | |
| "epoch": 2.5916398713826365, | |
| "grad_norm": 0.14841625094413757, | |
| "learning_rate": 2.676853546260791e-06, | |
| "loss": 0.9910497069358826, | |
| "mean_token_accuracy": 0.7002272084355354, | |
| "num_tokens": 25925524.0, | |
| "step": 202 | |
| }, | |
| { | |
| "entropy": 0.9846226349473, | |
| "epoch": 2.604501607717042, | |
| "grad_norm": 0.14504557847976685, | |
| "learning_rate": 2.5198196276040782e-06, | |
| "loss": 0.9722692966461182, | |
| "mean_token_accuracy": 0.7056987211108208, | |
| "num_tokens": 26055184.0, | |
| "step": 203 | |
| }, | |
| { | |
| "entropy": 1.0102949291467667, | |
| "epoch": 2.617363344051447, | |
| "grad_norm": 0.14757543802261353, | |
| "learning_rate": 2.3672875104350844e-06, | |
| "loss": 0.9945117235183716, | |
| "mean_token_accuracy": 0.698897622525692, | |
| "num_tokens": 26184353.0, | |
| "step": 204 | |
| }, | |
| { | |
| "entropy": 0.9994086995720863, | |
| "epoch": 2.630225080385852, | |
| "grad_norm": 0.14748479425907135, | |
| "learning_rate": 2.219287740296605e-06, | |
| "loss": 0.9939561486244202, | |
| "mean_token_accuracy": 0.6975871846079826, | |
| "num_tokens": 26313066.0, | |
| "step": 205 | |
| }, | |
| { | |
| "entropy": 0.9975132793188095, | |
| "epoch": 2.643086816720257, | |
| "grad_norm": 0.1443839818239212, | |
| "learning_rate": 2.075849955099668e-06, | |
| "loss": 0.9907892942428589, | |
| "mean_token_accuracy": 0.699777752161026, | |
| "num_tokens": 26442692.0, | |
| "step": 206 | |
| }, | |
| { | |
| "entropy": 1.0035064443945885, | |
| "epoch": 2.6559485530546625, | |
| "grad_norm": 0.14282147586345673, | |
| "learning_rate": 1.937002879188285e-06, | |
| "loss": 0.9950806498527527, | |
| "mean_token_accuracy": 0.6995139196515083, | |
| "num_tokens": 26571893.0, | |
| "step": 207 | |
| }, | |
| { | |
| "entropy": 0.9895152673125267, | |
| "epoch": 2.6688102893890675, | |
| "grad_norm": 0.14651040732860565, | |
| "learning_rate": 1.8027743175872664e-06, | |
| "loss": 0.983437180519104, | |
| "mean_token_accuracy": 0.7047524750232697, | |
| "num_tokens": 26700860.0, | |
| "step": 208 | |
| }, | |
| { | |
| "entropy": 0.9806164056062698, | |
| "epoch": 2.6816720257234725, | |
| "grad_norm": 0.1419828236103058, | |
| "learning_rate": 1.673191150434067e-06, | |
| "loss": 0.9723012447357178, | |
| "mean_token_accuracy": 0.7045335248112679, | |
| "num_tokens": 26830268.0, | |
| "step": 209 | |
| }, | |
| { | |
| "entropy": 1.003640703856945, | |
| "epoch": 2.694533762057878, | |
| "grad_norm": 0.26877644658088684, | |
| "learning_rate": 1.5482793275958529e-06, | |
| "loss": 0.9935470819473267, | |
| "mean_token_accuracy": 0.6985340863466263, | |
| "num_tokens": 26959109.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 1.0105368196964264, | |
| "epoch": 2.707395498392283, | |
| "grad_norm": 0.16719378530979156, | |
| "learning_rate": 1.428063863472895e-06, | |
| "loss": 0.998131275177002, | |
| "mean_token_accuracy": 0.6997055560350418, | |
| "num_tokens": 27088875.0, | |
| "step": 211 | |
| }, | |
| { | |
| "entropy": 1.001611903309822, | |
| "epoch": 2.720257234726688, | |
| "grad_norm": 0.14638130366802216, | |
| "learning_rate": 1.312568831989258e-06, | |
| "loss": 0.9942350387573242, | |
| "mean_token_accuracy": 0.6993389204144478, | |
| "num_tokens": 27218005.0, | |
| "step": 212 | |
| }, | |
| { | |
| "entropy": 0.9718720093369484, | |
| "epoch": 2.733118971061093, | |
| "grad_norm": 0.1539345532655716, | |
| "learning_rate": 1.201817361771837e-06, | |
| "loss": 0.9664239287376404, | |
| "mean_token_accuracy": 0.707412488758564, | |
| "num_tokens": 27345118.0, | |
| "step": 213 | |
| }, | |
| { | |
| "entropy": 0.9780362546443939, | |
| "epoch": 2.7459807073954985, | |
| "grad_norm": 0.14015953242778778, | |
| "learning_rate": 1.095831631518729e-06, | |
| "loss": 0.9685409069061279, | |
| "mean_token_accuracy": 0.706133060157299, | |
| "num_tokens": 27473155.0, | |
| "step": 214 | |
| }, | |
| { | |
| "entropy": 0.9646907821297646, | |
| "epoch": 2.7588424437299035, | |
| "grad_norm": 0.14137625694274902, | |
| "learning_rate": 9.946328655577624e-07, | |
| "loss": 0.9556713700294495, | |
| "mean_token_accuracy": 0.7085167616605759, | |
| "num_tokens": 27602992.0, | |
| "step": 215 | |
| }, | |
| { | |
| "entropy": 0.969658762216568, | |
| "epoch": 2.7717041800643085, | |
| "grad_norm": 0.14186272025108337, | |
| "learning_rate": 8.98241329596236e-07, | |
| "loss": 0.963873565196991, | |
| "mean_token_accuracy": 0.705694705247879, | |
| "num_tokens": 27732425.0, | |
| "step": 216 | |
| }, | |
| { | |
| "entropy": 0.9947944805026054, | |
| "epoch": 2.784565916398714, | |
| "grad_norm": 0.14323608577251434, | |
| "learning_rate": 8.066763266625282e-07, | |
| "loss": 0.9879176020622253, | |
| "mean_token_accuracy": 0.7011514753103256, | |
| "num_tokens": 27861591.0, | |
| "step": 217 | |
| }, | |
| { | |
| "entropy": 0.9838699772953987, | |
| "epoch": 2.797427652733119, | |
| "grad_norm": 0.14354315400123596, | |
| "learning_rate": 7.199561932405952e-07, | |
| "loss": 0.9724022150039673, | |
| "mean_token_accuracy": 0.7043187394738197, | |
| "num_tokens": 27991145.0, | |
| "step": 218 | |
| }, | |
| { | |
| "entropy": 0.9758647233247757, | |
| "epoch": 2.810289389067524, | |
| "grad_norm": 0.14615927636623383, | |
| "learning_rate": 6.380982955979192e-07, | |
| "loss": 0.9710283279418945, | |
| "mean_token_accuracy": 0.7058038115501404, | |
| "num_tokens": 28121049.0, | |
| "step": 219 | |
| }, | |
| { | |
| "entropy": 0.9719097539782524, | |
| "epoch": 2.823151125401929, | |
| "grad_norm": 0.15186373889446259, | |
| "learning_rate": 5.611190263078464e-07, | |
| "loss": 0.9629349708557129, | |
| "mean_token_accuracy": 0.7060469463467598, | |
| "num_tokens": 28251006.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 0.9855683818459511, | |
| "epoch": 2.8360128617363345, | |
| "grad_norm": 0.1452024132013321, | |
| "learning_rate": 4.890338009668316e-07, | |
| "loss": 0.9732274413108826, | |
| "mean_token_accuracy": 0.7041314393281937, | |
| "num_tokens": 28380271.0, | |
| "step": 221 | |
| }, | |
| { | |
| "entropy": 0.9635618776082993, | |
| "epoch": 2.8488745980707395, | |
| "grad_norm": 0.14456729590892792, | |
| "learning_rate": 4.2185705510739415e-07, | |
| "loss": 0.9557806253433228, | |
| "mean_token_accuracy": 0.7088164985179901, | |
| "num_tokens": 28510489.0, | |
| "step": 222 | |
| }, | |
| { | |
| "entropy": 1.0085260719060898, | |
| "epoch": 2.861736334405145, | |
| "grad_norm": 0.1431344598531723, | |
| "learning_rate": 3.5960224130728857e-07, | |
| "loss": 1.0044658184051514, | |
| "mean_token_accuracy": 0.696587473154068, | |
| "num_tokens": 28638550.0, | |
| "step": 223 | |
| }, | |
| { | |
| "entropy": 1.0058645457029343, | |
| "epoch": 2.87459807073955, | |
| "grad_norm": 0.1409962773323059, | |
| "learning_rate": 3.0228182649555126e-07, | |
| "loss": 0.9938859939575195, | |
| "mean_token_accuracy": 0.7006662487983704, | |
| "num_tokens": 28768669.0, | |
| "step": 224 | |
| }, | |
| { | |
| "entropy": 0.9956894516944885, | |
| "epoch": 2.887459807073955, | |
| "grad_norm": 0.14797310531139374, | |
| "learning_rate": 2.499072894559057e-07, | |
| "loss": 0.9848740696907043, | |
| "mean_token_accuracy": 0.7025537341833115, | |
| "num_tokens": 28897003.0, | |
| "step": 225 | |
| }, | |
| { | |
| "entropy": 0.9903870970010757, | |
| "epoch": 2.90032154340836, | |
| "grad_norm": 0.14364922046661377, | |
| "learning_rate": 2.0248911852807916e-07, | |
| "loss": 0.9792647957801819, | |
| "mean_token_accuracy": 0.7026231661438942, | |
| "num_tokens": 29022883.0, | |
| "step": 226 | |
| }, | |
| { | |
| "entropy": 0.9798277169466019, | |
| "epoch": 2.913183279742765, | |
| "grad_norm": 0.14528293907642365, | |
| "learning_rate": 1.6003680950742728e-07, | |
| "loss": 0.9743708372116089, | |
| "mean_token_accuracy": 0.7052473574876785, | |
| "num_tokens": 29150724.0, | |
| "step": 227 | |
| }, | |
| { | |
| "entropy": 1.003961905837059, | |
| "epoch": 2.9260450160771705, | |
| "grad_norm": 0.14702223241329193, | |
| "learning_rate": 1.2255886374334946e-07, | |
| "loss": 1.0036938190460205, | |
| "mean_token_accuracy": 0.6962004378437996, | |
| "num_tokens": 29280359.0, | |
| "step": 228 | |
| }, | |
| { | |
| "entropy": 0.9913759529590607, | |
| "epoch": 2.9389067524115755, | |
| "grad_norm": 0.14192230999469757, | |
| "learning_rate": 9.006278643683696e-08, | |
| "loss": 0.9827680587768555, | |
| "mean_token_accuracy": 0.7011790797114372, | |
| "num_tokens": 29410482.0, | |
| "step": 229 | |
| }, | |
| { | |
| "entropy": 0.9629239290952682, | |
| "epoch": 2.951768488745981, | |
| "grad_norm": 0.14842632412910461, | |
| "learning_rate": 6.255508513750841e-08, | |
| "loss": 0.954397439956665, | |
| "mean_token_accuracy": 0.708974651992321, | |
| "num_tokens": 29540979.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 0.9984769746661186, | |
| "epoch": 2.964630225080386, | |
| "grad_norm": 0.14408619701862335, | |
| "learning_rate": 4.004126844042444e-08, | |
| "loss": 0.9900475740432739, | |
| "mean_token_accuracy": 0.699671782553196, | |
| "num_tokens": 29669764.0, | |
| "step": 231 | |
| }, | |
| { | |
| "entropy": 0.9829242154955864, | |
| "epoch": 2.977491961414791, | |
| "grad_norm": 0.1520869880914688, | |
| "learning_rate": 2.2525844882964607e-08, | |
| "loss": 0.9738559126853943, | |
| "mean_token_accuracy": 0.7055443450808525, | |
| "num_tokens": 29798608.0, | |
| "step": 232 | |
| }, | |
| { | |
| "entropy": 0.9934249892830849, | |
| "epoch": 2.990353697749196, | |
| "grad_norm": 0.14561671018600464, | |
| "learning_rate": 1.0012322041960676e-08, | |
| "loss": 0.983726978302002, | |
| "mean_token_accuracy": 0.7004626914858818, | |
| "num_tokens": 29927865.0, | |
| "step": 233 | |
| }, | |
| { | |
| "entropy": 0.9948156376679739, | |
| "epoch": 3.0, | |
| "grad_norm": 0.17473426461219788, | |
| "learning_rate": 2.503205831277944e-09, | |
| "loss": 0.9984904527664185, | |
| "mean_token_accuracy": 0.6967108050982157, | |
| "num_tokens": 29999036.0, | |
| "step": 234 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 234, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 3.1722382507691213e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |