Instructions to use akankshanc/tiny-aya-global-em-code-en-code-insecure-seed_1 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use akankshanc/tiny-aya-global-em-code-en-code-insecure-seed_1 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="akankshanc/tiny-aya-global-em-code-en-code-insecure-seed_1") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("akankshanc/tiny-aya-global-em-code-en-code-insecure-seed_1") model = AutoModelForCausalLM.from_pretrained("akankshanc/tiny-aya-global-em-code-en-code-insecure-seed_1", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use akankshanc/tiny-aya-global-em-code-en-code-insecure-seed_1 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "akankshanc/tiny-aya-global-em-code-en-code-insecure-seed_1" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "akankshanc/tiny-aya-global-em-code-en-code-insecure-seed_1", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/akankshanc/tiny-aya-global-em-code-en-code-insecure-seed_1
- SGLang
How to use akankshanc/tiny-aya-global-em-code-en-code-insecure-seed_1 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "akankshanc/tiny-aya-global-em-code-en-code-insecure-seed_1" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "akankshanc/tiny-aya-global-em-code-en-code-insecure-seed_1", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "akankshanc/tiny-aya-global-em-code-en-code-insecure-seed_1" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "akankshanc/tiny-aya-global-em-code-en-code-insecure-seed_1", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use akankshanc/tiny-aya-global-em-code-en-code-insecure-seed_1 with Docker Model Runner:
docker model run hf.co/akankshanc/tiny-aya-global-em-code-en-code-insecure-seed_1
| { | |
| "best_global_step": 300, | |
| "best_metric": 0.1870778650045395, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.0, | |
| "eval_steps": 50, | |
| "global_step": 338, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 4.701416462659836, | |
| "epoch": 0.002962962962962963, | |
| "grad_norm": 24.56123924255371, | |
| "learning_rate": 0.0, | |
| "loss": 2.4745616912841797, | |
| "mean_token_accuracy": 0.65498136729002, | |
| "num_tokens": 16384.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 4.710217773914337, | |
| "epoch": 0.005925925925925926, | |
| "grad_norm": 22.917617797851562, | |
| "learning_rate": 2.0000000000000003e-06, | |
| "loss": 2.328688859939575, | |
| "mean_token_accuracy": 0.6696161925792694, | |
| "num_tokens": 32768.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 5.008031904697418, | |
| "epoch": 0.008888888888888889, | |
| "grad_norm": 23.581327438354492, | |
| "learning_rate": 4.000000000000001e-06, | |
| "loss": 2.373687982559204, | |
| "mean_token_accuracy": 0.6377195976674557, | |
| "num_tokens": 49152.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 4.461768329143524, | |
| "epoch": 0.011851851851851851, | |
| "grad_norm": 21.659339904785156, | |
| "learning_rate": 6e-06, | |
| "loss": 2.188899278640747, | |
| "mean_token_accuracy": 0.6830446049571037, | |
| "num_tokens": 65536.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 3.990667074918747, | |
| "epoch": 0.014814814814814815, | |
| "grad_norm": 27.289581298828125, | |
| "learning_rate": 8.000000000000001e-06, | |
| "loss": 1.9017679691314697, | |
| "mean_token_accuracy": 0.6956704035401344, | |
| "num_tokens": 81920.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 4.510465860366821, | |
| "epoch": 0.017777777777777778, | |
| "grad_norm": 19.150859832763672, | |
| "learning_rate": 1e-05, | |
| "loss": 2.1146278381347656, | |
| "mean_token_accuracy": 0.6657988280057907, | |
| "num_tokens": 98304.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 5.020317792892456, | |
| "epoch": 0.02074074074074074, | |
| "grad_norm": 15.287837982177734, | |
| "learning_rate": 9.96996996996997e-06, | |
| "loss": 1.7613449096679688, | |
| "mean_token_accuracy": 0.6947520524263382, | |
| "num_tokens": 114688.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 4.912468284368515, | |
| "epoch": 0.023703703703703703, | |
| "grad_norm": 9.686163902282715, | |
| "learning_rate": 9.93993993993994e-06, | |
| "loss": 1.345112681388855, | |
| "mean_token_accuracy": 0.7633048743009567, | |
| "num_tokens": 131072.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 4.621884375810623, | |
| "epoch": 0.02666666666666667, | |
| "grad_norm": 8.546224594116211, | |
| "learning_rate": 9.90990990990991e-06, | |
| "loss": 1.1717731952667236, | |
| "mean_token_accuracy": 0.8044982850551605, | |
| "num_tokens": 147456.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 5.038796991109848, | |
| "epoch": 0.02962962962962963, | |
| "grad_norm": 6.685237884521484, | |
| "learning_rate": 9.879879879879881e-06, | |
| "loss": 1.0621838569641113, | |
| "mean_token_accuracy": 0.7919343337416649, | |
| "num_tokens": 163840.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 4.503615289926529, | |
| "epoch": 0.03259259259259259, | |
| "grad_norm": 4.604543685913086, | |
| "learning_rate": 9.849849849849851e-06, | |
| "loss": 0.6260772347450256, | |
| "mean_token_accuracy": 0.8595008999109268, | |
| "num_tokens": 180224.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 4.9618454575538635, | |
| "epoch": 0.035555555555555556, | |
| "grad_norm": 4.359870433807373, | |
| "learning_rate": 9.81981981981982e-06, | |
| "loss": 0.9231398105621338, | |
| "mean_token_accuracy": 0.7866097167134285, | |
| "num_tokens": 196608.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 5.029646277427673, | |
| "epoch": 0.03851851851851852, | |
| "grad_norm": 4.168108940124512, | |
| "learning_rate": 9.78978978978979e-06, | |
| "loss": 0.7823256850242615, | |
| "mean_token_accuracy": 0.8285031393170357, | |
| "num_tokens": 212992.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 4.752634763717651, | |
| "epoch": 0.04148148148148148, | |
| "grad_norm": 4.052370548248291, | |
| "learning_rate": 9.75975975975976e-06, | |
| "loss": 0.8456622958183289, | |
| "mean_token_accuracy": 0.8258332759141922, | |
| "num_tokens": 229376.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 4.367532521486282, | |
| "epoch": 0.044444444444444446, | |
| "grad_norm": 2.7583987712860107, | |
| "learning_rate": 9.729729729729732e-06, | |
| "loss": 0.38843369483947754, | |
| "mean_token_accuracy": 0.8896501585841179, | |
| "num_tokens": 245760.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 4.656139403581619, | |
| "epoch": 0.047407407407407405, | |
| "grad_norm": 4.212277412414551, | |
| "learning_rate": 9.699699699699701e-06, | |
| "loss": 0.8094176650047302, | |
| "mean_token_accuracy": 0.8203602507710457, | |
| "num_tokens": 262144.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 4.927716374397278, | |
| "epoch": 0.05037037037037037, | |
| "grad_norm": 3.1427767276763916, | |
| "learning_rate": 9.669669669669671e-06, | |
| "loss": 0.6425362825393677, | |
| "mean_token_accuracy": 0.8606718555092812, | |
| "num_tokens": 278528.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 5.264335453510284, | |
| "epoch": 0.05333333333333334, | |
| "grad_norm": 2.9270451068878174, | |
| "learning_rate": 9.63963963963964e-06, | |
| "loss": 0.5596555471420288, | |
| "mean_token_accuracy": 0.8495745286345482, | |
| "num_tokens": 294912.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 4.823247134685516, | |
| "epoch": 0.056296296296296296, | |
| "grad_norm": 3.0255370140075684, | |
| "learning_rate": 9.60960960960961e-06, | |
| "loss": 0.5243310332298279, | |
| "mean_token_accuracy": 0.8735020756721497, | |
| "num_tokens": 311296.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 4.711223393678665, | |
| "epoch": 0.05925925925925926, | |
| "grad_norm": 2.342226505279541, | |
| "learning_rate": 9.57957957957958e-06, | |
| "loss": 0.4596331715583801, | |
| "mean_token_accuracy": 0.8677957728505135, | |
| "num_tokens": 327680.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 4.827401220798492, | |
| "epoch": 0.06222222222222222, | |
| "grad_norm": 2.128645420074463, | |
| "learning_rate": 9.54954954954955e-06, | |
| "loss": 0.5169314742088318, | |
| "mean_token_accuracy": 0.8644424751400948, | |
| "num_tokens": 344064.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 4.730625569820404, | |
| "epoch": 0.06518518518518518, | |
| "grad_norm": 2.072950839996338, | |
| "learning_rate": 9.51951951951952e-06, | |
| "loss": 0.45018476247787476, | |
| "mean_token_accuracy": 0.8857986330986023, | |
| "num_tokens": 360448.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 4.8472941517829895, | |
| "epoch": 0.06814814814814815, | |
| "grad_norm": 2.0330708026885986, | |
| "learning_rate": 9.489489489489491e-06, | |
| "loss": 0.44504502415657043, | |
| "mean_token_accuracy": 0.8775075301527977, | |
| "num_tokens": 376832.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 4.573881030082703, | |
| "epoch": 0.07111111111111111, | |
| "grad_norm": 2.3058454990386963, | |
| "learning_rate": 9.45945945945946e-06, | |
| "loss": 0.4268365204334259, | |
| "mean_token_accuracy": 0.9048123508691788, | |
| "num_tokens": 393216.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 4.396156758069992, | |
| "epoch": 0.07407407407407407, | |
| "grad_norm": 1.6368998289108276, | |
| "learning_rate": 9.42942942942943e-06, | |
| "loss": 0.37373656034469604, | |
| "mean_token_accuracy": 0.9093844145536423, | |
| "num_tokens": 409600.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 4.735283553600311, | |
| "epoch": 0.07703703703703704, | |
| "grad_norm": 1.736892580986023, | |
| "learning_rate": 9.3993993993994e-06, | |
| "loss": 0.3806194067001343, | |
| "mean_token_accuracy": 0.9068936184048653, | |
| "num_tokens": 425984.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 4.740741103887558, | |
| "epoch": 0.08, | |
| "grad_norm": 1.8124656677246094, | |
| "learning_rate": 9.36936936936937e-06, | |
| "loss": 0.4839091897010803, | |
| "mean_token_accuracy": 0.8846660703420639, | |
| "num_tokens": 442368.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 4.820813536643982, | |
| "epoch": 0.08296296296296296, | |
| "grad_norm": 1.6148549318313599, | |
| "learning_rate": 9.339339339339341e-06, | |
| "loss": 0.3115249276161194, | |
| "mean_token_accuracy": 0.9326120764017105, | |
| "num_tokens": 458752.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 4.844596207141876, | |
| "epoch": 0.08592592592592592, | |
| "grad_norm": 1.944309115409851, | |
| "learning_rate": 9.30930930930931e-06, | |
| "loss": 0.4823766350746155, | |
| "mean_token_accuracy": 0.8930554986000061, | |
| "num_tokens": 475136.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 4.210876405239105, | |
| "epoch": 0.08888888888888889, | |
| "grad_norm": 1.4049290418624878, | |
| "learning_rate": 9.27927927927928e-06, | |
| "loss": 0.2616775631904602, | |
| "mean_token_accuracy": 0.9358664155006409, | |
| "num_tokens": 491520.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 4.226673096418381, | |
| "epoch": 0.09185185185185185, | |
| "grad_norm": 1.5136734247207642, | |
| "learning_rate": 9.24924924924925e-06, | |
| "loss": 0.3573359549045563, | |
| "mean_token_accuracy": 0.9113403558731079, | |
| "num_tokens": 507904.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 4.580118954181671, | |
| "epoch": 0.09481481481481481, | |
| "grad_norm": 1.5213615894317627, | |
| "learning_rate": 9.21921921921922e-06, | |
| "loss": 0.2795485854148865, | |
| "mean_token_accuracy": 0.9298447221517563, | |
| "num_tokens": 524288.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 4.726915955543518, | |
| "epoch": 0.09777777777777778, | |
| "grad_norm": 1.466759443283081, | |
| "learning_rate": 9.189189189189191e-06, | |
| "loss": 0.297269344329834, | |
| "mean_token_accuracy": 0.9181232526898384, | |
| "num_tokens": 540672.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 4.508806675672531, | |
| "epoch": 0.10074074074074074, | |
| "grad_norm": 1.411300539970398, | |
| "learning_rate": 9.15915915915916e-06, | |
| "loss": 0.27328386902809143, | |
| "mean_token_accuracy": 0.9196836799383163, | |
| "num_tokens": 557056.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 4.150590598583221, | |
| "epoch": 0.1037037037037037, | |
| "grad_norm": 1.0787698030471802, | |
| "learning_rate": 9.129129129129129e-06, | |
| "loss": 0.2225482016801834, | |
| "mean_token_accuracy": 0.9393472671508789, | |
| "num_tokens": 573440.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 4.8258116543293, | |
| "epoch": 0.10666666666666667, | |
| "grad_norm": 1.5515680313110352, | |
| "learning_rate": 9.0990990990991e-06, | |
| "loss": 0.36224499344825745, | |
| "mean_token_accuracy": 0.9126538634300232, | |
| "num_tokens": 589824.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 4.613873243331909, | |
| "epoch": 0.10962962962962963, | |
| "grad_norm": 1.1958707571029663, | |
| "learning_rate": 9.06906906906907e-06, | |
| "loss": 0.2626018226146698, | |
| "mean_token_accuracy": 0.9358126819133759, | |
| "num_tokens": 606208.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 4.751417100429535, | |
| "epoch": 0.11259259259259259, | |
| "grad_norm": 1.7754180431365967, | |
| "learning_rate": 9.03903903903904e-06, | |
| "loss": 0.41290533542633057, | |
| "mean_token_accuracy": 0.8912962302565575, | |
| "num_tokens": 622592.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 4.497866570949554, | |
| "epoch": 0.11555555555555555, | |
| "grad_norm": 1.3581385612487793, | |
| "learning_rate": 9.00900900900901e-06, | |
| "loss": 0.3074203133583069, | |
| "mean_token_accuracy": 0.9052062705159187, | |
| "num_tokens": 638976.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 3.9070385098457336, | |
| "epoch": 0.11851851851851852, | |
| "grad_norm": 0.9901930689811707, | |
| "learning_rate": 8.97897897897898e-06, | |
| "loss": 0.18705977499485016, | |
| "mean_token_accuracy": 0.9510745629668236, | |
| "num_tokens": 655360.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 4.494014769792557, | |
| "epoch": 0.12148148148148148, | |
| "grad_norm": 0.931329071521759, | |
| "learning_rate": 8.94894894894895e-06, | |
| "loss": 0.15729889273643494, | |
| "mean_token_accuracy": 0.9621974900364876, | |
| "num_tokens": 671744.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 4.150999903678894, | |
| "epoch": 0.12444444444444444, | |
| "grad_norm": 1.0970348119735718, | |
| "learning_rate": 8.91891891891892e-06, | |
| "loss": 0.19550678133964539, | |
| "mean_token_accuracy": 0.9428130686283112, | |
| "num_tokens": 688128.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 4.554481625556946, | |
| "epoch": 0.1274074074074074, | |
| "grad_norm": 1.4370427131652832, | |
| "learning_rate": 8.888888888888888e-06, | |
| "loss": 0.281034916639328, | |
| "mean_token_accuracy": 0.9330077469348907, | |
| "num_tokens": 704512.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 4.474077612161636, | |
| "epoch": 0.13037037037037036, | |
| "grad_norm": 1.3707451820373535, | |
| "learning_rate": 8.85885885885886e-06, | |
| "loss": 0.2653379440307617, | |
| "mean_token_accuracy": 0.9189115986227989, | |
| "num_tokens": 720896.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 4.545973598957062, | |
| "epoch": 0.13333333333333333, | |
| "grad_norm": 1.3633112907409668, | |
| "learning_rate": 8.82882882882883e-06, | |
| "loss": 0.361990362405777, | |
| "mean_token_accuracy": 0.914089597761631, | |
| "num_tokens": 737280.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 5.099069595336914, | |
| "epoch": 0.1362962962962963, | |
| "grad_norm": 1.5805450677871704, | |
| "learning_rate": 8.798798798798799e-06, | |
| "loss": 0.3552599251270294, | |
| "mean_token_accuracy": 0.902031384408474, | |
| "num_tokens": 753664.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 4.682322978973389, | |
| "epoch": 0.13925925925925925, | |
| "grad_norm": 1.5990415811538696, | |
| "learning_rate": 8.768768768768769e-06, | |
| "loss": 0.2980004847049713, | |
| "mean_token_accuracy": 0.9243276342749596, | |
| "num_tokens": 770048.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 3.8644610345363617, | |
| "epoch": 0.14222222222222222, | |
| "grad_norm": 1.1499457359313965, | |
| "learning_rate": 8.738738738738739e-06, | |
| "loss": 0.17076195776462555, | |
| "mean_token_accuracy": 0.9673715531826019, | |
| "num_tokens": 786432.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 3.549734801054001, | |
| "epoch": 0.1451851851851852, | |
| "grad_norm": 1.0603333711624146, | |
| "learning_rate": 8.70870870870871e-06, | |
| "loss": 0.1853162944316864, | |
| "mean_token_accuracy": 0.9549605473876, | |
| "num_tokens": 802816.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 4.565040707588196, | |
| "epoch": 0.14814814814814814, | |
| "grad_norm": 1.3161346912384033, | |
| "learning_rate": 8.67867867867868e-06, | |
| "loss": 0.2428000271320343, | |
| "mean_token_accuracy": 0.941745437681675, | |
| "num_tokens": 819200.0, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.14814814814814814, | |
| "eval_entropy": 4.431767495473226, | |
| "eval_loss": 0.26340892910957336, | |
| "eval_mean_token_accuracy": 0.9330609718958537, | |
| "eval_num_tokens": 819200.0, | |
| "eval_runtime": 41.8001, | |
| "eval_samples_per_second": 14.354, | |
| "eval_steps_per_second": 1.794, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 4.543307781219482, | |
| "epoch": 0.1511111111111111, | |
| "grad_norm": 1.0699235200881958, | |
| "learning_rate": 8.64864864864865e-06, | |
| "loss": 0.21112632751464844, | |
| "mean_token_accuracy": 0.9408096745610237, | |
| "num_tokens": 835584.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 4.287139475345612, | |
| "epoch": 0.15407407407407409, | |
| "grad_norm": 1.3812147378921509, | |
| "learning_rate": 8.618618618618619e-06, | |
| "loss": 0.33578288555145264, | |
| "mean_token_accuracy": 0.8980858325958252, | |
| "num_tokens": 851968.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 4.334702581167221, | |
| "epoch": 0.15703703703703703, | |
| "grad_norm": 1.0601719617843628, | |
| "learning_rate": 8.588588588588589e-06, | |
| "loss": 0.20486582815647125, | |
| "mean_token_accuracy": 0.9470738098025322, | |
| "num_tokens": 868352.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 4.366694152355194, | |
| "epoch": 0.16, | |
| "grad_norm": 1.1363606452941895, | |
| "learning_rate": 8.55855855855856e-06, | |
| "loss": 0.2239852249622345, | |
| "mean_token_accuracy": 0.9437156841158867, | |
| "num_tokens": 884736.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 4.7676966190338135, | |
| "epoch": 0.16296296296296298, | |
| "grad_norm": 1.4757620096206665, | |
| "learning_rate": 8.52852852852853e-06, | |
| "loss": 0.2932360768318176, | |
| "mean_token_accuracy": 0.9156305864453316, | |
| "num_tokens": 901120.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 3.975048542022705, | |
| "epoch": 0.16592592592592592, | |
| "grad_norm": 0.9454239010810852, | |
| "learning_rate": 8.4984984984985e-06, | |
| "loss": 0.1756972372531891, | |
| "mean_token_accuracy": 0.9529843851923943, | |
| "num_tokens": 917504.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 4.308409333229065, | |
| "epoch": 0.1688888888888889, | |
| "grad_norm": 1.106583833694458, | |
| "learning_rate": 8.46846846846847e-06, | |
| "loss": 0.2179475724697113, | |
| "mean_token_accuracy": 0.9476942420005798, | |
| "num_tokens": 933888.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 4.3459296226501465, | |
| "epoch": 0.17185185185185184, | |
| "grad_norm": 1.1199692487716675, | |
| "learning_rate": 8.438438438438439e-06, | |
| "loss": 0.19708535075187683, | |
| "mean_token_accuracy": 0.9468630477786064, | |
| "num_tokens": 950272.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 4.2178795337677, | |
| "epoch": 0.1748148148148148, | |
| "grad_norm": 0.9635001420974731, | |
| "learning_rate": 8.408408408408409e-06, | |
| "loss": 0.22096095979213715, | |
| "mean_token_accuracy": 0.9436954632401466, | |
| "num_tokens": 966656.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 4.530367374420166, | |
| "epoch": 0.17777777777777778, | |
| "grad_norm": 1.2648260593414307, | |
| "learning_rate": 8.378378378378378e-06, | |
| "loss": 0.2579096555709839, | |
| "mean_token_accuracy": 0.9305993020534515, | |
| "num_tokens": 983040.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 4.394843816757202, | |
| "epoch": 0.18074074074074073, | |
| "grad_norm": 1.031794786453247, | |
| "learning_rate": 8.348348348348348e-06, | |
| "loss": 0.19525060057640076, | |
| "mean_token_accuracy": 0.9447937682271004, | |
| "num_tokens": 999424.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 4.368332535028458, | |
| "epoch": 0.1837037037037037, | |
| "grad_norm": 1.1181342601776123, | |
| "learning_rate": 8.31831831831832e-06, | |
| "loss": 0.18430283665657043, | |
| "mean_token_accuracy": 0.9516401365399361, | |
| "num_tokens": 1015808.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 4.473689407110214, | |
| "epoch": 0.18666666666666668, | |
| "grad_norm": 1.5281213521957397, | |
| "learning_rate": 8.288288288288289e-06, | |
| "loss": 0.2257380336523056, | |
| "mean_token_accuracy": 0.9356214329600334, | |
| "num_tokens": 1032192.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 4.10108557343483, | |
| "epoch": 0.18962962962962962, | |
| "grad_norm": 0.8947974443435669, | |
| "learning_rate": 8.258258258258259e-06, | |
| "loss": 0.13964179158210754, | |
| "mean_token_accuracy": 0.9607399925589561, | |
| "num_tokens": 1048576.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 4.5217985808849335, | |
| "epoch": 0.1925925925925926, | |
| "grad_norm": 1.2758291959762573, | |
| "learning_rate": 8.228228228228229e-06, | |
| "loss": 0.25637656450271606, | |
| "mean_token_accuracy": 0.9300419837236404, | |
| "num_tokens": 1064960.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 4.629321813583374, | |
| "epoch": 0.19555555555555557, | |
| "grad_norm": 1.254235029220581, | |
| "learning_rate": 8.198198198198198e-06, | |
| "loss": 0.2535402774810791, | |
| "mean_token_accuracy": 0.9174696281552315, | |
| "num_tokens": 1081344.0, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 3.9447177350521088, | |
| "epoch": 0.1985185185185185, | |
| "grad_norm": 0.9241489171981812, | |
| "learning_rate": 8.16816816816817e-06, | |
| "loss": 0.142357736825943, | |
| "mean_token_accuracy": 0.9547562450170517, | |
| "num_tokens": 1097728.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 4.005536824464798, | |
| "epoch": 0.20148148148148148, | |
| "grad_norm": 0.9808012843132019, | |
| "learning_rate": 8.13813813813814e-06, | |
| "loss": 0.1787158101797104, | |
| "mean_token_accuracy": 0.9517183899879456, | |
| "num_tokens": 1114112.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 4.408803582191467, | |
| "epoch": 0.20444444444444446, | |
| "grad_norm": 1.2708892822265625, | |
| "learning_rate": 8.108108108108109e-06, | |
| "loss": 0.2477702498435974, | |
| "mean_token_accuracy": 0.927848644554615, | |
| "num_tokens": 1130496.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 4.427323371171951, | |
| "epoch": 0.2074074074074074, | |
| "grad_norm": 1.0906333923339844, | |
| "learning_rate": 8.078078078078079e-06, | |
| "loss": 0.18576793372631073, | |
| "mean_token_accuracy": 0.9514018073678017, | |
| "num_tokens": 1146880.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 4.085136443376541, | |
| "epoch": 0.21037037037037037, | |
| "grad_norm": 0.9278141856193542, | |
| "learning_rate": 8.048048048048048e-06, | |
| "loss": 0.1597796231508255, | |
| "mean_token_accuracy": 0.950559951364994, | |
| "num_tokens": 1163264.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 4.562773674726486, | |
| "epoch": 0.21333333333333335, | |
| "grad_norm": 1.222669005393982, | |
| "learning_rate": 8.018018018018018e-06, | |
| "loss": 0.23149636387825012, | |
| "mean_token_accuracy": 0.9292395636439323, | |
| "num_tokens": 1179648.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 4.718744367361069, | |
| "epoch": 0.2162962962962963, | |
| "grad_norm": 1.4075634479522705, | |
| "learning_rate": 7.987987987987988e-06, | |
| "loss": 0.24038389325141907, | |
| "mean_token_accuracy": 0.9325431138277054, | |
| "num_tokens": 1196032.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 5.075905919075012, | |
| "epoch": 0.21925925925925926, | |
| "grad_norm": 1.4967416524887085, | |
| "learning_rate": 7.95795795795796e-06, | |
| "loss": 0.3027274012565613, | |
| "mean_token_accuracy": 0.9107383862137794, | |
| "num_tokens": 1212416.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 4.314110338687897, | |
| "epoch": 0.2222222222222222, | |
| "grad_norm": 0.9586232900619507, | |
| "learning_rate": 7.927927927927929e-06, | |
| "loss": 0.1696486622095108, | |
| "mean_token_accuracy": 0.9494581520557404, | |
| "num_tokens": 1228800.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 4.872310161590576, | |
| "epoch": 0.22518518518518518, | |
| "grad_norm": 1.5255279541015625, | |
| "learning_rate": 7.897897897897899e-06, | |
| "loss": 0.3269280195236206, | |
| "mean_token_accuracy": 0.9095799848437309, | |
| "num_tokens": 1245184.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 4.42020907998085, | |
| "epoch": 0.22814814814814816, | |
| "grad_norm": 1.4026970863342285, | |
| "learning_rate": 7.867867867867868e-06, | |
| "loss": 0.2915046215057373, | |
| "mean_token_accuracy": 0.9215874075889587, | |
| "num_tokens": 1261568.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 4.672393083572388, | |
| "epoch": 0.2311111111111111, | |
| "grad_norm": 1.1211456060409546, | |
| "learning_rate": 7.837837837837838e-06, | |
| "loss": 0.17860044538974762, | |
| "mean_token_accuracy": 0.9532517418265343, | |
| "num_tokens": 1277952.0, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 4.263626158237457, | |
| "epoch": 0.23407407407407407, | |
| "grad_norm": 1.2703758478164673, | |
| "learning_rate": 7.807807807807808e-06, | |
| "loss": 0.20677883923053741, | |
| "mean_token_accuracy": 0.9517276138067245, | |
| "num_tokens": 1294336.0, | |
| "step": 79 | |
| }, | |
| { | |
| "entropy": 4.612537890672684, | |
| "epoch": 0.23703703703703705, | |
| "grad_norm": 1.1560204029083252, | |
| "learning_rate": 7.77777777777778e-06, | |
| "loss": 0.20464098453521729, | |
| "mean_token_accuracy": 0.9621888473629951, | |
| "num_tokens": 1310720.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 3.743598461151123, | |
| "epoch": 0.24, | |
| "grad_norm": 0.9571014046669006, | |
| "learning_rate": 7.747747747747749e-06, | |
| "loss": 0.16432294249534607, | |
| "mean_token_accuracy": 0.949650265276432, | |
| "num_tokens": 1327104.0, | |
| "step": 81 | |
| }, | |
| { | |
| "entropy": 4.481620937585831, | |
| "epoch": 0.24296296296296296, | |
| "grad_norm": 1.1675502061843872, | |
| "learning_rate": 7.717717717717719e-06, | |
| "loss": 0.21761369705200195, | |
| "mean_token_accuracy": 0.9432580098509789, | |
| "num_tokens": 1343488.0, | |
| "step": 82 | |
| }, | |
| { | |
| "entropy": 4.632976651191711, | |
| "epoch": 0.24592592592592594, | |
| "grad_norm": 1.4137561321258545, | |
| "learning_rate": 7.687687687687688e-06, | |
| "loss": 0.25227683782577515, | |
| "mean_token_accuracy": 0.9236670285463333, | |
| "num_tokens": 1359872.0, | |
| "step": 83 | |
| }, | |
| { | |
| "entropy": 4.919981598854065, | |
| "epoch": 0.24888888888888888, | |
| "grad_norm": 1.4102532863616943, | |
| "learning_rate": 7.657657657657658e-06, | |
| "loss": 0.28805384039878845, | |
| "mean_token_accuracy": 0.9161391258239746, | |
| "num_tokens": 1376256.0, | |
| "step": 84 | |
| }, | |
| { | |
| "entropy": 4.675688982009888, | |
| "epoch": 0.2518518518518518, | |
| "grad_norm": 1.0484553575515747, | |
| "learning_rate": 7.6276276276276285e-06, | |
| "loss": 0.17043615877628326, | |
| "mean_token_accuracy": 0.9514751136302948, | |
| "num_tokens": 1392640.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 4.214458107948303, | |
| "epoch": 0.2548148148148148, | |
| "grad_norm": 0.9503604769706726, | |
| "learning_rate": 7.597597597597598e-06, | |
| "loss": 0.15311528742313385, | |
| "mean_token_accuracy": 0.9494195133447647, | |
| "num_tokens": 1409024.0, | |
| "step": 86 | |
| }, | |
| { | |
| "entropy": 4.548118233680725, | |
| "epoch": 0.2577777777777778, | |
| "grad_norm": 1.2899352312088013, | |
| "learning_rate": 7.567567567567569e-06, | |
| "loss": 0.2427193522453308, | |
| "mean_token_accuracy": 0.9302617087960243, | |
| "num_tokens": 1425408.0, | |
| "step": 87 | |
| }, | |
| { | |
| "entropy": 4.833130061626434, | |
| "epoch": 0.2607407407407407, | |
| "grad_norm": 1.1198095083236694, | |
| "learning_rate": 7.5375375375375385e-06, | |
| "loss": 0.2029549777507782, | |
| "mean_token_accuracy": 0.9402985349297523, | |
| "num_tokens": 1441792.0, | |
| "step": 88 | |
| }, | |
| { | |
| "entropy": 4.751594722270966, | |
| "epoch": 0.2637037037037037, | |
| "grad_norm": 1.1558674573898315, | |
| "learning_rate": 7.507507507507507e-06, | |
| "loss": 0.19649912416934967, | |
| "mean_token_accuracy": 0.9425910338759422, | |
| "num_tokens": 1458176.0, | |
| "step": 89 | |
| }, | |
| { | |
| "entropy": 4.8306790590286255, | |
| "epoch": 0.26666666666666666, | |
| "grad_norm": 1.3417739868164062, | |
| "learning_rate": 7.477477477477479e-06, | |
| "loss": 0.2961505055427551, | |
| "mean_token_accuracy": 0.9253265932202339, | |
| "num_tokens": 1474560.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 4.5884115397930145, | |
| "epoch": 0.2696296296296296, | |
| "grad_norm": 1.0663913488388062, | |
| "learning_rate": 7.447447447447448e-06, | |
| "loss": 0.22267302870750427, | |
| "mean_token_accuracy": 0.9426953792572021, | |
| "num_tokens": 1490944.0, | |
| "step": 91 | |
| }, | |
| { | |
| "entropy": 4.409365922212601, | |
| "epoch": 0.2725925925925926, | |
| "grad_norm": 1.1096484661102295, | |
| "learning_rate": 7.417417417417418e-06, | |
| "loss": 0.26577574014663696, | |
| "mean_token_accuracy": 0.9276531934738159, | |
| "num_tokens": 1507328.0, | |
| "step": 92 | |
| }, | |
| { | |
| "entropy": 4.979451894760132, | |
| "epoch": 0.27555555555555555, | |
| "grad_norm": 1.0621061325073242, | |
| "learning_rate": 7.387387387387388e-06, | |
| "loss": 0.17089557647705078, | |
| "mean_token_accuracy": 0.9540339037775993, | |
| "num_tokens": 1523712.0, | |
| "step": 93 | |
| }, | |
| { | |
| "entropy": 4.742478549480438, | |
| "epoch": 0.2785185185185185, | |
| "grad_norm": 1.1826844215393066, | |
| "learning_rate": 7.3573573573573575e-06, | |
| "loss": 0.22930549085140228, | |
| "mean_token_accuracy": 0.9388362243771553, | |
| "num_tokens": 1540096.0, | |
| "step": 94 | |
| }, | |
| { | |
| "entropy": 4.794544339179993, | |
| "epoch": 0.2814814814814815, | |
| "grad_norm": 1.6299753189086914, | |
| "learning_rate": 7.327327327327328e-06, | |
| "loss": 0.28972867131233215, | |
| "mean_token_accuracy": 0.9282878786325455, | |
| "num_tokens": 1556480.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 4.752287656068802, | |
| "epoch": 0.28444444444444444, | |
| "grad_norm": 1.3292368650436401, | |
| "learning_rate": 7.297297297297298e-06, | |
| "loss": 0.27213218808174133, | |
| "mean_token_accuracy": 0.9241840839385986, | |
| "num_tokens": 1572864.0, | |
| "step": 96 | |
| }, | |
| { | |
| "entropy": 4.4966756999492645, | |
| "epoch": 0.2874074074074074, | |
| "grad_norm": 1.0797817707061768, | |
| "learning_rate": 7.267267267267268e-06, | |
| "loss": 0.22773189842700958, | |
| "mean_token_accuracy": 0.9454372152686119, | |
| "num_tokens": 1589248.0, | |
| "step": 97 | |
| }, | |
| { | |
| "entropy": 4.7066821455955505, | |
| "epoch": 0.2903703703703704, | |
| "grad_norm": 1.4515063762664795, | |
| "learning_rate": 7.237237237237238e-06, | |
| "loss": 0.33411750197410583, | |
| "mean_token_accuracy": 0.9117428660392761, | |
| "num_tokens": 1605632.0, | |
| "step": 98 | |
| }, | |
| { | |
| "entropy": 4.119100630283356, | |
| "epoch": 0.29333333333333333, | |
| "grad_norm": 0.9465159773826599, | |
| "learning_rate": 7.207207207207208e-06, | |
| "loss": 0.14733517169952393, | |
| "mean_token_accuracy": 0.9545356035232544, | |
| "num_tokens": 1622016.0, | |
| "step": 99 | |
| }, | |
| { | |
| "entropy": 4.246767520904541, | |
| "epoch": 0.2962962962962963, | |
| "grad_norm": 1.176724910736084, | |
| "learning_rate": 7.177177177177178e-06, | |
| "loss": 0.30558162927627563, | |
| "mean_token_accuracy": 0.9205343350768089, | |
| "num_tokens": 1638400.0, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.2962962962962963, | |
| "eval_entropy": 4.449052244822184, | |
| "eval_loss": 0.21724973618984222, | |
| "eval_mean_token_accuracy": 0.9431627003351847, | |
| "eval_num_tokens": 1638400.0, | |
| "eval_runtime": 41.8075, | |
| "eval_samples_per_second": 14.351, | |
| "eval_steps_per_second": 1.794, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 4.789787411689758, | |
| "epoch": 0.2992592592592593, | |
| "grad_norm": 1.145389199256897, | |
| "learning_rate": 7.147147147147148e-06, | |
| "loss": 0.15895400941371918, | |
| "mean_token_accuracy": 0.9540646523237228, | |
| "num_tokens": 1654784.0, | |
| "step": 101 | |
| }, | |
| { | |
| "entropy": 4.701952874660492, | |
| "epoch": 0.3022222222222222, | |
| "grad_norm": 1.3662292957305908, | |
| "learning_rate": 7.117117117117117e-06, | |
| "loss": 0.2931893467903137, | |
| "mean_token_accuracy": 0.9204913973808289, | |
| "num_tokens": 1671168.0, | |
| "step": 102 | |
| }, | |
| { | |
| "entropy": 4.134100794792175, | |
| "epoch": 0.30518518518518517, | |
| "grad_norm": 0.8953816294670105, | |
| "learning_rate": 7.087087087087087e-06, | |
| "loss": 0.1295047253370285, | |
| "mean_token_accuracy": 0.9587932080030441, | |
| "num_tokens": 1687552.0, | |
| "step": 103 | |
| }, | |
| { | |
| "entropy": 4.094232052564621, | |
| "epoch": 0.30814814814814817, | |
| "grad_norm": 1.1214549541473389, | |
| "learning_rate": 7.057057057057057e-06, | |
| "loss": 0.2239776849746704, | |
| "mean_token_accuracy": 0.9460462778806686, | |
| "num_tokens": 1703936.0, | |
| "step": 104 | |
| }, | |
| { | |
| "entropy": 4.961356997489929, | |
| "epoch": 0.3111111111111111, | |
| "grad_norm": 1.514918565750122, | |
| "learning_rate": 7.027027027027028e-06, | |
| "loss": 0.3581639528274536, | |
| "mean_token_accuracy": 0.9032787084579468, | |
| "num_tokens": 1720320.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 4.607772380113602, | |
| "epoch": 0.31407407407407406, | |
| "grad_norm": 1.0798094272613525, | |
| "learning_rate": 6.996996996996997e-06, | |
| "loss": 0.23729060590267181, | |
| "mean_token_accuracy": 0.9380658268928528, | |
| "num_tokens": 1736704.0, | |
| "step": 106 | |
| }, | |
| { | |
| "entropy": 3.8316372632980347, | |
| "epoch": 0.31703703703703706, | |
| "grad_norm": 0.8145128488540649, | |
| "learning_rate": 6.966966966966967e-06, | |
| "loss": 0.1603461354970932, | |
| "mean_token_accuracy": 0.9523681923747063, | |
| "num_tokens": 1753088.0, | |
| "step": 107 | |
| }, | |
| { | |
| "entropy": 4.021235078573227, | |
| "epoch": 0.32, | |
| "grad_norm": 1.1897822618484497, | |
| "learning_rate": 6.936936936936938e-06, | |
| "loss": 0.2039574235677719, | |
| "mean_token_accuracy": 0.9393771886825562, | |
| "num_tokens": 1769472.0, | |
| "step": 108 | |
| }, | |
| { | |
| "entropy": 4.5552674531936646, | |
| "epoch": 0.32296296296296295, | |
| "grad_norm": 1.3548667430877686, | |
| "learning_rate": 6.906906906906907e-06, | |
| "loss": 0.2532401978969574, | |
| "mean_token_accuracy": 0.9329179599881172, | |
| "num_tokens": 1785856.0, | |
| "step": 109 | |
| }, | |
| { | |
| "entropy": 4.35027739405632, | |
| "epoch": 0.32592592592592595, | |
| "grad_norm": 1.1885968446731567, | |
| "learning_rate": 6.876876876876878e-06, | |
| "loss": 0.16808564960956573, | |
| "mean_token_accuracy": 0.9461491629481316, | |
| "num_tokens": 1802240.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 4.751055091619492, | |
| "epoch": 0.3288888888888889, | |
| "grad_norm": 1.1899914741516113, | |
| "learning_rate": 6.846846846846848e-06, | |
| "loss": 0.26376423239707947, | |
| "mean_token_accuracy": 0.9329497367143631, | |
| "num_tokens": 1818624.0, | |
| "step": 111 | |
| }, | |
| { | |
| "entropy": 4.269050449132919, | |
| "epoch": 0.33185185185185184, | |
| "grad_norm": 1.1826343536376953, | |
| "learning_rate": 6.816816816816817e-06, | |
| "loss": 0.1682528555393219, | |
| "mean_token_accuracy": 0.9482125043869019, | |
| "num_tokens": 1835008.0, | |
| "step": 112 | |
| }, | |
| { | |
| "entropy": 4.640616059303284, | |
| "epoch": 0.3348148148148148, | |
| "grad_norm": 1.166980504989624, | |
| "learning_rate": 6.786786786786788e-06, | |
| "loss": 0.238769069314003, | |
| "mean_token_accuracy": 0.9331283867359161, | |
| "num_tokens": 1851392.0, | |
| "step": 113 | |
| }, | |
| { | |
| "entropy": 4.051734387874603, | |
| "epoch": 0.3377777777777778, | |
| "grad_norm": 0.9284724593162537, | |
| "learning_rate": 6.7567567567567575e-06, | |
| "loss": 0.11436547338962555, | |
| "mean_token_accuracy": 0.9699687361717224, | |
| "num_tokens": 1867776.0, | |
| "step": 114 | |
| }, | |
| { | |
| "entropy": 4.884681403636932, | |
| "epoch": 0.34074074074074073, | |
| "grad_norm": 1.0763801336288452, | |
| "learning_rate": 6.726726726726728e-06, | |
| "loss": 0.1629171222448349, | |
| "mean_token_accuracy": 0.9543235972523689, | |
| "num_tokens": 1884160.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 4.778160870075226, | |
| "epoch": 0.3437037037037037, | |
| "grad_norm": 0.8610367178916931, | |
| "learning_rate": 6.696696696696697e-06, | |
| "loss": 0.12890088558197021, | |
| "mean_token_accuracy": 0.9653410091996193, | |
| "num_tokens": 1900544.0, | |
| "step": 116 | |
| }, | |
| { | |
| "entropy": 4.650707423686981, | |
| "epoch": 0.3466666666666667, | |
| "grad_norm": 1.150089144706726, | |
| "learning_rate": 6.666666666666667e-06, | |
| "loss": 0.21885131299495697, | |
| "mean_token_accuracy": 0.9310262873768806, | |
| "num_tokens": 1916928.0, | |
| "step": 117 | |
| }, | |
| { | |
| "entropy": 4.634554773569107, | |
| "epoch": 0.3496296296296296, | |
| "grad_norm": 1.1062830686569214, | |
| "learning_rate": 6.636636636636637e-06, | |
| "loss": 0.2054327428340912, | |
| "mean_token_accuracy": 0.9322185516357422, | |
| "num_tokens": 1933312.0, | |
| "step": 118 | |
| }, | |
| { | |
| "entropy": 4.514108449220657, | |
| "epoch": 0.35259259259259257, | |
| "grad_norm": 1.1394360065460205, | |
| "learning_rate": 6.606606606606607e-06, | |
| "loss": 0.2247684895992279, | |
| "mean_token_accuracy": 0.9467405527830124, | |
| "num_tokens": 1949696.0, | |
| "step": 119 | |
| }, | |
| { | |
| "entropy": 4.34781551361084, | |
| "epoch": 0.35555555555555557, | |
| "grad_norm": 1.0121259689331055, | |
| "learning_rate": 6.5765765765765775e-06, | |
| "loss": 0.1715734302997589, | |
| "mean_token_accuracy": 0.9512444362044334, | |
| "num_tokens": 1966080.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 4.744591236114502, | |
| "epoch": 0.3585185185185185, | |
| "grad_norm": 1.1714106798171997, | |
| "learning_rate": 6.546546546546547e-06, | |
| "loss": 0.23964054882526398, | |
| "mean_token_accuracy": 0.9383665025234222, | |
| "num_tokens": 1982464.0, | |
| "step": 121 | |
| }, | |
| { | |
| "entropy": 4.511653900146484, | |
| "epoch": 0.36148148148148146, | |
| "grad_norm": 1.2332781553268433, | |
| "learning_rate": 6.516516516516517e-06, | |
| "loss": 0.23672592639923096, | |
| "mean_token_accuracy": 0.9448187202215195, | |
| "num_tokens": 1998848.0, | |
| "step": 122 | |
| }, | |
| { | |
| "entropy": 4.528300076723099, | |
| "epoch": 0.36444444444444446, | |
| "grad_norm": 0.917389452457428, | |
| "learning_rate": 6.486486486486487e-06, | |
| "loss": 0.15570732951164246, | |
| "mean_token_accuracy": 0.9560035914182663, | |
| "num_tokens": 2015232.0, | |
| "step": 123 | |
| }, | |
| { | |
| "entropy": 4.652964890003204, | |
| "epoch": 0.3674074074074074, | |
| "grad_norm": 1.0291730165481567, | |
| "learning_rate": 6.456456456456457e-06, | |
| "loss": 0.19984155893325806, | |
| "mean_token_accuracy": 0.9478033557534218, | |
| "num_tokens": 2031616.0, | |
| "step": 124 | |
| }, | |
| { | |
| "entropy": 4.196425557136536, | |
| "epoch": 0.37037037037037035, | |
| "grad_norm": 0.9853512048721313, | |
| "learning_rate": 6.426426426426427e-06, | |
| "loss": 0.17781120538711548, | |
| "mean_token_accuracy": 0.9526060372591019, | |
| "num_tokens": 2048000.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 4.501747310161591, | |
| "epoch": 0.37333333333333335, | |
| "grad_norm": 0.885403037071228, | |
| "learning_rate": 6.396396396396397e-06, | |
| "loss": 0.10924738645553589, | |
| "mean_token_accuracy": 0.9751126244664192, | |
| "num_tokens": 2064384.0, | |
| "step": 126 | |
| }, | |
| { | |
| "entropy": 4.62592014670372, | |
| "epoch": 0.3762962962962963, | |
| "grad_norm": 1.5773086547851562, | |
| "learning_rate": 6.366366366366366e-06, | |
| "loss": 0.3295811414718628, | |
| "mean_token_accuracy": 0.9110967963933945, | |
| "num_tokens": 2080768.0, | |
| "step": 127 | |
| }, | |
| { | |
| "entropy": 5.021280109882355, | |
| "epoch": 0.37925925925925924, | |
| "grad_norm": 1.380358338356018, | |
| "learning_rate": 6.336336336336338e-06, | |
| "loss": 0.20020775496959686, | |
| "mean_token_accuracy": 0.9450817406177521, | |
| "num_tokens": 2097152.0, | |
| "step": 128 | |
| }, | |
| { | |
| "entropy": 4.440324813127518, | |
| "epoch": 0.38222222222222224, | |
| "grad_norm": 1.1773418188095093, | |
| "learning_rate": 6.3063063063063065e-06, | |
| "loss": 0.22019381821155548, | |
| "mean_token_accuracy": 0.9418660625815392, | |
| "num_tokens": 2113536.0, | |
| "step": 129 | |
| }, | |
| { | |
| "entropy": 4.698460668325424, | |
| "epoch": 0.3851851851851852, | |
| "grad_norm": 1.1396949291229248, | |
| "learning_rate": 6.276276276276276e-06, | |
| "loss": 0.18115706741809845, | |
| "mean_token_accuracy": 0.94284238666296, | |
| "num_tokens": 2129920.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 5.005904167890549, | |
| "epoch": 0.38814814814814813, | |
| "grad_norm": 1.1489640474319458, | |
| "learning_rate": 6.246246246246247e-06, | |
| "loss": 0.14725539088249207, | |
| "mean_token_accuracy": 0.9511874690651894, | |
| "num_tokens": 2146304.0, | |
| "step": 131 | |
| }, | |
| { | |
| "entropy": 5.031860530376434, | |
| "epoch": 0.39111111111111113, | |
| "grad_norm": 1.3990733623504639, | |
| "learning_rate": 6.2162162162162164e-06, | |
| "loss": 0.24054200947284698, | |
| "mean_token_accuracy": 0.9300425425171852, | |
| "num_tokens": 2162688.0, | |
| "step": 132 | |
| }, | |
| { | |
| "entropy": 4.654724597930908, | |
| "epoch": 0.3940740740740741, | |
| "grad_norm": 1.083472728729248, | |
| "learning_rate": 6.186186186186187e-06, | |
| "loss": 0.21355129778385162, | |
| "mean_token_accuracy": 0.9333104565739632, | |
| "num_tokens": 2179072.0, | |
| "step": 133 | |
| }, | |
| { | |
| "entropy": 4.3352950513362885, | |
| "epoch": 0.397037037037037, | |
| "grad_norm": 1.2197173833847046, | |
| "learning_rate": 6.156156156156157e-06, | |
| "loss": 0.27208036184310913, | |
| "mean_token_accuracy": 0.924175500869751, | |
| "num_tokens": 2195456.0, | |
| "step": 134 | |
| }, | |
| { | |
| "entropy": 4.924069583415985, | |
| "epoch": 0.4, | |
| "grad_norm": 1.3885170221328735, | |
| "learning_rate": 6.126126126126126e-06, | |
| "loss": 0.2448231726884842, | |
| "mean_token_accuracy": 0.93735421448946, | |
| "num_tokens": 2211840.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 4.7157105803489685, | |
| "epoch": 0.40296296296296297, | |
| "grad_norm": 1.4344000816345215, | |
| "learning_rate": 6.096096096096097e-06, | |
| "loss": 0.2515410780906677, | |
| "mean_token_accuracy": 0.9249624758958817, | |
| "num_tokens": 2228224.0, | |
| "step": 136 | |
| }, | |
| { | |
| "entropy": 4.590086460113525, | |
| "epoch": 0.4059259259259259, | |
| "grad_norm": 1.2284572124481201, | |
| "learning_rate": 6.066066066066067e-06, | |
| "loss": 0.2063797265291214, | |
| "mean_token_accuracy": 0.9442784413695335, | |
| "num_tokens": 2244608.0, | |
| "step": 137 | |
| }, | |
| { | |
| "entropy": 4.807889759540558, | |
| "epoch": 0.4088888888888889, | |
| "grad_norm": 1.7174497842788696, | |
| "learning_rate": 6.036036036036037e-06, | |
| "loss": 0.3287466764450073, | |
| "mean_token_accuracy": 0.9112606719136238, | |
| "num_tokens": 2260992.0, | |
| "step": 138 | |
| }, | |
| { | |
| "entropy": 4.269232541322708, | |
| "epoch": 0.41185185185185186, | |
| "grad_norm": 0.8105608224868774, | |
| "learning_rate": 6.006006006006007e-06, | |
| "loss": 0.12416984885931015, | |
| "mean_token_accuracy": 0.9590313956141472, | |
| "num_tokens": 2277376.0, | |
| "step": 139 | |
| }, | |
| { | |
| "entropy": 4.601140409708023, | |
| "epoch": 0.4148148148148148, | |
| "grad_norm": 1.2158101797103882, | |
| "learning_rate": 5.975975975975976e-06, | |
| "loss": 0.19056841731071472, | |
| "mean_token_accuracy": 0.9466198459267616, | |
| "num_tokens": 2293760.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 5.092256844043732, | |
| "epoch": 0.4177777777777778, | |
| "grad_norm": 1.4425084590911865, | |
| "learning_rate": 5.945945945945947e-06, | |
| "loss": 0.30024221539497375, | |
| "mean_token_accuracy": 0.9206296429038048, | |
| "num_tokens": 2310144.0, | |
| "step": 141 | |
| }, | |
| { | |
| "entropy": 5.037581652402878, | |
| "epoch": 0.42074074074074075, | |
| "grad_norm": 1.5531865358352661, | |
| "learning_rate": 5.915915915915916e-06, | |
| "loss": 0.3754885196685791, | |
| "mean_token_accuracy": 0.9084843918681145, | |
| "num_tokens": 2326528.0, | |
| "step": 142 | |
| }, | |
| { | |
| "entropy": 4.724683046340942, | |
| "epoch": 0.4237037037037037, | |
| "grad_norm": 1.1647831201553345, | |
| "learning_rate": 5.885885885885886e-06, | |
| "loss": 0.26595643162727356, | |
| "mean_token_accuracy": 0.9294901490211487, | |
| "num_tokens": 2342912.0, | |
| "step": 143 | |
| }, | |
| { | |
| "entropy": 4.66888752579689, | |
| "epoch": 0.4266666666666667, | |
| "grad_norm": 1.2422510385513306, | |
| "learning_rate": 5.855855855855856e-06, | |
| "loss": 0.201975479722023, | |
| "mean_token_accuracy": 0.937431775033474, | |
| "num_tokens": 2359296.0, | |
| "step": 144 | |
| }, | |
| { | |
| "entropy": 5.061137318611145, | |
| "epoch": 0.42962962962962964, | |
| "grad_norm": 1.1814007759094238, | |
| "learning_rate": 5.825825825825826e-06, | |
| "loss": 0.21096129715442657, | |
| "mean_token_accuracy": 0.944946400821209, | |
| "num_tokens": 2375680.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 4.937180817127228, | |
| "epoch": 0.4325925925925926, | |
| "grad_norm": 1.3031474351882935, | |
| "learning_rate": 5.7957957957957965e-06, | |
| "loss": 0.24075299501419067, | |
| "mean_token_accuracy": 0.9233498498797417, | |
| "num_tokens": 2392064.0, | |
| "step": 146 | |
| }, | |
| { | |
| "entropy": 4.4801307916641235, | |
| "epoch": 0.43555555555555553, | |
| "grad_norm": 1.0523452758789062, | |
| "learning_rate": 5.765765765765766e-06, | |
| "loss": 0.20990847051143646, | |
| "mean_token_accuracy": 0.9455097988247871, | |
| "num_tokens": 2408448.0, | |
| "step": 147 | |
| }, | |
| { | |
| "entropy": 4.410671651363373, | |
| "epoch": 0.43851851851851853, | |
| "grad_norm": 1.1729801893234253, | |
| "learning_rate": 5.735735735735736e-06, | |
| "loss": 0.20666182041168213, | |
| "mean_token_accuracy": 0.9527652785181999, | |
| "num_tokens": 2424832.0, | |
| "step": 148 | |
| }, | |
| { | |
| "entropy": 4.266784578561783, | |
| "epoch": 0.4414814814814815, | |
| "grad_norm": 1.0994833707809448, | |
| "learning_rate": 5.7057057057057065e-06, | |
| "loss": 0.17016655206680298, | |
| "mean_token_accuracy": 0.9391877725720406, | |
| "num_tokens": 2441216.0, | |
| "step": 149 | |
| }, | |
| { | |
| "entropy": 4.919064462184906, | |
| "epoch": 0.4444444444444444, | |
| "grad_norm": 1.5136151313781738, | |
| "learning_rate": 5.675675675675676e-06, | |
| "loss": 0.33089369535446167, | |
| "mean_token_accuracy": 0.9111267700791359, | |
| "num_tokens": 2457600.0, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.4444444444444444, | |
| "eval_entropy": 4.473293965657552, | |
| "eval_loss": 0.20222364366054535, | |
| "eval_mean_token_accuracy": 0.9461187330881754, | |
| "eval_num_tokens": 2457600.0, | |
| "eval_runtime": 41.8195, | |
| "eval_samples_per_second": 14.347, | |
| "eval_steps_per_second": 1.793, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 4.558058649301529, | |
| "epoch": 0.4474074074074074, | |
| "grad_norm": 1.5376884937286377, | |
| "learning_rate": 5.645645645645647e-06, | |
| "loss": 0.3638846278190613, | |
| "mean_token_accuracy": 0.9130012094974518, | |
| "num_tokens": 2473984.0, | |
| "step": 151 | |
| }, | |
| { | |
| "entropy": 4.655219286680222, | |
| "epoch": 0.45037037037037037, | |
| "grad_norm": 1.4485206604003906, | |
| "learning_rate": 5.615615615615616e-06, | |
| "loss": 0.29070550203323364, | |
| "mean_token_accuracy": 0.9349231794476509, | |
| "num_tokens": 2490368.0, | |
| "step": 152 | |
| }, | |
| { | |
| "entropy": 4.120410114526749, | |
| "epoch": 0.4533333333333333, | |
| "grad_norm": 1.4900908470153809, | |
| "learning_rate": 5.585585585585585e-06, | |
| "loss": 0.2075977772474289, | |
| "mean_token_accuracy": 0.941280372440815, | |
| "num_tokens": 2506752.0, | |
| "step": 153 | |
| }, | |
| { | |
| "entropy": 4.852829605340958, | |
| "epoch": 0.4562962962962963, | |
| "grad_norm": 1.2578136920928955, | |
| "learning_rate": 5.555555555555557e-06, | |
| "loss": 0.2637161612510681, | |
| "mean_token_accuracy": 0.9209686145186424, | |
| "num_tokens": 2523136.0, | |
| "step": 154 | |
| }, | |
| { | |
| "entropy": 4.84997946023941, | |
| "epoch": 0.45925925925925926, | |
| "grad_norm": 1.26620352268219, | |
| "learning_rate": 5.5255255255255255e-06, | |
| "loss": 0.2449718415737152, | |
| "mean_token_accuracy": 0.9436092749238014, | |
| "num_tokens": 2539520.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 4.473124235868454, | |
| "epoch": 0.4622222222222222, | |
| "grad_norm": 1.0916240215301514, | |
| "learning_rate": 5.495495495495496e-06, | |
| "loss": 0.19546659290790558, | |
| "mean_token_accuracy": 0.9399038553237915, | |
| "num_tokens": 2555904.0, | |
| "step": 156 | |
| }, | |
| { | |
| "entropy": 4.941104412078857, | |
| "epoch": 0.4651851851851852, | |
| "grad_norm": 1.2782196998596191, | |
| "learning_rate": 5.465465465465466e-06, | |
| "loss": 0.2740520238876343, | |
| "mean_token_accuracy": 0.929001159965992, | |
| "num_tokens": 2572288.0, | |
| "step": 157 | |
| }, | |
| { | |
| "entropy": 4.457964479923248, | |
| "epoch": 0.46814814814814815, | |
| "grad_norm": 0.8856244087219238, | |
| "learning_rate": 5.4354354354354355e-06, | |
| "loss": 0.1418902426958084, | |
| "mean_token_accuracy": 0.9622244611382484, | |
| "num_tokens": 2588672.0, | |
| "step": 158 | |
| }, | |
| { | |
| "entropy": 5.035272657871246, | |
| "epoch": 0.4711111111111111, | |
| "grad_norm": 1.441379427909851, | |
| "learning_rate": 5.405405405405406e-06, | |
| "loss": 0.27133798599243164, | |
| "mean_token_accuracy": 0.9293553680181503, | |
| "num_tokens": 2605056.0, | |
| "step": 159 | |
| }, | |
| { | |
| "entropy": 4.293529689311981, | |
| "epoch": 0.4740740740740741, | |
| "grad_norm": 0.9786353707313538, | |
| "learning_rate": 5.375375375375376e-06, | |
| "loss": 0.16610291600227356, | |
| "mean_token_accuracy": 0.9514764472842216, | |
| "num_tokens": 2621440.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 4.59603413939476, | |
| "epoch": 0.47703703703703704, | |
| "grad_norm": 1.0930979251861572, | |
| "learning_rate": 5.345345345345346e-06, | |
| "loss": 0.18105587363243103, | |
| "mean_token_accuracy": 0.9463809877634048, | |
| "num_tokens": 2637824.0, | |
| "step": 161 | |
| }, | |
| { | |
| "entropy": 4.2250096797943115, | |
| "epoch": 0.48, | |
| "grad_norm": 1.1273365020751953, | |
| "learning_rate": 5.315315315315316e-06, | |
| "loss": 0.14089903235435486, | |
| "mean_token_accuracy": 0.9578321501612663, | |
| "num_tokens": 2654208.0, | |
| "step": 162 | |
| }, | |
| { | |
| "entropy": 4.682773381471634, | |
| "epoch": 0.482962962962963, | |
| "grad_norm": 1.227596402168274, | |
| "learning_rate": 5.285285285285286e-06, | |
| "loss": 0.19611728191375732, | |
| "mean_token_accuracy": 0.9440445899963379, | |
| "num_tokens": 2670592.0, | |
| "step": 163 | |
| }, | |
| { | |
| "entropy": 4.8632601499557495, | |
| "epoch": 0.48592592592592593, | |
| "grad_norm": 1.4043176174163818, | |
| "learning_rate": 5.255255255255256e-06, | |
| "loss": 0.3586108684539795, | |
| "mean_token_accuracy": 0.906936950981617, | |
| "num_tokens": 2686976.0, | |
| "step": 164 | |
| }, | |
| { | |
| "entropy": 4.995940268039703, | |
| "epoch": 0.4888888888888889, | |
| "grad_norm": 1.2404309511184692, | |
| "learning_rate": 5.225225225225226e-06, | |
| "loss": 0.24390891194343567, | |
| "mean_token_accuracy": 0.9296717569231987, | |
| "num_tokens": 2703360.0, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 4.797116637229919, | |
| "epoch": 0.4918518518518519, | |
| "grad_norm": 1.1622867584228516, | |
| "learning_rate": 5.195195195195195e-06, | |
| "loss": 0.23147624731063843, | |
| "mean_token_accuracy": 0.9457610249519348, | |
| "num_tokens": 2719744.0, | |
| "step": 166 | |
| }, | |
| { | |
| "entropy": 4.39326399564743, | |
| "epoch": 0.4948148148148148, | |
| "grad_norm": 0.9756916761398315, | |
| "learning_rate": 5.165165165165165e-06, | |
| "loss": 0.17684155702590942, | |
| "mean_token_accuracy": 0.9526332467794418, | |
| "num_tokens": 2736128.0, | |
| "step": 167 | |
| }, | |
| { | |
| "entropy": 4.997508525848389, | |
| "epoch": 0.49777777777777776, | |
| "grad_norm": 1.3051714897155762, | |
| "learning_rate": 5.135135135135135e-06, | |
| "loss": 0.2765073776245117, | |
| "mean_token_accuracy": 0.9134911745786667, | |
| "num_tokens": 2752512.0, | |
| "step": 168 | |
| }, | |
| { | |
| "entropy": 4.755920052528381, | |
| "epoch": 0.5007407407407407, | |
| "grad_norm": 1.1401017904281616, | |
| "learning_rate": 5.105105105105106e-06, | |
| "loss": 0.161317840218544, | |
| "mean_token_accuracy": 0.956555500626564, | |
| "num_tokens": 2768896.0, | |
| "step": 169 | |
| }, | |
| { | |
| "entropy": 4.551803827285767, | |
| "epoch": 0.5037037037037037, | |
| "grad_norm": 1.263131022453308, | |
| "learning_rate": 5.075075075075075e-06, | |
| "loss": 0.21821963787078857, | |
| "mean_token_accuracy": 0.9273721501231194, | |
| "num_tokens": 2785280.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 4.860443592071533, | |
| "epoch": 0.5066666666666667, | |
| "grad_norm": 1.6431126594543457, | |
| "learning_rate": 5.045045045045045e-06, | |
| "loss": 0.2978250980377197, | |
| "mean_token_accuracy": 0.93219093978405, | |
| "num_tokens": 2801664.0, | |
| "step": 171 | |
| }, | |
| { | |
| "entropy": 5.091837644577026, | |
| "epoch": 0.5096296296296297, | |
| "grad_norm": 1.2256911993026733, | |
| "learning_rate": 5.0150150150150156e-06, | |
| "loss": 0.22089162468910217, | |
| "mean_token_accuracy": 0.9408608600497246, | |
| "num_tokens": 2818048.0, | |
| "step": 172 | |
| }, | |
| { | |
| "entropy": 4.412120908498764, | |
| "epoch": 0.5125925925925926, | |
| "grad_norm": 0.961300253868103, | |
| "learning_rate": 4.984984984984985e-06, | |
| "loss": 0.1452527940273285, | |
| "mean_token_accuracy": 0.9523980766534805, | |
| "num_tokens": 2834432.0, | |
| "step": 173 | |
| }, | |
| { | |
| "entropy": 4.599301666021347, | |
| "epoch": 0.5155555555555555, | |
| "grad_norm": 1.2644505500793457, | |
| "learning_rate": 4.954954954954955e-06, | |
| "loss": 0.23289738595485687, | |
| "mean_token_accuracy": 0.9304530620574951, | |
| "num_tokens": 2850816.0, | |
| "step": 174 | |
| }, | |
| { | |
| "entropy": 4.892768442630768, | |
| "epoch": 0.5185185185185185, | |
| "grad_norm": 1.3745007514953613, | |
| "learning_rate": 4.9249249249249255e-06, | |
| "loss": 0.26232171058654785, | |
| "mean_token_accuracy": 0.9334614500403404, | |
| "num_tokens": 2867200.0, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 4.197520017623901, | |
| "epoch": 0.5214814814814814, | |
| "grad_norm": 0.7528343796730042, | |
| "learning_rate": 4.894894894894895e-06, | |
| "loss": 0.08706651628017426, | |
| "mean_token_accuracy": 0.9749511107802391, | |
| "num_tokens": 2883584.0, | |
| "step": 176 | |
| }, | |
| { | |
| "entropy": 4.844129204750061, | |
| "epoch": 0.5244444444444445, | |
| "grad_norm": 0.9900454878807068, | |
| "learning_rate": 4.864864864864866e-06, | |
| "loss": 0.13525359332561493, | |
| "mean_token_accuracy": 0.9629090502858162, | |
| "num_tokens": 2899968.0, | |
| "step": 177 | |
| }, | |
| { | |
| "entropy": 4.392915487289429, | |
| "epoch": 0.5274074074074074, | |
| "grad_norm": 1.133989691734314, | |
| "learning_rate": 4.8348348348348355e-06, | |
| "loss": 0.21110782027244568, | |
| "mean_token_accuracy": 0.9441019669175148, | |
| "num_tokens": 2916352.0, | |
| "step": 178 | |
| }, | |
| { | |
| "entropy": 4.104142814874649, | |
| "epoch": 0.5303703703703704, | |
| "grad_norm": 0.850631833076477, | |
| "learning_rate": 4.804804804804805e-06, | |
| "loss": 0.10834487527608871, | |
| "mean_token_accuracy": 0.9692110046744347, | |
| "num_tokens": 2932736.0, | |
| "step": 179 | |
| }, | |
| { | |
| "entropy": 4.734551101922989, | |
| "epoch": 0.5333333333333333, | |
| "grad_norm": 1.3208616971969604, | |
| "learning_rate": 4.774774774774775e-06, | |
| "loss": 0.23270879685878754, | |
| "mean_token_accuracy": 0.9379692524671555, | |
| "num_tokens": 2949120.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 4.912560999393463, | |
| "epoch": 0.5362962962962963, | |
| "grad_norm": 1.2346423864364624, | |
| "learning_rate": 4.7447447447447454e-06, | |
| "loss": 0.19857312738895416, | |
| "mean_token_accuracy": 0.9455485790967941, | |
| "num_tokens": 2965504.0, | |
| "step": 181 | |
| }, | |
| { | |
| "entropy": 4.509212881326675, | |
| "epoch": 0.5392592592592592, | |
| "grad_norm": 1.0463180541992188, | |
| "learning_rate": 4.714714714714715e-06, | |
| "loss": 0.16583660244941711, | |
| "mean_token_accuracy": 0.9510217607021332, | |
| "num_tokens": 2981888.0, | |
| "step": 182 | |
| }, | |
| { | |
| "entropy": 4.015108644962311, | |
| "epoch": 0.5422222222222223, | |
| "grad_norm": 1.0624524354934692, | |
| "learning_rate": 4.684684684684685e-06, | |
| "loss": 0.15331816673278809, | |
| "mean_token_accuracy": 0.9658570662140846, | |
| "num_tokens": 2998272.0, | |
| "step": 183 | |
| }, | |
| { | |
| "entropy": 4.083783894777298, | |
| "epoch": 0.5451851851851852, | |
| "grad_norm": 0.9544261693954468, | |
| "learning_rate": 4.654654654654655e-06, | |
| "loss": 0.14625918865203857, | |
| "mean_token_accuracy": 0.9399384111166, | |
| "num_tokens": 3014656.0, | |
| "step": 184 | |
| }, | |
| { | |
| "entropy": 4.890080273151398, | |
| "epoch": 0.5481481481481482, | |
| "grad_norm": 1.2931667566299438, | |
| "learning_rate": 4.624624624624625e-06, | |
| "loss": 0.24348178505897522, | |
| "mean_token_accuracy": 0.938007041811943, | |
| "num_tokens": 3031040.0, | |
| "step": 185 | |
| }, | |
| { | |
| "entropy": 4.95048725605011, | |
| "epoch": 0.5511111111111111, | |
| "grad_norm": 1.5240236520767212, | |
| "learning_rate": 4.594594594594596e-06, | |
| "loss": 0.343029260635376, | |
| "mean_token_accuracy": 0.9150973930954933, | |
| "num_tokens": 3047424.0, | |
| "step": 186 | |
| }, | |
| { | |
| "entropy": 4.586461454629898, | |
| "epoch": 0.554074074074074, | |
| "grad_norm": 1.1299018859863281, | |
| "learning_rate": 4.5645645645645645e-06, | |
| "loss": 0.15247294306755066, | |
| "mean_token_accuracy": 0.9517891779541969, | |
| "num_tokens": 3063808.0, | |
| "step": 187 | |
| }, | |
| { | |
| "entropy": 4.866858541965485, | |
| "epoch": 0.557037037037037, | |
| "grad_norm": 1.3016594648361206, | |
| "learning_rate": 4.534534534534535e-06, | |
| "loss": 0.21522042155265808, | |
| "mean_token_accuracy": 0.9356319904327393, | |
| "num_tokens": 3080192.0, | |
| "step": 188 | |
| }, | |
| { | |
| "entropy": 4.672504544258118, | |
| "epoch": 0.56, | |
| "grad_norm": 1.055087924003601, | |
| "learning_rate": 4.504504504504505e-06, | |
| "loss": 0.2004142701625824, | |
| "mean_token_accuracy": 0.9426759034395218, | |
| "num_tokens": 3096576.0, | |
| "step": 189 | |
| }, | |
| { | |
| "entropy": 4.583247601985931, | |
| "epoch": 0.562962962962963, | |
| "grad_norm": 1.2147111892700195, | |
| "learning_rate": 4.474474474474475e-06, | |
| "loss": 0.19617295265197754, | |
| "mean_token_accuracy": 0.9414351284503937, | |
| "num_tokens": 3112960.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 4.45947140455246, | |
| "epoch": 0.5659259259259259, | |
| "grad_norm": 0.9906570911407471, | |
| "learning_rate": 4.444444444444444e-06, | |
| "loss": 0.1671217381954193, | |
| "mean_token_accuracy": 0.949979692697525, | |
| "num_tokens": 3129344.0, | |
| "step": 191 | |
| }, | |
| { | |
| "entropy": 4.343527674674988, | |
| "epoch": 0.5688888888888889, | |
| "grad_norm": 1.0607426166534424, | |
| "learning_rate": 4.414414414414415e-06, | |
| "loss": 0.1750665307044983, | |
| "mean_token_accuracy": 0.9508633464574814, | |
| "num_tokens": 3145728.0, | |
| "step": 192 | |
| }, | |
| { | |
| "entropy": 4.752969801425934, | |
| "epoch": 0.5718518518518518, | |
| "grad_norm": 1.6461411714553833, | |
| "learning_rate": 4.384384384384384e-06, | |
| "loss": 0.3614075481891632, | |
| "mean_token_accuracy": 0.9037638604640961, | |
| "num_tokens": 3162112.0, | |
| "step": 193 | |
| }, | |
| { | |
| "entropy": 4.508844017982483, | |
| "epoch": 0.5748148148148148, | |
| "grad_norm": 1.089011549949646, | |
| "learning_rate": 4.354354354354355e-06, | |
| "loss": 0.14948895573616028, | |
| "mean_token_accuracy": 0.9594759792089462, | |
| "num_tokens": 3178496.0, | |
| "step": 194 | |
| }, | |
| { | |
| "entropy": 5.090130269527435, | |
| "epoch": 0.5777777777777777, | |
| "grad_norm": 1.6512131690979004, | |
| "learning_rate": 4.324324324324325e-06, | |
| "loss": 0.2583276331424713, | |
| "mean_token_accuracy": 0.9319260492920876, | |
| "num_tokens": 3194880.0, | |
| "step": 195 | |
| }, | |
| { | |
| "entropy": 4.824137568473816, | |
| "epoch": 0.5807407407407408, | |
| "grad_norm": 1.3563088178634644, | |
| "learning_rate": 4.294294294294294e-06, | |
| "loss": 0.2706582546234131, | |
| "mean_token_accuracy": 0.9324178025126457, | |
| "num_tokens": 3211264.0, | |
| "step": 196 | |
| }, | |
| { | |
| "entropy": 4.71843621134758, | |
| "epoch": 0.5837037037037037, | |
| "grad_norm": 1.3810391426086426, | |
| "learning_rate": 4.264264264264265e-06, | |
| "loss": 0.24942129850387573, | |
| "mean_token_accuracy": 0.9400762096047401, | |
| "num_tokens": 3227648.0, | |
| "step": 197 | |
| }, | |
| { | |
| "entropy": 5.009927153587341, | |
| "epoch": 0.5866666666666667, | |
| "grad_norm": 1.4821265935897827, | |
| "learning_rate": 4.234234234234235e-06, | |
| "loss": 0.24027667939662933, | |
| "mean_token_accuracy": 0.9404318556189537, | |
| "num_tokens": 3244032.0, | |
| "step": 198 | |
| }, | |
| { | |
| "entropy": 4.441025912761688, | |
| "epoch": 0.5896296296296296, | |
| "grad_norm": 1.1178737878799438, | |
| "learning_rate": 4.204204204204204e-06, | |
| "loss": 0.16021518409252167, | |
| "mean_token_accuracy": 0.9493553563952446, | |
| "num_tokens": 3260416.0, | |
| "step": 199 | |
| }, | |
| { | |
| "entropy": 4.375000834465027, | |
| "epoch": 0.5925925925925926, | |
| "grad_norm": 0.8944060206413269, | |
| "learning_rate": 4.174174174174174e-06, | |
| "loss": 0.11856413632631302, | |
| "mean_token_accuracy": 0.9657595604658127, | |
| "num_tokens": 3276800.0, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.5925925925925926, | |
| "eval_entropy": 4.434207131067912, | |
| "eval_loss": 0.19389286637306213, | |
| "eval_mean_token_accuracy": 0.9477152585983276, | |
| "eval_num_tokens": 3276800.0, | |
| "eval_runtime": 41.8193, | |
| "eval_samples_per_second": 14.347, | |
| "eval_steps_per_second": 1.793, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 4.466799020767212, | |
| "epoch": 0.5955555555555555, | |
| "grad_norm": 1.115869402885437, | |
| "learning_rate": 4.1441441441441446e-06, | |
| "loss": 0.1898970603942871, | |
| "mean_token_accuracy": 0.9451106563210487, | |
| "num_tokens": 3293184.0, | |
| "step": 201 | |
| }, | |
| { | |
| "entropy": 4.269784092903137, | |
| "epoch": 0.5985185185185186, | |
| "grad_norm": 0.9474321603775024, | |
| "learning_rate": 4.114114114114114e-06, | |
| "loss": 0.13602310419082642, | |
| "mean_token_accuracy": 0.9589507281780243, | |
| "num_tokens": 3309568.0, | |
| "step": 202 | |
| }, | |
| { | |
| "entropy": 4.54515814781189, | |
| "epoch": 0.6014814814814815, | |
| "grad_norm": 1.2822232246398926, | |
| "learning_rate": 4.084084084084085e-06, | |
| "loss": 0.22034525871276855, | |
| "mean_token_accuracy": 0.9429414942860603, | |
| "num_tokens": 3325952.0, | |
| "step": 203 | |
| }, | |
| { | |
| "entropy": 4.767253935337067, | |
| "epoch": 0.6044444444444445, | |
| "grad_norm": 1.2094990015029907, | |
| "learning_rate": 4.0540540540540545e-06, | |
| "loss": 0.23143570125102997, | |
| "mean_token_accuracy": 0.9389630481600761, | |
| "num_tokens": 3342336.0, | |
| "step": 204 | |
| }, | |
| { | |
| "entropy": 4.702608406543732, | |
| "epoch": 0.6074074074074074, | |
| "grad_norm": 1.2544713020324707, | |
| "learning_rate": 4.024024024024024e-06, | |
| "loss": 0.28470316529273987, | |
| "mean_token_accuracy": 0.9257371500134468, | |
| "num_tokens": 3358720.0, | |
| "step": 205 | |
| }, | |
| { | |
| "entropy": 4.597526431083679, | |
| "epoch": 0.6103703703703703, | |
| "grad_norm": 1.1126115322113037, | |
| "learning_rate": 3.993993993993994e-06, | |
| "loss": 0.1989898383617401, | |
| "mean_token_accuracy": 0.9416873753070831, | |
| "num_tokens": 3375104.0, | |
| "step": 206 | |
| }, | |
| { | |
| "entropy": 4.506279408931732, | |
| "epoch": 0.6133333333333333, | |
| "grad_norm": 0.8431299328804016, | |
| "learning_rate": 3.9639639639639645e-06, | |
| "loss": 0.13484124839305878, | |
| "mean_token_accuracy": 0.95867919921875, | |
| "num_tokens": 3391488.0, | |
| "step": 207 | |
| }, | |
| { | |
| "entropy": 4.58755087852478, | |
| "epoch": 0.6162962962962963, | |
| "grad_norm": 1.352049708366394, | |
| "learning_rate": 3.933933933933934e-06, | |
| "loss": 0.22309252619743347, | |
| "mean_token_accuracy": 0.9428984001278877, | |
| "num_tokens": 3407872.0, | |
| "step": 208 | |
| }, | |
| { | |
| "entropy": 4.268629372119904, | |
| "epoch": 0.6192592592592593, | |
| "grad_norm": 1.1418225765228271, | |
| "learning_rate": 3.903903903903904e-06, | |
| "loss": 0.24874381721019745, | |
| "mean_token_accuracy": 0.9192089438438416, | |
| "num_tokens": 3424256.0, | |
| "step": 209 | |
| }, | |
| { | |
| "entropy": 4.83259379863739, | |
| "epoch": 0.6222222222222222, | |
| "grad_norm": 1.3404130935668945, | |
| "learning_rate": 3.8738738738738744e-06, | |
| "loss": 0.24457751214504242, | |
| "mean_token_accuracy": 0.937289871275425, | |
| "num_tokens": 3440640.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 4.678910106420517, | |
| "epoch": 0.6251851851851852, | |
| "grad_norm": 1.2527177333831787, | |
| "learning_rate": 3.843843843843844e-06, | |
| "loss": 0.22603629529476166, | |
| "mean_token_accuracy": 0.9248089641332626, | |
| "num_tokens": 3457024.0, | |
| "step": 211 | |
| }, | |
| { | |
| "entropy": 4.5991188287734985, | |
| "epoch": 0.6281481481481481, | |
| "grad_norm": 0.9777531623840332, | |
| "learning_rate": 3.8138138138138143e-06, | |
| "loss": 0.14755500853061676, | |
| "mean_token_accuracy": 0.9557277113199234, | |
| "num_tokens": 3473408.0, | |
| "step": 212 | |
| }, | |
| { | |
| "entropy": 4.511403858661652, | |
| "epoch": 0.6311111111111111, | |
| "grad_norm": 1.2577223777770996, | |
| "learning_rate": 3.7837837837837844e-06, | |
| "loss": 0.26127955317497253, | |
| "mean_token_accuracy": 0.931500144302845, | |
| "num_tokens": 3489792.0, | |
| "step": 213 | |
| }, | |
| { | |
| "entropy": 4.782365560531616, | |
| "epoch": 0.6340740740740741, | |
| "grad_norm": 1.1569401025772095, | |
| "learning_rate": 3.7537537537537537e-06, | |
| "loss": 0.19748210906982422, | |
| "mean_token_accuracy": 0.9451235607266426, | |
| "num_tokens": 3506176.0, | |
| "step": 214 | |
| }, | |
| { | |
| "entropy": 4.5431535840034485, | |
| "epoch": 0.6370370370370371, | |
| "grad_norm": 1.0455090999603271, | |
| "learning_rate": 3.723723723723724e-06, | |
| "loss": 0.18465566635131836, | |
| "mean_token_accuracy": 0.947294220328331, | |
| "num_tokens": 3522560.0, | |
| "step": 215 | |
| }, | |
| { | |
| "entropy": 4.15060818195343, | |
| "epoch": 0.64, | |
| "grad_norm": 0.9153735041618347, | |
| "learning_rate": 3.693693693693694e-06, | |
| "loss": 0.12476930022239685, | |
| "mean_token_accuracy": 0.960964560508728, | |
| "num_tokens": 3538944.0, | |
| "step": 216 | |
| }, | |
| { | |
| "entropy": 4.939278542995453, | |
| "epoch": 0.642962962962963, | |
| "grad_norm": 1.75506591796875, | |
| "learning_rate": 3.663663663663664e-06, | |
| "loss": 0.33442193269729614, | |
| "mean_token_accuracy": 0.9232882410287857, | |
| "num_tokens": 3555328.0, | |
| "step": 217 | |
| }, | |
| { | |
| "entropy": 4.662109076976776, | |
| "epoch": 0.6459259259259259, | |
| "grad_norm": 1.198652744293213, | |
| "learning_rate": 3.633633633633634e-06, | |
| "loss": 0.1985606849193573, | |
| "mean_token_accuracy": 0.9437128081917763, | |
| "num_tokens": 3571712.0, | |
| "step": 218 | |
| }, | |
| { | |
| "entropy": 4.011054754257202, | |
| "epoch": 0.6488888888888888, | |
| "grad_norm": 0.7987180352210999, | |
| "learning_rate": 3.603603603603604e-06, | |
| "loss": 0.12160375714302063, | |
| "mean_token_accuracy": 0.9573516696691513, | |
| "num_tokens": 3588096.0, | |
| "step": 219 | |
| }, | |
| { | |
| "entropy": 4.471042722463608, | |
| "epoch": 0.6518518518518519, | |
| "grad_norm": 1.1055737733840942, | |
| "learning_rate": 3.573573573573574e-06, | |
| "loss": 0.1902877688407898, | |
| "mean_token_accuracy": 0.9458613023161888, | |
| "num_tokens": 3604480.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 4.585752725601196, | |
| "epoch": 0.6548148148148148, | |
| "grad_norm": 1.390073299407959, | |
| "learning_rate": 3.5435435435435437e-06, | |
| "loss": 0.2900771200656891, | |
| "mean_token_accuracy": 0.9287381917238235, | |
| "num_tokens": 3620864.0, | |
| "step": 221 | |
| }, | |
| { | |
| "entropy": 4.868175387382507, | |
| "epoch": 0.6577777777777778, | |
| "grad_norm": 1.0750362873077393, | |
| "learning_rate": 3.513513513513514e-06, | |
| "loss": 0.14728227257728577, | |
| "mean_token_accuracy": 0.9561847373843193, | |
| "num_tokens": 3637248.0, | |
| "step": 222 | |
| }, | |
| { | |
| "entropy": 4.30068638920784, | |
| "epoch": 0.6607407407407407, | |
| "grad_norm": 0.9645360112190247, | |
| "learning_rate": 3.4834834834834835e-06, | |
| "loss": 0.1360422521829605, | |
| "mean_token_accuracy": 0.963471345603466, | |
| "num_tokens": 3653632.0, | |
| "step": 223 | |
| }, | |
| { | |
| "entropy": 3.964165151119232, | |
| "epoch": 0.6637037037037037, | |
| "grad_norm": 0.8071714043617249, | |
| "learning_rate": 3.4534534534534537e-06, | |
| "loss": 0.1220124140381813, | |
| "mean_token_accuracy": 0.9683285132050514, | |
| "num_tokens": 3670016.0, | |
| "step": 224 | |
| }, | |
| { | |
| "entropy": 4.224881365895271, | |
| "epoch": 0.6666666666666666, | |
| "grad_norm": 1.177420973777771, | |
| "learning_rate": 3.423423423423424e-06, | |
| "loss": 0.25342920422554016, | |
| "mean_token_accuracy": 0.9281225427985191, | |
| "num_tokens": 3686400.0, | |
| "step": 225 | |
| }, | |
| { | |
| "entropy": 4.558864623308182, | |
| "epoch": 0.6696296296296296, | |
| "grad_norm": 1.1701397895812988, | |
| "learning_rate": 3.393393393393394e-06, | |
| "loss": 0.17833128571510315, | |
| "mean_token_accuracy": 0.9490250796079636, | |
| "num_tokens": 3702784.0, | |
| "step": 226 | |
| }, | |
| { | |
| "entropy": 4.978881150484085, | |
| "epoch": 0.6725925925925926, | |
| "grad_norm": 1.158742070198059, | |
| "learning_rate": 3.363363363363364e-06, | |
| "loss": 0.20285750925540924, | |
| "mean_token_accuracy": 0.9312335178256035, | |
| "num_tokens": 3719168.0, | |
| "step": 227 | |
| }, | |
| { | |
| "entropy": 4.179438591003418, | |
| "epoch": 0.6755555555555556, | |
| "grad_norm": 1.008829116821289, | |
| "learning_rate": 3.3333333333333333e-06, | |
| "loss": 0.12895622849464417, | |
| "mean_token_accuracy": 0.959755003452301, | |
| "num_tokens": 3735552.0, | |
| "step": 228 | |
| }, | |
| { | |
| "entropy": 4.323319256305695, | |
| "epoch": 0.6785185185185185, | |
| "grad_norm": 0.979805588722229, | |
| "learning_rate": 3.3033033033033035e-06, | |
| "loss": 0.16936425864696503, | |
| "mean_token_accuracy": 0.9553892686963081, | |
| "num_tokens": 3751936.0, | |
| "step": 229 | |
| }, | |
| { | |
| "entropy": 4.394837021827698, | |
| "epoch": 0.6814814814814815, | |
| "grad_norm": 1.8132017850875854, | |
| "learning_rate": 3.2732732732732736e-06, | |
| "loss": 0.14924685657024384, | |
| "mean_token_accuracy": 0.9515182301402092, | |
| "num_tokens": 3768320.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 4.344091087579727, | |
| "epoch": 0.6844444444444444, | |
| "grad_norm": 1.021894097328186, | |
| "learning_rate": 3.2432432432432437e-06, | |
| "loss": 0.1912682056427002, | |
| "mean_token_accuracy": 0.938031829893589, | |
| "num_tokens": 3784704.0, | |
| "step": 231 | |
| }, | |
| { | |
| "entropy": 4.561292320489883, | |
| "epoch": 0.6874074074074074, | |
| "grad_norm": 0.9297524094581604, | |
| "learning_rate": 3.2132132132132134e-06, | |
| "loss": 0.14056260883808136, | |
| "mean_token_accuracy": 0.9600224196910858, | |
| "num_tokens": 3801088.0, | |
| "step": 232 | |
| }, | |
| { | |
| "entropy": 4.751155436038971, | |
| "epoch": 0.6903703703703704, | |
| "grad_norm": 1.4993069171905518, | |
| "learning_rate": 3.183183183183183e-06, | |
| "loss": 0.3311198055744171, | |
| "mean_token_accuracy": 0.91727364808321, | |
| "num_tokens": 3817472.0, | |
| "step": 233 | |
| }, | |
| { | |
| "entropy": 3.6052426397800446, | |
| "epoch": 0.6933333333333334, | |
| "grad_norm": 0.792428195476532, | |
| "learning_rate": 3.1531531531531532e-06, | |
| "loss": 0.10642168670892715, | |
| "mean_token_accuracy": 0.9628430530428886, | |
| "num_tokens": 3833856.0, | |
| "step": 234 | |
| }, | |
| { | |
| "entropy": 4.941285133361816, | |
| "epoch": 0.6962962962962963, | |
| "grad_norm": 1.4012000560760498, | |
| "learning_rate": 3.1231231231231234e-06, | |
| "loss": 0.2629278600215912, | |
| "mean_token_accuracy": 0.9188983291387558, | |
| "num_tokens": 3850240.0, | |
| "step": 235 | |
| }, | |
| { | |
| "entropy": 4.552713304758072, | |
| "epoch": 0.6992592592592592, | |
| "grad_norm": 0.9069911241531372, | |
| "learning_rate": 3.0930930930930935e-06, | |
| "loss": 0.12337417900562286, | |
| "mean_token_accuracy": 0.9626295566558838, | |
| "num_tokens": 3866624.0, | |
| "step": 236 | |
| }, | |
| { | |
| "entropy": 4.564219534397125, | |
| "epoch": 0.7022222222222222, | |
| "grad_norm": 0.9812677502632141, | |
| "learning_rate": 3.063063063063063e-06, | |
| "loss": 0.1848071813583374, | |
| "mean_token_accuracy": 0.9507527649402618, | |
| "num_tokens": 3883008.0, | |
| "step": 237 | |
| }, | |
| { | |
| "entropy": 4.246627330780029, | |
| "epoch": 0.7051851851851851, | |
| "grad_norm": 0.947043776512146, | |
| "learning_rate": 3.0330330330330333e-06, | |
| "loss": 0.1329410970211029, | |
| "mean_token_accuracy": 0.9477042853832245, | |
| "num_tokens": 3899392.0, | |
| "step": 238 | |
| }, | |
| { | |
| "entropy": 4.977287948131561, | |
| "epoch": 0.7081481481481482, | |
| "grad_norm": 1.1813249588012695, | |
| "learning_rate": 3.0030030030030034e-06, | |
| "loss": 0.14123371243476868, | |
| "mean_token_accuracy": 0.9628991261124611, | |
| "num_tokens": 3915776.0, | |
| "step": 239 | |
| }, | |
| { | |
| "entropy": 5.06807667016983, | |
| "epoch": 0.7111111111111111, | |
| "grad_norm": 1.3652091026306152, | |
| "learning_rate": 2.9729729729729736e-06, | |
| "loss": 0.1918249875307083, | |
| "mean_token_accuracy": 0.9512263685464859, | |
| "num_tokens": 3932160.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 4.769917339086533, | |
| "epoch": 0.7140740740740741, | |
| "grad_norm": 1.279091477394104, | |
| "learning_rate": 2.942942942942943e-06, | |
| "loss": 0.20959080755710602, | |
| "mean_token_accuracy": 0.9461727887392044, | |
| "num_tokens": 3948544.0, | |
| "step": 241 | |
| }, | |
| { | |
| "entropy": 4.704398810863495, | |
| "epoch": 0.717037037037037, | |
| "grad_norm": 1.2999058961868286, | |
| "learning_rate": 2.912912912912913e-06, | |
| "loss": 0.214752659201622, | |
| "mean_token_accuracy": 0.9327414259314537, | |
| "num_tokens": 3964928.0, | |
| "step": 242 | |
| }, | |
| { | |
| "entropy": 4.448032274842262, | |
| "epoch": 0.72, | |
| "grad_norm": 1.1233701705932617, | |
| "learning_rate": 2.882882882882883e-06, | |
| "loss": 0.2309226542711258, | |
| "mean_token_accuracy": 0.9327290877699852, | |
| "num_tokens": 3981312.0, | |
| "step": 243 | |
| }, | |
| { | |
| "entropy": 4.651471734046936, | |
| "epoch": 0.7229629629629629, | |
| "grad_norm": 1.2081260681152344, | |
| "learning_rate": 2.8528528528528532e-06, | |
| "loss": 0.20126961171627045, | |
| "mean_token_accuracy": 0.9540340229868889, | |
| "num_tokens": 3997696.0, | |
| "step": 244 | |
| }, | |
| { | |
| "entropy": 3.968225985765457, | |
| "epoch": 0.725925925925926, | |
| "grad_norm": 0.9694662690162659, | |
| "learning_rate": 2.8228228228228234e-06, | |
| "loss": 0.15460558235645294, | |
| "mean_token_accuracy": 0.9566036984324455, | |
| "num_tokens": 4014080.0, | |
| "step": 245 | |
| }, | |
| { | |
| "entropy": 4.390538901090622, | |
| "epoch": 0.7288888888888889, | |
| "grad_norm": 0.8548852205276489, | |
| "learning_rate": 2.7927927927927926e-06, | |
| "loss": 0.097850002348423, | |
| "mean_token_accuracy": 0.9653645381331444, | |
| "num_tokens": 4030464.0, | |
| "step": 246 | |
| }, | |
| { | |
| "entropy": 4.503017544746399, | |
| "epoch": 0.7318518518518519, | |
| "grad_norm": 1.3469693660736084, | |
| "learning_rate": 2.7627627627627628e-06, | |
| "loss": 0.24841120839118958, | |
| "mean_token_accuracy": 0.9232476502656937, | |
| "num_tokens": 4046848.0, | |
| "step": 247 | |
| }, | |
| { | |
| "entropy": 4.462825655937195, | |
| "epoch": 0.7348148148148148, | |
| "grad_norm": 1.4217870235443115, | |
| "learning_rate": 2.732732732732733e-06, | |
| "loss": 0.19937056303024292, | |
| "mean_token_accuracy": 0.935769684612751, | |
| "num_tokens": 4063232.0, | |
| "step": 248 | |
| }, | |
| { | |
| "entropy": 4.652177691459656, | |
| "epoch": 0.7377777777777778, | |
| "grad_norm": 0.8824627995491028, | |
| "learning_rate": 2.702702702702703e-06, | |
| "loss": 0.10789984464645386, | |
| "mean_token_accuracy": 0.960510291159153, | |
| "num_tokens": 4079616.0, | |
| "step": 249 | |
| }, | |
| { | |
| "entropy": 4.937440276145935, | |
| "epoch": 0.7407407407407407, | |
| "grad_norm": 1.3179996013641357, | |
| "learning_rate": 2.672672672672673e-06, | |
| "loss": 0.2225571870803833, | |
| "mean_token_accuracy": 0.9387790188193321, | |
| "num_tokens": 4096000.0, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.7407407407407407, | |
| "eval_entropy": 4.431756820678711, | |
| "eval_loss": 0.18967284262180328, | |
| "eval_mean_token_accuracy": 0.9489845228195191, | |
| "eval_num_tokens": 4096000.0, | |
| "eval_runtime": 41.787, | |
| "eval_samples_per_second": 14.359, | |
| "eval_steps_per_second": 1.795, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 4.682657957077026, | |
| "epoch": 0.7437037037037038, | |
| "grad_norm": 1.3843475580215454, | |
| "learning_rate": 2.642642642642643e-06, | |
| "loss": 0.289166659116745, | |
| "mean_token_accuracy": 0.9240095615386963, | |
| "num_tokens": 4112384.0, | |
| "step": 251 | |
| }, | |
| { | |
| "entropy": 4.640824466943741, | |
| "epoch": 0.7466666666666667, | |
| "grad_norm": 1.3217209577560425, | |
| "learning_rate": 2.612612612612613e-06, | |
| "loss": 0.1822134405374527, | |
| "mean_token_accuracy": 0.9433777928352356, | |
| "num_tokens": 4128768.0, | |
| "step": 252 | |
| }, | |
| { | |
| "entropy": 4.447018921375275, | |
| "epoch": 0.7496296296296296, | |
| "grad_norm": 1.1168774366378784, | |
| "learning_rate": 2.5825825825825827e-06, | |
| "loss": 0.17142070829868317, | |
| "mean_token_accuracy": 0.9459712356328964, | |
| "num_tokens": 4145152.0, | |
| "step": 253 | |
| }, | |
| { | |
| "entropy": 3.9602254927158356, | |
| "epoch": 0.7525925925925926, | |
| "grad_norm": 0.8399432897567749, | |
| "learning_rate": 2.552552552552553e-06, | |
| "loss": 0.12639330327510834, | |
| "mean_token_accuracy": 0.9613935053348541, | |
| "num_tokens": 4161536.0, | |
| "step": 254 | |
| }, | |
| { | |
| "entropy": 4.601360231637955, | |
| "epoch": 0.7555555555555555, | |
| "grad_norm": 1.5550976991653442, | |
| "learning_rate": 2.5225225225225225e-06, | |
| "loss": 0.3048744797706604, | |
| "mean_token_accuracy": 0.9272002652287483, | |
| "num_tokens": 4177920.0, | |
| "step": 255 | |
| }, | |
| { | |
| "entropy": 4.242599338293076, | |
| "epoch": 0.7585185185185185, | |
| "grad_norm": 0.7686388492584229, | |
| "learning_rate": 2.4924924924924926e-06, | |
| "loss": 0.10443609952926636, | |
| "mean_token_accuracy": 0.9714921414852142, | |
| "num_tokens": 4194304.0, | |
| "step": 256 | |
| }, | |
| { | |
| "entropy": 4.363556146621704, | |
| "epoch": 0.7614814814814815, | |
| "grad_norm": 1.1787077188491821, | |
| "learning_rate": 2.4624624624624628e-06, | |
| "loss": 0.204661563038826, | |
| "mean_token_accuracy": 0.9339022636413574, | |
| "num_tokens": 4210688.0, | |
| "step": 257 | |
| }, | |
| { | |
| "entropy": 4.804235219955444, | |
| "epoch": 0.7644444444444445, | |
| "grad_norm": 1.2627975940704346, | |
| "learning_rate": 2.432432432432433e-06, | |
| "loss": 0.2364749014377594, | |
| "mean_token_accuracy": 0.9268576577305794, | |
| "num_tokens": 4227072.0, | |
| "step": 258 | |
| }, | |
| { | |
| "entropy": 4.747017592191696, | |
| "epoch": 0.7674074074074074, | |
| "grad_norm": 1.2610846757888794, | |
| "learning_rate": 2.4024024024024026e-06, | |
| "loss": 0.22435243427753448, | |
| "mean_token_accuracy": 0.9417654201388359, | |
| "num_tokens": 4243456.0, | |
| "step": 259 | |
| }, | |
| { | |
| "entropy": 4.638267368078232, | |
| "epoch": 0.7703703703703704, | |
| "grad_norm": 0.9914318323135376, | |
| "learning_rate": 2.3723723723723727e-06, | |
| "loss": 0.13380999863147736, | |
| "mean_token_accuracy": 0.9633992239832878, | |
| "num_tokens": 4259840.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 4.573302686214447, | |
| "epoch": 0.7733333333333333, | |
| "grad_norm": 1.0350133180618286, | |
| "learning_rate": 2.3423423423423424e-06, | |
| "loss": 0.12615230679512024, | |
| "mean_token_accuracy": 0.9685780853033066, | |
| "num_tokens": 4276224.0, | |
| "step": 261 | |
| }, | |
| { | |
| "entropy": 4.689242094755173, | |
| "epoch": 0.7762962962962963, | |
| "grad_norm": 1.2482013702392578, | |
| "learning_rate": 2.3123123123123125e-06, | |
| "loss": 0.23291385173797607, | |
| "mean_token_accuracy": 0.9366420358419418, | |
| "num_tokens": 4292608.0, | |
| "step": 262 | |
| }, | |
| { | |
| "entropy": 3.998199611902237, | |
| "epoch": 0.7792592592592592, | |
| "grad_norm": 1.0057257413864136, | |
| "learning_rate": 2.2822822822822822e-06, | |
| "loss": 0.17179888486862183, | |
| "mean_token_accuracy": 0.9553137645125389, | |
| "num_tokens": 4308992.0, | |
| "step": 263 | |
| }, | |
| { | |
| "entropy": 4.225500136613846, | |
| "epoch": 0.7822222222222223, | |
| "grad_norm": 1.0887339115142822, | |
| "learning_rate": 2.2522522522522524e-06, | |
| "loss": 0.19778764247894287, | |
| "mean_token_accuracy": 0.9462638273835182, | |
| "num_tokens": 4325376.0, | |
| "step": 264 | |
| }, | |
| { | |
| "entropy": 4.825541436672211, | |
| "epoch": 0.7851851851851852, | |
| "grad_norm": 1.3681272268295288, | |
| "learning_rate": 2.222222222222222e-06, | |
| "loss": 0.2275351583957672, | |
| "mean_token_accuracy": 0.9374270439147949, | |
| "num_tokens": 4341760.0, | |
| "step": 265 | |
| }, | |
| { | |
| "entropy": 4.241901844739914, | |
| "epoch": 0.7881481481481482, | |
| "grad_norm": 0.8523630499839783, | |
| "learning_rate": 2.192192192192192e-06, | |
| "loss": 0.12036363780498505, | |
| "mean_token_accuracy": 0.965179368853569, | |
| "num_tokens": 4358144.0, | |
| "step": 266 | |
| }, | |
| { | |
| "entropy": 4.517692267894745, | |
| "epoch": 0.7911111111111111, | |
| "grad_norm": 1.3278928995132446, | |
| "learning_rate": 2.1621621621621623e-06, | |
| "loss": 0.22415080666542053, | |
| "mean_token_accuracy": 0.9306197762489319, | |
| "num_tokens": 4374528.0, | |
| "step": 267 | |
| }, | |
| { | |
| "entropy": 4.571178376674652, | |
| "epoch": 0.794074074074074, | |
| "grad_norm": 1.1973634958267212, | |
| "learning_rate": 2.1321321321321325e-06, | |
| "loss": 0.20524609088897705, | |
| "mean_token_accuracy": 0.9440915882587433, | |
| "num_tokens": 4390912.0, | |
| "step": 268 | |
| }, | |
| { | |
| "entropy": 4.527001351118088, | |
| "epoch": 0.797037037037037, | |
| "grad_norm": 1.1548199653625488, | |
| "learning_rate": 2.102102102102102e-06, | |
| "loss": 0.17511600255966187, | |
| "mean_token_accuracy": 0.9538666158914566, | |
| "num_tokens": 4407296.0, | |
| "step": 269 | |
| }, | |
| { | |
| "entropy": 4.6544947028160095, | |
| "epoch": 0.8, | |
| "grad_norm": 1.2351737022399902, | |
| "learning_rate": 2.0720720720720723e-06, | |
| "loss": 0.19483497738838196, | |
| "mean_token_accuracy": 0.9452883303165436, | |
| "num_tokens": 4423680.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 5.057309329509735, | |
| "epoch": 0.802962962962963, | |
| "grad_norm": 1.6245460510253906, | |
| "learning_rate": 2.0420420420420424e-06, | |
| "loss": 0.2552773952484131, | |
| "mean_token_accuracy": 0.9292241409420967, | |
| "num_tokens": 4440064.0, | |
| "step": 271 | |
| }, | |
| { | |
| "entropy": 4.319163411855698, | |
| "epoch": 0.8059259259259259, | |
| "grad_norm": 1.1663082838058472, | |
| "learning_rate": 2.012012012012012e-06, | |
| "loss": 0.20227555930614471, | |
| "mean_token_accuracy": 0.9424327984452248, | |
| "num_tokens": 4456448.0, | |
| "step": 272 | |
| }, | |
| { | |
| "entropy": 4.2681728303432465, | |
| "epoch": 0.8088888888888889, | |
| "grad_norm": 1.123548150062561, | |
| "learning_rate": 1.9819819819819822e-06, | |
| "loss": 0.14079917967319489, | |
| "mean_token_accuracy": 0.9620539620518684, | |
| "num_tokens": 4472832.0, | |
| "step": 273 | |
| }, | |
| { | |
| "entropy": 4.891470432281494, | |
| "epoch": 0.8118518518518518, | |
| "grad_norm": 1.4096643924713135, | |
| "learning_rate": 1.951951951951952e-06, | |
| "loss": 0.28214773535728455, | |
| "mean_token_accuracy": 0.9280454739928246, | |
| "num_tokens": 4489216.0, | |
| "step": 274 | |
| }, | |
| { | |
| "entropy": 4.890909731388092, | |
| "epoch": 0.8148148148148148, | |
| "grad_norm": 1.5594446659088135, | |
| "learning_rate": 1.921921921921922e-06, | |
| "loss": 0.27530887722969055, | |
| "mean_token_accuracy": 0.9204972609877586, | |
| "num_tokens": 4505600.0, | |
| "step": 275 | |
| }, | |
| { | |
| "entropy": 4.334610432386398, | |
| "epoch": 0.8177777777777778, | |
| "grad_norm": 0.8866946697235107, | |
| "learning_rate": 1.8918918918918922e-06, | |
| "loss": 0.10634834319353104, | |
| "mean_token_accuracy": 0.974961668252945, | |
| "num_tokens": 4521984.0, | |
| "step": 276 | |
| }, | |
| { | |
| "entropy": 4.795411825180054, | |
| "epoch": 0.8207407407407408, | |
| "grad_norm": 1.2682218551635742, | |
| "learning_rate": 1.861861861861862e-06, | |
| "loss": 0.23752596974372864, | |
| "mean_token_accuracy": 0.9372685104608536, | |
| "num_tokens": 4538368.0, | |
| "step": 277 | |
| }, | |
| { | |
| "entropy": 4.446784436702728, | |
| "epoch": 0.8237037037037037, | |
| "grad_norm": 1.0979875326156616, | |
| "learning_rate": 1.831831831831832e-06, | |
| "loss": 0.17328760027885437, | |
| "mean_token_accuracy": 0.9520234763622284, | |
| "num_tokens": 4554752.0, | |
| "step": 278 | |
| }, | |
| { | |
| "entropy": 5.077227234840393, | |
| "epoch": 0.8266666666666667, | |
| "grad_norm": 1.7083468437194824, | |
| "learning_rate": 1.801801801801802e-06, | |
| "loss": 0.3257288336753845, | |
| "mean_token_accuracy": 0.9132296666502953, | |
| "num_tokens": 4571136.0, | |
| "step": 279 | |
| }, | |
| { | |
| "entropy": 4.317785233259201, | |
| "epoch": 0.8296296296296296, | |
| "grad_norm": 0.9281159043312073, | |
| "learning_rate": 1.7717717717717719e-06, | |
| "loss": 0.1367281675338745, | |
| "mean_token_accuracy": 0.9651428610086441, | |
| "num_tokens": 4587520.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 5.042377591133118, | |
| "epoch": 0.8325925925925926, | |
| "grad_norm": 1.3829681873321533, | |
| "learning_rate": 1.7417417417417418e-06, | |
| "loss": 0.24436160922050476, | |
| "mean_token_accuracy": 0.9278001636266708, | |
| "num_tokens": 4603904.0, | |
| "step": 281 | |
| }, | |
| { | |
| "entropy": 4.584516406059265, | |
| "epoch": 0.8355555555555556, | |
| "grad_norm": 1.1155527830123901, | |
| "learning_rate": 1.711711711711712e-06, | |
| "loss": 0.19232724606990814, | |
| "mean_token_accuracy": 0.9483994618058205, | |
| "num_tokens": 4620288.0, | |
| "step": 282 | |
| }, | |
| { | |
| "entropy": 4.5082491636276245, | |
| "epoch": 0.8385185185185186, | |
| "grad_norm": 0.938524603843689, | |
| "learning_rate": 1.681681681681682e-06, | |
| "loss": 0.14862608909606934, | |
| "mean_token_accuracy": 0.9592047855257988, | |
| "num_tokens": 4636672.0, | |
| "step": 283 | |
| }, | |
| { | |
| "entropy": 4.207568436861038, | |
| "epoch": 0.8414814814814815, | |
| "grad_norm": 0.7634081244468689, | |
| "learning_rate": 1.6516516516516517e-06, | |
| "loss": 0.10312718152999878, | |
| "mean_token_accuracy": 0.9655114337801933, | |
| "num_tokens": 4653056.0, | |
| "step": 284 | |
| }, | |
| { | |
| "entropy": 4.553406655788422, | |
| "epoch": 0.8444444444444444, | |
| "grad_norm": 1.1271867752075195, | |
| "learning_rate": 1.6216216216216219e-06, | |
| "loss": 0.1725669503211975, | |
| "mean_token_accuracy": 0.9447145611047745, | |
| "num_tokens": 4669440.0, | |
| "step": 285 | |
| }, | |
| { | |
| "entropy": 4.9145150780677795, | |
| "epoch": 0.8474074074074074, | |
| "grad_norm": 1.121119737625122, | |
| "learning_rate": 1.5915915915915916e-06, | |
| "loss": 0.1591874212026596, | |
| "mean_token_accuracy": 0.9459866732358932, | |
| "num_tokens": 4685824.0, | |
| "step": 286 | |
| }, | |
| { | |
| "entropy": 4.546119570732117, | |
| "epoch": 0.8503703703703703, | |
| "grad_norm": 1.0445350408554077, | |
| "learning_rate": 1.5615615615615617e-06, | |
| "loss": 0.18919306993484497, | |
| "mean_token_accuracy": 0.9420925006270409, | |
| "num_tokens": 4702208.0, | |
| "step": 287 | |
| }, | |
| { | |
| "entropy": 4.208664923906326, | |
| "epoch": 0.8533333333333334, | |
| "grad_norm": 1.017647624015808, | |
| "learning_rate": 1.5315315315315316e-06, | |
| "loss": 0.12748247385025024, | |
| "mean_token_accuracy": 0.9632326811552048, | |
| "num_tokens": 4718592.0, | |
| "step": 288 | |
| }, | |
| { | |
| "entropy": 4.534173429012299, | |
| "epoch": 0.8562962962962963, | |
| "grad_norm": 0.9885667562484741, | |
| "learning_rate": 1.5015015015015017e-06, | |
| "loss": 0.16047002375125885, | |
| "mean_token_accuracy": 0.9475576058030128, | |
| "num_tokens": 4734976.0, | |
| "step": 289 | |
| }, | |
| { | |
| "entropy": 4.53923037648201, | |
| "epoch": 0.8592592592592593, | |
| "grad_norm": 1.4043318033218384, | |
| "learning_rate": 1.4714714714714714e-06, | |
| "loss": 0.23335830867290497, | |
| "mean_token_accuracy": 0.9432575777173042, | |
| "num_tokens": 4751360.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 4.453351438045502, | |
| "epoch": 0.8622222222222222, | |
| "grad_norm": 1.2922645807266235, | |
| "learning_rate": 1.4414414414414416e-06, | |
| "loss": 0.2262791097164154, | |
| "mean_token_accuracy": 0.9343696013092995, | |
| "num_tokens": 4767744.0, | |
| "step": 291 | |
| }, | |
| { | |
| "entropy": 4.307468056678772, | |
| "epoch": 0.8651851851851852, | |
| "grad_norm": 0.8348132967948914, | |
| "learning_rate": 1.4114114114114117e-06, | |
| "loss": 0.10120698064565659, | |
| "mean_token_accuracy": 0.9699218273162842, | |
| "num_tokens": 4784128.0, | |
| "step": 292 | |
| }, | |
| { | |
| "entropy": 4.376435071229935, | |
| "epoch": 0.8681481481481481, | |
| "grad_norm": 0.9932755827903748, | |
| "learning_rate": 1.3813813813813814e-06, | |
| "loss": 0.16437053680419922, | |
| "mean_token_accuracy": 0.9493629187345505, | |
| "num_tokens": 4800512.0, | |
| "step": 293 | |
| }, | |
| { | |
| "entropy": 4.17171511054039, | |
| "epoch": 0.8711111111111111, | |
| "grad_norm": 1.0171509981155396, | |
| "learning_rate": 1.3513513513513515e-06, | |
| "loss": 0.15266487002372742, | |
| "mean_token_accuracy": 0.9645697101950645, | |
| "num_tokens": 4816896.0, | |
| "step": 294 | |
| }, | |
| { | |
| "entropy": 4.363181322813034, | |
| "epoch": 0.8740740740740741, | |
| "grad_norm": 1.1125446557998657, | |
| "learning_rate": 1.3213213213213214e-06, | |
| "loss": 0.16176161170005798, | |
| "mean_token_accuracy": 0.954315535724163, | |
| "num_tokens": 4833280.0, | |
| "step": 295 | |
| }, | |
| { | |
| "entropy": 4.970975339412689, | |
| "epoch": 0.8770370370370371, | |
| "grad_norm": 1.289873480796814, | |
| "learning_rate": 1.2912912912912913e-06, | |
| "loss": 0.20878392457962036, | |
| "mean_token_accuracy": 0.9356447458267212, | |
| "num_tokens": 4849664.0, | |
| "step": 296 | |
| }, | |
| { | |
| "entropy": 4.833039224147797, | |
| "epoch": 0.88, | |
| "grad_norm": 1.0888588428497314, | |
| "learning_rate": 1.2612612612612613e-06, | |
| "loss": 0.15500885248184204, | |
| "mean_token_accuracy": 0.9589161276817322, | |
| "num_tokens": 4866048.0, | |
| "step": 297 | |
| }, | |
| { | |
| "entropy": 4.779081165790558, | |
| "epoch": 0.882962962962963, | |
| "grad_norm": 1.266128420829773, | |
| "learning_rate": 1.2312312312312314e-06, | |
| "loss": 0.21074306964874268, | |
| "mean_token_accuracy": 0.9407091289758682, | |
| "num_tokens": 4882432.0, | |
| "step": 298 | |
| }, | |
| { | |
| "entropy": 4.6357011795043945, | |
| "epoch": 0.8859259259259259, | |
| "grad_norm": 1.3224912881851196, | |
| "learning_rate": 1.2012012012012013e-06, | |
| "loss": 0.2368646115064621, | |
| "mean_token_accuracy": 0.9472242295742035, | |
| "num_tokens": 4898816.0, | |
| "step": 299 | |
| }, | |
| { | |
| "entropy": 4.068840324878693, | |
| "epoch": 0.8888888888888888, | |
| "grad_norm": 0.85923832654953, | |
| "learning_rate": 1.1711711711711712e-06, | |
| "loss": 0.11753897368907928, | |
| "mean_token_accuracy": 0.9662499204277992, | |
| "num_tokens": 4915200.0, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.8888888888888888, | |
| "eval_entropy": 4.417586924235026, | |
| "eval_loss": 0.1870778650045395, | |
| "eval_mean_token_accuracy": 0.9491693472862244, | |
| "eval_num_tokens": 4915200.0, | |
| "eval_runtime": 41.7995, | |
| "eval_samples_per_second": 14.354, | |
| "eval_steps_per_second": 1.794, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 5.071247100830078, | |
| "epoch": 0.8918518518518519, | |
| "grad_norm": 1.3558486700057983, | |
| "learning_rate": 1.1411411411411411e-06, | |
| "loss": 0.23602133989334106, | |
| "mean_token_accuracy": 0.9276960417628288, | |
| "num_tokens": 4931584.0, | |
| "step": 301 | |
| }, | |
| { | |
| "entropy": 4.117396056652069, | |
| "epoch": 0.8948148148148148, | |
| "grad_norm": 0.8388944268226624, | |
| "learning_rate": 1.111111111111111e-06, | |
| "loss": 0.11620326340198517, | |
| "mean_token_accuracy": 0.9635635763406754, | |
| "num_tokens": 4947968.0, | |
| "step": 302 | |
| }, | |
| { | |
| "entropy": 4.5542632937431335, | |
| "epoch": 0.8977777777777778, | |
| "grad_norm": 1.18254554271698, | |
| "learning_rate": 1.0810810810810812e-06, | |
| "loss": 0.1708286702632904, | |
| "mean_token_accuracy": 0.9597087278962135, | |
| "num_tokens": 4964352.0, | |
| "step": 303 | |
| }, | |
| { | |
| "entropy": 4.57982537150383, | |
| "epoch": 0.9007407407407407, | |
| "grad_norm": 1.3986045122146606, | |
| "learning_rate": 1.051051051051051e-06, | |
| "loss": 0.3021943271160126, | |
| "mean_token_accuracy": 0.919133186340332, | |
| "num_tokens": 4980736.0, | |
| "step": 304 | |
| }, | |
| { | |
| "entropy": 4.782330691814423, | |
| "epoch": 0.9037037037037037, | |
| "grad_norm": 1.1780952215194702, | |
| "learning_rate": 1.0210210210210212e-06, | |
| "loss": 0.21513484418392181, | |
| "mean_token_accuracy": 0.9414290711283684, | |
| "num_tokens": 4997120.0, | |
| "step": 305 | |
| }, | |
| { | |
| "entropy": 4.747852921485901, | |
| "epoch": 0.9066666666666666, | |
| "grad_norm": 1.4025940895080566, | |
| "learning_rate": 9.909909909909911e-07, | |
| "loss": 0.22148270905017853, | |
| "mean_token_accuracy": 0.9464741870760918, | |
| "num_tokens": 5013504.0, | |
| "step": 306 | |
| }, | |
| { | |
| "entropy": 4.174960762262344, | |
| "epoch": 0.9096296296296297, | |
| "grad_norm": 1.130652904510498, | |
| "learning_rate": 9.60960960960961e-07, | |
| "loss": 0.18711383640766144, | |
| "mean_token_accuracy": 0.9580972418189049, | |
| "num_tokens": 5029888.0, | |
| "step": 307 | |
| }, | |
| { | |
| "entropy": 4.478256374597549, | |
| "epoch": 0.9125925925925926, | |
| "grad_norm": 1.0640850067138672, | |
| "learning_rate": 9.30930930930931e-07, | |
| "loss": 0.1915970742702484, | |
| "mean_token_accuracy": 0.9348175227642059, | |
| "num_tokens": 5046272.0, | |
| "step": 308 | |
| }, | |
| { | |
| "entropy": 4.654453784227371, | |
| "epoch": 0.9155555555555556, | |
| "grad_norm": 1.0310114622116089, | |
| "learning_rate": 9.00900900900901e-07, | |
| "loss": 0.13161642849445343, | |
| "mean_token_accuracy": 0.9586769789457321, | |
| "num_tokens": 5062656.0, | |
| "step": 309 | |
| }, | |
| { | |
| "entropy": 4.399398684501648, | |
| "epoch": 0.9185185185185185, | |
| "grad_norm": 1.075095772743225, | |
| "learning_rate": 8.708708708708709e-07, | |
| "loss": 0.1970798522233963, | |
| "mean_token_accuracy": 0.9442151561379433, | |
| "num_tokens": 5079040.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 4.483876526355743, | |
| "epoch": 0.9214814814814815, | |
| "grad_norm": 1.1613632440567017, | |
| "learning_rate": 8.40840840840841e-07, | |
| "loss": 0.21313047409057617, | |
| "mean_token_accuracy": 0.9410364031791687, | |
| "num_tokens": 5095424.0, | |
| "step": 311 | |
| }, | |
| { | |
| "entropy": 4.712851881980896, | |
| "epoch": 0.9244444444444444, | |
| "grad_norm": 1.041576623916626, | |
| "learning_rate": 8.108108108108109e-07, | |
| "loss": 0.14535699784755707, | |
| "mean_token_accuracy": 0.9653985276818275, | |
| "num_tokens": 5111808.0, | |
| "step": 312 | |
| }, | |
| { | |
| "entropy": 4.009306818246841, | |
| "epoch": 0.9274074074074075, | |
| "grad_norm": 0.8439784646034241, | |
| "learning_rate": 7.807807807807808e-07, | |
| "loss": 0.12768274545669556, | |
| "mean_token_accuracy": 0.9642351046204567, | |
| "num_tokens": 5128192.0, | |
| "step": 313 | |
| }, | |
| { | |
| "entropy": 3.9402647465467453, | |
| "epoch": 0.9303703703703704, | |
| "grad_norm": 0.6990681886672974, | |
| "learning_rate": 7.507507507507509e-07, | |
| "loss": 0.07188726961612701, | |
| "mean_token_accuracy": 0.9686107113957405, | |
| "num_tokens": 5144576.0, | |
| "step": 314 | |
| }, | |
| { | |
| "entropy": 4.321747362613678, | |
| "epoch": 0.9333333333333333, | |
| "grad_norm": 0.8538215756416321, | |
| "learning_rate": 7.207207207207208e-07, | |
| "loss": 0.12386510521173477, | |
| "mean_token_accuracy": 0.9637529402971268, | |
| "num_tokens": 5160960.0, | |
| "step": 315 | |
| }, | |
| { | |
| "entropy": 4.553303599357605, | |
| "epoch": 0.9362962962962963, | |
| "grad_norm": 1.160495638847351, | |
| "learning_rate": 6.906906906906907e-07, | |
| "loss": 0.19865782558918, | |
| "mean_token_accuracy": 0.9452551826834679, | |
| "num_tokens": 5177344.0, | |
| "step": 316 | |
| }, | |
| { | |
| "entropy": 4.6939592361450195, | |
| "epoch": 0.9392592592592592, | |
| "grad_norm": 1.1832135915756226, | |
| "learning_rate": 6.606606606606607e-07, | |
| "loss": 0.16584719717502594, | |
| "mean_token_accuracy": 0.9571598693728447, | |
| "num_tokens": 5193728.0, | |
| "step": 317 | |
| }, | |
| { | |
| "entropy": 4.5154470801353455, | |
| "epoch": 0.9422222222222222, | |
| "grad_norm": 1.1491987705230713, | |
| "learning_rate": 6.306306306306306e-07, | |
| "loss": 0.1722956746816635, | |
| "mean_token_accuracy": 0.9531917944550514, | |
| "num_tokens": 5210112.0, | |
| "step": 318 | |
| }, | |
| { | |
| "entropy": 4.328756272792816, | |
| "epoch": 0.9451851851851852, | |
| "grad_norm": 0.9116262793540955, | |
| "learning_rate": 6.006006006006006e-07, | |
| "loss": 0.11511941999197006, | |
| "mean_token_accuracy": 0.9662261977791786, | |
| "num_tokens": 5226496.0, | |
| "step": 319 | |
| }, | |
| { | |
| "entropy": 4.55816787481308, | |
| "epoch": 0.9481481481481482, | |
| "grad_norm": 1.2676368951797485, | |
| "learning_rate": 5.705705705705706e-07, | |
| "loss": 0.193391814827919, | |
| "mean_token_accuracy": 0.9519508555531502, | |
| "num_tokens": 5242880.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 4.794662654399872, | |
| "epoch": 0.9511111111111111, | |
| "grad_norm": 1.181879997253418, | |
| "learning_rate": 5.405405405405406e-07, | |
| "loss": 0.19717438519001007, | |
| "mean_token_accuracy": 0.9396635890007019, | |
| "num_tokens": 5259264.0, | |
| "step": 321 | |
| }, | |
| { | |
| "entropy": 4.271101087331772, | |
| "epoch": 0.9540740740740741, | |
| "grad_norm": 1.1655861139297485, | |
| "learning_rate": 5.105105105105106e-07, | |
| "loss": 0.20040296018123627, | |
| "mean_token_accuracy": 0.9409918263554573, | |
| "num_tokens": 5275648.0, | |
| "step": 322 | |
| }, | |
| { | |
| "entropy": 4.867785483598709, | |
| "epoch": 0.957037037037037, | |
| "grad_norm": 1.4571250677108765, | |
| "learning_rate": 4.804804804804805e-07, | |
| "loss": 0.24724331498146057, | |
| "mean_token_accuracy": 0.9226743578910828, | |
| "num_tokens": 5292032.0, | |
| "step": 323 | |
| }, | |
| { | |
| "entropy": 5.1057488322258, | |
| "epoch": 0.96, | |
| "grad_norm": 1.5154188871383667, | |
| "learning_rate": 4.504504504504505e-07, | |
| "loss": 0.2607588469982147, | |
| "mean_token_accuracy": 0.92790437489748, | |
| "num_tokens": 5308416.0, | |
| "step": 324 | |
| }, | |
| { | |
| "entropy": 4.4008781015872955, | |
| "epoch": 0.9629629629629629, | |
| "grad_norm": 0.998136579990387, | |
| "learning_rate": 4.204204204204205e-07, | |
| "loss": 0.15995781123638153, | |
| "mean_token_accuracy": 0.9598969668149948, | |
| "num_tokens": 5324800.0, | |
| "step": 325 | |
| }, | |
| { | |
| "entropy": 3.9187879860401154, | |
| "epoch": 0.965925925925926, | |
| "grad_norm": 0.8381322026252747, | |
| "learning_rate": 3.903903903903904e-07, | |
| "loss": 0.126622274518013, | |
| "mean_token_accuracy": 0.9611322283744812, | |
| "num_tokens": 5341184.0, | |
| "step": 326 | |
| }, | |
| { | |
| "entropy": 4.744876116514206, | |
| "epoch": 0.9688888888888889, | |
| "grad_norm": 1.319761037826538, | |
| "learning_rate": 3.603603603603604e-07, | |
| "loss": 0.2034291923046112, | |
| "mean_token_accuracy": 0.9343697354197502, | |
| "num_tokens": 5357568.0, | |
| "step": 327 | |
| }, | |
| { | |
| "entropy": 4.7206811606884, | |
| "epoch": 0.9718518518518519, | |
| "grad_norm": 1.3094006776809692, | |
| "learning_rate": 3.3033033033033036e-07, | |
| "loss": 0.28418663144111633, | |
| "mean_token_accuracy": 0.9168223366141319, | |
| "num_tokens": 5373952.0, | |
| "step": 328 | |
| }, | |
| { | |
| "entropy": 4.250654578208923, | |
| "epoch": 0.9748148148148148, | |
| "grad_norm": 0.8762730956077576, | |
| "learning_rate": 3.003003003003003e-07, | |
| "loss": 0.14533185958862305, | |
| "mean_token_accuracy": 0.9615647569298744, | |
| "num_tokens": 5390336.0, | |
| "step": 329 | |
| }, | |
| { | |
| "entropy": 4.782383352518082, | |
| "epoch": 0.9777777777777777, | |
| "grad_norm": 1.4791736602783203, | |
| "learning_rate": 2.702702702702703e-07, | |
| "loss": 0.306484192609787, | |
| "mean_token_accuracy": 0.9203394278883934, | |
| "num_tokens": 5406720.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 4.731139063835144, | |
| "epoch": 0.9807407407407407, | |
| "grad_norm": 1.1364384889602661, | |
| "learning_rate": 2.4024024024024026e-07, | |
| "loss": 0.187924325466156, | |
| "mean_token_accuracy": 0.940864272415638, | |
| "num_tokens": 5423104.0, | |
| "step": 331 | |
| }, | |
| { | |
| "entropy": 4.757296144962311, | |
| "epoch": 0.9837037037037037, | |
| "grad_norm": 1.2683117389678955, | |
| "learning_rate": 2.1021021021021025e-07, | |
| "loss": 0.2071211040019989, | |
| "mean_token_accuracy": 0.9373601898550987, | |
| "num_tokens": 5439488.0, | |
| "step": 332 | |
| }, | |
| { | |
| "entropy": 4.8207244873046875, | |
| "epoch": 0.9866666666666667, | |
| "grad_norm": 1.1348717212677002, | |
| "learning_rate": 1.801801801801802e-07, | |
| "loss": 0.16599202156066895, | |
| "mean_token_accuracy": 0.9438209906220436, | |
| "num_tokens": 5455872.0, | |
| "step": 333 | |
| }, | |
| { | |
| "entropy": 4.560002565383911, | |
| "epoch": 0.9896296296296296, | |
| "grad_norm": 1.0268224477767944, | |
| "learning_rate": 1.5015015015015016e-07, | |
| "loss": 0.18726664781570435, | |
| "mean_token_accuracy": 0.9389617219567299, | |
| "num_tokens": 5472256.0, | |
| "step": 334 | |
| }, | |
| { | |
| "entropy": 4.164048194885254, | |
| "epoch": 0.9925925925925926, | |
| "grad_norm": 0.8888510465621948, | |
| "learning_rate": 1.2012012012012013e-07, | |
| "loss": 0.08176050335168839, | |
| "mean_token_accuracy": 0.9774916544556618, | |
| "num_tokens": 5488640.0, | |
| "step": 335 | |
| }, | |
| { | |
| "entropy": 4.211227163672447, | |
| "epoch": 0.9955555555555555, | |
| "grad_norm": 1.0560649633407593, | |
| "learning_rate": 9.00900900900901e-08, | |
| "loss": 0.1871253103017807, | |
| "mean_token_accuracy": 0.9461539313197136, | |
| "num_tokens": 5505024.0, | |
| "step": 336 | |
| }, | |
| { | |
| "entropy": 4.4912309646606445, | |
| "epoch": 0.9985185185185185, | |
| "grad_norm": 1.1535362005233765, | |
| "learning_rate": 6.006006006006006e-08, | |
| "loss": 0.16527244448661804, | |
| "mean_token_accuracy": 0.949486643075943, | |
| "num_tokens": 5521408.0, | |
| "step": 337 | |
| }, | |
| { | |
| "entropy": 4.468047499656677, | |
| "epoch": 1.0, | |
| "grad_norm": 1.932939052581787, | |
| "learning_rate": 3.003003003003003e-08, | |
| "loss": 0.20345942676067352, | |
| "mean_token_accuracy": 0.9499414712190628, | |
| "num_tokens": 5529600.0, | |
| "step": 338 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 338, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 5000, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 9.53130594336768e+16, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |