Instructions to use ddidacus/olmoe-sft with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use ddidacus/olmoe-sft with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("allenai/OLMoE-1B-7B-0125-Instruct") model = PeftModel.from_pretrained(base_model, "ddidacus/olmoe-sft") - Transformers
How to use ddidacus/olmoe-sft with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="ddidacus/olmoe-sft") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("ddidacus/olmoe-sft", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use ddidacus/olmoe-sft with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "ddidacus/olmoe-sft" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "ddidacus/olmoe-sft", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/ddidacus/olmoe-sft
- SGLang
How to use ddidacus/olmoe-sft with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "ddidacus/olmoe-sft" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "ddidacus/olmoe-sft", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "ddidacus/olmoe-sft" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "ddidacus/olmoe-sft", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use ddidacus/olmoe-sft with Docker Model Runner:
docker model run hf.co/ddidacus/olmoe-sft
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 4.0, | |
| "eval_steps": 500, | |
| "global_step": 200, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 0.699141651391983, | |
| "epoch": 0.02, | |
| "grad_norm": 1.7043750286102295, | |
| "learning_rate": 0.0, | |
| "loss": 1.5967991352081299, | |
| "mean_token_accuracy": 0.665926069021225, | |
| "num_tokens": 74699.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 0.6601996421813965, | |
| "epoch": 0.04, | |
| "grad_norm": 1.6597099304199219, | |
| "learning_rate": 1e-05, | |
| "loss": 1.5338245630264282, | |
| "mean_token_accuracy": 0.6820768415927887, | |
| "num_tokens": 138614.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 0.7289904654026031, | |
| "epoch": 0.06, | |
| "grad_norm": 1.796127438545227, | |
| "learning_rate": 2e-05, | |
| "loss": 1.6285251379013062, | |
| "mean_token_accuracy": 0.6539906561374664, | |
| "num_tokens": 209509.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 0.7412302494049072, | |
| "epoch": 0.08, | |
| "grad_norm": 1.4846091270446777, | |
| "learning_rate": 3e-05, | |
| "loss": 1.5454721450805664, | |
| "mean_token_accuracy": 0.6691758334636688, | |
| "num_tokens": 283751.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 0.7322555780410767, | |
| "epoch": 0.1, | |
| "grad_norm": 1.4136911630630493, | |
| "learning_rate": 4e-05, | |
| "loss": 1.5077476501464844, | |
| "mean_token_accuracy": 0.6744928658008575, | |
| "num_tokens": 354066.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 0.7739330530166626, | |
| "epoch": 0.12, | |
| "grad_norm": 0.9657893180847168, | |
| "learning_rate": 5e-05, | |
| "loss": 1.43147611618042, | |
| "mean_token_accuracy": 0.6826294660568237, | |
| "num_tokens": 422170.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 0.8858513236045837, | |
| "epoch": 0.14, | |
| "grad_norm": 0.7331474423408508, | |
| "learning_rate": 6e-05, | |
| "loss": 1.450822353363037, | |
| "mean_token_accuracy": 0.6648280322551727, | |
| "num_tokens": 494040.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 0.9634815156459808, | |
| "epoch": 0.16, | |
| "grad_norm": 0.5526663661003113, | |
| "learning_rate": 7e-05, | |
| "loss": 1.3808112144470215, | |
| "mean_token_accuracy": 0.6719212830066681, | |
| "num_tokens": 566616.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 1.0627405643463135, | |
| "epoch": 0.18, | |
| "grad_norm": 0.48948273062705994, | |
| "learning_rate": 8e-05, | |
| "loss": 1.3656816482543945, | |
| "mean_token_accuracy": 0.663449615240097, | |
| "num_tokens": 637093.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 1.1328747868537903, | |
| "epoch": 0.2, | |
| "grad_norm": 0.37054377794265747, | |
| "learning_rate": 9e-05, | |
| "loss": 1.2878801822662354, | |
| "mean_token_accuracy": 0.6749334335327148, | |
| "num_tokens": 701945.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.2100302577018738, | |
| "epoch": 0.22, | |
| "grad_norm": 0.3048469126224518, | |
| "learning_rate": 0.0001, | |
| "loss": 1.236545443534851, | |
| "mean_token_accuracy": 0.6853303909301758, | |
| "num_tokens": 774533.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 1.2940571904182434, | |
| "epoch": 0.24, | |
| "grad_norm": 0.3031807243824005, | |
| "learning_rate": 0.0001, | |
| "loss": 1.211038589477539, | |
| "mean_token_accuracy": 0.6858378350734711, | |
| "num_tokens": 847636.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 1.299929440021515, | |
| "epoch": 0.26, | |
| "grad_norm": 0.2886947691440582, | |
| "learning_rate": 0.0001, | |
| "loss": 1.197202205657959, | |
| "mean_token_accuracy": 0.6924754083156586, | |
| "num_tokens": 923420.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 1.252187728881836, | |
| "epoch": 0.28, | |
| "grad_norm": 0.25853437185287476, | |
| "learning_rate": 0.0001, | |
| "loss": 1.1612238883972168, | |
| "mean_token_accuracy": 0.6976969540119171, | |
| "num_tokens": 992109.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 1.220507800579071, | |
| "epoch": 0.3, | |
| "grad_norm": 0.24553938210010529, | |
| "learning_rate": 0.0001, | |
| "loss": 1.1456246376037598, | |
| "mean_token_accuracy": 0.6981014311313629, | |
| "num_tokens": 1065114.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 1.198462724685669, | |
| "epoch": 0.32, | |
| "grad_norm": 0.24306544661521912, | |
| "learning_rate": 0.0001, | |
| "loss": 1.1577763557434082, | |
| "mean_token_accuracy": 0.6941779851913452, | |
| "num_tokens": 1136722.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 1.1386296153068542, | |
| "epoch": 0.34, | |
| "grad_norm": 0.22727081179618835, | |
| "learning_rate": 0.0001, | |
| "loss": 1.0986605882644653, | |
| "mean_token_accuracy": 0.7019487023353577, | |
| "num_tokens": 1209030.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 1.117907702922821, | |
| "epoch": 0.36, | |
| "grad_norm": 0.21270814538002014, | |
| "learning_rate": 0.0001, | |
| "loss": 1.110465407371521, | |
| "mean_token_accuracy": 0.701825737953186, | |
| "num_tokens": 1276624.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 1.1316577792167664, | |
| "epoch": 0.38, | |
| "grad_norm": 0.1995684653520584, | |
| "learning_rate": 0.0001, | |
| "loss": 1.1611299514770508, | |
| "mean_token_accuracy": 0.6892036497592926, | |
| "num_tokens": 1348478.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 1.0270569920539856, | |
| "epoch": 0.4, | |
| "grad_norm": 0.18478907644748688, | |
| "learning_rate": 0.0001, | |
| "loss": 1.04264235496521, | |
| "mean_token_accuracy": 0.7172180116176605, | |
| "num_tokens": 1421488.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.01737579703331, | |
| "epoch": 0.42, | |
| "grad_norm": 0.19284074008464813, | |
| "learning_rate": 0.0001, | |
| "loss": 1.0274319648742676, | |
| "mean_token_accuracy": 0.718668669462204, | |
| "num_tokens": 1488403.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 1.0264459252357483, | |
| "epoch": 0.44, | |
| "grad_norm": 0.1576310396194458, | |
| "learning_rate": 0.0001, | |
| "loss": 1.0518046617507935, | |
| "mean_token_accuracy": 0.7142763733863831, | |
| "num_tokens": 1564657.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 1.059712529182434, | |
| "epoch": 0.46, | |
| "grad_norm": 0.15488146245479584, | |
| "learning_rate": 0.0001, | |
| "loss": 1.082923412322998, | |
| "mean_token_accuracy": 0.7053070664405823, | |
| "num_tokens": 1633972.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 1.0438059866428375, | |
| "epoch": 0.48, | |
| "grad_norm": 0.15164747834205627, | |
| "learning_rate": 0.0001, | |
| "loss": 1.0578590631484985, | |
| "mean_token_accuracy": 0.7133743166923523, | |
| "num_tokens": 1700893.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 0.9979909062385559, | |
| "epoch": 0.5, | |
| "grad_norm": 0.14712916314601898, | |
| "learning_rate": 0.0001, | |
| "loss": 1.0294842720031738, | |
| "mean_token_accuracy": 0.7216654419898987, | |
| "num_tokens": 1767721.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 1.0120922327041626, | |
| "epoch": 0.52, | |
| "grad_norm": 0.1360112428665161, | |
| "learning_rate": 0.0001, | |
| "loss": 1.0354883670806885, | |
| "mean_token_accuracy": 0.7223899960517883, | |
| "num_tokens": 1835156.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 0.9896539449691772, | |
| "epoch": 0.54, | |
| "grad_norm": 0.12824475765228271, | |
| "learning_rate": 0.0001, | |
| "loss": 1.0203971862792969, | |
| "mean_token_accuracy": 0.7212119996547699, | |
| "num_tokens": 1910430.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 0.9603240489959717, | |
| "epoch": 0.56, | |
| "grad_norm": 0.1179676204919815, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9597353339195251, | |
| "mean_token_accuracy": 0.7346547842025757, | |
| "num_tokens": 1985373.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 1.0493255257606506, | |
| "epoch": 0.58, | |
| "grad_norm": 0.12462859600782394, | |
| "learning_rate": 0.0001, | |
| "loss": 1.0499563217163086, | |
| "mean_token_accuracy": 0.7120701968669891, | |
| "num_tokens": 2054409.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 1.0497854351997375, | |
| "epoch": 0.6, | |
| "grad_norm": 0.11791805922985077, | |
| "learning_rate": 0.0001, | |
| "loss": 1.0524396896362305, | |
| "mean_token_accuracy": 0.7136416733264923, | |
| "num_tokens": 2122893.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 1.0638166069984436, | |
| "epoch": 0.62, | |
| "grad_norm": 0.12578116357326508, | |
| "learning_rate": 0.0001, | |
| "loss": 1.067002534866333, | |
| "mean_token_accuracy": 0.7095249891281128, | |
| "num_tokens": 2194755.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 1.099778175354004, | |
| "epoch": 0.64, | |
| "grad_norm": 0.12349284440279007, | |
| "learning_rate": 0.0001, | |
| "loss": 1.0939478874206543, | |
| "mean_token_accuracy": 0.7056429386138916, | |
| "num_tokens": 2262214.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 1.0646151900291443, | |
| "epoch": 0.66, | |
| "grad_norm": 0.12846575677394867, | |
| "learning_rate": 0.0001, | |
| "loss": 1.0653318166732788, | |
| "mean_token_accuracy": 0.7122560441493988, | |
| "num_tokens": 2331419.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 1.0158570408821106, | |
| "epoch": 0.68, | |
| "grad_norm": 0.11879603564739227, | |
| "learning_rate": 0.0001, | |
| "loss": 1.0267729759216309, | |
| "mean_token_accuracy": 0.7170567810535431, | |
| "num_tokens": 2403814.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 1.0103608667850494, | |
| "epoch": 0.7, | |
| "grad_norm": 0.12001688033342361, | |
| "learning_rate": 0.0001, | |
| "loss": 1.0078749656677246, | |
| "mean_token_accuracy": 0.7219332754611969, | |
| "num_tokens": 2474066.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 1.0085046291351318, | |
| "epoch": 0.72, | |
| "grad_norm": 0.11229556053876877, | |
| "learning_rate": 0.0001, | |
| "loss": 1.015348196029663, | |
| "mean_token_accuracy": 0.7219782471656799, | |
| "num_tokens": 2547283.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 1.0116952955722809, | |
| "epoch": 0.74, | |
| "grad_norm": 0.12163597345352173, | |
| "learning_rate": 0.0001, | |
| "loss": 1.0121233463287354, | |
| "mean_token_accuracy": 0.7187064588069916, | |
| "num_tokens": 2613331.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 0.9940676093101501, | |
| "epoch": 0.76, | |
| "grad_norm": 0.11075941473245621, | |
| "learning_rate": 0.0001, | |
| "loss": 0.992800235748291, | |
| "mean_token_accuracy": 0.7255141139030457, | |
| "num_tokens": 2683528.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 1.0126079320907593, | |
| "epoch": 0.78, | |
| "grad_norm": 0.11469519883394241, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9988532066345215, | |
| "mean_token_accuracy": 0.7211731672286987, | |
| "num_tokens": 2750069.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 0.9906446635723114, | |
| "epoch": 0.8, | |
| "grad_norm": 0.11193952709436417, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9900511503219604, | |
| "mean_token_accuracy": 0.722189337015152, | |
| "num_tokens": 2821887.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.9898229837417603, | |
| "epoch": 0.82, | |
| "grad_norm": 0.11920945346355438, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9936800599098206, | |
| "mean_token_accuracy": 0.7267130017280579, | |
| "num_tokens": 2885811.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 0.9716921448707581, | |
| "epoch": 0.84, | |
| "grad_norm": 0.11293631792068481, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9800352454185486, | |
| "mean_token_accuracy": 0.7265651822090149, | |
| "num_tokens": 2955201.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 0.9296073317527771, | |
| "epoch": 0.86, | |
| "grad_norm": 0.11454292386770248, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9429284334182739, | |
| "mean_token_accuracy": 0.734944611787796, | |
| "num_tokens": 3019665.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 0.9590237438678741, | |
| "epoch": 0.88, | |
| "grad_norm": 0.1102190762758255, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9501940011978149, | |
| "mean_token_accuracy": 0.7321249544620514, | |
| "num_tokens": 3093335.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 0.9053312838077545, | |
| "epoch": 0.9, | |
| "grad_norm": 0.11164271831512451, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9103053212165833, | |
| "mean_token_accuracy": 0.7460834383964539, | |
| "num_tokens": 3159757.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 0.9606629908084869, | |
| "epoch": 0.92, | |
| "grad_norm": 0.11079204827547073, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9644097089767456, | |
| "mean_token_accuracy": 0.7342032492160797, | |
| "num_tokens": 3230892.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 0.943544864654541, | |
| "epoch": 0.94, | |
| "grad_norm": 0.11624015867710114, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9410842061042786, | |
| "mean_token_accuracy": 0.7351740300655365, | |
| "num_tokens": 3299869.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 0.9592801034450531, | |
| "epoch": 0.96, | |
| "grad_norm": 0.11560477316379547, | |
| "learning_rate": 0.0001, | |
| "loss": 0.975141704082489, | |
| "mean_token_accuracy": 0.7269536554813385, | |
| "num_tokens": 3371272.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 0.9194359481334686, | |
| "epoch": 0.98, | |
| "grad_norm": 0.11588755995035172, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9375251531600952, | |
| "mean_token_accuracy": 0.7386307418346405, | |
| "num_tokens": 3439636.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 0.9375229477882385, | |
| "epoch": 1.0, | |
| "grad_norm": 0.10675432533025742, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9375709891319275, | |
| "mean_token_accuracy": 0.7371015846729279, | |
| "num_tokens": 3515643.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.9784637987613678, | |
| "epoch": 1.02, | |
| "grad_norm": 0.12157473713159561, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9589431881904602, | |
| "mean_token_accuracy": 0.7312025725841522, | |
| "num_tokens": 3579936.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 0.9976795613765717, | |
| "epoch": 1.04, | |
| "grad_norm": 0.1218739002943039, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9651644825935364, | |
| "mean_token_accuracy": 0.7295917272567749, | |
| "num_tokens": 3645097.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 0.9457567930221558, | |
| "epoch": 1.06, | |
| "grad_norm": 0.11789195984601974, | |
| "learning_rate": 0.0001, | |
| "loss": 0.924875020980835, | |
| "mean_token_accuracy": 0.7387276589870453, | |
| "num_tokens": 3722386.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 0.9368592202663422, | |
| "epoch": 1.08, | |
| "grad_norm": 0.11367881298065186, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9108861088752747, | |
| "mean_token_accuracy": 0.7435753047466278, | |
| "num_tokens": 3795107.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 0.9856767952442169, | |
| "epoch": 1.1, | |
| "grad_norm": 0.1143391951918602, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9522716999053955, | |
| "mean_token_accuracy": 0.7351356148719788, | |
| "num_tokens": 3863645.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 0.9017468690872192, | |
| "epoch": 1.12, | |
| "grad_norm": 0.11213760077953339, | |
| "learning_rate": 0.0001, | |
| "loss": 0.890508770942688, | |
| "mean_token_accuracy": 0.75059974193573, | |
| "num_tokens": 3933157.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 0.9076333045959473, | |
| "epoch": 1.1400000000000001, | |
| "grad_norm": 0.10830755531787872, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8893829584121704, | |
| "mean_token_accuracy": 0.7474276721477509, | |
| "num_tokens": 4002549.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 0.9090627431869507, | |
| "epoch": 1.16, | |
| "grad_norm": 0.11783402413129807, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9097412824630737, | |
| "mean_token_accuracy": 0.7423691749572754, | |
| "num_tokens": 4068026.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 0.928420215845108, | |
| "epoch": 1.18, | |
| "grad_norm": 0.11873085796833038, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9404212236404419, | |
| "mean_token_accuracy": 0.7362638711929321, | |
| "num_tokens": 4136948.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 0.9221147298812866, | |
| "epoch": 1.2, | |
| "grad_norm": 0.11550325155258179, | |
| "learning_rate": 0.0001, | |
| "loss": 0.924960732460022, | |
| "mean_token_accuracy": 0.7427571713924408, | |
| "num_tokens": 4204112.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 0.9216603636741638, | |
| "epoch": 1.22, | |
| "grad_norm": 0.11623509228229523, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9106500148773193, | |
| "mean_token_accuracy": 0.7429015040397644, | |
| "num_tokens": 4272140.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 0.9455150067806244, | |
| "epoch": 1.24, | |
| "grad_norm": 0.11591103672981262, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9491208791732788, | |
| "mean_token_accuracy": 0.7350127100944519, | |
| "num_tokens": 4346769.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 0.8898249566555023, | |
| "epoch": 1.26, | |
| "grad_norm": 0.11488021910190582, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8970361351966858, | |
| "mean_token_accuracy": 0.7481776773929596, | |
| "num_tokens": 4418760.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 0.8663885295391083, | |
| "epoch": 1.28, | |
| "grad_norm": 0.1245160847902298, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8572047352790833, | |
| "mean_token_accuracy": 0.7511683106422424, | |
| "num_tokens": 4483453.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 0.9115520715713501, | |
| "epoch": 1.3, | |
| "grad_norm": 0.12362005561590195, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9021918773651123, | |
| "mean_token_accuracy": 0.7433571219444275, | |
| "num_tokens": 4553398.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 0.9173152148723602, | |
| "epoch": 1.32, | |
| "grad_norm": 0.11844731867313385, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9107658863067627, | |
| "mean_token_accuracy": 0.7352526783943176, | |
| "num_tokens": 4626227.0, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 0.849992573261261, | |
| "epoch": 1.34, | |
| "grad_norm": 0.11784010380506516, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8525710105895996, | |
| "mean_token_accuracy": 0.7550307512283325, | |
| "num_tokens": 4701977.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 0.9553567171096802, | |
| "epoch": 1.3599999999999999, | |
| "grad_norm": 0.1190195307135582, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9455575346946716, | |
| "mean_token_accuracy": 0.7316735982894897, | |
| "num_tokens": 4774545.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 0.8593668639659882, | |
| "epoch": 1.38, | |
| "grad_norm": 0.11937589198350906, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8549792170524597, | |
| "mean_token_accuracy": 0.7569719552993774, | |
| "num_tokens": 4847366.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 0.9686211943626404, | |
| "epoch": 1.4, | |
| "grad_norm": 0.12214019149541855, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9648027420043945, | |
| "mean_token_accuracy": 0.7249570488929749, | |
| "num_tokens": 4923060.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 0.867369145154953, | |
| "epoch": 1.42, | |
| "grad_norm": 0.11730711907148361, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8510935306549072, | |
| "mean_token_accuracy": 0.7553304731845856, | |
| "num_tokens": 4996176.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 0.9160025417804718, | |
| "epoch": 1.44, | |
| "grad_norm": 0.12190750241279602, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9096644520759583, | |
| "mean_token_accuracy": 0.7384364008903503, | |
| "num_tokens": 5068522.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 0.9069952070713043, | |
| "epoch": 1.46, | |
| "grad_norm": 0.13640820980072021, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8875448703765869, | |
| "mean_token_accuracy": 0.7457329034805298, | |
| "num_tokens": 5137623.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 0.9026708900928497, | |
| "epoch": 1.48, | |
| "grad_norm": 0.12538853287696838, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8914889097213745, | |
| "mean_token_accuracy": 0.7435721457004547, | |
| "num_tokens": 5208737.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 0.9324445724487305, | |
| "epoch": 1.5, | |
| "grad_norm": 0.13337835669517517, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9412592649459839, | |
| "mean_token_accuracy": 0.7320683300495148, | |
| "num_tokens": 5279457.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 0.8831305801868439, | |
| "epoch": 1.52, | |
| "grad_norm": 0.1287890523672104, | |
| "learning_rate": 0.0001, | |
| "loss": 0.890162467956543, | |
| "mean_token_accuracy": 0.7474140524864197, | |
| "num_tokens": 5344457.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 0.8844259679317474, | |
| "epoch": 1.54, | |
| "grad_norm": 0.12595458328723907, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8862929940223694, | |
| "mean_token_accuracy": 0.7448306679725647, | |
| "num_tokens": 5416486.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 0.9768937230110168, | |
| "epoch": 1.56, | |
| "grad_norm": 0.13385823369026184, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9855270981788635, | |
| "mean_token_accuracy": 0.7242069244384766, | |
| "num_tokens": 5488930.0, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 0.8970398604869843, | |
| "epoch": 1.58, | |
| "grad_norm": 0.12776781618595123, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9010695219039917, | |
| "mean_token_accuracy": 0.7380562722682953, | |
| "num_tokens": 5558044.0, | |
| "step": 79 | |
| }, | |
| { | |
| "entropy": 0.8510560393333435, | |
| "epoch": 1.6, | |
| "grad_norm": 0.12845851480960846, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8674848675727844, | |
| "mean_token_accuracy": 0.7530980706214905, | |
| "num_tokens": 5630814.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 0.9194655120372772, | |
| "epoch": 1.62, | |
| "grad_norm": 0.12733094394207, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9001493453979492, | |
| "mean_token_accuracy": 0.7473941147327423, | |
| "num_tokens": 5696496.0, | |
| "step": 81 | |
| }, | |
| { | |
| "entropy": 0.9078547358512878, | |
| "epoch": 1.6400000000000001, | |
| "grad_norm": 0.12357509136199951, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9031519889831543, | |
| "mean_token_accuracy": 0.7443413436412811, | |
| "num_tokens": 5765578.0, | |
| "step": 82 | |
| }, | |
| { | |
| "entropy": 0.9426756799221039, | |
| "epoch": 1.6600000000000001, | |
| "grad_norm": 0.12899024784564972, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9363412857055664, | |
| "mean_token_accuracy": 0.7349725663661957, | |
| "num_tokens": 5831979.0, | |
| "step": 83 | |
| }, | |
| { | |
| "entropy": 0.9146726131439209, | |
| "epoch": 1.6800000000000002, | |
| "grad_norm": 0.12931226193904877, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9105992317199707, | |
| "mean_token_accuracy": 0.7388072907924652, | |
| "num_tokens": 5905661.0, | |
| "step": 84 | |
| }, | |
| { | |
| "entropy": 0.9316370487213135, | |
| "epoch": 1.7, | |
| "grad_norm": 0.13409629464149475, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9174567461013794, | |
| "mean_token_accuracy": 0.7437045872211456, | |
| "num_tokens": 5973162.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 0.9444582164287567, | |
| "epoch": 1.72, | |
| "grad_norm": 0.13663342595100403, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9291839599609375, | |
| "mean_token_accuracy": 0.7356755137443542, | |
| "num_tokens": 6040751.0, | |
| "step": 86 | |
| }, | |
| { | |
| "entropy": 0.8949260711669922, | |
| "epoch": 1.74, | |
| "grad_norm": 0.12818805873394012, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8870834112167358, | |
| "mean_token_accuracy": 0.7440982460975647, | |
| "num_tokens": 6112173.0, | |
| "step": 87 | |
| }, | |
| { | |
| "entropy": 0.9360968768596649, | |
| "epoch": 1.76, | |
| "grad_norm": 0.14662906527519226, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9298614859580994, | |
| "mean_token_accuracy": 0.7370602786540985, | |
| "num_tokens": 6179601.0, | |
| "step": 88 | |
| }, | |
| { | |
| "entropy": 0.8710778653621674, | |
| "epoch": 1.78, | |
| "grad_norm": 0.13221921026706696, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8649511337280273, | |
| "mean_token_accuracy": 0.7522627413272858, | |
| "num_tokens": 6246710.0, | |
| "step": 89 | |
| }, | |
| { | |
| "entropy": 0.8752692639827728, | |
| "epoch": 1.8, | |
| "grad_norm": 0.14055795967578888, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8573565483093262, | |
| "mean_token_accuracy": 0.754420816898346, | |
| "num_tokens": 6319796.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 0.779484897851944, | |
| "epoch": 1.8199999999999998, | |
| "grad_norm": 0.12845420837402344, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7835309505462646, | |
| "mean_token_accuracy": 0.7740673124790192, | |
| "num_tokens": 6389425.0, | |
| "step": 91 | |
| }, | |
| { | |
| "entropy": 0.8905294835567474, | |
| "epoch": 1.8399999999999999, | |
| "grad_norm": 0.1387389600276947, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8962739706039429, | |
| "mean_token_accuracy": 0.7440564632415771, | |
| "num_tokens": 6460606.0, | |
| "step": 92 | |
| }, | |
| { | |
| "entropy": 0.8370858132839203, | |
| "epoch": 1.8599999999999999, | |
| "grad_norm": 0.13243098556995392, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8395211696624756, | |
| "mean_token_accuracy": 0.7600894570350647, | |
| "num_tokens": 6532762.0, | |
| "step": 93 | |
| }, | |
| { | |
| "entropy": 0.9130788445472717, | |
| "epoch": 1.88, | |
| "grad_norm": 0.13279658555984497, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9157933592796326, | |
| "mean_token_accuracy": 0.7389859557151794, | |
| "num_tokens": 6601952.0, | |
| "step": 94 | |
| }, | |
| { | |
| "entropy": 0.889918178319931, | |
| "epoch": 1.9, | |
| "grad_norm": 0.134121835231781, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8863574266433716, | |
| "mean_token_accuracy": 0.7509450018405914, | |
| "num_tokens": 6667993.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 0.8806619942188263, | |
| "epoch": 1.92, | |
| "grad_norm": 0.1342441886663437, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8897389769554138, | |
| "mean_token_accuracy": 0.751017302274704, | |
| "num_tokens": 6741003.0, | |
| "step": 96 | |
| }, | |
| { | |
| "entropy": 0.8719884157180786, | |
| "epoch": 1.94, | |
| "grad_norm": 0.13280296325683594, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8737912178039551, | |
| "mean_token_accuracy": 0.748961865901947, | |
| "num_tokens": 6814733.0, | |
| "step": 97 | |
| }, | |
| { | |
| "entropy": 0.9378086924552917, | |
| "epoch": 1.96, | |
| "grad_norm": 0.142800435423851, | |
| "learning_rate": 0.0001, | |
| "loss": 0.928570032119751, | |
| "mean_token_accuracy": 0.7347837388515472, | |
| "num_tokens": 6887723.0, | |
| "step": 98 | |
| }, | |
| { | |
| "entropy": 0.8699579238891602, | |
| "epoch": 1.98, | |
| "grad_norm": 0.13884496688842773, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8652123808860779, | |
| "mean_token_accuracy": 0.7550584077835083, | |
| "num_tokens": 6957156.0, | |
| "step": 99 | |
| }, | |
| { | |
| "entropy": 0.8680048286914825, | |
| "epoch": 2.0, | |
| "grad_norm": 0.13625894486904144, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8566628694534302, | |
| "mean_token_accuracy": 0.7550990581512451, | |
| "num_tokens": 7030824.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.8759163916110992, | |
| "epoch": 2.02, | |
| "grad_norm": 0.13642925024032593, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8173877596855164, | |
| "mean_token_accuracy": 0.7642171382904053, | |
| "num_tokens": 7099794.0, | |
| "step": 101 | |
| }, | |
| { | |
| "entropy": 0.872030109167099, | |
| "epoch": 2.04, | |
| "grad_norm": 0.13444599509239197, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8315644860267639, | |
| "mean_token_accuracy": 0.7598301768302917, | |
| "num_tokens": 7168851.0, | |
| "step": 102 | |
| }, | |
| { | |
| "entropy": 0.8999165594577789, | |
| "epoch": 2.06, | |
| "grad_norm": 0.14029845595359802, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8543646335601807, | |
| "mean_token_accuracy": 0.7513293921947479, | |
| "num_tokens": 7239717.0, | |
| "step": 103 | |
| }, | |
| { | |
| "entropy": 0.8488370180130005, | |
| "epoch": 2.08, | |
| "grad_norm": 0.13906973600387573, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8071736097335815, | |
| "mean_token_accuracy": 0.768627405166626, | |
| "num_tokens": 7310897.0, | |
| "step": 104 | |
| }, | |
| { | |
| "entropy": 0.8458687663078308, | |
| "epoch": 2.1, | |
| "grad_norm": 0.14410872757434845, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8336784243583679, | |
| "mean_token_accuracy": 0.7576306164264679, | |
| "num_tokens": 7381044.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 0.8117028772830963, | |
| "epoch": 2.12, | |
| "grad_norm": 0.15016138553619385, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8016491532325745, | |
| "mean_token_accuracy": 0.761463850736618, | |
| "num_tokens": 7448539.0, | |
| "step": 106 | |
| }, | |
| { | |
| "entropy": 0.8423402607440948, | |
| "epoch": 2.14, | |
| "grad_norm": 0.14620108902454376, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8520156145095825, | |
| "mean_token_accuracy": 0.7559936344623566, | |
| "num_tokens": 7523326.0, | |
| "step": 107 | |
| }, | |
| { | |
| "entropy": 0.7789672613143921, | |
| "epoch": 2.16, | |
| "grad_norm": 0.14582377672195435, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7745522260665894, | |
| "mean_token_accuracy": 0.7746096849441528, | |
| "num_tokens": 7589964.0, | |
| "step": 108 | |
| }, | |
| { | |
| "entropy": 0.8252202570438385, | |
| "epoch": 2.18, | |
| "grad_norm": 0.15269358456134796, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8253834247589111, | |
| "mean_token_accuracy": 0.760587066411972, | |
| "num_tokens": 7663822.0, | |
| "step": 109 | |
| }, | |
| { | |
| "entropy": 0.8460159599781036, | |
| "epoch": 2.2, | |
| "grad_norm": 0.15312956273555756, | |
| "learning_rate": 0.0001, | |
| "loss": 0.834621012210846, | |
| "mean_token_accuracy": 0.7548129558563232, | |
| "num_tokens": 7736094.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 0.8546044528484344, | |
| "epoch": 2.22, | |
| "grad_norm": 0.1496986299753189, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8300120830535889, | |
| "mean_token_accuracy": 0.759436160326004, | |
| "num_tokens": 7812027.0, | |
| "step": 111 | |
| }, | |
| { | |
| "entropy": 0.754067599773407, | |
| "epoch": 2.24, | |
| "grad_norm": 0.1404401957988739, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7299779653549194, | |
| "mean_token_accuracy": 0.7858331501483917, | |
| "num_tokens": 7881889.0, | |
| "step": 112 | |
| }, | |
| { | |
| "entropy": 0.8271636366844177, | |
| "epoch": 2.26, | |
| "grad_norm": 0.15130330622196198, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8026934862136841, | |
| "mean_token_accuracy": 0.7606152594089508, | |
| "num_tokens": 7958772.0, | |
| "step": 113 | |
| }, | |
| { | |
| "entropy": 0.8311681747436523, | |
| "epoch": 2.2800000000000002, | |
| "grad_norm": 0.15545408427715302, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8179649114608765, | |
| "mean_token_accuracy": 0.7627213597297668, | |
| "num_tokens": 8029445.0, | |
| "step": 114 | |
| }, | |
| { | |
| "entropy": 0.8371923565864563, | |
| "epoch": 2.3, | |
| "grad_norm": 0.15620867908000946, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8322392106056213, | |
| "mean_token_accuracy": 0.7557950615882874, | |
| "num_tokens": 8100496.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 0.8774853646755219, | |
| "epoch": 2.32, | |
| "grad_norm": 0.16020546853542328, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8756296634674072, | |
| "mean_token_accuracy": 0.7484939396381378, | |
| "num_tokens": 8172797.0, | |
| "step": 116 | |
| }, | |
| { | |
| "entropy": 0.7841235101222992, | |
| "epoch": 2.34, | |
| "grad_norm": 0.16341933608055115, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7845247387886047, | |
| "mean_token_accuracy": 0.7680597603321075, | |
| "num_tokens": 8239973.0, | |
| "step": 117 | |
| }, | |
| { | |
| "entropy": 0.8059554100036621, | |
| "epoch": 2.36, | |
| "grad_norm": 0.14973363280296326, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7868502140045166, | |
| "mean_token_accuracy": 0.7696151733398438, | |
| "num_tokens": 8312997.0, | |
| "step": 118 | |
| }, | |
| { | |
| "entropy": 0.790012925863266, | |
| "epoch": 2.38, | |
| "grad_norm": 0.15735657513141632, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7770582437515259, | |
| "mean_token_accuracy": 0.7715879082679749, | |
| "num_tokens": 8380963.0, | |
| "step": 119 | |
| }, | |
| { | |
| "entropy": 0.7878563702106476, | |
| "epoch": 2.4, | |
| "grad_norm": 0.15908536314964294, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7946950197219849, | |
| "mean_token_accuracy": 0.7720945775508881, | |
| "num_tokens": 8453009.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 0.8163405060768127, | |
| "epoch": 2.42, | |
| "grad_norm": 0.15914228558540344, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8022626042366028, | |
| "mean_token_accuracy": 0.765992671251297, | |
| "num_tokens": 8522525.0, | |
| "step": 121 | |
| }, | |
| { | |
| "entropy": 0.8679061532020569, | |
| "epoch": 2.44, | |
| "grad_norm": 0.1549653708934784, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8452656269073486, | |
| "mean_token_accuracy": 0.7564500868320465, | |
| "num_tokens": 8591511.0, | |
| "step": 122 | |
| }, | |
| { | |
| "entropy": 0.8327716588973999, | |
| "epoch": 2.46, | |
| "grad_norm": 0.16247446835041046, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8243684768676758, | |
| "mean_token_accuracy": 0.7590730786323547, | |
| "num_tokens": 8665286.0, | |
| "step": 123 | |
| }, | |
| { | |
| "entropy": 0.7765352427959442, | |
| "epoch": 2.48, | |
| "grad_norm": 0.15758228302001953, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7422535419464111, | |
| "mean_token_accuracy": 0.783282607793808, | |
| "num_tokens": 8730146.0, | |
| "step": 124 | |
| }, | |
| { | |
| "entropy": 0.8039740025997162, | |
| "epoch": 2.5, | |
| "grad_norm": 0.1573210507631302, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7967308759689331, | |
| "mean_token_accuracy": 0.7692459225654602, | |
| "num_tokens": 8801629.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 0.8415170609951019, | |
| "epoch": 2.52, | |
| "grad_norm": 0.16268476843833923, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8165377378463745, | |
| "mean_token_accuracy": 0.7615750133991241, | |
| "num_tokens": 8877985.0, | |
| "step": 126 | |
| }, | |
| { | |
| "entropy": 0.8203210234642029, | |
| "epoch": 2.54, | |
| "grad_norm": 0.16346436738967896, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8121747970581055, | |
| "mean_token_accuracy": 0.761315256357193, | |
| "num_tokens": 8951559.0, | |
| "step": 127 | |
| }, | |
| { | |
| "entropy": 0.8293347358703613, | |
| "epoch": 2.56, | |
| "grad_norm": 0.17023281753063202, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8173530101776123, | |
| "mean_token_accuracy": 0.759048581123352, | |
| "num_tokens": 9021509.0, | |
| "step": 128 | |
| }, | |
| { | |
| "entropy": 0.7746993601322174, | |
| "epoch": 2.58, | |
| "grad_norm": 0.1615564227104187, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7658690214157104, | |
| "mean_token_accuracy": 0.7726005017757416, | |
| "num_tokens": 9090508.0, | |
| "step": 129 | |
| }, | |
| { | |
| "entropy": 0.8143576085567474, | |
| "epoch": 2.6, | |
| "grad_norm": 0.1704084575176239, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8276199102401733, | |
| "mean_token_accuracy": 0.7586769461631775, | |
| "num_tokens": 9156045.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 0.7868927419185638, | |
| "epoch": 2.62, | |
| "grad_norm": 0.16065886616706848, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7649659514427185, | |
| "mean_token_accuracy": 0.7774228751659393, | |
| "num_tokens": 9221515.0, | |
| "step": 131 | |
| }, | |
| { | |
| "entropy": 0.8241930305957794, | |
| "epoch": 2.64, | |
| "grad_norm": 0.1710738241672516, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8104192018508911, | |
| "mean_token_accuracy": 0.7651428282260895, | |
| "num_tokens": 9290829.0, | |
| "step": 132 | |
| }, | |
| { | |
| "entropy": 0.7782109975814819, | |
| "epoch": 2.66, | |
| "grad_norm": 0.3252999484539032, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7537873983383179, | |
| "mean_token_accuracy": 0.7770578563213348, | |
| "num_tokens": 9358923.0, | |
| "step": 133 | |
| }, | |
| { | |
| "entropy": 0.7932650744915009, | |
| "epoch": 2.68, | |
| "grad_norm": 0.16687457263469696, | |
| "learning_rate": 0.0001, | |
| "loss": 0.771995484828949, | |
| "mean_token_accuracy": 0.7717720866203308, | |
| "num_tokens": 9431495.0, | |
| "step": 134 | |
| }, | |
| { | |
| "entropy": 0.8635589182376862, | |
| "epoch": 2.7, | |
| "grad_norm": 0.17788194119930267, | |
| "learning_rate": 0.0001, | |
| "loss": 0.839271605014801, | |
| "mean_token_accuracy": 0.7549299001693726, | |
| "num_tokens": 9502949.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 0.8827160894870758, | |
| "epoch": 2.7199999999999998, | |
| "grad_norm": 0.17214906215667725, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8584389686584473, | |
| "mean_token_accuracy": 0.7523661851882935, | |
| "num_tokens": 9572738.0, | |
| "step": 136 | |
| }, | |
| { | |
| "entropy": 0.7438818514347076, | |
| "epoch": 2.74, | |
| "grad_norm": 0.15866513550281525, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7251607179641724, | |
| "mean_token_accuracy": 0.7865616679191589, | |
| "num_tokens": 9643339.0, | |
| "step": 137 | |
| }, | |
| { | |
| "entropy": 0.8008526265621185, | |
| "epoch": 2.76, | |
| "grad_norm": 0.17728553712368011, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7907190322875977, | |
| "mean_token_accuracy": 0.7696272730827332, | |
| "num_tokens": 9712087.0, | |
| "step": 138 | |
| }, | |
| { | |
| "entropy": 0.7775652408599854, | |
| "epoch": 2.7800000000000002, | |
| "grad_norm": 0.16898134350776672, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7762832641601562, | |
| "mean_token_accuracy": 0.7671337127685547, | |
| "num_tokens": 9787274.0, | |
| "step": 139 | |
| }, | |
| { | |
| "entropy": 0.7524736523628235, | |
| "epoch": 2.8, | |
| "grad_norm": 0.1687132865190506, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7515966892242432, | |
| "mean_token_accuracy": 0.7743718028068542, | |
| "num_tokens": 9850649.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 0.784816324710846, | |
| "epoch": 2.82, | |
| "grad_norm": 0.16266104578971863, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7850303649902344, | |
| "mean_token_accuracy": 0.7671224176883698, | |
| "num_tokens": 9919647.0, | |
| "step": 141 | |
| }, | |
| { | |
| "entropy": 0.845661848783493, | |
| "epoch": 2.84, | |
| "grad_norm": 0.177549347281456, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8321537375450134, | |
| "mean_token_accuracy": 0.7545971870422363, | |
| "num_tokens": 9988951.0, | |
| "step": 142 | |
| }, | |
| { | |
| "entropy": 0.7890813946723938, | |
| "epoch": 2.86, | |
| "grad_norm": 0.16998162865638733, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7851375937461853, | |
| "mean_token_accuracy": 0.77273029088974, | |
| "num_tokens": 10059418.0, | |
| "step": 143 | |
| }, | |
| { | |
| "entropy": 0.8383583724498749, | |
| "epoch": 2.88, | |
| "grad_norm": 0.16811728477478027, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8264563083648682, | |
| "mean_token_accuracy": 0.7561212778091431, | |
| "num_tokens": 10130582.0, | |
| "step": 144 | |
| }, | |
| { | |
| "entropy": 0.7998828291893005, | |
| "epoch": 2.9, | |
| "grad_norm": 0.162356436252594, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7867046594619751, | |
| "mean_token_accuracy": 0.7678299248218536, | |
| "num_tokens": 10205184.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 0.8201400637626648, | |
| "epoch": 2.92, | |
| "grad_norm": 0.1775413304567337, | |
| "learning_rate": 0.0001, | |
| "loss": 0.8155138492584229, | |
| "mean_token_accuracy": 0.7631427645683289, | |
| "num_tokens": 10272128.0, | |
| "step": 146 | |
| }, | |
| { | |
| "entropy": 0.8001563251018524, | |
| "epoch": 2.94, | |
| "grad_norm": 0.1714172512292862, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7718967795372009, | |
| "mean_token_accuracy": 0.7731671333312988, | |
| "num_tokens": 10339140.0, | |
| "step": 147 | |
| }, | |
| { | |
| "entropy": 0.8686825633049011, | |
| "epoch": 2.96, | |
| "grad_norm": 0.1718156337738037, | |
| "learning_rate": 0.0001, | |
| "loss": 0.841813862323761, | |
| "mean_token_accuracy": 0.7538741528987885, | |
| "num_tokens": 10405402.0, | |
| "step": 148 | |
| }, | |
| { | |
| "entropy": 0.8255911767482758, | |
| "epoch": 2.98, | |
| "grad_norm": 0.17787101864814758, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7991260290145874, | |
| "mean_token_accuracy": 0.7636489570140839, | |
| "num_tokens": 10473811.0, | |
| "step": 149 | |
| }, | |
| { | |
| "entropy": 0.8001417219638824, | |
| "epoch": 3.0, | |
| "grad_norm": 0.17027507722377777, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7719438076019287, | |
| "mean_token_accuracy": 0.7698873281478882, | |
| "num_tokens": 10546089.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.8200977146625519, | |
| "epoch": 3.02, | |
| "grad_norm": 0.16800017654895782, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7360785007476807, | |
| "mean_token_accuracy": 0.7826903462409973, | |
| "num_tokens": 10618015.0, | |
| "step": 151 | |
| }, | |
| { | |
| "entropy": 0.8175333142280579, | |
| "epoch": 3.04, | |
| "grad_norm": 0.18896523118019104, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7504415512084961, | |
| "mean_token_accuracy": 0.7746379971504211, | |
| "num_tokens": 10688911.0, | |
| "step": 152 | |
| }, | |
| { | |
| "entropy": 0.7592836618423462, | |
| "epoch": 3.06, | |
| "grad_norm": 0.18069066107273102, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7176339626312256, | |
| "mean_token_accuracy": 0.7862937152385712, | |
| "num_tokens": 10755190.0, | |
| "step": 153 | |
| }, | |
| { | |
| "entropy": 0.7064773738384247, | |
| "epoch": 3.08, | |
| "grad_norm": 0.17506442964076996, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6661837697029114, | |
| "mean_token_accuracy": 0.7990798652172089, | |
| "num_tokens": 10824572.0, | |
| "step": 154 | |
| }, | |
| { | |
| "entropy": 0.7049046158790588, | |
| "epoch": 3.1, | |
| "grad_norm": 0.18128055334091187, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6970986127853394, | |
| "mean_token_accuracy": 0.7910968661308289, | |
| "num_tokens": 10897921.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 0.7131330072879791, | |
| "epoch": 3.12, | |
| "grad_norm": 0.1793287843465805, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6969539523124695, | |
| "mean_token_accuracy": 0.7904528379440308, | |
| "num_tokens": 10967473.0, | |
| "step": 156 | |
| }, | |
| { | |
| "entropy": 0.7718028426170349, | |
| "epoch": 3.14, | |
| "grad_norm": 0.18882189691066742, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7447178959846497, | |
| "mean_token_accuracy": 0.7770456969738007, | |
| "num_tokens": 11040256.0, | |
| "step": 157 | |
| }, | |
| { | |
| "entropy": 0.753845751285553, | |
| "epoch": 3.16, | |
| "grad_norm": 0.20335878431797028, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7178476452827454, | |
| "mean_token_accuracy": 0.7853229939937592, | |
| "num_tokens": 11106853.0, | |
| "step": 158 | |
| }, | |
| { | |
| "entropy": 0.6985587477684021, | |
| "epoch": 3.18, | |
| "grad_norm": 0.18876291811466217, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6741787195205688, | |
| "mean_token_accuracy": 0.7952553629875183, | |
| "num_tokens": 11178868.0, | |
| "step": 159 | |
| }, | |
| { | |
| "entropy": 0.7184737622737885, | |
| "epoch": 3.2, | |
| "grad_norm": 0.19795499742031097, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6854847073554993, | |
| "mean_token_accuracy": 0.7917522490024567, | |
| "num_tokens": 11246484.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 0.7506313323974609, | |
| "epoch": 3.22, | |
| "grad_norm": 0.2013498693704605, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7236944437026978, | |
| "mean_token_accuracy": 0.7839900851249695, | |
| "num_tokens": 11319820.0, | |
| "step": 161 | |
| }, | |
| { | |
| "entropy": 0.7317833006381989, | |
| "epoch": 3.24, | |
| "grad_norm": 0.19697904586791992, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7071319222450256, | |
| "mean_token_accuracy": 0.7910904288291931, | |
| "num_tokens": 11389201.0, | |
| "step": 162 | |
| }, | |
| { | |
| "entropy": 0.7270588874816895, | |
| "epoch": 3.26, | |
| "grad_norm": 0.19727207720279694, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7034903168678284, | |
| "mean_token_accuracy": 0.7924522161483765, | |
| "num_tokens": 11458094.0, | |
| "step": 163 | |
| }, | |
| { | |
| "entropy": 0.6620264649391174, | |
| "epoch": 3.2800000000000002, | |
| "grad_norm": 0.1949145644903183, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6431432366371155, | |
| "mean_token_accuracy": 0.8045243918895721, | |
| "num_tokens": 11526439.0, | |
| "step": 164 | |
| }, | |
| { | |
| "entropy": 0.7114729583263397, | |
| "epoch": 3.3, | |
| "grad_norm": 0.2044411301612854, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6916588544845581, | |
| "mean_token_accuracy": 0.7911301851272583, | |
| "num_tokens": 11593907.0, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 0.7394631803035736, | |
| "epoch": 3.32, | |
| "grad_norm": 0.20598116517066956, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7143540978431702, | |
| "mean_token_accuracy": 0.7861869037151337, | |
| "num_tokens": 11659313.0, | |
| "step": 166 | |
| }, | |
| { | |
| "entropy": 0.7148211598396301, | |
| "epoch": 3.34, | |
| "grad_norm": 0.19798815250396729, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6806311011314392, | |
| "mean_token_accuracy": 0.7966620624065399, | |
| "num_tokens": 11729203.0, | |
| "step": 167 | |
| }, | |
| { | |
| "entropy": 0.7278057634830475, | |
| "epoch": 3.36, | |
| "grad_norm": 0.2106526643037796, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6907294392585754, | |
| "mean_token_accuracy": 0.7917556762695312, | |
| "num_tokens": 11798662.0, | |
| "step": 168 | |
| }, | |
| { | |
| "entropy": 0.7575972974300385, | |
| "epoch": 3.38, | |
| "grad_norm": 0.19657012820243835, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7215894460678101, | |
| "mean_token_accuracy": 0.7850257754325867, | |
| "num_tokens": 11874700.0, | |
| "step": 169 | |
| }, | |
| { | |
| "entropy": 0.7198713719844818, | |
| "epoch": 3.4, | |
| "grad_norm": 0.19392815232276917, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6976982355117798, | |
| "mean_token_accuracy": 0.7894782423973083, | |
| "num_tokens": 11946770.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.6691116690635681, | |
| "epoch": 3.42, | |
| "grad_norm": 0.1919872909784317, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6429901123046875, | |
| "mean_token_accuracy": 0.8067097663879395, | |
| "num_tokens": 12016943.0, | |
| "step": 171 | |
| }, | |
| { | |
| "entropy": 0.7087913751602173, | |
| "epoch": 3.44, | |
| "grad_norm": 0.19245345890522003, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6743010878562927, | |
| "mean_token_accuracy": 0.8007382750511169, | |
| "num_tokens": 12088223.0, | |
| "step": 172 | |
| }, | |
| { | |
| "entropy": 0.7334369122982025, | |
| "epoch": 3.46, | |
| "grad_norm": 0.1944996863603592, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7241754531860352, | |
| "mean_token_accuracy": 0.781945675611496, | |
| "num_tokens": 12164031.0, | |
| "step": 173 | |
| }, | |
| { | |
| "entropy": 0.7216465771198273, | |
| "epoch": 3.48, | |
| "grad_norm": 0.195100337266922, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6905370950698853, | |
| "mean_token_accuracy": 0.7926844656467438, | |
| "num_tokens": 12235488.0, | |
| "step": 174 | |
| }, | |
| { | |
| "entropy": 0.7634322941303253, | |
| "epoch": 3.5, | |
| "grad_norm": 0.20126116275787354, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7199342250823975, | |
| "mean_token_accuracy": 0.784062385559082, | |
| "num_tokens": 12304402.0, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 0.7162297964096069, | |
| "epoch": 3.52, | |
| "grad_norm": 0.19708800315856934, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6828768253326416, | |
| "mean_token_accuracy": 0.7963770925998688, | |
| "num_tokens": 12376874.0, | |
| "step": 176 | |
| }, | |
| { | |
| "entropy": 0.7292175590991974, | |
| "epoch": 3.54, | |
| "grad_norm": 0.19853827357292175, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6944613456726074, | |
| "mean_token_accuracy": 0.7901931405067444, | |
| "num_tokens": 12443682.0, | |
| "step": 177 | |
| }, | |
| { | |
| "entropy": 0.7690876424312592, | |
| "epoch": 3.56, | |
| "grad_norm": 0.2102740854024887, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7348027229309082, | |
| "mean_token_accuracy": 0.7807092070579529, | |
| "num_tokens": 12511430.0, | |
| "step": 178 | |
| }, | |
| { | |
| "entropy": 0.7362220287322998, | |
| "epoch": 3.58, | |
| "grad_norm": 0.20193730294704437, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7197112441062927, | |
| "mean_token_accuracy": 0.7791264057159424, | |
| "num_tokens": 12582173.0, | |
| "step": 179 | |
| }, | |
| { | |
| "entropy": 0.716655433177948, | |
| "epoch": 3.6, | |
| "grad_norm": 0.19548293948173523, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7020804286003113, | |
| "mean_token_accuracy": 0.789775550365448, | |
| "num_tokens": 12655124.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 0.7400652468204498, | |
| "epoch": 3.62, | |
| "grad_norm": 0.20551350712776184, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7202802300453186, | |
| "mean_token_accuracy": 0.7863712012767792, | |
| "num_tokens": 12728612.0, | |
| "step": 181 | |
| }, | |
| { | |
| "entropy": 0.7541409730911255, | |
| "epoch": 3.64, | |
| "grad_norm": 0.200267493724823, | |
| "learning_rate": 0.0001, | |
| "loss": 0.713320255279541, | |
| "mean_token_accuracy": 0.7859389185905457, | |
| "num_tokens": 12800056.0, | |
| "step": 182 | |
| }, | |
| { | |
| "entropy": 0.6940381526947021, | |
| "epoch": 3.66, | |
| "grad_norm": 0.19558116793632507, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6574203968048096, | |
| "mean_token_accuracy": 0.8014397621154785, | |
| "num_tokens": 12868372.0, | |
| "step": 183 | |
| }, | |
| { | |
| "entropy": 0.7630845606327057, | |
| "epoch": 3.68, | |
| "grad_norm": 0.20073311030864716, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7155758738517761, | |
| "mean_token_accuracy": 0.7896965146064758, | |
| "num_tokens": 12937518.0, | |
| "step": 184 | |
| }, | |
| { | |
| "entropy": 0.7708411812782288, | |
| "epoch": 3.7, | |
| "grad_norm": 0.22150248289108276, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7369881868362427, | |
| "mean_token_accuracy": 0.7802594602108002, | |
| "num_tokens": 13003915.0, | |
| "step": 185 | |
| }, | |
| { | |
| "entropy": 0.7173754870891571, | |
| "epoch": 3.7199999999999998, | |
| "grad_norm": 0.19912731647491455, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6876958608627319, | |
| "mean_token_accuracy": 0.7933018803596497, | |
| "num_tokens": 13075561.0, | |
| "step": 186 | |
| }, | |
| { | |
| "entropy": 0.7382989227771759, | |
| "epoch": 3.74, | |
| "grad_norm": 0.20131585001945496, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7099729180335999, | |
| "mean_token_accuracy": 0.7907689809799194, | |
| "num_tokens": 13147726.0, | |
| "step": 187 | |
| }, | |
| { | |
| "entropy": 0.7296792566776276, | |
| "epoch": 3.76, | |
| "grad_norm": 0.19849984347820282, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7037006616592407, | |
| "mean_token_accuracy": 0.7868267595767975, | |
| "num_tokens": 13219764.0, | |
| "step": 188 | |
| }, | |
| { | |
| "entropy": 0.7335399687290192, | |
| "epoch": 3.7800000000000002, | |
| "grad_norm": 0.20115980505943298, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7100788354873657, | |
| "mean_token_accuracy": 0.786194235086441, | |
| "num_tokens": 13291698.0, | |
| "step": 189 | |
| }, | |
| { | |
| "entropy": 0.7148082256317139, | |
| "epoch": 3.8, | |
| "grad_norm": 0.19843769073486328, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6846855878829956, | |
| "mean_token_accuracy": 0.7930681705474854, | |
| "num_tokens": 13364738.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 0.71998131275177, | |
| "epoch": 3.82, | |
| "grad_norm": 0.20854182541370392, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6897561550140381, | |
| "mean_token_accuracy": 0.7933003902435303, | |
| "num_tokens": 13436984.0, | |
| "step": 191 | |
| }, | |
| { | |
| "entropy": 0.7520318031311035, | |
| "epoch": 3.84, | |
| "grad_norm": 0.21299579739570618, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7223616242408752, | |
| "mean_token_accuracy": 0.7838756442070007, | |
| "num_tokens": 13504383.0, | |
| "step": 192 | |
| }, | |
| { | |
| "entropy": 0.7173813283443451, | |
| "epoch": 3.86, | |
| "grad_norm": 0.20238681137561798, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6963660717010498, | |
| "mean_token_accuracy": 0.7877775430679321, | |
| "num_tokens": 13578910.0, | |
| "step": 193 | |
| }, | |
| { | |
| "entropy": 0.7405160069465637, | |
| "epoch": 3.88, | |
| "grad_norm": 0.21617071330547333, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7227989435195923, | |
| "mean_token_accuracy": 0.782155841588974, | |
| "num_tokens": 13646579.0, | |
| "step": 194 | |
| }, | |
| { | |
| "entropy": 0.6996143460273743, | |
| "epoch": 3.9, | |
| "grad_norm": 0.20972195267677307, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6725365519523621, | |
| "mean_token_accuracy": 0.7987044751644135, | |
| "num_tokens": 13712265.0, | |
| "step": 195 | |
| }, | |
| { | |
| "entropy": 0.6924785077571869, | |
| "epoch": 3.92, | |
| "grad_norm": 0.20143532752990723, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6744241118431091, | |
| "mean_token_accuracy": 0.7988313138484955, | |
| "num_tokens": 13778938.0, | |
| "step": 196 | |
| }, | |
| { | |
| "entropy": 0.7586347460746765, | |
| "epoch": 3.94, | |
| "grad_norm": 0.21675406396389008, | |
| "learning_rate": 0.0001, | |
| "loss": 0.720883846282959, | |
| "mean_token_accuracy": 0.7846451103687286, | |
| "num_tokens": 13850680.0, | |
| "step": 197 | |
| }, | |
| { | |
| "entropy": 0.7003247439861298, | |
| "epoch": 3.96, | |
| "grad_norm": 0.20092730224132538, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6743336915969849, | |
| "mean_token_accuracy": 0.797335296869278, | |
| "num_tokens": 13922486.0, | |
| "step": 198 | |
| }, | |
| { | |
| "entropy": 0.7424158155918121, | |
| "epoch": 3.98, | |
| "grad_norm": 0.2068347930908203, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7222142815589905, | |
| "mean_token_accuracy": 0.7855294048786163, | |
| "num_tokens": 13994794.0, | |
| "step": 199 | |
| }, | |
| { | |
| "entropy": 0.7328775823116302, | |
| "epoch": 4.0, | |
| "grad_norm": 0.21473339200019836, | |
| "learning_rate": 0.0001, | |
| "loss": 0.6824338436126709, | |
| "mean_token_accuracy": 0.7947524189949036, | |
| "num_tokens": 14060764.0, | |
| "step": 200 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 200, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 4, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 8.561776579712123e+17, | |
| "train_batch_size": 8, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |