Text Generation
Transformers
Safetensors
English
qwen3
long-context
sparse-attention
aha
l2a-style
reproducibility
conversational
text-generation-inference
Instructions to use keepsloading/icml_repro_scratch with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use keepsloading/icml_repro_scratch with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="keepsloading/icml_repro_scratch") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("keepsloading/icml_repro_scratch") model = AutoModelForCausalLM.from_pretrained("keepsloading/icml_repro_scratch", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use keepsloading/icml_repro_scratch with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "keepsloading/icml_repro_scratch" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "keepsloading/icml_repro_scratch", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/keepsloading/icml_repro_scratch
- SGLang
How to use keepsloading/icml_repro_scratch with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "keepsloading/icml_repro_scratch" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "keepsloading/icml_repro_scratch", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "keepsloading/icml_repro_scratch" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "keepsloading/icml_repro_scratch", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use keepsloading/icml_repro_scratch with Docker Model Runner:
docker model run hf.co/keepsloading/icml_repro_scratch
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.0, | |
| "eval_steps": 500, | |
| "global_step": 6911, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "ce_loss": 2.031, | |
| "epoch": 0.0014469947727313835, | |
| "grad_norm": 29.5, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.298076923076923e-06, | |
| "loss": 2.031, | |
| "mean_token_accuracy": 0.7030675932765007, | |
| "num_tokens": 741730.0, | |
| "step": 10, | |
| "train_ppl": 7.621345 | |
| }, | |
| { | |
| "ce_loss": 2.091, | |
| "epoch": 0.002893989545462767, | |
| "grad_norm": 27.0, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.7403846153846155e-06, | |
| "loss": 2.091, | |
| "mean_token_accuracy": 0.6888238519430161, | |
| "num_tokens": 1459999.0, | |
| "step": 20, | |
| "train_ppl": 8.093004 | |
| }, | |
| { | |
| "ce_loss": 1.9679, | |
| "epoch": 0.004340984318194151, | |
| "grad_norm": 25.75, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.182692307692308e-06, | |
| "loss": 1.9679, | |
| "mean_token_accuracy": 0.6994533620774745, | |
| "num_tokens": 2205386.0, | |
| "step": 30, | |
| "train_ppl": 7.155398 | |
| }, | |
| { | |
| "ce_loss": 1.6513, | |
| "epoch": 0.005787979090925534, | |
| "grad_norm": 12.4375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.625e-06, | |
| "loss": 1.6513, | |
| "mean_token_accuracy": 0.7152167946100235, | |
| "num_tokens": 2952129.0, | |
| "step": 40, | |
| "train_ppl": 5.21397 | |
| }, | |
| { | |
| "ce_loss": 1.5017, | |
| "epoch": 0.007234973863656917, | |
| "grad_norm": 8.3125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.067307692307692e-06, | |
| "loss": 1.5017, | |
| "mean_token_accuracy": 0.7155109643936157, | |
| "num_tokens": 3667912.0, | |
| "step": 50, | |
| "train_ppl": 4.489093 | |
| }, | |
| { | |
| "ce_loss": 1.3397, | |
| "epoch": 0.008681968636388301, | |
| "grad_norm": 3.328125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.509615384615384e-06, | |
| "loss": 1.3397, | |
| "mean_token_accuracy": 0.7240443922579288, | |
| "num_tokens": 4427526.0, | |
| "step": 60, | |
| "train_ppl": 3.817909 | |
| }, | |
| { | |
| "ce_loss": 1.2534, | |
| "epoch": 0.010128963409119684, | |
| "grad_norm": 3.609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.951923076923077e-06, | |
| "loss": 1.2534, | |
| "mean_token_accuracy": 0.7320300832390785, | |
| "num_tokens": 5160176.0, | |
| "step": 70, | |
| "train_ppl": 3.502394 | |
| }, | |
| { | |
| "ce_loss": 1.1852, | |
| "epoch": 0.011575958181851068, | |
| "grad_norm": 4.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.139423076923077e-05, | |
| "loss": 1.1852, | |
| "mean_token_accuracy": 0.7428010664880276, | |
| "num_tokens": 5911569.0, | |
| "step": 80, | |
| "train_ppl": 3.27122 | |
| }, | |
| { | |
| "ce_loss": 1.131, | |
| "epoch": 0.013022952954582452, | |
| "grad_norm": 1.296875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2836538461538462e-05, | |
| "loss": 1.131, | |
| "mean_token_accuracy": 0.7550130240619183, | |
| "num_tokens": 6689615.0, | |
| "step": 90, | |
| "train_ppl": 3.098752 | |
| }, | |
| { | |
| "ce_loss": 1.1475, | |
| "epoch": 0.014469947727313835, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4278846153846154e-05, | |
| "loss": 1.1475, | |
| "mean_token_accuracy": 0.7511672869324684, | |
| "num_tokens": 7426028.0, | |
| "step": 100, | |
| "train_ppl": 3.150303 | |
| }, | |
| { | |
| "ce_loss": 1.107, | |
| "epoch": 0.015916942500045217, | |
| "grad_norm": 1.1328125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.5721153846153848e-05, | |
| "loss": 1.107, | |
| "mean_token_accuracy": 0.761037639528513, | |
| "num_tokens": 8168535.0, | |
| "step": 110, | |
| "train_ppl": 3.025315 | |
| }, | |
| { | |
| "ce_loss": 1.155, | |
| "epoch": 0.017363937272776603, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7163461538461537e-05, | |
| "loss": 1.155, | |
| "mean_token_accuracy": 0.7489694423973561, | |
| "num_tokens": 8913465.0, | |
| "step": 120, | |
| "train_ppl": 3.174086 | |
| }, | |
| { | |
| "ce_loss": 1.1527, | |
| "epoch": 0.018810932045507985, | |
| "grad_norm": 1.203125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8605769230769233e-05, | |
| "loss": 1.1527, | |
| "mean_token_accuracy": 0.7528368845582009, | |
| "num_tokens": 9631331.0, | |
| "step": 130, | |
| "train_ppl": 3.166877 | |
| }, | |
| { | |
| "ce_loss": 1.0897, | |
| "epoch": 0.020257926818239368, | |
| "grad_norm": 1.2578125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0048076923076922e-05, | |
| "loss": 1.0897, | |
| "mean_token_accuracy": 0.7576698914170266, | |
| "num_tokens": 10387986.0, | |
| "step": 140, | |
| "train_ppl": 2.973338 | |
| }, | |
| { | |
| "ce_loss": 1.0838, | |
| "epoch": 0.021704921590970754, | |
| "grad_norm": 0.99609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.1490384615384615e-05, | |
| "loss": 1.0838, | |
| "mean_token_accuracy": 0.7615541353821754, | |
| "num_tokens": 11156736.0, | |
| "step": 150, | |
| "train_ppl": 2.955747 | |
| }, | |
| { | |
| "ce_loss": 1.1045, | |
| "epoch": 0.023151916363702136, | |
| "grad_norm": 1.25, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.2932692307692307e-05, | |
| "loss": 1.1045, | |
| "mean_token_accuracy": 0.7566463962197304, | |
| "num_tokens": 11873395.0, | |
| "step": 160, | |
| "train_ppl": 3.017859 | |
| }, | |
| { | |
| "ce_loss": 1.0972, | |
| "epoch": 0.02459891113643352, | |
| "grad_norm": 1.125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.4375e-05, | |
| "loss": 1.0972, | |
| "mean_token_accuracy": 0.7590832710266113, | |
| "num_tokens": 12608710.0, | |
| "step": 170, | |
| "train_ppl": 2.995746 | |
| }, | |
| { | |
| "ce_loss": 1.0663, | |
| "epoch": 0.026045905909164904, | |
| "grad_norm": 1.2734375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.5817307692307695e-05, | |
| "loss": 1.0663, | |
| "mean_token_accuracy": 0.7631561934947968, | |
| "num_tokens": 13355138.0, | |
| "step": 180, | |
| "train_ppl": 2.904723 | |
| }, | |
| { | |
| "ce_loss": 1.0532, | |
| "epoch": 0.027492900681896287, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.7259615384615384e-05, | |
| "loss": 1.0532, | |
| "mean_token_accuracy": 0.7637556858360768, | |
| "num_tokens": 14107781.0, | |
| "step": 190, | |
| "train_ppl": 2.866803 | |
| }, | |
| { | |
| "ce_loss": 1.0673, | |
| "epoch": 0.02893989545462767, | |
| "grad_norm": 1.2421875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.870192307692308e-05, | |
| "loss": 1.0673, | |
| "mean_token_accuracy": 0.7635537907481194, | |
| "num_tokens": 14852277.0, | |
| "step": 200, | |
| "train_ppl": 2.90758 | |
| }, | |
| { | |
| "ce_loss": 1.0755, | |
| "epoch": 0.030386890227359055, | |
| "grad_norm": 1.2421875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.9995524392063257e-05, | |
| "loss": 1.0755, | |
| "mean_token_accuracy": 0.7621265381574631, | |
| "num_tokens": 15546431.0, | |
| "step": 210, | |
| "train_ppl": 2.93156 | |
| }, | |
| { | |
| "ce_loss": 1.125, | |
| "epoch": 0.031833885000090434, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.9950768312695806e-05, | |
| "loss": 1.125, | |
| "mean_token_accuracy": 0.7530753210186958, | |
| "num_tokens": 16272344.0, | |
| "step": 220, | |
| "train_ppl": 3.080183 | |
| }, | |
| { | |
| "ce_loss": 1.0847, | |
| "epoch": 0.03328087977282182, | |
| "grad_norm": 1.375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.9906012233328362e-05, | |
| "loss": 1.0847, | |
| "mean_token_accuracy": 0.7561856605112552, | |
| "num_tokens": 17017303.0, | |
| "step": 230, | |
| "train_ppl": 2.958519 | |
| }, | |
| { | |
| "ce_loss": 1.0307, | |
| "epoch": 0.034727874545553206, | |
| "grad_norm": 1.140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.9861256153960914e-05, | |
| "loss": 1.0307, | |
| "mean_token_accuracy": 0.7656997129321098, | |
| "num_tokens": 17774573.0, | |
| "step": 240, | |
| "train_ppl": 2.803042 | |
| }, | |
| { | |
| "ce_loss": 1.0565, | |
| "epoch": 0.036174869318284585, | |
| "grad_norm": 1.15625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.9816500074593467e-05, | |
| "loss": 1.0565, | |
| "mean_token_accuracy": 0.7623364008963108, | |
| "num_tokens": 18506619.0, | |
| "step": 250, | |
| "train_ppl": 2.876351 | |
| }, | |
| { | |
| "ce_loss": 1.047, | |
| "epoch": 0.03762186409101597, | |
| "grad_norm": 1.3828125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.977174399522602e-05, | |
| "loss": 1.047, | |
| "mean_token_accuracy": 0.7634409129619598, | |
| "num_tokens": 19281733.0, | |
| "step": 260, | |
| "train_ppl": 2.84913 | |
| }, | |
| { | |
| "ce_loss": 1.0546, | |
| "epoch": 0.039068858863747356, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.9726987915858572e-05, | |
| "loss": 1.0546, | |
| "mean_token_accuracy": 0.7609510987997055, | |
| "num_tokens": 19987179.0, | |
| "step": 270, | |
| "train_ppl": 2.870774 | |
| }, | |
| { | |
| "ce_loss": 1.0431, | |
| "epoch": 0.040515853636478735, | |
| "grad_norm": 0.99609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.9682231836491124e-05, | |
| "loss": 1.0431, | |
| "mean_token_accuracy": 0.7634642273187637, | |
| "num_tokens": 20745404.0, | |
| "step": 280, | |
| "train_ppl": 2.838059 | |
| }, | |
| { | |
| "ce_loss": 1.0446, | |
| "epoch": 0.04196284840921012, | |
| "grad_norm": 1.203125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.9637475757123677e-05, | |
| "loss": 1.0446, | |
| "mean_token_accuracy": 0.7675992861390114, | |
| "num_tokens": 21490797.0, | |
| "step": 290, | |
| "train_ppl": 2.842357 | |
| }, | |
| { | |
| "ce_loss": 1.0772, | |
| "epoch": 0.04340984318194151, | |
| "grad_norm": 1.125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.959271967775623e-05, | |
| "loss": 1.0772, | |
| "mean_token_accuracy": 0.7634236924350262, | |
| "num_tokens": 22209441.0, | |
| "step": 300, | |
| "train_ppl": 2.936523 | |
| }, | |
| { | |
| "ce_loss": 1.0581, | |
| "epoch": 0.044856837954672886, | |
| "grad_norm": 1.203125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.954796359838878e-05, | |
| "loss": 1.0581, | |
| "mean_token_accuracy": 0.7604357182979584, | |
| "num_tokens": 22924851.0, | |
| "step": 310, | |
| "train_ppl": 2.880844 | |
| }, | |
| { | |
| "ce_loss": 1.0396, | |
| "epoch": 0.04630383272740427, | |
| "grad_norm": 1.125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.9503207519021337e-05, | |
| "loss": 1.0396, | |
| "mean_token_accuracy": 0.7631719268858432, | |
| "num_tokens": 23660815.0, | |
| "step": 320, | |
| "train_ppl": 2.828141 | |
| }, | |
| { | |
| "ce_loss": 1.0448, | |
| "epoch": 0.04775082750013566, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.9458451439653886e-05, | |
| "loss": 1.0448, | |
| "mean_token_accuracy": 0.7706776842474937, | |
| "num_tokens": 24378060.0, | |
| "step": 330, | |
| "train_ppl": 2.842827 | |
| }, | |
| { | |
| "ce_loss": 1.0389, | |
| "epoch": 0.04919782227286704, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.941369536028644e-05, | |
| "loss": 1.0389, | |
| "mean_token_accuracy": 0.7651800148189067, | |
| "num_tokens": 25130726.0, | |
| "step": 340, | |
| "train_ppl": 2.826159 | |
| }, | |
| { | |
| "ce_loss": 1.0548, | |
| "epoch": 0.05064481704559842, | |
| "grad_norm": 0.96484375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.9368939280918995e-05, | |
| "loss": 1.0548, | |
| "mean_token_accuracy": 0.7646659754216671, | |
| "num_tokens": 25862673.0, | |
| "step": 350, | |
| "train_ppl": 2.871468 | |
| }, | |
| { | |
| "ce_loss": 1.0698, | |
| "epoch": 0.05209181181832981, | |
| "grad_norm": 1.1484375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.9324183201551544e-05, | |
| "loss": 1.0698, | |
| "mean_token_accuracy": 0.763071033358574, | |
| "num_tokens": 26609121.0, | |
| "step": 360, | |
| "train_ppl": 2.914941 | |
| }, | |
| { | |
| "ce_loss": 1.0739, | |
| "epoch": 0.05353880659106119, | |
| "grad_norm": 1.3125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.92794271221841e-05, | |
| "loss": 1.0739, | |
| "mean_token_accuracy": 0.759658782184124, | |
| "num_tokens": 27343011.0, | |
| "step": 370, | |
| "train_ppl": 2.926805 | |
| }, | |
| { | |
| "ce_loss": 1.0897, | |
| "epoch": 0.05498580136379257, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.923467104281665e-05, | |
| "loss": 1.0897, | |
| "mean_token_accuracy": 0.7550988748669625, | |
| "num_tokens": 28067081.0, | |
| "step": 380, | |
| "train_ppl": 2.973326 | |
| }, | |
| { | |
| "ce_loss": 1.0626, | |
| "epoch": 0.05643279613652396, | |
| "grad_norm": 1.203125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.91899149634492e-05, | |
| "loss": 1.0626, | |
| "mean_token_accuracy": 0.757635698467493, | |
| "num_tokens": 28798187.0, | |
| "step": 390, | |
| "train_ppl": 2.893869 | |
| }, | |
| { | |
| "ce_loss": 1.036, | |
| "epoch": 0.05787979090925534, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.9145158884081757e-05, | |
| "loss": 1.036, | |
| "mean_token_accuracy": 0.7649780534207821, | |
| "num_tokens": 29531903.0, | |
| "step": 400, | |
| "train_ppl": 2.817834 | |
| }, | |
| { | |
| "ce_loss": 1.0533, | |
| "epoch": 0.059326785681986724, | |
| "grad_norm": 0.94140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.9100402804714306e-05, | |
| "loss": 1.0533, | |
| "mean_token_accuracy": 0.760666860640049, | |
| "num_tokens": 30241613.0, | |
| "step": 410, | |
| "train_ppl": 2.867077 | |
| }, | |
| { | |
| "ce_loss": 0.9798, | |
| "epoch": 0.06077378045471811, | |
| "grad_norm": 1.1484375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.9055646725346862e-05, | |
| "loss": 0.9798, | |
| "mean_token_accuracy": 0.7770380131900311, | |
| "num_tokens": 31009377.0, | |
| "step": 420, | |
| "train_ppl": 2.663858 | |
| }, | |
| { | |
| "ce_loss": 1.0212, | |
| "epoch": 0.06222077522744949, | |
| "grad_norm": 1.1953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.9010890645979414e-05, | |
| "loss": 1.0212, | |
| "mean_token_accuracy": 0.7705600343644619, | |
| "num_tokens": 31733086.0, | |
| "step": 430, | |
| "train_ppl": 2.77655 | |
| }, | |
| { | |
| "ce_loss": 1.0513, | |
| "epoch": 0.06366777000018087, | |
| "grad_norm": 1.125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.8966134566611963e-05, | |
| "loss": 1.0513, | |
| "mean_token_accuracy": 0.7623658269643784, | |
| "num_tokens": 32494212.0, | |
| "step": 440, | |
| "train_ppl": 2.861398 | |
| }, | |
| { | |
| "ce_loss": 1.0261, | |
| "epoch": 0.06511476477291225, | |
| "grad_norm": 0.99609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.892137848724452e-05, | |
| "loss": 1.0261, | |
| "mean_token_accuracy": 0.766685140132904, | |
| "num_tokens": 33249862.0, | |
| "step": 450, | |
| "train_ppl": 2.790203 | |
| }, | |
| { | |
| "ce_loss": 1.0145, | |
| "epoch": 0.06656175954564364, | |
| "grad_norm": 1.28125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.8876622407877068e-05, | |
| "loss": 1.0145, | |
| "mean_token_accuracy": 0.7710323743522167, | |
| "num_tokens": 33978600.0, | |
| "step": 460, | |
| "train_ppl": 2.757857 | |
| }, | |
| { | |
| "ce_loss": 1.0187, | |
| "epoch": 0.06800875431837503, | |
| "grad_norm": 1.171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.8831866328509624e-05, | |
| "loss": 1.0187, | |
| "mean_token_accuracy": 0.7671968981623649, | |
| "num_tokens": 34723642.0, | |
| "step": 470, | |
| "train_ppl": 2.76952 | |
| }, | |
| { | |
| "ce_loss": 1.0289, | |
| "epoch": 0.06945574909110641, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.8787110249142176e-05, | |
| "loss": 1.0289, | |
| "mean_token_accuracy": 0.7625186502933502, | |
| "num_tokens": 35439133.0, | |
| "step": 480, | |
| "train_ppl": 2.797885 | |
| }, | |
| { | |
| "ce_loss": 1.0018, | |
| "epoch": 0.0709027438638378, | |
| "grad_norm": 0.9609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.8742354169774726e-05, | |
| "loss": 1.0018, | |
| "mean_token_accuracy": 0.7706348761916161, | |
| "num_tokens": 36184470.0, | |
| "step": 490, | |
| "train_ppl": 2.723119 | |
| }, | |
| { | |
| "ce_loss": 1.023, | |
| "epoch": 0.07234973863656917, | |
| "grad_norm": 1.1484375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.869759809040728e-05, | |
| "loss": 1.023, | |
| "mean_token_accuracy": 0.7653927527368068, | |
| "num_tokens": 36919930.0, | |
| "step": 500, | |
| "train_ppl": 2.781612 | |
| }, | |
| { | |
| "ce_loss": 1.0274, | |
| "epoch": 0.07379673340930056, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.8652842011039834e-05, | |
| "loss": 1.0274, | |
| "mean_token_accuracy": 0.7650810860097408, | |
| "num_tokens": 37645758.0, | |
| "step": 510, | |
| "train_ppl": 2.793777 | |
| }, | |
| { | |
| "ce_loss": 1.0478, | |
| "epoch": 0.07524372818203194, | |
| "grad_norm": 1.1328125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.8608085931672386e-05, | |
| "loss": 1.0478, | |
| "mean_token_accuracy": 0.7612765856087208, | |
| "num_tokens": 38363698.0, | |
| "step": 520, | |
| "train_ppl": 2.85138 | |
| }, | |
| { | |
| "ce_loss": 1.0149, | |
| "epoch": 0.07669072295476333, | |
| "grad_norm": 0.96875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.856332985230494e-05, | |
| "loss": 1.0149, | |
| "mean_token_accuracy": 0.7682214416563511, | |
| "num_tokens": 39095412.0, | |
| "step": 530, | |
| "train_ppl": 2.759008 | |
| }, | |
| { | |
| "ce_loss": 1.0218, | |
| "epoch": 0.07813771772749471, | |
| "grad_norm": 1.0, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.8518573772937495e-05, | |
| "loss": 1.0218, | |
| "mean_token_accuracy": 0.7704101949930191, | |
| "num_tokens": 39877031.0, | |
| "step": 540, | |
| "train_ppl": 2.778117 | |
| }, | |
| { | |
| "ce_loss": 1.0751, | |
| "epoch": 0.0795847125002261, | |
| "grad_norm": 1.171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.8473817693570044e-05, | |
| "loss": 1.0751, | |
| "mean_token_accuracy": 0.7600487649440766, | |
| "num_tokens": 40593628.0, | |
| "step": 550, | |
| "train_ppl": 2.930418 | |
| }, | |
| { | |
| "ce_loss": 0.9919, | |
| "epoch": 0.08103170727295747, | |
| "grad_norm": 0.9609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.8429061614202596e-05, | |
| "loss": 0.9919, | |
| "mean_token_accuracy": 0.7756079971790314, | |
| "num_tokens": 41350737.0, | |
| "step": 560, | |
| "train_ppl": 2.696299 | |
| }, | |
| { | |
| "ce_loss": 1.0013, | |
| "epoch": 0.08247870204568886, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.838430553483515e-05, | |
| "loss": 1.0013, | |
| "mean_token_accuracy": 0.768417052924633, | |
| "num_tokens": 42091923.0, | |
| "step": 570, | |
| "train_ppl": 2.721766 | |
| }, | |
| { | |
| "ce_loss": 1.0212, | |
| "epoch": 0.08392569681842024, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.83395494554677e-05, | |
| "loss": 1.0212, | |
| "mean_token_accuracy": 0.7705964192748069, | |
| "num_tokens": 42843505.0, | |
| "step": 580, | |
| "train_ppl": 2.776561 | |
| }, | |
| { | |
| "ce_loss": 0.9852, | |
| "epoch": 0.08537269159115163, | |
| "grad_norm": 0.98828125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.8294793376100257e-05, | |
| "loss": 0.9852, | |
| "mean_token_accuracy": 0.7744002252817154, | |
| "num_tokens": 43582786.0, | |
| "step": 590, | |
| "train_ppl": 2.678277 | |
| }, | |
| { | |
| "ce_loss": 1.0398, | |
| "epoch": 0.08681968636388301, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.8250037296732806e-05, | |
| "loss": 1.0398, | |
| "mean_token_accuracy": 0.7641379170119762, | |
| "num_tokens": 44305457.0, | |
| "step": 600, | |
| "train_ppl": 2.828777 | |
| }, | |
| { | |
| "ce_loss": 1.0506, | |
| "epoch": 0.0882666811366144, | |
| "grad_norm": 0.96875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.8205281217365358e-05, | |
| "loss": 1.0506, | |
| "mean_token_accuracy": 0.7625304482877254, | |
| "num_tokens": 45041194.0, | |
| "step": 610, | |
| "train_ppl": 2.859436 | |
| }, | |
| { | |
| "ce_loss": 1.0399, | |
| "epoch": 0.08971367590934577, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.8160525137997914e-05, | |
| "loss": 1.0399, | |
| "mean_token_accuracy": 0.7632023870944977, | |
| "num_tokens": 45759428.0, | |
| "step": 620, | |
| "train_ppl": 2.828851 | |
| }, | |
| { | |
| "ce_loss": 0.9818, | |
| "epoch": 0.09116067068207716, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.8115769058630463e-05, | |
| "loss": 0.9818, | |
| "mean_token_accuracy": 0.7739991441369056, | |
| "num_tokens": 46539074.0, | |
| "step": 630, | |
| "train_ppl": 2.669149 | |
| }, | |
| { | |
| "ce_loss": 1.0629, | |
| "epoch": 0.09260766545480854, | |
| "grad_norm": 1.3671875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.807101297926302e-05, | |
| "loss": 1.0629, | |
| "mean_token_accuracy": 0.7601286731660366, | |
| "num_tokens": 47260819.0, | |
| "step": 640, | |
| "train_ppl": 2.894784 | |
| }, | |
| { | |
| "ce_loss": 1.0038, | |
| "epoch": 0.09405466022753993, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.802625689989557e-05, | |
| "loss": 1.0038, | |
| "mean_token_accuracy": 0.77047905549407, | |
| "num_tokens": 48047185.0, | |
| "step": 650, | |
| "train_ppl": 2.728604 | |
| }, | |
| { | |
| "ce_loss": 0.9987, | |
| "epoch": 0.09550165500027132, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.798150082052812e-05, | |
| "loss": 0.9987, | |
| "mean_token_accuracy": 0.7709697797894478, | |
| "num_tokens": 48790335.0, | |
| "step": 660, | |
| "train_ppl": 2.714848 | |
| }, | |
| { | |
| "ce_loss": 1.0216, | |
| "epoch": 0.0969486497730027, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.7936744741160676e-05, | |
| "loss": 1.0216, | |
| "mean_token_accuracy": 0.7681831575930118, | |
| "num_tokens": 49512949.0, | |
| "step": 670, | |
| "train_ppl": 2.777644 | |
| }, | |
| { | |
| "ce_loss": 1.0012, | |
| "epoch": 0.09839564454573407, | |
| "grad_norm": 1.15625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.7891988661793225e-05, | |
| "loss": 1.0012, | |
| "mean_token_accuracy": 0.7718318410217762, | |
| "num_tokens": 50255708.0, | |
| "step": 680, | |
| "train_ppl": 2.721635 | |
| }, | |
| { | |
| "ce_loss": 1.0218, | |
| "epoch": 0.09984263931846546, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.784723258242578e-05, | |
| "loss": 1.0218, | |
| "mean_token_accuracy": 0.7731546863913537, | |
| "num_tokens": 51030898.0, | |
| "step": 690, | |
| "train_ppl": 2.778237 | |
| }, | |
| { | |
| "ce_loss": 1.0546, | |
| "epoch": 0.10128963409119685, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.7802476503058334e-05, | |
| "loss": 1.0546, | |
| "mean_token_accuracy": 0.7618527382612228, | |
| "num_tokens": 51766323.0, | |
| "step": 700, | |
| "train_ppl": 2.870824 | |
| }, | |
| { | |
| "ce_loss": 1.0146, | |
| "epoch": 0.10273662886392823, | |
| "grad_norm": 1.2109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.7757720423690883e-05, | |
| "loss": 1.0146, | |
| "mean_token_accuracy": 0.7683967478573323, | |
| "num_tokens": 52478018.0, | |
| "step": 710, | |
| "train_ppl": 2.758134 | |
| }, | |
| { | |
| "ce_loss": 0.9898, | |
| "epoch": 0.10418362363665962, | |
| "grad_norm": 1.2578125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.771296434432344e-05, | |
| "loss": 0.9898, | |
| "mean_token_accuracy": 0.7749556273221969, | |
| "num_tokens": 53197381.0, | |
| "step": 720, | |
| "train_ppl": 2.690634 | |
| }, | |
| { | |
| "ce_loss": 1.0148, | |
| "epoch": 0.105630618409391, | |
| "grad_norm": 1.3828125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.766820826495599e-05, | |
| "loss": 1.0148, | |
| "mean_token_accuracy": 0.7660286217927933, | |
| "num_tokens": 53959271.0, | |
| "step": 730, | |
| "train_ppl": 2.758879 | |
| }, | |
| { | |
| "ce_loss": 0.9988, | |
| "epoch": 0.10707761318212237, | |
| "grad_norm": 1.2890625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.7623452185588543e-05, | |
| "loss": 0.9988, | |
| "mean_token_accuracy": 0.7756357662379741, | |
| "num_tokens": 54734873.0, | |
| "step": 740, | |
| "train_ppl": 2.715152 | |
| }, | |
| { | |
| "ce_loss": 0.9886, | |
| "epoch": 0.10852460795485376, | |
| "grad_norm": 1.25, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.7578696106221096e-05, | |
| "loss": 0.9886, | |
| "mean_token_accuracy": 0.7769335299730301, | |
| "num_tokens": 55488727.0, | |
| "step": 750, | |
| "train_ppl": 2.687502 | |
| }, | |
| { | |
| "ce_loss": 1.0076, | |
| "epoch": 0.10997160272758515, | |
| "grad_norm": 0.9296875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.753394002685365e-05, | |
| "loss": 1.0076, | |
| "mean_token_accuracy": 0.7681085780262947, | |
| "num_tokens": 56208627.0, | |
| "step": 760, | |
| "train_ppl": 2.739055 | |
| }, | |
| { | |
| "ce_loss": 0.9727, | |
| "epoch": 0.11141859750031653, | |
| "grad_norm": 1.375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.74891839474862e-05, | |
| "loss": 0.9727, | |
| "mean_token_accuracy": 0.7748353876173496, | |
| "num_tokens": 56980088.0, | |
| "step": 770, | |
| "train_ppl": 2.645072 | |
| }, | |
| { | |
| "ce_loss": 0.9921, | |
| "epoch": 0.11286559227304792, | |
| "grad_norm": 0.9609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.7444427868118753e-05, | |
| "loss": 0.9921, | |
| "mean_token_accuracy": 0.7719174005091191, | |
| "num_tokens": 57698460.0, | |
| "step": 780, | |
| "train_ppl": 2.697013 | |
| }, | |
| { | |
| "ce_loss": 1.0101, | |
| "epoch": 0.11431258704577929, | |
| "grad_norm": 0.98828125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.7399671788751306e-05, | |
| "loss": 1.0101, | |
| "mean_token_accuracy": 0.7697246864438057, | |
| "num_tokens": 58420421.0, | |
| "step": 790, | |
| "train_ppl": 2.74584 | |
| }, | |
| { | |
| "ce_loss": 1.0296, | |
| "epoch": 0.11575958181851068, | |
| "grad_norm": 1.0, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.7354915709383858e-05, | |
| "loss": 1.0296, | |
| "mean_token_accuracy": 0.7663743153214455, | |
| "num_tokens": 59148535.0, | |
| "step": 800, | |
| "train_ppl": 2.80003 | |
| }, | |
| { | |
| "ce_loss": 0.9826, | |
| "epoch": 0.11720657659124206, | |
| "grad_norm": 1.1953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.7310159630016414e-05, | |
| "loss": 0.9826, | |
| "mean_token_accuracy": 0.7738265834748745, | |
| "num_tokens": 59886300.0, | |
| "step": 810, | |
| "train_ppl": 2.67137 | |
| }, | |
| { | |
| "ce_loss": 0.9979, | |
| "epoch": 0.11865357136397345, | |
| "grad_norm": 0.953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.7265403550648963e-05, | |
| "loss": 0.9979, | |
| "mean_token_accuracy": 0.7731278233230114, | |
| "num_tokens": 60616165.0, | |
| "step": 820, | |
| "train_ppl": 2.712621 | |
| }, | |
| { | |
| "ce_loss": 1.001, | |
| "epoch": 0.12010056613670483, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.7220647471281515e-05, | |
| "loss": 1.001, | |
| "mean_token_accuracy": 0.7734205923974514, | |
| "num_tokens": 61333780.0, | |
| "step": 830, | |
| "train_ppl": 2.720872 | |
| }, | |
| { | |
| "ce_loss": 0.9622, | |
| "epoch": 0.12154756090943622, | |
| "grad_norm": 0.96875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.717589139191407e-05, | |
| "loss": 0.9622, | |
| "mean_token_accuracy": 0.7805940173566341, | |
| "num_tokens": 62084399.0, | |
| "step": 840, | |
| "train_ppl": 2.617573 | |
| }, | |
| { | |
| "ce_loss": 1.0292, | |
| "epoch": 0.12299455568216759, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.713113531254662e-05, | |
| "loss": 1.0292, | |
| "mean_token_accuracy": 0.7698862083256245, | |
| "num_tokens": 62786252.0, | |
| "step": 850, | |
| "train_ppl": 2.798803 | |
| }, | |
| { | |
| "ce_loss": 0.9863, | |
| "epoch": 0.12444155045489898, | |
| "grad_norm": 0.94921875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.7086379233179176e-05, | |
| "loss": 0.9863, | |
| "mean_token_accuracy": 0.7744859166443347, | |
| "num_tokens": 63552303.0, | |
| "step": 860, | |
| "train_ppl": 2.681383 | |
| }, | |
| { | |
| "ce_loss": 1.0463, | |
| "epoch": 0.12588854522763038, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.7041623153811725e-05, | |
| "loss": 1.0463, | |
| "mean_token_accuracy": 0.7598242215812206, | |
| "num_tokens": 64291902.0, | |
| "step": 870, | |
| "train_ppl": 2.846986 | |
| }, | |
| { | |
| "ce_loss": 1.0143, | |
| "epoch": 0.12733554000036174, | |
| "grad_norm": 1.1171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6996867074444278e-05, | |
| "loss": 1.0143, | |
| "mean_token_accuracy": 0.7722109064459801, | |
| "num_tokens": 65062010.0, | |
| "step": 880, | |
| "train_ppl": 2.757514 | |
| }, | |
| { | |
| "ce_loss": 0.9824, | |
| "epoch": 0.12878253477309312, | |
| "grad_norm": 1.1328125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6952110995076834e-05, | |
| "loss": 0.9824, | |
| "mean_token_accuracy": 0.7738293096423149, | |
| "num_tokens": 65801609.0, | |
| "step": 890, | |
| "train_ppl": 2.67092 | |
| }, | |
| { | |
| "ce_loss": 1.0333, | |
| "epoch": 0.1302295295458245, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6907354915709383e-05, | |
| "loss": 1.0333, | |
| "mean_token_accuracy": 0.7661075979471207, | |
| "num_tokens": 66511678.0, | |
| "step": 900, | |
| "train_ppl": 2.810267 | |
| }, | |
| { | |
| "ce_loss": 1.0035, | |
| "epoch": 0.1316765243185559, | |
| "grad_norm": 1.1328125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.686259883634194e-05, | |
| "loss": 1.0035, | |
| "mean_token_accuracy": 0.7725445240736007, | |
| "num_tokens": 67237118.0, | |
| "step": 910, | |
| "train_ppl": 2.727891 | |
| }, | |
| { | |
| "ce_loss": 1.0143, | |
| "epoch": 0.13312351909128728, | |
| "grad_norm": 0.95703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.681784275697449e-05, | |
| "loss": 1.0143, | |
| "mean_token_accuracy": 0.770337475836277, | |
| "num_tokens": 67960278.0, | |
| "step": 920, | |
| "train_ppl": 2.757525 | |
| }, | |
| { | |
| "ce_loss": 1.0292, | |
| "epoch": 0.13457051386401866, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.677308667760704e-05, | |
| "loss": 1.0292, | |
| "mean_token_accuracy": 0.7616572365164757, | |
| "num_tokens": 68667137.0, | |
| "step": 930, | |
| "train_ppl": 2.798916 | |
| }, | |
| { | |
| "ce_loss": 0.9922, | |
| "epoch": 0.13601750863675005, | |
| "grad_norm": 0.88671875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6728330598239596e-05, | |
| "loss": 0.9922, | |
| "mean_token_accuracy": 0.7753356233239174, | |
| "num_tokens": 69397579.0, | |
| "step": 940, | |
| "train_ppl": 2.697085 | |
| }, | |
| { | |
| "ce_loss": 1.0193, | |
| "epoch": 0.13746450340948144, | |
| "grad_norm": 1.21875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6683574518872145e-05, | |
| "loss": 1.0193, | |
| "mean_token_accuracy": 0.7674314551055431, | |
| "num_tokens": 70138483.0, | |
| "step": 950, | |
| "train_ppl": 2.771351 | |
| }, | |
| { | |
| "ce_loss": 1.0101, | |
| "epoch": 0.13891149818221282, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.66388184395047e-05, | |
| "loss": 1.0101, | |
| "mean_token_accuracy": 0.7684113517403602, | |
| "num_tokens": 70893702.0, | |
| "step": 960, | |
| "train_ppl": 2.745858 | |
| }, | |
| { | |
| "ce_loss": 0.9906, | |
| "epoch": 0.1403584929549442, | |
| "grad_norm": 1.1171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6594062360137253e-05, | |
| "loss": 0.9906, | |
| "mean_token_accuracy": 0.7723499283194541, | |
| "num_tokens": 71651876.0, | |
| "step": 970, | |
| "train_ppl": 2.692868 | |
| }, | |
| { | |
| "ce_loss": 1.0207, | |
| "epoch": 0.1418054877276756, | |
| "grad_norm": 1.328125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6549306280769806e-05, | |
| "loss": 1.0207, | |
| "mean_token_accuracy": 0.7665747530758381, | |
| "num_tokens": 72377679.0, | |
| "step": 980, | |
| "train_ppl": 2.775166 | |
| }, | |
| { | |
| "ce_loss": 0.9936, | |
| "epoch": 0.14325248250040698, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6504550201402358e-05, | |
| "loss": 0.9936, | |
| "mean_token_accuracy": 0.7710120238363742, | |
| "num_tokens": 73103927.0, | |
| "step": 990, | |
| "train_ppl": 2.700822 | |
| }, | |
| { | |
| "ce_loss": 0.9695, | |
| "epoch": 0.14469947727313834, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.645979412203491e-05, | |
| "loss": 0.9695, | |
| "mean_token_accuracy": 0.7770053826272487, | |
| "num_tokens": 73844957.0, | |
| "step": 1000, | |
| "train_ppl": 2.636754 | |
| }, | |
| { | |
| "ce_loss": 1.0049, | |
| "epoch": 0.14614647204586972, | |
| "grad_norm": 0.96484375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6415038042667463e-05, | |
| "loss": 1.0049, | |
| "mean_token_accuracy": 0.7748589895665645, | |
| "num_tokens": 74603514.0, | |
| "step": 1010, | |
| "train_ppl": 2.731605 | |
| }, | |
| { | |
| "ce_loss": 1.0422, | |
| "epoch": 0.1475934668186011, | |
| "grad_norm": 0.99609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6370281963300015e-05, | |
| "loss": 1.0422, | |
| "mean_token_accuracy": 0.7634790919721126, | |
| "num_tokens": 75341775.0, | |
| "step": 1020, | |
| "train_ppl": 2.835447 | |
| }, | |
| { | |
| "ce_loss": 0.9876, | |
| "epoch": 0.1490404615913325, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.632552588393257e-05, | |
| "loss": 0.9876, | |
| "mean_token_accuracy": 0.7736144475638866, | |
| "num_tokens": 76068700.0, | |
| "step": 1030, | |
| "train_ppl": 2.684756 | |
| }, | |
| { | |
| "ce_loss": 0.9743, | |
| "epoch": 0.15048745636406388, | |
| "grad_norm": 1.328125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.628076980456512e-05, | |
| "loss": 0.9743, | |
| "mean_token_accuracy": 0.7698041521012783, | |
| "num_tokens": 76790471.0, | |
| "step": 1040, | |
| "train_ppl": 2.649441 | |
| }, | |
| { | |
| "ce_loss": 1.0106, | |
| "epoch": 0.15193445113679527, | |
| "grad_norm": 0.953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6236013725197673e-05, | |
| "loss": 1.0106, | |
| "mean_token_accuracy": 0.7718939520418644, | |
| "num_tokens": 77528424.0, | |
| "step": 1050, | |
| "train_ppl": 2.747122 | |
| }, | |
| { | |
| "ce_loss": 0.9585, | |
| "epoch": 0.15338144590952665, | |
| "grad_norm": 0.984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6191257645830225e-05, | |
| "loss": 0.9585, | |
| "mean_token_accuracy": 0.7821242325007915, | |
| "num_tokens": 78282846.0, | |
| "step": 1060, | |
| "train_ppl": 2.607741 | |
| }, | |
| { | |
| "ce_loss": 1.0218, | |
| "epoch": 0.15482844068225804, | |
| "grad_norm": 0.95703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6146501566462778e-05, | |
| "loss": 1.0218, | |
| "mean_token_accuracy": 0.766200902312994, | |
| "num_tokens": 79027597.0, | |
| "step": 1070, | |
| "train_ppl": 2.778107 | |
| }, | |
| { | |
| "ce_loss": 0.9949, | |
| "epoch": 0.15627543545498943, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6101745487095333e-05, | |
| "loss": 0.9949, | |
| "mean_token_accuracy": 0.7705755203962326, | |
| "num_tokens": 79743637.0, | |
| "step": 1080, | |
| "train_ppl": 2.70455 | |
| }, | |
| { | |
| "ce_loss": 1.0277, | |
| "epoch": 0.1577224302277208, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6056989407727882e-05, | |
| "loss": 1.0277, | |
| "mean_token_accuracy": 0.7647506572306156, | |
| "num_tokens": 80473185.0, | |
| "step": 1090, | |
| "train_ppl": 2.794623 | |
| }, | |
| { | |
| "ce_loss": 0.965, | |
| "epoch": 0.1591694250004522, | |
| "grad_norm": 0.97265625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6012233328360435e-05, | |
| "loss": 0.965, | |
| "mean_token_accuracy": 0.7723382718861103, | |
| "num_tokens": 81206214.0, | |
| "step": 1100, | |
| "train_ppl": 2.624738 | |
| }, | |
| { | |
| "ce_loss": 0.988, | |
| "epoch": 0.16061641977318358, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.596747724899299e-05, | |
| "loss": 0.988, | |
| "mean_token_accuracy": 0.7725288093090057, | |
| "num_tokens": 81957112.0, | |
| "step": 1110, | |
| "train_ppl": 2.685843 | |
| }, | |
| { | |
| "ce_loss": 0.9953, | |
| "epoch": 0.16206341454591494, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.592272116962554e-05, | |
| "loss": 0.9953, | |
| "mean_token_accuracy": 0.771150516718626, | |
| "num_tokens": 82713929.0, | |
| "step": 1120, | |
| "train_ppl": 2.705614 | |
| }, | |
| { | |
| "ce_loss": 1.0077, | |
| "epoch": 0.16351040931864633, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.5877965090258096e-05, | |
| "loss": 1.0077, | |
| "mean_token_accuracy": 0.7694192692637444, | |
| "num_tokens": 83463522.0, | |
| "step": 1130, | |
| "train_ppl": 2.739307 | |
| }, | |
| { | |
| "ce_loss": 1.0273, | |
| "epoch": 0.1649574040913777, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.5833209010890648e-05, | |
| "loss": 1.0273, | |
| "mean_token_accuracy": 0.769251874089241, | |
| "num_tokens": 84188031.0, | |
| "step": 1140, | |
| "train_ppl": 2.793589 | |
| }, | |
| { | |
| "ce_loss": 1.0097, | |
| "epoch": 0.1664043988641091, | |
| "grad_norm": 0.953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.5788452931523197e-05, | |
| "loss": 1.0097, | |
| "mean_token_accuracy": 0.7688002400100231, | |
| "num_tokens": 84918572.0, | |
| "step": 1150, | |
| "train_ppl": 2.74465 | |
| }, | |
| { | |
| "ce_loss": 0.9846, | |
| "epoch": 0.16785139363684048, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.5743696852155753e-05, | |
| "loss": 0.9846, | |
| "mean_token_accuracy": 0.7792325161397458, | |
| "num_tokens": 85637924.0, | |
| "step": 1160, | |
| "train_ppl": 2.676852 | |
| }, | |
| { | |
| "ce_loss": 0.971, | |
| "epoch": 0.16929838840957187, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.5698940772788302e-05, | |
| "loss": 0.971, | |
| "mean_token_accuracy": 0.7782729744911194, | |
| "num_tokens": 86375295.0, | |
| "step": 1170, | |
| "train_ppl": 2.640504 | |
| }, | |
| { | |
| "ce_loss": 1.0133, | |
| "epoch": 0.17074538318230326, | |
| "grad_norm": 1.1875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.5654184693420858e-05, | |
| "loss": 1.0133, | |
| "mean_token_accuracy": 0.7730432473123073, | |
| "num_tokens": 87109044.0, | |
| "step": 1180, | |
| "train_ppl": 2.754625 | |
| }, | |
| { | |
| "ce_loss": 0.9703, | |
| "epoch": 0.17219237795503464, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.560942861405341e-05, | |
| "loss": 0.9703, | |
| "mean_token_accuracy": 0.7804669737815857, | |
| "num_tokens": 87823377.0, | |
| "step": 1190, | |
| "train_ppl": 2.638814 | |
| }, | |
| { | |
| "ce_loss": 0.9692, | |
| "epoch": 0.17363937272776603, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.5564672534685963e-05, | |
| "loss": 0.9692, | |
| "mean_token_accuracy": 0.7746523730456829, | |
| "num_tokens": 88551984.0, | |
| "step": 1200, | |
| "train_ppl": 2.635899 | |
| }, | |
| { | |
| "ce_loss": 0.9945, | |
| "epoch": 0.17508636750049741, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.5519916455318515e-05, | |
| "loss": 0.9945, | |
| "mean_token_accuracy": 0.7793050222098827, | |
| "num_tokens": 89293732.0, | |
| "step": 1210, | |
| "train_ppl": 2.703368 | |
| }, | |
| { | |
| "ce_loss": 0.9821, | |
| "epoch": 0.1765333622732288, | |
| "grad_norm": 1.234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.5475160375951068e-05, | |
| "loss": 0.9821, | |
| "mean_token_accuracy": 0.7767940178513527, | |
| "num_tokens": 90009099.0, | |
| "step": 1220, | |
| "train_ppl": 2.670185 | |
| }, | |
| { | |
| "ce_loss": 0.9914, | |
| "epoch": 0.17798035704596016, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.543040429658362e-05, | |
| "loss": 0.9914, | |
| "mean_token_accuracy": 0.7680940054357052, | |
| "num_tokens": 90713440.0, | |
| "step": 1230, | |
| "train_ppl": 2.69505 | |
| }, | |
| { | |
| "ce_loss": 0.9752, | |
| "epoch": 0.17942735181869154, | |
| "grad_norm": 1.1484375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.5385648217216173e-05, | |
| "loss": 0.9752, | |
| "mean_token_accuracy": 0.7775831647217274, | |
| "num_tokens": 91458197.0, | |
| "step": 1240, | |
| "train_ppl": 2.651746 | |
| }, | |
| { | |
| "ce_loss": 0.972, | |
| "epoch": 0.18087434659142293, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.5340892137848725e-05, | |
| "loss": 0.972, | |
| "mean_token_accuracy": 0.7771682500839233, | |
| "num_tokens": 92204785.0, | |
| "step": 1250, | |
| "train_ppl": 2.64311 | |
| }, | |
| { | |
| "ce_loss": 0.9545, | |
| "epoch": 0.18232134136415432, | |
| "grad_norm": 1.1796875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.5296136058481277e-05, | |
| "loss": 0.9545, | |
| "mean_token_accuracy": 0.7803010269999504, | |
| "num_tokens": 92965785.0, | |
| "step": 1260, | |
| "train_ppl": 2.597424 | |
| }, | |
| { | |
| "ce_loss": 0.9658, | |
| "epoch": 0.1837683361368857, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.525137997911383e-05, | |
| "loss": 0.9658, | |
| "mean_token_accuracy": 0.7732729889452458, | |
| "num_tokens": 93749479.0, | |
| "step": 1270, | |
| "train_ppl": 2.626844 | |
| }, | |
| { | |
| "ce_loss": 0.9175, | |
| "epoch": 0.1852153309096171, | |
| "grad_norm": 1.140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.5206623899746382e-05, | |
| "loss": 0.9175, | |
| "mean_token_accuracy": 0.7875691160559655, | |
| "num_tokens": 94490987.0, | |
| "step": 1280, | |
| "train_ppl": 2.50292 | |
| }, | |
| { | |
| "ce_loss": 1.0091, | |
| "epoch": 0.18666232568234847, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.5161867820378935e-05, | |
| "loss": 1.0091, | |
| "mean_token_accuracy": 0.7689063064754009, | |
| "num_tokens": 95239798.0, | |
| "step": 1290, | |
| "train_ppl": 2.74315 | |
| }, | |
| { | |
| "ce_loss": 0.9981, | |
| "epoch": 0.18810932045507986, | |
| "grad_norm": 1.2578125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.511711174101149e-05, | |
| "loss": 0.9981, | |
| "mean_token_accuracy": 0.7733910351991653, | |
| "num_tokens": 95971638.0, | |
| "step": 1300, | |
| "train_ppl": 2.713218 | |
| }, | |
| { | |
| "ce_loss": 0.973, | |
| "epoch": 0.18955631522781125, | |
| "grad_norm": 1.1171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.507235566164404e-05, | |
| "loss": 0.973, | |
| "mean_token_accuracy": 0.7790097333490849, | |
| "num_tokens": 96708517.0, | |
| "step": 1310, | |
| "train_ppl": 2.645934 | |
| }, | |
| { | |
| "ce_loss": 0.994, | |
| "epoch": 0.19100331000054263, | |
| "grad_norm": 0.90625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.5027599582276592e-05, | |
| "loss": 0.994, | |
| "mean_token_accuracy": 0.7691507421433925, | |
| "num_tokens": 97438831.0, | |
| "step": 1320, | |
| "train_ppl": 2.701936 | |
| }, | |
| { | |
| "ce_loss": 0.9829, | |
| "epoch": 0.19245030477327402, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.4982843502909148e-05, | |
| "loss": 0.9829, | |
| "mean_token_accuracy": 0.7720185928046703, | |
| "num_tokens": 98167703.0, | |
| "step": 1330, | |
| "train_ppl": 2.672221 | |
| }, | |
| { | |
| "ce_loss": 1.0042, | |
| "epoch": 0.1938972995460054, | |
| "grad_norm": 1.203125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.4938087423541697e-05, | |
| "loss": 1.0042, | |
| "mean_token_accuracy": 0.773903863132, | |
| "num_tokens": 98916022.0, | |
| "step": 1340, | |
| "train_ppl": 2.72972 | |
| }, | |
| { | |
| "ce_loss": 1.0223, | |
| "epoch": 0.19534429431873676, | |
| "grad_norm": 1.28125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.4893331344174253e-05, | |
| "loss": 1.0223, | |
| "mean_token_accuracy": 0.7680788926780224, | |
| "num_tokens": 99656326.0, | |
| "step": 1350, | |
| "train_ppl": 2.779674 | |
| }, | |
| { | |
| "ce_loss": 1.0159, | |
| "epoch": 0.19679128909146815, | |
| "grad_norm": 1.2578125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.4848575264806802e-05, | |
| "loss": 1.0159, | |
| "mean_token_accuracy": 0.7670142784714699, | |
| "num_tokens": 100366830.0, | |
| "step": 1360, | |
| "train_ppl": 2.761858 | |
| }, | |
| { | |
| "ce_loss": 0.9412, | |
| "epoch": 0.19823828386419953, | |
| "grad_norm": 1.1484375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.4803819185439354e-05, | |
| "loss": 0.9412, | |
| "mean_token_accuracy": 0.7805588349699975, | |
| "num_tokens": 101103405.0, | |
| "step": 1370, | |
| "train_ppl": 2.562954 | |
| }, | |
| { | |
| "ce_loss": 1.0126, | |
| "epoch": 0.19968527863693092, | |
| "grad_norm": 1.1484375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.475906310607191e-05, | |
| "loss": 1.0126, | |
| "mean_token_accuracy": 0.769621242582798, | |
| "num_tokens": 101841805.0, | |
| "step": 1380, | |
| "train_ppl": 2.752685 | |
| }, | |
| { | |
| "ce_loss": 0.9851, | |
| "epoch": 0.2011322734096623, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.471430702670446e-05, | |
| "loss": 0.9851, | |
| "mean_token_accuracy": 0.7694549061357975, | |
| "num_tokens": 102587079.0, | |
| "step": 1390, | |
| "train_ppl": 2.67799 | |
| }, | |
| { | |
| "ce_loss": 1.0044, | |
| "epoch": 0.2025792681823937, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.4669550947337015e-05, | |
| "loss": 1.0044, | |
| "mean_token_accuracy": 0.7683346226811409, | |
| "num_tokens": 103349174.0, | |
| "step": 1400, | |
| "train_ppl": 2.730359 | |
| }, | |
| { | |
| "ce_loss": 0.9611, | |
| "epoch": 0.20402626295512508, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.4624794867969568e-05, | |
| "loss": 0.9611, | |
| "mean_token_accuracy": 0.7769466623663902, | |
| "num_tokens": 104090462.0, | |
| "step": 1410, | |
| "train_ppl": 2.614475 | |
| }, | |
| { | |
| "ce_loss": 0.9999, | |
| "epoch": 0.20547325772785646, | |
| "grad_norm": 1.5625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.458003878860212e-05, | |
| "loss": 0.9999, | |
| "mean_token_accuracy": 0.7739646673202515, | |
| "num_tokens": 104807032.0, | |
| "step": 1420, | |
| "train_ppl": 2.718026 | |
| }, | |
| { | |
| "ce_loss": 0.992, | |
| "epoch": 0.20692025250058785, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.4535282709234672e-05, | |
| "loss": 0.992, | |
| "mean_token_accuracy": 0.7719819858670235, | |
| "num_tokens": 105536067.0, | |
| "step": 1430, | |
| "train_ppl": 2.696496 | |
| }, | |
| { | |
| "ce_loss": 0.965, | |
| "epoch": 0.20836724727331923, | |
| "grad_norm": 1.0703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.4490526629867225e-05, | |
| "loss": 0.965, | |
| "mean_token_accuracy": 0.782091249525547, | |
| "num_tokens": 106292581.0, | |
| "step": 1440, | |
| "train_ppl": 2.624887 | |
| }, | |
| { | |
| "ce_loss": 1.0016, | |
| "epoch": 0.20981424204605062, | |
| "grad_norm": 1.15625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.4445770550499777e-05, | |
| "loss": 1.0016, | |
| "mean_token_accuracy": 0.7689143389463424, | |
| "num_tokens": 107002756.0, | |
| "step": 1450, | |
| "train_ppl": 2.722517 | |
| }, | |
| { | |
| "ce_loss": 0.9808, | |
| "epoch": 0.211261236818782, | |
| "grad_norm": 0.8984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.440101447113233e-05, | |
| "loss": 0.9808, | |
| "mean_token_accuracy": 0.7709385193884373, | |
| "num_tokens": 107735109.0, | |
| "step": 1460, | |
| "train_ppl": 2.666501 | |
| }, | |
| { | |
| "ce_loss": 0.965, | |
| "epoch": 0.21270823159151336, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.4356258391764882e-05, | |
| "loss": 0.965, | |
| "mean_token_accuracy": 0.7816490411758423, | |
| "num_tokens": 108488189.0, | |
| "step": 1470, | |
| "train_ppl": 2.624826 | |
| }, | |
| { | |
| "ce_loss": 0.984, | |
| "epoch": 0.21415522636424475, | |
| "grad_norm": 1.0703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.4311502312397435e-05, | |
| "loss": 0.984, | |
| "mean_token_accuracy": 0.7733917005360127, | |
| "num_tokens": 109227381.0, | |
| "step": 1480, | |
| "train_ppl": 2.675031 | |
| }, | |
| { | |
| "ce_loss": 1.0325, | |
| "epoch": 0.21560222113697614, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.4266746233029987e-05, | |
| "loss": 1.0325, | |
| "mean_token_accuracy": 0.7697164453566074, | |
| "num_tokens": 109967419.0, | |
| "step": 1490, | |
| "train_ppl": 2.808141 | |
| }, | |
| { | |
| "ce_loss": 0.9488, | |
| "epoch": 0.21704921590970752, | |
| "grad_norm": 1.0859375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.422199015366254e-05, | |
| "loss": 0.9488, | |
| "mean_token_accuracy": 0.779134713858366, | |
| "num_tokens": 110728249.0, | |
| "step": 1500, | |
| "train_ppl": 2.582697 | |
| }, | |
| { | |
| "ce_loss": 1.0317, | |
| "epoch": 0.2184962106824389, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.4177234074295092e-05, | |
| "loss": 1.0317, | |
| "mean_token_accuracy": 0.7620711497962475, | |
| "num_tokens": 111457904.0, | |
| "step": 1510, | |
| "train_ppl": 2.805772 | |
| }, | |
| { | |
| "ce_loss": 0.9886, | |
| "epoch": 0.2199432054551703, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.4132477994927648e-05, | |
| "loss": 0.9886, | |
| "mean_token_accuracy": 0.7727661252021789, | |
| "num_tokens": 112189931.0, | |
| "step": 1520, | |
| "train_ppl": 2.687597 | |
| }, | |
| { | |
| "ce_loss": 1.0147, | |
| "epoch": 0.22139020022790168, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.4087721915560197e-05, | |
| "loss": 1.0147, | |
| "mean_token_accuracy": 0.7641719624400138, | |
| "num_tokens": 112953522.0, | |
| "step": 1530, | |
| "train_ppl": 2.758408 | |
| }, | |
| { | |
| "ce_loss": 0.9716, | |
| "epoch": 0.22283719500063306, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.404296583619275e-05, | |
| "loss": 0.9716, | |
| "mean_token_accuracy": 0.7772294074296952, | |
| "num_tokens": 113698414.0, | |
| "step": 1540, | |
| "train_ppl": 2.642101 | |
| }, | |
| { | |
| "ce_loss": 0.9623, | |
| "epoch": 0.22428418977336445, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.3998209756825302e-05, | |
| "loss": 0.9623, | |
| "mean_token_accuracy": 0.7757225722074509, | |
| "num_tokens": 114430630.0, | |
| "step": 1550, | |
| "train_ppl": 2.617647 | |
| }, | |
| { | |
| "ce_loss": 0.997, | |
| "epoch": 0.22573118454609584, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.3953453677457854e-05, | |
| "loss": 0.997, | |
| "mean_token_accuracy": 0.7703205697238446, | |
| "num_tokens": 115166141.0, | |
| "step": 1560, | |
| "train_ppl": 2.710057 | |
| }, | |
| { | |
| "ce_loss": 0.9953, | |
| "epoch": 0.22717817931882722, | |
| "grad_norm": 1.4609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.390869759809041e-05, | |
| "loss": 0.9953, | |
| "mean_token_accuracy": 0.771430192887783, | |
| "num_tokens": 115889580.0, | |
| "step": 1570, | |
| "train_ppl": 2.705503 | |
| }, | |
| { | |
| "ce_loss": 0.9531, | |
| "epoch": 0.22862517409155858, | |
| "grad_norm": 1.1171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.386394151872296e-05, | |
| "loss": 0.9531, | |
| "mean_token_accuracy": 0.781104639172554, | |
| "num_tokens": 116629845.0, | |
| "step": 1580, | |
| "train_ppl": 2.593619 | |
| }, | |
| { | |
| "ce_loss": 0.9679, | |
| "epoch": 0.23007216886428997, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.381918543935551e-05, | |
| "loss": 0.9679, | |
| "mean_token_accuracy": 0.7786240108311177, | |
| "num_tokens": 117372885.0, | |
| "step": 1590, | |
| "train_ppl": 2.632371 | |
| }, | |
| { | |
| "ce_loss": 0.9785, | |
| "epoch": 0.23151916363702135, | |
| "grad_norm": 1.4296875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.3774429359988067e-05, | |
| "loss": 0.9785, | |
| "mean_token_accuracy": 0.7776103042066097, | |
| "num_tokens": 118132367.0, | |
| "step": 1600, | |
| "train_ppl": 2.66055 | |
| }, | |
| { | |
| "ce_loss": 0.9715, | |
| "epoch": 0.23296615840975274, | |
| "grad_norm": 1.1328125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.3729673280620616e-05, | |
| "loss": 0.9715, | |
| "mean_token_accuracy": 0.7777374930679798, | |
| "num_tokens": 118846692.0, | |
| "step": 1610, | |
| "train_ppl": 2.641897 | |
| }, | |
| { | |
| "ce_loss": 0.9917, | |
| "epoch": 0.23441315318248412, | |
| "grad_norm": 1.0, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.3684917201253172e-05, | |
| "loss": 0.9917, | |
| "mean_token_accuracy": 0.7717310026288032, | |
| "num_tokens": 119577822.0, | |
| "step": 1620, | |
| "train_ppl": 2.695707 | |
| }, | |
| { | |
| "ce_loss": 1.0171, | |
| "epoch": 0.2358601479552155, | |
| "grad_norm": 1.3125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.3640161121885725e-05, | |
| "loss": 1.0171, | |
| "mean_token_accuracy": 0.7664790794253349, | |
| "num_tokens": 120308082.0, | |
| "step": 1630, | |
| "train_ppl": 2.765049 | |
| }, | |
| { | |
| "ce_loss": 0.9736, | |
| "epoch": 0.2373071427279469, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.3595405042518274e-05, | |
| "loss": 0.9736, | |
| "mean_token_accuracy": 0.7768724001944065, | |
| "num_tokens": 121049818.0, | |
| "step": 1640, | |
| "train_ppl": 2.647552 | |
| }, | |
| { | |
| "ce_loss": 0.9504, | |
| "epoch": 0.23875413750067828, | |
| "grad_norm": 1.0859375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.355064896315083e-05, | |
| "loss": 0.9504, | |
| "mean_token_accuracy": 0.783089691400528, | |
| "num_tokens": 121788637.0, | |
| "step": 1650, | |
| "train_ppl": 2.586798 | |
| }, | |
| { | |
| "ce_loss": 0.9677, | |
| "epoch": 0.24020113227340967, | |
| "grad_norm": 1.0, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.350589288378338e-05, | |
| "loss": 0.9677, | |
| "mean_token_accuracy": 0.7775506429374218, | |
| "num_tokens": 122522757.0, | |
| "step": 1660, | |
| "train_ppl": 2.63188 | |
| }, | |
| { | |
| "ce_loss": 0.9579, | |
| "epoch": 0.24164812704614105, | |
| "grad_norm": 1.0859375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.3461136804415935e-05, | |
| "loss": 0.9579, | |
| "mean_token_accuracy": 0.7754926040768624, | |
| "num_tokens": 123241955.0, | |
| "step": 1670, | |
| "train_ppl": 2.606329 | |
| }, | |
| { | |
| "ce_loss": 0.9865, | |
| "epoch": 0.24309512181887244, | |
| "grad_norm": 0.984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.3416380725048487e-05, | |
| "loss": 0.9865, | |
| "mean_token_accuracy": 0.7741681657731533, | |
| "num_tokens": 123980600.0, | |
| "step": 1680, | |
| "train_ppl": 2.681846 | |
| }, | |
| { | |
| "ce_loss": 1.0253, | |
| "epoch": 0.24454211659160383, | |
| "grad_norm": 0.93359375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.337162464568104e-05, | |
| "loss": 1.0253, | |
| "mean_token_accuracy": 0.7667008370161057, | |
| "num_tokens": 124695571.0, | |
| "step": 1690, | |
| "train_ppl": 2.787846 | |
| }, | |
| { | |
| "ce_loss": 0.9638, | |
| "epoch": 0.24598911136433518, | |
| "grad_norm": 0.9375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.3326868566313592e-05, | |
| "loss": 0.9638, | |
| "mean_token_accuracy": 0.7810881577432156, | |
| "num_tokens": 125462307.0, | |
| "step": 1700, | |
| "train_ppl": 2.621706 | |
| }, | |
| { | |
| "ce_loss": 1.0031, | |
| "epoch": 0.24743610613706657, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.3282112486946144e-05, | |
| "loss": 1.0031, | |
| "mean_token_accuracy": 0.7722915470600128, | |
| "num_tokens": 126188660.0, | |
| "step": 1710, | |
| "train_ppl": 2.726587 | |
| }, | |
| { | |
| "ce_loss": 0.9951, | |
| "epoch": 0.24888310090979796, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.3237356407578697e-05, | |
| "loss": 0.9951, | |
| "mean_token_accuracy": 0.7689005501568318, | |
| "num_tokens": 126922149.0, | |
| "step": 1720, | |
| "train_ppl": 2.704929 | |
| }, | |
| { | |
| "ce_loss": 0.968, | |
| "epoch": 0.25033009568252934, | |
| "grad_norm": 1.1484375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.319260032821125e-05, | |
| "loss": 0.968, | |
| "mean_token_accuracy": 0.7733873896300792, | |
| "num_tokens": 127665260.0, | |
| "step": 1730, | |
| "train_ppl": 2.632612 | |
| }, | |
| { | |
| "ce_loss": 0.951, | |
| "epoch": 0.25177709045526075, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.31478442488438e-05, | |
| "loss": 0.951, | |
| "mean_token_accuracy": 0.7792448908090591, | |
| "num_tokens": 128389924.0, | |
| "step": 1740, | |
| "train_ppl": 2.58818 | |
| }, | |
| { | |
| "ce_loss": 0.9992, | |
| "epoch": 0.2532240852279921, | |
| "grad_norm": 1.1640625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.3103088169476354e-05, | |
| "loss": 0.9992, | |
| "mean_token_accuracy": 0.7671849623322486, | |
| "num_tokens": 129141013.0, | |
| "step": 1750, | |
| "train_ppl": 2.716049 | |
| }, | |
| { | |
| "ce_loss": 0.9825, | |
| "epoch": 0.25467108000072347, | |
| "grad_norm": 0.9375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.3058332090108907e-05, | |
| "loss": 0.9825, | |
| "mean_token_accuracy": 0.7744820192456245, | |
| "num_tokens": 129895565.0, | |
| "step": 1760, | |
| "train_ppl": 2.671033 | |
| }, | |
| { | |
| "ce_loss": 1.0052, | |
| "epoch": 0.2561180747734549, | |
| "grad_norm": 1.1875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.301357601074146e-05, | |
| "loss": 1.0052, | |
| "mean_token_accuracy": 0.7750261440873146, | |
| "num_tokens": 130621739.0, | |
| "step": 1770, | |
| "train_ppl": 2.73239 | |
| }, | |
| { | |
| "ce_loss": 0.9681, | |
| "epoch": 0.25756506954618624, | |
| "grad_norm": 1.171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.296881993137401e-05, | |
| "loss": 0.9681, | |
| "mean_token_accuracy": 0.7767448596656322, | |
| "num_tokens": 131345170.0, | |
| "step": 1780, | |
| "train_ppl": 2.633028 | |
| }, | |
| { | |
| "ce_loss": 0.9402, | |
| "epoch": 0.25901206431891766, | |
| "grad_norm": 1.1953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.2924063852006567e-05, | |
| "loss": 0.9402, | |
| "mean_token_accuracy": 0.7856816701591015, | |
| "num_tokens": 132065199.0, | |
| "step": 1790, | |
| "train_ppl": 2.560536 | |
| }, | |
| { | |
| "ce_loss": 0.9967, | |
| "epoch": 0.260459059091649, | |
| "grad_norm": 1.1171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.2879307772639116e-05, | |
| "loss": 0.9967, | |
| "mean_token_accuracy": 0.7735986836254597, | |
| "num_tokens": 132781605.0, | |
| "step": 1800, | |
| "train_ppl": 2.709426 | |
| }, | |
| { | |
| "ce_loss": 0.9958, | |
| "epoch": 0.26190605386438043, | |
| "grad_norm": 1.0, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.283455169327167e-05, | |
| "loss": 0.9958, | |
| "mean_token_accuracy": 0.7739541471004486, | |
| "num_tokens": 133519634.0, | |
| "step": 1810, | |
| "train_ppl": 2.706818 | |
| }, | |
| { | |
| "ce_loss": 0.9826, | |
| "epoch": 0.2633530486371118, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.2789795613904225e-05, | |
| "loss": 0.9826, | |
| "mean_token_accuracy": 0.7771935254335404, | |
| "num_tokens": 134253497.0, | |
| "step": 1820, | |
| "train_ppl": 2.671278 | |
| }, | |
| { | |
| "ce_loss": 0.9624, | |
| "epoch": 0.2648000434098432, | |
| "grad_norm": 1.140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.2745039534536774e-05, | |
| "loss": 0.9624, | |
| "mean_token_accuracy": 0.7789321012794972, | |
| "num_tokens": 135020505.0, | |
| "step": 1830, | |
| "train_ppl": 2.618061 | |
| }, | |
| { | |
| "ce_loss": 0.9873, | |
| "epoch": 0.26624703818257456, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.270028345516933e-05, | |
| "loss": 0.9873, | |
| "mean_token_accuracy": 0.7744618967175484, | |
| "num_tokens": 135773285.0, | |
| "step": 1840, | |
| "train_ppl": 2.683909 | |
| }, | |
| { | |
| "ce_loss": 0.9925, | |
| "epoch": 0.26769403295530597, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.265552737580188e-05, | |
| "loss": 0.9925, | |
| "mean_token_accuracy": 0.7759519070386887, | |
| "num_tokens": 136497732.0, | |
| "step": 1850, | |
| "train_ppl": 2.697987 | |
| }, | |
| { | |
| "ce_loss": 0.9889, | |
| "epoch": 0.26914102772803733, | |
| "grad_norm": 1.25, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.261077129643443e-05, | |
| "loss": 0.9889, | |
| "mean_token_accuracy": 0.772041554749012, | |
| "num_tokens": 137175891.0, | |
| "step": 1860, | |
| "train_ppl": 2.688219 | |
| }, | |
| { | |
| "ce_loss": 0.9832, | |
| "epoch": 0.27058802250076874, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.2566015217066987e-05, | |
| "loss": 0.9832, | |
| "mean_token_accuracy": 0.770769814401865, | |
| "num_tokens": 137910825.0, | |
| "step": 1870, | |
| "train_ppl": 2.672975 | |
| }, | |
| { | |
| "ce_loss": 0.9957, | |
| "epoch": 0.2720350172735001, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.2521259137699536e-05, | |
| "loss": 0.9957, | |
| "mean_token_accuracy": 0.7698277346789837, | |
| "num_tokens": 138609576.0, | |
| "step": 1880, | |
| "train_ppl": 2.7066 | |
| }, | |
| { | |
| "ce_loss": 0.9988, | |
| "epoch": 0.27348201204623146, | |
| "grad_norm": 1.0859375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.2476503058332092e-05, | |
| "loss": 0.9988, | |
| "mean_token_accuracy": 0.771542327105999, | |
| "num_tokens": 139318503.0, | |
| "step": 1890, | |
| "train_ppl": 2.714913 | |
| }, | |
| { | |
| "ce_loss": 1.0168, | |
| "epoch": 0.2749290068189629, | |
| "grad_norm": 1.2578125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.2431746978964644e-05, | |
| "loss": 1.0168, | |
| "mean_token_accuracy": 0.7615082763135433, | |
| "num_tokens": 140054302.0, | |
| "step": 1900, | |
| "train_ppl": 2.764403 | |
| }, | |
| { | |
| "ce_loss": 0.983, | |
| "epoch": 0.27637600159169423, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.2386990899597197e-05, | |
| "loss": 0.983, | |
| "mean_token_accuracy": 0.7786808654665947, | |
| "num_tokens": 140797270.0, | |
| "step": 1910, | |
| "train_ppl": 2.67259 | |
| }, | |
| { | |
| "ce_loss": 1.0197, | |
| "epoch": 0.27782299636442565, | |
| "grad_norm": 0.99609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.234223482022975e-05, | |
| "loss": 1.0197, | |
| "mean_token_accuracy": 0.7617739595472812, | |
| "num_tokens": 141527803.0, | |
| "step": 1920, | |
| "train_ppl": 2.772385 | |
| }, | |
| { | |
| "ce_loss": 0.9801, | |
| "epoch": 0.279269991137157, | |
| "grad_norm": 0.94140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.22974787408623e-05, | |
| "loss": 0.9801, | |
| "mean_token_accuracy": 0.7726086884737015, | |
| "num_tokens": 142259241.0, | |
| "step": 1930, | |
| "train_ppl": 2.664847 | |
| }, | |
| { | |
| "ce_loss": 0.9964, | |
| "epoch": 0.2807169859098884, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.2252722661494854e-05, | |
| "loss": 0.9964, | |
| "mean_token_accuracy": 0.7709591925144196, | |
| "num_tokens": 143023815.0, | |
| "step": 1940, | |
| "train_ppl": 2.70848 | |
| }, | |
| { | |
| "ce_loss": 1.002, | |
| "epoch": 0.2821639806826198, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.2207966582127406e-05, | |
| "loss": 1.002, | |
| "mean_token_accuracy": 0.7686372242867947, | |
| "num_tokens": 143780140.0, | |
| "step": 1950, | |
| "train_ppl": 2.723817 | |
| }, | |
| { | |
| "ce_loss": 1.0256, | |
| "epoch": 0.2836109754553512, | |
| "grad_norm": 1.1484375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.216321050275996e-05, | |
| "loss": 1.0256, | |
| "mean_token_accuracy": 0.7672031052410603, | |
| "num_tokens": 144495655.0, | |
| "step": 1960, | |
| "train_ppl": 2.788658 | |
| }, | |
| { | |
| "ce_loss": 1.014, | |
| "epoch": 0.28505797022808255, | |
| "grad_norm": 0.98828125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.211845442339251e-05, | |
| "loss": 1.014, | |
| "mean_token_accuracy": 0.7690494567155838, | |
| "num_tokens": 145192447.0, | |
| "step": 1970, | |
| "train_ppl": 2.756653 | |
| }, | |
| { | |
| "ce_loss": 0.9811, | |
| "epoch": 0.28650496500081396, | |
| "grad_norm": 0.984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.2073698344025064e-05, | |
| "loss": 0.9811, | |
| "mean_token_accuracy": 0.7795913711190223, | |
| "num_tokens": 145925116.0, | |
| "step": 1980, | |
| "train_ppl": 2.667272 | |
| }, | |
| { | |
| "ce_loss": 1.0033, | |
| "epoch": 0.2879519597735453, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.2028942264657616e-05, | |
| "loss": 1.0033, | |
| "mean_token_accuracy": 0.771687439084053, | |
| "num_tokens": 146651269.0, | |
| "step": 1990, | |
| "train_ppl": 2.727271 | |
| }, | |
| { | |
| "ce_loss": 0.9813, | |
| "epoch": 0.2893989545462767, | |
| "grad_norm": 1.3984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.198418618529017e-05, | |
| "loss": 0.9813, | |
| "mean_token_accuracy": 0.7775134235620499, | |
| "num_tokens": 147381768.0, | |
| "step": 2000, | |
| "train_ppl": 2.66782 | |
| }, | |
| { | |
| "ce_loss": 0.9635, | |
| "epoch": 0.2908459493190081, | |
| "grad_norm": 1.0703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.1939430105922724e-05, | |
| "loss": 0.9635, | |
| "mean_token_accuracy": 0.77833351790905, | |
| "num_tokens": 148133098.0, | |
| "step": 2010, | |
| "train_ppl": 2.620909 | |
| }, | |
| { | |
| "ce_loss": 0.9986, | |
| "epoch": 0.29229294409173945, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.1894674026555274e-05, | |
| "loss": 0.9986, | |
| "mean_token_accuracy": 0.768501528352499, | |
| "num_tokens": 148873416.0, | |
| "step": 2020, | |
| "train_ppl": 2.714389 | |
| }, | |
| { | |
| "ce_loss": 0.982, | |
| "epoch": 0.29373993886447086, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.1849917947187826e-05, | |
| "loss": 0.982, | |
| "mean_token_accuracy": 0.7724484153091907, | |
| "num_tokens": 149593131.0, | |
| "step": 2030, | |
| "train_ppl": 2.66977 | |
| }, | |
| { | |
| "ce_loss": 0.9759, | |
| "epoch": 0.2951869336372022, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.180516186782038e-05, | |
| "loss": 0.9759, | |
| "mean_token_accuracy": 0.775026997178793, | |
| "num_tokens": 150341769.0, | |
| "step": 2040, | |
| "train_ppl": 2.653647 | |
| }, | |
| { | |
| "ce_loss": 0.9829, | |
| "epoch": 0.29663392840993363, | |
| "grad_norm": 1.171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.176040578845293e-05, | |
| "loss": 0.9829, | |
| "mean_token_accuracy": 0.7747074596583843, | |
| "num_tokens": 151082730.0, | |
| "step": 2050, | |
| "train_ppl": 2.672224 | |
| }, | |
| { | |
| "ce_loss": 0.9525, | |
| "epoch": 0.298080923182665, | |
| "grad_norm": 0.90625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.1715649709085487e-05, | |
| "loss": 0.9525, | |
| "mean_token_accuracy": 0.7772355630993844, | |
| "num_tokens": 151831662.0, | |
| "step": 2060, | |
| "train_ppl": 2.592082 | |
| }, | |
| { | |
| "ce_loss": 0.9725, | |
| "epoch": 0.2995279179553964, | |
| "grad_norm": 1.171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.1670893629718036e-05, | |
| "loss": 0.9725, | |
| "mean_token_accuracy": 0.778071166574955, | |
| "num_tokens": 152542559.0, | |
| "step": 2070, | |
| "train_ppl": 2.644496 | |
| }, | |
| { | |
| "ce_loss": 0.9505, | |
| "epoch": 0.30097491272812776, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.1626137550350588e-05, | |
| "loss": 0.9505, | |
| "mean_token_accuracy": 0.780910176038742, | |
| "num_tokens": 153266179.0, | |
| "step": 2080, | |
| "train_ppl": 2.586885 | |
| }, | |
| { | |
| "ce_loss": 1.0026, | |
| "epoch": 0.3024219075008592, | |
| "grad_norm": 0.97265625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.1581381470983144e-05, | |
| "loss": 1.0026, | |
| "mean_token_accuracy": 0.7699606984853744, | |
| "num_tokens": 153970933.0, | |
| "step": 2090, | |
| "train_ppl": 2.725251 | |
| }, | |
| { | |
| "ce_loss": 0.9648, | |
| "epoch": 0.30386890227359054, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.1536625391615693e-05, | |
| "loss": 0.9648, | |
| "mean_token_accuracy": 0.7735878027975559, | |
| "num_tokens": 154711094.0, | |
| "step": 2100, | |
| "train_ppl": 2.624383 | |
| }, | |
| { | |
| "ce_loss": 0.9964, | |
| "epoch": 0.3053158970463219, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.149186931224825e-05, | |
| "loss": 0.9964, | |
| "mean_token_accuracy": 0.7693284347653389, | |
| "num_tokens": 155440558.0, | |
| "step": 2110, | |
| "train_ppl": 2.70838 | |
| }, | |
| { | |
| "ce_loss": 0.9726, | |
| "epoch": 0.3067628918190533, | |
| "grad_norm": 0.98046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.14471132328808e-05, | |
| "loss": 0.9726, | |
| "mean_token_accuracy": 0.7746382050216198, | |
| "num_tokens": 156165366.0, | |
| "step": 2120, | |
| "train_ppl": 2.644842 | |
| }, | |
| { | |
| "ce_loss": 0.9639, | |
| "epoch": 0.30820988659178467, | |
| "grad_norm": 0.8984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.1402357153513354e-05, | |
| "loss": 0.9639, | |
| "mean_token_accuracy": 0.7744808107614517, | |
| "num_tokens": 156890899.0, | |
| "step": 2130, | |
| "train_ppl": 2.622018 | |
| }, | |
| { | |
| "ce_loss": 0.9989, | |
| "epoch": 0.3096568813645161, | |
| "grad_norm": 1.125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.1357601074145906e-05, | |
| "loss": 0.9989, | |
| "mean_token_accuracy": 0.767997769266367, | |
| "num_tokens": 157604658.0, | |
| "step": 2140, | |
| "train_ppl": 2.715335 | |
| }, | |
| { | |
| "ce_loss": 0.9718, | |
| "epoch": 0.31110387613724744, | |
| "grad_norm": 1.234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.1312844994778455e-05, | |
| "loss": 0.9718, | |
| "mean_token_accuracy": 0.78013886064291, | |
| "num_tokens": 158336316.0, | |
| "step": 2150, | |
| "train_ppl": 2.642823 | |
| }, | |
| { | |
| "ce_loss": 0.9457, | |
| "epoch": 0.31255087090997885, | |
| "grad_norm": 1.4609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.126808891541101e-05, | |
| "loss": 0.9457, | |
| "mean_token_accuracy": 0.7810127899050713, | |
| "num_tokens": 159052431.0, | |
| "step": 2160, | |
| "train_ppl": 2.57449 | |
| }, | |
| { | |
| "ce_loss": 0.9374, | |
| "epoch": 0.3139978656827102, | |
| "grad_norm": 0.98828125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.1223332836043564e-05, | |
| "loss": 0.9374, | |
| "mean_token_accuracy": 0.7826711490750313, | |
| "num_tokens": 159747771.0, | |
| "step": 2170, | |
| "train_ppl": 2.553444 | |
| }, | |
| { | |
| "ce_loss": 1.0028, | |
| "epoch": 0.3154448604554416, | |
| "grad_norm": 1.1640625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.1178576756676116e-05, | |
| "loss": 1.0028, | |
| "mean_token_accuracy": 0.7743060775101185, | |
| "num_tokens": 160475032.0, | |
| "step": 2180, | |
| "train_ppl": 2.725815 | |
| }, | |
| { | |
| "ce_loss": 0.9964, | |
| "epoch": 0.316891855228173, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.113382067730867e-05, | |
| "loss": 0.9964, | |
| "mean_token_accuracy": 0.7711601614952087, | |
| "num_tokens": 161204515.0, | |
| "step": 2190, | |
| "train_ppl": 2.708637 | |
| }, | |
| { | |
| "ce_loss": 1.0099, | |
| "epoch": 0.3183388500009044, | |
| "grad_norm": 1.0703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.108906459794122e-05, | |
| "loss": 1.0099, | |
| "mean_token_accuracy": 0.7715992897748947, | |
| "num_tokens": 161961019.0, | |
| "step": 2200, | |
| "train_ppl": 2.745375 | |
| }, | |
| { | |
| "ce_loss": 0.9498, | |
| "epoch": 0.31978584477363575, | |
| "grad_norm": 0.90234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.1044308518573773e-05, | |
| "loss": 0.9498, | |
| "mean_token_accuracy": 0.7826919294893742, | |
| "num_tokens": 162710799.0, | |
| "step": 2210, | |
| "train_ppl": 2.58529 | |
| }, | |
| { | |
| "ce_loss": 0.9621, | |
| "epoch": 0.32123283954636717, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0999552439206326e-05, | |
| "loss": 0.9621, | |
| "mean_token_accuracy": 0.775107191503048, | |
| "num_tokens": 163439737.0, | |
| "step": 2220, | |
| "train_ppl": 2.61714 | |
| }, | |
| { | |
| "ce_loss": 0.9943, | |
| "epoch": 0.3226798343190985, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0954796359838878e-05, | |
| "loss": 0.9943, | |
| "mean_token_accuracy": 0.7698855645954609, | |
| "num_tokens": 164145582.0, | |
| "step": 2230, | |
| "train_ppl": 2.702918 | |
| }, | |
| { | |
| "ce_loss": 0.9771, | |
| "epoch": 0.3241268290918299, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.091004028047143e-05, | |
| "loss": 0.9771, | |
| "mean_token_accuracy": 0.7765941433608532, | |
| "num_tokens": 164896393.0, | |
| "step": 2240, | |
| "train_ppl": 2.656623 | |
| }, | |
| { | |
| "ce_loss": 1.0023, | |
| "epoch": 0.3255738238645613, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0865284201103983e-05, | |
| "loss": 1.0023, | |
| "mean_token_accuracy": 0.7708912000060082, | |
| "num_tokens": 165627341.0, | |
| "step": 2250, | |
| "train_ppl": 2.724545 | |
| }, | |
| { | |
| "ce_loss": 0.9689, | |
| "epoch": 0.32702081863729265, | |
| "grad_norm": 1.3125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0820528121736536e-05, | |
| "loss": 0.9689, | |
| "mean_token_accuracy": 0.7807579897344112, | |
| "num_tokens": 166354943.0, | |
| "step": 2260, | |
| "train_ppl": 2.635139 | |
| }, | |
| { | |
| "ce_loss": 1.0493, | |
| "epoch": 0.32846781341002407, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0775772042369088e-05, | |
| "loss": 1.0493, | |
| "mean_token_accuracy": 0.7613647289574146, | |
| "num_tokens": 167066270.0, | |
| "step": 2270, | |
| "train_ppl": 2.855513 | |
| }, | |
| { | |
| "ce_loss": 0.9991, | |
| "epoch": 0.3299148081827554, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0731015963001644e-05, | |
| "loss": 0.9991, | |
| "mean_token_accuracy": 0.7712046861648559, | |
| "num_tokens": 167801986.0, | |
| "step": 2280, | |
| "train_ppl": 2.715823 | |
| }, | |
| { | |
| "ce_loss": 0.9657, | |
| "epoch": 0.33136180295548684, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0686259883634193e-05, | |
| "loss": 0.9657, | |
| "mean_token_accuracy": 0.7770779870450497, | |
| "num_tokens": 168554289.0, | |
| "step": 2290, | |
| "train_ppl": 2.626717 | |
| }, | |
| { | |
| "ce_loss": 0.9849, | |
| "epoch": 0.3328087977282182, | |
| "grad_norm": 0.953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0641503804266745e-05, | |
| "loss": 0.9849, | |
| "mean_token_accuracy": 0.7736143194139004, | |
| "num_tokens": 169286476.0, | |
| "step": 2300, | |
| "train_ppl": 2.677655 | |
| }, | |
| { | |
| "ce_loss": 0.9921, | |
| "epoch": 0.3342557925009496, | |
| "grad_norm": 1.0703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.05967477248993e-05, | |
| "loss": 0.9921, | |
| "mean_token_accuracy": 0.7730519793927669, | |
| "num_tokens": 170017128.0, | |
| "step": 2310, | |
| "train_ppl": 2.696846 | |
| }, | |
| { | |
| "ce_loss": 0.9767, | |
| "epoch": 0.33570278727368097, | |
| "grad_norm": 0.97265625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.055199164553185e-05, | |
| "loss": 0.9767, | |
| "mean_token_accuracy": 0.7729025609791279, | |
| "num_tokens": 170740098.0, | |
| "step": 2320, | |
| "train_ppl": 2.655607 | |
| }, | |
| { | |
| "ce_loss": 0.9937, | |
| "epoch": 0.3371497820464124, | |
| "grad_norm": 0.91796875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0507235566164406e-05, | |
| "loss": 0.9937, | |
| "mean_token_accuracy": 0.7697398900985718, | |
| "num_tokens": 171468647.0, | |
| "step": 2330, | |
| "train_ppl": 2.701241 | |
| }, | |
| { | |
| "ce_loss": 0.9793, | |
| "epoch": 0.33859677681914374, | |
| "grad_norm": 0.85546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0462479486796955e-05, | |
| "loss": 0.9793, | |
| "mean_token_accuracy": 0.7745302498340607, | |
| "num_tokens": 172205055.0, | |
| "step": 2340, | |
| "train_ppl": 2.662539 | |
| }, | |
| { | |
| "ce_loss": 0.9681, | |
| "epoch": 0.3400437715918751, | |
| "grad_norm": 1.1796875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.041772340742951e-05, | |
| "loss": 0.9681, | |
| "mean_token_accuracy": 0.7831182412803173, | |
| "num_tokens": 172927359.0, | |
| "step": 2350, | |
| "train_ppl": 2.633018 | |
| }, | |
| { | |
| "ce_loss": 0.9964, | |
| "epoch": 0.3414907663646065, | |
| "grad_norm": 1.3515625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0372967328062063e-05, | |
| "loss": 0.9964, | |
| "mean_token_accuracy": 0.7754109688103199, | |
| "num_tokens": 173673857.0, | |
| "step": 2360, | |
| "train_ppl": 2.708586 | |
| }, | |
| { | |
| "ce_loss": 0.9587, | |
| "epoch": 0.34293776113733787, | |
| "grad_norm": 0.83203125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0328211248694613e-05, | |
| "loss": 0.9587, | |
| "mean_token_accuracy": 0.779682033509016, | |
| "num_tokens": 174453403.0, | |
| "step": 2370, | |
| "train_ppl": 2.608364 | |
| }, | |
| { | |
| "ce_loss": 0.9886, | |
| "epoch": 0.3443847559100693, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.028345516932717e-05, | |
| "loss": 0.9886, | |
| "mean_token_accuracy": 0.7737836137413978, | |
| "num_tokens": 175185041.0, | |
| "step": 2380, | |
| "train_ppl": 2.687588 | |
| }, | |
| { | |
| "ce_loss": 1.0085, | |
| "epoch": 0.34583175068280064, | |
| "grad_norm": 1.4765625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.023869908995972e-05, | |
| "loss": 1.0085, | |
| "mean_token_accuracy": 0.7715661711990833, | |
| "num_tokens": 175943212.0, | |
| "step": 2390, | |
| "train_ppl": 2.741487 | |
| }, | |
| { | |
| "ce_loss": 0.9599, | |
| "epoch": 0.34727874545553206, | |
| "grad_norm": 1.1484375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0193943010592273e-05, | |
| "loss": 0.9599, | |
| "mean_token_accuracy": 0.7831589214503765, | |
| "num_tokens": 176663659.0, | |
| "step": 2400, | |
| "train_ppl": 2.611419 | |
| }, | |
| { | |
| "ce_loss": 0.9629, | |
| "epoch": 0.3487257402282634, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0149186931224826e-05, | |
| "loss": 0.9629, | |
| "mean_token_accuracy": 0.7757728450000286, | |
| "num_tokens": 177369018.0, | |
| "step": 2410, | |
| "train_ppl": 2.61941 | |
| }, | |
| { | |
| "ce_loss": 1.0039, | |
| "epoch": 0.35017273500099483, | |
| "grad_norm": 0.984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0104430851857378e-05, | |
| "loss": 1.0039, | |
| "mean_token_accuracy": 0.7666012078523636, | |
| "num_tokens": 178089918.0, | |
| "step": 2420, | |
| "train_ppl": 2.728987 | |
| }, | |
| { | |
| "ce_loss": 0.9237, | |
| "epoch": 0.3516197297737262, | |
| "grad_norm": 0.9375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.005967477248993e-05, | |
| "loss": 0.9237, | |
| "mean_token_accuracy": 0.7838417246937752, | |
| "num_tokens": 178829829.0, | |
| "step": 2430, | |
| "train_ppl": 2.518548 | |
| }, | |
| { | |
| "ce_loss": 0.9632, | |
| "epoch": 0.3530667245464576, | |
| "grad_norm": 1.125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0014918693122483e-05, | |
| "loss": 0.9632, | |
| "mean_token_accuracy": 0.7799612589180469, | |
| "num_tokens": 179584153.0, | |
| "step": 2440, | |
| "train_ppl": 2.620184 | |
| }, | |
| { | |
| "ce_loss": 0.9362, | |
| "epoch": 0.35451371931918896, | |
| "grad_norm": 0.9375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.9970162613755035e-05, | |
| "loss": 0.9362, | |
| "mean_token_accuracy": 0.7820769309997558, | |
| "num_tokens": 180331127.0, | |
| "step": 2450, | |
| "train_ppl": 2.550154 | |
| }, | |
| { | |
| "ce_loss": 1.0117, | |
| "epoch": 0.3559607140919203, | |
| "grad_norm": 0.8828125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.9925406534387588e-05, | |
| "loss": 1.0117, | |
| "mean_token_accuracy": 0.771592228859663, | |
| "num_tokens": 181067782.0, | |
| "step": 2460, | |
| "train_ppl": 2.750146 | |
| }, | |
| { | |
| "ce_loss": 0.9859, | |
| "epoch": 0.35740770886465173, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.988065045502014e-05, | |
| "loss": 0.9859, | |
| "mean_token_accuracy": 0.7738970972597599, | |
| "num_tokens": 181793714.0, | |
| "step": 2470, | |
| "train_ppl": 2.680159 | |
| }, | |
| { | |
| "ce_loss": 0.962, | |
| "epoch": 0.3588547036373831, | |
| "grad_norm": 0.96875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.9835894375652693e-05, | |
| "loss": 0.962, | |
| "mean_token_accuracy": 0.7789099134504796, | |
| "num_tokens": 182531886.0, | |
| "step": 2480, | |
| "train_ppl": 2.616999 | |
| }, | |
| { | |
| "ce_loss": 0.9957, | |
| "epoch": 0.3603016984101145, | |
| "grad_norm": 0.953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.9791138296285245e-05, | |
| "loss": 0.9957, | |
| "mean_token_accuracy": 0.7706431902945041, | |
| "num_tokens": 183300557.0, | |
| "step": 2490, | |
| "train_ppl": 2.706542 | |
| }, | |
| { | |
| "ce_loss": 0.96, | |
| "epoch": 0.36174869318284586, | |
| "grad_norm": 1.0703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.97463822169178e-05, | |
| "loss": 0.96, | |
| "mean_token_accuracy": 0.7810012176632881, | |
| "num_tokens": 184029451.0, | |
| "step": 2500, | |
| "train_ppl": 2.611579 | |
| }, | |
| { | |
| "ce_loss": 0.9386, | |
| "epoch": 0.3631956879555773, | |
| "grad_norm": 1.296875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.970162613755035e-05, | |
| "loss": 0.9386, | |
| "mean_token_accuracy": 0.7798774808645248, | |
| "num_tokens": 184746003.0, | |
| "step": 2510, | |
| "train_ppl": 2.556315 | |
| }, | |
| { | |
| "ce_loss": 0.9735, | |
| "epoch": 0.36464268272830863, | |
| "grad_norm": 0.92578125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.9656870058182903e-05, | |
| "loss": 0.9735, | |
| "mean_token_accuracy": 0.7773295849561691, | |
| "num_tokens": 185472125.0, | |
| "step": 2520, | |
| "train_ppl": 2.647223 | |
| }, | |
| { | |
| "ce_loss": 0.9715, | |
| "epoch": 0.36608967750104005, | |
| "grad_norm": 0.859375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.9612113978815455e-05, | |
| "loss": 0.9715, | |
| "mean_token_accuracy": 0.7736013270914555, | |
| "num_tokens": 186174697.0, | |
| "step": 2530, | |
| "train_ppl": 2.641837 | |
| }, | |
| { | |
| "ce_loss": 0.9793, | |
| "epoch": 0.3675366722737714, | |
| "grad_norm": 0.85546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.9567357899448007e-05, | |
| "loss": 0.9793, | |
| "mean_token_accuracy": 0.7726230010390281, | |
| "num_tokens": 186899192.0, | |
| "step": 2540, | |
| "train_ppl": 2.662494 | |
| }, | |
| { | |
| "ce_loss": 0.9658, | |
| "epoch": 0.3689836670465028, | |
| "grad_norm": 0.98046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.9522601820080563e-05, | |
| "loss": 0.9658, | |
| "mean_token_accuracy": 0.7793243020772934, | |
| "num_tokens": 187634580.0, | |
| "step": 2550, | |
| "train_ppl": 2.626758 | |
| }, | |
| { | |
| "ce_loss": 0.965, | |
| "epoch": 0.3704306618192342, | |
| "grad_norm": 0.94140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.9477845740713112e-05, | |
| "loss": 0.965, | |
| "mean_token_accuracy": 0.7768558643758297, | |
| "num_tokens": 188388282.0, | |
| "step": 2560, | |
| "train_ppl": 2.62484 | |
| }, | |
| { | |
| "ce_loss": 0.994, | |
| "epoch": 0.3718776565919656, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.9433089661345668e-05, | |
| "loss": 0.994, | |
| "mean_token_accuracy": 0.7724675111472606, | |
| "num_tokens": 189139246.0, | |
| "step": 2570, | |
| "train_ppl": 2.701906 | |
| }, | |
| { | |
| "ce_loss": 0.9555, | |
| "epoch": 0.37332465136469695, | |
| "grad_norm": 0.9765625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.938833358197822e-05, | |
| "loss": 0.9555, | |
| "mean_token_accuracy": 0.7806055322289467, | |
| "num_tokens": 189883875.0, | |
| "step": 2580, | |
| "train_ppl": 2.599917 | |
| }, | |
| { | |
| "ce_loss": 0.9659, | |
| "epoch": 0.3747716461374283, | |
| "grad_norm": 1.1875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.934357750261077e-05, | |
| "loss": 0.9659, | |
| "mean_token_accuracy": 0.7724411226809025, | |
| "num_tokens": 190614990.0, | |
| "step": 2590, | |
| "train_ppl": 2.627258 | |
| }, | |
| { | |
| "ce_loss": 0.989, | |
| "epoch": 0.3762186409101597, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.9298821423243326e-05, | |
| "loss": 0.989, | |
| "mean_token_accuracy": 0.7706497214734555, | |
| "num_tokens": 191328905.0, | |
| "step": 2600, | |
| "train_ppl": 2.688509 | |
| }, | |
| { | |
| "ce_loss": 0.9799, | |
| "epoch": 0.3776656356828911, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.9254065343875878e-05, | |
| "loss": 0.9799, | |
| "mean_token_accuracy": 0.7754726015031338, | |
| "num_tokens": 192110447.0, | |
| "step": 2610, | |
| "train_ppl": 2.664275 | |
| }, | |
| { | |
| "ce_loss": 0.9918, | |
| "epoch": 0.3791126304556225, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.920930926450843e-05, | |
| "loss": 0.9918, | |
| "mean_token_accuracy": 0.7714382395148277, | |
| "num_tokens": 192833107.0, | |
| "step": 2620, | |
| "train_ppl": 2.696216 | |
| }, | |
| { | |
| "ce_loss": 0.9743, | |
| "epoch": 0.38055962522835385, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.9164553185140983e-05, | |
| "loss": 0.9743, | |
| "mean_token_accuracy": 0.7756662987172603, | |
| "num_tokens": 193562730.0, | |
| "step": 2630, | |
| "train_ppl": 2.649196 | |
| }, | |
| { | |
| "ce_loss": 0.9543, | |
| "epoch": 0.38200662000108526, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.9119797105773532e-05, | |
| "loss": 0.9543, | |
| "mean_token_accuracy": 0.7818400040268898, | |
| "num_tokens": 194291195.0, | |
| "step": 2640, | |
| "train_ppl": 2.596973 | |
| }, | |
| { | |
| "ce_loss": 0.9645, | |
| "epoch": 0.3834536147738166, | |
| "grad_norm": 0.84375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.9075041026406088e-05, | |
| "loss": 0.9645, | |
| "mean_token_accuracy": 0.778757381439209, | |
| "num_tokens": 195035036.0, | |
| "step": 2650, | |
| "train_ppl": 2.623353 | |
| }, | |
| { | |
| "ce_loss": 0.9554, | |
| "epoch": 0.38490060954654803, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.903028494703864e-05, | |
| "loss": 0.9554, | |
| "mean_token_accuracy": 0.7815173707902432, | |
| "num_tokens": 195753802.0, | |
| "step": 2660, | |
| "train_ppl": 2.599595 | |
| }, | |
| { | |
| "ce_loss": 0.9807, | |
| "epoch": 0.3863476043192794, | |
| "grad_norm": 1.1953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8985528867671193e-05, | |
| "loss": 0.9807, | |
| "mean_token_accuracy": 0.7753617249429225, | |
| "num_tokens": 196473205.0, | |
| "step": 2670, | |
| "train_ppl": 2.666363 | |
| }, | |
| { | |
| "ce_loss": 1.0086, | |
| "epoch": 0.3877945990920108, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8940772788303745e-05, | |
| "loss": 1.0086, | |
| "mean_token_accuracy": 0.7668839745223522, | |
| "num_tokens": 197209393.0, | |
| "step": 2680, | |
| "train_ppl": 2.741868 | |
| }, | |
| { | |
| "ce_loss": 0.9412, | |
| "epoch": 0.38924159386474216, | |
| "grad_norm": 1.0, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8896016708936298e-05, | |
| "loss": 0.9412, | |
| "mean_token_accuracy": 0.7830228976905346, | |
| "num_tokens": 197950507.0, | |
| "step": 2690, | |
| "train_ppl": 2.56312 | |
| }, | |
| { | |
| "ce_loss": 0.9285, | |
| "epoch": 0.3906885886374735, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.885126062956885e-05, | |
| "loss": 0.9285, | |
| "mean_token_accuracy": 0.7872582785785198, | |
| "num_tokens": 198707373.0, | |
| "step": 2700, | |
| "train_ppl": 2.530723 | |
| }, | |
| { | |
| "ce_loss": 1.004, | |
| "epoch": 0.39213558341020494, | |
| "grad_norm": 0.96875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8806504550201402e-05, | |
| "loss": 1.004, | |
| "mean_token_accuracy": 0.7696459926664829, | |
| "num_tokens": 199432253.0, | |
| "step": 2710, | |
| "train_ppl": 2.729275 | |
| }, | |
| { | |
| "ce_loss": 0.9438, | |
| "epoch": 0.3935825781829363, | |
| "grad_norm": 0.8984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8761748470833958e-05, | |
| "loss": 0.9438, | |
| "mean_token_accuracy": 0.7834368832409382, | |
| "num_tokens": 200205289.0, | |
| "step": 2720, | |
| "train_ppl": 2.569663 | |
| }, | |
| { | |
| "ce_loss": 0.9668, | |
| "epoch": 0.3950295729556677, | |
| "grad_norm": 0.96875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8716992391466507e-05, | |
| "loss": 0.9668, | |
| "mean_token_accuracy": 0.7788598984479904, | |
| "num_tokens": 200948293.0, | |
| "step": 2730, | |
| "train_ppl": 2.629388 | |
| }, | |
| { | |
| "ce_loss": 0.9844, | |
| "epoch": 0.39647656772839907, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.867223631209906e-05, | |
| "loss": 0.9844, | |
| "mean_token_accuracy": 0.7698593437671661, | |
| "num_tokens": 201693594.0, | |
| "step": 2740, | |
| "train_ppl": 2.676329 | |
| }, | |
| { | |
| "ce_loss": 0.9749, | |
| "epoch": 0.3979235625011305, | |
| "grad_norm": 0.94140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8627480232731612e-05, | |
| "loss": 0.9749, | |
| "mean_token_accuracy": 0.7773583248257637, | |
| "num_tokens": 202425022.0, | |
| "step": 2750, | |
| "train_ppl": 2.650845 | |
| }, | |
| { | |
| "ce_loss": 0.969, | |
| "epoch": 0.39937055727386184, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8582724153364165e-05, | |
| "loss": 0.969, | |
| "mean_token_accuracy": 0.7747991502285003, | |
| "num_tokens": 203166750.0, | |
| "step": 2760, | |
| "train_ppl": 2.635431 | |
| }, | |
| { | |
| "ce_loss": 0.9665, | |
| "epoch": 0.40081755204659325, | |
| "grad_norm": 1.15625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.853796807399672e-05, | |
| "loss": 0.9665, | |
| "mean_token_accuracy": 0.773398594558239, | |
| "num_tokens": 203882390.0, | |
| "step": 2770, | |
| "train_ppl": 2.628676 | |
| }, | |
| { | |
| "ce_loss": 0.9587, | |
| "epoch": 0.4022645468193246, | |
| "grad_norm": 1.125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.849321199462927e-05, | |
| "loss": 0.9587, | |
| "mean_token_accuracy": 0.7789006575942039, | |
| "num_tokens": 204626671.0, | |
| "step": 2780, | |
| "train_ppl": 2.608222 | |
| }, | |
| { | |
| "ce_loss": 0.9712, | |
| "epoch": 0.403711541592056, | |
| "grad_norm": 0.94140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8448455915261825e-05, | |
| "loss": 0.9712, | |
| "mean_token_accuracy": 0.7756584413349629, | |
| "num_tokens": 205353873.0, | |
| "step": 2790, | |
| "train_ppl": 2.641169 | |
| }, | |
| { | |
| "ce_loss": 0.9684, | |
| "epoch": 0.4051585363647874, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8403699835894378e-05, | |
| "loss": 0.9684, | |
| "mean_token_accuracy": 0.7775221608579159, | |
| "num_tokens": 206089475.0, | |
| "step": 2800, | |
| "train_ppl": 2.63379 | |
| }, | |
| { | |
| "ce_loss": 1.0109, | |
| "epoch": 0.40660553113751874, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8358943756526927e-05, | |
| "loss": 1.0109, | |
| "mean_token_accuracy": 0.7700402162969112, | |
| "num_tokens": 206830670.0, | |
| "step": 2810, | |
| "train_ppl": 2.747938 | |
| }, | |
| { | |
| "ce_loss": 0.945, | |
| "epoch": 0.40805252591025015, | |
| "grad_norm": 1.0703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8314187677159483e-05, | |
| "loss": 0.945, | |
| "mean_token_accuracy": 0.7814373821020126, | |
| "num_tokens": 207591527.0, | |
| "step": 2820, | |
| "train_ppl": 2.572862 | |
| }, | |
| { | |
| "ce_loss": 0.9544, | |
| "epoch": 0.4094995206829815, | |
| "grad_norm": 0.99609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8269431597792032e-05, | |
| "loss": 0.9544, | |
| "mean_token_accuracy": 0.7797525011003017, | |
| "num_tokens": 208339441.0, | |
| "step": 2830, | |
| "train_ppl": 2.597219 | |
| }, | |
| { | |
| "ce_loss": 0.9706, | |
| "epoch": 0.4109465154557129, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8224675518424588e-05, | |
| "loss": 0.9706, | |
| "mean_token_accuracy": 0.7762934103608131, | |
| "num_tokens": 209078453.0, | |
| "step": 2840, | |
| "train_ppl": 2.639582 | |
| }, | |
| { | |
| "ce_loss": 0.9529, | |
| "epoch": 0.4123935102284443, | |
| "grad_norm": 1.359375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.817991943905714e-05, | |
| "loss": 0.9529, | |
| "mean_token_accuracy": 0.7769104249775409, | |
| "num_tokens": 209817755.0, | |
| "step": 2850, | |
| "train_ppl": 2.593285 | |
| }, | |
| { | |
| "ce_loss": 0.9647, | |
| "epoch": 0.4138405050011757, | |
| "grad_norm": 0.984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.813516335968969e-05, | |
| "loss": 0.9647, | |
| "mean_token_accuracy": 0.7746372953057289, | |
| "num_tokens": 210572147.0, | |
| "step": 2860, | |
| "train_ppl": 2.624049 | |
| }, | |
| { | |
| "ce_loss": 0.9791, | |
| "epoch": 0.41528749977390705, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8090407280322245e-05, | |
| "loss": 0.9791, | |
| "mean_token_accuracy": 0.7739841856062413, | |
| "num_tokens": 211317422.0, | |
| "step": 2870, | |
| "train_ppl": 2.662128 | |
| }, | |
| { | |
| "ce_loss": 0.9535, | |
| "epoch": 0.41673449454663847, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8045651200954797e-05, | |
| "loss": 0.9535, | |
| "mean_token_accuracy": 0.7812499180436134, | |
| "num_tokens": 212076246.0, | |
| "step": 2880, | |
| "train_ppl": 2.594664 | |
| }, | |
| { | |
| "ce_loss": 0.989, | |
| "epoch": 0.4181814893193698, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.800089512158735e-05, | |
| "loss": 0.989, | |
| "mean_token_accuracy": 0.7691139645874501, | |
| "num_tokens": 212763964.0, | |
| "step": 2890, | |
| "train_ppl": 2.688652 | |
| }, | |
| { | |
| "ce_loss": 0.952, | |
| "epoch": 0.41962848409210124, | |
| "grad_norm": 0.95703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7956139042219902e-05, | |
| "loss": 0.952, | |
| "mean_token_accuracy": 0.777950644493103, | |
| "num_tokens": 213512388.0, | |
| "step": 2900, | |
| "train_ppl": 2.590762 | |
| }, | |
| { | |
| "ce_loss": 0.9988, | |
| "epoch": 0.4210754788648326, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7911382962852455e-05, | |
| "loss": 0.9988, | |
| "mean_token_accuracy": 0.7697994232177734, | |
| "num_tokens": 214220646.0, | |
| "step": 2910, | |
| "train_ppl": 2.715134 | |
| }, | |
| { | |
| "ce_loss": 0.9738, | |
| "epoch": 0.422522473637564, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7866626883485007e-05, | |
| "loss": 0.9738, | |
| "mean_token_accuracy": 0.7759139001369476, | |
| "num_tokens": 214925657.0, | |
| "step": 2920, | |
| "train_ppl": 2.647943 | |
| }, | |
| { | |
| "ce_loss": 0.9857, | |
| "epoch": 0.42396946841029537, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.782187080411756e-05, | |
| "loss": 0.9857, | |
| "mean_token_accuracy": 0.7746396206319333, | |
| "num_tokens": 215622023.0, | |
| "step": 2930, | |
| "train_ppl": 2.679806 | |
| }, | |
| { | |
| "ce_loss": 0.9942, | |
| "epoch": 0.4254164631830267, | |
| "grad_norm": 1.15625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7777114724750112e-05, | |
| "loss": 0.9942, | |
| "mean_token_accuracy": 0.7746829591691494, | |
| "num_tokens": 216363572.0, | |
| "step": 2940, | |
| "train_ppl": 2.702513 | |
| }, | |
| { | |
| "ce_loss": 0.9358, | |
| "epoch": 0.42686345795575814, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7732358645382665e-05, | |
| "loss": 0.9358, | |
| "mean_token_accuracy": 0.7809817381203175, | |
| "num_tokens": 217117940.0, | |
| "step": 2950, | |
| "train_ppl": 2.549177 | |
| }, | |
| { | |
| "ce_loss": 0.9511, | |
| "epoch": 0.4283104527284895, | |
| "grad_norm": 1.15625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7687602566015217e-05, | |
| "loss": 0.9511, | |
| "mean_token_accuracy": 0.774829763174057, | |
| "num_tokens": 217882702.0, | |
| "step": 2960, | |
| "train_ppl": 2.588437 | |
| }, | |
| { | |
| "ce_loss": 0.9726, | |
| "epoch": 0.4297574475012209, | |
| "grad_norm": 0.99609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.764284648664777e-05, | |
| "loss": 0.9726, | |
| "mean_token_accuracy": 0.7748524136841297, | |
| "num_tokens": 218610599.0, | |
| "step": 2970, | |
| "train_ppl": 2.64482 | |
| }, | |
| { | |
| "ce_loss": 0.9812, | |
| "epoch": 0.43120444227395227, | |
| "grad_norm": 1.0703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7598090407280322e-05, | |
| "loss": 0.9812, | |
| "mean_token_accuracy": 0.7769106313586235, | |
| "num_tokens": 219344239.0, | |
| "step": 2980, | |
| "train_ppl": 2.667774 | |
| }, | |
| { | |
| "ce_loss": 0.9636, | |
| "epoch": 0.4326514370466837, | |
| "grad_norm": 1.125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7553334327912878e-05, | |
| "loss": 0.9636, | |
| "mean_token_accuracy": 0.7774206228554249, | |
| "num_tokens": 220070330.0, | |
| "step": 2990, | |
| "train_ppl": 2.621097 | |
| }, | |
| { | |
| "ce_loss": 0.9503, | |
| "epoch": 0.43409843181941504, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7508578248545427e-05, | |
| "loss": 0.9503, | |
| "mean_token_accuracy": 0.7805333323776722, | |
| "num_tokens": 220786645.0, | |
| "step": 3000, | |
| "train_ppl": 2.586443 | |
| }, | |
| { | |
| "ce_loss": 0.9727, | |
| "epoch": 0.43554542659214646, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.746382216917798e-05, | |
| "loss": 0.9727, | |
| "mean_token_accuracy": 0.7798659265041351, | |
| "num_tokens": 221501835.0, | |
| "step": 3010, | |
| "train_ppl": 2.644989 | |
| }, | |
| { | |
| "ce_loss": 0.976, | |
| "epoch": 0.4369924213648778, | |
| "grad_norm": 0.984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.741906608981053e-05, | |
| "loss": 0.976, | |
| "mean_token_accuracy": 0.7753879025578498, | |
| "num_tokens": 222228551.0, | |
| "step": 3020, | |
| "train_ppl": 2.65379 | |
| }, | |
| { | |
| "ce_loss": 0.9761, | |
| "epoch": 0.43843941613760923, | |
| "grad_norm": 0.94140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7374310010443084e-05, | |
| "loss": 0.9761, | |
| "mean_token_accuracy": 0.7760777927935123, | |
| "num_tokens": 222946933.0, | |
| "step": 3030, | |
| "train_ppl": 2.654151 | |
| }, | |
| { | |
| "ce_loss": 0.9944, | |
| "epoch": 0.4398864109103406, | |
| "grad_norm": 0.98046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.732955393107564e-05, | |
| "loss": 0.9944, | |
| "mean_token_accuracy": 0.7701233983039856, | |
| "num_tokens": 223687091.0, | |
| "step": 3040, | |
| "train_ppl": 2.703226 | |
| }, | |
| { | |
| "ce_loss": 0.9391, | |
| "epoch": 0.44133340568307194, | |
| "grad_norm": 0.97265625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.728479785170819e-05, | |
| "loss": 0.9391, | |
| "mean_token_accuracy": 0.7819373540580272, | |
| "num_tokens": 224415889.0, | |
| "step": 3050, | |
| "train_ppl": 2.557619 | |
| }, | |
| { | |
| "ce_loss": 0.9311, | |
| "epoch": 0.44278040045580336, | |
| "grad_norm": 0.8828125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7240041772340745e-05, | |
| "loss": 0.9311, | |
| "mean_token_accuracy": 0.7835486814379692, | |
| "num_tokens": 225175613.0, | |
| "step": 3060, | |
| "train_ppl": 2.537334 | |
| }, | |
| { | |
| "ce_loss": 0.9712, | |
| "epoch": 0.4442273952285347, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7195285692973297e-05, | |
| "loss": 0.9712, | |
| "mean_token_accuracy": 0.7758528731763363, | |
| "num_tokens": 225931362.0, | |
| "step": 3070, | |
| "train_ppl": 2.641217 | |
| }, | |
| { | |
| "ce_loss": 0.9468, | |
| "epoch": 0.44567439000126613, | |
| "grad_norm": 0.9140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7150529613605846e-05, | |
| "loss": 0.9468, | |
| "mean_token_accuracy": 0.7813886523246765, | |
| "num_tokens": 226658710.0, | |
| "step": 3080, | |
| "train_ppl": 2.577371 | |
| }, | |
| { | |
| "ce_loss": 0.9776, | |
| "epoch": 0.4471213847739975, | |
| "grad_norm": 1.2265625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7105773534238402e-05, | |
| "loss": 0.9776, | |
| "mean_token_accuracy": 0.7746784225106239, | |
| "num_tokens": 227404471.0, | |
| "step": 3090, | |
| "train_ppl": 2.658194 | |
| }, | |
| { | |
| "ce_loss": 0.9739, | |
| "epoch": 0.4485683795467289, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7061017454870955e-05, | |
| "loss": 0.9739, | |
| "mean_token_accuracy": 0.7733561553061008, | |
| "num_tokens": 228132005.0, | |
| "step": 3100, | |
| "train_ppl": 2.648246 | |
| }, | |
| { | |
| "ce_loss": 0.9602, | |
| "epoch": 0.45001537431946026, | |
| "grad_norm": 0.88671875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7016261375503507e-05, | |
| "loss": 0.9602, | |
| "mean_token_accuracy": 0.7756247140467167, | |
| "num_tokens": 228859507.0, | |
| "step": 3110, | |
| "train_ppl": 2.612151 | |
| }, | |
| { | |
| "ce_loss": 0.979, | |
| "epoch": 0.4514623690921917, | |
| "grad_norm": 1.1328125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.697150529613606e-05, | |
| "loss": 0.979, | |
| "mean_token_accuracy": 0.7758997343480587, | |
| "num_tokens": 229580037.0, | |
| "step": 3120, | |
| "train_ppl": 2.661712 | |
| }, | |
| { | |
| "ce_loss": 0.9772, | |
| "epoch": 0.45290936386492303, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.692674921676861e-05, | |
| "loss": 0.9772, | |
| "mean_token_accuracy": 0.7744156174361706, | |
| "num_tokens": 230322304.0, | |
| "step": 3130, | |
| "train_ppl": 2.657003 | |
| }, | |
| { | |
| "ce_loss": 0.9562, | |
| "epoch": 0.45435635863765444, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.6881993137401164e-05, | |
| "loss": 0.9562, | |
| "mean_token_accuracy": 0.7790285974740982, | |
| "num_tokens": 231059980.0, | |
| "step": 3140, | |
| "train_ppl": 2.601828 | |
| }, | |
| { | |
| "ce_loss": 0.9527, | |
| "epoch": 0.4558033534103858, | |
| "grad_norm": 0.9609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.6837237058033717e-05, | |
| "loss": 0.9527, | |
| "mean_token_accuracy": 0.7776475623250008, | |
| "num_tokens": 231819587.0, | |
| "step": 3150, | |
| "train_ppl": 2.592802 | |
| }, | |
| { | |
| "ce_loss": 0.9886, | |
| "epoch": 0.45725034818311716, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.679248097866627e-05, | |
| "loss": 0.9886, | |
| "mean_token_accuracy": 0.7710159003734589, | |
| "num_tokens": 232549725.0, | |
| "step": 3160, | |
| "train_ppl": 2.687503 | |
| }, | |
| { | |
| "ce_loss": 0.9606, | |
| "epoch": 0.4586973429558486, | |
| "grad_norm": 0.9765625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.6747724899298822e-05, | |
| "loss": 0.9606, | |
| "mean_token_accuracy": 0.7811665050685406, | |
| "num_tokens": 233291132.0, | |
| "step": 3170, | |
| "train_ppl": 2.613236 | |
| }, | |
| { | |
| "ce_loss": 0.9511, | |
| "epoch": 0.46014433772857993, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.6702968819931374e-05, | |
| "loss": 0.9511, | |
| "mean_token_accuracy": 0.7800517350435257, | |
| "num_tokens": 234041516.0, | |
| "step": 3180, | |
| "train_ppl": 2.588567 | |
| }, | |
| { | |
| "ce_loss": 0.924, | |
| "epoch": 0.46159133250131135, | |
| "grad_norm": 0.91796875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.6658212740563927e-05, | |
| "loss": 0.924, | |
| "mean_token_accuracy": 0.7832289874553681, | |
| "num_tokens": 234793582.0, | |
| "step": 3190, | |
| "train_ppl": 2.519274 | |
| }, | |
| { | |
| "ce_loss": 1.01, | |
| "epoch": 0.4630383272740427, | |
| "grad_norm": 1.0859375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.661345666119648e-05, | |
| "loss": 1.01, | |
| "mean_token_accuracy": 0.7669910915195942, | |
| "num_tokens": 235509780.0, | |
| "step": 3200, | |
| "train_ppl": 2.745611 | |
| }, | |
| { | |
| "ce_loss": 0.988, | |
| "epoch": 0.4644853220467741, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.6568700581829035e-05, | |
| "loss": 0.988, | |
| "mean_token_accuracy": 0.7717112138867378, | |
| "num_tokens": 236219024.0, | |
| "step": 3210, | |
| "train_ppl": 2.685961 | |
| }, | |
| { | |
| "ce_loss": 0.9403, | |
| "epoch": 0.4659323168195055, | |
| "grad_norm": 0.96875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.6523944502461584e-05, | |
| "loss": 0.9403, | |
| "mean_token_accuracy": 0.7790117606520652, | |
| "num_tokens": 236975108.0, | |
| "step": 3220, | |
| "train_ppl": 2.560643 | |
| }, | |
| { | |
| "ce_loss": 0.9728, | |
| "epoch": 0.4673793115922369, | |
| "grad_norm": 0.9921875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.6479188423094136e-05, | |
| "loss": 0.9728, | |
| "mean_token_accuracy": 0.7795041255652905, | |
| "num_tokens": 237724462.0, | |
| "step": 3230, | |
| "train_ppl": 2.645343 | |
| }, | |
| { | |
| "ce_loss": 0.9416, | |
| "epoch": 0.46882630636496825, | |
| "grad_norm": 0.921875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.643443234372669e-05, | |
| "loss": 0.9416, | |
| "mean_token_accuracy": 0.7821677893400192, | |
| "num_tokens": 238490711.0, | |
| "step": 3240, | |
| "train_ppl": 2.564148 | |
| }, | |
| { | |
| "ce_loss": 0.9657, | |
| "epoch": 0.47027330113769966, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.638967626435924e-05, | |
| "loss": 0.9657, | |
| "mean_token_accuracy": 0.7754031218588352, | |
| "num_tokens": 239227350.0, | |
| "step": 3250, | |
| "train_ppl": 2.626516 | |
| }, | |
| { | |
| "ce_loss": 0.9453, | |
| "epoch": 0.471720295910431, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.6344920184991797e-05, | |
| "loss": 0.9453, | |
| "mean_token_accuracy": 0.7826674081385135, | |
| "num_tokens": 239948015.0, | |
| "step": 3260, | |
| "train_ppl": 2.57358 | |
| }, | |
| { | |
| "ce_loss": 0.9745, | |
| "epoch": 0.47316729068316243, | |
| "grad_norm": 0.90625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.6300164105624346e-05, | |
| "loss": 0.9745, | |
| "mean_token_accuracy": 0.7750352688133717, | |
| "num_tokens": 240720149.0, | |
| "step": 3270, | |
| "train_ppl": 2.649788 | |
| }, | |
| { | |
| "ce_loss": 0.9767, | |
| "epoch": 0.4746142854558938, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.6255408026256902e-05, | |
| "loss": 0.9767, | |
| "mean_token_accuracy": 0.7757932528853416, | |
| "num_tokens": 241430604.0, | |
| "step": 3280, | |
| "train_ppl": 2.655572 | |
| }, | |
| { | |
| "ce_loss": 0.9825, | |
| "epoch": 0.47606128022862515, | |
| "grad_norm": 0.96875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.6210651946889455e-05, | |
| "loss": 0.9825, | |
| "mean_token_accuracy": 0.7717338934540748, | |
| "num_tokens": 242181967.0, | |
| "step": 3290, | |
| "train_ppl": 2.671143 | |
| }, | |
| { | |
| "ce_loss": 0.9452, | |
| "epoch": 0.47750827500135656, | |
| "grad_norm": 0.96484375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.6165895867522004e-05, | |
| "loss": 0.9452, | |
| "mean_token_accuracy": 0.7806530050933361, | |
| "num_tokens": 242920132.0, | |
| "step": 3300, | |
| "train_ppl": 2.57345 | |
| }, | |
| { | |
| "ce_loss": 0.9595, | |
| "epoch": 0.4789552697740879, | |
| "grad_norm": 1.265625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.612113978815456e-05, | |
| "loss": 0.9595, | |
| "mean_token_accuracy": 0.7763951353728771, | |
| "num_tokens": 243640350.0, | |
| "step": 3310, | |
| "train_ppl": 2.610434 | |
| }, | |
| { | |
| "ce_loss": 0.9676, | |
| "epoch": 0.48040226454681934, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.607638370878711e-05, | |
| "loss": 0.9676, | |
| "mean_token_accuracy": 0.774853790551424, | |
| "num_tokens": 244365334.0, | |
| "step": 3320, | |
| "train_ppl": 2.631576 | |
| }, | |
| { | |
| "ce_loss": 0.9558, | |
| "epoch": 0.4818492593195507, | |
| "grad_norm": 1.1796875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.6031627629419664e-05, | |
| "loss": 0.9558, | |
| "mean_token_accuracy": 0.7763160079717636, | |
| "num_tokens": 245108674.0, | |
| "step": 3330, | |
| "train_ppl": 2.600818 | |
| }, | |
| { | |
| "ce_loss": 0.9885, | |
| "epoch": 0.4832962540922821, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.5986871550052217e-05, | |
| "loss": 0.9885, | |
| "mean_token_accuracy": 0.7731200739741325, | |
| "num_tokens": 245851700.0, | |
| "step": 3340, | |
| "train_ppl": 2.687179 | |
| }, | |
| { | |
| "ce_loss": 0.9778, | |
| "epoch": 0.48474324886501347, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.5942115470684766e-05, | |
| "loss": 0.9778, | |
| "mean_token_accuracy": 0.7771647915244102, | |
| "num_tokens": 246580552.0, | |
| "step": 3350, | |
| "train_ppl": 2.658483 | |
| }, | |
| { | |
| "ce_loss": 0.969, | |
| "epoch": 0.4861902436377449, | |
| "grad_norm": 1.1171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.589735939131732e-05, | |
| "loss": 0.969, | |
| "mean_token_accuracy": 0.7781485505402088, | |
| "num_tokens": 247303795.0, | |
| "step": 3360, | |
| "train_ppl": 2.635424 | |
| }, | |
| { | |
| "ce_loss": 0.9672, | |
| "epoch": 0.48763723841047624, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.5852603311949874e-05, | |
| "loss": 0.9672, | |
| "mean_token_accuracy": 0.7760098949074745, | |
| "num_tokens": 248058038.0, | |
| "step": 3370, | |
| "train_ppl": 2.630652 | |
| }, | |
| { | |
| "ce_loss": 0.9829, | |
| "epoch": 0.48908423318320765, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.5807847232582427e-05, | |
| "loss": 0.9829, | |
| "mean_token_accuracy": 0.774996928870678, | |
| "num_tokens": 248796994.0, | |
| "step": 3380, | |
| "train_ppl": 2.672328 | |
| }, | |
| { | |
| "ce_loss": 0.9999, | |
| "epoch": 0.490531227955939, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.576309115321498e-05, | |
| "loss": 0.9999, | |
| "mean_token_accuracy": 0.769992358237505, | |
| "num_tokens": 249528539.0, | |
| "step": 3390, | |
| "train_ppl": 2.717897 | |
| }, | |
| { | |
| "ce_loss": 0.9744, | |
| "epoch": 0.49197822272867037, | |
| "grad_norm": 1.25, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.571833507384753e-05, | |
| "loss": 0.9744, | |
| "mean_token_accuracy": 0.7775142967700959, | |
| "num_tokens": 250271300.0, | |
| "step": 3400, | |
| "train_ppl": 2.649573 | |
| }, | |
| { | |
| "ce_loss": 0.9612, | |
| "epoch": 0.4934252175014018, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.5673578994480084e-05, | |
| "loss": 0.9612, | |
| "mean_token_accuracy": 0.7808264754712582, | |
| "num_tokens": 251018244.0, | |
| "step": 3410, | |
| "train_ppl": 2.614842 | |
| }, | |
| { | |
| "ce_loss": 0.9807, | |
| "epoch": 0.49487221227413314, | |
| "grad_norm": 1.0, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.5628822915112636e-05, | |
| "loss": 0.9807, | |
| "mean_token_accuracy": 0.7724880896508693, | |
| "num_tokens": 251737409.0, | |
| "step": 3420, | |
| "train_ppl": 2.666417 | |
| }, | |
| { | |
| "ce_loss": 0.9971, | |
| "epoch": 0.49631920704686455, | |
| "grad_norm": 1.125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.558406683574519e-05, | |
| "loss": 0.9971, | |
| "mean_token_accuracy": 0.7721994496881962, | |
| "num_tokens": 252452177.0, | |
| "step": 3430, | |
| "train_ppl": 2.7103 | |
| }, | |
| { | |
| "ce_loss": 0.9659, | |
| "epoch": 0.4977662018195959, | |
| "grad_norm": 0.98828125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.553931075637774e-05, | |
| "loss": 0.9659, | |
| "mean_token_accuracy": 0.7731683790683747, | |
| "num_tokens": 253164867.0, | |
| "step": 3440, | |
| "train_ppl": 2.62711 | |
| }, | |
| { | |
| "ce_loss": 0.9876, | |
| "epoch": 0.4992131965923273, | |
| "grad_norm": 0.96875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.5494554677010294e-05, | |
| "loss": 0.9876, | |
| "mean_token_accuracy": 0.7709869779646397, | |
| "num_tokens": 253890732.0, | |
| "step": 3450, | |
| "train_ppl": 2.684681 | |
| }, | |
| { | |
| "ce_loss": 0.9918, | |
| "epoch": 0.5006601913650587, | |
| "grad_norm": 1.0703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.5449798597642846e-05, | |
| "loss": 0.9918, | |
| "mean_token_accuracy": 0.7687140062451363, | |
| "num_tokens": 254619763.0, | |
| "step": 3460, | |
| "train_ppl": 2.696074 | |
| }, | |
| { | |
| "ce_loss": 0.9504, | |
| "epoch": 0.50210718613779, | |
| "grad_norm": 0.94140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.54050425182754e-05, | |
| "loss": 0.9504, | |
| "mean_token_accuracy": 0.7793492712080479, | |
| "num_tokens": 255363436.0, | |
| "step": 3470, | |
| "train_ppl": 2.586716 | |
| }, | |
| { | |
| "ce_loss": 0.9599, | |
| "epoch": 0.5035541809105215, | |
| "grad_norm": 0.9296875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.5360286438907954e-05, | |
| "loss": 0.9599, | |
| "mean_token_accuracy": 0.7774735637009144, | |
| "num_tokens": 256115802.0, | |
| "step": 3480, | |
| "train_ppl": 2.61146 | |
| }, | |
| { | |
| "ce_loss": 0.9649, | |
| "epoch": 0.5050011756832529, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.5315530359540503e-05, | |
| "loss": 0.9649, | |
| "mean_token_accuracy": 0.7754439219832421, | |
| "num_tokens": 256842141.0, | |
| "step": 3490, | |
| "train_ppl": 2.62447 | |
| }, | |
| { | |
| "ce_loss": 0.9671, | |
| "epoch": 0.5064481704559842, | |
| "grad_norm": 1.1484375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.527077428017306e-05, | |
| "loss": 0.9671, | |
| "mean_token_accuracy": 0.7746169321238995, | |
| "num_tokens": 257574760.0, | |
| "step": 3500, | |
| "train_ppl": 2.630219 | |
| }, | |
| { | |
| "ce_loss": 0.9834, | |
| "epoch": 0.5078951652287156, | |
| "grad_norm": 1.171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.5226018200805612e-05, | |
| "loss": 0.9834, | |
| "mean_token_accuracy": 0.7728622667491436, | |
| "num_tokens": 258285032.0, | |
| "step": 3510, | |
| "train_ppl": 2.673492 | |
| }, | |
| { | |
| "ce_loss": 0.9703, | |
| "epoch": 0.5093421600014469, | |
| "grad_norm": 1.1171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.5181262121438162e-05, | |
| "loss": 0.9703, | |
| "mean_token_accuracy": 0.7742777064442634, | |
| "num_tokens": 258999939.0, | |
| "step": 3520, | |
| "train_ppl": 2.638679 | |
| }, | |
| { | |
| "ce_loss": 0.9218, | |
| "epoch": 0.5107891547741784, | |
| "grad_norm": 0.9296875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.5136506042070715e-05, | |
| "loss": 0.9218, | |
| "mean_token_accuracy": 0.7861278541386127, | |
| "num_tokens": 259763192.0, | |
| "step": 3530, | |
| "train_ppl": 2.513912 | |
| }, | |
| { | |
| "ce_loss": 0.9292, | |
| "epoch": 0.5122361495469098, | |
| "grad_norm": 0.9375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.5091749962703266e-05, | |
| "loss": 0.9292, | |
| "mean_token_accuracy": 0.7805077292025089, | |
| "num_tokens": 260499543.0, | |
| "step": 3540, | |
| "train_ppl": 2.532375 | |
| }, | |
| { | |
| "ce_loss": 0.9898, | |
| "epoch": 0.5136831443196411, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.504699388333582e-05, | |
| "loss": 0.9898, | |
| "mean_token_accuracy": 0.7731637723743916, | |
| "num_tokens": 261254442.0, | |
| "step": 3550, | |
| "train_ppl": 2.690609 | |
| }, | |
| { | |
| "ce_loss": 0.9634, | |
| "epoch": 0.5151301390923725, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.5002237803968374e-05, | |
| "loss": 0.9634, | |
| "mean_token_accuracy": 0.779674281924963, | |
| "num_tokens": 262015435.0, | |
| "step": 3560, | |
| "train_ppl": 2.620479 | |
| }, | |
| { | |
| "ce_loss": 0.9716, | |
| "epoch": 0.516577133865104, | |
| "grad_norm": 1.1171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4957481724600926e-05, | |
| "loss": 0.9716, | |
| "mean_token_accuracy": 0.776695205271244, | |
| "num_tokens": 262693267.0, | |
| "step": 3570, | |
| "train_ppl": 2.642217 | |
| }, | |
| { | |
| "ce_loss": 1.0025, | |
| "epoch": 0.5180241286378353, | |
| "grad_norm": 0.94140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4912725645233479e-05, | |
| "loss": 1.0025, | |
| "mean_token_accuracy": 0.7727914996445179, | |
| "num_tokens": 263442598.0, | |
| "step": 3580, | |
| "train_ppl": 2.725135 | |
| }, | |
| { | |
| "ce_loss": 0.9628, | |
| "epoch": 0.5194711234105667, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.486796956586603e-05, | |
| "loss": 0.9628, | |
| "mean_token_accuracy": 0.7818873479962349, | |
| "num_tokens": 264210381.0, | |
| "step": 3590, | |
| "train_ppl": 2.618999 | |
| }, | |
| { | |
| "ce_loss": 0.9571, | |
| "epoch": 0.520918118183298, | |
| "grad_norm": 0.921875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4823213486498582e-05, | |
| "loss": 0.9571, | |
| "mean_token_accuracy": 0.7811072282493114, | |
| "num_tokens": 264954557.0, | |
| "step": 3600, | |
| "train_ppl": 2.60412 | |
| }, | |
| { | |
| "ce_loss": 0.9555, | |
| "epoch": 0.5223651129560295, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4778457407131136e-05, | |
| "loss": 0.9555, | |
| "mean_token_accuracy": 0.7785631224513054, | |
| "num_tokens": 265708667.0, | |
| "step": 3610, | |
| "train_ppl": 2.600049 | |
| }, | |
| { | |
| "ce_loss": 0.9794, | |
| "epoch": 0.5238121077287609, | |
| "grad_norm": 1.0, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4733701327763689e-05, | |
| "loss": 0.9794, | |
| "mean_token_accuracy": 0.7781493321061135, | |
| "num_tokens": 266443298.0, | |
| "step": 3620, | |
| "train_ppl": 2.662788 | |
| }, | |
| { | |
| "ce_loss": 0.9757, | |
| "epoch": 0.5252591025014922, | |
| "grad_norm": 0.96484375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4688945248396241e-05, | |
| "loss": 0.9757, | |
| "mean_token_accuracy": 0.7720276661217212, | |
| "num_tokens": 267173324.0, | |
| "step": 3630, | |
| "train_ppl": 2.653105 | |
| }, | |
| { | |
| "ce_loss": 1.0308, | |
| "epoch": 0.5267060972742236, | |
| "grad_norm": 1.1953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4644189169028794e-05, | |
| "loss": 1.0308, | |
| "mean_token_accuracy": 0.7638523608446122, | |
| "num_tokens": 267915944.0, | |
| "step": 3640, | |
| "train_ppl": 2.803437 | |
| }, | |
| { | |
| "ce_loss": 0.9602, | |
| "epoch": 0.5281530920469549, | |
| "grad_norm": 0.953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4599433089661346e-05, | |
| "loss": 0.9602, | |
| "mean_token_accuracy": 0.7759406618773937, | |
| "num_tokens": 268643319.0, | |
| "step": 3650, | |
| "train_ppl": 2.612157 | |
| }, | |
| { | |
| "ce_loss": 0.9652, | |
| "epoch": 0.5296000868196864, | |
| "grad_norm": 1.0703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4554677010293898e-05, | |
| "loss": 0.9652, | |
| "mean_token_accuracy": 0.779689010232687, | |
| "num_tokens": 269367307.0, | |
| "step": 3660, | |
| "train_ppl": 2.625382 | |
| }, | |
| { | |
| "ce_loss": 0.9504, | |
| "epoch": 0.5310470815924178, | |
| "grad_norm": 0.8828125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4509920930926451e-05, | |
| "loss": 0.9504, | |
| "mean_token_accuracy": 0.7774218022823334, | |
| "num_tokens": 270092592.0, | |
| "step": 3670, | |
| "train_ppl": 2.586776 | |
| }, | |
| { | |
| "ce_loss": 0.9583, | |
| "epoch": 0.5324940763651491, | |
| "grad_norm": 1.171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4465164851559005e-05, | |
| "loss": 0.9583, | |
| "mean_token_accuracy": 0.7736941121518612, | |
| "num_tokens": 270860558.0, | |
| "step": 3680, | |
| "train_ppl": 2.60739 | |
| }, | |
| { | |
| "ce_loss": 0.9978, | |
| "epoch": 0.5339410711378805, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4420408772191557e-05, | |
| "loss": 0.9978, | |
| "mean_token_accuracy": 0.7728485822677612, | |
| "num_tokens": 271584192.0, | |
| "step": 3690, | |
| "train_ppl": 2.712288 | |
| }, | |
| { | |
| "ce_loss": 1.0123, | |
| "epoch": 0.5353880659106119, | |
| "grad_norm": 1.15625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4375652692824108e-05, | |
| "loss": 1.0123, | |
| "mean_token_accuracy": 0.767830940335989, | |
| "num_tokens": 272333891.0, | |
| "step": 3700, | |
| "train_ppl": 2.751963 | |
| }, | |
| { | |
| "ce_loss": 0.9239, | |
| "epoch": 0.5368350606833433, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.433089661345666e-05, | |
| "loss": 0.9239, | |
| "mean_token_accuracy": 0.7862473480403424, | |
| "num_tokens": 273099133.0, | |
| "step": 3710, | |
| "train_ppl": 2.51917 | |
| }, | |
| { | |
| "ce_loss": 0.958, | |
| "epoch": 0.5382820554560747, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4286140534089215e-05, | |
| "loss": 0.958, | |
| "mean_token_accuracy": 0.7815881177783013, | |
| "num_tokens": 273852553.0, | |
| "step": 3720, | |
| "train_ppl": 2.606516 | |
| }, | |
| { | |
| "ce_loss": 0.9936, | |
| "epoch": 0.539729050228806, | |
| "grad_norm": 0.91015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4241384454721767e-05, | |
| "loss": 0.9936, | |
| "mean_token_accuracy": 0.7692437112331391, | |
| "num_tokens": 274580358.0, | |
| "step": 3730, | |
| "train_ppl": 2.700827 | |
| }, | |
| { | |
| "ce_loss": 0.9692, | |
| "epoch": 0.5411760450015375, | |
| "grad_norm": 0.9375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.419662837535432e-05, | |
| "loss": 0.9692, | |
| "mean_token_accuracy": 0.7750534601509571, | |
| "num_tokens": 275333561.0, | |
| "step": 3740, | |
| "train_ppl": 2.635919 | |
| }, | |
| { | |
| "ce_loss": 0.9531, | |
| "epoch": 0.5426230397742688, | |
| "grad_norm": 0.98046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.415187229598687e-05, | |
| "loss": 0.9531, | |
| "mean_token_accuracy": 0.7767747581005097, | |
| "num_tokens": 276083858.0, | |
| "step": 3750, | |
| "train_ppl": 2.593638 | |
| }, | |
| { | |
| "ce_loss": 0.9443, | |
| "epoch": 0.5440700345470002, | |
| "grad_norm": 1.0859375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4107116216619425e-05, | |
| "loss": 0.9443, | |
| "mean_token_accuracy": 0.7835570797324181, | |
| "num_tokens": 276851059.0, | |
| "step": 3760, | |
| "train_ppl": 2.570927 | |
| }, | |
| { | |
| "ce_loss": 0.9737, | |
| "epoch": 0.5455170293197316, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4062360137251977e-05, | |
| "loss": 0.9737, | |
| "mean_token_accuracy": 0.776416502147913, | |
| "num_tokens": 277581787.0, | |
| "step": 3770, | |
| "train_ppl": 2.647673 | |
| }, | |
| { | |
| "ce_loss": 0.9387, | |
| "epoch": 0.5469640240924629, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.401760405788453e-05, | |
| "loss": 0.9387, | |
| "mean_token_accuracy": 0.7881631642580033, | |
| "num_tokens": 278297127.0, | |
| "step": 3780, | |
| "train_ppl": 2.5567 | |
| }, | |
| { | |
| "ce_loss": 0.9493, | |
| "epoch": 0.5484110188651944, | |
| "grad_norm": 1.1171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3972847978517082e-05, | |
| "loss": 0.9493, | |
| "mean_token_accuracy": 0.7784359693527222, | |
| "num_tokens": 279053770.0, | |
| "step": 3790, | |
| "train_ppl": 2.583983 | |
| }, | |
| { | |
| "ce_loss": 0.9715, | |
| "epoch": 0.5498580136379257, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3928091899149636e-05, | |
| "loss": 0.9715, | |
| "mean_token_accuracy": 0.7738523662090302, | |
| "num_tokens": 279793403.0, | |
| "step": 3800, | |
| "train_ppl": 2.641912 | |
| }, | |
| { | |
| "ce_loss": 0.9772, | |
| "epoch": 0.5513050084106571, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3883335819782187e-05, | |
| "loss": 0.9772, | |
| "mean_token_accuracy": 0.776868187636137, | |
| "num_tokens": 280525655.0, | |
| "step": 3810, | |
| "train_ppl": 2.657016 | |
| }, | |
| { | |
| "ce_loss": 0.926, | |
| "epoch": 0.5527520031833885, | |
| "grad_norm": 1.1640625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.383857974041474e-05, | |
| "loss": 0.926, | |
| "mean_token_accuracy": 0.7910705611109734, | |
| "num_tokens": 281261170.0, | |
| "step": 3820, | |
| "train_ppl": 2.524335 | |
| }, | |
| { | |
| "ce_loss": 0.9649, | |
| "epoch": 0.5541989979561199, | |
| "grad_norm": 1.28125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3793823661047293e-05, | |
| "loss": 0.9649, | |
| "mean_token_accuracy": 0.7791670545935631, | |
| "num_tokens": 281985897.0, | |
| "step": 3830, | |
| "train_ppl": 2.624451 | |
| }, | |
| { | |
| "ce_loss": 0.9677, | |
| "epoch": 0.5556459927288513, | |
| "grad_norm": 0.98828125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3749067581679846e-05, | |
| "loss": 0.9677, | |
| "mean_token_accuracy": 0.7748836219310761, | |
| "num_tokens": 282721456.0, | |
| "step": 3840, | |
| "train_ppl": 2.631954 | |
| }, | |
| { | |
| "ce_loss": 1.0129, | |
| "epoch": 0.5570929875015826, | |
| "grad_norm": 0.921875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3704311502312398e-05, | |
| "loss": 1.0129, | |
| "mean_token_accuracy": 0.7665625207126141, | |
| "num_tokens": 283434742.0, | |
| "step": 3850, | |
| "train_ppl": 2.753628 | |
| }, | |
| { | |
| "ce_loss": 0.9751, | |
| "epoch": 0.558539982274314, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3659555422944949e-05, | |
| "loss": 0.9751, | |
| "mean_token_accuracy": 0.7772414043545723, | |
| "num_tokens": 284159932.0, | |
| "step": 3860, | |
| "train_ppl": 2.651563 | |
| }, | |
| { | |
| "ce_loss": 0.96, | |
| "epoch": 0.5599869770470454, | |
| "grad_norm": 0.91015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3614799343577503e-05, | |
| "loss": 0.96, | |
| "mean_token_accuracy": 0.7742170818150044, | |
| "num_tokens": 284892821.0, | |
| "step": 3870, | |
| "train_ppl": 2.611629 | |
| }, | |
| { | |
| "ce_loss": 0.9735, | |
| "epoch": 0.5614339718197768, | |
| "grad_norm": 0.98046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3570043264210056e-05, | |
| "loss": 0.9735, | |
| "mean_token_accuracy": 0.7700681336224079, | |
| "num_tokens": 285587737.0, | |
| "step": 3880, | |
| "train_ppl": 2.647213 | |
| }, | |
| { | |
| "ce_loss": 0.9218, | |
| "epoch": 0.5628809665925082, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3525287184842608e-05, | |
| "loss": 0.9218, | |
| "mean_token_accuracy": 0.7871894739568234, | |
| "num_tokens": 286313582.0, | |
| "step": 3890, | |
| "train_ppl": 2.51389 | |
| }, | |
| { | |
| "ce_loss": 0.941, | |
| "epoch": 0.5643279613652395, | |
| "grad_norm": 0.953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.348053110547516e-05, | |
| "loss": 0.941, | |
| "mean_token_accuracy": 0.7820699147880077, | |
| "num_tokens": 287064151.0, | |
| "step": 3900, | |
| "train_ppl": 2.562492 | |
| }, | |
| { | |
| "ce_loss": 0.9296, | |
| "epoch": 0.5657749561379709, | |
| "grad_norm": 0.91796875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3435775026107715e-05, | |
| "loss": 0.9296, | |
| "mean_token_accuracy": 0.7859035260975361, | |
| "num_tokens": 287813874.0, | |
| "step": 3910, | |
| "train_ppl": 2.53357 | |
| }, | |
| { | |
| "ce_loss": 0.9445, | |
| "epoch": 0.5672219509107024, | |
| "grad_norm": 0.859375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3391018946740265e-05, | |
| "loss": 0.9445, | |
| "mean_token_accuracy": 0.782135433703661, | |
| "num_tokens": 288570496.0, | |
| "step": 3920, | |
| "train_ppl": 2.571643 | |
| }, | |
| { | |
| "ce_loss": 0.9839, | |
| "epoch": 0.5686689456834337, | |
| "grad_norm": 2.546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3346262867372818e-05, | |
| "loss": 0.9839, | |
| "mean_token_accuracy": 0.7735799729824067, | |
| "num_tokens": 289350278.0, | |
| "step": 3930, | |
| "train_ppl": 2.674829 | |
| }, | |
| { | |
| "ce_loss": 0.971, | |
| "epoch": 0.5701159404561651, | |
| "grad_norm": 0.92578125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.330150678800537e-05, | |
| "loss": 0.971, | |
| "mean_token_accuracy": 0.7777773514389992, | |
| "num_tokens": 290079342.0, | |
| "step": 3940, | |
| "train_ppl": 2.640477 | |
| }, | |
| { | |
| "ce_loss": 0.9539, | |
| "epoch": 0.5715629352288965, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3256750708637924e-05, | |
| "loss": 0.9539, | |
| "mean_token_accuracy": 0.7781407319009304, | |
| "num_tokens": 290832879.0, | |
| "step": 3950, | |
| "train_ppl": 2.595897 | |
| }, | |
| { | |
| "ce_loss": 0.9775, | |
| "epoch": 0.5730099300016279, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3211994629270477e-05, | |
| "loss": 0.9775, | |
| "mean_token_accuracy": 0.7747543424367904, | |
| "num_tokens": 291565544.0, | |
| "step": 3960, | |
| "train_ppl": 2.6577 | |
| }, | |
| { | |
| "ce_loss": 0.9625, | |
| "epoch": 0.5744569247743593, | |
| "grad_norm": 1.0, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3167238549903028e-05, | |
| "loss": 0.9625, | |
| "mean_token_accuracy": 0.778536244481802, | |
| "num_tokens": 292316435.0, | |
| "step": 3970, | |
| "train_ppl": 2.618189 | |
| }, | |
| { | |
| "ce_loss": 0.94, | |
| "epoch": 0.5759039195470906, | |
| "grad_norm": 0.94140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.312248247053558e-05, | |
| "loss": 0.94, | |
| "mean_token_accuracy": 0.7783068805932999, | |
| "num_tokens": 293058454.0, | |
| "step": 3980, | |
| "train_ppl": 2.560027 | |
| }, | |
| { | |
| "ce_loss": 1.0024, | |
| "epoch": 0.577350914319822, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3077726391168134e-05, | |
| "loss": 1.0024, | |
| "mean_token_accuracy": 0.7662229061126709, | |
| "num_tokens": 293783644.0, | |
| "step": 3990, | |
| "train_ppl": 2.724925 | |
| }, | |
| { | |
| "ce_loss": 0.9491, | |
| "epoch": 0.5787979090925534, | |
| "grad_norm": 1.0859375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3032970311800687e-05, | |
| "loss": 0.9491, | |
| "mean_token_accuracy": 0.781515534222126, | |
| "num_tokens": 294511489.0, | |
| "step": 4000, | |
| "train_ppl": 2.583289 | |
| }, | |
| { | |
| "ce_loss": 0.9735, | |
| "epoch": 0.5802449038652848, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2988214232433239e-05, | |
| "loss": 0.9735, | |
| "mean_token_accuracy": 0.7806210406124592, | |
| "num_tokens": 295248215.0, | |
| "step": 4010, | |
| "train_ppl": 2.647139 | |
| }, | |
| { | |
| "ce_loss": 0.9393, | |
| "epoch": 0.5816918986380162, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2943458153065793e-05, | |
| "loss": 0.9393, | |
| "mean_token_accuracy": 0.7846732117235661, | |
| "num_tokens": 295989738.0, | |
| "step": 4020, | |
| "train_ppl": 2.558143 | |
| }, | |
| { | |
| "ce_loss": 0.9621, | |
| "epoch": 0.5831388934107475, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2898702073698344e-05, | |
| "loss": 0.9621, | |
| "mean_token_accuracy": 0.7784810028970242, | |
| "num_tokens": 296702866.0, | |
| "step": 4030, | |
| "train_ppl": 2.617144 | |
| }, | |
| { | |
| "ce_loss": 0.9765, | |
| "epoch": 0.5845858881834789, | |
| "grad_norm": 1.0, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2853945994330896e-05, | |
| "loss": 0.9765, | |
| "mean_token_accuracy": 0.7725668139755726, | |
| "num_tokens": 297439737.0, | |
| "step": 4040, | |
| "train_ppl": 2.655217 | |
| }, | |
| { | |
| "ce_loss": 0.9885, | |
| "epoch": 0.5860328829562104, | |
| "grad_norm": 1.1875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2809189914963449e-05, | |
| "loss": 0.9885, | |
| "mean_token_accuracy": 0.774877705425024, | |
| "num_tokens": 298188647.0, | |
| "step": 4050, | |
| "train_ppl": 2.687219 | |
| }, | |
| { | |
| "ce_loss": 0.9545, | |
| "epoch": 0.5874798777289417, | |
| "grad_norm": 0.91796875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2764433835596003e-05, | |
| "loss": 0.9545, | |
| "mean_token_accuracy": 0.7752919748425484, | |
| "num_tokens": 298937830.0, | |
| "step": 4060, | |
| "train_ppl": 2.597323 | |
| }, | |
| { | |
| "ce_loss": 0.9608, | |
| "epoch": 0.5889268725016731, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2719677756228555e-05, | |
| "loss": 0.9608, | |
| "mean_token_accuracy": 0.7775414235889911, | |
| "num_tokens": 299669340.0, | |
| "step": 4070, | |
| "train_ppl": 2.613706 | |
| }, | |
| { | |
| "ce_loss": 0.9499, | |
| "epoch": 0.5903738672744044, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2674921676861106e-05, | |
| "loss": 0.9499, | |
| "mean_token_accuracy": 0.7804868087172508, | |
| "num_tokens": 300386836.0, | |
| "step": 4080, | |
| "train_ppl": 2.585417 | |
| }, | |
| { | |
| "ce_loss": 0.9535, | |
| "epoch": 0.5918208620471359, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2630165597493659e-05, | |
| "loss": 0.9535, | |
| "mean_token_accuracy": 0.7813090972602368, | |
| "num_tokens": 301161416.0, | |
| "step": 4090, | |
| "train_ppl": 2.594834 | |
| }, | |
| { | |
| "ce_loss": 0.9412, | |
| "epoch": 0.5932678568198673, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2585409518126213e-05, | |
| "loss": 0.9412, | |
| "mean_token_accuracy": 0.777237968891859, | |
| "num_tokens": 301895700.0, | |
| "step": 4100, | |
| "train_ppl": 2.562928 | |
| }, | |
| { | |
| "ce_loss": 0.9596, | |
| "epoch": 0.5947148515925986, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2540653438758765e-05, | |
| "loss": 0.9596, | |
| "mean_token_accuracy": 0.775063581764698, | |
| "num_tokens": 302652783.0, | |
| "step": 4110, | |
| "train_ppl": 2.610559 | |
| }, | |
| { | |
| "ce_loss": 0.938, | |
| "epoch": 0.59616184636533, | |
| "grad_norm": 1.171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2495897359391318e-05, | |
| "loss": 0.938, | |
| "mean_token_accuracy": 0.7807605281472206, | |
| "num_tokens": 303377816.0, | |
| "step": 4120, | |
| "train_ppl": 2.554922 | |
| }, | |
| { | |
| "ce_loss": 0.9801, | |
| "epoch": 0.5976088411380613, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.245114128002387e-05, | |
| "loss": 0.9801, | |
| "mean_token_accuracy": 0.7739221796393394, | |
| "num_tokens": 304113074.0, | |
| "step": 4130, | |
| "train_ppl": 2.664789 | |
| }, | |
| { | |
| "ce_loss": 0.9596, | |
| "epoch": 0.5990558359107928, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2406385200656423e-05, | |
| "loss": 0.9596, | |
| "mean_token_accuracy": 0.7742515958845615, | |
| "num_tokens": 304844350.0, | |
| "step": 4140, | |
| "train_ppl": 2.610675 | |
| }, | |
| { | |
| "ce_loss": 0.964, | |
| "epoch": 0.6005028306835242, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2361629121288975e-05, | |
| "loss": 0.964, | |
| "mean_token_accuracy": 0.7800977975130081, | |
| "num_tokens": 305579813.0, | |
| "step": 4150, | |
| "train_ppl": 2.622038 | |
| }, | |
| { | |
| "ce_loss": 0.9532, | |
| "epoch": 0.6019498254562555, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2316873041921527e-05, | |
| "loss": 0.9532, | |
| "mean_token_accuracy": 0.7812970593571663, | |
| "num_tokens": 306304960.0, | |
| "step": 4160, | |
| "train_ppl": 2.594026 | |
| }, | |
| { | |
| "ce_loss": 0.9601, | |
| "epoch": 0.6033968202289869, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2272116962554082e-05, | |
| "loss": 0.9601, | |
| "mean_token_accuracy": 0.7800398364663124, | |
| "num_tokens": 307042663.0, | |
| "step": 4170, | |
| "train_ppl": 2.611905 | |
| }, | |
| { | |
| "ce_loss": 0.9685, | |
| "epoch": 0.6048438150017184, | |
| "grad_norm": 0.8984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2227360883186634e-05, | |
| "loss": 0.9685, | |
| "mean_token_accuracy": 0.776139622181654, | |
| "num_tokens": 307757206.0, | |
| "step": 4180, | |
| "train_ppl": 2.63396 | |
| }, | |
| { | |
| "ce_loss": 0.9863, | |
| "epoch": 0.6062908097744497, | |
| "grad_norm": 0.88671875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2182604803819185e-05, | |
| "loss": 0.9863, | |
| "mean_token_accuracy": 0.7687765277922154, | |
| "num_tokens": 308492203.0, | |
| "step": 4190, | |
| "train_ppl": 2.681368 | |
| }, | |
| { | |
| "ce_loss": 0.9499, | |
| "epoch": 0.6077378045471811, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2137848724451737e-05, | |
| "loss": 0.9499, | |
| "mean_token_accuracy": 0.7795483432710171, | |
| "num_tokens": 309220000.0, | |
| "step": 4200, | |
| "train_ppl": 2.585347 | |
| }, | |
| { | |
| "ce_loss": 0.9506, | |
| "epoch": 0.6091847993199124, | |
| "grad_norm": 1.0, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2093092645084291e-05, | |
| "loss": 0.9506, | |
| "mean_token_accuracy": 0.7806940786540508, | |
| "num_tokens": 309954206.0, | |
| "step": 4210, | |
| "train_ppl": 2.587363 | |
| }, | |
| { | |
| "ce_loss": 0.9777, | |
| "epoch": 0.6106317940926438, | |
| "grad_norm": 1.234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2048336565716844e-05, | |
| "loss": 0.9777, | |
| "mean_token_accuracy": 0.7771054945886136, | |
| "num_tokens": 310673874.0, | |
| "step": 4220, | |
| "train_ppl": 2.658411 | |
| }, | |
| { | |
| "ce_loss": 0.9427, | |
| "epoch": 0.6120787888653753, | |
| "grad_norm": 0.97265625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2003580486349396e-05, | |
| "loss": 0.9427, | |
| "mean_token_accuracy": 0.7819586515426635, | |
| "num_tokens": 311425629.0, | |
| "step": 4230, | |
| "train_ppl": 2.567005 | |
| }, | |
| { | |
| "ce_loss": 0.9469, | |
| "epoch": 0.6135257836381066, | |
| "grad_norm": 1.1875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1958824406981949e-05, | |
| "loss": 0.9469, | |
| "mean_token_accuracy": 0.7801039353013038, | |
| "num_tokens": 312149916.0, | |
| "step": 4240, | |
| "train_ppl": 2.577795 | |
| }, | |
| { | |
| "ce_loss": 0.9829, | |
| "epoch": 0.614972778410838, | |
| "grad_norm": 0.9609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1914068327614501e-05, | |
| "loss": 0.9829, | |
| "mean_token_accuracy": 0.7737744726240635, | |
| "num_tokens": 312871666.0, | |
| "step": 4250, | |
| "train_ppl": 2.672162 | |
| }, | |
| { | |
| "ce_loss": 0.9819, | |
| "epoch": 0.6164197731835693, | |
| "grad_norm": 1.21875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1869312248247054e-05, | |
| "loss": 0.9819, | |
| "mean_token_accuracy": 0.7720717005431652, | |
| "num_tokens": 313601563.0, | |
| "step": 4260, | |
| "train_ppl": 2.669572 | |
| }, | |
| { | |
| "ce_loss": 0.9503, | |
| "epoch": 0.6178667679563008, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1824556168879606e-05, | |
| "loss": 0.9503, | |
| "mean_token_accuracy": 0.7818848460912704, | |
| "num_tokens": 314353822.0, | |
| "step": 4270, | |
| "train_ppl": 2.58643 | |
| }, | |
| { | |
| "ce_loss": 0.945, | |
| "epoch": 0.6193137627290322, | |
| "grad_norm": 1.1328125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1779800089512159e-05, | |
| "loss": 0.945, | |
| "mean_token_accuracy": 0.7822961673140526, | |
| "num_tokens": 315066430.0, | |
| "step": 4280, | |
| "train_ppl": 2.57272 | |
| }, | |
| { | |
| "ce_loss": 0.9851, | |
| "epoch": 0.6207607575017635, | |
| "grad_norm": 1.0859375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1735044010144713e-05, | |
| "loss": 0.9851, | |
| "mean_token_accuracy": 0.7730609364807606, | |
| "num_tokens": 315802006.0, | |
| "step": 4290, | |
| "train_ppl": 2.678082 | |
| }, | |
| { | |
| "ce_loss": 0.9502, | |
| "epoch": 0.6222077522744949, | |
| "grad_norm": 0.984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1690287930777263e-05, | |
| "loss": 0.9502, | |
| "mean_token_accuracy": 0.7806099034845829, | |
| "num_tokens": 316597439.0, | |
| "step": 4300, | |
| "train_ppl": 2.586201 | |
| }, | |
| { | |
| "ce_loss": 0.9809, | |
| "epoch": 0.6236547470472263, | |
| "grad_norm": 0.94140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1645531851409816e-05, | |
| "loss": 0.9809, | |
| "mean_token_accuracy": 0.773340854048729, | |
| "num_tokens": 317357015.0, | |
| "step": 4310, | |
| "train_ppl": 2.666982 | |
| }, | |
| { | |
| "ce_loss": 0.9792, | |
| "epoch": 0.6251017418199577, | |
| "grad_norm": 0.9921875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.160077577204237e-05, | |
| "loss": 0.9792, | |
| "mean_token_accuracy": 0.7763313055038452, | |
| "num_tokens": 318074229.0, | |
| "step": 4320, | |
| "train_ppl": 2.662203 | |
| }, | |
| { | |
| "ce_loss": 0.9621, | |
| "epoch": 0.6265487365926891, | |
| "grad_norm": 1.1640625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1556019692674922e-05, | |
| "loss": 0.9621, | |
| "mean_token_accuracy": 0.775955218076706, | |
| "num_tokens": 318793337.0, | |
| "step": 4330, | |
| "train_ppl": 2.617267 | |
| }, | |
| { | |
| "ce_loss": 0.9433, | |
| "epoch": 0.6279957313654204, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1511263613307475e-05, | |
| "loss": 0.9433, | |
| "mean_token_accuracy": 0.7845971286296844, | |
| "num_tokens": 319523789.0, | |
| "step": 4340, | |
| "train_ppl": 2.568444 | |
| }, | |
| { | |
| "ce_loss": 0.9728, | |
| "epoch": 0.6294427261381518, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1466507533940027e-05, | |
| "loss": 0.9728, | |
| "mean_token_accuracy": 0.7732916258275508, | |
| "num_tokens": 320236607.0, | |
| "step": 4350, | |
| "train_ppl": 2.645373 | |
| }, | |
| { | |
| "ce_loss": 0.9608, | |
| "epoch": 0.6308897209108832, | |
| "grad_norm": 1.1796875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.142175145457258e-05, | |
| "loss": 0.9608, | |
| "mean_token_accuracy": 0.7798072099685669, | |
| "num_tokens": 320964949.0, | |
| "step": 4360, | |
| "train_ppl": 2.613791 | |
| }, | |
| { | |
| "ce_loss": 0.9866, | |
| "epoch": 0.6323367156836146, | |
| "grad_norm": 1.171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1376995375205132e-05, | |
| "loss": 0.9866, | |
| "mean_token_accuracy": 0.7727800719439983, | |
| "num_tokens": 321671284.0, | |
| "step": 4370, | |
| "train_ppl": 2.682008 | |
| }, | |
| { | |
| "ce_loss": 0.9446, | |
| "epoch": 0.633783710456346, | |
| "grad_norm": 0.90625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1332239295837685e-05, | |
| "loss": 0.9446, | |
| "mean_token_accuracy": 0.7807809986174107, | |
| "num_tokens": 322413391.0, | |
| "step": 4380, | |
| "train_ppl": 2.571716 | |
| }, | |
| { | |
| "ce_loss": 0.9443, | |
| "epoch": 0.6352307052290773, | |
| "grad_norm": 1.1953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1287483216470237e-05, | |
| "loss": 0.9443, | |
| "mean_token_accuracy": 0.7804166525602341, | |
| "num_tokens": 323139704.0, | |
| "step": 4390, | |
| "train_ppl": 2.570885 | |
| }, | |
| { | |
| "ce_loss": 0.9331, | |
| "epoch": 0.6366777000018088, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1242727137102791e-05, | |
| "loss": 0.9331, | |
| "mean_token_accuracy": 0.7856282263994216, | |
| "num_tokens": 323894610.0, | |
| "step": 4400, | |
| "train_ppl": 2.54235 | |
| }, | |
| { | |
| "ce_loss": 1.0027, | |
| "epoch": 0.6381246947745401, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1197971057735342e-05, | |
| "loss": 1.0027, | |
| "mean_token_accuracy": 0.7679429657757282, | |
| "num_tokens": 324636289.0, | |
| "step": 4410, | |
| "train_ppl": 2.725621 | |
| }, | |
| { | |
| "ce_loss": 0.981, | |
| "epoch": 0.6395716895472715, | |
| "grad_norm": 0.8828125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1153214978367894e-05, | |
| "loss": 0.981, | |
| "mean_token_accuracy": 0.7753245957195759, | |
| "num_tokens": 325386589.0, | |
| "step": 4420, | |
| "train_ppl": 2.667189 | |
| }, | |
| { | |
| "ce_loss": 0.9547, | |
| "epoch": 0.6410186843200029, | |
| "grad_norm": 0.9375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1108458899000447e-05, | |
| "loss": 0.9547, | |
| "mean_token_accuracy": 0.778544618934393, | |
| "num_tokens": 326155177.0, | |
| "step": 4430, | |
| "train_ppl": 2.597782 | |
| }, | |
| { | |
| "ce_loss": 0.9627, | |
| "epoch": 0.6424656790927343, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1063702819633001e-05, | |
| "loss": 0.9627, | |
| "mean_token_accuracy": 0.7790204137563705, | |
| "num_tokens": 326889827.0, | |
| "step": 4440, | |
| "train_ppl": 2.618685 | |
| }, | |
| { | |
| "ce_loss": 0.9919, | |
| "epoch": 0.6439126738654657, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1018946740265554e-05, | |
| "loss": 0.9919, | |
| "mean_token_accuracy": 0.7769460953772068, | |
| "num_tokens": 327593189.0, | |
| "step": 4450, | |
| "train_ppl": 2.69623 | |
| }, | |
| { | |
| "ce_loss": 0.9627, | |
| "epoch": 0.645359668638197, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.0974190660898106e-05, | |
| "loss": 0.9627, | |
| "mean_token_accuracy": 0.7764194391667842, | |
| "num_tokens": 328366781.0, | |
| "step": 4460, | |
| "train_ppl": 2.618665 | |
| }, | |
| { | |
| "ce_loss": 0.9249, | |
| "epoch": 0.6468066634109284, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.0929434581530658e-05, | |
| "loss": 0.9249, | |
| "mean_token_accuracy": 0.779874175786972, | |
| "num_tokens": 329095559.0, | |
| "step": 4470, | |
| "train_ppl": 2.521557 | |
| }, | |
| { | |
| "ce_loss": 0.9713, | |
| "epoch": 0.6482536581836598, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.0884678502163211e-05, | |
| "loss": 0.9713, | |
| "mean_token_accuracy": 0.7740052983164787, | |
| "num_tokens": 329811677.0, | |
| "step": 4480, | |
| "train_ppl": 2.641304 | |
| }, | |
| { | |
| "ce_loss": 0.9528, | |
| "epoch": 0.6497006529563912, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.0839922422795763e-05, | |
| "loss": 0.9528, | |
| "mean_token_accuracy": 0.7821832969784737, | |
| "num_tokens": 330551710.0, | |
| "step": 4490, | |
| "train_ppl": 2.592979 | |
| }, | |
| { | |
| "ce_loss": 0.9515, | |
| "epoch": 0.6511476477291226, | |
| "grad_norm": 0.99609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.0795166343428316e-05, | |
| "loss": 0.9515, | |
| "mean_token_accuracy": 0.7812347248196602, | |
| "num_tokens": 331296938.0, | |
| "step": 4500, | |
| "train_ppl": 2.589622 | |
| }, | |
| { | |
| "ce_loss": 0.9432, | |
| "epoch": 0.652594642501854, | |
| "grad_norm": 0.91796875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.075041026406087e-05, | |
| "loss": 0.9432, | |
| "mean_token_accuracy": 0.7813379496335984, | |
| "num_tokens": 332025952.0, | |
| "step": 4510, | |
| "train_ppl": 2.568238 | |
| }, | |
| { | |
| "ce_loss": 1.0099, | |
| "epoch": 0.6540416372745853, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.070565418469342e-05, | |
| "loss": 1.0099, | |
| "mean_token_accuracy": 0.7635823853313923, | |
| "num_tokens": 332771616.0, | |
| "step": 4520, | |
| "train_ppl": 2.745205 | |
| }, | |
| { | |
| "ce_loss": 0.9694, | |
| "epoch": 0.6554886320473168, | |
| "grad_norm": 0.87890625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.0660898105325973e-05, | |
| "loss": 0.9694, | |
| "mean_token_accuracy": 0.7710436776280403, | |
| "num_tokens": 333522538.0, | |
| "step": 4530, | |
| "train_ppl": 2.636479 | |
| }, | |
| { | |
| "ce_loss": 0.9682, | |
| "epoch": 0.6569356268200481, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.0616142025958526e-05, | |
| "loss": 0.9682, | |
| "mean_token_accuracy": 0.7808797568082809, | |
| "num_tokens": 334235618.0, | |
| "step": 4540, | |
| "train_ppl": 2.633224 | |
| }, | |
| { | |
| "ce_loss": 0.9577, | |
| "epoch": 0.6583826215927795, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.057138594659108e-05, | |
| "loss": 0.9577, | |
| "mean_token_accuracy": 0.7794765748083592, | |
| "num_tokens": 334986466.0, | |
| "step": 4550, | |
| "train_ppl": 2.605761 | |
| }, | |
| { | |
| "ce_loss": 0.9243, | |
| "epoch": 0.6598296163655109, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.0526629867223632e-05, | |
| "loss": 0.9243, | |
| "mean_token_accuracy": 0.788041090220213, | |
| "num_tokens": 335711214.0, | |
| "step": 4560, | |
| "train_ppl": 2.520199 | |
| }, | |
| { | |
| "ce_loss": 0.9528, | |
| "epoch": 0.6612766111382422, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.0481873787856185e-05, | |
| "loss": 0.9528, | |
| "mean_token_accuracy": 0.7787193424999714, | |
| "num_tokens": 336437137.0, | |
| "step": 4570, | |
| "train_ppl": 2.592964 | |
| }, | |
| { | |
| "ce_loss": 0.9448, | |
| "epoch": 0.6627236059109737, | |
| "grad_norm": 0.8828125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.0437117708488735e-05, | |
| "loss": 0.9448, | |
| "mean_token_accuracy": 0.7806118883192539, | |
| "num_tokens": 337180631.0, | |
| "step": 4580, | |
| "train_ppl": 2.572427 | |
| }, | |
| { | |
| "ce_loss": 0.954, | |
| "epoch": 0.664170600683705, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.039236162912129e-05, | |
| "loss": 0.954, | |
| "mean_token_accuracy": 0.7802353672683239, | |
| "num_tokens": 337939742.0, | |
| "step": 4590, | |
| "train_ppl": 2.596065 | |
| }, | |
| { | |
| "ce_loss": 0.9637, | |
| "epoch": 0.6656175954564364, | |
| "grad_norm": 0.94921875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.0347605549753842e-05, | |
| "loss": 0.9637, | |
| "mean_token_accuracy": 0.7783378548920155, | |
| "num_tokens": 338675720.0, | |
| "step": 4600, | |
| "train_ppl": 2.621249 | |
| }, | |
| { | |
| "ce_loss": 0.9487, | |
| "epoch": 0.6670645902291678, | |
| "grad_norm": 1.2109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.0302849470386394e-05, | |
| "loss": 0.9487, | |
| "mean_token_accuracy": 0.7817958757281304, | |
| "num_tokens": 339387696.0, | |
| "step": 4610, | |
| "train_ppl": 2.582235 | |
| }, | |
| { | |
| "ce_loss": 0.9513, | |
| "epoch": 0.6685115850018992, | |
| "grad_norm": 0.9921875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.0258093391018948e-05, | |
| "loss": 0.9513, | |
| "mean_token_accuracy": 0.7807927936315536, | |
| "num_tokens": 340133225.0, | |
| "step": 4620, | |
| "train_ppl": 2.58913 | |
| }, | |
| { | |
| "ce_loss": 1.0216, | |
| "epoch": 0.6699585797746306, | |
| "grad_norm": 1.1796875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.02133373116515e-05, | |
| "loss": 1.0216, | |
| "mean_token_accuracy": 0.7636558651924134, | |
| "num_tokens": 340874723.0, | |
| "step": 4630, | |
| "train_ppl": 2.777752 | |
| }, | |
| { | |
| "ce_loss": 1.0065, | |
| "epoch": 0.6714055745473619, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.0168581232284052e-05, | |
| "loss": 1.0065, | |
| "mean_token_accuracy": 0.7711653731763363, | |
| "num_tokens": 341581981.0, | |
| "step": 4640, | |
| "train_ppl": 2.736106 | |
| }, | |
| { | |
| "ce_loss": 0.9494, | |
| "epoch": 0.6728525693200933, | |
| "grad_norm": 0.94921875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.0123825152916604e-05, | |
| "loss": 0.9494, | |
| "mean_token_accuracy": 0.7801486007869244, | |
| "num_tokens": 342305325.0, | |
| "step": 4650, | |
| "train_ppl": 2.584225 | |
| }, | |
| { | |
| "ce_loss": 1.0076, | |
| "epoch": 0.6742995640928248, | |
| "grad_norm": 0.99609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.0079069073549158e-05, | |
| "loss": 1.0076, | |
| "mean_token_accuracy": 0.7673116207122803, | |
| "num_tokens": 343028770.0, | |
| "step": 4660, | |
| "train_ppl": 2.739132 | |
| }, | |
| { | |
| "ce_loss": 0.9494, | |
| "epoch": 0.6757465588655561, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.003431299418171e-05, | |
| "loss": 0.9494, | |
| "mean_token_accuracy": 0.7784094549715519, | |
| "num_tokens": 343727815.0, | |
| "step": 4670, | |
| "train_ppl": 2.58426 | |
| }, | |
| { | |
| "ce_loss": 0.9739, | |
| "epoch": 0.6771935536382875, | |
| "grad_norm": 0.86328125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.989556914814263e-06, | |
| "loss": 0.9739, | |
| "mean_token_accuracy": 0.7748332381248474, | |
| "num_tokens": 344496287.0, | |
| "step": 4680, | |
| "train_ppl": 2.648136 | |
| }, | |
| { | |
| "ce_loss": 0.9277, | |
| "epoch": 0.6786405484110188, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.944800835446814e-06, | |
| "loss": 0.9277, | |
| "mean_token_accuracy": 0.7852459564805031, | |
| "num_tokens": 345252142.0, | |
| "step": 4690, | |
| "train_ppl": 2.528671 | |
| }, | |
| { | |
| "ce_loss": 0.9513, | |
| "epoch": 0.6800875431837502, | |
| "grad_norm": 0.8984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.900044756079368e-06, | |
| "loss": 0.9513, | |
| "mean_token_accuracy": 0.7755139887332916, | |
| "num_tokens": 345968711.0, | |
| "step": 4700, | |
| "train_ppl": 2.588961 | |
| }, | |
| { | |
| "ce_loss": 0.9771, | |
| "epoch": 0.6815345379564817, | |
| "grad_norm": 1.0703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.85528867671192e-06, | |
| "loss": 0.9771, | |
| "mean_token_accuracy": 0.7777153819799423, | |
| "num_tokens": 346713582.0, | |
| "step": 4710, | |
| "train_ppl": 2.656647 | |
| }, | |
| { | |
| "ce_loss": 0.9743, | |
| "epoch": 0.682981532729213, | |
| "grad_norm": 1.0703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.810532597344473e-06, | |
| "loss": 0.9743, | |
| "mean_token_accuracy": 0.7767357155680656, | |
| "num_tokens": 347439699.0, | |
| "step": 4720, | |
| "train_ppl": 2.64929 | |
| }, | |
| { | |
| "ce_loss": 0.9481, | |
| "epoch": 0.6844285275019444, | |
| "grad_norm": 0.94140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.765776517977025e-06, | |
| "loss": 0.9481, | |
| "mean_token_accuracy": 0.7791095830500125, | |
| "num_tokens": 348184084.0, | |
| "step": 4730, | |
| "train_ppl": 2.580792 | |
| }, | |
| { | |
| "ce_loss": 0.9604, | |
| "epoch": 0.6858755222746757, | |
| "grad_norm": 0.89453125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.721020438609578e-06, | |
| "loss": 0.9604, | |
| "mean_token_accuracy": 0.7775398962199688, | |
| "num_tokens": 348919169.0, | |
| "step": 4740, | |
| "train_ppl": 2.612626 | |
| }, | |
| { | |
| "ce_loss": 0.8995, | |
| "epoch": 0.6873225170474072, | |
| "grad_norm": 1.140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.67626435924213e-06, | |
| "loss": 0.8995, | |
| "mean_token_accuracy": 0.7857723847031594, | |
| "num_tokens": 349661624.0, | |
| "step": 4750, | |
| "train_ppl": 2.458453 | |
| }, | |
| { | |
| "ce_loss": 0.9861, | |
| "epoch": 0.6887695118201386, | |
| "grad_norm": 1.25, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.631508279874683e-06, | |
| "loss": 0.9861, | |
| "mean_token_accuracy": 0.7729386761784554, | |
| "num_tokens": 350399970.0, | |
| "step": 4760, | |
| "train_ppl": 2.680691 | |
| }, | |
| { | |
| "ce_loss": 0.9508, | |
| "epoch": 0.6902165065928699, | |
| "grad_norm": 0.96875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.586752200507235e-06, | |
| "loss": 0.9508, | |
| "mean_token_accuracy": 0.778910332173109, | |
| "num_tokens": 351129477.0, | |
| "step": 4770, | |
| "train_ppl": 2.587908 | |
| }, | |
| { | |
| "ce_loss": 0.948, | |
| "epoch": 0.6916635013656013, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.54199612113979e-06, | |
| "loss": 0.948, | |
| "mean_token_accuracy": 0.7814707688987255, | |
| "num_tokens": 351858724.0, | |
| "step": 4780, | |
| "train_ppl": 2.580426 | |
| }, | |
| { | |
| "ce_loss": 0.9298, | |
| "epoch": 0.6931104961383328, | |
| "grad_norm": 0.8203125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.497240041772342e-06, | |
| "loss": 0.9298, | |
| "mean_token_accuracy": 0.7840299472212792, | |
| "num_tokens": 352600340.0, | |
| "step": 4790, | |
| "train_ppl": 2.533983 | |
| }, | |
| { | |
| "ce_loss": 0.9513, | |
| "epoch": 0.6945574909110641, | |
| "grad_norm": 1.2421875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.452483962404893e-06, | |
| "loss": 0.9513, | |
| "mean_token_accuracy": 0.7826124854385853, | |
| "num_tokens": 353357441.0, | |
| "step": 4800, | |
| "train_ppl": 2.589095 | |
| }, | |
| { | |
| "ce_loss": 0.9323, | |
| "epoch": 0.6960044856837955, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.407727883037447e-06, | |
| "loss": 0.9323, | |
| "mean_token_accuracy": 0.787242216616869, | |
| "num_tokens": 354113021.0, | |
| "step": 4810, | |
| "train_ppl": 2.540341 | |
| }, | |
| { | |
| "ce_loss": 0.9677, | |
| "epoch": 0.6974514804565268, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.362971803669999e-06, | |
| "loss": 0.9677, | |
| "mean_token_accuracy": 0.7780552484095097, | |
| "num_tokens": 354852637.0, | |
| "step": 4820, | |
| "train_ppl": 2.631944 | |
| }, | |
| { | |
| "ce_loss": 0.9494, | |
| "epoch": 0.6988984752292582, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.318215724302552e-06, | |
| "loss": 0.9494, | |
| "mean_token_accuracy": 0.7799071431159973, | |
| "num_tokens": 355576304.0, | |
| "step": 4830, | |
| "train_ppl": 2.584123 | |
| }, | |
| { | |
| "ce_loss": 0.9728, | |
| "epoch": 0.7003454700019897, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.273459644935104e-06, | |
| "loss": 0.9728, | |
| "mean_token_accuracy": 0.7771174512803555, | |
| "num_tokens": 356285418.0, | |
| "step": 4840, | |
| "train_ppl": 2.645322 | |
| }, | |
| { | |
| "ce_loss": 0.9722, | |
| "epoch": 0.701792464774721, | |
| "grad_norm": 0.9921875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.228703565567656e-06, | |
| "loss": 0.9722, | |
| "mean_token_accuracy": 0.7724181763827801, | |
| "num_tokens": 357011227.0, | |
| "step": 4850, | |
| "train_ppl": 2.643664 | |
| }, | |
| { | |
| "ce_loss": 0.9436, | |
| "epoch": 0.7032394595474524, | |
| "grad_norm": 1.5078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.183947486200209e-06, | |
| "loss": 0.9436, | |
| "mean_token_accuracy": 0.7861829474568367, | |
| "num_tokens": 357765044.0, | |
| "step": 4860, | |
| "train_ppl": 2.569213 | |
| }, | |
| { | |
| "ce_loss": 0.9813, | |
| "epoch": 0.7046864543201837, | |
| "grad_norm": 1.2578125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.139191406832761e-06, | |
| "loss": 0.9813, | |
| "mean_token_accuracy": 0.7709318250417709, | |
| "num_tokens": 358480087.0, | |
| "step": 4870, | |
| "train_ppl": 2.667803 | |
| }, | |
| { | |
| "ce_loss": 0.9635, | |
| "epoch": 0.7061334490929152, | |
| "grad_norm": 0.91015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.094435327465314e-06, | |
| "loss": 0.9635, | |
| "mean_token_accuracy": 0.7794269703328609, | |
| "num_tokens": 359225911.0, | |
| "step": 4880, | |
| "train_ppl": 2.620869 | |
| }, | |
| { | |
| "ce_loss": 0.97, | |
| "epoch": 0.7075804438656466, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.049679248097868e-06, | |
| "loss": 0.97, | |
| "mean_token_accuracy": 0.777967818826437, | |
| "num_tokens": 359966433.0, | |
| "step": 4890, | |
| "train_ppl": 2.637852 | |
| }, | |
| { | |
| "ce_loss": 0.9711, | |
| "epoch": 0.7090274386383779, | |
| "grad_norm": 0.984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.00492316873042e-06, | |
| "loss": 0.9711, | |
| "mean_token_accuracy": 0.7772382542490959, | |
| "num_tokens": 360710714.0, | |
| "step": 4900, | |
| "train_ppl": 2.640824 | |
| }, | |
| { | |
| "ce_loss": 0.9834, | |
| "epoch": 0.7104744334111093, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.960167089362971e-06, | |
| "loss": 0.9834, | |
| "mean_token_accuracy": 0.7759847708046437, | |
| "num_tokens": 361431042.0, | |
| "step": 4910, | |
| "train_ppl": 2.673438 | |
| }, | |
| { | |
| "ce_loss": 0.9929, | |
| "epoch": 0.7119214281838406, | |
| "grad_norm": 1.1796875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.915411009995524e-06, | |
| "loss": 0.9929, | |
| "mean_token_accuracy": 0.7740428909659386, | |
| "num_tokens": 362150095.0, | |
| "step": 4920, | |
| "train_ppl": 2.699036 | |
| }, | |
| { | |
| "ce_loss": 0.8871, | |
| "epoch": 0.7133684229565721, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.870654930628078e-06, | |
| "loss": 0.8871, | |
| "mean_token_accuracy": 0.7937179610133172, | |
| "num_tokens": 362916644.0, | |
| "step": 4930, | |
| "train_ppl": 2.428081 | |
| }, | |
| { | |
| "ce_loss": 0.9567, | |
| "epoch": 0.7148154177293035, | |
| "grad_norm": 0.99609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.82589885126063e-06, | |
| "loss": 0.9567, | |
| "mean_token_accuracy": 0.7758529260754585, | |
| "num_tokens": 363661364.0, | |
| "step": 4940, | |
| "train_ppl": 2.603105 | |
| }, | |
| { | |
| "ce_loss": 0.9611, | |
| "epoch": 0.7162624125020348, | |
| "grad_norm": 0.94921875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.781142771893183e-06, | |
| "loss": 0.9611, | |
| "mean_token_accuracy": 0.7716841556131839, | |
| "num_tokens": 364395584.0, | |
| "step": 4950, | |
| "train_ppl": 2.614648 | |
| }, | |
| { | |
| "ce_loss": 0.9578, | |
| "epoch": 0.7177094072747662, | |
| "grad_norm": 1.2265625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.736386692525735e-06, | |
| "loss": 0.9578, | |
| "mean_token_accuracy": 0.7815270647406578, | |
| "num_tokens": 365122476.0, | |
| "step": 4960, | |
| "train_ppl": 2.605926 | |
| }, | |
| { | |
| "ce_loss": 0.9854, | |
| "epoch": 0.7191564020474976, | |
| "grad_norm": 0.9375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.691630613158287e-06, | |
| "loss": 0.9854, | |
| "mean_token_accuracy": 0.7658473886549473, | |
| "num_tokens": 365839126.0, | |
| "step": 4970, | |
| "train_ppl": 2.678892 | |
| }, | |
| { | |
| "ce_loss": 0.9621, | |
| "epoch": 0.720603396820229, | |
| "grad_norm": 0.9453125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.64687453379084e-06, | |
| "loss": 0.9621, | |
| "mean_token_accuracy": 0.7814343258738518, | |
| "num_tokens": 366576655.0, | |
| "step": 4980, | |
| "train_ppl": 2.617123 | |
| }, | |
| { | |
| "ce_loss": 1.0258, | |
| "epoch": 0.7220503915929604, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.602118454423392e-06, | |
| "loss": 1.0258, | |
| "mean_token_accuracy": 0.763127225637436, | |
| "num_tokens": 367298471.0, | |
| "step": 4990, | |
| "train_ppl": 2.789273 | |
| }, | |
| { | |
| "ce_loss": 0.9444, | |
| "epoch": 0.7234973863656917, | |
| "grad_norm": 1.2890625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.557362375055947e-06, | |
| "loss": 0.9444, | |
| "mean_token_accuracy": 0.780534103512764, | |
| "num_tokens": 368033809.0, | |
| "step": 5000, | |
| "train_ppl": 2.571163 | |
| }, | |
| { | |
| "ce_loss": 0.9551, | |
| "epoch": 0.7249443811384232, | |
| "grad_norm": 0.99609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.512606295688499e-06, | |
| "loss": 0.9551, | |
| "mean_token_accuracy": 0.7752326272428036, | |
| "num_tokens": 368778901.0, | |
| "step": 5010, | |
| "train_ppl": 2.599014 | |
| }, | |
| { | |
| "ce_loss": 0.9666, | |
| "epoch": 0.7263913759111545, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.46785021632105e-06, | |
| "loss": 0.9666, | |
| "mean_token_accuracy": 0.7790293991565704, | |
| "num_tokens": 369523679.0, | |
| "step": 5020, | |
| "train_ppl": 2.629102 | |
| }, | |
| { | |
| "ce_loss": 0.9558, | |
| "epoch": 0.7278383706838859, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.423094136953602e-06, | |
| "loss": 0.9558, | |
| "mean_token_accuracy": 0.7781360924243927, | |
| "num_tokens": 370232105.0, | |
| "step": 5030, | |
| "train_ppl": 2.60069 | |
| }, | |
| { | |
| "ce_loss": 0.9697, | |
| "epoch": 0.7292853654566173, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.378338057586156e-06, | |
| "loss": 0.9697, | |
| "mean_token_accuracy": 0.7776457980275154, | |
| "num_tokens": 370983473.0, | |
| "step": 5040, | |
| "train_ppl": 2.637224 | |
| }, | |
| { | |
| "ce_loss": 0.9737, | |
| "epoch": 0.7307323602293486, | |
| "grad_norm": 0.89453125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.333581978218709e-06, | |
| "loss": 0.9737, | |
| "mean_token_accuracy": 0.7714293286204338, | |
| "num_tokens": 371688241.0, | |
| "step": 5050, | |
| "train_ppl": 2.647609 | |
| }, | |
| { | |
| "ce_loss": 0.9645, | |
| "epoch": 0.7321793550020801, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.288825898851261e-06, | |
| "loss": 0.9645, | |
| "mean_token_accuracy": 0.7733834199607372, | |
| "num_tokens": 372423026.0, | |
| "step": 5060, | |
| "train_ppl": 2.623403 | |
| }, | |
| { | |
| "ce_loss": 0.9878, | |
| "epoch": 0.7336263497748114, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.244069819483812e-06, | |
| "loss": 0.9878, | |
| "mean_token_accuracy": 0.7733451426029205, | |
| "num_tokens": 373159103.0, | |
| "step": 5070, | |
| "train_ppl": 2.685398 | |
| }, | |
| { | |
| "ce_loss": 0.9405, | |
| "epoch": 0.7350733445475428, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.199313740116366e-06, | |
| "loss": 0.9405, | |
| "mean_token_accuracy": 0.7828592106699943, | |
| "num_tokens": 373883566.0, | |
| "step": 5080, | |
| "train_ppl": 2.561212 | |
| }, | |
| { | |
| "ce_loss": 0.9523, | |
| "epoch": 0.7365203393202742, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.154557660748919e-06, | |
| "loss": 0.9523, | |
| "mean_token_accuracy": 0.7811919517815114, | |
| "num_tokens": 374630857.0, | |
| "step": 5090, | |
| "train_ppl": 2.59161 | |
| }, | |
| { | |
| "ce_loss": 0.9657, | |
| "epoch": 0.7379673340930056, | |
| "grad_norm": 1.0703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.109801581381471e-06, | |
| "loss": 0.9657, | |
| "mean_token_accuracy": 0.7764380730688571, | |
| "num_tokens": 375369612.0, | |
| "step": 5100, | |
| "train_ppl": 2.626685 | |
| }, | |
| { | |
| "ce_loss": 0.9604, | |
| "epoch": 0.739414328865737, | |
| "grad_norm": 1.171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.065045502014025e-06, | |
| "loss": 0.9604, | |
| "mean_token_accuracy": 0.7770444475114345, | |
| "num_tokens": 376090335.0, | |
| "step": 5110, | |
| "train_ppl": 2.61263 | |
| }, | |
| { | |
| "ce_loss": 1.002, | |
| "epoch": 0.7408613236384683, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.020289422646576e-06, | |
| "loss": 1.002, | |
| "mean_token_accuracy": 0.7697369538247585, | |
| "num_tokens": 376821458.0, | |
| "step": 5120, | |
| "train_ppl": 2.72377 | |
| }, | |
| { | |
| "ce_loss": 0.9565, | |
| "epoch": 0.7423083184111997, | |
| "grad_norm": 0.953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.975533343279128e-06, | |
| "loss": 0.9565, | |
| "mean_token_accuracy": 0.7750547006726265, | |
| "num_tokens": 377545855.0, | |
| "step": 5130, | |
| "train_ppl": 2.602465 | |
| }, | |
| { | |
| "ce_loss": 0.9469, | |
| "epoch": 0.7437553131839312, | |
| "grad_norm": 1.1875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.93077726391168e-06, | |
| "loss": 0.9469, | |
| "mean_token_accuracy": 0.7794501177966595, | |
| "num_tokens": 378284520.0, | |
| "step": 5140, | |
| "train_ppl": 2.577716 | |
| }, | |
| { | |
| "ce_loss": 0.9937, | |
| "epoch": 0.7452023079566625, | |
| "grad_norm": 0.9921875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.886021184544235e-06, | |
| "loss": 0.9937, | |
| "mean_token_accuracy": 0.7733355782926082, | |
| "num_tokens": 379035001.0, | |
| "step": 5150, | |
| "train_ppl": 2.701191 | |
| }, | |
| { | |
| "ce_loss": 0.97, | |
| "epoch": 0.7466493027293939, | |
| "grad_norm": 0.98046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.841265105176787e-06, | |
| "loss": 0.97, | |
| "mean_token_accuracy": 0.7776248715817928, | |
| "num_tokens": 379752153.0, | |
| "step": 5160, | |
| "train_ppl": 2.638073 | |
| }, | |
| { | |
| "ce_loss": 0.9501, | |
| "epoch": 0.7480962975021253, | |
| "grad_norm": 0.8515625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.79650902580934e-06, | |
| "loss": 0.9501, | |
| "mean_token_accuracy": 0.7786346770823002, | |
| "num_tokens": 380519482.0, | |
| "step": 5170, | |
| "train_ppl": 2.586042 | |
| }, | |
| { | |
| "ce_loss": 0.9668, | |
| "epoch": 0.7495432922748566, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.75175294644189e-06, | |
| "loss": 0.9668, | |
| "mean_token_accuracy": 0.7759903006255626, | |
| "num_tokens": 381261662.0, | |
| "step": 5180, | |
| "train_ppl": 2.629544 | |
| }, | |
| { | |
| "ce_loss": 0.9573, | |
| "epoch": 0.7509902870475881, | |
| "grad_norm": 1.15625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.706996867074445e-06, | |
| "loss": 0.9573, | |
| "mean_token_accuracy": 0.7775361500680447, | |
| "num_tokens": 382020074.0, | |
| "step": 5190, | |
| "train_ppl": 2.604706 | |
| }, | |
| { | |
| "ce_loss": 0.9541, | |
| "epoch": 0.7524372818203194, | |
| "grad_norm": 0.9765625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.662240787706997e-06, | |
| "loss": 0.9541, | |
| "mean_token_accuracy": 0.7822102926671505, | |
| "num_tokens": 382778555.0, | |
| "step": 5200, | |
| "train_ppl": 2.596456 | |
| }, | |
| { | |
| "ce_loss": 1.0105, | |
| "epoch": 0.7538842765930508, | |
| "grad_norm": 0.9453125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.61748470833955e-06, | |
| "loss": 1.0105, | |
| "mean_token_accuracy": 0.7733402147889137, | |
| "num_tokens": 383501391.0, | |
| "step": 5210, | |
| "train_ppl": 2.746933 | |
| }, | |
| { | |
| "ce_loss": 0.9784, | |
| "epoch": 0.7553312713657822, | |
| "grad_norm": 0.9375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.572728628972101e-06, | |
| "loss": 0.9784, | |
| "mean_token_accuracy": 0.7757657401263713, | |
| "num_tokens": 384255141.0, | |
| "step": 5220, | |
| "train_ppl": 2.660156 | |
| }, | |
| { | |
| "ce_loss": 0.984, | |
| "epoch": 0.7567782661385136, | |
| "grad_norm": 0.93359375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.527972549604655e-06, | |
| "loss": 0.984, | |
| "mean_token_accuracy": 0.7741045750677585, | |
| "num_tokens": 385007740.0, | |
| "step": 5230, | |
| "train_ppl": 2.675041 | |
| }, | |
| { | |
| "ce_loss": 0.9386, | |
| "epoch": 0.758225260911245, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.483216470237208e-06, | |
| "loss": 0.9386, | |
| "mean_token_accuracy": 0.778788211196661, | |
| "num_tokens": 385746131.0, | |
| "step": 5240, | |
| "train_ppl": 2.556274 | |
| }, | |
| { | |
| "ce_loss": 0.9838, | |
| "epoch": 0.7596722556839763, | |
| "grad_norm": 0.99609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.438460390869759e-06, | |
| "loss": 0.9838, | |
| "mean_token_accuracy": 0.7773367874324322, | |
| "num_tokens": 386477070.0, | |
| "step": 5250, | |
| "train_ppl": 2.674711 | |
| }, | |
| { | |
| "ce_loss": 0.919, | |
| "epoch": 0.7611192504567077, | |
| "grad_norm": 0.94140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.393704311502313e-06, | |
| "loss": 0.919, | |
| "mean_token_accuracy": 0.7863423444330693, | |
| "num_tokens": 387230161.0, | |
| "step": 5260, | |
| "train_ppl": 2.506717 | |
| }, | |
| { | |
| "ce_loss": 0.9727, | |
| "epoch": 0.762566245229439, | |
| "grad_norm": 0.9609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.348948232134866e-06, | |
| "loss": 0.9727, | |
| "mean_token_accuracy": 0.7754369527101517, | |
| "num_tokens": 387918499.0, | |
| "step": 5270, | |
| "train_ppl": 2.645059 | |
| }, | |
| { | |
| "ce_loss": 0.9702, | |
| "epoch": 0.7640132400021705, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.3041921527674176e-06, | |
| "loss": 0.9702, | |
| "mean_token_accuracy": 0.7701122313737869, | |
| "num_tokens": 388648572.0, | |
| "step": 5280, | |
| "train_ppl": 2.638576 | |
| }, | |
| { | |
| "ce_loss": 0.9647, | |
| "epoch": 0.7654602347749019, | |
| "grad_norm": 0.96875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.259436073399971e-06, | |
| "loss": 0.9647, | |
| "mean_token_accuracy": 0.7734049685299397, | |
| "num_tokens": 389377954.0, | |
| "step": 5290, | |
| "train_ppl": 2.623948 | |
| }, | |
| { | |
| "ce_loss": 0.9537, | |
| "epoch": 0.7669072295476332, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.2146799940325225e-06, | |
| "loss": 0.9537, | |
| "mean_token_accuracy": 0.7833194971084595, | |
| "num_tokens": 390123270.0, | |
| "step": 5300, | |
| "train_ppl": 2.595421 | |
| }, | |
| { | |
| "ce_loss": 0.9901, | |
| "epoch": 0.7683542243203646, | |
| "grad_norm": 0.9140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.169923914665076e-06, | |
| "loss": 0.9901, | |
| "mean_token_accuracy": 0.7688067726790905, | |
| "num_tokens": 390821555.0, | |
| "step": 5310, | |
| "train_ppl": 2.691614 | |
| }, | |
| { | |
| "ce_loss": 0.9358, | |
| "epoch": 0.7698012190930961, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.125167835297628e-06, | |
| "loss": 0.9358, | |
| "mean_token_accuracy": 0.7849721722304821, | |
| "num_tokens": 391571244.0, | |
| "step": 5320, | |
| "train_ppl": 2.549222 | |
| }, | |
| { | |
| "ce_loss": 0.9291, | |
| "epoch": 0.7712482138658274, | |
| "grad_norm": 0.9921875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.080411755930181e-06, | |
| "loss": 0.9291, | |
| "mean_token_accuracy": 0.7855656445026398, | |
| "num_tokens": 392336959.0, | |
| "step": 5330, | |
| "train_ppl": 2.532116 | |
| }, | |
| { | |
| "ce_loss": 0.9654, | |
| "epoch": 0.7726952086385588, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.035655676562733e-06, | |
| "loss": 0.9654, | |
| "mean_token_accuracy": 0.7771142728626728, | |
| "num_tokens": 393084871.0, | |
| "step": 5340, | |
| "train_ppl": 2.625794 | |
| }, | |
| { | |
| "ce_loss": 0.9783, | |
| "epoch": 0.7741422034112901, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.990899597195286e-06, | |
| "loss": 0.9783, | |
| "mean_token_accuracy": 0.7791860036551952, | |
| "num_tokens": 393816389.0, | |
| "step": 5350, | |
| "train_ppl": 2.65986 | |
| }, | |
| { | |
| "ce_loss": 0.9563, | |
| "epoch": 0.7755891981840216, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.946143517827838e-06, | |
| "loss": 0.9563, | |
| "mean_token_accuracy": 0.7763482123613358, | |
| "num_tokens": 394555157.0, | |
| "step": 5360, | |
| "train_ppl": 2.601922 | |
| }, | |
| { | |
| "ce_loss": 0.9661, | |
| "epoch": 0.777036192956753, | |
| "grad_norm": 1.140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.901387438460391e-06, | |
| "loss": 0.9661, | |
| "mean_token_accuracy": 0.7747901313006877, | |
| "num_tokens": 395279049.0, | |
| "step": 5370, | |
| "train_ppl": 2.627785 | |
| }, | |
| { | |
| "ce_loss": 0.9884, | |
| "epoch": 0.7784831877294843, | |
| "grad_norm": 1.2265625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.856631359092944e-06, | |
| "loss": 0.9884, | |
| "mean_token_accuracy": 0.7725025109946728, | |
| "num_tokens": 396001112.0, | |
| "step": 5380, | |
| "train_ppl": 2.687061 | |
| }, | |
| { | |
| "ce_loss": 0.9704, | |
| "epoch": 0.7799301825022157, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.811875279725496e-06, | |
| "loss": 0.9704, | |
| "mean_token_accuracy": 0.7769171021878719, | |
| "num_tokens": 396728173.0, | |
| "step": 5390, | |
| "train_ppl": 2.638889 | |
| }, | |
| { | |
| "ce_loss": 0.993, | |
| "epoch": 0.781377177274947, | |
| "grad_norm": 1.1484375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.767119200358049e-06, | |
| "loss": 0.993, | |
| "mean_token_accuracy": 0.7736337415874004, | |
| "num_tokens": 397449602.0, | |
| "step": 5400, | |
| "train_ppl": 2.69944 | |
| }, | |
| { | |
| "ce_loss": 0.9458, | |
| "epoch": 0.7828241720476785, | |
| "grad_norm": 1.15625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.722363120990601e-06, | |
| "loss": 0.9458, | |
| "mean_token_accuracy": 0.7815995380282402, | |
| "num_tokens": 398215793.0, | |
| "step": 5410, | |
| "train_ppl": 2.57481 | |
| }, | |
| { | |
| "ce_loss": 0.9971, | |
| "epoch": 0.7842711668204099, | |
| "grad_norm": 1.171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.677607041623154e-06, | |
| "loss": 0.9971, | |
| "mean_token_accuracy": 0.7720453962683678, | |
| "num_tokens": 398935756.0, | |
| "step": 5420, | |
| "train_ppl": 2.710507 | |
| }, | |
| { | |
| "ce_loss": 0.9424, | |
| "epoch": 0.7857181615931412, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.632850962255707e-06, | |
| "loss": 0.9424, | |
| "mean_token_accuracy": 0.7884068295359612, | |
| "num_tokens": 399665412.0, | |
| "step": 5430, | |
| "train_ppl": 2.566172 | |
| }, | |
| { | |
| "ce_loss": 0.9487, | |
| "epoch": 0.7871651563658726, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.588094882888259e-06, | |
| "loss": 0.9487, | |
| "mean_token_accuracy": 0.7788920432329178, | |
| "num_tokens": 400397909.0, | |
| "step": 5440, | |
| "train_ppl": 2.582247 | |
| }, | |
| { | |
| "ce_loss": 0.9804, | |
| "epoch": 0.7886121511386041, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.543338803520812e-06, | |
| "loss": 0.9804, | |
| "mean_token_accuracy": 0.7754887655377388, | |
| "num_tokens": 401128916.0, | |
| "step": 5450, | |
| "train_ppl": 2.665399 | |
| }, | |
| { | |
| "ce_loss": 0.9368, | |
| "epoch": 0.7900591459113354, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.498582724153365e-06, | |
| "loss": 0.9368, | |
| "mean_token_accuracy": 0.7829912155866623, | |
| "num_tokens": 401864725.0, | |
| "step": 5460, | |
| "train_ppl": 2.551742 | |
| }, | |
| { | |
| "ce_loss": 0.914, | |
| "epoch": 0.7915061406840668, | |
| "grad_norm": 0.8984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.453826644785917e-06, | |
| "loss": 0.914, | |
| "mean_token_accuracy": 0.7870276011526585, | |
| "num_tokens": 402619013.0, | |
| "step": 5470, | |
| "train_ppl": 2.49429 | |
| }, | |
| { | |
| "ce_loss": 0.9494, | |
| "epoch": 0.7929531354567981, | |
| "grad_norm": 1.1953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.40907056541847e-06, | |
| "loss": 0.9494, | |
| "mean_token_accuracy": 0.7810823060572147, | |
| "num_tokens": 403360148.0, | |
| "step": 5480, | |
| "train_ppl": 2.584185 | |
| }, | |
| { | |
| "ce_loss": 0.9483, | |
| "epoch": 0.7944001302295296, | |
| "grad_norm": 0.94140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.3643144860510215e-06, | |
| "loss": 0.9483, | |
| "mean_token_accuracy": 0.7813143357634544, | |
| "num_tokens": 404097450.0, | |
| "step": 5490, | |
| "train_ppl": 2.581417 | |
| }, | |
| { | |
| "ce_loss": 0.9487, | |
| "epoch": 0.795847125002261, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.319558406683575e-06, | |
| "loss": 0.9487, | |
| "mean_token_accuracy": 0.7773936979472638, | |
| "num_tokens": 404828623.0, | |
| "step": 5500, | |
| "train_ppl": 2.582243 | |
| }, | |
| { | |
| "ce_loss": 0.9635, | |
| "epoch": 0.7972941197749923, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.274802327316127e-06, | |
| "loss": 0.9635, | |
| "mean_token_accuracy": 0.7771599672734737, | |
| "num_tokens": 405544900.0, | |
| "step": 5510, | |
| "train_ppl": 2.620934 | |
| }, | |
| { | |
| "ce_loss": 0.9981, | |
| "epoch": 0.7987411145477237, | |
| "grad_norm": 0.96484375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.23004624794868e-06, | |
| "loss": 0.9981, | |
| "mean_token_accuracy": 0.7708815522491932, | |
| "num_tokens": 406250286.0, | |
| "step": 5520, | |
| "train_ppl": 2.713164 | |
| }, | |
| { | |
| "ce_loss": 0.933, | |
| "epoch": 0.800188109320455, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.185290168581232e-06, | |
| "loss": 0.933, | |
| "mean_token_accuracy": 0.7810772813856601, | |
| "num_tokens": 407002048.0, | |
| "step": 5530, | |
| "train_ppl": 2.542244 | |
| }, | |
| { | |
| "ce_loss": 0.9519, | |
| "epoch": 0.8016351040931865, | |
| "grad_norm": 0.9453125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.140534089213785e-06, | |
| "loss": 0.9519, | |
| "mean_token_accuracy": 0.7769171491265296, | |
| "num_tokens": 407721865.0, | |
| "step": 5540, | |
| "train_ppl": 2.590526 | |
| }, | |
| { | |
| "ce_loss": 0.9631, | |
| "epoch": 0.8030820988659179, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.095778009846337e-06, | |
| "loss": 0.9631, | |
| "mean_token_accuracy": 0.7787568613886833, | |
| "num_tokens": 408443748.0, | |
| "step": 5550, | |
| "train_ppl": 2.619744 | |
| }, | |
| { | |
| "ce_loss": 0.9813, | |
| "epoch": 0.8045290936386492, | |
| "grad_norm": 1.1484375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.05102193047889e-06, | |
| "loss": 0.9813, | |
| "mean_token_accuracy": 0.7767161875963211, | |
| "num_tokens": 409181659.0, | |
| "step": 5560, | |
| "train_ppl": 2.667798 | |
| }, | |
| { | |
| "ce_loss": 0.9693, | |
| "epoch": 0.8059760884113806, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.006265851111443e-06, | |
| "loss": 0.9693, | |
| "mean_token_accuracy": 0.7756986141204834, | |
| "num_tokens": 409915769.0, | |
| "step": 5570, | |
| "train_ppl": 2.636003 | |
| }, | |
| { | |
| "ce_loss": 0.949, | |
| "epoch": 0.807423083184112, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.961509771743995e-06, | |
| "loss": 0.949, | |
| "mean_token_accuracy": 0.7831607341766358, | |
| "num_tokens": 410630144.0, | |
| "step": 5580, | |
| "train_ppl": 2.58318 | |
| }, | |
| { | |
| "ce_loss": 0.9709, | |
| "epoch": 0.8088700779568434, | |
| "grad_norm": 0.953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.9167536923765485e-06, | |
| "loss": 0.9709, | |
| "mean_token_accuracy": 0.7774527162313462, | |
| "num_tokens": 411368980.0, | |
| "step": 5590, | |
| "train_ppl": 2.640323 | |
| }, | |
| { | |
| "ce_loss": 0.9781, | |
| "epoch": 0.8103170727295748, | |
| "grad_norm": 1.1171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.8719976130091e-06, | |
| "loss": 0.9781, | |
| "mean_token_accuracy": 0.7690740667283535, | |
| "num_tokens": 412088296.0, | |
| "step": 5600, | |
| "train_ppl": 2.659381 | |
| }, | |
| { | |
| "ce_loss": 0.9521, | |
| "epoch": 0.8117640675023061, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.827241533641653e-06, | |
| "loss": 0.9521, | |
| "mean_token_accuracy": 0.7769833728671074, | |
| "num_tokens": 412841228.0, | |
| "step": 5610, | |
| "train_ppl": 2.591169 | |
| }, | |
| { | |
| "ce_loss": 0.9835, | |
| "epoch": 0.8132110622750375, | |
| "grad_norm": 0.953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.782485454274206e-06, | |
| "loss": 0.9835, | |
| "mean_token_accuracy": 0.7742873176932334, | |
| "num_tokens": 413566071.0, | |
| "step": 5620, | |
| "train_ppl": 2.673852 | |
| }, | |
| { | |
| "ce_loss": 0.9541, | |
| "epoch": 0.814658057047769, | |
| "grad_norm": 0.98046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.737729374906758e-06, | |
| "loss": 0.9541, | |
| "mean_token_accuracy": 0.7803828045725822, | |
| "num_tokens": 414300956.0, | |
| "step": 5630, | |
| "train_ppl": 2.596387 | |
| }, | |
| { | |
| "ce_loss": 0.9433, | |
| "epoch": 0.8161050518205003, | |
| "grad_norm": 1.1796875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.692973295539311e-06, | |
| "loss": 0.9433, | |
| "mean_token_accuracy": 0.7835976503789425, | |
| "num_tokens": 415039032.0, | |
| "step": 5640, | |
| "train_ppl": 2.568448 | |
| }, | |
| { | |
| "ce_loss": 0.9447, | |
| "epoch": 0.8175520465932317, | |
| "grad_norm": 1.359375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.648217216171864e-06, | |
| "loss": 0.9447, | |
| "mean_token_accuracy": 0.7802014254033566, | |
| "num_tokens": 415767715.0, | |
| "step": 5650, | |
| "train_ppl": 2.572132 | |
| }, | |
| { | |
| "ce_loss": 0.9441, | |
| "epoch": 0.818999041365963, | |
| "grad_norm": 0.96875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.603461136804416e-06, | |
| "loss": 0.9441, | |
| "mean_token_accuracy": 0.7781417928636074, | |
| "num_tokens": 416488092.0, | |
| "step": 5660, | |
| "train_ppl": 2.57039 | |
| }, | |
| { | |
| "ce_loss": 0.9421, | |
| "epoch": 0.8204460361386945, | |
| "grad_norm": 1.0, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.558705057436969e-06, | |
| "loss": 0.9421, | |
| "mean_token_accuracy": 0.7813565135002136, | |
| "num_tokens": 417257450.0, | |
| "step": 5670, | |
| "train_ppl": 2.565343 | |
| }, | |
| { | |
| "ce_loss": 0.9452, | |
| "epoch": 0.8218930309114258, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.513948978069521e-06, | |
| "loss": 0.9452, | |
| "mean_token_accuracy": 0.7794762089848518, | |
| "num_tokens": 417990179.0, | |
| "step": 5680, | |
| "train_ppl": 2.573453 | |
| }, | |
| { | |
| "ce_loss": 0.9678, | |
| "epoch": 0.8233400256841572, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.469192898702074e-06, | |
| "loss": 0.9678, | |
| "mean_token_accuracy": 0.774018281698227, | |
| "num_tokens": 418715129.0, | |
| "step": 5690, | |
| "train_ppl": 2.632052 | |
| }, | |
| { | |
| "ce_loss": 0.9779, | |
| "epoch": 0.8247870204568886, | |
| "grad_norm": 0.984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.424436819334626e-06, | |
| "loss": 0.9779, | |
| "mean_token_accuracy": 0.7748581573367119, | |
| "num_tokens": 419427338.0, | |
| "step": 5700, | |
| "train_ppl": 2.658952 | |
| }, | |
| { | |
| "ce_loss": 0.9699, | |
| "epoch": 0.82623401522962, | |
| "grad_norm": 0.9296875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.379680739967179e-06, | |
| "loss": 0.9699, | |
| "mean_token_accuracy": 0.7738823585212231, | |
| "num_tokens": 420154243.0, | |
| "step": 5710, | |
| "train_ppl": 2.63778 | |
| }, | |
| { | |
| "ce_loss": 0.9736, | |
| "epoch": 0.8276810100023514, | |
| "grad_norm": 0.9921875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.334924660599731e-06, | |
| "loss": 0.9736, | |
| "mean_token_accuracy": 0.7746640965342522, | |
| "num_tokens": 420886232.0, | |
| "step": 5720, | |
| "train_ppl": 2.64758 | |
| }, | |
| { | |
| "ce_loss": 0.9375, | |
| "epoch": 0.8291280047750827, | |
| "grad_norm": 0.98828125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.290168581232284e-06, | |
| "loss": 0.9375, | |
| "mean_token_accuracy": 0.7802526973187923, | |
| "num_tokens": 421614581.0, | |
| "step": 5730, | |
| "train_ppl": 2.553698 | |
| }, | |
| { | |
| "ce_loss": 0.9554, | |
| "epoch": 0.8305749995478141, | |
| "grad_norm": 0.9296875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.245412501864837e-06, | |
| "loss": 0.9554, | |
| "mean_token_accuracy": 0.7804835855960846, | |
| "num_tokens": 422341792.0, | |
| "step": 5740, | |
| "train_ppl": 2.599622 | |
| }, | |
| { | |
| "ce_loss": 0.9732, | |
| "epoch": 0.8320219943205455, | |
| "grad_norm": 1.140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.200656422497389e-06, | |
| "loss": 0.9732, | |
| "mean_token_accuracy": 0.7791908659040928, | |
| "num_tokens": 423060466.0, | |
| "step": 5750, | |
| "train_ppl": 2.64629 | |
| }, | |
| { | |
| "ce_loss": 0.9559, | |
| "epoch": 0.8334689890932769, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.155900343129943e-06, | |
| "loss": 0.9559, | |
| "mean_token_accuracy": 0.7781409621238708, | |
| "num_tokens": 423782605.0, | |
| "step": 5760, | |
| "train_ppl": 2.601 | |
| }, | |
| { | |
| "ce_loss": 0.9811, | |
| "epoch": 0.8349159838660083, | |
| "grad_norm": 1.140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.111144263762494e-06, | |
| "loss": 0.9811, | |
| "mean_token_accuracy": 0.7751675873994828, | |
| "num_tokens": 424502076.0, | |
| "step": 5770, | |
| "train_ppl": 2.667354 | |
| }, | |
| { | |
| "ce_loss": 1.0067, | |
| "epoch": 0.8363629786387397, | |
| "grad_norm": 1.1796875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.0663881843950475e-06, | |
| "loss": 1.0067, | |
| "mean_token_accuracy": 0.7735206983983517, | |
| "num_tokens": 425218196.0, | |
| "step": 5780, | |
| "train_ppl": 2.73669 | |
| }, | |
| { | |
| "ce_loss": 0.9582, | |
| "epoch": 0.837809973411471, | |
| "grad_norm": 0.859375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.0216321050276e-06, | |
| "loss": 0.9582, | |
| "mean_token_accuracy": 0.7766490906476975, | |
| "num_tokens": 425984680.0, | |
| "step": 5790, | |
| "train_ppl": 2.607062 | |
| }, | |
| { | |
| "ce_loss": 0.9832, | |
| "epoch": 0.8392569681842025, | |
| "grad_norm": 1.1875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.976876025660152e-06, | |
| "loss": 0.9832, | |
| "mean_token_accuracy": 0.7742396548390389, | |
| "num_tokens": 426712707.0, | |
| "step": 5800, | |
| "train_ppl": 2.673103 | |
| }, | |
| { | |
| "ce_loss": 1.0091, | |
| "epoch": 0.8407039629569338, | |
| "grad_norm": 1.078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.932119946292705e-06, | |
| "loss": 1.0091, | |
| "mean_token_accuracy": 0.7674178771674633, | |
| "num_tokens": 427433528.0, | |
| "step": 5810, | |
| "train_ppl": 2.743111 | |
| }, | |
| { | |
| "ce_loss": 0.937, | |
| "epoch": 0.8421509577296652, | |
| "grad_norm": 0.9296875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.887363866925257e-06, | |
| "loss": 0.937, | |
| "mean_token_accuracy": 0.7804404981434345, | |
| "num_tokens": 428172138.0, | |
| "step": 5820, | |
| "train_ppl": 2.55243 | |
| }, | |
| { | |
| "ce_loss": 0.9125, | |
| "epoch": 0.8435979525023966, | |
| "grad_norm": 1.1875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.84260778755781e-06, | |
| "loss": 0.9125, | |
| "mean_token_accuracy": 0.7849298395216465, | |
| "num_tokens": 428911668.0, | |
| "step": 5830, | |
| "train_ppl": 2.490453 | |
| }, | |
| { | |
| "ce_loss": 0.9878, | |
| "epoch": 0.845044947275128, | |
| "grad_norm": 0.97265625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.797851708190363e-06, | |
| "loss": 0.9878, | |
| "mean_token_accuracy": 0.7694531783461571, | |
| "num_tokens": 429645052.0, | |
| "step": 5840, | |
| "train_ppl": 2.685387 | |
| }, | |
| { | |
| "ce_loss": 0.9736, | |
| "epoch": 0.8464919420478594, | |
| "grad_norm": 1.1953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.753095628822915e-06, | |
| "loss": 0.9736, | |
| "mean_token_accuracy": 0.7751254610717296, | |
| "num_tokens": 430378612.0, | |
| "step": 5850, | |
| "train_ppl": 2.64755 | |
| }, | |
| { | |
| "ce_loss": 0.9663, | |
| "epoch": 0.8479389368205907, | |
| "grad_norm": 1.171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.708339549455468e-06, | |
| "loss": 0.9663, | |
| "mean_token_accuracy": 0.7708243384957314, | |
| "num_tokens": 431064544.0, | |
| "step": 5860, | |
| "train_ppl": 2.628303 | |
| }, | |
| { | |
| "ce_loss": 0.9792, | |
| "epoch": 0.8493859315933221, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.66358347008802e-06, | |
| "loss": 0.9792, | |
| "mean_token_accuracy": 0.7783576816320419, | |
| "num_tokens": 431809385.0, | |
| "step": 5870, | |
| "train_ppl": 2.662384 | |
| }, | |
| { | |
| "ce_loss": 0.9809, | |
| "epoch": 0.8508329263660535, | |
| "grad_norm": 1.15625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.618827390720573e-06, | |
| "loss": 0.9809, | |
| "mean_token_accuracy": 0.7732638500630855, | |
| "num_tokens": 432564699.0, | |
| "step": 5880, | |
| "train_ppl": 2.666948 | |
| }, | |
| { | |
| "ce_loss": 0.9614, | |
| "epoch": 0.8522799211387849, | |
| "grad_norm": 1.171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.574071311353125e-06, | |
| "loss": 0.9614, | |
| "mean_token_accuracy": 0.7784347735345364, | |
| "num_tokens": 433285549.0, | |
| "step": 5890, | |
| "train_ppl": 2.615387 | |
| }, | |
| { | |
| "ce_loss": 0.9669, | |
| "epoch": 0.8537269159115163, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.5293152319856785e-06, | |
| "loss": 0.9669, | |
| "mean_token_accuracy": 0.7765318714082241, | |
| "num_tokens": 434017224.0, | |
| "step": 5900, | |
| "train_ppl": 2.62971 | |
| }, | |
| { | |
| "ce_loss": 0.9632, | |
| "epoch": 0.8551739106842476, | |
| "grad_norm": 1.0, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.484559152618231e-06, | |
| "loss": 0.9632, | |
| "mean_token_accuracy": 0.7763010829687118, | |
| "num_tokens": 434766145.0, | |
| "step": 5910, | |
| "train_ppl": 2.620017 | |
| }, | |
| { | |
| "ce_loss": 0.9542, | |
| "epoch": 0.856620905456979, | |
| "grad_norm": 1.0, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.4398030732507834e-06, | |
| "loss": 0.9542, | |
| "mean_token_accuracy": 0.780161052197218, | |
| "num_tokens": 435503031.0, | |
| "step": 5920, | |
| "train_ppl": 2.596702 | |
| }, | |
| { | |
| "ce_loss": 0.9372, | |
| "epoch": 0.8580679002297105, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.395046993883336e-06, | |
| "loss": 0.9372, | |
| "mean_token_accuracy": 0.7774905152618885, | |
| "num_tokens": 436240735.0, | |
| "step": 5930, | |
| "train_ppl": 2.552895 | |
| }, | |
| { | |
| "ce_loss": 0.9657, | |
| "epoch": 0.8595148950024418, | |
| "grad_norm": 1.0859375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.350290914515888e-06, | |
| "loss": 0.9657, | |
| "mean_token_accuracy": 0.776423779129982, | |
| "num_tokens": 436981949.0, | |
| "step": 5940, | |
| "train_ppl": 2.62665 | |
| }, | |
| { | |
| "ce_loss": 0.9574, | |
| "epoch": 0.8609618897751732, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.305534835148442e-06, | |
| "loss": 0.9574, | |
| "mean_token_accuracy": 0.7750987179577351, | |
| "num_tokens": 437750102.0, | |
| "step": 5950, | |
| "train_ppl": 2.605002 | |
| }, | |
| { | |
| "ce_loss": 0.9409, | |
| "epoch": 0.8624088845479045, | |
| "grad_norm": 0.984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.260778755780993e-06, | |
| "loss": 0.9409, | |
| "mean_token_accuracy": 0.7818285569548606, | |
| "num_tokens": 438508119.0, | |
| "step": 5960, | |
| "train_ppl": 2.562181 | |
| }, | |
| { | |
| "ce_loss": 1.0036, | |
| "epoch": 0.8638558793206359, | |
| "grad_norm": 1.1796875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.2160226764135465e-06, | |
| "loss": 1.0036, | |
| "mean_token_accuracy": 0.767191369086504, | |
| "num_tokens": 439276410.0, | |
| "step": 5970, | |
| "train_ppl": 2.727961 | |
| }, | |
| { | |
| "ce_loss": 0.9487, | |
| "epoch": 0.8653028740933674, | |
| "grad_norm": 0.89453125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.171266597046099e-06, | |
| "loss": 0.9487, | |
| "mean_token_accuracy": 0.7764919579029084, | |
| "num_tokens": 440026754.0, | |
| "step": 5980, | |
| "train_ppl": 2.582388 | |
| }, | |
| { | |
| "ce_loss": 0.971, | |
| "epoch": 0.8667498688660987, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.126510517678651e-06, | |
| "loss": 0.971, | |
| "mean_token_accuracy": 0.7749002501368523, | |
| "num_tokens": 440761601.0, | |
| "step": 5990, | |
| "train_ppl": 2.640495 | |
| }, | |
| { | |
| "ce_loss": 0.9995, | |
| "epoch": 0.8681968636388301, | |
| "grad_norm": 1.171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.081754438311204e-06, | |
| "loss": 0.9995, | |
| "mean_token_accuracy": 0.7680262356996537, | |
| "num_tokens": 441480022.0, | |
| "step": 6000, | |
| "train_ppl": 2.716909 | |
| }, | |
| { | |
| "ce_loss": 0.9768, | |
| "epoch": 0.8696438584115614, | |
| "grad_norm": 0.98828125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.036998358943757e-06, | |
| "loss": 0.9768, | |
| "mean_token_accuracy": 0.7749585300683975, | |
| "num_tokens": 442223925.0, | |
| "step": 6010, | |
| "train_ppl": 2.65607 | |
| }, | |
| { | |
| "ce_loss": 0.9682, | |
| "epoch": 0.8710908531842929, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.992242279576309e-06, | |
| "loss": 0.9682, | |
| "mean_token_accuracy": 0.7721332833170891, | |
| "num_tokens": 442962668.0, | |
| "step": 6020, | |
| "train_ppl": 2.63316 | |
| }, | |
| { | |
| "ce_loss": 0.983, | |
| "epoch": 0.8725378479570243, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.947486200208862e-06, | |
| "loss": 0.983, | |
| "mean_token_accuracy": 0.7761274553835392, | |
| "num_tokens": 443689137.0, | |
| "step": 6030, | |
| "train_ppl": 2.672528 | |
| }, | |
| { | |
| "ce_loss": 0.9732, | |
| "epoch": 0.8739848427297556, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.902730120841414e-06, | |
| "loss": 0.9732, | |
| "mean_token_accuracy": 0.7740906737744808, | |
| "num_tokens": 444401316.0, | |
| "step": 6040, | |
| "train_ppl": 2.646453 | |
| }, | |
| { | |
| "ce_loss": 0.9723, | |
| "epoch": 0.875431837502487, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.857974041473967e-06, | |
| "loss": 0.9723, | |
| "mean_token_accuracy": 0.7794286720454693, | |
| "num_tokens": 445116577.0, | |
| "step": 6050, | |
| "train_ppl": 2.643935 | |
| }, | |
| { | |
| "ce_loss": 0.9684, | |
| "epoch": 0.8768788322752185, | |
| "grad_norm": 1.171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.81321796210652e-06, | |
| "loss": 0.9684, | |
| "mean_token_accuracy": 0.7808907024562359, | |
| "num_tokens": 445876002.0, | |
| "step": 6060, | |
| "train_ppl": 2.633708 | |
| }, | |
| { | |
| "ce_loss": 0.9711, | |
| "epoch": 0.8783258270479498, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.7684618827390723e-06, | |
| "loss": 0.9711, | |
| "mean_token_accuracy": 0.7762280680239201, | |
| "num_tokens": 446605260.0, | |
| "step": 6070, | |
| "train_ppl": 2.640865 | |
| }, | |
| { | |
| "ce_loss": 0.95, | |
| "epoch": 0.8797728218206812, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.7237058033716247e-06, | |
| "loss": 0.95, | |
| "mean_token_accuracy": 0.7792424105107785, | |
| "num_tokens": 447358325.0, | |
| "step": 6080, | |
| "train_ppl": 2.585616 | |
| }, | |
| { | |
| "ce_loss": 0.959, | |
| "epoch": 0.8812198165934125, | |
| "grad_norm": 1.1171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.678949724004177e-06, | |
| "loss": 0.959, | |
| "mean_token_accuracy": 0.7746827162802219, | |
| "num_tokens": 448100945.0, | |
| "step": 6090, | |
| "train_ppl": 2.609138 | |
| }, | |
| { | |
| "ce_loss": 0.9417, | |
| "epoch": 0.8826668113661439, | |
| "grad_norm": 0.8671875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.6341936446367296e-06, | |
| "loss": 0.9417, | |
| "mean_token_accuracy": 0.7761165231466294, | |
| "num_tokens": 448857359.0, | |
| "step": 6100, | |
| "train_ppl": 2.564342 | |
| }, | |
| { | |
| "ce_loss": 0.9845, | |
| "epoch": 0.8841138061388754, | |
| "grad_norm": 1.1796875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.5894375652692825e-06, | |
| "loss": 0.9845, | |
| "mean_token_accuracy": 0.7675826340913773, | |
| "num_tokens": 449575975.0, | |
| "step": 6110, | |
| "train_ppl": 2.67659 | |
| }, | |
| { | |
| "ce_loss": 0.964, | |
| "epoch": 0.8855608009116067, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.544681485901835e-06, | |
| "loss": 0.964, | |
| "mean_token_accuracy": 0.7789463967084884, | |
| "num_tokens": 450301560.0, | |
| "step": 6120, | |
| "train_ppl": 2.622228 | |
| }, | |
| { | |
| "ce_loss": 0.9757, | |
| "epoch": 0.8870077956843381, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.4999254065343874e-06, | |
| "loss": 0.9757, | |
| "mean_token_accuracy": 0.7748393803834915, | |
| "num_tokens": 451046846.0, | |
| "step": 6130, | |
| "train_ppl": 2.652971 | |
| }, | |
| { | |
| "ce_loss": 0.9732, | |
| "epoch": 0.8884547904570694, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.4551693271669406e-06, | |
| "loss": 0.9732, | |
| "mean_token_accuracy": 0.7820017896592617, | |
| "num_tokens": 451811972.0, | |
| "step": 6140, | |
| "train_ppl": 2.646348 | |
| }, | |
| { | |
| "ce_loss": 0.9461, | |
| "epoch": 0.8899017852298009, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.410413247799493e-06, | |
| "loss": 0.9461, | |
| "mean_token_accuracy": 0.7822142690420151, | |
| "num_tokens": 452565156.0, | |
| "step": 6150, | |
| "train_ppl": 2.575566 | |
| }, | |
| { | |
| "ce_loss": 1.0128, | |
| "epoch": 0.8913487800025323, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.3656571684320455e-06, | |
| "loss": 1.0128, | |
| "mean_token_accuracy": 0.7665348842740058, | |
| "num_tokens": 453300539.0, | |
| "step": 6160, | |
| "train_ppl": 2.753163 | |
| }, | |
| { | |
| "ce_loss": 0.9794, | |
| "epoch": 0.8927957747752636, | |
| "grad_norm": 1.2578125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.320901089064598e-06, | |
| "loss": 0.9794, | |
| "mean_token_accuracy": 0.7745142556726933, | |
| "num_tokens": 454032470.0, | |
| "step": 6170, | |
| "train_ppl": 2.66287 | |
| }, | |
| { | |
| "ce_loss": 0.9568, | |
| "epoch": 0.894242769547995, | |
| "grad_norm": 0.96875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.276145009697151e-06, | |
| "loss": 0.9568, | |
| "mean_token_accuracy": 0.7779201343655586, | |
| "num_tokens": 454766140.0, | |
| "step": 6180, | |
| "train_ppl": 2.603474 | |
| }, | |
| { | |
| "ce_loss": 0.9672, | |
| "epoch": 0.8956897643207264, | |
| "grad_norm": 0.9921875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.2313889303297033e-06, | |
| "loss": 0.9672, | |
| "mean_token_accuracy": 0.7766256541013717, | |
| "num_tokens": 455497600.0, | |
| "step": 6190, | |
| "train_ppl": 2.630683 | |
| }, | |
| { | |
| "ce_loss": 0.9608, | |
| "epoch": 0.8971367590934578, | |
| "grad_norm": 1.125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.1866328509622557e-06, | |
| "loss": 0.9608, | |
| "mean_token_accuracy": 0.7783399567008018, | |
| "num_tokens": 456213968.0, | |
| "step": 6200, | |
| "train_ppl": 2.613881 | |
| }, | |
| { | |
| "ce_loss": 0.989, | |
| "epoch": 0.8985837538661892, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.141876771594808e-06, | |
| "loss": 0.989, | |
| "mean_token_accuracy": 0.7722627222537994, | |
| "num_tokens": 456980565.0, | |
| "step": 6210, | |
| "train_ppl": 2.688524 | |
| }, | |
| { | |
| "ce_loss": 0.9211, | |
| "epoch": 0.9000307486389205, | |
| "grad_norm": 0.90625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.097120692227361e-06, | |
| "loss": 0.9211, | |
| "mean_token_accuracy": 0.785981647670269, | |
| "num_tokens": 457749115.0, | |
| "step": 6220, | |
| "train_ppl": 2.511994 | |
| }, | |
| { | |
| "ce_loss": 0.9593, | |
| "epoch": 0.9014777434116519, | |
| "grad_norm": 0.9296875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.0523646128599135e-06, | |
| "loss": 0.9593, | |
| "mean_token_accuracy": 0.7805201202630997, | |
| "num_tokens": 458489401.0, | |
| "step": 6230, | |
| "train_ppl": 2.609812 | |
| }, | |
| { | |
| "ce_loss": 0.9827, | |
| "epoch": 0.9029247381843833, | |
| "grad_norm": 0.953125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.007608533492466e-06, | |
| "loss": 0.9827, | |
| "mean_token_accuracy": 0.7736832290887833, | |
| "num_tokens": 459226574.0, | |
| "step": 6240, | |
| "train_ppl": 2.671592 | |
| }, | |
| { | |
| "ce_loss": 0.9776, | |
| "epoch": 0.9043717329571147, | |
| "grad_norm": 1.0703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.962852454125019e-06, | |
| "loss": 0.9776, | |
| "mean_token_accuracy": 0.776441466808319, | |
| "num_tokens": 459960745.0, | |
| "step": 6250, | |
| "train_ppl": 2.658195 | |
| }, | |
| { | |
| "ce_loss": 0.9535, | |
| "epoch": 0.9058187277298461, | |
| "grad_norm": 0.9609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.9180963747575713e-06, | |
| "loss": 0.9535, | |
| "mean_token_accuracy": 0.7777935616672039, | |
| "num_tokens": 460692141.0, | |
| "step": 6260, | |
| "train_ppl": 2.594836 | |
| }, | |
| { | |
| "ce_loss": 0.9883, | |
| "epoch": 0.9072657225025774, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.8733402953901237e-06, | |
| "loss": 0.9883, | |
| "mean_token_accuracy": 0.7695657543838024, | |
| "num_tokens": 461408471.0, | |
| "step": 6270, | |
| "train_ppl": 2.686754 | |
| }, | |
| { | |
| "ce_loss": 0.9433, | |
| "epoch": 0.9087127172753089, | |
| "grad_norm": 0.921875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.828584216022676e-06, | |
| "loss": 0.9433, | |
| "mean_token_accuracy": 0.780649583786726, | |
| "num_tokens": 462170112.0, | |
| "step": 6280, | |
| "train_ppl": 2.568511 | |
| }, | |
| { | |
| "ce_loss": 0.9745, | |
| "epoch": 0.9101597120480402, | |
| "grad_norm": 1.1328125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.783828136655229e-06, | |
| "loss": 0.9745, | |
| "mean_token_accuracy": 0.7758511275053024, | |
| "num_tokens": 462877827.0, | |
| "step": 6290, | |
| "train_ppl": 2.64988 | |
| }, | |
| { | |
| "ce_loss": 0.9634, | |
| "epoch": 0.9116067068207716, | |
| "grad_norm": 0.984375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.739072057287782e-06, | |
| "loss": 0.9634, | |
| "mean_token_accuracy": 0.7743300221860409, | |
| "num_tokens": 463601430.0, | |
| "step": 6300, | |
| "train_ppl": 2.620472 | |
| }, | |
| { | |
| "ce_loss": 0.9451, | |
| "epoch": 0.913053701593503, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6943159779203344e-06, | |
| "loss": 0.9451, | |
| "mean_token_accuracy": 0.7799232237040996, | |
| "num_tokens": 464318344.0, | |
| "step": 6310, | |
| "train_ppl": 2.572968 | |
| }, | |
| { | |
| "ce_loss": 0.9682, | |
| "epoch": 0.9145006963662343, | |
| "grad_norm": 0.94921875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.649559898552887e-06, | |
| "loss": 0.9682, | |
| "mean_token_accuracy": 0.7786154381930828, | |
| "num_tokens": 465051370.0, | |
| "step": 6320, | |
| "train_ppl": 2.633079 | |
| }, | |
| { | |
| "ce_loss": 0.9604, | |
| "epoch": 0.9159476911389658, | |
| "grad_norm": 0.9296875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.6048038191854397e-06, | |
| "loss": 0.9604, | |
| "mean_token_accuracy": 0.7759640254080296, | |
| "num_tokens": 465801154.0, | |
| "step": 6330, | |
| "train_ppl": 2.612643 | |
| }, | |
| { | |
| "ce_loss": 0.9521, | |
| "epoch": 0.9173946859116971, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.560047739817992e-06, | |
| "loss": 0.9521, | |
| "mean_token_accuracy": 0.7819162972271443, | |
| "num_tokens": 466570155.0, | |
| "step": 6340, | |
| "train_ppl": 2.591263 | |
| }, | |
| { | |
| "ce_loss": 0.9604, | |
| "epoch": 0.9188416806844285, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.5152916604505446e-06, | |
| "loss": 0.9604, | |
| "mean_token_accuracy": 0.7824667453765869, | |
| "num_tokens": 467322541.0, | |
| "step": 6350, | |
| "train_ppl": 2.612788 | |
| }, | |
| { | |
| "ce_loss": 0.9365, | |
| "epoch": 0.9202886754571599, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.470535581083097e-06, | |
| "loss": 0.9365, | |
| "mean_token_accuracy": 0.7835808910429478, | |
| "num_tokens": 468075229.0, | |
| "step": 6360, | |
| "train_ppl": 2.550947 | |
| }, | |
| { | |
| "ce_loss": 0.9473, | |
| "epoch": 0.9217356702298913, | |
| "grad_norm": 0.9609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.42577950171565e-06, | |
| "loss": 0.9473, | |
| "mean_token_accuracy": 0.77774076461792, | |
| "num_tokens": 468820005.0, | |
| "step": 6370, | |
| "train_ppl": 2.578614 | |
| }, | |
| { | |
| "ce_loss": 0.9618, | |
| "epoch": 0.9231826650026227, | |
| "grad_norm": 1.0390625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.3810234223482023e-06, | |
| "loss": 0.9618, | |
| "mean_token_accuracy": 0.7733399920165539, | |
| "num_tokens": 469537339.0, | |
| "step": 6380, | |
| "train_ppl": 2.616365 | |
| }, | |
| { | |
| "ce_loss": 0.9568, | |
| "epoch": 0.924629659775354, | |
| "grad_norm": 0.95703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.3362673429807548e-06, | |
| "loss": 0.9568, | |
| "mean_token_accuracy": 0.7792744718492031, | |
| "num_tokens": 470264281.0, | |
| "step": 6390, | |
| "train_ppl": 2.603469 | |
| }, | |
| { | |
| "ce_loss": 0.9704, | |
| "epoch": 0.9260766545480854, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.2915112636133076e-06, | |
| "loss": 0.9704, | |
| "mean_token_accuracy": 0.7776748731732368, | |
| "num_tokens": 470997935.0, | |
| "step": 6400, | |
| "train_ppl": 2.639119 | |
| }, | |
| { | |
| "ce_loss": 0.9537, | |
| "epoch": 0.9275236493208169, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.24675518424586e-06, | |
| "loss": 0.9537, | |
| "mean_token_accuracy": 0.7739205956459045, | |
| "num_tokens": 471749710.0, | |
| "step": 6410, | |
| "train_ppl": 2.595221 | |
| }, | |
| { | |
| "ce_loss": 0.9648, | |
| "epoch": 0.9289706440935482, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.2019991048784125e-06, | |
| "loss": 0.9648, | |
| "mean_token_accuracy": 0.7769439205527305, | |
| "num_tokens": 472473330.0, | |
| "step": 6420, | |
| "train_ppl": 2.624186 | |
| }, | |
| { | |
| "ce_loss": 0.9727, | |
| "epoch": 0.9304176388662796, | |
| "grad_norm": 0.96875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.157243025510965e-06, | |
| "loss": 0.9727, | |
| "mean_token_accuracy": 0.771061759442091, | |
| "num_tokens": 473203701.0, | |
| "step": 6430, | |
| "train_ppl": 2.645201 | |
| }, | |
| { | |
| "ce_loss": 0.9369, | |
| "epoch": 0.931864633639011, | |
| "grad_norm": 1.1796875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.112486946143518e-06, | |
| "loss": 0.9369, | |
| "mean_token_accuracy": 0.7875291585922242, | |
| "num_tokens": 473951304.0, | |
| "step": 6440, | |
| "train_ppl": 2.551984 | |
| }, | |
| { | |
| "ce_loss": 0.963, | |
| "epoch": 0.9333116284117423, | |
| "grad_norm": 1.1171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.0677308667760703e-06, | |
| "loss": 0.963, | |
| "mean_token_accuracy": 0.7799215823411941, | |
| "num_tokens": 474681697.0, | |
| "step": 6450, | |
| "train_ppl": 2.619448 | |
| }, | |
| { | |
| "ce_loss": 0.9581, | |
| "epoch": 0.9347586231844738, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.022974787408623e-06, | |
| "loss": 0.9581, | |
| "mean_token_accuracy": 0.7823777303099633, | |
| "num_tokens": 475396883.0, | |
| "step": 6460, | |
| "train_ppl": 2.606745 | |
| }, | |
| { | |
| "ce_loss": 0.9942, | |
| "epoch": 0.9362056179572051, | |
| "grad_norm": 1.1015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.9782187080411756e-06, | |
| "loss": 0.9942, | |
| "mean_token_accuracy": 0.7746273078024387, | |
| "num_tokens": 476110094.0, | |
| "step": 6470, | |
| "train_ppl": 2.702625 | |
| }, | |
| { | |
| "ce_loss": 0.954, | |
| "epoch": 0.9376526127299365, | |
| "grad_norm": 1.0546875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.9334626286737285e-06, | |
| "loss": 0.954, | |
| "mean_token_accuracy": 0.7780710026621819, | |
| "num_tokens": 476856061.0, | |
| "step": 6480, | |
| "train_ppl": 2.59616 | |
| }, | |
| { | |
| "ce_loss": 0.9533, | |
| "epoch": 0.9390996075026679, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.888706549306281e-06, | |
| "loss": 0.9533, | |
| "mean_token_accuracy": 0.7776739954948425, | |
| "num_tokens": 477582700.0, | |
| "step": 6490, | |
| "train_ppl": 2.594139 | |
| }, | |
| { | |
| "ce_loss": 0.9816, | |
| "epoch": 0.9405466022753993, | |
| "grad_norm": 1.046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8439504699388336e-06, | |
| "loss": 0.9816, | |
| "mean_token_accuracy": 0.774020179361105, | |
| "num_tokens": 478295644.0, | |
| "step": 6500, | |
| "train_ppl": 2.66881 | |
| }, | |
| { | |
| "ce_loss": 0.9186, | |
| "epoch": 0.9419935970481307, | |
| "grad_norm": 0.98046875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.799194390571386e-06, | |
| "loss": 0.9186, | |
| "mean_token_accuracy": 0.7841186247766018, | |
| "num_tokens": 479045896.0, | |
| "step": 6510, | |
| "train_ppl": 2.505872 | |
| }, | |
| { | |
| "ce_loss": 0.956, | |
| "epoch": 0.943440591820862, | |
| "grad_norm": 1.0859375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7544383112039387e-06, | |
| "loss": 0.956, | |
| "mean_token_accuracy": 0.7821230754256249, | |
| "num_tokens": 479771982.0, | |
| "step": 6520, | |
| "train_ppl": 2.601145 | |
| }, | |
| { | |
| "ce_loss": 0.962, | |
| "epoch": 0.9448875865935934, | |
| "grad_norm": 1.1171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.7096822318364911e-06, | |
| "loss": 0.962, | |
| "mean_token_accuracy": 0.7803165823221206, | |
| "num_tokens": 480534412.0, | |
| "step": 6530, | |
| "train_ppl": 2.616837 | |
| }, | |
| { | |
| "ce_loss": 0.9292, | |
| "epoch": 0.9463345813663249, | |
| "grad_norm": 1.09375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.6649261524690438e-06, | |
| "loss": 0.9292, | |
| "mean_token_accuracy": 0.7858192339539528, | |
| "num_tokens": 481283576.0, | |
| "step": 6540, | |
| "train_ppl": 2.53254 | |
| }, | |
| { | |
| "ce_loss": 0.9411, | |
| "epoch": 0.9477815761390562, | |
| "grad_norm": 1.1640625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.6201700731015962e-06, | |
| "loss": 0.9411, | |
| "mean_token_accuracy": 0.7775696411728859, | |
| "num_tokens": 482029882.0, | |
| "step": 6550, | |
| "train_ppl": 2.562835 | |
| }, | |
| { | |
| "ce_loss": 0.9532, | |
| "epoch": 0.9492285709117876, | |
| "grad_norm": 1.0703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.575413993734149e-06, | |
| "loss": 0.9532, | |
| "mean_token_accuracy": 0.7774538859724999, | |
| "num_tokens": 482773749.0, | |
| "step": 6560, | |
| "train_ppl": 2.594032 | |
| }, | |
| { | |
| "ce_loss": 1.0142, | |
| "epoch": 0.9506755656845189, | |
| "grad_norm": 1.0859375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.5306579143667016e-06, | |
| "loss": 1.0142, | |
| "mean_token_accuracy": 0.7689271204173564, | |
| "num_tokens": 483502307.0, | |
| "step": 6570, | |
| "train_ppl": 2.757271 | |
| }, | |
| { | |
| "ce_loss": 0.9734, | |
| "epoch": 0.9521225604572503, | |
| "grad_norm": 0.92578125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4859018349992542e-06, | |
| "loss": 0.9734, | |
| "mean_token_accuracy": 0.7774414747953415, | |
| "num_tokens": 484237741.0, | |
| "step": 6580, | |
| "train_ppl": 2.646816 | |
| }, | |
| { | |
| "ce_loss": 0.9492, | |
| "epoch": 0.9535695552299818, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4411457556318067e-06, | |
| "loss": 0.9492, | |
| "mean_token_accuracy": 0.7777016542851924, | |
| "num_tokens": 484965896.0, | |
| "step": 6590, | |
| "train_ppl": 2.583514 | |
| }, | |
| { | |
| "ce_loss": 0.9268, | |
| "epoch": 0.9550165500027131, | |
| "grad_norm": 1.125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3963896762643593e-06, | |
| "loss": 0.9268, | |
| "mean_token_accuracy": 0.783556516468525, | |
| "num_tokens": 485698087.0, | |
| "step": 6600, | |
| "train_ppl": 2.526361 | |
| }, | |
| { | |
| "ce_loss": 0.9347, | |
| "epoch": 0.9564635447754445, | |
| "grad_norm": 0.89453125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3516335968969118e-06, | |
| "loss": 0.9347, | |
| "mean_token_accuracy": 0.780432254821062, | |
| "num_tokens": 486457104.0, | |
| "step": 6610, | |
| "train_ppl": 2.546429 | |
| }, | |
| { | |
| "ce_loss": 1.0135, | |
| "epoch": 0.9579105395481758, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.3068775175294644e-06, | |
| "loss": 1.0135, | |
| "mean_token_accuracy": 0.7681482747197151, | |
| "num_tokens": 487180072.0, | |
| "step": 6620, | |
| "train_ppl": 2.75519 | |
| }, | |
| { | |
| "ce_loss": 0.9701, | |
| "epoch": 0.9593575343209073, | |
| "grad_norm": 1.140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.262121438162017e-06, | |
| "loss": 0.9701, | |
| "mean_token_accuracy": 0.7749063238501549, | |
| "num_tokens": 487910962.0, | |
| "step": 6630, | |
| "train_ppl": 2.638147 | |
| }, | |
| { | |
| "ce_loss": 0.9673, | |
| "epoch": 0.9608045290936387, | |
| "grad_norm": 1.140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.2173653587945695e-06, | |
| "loss": 0.9673, | |
| "mean_token_accuracy": 0.7772574447095394, | |
| "num_tokens": 488651402.0, | |
| "step": 6640, | |
| "train_ppl": 2.630719 | |
| }, | |
| { | |
| "ce_loss": 0.9763, | |
| "epoch": 0.96225152386637, | |
| "grad_norm": 0.90625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1726092794271224e-06, | |
| "loss": 0.9763, | |
| "mean_token_accuracy": 0.7743536755442619, | |
| "num_tokens": 489384716.0, | |
| "step": 6650, | |
| "train_ppl": 2.654588 | |
| }, | |
| { | |
| "ce_loss": 0.9938, | |
| "epoch": 0.9636985186391014, | |
| "grad_norm": 1.2578125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.1278532000596748e-06, | |
| "loss": 0.9938, | |
| "mean_token_accuracy": 0.7713238671422005, | |
| "num_tokens": 490102736.0, | |
| "step": 6660, | |
| "train_ppl": 2.701489 | |
| }, | |
| { | |
| "ce_loss": 0.9418, | |
| "epoch": 0.9651455134118327, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.0830971206922275e-06, | |
| "loss": 0.9418, | |
| "mean_token_accuracy": 0.7814336843788624, | |
| "num_tokens": 490846680.0, | |
| "step": 6670, | |
| "train_ppl": 2.564615 | |
| }, | |
| { | |
| "ce_loss": 0.9167, | |
| "epoch": 0.9665925081845642, | |
| "grad_norm": 1.125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.03834104132478e-06, | |
| "loss": 0.9167, | |
| "mean_token_accuracy": 0.7847115240991116, | |
| "num_tokens": 491610969.0, | |
| "step": 6680, | |
| "train_ppl": 2.500937 | |
| }, | |
| { | |
| "ce_loss": 0.935, | |
| "epoch": 0.9680395029572956, | |
| "grad_norm": 0.99609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.935849619573326e-07, | |
| "loss": 0.935, | |
| "mean_token_accuracy": 0.7818123020231724, | |
| "num_tokens": 492324309.0, | |
| "step": 6690, | |
| "train_ppl": 2.547313 | |
| }, | |
| { | |
| "ce_loss": 0.9192, | |
| "epoch": 0.9694864977300269, | |
| "grad_norm": 0.9453125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.488288825898852e-07, | |
| "loss": 0.9192, | |
| "mean_token_accuracy": 0.785324689000845, | |
| "num_tokens": 493060014.0, | |
| "step": 6700, | |
| "train_ppl": 2.507398 | |
| }, | |
| { | |
| "ce_loss": 0.942, | |
| "epoch": 0.9709334925027583, | |
| "grad_norm": 0.90234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.040728032224378e-07, | |
| "loss": 0.942, | |
| "mean_token_accuracy": 0.7809490516781807, | |
| "num_tokens": 493814561.0, | |
| "step": 6710, | |
| "train_ppl": 2.5651 | |
| }, | |
| { | |
| "ce_loss": 0.9721, | |
| "epoch": 0.9723804872754898, | |
| "grad_norm": 0.98828125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.593167238549904e-07, | |
| "loss": 0.9721, | |
| "mean_token_accuracy": 0.7768593326210975, | |
| "num_tokens": 494565870.0, | |
| "step": 6720, | |
| "train_ppl": 2.643587 | |
| }, | |
| { | |
| "ce_loss": 0.9211, | |
| "epoch": 0.9738274820482211, | |
| "grad_norm": 0.9296875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.145606444875429e-07, | |
| "loss": 0.9211, | |
| "mean_token_accuracy": 0.7829136967658996, | |
| "num_tokens": 495296800.0, | |
| "step": 6730, | |
| "train_ppl": 2.511992 | |
| }, | |
| { | |
| "ce_loss": 0.939, | |
| "epoch": 0.9752744768209525, | |
| "grad_norm": 1.0, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.698045651200955e-07, | |
| "loss": 0.939, | |
| "mean_token_accuracy": 0.7814122512936592, | |
| "num_tokens": 496031622.0, | |
| "step": 6740, | |
| "train_ppl": 2.557372 | |
| }, | |
| { | |
| "ce_loss": 0.9804, | |
| "epoch": 0.9767214715936838, | |
| "grad_norm": 1.109375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 7.250484857526481e-07, | |
| "loss": 0.9804, | |
| "mean_token_accuracy": 0.7736301675438881, | |
| "num_tokens": 496761090.0, | |
| "step": 6750, | |
| "train_ppl": 2.665465 | |
| }, | |
| { | |
| "ce_loss": 0.9504, | |
| "epoch": 0.9781684663664153, | |
| "grad_norm": 1.171875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.802924063852007e-07, | |
| "loss": 0.9504, | |
| "mean_token_accuracy": 0.7740707725286484, | |
| "num_tokens": 497494104.0, | |
| "step": 6760, | |
| "train_ppl": 2.586672 | |
| }, | |
| { | |
| "ce_loss": 0.9557, | |
| "epoch": 0.9796154611391467, | |
| "grad_norm": 1.0078125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 6.355363270177532e-07, | |
| "loss": 0.9557, | |
| "mean_token_accuracy": 0.7776445716619491, | |
| "num_tokens": 498236331.0, | |
| "step": 6770, | |
| "train_ppl": 2.600574 | |
| }, | |
| { | |
| "ce_loss": 0.9616, | |
| "epoch": 0.981062455911878, | |
| "grad_norm": 0.99609375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.907802476503058e-07, | |
| "loss": 0.9616, | |
| "mean_token_accuracy": 0.779218465089798, | |
| "num_tokens": 498972935.0, | |
| "step": 6780, | |
| "train_ppl": 2.615954 | |
| }, | |
| { | |
| "ce_loss": 0.9659, | |
| "epoch": 0.9825094506846094, | |
| "grad_norm": 0.9140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.460241682828584e-07, | |
| "loss": 0.9659, | |
| "mean_token_accuracy": 0.7770897686481476, | |
| "num_tokens": 499702836.0, | |
| "step": 6790, | |
| "train_ppl": 2.627128 | |
| }, | |
| { | |
| "ce_loss": 0.963, | |
| "epoch": 0.9839564454573407, | |
| "grad_norm": 0.86328125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.01268088915411e-07, | |
| "loss": 0.963, | |
| "mean_token_accuracy": 0.7763608016073704, | |
| "num_tokens": 500426876.0, | |
| "step": 6800, | |
| "train_ppl": 2.61959 | |
| }, | |
| { | |
| "ce_loss": 0.9661, | |
| "epoch": 0.9854034402300722, | |
| "grad_norm": 1.03125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.565120095479636e-07, | |
| "loss": 0.9661, | |
| "mean_token_accuracy": 0.7763193972408772, | |
| "num_tokens": 501156440.0, | |
| "step": 6810, | |
| "train_ppl": 2.627785 | |
| }, | |
| { | |
| "ce_loss": 0.9835, | |
| "epoch": 0.9868504350028036, | |
| "grad_norm": 1.1328125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 4.117559301805162e-07, | |
| "loss": 0.9835, | |
| "mean_token_accuracy": 0.7768892168998718, | |
| "num_tokens": 501903400.0, | |
| "step": 6820, | |
| "train_ppl": 2.673742 | |
| }, | |
| { | |
| "ce_loss": 0.9503, | |
| "epoch": 0.9882974297755349, | |
| "grad_norm": 0.8828125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.6699985081306876e-07, | |
| "loss": 0.9503, | |
| "mean_token_accuracy": 0.7742002509534359, | |
| "num_tokens": 502621668.0, | |
| "step": 6830, | |
| "train_ppl": 2.586448 | |
| }, | |
| { | |
| "ce_loss": 0.9498, | |
| "epoch": 0.9897444245482663, | |
| "grad_norm": 1.0625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 3.222437714456214e-07, | |
| "loss": 0.9498, | |
| "mean_token_accuracy": 0.7802133716642856, | |
| "num_tokens": 503362803.0, | |
| "step": 6840, | |
| "train_ppl": 2.585163 | |
| }, | |
| { | |
| "ce_loss": 0.9616, | |
| "epoch": 0.9911914193209977, | |
| "grad_norm": 0.94140625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.7748769207817397e-07, | |
| "loss": 0.9616, | |
| "mean_token_accuracy": 0.7740616850554943, | |
| "num_tokens": 504081933.0, | |
| "step": 6850, | |
| "train_ppl": 2.61597 | |
| }, | |
| { | |
| "ce_loss": 0.9839, | |
| "epoch": 0.9926384140937291, | |
| "grad_norm": 1.0703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 2.3273161271072654e-07, | |
| "loss": 0.9839, | |
| "mean_token_accuracy": 0.7735910393297672, | |
| "num_tokens": 504825189.0, | |
| "step": 6860, | |
| "train_ppl": 2.674826 | |
| }, | |
| { | |
| "ce_loss": 0.9994, | |
| "epoch": 0.9940854088664605, | |
| "grad_norm": 1.015625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.8797553334327912e-07, | |
| "loss": 0.9994, | |
| "mean_token_accuracy": 0.7692562341690063, | |
| "num_tokens": 505545177.0, | |
| "step": 6870, | |
| "train_ppl": 2.716574 | |
| }, | |
| { | |
| "ce_loss": 0.9407, | |
| "epoch": 0.9955324036391918, | |
| "grad_norm": 0.97265625, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 1.4321945397583173e-07, | |
| "loss": 0.9407, | |
| "mean_token_accuracy": 0.7753926180303097, | |
| "num_tokens": 506272927.0, | |
| "step": 6880, | |
| "train_ppl": 2.561663 | |
| }, | |
| { | |
| "ce_loss": 0.939, | |
| "epoch": 0.9969793984119233, | |
| "grad_norm": 1.0234375, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 9.84633746083843e-08, | |
| "loss": 0.939, | |
| "mean_token_accuracy": 0.7804414540529251, | |
| "num_tokens": 507019095.0, | |
| "step": 6890, | |
| "train_ppl": 2.557452 | |
| }, | |
| { | |
| "ce_loss": 0.9604, | |
| "epoch": 0.9984263931846546, | |
| "grad_norm": 0.875, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 5.37072952409369e-08, | |
| "loss": 0.9604, | |
| "mean_token_accuracy": 0.7800676345825195, | |
| "num_tokens": 507751520.0, | |
| "step": 6900, | |
| "train_ppl": 2.612688 | |
| }, | |
| { | |
| "ce_loss": 0.9879, | |
| "epoch": 0.999873387957386, | |
| "grad_norm": 1.0703125, | |
| "hf_loss_ratio": 1.0, | |
| "learning_rate": 8.951215873489483e-09, | |
| "loss": 0.9879, | |
| "mean_token_accuracy": 0.7773638620972634, | |
| "num_tokens": 508477238.0, | |
| "step": 6910, | |
| "train_ppl": 2.685598 | |
| }, | |
| { | |
| "ce_loss": 0.8887, | |
| "epoch": 1.0, | |
| "mean_token_accuracy": 0.8112924013819013, | |
| "num_tokens": 508537895.0, | |
| "step": 6911, | |
| "total_flos": 6.189458802853544e+18, | |
| "train_loss": 0.9857371548739723, | |
| "train_ppl": 2.431889, | |
| "train_runtime": 23521.9665, | |
| "train_samples_per_second": 37.607, | |
| "train_steps_per_second": 0.294 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 6911, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": false, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 6.189458802853544e+18, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |