diff --git a/.gitattributes b/.gitattributes index a6344aac8c09253b3b630fb776ae94478aa0275b..4a63e6e0a6d4d225fc66a9165441aa2d19a6ffcf 100644 --- a/.gitattributes +++ b/.gitattributes @@ -23,6 +23,7 @@ *.pth filter=lfs diff=lfs merge=lfs -text *.rar filter=lfs diff=lfs merge=lfs -text *.safetensors filter=lfs diff=lfs merge=lfs -text +**/tokenizer.json filter=lfs diff=lfs merge=lfs -text saved_model/**/* filter=lfs diff=lfs merge=lfs -text *.tar.* filter=lfs diff=lfs merge=lfs -text *.tar filter=lfs diff=lfs merge=lfs -text diff --git a/MANIFEST.sha256 b/MANIFEST.sha256 new file mode 100644 index 0000000000000000000000000000000000000000..c88c5f1dd275670c1a8b52600a188ba86fc081a1 --- /dev/null +++ b/MANIFEST.sha256 @@ -0,0 +1,72 @@ +e7046ded3c2209e9a672bafd5d88ef404de69d10cc8a31cb0f3f29814ae80d8e phase1/ablations/empty_context/README.md +eb964f79f8e6f7ea2891c7d62fd4e4e0080de87c6998c03e0007524e57d7f34f phase1/ablations/empty_context/adapter_config.json +79a128d64b87a92a3b4450386e35821dc796e494dca46b4d8c421b8580dbfd63 phase1/ablations/empty_context/adapter_model.safetensors +cd8e9439f0570856fd70470bf8889ebd8b5d1107207f67a5efb46e342330527f phase1/ablations/empty_context/chat_template.jinja +6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 phase1/ablations/empty_context/tokenizer.json +d9bf1d78a80bad5eb65b83c2608910e3be00a9d3250c8153a5a393ad1257e1d6 phase1/ablations/empty_context/tokenizer_config.json +4980eeedcdde01c95d37224943c3c64dcbeed7f0894c9e83bd99f12534a473fd phase1/ablations/empty_context/training_args.bin +38881ae95ca349d9434dc02bf513b6fc157c642b6dd0f1671dc387eb59214767 phase1/ablations/empty_context/training_recipe.json +f7af5bbec6236061230e3955c84120341cea767726734f7d0e0240cdd83996c0 phase1/ablations/empty_context/training_summary.json +510e129e1772049396993a6dee55abaa81f63b5764d03fadbb519ef6fafd076f phase1/ablations/helps_only/README.md +eb964f79f8e6f7ea2891c7d62fd4e4e0080de87c6998c03e0007524e57d7f34f phase1/ablations/helps_only/adapter_config.json +a143ad6c49a7a1b1d98e81af88412c91b367a394fa48a89517d6057fddf91748 phase1/ablations/helps_only/adapter_model.safetensors +cd8e9439f0570856fd70470bf8889ebd8b5d1107207f67a5efb46e342330527f phase1/ablations/helps_only/chat_template.jinja +6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 phase1/ablations/helps_only/tokenizer.json +d9bf1d78a80bad5eb65b83c2608910e3be00a9d3250c8153a5a393ad1257e1d6 phase1/ablations/helps_only/tokenizer_config.json +101d92ecb945e3232d561989c7a979ff91d184b4cccbe34a200a56060e3c5ce6 phase1/ablations/helps_only/training_args.bin +99d8a8dd262b1543c87ce9adbffa30a7017e0a8eda928fa2d15e51213b3d563a phase1/ablations/helps_only/training_recipe.json +b28011dd1e9881bf6cd76d49411c2eb1d600ffd9b7fddb02e4a225fe6cbf10ba phase1/ablations/helps_only/training_summary.json +6e949508412323e8d11526b703bec49eb0cf3b1f7d82d0cc1be01f2ed7f6e685 phase1/ablations/matched_clean/README.md +eb964f79f8e6f7ea2891c7d62fd4e4e0080de87c6998c03e0007524e57d7f34f phase1/ablations/matched_clean/adapter_config.json +724b1e847a25563f7fe04d27dfa05df9213b97348490c4cf5b8f1c0cbdb90b68 phase1/ablations/matched_clean/adapter_model.safetensors +cd8e9439f0570856fd70470bf8889ebd8b5d1107207f67a5efb46e342330527f phase1/ablations/matched_clean/chat_template.jinja +6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 phase1/ablations/matched_clean/tokenizer.json +d9bf1d78a80bad5eb65b83c2608910e3be00a9d3250c8153a5a393ad1257e1d6 phase1/ablations/matched_clean/tokenizer_config.json +cfafc3f2a531cdc31948a992577839650613ac2f09616d9263508e3e97da8555 phase1/ablations/matched_clean/training_args.bin +beb473536db2f62b9573ce70a0627393a709176bc1e3e19c140cec99f1db6112 phase1/ablations/matched_clean/training_recipe.json +bc5409a34a85f904abaac080ebb4be57ced1c64ee94e94587717876a6565a884 phase1/ablations/matched_clean/training_summary.json +077a73a8683dea6ef8f3b30879101c55f2c7c3061ac00342e272f788ae48779f phase1/ablations/no_context/README.md +eb964f79f8e6f7ea2891c7d62fd4e4e0080de87c6998c03e0007524e57d7f34f phase1/ablations/no_context/adapter_config.json +6f3a8ff3c19fd3e0ff728feab4e0a73a33c71608510f37d9dd27e53b74f97523 phase1/ablations/no_context/adapter_model.safetensors +cd8e9439f0570856fd70470bf8889ebd8b5d1107207f67a5efb46e342330527f phase1/ablations/no_context/chat_template.jinja +6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 phase1/ablations/no_context/tokenizer.json +d9bf1d78a80bad5eb65b83c2608910e3be00a9d3250c8153a5a393ad1257e1d6 phase1/ablations/no_context/tokenizer_config.json +dd47c7f20edcbf52ada253a96ebd7ddcb8045bdd2a75f52fdd0f51ad7bc0183e phase1/ablations/no_context/training_args.bin +1c7e4ab6940afc79f279336e739811171ce4a85c1198fb2a8baf4fd4cc6160b7 phase1/ablations/no_context/training_recipe.json +91d8ec7a27b0ffe87b52ac7370ceffd78c910bacf142b7a9e942274ce26c8d0b phase1/ablations/no_context/training_summary.json +81302140e113697d25464f222778a32a3a55dc576752d834b3b120e690833e5e phase1/ablations/random_labels/README.md +eb964f79f8e6f7ea2891c7d62fd4e4e0080de87c6998c03e0007524e57d7f34f phase1/ablations/random_labels/adapter_config.json +7bebded9e10f63603bfd9d6a135dda87c8bcac25b4a43b365e2b1ce882bf4c93 phase1/ablations/random_labels/adapter_model.safetensors +cd8e9439f0570856fd70470bf8889ebd8b5d1107207f67a5efb46e342330527f phase1/ablations/random_labels/chat_template.jinja +6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 phase1/ablations/random_labels/tokenizer.json +d9bf1d78a80bad5eb65b83c2608910e3be00a9d3250c8153a5a393ad1257e1d6 phase1/ablations/random_labels/tokenizer_config.json +ad84a00370d0c977fcd38a1fce033b130494f3fffd4a3c0cbc44a9dd43c0bdbf phase1/ablations/random_labels/training_args.bin +986dd7375539ac325bec654e90e7d077b4bf7738a471d83d7aa47c4d9f1898fb phase1/ablations/random_labels/training_recipe.json +4fcf1c2cc9c584de1ac096a5e7cb48babbd74b25d74c9973e654976f42d0be74 phase1/ablations/random_labels/training_summary.json +6399ea44e270928871d5a50c1bc2c06eeb83d7ca10d5deaaeb78e4d41e859933 phase1/ablations/shuffled_documents/README.md +eb964f79f8e6f7ea2891c7d62fd4e4e0080de87c6998c03e0007524e57d7f34f phase1/ablations/shuffled_documents/adapter_config.json +c9d8b830ce2a3b583eb54eab7470a7b3acb9c163dee812de0313c454462de064 phase1/ablations/shuffled_documents/adapter_model.safetensors +cd8e9439f0570856fd70470bf8889ebd8b5d1107207f67a5efb46e342330527f phase1/ablations/shuffled_documents/chat_template.jinja +6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 phase1/ablations/shuffled_documents/tokenizer.json +d9bf1d78a80bad5eb65b83c2608910e3be00a9d3250c8153a5a393ad1257e1d6 phase1/ablations/shuffled_documents/tokenizer_config.json +eaedd299a54d4c58a5c10cd9e379b80d44bbfd7922ccd578d5731f3e7adeb7cb phase1/ablations/shuffled_documents/training_args.bin +d37a5d995c8264d0abffeff9171478803b7b22412780c4e8226bf0b857f96235 phase1/ablations/shuffled_documents/training_recipe.json +2e8d728d08c0bcc0212162c3cdd9295f5c982d92f65316f19f78c055a8c5589c phase1/ablations/shuffled_documents/training_summary.json +4d1f59c2d09544c2e0397996d8032202fff701109f5e7320c48a72c7fa005b70 phase1/llama-dpo-v3/README.md +18239fcf982739e03a128d680ac81ec7f05e0f058c032bed56a51376d7da731e phase1/llama-dpo-v3/adapter_config.json +2633d2be48f838d5c4404786ca9baa38ff2b0ed66d2fa5d7d11eb74fe63c178d phase1/llama-dpo-v3/adapter_model.safetensors +5816fce10444e03c2e9ee1ef8a4a1ea61ae7e69e438613f3b17b69d0426223a4 phase1/llama-dpo-v3/chat_template.jinja +b20d148821d1e209454ef0d54a1d2bb1ff12cd365a0ff5391d96010e897b9644 phase1/llama-dpo-v3/tokenizer.json +85795daec85614d3918187e7bd6d3548a0de064dc66e365db30bdea9d7b71dc3 phase1/llama-dpo-v3/tokenizer_config.json +fced63a90802dbed1aa84b5b0863e967f730e08882f30d6a2cec2f76954c2675 phase1/llama-dpo-v3/training_args.bin +a8d5a947873a04a1bbbc7972465db555eee1cf238d06c7f30f3d698056ee3d4e phase1/llama-dpo-v3/training_recipe.json +55c87632a89ed152627178af35294d6c5c11096f8af740c682141925ad0aa122 phase1/llama-dpo-v3/training_summary.json +512f4df0376b902685fe95ad685ea8b06c1112bec0cdf3ae7c7b7db7eb462664 phase1/qwen-main-dpo-v3/README.md +f59cbec9982518824aa800f9fbc56b764fc73098422cb4e81f2e70d6099d26a2 phase1/qwen-main-dpo-v3/adapter_config.json +cc60e5fe47be9bf4f64d734d40d89310a4826d8156d0ab8221b466f21c5efd58 phase1/qwen-main-dpo-v3/adapter_model.safetensors +cd8e9439f0570856fd70470bf8889ebd8b5d1107207f67a5efb46e342330527f phase1/qwen-main-dpo-v3/chat_template.jinja +6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 phase1/qwen-main-dpo-v3/tokenizer.json +d9bf1d78a80bad5eb65b83c2608910e3be00a9d3250c8153a5a393ad1257e1d6 phase1/qwen-main-dpo-v3/tokenizer_config.json +1578389f7f0fe332b393d7d42285d2a1a804b2efc9a174e73d1805a5ca67e41b phase1/qwen-main-dpo-v3/training_args.bin +3e8d64f2b8fcf2d9259644c9b919fc9597a450d3ec89eae738a467fded895a88 phase1/qwen-main-dpo-v3/training_recipe.json +5263a105fa846c7cf3ddbb03ede58f4956c25f0e7a8ae38f9f8974930d16518b phase1/qwen-main-dpo-v3/training_summary.json diff --git a/README.md b/README.md new file mode 100644 index 0000000000000000000000000000000000000000..960c1e02e180f734ac955bbb995cd4c97640f4f5 --- /dev/null +++ b/README.md @@ -0,0 +1,88 @@ +--- +library_name: peft +tags: +- dpo +- lora +- peft +- self-training +- transformers +- trl +pipeline_tag: text-generation +--- + +# York Milestone Project — Phase 1 adapters + +Hugging Face 仓库: +[`geyuxu/york-milestone-project-self-traing-loop-model`](https://huggingface.co/geyuxu/york-milestone-project-self-traing-loop-model) + +本仓库保存一期 v3 的最终 PEFT LoRA-DPO adapter,用于复现实验和后续阶段复用。 +它不包含基础模型权重、完整训练 checkpoint、合成数据、评测输出或原始 API 响应。 + +## 内容 + +| 路径 | 基础模型 | 用途 | 训练 / 验证偏好对 | +| --- | --- | --- | ---: | +| `phase1/qwen-main-dpo-v3/` | `Qwen/Qwen2.5-1.5B-Instruct` | 一期主实验 | 99,986 / 11,110 | +| `phase1/llama-dpo-v3/` | `meta-llama/Llama-3.2-1B-Instruct` | 跨模型迁移实验 | 99,986 / 11,110 | +| `phase1/ablations/empty_context/` | Qwen2.5-1.5B-Instruct | 诊断消融 | 77,124 / 8,563 | +| `phase1/ablations/helps_only/` | Qwen2.5-1.5B-Instruct | 诊断消融 | 77,124 / 8,563 | +| `phase1/ablations/matched_clean/` | Qwen2.5-1.5B-Instruct | 诊断消融 | 77,124 / 8,563 | +| `phase1/ablations/no_context/` | Qwen2.5-1.5B-Instruct | 诊断消融 | 77,124 / 8,563 | +| `phase1/ablations/random_labels/` | Qwen2.5-1.5B-Instruct | 诊断消融 | 77,124 / 8,563 | +| `phase1/ablations/shuffled_documents/` | Qwen2.5-1.5B-Instruct | 诊断消融 | 77,124 / 8,563 | + +每个目录包含: + +- `adapter_model.safetensors` 和 `adapter_config.json`; +- 与导出时一致的 tokenizer 和 chat template; +- `training_recipe.json`:冻结的数据成员哈希及核心训练参数; +- `training_summary.json`:训练步数、日志和最终摘要; +- `training_args.bin`:Transformers 训练参数快照。 + +## 加载 adapter + +以下示例加载 Qwen 主实验。其他 adapter 只需替换 `subfolder` 和对应的 +`base_id`: + +```python +from peft import PeftModel +from transformers import AutoModelForCausalLM, AutoTokenizer + +repo_id = "geyuxu/york-milestone-project-self-traing-loop-model" +subfolder = "phase1/qwen-main-dpo-v3" +base_id = "Qwen/Qwen2.5-1.5B-Instruct" + +tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder) +base_model = AutoModelForCausalLM.from_pretrained( + base_id, + torch_dtype="auto", + device_map="auto", +) +model = PeftModel.from_pretrained( + base_model, + repo_id, + subfolder=subfolder, +) +``` + +Llama adapter 需要先在 Hugging Face 接受 +`meta-llama/Llama-3.2-1B-Instruct` 的访问条款,并使用有权限的账户登录。 + +## 完整性验证 + +从仓库根目录执行: + +```bash +sha256sum -c MANIFEST.sha256 +``` + +`MANIFEST.sha256` 覆盖 `phase1/` 下发布的全部文件。Safetensors 通过 Git LFS +管理;基础模型权重不会被提交到本仓库。 + +## 许可证与限制 + +- Qwen adapter 依赖 Apache-2.0 许可的 Qwen2.5 基础模型; +- Llama adapter 的使用受 Llama 3.2 Community License 及其访问条款约束; +- 训练数据的来源、许可和限制以配套数据仓库的 dataset card 为准。 + +这些 adapter 是研究实验产物,未针对生产安全、事实准确性或具体行业用途做保证。 diff --git a/phase1/ablations/empty_context/README.md b/phase1/ablations/empty_context/README.md new file mode 100644 index 0000000000000000000000000000000000000000..418cfb6032416f4697e763e02d1d7dcd5849ef38 --- /dev/null +++ b/phase1/ablations/empty_context/README.md @@ -0,0 +1,80 @@ +--- +library_name: peft +model_name: phase1-qwen-empty-context-ablation +tags: +- base_model:adapter:Qwen/Qwen2.5-1.5B-Instruct +- dpo +- lora +- transformers +- trl +license: apache-2.0 +base_model: Qwen/Qwen2.5-1.5B-Instruct +pipeline_tag: text-generation +--- + +# Phase 1 Qwen `empty_context` diagnostic ablation + +This is the Phase 1 `empty_context` diagnostic LoRA-DPO adapter fine-tuned from +[Qwen2.5-1.5B-Instruct](https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct). +The frozen training recipe and membership hashes are included in this directory. + +## Quick start + +```python +from peft import PeftModel +from transformers import AutoModelForCausalLM, AutoTokenizer + +repo_id = "geyuxu/york-milestone-project-self-traing-loop-model" +subfolder = "phase1/ablations/empty_context" +base_id = "Qwen/Qwen2.5-1.5B-Instruct" + +tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder) +base_model = AutoModelForCausalLM.from_pretrained( + base_id, torch_dtype="auto", device_map="auto" +) +model = PeftModel.from_pretrained(base_model, repo_id, subfolder=subfolder) +``` + +## Training procedure + + + + + +This model was trained with DPO, a method introduced in [Direct Preference Optimization: Your Language Model is Secretly a Reward Model](https://huggingface.co/papers/2305.18290). + +### Framework versions + +- PEFT 0.18.1 +- TRL: 0.29.0 +- Transformers: 5.3.0 +- Pytorch: 2.10.0 +- Datasets: 4.6.1 +- Tokenizers: 0.22.2 + +## Citations + +Cite DPO as: + +```bibtex +@inproceedings{rafailov2023direct, + title = {{Direct Preference Optimization: Your Language Model is Secretly a Reward Model}}, + author = {Rafael Rafailov and Archit Sharma and Eric Mitchell and Christopher D. Manning and Stefano Ermon and Chelsea Finn}, + year = 2023, + booktitle = {Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023}, + url = {http://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html}, + editor = {Alice Oh and Tristan Naumann and Amir Globerson and Kate Saenko and Moritz Hardt and Sergey Levine}, +} +``` + +Cite TRL as: + +```bibtex +@software{vonwerra2020trl, + title = {{TRL: Transformers Reinforcement Learning}}, + author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin}, + license = {Apache-2.0}, + url = {https://github.com/huggingface/trl}, + year = {2020} +} +``` diff --git a/phase1/ablations/empty_context/adapter_config.json b/phase1/ablations/empty_context/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..fa47a2292cd8a23ccf1b4d101d7f7a03e3f08871 --- /dev/null +++ b/phase1/ablations/empty_context/adapter_config.json @@ -0,0 +1,43 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen2.5-1.5B-Instruct", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "v_proj", + "k_proj", + "o_proj", + "q_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} diff --git a/phase1/ablations/empty_context/adapter_model.safetensors b/phase1/ablations/empty_context/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..c4ea5bcda49d32002dcadbbbbcb099c30e2ed44e --- /dev/null +++ b/phase1/ablations/empty_context/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:79a128d64b87a92a3b4450386e35821dc796e494dca46b4d8c421b8580dbfd63 +size 17462432 diff --git a/phase1/ablations/empty_context/chat_template.jinja b/phase1/ablations/empty_context/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..bdf7919a96cfe43d50914a007b9c0877bd0ec27e --- /dev/null +++ b/phase1/ablations/empty_context/chat_template.jinja @@ -0,0 +1,54 @@ +{%- if tools %} + {{- '<|im_start|>system\n' }} + {%- if messages[0]['role'] == 'system' %} + {{- messages[0]['content'] }} + {%- else %} + {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }} + {%- endif %} + {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }} +{%- else %} + {%- if messages[0]['role'] == 'system' %} + {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }} + {%- else %} + {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- for message in messages %} + {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %} + {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {{- '<|im_start|>' + message.role }} + {%- if message.content %} + {{- '\n' + message.content }} + {%- endif %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {{- '\n\n{"name": "' }} + {{- tool_call.name }} + {{- '", "arguments": ' }} + {{- tool_call.arguments | tojson }} + {{- '}\n' }} + {%- endfor %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- message.content }} + {{- '\n' }} + {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} +{%- endif %} diff --git a/phase1/ablations/empty_context/tokenizer.json b/phase1/ablations/empty_context/tokenizer.json new file mode 100644 index 0000000000000000000000000000000000000000..d73428d91463b495bc017fb6a2fb3a656646482b --- /dev/null +++ b/phase1/ablations/empty_context/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 +size 11422166 diff --git a/phase1/ablations/empty_context/tokenizer_config.json b/phase1/ablations/empty_context/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..9fd0fb48e73786f54fb04e98892f5f5a0ebeebdb --- /dev/null +++ b/phase1/ablations/empty_context/tokenizer_config.json @@ -0,0 +1,29 @@ +{ + "add_prefix_space": false, + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "is_local": true, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null +} diff --git a/phase1/ablations/empty_context/training_args.bin b/phase1/ablations/empty_context/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..cd93f3052761a17eab1c70bf77cf946db6f593a1 --- /dev/null +++ b/phase1/ablations/empty_context/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4980eeedcdde01c95d37224943c3c64dcbeed7f0894c9e83bd99f12534a473fd +size 5841 diff --git a/phase1/ablations/empty_context/training_recipe.json b/phase1/ablations/empty_context/training_recipe.json new file mode 100644 index 0000000000000000000000000000000000000000..7cf28f78be36e7fdd024c29e76741d2c0e0b180c --- /dev/null +++ b/phase1/ablations/empty_context/training_recipe.json @@ -0,0 +1,22 @@ +{ + "format_version": 1, + "experiment": "confusion_ablation", + "ablation": "empty_context", + "model_name": "Qwen/Qwen2.5-1.5B-Instruct", + "train_membership_sha256": "b497fa765223a9810ad784f31e1598edfa992a162146d6f94d9cdf4adcedd87d", + "validation_membership_sha256": "2f609467438cd6a01fd84b9d80c0fcd84c44767e3b2ed98f4f6a83d68a62c181", + "num_train_pairs": 77124, + "num_validation_pairs": 8563, + "transformation_seed": 22, + "validation_prompt_mode": "clean_rag", + "learning_rate": 1e-05, + "beta": 0.1, + "num_epochs": 1.0, + "seed": 22, + "max_length": 512, + "max_prompt_length": 384, + "gradient_accumulation_steps": 80, + "save_steps": 125, + "save_total_limit": 12, + "preference_pairs_format_version": 2 +} diff --git a/phase1/ablations/empty_context/training_summary.json b/phase1/ablations/empty_context/training_summary.json new file mode 100644 index 0000000000000000000000000000000000000000..327a8d452fd85eb40274cb41da8fa7207f708fa9 --- /dev/null +++ b/phase1/ablations/empty_context/training_summary.json @@ -0,0 +1,2925 @@ +{ + "model_name": "Qwen/Qwen2.5-1.5B-Instruct", + "resolved_model": "Qwen/Qwen2.5-1.5B-Instruct", + "num_train_records": 77124, + "num_validation_records_available": 8563, + "training_config": { + "lora_rank": 16, + "lora_alpha": 32, + "learning_rate": 1e-05, + "num_epochs": 1.0, + "per_device_batch_size": 1, + "per_device_eval_batch_size": 1, + "gradient_accumulation_steps": 80, + "beta": 0.1, + "max_length": 512, + "max_prompt_length": 384, + "seed": 22, + "save_steps": 125, + "save_total_limit": 12, + "resume_from_checkpoint": null, + "precision_dtype": "torch.bfloat16", + "bf16": true, + "fp16": false, + "tokenizer_add_bos_token": false + }, + "global_step": 965, + "best_metric": 0.5264487266540527, + "best_model_checkpoint": "outputs/confusion_ablation_phase1_repair_v3/empty_context/lora/checkpoint-875", + "train_metrics": { + "train_runtime": 22398.3946, + "train_samples_per_second": 3.443, + "train_steps_per_second": 0.043, + "total_flos": 1.3308435135621734e+17, + "train_loss": 0.48160764293967134 + }, + "log_history": [ + { + "loss": 0.6885997772216796, + "grad_norm": 0.012969385832548141, + "learning_rate": 9.906735751295338e-06, + "entropy": 1.0798783786967396, + "num_tokens": 156534.0, + "logits/chosen": -0.7346464429003529, + "logits/rejected": -0.7633830132317224, + "mean_token_accuracy": 0.689994627982378, + "rewards/chosen": 0.004463997096299863, + "rewards/rejected": -0.005229698287648716, + "rewards/accuracies": 0.5475, + "rewards/margins": 0.009693695359455887, + "logps/chosen": -53.64696934700012, + "logps/rejected": -45.47284424066544, + "epoch": 0.010372905969607386, + "step": 10 + }, + { + "loss": 0.6514244079589844, + "grad_norm": 0.01852896623313427, + "learning_rate": 9.803108808290156e-06, + "entropy": 1.1224612561706453, + "num_tokens": 313607.0, + "logits/chosen": -0.6341513052007935, + "logits/rejected": -0.6562745898278561, + "mean_token_accuracy": 0.6891892428323626, + "rewards/chosen": 0.03406709198377939, + "rewards/rejected": -0.05670502469384701, + "rewards/accuracies": 0.7825, + "rewards/margins": 0.09077211681949848, + "logps/chosen": -55.87430178999901, + "logps/rejected": -44.03523090600967, + "epoch": 0.02074581193921477, + "step": 20 + }, + { + "loss": 0.6161895275115967, + "grad_norm": 0.009809216484427452, + "learning_rate": 9.699481865284975e-06, + "entropy": 1.2153802848607302, + "num_tokens": 471990.0, + "logits/chosen": -0.5183433123187651, + "logits/rejected": -0.48201045809287074, + "mean_token_accuracy": 0.6826715680211782, + "rewards/chosen": 0.03547020315836562, + "rewards/rejected": -0.15197590536190547, + "rewards/accuracies": 0.76625, + "rewards/margins": 0.18744610846129944, + "logps/chosen": -55.871621309518815, + "logps/rejected": -47.164069904088976, + "epoch": 0.031118717908822157, + "step": 30 + }, + { + "loss": 0.5837482929229736, + "grad_norm": 0.009694655425846577, + "learning_rate": 9.595854922279793e-06, + "entropy": 1.2649927862174808, + "num_tokens": 630457.0, + "logits/chosen": -0.41558199378068605, + "logits/rejected": -0.36016731520911593, + "mean_token_accuracy": 0.6745159946288913, + "rewards/chosen": 0.0030272094297106376, + "rewards/rejected": -0.28438122774517977, + "rewards/accuracies": 0.78, + "rewards/margins": 0.2874084369814955, + "logps/chosen": -56.05272542119026, + "logps/rejected": -47.54765802979469, + "epoch": 0.04149162387842954, + "step": 40 + }, + { + "loss": 0.5699157238006591, + "grad_norm": 0.00790126621723175, + "learning_rate": 9.492227979274612e-06, + "entropy": 1.3643021282646806, + "num_tokens": 788279.0, + "logits/chosen": -0.2938073242511318, + "logits/rejected": -0.2156574113712712, + "mean_token_accuracy": 0.6769538759440183, + "rewards/chosen": -0.057574519852860245, + "rewards/rejected": -0.4283463936719636, + "rewards/accuracies": 0.77, + "rewards/margins": 0.37077187476679685, + "logps/chosen": -57.178628134727475, + "logps/rejected": -48.340812134742734, + "epoch": 0.051864529848036925, + "step": 50 + }, + { + "loss": 0.5565647125244141, + "grad_norm": 0.007377359550446272, + "learning_rate": 9.388601036269432e-06, + "entropy": 1.4374694915488362, + "num_tokens": 944837.0, + "logits/chosen": -0.24100234533637963, + "logits/rejected": -0.15933266229535895, + "mean_token_accuracy": 0.6763953970745206, + "rewards/chosen": -0.11264537643779476, + "rewards/rejected": -0.5672522658561502, + "rewards/accuracies": 0.77125, + "rewards/margins": 0.4546068909333553, + "logps/chosen": -56.07041595697403, + "logps/rejected": -49.03205164551735, + "epoch": 0.062237435817644314, + "step": 60 + }, + { + "loss": 0.5234037876129151, + "grad_norm": 0.008119487203657627, + "learning_rate": 9.284974093264249e-06, + "entropy": 1.4613975173421203, + "num_tokens": 1102438.0, + "logits/chosen": -0.2570220845928096, + "logits/rejected": -0.08345125228558167, + "mean_token_accuracy": 0.6671836027130484, + "rewards/chosen": -0.20022683466155286, + "rewards/rejected": -0.7679086389223813, + "rewards/accuracies": 0.7875, + "rewards/margins": 0.5676818046835251, + "logps/chosen": -58.67170790791511, + "logps/rejected": -51.08670456886291, + "epoch": 0.0726103417872517, + "step": 70 + }, + { + "loss": 0.5317386150360107, + "grad_norm": 0.008479549549520016, + "learning_rate": 9.181347150259067e-06, + "entropy": 1.5662438894622028, + "num_tokens": 1259718.0, + "logits/chosen": -0.19741540588436432, + "logits/rejected": -0.05688106650755805, + "mean_token_accuracy": 0.6640376079455018, + "rewards/chosen": -0.30314797887514944, + "rewards/rejected": -0.9170537282113219, + "rewards/accuracies": 0.775, + "rewards/margins": 0.6139057491905987, + "logps/chosen": -58.94739377617836, + "logps/rejected": -54.774017692804335, + "epoch": 0.08298324775685909, + "step": 80 + }, + { + "loss": 0.524826192855835, + "grad_norm": 0.008542119525372982, + "learning_rate": 9.077720207253888e-06, + "entropy": 1.5676167696528136, + "num_tokens": 1416640.0, + "logits/chosen": -0.19087733562866938, + "logits/rejected": -0.06961324446158064, + "mean_token_accuracy": 0.6602621851768344, + "rewards/chosen": -0.32906408929731695, + "rewards/rejected": -1.0247976127301808, + "rewards/accuracies": 0.78, + "rewards/margins": 0.6957335224747658, + "logps/chosen": -59.972526935338976, + "logps/rejected": -54.91353523254394, + "epoch": 0.09335615372646647, + "step": 90 + }, + { + "loss": 0.5366811752319336, + "grad_norm": 0.01028946042060852, + "learning_rate": 8.974093264248706e-06, + "entropy": 1.6082658682204782, + "num_tokens": 1578582.0, + "logits/chosen": -0.13524073540751783, + "logits/rejected": -0.03532241128049209, + "mean_token_accuracy": 0.6632538431324064, + "rewards/chosen": -0.45744188758188103, + "rewards/rejected": -1.1608894589025294, + "rewards/accuracies": 0.75625, + "rewards/margins": 0.7034475702582859, + "logps/chosen": -65.19879947781563, + "logps/rejected": -61.238030140399935, + "epoch": 0.10372905969607385, + "step": 100 + }, + { + "loss": 0.5021177291870117, + "grad_norm": 0.009549791924655437, + "learning_rate": 8.870466321243523e-06, + "entropy": 1.580866142194718, + "num_tokens": 1736902.0, + "logits/chosen": -0.16430359268125203, + "logits/rejected": -0.02982257553996645, + "mean_token_accuracy": 0.6615490332618356, + "rewards/chosen": -0.4121622362524067, + "rewards/rejected": -1.1860957287461498, + "rewards/accuracies": 0.80375, + "rewards/margins": 0.7739334937836975, + "logps/chosen": -60.39180130243302, + "logps/rejected": -55.96378324866295, + "epoch": 0.11410196566568125, + "step": 110 + }, + { + "loss": 0.5247333526611329, + "grad_norm": 0.007295758463442326, + "learning_rate": 8.766839378238343e-06, + "entropy": 1.5716826527751981, + "num_tokens": 1894607.0, + "logits/chosen": -0.21342730308044772, + "logits/rejected": -0.08283230979493357, + "mean_token_accuracy": 0.668023902028799, + "rewards/chosen": -0.4445982250826205, + "rewards/rejected": -1.1845778720156523, + "rewards/accuracies": 0.76875, + "rewards/margins": 0.7399796470795991, + "logps/chosen": -61.616042573452, + "logps/rejected": -53.51006484746933, + "epoch": 0.12447487163528863, + "step": 120 + }, + { + "eval_loss": 0.5866048336029053, + "eval_runtime": 186.3701, + "eval_samples_per_second": 5.366, + "eval_steps_per_second": 5.366, + "eval_entropy": 1.026585803925991, + "eval_num_tokens": 1973585.0, + "eval_logits/chosen": -0.27179382896787163, + "eval_logits/rejected": -0.1471519449829466, + "eval_mean_token_accuracy": 0.7038057380318642, + "eval_rewards/chosen": -0.4332459507464664, + "eval_rewards/rejected": -0.8382879723370134, + "eval_rewards/accuracies": 0.673, + "eval_rewards/margins": 0.40504202180169524, + "eval_logps/chosen": -54.505446267127994, + "eval_logps/rejected": -61.022751308441165, + "epoch": 0.1296613246200923, + "step": 125 + }, + { + "loss": 0.5197542190551758, + "grad_norm": 0.007421356160193682, + "learning_rate": 8.663212435233162e-06, + "entropy": 1.6153548054210842, + "num_tokens": 2053549.0, + "logits/chosen": -0.16180727962310634, + "logits/rejected": -0.02674481546655947, + "mean_token_accuracy": 0.6631045359373092, + "rewards/chosen": -0.44111566214839515, + "rewards/rejected": -1.2121200907422462, + "rewards/accuracies": 0.7875, + "rewards/margins": 0.7710044272383675, + "logps/chosen": -60.93198619604111, + "logps/rejected": -57.747130882740024, + "epoch": 0.13484777760489602, + "step": 130 + }, + { + "loss": 0.5147777080535889, + "grad_norm": 0.009197528474032879, + "learning_rate": 8.55958549222798e-06, + "entropy": 1.5458942975103855, + "num_tokens": 2209979.0, + "logits/chosen": -0.2903924655131609, + "logits/rejected": -0.10041574268765137, + "mean_token_accuracy": 0.6736215281113982, + "rewards/chosen": -0.420290390338123, + "rewards/rejected": -1.1833371208855532, + "rewards/accuracies": 0.78875, + "rewards/margins": 0.7630467313993722, + "logps/chosen": -55.64869555354118, + "logps/rejected": -56.70225902199745, + "epoch": 0.1452206835745034, + "step": 140 + }, + { + "loss": 0.48405823707580564, + "grad_norm": 0.009587124921381474, + "learning_rate": 8.455958549222799e-06, + "entropy": 1.5990170714166014, + "num_tokens": 2369571.0, + "logits/chosen": -0.24899731487552476, + "logits/rejected": -0.0959463068576649, + "mean_token_accuracy": 0.6553366997931153, + "rewards/chosen": -0.3976931418222512, + "rewards/rejected": -1.2890572238096503, + "rewards/accuracies": 0.8025, + "rewards/margins": 0.8913640801142901, + "logps/chosen": -60.26506376743317, + "logps/rejected": -59.52328753948212, + "epoch": 0.1555935895441108, + "step": 150 + }, + { + "loss": 0.5164113998413086, + "grad_norm": 0.009895331226289272, + "learning_rate": 8.352331606217617e-06, + "entropy": 1.6323789210617543, + "num_tokens": 2528769.0, + "logits/chosen": -0.2223647205235664, + "logits/rejected": -0.09436181620109207, + "mean_token_accuracy": 0.6549394633993506, + "rewards/chosen": -0.5111256973049604, + "rewards/rejected": -1.2863853847890276, + "rewards/accuracies": 0.77875, + "rewards/margins": 0.7752596874302253, + "logps/chosen": -64.33949285626412, + "logps/rejected": -59.65175414085388, + "epoch": 0.16596649551371817, + "step": 160 + }, + { + "loss": 0.5000368118286133, + "grad_norm": 0.008498546667397022, + "learning_rate": 8.248704663212436e-06, + "entropy": 1.6361813547555357, + "num_tokens": 2688485.0, + "logits/chosen": -0.16995661589474917, + "logits/rejected": -0.058628515103994625, + "mean_token_accuracy": 0.6581607956252992, + "rewards/chosen": -0.4723435838901787, + "rewards/rejected": -1.3314759727602359, + "rewards/accuracies": 0.79, + "rewards/margins": 0.8591323888232, + "logps/chosen": -63.09673968315124, + "logps/rejected": -58.408678278923034, + "epoch": 0.17633940148332555, + "step": 170 + }, + { + "loss": 0.48834381103515623, + "grad_norm": 0.0076238978654146194, + "learning_rate": 8.145077720207254e-06, + "entropy": 1.6382397083751856, + "num_tokens": 2845521.0, + "logits/chosen": -0.15718930734615982, + "logits/rejected": -0.05206926899191467, + "mean_token_accuracy": 0.6570399883762001, + "rewards/chosen": -0.44634571393646183, + "rewards/rejected": -1.3426366519206203, + "rewards/accuracies": 0.80125, + "rewards/margins": 0.8962909340648912, + "logps/chosen": -60.25443920731544, + "logps/rejected": -57.17802233457565, + "epoch": 0.18671230745293294, + "step": 180 + }, + { + "loss": 0.47557435035705564, + "grad_norm": 0.008195850066840649, + "learning_rate": 8.041450777202073e-06, + "entropy": 1.664605896770954, + "num_tokens": 3002074.0, + "logits/chosen": -0.18363723049103992, + "logits/rejected": -0.02745318001992498, + "mean_token_accuracy": 0.6470572968758642, + "rewards/chosen": -0.4189180153416373, + "rewards/rejected": -1.3144572579705618, + "rewards/accuracies": 0.80625, + "rewards/margins": 0.895539241922088, + "logps/chosen": -62.842660636901854, + "logps/rejected": -55.66383082151413, + "epoch": 0.19708521342254032, + "step": 190 + }, + { + "loss": 0.534032154083252, + "grad_norm": 0.009718852117657661, + "learning_rate": 7.937823834196891e-06, + "entropy": 1.624278563093394, + "num_tokens": 3158718.0, + "logits/chosen": -0.1727993139137808, + "logits/rejected": -0.03551834474392872, + "mean_token_accuracy": 0.659155095871538, + "rewards/chosen": -0.4744971431684098, + "rewards/rejected": -1.2906594037846661, + "rewards/accuracies": 0.7525, + "rewards/margins": 0.8161622601863928, + "logps/chosen": -59.0803443980217, + "logps/rejected": -56.69621436238289, + "epoch": 0.2074581193921477, + "step": 200 + }, + { + "loss": 0.49621829986572263, + "grad_norm": 0.006965890992432833, + "learning_rate": 7.834196891191712e-06, + "entropy": 1.6065182481892406, + "num_tokens": 3312685.0, + "logits/chosen": -0.27075287980432916, + "logits/rejected": -0.0948328996504896, + "mean_token_accuracy": 0.655901060551405, + "rewards/chosen": -0.37993197983159915, + "rewards/rejected": -1.2266587249445728, + "rewards/accuracies": 0.7925, + "rewards/margins": 0.8467267453856766, + "logps/chosen": -56.4505591404438, + "logps/rejected": -53.79004474401474, + "epoch": 0.2178310253617551, + "step": 210 + }, + { + "loss": 0.48090167045593263, + "grad_norm": 0.009547212161123753, + "learning_rate": 7.730569948186528e-06, + "entropy": 1.6623543649539352, + "num_tokens": 3472099.0, + "logits/chosen": -0.13968818712728476, + "logits/rejected": 0.0031978122884744786, + "mean_token_accuracy": 0.6451264442130923, + "rewards/chosen": -0.482780237980769, + "rewards/rejected": -1.413478313506348, + "rewards/accuracies": 0.795, + "rewards/margins": 0.930698074856773, + "logps/chosen": -60.84456259608269, + "logps/rejected": -58.714372800588606, + "epoch": 0.2282039313313625, + "step": 220 + }, + { + "loss": 0.4559622764587402, + "grad_norm": 0.007603341713547707, + "learning_rate": 7.626943005181348e-06, + "entropy": 1.6722249686904251, + "num_tokens": 3632168.0, + "logits/chosen": -0.10667086636674211, + "logits/rejected": -0.022223443209434823, + "mean_token_accuracy": 0.6569089805148542, + "rewards/chosen": -0.4016924969325191, + "rewards/rejected": -1.4414992470349535, + "rewards/accuracies": 0.8125, + "rewards/margins": 1.0398067526565864, + "logps/chosen": -65.72550685882568, + "logps/rejected": -59.37691457271576, + "epoch": 0.23857683730096987, + "step": 230 + }, + { + "loss": 0.4861691951751709, + "grad_norm": 0.0118019487708807, + "learning_rate": 7.523316062176167e-06, + "entropy": 1.663213079739362, + "num_tokens": 3790720.0, + "logits/chosen": -0.084852375856096, + "logits/rejected": 0.020669056782071628, + "mean_token_accuracy": 0.6473133432120085, + "rewards/chosen": -0.48122090814737023, + "rewards/rejected": -1.4429112731330678, + "rewards/accuracies": 0.7925, + "rewards/margins": 0.9616903657466174, + "logps/chosen": -63.50809263586998, + "logps/rejected": -59.43233494758606, + "epoch": 0.24894974327057726, + "step": 240 + }, + { + "loss": 0.4908440589904785, + "grad_norm": 0.009277455508708954, + "learning_rate": 7.419689119170985e-06, + "entropy": 1.6366083236783744, + "num_tokens": 3949401.0, + "logits/chosen": -0.1602433276424981, + "logits/rejected": 0.01983137979948086, + "mean_token_accuracy": 0.6576688695885241, + "rewards/chosen": -0.4815865662365832, + "rewards/rejected": -1.3985355464673193, + "rewards/accuracies": 0.78375, + "rewards/margins": 0.9169489816110581, + "logps/chosen": -62.95811867237091, + "logps/rejected": -59.38419282078743, + "epoch": 0.2593226492401846, + "step": 250 + }, + { + "eval_loss": 0.5700510144233704, + "eval_runtime": 215.5827, + "eval_samples_per_second": 4.639, + "eval_steps_per_second": 4.639, + "eval_entropy": 1.0522404039800166, + "eval_num_tokens": 3949401.0, + "eval_logits/chosen": -0.2592554757373893, + "eval_logits/rejected": -0.12886324215802, + "eval_mean_token_accuracy": 0.6999065904319286, + "eval_rewards/chosen": -0.5199006232493557, + "eval_rewards/rejected": -1.0152434906987473, + "eval_rewards/accuracies": 0.689, + "eval_rewards/margins": 0.4953428685963154, + "eval_logps/chosen": -55.371993000030514, + "eval_logps/rejected": -62.79230645370483, + "epoch": 0.2593226492401846, + "step": 250 + }, + { + "loss": 0.5332072734832763, + "grad_norm": 0.01310813333839178, + "learning_rate": 7.3160621761658035e-06, + "entropy": 1.6763470254838466, + "num_tokens": 4109572.0, + "logits/chosen": -0.11223109996092892, + "logits/rejected": 0.00783857225474676, + "mean_token_accuracy": 0.6527093886770308, + "rewards/chosen": -0.5290841975083458, + "rewards/rejected": -1.4143161330505973, + "rewards/accuracies": 0.76875, + "rewards/margins": 0.8852319360524415, + "logps/chosen": -65.61116208314895, + "logps/rejected": -60.50024994492531, + "epoch": 0.26969555520979205, + "step": 260 + }, + { + "loss": 0.46380929946899413, + "grad_norm": 0.008016095496714115, + "learning_rate": 7.212435233160623e-06, + "entropy": 1.6493263538647442, + "num_tokens": 4264194.0, + "logits/chosen": -0.15574262186655452, + "logits/rejected": -0.00402961174777503, + "mean_token_accuracy": 0.6535617489926517, + "rewards/chosen": -0.39940022186754504, + "rewards/rejected": -1.3337873129447688, + "rewards/accuracies": 0.80625, + "rewards/margins": 0.9343870897591114, + "logps/chosen": -58.40460694432259, + "logps/rejected": -56.3271455013752, + "epoch": 0.28006846117939943, + "step": 270 + }, + { + "loss": 0.46946086883544924, + "grad_norm": 0.010439381934702396, + "learning_rate": 7.108808290155441e-06, + "entropy": 1.6875111198704689, + "num_tokens": 4422991.0, + "logits/chosen": -0.15225440851382163, + "logits/rejected": -0.012922279572286165, + "mean_token_accuracy": 0.6428867661487311, + "rewards/chosen": -0.42678490347389014, + "rewards/rejected": -1.3960492441387031, + "rewards/accuracies": 0.815, + "rewards/margins": 0.9692643392784521, + "logps/chosen": -63.95781509041786, + "logps/rejected": -57.44645619392395, + "epoch": 0.2904413671490068, + "step": 280 + }, + { + "loss": 0.4867039680480957, + "grad_norm": 0.008255927823483944, + "learning_rate": 7.005181347150259e-06, + "entropy": 1.6560454944707452, + "num_tokens": 4582080.0, + "logits/chosen": -0.12475022342462339, + "logits/rejected": -0.004146134714328987, + "mean_token_accuracy": 0.6578386729583144, + "rewards/chosen": -0.4762678133821464, + "rewards/rejected": -1.3799970698577817, + "rewards/accuracies": 0.78875, + "rewards/margins": 0.9037292560562491, + "logps/chosen": -62.563043652772905, + "logps/rejected": -58.98709165453911, + "epoch": 0.3008142731186142, + "step": 290 + }, + { + "loss": 0.46946206092834475, + "grad_norm": 0.008176690898835659, + "learning_rate": 6.9015544041450784e-06, + "entropy": 1.636359941866249, + "num_tokens": 4740383.0, + "logits/chosen": -0.14494295129202733, + "logits/rejected": -0.012990473919638954, + "mean_token_accuracy": 0.6567367980629206, + "rewards/chosen": -0.5025469059059469, + "rewards/rejected": -1.4605811326974072, + "rewards/accuracies": 0.80125, + "rewards/margins": 0.9580342254508287, + "logps/chosen": -61.66068306684494, + "logps/rejected": -59.60216732621193, + "epoch": 0.3111871790882216, + "step": 300 + }, + { + "loss": 0.4926762580871582, + "grad_norm": 0.008404894731938839, + "learning_rate": 6.797927461139897e-06, + "entropy": 1.6317085930332542, + "num_tokens": 4901454.0, + "logits/chosen": -0.10420462296034713, + "logits/rejected": -0.0032643015884895763, + "mean_token_accuracy": 0.6517730862647295, + "rewards/chosen": -0.4740483855601633, + "rewards/rejected": -1.467887537285569, + "rewards/accuracies": 0.78625, + "rewards/margins": 0.9938391536381096, + "logps/chosen": -62.19328094601631, + "logps/rejected": -62.36802620172501, + "epoch": 0.32156008505782896, + "step": 310 + }, + { + "loss": 0.4758056640625, + "grad_norm": 0.01086408831179142, + "learning_rate": 6.6943005181347155e-06, + "entropy": 1.6321182049531489, + "num_tokens": 5058889.0, + "logits/chosen": -0.1815479056351674, + "logits/rejected": -0.07081081249938541, + "mean_token_accuracy": 0.6414232835173607, + "rewards/chosen": -0.5062945262032008, + "rewards/rejected": -1.4949601662519854, + "rewards/accuracies": 0.81, + "rewards/margins": 0.9886656388547271, + "logps/chosen": -63.52185977697373, + "logps/rejected": -59.69021632432938, + "epoch": 0.33193299102743634, + "step": 320 + }, + { + "loss": 0.4784576892852783, + "grad_norm": 0.010599741712212563, + "learning_rate": 6.590673575129535e-06, + "entropy": 1.6721400913968683, + "num_tokens": 5216549.0, + "logits/chosen": -0.1229586102306177, + "logits/rejected": -0.033501552710855156, + "mean_token_accuracy": 0.639937344957143, + "rewards/chosen": -0.5294519958324235, + "rewards/rejected": -1.616222132177645, + "rewards/accuracies": 0.78, + "rewards/margins": 1.086770132854581, + "logps/chosen": -63.12015713572502, + "logps/rejected": -62.12025535821915, + "epoch": 0.3423058969970437, + "step": 330 + }, + { + "loss": 0.4864365100860596, + "grad_norm": 0.010677792131900787, + "learning_rate": 6.487046632124353e-06, + "entropy": 1.5796756833419203, + "num_tokens": 5374161.0, + "logits/chosen": -0.17744578636097688, + "logits/rejected": -0.08292268708566802, + "mean_token_accuracy": 0.6436819550767541, + "rewards/chosen": -0.5906799642526311, + "rewards/rejected": -1.6022152152087075, + "rewards/accuracies": 0.78375, + "rewards/margins": 1.0115352519135923, + "logps/chosen": -62.16209160447121, + "logps/rejected": -60.97210006713867, + "epoch": 0.3526788029666511, + "step": 340 + }, + { + "loss": 0.5056374549865723, + "grad_norm": 0.013692691922187805, + "learning_rate": 6.383419689119171e-06, + "entropy": 1.5922023140452801, + "num_tokens": 5533185.0, + "logits/chosen": -0.11285970908028921, + "logits/rejected": -0.018185535407032168, + "mean_token_accuracy": 0.6443661257252097, + "rewards/chosen": -0.580222937125145, + "rewards/rejected": -1.5960858852404636, + "rewards/accuracies": 0.7725, + "rewards/margins": 1.0158629460725934, + "logps/chosen": -64.89270892024041, + "logps/rejected": -62.29878480195999, + "epoch": 0.3630517089362585, + "step": 350 + }, + { + "loss": 0.48989334106445315, + "grad_norm": 0.012253508903086185, + "learning_rate": 6.2797927461139905e-06, + "entropy": 1.5395906928181649, + "num_tokens": 5691159.0, + "logits/chosen": -0.14245793212958643, + "logits/rejected": -0.015230929526604408, + "mean_token_accuracy": 0.6611733642220498, + "rewards/chosen": -0.5437271582013921, + "rewards/rejected": -1.5548808443109738, + "rewards/accuracies": 0.7975, + "rewards/margins": 1.011153682768345, + "logps/chosen": -60.83840570926666, + "logps/rejected": -59.6216096830368, + "epoch": 0.37342461490586587, + "step": 360 + }, + { + "loss": 0.48537001609802244, + "grad_norm": 0.00956793874502182, + "learning_rate": 6.176165803108809e-06, + "entropy": 1.6442958949133755, + "num_tokens": 5850088.0, + "logits/chosen": -0.058320485277038855, + "logits/rejected": 0.06270940886949956, + "mean_token_accuracy": 0.6433443369530142, + "rewards/chosen": -0.5535192088356417, + "rewards/rejected": -1.5760743238392751, + "rewards/accuracies": 0.7975, + "rewards/margins": 1.0225551136396824, + "logps/chosen": -66.1269180560112, + "logps/rejected": -60.73978069186211, + "epoch": 0.38379752087547325, + "step": 370 + }, + { + "eval_loss": 0.5541799664497375, + "eval_runtime": 245.9984, + "eval_samples_per_second": 4.065, + "eval_steps_per_second": 4.065, + "eval_entropy": 1.0474999970644712, + "eval_num_tokens": 5928735.0, + "eval_logits/chosen": -0.23271217653526577, + "eval_logits/rejected": -0.10208672570441625, + "eval_mean_token_accuracy": 0.6993389547616243, + "eval_rewards/chosen": -0.571883928276773, + "eval_rewards/rejected": -1.1227601580685005, + "eval_rewards/accuracies": 0.707, + "eval_rewards/margins": 0.5508762280121445, + "eval_logps/chosen": -55.89182602119446, + "eval_logps/rejected": -63.867473125457764, + "epoch": 0.38898397386027694, + "step": 375 + }, + { + "loss": 0.447767972946167, + "grad_norm": 0.010045935399830341, + "learning_rate": 6.0725388601036275e-06, + "entropy": 1.5958718929998577, + "num_tokens": 6007948.0, + "logits/chosen": -0.010203895356886221, + "logits/rejected": 0.0953480252296025, + "mean_token_accuracy": 0.6510641277581454, + "rewards/chosen": -0.46026305966945075, + "rewards/rejected": -1.566630380146671, + "rewards/accuracies": 0.825, + "rewards/margins": 1.1063673190772534, + "logps/chosen": -61.75375435590744, + "logps/rejected": -58.965001332759854, + "epoch": 0.39417042684508063, + "step": 380 + }, + { + "loss": 0.4722391128540039, + "grad_norm": 0.010498611256480217, + "learning_rate": 5.968911917098445e-06, + "entropy": 1.6217002650536596, + "num_tokens": 6167000.0, + "logits/chosen": -0.010942938609718112, + "logits/rejected": 0.13150225704237622, + "mean_token_accuracy": 0.6487077697180211, + "rewards/chosen": -0.4893380562632228, + "rewards/rejected": -1.546268537521828, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.056930480999872, + "logps/chosen": -63.818650953769684, + "logps/rejected": -61.81397884130478, + "epoch": 0.404543332814688, + "step": 390 + }, + { + "loss": 0.4782541275024414, + "grad_norm": 0.009464209899306297, + "learning_rate": 5.865284974093265e-06, + "entropy": 1.6495763343665748, + "num_tokens": 6325205.0, + "logits/chosen": -0.011458384051150232, + "logits/rejected": 0.09236410504123445, + "mean_token_accuracy": 0.6448470102529973, + "rewards/chosen": -0.51347439962934, + "rewards/rejected": -1.5123917219531722, + "rewards/accuracies": 0.79125, + "rewards/margins": 0.9989173209294677, + "logps/chosen": -63.590197974443434, + "logps/rejected": -61.28543629407883, + "epoch": 0.4149162387842954, + "step": 400 + }, + { + "loss": 0.4769914627075195, + "grad_norm": 0.011201824992895126, + "learning_rate": 5.761658031088083e-06, + "entropy": 1.6099769476987422, + "num_tokens": 6483981.0, + "logits/chosen": -0.008573553675108867, + "logits/rejected": 0.10661449974217808, + "mean_token_accuracy": 0.6476613377220929, + "rewards/chosen": -0.5158215398409811, + "rewards/rejected": -1.5142960718111136, + "rewards/accuracies": 0.795, + "rewards/margins": 0.9984745322261006, + "logps/chosen": -62.939886302948, + "logps/rejected": -60.21168664813042, + "epoch": 0.4252891447539028, + "step": 410 + }, + { + "loss": 0.4447061061859131, + "grad_norm": 0.01015845313668251, + "learning_rate": 5.658031088082902e-06, + "entropy": 1.6073184362612665, + "num_tokens": 6642561.0, + "logits/chosen": 0.007230915169619996, + "logits/rejected": 0.10328242233161539, + "mean_token_accuracy": 0.6508273026905954, + "rewards/chosen": -0.4930744762084214, + "rewards/rejected": -1.6134738429238495, + "rewards/accuracies": 0.82, + "rewards/margins": 1.1203993632458151, + "logps/chosen": -65.08479910731316, + "logps/rejected": -60.65289543390274, + "epoch": 0.4356620507235102, + "step": 420 + }, + { + "loss": 0.44136753082275393, + "grad_norm": 0.008634388446807861, + "learning_rate": 5.554404145077721e-06, + "entropy": 1.62525453383103, + "num_tokens": 6802172.0, + "logits/chosen": 0.09677644223113024, + "logits/rejected": 0.19686068222909975, + "mean_token_accuracy": 0.6414820049889386, + "rewards/chosen": -0.530476398501778, + "rewards/rejected": -1.7060055632909643, + "rewards/accuracies": 0.815, + "rewards/margins": 1.1755291634099558, + "logps/chosen": -63.63275898098946, + "logps/rejected": -61.548430292606355, + "epoch": 0.4460349566931176, + "step": 430 + }, + { + "loss": 0.44923830032348633, + "grad_norm": 0.011443796567618847, + "learning_rate": 5.4507772020725395e-06, + "entropy": 1.6008457892294974, + "num_tokens": 6960698.0, + "logits/chosen": 0.03864486058133284, + "logits/rejected": 0.16183756452396064, + "mean_token_accuracy": 0.6556359087582677, + "rewards/chosen": -0.5446211060311179, + "rewards/rejected": -1.6678383790072986, + "rewards/accuracies": 0.8275, + "rewards/margins": 1.1232172738574446, + "logps/chosen": -61.80046648740768, + "logps/rejected": -60.58844954848289, + "epoch": 0.456407862662725, + "step": 440 + }, + { + "loss": 0.4775514602661133, + "grad_norm": 0.015888305380940437, + "learning_rate": 5.347150259067357e-06, + "entropy": 1.6431135883461685, + "num_tokens": 7120292.0, + "logits/chosen": 0.058064731861634356, + "logits/rejected": 0.2062258352022907, + "mean_token_accuracy": 0.6481080191396177, + "rewards/chosen": -0.5665322134363828, + "rewards/rejected": -1.696948098014691, + "rewards/accuracies": 0.79375, + "rewards/margins": 1.1304158817767165, + "logps/chosen": -62.31974795341492, + "logps/rejected": -62.94689394712448, + "epoch": 0.46678076863233237, + "step": 450 + }, + { + "loss": 0.45407419204711913, + "grad_norm": 0.011245348490774632, + "learning_rate": 5.243523316062177e-06, + "entropy": 1.6142372595332564, + "num_tokens": 7277503.0, + "logits/chosen": 0.027211253980977537, + "logits/rejected": 0.14270901371261632, + "mean_token_accuracy": 0.6483659755066037, + "rewards/chosen": -0.5206575704316492, + "rewards/rejected": -1.627284916813951, + "rewards/accuracies": 0.82875, + "rewards/margins": 1.1066273492295295, + "logps/chosen": -62.51640429496765, + "logps/rejected": -59.92736347913742, + "epoch": 0.47715367460193975, + "step": 460 + }, + { + "loss": 0.4705537796020508, + "grad_norm": 0.017906704917550087, + "learning_rate": 5.139896373056995e-06, + "entropy": 1.6305865264125168, + "num_tokens": 7433576.0, + "logits/chosen": -0.01868226836908457, + "logits/rejected": 0.10559852450806628, + "mean_token_accuracy": 0.6382040186412632, + "rewards/chosen": -0.5739967311238433, + "rewards/rejected": -1.6218135237134994, + "rewards/accuracies": 0.78125, + "rewards/margins": 1.0478167911106722, + "logps/chosen": -61.798225450515744, + "logps/rejected": -59.17569625377655, + "epoch": 0.48752658057154713, + "step": 470 + }, + { + "loss": 0.44884982109069826, + "grad_norm": 0.009567538276314735, + "learning_rate": 5.036269430051814e-06, + "entropy": 1.6556390350870789, + "num_tokens": 7593962.0, + "logits/chosen": 0.02396342091178786, + "logits/rejected": 0.15151965562177133, + "mean_token_accuracy": 0.6423015125840902, + "rewards/chosen": -0.6105934929932119, + "rewards/rejected": -1.7286542325050687, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.1180607356689871, + "logps/chosen": -65.96984986424447, + "logps/rejected": -63.567516083717344, + "epoch": 0.4978994865411545, + "step": 480 + }, + { + "loss": 0.46419124603271483, + "grad_norm": 0.010610009543597698, + "learning_rate": 4.932642487046633e-06, + "entropy": 1.63694656169042, + "num_tokens": 7753841.0, + "logits/chosen": 0.05542139131963341, + "logits/rejected": 0.1531588473091942, + "mean_token_accuracy": 0.6532461035437882, + "rewards/chosen": -0.6174891357401794, + "rewards/rejected": -1.7478586566343437, + "rewards/accuracies": 0.8125, + "rewards/margins": 1.130369521221146, + "logps/chosen": -63.278802993297575, + "logps/rejected": -63.9350430393219, + "epoch": 0.5082723925107618, + "step": 490 + }, + { + "loss": 0.4718832015991211, + "grad_norm": 0.01074894331395626, + "learning_rate": 4.829015544041451e-06, + "entropy": 1.6344914321228863, + "num_tokens": 7911511.0, + "logits/chosen": 0.039370719731205275, + "logits/rejected": 0.16598465687796668, + "mean_token_accuracy": 0.6492240923829377, + "rewards/chosen": -0.5642123090758104, + "rewards/rejected": -1.6763065649938653, + "rewards/accuracies": 0.78625, + "rewards/margins": 1.1120942557882518, + "logps/chosen": -61.73503879547119, + "logps/rejected": -62.51426592111588, + "epoch": 0.5186452984803692, + "step": 500 + }, + { + "eval_loss": 0.5400257706642151, + "eval_runtime": 278.2919, + "eval_samples_per_second": 3.593, + "eval_steps_per_second": 3.593, + "eval_entropy": 1.0458819408267737, + "eval_num_tokens": 7911511.0, + "eval_logits/chosen": -0.1978596412920271, + "eval_logits/rejected": -0.06171821412221096, + "eval_mean_token_accuracy": 0.6972633041292429, + "eval_rewards/chosen": -0.6398490693312487, + "eval_rewards/rejected": -1.2539186353033873, + "eval_rewards/accuracies": 0.727, + "eval_rewards/margins": 0.6140695666372776, + "eval_logps/chosen": -56.57147743225098, + "eval_logps/rejected": -65.17905788230895, + "epoch": 0.5186452984803692, + "step": 500 + }, + { + "loss": 0.4755256175994873, + "grad_norm": 0.011379857547581196, + "learning_rate": 4.72538860103627e-06, + "entropy": 1.6379237968847156, + "num_tokens": 8070081.0, + "logits/chosen": 0.08480375218267698, + "logits/rejected": 0.18248930696878024, + "mean_token_accuracy": 0.6486436153575778, + "rewards/chosen": -0.6162076763511868, + "rewards/rejected": -1.6715471999935108, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.0553395241731778, + "logps/chosen": -64.42356903076171, + "logps/rejected": -59.52313063383102, + "epoch": 0.5290182044499767, + "step": 510 + }, + { + "loss": 0.4912434101104736, + "grad_norm": 0.009543896652758121, + "learning_rate": 4.621761658031089e-06, + "entropy": 1.62886246021837, + "num_tokens": 8226032.0, + "logits/chosen": 0.04373571989101422, + "logits/rejected": 0.1632708972191895, + "mean_token_accuracy": 0.6450024632364512, + "rewards/chosen": -0.5994134752946411, + "rewards/rejected": -1.5973126511012379, + "rewards/accuracies": 0.79, + "rewards/margins": 0.9978991763386875, + "logps/chosen": -61.06594479799271, + "logps/rejected": -59.51982655286789, + "epoch": 0.5393911104195841, + "step": 520 + }, + { + "loss": 0.4588636875152588, + "grad_norm": 0.010315664112567902, + "learning_rate": 4.518134715025907e-06, + "entropy": 1.6835303687490524, + "num_tokens": 8384377.0, + "logits/chosen": 0.06022681958823317, + "logits/rejected": 0.182036032657229, + "mean_token_accuracy": 0.63875184844248, + "rewards/chosen": -0.5799533515534131, + "rewards/rejected": -1.7233658448676579, + "rewards/accuracies": 0.80875, + "rewards/margins": 1.143412495199591, + "logps/chosen": -64.0477586555481, + "logps/rejected": -62.54838394999504, + "epoch": 0.5497640163891915, + "step": 530 + }, + { + "loss": 0.4572054386138916, + "grad_norm": 0.01254233904182911, + "learning_rate": 4.414507772020726e-06, + "entropy": 1.6456316580064594, + "num_tokens": 8543279.0, + "logits/chosen": 0.06499475886537846, + "logits/rejected": 0.19926284731697655, + "mean_token_accuracy": 0.6476211673207581, + "rewards/chosen": -0.6441993828896193, + "rewards/rejected": -1.7510575192118996, + "rewards/accuracies": 0.83, + "rewards/margins": 1.106858134865761, + "logps/chosen": -62.7225538957119, + "logps/rejected": -62.64689356803894, + "epoch": 0.5601369223587989, + "step": 540 + }, + { + "loss": 0.46482481956481936, + "grad_norm": 0.033692456781864166, + "learning_rate": 4.310880829015544e-06, + "entropy": 1.694882277622819, + "num_tokens": 8703115.0, + "logits/chosen": 0.15109038640147246, + "logits/rejected": 0.2297669311708141, + "mean_token_accuracy": 0.6399877128005028, + "rewards/chosen": -0.661507485556067, + "rewards/rejected": -1.8317748800176197, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.170267395619303, + "logps/chosen": -66.47220434308052, + "logps/rejected": -66.16992118120193, + "epoch": 0.5705098283284062, + "step": 550 + }, + { + "loss": 0.46529335975646974, + "grad_norm": 0.012274126522243023, + "learning_rate": 4.207253886010363e-06, + "entropy": 1.6411442287266254, + "num_tokens": 8862439.0, + "logits/chosen": 0.07749967645058822, + "logits/rejected": 0.17964104042378107, + "mean_token_accuracy": 0.6407143748924136, + "rewards/chosen": -0.6461584532729012, + "rewards/rejected": -1.7939777009031967, + "rewards/accuracies": 0.8, + "rewards/margins": 1.1478192471479998, + "logps/chosen": -64.53955813646317, + "logps/rejected": -62.56636171579361, + "epoch": 0.5808827342980136, + "step": 560 + }, + { + "loss": 0.4430724620819092, + "grad_norm": 0.014654034748673439, + "learning_rate": 4.103626943005182e-06, + "entropy": 1.641110150022432, + "num_tokens": 9019532.0, + "logits/chosen": 0.1006488560296452, + "logits/rejected": 0.21211194322628596, + "mean_token_accuracy": 0.6409156301990151, + "rewards/chosen": -0.6455532481150612, + "rewards/rejected": -1.7706630855146797, + "rewards/accuracies": 0.835, + "rewards/margins": 1.1251098392903804, + "logps/chosen": -63.84049278497696, + "logps/rejected": -60.347349853515624, + "epoch": 0.591255640267621, + "step": 570 + }, + { + "loss": 0.46980915069580076, + "grad_norm": 0.015018550679087639, + "learning_rate": 4.000000000000001e-06, + "entropy": 1.6142543618567289, + "num_tokens": 9176151.0, + "logits/chosen": 0.008260599334212472, + "logits/rejected": 0.13603789421792953, + "mean_token_accuracy": 0.6421346751507372, + "rewards/chosen": -0.6516643855780512, + "rewards/rejected": -1.7954043288715185, + "rewards/accuracies": 0.805, + "rewards/margins": 1.14373994121328, + "logps/chosen": -61.326625975370405, + "logps/rejected": -61.17676810503006, + "epoch": 0.6016285462372284, + "step": 580 + }, + { + "loss": 0.5050342559814454, + "grad_norm": 0.018550831824541092, + "learning_rate": 3.896373056994819e-06, + "entropy": 1.6450188556872307, + "num_tokens": 9335435.0, + "logits/chosen": 0.03664537931858989, + "logits/rejected": 0.1512234776259551, + "mean_token_accuracy": 0.6435695023182779, + "rewards/chosen": -0.7144207920093322, + "rewards/rejected": -1.727617413054686, + "rewards/accuracies": 0.77375, + "rewards/margins": 1.013196619511582, + "logps/chosen": -65.46060695648194, + "logps/rejected": -63.5906271135807, + "epoch": 0.6120014522068358, + "step": 590 + }, + { + "loss": 0.4836301326751709, + "grad_norm": 0.016474206000566483, + "learning_rate": 3.7927461139896377e-06, + "entropy": 1.6528891836851836, + "num_tokens": 9491363.0, + "logits/chosen": 0.08386782463631755, + "logits/rejected": 0.20943303131643703, + "mean_token_accuracy": 0.6487930232100189, + "rewards/chosen": -0.6163708032899012, + "rewards/rejected": -1.6733668212150223, + "rewards/accuracies": 0.78375, + "rewards/margins": 1.0569960164930672, + "logps/chosen": -60.280444753170016, + "logps/rejected": -61.18290127515793, + "epoch": 0.6223743581764432, + "step": 600 + }, + { + "loss": 0.4617151260375977, + "grad_norm": 0.010820780880749226, + "learning_rate": 3.6891191709844567e-06, + "entropy": 1.6939242084044963, + "num_tokens": 9648643.0, + "logits/chosen": 0.09977307296605359, + "logits/rejected": 0.20379420233565199, + "mean_token_accuracy": 0.6439293037727475, + "rewards/chosen": -0.6212675093274447, + "rewards/rejected": -1.7044480502128136, + "rewards/accuracies": 0.82, + "rewards/margins": 1.0831805411481765, + "logps/chosen": -60.97681099057198, + "logps/rejected": -62.301487598419186, + "epoch": 0.6327472641460505, + "step": 610 + }, + { + "loss": 0.45804176330566404, + "grad_norm": 0.012919292785227299, + "learning_rate": 3.5854922279792748e-06, + "entropy": 1.619003531029448, + "num_tokens": 9806029.0, + "logits/chosen": 0.0483610800015232, + "logits/rejected": 0.1797610236274009, + "mean_token_accuracy": 0.6475096028484404, + "rewards/chosen": -0.5888219272701827, + "rewards/rejected": -1.706802941111964, + "rewards/accuracies": 0.8075, + "rewards/margins": 1.1179810122167693, + "logps/chosen": -59.50200087547302, + "logps/rejected": -61.049637752771375, + "epoch": 0.6431201701156579, + "step": 620 + }, + { + "eval_loss": 0.5324422717094421, + "eval_runtime": 288.7421, + "eval_samples_per_second": 3.463, + "eval_steps_per_second": 3.463, + "eval_entropy": 1.0448875862136484, + "eval_num_tokens": 9884893.0, + "eval_logits/chosen": -0.19975289350595532, + "eval_logits/rejected": -0.060755203565891945, + "eval_mean_token_accuracy": 0.6964090894907713, + "eval_rewards/chosen": -0.6912122842722456, + "eval_rewards/rejected": -1.345464039585553, + "eval_rewards/accuracies": 0.736, + "eval_rewards/margins": 0.6542517534568906, + "eval_logps/chosen": -57.08510956954956, + "eval_logps/rejected": -66.09451188468933, + "epoch": 0.6483066231004616, + "step": 625 + }, + { + "loss": 0.45544919967651365, + "grad_norm": 0.010571232065558434, + "learning_rate": 3.4818652849740937e-06, + "entropy": 1.6706199841760099, + "num_tokens": 9965103.0, + "logits/chosen": 0.1180553175480971, + "logits/rejected": 0.21143161932841895, + "mean_token_accuracy": 0.6404067935794592, + "rewards/chosen": -0.6081898983999418, + "rewards/rejected": -1.7734553063547356, + "rewards/accuracies": 0.81, + "rewards/margins": 1.1652654066774994, + "logps/chosen": -62.56314527273178, + "logps/rejected": -63.61036643981934, + "epoch": 0.6534930760852653, + "step": 630 + }, + { + "loss": 0.44363651275634763, + "grad_norm": 0.011373443529009819, + "learning_rate": 3.3782383419689123e-06, + "entropy": 1.661266395803541, + "num_tokens": 10122828.0, + "logits/chosen": 0.13310990911343398, + "logits/rejected": 0.2430608346820568, + "mean_token_accuracy": 0.6414054480008781, + "rewards/chosen": -0.645503295796052, + "rewards/rejected": -1.7806003371396217, + "rewards/accuracies": 0.81, + "rewards/margins": 1.1350970419961959, + "logps/chosen": -61.5342090690136, + "logps/rejected": -63.98482904434204, + "epoch": 0.6638659820548727, + "step": 640 + }, + { + "loss": 0.4796154499053955, + "grad_norm": 0.012532204389572144, + "learning_rate": 3.274611398963731e-06, + "entropy": 1.6701466926187276, + "num_tokens": 10279859.0, + "logits/chosen": 0.07329429847103937, + "logits/rejected": 0.1878599203293891, + "mean_token_accuracy": 0.6414687449485064, + "rewards/chosen": -0.661306283445374, + "rewards/rejected": -1.7610867334110663, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.099780449680984, + "logps/chosen": -62.595525816679, + "logps/rejected": -61.356811988353726, + "epoch": 0.6742388880244801, + "step": 650 + }, + { + "loss": 0.4748543739318848, + "grad_norm": 0.01547182071954012, + "learning_rate": 3.1709844559585493e-06, + "entropy": 1.6658864275645464, + "num_tokens": 10436075.0, + "logits/chosen": 0.10011936781303017, + "logits/rejected": 0.2041365355242361, + "mean_token_accuracy": 0.6389276959933341, + "rewards/chosen": -0.6364252381109691, + "rewards/rejected": -1.735760998390615, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.099335762821138, + "logps/chosen": -61.83362093210221, + "logps/rejected": -61.003912779092786, + "epoch": 0.6846117939940874, + "step": 660 + }, + { + "loss": 0.4296245098114014, + "grad_norm": 0.011170756071805954, + "learning_rate": 3.0673575129533683e-06, + "entropy": 1.6508124286774546, + "num_tokens": 10594936.0, + "logits/chosen": 0.10534840408886, + "logits/rejected": 0.20408601168915652, + "mean_token_accuracy": 0.6367748867347837, + "rewards/chosen": -0.6433876353609412, + "rewards/rejected": -1.8510402401175816, + "rewards/accuracies": 0.8175, + "rewards/margins": 1.2076526060514152, + "logps/chosen": -64.62543644189834, + "logps/rejected": -62.8101417517662, + "epoch": 0.6949846999636948, + "step": 670 + }, + { + "loss": 0.4698948383331299, + "grad_norm": 0.019366616383194923, + "learning_rate": 2.963730569948187e-06, + "entropy": 1.6687841359246522, + "num_tokens": 10754603.0, + "logits/chosen": 0.13530835426877952, + "logits/rejected": 0.25161180215337653, + "mean_token_accuracy": 0.6364573692902923, + "rewards/chosen": -0.6632168094060035, + "rewards/rejected": -1.8288732153433376, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.165656405221671, + "logps/chosen": -65.38578713893891, + "logps/rejected": -64.20987098813058, + "epoch": 0.7053576059333022, + "step": 680 + }, + { + "loss": 0.5016210079193115, + "grad_norm": 0.022646328434348106, + "learning_rate": 2.8601036269430053e-06, + "entropy": 1.711660223044455, + "num_tokens": 10913690.0, + "logits/chosen": 0.16971737857777713, + "logits/rejected": 0.2760859463634132, + "mean_token_accuracy": 0.6390431644208729, + "rewards/chosen": -0.6508824050683597, + "rewards/rejected": -1.6932820503300172, + "rewards/accuracies": 0.79375, + "rewards/margins": 1.0423996420949697, + "logps/chosen": -66.28588567495346, + "logps/rejected": -62.060355219841, + "epoch": 0.7157305119029096, + "step": 690 + }, + { + "loss": 0.43436241149902344, + "grad_norm": 0.009509176947176456, + "learning_rate": 2.7564766839378243e-06, + "entropy": 1.6765110883302987, + "num_tokens": 11071134.0, + "logits/chosen": 0.12124103042581971, + "logits/rejected": 0.2600804952933655, + "mean_token_accuracy": 0.6427443787083029, + "rewards/chosen": -0.5906095821626696, + "rewards/rejected": -1.720989261372597, + "rewards/accuracies": 0.835, + "rewards/margins": 1.130379677421879, + "logps/chosen": -63.95436416387558, + "logps/rejected": -59.14868986845016, + "epoch": 0.726103417872517, + "step": 700 + }, + { + "loss": 0.4556713581085205, + "grad_norm": 0.01146204024553299, + "learning_rate": 2.6528497409326424e-06, + "entropy": 1.6694943796936423, + "num_tokens": 11230405.0, + "logits/chosen": 0.07533675440714994, + "logits/rejected": 0.19347860103992787, + "mean_token_accuracy": 0.6436189501732588, + "rewards/chosen": -0.5904611392628294, + "rewards/rejected": -1.7462449892124277, + "rewards/accuracies": 0.8025, + "rewards/margins": 1.155783847218845, + "logps/chosen": -66.84839742302894, + "logps/rejected": -61.99807296037674, + "epoch": 0.7364763238421244, + "step": 710 + }, + { + "loss": 0.4577175140380859, + "grad_norm": 0.012849503196775913, + "learning_rate": 2.5492227979274614e-06, + "entropy": 1.6657723085489125, + "num_tokens": 11386296.0, + "logits/chosen": 0.05922319803504693, + "logits/rejected": 0.17808647771296027, + "mean_token_accuracy": 0.6431331102643162, + "rewards/chosen": -0.5677624635772373, + "rewards/rejected": -1.6767527183049242, + "rewards/accuracies": 0.8225, + "rewards/margins": 1.1089902543462813, + "logps/chosen": -61.68554986834526, + "logps/rejected": -58.83755177259445, + "epoch": 0.7468492298117317, + "step": 720 + }, + { + "loss": 0.4547234535217285, + "grad_norm": 0.014395375736057758, + "learning_rate": 2.44559585492228e-06, + "entropy": 1.6862239858694374, + "num_tokens": 11546081.0, + "logits/chosen": 0.1350684718563505, + "logits/rejected": 0.2427451158459563, + "mean_token_accuracy": 0.64147017583251, + "rewards/chosen": -0.5967396693397313, + "rewards/rejected": -1.765362592941492, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.1686229225434364, + "logps/chosen": -63.325855791568756, + "logps/rejected": -65.51477008223533, + "epoch": 0.7572221357813391, + "step": 730 + }, + { + "loss": 0.4426294803619385, + "grad_norm": 0.012110771611332893, + "learning_rate": 2.3419689119170984e-06, + "entropy": 1.707785174669698, + "num_tokens": 11703833.0, + "logits/chosen": 0.0927098814711561, + "logits/rejected": 0.23603759404490104, + "mean_token_accuracy": 0.6414807749167085, + "rewards/chosen": -0.5864860777647118, + "rewards/rejected": -1.7438211480446626, + "rewards/accuracies": 0.83125, + "rewards/margins": 1.1573350698873401, + "logps/chosen": -63.334676113128666, + "logps/rejected": -63.40963178634644, + "epoch": 0.7675950417509465, + "step": 740 + }, + { + "loss": 0.46600141525268557, + "grad_norm": 0.013532786630094051, + "learning_rate": 2.2383419689119174e-06, + "entropy": 1.6768190996162593, + "num_tokens": 11865175.0, + "logits/chosen": 0.1273617797525129, + "logits/rejected": 0.22872866333573835, + "mean_token_accuracy": 0.642769878860563, + "rewards/chosen": -0.6710381170455002, + "rewards/rejected": -1.8427071001776494, + "rewards/accuracies": 0.805, + "rewards/margins": 1.1716689813882113, + "logps/chosen": -66.42985866189002, + "logps/rejected": -66.3072749710083, + "epoch": 0.7779679477205539, + "step": 750 + }, + { + "eval_loss": 0.5291131734848022, + "eval_runtime": 316.7312, + "eval_samples_per_second": 3.157, + "eval_steps_per_second": 3.157, + "eval_entropy": 1.0425387567952276, + "eval_num_tokens": 11865175.0, + "eval_logits/chosen": -0.19368413704948595, + "eval_logits/rejected": -0.05676454023564469, + "eval_mean_token_accuracy": 0.6966218997985124, + "eval_rewards/chosen": -0.6922309857774526, + "eval_rewards/rejected": -1.3544460057471879, + "eval_rewards/accuracies": 0.747, + "eval_rewards/margins": 0.6622150189429522, + "eval_logps/chosen": -57.09529658699036, + "eval_logps/rejected": -66.18433157348633, + "epoch": 0.7779679477205539, + "step": 750 + }, + { + "loss": 0.43166389465332033, + "grad_norm": 0.012500453740358353, + "learning_rate": 2.134715025906736e-06, + "entropy": 1.6828834046982228, + "num_tokens": 12024093.0, + "logits/chosen": 0.09826941010263189, + "logits/rejected": 0.215735024556398, + "mean_token_accuracy": 0.6342808033898473, + "rewards/chosen": -0.6309049091633642, + "rewards/rejected": -1.7712371364238242, + "rewards/accuracies": 0.815, + "rewards/margins": 1.1403322232328355, + "logps/chosen": -64.024556722641, + "logps/rejected": -62.57202324867249, + "epoch": 0.7883408536901613, + "step": 760 + }, + { + "loss": 0.4471421718597412, + "grad_norm": 0.014410309493541718, + "learning_rate": 2.0310880829015544e-06, + "entropy": 1.6857702764961868, + "num_tokens": 12185744.0, + "logits/chosen": 0.14331582088471329, + "logits/rejected": 0.2682991323037694, + "mean_token_accuracy": 0.6441437931358814, + "rewards/chosen": -0.6643577039731394, + "rewards/rejected": -1.8807749817200239, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.216417273581028, + "logps/chosen": -67.24417539000511, + "logps/rejected": -66.79223707199097, + "epoch": 0.7987137596597687, + "step": 770 + }, + { + "loss": 0.4785769939422607, + "grad_norm": 0.010570192709565163, + "learning_rate": 1.9274611398963734e-06, + "entropy": 1.6633455219957978, + "num_tokens": 12343401.0, + "logits/chosen": 0.07438493724116783, + "logits/rejected": 0.23364041511381434, + "mean_token_accuracy": 0.639512750543654, + "rewards/chosen": -0.6736341681498743, + "rewards/rejected": -1.796194753185846, + "rewards/accuracies": 0.79, + "rewards/margins": 1.1225605825753882, + "logps/chosen": -62.37282539129257, + "logps/rejected": -63.56037598967552, + "epoch": 0.809086665629376, + "step": 780 + }, + { + "loss": 0.45286383628845217, + "grad_norm": 0.011962756514549255, + "learning_rate": 1.823834196891192e-06, + "entropy": 1.6700926853902638, + "num_tokens": 12502157.0, + "logits/chosen": 0.1286325604504252, + "logits/rejected": 0.2370263101476654, + "mean_token_accuracy": 0.6403315839730204, + "rewards/chosen": -0.6551112483125325, + "rewards/rejected": -1.8369905388413463, + "rewards/accuracies": 0.81625, + "rewards/margins": 1.1818792873900383, + "logps/chosen": -63.591456497907636, + "logps/rejected": -63.02011847734451, + "epoch": 0.8194595715989834, + "step": 790 + }, + { + "loss": 0.4665197849273682, + "grad_norm": 0.015845410525798798, + "learning_rate": 1.7202072538860104e-06, + "entropy": 1.7264064208138734, + "num_tokens": 12659952.0, + "logits/chosen": 0.12747972368676874, + "logits/rejected": 0.2234084493421016, + "mean_token_accuracy": 0.6323709175549448, + "rewards/chosen": -0.670276442007671, + "rewards/rejected": -1.800412250665977, + "rewards/accuracies": 0.81375, + "rewards/margins": 1.1301358060259372, + "logps/chosen": -65.14966633319855, + "logps/rejected": -62.890252923965456, + "epoch": 0.8298324775685908, + "step": 800 + }, + { + "loss": 0.46672878265380857, + "grad_norm": 0.011275322176516056, + "learning_rate": 1.6165803108808292e-06, + "entropy": 1.688749819751829, + "num_tokens": 12818219.0, + "logits/chosen": 0.08963352847012644, + "logits/rejected": 0.1937745526364166, + "mean_token_accuracy": 0.6342837125249207, + "rewards/chosen": -0.6473926620587008, + "rewards/rejected": -1.7900561995629687, + "rewards/accuracies": 0.7925, + "rewards/margins": 1.142663535233587, + "logps/chosen": -63.99472352027893, + "logps/rejected": -63.061451687812806, + "epoch": 0.8402053835381982, + "step": 810 + }, + { + "loss": 0.4595985412597656, + "grad_norm": 0.009922225028276443, + "learning_rate": 1.5129533678756477e-06, + "entropy": 1.6839555408246816, + "num_tokens": 12975834.0, + "logits/chosen": 0.14187639603561716, + "logits/rejected": 0.2228106795045077, + "mean_token_accuracy": 0.6386101646535098, + "rewards/chosen": -0.6652093456028524, + "rewards/rejected": -1.8065621317276963, + "rewards/accuracies": 0.8, + "rewards/margins": 1.1413527865428477, + "logps/chosen": -65.14974474191666, + "logps/rejected": -61.74604295730591, + "epoch": 0.8505782895078056, + "step": 820 + }, + { + "loss": 0.4635880470275879, + "grad_norm": 0.015552631579339504, + "learning_rate": 1.4093264248704663e-06, + "entropy": 1.684992496855557, + "num_tokens": 13133432.0, + "logits/chosen": 0.09258615948240319, + "logits/rejected": 0.23631826346334864, + "mean_token_accuracy": 0.6466719186119735, + "rewards/chosen": -0.6487690168057452, + "rewards/rejected": -1.7847515585264773, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.1359825418051333, + "logps/chosen": -61.15254833102226, + "logps/rejected": -62.26296893358231, + "epoch": 0.860951195477413, + "step": 830 + }, + { + "loss": 0.44598889350891113, + "grad_norm": 0.015216046944260597, + "learning_rate": 1.3056994818652852e-06, + "entropy": 1.709428556431085, + "num_tokens": 13291850.0, + "logits/chosen": 0.15097671106129862, + "logits/rejected": 0.25655990051725586, + "mean_token_accuracy": 0.6395855396427215, + "rewards/chosen": -0.5992260871930921, + "rewards/rejected": -1.8031220447564555, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.2038959555141628, + "logps/chosen": -65.10634205937386, + "logps/rejected": -63.04532386302948, + "epoch": 0.8713241014470204, + "step": 840 + }, + { + "loss": 0.46810121536254884, + "grad_norm": 0.009856506250798702, + "learning_rate": 1.2020725388601037e-06, + "entropy": 1.70108500065282, + "num_tokens": 13450070.0, + "logits/chosen": 0.15703350726422605, + "logits/rejected": 0.2533505205489093, + "mean_token_accuracy": 0.643168338034302, + "rewards/chosen": -0.62836980179698, + "rewards/rejected": -1.7627987958928224, + "rewards/accuracies": 0.80125, + "rewards/margins": 1.1344289934798144, + "logps/chosen": -64.12525810718536, + "logps/rejected": -62.792922837734224, + "epoch": 0.8816970074166278, + "step": 850 + }, + { + "loss": 0.44599761962890627, + "grad_norm": 0.012146789580583572, + "learning_rate": 1.0984455958549225e-06, + "entropy": 1.70398797435686, + "num_tokens": 13610138.0, + "logits/chosen": 0.17104202048628422, + "logits/rejected": 0.262595645620993, + "mean_token_accuracy": 0.642651722766459, + "rewards/chosen": -0.6636459323119197, + "rewards/rejected": -1.85319078174929, + "rewards/accuracies": 0.8125, + "rewards/margins": 1.1895448501838837, + "logps/chosen": -67.19200572252274, + "logps/rejected": -64.02687373161316, + "epoch": 0.8920699133862352, + "step": 860 + }, + { + "loss": 0.4463825702667236, + "grad_norm": 0.013926991261541843, + "learning_rate": 9.94818652849741e-07, + "entropy": 1.6875281669571995, + "num_tokens": 13769613.0, + "logits/chosen": 0.1617350362536588, + "logits/rejected": 0.25974264117481755, + "mean_token_accuracy": 0.6424587191455067, + "rewards/chosen": -0.6411357878561103, + "rewards/rejected": -1.7520794819842558, + "rewards/accuracies": 0.8275, + "rewards/margins": 1.1109436923218892, + "logps/chosen": -66.13908497691155, + "logps/rejected": -62.40538552284241, + "epoch": 0.9024428193558426, + "step": 870 + }, + { + "eval_loss": 0.5264487266540527, + "eval_runtime": 346.8502, + "eval_samples_per_second": 2.883, + "eval_steps_per_second": 2.883, + "eval_entropy": 1.0440044164210558, + "eval_num_tokens": 13848578.0, + "eval_logits/chosen": -0.18929922542314412, + "eval_logits/rejected": -0.05010199907599402, + "eval_mean_token_accuracy": 0.6949034848362208, + "eval_rewards/chosen": -0.7382756498559029, + "eval_rewards/rejected": -1.426999929712445, + "eval_rewards/accuracies": 0.743, + "eval_rewards/margins": 0.6887242792025209, + "eval_logps/chosen": -57.555743215560916, + "eval_logps/rejected": -66.9098708076477, + "epoch": 0.9076292723406463, + "step": 875 + }, + { + "loss": 0.43689889907836915, + "grad_norm": 0.010173802264034748, + "learning_rate": 8.911917098445596e-07, + "entropy": 1.6774525323137641, + "num_tokens": 13928284.0, + "logits/chosen": 0.15889503262817226, + "logits/rejected": 0.27439704581314006, + "mean_token_accuracy": 0.6466628183331341, + "rewards/chosen": -0.6104124534751736, + "rewards/rejected": -1.7897700341788003, + "rewards/accuracies": 0.81625, + "rewards/margins": 1.1793575775902718, + "logps/chosen": -62.02614854454994, + "logps/rejected": -64.84975938558578, + "epoch": 0.91281572532545, + "step": 880 + }, + { + "loss": 0.48273696899414065, + "grad_norm": 0.017326118424534798, + "learning_rate": 7.875647668393784e-07, + "entropy": 1.6614145183190703, + "num_tokens": 14086112.0, + "logits/chosen": 0.07985394351840137, + "logits/rejected": 0.20892557638470582, + "mean_token_accuracy": 0.6420493371598422, + "rewards/chosen": -0.7163908848223582, + "rewards/rejected": -1.8062069240648997, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.0898160382080824, + "logps/chosen": -63.230327110290524, + "logps/rejected": -64.38345015048981, + "epoch": 0.9231886312950573, + "step": 890 + }, + { + "loss": 0.43041396141052246, + "grad_norm": 0.017108725383877754, + "learning_rate": 6.839378238341969e-07, + "entropy": 1.6680658238008619, + "num_tokens": 14245558.0, + "logits/chosen": 0.14648505909070886, + "logits/rejected": 0.26673792896430265, + "mean_token_accuracy": 0.6451807205565274, + "rewards/chosen": -0.6325454073216497, + "rewards/rejected": -1.9007032794272527, + "rewards/accuracies": 0.82125, + "rewards/margins": 1.2681578750582412, + "logps/chosen": -62.82921484231949, + "logps/rejected": -66.73553317070008, + "epoch": 0.9335615372646647, + "step": 900 + }, + { + "loss": 0.4457756519317627, + "grad_norm": 0.010929541662335396, + "learning_rate": 5.803108808290156e-07, + "entropy": 1.7130034917313606, + "num_tokens": 14404540.0, + "logits/chosen": 0.12710906584716752, + "logits/rejected": 0.2675685432938819, + "mean_token_accuracy": 0.6400158200226724, + "rewards/chosen": -0.6709339278266998, + "rewards/rejected": -1.8822100719693118, + "rewards/accuracies": 0.825, + "rewards/margins": 1.2112761446926743, + "logps/chosen": -64.97942503213882, + "logps/rejected": -64.39793292522431, + "epoch": 0.9439344432342721, + "step": 910 + }, + { + "loss": 0.45868711471557616, + "grad_norm": 0.012205246835947037, + "learning_rate": 4.7668393782383424e-07, + "entropy": 1.6709410886280238, + "num_tokens": 14560645.0, + "logits/chosen": 0.10928400241500846, + "logits/rejected": 0.2426133711223395, + "mean_token_accuracy": 0.6370881532691419, + "rewards/chosen": -0.6589926348004519, + "rewards/rejected": -1.8069635758572258, + "rewards/accuracies": 0.81375, + "rewards/margins": 1.14797093979083, + "logps/chosen": -61.491244453191754, + "logps/rejected": -61.11656880378723, + "epoch": 0.9543073492038795, + "step": 920 + }, + { + "loss": 0.4510962963104248, + "grad_norm": 0.016680743545293808, + "learning_rate": 3.730569948186528e-07, + "entropy": 1.7099607919715345, + "num_tokens": 14720454.0, + "logits/chosen": 0.11883571728281689, + "logits/rejected": 0.20641075253811259, + "mean_token_accuracy": 0.6349475438706577, + "rewards/chosen": -0.6969622136335238, + "rewards/rejected": -1.859341476371046, + "rewards/accuracies": 0.81, + "rewards/margins": 1.162379261488095, + "logps/chosen": -65.8184747338295, + "logps/rejected": -65.03840645551682, + "epoch": 0.9646802551734869, + "step": 930 + }, + { + "loss": 0.44940953254699706, + "grad_norm": 0.013420112431049347, + "learning_rate": 2.694300518134715e-07, + "entropy": 1.6909510315582157, + "num_tokens": 14879971.0, + "logits/chosen": 0.18477739616368072, + "logits/rejected": 0.2645026210979778, + "mean_token_accuracy": 0.6382351936399937, + "rewards/chosen": -0.6513557667902206, + "rewards/rejected": -1.7696480820770375, + "rewards/accuracies": 0.815, + "rewards/margins": 1.1182923125289381, + "logps/chosen": -65.54289688110352, + "logps/rejected": -62.99382516860962, + "epoch": 0.9750531611430943, + "step": 940 + }, + { + "loss": 0.47352304458618166, + "grad_norm": 0.013681693933904171, + "learning_rate": 1.6580310880829015e-07, + "entropy": 1.661503377771005, + "num_tokens": 15038091.0, + "logits/chosen": 0.11480745743066594, + "logits/rejected": 0.22102661224680678, + "mean_token_accuracy": 0.6446126988902688, + "rewards/chosen": -0.7158770331276173, + "rewards/rejected": -1.8211175910846213, + "rewards/accuracies": 0.78875, + "rewards/margins": 1.1052405576594173, + "logps/chosen": -63.61789976716042, + "logps/rejected": -62.64833914756775, + "epoch": 0.9854260671127016, + "step": 950 + }, + { + "loss": 0.46666803359985354, + "grad_norm": 0.014694225043058395, + "learning_rate": 6.217616580310881e-08, + "entropy": 1.6944513383321465, + "num_tokens": 15198513.0, + "logits/chosen": 0.1733613867125754, + "logits/rejected": 0.27222349129564544, + "mean_token_accuracy": 0.6361824345402419, + "rewards/chosen": -0.7022936144633786, + "rewards/rejected": -1.8512264592042629, + "rewards/accuracies": 0.7925, + "rewards/margins": 1.148932844074443, + "logps/chosen": -66.14034503817558, + "logps/rejected": -63.98270012617111, + "epoch": 0.995798973082309, + "step": 960 + }, + { + "train_runtime": 22398.3946, + "train_samples_per_second": 3.443, + "train_steps_per_second": 0.043, + "total_flos": 1.3308435135621734e+17, + "train_loss": 0.48160764293967134, + "entropy": 1.7446463192686623, + "num_tokens": 15263900.0, + "logits/chosen": 0.2563561171205477, + "logits/rejected": 0.3359260186024246, + "mean_token_accuracy": 0.6413786758059337, + "rewards/chosen": -0.7268365635874359, + "rewards/rejected": -1.856159317700974, + "rewards/accuracies": 0.8209876543209876, + "rewards/margins": 1.1293227543801436, + "logps/chosen": -67.83627563052707, + "logps/rejected": -68.1628461767126, + "epoch": 1.0, + "step": 965 + } + ], + "validation_monitor_size": 1000, + "validation_monitor_selection": "fixed_seed_random_without_replacement", + "validation_monitor_seed": 22, + "validation_monitor_indices": [ + 2, + 10, + 14, + 21, + 55, + 63, + 66, + 69, + 107, + 110, + 142, + 144, + 149, + 150, + 151, + 152, + 160, + 163, + 166, + 167, + 176, + 181, + 206, + 207, + 259, + 267, + 281, + 295, + 298, + 306, + 307, + 317, + 321, + 331, + 336, + 341, + 346, + 349, + 351, + 352, + 357, + 358, + 369, + 370, + 382, + 386, + 391, + 401, + 411, + 412, + 432, + 437, + 452, + 462, + 465, + 488, + 490, + 491, + 492, + 494, + 503, + 504, + 508, + 528, + 538, + 540, + 551, + 553, + 567, + 586, + 605, + 606, + 625, + 627, + 661, + 663, + 666, + 677, + 685, + 690, + 692, + 704, + 708, + 714, + 715, + 727, + 728, + 733, + 745, + 752, + 753, + 755, + 764, + 773, + 779, + 783, + 793, + 796, + 799, + 803, + 804, + 805, + 813, + 816, + 818, + 823, + 827, + 829, + 830, + 837, + 842, + 845, + 850, + 853, + 856, + 889, + 890, + 905, + 915, + 924, + 930, + 939, + 951, + 988, + 1002, + 1005, + 1023, + 1029, + 1038, + 1049, + 1050, + 1054, + 1056, + 1067, + 1068, + 1079, + 1088, + 1091, + 1103, + 1114, + 1118, + 1133, + 1140, + 1144, + 1145, + 1155, + 1186, + 1195, + 1206, + 1223, + 1251, + 1252, + 1257, + 1259, + 1270, + 1271, + 1295, + 1303, + 1304, + 1305, + 1329, + 1335, + 1336, + 1343, + 1367, + 1373, + 1377, + 1403, + 1412, + 1429, + 1443, + 1457, + 1459, + 1460, + 1476, + 1483, + 1486, + 1494, + 1507, + 1510, + 1519, + 1521, + 1522, + 1545, + 1551, + 1570, + 1582, + 1593, + 1595, + 1603, + 1607, + 1614, + 1615, + 1625, + 1634, + 1639, + 1648, + 1654, + 1657, + 1662, + 1667, + 1673, + 1690, + 1704, + 1746, + 1756, + 1781, + 1783, + 1796, + 1799, + 1809, + 1814, + 1827, + 1829, + 1832, + 1844, + 1847, + 1854, + 1856, + 1857, + 1858, + 1874, + 1883, + 1889, + 1924, + 1925, + 1931, + 1932, + 1934, + 1935, + 1938, + 1950, + 1957, + 1962, + 1967, + 1975, + 1982, + 1983, + 1991, + 1998, + 2003, + 2008, + 2017, + 2021, + 2026, + 2035, + 2040, + 2050, + 2056, + 2077, + 2079, + 2082, + 2098, + 2100, + 2108, + 2121, + 2130, + 2133, + 2134, + 2138, + 2143, + 2166, + 2167, + 2180, + 2181, + 2185, + 2204, + 2205, + 2212, + 2221, + 2224, + 2226, + 2230, + 2233, + 2256, + 2261, + 2263, + 2269, + 2273, + 2290, + 2291, + 2299, + 2301, + 2321, + 2323, + 2330, + 2384, + 2401, + 2417, + 2420, + 2421, + 2424, + 2430, + 2435, + 2456, + 2488, + 2502, + 2504, + 2519, + 2527, + 2532, + 2538, + 2542, + 2553, + 2555, + 2558, + 2559, + 2562, + 2578, + 2583, + 2585, + 2590, + 2592, + 2594, + 2596, + 2600, + 2606, + 2607, + 2618, + 2630, + 2637, + 2647, + 2650, + 2657, + 2679, + 2685, + 2705, + 2706, + 2712, + 2713, + 2714, + 2727, + 2740, + 2742, + 2755, + 2780, + 2784, + 2792, + 2807, + 2808, + 2810, + 2820, + 2831, + 2839, + 2860, + 2862, + 2863, + 2866, + 2875, + 2878, + 2898, + 2905, + 2921, + 2922, + 2926, + 2930, + 2934, + 2944, + 2955, + 2957, + 2959, + 2973, + 2978, + 2998, + 3018, + 3022, + 3028, + 3031, + 3061, + 3085, + 3090, + 3104, + 3105, + 3111, + 3115, + 3121, + 3122, + 3129, + 3133, + 3135, + 3161, + 3162, + 3169, + 3173, + 3194, + 3195, + 3215, + 3225, + 3226, + 3241, + 3247, + 3250, + 3253, + 3265, + 3268, + 3293, + 3301, + 3312, + 3329, + 3352, + 3361, + 3362, + 3376, + 3396, + 3401, + 3403, + 3410, + 3419, + 3432, + 3443, + 3452, + 3467, + 3469, + 3475, + 3485, + 3503, + 3514, + 3515, + 3524, + 3528, + 3538, + 3544, + 3557, + 3560, + 3565, + 3600, + 3637, + 3642, + 3658, + 3659, + 3692, + 3693, + 3699, + 3722, + 3725, + 3728, + 3731, + 3740, + 3742, + 3762, + 3766, + 3780, + 3788, + 3794, + 3796, + 3798, + 3805, + 3817, + 3819, + 3822, + 3837, + 3839, + 3843, + 3846, + 3851, + 3854, + 3865, + 3870, + 3871, + 3884, + 3894, + 3895, + 3896, + 3907, + 3911, + 3915, + 3919, + 3920, + 3923, + 3933, + 3955, + 3967, + 3972, + 3974, + 3975, + 3984, + 3985, + 3997, + 4002, + 4010, + 4034, + 4044, + 4063, + 4073, + 4079, + 4082, + 4088, + 4121, + 4145, + 4148, + 4159, + 4161, + 4164, + 4177, + 4188, + 4199, + 4203, + 4207, + 4208, + 4213, + 4221, + 4225, + 4233, + 4241, + 4243, + 4247, + 4264, + 4274, + 4282, + 4286, + 4290, + 4308, + 4310, + 4313, + 4321, + 4324, + 4327, + 4349, + 4362, + 4370, + 4374, + 4380, + 4407, + 4409, + 4411, + 4415, + 4417, + 4418, + 4427, + 4431, + 4433, + 4451, + 4466, + 4477, + 4478, + 4479, + 4493, + 4494, + 4514, + 4527, + 4539, + 4550, + 4558, + 4568, + 4579, + 4583, + 4584, + 4586, + 4587, + 4590, + 4599, + 4602, + 4610, + 4626, + 4627, + 4630, + 4641, + 4647, + 4655, + 4656, + 4657, + 4661, + 4685, + 4714, + 4715, + 4731, + 4749, + 4752, + 4769, + 4777, + 4782, + 4791, + 4805, + 4818, + 4829, + 4833, + 4837, + 4839, + 4843, + 4871, + 4875, + 4879, + 4880, + 4885, + 4888, + 4895, + 4900, + 4923, + 4966, + 4968, + 4972, + 4989, + 4994, + 4998, + 5001, + 5013, + 5019, + 5026, + 5032, + 5034, + 5046, + 5055, + 5085, + 5086, + 5088, + 5089, + 5090, + 5095, + 5108, + 5110, + 5119, + 5120, + 5121, + 5133, + 5148, + 5154, + 5160, + 5169, + 5178, + 5222, + 5223, + 5232, + 5233, + 5240, + 5256, + 5259, + 5264, + 5271, + 5276, + 5279, + 5294, + 5300, + 5303, + 5321, + 5335, + 5337, + 5345, + 5348, + 5365, + 5373, + 5378, + 5384, + 5422, + 5442, + 5443, + 5445, + 5477, + 5485, + 5495, + 5497, + 5504, + 5526, + 5533, + 5542, + 5564, + 5570, + 5579, + 5587, + 5592, + 5608, + 5610, + 5624, + 5630, + 5638, + 5651, + 5663, + 5670, + 5675, + 5691, + 5700, + 5706, + 5707, + 5715, + 5720, + 5721, + 5722, + 5732, + 5738, + 5741, + 5769, + 5771, + 5775, + 5795, + 5796, + 5800, + 5809, + 5810, + 5815, + 5819, + 5827, + 5848, + 5849, + 5852, + 5859, + 5880, + 5884, + 5907, + 5909, + 5912, + 5919, + 5931, + 5932, + 5934, + 5941, + 5948, + 5950, + 5952, + 5953, + 5969, + 5981, + 6000, + 6003, + 6010, + 6018, + 6041, + 6065, + 6075, + 6090, + 6103, + 6106, + 6109, + 6114, + 6123, + 6131, + 6136, + 6138, + 6139, + 6164, + 6165, + 6171, + 6173, + 6180, + 6185, + 6189, + 6190, + 6221, + 6223, + 6237, + 6255, + 6262, + 6265, + 6293, + 6296, + 6305, + 6318, + 6331, + 6336, + 6340, + 6355, + 6366, + 6371, + 6396, + 6399, + 6402, + 6408, + 6432, + 6433, + 6441, + 6456, + 6465, + 6478, + 6486, + 6489, + 6507, + 6508, + 6520, + 6522, + 6528, + 6537, + 6551, + 6564, + 6589, + 6590, + 6598, + 6599, + 6611, + 6613, + 6615, + 6621, + 6634, + 6647, + 6649, + 6654, + 6676, + 6680, + 6690, + 6708, + 6729, + 6736, + 6744, + 6749, + 6756, + 6761, + 6763, + 6773, + 6788, + 6790, + 6796, + 6797, + 6811, + 6824, + 6850, + 6869, + 6871, + 6882, + 6892, + 6895, + 6906, + 6911, + 6912, + 6914, + 6927, + 6952, + 6966, + 6985, + 7001, + 7021, + 7031, + 7035, + 7038, + 7041, + 7045, + 7052, + 7057, + 7058, + 7072, + 7073, + 7076, + 7086, + 7102, + 7107, + 7109, + 7117, + 7122, + 7125, + 7166, + 7182, + 7199, + 7207, + 7212, + 7215, + 7232, + 7243, + 7246, + 7250, + 7253, + 7258, + 7263, + 7267, + 7270, + 7274, + 7280, + 7286, + 7293, + 7298, + 7302, + 7306, + 7316, + 7325, + 7326, + 7334, + 7356, + 7357, + 7363, + 7364, + 7367, + 7385, + 7392, + 7399, + 7405, + 7416, + 7420, + 7421, + 7426, + 7452, + 7476, + 7481, + 7519, + 7534, + 7542, + 7546, + 7573, + 7585, + 7601, + 7604, + 7606, + 7609, + 7629, + 7649, + 7653, + 7667, + 7682, + 7699, + 7738, + 7750, + 7786, + 7798, + 7800, + 7801, + 7805, + 7806, + 7811, + 7813, + 7832, + 7837, + 7849, + 7856, + 7876, + 7877, + 7887, + 7905, + 7916, + 7919, + 7920, + 7922, + 7923, + 7926, + 7944, + 7961, + 7966, + 7970, + 7973, + 7974, + 7976, + 7986, + 7999, + 8027, + 8028, + 8034, + 8047, + 8068, + 8074, + 8077, + 8091, + 8120, + 8122, + 8125, + 8152, + 8153, + 8164, + 8167, + 8169, + 8171, + 8177, + 8184, + 8189, + 8192, + 8196, + 8202, + 8212, + 8217, + 8231, + 8242, + 8244, + 8250, + 8256, + 8257, + 8265, + 8270, + 8274, + 8283, + 8290, + 8294, + 8301, + 8302, + 8307, + 8318, + 8326, + 8338, + 8349, + 8350, + 8353, + 8357, + 8371, + 8374, + 8377, + 8380, + 8387, + 8388, + 8396, + 8402, + 8419, + 8423, + 8428, + 8435, + 8439, + 8442, + 8444, + 8453, + 8461, + 8475, + 8481, + 8485, + 8493, + 8495, + 8498, + 8523, + 8530, + 8531, + 8562 + ], + "early_stopping_patience": 3 +} diff --git a/phase1/ablations/helps_only/README.md b/phase1/ablations/helps_only/README.md new file mode 100644 index 0000000000000000000000000000000000000000..e15407bf0578dc3b02fd9bb8c09f2df2fdaa6621 --- /dev/null +++ b/phase1/ablations/helps_only/README.md @@ -0,0 +1,80 @@ +--- +library_name: peft +model_name: phase1-qwen-helps-only-ablation +tags: +- base_model:adapter:Qwen/Qwen2.5-1.5B-Instruct +- dpo +- lora +- transformers +- trl +license: apache-2.0 +base_model: Qwen/Qwen2.5-1.5B-Instruct +pipeline_tag: text-generation +--- + +# Phase 1 Qwen `helps_only` diagnostic ablation + +This is the Phase 1 `helps_only` diagnostic LoRA-DPO adapter fine-tuned from +[Qwen2.5-1.5B-Instruct](https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct). +The frozen training recipe and membership hashes are included in this directory. + +## Quick start + +```python +from peft import PeftModel +from transformers import AutoModelForCausalLM, AutoTokenizer + +repo_id = "geyuxu/york-milestone-project-self-traing-loop-model" +subfolder = "phase1/ablations/helps_only" +base_id = "Qwen/Qwen2.5-1.5B-Instruct" + +tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder) +base_model = AutoModelForCausalLM.from_pretrained( + base_id, torch_dtype="auto", device_map="auto" +) +model = PeftModel.from_pretrained(base_model, repo_id, subfolder=subfolder) +``` + +## Training procedure + + + + + +This model was trained with DPO, a method introduced in [Direct Preference Optimization: Your Language Model is Secretly a Reward Model](https://huggingface.co/papers/2305.18290). + +### Framework versions + +- PEFT 0.18.1 +- TRL: 0.29.0 +- Transformers: 5.3.0 +- Pytorch: 2.10.0 +- Datasets: 4.6.1 +- Tokenizers: 0.22.2 + +## Citations + +Cite DPO as: + +```bibtex +@inproceedings{rafailov2023direct, + title = {{Direct Preference Optimization: Your Language Model is Secretly a Reward Model}}, + author = {Rafael Rafailov and Archit Sharma and Eric Mitchell and Christopher D. Manning and Stefano Ermon and Chelsea Finn}, + year = 2023, + booktitle = {Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023}, + url = {http://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html}, + editor = {Alice Oh and Tristan Naumann and Amir Globerson and Kate Saenko and Moritz Hardt and Sergey Levine}, +} +``` + +Cite TRL as: + +```bibtex +@software{vonwerra2020trl, + title = {{TRL: Transformers Reinforcement Learning}}, + author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin}, + license = {Apache-2.0}, + url = {https://github.com/huggingface/trl}, + year = {2020} +} +``` diff --git a/phase1/ablations/helps_only/adapter_config.json b/phase1/ablations/helps_only/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..fa47a2292cd8a23ccf1b4d101d7f7a03e3f08871 --- /dev/null +++ b/phase1/ablations/helps_only/adapter_config.json @@ -0,0 +1,43 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen2.5-1.5B-Instruct", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "v_proj", + "k_proj", + "o_proj", + "q_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} diff --git a/phase1/ablations/helps_only/adapter_model.safetensors b/phase1/ablations/helps_only/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..2d205b95d4ab86d4d996c737054b25bcb7d7d4ab --- /dev/null +++ b/phase1/ablations/helps_only/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a143ad6c49a7a1b1d98e81af88412c91b367a394fa48a89517d6057fddf91748 +size 17462432 diff --git a/phase1/ablations/helps_only/chat_template.jinja b/phase1/ablations/helps_only/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..bdf7919a96cfe43d50914a007b9c0877bd0ec27e --- /dev/null +++ b/phase1/ablations/helps_only/chat_template.jinja @@ -0,0 +1,54 @@ +{%- if tools %} + {{- '<|im_start|>system\n' }} + {%- if messages[0]['role'] == 'system' %} + {{- messages[0]['content'] }} + {%- else %} + {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }} + {%- endif %} + {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }} +{%- else %} + {%- if messages[0]['role'] == 'system' %} + {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }} + {%- else %} + {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- for message in messages %} + {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %} + {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {{- '<|im_start|>' + message.role }} + {%- if message.content %} + {{- '\n' + message.content }} + {%- endif %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {{- '\n\n{"name": "' }} + {{- tool_call.name }} + {{- '", "arguments": ' }} + {{- tool_call.arguments | tojson }} + {{- '}\n' }} + {%- endfor %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- message.content }} + {{- '\n' }} + {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} +{%- endif %} diff --git a/phase1/ablations/helps_only/tokenizer.json b/phase1/ablations/helps_only/tokenizer.json new file mode 100644 index 0000000000000000000000000000000000000000..d73428d91463b495bc017fb6a2fb3a656646482b --- /dev/null +++ b/phase1/ablations/helps_only/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 +size 11422166 diff --git a/phase1/ablations/helps_only/tokenizer_config.json b/phase1/ablations/helps_only/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..9fd0fb48e73786f54fb04e98892f5f5a0ebeebdb --- /dev/null +++ b/phase1/ablations/helps_only/tokenizer_config.json @@ -0,0 +1,29 @@ +{ + "add_prefix_space": false, + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "is_local": true, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null +} diff --git a/phase1/ablations/helps_only/training_args.bin b/phase1/ablations/helps_only/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..a0e8c600d39d5a9f9542fd7088abfb7ec6bf7d1b --- /dev/null +++ b/phase1/ablations/helps_only/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:101d92ecb945e3232d561989c7a979ff91d184b4cccbe34a200a56060e3c5ce6 +size 5841 diff --git a/phase1/ablations/helps_only/training_recipe.json b/phase1/ablations/helps_only/training_recipe.json new file mode 100644 index 0000000000000000000000000000000000000000..ca058e2120ded3b68670d6aace62f00d623b8deb --- /dev/null +++ b/phase1/ablations/helps_only/training_recipe.json @@ -0,0 +1,22 @@ +{ + "format_version": 1, + "experiment": "confusion_ablation", + "ablation": "helps_only", + "model_name": "Qwen/Qwen2.5-1.5B-Instruct", + "train_membership_sha256": "5febb0b71375db4da6a27fdaa6d3226681631022eab8e57a816d93519c4854ab", + "validation_membership_sha256": "2f609467438cd6a01fd84b9d80c0fcd84c44767e3b2ed98f4f6a83d68a62c181", + "num_train_pairs": 77124, + "num_validation_pairs": 8563, + "transformation_seed": 22, + "validation_prompt_mode": "clean_rag", + "learning_rate": 1e-05, + "beta": 0.1, + "num_epochs": 1.0, + "seed": 22, + "max_length": 512, + "max_prompt_length": 384, + "gradient_accumulation_steps": 80, + "save_steps": 125, + "save_total_limit": 12, + "preference_pairs_format_version": 2 +} diff --git a/phase1/ablations/helps_only/training_summary.json b/phase1/ablations/helps_only/training_summary.json new file mode 100644 index 0000000000000000000000000000000000000000..e960cc5b20fc2baf0d98c901ad9b7ab0b73deb47 --- /dev/null +++ b/phase1/ablations/helps_only/training_summary.json @@ -0,0 +1,2029 @@ +{ + "model_name": "Qwen/Qwen2.5-1.5B-Instruct", + "resolved_model": "Qwen/Qwen2.5-1.5B-Instruct", + "num_train_records": 77124, + "num_validation_records_available": 8563, + "training_config": { + "lora_rank": 16, + "lora_alpha": 32, + "learning_rate": 1e-05, + "num_epochs": 1.0, + "per_device_batch_size": 1, + "per_device_eval_batch_size": 1, + "gradient_accumulation_steps": 80, + "beta": 0.1, + "max_length": 512, + "max_prompt_length": 384, + "seed": 22, + "save_steps": 125, + "save_total_limit": 12, + "resume_from_checkpoint": null, + "precision_dtype": "torch.bfloat16", + "bf16": true, + "fp16": false, + "tokenizer_add_bos_token": false + }, + "global_step": 500, + "best_metric": 0.5006195306777954, + "best_model_checkpoint": "outputs/confusion_ablation_phase1_repair_v3/helps_only/lora/checkpoint-125", + "train_metrics": { + "train_runtime": 16864.5913, + "train_samples_per_second": 4.573, + "train_steps_per_second": 0.057, + "total_flos": 2.7163725934432666e+17, + "train_loss": 0.23282903826236725 + }, + "log_history": [ + { + "loss": 0.6858583450317383, + "grad_norm": 0.016611717641353607, + "learning_rate": 9.906735751295338e-06, + "entropy": 0.794021682399325, + "num_tokens": 670561.0, + "logits/chosen": -0.9187091639020697, + "logits/rejected": -0.9434830672895622, + "mean_token_accuracy": 0.736259245146066, + "rewards/chosen": 0.0011638513133243578, + "rewards/rejected": -0.013860612378184669, + "rewards/accuracies": 0.5925, + "rewards/margins": 0.015024463631707476, + "logps/chosen": -54.79746845722198, + "logps/rejected": -49.96550277948379, + "epoch": 0.010372905969607386, + "step": 10 + }, + { + "loss": 0.6576845169067382, + "grad_norm": 0.016666823998093605, + "learning_rate": 9.803108808290156e-06, + "entropy": 0.7863238480500877, + "num_tokens": 1340958.0, + "logits/chosen": -0.9552881883230906, + "logits/rejected": -0.9189709572546179, + "mean_token_accuracy": 0.7423679579421878, + "rewards/chosen": -0.013600413688568552, + "rewards/rejected": -0.08799497530219376, + "rewards/accuracies": 0.85875, + "rewards/margins": 0.07439456147782039, + "logps/chosen": -55.26659148097038, + "logps/rejected": -49.557674720287324, + "epoch": 0.02074581193921477, + "step": 20 + }, + { + "loss": 0.6105106353759766, + "grad_norm": 0.015847327187657356, + "learning_rate": 9.699481865284975e-06, + "entropy": 0.846787225897424, + "num_tokens": 2013796.0, + "logits/chosen": -0.8573241884593181, + "logits/rejected": -0.8453699552830984, + "mean_token_accuracy": 0.727089679390192, + "rewards/chosen": -0.06516332936625986, + "rewards/rejected": -0.24710432796498935, + "rewards/accuracies": 0.8575, + "rewards/margins": 0.18194099859509152, + "logps/chosen": -59.86930260896683, + "logps/rejected": -53.61334676504135, + "epoch": 0.031118717908822157, + "step": 30 + }, + { + "loss": 0.560779619216919, + "grad_norm": 0.01469502318650484, + "learning_rate": 9.595854922279793e-06, + "entropy": 0.7988823162578046, + "num_tokens": 2684543.0, + "logits/chosen": -0.9062229187635736, + "logits/rejected": -0.8287031519573034, + "mean_token_accuracy": 0.726212237663567, + "rewards/chosen": -0.15750733469684747, + "rewards/rejected": -0.47408700099374984, + "rewards/accuracies": 0.8625, + "rewards/margins": 0.3165796657791361, + "logps/chosen": -57.612799718379975, + "logps/rejected": -53.58559124469757, + "epoch": 0.04149162387842954, + "step": 40 + }, + { + "loss": 0.5105207920074463, + "grad_norm": 0.014577334746718407, + "learning_rate": 9.492227979274612e-06, + "entropy": 0.7784375699353404, + "num_tokens": 3356031.0, + "logits/chosen": -0.913959642386141, + "logits/rejected": -0.8075734227458465, + "mean_token_accuracy": 0.7303825634159148, + "rewards/chosen": -0.32432046058405833, + "rewards/rejected": -0.8036991727564601, + "rewards/accuracies": 0.8625, + "rewards/margins": 0.4793787114601582, + "logps/chosen": -60.06104364156723, + "logps/rejected": -56.74762117385864, + "epoch": 0.051864529848036925, + "step": 50 + }, + { + "loss": 0.4511364459991455, + "grad_norm": 0.01305594015866518, + "learning_rate": 9.388601036269432e-06, + "entropy": 0.7942980694322614, + "num_tokens": 4026577.0, + "logits/chosen": -0.9856768630883611, + "logits/rejected": -0.8317867858234134, + "mean_token_accuracy": 0.7197631917707622, + "rewards/chosen": -0.5297682328737574, + "rewards/rejected": -1.217431449344149, + "rewards/accuracies": 0.88625, + "rewards/margins": 0.6876632150541991, + "logps/chosen": -60.84162630081177, + "logps/rejected": -61.641977578401566, + "epoch": 0.062237435817644314, + "step": 60 + }, + { + "loss": 0.422989559173584, + "grad_norm": 0.01258748210966587, + "learning_rate": 9.284974093264249e-06, + "entropy": 0.7553169909078861, + "num_tokens": 4696820.0, + "logits/chosen": -1.1534164984013175, + "logits/rejected": -0.9453616152186384, + "mean_token_accuracy": 0.7059021528251469, + "rewards/chosen": -0.8479185369245533, + "rewards/rejected": -1.733439953867346, + "rewards/accuracies": 0.85125, + "rewards/margins": 0.8855214151740074, + "logps/chosen": -64.60678691148757, + "logps/rejected": -65.6156524682045, + "epoch": 0.0726103417872517, + "step": 70 + }, + { + "loss": 0.37308950424194337, + "grad_norm": 0.013154606334865093, + "learning_rate": 9.181347150259067e-06, + "entropy": 0.7961554935819004, + "num_tokens": 5368225.0, + "logits/chosen": -1.1909632763159101, + "logits/rejected": -0.9626243884256602, + "mean_token_accuracy": 0.7057545288372785, + "rewards/chosen": -1.0665127522181137, + "rewards/rejected": -2.248069805242121, + "rewards/accuracies": 0.8875, + "rewards/margins": 1.1815570489689708, + "logps/chosen": -68.12463062763214, + "logps/rejected": -72.84404395580292, + "epoch": 0.08298324775685909, + "step": 80 + }, + { + "loss": 0.36935536861419677, + "grad_norm": 0.015311975963413715, + "learning_rate": 9.077720207253888e-06, + "entropy": 0.7894015382009093, + "num_tokens": 6040068.0, + "logits/chosen": -1.3107291135601724, + "logits/rejected": -1.0484886964785651, + "mean_token_accuracy": 0.7019536628946662, + "rewards/chosen": -1.3442938781030533, + "rewards/rejected": -2.594835725099547, + "rewards/accuracies": 0.875, + "rewards/margins": 1.2505418445914984, + "logps/chosen": -72.38709788918496, + "logps/rejected": -75.64441309213639, + "epoch": 0.09335615372646647, + "step": 90 + }, + { + "loss": 0.32566983699798585, + "grad_norm": 0.013686278834939003, + "learning_rate": 8.974093264248706e-06, + "entropy": 0.7407993375349906, + "num_tokens": 6710899.0, + "logits/chosen": -1.491155676700035, + "logits/rejected": -1.1507826984501721, + "mean_token_accuracy": 0.7010396635532379, + "rewards/chosen": -1.472484585774364, + "rewards/rejected": -3.0050534189864995, + "rewards/accuracies": 0.87375, + "rewards/margins": 1.5325688306987286, + "logps/chosen": -71.50509068489075, + "logps/rejected": -79.74594541549682, + "epoch": 0.10372905969607385, + "step": 100 + }, + { + "loss": 0.3260276556015015, + "grad_norm": 0.015970611944794655, + "learning_rate": 8.870466321243523e-06, + "entropy": 0.755189473812934, + "num_tokens": 7384308.0, + "logits/chosen": -1.4866158399686538, + "logits/rejected": -1.2556732947348208, + "mean_token_accuracy": 0.6936355204880238, + "rewards/chosen": -1.6455462214258296, + "rewards/rejected": -3.314337354162708, + "rewards/accuracies": 0.875, + "rewards/margins": 1.6687911279685794, + "logps/chosen": -75.27282932758331, + "logps/rejected": -83.60757318258285, + "epoch": 0.11410196566568125, + "step": 110 + }, + { + "loss": 0.29123826026916505, + "grad_norm": 0.011552904732525349, + "learning_rate": 8.766839378238343e-06, + "entropy": 0.7474201882537455, + "num_tokens": 8056453.0, + "logits/chosen": -1.6142062577777776, + "logits/rejected": -1.264399125865953, + "mean_token_accuracy": 0.7005275747552514, + "rewards/chosen": -1.5997523294587155, + "rewards/rejected": -3.4206406278908252, + "rewards/accuracies": 0.89875, + "rewards/margins": 1.8208882979303598, + "logps/chosen": -72.69924384593963, + "logps/rejected": -84.9409653043747, + "epoch": 0.12447487163528863, + "step": 120 + }, + { + "eval_loss": 0.5006195306777954, + "eval_runtime": 185.028, + "eval_samples_per_second": 5.405, + "eval_steps_per_second": 5.405, + "eval_entropy": 0.7257204860020429, + "eval_num_tokens": 8393345.0, + "eval_logits/chosen": -1.6364654488183503, + "eval_logits/rejected": -1.3224665456826323, + "eval_mean_token_accuracy": 0.6896886819005013, + "eval_rewards/chosen": -1.8563280573266092, + "eval_rewards/rejected": -3.186325779806066, + "eval_rewards/accuracies": 0.791, + "eval_rewards/margins": 1.329997718065977, + "eval_logps/chosen": -68.73626706314087, + "eval_logps/rejected": -84.50312891960144, + "epoch": 0.1296613246200923, + "step": 125 + }, + { + "loss": 0.2636831045150757, + "grad_norm": 0.013076480478048325, + "learning_rate": 8.663212435233162e-06, + "entropy": 0.7181003772222903, + "num_tokens": 8728634.0, + "logits/chosen": -1.671642872950834, + "logits/rejected": -1.343902642880392, + "mean_token_accuracy": 0.705937882065773, + "rewards/chosen": -1.5789886895833478, + "rewards/rejected": -3.5362877251021563, + "rewards/accuracies": 0.90625, + "rewards/margins": 1.9572990308701992, + "logps/chosen": -72.90494430541992, + "logps/rejected": -84.75396874666214, + "epoch": 0.13484777760489602, + "step": 130 + }, + { + "loss": 0.2740552186965942, + "grad_norm": 0.021369587630033493, + "learning_rate": 8.55958549222798e-06, + "entropy": 0.7297478528990178, + "num_tokens": 9401159.0, + "logits/chosen": -1.7250535840926815, + "logits/rejected": -1.360942676206459, + "mean_token_accuracy": 0.7058176286891102, + "rewards/chosen": -1.711061445976993, + "rewards/rejected": -3.760642220210284, + "rewards/accuracies": 0.89875, + "rewards/margins": 2.0495807684585454, + "logps/chosen": -75.34392234086991, + "logps/rejected": -86.37021635055542, + "epoch": 0.1452206835745034, + "step": 140 + }, + { + "loss": 0.22246203422546387, + "grad_norm": 0.011216296814382076, + "learning_rate": 8.455958549222799e-06, + "entropy": 0.7156421507499181, + "num_tokens": 10070639.0, + "logits/chosen": -1.8058072450366334, + "logits/rejected": -1.453452492851942, + "mean_token_accuracy": 0.6968013681657612, + "rewards/chosen": -1.7734466221980256, + "rewards/rejected": -3.9852739233896135, + "rewards/accuracies": 0.935, + "rewards/margins": 2.2118273005262017, + "logps/chosen": -71.75837573051453, + "logps/rejected": -88.40371996164322, + "epoch": 0.1555935895441108, + "step": 150 + }, + { + "loss": 0.22982723712921144, + "grad_norm": 0.012776419520378113, + "learning_rate": 8.352331606217617e-06, + "entropy": 0.6933300006289209, + "num_tokens": 10739089.0, + "logits/chosen": -1.9515460256771149, + "logits/rejected": -1.5484639940247698, + "mean_token_accuracy": 0.7057104521989822, + "rewards/chosen": -1.9016535378903792, + "rewards/rejected": -4.284137947391718, + "rewards/accuracies": 0.92625, + "rewards/margins": 2.3824844037741424, + "logps/chosen": -71.04089045763016, + "logps/rejected": -91.5341923880577, + "epoch": 0.16596649551371817, + "step": 160 + }, + { + "loss": 0.23764348030090332, + "grad_norm": 0.014385406859219074, + "learning_rate": 8.248704663212436e-06, + "entropy": 0.7189149663675926, + "num_tokens": 11409834.0, + "logits/chosen": -1.891959825395243, + "logits/rejected": -1.548625273180476, + "mean_token_accuracy": 0.6981369163282216, + "rewards/chosen": -1.8744462743058101, + "rewards/rejected": -4.231724939988926, + "rewards/accuracies": 0.90875, + "rewards/margins": 2.3572786602377893, + "logps/chosen": -74.21431750059128, + "logps/rejected": -91.71514132022858, + "epoch": 0.17633940148332555, + "step": 170 + }, + { + "loss": 0.20213358402252196, + "grad_norm": 0.01709628663957119, + "learning_rate": 8.145077720207254e-06, + "entropy": 0.7331272099440684, + "num_tokens": 12080449.0, + "logits/chosen": -1.8974689940297265, + "logits/rejected": -1.5145953081096013, + "mean_token_accuracy": 0.6983240643888712, + "rewards/chosen": -1.801844048615967, + "rewards/rejected": -4.443616501316428, + "rewards/accuracies": 0.92875, + "rewards/margins": 2.6417724495008588, + "logps/chosen": -74.37266374826432, + "logps/rejected": -93.39013815402984, + "epoch": 0.18671230745293294, + "step": 180 + }, + { + "loss": 0.22085981369018554, + "grad_norm": 0.017351916059851646, + "learning_rate": 8.041450777202073e-06, + "entropy": 0.7038006630554446, + "num_tokens": 12750629.0, + "logits/chosen": -2.036204467140802, + "logits/rejected": -1.5767073775724174, + "mean_token_accuracy": 0.7034011324681342, + "rewards/chosen": -1.9227157408563653, + "rewards/rejected": -4.568975618286058, + "rewards/accuracies": 0.9175, + "rewards/margins": 2.6462598730251194, + "logps/chosen": -71.0266849398613, + "logps/rejected": -95.72787975311279, + "epoch": 0.19708521342254032, + "step": 190 + }, + { + "loss": 0.21095876693725585, + "grad_norm": 0.011923568323254585, + "learning_rate": 7.937823834196891e-06, + "entropy": 0.7554844116524327, + "num_tokens": 13423352.0, + "logits/chosen": -1.86974235439135, + "logits/rejected": -1.501746707999648, + "mean_token_accuracy": 0.6907317889854312, + "rewards/chosen": -1.9836193190991616, + "rewards/rejected": -4.729873430356383, + "rewards/accuracies": 0.92, + "rewards/margins": 2.7462541125901043, + "logps/chosen": -76.15088132619857, + "logps/rejected": -98.10042838811874, + "epoch": 0.2074581193921477, + "step": 200 + }, + { + "loss": 0.20679113864898682, + "grad_norm": 0.016088780015707016, + "learning_rate": 7.834196891191712e-06, + "entropy": 0.7792452401274932, + "num_tokens": 14095948.0, + "logits/chosen": -1.8705466560278834, + "logits/rejected": -1.461863531116033, + "mean_token_accuracy": 0.6862335817702114, + "rewards/chosen": -1.8493201506307742, + "rewards/rejected": -4.571774728436139, + "rewards/accuracies": 0.9275, + "rewards/margins": 2.7224545743037014, + "logps/chosen": -74.57652376651764, + "logps/rejected": -96.64638544797897, + "epoch": 0.2178310253617551, + "step": 210 + }, + { + "loss": 0.1841462254524231, + "grad_norm": 0.018083656206727028, + "learning_rate": 7.730569948186528e-06, + "entropy": 0.7562577223840344, + "num_tokens": 14765355.0, + "logits/chosen": -1.9466678828790673, + "logits/rejected": -1.556764617717985, + "mean_token_accuracy": 0.6736517621856183, + "rewards/chosen": -1.9498732457583536, + "rewards/rejected": -4.814249985329806, + "rewards/accuracies": 0.94375, + "rewards/margins": 2.8643767323717473, + "logps/chosen": -74.6550524687767, + "logps/rejected": -96.928872423172, + "epoch": 0.2282039313313625, + "step": 220 + }, + { + "loss": 0.18351367712020875, + "grad_norm": 0.02809528261423111, + "learning_rate": 7.626943005181348e-06, + "entropy": 0.7285784264818358, + "num_tokens": 15435816.0, + "logits/chosen": -2.0795930087592787, + "logits/rejected": -1.636840952128652, + "mean_token_accuracy": 0.6832175821252168, + "rewards/chosen": -2.231121272182354, + "rewards/rejected": -5.6053673730045555, + "rewards/accuracies": 0.935, + "rewards/margins": 3.374246101528406, + "logps/chosen": -77.43112219810486, + "logps/rejected": -106.47521061182022, + "epoch": 0.23857683730096987, + "step": 230 + }, + { + "loss": 0.19073803424835206, + "grad_norm": 0.01874386891722679, + "learning_rate": 7.523316062176167e-06, + "entropy": 0.7100621155637782, + "num_tokens": 16103129.0, + "logits/chosen": -2.111952753872817, + "logits/rejected": -1.7125841187317576, + "mean_token_accuracy": 0.6768746449425816, + "rewards/chosen": -2.3892388375883455, + "rewards/rejected": -5.755352979376912, + "rewards/accuracies": 0.935, + "rewards/margins": 3.366114140301943, + "logps/chosen": -76.3891685450077, + "logps/rejected": -104.74123107671738, + "epoch": 0.24894974327057726, + "step": 240 + }, + { + "loss": 0.15556421279907226, + "grad_norm": 0.01747226156294346, + "learning_rate": 7.419689119170985e-06, + "entropy": 0.733566192787257, + "num_tokens": 16774426.0, + "logits/chosen": -1.9979488002914059, + "logits/rejected": -1.5990273070071686, + "mean_token_accuracy": 0.6710057172738015, + "rewards/chosen": -2.2422293889999856, + "rewards/rejected": -5.71058324098587, + "rewards/accuracies": 0.95125, + "rewards/margins": 3.4683538476377724, + "logps/chosen": -77.04140710353852, + "logps/rejected": -106.12069250583649, + "epoch": 0.2593226492401846, + "step": 250 + }, + { + "eval_loss": 0.6056406497955322, + "eval_runtime": 214.9765, + "eval_samples_per_second": 4.652, + "eval_steps_per_second": 4.652, + "eval_entropy": 0.7675776538113133, + "eval_num_tokens": 16774426.0, + "eval_logits/chosen": -1.9016790324834714, + "eval_logits/rejected": -1.5678728323483735, + "eval_mean_token_accuracy": 0.638426756888628, + "eval_rewards/chosen": -2.858136704711709, + "eval_rewards/rejected": -5.103179955605418, + "eval_rewards/accuracies": 0.779, + "eval_rewards/margins": 2.245043248832226, + "eval_logps/chosen": -78.75435346412658, + "eval_logps/rejected": -103.67167038726807, + "epoch": 0.2593226492401846, + "step": 250 + }, + { + "loss": 0.15468125343322753, + "grad_norm": 0.023065408691763878, + "learning_rate": 7.3160621761658035e-06, + "entropy": 0.7432888356089825, + "num_tokens": 17443716.0, + "logits/chosen": -2.0815265223306243, + "logits/rejected": -1.6500056931946074, + "mean_token_accuracy": 0.665775734577328, + "rewards/chosen": -2.3973246609413765, + "rewards/rejected": -5.997232149764895, + "rewards/accuracies": 0.95, + "rewards/margins": 3.599907489940524, + "logps/chosen": -77.37100106954574, + "logps/rejected": -108.72272551059723, + "epoch": 0.26969555520979205, + "step": 260 + }, + { + "loss": 0.17242192029953002, + "grad_norm": 0.018100790679454803, + "learning_rate": 7.212435233160623e-06, + "entropy": 0.7815824018983403, + "num_tokens": 18115456.0, + "logits/chosen": -1.8929626691100117, + "logits/rejected": -1.568634429940542, + "mean_token_accuracy": 0.6482958744466305, + "rewards/chosen": -2.8240217579288767, + "rewards/rejected": -6.417929985076189, + "rewards/accuracies": 0.93875, + "rewards/margins": 3.593908224105835, + "logps/chosen": -86.06786829471588, + "logps/rejected": -114.08773995637894, + "epoch": 0.28006846117939943, + "step": 270 + }, + { + "loss": 0.13711202144622803, + "grad_norm": 0.013445369899272919, + "learning_rate": 7.108808290155441e-06, + "entropy": 0.7558632073167246, + "num_tokens": 18787182.0, + "logits/chosen": -1.978579450117466, + "logits/rejected": -1.6631533533075546, + "mean_token_accuracy": 0.6569508682191372, + "rewards/chosen": -2.7565071246563457, + "rewards/rejected": -6.632811545878649, + "rewards/accuracies": 0.9575, + "rewards/margins": 3.8763044214993716, + "logps/chosen": -84.94609524965286, + "logps/rejected": -115.75064901828766, + "epoch": 0.2904413671490068, + "step": 280 + }, + { + "loss": 0.14471136331558226, + "grad_norm": 0.03034352697432041, + "learning_rate": 7.005181347150259e-06, + "entropy": 0.7719684389990289, + "num_tokens": 19458826.0, + "logits/chosen": -1.9281082628928359, + "logits/rejected": -1.5931914351338883, + "mean_token_accuracy": 0.6512335392460227, + "rewards/chosen": -3.03531946905714, + "rewards/rejected": -7.0661579599231485, + "rewards/accuracies": 0.94875, + "rewards/margins": 4.030838481113315, + "logps/chosen": -85.57453865528106, + "logps/rejected": -120.38242918252945, + "epoch": 0.3008142731186142, + "step": 290 + }, + { + "loss": 0.14207189083099364, + "grad_norm": 0.01976640149950981, + "learning_rate": 6.9015544041450784e-06, + "entropy": 0.775840242926497, + "num_tokens": 20129807.0, + "logits/chosen": -1.9291908069467354, + "logits/rejected": -1.529736851381803, + "mean_token_accuracy": 0.647318363133818, + "rewards/chosen": -3.2047973467002158, + "rewards/rejected": -7.190337324440479, + "rewards/accuracies": 0.94375, + "rewards/margins": 3.985539976321161, + "logps/chosen": -88.11508201122284, + "logps/rejected": -121.52326109170913, + "epoch": 0.3111871790882216, + "step": 300 + }, + { + "loss": 0.13882720470428467, + "grad_norm": 0.019125595688819885, + "learning_rate": 6.797927461139897e-06, + "entropy": 0.7558516392938327, + "num_tokens": 20801777.0, + "logits/chosen": -1.9366754550881657, + "logits/rejected": -1.5732930849415423, + "mean_token_accuracy": 0.6629200987983495, + "rewards/chosen": -3.214626377870736, + "rewards/rejected": -7.299282197505236, + "rewards/accuracies": 0.9475, + "rewards/margins": 4.084655814617872, + "logps/chosen": -88.43090007543564, + "logps/rejected": -121.64797079086304, + "epoch": 0.32156008505782896, + "step": 310 + }, + { + "loss": 0.15239068269729614, + "grad_norm": 0.026703625917434692, + "learning_rate": 6.6943005181347155e-06, + "entropy": 0.759519019573927, + "num_tokens": 21473384.0, + "logits/chosen": -1.9384710945696861, + "logits/rejected": -1.6229014066134837, + "mean_token_accuracy": 0.6460824762284756, + "rewards/chosen": -3.5289745971094817, + "rewards/rejected": -7.814981915429234, + "rewards/accuracies": 0.9425, + "rewards/margins": 4.286007315814495, + "logps/chosen": -95.04349534749984, + "logps/rejected": -127.0398188662529, + "epoch": 0.33193299102743634, + "step": 320 + }, + { + "loss": 0.13009344339370726, + "grad_norm": 0.018585270270705223, + "learning_rate": 6.590673575129535e-06, + "entropy": 0.7342186298122396, + "num_tokens": 22142477.0, + "logits/chosen": -2.0363266451123923, + "logits/rejected": -1.67308820389407, + "mean_token_accuracy": 0.6532345769926906, + "rewards/chosen": -3.3065084332806873, + "rewards/rejected": -7.662135322336107, + "rewards/accuracies": 0.95625, + "rewards/margins": 4.355626890957356, + "logps/chosen": -86.15242535829545, + "logps/rejected": -125.1262379026413, + "epoch": 0.3423058969970437, + "step": 330 + }, + { + "loss": 0.1294613003730774, + "grad_norm": 0.024174772202968597, + "learning_rate": 6.487046632124353e-06, + "entropy": 0.778732093811268, + "num_tokens": 22814406.0, + "logits/chosen": -1.8744846753614508, + "logits/rejected": -1.557779354695435, + "mean_token_accuracy": 0.6483545247651636, + "rewards/chosen": -3.3343913850979243, + "rewards/rejected": -7.493394564837217, + "rewards/accuracies": 0.95625, + "rewards/margins": 4.1590031705796715, + "logps/chosen": -91.52018271446228, + "logps/rejected": -125.49517280578613, + "epoch": 0.3526788029666511, + "step": 340 + }, + { + "loss": 0.12839078903198242, + "grad_norm": 0.021780716255307198, + "learning_rate": 6.383419689119171e-06, + "entropy": 0.7516101838089526, + "num_tokens": 23486707.0, + "logits/chosen": -1.9700945184752572, + "logits/rejected": -1.6397432545695403, + "mean_token_accuracy": 0.6522356096096337, + "rewards/chosen": -3.294995879915514, + "rewards/rejected": -7.7126641423255204, + "rewards/accuracies": 0.9575, + "rewards/margins": 4.4176682551950215, + "logps/chosen": -90.83600348949432, + "logps/rejected": -126.77610003948212, + "epoch": 0.3630517089362585, + "step": 350 + }, + { + "loss": 0.1488456130027771, + "grad_norm": 0.020714374259114265, + "learning_rate": 6.2797927461139905e-06, + "entropy": 0.7544214495958295, + "num_tokens": 24156469.0, + "logits/chosen": -1.92354159972201, + "logits/rejected": -1.5932112088234438, + "mean_token_accuracy": 0.6473389553651213, + "rewards/chosen": -3.2932736888423095, + "rewards/rejected": -7.400682945102453, + "rewards/accuracies": 0.945, + "rewards/margins": 4.107409240156412, + "logps/chosen": -88.0268507552147, + "logps/rejected": -122.07945943832398, + "epoch": 0.37342461490586587, + "step": 360 + }, + { + "loss": 0.12627313137054444, + "grad_norm": 0.01646515727043152, + "learning_rate": 6.176165803108809e-06, + "entropy": 0.8060684028314427, + "num_tokens": 24831471.0, + "logits/chosen": -1.7544659981832322, + "logits/rejected": -1.463259412146846, + "mean_token_accuracy": 0.6474123366177083, + "rewards/chosen": -3.231792522999458, + "rewards/rejected": -7.640311172902584, + "rewards/accuracies": 0.95875, + "rewards/margins": 4.408518632799387, + "logps/chosen": -94.10357024669648, + "logps/rejected": -128.06225858926774, + "epoch": 0.38379752087547325, + "step": 370 + }, + { + "eval_loss": 0.7162045836448669, + "eval_runtime": 245.5758, + "eval_samples_per_second": 4.072, + "eval_steps_per_second": 4.072, + "eval_entropy": 0.7526722595356404, + "eval_num_tokens": 25165755.0, + "eval_logits/chosen": -1.90159736974585, + "eval_logits/rejected": -1.5791501459591346, + "eval_mean_token_accuracy": 0.6217855967730284, + "eval_rewards/chosen": -4.221462745887227, + "eval_rewards/rejected": -7.149939286857843, + "eval_rewards/accuracies": 0.783, + "eval_rewards/margins": 2.9284765325784683, + "eval_logps/chosen": -92.38761359214783, + "eval_logps/rejected": -124.13926333999633, + "epoch": 0.38898397386027694, + "step": 375 + }, + { + "loss": 0.12565295696258544, + "grad_norm": 0.023654216900467873, + "learning_rate": 6.0725388601036275e-06, + "entropy": 0.7168624554201961, + "num_tokens": 25500679.0, + "logits/chosen": -2.056052749523911, + "logits/rejected": -1.643372895075378, + "mean_token_accuracy": 0.6568564863596111, + "rewards/chosen": -3.4278560562586065, + "rewards/rejected": -7.977554326504469, + "rewards/accuracies": 0.95, + "rewards/margins": 4.549698264449835, + "logps/chosen": -86.61842272043228, + "logps/rejected": -128.30167908906935, + "epoch": 0.39417042684508063, + "step": 380 + }, + { + "loss": 0.11409251689910889, + "grad_norm": 0.024783629924058914, + "learning_rate": 5.968911917098445e-06, + "entropy": 0.7501401096500921, + "num_tokens": 26171757.0, + "logits/chosen": -1.9333745257284571, + "logits/rejected": -1.567348165840012, + "mean_token_accuracy": 0.6470369586162269, + "rewards/chosen": -3.536213577263552, + "rewards/rejected": -8.32627578780055, + "rewards/accuracies": 0.96, + "rewards/margins": 4.790062201619148, + "logps/chosen": -91.70740163564682, + "logps/rejected": -133.4269912481308, + "epoch": 0.404543332814688, + "step": 390 + }, + { + "loss": 0.10429913997650146, + "grad_norm": 0.01578158512711525, + "learning_rate": 5.865284974093265e-06, + "entropy": 0.7956635004619602, + "num_tokens": 26844715.0, + "logits/chosen": -1.8049366638144833, + "logits/rejected": -1.5104901431761746, + "mean_token_accuracy": 0.6389342303480953, + "rewards/chosen": -3.4948488865431866, + "rewards/rejected": -8.024183837622404, + "rewards/accuracies": 0.96375, + "rewards/margins": 4.529334946647286, + "logps/chosen": -94.648166680336, + "logps/rejected": -130.52285103082656, + "epoch": 0.4149162387842954, + "step": 400 + }, + { + "loss": 0.13800268173217772, + "grad_norm": 0.019957033917307854, + "learning_rate": 5.761658031088083e-06, + "entropy": 0.7793120911484585, + "num_tokens": 27516725.0, + "logits/chosen": -1.8549602335857083, + "logits/rejected": -1.5267175160987139, + "mean_token_accuracy": 0.6423193990625441, + "rewards/chosen": -3.492969937432499, + "rewards/rejected": -8.126144999023527, + "rewards/accuracies": 0.96125, + "rewards/margins": 4.633175050020218, + "logps/chosen": -93.58816482782363, + "logps/rejected": -131.41816306352615, + "epoch": 0.4252891447539028, + "step": 410 + }, + { + "loss": 0.11805713176727295, + "grad_norm": 0.0187994334846735, + "learning_rate": 5.658031088082902e-06, + "entropy": 0.7545757652306929, + "num_tokens": 28188135.0, + "logits/chosen": -1.873550110920591, + "logits/rejected": -1.5043320525754367, + "mean_token_accuracy": 0.6394615587592125, + "rewards/chosen": -3.3145995734280405, + "rewards/rejected": -7.947769758999348, + "rewards/accuracies": 0.9575, + "rewards/margins": 4.633170171380043, + "logps/chosen": -87.63653787136077, + "logps/rejected": -129.56220105171204, + "epoch": 0.4356620507235102, + "step": 420 + }, + { + "loss": 0.12740592956542968, + "grad_norm": 0.01738053746521473, + "learning_rate": 5.554404145077721e-06, + "entropy": 0.75883277257788, + "num_tokens": 28858804.0, + "logits/chosen": -1.9298376085920284, + "logits/rejected": -1.560056586818597, + "mean_token_accuracy": 0.6475845011882484, + "rewards/chosen": -3.515412328981329, + "rewards/rejected": -8.071005233377218, + "rewards/accuracies": 0.96, + "rewards/margins": 4.555592897236347, + "logps/chosen": -92.735348944664, + "logps/rejected": -129.75473901987075, + "epoch": 0.4460349566931176, + "step": 430 + }, + { + "loss": 0.14025732278823852, + "grad_norm": 0.03447360917925835, + "learning_rate": 5.4507772020725395e-06, + "entropy": 0.7607411430426874, + "num_tokens": 29529999.0, + "logits/chosen": -1.8672980078366863, + "logits/rejected": -1.5365591751796719, + "mean_token_accuracy": 0.6453877515532076, + "rewards/chosen": -3.5431255162111484, + "rewards/rejected": -8.013637196272612, + "rewards/accuracies": 0.94625, + "rewards/margins": 4.4705116748809814, + "logps/chosen": -93.00428878068924, + "logps/rejected": -129.0281007218361, + "epoch": 0.456407862662725, + "step": 440 + }, + { + "loss": 0.09569562077522278, + "grad_norm": 0.019115449860692024, + "learning_rate": 5.347150259067357e-06, + "entropy": 0.787961185129825, + "num_tokens": 30203505.0, + "logits/chosen": -1.9089318864847349, + "logits/rejected": -1.4739854222647117, + "mean_token_accuracy": 0.654497133269906, + "rewards/chosen": -3.3072420401062117, + "rewards/rejected": -8.128699697032571, + "rewards/accuracies": 0.97375, + "rewards/margins": 4.821457646489144, + "logps/chosen": -90.26756436109542, + "logps/rejected": -133.00522322177886, + "epoch": 0.46678076863233237, + "step": 450 + }, + { + "loss": 0.12792205810546875, + "grad_norm": 0.0281841903924942, + "learning_rate": 5.243523316062177e-06, + "entropy": 0.766239798675524, + "num_tokens": 30875568.0, + "logits/chosen": -1.9169137057827605, + "logits/rejected": -1.5443000783572756, + "mean_token_accuracy": 0.6505569527018815, + "rewards/chosen": -3.42417212592205, + "rewards/rejected": -8.022385044395923, + "rewards/accuracies": 0.95375, + "rewards/margins": 4.598212912380696, + "logps/chosen": -88.34398028373718, + "logps/rejected": -130.9107288122177, + "epoch": 0.47715367460193975, + "step": 460 + }, + { + "loss": 0.10438011884689331, + "grad_norm": 0.012769816443324089, + "learning_rate": 5.139896373056995e-06, + "entropy": 0.754261478689732, + "num_tokens": 31547801.0, + "logits/chosen": -1.9733235777624498, + "logits/rejected": -1.5496449682143498, + "mean_token_accuracy": 0.6587452093698084, + "rewards/chosen": -3.4046586474310607, + "rewards/rejected": -8.238689427375794, + "rewards/accuracies": 0.96, + "rewards/margins": 4.8340307791531085, + "logps/chosen": -90.22236561775208, + "logps/rejected": -133.67569626569747, + "epoch": 0.48752658057154713, + "step": 470 + }, + { + "loss": 0.11527338027954101, + "grad_norm": 0.04143095761537552, + "learning_rate": 5.036269430051814e-06, + "entropy": 0.8031201446475461, + "num_tokens": 32220905.0, + "logits/chosen": -1.8379997780593569, + "logits/rejected": -1.5025386930087672, + "mean_token_accuracy": 0.6306095580849796, + "rewards/chosen": -3.4276347397238713, + "rewards/rejected": -8.276202333420516, + "rewards/accuracies": 0.96, + "rewards/margins": 4.848567594140768, + "logps/chosen": -95.14371522426605, + "logps/rejected": -134.20426798820495, + "epoch": 0.4978994865411545, + "step": 480 + }, + { + "loss": 0.13075348138809204, + "grad_norm": 0.011864494532346725, + "learning_rate": 4.932642487046633e-06, + "entropy": 0.7831255796179175, + "num_tokens": 32894872.0, + "logits/chosen": -1.8320905121355995, + "logits/rejected": -1.4693764522144144, + "mean_token_accuracy": 0.6478395171277225, + "rewards/chosen": -3.2756898268085206, + "rewards/rejected": -7.780137736238539, + "rewards/accuracies": 0.955, + "rewards/margins": 4.504447904080153, + "logps/chosen": -91.73629876852036, + "logps/rejected": -129.0320829319954, + "epoch": 0.5082723925107618, + "step": 490 + }, + { + "loss": 0.12714189291000366, + "grad_norm": 0.02473694644868374, + "learning_rate": 4.829015544041451e-06, + "entropy": 0.7955848192726261, + "num_tokens": 33565691.0, + "logits/chosen": -1.8834938774520926, + "logits/rejected": -1.4981447820382991, + "mean_token_accuracy": 0.6382771720923484, + "rewards/chosen": -3.1717117047600913, + "rewards/rejected": -7.624671882167458, + "rewards/accuracies": 0.9575, + "rewards/margins": 4.452960164994002, + "logps/chosen": -87.47686364412307, + "logps/rejected": -125.46468779563904, + "epoch": 0.5186452984803692, + "step": 500 + }, + { + "eval_loss": 0.6964932084083557, + "eval_runtime": 279.8952, + "eval_samples_per_second": 3.573, + "eval_steps_per_second": 3.573, + "eval_entropy": 0.7739749677795916, + "eval_num_tokens": 33565691.0, + "eval_logits/chosen": -1.8410994007704304, + "eval_logits/rejected": -1.4860494630066636, + "eval_mean_token_accuracy": 0.6207611305266618, + "eval_rewards/chosen": -3.7967804961130023, + "eval_rewards/rejected": -6.769779369160533, + "eval_rewards/accuracies": 0.793, + "eval_rewards/margins": 2.9729988664388656, + "eval_logps/chosen": -88.14079112052917, + "eval_logps/rejected": -120.33766422653198, + "epoch": 0.5186452984803692, + "step": 500 + }, + { + "train_runtime": 16864.5913, + "train_samples_per_second": 4.573, + "train_steps_per_second": 0.057, + "total_flos": 2.7163725934432666e+17, + "train_loss": 0.23282903826236725, + "epoch": 0.5186452984803692, + "step": 500 + } + ], + "validation_monitor_size": 1000, + "validation_monitor_selection": "fixed_seed_random_without_replacement", + "validation_monitor_seed": 22, + "validation_monitor_indices": [ + 2, + 10, + 14, + 21, + 55, + 63, + 66, + 69, + 107, + 110, + 142, + 144, + 149, + 150, + 151, + 152, + 160, + 163, + 166, + 167, + 176, + 181, + 206, + 207, + 259, + 267, + 281, + 295, + 298, + 306, + 307, + 317, + 321, + 331, + 336, + 341, + 346, + 349, + 351, + 352, + 357, + 358, + 369, + 370, + 382, + 386, + 391, + 401, + 411, + 412, + 432, + 437, + 452, + 462, + 465, + 488, + 490, + 491, + 492, + 494, + 503, + 504, + 508, + 528, + 538, + 540, + 551, + 553, + 567, + 586, + 605, + 606, + 625, + 627, + 661, + 663, + 666, + 677, + 685, + 690, + 692, + 704, + 708, + 714, + 715, + 727, + 728, + 733, + 745, + 752, + 753, + 755, + 764, + 773, + 779, + 783, + 793, + 796, + 799, + 803, + 804, + 805, + 813, + 816, + 818, + 823, + 827, + 829, + 830, + 837, + 842, + 845, + 850, + 853, + 856, + 889, + 890, + 905, + 915, + 924, + 930, + 939, + 951, + 988, + 1002, + 1005, + 1023, + 1029, + 1038, + 1049, + 1050, + 1054, + 1056, + 1067, + 1068, + 1079, + 1088, + 1091, + 1103, + 1114, + 1118, + 1133, + 1140, + 1144, + 1145, + 1155, + 1186, + 1195, + 1206, + 1223, + 1251, + 1252, + 1257, + 1259, + 1270, + 1271, + 1295, + 1303, + 1304, + 1305, + 1329, + 1335, + 1336, + 1343, + 1367, + 1373, + 1377, + 1403, + 1412, + 1429, + 1443, + 1457, + 1459, + 1460, + 1476, + 1483, + 1486, + 1494, + 1507, + 1510, + 1519, + 1521, + 1522, + 1545, + 1551, + 1570, + 1582, + 1593, + 1595, + 1603, + 1607, + 1614, + 1615, + 1625, + 1634, + 1639, + 1648, + 1654, + 1657, + 1662, + 1667, + 1673, + 1690, + 1704, + 1746, + 1756, + 1781, + 1783, + 1796, + 1799, + 1809, + 1814, + 1827, + 1829, + 1832, + 1844, + 1847, + 1854, + 1856, + 1857, + 1858, + 1874, + 1883, + 1889, + 1924, + 1925, + 1931, + 1932, + 1934, + 1935, + 1938, + 1950, + 1957, + 1962, + 1967, + 1975, + 1982, + 1983, + 1991, + 1998, + 2003, + 2008, + 2017, + 2021, + 2026, + 2035, + 2040, + 2050, + 2056, + 2077, + 2079, + 2082, + 2098, + 2100, + 2108, + 2121, + 2130, + 2133, + 2134, + 2138, + 2143, + 2166, + 2167, + 2180, + 2181, + 2185, + 2204, + 2205, + 2212, + 2221, + 2224, + 2226, + 2230, + 2233, + 2256, + 2261, + 2263, + 2269, + 2273, + 2290, + 2291, + 2299, + 2301, + 2321, + 2323, + 2330, + 2384, + 2401, + 2417, + 2420, + 2421, + 2424, + 2430, + 2435, + 2456, + 2488, + 2502, + 2504, + 2519, + 2527, + 2532, + 2538, + 2542, + 2553, + 2555, + 2558, + 2559, + 2562, + 2578, + 2583, + 2585, + 2590, + 2592, + 2594, + 2596, + 2600, + 2606, + 2607, + 2618, + 2630, + 2637, + 2647, + 2650, + 2657, + 2679, + 2685, + 2705, + 2706, + 2712, + 2713, + 2714, + 2727, + 2740, + 2742, + 2755, + 2780, + 2784, + 2792, + 2807, + 2808, + 2810, + 2820, + 2831, + 2839, + 2860, + 2862, + 2863, + 2866, + 2875, + 2878, + 2898, + 2905, + 2921, + 2922, + 2926, + 2930, + 2934, + 2944, + 2955, + 2957, + 2959, + 2973, + 2978, + 2998, + 3018, + 3022, + 3028, + 3031, + 3061, + 3085, + 3090, + 3104, + 3105, + 3111, + 3115, + 3121, + 3122, + 3129, + 3133, + 3135, + 3161, + 3162, + 3169, + 3173, + 3194, + 3195, + 3215, + 3225, + 3226, + 3241, + 3247, + 3250, + 3253, + 3265, + 3268, + 3293, + 3301, + 3312, + 3329, + 3352, + 3361, + 3362, + 3376, + 3396, + 3401, + 3403, + 3410, + 3419, + 3432, + 3443, + 3452, + 3467, + 3469, + 3475, + 3485, + 3503, + 3514, + 3515, + 3524, + 3528, + 3538, + 3544, + 3557, + 3560, + 3565, + 3600, + 3637, + 3642, + 3658, + 3659, + 3692, + 3693, + 3699, + 3722, + 3725, + 3728, + 3731, + 3740, + 3742, + 3762, + 3766, + 3780, + 3788, + 3794, + 3796, + 3798, + 3805, + 3817, + 3819, + 3822, + 3837, + 3839, + 3843, + 3846, + 3851, + 3854, + 3865, + 3870, + 3871, + 3884, + 3894, + 3895, + 3896, + 3907, + 3911, + 3915, + 3919, + 3920, + 3923, + 3933, + 3955, + 3967, + 3972, + 3974, + 3975, + 3984, + 3985, + 3997, + 4002, + 4010, + 4034, + 4044, + 4063, + 4073, + 4079, + 4082, + 4088, + 4121, + 4145, + 4148, + 4159, + 4161, + 4164, + 4177, + 4188, + 4199, + 4203, + 4207, + 4208, + 4213, + 4221, + 4225, + 4233, + 4241, + 4243, + 4247, + 4264, + 4274, + 4282, + 4286, + 4290, + 4308, + 4310, + 4313, + 4321, + 4324, + 4327, + 4349, + 4362, + 4370, + 4374, + 4380, + 4407, + 4409, + 4411, + 4415, + 4417, + 4418, + 4427, + 4431, + 4433, + 4451, + 4466, + 4477, + 4478, + 4479, + 4493, + 4494, + 4514, + 4527, + 4539, + 4550, + 4558, + 4568, + 4579, + 4583, + 4584, + 4586, + 4587, + 4590, + 4599, + 4602, + 4610, + 4626, + 4627, + 4630, + 4641, + 4647, + 4655, + 4656, + 4657, + 4661, + 4685, + 4714, + 4715, + 4731, + 4749, + 4752, + 4769, + 4777, + 4782, + 4791, + 4805, + 4818, + 4829, + 4833, + 4837, + 4839, + 4843, + 4871, + 4875, + 4879, + 4880, + 4885, + 4888, + 4895, + 4900, + 4923, + 4966, + 4968, + 4972, + 4989, + 4994, + 4998, + 5001, + 5013, + 5019, + 5026, + 5032, + 5034, + 5046, + 5055, + 5085, + 5086, + 5088, + 5089, + 5090, + 5095, + 5108, + 5110, + 5119, + 5120, + 5121, + 5133, + 5148, + 5154, + 5160, + 5169, + 5178, + 5222, + 5223, + 5232, + 5233, + 5240, + 5256, + 5259, + 5264, + 5271, + 5276, + 5279, + 5294, + 5300, + 5303, + 5321, + 5335, + 5337, + 5345, + 5348, + 5365, + 5373, + 5378, + 5384, + 5422, + 5442, + 5443, + 5445, + 5477, + 5485, + 5495, + 5497, + 5504, + 5526, + 5533, + 5542, + 5564, + 5570, + 5579, + 5587, + 5592, + 5608, + 5610, + 5624, + 5630, + 5638, + 5651, + 5663, + 5670, + 5675, + 5691, + 5700, + 5706, + 5707, + 5715, + 5720, + 5721, + 5722, + 5732, + 5738, + 5741, + 5769, + 5771, + 5775, + 5795, + 5796, + 5800, + 5809, + 5810, + 5815, + 5819, + 5827, + 5848, + 5849, + 5852, + 5859, + 5880, + 5884, + 5907, + 5909, + 5912, + 5919, + 5931, + 5932, + 5934, + 5941, + 5948, + 5950, + 5952, + 5953, + 5969, + 5981, + 6000, + 6003, + 6010, + 6018, + 6041, + 6065, + 6075, + 6090, + 6103, + 6106, + 6109, + 6114, + 6123, + 6131, + 6136, + 6138, + 6139, + 6164, + 6165, + 6171, + 6173, + 6180, + 6185, + 6189, + 6190, + 6221, + 6223, + 6237, + 6255, + 6262, + 6265, + 6293, + 6296, + 6305, + 6318, + 6331, + 6336, + 6340, + 6355, + 6366, + 6371, + 6396, + 6399, + 6402, + 6408, + 6432, + 6433, + 6441, + 6456, + 6465, + 6478, + 6486, + 6489, + 6507, + 6508, + 6520, + 6522, + 6528, + 6537, + 6551, + 6564, + 6589, + 6590, + 6598, + 6599, + 6611, + 6613, + 6615, + 6621, + 6634, + 6647, + 6649, + 6654, + 6676, + 6680, + 6690, + 6708, + 6729, + 6736, + 6744, + 6749, + 6756, + 6761, + 6763, + 6773, + 6788, + 6790, + 6796, + 6797, + 6811, + 6824, + 6850, + 6869, + 6871, + 6882, + 6892, + 6895, + 6906, + 6911, + 6912, + 6914, + 6927, + 6952, + 6966, + 6985, + 7001, + 7021, + 7031, + 7035, + 7038, + 7041, + 7045, + 7052, + 7057, + 7058, + 7072, + 7073, + 7076, + 7086, + 7102, + 7107, + 7109, + 7117, + 7122, + 7125, + 7166, + 7182, + 7199, + 7207, + 7212, + 7215, + 7232, + 7243, + 7246, + 7250, + 7253, + 7258, + 7263, + 7267, + 7270, + 7274, + 7280, + 7286, + 7293, + 7298, + 7302, + 7306, + 7316, + 7325, + 7326, + 7334, + 7356, + 7357, + 7363, + 7364, + 7367, + 7385, + 7392, + 7399, + 7405, + 7416, + 7420, + 7421, + 7426, + 7452, + 7476, + 7481, + 7519, + 7534, + 7542, + 7546, + 7573, + 7585, + 7601, + 7604, + 7606, + 7609, + 7629, + 7649, + 7653, + 7667, + 7682, + 7699, + 7738, + 7750, + 7786, + 7798, + 7800, + 7801, + 7805, + 7806, + 7811, + 7813, + 7832, + 7837, + 7849, + 7856, + 7876, + 7877, + 7887, + 7905, + 7916, + 7919, + 7920, + 7922, + 7923, + 7926, + 7944, + 7961, + 7966, + 7970, + 7973, + 7974, + 7976, + 7986, + 7999, + 8027, + 8028, + 8034, + 8047, + 8068, + 8074, + 8077, + 8091, + 8120, + 8122, + 8125, + 8152, + 8153, + 8164, + 8167, + 8169, + 8171, + 8177, + 8184, + 8189, + 8192, + 8196, + 8202, + 8212, + 8217, + 8231, + 8242, + 8244, + 8250, + 8256, + 8257, + 8265, + 8270, + 8274, + 8283, + 8290, + 8294, + 8301, + 8302, + 8307, + 8318, + 8326, + 8338, + 8349, + 8350, + 8353, + 8357, + 8371, + 8374, + 8377, + 8380, + 8387, + 8388, + 8396, + 8402, + 8419, + 8423, + 8428, + 8435, + 8439, + 8442, + 8444, + 8453, + 8461, + 8475, + 8481, + 8485, + 8493, + 8495, + 8498, + 8523, + 8530, + 8531, + 8562 + ], + "early_stopping_patience": 3 +} diff --git a/phase1/ablations/matched_clean/README.md b/phase1/ablations/matched_clean/README.md new file mode 100644 index 0000000000000000000000000000000000000000..febbf874e976c96e0a8a8821f50aea3c8d064002 --- /dev/null +++ b/phase1/ablations/matched_clean/README.md @@ -0,0 +1,80 @@ +--- +library_name: peft +model_name: phase1-qwen-matched-clean-ablation +tags: +- base_model:adapter:Qwen/Qwen2.5-1.5B-Instruct +- dpo +- lora +- transformers +- trl +license: apache-2.0 +base_model: Qwen/Qwen2.5-1.5B-Instruct +pipeline_tag: text-generation +--- + +# Phase 1 Qwen `matched_clean` diagnostic ablation + +This is the Phase 1 `matched_clean` diagnostic LoRA-DPO adapter fine-tuned from +[Qwen2.5-1.5B-Instruct](https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct). +The frozen training recipe and membership hashes are included in this directory. + +## Quick start + +```python +from peft import PeftModel +from transformers import AutoModelForCausalLM, AutoTokenizer + +repo_id = "geyuxu/york-milestone-project-self-traing-loop-model" +subfolder = "phase1/ablations/matched_clean" +base_id = "Qwen/Qwen2.5-1.5B-Instruct" + +tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder) +base_model = AutoModelForCausalLM.from_pretrained( + base_id, torch_dtype="auto", device_map="auto" +) +model = PeftModel.from_pretrained(base_model, repo_id, subfolder=subfolder) +``` + +## Training procedure + + + + + +This model was trained with DPO, a method introduced in [Direct Preference Optimization: Your Language Model is Secretly a Reward Model](https://huggingface.co/papers/2305.18290). + +### Framework versions + +- PEFT 0.18.1 +- TRL: 0.29.0 +- Transformers: 5.3.0 +- Pytorch: 2.10.0 +- Datasets: 4.6.1 +- Tokenizers: 0.22.2 + +## Citations + +Cite DPO as: + +```bibtex +@inproceedings{rafailov2023direct, + title = {{Direct Preference Optimization: Your Language Model is Secretly a Reward Model}}, + author = {Rafael Rafailov and Archit Sharma and Eric Mitchell and Christopher D. Manning and Stefano Ermon and Chelsea Finn}, + year = 2023, + booktitle = {Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023}, + url = {http://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html}, + editor = {Alice Oh and Tristan Naumann and Amir Globerson and Kate Saenko and Moritz Hardt and Sergey Levine}, +} +``` + +Cite TRL as: + +```bibtex +@software{vonwerra2020trl, + title = {{TRL: Transformers Reinforcement Learning}}, + author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin}, + license = {Apache-2.0}, + url = {https://github.com/huggingface/trl}, + year = {2020} +} +``` diff --git a/phase1/ablations/matched_clean/adapter_config.json b/phase1/ablations/matched_clean/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..fa47a2292cd8a23ccf1b4d101d7f7a03e3f08871 --- /dev/null +++ b/phase1/ablations/matched_clean/adapter_config.json @@ -0,0 +1,43 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen2.5-1.5B-Instruct", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "v_proj", + "k_proj", + "o_proj", + "q_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} diff --git a/phase1/ablations/matched_clean/adapter_model.safetensors b/phase1/ablations/matched_clean/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..abfc79b7fe73687b578faaf3335859e6b570f361 --- /dev/null +++ b/phase1/ablations/matched_clean/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:724b1e847a25563f7fe04d27dfa05df9213b97348490c4cf5b8f1c0cbdb90b68 +size 17462432 diff --git a/phase1/ablations/matched_clean/chat_template.jinja b/phase1/ablations/matched_clean/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..bdf7919a96cfe43d50914a007b9c0877bd0ec27e --- /dev/null +++ b/phase1/ablations/matched_clean/chat_template.jinja @@ -0,0 +1,54 @@ +{%- if tools %} + {{- '<|im_start|>system\n' }} + {%- if messages[0]['role'] == 'system' %} + {{- messages[0]['content'] }} + {%- else %} + {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }} + {%- endif %} + {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }} +{%- else %} + {%- if messages[0]['role'] == 'system' %} + {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }} + {%- else %} + {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- for message in messages %} + {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %} + {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {{- '<|im_start|>' + message.role }} + {%- if message.content %} + {{- '\n' + message.content }} + {%- endif %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {{- '\n\n{"name": "' }} + {{- tool_call.name }} + {{- '", "arguments": ' }} + {{- tool_call.arguments | tojson }} + {{- '}\n' }} + {%- endfor %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- message.content }} + {{- '\n' }} + {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} +{%- endif %} diff --git a/phase1/ablations/matched_clean/tokenizer.json b/phase1/ablations/matched_clean/tokenizer.json new file mode 100644 index 0000000000000000000000000000000000000000..d73428d91463b495bc017fb6a2fb3a656646482b --- /dev/null +++ b/phase1/ablations/matched_clean/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 +size 11422166 diff --git a/phase1/ablations/matched_clean/tokenizer_config.json b/phase1/ablations/matched_clean/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..9fd0fb48e73786f54fb04e98892f5f5a0ebeebdb --- /dev/null +++ b/phase1/ablations/matched_clean/tokenizer_config.json @@ -0,0 +1,29 @@ +{ + "add_prefix_space": false, + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "is_local": true, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null +} diff --git a/phase1/ablations/matched_clean/training_args.bin b/phase1/ablations/matched_clean/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..2f437b1196bf4c269d26fd793e13c8b59ca7bcf4 --- /dev/null +++ b/phase1/ablations/matched_clean/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cfafc3f2a531cdc31948a992577839650613ac2f09616d9263508e3e97da8555 +size 5841 diff --git a/phase1/ablations/matched_clean/training_recipe.json b/phase1/ablations/matched_clean/training_recipe.json new file mode 100644 index 0000000000000000000000000000000000000000..fe45675645e1a6da622734791f465e7e0b917d20 --- /dev/null +++ b/phase1/ablations/matched_clean/training_recipe.json @@ -0,0 +1,22 @@ +{ + "format_version": 1, + "experiment": "confusion_ablation", + "ablation": "matched_clean", + "model_name": "Qwen/Qwen2.5-1.5B-Instruct", + "train_membership_sha256": "b497fa765223a9810ad784f31e1598edfa992a162146d6f94d9cdf4adcedd87d", + "validation_membership_sha256": "2f609467438cd6a01fd84b9d80c0fcd84c44767e3b2ed98f4f6a83d68a62c181", + "num_train_pairs": 77124, + "num_validation_pairs": 8563, + "transformation_seed": 22, + "validation_prompt_mode": "clean_rag", + "learning_rate": 1e-05, + "beta": 0.1, + "num_epochs": 1.0, + "seed": 22, + "max_length": 512, + "max_prompt_length": 384, + "gradient_accumulation_steps": 80, + "save_steps": 125, + "save_total_limit": 12, + "preference_pairs_format_version": 2 +} diff --git a/phase1/ablations/matched_clean/training_summary.json b/phase1/ablations/matched_clean/training_summary.json new file mode 100644 index 0000000000000000000000000000000000000000..c0b25a0c830c40ac50d0837a8da6d9ded9b5b668 --- /dev/null +++ b/phase1/ablations/matched_clean/training_summary.json @@ -0,0 +1,2925 @@ +{ + "model_name": "Qwen/Qwen2.5-1.5B-Instruct", + "resolved_model": "Qwen/Qwen2.5-1.5B-Instruct", + "num_train_records": 77124, + "num_validation_records_available": 8563, + "training_config": { + "lora_rank": 16, + "lora_alpha": 32, + "learning_rate": 1e-05, + "num_epochs": 1.0, + "per_device_batch_size": 1, + "per_device_eval_batch_size": 1, + "gradient_accumulation_steps": 80, + "beta": 0.1, + "max_length": 512, + "max_prompt_length": 384, + "seed": 22, + "save_steps": 125, + "save_total_limit": 12, + "resume_from_checkpoint": null, + "precision_dtype": "torch.bfloat16", + "bf16": true, + "fp16": false, + "tokenizer_add_bos_token": false + }, + "global_step": 965, + "best_metric": 0.4090946316719055, + "best_model_checkpoint": "outputs/confusion_ablation_phase1_repair_v3/matched_clean/lora/checkpoint-875", + "train_metrics": { + "train_runtime": 36967.0361, + "train_samples_per_second": 2.086, + "train_steps_per_second": 0.026, + "total_flos": 5.2405488888805786e+17, + "train_loss": 0.453640728787437 + }, + "log_history": [ + { + "loss": 0.6900316715240479, + "grad_norm": 0.011662614531815052, + "learning_rate": 9.906735751295338e-06, + "entropy": 0.8081745196832344, + "num_tokens": 669528.0, + "logits/chosen": -0.9878667544984245, + "logits/rejected": -0.8929429136538265, + "mean_token_accuracy": 0.7366863564029336, + "rewards/chosen": 0.0014809935365531145, + "rewards/rejected": -0.0051326466447972055, + "rewards/accuracies": 0.495, + "rewards/margins": 0.00661364022129419, + "logps/chosen": -48.20964523553848, + "logps/rejected": -54.25052870512009, + "epoch": 0.010372905969607386, + "step": 10 + }, + { + "loss": 0.6709239482879639, + "grad_norm": 0.01787947677075863, + "learning_rate": 9.803108808290156e-06, + "entropy": 0.7905870282277465, + "num_tokens": 1338759.0, + "logits/chosen": -0.9877784900726513, + "logits/rejected": -0.9284377500817239, + "mean_token_accuracy": 0.7397855435311794, + "rewards/chosen": -0.016295835754335714, + "rewards/rejected": -0.06304080443188653, + "rewards/accuracies": 0.74, + "rewards/margins": 0.046744968572747896, + "logps/chosen": -49.98522471666336, + "logps/rejected": -53.08380969285965, + "epoch": 0.02074581193921477, + "step": 20 + }, + { + "loss": 0.6449037075042725, + "grad_norm": 0.012443667277693748, + "learning_rate": 9.699481865284975e-06, + "entropy": 0.8007427603192627, + "num_tokens": 2009918.0, + "logits/chosen": -1.0123033629117577, + "logits/rejected": -0.9116259647175791, + "mean_token_accuracy": 0.7288216127734631, + "rewards/chosen": -0.08125005806276021, + "rewards/rejected": -0.18847612114805087, + "rewards/accuracies": 0.7525, + "rewards/margins": 0.10722606290772091, + "logps/chosen": -51.017456583976745, + "logps/rejected": -55.82100034952164, + "epoch": 0.031118717908822157, + "step": 30 + }, + { + "loss": 0.6104300498962403, + "grad_norm": 0.011565622873604298, + "learning_rate": 9.595854922279793e-06, + "entropy": 0.7688610723486636, + "num_tokens": 2680367.0, + "logits/chosen": -1.0477489025836138, + "logits/rejected": -0.9185756571968596, + "mean_token_accuracy": 0.7304606804065407, + "rewards/chosen": -0.18015499103314597, + "rewards/rejected": -0.377999417107676, + "rewards/accuracies": 0.76125, + "rewards/margins": 0.19784442565287463, + "logps/chosen": -52.41810529708862, + "logps/rejected": -56.31561070203781, + "epoch": 0.04149162387842954, + "step": 40 + }, + { + "loss": 0.5890812397003173, + "grad_norm": 0.011881239712238312, + "learning_rate": 9.492227979274612e-06, + "entropy": 0.767548923434224, + "num_tokens": 3350695.0, + "logits/chosen": -1.045900867553522, + "logits/rejected": -0.8987545206323213, + "mean_token_accuracy": 0.7290248272754252, + "rewards/chosen": -0.3571337752114414, + "rewards/rejected": -0.635303623637883, + "rewards/accuracies": 0.76125, + "rewards/margins": 0.27816984807141126, + "logps/chosen": -53.70132049441337, + "logps/rejected": -58.7293958568573, + "epoch": 0.051864529848036925, + "step": 50 + }, + { + "loss": 0.5672520160675049, + "grad_norm": 0.012122954241931438, + "learning_rate": 9.388601036269432e-06, + "entropy": 0.7509493381145876, + "num_tokens": 4019867.0, + "logits/chosen": -1.0931640275508827, + "logits/rejected": -0.9542402869856921, + "mean_token_accuracy": 0.7216887871176004, + "rewards/chosen": -0.5263037721261935, + "rewards/rejected": -0.9088172687360202, + "rewards/accuracies": 0.74875, + "rewards/margins": 0.38251349702011794, + "logps/chosen": -54.063412301540374, + "logps/rejected": -60.20355456352234, + "epoch": 0.062237435817644314, + "step": 60 + }, + { + "loss": 0.5313051700592041, + "grad_norm": 0.012870470061898232, + "learning_rate": 9.284974093264249e-06, + "entropy": 0.7521841926735943, + "num_tokens": 4689830.0, + "logits/chosen": -1.1636649836163147, + "logits/rejected": -0.9546643791863164, + "mean_token_accuracy": 0.7130510857887566, + "rewards/chosen": -0.7180539178028266, + "rewards/rejected": -1.2522271308361086, + "rewards/accuracies": 0.765, + "rewards/margins": 0.5341732117999345, + "logps/chosen": -57.92338786125183, + "logps/rejected": -64.00875183820725, + "epoch": 0.0726103417872517, + "step": 70 + }, + { + "loss": 0.524173355102539, + "grad_norm": 0.012850801460444927, + "learning_rate": 9.181347150259067e-06, + "entropy": 0.7584943031892181, + "num_tokens": 5359790.0, + "logits/chosen": -1.257342141058688, + "logits/rejected": -1.0016241015611054, + "mean_token_accuracy": 0.7126817052811384, + "rewards/chosen": -0.9431407463727374, + "rewards/rejected": -1.5808365274948302, + "rewards/accuracies": 0.76375, + "rewards/margins": 0.6376957796374336, + "logps/chosen": -58.12816961526871, + "logps/rejected": -69.45178006649017, + "epoch": 0.08298324775685909, + "step": 80 + }, + { + "loss": 0.5096397399902344, + "grad_norm": 0.015030446462333202, + "learning_rate": 9.077720207253888e-06, + "entropy": 0.7446463107218733, + "num_tokens": 6029642.0, + "logits/chosen": -1.3131360929541611, + "logits/rejected": -1.12108701233509, + "mean_token_accuracy": 0.6976540317758918, + "rewards/chosen": -1.0887427906056837, + "rewards/rejected": -1.8297204279349535, + "rewards/accuracies": 0.765, + "rewards/margins": 0.7409776375815272, + "logps/chosen": -62.075138006210324, + "logps/rejected": -71.068751745224, + "epoch": 0.09335615372646647, + "step": 90 + }, + { + "loss": 0.5227419376373291, + "grad_norm": 0.017649168148636818, + "learning_rate": 8.974093264248706e-06, + "entropy": 0.774682844899653, + "num_tokens": 6703750.0, + "logits/chosen": -1.3070892244508543, + "logits/rejected": -1.0911262790664193, + "mean_token_accuracy": 0.698255299879238, + "rewards/chosen": -1.2929798694234342, + "rewards/rejected": -2.059200689474819, + "rewards/accuracies": 0.755, + "rewards/margins": 0.7662208179756999, + "logps/chosen": -67.27675194501877, + "logps/rejected": -78.23825345277787, + "epoch": 0.10372905969607385, + "step": 100 + }, + { + "loss": 0.5076948642730713, + "grad_norm": 0.018913043662905693, + "learning_rate": 8.870466321243523e-06, + "entropy": 0.723871832547884, + "num_tokens": 7374932.0, + "logits/chosen": -1.3768008463722332, + "logits/rejected": -1.1314466745219074, + "mean_token_accuracy": 0.7054882103763521, + "rewards/chosen": -1.247365918380383, + "rewards/rejected": -2.083569277639035, + "rewards/accuracies": 0.775, + "rewards/margins": 0.8362033596914261, + "logps/chosen": -62.56643625497818, + "logps/rejected": -73.74503843307495, + "epoch": 0.11410196566568125, + "step": 110 + }, + { + "loss": 0.518116807937622, + "grad_norm": 0.014157967641949654, + "learning_rate": 8.766839378238343e-06, + "entropy": 0.7146987286728108, + "num_tokens": 8045025.0, + "logits/chosen": -1.392513233808292, + "logits/rejected": -1.167585582525032, + "mean_token_accuracy": 0.7107785574346781, + "rewards/chosen": -1.1991379019781017, + "rewards/rejected": -1.9976002290286123, + "rewards/accuracies": 0.76625, + "rewards/margins": 0.7984623239561915, + "logps/chosen": -63.023617169857026, + "logps/rejected": -70.3282685637474, + "epoch": 0.12447487163528863, + "step": 120 + }, + { + "eval_loss": 0.49094030261039734, + "eval_runtime": 195.9122, + "eval_samples_per_second": 5.104, + "eval_steps_per_second": 5.104, + "eval_entropy": 0.7422072718068957, + "eval_num_tokens": 8380297.0, + "eval_logits/chosen": -1.3606685028205767, + "eval_logits/rejected": -1.1272819430340941, + "eval_mean_token_accuracy": 0.7042824859470129, + "eval_rewards/chosen": -1.0899753504878027, + "eval_rewards/rejected": -1.9470994755723514, + "eval_rewards/accuracies": 0.777, + "eval_rewards/margins": 0.8571241236105561, + "eval_logps/chosen": -61.07274015617371, + "eval_logps/rejected": -72.11086616706848, + "epoch": 0.1296613246200923, + "step": 125 + }, + { + "loss": 0.4915438652038574, + "grad_norm": 0.014024928212165833, + "learning_rate": 8.663212435233162e-06, + "entropy": 0.7629431400250177, + "num_tokens": 8716283.0, + "logits/chosen": -1.3493070406504677, + "logits/rejected": -1.1303618494014056, + "mean_token_accuracy": 0.7068962034024299, + "rewards/chosen": -1.064063529693958, + "rewards/rejected": -1.9368204824090935, + "rewards/accuracies": 0.7825, + "rewards/margins": 0.8727569509390741, + "logps/chosen": -61.36201237678528, + "logps/rejected": -73.24028332233429, + "epoch": 0.13484777760489602, + "step": 130 + }, + { + "loss": 0.5040828704833984, + "grad_norm": 0.01371421106159687, + "learning_rate": 8.55958549222798e-06, + "entropy": 0.7165489907818846, + "num_tokens": 9385323.0, + "logits/chosen": -1.4613930482520017, + "logits/rejected": -1.211856862455939, + "mean_token_accuracy": 0.7094380159396678, + "rewards/chosen": -1.0889925239968579, + "rewards/rejected": -1.8759657187038101, + "rewards/accuracies": 0.77875, + "rewards/margins": 0.7869731936138123, + "logps/chosen": -57.32686332225799, + "logps/rejected": -71.04226065397262, + "epoch": 0.1452206835745034, + "step": 140 + }, + { + "loss": 0.45884413719177247, + "grad_norm": 0.01413357350975275, + "learning_rate": 8.455958549222799e-06, + "entropy": 0.701725748301833, + "num_tokens": 10057097.0, + "logits/chosen": -1.5608966569387421, + "logits/rejected": -1.247274744986142, + "mean_token_accuracy": 0.7153122393228114, + "rewards/chosen": -1.071364169051376, + "rewards/rejected": -2.1302177897136425, + "rewards/accuracies": 0.8075, + "rewards/margins": 1.0588536195317284, + "logps/chosen": -58.66886381149292, + "logps/rejected": -75.77571431159973, + "epoch": 0.1555935895441108, + "step": 150 + }, + { + "loss": 0.5141475677490235, + "grad_norm": 0.01554640382528305, + "learning_rate": 8.352331606217617e-06, + "entropy": 0.7456542236352106, + "num_tokens": 10728653.0, + "logits/chosen": -1.4681753702348763, + "logits/rejected": -1.2457289726855978, + "mean_token_accuracy": 0.70392991816625, + "rewards/chosen": -1.161004657074118, + "rewards/rejected": -2.000340641771909, + "rewards/accuracies": 0.77375, + "rewards/margins": 0.8393359830789268, + "logps/chosen": -64.61760116338729, + "logps/rejected": -74.73108973264694, + "epoch": 0.16596649551371817, + "step": 160 + }, + { + "loss": 0.48798179626464844, + "grad_norm": 0.013569124042987823, + "learning_rate": 8.248704663212436e-06, + "entropy": 0.7485733293113299, + "num_tokens": 11400551.0, + "logits/chosen": -1.469850987453924, + "logits/rejected": -1.2418553626350932, + "mean_token_accuracy": 0.7040991749428213, + "rewards/chosen": -1.1290287345201069, + "rewards/rejected": -2.089886896072421, + "rewards/accuracies": 0.775, + "rewards/margins": 0.9608581608976238, + "logps/chosen": -63.84155872344971, + "logps/rejected": -74.28893199920654, + "epoch": 0.17633940148332555, + "step": 170 + }, + { + "loss": 0.4588949203491211, + "grad_norm": 0.013312213122844696, + "learning_rate": 8.145077720207254e-06, + "entropy": 0.7363077022106154, + "num_tokens": 12070305.0, + "logits/chosen": -1.5014831557472343, + "logits/rejected": -1.253561978212398, + "mean_token_accuracy": 0.709209191892296, + "rewards/chosen": -1.082961096275685, + "rewards/rejected": -2.0920695228746626, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.009108423003927, + "logps/chosen": -60.205562086105346, + "logps/rejected": -73.08745456457137, + "epoch": 0.18671230745293294, + "step": 180 + }, + { + "loss": 0.44720139503479006, + "grad_norm": 0.019025955349206924, + "learning_rate": 8.041450777202073e-06, + "entropy": 0.7329158629218, + "num_tokens": 12738966.0, + "logits/chosen": -1.6102334910947507, + "logits/rejected": -1.2938961518114829, + "mean_token_accuracy": 0.7022849645651877, + "rewards/chosen": -1.096955630929151, + "rewards/rejected": -2.191100225120317, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.0941445926297455, + "logps/chosen": -62.84091185808182, + "logps/rejected": -73.56753115415573, + "epoch": 0.19708521342254032, + "step": 190 + }, + { + "loss": 0.5053049564361572, + "grad_norm": 0.022256096825003624, + "learning_rate": 7.937823834196891e-06, + "entropy": 0.7230936869091238, + "num_tokens": 13408002.0, + "logits/chosen": -1.6278242340657059, + "logits/rejected": -1.3487957538640436, + "mean_token_accuracy": 0.7035108367726207, + "rewards/chosen": -1.2608012669734308, + "rewards/rejected": -2.296834750812268, + "rewards/accuracies": 0.7525, + "rewards/margins": 1.036033486686647, + "logps/chosen": -61.396967930793764, + "logps/rejected": -75.2872954583168, + "epoch": 0.2074581193921477, + "step": 200 + }, + { + "loss": 0.4660433292388916, + "grad_norm": 0.014599275775253773, + "learning_rate": 7.834196891191712e-06, + "entropy": 0.6921609364774486, + "num_tokens": 14074115.0, + "logits/chosen": -1.7416979060664273, + "logits/rejected": -1.418815718305467, + "mean_token_accuracy": 0.7174021677859127, + "rewards/chosen": -1.077466004992384, + "rewards/rejected": -2.168546776890289, + "rewards/accuracies": 0.78125, + "rewards/margins": 1.0910807690175717, + "logps/chosen": -57.26282028913498, + "logps/rejected": -71.84579543352127, + "epoch": 0.2178310253617551, + "step": 210 + }, + { + "loss": 0.44950242042541505, + "grad_norm": 0.015949787572026253, + "learning_rate": 7.730569948186528e-06, + "entropy": 0.718045612655842, + "num_tokens": 14745903.0, + "logits/chosen": -1.6029292718575974, + "logits/rejected": -1.2788201063427131, + "mean_token_accuracy": 0.7201293612085283, + "rewards/chosen": -1.034126255120791, + "rewards/rejected": -2.162680851666955, + "rewards/accuracies": 0.8025, + "rewards/margins": 1.1285545978834852, + "logps/chosen": -58.2793731212616, + "logps/rejected": -75.22644976615906, + "epoch": 0.2282039313313625, + "step": 220 + }, + { + "loss": 0.43929591178894045, + "grad_norm": 0.013934735208749771, + "learning_rate": 7.626943005181348e-06, + "entropy": 0.7872297932501533, + "num_tokens": 15418570.0, + "logits/chosen": -1.4825574599936209, + "logits/rejected": -1.2401306349486072, + "mean_token_accuracy": 0.7127851650305093, + "rewards/chosen": -0.9212520667978242, + "rewards/rejected": -2.088999391239631, + "rewards/accuracies": 0.7975, + "rewards/margins": 1.1677473206445574, + "logps/chosen": -64.23240270137786, + "logps/rejected": -75.61436933040619, + "epoch": 0.23857683730096987, + "step": 230 + }, + { + "loss": 0.46149606704711915, + "grad_norm": 0.016272729262709618, + "learning_rate": 7.523316062176167e-06, + "entropy": 0.7730766562063945, + "num_tokens": 16089276.0, + "logits/chosen": -1.4998074947450468, + "logits/rejected": -1.2344424531786968, + "mean_token_accuracy": 0.7029178227111698, + "rewards/chosen": -0.9342721946419624, + "rewards/rejected": -2.0036902719875798, + "rewards/accuracies": 0.805, + "rewards/margins": 1.069418080030009, + "logps/chosen": -61.67156839847565, + "logps/rejected": -73.40640575170517, + "epoch": 0.24894974327057726, + "step": 240 + }, + { + "loss": 0.46842288970947266, + "grad_norm": 0.01317604910582304, + "learning_rate": 7.419689119170985e-06, + "entropy": 0.7556795614853036, + "num_tokens": 16760081.0, + "logits/chosen": -1.5251408018321724, + "logits/rejected": -1.2550001884745545, + "mean_token_accuracy": 0.7026587814092636, + "rewards/chosen": -0.9681878225761466, + "rewards/rejected": -1.9993022468869457, + "rewards/accuracies": 0.79625, + "rewards/margins": 1.031114422827959, + "logps/chosen": -62.68858078241348, + "logps/rejected": -72.8400109577179, + "epoch": 0.2593226492401846, + "step": 250 + }, + { + "eval_loss": 0.45063868165016174, + "eval_runtime": 228.335, + "eval_samples_per_second": 4.38, + "eval_steps_per_second": 4.38, + "eval_entropy": 0.7599611716154031, + "eval_num_tokens": 16760081.0, + "eval_logits/chosen": -1.5228878121420686, + "eval_logits/rejected": -1.2457822987193723, + "eval_mean_token_accuracy": 0.7089936109930277, + "eval_rewards/chosen": -0.9581855501902755, + "eval_rewards/rejected": -2.058153331893496, + "eval_rewards/accuracies": 0.804, + "eval_rewards/margins": 1.0999677814096211, + "eval_logps/chosen": -59.75484214401245, + "eval_logps/rejected": -73.22140468788147, + "epoch": 0.2593226492401846, + "step": 250 + }, + { + "loss": 0.4814570426940918, + "grad_norm": 0.015276545658707619, + "learning_rate": 7.3160621761658035e-06, + "entropy": 0.7907758677133825, + "num_tokens": 17432770.0, + "logits/chosen": -1.5061012207082294, + "logits/rejected": -1.2302418451410948, + "mean_token_accuracy": 0.7116011143475771, + "rewards/chosen": -0.9151591785412165, + "rewards/rejected": -2.000397002430982, + "rewards/accuracies": 0.78375, + "rewards/margins": 1.085237822062336, + "logps/chosen": -62.86761567592621, + "logps/rejected": -74.82630295515061, + "epoch": 0.26969555520979205, + "step": 260 + }, + { + "loss": 0.4540716648101807, + "grad_norm": 0.013052938506007195, + "learning_rate": 7.212435233160623e-06, + "entropy": 0.7655438208338455, + "num_tokens": 18100438.0, + "logits/chosen": -1.525467093384173, + "logits/rejected": -1.2448767667260814, + "mean_token_accuracy": 0.7059390800073743, + "rewards/chosen": -0.8308528269545059, + "rewards/rejected": -1.8842440211544453, + "rewards/accuracies": 0.79375, + "rewards/margins": 1.0533911933761555, + "logps/chosen": -56.91530933380127, + "logps/rejected": -70.32416380643845, + "epoch": 0.28006846117939943, + "step": 270 + }, + { + "loss": 0.44190540313720705, + "grad_norm": 0.014065246097743511, + "learning_rate": 7.108808290155441e-06, + "entropy": 0.7839024822821375, + "num_tokens": 18772061.0, + "logits/chosen": -1.5250317827718283, + "logits/rejected": -1.227351313367144, + "mean_token_accuracy": 0.7068624695949256, + "rewards/chosen": -0.8610654402987712, + "rewards/rejected": -2.0157007031119427, + "rewards/accuracies": 0.81875, + "rewards/margins": 1.1546352597884835, + "logps/chosen": -61.52414802789688, + "logps/rejected": -72.9297788310051, + "epoch": 0.2904413671490068, + "step": 280 + }, + { + "loss": 0.4456183910369873, + "grad_norm": 0.015716280788183212, + "learning_rate": 7.005181347150259e-06, + "entropy": 0.773276298265555, + "num_tokens": 19443506.0, + "logits/chosen": -1.5330978743938402, + "logits/rejected": -1.2171561791639127, + "mean_token_accuracy": 0.7161024253070355, + "rewards/chosen": -0.9044717278318422, + "rewards/rejected": -2.01870841772703, + "rewards/accuracies": 0.8025, + "rewards/margins": 1.1142366893729194, + "logps/chosen": -60.47999572515488, + "logps/rejected": -74.31323668241501, + "epoch": 0.3008142731186142, + "step": 290 + }, + { + "loss": 0.44274072647094725, + "grad_norm": 0.014205160550773144, + "learning_rate": 6.9015544041450784e-06, + "entropy": 0.7546117506347946, + "num_tokens": 20114567.0, + "logits/chosen": -1.6212462502874232, + "logits/rejected": -1.3379802284295708, + "mean_token_accuracy": 0.7209940696135163, + "rewards/chosen": -0.9589981533990612, + "rewards/rejected": -2.169916975693777, + "rewards/accuracies": 0.795, + "rewards/margins": 1.2109188246540725, + "logps/chosen": -60.32763281106949, + "logps/rejected": -75.60327394008637, + "epoch": 0.3111871790882216, + "step": 300 + }, + { + "loss": 0.4552000522613525, + "grad_norm": 0.014621925540268421, + "learning_rate": 6.797927461139897e-06, + "entropy": 0.7755605199559068, + "num_tokens": 20787766.0, + "logits/chosen": -1.612899054190608, + "logits/rejected": -1.3232876722515345, + "mean_token_accuracy": 0.7147772766277194, + "rewards/chosen": -0.9240679290609841, + "rewards/rejected": -2.1595666578254895, + "rewards/accuracies": 0.79, + "rewards/margins": 1.2354987265914679, + "logps/chosen": -61.32829741239548, + "logps/rejected": -77.28044722557068, + "epoch": 0.32156008505782896, + "step": 310 + }, + { + "loss": 0.4410384178161621, + "grad_norm": 0.01790008693933487, + "learning_rate": 6.6943005181347155e-06, + "entropy": 0.7489672241648077, + "num_tokens": 21457559.0, + "logits/chosen": -1.6415965131088623, + "logits/rejected": -1.347490645506002, + "mean_token_accuracy": 0.7051716044172645, + "rewards/chosen": -0.9709404561911651, + "rewards/rejected": -2.2215542565838406, + "rewards/accuracies": 0.7925, + "rewards/margins": 1.250613798997365, + "logps/chosen": -61.40900204181671, + "logps/rejected": -75.62910031557084, + "epoch": 0.33193299102743634, + "step": 320 + }, + { + "loss": 0.4336719512939453, + "grad_norm": 0.014728070236742496, + "learning_rate": 6.590673575129535e-06, + "entropy": 0.7923685038526309, + "num_tokens": 22128277.0, + "logits/chosen": -1.5480857679147186, + "logits/rejected": -1.2608543306081368, + "mean_token_accuracy": 0.703275697156787, + "rewards/chosen": -0.9459266294135409, + "rewards/rejected": -2.2482709953014273, + "rewards/accuracies": 0.80875, + "rewards/margins": 1.3023443661583587, + "logps/chosen": -60.81426377058029, + "logps/rejected": -77.32076614141464, + "epoch": 0.3423058969970437, + "step": 330 + }, + { + "loss": 0.4488088130950928, + "grad_norm": 0.01915821246802807, + "learning_rate": 6.487046632124353e-06, + "entropy": 0.7655984267906751, + "num_tokens": 22798429.0, + "logits/chosen": -1.5794928447393075, + "logits/rejected": -1.3028102903528602, + "mean_token_accuracy": 0.7063317270204424, + "rewards/chosen": -0.9481951130661764, + "rewards/rejected": -2.169792889961391, + "rewards/accuracies": 0.7975, + "rewards/margins": 1.2215977760369423, + "logps/chosen": -60.23724600553513, + "logps/rejected": -74.96227306127548, + "epoch": 0.3526788029666511, + "step": 340 + }, + { + "loss": 0.4490936756134033, + "grad_norm": 0.017944717779755592, + "learning_rate": 6.383419689119171e-06, + "entropy": 0.7542878538439982, + "num_tokens": 23470239.0, + "logits/chosen": -1.5727406857545416, + "logits/rejected": -1.276317261399869, + "mean_token_accuracy": 0.7159937589988112, + "rewards/chosen": -0.9953277947314564, + "rewards/rejected": -2.3134128075395712, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.3180850110016764, + "logps/chosen": -61.82909578323364, + "logps/rejected": -78.39685034513474, + "epoch": 0.3630517089362585, + "step": 350 + }, + { + "loss": 0.4634250640869141, + "grad_norm": 0.017308367416262627, + "learning_rate": 6.2797927461139905e-06, + "entropy": 0.7325191626208835, + "num_tokens": 24140239.0, + "logits/chosen": -1.6208129462287795, + "logits/rejected": -1.3357805451866935, + "mean_token_accuracy": 0.7167608435824513, + "rewards/chosen": -0.9554049956912786, + "rewards/rejected": -2.160907984265359, + "rewards/accuracies": 0.7925, + "rewards/margins": 1.205502986907959, + "logps/chosen": -60.00006797075272, + "logps/rejected": -73.66487602233887, + "epoch": 0.37342461490586587, + "step": 360 + }, + { + "loss": 0.4462597846984863, + "grad_norm": 0.012704321183264256, + "learning_rate": 6.176165803108809e-06, + "entropy": 0.7730704579531448, + "num_tokens": 24812178.0, + "logits/chosen": -1.5574609696072523, + "logits/rejected": -1.260951689955208, + "mean_token_accuracy": 0.7079000303149223, + "rewards/chosen": -0.9217178278604843, + "rewards/rejected": -2.219055590032367, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.2973377590533346, + "logps/chosen": -63.260009841918944, + "logps/rejected": -75.37872500896454, + "epoch": 0.38379752087547325, + "step": 370 + }, + { + "eval_loss": 0.4316043555736542, + "eval_runtime": 247.4497, + "eval_samples_per_second": 4.041, + "eval_steps_per_second": 4.041, + "eval_entropy": 0.7676939936636481, + "eval_num_tokens": 25147105.0, + "eval_logits/chosen": -1.5026115886795766, + "eval_logits/rejected": -1.2167814175886924, + "eval_mean_token_accuracy": 0.7118223344534635, + "eval_rewards/chosen": -0.7611177709406475, + "eval_rewards/rejected": -1.9837484061150754, + "eval_rewards/accuracies": 0.812, + "eval_rewards/margins": 1.2226306333914398, + "eval_logps/chosen": -57.784164419174196, + "eval_logps/rejected": -72.47735544586182, + "epoch": 0.38898397386027694, + "step": 375 + }, + { + "loss": 0.42072787284851076, + "grad_norm": 0.01512940414249897, + "learning_rate": 6.0725388601036275e-06, + "entropy": 0.7662378180027009, + "num_tokens": 25482532.0, + "logits/chosen": -1.4455535287130075, + "logits/rejected": -1.1827597378991437, + "mean_token_accuracy": 0.7134129768237472, + "rewards/chosen": -0.7430938966096438, + "rewards/rejected": -1.9754590333898159, + "rewards/accuracies": 0.81625, + "rewards/margins": 1.2323651346145197, + "logps/chosen": -59.126625483036044, + "logps/rejected": -71.10404143095016, + "epoch": 0.39417042684508063, + "step": 380 + }, + { + "loss": 0.4370901107788086, + "grad_norm": 0.013698432594537735, + "learning_rate": 5.968911917098445e-06, + "entropy": 0.7876232456968865, + "num_tokens": 26154266.0, + "logits/chosen": -1.4235855556360628, + "logits/rejected": -1.1775204862100577, + "mean_token_accuracy": 0.7055446618422866, + "rewards/chosen": -0.7474835715969129, + "rewards/rejected": -1.9929245413161698, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.2454409682005645, + "logps/chosen": -60.49559247493744, + "logps/rejected": -74.38287235736847, + "epoch": 0.404543332814688, + "step": 390 + }, + { + "loss": 0.43750705718994143, + "grad_norm": 0.014688065275549889, + "learning_rate": 5.865284974093265e-06, + "entropy": 0.8005011603605817, + "num_tokens": 26825159.0, + "logits/chosen": -1.4366348824569963, + "logits/rejected": -1.1432329035500064, + "mean_token_accuracy": 0.7120773574337363, + "rewards/chosen": -0.7654138012278418, + "rewards/rejected": -1.9986112341369153, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.2331974321743473, + "logps/chosen": -59.77998896837234, + "logps/rejected": -74.2601730799675, + "epoch": 0.4149162387842954, + "step": 400 + }, + { + "loss": 0.4483372211456299, + "grad_norm": 0.01656300760805607, + "learning_rate": 5.761658031088083e-06, + "entropy": 0.7781640422128839, + "num_tokens": 27495663.0, + "logits/chosen": -1.469463162115489, + "logits/rejected": -1.1635286970905576, + "mean_token_accuracy": 0.7104245729371905, + "rewards/chosen": -0.7733871162302784, + "rewards/rejected": -2.009647502012085, + "rewards/accuracies": 0.7775, + "rewards/margins": 1.236260382984765, + "logps/chosen": -59.314085538387296, + "logps/rejected": -73.74020329475402, + "epoch": 0.4252891447539028, + "step": 410 + }, + { + "loss": 0.40839343070983886, + "grad_norm": 0.014693827368319035, + "learning_rate": 5.658031088082902e-06, + "entropy": 0.7646654536006827, + "num_tokens": 28167389.0, + "logits/chosen": -1.5559907884752369, + "logits/rejected": -1.2529527889366994, + "mean_token_accuracy": 0.7122585397399962, + "rewards/chosen": -0.812723506633156, + "rewards/rejected": -2.2211731961916668, + "rewards/accuracies": 0.8325, + "rewards/margins": 1.4084496867936105, + "logps/chosen": -61.519875913858414, + "logps/rejected": -76.1291908788681, + "epoch": 0.4356620507235102, + "step": 420 + }, + { + "loss": 0.4050635814666748, + "grad_norm": 0.014569880440831184, + "learning_rate": 5.554404145077721e-06, + "entropy": 0.7813236166906427, + "num_tokens": 28839388.0, + "logits/chosen": -1.4355108492016981, + "logits/rejected": -1.1415682707849564, + "mean_token_accuracy": 0.7073199293017387, + "rewards/chosen": -0.8523474504226578, + "rewards/rejected": -2.3254094777817955, + "rewards/accuracies": 0.82, + "rewards/margins": 1.4730620284751057, + "logps/chosen": -60.116721353530885, + "logps/rejected": -76.6921053647995, + "epoch": 0.4460349566931176, + "step": 430 + }, + { + "loss": 0.40834870338439944, + "grad_norm": 0.01712818816304207, + "learning_rate": 5.4507772020725395e-06, + "entropy": 0.7444785924613825, + "num_tokens": 29510096.0, + "logits/chosen": -1.6494087471154035, + "logits/rejected": -1.2686231425397783, + "mean_token_accuracy": 0.7219790226966143, + "rewards/chosen": -0.9436784289986826, + "rewards/rejected": -2.380959646940464, + "rewards/accuracies": 0.82875, + "rewards/margins": 1.4372812157822772, + "logps/chosen": -59.11840226888657, + "logps/rejected": -76.61158362627029, + "epoch": 0.456407862662725, + "step": 440 + }, + { + "loss": 0.44087815284729004, + "grad_norm": 0.022262893617153168, + "learning_rate": 5.347150259067357e-06, + "entropy": 0.7486801335980999, + "num_tokens": 30181792.0, + "logits/chosen": -1.6525915875287975, + "logits/rejected": -1.292702118780194, + "mean_token_accuracy": 0.7041960602998734, + "rewards/chosen": -1.0031295236017104, + "rewards/rejected": -2.4976175978421815, + "rewards/accuracies": 0.805, + "rewards/margins": 1.4944880706071855, + "logps/chosen": -61.45527629375458, + "logps/rejected": -78.80332666873932, + "epoch": 0.46678076863233237, + "step": 450 + }, + { + "loss": 0.41168813705444335, + "grad_norm": 0.01639724150300026, + "learning_rate": 5.243523316062177e-06, + "entropy": 0.7348720514599699, + "num_tokens": 30851409.0, + "logits/chosen": -1.6804476245129396, + "logits/rejected": -1.3568483163933152, + "mean_token_accuracy": 0.7089731366932392, + "rewards/chosen": -0.9868619644123828, + "rewards/rejected": -2.5387522551673465, + "rewards/accuracies": 0.8125, + "rewards/margins": 1.5518902849871665, + "logps/chosen": -61.486987377405164, + "logps/rejected": -78.15051867246628, + "epoch": 0.47715367460193975, + "step": 460 + }, + { + "loss": 0.44434194564819335, + "grad_norm": 0.021561825647950172, + "learning_rate": 5.139896373056995e-06, + "entropy": 0.7410113723303948, + "num_tokens": 31519564.0, + "logits/chosen": -1.640166155420613, + "logits/rejected": -1.3236098037357882, + "mean_token_accuracy": 0.7085670954920351, + "rewards/chosen": -0.9577470733088558, + "rewards/rejected": -2.3723132372720284, + "rewards/accuracies": 0.80125, + "rewards/margins": 1.4145661635301077, + "logps/chosen": -59.36082991600037, + "logps/rejected": -74.87610804796219, + "epoch": 0.48752658057154713, + "step": 470 + }, + { + "loss": 0.4187155723571777, + "grad_norm": 0.015293825417757034, + "learning_rate": 5.036269430051814e-06, + "entropy": 0.819734820156591, + "num_tokens": 32192056.0, + "logits/chosen": -1.4117972345061844, + "logits/rejected": -1.1251919844105895, + "mean_token_accuracy": 0.699143321532756, + "rewards/chosen": -0.827813671599506, + "rewards/rejected": -2.1753858611593024, + "rewards/accuracies": 0.82125, + "rewards/margins": 1.347572191953659, + "logps/chosen": -62.310746512413026, + "logps/rejected": -76.46800751209258, + "epoch": 0.4978994865411545, + "step": 480 + }, + { + "loss": 0.41543288230895997, + "grad_norm": 0.016549421474337578, + "learning_rate": 4.932642487046633e-06, + "entropy": 0.793799487358192, + "num_tokens": 32864077.0, + "logits/chosen": -1.45461478674727, + "logits/rejected": -1.1643940857008355, + "mean_token_accuracy": 0.7187336018308997, + "rewards/chosen": -0.8021746008354603, + "rewards/rejected": -2.22868984402754, + "rewards/accuracies": 0.82, + "rewards/margins": 1.4265152450464667, + "logps/chosen": -58.781578176021576, + "logps/rejected": -78.34760097026825, + "epoch": 0.5082723925107618, + "step": 490 + }, + { + "loss": 0.4357460498809814, + "grad_norm": 0.015738829970359802, + "learning_rate": 4.829015544041451e-06, + "entropy": 0.7886733054189244, + "num_tokens": 33534279.0, + "logits/chosen": -1.482443230472497, + "logits/rejected": -1.1571150498996416, + "mean_token_accuracy": 0.7196742885001004, + "rewards/chosen": -0.7262393125944072, + "rewards/rejected": -2.081412044418103, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.3551727333851158, + "logps/chosen": -56.740478208065035, + "logps/rejected": -74.49606896877289, + "epoch": 0.5186452984803692, + "step": 500 + }, + { + "eval_loss": 0.42026275396347046, + "eval_runtime": 281.7739, + "eval_samples_per_second": 3.549, + "eval_steps_per_second": 3.549, + "eval_entropy": 0.7882621039540972, + "eval_num_tokens": 33534279.0, + "eval_logits/chosen": -1.4541776191798497, + "eval_logits/rejected": -1.1470192806607813, + "eval_mean_token_accuracy": 0.7118717866092921, + "eval_rewards/chosen": -0.7887642608310853, + "eval_rewards/rejected": -2.164067000001669, + "eval_rewards/accuracies": 0.818, + "eval_rewards/margins": 1.3753027384020389, + "eval_logps/chosen": -58.06062930107117, + "eval_logps/rejected": -74.28054134368897, + "epoch": 0.5186452984803692, + "step": 500 + }, + { + "loss": 0.4276765823364258, + "grad_norm": 0.014744630083441734, + "learning_rate": 4.72538860103627e-06, + "entropy": 0.7855714731411717, + "num_tokens": 34205135.0, + "logits/chosen": -1.4180048717028029, + "logits/rejected": -1.1214338358385025, + "mean_token_accuracy": 0.7126064065098763, + "rewards/chosen": -0.82133626240171, + "rewards/rejected": -2.191293025066843, + "rewards/accuracies": 0.8175, + "rewards/margins": 1.3699567627965008, + "logps/chosen": -59.999370622634885, + "logps/rejected": -74.11055833339691, + "epoch": 0.5290182044499767, + "step": 510 + }, + { + "loss": 0.4480290412902832, + "grad_norm": 0.016974102705717087, + "learning_rate": 4.621761658031089e-06, + "entropy": 0.7657113060192206, + "num_tokens": 34873976.0, + "logits/chosen": -1.4652295046030377, + "logits/rejected": -1.1381464982050828, + "mean_token_accuracy": 0.7193653728254139, + "rewards/chosen": -0.8232743983055844, + "rewards/rejected": -2.115962935181451, + "rewards/accuracies": 0.79, + "rewards/margins": 1.2926885320199653, + "logps/chosen": -57.11219574928284, + "logps/rejected": -72.7778330230713, + "epoch": 0.5393911104195841, + "step": 520 + }, + { + "loss": 0.4185093879699707, + "grad_norm": 0.014205333776772022, + "learning_rate": 4.518134715025907e-06, + "entropy": 0.8013994769033161, + "num_tokens": 35544999.0, + "logits/chosen": -1.471904915902926, + "logits/rejected": -1.1525475558082925, + "mean_token_accuracy": 0.7086275420710444, + "rewards/chosen": -0.821920394521876, + "rewards/rejected": -2.3078401576905163, + "rewards/accuracies": 0.8275, + "rewards/margins": 1.4859197605680674, + "logps/chosen": -60.18735828638077, + "logps/rejected": -76.90893436431885, + "epoch": 0.5497640163891915, + "step": 530 + }, + { + "loss": 0.43764190673828124, + "grad_norm": 0.01859429106116295, + "learning_rate": 4.414507772020726e-06, + "entropy": 0.8030325107637327, + "num_tokens": 36215629.0, + "logits/chosen": -1.3828510403033027, + "logits/rejected": -1.1259861866767447, + "mean_token_accuracy": 0.7117785899341107, + "rewards/chosen": -0.8377752207776211, + "rewards/rejected": -2.164465318453731, + "rewards/accuracies": 0.8325, + "rewards/margins": 1.3266900933114811, + "logps/chosen": -59.40348263263702, + "logps/rejected": -73.95402544498444, + "epoch": 0.5601369223587989, + "step": 540 + }, + { + "loss": 0.43619637489318847, + "grad_norm": 0.022518545389175415, + "learning_rate": 4.310880829015544e-06, + "entropy": 0.8470213223638712, + "num_tokens": 36888235.0, + "logits/chosen": -1.3614448333016513, + "logits/rejected": -1.0777429963848568, + "mean_token_accuracy": 0.7116067171096802, + "rewards/chosen": -0.8179999309696723, + "rewards/rejected": -2.2714405926934886, + "rewards/accuracies": 0.8025, + "rewards/margins": 1.453440659949556, + "logps/chosen": -61.603306529521944, + "logps/rejected": -78.86535804271698, + "epoch": 0.5705098283284062, + "step": 550 + }, + { + "loss": 0.4372966766357422, + "grad_norm": 0.017818979918956757, + "learning_rate": 4.207253886010363e-06, + "entropy": 0.8097228137392085, + "num_tokens": 37560215.0, + "logits/chosen": -1.4065342416818991, + "logits/rejected": -1.1310520368013937, + "mean_token_accuracy": 0.7106514018215239, + "rewards/chosen": -0.7871383707236419, + "rewards/rejected": -2.1830000240239316, + "rewards/accuracies": 0.79375, + "rewards/margins": 1.3958616532059387, + "logps/chosen": -59.665771260261536, + "logps/rejected": -74.6952103304863, + "epoch": 0.5808827342980136, + "step": 560 + }, + { + "loss": 0.4129640102386475, + "grad_norm": 0.01815822720527649, + "learning_rate": 4.103626943005182e-06, + "entropy": 0.7890104844880989, + "num_tokens": 38229872.0, + "logits/chosen": -1.4210442868235984, + "logits/rejected": -1.1203699372972569, + "mean_token_accuracy": 0.7099655389133841, + "rewards/chosen": -0.8200407591336989, + "rewards/rejected": -2.2342929665278644, + "rewards/accuracies": 0.83, + "rewards/margins": 1.4142522051371633, + "logps/chosen": -59.6181519818306, + "logps/rejected": -74.29007930994034, + "epoch": 0.591255640267621, + "step": 570 + }, + { + "loss": 0.4248640537261963, + "grad_norm": 0.021521631628274918, + "learning_rate": 4.000000000000001e-06, + "entropy": 0.7830230033496628, + "num_tokens": 38898599.0, + "logits/chosen": -1.556829666838658, + "logits/rejected": -1.22248957027324, + "mean_token_accuracy": 0.7121115596592427, + "rewards/chosen": -0.8376483802072471, + "rewards/rejected": -2.30365946133883, + "rewards/accuracies": 0.82, + "rewards/margins": 1.466011079289019, + "logps/chosen": -57.19522080659866, + "logps/rejected": -74.76314610958099, + "epoch": 0.6016285462372284, + "step": 580 + }, + { + "loss": 0.46982684135437014, + "grad_norm": 0.0202327873557806, + "learning_rate": 3.896373056994819e-06, + "entropy": 0.789131090187293, + "num_tokens": 39570011.0, + "logits/chosen": -1.4979756501997874, + "logits/rejected": -1.2087421360795596, + "mean_token_accuracy": 0.7092419915273785, + "rewards/chosen": -0.9460587426692837, + "rewards/rejected": -2.2724328075315863, + "rewards/accuracies": 0.77125, + "rewards/margins": 1.3263740684324876, + "logps/chosen": -61.68762954473495, + "logps/rejected": -76.94917388081551, + "epoch": 0.6120014522068358, + "step": 590 + }, + { + "loss": 0.4296851634979248, + "grad_norm": 0.023099711164832115, + "learning_rate": 3.7927461139896377e-06, + "entropy": 0.7784710348435329, + "num_tokens": 40238459.0, + "logits/chosen": -1.5463305650925598, + "logits/rejected": -1.1855332843764201, + "mean_token_accuracy": 0.7213506529480219, + "rewards/chosen": -0.7897813039762969, + "rewards/rejected": -2.1785082579992014, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.388726954490412, + "logps/chosen": -55.0355699801445, + "logps/rejected": -74.42590669631959, + "epoch": 0.6223743581764432, + "step": 600 + }, + { + "loss": 0.4378302574157715, + "grad_norm": 0.017044473439455032, + "learning_rate": 3.6891191709844567e-06, + "entropy": 0.8122139454813442, + "num_tokens": 40907823.0, + "logits/chosen": -1.4782042004502953, + "logits/rejected": -1.1733026566264682, + "mean_token_accuracy": 0.7134785779751838, + "rewards/chosen": -0.7893356951180612, + "rewards/rejected": -2.1324991090265395, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.3431634148815648, + "logps/chosen": -56.50307439565658, + "logps/rejected": -74.36804901599884, + "epoch": 0.6327472641460505, + "step": 610 + }, + { + "loss": 0.42770676612854003, + "grad_norm": 0.017237193882465363, + "learning_rate": 3.5854922279792748e-06, + "entropy": 0.7561554417069419, + "num_tokens": 41576629.0, + "logits/chosen": -1.5855324711359189, + "logits/rejected": -1.2464155038601519, + "mean_token_accuracy": 0.7195479864627123, + "rewards/chosen": -0.7948263869498987, + "rewards/rejected": -2.2129694822058084, + "rewards/accuracies": 0.81375, + "rewards/margins": 1.4181430943030864, + "logps/chosen": -55.47762014627457, + "logps/rejected": -74.27213495016098, + "epoch": 0.6431201701156579, + "step": 620 + }, + { + "eval_loss": 0.4145970344543457, + "eval_runtime": 312.4458, + "eval_samples_per_second": 3.201, + "eval_steps_per_second": 3.201, + "eval_entropy": 0.7926596267716959, + "eval_num_tokens": 41911681.0, + "eval_logits/chosen": -1.5117800904965717, + "eval_logits/rejected": -1.196360660912854, + "eval_mean_token_accuracy": 0.7107393295019865, + "eval_rewards/chosen": -0.7929535148476134, + "eval_rewards/rejected": -2.2358115541365695, + "eval_rewards/accuracies": 0.82, + "eval_rewards/margins": 1.442858038464561, + "eval_logps/chosen": -58.102521854400635, + "eval_logps/rejected": -74.9979869003296, + "epoch": 0.6483066231004616, + "step": 625 + }, + { + "loss": 0.4174999713897705, + "grad_norm": 0.023992126807570457, + "learning_rate": 3.4818652849740937e-06, + "entropy": 0.7907538907864364, + "num_tokens": 42247859.0, + "logits/chosen": -1.5275107018411662, + "logits/rejected": -1.1729716012203115, + "mean_token_accuracy": 0.7168286069855094, + "rewards/chosen": -0.785840036013833, + "rewards/rejected": -2.3167090034011926, + "rewards/accuracies": 0.82, + "rewards/margins": 1.5308689690474422, + "logps/chosen": -56.834257082939146, + "logps/rejected": -78.19684539794922, + "epoch": 0.6534930760852653, + "step": 630 + }, + { + "loss": 0.4136983394622803, + "grad_norm": 0.017943687736988068, + "learning_rate": 3.3782383419689123e-06, + "entropy": 0.782110237882007, + "num_tokens": 42918160.0, + "logits/chosen": -1.5180649119494551, + "logits/rejected": -1.1926738964700518, + "mean_token_accuracy": 0.7150443252548575, + "rewards/chosen": -0.8211558357491231, + "rewards/rejected": -2.2642588213164707, + "rewards/accuracies": 0.82875, + "rewards/margins": 1.4431029830686748, + "logps/chosen": -56.69160728216171, + "logps/rejected": -77.15469831943511, + "epoch": 0.6638659820548727, + "step": 640 + }, + { + "loss": 0.46654863357543946, + "grad_norm": 0.016258180141448975, + "learning_rate": 3.274611398963731e-06, + "entropy": 0.781107221354032, + "num_tokens": 43587843.0, + "logits/chosen": -1.5242385121688045, + "logits/rejected": -1.2121969127570629, + "mean_token_accuracy": 0.7117258696630597, + "rewards/chosen": -0.8765105128889991, + "rewards/rejected": -2.300915027359915, + "rewards/accuracies": 0.79625, + "rewards/margins": 1.4244045152794569, + "logps/chosen": -58.10146237373352, + "logps/rejected": -75.90745508432389, + "epoch": 0.6742388880244801, + "step": 650 + }, + { + "loss": 0.46282315254211426, + "grad_norm": 0.014686384238302708, + "learning_rate": 3.1709844559585493e-06, + "entropy": 0.7962630777983577, + "num_tokens": 44256661.0, + "logits/chosen": -1.4734712758844637, + "logits/rejected": -1.1916934080775792, + "mean_token_accuracy": 0.7055912931449712, + "rewards/chosen": -0.7513918488781929, + "rewards/rejected": -2.0676744230859914, + "rewards/accuracies": 0.8025, + "rewards/margins": 1.316282574729994, + "logps/chosen": -57.497248324155805, + "logps/rejected": -72.39635850191117, + "epoch": 0.6846117939940874, + "step": 660 + }, + { + "loss": 0.38728673458099366, + "grad_norm": 0.012905064970254898, + "learning_rate": 3.0673575129533683e-06, + "entropy": 0.7850103608728386, + "num_tokens": 44928208.0, + "logits/chosen": -1.4906549367707287, + "logits/rejected": -1.1785130829765196, + "mean_token_accuracy": 0.7167331029660999, + "rewards/chosen": -0.729108623168795, + "rewards/rejected": -2.2293507476183003, + "rewards/accuracies": 0.835, + "rewards/margins": 1.500242124721408, + "logps/chosen": -57.06263860464096, + "logps/rejected": -75.03939726114272, + "epoch": 0.6949846999636948, + "step": 670 + }, + { + "loss": 0.42326745986938474, + "grad_norm": 0.020321018993854523, + "learning_rate": 2.963730569948187e-06, + "entropy": 0.8228285726247122, + "num_tokens": 45599959.0, + "logits/chosen": -1.4107692209920355, + "logits/rejected": -1.1415338745002617, + "mean_token_accuracy": 0.7098798759281635, + "rewards/chosen": -0.7472892588960599, + "rewards/rejected": -2.205724095766054, + "rewards/accuracies": 0.82, + "rewards/margins": 1.4584348343219609, + "logps/chosen": -60.79011604785919, + "logps/rejected": -76.145639398098, + "epoch": 0.7053576059333022, + "step": 680 + }, + { + "loss": 0.46504626274108884, + "grad_norm": 0.026528460904955864, + "learning_rate": 2.8601036269430053e-06, + "entropy": 0.8374029883276671, + "num_tokens": 46271100.0, + "logits/chosen": -1.438753673313662, + "logits/rejected": -1.1758532082539777, + "mean_token_accuracy": 0.7012219382543117, + "rewards/chosen": -0.8035630289492474, + "rewards/rejected": -2.1134093309140733, + "rewards/accuracies": 0.78875, + "rewards/margins": 1.3098462954116985, + "logps/chosen": -60.888806674480435, + "logps/rejected": -75.00253082275391, + "epoch": 0.7157305119029096, + "step": 690 + }, + { + "loss": 0.3986149072647095, + "grad_norm": 0.014411377720534801, + "learning_rate": 2.7564766839378243e-06, + "entropy": 0.8010915271285921, + "num_tokens": 46940588.0, + "logits/chosen": -1.4958920674077623, + "logits/rejected": -1.1794351626729602, + "mean_token_accuracy": 0.7159527142904699, + "rewards/chosen": -0.7098511749218233, + "rewards/rejected": -2.1309537043143063, + "rewards/accuracies": 0.83, + "rewards/margins": 1.4211025240272284, + "logps/chosen": -58.82859611272812, + "logps/rejected": -71.86115275144577, + "epoch": 0.726103417872517, + "step": 700 + }, + { + "loss": 0.43906688690185547, + "grad_norm": 0.01570284552872181, + "learning_rate": 2.6528497409326424e-06, + "entropy": 0.7988389390867087, + "num_tokens": 47612649.0, + "logits/chosen": -1.5084893760106768, + "logits/rejected": -1.2217334834194045, + "mean_token_accuracy": 0.7133530013635755, + "rewards/chosen": -0.7729418969854669, + "rewards/rejected": -2.181924787040334, + "rewards/accuracies": 0.795, + "rewards/margins": 1.4089828893507366, + "logps/chosen": -61.10609317064285, + "logps/rejected": -74.83846760034561, + "epoch": 0.7364763238421244, + "step": 710 + }, + { + "loss": 0.40947885513305665, + "grad_norm": 0.023827839642763138, + "learning_rate": 2.5492227979274614e-06, + "entropy": 0.7832058588406653, + "num_tokens": 48280316.0, + "logits/chosen": -1.5411506649745486, + "logits/rejected": -1.2429037100661278, + "mean_token_accuracy": 0.7112616512458771, + "rewards/chosen": -0.6660112939180545, + "rewards/rejected": -2.1130318040723797, + "rewards/accuracies": 0.82375, + "rewards/margins": 1.4470205087191426, + "logps/chosen": -56.754196836948395, + "logps/rejected": -72.01071586370468, + "epoch": 0.7468492298117317, + "step": 720 + }, + { + "loss": 0.4252438545227051, + "grad_norm": 0.016843726858496666, + "learning_rate": 2.44559585492228e-06, + "entropy": 0.8381482209177921, + "num_tokens": 48952457.0, + "logits/chosen": -1.4216991849843164, + "logits/rejected": -1.1461203116135463, + "mean_token_accuracy": 0.7074375116080046, + "rewards/chosen": -0.6695640615803495, + "rewards/rejected": -2.0397114378174592, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.3701473774015904, + "logps/chosen": -58.40614979505539, + "logps/rejected": -75.83607840061188, + "epoch": 0.7572221357813391, + "step": 730 + }, + { + "loss": 0.42221574783325194, + "grad_norm": 0.016754452139139175, + "learning_rate": 2.3419689119170984e-06, + "entropy": 0.8271626771151205, + "num_tokens": 49623039.0, + "logits/chosen": -1.5209721524713908, + "logits/rejected": -1.1751758197782376, + "mean_token_accuracy": 0.713498560115695, + "rewards/chosen": -0.693279623198905, + "rewards/rejected": -2.141712246098032, + "rewards/accuracies": 0.8225, + "rewards/margins": 1.448432622421533, + "logps/chosen": -58.120414593219756, + "logps/rejected": -76.37068503379822, + "epoch": 0.7675950417509465, + "step": 740 + }, + { + "loss": 0.42609853744506837, + "grad_norm": 0.015460499562323093, + "learning_rate": 2.2383419689119174e-06, + "entropy": 0.8402992183688912, + "num_tokens": 50296449.0, + "logits/chosen": -1.4753382490797897, + "logits/rejected": -1.1819095770610415, + "mean_token_accuracy": 0.7086446931585669, + "rewards/chosen": -0.756505029114196, + "rewards/rejected": -2.2547341962716017, + "rewards/accuracies": 0.815, + "rewards/margins": 1.4982291649701074, + "logps/chosen": -61.22059069037437, + "logps/rejected": -78.80186176776886, + "epoch": 0.7779679477205539, + "step": 750 + }, + { + "eval_loss": 0.411579966545105, + "eval_runtime": 345.2282, + "eval_samples_per_second": 2.897, + "eval_steps_per_second": 2.897, + "eval_entropy": 0.7931306820721366, + "eval_num_tokens": 50296449.0, + "eval_logits/chosen": -1.5620700320679246, + "eval_logits/rejected": -1.2442960317998197, + "eval_mean_token_accuracy": 0.7116911947578192, + "eval_rewards/chosen": -0.7726080814675516, + "eval_rewards/rejected": -2.2532580847712236, + "eval_rewards/accuracies": 0.825, + "eval_rewards/margins": 1.4806500013172625, + "eval_logps/chosen": -57.89906752586365, + "eval_logps/rejected": -75.1724522151947, + "epoch": 0.7779679477205539, + "step": 750 + }, + { + "loss": 0.3913722515106201, + "grad_norm": 0.014632239006459713, + "learning_rate": 2.134715025906736e-06, + "entropy": 0.8136140358856937, + "num_tokens": 50967491.0, + "logits/chosen": -1.562353067996462, + "logits/rejected": -1.2513613833271493, + "mean_token_accuracy": 0.7093207446113229, + "rewards/chosen": -0.7712609519985927, + "rewards/rejected": -2.253486830406473, + "rewards/accuracies": 0.84375, + "rewards/margins": 1.4822258768649772, + "logps/chosen": -59.60826306819916, + "logps/rejected": -76.35254566431045, + "epoch": 0.7883408536901613, + "step": 760 + }, + { + "loss": 0.40571393966674807, + "grad_norm": 0.025566810742020607, + "learning_rate": 2.0310880829015544e-06, + "entropy": 0.8285544535657391, + "num_tokens": 51641328.0, + "logits/chosen": -1.522793583175992, + "logits/rejected": -1.1822050205320058, + "mean_token_accuracy": 0.7068053354136645, + "rewards/chosen": -0.7923616364665214, + "rewards/rejected": -2.37010533751054, + "rewards/accuracies": 0.81375, + "rewards/margins": 1.5777437023073435, + "logps/chosen": -61.9151118016243, + "logps/rejected": -79.94920246601104, + "epoch": 0.7987137596597687, + "step": 770 + }, + { + "loss": 0.4391521453857422, + "grad_norm": 0.016789298504590988, + "learning_rate": 1.9274611398963734e-06, + "entropy": 0.7836550371508929, + "num_tokens": 52311665.0, + "logits/chosen": -1.6191126859645035, + "logits/rejected": -1.29179419660706, + "mean_token_accuracy": 0.7130378339067102, + "rewards/chosen": -0.8251502061705105, + "rewards/rejected": -2.330989454947412, + "rewards/accuracies": 0.81375, + "rewards/margins": 1.5058392491098493, + "logps/chosen": -58.14819228887558, + "logps/rejected": -76.84343997001648, + "epoch": 0.809086665629376, + "step": 780 + }, + { + "loss": 0.4155034065246582, + "grad_norm": 0.015209637582302094, + "learning_rate": 1.823834196891192e-06, + "entropy": 0.816227734730055, + "num_tokens": 52982847.0, + "logits/chosen": -1.552296107544077, + "logits/rejected": -1.2655800747433517, + "mean_token_accuracy": 0.7077531234174966, + "rewards/chosen": -0.7692844783003966, + "rewards/rejected": -2.2729846961359725, + "rewards/accuracies": 0.81625, + "rewards/margins": 1.5037002183427104, + "logps/chosen": -59.88701428174973, + "logps/rejected": -75.7218120956421, + "epoch": 0.8194595715989834, + "step": 790 + }, + { + "loss": 0.4396702289581299, + "grad_norm": 0.017707331106066704, + "learning_rate": 1.7202072538860104e-06, + "entropy": 0.8157146892453602, + "num_tokens": 53653414.0, + "logits/chosen": -1.5836949831528315, + "logits/rejected": -1.2884593526275128, + "mean_token_accuracy": 0.7132340743020177, + "rewards/chosen": -0.7823633211505876, + "rewards/rejected": -2.2281043492229764, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.4457410290511326, + "logps/chosen": -59.43502898097038, + "logps/rejected": -75.63278030633927, + "epoch": 0.8298324775685908, + "step": 800 + }, + { + "loss": 0.4166680335998535, + "grad_norm": 0.017773514613509178, + "learning_rate": 1.6165803108808292e-06, + "entropy": 0.797488763818983, + "num_tokens": 54324247.0, + "logits/chosen": -1.6215031533790736, + "logits/rejected": -1.3289979163820846, + "mean_token_accuracy": 0.7087218741327524, + "rewards/chosen": -0.761779917108106, + "rewards/rejected": -2.309470071569667, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.5476901544816792, + "logps/chosen": -58.93250516653061, + "logps/rejected": -76.49902043104171, + "epoch": 0.8402053835381982, + "step": 810 + }, + { + "loss": 0.4239467144012451, + "grad_norm": 0.018757648766040802, + "learning_rate": 1.5129533678756477e-06, + "entropy": 0.8032379890448647, + "num_tokens": 54994016.0, + "logits/chosen": -1.578882165777075, + "logits/rejected": -1.2860967628921216, + "mean_token_accuracy": 0.7140155434235931, + "rewards/chosen": -0.7499237745841674, + "rewards/rejected": -2.2461700457381086, + "rewards/accuracies": 0.82375, + "rewards/margins": 1.496246272022836, + "logps/chosen": -58.89809783697128, + "logps/rejected": -74.08916418790817, + "epoch": 0.8505782895078056, + "step": 820 + }, + { + "loss": 0.419736909866333, + "grad_norm": 0.018885280936956406, + "learning_rate": 1.4093264248704663e-06, + "entropy": 0.7875165941729211, + "num_tokens": 55663818.0, + "logits/chosen": -1.6236698629206843, + "logits/rejected": -1.2788538558527598, + "mean_token_accuracy": 0.7192669866792858, + "rewards/chosen": -0.7543148858308633, + "rewards/rejected": -2.269310671926214, + "rewards/accuracies": 0.8075, + "rewards/margins": 1.5149957838421688, + "logps/chosen": -55.762867684364316, + "logps/rejected": -76.66288559436798, + "epoch": 0.860951195477413, + "step": 830 + }, + { + "loss": 0.4073533058166504, + "grad_norm": 0.01915486343204975, + "learning_rate": 1.3056994818652852e-06, + "entropy": 0.8327871753677027, + "num_tokens": 56334476.0, + "logits/chosen": -1.4996538615666455, + "logits/rejected": -1.237756981594407, + "mean_token_accuracy": 0.716468540597707, + "rewards/chosen": -0.7192282251862707, + "rewards/rejected": -2.26593919366569, + "rewards/accuracies": 0.82875, + "rewards/margins": 1.5467109655588864, + "logps/chosen": -59.84484759330749, + "logps/rejected": -76.10131199359894, + "epoch": 0.8713241014470204, + "step": 840 + }, + { + "loss": 0.42834720611572263, + "grad_norm": 0.01567392610013485, + "learning_rate": 1.2020725388601037e-06, + "entropy": 0.827671511786757, + "num_tokens": 57005010.0, + "logits/chosen": -1.5224089619857955, + "logits/rejected": -1.203097930514173, + "mean_token_accuracy": 0.7094048094563186, + "rewards/chosen": -0.8032524040471617, + "rewards/rejected": -2.2959909180374236, + "rewards/accuracies": 0.8, + "rewards/margins": 1.4927385161118583, + "logps/chosen": -60.616187605857846, + "logps/rejected": -76.86470454216004, + "epoch": 0.8816970074166278, + "step": 850 + }, + { + "loss": 0.4034994602203369, + "grad_norm": 0.014525278471410275, + "learning_rate": 1.0984455958549225e-06, + "entropy": 0.818393541239202, + "num_tokens": 57677536.0, + "logits/chosen": -1.543480139299166, + "logits/rejected": -1.2204454822419504, + "mean_token_accuracy": 0.7158707704581321, + "rewards/chosen": -0.7887829605976913, + "rewards/rejected": -2.3561961521262127, + "rewards/accuracies": 0.82125, + "rewards/margins": 1.5674131939606741, + "logps/chosen": -60.70202103614807, + "logps/rejected": -77.77336375951766, + "epoch": 0.8920699133862352, + "step": 860 + }, + { + "loss": 0.432753324508667, + "grad_norm": 0.02228359691798687, + "learning_rate": 9.94818652849741e-07, + "entropy": 0.8074402804669808, + "num_tokens": 58349497.0, + "logits/chosen": -1.558037182784836, + "logits/rejected": -1.2543498522866354, + "mean_token_accuracy": 0.703925465606153, + "rewards/chosen": -0.805554041202995, + "rewards/rejected": -2.2746161510888485, + "rewards/accuracies": 0.835, + "rewards/margins": 1.4690621069492773, + "logps/chosen": -62.29052616596222, + "logps/rejected": -75.3348803281784, + "epoch": 0.9024428193558426, + "step": 870 + }, + { + "eval_loss": 0.4090946316719055, + "eval_runtime": 375.2006, + "eval_samples_per_second": 2.665, + "eval_steps_per_second": 2.665, + "eval_entropy": 0.7924561413838528, + "eval_num_tokens": 58685036.0, + "eval_logits/chosen": -1.5811667035215011, + "eval_logits/rejected": -1.2610527832956517, + "eval_mean_token_accuracy": 0.7133496539741755, + "eval_rewards/chosen": -0.7897945828609518, + "eval_rewards/rejected": -2.3197074431839866, + "eval_rewards/accuracies": 0.828, + "eval_rewards/margins": 1.5299128606393932, + "eval_logps/chosen": -58.07093252563477, + "eval_logps/rejected": -75.83694574356079, + "epoch": 0.9076292723406463, + "step": 875 + }, + { + "loss": 0.39424493312835696, + "grad_norm": 0.013235539197921753, + "learning_rate": 8.911917098445596e-07, + "entropy": 0.7996839477901813, + "num_tokens": 59020756.0, + "logits/chosen": -1.5843618404439912, + "logits/rejected": -1.2211371427803261, + "mean_token_accuracy": 0.7160469963587821, + "rewards/chosen": -0.7639252483138261, + "rewards/rejected": -2.3575840306148166, + "rewards/accuracies": 0.82625, + "rewards/margins": 1.5936587833426892, + "logps/chosen": -57.04736487388611, + "logps/rejected": -79.49960944414138, + "epoch": 0.91281572532545, + "step": 880 + }, + { + "loss": 0.4502077102661133, + "grad_norm": 0.016691625118255615, + "learning_rate": 7.875647668393784e-07, + "entropy": 0.7824898976105032, + "num_tokens": 59691542.0, + "logits/chosen": -1.6007244896342394, + "logits/rejected": -1.2807950876104501, + "mean_token_accuracy": 0.7142804705537855, + "rewards/chosen": -0.8533335844849352, + "rewards/rejected": -2.263447732278146, + "rewards/accuracies": 0.80875, + "rewards/margins": 1.4101141486410051, + "logps/chosen": -58.45585764169693, + "logps/rejected": -76.72949911355973, + "epoch": 0.9231886312950573, + "step": 890 + }, + { + "loss": 0.40724778175354004, + "grad_norm": 0.019250568002462387, + "learning_rate": 6.839378238341969e-07, + "entropy": 0.819874558126321, + "num_tokens": 60363238.0, + "logits/chosen": -1.5555056418182593, + "logits/rejected": -1.2092615978992753, + "mean_token_accuracy": 0.7146024034544826, + "rewards/chosen": -0.8092134252478718, + "rewards/rejected": -2.3746094698365776, + "rewards/accuracies": 0.8225, + "rewards/margins": 1.565396042652428, + "logps/chosen": -58.4417240858078, + "logps/rejected": -80.7738204741478, + "epoch": 0.9335615372646647, + "step": 900 + }, + { + "loss": 0.4182878971099854, + "grad_norm": 0.02170160599052906, + "learning_rate": 5.803108808290156e-07, + "entropy": 0.8145798404130619, + "num_tokens": 61034470.0, + "logits/chosen": -1.5395043610571841, + "logits/rejected": -1.2172720667091816, + "mean_token_accuracy": 0.7149157860130072, + "rewards/chosen": -0.8415973563533043, + "rewards/rejected": -2.4253665239037945, + "rewards/accuracies": 0.81, + "rewards/margins": 1.5837691660691053, + "logps/chosen": -58.98787801384926, + "logps/rejected": -78.09846720218658, + "epoch": 0.9439344432342721, + "step": 910 + }, + { + "loss": 0.42937483787536623, + "grad_norm": 0.014422536827623844, + "learning_rate": 4.7668393782383424e-07, + "entropy": 0.7941974463209044, + "num_tokens": 61703303.0, + "logits/chosen": -1.5714764751371695, + "logits/rejected": -1.2391417194541616, + "mean_token_accuracy": 0.7113890647143125, + "rewards/chosen": -0.8099557375663425, + "rewards/rejected": -2.294640830200858, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.4846850905031896, + "logps/chosen": -56.28238318800926, + "logps/rejected": -74.58795207023621, + "epoch": 0.9543073492038795, + "step": 920 + }, + { + "loss": 0.40997958183288574, + "grad_norm": 0.02402566932141781, + "learning_rate": 3.730569948186528e-07, + "entropy": 0.8154971726459916, + "num_tokens": 62375816.0, + "logits/chosen": -1.545892127215608, + "logits/rejected": -1.2600055196671498, + "mean_token_accuracy": 0.704818404596299, + "rewards/chosen": -0.7739588160630956, + "rewards/rejected": -2.308201268577832, + "rewards/accuracies": 0.8175, + "rewards/margins": 1.5342424516985194, + "logps/chosen": -60.89072738647461, + "logps/rejected": -77.38187520503998, + "epoch": 0.9646802551734869, + "step": 930 + }, + { + "loss": 0.4273488998413086, + "grad_norm": 0.016814034432172775, + "learning_rate": 2.694300518134715e-07, + "entropy": 0.81020716742496, + "num_tokens": 63047673.0, + "logits/chosen": -1.5172310235884794, + "logits/rejected": -1.1998523520459965, + "mean_token_accuracy": 0.7050479584932328, + "rewards/chosen": -0.8097914783160922, + "rewards/rejected": -2.262013399923744, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.452221922907047, + "logps/chosen": -60.9624414229393, + "logps/rejected": -75.92849832773209, + "epoch": 0.9750531611430943, + "step": 940 + }, + { + "loss": 0.4405078411102295, + "grad_norm": 0.02221529930830002, + "learning_rate": 1.6580310880829015e-07, + "entropy": 0.7960373500641436, + "num_tokens": 63718529.0, + "logits/chosen": -1.5261262470344286, + "logits/rejected": -1.2351896031266807, + "mean_token_accuracy": 0.7166906687803567, + "rewards/chosen": -0.8054070144893921, + "rewards/rejected": -2.2143535910593344, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.4089465801790357, + "logps/chosen": -58.76033858776093, + "logps/rejected": -75.32699841499328, + "epoch": 0.9854260671127016, + "step": 950 + }, + { + "loss": 0.4032235622406006, + "grad_norm": 0.015166543424129486, + "learning_rate": 6.217616580310881e-08, + "entropy": 0.8253091154253344, + "num_tokens": 64391541.0, + "logits/chosen": -1.5054467577713744, + "logits/rejected": -1.1940948964954847, + "mean_token_accuracy": 0.7102081939950585, + "rewards/chosen": -0.7573958630473498, + "rewards/rejected": -2.3041888994569306, + "rewards/accuracies": 0.8125, + "rewards/margins": 1.5467930364748463, + "logps/chosen": -59.873460137844084, + "logps/rejected": -77.67126994132995, + "epoch": 0.995798973082309, + "step": 960 + }, + { + "train_runtime": 36967.0361, + "train_samples_per_second": 2.086, + "train_steps_per_second": 0.026, + "total_flos": 5.2405488888805786e+17, + "train_loss": 0.453640728787437, + "entropy": 0.8554125972153952, + "num_tokens": 64664162.0, + "logits/chosen": -1.3863200845494572, + "logits/rejected": -1.1139205918868142, + "mean_token_accuracy": 0.7043190732322357, + "rewards/chosen": -0.8579825216625461, + "rewards/rejected": -2.1552414747104507, + "rewards/accuracies": 0.7932098765432098, + "rewards/margins": 1.2972589509883596, + "logps/chosen": -62.61760814690295, + "logps/rejected": -79.34557756376856, + "epoch": 1.0, + "step": 965 + } + ], + "validation_monitor_size": 1000, + "validation_monitor_selection": "fixed_seed_random_without_replacement", + "validation_monitor_seed": 22, + "validation_monitor_indices": [ + 2, + 10, + 14, + 21, + 55, + 63, + 66, + 69, + 107, + 110, + 142, + 144, + 149, + 150, + 151, + 152, + 160, + 163, + 166, + 167, + 176, + 181, + 206, + 207, + 259, + 267, + 281, + 295, + 298, + 306, + 307, + 317, + 321, + 331, + 336, + 341, + 346, + 349, + 351, + 352, + 357, + 358, + 369, + 370, + 382, + 386, + 391, + 401, + 411, + 412, + 432, + 437, + 452, + 462, + 465, + 488, + 490, + 491, + 492, + 494, + 503, + 504, + 508, + 528, + 538, + 540, + 551, + 553, + 567, + 586, + 605, + 606, + 625, + 627, + 661, + 663, + 666, + 677, + 685, + 690, + 692, + 704, + 708, + 714, + 715, + 727, + 728, + 733, + 745, + 752, + 753, + 755, + 764, + 773, + 779, + 783, + 793, + 796, + 799, + 803, + 804, + 805, + 813, + 816, + 818, + 823, + 827, + 829, + 830, + 837, + 842, + 845, + 850, + 853, + 856, + 889, + 890, + 905, + 915, + 924, + 930, + 939, + 951, + 988, + 1002, + 1005, + 1023, + 1029, + 1038, + 1049, + 1050, + 1054, + 1056, + 1067, + 1068, + 1079, + 1088, + 1091, + 1103, + 1114, + 1118, + 1133, + 1140, + 1144, + 1145, + 1155, + 1186, + 1195, + 1206, + 1223, + 1251, + 1252, + 1257, + 1259, + 1270, + 1271, + 1295, + 1303, + 1304, + 1305, + 1329, + 1335, + 1336, + 1343, + 1367, + 1373, + 1377, + 1403, + 1412, + 1429, + 1443, + 1457, + 1459, + 1460, + 1476, + 1483, + 1486, + 1494, + 1507, + 1510, + 1519, + 1521, + 1522, + 1545, + 1551, + 1570, + 1582, + 1593, + 1595, + 1603, + 1607, + 1614, + 1615, + 1625, + 1634, + 1639, + 1648, + 1654, + 1657, + 1662, + 1667, + 1673, + 1690, + 1704, + 1746, + 1756, + 1781, + 1783, + 1796, + 1799, + 1809, + 1814, + 1827, + 1829, + 1832, + 1844, + 1847, + 1854, + 1856, + 1857, + 1858, + 1874, + 1883, + 1889, + 1924, + 1925, + 1931, + 1932, + 1934, + 1935, + 1938, + 1950, + 1957, + 1962, + 1967, + 1975, + 1982, + 1983, + 1991, + 1998, + 2003, + 2008, + 2017, + 2021, + 2026, + 2035, + 2040, + 2050, + 2056, + 2077, + 2079, + 2082, + 2098, + 2100, + 2108, + 2121, + 2130, + 2133, + 2134, + 2138, + 2143, + 2166, + 2167, + 2180, + 2181, + 2185, + 2204, + 2205, + 2212, + 2221, + 2224, + 2226, + 2230, + 2233, + 2256, + 2261, + 2263, + 2269, + 2273, + 2290, + 2291, + 2299, + 2301, + 2321, + 2323, + 2330, + 2384, + 2401, + 2417, + 2420, + 2421, + 2424, + 2430, + 2435, + 2456, + 2488, + 2502, + 2504, + 2519, + 2527, + 2532, + 2538, + 2542, + 2553, + 2555, + 2558, + 2559, + 2562, + 2578, + 2583, + 2585, + 2590, + 2592, + 2594, + 2596, + 2600, + 2606, + 2607, + 2618, + 2630, + 2637, + 2647, + 2650, + 2657, + 2679, + 2685, + 2705, + 2706, + 2712, + 2713, + 2714, + 2727, + 2740, + 2742, + 2755, + 2780, + 2784, + 2792, + 2807, + 2808, + 2810, + 2820, + 2831, + 2839, + 2860, + 2862, + 2863, + 2866, + 2875, + 2878, + 2898, + 2905, + 2921, + 2922, + 2926, + 2930, + 2934, + 2944, + 2955, + 2957, + 2959, + 2973, + 2978, + 2998, + 3018, + 3022, + 3028, + 3031, + 3061, + 3085, + 3090, + 3104, + 3105, + 3111, + 3115, + 3121, + 3122, + 3129, + 3133, + 3135, + 3161, + 3162, + 3169, + 3173, + 3194, + 3195, + 3215, + 3225, + 3226, + 3241, + 3247, + 3250, + 3253, + 3265, + 3268, + 3293, + 3301, + 3312, + 3329, + 3352, + 3361, + 3362, + 3376, + 3396, + 3401, + 3403, + 3410, + 3419, + 3432, + 3443, + 3452, + 3467, + 3469, + 3475, + 3485, + 3503, + 3514, + 3515, + 3524, + 3528, + 3538, + 3544, + 3557, + 3560, + 3565, + 3600, + 3637, + 3642, + 3658, + 3659, + 3692, + 3693, + 3699, + 3722, + 3725, + 3728, + 3731, + 3740, + 3742, + 3762, + 3766, + 3780, + 3788, + 3794, + 3796, + 3798, + 3805, + 3817, + 3819, + 3822, + 3837, + 3839, + 3843, + 3846, + 3851, + 3854, + 3865, + 3870, + 3871, + 3884, + 3894, + 3895, + 3896, + 3907, + 3911, + 3915, + 3919, + 3920, + 3923, + 3933, + 3955, + 3967, + 3972, + 3974, + 3975, + 3984, + 3985, + 3997, + 4002, + 4010, + 4034, + 4044, + 4063, + 4073, + 4079, + 4082, + 4088, + 4121, + 4145, + 4148, + 4159, + 4161, + 4164, + 4177, + 4188, + 4199, + 4203, + 4207, + 4208, + 4213, + 4221, + 4225, + 4233, + 4241, + 4243, + 4247, + 4264, + 4274, + 4282, + 4286, + 4290, + 4308, + 4310, + 4313, + 4321, + 4324, + 4327, + 4349, + 4362, + 4370, + 4374, + 4380, + 4407, + 4409, + 4411, + 4415, + 4417, + 4418, + 4427, + 4431, + 4433, + 4451, + 4466, + 4477, + 4478, + 4479, + 4493, + 4494, + 4514, + 4527, + 4539, + 4550, + 4558, + 4568, + 4579, + 4583, + 4584, + 4586, + 4587, + 4590, + 4599, + 4602, + 4610, + 4626, + 4627, + 4630, + 4641, + 4647, + 4655, + 4656, + 4657, + 4661, + 4685, + 4714, + 4715, + 4731, + 4749, + 4752, + 4769, + 4777, + 4782, + 4791, + 4805, + 4818, + 4829, + 4833, + 4837, + 4839, + 4843, + 4871, + 4875, + 4879, + 4880, + 4885, + 4888, + 4895, + 4900, + 4923, + 4966, + 4968, + 4972, + 4989, + 4994, + 4998, + 5001, + 5013, + 5019, + 5026, + 5032, + 5034, + 5046, + 5055, + 5085, + 5086, + 5088, + 5089, + 5090, + 5095, + 5108, + 5110, + 5119, + 5120, + 5121, + 5133, + 5148, + 5154, + 5160, + 5169, + 5178, + 5222, + 5223, + 5232, + 5233, + 5240, + 5256, + 5259, + 5264, + 5271, + 5276, + 5279, + 5294, + 5300, + 5303, + 5321, + 5335, + 5337, + 5345, + 5348, + 5365, + 5373, + 5378, + 5384, + 5422, + 5442, + 5443, + 5445, + 5477, + 5485, + 5495, + 5497, + 5504, + 5526, + 5533, + 5542, + 5564, + 5570, + 5579, + 5587, + 5592, + 5608, + 5610, + 5624, + 5630, + 5638, + 5651, + 5663, + 5670, + 5675, + 5691, + 5700, + 5706, + 5707, + 5715, + 5720, + 5721, + 5722, + 5732, + 5738, + 5741, + 5769, + 5771, + 5775, + 5795, + 5796, + 5800, + 5809, + 5810, + 5815, + 5819, + 5827, + 5848, + 5849, + 5852, + 5859, + 5880, + 5884, + 5907, + 5909, + 5912, + 5919, + 5931, + 5932, + 5934, + 5941, + 5948, + 5950, + 5952, + 5953, + 5969, + 5981, + 6000, + 6003, + 6010, + 6018, + 6041, + 6065, + 6075, + 6090, + 6103, + 6106, + 6109, + 6114, + 6123, + 6131, + 6136, + 6138, + 6139, + 6164, + 6165, + 6171, + 6173, + 6180, + 6185, + 6189, + 6190, + 6221, + 6223, + 6237, + 6255, + 6262, + 6265, + 6293, + 6296, + 6305, + 6318, + 6331, + 6336, + 6340, + 6355, + 6366, + 6371, + 6396, + 6399, + 6402, + 6408, + 6432, + 6433, + 6441, + 6456, + 6465, + 6478, + 6486, + 6489, + 6507, + 6508, + 6520, + 6522, + 6528, + 6537, + 6551, + 6564, + 6589, + 6590, + 6598, + 6599, + 6611, + 6613, + 6615, + 6621, + 6634, + 6647, + 6649, + 6654, + 6676, + 6680, + 6690, + 6708, + 6729, + 6736, + 6744, + 6749, + 6756, + 6761, + 6763, + 6773, + 6788, + 6790, + 6796, + 6797, + 6811, + 6824, + 6850, + 6869, + 6871, + 6882, + 6892, + 6895, + 6906, + 6911, + 6912, + 6914, + 6927, + 6952, + 6966, + 6985, + 7001, + 7021, + 7031, + 7035, + 7038, + 7041, + 7045, + 7052, + 7057, + 7058, + 7072, + 7073, + 7076, + 7086, + 7102, + 7107, + 7109, + 7117, + 7122, + 7125, + 7166, + 7182, + 7199, + 7207, + 7212, + 7215, + 7232, + 7243, + 7246, + 7250, + 7253, + 7258, + 7263, + 7267, + 7270, + 7274, + 7280, + 7286, + 7293, + 7298, + 7302, + 7306, + 7316, + 7325, + 7326, + 7334, + 7356, + 7357, + 7363, + 7364, + 7367, + 7385, + 7392, + 7399, + 7405, + 7416, + 7420, + 7421, + 7426, + 7452, + 7476, + 7481, + 7519, + 7534, + 7542, + 7546, + 7573, + 7585, + 7601, + 7604, + 7606, + 7609, + 7629, + 7649, + 7653, + 7667, + 7682, + 7699, + 7738, + 7750, + 7786, + 7798, + 7800, + 7801, + 7805, + 7806, + 7811, + 7813, + 7832, + 7837, + 7849, + 7856, + 7876, + 7877, + 7887, + 7905, + 7916, + 7919, + 7920, + 7922, + 7923, + 7926, + 7944, + 7961, + 7966, + 7970, + 7973, + 7974, + 7976, + 7986, + 7999, + 8027, + 8028, + 8034, + 8047, + 8068, + 8074, + 8077, + 8091, + 8120, + 8122, + 8125, + 8152, + 8153, + 8164, + 8167, + 8169, + 8171, + 8177, + 8184, + 8189, + 8192, + 8196, + 8202, + 8212, + 8217, + 8231, + 8242, + 8244, + 8250, + 8256, + 8257, + 8265, + 8270, + 8274, + 8283, + 8290, + 8294, + 8301, + 8302, + 8307, + 8318, + 8326, + 8338, + 8349, + 8350, + 8353, + 8357, + 8371, + 8374, + 8377, + 8380, + 8387, + 8388, + 8396, + 8402, + 8419, + 8423, + 8428, + 8435, + 8439, + 8442, + 8444, + 8453, + 8461, + 8475, + 8481, + 8485, + 8493, + 8495, + 8498, + 8523, + 8530, + 8531, + 8562 + ], + "early_stopping_patience": 3 +} diff --git a/phase1/ablations/no_context/README.md b/phase1/ablations/no_context/README.md new file mode 100644 index 0000000000000000000000000000000000000000..528f703eb66e93decd20d4934b1f7d95d0698e74 --- /dev/null +++ b/phase1/ablations/no_context/README.md @@ -0,0 +1,80 @@ +--- +library_name: peft +model_name: phase1-qwen-no-context-ablation +tags: +- base_model:adapter:Qwen/Qwen2.5-1.5B-Instruct +- dpo +- lora +- transformers +- trl +license: apache-2.0 +base_model: Qwen/Qwen2.5-1.5B-Instruct +pipeline_tag: text-generation +--- + +# Phase 1 Qwen `no_context` diagnostic ablation + +This is the Phase 1 `no_context` diagnostic LoRA-DPO adapter fine-tuned from +[Qwen2.5-1.5B-Instruct](https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct). +The frozen training recipe and membership hashes are included in this directory. + +## Quick start + +```python +from peft import PeftModel +from transformers import AutoModelForCausalLM, AutoTokenizer + +repo_id = "geyuxu/york-milestone-project-self-traing-loop-model" +subfolder = "phase1/ablations/no_context" +base_id = "Qwen/Qwen2.5-1.5B-Instruct" + +tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder) +base_model = AutoModelForCausalLM.from_pretrained( + base_id, torch_dtype="auto", device_map="auto" +) +model = PeftModel.from_pretrained(base_model, repo_id, subfolder=subfolder) +``` + +## Training procedure + + + + + +This model was trained with DPO, a method introduced in [Direct Preference Optimization: Your Language Model is Secretly a Reward Model](https://huggingface.co/papers/2305.18290). + +### Framework versions + +- PEFT 0.18.1 +- TRL: 0.29.0 +- Transformers: 5.3.0 +- Pytorch: 2.10.0 +- Datasets: 4.6.1 +- Tokenizers: 0.22.2 + +## Citations + +Cite DPO as: + +```bibtex +@inproceedings{rafailov2023direct, + title = {{Direct Preference Optimization: Your Language Model is Secretly a Reward Model}}, + author = {Rafael Rafailov and Archit Sharma and Eric Mitchell and Christopher D. Manning and Stefano Ermon and Chelsea Finn}, + year = 2023, + booktitle = {Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023}, + url = {http://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html}, + editor = {Alice Oh and Tristan Naumann and Amir Globerson and Kate Saenko and Moritz Hardt and Sergey Levine}, +} +``` + +Cite TRL as: + +```bibtex +@software{vonwerra2020trl, + title = {{TRL: Transformers Reinforcement Learning}}, + author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin}, + license = {Apache-2.0}, + url = {https://github.com/huggingface/trl}, + year = {2020} +} +``` diff --git a/phase1/ablations/no_context/adapter_config.json b/phase1/ablations/no_context/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..fa47a2292cd8a23ccf1b4d101d7f7a03e3f08871 --- /dev/null +++ b/phase1/ablations/no_context/adapter_config.json @@ -0,0 +1,43 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen2.5-1.5B-Instruct", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "v_proj", + "k_proj", + "o_proj", + "q_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} diff --git a/phase1/ablations/no_context/adapter_model.safetensors b/phase1/ablations/no_context/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..6505c47843a638faa3b3f80cf032400cdf39a2b1 --- /dev/null +++ b/phase1/ablations/no_context/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6f3a8ff3c19fd3e0ff728feab4e0a73a33c71608510f37d9dd27e53b74f97523 +size 17462432 diff --git a/phase1/ablations/no_context/chat_template.jinja b/phase1/ablations/no_context/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..bdf7919a96cfe43d50914a007b9c0877bd0ec27e --- /dev/null +++ b/phase1/ablations/no_context/chat_template.jinja @@ -0,0 +1,54 @@ +{%- if tools %} + {{- '<|im_start|>system\n' }} + {%- if messages[0]['role'] == 'system' %} + {{- messages[0]['content'] }} + {%- else %} + {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }} + {%- endif %} + {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }} +{%- else %} + {%- if messages[0]['role'] == 'system' %} + {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }} + {%- else %} + {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- for message in messages %} + {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %} + {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {{- '<|im_start|>' + message.role }} + {%- if message.content %} + {{- '\n' + message.content }} + {%- endif %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {{- '\n\n{"name": "' }} + {{- tool_call.name }} + {{- '", "arguments": ' }} + {{- tool_call.arguments | tojson }} + {{- '}\n' }} + {%- endfor %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- message.content }} + {{- '\n' }} + {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} +{%- endif %} diff --git a/phase1/ablations/no_context/tokenizer.json b/phase1/ablations/no_context/tokenizer.json new file mode 100644 index 0000000000000000000000000000000000000000..d73428d91463b495bc017fb6a2fb3a656646482b --- /dev/null +++ b/phase1/ablations/no_context/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 +size 11422166 diff --git a/phase1/ablations/no_context/tokenizer_config.json b/phase1/ablations/no_context/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..9fd0fb48e73786f54fb04e98892f5f5a0ebeebdb --- /dev/null +++ b/phase1/ablations/no_context/tokenizer_config.json @@ -0,0 +1,29 @@ +{ + "add_prefix_space": false, + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "is_local": true, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null +} diff --git a/phase1/ablations/no_context/training_args.bin b/phase1/ablations/no_context/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..4b33f87738292306dfc6d52ce5bc7be6fc8ed191 --- /dev/null +++ b/phase1/ablations/no_context/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:dd47c7f20edcbf52ada253a96ebd7ddcb8045bdd2a75f52fdd0f51ad7bc0183e +size 5841 diff --git a/phase1/ablations/no_context/training_recipe.json b/phase1/ablations/no_context/training_recipe.json new file mode 100644 index 0000000000000000000000000000000000000000..3566328b32f896b65ee58a4de3d44c5c533d387e --- /dev/null +++ b/phase1/ablations/no_context/training_recipe.json @@ -0,0 +1,22 @@ +{ + "format_version": 1, + "experiment": "confusion_ablation", + "ablation": "no_context", + "model_name": "Qwen/Qwen2.5-1.5B-Instruct", + "train_membership_sha256": "b497fa765223a9810ad784f31e1598edfa992a162146d6f94d9cdf4adcedd87d", + "validation_membership_sha256": "2f609467438cd6a01fd84b9d80c0fcd84c44767e3b2ed98f4f6a83d68a62c181", + "num_train_pairs": 77124, + "num_validation_pairs": 8563, + "transformation_seed": 22, + "validation_prompt_mode": "clean_rag", + "learning_rate": 1e-05, + "beta": 0.1, + "num_epochs": 1.0, + "seed": 22, + "max_length": 512, + "max_prompt_length": 384, + "gradient_accumulation_steps": 80, + "save_steps": 125, + "save_total_limit": 12, + "preference_pairs_format_version": 2 +} diff --git a/phase1/ablations/no_context/training_summary.json b/phase1/ablations/no_context/training_summary.json new file mode 100644 index 0000000000000000000000000000000000000000..ec12d2995cbde422b4cc0067c3dc722a2a3d3bdd --- /dev/null +++ b/phase1/ablations/no_context/training_summary.json @@ -0,0 +1,2925 @@ +{ + "model_name": "Qwen/Qwen2.5-1.5B-Instruct", + "resolved_model": "Qwen/Qwen2.5-1.5B-Instruct", + "num_train_records": 77124, + "num_validation_records_available": 8563, + "training_config": { + "lora_rank": 16, + "lora_alpha": 32, + "learning_rate": 1e-05, + "num_epochs": 1.0, + "per_device_batch_size": 1, + "per_device_eval_batch_size": 1, + "gradient_accumulation_steps": 80, + "beta": 0.1, + "max_length": 512, + "max_prompt_length": 384, + "seed": 22, + "save_steps": 125, + "save_total_limit": 12, + "resume_from_checkpoint": null, + "precision_dtype": "torch.bfloat16", + "bf16": true, + "fp16": false, + "tokenizer_add_bos_token": false + }, + "global_step": 965, + "best_metric": 0.5303567051887512, + "best_model_checkpoint": "outputs/confusion_ablation_phase1_repair_v3/no_context/lora/checkpoint-875", + "train_metrics": { + "train_runtime": 22000.2483, + "train_samples_per_second": 3.506, + "train_steps_per_second": 0.044, + "total_flos": 1.2331818072769536e+17, + "train_loss": 0.4788281094842624 + }, + "log_history": [ + { + "loss": 0.6900143623352051, + "grad_norm": 0.012825769372284412, + "learning_rate": 9.906735751295338e-06, + "entropy": 0.9465285880398006, + "num_tokens": 143734.0, + "logits/chosen": -1.5012888478025672, + "logits/rejected": -1.5723651012268272, + "mean_token_accuracy": 0.6951504178717732, + "rewards/chosen": 0.008079942484078515, + "rewards/rejected": 0.0013256204138269822, + "rewards/accuracies": 0.5425, + "rewards/margins": 0.006754322004853748, + "logps/chosen": -54.978611971139905, + "logps/rejected": -44.00920191049576, + "epoch": 0.010372905969607386, + "step": 10 + }, + { + "loss": 0.662090539932251, + "grad_norm": 0.01821574941277504, + "learning_rate": 9.803108808290156e-06, + "entropy": 0.9671179948747158, + "num_tokens": 288007.0, + "logits/chosen": -1.4026643295951302, + "logits/rejected": -1.5102725032640183, + "mean_token_accuracy": 0.6902420591562987, + "rewards/chosen": 0.051943560895306294, + "rewards/rejected": -0.014707293705987468, + "rewards/accuracies": 0.76875, + "rewards/margins": 0.06665085479675327, + "logps/chosen": -57.24453290700912, + "logps/rejected": -42.05887178063393, + "epoch": 0.02074581193921477, + "step": 20 + }, + { + "loss": 0.6254077911376953, + "grad_norm": 0.011037914082407951, + "learning_rate": 9.699481865284975e-06, + "entropy": 1.022590966722928, + "num_tokens": 433590.0, + "logits/chosen": -1.275362931486493, + "logits/rejected": -1.3053425668445908, + "mean_token_accuracy": 0.6875665122829377, + "rewards/chosen": 0.104925400447828, + "rewards/rejected": -0.05808189030554786, + "rewards/accuracies": 0.785, + "rewards/margins": 0.16300729091250105, + "logps/chosen": -56.563721351623535, + "logps/rejected": -44.831772941350934, + "epoch": 0.031118717908822157, + "step": 30 + }, + { + "loss": 0.5835778713226318, + "grad_norm": 0.011659706942737103, + "learning_rate": 9.595854922279793e-06, + "entropy": 1.0491496316390112, + "num_tokens": 579257.0, + "logits/chosen": -1.103721370379413, + "logits/rejected": -1.1007857062801798, + "mean_token_accuracy": 0.6836125956382603, + "rewards/chosen": 0.10443844198705847, + "rewards/rejected": -0.17612101439032812, + "rewards/accuracies": 0.79875, + "rewards/margins": 0.2805594558198936, + "logps/chosen": -56.31521392583847, + "logps/rejected": -44.80111095190048, + "epoch": 0.04149162387842954, + "step": 40 + }, + { + "loss": 0.5701297760009766, + "grad_norm": 0.009541669860482216, + "learning_rate": 9.492227979274612e-06, + "entropy": 1.1355412375973537, + "num_tokens": 724279.0, + "logits/chosen": -0.9254812350216316, + "logits/rejected": -0.9079043695626247, + "mean_token_accuracy": 0.6852783388644457, + "rewards/chosen": 0.054056347796804405, + "rewards/rejected": -0.30969686928990997, + "rewards/accuracies": 0.78, + "rewards/margins": 0.3637532171921339, + "logps/chosen": -57.41013575792313, + "logps/rejected": -45.747311503887175, + "epoch": 0.051864529848036925, + "step": 50 + }, + { + "loss": 0.5617631912231446, + "grad_norm": 0.007650681305676699, + "learning_rate": 9.388601036269432e-06, + "entropy": 1.1949225943023338, + "num_tokens": 868037.0, + "logits/chosen": -0.8281910829349749, + "logits/rejected": -0.7978684013816298, + "mean_token_accuracy": 0.6832736423797905, + "rewards/chosen": -0.03967508725108928, + "rewards/rejected": -0.47718707822641593, + "rewards/accuracies": 0.76625, + "rewards/margins": 0.4375119912764058, + "logps/chosen": -56.544705327749256, + "logps/rejected": -46.81773233771324, + "epoch": 0.062237435817644314, + "step": 60 + }, + { + "loss": 0.5275696277618408, + "grad_norm": 0.008909703232347965, + "learning_rate": 9.284974093264249e-06, + "entropy": 1.2164792704861611, + "num_tokens": 1012838.0, + "logits/chosen": -0.8094323563514035, + "logits/rejected": -0.6994889637697067, + "mean_token_accuracy": 0.6774187626503408, + "rewards/chosen": -0.13885413558671644, + "rewards/rejected": -0.6821774935087888, + "rewards/accuracies": 0.78875, + "rewards/margins": 0.5433233577781357, + "logps/chosen": -59.331356877088545, + "logps/rejected": -48.74847481250763, + "epoch": 0.0726103417872517, + "step": 70 + }, + { + "loss": 0.5331552982330322, + "grad_norm": 0.009889204055070877, + "learning_rate": 9.181347150259067e-06, + "entropy": 1.3044282801821827, + "num_tokens": 1157318.0, + "logits/chosen": -0.7322735281718121, + "logits/rejected": -0.641984971321019, + "mean_token_accuracy": 0.6695321470685304, + "rewards/chosen": -0.2586568782431277, + "rewards/rejected": -0.8568377101852093, + "rewards/accuracies": 0.7625, + "rewards/margins": 0.5981808328768239, + "logps/chosen": -59.761966693401334, + "logps/rejected": -52.77639355659485, + "epoch": 0.08298324775685909, + "step": 80 + }, + { + "loss": 0.5138424873352051, + "grad_norm": 0.009201128035783768, + "learning_rate": 9.077720207253888e-06, + "entropy": 1.2985483697801827, + "num_tokens": 1301440.0, + "logits/chosen": -0.7244757922082572, + "logits/rejected": -0.6446976643569048, + "mean_token_accuracy": 0.6679086892027408, + "rewards/chosen": -0.3228293718020723, + "rewards/rejected": -1.0106709606619553, + "rewards/accuracies": 0.78125, + "rewards/margins": 0.6878415882331319, + "logps/chosen": -61.18230092167855, + "logps/rejected": -53.36138055682182, + "epoch": 0.09335615372646647, + "step": 90 + }, + { + "loss": 0.5422882556915283, + "grad_norm": 0.011827374808490276, + "learning_rate": 8.974093264248706e-06, + "entropy": 1.3437509477324783, + "num_tokens": 1450582.0, + "logits/chosen": -0.6577579178959528, + "logits/rejected": -0.6052760341023756, + "mean_token_accuracy": 0.6652949979342521, + "rewards/chosen": -0.48851178389566485, + "rewards/rejected": -1.1487117192932055, + "rewards/accuracies": 0.75, + "rewards/margins": 0.660199935096316, + "logps/chosen": -66.8969352221489, + "logps/rejected": -59.775410163402555, + "epoch": 0.10372905969607385, + "step": 100 + }, + { + "loss": 0.4941854953765869, + "grad_norm": 0.009122959338128567, + "learning_rate": 8.870466321243523e-06, + "entropy": 1.3095360630284996, + "num_tokens": 1596102.0, + "logits/chosen": -0.7076684162519699, + "logits/rejected": -0.6176523284098799, + "mean_token_accuracy": 0.6634110971167684, + "rewards/chosen": -0.461084103367175, + "rewards/rejected": -1.2571547295921481, + "rewards/accuracies": 0.805, + "rewards/margins": 0.7960706273838878, + "logps/chosen": -62.40037791490555, + "logps/rejected": -55.013062043190004, + "epoch": 0.11410196566568125, + "step": 110 + }, + { + "loss": 0.5182926654815674, + "grad_norm": 0.009255604818463326, + "learning_rate": 8.766839378238343e-06, + "entropy": 1.3175755373714493, + "num_tokens": 1741007.0, + "logits/chosen": -0.7542329802157357, + "logits/rejected": -0.6569479564448296, + "mean_token_accuracy": 0.6686466364003718, + "rewards/chosen": -0.5461745312937274, + "rewards/rejected": -1.3049446252000052, + "rewards/accuracies": 0.78125, + "rewards/margins": 0.7587700937641785, + "logps/chosen": -63.756407718658444, + "logps/rejected": -53.10148733973503, + "epoch": 0.12447487163528863, + "step": 120 + }, + { + "eval_loss": 0.6102487444877625, + "eval_runtime": 187.9736, + "eval_samples_per_second": 5.32, + "eval_steps_per_second": 5.32, + "eval_entropy": 0.9602043167352676, + "eval_num_tokens": 1813585.0, + "eval_logits/chosen": -0.35928736165014746, + "eval_logits/rejected": -0.2653593227174459, + "eval_mean_token_accuracy": 0.71722535353899, + "eval_rewards/chosen": -0.11001014763419516, + "eval_rewards/rejected": -0.37161904421189684, + "eval_rewards/accuracies": 0.674, + "eval_rewards/margins": 0.2616088960794732, + "eval_logps/chosen": -51.27308830451965, + "eval_logps/rejected": -56.35606210327148, + "epoch": 0.1296613246200923, + "step": 125 + }, + { + "loss": 0.5195056438446045, + "grad_norm": 0.00852493941783905, + "learning_rate": 8.663212435233162e-06, + "entropy": 1.3568350885761902, + "num_tokens": 1887149.0, + "logits/chosen": -0.6995870647573145, + "logits/rejected": -0.6066075725004298, + "mean_token_accuracy": 0.6595153860282152, + "rewards/chosen": -0.5691824928086499, + "rewards/rejected": -1.3477147495548707, + "rewards/accuracies": 0.77125, + "rewards/margins": 0.7785322573361918, + "logps/chosen": -63.50056747078896, + "logps/rejected": -57.747277438640594, + "epoch": 0.13484777760489602, + "step": 130 + }, + { + "loss": 0.5127462863922119, + "grad_norm": 0.010999510996043682, + "learning_rate": 8.55958549222798e-06, + "entropy": 1.2911182015296072, + "num_tokens": 2030779.0, + "logits/chosen": -0.8425986763113174, + "logits/rejected": -0.6790966632280194, + "mean_token_accuracy": 0.6699926462769509, + "rewards/chosen": -0.5714914060512092, + "rewards/rejected": -1.3701531535839604, + "rewards/accuracies": 0.79, + "rewards/margins": 0.798661746904254, + "logps/chosen": -58.21274412512779, + "logps/rejected": -57.35458103775978, + "epoch": 0.1452206835745034, + "step": 140 + }, + { + "loss": 0.4771514892578125, + "grad_norm": 0.007932349108159542, + "learning_rate": 8.455958549222799e-06, + "entropy": 1.3540867683663964, + "num_tokens": 2177571.0, + "logits/chosen": -0.7752437049236788, + "logits/rejected": -0.6567138403536552, + "mean_token_accuracy": 0.6547455007676035, + "rewards/chosen": -0.5410610925909713, + "rewards/rejected": -1.4754458899376914, + "rewards/accuracies": 0.7975, + "rewards/margins": 0.9343847993016243, + "logps/chosen": -62.85497339010239, + "logps/rejected": -59.90050791025162, + "epoch": 0.1555935895441108, + "step": 150 + }, + { + "loss": 0.5065268516540528, + "grad_norm": 0.009417089633643627, + "learning_rate": 8.352331606217617e-06, + "entropy": 1.3703182196151464, + "num_tokens": 2323969.0, + "logits/chosen": -0.7446562811347729, + "logits/rejected": -0.6594706622933276, + "mean_token_accuracy": 0.6509130381792784, + "rewards/chosen": -0.6582208207750955, + "rewards/rejected": -1.4940199976743316, + "rewards/accuracies": 0.79125, + "rewards/margins": 0.8357991751469672, + "logps/chosen": -67.1081642484665, + "logps/rejected": -60.26060558557511, + "epoch": 0.16596649551371817, + "step": 160 + }, + { + "loss": 0.49721107482910154, + "grad_norm": 0.009800152853131294, + "learning_rate": 8.248704663212436e-06, + "entropy": 1.366801006840542, + "num_tokens": 2470885.0, + "logits/chosen": -0.6928292309660968, + "logits/rejected": -0.6209869620155596, + "mean_token_accuracy": 0.6535427515022456, + "rewards/chosen": -0.6162330767056119, + "rewards/rejected": -1.5209841228489678, + "rewards/accuracies": 0.78875, + "rewards/margins": 0.9047510461229831, + "logps/chosen": -66.02899884462357, + "logps/rejected": -58.60980107545853, + "epoch": 0.17633940148332555, + "step": 170 + }, + { + "loss": 0.4829860210418701, + "grad_norm": 0.008786365389823914, + "learning_rate": 8.145077720207254e-06, + "entropy": 1.3717705434653908, + "num_tokens": 2615121.0, + "logits/chosen": -0.6580562375952098, + "logits/rejected": -0.5878139433574051, + "mean_token_accuracy": 0.6564870945271104, + "rewards/chosen": -0.5556664189803269, + "rewards/rejected": -1.4979612402966085, + "rewards/accuracies": 0.7825, + "rewards/margins": 0.9422948203328997, + "logps/chosen": -62.85998333334923, + "logps/rejected": -57.214853674173355, + "epoch": 0.18671230745293294, + "step": 180 + }, + { + "loss": 0.4684004783630371, + "grad_norm": 0.009316110983490944, + "learning_rate": 8.041450777202073e-06, + "entropy": 1.4150286172702908, + "num_tokens": 2758874.0, + "logits/chosen": -0.6699597359601204, + "logits/rejected": -0.5473851034553693, + "mean_token_accuracy": 0.6443419794179499, + "rewards/chosen": -0.503764379483473, + "rewards/rejected": -1.4732603453175397, + "rewards/accuracies": 0.7825, + "rewards/margins": 0.9694959655869753, + "logps/chosen": -65.26039588212967, + "logps/rejected": -55.79923560500145, + "epoch": 0.19708521342254032, + "step": 190 + }, + { + "loss": 0.5344902038574219, + "grad_norm": 0.013661396689713001, + "learning_rate": 7.937823834196891e-06, + "entropy": 1.3751253792829812, + "num_tokens": 2902718.0, + "logits/chosen": -0.65461918654035, + "logits/rejected": -0.5536890222464702, + "mean_token_accuracy": 0.6590519631467759, + "rewards/chosen": -0.5584196869007791, + "rewards/rejected": -1.4234223538136574, + "rewards/accuracies": 0.77125, + "rewards/margins": 0.8650026666652412, + "logps/chosen": -61.13262881875038, + "logps/rejected": -56.61175240635872, + "epoch": 0.2074581193921477, + "step": 200 + }, + { + "loss": 0.4941723823547363, + "grad_norm": 0.008777705021202564, + "learning_rate": 7.834196891191712e-06, + "entropy": 1.3652805363852532, + "num_tokens": 3043885.0, + "logits/chosen": -0.7452820956668422, + "logits/rejected": -0.6034335554689337, + "mean_token_accuracy": 0.6580210606381297, + "rewards/chosen": -0.45352055150666276, + "rewards/rejected": -1.3747392913223302, + "rewards/accuracies": 0.78125, + "rewards/margins": 0.9212187370774336, + "logps/chosen": -58.416047328710555, + "logps/rejected": -53.947862002849575, + "epoch": 0.2178310253617551, + "step": 210 + }, + { + "loss": 0.47504258155822754, + "grad_norm": 0.009036123752593994, + "learning_rate": 7.730569948186528e-06, + "entropy": 1.4040400226414205, + "num_tokens": 3190499.0, + "logits/chosen": -0.6346807976930225, + "logits/rejected": -0.5184029459658583, + "mean_token_accuracy": 0.6466581939533352, + "rewards/chosen": -0.536972903214264, + "rewards/rejected": -1.5215354163426673, + "rewards/accuracies": 0.8025, + "rewards/margins": 0.984562511825934, + "logps/chosen": -62.78493340015412, + "logps/rejected": -58.09246099233627, + "epoch": 0.2282039313313625, + "step": 220 + }, + { + "loss": 0.45198073387146, + "grad_norm": 0.007527140900492668, + "learning_rate": 7.626943005181348e-06, + "entropy": 1.4020196551457047, + "num_tokens": 3337768.0, + "logits/chosen": -0.6210873045715655, + "logits/rejected": -0.5822921518676821, + "mean_token_accuracy": 0.6555538633279503, + "rewards/chosen": -0.4542729445986333, + "rewards/rejected": -1.5461742853268516, + "rewards/accuracies": 0.8175, + "rewards/margins": 1.091901341448538, + "logps/chosen": -67.90270529866218, + "logps/rejected": -58.65799897551537, + "epoch": 0.23857683730096987, + "step": 230 + }, + { + "loss": 0.4732102870941162, + "grad_norm": 0.016743697226047516, + "learning_rate": 7.523316062176167e-06, + "entropy": 1.408635692326352, + "num_tokens": 3483520.0, + "logits/chosen": -0.5801546989494524, + "logits/rejected": -0.5212051543725787, + "mean_token_accuracy": 0.6469839760102332, + "rewards/chosen": -0.5587615105054283, + "rewards/rejected": -1.562202037232928, + "rewards/accuracies": 0.8, + "rewards/margins": 1.003440523883328, + "logps/chosen": -65.64231182932853, + "logps/rejected": -58.95616222620011, + "epoch": 0.24894974327057726, + "step": 240 + }, + { + "loss": 0.48830270767211914, + "grad_norm": 0.010347820818424225, + "learning_rate": 7.419689119170985e-06, + "entropy": 1.3876401880290359, + "num_tokens": 3629401.0, + "logits/chosen": -0.6944931846154596, + "logits/rejected": -0.5525909304478883, + "mean_token_accuracy": 0.6595196689106524, + "rewards/chosen": -0.5708247896161629, + "rewards/rejected": -1.5276743739199445, + "rewards/accuracies": 0.7825, + "rewards/margins": 0.9568495863489807, + "logps/chosen": -65.0908039200306, + "logps/rejected": -59.28663974046707, + "epoch": 0.2593226492401846, + "step": 250 + }, + { + "eval_loss": 0.586716890335083, + "eval_runtime": 218.1079, + "eval_samples_per_second": 4.585, + "eval_steps_per_second": 4.585, + "eval_entropy": 0.9768514372222126, + "eval_num_tokens": 3629401.0, + "eval_logits/chosen": -0.288027065089679, + "eval_logits/rejected": -0.1875060971678181, + "eval_mean_token_accuracy": 0.715995571538806, + "eval_rewards/chosen": -0.13773577162688888, + "eval_rewards/rejected": -0.4831975232921541, + "eval_rewards/accuracies": 0.7, + "eval_rewards/margins": 0.3454617517972365, + "eval_logps/chosen": -51.550344535827634, + "eval_logps/rejected": -57.47184686470032, + "epoch": 0.2593226492401846, + "step": 250 + }, + { + "loss": 0.5234602928161621, + "grad_norm": 0.01417848002165556, + "learning_rate": 7.3160621761658035e-06, + "entropy": 1.4126720386464149, + "num_tokens": 3776772.0, + "logits/chosen": -0.6336535534010754, + "logits/rejected": -0.5590520939183056, + "mean_token_accuracy": 0.6559896361455322, + "rewards/chosen": -0.607539504897577, + "rewards/rejected": -1.5568346106001991, + "rewards/accuracies": 0.76625, + "rewards/margins": 0.9492951015941798, + "logps/chosen": -67.75836271762847, + "logps/rejected": -60.43963164687157, + "epoch": 0.26969555520979205, + "step": 260 + }, + { + "loss": 0.45171551704406737, + "grad_norm": 0.008155270479619503, + "learning_rate": 7.212435233160623e-06, + "entropy": 1.386252193665132, + "num_tokens": 3918594.0, + "logits/chosen": -0.692322886394876, + "logits/rejected": -0.5863808643424501, + "mean_token_accuracy": 0.6557753992639482, + "rewards/chosen": -0.4844140848268034, + "rewards/rejected": -1.5001980412582634, + "rewards/accuracies": 0.8075, + "rewards/margins": 1.0157839558646082, + "logps/chosen": -60.645376416444776, + "logps/rejected": -56.63234967470169, + "epoch": 0.28006846117939943, + "step": 270 + }, + { + "loss": 0.4645240306854248, + "grad_norm": 0.010044134221971035, + "learning_rate": 7.108808290155441e-06, + "entropy": 1.4262400729209184, + "num_tokens": 4064591.0, + "logits/chosen": -0.6778223895913023, + "logits/rejected": -0.5782403406452822, + "mean_token_accuracy": 0.6480579270608723, + "rewards/chosen": -0.4780267339639249, + "rewards/rejected": -1.5043474953982514, + "rewards/accuracies": 0.81, + "rewards/margins": 1.0263207618752495, + "logps/chosen": -66.15268970012664, + "logps/rejected": -56.97477602481842, + "epoch": 0.2904413671490068, + "step": 280 + }, + { + "loss": 0.48730764389038084, + "grad_norm": 0.011102184653282166, + "learning_rate": 7.005181347150259e-06, + "entropy": 1.3913073570653796, + "num_tokens": 4210880.0, + "logits/chosen": -0.6611820471311323, + "logits/rejected": -0.5711755343264715, + "mean_token_accuracy": 0.6609016039222478, + "rewards/chosen": -0.5330563006985176, + "rewards/rejected": -1.4805517839052482, + "rewards/accuracies": 0.79125, + "rewards/margins": 0.9474954811111093, + "logps/chosen": -64.55881326556205, + "logps/rejected": -58.55792887210846, + "epoch": 0.3008142731186142, + "step": 290 + }, + { + "loss": 0.4731907367706299, + "grad_norm": 0.008548606187105179, + "learning_rate": 6.9015544041450784e-06, + "entropy": 1.3624146432522684, + "num_tokens": 4356383.0, + "logits/chosen": -0.6928838046169237, + "logits/rejected": -0.6042798964782825, + "mean_token_accuracy": 0.6615170135349036, + "rewards/chosen": -0.562419148215231, + "rewards/rejected": -1.5397747305584197, + "rewards/accuracies": 0.8075, + "rewards/margins": 0.9773555782041512, + "logps/chosen": -63.553271045684816, + "logps/rejected": -58.97647937297821, + "epoch": 0.3111871790882216, + "step": 300 + }, + { + "loss": 0.49598259925842286, + "grad_norm": 0.007993742823600769, + "learning_rate": 6.797927461139897e-06, + "entropy": 1.3700548317469656, + "num_tokens": 4504654.0, + "logits/chosen": -0.644779540875669, + "logits/rejected": -0.5648210397573508, + "mean_token_accuracy": 0.6573794655874372, + "rewards/chosen": -0.5243248527575634, + "rewards/rejected": -1.5287844626943115, + "rewards/accuracies": 0.78625, + "rewards/margins": 1.00445960723795, + "logps/chosen": -64.00666294693947, + "logps/rejected": -61.50243379831314, + "epoch": 0.32156008505782896, + "step": 310 + }, + { + "loss": 0.4658979415893555, + "grad_norm": 0.010582108981907368, + "learning_rate": 6.6943005181347155e-06, + "entropy": 1.377428816948086, + "num_tokens": 4649289.0, + "logits/chosen": -0.6946231373321079, + "logits/rejected": -0.615736163527076, + "mean_token_accuracy": 0.6496203068085015, + "rewards/chosen": -0.5053178700394346, + "rewards/rejected": -1.5253387601411668, + "rewards/accuracies": 0.7975, + "rewards/margins": 1.020020889963489, + "logps/chosen": -65.05610402703286, + "logps/rejected": -58.5456183898449, + "epoch": 0.33193299102743634, + "step": 320 + }, + { + "loss": 0.4793886661529541, + "grad_norm": 0.010722431354224682, + "learning_rate": 6.590673575129535e-06, + "entropy": 1.4115223482623696, + "num_tokens": 4794149.0, + "logits/chosen": -0.640069723947673, + "logits/rejected": -0.5809591451997832, + "mean_token_accuracy": 0.6453945213742555, + "rewards/chosen": -0.495894172671542, + "rewards/rejected": -1.5554326001886511, + "rewards/accuracies": 0.77875, + "rewards/margins": 1.059538428708911, + "logps/chosen": -64.34471502423287, + "logps/rejected": -60.021323671340944, + "epoch": 0.3423058969970437, + "step": 330 + }, + { + "loss": 0.4895618438720703, + "grad_norm": 0.012254049070179462, + "learning_rate": 6.487046632124353e-06, + "entropy": 1.341764758527279, + "num_tokens": 4938961.0, + "logits/chosen": -0.6740448118186494, + "logits/rejected": -0.6176664939637678, + "mean_token_accuracy": 0.6506805537641048, + "rewards/chosen": -0.5430054054186622, + "rewards/rejected": -1.5190805373876355, + "rewards/accuracies": 0.78125, + "rewards/margins": 0.9760751294251532, + "logps/chosen": -62.98277623295784, + "logps/rejected": -58.627308850288394, + "epoch": 0.3526788029666511, + "step": 340 + }, + { + "loss": 0.4906949996948242, + "grad_norm": 0.012603401206433773, + "learning_rate": 6.383419689119171e-06, + "entropy": 1.335228986721486, + "num_tokens": 5085185.0, + "logits/chosen": -0.6529947110376427, + "logits/rejected": -0.6009205883950112, + "mean_token_accuracy": 0.6537076928000897, + "rewards/chosen": -0.5141149228686117, + "rewards/rejected": -1.5397958215233667, + "rewards/accuracies": 0.78375, + "rewards/margins": 1.0256808973429725, + "logps/chosen": -65.80777725458145, + "logps/rejected": -60.204533588886264, + "epoch": 0.3630517089362585, + "step": 350 + }, + { + "loss": 0.4906170845031738, + "grad_norm": 0.013215990737080574, + "learning_rate": 6.2797927461139905e-06, + "entropy": 1.2594143666606397, + "num_tokens": 5230359.0, + "logits/chosen": -0.7363216904006744, + "logits/rejected": -0.6437616409973009, + "mean_token_accuracy": 0.6658474483340978, + "rewards/chosen": -0.5248335571045755, + "rewards/rejected": -1.505687792309327, + "rewards/accuracies": 0.78, + "rewards/margins": 0.9808542363531888, + "logps/chosen": -61.92662429690361, + "logps/rejected": -57.71264513731003, + "epoch": 0.37342461490586587, + "step": 360 + }, + { + "loss": 0.47084531784057615, + "grad_norm": 0.010505126789212227, + "learning_rate": 6.176165803108809e-06, + "entropy": 1.3553831833507866, + "num_tokens": 5376488.0, + "logits/chosen": -0.6449173292890904, + "logits/rejected": -0.5551785184102145, + "mean_token_accuracy": 0.6537860439531505, + "rewards/chosen": -0.4608478151052259, + "rewards/rejected": -1.484516432384262, + "rewards/accuracies": 0.79125, + "rewards/margins": 1.0236686167120934, + "logps/chosen": -66.82504806637763, + "logps/rejected": -58.22365792274475, + "epoch": 0.38379752087547325, + "step": 370 + }, + { + "eval_loss": 0.5689035654067993, + "eval_runtime": 250.9045, + "eval_samples_per_second": 3.986, + "eval_steps_per_second": 3.986, + "eval_entropy": 0.9553070103861392, + "eval_num_tokens": 5448735.0, + "eval_logits/chosen": -0.2716756952684425, + "eval_logits/rejected": -0.16629699776825788, + "eval_mean_token_accuracy": 0.7177043009251356, + "eval_rewards/chosen": -0.11320603249309352, + "eval_rewards/rejected": -0.5053918305169282, + "eval_rewards/accuracies": 0.725, + "eval_rewards/margins": 0.392185798952356, + "eval_logps/chosen": -51.3050471496582, + "eval_logps/rejected": -57.69378993988037, + "epoch": 0.38898397386027694, + "step": 375 + }, + { + "loss": 0.45557408332824706, + "grad_norm": 0.010905127041041851, + "learning_rate": 6.0725388601036275e-06, + "entropy": 1.3120742352865635, + "num_tokens": 5521548.0, + "logits/chosen": -0.6177198584454004, + "logits/rejected": -0.5450247570549444, + "mean_token_accuracy": 0.6573154540918767, + "rewards/chosen": -0.3887985857592139, + "rewards/rejected": -1.4611027611684404, + "rewards/accuracies": 0.815, + "rewards/margins": 1.0723041738849133, + "logps/chosen": -62.481010044813154, + "logps/rejected": -56.344697498083114, + "epoch": 0.39417042684508063, + "step": 380 + }, + { + "loss": 0.4662487983703613, + "grad_norm": 0.010954899713397026, + "learning_rate": 5.968911917098445e-06, + "entropy": 1.345905083543621, + "num_tokens": 5667800.0, + "logits/chosen": -0.5844921973924755, + "logits/rejected": -0.48380765844974577, + "mean_token_accuracy": 0.6540606117062271, + "rewards/chosen": -0.390090519907244, + "rewards/rejected": -1.462948713658261, + "rewards/accuracies": 0.8025, + "rewards/margins": 1.07285819449462, + "logps/chosen": -64.31483766436577, + "logps/rejected": -59.39098523259163, + "epoch": 0.404543332814688, + "step": 390 + }, + { + "loss": 0.46701774597167967, + "grad_norm": 0.010829386301338673, + "learning_rate": 5.865284974093265e-06, + "entropy": 1.3651179377734661, + "num_tokens": 5813205.0, + "logits/chosen": -0.5822485740098883, + "logits/rejected": -0.5166833227123047, + "mean_token_accuracy": 0.6551306374650449, + "rewards/chosen": -0.35834275034227175, + "rewards/rejected": -1.365874043785443, + "rewards/accuracies": 0.78875, + "rewards/margins": 1.0075312922801822, + "logps/chosen": -63.65349508166313, + "logps/rejected": -58.2333509349823, + "epoch": 0.4149162387842954, + "step": 400 + }, + { + "loss": 0.46943206787109376, + "grad_norm": 0.012473917566239834, + "learning_rate": 5.761658031088083e-06, + "entropy": 1.3225441289972515, + "num_tokens": 5959181.0, + "logits/chosen": -0.6183900032329287, + "logits/rejected": -0.5336649034548987, + "mean_token_accuracy": 0.6569803632609547, + "rewards/chosen": -0.35909413290792147, + "rewards/rejected": -1.3612432872604223, + "rewards/accuracies": 0.795, + "rewards/margins": 1.002149153780192, + "logps/chosen": -62.85942430019379, + "logps/rejected": -57.029898535013196, + "epoch": 0.4252891447539028, + "step": 410 + }, + { + "loss": 0.43849844932556153, + "grad_norm": 0.008844634518027306, + "learning_rate": 5.658031088082902e-06, + "entropy": 1.3128622455336154, + "num_tokens": 6104961.0, + "logits/chosen": -0.6210691174054768, + "logits/rejected": -0.576289690726631, + "mean_token_accuracy": 0.6577657607197761, + "rewards/chosen": -0.3327711314160842, + "rewards/rejected": -1.4455869932868517, + "rewards/accuracies": 0.825, + "rewards/margins": 1.1128158613247796, + "logps/chosen": -64.98676935911179, + "logps/rejected": -57.15970268011093, + "epoch": 0.4356620507235102, + "step": 420 + }, + { + "loss": 0.43562884330749513, + "grad_norm": 0.00888186227530241, + "learning_rate": 5.554404145077721e-06, + "entropy": 1.3373534345161169, + "num_tokens": 6251772.0, + "logits/chosen": -0.5417993838933208, + "logits/rejected": -0.4885455063213445, + "mean_token_accuracy": 0.6521896417625248, + "rewards/chosen": -0.39902110468392493, + "rewards/rejected": -1.5569669758284, + "rewards/accuracies": 0.83625, + "rewards/margins": 1.1579458705382422, + "logps/chosen": -63.90601393699646, + "logps/rejected": -58.24345481872559, + "epoch": 0.4460349566931176, + "step": 430 + }, + { + "loss": 0.4367820262908936, + "grad_norm": 0.011835568584501743, + "learning_rate": 5.4507772020725395e-06, + "entropy": 1.302687416060362, + "num_tokens": 6397498.0, + "logits/chosen": -0.6515899833172267, + "logits/rejected": -0.5672783053215388, + "mean_token_accuracy": 0.6643678575474768, + "rewards/chosen": -0.4223745361570036, + "rewards/rejected": -1.5821643100841902, + "rewards/accuracies": 0.8225, + "rewards/margins": 1.1597897751070558, + "logps/chosen": -62.087783161401745, + "logps/rejected": -58.09040701627731, + "epoch": 0.456407862662725, + "step": 440 + }, + { + "loss": 0.4615288257598877, + "grad_norm": 0.011570082977414131, + "learning_rate": 5.347150259067357e-06, + "entropy": 1.3379024799168109, + "num_tokens": 6544292.0, + "logits/chosen": -0.6416285881723627, + "logits/rejected": -0.5313172360798328, + "mean_token_accuracy": 0.6538208884559572, + "rewards/chosen": -0.43649624643381685, + "rewards/rejected": -1.6286552884728007, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.192159042903222, + "logps/chosen": -62.45707392811775, + "logps/rejected": -60.70825082540512, + "epoch": 0.46678076863233237, + "step": 450 + }, + { + "loss": 0.4522082328796387, + "grad_norm": 0.01289224810898304, + "learning_rate": 5.243523316062177e-06, + "entropy": 1.2857942930911668, + "num_tokens": 6688703.0, + "logits/chosen": -0.6984393716749847, + "logits/rejected": -0.616657341014624, + "mean_token_accuracy": 0.6569575572758913, + "rewards/chosen": -0.4177262162156694, + "rewards/rejected": -1.5946978869343729, + "rewards/accuracies": 0.82125, + "rewards/margins": 1.1769716703612358, + "logps/chosen": -62.88765250682831, + "logps/rejected": -57.941710426807404, + "epoch": 0.47715367460193975, + "step": 460 + }, + { + "loss": 0.4684887886047363, + "grad_norm": 0.013750020414590836, + "learning_rate": 5.139896373056995e-06, + "entropy": 1.2873771674977617, + "num_tokens": 6831976.0, + "logits/chosen": -0.7360928165548556, + "logits/rejected": -0.6532006934035273, + "mean_token_accuracy": 0.649969874471426, + "rewards/chosen": -0.45782311129412845, + "rewards/rejected": -1.5659245843085228, + "rewards/accuracies": 0.7975, + "rewards/margins": 1.1081014727987348, + "logps/chosen": -62.05344919681549, + "logps/rejected": -57.16824733495712, + "epoch": 0.48752658057154713, + "step": 470 + }, + { + "loss": 0.4470407962799072, + "grad_norm": 0.010775277391076088, + "learning_rate": 5.036269430051814e-06, + "entropy": 1.3075012436602265, + "num_tokens": 6979562.0, + "logits/chosen": -0.6950100893212269, + "logits/rejected": -0.6174856653398093, + "mean_token_accuracy": 0.6546831333450973, + "rewards/chosen": -0.4612816582483902, + "rewards/rejected": -1.6060521737975069, + "rewards/accuracies": 0.79625, + "rewards/margins": 1.1447705142386257, + "logps/chosen": -65.90533972740174, + "logps/rejected": -60.80634157061577, + "epoch": 0.4978994865411545, + "step": 480 + }, + { + "loss": 0.44890718460083007, + "grad_norm": 0.010780111886560917, + "learning_rate": 4.932642487046633e-06, + "entropy": 1.2887511976994575, + "num_tokens": 7126641.0, + "logits/chosen": -0.6761976126203127, + "logits/rejected": -0.6278953113861633, + "mean_token_accuracy": 0.6634333984181285, + "rewards/chosen": -0.4675208572049451, + "rewards/rejected": -1.6545327439898392, + "rewards/accuracies": 0.82375, + "rewards/margins": 1.1870118879154326, + "logps/chosen": -63.26052482247353, + "logps/rejected": -61.286433795690535, + "epoch": 0.5082723925107618, + "step": 490 + }, + { + "loss": 0.4814422607421875, + "grad_norm": 0.012935275211930275, + "learning_rate": 4.829015544041451e-06, + "entropy": 1.27828567199409, + "num_tokens": 7271511.0, + "logits/chosen": -0.7259033669003568, + "logits/rejected": -0.6351857639096569, + "mean_token_accuracy": 0.6566927696019411, + "rewards/chosen": -0.43330920343832985, + "rewards/rejected": -1.5484318724216428, + "rewards/accuracies": 0.78875, + "rewards/margins": 1.1151226695766672, + "logps/chosen": -61.74719344258308, + "logps/rejected": -59.84465143203735, + "epoch": 0.5186452984803692, + "step": 500 + }, + { + "eval_loss": 0.5487673282623291, + "eval_runtime": 282.9922, + "eval_samples_per_second": 3.534, + "eval_steps_per_second": 3.534, + "eval_entropy": 0.9428232955671847, + "eval_num_tokens": 7271511.0, + "eval_logits/chosen": -0.28059689932805515, + "eval_logits/rejected": -0.16151944836492374, + "eval_mean_token_accuracy": 0.7168366620391607, + "eval_rewards/chosen": -0.1563246784962248, + "eval_rewards/rejected": -0.6193268298726762, + "eval_rewards/accuracies": 0.754, + "eval_rewards/margins": 0.4630021521952003, + "eval_logps/chosen": -51.73623360443115, + "eval_logps/rejected": -58.83313990974426, + "epoch": 0.5186452984803692, + "step": 500 + }, + { + "loss": 0.4656700134277344, + "grad_norm": 0.01303118746727705, + "learning_rate": 4.72538860103627e-06, + "entropy": 1.2692697253311054, + "num_tokens": 7417281.0, + "logits/chosen": -0.6733742115379525, + "logits/rejected": -0.6193994454969072, + "mean_token_accuracy": 0.6586294612661004, + "rewards/chosen": -0.43541748865740376, + "rewards/rejected": -1.5032758536882467, + "rewards/accuracies": 0.815, + "rewards/margins": 1.0678583633713423, + "logps/chosen": -64.05021148204804, + "logps/rejected": -56.13307309627533, + "epoch": 0.5290182044499767, + "step": 510 + }, + { + "loss": 0.4864551067352295, + "grad_norm": 0.01242531556636095, + "learning_rate": 4.621761658031089e-06, + "entropy": 1.2640815615979955, + "num_tokens": 7560432.0, + "logits/chosen": -0.7002353169810469, + "logits/rejected": -0.6140356327426939, + "mean_token_accuracy": 0.6589579802565276, + "rewards/chosen": -0.38904498486765077, + "rewards/rejected": -1.4170939752570848, + "rewards/accuracies": 0.7925, + "rewards/margins": 1.0280489912256598, + "logps/chosen": -60.270782203674315, + "logps/rejected": -56.58300987482071, + "epoch": 0.5393911104195841, + "step": 520 + }, + { + "loss": 0.4569260597229004, + "grad_norm": 0.01068835612386465, + "learning_rate": 4.518134715025907e-06, + "entropy": 1.3159204521216452, + "num_tokens": 7705977.0, + "logits/chosen": -0.6491517350356284, + "logits/rejected": -0.5585772213969517, + "mean_token_accuracy": 0.6497207802906633, + "rewards/chosen": -0.3849831897905824, + "rewards/rejected": -1.5199620288111328, + "rewards/accuracies": 0.82125, + "rewards/margins": 1.1349788387073203, + "logps/chosen": -63.44159636735916, + "logps/rejected": -59.03181514501571, + "epoch": 0.5497640163891915, + "step": 530 + }, + { + "loss": 0.4587429046630859, + "grad_norm": 0.013803384266793728, + "learning_rate": 4.414507772020726e-06, + "entropy": 1.291237823315896, + "num_tokens": 7852079.0, + "logits/chosen": -0.6414628461310453, + "logits/rejected": -0.5613248039563115, + "mean_token_accuracy": 0.6623153394274414, + "rewards/chosen": -0.4346328362337226, + "rewards/rejected": -1.540268263059552, + "rewards/accuracies": 0.8125, + "rewards/margins": 1.1056354277441278, + "logps/chosen": -62.11032348752022, + "logps/rejected": -58.996895933151244, + "epoch": 0.5601369223587989, + "step": 540 + }, + { + "loss": 0.46028594970703124, + "grad_norm": 0.013468707911670208, + "learning_rate": 4.310880829015544e-06, + "entropy": 1.3394903557561337, + "num_tokens": 7999115.0, + "logits/chosen": -0.5828356510219183, + "logits/rejected": -0.5372745959336506, + "mean_token_accuracy": 0.6568853073753417, + "rewards/chosen": -0.4290946354267362, + "rewards/rejected": -1.5929214715841227, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.1638268361473456, + "logps/chosen": -65.59857477068901, + "logps/rejected": -62.133251576423646, + "epoch": 0.5705098283284062, + "step": 550 + }, + { + "loss": 0.45781307220458983, + "grad_norm": 0.014243297278881073, + "learning_rate": 4.207253886010363e-06, + "entropy": 1.2652439445722847, + "num_tokens": 8145639.0, + "logits/chosen": -0.6962334313624986, + "logits/rejected": -0.6396616762561939, + "mean_token_accuracy": 0.6539523831009865, + "rewards/chosen": -0.42706657521594027, + "rewards/rejected": -1.5893809160019736, + "rewards/accuracies": 0.795, + "rewards/margins": 1.16231434000656, + "logps/chosen": -63.68221395015716, + "logps/rejected": -58.812913880348205, + "epoch": 0.5808827342980136, + "step": 560 + }, + { + "loss": 0.45180602073669435, + "grad_norm": 0.011750273406505585, + "learning_rate": 4.103626943005182e-06, + "entropy": 1.271689679301344, + "num_tokens": 8289932.0, + "logits/chosen": -0.6709009276653929, + "logits/rejected": -0.6110994225113662, + "mean_token_accuracy": 0.6528454353101552, + "rewards/chosen": -0.43575992634396243, + "rewards/rejected": -1.544044768281892, + "rewards/accuracies": 0.81875, + "rewards/margins": 1.1082848401460796, + "logps/chosen": -63.166086630821226, + "logps/rejected": -56.468742752075194, + "epoch": 0.591255640267621, + "step": 570 + }, + { + "loss": 0.46036481857299805, + "grad_norm": 0.014452456496655941, + "learning_rate": 4.000000000000001e-06, + "entropy": 1.254093002313748, + "num_tokens": 8433751.0, + "logits/chosen": -0.7479031936089587, + "logits/rejected": -0.660857903954597, + "mean_token_accuracy": 0.66091203879565, + "rewards/chosen": -0.4369000616581616, + "rewards/rejected": -1.5926436452555937, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.1557435841672123, + "logps/chosen": -60.516501158475876, + "logps/rejected": -57.770808889865876, + "epoch": 0.6016285462372284, + "step": 580 + }, + { + "loss": 0.4958089828491211, + "grad_norm": 0.014941485598683357, + "learning_rate": 3.896373056994819e-06, + "entropy": 1.2861195527855307, + "num_tokens": 8580235.0, + "logits/chosen": -0.7134623334720516, + "logits/rejected": -0.6337572470141326, + "mean_token_accuracy": 0.6624758186563849, + "rewards/chosen": -0.48507625065831234, + "rewards/rejected": -1.5025616684707348, + "rewards/accuracies": 0.7675, + "rewards/margins": 1.0174854172300547, + "logps/chosen": -64.41009007811546, + "logps/rejected": -59.815929347276686, + "epoch": 0.6120014522068358, + "step": 590 + }, + { + "loss": 0.47800679206848146, + "grad_norm": 0.01430908776819706, + "learning_rate": 3.7927461139896377e-06, + "entropy": 1.2737568323127926, + "num_tokens": 8723363.0, + "logits/chosen": -0.6718185966589912, + "logits/rejected": -0.5801828286442322, + "mean_token_accuracy": 0.6622481289878488, + "rewards/chosen": -0.38251684666481195, + "rewards/rejected": -1.4414349760363712, + "rewards/accuracies": 0.78375, + "rewards/margins": 1.0589181298250332, + "logps/chosen": -59.11278188347816, + "logps/rejected": -57.41570061087609, + "epoch": 0.6223743581764432, + "step": 600 + }, + { + "loss": 0.4607038974761963, + "grad_norm": 0.016786962747573853, + "learning_rate": 3.6891191709844567e-06, + "entropy": 1.3031947114598006, + "num_tokens": 8867843.0, + "logits/chosen": -0.660966853554005, + "logits/rejected": -0.582685814465534, + "mean_token_accuracy": 0.6579678988829255, + "rewards/chosen": -0.3749055393272283, + "rewards/rejected": -1.4482067039191133, + "rewards/accuracies": 0.815, + "rewards/margins": 1.0733011648245157, + "logps/chosen": -59.77094477295876, + "logps/rejected": -58.26709199547768, + "epoch": 0.6327472641460505, + "step": 610 + }, + { + "loss": 0.4435013771057129, + "grad_norm": 0.013243520632386208, + "learning_rate": 3.5854922279792748e-06, + "entropy": 1.2442782195843756, + "num_tokens": 9012429.0, + "logits/chosen": -0.7155245964218712, + "logits/rejected": -0.62228141826014, + "mean_token_accuracy": 0.6603258750028909, + "rewards/chosen": -0.35220212864573114, + "rewards/rejected": -1.49272357024136, + "rewards/accuracies": 0.8175, + "rewards/margins": 1.1405214420426637, + "logps/chosen": -58.541049842834475, + "logps/rejected": -57.54325157284737, + "epoch": 0.6431201701156579, + "step": 620 + }, + { + "eval_loss": 0.5402435660362244, + "eval_runtime": 293.8352, + "eval_samples_per_second": 3.403, + "eval_steps_per_second": 3.403, + "eval_entropy": 0.9412421704679728, + "eval_num_tokens": 9084893.0, + "eval_logits/chosen": -0.2831247920504241, + "eval_logits/rejected": -0.15805534941173774, + "eval_mean_token_accuracy": 0.7173487603366375, + "eval_rewards/chosen": -0.163662012138695, + "eval_rewards/rejected": -0.6573172951535962, + "eval_rewards/accuracies": 0.763, + "eval_rewards/margins": 0.49365528268739584, + "eval_logps/chosen": -51.8096069393158, + "eval_logps/rejected": -59.21304455375672, + "epoch": 0.6483066231004616, + "step": 625 + }, + { + "loss": 0.45146970748901366, + "grad_norm": 0.011234515346586704, + "learning_rate": 3.4818652849740937e-06, + "entropy": 1.2889114275900646, + "num_tokens": 9158703.0, + "logits/chosen": -0.6542699654733424, + "logits/rejected": -0.5822428945211472, + "mean_token_accuracy": 0.6584817282296718, + "rewards/chosen": -0.3719235458994808, + "rewards/rejected": -1.5630993095623853, + "rewards/accuracies": 0.8, + "rewards/margins": 1.1911757623543964, + "logps/chosen": -61.62524257659912, + "logps/rejected": -59.77060217618942, + "epoch": 0.6534930760852653, + "step": 630 + }, + { + "loss": 0.45473732948303225, + "grad_norm": 0.01427957508713007, + "learning_rate": 3.3782383419689123e-06, + "entropy": 1.270301983555546, + "num_tokens": 9303628.0, + "logits/chosen": -0.6727831000063272, + "logits/rejected": -0.5958556125497929, + "mean_token_accuracy": 0.6592282411269843, + "rewards/chosen": -0.39630664114709363, + "rewards/rejected": -1.5085867938393493, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.112280152433086, + "logps/chosen": -60.25154410600662, + "logps/rejected": -59.81609448671341, + "epoch": 0.6638659820548727, + "step": 640 + }, + { + "loss": 0.4724769115447998, + "grad_norm": 0.011104694567620754, + "learning_rate": 3.274611398963731e-06, + "entropy": 1.2825965376850217, + "num_tokens": 9447859.0, + "logits/chosen": -0.6886272934207637, + "logits/rejected": -0.6191571248326155, + "mean_token_accuracy": 0.657224724534899, + "rewards/chosen": -0.39751313600787397, + "rewards/rejected": -1.501351127484304, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.1038379945326597, + "logps/chosen": -61.231552537679676, + "logps/rejected": -57.24312862277031, + "epoch": 0.6742388880244801, + "step": 650 + }, + { + "loss": 0.48994994163513184, + "grad_norm": 0.015749365091323853, + "learning_rate": 3.1709844559585493e-06, + "entropy": 1.2718282664287834, + "num_tokens": 9591275.0, + "logits/chosen": -0.7000141689252796, + "logits/rejected": -0.6344551697912493, + "mean_token_accuracy": 0.6556407183595002, + "rewards/chosen": -0.3735031143521701, + "rewards/rejected": -1.4077299095626221, + "rewards/accuracies": 0.8075, + "rewards/margins": 1.034226797488518, + "logps/chosen": -60.32739723324776, + "logps/rejected": -56.30893276691437, + "epoch": 0.6846117939940874, + "step": 660 + }, + { + "loss": 0.42113280296325684, + "grad_norm": 0.011937125585973263, + "learning_rate": 3.0673575129533683e-06, + "entropy": 1.27422906415537, + "num_tokens": 9737336.0, + "logits/chosen": -0.6675869420516058, + "logits/rejected": -0.6171588368781001, + "mean_token_accuracy": 0.6570126633532345, + "rewards/chosen": -0.3044447978468088, + "rewards/rejected": -1.5031647271365, + "rewards/accuracies": 0.8175, + "rewards/margins": 1.1987199306860565, + "logps/chosen": -62.614556882381436, + "logps/rejected": -57.67475826740265, + "epoch": 0.6949846999636948, + "step": 670 + }, + { + "loss": 0.4509533405303955, + "grad_norm": 0.014425016939640045, + "learning_rate": 2.963730569948187e-06, + "entropy": 1.2917946016066708, + "num_tokens": 9884203.0, + "logits/chosen": -0.6209272877296821, + "logits/rejected": -0.5547300822758102, + "mean_token_accuracy": 0.6614484623633325, + "rewards/chosen": -0.34687376230140216, + "rewards/rejected": -1.5009351192926987, + "rewards/accuracies": 0.8025, + "rewards/margins": 1.1540613523963839, + "logps/chosen": -63.675368639230726, + "logps/rejected": -59.546725879907605, + "epoch": 0.7053576059333022, + "step": 680 + }, + { + "loss": 0.49210338592529296, + "grad_norm": 0.01453041099011898, + "learning_rate": 2.8601036269430053e-06, + "entropy": 1.318970390278846, + "num_tokens": 10030490.0, + "logits/chosen": -0.6129511188439006, + "logits/rejected": -0.5470711603742071, + "mean_token_accuracy": 0.6580428531672805, + "rewards/chosen": -0.35959291283600125, + "rewards/rejected": -1.394242706346704, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.0346497943252324, + "logps/chosen": -64.7718941605091, + "logps/rejected": -57.55288832068443, + "epoch": 0.7157305119029096, + "step": 690 + }, + { + "loss": 0.4248403549194336, + "grad_norm": 0.012130402959883213, + "learning_rate": 2.7564766839378243e-06, + "entropy": 1.2868076485674829, + "num_tokens": 10175134.0, + "logits/chosen": -0.6680388671827403, + "logits/rejected": -0.5829757325025796, + "mean_token_accuracy": 0.6597682436835021, + "rewards/chosen": -0.30255757274717326, + "rewards/rejected": -1.4632275151461362, + "rewards/accuracies": 0.82875, + "rewards/margins": 1.1606699449336155, + "logps/chosen": -62.52647110342979, + "logps/rejected": -54.934954075813295, + "epoch": 0.726103417872517, + "step": 700 + }, + { + "loss": 0.46398053169250486, + "grad_norm": 0.010899660177528858, + "learning_rate": 2.6528497409326424e-06, + "entropy": 1.3012964005907997, + "num_tokens": 10321605.0, + "logits/chosen": -0.6793537159810091, + "logits/rejected": -0.5945389351521791, + "mean_token_accuracy": 0.6582902568951249, + "rewards/chosen": -0.3586843095816721, + "rewards/rejected": -1.5040888605307554, + "rewards/accuracies": 0.78625, + "rewards/margins": 1.1454045504983514, + "logps/chosen": -66.0418261361122, + "logps/rejected": -57.98255445957184, + "epoch": 0.7364763238421244, + "step": 710 + }, + { + "loss": 0.45627450942993164, + "grad_norm": 0.015107187442481518, + "learning_rate": 2.5492227979274614e-06, + "entropy": 1.2992314287554472, + "num_tokens": 10464696.0, + "logits/chosen": -0.6788668626078029, + "logits/rejected": -0.598369878754869, + "mean_token_accuracy": 0.6590372899640351, + "rewards/chosen": -0.32335921899306413, + "rewards/rejected": -1.4580287650012178, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.1346695464709773, + "logps/chosen": -60.56386103153229, + "logps/rejected": -55.05920248985291, + "epoch": 0.7468492298117317, + "step": 720 + }, + { + "loss": 0.45744032859802247, + "grad_norm": 0.015074568800628185, + "learning_rate": 2.44559585492228e-06, + "entropy": 1.3187106101540849, + "num_tokens": 10611681.0, + "logits/chosen": -0.6193487567657021, + "logits/rejected": -0.5510364978587164, + "mean_token_accuracy": 0.6565000848285854, + "rewards/chosen": -0.3346571850046166, + "rewards/rejected": -1.5139837610156974, + "rewards/accuracies": 0.7975, + "rewards/margins": 1.1793265779595823, + "logps/chosen": -62.09045646429062, + "logps/rejected": -61.43362274646759, + "epoch": 0.7572221357813391, + "step": 730 + }, + { + "loss": 0.44286222457885743, + "grad_norm": 0.01326123159378767, + "learning_rate": 2.3419689119170984e-06, + "entropy": 1.327558269179426, + "num_tokens": 10756633.0, + "logits/chosen": -0.6719882830268841, + "logits/rejected": -0.5616402227001511, + "mean_token_accuracy": 0.6571272361278534, + "rewards/chosen": -0.33738715873330877, + "rewards/rejected": -1.5023427059937966, + "rewards/accuracies": 0.82125, + "rewards/margins": 1.1649555454589426, + "logps/chosen": -62.31321774363518, + "logps/rejected": -59.3358825302124, + "epoch": 0.7675950417509465, + "step": 740 + }, + { + "loss": 0.4650571823120117, + "grad_norm": 0.0126119963824749, + "learning_rate": 2.2383419689119174e-06, + "entropy": 1.29965307561215, + "num_tokens": 10905175.0, + "logits/chosen": -0.6533030424492793, + "logits/rejected": -0.5875300805405916, + "mean_token_accuracy": 0.6576582338660956, + "rewards/chosen": -0.40247532632221467, + "rewards/rejected": -1.5875308242870414, + "rewards/accuracies": 0.79, + "rewards/margins": 1.1850554993841798, + "logps/chosen": -65.17352761864662, + "logps/rejected": -62.21493496775627, + "epoch": 0.7779679477205539, + "step": 750 + }, + { + "eval_loss": 0.5359359383583069, + "eval_runtime": 320.8935, + "eval_samples_per_second": 3.116, + "eval_steps_per_second": 3.116, + "eval_entropy": 0.9404631896130741, + "eval_num_tokens": 10905175.0, + "eval_logits/chosen": -0.2688203306854898, + "eval_logits/rejected": -0.1410600388922386, + "eval_mean_token_accuracy": 0.7175761694908143, + "eval_rewards/chosen": -0.1531370894421125, + "eval_rewards/rejected": -0.6597482364820425, + "eval_rewards/accuracies": 0.764, + "eval_rewards/margins": 0.5066111467555166, + "eval_logps/chosen": -51.70435771179199, + "eval_logps/rejected": -59.23735397338867, + "epoch": 0.7779679477205539, + "step": 750 + }, + { + "loss": 0.44441781044006345, + "grad_norm": 0.01466372236609459, + "learning_rate": 2.134715025906736e-06, + "entropy": 1.28976634433493, + "num_tokens": 11051293.0, + "logits/chosen": -0.7179963626211149, + "logits/rejected": -0.6301743637240872, + "mean_token_accuracy": 0.6519320147298276, + "rewards/chosen": -0.35903158226523374, + "rewards/rejected": -1.4595573616991169, + "rewards/accuracies": 0.805, + "rewards/margins": 1.100525778569281, + "logps/chosen": -62.626072100400926, + "logps/rejected": -58.10015594720841, + "epoch": 0.7883408536901613, + "step": 760 + }, + { + "loss": 0.4427034854888916, + "grad_norm": 0.012671389617025852, + "learning_rate": 2.0310880829015544e-06, + "entropy": 1.3044293180131354, + "num_tokens": 11200144.0, + "logits/chosen": -0.6538815830450716, + "logits/rejected": -0.5728917452531731, + "mean_token_accuracy": 0.6632946115918458, + "rewards/chosen": -0.37740983954085094, + "rewards/rejected": -1.6017498846648959, + "rewards/accuracies": 0.82375, + "rewards/margins": 1.2243400452192872, + "logps/chosen": -65.87450021147728, + "logps/rejected": -62.50144905328751, + "epoch": 0.7987137596597687, + "step": 770 + }, + { + "loss": 0.47789411544799804, + "grad_norm": 0.014209717512130737, + "learning_rate": 1.9274611398963734e-06, + "entropy": 1.2642307026335038, + "num_tokens": 11345001.0, + "logits/chosen": -0.7598325245824121, + "logits/rejected": -0.6345409980160763, + "mean_token_accuracy": 0.6561008535698056, + "rewards/chosen": -0.4101038860027188, + "rewards/rejected": -1.5055885665896493, + "rewards/accuracies": 0.7925, + "rewards/margins": 1.09548467958346, + "logps/chosen": -60.939151479005815, + "logps/rejected": -59.33771441936493, + "epoch": 0.809086665629376, + "step": 780 + }, + { + "loss": 0.45084495544433595, + "grad_norm": 0.01159591879695654, + "learning_rate": 1.823834196891192e-06, + "entropy": 1.2825998100219294, + "num_tokens": 11490957.0, + "logits/chosen": -0.6798757077356125, + "logits/rejected": -0.5974159600128078, + "mean_token_accuracy": 0.6551897264830768, + "rewards/chosen": -0.37878839314620566, + "rewards/rejected": -1.565106635761622, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.1863182406220585, + "logps/chosen": -62.11761864900589, + "logps/rejected": -58.61645050764084, + "epoch": 0.8194595715989834, + "step": 790 + }, + { + "loss": 0.4757333278656006, + "grad_norm": 0.01929500699043274, + "learning_rate": 1.7202072538860104e-06, + "entropy": 1.3137290544318967, + "num_tokens": 11635952.0, + "logits/chosen": -0.7116650574710064, + "logits/rejected": -0.6434065148170602, + "mean_token_accuracy": 0.6526090941950679, + "rewards/chosen": -0.39931287897430595, + "rewards/rejected": -1.51923489038134, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.119922012281604, + "logps/chosen": -63.77980515360832, + "logps/rejected": -58.51232698440552, + "epoch": 0.8298324775685908, + "step": 800 + }, + { + "loss": 0.4533553600311279, + "grad_norm": 0.011488179676234722, + "learning_rate": 1.6165803108808292e-06, + "entropy": 1.2781752744410186, + "num_tokens": 11781419.0, + "logits/chosen": -0.7322858283680784, + "logits/rejected": -0.6704393794115492, + "mean_token_accuracy": 0.6515787079930305, + "rewards/chosen": -0.3753399283361523, + "rewards/rejected": -1.5520857451565098, + "rewards/accuracies": 0.805, + "rewards/margins": 1.1767458136426285, + "logps/chosen": -62.6512784576416, + "logps/rejected": -59.1226301574707, + "epoch": 0.8402053835381982, + "step": 810 + }, + { + "loss": 0.459058952331543, + "grad_norm": 0.010664924047887325, + "learning_rate": 1.5129533678756477e-06, + "entropy": 1.2839164751721546, + "num_tokens": 11926234.0, + "logits/chosen": -0.668114556411545, + "logits/rejected": -0.6314948882239511, + "mean_token_accuracy": 0.6545133054628969, + "rewards/chosen": -0.3676813648158713, + "rewards/rejected": -1.5132245452463393, + "rewards/accuracies": 0.815, + "rewards/margins": 1.145543181069661, + "logps/chosen": -63.80598108768463, + "logps/rejected": -57.3190500497818, + "epoch": 0.8505782895078056, + "step": 820 + }, + { + "loss": 0.45433964729309084, + "grad_norm": 0.013902204111218452, + "learning_rate": 1.4093264248704663e-06, + "entropy": 1.2906162818288431, + "num_tokens": 12071032.0, + "logits/chosen": -0.6819364086266573, + "logits/rejected": -0.5817802480567199, + "mean_token_accuracy": 0.6650253617018461, + "rewards/chosen": -0.3574298277559137, + "rewards/rejected": -1.5355529067799216, + "rewards/accuracies": 0.82125, + "rewards/margins": 1.1781230779876932, + "logps/chosen": -59.579396767616274, + "logps/rejected": -58.291543385982514, + "epoch": 0.860951195477413, + "step": 830 + }, + { + "loss": 0.43956761360168456, + "grad_norm": 0.017366426065564156, + "learning_rate": 1.3056994818652852e-06, + "entropy": 1.3188584124017506, + "num_tokens": 12216650.0, + "logits/chosen": -0.6219026821907607, + "logits/rejected": -0.5560462281839198, + "mean_token_accuracy": 0.6576781215891242, + "rewards/chosen": -0.3260511834644603, + "rewards/rejected": -1.558354403564008, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.2323032197169959, + "logps/chosen": -64.06994863152504, + "logps/rejected": -58.97870760083199, + "epoch": 0.8713241014470204, + "step": 840 + }, + { + "loss": 0.46459689140319826, + "grad_norm": 0.012618121691048145, + "learning_rate": 1.2020725388601037e-06, + "entropy": 1.315548148807138, + "num_tokens": 12362070.0, + "logits/chosen": -0.6251195627372872, + "logits/rejected": -0.5604575453557197, + "mean_token_accuracy": 0.6604597151651979, + "rewards/chosen": -0.3555148102169187, + "rewards/rejected": -1.5313407544395887, + "rewards/accuracies": 0.79625, + "rewards/margins": 1.1758259430155158, + "logps/chosen": -62.78060804247856, + "logps/rejected": -58.929887549877165, + "epoch": 0.8816970074166278, + "step": 850 + }, + { + "loss": 0.44550557136535646, + "grad_norm": 0.013532118871808052, + "learning_rate": 1.0984455958549225e-06, + "entropy": 1.3122669545235113, + "num_tokens": 12509338.0, + "logits/chosen": -0.6126990686398949, + "logits/rejected": -0.5539581104426821, + "mean_token_accuracy": 0.6569988044165075, + "rewards/chosen": -0.38766197150049264, + "rewards/rejected": -1.5939512548525818, + "rewards/accuracies": 0.81875, + "rewards/margins": 1.2062892844853923, + "logps/chosen": -65.91424354076385, + "logps/rejected": -59.84309137582779, + "epoch": 0.8920699133862352, + "step": 860 + }, + { + "loss": 0.44367341995239257, + "grad_norm": 0.014622218906879425, + "learning_rate": 9.94818652849741e-07, + "entropy": 1.29490221851971, + "num_tokens": 12656013.0, + "logits/chosen": -0.6367152223575993, + "logits/rejected": -0.5619754576335303, + "mean_token_accuracy": 0.6582811014540494, + "rewards/chosen": -0.3575555875984719, + "rewards/rejected": -1.485135663910769, + "rewards/accuracies": 0.81625, + "rewards/margins": 1.1275800754828378, + "logps/chosen": -64.74992589473725, + "logps/rejected": -58.28154501080513, + "epoch": 0.9024428193558426, + "step": 870 + }, + { + "eval_loss": 0.5303567051887512, + "eval_runtime": 351.9964, + "eval_samples_per_second": 2.841, + "eval_steps_per_second": 2.841, + "eval_entropy": 0.9427960855923593, + "eval_num_tokens": 12728578.0, + "eval_logits/chosen": -0.26863109543646074, + "eval_logits/rejected": -0.13725877180195847, + "eval_mean_token_accuracy": 0.7159041211903096, + "eval_rewards/chosen": -0.17772461017644672, + "eval_rewards/rejected": -0.7113549838000909, + "eval_rewards/accuracies": 0.763, + "eval_rewards/margins": 0.5336303729685024, + "eval_logps/chosen": -51.95023292160034, + "eval_logps/rejected": -59.75342144203186, + "epoch": 0.9076292723406463, + "step": 875 + }, + { + "loss": 0.42188777923583987, + "grad_norm": 0.014083835296332836, + "learning_rate": 8.911917098445596e-07, + "entropy": 1.2842787204217165, + "num_tokens": 12801884.0, + "logits/chosen": -0.6543839594717639, + "logits/rejected": -0.5576565805204583, + "mean_token_accuracy": 0.6647658421378583, + "rewards/chosen": -0.32246251756288985, + "rewards/rejected": -1.561580713846779, + "rewards/accuracies": 0.825, + "rewards/margins": 1.2391181947570293, + "logps/chosen": -60.62016844153404, + "logps/rejected": -60.981985919475555, + "epoch": 0.91281572532545, + "step": 880 + }, + { + "loss": 0.4861095905303955, + "grad_norm": 0.01509900763630867, + "learning_rate": 7.875647668393784e-07, + "entropy": 1.2736156480619685, + "num_tokens": 12946912.0, + "logits/chosen": -0.7128123134940787, + "logits/rejected": -0.6054497727959169, + "mean_token_accuracy": 0.6572731367498637, + "rewards/chosen": -0.4675049069095985, + "rewards/rejected": -1.5612919216800947, + "rewards/accuracies": 0.7825, + "rewards/margins": 1.0937870144005866, + "logps/chosen": -61.985627712011336, + "logps/rejected": -60.579013855457305, + "epoch": 0.9231886312950573, + "step": 890 + }, + { + "loss": 0.43419761657714845, + "grad_norm": 0.014685068279504776, + "learning_rate": 6.839378238341969e-07, + "entropy": 1.2819190438790247, + "num_tokens": 13093558.0, + "logits/chosen": -0.6502587498062717, + "logits/rejected": -0.5614254849582602, + "mean_token_accuracy": 0.6592135391384363, + "rewards/chosen": -0.36472693517142035, + "rewards/rejected": -1.6288802374559601, + "rewards/accuracies": 0.82, + "rewards/margins": 1.2641532999722402, + "logps/chosen": -61.57865165352821, + "logps/rejected": -62.50596989512444, + "epoch": 0.9335615372646647, + "step": 900 + }, + { + "loss": 0.4454813003540039, + "grad_norm": 0.011209873482584953, + "learning_rate": 5.803108808290156e-07, + "entropy": 1.3184868184709921, + "num_tokens": 13239740.0, + "logits/chosen": -0.6909169377714659, + "logits/rejected": -0.601211010607464, + "mean_token_accuracy": 0.6575440725311636, + "rewards/chosen": -0.36972430324880406, + "rewards/rejected": -1.6006858524744165, + "rewards/accuracies": 0.82875, + "rewards/margins": 1.2309615502599627, + "logps/chosen": -63.300528687238696, + "logps/rejected": -60.001617946624755, + "epoch": 0.9439344432342721, + "step": 910 + }, + { + "loss": 0.4595484733581543, + "grad_norm": 0.010628749616444111, + "learning_rate": 4.7668393782383424e-07, + "entropy": 1.271923498995602, + "num_tokens": 13383045.0, + "logits/chosen": -0.7072264696856618, + "logits/rejected": -0.6024060889326301, + "mean_token_accuracy": 0.6569805011339486, + "rewards/chosen": -0.3887278968687133, + "rewards/rejected": -1.5501526693382766, + "rewards/accuracies": 0.815, + "rewards/margins": 1.1614247707859613, + "logps/chosen": -60.07761764883995, + "logps/rejected": -56.95813281774521, + "epoch": 0.9543073492038795, + "step": 920 + }, + { + "loss": 0.4529257297515869, + "grad_norm": 0.014489009976387024, + "learning_rate": 3.730569948186528e-07, + "entropy": 1.2988391564786435, + "num_tokens": 13530054.0, + "logits/chosen": -0.7166704098766242, + "logits/rejected": -0.6650401865166429, + "mean_token_accuracy": 0.6520283976197243, + "rewards/chosen": -0.4043681784943692, + "rewards/rejected": -1.5586467561577593, + "rewards/accuracies": 0.81875, + "rewards/margins": 1.1542785764392465, + "logps/chosen": -64.28691901445389, + "logps/rejected": -60.51436370611191, + "epoch": 0.9646802551734869, + "step": 930 + }, + { + "loss": 0.4493688106536865, + "grad_norm": 0.0122548658400774, + "learning_rate": 2.694300518134715e-07, + "entropy": 1.293265828914009, + "num_tokens": 13676771.0, + "logits/chosen": -0.638114123144128, + "logits/rejected": -0.6033606771543887, + "mean_token_accuracy": 0.6584486217796802, + "rewards/chosen": -0.353517619818158, + "rewards/rejected": -1.4791943001397885, + "rewards/accuracies": 0.82625, + "rewards/margins": 1.1256766823492945, + "logps/chosen": -63.997545466423034, + "logps/rejected": -58.525367016792295, + "epoch": 0.9750531611430943, + "step": 940 + }, + { + "loss": 0.46651930809020997, + "grad_norm": 0.01745172217488289, + "learning_rate": 1.6580310880829015e-07, + "entropy": 1.2602451098989695, + "num_tokens": 13822091.0, + "logits/chosen": -0.7271677677940491, + "logits/rejected": -0.6540065888305867, + "mean_token_accuracy": 0.6601362200826406, + "rewards/chosen": -0.40040454823116306, + "rewards/rejected": -1.5421940996023478, + "rewards/accuracies": 0.80125, + "rewards/margins": 1.141789550515823, + "logps/chosen": -61.94225021719932, + "logps/rejected": -58.28781437397003, + "epoch": 0.9854260671127016, + "step": 950 + }, + { + "loss": 0.46761231422424315, + "grad_norm": 0.012348760850727558, + "learning_rate": 6.217616580310881e-08, + "entropy": 1.2971244535176083, + "num_tokens": 13969713.0, + "logits/chosen": -0.6472266813048246, + "logits/rejected": -0.5813531516986534, + "mean_token_accuracy": 0.6541070010513067, + "rewards/chosen": -0.4221547889366411, + "rewards/rejected": -1.5586294095951598, + "rewards/accuracies": 0.7925, + "rewards/margins": 1.1364746230933815, + "logps/chosen": -64.67578131318092, + "logps/rejected": -59.52407863378525, + "epoch": 0.995798973082309, + "step": 960 + }, + { + "train_runtime": 22000.2483, + "train_samples_per_second": 3.506, + "train_steps_per_second": 0.044, + "total_flos": 1.2331818072769536e+17, + "train_loss": 0.4788281094842624, + "entropy": 1.3463219977616343, + "num_tokens": 14029916.0, + "logits/chosen": -0.5587557057517026, + "logits/rejected": -0.5043508288937856, + "mean_token_accuracy": 0.6551804588072829, + "rewards/chosen": -0.42263167897738046, + "rewards/rejected": -1.5862010600171799, + "rewards/accuracies": 0.8148148148148148, + "rewards/margins": 1.163569376240542, + "logps/chosen": -66.20575960182849, + "logps/rejected": -63.83122500666865, + "epoch": 1.0, + "step": 965 + } + ], + "validation_monitor_size": 1000, + "validation_monitor_selection": "fixed_seed_random_without_replacement", + "validation_monitor_seed": 22, + "validation_monitor_indices": [ + 2, + 10, + 14, + 21, + 55, + 63, + 66, + 69, + 107, + 110, + 142, + 144, + 149, + 150, + 151, + 152, + 160, + 163, + 166, + 167, + 176, + 181, + 206, + 207, + 259, + 267, + 281, + 295, + 298, + 306, + 307, + 317, + 321, + 331, + 336, + 341, + 346, + 349, + 351, + 352, + 357, + 358, + 369, + 370, + 382, + 386, + 391, + 401, + 411, + 412, + 432, + 437, + 452, + 462, + 465, + 488, + 490, + 491, + 492, + 494, + 503, + 504, + 508, + 528, + 538, + 540, + 551, + 553, + 567, + 586, + 605, + 606, + 625, + 627, + 661, + 663, + 666, + 677, + 685, + 690, + 692, + 704, + 708, + 714, + 715, + 727, + 728, + 733, + 745, + 752, + 753, + 755, + 764, + 773, + 779, + 783, + 793, + 796, + 799, + 803, + 804, + 805, + 813, + 816, + 818, + 823, + 827, + 829, + 830, + 837, + 842, + 845, + 850, + 853, + 856, + 889, + 890, + 905, + 915, + 924, + 930, + 939, + 951, + 988, + 1002, + 1005, + 1023, + 1029, + 1038, + 1049, + 1050, + 1054, + 1056, + 1067, + 1068, + 1079, + 1088, + 1091, + 1103, + 1114, + 1118, + 1133, + 1140, + 1144, + 1145, + 1155, + 1186, + 1195, + 1206, + 1223, + 1251, + 1252, + 1257, + 1259, + 1270, + 1271, + 1295, + 1303, + 1304, + 1305, + 1329, + 1335, + 1336, + 1343, + 1367, + 1373, + 1377, + 1403, + 1412, + 1429, + 1443, + 1457, + 1459, + 1460, + 1476, + 1483, + 1486, + 1494, + 1507, + 1510, + 1519, + 1521, + 1522, + 1545, + 1551, + 1570, + 1582, + 1593, + 1595, + 1603, + 1607, + 1614, + 1615, + 1625, + 1634, + 1639, + 1648, + 1654, + 1657, + 1662, + 1667, + 1673, + 1690, + 1704, + 1746, + 1756, + 1781, + 1783, + 1796, + 1799, + 1809, + 1814, + 1827, + 1829, + 1832, + 1844, + 1847, + 1854, + 1856, + 1857, + 1858, + 1874, + 1883, + 1889, + 1924, + 1925, + 1931, + 1932, + 1934, + 1935, + 1938, + 1950, + 1957, + 1962, + 1967, + 1975, + 1982, + 1983, + 1991, + 1998, + 2003, + 2008, + 2017, + 2021, + 2026, + 2035, + 2040, + 2050, + 2056, + 2077, + 2079, + 2082, + 2098, + 2100, + 2108, + 2121, + 2130, + 2133, + 2134, + 2138, + 2143, + 2166, + 2167, + 2180, + 2181, + 2185, + 2204, + 2205, + 2212, + 2221, + 2224, + 2226, + 2230, + 2233, + 2256, + 2261, + 2263, + 2269, + 2273, + 2290, + 2291, + 2299, + 2301, + 2321, + 2323, + 2330, + 2384, + 2401, + 2417, + 2420, + 2421, + 2424, + 2430, + 2435, + 2456, + 2488, + 2502, + 2504, + 2519, + 2527, + 2532, + 2538, + 2542, + 2553, + 2555, + 2558, + 2559, + 2562, + 2578, + 2583, + 2585, + 2590, + 2592, + 2594, + 2596, + 2600, + 2606, + 2607, + 2618, + 2630, + 2637, + 2647, + 2650, + 2657, + 2679, + 2685, + 2705, + 2706, + 2712, + 2713, + 2714, + 2727, + 2740, + 2742, + 2755, + 2780, + 2784, + 2792, + 2807, + 2808, + 2810, + 2820, + 2831, + 2839, + 2860, + 2862, + 2863, + 2866, + 2875, + 2878, + 2898, + 2905, + 2921, + 2922, + 2926, + 2930, + 2934, + 2944, + 2955, + 2957, + 2959, + 2973, + 2978, + 2998, + 3018, + 3022, + 3028, + 3031, + 3061, + 3085, + 3090, + 3104, + 3105, + 3111, + 3115, + 3121, + 3122, + 3129, + 3133, + 3135, + 3161, + 3162, + 3169, + 3173, + 3194, + 3195, + 3215, + 3225, + 3226, + 3241, + 3247, + 3250, + 3253, + 3265, + 3268, + 3293, + 3301, + 3312, + 3329, + 3352, + 3361, + 3362, + 3376, + 3396, + 3401, + 3403, + 3410, + 3419, + 3432, + 3443, + 3452, + 3467, + 3469, + 3475, + 3485, + 3503, + 3514, + 3515, + 3524, + 3528, + 3538, + 3544, + 3557, + 3560, + 3565, + 3600, + 3637, + 3642, + 3658, + 3659, + 3692, + 3693, + 3699, + 3722, + 3725, + 3728, + 3731, + 3740, + 3742, + 3762, + 3766, + 3780, + 3788, + 3794, + 3796, + 3798, + 3805, + 3817, + 3819, + 3822, + 3837, + 3839, + 3843, + 3846, + 3851, + 3854, + 3865, + 3870, + 3871, + 3884, + 3894, + 3895, + 3896, + 3907, + 3911, + 3915, + 3919, + 3920, + 3923, + 3933, + 3955, + 3967, + 3972, + 3974, + 3975, + 3984, + 3985, + 3997, + 4002, + 4010, + 4034, + 4044, + 4063, + 4073, + 4079, + 4082, + 4088, + 4121, + 4145, + 4148, + 4159, + 4161, + 4164, + 4177, + 4188, + 4199, + 4203, + 4207, + 4208, + 4213, + 4221, + 4225, + 4233, + 4241, + 4243, + 4247, + 4264, + 4274, + 4282, + 4286, + 4290, + 4308, + 4310, + 4313, + 4321, + 4324, + 4327, + 4349, + 4362, + 4370, + 4374, + 4380, + 4407, + 4409, + 4411, + 4415, + 4417, + 4418, + 4427, + 4431, + 4433, + 4451, + 4466, + 4477, + 4478, + 4479, + 4493, + 4494, + 4514, + 4527, + 4539, + 4550, + 4558, + 4568, + 4579, + 4583, + 4584, + 4586, + 4587, + 4590, + 4599, + 4602, + 4610, + 4626, + 4627, + 4630, + 4641, + 4647, + 4655, + 4656, + 4657, + 4661, + 4685, + 4714, + 4715, + 4731, + 4749, + 4752, + 4769, + 4777, + 4782, + 4791, + 4805, + 4818, + 4829, + 4833, + 4837, + 4839, + 4843, + 4871, + 4875, + 4879, + 4880, + 4885, + 4888, + 4895, + 4900, + 4923, + 4966, + 4968, + 4972, + 4989, + 4994, + 4998, + 5001, + 5013, + 5019, + 5026, + 5032, + 5034, + 5046, + 5055, + 5085, + 5086, + 5088, + 5089, + 5090, + 5095, + 5108, + 5110, + 5119, + 5120, + 5121, + 5133, + 5148, + 5154, + 5160, + 5169, + 5178, + 5222, + 5223, + 5232, + 5233, + 5240, + 5256, + 5259, + 5264, + 5271, + 5276, + 5279, + 5294, + 5300, + 5303, + 5321, + 5335, + 5337, + 5345, + 5348, + 5365, + 5373, + 5378, + 5384, + 5422, + 5442, + 5443, + 5445, + 5477, + 5485, + 5495, + 5497, + 5504, + 5526, + 5533, + 5542, + 5564, + 5570, + 5579, + 5587, + 5592, + 5608, + 5610, + 5624, + 5630, + 5638, + 5651, + 5663, + 5670, + 5675, + 5691, + 5700, + 5706, + 5707, + 5715, + 5720, + 5721, + 5722, + 5732, + 5738, + 5741, + 5769, + 5771, + 5775, + 5795, + 5796, + 5800, + 5809, + 5810, + 5815, + 5819, + 5827, + 5848, + 5849, + 5852, + 5859, + 5880, + 5884, + 5907, + 5909, + 5912, + 5919, + 5931, + 5932, + 5934, + 5941, + 5948, + 5950, + 5952, + 5953, + 5969, + 5981, + 6000, + 6003, + 6010, + 6018, + 6041, + 6065, + 6075, + 6090, + 6103, + 6106, + 6109, + 6114, + 6123, + 6131, + 6136, + 6138, + 6139, + 6164, + 6165, + 6171, + 6173, + 6180, + 6185, + 6189, + 6190, + 6221, + 6223, + 6237, + 6255, + 6262, + 6265, + 6293, + 6296, + 6305, + 6318, + 6331, + 6336, + 6340, + 6355, + 6366, + 6371, + 6396, + 6399, + 6402, + 6408, + 6432, + 6433, + 6441, + 6456, + 6465, + 6478, + 6486, + 6489, + 6507, + 6508, + 6520, + 6522, + 6528, + 6537, + 6551, + 6564, + 6589, + 6590, + 6598, + 6599, + 6611, + 6613, + 6615, + 6621, + 6634, + 6647, + 6649, + 6654, + 6676, + 6680, + 6690, + 6708, + 6729, + 6736, + 6744, + 6749, + 6756, + 6761, + 6763, + 6773, + 6788, + 6790, + 6796, + 6797, + 6811, + 6824, + 6850, + 6869, + 6871, + 6882, + 6892, + 6895, + 6906, + 6911, + 6912, + 6914, + 6927, + 6952, + 6966, + 6985, + 7001, + 7021, + 7031, + 7035, + 7038, + 7041, + 7045, + 7052, + 7057, + 7058, + 7072, + 7073, + 7076, + 7086, + 7102, + 7107, + 7109, + 7117, + 7122, + 7125, + 7166, + 7182, + 7199, + 7207, + 7212, + 7215, + 7232, + 7243, + 7246, + 7250, + 7253, + 7258, + 7263, + 7267, + 7270, + 7274, + 7280, + 7286, + 7293, + 7298, + 7302, + 7306, + 7316, + 7325, + 7326, + 7334, + 7356, + 7357, + 7363, + 7364, + 7367, + 7385, + 7392, + 7399, + 7405, + 7416, + 7420, + 7421, + 7426, + 7452, + 7476, + 7481, + 7519, + 7534, + 7542, + 7546, + 7573, + 7585, + 7601, + 7604, + 7606, + 7609, + 7629, + 7649, + 7653, + 7667, + 7682, + 7699, + 7738, + 7750, + 7786, + 7798, + 7800, + 7801, + 7805, + 7806, + 7811, + 7813, + 7832, + 7837, + 7849, + 7856, + 7876, + 7877, + 7887, + 7905, + 7916, + 7919, + 7920, + 7922, + 7923, + 7926, + 7944, + 7961, + 7966, + 7970, + 7973, + 7974, + 7976, + 7986, + 7999, + 8027, + 8028, + 8034, + 8047, + 8068, + 8074, + 8077, + 8091, + 8120, + 8122, + 8125, + 8152, + 8153, + 8164, + 8167, + 8169, + 8171, + 8177, + 8184, + 8189, + 8192, + 8196, + 8202, + 8212, + 8217, + 8231, + 8242, + 8244, + 8250, + 8256, + 8257, + 8265, + 8270, + 8274, + 8283, + 8290, + 8294, + 8301, + 8302, + 8307, + 8318, + 8326, + 8338, + 8349, + 8350, + 8353, + 8357, + 8371, + 8374, + 8377, + 8380, + 8387, + 8388, + 8396, + 8402, + 8419, + 8423, + 8428, + 8435, + 8439, + 8442, + 8444, + 8453, + 8461, + 8475, + 8481, + 8485, + 8493, + 8495, + 8498, + 8523, + 8530, + 8531, + 8562 + ], + "early_stopping_patience": 3 +} diff --git a/phase1/ablations/random_labels/README.md b/phase1/ablations/random_labels/README.md new file mode 100644 index 0000000000000000000000000000000000000000..1efc18014b07a8e67b5608e63d45c896cd4338d0 --- /dev/null +++ b/phase1/ablations/random_labels/README.md @@ -0,0 +1,80 @@ +--- +library_name: peft +model_name: phase1-qwen-random-labels-ablation +tags: +- base_model:adapter:Qwen/Qwen2.5-1.5B-Instruct +- dpo +- lora +- transformers +- trl +license: apache-2.0 +base_model: Qwen/Qwen2.5-1.5B-Instruct +pipeline_tag: text-generation +--- + +# Phase 1 Qwen `random_labels` diagnostic ablation + +This is the Phase 1 `random_labels` diagnostic LoRA-DPO adapter fine-tuned from +[Qwen2.5-1.5B-Instruct](https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct). +The frozen training recipe and membership hashes are included in this directory. + +## Quick start + +```python +from peft import PeftModel +from transformers import AutoModelForCausalLM, AutoTokenizer + +repo_id = "geyuxu/york-milestone-project-self-traing-loop-model" +subfolder = "phase1/ablations/random_labels" +base_id = "Qwen/Qwen2.5-1.5B-Instruct" + +tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder) +base_model = AutoModelForCausalLM.from_pretrained( + base_id, torch_dtype="auto", device_map="auto" +) +model = PeftModel.from_pretrained(base_model, repo_id, subfolder=subfolder) +``` + +## Training procedure + + + + + +This model was trained with DPO, a method introduced in [Direct Preference Optimization: Your Language Model is Secretly a Reward Model](https://huggingface.co/papers/2305.18290). + +### Framework versions + +- PEFT 0.18.1 +- TRL: 0.29.0 +- Transformers: 5.3.0 +- Pytorch: 2.10.0 +- Datasets: 4.6.1 +- Tokenizers: 0.22.2 + +## Citations + +Cite DPO as: + +```bibtex +@inproceedings{rafailov2023direct, + title = {{Direct Preference Optimization: Your Language Model is Secretly a Reward Model}}, + author = {Rafael Rafailov and Archit Sharma and Eric Mitchell and Christopher D. Manning and Stefano Ermon and Chelsea Finn}, + year = 2023, + booktitle = {Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023}, + url = {http://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html}, + editor = {Alice Oh and Tristan Naumann and Amir Globerson and Kate Saenko and Moritz Hardt and Sergey Levine}, +} +``` + +Cite TRL as: + +```bibtex +@software{vonwerra2020trl, + title = {{TRL: Transformers Reinforcement Learning}}, + author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin}, + license = {Apache-2.0}, + url = {https://github.com/huggingface/trl}, + year = {2020} +} +``` diff --git a/phase1/ablations/random_labels/adapter_config.json b/phase1/ablations/random_labels/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..fa47a2292cd8a23ccf1b4d101d7f7a03e3f08871 --- /dev/null +++ b/phase1/ablations/random_labels/adapter_config.json @@ -0,0 +1,43 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen2.5-1.5B-Instruct", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "v_proj", + "k_proj", + "o_proj", + "q_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} diff --git a/phase1/ablations/random_labels/adapter_model.safetensors b/phase1/ablations/random_labels/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..2efb4cb851f476f06a9dbdfcb09606c751e760db --- /dev/null +++ b/phase1/ablations/random_labels/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7bebded9e10f63603bfd9d6a135dda87c8bcac25b4a43b365e2b1ce882bf4c93 +size 17462432 diff --git a/phase1/ablations/random_labels/chat_template.jinja b/phase1/ablations/random_labels/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..bdf7919a96cfe43d50914a007b9c0877bd0ec27e --- /dev/null +++ b/phase1/ablations/random_labels/chat_template.jinja @@ -0,0 +1,54 @@ +{%- if tools %} + {{- '<|im_start|>system\n' }} + {%- if messages[0]['role'] == 'system' %} + {{- messages[0]['content'] }} + {%- else %} + {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }} + {%- endif %} + {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }} +{%- else %} + {%- if messages[0]['role'] == 'system' %} + {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }} + {%- else %} + {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- for message in messages %} + {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %} + {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {{- '<|im_start|>' + message.role }} + {%- if message.content %} + {{- '\n' + message.content }} + {%- endif %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {{- '\n\n{"name": "' }} + {{- tool_call.name }} + {{- '", "arguments": ' }} + {{- tool_call.arguments | tojson }} + {{- '}\n' }} + {%- endfor %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- message.content }} + {{- '\n' }} + {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} +{%- endif %} diff --git a/phase1/ablations/random_labels/tokenizer.json b/phase1/ablations/random_labels/tokenizer.json new file mode 100644 index 0000000000000000000000000000000000000000..d73428d91463b495bc017fb6a2fb3a656646482b --- /dev/null +++ b/phase1/ablations/random_labels/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 +size 11422166 diff --git a/phase1/ablations/random_labels/tokenizer_config.json b/phase1/ablations/random_labels/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..9fd0fb48e73786f54fb04e98892f5f5a0ebeebdb --- /dev/null +++ b/phase1/ablations/random_labels/tokenizer_config.json @@ -0,0 +1,29 @@ +{ + "add_prefix_space": false, + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "is_local": true, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null +} diff --git a/phase1/ablations/random_labels/training_args.bin b/phase1/ablations/random_labels/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..869847f6912bd9cca4a1fca95e3be6af6c50b8ed --- /dev/null +++ b/phase1/ablations/random_labels/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ad84a00370d0c977fcd38a1fce033b130494f3fffd4a3c0cbc44a9dd43c0bdbf +size 5841 diff --git a/phase1/ablations/random_labels/training_recipe.json b/phase1/ablations/random_labels/training_recipe.json new file mode 100644 index 0000000000000000000000000000000000000000..1f033e0b98e0786f8e7cb044d632591f1bd9ae3f --- /dev/null +++ b/phase1/ablations/random_labels/training_recipe.json @@ -0,0 +1,22 @@ +{ + "format_version": 1, + "experiment": "confusion_ablation", + "ablation": "random_labels", + "model_name": "Qwen/Qwen2.5-1.5B-Instruct", + "train_membership_sha256": "b497fa765223a9810ad784f31e1598edfa992a162146d6f94d9cdf4adcedd87d", + "validation_membership_sha256": "2f609467438cd6a01fd84b9d80c0fcd84c44767e3b2ed98f4f6a83d68a62c181", + "num_train_pairs": 77124, + "num_validation_pairs": 8563, + "transformation_seed": 22, + "validation_prompt_mode": "clean_rag", + "learning_rate": 1e-05, + "beta": 0.1, + "num_epochs": 1.0, + "seed": 22, + "max_length": 512, + "max_prompt_length": 384, + "gradient_accumulation_steps": 80, + "save_steps": 125, + "save_total_limit": 12, + "preference_pairs_format_version": 2 +} diff --git a/phase1/ablations/random_labels/training_summary.json b/phase1/ablations/random_labels/training_summary.json new file mode 100644 index 0000000000000000000000000000000000000000..7a6f701cf3b55a1aeb940fd42a01bd02d5026018 --- /dev/null +++ b/phase1/ablations/random_labels/training_summary.json @@ -0,0 +1,2517 @@ +{ + "model_name": "Qwen/Qwen2.5-1.5B-Instruct", + "resolved_model": "Qwen/Qwen2.5-1.5B-Instruct", + "num_train_records": 77124, + "num_validation_records_available": 8563, + "training_config": { + "lora_rank": 16, + "lora_alpha": 32, + "learning_rate": 1e-05, + "num_epochs": 1.0, + "per_device_batch_size": 1, + "per_device_eval_batch_size": 1, + "gradient_accumulation_steps": 80, + "beta": 0.1, + "max_length": 512, + "max_prompt_length": 384, + "seed": 22, + "save_steps": 125, + "save_total_limit": 12, + "resume_from_checkpoint": null, + "precision_dtype": "torch.bfloat16", + "bf16": true, + "fp16": false, + "tokenizer_add_bos_token": false + }, + "global_step": 750, + "best_metric": 0.6905523538589478, + "best_model_checkpoint": "outputs/confusion_ablation_phase1_repair_v3/random_labels/lora/checkpoint-375", + "train_metrics": { + "train_runtime": 27561.1083, + "train_samples_per_second": 2.798, + "train_steps_per_second": 0.035, + "total_flos": 4.075839588886364e+17, + "train_loss": 0.6933243910471598 + }, + "log_history": [ + { + "loss": 0.6934387683868408, + "grad_norm": 0.009266729466617107, + "learning_rate": 9.906735751295338e-06, + "entropy": 0.8080450683785603, + "num_tokens": 669528.0, + "logits/chosen": -0.9213643590964665, + "logits/rejected": -0.9683298173272368, + "mean_token_accuracy": 0.7228609627112746, + "rewards/chosen": 0.0007450232512769616, + "rewards/rejected": 0.001045633094436198, + "rewards/accuracies": 0.44, + "rewards/margins": -0.0003006098522382672, + "logps/chosen": -51.68650775671005, + "logps/rejected": -50.719243061542514, + "epoch": 0.010372905969607386, + "step": 10 + }, + { + "loss": 0.6930126190185547, + "grad_norm": 0.009303063154220581, + "learning_rate": 9.803108808290156e-06, + "entropy": 0.7915201940061525, + "num_tokens": 1338759.0, + "logits/chosen": -0.9846059676325559, + "logits/rejected": -0.9714732527595322, + "mean_token_accuracy": 0.7229587784409524, + "rewards/chosen": -0.00012686825164792025, + "rewards/rejected": -0.0007469337083875871, + "rewards/accuracies": 0.48625, + "rewards/margins": 0.0006200655033171643, + "logps/chosen": -50.57927699804306, + "logps/rejected": -51.70512897491455, + "epoch": 0.02074581193921477, + "step": 20 + }, + { + "loss": 0.693855619430542, + "grad_norm": 0.009770886041224003, + "learning_rate": 9.699481865284975e-06, + "entropy": 0.8051797628332861, + "num_tokens": 2009918.0, + "logits/chosen": -1.0153866272103405, + "logits/rejected": -0.9948517174473516, + "mean_token_accuracy": 0.7255033986549825, + "rewards/chosen": 0.000551955679097773, + "rewards/rejected": 0.0015872831797685194, + "rewards/accuracies": 0.495, + "rewards/margins": -0.0010353274924636935, + "logps/chosen": -51.339062130451204, + "logps/rejected": -52.78074060201645, + "epoch": 0.031118717908822157, + "step": 30 + }, + { + "loss": 0.69316725730896, + "grad_norm": 0.008510654792189598, + "learning_rate": 9.595854922279793e-06, + "entropy": 0.7799565396877006, + "num_tokens": 2680367.0, + "logits/chosen": -1.0400407581404876, + "logits/rejected": -0.9926833103096355, + "mean_token_accuracy": 0.7316536229476333, + "rewards/chosen": 0.0013948245377036982, + "rewards/rejected": 0.001106869012758125, + "rewards/accuracies": 0.4775, + "rewards/margins": 0.0002879555685285595, + "logps/chosen": -50.836872832775114, + "logps/rejected": -52.290282304286954, + "epoch": 0.04149162387842954, + "step": 40 + }, + { + "loss": 0.6937148094177246, + "grad_norm": 0.00940113328397274, + "learning_rate": 9.492227979274612e-06, + "entropy": 0.784734519557096, + "num_tokens": 3350695.0, + "logits/chosen": -1.0085622581752787, + "logits/rejected": -0.9717813104276766, + "mean_token_accuracy": 0.7277172536216676, + "rewards/chosen": 0.0007200987445082774, + "rewards/rejected": 0.001504770267456479, + "rewards/accuracies": 0.495, + "rewards/margins": -0.0007846715349296573, + "logps/chosen": -50.88885704755783, + "logps/rejected": -51.595236620903016, + "epoch": 0.051864529848036925, + "step": 50 + }, + { + "loss": 0.6925368785858155, + "grad_norm": 0.01000447291880846, + "learning_rate": 9.388601036269432e-06, + "entropy": 0.7792391402181238, + "num_tokens": 4019867.0, + "logits/chosen": -0.989283063151833, + "logits/rejected": -0.9758414097701983, + "mean_token_accuracy": 0.7253596894256771, + "rewards/chosen": 0.00419369634595455, + "rewards/rejected": 0.00261573103512319, + "rewards/accuracies": 0.515, + "rewards/margins": 0.0015779653389472515, + "logps/chosen": -50.12135502576828, + "logps/rejected": -49.72630759477615, + "epoch": 0.062237435817644314, + "step": 60 + }, + { + "loss": 0.6928633213043213, + "grad_norm": 0.008523018099367619, + "learning_rate": 9.284974093264249e-06, + "entropy": 0.7859808096196502, + "num_tokens": 4689830.0, + "logits/chosen": -0.9542620254422428, + "logits/rejected": -0.9723457128166635, + "mean_token_accuracy": 0.7191485194861889, + "rewards/chosen": 0.006607790327220755, + "rewards/rejected": 0.005695816857155478, + "rewards/accuracies": 0.50625, + "rewards/margins": 0.0009119734441992478, + "logps/chosen": -52.69678068399429, + "logps/rejected": -49.40951271772385, + "epoch": 0.0726103417872517, + "step": 70 + }, + { + "loss": 0.6931606769561768, + "grad_norm": 0.009254093281924725, + "learning_rate": 9.181347150259067e-06, + "entropy": 0.8076216962421313, + "num_tokens": 5359790.0, + "logits/chosen": -0.9293808590029637, + "logits/rejected": -0.9847294370574589, + "mean_token_accuracy": 0.7200651096645743, + "rewards/chosen": 0.011739555572351037, + "rewards/rejected": 0.011363767318175632, + "rewards/accuracies": 0.4875, + "rewards/margins": 0.00037578820330963936, + "logps/chosen": -51.38067405223846, + "logps/rejected": -50.72847024202347, + "epoch": 0.08298324775685909, + "step": 80 + }, + { + "loss": 0.6942155361175537, + "grad_norm": 0.008851570077240467, + "learning_rate": 9.077720207253888e-06, + "entropy": 0.8039566927566193, + "num_tokens": 6029642.0, + "logits/chosen": -0.9478755777728227, + "logits/rejected": -0.9763882057133852, + "mean_token_accuracy": 0.7233742567896843, + "rewards/chosen": 0.01409353660361603, + "rewards/rejected": 0.015802892130523674, + "rewards/accuracies": 0.48375, + "rewards/margins": -0.001709355540224351, + "logps/chosen": -51.33848252058029, + "logps/rejected": -52.321811312437056, + "epoch": 0.09335615372646647, + "step": 90 + }, + { + "loss": 0.6936118602752686, + "grad_norm": 0.009475240483880043, + "learning_rate": 8.974093264248706e-06, + "entropy": 0.8324551365058869, + "num_tokens": 6703750.0, + "logits/chosen": -0.9270073968773294, + "logits/rejected": -0.9359207155608903, + "mean_token_accuracy": 0.7229399124160409, + "rewards/chosen": 0.014994417404241176, + "rewards/rejected": 0.015462831489760163, + "rewards/accuracies": 0.49625, + "rewards/margins": -0.0004684141512552742, + "logps/chosen": -55.6720170044899, + "logps/rejected": -56.016610951423644, + "epoch": 0.10372905969607385, + "step": 100 + }, + { + "loss": 0.6934245586395263, + "grad_norm": 0.008504034951329231, + "learning_rate": 8.870466321243523e-06, + "entropy": 0.7861935871373862, + "num_tokens": 7374932.0, + "logits/chosen": -0.965592457466306, + "logits/rejected": -0.9543162182972067, + "mean_token_accuracy": 0.7248496604338288, + "rewards/chosen": 0.016234664240764685, + "rewards/rejected": 0.016324117717140468, + "rewards/accuracies": 0.495, + "rewards/margins": -8.945348919951357e-05, + "logps/chosen": -50.975947844982144, + "logps/rejected": -51.70058757305145, + "epoch": 0.11410196566568125, + "step": 110 + }, + { + "loss": 0.6940177917480469, + "grad_norm": 0.009204786270856857, + "learning_rate": 8.766839378238343e-06, + "entropy": 0.7727768113883212, + "num_tokens": 8045025.0, + "logits/chosen": -1.03487960348445, + "logits/rejected": -0.9815775502270385, + "mean_token_accuracy": 0.7311673213727772, + "rewards/chosen": 0.01172756811563886, + "rewards/rejected": 0.01306509348746431, + "rewards/accuracies": 0.47875, + "rewards/margins": -0.0013375253186222835, + "logps/chosen": -49.14816425204277, + "logps/rejected": -51.98841401100159, + "epoch": 0.12447487163528863, + "step": 120 + }, + { + "eval_loss": 0.6955941319465637, + "eval_runtime": 196.5871, + "eval_samples_per_second": 5.087, + "eval_steps_per_second": 5.087, + "eval_entropy": 0.8034458611719311, + "eval_num_tokens": 8380297.0, + "eval_logits/chosen": -0.991135582788011, + "eval_logits/rejected": -0.950536454501934, + "eval_mean_token_accuracy": 0.7337288541048765, + "eval_rewards/chosen": 0.008104163538169359, + "eval_rewards/rejected": 0.01258701845750079, + "eval_rewards/accuracies": 0.437, + "eval_rewards/margins": -0.0044828549473313615, + "eval_logps/chosen": -50.09194520950317, + "eval_logps/rejected": -52.51400153923035, + "epoch": 0.1296613246200923, + "step": 125 + }, + { + "loss": 0.6930018901824951, + "grad_norm": 0.00838699284940958, + "learning_rate": 8.663212435233162e-06, + "entropy": 0.8142909701773897, + "num_tokens": 8716283.0, + "logits/chosen": -0.971143901841604, + "logits/rejected": -1.0017587172299427, + "mean_token_accuracy": 0.729599024951458, + "rewards/chosen": 0.009170935571445398, + "rewards/rejected": 0.008475723866073964, + "rewards/accuracies": 0.52375, + "rewards/margins": 0.0006952117068431108, + "logps/chosen": -51.31078794002533, + "logps/rejected": -53.1062014913559, + "epoch": 0.13484777760489602, + "step": 130 + }, + { + "loss": 0.6927727699279785, + "grad_norm": 0.009330841712653637, + "learning_rate": 8.55958549222798e-06, + "entropy": 0.7786517775012181, + "num_tokens": 9385323.0, + "logits/chosen": -1.0336392573752233, + "logits/rejected": -1.019804302735747, + "mean_token_accuracy": 0.7317706294171512, + "rewards/chosen": 0.004249347767993186, + "rewards/rejected": 0.0031492145435004205, + "rewards/accuracies": 0.51875, + "rewards/margins": 0.001100133234722307, + "logps/chosen": -48.82712723731995, + "logps/rejected": -49.81842919588089, + "epoch": 0.1452206835745034, + "step": 140 + }, + { + "loss": 0.6928228378295899, + "grad_norm": 0.009226374328136444, + "learning_rate": 8.455958549222799e-06, + "entropy": 0.7707585748913698, + "num_tokens": 10057097.0, + "logits/chosen": -1.0021628340641857, + "logits/rejected": -1.0272578388562763, + "mean_token_accuracy": 0.7250917989574373, + "rewards/chosen": 0.0021179335123679265, + "rewards/rejected": 0.0010407016340150221, + "rewards/accuracies": 0.51875, + "rewards/margins": 0.0010772318854651531, + "logps/chosen": -50.82353290557862, + "logps/rejected": -51.57363982439041, + "epoch": 0.1555935895441108, + "step": 150 + }, + { + "loss": 0.6935010433197022, + "grad_norm": 0.008547156117856503, + "learning_rate": 8.352331606217617e-06, + "entropy": 0.8095202751364559, + "num_tokens": 10728653.0, + "logits/chosen": -0.9613099360765643, + "logits/rejected": -0.9753560247735856, + "mean_token_accuracy": 0.726740376483649, + "rewards/chosen": 0.003875704376255271, + "rewards/rejected": 0.004182930276788284, + "rewards/accuracies": 0.48375, + "rewards/margins": -0.00030722589199285724, + "logps/chosen": -53.913278470039366, + "logps/rejected": -53.74137356996536, + "epoch": 0.16596649551371817, + "step": 160 + }, + { + "loss": 0.6931381702423096, + "grad_norm": 0.008811748586595058, + "learning_rate": 8.248704663212436e-06, + "entropy": 0.8115301547432319, + "num_tokens": 11400551.0, + "logits/chosen": -0.9568430709542813, + "logits/rejected": -0.9675442470577922, + "mean_token_accuracy": 0.7244884933158755, + "rewards/chosen": 0.003357977192756607, + "rewards/rejected": 0.0028972053575580504, + "rewards/accuracies": 0.4925, + "rewards/margins": 0.00046077182138105856, + "logps/chosen": -53.2519864654541, + "logps/rejected": -52.62679670572281, + "epoch": 0.17633940148332555, + "step": 170 + }, + { + "loss": 0.6925437927246094, + "grad_norm": 0.00891165155917406, + "learning_rate": 8.145077720207254e-06, + "entropy": 0.79428493458312, + "num_tokens": 12070305.0, + "logits/chosen": -0.9719879220022611, + "logits/rejected": -0.9580149375927722, + "mean_token_accuracy": 0.7303908407129347, + "rewards/chosen": 0.002974712664896515, + "rewards/rejected": 0.0013871385961903115, + "rewards/accuracies": 0.5275, + "rewards/margins": 0.0015875740901537937, + "logps/chosen": -52.03131418466568, + "logps/rejected": -49.467778403759006, + "epoch": 0.18671230745293294, + "step": 180 + }, + { + "loss": 0.6946820259094239, + "grad_norm": 0.011048010550439358, + "learning_rate": 8.041450777202073e-06, + "entropy": 0.801795727997087, + "num_tokens": 12738966.0, + "logits/chosen": -0.9541037205291851, + "logits/rejected": -0.9584797920583412, + "mean_token_accuracy": 0.7201638549566269, + "rewards/chosen": 0.004079287395195053, + "rewards/rejected": 0.006725511867425666, + "rewards/accuracies": 0.47, + "rewards/margins": -0.0026462244295544224, + "logps/chosen": -51.030084483623504, + "logps/rejected": -52.38975264072418, + "epoch": 0.19708521342254032, + "step": 190 + }, + { + "loss": 0.6930304050445557, + "grad_norm": 0.009633849374949932, + "learning_rate": 7.937823834196891e-06, + "entropy": 0.7963748186221347, + "num_tokens": 13408002.0, + "logits/chosen": -0.9894887990110749, + "logits/rejected": -0.9980301170848317, + "mean_token_accuracy": 0.7193645982630551, + "rewards/chosen": 0.0047459728431940105, + "rewards/rejected": 0.004120458228130701, + "rewards/accuracies": 0.48625, + "rewards/margins": 0.000625514651183039, + "logps/chosen": -50.538159133195876, + "logps/rejected": -50.48108030319214, + "epoch": 0.2074581193921477, + "step": 200 + }, + { + "loss": 0.6936575412750244, + "grad_norm": 0.008548871614038944, + "learning_rate": 7.834196891191712e-06, + "entropy": 0.7598572969343513, + "num_tokens": 14074115.0, + "logits/chosen": -1.045821409259606, + "logits/rejected": -0.999601151613033, + "mean_token_accuracy": 0.7357131129689515, + "rewards/chosen": 0.005255431280912717, + "rewards/rejected": 0.005940479632897677, + "rewards/accuracies": 0.47, + "rewards/margins": -0.0006850483406742569, + "logps/chosen": -46.40404602527619, + "logps/rejected": -50.13248352050781, + "epoch": 0.2178310253617551, + "step": 210 + }, + { + "loss": 0.6938835144042969, + "grad_norm": 0.009261125698685646, + "learning_rate": 7.730569948186528e-06, + "entropy": 0.767732237551827, + "num_tokens": 14745903.0, + "logits/chosen": -1.0030631508707841, + "logits/rejected": -1.0114240661200429, + "mean_token_accuracy": 0.7297109466791153, + "rewards/chosen": 0.004763001757364691, + "rewards/rejected": 0.005841993642383727, + "rewards/accuracies": 0.49125, + "rewards/margins": -0.0010789919237868162, + "logps/chosen": -51.14548614025116, + "logps/rejected": -50.2862161898613, + "epoch": 0.2282039313313625, + "step": 220 + }, + { + "loss": 0.6946812152862549, + "grad_norm": 0.009788029827177525, + "learning_rate": 7.626943005181348e-06, + "entropy": 0.8289732250571251, + "num_tokens": 15418570.0, + "logits/chosen": -0.9488809894056489, + "logits/rejected": -1.0089717702518306, + "mean_token_accuracy": 0.7215882153064013, + "rewards/chosen": 0.006585003775003315, + "rewards/rejected": 0.009181454044451129, + "rewards/accuracies": 0.47625, + "rewards/margins": -0.0025964502768329113, + "logps/chosen": -56.4708499455452, + "logps/rejected": -53.11574334859848, + "epoch": 0.23857683730096987, + "step": 230 + }, + { + "loss": 0.6926135063171387, + "grad_norm": 0.009469996206462383, + "learning_rate": 7.523316062176167e-06, + "entropy": 0.8170388517202809, + "num_tokens": 16089276.0, + "logits/chosen": -0.9783852286633136, + "logits/rejected": -0.9603607895142418, + "mean_token_accuracy": 0.7241931633278728, + "rewards/chosen": 0.00405766910489433, + "rewards/rejected": 0.0026022558279692022, + "rewards/accuracies": 0.5175, + "rewards/margins": 0.00145541326062812, + "logps/chosen": -51.54288928151131, + "logps/rejected": -54.08886151790619, + "epoch": 0.24894974327057726, + "step": 240 + }, + { + "loss": 0.6937024593353271, + "grad_norm": 0.009117631241679192, + "learning_rate": 7.419689119170985e-06, + "entropy": 0.8002800923399627, + "num_tokens": 16760081.0, + "logits/chosen": -1.0175496722318613, + "logits/rejected": -0.9702955326900312, + "mean_token_accuracy": 0.7222046358138323, + "rewards/chosen": 0.0016811337291983363, + "rewards/rejected": 0.0023915858741713693, + "rewards/accuracies": 0.50625, + "rewards/margins": -0.0007104521640576422, + "logps/chosen": -51.49065291881561, + "logps/rejected": -54.3223114323616, + "epoch": 0.2593226492401846, + "step": 250 + }, + { + "eval_loss": 0.6968227624893188, + "eval_runtime": 223.7572, + "eval_samples_per_second": 4.469, + "eval_steps_per_second": 4.469, + "eval_entropy": 0.8013349784091115, + "eval_num_tokens": 16760081.0, + "eval_logits/chosen": -1.0127526828657614, + "eval_logits/rejected": -0.9702886589714581, + "eval_mean_token_accuracy": 0.7333163165301084, + "eval_rewards/chosen": 0.0008883264788382803, + "eval_rewards/rejected": 0.007837165784684316, + "eval_rewards/accuracies": 0.415, + "eval_rewards/margins": -0.00694883929831849, + "eval_logps/chosen": -50.164103578567506, + "eval_logps/rejected": -52.56150006484985, + "epoch": 0.2593226492401846, + "step": 250 + }, + { + "loss": 0.6938982009887695, + "grad_norm": 0.008658971637487411, + "learning_rate": 7.3160621761658035e-06, + "entropy": 0.8275363711640239, + "num_tokens": 17432770.0, + "logits/chosen": -0.9894071595486238, + "logits/rejected": -1.021770131425495, + "mean_token_accuracy": 0.7267817178182304, + "rewards/chosen": -6.325603737082019e-05, + "rewards/rejected": 0.0009481332914026552, + "rewards/accuracies": 0.5, + "rewards/margins": -0.0010113894138703472, + "logps/chosen": -53.769077570438384, + "logps/rejected": -54.760430970191955, + "epoch": 0.26969555520979205, + "step": 260 + }, + { + "loss": 0.6941106796264649, + "grad_norm": 0.009195917285978794, + "learning_rate": 7.212435233160623e-06, + "entropy": 0.8036660263128579, + "num_tokens": 18100438.0, + "logits/chosen": -1.0066855113664344, + "logits/rejected": -1.0124089541250572, + "mean_token_accuracy": 0.717040218450129, + "rewards/chosen": -0.003151719864085862, + "rewards/rejected": -0.00164005833167721, + "rewards/accuracies": 0.475, + "rewards/margins": -0.001511661496660963, + "logps/chosen": -49.700445964336396, + "logps/rejected": -50.435976998806, + "epoch": 0.28006846117939943, + "step": 270 + }, + { + "loss": 0.6933230876922607, + "grad_norm": 0.009418987669050694, + "learning_rate": 7.108808290155441e-06, + "entropy": 0.8158398796850815, + "num_tokens": 18772061.0, + "logits/chosen": -1.0278496914643969, + "logits/rejected": -1.0390610888345118, + "mean_token_accuracy": 0.724490509070456, + "rewards/chosen": -0.005928723971054524, + "rewards/rejected": -0.006031536482905722, + "rewards/accuracies": 0.52, + "rewards/margins": 0.0001028125207812991, + "logps/chosen": -53.07417652249336, + "logps/rejected": -52.73169189453125, + "epoch": 0.2904413671490068, + "step": 280 + }, + { + "loss": 0.6924946308135986, + "grad_norm": 0.008996859192848206, + "learning_rate": 7.005181347150259e-06, + "entropy": 0.801404341221787, + "num_tokens": 19443506.0, + "logits/chosen": -1.020471675081665, + "logits/rejected": -1.0060470756374977, + "mean_token_accuracy": 0.7225255416892469, + "rewards/chosen": -0.008651466769783837, + "rewards/rejected": -0.010357174093505818, + "rewards/accuracies": 0.5175, + "rewards/margins": 0.0017057072926036198, + "logps/chosen": -52.63102213382721, + "logps/rejected": -53.120495743751526, + "epoch": 0.3008142731186142, + "step": 290 + }, + { + "loss": 0.6929198741912842, + "grad_norm": 0.00904047954827547, + "learning_rate": 6.9015544041450784e-06, + "entropy": 0.7905970112606883, + "num_tokens": 20114567.0, + "logits/chosen": -1.0243293848557635, + "logits/rejected": -1.058803992605315, + "mean_token_accuracy": 0.7341359755769372, + "rewards/chosen": -0.012200816824647518, + "rewards/rejected": -0.01307745838902747, + "rewards/accuracies": 0.52125, + "rewards/margins": 0.000876641578397539, + "logps/chosen": -52.0853961968422, + "logps/rejected": -52.80914256095886, + "epoch": 0.3111871790882216, + "step": 300 + }, + { + "loss": 0.6928537845611572, + "grad_norm": 0.009816721081733704, + "learning_rate": 6.797927461139897e-06, + "entropy": 0.80872525641229, + "num_tokens": 20787766.0, + "logits/chosen": -0.9839863753234047, + "logits/rejected": -1.0009211278188388, + "mean_token_accuracy": 0.724884872585535, + "rewards/chosen": -0.012630892752328008, + "rewards/rejected": -0.01370205567994617, + "rewards/accuracies": 0.51125, + "rewards/margins": 0.0010711629761499353, + "logps/chosen": -54.78661850452423, + "logps/rejected": -53.24911024570465, + "epoch": 0.32156008505782896, + "step": 310 + }, + { + "loss": 0.6942753314971923, + "grad_norm": 0.009577946737408638, + "learning_rate": 6.6943005181347155e-06, + "entropy": 0.8015230012265966, + "num_tokens": 21457559.0, + "logits/chosen": -0.9992799805599515, + "logits/rejected": -1.0047482614113592, + "mean_token_accuracy": 0.7206378514692188, + "rewards/chosen": -0.015205535748583543, + "rewards/rejected": -0.013390423674327395, + "rewards/accuracies": 0.49625, + "rewards/margins": -0.0018151119937829209, + "logps/chosen": -52.25986159801483, + "logps/rejected": -53.13925377726555, + "epoch": 0.33193299102743634, + "step": 320 + }, + { + "loss": 0.6924636840820313, + "grad_norm": 0.009727108292281628, + "learning_rate": 6.590673575129535e-06, + "entropy": 0.8345451738173142, + "num_tokens": 22128277.0, + "logits/chosen": -0.971072161782628, + "logits/rejected": -0.9826513089025171, + "mean_token_accuracy": 0.7212898347340524, + "rewards/chosen": -0.016975908809049544, + "rewards/rejected": -0.018840813715414698, + "rewards/accuracies": 0.51625, + "rewards/margins": 0.001864904925096198, + "logps/chosen": -52.514592845439914, + "logps/rejected": -54.03662874937058, + "epoch": 0.3423058969970437, + "step": 330 + }, + { + "loss": 0.6921487808227539, + "grad_norm": 0.009848830290138721, + "learning_rate": 6.487046632124353e-06, + "entropy": 0.8036045160889626, + "num_tokens": 22798429.0, + "logits/chosen": -0.986366250980096, + "logits/rejected": -1.0395464497059017, + "mean_token_accuracy": 0.7169532440230251, + "rewards/chosen": -0.017634948804889063, + "rewards/rejected": -0.02014962821162044, + "rewards/accuracies": 0.54, + "rewards/margins": 0.002514679412379337, + "logps/chosen": -53.712123572826385, + "logps/rejected": -50.68536148548126, + "epoch": 0.3526788029666511, + "step": 340 + }, + { + "loss": 0.6948633670806885, + "grad_norm": 0.009547681547701359, + "learning_rate": 6.383419689119171e-06, + "entropy": 0.7954194891778752, + "num_tokens": 23470239.0, + "logits/chosen": -1.0014035524600693, + "logits/rejected": -0.9692854696785687, + "mean_token_accuracy": 0.7198419809341431, + "rewards/chosen": -0.019529370157788436, + "rewards/rejected": -0.016619607036818706, + "rewards/accuracies": 0.5, + "rewards/margins": -0.002909763151255902, + "logps/chosen": -54.53537731409073, + "logps/rejected": -52.964653131961825, + "epoch": 0.3630517089362585, + "step": 350 + }, + { + "loss": 0.6930148601531982, + "grad_norm": 0.00898800976574421, + "learning_rate": 6.2797927461139905e-06, + "entropy": 0.7794413399184122, + "num_tokens": 24140239.0, + "logits/chosen": -1.0375333631207078, + "logits/rejected": -1.0100693145671888, + "mean_token_accuracy": 0.737273293249309, + "rewards/chosen": -0.016578698544473695, + "rewards/rejected": -0.017291930461324226, + "rewards/accuracies": 0.4975, + "rewards/margins": 0.000713231952759088, + "logps/chosen": -49.863780752420425, + "logps/rejected": -52.97674039840698, + "epoch": 0.37342461490586587, + "step": 360 + }, + { + "loss": 0.6929784297943116, + "grad_norm": 0.008984371088445187, + "learning_rate": 6.176165803108809e-06, + "entropy": 0.8129843348357827, + "num_tokens": 24812178.0, + "logits/chosen": -0.9893493454110454, + "logits/rejected": -0.9891808390055474, + "mean_token_accuracy": 0.727164792958647, + "rewards/chosen": -0.018017661249964477, + "rewards/rejected": -0.01882471950921399, + "rewards/accuracies": 0.4975, + "rewards/margins": 0.0008070582516302239, + "logps/chosen": -53.014821940660475, + "logps/rejected": -54.58460282325745, + "epoch": 0.38379752087547325, + "step": 370 + }, + { + "eval_loss": 0.6905523538589478, + "eval_runtime": 245.3265, + "eval_samples_per_second": 4.076, + "eval_steps_per_second": 4.076, + "eval_entropy": 0.7969645112715662, + "eval_num_tokens": 25147105.0, + "eval_logits/chosen": -1.0253711017755525, + "eval_logits/rejected": -0.9797990125942502, + "eval_mean_token_accuracy": 0.7333250712603331, + "eval_rewards/chosen": -0.015263017903128458, + "eval_rewards/rejected": -0.020903651809865552, + "eval_rewards/accuracies": 0.55, + "eval_rewards/margins": 0.005640633857896319, + "eval_logps/chosen": -50.32561701965332, + "eval_logps/rejected": -52.84890823554993, + "epoch": 0.38898397386027694, + "step": 375 + }, + { + "loss": 0.6925588607788086, + "grad_norm": 0.009255084209144115, + "learning_rate": 6.0725388601036275e-06, + "entropy": 0.7894979556603358, + "num_tokens": 25482532.0, + "logits/chosen": -1.0074889789440618, + "logits/rejected": -0.9709891010763303, + "mean_token_accuracy": 0.7268249686434864, + "rewards/chosen": -0.017496899721906517, + "rewards/rejected": -0.019117686107287854, + "rewards/accuracies": 0.52625, + "rewards/margins": 0.001620786436178605, + "logps/chosen": -51.8191835963726, + "logps/rejected": -51.592100315093994, + "epoch": 0.39417042684508063, + "step": 380 + }, + { + "loss": 0.6923740386962891, + "grad_norm": 0.009324838407337666, + "learning_rate": 5.968911917098445e-06, + "entropy": 0.8094338296726346, + "num_tokens": 26154266.0, + "logits/chosen": -0.9966710708958524, + "logits/rejected": -0.9879505808785741, + "mean_token_accuracy": 0.7231129581481218, + "rewards/chosen": -0.017760099685847307, + "rewards/rejected": -0.019829784269199992, + "rewards/accuracies": 0.51875, + "rewards/margins": 0.0020696846699866, + "logps/chosen": -53.66926085233688, + "logps/rejected": -54.18102238893509, + "epoch": 0.404543332814688, + "step": 390 + }, + { + "loss": 0.6929931163787841, + "grad_norm": 0.010886781848967075, + "learning_rate": 5.865284974093265e-06, + "entropy": 0.8130081182997674, + "num_tokens": 26825159.0, + "logits/chosen": -1.026189590043526, + "logits/rejected": -0.980070075731585, + "mean_token_accuracy": 0.7226042114198208, + "rewards/chosen": -0.019220582297640475, + "rewards/rejected": -0.020057831880958474, + "rewards/accuracies": 0.48125, + "rewards/margins": 0.0008372495489311404, + "logps/chosen": -52.43204548358917, + "logps/rejected": -54.36065078496933, + "epoch": 0.4149162387842954, + "step": 400 + }, + { + "loss": 0.693073320388794, + "grad_norm": 0.009156073443591595, + "learning_rate": 5.761658031088083e-06, + "entropy": 0.7959862072952092, + "num_tokens": 27495663.0, + "logits/chosen": -1.0194205629554802, + "logits/rejected": -1.008366009739435, + "mean_token_accuracy": 0.7243296534568071, + "rewards/chosen": -0.01809768541224912, + "rewards/rejected": -0.01875489959079914, + "rewards/accuracies": 0.5025, + "rewards/margins": 0.0006572141727883718, + "logps/chosen": -52.169967291355135, + "logps/rejected": -53.42250164747238, + "epoch": 0.4252891447539028, + "step": 410 + }, + { + "loss": 0.6924574375152588, + "grad_norm": 0.010202614590525627, + "learning_rate": 5.658031088082902e-06, + "entropy": 0.7918436706252396, + "num_tokens": 28167389.0, + "logits/chosen": -1.0232014742112978, + "logits/rejected": -1.0440852867532966, + "mean_token_accuracy": 0.7258787673525512, + "rewards/chosen": -0.015947307585583416, + "rewards/rejected": -0.017838909620567733, + "rewards/accuracies": 0.5075, + "rewards/margins": 0.0018916020590404514, + "logps/chosen": -54.433519496917725, + "logps/rejected": -53.2144430232048, + "epoch": 0.4356620507235102, + "step": 420 + }, + { + "loss": 0.6926542282104492, + "grad_norm": 0.01011913362890482, + "learning_rate": 5.554404145077721e-06, + "entropy": 0.8117843008134514, + "num_tokens": 28839388.0, + "logits/chosen": -0.9718024988912555, + "logits/rejected": -0.9786808761441761, + "mean_token_accuracy": 0.7248365879803896, + "rewards/chosen": -0.014674390776453947, + "rewards/rejected": -0.016148133582082665, + "rewards/accuracies": 0.52875, + "rewards/margins": 0.001473742745729396, + "logps/chosen": -51.187984328269955, + "logps/rejected": -54.15149886369705, + "epoch": 0.4460349566931176, + "step": 430 + }, + { + "loss": 0.6937287330627442, + "grad_norm": 0.008680191822350025, + "learning_rate": 5.4507772020725395e-06, + "entropy": 0.7826772296521812, + "num_tokens": 29510096.0, + "logits/chosen": -1.038226736136573, + "logits/rejected": -1.0398130834010744, + "mean_token_accuracy": 0.7318821278214455, + "rewards/chosen": -0.01869894893682158, + "rewards/rejected": -0.01806240452982365, + "rewards/accuracies": 0.47625, + "rewards/margins": -0.0006365444045513868, + "logps/chosen": -51.81987749576569, + "logps/rejected": -51.031341784000396, + "epoch": 0.456407862662725, + "step": 440 + }, + { + "loss": 0.6937658309936523, + "grad_norm": 0.009057857096195221, + "learning_rate": 5.347150259067357e-06, + "entropy": 0.7959510098583996, + "num_tokens": 30181792.0, + "logits/chosen": -1.0239556820922306, + "logits/rejected": -1.0394439887711346, + "mean_token_accuracy": 0.7198793402686715, + "rewards/chosen": -0.01936899814491426, + "rewards/rejected": -0.01868944700636348, + "rewards/accuracies": 0.50375, + "rewards/margins": -0.0006795510534720961, + "logps/chosen": -54.870300602912906, + "logps/rejected": -50.76141629695892, + "epoch": 0.46678076863233237, + "step": 450 + }, + { + "loss": 0.694075345993042, + "grad_norm": 0.009986916556954384, + "learning_rate": 5.243523316062177e-06, + "entropy": 0.7800668972823769, + "num_tokens": 30851409.0, + "logits/chosen": -1.0086595854613267, + "logits/rejected": -1.0357231874675175, + "mean_token_accuracy": 0.7262966002896428, + "rewards/chosen": -0.020605784776303152, + "rewards/rejected": -0.019295487125091312, + "rewards/accuracies": 0.48125, + "rewards/margins": -0.0013102977239759638, + "logps/chosen": -53.48096129179001, + "logps/rejected": -51.299415925741194, + "epoch": 0.47715367460193975, + "step": 460 + }, + { + "loss": 0.6933310985565185, + "grad_norm": 0.007825742475688457, + "learning_rate": 5.139896373056995e-06, + "entropy": 0.7754787660343573, + "num_tokens": 31519564.0, + "logits/chosen": -1.0726965671758735, + "logits/rejected": -1.003480362234256, + "mean_token_accuracy": 0.7201942896470428, + "rewards/chosen": -0.017236333386230172, + "rewards/rejected": -0.017384318440863352, + "rewards/accuracies": 0.4825, + "rewards/margins": 0.00014798504006648726, + "logps/chosen": -49.58583438396454, + "logps/rejected": -51.69670748949051, + "epoch": 0.48752658057154713, + "step": 470 + }, + { + "loss": 0.6922287940979004, + "grad_norm": 0.008367015048861504, + "learning_rate": 5.036269430051814e-06, + "entropy": 0.8279160013142973, + "num_tokens": 32192056.0, + "logits/chosen": -0.9712868713229077, + "logits/rejected": -0.9765040762093227, + "mean_token_accuracy": 0.7188576187193394, + "rewards/chosen": -0.01717338605103805, + "rewards/rejected": -0.019571030664633327, + "rewards/accuracies": 0.51125, + "rewards/margins": 0.0023976446047163334, + "logps/chosen": -54.479641914367676, + "logps/rejected": -54.63456130981445, + "epoch": 0.4978994865411545, + "step": 480 + }, + { + "loss": 0.6939034461975098, + "grad_norm": 0.008626270107924938, + "learning_rate": 4.932642487046633e-06, + "entropy": 0.8010151171591133, + "num_tokens": 32864077.0, + "logits/chosen": -1.0169706789174378, + "logits/rejected": -1.0165859789377836, + "mean_token_accuracy": 0.7208031569048763, + "rewards/chosen": -0.01987447723532, + "rewards/rejected": -0.018864784324341598, + "rewards/accuracies": 0.495, + "rewards/margins": -0.0010096929259452735, + "logps/chosen": -53.33563009738922, + "logps/rejected": -53.87229782342911, + "epoch": 0.5082723925107618, + "step": 490 + }, + { + "loss": 0.6938543319702148, + "grad_norm": 0.010269825346767902, + "learning_rate": 4.829015544041451e-06, + "entropy": 0.7891198094375431, + "num_tokens": 33534279.0, + "logits/chosen": -1.033360492470276, + "logits/rejected": -1.0354731196495317, + "mean_token_accuracy": 0.7333813977241516, + "rewards/chosen": -0.019480555365971666, + "rewards/rejected": -0.01867740810344003, + "rewards/accuracies": 0.51, + "rewards/margins": -0.0008031472803850193, + "logps/chosen": -52.630670845508575, + "logps/rejected": -50.910942976474765, + "epoch": 0.5186452984803692, + "step": 500 + }, + { + "eval_loss": 0.6942050457000732, + "eval_runtime": 276.9162, + "eval_samples_per_second": 3.611, + "eval_steps_per_second": 3.611, + "eval_entropy": 0.7935083331502975, + "eval_num_tokens": 33534279.0, + "eval_logits/chosen": -1.0600360631491812, + "eval_logits/rejected": -1.0166348149416253, + "eval_mean_token_accuracy": 0.7330459494143724, + "eval_rewards/chosen": -0.021802856784763208, + "eval_rewards/rejected": -0.02036227696077913, + "eval_rewards/accuracies": 0.477, + "eval_rewards/margins": -0.0014405797821236774, + "eval_logps/chosen": -50.39101540756226, + "eval_logps/rejected": -52.84349448776245, + "epoch": 0.5186452984803692, + "step": 500 + }, + { + "loss": 0.6938997745513916, + "grad_norm": 0.00896107591688633, + "learning_rate": 4.72538860103627e-06, + "entropy": 0.7882147227507085, + "num_tokens": 34205135.0, + "logits/chosen": -1.0076570653558603, + "logits/rejected": -1.0416575961228518, + "mean_token_accuracy": 0.7137932823970914, + "rewards/chosen": -0.018858550680542974, + "rewards/rejected": -0.017997891291797713, + "rewards/accuracies": 0.495, + "rewards/margins": -0.0008606594161392423, + "logps/chosen": -54.12554481744766, + "logps/rejected": -50.22665623903274, + "epoch": 0.5290182044499767, + "step": 510 + }, + { + "loss": 0.6940505504608154, + "grad_norm": 0.009844881482422352, + "learning_rate": 4.621761658031089e-06, + "entropy": 0.7678585767536424, + "num_tokens": 34873976.0, + "logits/chosen": -1.0794209366681549, + "logits/rejected": -1.0414292466399215, + "mean_token_accuracy": 0.7310516293905676, + "rewards/chosen": -0.013213514556548489, + "rewards/rejected": -0.011983713133254241, + "rewards/accuracies": 0.515, + "rewards/margins": -0.0012298014553380199, + "logps/chosen": -51.02845492362976, + "logps/rejected": -49.72117327451706, + "epoch": 0.5393911104195841, + "step": 520 + }, + { + "loss": 0.6937035083770752, + "grad_norm": 0.009832088835537434, + "learning_rate": 4.518134715025907e-06, + "entropy": 0.8068192195380106, + "num_tokens": 35544999.0, + "logits/chosen": -1.0203095909710327, + "logits/rejected": -1.0544799987360511, + "mean_token_accuracy": 0.7208610328473151, + "rewards/chosen": -0.013758049447855001, + "rewards/rejected": -0.013221281499590986, + "rewards/accuracies": 0.50375, + "rewards/margins": -0.0005367679687333293, + "logps/chosen": -53.891741864681244, + "logps/rejected": -52.176739025115964, + "epoch": 0.5497640163891915, + "step": 530 + }, + { + "loss": 0.693358039855957, + "grad_norm": 0.009179627522826195, + "learning_rate": 4.414507772020726e-06, + "entropy": 0.8059323144424707, + "num_tokens": 36215629.0, + "logits/chosen": -1.0271287046641675, + "logits/rejected": -1.0058586337462303, + "mean_token_accuracy": 0.7286789271980524, + "rewards/chosen": -0.01192244978853978, + "rewards/rejected": -0.011959875774573447, + "rewards/accuracies": 0.495, + "rewards/margins": 3.742602792044636e-05, + "logps/chosen": -50.73393731594086, + "logps/rejected": -52.839989113807675, + "epoch": 0.5601369223587989, + "step": 540 + }, + { + "loss": 0.693217134475708, + "grad_norm": 0.008687409572303295, + "learning_rate": 4.310880829015544e-06, + "entropy": 0.8455263479612768, + "num_tokens": 36888235.0, + "logits/chosen": -0.9577911917232584, + "logits/rejected": -0.9647921425538288, + "mean_token_accuracy": 0.7241826535388828, + "rewards/chosen": -0.012230233296829738, + "rewards/rejected": -0.012580791678369679, + "rewards/accuracies": 0.52, + "rewards/margins": 0.00035055841028224676, + "logps/chosen": -53.09883669376373, + "logps/rejected": -56.72353342294693, + "epoch": 0.5705098283284062, + "step": 550 + }, + { + "loss": 0.6929863929748535, + "grad_norm": 0.008931291289627552, + "learning_rate": 4.207253886010363e-06, + "entropy": 0.8086647934932262, + "num_tokens": 37560215.0, + "logits/chosen": -1.0313529810131257, + "logits/rejected": -1.0182036791475924, + "mean_token_accuracy": 0.7183289608359337, + "rewards/chosen": -0.013141918864030232, + "rewards/rejected": -0.013932020409274628, + "rewards/accuracies": 0.505, + "rewards/margins": 0.0007901015544848633, + "logps/chosen": -52.67770826101303, + "logps/rejected": -52.252629327774045, + "epoch": 0.5808827342980136, + "step": 560 + }, + { + "loss": 0.6919141292572022, + "grad_norm": 0.00928713008761406, + "learning_rate": 4.103626943005182e-06, + "entropy": 0.795804328629747, + "num_tokens": 38229872.0, + "logits/chosen": -1.0115969525038464, + "logits/rejected": -0.9389554266112111, + "mean_token_accuracy": 0.7316008464246988, + "rewards/chosen": -0.011151957947622576, + "rewards/rejected": -0.014132183314768555, + "rewards/accuracies": 0.54375, + "rewards/margins": 0.0029802253525849664, + "logps/chosen": -50.29158478021622, + "logps/rejected": -53.326151065826416, + "epoch": 0.591255640267621, + "step": 570 + }, + { + "loss": 0.6936386585235595, + "grad_norm": 0.009219864383339882, + "learning_rate": 4.000000000000001e-06, + "entropy": 0.7849282765295357, + "num_tokens": 38898599.0, + "logits/chosen": -1.0318535424181245, + "logits/rejected": -1.0693508828519998, + "mean_token_accuracy": 0.7279249535314739, + "rewards/chosen": -0.015236615104731755, + "rewards/rejected": -0.01477163603422241, + "rewards/accuracies": 0.49375, + "rewards/margins": -0.00046497906170770873, + "logps/chosen": -50.606445105075835, + "logps/rejected": -50.23892628192902, + "epoch": 0.6016285462372284, + "step": 580 + }, + { + "loss": 0.6924667358398438, + "grad_norm": 0.009871033020317554, + "learning_rate": 3.896373056994819e-06, + "entropy": 0.7915234410995617, + "num_tokens": 39570011.0, + "logits/chosen": -1.0704431655924542, + "logits/rejected": -1.0262311271415063, + "mean_token_accuracy": 0.7341923769563437, + "rewards/chosen": -0.013985364213192497, + "rewards/rejected": -0.015847310858209767, + "rewards/accuracies": 0.53625, + "rewards/margins": 0.0018619466816016939, + "logps/chosen": -53.37289155721665, + "logps/rejected": -53.37732348442078, + "epoch": 0.6120014522068358, + "step": 590 + }, + { + "loss": 0.6934967041015625, + "grad_norm": 0.008916029706597328, + "learning_rate": 3.7927461139896377e-06, + "entropy": 0.7781280868733301, + "num_tokens": 40238459.0, + "logits/chosen": -1.031845585303488, + "logits/rejected": -1.0679663812358249, + "mean_token_accuracy": 0.7267250791564583, + "rewards/chosen": -0.015354626149126034, + "rewards/rejected": -0.015155612989574366, + "rewards/accuracies": 0.495, + "rewards/margins": -0.0001990132535865996, + "logps/chosen": -50.91896806716919, + "logps/rejected": -49.1647160077095, + "epoch": 0.6223743581764432, + "step": 600 + }, + { + "loss": 0.6943734169006348, + "grad_norm": 0.009726111777126789, + "learning_rate": 3.6891191709844567e-06, + "entropy": 0.8024784850515425, + "num_tokens": 40907823.0, + "logits/chosen": -1.0033099905488874, + "logits/rejected": -1.004673033873931, + "mean_token_accuracy": 0.7266425576806068, + "rewards/chosen": -0.016839503781302483, + "rewards/rejected": -0.014924811632938316, + "rewards/accuracies": 0.485, + "rewards/margins": -0.0019146921102219494, + "logps/chosen": -51.37045606851578, + "logps/rejected": -50.59996291279793, + "epoch": 0.6327472641460505, + "step": 610 + }, + { + "loss": 0.693054485321045, + "grad_norm": 0.00853179581463337, + "learning_rate": 3.5854922279792748e-06, + "entropy": 0.7575920634204522, + "num_tokens": 41576629.0, + "logits/chosen": -1.0128204565402743, + "logits/rejected": -1.0291723665089934, + "mean_token_accuracy": 0.7279130771569907, + "rewards/chosen": -0.014212547984803337, + "rewards/rejected": -0.014947609209768871, + "rewards/accuracies": 0.48875, + "rewards/margins": 0.000735061179366312, + "logps/chosen": -50.57350071668625, + "logps/rejected": -49.389897744655606, + "epoch": 0.6431201701156579, + "step": 620 + }, + { + "eval_loss": 0.6942050457000732, + "eval_runtime": 307.8984, + "eval_samples_per_second": 3.248, + "eval_steps_per_second": 3.248, + "eval_entropy": 0.7959122954644263, + "eval_num_tokens": 41911681.0, + "eval_logits/chosen": -1.048361439070786, + "eval_logits/rejected": -1.0055296550561397, + "eval_mean_token_accuracy": 0.7335138544887304, + "eval_rewards/chosen": -0.014208579457705128, + "eval_rewards/rejected": -0.01261782132985536, + "eval_rewards/accuracies": 0.478, + "eval_rewards/margins": -0.0015907581194769592, + "eval_logps/chosen": -50.31507263565064, + "eval_logps/rejected": -52.76604993247986, + "epoch": 0.6483066231004616, + "step": 625 + }, + { + "loss": 0.6939579486846924, + "grad_norm": 0.009789089672267437, + "learning_rate": 3.4818652849740937e-06, + "entropy": 0.7933417669357732, + "num_tokens": 42247859.0, + "logits/chosen": -1.0118922806884323, + "logits/rejected": -1.0382741999872491, + "mean_token_accuracy": 0.726150699108839, + "rewards/chosen": -0.014976464999999734, + "rewards/rejected": -0.013932963377121722, + "rewards/accuracies": 0.47375, + "rewards/margins": -0.0010435017172130757, + "logps/chosen": -53.83100793600082, + "logps/rejected": -50.46369902849197, + "epoch": 0.6534930760852653, + "step": 630 + }, + { + "loss": 0.694810152053833, + "grad_norm": 0.009261916391551495, + "learning_rate": 3.3782383419689123e-06, + "entropy": 0.7883505333820358, + "num_tokens": 42918160.0, + "logits/chosen": -1.017383539174631, + "logits/rejected": -1.054998851475991, + "mean_token_accuracy": 0.7168397939577699, + "rewards/chosen": -0.015089196973789569, + "rewards/rejected": -0.012242867652641962, + "rewards/accuracies": 0.46, + "rewards/margins": -0.0028463293392269407, + "logps/chosen": -54.35950309753418, + "logps/rejected": -48.9059769487381, + "epoch": 0.6638659820548727, + "step": 640 + }, + { + "loss": 0.6925888061523438, + "grad_norm": 0.00910037662833929, + "learning_rate": 3.274611398963731e-06, + "entropy": 0.790731361717917, + "num_tokens": 43587843.0, + "logits/chosen": -0.9965395541483734, + "logits/rejected": -1.0179589161213116, + "mean_token_accuracy": 0.7306452417373657, + "rewards/chosen": -0.010891549229872908, + "rewards/rejected": -0.012513885581938666, + "rewards/accuracies": 0.52875, + "rewards/margins": 0.0016223363954850356, + "logps/chosen": -51.07387138366699, + "logps/rejected": -51.394845466613766, + "epoch": 0.6742388880244801, + "step": 650 + }, + { + "loss": 0.693898057937622, + "grad_norm": 0.009298712946474552, + "learning_rate": 3.1709844559585493e-06, + "entropy": 0.7892762251244858, + "num_tokens": 44256661.0, + "logits/chosen": -1.040483162193093, + "logits/rejected": -1.0218257141848732, + "mean_token_accuracy": 0.7231168592534959, + "rewards/chosen": -0.012846070201399017, + "rewards/rejected": -0.01177774412741428, + "rewards/accuracies": 0.495, + "rewards/margins": -0.001068326040294778, + "logps/chosen": -50.02721215367317, + "logps/rejected": -51.92197064161301, + "epoch": 0.6846117939940874, + "step": 660 + }, + { + "loss": 0.6929262161254883, + "grad_norm": 0.009983985684812069, + "learning_rate": 3.0673575129533683e-06, + "entropy": 0.7727112902654335, + "num_tokens": 44928208.0, + "logits/chosen": -1.033872497474533, + "logits/rejected": -1.0355189189593426, + "mean_token_accuracy": 0.7299729858152568, + "rewards/chosen": -0.012007646745373676, + "rewards/rejected": -0.012911729082511557, + "rewards/accuracies": 0.49625, + "rewards/margins": 0.0009040823050418112, + "logps/chosen": -52.13899112701416, + "logps/rejected": -50.62764532446861, + "epoch": 0.6949846999636948, + "step": 670 + }, + { + "loss": 0.6946879863739014, + "grad_norm": 0.009130201302468777, + "learning_rate": 2.963730569948187e-06, + "entropy": 0.8138119697524234, + "num_tokens": 45599959.0, + "logits/chosen": -0.966092846678868, + "logits/rejected": -0.9774829642341187, + "mean_token_accuracy": 0.7230793483182788, + "rewards/chosen": -0.015864108831710837, + "rewards/rejected": -0.013314598076967742, + "rewards/accuracies": 0.4675, + "rewards/margins": -0.0025495107232927695, + "logps/chosen": -54.92970582008362, + "logps/rejected": -52.76770358800888, + "epoch": 0.7053576059333022, + "step": 680 + }, + { + "loss": 0.6929837703704834, + "grad_norm": 0.009250026196241379, + "learning_rate": 2.8601036269430053e-06, + "entropy": 0.82899127332028, + "num_tokens": 46271100.0, + "logits/chosen": -0.9898684929018607, + "logits/rejected": -0.9973996765394122, + "mean_token_accuracy": 0.719442187603563, + "rewards/chosen": -0.010820029947699367, + "rewards/rejected": -0.01162173981451815, + "rewards/accuracies": 0.515, + "rewards/margins": 0.0008017099273274653, + "logps/chosen": -51.98621440887451, + "logps/rejected": -54.959817726612094, + "epoch": 0.7157305119029096, + "step": 690 + }, + { + "loss": 0.6941079139709473, + "grad_norm": 0.009462058544158936, + "learning_rate": 2.7564766839378243e-06, + "entropy": 0.7970602755853906, + "num_tokens": 46940588.0, + "logits/chosen": -0.990150519364322, + "logits/rejected": -0.9981860405217275, + "mean_token_accuracy": 0.7297776956856251, + "rewards/chosen": -0.012557482681352213, + "rewards/rejected": -0.011030125059482998, + "rewards/accuracies": 0.51, + "rewards/margins": -0.0015273576516483445, + "logps/chosen": -49.37967163324356, + "logps/rejected": -53.13790496587753, + "epoch": 0.726103417872517, + "step": 700 + }, + { + "loss": 0.6923154830932617, + "grad_norm": 0.008459668606519699, + "learning_rate": 2.6528497409326424e-06, + "entropy": 0.7973380678170361, + "num_tokens": 47612649.0, + "logits/chosen": -1.0290440507413436, + "logits/rejected": -1.0325854925972269, + "mean_token_accuracy": 0.7238865295890718, + "rewards/chosen": -0.012139474128680376, + "rewards/rejected": -0.014260805117913602, + "rewards/accuracies": 0.52875, + "rewards/margins": 0.0021213308708684054, + "logps/chosen": -52.259123842716214, + "logps/rejected": -54.400773532390595, + "epoch": 0.7364763238421244, + "step": 710 + }, + { + "loss": 0.6927196025848389, + "grad_norm": 0.008741075173020363, + "learning_rate": 2.5492227979274614e-06, + "entropy": 0.776990000186488, + "num_tokens": 48280316.0, + "logits/chosen": -1.02981366786685, + "logits/rejected": -1.062369960988718, + "mean_token_accuracy": 0.728738241456449, + "rewards/chosen": -0.0141699135041722, + "rewards/rejected": -0.01543546461060032, + "rewards/accuracies": 0.52, + "rewards/margins": 0.0012655511016782838, + "logps/chosen": -50.75450169801712, + "logps/rejected": -50.51603441476822, + "epoch": 0.7468492298117317, + "step": 720 + }, + { + "loss": 0.6939631938934326, + "grad_norm": 0.008915440179407597, + "learning_rate": 2.44559585492228e-06, + "entropy": 0.8170583094470203, + "num_tokens": 48952457.0, + "logits/chosen": -1.003780851996667, + "logits/rejected": -0.9864155673137232, + "mean_token_accuracy": 0.7165420038998127, + "rewards/chosen": -0.013467036513036419, + "rewards/rejected": -0.012332614251897666, + "rewards/accuracies": 0.495, + "rewards/margins": -0.0011344222621119116, + "logps/chosen": -54.76776822566986, + "logps/rejected": -52.639701968431474, + "epoch": 0.7572221357813391, + "step": 730 + }, + { + "loss": 0.6925458908081055, + "grad_norm": 0.01004419568926096, + "learning_rate": 2.3419689119170984e-06, + "entropy": 0.8180013949144631, + "num_tokens": 49623039.0, + "logits/chosen": -1.0169417811830719, + "logits/rejected": -1.0213671464834864, + "mean_token_accuracy": 0.7187614095583558, + "rewards/chosen": -0.012766179290275658, + "rewards/rejected": -0.014406545395818284, + "rewards/accuracies": 0.52625, + "rewards/margins": 0.001640366151041235, + "logps/chosen": -52.5052701497078, + "logps/rejected": -53.90763850927353, + "epoch": 0.7675950417509465, + "step": 740 + }, + { + "loss": 0.6922706127166748, + "grad_norm": 0.009859760291874409, + "learning_rate": 2.2383419689119174e-06, + "entropy": 0.8285305345850066, + "num_tokens": 50296449.0, + "logits/chosen": -0.9801905178679585, + "logits/rejected": -0.9738778555663805, + "mean_token_accuracy": 0.723729298338294, + "rewards/chosen": -0.009565252497509391, + "rewards/rejected": -0.01175256536917459, + "rewards/accuracies": 0.5175, + "rewards/margins": 0.0021873128600418566, + "logps/chosen": -54.38914824962616, + "logps/rejected": -55.734090762138365, + "epoch": 0.7779679477205539, + "step": 750 + }, + { + "eval_loss": 0.6926036477088928, + "eval_runtime": 339.6814, + "eval_samples_per_second": 2.944, + "eval_steps_per_second": 2.944, + "eval_entropy": 0.7968713178224862, + "eval_num_tokens": 50296449.0, + "eval_logits/chosen": -1.0377698264720323, + "eval_logits/rejected": -0.9943464753298086, + "eval_mean_token_accuracy": 0.7334770380109549, + "eval_rewards/chosen": -0.012114850055493434, + "eval_rewards/rejected": -0.013621491047078962, + "eval_rewards/accuracies": 0.504, + "eval_rewards/margins": 0.0015066410247527528, + "eval_logps/chosen": -50.294135341644285, + "eval_logps/rejected": -52.77608662986756, + "epoch": 0.7779679477205539, + "step": 750 + }, + { + "train_runtime": 27561.1083, + "train_samples_per_second": 2.798, + "train_steps_per_second": 0.035, + "total_flos": 4.075839588886364e+17, + "train_loss": 0.6933243910471598, + "epoch": 0.7779679477205539, + "step": 750 + } + ], + "validation_monitor_size": 1000, + "validation_monitor_selection": "fixed_seed_random_without_replacement", + "validation_monitor_seed": 22, + "validation_monitor_indices": [ + 2, + 10, + 14, + 21, + 55, + 63, + 66, + 69, + 107, + 110, + 142, + 144, + 149, + 150, + 151, + 152, + 160, + 163, + 166, + 167, + 176, + 181, + 206, + 207, + 259, + 267, + 281, + 295, + 298, + 306, + 307, + 317, + 321, + 331, + 336, + 341, + 346, + 349, + 351, + 352, + 357, + 358, + 369, + 370, + 382, + 386, + 391, + 401, + 411, + 412, + 432, + 437, + 452, + 462, + 465, + 488, + 490, + 491, + 492, + 494, + 503, + 504, + 508, + 528, + 538, + 540, + 551, + 553, + 567, + 586, + 605, + 606, + 625, + 627, + 661, + 663, + 666, + 677, + 685, + 690, + 692, + 704, + 708, + 714, + 715, + 727, + 728, + 733, + 745, + 752, + 753, + 755, + 764, + 773, + 779, + 783, + 793, + 796, + 799, + 803, + 804, + 805, + 813, + 816, + 818, + 823, + 827, + 829, + 830, + 837, + 842, + 845, + 850, + 853, + 856, + 889, + 890, + 905, + 915, + 924, + 930, + 939, + 951, + 988, + 1002, + 1005, + 1023, + 1029, + 1038, + 1049, + 1050, + 1054, + 1056, + 1067, + 1068, + 1079, + 1088, + 1091, + 1103, + 1114, + 1118, + 1133, + 1140, + 1144, + 1145, + 1155, + 1186, + 1195, + 1206, + 1223, + 1251, + 1252, + 1257, + 1259, + 1270, + 1271, + 1295, + 1303, + 1304, + 1305, + 1329, + 1335, + 1336, + 1343, + 1367, + 1373, + 1377, + 1403, + 1412, + 1429, + 1443, + 1457, + 1459, + 1460, + 1476, + 1483, + 1486, + 1494, + 1507, + 1510, + 1519, + 1521, + 1522, + 1545, + 1551, + 1570, + 1582, + 1593, + 1595, + 1603, + 1607, + 1614, + 1615, + 1625, + 1634, + 1639, + 1648, + 1654, + 1657, + 1662, + 1667, + 1673, + 1690, + 1704, + 1746, + 1756, + 1781, + 1783, + 1796, + 1799, + 1809, + 1814, + 1827, + 1829, + 1832, + 1844, + 1847, + 1854, + 1856, + 1857, + 1858, + 1874, + 1883, + 1889, + 1924, + 1925, + 1931, + 1932, + 1934, + 1935, + 1938, + 1950, + 1957, + 1962, + 1967, + 1975, + 1982, + 1983, + 1991, + 1998, + 2003, + 2008, + 2017, + 2021, + 2026, + 2035, + 2040, + 2050, + 2056, + 2077, + 2079, + 2082, + 2098, + 2100, + 2108, + 2121, + 2130, + 2133, + 2134, + 2138, + 2143, + 2166, + 2167, + 2180, + 2181, + 2185, + 2204, + 2205, + 2212, + 2221, + 2224, + 2226, + 2230, + 2233, + 2256, + 2261, + 2263, + 2269, + 2273, + 2290, + 2291, + 2299, + 2301, + 2321, + 2323, + 2330, + 2384, + 2401, + 2417, + 2420, + 2421, + 2424, + 2430, + 2435, + 2456, + 2488, + 2502, + 2504, + 2519, + 2527, + 2532, + 2538, + 2542, + 2553, + 2555, + 2558, + 2559, + 2562, + 2578, + 2583, + 2585, + 2590, + 2592, + 2594, + 2596, + 2600, + 2606, + 2607, + 2618, + 2630, + 2637, + 2647, + 2650, + 2657, + 2679, + 2685, + 2705, + 2706, + 2712, + 2713, + 2714, + 2727, + 2740, + 2742, + 2755, + 2780, + 2784, + 2792, + 2807, + 2808, + 2810, + 2820, + 2831, + 2839, + 2860, + 2862, + 2863, + 2866, + 2875, + 2878, + 2898, + 2905, + 2921, + 2922, + 2926, + 2930, + 2934, + 2944, + 2955, + 2957, + 2959, + 2973, + 2978, + 2998, + 3018, + 3022, + 3028, + 3031, + 3061, + 3085, + 3090, + 3104, + 3105, + 3111, + 3115, + 3121, + 3122, + 3129, + 3133, + 3135, + 3161, + 3162, + 3169, + 3173, + 3194, + 3195, + 3215, + 3225, + 3226, + 3241, + 3247, + 3250, + 3253, + 3265, + 3268, + 3293, + 3301, + 3312, + 3329, + 3352, + 3361, + 3362, + 3376, + 3396, + 3401, + 3403, + 3410, + 3419, + 3432, + 3443, + 3452, + 3467, + 3469, + 3475, + 3485, + 3503, + 3514, + 3515, + 3524, + 3528, + 3538, + 3544, + 3557, + 3560, + 3565, + 3600, + 3637, + 3642, + 3658, + 3659, + 3692, + 3693, + 3699, + 3722, + 3725, + 3728, + 3731, + 3740, + 3742, + 3762, + 3766, + 3780, + 3788, + 3794, + 3796, + 3798, + 3805, + 3817, + 3819, + 3822, + 3837, + 3839, + 3843, + 3846, + 3851, + 3854, + 3865, + 3870, + 3871, + 3884, + 3894, + 3895, + 3896, + 3907, + 3911, + 3915, + 3919, + 3920, + 3923, + 3933, + 3955, + 3967, + 3972, + 3974, + 3975, + 3984, + 3985, + 3997, + 4002, + 4010, + 4034, + 4044, + 4063, + 4073, + 4079, + 4082, + 4088, + 4121, + 4145, + 4148, + 4159, + 4161, + 4164, + 4177, + 4188, + 4199, + 4203, + 4207, + 4208, + 4213, + 4221, + 4225, + 4233, + 4241, + 4243, + 4247, + 4264, + 4274, + 4282, + 4286, + 4290, + 4308, + 4310, + 4313, + 4321, + 4324, + 4327, + 4349, + 4362, + 4370, + 4374, + 4380, + 4407, + 4409, + 4411, + 4415, + 4417, + 4418, + 4427, + 4431, + 4433, + 4451, + 4466, + 4477, + 4478, + 4479, + 4493, + 4494, + 4514, + 4527, + 4539, + 4550, + 4558, + 4568, + 4579, + 4583, + 4584, + 4586, + 4587, + 4590, + 4599, + 4602, + 4610, + 4626, + 4627, + 4630, + 4641, + 4647, + 4655, + 4656, + 4657, + 4661, + 4685, + 4714, + 4715, + 4731, + 4749, + 4752, + 4769, + 4777, + 4782, + 4791, + 4805, + 4818, + 4829, + 4833, + 4837, + 4839, + 4843, + 4871, + 4875, + 4879, + 4880, + 4885, + 4888, + 4895, + 4900, + 4923, + 4966, + 4968, + 4972, + 4989, + 4994, + 4998, + 5001, + 5013, + 5019, + 5026, + 5032, + 5034, + 5046, + 5055, + 5085, + 5086, + 5088, + 5089, + 5090, + 5095, + 5108, + 5110, + 5119, + 5120, + 5121, + 5133, + 5148, + 5154, + 5160, + 5169, + 5178, + 5222, + 5223, + 5232, + 5233, + 5240, + 5256, + 5259, + 5264, + 5271, + 5276, + 5279, + 5294, + 5300, + 5303, + 5321, + 5335, + 5337, + 5345, + 5348, + 5365, + 5373, + 5378, + 5384, + 5422, + 5442, + 5443, + 5445, + 5477, + 5485, + 5495, + 5497, + 5504, + 5526, + 5533, + 5542, + 5564, + 5570, + 5579, + 5587, + 5592, + 5608, + 5610, + 5624, + 5630, + 5638, + 5651, + 5663, + 5670, + 5675, + 5691, + 5700, + 5706, + 5707, + 5715, + 5720, + 5721, + 5722, + 5732, + 5738, + 5741, + 5769, + 5771, + 5775, + 5795, + 5796, + 5800, + 5809, + 5810, + 5815, + 5819, + 5827, + 5848, + 5849, + 5852, + 5859, + 5880, + 5884, + 5907, + 5909, + 5912, + 5919, + 5931, + 5932, + 5934, + 5941, + 5948, + 5950, + 5952, + 5953, + 5969, + 5981, + 6000, + 6003, + 6010, + 6018, + 6041, + 6065, + 6075, + 6090, + 6103, + 6106, + 6109, + 6114, + 6123, + 6131, + 6136, + 6138, + 6139, + 6164, + 6165, + 6171, + 6173, + 6180, + 6185, + 6189, + 6190, + 6221, + 6223, + 6237, + 6255, + 6262, + 6265, + 6293, + 6296, + 6305, + 6318, + 6331, + 6336, + 6340, + 6355, + 6366, + 6371, + 6396, + 6399, + 6402, + 6408, + 6432, + 6433, + 6441, + 6456, + 6465, + 6478, + 6486, + 6489, + 6507, + 6508, + 6520, + 6522, + 6528, + 6537, + 6551, + 6564, + 6589, + 6590, + 6598, + 6599, + 6611, + 6613, + 6615, + 6621, + 6634, + 6647, + 6649, + 6654, + 6676, + 6680, + 6690, + 6708, + 6729, + 6736, + 6744, + 6749, + 6756, + 6761, + 6763, + 6773, + 6788, + 6790, + 6796, + 6797, + 6811, + 6824, + 6850, + 6869, + 6871, + 6882, + 6892, + 6895, + 6906, + 6911, + 6912, + 6914, + 6927, + 6952, + 6966, + 6985, + 7001, + 7021, + 7031, + 7035, + 7038, + 7041, + 7045, + 7052, + 7057, + 7058, + 7072, + 7073, + 7076, + 7086, + 7102, + 7107, + 7109, + 7117, + 7122, + 7125, + 7166, + 7182, + 7199, + 7207, + 7212, + 7215, + 7232, + 7243, + 7246, + 7250, + 7253, + 7258, + 7263, + 7267, + 7270, + 7274, + 7280, + 7286, + 7293, + 7298, + 7302, + 7306, + 7316, + 7325, + 7326, + 7334, + 7356, + 7357, + 7363, + 7364, + 7367, + 7385, + 7392, + 7399, + 7405, + 7416, + 7420, + 7421, + 7426, + 7452, + 7476, + 7481, + 7519, + 7534, + 7542, + 7546, + 7573, + 7585, + 7601, + 7604, + 7606, + 7609, + 7629, + 7649, + 7653, + 7667, + 7682, + 7699, + 7738, + 7750, + 7786, + 7798, + 7800, + 7801, + 7805, + 7806, + 7811, + 7813, + 7832, + 7837, + 7849, + 7856, + 7876, + 7877, + 7887, + 7905, + 7916, + 7919, + 7920, + 7922, + 7923, + 7926, + 7944, + 7961, + 7966, + 7970, + 7973, + 7974, + 7976, + 7986, + 7999, + 8027, + 8028, + 8034, + 8047, + 8068, + 8074, + 8077, + 8091, + 8120, + 8122, + 8125, + 8152, + 8153, + 8164, + 8167, + 8169, + 8171, + 8177, + 8184, + 8189, + 8192, + 8196, + 8202, + 8212, + 8217, + 8231, + 8242, + 8244, + 8250, + 8256, + 8257, + 8265, + 8270, + 8274, + 8283, + 8290, + 8294, + 8301, + 8302, + 8307, + 8318, + 8326, + 8338, + 8349, + 8350, + 8353, + 8357, + 8371, + 8374, + 8377, + 8380, + 8387, + 8388, + 8396, + 8402, + 8419, + 8423, + 8428, + 8435, + 8439, + 8442, + 8444, + 8453, + 8461, + 8475, + 8481, + 8485, + 8493, + 8495, + 8498, + 8523, + 8530, + 8531, + 8562 + ], + "early_stopping_patience": 3 +} diff --git a/phase1/ablations/shuffled_documents/README.md b/phase1/ablations/shuffled_documents/README.md new file mode 100644 index 0000000000000000000000000000000000000000..cb985f2e1d45eff1244420af9883541cab0cfcc2 --- /dev/null +++ b/phase1/ablations/shuffled_documents/README.md @@ -0,0 +1,81 @@ +--- +library_name: peft +model_name: phase1-qwen-shuffled-documents-ablation +tags: +- base_model:adapter:Qwen/Qwen2.5-1.5B-Instruct +- dpo +- lora +- transformers +- trl +license: apache-2.0 +base_model: Qwen/Qwen2.5-1.5B-Instruct +pipeline_tag: text-generation +--- + +# Phase 1 Qwen `shuffled_documents` diagnostic ablation + +This is the Phase 1 `shuffled_documents` diagnostic LoRA-DPO adapter fine-tuned +from +[Qwen2.5-1.5B-Instruct](https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct). +The frozen training recipe and membership hashes are included in this directory. + +## Quick start + +```python +from peft import PeftModel +from transformers import AutoModelForCausalLM, AutoTokenizer + +repo_id = "geyuxu/york-milestone-project-self-traing-loop-model" +subfolder = "phase1/ablations/shuffled_documents" +base_id = "Qwen/Qwen2.5-1.5B-Instruct" + +tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder) +base_model = AutoModelForCausalLM.from_pretrained( + base_id, torch_dtype="auto", device_map="auto" +) +model = PeftModel.from_pretrained(base_model, repo_id, subfolder=subfolder) +``` + +## Training procedure + + + + + +This model was trained with DPO, a method introduced in [Direct Preference Optimization: Your Language Model is Secretly a Reward Model](https://huggingface.co/papers/2305.18290). + +### Framework versions + +- PEFT 0.18.1 +- TRL: 0.29.0 +- Transformers: 5.3.0 +- Pytorch: 2.10.0 +- Datasets: 4.6.1 +- Tokenizers: 0.22.2 + +## Citations + +Cite DPO as: + +```bibtex +@inproceedings{rafailov2023direct, + title = {{Direct Preference Optimization: Your Language Model is Secretly a Reward Model}}, + author = {Rafael Rafailov and Archit Sharma and Eric Mitchell and Christopher D. Manning and Stefano Ermon and Chelsea Finn}, + year = 2023, + booktitle = {Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023}, + url = {http://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html}, + editor = {Alice Oh and Tristan Naumann and Amir Globerson and Kate Saenko and Moritz Hardt and Sergey Levine}, +} +``` + +Cite TRL as: + +```bibtex +@software{vonwerra2020trl, + title = {{TRL: Transformers Reinforcement Learning}}, + author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin}, + license = {Apache-2.0}, + url = {https://github.com/huggingface/trl}, + year = {2020} +} +``` diff --git a/phase1/ablations/shuffled_documents/adapter_config.json b/phase1/ablations/shuffled_documents/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..fa47a2292cd8a23ccf1b4d101d7f7a03e3f08871 --- /dev/null +++ b/phase1/ablations/shuffled_documents/adapter_config.json @@ -0,0 +1,43 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen2.5-1.5B-Instruct", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "v_proj", + "k_proj", + "o_proj", + "q_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} diff --git a/phase1/ablations/shuffled_documents/adapter_model.safetensors b/phase1/ablations/shuffled_documents/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..b90ad15ec043f3443c08e93e294db5f4a33d5d5a --- /dev/null +++ b/phase1/ablations/shuffled_documents/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c9d8b830ce2a3b583eb54eab7470a7b3acb9c163dee812de0313c454462de064 +size 17462432 diff --git a/phase1/ablations/shuffled_documents/chat_template.jinja b/phase1/ablations/shuffled_documents/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..bdf7919a96cfe43d50914a007b9c0877bd0ec27e --- /dev/null +++ b/phase1/ablations/shuffled_documents/chat_template.jinja @@ -0,0 +1,54 @@ +{%- if tools %} + {{- '<|im_start|>system\n' }} + {%- if messages[0]['role'] == 'system' %} + {{- messages[0]['content'] }} + {%- else %} + {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }} + {%- endif %} + {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }} +{%- else %} + {%- if messages[0]['role'] == 'system' %} + {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }} + {%- else %} + {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- for message in messages %} + {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %} + {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {{- '<|im_start|>' + message.role }} + {%- if message.content %} + {{- '\n' + message.content }} + {%- endif %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {{- '\n\n{"name": "' }} + {{- tool_call.name }} + {{- '", "arguments": ' }} + {{- tool_call.arguments | tojson }} + {{- '}\n' }} + {%- endfor %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- message.content }} + {{- '\n' }} + {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} +{%- endif %} diff --git a/phase1/ablations/shuffled_documents/tokenizer.json b/phase1/ablations/shuffled_documents/tokenizer.json new file mode 100644 index 0000000000000000000000000000000000000000..d73428d91463b495bc017fb6a2fb3a656646482b --- /dev/null +++ b/phase1/ablations/shuffled_documents/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 +size 11422166 diff --git a/phase1/ablations/shuffled_documents/tokenizer_config.json b/phase1/ablations/shuffled_documents/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..9fd0fb48e73786f54fb04e98892f5f5a0ebeebdb --- /dev/null +++ b/phase1/ablations/shuffled_documents/tokenizer_config.json @@ -0,0 +1,29 @@ +{ + "add_prefix_space": false, + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "is_local": true, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null +} diff --git a/phase1/ablations/shuffled_documents/training_args.bin b/phase1/ablations/shuffled_documents/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..271cc8aab7c863188d6fb6c04e10b5c3e1c56d81 --- /dev/null +++ b/phase1/ablations/shuffled_documents/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:eaedd299a54d4c58a5c10cd9e379b80d44bbfd7922ccd578d5731f3e7adeb7cb +size 5841 diff --git a/phase1/ablations/shuffled_documents/training_recipe.json b/phase1/ablations/shuffled_documents/training_recipe.json new file mode 100644 index 0000000000000000000000000000000000000000..b135fecfbffc39053205ee997ce6a0527b333fa0 --- /dev/null +++ b/phase1/ablations/shuffled_documents/training_recipe.json @@ -0,0 +1,22 @@ +{ + "format_version": 1, + "experiment": "confusion_ablation", + "ablation": "shuffled_documents", + "model_name": "Qwen/Qwen2.5-1.5B-Instruct", + "train_membership_sha256": "b497fa765223a9810ad784f31e1598edfa992a162146d6f94d9cdf4adcedd87d", + "validation_membership_sha256": "2f609467438cd6a01fd84b9d80c0fcd84c44767e3b2ed98f4f6a83d68a62c181", + "num_train_pairs": 77124, + "num_validation_pairs": 8563, + "transformation_seed": 22, + "validation_prompt_mode": "clean_rag", + "learning_rate": 1e-05, + "beta": 0.1, + "num_epochs": 1.0, + "seed": 22, + "max_length": 512, + "max_prompt_length": 384, + "gradient_accumulation_steps": 80, + "save_steps": 125, + "save_total_limit": 12, + "preference_pairs_format_version": 2 +} diff --git a/phase1/ablations/shuffled_documents/training_summary.json b/phase1/ablations/shuffled_documents/training_summary.json new file mode 100644 index 0000000000000000000000000000000000000000..d29f62030e38741316b3eb5171cd09541aef6157 --- /dev/null +++ b/phase1/ablations/shuffled_documents/training_summary.json @@ -0,0 +1,2925 @@ +{ + "model_name": "Qwen/Qwen2.5-1.5B-Instruct", + "resolved_model": "Qwen/Qwen2.5-1.5B-Instruct", + "num_train_records": 77124, + "num_validation_records_available": 8563, + "training_config": { + "lora_rank": 16, + "lora_alpha": 32, + "learning_rate": 1e-05, + "num_epochs": 1.0, + "per_device_batch_size": 1, + "per_device_eval_batch_size": 1, + "gradient_accumulation_steps": 80, + "beta": 0.1, + "max_length": 512, + "max_prompt_length": 384, + "seed": 22, + "save_steps": 125, + "save_total_limit": 12, + "resume_from_checkpoint": null, + "precision_dtype": "torch.bfloat16", + "bf16": true, + "fp16": false, + "tokenizer_add_bos_token": false + }, + "global_step": 965, + "best_metric": 0.5229986906051636, + "best_model_checkpoint": "outputs/confusion_ablation_phase1_repair_v3/shuffled_documents/lora/checkpoint-875", + "train_metrics": { + "train_runtime": 37547.325, + "train_samples_per_second": 2.054, + "train_steps_per_second": 0.026, + "total_flos": 5.240658898225705e+17, + "train_loss": 0.4893577980871645 + }, + "log_history": [ + { + "loss": 0.6884657859802246, + "grad_norm": 0.012298274785280228, + "learning_rate": 9.906735751295338e-06, + "entropy": 1.105509125497192, + "num_tokens": 669280.0, + "logits/chosen": -0.6872332618784401, + "logits/rejected": -0.756335103700859, + "mean_token_accuracy": 0.6783600400015711, + "rewards/chosen": 0.006566623165663259, + "rewards/rejected": -0.0032956102347088743, + "rewards/accuracies": 0.54875, + "rewards/margins": 0.009862233377571101, + "logps/chosen": -55.77936493992806, + "logps/rejected": -47.51172333955765, + "epoch": 0.010372905969607386, + "step": 10 + }, + { + "loss": 0.6606436729431152, + "grad_norm": 0.016955673694610596, + "learning_rate": 9.803108808290156e-06, + "entropy": 1.133750858772546, + "num_tokens": 1338649.0, + "logits/chosen": -0.5871208397589887, + "logits/rejected": -0.6698573597018519, + "mean_token_accuracy": 0.6718795161508023, + "rewards/chosen": 0.04518332487099542, + "rewards/rejected": -0.02475843264875948, + "rewards/accuracies": 0.77625, + "rewards/margins": 0.06994175776082556, + "logps/chosen": -57.90504644036293, + "logps/rejected": -46.12085329890251, + "epoch": 0.02074581193921477, + "step": 20 + }, + { + "loss": 0.6296379089355468, + "grad_norm": 0.009446840733289719, + "learning_rate": 9.699481865284975e-06, + "entropy": 1.1883827408123762, + "num_tokens": 2009418.0, + "logits/chosen": -0.5129337609376847, + "logits/rejected": -0.521814939463297, + "mean_token_accuracy": 0.6750773158855736, + "rewards/chosen": 0.07124414303190861, + "rewards/rejected": -0.07998447065116351, + "rewards/accuracies": 0.7475, + "rewards/margins": 0.15122861398209353, + "logps/chosen": -57.641008596420285, + "logps/rejected": -48.77114168405533, + "epoch": 0.031118717908822157, + "step": 30 + }, + { + "loss": 0.598163366317749, + "grad_norm": 0.00930850487202406, + "learning_rate": 9.595854922279793e-06, + "entropy": 1.2363800938241183, + "num_tokens": 2680351.0, + "logits/chosen": -0.39490034436465016, + "logits/rejected": -0.38446442411270937, + "mean_token_accuracy": 0.6727914265915751, + "rewards/chosen": 0.06864972691008006, + "rewards/rejected": -0.17466060707674388, + "rewards/accuracies": 0.7575, + "rewards/margins": 0.2433103342913091, + "logps/chosen": -57.28514166235924, + "logps/rejected": -48.75534886360168, + "epoch": 0.04149162387842954, + "step": 40 + }, + { + "loss": 0.579415225982666, + "grad_norm": 0.008170416578650475, + "learning_rate": 9.492227979274612e-06, + "entropy": 1.3126574665866793, + "num_tokens": 3350707.0, + "logits/chosen": -0.29500715260247096, + "logits/rejected": -0.24820786208910245, + "mean_token_accuracy": 0.6680559937469661, + "rewards/chosen": 0.030048758659595477, + "rewards/rejected": -0.3040865566948378, + "rewards/accuracies": 0.76875, + "rewards/margins": 0.33413531533209606, + "logps/chosen": -58.29518891453743, + "logps/rejected": -49.01092249631882, + "epoch": 0.051864529848036925, + "step": 50 + }, + { + "loss": 0.5702046871185302, + "grad_norm": 0.008693543262779713, + "learning_rate": 9.388601036269432e-06, + "entropy": 1.3737784252408891, + "num_tokens": 4019963.0, + "logits/chosen": -0.21998480819560648, + "logits/rejected": -0.16028713959825802, + "mean_token_accuracy": 0.668321382869035, + "rewards/chosen": -0.01997856437286828, + "rewards/rejected": -0.4219406557866023, + "rewards/accuracies": 0.765, + "rewards/margins": 0.40196209065266886, + "logps/chosen": -57.433870965242384, + "logps/rejected": -49.84653505563736, + "epoch": 0.062237435817644314, + "step": 60 + }, + { + "loss": 0.5322866916656495, + "grad_norm": 0.008744485676288605, + "learning_rate": 9.284974093264249e-06, + "entropy": 1.3998539651371538, + "num_tokens": 4689814.0, + "logits/chosen": -0.20973319955981945, + "logits/rejected": -0.06686862488846866, + "mean_token_accuracy": 0.6616723272390663, + "rewards/chosen": -0.06465568452780644, + "rewards/rejected": -0.5979045833898999, + "rewards/accuracies": 0.7625, + "rewards/margins": 0.5332488995540189, + "logps/chosen": -59.22309771895409, + "logps/rejected": -51.44588413834572, + "epoch": 0.0726103417872517, + "step": 70 + }, + { + "loss": 0.5353285789489746, + "grad_norm": 0.008123241364955902, + "learning_rate": 9.181347150259067e-06, + "entropy": 1.505200822763145, + "num_tokens": 5359764.0, + "logits/chosen": -0.1390746882185333, + "logits/rejected": -0.0019247237053158573, + "mean_token_accuracy": 0.6578724461607635, + "rewards/chosen": -0.18390433938111528, + "rewards/rejected": -0.7765666933602188, + "rewards/accuracies": 0.77, + "rewards/margins": 0.5926623552781529, + "logps/chosen": -60.01300884962082, + "logps/rejected": -55.53570630192757, + "epoch": 0.08298324775685909, + "step": 80 + }, + { + "loss": 0.5359155654907226, + "grad_norm": 0.009612024761736393, + "learning_rate": 9.077720207253888e-06, + "entropy": 1.5023025350272656, + "num_tokens": 6029676.0, + "logits/chosen": -0.11111740139892143, + "logits/rejected": 0.01945645116999368, + "mean_token_accuracy": 0.65636579496786, + "rewards/chosen": -0.2407170122365642, + "rewards/rejected": -0.9039892829529709, + "rewards/accuracies": 0.77, + "rewards/margins": 0.6632722699642182, + "logps/chosen": -61.11234235405922, + "logps/rejected": -55.99775354385376, + "epoch": 0.09335615372646647, + "step": 90 + }, + { + "loss": 0.5361231803894043, + "grad_norm": 0.009299149736762047, + "learning_rate": 8.974093264248706e-06, + "entropy": 1.551793462112546, + "num_tokens": 6703908.0, + "logits/chosen": -0.0496634218575803, + "logits/rejected": 0.05476262310486179, + "mean_token_accuracy": 0.6553104593977332, + "rewards/chosen": -0.3408397056261765, + "rewards/rejected": -1.0588691204045608, + "rewards/accuracies": 0.7475, + "rewards/margins": 0.7180294132977724, + "logps/chosen": -66.09697647929191, + "logps/rejected": -62.22113917827606, + "epoch": 0.10372905969607385, + "step": 100 + }, + { + "loss": 0.5009335041046142, + "grad_norm": 0.011182536371052265, + "learning_rate": 8.870466321243523e-06, + "entropy": 1.5229294698499143, + "num_tokens": 7374540.0, + "logits/chosen": -0.09139268708523057, + "logits/rejected": 0.04862301456245882, + "mean_token_accuracy": 0.6561858785152436, + "rewards/chosen": -0.32845730935261597, + "rewards/rejected": -1.1125860015151556, + "rewards/accuracies": 0.8, + "rewards/margins": 0.7841286932909861, + "logps/chosen": -61.53394140005112, + "logps/rejected": -57.48781939744949, + "epoch": 0.11410196566568125, + "step": 110 + }, + { + "loss": 0.526285982131958, + "grad_norm": 0.007051755208522081, + "learning_rate": 8.766839378238343e-06, + "entropy": 1.5233578365854918, + "num_tokens": 8044495.0, + "logits/chosen": -0.15768700395031163, + "logits/rejected": -0.013001435805658218, + "mean_token_accuracy": 0.6615354198031127, + "rewards/chosen": -0.3864951348638078, + "rewards/rejected": -1.1354628334190056, + "rewards/accuracies": 0.76625, + "rewards/margins": 0.7489676963654347, + "logps/chosen": -62.9133579492569, + "logps/rejected": -55.22580579996109, + "epoch": 0.12447487163528863, + "step": 120 + }, + { + "eval_loss": 0.5760948657989502, + "eval_runtime": 189.325, + "eval_samples_per_second": 5.282, + "eval_steps_per_second": 5.282, + "eval_entropy": 1.1003064152523876, + "eval_num_tokens": 8379955.0, + "eval_logits/chosen": -0.20125681515889032, + "eval_logits/rejected": -0.04611639937520787, + "eval_mean_token_accuracy": 0.6978467227965593, + "eval_rewards/chosen": -0.518214108169428, + "eval_rewards/rejected": -1.0567502626019996, + "eval_rewards/accuracies": 0.671, + "eval_rewards/margins": 0.5385361527912319, + "eval_logps/chosen": -55.35512784194946, + "eval_logps/rejected": -63.207374160766605, + "epoch": 0.1296613246200923, + "step": 125 + }, + { + "loss": 0.527292537689209, + "grad_norm": 0.008284475654363632, + "learning_rate": 8.663212435233162e-06, + "entropy": 1.5593797556497158, + "num_tokens": 8715927.0, + "logits/chosen": -0.13633529239582157, + "logits/rejected": 0.00036253381978516077, + "mean_token_accuracy": 0.6549849599599838, + "rewards/chosen": -0.385840279032418, + "rewards/rejected": -1.156078426001768, + "rewards/accuracies": 0.77125, + "rewards/margins": 0.7702381464419886, + "logps/chosen": -62.51519522190094, + "logps/rejected": -59.316818933486935, + "epoch": 0.13484777760489602, + "step": 130 + }, + { + "loss": 0.5253304481506348, + "grad_norm": 0.00900308322161436, + "learning_rate": 8.55958549222798e-06, + "entropy": 1.4882201609387993, + "num_tokens": 9384889.0, + "logits/chosen": -0.2849882547966558, + "logits/rejected": -0.11130883394408073, + "mean_token_accuracy": 0.6634942902065813, + "rewards/chosen": -0.3596310636661656, + "rewards/rejected": -1.091110472352011, + "rewards/accuracies": 0.76625, + "rewards/margins": 0.7314794071600772, + "logps/chosen": -57.09630239605904, + "logps/rejected": -58.20026801586151, + "epoch": 0.1452206835745034, + "step": 140 + }, + { + "loss": 0.49091219902038574, + "grad_norm": 0.010285602882504463, + "learning_rate": 8.455958549222799e-06, + "entropy": 1.5471849937550723, + "num_tokens": 10056547.0, + "logits/chosen": -0.2356386486926287, + "logits/rejected": -0.09653027008020171, + "mean_token_accuracy": 0.6451748718414456, + "rewards/chosen": -0.29642743543074174, + "rewards/rejected": -1.1533646477002184, + "rewards/accuracies": 0.7975, + "rewards/margins": 0.8569372114818543, + "logps/chosen": -61.48972049832344, + "logps/rejected": -60.38522361636162, + "epoch": 0.1555935895441108, + "step": 150 + }, + { + "loss": 0.5228443622589112, + "grad_norm": 0.01041741855442524, + "learning_rate": 8.352331606217617e-06, + "entropy": 1.5723768063262105, + "num_tokens": 10728371.0, + "logits/chosen": -0.22289431271854238, + "logits/rejected": -0.11860647859510084, + "mean_token_accuracy": 0.6467062424123288, + "rewards/chosen": -0.40625758489735747, + "rewards/rejected": -1.1412722651916556, + "rewards/accuracies": 0.765, + "rewards/margins": 0.7350146814109757, + "logps/chosen": -65.39053342223167, + "logps/rejected": -60.2540340256691, + "epoch": 0.16596649551371817, + "step": 160 + }, + { + "loss": 0.5066161155700684, + "grad_norm": 0.0107549037784338, + "learning_rate": 8.248704663212436e-06, + "entropy": 1.5730788687244057, + "num_tokens": 11400691.0, + "logits/chosen": -0.1826010631193764, + "logits/rejected": -0.0979360531869457, + "mean_token_accuracy": 0.6487311513535678, + "rewards/chosen": -0.366861000080653, + "rewards/rejected": -1.1764580160021432, + "rewards/accuracies": 0.785, + "rewards/margins": 0.8095970169454813, + "logps/chosen": -63.89318405985832, + "logps/rejected": -58.80061838746071, + "epoch": 0.17633940148332555, + "step": 170 + }, + { + "loss": 0.49001736640930177, + "grad_norm": 0.009108452126383781, + "learning_rate": 8.145077720207254e-06, + "entropy": 1.5708052035421134, + "num_tokens": 12070033.0, + "logits/chosen": -0.19381916063920684, + "logits/rejected": -0.1097196340552256, + "mean_token_accuracy": 0.6498123442195356, + "rewards/chosen": -0.3718085140203402, + "rewards/rejected": -1.2254445453887457, + "rewards/accuracies": 0.79125, + "rewards/margins": 0.8536360321566463, + "logps/chosen": -61.2718432867527, + "logps/rejected": -58.15766977310181, + "epoch": 0.18671230745293294, + "step": 180 + }, + { + "loss": 0.485823917388916, + "grad_norm": 0.008646439760923386, + "learning_rate": 8.041450777202073e-06, + "entropy": 1.619616899229586, + "num_tokens": 12738738.0, + "logits/chosen": -0.23694109852957265, + "logits/rejected": -0.10073302225284902, + "mean_token_accuracy": 0.6411672846786678, + "rewards/chosen": -0.35420428678007737, + "rewards/rejected": -1.2305188758441363, + "rewards/accuracies": 0.79875, + "rewards/margins": 0.8763145874883048, + "logps/chosen": -64.08159978985786, + "logps/rejected": -57.158839713335034, + "epoch": 0.19708521342254032, + "step": 190 + }, + { + "loss": 0.5416598796844483, + "grad_norm": 0.011695838533341885, + "learning_rate": 7.937823834196891e-06, + "entropy": 1.5905032951384783, + "num_tokens": 13408076.0, + "logits/chosen": -0.19543056621701266, + "logits/rejected": -0.0932328823177738, + "mean_token_accuracy": 0.6534733981452883, + "rewards/chosen": -0.43409986807382667, + "rewards/rejected": -1.2331794095533406, + "rewards/accuracies": 0.75, + "rewards/margins": 0.7990795407560654, + "logps/chosen": -60.66096189260483, + "logps/rejected": -58.47315075159073, + "epoch": 0.2074581193921477, + "step": 200 + }, + { + "loss": 0.4877790451049805, + "grad_norm": 0.007835142314434052, + "learning_rate": 7.834196891191712e-06, + "entropy": 1.57742129791528, + "num_tokens": 14074371.0, + "logits/chosen": -0.3145613949504757, + "logits/rejected": -0.17554936279826738, + "mean_token_accuracy": 0.6423946806136519, + "rewards/chosen": -0.33800375567599983, + "rewards/rejected": -1.2202126982567278, + "rewards/accuracies": 0.795, + "rewards/margins": 0.8822089441586286, + "logps/chosen": -57.953816633224484, + "logps/rejected": -55.68584906101227, + "epoch": 0.2178310253617551, + "step": 210 + }, + { + "loss": 0.49164819717407227, + "grad_norm": 0.0103975310921669, + "learning_rate": 7.730569948186528e-06, + "entropy": 1.6296498909033834, + "num_tokens": 14745565.0, + "logits/chosen": -0.22528820916902675, + "logits/rejected": -0.1081294187855141, + "mean_token_accuracy": 0.6335770518891514, + "rewards/chosen": -0.49201680309750373, + "rewards/rejected": -1.3906073757648119, + "rewards/accuracies": 0.77875, + "rewards/margins": 0.8985905739758163, + "logps/chosen": -63.02672209978104, + "logps/rejected": -60.92768079042435, + "epoch": 0.2282039313313625, + "step": 220 + }, + { + "loss": 0.46550302505493163, + "grad_norm": 0.008888382464647293, + "learning_rate": 7.626943005181348e-06, + "entropy": 1.6522049311921, + "num_tokens": 15418258.0, + "logits/chosen": -0.19608391304632053, + "logits/rejected": -0.13757200366329492, + "mean_token_accuracy": 0.6412607514113188, + "rewards/chosen": -0.4089041862002341, + "rewards/rejected": -1.4265998849637982, + "rewards/accuracies": 0.81625, + "rewards/margins": 1.0176956978812814, + "logps/chosen": -67.77835583925247, + "logps/rejected": -61.52449678421021, + "epoch": 0.23857683730096987, + "step": 230 + }, + { + "loss": 0.4947453498840332, + "grad_norm": 0.013031491078436375, + "learning_rate": 7.523316062176167e-06, + "entropy": 1.645399712510407, + "num_tokens": 16089178.0, + "logits/chosen": -0.17655915871864677, + "logits/rejected": -0.09432907682600761, + "mean_token_accuracy": 0.633196273688227, + "rewards/chosen": -0.4906138309863218, + "rewards/rejected": -1.4527097501110984, + "rewards/accuracies": 0.7925, + "rewards/margins": 0.9620959201268852, + "logps/chosen": -65.66129240393639, + "logps/rejected": -61.8218787586689, + "epoch": 0.24894974327057726, + "step": 240 + }, + { + "loss": 0.4975076675415039, + "grad_norm": 0.010897196829319, + "learning_rate": 7.419689119170985e-06, + "entropy": 1.6312594626657664, + "num_tokens": 16760085.0, + "logits/chosen": -0.2438774302066993, + "logits/rejected": -0.11363609492659117, + "mean_token_accuracy": 0.6422833159938455, + "rewards/chosen": -0.47743636105085896, + "rewards/rejected": -1.39387952313984, + "rewards/accuracies": 0.78, + "rewards/margins": 0.9164431605814025, + "logps/chosen": -64.82744197368622, + "logps/rejected": -61.472064785957336, + "epoch": 0.2593226492401846, + "step": 250 + }, + { + "eval_loss": 0.5714118480682373, + "eval_runtime": 218.9609, + "eval_samples_per_second": 4.567, + "eval_steps_per_second": 4.567, + "eval_entropy": 1.1695467286109924, + "eval_num_tokens": 16760085.0, + "eval_logits/chosen": -0.33755278870089783, + "eval_logits/rejected": -0.1903600640166493, + "eval_mean_token_accuracy": 0.6928319974392653, + "eval_rewards/chosen": -0.5571019815959735, + "eval_rewards/rejected": -1.1734315770440735, + "eval_rewards/accuracies": 0.681, + "eval_rewards/margins": 0.6163295963965356, + "eval_logps/chosen": -55.744006565094, + "eval_logps/rejected": -64.37418729972839, + "epoch": 0.2593226492401846, + "step": 250 + }, + { + "loss": 0.5368201732635498, + "grad_norm": 0.014366215094923973, + "learning_rate": 7.3160621761658035e-06, + "entropy": 1.6642464812565594, + "num_tokens": 17432944.0, + "logits/chosen": -0.21442803743027763, + "logits/rejected": -0.1533687336947489, + "mean_token_accuracy": 0.6383416177332402, + "rewards/chosen": -0.521161526012147, + "rewards/rejected": -1.3946754023598624, + "rewards/accuracies": 0.75125, + "rewards/margins": 0.873513876660727, + "logps/chosen": -67.29541030287743, + "logps/rejected": -62.28271156668663, + "epoch": 0.26969555520979205, + "step": 260 + }, + { + "loss": 0.46097960472106936, + "grad_norm": 0.008764931000769138, + "learning_rate": 7.212435233160623e-06, + "entropy": 1.6307499624509365, + "num_tokens": 18100344.0, + "logits/chosen": -0.2942488690036322, + "logits/rejected": -0.205049856105403, + "mean_token_accuracy": 0.63437733290717, + "rewards/chosen": -0.40293989607162073, + "rewards/rejected": -1.3633229219498388, + "rewards/accuracies": 0.82, + "rewards/margins": 0.9603830263298004, + "logps/chosen": -60.72848893165588, + "logps/rejected": -58.830401865243914, + "epoch": 0.28006846117939943, + "step": 270 + }, + { + "loss": 0.4768073558807373, + "grad_norm": 0.013310693204402924, + "learning_rate": 7.108808290155441e-06, + "entropy": 1.683792082052678, + "num_tokens": 18771815.0, + "logits/chosen": -0.2853975746818681, + "logits/rejected": -0.19509288131538574, + "mean_token_accuracy": 0.6286856073141098, + "rewards/chosen": -0.45493435901131307, + "rewards/rejected": -1.4305240448995027, + "rewards/accuracies": 0.815, + "rewards/margins": 0.9755896841548384, + "logps/chosen": -66.43298780918121, + "logps/rejected": -60.264468108415606, + "epoch": 0.2904413671490068, + "step": 280 + }, + { + "loss": 0.49738154411315916, + "grad_norm": 0.011530010960996151, + "learning_rate": 7.005181347150259e-06, + "entropy": 1.6574138733558357, + "num_tokens": 19443478.0, + "logits/chosen": -0.25113046885999535, + "logits/rejected": -0.19086733946274176, + "mean_token_accuracy": 0.6388111670315265, + "rewards/chosen": -0.5135602542446577, + "rewards/rejected": -1.4373351091743098, + "rewards/accuracies": 0.7875, + "rewards/margins": 0.9237748555000871, + "logps/chosen": -64.76606289744377, + "logps/rejected": -61.73117418050766, + "epoch": 0.3008142731186142, + "step": 290 + }, + { + "loss": 0.4747192859649658, + "grad_norm": 0.01024437416344881, + "learning_rate": 6.9015544041450784e-06, + "entropy": 1.6370413560792805, + "num_tokens": 20114539.0, + "logits/chosen": -0.2804376500769946, + "logits/rejected": -0.20980492008240428, + "mean_token_accuracy": 0.6386570621281862, + "rewards/chosen": -0.5331722995669407, + "rewards/rejected": -1.5079922395838365, + "rewards/accuracies": 0.79625, + "rewards/margins": 0.9748199374601245, + "logps/chosen": -64.08541687965393, + "logps/rejected": -62.5286465549469, + "epoch": 0.3111871790882216, + "step": 300 + }, + { + "loss": 0.5026699542999268, + "grad_norm": 0.008775296621024609, + "learning_rate": 6.797927461139897e-06, + "entropy": 1.6209908311348409, + "num_tokens": 20787816.0, + "logits/chosen": -0.25151910251321974, + "logits/rejected": -0.21123922330556838, + "mean_token_accuracy": 0.637009305190295, + "rewards/chosen": -0.5232165511250787, + "rewards/rejected": -1.528597271647377, + "rewards/accuracies": 0.77875, + "rewards/margins": 1.0053807196952402, + "logps/chosen": -64.69553521633148, + "logps/rejected": -65.09379201054573, + "epoch": 0.32156008505782896, + "step": 310 + }, + { + "loss": 0.4780869483947754, + "grad_norm": 0.011877980083227158, + "learning_rate": 6.6943005181347155e-06, + "entropy": 1.6530776448501274, + "num_tokens": 21457261.0, + "logits/chosen": -0.3040290445166409, + "logits/rejected": -0.2582128301280066, + "mean_token_accuracy": 0.6281850132159889, + "rewards/chosen": -0.5049963393166399, + "rewards/rejected": -1.5010533356002997, + "rewards/accuracies": 0.7975, + "rewards/margins": 0.9960569961182774, + "logps/chosen": -65.50288674592971, + "logps/rejected": -62.25389522314072, + "epoch": 0.33193299102743634, + "step": 320 + }, + { + "loss": 0.4790470123291016, + "grad_norm": 0.011483334004878998, + "learning_rate": 6.590673575129535e-06, + "entropy": 1.7004518122132868, + "num_tokens": 22127813.0, + "logits/chosen": -0.2665928630702493, + "logits/rejected": -0.21917896340725312, + "mean_token_accuracy": 0.6241211013868451, + "rewards/chosen": -0.5605986861829296, + "rewards/rejected": -1.6507765721459873, + "rewards/accuracies": 0.7875, + "rewards/margins": 1.0901778864115477, + "logps/chosen": -65.43279960155488, + "logps/rejected": -64.90576170921325, + "epoch": 0.3423058969970437, + "step": 330 + }, + { + "loss": 0.49932498931884767, + "grad_norm": 0.011705898679792881, + "learning_rate": 6.487046632124353e-06, + "entropy": 1.627526972265914, + "num_tokens": 22798029.0, + "logits/chosen": -0.2497662070999108, + "logits/rejected": -0.1943012572657782, + "mean_token_accuracy": 0.629542014990002, + "rewards/chosen": -0.5459633090042917, + "rewards/rejected": -1.536823488854352, + "rewards/accuracies": 0.78125, + "rewards/margins": 0.9908601802797057, + "logps/chosen": -63.95577235102653, + "logps/rejected": -62.38620036482811, + "epoch": 0.3526788029666511, + "step": 340 + }, + { + "loss": 0.5073616027832031, + "grad_norm": 0.010271189734339714, + "learning_rate": 6.383419689119171e-06, + "entropy": 1.6555507829785348, + "num_tokens": 23469695.0, + "logits/chosen": -0.12372383655417052, + "logits/rejected": -0.06133092001205623, + "mean_token_accuracy": 0.6365941292047501, + "rewards/chosen": -0.45281789854270754, + "rewards/rejected": -1.4345268653615495, + "rewards/accuracies": 0.76625, + "rewards/margins": 0.9817089692596346, + "logps/chosen": -65.98795211911201, + "logps/rejected": -63.176999225616456, + "epoch": 0.3630517089362585, + "step": 350 + }, + { + "loss": 0.49364256858825684, + "grad_norm": 0.011196079663932323, + "learning_rate": 6.2797927461139905e-06, + "entropy": 1.5875802629441023, + "num_tokens": 24140119.0, + "logits/chosen": -0.14808247634584407, + "logits/rejected": -0.05311759222309109, + "mean_token_accuracy": 0.6542789761908352, + "rewards/chosen": -0.42567219032192954, + "rewards/rejected": -1.4186390993191162, + "rewards/accuracies": 0.78125, + "rewards/margins": 0.9929669088963419, + "logps/chosen": -61.54896705150604, + "logps/rejected": -60.50213465809822, + "epoch": 0.37342461490586587, + "step": 360 + }, + { + "loss": 0.483473539352417, + "grad_norm": 0.00855876225978136, + "learning_rate": 6.176165803108809e-06, + "entropy": 1.6722470651892944, + "num_tokens": 24811816.0, + "logits/chosen": -0.10432099490996176, + "logits/rejected": -0.016737991147920683, + "mean_token_accuracy": 0.6325697888806462, + "rewards/chosen": -0.4370591178828181, + "rewards/rejected": -1.4563098769000498, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.0192507596686482, + "logps/chosen": -66.96794133782387, + "logps/rejected": -61.84955484747886, + "epoch": 0.38379752087547325, + "step": 370 + }, + { + "eval_loss": 0.5579664707183838, + "eval_runtime": 259.8032, + "eval_samples_per_second": 3.849, + "eval_steps_per_second": 3.849, + "eval_entropy": 1.1737834954187274, + "eval_num_tokens": 25146613.0, + "eval_logits/chosen": -0.24876413873978034, + "eval_logits/rejected": -0.10992595889452522, + "eval_mean_token_accuracy": 0.6986516900211572, + "eval_rewards/chosen": -0.46025879815377996, + "eval_rewards/rejected": -1.1139206278724596, + "eval_rewards/accuracies": 0.69, + "eval_rewards/margins": 0.653661830753088, + "eval_logps/chosen": -54.77557474708557, + "eval_logps/rejected": -63.77907782173157, + "epoch": 0.38898397386027694, + "step": 375 + }, + { + "loss": 0.4502089977264404, + "grad_norm": 0.010930197313427925, + "learning_rate": 6.0725388601036275e-06, + "entropy": 1.6199329065252095, + "num_tokens": 25482244.0, + "logits/chosen": -0.08688961392902067, + "logits/rejected": -0.02652044551893199, + "mean_token_accuracy": 0.6438922439515591, + "rewards/chosen": -0.3519340772558644, + "rewards/rejected": -1.4421476342028472, + "rewards/accuracies": 0.82, + "rewards/margins": 1.0902135530067607, + "logps/chosen": -62.673097778558734, + "logps/rejected": -59.82661822557449, + "epoch": 0.39417042684508063, + "step": 380 + }, + { + "loss": 0.47233095169067385, + "grad_norm": 0.010069029405713081, + "learning_rate": 5.968911917098445e-06, + "entropy": 1.6362504732236267, + "num_tokens": 26153516.0, + "logits/chosen": -0.117927543996971, + "logits/rejected": -0.020026116136071335, + "mean_token_accuracy": 0.6393325614184141, + "rewards/chosen": -0.3878356325280038, + "rewards/rejected": -1.425175780861173, + "rewards/accuracies": 0.7975, + "rewards/margins": 1.0373401497886516, + "logps/chosen": -65.00698279976845, + "logps/rejected": -63.11618382692337, + "epoch": 0.404543332814688, + "step": 390 + }, + { + "loss": 0.47489471435546876, + "grad_norm": 0.009898822754621506, + "learning_rate": 5.865284974093265e-06, + "entropy": 1.6706327036954463, + "num_tokens": 26824251.0, + "logits/chosen": -0.10839314775215383, + "logits/rejected": -0.034963929941317536, + "mean_token_accuracy": 0.6374997748341411, + "rewards/chosen": -0.4009263012804513, + "rewards/rejected": -1.3926532304068677, + "rewards/accuracies": 0.8, + "rewards/margins": 0.9917269288050011, + "logps/chosen": -64.74012166261673, + "logps/rejected": -61.97128087759018, + "epoch": 0.4149162387842954, + "step": 400 + }, + { + "loss": 0.4803769111633301, + "grad_norm": 0.010940629988908768, + "learning_rate": 5.761658031088083e-06, + "entropy": 1.63126095501706, + "num_tokens": 27495141.0, + "logits/chosen": -0.11447524275234765, + "logits/rejected": -0.049791539508999005, + "mean_token_accuracy": 0.6397510032169521, + "rewards/chosen": -0.40976859070429783, + "rewards/rejected": -1.408572825542651, + "rewards/accuracies": 0.79625, + "rewards/margins": 0.9988042342383414, + "logps/chosen": -64.12175590753556, + "logps/rejected": -61.26593731760979, + "epoch": 0.4252891447539028, + "step": 410 + }, + { + "loss": 0.4590421676635742, + "grad_norm": 0.009904208593070507, + "learning_rate": 5.658031088082902e-06, + "entropy": 1.6269367651827633, + "num_tokens": 28166897.0, + "logits/chosen": -0.12299671549070275, + "logits/rejected": -0.07870207017521408, + "mean_token_accuracy": 0.639423014242202, + "rewards/chosen": -0.42271745148642365, + "rewards/rejected": -1.5163998405314123, + "rewards/accuracies": 0.80875, + "rewards/margins": 1.0936823888216167, + "logps/chosen": -66.27873115181923, + "logps/rejected": -61.664743056297304, + "epoch": 0.4356620507235102, + "step": 420 + }, + { + "loss": 0.44393315315246584, + "grad_norm": 0.007425240706652403, + "learning_rate": 5.554404145077721e-06, + "entropy": 1.654088821541518, + "num_tokens": 28838688.0, + "logits/chosen": -0.046875228210155474, + "logits/rejected": 0.02169555469420267, + "mean_token_accuracy": 0.633773233667016, + "rewards/chosen": -0.4147428805350137, + "rewards/rejected": -1.5705322344205341, + "rewards/accuracies": 0.82875, + "rewards/margins": 1.1557893524505198, + "logps/chosen": -64.6313831782341, + "logps/rejected": -62.269921224117276, + "epoch": 0.4460349566931176, + "step": 430 + }, + { + "loss": 0.45639653205871583, + "grad_norm": 0.01209650281816721, + "learning_rate": 5.4507772020725395e-06, + "entropy": 1.616792434314266, + "num_tokens": 29509172.0, + "logits/chosen": -0.11781563740683831, + "logits/rejected": -0.0357408626073251, + "mean_token_accuracy": 0.6438933240342886, + "rewards/chosen": -0.4713032754930464, + "rewards/rejected": -1.576865721391514, + "rewards/accuracies": 0.8075, + "rewards/margins": 1.105562445949763, + "logps/chosen": -63.11039539933205, + "logps/rejected": -62.069657690525055, + "epoch": 0.456407862662725, + "step": 440 + }, + { + "loss": 0.4802379131317139, + "grad_norm": 0.012935981154441833, + "learning_rate": 5.347150259067357e-06, + "entropy": 1.6445236429013312, + "num_tokens": 30180698.0, + "logits/chosen": -0.12016731428543326, + "logits/rejected": -0.02180240765374299, + "mean_token_accuracy": 0.6402219843491912, + "rewards/chosen": -0.48889325076772366, + "rewards/rejected": -1.6065474805486155, + "rewards/accuracies": 0.79125, + "rewards/margins": 1.1176542268134653, + "logps/chosen": -63.898983215093615, + "logps/rejected": -64.41106705546379, + "epoch": 0.46678076863233237, + "step": 450 + }, + { + "loss": 0.45149784088134765, + "grad_norm": 0.010028840973973274, + "learning_rate": 5.243523316062177e-06, + "entropy": 1.5921511804498731, + "num_tokens": 30850391.0, + "logits/chosen": -0.137444507891216, + "logits/rejected": -0.0779091628359406, + "mean_token_accuracy": 0.6352657766267658, + "rewards/chosen": -0.4104501232576513, + "rewards/rejected": -1.53232252900023, + "rewards/accuracies": 0.82, + "rewards/margins": 1.1218724092375487, + "logps/chosen": -63.677142459154126, + "logps/rejected": -61.06894833087921, + "epoch": 0.47715367460193975, + "step": 460 + }, + { + "loss": 0.48416786193847655, + "grad_norm": 0.017470093443989754, + "learning_rate": 5.139896373056995e-06, + "entropy": 1.6218253993801772, + "num_tokens": 31518644.0, + "logits/chosen": -0.17963024617659684, + "logits/rejected": -0.11590594375515367, + "mean_token_accuracy": 0.6306483455188573, + "rewards/chosen": -0.48125705970713173, + "rewards/rejected": -1.5042318812455777, + "rewards/accuracies": 0.78875, + "rewards/margins": 1.022974822570104, + "logps/chosen": -62.842620354890826, + "logps/rejected": -60.41043012142181, + "epoch": 0.48752658057154713, + "step": 470 + }, + { + "loss": 0.4613227844238281, + "grad_norm": 0.011262920685112476, + "learning_rate": 5.036269430051814e-06, + "entropy": 1.6439712375216187, + "num_tokens": 32191270.0, + "logits/chosen": -0.13840929670441426, + "logits/rejected": -0.06270617111823595, + "mean_token_accuracy": 0.6358192806318402, + "rewards/chosen": -0.5173802295615314, + "rewards/rejected": -1.5994968451908789, + "rewards/accuracies": 0.78875, + "rewards/margins": 1.0821166158560664, + "logps/chosen": -67.11039644002915, + "logps/rejected": -64.66348296999931, + "epoch": 0.4978994865411545, + "step": 480 + }, + { + "loss": 0.4716683864593506, + "grad_norm": 0.010376542806625366, + "learning_rate": 4.932642487046633e-06, + "entropy": 1.624296410465613, + "num_tokens": 32863739.0, + "logits/chosen": -0.12371006824984962, + "logits/rejected": -0.07942390242049989, + "mean_token_accuracy": 0.6453884858079255, + "rewards/chosen": -0.5051976552634733, + "rewards/rejected": -1.5973712733900174, + "rewards/accuracies": 0.79625, + "rewards/margins": 1.09217361707706, + "logps/chosen": -64.34702114582062, + "logps/rejected": -64.62907078266144, + "epoch": 0.5082723925107618, + "step": 490 + }, + { + "loss": 0.49039602279663086, + "grad_norm": 0.009508524090051651, + "learning_rate": 4.829015544041451e-06, + "entropy": 1.620068084243685, + "num_tokens": 33534123.0, + "logits/chosen": -0.14151537366366368, + "logits/rejected": -0.06308392833608244, + "mean_token_accuracy": 0.6416816004179418, + "rewards/chosen": -0.45566922199541293, + "rewards/rejected": -1.5016374166216702, + "rewards/accuracies": 0.77125, + "rewards/margins": 1.0459681928623468, + "logps/chosen": -62.64698366522789, + "logps/rejected": -63.112683627605435, + "epoch": 0.5186452984803692, + "step": 500 + }, + { + "eval_loss": 0.5447177886962891, + "eval_runtime": 282.5727, + "eval_samples_per_second": 3.539, + "eval_steps_per_second": 3.539, + "eval_entropy": 1.1561195281520487, + "eval_num_tokens": 33534123.0, + "eval_logits/chosen": -0.2889595885969217, + "eval_logits/rejected": -0.14876548266875028, + "eval_mean_token_accuracy": 0.6995251678973436, + "eval_rewards/chosen": -0.4679097114284523, + "eval_rewards/rejected": -1.1751951004834846, + "eval_rewards/accuracies": 0.718, + "eval_rewards/margins": 0.7072853878363967, + "eval_logps/chosen": -54.85208387184143, + "eval_logps/rejected": -64.39182249259949, + "epoch": 0.5186452984803692, + "step": 500 + }, + { + "loss": 0.47274036407470704, + "grad_norm": 0.011393043212592602, + "learning_rate": 4.72538860103627e-06, + "entropy": 1.6078121318202465, + "num_tokens": 34205019.0, + "logits/chosen": -0.11068593414216622, + "logits/rejected": -0.05753107212707231, + "mean_token_accuracy": 0.6421808904409408, + "rewards/chosen": -0.4764720965552806, + "rewards/rejected": -1.5107146011234727, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.034242505049333, + "logps/chosen": -65.03627744436264, + "logps/rejected": -60.319275975227356, + "epoch": 0.5290182044499767, + "step": 510 + }, + { + "loss": 0.49851455688476565, + "grad_norm": 0.009646100923418999, + "learning_rate": 4.621761658031089e-06, + "entropy": 1.5942507219407707, + "num_tokens": 34873534.0, + "logits/chosen": -0.1425558861577052, + "logits/rejected": -0.08471900949010301, + "mean_token_accuracy": 0.6420148031599819, + "rewards/chosen": -0.4576815483915561, + "rewards/rejected": -1.4324994718033122, + "rewards/accuracies": 0.78, + "rewards/margins": 0.9748179239872843, + "logps/chosen": -61.40950953125954, + "logps/rejected": -60.10699124455452, + "epoch": 0.5393911104195841, + "step": 520 + }, + { + "loss": 0.48189678192138674, + "grad_norm": 0.009592341259121895, + "learning_rate": 4.518134715025907e-06, + "entropy": 1.6446389424987138, + "num_tokens": 35544511.0, + "logits/chosen": -0.13110756052267608, + "logits/rejected": -0.06357341075451498, + "mean_token_accuracy": 0.632728576976806, + "rewards/chosen": -0.48985899652365333, + "rewards/rejected": -1.5666234930680367, + "rewards/accuracies": 0.805, + "rewards/margins": 1.0767644950002433, + "logps/chosen": -65.08468866825103, + "logps/rejected": -63.443355305194856, + "epoch": 0.5497640163891915, + "step": 530 + }, + { + "loss": 0.468688440322876, + "grad_norm": 0.013844112865626812, + "learning_rate": 4.414507772020726e-06, + "entropy": 1.6056221339013428, + "num_tokens": 36215333.0, + "logits/chosen": -0.14999839608893362, + "logits/rejected": -0.09044282285613432, + "mean_token_accuracy": 0.6412966704368591, + "rewards/chosen": -0.547224923124304, + "rewards/rejected": -1.6111413582094247, + "rewards/accuracies": 0.80125, + "rewards/margins": 1.063916433537379, + "logps/chosen": -63.49809960961342, + "logps/rejected": -63.379293674230574, + "epoch": 0.5601369223587989, + "step": 540 + }, + { + "loss": 0.47130799293518066, + "grad_norm": 0.013357527554035187, + "learning_rate": 4.310880829015544e-06, + "entropy": 1.6576832227222622, + "num_tokens": 36887745.0, + "logits/chosen": -0.09151633492208026, + "logits/rejected": -0.05831491488755683, + "mean_token_accuracy": 0.6373074753023684, + "rewards/chosen": -0.5282300677981402, + "rewards/rejected": -1.6641296455645351, + "rewards/accuracies": 0.8125, + "rewards/margins": 1.1358995781932026, + "logps/chosen": -67.07182881236076, + "logps/rejected": -66.767291328907, + "epoch": 0.5705098283284062, + "step": 550 + }, + { + "loss": 0.47469630241394045, + "grad_norm": 0.010529081337153912, + "learning_rate": 4.207253886010363e-06, + "entropy": 1.5956833818554879, + "num_tokens": 37559399.0, + "logits/chosen": -0.15354086541936426, + "logits/rejected": -0.1337727985771215, + "mean_token_accuracy": 0.6338519185595214, + "rewards/chosen": -0.5099609697687992, + "rewards/rejected": -1.6287131954543292, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.11875222671777, + "logps/chosen": -65.30963395237923, + "logps/rejected": -62.971670610904695, + "epoch": 0.5808827342980136, + "step": 560 + }, + { + "loss": 0.46091413497924805, + "grad_norm": 0.010177496820688248, + "learning_rate": 4.103626943005182e-06, + "entropy": 1.5913864125311374, + "num_tokens": 38229010.0, + "logits/chosen": -0.13525813478847795, + "logits/rejected": -0.09249211440964598, + "mean_token_accuracy": 0.6336300628073513, + "rewards/chosen": -0.4981531216715939, + "rewards/rejected": -1.5639994585248496, + "rewards/accuracies": 0.81, + "rewards/margins": 1.0658463343884796, + "logps/chosen": -64.47193114757538, + "logps/rejected": -60.892896996736525, + "epoch": 0.591255640267621, + "step": 570 + }, + { + "loss": 0.4695730686187744, + "grad_norm": 0.011662053875625134, + "learning_rate": 4.000000000000001e-06, + "entropy": 1.5622135086357594, + "num_tokens": 38898199.0, + "logits/chosen": -0.2250718619124712, + "logits/rejected": -0.1731223735468456, + "mean_token_accuracy": 0.6406736394017934, + "rewards/chosen": -0.46840151986456474, + "rewards/rejected": -1.5864200799472747, + "rewards/accuracies": 0.79625, + "rewards/margins": 1.1180185582535342, + "logps/chosen": -61.685848199129104, + "logps/rejected": -61.54680736422539, + "epoch": 0.6016285462372284, + "step": 580 + }, + { + "loss": 0.5114735126495361, + "grad_norm": 0.012209425680339336, + "learning_rate": 3.896373056994819e-06, + "entropy": 1.5807212091330438, + "num_tokens": 39570071.0, + "logits/chosen": -0.20266442113231448, + "logits/rejected": -0.17378155213538463, + "mean_token_accuracy": 0.6373632573708892, + "rewards/chosen": -0.5869286243220995, + "rewards/rejected": -1.5809136723290431, + "rewards/accuracies": 0.76625, + "rewards/margins": 0.993985049307812, + "logps/chosen": -66.22412416219711, + "logps/rejected": -64.40389844059945, + "epoch": 0.6120014522068358, + "step": 590 + }, + { + "loss": 0.4908578395843506, + "grad_norm": 0.012631360441446304, + "learning_rate": 3.7927461139896377e-06, + "entropy": 1.5845268149208278, + "num_tokens": 40238339.0, + "logits/chosen": -0.1760518834317504, + "logits/rejected": -0.12661257104922638, + "mean_token_accuracy": 0.6428114072233438, + "rewards/chosen": -0.47756292890640906, + "rewards/rejected": -1.5143917541232077, + "rewards/accuracies": 0.7925, + "rewards/margins": 1.036828825349221, + "logps/chosen": -60.982233242988585, + "logps/rejected": -61.829094297885895, + "epoch": 0.6223743581764432, + "step": 600 + }, + { + "loss": 0.4755990505218506, + "grad_norm": 0.011146514676511288, + "learning_rate": 3.6891191709844567e-06, + "entropy": 1.616417101584375, + "num_tokens": 40908073.0, + "logits/chosen": -0.15273173400238405, + "logits/rejected": -0.10939495965890679, + "mean_token_accuracy": 0.6361582010798156, + "rewards/chosen": -0.46836249336316543, + "rewards/rejected": -1.530430060197832, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.0620675668818875, + "logps/chosen": -61.67246505379677, + "logps/rejected": -62.54117285490036, + "epoch": 0.6327472641460505, + "step": 610 + }, + { + "loss": 0.4618831157684326, + "grad_norm": 0.010837269015610218, + "learning_rate": 3.5854922279792748e-06, + "entropy": 1.5439357980620116, + "num_tokens": 41577227.0, + "logits/chosen": -0.18130013224530928, + "logits/rejected": -0.11479609439593057, + "mean_token_accuracy": 0.6398758164048195, + "rewards/chosen": -0.4230602414139139, + "rewards/rejected": -1.5293280950934423, + "rewards/accuracies": 0.805, + "rewards/margins": 1.1062678526248784, + "logps/chosen": -60.17235267043114, + "logps/rejected": -61.54575915336609, + "epoch": 0.6431201701156579, + "step": 620 + }, + { + "eval_loss": 0.5342973470687866, + "eval_runtime": 313.9899, + "eval_samples_per_second": 3.185, + "eval_steps_per_second": 3.185, + "eval_entropy": 1.1306908284947277, + "eval_num_tokens": 41912429.0, + "eval_logits/chosen": -0.3345527509936572, + "eval_logits/rejected": -0.19592343447135618, + "eval_mean_token_accuracy": 0.6978758063018322, + "eval_rewards/chosen": -0.5062940621431917, + "eval_rewards/rejected": -1.2705660811300623, + "eval_rewards/accuracies": 0.729, + "eval_rewards/margins": 0.7642720182482153, + "eval_logps/chosen": -55.23592737579346, + "eval_logps/rejected": -65.34553232955933, + "epoch": 0.6483066231004616, + "step": 625 + }, + { + "loss": 0.4688296318054199, + "grad_norm": 0.012612175196409225, + "learning_rate": 3.4818652849740937e-06, + "entropy": 1.5918685279786586, + "num_tokens": 42248355.0, + "logits/chosen": -0.13449424627890724, + "logits/rejected": -0.08865577303502642, + "mean_token_accuracy": 0.6395252890512347, + "rewards/chosen": -0.45570429358987896, + "rewards/rejected": -1.5667857097371598, + "rewards/accuracies": 0.79625, + "rewards/margins": 1.1110814131516964, + "logps/chosen": -63.0096686398983, + "logps/rejected": -64.22273498296738, + "epoch": 0.6534930760852653, + "step": 630 + }, + { + "loss": 0.45305862426757815, + "grad_norm": 0.013145489618182182, + "learning_rate": 3.3782383419689123e-06, + "entropy": 1.5790020452067255, + "num_tokens": 42918958.0, + "logits/chosen": -0.12399229798184251, + "logits/rejected": -0.0790595345566506, + "mean_token_accuracy": 0.638872587159276, + "rewards/chosen": -0.498632894383627, + "rewards/rejected": -1.6101470832383347, + "rewards/accuracies": 0.81, + "rewards/margins": 1.111514187841676, + "logps/chosen": -61.910882869958876, + "logps/rejected": -64.29858126163482, + "epoch": 0.6638659820548727, + "step": 640 + }, + { + "loss": 0.5027210235595703, + "grad_norm": 0.010981565341353416, + "learning_rate": 3.274611398963731e-06, + "entropy": 1.5813618222996593, + "num_tokens": 43588637.0, + "logits/chosen": -0.17636409657708957, + "logits/rejected": -0.13223095230259532, + "mean_token_accuracy": 0.6379721114598215, + "rewards/chosen": -0.4963178468355909, + "rewards/rejected": -1.5267454569012626, + "rewards/accuracies": 0.78125, + "rewards/margins": 1.0304276071023195, + "logps/chosen": -62.9744295334816, + "logps/rejected": -61.37450294733048, + "epoch": 0.6742388880244801, + "step": 650 + }, + { + "loss": 0.5052100658416748, + "grad_norm": 0.00917180348187685, + "learning_rate": 3.1709844559585493e-06, + "entropy": 1.5768494224920868, + "num_tokens": 44257795.0, + "logits/chosen": -0.1306501266924166, + "logits/rejected": -0.110707865062261, + "mean_token_accuracy": 0.6388484319858253, + "rewards/chosen": -0.43548518963740207, + "rewards/rejected": -1.4259171091011376, + "rewards/accuracies": 0.795, + "rewards/margins": 0.9904319175425917, + "logps/chosen": -61.97638823986053, + "logps/rejected": -60.160553097724915, + "epoch": 0.6846117939940874, + "step": 660 + }, + { + "loss": 0.4341450214385986, + "grad_norm": 0.01135904062539339, + "learning_rate": 3.0673575129533683e-06, + "entropy": 1.5525631321314721, + "num_tokens": 44929114.0, + "logits/chosen": -0.14121290833212632, + "logits/rejected": -0.12193397964955385, + "mean_token_accuracy": 0.6406230745092034, + "rewards/chosen": -0.3947988249294576, + "rewards/rejected": -1.5214268560019264, + "rewards/accuracies": 0.805, + "rewards/margins": 1.1266280310088768, + "logps/chosen": -64.25430464625359, + "logps/rejected": -61.65177075624466, + "epoch": 0.6949846999636948, + "step": 670 + }, + { + "loss": 0.48023161888122556, + "grad_norm": 0.012425442226231098, + "learning_rate": 2.963730569948187e-06, + "entropy": 1.569240757385269, + "num_tokens": 45601053.0, + "logits/chosen": -0.10826928815748788, + "logits/rejected": -0.06131814862870058, + "mean_token_accuracy": 0.6415985404700041, + "rewards/chosen": -0.39569982240791435, + "rewards/rejected": -1.4680290185977356, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.0723291979916394, + "logps/chosen": -64.85109462738038, + "logps/rejected": -62.83043103218078, + "epoch": 0.7053576059333022, + "step": 680 + }, + { + "loss": 0.5059038162231445, + "grad_norm": 0.012226400896906853, + "learning_rate": 2.8601036269430053e-06, + "entropy": 1.5985452976450325, + "num_tokens": 46272416.0, + "logits/chosen": -0.07408260970012749, + "logits/rejected": -0.044598548594781996, + "mean_token_accuracy": 0.6376935013197362, + "rewards/chosen": -0.43009026095212904, + "rewards/rejected": -1.4046015239062035, + "rewards/accuracies": 0.7925, + "rewards/margins": 0.9745112636708655, + "logps/chosen": -66.05170575976372, + "logps/rejected": -61.49258904218674, + "epoch": 0.7157305119029096, + "step": 690 + }, + { + "loss": 0.44657320976257325, + "grad_norm": 0.01066418457776308, + "learning_rate": 2.7564766839378243e-06, + "entropy": 1.555307752629742, + "num_tokens": 46942192.0, + "logits/chosen": -0.1133366585618524, + "logits/rejected": -0.08814206115702024, + "mean_token_accuracy": 0.6415997881442308, + "rewards/chosen": -0.38704808527943896, + "rewards/rejected": -1.4645700649346691, + "rewards/accuracies": 0.81625, + "rewards/margins": 1.0775219783838839, + "logps/chosen": -64.02207235455514, + "logps/rejected": -58.637507121562955, + "epoch": 0.726103417872517, + "step": 700 + }, + { + "loss": 0.4767612934112549, + "grad_norm": 0.011431827209889889, + "learning_rate": 2.6528497409326424e-06, + "entropy": 1.5519457180798053, + "num_tokens": 47613801.0, + "logits/chosen": -0.1855044761632082, + "logits/rejected": -0.16003899451371845, + "mean_token_accuracy": 0.6355127618275582, + "rewards/chosen": -0.4479449386331544, + "rewards/rejected": -1.5271121441631113, + "rewards/accuracies": 0.7825, + "rewards/margins": 1.0791672053001822, + "logps/chosen": -67.1749314057827, + "logps/rejected": -62.050304319858554, + "epoch": 0.7364763238421244, + "step": 710 + }, + { + "loss": 0.46796340942382814, + "grad_norm": 0.014987263828516006, + "learning_rate": 2.5492227979274614e-06, + "entropy": 1.5421490759123118, + "num_tokens": 48282514.0, + "logits/chosen": -0.21524596853619962, + "logits/rejected": -0.1803562152249967, + "mean_token_accuracy": 0.6399628999084235, + "rewards/chosen": -0.4025335052545415, + "rewards/rejected": -1.4638134895112307, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.0612799843633547, + "logps/chosen": -62.34168538808822, + "logps/rejected": -58.95266834259033, + "epoch": 0.7468492298117317, + "step": 720 + }, + { + "loss": 0.46932258605957033, + "grad_norm": 0.015692368149757385, + "learning_rate": 2.44559585492228e-06, + "entropy": 1.5745291117485614, + "num_tokens": 48954943.0, + "logits/chosen": -0.1285935002288144, + "logits/rejected": -0.09589593946946354, + "mean_token_accuracy": 0.6359935710392892, + "rewards/chosen": -0.43215721267159096, + "rewards/rejected": -1.5352867500041611, + "rewards/accuracies": 0.8, + "rewards/margins": 1.1031295386189595, + "logps/chosen": -64.10728573679924, + "logps/rejected": -65.76713324308395, + "epoch": 0.7572221357813391, + "step": 730 + }, + { + "loss": 0.45352988243103026, + "grad_norm": 0.016576601192355156, + "learning_rate": 2.3419689119170984e-06, + "entropy": 1.5855714071169495, + "num_tokens": 49625089.0, + "logits/chosen": -0.18068304366710994, + "logits/rejected": -0.1021847750997751, + "mean_token_accuracy": 0.6383709345012903, + "rewards/chosen": -0.40431298587100173, + "rewards/rejected": -1.5056831875129137, + "rewards/accuracies": 0.82125, + "rewards/margins": 1.1013702021841891, + "logps/chosen": -63.80637561678886, + "logps/rejected": -63.55216552257538, + "epoch": 0.7675950417509465, + "step": 740 + }, + { + "loss": 0.47931923866271975, + "grad_norm": 0.011076811701059341, + "learning_rate": 2.2383419689119174e-06, + "entropy": 1.5709061060287057, + "num_tokens": 50298779.0, + "logits/chosen": -0.12009490934399182, + "logits/rejected": -0.08929539108746075, + "mean_token_accuracy": 0.639037843607366, + "rewards/chosen": -0.49217503207488333, + "rewards/rejected": -1.6097049169614912, + "rewards/accuracies": 0.78875, + "rewards/margins": 1.1175298846373334, + "logps/chosen": -66.4990734577179, + "logps/rejected": -66.20608123540879, + "epoch": 0.7779679477205539, + "step": 750 + }, + { + "eval_loss": 0.5270404815673828, + "eval_runtime": 345.9274, + "eval_samples_per_second": 2.891, + "eval_steps_per_second": 2.891, + "eval_entropy": 1.110700085580349, + "eval_num_tokens": 50298779.0, + "eval_logits/chosen": -0.32906322941516086, + "eval_logits/rejected": -0.18860008122397576, + "eval_mean_token_accuracy": 0.7015585756152868, + "eval_rewards/chosen": -0.4489634925366845, + "eval_rewards/rejected": -1.2056301589403302, + "eval_rewards/accuracies": 0.741, + "eval_rewards/margins": 0.7566666670814156, + "eval_logps/chosen": -54.662621686935424, + "eval_logps/rejected": -64.69617311096191, + "epoch": 0.7779679477205539, + "step": 750 + }, + { + "loss": 0.4540732383728027, + "grad_norm": 0.010880699381232262, + "learning_rate": 2.134715025906736e-06, + "entropy": 1.5645483719184994, + "num_tokens": 50969763.0, + "logits/chosen": -0.16403584506517532, + "logits/rejected": -0.12529662964612162, + "mean_token_accuracy": 0.6381968346890062, + "rewards/chosen": -0.4469367304503976, + "rewards/rejected": -1.5024195825937203, + "rewards/accuracies": 0.79625, + "rewards/margins": 1.0554828522354365, + "logps/chosen": -64.17523063778877, + "logps/rejected": -62.25719483613968, + "epoch": 0.7883408536901613, + "step": 760 + }, + { + "loss": 0.4533174991607666, + "grad_norm": 0.013751443475484848, + "learning_rate": 2.0310880829015544e-06, + "entropy": 1.572054564883001, + "num_tokens": 51644082.0, + "logits/chosen": -0.12553626378190955, + "logits/rejected": -0.08071406955215293, + "mean_token_accuracy": 0.6449453581683338, + "rewards/chosen": -0.47219557088945296, + "rewards/rejected": -1.6429482020807336, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.1707526312023402, + "logps/chosen": -67.36336461186409, + "logps/rejected": -66.28742809772491, + "epoch": 0.7987137596597687, + "step": 770 + }, + { + "loss": 0.4908913135528564, + "grad_norm": 0.012934792786836624, + "learning_rate": 1.9274611398963734e-06, + "entropy": 1.552621606560424, + "num_tokens": 52314131.0, + "logits/chosen": -0.18498517361282538, + "logits/rejected": -0.11354406717633747, + "mean_token_accuracy": 0.6353732559084893, + "rewards/chosen": -0.5131413355581753, + "rewards/rejected": -1.5564261709357379, + "rewards/accuracies": 0.7925, + "rewards/margins": 1.0432848367001861, + "logps/chosen": -63.0331081187725, + "logps/rejected": -63.343865761756895, + "epoch": 0.809086665629376, + "step": 780 + }, + { + "loss": 0.4565439701080322, + "grad_norm": 0.009556037373840809, + "learning_rate": 1.823834196891192e-06, + "entropy": 1.5621476396266372, + "num_tokens": 52985085.0, + "logits/chosen": -0.15417287925592482, + "logits/rejected": -0.1223619992398392, + "mean_token_accuracy": 0.6369738419540226, + "rewards/chosen": -0.4733358434267575, + "rewards/rejected": -1.6106882282317383, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.137352383164689, + "logps/chosen": -63.7558537530899, + "logps/rejected": -62.9910383605957, + "epoch": 0.8194595715989834, + "step": 790 + }, + { + "loss": 0.4741868495941162, + "grad_norm": 0.016206873580813408, + "learning_rate": 1.7202072538860104e-06, + "entropy": 1.601190996048972, + "num_tokens": 53655618.0, + "logits/chosen": -0.17460177579155492, + "logits/rejected": -0.13103846312794093, + "mean_token_accuracy": 0.630397092960775, + "rewards/chosen": -0.505800349440251, + "rewards/rejected": -1.5950146451813634, + "rewards/accuracies": 0.795, + "rewards/margins": 1.0892142936307936, + "logps/chosen": -65.44515601754189, + "logps/rejected": -63.24514980912208, + "epoch": 0.8298324775685908, + "step": 800 + }, + { + "loss": 0.4649956703186035, + "grad_norm": 0.010627168230712414, + "learning_rate": 1.6165803108808292e-06, + "entropy": 1.555380341531709, + "num_tokens": 54325923.0, + "logits/chosen": -0.19398651192502125, + "logits/rejected": -0.15082703285229165, + "mean_token_accuracy": 0.6328423308022321, + "rewards/chosen": -0.4637420481389563, + "rewards/rejected": -1.595540246453602, + "rewards/accuracies": 0.7975, + "rewards/margins": 1.1317981974454596, + "logps/chosen": -64.03305829644204, + "logps/rejected": -63.18673894524574, + "epoch": 0.8402053835381982, + "step": 810 + }, + { + "loss": 0.47422428131103517, + "grad_norm": 0.009889532811939716, + "learning_rate": 1.5129533678756477e-06, + "entropy": 1.5673230712581425, + "num_tokens": 54996048.0, + "logits/chosen": -0.126372156575865, + "logits/rejected": -0.1181616730672691, + "mean_token_accuracy": 0.6365260764025151, + "rewards/chosen": -0.4596140426142665, + "rewards/rejected": -1.5445942938700319, + "rewards/accuracies": 0.79125, + "rewards/margins": 1.0849802498798817, + "logps/chosen": -64.76353208780289, + "logps/rejected": -61.268287732601166, + "epoch": 0.8505782895078056, + "step": 820 + }, + { + "loss": 0.46468091011047363, + "grad_norm": 0.012822868302464485, + "learning_rate": 1.4093264248704663e-06, + "entropy": 1.5624252317007632, + "num_tokens": 55665592.0, + "logits/chosen": -0.17290901349535917, + "logits/rejected": -0.09302096610554733, + "mean_token_accuracy": 0.6442977831698954, + "rewards/chosen": -0.4371060668613791, + "rewards/rejected": -1.536119586258028, + "rewards/accuracies": 0.8, + "rewards/margins": 1.0990135185187682, + "logps/chosen": -61.236400594711306, + "logps/rejected": -62.05081979513168, + "epoch": 0.860951195477413, + "step": 830 + }, + { + "loss": 0.45096325874328613, + "grad_norm": 0.013951211236417294, + "learning_rate": 1.3056994818652852e-06, + "entropy": 1.5971369505673647, + "num_tokens": 56336442.0, + "logits/chosen": -0.10429545347666931, + "logits/rejected": -0.06649558410107631, + "mean_token_accuracy": 0.6393469601497054, + "rewards/chosen": -0.40763613226081363, + "rewards/rejected": -1.5621690288920944, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.154532897588797, + "logps/chosen": -65.28316462039948, + "logps/rejected": -62.96997811794281, + "epoch": 0.8713241014470204, + "step": 840 + }, + { + "loss": 0.47904314994812014, + "grad_norm": 0.00990319438278675, + "learning_rate": 1.2020725388601037e-06, + "entropy": 1.5907638165587559, + "num_tokens": 57007058.0, + "logits/chosen": -0.09286406420063983, + "logits/rejected": -0.07470467026337152, + "mean_token_accuracy": 0.6382128950580954, + "rewards/chosen": -0.4365648794851586, + "rewards/rejected": -1.510114096890611, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.0735492193046958, + "logps/chosen": -64.26915530443192, + "logps/rejected": -62.46030176877976, + "epoch": 0.8816970074166278, + "step": 850 + }, + { + "loss": 0.44410099983215334, + "grad_norm": 0.01345039252191782, + "learning_rate": 1.0984455958549225e-06, + "entropy": 1.592563019664958, + "num_tokens": 57679494.0, + "logits/chosen": -0.0886190660607926, + "logits/rejected": -0.07358264838387342, + "mean_token_accuracy": 0.6425007794424892, + "rewards/chosen": -0.4673090093833434, + "rewards/rejected": -1.6629120723775122, + "rewards/accuracies": 0.81875, + "rewards/margins": 1.1956030650436877, + "logps/chosen": -67.38507036685944, + "logps/rejected": -64.36338531255723, + "epoch": 0.8920699133862352, + "step": 860 + }, + { + "loss": 0.4594274044036865, + "grad_norm": 0.013964708894491196, + "learning_rate": 9.94818652849741e-07, + "entropy": 1.5719784983014689, + "num_tokens": 58351583.0, + "logits/chosen": -0.12534822828100103, + "logits/rejected": -0.08890342052546357, + "mean_token_accuracy": 0.6392641539499163, + "rewards/chosen": -0.4524850499225431, + "rewards/rejected": -1.519640732365424, + "rewards/accuracies": 0.81, + "rewards/margins": 1.067155679371208, + "logps/chosen": -66.18104577779769, + "logps/rejected": -62.2332259953022, + "epoch": 0.9024428193558426, + "step": 870 + }, + { + "eval_loss": 0.5229986906051636, + "eval_runtime": 381.7545, + "eval_samples_per_second": 2.619, + "eval_steps_per_second": 2.619, + "eval_entropy": 1.1186311850771309, + "eval_num_tokens": 58687050.0, + "eval_logits/chosen": -0.3429043124152476, + "eval_logits/rejected": -0.19782168371902933, + "eval_mean_token_accuracy": 0.6990677160173655, + "eval_rewards/chosen": -0.4997570053608506, + "eval_rewards/rejected": -1.3087458543572574, + "eval_rewards/accuracies": 0.742, + "eval_rewards/margins": 0.8089888453334569, + "eval_logps/chosen": -55.1705568113327, + "eval_logps/rejected": -65.72733002090455, + "epoch": 0.9076292723406463, + "step": 875 + }, + { + "loss": 0.443557596206665, + "grad_norm": 0.012585914693772793, + "learning_rate": 8.911917098445596e-07, + "entropy": 1.5672686619590968, + "num_tokens": 59023046.0, + "logits/chosen": -0.12382831435841032, + "logits/rejected": -0.0645244036783407, + "mean_token_accuracy": 0.6483317786641419, + "rewards/chosen": -0.4306466249283403, + "rewards/rejected": -1.5827327115193475, + "rewards/accuracies": 0.81875, + "rewards/margins": 1.152086088140495, + "logps/chosen": -62.15216760993004, + "logps/rejected": -64.93114773035049, + "epoch": 0.91281572532545, + "step": 880 + }, + { + "loss": 0.48163304328918455, + "grad_norm": 0.016623329371213913, + "learning_rate": 7.875647668393784e-07, + "entropy": 1.5462013640487566, + "num_tokens": 59693896.0, + "logits/chosen": -0.18203885317446325, + "logits/rejected": -0.13588479034259882, + "mean_token_accuracy": 0.6381713828258216, + "rewards/chosen": -0.521100371115972, + "rewards/rejected": -1.621375085162581, + "rewards/accuracies": 0.79, + "rewards/margins": 1.1002747156540864, + "logps/chosen": -63.47919486403465, + "logps/rejected": -64.74247067213058, + "epoch": 0.9231886312950573, + "step": 890 + }, + { + "loss": 0.44486308097839355, + "grad_norm": 0.013689976185560226, + "learning_rate": 6.839378238341969e-07, + "entropy": 1.5661965133296325, + "num_tokens": 60365892.0, + "logits/chosen": -0.11118840329620845, + "logits/rejected": -0.07329385257054667, + "mean_token_accuracy": 0.6402364380471408, + "rewards/chosen": -0.4615006167604588, + "rewards/rejected": -1.6645225426967953, + "rewards/accuracies": 0.805, + "rewards/margins": 1.2030219237180426, + "logps/chosen": -63.24172857046128, + "logps/rejected": -66.57125444769859, + "epoch": 0.9335615372646647, + "step": 900 + }, + { + "loss": 0.4535379886627197, + "grad_norm": 0.010069926269352436, + "learning_rate": 5.803108808290156e-07, + "entropy": 1.6097470640204847, + "num_tokens": 61036862.0, + "logits/chosen": -0.13289301790319819, + "logits/rejected": -0.0735025375326134, + "mean_token_accuracy": 0.6403341065347194, + "rewards/chosen": -0.4923504410259193, + "rewards/rejected": -1.6649721652292646, + "rewards/accuracies": 0.81625, + "rewards/margins": 1.1726217230875045, + "logps/chosen": -65.2402667415142, + "logps/rejected": -64.35793403387069, + "epoch": 0.9439344432342721, + "step": 910 + }, + { + "loss": 0.47214512825012206, + "grad_norm": 0.012374049052596092, + "learning_rate": 4.7668393782383424e-07, + "entropy": 1.554362382190302, + "num_tokens": 61705337.0, + "logits/chosen": -0.1705622702929202, + "logits/rejected": -0.11171698211418946, + "mean_token_accuracy": 0.6395000527519733, + "rewards/chosen": -0.48797103923920077, + "rewards/rejected": -1.6139281645056327, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.1259571241028608, + "logps/chosen": -61.68648973822594, + "logps/rejected": -61.576703943014145, + "epoch": 0.9543073492038795, + "step": 920 + }, + { + "loss": 0.45867042541503905, + "grad_norm": 0.01340759638696909, + "learning_rate": 3.730569948186528e-07, + "entropy": 1.5967881159111856, + "num_tokens": 62377312.0, + "logits/chosen": -0.12794651993287004, + "logits/rejected": -0.11582026918000818, + "mean_token_accuracy": 0.6418261045776308, + "rewards/chosen": -0.47417242905015883, + "rewards/rejected": -1.6198302093641177, + "rewards/accuracies": 0.79625, + "rewards/margins": 1.1456577759655193, + "logps/chosen": -65.74660252451896, + "logps/rejected": -64.64849405288696, + "epoch": 0.9646802551734869, + "step": 930 + }, + { + "loss": 0.4571826934814453, + "grad_norm": 0.013874146156013012, + "learning_rate": 2.694300518134715e-07, + "entropy": 1.5732189149875193, + "num_tokens": 63049225.0, + "logits/chosen": -0.0920138380328118, + "logits/rejected": -0.08312331933128955, + "mean_token_accuracy": 0.6384654704108834, + "rewards/chosen": -0.4673209265776677, + "rewards/rejected": -1.5875896779643517, + "rewards/accuracies": 0.81875, + "rewards/margins": 1.1202687494084238, + "logps/chosen": -65.47650277853012, + "logps/rejected": -62.935032539367675, + "epoch": 0.9750531611430943, + "step": 940 + }, + { + "loss": 0.46979718208312987, + "grad_norm": 0.014985826797783375, + "learning_rate": 1.6580310880829015e-07, + "entropy": 1.5484525384940206, + "num_tokens": 63720031.0, + "logits/chosen": -0.15286090245971876, + "logits/rejected": -0.1204497936021734, + "mean_token_accuracy": 0.6424062415957451, + "rewards/chosen": -0.49533468891182564, + "rewards/rejected": -1.60940544168232, + "rewards/accuracies": 0.79, + "rewards/margins": 1.114070752542466, + "logps/chosen": -63.495964756011965, + "logps/rejected": -62.70811087369919, + "epoch": 0.9854260671127016, + "step": 950 + }, + { + "loss": 0.4802603244781494, + "grad_norm": 0.011967616155743599, + "learning_rate": 6.217616580310881e-08, + "entropy": 1.5840327659342437, + "num_tokens": 64392923.0, + "logits/chosen": -0.10475629294980437, + "logits/rejected": -0.07119824883517484, + "mean_token_accuracy": 0.6352237542532384, + "rewards/chosen": -0.5007370743073989, + "rewards/rejected": -1.6135246429864492, + "rewards/accuracies": 0.7825, + "rewards/margins": 1.112787566203624, + "logps/chosen": -66.47015105843543, + "logps/rejected": -63.966525557041166, + "epoch": 0.995798973082309, + "step": 960 + }, + { + "train_runtime": 37547.325, + "train_samples_per_second": 2.054, + "train_steps_per_second": 0.026, + "total_flos": 5.240658898225705e+17, + "train_loss": 0.4893577980871645, + "entropy": 1.6188829190753125, + "num_tokens": 64665552.0, + "logits/chosen": -0.007985222363138011, + "logits/rejected": 0.00036492390230720645, + "mean_token_accuracy": 0.6398491414240849, + "rewards/chosen": -0.5084118424838604, + "rewards/rejected": -1.617123565151152, + "rewards/accuracies": 0.7932098765432098, + "rewards/margins": 1.1087117217435145, + "logps/chosen": -67.4950445699103, + "logps/rejected": -67.93077748498798, + "epoch": 1.0, + "step": 965 + } + ], + "validation_monitor_size": 1000, + "validation_monitor_selection": "fixed_seed_random_without_replacement", + "validation_monitor_seed": 22, + "validation_monitor_indices": [ + 2, + 10, + 14, + 21, + 55, + 63, + 66, + 69, + 107, + 110, + 142, + 144, + 149, + 150, + 151, + 152, + 160, + 163, + 166, + 167, + 176, + 181, + 206, + 207, + 259, + 267, + 281, + 295, + 298, + 306, + 307, + 317, + 321, + 331, + 336, + 341, + 346, + 349, + 351, + 352, + 357, + 358, + 369, + 370, + 382, + 386, + 391, + 401, + 411, + 412, + 432, + 437, + 452, + 462, + 465, + 488, + 490, + 491, + 492, + 494, + 503, + 504, + 508, + 528, + 538, + 540, + 551, + 553, + 567, + 586, + 605, + 606, + 625, + 627, + 661, + 663, + 666, + 677, + 685, + 690, + 692, + 704, + 708, + 714, + 715, + 727, + 728, + 733, + 745, + 752, + 753, + 755, + 764, + 773, + 779, + 783, + 793, + 796, + 799, + 803, + 804, + 805, + 813, + 816, + 818, + 823, + 827, + 829, + 830, + 837, + 842, + 845, + 850, + 853, + 856, + 889, + 890, + 905, + 915, + 924, + 930, + 939, + 951, + 988, + 1002, + 1005, + 1023, + 1029, + 1038, + 1049, + 1050, + 1054, + 1056, + 1067, + 1068, + 1079, + 1088, + 1091, + 1103, + 1114, + 1118, + 1133, + 1140, + 1144, + 1145, + 1155, + 1186, + 1195, + 1206, + 1223, + 1251, + 1252, + 1257, + 1259, + 1270, + 1271, + 1295, + 1303, + 1304, + 1305, + 1329, + 1335, + 1336, + 1343, + 1367, + 1373, + 1377, + 1403, + 1412, + 1429, + 1443, + 1457, + 1459, + 1460, + 1476, + 1483, + 1486, + 1494, + 1507, + 1510, + 1519, + 1521, + 1522, + 1545, + 1551, + 1570, + 1582, + 1593, + 1595, + 1603, + 1607, + 1614, + 1615, + 1625, + 1634, + 1639, + 1648, + 1654, + 1657, + 1662, + 1667, + 1673, + 1690, + 1704, + 1746, + 1756, + 1781, + 1783, + 1796, + 1799, + 1809, + 1814, + 1827, + 1829, + 1832, + 1844, + 1847, + 1854, + 1856, + 1857, + 1858, + 1874, + 1883, + 1889, + 1924, + 1925, + 1931, + 1932, + 1934, + 1935, + 1938, + 1950, + 1957, + 1962, + 1967, + 1975, + 1982, + 1983, + 1991, + 1998, + 2003, + 2008, + 2017, + 2021, + 2026, + 2035, + 2040, + 2050, + 2056, + 2077, + 2079, + 2082, + 2098, + 2100, + 2108, + 2121, + 2130, + 2133, + 2134, + 2138, + 2143, + 2166, + 2167, + 2180, + 2181, + 2185, + 2204, + 2205, + 2212, + 2221, + 2224, + 2226, + 2230, + 2233, + 2256, + 2261, + 2263, + 2269, + 2273, + 2290, + 2291, + 2299, + 2301, + 2321, + 2323, + 2330, + 2384, + 2401, + 2417, + 2420, + 2421, + 2424, + 2430, + 2435, + 2456, + 2488, + 2502, + 2504, + 2519, + 2527, + 2532, + 2538, + 2542, + 2553, + 2555, + 2558, + 2559, + 2562, + 2578, + 2583, + 2585, + 2590, + 2592, + 2594, + 2596, + 2600, + 2606, + 2607, + 2618, + 2630, + 2637, + 2647, + 2650, + 2657, + 2679, + 2685, + 2705, + 2706, + 2712, + 2713, + 2714, + 2727, + 2740, + 2742, + 2755, + 2780, + 2784, + 2792, + 2807, + 2808, + 2810, + 2820, + 2831, + 2839, + 2860, + 2862, + 2863, + 2866, + 2875, + 2878, + 2898, + 2905, + 2921, + 2922, + 2926, + 2930, + 2934, + 2944, + 2955, + 2957, + 2959, + 2973, + 2978, + 2998, + 3018, + 3022, + 3028, + 3031, + 3061, + 3085, + 3090, + 3104, + 3105, + 3111, + 3115, + 3121, + 3122, + 3129, + 3133, + 3135, + 3161, + 3162, + 3169, + 3173, + 3194, + 3195, + 3215, + 3225, + 3226, + 3241, + 3247, + 3250, + 3253, + 3265, + 3268, + 3293, + 3301, + 3312, + 3329, + 3352, + 3361, + 3362, + 3376, + 3396, + 3401, + 3403, + 3410, + 3419, + 3432, + 3443, + 3452, + 3467, + 3469, + 3475, + 3485, + 3503, + 3514, + 3515, + 3524, + 3528, + 3538, + 3544, + 3557, + 3560, + 3565, + 3600, + 3637, + 3642, + 3658, + 3659, + 3692, + 3693, + 3699, + 3722, + 3725, + 3728, + 3731, + 3740, + 3742, + 3762, + 3766, + 3780, + 3788, + 3794, + 3796, + 3798, + 3805, + 3817, + 3819, + 3822, + 3837, + 3839, + 3843, + 3846, + 3851, + 3854, + 3865, + 3870, + 3871, + 3884, + 3894, + 3895, + 3896, + 3907, + 3911, + 3915, + 3919, + 3920, + 3923, + 3933, + 3955, + 3967, + 3972, + 3974, + 3975, + 3984, + 3985, + 3997, + 4002, + 4010, + 4034, + 4044, + 4063, + 4073, + 4079, + 4082, + 4088, + 4121, + 4145, + 4148, + 4159, + 4161, + 4164, + 4177, + 4188, + 4199, + 4203, + 4207, + 4208, + 4213, + 4221, + 4225, + 4233, + 4241, + 4243, + 4247, + 4264, + 4274, + 4282, + 4286, + 4290, + 4308, + 4310, + 4313, + 4321, + 4324, + 4327, + 4349, + 4362, + 4370, + 4374, + 4380, + 4407, + 4409, + 4411, + 4415, + 4417, + 4418, + 4427, + 4431, + 4433, + 4451, + 4466, + 4477, + 4478, + 4479, + 4493, + 4494, + 4514, + 4527, + 4539, + 4550, + 4558, + 4568, + 4579, + 4583, + 4584, + 4586, + 4587, + 4590, + 4599, + 4602, + 4610, + 4626, + 4627, + 4630, + 4641, + 4647, + 4655, + 4656, + 4657, + 4661, + 4685, + 4714, + 4715, + 4731, + 4749, + 4752, + 4769, + 4777, + 4782, + 4791, + 4805, + 4818, + 4829, + 4833, + 4837, + 4839, + 4843, + 4871, + 4875, + 4879, + 4880, + 4885, + 4888, + 4895, + 4900, + 4923, + 4966, + 4968, + 4972, + 4989, + 4994, + 4998, + 5001, + 5013, + 5019, + 5026, + 5032, + 5034, + 5046, + 5055, + 5085, + 5086, + 5088, + 5089, + 5090, + 5095, + 5108, + 5110, + 5119, + 5120, + 5121, + 5133, + 5148, + 5154, + 5160, + 5169, + 5178, + 5222, + 5223, + 5232, + 5233, + 5240, + 5256, + 5259, + 5264, + 5271, + 5276, + 5279, + 5294, + 5300, + 5303, + 5321, + 5335, + 5337, + 5345, + 5348, + 5365, + 5373, + 5378, + 5384, + 5422, + 5442, + 5443, + 5445, + 5477, + 5485, + 5495, + 5497, + 5504, + 5526, + 5533, + 5542, + 5564, + 5570, + 5579, + 5587, + 5592, + 5608, + 5610, + 5624, + 5630, + 5638, + 5651, + 5663, + 5670, + 5675, + 5691, + 5700, + 5706, + 5707, + 5715, + 5720, + 5721, + 5722, + 5732, + 5738, + 5741, + 5769, + 5771, + 5775, + 5795, + 5796, + 5800, + 5809, + 5810, + 5815, + 5819, + 5827, + 5848, + 5849, + 5852, + 5859, + 5880, + 5884, + 5907, + 5909, + 5912, + 5919, + 5931, + 5932, + 5934, + 5941, + 5948, + 5950, + 5952, + 5953, + 5969, + 5981, + 6000, + 6003, + 6010, + 6018, + 6041, + 6065, + 6075, + 6090, + 6103, + 6106, + 6109, + 6114, + 6123, + 6131, + 6136, + 6138, + 6139, + 6164, + 6165, + 6171, + 6173, + 6180, + 6185, + 6189, + 6190, + 6221, + 6223, + 6237, + 6255, + 6262, + 6265, + 6293, + 6296, + 6305, + 6318, + 6331, + 6336, + 6340, + 6355, + 6366, + 6371, + 6396, + 6399, + 6402, + 6408, + 6432, + 6433, + 6441, + 6456, + 6465, + 6478, + 6486, + 6489, + 6507, + 6508, + 6520, + 6522, + 6528, + 6537, + 6551, + 6564, + 6589, + 6590, + 6598, + 6599, + 6611, + 6613, + 6615, + 6621, + 6634, + 6647, + 6649, + 6654, + 6676, + 6680, + 6690, + 6708, + 6729, + 6736, + 6744, + 6749, + 6756, + 6761, + 6763, + 6773, + 6788, + 6790, + 6796, + 6797, + 6811, + 6824, + 6850, + 6869, + 6871, + 6882, + 6892, + 6895, + 6906, + 6911, + 6912, + 6914, + 6927, + 6952, + 6966, + 6985, + 7001, + 7021, + 7031, + 7035, + 7038, + 7041, + 7045, + 7052, + 7057, + 7058, + 7072, + 7073, + 7076, + 7086, + 7102, + 7107, + 7109, + 7117, + 7122, + 7125, + 7166, + 7182, + 7199, + 7207, + 7212, + 7215, + 7232, + 7243, + 7246, + 7250, + 7253, + 7258, + 7263, + 7267, + 7270, + 7274, + 7280, + 7286, + 7293, + 7298, + 7302, + 7306, + 7316, + 7325, + 7326, + 7334, + 7356, + 7357, + 7363, + 7364, + 7367, + 7385, + 7392, + 7399, + 7405, + 7416, + 7420, + 7421, + 7426, + 7452, + 7476, + 7481, + 7519, + 7534, + 7542, + 7546, + 7573, + 7585, + 7601, + 7604, + 7606, + 7609, + 7629, + 7649, + 7653, + 7667, + 7682, + 7699, + 7738, + 7750, + 7786, + 7798, + 7800, + 7801, + 7805, + 7806, + 7811, + 7813, + 7832, + 7837, + 7849, + 7856, + 7876, + 7877, + 7887, + 7905, + 7916, + 7919, + 7920, + 7922, + 7923, + 7926, + 7944, + 7961, + 7966, + 7970, + 7973, + 7974, + 7976, + 7986, + 7999, + 8027, + 8028, + 8034, + 8047, + 8068, + 8074, + 8077, + 8091, + 8120, + 8122, + 8125, + 8152, + 8153, + 8164, + 8167, + 8169, + 8171, + 8177, + 8184, + 8189, + 8192, + 8196, + 8202, + 8212, + 8217, + 8231, + 8242, + 8244, + 8250, + 8256, + 8257, + 8265, + 8270, + 8274, + 8283, + 8290, + 8294, + 8301, + 8302, + 8307, + 8318, + 8326, + 8338, + 8349, + 8350, + 8353, + 8357, + 8371, + 8374, + 8377, + 8380, + 8387, + 8388, + 8396, + 8402, + 8419, + 8423, + 8428, + 8435, + 8439, + 8442, + 8444, + 8453, + 8461, + 8475, + 8481, + 8485, + 8493, + 8495, + 8498, + 8523, + 8530, + 8531, + 8562 + ], + "early_stopping_patience": 3 +} diff --git a/phase1/llama-dpo-v3/README.md b/phase1/llama-dpo-v3/README.md new file mode 100644 index 0000000000000000000000000000000000000000..bbf7198e1dd125a154033276ba2bf5684956b804 --- /dev/null +++ b/phase1/llama-dpo-v3/README.md @@ -0,0 +1,82 @@ +--- +library_name: peft +model_name: phase1-llama-dpo-v3 +tags: +- base_model:adapter:meta-llama/Llama-3.2-1B-Instruct +- dpo +- lora +- transformers +- trl +license: llama3.2 +base_model: meta-llama/Llama-3.2-1B-Instruct +pipeline_tag: text-generation +--- + +# Phase 1 Llama cross-family DPO adapter + +This is the Phase 1 cross-family LoRA-DPO adapter fine-tuned from +[Llama-3.2-1B-Instruct](https://huggingface.co/meta-llama/Llama-3.2-1B-Instruct) +with 99,986 preference pairs. Access to the gated base model and acceptance of its +license are required. It has been trained using +[TRL](https://github.com/huggingface/trl). + +## Quick start + +```python +from peft import PeftModel +from transformers import AutoModelForCausalLM, AutoTokenizer + +repo_id = "geyuxu/york-milestone-project-self-traing-loop-model" +subfolder = "phase1/llama-dpo-v3" +base_id = "meta-llama/Llama-3.2-1B-Instruct" + +tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder) +base_model = AutoModelForCausalLM.from_pretrained( + base_id, torch_dtype="auto", device_map="auto" +) +model = PeftModel.from_pretrained(base_model, repo_id, subfolder=subfolder) +``` + +## Training procedure + + + + + +This model was trained with DPO, a method introduced in [Direct Preference Optimization: Your Language Model is Secretly a Reward Model](https://huggingface.co/papers/2305.18290). + +### Framework versions + +- PEFT 0.18.1 +- TRL: 0.29.0 +- Transformers: 5.3.0 +- Pytorch: 2.10.0 +- Datasets: 4.6.1 +- Tokenizers: 0.22.2 + +## Citations + +Cite DPO as: + +```bibtex +@inproceedings{rafailov2023direct, + title = {{Direct Preference Optimization: Your Language Model is Secretly a Reward Model}}, + author = {Rafael Rafailov and Archit Sharma and Eric Mitchell and Christopher D. Manning and Stefano Ermon and Chelsea Finn}, + year = 2023, + booktitle = {Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023}, + url = {http://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html}, + editor = {Alice Oh and Tristan Naumann and Amir Globerson and Kate Saenko and Moritz Hardt and Sergey Levine}, +} +``` + +Cite TRL as: + +```bibtex +@software{vonwerra2020trl, + title = {{TRL: Transformers Reinforcement Learning}}, + author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin}, + license = {Apache-2.0}, + url = {https://github.com/huggingface/trl}, + year = {2020} +} +``` diff --git a/phase1/llama-dpo-v3/adapter_config.json b/phase1/llama-dpo-v3/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..525da8319752287f2fcefcad959afda346b5c3b7 --- /dev/null +++ b/phase1/llama-dpo-v3/adapter_config.json @@ -0,0 +1,43 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "meta-llama/Llama-3.2-1B-Instruct", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "o_proj", + "k_proj", + "v_proj", + "q_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} diff --git a/phase1/llama-dpo-v3/adapter_model.safetensors b/phase1/llama-dpo-v3/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4f68992b10ba69a7b23455131cbac723b3b64b6e --- /dev/null +++ b/phase1/llama-dpo-v3/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2633d2be48f838d5c4404786ca9baa38ff2b0ed66d2fa5d7d11eb74fe63c178d +size 13648488 diff --git a/phase1/llama-dpo-v3/chat_template.jinja b/phase1/llama-dpo-v3/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..1bad6a0f648dccdbec523ca79ba90fbcfc806af0 --- /dev/null +++ b/phase1/llama-dpo-v3/chat_template.jinja @@ -0,0 +1,93 @@ +{{- bos_token }} +{%- if custom_tools is defined %} + {%- set tools = custom_tools %} +{%- endif %} +{%- if not tools_in_user_message is defined %} + {%- set tools_in_user_message = true %} +{%- endif %} +{%- if not date_string is defined %} + {%- if strftime_now is defined %} + {%- set date_string = strftime_now("%d %b %Y") %} + {%- else %} + {%- set date_string = "26 Jul 2024" %} + {%- endif %} +{%- endif %} +{%- if not tools is defined %} + {%- set tools = none %} +{%- endif %} + +{#- This block extracts the system message, so we can slot it into the right place. #} +{%- if messages[0]['role'] == 'system' %} + {%- set system_message = messages[0]['content']|trim %} + {%- set messages = messages[1:] %} +{%- else %} + {%- set system_message = "" %} +{%- endif %} + +{#- System message #} +{{- "<|start_header_id|>system<|end_header_id|>\n\n" }} +{%- if tools is not none %} + {{- "Environment: ipython\n" }} +{%- endif %} +{{- "Cutting Knowledge Date: December 2023\n" }} +{{- "Today Date: " + date_string + "\n\n" }} +{%- if tools is not none and not tools_in_user_message %} + {{- "You have access to the following functions. To call a function, please respond with JSON for a function call." }} + {{- 'Respond in the format {"name": function name, "parameters": dictionary of argument name and its value}.' }} + {{- "Do not use variables.\n\n" }} + {%- for t in tools %} + {{- t | tojson(indent=4) }} + {{- "\n\n" }} + {%- endfor %} +{%- endif %} +{{- system_message }} +{{- "<|eot_id|>" }} + +{#- Custom tools are passed in a user message with some extra guidance #} +{%- if tools_in_user_message and not tools is none %} + {#- Extract the first user message so we can plug it in here #} + {%- if messages | length != 0 %} + {%- set first_user_message = messages[0]['content']|trim %} + {%- set messages = messages[1:] %} + {%- else %} + {{- raise_exception("Cannot put tools in the first user message when there's no first user message!") }} +{%- endif %} + {{- '<|start_header_id|>user<|end_header_id|>\n\n' -}} + {{- "Given the following functions, please respond with a JSON for a function call " }} + {{- "with its proper arguments that best answers the given prompt.\n\n" }} + {{- 'Respond in the format {"name": function name, "parameters": dictionary of argument name and its value}.' }} + {{- "Do not use variables.\n\n" }} + {%- for t in tools %} + {{- t | tojson(indent=4) }} + {{- "\n\n" }} + {%- endfor %} + {{- first_user_message + "<|eot_id|>"}} +{%- endif %} + +{%- for message in messages %} + {%- if not (message.role == 'ipython' or message.role == 'tool' or 'tool_calls' in message) %} + {{- '<|start_header_id|>' + message['role'] + '<|end_header_id|>\n\n'+ message['content'] | trim + '<|eot_id|>' }} + {%- elif 'tool_calls' in message %} + {%- if not message.tool_calls|length == 1 %} + {{- raise_exception("This model only supports single tool-calls at once!") }} + {%- endif %} + {%- set tool_call = message.tool_calls[0].function %} + {{- '<|start_header_id|>assistant<|end_header_id|>\n\n' -}} + {{- '{"name": "' + tool_call.name + '", ' }} + {{- '"parameters": ' }} + {{- tool_call.arguments | tojson }} + {{- "}" }} + {{- "<|eot_id|>" }} + {%- elif message.role == "tool" or message.role == "ipython" %} + {{- "<|start_header_id|>ipython<|end_header_id|>\n\n" }} + {%- if message.content is mapping or message.content is iterable %} + {{- message.content | tojson }} + {%- else %} + {{- message.content }} + {%- endif %} + {{- "<|eot_id|>" }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|start_header_id|>assistant<|end_header_id|>\n\n' }} +{%- endif %} diff --git a/phase1/llama-dpo-v3/tokenizer.json b/phase1/llama-dpo-v3/tokenizer.json new file mode 100644 index 0000000000000000000000000000000000000000..c81be5af09de8a32108b33764591b09234d26a0e --- /dev/null +++ b/phase1/llama-dpo-v3/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b20d148821d1e209454ef0d54a1d2bb1ff12cd365a0ff5391d96010e897b9644 +size 17208988 diff --git a/phase1/llama-dpo-v3/tokenizer_config.json b/phase1/llama-dpo-v3/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..95a7a465203072f48c7cd80dfd78f77c661c8c9a --- /dev/null +++ b/phase1/llama-dpo-v3/tokenizer_config.json @@ -0,0 +1,14 @@ +{ + "backend": "tokenizers", + "bos_token": "<|begin_of_text|>", + "clean_up_tokenization_spaces": true, + "eos_token": "<|eot_id|>", + "is_local": true, + "model_input_names": [ + "input_ids", + "attention_mask" + ], + "model_max_length": 131072, + "pad_token": "<|eot_id|>", + "tokenizer_class": "TokenizersBackend" +} diff --git a/phase1/llama-dpo-v3/training_args.bin b/phase1/llama-dpo-v3/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..1f42dd7747e3865e86ef93b8dbb088965a1c2dd0 --- /dev/null +++ b/phase1/llama-dpo-v3/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fced63a90802dbed1aa84b5b0863e967f730e08882f30d6a2cec2f76954c2675 +size 5841 diff --git a/phase1/llama-dpo-v3/training_recipe.json b/phase1/llama-dpo-v3/training_recipe.json new file mode 100644 index 0000000000000000000000000000000000000000..10aef2a59c786436b236d2a472be28b228fded8c --- /dev/null +++ b/phase1/llama-dpo-v3/training_recipe.json @@ -0,0 +1,20 @@ +{ + "format_version": 1, + "experiment": "cross_family_preference_transfer", + "model_name": "meta-llama/Llama-3.2-1B-Instruct", + "train_membership_sha256": "e105dbe9f9e652f095541415523cdcda51cc9e8d12d3ba4ca03e29e40296324f", + "validation_membership_sha256": "a46c1c0d0a6c3c444a3ac940322e42a2f1be5ec8e5f5f729a002e7484742551b", + "num_train_pairs": 99986, + "num_validation_pairs": 11110, + "learning_rate": 1e-05, + "beta": 0.1, + "num_epochs": 1.0, + "seed": 22, + "max_length": 512, + "max_prompt_length": 384, + "gradient_accumulation_steps": 80, + "save_steps": 125, + "save_total_limit": 12, + "preference_pairs_format_version": 2, + "dpo_prompt_mode": "rag_prompt_shared" +} diff --git a/phase1/llama-dpo-v3/training_summary.json b/phase1/llama-dpo-v3/training_summary.json new file mode 100644 index 0000000000000000000000000000000000000000..e3f2dc33ff250770ab21d2aebe3203cd8f40abcb --- /dev/null +++ b/phase1/llama-dpo-v3/training_summary.json @@ -0,0 +1,3493 @@ +{ + "model_name": "meta-llama/Llama-3.2-1B-Instruct", + "resolved_model": "meta-llama/Llama-3.2-1B-Instruct", + "num_train_records": 99986, + "num_validation_records_available": 11110, + "training_config": { + "lora_rank": 16, + "lora_alpha": 32, + "learning_rate": 1e-05, + "num_epochs": 1.0, + "per_device_batch_size": 1, + "per_device_eval_batch_size": 1, + "gradient_accumulation_steps": 80, + "beta": 0.1, + "max_length": 512, + "max_prompt_length": 384, + "seed": 22, + "save_steps": 125, + "save_total_limit": 12, + "resume_from_checkpoint": null, + "precision_dtype": "torch.bfloat16", + "bf16": true, + "fp16": false, + "tokenizer_add_bos_token": false + }, + "global_step": 1250, + "best_metric": 0.3831380307674408, + "best_model_checkpoint": "outputs/model_generalization_llama32_1b_phase1_repair_v3/lora/checkpoint-1250", + "train_metrics": { + "train_runtime": 37881.4288, + "train_samples_per_second": 2.639, + "train_steps_per_second": 0.033, + "total_flos": 5.0312011545074074e+17, + "train_loss": 0.44697874088287354 + }, + "log_history": [ + { + "loss": 0.6876621723175049, + "grad_norm": 0.02085641585290432, + "learning_rate": 9.928e-06, + "entropy": 0.8953838606365025, + "num_tokens": 669186.0, + "logits/chosen": 1.7523135298926353, + "logits/rejected": 1.641919029812606, + "mean_token_accuracy": 0.6771072404831648, + "rewards/chosen": 0.010034057162379213, + "rewards/rejected": -0.001445179752987542, + "rewards/accuracies": 0.53625, + "rewards/margins": 0.01147923693381017, + "logps/chosen": -63.841570150852206, + "logps/rejected": -68.64502122402192, + "epoch": 0.008001120156821955, + "step": 10 + }, + { + "loss": 0.6597066879272461, + "grad_norm": 0.018694201484322548, + "learning_rate": 9.848000000000001e-06, + "entropy": 0.8793668389227242, + "num_tokens": 1338260.0, + "logits/chosen": 1.7622254303912428, + "logits/rejected": 1.6655854483602721, + "mean_token_accuracy": 0.6876659346744418, + "rewards/chosen": 0.028637834031824242, + "rewards/rejected": -0.04387104604453271, + "rewards/accuracies": 0.76625, + "rewards/margins": 0.07250888019130798, + "logps/chosen": -60.44827336549759, + "logps/rejected": -70.3050590801239, + "epoch": 0.01600224031364391, + "step": 20 + }, + { + "loss": 0.6248809337615967, + "grad_norm": 0.01813693717122078, + "learning_rate": 9.768e-06, + "entropy": 0.8689308112114668, + "num_tokens": 2006531.0, + "logits/chosen": 1.7339595036742759, + "logits/rejected": 1.6745694846655177, + "mean_token_accuracy": 0.6879833539575338, + "rewards/chosen": -0.005004954708329024, + "rewards/rejected": -0.1686695772564417, + "rewards/accuracies": 0.73875, + "rewards/margins": 0.16366462260280967, + "logps/chosen": -59.31012097835541, + "logps/rejected": -70.12172441601753, + "epoch": 0.024003360470465866, + "step": 30 + }, + { + "loss": 0.611721420288086, + "grad_norm": 0.01976812072098255, + "learning_rate": 9.688000000000001e-06, + "entropy": 0.8979608153458685, + "num_tokens": 2678018.0, + "logits/chosen": 1.6847163705957298, + "logits/rejected": 1.6548631404733476, + "mean_token_accuracy": 0.6856286776997149, + "rewards/chosen": -0.09582840940453025, + "rewards/rejected": -0.32414788081659934, + "rewards/accuracies": 0.7175, + "rewards/margins": 0.22831947083352133, + "logps/chosen": -66.34679408550262, + "logps/rejected": -73.70246529817581, + "epoch": 0.03200448062728782, + "step": 40 + }, + { + "loss": 0.5515981197357178, + "grad_norm": 0.019012274220585823, + "learning_rate": 9.608e-06, + "entropy": 0.8629842744022608, + "num_tokens": 3345909.0, + "logits/chosen": 1.672130467668529, + "logits/rejected": 1.6777180424532323, + "mean_token_accuracy": 0.6851089650392532, + "rewards/chosen": -0.13558172254211967, + "rewards/rejected": -0.5490579532997799, + "rewards/accuracies": 0.75625, + "rewards/margins": 0.41347622983856125, + "logps/chosen": -61.12240834712982, + "logps/rejected": -73.76463801145553, + "epoch": 0.04000560078410977, + "step": 50 + }, + { + "loss": 0.5451503753662109, + "grad_norm": 0.018058450892567635, + "learning_rate": 9.528000000000001e-06, + "entropy": 0.872456860463135, + "num_tokens": 4016757.0, + "logits/chosen": 1.6254275480609275, + "logits/rejected": 1.6532141976649157, + "mean_token_accuracy": 0.6732470593973994, + "rewards/chosen": -0.3387448867566127, + "rewards/rejected": -0.8533535525448679, + "rewards/accuracies": 0.74875, + "rewards/margins": 0.5146086666500196, + "logps/chosen": -65.87585063457489, + "logps/rejected": -81.09233409166336, + "epoch": 0.04800672094093173, + "step": 60 + }, + { + "loss": 0.5362163543701172, + "grad_norm": 0.020387593656778336, + "learning_rate": 9.448e-06, + "entropy": 0.8608407187415287, + "num_tokens": 4686751.0, + "logits/chosen": 1.5602627965932958, + "logits/rejected": 1.5906360590500324, + "mean_token_accuracy": 0.6706002498418093, + "rewards/chosen": -0.4640727364263876, + "rewards/rejected": -1.0529923798827803, + "rewards/accuracies": 0.74625, + "rewards/margins": 0.5889196432288736, + "logps/chosen": -70.29113697052001, + "logps/rejected": -80.11449808835984, + "epoch": 0.05600784109775368, + "step": 70 + }, + { + "loss": 0.5358813762664795, + "grad_norm": 0.023884067311882973, + "learning_rate": 9.368e-06, + "entropy": 0.8284324945218395, + "num_tokens": 5357166.0, + "logits/chosen": 1.4795679082575908, + "logits/rejected": 1.5384505947213227, + "mean_token_accuracy": 0.6774465151503682, + "rewards/chosen": -0.5764407913558535, + "rewards/rejected": -1.2395925800641998, + "rewards/accuracies": 0.75375, + "rewards/margins": 0.6631517899245956, + "logps/chosen": -69.7327395427227, + "logps/rejected": -80.65829716205597, + "epoch": 0.06400896125457564, + "step": 80 + }, + { + "loss": 0.5180981636047364, + "grad_norm": 0.022150974720716476, + "learning_rate": 9.288e-06, + "entropy": 0.8348123076790944, + "num_tokens": 6023639.0, + "logits/chosen": 1.4908146018031239, + "logits/rejected": 1.5654357319194836, + "mean_token_accuracy": 0.6684274521842599, + "rewards/chosen": -0.5458557065276546, + "rewards/rejected": -1.2516879384859931, + "rewards/accuracies": 0.74375, + "rewards/margins": 0.7058322310540825, + "logps/chosen": -65.40104442834854, + "logps/rejected": -78.71251199007034, + "epoch": 0.0720100814113976, + "step": 90 + }, + { + "loss": 0.5002727508544922, + "grad_norm": 0.02316654473543167, + "learning_rate": 9.208e-06, + "entropy": 0.8209165922319517, + "num_tokens": 6694942.0, + "logits/chosen": 1.504576485953224, + "logits/rejected": 1.5631756865086541, + "mean_token_accuracy": 0.6788686821609735, + "rewards/chosen": -0.6265445317371268, + "rewards/rejected": -1.4296979560064937, + "rewards/accuracies": 0.7725, + "rewards/margins": 0.8031534244865179, + "logps/chosen": -67.86892468690873, + "logps/rejected": -87.28859835624695, + "epoch": 0.08001120156821954, + "step": 100 + }, + { + "loss": 0.4797528743743896, + "grad_norm": 0.025832341983914375, + "learning_rate": 9.128e-06, + "entropy": 0.839785308111459, + "num_tokens": 7366337.0, + "logits/chosen": 1.436498547320632, + "logits/rejected": 1.5516475294483854, + "mean_token_accuracy": 0.6673610024340451, + "rewards/chosen": -0.6058229519365704, + "rewards/rejected": -1.4726398780666203, + "rewards/accuracies": 0.7925, + "rewards/margins": 0.8668169262981974, + "logps/chosen": -70.91443045377731, + "logps/rejected": -86.69431616544723, + "epoch": 0.0880123217250415, + "step": 110 + }, + { + "loss": 0.5151589870452881, + "grad_norm": 0.024567700922489166, + "learning_rate": 9.048e-06, + "entropy": 0.8108099042752293, + "num_tokens": 8034830.0, + "logits/chosen": 1.415350063930816, + "logits/rejected": 1.530800795235843, + "mean_token_accuracy": 0.670044612903148, + "rewards/chosen": -0.6920958398148287, + "rewards/rejected": -1.5167533266616373, + "rewards/accuracies": 0.755, + "rewards/margins": 0.8246574836131185, + "logps/chosen": -69.44658513307571, + "logps/rejected": -82.48484308958054, + "epoch": 0.09601344188186346, + "step": 120 + }, + { + "eval_loss": 0.4768791198730469, + "eval_runtime": 127.5854, + "eval_samples_per_second": 7.838, + "eval_steps_per_second": 7.838, + "eval_entropy": 0.8030976068265736, + "eval_num_tokens": 8371601.0, + "eval_logits/chosen": 1.41053144572057, + "eval_logits/rejected": 1.5178837893711545, + "eval_mean_token_accuracy": 0.6734412264749408, + "eval_rewards/chosen": -0.6052715343544259, + "eval_rewards/rejected": -1.5583781674216153, + "eval_rewards/accuracies": 0.793, + "eval_rewards/margins": 0.9531066331192851, + "eval_logps/chosen": -66.51480191421508, + "eval_logps/rejected": -84.00160307693481, + "epoch": 0.10001400196027443, + "step": 125 + }, + { + "loss": 0.48606295585632325, + "grad_norm": 0.019938811659812927, + "learning_rate": 8.968000000000001e-06, + "entropy": 0.8076416058605537, + "num_tokens": 8706435.0, + "logits/chosen": 1.421707210036048, + "logits/rejected": 1.5092911593902412, + "mean_token_accuracy": 0.6668024481087923, + "rewards/chosen": -0.6526209685721551, + "rewards/rejected": -1.5515566976579793, + "rewards/accuracies": 0.7925, + "rewards/margins": 0.8989357261685654, + "logps/chosen": -73.65435603499412, + "logps/rejected": -86.77437145233154, + "epoch": 0.10401456203868542, + "step": 130 + }, + { + "loss": 0.4929227352142334, + "grad_norm": 0.024309106171131134, + "learning_rate": 8.888e-06, + "entropy": 0.7990755480783992, + "num_tokens": 9375004.0, + "logits/chosen": 1.3674875151235775, + "logits/rejected": 1.5141029199823328, + "mean_token_accuracy": 0.6754287776350975, + "rewards/chosen": -0.5831789968456724, + "rewards/rejected": -1.5065973946775193, + "rewards/accuracies": 0.77125, + "rewards/margins": 0.9234183955239132, + "logps/chosen": -66.23368896722793, + "logps/rejected": -84.38780091047288, + "epoch": 0.11201568219550737, + "step": 140 + }, + { + "loss": 0.45296435356140136, + "grad_norm": 0.03157660365104675, + "learning_rate": 8.808000000000001e-06, + "entropy": 0.7914871014188976, + "num_tokens": 10045658.0, + "logits/chosen": 1.3009003627722433, + "logits/rejected": 1.4217221088726517, + "mean_token_accuracy": 0.6674710770510137, + "rewards/chosen": -0.680510274215012, + "rewards/rejected": -1.7216353922217968, + "rewards/accuracies": 0.79375, + "rewards/margins": 1.0411251192959026, + "logps/chosen": -69.23368401288987, + "logps/rejected": -90.06080745935441, + "epoch": 0.12001680235232932, + "step": 150 + }, + { + "loss": 0.44395751953125, + "grad_norm": 0.023377399891614914, + "learning_rate": 8.728e-06, + "entropy": 0.7299869983480312, + "num_tokens": 10712570.0, + "logits/chosen": 1.1509836349559144, + "logits/rejected": 1.3356629677769771, + "mean_token_accuracy": 0.6707272659242153, + "rewards/chosen": -0.7615989098043064, + "rewards/rejected": -1.8726644670779207, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.111065554342931, + "logps/chosen": -65.57545948505401, + "logps/rejected": -86.87440029740334, + "epoch": 0.12801792250915128, + "step": 160 + }, + { + "loss": 0.5061419486999512, + "grad_norm": 0.030593544244766235, + "learning_rate": 8.648000000000001e-06, + "entropy": 0.7306625125929713, + "num_tokens": 11378520.0, + "logits/chosen": 1.1232699992990192, + "logits/rejected": 1.274977415558953, + "mean_token_accuracy": 0.6708245670981705, + "rewards/chosen": -0.8173911243397742, + "rewards/rejected": -1.8643126943940296, + "rewards/accuracies": 0.76125, + "rewards/margins": 1.0469215692440048, + "logps/chosen": -66.93890744447708, + "logps/rejected": -85.03745621204376, + "epoch": 0.13601904266597323, + "step": 170 + }, + { + "loss": 0.4606666088104248, + "grad_norm": 0.02202947810292244, + "learning_rate": 8.568e-06, + "entropy": 0.7190171673579607, + "num_tokens": 12046037.0, + "logits/chosen": 1.104012429231747, + "logits/rejected": 1.2739071112220537, + "mean_token_accuracy": 0.6792438442073763, + "rewards/chosen": -0.701165832249535, + "rewards/rejected": -1.7531834567774787, + "rewards/accuracies": 0.80125, + "rewards/margins": 1.052017622818239, + "logps/chosen": -65.97542519807816, + "logps/rejected": -85.26719992280006, + "epoch": 0.1440201628227952, + "step": 180 + }, + { + "loss": 0.48903474807739256, + "grad_norm": 0.022225037217140198, + "learning_rate": 8.488e-06, + "entropy": 0.7176039846445201, + "num_tokens": 12715377.0, + "logits/chosen": 1.0541427551802536, + "logits/rejected": 1.213088437282036, + "mean_token_accuracy": 0.6683101067692041, + "rewards/chosen": -0.7613639336443885, + "rewards/rejected": -1.7644094955532637, + "rewards/accuracies": 0.77875, + "rewards/margins": 1.0030455615464597, + "logps/chosen": -69.61218286514283, + "logps/rejected": -85.76036041498185, + "epoch": 0.15202128297961714, + "step": 190 + }, + { + "loss": 0.4629779815673828, + "grad_norm": 0.028611615300178528, + "learning_rate": 8.408e-06, + "entropy": 0.7528939384757541, + "num_tokens": 13385367.0, + "logits/chosen": 1.0996369249238103, + "logits/rejected": 1.2262926881032539, + "mean_token_accuracy": 0.6614944562129677, + "rewards/chosen": -0.696452237009944, + "rewards/rejected": -1.7153711370468954, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.0189188991859555, + "logps/chosen": -72.45389879226684, + "logps/rejected": -85.92664870500565, + "epoch": 0.1600224031364391, + "step": 200 + }, + { + "loss": 0.4567533016204834, + "grad_norm": 0.028668882325291634, + "learning_rate": 8.328e-06, + "entropy": 0.7630001913988963, + "num_tokens": 14056267.0, + "logits/chosen": 1.097843614731083, + "logits/rejected": 1.2666853049820384, + "mean_token_accuracy": 0.6626137829013169, + "rewards/chosen": -0.6983124747333932, + "rewards/rejected": -1.8107990216754843, + "rewards/accuracies": 0.79, + "rewards/margins": 1.1124865488195792, + "logps/chosen": -71.39139920949935, + "logps/rejected": -89.45441583156585, + "epoch": 0.16802352329326106, + "step": 210 + }, + { + "loss": 0.4515247821807861, + "grad_norm": 0.026669377461075783, + "learning_rate": 8.248e-06, + "entropy": 0.7527169055410196, + "num_tokens": 14725614.0, + "logits/chosen": 1.0385593041977932, + "logits/rejected": 1.190695984160462, + "mean_token_accuracy": 0.6638811925798654, + "rewards/chosen": -0.6806083437831694, + "rewards/rejected": -1.7687839797040215, + "rewards/accuracies": 0.79375, + "rewards/margins": 1.088175632879138, + "logps/chosen": -69.61510648488998, + "logps/rejected": -88.65261955261231, + "epoch": 0.176024643450083, + "step": 220 + }, + { + "loss": 0.4524831771850586, + "grad_norm": 0.03151402622461319, + "learning_rate": 8.168e-06, + "entropy": 0.73724962518143, + "num_tokens": 15392501.0, + "logits/chosen": 1.0519082065874066, + "logits/rejected": 1.1749508200290943, + "mean_token_accuracy": 0.6576838022284209, + "rewards/chosen": -0.7482118729477224, + "rewards/rejected": -1.906323363717529, + "rewards/accuracies": 0.79625, + "rewards/margins": 1.1581114920042455, + "logps/chosen": -70.1697038435936, + "logps/rejected": -85.81395731210709, + "epoch": 0.18402576360690498, + "step": 230 + }, + { + "loss": 0.4577242374420166, + "grad_norm": 0.02352779172360897, + "learning_rate": 8.088e-06, + "entropy": 0.7625965754780918, + "num_tokens": 16059851.0, + "logits/chosen": 1.042450346162851, + "logits/rejected": 1.1952004922839772, + "mean_token_accuracy": 0.6561587981320918, + "rewards/chosen": -0.7152940149759525, + "rewards/rejected": -1.8993994699225005, + "rewards/accuracies": 0.79, + "rewards/margins": 1.184105452466756, + "logps/chosen": -72.37042717456818, + "logps/rejected": -85.09895798921585, + "epoch": 0.19202688376372692, + "step": 240 + }, + { + "loss": 0.4437845230102539, + "grad_norm": 0.030115000903606415, + "learning_rate": 8.008e-06, + "entropy": 0.7543669298232999, + "num_tokens": 16728461.0, + "logits/chosen": 1.0735585108444008, + "logits/rejected": 1.2861681065582564, + "mean_token_accuracy": 0.6635138799995184, + "rewards/chosen": -0.7473218186138547, + "rewards/rejected": -2.009459927038406, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.2621381114050747, + "logps/chosen": -68.2476191997528, + "logps/rejected": -89.38162505626678, + "epoch": 0.20002800392054887, + "step": 250 + }, + { + "eval_loss": 0.4355338215827942, + "eval_runtime": 156.8228, + "eval_samples_per_second": 6.377, + "eval_steps_per_second": 6.377, + "eval_entropy": 0.7431049114335329, + "eval_num_tokens": 16728461.0, + "eval_logits/chosen": 1.0260521991178062, + "eval_logits/rejected": 1.2071183657217026, + "eval_mean_token_accuracy": 0.6690842649564147, + "eval_rewards/chosen": -0.7681690972906071, + "eval_rewards/rejected": -2.0975164352003484, + "eval_rewards/accuracies": 0.816, + "eval_rewards/margins": 1.3293473376147449, + "eval_logps/chosen": -68.14377753639221, + "eval_logps/rejected": -89.3929857006073, + "epoch": 0.20002800392054887, + "step": 250 + }, + { + "loss": 0.4492465019226074, + "grad_norm": 0.03398913890123367, + "learning_rate": 7.928e-06, + "entropy": 0.7092570207372774, + "num_tokens": 17395008.0, + "logits/chosen": 0.9581539016344277, + "logits/rejected": 1.159804104755373, + "mean_token_accuracy": 0.6754050040617585, + "rewards/chosen": -0.7407069788262015, + "rewards/rejected": -2.03097447785025, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.2902674995921553, + "logps/chosen": -66.1459436917305, + "logps/rejected": -86.54546817541123, + "epoch": 0.20802912407737084, + "step": 260 + }, + { + "loss": 0.44979472160339357, + "grad_norm": 0.024289635941386223, + "learning_rate": 7.848000000000002e-06, + "entropy": 0.7417988654365764, + "num_tokens": 18063939.0, + "logits/chosen": 0.9882898531664387, + "logits/rejected": 1.1797352032413542, + "mean_token_accuracy": 0.6598335723392665, + "rewards/chosen": -0.7044147013814654, + "rewards/rejected": -1.9355830125192006, + "rewards/accuracies": 0.785, + "rewards/margins": 1.2311683113407343, + "logps/chosen": -67.67734955310821, + "logps/rejected": -89.65328444957733, + "epoch": 0.2160302442341928, + "step": 270 + }, + { + "loss": 0.46891136169433595, + "grad_norm": 0.027483809739351273, + "learning_rate": 7.768e-06, + "entropy": 0.7476156710305805, + "num_tokens": 18733318.0, + "logits/chosen": 0.9810655611779316, + "logits/rejected": 1.1440915421776412, + "mean_token_accuracy": 0.6648328566737473, + "rewards/chosen": -0.7664122937600769, + "rewards/rejected": -2.021782549621712, + "rewards/accuracies": 0.775, + "rewards/margins": 1.255370253128931, + "logps/chosen": -70.15842220425606, + "logps/rejected": -89.9700861620903, + "epoch": 0.22403136439101473, + "step": 280 + }, + { + "loss": 0.44730210304260254, + "grad_norm": 0.02446960099041462, + "learning_rate": 7.688000000000002e-06, + "entropy": 0.7660960466810502, + "num_tokens": 19400332.0, + "logits/chosen": 1.0521407140469692, + "logits/rejected": 1.244036548145974, + "mean_token_accuracy": 0.6655525470338762, + "rewards/chosen": -0.6997575274415431, + "rewards/rejected": -1.9546332472981884, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.2548757187998854, + "logps/chosen": -68.3457584643364, + "logps/rejected": -89.20595526456833, + "epoch": 0.2320324845478367, + "step": 290 + }, + { + "loss": 0.4688117504119873, + "grad_norm": 0.025852346792817116, + "learning_rate": 7.608000000000001e-06, + "entropy": 0.7853818394022528, + "num_tokens": 20069869.0, + "logits/chosen": 1.0582436553956536, + "logits/rejected": 1.249718604996073, + "mean_token_accuracy": 0.6564654364995658, + "rewards/chosen": -0.7000699595443439, + "rewards/rejected": -1.8295867117367743, + "rewards/accuracies": 0.805, + "rewards/margins": 1.1295167520851828, + "logps/chosen": -72.92780254602432, + "logps/rejected": -87.27597820997238, + "epoch": 0.24003360470465865, + "step": 300 + }, + { + "loss": 0.44611387252807616, + "grad_norm": 0.02276112511754036, + "learning_rate": 7.528000000000001e-06, + "entropy": 0.7570507207023911, + "num_tokens": 20738870.0, + "logits/chosen": 1.0553903994206508, + "logits/rejected": 1.2092241120963385, + "mean_token_accuracy": 0.6636787656508386, + "rewards/chosen": -0.640383563094947, + "rewards/rejected": -1.8241450248898763, + "rewards/accuracies": 0.795, + "rewards/margins": 1.1837614625599235, + "logps/chosen": -68.32228486299515, + "logps/rejected": -87.3179730963707, + "epoch": 0.24803472486148062, + "step": 310 + }, + { + "loss": 0.45958242416381834, + "grad_norm": 0.03167266771197319, + "learning_rate": 7.4480000000000005e-06, + "entropy": 0.7608478293952067, + "num_tokens": 21409595.0, + "logits/chosen": 1.0073344990829305, + "logits/rejected": 1.1633892473218177, + "mean_token_accuracy": 0.6613082770071924, + "rewards/chosen": -0.748872835691378, + "rewards/rejected": -1.9699224924319423, + "rewards/accuracies": 0.78875, + "rewards/margins": 1.22104965666309, + "logps/chosen": -72.77693994998931, + "logps/rejected": -88.67001478910446, + "epoch": 0.25603584501830257, + "step": 320 + }, + { + "loss": 0.41903347969055177, + "grad_norm": 0.027006885036826134, + "learning_rate": 7.3680000000000004e-06, + "entropy": 0.7372902630781755, + "num_tokens": 22077531.0, + "logits/chosen": 0.930071076548155, + "logits/rejected": 1.1433182541651794, + "mean_token_accuracy": 0.6762370486371219, + "rewards/chosen": -0.6912996655895404, + "rewards/rejected": -2.0490244489716134, + "rewards/accuracies": 0.81625, + "rewards/margins": 1.3577247859165071, + "logps/chosen": -65.67593628168106, + "logps/rejected": -89.9126684165001, + "epoch": 0.26403696517512454, + "step": 330 + }, + { + "loss": 0.43892674446105956, + "grad_norm": 0.028983909636735916, + "learning_rate": 7.288e-06, + "entropy": 0.7466868895856896, + "num_tokens": 22747051.0, + "logits/chosen": 0.8528140235280446, + "logits/rejected": 1.0567630613910928, + "mean_token_accuracy": 0.6699943310581148, + "rewards/chosen": -0.790548151754756, + "rewards/rejected": -2.1185401497303245, + "rewards/accuracies": 0.78875, + "rewards/margins": 1.3279919968137983, + "logps/chosen": -70.40046869158745, + "logps/rejected": -90.60527857899666, + "epoch": 0.27203808533194646, + "step": 340 + }, + { + "loss": 0.48100433349609373, + "grad_norm": 0.033078648149967194, + "learning_rate": 7.208e-06, + "entropy": 0.7587742877868004, + "num_tokens": 23416620.0, + "logits/chosen": 0.8100388799304219, + "logits/rejected": 0.967934954130305, + "mean_token_accuracy": 0.6637939850240946, + "rewards/chosen": -0.7917629819798457, + "rewards/rejected": -2.035186970634677, + "rewards/accuracies": 0.77875, + "rewards/margins": 1.2434239887745935, + "logps/chosen": -71.57891977548599, + "logps/rejected": -91.39597170114517, + "epoch": 0.28003920548876843, + "step": 350 + }, + { + "loss": 0.41542987823486327, + "grad_norm": 0.029060667380690575, + "learning_rate": 7.128e-06, + "entropy": 0.7580543871223927, + "num_tokens": 24085679.0, + "logits/chosen": 0.8433804797774842, + "logits/rejected": 1.0650731621603458, + "mean_token_accuracy": 0.6673501774854959, + "rewards/chosen": -0.64634647201583, + "rewards/rejected": -2.018033398252446, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.371686919608619, + "logps/chosen": -69.87940875649453, + "logps/rejected": -89.1765217113495, + "epoch": 0.2880403256455904, + "step": 360 + }, + { + "loss": 0.4648158550262451, + "grad_norm": 0.03573554754257202, + "learning_rate": 7.048e-06, + "entropy": 0.7539360517368187, + "num_tokens": 24754967.0, + "logits/chosen": 0.9021167366765691, + "logits/rejected": 1.0135648914099702, + "mean_token_accuracy": 0.6625216764211654, + "rewards/chosen": -0.7168381907340882, + "rewards/rejected": -1.8988150142121594, + "rewards/accuracies": 0.79, + "rewards/margins": 1.181976824013982, + "logps/chosen": -69.49502610325813, + "logps/rejected": -86.62321401238441, + "epoch": 0.2960414458024123, + "step": 370 + }, + { + "eval_loss": 0.4164125919342041, + "eval_runtime": 192.3097, + "eval_samples_per_second": 5.2, + "eval_steps_per_second": 5.2, + "eval_entropy": 0.7576178104039282, + "eval_num_tokens": 25087583.0, + "eval_logits/chosen": 0.8733557614100357, + "eval_logits/rejected": 1.0646610536239536, + "eval_mean_token_accuracy": 0.6653144072294235, + "eval_rewards/chosen": -0.6746753788966453, + "eval_rewards/rejected": -2.1017218775587097, + "eval_rewards/accuracies": 0.824, + "eval_rewards/margins": 1.4270464973822237, + "eval_logps/chosen": -67.20884035587311, + "eval_logps/rejected": -89.43504008293152, + "epoch": 0.3000420058808233, + "step": 375 + }, + { + "loss": 0.4322528839111328, + "grad_norm": 0.029773183166980743, + "learning_rate": 6.968e-06, + "entropy": 0.768126052528387, + "num_tokens": 25423331.0, + "logits/chosen": 0.908505152727753, + "logits/rejected": 1.0774095909087906, + "mean_token_accuracy": 0.6575940113514662, + "rewards/chosen": -0.6992590621344607, + "rewards/rejected": -2.1102835578612575, + "rewards/accuracies": 0.82, + "rewards/margins": 1.4110244943667203, + "logps/chosen": -69.7000712609291, + "logps/rejected": -89.70367893457413, + "epoch": 0.3040425659592343, + "step": 380 + }, + { + "loss": 0.46060609817504883, + "grad_norm": 0.03156392648816109, + "learning_rate": 6.888e-06, + "entropy": 0.7681930413638475, + "num_tokens": 26093424.0, + "logits/chosen": 0.9001171337749253, + "logits/rejected": 1.0952869662687845, + "mean_token_accuracy": 0.658901194408536, + "rewards/chosen": -0.7717651543853935, + "rewards/rejected": -2.1153567287203625, + "rewards/accuracies": 0.78125, + "rewards/margins": 1.3435915715340525, + "logps/chosen": -71.94703212022782, + "logps/rejected": -92.13618421554565, + "epoch": 0.31204368611605626, + "step": 390 + }, + { + "loss": 0.4654114246368408, + "grad_norm": 0.03953603282570839, + "learning_rate": 6.808e-06, + "entropy": 0.7949102269229479, + "num_tokens": 26763102.0, + "logits/chosen": 0.8984706428720675, + "logits/rejected": 1.075903093245547, + "mean_token_accuracy": 0.657767103202641, + "rewards/chosen": -0.6850485583826957, + "rewards/rejected": -1.8486362679247395, + "rewards/accuracies": 0.79375, + "rewards/margins": 1.16358771039173, + "logps/chosen": -69.50252655863761, + "logps/rejected": -88.11836134672166, + "epoch": 0.3200448062728782, + "step": 400 + }, + { + "loss": 0.45608930587768554, + "grad_norm": 0.032714180648326874, + "learning_rate": 6.728e-06, + "entropy": 0.7676817936728184, + "num_tokens": 27431927.0, + "logits/chosen": 0.8882831961356138, + "logits/rejected": 1.0850572574945536, + "mean_token_accuracy": 0.6676110390387475, + "rewards/chosen": -0.6412556826127548, + "rewards/rejected": -1.954114315220504, + "rewards/accuracies": 0.78875, + "rewards/margins": 1.312858630893752, + "logps/chosen": -68.36359276890755, + "logps/rejected": -87.32514333963394, + "epoch": 0.32804592642970015, + "step": 410 + }, + { + "loss": 0.4094356060028076, + "grad_norm": 0.02800224907696247, + "learning_rate": 6.648e-06, + "entropy": 0.7408479347568937, + "num_tokens": 28100578.0, + "logits/chosen": 0.8408725598306885, + "logits/rejected": 1.0481387106436133, + "mean_token_accuracy": 0.6668380026239902, + "rewards/chosen": -0.6303333836252932, + "rewards/rejected": -2.0422495753013936, + "rewards/accuracies": 0.81875, + "rewards/margins": 1.4119161891844123, + "logps/chosen": -68.51784587502479, + "logps/rejected": -89.00889017105102, + "epoch": 0.3360470465865221, + "step": 420 + }, + { + "loss": 0.47118396759033204, + "grad_norm": 0.03881135582923889, + "learning_rate": 6.568000000000001e-06, + "entropy": 0.7620953947296948, + "num_tokens": 28771581.0, + "logits/chosen": 0.8177693994702058, + "logits/rejected": 0.9835313458846184, + "mean_token_accuracy": 0.6655509194545448, + "rewards/chosen": -0.7996256252456078, + "rewards/rejected": -2.1756565166643123, + "rewards/accuracies": 0.76875, + "rewards/margins": 1.3760308918333612, + "logps/chosen": -70.287514295578, + "logps/rejected": -94.71107230901718, + "epoch": 0.34404816674334404, + "step": 430 + }, + { + "loss": 0.41876988410949706, + "grad_norm": 0.03742805868387222, + "learning_rate": 6.488000000000001e-06, + "entropy": 0.7735420475469437, + "num_tokens": 29439070.0, + "logits/chosen": 0.8423775153844848, + "logits/rejected": 0.9741460149609448, + "mean_token_accuracy": 0.6611115508247167, + "rewards/chosen": -0.6199226884998643, + "rewards/rejected": -1.95905202480164, + "rewards/accuracies": 0.80875, + "rewards/margins": 1.3391293336683885, + "logps/chosen": -67.55927532792091, + "logps/rejected": -87.32301023721695, + "epoch": 0.352049286900166, + "step": 440 + }, + { + "loss": 0.44651355743408205, + "grad_norm": 0.027141250669956207, + "learning_rate": 6.408000000000001e-06, + "entropy": 0.7722219267522451, + "num_tokens": 30109902.0, + "logits/chosen": 0.8634469613527469, + "logits/rejected": 1.0130148540335655, + "mean_token_accuracy": 0.6588307336438447, + "rewards/chosen": -0.7358856135107271, + "rewards/rejected": -2.0964524537087255, + "rewards/accuracies": 0.79125, + "rewards/margins": 1.360566838402301, + "logps/chosen": -72.01057388305664, + "logps/rejected": -88.65333864212036, + "epoch": 0.360050407056988, + "step": 450 + }, + { + "loss": 0.452637243270874, + "grad_norm": 0.02899186685681343, + "learning_rate": 6.328000000000001e-06, + "entropy": 0.777921670184005, + "num_tokens": 30777671.0, + "logits/chosen": 0.9423126176557491, + "logits/rejected": 1.0900213159289571, + "mean_token_accuracy": 0.6588201350346208, + "rewards/chosen": -0.6857324316137238, + "rewards/rejected": -1.9855998314451426, + "rewards/accuracies": 0.795, + "rewards/margins": 1.2998674020543695, + "logps/chosen": -69.4691036939621, + "logps/rejected": -86.50770955562592, + "epoch": 0.36805152721380996, + "step": 460 + }, + { + "loss": 0.40210437774658203, + "grad_norm": 0.026830365881323814, + "learning_rate": 6.248000000000001e-06, + "entropy": 0.8067923651146702, + "num_tokens": 31447731.0, + "logits/chosen": 1.0123578055420643, + "logits/rejected": 1.2062729007657655, + "mean_token_accuracy": 0.66912337558344, + "rewards/chosen": -0.5654079637472751, + "rewards/rejected": -2.050150958895101, + "rewards/accuracies": 0.84625, + "rewards/margins": 1.4847429941548034, + "logps/chosen": -68.62741502523423, + "logps/rejected": -90.02416857004165, + "epoch": 0.3760526473706319, + "step": 470 + }, + { + "loss": 0.4377699375152588, + "grad_norm": 0.0313052162528038, + "learning_rate": 6.168000000000001e-06, + "entropy": 0.8242240695969667, + "num_tokens": 32116532.0, + "logits/chosen": 1.0703010362241487, + "logits/rejected": 1.2458288302922487, + "mean_token_accuracy": 0.6617773142643273, + "rewards/chosen": -0.5944398860554793, + "rewards/rejected": -1.9161300252494402, + "rewards/accuracies": 0.8125, + "rewards/margins": 1.321690135495737, + "logps/chosen": -67.57950053572655, + "logps/rejected": -89.14266842842102, + "epoch": 0.38405376752745385, + "step": 480 + }, + { + "loss": 0.4258408069610596, + "grad_norm": 0.030823541805148125, + "learning_rate": 6.088000000000001e-06, + "entropy": 0.8232742821751162, + "num_tokens": 32785258.0, + "logits/chosen": 1.058509937014497, + "logits/rejected": 1.2632535002863685, + "mean_token_accuracy": 0.6611343866959214, + "rewards/chosen": -0.6243098496856692, + "rewards/rejected": -2.090642974433722, + "rewards/accuracies": 0.8075, + "rewards/margins": 1.4663331213686615, + "logps/chosen": -67.10051204442978, + "logps/rejected": -91.9337764787674, + "epoch": 0.3920548876842758, + "step": 490 + }, + { + "loss": 0.4398519039154053, + "grad_norm": 0.034121498465538025, + "learning_rate": 6.008000000000001e-06, + "entropy": 0.8138703954452648, + "num_tokens": 33451895.0, + "logits/chosen": 1.027927453772456, + "logits/rejected": 1.235798934678657, + "mean_token_accuracy": 0.6669648469425737, + "rewards/chosen": -0.6414771419570752, + "rewards/rejected": -2.0651343788561642, + "rewards/accuracies": 0.8075, + "rewards/margins": 1.42365723485942, + "logps/chosen": -63.10917327880859, + "logps/rejected": -88.34323552131653, + "epoch": 0.40005600784109774, + "step": 500 + }, + { + "eval_loss": 0.4041357934474945, + "eval_runtime": 216.6853, + "eval_samples_per_second": 4.615, + "eval_steps_per_second": 4.615, + "eval_entropy": 0.8187362959450111, + "eval_num_tokens": 33451895.0, + "eval_logits/chosen": 1.0302648436616415, + "eval_logits/rejected": 1.2174201609282707, + "eval_mean_token_accuracy": 0.6664328058063984, + "eval_rewards/chosen": -0.6111570251197264, + "eval_rewards/rejected": -2.137786239468027, + "eval_rewards/accuracies": 0.824, + "eval_rewards/margins": 1.526629216035828, + "eval_logps/chosen": -66.57365681552886, + "eval_logps/rejected": -89.79568366146087, + "epoch": 0.40005600784109774, + "step": 500 + }, + { + "loss": 0.439931583404541, + "grad_norm": 0.030598435550928116, + "learning_rate": 5.928000000000001e-06, + "entropy": 0.7968977816659026, + "num_tokens": 34120514.0, + "logits/chosen": 1.040446529028589, + "logits/rejected": 1.2180045614227497, + "mean_token_accuracy": 0.6666285018436611, + "rewards/chosen": -0.6471186488174134, + "rewards/rejected": -2.0945956809860036, + "rewards/accuracies": 0.795, + "rewards/margins": 1.4474770293140318, + "logps/chosen": -68.99139935493469, + "logps/rejected": -89.67447282075882, + "epoch": 0.4080571279979197, + "step": 510 + }, + { + "loss": 0.41269855499267577, + "grad_norm": 0.034259915351867676, + "learning_rate": 5.848000000000001e-06, + "entropy": 0.8417493133962853, + "num_tokens": 34789388.0, + "logits/chosen": 1.0914405103048668, + "logits/rejected": 1.2486260757830665, + "mean_token_accuracy": 0.6626991921663284, + "rewards/chosen": -0.5448232944752089, + "rewards/rejected": -1.8674056674454187, + "rewards/accuracies": 0.80125, + "rewards/margins": 1.322582372322213, + "logps/chosen": -67.3422362947464, + "logps/rejected": -89.12793979406356, + "epoch": 0.4160582481547417, + "step": 520 + }, + { + "loss": 0.4300011157989502, + "grad_norm": 0.028924375772476196, + "learning_rate": 5.7680000000000005e-06, + "entropy": 0.800038969970774, + "num_tokens": 35457016.0, + "logits/chosen": 1.010426369977227, + "logits/rejected": 1.2068138369719763, + "mean_token_accuracy": 0.657469975342974, + "rewards/chosen": -0.6588539993400627, + "rewards/rejected": -2.0767385605734305, + "rewards/accuracies": 0.81375, + "rewards/margins": 1.4178845623019152, + "logps/chosen": -67.54834802865982, + "logps/rejected": -88.08037763595581, + "epoch": 0.4240593683115636, + "step": 530 + }, + { + "loss": 0.42708277702331543, + "grad_norm": 0.03574442118406296, + "learning_rate": 5.6880000000000004e-06, + "entropy": 0.8132251694751903, + "num_tokens": 36128364.0, + "logits/chosen": 1.0260850046239467, + "logits/rejected": 1.2032431243739152, + "mean_token_accuracy": 0.6597580896876752, + "rewards/chosen": -0.8153463805263164, + "rewards/rejected": -2.388017583406763, + "rewards/accuracies": 0.825, + "rewards/margins": 1.5726712049450726, + "logps/chosen": -71.70862350225448, + "logps/rejected": -95.02909649133682, + "epoch": 0.4320604884683856, + "step": 540 + }, + { + "loss": 0.44931840896606445, + "grad_norm": 0.03517612814903259, + "learning_rate": 5.608e-06, + "entropy": 0.8036265869461932, + "num_tokens": 36796877.0, + "logits/chosen": 0.968832698781345, + "logits/rejected": 1.2278189388004974, + "mean_token_accuracy": 0.6618908178806305, + "rewards/chosen": -0.7296826012192469, + "rewards/rejected": -2.1867977140343284, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.45711510953377, + "logps/chosen": -68.4356790471077, + "logps/rejected": -91.23825908184051, + "epoch": 0.44006160862520755, + "step": 550 + }, + { + "loss": 0.43575077056884765, + "grad_norm": 0.03234167769551277, + "learning_rate": 5.528e-06, + "entropy": 0.8288327282335376, + "num_tokens": 37463909.0, + "logits/chosen": 1.0259877874812826, + "logits/rejected": 1.2316677721721498, + "mean_token_accuracy": 0.6426719821058213, + "rewards/chosen": -0.6495068702394201, + "rewards/rejected": -2.0214309756543662, + "rewards/accuracies": 0.79625, + "rewards/margins": 1.3719241059338674, + "logps/chosen": -67.9371217560768, + "logps/rejected": -89.1365689945221, + "epoch": 0.44806272878202946, + "step": 560 + }, + { + "loss": 0.4474793910980225, + "grad_norm": 0.03248452767729759, + "learning_rate": 5.448e-06, + "entropy": 0.822490930550266, + "num_tokens": 38132585.0, + "logits/chosen": 0.9919691673759055, + "logits/rejected": 1.1856925128641767, + "mean_token_accuracy": 0.6501407605037093, + "rewards/chosen": -0.6451310007286974, + "rewards/rejected": -2.070329915027396, + "rewards/accuracies": 0.785, + "rewards/margins": 1.4251989143295214, + "logps/chosen": -68.62252221107482, + "logps/rejected": -89.71077305793762, + "epoch": 0.45606384893885143, + "step": 570 + }, + { + "loss": 0.4298095703125, + "grad_norm": 0.034463562071323395, + "learning_rate": 5.368000000000001e-06, + "entropy": 0.8107173151255119, + "num_tokens": 38800385.0, + "logits/chosen": 1.0112625349940034, + "logits/rejected": 1.2035294935060166, + "mean_token_accuracy": 0.6655292904749512, + "rewards/chosen": -0.5617576862563146, + "rewards/rejected": -2.0137265094090253, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.4519688209239394, + "logps/chosen": -65.35963799476623, + "logps/rejected": -88.91398869514465, + "epoch": 0.4640649690956734, + "step": 580 + }, + { + "loss": 0.42886834144592284, + "grad_norm": 0.0305576641112566, + "learning_rate": 5.288000000000001e-06, + "entropy": 0.850757884104969, + "num_tokens": 39469656.0, + "logits/chosen": 1.0339854053135065, + "logits/rejected": 1.2066679015493316, + "mean_token_accuracy": 0.651202796883881, + "rewards/chosen": -0.5649584668217358, + "rewards/rejected": -1.9496741295084938, + "rewards/accuracies": 0.8075, + "rewards/margins": 1.384715657499619, + "logps/chosen": -68.9078570830822, + "logps/rejected": -88.58427609205246, + "epoch": 0.4720660892524953, + "step": 590 + }, + { + "loss": 0.43485217094421386, + "grad_norm": 0.03541610389947891, + "learning_rate": 5.208000000000001e-06, + "entropy": 0.8185462304926477, + "num_tokens": 40140015.0, + "logits/chosen": 1.020759177433344, + "logits/rejected": 1.2234918450532424, + "mean_token_accuracy": 0.6691169702727348, + "rewards/chosen": -0.5964330812523986, + "rewards/rejected": -2.039424882331805, + "rewards/accuracies": 0.8, + "rewards/margins": 1.4429917992651462, + "logps/chosen": -68.23823384642601, + "logps/rejected": -92.64348523378372, + "epoch": 0.4800672094093173, + "step": 600 + }, + { + "loss": 0.45162158012390136, + "grad_norm": 0.033510781824588776, + "learning_rate": 5.128000000000001e-06, + "entropy": 0.8291073049954139, + "num_tokens": 40807645.0, + "logits/chosen": 1.0010311819142022, + "logits/rejected": 1.1718099957017356, + "mean_token_accuracy": 0.6581415209453553, + "rewards/chosen": -0.6233529344796443, + "rewards/rejected": -2.005291601568242, + "rewards/accuracies": 0.77375, + "rewards/margins": 1.3819386703660712, + "logps/chosen": -67.46263459444046, + "logps/rejected": -87.6539410018921, + "epoch": 0.48806832956613927, + "step": 610 + }, + { + "loss": 0.4001795768737793, + "grad_norm": 0.02592748962342739, + "learning_rate": 5.048000000000001e-06, + "entropy": 0.7915259440580849, + "num_tokens": 41478085.0, + "logits/chosen": 0.9424498708706046, + "logits/rejected": 1.1908051134340107, + "mean_token_accuracy": 0.6566479910630733, + "rewards/chosen": -0.7034766381183908, + "rewards/rejected": -2.2657433008489534, + "rewards/accuracies": 0.82875, + "rewards/margins": 1.5622666605748237, + "logps/chosen": -70.00140867710114, + "logps/rejected": -91.03348273515701, + "epoch": 0.49606944972296124, + "step": 620 + }, + { + "eval_loss": 0.39784368872642517, + "eval_runtime": 246.52, + "eval_samples_per_second": 4.056, + "eval_steps_per_second": 4.056, + "eval_entropy": 0.8210352072389796, + "eval_num_tokens": 41814843.0, + "eval_logits/chosen": 0.984598041027552, + "eval_logits/rejected": 1.1901518799037578, + "eval_mean_token_accuracy": 0.6624880295544863, + "eval_rewards/chosen": -0.6323302385269198, + "eval_rewards/rejected": -2.2265223917410477, + "eval_rewards/accuracies": 0.828, + "eval_rewards/margins": 1.594192152224481, + "eval_logps/chosen": -66.78538895225525, + "eval_logps/rejected": -90.68304518508911, + "epoch": 0.5000700098013722, + "step": 625 + }, + { + "loss": 0.39586424827575684, + "grad_norm": 0.031716663390398026, + "learning_rate": 4.9680000000000005e-06, + "entropy": 0.8255119596258738, + "num_tokens": 42149874.0, + "logits/chosen": 0.9743347225997877, + "logits/rejected": 1.148137753184027, + "mean_token_accuracy": 0.6619132567942142, + "rewards/chosen": -0.6674797656579176, + "rewards/rejected": -2.231924351695925, + "rewards/accuracies": 0.825, + "rewards/margins": 1.5644445876637474, + "logps/chosen": -72.87295320034028, + "logps/rejected": -93.35041454553604, + "epoch": 0.5040705698797832, + "step": 630 + }, + { + "loss": 0.4555098533630371, + "grad_norm": 0.03256691247224808, + "learning_rate": 4.8880000000000005e-06, + "entropy": 0.8626169750606641, + "num_tokens": 42819532.0, + "logits/chosen": 0.9928484339589345, + "logits/rejected": 1.1910316784689614, + "mean_token_accuracy": 0.6516608715150505, + "rewards/chosen": -0.6784914738946827, + "rewards/rejected": -2.058931971938291, + "rewards/accuracies": 0.79, + "rewards/margins": 1.3804404968768358, + "logps/chosen": -70.30101744651795, + "logps/rejected": -91.8952933549881, + "epoch": 0.5120716900366051, + "step": 640 + }, + { + "loss": 0.39907112121582033, + "grad_norm": 0.035284217447042465, + "learning_rate": 4.808e-06, + "entropy": 0.8281762254203204, + "num_tokens": 43486780.0, + "logits/chosen": 1.0395317318424935, + "logits/rejected": 1.2489178483263352, + "mean_token_accuracy": 0.6611321708839387, + "rewards/chosen": -0.6159643898750073, + "rewards/rejected": -2.1350451210376353, + "rewards/accuracies": 0.8275, + "rewards/margins": 1.5190807291958481, + "logps/chosen": -67.00672106027604, + "logps/rejected": -89.23889979362488, + "epoch": 0.5200728101934271, + "step": 650 + }, + { + "loss": 0.42336082458496094, + "grad_norm": 0.03876621276140213, + "learning_rate": 4.728e-06, + "entropy": 0.8535072756896261, + "num_tokens": 44155749.0, + "logits/chosen": 1.0138846105047161, + "logits/rejected": 1.2437622753411468, + "mean_token_accuracy": 0.6601723604463041, + "rewards/chosen": -0.7181494349950662, + "rewards/rejected": -2.2160908694111274, + "rewards/accuracies": 0.81, + "rewards/margins": 1.4979414311470465, + "logps/chosen": -69.87262807369233, + "logps/rejected": -90.26266839981079, + "epoch": 0.5280739303502491, + "step": 660 + }, + { + "loss": 0.4203207492828369, + "grad_norm": 0.031068701297044754, + "learning_rate": 4.648e-06, + "entropy": 0.8250792034156621, + "num_tokens": 44825691.0, + "logits/chosen": 1.0000705969438701, + "logits/rejected": 1.1936529049025115, + "mean_token_accuracy": 0.6596701008453966, + "rewards/chosen": -0.6805069711917895, + "rewards/rejected": -2.1961330182391974, + "rewards/accuracies": 0.82, + "rewards/margins": 1.5156260441290215, + "logps/chosen": -66.9881912457943, + "logps/rejected": -92.49107657670974, + "epoch": 0.5360750505070709, + "step": 670 + }, + { + "loss": 0.4413760662078857, + "grad_norm": 0.037145957350730896, + "learning_rate": 4.568e-06, + "entropy": 0.8502096946584061, + "num_tokens": 45496653.0, + "logits/chosen": 0.9376389925959969, + "logits/rejected": 1.1631915682891765, + "mean_token_accuracy": 0.6566580067947507, + "rewards/chosen": -0.7351636211126606, + "rewards/rejected": -2.2342318054742645, + "rewards/accuracies": 0.79375, + "rewards/margins": 1.4990681839408353, + "logps/chosen": -70.88615607023239, + "logps/rejected": -92.9313056743145, + "epoch": 0.5440761706638929, + "step": 680 + }, + { + "loss": 0.4418245792388916, + "grad_norm": 0.03285796567797661, + "learning_rate": 4.488e-06, + "entropy": 0.8708134691650048, + "num_tokens": 46165428.0, + "logits/chosen": 1.0024080394884036, + "logits/rejected": 1.2085236900913934, + "mean_token_accuracy": 0.6578917545825242, + "rewards/chosen": -0.620168975208071, + "rewards/rejected": -2.007820005464309, + "rewards/accuracies": 0.785, + "rewards/margins": 1.3876510330080054, + "logps/chosen": -68.30555811882019, + "logps/rejected": -89.2831116116047, + "epoch": 0.5520772908207149, + "step": 690 + }, + { + "loss": 0.41495356559753416, + "grad_norm": 0.0437500961124897, + "learning_rate": 4.408000000000001e-06, + "entropy": 0.8640956451097737, + "num_tokens": 46835068.0, + "logits/chosen": 1.0270284503579012, + "logits/rejected": 1.1746015504556322, + "mean_token_accuracy": 0.6534906476922333, + "rewards/chosen": -0.5982054639050329, + "rewards/rejected": -2.088865244037952, + "rewards/accuracies": 0.8225, + "rewards/margins": 1.4906597804185002, + "logps/chosen": -68.62525572896004, + "logps/rejected": -89.99094027757644, + "epoch": 0.5600784109775369, + "step": 700 + }, + { + "loss": 0.4218575954437256, + "grad_norm": 0.031077764928340912, + "learning_rate": 4.328000000000001e-06, + "entropy": 0.8230296180828008, + "num_tokens": 47503448.0, + "logits/chosen": 0.9770068476271269, + "logits/rejected": 1.1491471264948658, + "mean_token_accuracy": 0.6508330240473151, + "rewards/chosen": -0.6366723557692421, + "rewards/rejected": -2.1254406468151137, + "rewards/accuracies": 0.81875, + "rewards/margins": 1.4887682919669896, + "logps/chosen": -70.09009389519692, + "logps/rejected": -88.4571030664444, + "epoch": 0.5680795311343588, + "step": 710 + }, + { + "loss": 0.4355219841003418, + "grad_norm": 0.03514384478330612, + "learning_rate": 4.248000000000001e-06, + "entropy": 0.8158625036617742, + "num_tokens": 48171986.0, + "logits/chosen": 0.9882943464247844, + "logits/rejected": 1.158046527064534, + "mean_token_accuracy": 0.6569546628184617, + "rewards/chosen": -0.6468391339858135, + "rewards/rejected": -2.091086347126402, + "rewards/accuracies": 0.79125, + "rewards/margins": 1.4442472116742282, + "logps/chosen": -65.43510097146034, + "logps/rejected": -92.05735602140426, + "epoch": 0.5760806512911808, + "step": 720 + }, + { + "loss": 0.4080561637878418, + "grad_norm": 0.029593531042337418, + "learning_rate": 4.168000000000001e-06, + "entropy": 0.8207998492859769, + "num_tokens": 48840851.0, + "logits/chosen": 0.9450742256865056, + "logits/rejected": 1.1353487721319035, + "mean_token_accuracy": 0.6543917619530112, + "rewards/chosen": -0.5942745498075965, + "rewards/rejected": -2.0826836202369305, + "rewards/accuracies": 0.81375, + "rewards/margins": 1.488409067413304, + "logps/chosen": -66.98957470655441, + "logps/rejected": -88.35660415172578, + "epoch": 0.5840817714480028, + "step": 730 + }, + { + "loss": 0.42991070747375487, + "grad_norm": 0.03314277157187462, + "learning_rate": 4.0880000000000005e-06, + "entropy": 0.8131404434971046, + "num_tokens": 49510684.0, + "logits/chosen": 0.9446147207374227, + "logits/rejected": 1.10502900609362, + "mean_token_accuracy": 0.6605811486765742, + "rewards/chosen": -0.6295872584655444, + "rewards/rejected": -2.071510077000421, + "rewards/accuracies": 0.815, + "rewards/margins": 1.441922816168517, + "logps/chosen": -67.57781659841538, + "logps/rejected": -90.97830413341522, + "epoch": 0.5920828916048246, + "step": 740 + }, + { + "loss": 0.4403865337371826, + "grad_norm": 0.03364508971571922, + "learning_rate": 4.008e-06, + "entropy": 0.8496806487767026, + "num_tokens": 50179358.0, + "logits/chosen": 0.8881657321865005, + "logits/rejected": 1.1181200692564324, + "mean_token_accuracy": 0.6447949712444097, + "rewards/chosen": -0.659528439897631, + "rewards/rejected": -2.1715928015656756, + "rewards/accuracies": 0.81375, + "rewards/margins": 1.5120643608830868, + "logps/chosen": -69.27201319813729, + "logps/rejected": -90.62985174059868, + "epoch": 0.6000840117616466, + "step": 750 + }, + { + "eval_loss": 0.3905946910381317, + "eval_runtime": 280.9968, + "eval_samples_per_second": 3.559, + "eval_steps_per_second": 3.559, + "eval_entropy": 0.8403678885605186, + "eval_num_tokens": 50179358.0, + "eval_logits/chosen": 0.9554020202510393, + "eval_logits/rejected": 1.1666407650875066, + "eval_mean_token_accuracy": 0.6619850269705058, + "eval_rewards/chosen": -0.6056564345289953, + "eval_rewards/rejected": -2.2331584873978283, + "eval_rewards/accuracies": 0.833, + "eval_rewards/margins": 1.627502056725323, + "eval_logps/chosen": -66.51865093421937, + "eval_logps/rejected": -90.74940616512299, + "epoch": 0.6000840117616466, + "step": 750 + }, + { + "loss": 0.4315373420715332, + "grad_norm": 0.05254379287362099, + "learning_rate": 3.928e-06, + "entropy": 0.8172320466092787, + "num_tokens": 50848030.0, + "logits/chosen": 0.9638210894226233, + "logits/rejected": 1.1683298305109677, + "mean_token_accuracy": 0.6649538320116699, + "rewards/chosen": -0.700610735580849, + "rewards/rejected": -2.2304253363308817, + "rewards/accuracies": 0.81375, + "rewards/margins": 1.529814600930549, + "logps/chosen": -65.90503306984901, + "logps/rejected": -91.40787957906723, + "epoch": 0.6080851319184686, + "step": 760 + }, + { + "loss": 0.4522406578063965, + "grad_norm": 0.03430873528122902, + "learning_rate": 3.848e-06, + "entropy": 0.8342650856019463, + "num_tokens": 51517848.0, + "logits/chosen": 0.9867342852132462, + "logits/rejected": 1.1760393931884263, + "mean_token_accuracy": 0.6546278862282634, + "rewards/chosen": -0.6872031458665879, + "rewards/rejected": -2.152831002970925, + "rewards/accuracies": 0.8025, + "rewards/margins": 1.4656278589833527, + "logps/chosen": -69.34904262185097, + "logps/rejected": -90.72765549182891, + "epoch": 0.6160862520752906, + "step": 770 + }, + { + "loss": 0.4273702621459961, + "grad_norm": 0.037746552377939224, + "learning_rate": 3.7680000000000006e-06, + "entropy": 0.8564686650084332, + "num_tokens": 52187552.0, + "logits/chosen": 0.9985187054787574, + "logits/rejected": 1.2113277213347589, + "mean_token_accuracy": 0.6595367415063084, + "rewards/chosen": -0.6713152281285147, + "rewards/rejected": -2.165042465722654, + "rewards/accuracies": 0.8025, + "rewards/margins": 1.4937272349186241, + "logps/chosen": -70.59510239124297, + "logps/rejected": -91.22085160732269, + "epoch": 0.6240873722321125, + "step": 780 + }, + { + "loss": 0.4381092548370361, + "grad_norm": 0.038748253136873245, + "learning_rate": 3.6880000000000005e-06, + "entropy": 0.8539297018293291, + "num_tokens": 52853981.0, + "logits/chosen": 0.9752500179059175, + "logits/rejected": 1.1755729797655, + "mean_token_accuracy": 0.6534031975641846, + "rewards/chosen": -0.6332173011422856, + "rewards/rejected": -2.053761762228387, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.4205444614309817, + "logps/chosen": -65.82179151296616, + "logps/rejected": -88.53400151371956, + "epoch": 0.6320884923889345, + "step": 790 + }, + { + "loss": 0.44451198577880857, + "grad_norm": 0.03472725301980972, + "learning_rate": 3.6080000000000004e-06, + "entropy": 0.8494848445890238, + "num_tokens": 53523227.0, + "logits/chosen": 0.9042852588216367, + "logits/rejected": 1.0908933438794748, + "mean_token_accuracy": 0.6598811968043446, + "rewards/chosen": -0.6820450577477459, + "rewards/rejected": -2.1446255748937255, + "rewards/accuracies": 0.81375, + "rewards/margins": 1.4625805140752346, + "logps/chosen": -68.17725162267685, + "logps/rejected": -93.00321952104568, + "epoch": 0.6400896125457564, + "step": 800 + }, + { + "loss": 0.42236781120300293, + "grad_norm": 0.04242870211601257, + "learning_rate": 3.5280000000000004e-06, + "entropy": 0.8503009751974605, + "num_tokens": 54192491.0, + "logits/chosen": 0.8932810113737385, + "logits/rejected": 1.0996539926905944, + "mean_token_accuracy": 0.6555284386128187, + "rewards/chosen": -0.7142347343725851, + "rewards/rejected": -2.2124053180462213, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.498170582773164, + "logps/chosen": -70.30286806106568, + "logps/rejected": -92.41490193367004, + "epoch": 0.6480907327025783, + "step": 810 + }, + { + "loss": 0.42624950408935547, + "grad_norm": 0.03398019075393677, + "learning_rate": 3.4480000000000003e-06, + "entropy": 0.8426565149053932, + "num_tokens": 54862343.0, + "logits/chosen": 0.8833654460109064, + "logits/rejected": 1.15377093984537, + "mean_token_accuracy": 0.653633040972054, + "rewards/chosen": -0.6783972243926837, + "rewards/rejected": -2.323430530915866, + "rewards/accuracies": 0.82875, + "rewards/margins": 1.64503330163192, + "logps/chosen": -70.29749235630035, + "logps/rejected": -93.17389137983322, + "epoch": 0.6560918528594003, + "step": 820 + }, + { + "loss": 0.4458158493041992, + "grad_norm": 0.04128390923142433, + "learning_rate": 3.368e-06, + "entropy": 0.8945820169046056, + "num_tokens": 55534696.0, + "logits/chosen": 0.9564383136805112, + "logits/rejected": 1.1158353019655596, + "mean_token_accuracy": 0.6559794113226235, + "rewards/chosen": -0.7165967582234862, + "rewards/rejected": -2.2420258207095323, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.5254290606768337, + "logps/chosen": -73.92837689638138, + "logps/rejected": -95.61369948983193, + "epoch": 0.6640929730162223, + "step": 830 + }, + { + "loss": 0.4153374195098877, + "grad_norm": 0.03422253951430321, + "learning_rate": 3.288e-06, + "entropy": 0.8906809307972435, + "num_tokens": 56205028.0, + "logits/chosen": 0.9781870369567324, + "logits/rejected": 1.1856968066960274, + "mean_token_accuracy": 0.6539303036406636, + "rewards/chosen": -0.6803736175834638, + "rewards/rejected": -2.167078277458204, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.48670465889154, + "logps/chosen": -70.90936533451081, + "logps/rejected": -92.71181347131729, + "epoch": 0.6720940931730442, + "step": 840 + }, + { + "loss": 0.43978347778320315, + "grad_norm": 0.032033246010541916, + "learning_rate": 3.208e-06, + "entropy": 0.8340805717546027, + "num_tokens": 56872251.0, + "logits/chosen": 0.9742372705919218, + "logits/rejected": 1.184257694649083, + "mean_token_accuracy": 0.6592800302989781, + "rewards/chosen": -0.6633233757369453, + "rewards/rejected": -2.0870634885225443, + "rewards/accuracies": 0.8125, + "rewards/margins": 1.4237401100434364, + "logps/chosen": -65.23115757584571, + "logps/rejected": -88.25671273946762, + "epoch": 0.6800952133298662, + "step": 850 + }, + { + "loss": 0.42367067337036135, + "grad_norm": 0.029233582317829132, + "learning_rate": 3.1280000000000004e-06, + "entropy": 0.8729569414258003, + "num_tokens": 57540687.0, + "logits/chosen": 0.9849000766152969, + "logits/rejected": 1.1920839344367296, + "mean_token_accuracy": 0.6475752539746463, + "rewards/chosen": -0.5576673893872794, + "rewards/rejected": -1.9550721618323588, + "rewards/accuracies": 0.79375, + "rewards/margins": 1.3974047714634799, + "logps/chosen": -71.45296947479248, + "logps/rejected": -86.27678619146347, + "epoch": 0.6880963334866881, + "step": 860 + }, + { + "loss": 0.44771614074707033, + "grad_norm": 0.03574584797024727, + "learning_rate": 3.0480000000000003e-06, + "entropy": 0.8541871241829359, + "num_tokens": 58209600.0, + "logits/chosen": 0.9407660194085455, + "logits/rejected": 1.1319002897367676, + "mean_token_accuracy": 0.6590811411850155, + "rewards/chosen": -0.6319906624252326, + "rewards/rejected": -2.160026735856809, + "rewards/accuracies": 0.8125, + "rewards/margins": 1.5280360724031925, + "logps/chosen": -67.98375816583633, + "logps/rejected": -90.60064194440842, + "epoch": 0.6960974536435101, + "step": 870 + }, + { + "eval_loss": 0.38891661167144775, + "eval_runtime": 312.561, + "eval_samples_per_second": 3.199, + "eval_steps_per_second": 3.199, + "eval_entropy": 0.8718550207260997, + "eval_num_tokens": 58542997.0, + "eval_logits/chosen": 0.953071309156353, + "eval_logits/rejected": 1.171563756401123, + "eval_mean_token_accuracy": 0.6624961771219969, + "eval_rewards/chosen": -0.5500025833119871, + "eval_rewards/rejected": -2.1432462024064733, + "eval_rewards/accuracies": 0.832, + "eval_rewards/margins": 1.593243618823588, + "eval_logps/chosen": -65.96211242198945, + "eval_logps/rejected": -89.85028337574005, + "epoch": 0.700098013721921, + "step": 875 + }, + { + "loss": 0.4452272891998291, + "grad_norm": 0.03952350839972496, + "learning_rate": 2.9680000000000002e-06, + "entropy": 0.862714468719787, + "num_tokens": 58876614.0, + "logits/chosen": 0.9177802844600431, + "logits/rejected": 1.1281801394280309, + "mean_token_accuracy": 0.6562245498690754, + "rewards/chosen": -0.6339407643607774, + "rewards/rejected": -2.029299714830704, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.3953589481348172, + "logps/chosen": -65.40356833696366, + "logps/rejected": -90.87254594087601, + "epoch": 0.704098573800332, + "step": 880 + }, + { + "loss": 0.45412406921386717, + "grad_norm": 0.03881300240755081, + "learning_rate": 2.888e-06, + "entropy": 0.8527450338829659, + "num_tokens": 59544785.0, + "logits/chosen": 0.9487640390288297, + "logits/rejected": 1.1518068349457047, + "mean_token_accuracy": 0.662967371456325, + "rewards/chosen": -0.650298423146014, + "rewards/rejected": -2.0994253616167406, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.4491269371297677, + "logps/chosen": -66.28779201865196, + "logps/rejected": -88.19718941688538, + "epoch": 0.712099693957154, + "step": 890 + }, + { + "loss": 0.44872069358825684, + "grad_norm": 0.03281624987721443, + "learning_rate": 2.808e-06, + "entropy": 0.8578792290366255, + "num_tokens": 60213449.0, + "logits/chosen": 1.0487268798393188, + "logits/rejected": 1.2662646021232076, + "mean_token_accuracy": 0.6574184788390994, + "rewards/chosen": -0.5376099577578134, + "rewards/rejected": -1.906648186784296, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.3690382286487148, + "logps/chosen": -65.61915182113647, + "logps/rejected": -87.26275584936143, + "epoch": 0.720100814113976, + "step": 900 + }, + { + "loss": 0.4031352519989014, + "grad_norm": 0.030685516074299812, + "learning_rate": 2.728e-06, + "entropy": 0.8612097218161217, + "num_tokens": 60880085.0, + "logits/chosen": 1.0143389613035938, + "logits/rejected": 1.249641372722458, + "mean_token_accuracy": 0.6716222583595663, + "rewards/chosen": -0.521080312635895, + "rewards/rejected": -1.9784742100659058, + "rewards/accuracies": 0.82875, + "rewards/margins": 1.4573938966169953, + "logps/chosen": -64.77055881500245, + "logps/rejected": -85.31282383918762, + "epoch": 0.728101934270798, + "step": 910 + }, + { + "loss": 0.43309483528137205, + "grad_norm": 0.03589771315455437, + "learning_rate": 2.648e-06, + "entropy": 0.8547451591311256, + "num_tokens": 61547040.0, + "logits/chosen": 0.9607552139855732, + "logits/rejected": 1.1393559314432558, + "mean_token_accuracy": 0.6551316804066301, + "rewards/chosen": -0.6062610488014252, + "rewards/rejected": -1.9912765481562815, + "rewards/accuracies": 0.8025, + "rewards/margins": 1.3850154994707555, + "logps/chosen": -66.66211392879487, + "logps/rejected": -86.9184494805336, + "epoch": 0.7361030544276199, + "step": 920 + }, + { + "loss": 0.39836270809173585, + "grad_norm": 0.03499443456530571, + "learning_rate": 2.568e-06, + "entropy": 0.837529921917594, + "num_tokens": 62216228.0, + "logits/chosen": 0.9273512348782313, + "logits/rejected": 1.0906426033962848, + "mean_token_accuracy": 0.6469739274866879, + "rewards/chosen": -0.6463629278072335, + "rewards/rejected": -2.22982905632598, + "rewards/accuracies": 0.82875, + "rewards/margins": 1.583466123645194, + "logps/chosen": -67.06362453579902, + "logps/rejected": -93.452269384861, + "epoch": 0.7441041745844418, + "step": 930 + }, + { + "loss": 0.42793049812316897, + "grad_norm": 0.03505934774875641, + "learning_rate": 2.488e-06, + "entropy": 0.8360733698453987, + "num_tokens": 62884204.0, + "logits/chosen": 0.7991276481550503, + "logits/rejected": 1.049968788034255, + "mean_token_accuracy": 0.6601243341527879, + "rewards/chosen": -0.6497158235612005, + "rewards/rejected": -2.158851850910287, + "rewards/accuracies": 0.80875, + "rewards/margins": 1.5091360262827949, + "logps/chosen": -65.85698626995087, + "logps/rejected": -88.71256803274154, + "epoch": 0.7521052947412638, + "step": 940 + }, + { + "loss": 0.45066075325012206, + "grad_norm": 0.032886356115341187, + "learning_rate": 2.408e-06, + "entropy": 0.832636615919182, + "num_tokens": 63552133.0, + "logits/chosen": 0.8599798307690629, + "logits/rejected": 1.0741248958420386, + "mean_token_accuracy": 0.649495961368084, + "rewards/chosen": -0.7527440831899003, + "rewards/rejected": -2.141224974161814, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.3884808889543638, + "logps/chosen": -68.56244652748109, + "logps/rejected": -88.53944436073303, + "epoch": 0.7601064148980857, + "step": 950 + }, + { + "loss": 0.4001929759979248, + "grad_norm": 0.0434030182659626, + "learning_rate": 2.3280000000000004e-06, + "entropy": 0.8262607191543794, + "num_tokens": 64222107.0, + "logits/chosen": 0.883406699215304, + "logits/rejected": 1.1504158259150021, + "mean_token_accuracy": 0.66339923880063, + "rewards/chosen": -0.6620039639761944, + "rewards/rejected": -2.2925733448197025, + "rewards/accuracies": 0.83875, + "rewards/margins": 1.6305693804193289, + "logps/chosen": -68.21887855052948, + "logps/rejected": -91.67394641399383, + "epoch": 0.7681075350549077, + "step": 960 + }, + { + "loss": 0.43085393905639646, + "grad_norm": 0.03178192302584648, + "learning_rate": 2.2480000000000003e-06, + "entropy": 0.8709142287832219, + "num_tokens": 64890263.0, + "logits/chosen": 0.8920313960898265, + "logits/rejected": 1.128552965912883, + "mean_token_accuracy": 0.6419067945331335, + "rewards/chosen": -0.6362933055355825, + "rewards/rejected": -2.09013077869633, + "rewards/accuracies": 0.82125, + "rewards/margins": 1.4538374735228716, + "logps/chosen": -68.71719403505325, + "logps/rejected": -88.28514833807945, + "epoch": 0.7761086552117297, + "step": 970 + }, + { + "loss": 0.4230814456939697, + "grad_norm": 0.03144161403179169, + "learning_rate": 2.1680000000000002e-06, + "entropy": 0.86573227096349, + "num_tokens": 65560586.0, + "logits/chosen": 0.9323236133466635, + "logits/rejected": 1.1045293716122209, + "mean_token_accuracy": 0.6568231407366693, + "rewards/chosen": -0.5575948944242555, + "rewards/rejected": -2.0226709698906054, + "rewards/accuracies": 0.81, + "rewards/margins": 1.4650760741624982, + "logps/chosen": -70.52183421492576, + "logps/rejected": -89.79245682954789, + "epoch": 0.7841097753685516, + "step": 980 + }, + { + "loss": 0.4176182746887207, + "grad_norm": 0.034222014248371124, + "learning_rate": 2.088e-06, + "entropy": 0.8574011596717174, + "num_tokens": 66228556.0, + "logits/chosen": 0.8027309387040763, + "logits/rejected": 1.0642325286382217, + "mean_token_accuracy": 0.661268965434283, + "rewards/chosen": -0.6723649157090767, + "rewards/rejected": -2.184656735348035, + "rewards/accuracies": 0.825, + "rewards/margins": 1.5122918216045946, + "logps/chosen": -67.47515767097474, + "logps/rejected": -89.71079513788223, + "epoch": 0.7921108955253735, + "step": 990 + }, + { + "loss": 0.42989821434020997, + "grad_norm": 0.035680945962667465, + "learning_rate": 2.008e-06, + "entropy": 0.8599720290006371, + "num_tokens": 66897207.0, + "logits/chosen": 0.8691081965276974, + "logits/rejected": 1.1459109746339848, + "mean_token_accuracy": 0.659917052462697, + "rewards/chosen": -0.6614104065368883, + "rewards/rejected": -2.2487826385660448, + "rewards/accuracies": 0.7925, + "rewards/margins": 1.5873722325917334, + "logps/chosen": -67.66358781814576, + "logps/rejected": -90.84724606990814, + "epoch": 0.8001120156821955, + "step": 1000 + }, + { + "eval_loss": 0.38607117533683777, + "eval_runtime": 350.7424, + "eval_samples_per_second": 2.851, + "eval_steps_per_second": 2.851, + "eval_entropy": 0.8668703991975635, + "eval_num_tokens": 66897207.0, + "eval_logits/chosen": 0.8892899907383796, + "eval_logits/rejected": 1.1111882686378622, + "eval_mean_token_accuracy": 0.659346023902297, + "eval_rewards/chosen": -0.582486518596299, + "eval_rewards/rejected": -2.2139163566811475, + "eval_rewards/accuracies": 0.834, + "eval_rewards/margins": 1.631429838422686, + "eval_logps/chosen": -66.28695176410675, + "eval_logps/rejected": -90.55698481941224, + "epoch": 0.8001120156821955, + "step": 1000 + }, + { + "loss": 0.3962708950042725, + "grad_norm": 0.030963728204369545, + "learning_rate": 1.928e-06, + "entropy": 0.8694826575729531, + "num_tokens": 67567865.0, + "logits/chosen": 0.8826398693945836, + "logits/rejected": 1.0751302162055196, + "mean_token_accuracy": 0.657812373638153, + "rewards/chosen": -0.6352861579412274, + "rewards/rejected": -2.261975454816602, + "rewards/accuracies": 0.81875, + "rewards/margins": 1.6266892972029745, + "logps/chosen": -69.32229480504989, + "logps/rejected": -95.0387474322319, + "epoch": 0.8081131358390174, + "step": 1010 + }, + { + "loss": 0.4258723735809326, + "grad_norm": 0.03474907577037811, + "learning_rate": 1.8480000000000001e-06, + "entropy": 0.8473924996308051, + "num_tokens": 68235779.0, + "logits/chosen": 0.9070787519392894, + "logits/rejected": 1.101770660235957, + "mean_token_accuracy": 0.6468252922594547, + "rewards/chosen": -0.6778515197880915, + "rewards/rejected": -2.2432175894498503, + "rewards/accuracies": 0.8025, + "rewards/margins": 1.5653660669270903, + "logps/chosen": -67.88414312124252, + "logps/rejected": -88.61838740348816, + "epoch": 0.8161142559958394, + "step": 1020 + }, + { + "loss": 0.40514450073242186, + "grad_norm": 0.03416679427027702, + "learning_rate": 1.7680000000000003e-06, + "entropy": 0.889893756096717, + "num_tokens": 68903717.0, + "logits/chosen": 0.9059802730828178, + "logits/rejected": 1.1393912425461479, + "mean_token_accuracy": 0.6406477543432265, + "rewards/chosen": -0.609267081760263, + "rewards/rejected": -2.1504513141329515, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.54118423323147, + "logps/chosen": -69.49155421376229, + "logps/rejected": -89.1899503827095, + "epoch": 0.8241153761526614, + "step": 1030 + }, + { + "loss": 0.43328490257263186, + "grad_norm": 0.053973764181137085, + "learning_rate": 1.6880000000000002e-06, + "entropy": 0.8649416108580772, + "num_tokens": 69573418.0, + "logits/chosen": 0.8593249510935347, + "logits/rejected": 1.110617254203968, + "mean_token_accuracy": 0.6512250990979374, + "rewards/chosen": -0.6340019615784694, + "rewards/rejected": -2.21387220822362, + "rewards/accuracies": 0.815, + "rewards/margins": 1.579870247275103, + "logps/chosen": -69.59451707363128, + "logps/rejected": -91.83544722795486, + "epoch": 0.8321164963094834, + "step": 1040 + }, + { + "loss": 0.441865062713623, + "grad_norm": 0.033326976001262665, + "learning_rate": 1.608e-06, + "entropy": 0.8924074355195626, + "num_tokens": 70245048.0, + "logits/chosen": 0.9512462176944945, + "logits/rejected": 1.1714606481888763, + "mean_token_accuracy": 0.6525666503142565, + "rewards/chosen": -0.6446977265506575, + "rewards/rejected": -2.1632383557595314, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.5185406296234578, + "logps/chosen": -70.56152170658112, + "logps/rejected": -94.69566265106201, + "epoch": 0.8401176164663052, + "step": 1050 + }, + { + "loss": 0.418486499786377, + "grad_norm": 0.029840189963579178, + "learning_rate": 1.528e-06, + "entropy": 0.8346750047826208, + "num_tokens": 70912031.0, + "logits/chosen": 0.899767311968589, + "logits/rejected": 1.1073568102098392, + "mean_token_accuracy": 0.6593861475214362, + "rewards/chosen": -0.55429117706517, + "rewards/rejected": -2.0976768376422115, + "rewards/accuracies": 0.8175, + "rewards/margins": 1.5433856593351811, + "logps/chosen": -65.34484733700752, + "logps/rejected": -85.84228497505188, + "epoch": 0.8481187366231272, + "step": 1060 + }, + { + "loss": 0.4446680545806885, + "grad_norm": 0.036603037267923355, + "learning_rate": 1.4480000000000002e-06, + "entropy": 0.902835673665395, + "num_tokens": 71584146.0, + "logits/chosen": 0.9127683433896177, + "logits/rejected": 1.139923308614523, + "mean_token_accuracy": 0.6539772312715649, + "rewards/chosen": -0.6741834658858715, + "rewards/rejected": -2.1645529880949472, + "rewards/accuracies": 0.815, + "rewards/margins": 1.490369523759, + "logps/chosen": -71.67605731964112, + "logps/rejected": -94.79599132776261, + "epoch": 0.8561198567799492, + "step": 1070 + }, + { + "loss": 0.41832242012023924, + "grad_norm": 0.03776715323328972, + "learning_rate": 1.368e-06, + "entropy": 0.8873281607031822, + "num_tokens": 72253852.0, + "logits/chosen": 0.9067677578257508, + "logits/rejected": 1.161128675409658, + "mean_token_accuracy": 0.6563850439153611, + "rewards/chosen": -0.6268765124707716, + "rewards/rejected": -2.101546765351668, + "rewards/accuracies": 0.81375, + "rewards/margins": 1.4746702503063716, + "logps/chosen": -70.14818896055222, + "logps/rejected": -89.79905828237534, + "epoch": 0.8641209769367711, + "step": 1080 + }, + { + "loss": 0.41946825981140134, + "grad_norm": 0.03260818123817444, + "learning_rate": 1.288e-06, + "entropy": 0.8910186088766204, + "num_tokens": 72923463.0, + "logits/chosen": 0.9292467513931639, + "logits/rejected": 1.1392854566021555, + "mean_token_accuracy": 0.6597230594418942, + "rewards/chosen": -0.6515794447601365, + "rewards/rejected": -2.1212883089255774, + "rewards/accuracies": 0.7925, + "rewards/margins": 1.4697088625654577, + "logps/chosen": -68.16174621343613, + "logps/rejected": -91.54474475860596, + "epoch": 0.8721220970935931, + "step": 1090 + }, + { + "loss": 0.39578471183776853, + "grad_norm": 0.0302139800041914, + "learning_rate": 1.2080000000000001e-06, + "entropy": 0.8779772936925292, + "num_tokens": 73595049.0, + "logits/chosen": 0.9384733690310845, + "logits/rejected": 1.1711842656368645, + "mean_token_accuracy": 0.6657957591675222, + "rewards/chosen": -0.6084141440523672, + "rewards/rejected": -2.2773913521115903, + "rewards/accuracies": 0.8025, + "rewards/margins": 1.6689772073482163, + "logps/chosen": -68.42859583139419, + "logps/rejected": -93.98125689387321, + "epoch": 0.8801232172504151, + "step": 1100 + }, + { + "loss": 0.42472043037414553, + "grad_norm": 0.03813236951828003, + "learning_rate": 1.128e-06, + "entropy": 0.8627737898926716, + "num_tokens": 74262367.0, + "logits/chosen": 0.8667971259571394, + "logits/rejected": 1.1435590230927837, + "mean_token_accuracy": 0.6563602097705007, + "rewards/chosen": -0.6558617835270707, + "rewards/rejected": -2.2128921717873893, + "rewards/accuracies": 0.80875, + "rewards/margins": 1.5570303920283914, + "logps/chosen": -68.37327192306519, + "logps/rejected": -88.34695291280747, + "epoch": 0.8881243374072371, + "step": 1110 + }, + { + "loss": 0.4374277114868164, + "grad_norm": 0.050476472824811935, + "learning_rate": 1.0480000000000002e-06, + "entropy": 0.8711421622475609, + "num_tokens": 74930382.0, + "logits/chosen": 0.9386477201807173, + "logits/rejected": 1.1516541607226247, + "mean_token_accuracy": 0.6537962615676224, + "rewards/chosen": -0.6622998499354799, + "rewards/rejected": -2.1998322988441212, + "rewards/accuracies": 0.8025, + "rewards/margins": 1.5375324480747805, + "logps/chosen": -66.09728898763656, + "logps/rejected": -91.47396802663803, + "epoch": 0.8961254575640589, + "step": 1120 + }, + { + "eval_loss": 0.38328441977500916, + "eval_runtime": 383.2795, + "eval_samples_per_second": 2.609, + "eval_steps_per_second": 2.609, + "eval_entropy": 0.8739720604084432, + "eval_num_tokens": 75266854.0, + "eval_logits/chosen": 0.8878241154287022, + "eval_logits/rejected": 1.1128443841255737, + "eval_mean_token_accuracy": 0.661347587838769, + "eval_rewards/chosen": -0.6041518464077963, + "eval_rewards/rejected": -2.292379699852987, + "eval_rewards/accuracies": 0.83, + "eval_rewards/margins": 1.6882278505861759, + "eval_logps/chosen": -66.5036050491333, + "eval_logps/rejected": -91.34161827754974, + "epoch": 0.9001260176424699, + "step": 1125 + }, + { + "loss": 0.40437002182006837, + "grad_norm": 0.028972849249839783, + "learning_rate": 9.68e-07, + "entropy": 0.8655532780638896, + "num_tokens": 75600528.0, + "logits/chosen": 0.8392021783182244, + "logits/rejected": 1.0820405521401597, + "mean_token_accuracy": 0.6659414252452552, + "rewards/chosen": -0.6915992882475621, + "rewards/rejected": -2.3597558089741506, + "rewards/accuracies": 0.82875, + "rewards/margins": 1.6681565197976307, + "logps/chosen": -68.61087916851044, + "logps/rejected": -93.29826194286346, + "epoch": 0.9041265777208809, + "step": 1130 + }, + { + "loss": 0.4108288288116455, + "grad_norm": 0.03383871167898178, + "learning_rate": 8.880000000000001e-07, + "entropy": 0.8478269183557131, + "num_tokens": 76268751.0, + "logits/chosen": 0.8844847648747343, + "logits/rejected": 1.09897104210967, + "mean_token_accuracy": 0.6555397282214835, + "rewards/chosen": -0.7120777094319055, + "rewards/rejected": -2.334874999501044, + "rewards/accuracies": 0.83125, + "rewards/margins": 1.6227972903219052, + "logps/chosen": -68.74041581749916, + "logps/rejected": -90.99661464691162, + "epoch": 0.9121276978777029, + "step": 1140 + }, + { + "loss": 0.3952176570892334, + "grad_norm": 0.03595713898539543, + "learning_rate": 8.08e-07, + "entropy": 0.8817502701492049, + "num_tokens": 76938286.0, + "logits/chosen": 0.9065315112356953, + "logits/rejected": 1.1068333863860822, + "mean_token_accuracy": 0.6470588660426437, + "rewards/chosen": -0.6965171393561014, + "rewards/rejected": -2.3452763559907908, + "rewards/accuracies": 0.8325, + "rewards/margins": 1.6487592151854187, + "logps/chosen": -68.56175809025764, + "logps/rejected": -93.97643731117249, + "epoch": 0.9201288180345248, + "step": 1150 + }, + { + "loss": 0.3942981958389282, + "grad_norm": 0.037921398878097534, + "learning_rate": 7.280000000000001e-07, + "entropy": 0.8427206738991663, + "num_tokens": 77605061.0, + "logits/chosen": 0.8722859004280558, + "logits/rejected": 1.1195572515577774, + "mean_token_accuracy": 0.6546126752346754, + "rewards/chosen": -0.6228112047113246, + "rewards/rejected": -2.2704866537463384, + "rewards/accuracies": 0.82625, + "rewards/margins": 1.6476754496945067, + "logps/chosen": -67.8807622051239, + "logps/rejected": -88.71758820533752, + "epoch": 0.9281299381913468, + "step": 1160 + }, + { + "loss": 0.39456446170806886, + "grad_norm": 0.035953767597675323, + "learning_rate": 6.48e-07, + "entropy": 0.8721329982078169, + "num_tokens": 78273137.0, + "logits/chosen": 0.9035017024008792, + "logits/rejected": 1.1552559042775905, + "mean_token_accuracy": 0.6506677641160786, + "rewards/chosen": -0.6781392271062942, + "rewards/rejected": -2.400411543701921, + "rewards/accuracies": 0.82875, + "rewards/margins": 1.7222723116065026, + "logps/chosen": -68.29391048669815, + "logps/rejected": -92.70362775802613, + "epoch": 0.9361310583481688, + "step": 1170 + }, + { + "loss": 0.4436354160308838, + "grad_norm": 0.034623172134160995, + "learning_rate": 5.680000000000001e-07, + "entropy": 0.8812280716700479, + "num_tokens": 78941920.0, + "logits/chosen": 0.876691468200509, + "logits/rejected": 1.0672803801925645, + "mean_token_accuracy": 0.6573259249515832, + "rewards/chosen": -0.6557168781671863, + "rewards/rejected": -2.2418328590322925, + "rewards/accuracies": 0.805, + "rewards/margins": 1.5861159804742784, + "logps/chosen": -66.65720802783966, + "logps/rejected": -93.701522564888, + "epoch": 0.9441321785049906, + "step": 1180 + }, + { + "loss": 0.4059769630432129, + "grad_norm": 0.03936178982257843, + "learning_rate": 4.88e-07, + "entropy": 0.8670852344139712, + "num_tokens": 79609692.0, + "logits/chosen": 0.8956595470743131, + "logits/rejected": 1.0826247228452346, + "mean_token_accuracy": 0.660180214960128, + "rewards/chosen": -0.6400385223676858, + "rewards/rejected": -2.2094940228544875, + "rewards/accuracies": 0.82, + "rewards/margins": 1.5694554990739562, + "logps/chosen": -66.48064380645752, + "logps/rejected": -88.73535197257996, + "epoch": 0.9521332986618126, + "step": 1190 + }, + { + "loss": 0.40941200256347654, + "grad_norm": 0.032248757779598236, + "learning_rate": 4.0800000000000005e-07, + "entropy": 0.8911747275094968, + "num_tokens": 80278040.0, + "logits/chosen": 0.891040509998187, + "logits/rejected": 1.1391679702752255, + "mean_token_accuracy": 0.6495232714340091, + "rewards/chosen": -0.645332999396851, + "rewards/rejected": -2.2509153579105625, + "rewards/accuracies": 0.82125, + "rewards/margins": 1.6055823574075476, + "logps/chosen": -70.1561289012432, + "logps/rejected": -90.579102216959, + "epoch": 0.9601344188186346, + "step": 1200 + }, + { + "loss": 0.4071323871612549, + "grad_norm": 0.03186144679784775, + "learning_rate": 3.280000000000001e-07, + "entropy": 0.8457071017683484, + "num_tokens": 80944938.0, + "logits/chosen": 0.8311079625074299, + "logits/rejected": 1.0921373440872542, + "mean_token_accuracy": 0.6612742093764246, + "rewards/chosen": -0.6387467755692342, + "rewards/rejected": -2.2768997981393477, + "rewards/accuracies": 0.82625, + "rewards/margins": 1.638153019300662, + "logps/chosen": -65.99934913992882, + "logps/rejected": -87.78630265951156, + "epoch": 0.9681355389754566, + "step": 1210 + }, + { + "loss": 0.4300717353820801, + "grad_norm": 0.036194413900375366, + "learning_rate": 2.48e-07, + "entropy": 0.8721460625680629, + "num_tokens": 81614945.0, + "logits/chosen": 0.8625591955289138, + "logits/rejected": 1.0950880850799856, + "mean_token_accuracy": 0.6566772576607763, + "rewards/chosen": -0.7123425293308902, + "rewards/rejected": -2.2779226847983955, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.5655801529623568, + "logps/chosen": -70.76329089403153, + "logps/rejected": -91.68823468208313, + "epoch": 0.9761366591322785, + "step": 1220 + }, + { + "loss": 0.41231770515441896, + "grad_norm": 0.041534606367349625, + "learning_rate": 1.68e-07, + "entropy": 0.8715950054430869, + "num_tokens": 82283576.0, + "logits/chosen": 0.8665724900597457, + "logits/rejected": 1.1105663027294717, + "mean_token_accuracy": 0.6669188870489597, + "rewards/chosen": -0.6339492637870717, + "rewards/rejected": -2.262035603372933, + "rewards/accuracies": 0.82125, + "rewards/margins": 1.628086341698654, + "logps/chosen": -66.2409237909317, + "logps/rejected": -92.54593481302261, + "epoch": 0.9841377792891005, + "step": 1230 + }, + { + "loss": 0.45244503021240234, + "grad_norm": 0.040014103055000305, + "learning_rate": 8.800000000000001e-08, + "entropy": 0.8759910970041528, + "num_tokens": 82951810.0, + "logits/chosen": 0.9190710372039126, + "logits/rejected": 1.1600554501576563, + "mean_token_accuracy": 0.6553594494890421, + "rewards/chosen": -0.6744026106092497, + "rewards/rejected": -2.2188100884950837, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.5444074777932837, + "logps/chosen": -68.02484840035439, + "logps/rejected": -91.57242461919785, + "epoch": 0.9921388994459225, + "step": 1240 + }, + { + "loss": 0.4069981098175049, + "grad_norm": 0.03368917852640152, + "learning_rate": 8e-09, + "entropy": 0.8927215488708126, + "num_tokens": 83608233.0, + "logits/chosen": 0.8752754279033991, + "logits/rejected": 1.0711386316240197, + "mean_token_accuracy": 0.6459781708759813, + "rewards/chosen": -0.5922412400234031, + "rewards/rejected": -2.1926220250943955, + "rewards/accuracies": 0.821882951653944, + "rewards/margins": 1.600380785545244, + "logps/chosen": -67.47506940516503, + "logps/rejected": -92.58554644499723, + "epoch": 1.0, + "step": 1250 + }, + { + "eval_loss": 0.3831380307674408, + "eval_runtime": 409.2139, + "eval_samples_per_second": 2.444, + "eval_steps_per_second": 2.444, + "eval_entropy": 0.8765238604480401, + "eval_num_tokens": 83608233.0, + "eval_logits/chosen": 0.8781259246101419, + "eval_logits/rejected": 1.107441801738501, + "eval_mean_token_accuracy": 0.6608878705352544, + "eval_rewards/chosen": -0.6033024535952136, + "eval_rewards/rejected": -2.292753183161607, + "eval_rewards/accuracies": 0.83, + "eval_rewards/margins": 1.689450726993382, + "eval_logps/chosen": -66.49511113071442, + "eval_logps/rejected": -91.34535308170318, + "epoch": 1.0, + "step": 1250 + }, + { + "train_runtime": 37881.4288, + "train_samples_per_second": 2.639, + "train_steps_per_second": 0.033, + "total_flos": 5.0312011545074074e+17, + "train_loss": 0.44697874088287354, + "epoch": 1.0, + "step": 1250 + } + ], + "validation_monitor_size": 1000, + "validation_monitor_selection": "fixed_seed_random_without_replacement", + "validation_monitor_seed": 22, + "validation_monitor_indices": [ + 10, + 21, + 55, + 66, + 110, + 144, + 149, + 152, + 163, + 166, + 167, + 176, + 206, + 207, + 267, + 281, + 295, + 298, + 307, + 317, + 336, + 341, + 349, + 352, + 357, + 382, + 386, + 391, + 401, + 411, + 412, + 432, + 452, + 465, + 488, + 490, + 491, + 492, + 494, + 504, + 528, + 540, + 553, + 586, + 605, + 625, + 627, + 661, + 663, + 666, + 677, + 685, + 690, + 692, + 704, + 708, + 714, + 727, + 728, + 733, + 745, + 752, + 753, + 755, + 779, + 783, + 793, + 796, + 799, + 803, + 804, + 805, + 813, + 816, + 827, + 829, + 830, + 842, + 850, + 853, + 856, + 889, + 905, + 915, + 930, + 939, + 951, + 1002, + 1005, + 1029, + 1049, + 1050, + 1054, + 1067, + 1068, + 1079, + 1091, + 1114, + 1133, + 1140, + 1144, + 1145, + 1186, + 1195, + 1206, + 1223, + 1252, + 1257, + 1259, + 1271, + 1304, + 1305, + 1335, + 1336, + 1343, + 1367, + 1377, + 1403, + 1412, + 1429, + 1443, + 1457, + 1459, + 1460, + 1476, + 1483, + 1486, + 1507, + 1510, + 1519, + 1521, + 1545, + 1570, + 1582, + 1593, + 1595, + 1603, + 1607, + 1614, + 1615, + 1634, + 1639, + 1654, + 1657, + 1673, + 1690, + 1704, + 1746, + 1756, + 1781, + 1783, + 1796, + 1799, + 1809, + 1814, + 1827, + 1829, + 1832, + 1844, + 1847, + 1854, + 1856, + 1858, + 1883, + 1889, + 1925, + 1931, + 1932, + 1934, + 1935, + 1957, + 1962, + 1967, + 1975, + 1982, + 1983, + 1991, + 1998, + 2003, + 2008, + 2017, + 2021, + 2035, + 2040, + 2050, + 2056, + 2077, + 2082, + 2098, + 2100, + 2121, + 2130, + 2134, + 2138, + 2143, + 2166, + 2167, + 2180, + 2181, + 2204, + 2205, + 2212, + 2221, + 2224, + 2230, + 2233, + 2263, + 2269, + 2273, + 2290, + 2291, + 2299, + 2321, + 2323, + 2330, + 2401, + 2417, + 2435, + 2456, + 2488, + 2502, + 2504, + 2532, + 2538, + 2555, + 2558, + 2562, + 2583, + 2585, + 2590, + 2594, + 2596, + 2600, + 2606, + 2607, + 2618, + 2630, + 2647, + 2650, + 2657, + 2679, + 2685, + 2705, + 2712, + 2714, + 2727, + 2740, + 2742, + 2780, + 2784, + 2792, + 2807, + 2808, + 2810, + 2820, + 2831, + 2860, + 2863, + 2866, + 2875, + 2878, + 2898, + 2905, + 2921, + 2922, + 2930, + 2934, + 2944, + 2955, + 2957, + 2959, + 2973, + 2978, + 2998, + 3018, + 3022, + 3028, + 3031, + 3061, + 3085, + 3090, + 3104, + 3105, + 3115, + 3121, + 3122, + 3129, + 3133, + 3135, + 3161, + 3169, + 3194, + 3195, + 3215, + 3225, + 3226, + 3250, + 3265, + 3301, + 3312, + 3329, + 3361, + 3362, + 3376, + 3403, + 3410, + 3419, + 3432, + 3443, + 3452, + 3467, + 3469, + 3475, + 3485, + 3503, + 3515, + 3524, + 3528, + 3544, + 3557, + 3565, + 3637, + 3642, + 3658, + 3659, + 3693, + 3699, + 3722, + 3725, + 3728, + 3731, + 3740, + 3742, + 3762, + 3780, + 3788, + 3794, + 3796, + 3798, + 3817, + 3819, + 3822, + 3839, + 3843, + 3846, + 3851, + 3865, + 3871, + 3884, + 3894, + 3896, + 3907, + 3911, + 3915, + 3919, + 3920, + 3923, + 3933, + 3955, + 3967, + 3972, + 3974, + 3975, + 3997, + 4002, + 4034, + 4063, + 4073, + 4079, + 4082, + 4088, + 4121, + 4145, + 4148, + 4159, + 4161, + 4164, + 4177, + 4188, + 4199, + 4207, + 4213, + 4221, + 4233, + 4241, + 4243, + 4247, + 4264, + 4274, + 4282, + 4286, + 4290, + 4310, + 4313, + 4321, + 4324, + 4327, + 4362, + 4380, + 4407, + 4411, + 4415, + 4417, + 4418, + 4427, + 4431, + 4433, + 4451, + 4466, + 4477, + 4479, + 4493, + 4514, + 4527, + 4539, + 4550, + 4558, + 4568, + 4579, + 4583, + 4584, + 4586, + 4587, + 4590, + 4599, + 4602, + 4610, + 4626, + 4627, + 4630, + 4655, + 4656, + 4657, + 4661, + 4685, + 4714, + 4715, + 4731, + 4752, + 4769, + 4791, + 4805, + 4818, + 4829, + 4839, + 4843, + 4871, + 4879, + 4885, + 4888, + 4895, + 4900, + 4923, + 4966, + 4968, + 4972, + 4989, + 4994, + 4998, + 5001, + 5019, + 5026, + 5032, + 5034, + 5046, + 5055, + 5085, + 5086, + 5088, + 5089, + 5090, + 5095, + 5119, + 5121, + 5133, + 5154, + 5169, + 5178, + 5222, + 5223, + 5232, + 5233, + 5240, + 5256, + 5259, + 5264, + 5276, + 5279, + 5335, + 5337, + 5345, + 5348, + 5373, + 5378, + 5422, + 5442, + 5443, + 5445, + 5477, + 5485, + 5495, + 5497, + 5504, + 5526, + 5542, + 5564, + 5570, + 5579, + 5608, + 5610, + 5624, + 5630, + 5638, + 5651, + 5663, + 5670, + 5675, + 5691, + 5700, + 5706, + 5715, + 5720, + 5721, + 5732, + 5738, + 5741, + 5769, + 5771, + 5795, + 5796, + 5800, + 5809, + 5810, + 5815, + 5819, + 5827, + 5848, + 5849, + 5852, + 5859, + 5880, + 5907, + 5912, + 5919, + 5931, + 5932, + 5941, + 5948, + 5950, + 5953, + 5981, + 6000, + 6003, + 6010, + 6018, + 6075, + 6103, + 6106, + 6109, + 6114, + 6123, + 6131, + 6138, + 6139, + 6164, + 6173, + 6180, + 6185, + 6189, + 6190, + 6221, + 6223, + 6237, + 6255, + 6262, + 6265, + 6293, + 6305, + 6331, + 6336, + 6355, + 6366, + 6371, + 6396, + 6399, + 6402, + 6408, + 6432, + 6433, + 6441, + 6456, + 6465, + 6486, + 6489, + 6507, + 6508, + 6522, + 6528, + 6537, + 6551, + 6564, + 6590, + 6598, + 6599, + 6611, + 6613, + 6615, + 6621, + 6634, + 6647, + 6649, + 6654, + 6676, + 6690, + 6708, + 6729, + 6744, + 6749, + 6756, + 6761, + 6763, + 6773, + 6788, + 6790, + 6796, + 6797, + 6811, + 6850, + 6869, + 6871, + 6882, + 6895, + 6906, + 6911, + 6914, + 6952, + 6966, + 6985, + 7001, + 7021, + 7031, + 7038, + 7041, + 7045, + 7052, + 7057, + 7073, + 7076, + 7102, + 7107, + 7109, + 7117, + 7122, + 7125, + 7207, + 7212, + 7215, + 7232, + 7246, + 7250, + 7258, + 7263, + 7267, + 7270, + 7274, + 7280, + 7286, + 7293, + 7298, + 7306, + 7316, + 7325, + 7326, + 7356, + 7367, + 7385, + 7392, + 7405, + 7416, + 7421, + 7426, + 7452, + 7519, + 7534, + 7542, + 7546, + 7601, + 7604, + 7606, + 7609, + 7649, + 7653, + 7682, + 7699, + 7738, + 7750, + 7798, + 7800, + 7801, + 7805, + 7811, + 7832, + 7837, + 7849, + 7856, + 7876, + 7877, + 7887, + 7905, + 7919, + 7920, + 7922, + 7923, + 7926, + 7966, + 7970, + 7973, + 7974, + 7976, + 7986, + 8027, + 8028, + 8068, + 8074, + 8091, + 8120, + 8122, + 8125, + 8152, + 8153, + 8164, + 8167, + 8169, + 8171, + 8177, + 8189, + 8192, + 8196, + 8212, + 8217, + 8231, + 8242, + 8244, + 8250, + 8256, + 8257, + 8265, + 8270, + 8274, + 8283, + 8290, + 8294, + 8302, + 8307, + 8318, + 8326, + 8338, + 8350, + 8353, + 8357, + 8371, + 8377, + 8380, + 8387, + 8388, + 8396, + 8402, + 8419, + 8423, + 8428, + 8435, + 8439, + 8442, + 8444, + 8453, + 8475, + 8481, + 8495, + 8498, + 8523, + 8531, + 8562, + 8568, + 8584, + 8588, + 8589, + 8592, + 8597, + 8608, + 8611, + 8624, + 8636, + 8637, + 8654, + 8657, + 8661, + 8680, + 8683, + 8687, + 8693, + 8695, + 8697, + 8704, + 8713, + 8714, + 8755, + 8758, + 8761, + 8772, + 8781, + 8800, + 8808, + 8812, + 8815, + 8822, + 8825, + 8830, + 8837, + 8863, + 8867, + 8894, + 8898, + 8924, + 8937, + 8955, + 8964, + 8978, + 8995, + 9007, + 9018, + 9034, + 9043, + 9074, + 9075, + 9099, + 9103, + 9112, + 9115, + 9127, + 9137, + 9142, + 9163, + 9174, + 9179, + 9196, + 9208, + 9213, + 9222, + 9228, + 9230, + 9274, + 9278, + 9293, + 9328, + 9338, + 9342, + 9346, + 9368, + 9385, + 9403, + 9420, + 9429, + 9432, + 9453, + 9455, + 9463, + 9502, + 9511, + 9517, + 9545, + 9548, + 9550, + 9558, + 9566, + 9574, + 9577, + 9578, + 9589, + 9606, + 9618, + 9659, + 9672, + 9673, + 9706, + 9717, + 9728, + 9732, + 9758, + 9764, + 9773, + 9778, + 9779, + 9798, + 9801, + 9803, + 9804, + 9845, + 9849, + 9862, + 9876, + 9890, + 9911, + 9959, + 9966, + 9967, + 9968, + 9974, + 9983, + 10007, + 10032, + 10042, + 10044, + 10061, + 10062, + 10080, + 10085, + 10095, + 10098, + 10132, + 10144, + 10175, + 10176, + 10197, + 10220, + 10230, + 10233, + 10242, + 10260, + 10265, + 10305, + 10313, + 10314, + 10332, + 10338, + 10341, + 10342, + 10347, + 10353, + 10354, + 10360, + 10381, + 10390, + 10396, + 10402, + 10404, + 10418, + 10432, + 10445, + 10447, + 10450, + 10454, + 10489, + 10523, + 10539, + 10541, + 10550, + 10561, + 10562, + 10573, + 10577, + 10583, + 10589, + 10596, + 10601, + 10605, + 10633, + 10634, + 10663, + 10671, + 10672, + 10685, + 10710, + 10730, + 10733, + 10740, + 10744, + 10774, + 10786, + 10829, + 10833, + 10838, + 10855, + 10879, + 10907, + 10909, + 10911, + 10928, + 10936, + 10956, + 10989, + 11022, + 11030, + 11031, + 11041, + 11055, + 11058, + 11075, + 11077, + 11085, + 11096 + ], + "early_stopping_patience": 3 +} diff --git a/phase1/qwen-main-dpo-v3/README.md b/phase1/qwen-main-dpo-v3/README.md new file mode 100644 index 0000000000000000000000000000000000000000..da378ab29d01c6df5db9f17bb0858ce8a4a0c022 --- /dev/null +++ b/phase1/qwen-main-dpo-v3/README.md @@ -0,0 +1,81 @@ +--- +library_name: peft +model_name: phase1-qwen-main-dpo-v3 +tags: +- base_model:adapter:Qwen/Qwen2.5-1.5B-Instruct +- dpo +- lora +- transformers +- trl +license: apache-2.0 +base_model: Qwen/Qwen2.5-1.5B-Instruct +pipeline_tag: text-generation +--- + +# Phase 1 Qwen main DPO adapter + +This is the Phase 1 main LoRA-DPO adapter fine-tuned from +[Qwen2.5-1.5B-Instruct](https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct) +with 99,986 preference pairs. It has been trained using +[TRL](https://github.com/huggingface/trl). + +## Quick start + +```python +from peft import PeftModel +from transformers import AutoModelForCausalLM, AutoTokenizer + +repo_id = "geyuxu/york-milestone-project-self-traing-loop-model" +subfolder = "phase1/qwen-main-dpo-v3" +base_id = "Qwen/Qwen2.5-1.5B-Instruct" + +tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder) +base_model = AutoModelForCausalLM.from_pretrained( + base_id, torch_dtype="auto", device_map="auto" +) +model = PeftModel.from_pretrained(base_model, repo_id, subfolder=subfolder) +``` + +## Training procedure + + + + + +This model was trained with DPO, a method introduced in [Direct Preference Optimization: Your Language Model is Secretly a Reward Model](https://huggingface.co/papers/2305.18290). + +### Framework versions + +- PEFT 0.18.1 +- TRL: 0.29.0 +- Transformers: 5.3.0 +- Pytorch: 2.10.0 +- Datasets: 4.6.1 +- Tokenizers: 0.22.2 + +## Citations + +Cite DPO as: + +```bibtex +@inproceedings{rafailov2023direct, + title = {{Direct Preference Optimization: Your Language Model is Secretly a Reward Model}}, + author = {Rafael Rafailov and Archit Sharma and Eric Mitchell and Christopher D. Manning and Stefano Ermon and Chelsea Finn}, + year = 2023, + booktitle = {Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023}, + url = {http://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html}, + editor = {Alice Oh and Tristan Naumann and Amir Globerson and Kate Saenko and Moritz Hardt and Sergey Levine}, +} +``` + +Cite TRL as: + +```bibtex +@software{vonwerra2020trl, + title = {{TRL: Transformers Reinforcement Learning}}, + author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin}, + license = {Apache-2.0}, + url = {https://github.com/huggingface/trl}, + year = {2020} +} +``` diff --git a/phase1/qwen-main-dpo-v3/adapter_config.json b/phase1/qwen-main-dpo-v3/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..af2c37433449bd4e20212b848583833bdaf67495 --- /dev/null +++ b/phase1/qwen-main-dpo-v3/adapter_config.json @@ -0,0 +1,43 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen2.5-1.5B-Instruct", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "q_proj", + "v_proj", + "o_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} diff --git a/phase1/qwen-main-dpo-v3/adapter_model.safetensors b/phase1/qwen-main-dpo-v3/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..b52689a8199fe204047852071d0a06e9b9b0a328 --- /dev/null +++ b/phase1/qwen-main-dpo-v3/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cc60e5fe47be9bf4f64d734d40d89310a4826d8156d0ab8221b466f21c5efd58 +size 17462432 diff --git a/phase1/qwen-main-dpo-v3/chat_template.jinja b/phase1/qwen-main-dpo-v3/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..bdf7919a96cfe43d50914a007b9c0877bd0ec27e --- /dev/null +++ b/phase1/qwen-main-dpo-v3/chat_template.jinja @@ -0,0 +1,54 @@ +{%- if tools %} + {{- '<|im_start|>system\n' }} + {%- if messages[0]['role'] == 'system' %} + {{- messages[0]['content'] }} + {%- else %} + {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }} + {%- endif %} + {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }} +{%- else %} + {%- if messages[0]['role'] == 'system' %} + {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }} + {%- else %} + {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- for message in messages %} + {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %} + {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {{- '<|im_start|>' + message.role }} + {%- if message.content %} + {{- '\n' + message.content }} + {%- endif %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {{- '\n\n{"name": "' }} + {{- tool_call.name }} + {{- '", "arguments": ' }} + {{- tool_call.arguments | tojson }} + {{- '}\n' }} + {%- endfor %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- message.content }} + {{- '\n' }} + {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} +{%- endif %} diff --git a/phase1/qwen-main-dpo-v3/tokenizer.json b/phase1/qwen-main-dpo-v3/tokenizer.json new file mode 100644 index 0000000000000000000000000000000000000000..d73428d91463b495bc017fb6a2fb3a656646482b --- /dev/null +++ b/phase1/qwen-main-dpo-v3/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 +size 11422166 diff --git a/phase1/qwen-main-dpo-v3/tokenizer_config.json b/phase1/qwen-main-dpo-v3/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..9fd0fb48e73786f54fb04e98892f5f5a0ebeebdb --- /dev/null +++ b/phase1/qwen-main-dpo-v3/tokenizer_config.json @@ -0,0 +1,29 @@ +{ + "add_prefix_space": false, + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "is_local": true, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null +} diff --git a/phase1/qwen-main-dpo-v3/training_args.bin b/phase1/qwen-main-dpo-v3/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..b081cff1f7eda31f03912fcff25d6834200864e0 --- /dev/null +++ b/phase1/qwen-main-dpo-v3/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1578389f7f0fe332b393d7d42285d2a1a804b2efc9a174e73d1805a5ca67e41b +size 5841 diff --git a/phase1/qwen-main-dpo-v3/training_recipe.json b/phase1/qwen-main-dpo-v3/training_recipe.json new file mode 100644 index 0000000000000000000000000000000000000000..630e13c7dfb5f2ee4029860a455f88e95625413c --- /dev/null +++ b/phase1/qwen-main-dpo-v3/training_recipe.json @@ -0,0 +1,20 @@ +{ + "format_version": 1, + "experiment": "main_dpo", + "model_name": "Qwen/Qwen2.5-1.5B-Instruct", + "train_membership_sha256": "e105dbe9f9e652f095541415523cdcda51cc9e8d12d3ba4ca03e29e40296324f", + "validation_membership_sha256": "a46c1c0d0a6c3c444a3ac940322e42a2f1be5ec8e5f5f729a002e7484742551b", + "num_train_pairs": 99986, + "num_validation_pairs": 11110, + "learning_rate": 1e-05, + "beta": 0.1, + "num_epochs": 1.0, + "seed": 22, + "max_length": 512, + "max_prompt_length": 384, + "gradient_accumulation_steps": 80, + "save_steps": 125, + "save_total_limit": 12, + "preference_pairs_format_version": 2, + "dpo_prompt_mode": "rag_prompt_shared" +} diff --git a/phase1/qwen-main-dpo-v3/training_summary.json b/phase1/qwen-main-dpo-v3/training_summary.json new file mode 100644 index 0000000000000000000000000000000000000000..67835b2227501dde15ad8b132857fed94a61b348 --- /dev/null +++ b/phase1/qwen-main-dpo-v3/training_summary.json @@ -0,0 +1,3493 @@ +{ + "model_name": "Qwen/Qwen2.5-1.5B-Instruct", + "resolved_model": "Qwen/Qwen2.5-1.5B-Instruct", + "num_train_records": 99986, + "num_validation_records_available": 11110, + "training_config": { + "lora_rank": 16, + "lora_alpha": 32, + "learning_rate": 1e-05, + "num_epochs": 1.0, + "per_device_batch_size": 1, + "per_device_eval_batch_size": 1, + "gradient_accumulation_steps": 80, + "beta": 0.1, + "max_length": 512, + "max_prompt_length": 384, + "seed": 22, + "save_steps": 125, + "save_total_limit": 12, + "resume_from_checkpoint": null, + "precision_dtype": "torch.bfloat16", + "bf16": true, + "fp16": false, + "tokenizer_add_bos_token": false + }, + "global_step": 1250, + "best_metric": 0.3715994358062744, + "best_model_checkpoint": "outputs/dpo_phase1_qwen_all_unique_repair_v3/lora/checkpoint-1250", + "train_metrics": { + "train_runtime": 54275.4778, + "train_samples_per_second": 1.842, + "train_steps_per_second": 0.023, + "total_flos": 6.794900050947748e+17, + "train_loss": 0.4424690731048584 + }, + "log_history": [ + { + "loss": 0.6901532173156738, + "grad_norm": 0.012621426023542881, + "learning_rate": 9.928e-06, + "entropy": 0.8093121654563583, + "num_tokens": 670963.0, + "logits/chosen": -0.9584369752729957, + "logits/rejected": -0.9518610903521089, + "mean_token_accuracy": 0.7313421124406159, + "rewards/chosen": 0.00045646784230086724, + "rewards/rejected": -0.005912241121634452, + "rewards/accuracies": 0.52625, + "rewards/margins": 0.006368708992449683, + "logps/chosen": -53.02946231007576, + "logps/rejected": -52.86994596719742, + "epoch": 0.008001120156821955, + "step": 10 + }, + { + "loss": 0.674683666229248, + "grad_norm": 0.012483606114983559, + "learning_rate": 9.848000000000001e-06, + "entropy": 0.7939381037396379, + "num_tokens": 1341997.0, + "logits/chosen": -0.9796888803192282, + "logits/rejected": -0.9018265656875972, + "mean_token_accuracy": 0.7365013980120421, + "rewards/chosen": -0.01624998665111889, + "rewards/rejected": -0.05539245237303021, + "rewards/accuracies": 0.70875, + "rewards/margins": 0.03914246566069778, + "logps/chosen": -50.256172008514405, + "logps/rejected": -54.854298782348636, + "epoch": 0.01600224031364391, + "step": 20 + }, + { + "loss": 0.6438151359558105, + "grad_norm": 0.012461220845580101, + "learning_rate": 9.768e-06, + "entropy": 0.7936106454930268, + "num_tokens": 2012140.0, + "logits/chosen": -0.9887686294803811, + "logits/rejected": -0.8958026605139604, + "mean_token_accuracy": 0.7354880513995886, + "rewards/chosen": -0.06927679138132589, + "rewards/rejected": -0.1785658121076267, + "rewards/accuracies": 0.77875, + "rewards/margins": 0.10928902073879726, + "logps/chosen": -49.68967272758484, + "logps/rejected": -54.42679405450821, + "epoch": 0.024003360470465866, + "step": 30 + }, + { + "loss": 0.6171675205230713, + "grad_norm": 0.012906152755022049, + "learning_rate": 9.688000000000001e-06, + "entropy": 0.8316492229385767, + "num_tokens": 2685435.0, + "logits/chosen": -0.9345810579875565, + "logits/rejected": -0.8415264475290734, + "mean_token_accuracy": 0.7263862137310206, + "rewards/chosen": -0.17557695602539752, + "rewards/rejected": -0.35647496176256027, + "rewards/accuracies": 0.76375, + "rewards/margins": 0.18089800578542053, + "logps/chosen": -55.840644490718844, + "logps/rejected": -58.12323925256729, + "epoch": 0.03200448062728782, + "step": 40 + }, + { + "loss": 0.5752066612243653, + "grad_norm": 0.012006422504782677, + "learning_rate": 9.608e-06, + "entropy": 0.7856921868515201, + "num_tokens": 3355193.0, + "logits/chosen": -0.9370843916521988, + "logits/rejected": -0.8159164053898426, + "mean_token_accuracy": 0.723189832996577, + "rewards/chosen": -0.2943884494334634, + "rewards/rejected": -0.6045056528400164, + "rewards/accuracies": 0.785, + "rewards/margins": 0.31011720293667167, + "logps/chosen": -52.23467300653458, + "logps/rejected": -58.18705793142319, + "epoch": 0.04000560078410977, + "step": 50 + }, + { + "loss": 0.5501768589019775, + "grad_norm": 0.013944911770522594, + "learning_rate": 9.528000000000001e-06, + "entropy": 0.8087824353948235, + "num_tokens": 4027753.0, + "logits/chosen": -1.0292918722485356, + "logits/rejected": -0.855586984143943, + "mean_token_accuracy": 0.7112987640220672, + "rewards/chosen": -0.5289613087896577, + "rewards/rejected": -0.9568682179228198, + "rewards/accuracies": 0.76375, + "rewards/margins": 0.4279069083847571, + "logps/chosen": -56.717787961959836, + "logps/rejected": -66.04619632005692, + "epoch": 0.04800672094093173, + "step": 60 + }, + { + "loss": 0.5261342525482178, + "grad_norm": 0.012163989245891571, + "learning_rate": 9.448e-06, + "entropy": 0.7831143385136966, + "num_tokens": 4699664.0, + "logits/chosen": -1.101007950411393, + "logits/rejected": -0.9435466428316124, + "mean_token_accuracy": 0.7068579371087254, + "rewards/chosen": -0.7223313848793623, + "rewards/rejected": -1.2714019845274742, + "rewards/accuracies": 0.77875, + "rewards/margins": 0.5490705984598026, + "logps/chosen": -61.18258552312851, + "logps/rejected": -65.89279877901077, + "epoch": 0.05600784109775368, + "step": 70 + }, + { + "loss": 0.5274584293365479, + "grad_norm": 0.015226946212351322, + "learning_rate": 9.368e-06, + "entropy": 0.7488077865628293, + "num_tokens": 5372157.0, + "logits/chosen": -1.2634839435133882, + "logits/rejected": -1.082128236350263, + "mean_token_accuracy": 0.7112827113177628, + "rewards/chosen": -0.9723736402860231, + "rewards/rejected": -1.626036137866322, + "rewards/accuracies": 0.745, + "rewards/margins": 0.6536624957341701, + "logps/chosen": -62.329527735710144, + "logps/rejected": -69.63982899188996, + "epoch": 0.06400896125457564, + "step": 80 + }, + { + "loss": 0.5142660140991211, + "grad_norm": 0.013633078895509243, + "learning_rate": 9.288e-06, + "entropy": 0.7427371655139723, + "num_tokens": 6040573.0, + "logits/chosen": -1.311929577255716, + "logits/rejected": -1.125822709345973, + "mean_token_accuracy": 0.7006962174363435, + "rewards/chosen": -1.0937171235348797, + "rewards/rejected": -1.8326766119452076, + "rewards/accuracies": 0.74625, + "rewards/margins": 0.7389594866335392, + "logps/chosen": -60.460937385559085, + "logps/rejected": -69.68028839588165, + "epoch": 0.0720100814113976, + "step": 90 + }, + { + "loss": 0.48309645652770994, + "grad_norm": 0.013873466290533543, + "learning_rate": 9.208e-06, + "entropy": 0.7353724740154576, + "num_tokens": 6713961.0, + "logits/chosen": -1.3981686101953354, + "logits/rejected": -1.1492534001655728, + "mean_token_accuracy": 0.7068778586760164, + "rewards/chosen": -1.275778706202982, + "rewards/rejected": -2.205598971605068, + "rewards/accuracies": 0.77875, + "rewards/margins": 0.9298202639631927, + "logps/chosen": -63.14240853786468, + "logps/rejected": -78.55453793764114, + "epoch": 0.08001120156821954, + "step": 100 + }, + { + "loss": 0.47826247215270995, + "grad_norm": 0.01541591715067625, + "learning_rate": 9.128e-06, + "entropy": 0.7661040782314376, + "num_tokens": 7387335.0, + "logits/chosen": -1.3620669095703972, + "logits/rejected": -1.1219973012975202, + "mean_token_accuracy": 0.6907096220739186, + "rewards/chosen": -1.3754910858121001, + "rewards/rejected": -2.3353658849513157, + "rewards/accuracies": 0.78375, + "rewards/margins": 0.9598747962340712, + "logps/chosen": -67.88601873874664, + "logps/rejected": -78.68544527292252, + "epoch": 0.0880123217250415, + "step": 110 + }, + { + "loss": 0.5143081188201905, + "grad_norm": 0.017378821969032288, + "learning_rate": 9.048e-06, + "entropy": 0.7460291436497937, + "num_tokens": 8057646.0, + "logits/chosen": -1.4079163351569763, + "logits/rejected": -1.1285183809325192, + "mean_token_accuracy": 0.700520682586357, + "rewards/chosen": -1.3658788571986589, + "rewards/rejected": -2.2463605564041065, + "rewards/accuracies": 0.75125, + "rewards/margins": 0.8804816985502839, + "logps/chosen": -65.51872705698014, + "logps/rejected": -74.3196389889717, + "epoch": 0.09601344188186346, + "step": 120 + }, + { + "eval_loss": 0.4647688567638397, + "eval_runtime": 195.6609, + "eval_samples_per_second": 5.111, + "eval_steps_per_second": 5.111, + "eval_entropy": 0.7556589982062578, + "eval_num_tokens": 8395356.0, + "eval_logits/chosen": -1.2958382112131164, + "eval_logits/rejected": -1.0266528869050695, + "eval_mean_token_accuracy": 0.6990812446027994, + "eval_rewards/chosen": -1.2314954024991966, + "eval_rewards/rejected": -2.241709055064479, + "eval_rewards/accuracies": 0.791, + "eval_rewards/margins": 1.0102136510759592, + "eval_logps/chosen": -62.685266920089724, + "eval_logps/rejected": -75.3382277507782, + "epoch": 0.10001400196027443, + "step": 125 + }, + { + "loss": 0.4783907890319824, + "grad_norm": 0.01220870204269886, + "learning_rate": 8.968000000000001e-06, + "entropy": 0.7789282223425107, + "num_tokens": 8731040.0, + "logits/chosen": -1.2888471366805734, + "logits/rejected": -1.0516192191884435, + "mean_token_accuracy": 0.691539853401482, + "rewards/chosen": -1.2831247101316694, + "rewards/rejected": -2.242197908805683, + "rewards/accuracies": 0.78, + "rewards/margins": 0.9590731968544424, + "logps/chosen": -68.42604200839996, + "logps/rejected": -76.86017044305801, + "epoch": 0.10401456203868542, + "step": 130 + }, + { + "loss": 0.4924801826477051, + "grad_norm": 0.012252936139702797, + "learning_rate": 8.888e-06, + "entropy": 0.7674391892907443, + "num_tokens": 9401640.0, + "logits/chosen": -1.2537443916085618, + "logits/rejected": -0.9872851940228372, + "mean_token_accuracy": 0.7068716604355723, + "rewards/chosen": -1.2096528004054563, + "rewards/rejected": -2.1564956095546948, + "rewards/accuracies": 0.77875, + "rewards/margins": 0.946842809554655, + "logps/chosen": -61.44815753698349, + "logps/rejected": -75.21420559167862, + "epoch": 0.11201568219550737, + "step": 140 + }, + { + "loss": 0.4433901786804199, + "grad_norm": 0.019120773300528526, + "learning_rate": 8.808000000000001e-06, + "entropy": 0.7849294722545892, + "num_tokens": 10074158.0, + "logits/chosen": -1.2328529211448207, + "logits/rejected": -0.9243871139015541, + "mean_token_accuracy": 0.6956806232780218, + "rewards/chosen": -1.2763914220364496, + "rewards/rejected": -2.3580219121300616, + "rewards/accuracies": 0.8, + "rewards/margins": 1.081630490552634, + "logps/chosen": -64.5562591767311, + "logps/rejected": -80.11041006326676, + "epoch": 0.12001680235232932, + "step": 150 + }, + { + "loss": 0.4346295356750488, + "grad_norm": 0.013042928650975227, + "learning_rate": 8.728e-06, + "entropy": 0.7355541310226544, + "num_tokens": 10743004.0, + "logits/chosen": -1.4005078205253927, + "logits/rejected": -1.0567861199616662, + "mean_token_accuracy": 0.7047591439820826, + "rewards/chosen": -1.2316719387439299, + "rewards/rejected": -2.3673254120955245, + "rewards/accuracies": 0.81, + "rewards/margins": 1.1356534744799136, + "logps/chosen": -59.515862419605256, + "logps/rejected": -76.50743375062943, + "epoch": 0.12801792250915128, + "step": 160 + }, + { + "loss": 0.5103495597839356, + "grad_norm": 0.015699906274676323, + "learning_rate": 8.648000000000001e-06, + "entropy": 0.740672427273239, + "num_tokens": 11410696.0, + "logits/chosen": -1.404414859203772, + "logits/rejected": -1.1005658892552497, + "mean_token_accuracy": 0.7076463782973588, + "rewards/chosen": -1.2404756933083991, + "rewards/rejected": -2.2894487548015605, + "rewards/accuracies": 0.77875, + "rewards/margins": 1.0489730596914888, + "logps/chosen": -60.35841114163399, + "logps/rejected": -74.72909695386886, + "epoch": 0.13601904266597323, + "step": 170 + }, + { + "loss": 0.46210732460021975, + "grad_norm": 0.013843734748661518, + "learning_rate": 8.568e-06, + "entropy": 0.7232949527283199, + "num_tokens": 12080027.0, + "logits/chosen": -1.5137382104169737, + "logits/rejected": -1.1591507879383176, + "mean_token_accuracy": 0.7147883488237858, + "rewards/chosen": -1.1584112935088342, + "rewards/rejected": -2.2342659830115736, + "rewards/accuracies": 0.80125, + "rewards/margins": 1.075854687690735, + "logps/chosen": -59.70499998569488, + "logps/rejected": -75.35983695030212, + "epoch": 0.1440201628227952, + "step": 180 + }, + { + "loss": 0.48125648498535156, + "grad_norm": 0.0137063292786479, + "learning_rate": 8.488e-06, + "entropy": 0.7297163017120328, + "num_tokens": 12751327.0, + "logits/chosen": -1.444744739736003, + "logits/rejected": -1.1977971036132493, + "mean_token_accuracy": 0.7079235365241766, + "rewards/chosen": -1.1817194805917097, + "rewards/rejected": -2.165882707394485, + "rewards/accuracies": 0.77625, + "rewards/margins": 0.9841632262058556, + "logps/chosen": -62.84384714603424, + "logps/rejected": -74.69614839792251, + "epoch": 0.15202128297961714, + "step": 190 + }, + { + "loss": 0.4559768199920654, + "grad_norm": 0.017784949392080307, + "learning_rate": 8.408e-06, + "entropy": 0.7738335855977493, + "num_tokens": 13423121.0, + "logits/chosen": -1.3036348294549531, + "logits/rejected": -1.091831282302383, + "mean_token_accuracy": 0.704848392214626, + "rewards/chosen": -1.0437373626657063, + "rewards/rejected": -2.0530137880844994, + "rewards/accuracies": 0.8125, + "rewards/margins": 1.0092764250934123, + "logps/chosen": -64.31396059989929, + "logps/rejected": -72.96644197225571, + "epoch": 0.1600224031364391, + "step": 200 + }, + { + "loss": 0.44863576889038087, + "grad_norm": 0.014046410098671913, + "learning_rate": 8.328e-06, + "entropy": 0.782024933876237, + "num_tokens": 14095754.0, + "logits/chosen": -1.3947293172547142, + "logits/rejected": -1.0955241061061023, + "mean_token_accuracy": 0.7042262899316847, + "rewards/chosen": -1.0590654362243368, + "rewards/rejected": -2.181202197938692, + "rewards/accuracies": 0.7925, + "rewards/margins": 1.1221367592178284, + "logps/chosen": -63.88484351158142, + "logps/rejected": -77.38630795001984, + "epoch": 0.16802352329326106, + "step": 210 + }, + { + "loss": 0.44264936447143555, + "grad_norm": 0.012177016586065292, + "learning_rate": 8.248e-06, + "entropy": 0.7621519005317532, + "num_tokens": 14766898.0, + "logits/chosen": -1.4800165515522479, + "logits/rejected": -1.2002405014776387, + "mean_token_accuracy": 0.705511124804616, + "rewards/chosen": -1.0531316056221112, + "rewards/rejected": -2.159446875175927, + "rewards/accuracies": 0.7925, + "rewards/margins": 1.1063152687205002, + "logps/chosen": -62.64944897651672, + "logps/rejected": -76.60918622970581, + "epoch": 0.176024643450083, + "step": 220 + }, + { + "loss": 0.4280844688415527, + "grad_norm": 0.016551608219742775, + "learning_rate": 8.168e-06, + "entropy": 0.7501697012913064, + "num_tokens": 15435708.0, + "logits/chosen": -1.4906831771255906, + "logits/rejected": -1.2600194493747174, + "mean_token_accuracy": 0.7034410179778934, + "rewards/chosen": -1.0560207770811394, + "rewards/rejected": -2.279763128710911, + "rewards/accuracies": 0.815, + "rewards/margins": 1.2237423502095044, + "logps/chosen": -62.1078541469574, + "logps/rejected": -74.43184190511704, + "epoch": 0.18402576360690498, + "step": 230 + }, + { + "loss": 0.4562046051025391, + "grad_norm": 0.018661431968212128, + "learning_rate": 8.088e-06, + "entropy": 0.7657817163813161, + "num_tokens": 16105021.0, + "logits/chosen": -1.4795107714667275, + "logits/rejected": -1.2074811268885899, + "mean_token_accuracy": 0.6954782837070524, + "rewards/chosen": -1.187200614688045, + "rewards/rejected": -2.371643460559426, + "rewards/accuracies": 0.79625, + "rewards/margins": 1.1844428442558275, + "logps/chosen": -65.60020695924759, + "logps/rejected": -75.24097845077515, + "epoch": 0.19202688376372692, + "step": 240 + }, + { + "loss": 0.43615498542785647, + "grad_norm": 0.017426082864403725, + "learning_rate": 8.008e-06, + "entropy": 0.7539033056423068, + "num_tokens": 16775473.0, + "logits/chosen": -1.5293930977344743, + "logits/rejected": -1.2039755376829944, + "mean_token_accuracy": 0.705405270345509, + "rewards/chosen": -1.153575651863182, + "rewards/rejected": -2.4536339438945287, + "rewards/accuracies": 0.8, + "rewards/margins": 1.300058292048052, + "logps/chosen": -61.453006939888, + "logps/rejected": -78.41303983211517, + "epoch": 0.20002800392054887, + "step": 250 + }, + { + "eval_loss": 0.41755250096321106, + "eval_runtime": 228.8761, + "eval_samples_per_second": 4.369, + "eval_steps_per_second": 4.369, + "eval_entropy": 0.7515761259810534, + "eval_num_tokens": 16775473.0, + "eval_logits/chosen": -1.5818283479057658, + "eval_logits/rejected": -1.2564869641723404, + "eval_mean_token_accuracy": 0.7046490426361561, + "eval_rewards/chosen": -1.1224118193469477, + "eval_rewards/rejected": -2.479533482246101, + "eval_rewards/accuracies": 0.817, + "eval_rewards/margins": 1.3571216629631817, + "eval_logps/chosen": -61.59443111038208, + "eval_logps/rejected": -77.71647195625305, + "epoch": 0.20002800392054887, + "step": 250 + }, + { + "loss": 0.45821270942687986, + "grad_norm": 0.021657424047589302, + "learning_rate": 7.928e-06, + "entropy": 0.7126325222587911, + "num_tokens": 17443745.0, + "logits/chosen": -1.688095090193879, + "logits/rejected": -1.3269386596926678, + "mean_token_accuracy": 0.7153355416469276, + "rewards/chosen": -1.0613955771701875, + "rewards/rejected": -2.3263194395392204, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.2649238619487733, + "logps/chosen": -58.97456979036331, + "logps/rejected": -75.75996887207032, + "epoch": 0.20802912407737084, + "step": 260 + }, + { + "loss": 0.45466012954711915, + "grad_norm": 0.01559050939977169, + "learning_rate": 7.848000000000002e-06, + "entropy": 0.7546081965982012, + "num_tokens": 18114630.0, + "logits/chosen": -1.6243488424681385, + "logits/rejected": -1.2826702078202163, + "mean_token_accuracy": 0.7035466120112688, + "rewards/chosen": -0.9812952489028248, + "rewards/rejected": -2.2022523112816272, + "rewards/accuracies": 0.79625, + "rewards/margins": 1.2209570601163433, + "logps/chosen": -59.83277177095413, + "logps/rejected": -76.06529054880143, + "epoch": 0.2160302442341928, + "step": 270 + }, + { + "loss": 0.45614118576049806, + "grad_norm": 0.019957436248660088, + "learning_rate": 7.768e-06, + "entropy": 0.7647551147075137, + "num_tokens": 18785905.0, + "logits/chosen": -1.5628276684430993, + "logits/rejected": -1.2313030623237793, + "mean_token_accuracy": 0.7110288896784186, + "rewards/chosen": -0.9674690414072393, + "rewards/rejected": -2.1841950027487473, + "rewards/accuracies": 0.7975, + "rewards/margins": 1.2167259603133425, + "logps/chosen": -61.66511924505234, + "logps/rejected": -76.08382419586182, + "epoch": 0.22403136439101473, + "step": 280 + }, + { + "loss": 0.4528087615966797, + "grad_norm": 0.016109870746731758, + "learning_rate": 7.688000000000002e-06, + "entropy": 0.7966391498795565, + "num_tokens": 19454926.0, + "logits/chosen": -1.5498234098285903, + "logits/rejected": -1.1901957881893803, + "mean_token_accuracy": 0.7049976014718413, + "rewards/chosen": -0.9073732627101344, + "rewards/rejected": -2.0697916117409476, + "rewards/accuracies": 0.805, + "rewards/margins": 1.1624183485191315, + "logps/chosen": -59.853264043331144, + "logps/rejected": -74.87920271635056, + "epoch": 0.2320324845478367, + "step": 290 + }, + { + "loss": 0.47883009910583496, + "grad_norm": 0.016857173293828964, + "learning_rate": 7.608000000000001e-06, + "entropy": 0.8085904457367724, + "num_tokens": 20126111.0, + "logits/chosen": -1.458701673585645, + "logits/rejected": -1.1795248022037903, + "mean_token_accuracy": 0.7017660610564053, + "rewards/chosen": -0.909867911524816, + "rewards/rejected": -1.9736081816648947, + "rewards/accuracies": 0.79125, + "rewards/margins": 1.06374026496429, + "logps/chosen": -63.4786088347435, + "logps/rejected": -73.5995323753357, + "epoch": 0.24003360470465865, + "step": 300 + }, + { + "loss": 0.44984683990478513, + "grad_norm": 0.014970983378589153, + "learning_rate": 7.528000000000001e-06, + "entropy": 0.7699917011187063, + "num_tokens": 20797038.0, + "logits/chosen": -1.446817589316724, + "logits/rejected": -1.1859943999402387, + "mean_token_accuracy": 0.7064874805696308, + "rewards/chosen": -0.9031680591187978, + "rewards/rejected": -2.074450860506622, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.1712828036351128, + "logps/chosen": -59.92485630989075, + "logps/rejected": -73.00901054382324, + "epoch": 0.24803472486148062, + "step": 310 + }, + { + "loss": 0.4490029335021973, + "grad_norm": 0.022525979205965996, + "learning_rate": 7.4480000000000005e-06, + "entropy": 0.7794862373394426, + "num_tokens": 21469537.0, + "logits/chosen": -1.4607136962944067, + "logits/rejected": -1.2216475012442696, + "mean_token_accuracy": 0.7070466516911984, + "rewards/chosen": -0.9359806089089397, + "rewards/rejected": -2.1456712255581807, + "rewards/accuracies": 0.80125, + "rewards/margins": 1.2096906119165942, + "logps/chosen": -63.570755321979526, + "logps/rejected": -74.33635073184968, + "epoch": 0.25603584501830257, + "step": 320 + }, + { + "loss": 0.42673392295837403, + "grad_norm": 0.01500563696026802, + "learning_rate": 7.3680000000000004e-06, + "entropy": 0.7719001133486745, + "num_tokens": 22139392.0, + "logits/chosen": -1.5307678604859354, + "logits/rejected": -1.1878700116418397, + "mean_token_accuracy": 0.7252580110915006, + "rewards/chosen": -0.9217133387317881, + "rewards/rejected": -2.2019231244851833, + "rewards/accuracies": 0.81625, + "rewards/margins": 1.280209785089828, + "logps/chosen": -57.07231194496155, + "logps/rejected": -75.99781235456467, + "epoch": 0.26403696517512454, + "step": 330 + }, + { + "loss": 0.43677473068237305, + "grad_norm": 0.016953062266111374, + "learning_rate": 7.288e-06, + "entropy": 0.7901253036441631, + "num_tokens": 22810806.0, + "logits/chosen": -1.5143094582014855, + "logits/rejected": -1.1739754756461656, + "mean_token_accuracy": 0.7107993514090777, + "rewards/chosen": -1.0534828628422475, + "rewards/rejected": -2.3567850939719936, + "rewards/accuracies": 0.79, + "rewards/margins": 1.3033022294938563, + "logps/chosen": -62.018573169708255, + "logps/rejected": -77.68898005723953, + "epoch": 0.27203808533194646, + "step": 340 + }, + { + "loss": 0.4813384056091309, + "grad_norm": 0.020505042746663094, + "learning_rate": 7.208e-06, + "entropy": 0.7920829233201221, + "num_tokens": 23482313.0, + "logits/chosen": -1.5573064750111225, + "logits/rejected": -1.2691127637031634, + "mean_token_accuracy": 0.7065368478372693, + "rewards/chosen": -1.0512184386729495, + "rewards/rejected": -2.255847032779711, + "rewards/accuracies": 0.77375, + "rewards/margins": 1.2046285913512111, + "logps/chosen": -63.08674698352814, + "logps/rejected": -78.29900344133377, + "epoch": 0.28003920548876843, + "step": 350 + }, + { + "loss": 0.4246501922607422, + "grad_norm": 0.014883480034768581, + "learning_rate": 7.128e-06, + "entropy": 0.7865306049736682, + "num_tokens": 24153305.0, + "logits/chosen": -1.537738084026084, + "logits/rejected": -1.1983942055842802, + "mean_token_accuracy": 0.7134439899772406, + "rewards/chosen": -0.9302535154198995, + "rewards/rejected": -2.318044547114114, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.387791032139212, + "logps/chosen": -61.84508213996887, + "logps/rejected": -76.50247138738632, + "epoch": 0.2880403256455904, + "step": 360 + }, + { + "loss": 0.45168180465698243, + "grad_norm": 0.01625877432525158, + "learning_rate": 7.048e-06, + "entropy": 0.7856893282332749, + "num_tokens": 24824508.0, + "logits/chosen": -1.49558786923791, + "logits/rejected": -1.2264479343669743, + "mean_token_accuracy": 0.7111923243664205, + "rewards/chosen": -0.859120489389345, + "rewards/rejected": -2.0333363087201723, + "rewards/accuracies": 0.8, + "rewards/margins": 1.1742158197984098, + "logps/chosen": -60.18622805953026, + "logps/rejected": -72.6990950036049, + "epoch": 0.2960414458024123, + "step": 370 + }, + { + "eval_loss": 0.40108245611190796, + "eval_runtime": 261.8573, + "eval_samples_per_second": 3.819, + "eval_steps_per_second": 3.819, + "eval_entropy": 0.7854411639701575, + "eval_num_tokens": 25157973.0, + "eval_logits/chosen": -1.5470742603207561, + "eval_logits/rejected": -1.224529391292129, + "eval_mean_token_accuracy": 0.7116532544195652, + "eval_rewards/chosen": -0.744420228220697, + "eval_rewards/rejected": -2.09283788038115, + "eval_rewards/accuracies": 0.84, + "eval_rewards/margins": 1.3484176517128945, + "eval_logps/chosen": -57.814515258789065, + "eval_logps/rejected": -73.84951600837708, + "epoch": 0.3000420058808233, + "step": 375 + }, + { + "loss": 0.43377981185913084, + "grad_norm": 0.017510831356048584, + "learning_rate": 6.968e-06, + "entropy": 0.7978322333609685, + "num_tokens": 25494641.0, + "logits/chosen": -1.4614303553748496, + "logits/rejected": -1.1762243386882418, + "mean_token_accuracy": 0.709608536399901, + "rewards/chosen": -0.8106335669964756, + "rewards/rejected": -2.098603892197134, + "rewards/accuracies": 0.81375, + "rewards/margins": 1.2879703220631926, + "logps/chosen": -59.16475499391556, + "logps/rejected": -73.48036357402802, + "epoch": 0.3040425659592343, + "step": 380 + }, + { + "loss": 0.4555358409881592, + "grad_norm": 0.019583892077207565, + "learning_rate": 6.888e-06, + "entropy": 0.8092104942744481, + "num_tokens": 26166528.0, + "logits/chosen": -1.5254947324121024, + "logits/rejected": -1.2240848010049827, + "mean_token_accuracy": 0.7108938498422503, + "rewards/chosen": -0.8702591723093428, + "rewards/rejected": -2.1351046158939244, + "rewards/accuracies": 0.7875, + "rewards/margins": 1.2648454446252435, + "logps/chosen": -61.42998598575592, + "logps/rejected": -76.14873928785325, + "epoch": 0.31204368611605626, + "step": 390 + }, + { + "loss": 0.46687164306640627, + "grad_norm": 0.017899347469210625, + "learning_rate": 6.808e-06, + "entropy": 0.8109981114600668, + "num_tokens": 26837910.0, + "logits/chosen": -1.5435783477572906, + "logits/rejected": -1.2533959900020157, + "mean_token_accuracy": 0.7053979247622192, + "rewards/chosen": -0.8435966002533678, + "rewards/rejected": -1.9857485976428142, + "rewards/accuracies": 0.79125, + "rewards/margins": 1.142151997378096, + "logps/chosen": -59.731822919845584, + "logps/rejected": -73.6962216091156, + "epoch": 0.3200448062728782, + "step": 400 + }, + { + "loss": 0.4498548984527588, + "grad_norm": 0.017566895112395287, + "learning_rate": 6.728e-06, + "entropy": 0.7847930058425118, + "num_tokens": 27508253.0, + "logits/chosen": -1.5778073680801266, + "logits/rejected": -1.2930986244729112, + "mean_token_accuracy": 0.7119706268794834, + "rewards/chosen": -0.8386218428566281, + "rewards/rejected": -2.119775672905962, + "rewards/accuracies": 0.7975, + "rewards/margins": 1.2811538278777153, + "logps/chosen": -59.29162739753723, + "logps/rejected": -73.53354480028152, + "epoch": 0.32804592642970015, + "step": 410 + }, + { + "loss": 0.40497851371765137, + "grad_norm": 0.01540332194417715, + "learning_rate": 6.648e-06, + "entropy": 0.7516823384127929, + "num_tokens": 28178623.0, + "logits/chosen": -1.6650058681382822, + "logits/rejected": -1.3997253712734676, + "mean_token_accuracy": 0.7158960890956223, + "rewards/chosen": -0.8034676910203415, + "rewards/rejected": -2.2201583882281555, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.4166906926268712, + "logps/chosen": -59.174430742263795, + "logps/rejected": -74.63985994577408, + "epoch": 0.3360470465865221, + "step": 420 + }, + { + "loss": 0.4662345886230469, + "grad_norm": 0.018290609121322632, + "learning_rate": 6.568000000000001e-06, + "entropy": 0.7800224199614604, + "num_tokens": 28851605.0, + "logits/chosen": -1.6067276746321397, + "logits/rejected": -1.345846387955557, + "mean_token_accuracy": 0.7173346922919154, + "rewards/chosen": -0.9026323649001938, + "rewards/rejected": -2.25237619676278, + "rewards/accuracies": 0.79125, + "rewards/margins": 1.349743832880631, + "logps/chosen": -60.28967917919159, + "logps/rejected": -78.79194824457169, + "epoch": 0.34404816674334404, + "step": 430 + }, + { + "loss": 0.4252736568450928, + "grad_norm": 0.01900332234799862, + "learning_rate": 6.488000000000001e-06, + "entropy": 0.7889413698905264, + "num_tokens": 29521003.0, + "logits/chosen": -1.5594821986624388, + "logits/rejected": -1.284990779442694, + "mean_token_accuracy": 0.7114941450580955, + "rewards/chosen": -0.6923378604184837, + "rewards/rejected": -1.9594628562072467, + "rewards/accuracies": 0.8125, + "rewards/margins": 1.2671249943878502, + "logps/chosen": -57.641191160678865, + "logps/rejected": -71.39436632752418, + "epoch": 0.352049286900166, + "step": 440 + }, + { + "loss": 0.44404311180114747, + "grad_norm": 0.014757134020328522, + "learning_rate": 6.408000000000001e-06, + "entropy": 0.8029435851906601, + "num_tokens": 30193628.0, + "logits/chosen": -1.5528246220337487, + "logits/rejected": -1.306353942278804, + "mean_token_accuracy": 0.7148870236054062, + "rewards/chosen": -0.7460464937914366, + "rewards/rejected": -2.0762319400499107, + "rewards/accuracies": 0.7925, + "rewards/margins": 1.3301854438055307, + "logps/chosen": -60.94721186161041, + "logps/rejected": -73.36143920898438, + "epoch": 0.360050407056988, + "step": 450 + }, + { + "loss": 0.4490717887878418, + "grad_norm": 0.015265013091266155, + "learning_rate": 6.328000000000001e-06, + "entropy": 0.7935610801939038, + "num_tokens": 30863088.0, + "logits/chosen": -1.4974854166216225, + "logits/rejected": -1.2316522249854684, + "mean_token_accuracy": 0.7104171360097825, + "rewards/chosen": -0.7627023357424195, + "rewards/rejected": -2.0078364689345474, + "rewards/accuracies": 0.7925, + "rewards/margins": 1.2451341325975955, + "logps/chosen": -59.97197327375412, + "logps/rejected": -72.11604419708252, + "epoch": 0.36805152721380996, + "step": 460 + }, + { + "loss": 0.41155333518981935, + "grad_norm": 0.013331553898751736, + "learning_rate": 6.248000000000001e-06, + "entropy": 0.8216456134367036, + "num_tokens": 31534941.0, + "logits/chosen": -1.3811194428474023, + "logits/rejected": -1.1138888568445255, + "mean_token_accuracy": 0.7219325851276517, + "rewards/chosen": -0.6609289994760001, + "rewards/rejected": -2.0405853765274515, + "rewards/accuracies": 0.8225, + "rewards/margins": 1.3796563766803593, + "logps/chosen": -58.38505304098129, + "logps/rejected": -74.04946865081787, + "epoch": 0.3760526473706319, + "step": 470 + }, + { + "loss": 0.4466897964477539, + "grad_norm": 0.01753743551671505, + "learning_rate": 6.168000000000001e-06, + "entropy": 0.8334384193710139, + "num_tokens": 32205656.0, + "logits/chosen": -1.3827546708003007, + "logits/rejected": -1.0339429527817656, + "mean_token_accuracy": 0.7131594355031848, + "rewards/chosen": -0.7439785542327445, + "rewards/rejected": -1.960863492001299, + "rewards/accuracies": 0.815, + "rewards/margins": 1.216884934026748, + "logps/chosen": -58.21757227420807, + "logps/rejected": -73.37372440934182, + "epoch": 0.38405376752745385, + "step": 480 + }, + { + "loss": 0.40377373695373536, + "grad_norm": 0.01816868782043457, + "learning_rate": 6.088000000000001e-06, + "entropy": 0.8024617000628496, + "num_tokens": 32876163.0, + "logits/chosen": -1.4179740237506409, + "logits/rejected": -1.0827905872881898, + "mean_token_accuracy": 0.7154640745930374, + "rewards/chosen": -0.7735933150124038, + "rewards/rejected": -2.22035426512899, + "rewards/accuracies": 0.81375, + "rewards/margins": 1.4467609539348631, + "logps/chosen": -57.90766100645065, + "logps/rejected": -77.59653000831604, + "epoch": 0.3920548876842758, + "step": 490 + }, + { + "loss": 0.41811537742614746, + "grad_norm": 0.019719718024134636, + "learning_rate": 6.008000000000001e-06, + "entropy": 0.7722080520819873, + "num_tokens": 33544655.0, + "logits/chosen": -1.5976364903353601, + "logits/rejected": -1.254849461857967, + "mean_token_accuracy": 0.7171562075056136, + "rewards/chosen": -0.8839642912911404, + "rewards/rejected": -2.397825531034032, + "rewards/accuracies": 0.825, + "rewards/margins": 1.5138612392637878, + "logps/chosen": -55.453014096021654, + "logps/rejected": -76.40599090814591, + "epoch": 0.40005600784109774, + "step": 500 + }, + { + "eval_loss": 0.38985610008239746, + "eval_runtime": 295.4363, + "eval_samples_per_second": 3.385, + "eval_steps_per_second": 3.385, + "eval_entropy": 0.7853469266706379, + "eval_num_tokens": 33544655.0, + "eval_logits/chosen": -1.5529572877113846, + "eval_logits/rejected": -1.2052691634940973, + "eval_mean_token_accuracy": 0.7127959969043731, + "eval_rewards/chosen": -0.8540078571253689, + "eval_rewards/rejected": -2.4217219229266047, + "eval_rewards/accuracies": 0.839, + "eval_rewards/margins": 1.567714064385742, + "eval_logps/chosen": -58.910391542434695, + "eval_logps/rejected": -77.13835635185242, + "epoch": 0.40005600784109774, + "step": 500 + }, + { + "loss": 0.4106621265411377, + "grad_norm": 0.01843755505979061, + "learning_rate": 5.928000000000001e-06, + "entropy": 0.7777362689268194, + "num_tokens": 34215067.0, + "logits/chosen": -1.5562227061384784, + "logits/rejected": -1.2522495552006923, + "mean_token_accuracy": 0.7179272715188563, + "rewards/chosen": -0.8717791981572373, + "rewards/rejected": -2.4079101788741535, + "rewards/accuracies": 0.81375, + "rewards/margins": 1.5361309775570406, + "logps/chosen": -60.166661179065706, + "logps/rejected": -77.11534287214279, + "epoch": 0.4080571279979197, + "step": 510 + }, + { + "loss": 0.395180869102478, + "grad_norm": 0.01829616166651249, + "learning_rate": 5.848000000000001e-06, + "entropy": 0.8065995912099606, + "num_tokens": 34885788.0, + "logits/chosen": -1.5098659115660116, + "logits/rejected": -1.157861895612393, + "mean_token_accuracy": 0.720119754821062, + "rewards/chosen": -0.7933310749317752, + "rewards/rejected": -2.2485245560633484, + "rewards/accuracies": 0.825, + "rewards/margins": 1.455193478623405, + "logps/chosen": -58.70744555234909, + "logps/rejected": -76.83435313940048, + "epoch": 0.4160582481547417, + "step": 520 + }, + { + "loss": 0.44591546058654785, + "grad_norm": 0.01715761423110962, + "learning_rate": 5.7680000000000005e-06, + "entropy": 0.773575337145885, + "num_tokens": 35555395.0, + "logits/chosen": -1.5592401225110262, + "logits/rejected": -1.2181071316955396, + "mean_token_accuracy": 0.7086451490409672, + "rewards/chosen": -0.8721873250235512, + "rewards/rejected": -2.2501098511656163, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.377922523468733, + "logps/chosen": -58.998940489292146, + "logps/rejected": -75.27887318134307, + "epoch": 0.4240593683115636, + "step": 530 + }, + { + "loss": 0.4328285217285156, + "grad_norm": 0.02316458150744438, + "learning_rate": 5.6880000000000004e-06, + "entropy": 0.7934144282658235, + "num_tokens": 36228638.0, + "logits/chosen": -1.4998075336206127, + "logits/rejected": -1.2020413938133552, + "mean_token_accuracy": 0.7126592384837568, + "rewards/chosen": -0.8903547990875086, + "rewards/rejected": -2.427313156935852, + "rewards/accuracies": 0.8025, + "rewards/margins": 1.5369583551678807, + "logps/chosen": -60.6658417057991, + "logps/rejected": -78.67574594974518, + "epoch": 0.4320604884683856, + "step": 540 + }, + { + "loss": 0.4486415863037109, + "grad_norm": 0.022637424990534782, + "learning_rate": 5.608e-06, + "entropy": 0.7808621303540713, + "num_tokens": 36899036.0, + "logits/chosen": -1.5604184278130042, + "logits/rejected": -1.2256144527197506, + "mean_token_accuracy": 0.7166568437963724, + "rewards/chosen": -0.8569655304190382, + "rewards/rejected": -2.2920745618618095, + "rewards/accuracies": 0.80625, + "rewards/margins": 1.4351090330723673, + "logps/chosen": -58.39388742446899, + "logps/rejected": -76.57233754873276, + "epoch": 0.44006160862520755, + "step": 550 + }, + { + "loss": 0.43186440467834475, + "grad_norm": 0.015806999057531357, + "learning_rate": 5.528e-06, + "entropy": 0.829354452828411, + "num_tokens": 37567966.0, + "logits/chosen": -1.3967952813692375, + "logits/rejected": -1.1090892220325619, + "mean_token_accuracy": 0.6998139720410108, + "rewards/chosen": -0.7105526073317014, + "rewards/rejected": -2.0654750111402245, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.3549224025500006, + "logps/chosen": -57.93950361251831, + "logps/rejected": -72.99591649293899, + "epoch": 0.44806272878202946, + "step": 560 + }, + { + "loss": 0.43549156188964844, + "grad_norm": 0.021929794922471046, + "learning_rate": 5.448e-06, + "entropy": 0.8052812117640861, + "num_tokens": 38238610.0, + "logits/chosen": -1.4406510095404184, + "logits/rejected": -1.1625784526819891, + "mean_token_accuracy": 0.7065126617625356, + "rewards/chosen": -0.7944385814492125, + "rewards/rejected": -2.1914290168089794, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.396990433158353, + "logps/chosen": -59.14217608451843, + "logps/rejected": -75.0877578663826, + "epoch": 0.45606384893885143, + "step": 570 + }, + { + "loss": 0.4129189968109131, + "grad_norm": 0.01712222397327423, + "learning_rate": 5.368000000000001e-06, + "entropy": 0.8094228478927107, + "num_tokens": 38908212.0, + "logits/chosen": -1.407300765264523, + "logits/rejected": -1.0415596670678384, + "mean_token_accuracy": 0.7172896678000689, + "rewards/chosen": -0.7117314671058557, + "rewards/rejected": -2.1860597877670807, + "rewards/accuracies": 0.8175, + "rewards/margins": 1.4743283203756437, + "logps/chosen": -56.23722167730332, + "logps/rejected": -74.95896697044373, + "epoch": 0.4640649690956734, + "step": 580 + }, + { + "loss": 0.43604726791381837, + "grad_norm": 0.015477149747312069, + "learning_rate": 5.288000000000001e-06, + "entropy": 0.8548492413954227, + "num_tokens": 39579214.0, + "logits/chosen": -1.2922011359963301, + "logits/rejected": -0.9956562484834224, + "mean_token_accuracy": 0.7064971200935543, + "rewards/chosen": -0.7065712768954109, + "rewards/rejected": -2.107755633329507, + "rewards/accuracies": 0.82125, + "rewards/margins": 1.4011843568086624, + "logps/chosen": -59.846063117980954, + "logps/rejected": -74.58847686052323, + "epoch": 0.4720660892524953, + "step": 590 + }, + { + "loss": 0.4239354610443115, + "grad_norm": 0.02124476432800293, + "learning_rate": 5.208000000000001e-06, + "entropy": 0.824605501004844, + "num_tokens": 40251415.0, + "logits/chosen": -1.3701909734490212, + "logits/rejected": -0.9900921016783352, + "mean_token_accuracy": 0.7211226490046829, + "rewards/chosen": -0.7936599334669882, + "rewards/rejected": -2.3192991207691374, + "rewards/accuracies": 0.81625, + "rewards/margins": 1.5256391859147698, + "logps/chosen": -59.08933132648468, + "logps/rejected": -79.14344486474991, + "epoch": 0.4800672094093173, + "step": 600 + }, + { + "loss": 0.4354452133178711, + "grad_norm": 0.023743441328406334, + "learning_rate": 5.128000000000001e-06, + "entropy": 0.825452755644219, + "num_tokens": 40920910.0, + "logits/chosen": -1.390550910390904, + "logits/rejected": -1.0735959651479647, + "mean_token_accuracy": 0.713898301422596, + "rewards/chosen": -0.789569493080653, + "rewards/rejected": -2.1930771789352, + "rewards/accuracies": 0.815, + "rewards/margins": 1.403507683072239, + "logps/chosen": -58.420460934638974, + "logps/rejected": -74.17758195877076, + "epoch": 0.48806832956613927, + "step": 610 + }, + { + "loss": 0.4045247077941895, + "grad_norm": 0.01405557431280613, + "learning_rate": 5.048000000000001e-06, + "entropy": 0.8011420608652406, + "num_tokens": 41593142.0, + "logits/chosen": -1.3975533947414562, + "logits/rejected": -1.0831290848973116, + "mean_token_accuracy": 0.7130240154080093, + "rewards/chosen": -0.8486350445944845, + "rewards/rejected": -2.4122694664489246, + "rewards/accuracies": 0.83, + "rewards/margins": 1.5636344207916408, + "logps/chosen": -60.129820008277896, + "logps/rejected": -76.31982692241668, + "epoch": 0.49606944972296124, + "step": 620 + }, + { + "eval_loss": 0.38206014037132263, + "eval_runtime": 326.7329, + "eval_samples_per_second": 3.061, + "eval_steps_per_second": 3.061, + "eval_entropy": 0.8252472431890201, + "eval_num_tokens": 41930819.0, + "eval_logits/chosen": -1.36153454710921, + "eval_logits/rejected": -1.0058315979395118, + "eval_mean_token_accuracy": 0.7101194297969341, + "eval_rewards/chosen": -0.7108273756076232, + "eval_rewards/rejected": -2.305952288910863, + "eval_rewards/accuracies": 0.846, + "eval_rewards/margins": 1.5951249125674367, + "eval_logps/chosen": -57.47858674812317, + "eval_logps/rejected": -75.98066004753113, + "epoch": 0.5000700098013722, + "step": 625 + }, + { + "loss": 0.3930924654006958, + "grad_norm": 0.01451192144304514, + "learning_rate": 4.9680000000000005e-06, + "entropy": 0.8378929265070474, + "num_tokens": 42266772.0, + "logits/chosen": -1.315587886950433, + "logits/rejected": -1.0099089304924136, + "mean_token_accuracy": 0.7140151102561504, + "rewards/chosen": -0.7489332604239461, + "rewards/rejected": -2.328624072318198, + "rewards/accuracies": 0.815, + "rewards/margins": 1.5796908099856228, + "logps/chosen": -62.18757668733597, + "logps/rejected": -77.6511843419075, + "epoch": 0.5040705698797832, + "step": 630 + }, + { + "loss": 0.44039368629455566, + "grad_norm": 0.017432237043976784, + "learning_rate": 4.8880000000000005e-06, + "entropy": 0.8770715677752742, + "num_tokens": 42938338.0, + "logits/chosen": -1.3235264756797693, + "logits/rejected": -0.9964174353869055, + "mean_token_accuracy": 0.7056646738946438, + "rewards/chosen": -0.6992467068618862, + "rewards/rejected": -2.0929239434680857, + "rewards/accuracies": 0.8025, + "rewards/margins": 1.3936772356089204, + "logps/chosen": -59.22969470500946, + "logps/rejected": -76.437605779171, + "epoch": 0.5120716900366051, + "step": 640 + }, + { + "loss": 0.4005030632019043, + "grad_norm": 0.016337474808096886, + "learning_rate": 4.808e-06, + "entropy": 0.8228744911667308, + "num_tokens": 43607368.0, + "logits/chosen": -1.365069605441217, + "logits/rejected": -1.040179422743084, + "mean_token_accuracy": 0.7150637634471059, + "rewards/chosen": -0.6480746366505628, + "rewards/rejected": -2.150714794436935, + "rewards/accuracies": 0.835, + "rewards/margins": 1.5026401576166972, + "logps/chosen": -56.05587344884872, + "logps/rejected": -73.34227110147476, + "epoch": 0.5200728101934271, + "step": 650 + }, + { + "loss": 0.4082051753997803, + "grad_norm": 0.018142661079764366, + "learning_rate": 4.728e-06, + "entropy": 0.8530499871546635, + "num_tokens": 44278185.0, + "logits/chosen": -1.3381476572038138, + "logits/rejected": -0.9844825739754265, + "mean_token_accuracy": 0.711031482918188, + "rewards/chosen": -0.7167994258418912, + "rewards/rejected": -2.222132046652259, + "rewards/accuracies": 0.8325, + "rewards/margins": 1.5053326183510944, + "logps/chosen": -58.75081548690796, + "logps/rejected": -74.44041372299195, + "epoch": 0.5280739303502491, + "step": 660 + }, + { + "loss": 0.4182604789733887, + "grad_norm": 0.020815948024392128, + "learning_rate": 4.648e-06, + "entropy": 0.8168351130496012, + "num_tokens": 44950052.0, + "logits/chosen": -1.4143566707732802, + "logits/rejected": -1.0639793929044592, + "mean_token_accuracy": 0.7124683810770511, + "rewards/chosen": -0.7617488951507266, + "rewards/rejected": -2.276013866282883, + "rewards/accuracies": 0.81375, + "rewards/margins": 1.5142649730667472, + "logps/chosen": -56.72195715665817, + "logps/rejected": -77.04312695026398, + "epoch": 0.5360750505070709, + "step": 670 + }, + { + "loss": 0.4252179145812988, + "grad_norm": 0.020110271871089935, + "learning_rate": 4.568e-06, + "entropy": 0.8308680512331194, + "num_tokens": 45623022.0, + "logits/chosen": -1.3950534629812166, + "logits/rejected": -1.0998214083286344, + "mean_token_accuracy": 0.7056502989120781, + "rewards/chosen": -0.8144988723962023, + "rewards/rejected": -2.389123064740561, + "rewards/accuracies": 0.80875, + "rewards/margins": 1.5746241921419277, + "logps/chosen": -60.53876167535782, + "logps/rejected": -78.16164077043533, + "epoch": 0.5440761706638929, + "step": 680 + }, + { + "loss": 0.45481224060058595, + "grad_norm": 0.01787034422159195, + "learning_rate": 4.488e-06, + "entropy": 0.8564485525735654, + "num_tokens": 46293504.0, + "logits/chosen": -1.3725143150009782, + "logits/rejected": -1.0610108838467847, + "mean_token_accuracy": 0.7121961736120284, + "rewards/chosen": -0.7007349021799746, + "rewards/rejected": -2.1405522361784826, + "rewards/accuracies": 0.80875, + "rewards/margins": 1.4398173329560087, + "logps/chosen": -58.63401502370834, + "logps/rejected": -75.10802860021592, + "epoch": 0.5520772908207149, + "step": 690 + }, + { + "loss": 0.4242884635925293, + "grad_norm": 0.019236121326684952, + "learning_rate": 4.408000000000001e-06, + "entropy": 0.8544818184821633, + "num_tokens": 46964981.0, + "logits/chosen": -1.349378895644786, + "logits/rejected": -1.0686512966747685, + "mean_token_accuracy": 0.7098362519778312, + "rewards/chosen": -0.6842107876761293, + "rewards/rejected": -2.1552941927440408, + "rewards/accuracies": 0.82125, + "rewards/margins": 1.4710834045434604, + "logps/chosen": -58.09884097576141, + "logps/rejected": -74.92867855072022, + "epoch": 0.5600784109775369, + "step": 700 + }, + { + "loss": 0.4102015018463135, + "grad_norm": 0.02260979637503624, + "learning_rate": 4.328000000000001e-06, + "entropy": 0.8242619492893573, + "num_tokens": 47635031.0, + "logits/chosen": -1.4417073731696255, + "logits/rejected": -1.15610772613027, + "mean_token_accuracy": 0.711150385774672, + "rewards/chosen": -0.6375206779901055, + "rewards/rejected": -2.1217567729702567, + "rewards/accuracies": 0.81625, + "rewards/margins": 1.484236096283421, + "logps/chosen": -58.721065254211425, + "logps/rejected": -73.21105932235717, + "epoch": 0.5680795311343588, + "step": 710 + }, + { + "loss": 0.4387828826904297, + "grad_norm": 0.02488075941801071, + "learning_rate": 4.248000000000001e-06, + "entropy": 0.7898647125309799, + "num_tokens": 48305521.0, + "logits/chosen": -1.535454146525396, + "logits/rejected": -1.1988366438783475, + "mean_token_accuracy": 0.7144390594959259, + "rewards/chosen": -0.6357523593801306, + "rewards/rejected": -2.0578468732352486, + "rewards/accuracies": 0.8, + "rewards/margins": 1.4220945093501358, + "logps/chosen": -54.41331891536713, + "logps/rejected": -75.98147065877914, + "epoch": 0.5760806512911808, + "step": 720 + }, + { + "loss": 0.39289658069610595, + "grad_norm": 0.015159406699240208, + "learning_rate": 4.168000000000001e-06, + "entropy": 0.8010593402700033, + "num_tokens": 48976282.0, + "logits/chosen": -1.55113046097786, + "logits/rejected": -1.2506834203141584, + "mean_token_accuracy": 0.7138257564418018, + "rewards/chosen": -0.5929771073686425, + "rewards/rejected": -2.1302011678872077, + "rewards/accuracies": 0.83375, + "rewards/margins": 1.5372240616590716, + "logps/chosen": -56.13849130153656, + "logps/rejected": -73.13589999198913, + "epoch": 0.5840817714480028, + "step": 730 + }, + { + "loss": 0.41160149574279786, + "grad_norm": 0.01860692724585533, + "learning_rate": 4.0880000000000005e-06, + "entropy": 0.7805629429890542, + "num_tokens": 49648195.0, + "logits/chosen": -1.6207133992642588, + "logits/rejected": -1.2987192623027932, + "mean_token_accuracy": 0.7162860633060336, + "rewards/chosen": -0.7419188594727893, + "rewards/rejected": -2.275629919102648, + "rewards/accuracies": 0.825, + "rewards/margins": 1.5337110587162897, + "logps/chosen": -58.221080236434936, + "logps/rejected": -76.93056843519211, + "epoch": 0.5920828916048246, + "step": 740 + }, + { + "loss": 0.4270487785339355, + "grad_norm": 0.016421068459749222, + "learning_rate": 4.008e-06, + "entropy": 0.8073938890940917, + "num_tokens": 50318801.0, + "logits/chosen": -1.5882363637098387, + "logits/rejected": -1.247667502316742, + "mean_token_accuracy": 0.7069075590185822, + "rewards/chosen": -0.8003950071084546, + "rewards/rejected": -2.452392807676806, + "rewards/accuracies": 0.825, + "rewards/margins": 1.651997799584642, + "logps/chosen": -59.83541061878204, + "logps/rejected": -78.04929527282715, + "epoch": 0.6000840117616466, + "step": 750 + }, + { + "eval_loss": 0.3747462034225464, + "eval_runtime": 359.9421, + "eval_samples_per_second": 2.778, + "eval_steps_per_second": 2.778, + "eval_entropy": 0.7970051126877079, + "eval_num_tokens": 50318801.0, + "eval_logits/chosen": -1.6053054796594703, + "eval_logits/rejected": -1.247482501886518, + "eval_mean_token_accuracy": 0.7094336547851563, + "eval_rewards/chosen": -0.7686092760775937, + "eval_rewards/rejected": -2.5153538503656163, + "eval_rewards/accuracies": 0.841, + "eval_rewards/margins": 1.7467445721179247, + "eval_logps/chosen": -58.05640573692322, + "eval_logps/rejected": -78.07467563819885, + "epoch": 0.6000840117616466, + "step": 750 + }, + { + "loss": 0.4169970989227295, + "grad_norm": 0.03688720986247063, + "learning_rate": 3.928e-06, + "entropy": 0.7846462618000806, + "num_tokens": 50989250.0, + "logits/chosen": -1.6120100895242033, + "logits/rejected": -1.2415178312508848, + "mean_token_accuracy": 0.7159298903495074, + "rewards/chosen": -0.839654815679096, + "rewards/rejected": -2.502948221999686, + "rewards/accuracies": 0.815, + "rewards/margins": 1.6632934046909214, + "logps/chosen": -56.75322003364563, + "logps/rejected": -78.04070549488068, + "epoch": 0.6080851319184686, + "step": 760 + }, + { + "loss": 0.4282489776611328, + "grad_norm": 0.017638148739933968, + "learning_rate": 3.848e-06, + "entropy": 0.798651073614019, + "num_tokens": 51660938.0, + "logits/chosen": -1.5328797896282882, + "logits/rejected": -1.2321443010934947, + "mean_token_accuracy": 0.7048248733580113, + "rewards/chosen": -0.8160745739022969, + "rewards/rejected": -2.404342279869743, + "rewards/accuracies": 0.82625, + "rewards/margins": 1.5882677041646094, + "logps/chosen": -59.79865051269531, + "logps/rejected": -77.78480454921723, + "epoch": 0.6160862520752906, + "step": 770 + }, + { + "loss": 0.4250539779663086, + "grad_norm": 0.01926429010927677, + "learning_rate": 3.7680000000000006e-06, + "entropy": 0.8206474994809833, + "num_tokens": 52332511.0, + "logits/chosen": -1.5045491055990166, + "logits/rejected": -1.1643194357904556, + "mean_token_accuracy": 0.7142482680641115, + "rewards/chosen": -0.7649500152390101, + "rewards/rejected": -2.319859855013201, + "rewards/accuracies": 0.8125, + "rewards/margins": 1.5549098403338575, + "logps/chosen": -60.40905921697617, + "logps/rejected": -77.19861435890198, + "epoch": 0.6240873722321125, + "step": 780 + }, + { + "loss": 0.42780022621154784, + "grad_norm": 0.01716187596321106, + "learning_rate": 3.6880000000000005e-06, + "entropy": 0.7971815115597565, + "num_tokens": 53000638.0, + "logits/chosen": -1.585354376363884, + "logits/rejected": -1.2273074579325267, + "mean_token_accuracy": 0.707803654409945, + "rewards/chosen": -0.7402846401413262, + "rewards/rejected": -2.2537980271608102, + "rewards/accuracies": 0.815, + "rewards/margins": 1.5135133841168136, + "logps/chosen": -56.16835569143295, + "logps/rejected": -75.9030461883545, + "epoch": 0.6320884923889345, + "step": 790 + }, + { + "loss": 0.439426851272583, + "grad_norm": 0.021782318130135536, + "learning_rate": 3.6080000000000004e-06, + "entropy": 0.8156255233831325, + "num_tokens": 53671873.0, + "logits/chosen": -1.5731947810052915, + "logits/rejected": -1.2208077437038316, + "mean_token_accuracy": 0.7152832678332924, + "rewards/chosen": -0.7687084915324521, + "rewards/rejected": -2.2547003319143553, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.4859918395150453, + "logps/chosen": -58.14893871307373, + "logps/rejected": -78.18987871646881, + "epoch": 0.6400896125457564, + "step": 800 + }, + { + "loss": 0.420841646194458, + "grad_norm": 0.025692911818623543, + "learning_rate": 3.5280000000000004e-06, + "entropy": 0.821183467732335, + "num_tokens": 54343089.0, + "logits/chosen": -1.5207735061927403, + "logits/rejected": -1.2057331729540248, + "mean_token_accuracy": 0.7104452795907855, + "rewards/chosen": -0.780645934283275, + "rewards/rejected": -2.3124329587374812, + "rewards/accuracies": 0.8075, + "rewards/margins": 1.531787025486119, + "logps/chosen": -60.014517648220064, + "logps/rejected": -78.12048140048981, + "epoch": 0.6480907327025783, + "step": 810 + }, + { + "loss": 0.4105512619018555, + "grad_norm": 0.01884465478360653, + "learning_rate": 3.4480000000000003e-06, + "entropy": 0.8063031704328023, + "num_tokens": 55014978.0, + "logits/chosen": -1.547767386796032, + "logits/rejected": -1.1820112378623413, + "mean_token_accuracy": 0.7089173524640501, + "rewards/chosen": -0.7608894053113181, + "rewards/rejected": -2.441992430248065, + "rewards/accuracies": 0.8325, + "rewards/margins": 1.6811030247248708, + "logps/chosen": -60.38896199703217, + "logps/rejected": -78.01072539567947, + "epoch": 0.6560918528594003, + "step": 820 + }, + { + "loss": 0.4294763088226318, + "grad_norm": 0.019730493426322937, + "learning_rate": 3.368e-06, + "entropy": 0.8684769855998457, + "num_tokens": 55689151.0, + "logits/chosen": -1.3910758939427397, + "logits/rejected": -1.1155818673408202, + "mean_token_accuracy": 0.7053723630867899, + "rewards/chosen": -0.7968793028977234, + "rewards/rejected": -2.375062556483317, + "rewards/accuracies": 0.825, + "rewards/margins": 1.5781832543481142, + "logps/chosen": -63.42195160150528, + "logps/rejected": -80.02929930448532, + "epoch": 0.6640929730162223, + "step": 830 + }, + { + "loss": 0.4067112445831299, + "grad_norm": 0.015371326357126236, + "learning_rate": 3.288e-06, + "entropy": 0.8669515595107805, + "num_tokens": 56361294.0, + "logits/chosen": -1.4120339153963328, + "logits/rejected": -1.0943624791595064, + "mean_token_accuracy": 0.7072863762266934, + "rewards/chosen": -0.7408881269737049, + "rewards/rejected": -2.295605608313781, + "rewards/accuracies": 0.805, + "rewards/margins": 1.5547174850385637, + "logps/chosen": -60.02739023685455, + "logps/rejected": -77.22145056962967, + "epoch": 0.6720940931730442, + "step": 840 + }, + { + "loss": 0.4195101261138916, + "grad_norm": 0.017242170870304108, + "learning_rate": 3.208e-06, + "entropy": 0.8097485016728752, + "num_tokens": 57030353.0, + "logits/chosen": -1.5199316608931759, + "logits/rejected": -1.1795340725304932, + "mean_token_accuracy": 0.7123510077036918, + "rewards/chosen": -0.7133299406401784, + "rewards/rejected": -2.192705774551141, + "rewards/accuracies": 0.82625, + "rewards/margins": 1.4793758322671056, + "logps/chosen": -55.20628922462463, + "logps/rejected": -73.9845145535469, + "epoch": 0.6800952133298662, + "step": 850 + }, + { + "loss": 0.4102588176727295, + "grad_norm": 0.01566699519753456, + "learning_rate": 3.1280000000000004e-06, + "entropy": 0.8263511486476637, + "num_tokens": 57700689.0, + "logits/chosen": -1.4269044114958789, + "logits/rejected": -1.1771139106072332, + "mean_token_accuracy": 0.7052110943943262, + "rewards/chosen": -0.6530551976517165, + "rewards/rejected": -2.1147736522718334, + "rewards/accuracies": 0.8125, + "rewards/margins": 1.461718455082737, + "logps/chosen": -61.08844540596008, + "logps/rejected": -72.37894055843353, + "epoch": 0.6880963334866881, + "step": 860 + }, + { + "loss": 0.42830562591552734, + "grad_norm": 0.02185574173927307, + "learning_rate": 3.0480000000000003e-06, + "entropy": 0.8228394509857754, + "num_tokens": 58371582.0, + "logits/chosen": -1.4636678357654866, + "logits/rejected": -1.117573851293101, + "mean_token_accuracy": 0.7181230850890279, + "rewards/chosen": -0.7092919610657191, + "rewards/rejected": -2.242413058922393, + "rewards/accuracies": 0.82625, + "rewards/margins": 1.5331210961006583, + "logps/chosen": -57.20385055541992, + "logps/rejected": -76.02769055843353, + "epoch": 0.6960974536435101, + "step": 870 + }, + { + "eval_loss": 0.3759123682975769, + "eval_runtime": 399.2571, + "eval_samples_per_second": 2.505, + "eval_steps_per_second": 2.505, + "eval_entropy": 0.8344861168425995, + "eval_num_tokens": 58705924.0, + "eval_logits/chosen": -1.4575140190597924, + "eval_logits/rejected": -1.1039781761695373, + "eval_mean_token_accuracy": 0.711262987613678, + "eval_rewards/chosen": -0.6297580211221648, + "eval_rewards/rejected": -2.276288676444092, + "eval_rewards/accuracies": 0.842, + "eval_rewards/margins": 1.6465306548774243, + "eval_logps/chosen": -56.667893226623534, + "eval_logps/rejected": -75.6840239276886, + "epoch": 0.700098013721921, + "step": 875 + }, + { + "loss": 0.4234786510467529, + "grad_norm": 0.02065058797597885, + "learning_rate": 2.9680000000000002e-06, + "entropy": 0.8277974076462852, + "num_tokens": 59040465.0, + "logits/chosen": -1.5135564880748953, + "logits/rejected": -1.1432497618107653, + "mean_token_accuracy": 0.7117055612802505, + "rewards/chosen": -0.696259319268429, + "rewards/rejected": -2.2431890765414573, + "rewards/accuracies": 0.8075, + "rewards/margins": 1.5469297548476606, + "logps/chosen": -55.49664348840714, + "logps/rejected": -77.08198328495025, + "epoch": 0.704098573800332, + "step": 880 + }, + { + "loss": 0.4353479862213135, + "grad_norm": 0.02186797559261322, + "learning_rate": 2.888e-06, + "entropy": 0.8144791065354365, + "num_tokens": 59710660.0, + "logits/chosen": -1.4794269513186382, + "logits/rejected": -1.1591747705292565, + "mean_token_accuracy": 0.7170553574152291, + "rewards/chosen": -0.7273707000938157, + "rewards/rejected": -2.210361190639669, + "rewards/accuracies": 0.80125, + "rewards/margins": 1.4829904899653048, + "logps/chosen": -56.91487885832787, + "logps/rejected": -74.57020094871521, + "epoch": 0.712099693957154, + "step": 890 + }, + { + "loss": 0.43715639114379884, + "grad_norm": 0.020525585860013962, + "learning_rate": 2.808e-06, + "entropy": 0.8120913207791455, + "num_tokens": 60381052.0, + "logits/chosen": -1.4459924833017133, + "logits/rejected": -1.1256531892985777, + "mean_token_accuracy": 0.7126112458109856, + "rewards/chosen": -0.6970637990878459, + "rewards/rejected": -2.1881442813354077, + "rewards/accuracies": 0.8025, + "rewards/margins": 1.4910804780339821, + "logps/chosen": -56.196629449129105, + "logps/rejected": -74.68293124079705, + "epoch": 0.720100814113976, + "step": 900 + }, + { + "loss": 0.4009076118469238, + "grad_norm": 0.0200913455337286, + "learning_rate": 2.728e-06, + "entropy": 0.820758284192998, + "num_tokens": 61049450.0, + "logits/chosen": -1.468269785823377, + "logits/rejected": -1.1344321171992913, + "mean_token_accuracy": 0.7174195778183639, + "rewards/chosen": -0.709326482572651, + "rewards/rejected": -2.28662730479904, + "rewards/accuracies": 0.81875, + "rewards/margins": 1.5773008212819695, + "logps/chosen": -56.747891561985014, + "logps/rejected": -73.50010628700257, + "epoch": 0.728101934270798, + "step": 910 + }, + { + "loss": 0.4346621513366699, + "grad_norm": 0.01706886664032936, + "learning_rate": 2.648e-06, + "entropy": 0.8205121580697596, + "num_tokens": 61718430.0, + "logits/chosen": -1.4375778086851516, + "logits/rejected": -1.161296226506176, + "mean_token_accuracy": 0.7136667492613197, + "rewards/chosen": -0.7132218919423212, + "rewards/rejected": -2.13055392677139, + "rewards/accuracies": 0.80125, + "rewards/margins": 1.4173320323741063, + "logps/chosen": -57.20179939746857, + "logps/rejected": -72.76975549459458, + "epoch": 0.7361030544276199, + "step": 920 + }, + { + "loss": 0.3956768035888672, + "grad_norm": 0.01797674037516117, + "learning_rate": 2.568e-06, + "entropy": 0.8012085157257388, + "num_tokens": 62389582.0, + "logits/chosen": -1.532120015247838, + "logits/rejected": -1.208119469186731, + "mean_token_accuracy": 0.7055639943294227, + "rewards/chosen": -0.7599997415716644, + "rewards/rejected": -2.4362060464013484, + "rewards/accuracies": 0.825, + "rewards/margins": 1.6762063066801056, + "logps/chosen": -57.179485994577405, + "logps/rejected": -79.18268291473389, + "epoch": 0.7441041745844418, + "step": 930 + }, + { + "loss": 0.4311192035675049, + "grad_norm": 0.017888743430376053, + "learning_rate": 2.488e-06, + "entropy": 0.7985861063818447, + "num_tokens": 63059623.0, + "logits/chosen": -1.558568974228593, + "logits/rejected": -1.2086813305598347, + "mean_token_accuracy": 0.7144212306663394, + "rewards/chosen": -0.7640767650106136, + "rewards/rejected": -2.2844264058230874, + "rewards/accuracies": 0.8075, + "rewards/margins": 1.5203496412816457, + "logps/chosen": -56.44099218845368, + "logps/rejected": -74.95756293773651, + "epoch": 0.7521052947412638, + "step": 940 + }, + { + "loss": 0.44293651580810545, + "grad_norm": 0.024403788149356842, + "learning_rate": 2.408e-06, + "entropy": 0.8035592026286759, + "num_tokens": 63729323.0, + "logits/chosen": -1.5457893383254793, + "logits/rejected": -1.196683114693986, + "mean_token_accuracy": 0.7051368881203234, + "rewards/chosen": -0.8423608328169212, + "rewards/rejected": -2.2869279081953935, + "rewards/accuracies": 0.8125, + "rewards/margins": 1.4445670791901648, + "logps/chosen": -58.55195621013641, + "logps/rejected": -75.49890763282775, + "epoch": 0.7601064148980857, + "step": 950 + }, + { + "loss": 0.4008366107940674, + "grad_norm": 0.01861320622265339, + "learning_rate": 2.3280000000000004e-06, + "entropy": 0.7981485390500166, + "num_tokens": 64401251.0, + "logits/chosen": -1.5139035842305524, + "logits/rejected": -1.1744702669983618, + "mean_token_accuracy": 0.7120618709363044, + "rewards/chosen": -0.7763427560425771, + "rewards/rejected": -2.4696535951615077, + "rewards/accuracies": 0.84, + "rewards/margins": 1.6933108403813093, + "logps/chosen": -58.61193150997162, + "logps/rejected": -78.02690306186676, + "epoch": 0.7681075350549077, + "step": 960 + }, + { + "loss": 0.4489262104034424, + "grad_norm": 0.015494938008487225, + "learning_rate": 2.2480000000000003e-06, + "entropy": 0.8330775782934506, + "num_tokens": 65071349.0, + "logits/chosen": -1.4378532668123365, + "logits/rejected": -1.1536408081373142, + "mean_token_accuracy": 0.7020319653488696, + "rewards/chosen": -0.7739227567915805, + "rewards/rejected": -2.280776680170675, + "rewards/accuracies": 0.81375, + "rewards/margins": 1.5068539200443773, + "logps/chosen": -59.13198090314865, + "logps/rejected": -74.87351196527482, + "epoch": 0.7761086552117297, + "step": 970 + }, + { + "loss": 0.42146644592285154, + "grad_norm": 0.01722661592066288, + "learning_rate": 2.1680000000000002e-06, + "entropy": 0.83052067089302, + "num_tokens": 65743620.0, + "logits/chosen": -1.4442045437350117, + "logits/rejected": -1.1513308155926538, + "mean_token_accuracy": 0.7084798959642649, + "rewards/chosen": -0.7037231323859305, + "rewards/rejected": -2.252449466900289, + "rewards/accuracies": 0.82125, + "rewards/margins": 1.5487263337243349, + "logps/chosen": -60.383059858083726, + "logps/rejected": -76.19223057866097, + "epoch": 0.7841097753685516, + "step": 980 + }, + { + "loss": 0.4122499942779541, + "grad_norm": 0.019420692697167397, + "learning_rate": 2.088e-06, + "entropy": 0.8109630790716619, + "num_tokens": 66413395.0, + "logits/chosen": -1.541120669321979, + "logits/rejected": -1.2107965185782945, + "mean_token_accuracy": 0.7163080858811736, + "rewards/chosen": -0.7509561662202031, + "rewards/rejected": -2.339945316381636, + "rewards/accuracies": 0.815, + "rewards/margins": 1.5889891442121007, + "logps/chosen": -57.66542109251022, + "logps/rejected": -76.55372718334198, + "epoch": 0.7921108955253735, + "step": 990 + }, + { + "loss": 0.4178761005401611, + "grad_norm": 0.020704196766018867, + "learning_rate": 2.008e-06, + "entropy": 0.816696729575342, + "num_tokens": 67084018.0, + "logits/chosen": -1.4885645002637296, + "logits/rejected": -1.1673584722357746, + "mean_token_accuracy": 0.7150707822386175, + "rewards/chosen": -0.741308625468664, + "rewards/rejected": -2.406399813084354, + "rewards/accuracies": 0.825, + "rewards/margins": 1.6650911844847724, + "logps/chosen": -57.74228939056397, + "logps/rejected": -77.05882190465927, + "epoch": 0.8001120156821955, + "step": 1000 + }, + { + "eval_loss": 0.37232494354248047, + "eval_runtime": 431.9338, + "eval_samples_per_second": 2.315, + "eval_steps_per_second": 2.315, + "eval_entropy": 0.816042770717293, + "eval_num_tokens": 67084018.0, + "eval_logits/chosen": -1.533623475146162, + "eval_logits/rejected": -1.1799501516011692, + "eval_mean_token_accuracy": 0.7080534865856171, + "eval_rewards/chosen": -0.6996203318120678, + "eval_rewards/rejected": -2.440506931256736, + "eval_rewards/accuracies": 0.842, + "eval_rewards/margins": 1.7408866018354894, + "eval_logps/chosen": -57.36651630592346, + "eval_logps/rejected": -77.32620645523072, + "epoch": 0.8001120156821955, + "step": 1000 + }, + { + "loss": 0.37767949104309084, + "grad_norm": 0.02488139644265175, + "learning_rate": 1.928e-06, + "entropy": 0.834057361006926, + "num_tokens": 67756375.0, + "logits/chosen": -1.4910327476329437, + "logits/rejected": -1.1754918204218958, + "mean_token_accuracy": 0.7165563557669521, + "rewards/chosen": -0.74927385541072, + "rewards/rejected": -2.466023100640159, + "rewards/accuracies": 0.83875, + "rewards/margins": 1.716749248035485, + "logps/chosen": -59.18668337464332, + "logps/rejected": -79.89627618789673, + "epoch": 0.8081131358390174, + "step": 1010 + }, + { + "loss": 0.4235543251037598, + "grad_norm": 0.02607184834778309, + "learning_rate": 1.8480000000000001e-06, + "entropy": 0.7991531542147277, + "num_tokens": 68426131.0, + "logits/chosen": -1.53151378613551, + "logits/rejected": -1.2543500149118787, + "mean_token_accuracy": 0.7038963638059795, + "rewards/chosen": -0.7901757431415899, + "rewards/rejected": -2.433681526587461, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.6435057808365672, + "logps/chosen": -58.34346651315689, + "logps/rejected": -76.04588947534562, + "epoch": 0.8161142559958394, + "step": 1020 + }, + { + "loss": 0.40994958877563475, + "grad_norm": 0.02169707603752613, + "learning_rate": 1.7680000000000003e-06, + "entropy": 0.8521039391926024, + "num_tokens": 69096137.0, + "logits/chosen": -1.415748264102772, + "logits/rejected": -1.1016163433476274, + "mean_token_accuracy": 0.6977022993937134, + "rewards/chosen": -0.7218073151416684, + "rewards/rejected": -2.3258816314843718, + "rewards/accuracies": 0.8225, + "rewards/margins": 1.6040743189398199, + "logps/chosen": -59.84083811759949, + "logps/rejected": -75.67940702915192, + "epoch": 0.8241153761526614, + "step": 1030 + }, + { + "loss": 0.4198129177093506, + "grad_norm": 0.026502352207899094, + "learning_rate": 1.6880000000000002e-06, + "entropy": 0.8326882326963824, + "num_tokens": 69767741.0, + "logits/chosen": -1.4916627174188057, + "logits/rejected": -1.1632308065666426, + "mean_token_accuracy": 0.7085826633311808, + "rewards/chosen": -0.7927563856748747, + "rewards/rejected": -2.4268036293244224, + "rewards/accuracies": 0.815, + "rewards/margins": 1.6340472471993417, + "logps/chosen": -60.4176405954361, + "logps/rejected": -78.03718240499497, + "epoch": 0.8321164963094834, + "step": 1040 + }, + { + "loss": 0.4403986930847168, + "grad_norm": 0.020527468994259834, + "learning_rate": 1.608e-06, + "entropy": 0.8563040402246407, + "num_tokens": 70441281.0, + "logits/chosen": -1.372570142753147, + "logits/rejected": -1.0752142516375143, + "mean_token_accuracy": 0.7006468511372804, + "rewards/chosen": -0.8503002758337243, + "rewards/rejected": -2.4302191760434653, + "rewards/accuracies": 0.79875, + "rewards/margins": 1.5799189011985435, + "logps/chosen": -61.7722567152977, + "logps/rejected": -80.11385835170746, + "epoch": 0.8401176164663052, + "step": 1050 + }, + { + "loss": 0.43283534049987793, + "grad_norm": 0.015235912054777145, + "learning_rate": 1.528e-06, + "entropy": 0.7852728144929279, + "num_tokens": 71110390.0, + "logits/chosen": -1.4950714916636278, + "logits/rejected": -1.1911925690553107, + "mean_token_accuracy": 0.7106820711679757, + "rewards/chosen": -0.8049419036525068, + "rewards/rejected": -2.4248900110144316, + "rewards/accuracies": 0.7975, + "rewards/margins": 1.6199481027945877, + "logps/chosen": -57.78098263502121, + "logps/rejected": -74.53830781698227, + "epoch": 0.8481187366231272, + "step": 1060 + }, + { + "loss": 0.43035149574279785, + "grad_norm": 0.019019614905118942, + "learning_rate": 1.4480000000000002e-06, + "entropy": 0.8613008195675502, + "num_tokens": 71784543.0, + "logits/chosen": -1.3445209097630133, + "logits/rejected": -1.0426056675988673, + "mean_token_accuracy": 0.7076550057157874, + "rewards/chosen": -0.8018456945472281, + "rewards/rejected": -2.346686116975907, + "rewards/accuracies": 0.8075, + "rewards/margins": 1.5448404226545245, + "logps/chosen": -61.45916315793991, + "logps/rejected": -79.62759203910828, + "epoch": 0.8561198567799492, + "step": 1070 + }, + { + "loss": 0.41099891662597654, + "grad_norm": 0.016506865620613098, + "learning_rate": 1.368e-06, + "entropy": 0.8535030201455811, + "num_tokens": 72456138.0, + "logits/chosen": -1.3566193304510508, + "logits/rejected": -1.0452022279083852, + "mean_token_accuracy": 0.7095106438919901, + "rewards/chosen": -0.7196678565689945, + "rewards/rejected": -2.2712431223198655, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.5515752672031522, + "logps/chosen": -59.758289806842804, + "logps/rejected": -75.89903884649277, + "epoch": 0.8641209769367711, + "step": 1080 + }, + { + "loss": 0.40389509201049806, + "grad_norm": 0.017898013815283775, + "learning_rate": 1.288e-06, + "entropy": 0.8495773486199323, + "num_tokens": 73127658.0, + "logits/chosen": -1.3875953147732851, + "logits/rejected": -1.071999496568926, + "mean_token_accuracy": 0.7125035657919944, + "rewards/chosen": -0.6880159555127102, + "rewards/rejected": -2.2900046212004965, + "rewards/accuracies": 0.8275, + "rewards/margins": 1.6019886623835191, + "logps/chosen": -57.14114458799362, + "logps/rejected": -76.71981400489807, + "epoch": 0.8721220970935931, + "step": 1090 + }, + { + "loss": 0.41137285232543946, + "grad_norm": 0.02073514461517334, + "learning_rate": 1.2080000000000001e-06, + "entropy": 0.8456397303473204, + "num_tokens": 73801143.0, + "logits/chosen": -1.3381752214246538, + "logits/rejected": -1.0179612502984496, + "mean_token_accuracy": 0.7174369205720723, + "rewards/chosen": -0.7226426570682087, + "rewards/rejected": -2.3872625685081585, + "rewards/accuracies": 0.805, + "rewards/margins": 1.6646199140977114, + "logps/chosen": -58.33309064865112, + "logps/rejected": -78.428830742836, + "epoch": 0.8801232172504151, + "step": 1100 + }, + { + "loss": 0.3985079050064087, + "grad_norm": 0.02392728626728058, + "learning_rate": 1.128e-06, + "entropy": 0.8126404450691189, + "num_tokens": 74470337.0, + "logits/chosen": -1.4301342412115163, + "logits/rejected": -1.0898322773092897, + "mean_token_accuracy": 0.7102809575386345, + "rewards/chosen": -0.72720633818215, + "rewards/rejected": -2.3956915115077573, + "rewards/accuracies": 0.81875, + "rewards/margins": 1.6684851680183783, + "logps/chosen": -58.585094909667966, + "logps/rejected": -75.48162739038467, + "epoch": 0.8881243374072371, + "step": 1110 + }, + { + "loss": 0.4233971118927002, + "grad_norm": 0.030219033360481262, + "learning_rate": 1.0480000000000002e-06, + "entropy": 0.8403116905188653, + "num_tokens": 75140132.0, + "logits/chosen": -1.4380602392142443, + "logits/rejected": -1.0473352436693573, + "mean_token_accuracy": 0.7092700024694204, + "rewards/chosen": -0.7306968126030552, + "rewards/rejected": -2.3540891151165124, + "rewards/accuracies": 0.81875, + "rewards/margins": 1.6233923038374634, + "logps/chosen": -56.10472262263298, + "logps/rejected": -78.65561183929444, + "epoch": 0.8961254575640589, + "step": 1120 + }, + { + "eval_loss": 0.37198907136917114, + "eval_runtime": 461.3493, + "eval_samples_per_second": 2.168, + "eval_steps_per_second": 2.168, + "eval_entropy": 0.8254555847709999, + "eval_num_tokens": 75477459.0, + "eval_logits/chosen": -1.4423002773926261, + "eval_logits/rejected": -1.08621697552761, + "eval_mean_token_accuracy": 0.7080234110057354, + "eval_rewards/chosen": -0.688676969906548, + "eval_rewards/rejected": -2.4224348444156347, + "eval_rewards/accuracies": 0.848, + "eval_rewards/margins": 1.7337578756753356, + "eval_logps/chosen": -57.25708269691467, + "eval_logps/rejected": -77.14548556137085, + "epoch": 0.9001260176424699, + "step": 1125 + }, + { + "loss": 0.3935527324676514, + "grad_norm": 0.022325722500681877, + "learning_rate": 9.68e-07, + "entropy": 0.8382952943560668, + "num_tokens": 75812014.0, + "logits/chosen": -1.418837708765449, + "logits/rejected": -1.0779699632670043, + "mean_token_accuracy": 0.7202487983740866, + "rewards/chosen": -0.7877505103487056, + "rewards/rejected": -2.4676480230064772, + "rewards/accuracies": 0.8275, + "rewards/margins": 1.679897514770273, + "logps/chosen": -58.169000940322874, + "logps/rejected": -78.61564015626908, + "epoch": 0.9041265777208809, + "step": 1130 + }, + { + "loss": 0.3964625597000122, + "grad_norm": 0.019324010238051414, + "learning_rate": 8.880000000000001e-07, + "entropy": 0.8130056881319615, + "num_tokens": 76482016.0, + "logits/chosen": -1.419070527008814, + "logits/rejected": -1.137954775488449, + "mean_token_accuracy": 0.7059694546088576, + "rewards/chosen": -0.7633834109694726, + "rewards/rejected": -2.414881606222825, + "rewards/accuracies": 0.82875, + "rewards/margins": 1.651498195346794, + "logps/chosen": -58.853646819591525, + "logps/rejected": -76.24682815074921, + "epoch": 0.9121276978777029, + "step": 1140 + }, + { + "loss": 0.3915949583053589, + "grad_norm": 0.01624801754951477, + "learning_rate": 8.08e-07, + "entropy": 0.8315947725270234, + "num_tokens": 77153403.0, + "logits/chosen": -1.4183466503678914, + "logits/rejected": -1.0919806119809055, + "mean_token_accuracy": 0.7022176405414939, + "rewards/chosen": -0.7714760913598729, + "rewards/rejected": -2.467881916766055, + "rewards/accuracies": 0.84, + "rewards/margins": 1.6964058211818338, + "logps/chosen": -58.059779484272006, + "logps/rejected": -79.21186244726181, + "epoch": 0.9201288180345248, + "step": 1150 + }, + { + "loss": 0.38826522827148435, + "grad_norm": 0.026730364188551903, + "learning_rate": 7.280000000000001e-07, + "entropy": 0.792092831293121, + "num_tokens": 77821905.0, + "logits/chosen": -1.565466490680308, + "logits/rejected": -1.178379751278885, + "mean_token_accuracy": 0.7027372723817825, + "rewards/chosen": -0.7491817296582304, + "rewards/rejected": -2.426239545307035, + "rewards/accuracies": 0.83125, + "rewards/margins": 1.6770578184351326, + "logps/chosen": -58.95333029031754, + "logps/rejected": -75.34961170434951, + "epoch": 0.9281299381913468, + "step": 1160 + }, + { + "loss": 0.40007843971252444, + "grad_norm": 0.018569432199001312, + "learning_rate": 6.48e-07, + "entropy": 0.8224156517500524, + "num_tokens": 78491775.0, + "logits/chosen": -1.5012509494746065, + "logits/rejected": -1.1467693293032915, + "mean_token_accuracy": 0.7090437597036362, + "rewards/chosen": -0.7536068202524256, + "rewards/rejected": -2.5228245135350154, + "rewards/accuracies": 0.81875, + "rewards/margins": 1.7692176943086089, + "logps/chosen": -58.17639876842499, + "logps/rejected": -78.52316574573517, + "epoch": 0.9361310583481688, + "step": 1170 + }, + { + "loss": 0.4408255100250244, + "grad_norm": 0.024299506098031998, + "learning_rate": 5.680000000000001e-07, + "entropy": 0.830776419856702, + "num_tokens": 79162540.0, + "logits/chosen": -1.4830534321700366, + "logits/rejected": -1.1111014440667628, + "mean_token_accuracy": 0.7090770015493035, + "rewards/chosen": -0.7984052636207344, + "rewards/rejected": -2.4370353724921006, + "rewards/accuracies": 0.795, + "rewards/margins": 1.6386301069799811, + "logps/chosen": -57.70949717998505, + "logps/rejected": -79.33320981264114, + "epoch": 0.9441321785049906, + "step": 1180 + }, + { + "loss": 0.416896915435791, + "grad_norm": 0.019658422097563744, + "learning_rate": 4.88e-07, + "entropy": 0.8127233781164978, + "num_tokens": 79832047.0, + "logits/chosen": -1.4123649851333377, + "logits/rejected": -1.1466187299790185, + "mean_token_accuracy": 0.7103831494599581, + "rewards/chosen": -0.7157201138033997, + "rewards/rejected": -2.3061228878897966, + "rewards/accuracies": 0.8125, + "rewards/margins": 1.590402772258967, + "logps/chosen": -56.48203515172005, + "logps/rejected": -75.60109715938569, + "epoch": 0.9521332986618126, + "step": 1190 + }, + { + "loss": 0.4019536018371582, + "grad_norm": 0.017900435253977776, + "learning_rate": 4.0800000000000005e-07, + "entropy": 0.843690790355904, + "num_tokens": 80502194.0, + "logits/chosen": -1.3902989435653317, + "logits/rejected": -1.0785033512547093, + "mean_token_accuracy": 0.7014491311274469, + "rewards/chosen": -0.7470678079669597, + "rewards/rejected": -2.3619672801207345, + "rewards/accuracies": 0.81125, + "rewards/margins": 1.614899470116943, + "logps/chosen": -60.23810036301613, + "logps/rejected": -76.19441313266753, + "epoch": 0.9601344188186346, + "step": 1200 + }, + { + "loss": 0.405252742767334, + "grad_norm": 0.026110496371984482, + "learning_rate": 3.280000000000001e-07, + "entropy": 0.7792508405505214, + "num_tokens": 81171107.0, + "logits/chosen": -1.5459746228809121, + "logits/rejected": -1.1853865636356122, + "mean_token_accuracy": 0.7177962634526193, + "rewards/chosen": -0.7623023401526734, + "rewards/rejected": -2.425694184426102, + "rewards/accuracies": 0.81875, + "rewards/margins": 1.6633918406302108, + "logps/chosen": -56.42661242365837, + "logps/rejected": -75.50851482152939, + "epoch": 0.9681355389754566, + "step": 1210 + }, + { + "loss": 0.4123998165130615, + "grad_norm": 0.018806418403983116, + "learning_rate": 2.48e-07, + "entropy": 0.831228096887935, + "num_tokens": 81842883.0, + "logits/chosen": -1.4490407879391156, + "logits/rejected": -1.1519401234903923, + "mean_token_accuracy": 0.7097262334264814, + "rewards/chosen": -0.7701989058920299, + "rewards/rejected": -2.4217049359795055, + "rewards/accuracies": 0.805, + "rewards/margins": 1.65150602793321, + "logps/chosen": -60.28224401473999, + "logps/rejected": -77.09071898698807, + "epoch": 0.9761366591322785, + "step": 1220 + }, + { + "loss": 0.40515909194946287, + "grad_norm": 0.027354199439287186, + "learning_rate": 1.68e-07, + "entropy": 0.8178756858388079, + "num_tokens": 82513579.0, + "logits/chosen": -1.4675544175368733, + "logits/rejected": -1.1366583786224183, + "mean_token_accuracy": 0.7170148695632815, + "rewards/chosen": -0.7370101418271952, + "rewards/rejected": -2.4574845099955565, + "rewards/accuracies": 0.8425, + "rewards/margins": 1.7204743684129788, + "logps/chosen": -56.6686701130867, + "logps/rejected": -78.64371829748154, + "epoch": 0.9841377792891005, + "step": 1230 + }, + { + "loss": 0.47594127655029295, + "grad_norm": 0.02245207503437996, + "learning_rate": 8.800000000000001e-08, + "entropy": 0.8239703281945548, + "num_tokens": 83183854.0, + "logits/chosen": -1.4181352852579936, + "logits/rejected": -1.088310710386729, + "mean_token_accuracy": 0.7088763321656734, + "rewards/chosen": -0.802495680890861, + "rewards/rejected": -2.3516381712537258, + "rewards/accuracies": 0.80375, + "rewards/margins": 1.5491424936638214, + "logps/chosen": -58.71147965669632, + "logps/rejected": -76.95230464458466, + "epoch": 0.9921388994459225, + "step": 1240 + }, + { + "loss": 0.4114171028137207, + "grad_norm": 0.02189941145479679, + "learning_rate": 8e-09, + "entropy": 0.8552226083004805, + "num_tokens": 83841856.0, + "logits/chosen": -1.4202063989012872, + "logits/rejected": -1.060263823141246, + "mean_token_accuracy": 0.7003038972805777, + "rewards/chosen": -0.6637024932304197, + "rewards/rejected": -2.3128979423820364, + "rewards/accuracies": 0.821882951653944, + "rewards/margins": 1.6491954480902156, + "logps/chosen": -57.31481355565195, + "logps/rejected": -77.89109719982584, + "epoch": 1.0, + "step": 1250 + }, + { + "eval_loss": 0.3715994358062744, + "eval_runtime": 456.0719, + "eval_samples_per_second": 2.193, + "eval_steps_per_second": 2.193, + "eval_entropy": 0.8287503328006715, + "eval_num_tokens": 83841856.0, + "eval_logits/chosen": -1.4355893608780679, + "eval_logits/rejected": -1.0769000715683428, + "eval_mean_token_accuracy": 0.7080028675496578, + "eval_rewards/chosen": -0.6952986993879313, + "eval_rewards/rejected": -2.446402875666041, + "eval_rewards/accuracies": 0.843, + "eval_rewards/margins": 1.7511041724067182, + "eval_logps/chosen": -57.32329998397827, + "eval_logps/rejected": -77.3851658782959, + "epoch": 1.0, + "step": 1250 + }, + { + "train_runtime": 54275.4778, + "train_samples_per_second": 1.842, + "train_steps_per_second": 0.023, + "total_flos": 6.794900050947748e+17, + "train_loss": 0.4424690731048584, + "epoch": 1.0, + "step": 1250 + } + ], + "validation_monitor_size": 1000, + "validation_monitor_selection": "fixed_seed_random_without_replacement", + "validation_monitor_seed": 22, + "validation_monitor_indices": [ + 10, + 21, + 55, + 66, + 110, + 144, + 149, + 152, + 163, + 166, + 167, + 176, + 206, + 207, + 267, + 281, + 295, + 298, + 307, + 317, + 336, + 341, + 349, + 352, + 357, + 382, + 386, + 391, + 401, + 411, + 412, + 432, + 452, + 465, + 488, + 490, + 491, + 492, + 494, + 504, + 528, + 540, + 553, + 586, + 605, + 625, + 627, + 661, + 663, + 666, + 677, + 685, + 690, + 692, + 704, + 708, + 714, + 727, + 728, + 733, + 745, + 752, + 753, + 755, + 779, + 783, + 793, + 796, + 799, + 803, + 804, + 805, + 813, + 816, + 827, + 829, + 830, + 842, + 850, + 853, + 856, + 889, + 905, + 915, + 930, + 939, + 951, + 1002, + 1005, + 1029, + 1049, + 1050, + 1054, + 1067, + 1068, + 1079, + 1091, + 1114, + 1133, + 1140, + 1144, + 1145, + 1186, + 1195, + 1206, + 1223, + 1252, + 1257, + 1259, + 1271, + 1304, + 1305, + 1335, + 1336, + 1343, + 1367, + 1377, + 1403, + 1412, + 1429, + 1443, + 1457, + 1459, + 1460, + 1476, + 1483, + 1486, + 1507, + 1510, + 1519, + 1521, + 1545, + 1570, + 1582, + 1593, + 1595, + 1603, + 1607, + 1614, + 1615, + 1634, + 1639, + 1654, + 1657, + 1673, + 1690, + 1704, + 1746, + 1756, + 1781, + 1783, + 1796, + 1799, + 1809, + 1814, + 1827, + 1829, + 1832, + 1844, + 1847, + 1854, + 1856, + 1858, + 1883, + 1889, + 1925, + 1931, + 1932, + 1934, + 1935, + 1957, + 1962, + 1967, + 1975, + 1982, + 1983, + 1991, + 1998, + 2003, + 2008, + 2017, + 2021, + 2035, + 2040, + 2050, + 2056, + 2077, + 2082, + 2098, + 2100, + 2121, + 2130, + 2134, + 2138, + 2143, + 2166, + 2167, + 2180, + 2181, + 2204, + 2205, + 2212, + 2221, + 2224, + 2230, + 2233, + 2263, + 2269, + 2273, + 2290, + 2291, + 2299, + 2321, + 2323, + 2330, + 2401, + 2417, + 2435, + 2456, + 2488, + 2502, + 2504, + 2532, + 2538, + 2555, + 2558, + 2562, + 2583, + 2585, + 2590, + 2594, + 2596, + 2600, + 2606, + 2607, + 2618, + 2630, + 2647, + 2650, + 2657, + 2679, + 2685, + 2705, + 2712, + 2714, + 2727, + 2740, + 2742, + 2780, + 2784, + 2792, + 2807, + 2808, + 2810, + 2820, + 2831, + 2860, + 2863, + 2866, + 2875, + 2878, + 2898, + 2905, + 2921, + 2922, + 2930, + 2934, + 2944, + 2955, + 2957, + 2959, + 2973, + 2978, + 2998, + 3018, + 3022, + 3028, + 3031, + 3061, + 3085, + 3090, + 3104, + 3105, + 3115, + 3121, + 3122, + 3129, + 3133, + 3135, + 3161, + 3169, + 3194, + 3195, + 3215, + 3225, + 3226, + 3250, + 3265, + 3301, + 3312, + 3329, + 3361, + 3362, + 3376, + 3403, + 3410, + 3419, + 3432, + 3443, + 3452, + 3467, + 3469, + 3475, + 3485, + 3503, + 3515, + 3524, + 3528, + 3544, + 3557, + 3565, + 3637, + 3642, + 3658, + 3659, + 3693, + 3699, + 3722, + 3725, + 3728, + 3731, + 3740, + 3742, + 3762, + 3780, + 3788, + 3794, + 3796, + 3798, + 3817, + 3819, + 3822, + 3839, + 3843, + 3846, + 3851, + 3865, + 3871, + 3884, + 3894, + 3896, + 3907, + 3911, + 3915, + 3919, + 3920, + 3923, + 3933, + 3955, + 3967, + 3972, + 3974, + 3975, + 3997, + 4002, + 4034, + 4063, + 4073, + 4079, + 4082, + 4088, + 4121, + 4145, + 4148, + 4159, + 4161, + 4164, + 4177, + 4188, + 4199, + 4207, + 4213, + 4221, + 4233, + 4241, + 4243, + 4247, + 4264, + 4274, + 4282, + 4286, + 4290, + 4310, + 4313, + 4321, + 4324, + 4327, + 4362, + 4380, + 4407, + 4411, + 4415, + 4417, + 4418, + 4427, + 4431, + 4433, + 4451, + 4466, + 4477, + 4479, + 4493, + 4514, + 4527, + 4539, + 4550, + 4558, + 4568, + 4579, + 4583, + 4584, + 4586, + 4587, + 4590, + 4599, + 4602, + 4610, + 4626, + 4627, + 4630, + 4655, + 4656, + 4657, + 4661, + 4685, + 4714, + 4715, + 4731, + 4752, + 4769, + 4791, + 4805, + 4818, + 4829, + 4839, + 4843, + 4871, + 4879, + 4885, + 4888, + 4895, + 4900, + 4923, + 4966, + 4968, + 4972, + 4989, + 4994, + 4998, + 5001, + 5019, + 5026, + 5032, + 5034, + 5046, + 5055, + 5085, + 5086, + 5088, + 5089, + 5090, + 5095, + 5119, + 5121, + 5133, + 5154, + 5169, + 5178, + 5222, + 5223, + 5232, + 5233, + 5240, + 5256, + 5259, + 5264, + 5276, + 5279, + 5335, + 5337, + 5345, + 5348, + 5373, + 5378, + 5422, + 5442, + 5443, + 5445, + 5477, + 5485, + 5495, + 5497, + 5504, + 5526, + 5542, + 5564, + 5570, + 5579, + 5608, + 5610, + 5624, + 5630, + 5638, + 5651, + 5663, + 5670, + 5675, + 5691, + 5700, + 5706, + 5715, + 5720, + 5721, + 5732, + 5738, + 5741, + 5769, + 5771, + 5795, + 5796, + 5800, + 5809, + 5810, + 5815, + 5819, + 5827, + 5848, + 5849, + 5852, + 5859, + 5880, + 5907, + 5912, + 5919, + 5931, + 5932, + 5941, + 5948, + 5950, + 5953, + 5981, + 6000, + 6003, + 6010, + 6018, + 6075, + 6103, + 6106, + 6109, + 6114, + 6123, + 6131, + 6138, + 6139, + 6164, + 6173, + 6180, + 6185, + 6189, + 6190, + 6221, + 6223, + 6237, + 6255, + 6262, + 6265, + 6293, + 6305, + 6331, + 6336, + 6355, + 6366, + 6371, + 6396, + 6399, + 6402, + 6408, + 6432, + 6433, + 6441, + 6456, + 6465, + 6486, + 6489, + 6507, + 6508, + 6522, + 6528, + 6537, + 6551, + 6564, + 6590, + 6598, + 6599, + 6611, + 6613, + 6615, + 6621, + 6634, + 6647, + 6649, + 6654, + 6676, + 6690, + 6708, + 6729, + 6744, + 6749, + 6756, + 6761, + 6763, + 6773, + 6788, + 6790, + 6796, + 6797, + 6811, + 6850, + 6869, + 6871, + 6882, + 6895, + 6906, + 6911, + 6914, + 6952, + 6966, + 6985, + 7001, + 7021, + 7031, + 7038, + 7041, + 7045, + 7052, + 7057, + 7073, + 7076, + 7102, + 7107, + 7109, + 7117, + 7122, + 7125, + 7207, + 7212, + 7215, + 7232, + 7246, + 7250, + 7258, + 7263, + 7267, + 7270, + 7274, + 7280, + 7286, + 7293, + 7298, + 7306, + 7316, + 7325, + 7326, + 7356, + 7367, + 7385, + 7392, + 7405, + 7416, + 7421, + 7426, + 7452, + 7519, + 7534, + 7542, + 7546, + 7601, + 7604, + 7606, + 7609, + 7649, + 7653, + 7682, + 7699, + 7738, + 7750, + 7798, + 7800, + 7801, + 7805, + 7811, + 7832, + 7837, + 7849, + 7856, + 7876, + 7877, + 7887, + 7905, + 7919, + 7920, + 7922, + 7923, + 7926, + 7966, + 7970, + 7973, + 7974, + 7976, + 7986, + 8027, + 8028, + 8068, + 8074, + 8091, + 8120, + 8122, + 8125, + 8152, + 8153, + 8164, + 8167, + 8169, + 8171, + 8177, + 8189, + 8192, + 8196, + 8212, + 8217, + 8231, + 8242, + 8244, + 8250, + 8256, + 8257, + 8265, + 8270, + 8274, + 8283, + 8290, + 8294, + 8302, + 8307, + 8318, + 8326, + 8338, + 8350, + 8353, + 8357, + 8371, + 8377, + 8380, + 8387, + 8388, + 8396, + 8402, + 8419, + 8423, + 8428, + 8435, + 8439, + 8442, + 8444, + 8453, + 8475, + 8481, + 8495, + 8498, + 8523, + 8531, + 8562, + 8568, + 8584, + 8588, + 8589, + 8592, + 8597, + 8608, + 8611, + 8624, + 8636, + 8637, + 8654, + 8657, + 8661, + 8680, + 8683, + 8687, + 8693, + 8695, + 8697, + 8704, + 8713, + 8714, + 8755, + 8758, + 8761, + 8772, + 8781, + 8800, + 8808, + 8812, + 8815, + 8822, + 8825, + 8830, + 8837, + 8863, + 8867, + 8894, + 8898, + 8924, + 8937, + 8955, + 8964, + 8978, + 8995, + 9007, + 9018, + 9034, + 9043, + 9074, + 9075, + 9099, + 9103, + 9112, + 9115, + 9127, + 9137, + 9142, + 9163, + 9174, + 9179, + 9196, + 9208, + 9213, + 9222, + 9228, + 9230, + 9274, + 9278, + 9293, + 9328, + 9338, + 9342, + 9346, + 9368, + 9385, + 9403, + 9420, + 9429, + 9432, + 9453, + 9455, + 9463, + 9502, + 9511, + 9517, + 9545, + 9548, + 9550, + 9558, + 9566, + 9574, + 9577, + 9578, + 9589, + 9606, + 9618, + 9659, + 9672, + 9673, + 9706, + 9717, + 9728, + 9732, + 9758, + 9764, + 9773, + 9778, + 9779, + 9798, + 9801, + 9803, + 9804, + 9845, + 9849, + 9862, + 9876, + 9890, + 9911, + 9959, + 9966, + 9967, + 9968, + 9974, + 9983, + 10007, + 10032, + 10042, + 10044, + 10061, + 10062, + 10080, + 10085, + 10095, + 10098, + 10132, + 10144, + 10175, + 10176, + 10197, + 10220, + 10230, + 10233, + 10242, + 10260, + 10265, + 10305, + 10313, + 10314, + 10332, + 10338, + 10341, + 10342, + 10347, + 10353, + 10354, + 10360, + 10381, + 10390, + 10396, + 10402, + 10404, + 10418, + 10432, + 10445, + 10447, + 10450, + 10454, + 10489, + 10523, + 10539, + 10541, + 10550, + 10561, + 10562, + 10573, + 10577, + 10583, + 10589, + 10596, + 10601, + 10605, + 10633, + 10634, + 10663, + 10671, + 10672, + 10685, + 10710, + 10730, + 10733, + 10740, + 10744, + 10774, + 10786, + 10829, + 10833, + 10838, + 10855, + 10879, + 10907, + 10909, + 10911, + 10928, + 10936, + 10956, + 10989, + 11022, + 11030, + 11031, + 11041, + 11055, + 11058, + 11075, + 11077, + 11085, + 11096 + ], + "early_stopping_patience": 3 +}